{
  "best_global_step": null,
  "best_metric": null,
  "best_model_checkpoint": null,
  "epoch": 6.7897305325694886,
  "eval_steps": 1000,
  "global_step": 64000,
  "is_hyper_param_search": false,
  "is_local_process_zero": true,
  "is_world_process_zero": true,
  "log_history": [
    {
      "epoch": 0.00010608953957139826,
      "grad_norm": 0.45892735986518196,
      "learning_rate": 0.0,
      "loss": 2.7491,
      "num_input_tokens_seen": 786816,
      "step": 1
    },
    {
      "epoch": 0.0002121790791427965,
      "grad_norm": 0.5356233725235311,
      "learning_rate": 5.000000000000001e-07,
      "loss": 2.8545,
      "num_input_tokens_seen": 1573600,
      "step": 2
    },
    {
      "epoch": 0.00031826861871419476,
      "grad_norm": 0.7795008084816987,
      "learning_rate": 1.0000000000000002e-06,
      "loss": 3.0025,
      "num_input_tokens_seen": 2360304,
      "step": 3
    },
    {
      "epoch": 0.000424358158285593,
      "grad_norm": 0.45195897478808544,
      "learning_rate": 1.5e-06,
      "loss": 2.6878,
      "num_input_tokens_seen": 3147040,
      "step": 4
    },
    {
      "epoch": 0.0005304476978569913,
      "grad_norm": 0.4477564531735783,
      "learning_rate": 2.0000000000000003e-06,
      "loss": 2.6327,
      "num_input_tokens_seen": 3933808,
      "step": 5
    },
    {
      "epoch": 0.0006365372374283895,
      "grad_norm": 0.5294685365574597,
      "learning_rate": 2.5e-06,
      "loss": 2.7146,
      "num_input_tokens_seen": 4720624,
      "step": 6
    },
    {
      "epoch": 0.0007426267769997878,
      "grad_norm": 0.38558100074743284,
      "learning_rate": 3e-06,
      "loss": 2.4529,
      "num_input_tokens_seen": 5507472,
      "step": 7
    },
    {
      "epoch": 0.000848716316571186,
      "grad_norm": 0.5320897428973126,
      "learning_rate": 3.5000000000000004e-06,
      "loss": 2.5187,
      "num_input_tokens_seen": 6294240,
      "step": 8
    },
    {
      "epoch": 0.0009548058561425843,
      "grad_norm": 0.4732590179300764,
      "learning_rate": 4.000000000000001e-06,
      "loss": 2.4531,
      "num_input_tokens_seen": 7080960,
      "step": 9
    },
    {
      "epoch": 0.0010608953957139827,
      "grad_norm": 0.6165080764832043,
      "learning_rate": 4.5e-06,
      "loss": 2.6072,
      "num_input_tokens_seen": 7867648,
      "step": 10
    },
    {
      "epoch": 0.0011669849352853809,
      "grad_norm": 0.5291891006112727,
      "learning_rate": 5e-06,
      "loss": 2.6971,
      "num_input_tokens_seen": 8654368,
      "step": 11
    },
    {
      "epoch": 0.001273074474856779,
      "grad_norm": 0.5891959877850301,
      "learning_rate": 5.500000000000001e-06,
      "loss": 2.7592,
      "num_input_tokens_seen": 9441088,
      "step": 12
    },
    {
      "epoch": 0.0013791640144281774,
      "grad_norm": 0.7214177515530251,
      "learning_rate": 6e-06,
      "loss": 2.6496,
      "num_input_tokens_seen": 10227840,
      "step": 13
    },
    {
      "epoch": 0.0014852535539995756,
      "grad_norm": 0.727717311321097,
      "learning_rate": 6.5000000000000004e-06,
      "loss": 2.3676,
      "num_input_tokens_seen": 11014624,
      "step": 14
    },
    {
      "epoch": 0.001591343093570974,
      "grad_norm": 0.7404953963765101,
      "learning_rate": 7.000000000000001e-06,
      "loss": 2.5291,
      "num_input_tokens_seen": 11801376,
      "step": 15
    },
    {
      "epoch": 0.001697432633142372,
      "grad_norm": 0.7174346850181497,
      "learning_rate": 7.5e-06,
      "loss": 2.4983,
      "num_input_tokens_seen": 12588192,
      "step": 16
    },
    {
      "epoch": 0.0018035221727137705,
      "grad_norm": 0.6311662654113404,
      "learning_rate": 8.000000000000001e-06,
      "loss": 2.5755,
      "num_input_tokens_seen": 13374976,
      "step": 17
    },
    {
      "epoch": 0.0019096117122851686,
      "grad_norm": 1.494535581206219,
      "learning_rate": 8.500000000000002e-06,
      "loss": 2.7033,
      "num_input_tokens_seen": 14161712,
      "step": 18
    },
    {
      "epoch": 0.002015701251856567,
      "grad_norm": 0.7812370848479728,
      "learning_rate": 9e-06,
      "loss": 2.5668,
      "num_input_tokens_seen": 14948496,
      "step": 19
    },
    {
      "epoch": 0.0021217907914279654,
      "grad_norm": 1.851979625122348,
      "learning_rate": 9.5e-06,
      "loss": 2.6828,
      "num_input_tokens_seen": 15735328,
      "step": 20
    },
    {
      "epoch": 0.0022278803309993636,
      "grad_norm": 0.9132491064104036,
      "learning_rate": 1e-05,
      "loss": 2.7045,
      "num_input_tokens_seen": 16522096,
      "step": 21
    },
    {
      "epoch": 0.0023339698705707617,
      "grad_norm": 1.4201508786589099,
      "learning_rate": 1.05e-05,
      "loss": 2.7287,
      "num_input_tokens_seen": 17308816,
      "step": 22
    },
    {
      "epoch": 0.00244005941014216,
      "grad_norm": 0.9979458559587291,
      "learning_rate": 1.1000000000000001e-05,
      "loss": 2.489,
      "num_input_tokens_seen": 18095648,
      "step": 23
    },
    {
      "epoch": 0.002546148949713558,
      "grad_norm": 1.232106900517445,
      "learning_rate": 1.1500000000000002e-05,
      "loss": 2.4731,
      "num_input_tokens_seen": 18882432,
      "step": 24
    },
    {
      "epoch": 0.0026522384892849566,
      "grad_norm": 1.8304562579323738,
      "learning_rate": 1.2e-05,
      "loss": 3.1318,
      "num_input_tokens_seen": 19669104,
      "step": 25
    },
    {
      "epoch": 0.002758328028856355,
      "grad_norm": 0.7720540076819103,
      "learning_rate": 1.25e-05,
      "loss": 2.4649,
      "num_input_tokens_seen": 20455872,
      "step": 26
    },
    {
      "epoch": 0.002864417568427753,
      "grad_norm": 1.4370549254407878,
      "learning_rate": 1.3000000000000001e-05,
      "loss": 2.7903,
      "num_input_tokens_seen": 21242624,
      "step": 27
    },
    {
      "epoch": 0.002970507107999151,
      "grad_norm": 1.375532865269091,
      "learning_rate": 1.3500000000000001e-05,
      "loss": 2.7115,
      "num_input_tokens_seen": 22029328,
      "step": 28
    },
    {
      "epoch": 0.0030765966475705497,
      "grad_norm": 0.7263477342300839,
      "learning_rate": 1.4000000000000001e-05,
      "loss": 2.766,
      "num_input_tokens_seen": 22816128,
      "step": 29
    },
    {
      "epoch": 0.003182686187141948,
      "grad_norm": 1.716919703790352,
      "learning_rate": 1.45e-05,
      "loss": 2.503,
      "num_input_tokens_seen": 23602928,
      "step": 30
    },
    {
      "epoch": 0.003288775726713346,
      "grad_norm": 1.11520927341931,
      "learning_rate": 1.5e-05,
      "loss": 2.6003,
      "num_input_tokens_seen": 24389600,
      "step": 31
    },
    {
      "epoch": 0.003394865266284744,
      "grad_norm": 2.9507394312954895,
      "learning_rate": 1.55e-05,
      "loss": 2.7189,
      "num_input_tokens_seen": 25176448,
      "step": 32
    },
    {
      "epoch": 0.003500954805856143,
      "grad_norm": 2.5487544084348395,
      "learning_rate": 1.6000000000000003e-05,
      "loss": 2.6926,
      "num_input_tokens_seen": 25963200,
      "step": 33
    },
    {
      "epoch": 0.003607044345427541,
      "grad_norm": 1.0884979704123017,
      "learning_rate": 1.65e-05,
      "loss": 2.5182,
      "num_input_tokens_seen": 26749968,
      "step": 34
    },
    {
      "epoch": 0.003713133884998939,
      "grad_norm": 1.5742788833261867,
      "learning_rate": 1.7000000000000003e-05,
      "loss": 2.7069,
      "num_input_tokens_seen": 27536800,
      "step": 35
    },
    {
      "epoch": 0.0038192234245703373,
      "grad_norm": 1.6497495408231242,
      "learning_rate": 1.75e-05,
      "loss": 2.645,
      "num_input_tokens_seen": 28323536,
      "step": 36
    },
    {
      "epoch": 0.0039253129641417354,
      "grad_norm": 1.4154518113481802,
      "learning_rate": 1.8e-05,
      "loss": 2.7216,
      "num_input_tokens_seen": 29110256,
      "step": 37
    },
    {
      "epoch": 0.004031402503713134,
      "grad_norm": 2.147863162404296,
      "learning_rate": 1.85e-05,
      "loss": 2.8002,
      "num_input_tokens_seen": 29897072,
      "step": 38
    },
    {
      "epoch": 0.004137492043284532,
      "grad_norm": 1.8698360849344053,
      "learning_rate": 1.9e-05,
      "loss": 2.6641,
      "num_input_tokens_seen": 30683856,
      "step": 39
    },
    {
      "epoch": 0.004243581582855931,
      "grad_norm": 2.0600388837072656,
      "learning_rate": 1.9500000000000003e-05,
      "loss": 2.4805,
      "num_input_tokens_seen": 31470688,
      "step": 40
    },
    {
      "epoch": 0.004349671122427329,
      "grad_norm": 2.170447916620332,
      "learning_rate": 2e-05,
      "loss": 2.8711,
      "num_input_tokens_seen": 32257440,
      "step": 41
    },
    {
      "epoch": 0.004455760661998727,
      "grad_norm": 1.2686206336455954,
      "learning_rate": 2.05e-05,
      "loss": 2.7688,
      "num_input_tokens_seen": 33044192,
      "step": 42
    },
    {
      "epoch": 0.004561850201570125,
      "grad_norm": 2.8044742409533425,
      "learning_rate": 2.1e-05,
      "loss": 2.7581,
      "num_input_tokens_seen": 33830992,
      "step": 43
    },
    {
      "epoch": 0.0046679397411415234,
      "grad_norm": 1.965653414185909,
      "learning_rate": 2.15e-05,
      "loss": 2.8268,
      "num_input_tokens_seen": 34617712,
      "step": 44
    },
    {
      "epoch": 0.004774029280712922,
      "grad_norm": 3.656230509530401,
      "learning_rate": 2.2000000000000003e-05,
      "loss": 2.6226,
      "num_input_tokens_seen": 35404544,
      "step": 45
    },
    {
      "epoch": 0.00488011882028432,
      "grad_norm": 3.61562630926856,
      "learning_rate": 2.25e-05,
      "loss": 2.8032,
      "num_input_tokens_seen": 36191296,
      "step": 46
    },
    {
      "epoch": 0.004986208359855718,
      "grad_norm": 1.65265193676588,
      "learning_rate": 2.3000000000000003e-05,
      "loss": 2.6651,
      "num_input_tokens_seen": 36978096,
      "step": 47
    },
    {
      "epoch": 0.005092297899427116,
      "grad_norm": 1.9547610639246202,
      "learning_rate": 2.35e-05,
      "loss": 2.5416,
      "num_input_tokens_seen": 37764896,
      "step": 48
    },
    {
      "epoch": 0.005198387438998515,
      "grad_norm": 1.7368236309780216,
      "learning_rate": 2.4e-05,
      "loss": 2.7333,
      "num_input_tokens_seen": 38551728,
      "step": 49
    },
    {
      "epoch": 0.005304476978569913,
      "grad_norm": 1.8567382047667942,
      "learning_rate": 2.45e-05,
      "loss": 2.5979,
      "num_input_tokens_seen": 39338576,
      "step": 50
    },
    {
      "epoch": 0.0054105665181413114,
      "grad_norm": 1.3035296932282174,
      "learning_rate": 2.5e-05,
      "loss": 2.6968,
      "num_input_tokens_seen": 40125264,
      "step": 51
    },
    {
      "epoch": 0.00551665605771271,
      "grad_norm": 1.6241428400049922,
      "learning_rate": 2.5500000000000003e-05,
      "loss": 2.5772,
      "num_input_tokens_seen": 40912096,
      "step": 52
    },
    {
      "epoch": 0.005622745597284108,
      "grad_norm": 1.4099030959720122,
      "learning_rate": 2.6000000000000002e-05,
      "loss": 2.7632,
      "num_input_tokens_seen": 41698880,
      "step": 53
    },
    {
      "epoch": 0.005728835136855506,
      "grad_norm": 1.6913197265746212,
      "learning_rate": 2.6500000000000004e-05,
      "loss": 2.6827,
      "num_input_tokens_seen": 42485584,
      "step": 54
    },
    {
      "epoch": 0.005834924676426904,
      "grad_norm": 1.1716260487584784,
      "learning_rate": 2.7000000000000002e-05,
      "loss": 2.6555,
      "num_input_tokens_seen": 43272464,
      "step": 55
    },
    {
      "epoch": 0.005941014215998302,
      "grad_norm": 1.6211389322900034,
      "learning_rate": 2.7500000000000004e-05,
      "loss": 2.5634,
      "num_input_tokens_seen": 44059216,
      "step": 56
    },
    {
      "epoch": 0.0060471037555697,
      "grad_norm": 2.135445115080757,
      "learning_rate": 2.8000000000000003e-05,
      "loss": 2.7434,
      "num_input_tokens_seen": 44845920,
      "step": 57
    },
    {
      "epoch": 0.0061531932951410994,
      "grad_norm": 2.2490167416272433,
      "learning_rate": 2.8499999999999998e-05,
      "loss": 2.8346,
      "num_input_tokens_seen": 45632592,
      "step": 58
    },
    {
      "epoch": 0.006259282834712498,
      "grad_norm": 1.7414856333827426,
      "learning_rate": 2.9e-05,
      "loss": 2.7835,
      "num_input_tokens_seen": 46419312,
      "step": 59
    },
    {
      "epoch": 0.006365372374283896,
      "grad_norm": 1.472706111166242,
      "learning_rate": 2.95e-05,
      "loss": 2.6935,
      "num_input_tokens_seen": 47206128,
      "step": 60
    },
    {
      "epoch": 0.006471461913855294,
      "grad_norm": 3.265857912001694,
      "learning_rate": 3e-05,
      "loss": 2.7785,
      "num_input_tokens_seen": 47992912,
      "step": 61
    },
    {
      "epoch": 0.006577551453426692,
      "grad_norm": 1.644621008983469,
      "learning_rate": 3.05e-05,
      "loss": 2.5664,
      "num_input_tokens_seen": 48779696,
      "step": 62
    },
    {
      "epoch": 0.00668364099299809,
      "grad_norm": 1.8420394130174365,
      "learning_rate": 3.1e-05,
      "loss": 2.415,
      "num_input_tokens_seen": 49566496,
      "step": 63
    },
    {
      "epoch": 0.006789730532569488,
      "grad_norm": 2.7883083707411145,
      "learning_rate": 3.15e-05,
      "loss": 2.9353,
      "num_input_tokens_seen": 50353216,
      "step": 64
    },
    {
      "epoch": 0.006895820072140887,
      "grad_norm": 1.3020735085439805,
      "learning_rate": 3.2000000000000005e-05,
      "loss": 2.5768,
      "num_input_tokens_seen": 51140000,
      "step": 65
    },
    {
      "epoch": 0.007001909611712286,
      "grad_norm": 2.1693115767946125,
      "learning_rate": 3.2500000000000004e-05,
      "loss": 2.521,
      "num_input_tokens_seen": 51926784,
      "step": 66
    },
    {
      "epoch": 0.007107999151283684,
      "grad_norm": 1.0303249435007602,
      "learning_rate": 3.3e-05,
      "loss": 2.4836,
      "num_input_tokens_seen": 52713600,
      "step": 67
    },
    {
      "epoch": 0.007214088690855082,
      "grad_norm": 2.5768216163726128,
      "learning_rate": 3.35e-05,
      "loss": 2.4118,
      "num_input_tokens_seen": 53500320,
      "step": 68
    },
    {
      "epoch": 0.00732017823042648,
      "grad_norm": 1.9747570608958995,
      "learning_rate": 3.4000000000000007e-05,
      "loss": 2.8068,
      "num_input_tokens_seen": 54287104,
      "step": 69
    },
    {
      "epoch": 0.007426267769997878,
      "grad_norm": 1.573284459832432,
      "learning_rate": 3.45e-05,
      "loss": 2.5798,
      "num_input_tokens_seen": 55073872,
      "step": 70
    },
    {
      "epoch": 0.007532357309569276,
      "grad_norm": 1.7883715801306677,
      "learning_rate": 3.5e-05,
      "loss": 2.702,
      "num_input_tokens_seen": 55860640,
      "step": 71
    },
    {
      "epoch": 0.0076384468491406746,
      "grad_norm": 1.0837069982862346,
      "learning_rate": 3.55e-05,
      "loss": 2.5028,
      "num_input_tokens_seen": 56647520,
      "step": 72
    },
    {
      "epoch": 0.007744536388712073,
      "grad_norm": 2.265511699376276,
      "learning_rate": 3.6e-05,
      "loss": 2.6829,
      "num_input_tokens_seen": 57434304,
      "step": 73
    },
    {
      "epoch": 0.007850625928283471,
      "grad_norm": 2.014055338887017,
      "learning_rate": 3.65e-05,
      "loss": 2.5408,
      "num_input_tokens_seen": 58221072,
      "step": 74
    },
    {
      "epoch": 0.007956715467854869,
      "grad_norm": 1.1840896366358207,
      "learning_rate": 3.7e-05,
      "loss": 2.5891,
      "num_input_tokens_seen": 59007840,
      "step": 75
    },
    {
      "epoch": 0.008062805007426267,
      "grad_norm": 3.5942950410455166,
      "learning_rate": 3.7500000000000003e-05,
      "loss": 2.6781,
      "num_input_tokens_seen": 59794544,
      "step": 76
    },
    {
      "epoch": 0.008168894546997665,
      "grad_norm": 2.0479516146646795,
      "learning_rate": 3.8e-05,
      "loss": 2.6761,
      "num_input_tokens_seen": 60581280,
      "step": 77
    },
    {
      "epoch": 0.008274984086569064,
      "grad_norm": 3.350163569770255,
      "learning_rate": 3.85e-05,
      "loss": 2.7666,
      "num_input_tokens_seen": 61367936,
      "step": 78
    },
    {
      "epoch": 0.008381073626140462,
      "grad_norm": 1.964046835916454,
      "learning_rate": 3.9000000000000006e-05,
      "loss": 2.5218,
      "num_input_tokens_seen": 62154784,
      "step": 79
    },
    {
      "epoch": 0.008487163165711862,
      "grad_norm": 1.9351986364335172,
      "learning_rate": 3.9500000000000005e-05,
      "loss": 2.5648,
      "num_input_tokens_seen": 62941488,
      "step": 80
    },
    {
      "epoch": 0.00859325270528326,
      "grad_norm": 2.8448107060511125,
      "learning_rate": 4e-05,
      "loss": 2.7849,
      "num_input_tokens_seen": 63728224,
      "step": 81
    },
    {
      "epoch": 0.008699342244854658,
      "grad_norm": 1.3126723722466882,
      "learning_rate": 4.05e-05,
      "loss": 2.7718,
      "num_input_tokens_seen": 64514960,
      "step": 82
    },
    {
      "epoch": 0.008805431784426056,
      "grad_norm": 2.6645026267226952,
      "learning_rate": 4.1e-05,
      "loss": 2.7656,
      "num_input_tokens_seen": 65301744,
      "step": 83
    },
    {
      "epoch": 0.008911521323997454,
      "grad_norm": 2.4136307064575924,
      "learning_rate": 4.15e-05,
      "loss": 2.5746,
      "num_input_tokens_seen": 66088624,
      "step": 84
    },
    {
      "epoch": 0.009017610863568852,
      "grad_norm": 1.8778197835385178,
      "learning_rate": 4.2e-05,
      "loss": 2.6562,
      "num_input_tokens_seen": 66875440,
      "step": 85
    },
    {
      "epoch": 0.00912370040314025,
      "grad_norm": 4.277322890325999,
      "learning_rate": 4.25e-05,
      "loss": 2.5722,
      "num_input_tokens_seen": 67662208,
      "step": 86
    },
    {
      "epoch": 0.009229789942711649,
      "grad_norm": 2.796593044530221,
      "learning_rate": 4.3e-05,
      "loss": 2.5878,
      "num_input_tokens_seen": 68448960,
      "step": 87
    },
    {
      "epoch": 0.009335879482283047,
      "grad_norm": 3.761976326825029,
      "learning_rate": 4.35e-05,
      "loss": 2.63,
      "num_input_tokens_seen": 69235648,
      "step": 88
    },
    {
      "epoch": 0.009441969021854445,
      "grad_norm": 2.7299232078812192,
      "learning_rate": 4.4000000000000006e-05,
      "loss": 2.7912,
      "num_input_tokens_seen": 70022416,
      "step": 89
    },
    {
      "epoch": 0.009548058561425843,
      "grad_norm": 1.9566105802359397,
      "learning_rate": 4.4500000000000004e-05,
      "loss": 2.7251,
      "num_input_tokens_seen": 70809184,
      "step": 90
    },
    {
      "epoch": 0.009654148100997241,
      "grad_norm": 2.463038819539347,
      "learning_rate": 4.5e-05,
      "loss": 2.4454,
      "num_input_tokens_seen": 71595936,
      "step": 91
    },
    {
      "epoch": 0.00976023764056864,
      "grad_norm": 1.4104622076803168,
      "learning_rate": 4.55e-05,
      "loss": 2.5595,
      "num_input_tokens_seen": 72382704,
      "step": 92
    },
    {
      "epoch": 0.009866327180140038,
      "grad_norm": 2.6992579360808673,
      "learning_rate": 4.600000000000001e-05,
      "loss": 2.4407,
      "num_input_tokens_seen": 73169568,
      "step": 93
    },
    {
      "epoch": 0.009972416719711436,
      "grad_norm": 2.171380980436761,
      "learning_rate": 4.6500000000000005e-05,
      "loss": 2.5249,
      "num_input_tokens_seen": 73956368,
      "step": 94
    },
    {
      "epoch": 0.010078506259282834,
      "grad_norm": 3.9860261388649034,
      "learning_rate": 4.7e-05,
      "loss": 2.6843,
      "num_input_tokens_seen": 74743152,
      "step": 95
    },
    {
      "epoch": 0.010184595798854232,
      "grad_norm": 1.8528628256245947,
      "learning_rate": 4.75e-05,
      "loss": 2.3008,
      "num_input_tokens_seen": 75530080,
      "step": 96
    },
    {
      "epoch": 0.010290685338425632,
      "grad_norm": 3.450194390060371,
      "learning_rate": 4.8e-05,
      "loss": 2.619,
      "num_input_tokens_seen": 76316848,
      "step": 97
    },
    {
      "epoch": 0.01039677487799703,
      "grad_norm": 1.851796118465726,
      "learning_rate": 4.85e-05,
      "loss": 2.4624,
      "num_input_tokens_seen": 77103664,
      "step": 98
    },
    {
      "epoch": 0.010502864417568428,
      "grad_norm": 2.0337081990622456,
      "learning_rate": 4.9e-05,
      "loss": 2.5117,
      "num_input_tokens_seen": 77890384,
      "step": 99
    },
    {
      "epoch": 0.010608953957139827,
      "grad_norm": 1.3513474542031692,
      "learning_rate": 4.9500000000000004e-05,
      "loss": 2.6904,
      "num_input_tokens_seen": 78677120,
      "step": 100
    },
    {
      "epoch": 0.010715043496711225,
      "grad_norm": 1.7988814170065086,
      "learning_rate": 5e-05,
      "loss": 2.3725,
      "num_input_tokens_seen": 79463968,
      "step": 101
    },
    {
      "epoch": 0.010821133036282623,
      "grad_norm": 1.3474130770681116,
      "learning_rate": 4.999999999034037e-05,
      "loss": 2.5343,
      "num_input_tokens_seen": 80250720,
      "step": 102
    },
    {
      "epoch": 0.010927222575854021,
      "grad_norm": 2.1006774187123356,
      "learning_rate": 4.999999996136146e-05,
      "loss": 2.614,
      "num_input_tokens_seen": 81037536,
      "step": 103
    },
    {
      "epoch": 0.01103331211542542,
      "grad_norm": 2.0200956568321877,
      "learning_rate": 4.99999999130633e-05,
      "loss": 2.8555,
      "num_input_tokens_seen": 81824224,
      "step": 104
    },
    {
      "epoch": 0.011139401654996817,
      "grad_norm": 2.381970581693618,
      "learning_rate": 4.999999984544587e-05,
      "loss": 2.8181,
      "num_input_tokens_seen": 82610896,
      "step": 105
    },
    {
      "epoch": 0.011245491194568216,
      "grad_norm": 1.7822647444964606,
      "learning_rate": 4.9999999758509174e-05,
      "loss": 2.6087,
      "num_input_tokens_seen": 83397584,
      "step": 106
    },
    {
      "epoch": 0.011351580734139614,
      "grad_norm": 1.4101034487620223,
      "learning_rate": 4.999999965225321e-05,
      "loss": 2.6452,
      "num_input_tokens_seen": 84184384,
      "step": 107
    },
    {
      "epoch": 0.011457670273711012,
      "grad_norm": 1.586195082503293,
      "learning_rate": 4.999999952667798e-05,
      "loss": 2.2066,
      "num_input_tokens_seen": 84971216,
      "step": 108
    },
    {
      "epoch": 0.01156375981328241,
      "grad_norm": 3.0022044770403107,
      "learning_rate": 4.999999938178348e-05,
      "loss": 2.5782,
      "num_input_tokens_seen": 85757936,
      "step": 109
    },
    {
      "epoch": 0.011669849352853808,
      "grad_norm": 1.1939126912175952,
      "learning_rate": 4.9999999217569716e-05,
      "loss": 2.4354,
      "num_input_tokens_seen": 86544704,
      "step": 110
    },
    {
      "epoch": 0.011775938892425206,
      "grad_norm": 2.9554796217050248,
      "learning_rate": 4.9999999034036684e-05,
      "loss": 2.7461,
      "num_input_tokens_seen": 87331472,
      "step": 111
    },
    {
      "epoch": 0.011882028431996604,
      "grad_norm": 2.135858659445641,
      "learning_rate": 4.999999883118439e-05,
      "loss": 2.8531,
      "num_input_tokens_seen": 88118224,
      "step": 112
    },
    {
      "epoch": 0.011988117971568003,
      "grad_norm": 1.6332261943829072,
      "learning_rate": 4.999999860901283e-05,
      "loss": 2.4317,
      "num_input_tokens_seen": 88905040,
      "step": 113
    },
    {
      "epoch": 0.0120942075111394,
      "grad_norm": 3.3543989345258756,
      "learning_rate": 4.9999998367522e-05,
      "loss": 2.4648,
      "num_input_tokens_seen": 89691888,
      "step": 114
    },
    {
      "epoch": 0.0122002970507108,
      "grad_norm": 1.6910081092769778,
      "learning_rate": 4.999999810671191e-05,
      "loss": 2.7899,
      "num_input_tokens_seen": 90478704,
      "step": 115
    },
    {
      "epoch": 0.012306386590282199,
      "grad_norm": 4.615007661374586,
      "learning_rate": 4.999999782658256e-05,
      "loss": 2.5658,
      "num_input_tokens_seen": 91265376,
      "step": 116
    },
    {
      "epoch": 0.012412476129853597,
      "grad_norm": 3.059747007550569,
      "learning_rate": 4.9999997527133934e-05,
      "loss": 2.7388,
      "num_input_tokens_seen": 92052128,
      "step": 117
    },
    {
      "epoch": 0.012518565669424995,
      "grad_norm": 4.7452052345261,
      "learning_rate": 4.9999997208366054e-05,
      "loss": 2.7722,
      "num_input_tokens_seen": 92838912,
      "step": 118
    },
    {
      "epoch": 0.012624655208996393,
      "grad_norm": 3.3835217972628793,
      "learning_rate": 4.99999968702789e-05,
      "loss": 2.8961,
      "num_input_tokens_seen": 93625568,
      "step": 119
    },
    {
      "epoch": 0.012730744748567792,
      "grad_norm": 3.0856631085987893,
      "learning_rate": 4.9999996512872485e-05,
      "loss": 2.682,
      "num_input_tokens_seen": 94412288,
      "step": 120
    },
    {
      "epoch": 0.01283683428813919,
      "grad_norm": 3.621533539834074,
      "learning_rate": 4.999999613614681e-05,
      "loss": 2.7044,
      "num_input_tokens_seen": 95199040,
      "step": 121
    },
    {
      "epoch": 0.012942923827710588,
      "grad_norm": 3.288504517287484,
      "learning_rate": 4.999999574010187e-05,
      "loss": 2.9319,
      "num_input_tokens_seen": 95985824,
      "step": 122
    },
    {
      "epoch": 0.013049013367281986,
      "grad_norm": 2.3952137020288924,
      "learning_rate": 4.999999532473767e-05,
      "loss": 2.6126,
      "num_input_tokens_seen": 96772640,
      "step": 123
    },
    {
      "epoch": 0.013155102906853384,
      "grad_norm": 2.7398250877218313,
      "learning_rate": 4.9999994890054204e-05,
      "loss": 2.8076,
      "num_input_tokens_seen": 97559408,
      "step": 124
    },
    {
      "epoch": 0.013261192446424782,
      "grad_norm": 1.119031113529056,
      "learning_rate": 4.999999443605147e-05,
      "loss": 2.4186,
      "num_input_tokens_seen": 98346144,
      "step": 125
    },
    {
      "epoch": 0.01336728198599618,
      "grad_norm": 1.2504148122544714,
      "learning_rate": 4.999999396272947e-05,
      "loss": 2.6114,
      "num_input_tokens_seen": 99132928,
      "step": 126
    },
    {
      "epoch": 0.013473371525567579,
      "grad_norm": 2.090361280754225,
      "learning_rate": 4.9999993470088225e-05,
      "loss": 2.749,
      "num_input_tokens_seen": 99919680,
      "step": 127
    },
    {
      "epoch": 0.013579461065138977,
      "grad_norm": 2.017575167173935,
      "learning_rate": 4.999999295812771e-05,
      "loss": 2.6034,
      "num_input_tokens_seen": 100706400,
      "step": 128
    },
    {
      "epoch": 0.013685550604710375,
      "grad_norm": 1.2901877947428673,
      "learning_rate": 4.999999242684793e-05,
      "loss": 2.7924,
      "num_input_tokens_seen": 101493200,
      "step": 129
    },
    {
      "epoch": 0.013791640144281773,
      "grad_norm": 1.4827713637766518,
      "learning_rate": 4.99999918762489e-05,
      "loss": 2.7072,
      "num_input_tokens_seen": 102279968,
      "step": 130
    },
    {
      "epoch": 0.013897729683853171,
      "grad_norm": 1.806786671826711,
      "learning_rate": 4.99999913063306e-05,
      "loss": 2.6427,
      "num_input_tokens_seen": 103066704,
      "step": 131
    },
    {
      "epoch": 0.014003819223424571,
      "grad_norm": 1.4350107387781756,
      "learning_rate": 4.9999990717093047e-05,
      "loss": 2.4973,
      "num_input_tokens_seen": 103853568,
      "step": 132
    },
    {
      "epoch": 0.01410990876299597,
      "grad_norm": 1.2996724894473326,
      "learning_rate": 4.9999990108536235e-05,
      "loss": 2.7063,
      "num_input_tokens_seen": 104640256,
      "step": 133
    },
    {
      "epoch": 0.014215998302567368,
      "grad_norm": 1.7741407976655426,
      "learning_rate": 4.9999989480660154e-05,
      "loss": 2.7633,
      "num_input_tokens_seen": 105426976,
      "step": 134
    },
    {
      "epoch": 0.014322087842138766,
      "grad_norm": 1.8659120641491556,
      "learning_rate": 4.9999988833464824e-05,
      "loss": 2.3953,
      "num_input_tokens_seen": 106213808,
      "step": 135
    },
    {
      "epoch": 0.014428177381710164,
      "grad_norm": 0.9548533262410196,
      "learning_rate": 4.999998816695023e-05,
      "loss": 2.4427,
      "num_input_tokens_seen": 107000512,
      "step": 136
    },
    {
      "epoch": 0.014534266921281562,
      "grad_norm": 2.774813408364066,
      "learning_rate": 4.999998748111638e-05,
      "loss": 2.7325,
      "num_input_tokens_seen": 107787312,
      "step": 137
    },
    {
      "epoch": 0.01464035646085296,
      "grad_norm": 1.9679888573955073,
      "learning_rate": 4.999998677596328e-05,
      "loss": 2.7333,
      "num_input_tokens_seen": 108574048,
      "step": 138
    },
    {
      "epoch": 0.014746446000424358,
      "grad_norm": 1.5885000891803014,
      "learning_rate": 4.999998605149092e-05,
      "loss": 2.7008,
      "num_input_tokens_seen": 109360768,
      "step": 139
    },
    {
      "epoch": 0.014852535539995756,
      "grad_norm": 1.852518356143499,
      "learning_rate": 4.99999853076993e-05,
      "loss": 2.6492,
      "num_input_tokens_seen": 110147520,
      "step": 140
    },
    {
      "epoch": 0.014958625079567155,
      "grad_norm": 3.2222372633536756,
      "learning_rate": 4.999998454458843e-05,
      "loss": 2.6555,
      "num_input_tokens_seen": 110934208,
      "step": 141
    },
    {
      "epoch": 0.015064714619138553,
      "grad_norm": 1.3413942038431943,
      "learning_rate": 4.9999983762158304e-05,
      "loss": 2.6887,
      "num_input_tokens_seen": 111721024,
      "step": 142
    },
    {
      "epoch": 0.015170804158709951,
      "grad_norm": 3.421328570904378,
      "learning_rate": 4.999998296040892e-05,
      "loss": 2.7244,
      "num_input_tokens_seen": 112507728,
      "step": 143
    },
    {
      "epoch": 0.015276893698281349,
      "grad_norm": 2.2427213467913263,
      "learning_rate": 4.999998213934029e-05,
      "loss": 2.6713,
      "num_input_tokens_seen": 113294480,
      "step": 144
    },
    {
      "epoch": 0.015382983237852747,
      "grad_norm": 2.8964380051971395,
      "learning_rate": 4.99999812989524e-05,
      "loss": 2.7474,
      "num_input_tokens_seen": 114081184,
      "step": 145
    },
    {
      "epoch": 0.015489072777424145,
      "grad_norm": 2.668744932649812,
      "learning_rate": 4.9999980439245267e-05,
      "loss": 2.6015,
      "num_input_tokens_seen": 114867840,
      "step": 146
    },
    {
      "epoch": 0.015595162316995544,
      "grad_norm": 1.8925570804878586,
      "learning_rate": 4.999997956021888e-05,
      "loss": 2.6166,
      "num_input_tokens_seen": 115654528,
      "step": 147
    },
    {
      "epoch": 0.015701251856566942,
      "grad_norm": 1.8744700295410393,
      "learning_rate": 4.9999978661873234e-05,
      "loss": 2.3966,
      "num_input_tokens_seen": 116441360,
      "step": 148
    },
    {
      "epoch": 0.01580734139613834,
      "grad_norm": 1.9803588879490213,
      "learning_rate": 4.999997774420835e-05,
      "loss": 2.5567,
      "num_input_tokens_seen": 117228128,
      "step": 149
    },
    {
      "epoch": 0.015913430935709738,
      "grad_norm": 1.565743234638656,
      "learning_rate": 4.9999976807224205e-05,
      "loss": 2.6378,
      "num_input_tokens_seen": 118014800,
      "step": 150
    },
    {
      "epoch": 0.016019520475281136,
      "grad_norm": 1.8458293666850796,
      "learning_rate": 4.999997585092082e-05,
      "loss": 2.752,
      "num_input_tokens_seen": 118801520,
      "step": 151
    },
    {
      "epoch": 0.016125610014852534,
      "grad_norm": 3.4815498545563703,
      "learning_rate": 4.9999974875298184e-05,
      "loss": 2.729,
      "num_input_tokens_seen": 119588304,
      "step": 152
    },
    {
      "epoch": 0.016231699554423933,
      "grad_norm": 1.501524617580014,
      "learning_rate": 4.9999973880356296e-05,
      "loss": 2.4866,
      "num_input_tokens_seen": 120375104,
      "step": 153
    },
    {
      "epoch": 0.01633778909399533,
      "grad_norm": 4.843517774996488,
      "learning_rate": 4.9999972866095165e-05,
      "loss": 2.4823,
      "num_input_tokens_seen": 121161904,
      "step": 154
    },
    {
      "epoch": 0.01644387863356673,
      "grad_norm": 3.1542546867663535,
      "learning_rate": 4.99999718325148e-05,
      "loss": 2.6448,
      "num_input_tokens_seen": 121948656,
      "step": 155
    },
    {
      "epoch": 0.016549968173138127,
      "grad_norm": 3.8065495006819807,
      "learning_rate": 4.9999970779615176e-05,
      "loss": 2.521,
      "num_input_tokens_seen": 122735408,
      "step": 156
    },
    {
      "epoch": 0.016656057712709525,
      "grad_norm": 3.2812162897582344,
      "learning_rate": 4.999996970739632e-05,
      "loss": 2.519,
      "num_input_tokens_seen": 123522224,
      "step": 157
    },
    {
      "epoch": 0.016762147252280923,
      "grad_norm": 3.069419941841549,
      "learning_rate": 4.99999686158582e-05,
      "loss": 2.7293,
      "num_input_tokens_seen": 124308944,
      "step": 158
    },
    {
      "epoch": 0.016868236791852325,
      "grad_norm": 2.6841842592696654,
      "learning_rate": 4.999996750500086e-05,
      "loss": 2.5423,
      "num_input_tokens_seen": 125095792,
      "step": 159
    },
    {
      "epoch": 0.016974326331423723,
      "grad_norm": 2.2826274708715175,
      "learning_rate": 4.999996637482427e-05,
      "loss": 2.5703,
      "num_input_tokens_seen": 125882592,
      "step": 160
    },
    {
      "epoch": 0.01708041587099512,
      "grad_norm": 1.9790938805471043,
      "learning_rate": 4.9999965225328436e-05,
      "loss": 2.4277,
      "num_input_tokens_seen": 126669424,
      "step": 161
    },
    {
      "epoch": 0.01718650541056652,
      "grad_norm": 2.3725307784711487,
      "learning_rate": 4.999996405651337e-05,
      "loss": 2.5635,
      "num_input_tokens_seen": 127456192,
      "step": 162
    },
    {
      "epoch": 0.017292594950137918,
      "grad_norm": 1.815575083783538,
      "learning_rate": 4.9999962868379064e-05,
      "loss": 2.6635,
      "num_input_tokens_seen": 128242944,
      "step": 163
    },
    {
      "epoch": 0.017398684489709316,
      "grad_norm": 3.497996687820066,
      "learning_rate": 4.999996166092552e-05,
      "loss": 2.7748,
      "num_input_tokens_seen": 129029712,
      "step": 164
    },
    {
      "epoch": 0.017504774029280714,
      "grad_norm": 2.3812392439456986,
      "learning_rate": 4.999996043415274e-05,
      "loss": 2.836,
      "num_input_tokens_seen": 129816416,
      "step": 165
    },
    {
      "epoch": 0.017610863568852112,
      "grad_norm": 3.44209865258508,
      "learning_rate": 4.999995918806072e-05,
      "loss": 2.5757,
      "num_input_tokens_seen": 130603168,
      "step": 166
    },
    {
      "epoch": 0.01771695310842351,
      "grad_norm": 3.477431270403951,
      "learning_rate": 4.999995792264947e-05,
      "loss": 2.8547,
      "num_input_tokens_seen": 131389920,
      "step": 167
    },
    {
      "epoch": 0.01782304264799491,
      "grad_norm": 1.700693005793861,
      "learning_rate": 4.999995663791898e-05,
      "loss": 2.6296,
      "num_input_tokens_seen": 132176736,
      "step": 168
    },
    {
      "epoch": 0.017929132187566307,
      "grad_norm": 1.9953360993431442,
      "learning_rate": 4.999995533386925e-05,
      "loss": 2.4396,
      "num_input_tokens_seen": 132963520,
      "step": 169
    },
    {
      "epoch": 0.018035221727137705,
      "grad_norm": 1.3816223300491026,
      "learning_rate": 4.99999540105003e-05,
      "loss": 2.4698,
      "num_input_tokens_seen": 133750304,
      "step": 170
    },
    {
      "epoch": 0.018141311266709103,
      "grad_norm": 1.6722456353488744,
      "learning_rate": 4.999995266781212e-05,
      "loss": 2.3885,
      "num_input_tokens_seen": 134537200,
      "step": 171
    },
    {
      "epoch": 0.0182474008062805,
      "grad_norm": 1.6243429329653427,
      "learning_rate": 4.9999951305804706e-05,
      "loss": 2.6163,
      "num_input_tokens_seen": 135323936,
      "step": 172
    },
    {
      "epoch": 0.0183534903458519,
      "grad_norm": 1.3419963611091053,
      "learning_rate": 4.999994992447806e-05,
      "loss": 2.5743,
      "num_input_tokens_seen": 136110768,
      "step": 173
    },
    {
      "epoch": 0.018459579885423297,
      "grad_norm": 1.920944722010482,
      "learning_rate": 4.999994852383219e-05,
      "loss": 2.5919,
      "num_input_tokens_seen": 136897552,
      "step": 174
    },
    {
      "epoch": 0.018565669424994696,
      "grad_norm": 0.9004881663956655,
      "learning_rate": 4.9999947103867094e-05,
      "loss": 2.5037,
      "num_input_tokens_seen": 137684368,
      "step": 175
    },
    {
      "epoch": 0.018671758964566094,
      "grad_norm": 2.058015957099462,
      "learning_rate": 4.999994566458277e-05,
      "loss": 2.5135,
      "num_input_tokens_seen": 138471184,
      "step": 176
    },
    {
      "epoch": 0.018777848504137492,
      "grad_norm": 1.666117185638751,
      "learning_rate": 4.9999944205979225e-05,
      "loss": 2.6474,
      "num_input_tokens_seen": 139257984,
      "step": 177
    },
    {
      "epoch": 0.01888393804370889,
      "grad_norm": 2.5791836933303993,
      "learning_rate": 4.999994272805646e-05,
      "loss": 2.77,
      "num_input_tokens_seen": 140044800,
      "step": 178
    },
    {
      "epoch": 0.018990027583280288,
      "grad_norm": 1.5563866918313491,
      "learning_rate": 4.999994123081446e-05,
      "loss": 2.3559,
      "num_input_tokens_seen": 140831664,
      "step": 179
    },
    {
      "epoch": 0.019096117122851686,
      "grad_norm": 2.2590828429301286,
      "learning_rate": 4.999993971425325e-05,
      "loss": 2.921,
      "num_input_tokens_seen": 141618368,
      "step": 180
    },
    {
      "epoch": 0.019202206662423085,
      "grad_norm": 1.831562923189873,
      "learning_rate": 4.999993817837282e-05,
      "loss": 2.8406,
      "num_input_tokens_seen": 142405072,
      "step": 181
    },
    {
      "epoch": 0.019308296201994483,
      "grad_norm": 2.555167535995266,
      "learning_rate": 4.9999936623173165e-05,
      "loss": 2.7797,
      "num_input_tokens_seen": 143191808,
      "step": 182
    },
    {
      "epoch": 0.01941438574156588,
      "grad_norm": 1.1482657866895256,
      "learning_rate": 4.99999350486543e-05,
      "loss": 2.3945,
      "num_input_tokens_seen": 143978528,
      "step": 183
    },
    {
      "epoch": 0.01952047528113728,
      "grad_norm": 3.228633115534939,
      "learning_rate": 4.999993345481621e-05,
      "loss": 2.8376,
      "num_input_tokens_seen": 144765232,
      "step": 184
    },
    {
      "epoch": 0.019626564820708677,
      "grad_norm": 2.2593584767146204,
      "learning_rate": 4.999993184165891e-05,
      "loss": 2.7058,
      "num_input_tokens_seen": 145551968,
      "step": 185
    },
    {
      "epoch": 0.019732654360280075,
      "grad_norm": 2.950601100892125,
      "learning_rate": 4.99999302091824e-05,
      "loss": 2.6144,
      "num_input_tokens_seen": 146338816,
      "step": 186
    },
    {
      "epoch": 0.019838743899851474,
      "grad_norm": 2.8738872623287173,
      "learning_rate": 4.999992855738667e-05,
      "loss": 2.8552,
      "num_input_tokens_seen": 147125504,
      "step": 187
    },
    {
      "epoch": 0.01994483343942287,
      "grad_norm": 1.3427495742333049,
      "learning_rate": 4.999992688627173e-05,
      "loss": 2.6783,
      "num_input_tokens_seen": 147912192,
      "step": 188
    },
    {
      "epoch": 0.02005092297899427,
      "grad_norm": 1.6280748844413626,
      "learning_rate": 4.9999925195837586e-05,
      "loss": 2.1972,
      "num_input_tokens_seen": 148698976,
      "step": 189
    },
    {
      "epoch": 0.020157012518565668,
      "grad_norm": 1.5410737235692609,
      "learning_rate": 4.999992348608423e-05,
      "loss": 2.6532,
      "num_input_tokens_seen": 149485680,
      "step": 190
    },
    {
      "epoch": 0.020263102058137066,
      "grad_norm": 2.4122892285718036,
      "learning_rate": 4.999992175701166e-05,
      "loss": 2.5638,
      "num_input_tokens_seen": 150272448,
      "step": 191
    },
    {
      "epoch": 0.020369191597708464,
      "grad_norm": 2.579432376133349,
      "learning_rate": 4.999992000861989e-05,
      "loss": 2.5713,
      "num_input_tokens_seen": 151059312,
      "step": 192
    },
    {
      "epoch": 0.020475281137279863,
      "grad_norm": 1.7601452991858266,
      "learning_rate": 4.9999918240908914e-05,
      "loss": 2.6002,
      "num_input_tokens_seen": 151846048,
      "step": 193
    },
    {
      "epoch": 0.020581370676851264,
      "grad_norm": 4.191917338519192,
      "learning_rate": 4.9999916453878735e-05,
      "loss": 2.6768,
      "num_input_tokens_seen": 152632768,
      "step": 194
    },
    {
      "epoch": 0.020687460216422662,
      "grad_norm": 3.7892062769201718,
      "learning_rate": 4.999991464752936e-05,
      "loss": 2.6988,
      "num_input_tokens_seen": 153419600,
      "step": 195
    },
    {
      "epoch": 0.02079354975599406,
      "grad_norm": 2.4059409516351136,
      "learning_rate": 4.999991282186078e-05,
      "loss": 2.4114,
      "num_input_tokens_seen": 154206368,
      "step": 196
    },
    {
      "epoch": 0.02089963929556546,
      "grad_norm": 2.1375616528091417,
      "learning_rate": 4.9999910976873e-05,
      "loss": 2.4411,
      "num_input_tokens_seen": 154993120,
      "step": 197
    },
    {
      "epoch": 0.021005728835136857,
      "grad_norm": 2.607743884386051,
      "learning_rate": 4.9999909112566023e-05,
      "loss": 2.6303,
      "num_input_tokens_seen": 155779856,
      "step": 198
    },
    {
      "epoch": 0.021111818374708255,
      "grad_norm": 2.3668218279146256,
      "learning_rate": 4.9999907228939854e-05,
      "loss": 2.8464,
      "num_input_tokens_seen": 156566640,
      "step": 199
    },
    {
      "epoch": 0.021217907914279653,
      "grad_norm": 2.7990132156962004,
      "learning_rate": 4.9999905325994476e-05,
      "loss": 2.4153,
      "num_input_tokens_seen": 157353520,
      "step": 200
    },
    {
      "epoch": 0.02132399745385105,
      "grad_norm": 3.3495180368825634,
      "learning_rate": 4.9999903403729916e-05,
      "loss": 2.7209,
      "num_input_tokens_seen": 158140256,
      "step": 201
    },
    {
      "epoch": 0.02143008699342245,
      "grad_norm": 1.5164928961178001,
      "learning_rate": 4.999990146214617e-05,
      "loss": 2.561,
      "num_input_tokens_seen": 158926960,
      "step": 202
    },
    {
      "epoch": 0.021536176532993848,
      "grad_norm": 1.4308822487524409,
      "learning_rate": 4.9999899501243225e-05,
      "loss": 2.6525,
      "num_input_tokens_seen": 159713696,
      "step": 203
    },
    {
      "epoch": 0.021642266072565246,
      "grad_norm": 1.9372354156180938,
      "learning_rate": 4.9999897521021086e-05,
      "loss": 2.8281,
      "num_input_tokens_seen": 160500400,
      "step": 204
    },
    {
      "epoch": 0.021748355612136644,
      "grad_norm": 1.0496231195366075,
      "learning_rate": 4.999989552147977e-05,
      "loss": 2.6597,
      "num_input_tokens_seen": 161287216,
      "step": 205
    },
    {
      "epoch": 0.021854445151708042,
      "grad_norm": 1.975826310878878,
      "learning_rate": 4.9999893502619264e-05,
      "loss": 2.4472,
      "num_input_tokens_seen": 162074048,
      "step": 206
    },
    {
      "epoch": 0.02196053469127944,
      "grad_norm": 1.2621347385239134,
      "learning_rate": 4.9999891464439574e-05,
      "loss": 2.6285,
      "num_input_tokens_seen": 162860768,
      "step": 207
    },
    {
      "epoch": 0.02206662423085084,
      "grad_norm": 2.635030387331071,
      "learning_rate": 4.99998894069407e-05,
      "loss": 2.5565,
      "num_input_tokens_seen": 163647552,
      "step": 208
    },
    {
      "epoch": 0.022172713770422237,
      "grad_norm": 2.2498806749824443,
      "learning_rate": 4.9999887330122655e-05,
      "loss": 2.7768,
      "num_input_tokens_seen": 164434240,
      "step": 209
    },
    {
      "epoch": 0.022278803309993635,
      "grad_norm": 2.1947620382289217,
      "learning_rate": 4.999988523398542e-05,
      "loss": 2.75,
      "num_input_tokens_seen": 165221088,
      "step": 210
    },
    {
      "epoch": 0.022384892849565033,
      "grad_norm": 1.46028641950939,
      "learning_rate": 4.999988311852901e-05,
      "loss": 2.5652,
      "num_input_tokens_seen": 166007824,
      "step": 211
    },
    {
      "epoch": 0.02249098238913643,
      "grad_norm": 2.4712306553094394,
      "learning_rate": 4.9999880983753424e-05,
      "loss": 2.5319,
      "num_input_tokens_seen": 166794528,
      "step": 212
    },
    {
      "epoch": 0.02259707192870783,
      "grad_norm": 1.9412281534293114,
      "learning_rate": 4.9999878829658664e-05,
      "loss": 2.7797,
      "num_input_tokens_seen": 167581328,
      "step": 213
    },
    {
      "epoch": 0.022703161468279227,
      "grad_norm": 2.3746968377968716,
      "learning_rate": 4.999987665624473e-05,
      "loss": 2.6198,
      "num_input_tokens_seen": 168368080,
      "step": 214
    },
    {
      "epoch": 0.022809251007850626,
      "grad_norm": 2.209815443449551,
      "learning_rate": 4.9999874463511626e-05,
      "loss": 2.6686,
      "num_input_tokens_seen": 169154800,
      "step": 215
    },
    {
      "epoch": 0.022915340547422024,
      "grad_norm": 1.1671155042700274,
      "learning_rate": 4.9999872251459354e-05,
      "loss": 2.4889,
      "num_input_tokens_seen": 169941552,
      "step": 216
    },
    {
      "epoch": 0.023021430086993422,
      "grad_norm": 1.5880109053270337,
      "learning_rate": 4.999987002008791e-05,
      "loss": 2.7167,
      "num_input_tokens_seen": 170728272,
      "step": 217
    },
    {
      "epoch": 0.02312751962656482,
      "grad_norm": 1.4049334371921256,
      "learning_rate": 4.99998677693973e-05,
      "loss": 2.7041,
      "num_input_tokens_seen": 171515008,
      "step": 218
    },
    {
      "epoch": 0.023233609166136218,
      "grad_norm": 1.990845572514407,
      "learning_rate": 4.999986549938753e-05,
      "loss": 2.4679,
      "num_input_tokens_seen": 172301808,
      "step": 219
    },
    {
      "epoch": 0.023339698705707616,
      "grad_norm": 1.277805231602235,
      "learning_rate": 4.9999863210058595e-05,
      "loss": 2.5423,
      "num_input_tokens_seen": 173088528,
      "step": 220
    },
    {
      "epoch": 0.023445788245279015,
      "grad_norm": 1.3814050400911975,
      "learning_rate": 4.9999860901410504e-05,
      "loss": 2.5352,
      "num_input_tokens_seen": 173875360,
      "step": 221
    },
    {
      "epoch": 0.023551877784850413,
      "grad_norm": 1.122615146771334,
      "learning_rate": 4.999985857344325e-05,
      "loss": 2.4168,
      "num_input_tokens_seen": 174662176,
      "step": 222
    },
    {
      "epoch": 0.02365796732442181,
      "grad_norm": 1.2775169595231826,
      "learning_rate": 4.999985622615683e-05,
      "loss": 2.7785,
      "num_input_tokens_seen": 175448864,
      "step": 223
    },
    {
      "epoch": 0.02376405686399321,
      "grad_norm": 1.5054805456443698,
      "learning_rate": 4.999985385955127e-05,
      "loss": 2.6112,
      "num_input_tokens_seen": 176235552,
      "step": 224
    },
    {
      "epoch": 0.023870146403564607,
      "grad_norm": 1.075651160262208,
      "learning_rate": 4.9999851473626544e-05,
      "loss": 2.665,
      "num_input_tokens_seen": 177022240,
      "step": 225
    },
    {
      "epoch": 0.023976235943136005,
      "grad_norm": 1.2289169229939962,
      "learning_rate": 4.999984906838267e-05,
      "loss": 2.5085,
      "num_input_tokens_seen": 177809072,
      "step": 226
    },
    {
      "epoch": 0.024082325482707403,
      "grad_norm": 2.2719945470231795,
      "learning_rate": 4.999984664381965e-05,
      "loss": 2.5691,
      "num_input_tokens_seen": 178595760,
      "step": 227
    },
    {
      "epoch": 0.0241884150222788,
      "grad_norm": 1.3430365319557267,
      "learning_rate": 4.999984419993749e-05,
      "loss": 2.6727,
      "num_input_tokens_seen": 179382544,
      "step": 228
    },
    {
      "epoch": 0.024294504561850203,
      "grad_norm": 2.796294206703444,
      "learning_rate": 4.9999841736736167e-05,
      "loss": 2.637,
      "num_input_tokens_seen": 180169360,
      "step": 229
    },
    {
      "epoch": 0.0244005941014216,
      "grad_norm": 2.054101403370951,
      "learning_rate": 4.999983925421571e-05,
      "loss": 2.718,
      "num_input_tokens_seen": 180956080,
      "step": 230
    },
    {
      "epoch": 0.024506683640993,
      "grad_norm": 3.289992987902477,
      "learning_rate": 4.999983675237611e-05,
      "loss": 2.8669,
      "num_input_tokens_seen": 181742768,
      "step": 231
    },
    {
      "epoch": 0.024612773180564398,
      "grad_norm": 2.4291702210516926,
      "learning_rate": 4.999983423121736e-05,
      "loss": 2.6932,
      "num_input_tokens_seen": 182529536,
      "step": 232
    },
    {
      "epoch": 0.024718862720135796,
      "grad_norm": 1.6238395161310688,
      "learning_rate": 4.999983169073948e-05,
      "loss": 2.6465,
      "num_input_tokens_seen": 183316224,
      "step": 233
    },
    {
      "epoch": 0.024824952259707194,
      "grad_norm": 2.2945023600261205,
      "learning_rate": 4.999982913094246e-05,
      "loss": 2.8126,
      "num_input_tokens_seen": 184102992,
      "step": 234
    },
    {
      "epoch": 0.024931041799278592,
      "grad_norm": 1.6226643091444632,
      "learning_rate": 4.999982655182631e-05,
      "loss": 2.7164,
      "num_input_tokens_seen": 184889776,
      "step": 235
    },
    {
      "epoch": 0.02503713133884999,
      "grad_norm": 2.317291196773856,
      "learning_rate": 4.9999823953391024e-05,
      "loss": 2.5208,
      "num_input_tokens_seen": 185676608,
      "step": 236
    },
    {
      "epoch": 0.02514322087842139,
      "grad_norm": 1.8920451910410843,
      "learning_rate": 4.999982133563661e-05,
      "loss": 2.7127,
      "num_input_tokens_seen": 186463360,
      "step": 237
    },
    {
      "epoch": 0.025249310417992787,
      "grad_norm": 2.9516850696767234,
      "learning_rate": 4.9999818698563065e-05,
      "loss": 2.571,
      "num_input_tokens_seen": 187250048,
      "step": 238
    },
    {
      "epoch": 0.025355399957564185,
      "grad_norm": 1.8749323124822728,
      "learning_rate": 4.99998160421704e-05,
      "loss": 2.5392,
      "num_input_tokens_seen": 188036800,
      "step": 239
    },
    {
      "epoch": 0.025461489497135583,
      "grad_norm": 2.3185609197140926,
      "learning_rate": 4.9999813366458604e-05,
      "loss": 2.4296,
      "num_input_tokens_seen": 188823616,
      "step": 240
    },
    {
      "epoch": 0.02556757903670698,
      "grad_norm": 1.8641001125817107,
      "learning_rate": 4.9999810671427685e-05,
      "loss": 2.7218,
      "num_input_tokens_seen": 189610304,
      "step": 241
    },
    {
      "epoch": 0.02567366857627838,
      "grad_norm": 1.1514324400386846,
      "learning_rate": 4.9999807957077646e-05,
      "loss": 2.5556,
      "num_input_tokens_seen": 190397088,
      "step": 242
    },
    {
      "epoch": 0.025779758115849778,
      "grad_norm": 2.3185219579337524,
      "learning_rate": 4.99998052234085e-05,
      "loss": 2.5549,
      "num_input_tokens_seen": 191183840,
      "step": 243
    },
    {
      "epoch": 0.025885847655421176,
      "grad_norm": 1.7316153987256053,
      "learning_rate": 4.999980247042023e-05,
      "loss": 2.6942,
      "num_input_tokens_seen": 191970656,
      "step": 244
    },
    {
      "epoch": 0.025991937194992574,
      "grad_norm": 2.2332710729426624,
      "learning_rate": 4.9999799698112845e-05,
      "loss": 2.5661,
      "num_input_tokens_seen": 192757392,
      "step": 245
    },
    {
      "epoch": 0.026098026734563972,
      "grad_norm": 2.4364119714683246,
      "learning_rate": 4.999979690648635e-05,
      "loss": 2.7076,
      "num_input_tokens_seen": 193544112,
      "step": 246
    },
    {
      "epoch": 0.02620411627413537,
      "grad_norm": 1.7176011713647985,
      "learning_rate": 4.999979409554074e-05,
      "loss": 2.5724,
      "num_input_tokens_seen": 194330896,
      "step": 247
    },
    {
      "epoch": 0.02631020581370677,
      "grad_norm": 2.4073808097192333,
      "learning_rate": 4.999979126527603e-05,
      "loss": 2.6938,
      "num_input_tokens_seen": 195117584,
      "step": 248
    },
    {
      "epoch": 0.026416295353278166,
      "grad_norm": 1.487794549909839,
      "learning_rate": 4.9999788415692216e-05,
      "loss": 2.5479,
      "num_input_tokens_seen": 195904416,
      "step": 249
    },
    {
      "epoch": 0.026522384892849565,
      "grad_norm": 1.3803169307485443,
      "learning_rate": 4.999978554678929e-05,
      "loss": 2.5784,
      "num_input_tokens_seen": 196691168,
      "step": 250
    },
    {
      "epoch": 0.026628474432420963,
      "grad_norm": 1.6243542030056044,
      "learning_rate": 4.9999782658567276e-05,
      "loss": 2.8475,
      "num_input_tokens_seen": 197477824,
      "step": 251
    },
    {
      "epoch": 0.02673456397199236,
      "grad_norm": 1.0026719459995723,
      "learning_rate": 4.999977975102615e-05,
      "loss": 2.5635,
      "num_input_tokens_seen": 198264672,
      "step": 252
    },
    {
      "epoch": 0.02684065351156376,
      "grad_norm": 1.3526420204052996,
      "learning_rate": 4.9999776824165934e-05,
      "loss": 2.5385,
      "num_input_tokens_seen": 199051472,
      "step": 253
    },
    {
      "epoch": 0.026946743051135157,
      "grad_norm": 1.085498496623415,
      "learning_rate": 4.999977387798663e-05,
      "loss": 2.6622,
      "num_input_tokens_seen": 199838192,
      "step": 254
    },
    {
      "epoch": 0.027052832590706555,
      "grad_norm": 2.8433422043880787,
      "learning_rate": 4.9999770912488224e-05,
      "loss": 2.6264,
      "num_input_tokens_seen": 200624960,
      "step": 255
    },
    {
      "epoch": 0.027158922130277954,
      "grad_norm": 2.11745504618827,
      "learning_rate": 4.999976792767074e-05,
      "loss": 2.6194,
      "num_input_tokens_seen": 201411680,
      "step": 256
    },
    {
      "epoch": 0.027265011669849352,
      "grad_norm": 0.9864531095808953,
      "learning_rate": 4.9999764923534154e-05,
      "loss": 2.532,
      "num_input_tokens_seen": 202198448,
      "step": 257
    },
    {
      "epoch": 0.02737110120942075,
      "grad_norm": 1.4699218922021688,
      "learning_rate": 4.999976190007849e-05,
      "loss": 2.4864,
      "num_input_tokens_seen": 202985216,
      "step": 258
    },
    {
      "epoch": 0.027477190748992148,
      "grad_norm": 2.548976958838643,
      "learning_rate": 4.9999758857303744e-05,
      "loss": 2.5299,
      "num_input_tokens_seen": 203771968,
      "step": 259
    },
    {
      "epoch": 0.027583280288563546,
      "grad_norm": 1.3204374854187821,
      "learning_rate": 4.9999755795209925e-05,
      "loss": 2.5129,
      "num_input_tokens_seen": 204558832,
      "step": 260
    },
    {
      "epoch": 0.027689369828134944,
      "grad_norm": 1.2878067074658506,
      "learning_rate": 4.999975271379702e-05,
      "loss": 2.6094,
      "num_input_tokens_seen": 205345648,
      "step": 261
    },
    {
      "epoch": 0.027795459367706343,
      "grad_norm": 1.2154707374514593,
      "learning_rate": 4.999974961306504e-05,
      "loss": 2.7032,
      "num_input_tokens_seen": 206132384,
      "step": 262
    },
    {
      "epoch": 0.02790154890727774,
      "grad_norm": 2.073770191753925,
      "learning_rate": 4.999974649301399e-05,
      "loss": 2.6006,
      "num_input_tokens_seen": 206919216,
      "step": 263
    },
    {
      "epoch": 0.028007638446849142,
      "grad_norm": 1.2466523633106599,
      "learning_rate": 4.999974335364387e-05,
      "loss": 2.6318,
      "num_input_tokens_seen": 207705952,
      "step": 264
    },
    {
      "epoch": 0.02811372798642054,
      "grad_norm": 0.8657838038406629,
      "learning_rate": 4.999974019495467e-05,
      "loss": 2.4843,
      "num_input_tokens_seen": 208492784,
      "step": 265
    },
    {
      "epoch": 0.02821981752599194,
      "grad_norm": 1.2551251205855194,
      "learning_rate": 4.999973701694642e-05,
      "loss": 2.5603,
      "num_input_tokens_seen": 209279568,
      "step": 266
    },
    {
      "epoch": 0.028325907065563337,
      "grad_norm": 2.59535788728045,
      "learning_rate": 4.99997338196191e-05,
      "loss": 2.5392,
      "num_input_tokens_seen": 210066352,
      "step": 267
    },
    {
      "epoch": 0.028431996605134735,
      "grad_norm": 1.0710478658893148,
      "learning_rate": 4.999973060297271e-05,
      "loss": 2.4055,
      "num_input_tokens_seen": 210853136,
      "step": 268
    },
    {
      "epoch": 0.028538086144706133,
      "grad_norm": 2.3585839475379156,
      "learning_rate": 4.999972736700728e-05,
      "loss": 2.7124,
      "num_input_tokens_seen": 211639984,
      "step": 269
    },
    {
      "epoch": 0.02864417568427753,
      "grad_norm": 1.9363105354174128,
      "learning_rate": 4.999972411172279e-05,
      "loss": 2.683,
      "num_input_tokens_seen": 212426768,
      "step": 270
    },
    {
      "epoch": 0.02875026522384893,
      "grad_norm": 1.5157769519302229,
      "learning_rate": 4.999972083711924e-05,
      "loss": 2.7625,
      "num_input_tokens_seen": 213213584,
      "step": 271
    },
    {
      "epoch": 0.028856354763420328,
      "grad_norm": 1.1393798844554957,
      "learning_rate": 4.999971754319665e-05,
      "loss": 2.4202,
      "num_input_tokens_seen": 214000384,
      "step": 272
    },
    {
      "epoch": 0.028962444302991726,
      "grad_norm": 1.3681020449726355,
      "learning_rate": 4.9999714229955e-05,
      "loss": 2.5906,
      "num_input_tokens_seen": 214787136,
      "step": 273
    },
    {
      "epoch": 0.029068533842563124,
      "grad_norm": 1.822597226187751,
      "learning_rate": 4.99997108973943e-05,
      "loss": 2.4262,
      "num_input_tokens_seen": 215573824,
      "step": 274
    },
    {
      "epoch": 0.029174623382134522,
      "grad_norm": 1.1773564853246734,
      "learning_rate": 4.9999707545514576e-05,
      "loss": 2.4533,
      "num_input_tokens_seen": 216360592,
      "step": 275
    },
    {
      "epoch": 0.02928071292170592,
      "grad_norm": 1.4209190821306819,
      "learning_rate": 4.9999704174315795e-05,
      "loss": 2.4347,
      "num_input_tokens_seen": 217147392,
      "step": 276
    },
    {
      "epoch": 0.02938680246127732,
      "grad_norm": 1.2885841848567752,
      "learning_rate": 4.999970078379798e-05,
      "loss": 2.6578,
      "num_input_tokens_seen": 217934192,
      "step": 277
    },
    {
      "epoch": 0.029492892000848717,
      "grad_norm": 3.65591182892161,
      "learning_rate": 4.999969737396113e-05,
      "loss": 2.7635,
      "num_input_tokens_seen": 218720960,
      "step": 278
    },
    {
      "epoch": 0.029598981540420115,
      "grad_norm": 1.3979433726394528,
      "learning_rate": 4.999969394480525e-05,
      "loss": 2.4637,
      "num_input_tokens_seen": 219507712,
      "step": 279
    },
    {
      "epoch": 0.029705071079991513,
      "grad_norm": 2.975065031688236,
      "learning_rate": 4.999969049633034e-05,
      "loss": 2.5562,
      "num_input_tokens_seen": 220294448,
      "step": 280
    },
    {
      "epoch": 0.02981116061956291,
      "grad_norm": 2.318796572425591,
      "learning_rate": 4.9999687028536404e-05,
      "loss": 2.6485,
      "num_input_tokens_seen": 221081232,
      "step": 281
    },
    {
      "epoch": 0.02991725015913431,
      "grad_norm": 2.029322808203846,
      "learning_rate": 4.9999683541423435e-05,
      "loss": 2.4088,
      "num_input_tokens_seen": 221868048,
      "step": 282
    },
    {
      "epoch": 0.030023339698705707,
      "grad_norm": 2.676776036791408,
      "learning_rate": 4.999968003499146e-05,
      "loss": 2.4678,
      "num_input_tokens_seen": 222654848,
      "step": 283
    },
    {
      "epoch": 0.030129429238277106,
      "grad_norm": 2.5678867292690963,
      "learning_rate": 4.999967650924045e-05,
      "loss": 2.8224,
      "num_input_tokens_seen": 223441616,
      "step": 284
    },
    {
      "epoch": 0.030235518777848504,
      "grad_norm": 2.832561389515151,
      "learning_rate": 4.999967296417043e-05,
      "loss": 2.6915,
      "num_input_tokens_seen": 224228384,
      "step": 285
    },
    {
      "epoch": 0.030341608317419902,
      "grad_norm": 2.7320263563572036,
      "learning_rate": 4.9999669399781394e-05,
      "loss": 2.6956,
      "num_input_tokens_seen": 225015168,
      "step": 286
    },
    {
      "epoch": 0.0304476978569913,
      "grad_norm": 2.878347894672741,
      "learning_rate": 4.999966581607335e-05,
      "loss": 2.6073,
      "num_input_tokens_seen": 225801984,
      "step": 287
    },
    {
      "epoch": 0.030553787396562698,
      "grad_norm": 1.8526185359125322,
      "learning_rate": 4.9999662213046294e-05,
      "loss": 2.6336,
      "num_input_tokens_seen": 226588768,
      "step": 288
    },
    {
      "epoch": 0.030659876936134096,
      "grad_norm": 2.933424225548633,
      "learning_rate": 4.999965859070024e-05,
      "loss": 2.7465,
      "num_input_tokens_seen": 227375504,
      "step": 289
    },
    {
      "epoch": 0.030765966475705495,
      "grad_norm": 1.8105662330805001,
      "learning_rate": 4.999965494903518e-05,
      "loss": 2.5793,
      "num_input_tokens_seen": 228162224,
      "step": 290
    },
    {
      "epoch": 0.030872056015276893,
      "grad_norm": 3.000124443435538,
      "learning_rate": 4.999965128805112e-05,
      "loss": 2.6473,
      "num_input_tokens_seen": 228948992,
      "step": 291
    },
    {
      "epoch": 0.03097814555484829,
      "grad_norm": 1.7119900992152035,
      "learning_rate": 4.9999647607748054e-05,
      "loss": 2.5176,
      "num_input_tokens_seen": 229735824,
      "step": 292
    },
    {
      "epoch": 0.03108423509441969,
      "grad_norm": 2.315756131508293,
      "learning_rate": 4.9999643908126004e-05,
      "loss": 2.5731,
      "num_input_tokens_seen": 230522624,
      "step": 293
    },
    {
      "epoch": 0.031190324633991087,
      "grad_norm": 1.3969077840512836,
      "learning_rate": 4.999964018918496e-05,
      "loss": 2.4315,
      "num_input_tokens_seen": 231309472,
      "step": 294
    },
    {
      "epoch": 0.031296414173562485,
      "grad_norm": 2.5681853700965207,
      "learning_rate": 4.999963645092493e-05,
      "loss": 2.3722,
      "num_input_tokens_seen": 232096352,
      "step": 295
    },
    {
      "epoch": 0.031402503713133884,
      "grad_norm": 1.8389975298442187,
      "learning_rate": 4.999963269334591e-05,
      "loss": 2.4269,
      "num_input_tokens_seen": 232883184,
      "step": 296
    },
    {
      "epoch": 0.03150859325270528,
      "grad_norm": 2.7844445950121237,
      "learning_rate": 4.999962891644792e-05,
      "loss": 2.3427,
      "num_input_tokens_seen": 233670064,
      "step": 297
    },
    {
      "epoch": 0.03161468279227668,
      "grad_norm": 2.8776644816634898,
      "learning_rate": 4.999962512023093e-05,
      "loss": 2.7555,
      "num_input_tokens_seen": 234456736,
      "step": 298
    },
    {
      "epoch": 0.03172077233184808,
      "grad_norm": 1.7083206647045586,
      "learning_rate": 4.9999621304694975e-05,
      "loss": 2.5321,
      "num_input_tokens_seen": 235243472,
      "step": 299
    },
    {
      "epoch": 0.031826861871419476,
      "grad_norm": 1.7324252289708617,
      "learning_rate": 4.999961746984004e-05,
      "loss": 2.4995,
      "num_input_tokens_seen": 236030304,
      "step": 300
    },
    {
      "epoch": 0.031932951410990874,
      "grad_norm": 1.2410869160568616,
      "learning_rate": 4.999961361566614e-05,
      "loss": 2.5643,
      "num_input_tokens_seen": 236817200,
      "step": 301
    },
    {
      "epoch": 0.03203904095056227,
      "grad_norm": 2.1920403358798213,
      "learning_rate": 4.9999609742173276e-05,
      "loss": 2.532,
      "num_input_tokens_seen": 237603952,
      "step": 302
    },
    {
      "epoch": 0.03214513049013367,
      "grad_norm": 1.339841026285963,
      "learning_rate": 4.999960584936144e-05,
      "loss": 2.6299,
      "num_input_tokens_seen": 238390688,
      "step": 303
    },
    {
      "epoch": 0.03225122002970507,
      "grad_norm": 2.3416279391510226,
      "learning_rate": 4.9999601937230644e-05,
      "loss": 2.3977,
      "num_input_tokens_seen": 239177504,
      "step": 304
    },
    {
      "epoch": 0.03235730956927647,
      "grad_norm": 1.9064256187101272,
      "learning_rate": 4.999959800578089e-05,
      "loss": 2.7237,
      "num_input_tokens_seen": 239964320,
      "step": 305
    },
    {
      "epoch": 0.032463399108847865,
      "grad_norm": 2.0432213931738823,
      "learning_rate": 4.999959405501218e-05,
      "loss": 2.5155,
      "num_input_tokens_seen": 240751072,
      "step": 306
    },
    {
      "epoch": 0.03256948864841926,
      "grad_norm": 1.7113063108456676,
      "learning_rate": 4.999959008492452e-05,
      "loss": 2.5054,
      "num_input_tokens_seen": 241537920,
      "step": 307
    },
    {
      "epoch": 0.03267557818799066,
      "grad_norm": 1.2634337112153895,
      "learning_rate": 4.99995860955179e-05,
      "loss": 2.283,
      "num_input_tokens_seen": 242324816,
      "step": 308
    },
    {
      "epoch": 0.03278166772756206,
      "grad_norm": 2.170850412290721,
      "learning_rate": 4.999958208679234e-05,
      "loss": 2.6513,
      "num_input_tokens_seen": 243111616,
      "step": 309
    },
    {
      "epoch": 0.03288775726713346,
      "grad_norm": 1.4205546653040153,
      "learning_rate": 4.999957805874784e-05,
      "loss": 2.3798,
      "num_input_tokens_seen": 243898416,
      "step": 310
    },
    {
      "epoch": 0.032993846806704856,
      "grad_norm": 1.9400972385150144,
      "learning_rate": 4.99995740113844e-05,
      "loss": 2.7768,
      "num_input_tokens_seen": 244685152,
      "step": 311
    },
    {
      "epoch": 0.033099936346276254,
      "grad_norm": 1.7029275542380182,
      "learning_rate": 4.9999569944702016e-05,
      "loss": 2.6825,
      "num_input_tokens_seen": 245471840,
      "step": 312
    },
    {
      "epoch": 0.03320602588584765,
      "grad_norm": 0.9813381629556781,
      "learning_rate": 4.99995658587007e-05,
      "loss": 2.5896,
      "num_input_tokens_seen": 246258640,
      "step": 313
    },
    {
      "epoch": 0.03331211542541905,
      "grad_norm": 1.4830933542056741,
      "learning_rate": 4.999956175338045e-05,
      "loss": 2.8445,
      "num_input_tokens_seen": 247045408,
      "step": 314
    },
    {
      "epoch": 0.03341820496499045,
      "grad_norm": 1.5482404840033006,
      "learning_rate": 4.9999557628741285e-05,
      "loss": 2.3638,
      "num_input_tokens_seen": 247832176,
      "step": 315
    },
    {
      "epoch": 0.03352429450456185,
      "grad_norm": 1.5051924679490187,
      "learning_rate": 4.9999553484783186e-05,
      "loss": 2.4248,
      "num_input_tokens_seen": 248619024,
      "step": 316
    },
    {
      "epoch": 0.03363038404413325,
      "grad_norm": 1.2223840268602613,
      "learning_rate": 4.999954932150617e-05,
      "loss": 2.6362,
      "num_input_tokens_seen": 249405904,
      "step": 317
    },
    {
      "epoch": 0.03373647358370465,
      "grad_norm": 2.0438096871226583,
      "learning_rate": 4.999954513891022e-05,
      "loss": 2.557,
      "num_input_tokens_seen": 250192656,
      "step": 318
    },
    {
      "epoch": 0.03384256312327605,
      "grad_norm": 1.4925324512937148,
      "learning_rate": 4.999954093699537e-05,
      "loss": 2.7289,
      "num_input_tokens_seen": 250979408,
      "step": 319
    },
    {
      "epoch": 0.033948652662847446,
      "grad_norm": 1.2294488838445692,
      "learning_rate": 4.999953671576161e-05,
      "loss": 2.6354,
      "num_input_tokens_seen": 251766032,
      "step": 320
    },
    {
      "epoch": 0.034054742202418845,
      "grad_norm": 1.0227844631318082,
      "learning_rate": 4.999953247520894e-05,
      "loss": 2.6374,
      "num_input_tokens_seen": 252552656,
      "step": 321
    },
    {
      "epoch": 0.03416083174199024,
      "grad_norm": 2.177418036013238,
      "learning_rate": 4.9999528215337355e-05,
      "loss": 2.5261,
      "num_input_tokens_seen": 253339424,
      "step": 322
    },
    {
      "epoch": 0.03426692128156164,
      "grad_norm": 1.836727772620066,
      "learning_rate": 4.9999523936146876e-05,
      "loss": 2.5678,
      "num_input_tokens_seen": 254126160,
      "step": 323
    },
    {
      "epoch": 0.03437301082113304,
      "grad_norm": 1.1779062142183392,
      "learning_rate": 4.9999519637637505e-05,
      "loss": 2.6164,
      "num_input_tokens_seen": 254912896,
      "step": 324
    },
    {
      "epoch": 0.03447910036070444,
      "grad_norm": 1.1071911349108599,
      "learning_rate": 4.9999515319809225e-05,
      "loss": 2.6216,
      "num_input_tokens_seen": 255699616,
      "step": 325
    },
    {
      "epoch": 0.034585189900275835,
      "grad_norm": 1.1491302403091659,
      "learning_rate": 4.9999510982662054e-05,
      "loss": 2.4793,
      "num_input_tokens_seen": 256486416,
      "step": 326
    },
    {
      "epoch": 0.034691279439847234,
      "grad_norm": 1.4538462347830088,
      "learning_rate": 4.9999506626196006e-05,
      "loss": 2.6124,
      "num_input_tokens_seen": 257273152,
      "step": 327
    },
    {
      "epoch": 0.03479736897941863,
      "grad_norm": 2.6076147731228096,
      "learning_rate": 4.999950225041107e-05,
      "loss": 2.7605,
      "num_input_tokens_seen": 258059936,
      "step": 328
    },
    {
      "epoch": 0.03490345851899003,
      "grad_norm": 1.2661313307035422,
      "learning_rate": 4.999949785530724e-05,
      "loss": 2.5019,
      "num_input_tokens_seen": 258846720,
      "step": 329
    },
    {
      "epoch": 0.03500954805856143,
      "grad_norm": 1.17784908631374,
      "learning_rate": 4.999949344088455e-05,
      "loss": 2.5715,
      "num_input_tokens_seen": 259633424,
      "step": 330
    },
    {
      "epoch": 0.035115637598132826,
      "grad_norm": 1.690538592685011,
      "learning_rate": 4.999948900714297e-05,
      "loss": 2.7225,
      "num_input_tokens_seen": 260420160,
      "step": 331
    },
    {
      "epoch": 0.035221727137704224,
      "grad_norm": 1.2012899132565622,
      "learning_rate": 4.999948455408253e-05,
      "loss": 2.6251,
      "num_input_tokens_seen": 261206944,
      "step": 332
    },
    {
      "epoch": 0.03532781667727562,
      "grad_norm": 2.8735805058289143,
      "learning_rate": 4.999948008170321e-05,
      "loss": 2.7367,
      "num_input_tokens_seen": 261993712,
      "step": 333
    },
    {
      "epoch": 0.03543390621684702,
      "grad_norm": 1.3844724171966714,
      "learning_rate": 4.999947559000503e-05,
      "loss": 2.5947,
      "num_input_tokens_seen": 262780400,
      "step": 334
    },
    {
      "epoch": 0.03553999575641842,
      "grad_norm": 1.2205691673943102,
      "learning_rate": 4.999947107898799e-05,
      "loss": 2.8775,
      "num_input_tokens_seen": 263567136,
      "step": 335
    },
    {
      "epoch": 0.03564608529598982,
      "grad_norm": 1.2061239588581696,
      "learning_rate": 4.9999466548652095e-05,
      "loss": 2.8119,
      "num_input_tokens_seen": 264353776,
      "step": 336
    },
    {
      "epoch": 0.035752174835561215,
      "grad_norm": 0.9203355944487864,
      "learning_rate": 4.999946199899734e-05,
      "loss": 2.598,
      "num_input_tokens_seen": 265140496,
      "step": 337
    },
    {
      "epoch": 0.03585826437513261,
      "grad_norm": 2.0956817794716587,
      "learning_rate": 4.999945743002374e-05,
      "loss": 2.8294,
      "num_input_tokens_seen": 265927216,
      "step": 338
    },
    {
      "epoch": 0.03596435391470401,
      "grad_norm": 1.4898976979130614,
      "learning_rate": 4.999945284173129e-05,
      "loss": 2.6661,
      "num_input_tokens_seen": 266714016,
      "step": 339
    },
    {
      "epoch": 0.03607044345427541,
      "grad_norm": 1.1486192723519988,
      "learning_rate": 4.9999448234119994e-05,
      "loss": 2.3081,
      "num_input_tokens_seen": 267500768,
      "step": 340
    },
    {
      "epoch": 0.03617653299384681,
      "grad_norm": 1.4221272603078217,
      "learning_rate": 4.999944360718986e-05,
      "loss": 2.64,
      "num_input_tokens_seen": 268287632,
      "step": 341
    },
    {
      "epoch": 0.036282622533418206,
      "grad_norm": 1.374181535038573,
      "learning_rate": 4.999943896094089e-05,
      "loss": 2.4294,
      "num_input_tokens_seen": 269074400,
      "step": 342
    },
    {
      "epoch": 0.036388712072989604,
      "grad_norm": 1.869807310236694,
      "learning_rate": 4.999943429537309e-05,
      "loss": 2.482,
      "num_input_tokens_seen": 269861216,
      "step": 343
    },
    {
      "epoch": 0.036494801612561,
      "grad_norm": 0.8708675218799282,
      "learning_rate": 4.999942961048646e-05,
      "loss": 2.4666,
      "num_input_tokens_seen": 270648016,
      "step": 344
    },
    {
      "epoch": 0.0366008911521324,
      "grad_norm": 0.9195764365561498,
      "learning_rate": 4.9999424906281e-05,
      "loss": 2.3828,
      "num_input_tokens_seen": 271434864,
      "step": 345
    },
    {
      "epoch": 0.0367069806917038,
      "grad_norm": 1.2990056594396617,
      "learning_rate": 4.999942018275672e-05,
      "loss": 2.2939,
      "num_input_tokens_seen": 272221712,
      "step": 346
    },
    {
      "epoch": 0.0368130702312752,
      "grad_norm": 1.5389536672780733,
      "learning_rate": 4.9999415439913624e-05,
      "loss": 2.6741,
      "num_input_tokens_seen": 273008448,
      "step": 347
    },
    {
      "epoch": 0.036919159770846595,
      "grad_norm": 1.5935359955319992,
      "learning_rate": 4.99994106777517e-05,
      "loss": 2.5263,
      "num_input_tokens_seen": 273795296,
      "step": 348
    },
    {
      "epoch": 0.03702524931041799,
      "grad_norm": 1.3162279350708739,
      "learning_rate": 4.999940589627098e-05,
      "loss": 2.5022,
      "num_input_tokens_seen": 274582064,
      "step": 349
    },
    {
      "epoch": 0.03713133884998939,
      "grad_norm": 1.1711832029504357,
      "learning_rate": 4.9999401095471445e-05,
      "loss": 2.4503,
      "num_input_tokens_seen": 275368832,
      "step": 350
    },
    {
      "epoch": 0.03723742838956079,
      "grad_norm": 1.1988321708569267,
      "learning_rate": 4.9999396275353115e-05,
      "loss": 2.5089,
      "num_input_tokens_seen": 276155584,
      "step": 351
    },
    {
      "epoch": 0.03734351792913219,
      "grad_norm": 1.7343191040112833,
      "learning_rate": 4.9999391435915975e-05,
      "loss": 2.5397,
      "num_input_tokens_seen": 276942336,
      "step": 352
    },
    {
      "epoch": 0.037449607468703586,
      "grad_norm": 1.489521064283134,
      "learning_rate": 4.999938657716005e-05,
      "loss": 2.2808,
      "num_input_tokens_seen": 277729104,
      "step": 353
    },
    {
      "epoch": 0.037555697008274984,
      "grad_norm": 0.9788297469259153,
      "learning_rate": 4.999938169908532e-05,
      "loss": 2.3948,
      "num_input_tokens_seen": 278515920,
      "step": 354
    },
    {
      "epoch": 0.03766178654784638,
      "grad_norm": 1.4802385497906965,
      "learning_rate": 4.999937680169181e-05,
      "loss": 2.7093,
      "num_input_tokens_seen": 279302640,
      "step": 355
    },
    {
      "epoch": 0.03776787608741778,
      "grad_norm": 2.1910524020011417,
      "learning_rate": 4.999937188497951e-05,
      "loss": 2.2844,
      "num_input_tokens_seen": 280089520,
      "step": 356
    },
    {
      "epoch": 0.03787396562698918,
      "grad_norm": 0.8664337301104134,
      "learning_rate": 4.9999366948948434e-05,
      "loss": 2.5824,
      "num_input_tokens_seen": 280876304,
      "step": 357
    },
    {
      "epoch": 0.037980055166560577,
      "grad_norm": 2.3305402005398452,
      "learning_rate": 4.999936199359858e-05,
      "loss": 2.5493,
      "num_input_tokens_seen": 281663104,
      "step": 358
    },
    {
      "epoch": 0.038086144706131975,
      "grad_norm": 1.6159057909315926,
      "learning_rate": 4.999935701892995e-05,
      "loss": 2.6987,
      "num_input_tokens_seen": 282449936,
      "step": 359
    },
    {
      "epoch": 0.03819223424570337,
      "grad_norm": 1.765658899079102,
      "learning_rate": 4.9999352024942555e-05,
      "loss": 2.6382,
      "num_input_tokens_seen": 283236672,
      "step": 360
    },
    {
      "epoch": 0.03829832378527477,
      "grad_norm": 1.31099255120287,
      "learning_rate": 4.9999347011636386e-05,
      "loss": 2.6089,
      "num_input_tokens_seen": 284023424,
      "step": 361
    },
    {
      "epoch": 0.03840441332484617,
      "grad_norm": 2.676588797089962,
      "learning_rate": 4.999934197901146e-05,
      "loss": 2.8803,
      "num_input_tokens_seen": 284810112,
      "step": 362
    },
    {
      "epoch": 0.03851050286441757,
      "grad_norm": 1.2010815285034702,
      "learning_rate": 4.9999336927067775e-05,
      "loss": 2.5578,
      "num_input_tokens_seen": 285596944,
      "step": 363
    },
    {
      "epoch": 0.038616592403988965,
      "grad_norm": 3.8826201701294263,
      "learning_rate": 4.999933185580534e-05,
      "loss": 2.8148,
      "num_input_tokens_seen": 286383632,
      "step": 364
    },
    {
      "epoch": 0.038722681943560364,
      "grad_norm": 2.489058315969692,
      "learning_rate": 4.999932676522415e-05,
      "loss": 2.6754,
      "num_input_tokens_seen": 287170384,
      "step": 365
    },
    {
      "epoch": 0.03882877148313176,
      "grad_norm": 2.880192725155764,
      "learning_rate": 4.9999321655324216e-05,
      "loss": 2.8143,
      "num_input_tokens_seen": 287957168,
      "step": 366
    },
    {
      "epoch": 0.03893486102270316,
      "grad_norm": 1.7955374373038566,
      "learning_rate": 4.999931652610554e-05,
      "loss": 2.5036,
      "num_input_tokens_seen": 288743968,
      "step": 367
    },
    {
      "epoch": 0.03904095056227456,
      "grad_norm": 2.14358720837542,
      "learning_rate": 4.9999311377568125e-05,
      "loss": 2.5912,
      "num_input_tokens_seen": 289530720,
      "step": 368
    },
    {
      "epoch": 0.039147040101845956,
      "grad_norm": 2.0114584246248284,
      "learning_rate": 4.999930620971197e-05,
      "loss": 2.6063,
      "num_input_tokens_seen": 290317504,
      "step": 369
    },
    {
      "epoch": 0.039253129641417354,
      "grad_norm": 1.8408270081945355,
      "learning_rate": 4.999930102253709e-05,
      "loss": 2.4946,
      "num_input_tokens_seen": 291104240,
      "step": 370
    },
    {
      "epoch": 0.03935921918098875,
      "grad_norm": 1.519288919110294,
      "learning_rate": 4.999929581604349e-05,
      "loss": 2.4676,
      "num_input_tokens_seen": 291891008,
      "step": 371
    },
    {
      "epoch": 0.03946530872056015,
      "grad_norm": 2.0341633599006275,
      "learning_rate": 4.9999290590231165e-05,
      "loss": 2.4379,
      "num_input_tokens_seen": 292677792,
      "step": 372
    },
    {
      "epoch": 0.03957139826013155,
      "grad_norm": 1.326359821898248,
      "learning_rate": 4.999928534510011e-05,
      "loss": 2.3932,
      "num_input_tokens_seen": 293464576,
      "step": 373
    },
    {
      "epoch": 0.03967748779970295,
      "grad_norm": 2.0550604039753417,
      "learning_rate": 4.999928008065035e-05,
      "loss": 2.3844,
      "num_input_tokens_seen": 294251328,
      "step": 374
    },
    {
      "epoch": 0.039783577339274345,
      "grad_norm": 1.8954883300675094,
      "learning_rate": 4.999927479688188e-05,
      "loss": 2.668,
      "num_input_tokens_seen": 295038096,
      "step": 375
    },
    {
      "epoch": 0.03988966687884574,
      "grad_norm": 1.522673777845715,
      "learning_rate": 4.9999269493794705e-05,
      "loss": 2.4393,
      "num_input_tokens_seen": 295824976,
      "step": 376
    },
    {
      "epoch": 0.03999575641841714,
      "grad_norm": 2.150475092780063,
      "learning_rate": 4.9999264171388825e-05,
      "loss": 2.4965,
      "num_input_tokens_seen": 296611648,
      "step": 377
    },
    {
      "epoch": 0.04010184595798854,
      "grad_norm": 1.2423455891856265,
      "learning_rate": 4.999925882966425e-05,
      "loss": 2.4162,
      "num_input_tokens_seen": 297398448,
      "step": 378
    },
    {
      "epoch": 0.04020793549755994,
      "grad_norm": 1.3269984582031267,
      "learning_rate": 4.999925346862098e-05,
      "loss": 2.6414,
      "num_input_tokens_seen": 298185152,
      "step": 379
    },
    {
      "epoch": 0.040314025037131336,
      "grad_norm": 2.2579284073410477,
      "learning_rate": 4.999924808825902e-05,
      "loss": 2.3953,
      "num_input_tokens_seen": 298972000,
      "step": 380
    },
    {
      "epoch": 0.040420114576702734,
      "grad_norm": 1.2474191529606355,
      "learning_rate": 4.9999242688578374e-05,
      "loss": 2.6735,
      "num_input_tokens_seen": 299758720,
      "step": 381
    },
    {
      "epoch": 0.04052620411627413,
      "grad_norm": 2.705972588910654,
      "learning_rate": 4.9999237269579045e-05,
      "loss": 2.6073,
      "num_input_tokens_seen": 300545424,
      "step": 382
    },
    {
      "epoch": 0.04063229365584553,
      "grad_norm": 2.035914318895527,
      "learning_rate": 4.999923183126104e-05,
      "loss": 2.5532,
      "num_input_tokens_seen": 301332224,
      "step": 383
    },
    {
      "epoch": 0.04073838319541693,
      "grad_norm": 1.0146338317705765,
      "learning_rate": 4.999922637362436e-05,
      "loss": 2.6171,
      "num_input_tokens_seen": 302118960,
      "step": 384
    },
    {
      "epoch": 0.04084447273498833,
      "grad_norm": 2.952163213215258,
      "learning_rate": 4.999922089666902e-05,
      "loss": 2.5311,
      "num_input_tokens_seen": 302905680,
      "step": 385
    },
    {
      "epoch": 0.040950562274559725,
      "grad_norm": 2.2359807130459397,
      "learning_rate": 4.999921540039502e-05,
      "loss": 2.701,
      "num_input_tokens_seen": 303692560,
      "step": 386
    },
    {
      "epoch": 0.04105665181413113,
      "grad_norm": 1.8730684630126626,
      "learning_rate": 4.999920988480235e-05,
      "loss": 2.6652,
      "num_input_tokens_seen": 304479216,
      "step": 387
    },
    {
      "epoch": 0.04116274135370253,
      "grad_norm": 1.570026293866262,
      "learning_rate": 4.999920434989101e-05,
      "loss": 2.4997,
      "num_input_tokens_seen": 305266064,
      "step": 388
    },
    {
      "epoch": 0.041268830893273926,
      "grad_norm": 2.3951635915772007,
      "learning_rate": 4.999919879566104e-05,
      "loss": 2.4675,
      "num_input_tokens_seen": 306052816,
      "step": 389
    },
    {
      "epoch": 0.041374920432845325,
      "grad_norm": 1.8262641289097314,
      "learning_rate": 4.9999193222112417e-05,
      "loss": 2.6747,
      "num_input_tokens_seen": 306839616,
      "step": 390
    },
    {
      "epoch": 0.04148100997241672,
      "grad_norm": 1.2699475990557367,
      "learning_rate": 4.999918762924515e-05,
      "loss": 2.5918,
      "num_input_tokens_seen": 307626272,
      "step": 391
    },
    {
      "epoch": 0.04158709951198812,
      "grad_norm": 1.179341383231568,
      "learning_rate": 4.999918201705924e-05,
      "loss": 2.5175,
      "num_input_tokens_seen": 308413120,
      "step": 392
    },
    {
      "epoch": 0.04169318905155952,
      "grad_norm": 1.0156485989620996,
      "learning_rate": 4.99991763855547e-05,
      "loss": 2.4769,
      "num_input_tokens_seen": 309199872,
      "step": 393
    },
    {
      "epoch": 0.04179927859113092,
      "grad_norm": 1.2750952905499566,
      "learning_rate": 4.999917073473153e-05,
      "loss": 2.7978,
      "num_input_tokens_seen": 309986672,
      "step": 394
    },
    {
      "epoch": 0.041905368130702315,
      "grad_norm": 1.4230075305275076,
      "learning_rate": 4.999916506458974e-05,
      "loss": 2.4018,
      "num_input_tokens_seen": 310773520,
      "step": 395
    },
    {
      "epoch": 0.042011457670273714,
      "grad_norm": 1.1539127368716025,
      "learning_rate": 4.999915937512932e-05,
      "loss": 2.4049,
      "num_input_tokens_seen": 311560224,
      "step": 396
    },
    {
      "epoch": 0.04211754720984511,
      "grad_norm": 1.042539935672998,
      "learning_rate": 4.999915366635029e-05,
      "loss": 2.537,
      "num_input_tokens_seen": 312347008,
      "step": 397
    },
    {
      "epoch": 0.04222363674941651,
      "grad_norm": 2.1786509826768095,
      "learning_rate": 4.999914793825264e-05,
      "loss": 2.6286,
      "num_input_tokens_seen": 313133776,
      "step": 398
    },
    {
      "epoch": 0.04232972628898791,
      "grad_norm": 1.4250003865333958,
      "learning_rate": 4.9999142190836376e-05,
      "loss": 2.7487,
      "num_input_tokens_seen": 313920496,
      "step": 399
    },
    {
      "epoch": 0.042435815828559306,
      "grad_norm": 2.0779180191937257,
      "learning_rate": 4.999913642410152e-05,
      "loss": 2.6845,
      "num_input_tokens_seen": 314707264,
      "step": 400
    },
    {
      "epoch": 0.042541905368130704,
      "grad_norm": 2.144644297881668,
      "learning_rate": 4.999913063804806e-05,
      "loss": 2.3662,
      "num_input_tokens_seen": 315494032,
      "step": 401
    },
    {
      "epoch": 0.0426479949077021,
      "grad_norm": 2.320478062115425,
      "learning_rate": 4.9999124832676016e-05,
      "loss": 2.4547,
      "num_input_tokens_seen": 316280800,
      "step": 402
    },
    {
      "epoch": 0.0427540844472735,
      "grad_norm": 1.259568287029507,
      "learning_rate": 4.999911900798537e-05,
      "loss": 2.7565,
      "num_input_tokens_seen": 317067536,
      "step": 403
    },
    {
      "epoch": 0.0428601739868449,
      "grad_norm": 2.0193755472796595,
      "learning_rate": 4.999911316397615e-05,
      "loss": 2.4897,
      "num_input_tokens_seen": 317854416,
      "step": 404
    },
    {
      "epoch": 0.0429662635264163,
      "grad_norm": 1.2987164930379025,
      "learning_rate": 4.999910730064834e-05,
      "loss": 2.3549,
      "num_input_tokens_seen": 318641120,
      "step": 405
    },
    {
      "epoch": 0.043072353065987695,
      "grad_norm": 1.0726451838542592,
      "learning_rate": 4.999910141800195e-05,
      "loss": 2.4013,
      "num_input_tokens_seen": 319427968,
      "step": 406
    },
    {
      "epoch": 0.04317844260555909,
      "grad_norm": 1.2577613842068873,
      "learning_rate": 4.9999095516036995e-05,
      "loss": 2.6268,
      "num_input_tokens_seen": 320214672,
      "step": 407
    },
    {
      "epoch": 0.04328453214513049,
      "grad_norm": 2.2600704029489282,
      "learning_rate": 4.9999089594753464e-05,
      "loss": 2.5705,
      "num_input_tokens_seen": 321001408,
      "step": 408
    },
    {
      "epoch": 0.04339062168470189,
      "grad_norm": 1.7921505992170224,
      "learning_rate": 4.999908365415138e-05,
      "loss": 2.4771,
      "num_input_tokens_seen": 321788208,
      "step": 409
    },
    {
      "epoch": 0.04349671122427329,
      "grad_norm": 1.4431517442217285,
      "learning_rate": 4.9999077694230735e-05,
      "loss": 2.498,
      "num_input_tokens_seen": 322575008,
      "step": 410
    },
    {
      "epoch": 0.043602800763844686,
      "grad_norm": 3.0485260422390352,
      "learning_rate": 4.999907171499154e-05,
      "loss": 2.4998,
      "num_input_tokens_seen": 323361824,
      "step": 411
    },
    {
      "epoch": 0.043708890303416084,
      "grad_norm": 2.6465731595706377,
      "learning_rate": 4.999906571643379e-05,
      "loss": 2.5347,
      "num_input_tokens_seen": 324148592,
      "step": 412
    },
    {
      "epoch": 0.04381497984298748,
      "grad_norm": 2.4437863558552606,
      "learning_rate": 4.999905969855749e-05,
      "loss": 2.6493,
      "num_input_tokens_seen": 324935424,
      "step": 413
    },
    {
      "epoch": 0.04392106938255888,
      "grad_norm": 2.0640743413409153,
      "learning_rate": 4.999905366136266e-05,
      "loss": 2.4839,
      "num_input_tokens_seen": 325722144,
      "step": 414
    },
    {
      "epoch": 0.04402715892213028,
      "grad_norm": 3.636092655515361,
      "learning_rate": 4.999904760484929e-05,
      "loss": 2.5634,
      "num_input_tokens_seen": 326508992,
      "step": 415
    },
    {
      "epoch": 0.04413324846170168,
      "grad_norm": 1.8060651486787513,
      "learning_rate": 4.999904152901739e-05,
      "loss": 2.3741,
      "num_input_tokens_seen": 327295776,
      "step": 416
    },
    {
      "epoch": 0.044239338001273075,
      "grad_norm": 3.9142800189136335,
      "learning_rate": 4.999903543386697e-05,
      "loss": 2.516,
      "num_input_tokens_seen": 328082464,
      "step": 417
    },
    {
      "epoch": 0.04434542754084447,
      "grad_norm": 3.5713550660146662,
      "learning_rate": 4.999902931939802e-05,
      "loss": 2.496,
      "num_input_tokens_seen": 328869264,
      "step": 418
    },
    {
      "epoch": 0.04445151708041587,
      "grad_norm": 1.7666806060674782,
      "learning_rate": 4.999902318561056e-05,
      "loss": 2.7921,
      "num_input_tokens_seen": 329656000,
      "step": 419
    },
    {
      "epoch": 0.04455760661998727,
      "grad_norm": 1.4283859760242004,
      "learning_rate": 4.999901703250458e-05,
      "loss": 2.3842,
      "num_input_tokens_seen": 330442800,
      "step": 420
    },
    {
      "epoch": 0.04466369615955867,
      "grad_norm": 2.3149557398602876,
      "learning_rate": 4.99990108600801e-05,
      "loss": 2.5456,
      "num_input_tokens_seen": 331229520,
      "step": 421
    },
    {
      "epoch": 0.044769785699130066,
      "grad_norm": 1.5801190946391548,
      "learning_rate": 4.999900466833712e-05,
      "loss": 2.28,
      "num_input_tokens_seen": 332016336,
      "step": 422
    },
    {
      "epoch": 0.044875875238701464,
      "grad_norm": 2.8376408422278363,
      "learning_rate": 4.9998998457275644e-05,
      "loss": 2.444,
      "num_input_tokens_seen": 332803120,
      "step": 423
    },
    {
      "epoch": 0.04498196477827286,
      "grad_norm": 4.092636988182379,
      "learning_rate": 4.999899222689567e-05,
      "loss": 2.5782,
      "num_input_tokens_seen": 333589888,
      "step": 424
    },
    {
      "epoch": 0.04508805431784426,
      "grad_norm": 1.56591126488339,
      "learning_rate": 4.999898597719721e-05,
      "loss": 2.4748,
      "num_input_tokens_seen": 334376704,
      "step": 425
    },
    {
      "epoch": 0.04519414385741566,
      "grad_norm": 1.1875035742292015,
      "learning_rate": 4.999897970818027e-05,
      "loss": 2.3216,
      "num_input_tokens_seen": 335163584,
      "step": 426
    },
    {
      "epoch": 0.04530023339698706,
      "grad_norm": 2.2178682380606944,
      "learning_rate": 4.999897341984484e-05,
      "loss": 2.367,
      "num_input_tokens_seen": 335950320,
      "step": 427
    },
    {
      "epoch": 0.045406322936558455,
      "grad_norm": 1.737527791095714,
      "learning_rate": 4.9998967112190954e-05,
      "loss": 2.686,
      "num_input_tokens_seen": 336737040,
      "step": 428
    },
    {
      "epoch": 0.04551241247612985,
      "grad_norm": 2.77278007603354,
      "learning_rate": 4.999896078521859e-05,
      "loss": 2.669,
      "num_input_tokens_seen": 337523776,
      "step": 429
    },
    {
      "epoch": 0.04561850201570125,
      "grad_norm": 3.1469544858662393,
      "learning_rate": 4.999895443892776e-05,
      "loss": 2.6365,
      "num_input_tokens_seen": 338310512,
      "step": 430
    },
    {
      "epoch": 0.04572459155527265,
      "grad_norm": 1.4391909496115656,
      "learning_rate": 4.999894807331847e-05,
      "loss": 2.5061,
      "num_input_tokens_seen": 339097248,
      "step": 431
    },
    {
      "epoch": 0.04583068109484405,
      "grad_norm": 1.4521721145627555,
      "learning_rate": 4.999894168839074e-05,
      "loss": 2.3463,
      "num_input_tokens_seen": 339884048,
      "step": 432
    },
    {
      "epoch": 0.045936770634415446,
      "grad_norm": 1.9473509204614585,
      "learning_rate": 4.999893528414456e-05,
      "loss": 2.5867,
      "num_input_tokens_seen": 340670800,
      "step": 433
    },
    {
      "epoch": 0.046042860173986844,
      "grad_norm": 1.0218402935971125,
      "learning_rate": 4.999892886057992e-05,
      "loss": 2.6311,
      "num_input_tokens_seen": 341457536,
      "step": 434
    },
    {
      "epoch": 0.04614894971355824,
      "grad_norm": 2.4842473269650642,
      "learning_rate": 4.9998922417696856e-05,
      "loss": 2.5497,
      "num_input_tokens_seen": 342244272,
      "step": 435
    },
    {
      "epoch": 0.04625503925312964,
      "grad_norm": 1.3236487243985242,
      "learning_rate": 4.9998915955495355e-05,
      "loss": 2.5637,
      "num_input_tokens_seen": 343031120,
      "step": 436
    },
    {
      "epoch": 0.04636112879270104,
      "grad_norm": 2.8127830724465905,
      "learning_rate": 4.999890947397542e-05,
      "loss": 2.6051,
      "num_input_tokens_seen": 343817904,
      "step": 437
    },
    {
      "epoch": 0.046467218332272436,
      "grad_norm": 2.3004942036023355,
      "learning_rate": 4.999890297313706e-05,
      "loss": 2.5949,
      "num_input_tokens_seen": 344604688,
      "step": 438
    },
    {
      "epoch": 0.046573307871843835,
      "grad_norm": 2.1775635713540185,
      "learning_rate": 4.9998896452980293e-05,
      "loss": 2.5104,
      "num_input_tokens_seen": 345391472,
      "step": 439
    },
    {
      "epoch": 0.04667939741141523,
      "grad_norm": 1.9544709521464683,
      "learning_rate": 4.99988899135051e-05,
      "loss": 2.4391,
      "num_input_tokens_seen": 346178304,
      "step": 440
    },
    {
      "epoch": 0.04678548695098663,
      "grad_norm": 2.110038144403526,
      "learning_rate": 4.999888335471151e-05,
      "loss": 2.4945,
      "num_input_tokens_seen": 346965024,
      "step": 441
    },
    {
      "epoch": 0.04689157649055803,
      "grad_norm": 2.3441875686100087,
      "learning_rate": 4.999887677659951e-05,
      "loss": 2.6718,
      "num_input_tokens_seen": 347751760,
      "step": 442
    },
    {
      "epoch": 0.04699766603012943,
      "grad_norm": 1.2270262280237587,
      "learning_rate": 4.999887017916911e-05,
      "loss": 2.5277,
      "num_input_tokens_seen": 348538528,
      "step": 443
    },
    {
      "epoch": 0.047103755569700825,
      "grad_norm": 1.8540887298124291,
      "learning_rate": 4.9998863562420314e-05,
      "loss": 2.5313,
      "num_input_tokens_seen": 349325328,
      "step": 444
    },
    {
      "epoch": 0.047209845109272223,
      "grad_norm": 1.3434189842625628,
      "learning_rate": 4.999885692635314e-05,
      "loss": 2.3512,
      "num_input_tokens_seen": 350112112,
      "step": 445
    },
    {
      "epoch": 0.04731593464884362,
      "grad_norm": 1.5857474839601835,
      "learning_rate": 4.999885027096758e-05,
      "loss": 2.5581,
      "num_input_tokens_seen": 350898928,
      "step": 446
    },
    {
      "epoch": 0.04742202418841502,
      "grad_norm": 2.2878205203752544,
      "learning_rate": 4.9998843596263636e-05,
      "loss": 2.3801,
      "num_input_tokens_seen": 351685728,
      "step": 447
    },
    {
      "epoch": 0.04752811372798642,
      "grad_norm": 1.1273971649113521,
      "learning_rate": 4.999883690224132e-05,
      "loss": 2.5461,
      "num_input_tokens_seen": 352472576,
      "step": 448
    },
    {
      "epoch": 0.047634203267557816,
      "grad_norm": 2.605925836109736,
      "learning_rate": 4.999883018890064e-05,
      "loss": 2.5077,
      "num_input_tokens_seen": 353259328,
      "step": 449
    },
    {
      "epoch": 0.047740292807129214,
      "grad_norm": 1.8364350115763244,
      "learning_rate": 4.9998823456241594e-05,
      "loss": 2.5345,
      "num_input_tokens_seen": 354046064,
      "step": 450
    },
    {
      "epoch": 0.04784638234670061,
      "grad_norm": 1.747026105349264,
      "learning_rate": 4.999881670426419e-05,
      "loss": 2.6928,
      "num_input_tokens_seen": 354832784,
      "step": 451
    },
    {
      "epoch": 0.04795247188627201,
      "grad_norm": 1.7916690740249772,
      "learning_rate": 4.999880993296844e-05,
      "loss": 2.5704,
      "num_input_tokens_seen": 355619552,
      "step": 452
    },
    {
      "epoch": 0.04805856142584341,
      "grad_norm": 2.101035341938103,
      "learning_rate": 4.9998803142354344e-05,
      "loss": 2.4572,
      "num_input_tokens_seen": 356406304,
      "step": 453
    },
    {
      "epoch": 0.04816465096541481,
      "grad_norm": 1.4814778396984427,
      "learning_rate": 4.9998796332421904e-05,
      "loss": 2.8035,
      "num_input_tokens_seen": 357193072,
      "step": 454
    },
    {
      "epoch": 0.048270740504986205,
      "grad_norm": 3.0544277844592505,
      "learning_rate": 4.999878950317112e-05,
      "loss": 2.6083,
      "num_input_tokens_seen": 357979808,
      "step": 455
    },
    {
      "epoch": 0.0483768300445576,
      "grad_norm": 2.1196312973755282,
      "learning_rate": 4.9998782654602014e-05,
      "loss": 2.5093,
      "num_input_tokens_seen": 358766496,
      "step": 456
    },
    {
      "epoch": 0.048482919584129,
      "grad_norm": 1.9152260316713094,
      "learning_rate": 4.999877578671458e-05,
      "loss": 2.495,
      "num_input_tokens_seen": 359553296,
      "step": 457
    },
    {
      "epoch": 0.04858900912370041,
      "grad_norm": 1.4599649326780617,
      "learning_rate": 4.999876889950883e-05,
      "loss": 2.2835,
      "num_input_tokens_seen": 360340080,
      "step": 458
    },
    {
      "epoch": 0.048695098663271805,
      "grad_norm": 1.981440772846224,
      "learning_rate": 4.9998761992984754e-05,
      "loss": 2.6332,
      "num_input_tokens_seen": 361126832,
      "step": 459
    },
    {
      "epoch": 0.0488011882028432,
      "grad_norm": 1.5116735870010873,
      "learning_rate": 4.999875506714238e-05,
      "loss": 2.4998,
      "num_input_tokens_seen": 361913600,
      "step": 460
    },
    {
      "epoch": 0.0489072777424146,
      "grad_norm": 1.152980213105502,
      "learning_rate": 4.999874812198169e-05,
      "loss": 2.7075,
      "num_input_tokens_seen": 362700256,
      "step": 461
    },
    {
      "epoch": 0.049013367281986,
      "grad_norm": 1.8335833703838447,
      "learning_rate": 4.999874115750271e-05,
      "loss": 2.5038,
      "num_input_tokens_seen": 363487040,
      "step": 462
    },
    {
      "epoch": 0.0491194568215574,
      "grad_norm": 0.8489986911807091,
      "learning_rate": 4.999873417370543e-05,
      "loss": 2.4519,
      "num_input_tokens_seen": 364273840,
      "step": 463
    },
    {
      "epoch": 0.049225546361128796,
      "grad_norm": 2.2150023185400167,
      "learning_rate": 4.999872717058987e-05,
      "loss": 2.6671,
      "num_input_tokens_seen": 365060512,
      "step": 464
    },
    {
      "epoch": 0.049331635900700194,
      "grad_norm": 1.5819675024235007,
      "learning_rate": 4.999872014815602e-05,
      "loss": 2.6349,
      "num_input_tokens_seen": 365847312,
      "step": 465
    },
    {
      "epoch": 0.04943772544027159,
      "grad_norm": 1.1505456366107016,
      "learning_rate": 4.9998713106403894e-05,
      "loss": 2.4328,
      "num_input_tokens_seen": 366634128,
      "step": 466
    },
    {
      "epoch": 0.04954381497984299,
      "grad_norm": 1.9330336490551576,
      "learning_rate": 4.99987060453335e-05,
      "loss": 2.5016,
      "num_input_tokens_seen": 367420864,
      "step": 467
    },
    {
      "epoch": 0.04964990451941439,
      "grad_norm": 1.189401352431484,
      "learning_rate": 4.9998698964944834e-05,
      "loss": 2.4158,
      "num_input_tokens_seen": 368207632,
      "step": 468
    },
    {
      "epoch": 0.049755994058985786,
      "grad_norm": 2.069080168125125,
      "learning_rate": 4.999869186523791e-05,
      "loss": 2.6469,
      "num_input_tokens_seen": 368994416,
      "step": 469
    },
    {
      "epoch": 0.049862083598557184,
      "grad_norm": 1.8075582842517202,
      "learning_rate": 4.999868474621273e-05,
      "loss": 2.5702,
      "num_input_tokens_seen": 369781216,
      "step": 470
    },
    {
      "epoch": 0.04996817313812858,
      "grad_norm": 1.719281081965014,
      "learning_rate": 4.9998677607869295e-05,
      "loss": 2.7126,
      "num_input_tokens_seen": 370567920,
      "step": 471
    },
    {
      "epoch": 0.05007426267769998,
      "grad_norm": 0.97483861732714,
      "learning_rate": 4.999867045020762e-05,
      "loss": 2.279,
      "num_input_tokens_seen": 371354720,
      "step": 472
    },
    {
      "epoch": 0.05018035221727138,
      "grad_norm": 1.5657914294432795,
      "learning_rate": 4.999866327322771e-05,
      "loss": 2.6592,
      "num_input_tokens_seen": 372141392,
      "step": 473
    },
    {
      "epoch": 0.05028644175684278,
      "grad_norm": 1.0364530326758756,
      "learning_rate": 4.9998656076929564e-05,
      "loss": 2.6507,
      "num_input_tokens_seen": 372928112,
      "step": 474
    },
    {
      "epoch": 0.050392531296414175,
      "grad_norm": 1.5333273256280078,
      "learning_rate": 4.999864886131319e-05,
      "loss": 2.3398,
      "num_input_tokens_seen": 373714848,
      "step": 475
    },
    {
      "epoch": 0.05049862083598557,
      "grad_norm": 1.3140582589248018,
      "learning_rate": 4.9998641626378586e-05,
      "loss": 2.4715,
      "num_input_tokens_seen": 374501584,
      "step": 476
    },
    {
      "epoch": 0.05060471037555697,
      "grad_norm": 1.2653414242948595,
      "learning_rate": 4.999863437212578e-05,
      "loss": 2.5327,
      "num_input_tokens_seen": 375288320,
      "step": 477
    },
    {
      "epoch": 0.05071079991512837,
      "grad_norm": 1.3573715644246367,
      "learning_rate": 4.999862709855474e-05,
      "loss": 2.6513,
      "num_input_tokens_seen": 376075200,
      "step": 478
    },
    {
      "epoch": 0.05081688945469977,
      "grad_norm": 0.9666593740747914,
      "learning_rate": 4.9998619805665516e-05,
      "loss": 2.4413,
      "num_input_tokens_seen": 376862016,
      "step": 479
    },
    {
      "epoch": 0.050922978994271166,
      "grad_norm": 1.984717983498743,
      "learning_rate": 4.9998612493458084e-05,
      "loss": 2.4152,
      "num_input_tokens_seen": 377648896,
      "step": 480
    },
    {
      "epoch": 0.051029068533842564,
      "grad_norm": 1.3150490157329036,
      "learning_rate": 4.999860516193245e-05,
      "loss": 2.6619,
      "num_input_tokens_seen": 378435632,
      "step": 481
    },
    {
      "epoch": 0.05113515807341396,
      "grad_norm": 1.2377617365113738,
      "learning_rate": 4.999859781108864e-05,
      "loss": 2.4468,
      "num_input_tokens_seen": 379222432,
      "step": 482
    },
    {
      "epoch": 0.05124124761298536,
      "grad_norm": 1.093707456888766,
      "learning_rate": 4.999859044092665e-05,
      "loss": 2.4541,
      "num_input_tokens_seen": 380009168,
      "step": 483
    },
    {
      "epoch": 0.05134733715255676,
      "grad_norm": 1.3472411256267773,
      "learning_rate": 4.999858305144648e-05,
      "loss": 2.397,
      "num_input_tokens_seen": 380795920,
      "step": 484
    },
    {
      "epoch": 0.05145342669212816,
      "grad_norm": 2.1086082736268614,
      "learning_rate": 4.999857564264813e-05,
      "loss": 2.4457,
      "num_input_tokens_seen": 381582704,
      "step": 485
    },
    {
      "epoch": 0.051559516231699555,
      "grad_norm": 0.9383690026315614,
      "learning_rate": 4.999856821453162e-05,
      "loss": 2.5427,
      "num_input_tokens_seen": 382369504,
      "step": 486
    },
    {
      "epoch": 0.05166560577127095,
      "grad_norm": 2.9201220794152944,
      "learning_rate": 4.999856076709695e-05,
      "loss": 2.4088,
      "num_input_tokens_seen": 383156256,
      "step": 487
    },
    {
      "epoch": 0.05177169531084235,
      "grad_norm": 2.2380091219824694,
      "learning_rate": 4.999855330034412e-05,
      "loss": 2.7347,
      "num_input_tokens_seen": 383942928,
      "step": 488
    },
    {
      "epoch": 0.05187778485041375,
      "grad_norm": 3.3279861531449004,
      "learning_rate": 4.9998545814273144e-05,
      "loss": 2.4283,
      "num_input_tokens_seen": 384729792,
      "step": 489
    },
    {
      "epoch": 0.05198387438998515,
      "grad_norm": 3.071878419757693,
      "learning_rate": 4.999853830888403e-05,
      "loss": 2.415,
      "num_input_tokens_seen": 385516528,
      "step": 490
    },
    {
      "epoch": 0.052089963929556546,
      "grad_norm": 2.6873881962746307,
      "learning_rate": 4.9998530784176775e-05,
      "loss": 2.6135,
      "num_input_tokens_seen": 386303248,
      "step": 491
    },
    {
      "epoch": 0.052196053469127944,
      "grad_norm": 1.9178843144390187,
      "learning_rate": 4.999852324015139e-05,
      "loss": 2.4675,
      "num_input_tokens_seen": 387090064,
      "step": 492
    },
    {
      "epoch": 0.05230214300869934,
      "grad_norm": 2.032757549864484,
      "learning_rate": 4.999851567680788e-05,
      "loss": 2.5024,
      "num_input_tokens_seen": 387876848,
      "step": 493
    },
    {
      "epoch": 0.05240823254827074,
      "grad_norm": 1.5008054321152247,
      "learning_rate": 4.999850809414625e-05,
      "loss": 2.4599,
      "num_input_tokens_seen": 388663600,
      "step": 494
    },
    {
      "epoch": 0.05251432208784214,
      "grad_norm": 2.25769996424759,
      "learning_rate": 4.9998500492166514e-05,
      "loss": 2.7241,
      "num_input_tokens_seen": 389450304,
      "step": 495
    },
    {
      "epoch": 0.05262041162741354,
      "grad_norm": 1.2539953611296975,
      "learning_rate": 4.999849287086866e-05,
      "loss": 2.4914,
      "num_input_tokens_seen": 390237040,
      "step": 496
    },
    {
      "epoch": 0.052726501166984935,
      "grad_norm": 2.0258441524943733,
      "learning_rate": 4.9998485230252705e-05,
      "loss": 2.5593,
      "num_input_tokens_seen": 391023824,
      "step": 497
    },
    {
      "epoch": 0.05283259070655633,
      "grad_norm": 1.2520807488470103,
      "learning_rate": 4.999847757031866e-05,
      "loss": 2.4789,
      "num_input_tokens_seen": 391810608,
      "step": 498
    },
    {
      "epoch": 0.05293868024612773,
      "grad_norm": 1.9464293762432983,
      "learning_rate": 4.9998469891066525e-05,
      "loss": 2.7005,
      "num_input_tokens_seen": 392597344,
      "step": 499
    },
    {
      "epoch": 0.05304476978569913,
      "grad_norm": 1.2333659309671257,
      "learning_rate": 4.9998462192496296e-05,
      "loss": 2.599,
      "num_input_tokens_seen": 393384096,
      "step": 500
    },
    {
      "epoch": 0.05315085932527053,
      "grad_norm": 1.3155214300292781,
      "learning_rate": 4.9998454474608e-05,
      "loss": 2.5119,
      "num_input_tokens_seen": 394170816,
      "step": 501
    },
    {
      "epoch": 0.053256948864841926,
      "grad_norm": 1.8285340989350618,
      "learning_rate": 4.999844673740163e-05,
      "loss": 2.4712,
      "num_input_tokens_seen": 394957488,
      "step": 502
    },
    {
      "epoch": 0.053363038404413324,
      "grad_norm": 1.1206718003912355,
      "learning_rate": 4.999843898087718e-05,
      "loss": 2.6606,
      "num_input_tokens_seen": 395744160,
      "step": 503
    },
    {
      "epoch": 0.05346912794398472,
      "grad_norm": 1.7105896523503337,
      "learning_rate": 4.999843120503469e-05,
      "loss": 2.6025,
      "num_input_tokens_seen": 396531088,
      "step": 504
    },
    {
      "epoch": 0.05357521748355612,
      "grad_norm": 1.2054930161788695,
      "learning_rate": 4.9998423409874136e-05,
      "loss": 2.4815,
      "num_input_tokens_seen": 397317840,
      "step": 505
    },
    {
      "epoch": 0.05368130702312752,
      "grad_norm": 1.7610984429719496,
      "learning_rate": 4.999841559539553e-05,
      "loss": 2.494,
      "num_input_tokens_seen": 398104560,
      "step": 506
    },
    {
      "epoch": 0.053787396562698916,
      "grad_norm": 1.3491494752513833,
      "learning_rate": 4.9998407761598885e-05,
      "loss": 2.5455,
      "num_input_tokens_seen": 398891376,
      "step": 507
    },
    {
      "epoch": 0.053893486102270315,
      "grad_norm": 1.2249485086136984,
      "learning_rate": 4.9998399908484215e-05,
      "loss": 2.3939,
      "num_input_tokens_seen": 399678176,
      "step": 508
    },
    {
      "epoch": 0.05399957564184171,
      "grad_norm": 2.134166905816564,
      "learning_rate": 4.99983920360515e-05,
      "loss": 2.473,
      "num_input_tokens_seen": 400464944,
      "step": 509
    },
    {
      "epoch": 0.05410566518141311,
      "grad_norm": 1.606453838472205,
      "learning_rate": 4.999838414430077e-05,
      "loss": 2.4627,
      "num_input_tokens_seen": 401251728,
      "step": 510
    },
    {
      "epoch": 0.05421175472098451,
      "grad_norm": 2.3877429987340184,
      "learning_rate": 4.999837623323202e-05,
      "loss": 2.5187,
      "num_input_tokens_seen": 402038512,
      "step": 511
    },
    {
      "epoch": 0.05431784426055591,
      "grad_norm": 2.028408711138951,
      "learning_rate": 4.999836830284526e-05,
      "loss": 2.4308,
      "num_input_tokens_seen": 402825296,
      "step": 512
    },
    {
      "epoch": 0.054423933800127305,
      "grad_norm": 2.307749726058009,
      "learning_rate": 4.9998360353140487e-05,
      "loss": 2.5008,
      "num_input_tokens_seen": 403612064,
      "step": 513
    },
    {
      "epoch": 0.054530023339698704,
      "grad_norm": 1.7002880735895087,
      "learning_rate": 4.999835238411772e-05,
      "loss": 2.448,
      "num_input_tokens_seen": 404398848,
      "step": 514
    },
    {
      "epoch": 0.0546361128792701,
      "grad_norm": 1.7279447120228004,
      "learning_rate": 4.9998344395776964e-05,
      "loss": 2.3087,
      "num_input_tokens_seen": 405185600,
      "step": 515
    },
    {
      "epoch": 0.0547422024188415,
      "grad_norm": 1.2879955762079691,
      "learning_rate": 4.999833638811822e-05,
      "loss": 2.4035,
      "num_input_tokens_seen": 405972416,
      "step": 516
    },
    {
      "epoch": 0.0548482919584129,
      "grad_norm": 2.1603173678110825,
      "learning_rate": 4.9998328361141484e-05,
      "loss": 2.5816,
      "num_input_tokens_seen": 406759056,
      "step": 517
    },
    {
      "epoch": 0.054954381497984296,
      "grad_norm": 1.6859551174468321,
      "learning_rate": 4.999832031484678e-05,
      "loss": 2.5867,
      "num_input_tokens_seen": 407545824,
      "step": 518
    },
    {
      "epoch": 0.055060471037555694,
      "grad_norm": 1.9594479266395863,
      "learning_rate": 4.999831224923412e-05,
      "loss": 2.4312,
      "num_input_tokens_seen": 408332560,
      "step": 519
    },
    {
      "epoch": 0.05516656057712709,
      "grad_norm": 1.4939567807371539,
      "learning_rate": 4.9998304164303476e-05,
      "loss": 2.324,
      "num_input_tokens_seen": 409119392,
      "step": 520
    },
    {
      "epoch": 0.05527265011669849,
      "grad_norm": 1.413457097074271,
      "learning_rate": 4.999829606005488e-05,
      "loss": 2.5532,
      "num_input_tokens_seen": 409906176,
      "step": 521
    },
    {
      "epoch": 0.05537873965626989,
      "grad_norm": 0.93307600278211,
      "learning_rate": 4.9998287936488344e-05,
      "loss": 2.4949,
      "num_input_tokens_seen": 410692960,
      "step": 522
    },
    {
      "epoch": 0.05548482919584129,
      "grad_norm": 1.228276441437365,
      "learning_rate": 4.9998279793603865e-05,
      "loss": 2.3901,
      "num_input_tokens_seen": 411479696,
      "step": 523
    },
    {
      "epoch": 0.055590918735412685,
      "grad_norm": 1.1605312058990165,
      "learning_rate": 4.9998271631401445e-05,
      "loss": 2.3877,
      "num_input_tokens_seen": 412266528,
      "step": 524
    },
    {
      "epoch": 0.05569700827498408,
      "grad_norm": 1.4022465728784748,
      "learning_rate": 4.9998263449881097e-05,
      "loss": 2.3417,
      "num_input_tokens_seen": 413053248,
      "step": 525
    },
    {
      "epoch": 0.05580309781455548,
      "grad_norm": 0.8664075358266843,
      "learning_rate": 4.999825524904282e-05,
      "loss": 2.5898,
      "num_input_tokens_seen": 413840016,
      "step": 526
    },
    {
      "epoch": 0.05590918735412688,
      "grad_norm": 1.0524005709843187,
      "learning_rate": 4.999824702888662e-05,
      "loss": 2.5109,
      "num_input_tokens_seen": 414626832,
      "step": 527
    },
    {
      "epoch": 0.056015276893698285,
      "grad_norm": 0.8334339945049779,
      "learning_rate": 4.9998238789412524e-05,
      "loss": 2.5564,
      "num_input_tokens_seen": 415413488,
      "step": 528
    },
    {
      "epoch": 0.05612136643326968,
      "grad_norm": 0.9476369993155636,
      "learning_rate": 4.999823053062051e-05,
      "loss": 2.466,
      "num_input_tokens_seen": 416200208,
      "step": 529
    },
    {
      "epoch": 0.05622745597284108,
      "grad_norm": 1.2561174570647164,
      "learning_rate": 4.9998222252510597e-05,
      "loss": 2.6223,
      "num_input_tokens_seen": 416986944,
      "step": 530
    },
    {
      "epoch": 0.05633354551241248,
      "grad_norm": 1.8502229271657809,
      "learning_rate": 4.9998213955082795e-05,
      "loss": 2.4705,
      "num_input_tokens_seen": 417773744,
      "step": 531
    },
    {
      "epoch": 0.05643963505198388,
      "grad_norm": 1.0625116772958365,
      "learning_rate": 4.9998205638337106e-05,
      "loss": 2.206,
      "num_input_tokens_seen": 418560640,
      "step": 532
    },
    {
      "epoch": 0.056545724591555276,
      "grad_norm": 1.097833959906737,
      "learning_rate": 4.999819730227354e-05,
      "loss": 2.5275,
      "num_input_tokens_seen": 419347456,
      "step": 533
    },
    {
      "epoch": 0.056651814131126674,
      "grad_norm": 1.4328175793994757,
      "learning_rate": 4.99981889468921e-05,
      "loss": 2.6669,
      "num_input_tokens_seen": 420134256,
      "step": 534
    },
    {
      "epoch": 0.05675790367069807,
      "grad_norm": 0.9416541363559813,
      "learning_rate": 4.999818057219279e-05,
      "loss": 2.37,
      "num_input_tokens_seen": 420921008,
      "step": 535
    },
    {
      "epoch": 0.05686399321026947,
      "grad_norm": 2.231726604163305,
      "learning_rate": 4.999817217817562e-05,
      "loss": 2.4346,
      "num_input_tokens_seen": 421707776,
      "step": 536
    },
    {
      "epoch": 0.05697008274984087,
      "grad_norm": 1.0106326459826918,
      "learning_rate": 4.99981637648406e-05,
      "loss": 2.7234,
      "num_input_tokens_seen": 422494496,
      "step": 537
    },
    {
      "epoch": 0.057076172289412266,
      "grad_norm": 2.5854686904252047,
      "learning_rate": 4.999815533218772e-05,
      "loss": 2.5019,
      "num_input_tokens_seen": 423281200,
      "step": 538
    },
    {
      "epoch": 0.057182261828983665,
      "grad_norm": 1.5186750257381594,
      "learning_rate": 4.999814688021701e-05,
      "loss": 2.5996,
      "num_input_tokens_seen": 424067920,
      "step": 539
    },
    {
      "epoch": 0.05728835136855506,
      "grad_norm": 2.6529404950323707,
      "learning_rate": 4.999813840892847e-05,
      "loss": 2.4045,
      "num_input_tokens_seen": 424854688,
      "step": 540
    },
    {
      "epoch": 0.05739444090812646,
      "grad_norm": 2.0538539733272416,
      "learning_rate": 4.999812991832209e-05,
      "loss": 2.5549,
      "num_input_tokens_seen": 425641440,
      "step": 541
    },
    {
      "epoch": 0.05750053044769786,
      "grad_norm": 2.2929717062269046,
      "learning_rate": 4.99981214083979e-05,
      "loss": 2.3507,
      "num_input_tokens_seen": 426428224,
      "step": 542
    },
    {
      "epoch": 0.05760661998726926,
      "grad_norm": 1.7697501449233144,
      "learning_rate": 4.999811287915589e-05,
      "loss": 2.594,
      "num_input_tokens_seen": 427214896,
      "step": 543
    },
    {
      "epoch": 0.057712709526840655,
      "grad_norm": 1.697330234297014,
      "learning_rate": 4.9998104330596074e-05,
      "loss": 2.5393,
      "num_input_tokens_seen": 428001648,
      "step": 544
    },
    {
      "epoch": 0.057818799066412054,
      "grad_norm": 1.3948761921941217,
      "learning_rate": 4.999809576271845e-05,
      "loss": 2.5402,
      "num_input_tokens_seen": 428788384,
      "step": 545
    },
    {
      "epoch": 0.05792488860598345,
      "grad_norm": 1.697582132295313,
      "learning_rate": 4.999808717552303e-05,
      "loss": 2.507,
      "num_input_tokens_seen": 429575168,
      "step": 546
    },
    {
      "epoch": 0.05803097814555485,
      "grad_norm": 1.3601813334425064,
      "learning_rate": 4.999807856900983e-05,
      "loss": 2.4147,
      "num_input_tokens_seen": 430361904,
      "step": 547
    },
    {
      "epoch": 0.05813706768512625,
      "grad_norm": 1.4610570561558933,
      "learning_rate": 4.999806994317885e-05,
      "loss": 2.5002,
      "num_input_tokens_seen": 431148560,
      "step": 548
    },
    {
      "epoch": 0.058243157224697646,
      "grad_norm": 1.3978610025292055,
      "learning_rate": 4.9998061298030086e-05,
      "loss": 2.576,
      "num_input_tokens_seen": 431935328,
      "step": 549
    },
    {
      "epoch": 0.058349246764269044,
      "grad_norm": 1.4838507480150536,
      "learning_rate": 4.999805263356356e-05,
      "loss": 2.561,
      "num_input_tokens_seen": 432722112,
      "step": 550
    },
    {
      "epoch": 0.05845533630384044,
      "grad_norm": 1.6516944373861178,
      "learning_rate": 4.999804394977927e-05,
      "loss": 2.5281,
      "num_input_tokens_seen": 433508880,
      "step": 551
    },
    {
      "epoch": 0.05856142584341184,
      "grad_norm": 1.1597138350509262,
      "learning_rate": 4.9998035246677225e-05,
      "loss": 2.3915,
      "num_input_tokens_seen": 434295696,
      "step": 552
    },
    {
      "epoch": 0.05866751538298324,
      "grad_norm": 1.46122258690376,
      "learning_rate": 4.999802652425744e-05,
      "loss": 2.5813,
      "num_input_tokens_seen": 435082416,
      "step": 553
    },
    {
      "epoch": 0.05877360492255464,
      "grad_norm": 1.079515461475192,
      "learning_rate": 4.99980177825199e-05,
      "loss": 2.582,
      "num_input_tokens_seen": 435869104,
      "step": 554
    },
    {
      "epoch": 0.058879694462126035,
      "grad_norm": 1.304601041044764,
      "learning_rate": 4.999800902146463e-05,
      "loss": 2.4684,
      "num_input_tokens_seen": 436655760,
      "step": 555
    },
    {
      "epoch": 0.05898578400169743,
      "grad_norm": 1.0659408463263864,
      "learning_rate": 4.9998000241091636e-05,
      "loss": 2.496,
      "num_input_tokens_seen": 437442608,
      "step": 556
    },
    {
      "epoch": 0.05909187354126883,
      "grad_norm": 1.231270499930835,
      "learning_rate": 4.999799144140092e-05,
      "loss": 2.6775,
      "num_input_tokens_seen": 438229344,
      "step": 557
    },
    {
      "epoch": 0.05919796308084023,
      "grad_norm": 0.8584456682772283,
      "learning_rate": 4.999798262239249e-05,
      "loss": 2.232,
      "num_input_tokens_seen": 439016128,
      "step": 558
    },
    {
      "epoch": 0.05930405262041163,
      "grad_norm": 1.592273351476954,
      "learning_rate": 4.999797378406635e-05,
      "loss": 2.431,
      "num_input_tokens_seen": 439802848,
      "step": 559
    },
    {
      "epoch": 0.059410142159983026,
      "grad_norm": 0.9920519845616799,
      "learning_rate": 4.9997964926422506e-05,
      "loss": 2.4812,
      "num_input_tokens_seen": 440589568,
      "step": 560
    },
    {
      "epoch": 0.059516231699554424,
      "grad_norm": 1.5457594704861028,
      "learning_rate": 4.9997956049460975e-05,
      "loss": 2.4529,
      "num_input_tokens_seen": 441376320,
      "step": 561
    },
    {
      "epoch": 0.05962232123912582,
      "grad_norm": 1.2760108839070716,
      "learning_rate": 4.9997947153181754e-05,
      "loss": 2.4925,
      "num_input_tokens_seen": 442162992,
      "step": 562
    },
    {
      "epoch": 0.05972841077869722,
      "grad_norm": 1.4834949557706458,
      "learning_rate": 4.999793823758485e-05,
      "loss": 2.5246,
      "num_input_tokens_seen": 442949728,
      "step": 563
    },
    {
      "epoch": 0.05983450031826862,
      "grad_norm": 1.7678683011131415,
      "learning_rate": 4.999792930267027e-05,
      "loss": 2.5825,
      "num_input_tokens_seen": 443736512,
      "step": 564
    },
    {
      "epoch": 0.05994058985784002,
      "grad_norm": 1.1620540930139347,
      "learning_rate": 4.999792034843804e-05,
      "loss": 2.569,
      "num_input_tokens_seen": 444523232,
      "step": 565
    },
    {
      "epoch": 0.060046679397411415,
      "grad_norm": 1.167030545725195,
      "learning_rate": 4.999791137488814e-05,
      "loss": 2.3972,
      "num_input_tokens_seen": 445309984,
      "step": 566
    },
    {
      "epoch": 0.06015276893698281,
      "grad_norm": 1.0407721043425262,
      "learning_rate": 4.999790238202059e-05,
      "loss": 2.4147,
      "num_input_tokens_seen": 446096752,
      "step": 567
    },
    {
      "epoch": 0.06025885847655421,
      "grad_norm": 1.096802797671061,
      "learning_rate": 4.999789336983539e-05,
      "loss": 2.7016,
      "num_input_tokens_seen": 446883520,
      "step": 568
    },
    {
      "epoch": 0.06036494801612561,
      "grad_norm": 1.0349724703810235,
      "learning_rate": 4.999788433833256e-05,
      "loss": 2.5131,
      "num_input_tokens_seen": 447670320,
      "step": 569
    },
    {
      "epoch": 0.06047103755569701,
      "grad_norm": 2.321251478602528,
      "learning_rate": 4.999787528751209e-05,
      "loss": 2.2939,
      "num_input_tokens_seen": 448457152,
      "step": 570
    },
    {
      "epoch": 0.060577127095268406,
      "grad_norm": 1.5769403448296944,
      "learning_rate": 4.9997866217373996e-05,
      "loss": 2.4251,
      "num_input_tokens_seen": 449243952,
      "step": 571
    },
    {
      "epoch": 0.060683216634839804,
      "grad_norm": 2.6881549439057837,
      "learning_rate": 4.9997857127918286e-05,
      "loss": 2.449,
      "num_input_tokens_seen": 450030720,
      "step": 572
    },
    {
      "epoch": 0.0607893061744112,
      "grad_norm": 1.800871972382737,
      "learning_rate": 4.9997848019144966e-05,
      "loss": 2.3361,
      "num_input_tokens_seen": 450817472,
      "step": 573
    },
    {
      "epoch": 0.0608953957139826,
      "grad_norm": 2.5466490889460403,
      "learning_rate": 4.999783889105404e-05,
      "loss": 2.521,
      "num_input_tokens_seen": 451604208,
      "step": 574
    },
    {
      "epoch": 0.061001485253554,
      "grad_norm": 1.8061130063264559,
      "learning_rate": 4.999782974364552e-05,
      "loss": 2.5626,
      "num_input_tokens_seen": 452390992,
      "step": 575
    },
    {
      "epoch": 0.061107574793125397,
      "grad_norm": 2.9307401184177353,
      "learning_rate": 4.999782057691941e-05,
      "loss": 2.4368,
      "num_input_tokens_seen": 453177840,
      "step": 576
    },
    {
      "epoch": 0.061213664332696795,
      "grad_norm": 2.47787422637046,
      "learning_rate": 4.999781139087572e-05,
      "loss": 2.4736,
      "num_input_tokens_seen": 453964624,
      "step": 577
    },
    {
      "epoch": 0.06131975387226819,
      "grad_norm": 2.1945653995587975,
      "learning_rate": 4.9997802185514456e-05,
      "loss": 2.6033,
      "num_input_tokens_seen": 454751360,
      "step": 578
    },
    {
      "epoch": 0.06142584341183959,
      "grad_norm": 2.2264651642154827,
      "learning_rate": 4.999779296083562e-05,
      "loss": 2.7196,
      "num_input_tokens_seen": 455538048,
      "step": 579
    },
    {
      "epoch": 0.06153193295141099,
      "grad_norm": 1.54548700898634,
      "learning_rate": 4.999778371683922e-05,
      "loss": 2.418,
      "num_input_tokens_seen": 456324800,
      "step": 580
    },
    {
      "epoch": 0.06163802249098239,
      "grad_norm": 1.7095083618991378,
      "learning_rate": 4.999777445352527e-05,
      "loss": 2.5144,
      "num_input_tokens_seen": 457111552,
      "step": 581
    },
    {
      "epoch": 0.061744112030553785,
      "grad_norm": 1.4158014094549032,
      "learning_rate": 4.999776517089378e-05,
      "loss": 2.4463,
      "num_input_tokens_seen": 457898416,
      "step": 582
    },
    {
      "epoch": 0.061850201570125184,
      "grad_norm": 1.8303114963408202,
      "learning_rate": 4.999775586894474e-05,
      "loss": 2.6463,
      "num_input_tokens_seen": 458685088,
      "step": 583
    },
    {
      "epoch": 0.06195629110969658,
      "grad_norm": 0.8577307442269742,
      "learning_rate": 4.999774654767817e-05,
      "loss": 2.4036,
      "num_input_tokens_seen": 459471808,
      "step": 584
    },
    {
      "epoch": 0.06206238064926798,
      "grad_norm": 1.8165783973193368,
      "learning_rate": 4.999773720709408e-05,
      "loss": 2.3912,
      "num_input_tokens_seen": 460258576,
      "step": 585
    },
    {
      "epoch": 0.06216847018883938,
      "grad_norm": 1.0948219954284264,
      "learning_rate": 4.999772784719247e-05,
      "loss": 2.7659,
      "num_input_tokens_seen": 461045280,
      "step": 586
    },
    {
      "epoch": 0.062274559728410776,
      "grad_norm": 1.3224399176350834,
      "learning_rate": 4.999771846797335e-05,
      "loss": 2.5086,
      "num_input_tokens_seen": 461832000,
      "step": 587
    },
    {
      "epoch": 0.062380649267982174,
      "grad_norm": 1.5931939765213554,
      "learning_rate": 4.999770906943673e-05,
      "loss": 2.6693,
      "num_input_tokens_seen": 462618752,
      "step": 588
    },
    {
      "epoch": 0.06248673880755357,
      "grad_norm": 1.2929041739731617,
      "learning_rate": 4.999769965158261e-05,
      "loss": 2.6315,
      "num_input_tokens_seen": 463405440,
      "step": 589
    },
    {
      "epoch": 0.06259282834712497,
      "grad_norm": 1.136198695565467,
      "learning_rate": 4.9997690214411e-05,
      "loss": 2.574,
      "num_input_tokens_seen": 464192192,
      "step": 590
    },
    {
      "epoch": 0.06269891788669638,
      "grad_norm": 0.8788081981785734,
      "learning_rate": 4.9997680757921906e-05,
      "loss": 2.6197,
      "num_input_tokens_seen": 464978944,
      "step": 591
    },
    {
      "epoch": 0.06280500742626777,
      "grad_norm": 1.6073884066852968,
      "learning_rate": 4.999767128211534e-05,
      "loss": 2.6112,
      "num_input_tokens_seen": 465765680,
      "step": 592
    },
    {
      "epoch": 0.06291109696583917,
      "grad_norm": 1.137499472211265,
      "learning_rate": 4.9997661786991306e-05,
      "loss": 2.7377,
      "num_input_tokens_seen": 466552400,
      "step": 593
    },
    {
      "epoch": 0.06301718650541056,
      "grad_norm": 1.6315018384595628,
      "learning_rate": 4.999765227254981e-05,
      "loss": 2.597,
      "num_input_tokens_seen": 467339200,
      "step": 594
    },
    {
      "epoch": 0.06312327604498197,
      "grad_norm": 0.8353626381191215,
      "learning_rate": 4.999764273879087e-05,
      "loss": 2.3339,
      "num_input_tokens_seen": 468126032,
      "step": 595
    },
    {
      "epoch": 0.06322936558455336,
      "grad_norm": 0.8460590767245185,
      "learning_rate": 4.999763318571448e-05,
      "loss": 2.433,
      "num_input_tokens_seen": 468912736,
      "step": 596
    },
    {
      "epoch": 0.06333545512412476,
      "grad_norm": 0.962695373656052,
      "learning_rate": 4.999762361332065e-05,
      "loss": 2.4713,
      "num_input_tokens_seen": 469699536,
      "step": 597
    },
    {
      "epoch": 0.06344154466369616,
      "grad_norm": 1.6394520980121081,
      "learning_rate": 4.99976140216094e-05,
      "loss": 2.452,
      "num_input_tokens_seen": 470486320,
      "step": 598
    },
    {
      "epoch": 0.06354763420326756,
      "grad_norm": 1.2426595764181005,
      "learning_rate": 4.9997604410580723e-05,
      "loss": 2.6101,
      "num_input_tokens_seen": 471273152,
      "step": 599
    },
    {
      "epoch": 0.06365372374283895,
      "grad_norm": 1.7244445360081226,
      "learning_rate": 4.999759478023462e-05,
      "loss": 2.4786,
      "num_input_tokens_seen": 472059968,
      "step": 600
    },
    {
      "epoch": 0.06375981328241036,
      "grad_norm": 1.0365074746011462,
      "learning_rate": 4.999758513057112e-05,
      "loss": 2.5874,
      "num_input_tokens_seen": 472846720,
      "step": 601
    },
    {
      "epoch": 0.06386590282198175,
      "grad_norm": 1.0046900747504128,
      "learning_rate": 4.999757546159022e-05,
      "loss": 2.166,
      "num_input_tokens_seen": 473633536,
      "step": 602
    },
    {
      "epoch": 0.06397199236155315,
      "grad_norm": 1.8740410408641501,
      "learning_rate": 4.999756577329193e-05,
      "loss": 2.387,
      "num_input_tokens_seen": 474420304,
      "step": 603
    },
    {
      "epoch": 0.06407808190112455,
      "grad_norm": 1.120127338416643,
      "learning_rate": 4.999755606567624e-05,
      "loss": 2.4345,
      "num_input_tokens_seen": 475207008,
      "step": 604
    },
    {
      "epoch": 0.06418417144069595,
      "grad_norm": 1.8197629016527497,
      "learning_rate": 4.999754633874318e-05,
      "loss": 2.5629,
      "num_input_tokens_seen": 475993760,
      "step": 605
    },
    {
      "epoch": 0.06429026098026734,
      "grad_norm": 1.0395839851462152,
      "learning_rate": 4.999753659249275e-05,
      "loss": 2.5083,
      "num_input_tokens_seen": 476780496,
      "step": 606
    },
    {
      "epoch": 0.06439635051983875,
      "grad_norm": 1.44375334072955,
      "learning_rate": 4.999752682692497e-05,
      "loss": 2.3174,
      "num_input_tokens_seen": 477567200,
      "step": 607
    },
    {
      "epoch": 0.06450244005941014,
      "grad_norm": 1.3733795618220719,
      "learning_rate": 4.999751704203982e-05,
      "loss": 2.5722,
      "num_input_tokens_seen": 478354032,
      "step": 608
    },
    {
      "epoch": 0.06460852959898154,
      "grad_norm": 2.0384683261076453,
      "learning_rate": 4.999750723783733e-05,
      "loss": 2.4927,
      "num_input_tokens_seen": 479140800,
      "step": 609
    },
    {
      "epoch": 0.06471461913855293,
      "grad_norm": 1.7827856117277459,
      "learning_rate": 4.9997497414317495e-05,
      "loss": 2.5861,
      "num_input_tokens_seen": 479927472,
      "step": 610
    },
    {
      "epoch": 0.06482070867812434,
      "grad_norm": 1.5629809372123842,
      "learning_rate": 4.999748757148033e-05,
      "loss": 2.4489,
      "num_input_tokens_seen": 480714224,
      "step": 611
    },
    {
      "epoch": 0.06492679821769573,
      "grad_norm": 2.145411319399185,
      "learning_rate": 4.9997477709325835e-05,
      "loss": 2.5018,
      "num_input_tokens_seen": 481501024,
      "step": 612
    },
    {
      "epoch": 0.06503288775726714,
      "grad_norm": 1.354323605796275,
      "learning_rate": 4.999746782785403e-05,
      "loss": 2.4786,
      "num_input_tokens_seen": 482287728,
      "step": 613
    },
    {
      "epoch": 0.06513897729683853,
      "grad_norm": 2.1175043419449824,
      "learning_rate": 4.999745792706491e-05,
      "loss": 2.4051,
      "num_input_tokens_seen": 483074544,
      "step": 614
    },
    {
      "epoch": 0.06524506683640993,
      "grad_norm": 1.5605845176365958,
      "learning_rate": 4.999744800695848e-05,
      "loss": 2.4405,
      "num_input_tokens_seen": 483861424,
      "step": 615
    },
    {
      "epoch": 0.06535115637598132,
      "grad_norm": 2.000845219261247,
      "learning_rate": 4.999743806753477e-05,
      "loss": 2.4504,
      "num_input_tokens_seen": 484648144,
      "step": 616
    },
    {
      "epoch": 0.06545724591555273,
      "grad_norm": 1.7105128280369868,
      "learning_rate": 4.9997428108793766e-05,
      "loss": 2.4374,
      "num_input_tokens_seen": 485434864,
      "step": 617
    },
    {
      "epoch": 0.06556333545512412,
      "grad_norm": 1.0566015728000149,
      "learning_rate": 4.999741813073548e-05,
      "loss": 2.3719,
      "num_input_tokens_seen": 486221616,
      "step": 618
    },
    {
      "epoch": 0.06566942499469552,
      "grad_norm": 2.5118452832158193,
      "learning_rate": 4.9997408133359935e-05,
      "loss": 2.4243,
      "num_input_tokens_seen": 487008400,
      "step": 619
    },
    {
      "epoch": 0.06577551453426692,
      "grad_norm": 1.4770033231202242,
      "learning_rate": 4.999739811666712e-05,
      "loss": 2.2958,
      "num_input_tokens_seen": 487795232,
      "step": 620
    },
    {
      "epoch": 0.06588160407383832,
      "grad_norm": 3.5827575148387303,
      "learning_rate": 4.999738808065705e-05,
      "loss": 2.5967,
      "num_input_tokens_seen": 488581888,
      "step": 621
    },
    {
      "epoch": 0.06598769361340971,
      "grad_norm": 2.6567060681610064,
      "learning_rate": 4.999737802532973e-05,
      "loss": 2.6379,
      "num_input_tokens_seen": 489368768,
      "step": 622
    },
    {
      "epoch": 0.06609378315298112,
      "grad_norm": 2.664368815084126,
      "learning_rate": 4.999736795068517e-05,
      "loss": 2.6222,
      "num_input_tokens_seen": 490155536,
      "step": 623
    },
    {
      "epoch": 0.06619987269255251,
      "grad_norm": 1.9966021732853942,
      "learning_rate": 4.999735785672337e-05,
      "loss": 2.417,
      "num_input_tokens_seen": 490942224,
      "step": 624
    },
    {
      "epoch": 0.06630596223212391,
      "grad_norm": 2.577944866615984,
      "learning_rate": 4.9997347743444353e-05,
      "loss": 2.6656,
      "num_input_tokens_seen": 491728880,
      "step": 625
    },
    {
      "epoch": 0.0664120517716953,
      "grad_norm": 2.4979013273917734,
      "learning_rate": 4.999733761084812e-05,
      "loss": 2.5178,
      "num_input_tokens_seen": 492515696,
      "step": 626
    },
    {
      "epoch": 0.06651814131126671,
      "grad_norm": 1.5587455817208353,
      "learning_rate": 4.9997327458934686e-05,
      "loss": 2.4318,
      "num_input_tokens_seen": 493302464,
      "step": 627
    },
    {
      "epoch": 0.0666242308508381,
      "grad_norm": 1.212193598419072,
      "learning_rate": 4.999731728770404e-05,
      "loss": 2.5195,
      "num_input_tokens_seen": 494089216,
      "step": 628
    },
    {
      "epoch": 0.0667303203904095,
      "grad_norm": 1.562085600133292,
      "learning_rate": 4.99973070971562e-05,
      "loss": 2.2591,
      "num_input_tokens_seen": 494876080,
      "step": 629
    },
    {
      "epoch": 0.0668364099299809,
      "grad_norm": 1.3342039654977706,
      "learning_rate": 4.9997296887291175e-05,
      "loss": 2.6375,
      "num_input_tokens_seen": 495662816,
      "step": 630
    },
    {
      "epoch": 0.0669424994695523,
      "grad_norm": 1.7967976635564635,
      "learning_rate": 4.9997286658108975e-05,
      "loss": 2.4043,
      "num_input_tokens_seen": 496449504,
      "step": 631
    },
    {
      "epoch": 0.0670485890091237,
      "grad_norm": 1.3752537512590413,
      "learning_rate": 4.9997276409609606e-05,
      "loss": 2.3264,
      "num_input_tokens_seen": 497236256,
      "step": 632
    },
    {
      "epoch": 0.0671546785486951,
      "grad_norm": 1.166762920057602,
      "learning_rate": 4.9997266141793075e-05,
      "loss": 2.4254,
      "num_input_tokens_seen": 498023040,
      "step": 633
    },
    {
      "epoch": 0.0672607680882665,
      "grad_norm": 1.3409335137045255,
      "learning_rate": 4.999725585465939e-05,
      "loss": 2.451,
      "num_input_tokens_seen": 498809728,
      "step": 634
    },
    {
      "epoch": 0.0673668576278379,
      "grad_norm": 1.0743622973259361,
      "learning_rate": 4.999724554820855e-05,
      "loss": 2.5728,
      "num_input_tokens_seen": 499596464,
      "step": 635
    },
    {
      "epoch": 0.0674729471674093,
      "grad_norm": 1.5978581710978843,
      "learning_rate": 4.999723522244059e-05,
      "loss": 2.5628,
      "num_input_tokens_seen": 500383296,
      "step": 636
    },
    {
      "epoch": 0.06757903670698069,
      "grad_norm": 1.4977688387554764,
      "learning_rate": 4.999722487735549e-05,
      "loss": 2.3941,
      "num_input_tokens_seen": 501170032,
      "step": 637
    },
    {
      "epoch": 0.0676851262465521,
      "grad_norm": 1.5302643893785526,
      "learning_rate": 4.999721451295327e-05,
      "loss": 2.4315,
      "num_input_tokens_seen": 501956704,
      "step": 638
    },
    {
      "epoch": 0.06779121578612349,
      "grad_norm": 2.266494359802096,
      "learning_rate": 4.999720412923393e-05,
      "loss": 2.4653,
      "num_input_tokens_seen": 502743520,
      "step": 639
    },
    {
      "epoch": 0.06789730532569489,
      "grad_norm": 1.499774367047273,
      "learning_rate": 4.999719372619749e-05,
      "loss": 2.3603,
      "num_input_tokens_seen": 503530224,
      "step": 640
    },
    {
      "epoch": 0.06800339486526628,
      "grad_norm": 2.3693973545554106,
      "learning_rate": 4.9997183303843955e-05,
      "loss": 2.5268,
      "num_input_tokens_seen": 504316960,
      "step": 641
    },
    {
      "epoch": 0.06810948440483769,
      "grad_norm": 1.4417973269636557,
      "learning_rate": 4.999717286217332e-05,
      "loss": 2.4308,
      "num_input_tokens_seen": 505103696,
      "step": 642
    },
    {
      "epoch": 0.06821557394440908,
      "grad_norm": 2.372711862995648,
      "learning_rate": 4.999716240118561e-05,
      "loss": 2.3187,
      "num_input_tokens_seen": 505890496,
      "step": 643
    },
    {
      "epoch": 0.06832166348398049,
      "grad_norm": 1.9340683973753794,
      "learning_rate": 4.9997151920880826e-05,
      "loss": 2.4696,
      "num_input_tokens_seen": 506677248,
      "step": 644
    },
    {
      "epoch": 0.06842775302355188,
      "grad_norm": 1.9528684049567635,
      "learning_rate": 4.9997141421258977e-05,
      "loss": 2.4004,
      "num_input_tokens_seen": 507464048,
      "step": 645
    },
    {
      "epoch": 0.06853384256312328,
      "grad_norm": 1.663056730882284,
      "learning_rate": 4.9997130902320067e-05,
      "loss": 2.587,
      "num_input_tokens_seen": 508250784,
      "step": 646
    },
    {
      "epoch": 0.06863993210269467,
      "grad_norm": 2.160630296535809,
      "learning_rate": 4.999712036406411e-05,
      "loss": 2.5542,
      "num_input_tokens_seen": 509037584,
      "step": 647
    },
    {
      "epoch": 0.06874602164226608,
      "grad_norm": 1.3208281377450601,
      "learning_rate": 4.999710980649112e-05,
      "loss": 2.5023,
      "num_input_tokens_seen": 509824384,
      "step": 648
    },
    {
      "epoch": 0.06885211118183747,
      "grad_norm": 2.528056103749552,
      "learning_rate": 4.999709922960109e-05,
      "loss": 2.4859,
      "num_input_tokens_seen": 510611040,
      "step": 649
    },
    {
      "epoch": 0.06895820072140887,
      "grad_norm": 1.644955025939781,
      "learning_rate": 4.999708863339403e-05,
      "loss": 2.4353,
      "num_input_tokens_seen": 511397808,
      "step": 650
    },
    {
      "epoch": 0.06906429026098027,
      "grad_norm": 1.4574578729659209,
      "learning_rate": 4.999707801786996e-05,
      "loss": 2.3512,
      "num_input_tokens_seen": 512184592,
      "step": 651
    },
    {
      "epoch": 0.06917037980055167,
      "grad_norm": 1.3641753121651683,
      "learning_rate": 4.999706738302888e-05,
      "loss": 2.6297,
      "num_input_tokens_seen": 512971296,
      "step": 652
    },
    {
      "epoch": 0.06927646934012306,
      "grad_norm": 1.164343677151113,
      "learning_rate": 4.9997056728870796e-05,
      "loss": 2.4088,
      "num_input_tokens_seen": 513758064,
      "step": 653
    },
    {
      "epoch": 0.06938255887969447,
      "grad_norm": 1.1979915685669442,
      "learning_rate": 4.9997046055395726e-05,
      "loss": 2.5349,
      "num_input_tokens_seen": 514544816,
      "step": 654
    },
    {
      "epoch": 0.06948864841926586,
      "grad_norm": 1.0129546842490822,
      "learning_rate": 4.999703536260367e-05,
      "loss": 2.4439,
      "num_input_tokens_seen": 515331680,
      "step": 655
    },
    {
      "epoch": 0.06959473795883726,
      "grad_norm": 1.4837904514243316,
      "learning_rate": 4.999702465049464e-05,
      "loss": 2.2999,
      "num_input_tokens_seen": 516118448,
      "step": 656
    },
    {
      "epoch": 0.06970082749840865,
      "grad_norm": 1.984950010681087,
      "learning_rate": 4.999701391906864e-05,
      "loss": 2.4515,
      "num_input_tokens_seen": 516905248,
      "step": 657
    },
    {
      "epoch": 0.06980691703798006,
      "grad_norm": 1.041741210015706,
      "learning_rate": 4.999700316832568e-05,
      "loss": 2.4137,
      "num_input_tokens_seen": 517691936,
      "step": 658
    },
    {
      "epoch": 0.06991300657755145,
      "grad_norm": 1.1944817193062098,
      "learning_rate": 4.999699239826577e-05,
      "loss": 2.3009,
      "num_input_tokens_seen": 518478736,
      "step": 659
    },
    {
      "epoch": 0.07001909611712286,
      "grad_norm": 0.8968932573929396,
      "learning_rate": 4.999698160888891e-05,
      "loss": 2.4218,
      "num_input_tokens_seen": 519265504,
      "step": 660
    },
    {
      "epoch": 0.07012518565669425,
      "grad_norm": 1.8249008065204284,
      "learning_rate": 4.999697080019513e-05,
      "loss": 2.704,
      "num_input_tokens_seen": 520052256,
      "step": 661
    },
    {
      "epoch": 0.07023127519626565,
      "grad_norm": 0.9174950426765963,
      "learning_rate": 4.999695997218442e-05,
      "loss": 2.4044,
      "num_input_tokens_seen": 520839008,
      "step": 662
    },
    {
      "epoch": 0.07033736473583704,
      "grad_norm": 1.4408310252565528,
      "learning_rate": 4.999694912485679e-05,
      "loss": 2.3459,
      "num_input_tokens_seen": 521625824,
      "step": 663
    },
    {
      "epoch": 0.07044345427540845,
      "grad_norm": 1.3298531680494596,
      "learning_rate": 4.9996938258212254e-05,
      "loss": 2.5573,
      "num_input_tokens_seen": 522412512,
      "step": 664
    },
    {
      "epoch": 0.07054954381497984,
      "grad_norm": 0.9462195910957818,
      "learning_rate": 4.9996927372250824e-05,
      "loss": 2.2603,
      "num_input_tokens_seen": 523199312,
      "step": 665
    },
    {
      "epoch": 0.07065563335455124,
      "grad_norm": 1.4059055129313294,
      "learning_rate": 4.9996916466972496e-05,
      "loss": 2.3593,
      "num_input_tokens_seen": 523986064,
      "step": 666
    },
    {
      "epoch": 0.07076172289412264,
      "grad_norm": 1.482793106292174,
      "learning_rate": 4.999690554237728e-05,
      "loss": 2.4308,
      "num_input_tokens_seen": 524772848,
      "step": 667
    },
    {
      "epoch": 0.07086781243369404,
      "grad_norm": 1.1343156297667043,
      "learning_rate": 4.999689459846519e-05,
      "loss": 2.4418,
      "num_input_tokens_seen": 525559680,
      "step": 668
    },
    {
      "epoch": 0.07097390197326543,
      "grad_norm": 1.1432312737541497,
      "learning_rate": 4.999688363523624e-05,
      "loss": 2.454,
      "num_input_tokens_seen": 526346512,
      "step": 669
    },
    {
      "epoch": 0.07107999151283684,
      "grad_norm": 1.2656601101705645,
      "learning_rate": 4.999687265269043e-05,
      "loss": 2.4339,
      "num_input_tokens_seen": 527133200,
      "step": 670
    },
    {
      "epoch": 0.07118608105240823,
      "grad_norm": 1.1991649698758382,
      "learning_rate": 4.999686165082776e-05,
      "loss": 2.2671,
      "num_input_tokens_seen": 527920000,
      "step": 671
    },
    {
      "epoch": 0.07129217059197963,
      "grad_norm": 0.8089303030016584,
      "learning_rate": 4.999685062964826e-05,
      "loss": 2.4493,
      "num_input_tokens_seen": 528706800,
      "step": 672
    },
    {
      "epoch": 0.07139826013155103,
      "grad_norm": 1.2404880059811607,
      "learning_rate": 4.9996839589151925e-05,
      "loss": 2.7383,
      "num_input_tokens_seen": 529493472,
      "step": 673
    },
    {
      "epoch": 0.07150434967112243,
      "grad_norm": 1.2359456474419963,
      "learning_rate": 4.999682852933877e-05,
      "loss": 2.3724,
      "num_input_tokens_seen": 530280256,
      "step": 674
    },
    {
      "epoch": 0.07161043921069382,
      "grad_norm": 1.3754321445883477,
      "learning_rate": 4.999681745020879e-05,
      "loss": 2.5347,
      "num_input_tokens_seen": 531067024,
      "step": 675
    },
    {
      "epoch": 0.07171652875026523,
      "grad_norm": 0.8517296202584884,
      "learning_rate": 4.999680635176201e-05,
      "loss": 2.3393,
      "num_input_tokens_seen": 531853760,
      "step": 676
    },
    {
      "epoch": 0.07182261828983662,
      "grad_norm": 1.0794863431294952,
      "learning_rate": 4.999679523399843e-05,
      "loss": 2.492,
      "num_input_tokens_seen": 532640496,
      "step": 677
    },
    {
      "epoch": 0.07192870782940802,
      "grad_norm": 2.091447438040354,
      "learning_rate": 4.999678409691805e-05,
      "loss": 2.3775,
      "num_input_tokens_seen": 533427312,
      "step": 678
    },
    {
      "epoch": 0.07203479736897941,
      "grad_norm": 1.3255009092652283,
      "learning_rate": 4.9996772940520894e-05,
      "loss": 2.604,
      "num_input_tokens_seen": 534214128,
      "step": 679
    },
    {
      "epoch": 0.07214088690855082,
      "grad_norm": 3.164333111518193,
      "learning_rate": 4.9996761764806975e-05,
      "loss": 2.3331,
      "num_input_tokens_seen": 535000976,
      "step": 680
    },
    {
      "epoch": 0.07224697644812221,
      "grad_norm": 2.4368938153916098,
      "learning_rate": 4.999675056977629e-05,
      "loss": 2.3938,
      "num_input_tokens_seen": 535787824,
      "step": 681
    },
    {
      "epoch": 0.07235306598769362,
      "grad_norm": 2.5260186456636746,
      "learning_rate": 4.999673935542884e-05,
      "loss": 2.5137,
      "num_input_tokens_seen": 536574640,
      "step": 682
    },
    {
      "epoch": 0.072459155527265,
      "grad_norm": 3.1285953509293276,
      "learning_rate": 4.9996728121764644e-05,
      "loss": 2.5187,
      "num_input_tokens_seen": 537361328,
      "step": 683
    },
    {
      "epoch": 0.07256524506683641,
      "grad_norm": 1.5493169059131955,
      "learning_rate": 4.999671686878372e-05,
      "loss": 2.4812,
      "num_input_tokens_seen": 538148096,
      "step": 684
    },
    {
      "epoch": 0.0726713346064078,
      "grad_norm": 1.6876578005463425,
      "learning_rate": 4.999670559648606e-05,
      "loss": 2.4243,
      "num_input_tokens_seen": 538934864,
      "step": 685
    },
    {
      "epoch": 0.07277742414597921,
      "grad_norm": 1.5237694388906335,
      "learning_rate": 4.999669430487168e-05,
      "loss": 2.2922,
      "num_input_tokens_seen": 539721664,
      "step": 686
    },
    {
      "epoch": 0.0728835136855506,
      "grad_norm": 0.8559121730742588,
      "learning_rate": 4.999668299394059e-05,
      "loss": 2.5553,
      "num_input_tokens_seen": 540508400,
      "step": 687
    },
    {
      "epoch": 0.072989603225122,
      "grad_norm": 1.728476133500355,
      "learning_rate": 4.99966716636928e-05,
      "loss": 2.5689,
      "num_input_tokens_seen": 541295088,
      "step": 688
    },
    {
      "epoch": 0.0730956927646934,
      "grad_norm": 1.3424288804709055,
      "learning_rate": 4.999666031412831e-05,
      "loss": 2.4993,
      "num_input_tokens_seen": 542081760,
      "step": 689
    },
    {
      "epoch": 0.0732017823042648,
      "grad_norm": 0.9438941901419058,
      "learning_rate": 4.999664894524713e-05,
      "loss": 2.6994,
      "num_input_tokens_seen": 542868464,
      "step": 690
    },
    {
      "epoch": 0.07330787184383619,
      "grad_norm": 0.6972474310236189,
      "learning_rate": 4.9996637557049276e-05,
      "loss": 2.3607,
      "num_input_tokens_seen": 543655200,
      "step": 691
    },
    {
      "epoch": 0.0734139613834076,
      "grad_norm": 0.9826847850275097,
      "learning_rate": 4.9996626149534756e-05,
      "loss": 2.4262,
      "num_input_tokens_seen": 544441952,
      "step": 692
    },
    {
      "epoch": 0.07352005092297899,
      "grad_norm": 1.2960819412748956,
      "learning_rate": 4.999661472270358e-05,
      "loss": 2.5545,
      "num_input_tokens_seen": 545228640,
      "step": 693
    },
    {
      "epoch": 0.0736261404625504,
      "grad_norm": 0.8187385174461298,
      "learning_rate": 4.999660327655575e-05,
      "loss": 2.5109,
      "num_input_tokens_seen": 546015360,
      "step": 694
    },
    {
      "epoch": 0.07373223000212178,
      "grad_norm": 0.7654090523478639,
      "learning_rate": 4.9996591811091276e-05,
      "loss": 2.288,
      "num_input_tokens_seen": 546802208,
      "step": 695
    },
    {
      "epoch": 0.07383831954169319,
      "grad_norm": 0.8208844845977442,
      "learning_rate": 4.999658032631017e-05,
      "loss": 2.4438,
      "num_input_tokens_seen": 547589056,
      "step": 696
    },
    {
      "epoch": 0.07394440908126458,
      "grad_norm": 1.143695313917209,
      "learning_rate": 4.999656882221245e-05,
      "loss": 2.3788,
      "num_input_tokens_seen": 548375856,
      "step": 697
    },
    {
      "epoch": 0.07405049862083599,
      "grad_norm": 2.1025130062295063,
      "learning_rate": 4.9996557298798107e-05,
      "loss": 2.5332,
      "num_input_tokens_seen": 549162592,
      "step": 698
    },
    {
      "epoch": 0.07415658816040738,
      "grad_norm": 0.8028701690779151,
      "learning_rate": 4.9996545756067156e-05,
      "loss": 2.1886,
      "num_input_tokens_seen": 549949392,
      "step": 699
    },
    {
      "epoch": 0.07426267769997878,
      "grad_norm": 2.3748150890537625,
      "learning_rate": 4.999653419401961e-05,
      "loss": 2.3709,
      "num_input_tokens_seen": 550736160,
      "step": 700
    },
    {
      "epoch": 0.07436876723955017,
      "grad_norm": 1.5457951924846578,
      "learning_rate": 4.9996522612655477e-05,
      "loss": 2.4925,
      "num_input_tokens_seen": 551522976,
      "step": 701
    },
    {
      "epoch": 0.07447485677912158,
      "grad_norm": 1.8472702882829597,
      "learning_rate": 4.999651101197477e-05,
      "loss": 2.2002,
      "num_input_tokens_seen": 552309952,
      "step": 702
    },
    {
      "epoch": 0.07458094631869297,
      "grad_norm": 1.4406261828924718,
      "learning_rate": 4.999649939197748e-05,
      "loss": 2.2755,
      "num_input_tokens_seen": 553096768,
      "step": 703
    },
    {
      "epoch": 0.07468703585826438,
      "grad_norm": 1.8942365106360954,
      "learning_rate": 4.999648775266364e-05,
      "loss": 2.4583,
      "num_input_tokens_seen": 553883568,
      "step": 704
    },
    {
      "epoch": 0.07479312539783578,
      "grad_norm": 1.2967592460952342,
      "learning_rate": 4.999647609403324e-05,
      "loss": 2.2748,
      "num_input_tokens_seen": 554670336,
      "step": 705
    },
    {
      "epoch": 0.07489921493740717,
      "grad_norm": 1.3571342949149876,
      "learning_rate": 4.99964644160863e-05,
      "loss": 2.4618,
      "num_input_tokens_seen": 555457024,
      "step": 706
    },
    {
      "epoch": 0.07500530447697858,
      "grad_norm": 1.4892940794434695,
      "learning_rate": 4.9996452718822825e-05,
      "loss": 2.292,
      "num_input_tokens_seen": 556243888,
      "step": 707
    },
    {
      "epoch": 0.07511139401654997,
      "grad_norm": 0.8899245131814408,
      "learning_rate": 4.999644100224282e-05,
      "loss": 2.346,
      "num_input_tokens_seen": 557030592,
      "step": 708
    },
    {
      "epoch": 0.07521748355612137,
      "grad_norm": 0.8774685923536217,
      "learning_rate": 4.999642926634631e-05,
      "loss": 2.3443,
      "num_input_tokens_seen": 557817312,
      "step": 709
    },
    {
      "epoch": 0.07532357309569276,
      "grad_norm": 1.3579405466971948,
      "learning_rate": 4.9996417511133285e-05,
      "loss": 2.6163,
      "num_input_tokens_seen": 558604112,
      "step": 710
    },
    {
      "epoch": 0.07542966263526417,
      "grad_norm": 1.4301128297705934,
      "learning_rate": 4.9996405736603766e-05,
      "loss": 2.46,
      "num_input_tokens_seen": 559390848,
      "step": 711
    },
    {
      "epoch": 0.07553575217483556,
      "grad_norm": 1.4449670392304292,
      "learning_rate": 4.9996393942757756e-05,
      "loss": 2.483,
      "num_input_tokens_seen": 560177680,
      "step": 712
    },
    {
      "epoch": 0.07564184171440697,
      "grad_norm": 0.9838114305536416,
      "learning_rate": 4.999638212959527e-05,
      "loss": 2.4591,
      "num_input_tokens_seen": 560964464,
      "step": 713
    },
    {
      "epoch": 0.07574793125397836,
      "grad_norm": 1.1276088228526517,
      "learning_rate": 4.999637029711631e-05,
      "loss": 2.3303,
      "num_input_tokens_seen": 561751280,
      "step": 714
    },
    {
      "epoch": 0.07585402079354976,
      "grad_norm": 0.872170515821415,
      "learning_rate": 4.9996358445320884e-05,
      "loss": 2.4766,
      "num_input_tokens_seen": 562537952,
      "step": 715
    },
    {
      "epoch": 0.07596011033312115,
      "grad_norm": 0.9271843774507984,
      "learning_rate": 4.999634657420901e-05,
      "loss": 2.406,
      "num_input_tokens_seen": 563324656,
      "step": 716
    },
    {
      "epoch": 0.07606619987269256,
      "grad_norm": 1.5273652391963584,
      "learning_rate": 4.99963346837807e-05,
      "loss": 2.5528,
      "num_input_tokens_seen": 564111360,
      "step": 717
    },
    {
      "epoch": 0.07617228941226395,
      "grad_norm": 1.193199658425061,
      "learning_rate": 4.999632277403594e-05,
      "loss": 2.4436,
      "num_input_tokens_seen": 564898096,
      "step": 718
    },
    {
      "epoch": 0.07627837895183535,
      "grad_norm": 1.1997033640531274,
      "learning_rate": 4.999631084497477e-05,
      "loss": 2.4654,
      "num_input_tokens_seen": 565684912,
      "step": 719
    },
    {
      "epoch": 0.07638446849140675,
      "grad_norm": 1.446722981310639,
      "learning_rate": 4.999629889659717e-05,
      "loss": 2.4321,
      "num_input_tokens_seen": 566471680,
      "step": 720
    },
    {
      "epoch": 0.07649055803097815,
      "grad_norm": 1.7117316776002802,
      "learning_rate": 4.999628692890318e-05,
      "loss": 2.523,
      "num_input_tokens_seen": 567258416,
      "step": 721
    },
    {
      "epoch": 0.07659664757054954,
      "grad_norm": 0.9888857716540044,
      "learning_rate": 4.999627494189279e-05,
      "loss": 2.4414,
      "num_input_tokens_seen": 568045216,
      "step": 722
    },
    {
      "epoch": 0.07670273711012095,
      "grad_norm": 3.464274262343499,
      "learning_rate": 4.9996262935565993e-05,
      "loss": 2.5465,
      "num_input_tokens_seen": 568831936,
      "step": 723
    },
    {
      "epoch": 0.07680882664969234,
      "grad_norm": 2.5996431339608654,
      "learning_rate": 4.999625090992284e-05,
      "loss": 2.6083,
      "num_input_tokens_seen": 569618656,
      "step": 724
    },
    {
      "epoch": 0.07691491618926374,
      "grad_norm": 2.91767950950335,
      "learning_rate": 4.9996238864963305e-05,
      "loss": 2.467,
      "num_input_tokens_seen": 570405536,
      "step": 725
    },
    {
      "epoch": 0.07702100572883513,
      "grad_norm": 2.935663925998549,
      "learning_rate": 4.9996226800687416e-05,
      "loss": 2.5511,
      "num_input_tokens_seen": 571192368,
      "step": 726
    },
    {
      "epoch": 0.07712709526840654,
      "grad_norm": 1.8033561343157833,
      "learning_rate": 4.999621471709517e-05,
      "loss": 2.3674,
      "num_input_tokens_seen": 571979120,
      "step": 727
    },
    {
      "epoch": 0.07723318480797793,
      "grad_norm": 1.4200440044641813,
      "learning_rate": 4.999620261418659e-05,
      "loss": 2.3915,
      "num_input_tokens_seen": 572765904,
      "step": 728
    },
    {
      "epoch": 0.07733927434754934,
      "grad_norm": 2.479631713124537,
      "learning_rate": 4.9996190491961676e-05,
      "loss": 2.673,
      "num_input_tokens_seen": 573552512,
      "step": 729
    },
    {
      "epoch": 0.07744536388712073,
      "grad_norm": 1.0673011925215325,
      "learning_rate": 4.9996178350420445e-05,
      "loss": 2.2754,
      "num_input_tokens_seen": 574339280,
      "step": 730
    },
    {
      "epoch": 0.07755145342669213,
      "grad_norm": 1.312089475090528,
      "learning_rate": 4.9996166189562885e-05,
      "loss": 2.6412,
      "num_input_tokens_seen": 575126064,
      "step": 731
    },
    {
      "epoch": 0.07765754296626352,
      "grad_norm": 1.3965136437411358,
      "learning_rate": 4.999615400938903e-05,
      "loss": 2.5741,
      "num_input_tokens_seen": 575912832,
      "step": 732
    },
    {
      "epoch": 0.07776363250583493,
      "grad_norm": 1.1130064715226762,
      "learning_rate": 4.999614180989888e-05,
      "loss": 2.5853,
      "num_input_tokens_seen": 576699664,
      "step": 733
    },
    {
      "epoch": 0.07786972204540632,
      "grad_norm": 1.229498346731694,
      "learning_rate": 4.999612959109245e-05,
      "loss": 2.409,
      "num_input_tokens_seen": 577486448,
      "step": 734
    },
    {
      "epoch": 0.07797581158497773,
      "grad_norm": 1.3008160126915558,
      "learning_rate": 4.999611735296974e-05,
      "loss": 2.5576,
      "num_input_tokens_seen": 578273088,
      "step": 735
    },
    {
      "epoch": 0.07808190112454912,
      "grad_norm": 1.6538933627468537,
      "learning_rate": 4.999610509553076e-05,
      "loss": 2.4944,
      "num_input_tokens_seen": 579059840,
      "step": 736
    },
    {
      "epoch": 0.07818799066412052,
      "grad_norm": 1.0220873590718884,
      "learning_rate": 4.9996092818775534e-05,
      "loss": 2.4949,
      "num_input_tokens_seen": 579846592,
      "step": 737
    },
    {
      "epoch": 0.07829408020369191,
      "grad_norm": 2.5843312882769407,
      "learning_rate": 4.999608052270406e-05,
      "loss": 2.4407,
      "num_input_tokens_seen": 580633376,
      "step": 738
    },
    {
      "epoch": 0.07840016974326332,
      "grad_norm": 1.5808665670946078,
      "learning_rate": 4.9996068207316335e-05,
      "loss": 2.2896,
      "num_input_tokens_seen": 581420176,
      "step": 739
    },
    {
      "epoch": 0.07850625928283471,
      "grad_norm": 2.34108700858267,
      "learning_rate": 4.999605587261239e-05,
      "loss": 2.4142,
      "num_input_tokens_seen": 582206976,
      "step": 740
    },
    {
      "epoch": 0.07861234882240611,
      "grad_norm": 1.7705852419535504,
      "learning_rate": 4.999604351859223e-05,
      "loss": 2.5041,
      "num_input_tokens_seen": 582993728,
      "step": 741
    },
    {
      "epoch": 0.0787184383619775,
      "grad_norm": 1.964294004069509,
      "learning_rate": 4.999603114525586e-05,
      "loss": 2.481,
      "num_input_tokens_seen": 583780496,
      "step": 742
    },
    {
      "epoch": 0.07882452790154891,
      "grad_norm": 1.5324705391471687,
      "learning_rate": 4.999601875260329e-05,
      "loss": 2.3816,
      "num_input_tokens_seen": 584567312,
      "step": 743
    },
    {
      "epoch": 0.0789306174411203,
      "grad_norm": 1.525628173865434,
      "learning_rate": 4.999600634063453e-05,
      "loss": 2.3518,
      "num_input_tokens_seen": 585354048,
      "step": 744
    },
    {
      "epoch": 0.0790367069806917,
      "grad_norm": 1.3244635831745757,
      "learning_rate": 4.999599390934958e-05,
      "loss": 2.475,
      "num_input_tokens_seen": 586140800,
      "step": 745
    },
    {
      "epoch": 0.0791427965202631,
      "grad_norm": 1.0080607868459743,
      "learning_rate": 4.999598145874847e-05,
      "loss": 2.3249,
      "num_input_tokens_seen": 586927600,
      "step": 746
    },
    {
      "epoch": 0.0792488860598345,
      "grad_norm": 1.2081074574679986,
      "learning_rate": 4.99959689888312e-05,
      "loss": 2.511,
      "num_input_tokens_seen": 587714304,
      "step": 747
    },
    {
      "epoch": 0.0793549755994059,
      "grad_norm": 1.578840959660432,
      "learning_rate": 4.999595649959777e-05,
      "loss": 2.3432,
      "num_input_tokens_seen": 588501120,
      "step": 748
    },
    {
      "epoch": 0.0794610651389773,
      "grad_norm": 0.9225738544754905,
      "learning_rate": 4.9995943991048204e-05,
      "loss": 2.4224,
      "num_input_tokens_seen": 589287936,
      "step": 749
    },
    {
      "epoch": 0.07956715467854869,
      "grad_norm": 1.278232058934287,
      "learning_rate": 4.999593146318251e-05,
      "loss": 2.2745,
      "num_input_tokens_seen": 590074656,
      "step": 750
    },
    {
      "epoch": 0.0796732442181201,
      "grad_norm": 1.1010051378711265,
      "learning_rate": 4.999591891600068e-05,
      "loss": 2.4168,
      "num_input_tokens_seen": 590861392,
      "step": 751
    },
    {
      "epoch": 0.07977933375769149,
      "grad_norm": 1.0311337598119532,
      "learning_rate": 4.999590634950275e-05,
      "loss": 2.2743,
      "num_input_tokens_seen": 591648224,
      "step": 752
    },
    {
      "epoch": 0.07988542329726289,
      "grad_norm": 0.8714019076404099,
      "learning_rate": 4.9995893763688715e-05,
      "loss": 2.3991,
      "num_input_tokens_seen": 592435024,
      "step": 753
    },
    {
      "epoch": 0.07999151283683428,
      "grad_norm": 1.512746503415599,
      "learning_rate": 4.9995881158558586e-05,
      "loss": 2.5852,
      "num_input_tokens_seen": 593221856,
      "step": 754
    },
    {
      "epoch": 0.08009760237640569,
      "grad_norm": 1.195072424277587,
      "learning_rate": 4.999586853411237e-05,
      "loss": 2.5615,
      "num_input_tokens_seen": 594008608,
      "step": 755
    },
    {
      "epoch": 0.08020369191597708,
      "grad_norm": 1.368721583730474,
      "learning_rate": 4.999585589035009e-05,
      "loss": 2.4693,
      "num_input_tokens_seen": 594795280,
      "step": 756
    },
    {
      "epoch": 0.08030978145554848,
      "grad_norm": 1.384270505851504,
      "learning_rate": 4.999584322727173e-05,
      "loss": 2.5933,
      "num_input_tokens_seen": 595581968,
      "step": 757
    },
    {
      "epoch": 0.08041587099511988,
      "grad_norm": 1.5486157737574955,
      "learning_rate": 4.999583054487733e-05,
      "loss": 2.4732,
      "num_input_tokens_seen": 596368688,
      "step": 758
    },
    {
      "epoch": 0.08052196053469128,
      "grad_norm": 0.6881133352565154,
      "learning_rate": 4.999581784316688e-05,
      "loss": 2.3174,
      "num_input_tokens_seen": 597155456,
      "step": 759
    },
    {
      "epoch": 0.08062805007426267,
      "grad_norm": 1.4749790097499105,
      "learning_rate": 4.9995805122140396e-05,
      "loss": 2.2954,
      "num_input_tokens_seen": 597942304,
      "step": 760
    },
    {
      "epoch": 0.08073413961383408,
      "grad_norm": 0.8114596863714041,
      "learning_rate": 4.9995792381797876e-05,
      "loss": 2.5414,
      "num_input_tokens_seen": 598729040,
      "step": 761
    },
    {
      "epoch": 0.08084022915340547,
      "grad_norm": 0.9532886723454975,
      "learning_rate": 4.999577962213936e-05,
      "loss": 2.4119,
      "num_input_tokens_seen": 599515808,
      "step": 762
    },
    {
      "epoch": 0.08094631869297687,
      "grad_norm": 0.848551781941847,
      "learning_rate": 4.9995766843164826e-05,
      "loss": 2.5039,
      "num_input_tokens_seen": 600302496,
      "step": 763
    },
    {
      "epoch": 0.08105240823254826,
      "grad_norm": 0.7254277438332294,
      "learning_rate": 4.99957540448743e-05,
      "loss": 2.3934,
      "num_input_tokens_seen": 601089312,
      "step": 764
    },
    {
      "epoch": 0.08115849777211967,
      "grad_norm": 0.966503795178405,
      "learning_rate": 4.9995741227267795e-05,
      "loss": 2.4631,
      "num_input_tokens_seen": 601876096,
      "step": 765
    },
    {
      "epoch": 0.08126458731169106,
      "grad_norm": 1.3850660407203501,
      "learning_rate": 4.999572839034531e-05,
      "loss": 2.2793,
      "num_input_tokens_seen": 602662992,
      "step": 766
    },
    {
      "epoch": 0.08137067685126247,
      "grad_norm": 0.9384665071797158,
      "learning_rate": 4.999571553410686e-05,
      "loss": 2.6251,
      "num_input_tokens_seen": 603449712,
      "step": 767
    },
    {
      "epoch": 0.08147676639083386,
      "grad_norm": 1.3009435194666004,
      "learning_rate": 4.999570265855245e-05,
      "loss": 2.4123,
      "num_input_tokens_seen": 604236416,
      "step": 768
    },
    {
      "epoch": 0.08158285593040526,
      "grad_norm": 1.606075067782428,
      "learning_rate": 4.9995689763682096e-05,
      "loss": 2.4234,
      "num_input_tokens_seen": 605023120,
      "step": 769
    },
    {
      "epoch": 0.08168894546997665,
      "grad_norm": 1.4855748609302135,
      "learning_rate": 4.999567684949581e-05,
      "loss": 2.4246,
      "num_input_tokens_seen": 605810016,
      "step": 770
    },
    {
      "epoch": 0.08179503500954806,
      "grad_norm": 2.0367189823730754,
      "learning_rate": 4.99956639159936e-05,
      "loss": 2.4177,
      "num_input_tokens_seen": 606596752,
      "step": 771
    },
    {
      "epoch": 0.08190112454911945,
      "grad_norm": 1.135849217773405,
      "learning_rate": 4.9995650963175465e-05,
      "loss": 2.373,
      "num_input_tokens_seen": 607383584,
      "step": 772
    },
    {
      "epoch": 0.08200721408869086,
      "grad_norm": 2.943165346898397,
      "learning_rate": 4.999563799104143e-05,
      "loss": 2.3551,
      "num_input_tokens_seen": 608170416,
      "step": 773
    },
    {
      "epoch": 0.08211330362826226,
      "grad_norm": 2.69303542629084,
      "learning_rate": 4.999562499959151e-05,
      "loss": 2.3979,
      "num_input_tokens_seen": 608957120,
      "step": 774
    },
    {
      "epoch": 0.08221939316783365,
      "grad_norm": 2.5087789729021934,
      "learning_rate": 4.999561198882568e-05,
      "loss": 2.4598,
      "num_input_tokens_seen": 609743936,
      "step": 775
    },
    {
      "epoch": 0.08232548270740506,
      "grad_norm": 1.859608937594071,
      "learning_rate": 4.9995598958744e-05,
      "loss": 2.6942,
      "num_input_tokens_seen": 610530640,
      "step": 776
    },
    {
      "epoch": 0.08243157224697645,
      "grad_norm": 1.7065644427462427,
      "learning_rate": 4.999558590934644e-05,
      "loss": 2.3856,
      "num_input_tokens_seen": 611317408,
      "step": 777
    },
    {
      "epoch": 0.08253766178654785,
      "grad_norm": 1.0358613597135173,
      "learning_rate": 4.9995572840633034e-05,
      "loss": 2.432,
      "num_input_tokens_seen": 612104160,
      "step": 778
    },
    {
      "epoch": 0.08264375132611924,
      "grad_norm": 1.3984120163071483,
      "learning_rate": 4.999555975260377e-05,
      "loss": 2.4452,
      "num_input_tokens_seen": 612890944,
      "step": 779
    },
    {
      "epoch": 0.08274984086569065,
      "grad_norm": 1.187662119178694,
      "learning_rate": 4.999554664525868e-05,
      "loss": 2.3288,
      "num_input_tokens_seen": 613677760,
      "step": 780
    },
    {
      "epoch": 0.08285593040526204,
      "grad_norm": 1.1862105117458053,
      "learning_rate": 4.999553351859776e-05,
      "loss": 2.4481,
      "num_input_tokens_seen": 614464480,
      "step": 781
    },
    {
      "epoch": 0.08296201994483345,
      "grad_norm": 1.2107603925570336,
      "learning_rate": 4.999552037262103e-05,
      "loss": 2.5136,
      "num_input_tokens_seen": 615251136,
      "step": 782
    },
    {
      "epoch": 0.08306810948440484,
      "grad_norm": 0.9837293682116212,
      "learning_rate": 4.999550720732849e-05,
      "loss": 2.444,
      "num_input_tokens_seen": 616037872,
      "step": 783
    },
    {
      "epoch": 0.08317419902397624,
      "grad_norm": 1.3768085525005194,
      "learning_rate": 4.999549402272016e-05,
      "loss": 2.6282,
      "num_input_tokens_seen": 616824688,
      "step": 784
    },
    {
      "epoch": 0.08328028856354763,
      "grad_norm": 0.9161805045781831,
      "learning_rate": 4.9995480818796045e-05,
      "loss": 2.4601,
      "num_input_tokens_seen": 617611456,
      "step": 785
    },
    {
      "epoch": 0.08338637810311904,
      "grad_norm": 1.1950555498770956,
      "learning_rate": 4.999546759555616e-05,
      "loss": 2.5011,
      "num_input_tokens_seen": 618398224,
      "step": 786
    },
    {
      "epoch": 0.08349246764269043,
      "grad_norm": 1.2190839746611817,
      "learning_rate": 4.99954543530005e-05,
      "loss": 2.7049,
      "num_input_tokens_seen": 619184896,
      "step": 787
    },
    {
      "epoch": 0.08359855718226183,
      "grad_norm": 1.4847468328246785,
      "learning_rate": 4.9995441091129095e-05,
      "loss": 2.6019,
      "num_input_tokens_seen": 619971696,
      "step": 788
    },
    {
      "epoch": 0.08370464672183323,
      "grad_norm": 1.4372543673051221,
      "learning_rate": 4.999542780994194e-05,
      "loss": 2.4842,
      "num_input_tokens_seen": 620758448,
      "step": 789
    },
    {
      "epoch": 0.08381073626140463,
      "grad_norm": 0.9456397670845177,
      "learning_rate": 4.999541450943905e-05,
      "loss": 2.4426,
      "num_input_tokens_seen": 621545184,
      "step": 790
    },
    {
      "epoch": 0.08391682580097602,
      "grad_norm": 0.9742589927184657,
      "learning_rate": 4.999540118962045e-05,
      "loss": 2.1888,
      "num_input_tokens_seen": 622331952,
      "step": 791
    },
    {
      "epoch": 0.08402291534054743,
      "grad_norm": 0.7817152694547759,
      "learning_rate": 4.999538785048613e-05,
      "loss": 2.2536,
      "num_input_tokens_seen": 623118736,
      "step": 792
    },
    {
      "epoch": 0.08412900488011882,
      "grad_norm": 0.9450191235558828,
      "learning_rate": 4.999537449203611e-05,
      "loss": 2.5908,
      "num_input_tokens_seen": 623905392,
      "step": 793
    },
    {
      "epoch": 0.08423509441969022,
      "grad_norm": 0.7963565860045135,
      "learning_rate": 4.999536111427039e-05,
      "loss": 2.5641,
      "num_input_tokens_seen": 624692048,
      "step": 794
    },
    {
      "epoch": 0.08434118395926161,
      "grad_norm": 1.0618122955168297,
      "learning_rate": 4.999534771718899e-05,
      "loss": 2.3779,
      "num_input_tokens_seen": 625478832,
      "step": 795
    },
    {
      "epoch": 0.08444727349883302,
      "grad_norm": 1.8610458092018691,
      "learning_rate": 4.999533430079192e-05,
      "loss": 2.471,
      "num_input_tokens_seen": 626265664,
      "step": 796
    },
    {
      "epoch": 0.08455336303840441,
      "grad_norm": 1.1761938820661182,
      "learning_rate": 4.99953208650792e-05,
      "loss": 2.373,
      "num_input_tokens_seen": 627052432,
      "step": 797
    },
    {
      "epoch": 0.08465945257797582,
      "grad_norm": 1.1897700495347976,
      "learning_rate": 4.9995307410050816e-05,
      "loss": 2.4174,
      "num_input_tokens_seen": 627839216,
      "step": 798
    },
    {
      "epoch": 0.08476554211754721,
      "grad_norm": 1.1763378077289377,
      "learning_rate": 4.99952939357068e-05,
      "loss": 2.4827,
      "num_input_tokens_seen": 628625984,
      "step": 799
    },
    {
      "epoch": 0.08487163165711861,
      "grad_norm": 1.1875688941349152,
      "learning_rate": 4.9995280442047146e-05,
      "loss": 2.392,
      "num_input_tokens_seen": 629412864,
      "step": 800
    },
    {
      "epoch": 0.08497772119669,
      "grad_norm": 1.4639877696037986,
      "learning_rate": 4.999526692907188e-05,
      "loss": 2.8005,
      "num_input_tokens_seen": 630199536,
      "step": 801
    },
    {
      "epoch": 0.08508381073626141,
      "grad_norm": 1.3972079782682545,
      "learning_rate": 4.999525339678101e-05,
      "loss": 2.638,
      "num_input_tokens_seen": 630986304,
      "step": 802
    },
    {
      "epoch": 0.0851899002758328,
      "grad_norm": 2.0428662080440176,
      "learning_rate": 4.999523984517452e-05,
      "loss": 2.5006,
      "num_input_tokens_seen": 631773056,
      "step": 803
    },
    {
      "epoch": 0.0852959898154042,
      "grad_norm": 1.1459810123260905,
      "learning_rate": 4.9995226274252466e-05,
      "loss": 2.4168,
      "num_input_tokens_seen": 632559872,
      "step": 804
    },
    {
      "epoch": 0.0854020793549756,
      "grad_norm": 1.1273780228074193,
      "learning_rate": 4.999521268401483e-05,
      "loss": 2.3066,
      "num_input_tokens_seen": 633346720,
      "step": 805
    },
    {
      "epoch": 0.085508168894547,
      "grad_norm": 1.738654515035142,
      "learning_rate": 4.999519907446162e-05,
      "loss": 2.5638,
      "num_input_tokens_seen": 634133584,
      "step": 806
    },
    {
      "epoch": 0.08561425843411839,
      "grad_norm": 2.168633760671057,
      "learning_rate": 4.9995185445592854e-05,
      "loss": 2.567,
      "num_input_tokens_seen": 634920352,
      "step": 807
    },
    {
      "epoch": 0.0857203479736898,
      "grad_norm": 1.064562889603642,
      "learning_rate": 4.999517179740854e-05,
      "loss": 2.551,
      "num_input_tokens_seen": 635706992,
      "step": 808
    },
    {
      "epoch": 0.08582643751326119,
      "grad_norm": 3.886585938260058,
      "learning_rate": 4.9995158129908695e-05,
      "loss": 2.5197,
      "num_input_tokens_seen": 636493808,
      "step": 809
    },
    {
      "epoch": 0.0859325270528326,
      "grad_norm": 2.6777173447214824,
      "learning_rate": 4.999514444309332e-05,
      "loss": 2.2965,
      "num_input_tokens_seen": 637280544,
      "step": 810
    },
    {
      "epoch": 0.08603861659240399,
      "grad_norm": 3.235077152297584,
      "learning_rate": 4.999513073696244e-05,
      "loss": 2.5656,
      "num_input_tokens_seen": 638067296,
      "step": 811
    },
    {
      "epoch": 0.08614470613197539,
      "grad_norm": 2.259422527109662,
      "learning_rate": 4.9995117011516055e-05,
      "loss": 2.4784,
      "num_input_tokens_seen": 638854096,
      "step": 812
    },
    {
      "epoch": 0.08625079567154678,
      "grad_norm": 2.216692594904534,
      "learning_rate": 4.9995103266754175e-05,
      "loss": 2.3386,
      "num_input_tokens_seen": 639640832,
      "step": 813
    },
    {
      "epoch": 0.08635688521111819,
      "grad_norm": 0.8996836315837528,
      "learning_rate": 4.999508950267681e-05,
      "loss": 2.4392,
      "num_input_tokens_seen": 640427520,
      "step": 814
    },
    {
      "epoch": 0.08646297475068958,
      "grad_norm": 1.3223804594377986,
      "learning_rate": 4.999507571928397e-05,
      "loss": 2.6872,
      "num_input_tokens_seen": 641214256,
      "step": 815
    },
    {
      "epoch": 0.08656906429026098,
      "grad_norm": 1.6163182415115136,
      "learning_rate": 4.999506191657567e-05,
      "loss": 2.4858,
      "num_input_tokens_seen": 642001056,
      "step": 816
    },
    {
      "epoch": 0.08667515382983237,
      "grad_norm": 1.2656839343615007,
      "learning_rate": 4.9995048094551926e-05,
      "loss": 2.4625,
      "num_input_tokens_seen": 642787760,
      "step": 817
    },
    {
      "epoch": 0.08678124336940378,
      "grad_norm": 0.9290097798659128,
      "learning_rate": 4.999503425321274e-05,
      "loss": 2.2426,
      "num_input_tokens_seen": 643574560,
      "step": 818
    },
    {
      "epoch": 0.08688733290897517,
      "grad_norm": 1.6888194406933785,
      "learning_rate": 4.9995020392558124e-05,
      "loss": 2.3279,
      "num_input_tokens_seen": 644361344,
      "step": 819
    },
    {
      "epoch": 0.08699342244854658,
      "grad_norm": 1.1249410969784772,
      "learning_rate": 4.9995006512588095e-05,
      "loss": 2.3183,
      "num_input_tokens_seen": 645148096,
      "step": 820
    },
    {
      "epoch": 0.08709951198811797,
      "grad_norm": 1.3903687644677198,
      "learning_rate": 4.999499261330265e-05,
      "loss": 2.6095,
      "num_input_tokens_seen": 645934832,
      "step": 821
    },
    {
      "epoch": 0.08720560152768937,
      "grad_norm": 0.7649133648197544,
      "learning_rate": 4.999497869470181e-05,
      "loss": 2.3596,
      "num_input_tokens_seen": 646721632,
      "step": 822
    },
    {
      "epoch": 0.08731169106726076,
      "grad_norm": 1.070583339405392,
      "learning_rate": 4.9994964756785584e-05,
      "loss": 2.495,
      "num_input_tokens_seen": 647508400,
      "step": 823
    },
    {
      "epoch": 0.08741778060683217,
      "grad_norm": 1.0926922263228025,
      "learning_rate": 4.999495079955399e-05,
      "loss": 2.3012,
      "num_input_tokens_seen": 648295264,
      "step": 824
    },
    {
      "epoch": 0.08752387014640356,
      "grad_norm": 0.7510276062960058,
      "learning_rate": 4.9994936823007024e-05,
      "loss": 2.2083,
      "num_input_tokens_seen": 649082096,
      "step": 825
    },
    {
      "epoch": 0.08762995968597496,
      "grad_norm": 0.8972066826570891,
      "learning_rate": 4.99949228271447e-05,
      "loss": 2.4501,
      "num_input_tokens_seen": 649868816,
      "step": 826
    },
    {
      "epoch": 0.08773604922554636,
      "grad_norm": 1.367527200233315,
      "learning_rate": 4.999490881196704e-05,
      "loss": 2.3861,
      "num_input_tokens_seen": 650655488,
      "step": 827
    },
    {
      "epoch": 0.08784213876511776,
      "grad_norm": 1.3962017222706622,
      "learning_rate": 4.999489477747404e-05,
      "loss": 2.8284,
      "num_input_tokens_seen": 651442208,
      "step": 828
    },
    {
      "epoch": 0.08794822830468915,
      "grad_norm": 0.7817882126494489,
      "learning_rate": 4.9994880723665726e-05,
      "loss": 2.3666,
      "num_input_tokens_seen": 652228976,
      "step": 829
    },
    {
      "epoch": 0.08805431784426056,
      "grad_norm": 1.2194039546789013,
      "learning_rate": 4.9994866650542105e-05,
      "loss": 2.4346,
      "num_input_tokens_seen": 653015696,
      "step": 830
    },
    {
      "epoch": 0.08816040738383195,
      "grad_norm": 1.0471070934051887,
      "learning_rate": 4.999485255810318e-05,
      "loss": 2.5751,
      "num_input_tokens_seen": 653802400,
      "step": 831
    },
    {
      "epoch": 0.08826649692340335,
      "grad_norm": 1.3190465356898586,
      "learning_rate": 4.999483844634897e-05,
      "loss": 2.5796,
      "num_input_tokens_seen": 654589168,
      "step": 832
    },
    {
      "epoch": 0.08837258646297474,
      "grad_norm": 0.8390334615174734,
      "learning_rate": 4.9994824315279477e-05,
      "loss": 2.3314,
      "num_input_tokens_seen": 655375936,
      "step": 833
    },
    {
      "epoch": 0.08847867600254615,
      "grad_norm": 1.6323772880094392,
      "learning_rate": 4.9994810164894714e-05,
      "loss": 2.4999,
      "num_input_tokens_seen": 656162720,
      "step": 834
    },
    {
      "epoch": 0.08858476554211754,
      "grad_norm": 2.142611847030118,
      "learning_rate": 4.99947959951947e-05,
      "loss": 2.4716,
      "num_input_tokens_seen": 656949456,
      "step": 835
    },
    {
      "epoch": 0.08869085508168895,
      "grad_norm": 0.9252461378326454,
      "learning_rate": 4.999478180617944e-05,
      "loss": 2.5665,
      "num_input_tokens_seen": 657736208,
      "step": 836
    },
    {
      "epoch": 0.08879694462126034,
      "grad_norm": 4.835121147764302,
      "learning_rate": 4.999476759784895e-05,
      "loss": 2.7142,
      "num_input_tokens_seen": 658522928,
      "step": 837
    },
    {
      "epoch": 0.08890303416083174,
      "grad_norm": 2.8592630619676314,
      "learning_rate": 4.999475337020323e-05,
      "loss": 2.5073,
      "num_input_tokens_seen": 659309680,
      "step": 838
    },
    {
      "epoch": 0.08900912370040313,
      "grad_norm": 3.6384657215263543,
      "learning_rate": 4.999473912324231e-05,
      "loss": 2.6285,
      "num_input_tokens_seen": 660096496,
      "step": 839
    },
    {
      "epoch": 0.08911521323997454,
      "grad_norm": 2.634079611985125,
      "learning_rate": 4.999472485696618e-05,
      "loss": 2.2094,
      "num_input_tokens_seen": 660883248,
      "step": 840
    },
    {
      "epoch": 0.08922130277954593,
      "grad_norm": 2.2296201504925923,
      "learning_rate": 4.999471057137486e-05,
      "loss": 2.4606,
      "num_input_tokens_seen": 661670016,
      "step": 841
    },
    {
      "epoch": 0.08932739231911734,
      "grad_norm": 1.6496263019561757,
      "learning_rate": 4.999469626646835e-05,
      "loss": 2.4117,
      "num_input_tokens_seen": 662456784,
      "step": 842
    },
    {
      "epoch": 0.08943348185868873,
      "grad_norm": 3.4606672878013622,
      "learning_rate": 4.999468194224669e-05,
      "loss": 2.5152,
      "num_input_tokens_seen": 663243488,
      "step": 843
    },
    {
      "epoch": 0.08953957139826013,
      "grad_norm": 1.8972795341779685,
      "learning_rate": 4.9994667598709864e-05,
      "loss": 2.4669,
      "num_input_tokens_seen": 664030144,
      "step": 844
    },
    {
      "epoch": 0.08964566093783154,
      "grad_norm": 3.8666919971221203,
      "learning_rate": 4.9994653235857905e-05,
      "loss": 2.4956,
      "num_input_tokens_seen": 664816896,
      "step": 845
    },
    {
      "epoch": 0.08975175047740293,
      "grad_norm": 2.763219358453639,
      "learning_rate": 4.9994638853690804e-05,
      "loss": 2.4081,
      "num_input_tokens_seen": 665603664,
      "step": 846
    },
    {
      "epoch": 0.08985784001697433,
      "grad_norm": 2.2084296325086665,
      "learning_rate": 4.999462445220857e-05,
      "loss": 2.4017,
      "num_input_tokens_seen": 666390448,
      "step": 847
    },
    {
      "epoch": 0.08996392955654572,
      "grad_norm": 1.6721560610628625,
      "learning_rate": 4.999461003141123e-05,
      "loss": 2.2191,
      "num_input_tokens_seen": 667177200,
      "step": 848
    },
    {
      "epoch": 0.09007001909611713,
      "grad_norm": 1.6218056526760414,
      "learning_rate": 4.999459559129879e-05,
      "loss": 2.5328,
      "num_input_tokens_seen": 667963968,
      "step": 849
    },
    {
      "epoch": 0.09017610863568852,
      "grad_norm": 1.136541162043083,
      "learning_rate": 4.9994581131871265e-05,
      "loss": 2.4047,
      "num_input_tokens_seen": 668750736,
      "step": 850
    },
    {
      "epoch": 0.09028219817525993,
      "grad_norm": 2.3679220425703766,
      "learning_rate": 4.999456665312865e-05,
      "loss": 2.5438,
      "num_input_tokens_seen": 669537552,
      "step": 851
    },
    {
      "epoch": 0.09038828771483132,
      "grad_norm": 1.6875553925339979,
      "learning_rate": 4.999455215507097e-05,
      "loss": 2.2811,
      "num_input_tokens_seen": 670324352,
      "step": 852
    },
    {
      "epoch": 0.09049437725440272,
      "grad_norm": 1.9676539644021476,
      "learning_rate": 4.999453763769824e-05,
      "loss": 2.593,
      "num_input_tokens_seen": 671111024,
      "step": 853
    },
    {
      "epoch": 0.09060046679397411,
      "grad_norm": 1.5288970139180336,
      "learning_rate": 4.999452310101046e-05,
      "loss": 2.357,
      "num_input_tokens_seen": 671897792,
      "step": 854
    },
    {
      "epoch": 0.09070655633354552,
      "grad_norm": 2.0201217928862687,
      "learning_rate": 4.999450854500765e-05,
      "loss": 2.3339,
      "num_input_tokens_seen": 672684624,
      "step": 855
    },
    {
      "epoch": 0.09081264587311691,
      "grad_norm": 1.3147231165097801,
      "learning_rate": 4.9994493969689814e-05,
      "loss": 2.4212,
      "num_input_tokens_seen": 673471360,
      "step": 856
    },
    {
      "epoch": 0.09091873541268831,
      "grad_norm": 2.682826312818321,
      "learning_rate": 4.9994479375056966e-05,
      "loss": 2.4984,
      "num_input_tokens_seen": 674258048,
      "step": 857
    },
    {
      "epoch": 0.0910248249522597,
      "grad_norm": 2.0726889972220457,
      "learning_rate": 4.999446476110912e-05,
      "loss": 2.4728,
      "num_input_tokens_seen": 675044752,
      "step": 858
    },
    {
      "epoch": 0.09113091449183111,
      "grad_norm": 2.064847884995152,
      "learning_rate": 4.999445012784628e-05,
      "loss": 2.505,
      "num_input_tokens_seen": 675831616,
      "step": 859
    },
    {
      "epoch": 0.0912370040314025,
      "grad_norm": 2.1774314194856803,
      "learning_rate": 4.9994435475268465e-05,
      "loss": 2.5223,
      "num_input_tokens_seen": 676618336,
      "step": 860
    },
    {
      "epoch": 0.09134309357097391,
      "grad_norm": 1.9646989250333553,
      "learning_rate": 4.999442080337569e-05,
      "loss": 2.5233,
      "num_input_tokens_seen": 677405152,
      "step": 861
    },
    {
      "epoch": 0.0914491831105453,
      "grad_norm": 1.2261139559983323,
      "learning_rate": 4.999440611216795e-05,
      "loss": 2.4173,
      "num_input_tokens_seen": 678191904,
      "step": 862
    },
    {
      "epoch": 0.0915552726501167,
      "grad_norm": 1.8331402081065,
      "learning_rate": 4.999439140164527e-05,
      "loss": 2.4996,
      "num_input_tokens_seen": 678978688,
      "step": 863
    },
    {
      "epoch": 0.0916613621896881,
      "grad_norm": 1.2720419642544811,
      "learning_rate": 4.9994376671807666e-05,
      "loss": 2.6173,
      "num_input_tokens_seen": 679765392,
      "step": 864
    },
    {
      "epoch": 0.0917674517292595,
      "grad_norm": 2.4507545086994265,
      "learning_rate": 4.999436192265513e-05,
      "loss": 2.4829,
      "num_input_tokens_seen": 680552160,
      "step": 865
    },
    {
      "epoch": 0.09187354126883089,
      "grad_norm": 1.9545401651909136,
      "learning_rate": 4.999434715418768e-05,
      "loss": 2.6035,
      "num_input_tokens_seen": 681338864,
      "step": 866
    },
    {
      "epoch": 0.0919796308084023,
      "grad_norm": 1.7935492787231095,
      "learning_rate": 4.999433236640534e-05,
      "loss": 2.3379,
      "num_input_tokens_seen": 682125536,
      "step": 867
    },
    {
      "epoch": 0.09208572034797369,
      "grad_norm": 1.5178546176880157,
      "learning_rate": 4.999431755930812e-05,
      "loss": 2.1329,
      "num_input_tokens_seen": 682912416,
      "step": 868
    },
    {
      "epoch": 0.09219180988754509,
      "grad_norm": 1.6952234575392915,
      "learning_rate": 4.999430273289601e-05,
      "loss": 2.3524,
      "num_input_tokens_seen": 683699216,
      "step": 869
    },
    {
      "epoch": 0.09229789942711648,
      "grad_norm": 1.8410840153882977,
      "learning_rate": 4.999428788716905e-05,
      "loss": 2.5463,
      "num_input_tokens_seen": 684485984,
      "step": 870
    },
    {
      "epoch": 0.09240398896668789,
      "grad_norm": 1.9943743966190588,
      "learning_rate": 4.9994273022127234e-05,
      "loss": 2.273,
      "num_input_tokens_seen": 685272752,
      "step": 871
    },
    {
      "epoch": 0.09251007850625928,
      "grad_norm": 1.7761092389007422,
      "learning_rate": 4.9994258137770575e-05,
      "loss": 2.3816,
      "num_input_tokens_seen": 686059520,
      "step": 872
    },
    {
      "epoch": 0.09261616804583069,
      "grad_norm": 1.7484628189962608,
      "learning_rate": 4.9994243234099084e-05,
      "loss": 2.4393,
      "num_input_tokens_seen": 686846288,
      "step": 873
    },
    {
      "epoch": 0.09272225758540208,
      "grad_norm": 1.2379526905818048,
      "learning_rate": 4.9994228311112775e-05,
      "loss": 2.2496,
      "num_input_tokens_seen": 687633120,
      "step": 874
    },
    {
      "epoch": 0.09282834712497348,
      "grad_norm": 1.54046431309441,
      "learning_rate": 4.999421336881167e-05,
      "loss": 2.5111,
      "num_input_tokens_seen": 688419936,
      "step": 875
    },
    {
      "epoch": 0.09293443666454487,
      "grad_norm": 1.278087228530065,
      "learning_rate": 4.999419840719576e-05,
      "loss": 2.4834,
      "num_input_tokens_seen": 689206672,
      "step": 876
    },
    {
      "epoch": 0.09304052620411628,
      "grad_norm": 1.8151573865501074,
      "learning_rate": 4.999418342626507e-05,
      "loss": 2.3974,
      "num_input_tokens_seen": 689993472,
      "step": 877
    },
    {
      "epoch": 0.09314661574368767,
      "grad_norm": 1.764358867954206,
      "learning_rate": 4.999416842601961e-05,
      "loss": 2.4179,
      "num_input_tokens_seen": 690780208,
      "step": 878
    },
    {
      "epoch": 0.09325270528325907,
      "grad_norm": 1.3846054353542203,
      "learning_rate": 4.9994153406459386e-05,
      "loss": 2.4801,
      "num_input_tokens_seen": 691566976,
      "step": 879
    },
    {
      "epoch": 0.09335879482283047,
      "grad_norm": 1.3073289774061776,
      "learning_rate": 4.999413836758442e-05,
      "loss": 2.2938,
      "num_input_tokens_seen": 692353776,
      "step": 880
    },
    {
      "epoch": 0.09346488436240187,
      "grad_norm": 1.1138030419991278,
      "learning_rate": 4.999412330939471e-05,
      "loss": 2.5837,
      "num_input_tokens_seen": 693140624,
      "step": 881
    },
    {
      "epoch": 0.09357097390197326,
      "grad_norm": 1.2911494702366786,
      "learning_rate": 4.999410823189028e-05,
      "loss": 2.3694,
      "num_input_tokens_seen": 693927408,
      "step": 882
    },
    {
      "epoch": 0.09367706344154467,
      "grad_norm": 1.2020481856942777,
      "learning_rate": 4.999409313507113e-05,
      "loss": 2.42,
      "num_input_tokens_seen": 694714176,
      "step": 883
    },
    {
      "epoch": 0.09378315298111606,
      "grad_norm": 0.8621460865568771,
      "learning_rate": 4.999407801893729e-05,
      "loss": 2.127,
      "num_input_tokens_seen": 695501072,
      "step": 884
    },
    {
      "epoch": 0.09388924252068746,
      "grad_norm": 1.0604511902849247,
      "learning_rate": 4.999406288348874e-05,
      "loss": 2.4007,
      "num_input_tokens_seen": 696287808,
      "step": 885
    },
    {
      "epoch": 0.09399533206025885,
      "grad_norm": 1.2521965766919299,
      "learning_rate": 4.9994047728725536e-05,
      "loss": 2.3333,
      "num_input_tokens_seen": 697074624,
      "step": 886
    },
    {
      "epoch": 0.09410142159983026,
      "grad_norm": 2.011631881647487,
      "learning_rate": 4.9994032554647654e-05,
      "loss": 2.6881,
      "num_input_tokens_seen": 697861280,
      "step": 887
    },
    {
      "epoch": 0.09420751113940165,
      "grad_norm": 1.063005205431504,
      "learning_rate": 4.999401736125511e-05,
      "loss": 2.5053,
      "num_input_tokens_seen": 698648016,
      "step": 888
    },
    {
      "epoch": 0.09431360067897306,
      "grad_norm": 2.0065691144708118,
      "learning_rate": 4.999400214854793e-05,
      "loss": 2.4192,
      "num_input_tokens_seen": 699434736,
      "step": 889
    },
    {
      "epoch": 0.09441969021854445,
      "grad_norm": 1.4310076144375126,
      "learning_rate": 4.9993986916526117e-05,
      "loss": 2.4271,
      "num_input_tokens_seen": 700221504,
      "step": 890
    },
    {
      "epoch": 0.09452577975811585,
      "grad_norm": 1.493846876116834,
      "learning_rate": 4.999397166518969e-05,
      "loss": 2.2386,
      "num_input_tokens_seen": 701008288,
      "step": 891
    },
    {
      "epoch": 0.09463186929768724,
      "grad_norm": 1.2121068351157351,
      "learning_rate": 4.9993956394538645e-05,
      "loss": 2.4169,
      "num_input_tokens_seen": 701795072,
      "step": 892
    },
    {
      "epoch": 0.09473795883725865,
      "grad_norm": 1.6148135135412307,
      "learning_rate": 4.999394110457301e-05,
      "loss": 2.686,
      "num_input_tokens_seen": 702581808,
      "step": 893
    },
    {
      "epoch": 0.09484404837683004,
      "grad_norm": 1.1699578800651103,
      "learning_rate": 4.999392579529279e-05,
      "loss": 2.563,
      "num_input_tokens_seen": 703368416,
      "step": 894
    },
    {
      "epoch": 0.09495013791640144,
      "grad_norm": 1.3327758963954945,
      "learning_rate": 4.999391046669799e-05,
      "loss": 2.4894,
      "num_input_tokens_seen": 704155136,
      "step": 895
    },
    {
      "epoch": 0.09505622745597284,
      "grad_norm": 1.1318390625779395,
      "learning_rate": 4.999389511878864e-05,
      "loss": 2.2465,
      "num_input_tokens_seen": 704942016,
      "step": 896
    },
    {
      "epoch": 0.09516231699554424,
      "grad_norm": 1.013899992162697,
      "learning_rate": 4.999387975156474e-05,
      "loss": 2.3607,
      "num_input_tokens_seen": 705728784,
      "step": 897
    },
    {
      "epoch": 0.09526840653511563,
      "grad_norm": 1.9586263079918333,
      "learning_rate": 4.99938643650263e-05,
      "loss": 2.4465,
      "num_input_tokens_seen": 706515632,
      "step": 898
    },
    {
      "epoch": 0.09537449607468704,
      "grad_norm": 1.0321952615328998,
      "learning_rate": 4.999384895917334e-05,
      "loss": 2.5033,
      "num_input_tokens_seen": 707302368,
      "step": 899
    },
    {
      "epoch": 0.09548058561425843,
      "grad_norm": 2.0057037871611643,
      "learning_rate": 4.999383353400586e-05,
      "loss": 2.3393,
      "num_input_tokens_seen": 708089152,
      "step": 900
    },
    {
      "epoch": 0.09558667515382983,
      "grad_norm": 1.3602187827539824,
      "learning_rate": 4.999381808952388e-05,
      "loss": 2.4277,
      "num_input_tokens_seen": 708875968,
      "step": 901
    },
    {
      "epoch": 0.09569276469340122,
      "grad_norm": 1.8905973416216522,
      "learning_rate": 4.999380262572742e-05,
      "loss": 2.5159,
      "num_input_tokens_seen": 709662688,
      "step": 902
    },
    {
      "epoch": 0.09579885423297263,
      "grad_norm": 1.379040142396483,
      "learning_rate": 4.999378714261647e-05,
      "loss": 2.4976,
      "num_input_tokens_seen": 710449408,
      "step": 903
    },
    {
      "epoch": 0.09590494377254402,
      "grad_norm": 2.4355752452387165,
      "learning_rate": 4.9993771640191055e-05,
      "loss": 2.3154,
      "num_input_tokens_seen": 711236208,
      "step": 904
    },
    {
      "epoch": 0.09601103331211543,
      "grad_norm": 1.4488144221498698,
      "learning_rate": 4.99937561184512e-05,
      "loss": 2.3988,
      "num_input_tokens_seen": 712022992,
      "step": 905
    },
    {
      "epoch": 0.09611712285168682,
      "grad_norm": 2.1465097164426084,
      "learning_rate": 4.9993740577396886e-05,
      "loss": 2.4025,
      "num_input_tokens_seen": 712809712,
      "step": 906
    },
    {
      "epoch": 0.09622321239125822,
      "grad_norm": 1.492502964529578,
      "learning_rate": 4.999372501702815e-05,
      "loss": 2.4747,
      "num_input_tokens_seen": 713596496,
      "step": 907
    },
    {
      "epoch": 0.09632930193082961,
      "grad_norm": 1.2873447972171792,
      "learning_rate": 4.9993709437345005e-05,
      "loss": 2.4112,
      "num_input_tokens_seen": 714383216,
      "step": 908
    },
    {
      "epoch": 0.09643539147040102,
      "grad_norm": 1.4057998171510195,
      "learning_rate": 4.999369383834745e-05,
      "loss": 2.6434,
      "num_input_tokens_seen": 715170000,
      "step": 909
    },
    {
      "epoch": 0.09654148100997241,
      "grad_norm": 0.9549083384352508,
      "learning_rate": 4.999367822003549e-05,
      "loss": 2.4313,
      "num_input_tokens_seen": 715956784,
      "step": 910
    },
    {
      "epoch": 0.09664757054954382,
      "grad_norm": 1.035529567664432,
      "learning_rate": 4.999366258240916e-05,
      "loss": 2.3313,
      "num_input_tokens_seen": 716743632,
      "step": 911
    },
    {
      "epoch": 0.0967536600891152,
      "grad_norm": 1.2447212343009302,
      "learning_rate": 4.9993646925468464e-05,
      "loss": 2.4608,
      "num_input_tokens_seen": 717530464,
      "step": 912
    },
    {
      "epoch": 0.09685974962868661,
      "grad_norm": 1.3683328081660877,
      "learning_rate": 4.9993631249213404e-05,
      "loss": 2.2519,
      "num_input_tokens_seen": 718317328,
      "step": 913
    },
    {
      "epoch": 0.096965839168258,
      "grad_norm": 0.7648748550123636,
      "learning_rate": 4.9993615553644e-05,
      "loss": 2.3208,
      "num_input_tokens_seen": 719104112,
      "step": 914
    },
    {
      "epoch": 0.09707192870782941,
      "grad_norm": 1.6775471788467238,
      "learning_rate": 4.999359983876026e-05,
      "loss": 2.505,
      "num_input_tokens_seen": 719890976,
      "step": 915
    },
    {
      "epoch": 0.09717801824740081,
      "grad_norm": 1.1152976413472375,
      "learning_rate": 4.999358410456221e-05,
      "loss": 2.3652,
      "num_input_tokens_seen": 720677728,
      "step": 916
    },
    {
      "epoch": 0.0972841077869722,
      "grad_norm": 1.1294080947184533,
      "learning_rate": 4.9993568351049845e-05,
      "loss": 2.5191,
      "num_input_tokens_seen": 721464576,
      "step": 917
    },
    {
      "epoch": 0.09739019732654361,
      "grad_norm": 1.4040520910852845,
      "learning_rate": 4.999355257822318e-05,
      "loss": 2.3138,
      "num_input_tokens_seen": 722251344,
      "step": 918
    },
    {
      "epoch": 0.097496286866115,
      "grad_norm": 1.5155110420576166,
      "learning_rate": 4.999353678608224e-05,
      "loss": 2.3993,
      "num_input_tokens_seen": 723038128,
      "step": 919
    },
    {
      "epoch": 0.0976023764056864,
      "grad_norm": 1.3196646339710425,
      "learning_rate": 4.9993520974627026e-05,
      "loss": 2.3442,
      "num_input_tokens_seen": 723825040,
      "step": 920
    },
    {
      "epoch": 0.0977084659452578,
      "grad_norm": 0.7742294184164509,
      "learning_rate": 4.999350514385755e-05,
      "loss": 2.3491,
      "num_input_tokens_seen": 724611824,
      "step": 921
    },
    {
      "epoch": 0.0978145554848292,
      "grad_norm": 1.3569107441328367,
      "learning_rate": 4.999348929377382e-05,
      "loss": 2.2325,
      "num_input_tokens_seen": 725398672,
      "step": 922
    },
    {
      "epoch": 0.0979206450244006,
      "grad_norm": 0.8110081785020168,
      "learning_rate": 4.999347342437587e-05,
      "loss": 2.5236,
      "num_input_tokens_seen": 726185408,
      "step": 923
    },
    {
      "epoch": 0.098026734563972,
      "grad_norm": 1.0067201453580314,
      "learning_rate": 4.999345753566369e-05,
      "loss": 2.4983,
      "num_input_tokens_seen": 726972144,
      "step": 924
    },
    {
      "epoch": 0.09813282410354339,
      "grad_norm": 1.0662941607496887,
      "learning_rate": 4.999344162763729e-05,
      "loss": 2.3052,
      "num_input_tokens_seen": 727758912,
      "step": 925
    },
    {
      "epoch": 0.0982389136431148,
      "grad_norm": 0.7144793886855207,
      "learning_rate": 4.99934257002967e-05,
      "loss": 2.339,
      "num_input_tokens_seen": 728545664,
      "step": 926
    },
    {
      "epoch": 0.09834500318268619,
      "grad_norm": 1.1888619504081779,
      "learning_rate": 4.9993409753641926e-05,
      "loss": 2.4515,
      "num_input_tokens_seen": 729332416,
      "step": 927
    },
    {
      "epoch": 0.09845109272225759,
      "grad_norm": 1.5068688351381023,
      "learning_rate": 4.999339378767297e-05,
      "loss": 2.4214,
      "num_input_tokens_seen": 730119168,
      "step": 928
    },
    {
      "epoch": 0.09855718226182898,
      "grad_norm": 1.4591074112955562,
      "learning_rate": 4.9993377802389864e-05,
      "loss": 2.6216,
      "num_input_tokens_seen": 730905888,
      "step": 929
    },
    {
      "epoch": 0.09866327180140039,
      "grad_norm": 1.0166404717248905,
      "learning_rate": 4.9993361797792606e-05,
      "loss": 2.5596,
      "num_input_tokens_seen": 731692624,
      "step": 930
    },
    {
      "epoch": 0.09876936134097178,
      "grad_norm": 0.7636521116977704,
      "learning_rate": 4.999334577388121e-05,
      "loss": 2.4252,
      "num_input_tokens_seen": 732479440,
      "step": 931
    },
    {
      "epoch": 0.09887545088054318,
      "grad_norm": 1.2724492176892772,
      "learning_rate": 4.999332973065568e-05,
      "loss": 2.4868,
      "num_input_tokens_seen": 733266176,
      "step": 932
    },
    {
      "epoch": 0.09898154042011457,
      "grad_norm": 1.232378420860763,
      "learning_rate": 4.999331366811605e-05,
      "loss": 2.4002,
      "num_input_tokens_seen": 734052880,
      "step": 933
    },
    {
      "epoch": 0.09908762995968598,
      "grad_norm": 1.1187586104035019,
      "learning_rate": 4.9993297586262314e-05,
      "loss": 2.2517,
      "num_input_tokens_seen": 734839648,
      "step": 934
    },
    {
      "epoch": 0.09919371949925737,
      "grad_norm": 0.9500466090994588,
      "learning_rate": 4.99932814850945e-05,
      "loss": 2.285,
      "num_input_tokens_seen": 735626416,
      "step": 935
    },
    {
      "epoch": 0.09929980903882878,
      "grad_norm": 1.092636678047116,
      "learning_rate": 4.99932653646126e-05,
      "loss": 2.1531,
      "num_input_tokens_seen": 736413248,
      "step": 936
    },
    {
      "epoch": 0.09940589857840017,
      "grad_norm": 1.0584142666257572,
      "learning_rate": 4.999324922481664e-05,
      "loss": 2.3548,
      "num_input_tokens_seen": 737200032,
      "step": 937
    },
    {
      "epoch": 0.09951198811797157,
      "grad_norm": 0.7898797781480231,
      "learning_rate": 4.9993233065706634e-05,
      "loss": 2.231,
      "num_input_tokens_seen": 737986784,
      "step": 938
    },
    {
      "epoch": 0.09961807765754296,
      "grad_norm": 0.8463079519188581,
      "learning_rate": 4.9993216887282596e-05,
      "loss": 2.1977,
      "num_input_tokens_seen": 738773616,
      "step": 939
    },
    {
      "epoch": 0.09972416719711437,
      "grad_norm": 0.6780404258699444,
      "learning_rate": 4.9993200689544526e-05,
      "loss": 2.315,
      "num_input_tokens_seen": 739560432,
      "step": 940
    },
    {
      "epoch": 0.09983025673668576,
      "grad_norm": 0.8233589948268236,
      "learning_rate": 4.999318447249245e-05,
      "loss": 2.3958,
      "num_input_tokens_seen": 740347184,
      "step": 941
    },
    {
      "epoch": 0.09993634627625717,
      "grad_norm": 0.8066891514536317,
      "learning_rate": 4.9993168236126365e-05,
      "loss": 2.3125,
      "num_input_tokens_seen": 741133936,
      "step": 942
    },
    {
      "epoch": 0.10004243581582856,
      "grad_norm": 0.934565090125142,
      "learning_rate": 4.9993151980446295e-05,
      "loss": 2.6678,
      "num_input_tokens_seen": 741920704,
      "step": 943
    },
    {
      "epoch": 0.10014852535539996,
      "grad_norm": 1.8300722598379549,
      "learning_rate": 4.9993135705452254e-05,
      "loss": 2.425,
      "num_input_tokens_seen": 742707408,
      "step": 944
    },
    {
      "epoch": 0.10025461489497135,
      "grad_norm": 0.9907261438012637,
      "learning_rate": 4.999311941114425e-05,
      "loss": 2.3923,
      "num_input_tokens_seen": 743494192,
      "step": 945
    },
    {
      "epoch": 0.10036070443454276,
      "grad_norm": 1.9157284194677864,
      "learning_rate": 4.99931030975223e-05,
      "loss": 2.3287,
      "num_input_tokens_seen": 744280912,
      "step": 946
    },
    {
      "epoch": 0.10046679397411415,
      "grad_norm": 1.5038254961061512,
      "learning_rate": 4.999308676458641e-05,
      "loss": 2.3719,
      "num_input_tokens_seen": 745067664,
      "step": 947
    },
    {
      "epoch": 0.10057288351368555,
      "grad_norm": 1.6697856588671447,
      "learning_rate": 4.999307041233659e-05,
      "loss": 2.2126,
      "num_input_tokens_seen": 745854560,
      "step": 948
    },
    {
      "epoch": 0.10067897305325695,
      "grad_norm": 1.3887406944436707,
      "learning_rate": 4.999305404077287e-05,
      "loss": 2.3568,
      "num_input_tokens_seen": 746641296,
      "step": 949
    },
    {
      "epoch": 0.10078506259282835,
      "grad_norm": 1.1875794198607121,
      "learning_rate": 4.9993037649895246e-05,
      "loss": 2.2969,
      "num_input_tokens_seen": 747428032,
      "step": 950
    },
    {
      "epoch": 0.10089115213239974,
      "grad_norm": 1.3946592527892392,
      "learning_rate": 4.999302123970374e-05,
      "loss": 2.5304,
      "num_input_tokens_seen": 748214800,
      "step": 951
    },
    {
      "epoch": 0.10099724167197115,
      "grad_norm": 1.20025067746393,
      "learning_rate": 4.999300481019835e-05,
      "loss": 2.5006,
      "num_input_tokens_seen": 749001536,
      "step": 952
    },
    {
      "epoch": 0.10110333121154254,
      "grad_norm": 1.5020282424374605,
      "learning_rate": 4.9992988361379114e-05,
      "loss": 2.6431,
      "num_input_tokens_seen": 749788288,
      "step": 953
    },
    {
      "epoch": 0.10120942075111394,
      "grad_norm": 0.9810068547327608,
      "learning_rate": 4.999297189324602e-05,
      "loss": 2.472,
      "num_input_tokens_seen": 750575008,
      "step": 954
    },
    {
      "epoch": 0.10131551029068533,
      "grad_norm": 2.241528044108039,
      "learning_rate": 4.999295540579909e-05,
      "loss": 2.4384,
      "num_input_tokens_seen": 751361808,
      "step": 955
    },
    {
      "epoch": 0.10142159983025674,
      "grad_norm": 1.5393697646159237,
      "learning_rate": 4.9992938899038335e-05,
      "loss": 2.622,
      "num_input_tokens_seen": 752148480,
      "step": 956
    },
    {
      "epoch": 0.10152768936982813,
      "grad_norm": 2.1959171546858007,
      "learning_rate": 4.999292237296378e-05,
      "loss": 2.5421,
      "num_input_tokens_seen": 752935184,
      "step": 957
    },
    {
      "epoch": 0.10163377890939954,
      "grad_norm": 1.6085525709797983,
      "learning_rate": 4.999290582757542e-05,
      "loss": 2.4476,
      "num_input_tokens_seen": 753721984,
      "step": 958
    },
    {
      "epoch": 0.10173986844897093,
      "grad_norm": 1.6542392856138937,
      "learning_rate": 4.999288926287328e-05,
      "loss": 2.2692,
      "num_input_tokens_seen": 754508752,
      "step": 959
    },
    {
      "epoch": 0.10184595798854233,
      "grad_norm": 1.9656878294145874,
      "learning_rate": 4.9992872678857365e-05,
      "loss": 2.4229,
      "num_input_tokens_seen": 755295584,
      "step": 960
    },
    {
      "epoch": 0.10195204752811372,
      "grad_norm": 1.3232584604839157,
      "learning_rate": 4.999285607552769e-05,
      "loss": 2.4351,
      "num_input_tokens_seen": 756082368,
      "step": 961
    },
    {
      "epoch": 0.10205813706768513,
      "grad_norm": 1.5254988490274952,
      "learning_rate": 4.999283945288428e-05,
      "loss": 2.4857,
      "num_input_tokens_seen": 756869072,
      "step": 962
    },
    {
      "epoch": 0.10216422660725652,
      "grad_norm": 1.2024807386233392,
      "learning_rate": 4.9992822810927125e-05,
      "loss": 2.2556,
      "num_input_tokens_seen": 757655920,
      "step": 963
    },
    {
      "epoch": 0.10227031614682792,
      "grad_norm": 0.995151013953165,
      "learning_rate": 4.999280614965626e-05,
      "loss": 2.4292,
      "num_input_tokens_seen": 758442720,
      "step": 964
    },
    {
      "epoch": 0.10237640568639932,
      "grad_norm": 1.99863300775403,
      "learning_rate": 4.999278946907168e-05,
      "loss": 2.4976,
      "num_input_tokens_seen": 759229472,
      "step": 965
    },
    {
      "epoch": 0.10248249522597072,
      "grad_norm": 1.4089405936263262,
      "learning_rate": 4.9992772769173405e-05,
      "loss": 2.4773,
      "num_input_tokens_seen": 760016208,
      "step": 966
    },
    {
      "epoch": 0.10258858476554211,
      "grad_norm": 1.1548066891653639,
      "learning_rate": 4.999275604996145e-05,
      "loss": 2.4412,
      "num_input_tokens_seen": 760802912,
      "step": 967
    },
    {
      "epoch": 0.10269467430511352,
      "grad_norm": 2.2221718204135597,
      "learning_rate": 4.9992739311435834e-05,
      "loss": 2.2468,
      "num_input_tokens_seen": 761589584,
      "step": 968
    },
    {
      "epoch": 0.10280076384468491,
      "grad_norm": 1.0539960081093722,
      "learning_rate": 4.999272255359655e-05,
      "loss": 2.2457,
      "num_input_tokens_seen": 762376416,
      "step": 969
    },
    {
      "epoch": 0.10290685338425631,
      "grad_norm": 1.5939481303730216,
      "learning_rate": 4.999270577644363e-05,
      "loss": 2.3853,
      "num_input_tokens_seen": 763163248,
      "step": 970
    },
    {
      "epoch": 0.1030129429238277,
      "grad_norm": 2.053771146338223,
      "learning_rate": 4.999268897997708e-05,
      "loss": 2.4628,
      "num_input_tokens_seen": 763950016,
      "step": 971
    },
    {
      "epoch": 0.10311903246339911,
      "grad_norm": 1.237040413476309,
      "learning_rate": 4.999267216419691e-05,
      "loss": 2.543,
      "num_input_tokens_seen": 764736768,
      "step": 972
    },
    {
      "epoch": 0.1032251220029705,
      "grad_norm": 1.4579971878593945,
      "learning_rate": 4.999265532910314e-05,
      "loss": 2.3084,
      "num_input_tokens_seen": 765523552,
      "step": 973
    },
    {
      "epoch": 0.1033312115425419,
      "grad_norm": 1.3404590967067431,
      "learning_rate": 4.999263847469578e-05,
      "loss": 2.368,
      "num_input_tokens_seen": 766310288,
      "step": 974
    },
    {
      "epoch": 0.1034373010821133,
      "grad_norm": 1.6795769435777888,
      "learning_rate": 4.999262160097484e-05,
      "loss": 2.477,
      "num_input_tokens_seen": 767097008,
      "step": 975
    },
    {
      "epoch": 0.1035433906216847,
      "grad_norm": 1.716228671963232,
      "learning_rate": 4.9992604707940336e-05,
      "loss": 2.4939,
      "num_input_tokens_seen": 767883728,
      "step": 976
    },
    {
      "epoch": 0.1036494801612561,
      "grad_norm": 0.8895537641251479,
      "learning_rate": 4.999258779559228e-05,
      "loss": 2.4394,
      "num_input_tokens_seen": 768670496,
      "step": 977
    },
    {
      "epoch": 0.1037555697008275,
      "grad_norm": 1.2125091765810998,
      "learning_rate": 4.999257086393069e-05,
      "loss": 2.4444,
      "num_input_tokens_seen": 769457168,
      "step": 978
    },
    {
      "epoch": 0.10386165924039889,
      "grad_norm": 1.16188966188473,
      "learning_rate": 4.999255391295557e-05,
      "loss": 2.2785,
      "num_input_tokens_seen": 770243968,
      "step": 979
    },
    {
      "epoch": 0.1039677487799703,
      "grad_norm": 2.0774649201651885,
      "learning_rate": 4.9992536942666936e-05,
      "loss": 2.4819,
      "num_input_tokens_seen": 771030608,
      "step": 980
    },
    {
      "epoch": 0.10407383831954169,
      "grad_norm": 1.264748387195109,
      "learning_rate": 4.999251995306481e-05,
      "loss": 2.5133,
      "num_input_tokens_seen": 771817520,
      "step": 981
    },
    {
      "epoch": 0.10417992785911309,
      "grad_norm": 2.521494442749585,
      "learning_rate": 4.999250294414919e-05,
      "loss": 2.4875,
      "num_input_tokens_seen": 772604272,
      "step": 982
    },
    {
      "epoch": 0.10428601739868448,
      "grad_norm": 1.4353989316677986,
      "learning_rate": 4.9992485915920096e-05,
      "loss": 2.327,
      "num_input_tokens_seen": 773391120,
      "step": 983
    },
    {
      "epoch": 0.10439210693825589,
      "grad_norm": 2.186167904973447,
      "learning_rate": 4.999246886837755e-05,
      "loss": 2.5148,
      "num_input_tokens_seen": 774177872,
      "step": 984
    },
    {
      "epoch": 0.1044981964778273,
      "grad_norm": 1.6688100820085137,
      "learning_rate": 4.9992451801521554e-05,
      "loss": 2.4619,
      "num_input_tokens_seen": 774964608,
      "step": 985
    },
    {
      "epoch": 0.10460428601739868,
      "grad_norm": 2.165354283592241,
      "learning_rate": 4.999243471535212e-05,
      "loss": 2.3718,
      "num_input_tokens_seen": 775751312,
      "step": 986
    },
    {
      "epoch": 0.10471037555697009,
      "grad_norm": 1.4106982707937439,
      "learning_rate": 4.999241760986927e-05,
      "loss": 2.408,
      "num_input_tokens_seen": 776538016,
      "step": 987
    },
    {
      "epoch": 0.10481646509654148,
      "grad_norm": 2.7678743684551668,
      "learning_rate": 4.9992400485073013e-05,
      "loss": 2.4272,
      "num_input_tokens_seen": 777324704,
      "step": 988
    },
    {
      "epoch": 0.10492255463611289,
      "grad_norm": 2.038943364506112,
      "learning_rate": 4.999238334096337e-05,
      "loss": 2.4859,
      "num_input_tokens_seen": 778111536,
      "step": 989
    },
    {
      "epoch": 0.10502864417568428,
      "grad_norm": 2.240901342691607,
      "learning_rate": 4.9992366177540335e-05,
      "loss": 2.4227,
      "num_input_tokens_seen": 778898320,
      "step": 990
    },
    {
      "epoch": 0.10513473371525568,
      "grad_norm": 2.44982803661038,
      "learning_rate": 4.999234899480394e-05,
      "loss": 2.2186,
      "num_input_tokens_seen": 779684992,
      "step": 991
    },
    {
      "epoch": 0.10524082325482707,
      "grad_norm": 1.5702462521212457,
      "learning_rate": 4.9992331792754185e-05,
      "loss": 2.4829,
      "num_input_tokens_seen": 780471712,
      "step": 992
    },
    {
      "epoch": 0.10534691279439848,
      "grad_norm": 1.7520297324822784,
      "learning_rate": 4.999231457139108e-05,
      "loss": 2.3571,
      "num_input_tokens_seen": 781258416,
      "step": 993
    },
    {
      "epoch": 0.10545300233396987,
      "grad_norm": 1.337699554529211,
      "learning_rate": 4.999229733071467e-05,
      "loss": 2.3237,
      "num_input_tokens_seen": 782045200,
      "step": 994
    },
    {
      "epoch": 0.10555909187354127,
      "grad_norm": 1.3988114213379452,
      "learning_rate": 4.999228007072493e-05,
      "loss": 2.2921,
      "num_input_tokens_seen": 782832096,
      "step": 995
    },
    {
      "epoch": 0.10566518141311267,
      "grad_norm": 1.1524832760105355,
      "learning_rate": 4.9992262791421895e-05,
      "loss": 2.4067,
      "num_input_tokens_seen": 783618816,
      "step": 996
    },
    {
      "epoch": 0.10577127095268407,
      "grad_norm": 1.4284753729251727,
      "learning_rate": 4.999224549280558e-05,
      "loss": 2.4502,
      "num_input_tokens_seen": 784405568,
      "step": 997
    },
    {
      "epoch": 0.10587736049225546,
      "grad_norm": 0.7947006997126317,
      "learning_rate": 4.999222817487598e-05,
      "loss": 2.3287,
      "num_input_tokens_seen": 785192368,
      "step": 998
    },
    {
      "epoch": 0.10598345003182687,
      "grad_norm": 0.9562175821308343,
      "learning_rate": 4.9992210837633124e-05,
      "loss": 2.4587,
      "num_input_tokens_seen": 785979120,
      "step": 999
    },
    {
      "epoch": 0.10608953957139826,
      "grad_norm": 0.9614059117357061,
      "learning_rate": 4.999219348107702e-05,
      "loss": 2.228,
      "num_input_tokens_seen": 786765952,
      "step": 1000
    },
    {
      "epoch": 0.10608953957139826,
      "eval_loss": 2.3398306369781494,
      "eval_runtime": 68.1872,
      "eval_samples_per_second": 43.997,
      "eval_steps_per_second": 0.469,
      "num_input_tokens_seen": 786765952,
      "step": 1000
    },
    {
      "epoch": 0.10619562911096966,
      "grad_norm": 0.9245344719411348,
      "learning_rate": 4.999217610520768e-05,
      "loss": 2.4553,
      "num_input_tokens_seen": 787552704,
      "step": 1001
    },
    {
      "epoch": 0.10630171865054105,
      "grad_norm": 1.3404078202829175,
      "learning_rate": 4.9992158710025115e-05,
      "loss": 2.3412,
      "num_input_tokens_seen": 788339440,
      "step": 1002
    },
    {
      "epoch": 0.10640780819011246,
      "grad_norm": 0.7767427013360464,
      "learning_rate": 4.999214129552935e-05,
      "loss": 2.5541,
      "num_input_tokens_seen": 789126160,
      "step": 1003
    },
    {
      "epoch": 0.10651389772968385,
      "grad_norm": 1.6075893779526937,
      "learning_rate": 4.99921238617204e-05,
      "loss": 2.4588,
      "num_input_tokens_seen": 789912912,
      "step": 1004
    },
    {
      "epoch": 0.10661998726925526,
      "grad_norm": 0.7726210069436219,
      "learning_rate": 4.999210640859825e-05,
      "loss": 2.305,
      "num_input_tokens_seen": 790699648,
      "step": 1005
    },
    {
      "epoch": 0.10672607680882665,
      "grad_norm": 1.2949992057978854,
      "learning_rate": 4.999208893616295e-05,
      "loss": 2.2388,
      "num_input_tokens_seen": 791486384,
      "step": 1006
    },
    {
      "epoch": 0.10683216634839805,
      "grad_norm": 1.2736384613228116,
      "learning_rate": 4.999207144441449e-05,
      "loss": 2.2873,
      "num_input_tokens_seen": 792273136,
      "step": 1007
    },
    {
      "epoch": 0.10693825588796944,
      "grad_norm": 0.8463152792695452,
      "learning_rate": 4.999205393335289e-05,
      "loss": 2.3019,
      "num_input_tokens_seen": 793059856,
      "step": 1008
    },
    {
      "epoch": 0.10704434542754085,
      "grad_norm": 1.0918054696643025,
      "learning_rate": 4.999203640297817e-05,
      "loss": 2.4375,
      "num_input_tokens_seen": 793846688,
      "step": 1009
    },
    {
      "epoch": 0.10715043496711224,
      "grad_norm": 1.1660135387315071,
      "learning_rate": 4.999201885329033e-05,
      "loss": 2.3788,
      "num_input_tokens_seen": 794633504,
      "step": 1010
    },
    {
      "epoch": 0.10725652450668365,
      "grad_norm": 0.7606184676925127,
      "learning_rate": 4.999200128428939e-05,
      "loss": 2.3921,
      "num_input_tokens_seen": 795420192,
      "step": 1011
    },
    {
      "epoch": 0.10736261404625504,
      "grad_norm": 0.7822716575384493,
      "learning_rate": 4.9991983695975374e-05,
      "loss": 2.4471,
      "num_input_tokens_seen": 796206960,
      "step": 1012
    },
    {
      "epoch": 0.10746870358582644,
      "grad_norm": 0.8780726625682801,
      "learning_rate": 4.9991966088348286e-05,
      "loss": 2.4479,
      "num_input_tokens_seen": 796993760,
      "step": 1013
    },
    {
      "epoch": 0.10757479312539783,
      "grad_norm": 0.9323927274015094,
      "learning_rate": 4.9991948461408136e-05,
      "loss": 2.3747,
      "num_input_tokens_seen": 797780480,
      "step": 1014
    },
    {
      "epoch": 0.10768088266496924,
      "grad_norm": 1.1773674280479056,
      "learning_rate": 4.999193081515494e-05,
      "loss": 2.3919,
      "num_input_tokens_seen": 798567328,
      "step": 1015
    },
    {
      "epoch": 0.10778697220454063,
      "grad_norm": 0.8438246374072857,
      "learning_rate": 4.999191314958871e-05,
      "loss": 2.2896,
      "num_input_tokens_seen": 799354160,
      "step": 1016
    },
    {
      "epoch": 0.10789306174411203,
      "grad_norm": 1.2790683378071406,
      "learning_rate": 4.999189546470947e-05,
      "loss": 2.4743,
      "num_input_tokens_seen": 800140848,
      "step": 1017
    },
    {
      "epoch": 0.10799915128368343,
      "grad_norm": 1.1099979819817638,
      "learning_rate": 4.999187776051722e-05,
      "loss": 2.3377,
      "num_input_tokens_seen": 800927664,
      "step": 1018
    },
    {
      "epoch": 0.10810524082325483,
      "grad_norm": 1.0950498345998432,
      "learning_rate": 4.999186003701198e-05,
      "loss": 2.3108,
      "num_input_tokens_seen": 801714496,
      "step": 1019
    },
    {
      "epoch": 0.10821133036282622,
      "grad_norm": 1.065899313154258,
      "learning_rate": 4.9991842294193766e-05,
      "loss": 2.3853,
      "num_input_tokens_seen": 802501296,
      "step": 1020
    },
    {
      "epoch": 0.10831741990239763,
      "grad_norm": 1.323067302787554,
      "learning_rate": 4.999182453206259e-05,
      "loss": 2.3883,
      "num_input_tokens_seen": 803288016,
      "step": 1021
    },
    {
      "epoch": 0.10842350944196902,
      "grad_norm": 0.7862504682780141,
      "learning_rate": 4.9991806750618474e-05,
      "loss": 2.3802,
      "num_input_tokens_seen": 804074832,
      "step": 1022
    },
    {
      "epoch": 0.10852959898154042,
      "grad_norm": 0.953494939374485,
      "learning_rate": 4.999178894986142e-05,
      "loss": 2.3622,
      "num_input_tokens_seen": 804861632,
      "step": 1023
    },
    {
      "epoch": 0.10863568852111181,
      "grad_norm": 2.452656731184519,
      "learning_rate": 4.999177112979143e-05,
      "loss": 2.5001,
      "num_input_tokens_seen": 805648496,
      "step": 1024
    },
    {
      "epoch": 0.10874177806068322,
      "grad_norm": 1.2038481940921548,
      "learning_rate": 4.999175329040855e-05,
      "loss": 2.327,
      "num_input_tokens_seen": 806435296,
      "step": 1025
    },
    {
      "epoch": 0.10884786760025461,
      "grad_norm": 3.5032687904154605,
      "learning_rate": 4.9991735431712764e-05,
      "loss": 2.4405,
      "num_input_tokens_seen": 807222144,
      "step": 1026
    },
    {
      "epoch": 0.10895395713982602,
      "grad_norm": 4.215296908195149,
      "learning_rate": 4.999171755370411e-05,
      "loss": 2.5624,
      "num_input_tokens_seen": 808008864,
      "step": 1027
    },
    {
      "epoch": 0.10906004667939741,
      "grad_norm": 1.1375265439571414,
      "learning_rate": 4.999169965638258e-05,
      "loss": 2.1117,
      "num_input_tokens_seen": 808795616,
      "step": 1028
    },
    {
      "epoch": 0.10916613621896881,
      "grad_norm": 2.150814913358499,
      "learning_rate": 4.99916817397482e-05,
      "loss": 2.4421,
      "num_input_tokens_seen": 809582352,
      "step": 1029
    },
    {
      "epoch": 0.1092722257585402,
      "grad_norm": 1.393830306761471,
      "learning_rate": 4.999166380380098e-05,
      "loss": 2.2399,
      "num_input_tokens_seen": 810369136,
      "step": 1030
    },
    {
      "epoch": 0.10937831529811161,
      "grad_norm": 1.2407979640291804,
      "learning_rate": 4.9991645848540944e-05,
      "loss": 2.2628,
      "num_input_tokens_seen": 811155984,
      "step": 1031
    },
    {
      "epoch": 0.109484404837683,
      "grad_norm": 1.5581595421469197,
      "learning_rate": 4.999162787396809e-05,
      "loss": 2.3164,
      "num_input_tokens_seen": 811942816,
      "step": 1032
    },
    {
      "epoch": 0.1095904943772544,
      "grad_norm": 1.105954584483981,
      "learning_rate": 4.9991609880082434e-05,
      "loss": 2.4555,
      "num_input_tokens_seen": 812729648,
      "step": 1033
    },
    {
      "epoch": 0.1096965839168258,
      "grad_norm": 1.924450059373044,
      "learning_rate": 4.999159186688401e-05,
      "loss": 2.4802,
      "num_input_tokens_seen": 813516432,
      "step": 1034
    },
    {
      "epoch": 0.1098026734563972,
      "grad_norm": 1.0782455932965378,
      "learning_rate": 4.9991573834372804e-05,
      "loss": 2.0934,
      "num_input_tokens_seen": 814303248,
      "step": 1035
    },
    {
      "epoch": 0.10990876299596859,
      "grad_norm": 1.367737462285215,
      "learning_rate": 4.999155578254885e-05,
      "loss": 2.3884,
      "num_input_tokens_seen": 815090000,
      "step": 1036
    },
    {
      "epoch": 0.11001485253554,
      "grad_norm": 1.371449283522172,
      "learning_rate": 4.999153771141215e-05,
      "loss": 2.3651,
      "num_input_tokens_seen": 815876768,
      "step": 1037
    },
    {
      "epoch": 0.11012094207511139,
      "grad_norm": 1.1749122083104009,
      "learning_rate": 4.999151962096273e-05,
      "loss": 2.208,
      "num_input_tokens_seen": 816663568,
      "step": 1038
    },
    {
      "epoch": 0.1102270316146828,
      "grad_norm": 0.9558902578951367,
      "learning_rate": 4.9991501511200586e-05,
      "loss": 2.3937,
      "num_input_tokens_seen": 817450352,
      "step": 1039
    },
    {
      "epoch": 0.11033312115425419,
      "grad_norm": 1.4143509307544009,
      "learning_rate": 4.999148338212576e-05,
      "loss": 2.4152,
      "num_input_tokens_seen": 818237136,
      "step": 1040
    },
    {
      "epoch": 0.11043921069382559,
      "grad_norm": 1.4049990483145864,
      "learning_rate": 4.9991465233738235e-05,
      "loss": 2.5838,
      "num_input_tokens_seen": 819023824,
      "step": 1041
    },
    {
      "epoch": 0.11054530023339698,
      "grad_norm": 0.8850302009432237,
      "learning_rate": 4.999144706603804e-05,
      "loss": 2.4143,
      "num_input_tokens_seen": 819810608,
      "step": 1042
    },
    {
      "epoch": 0.11065138977296839,
      "grad_norm": 1.2400163675296971,
      "learning_rate": 4.999142887902519e-05,
      "loss": 2.3817,
      "num_input_tokens_seen": 820597360,
      "step": 1043
    },
    {
      "epoch": 0.11075747931253978,
      "grad_norm": 1.0368343714883423,
      "learning_rate": 4.99914106726997e-05,
      "loss": 2.3741,
      "num_input_tokens_seen": 821384032,
      "step": 1044
    },
    {
      "epoch": 0.11086356885211118,
      "grad_norm": 0.7785536687699595,
      "learning_rate": 4.999139244706158e-05,
      "loss": 2.1628,
      "num_input_tokens_seen": 822170800,
      "step": 1045
    },
    {
      "epoch": 0.11096965839168257,
      "grad_norm": 1.240568650687742,
      "learning_rate": 4.999137420211084e-05,
      "loss": 2.3797,
      "num_input_tokens_seen": 822957632,
      "step": 1046
    },
    {
      "epoch": 0.11107574793125398,
      "grad_norm": 1.7189811750834183,
      "learning_rate": 4.9991355937847504e-05,
      "loss": 2.6146,
      "num_input_tokens_seen": 823744336,
      "step": 1047
    },
    {
      "epoch": 0.11118183747082537,
      "grad_norm": 0.8872852682482879,
      "learning_rate": 4.9991337654271584e-05,
      "loss": 2.364,
      "num_input_tokens_seen": 824531200,
      "step": 1048
    },
    {
      "epoch": 0.11128792701039678,
      "grad_norm": 0.9554407998293148,
      "learning_rate": 4.999131935138309e-05,
      "loss": 2.4085,
      "num_input_tokens_seen": 825317936,
      "step": 1049
    },
    {
      "epoch": 0.11139401654996817,
      "grad_norm": 0.8111113782691348,
      "learning_rate": 4.999130102918203e-05,
      "loss": 2.325,
      "num_input_tokens_seen": 826104672,
      "step": 1050
    },
    {
      "epoch": 0.11150010608953957,
      "grad_norm": 1.002864737181611,
      "learning_rate": 4.9991282687668436e-05,
      "loss": 2.26,
      "num_input_tokens_seen": 826891392,
      "step": 1051
    },
    {
      "epoch": 0.11160619562911096,
      "grad_norm": 1.178418614078108,
      "learning_rate": 4.999126432684231e-05,
      "loss": 2.4012,
      "num_input_tokens_seen": 827678096,
      "step": 1052
    },
    {
      "epoch": 0.11171228516868237,
      "grad_norm": 1.1776694445980385,
      "learning_rate": 4.9991245946703666e-05,
      "loss": 2.3336,
      "num_input_tokens_seen": 828464912,
      "step": 1053
    },
    {
      "epoch": 0.11181837470825376,
      "grad_norm": 1.0236107561860814,
      "learning_rate": 4.999122754725252e-05,
      "loss": 2.569,
      "num_input_tokens_seen": 829251632,
      "step": 1054
    },
    {
      "epoch": 0.11192446424782516,
      "grad_norm": 1.298416885492393,
      "learning_rate": 4.999120912848889e-05,
      "loss": 2.4044,
      "num_input_tokens_seen": 830038352,
      "step": 1055
    },
    {
      "epoch": 0.11203055378739657,
      "grad_norm": 0.9014111771004921,
      "learning_rate": 4.9991190690412784e-05,
      "loss": 2.3112,
      "num_input_tokens_seen": 830825120,
      "step": 1056
    },
    {
      "epoch": 0.11213664332696796,
      "grad_norm": 1.4282720615392146,
      "learning_rate": 4.999117223302422e-05,
      "loss": 2.3286,
      "num_input_tokens_seen": 831611840,
      "step": 1057
    },
    {
      "epoch": 0.11224273286653937,
      "grad_norm": 1.5918326224623767,
      "learning_rate": 4.999115375632321e-05,
      "loss": 2.3186,
      "num_input_tokens_seen": 832398592,
      "step": 1058
    },
    {
      "epoch": 0.11234882240611076,
      "grad_norm": 0.6112021325765303,
      "learning_rate": 4.999113526030977e-05,
      "loss": 2.2257,
      "num_input_tokens_seen": 833185376,
      "step": 1059
    },
    {
      "epoch": 0.11245491194568216,
      "grad_norm": 0.7985504963340225,
      "learning_rate": 4.9991116744983916e-05,
      "loss": 2.4154,
      "num_input_tokens_seen": 833972144,
      "step": 1060
    },
    {
      "epoch": 0.11256100148525355,
      "grad_norm": 0.9616887936565417,
      "learning_rate": 4.9991098210345655e-05,
      "loss": 2.3449,
      "num_input_tokens_seen": 834758928,
      "step": 1061
    },
    {
      "epoch": 0.11266709102482496,
      "grad_norm": 1.327040005387681,
      "learning_rate": 4.9991079656395015e-05,
      "loss": 2.4599,
      "num_input_tokens_seen": 835545648,
      "step": 1062
    },
    {
      "epoch": 0.11277318056439635,
      "grad_norm": 0.7765387738715818,
      "learning_rate": 4.9991061083132e-05,
      "loss": 2.2598,
      "num_input_tokens_seen": 836332432,
      "step": 1063
    },
    {
      "epoch": 0.11287927010396775,
      "grad_norm": 0.7654007127347857,
      "learning_rate": 4.9991042490556615e-05,
      "loss": 2.2391,
      "num_input_tokens_seen": 837119216,
      "step": 1064
    },
    {
      "epoch": 0.11298535964353915,
      "grad_norm": 1.7199769503425817,
      "learning_rate": 4.9991023878668895e-05,
      "loss": 2.1547,
      "num_input_tokens_seen": 837905920,
      "step": 1065
    },
    {
      "epoch": 0.11309144918311055,
      "grad_norm": 1.1044852050836595,
      "learning_rate": 4.9991005247468844e-05,
      "loss": 2.3712,
      "num_input_tokens_seen": 838692688,
      "step": 1066
    },
    {
      "epoch": 0.11319753872268194,
      "grad_norm": 1.4584313699973337,
      "learning_rate": 4.999098659695648e-05,
      "loss": 2.3648,
      "num_input_tokens_seen": 839479504,
      "step": 1067
    },
    {
      "epoch": 0.11330362826225335,
      "grad_norm": 1.2786423816989674,
      "learning_rate": 4.999096792713182e-05,
      "loss": 2.1878,
      "num_input_tokens_seen": 840266288,
      "step": 1068
    },
    {
      "epoch": 0.11340971780182474,
      "grad_norm": 1.799939121953811,
      "learning_rate": 4.9990949237994855e-05,
      "loss": 2.4061,
      "num_input_tokens_seen": 841053024,
      "step": 1069
    },
    {
      "epoch": 0.11351580734139614,
      "grad_norm": 0.9176596717911235,
      "learning_rate": 4.999093052954563e-05,
      "loss": 2.3828,
      "num_input_tokens_seen": 841839808,
      "step": 1070
    },
    {
      "epoch": 0.11362189688096754,
      "grad_norm": 3.0201712765610047,
      "learning_rate": 4.999091180178415e-05,
      "loss": 2.4765,
      "num_input_tokens_seen": 842626592,
      "step": 1071
    },
    {
      "epoch": 0.11372798642053894,
      "grad_norm": 1.5388087938208725,
      "learning_rate": 4.999089305471042e-05,
      "loss": 2.4644,
      "num_input_tokens_seen": 843413280,
      "step": 1072
    },
    {
      "epoch": 0.11383407596011033,
      "grad_norm": 1.5210247521522886,
      "learning_rate": 4.9990874288324464e-05,
      "loss": 2.2474,
      "num_input_tokens_seen": 844200064,
      "step": 1073
    },
    {
      "epoch": 0.11394016549968174,
      "grad_norm": 1.3046234228611913,
      "learning_rate": 4.999085550262629e-05,
      "loss": 2.3504,
      "num_input_tokens_seen": 844986928,
      "step": 1074
    },
    {
      "epoch": 0.11404625503925313,
      "grad_norm": 1.2986530030477756,
      "learning_rate": 4.9990836697615916e-05,
      "loss": 2.2307,
      "num_input_tokens_seen": 845773776,
      "step": 1075
    },
    {
      "epoch": 0.11415234457882453,
      "grad_norm": 1.0979080854833372,
      "learning_rate": 4.999081787329336e-05,
      "loss": 2.1702,
      "num_input_tokens_seen": 846560576,
      "step": 1076
    },
    {
      "epoch": 0.11425843411839592,
      "grad_norm": 1.2232393274964468,
      "learning_rate": 4.9990799029658635e-05,
      "loss": 2.2715,
      "num_input_tokens_seen": 847347456,
      "step": 1077
    },
    {
      "epoch": 0.11436452365796733,
      "grad_norm": 1.2661837043138504,
      "learning_rate": 4.999078016671175e-05,
      "loss": 2.5225,
      "num_input_tokens_seen": 848134224,
      "step": 1078
    },
    {
      "epoch": 0.11447061319753872,
      "grad_norm": 0.9242229938787291,
      "learning_rate": 4.999076128445273e-05,
      "loss": 2.504,
      "num_input_tokens_seen": 848920928,
      "step": 1079
    },
    {
      "epoch": 0.11457670273711013,
      "grad_norm": 2.08435899362382,
      "learning_rate": 4.999074238288157e-05,
      "loss": 2.4224,
      "num_input_tokens_seen": 849707728,
      "step": 1080
    },
    {
      "epoch": 0.11468279227668152,
      "grad_norm": 1.0965224090098014,
      "learning_rate": 4.999072346199831e-05,
      "loss": 2.4098,
      "num_input_tokens_seen": 850494464,
      "step": 1081
    },
    {
      "epoch": 0.11478888181625292,
      "grad_norm": 1.5391649087027968,
      "learning_rate": 4.999070452180295e-05,
      "loss": 2.2585,
      "num_input_tokens_seen": 851281296,
      "step": 1082
    },
    {
      "epoch": 0.11489497135582431,
      "grad_norm": 0.9194387961838956,
      "learning_rate": 4.9990685562295505e-05,
      "loss": 2.3531,
      "num_input_tokens_seen": 852068208,
      "step": 1083
    },
    {
      "epoch": 0.11500106089539572,
      "grad_norm": 1.2989510597132874,
      "learning_rate": 4.9990666583475985e-05,
      "loss": 2.2591,
      "num_input_tokens_seen": 852854944,
      "step": 1084
    },
    {
      "epoch": 0.11510715043496711,
      "grad_norm": 0.8496284977755428,
      "learning_rate": 4.999064758534442e-05,
      "loss": 2.1255,
      "num_input_tokens_seen": 853641744,
      "step": 1085
    },
    {
      "epoch": 0.11521323997453851,
      "grad_norm": 1.2803172459251735,
      "learning_rate": 4.9990628567900814e-05,
      "loss": 2.4255,
      "num_input_tokens_seen": 854428432,
      "step": 1086
    },
    {
      "epoch": 0.1153193295141099,
      "grad_norm": 1.164891827423861,
      "learning_rate": 4.999060953114518e-05,
      "loss": 2.2604,
      "num_input_tokens_seen": 855215232,
      "step": 1087
    },
    {
      "epoch": 0.11542541905368131,
      "grad_norm": 2.314424173736078,
      "learning_rate": 4.999059047507754e-05,
      "loss": 2.499,
      "num_input_tokens_seen": 856001952,
      "step": 1088
    },
    {
      "epoch": 0.1155315085932527,
      "grad_norm": 0.976514769204037,
      "learning_rate": 4.99905713996979e-05,
      "loss": 2.4084,
      "num_input_tokens_seen": 856788816,
      "step": 1089
    },
    {
      "epoch": 0.11563759813282411,
      "grad_norm": 1.6839421011101563,
      "learning_rate": 4.999055230500629e-05,
      "loss": 2.2852,
      "num_input_tokens_seen": 857575696,
      "step": 1090
    },
    {
      "epoch": 0.1157436876723955,
      "grad_norm": 1.1200419615632282,
      "learning_rate": 4.999053319100271e-05,
      "loss": 2.3656,
      "num_input_tokens_seen": 858362448,
      "step": 1091
    },
    {
      "epoch": 0.1158497772119669,
      "grad_norm": 1.072482134403619,
      "learning_rate": 4.999051405768718e-05,
      "loss": 2.539,
      "num_input_tokens_seen": 859149104,
      "step": 1092
    },
    {
      "epoch": 0.1159558667515383,
      "grad_norm": 2.47016351632044,
      "learning_rate": 4.9990494905059704e-05,
      "loss": 2.3058,
      "num_input_tokens_seen": 859935744,
      "step": 1093
    },
    {
      "epoch": 0.1160619562911097,
      "grad_norm": 1.159521260975916,
      "learning_rate": 4.999047573312031e-05,
      "loss": 2.2736,
      "num_input_tokens_seen": 860722400,
      "step": 1094
    },
    {
      "epoch": 0.11616804583068109,
      "grad_norm": 2.965679939966821,
      "learning_rate": 4.999045654186902e-05,
      "loss": 2.1651,
      "num_input_tokens_seen": 861509168,
      "step": 1095
    },
    {
      "epoch": 0.1162741353702525,
      "grad_norm": 1.9291120089113079,
      "learning_rate": 4.999043733130583e-05,
      "loss": 2.4083,
      "num_input_tokens_seen": 862295920,
      "step": 1096
    },
    {
      "epoch": 0.11638022490982389,
      "grad_norm": 2.053138360872126,
      "learning_rate": 4.999041810143077e-05,
      "loss": 2.2371,
      "num_input_tokens_seen": 863082768,
      "step": 1097
    },
    {
      "epoch": 0.11648631444939529,
      "grad_norm": 1.7676719589963374,
      "learning_rate": 4.9990398852243836e-05,
      "loss": 2.433,
      "num_input_tokens_seen": 863869552,
      "step": 1098
    },
    {
      "epoch": 0.11659240398896668,
      "grad_norm": 2.6073879810336433,
      "learning_rate": 4.999037958374506e-05,
      "loss": 2.2045,
      "num_input_tokens_seen": 864656352,
      "step": 1099
    },
    {
      "epoch": 0.11669849352853809,
      "grad_norm": 1.9177147702918371,
      "learning_rate": 4.999036029593446e-05,
      "loss": 2.6443,
      "num_input_tokens_seen": 865443040,
      "step": 1100
    },
    {
      "epoch": 0.11680458306810948,
      "grad_norm": 2.930286384843049,
      "learning_rate": 4.999034098881204e-05,
      "loss": 2.4336,
      "num_input_tokens_seen": 866229728,
      "step": 1101
    },
    {
      "epoch": 0.11691067260768088,
      "grad_norm": 1.9299509967242694,
      "learning_rate": 4.999032166237781e-05,
      "loss": 2.2991,
      "num_input_tokens_seen": 867016544,
      "step": 1102
    },
    {
      "epoch": 0.11701676214725228,
      "grad_norm": 1.7338703813974807,
      "learning_rate": 4.99903023166318e-05,
      "loss": 2.2189,
      "num_input_tokens_seen": 867803280,
      "step": 1103
    },
    {
      "epoch": 0.11712285168682368,
      "grad_norm": 1.8365297326345764,
      "learning_rate": 4.999028295157402e-05,
      "loss": 2.3855,
      "num_input_tokens_seen": 868590048,
      "step": 1104
    },
    {
      "epoch": 0.11722894122639507,
      "grad_norm": 1.9856867281402883,
      "learning_rate": 4.999026356720447e-05,
      "loss": 2.3826,
      "num_input_tokens_seen": 869376816,
      "step": 1105
    },
    {
      "epoch": 0.11733503076596648,
      "grad_norm": 1.3708748101856036,
      "learning_rate": 4.999024416352319e-05,
      "loss": 2.4815,
      "num_input_tokens_seen": 870163584,
      "step": 1106
    },
    {
      "epoch": 0.11744112030553787,
      "grad_norm": 1.8332282324447031,
      "learning_rate": 4.9990224740530176e-05,
      "loss": 2.4544,
      "num_input_tokens_seen": 870950304,
      "step": 1107
    },
    {
      "epoch": 0.11754720984510927,
      "grad_norm": 1.3852502228967516,
      "learning_rate": 4.999020529822545e-05,
      "loss": 2.3619,
      "num_input_tokens_seen": 871737152,
      "step": 1108
    },
    {
      "epoch": 0.11765329938468067,
      "grad_norm": 1.3655947187693624,
      "learning_rate": 4.999018583660903e-05,
      "loss": 2.2617,
      "num_input_tokens_seen": 872523984,
      "step": 1109
    },
    {
      "epoch": 0.11775938892425207,
      "grad_norm": 1.1745159817460247,
      "learning_rate": 4.999016635568092e-05,
      "loss": 2.3504,
      "num_input_tokens_seen": 873310800,
      "step": 1110
    },
    {
      "epoch": 0.11786547846382346,
      "grad_norm": 1.6857374665235885,
      "learning_rate": 4.999014685544116e-05,
      "loss": 2.4181,
      "num_input_tokens_seen": 874097616,
      "step": 1111
    },
    {
      "epoch": 0.11797156800339487,
      "grad_norm": 1.3692661263346293,
      "learning_rate": 4.9990127335889724e-05,
      "loss": 2.4021,
      "num_input_tokens_seen": 874884320,
      "step": 1112
    },
    {
      "epoch": 0.11807765754296626,
      "grad_norm": 1.1657667692927136,
      "learning_rate": 4.999010779702666e-05,
      "loss": 2.3718,
      "num_input_tokens_seen": 875671040,
      "step": 1113
    },
    {
      "epoch": 0.11818374708253766,
      "grad_norm": 1.489346110699155,
      "learning_rate": 4.999008823885198e-05,
      "loss": 2.5823,
      "num_input_tokens_seen": 876457712,
      "step": 1114
    },
    {
      "epoch": 0.11828983662210905,
      "grad_norm": 1.0425847184338253,
      "learning_rate": 4.99900686613657e-05,
      "loss": 2.4213,
      "num_input_tokens_seen": 877244400,
      "step": 1115
    },
    {
      "epoch": 0.11839592616168046,
      "grad_norm": 1.840734898995344,
      "learning_rate": 4.999004906456781e-05,
      "loss": 2.1929,
      "num_input_tokens_seen": 878031136,
      "step": 1116
    },
    {
      "epoch": 0.11850201570125185,
      "grad_norm": 1.290505837063353,
      "learning_rate": 4.9990029448458355e-05,
      "loss": 2.3472,
      "num_input_tokens_seen": 878817808,
      "step": 1117
    },
    {
      "epoch": 0.11860810524082326,
      "grad_norm": 1.4729667032494567,
      "learning_rate": 4.999000981303733e-05,
      "loss": 2.2303,
      "num_input_tokens_seen": 879604560,
      "step": 1118
    },
    {
      "epoch": 0.11871419478039465,
      "grad_norm": 1.086280511908986,
      "learning_rate": 4.9989990158304766e-05,
      "loss": 2.4846,
      "num_input_tokens_seen": 880391344,
      "step": 1119
    },
    {
      "epoch": 0.11882028431996605,
      "grad_norm": 2.1341866811457324,
      "learning_rate": 4.9989970484260674e-05,
      "loss": 2.2456,
      "num_input_tokens_seen": 881178128,
      "step": 1120
    },
    {
      "epoch": 0.11892637385953744,
      "grad_norm": 1.4051851661334738,
      "learning_rate": 4.998995079090506e-05,
      "loss": 2.1826,
      "num_input_tokens_seen": 881964832,
      "step": 1121
    },
    {
      "epoch": 0.11903246339910885,
      "grad_norm": 2.7198739116111046,
      "learning_rate": 4.9989931078237945e-05,
      "loss": 2.3885,
      "num_input_tokens_seen": 882751600,
      "step": 1122
    },
    {
      "epoch": 0.11913855293868024,
      "grad_norm": 2.515486376662443,
      "learning_rate": 4.998991134625934e-05,
      "loss": 2.5713,
      "num_input_tokens_seen": 883538336,
      "step": 1123
    },
    {
      "epoch": 0.11924464247825164,
      "grad_norm": 1.2787519085729981,
      "learning_rate": 4.9989891594969274e-05,
      "loss": 2.4393,
      "num_input_tokens_seen": 884325152,
      "step": 1124
    },
    {
      "epoch": 0.11935073201782304,
      "grad_norm": 1.433605209971725,
      "learning_rate": 4.998987182436775e-05,
      "loss": 2.3641,
      "num_input_tokens_seen": 885111856,
      "step": 1125
    },
    {
      "epoch": 0.11945682155739444,
      "grad_norm": 1.6356133477102768,
      "learning_rate": 4.998985203445479e-05,
      "loss": 2.4928,
      "num_input_tokens_seen": 885898512,
      "step": 1126
    },
    {
      "epoch": 0.11956291109696585,
      "grad_norm": 1.259693755957385,
      "learning_rate": 4.998983222523039e-05,
      "loss": 2.435,
      "num_input_tokens_seen": 886685328,
      "step": 1127
    },
    {
      "epoch": 0.11966900063653724,
      "grad_norm": 1.2578974525265623,
      "learning_rate": 4.99898123966946e-05,
      "loss": 2.4823,
      "num_input_tokens_seen": 887472048,
      "step": 1128
    },
    {
      "epoch": 0.11977509017610864,
      "grad_norm": 1.9480235397896628,
      "learning_rate": 4.9989792548847404e-05,
      "loss": 2.6502,
      "num_input_tokens_seen": 888258720,
      "step": 1129
    },
    {
      "epoch": 0.11988117971568003,
      "grad_norm": 1.0449378746727895,
      "learning_rate": 4.998977268168884e-05,
      "loss": 2.4616,
      "num_input_tokens_seen": 889045568,
      "step": 1130
    },
    {
      "epoch": 0.11998726925525144,
      "grad_norm": 2.4665275296057865,
      "learning_rate": 4.99897527952189e-05,
      "loss": 2.4668,
      "num_input_tokens_seen": 889832448,
      "step": 1131
    },
    {
      "epoch": 0.12009335879482283,
      "grad_norm": 1.7070029831450961,
      "learning_rate": 4.998973288943763e-05,
      "loss": 2.2124,
      "num_input_tokens_seen": 890619360,
      "step": 1132
    },
    {
      "epoch": 0.12019944833439423,
      "grad_norm": 1.6678810524738175,
      "learning_rate": 4.998971296434501e-05,
      "loss": 2.0384,
      "num_input_tokens_seen": 891406176,
      "step": 1133
    },
    {
      "epoch": 0.12030553787396563,
      "grad_norm": 1.188905989997818,
      "learning_rate": 4.9989693019941074e-05,
      "loss": 2.2244,
      "num_input_tokens_seen": 892192960,
      "step": 1134
    },
    {
      "epoch": 0.12041162741353703,
      "grad_norm": 1.459423817122535,
      "learning_rate": 4.998967305622585e-05,
      "loss": 2.289,
      "num_input_tokens_seen": 892979808,
      "step": 1135
    },
    {
      "epoch": 0.12051771695310842,
      "grad_norm": 1.129415225403608,
      "learning_rate": 4.9989653073199325e-05,
      "loss": 2.3894,
      "num_input_tokens_seen": 893766656,
      "step": 1136
    },
    {
      "epoch": 0.12062380649267983,
      "grad_norm": 1.057188671042509,
      "learning_rate": 4.998963307086154e-05,
      "loss": 2.3613,
      "num_input_tokens_seen": 894553392,
      "step": 1137
    },
    {
      "epoch": 0.12072989603225122,
      "grad_norm": 1.5313040009254786,
      "learning_rate": 4.9989613049212494e-05,
      "loss": 2.427,
      "num_input_tokens_seen": 895340080,
      "step": 1138
    },
    {
      "epoch": 0.12083598557182262,
      "grad_norm": 0.7741233891901681,
      "learning_rate": 4.998959300825221e-05,
      "loss": 2.1568,
      "num_input_tokens_seen": 896126848,
      "step": 1139
    },
    {
      "epoch": 0.12094207511139402,
      "grad_norm": 1.5281960962021142,
      "learning_rate": 4.9989572947980704e-05,
      "loss": 2.3725,
      "num_input_tokens_seen": 896913664,
      "step": 1140
    },
    {
      "epoch": 0.12104816465096542,
      "grad_norm": 1.055722088335962,
      "learning_rate": 4.9989552868397987e-05,
      "loss": 2.4611,
      "num_input_tokens_seen": 897700336,
      "step": 1141
    },
    {
      "epoch": 0.12115425419053681,
      "grad_norm": 0.9826121554842592,
      "learning_rate": 4.9989532769504076e-05,
      "loss": 2.2206,
      "num_input_tokens_seen": 898487136,
      "step": 1142
    },
    {
      "epoch": 0.12126034373010822,
      "grad_norm": 1.2553965659163921,
      "learning_rate": 4.9989512651298994e-05,
      "loss": 2.2148,
      "num_input_tokens_seen": 899273952,
      "step": 1143
    },
    {
      "epoch": 0.12136643326967961,
      "grad_norm": 1.2284544698197113,
      "learning_rate": 4.998949251378274e-05,
      "loss": 2.4987,
      "num_input_tokens_seen": 900060688,
      "step": 1144
    },
    {
      "epoch": 0.12147252280925101,
      "grad_norm": 1.1832579521105289,
      "learning_rate": 4.998947235695535e-05,
      "loss": 2.5875,
      "num_input_tokens_seen": 900847456,
      "step": 1145
    },
    {
      "epoch": 0.1215786123488224,
      "grad_norm": 2.027972516712793,
      "learning_rate": 4.998945218081682e-05,
      "loss": 2.3165,
      "num_input_tokens_seen": 901634240,
      "step": 1146
    },
    {
      "epoch": 0.12168470188839381,
      "grad_norm": 1.0406451528225964,
      "learning_rate": 4.9989431985367174e-05,
      "loss": 2.445,
      "num_input_tokens_seen": 902420912,
      "step": 1147
    },
    {
      "epoch": 0.1217907914279652,
      "grad_norm": 1.9369374296338953,
      "learning_rate": 4.9989411770606435e-05,
      "loss": 2.4369,
      "num_input_tokens_seen": 903207664,
      "step": 1148
    },
    {
      "epoch": 0.1218968809675366,
      "grad_norm": 1.3404959326004506,
      "learning_rate": 4.998939153653461e-05,
      "loss": 2.2985,
      "num_input_tokens_seen": 903994384,
      "step": 1149
    },
    {
      "epoch": 0.122002970507108,
      "grad_norm": 1.101417200675833,
      "learning_rate": 4.998937128315171e-05,
      "loss": 2.3023,
      "num_input_tokens_seen": 904781120,
      "step": 1150
    },
    {
      "epoch": 0.1221090600466794,
      "grad_norm": 1.341302577095124,
      "learning_rate": 4.9989351010457766e-05,
      "loss": 2.1393,
      "num_input_tokens_seen": 905567968,
      "step": 1151
    },
    {
      "epoch": 0.12221514958625079,
      "grad_norm": 1.4851225176546377,
      "learning_rate": 4.998933071845278e-05,
      "loss": 2.4637,
      "num_input_tokens_seen": 906354720,
      "step": 1152
    },
    {
      "epoch": 0.1223212391258222,
      "grad_norm": 1.382467918605918,
      "learning_rate": 4.998931040713677e-05,
      "loss": 2.3706,
      "num_input_tokens_seen": 907141472,
      "step": 1153
    },
    {
      "epoch": 0.12242732866539359,
      "grad_norm": 1.1413128172984093,
      "learning_rate": 4.998929007650976e-05,
      "loss": 2.2839,
      "num_input_tokens_seen": 907928208,
      "step": 1154
    },
    {
      "epoch": 0.122533418204965,
      "grad_norm": 1.3327153229861843,
      "learning_rate": 4.998926972657176e-05,
      "loss": 2.4528,
      "num_input_tokens_seen": 908715040,
      "step": 1155
    },
    {
      "epoch": 0.12263950774453639,
      "grad_norm": 0.9088222469996162,
      "learning_rate": 4.998924935732278e-05,
      "loss": 2.5717,
      "num_input_tokens_seen": 909501776,
      "step": 1156
    },
    {
      "epoch": 0.12274559728410779,
      "grad_norm": 0.9295743116307891,
      "learning_rate": 4.9989228968762846e-05,
      "loss": 2.2422,
      "num_input_tokens_seen": 910288576,
      "step": 1157
    },
    {
      "epoch": 0.12285168682367918,
      "grad_norm": 1.3406118213088234,
      "learning_rate": 4.9989208560891964e-05,
      "loss": 2.3388,
      "num_input_tokens_seen": 911075376,
      "step": 1158
    },
    {
      "epoch": 0.12295777636325059,
      "grad_norm": 0.8159789293543509,
      "learning_rate": 4.998918813371016e-05,
      "loss": 2.2978,
      "num_input_tokens_seen": 911862128,
      "step": 1159
    },
    {
      "epoch": 0.12306386590282198,
      "grad_norm": 1.2595382040792173,
      "learning_rate": 4.998916768721744e-05,
      "loss": 2.3039,
      "num_input_tokens_seen": 912648944,
      "step": 1160
    },
    {
      "epoch": 0.12316995544239338,
      "grad_norm": 1.8983580066626535,
      "learning_rate": 4.998914722141383e-05,
      "loss": 2.444,
      "num_input_tokens_seen": 913435728,
      "step": 1161
    },
    {
      "epoch": 0.12327604498196477,
      "grad_norm": 0.7372477893876148,
      "learning_rate": 4.9989126736299344e-05,
      "loss": 2.2641,
      "num_input_tokens_seen": 914222464,
      "step": 1162
    },
    {
      "epoch": 0.12338213452153618,
      "grad_norm": 1.5669599701372996,
      "learning_rate": 4.9989106231873984e-05,
      "loss": 2.4056,
      "num_input_tokens_seen": 915009136,
      "step": 1163
    },
    {
      "epoch": 0.12348822406110757,
      "grad_norm": 0.9018012869722286,
      "learning_rate": 4.998908570813777e-05,
      "loss": 2.3111,
      "num_input_tokens_seen": 915795904,
      "step": 1164
    },
    {
      "epoch": 0.12359431360067898,
      "grad_norm": 1.049855104853453,
      "learning_rate": 4.998906516509074e-05,
      "loss": 2.1477,
      "num_input_tokens_seen": 916582720,
      "step": 1165
    },
    {
      "epoch": 0.12370040314025037,
      "grad_norm": 1.4551841938050207,
      "learning_rate": 4.998904460273289e-05,
      "loss": 2.1673,
      "num_input_tokens_seen": 917369520,
      "step": 1166
    },
    {
      "epoch": 0.12380649267982177,
      "grad_norm": 0.9133247179726023,
      "learning_rate": 4.9989024021064237e-05,
      "loss": 2.2919,
      "num_input_tokens_seen": 918156272,
      "step": 1167
    },
    {
      "epoch": 0.12391258221939316,
      "grad_norm": 1.3025951611757154,
      "learning_rate": 4.99890034200848e-05,
      "loss": 2.3233,
      "num_input_tokens_seen": 918943056,
      "step": 1168
    },
    {
      "epoch": 0.12401867175896457,
      "grad_norm": 1.2401127852933125,
      "learning_rate": 4.9988982799794593e-05,
      "loss": 2.2768,
      "num_input_tokens_seen": 919729840,
      "step": 1169
    },
    {
      "epoch": 0.12412476129853596,
      "grad_norm": 1.122658336674361,
      "learning_rate": 4.998896216019363e-05,
      "loss": 2.339,
      "num_input_tokens_seen": 920516544,
      "step": 1170
    },
    {
      "epoch": 0.12423085083810737,
      "grad_norm": 1.0183144293933806,
      "learning_rate": 4.9988941501281936e-05,
      "loss": 2.5795,
      "num_input_tokens_seen": 921303344,
      "step": 1171
    },
    {
      "epoch": 0.12433694037767876,
      "grad_norm": 1.3101125934723221,
      "learning_rate": 4.9988920823059516e-05,
      "loss": 2.511,
      "num_input_tokens_seen": 922090080,
      "step": 1172
    },
    {
      "epoch": 0.12444302991725016,
      "grad_norm": 0.6429595992374096,
      "learning_rate": 4.998890012552639e-05,
      "loss": 2.2469,
      "num_input_tokens_seen": 922876816,
      "step": 1173
    },
    {
      "epoch": 0.12454911945682155,
      "grad_norm": 0.7984033604369662,
      "learning_rate": 4.998887940868259e-05,
      "loss": 2.2474,
      "num_input_tokens_seen": 923663632,
      "step": 1174
    },
    {
      "epoch": 0.12465520899639296,
      "grad_norm": 0.800234795526637,
      "learning_rate": 4.9988858672528104e-05,
      "loss": 2.2961,
      "num_input_tokens_seen": 924450432,
      "step": 1175
    },
    {
      "epoch": 0.12476129853596435,
      "grad_norm": 0.939337866036513,
      "learning_rate": 4.998883791706296e-05,
      "loss": 2.3862,
      "num_input_tokens_seen": 925237168,
      "step": 1176
    },
    {
      "epoch": 0.12486738807553575,
      "grad_norm": 1.214923349951526,
      "learning_rate": 4.998881714228718e-05,
      "loss": 2.2909,
      "num_input_tokens_seen": 926023952,
      "step": 1177
    },
    {
      "epoch": 0.12497347761510715,
      "grad_norm": 0.708150712130346,
      "learning_rate": 4.998879634820077e-05,
      "loss": 2.2524,
      "num_input_tokens_seen": 926810816,
      "step": 1178
    },
    {
      "epoch": 0.12507956715467855,
      "grad_norm": 0.6782883191887521,
      "learning_rate": 4.998877553480376e-05,
      "loss": 2.4247,
      "num_input_tokens_seen": 927597536,
      "step": 1179
    },
    {
      "epoch": 0.12518565669424994,
      "grad_norm": 0.8678663870624932,
      "learning_rate": 4.998875470209615e-05,
      "loss": 2.4033,
      "num_input_tokens_seen": 928384320,
      "step": 1180
    },
    {
      "epoch": 0.12529174623382133,
      "grad_norm": 2.2346947729455215,
      "learning_rate": 4.998873385007797e-05,
      "loss": 2.4313,
      "num_input_tokens_seen": 929171024,
      "step": 1181
    },
    {
      "epoch": 0.12539783577339275,
      "grad_norm": 0.8890139565290565,
      "learning_rate": 4.998871297874923e-05,
      "loss": 2.5131,
      "num_input_tokens_seen": 929957744,
      "step": 1182
    },
    {
      "epoch": 0.12550392531296414,
      "grad_norm": 1.4356539385786027,
      "learning_rate": 4.998869208810994e-05,
      "loss": 2.4601,
      "num_input_tokens_seen": 930744432,
      "step": 1183
    },
    {
      "epoch": 0.12561001485253553,
      "grad_norm": 2.025448329786458,
      "learning_rate": 4.998867117816013e-05,
      "loss": 2.4147,
      "num_input_tokens_seen": 931531264,
      "step": 1184
    },
    {
      "epoch": 0.12571610439210693,
      "grad_norm": 0.8508920248416242,
      "learning_rate": 4.99886502488998e-05,
      "loss": 2.3583,
      "num_input_tokens_seen": 932318032,
      "step": 1185
    },
    {
      "epoch": 0.12582219393167834,
      "grad_norm": 2.437698089473588,
      "learning_rate": 4.998862930032897e-05,
      "loss": 2.196,
      "num_input_tokens_seen": 933104832,
      "step": 1186
    },
    {
      "epoch": 0.12592828347124974,
      "grad_norm": 1.2466502987919688,
      "learning_rate": 4.998860833244767e-05,
      "loss": 2.3223,
      "num_input_tokens_seen": 933891504,
      "step": 1187
    },
    {
      "epoch": 0.12603437301082113,
      "grad_norm": 4.2329111065049885,
      "learning_rate": 4.9988587345255903e-05,
      "loss": 2.3165,
      "num_input_tokens_seen": 934678272,
      "step": 1188
    },
    {
      "epoch": 0.12614046255039252,
      "grad_norm": 3.1209165753185095,
      "learning_rate": 4.9988566338753695e-05,
      "loss": 2.3835,
      "num_input_tokens_seen": 935465072,
      "step": 1189
    },
    {
      "epoch": 0.12624655208996394,
      "grad_norm": 1.8656215361839568,
      "learning_rate": 4.9988545312941046e-05,
      "loss": 2.3332,
      "num_input_tokens_seen": 936251840,
      "step": 1190
    },
    {
      "epoch": 0.12635264162953533,
      "grad_norm": 1.4665825041777343,
      "learning_rate": 4.998852426781799e-05,
      "loss": 2.3803,
      "num_input_tokens_seen": 937038512,
      "step": 1191
    },
    {
      "epoch": 0.12645873116910672,
      "grad_norm": 1.3318029025889084,
      "learning_rate": 4.9988503203384536e-05,
      "loss": 2.2181,
      "num_input_tokens_seen": 937825344,
      "step": 1192
    },
    {
      "epoch": 0.1265648207086781,
      "grad_norm": 0.8429724135802231,
      "learning_rate": 4.9988482119640695e-05,
      "loss": 2.2801,
      "num_input_tokens_seen": 938612080,
      "step": 1193
    },
    {
      "epoch": 0.12667091024824953,
      "grad_norm": 1.1506810943374575,
      "learning_rate": 4.998846101658649e-05,
      "loss": 2.4885,
      "num_input_tokens_seen": 939398800,
      "step": 1194
    },
    {
      "epoch": 0.12677699978782092,
      "grad_norm": 1.6498149717021864,
      "learning_rate": 4.9988439894221936e-05,
      "loss": 2.2053,
      "num_input_tokens_seen": 940185552,
      "step": 1195
    },
    {
      "epoch": 0.1268830893273923,
      "grad_norm": 1.130885610109591,
      "learning_rate": 4.998841875254705e-05,
      "loss": 2.395,
      "num_input_tokens_seen": 940972336,
      "step": 1196
    },
    {
      "epoch": 0.12698917886696373,
      "grad_norm": 1.5609610714804407,
      "learning_rate": 4.998839759156184e-05,
      "loss": 2.408,
      "num_input_tokens_seen": 941759104,
      "step": 1197
    },
    {
      "epoch": 0.12709526840653512,
      "grad_norm": 1.0568638366857115,
      "learning_rate": 4.998837641126634e-05,
      "loss": 2.3676,
      "num_input_tokens_seen": 942545824,
      "step": 1198
    },
    {
      "epoch": 0.1272013579461065,
      "grad_norm": 1.5660628456894445,
      "learning_rate": 4.998835521166055e-05,
      "loss": 2.3105,
      "num_input_tokens_seen": 943332576,
      "step": 1199
    },
    {
      "epoch": 0.1273074474856779,
      "grad_norm": 1.7331101637200352,
      "learning_rate": 4.9988333992744495e-05,
      "loss": 2.4037,
      "num_input_tokens_seen": 944119360,
      "step": 1200
    },
    {
      "epoch": 0.12741353702524932,
      "grad_norm": 1.4356845284789457,
      "learning_rate": 4.998831275451818e-05,
      "loss": 2.4917,
      "num_input_tokens_seen": 944906112,
      "step": 1201
    },
    {
      "epoch": 0.12751962656482072,
      "grad_norm": 2.0264088484665255,
      "learning_rate": 4.9988291496981646e-05,
      "loss": 2.4577,
      "num_input_tokens_seen": 945692848,
      "step": 1202
    },
    {
      "epoch": 0.1276257161043921,
      "grad_norm": 1.0656504157022324,
      "learning_rate": 4.9988270220134886e-05,
      "loss": 2.2813,
      "num_input_tokens_seen": 946479616,
      "step": 1203
    },
    {
      "epoch": 0.1277318056439635,
      "grad_norm": 1.202975428956594,
      "learning_rate": 4.998824892397792e-05,
      "loss": 2.3494,
      "num_input_tokens_seen": 947266464,
      "step": 1204
    },
    {
      "epoch": 0.12783789518353492,
      "grad_norm": 1.2205542211503453,
      "learning_rate": 4.998822760851077e-05,
      "loss": 2.2892,
      "num_input_tokens_seen": 948053216,
      "step": 1205
    },
    {
      "epoch": 0.1279439847231063,
      "grad_norm": 1.4643361486437578,
      "learning_rate": 4.9988206273733456e-05,
      "loss": 2.4908,
      "num_input_tokens_seen": 948839936,
      "step": 1206
    },
    {
      "epoch": 0.1280500742626777,
      "grad_norm": 1.4432885075210113,
      "learning_rate": 4.9988184919645985e-05,
      "loss": 2.168,
      "num_input_tokens_seen": 949626816,
      "step": 1207
    },
    {
      "epoch": 0.1281561638022491,
      "grad_norm": 0.9284512951559583,
      "learning_rate": 4.998816354624838e-05,
      "loss": 2.2862,
      "num_input_tokens_seen": 950413584,
      "step": 1208
    },
    {
      "epoch": 0.1282622533418205,
      "grad_norm": 2.5915079641921626,
      "learning_rate": 4.998814215354065e-05,
      "loss": 2.4673,
      "num_input_tokens_seen": 951200256,
      "step": 1209
    },
    {
      "epoch": 0.1283683428813919,
      "grad_norm": 1.5293074149061188,
      "learning_rate": 4.998812074152283e-05,
      "loss": 2.4157,
      "num_input_tokens_seen": 951987024,
      "step": 1210
    },
    {
      "epoch": 0.1284744324209633,
      "grad_norm": 2.0528720775955356,
      "learning_rate": 4.998809931019491e-05,
      "loss": 2.2045,
      "num_input_tokens_seen": 952773808,
      "step": 1211
    },
    {
      "epoch": 0.12858052196053468,
      "grad_norm": 1.5718867283441083,
      "learning_rate": 4.9988077859556926e-05,
      "loss": 2.3534,
      "num_input_tokens_seen": 953560624,
      "step": 1212
    },
    {
      "epoch": 0.1286866115001061,
      "grad_norm": 1.594826253475392,
      "learning_rate": 4.998805638960889e-05,
      "loss": 2.2831,
      "num_input_tokens_seen": 954347296,
      "step": 1213
    },
    {
      "epoch": 0.1287927010396775,
      "grad_norm": 1.479375456652504,
      "learning_rate": 4.998803490035081e-05,
      "loss": 2.4318,
      "num_input_tokens_seen": 955134096,
      "step": 1214
    },
    {
      "epoch": 0.12889879057924888,
      "grad_norm": 1.6381710633402558,
      "learning_rate": 4.9988013391782715e-05,
      "loss": 2.1975,
      "num_input_tokens_seen": 955920896,
      "step": 1215
    },
    {
      "epoch": 0.12900488011882028,
      "grad_norm": 1.3971623166608425,
      "learning_rate": 4.9987991863904616e-05,
      "loss": 2.547,
      "num_input_tokens_seen": 956707584,
      "step": 1216
    },
    {
      "epoch": 0.1291109696583917,
      "grad_norm": 1.3064873821808587,
      "learning_rate": 4.998797031671652e-05,
      "loss": 2.4842,
      "num_input_tokens_seen": 957494272,
      "step": 1217
    },
    {
      "epoch": 0.12921705919796309,
      "grad_norm": 1.4530755688126817,
      "learning_rate": 4.998794875021847e-05,
      "loss": 2.3077,
      "num_input_tokens_seen": 958281040,
      "step": 1218
    },
    {
      "epoch": 0.12932314873753448,
      "grad_norm": 0.8312982723150367,
      "learning_rate": 4.998792716441047e-05,
      "loss": 2.4144,
      "num_input_tokens_seen": 959067792,
      "step": 1219
    },
    {
      "epoch": 0.12942923827710587,
      "grad_norm": 1.4732657600901118,
      "learning_rate": 4.998790555929251e-05,
      "loss": 2.428,
      "num_input_tokens_seen": 959854496,
      "step": 1220
    },
    {
      "epoch": 0.1295353278166773,
      "grad_norm": 0.9772838627220308,
      "learning_rate": 4.998788393486464e-05,
      "loss": 2.5417,
      "num_input_tokens_seen": 960641184,
      "step": 1221
    },
    {
      "epoch": 0.12964141735624868,
      "grad_norm": 0.8943622659458472,
      "learning_rate": 4.9987862291126876e-05,
      "loss": 2.414,
      "num_input_tokens_seen": 961427968,
      "step": 1222
    },
    {
      "epoch": 0.12974750689582007,
      "grad_norm": 0.8920026165837214,
      "learning_rate": 4.998784062807922e-05,
      "loss": 2.2784,
      "num_input_tokens_seen": 962214800,
      "step": 1223
    },
    {
      "epoch": 0.12985359643539146,
      "grad_norm": 0.8163470910446844,
      "learning_rate": 4.998781894572169e-05,
      "loss": 2.3355,
      "num_input_tokens_seen": 963001616,
      "step": 1224
    },
    {
      "epoch": 0.12995968597496288,
      "grad_norm": 0.9546065603518301,
      "learning_rate": 4.998779724405431e-05,
      "loss": 2.4299,
      "num_input_tokens_seen": 963788304,
      "step": 1225
    },
    {
      "epoch": 0.13006577551453427,
      "grad_norm": 1.0337645018727064,
      "learning_rate": 4.998777552307709e-05,
      "loss": 2.3311,
      "num_input_tokens_seen": 964574960,
      "step": 1226
    },
    {
      "epoch": 0.13017186505410566,
      "grad_norm": 1.0190741309560656,
      "learning_rate": 4.998775378279005e-05,
      "loss": 2.3385,
      "num_input_tokens_seen": 965361680,
      "step": 1227
    },
    {
      "epoch": 0.13027795459367705,
      "grad_norm": 0.9559776172520028,
      "learning_rate": 4.9987732023193216e-05,
      "loss": 2.2899,
      "num_input_tokens_seen": 966148496,
      "step": 1228
    },
    {
      "epoch": 0.13038404413324847,
      "grad_norm": 0.8462493388678849,
      "learning_rate": 4.998771024428659e-05,
      "loss": 2.2531,
      "num_input_tokens_seen": 966935280,
      "step": 1229
    },
    {
      "epoch": 0.13049013367281986,
      "grad_norm": 1.0433468451078842,
      "learning_rate": 4.998768844607019e-05,
      "loss": 2.2744,
      "num_input_tokens_seen": 967722032,
      "step": 1230
    },
    {
      "epoch": 0.13059622321239125,
      "grad_norm": 1.808087618867067,
      "learning_rate": 4.998766662854405e-05,
      "loss": 2.3895,
      "num_input_tokens_seen": 968508816,
      "step": 1231
    },
    {
      "epoch": 0.13070231275196265,
      "grad_norm": 1.0023986640586857,
      "learning_rate": 4.998764479170816e-05,
      "loss": 2.5349,
      "num_input_tokens_seen": 969295504,
      "step": 1232
    },
    {
      "epoch": 0.13080840229153406,
      "grad_norm": 1.7258377116955728,
      "learning_rate": 4.998762293556256e-05,
      "loss": 2.4284,
      "num_input_tokens_seen": 970082240,
      "step": 1233
    },
    {
      "epoch": 0.13091449183110546,
      "grad_norm": 1.4426626355806675,
      "learning_rate": 4.998760106010725e-05,
      "loss": 2.451,
      "num_input_tokens_seen": 970869008,
      "step": 1234
    },
    {
      "epoch": 0.13102058137067685,
      "grad_norm": 1.0278225052796917,
      "learning_rate": 4.9987579165342266e-05,
      "loss": 2.5224,
      "num_input_tokens_seen": 971655792,
      "step": 1235
    },
    {
      "epoch": 0.13112667091024824,
      "grad_norm": 1.0127893182026149,
      "learning_rate": 4.9987557251267605e-05,
      "loss": 2.4329,
      "num_input_tokens_seen": 972442528,
      "step": 1236
    },
    {
      "epoch": 0.13123276044981966,
      "grad_norm": 1.6918897770172123,
      "learning_rate": 4.99875353178833e-05,
      "loss": 2.4178,
      "num_input_tokens_seen": 973229264,
      "step": 1237
    },
    {
      "epoch": 0.13133884998939105,
      "grad_norm": 0.7546942890821373,
      "learning_rate": 4.9987513365189356e-05,
      "loss": 2.3043,
      "num_input_tokens_seen": 974016112,
      "step": 1238
    },
    {
      "epoch": 0.13144493952896244,
      "grad_norm": 1.2327722361312217,
      "learning_rate": 4.99874913931858e-05,
      "loss": 2.3353,
      "num_input_tokens_seen": 974802928,
      "step": 1239
    },
    {
      "epoch": 0.13155102906853383,
      "grad_norm": 1.0589402685772022,
      "learning_rate": 4.998746940187264e-05,
      "loss": 2.2022,
      "num_input_tokens_seen": 975589664,
      "step": 1240
    },
    {
      "epoch": 0.13165711860810525,
      "grad_norm": 0.9910312499479662,
      "learning_rate": 4.9987447391249896e-05,
      "loss": 2.2686,
      "num_input_tokens_seen": 976376496,
      "step": 1241
    },
    {
      "epoch": 0.13176320814767664,
      "grad_norm": 1.0189354205452346,
      "learning_rate": 4.998742536131759e-05,
      "loss": 2.4768,
      "num_input_tokens_seen": 977163264,
      "step": 1242
    },
    {
      "epoch": 0.13186929768724803,
      "grad_norm": 1.3161931494130674,
      "learning_rate": 4.9987403312075734e-05,
      "loss": 2.3166,
      "num_input_tokens_seen": 977950080,
      "step": 1243
    },
    {
      "epoch": 0.13197538722681942,
      "grad_norm": 0.8131560752977368,
      "learning_rate": 4.9987381243524334e-05,
      "loss": 2.2905,
      "num_input_tokens_seen": 978736832,
      "step": 1244
    },
    {
      "epoch": 0.13208147676639084,
      "grad_norm": 1.4655083360035572,
      "learning_rate": 4.9987359155663436e-05,
      "loss": 2.354,
      "num_input_tokens_seen": 979523616,
      "step": 1245
    },
    {
      "epoch": 0.13218756630596223,
      "grad_norm": 1.1711444362658872,
      "learning_rate": 4.998733704849303e-05,
      "loss": 2.219,
      "num_input_tokens_seen": 980310464,
      "step": 1246
    },
    {
      "epoch": 0.13229365584553363,
      "grad_norm": 0.6001699371912703,
      "learning_rate": 4.9987314922013144e-05,
      "loss": 2.3255,
      "num_input_tokens_seen": 981097280,
      "step": 1247
    },
    {
      "epoch": 0.13239974538510502,
      "grad_norm": 0.7480869982750149,
      "learning_rate": 4.998729277622379e-05,
      "loss": 2.1995,
      "num_input_tokens_seen": 981884160,
      "step": 1248
    },
    {
      "epoch": 0.13250583492467644,
      "grad_norm": 0.95613268460506,
      "learning_rate": 4.9987270611125e-05,
      "loss": 2.4455,
      "num_input_tokens_seen": 982670848,
      "step": 1249
    },
    {
      "epoch": 0.13261192446424783,
      "grad_norm": 0.8746142587292471,
      "learning_rate": 4.998724842671678e-05,
      "loss": 2.2649,
      "num_input_tokens_seen": 983457648,
      "step": 1250
    },
    {
      "epoch": 0.13271801400381922,
      "grad_norm": 1.2699008827004439,
      "learning_rate": 4.998722622299914e-05,
      "loss": 2.1421,
      "num_input_tokens_seen": 984244480,
      "step": 1251
    },
    {
      "epoch": 0.1328241035433906,
      "grad_norm": 1.4583386120671475,
      "learning_rate": 4.998720399997211e-05,
      "loss": 2.395,
      "num_input_tokens_seen": 985031344,
      "step": 1252
    },
    {
      "epoch": 0.13293019308296203,
      "grad_norm": 1.101547610309061,
      "learning_rate": 4.9987181757635704e-05,
      "loss": 2.1794,
      "num_input_tokens_seen": 985818144,
      "step": 1253
    },
    {
      "epoch": 0.13303628262253342,
      "grad_norm": 1.128056297541296,
      "learning_rate": 4.998715949598993e-05,
      "loss": 2.1982,
      "num_input_tokens_seen": 986605008,
      "step": 1254
    },
    {
      "epoch": 0.1331423721621048,
      "grad_norm": 1.1020719231059297,
      "learning_rate": 4.998713721503482e-05,
      "loss": 2.3085,
      "num_input_tokens_seen": 987391760,
      "step": 1255
    },
    {
      "epoch": 0.1332484617016762,
      "grad_norm": 1.6971902043477356,
      "learning_rate": 4.9987114914770375e-05,
      "loss": 2.3685,
      "num_input_tokens_seen": 988178544,
      "step": 1256
    },
    {
      "epoch": 0.13335455124124762,
      "grad_norm": 0.5648602464039695,
      "learning_rate": 4.998709259519663e-05,
      "loss": 2.1454,
      "num_input_tokens_seen": 988965376,
      "step": 1257
    },
    {
      "epoch": 0.133460640780819,
      "grad_norm": 1.3391414916334896,
      "learning_rate": 4.9987070256313585e-05,
      "loss": 2.4426,
      "num_input_tokens_seen": 989752176,
      "step": 1258
    },
    {
      "epoch": 0.1335667303203904,
      "grad_norm": 0.6581159806315376,
      "learning_rate": 4.998704789812126e-05,
      "loss": 2.4876,
      "num_input_tokens_seen": 990538864,
      "step": 1259
    },
    {
      "epoch": 0.1336728198599618,
      "grad_norm": 1.0148808146721284,
      "learning_rate": 4.998702552061969e-05,
      "loss": 2.2651,
      "num_input_tokens_seen": 991325568,
      "step": 1260
    },
    {
      "epoch": 0.1337789093995332,
      "grad_norm": 1.929996504190594,
      "learning_rate": 4.998700312380887e-05,
      "loss": 2.4505,
      "num_input_tokens_seen": 992112272,
      "step": 1261
    },
    {
      "epoch": 0.1338849989391046,
      "grad_norm": 1.1569585635763737,
      "learning_rate": 4.998698070768884e-05,
      "loss": 2.3949,
      "num_input_tokens_seen": 992898944,
      "step": 1262
    },
    {
      "epoch": 0.133991088478676,
      "grad_norm": 3.074355183110138,
      "learning_rate": 4.99869582722596e-05,
      "loss": 2.3571,
      "num_input_tokens_seen": 993685648,
      "step": 1263
    },
    {
      "epoch": 0.1340971780182474,
      "grad_norm": 2.239751751076652,
      "learning_rate": 4.9986935817521164e-05,
      "loss": 2.1959,
      "num_input_tokens_seen": 994472368,
      "step": 1264
    },
    {
      "epoch": 0.1342032675578188,
      "grad_norm": 0.9810350010256826,
      "learning_rate": 4.9986913343473564e-05,
      "loss": 2.1666,
      "num_input_tokens_seen": 995259216,
      "step": 1265
    },
    {
      "epoch": 0.1343093570973902,
      "grad_norm": 1.0364818831248361,
      "learning_rate": 4.9986890850116805e-05,
      "loss": 2.3201,
      "num_input_tokens_seen": 996045968,
      "step": 1266
    },
    {
      "epoch": 0.1344154466369616,
      "grad_norm": 0.9352293602383852,
      "learning_rate": 4.998686833745091e-05,
      "loss": 2.4052,
      "num_input_tokens_seen": 996832784,
      "step": 1267
    },
    {
      "epoch": 0.134521536176533,
      "grad_norm": 0.9360890858229389,
      "learning_rate": 4.99868458054759e-05,
      "loss": 2.3748,
      "num_input_tokens_seen": 997619616,
      "step": 1268
    },
    {
      "epoch": 0.1346276257161044,
      "grad_norm": 0.8118016289505511,
      "learning_rate": 4.998682325419179e-05,
      "loss": 2.4692,
      "num_input_tokens_seen": 998406352,
      "step": 1269
    },
    {
      "epoch": 0.1347337152556758,
      "grad_norm": 0.9345686999088035,
      "learning_rate": 4.99868006835986e-05,
      "loss": 2.458,
      "num_input_tokens_seen": 999193056,
      "step": 1270
    },
    {
      "epoch": 0.13483980479524718,
      "grad_norm": 1.072026162038913,
      "learning_rate": 4.998677809369633e-05,
      "loss": 2.3653,
      "num_input_tokens_seen": 999979824,
      "step": 1271
    },
    {
      "epoch": 0.1349458943348186,
      "grad_norm": 1.3316764465393425,
      "learning_rate": 4.998675548448503e-05,
      "loss": 2.3297,
      "num_input_tokens_seen": 1000766496,
      "step": 1272
    },
    {
      "epoch": 0.13505198387439,
      "grad_norm": 1.162516749498651,
      "learning_rate": 4.998673285596468e-05,
      "loss": 2.3575,
      "num_input_tokens_seen": 1001553200,
      "step": 1273
    },
    {
      "epoch": 0.13515807341396138,
      "grad_norm": 1.1614303407081334,
      "learning_rate": 4.998671020813532e-05,
      "loss": 2.443,
      "num_input_tokens_seen": 1002339904,
      "step": 1274
    },
    {
      "epoch": 0.13526416295353277,
      "grad_norm": 1.1770643053160221,
      "learning_rate": 4.9986687540996973e-05,
      "loss": 2.5149,
      "num_input_tokens_seen": 1003126560,
      "step": 1275
    },
    {
      "epoch": 0.1353702524931042,
      "grad_norm": 0.8446088070942186,
      "learning_rate": 4.998666485454964e-05,
      "loss": 2.415,
      "num_input_tokens_seen": 1003913360,
      "step": 1276
    },
    {
      "epoch": 0.13547634203267558,
      "grad_norm": 1.145839137742166,
      "learning_rate": 4.998664214879335e-05,
      "loss": 2.4128,
      "num_input_tokens_seen": 1004700144,
      "step": 1277
    },
    {
      "epoch": 0.13558243157224698,
      "grad_norm": 1.0628852162341993,
      "learning_rate": 4.998661942372811e-05,
      "loss": 2.2948,
      "num_input_tokens_seen": 1005486912,
      "step": 1278
    },
    {
      "epoch": 0.13568852111181837,
      "grad_norm": 1.2356776380902101,
      "learning_rate": 4.998659667935395e-05,
      "loss": 2.3668,
      "num_input_tokens_seen": 1006273680,
      "step": 1279
    },
    {
      "epoch": 0.13579461065138979,
      "grad_norm": 1.3301808961178752,
      "learning_rate": 4.998657391567087e-05,
      "loss": 2.4271,
      "num_input_tokens_seen": 1007060480,
      "step": 1280
    },
    {
      "epoch": 0.13590070019096118,
      "grad_norm": 0.8493334580689792,
      "learning_rate": 4.9986551132678915e-05,
      "loss": 2.392,
      "num_input_tokens_seen": 1007847168,
      "step": 1281
    },
    {
      "epoch": 0.13600678973053257,
      "grad_norm": 1.655606648044735,
      "learning_rate": 4.998652833037808e-05,
      "loss": 2.3682,
      "num_input_tokens_seen": 1008633888,
      "step": 1282
    },
    {
      "epoch": 0.13611287927010396,
      "grad_norm": 0.9477265623602429,
      "learning_rate": 4.998650550876838e-05,
      "loss": 2.5132,
      "num_input_tokens_seen": 1009420720,
      "step": 1283
    },
    {
      "epoch": 0.13621896880967538,
      "grad_norm": 1.993953730096856,
      "learning_rate": 4.998648266784985e-05,
      "loss": 2.2335,
      "num_input_tokens_seen": 1010207520,
      "step": 1284
    },
    {
      "epoch": 0.13632505834924677,
      "grad_norm": 1.8046741468382577,
      "learning_rate": 4.99864598076225e-05,
      "loss": 2.4043,
      "num_input_tokens_seen": 1010994272,
      "step": 1285
    },
    {
      "epoch": 0.13643114788881816,
      "grad_norm": 1.9631514541616728,
      "learning_rate": 4.998643692808634e-05,
      "loss": 2.2917,
      "num_input_tokens_seen": 1011781008,
      "step": 1286
    },
    {
      "epoch": 0.13653723742838955,
      "grad_norm": 1.435854717871403,
      "learning_rate": 4.9986414029241405e-05,
      "loss": 2.3406,
      "num_input_tokens_seen": 1012567680,
      "step": 1287
    },
    {
      "epoch": 0.13664332696796097,
      "grad_norm": 1.85481943975016,
      "learning_rate": 4.99863911110877e-05,
      "loss": 2.2896,
      "num_input_tokens_seen": 1013354496,
      "step": 1288
    },
    {
      "epoch": 0.13674941650753236,
      "grad_norm": 1.0676156477755048,
      "learning_rate": 4.998636817362524e-05,
      "loss": 2.3113,
      "num_input_tokens_seen": 1014141328,
      "step": 1289
    },
    {
      "epoch": 0.13685550604710375,
      "grad_norm": 2.0303593358625576,
      "learning_rate": 4.9986345216854044e-05,
      "loss": 2.6,
      "num_input_tokens_seen": 1014928208,
      "step": 1290
    },
    {
      "epoch": 0.13696159558667514,
      "grad_norm": 1.164156517451936,
      "learning_rate": 4.998632224077415e-05,
      "loss": 2.3454,
      "num_input_tokens_seen": 1015714976,
      "step": 1291
    },
    {
      "epoch": 0.13706768512624656,
      "grad_norm": 1.7849407252410843,
      "learning_rate": 4.998629924538555e-05,
      "loss": 2.3021,
      "num_input_tokens_seen": 1016501808,
      "step": 1292
    },
    {
      "epoch": 0.13717377466581795,
      "grad_norm": 1.3479501440485733,
      "learning_rate": 4.9986276230688265e-05,
      "loss": 2.3551,
      "num_input_tokens_seen": 1017288576,
      "step": 1293
    },
    {
      "epoch": 0.13727986420538935,
      "grad_norm": 1.6097598162592495,
      "learning_rate": 4.998625319668233e-05,
      "loss": 2.2947,
      "num_input_tokens_seen": 1018075360,
      "step": 1294
    },
    {
      "epoch": 0.13738595374496074,
      "grad_norm": 1.683676870814421,
      "learning_rate": 4.998623014336774e-05,
      "loss": 2.3503,
      "num_input_tokens_seen": 1018862144,
      "step": 1295
    },
    {
      "epoch": 0.13749204328453216,
      "grad_norm": 0.9448449737989373,
      "learning_rate": 4.998620707074453e-05,
      "loss": 2.2939,
      "num_input_tokens_seen": 1019648896,
      "step": 1296
    },
    {
      "epoch": 0.13759813282410355,
      "grad_norm": 1.3629705768158382,
      "learning_rate": 4.998618397881272e-05,
      "loss": 2.5206,
      "num_input_tokens_seen": 1020435600,
      "step": 1297
    },
    {
      "epoch": 0.13770422236367494,
      "grad_norm": 0.8614343252101303,
      "learning_rate": 4.998616086757231e-05,
      "loss": 2.3092,
      "num_input_tokens_seen": 1021222304,
      "step": 1298
    },
    {
      "epoch": 0.13781031190324633,
      "grad_norm": 1.1627228505759848,
      "learning_rate": 4.9986137737023324e-05,
      "loss": 2.2726,
      "num_input_tokens_seen": 1022009120,
      "step": 1299
    },
    {
      "epoch": 0.13791640144281775,
      "grad_norm": 1.0881982919974305,
      "learning_rate": 4.998611458716579e-05,
      "loss": 2.3858,
      "num_input_tokens_seen": 1022795968,
      "step": 1300
    },
    {
      "epoch": 0.13802249098238914,
      "grad_norm": 0.9438455734876308,
      "learning_rate": 4.998609141799972e-05,
      "loss": 2.1754,
      "num_input_tokens_seen": 1023582832,
      "step": 1301
    },
    {
      "epoch": 0.13812858052196053,
      "grad_norm": 1.055391177615207,
      "learning_rate": 4.998606822952514e-05,
      "loss": 2.36,
      "num_input_tokens_seen": 1024369664,
      "step": 1302
    },
    {
      "epoch": 0.13823467006153192,
      "grad_norm": 0.9037879473528692,
      "learning_rate": 4.9986045021742043e-05,
      "loss": 2.3455,
      "num_input_tokens_seen": 1025156384,
      "step": 1303
    },
    {
      "epoch": 0.13834075960110334,
      "grad_norm": 0.763857178596805,
      "learning_rate": 4.9986021794650474e-05,
      "loss": 2.5516,
      "num_input_tokens_seen": 1025943056,
      "step": 1304
    },
    {
      "epoch": 0.13844684914067473,
      "grad_norm": 1.08463484801706,
      "learning_rate": 4.998599854825044e-05,
      "loss": 2.0921,
      "num_input_tokens_seen": 1026729904,
      "step": 1305
    },
    {
      "epoch": 0.13855293868024612,
      "grad_norm": 1.1712548211803242,
      "learning_rate": 4.998597528254196e-05,
      "loss": 2.3054,
      "num_input_tokens_seen": 1027516624,
      "step": 1306
    },
    {
      "epoch": 0.13865902821981752,
      "grad_norm": 1.2036233371092113,
      "learning_rate": 4.998595199752505e-05,
      "loss": 2.3933,
      "num_input_tokens_seen": 1028303392,
      "step": 1307
    },
    {
      "epoch": 0.13876511775938893,
      "grad_norm": 1.2485966909406552,
      "learning_rate": 4.9985928693199725e-05,
      "loss": 2.3242,
      "num_input_tokens_seen": 1029090208,
      "step": 1308
    },
    {
      "epoch": 0.13887120729896033,
      "grad_norm": 1.3215586447055139,
      "learning_rate": 4.998590536956601e-05,
      "loss": 2.3883,
      "num_input_tokens_seen": 1029876976,
      "step": 1309
    },
    {
      "epoch": 0.13897729683853172,
      "grad_norm": 1.1044924648466092,
      "learning_rate": 4.998588202662393e-05,
      "loss": 2.3065,
      "num_input_tokens_seen": 1030663680,
      "step": 1310
    },
    {
      "epoch": 0.1390833863781031,
      "grad_norm": 0.7711643164466916,
      "learning_rate": 4.998585866437348e-05,
      "loss": 2.5455,
      "num_input_tokens_seen": 1031450448,
      "step": 1311
    },
    {
      "epoch": 0.13918947591767453,
      "grad_norm": 1.8524415193793717,
      "learning_rate": 4.99858352828147e-05,
      "loss": 2.1432,
      "num_input_tokens_seen": 1032237248,
      "step": 1312
    },
    {
      "epoch": 0.13929556545724592,
      "grad_norm": 0.9292973877090869,
      "learning_rate": 4.99858118819476e-05,
      "loss": 2.4706,
      "num_input_tokens_seen": 1033023920,
      "step": 1313
    },
    {
      "epoch": 0.1394016549968173,
      "grad_norm": 2.0163995646462065,
      "learning_rate": 4.998578846177219e-05,
      "loss": 2.2121,
      "num_input_tokens_seen": 1033810624,
      "step": 1314
    },
    {
      "epoch": 0.1395077445363887,
      "grad_norm": 1.8566936653777668,
      "learning_rate": 4.99857650222885e-05,
      "loss": 2.2541,
      "num_input_tokens_seen": 1034597440,
      "step": 1315
    },
    {
      "epoch": 0.13961383407596012,
      "grad_norm": 1.4916266911493772,
      "learning_rate": 4.9985741563496546e-05,
      "loss": 2.3119,
      "num_input_tokens_seen": 1035384288,
      "step": 1316
    },
    {
      "epoch": 0.1397199236155315,
      "grad_norm": 2.034899773788718,
      "learning_rate": 4.998571808539634e-05,
      "loss": 2.4719,
      "num_input_tokens_seen": 1036171008,
      "step": 1317
    },
    {
      "epoch": 0.1398260131551029,
      "grad_norm": 1.040830034743187,
      "learning_rate": 4.9985694587987905e-05,
      "loss": 2.4486,
      "num_input_tokens_seen": 1036957744,
      "step": 1318
    },
    {
      "epoch": 0.1399321026946743,
      "grad_norm": 1.8285291274767461,
      "learning_rate": 4.9985671071271255e-05,
      "loss": 2.2972,
      "num_input_tokens_seen": 1037744432,
      "step": 1319
    },
    {
      "epoch": 0.1400381922342457,
      "grad_norm": 1.7363237910644238,
      "learning_rate": 4.998564753524642e-05,
      "loss": 2.232,
      "num_input_tokens_seen": 1038531184,
      "step": 1320
    },
    {
      "epoch": 0.1401442817738171,
      "grad_norm": 0.9207639222709566,
      "learning_rate": 4.998562397991341e-05,
      "loss": 2.17,
      "num_input_tokens_seen": 1039318096,
      "step": 1321
    },
    {
      "epoch": 0.1402503713133885,
      "grad_norm": 1.8003904402831448,
      "learning_rate": 4.9985600405272236e-05,
      "loss": 2.2299,
      "num_input_tokens_seen": 1040104928,
      "step": 1322
    },
    {
      "epoch": 0.14035646085295989,
      "grad_norm": 1.6365143078877054,
      "learning_rate": 4.9985576811322925e-05,
      "loss": 2.3134,
      "num_input_tokens_seen": 1040891760,
      "step": 1323
    },
    {
      "epoch": 0.1404625503925313,
      "grad_norm": 1.0996264148066035,
      "learning_rate": 4.998555319806549e-05,
      "loss": 2.3365,
      "num_input_tokens_seen": 1041678528,
      "step": 1324
    },
    {
      "epoch": 0.1405686399321027,
      "grad_norm": 1.864481406996895,
      "learning_rate": 4.998552956549996e-05,
      "loss": 2.5793,
      "num_input_tokens_seen": 1042465296,
      "step": 1325
    },
    {
      "epoch": 0.1406747294716741,
      "grad_norm": 0.7566046735150753,
      "learning_rate": 4.9985505913626344e-05,
      "loss": 2.2557,
      "num_input_tokens_seen": 1043252048,
      "step": 1326
    },
    {
      "epoch": 0.14078081901124548,
      "grad_norm": 0.9420698633641044,
      "learning_rate": 4.998548224244466e-05,
      "loss": 2.2165,
      "num_input_tokens_seen": 1044038832,
      "step": 1327
    },
    {
      "epoch": 0.1408869085508169,
      "grad_norm": 1.4740693946083325,
      "learning_rate": 4.9985458551954935e-05,
      "loss": 2.2523,
      "num_input_tokens_seen": 1044825584,
      "step": 1328
    },
    {
      "epoch": 0.1409929980903883,
      "grad_norm": 0.7812308693329775,
      "learning_rate": 4.998543484215717e-05,
      "loss": 2.3099,
      "num_input_tokens_seen": 1045612352,
      "step": 1329
    },
    {
      "epoch": 0.14109908762995968,
      "grad_norm": 2.0858281591424,
      "learning_rate": 4.99854111130514e-05,
      "loss": 2.5723,
      "num_input_tokens_seen": 1046399104,
      "step": 1330
    },
    {
      "epoch": 0.14120517716953107,
      "grad_norm": 1.1470148854880429,
      "learning_rate": 4.9985387364637637e-05,
      "loss": 2.3485,
      "num_input_tokens_seen": 1047185888,
      "step": 1331
    },
    {
      "epoch": 0.1413112667091025,
      "grad_norm": 1.4078141306708922,
      "learning_rate": 4.9985363596915905e-05,
      "loss": 2.2706,
      "num_input_tokens_seen": 1047972688,
      "step": 1332
    },
    {
      "epoch": 0.14141735624867388,
      "grad_norm": 1.3955194665921786,
      "learning_rate": 4.9985339809886206e-05,
      "loss": 2.1617,
      "num_input_tokens_seen": 1048759472,
      "step": 1333
    },
    {
      "epoch": 0.14152344578824527,
      "grad_norm": 1.1102039171982088,
      "learning_rate": 4.9985316003548574e-05,
      "loss": 2.4324,
      "num_input_tokens_seen": 1049546336,
      "step": 1334
    },
    {
      "epoch": 0.14162953532781666,
      "grad_norm": 1.8487174147696002,
      "learning_rate": 4.998529217790302e-05,
      "loss": 2.4888,
      "num_input_tokens_seen": 1050332960,
      "step": 1335
    },
    {
      "epoch": 0.14173562486738808,
      "grad_norm": 0.9351221749648964,
      "learning_rate": 4.998526833294957e-05,
      "loss": 2.1964,
      "num_input_tokens_seen": 1051119840,
      "step": 1336
    },
    {
      "epoch": 0.14184171440695947,
      "grad_norm": 1.04263381121701,
      "learning_rate": 4.9985244468688243e-05,
      "loss": 2.2366,
      "num_input_tokens_seen": 1051906576,
      "step": 1337
    },
    {
      "epoch": 0.14194780394653086,
      "grad_norm": 1.1431055859994639,
      "learning_rate": 4.998522058511904e-05,
      "loss": 2.3283,
      "num_input_tokens_seen": 1052693264,
      "step": 1338
    },
    {
      "epoch": 0.14205389348610228,
      "grad_norm": 1.428641752463248,
      "learning_rate": 4.9985196682241996e-05,
      "loss": 2.3505,
      "num_input_tokens_seen": 1053479952,
      "step": 1339
    },
    {
      "epoch": 0.14215998302567368,
      "grad_norm": 0.7907273523175895,
      "learning_rate": 4.998517276005713e-05,
      "loss": 2.2839,
      "num_input_tokens_seen": 1054266688,
      "step": 1340
    },
    {
      "epoch": 0.14226607256524507,
      "grad_norm": 1.0805469233482363,
      "learning_rate": 4.9985148818564456e-05,
      "loss": 2.3351,
      "num_input_tokens_seen": 1055053472,
      "step": 1341
    },
    {
      "epoch": 0.14237216210481646,
      "grad_norm": 1.0522123900907128,
      "learning_rate": 4.998512485776399e-05,
      "loss": 2.1006,
      "num_input_tokens_seen": 1055840208,
      "step": 1342
    },
    {
      "epoch": 0.14247825164438788,
      "grad_norm": 0.6467014846958777,
      "learning_rate": 4.9985100877655747e-05,
      "loss": 2.2123,
      "num_input_tokens_seen": 1056626976,
      "step": 1343
    },
    {
      "epoch": 0.14258434118395927,
      "grad_norm": 1.1600405127440112,
      "learning_rate": 4.998507687823975e-05,
      "loss": 2.147,
      "num_input_tokens_seen": 1057413744,
      "step": 1344
    },
    {
      "epoch": 0.14269043072353066,
      "grad_norm": 1.6333666323684648,
      "learning_rate": 4.998505285951603e-05,
      "loss": 2.286,
      "num_input_tokens_seen": 1058200464,
      "step": 1345
    },
    {
      "epoch": 0.14279652026310205,
      "grad_norm": 1.1254370283917348,
      "learning_rate": 4.9985028821484584e-05,
      "loss": 2.2437,
      "num_input_tokens_seen": 1058987264,
      "step": 1346
    },
    {
      "epoch": 0.14290260980267347,
      "grad_norm": 3.5273475352060837,
      "learning_rate": 4.998500476414545e-05,
      "loss": 2.2947,
      "num_input_tokens_seen": 1059774144,
      "step": 1347
    },
    {
      "epoch": 0.14300869934224486,
      "grad_norm": 2.5154457991810304,
      "learning_rate": 4.998498068749863e-05,
      "loss": 2.2434,
      "num_input_tokens_seen": 1060560912,
      "step": 1348
    },
    {
      "epoch": 0.14311478888181625,
      "grad_norm": 1.9775434363279392,
      "learning_rate": 4.998495659154415e-05,
      "loss": 2.3049,
      "num_input_tokens_seen": 1061347648,
      "step": 1349
    },
    {
      "epoch": 0.14322087842138764,
      "grad_norm": 1.4853203076937695,
      "learning_rate": 4.998493247628203e-05,
      "loss": 2.36,
      "num_input_tokens_seen": 1062134432,
      "step": 1350
    },
    {
      "epoch": 0.14332696796095906,
      "grad_norm": 2.5274718030598953,
      "learning_rate": 4.998490834171229e-05,
      "loss": 2.339,
      "num_input_tokens_seen": 1062921216,
      "step": 1351
    },
    {
      "epoch": 0.14343305750053045,
      "grad_norm": 2.1272277236992245,
      "learning_rate": 4.998488418783495e-05,
      "loss": 2.4398,
      "num_input_tokens_seen": 1063708016,
      "step": 1352
    },
    {
      "epoch": 0.14353914704010184,
      "grad_norm": 3.0585331592773897,
      "learning_rate": 4.998486001465001e-05,
      "loss": 2.1956,
      "num_input_tokens_seen": 1064494736,
      "step": 1353
    },
    {
      "epoch": 0.14364523657967324,
      "grad_norm": 2.630037399926122,
      "learning_rate": 4.998483582215752e-05,
      "loss": 2.2525,
      "num_input_tokens_seen": 1065281536,
      "step": 1354
    },
    {
      "epoch": 0.14375132611924465,
      "grad_norm": 1.7925618406507822,
      "learning_rate": 4.9984811610357474e-05,
      "loss": 2.5384,
      "num_input_tokens_seen": 1066068256,
      "step": 1355
    },
    {
      "epoch": 0.14385741565881605,
      "grad_norm": 1.512104039193768,
      "learning_rate": 4.9984787379249896e-05,
      "loss": 2.3947,
      "num_input_tokens_seen": 1066854976,
      "step": 1356
    },
    {
      "epoch": 0.14396350519838744,
      "grad_norm": 1.6957596931800119,
      "learning_rate": 4.998476312883481e-05,
      "loss": 2.2143,
      "num_input_tokens_seen": 1067641776,
      "step": 1357
    },
    {
      "epoch": 0.14406959473795883,
      "grad_norm": 1.2442761584072914,
      "learning_rate": 4.998473885911223e-05,
      "loss": 2.4329,
      "num_input_tokens_seen": 1068428496,
      "step": 1358
    },
    {
      "epoch": 0.14417568427753025,
      "grad_norm": 2.084826423260731,
      "learning_rate": 4.9984714570082184e-05,
      "loss": 2.5243,
      "num_input_tokens_seen": 1069215312,
      "step": 1359
    },
    {
      "epoch": 0.14428177381710164,
      "grad_norm": 1.1023281027556109,
      "learning_rate": 4.998469026174468e-05,
      "loss": 2.4014,
      "num_input_tokens_seen": 1070002032,
      "step": 1360
    },
    {
      "epoch": 0.14438786335667303,
      "grad_norm": 1.8966048390468762,
      "learning_rate": 4.998466593409974e-05,
      "loss": 2.3293,
      "num_input_tokens_seen": 1070788864,
      "step": 1361
    },
    {
      "epoch": 0.14449395289624442,
      "grad_norm": 1.0438641255720371,
      "learning_rate": 4.9984641587147384e-05,
      "loss": 2.1475,
      "num_input_tokens_seen": 1071575600,
      "step": 1362
    },
    {
      "epoch": 0.14460004243581584,
      "grad_norm": 1.9991307417359585,
      "learning_rate": 4.998461722088763e-05,
      "loss": 2.4042,
      "num_input_tokens_seen": 1072362320,
      "step": 1363
    },
    {
      "epoch": 0.14470613197538723,
      "grad_norm": 1.6037212916596544,
      "learning_rate": 4.9984592835320495e-05,
      "loss": 2.3244,
      "num_input_tokens_seen": 1073149184,
      "step": 1364
    },
    {
      "epoch": 0.14481222151495862,
      "grad_norm": 1.3514852886900384,
      "learning_rate": 4.9984568430446e-05,
      "loss": 2.1842,
      "num_input_tokens_seen": 1073935968,
      "step": 1365
    },
    {
      "epoch": 0.14491831105453,
      "grad_norm": 1.7872699516237216,
      "learning_rate": 4.9984544006264164e-05,
      "loss": 2.2738,
      "num_input_tokens_seen": 1074722688,
      "step": 1366
    },
    {
      "epoch": 0.14502440059410143,
      "grad_norm": 1.0103956116015602,
      "learning_rate": 4.9984519562775e-05,
      "loss": 2.181,
      "num_input_tokens_seen": 1075509408,
      "step": 1367
    },
    {
      "epoch": 0.14513049013367282,
      "grad_norm": 1.5780478803892446,
      "learning_rate": 4.998449509997854e-05,
      "loss": 2.1704,
      "num_input_tokens_seen": 1076296256,
      "step": 1368
    },
    {
      "epoch": 0.14523657967324421,
      "grad_norm": 1.4366319573562065,
      "learning_rate": 4.99844706178748e-05,
      "loss": 2.1733,
      "num_input_tokens_seen": 1077083024,
      "step": 1369
    },
    {
      "epoch": 0.1453426692128156,
      "grad_norm": 0.9184541491019529,
      "learning_rate": 4.998444611646378e-05,
      "loss": 2.1859,
      "num_input_tokens_seen": 1077869744,
      "step": 1370
    },
    {
      "epoch": 0.14544875875238703,
      "grad_norm": 1.0757817077832041,
      "learning_rate": 4.9984421595745525e-05,
      "loss": 2.2365,
      "num_input_tokens_seen": 1078656512,
      "step": 1371
    },
    {
      "epoch": 0.14555484829195842,
      "grad_norm": 0.7310437577690456,
      "learning_rate": 4.998439705572004e-05,
      "loss": 2.3059,
      "num_input_tokens_seen": 1079443264,
      "step": 1372
    },
    {
      "epoch": 0.1456609378315298,
      "grad_norm": 1.0708950285504433,
      "learning_rate": 4.998437249638734e-05,
      "loss": 2.2335,
      "num_input_tokens_seen": 1080230064,
      "step": 1373
    },
    {
      "epoch": 0.1457670273711012,
      "grad_norm": 0.7555453177240418,
      "learning_rate": 4.9984347917747456e-05,
      "loss": 2.3405,
      "num_input_tokens_seen": 1081016864,
      "step": 1374
    },
    {
      "epoch": 0.14587311691067262,
      "grad_norm": 1.2105838914460103,
      "learning_rate": 4.99843233198004e-05,
      "loss": 2.503,
      "num_input_tokens_seen": 1081803536,
      "step": 1375
    },
    {
      "epoch": 0.145979206450244,
      "grad_norm": 0.6618085543999771,
      "learning_rate": 4.9984298702546185e-05,
      "loss": 2.3813,
      "num_input_tokens_seen": 1082590336,
      "step": 1376
    },
    {
      "epoch": 0.1460852959898154,
      "grad_norm": 0.978270473415243,
      "learning_rate": 4.998427406598484e-05,
      "loss": 2.3369,
      "num_input_tokens_seen": 1083377136,
      "step": 1377
    },
    {
      "epoch": 0.1461913855293868,
      "grad_norm": 0.872963243261942,
      "learning_rate": 4.998424941011639e-05,
      "loss": 2.2106,
      "num_input_tokens_seen": 1084163904,
      "step": 1378
    },
    {
      "epoch": 0.1462974750689582,
      "grad_norm": 0.7491217189097732,
      "learning_rate": 4.9984224734940836e-05,
      "loss": 2.3436,
      "num_input_tokens_seen": 1084950640,
      "step": 1379
    },
    {
      "epoch": 0.1464035646085296,
      "grad_norm": 1.3441656952298815,
      "learning_rate": 4.9984200040458205e-05,
      "loss": 2.5074,
      "num_input_tokens_seen": 1085737264,
      "step": 1380
    },
    {
      "epoch": 0.146509654148101,
      "grad_norm": 0.6666317555952606,
      "learning_rate": 4.998417532666852e-05,
      "loss": 2.4153,
      "num_input_tokens_seen": 1086523968,
      "step": 1381
    },
    {
      "epoch": 0.14661574368767238,
      "grad_norm": 0.5752264859928576,
      "learning_rate": 4.998415059357181e-05,
      "loss": 2.1342,
      "num_input_tokens_seen": 1087310720,
      "step": 1382
    },
    {
      "epoch": 0.1467218332272438,
      "grad_norm": 0.9302864875684475,
      "learning_rate": 4.998412584116807e-05,
      "loss": 2.4397,
      "num_input_tokens_seen": 1088097488,
      "step": 1383
    },
    {
      "epoch": 0.1468279227668152,
      "grad_norm": 1.1217344384784187,
      "learning_rate": 4.998410106945732e-05,
      "loss": 2.2104,
      "num_input_tokens_seen": 1088884304,
      "step": 1384
    },
    {
      "epoch": 0.14693401230638659,
      "grad_norm": 0.8221936662048167,
      "learning_rate": 4.998407627843961e-05,
      "loss": 2.2452,
      "num_input_tokens_seen": 1089671136,
      "step": 1385
    },
    {
      "epoch": 0.14704010184595798,
      "grad_norm": 0.8352653539921538,
      "learning_rate": 4.998405146811492e-05,
      "loss": 2.4482,
      "num_input_tokens_seen": 1090457984,
      "step": 1386
    },
    {
      "epoch": 0.1471461913855294,
      "grad_norm": 0.696350280514189,
      "learning_rate": 4.9984026638483304e-05,
      "loss": 2.4753,
      "num_input_tokens_seen": 1091244672,
      "step": 1387
    },
    {
      "epoch": 0.1472522809251008,
      "grad_norm": 0.7035176586875802,
      "learning_rate": 4.998400178954476e-05,
      "loss": 2.4611,
      "num_input_tokens_seen": 1092031504,
      "step": 1388
    },
    {
      "epoch": 0.14735837046467218,
      "grad_norm": 0.6868087973994359,
      "learning_rate": 4.9983976921299314e-05,
      "loss": 2.4767,
      "num_input_tokens_seen": 1092818256,
      "step": 1389
    },
    {
      "epoch": 0.14746446000424357,
      "grad_norm": 0.7037783480250288,
      "learning_rate": 4.9983952033746975e-05,
      "loss": 2.2904,
      "num_input_tokens_seen": 1093605088,
      "step": 1390
    },
    {
      "epoch": 0.147570549543815,
      "grad_norm": 0.7848754366304422,
      "learning_rate": 4.998392712688778e-05,
      "loss": 2.419,
      "num_input_tokens_seen": 1094391808,
      "step": 1391
    },
    {
      "epoch": 0.14767663908338638,
      "grad_norm": 0.8191110935649978,
      "learning_rate": 4.9983902200721736e-05,
      "loss": 2.3244,
      "num_input_tokens_seen": 1095178512,
      "step": 1392
    },
    {
      "epoch": 0.14778272862295777,
      "grad_norm": 0.8464070251855442,
      "learning_rate": 4.998387725524887e-05,
      "loss": 2.2471,
      "num_input_tokens_seen": 1095965216,
      "step": 1393
    },
    {
      "epoch": 0.14788881816252916,
      "grad_norm": 0.8428097453750797,
      "learning_rate": 4.998385229046919e-05,
      "loss": 2.2155,
      "num_input_tokens_seen": 1096752096,
      "step": 1394
    },
    {
      "epoch": 0.14799490770210058,
      "grad_norm": 0.9378069876560559,
      "learning_rate": 4.998382730638272e-05,
      "loss": 2.185,
      "num_input_tokens_seen": 1097538912,
      "step": 1395
    },
    {
      "epoch": 0.14810099724167197,
      "grad_norm": 0.9789458735436738,
      "learning_rate": 4.998380230298949e-05,
      "loss": 2.4716,
      "num_input_tokens_seen": 1098325648,
      "step": 1396
    },
    {
      "epoch": 0.14820708678124336,
      "grad_norm": 2.632610179703641,
      "learning_rate": 4.998377728028951e-05,
      "loss": 2.4404,
      "num_input_tokens_seen": 1099112336,
      "step": 1397
    },
    {
      "epoch": 0.14831317632081475,
      "grad_norm": 0.9120694123651792,
      "learning_rate": 4.998375223828279e-05,
      "loss": 2.2089,
      "num_input_tokens_seen": 1099899184,
      "step": 1398
    },
    {
      "epoch": 0.14841926586038617,
      "grad_norm": 1.381313636681097,
      "learning_rate": 4.998372717696937e-05,
      "loss": 2.3016,
      "num_input_tokens_seen": 1100685920,
      "step": 1399
    },
    {
      "epoch": 0.14852535539995756,
      "grad_norm": 1.873945809041544,
      "learning_rate": 4.998370209634926e-05,
      "loss": 2.235,
      "num_input_tokens_seen": 1101472736,
      "step": 1400
    },
    {
      "epoch": 0.14863144493952896,
      "grad_norm": 1.3004696608284105,
      "learning_rate": 4.998367699642247e-05,
      "loss": 2.4355,
      "num_input_tokens_seen": 1102259584,
      "step": 1401
    },
    {
      "epoch": 0.14873753447910035,
      "grad_norm": 0.8282251421282314,
      "learning_rate": 4.998365187718903e-05,
      "loss": 2.2993,
      "num_input_tokens_seen": 1103046304,
      "step": 1402
    },
    {
      "epoch": 0.14884362401867177,
      "grad_norm": 1.3041307042079067,
      "learning_rate": 4.9983626738648954e-05,
      "loss": 2.4589,
      "num_input_tokens_seen": 1103833088,
      "step": 1403
    },
    {
      "epoch": 0.14894971355824316,
      "grad_norm": 1.3716885830900516,
      "learning_rate": 4.998360158080226e-05,
      "loss": 2.237,
      "num_input_tokens_seen": 1104619824,
      "step": 1404
    },
    {
      "epoch": 0.14905580309781455,
      "grad_norm": 1.1973798927917363,
      "learning_rate": 4.998357640364899e-05,
      "loss": 2.2282,
      "num_input_tokens_seen": 1105406624,
      "step": 1405
    },
    {
      "epoch": 0.14916189263738594,
      "grad_norm": 0.8576592330113503,
      "learning_rate": 4.998355120718913e-05,
      "loss": 1.9388,
      "num_input_tokens_seen": 1106193488,
      "step": 1406
    },
    {
      "epoch": 0.14926798217695736,
      "grad_norm": 1.2582704722304945,
      "learning_rate": 4.998352599142272e-05,
      "loss": 2.2656,
      "num_input_tokens_seen": 1106980256,
      "step": 1407
    },
    {
      "epoch": 0.14937407171652875,
      "grad_norm": 1.4209114090346666,
      "learning_rate": 4.9983500756349776e-05,
      "loss": 2.2363,
      "num_input_tokens_seen": 1107767056,
      "step": 1408
    },
    {
      "epoch": 0.14948016125610014,
      "grad_norm": 1.2024537771021055,
      "learning_rate": 4.998347550197031e-05,
      "loss": 2.3806,
      "num_input_tokens_seen": 1108553824,
      "step": 1409
    },
    {
      "epoch": 0.14958625079567156,
      "grad_norm": 2.859588639147699,
      "learning_rate": 4.998345022828435e-05,
      "loss": 2.4018,
      "num_input_tokens_seen": 1109340496,
      "step": 1410
    },
    {
      "epoch": 0.14969234033524295,
      "grad_norm": 1.8364046240685847,
      "learning_rate": 4.998342493529191e-05,
      "loss": 2.2619,
      "num_input_tokens_seen": 1110127328,
      "step": 1411
    },
    {
      "epoch": 0.14979842987481434,
      "grad_norm": 1.928465890888335,
      "learning_rate": 4.998339962299302e-05,
      "loss": 2.3496,
      "num_input_tokens_seen": 1110914112,
      "step": 1412
    },
    {
      "epoch": 0.14990451941438573,
      "grad_norm": 1.181732703175745,
      "learning_rate": 4.9983374291387684e-05,
      "loss": 2.1583,
      "num_input_tokens_seen": 1111700880,
      "step": 1413
    },
    {
      "epoch": 0.15001060895395715,
      "grad_norm": 2.360646339959302,
      "learning_rate": 4.998334894047594e-05,
      "loss": 2.305,
      "num_input_tokens_seen": 1112487696,
      "step": 1414
    },
    {
      "epoch": 0.15011669849352854,
      "grad_norm": 1.123181317182569,
      "learning_rate": 4.9983323570257785e-05,
      "loss": 2.3103,
      "num_input_tokens_seen": 1113274448,
      "step": 1415
    },
    {
      "epoch": 0.15022278803309994,
      "grad_norm": 3.1119857139346885,
      "learning_rate": 4.998329818073325e-05,
      "loss": 2.3611,
      "num_input_tokens_seen": 1114061216,
      "step": 1416
    },
    {
      "epoch": 0.15032887757267133,
      "grad_norm": 2.5328983975664046,
      "learning_rate": 4.998327277190237e-05,
      "loss": 2.3524,
      "num_input_tokens_seen": 1114848016,
      "step": 1417
    },
    {
      "epoch": 0.15043496711224275,
      "grad_norm": 1.3534715747835284,
      "learning_rate": 4.998324734376513e-05,
      "loss": 2.3097,
      "num_input_tokens_seen": 1115634848,
      "step": 1418
    },
    {
      "epoch": 0.15054105665181414,
      "grad_norm": 1.2645126753320228,
      "learning_rate": 4.998322189632159e-05,
      "loss": 2.0129,
      "num_input_tokens_seen": 1116421744,
      "step": 1419
    },
    {
      "epoch": 0.15064714619138553,
      "grad_norm": 1.119885218121562,
      "learning_rate": 4.998319642957173e-05,
      "loss": 2.3572,
      "num_input_tokens_seen": 1117208560,
      "step": 1420
    },
    {
      "epoch": 0.15075323573095692,
      "grad_norm": 1.230026829038026,
      "learning_rate": 4.99831709435156e-05,
      "loss": 2.3361,
      "num_input_tokens_seen": 1117995296,
      "step": 1421
    },
    {
      "epoch": 0.15085932527052834,
      "grad_norm": 1.2257187461707775,
      "learning_rate": 4.9983145438153205e-05,
      "loss": 2.3498,
      "num_input_tokens_seen": 1118782048,
      "step": 1422
    },
    {
      "epoch": 0.15096541481009973,
      "grad_norm": 1.0894735128999051,
      "learning_rate": 4.9983119913484564e-05,
      "loss": 2.294,
      "num_input_tokens_seen": 1119568800,
      "step": 1423
    },
    {
      "epoch": 0.15107150434967112,
      "grad_norm": 1.5137685067171491,
      "learning_rate": 4.998309436950971e-05,
      "loss": 2.2835,
      "num_input_tokens_seen": 1120355616,
      "step": 1424
    },
    {
      "epoch": 0.1511775938892425,
      "grad_norm": 0.7945939616796097,
      "learning_rate": 4.998306880622865e-05,
      "loss": 2.2922,
      "num_input_tokens_seen": 1121142464,
      "step": 1425
    },
    {
      "epoch": 0.15128368342881393,
      "grad_norm": 1.2015272394708993,
      "learning_rate": 4.9983043223641414e-05,
      "loss": 2.2695,
      "num_input_tokens_seen": 1121929248,
      "step": 1426
    },
    {
      "epoch": 0.15138977296838532,
      "grad_norm": 0.9237102174957453,
      "learning_rate": 4.9983017621748006e-05,
      "loss": 2.3386,
      "num_input_tokens_seen": 1122716000,
      "step": 1427
    },
    {
      "epoch": 0.1514958625079567,
      "grad_norm": 0.9898816014120607,
      "learning_rate": 4.9982992000548454e-05,
      "loss": 2.2466,
      "num_input_tokens_seen": 1123502736,
      "step": 1428
    },
    {
      "epoch": 0.1516019520475281,
      "grad_norm": 1.3500804100504054,
      "learning_rate": 4.9982966360042785e-05,
      "loss": 2.3052,
      "num_input_tokens_seen": 1124289504,
      "step": 1429
    },
    {
      "epoch": 0.15170804158709952,
      "grad_norm": 1.0833763792507747,
      "learning_rate": 4.9982940700231006e-05,
      "loss": 2.2494,
      "num_input_tokens_seen": 1125076256,
      "step": 1430
    },
    {
      "epoch": 0.15181413112667091,
      "grad_norm": 1.3281398727929945,
      "learning_rate": 4.998291502111315e-05,
      "loss": 2.2365,
      "num_input_tokens_seen": 1125863024,
      "step": 1431
    },
    {
      "epoch": 0.1519202206662423,
      "grad_norm": 0.8384181096126719,
      "learning_rate": 4.998288932268923e-05,
      "loss": 2.2854,
      "num_input_tokens_seen": 1126649792,
      "step": 1432
    },
    {
      "epoch": 0.1520263102058137,
      "grad_norm": 1.892036611800154,
      "learning_rate": 4.998286360495926e-05,
      "loss": 2.3504,
      "num_input_tokens_seen": 1127436512,
      "step": 1433
    },
    {
      "epoch": 0.15213239974538512,
      "grad_norm": 1.0875113547178303,
      "learning_rate": 4.998283786792327e-05,
      "loss": 2.3224,
      "num_input_tokens_seen": 1128223312,
      "step": 1434
    },
    {
      "epoch": 0.1522384892849565,
      "grad_norm": 1.9082270734535578,
      "learning_rate": 4.998281211158128e-05,
      "loss": 2.4321,
      "num_input_tokens_seen": 1129010128,
      "step": 1435
    },
    {
      "epoch": 0.1523445788245279,
      "grad_norm": 1.9220000090410478,
      "learning_rate": 4.99827863359333e-05,
      "loss": 2.5183,
      "num_input_tokens_seen": 1129796848,
      "step": 1436
    },
    {
      "epoch": 0.1524506683640993,
      "grad_norm": 1.826396727909175,
      "learning_rate": 4.998276054097936e-05,
      "loss": 2.3339,
      "num_input_tokens_seen": 1130583504,
      "step": 1437
    },
    {
      "epoch": 0.1525567579036707,
      "grad_norm": 1.7320596304136437,
      "learning_rate": 4.998273472671947e-05,
      "loss": 2.2119,
      "num_input_tokens_seen": 1131370256,
      "step": 1438
    },
    {
      "epoch": 0.1526628474432421,
      "grad_norm": 0.7713409568968969,
      "learning_rate": 4.998270889315366e-05,
      "loss": 2.2975,
      "num_input_tokens_seen": 1132156992,
      "step": 1439
    },
    {
      "epoch": 0.1527689369828135,
      "grad_norm": 1.2910590121646413,
      "learning_rate": 4.9982683040281945e-05,
      "loss": 2.1595,
      "num_input_tokens_seen": 1132943696,
      "step": 1440
    },
    {
      "epoch": 0.15287502652238488,
      "grad_norm": 0.8490251369788395,
      "learning_rate": 4.998265716810435e-05,
      "loss": 2.369,
      "num_input_tokens_seen": 1133730400,
      "step": 1441
    },
    {
      "epoch": 0.1529811160619563,
      "grad_norm": 1.39678977535359,
      "learning_rate": 4.9982631276620886e-05,
      "loss": 2.3391,
      "num_input_tokens_seen": 1134517152,
      "step": 1442
    },
    {
      "epoch": 0.1530872056015277,
      "grad_norm": 1.0156480920716089,
      "learning_rate": 4.998260536583158e-05,
      "loss": 2.3253,
      "num_input_tokens_seen": 1135303952,
      "step": 1443
    },
    {
      "epoch": 0.15319329514109908,
      "grad_norm": 1.4351995445038748,
      "learning_rate": 4.998257943573644e-05,
      "loss": 2.2688,
      "num_input_tokens_seen": 1136090736,
      "step": 1444
    },
    {
      "epoch": 0.15329938468067048,
      "grad_norm": 1.225567663833751,
      "learning_rate": 4.99825534863355e-05,
      "loss": 2.3007,
      "num_input_tokens_seen": 1136877488,
      "step": 1445
    },
    {
      "epoch": 0.1534054742202419,
      "grad_norm": 1.6758177016303941,
      "learning_rate": 4.9982527517628785e-05,
      "loss": 2.4392,
      "num_input_tokens_seen": 1137664208,
      "step": 1446
    },
    {
      "epoch": 0.15351156375981329,
      "grad_norm": 1.6114229569735918,
      "learning_rate": 4.99825015296163e-05,
      "loss": 2.5297,
      "num_input_tokens_seen": 1138451024,
      "step": 1447
    },
    {
      "epoch": 0.15361765329938468,
      "grad_norm": 0.9944572786233297,
      "learning_rate": 4.998247552229807e-05,
      "loss": 2.2092,
      "num_input_tokens_seen": 1139237776,
      "step": 1448
    },
    {
      "epoch": 0.15372374283895607,
      "grad_norm": 1.2277034420847965,
      "learning_rate": 4.998244949567411e-05,
      "loss": 2.4129,
      "num_input_tokens_seen": 1140024464,
      "step": 1449
    },
    {
      "epoch": 0.1538298323785275,
      "grad_norm": 1.1875083908097088,
      "learning_rate": 4.9982423449744456e-05,
      "loss": 2.4504,
      "num_input_tokens_seen": 1140811216,
      "step": 1450
    },
    {
      "epoch": 0.15393592191809888,
      "grad_norm": 1.2004079700229087,
      "learning_rate": 4.998239738450912e-05,
      "loss": 2.2448,
      "num_input_tokens_seen": 1141598000,
      "step": 1451
    },
    {
      "epoch": 0.15404201145767027,
      "grad_norm": 1.410437771426075,
      "learning_rate": 4.998237129996811e-05,
      "loss": 2.0692,
      "num_input_tokens_seen": 1142384912,
      "step": 1452
    },
    {
      "epoch": 0.15414810099724166,
      "grad_norm": 0.9766940661557508,
      "learning_rate": 4.998234519612146e-05,
      "loss": 2.2756,
      "num_input_tokens_seen": 1143171712,
      "step": 1453
    },
    {
      "epoch": 0.15425419053681308,
      "grad_norm": 1.009908183066283,
      "learning_rate": 4.998231907296919e-05,
      "loss": 2.2316,
      "num_input_tokens_seen": 1143958544,
      "step": 1454
    },
    {
      "epoch": 0.15436028007638447,
      "grad_norm": 0.9444255075294545,
      "learning_rate": 4.998229293051131e-05,
      "loss": 2.3709,
      "num_input_tokens_seen": 1144745328,
      "step": 1455
    },
    {
      "epoch": 0.15446636961595586,
      "grad_norm": 0.8229347102537019,
      "learning_rate": 4.9982266768747856e-05,
      "loss": 2.2855,
      "num_input_tokens_seen": 1145532064,
      "step": 1456
    },
    {
      "epoch": 0.15457245915552725,
      "grad_norm": 1.3020727443810867,
      "learning_rate": 4.998224058767883e-05,
      "loss": 2.2314,
      "num_input_tokens_seen": 1146318832,
      "step": 1457
    },
    {
      "epoch": 0.15467854869509867,
      "grad_norm": 1.0501522640584091,
      "learning_rate": 4.998221438730427e-05,
      "loss": 2.1735,
      "num_input_tokens_seen": 1147105680,
      "step": 1458
    },
    {
      "epoch": 0.15478463823467006,
      "grad_norm": 1.2263627370350965,
      "learning_rate": 4.9982188167624186e-05,
      "loss": 2.2949,
      "num_input_tokens_seen": 1147892480,
      "step": 1459
    },
    {
      "epoch": 0.15489072777424145,
      "grad_norm": 1.1728330595865624,
      "learning_rate": 4.998216192863859e-05,
      "loss": 2.2072,
      "num_input_tokens_seen": 1148679232,
      "step": 1460
    },
    {
      "epoch": 0.15499681731381285,
      "grad_norm": 0.8265037580545878,
      "learning_rate": 4.9982135670347525e-05,
      "loss": 2.1808,
      "num_input_tokens_seen": 1149465952,
      "step": 1461
    },
    {
      "epoch": 0.15510290685338426,
      "grad_norm": 0.9718928788448403,
      "learning_rate": 4.9982109392751e-05,
      "loss": 2.2316,
      "num_input_tokens_seen": 1150252704,
      "step": 1462
    },
    {
      "epoch": 0.15520899639295566,
      "grad_norm": 0.9496132623540243,
      "learning_rate": 4.998208309584902e-05,
      "loss": 2.3208,
      "num_input_tokens_seen": 1151039392,
      "step": 1463
    },
    {
      "epoch": 0.15531508593252705,
      "grad_norm": 0.8352060955857558,
      "learning_rate": 4.998205677964163e-05,
      "loss": 2.4464,
      "num_input_tokens_seen": 1151826112,
      "step": 1464
    },
    {
      "epoch": 0.15542117547209844,
      "grad_norm": 1.3440568196431184,
      "learning_rate": 4.9982030444128836e-05,
      "loss": 2.3041,
      "num_input_tokens_seen": 1152612944,
      "step": 1465
    },
    {
      "epoch": 0.15552726501166986,
      "grad_norm": 1.0286777636038282,
      "learning_rate": 4.998200408931066e-05,
      "loss": 2.1062,
      "num_input_tokens_seen": 1153399712,
      "step": 1466
    },
    {
      "epoch": 0.15563335455124125,
      "grad_norm": 1.0245139194900796,
      "learning_rate": 4.9981977715187126e-05,
      "loss": 2.3398,
      "num_input_tokens_seen": 1154186464,
      "step": 1467
    },
    {
      "epoch": 0.15573944409081264,
      "grad_norm": 0.865759482020595,
      "learning_rate": 4.9981951321758255e-05,
      "loss": 2.1166,
      "num_input_tokens_seen": 1154973280,
      "step": 1468
    },
    {
      "epoch": 0.15584553363038403,
      "grad_norm": 1.664861964018769,
      "learning_rate": 4.9981924909024065e-05,
      "loss": 2.3722,
      "num_input_tokens_seen": 1155759968,
      "step": 1469
    },
    {
      "epoch": 0.15595162316995545,
      "grad_norm": 0.6849132907929499,
      "learning_rate": 4.998189847698457e-05,
      "loss": 2.1305,
      "num_input_tokens_seen": 1156546784,
      "step": 1470
    },
    {
      "epoch": 0.15605771270952684,
      "grad_norm": 0.7742125043218409,
      "learning_rate": 4.998187202563981e-05,
      "loss": 2.2118,
      "num_input_tokens_seen": 1157333568,
      "step": 1471
    },
    {
      "epoch": 0.15616380224909823,
      "grad_norm": 1.6663218628716232,
      "learning_rate": 4.998184555498978e-05,
      "loss": 2.4424,
      "num_input_tokens_seen": 1158120368,
      "step": 1472
    },
    {
      "epoch": 0.15626989178866962,
      "grad_norm": 1.0098026819378803,
      "learning_rate": 4.998181906503452e-05,
      "loss": 2.5594,
      "num_input_tokens_seen": 1158907088,
      "step": 1473
    },
    {
      "epoch": 0.15637598132824104,
      "grad_norm": 1.013885639599135,
      "learning_rate": 4.9981792555774036e-05,
      "loss": 2.3679,
      "num_input_tokens_seen": 1159693920,
      "step": 1474
    },
    {
      "epoch": 0.15648207086781243,
      "grad_norm": 1.1792452062948695,
      "learning_rate": 4.998176602720836e-05,
      "loss": 2.3388,
      "num_input_tokens_seen": 1160480704,
      "step": 1475
    },
    {
      "epoch": 0.15658816040738383,
      "grad_norm": 1.519588852148588,
      "learning_rate": 4.9981739479337506e-05,
      "loss": 2.298,
      "num_input_tokens_seen": 1161267488,
      "step": 1476
    },
    {
      "epoch": 0.15669424994695522,
      "grad_norm": 0.8014878285854378,
      "learning_rate": 4.99817129121615e-05,
      "loss": 2.2107,
      "num_input_tokens_seen": 1162054224,
      "step": 1477
    },
    {
      "epoch": 0.15680033948652664,
      "grad_norm": 1.811672788459061,
      "learning_rate": 4.998168632568036e-05,
      "loss": 2.4024,
      "num_input_tokens_seen": 1162840912,
      "step": 1478
    },
    {
      "epoch": 0.15690642902609803,
      "grad_norm": 0.7241719031072864,
      "learning_rate": 4.9981659719894106e-05,
      "loss": 2.4013,
      "num_input_tokens_seen": 1163627712,
      "step": 1479
    },
    {
      "epoch": 0.15701251856566942,
      "grad_norm": 1.7643522198769201,
      "learning_rate": 4.9981633094802746e-05,
      "loss": 2.3726,
      "num_input_tokens_seen": 1164414416,
      "step": 1480
    },
    {
      "epoch": 0.15711860810524084,
      "grad_norm": 1.149582957482299,
      "learning_rate": 4.9981606450406326e-05,
      "loss": 2.3316,
      "num_input_tokens_seen": 1165201136,
      "step": 1481
    },
    {
      "epoch": 0.15722469764481223,
      "grad_norm": 0.8179914297416097,
      "learning_rate": 4.998157978670486e-05,
      "loss": 2.4525,
      "num_input_tokens_seen": 1165987968,
      "step": 1482
    },
    {
      "epoch": 0.15733078718438362,
      "grad_norm": 0.8950520072457437,
      "learning_rate": 4.998155310369835e-05,
      "loss": 2.4242,
      "num_input_tokens_seen": 1166774704,
      "step": 1483
    },
    {
      "epoch": 0.157436876723955,
      "grad_norm": 0.7658197741052892,
      "learning_rate": 4.998152640138683e-05,
      "loss": 2.2438,
      "num_input_tokens_seen": 1167561552,
      "step": 1484
    },
    {
      "epoch": 0.15754296626352643,
      "grad_norm": 0.7957211701726166,
      "learning_rate": 4.998149967977031e-05,
      "loss": 2.2347,
      "num_input_tokens_seen": 1168348432,
      "step": 1485
    },
    {
      "epoch": 0.15764905580309782,
      "grad_norm": 0.7569710729224068,
      "learning_rate": 4.998147293884884e-05,
      "loss": 2.3562,
      "num_input_tokens_seen": 1169135104,
      "step": 1486
    },
    {
      "epoch": 0.1577551453426692,
      "grad_norm": 0.8290539639561935,
      "learning_rate": 4.998144617862242e-05,
      "loss": 2.3889,
      "num_input_tokens_seen": 1169921888,
      "step": 1487
    },
    {
      "epoch": 0.1578612348822406,
      "grad_norm": 0.8062060403325151,
      "learning_rate": 4.998141939909105e-05,
      "loss": 2.1699,
      "num_input_tokens_seen": 1170708640,
      "step": 1488
    },
    {
      "epoch": 0.15796732442181202,
      "grad_norm": 1.585362332440642,
      "learning_rate": 4.99813926002548e-05,
      "loss": 2.4941,
      "num_input_tokens_seen": 1171495360,
      "step": 1489
    },
    {
      "epoch": 0.1580734139613834,
      "grad_norm": 0.6859836262913486,
      "learning_rate": 4.9981365782113645e-05,
      "loss": 2.2107,
      "num_input_tokens_seen": 1172282064,
      "step": 1490
    },
    {
      "epoch": 0.1581795035009548,
      "grad_norm": 1.0321609248253434,
      "learning_rate": 4.998133894466762e-05,
      "loss": 2.3721,
      "num_input_tokens_seen": 1173068752,
      "step": 1491
    },
    {
      "epoch": 0.1582855930405262,
      "grad_norm": 1.678561519122836,
      "learning_rate": 4.9981312087916756e-05,
      "loss": 2.3081,
      "num_input_tokens_seen": 1173855504,
      "step": 1492
    },
    {
      "epoch": 0.15839168258009761,
      "grad_norm": 0.7178435241946589,
      "learning_rate": 4.998128521186107e-05,
      "loss": 2.3207,
      "num_input_tokens_seen": 1174642256,
      "step": 1493
    },
    {
      "epoch": 0.158497772119669,
      "grad_norm": 1.3107138481563945,
      "learning_rate": 4.9981258316500576e-05,
      "loss": 2.2196,
      "num_input_tokens_seen": 1175429040,
      "step": 1494
    },
    {
      "epoch": 0.1586038616592404,
      "grad_norm": 1.2662212553061116,
      "learning_rate": 4.9981231401835296e-05,
      "loss": 2.3955,
      "num_input_tokens_seen": 1176215776,
      "step": 1495
    },
    {
      "epoch": 0.1587099511988118,
      "grad_norm": 0.8361104403609463,
      "learning_rate": 4.9981204467865255e-05,
      "loss": 2.4216,
      "num_input_tokens_seen": 1177002496,
      "step": 1496
    },
    {
      "epoch": 0.1588160407383832,
      "grad_norm": 1.3245122037251678,
      "learning_rate": 4.998117751459048e-05,
      "loss": 2.3214,
      "num_input_tokens_seen": 1177789152,
      "step": 1497
    },
    {
      "epoch": 0.1589221302779546,
      "grad_norm": 0.8351502088781726,
      "learning_rate": 4.9981150542010974e-05,
      "loss": 2.2211,
      "num_input_tokens_seen": 1178575920,
      "step": 1498
    },
    {
      "epoch": 0.159028219817526,
      "grad_norm": 0.8057293697843763,
      "learning_rate": 4.9981123550126775e-05,
      "loss": 2.424,
      "num_input_tokens_seen": 1179362624,
      "step": 1499
    },
    {
      "epoch": 0.15913430935709738,
      "grad_norm": 1.0433327393686251,
      "learning_rate": 4.998109653893789e-05,
      "loss": 2.0467,
      "num_input_tokens_seen": 1180149456,
      "step": 1500
    },
    {
      "epoch": 0.1592403988966688,
      "grad_norm": 0.7708380660273345,
      "learning_rate": 4.998106950844435e-05,
      "loss": 2.3052,
      "num_input_tokens_seen": 1180936240,
      "step": 1501
    },
    {
      "epoch": 0.1593464884362402,
      "grad_norm": 0.7567127956012482,
      "learning_rate": 4.998104245864617e-05,
      "loss": 2.4689,
      "num_input_tokens_seen": 1181722960,
      "step": 1502
    },
    {
      "epoch": 0.15945257797581158,
      "grad_norm": 1.0713897582195486,
      "learning_rate": 4.9981015389543374e-05,
      "loss": 2.0857,
      "num_input_tokens_seen": 1182509872,
      "step": 1503
    },
    {
      "epoch": 0.15955866751538297,
      "grad_norm": 1.6119893877289027,
      "learning_rate": 4.998098830113599e-05,
      "loss": 2.468,
      "num_input_tokens_seen": 1183296528,
      "step": 1504
    },
    {
      "epoch": 0.1596647570549544,
      "grad_norm": 0.5502663071446496,
      "learning_rate": 4.998096119342403e-05,
      "loss": 2.2642,
      "num_input_tokens_seen": 1184083296,
      "step": 1505
    },
    {
      "epoch": 0.15977084659452578,
      "grad_norm": 0.9849076803615154,
      "learning_rate": 4.9980934066407506e-05,
      "loss": 2.2223,
      "num_input_tokens_seen": 1184870032,
      "step": 1506
    },
    {
      "epoch": 0.15987693613409718,
      "grad_norm": 1.2075428226546252,
      "learning_rate": 4.998090692008645e-05,
      "loss": 2.3368,
      "num_input_tokens_seen": 1185656816,
      "step": 1507
    },
    {
      "epoch": 0.15998302567366857,
      "grad_norm": 0.7561075216065825,
      "learning_rate": 4.998087975446088e-05,
      "loss": 2.2474,
      "num_input_tokens_seen": 1186443632,
      "step": 1508
    },
    {
      "epoch": 0.16008911521323999,
      "grad_norm": 0.5580336036905762,
      "learning_rate": 4.9980852569530835e-05,
      "loss": 2.4175,
      "num_input_tokens_seen": 1187230480,
      "step": 1509
    },
    {
      "epoch": 0.16019520475281138,
      "grad_norm": 0.9407271447386618,
      "learning_rate": 4.998082536529631e-05,
      "loss": 2.3865,
      "num_input_tokens_seen": 1188017264,
      "step": 1510
    },
    {
      "epoch": 0.16030129429238277,
      "grad_norm": 1.174072954767199,
      "learning_rate": 4.9980798141757336e-05,
      "loss": 2.4088,
      "num_input_tokens_seen": 1188803920,
      "step": 1511
    },
    {
      "epoch": 0.16040738383195416,
      "grad_norm": 0.5660855084423467,
      "learning_rate": 4.998077089891394e-05,
      "loss": 2.1402,
      "num_input_tokens_seen": 1189590752,
      "step": 1512
    },
    {
      "epoch": 0.16051347337152558,
      "grad_norm": 0.8306294264705324,
      "learning_rate": 4.9980743636766124e-05,
      "loss": 2.5085,
      "num_input_tokens_seen": 1190377520,
      "step": 1513
    },
    {
      "epoch": 0.16061956291109697,
      "grad_norm": 2.0673924543020212,
      "learning_rate": 4.998071635531394e-05,
      "loss": 2.4208,
      "num_input_tokens_seen": 1191164336,
      "step": 1514
    },
    {
      "epoch": 0.16072565245066836,
      "grad_norm": 1.402228523825023,
      "learning_rate": 4.9980689054557376e-05,
      "loss": 2.4304,
      "num_input_tokens_seen": 1191951088,
      "step": 1515
    },
    {
      "epoch": 0.16083174199023975,
      "grad_norm": 1.3860177463462953,
      "learning_rate": 4.9980661734496476e-05,
      "loss": 2.3368,
      "num_input_tokens_seen": 1192737792,
      "step": 1516
    },
    {
      "epoch": 0.16093783152981117,
      "grad_norm": 0.6727992180111538,
      "learning_rate": 4.9980634395131255e-05,
      "loss": 2.228,
      "num_input_tokens_seen": 1193524544,
      "step": 1517
    },
    {
      "epoch": 0.16104392106938256,
      "grad_norm": 1.2648813245792612,
      "learning_rate": 4.9980607036461725e-05,
      "loss": 2.4138,
      "num_input_tokens_seen": 1194311312,
      "step": 1518
    },
    {
      "epoch": 0.16115001060895395,
      "grad_norm": 0.8951395092237587,
      "learning_rate": 4.998057965848792e-05,
      "loss": 2.213,
      "num_input_tokens_seen": 1195098192,
      "step": 1519
    },
    {
      "epoch": 0.16125610014852534,
      "grad_norm": 1.2738445590837526,
      "learning_rate": 4.998055226120986e-05,
      "loss": 2.3217,
      "num_input_tokens_seen": 1195884944,
      "step": 1520
    },
    {
      "epoch": 0.16136218968809676,
      "grad_norm": 0.8285076279664495,
      "learning_rate": 4.998052484462755e-05,
      "loss": 2.3113,
      "num_input_tokens_seen": 1196671728,
      "step": 1521
    },
    {
      "epoch": 0.16146827922766815,
      "grad_norm": 1.1545622679081364,
      "learning_rate": 4.998049740874103e-05,
      "loss": 2.3076,
      "num_input_tokens_seen": 1197458448,
      "step": 1522
    },
    {
      "epoch": 0.16157436876723955,
      "grad_norm": 1.127521091842819,
      "learning_rate": 4.9980469953550324e-05,
      "loss": 2.3,
      "num_input_tokens_seen": 1198245152,
      "step": 1523
    },
    {
      "epoch": 0.16168045830681094,
      "grad_norm": 1.058492875753623,
      "learning_rate": 4.9980442479055436e-05,
      "loss": 2.107,
      "num_input_tokens_seen": 1199031920,
      "step": 1524
    },
    {
      "epoch": 0.16178654784638236,
      "grad_norm": 0.8648894042016941,
      "learning_rate": 4.9980414985256397e-05,
      "loss": 2.4197,
      "num_input_tokens_seen": 1199818544,
      "step": 1525
    },
    {
      "epoch": 0.16189263738595375,
      "grad_norm": 0.8920839271659993,
      "learning_rate": 4.9980387472153225e-05,
      "loss": 2.3595,
      "num_input_tokens_seen": 1200605280,
      "step": 1526
    },
    {
      "epoch": 0.16199872692552514,
      "grad_norm": 0.5183636951372196,
      "learning_rate": 4.9980359939745936e-05,
      "loss": 2.2491,
      "num_input_tokens_seen": 1201392000,
      "step": 1527
    },
    {
      "epoch": 0.16210481646509653,
      "grad_norm": 0.7626323089818285,
      "learning_rate": 4.998033238803457e-05,
      "loss": 2.1807,
      "num_input_tokens_seen": 1202178832,
      "step": 1528
    },
    {
      "epoch": 0.16221090600466795,
      "grad_norm": 0.9780038131837968,
      "learning_rate": 4.998030481701912e-05,
      "loss": 2.3539,
      "num_input_tokens_seen": 1202965584,
      "step": 1529
    },
    {
      "epoch": 0.16231699554423934,
      "grad_norm": 1.0998601185855124,
      "learning_rate": 4.998027722669964e-05,
      "loss": 2.3719,
      "num_input_tokens_seen": 1203752384,
      "step": 1530
    },
    {
      "epoch": 0.16242308508381073,
      "grad_norm": 0.9250613407385152,
      "learning_rate": 4.9980249617076127e-05,
      "loss": 2.3855,
      "num_input_tokens_seen": 1204539120,
      "step": 1531
    },
    {
      "epoch": 0.16252917462338212,
      "grad_norm": 0.7907224770119538,
      "learning_rate": 4.9980221988148606e-05,
      "loss": 2.2803,
      "num_input_tokens_seen": 1205325872,
      "step": 1532
    },
    {
      "epoch": 0.16263526416295354,
      "grad_norm": 0.5584824384229559,
      "learning_rate": 4.998019433991711e-05,
      "loss": 2.1545,
      "num_input_tokens_seen": 1206112624,
      "step": 1533
    },
    {
      "epoch": 0.16274135370252493,
      "grad_norm": 0.7491528932446944,
      "learning_rate": 4.9980166672381645e-05,
      "loss": 2.1849,
      "num_input_tokens_seen": 1206899376,
      "step": 1534
    },
    {
      "epoch": 0.16284744324209632,
      "grad_norm": 0.9072401410846476,
      "learning_rate": 4.9980138985542245e-05,
      "loss": 2.1485,
      "num_input_tokens_seen": 1207686144,
      "step": 1535
    },
    {
      "epoch": 0.16295353278166771,
      "grad_norm": 0.9573561774999939,
      "learning_rate": 4.998011127939893e-05,
      "loss": 2.3346,
      "num_input_tokens_seen": 1208472944,
      "step": 1536
    },
    {
      "epoch": 0.16305962232123913,
      "grad_norm": 1.1465408358419749,
      "learning_rate": 4.9980083553951714e-05,
      "loss": 2.2379,
      "num_input_tokens_seen": 1209259728,
      "step": 1537
    },
    {
      "epoch": 0.16316571186081053,
      "grad_norm": 1.0194742328918882,
      "learning_rate": 4.9980055809200624e-05,
      "loss": 2.2221,
      "num_input_tokens_seen": 1210046544,
      "step": 1538
    },
    {
      "epoch": 0.16327180140038192,
      "grad_norm": 0.732589660664397,
      "learning_rate": 4.998002804514568e-05,
      "loss": 2.2999,
      "num_input_tokens_seen": 1210833360,
      "step": 1539
    },
    {
      "epoch": 0.1633778909399533,
      "grad_norm": 0.6717325737127741,
      "learning_rate": 4.9980000261786895e-05,
      "loss": 2.3747,
      "num_input_tokens_seen": 1211620096,
      "step": 1540
    },
    {
      "epoch": 0.16348398047952473,
      "grad_norm": 1.1389565480163268,
      "learning_rate": 4.997997245912431e-05,
      "loss": 2.252,
      "num_input_tokens_seen": 1212406880,
      "step": 1541
    },
    {
      "epoch": 0.16359007001909612,
      "grad_norm": 1.9739055226458422,
      "learning_rate": 4.997994463715793e-05,
      "loss": 2.0641,
      "num_input_tokens_seen": 1213193760,
      "step": 1542
    },
    {
      "epoch": 0.1636961595586675,
      "grad_norm": 0.6945736772687559,
      "learning_rate": 4.997991679588778e-05,
      "loss": 2.241,
      "num_input_tokens_seen": 1213980592,
      "step": 1543
    },
    {
      "epoch": 0.1638022490982389,
      "grad_norm": 1.7173926325907993,
      "learning_rate": 4.997988893531389e-05,
      "loss": 2.5161,
      "num_input_tokens_seen": 1214767312,
      "step": 1544
    },
    {
      "epoch": 0.16390833863781032,
      "grad_norm": 0.6857165609873849,
      "learning_rate": 4.997986105543627e-05,
      "loss": 2.167,
      "num_input_tokens_seen": 1215554128,
      "step": 1545
    },
    {
      "epoch": 0.1640144281773817,
      "grad_norm": 1.59193392675995,
      "learning_rate": 4.997983315625495e-05,
      "loss": 2.3331,
      "num_input_tokens_seen": 1216340816,
      "step": 1546
    },
    {
      "epoch": 0.1641205177169531,
      "grad_norm": 1.2180114731138985,
      "learning_rate": 4.997980523776994e-05,
      "loss": 2.3103,
      "num_input_tokens_seen": 1217127600,
      "step": 1547
    },
    {
      "epoch": 0.16422660725652452,
      "grad_norm": 1.037366193498555,
      "learning_rate": 4.997977729998128e-05,
      "loss": 2.1813,
      "num_input_tokens_seen": 1217914384,
      "step": 1548
    },
    {
      "epoch": 0.1643326967960959,
      "grad_norm": 1.3140875638456264,
      "learning_rate": 4.997974934288897e-05,
      "loss": 2.1438,
      "num_input_tokens_seen": 1218701104,
      "step": 1549
    },
    {
      "epoch": 0.1644387863356673,
      "grad_norm": 1.1738819524246964,
      "learning_rate": 4.9979721366493046e-05,
      "loss": 2.3421,
      "num_input_tokens_seen": 1219487856,
      "step": 1550
    },
    {
      "epoch": 0.1645448758752387,
      "grad_norm": 1.4830202902009784,
      "learning_rate": 4.997969337079354e-05,
      "loss": 2.1185,
      "num_input_tokens_seen": 1220274672,
      "step": 1551
    },
    {
      "epoch": 0.1646509654148101,
      "grad_norm": 1.0900819303334992,
      "learning_rate": 4.997966535579044e-05,
      "loss": 2.1467,
      "num_input_tokens_seen": 1221061424,
      "step": 1552
    },
    {
      "epoch": 0.1647570549543815,
      "grad_norm": 1.1679378194582002,
      "learning_rate": 4.99796373214838e-05,
      "loss": 2.2868,
      "num_input_tokens_seen": 1221848160,
      "step": 1553
    },
    {
      "epoch": 0.1648631444939529,
      "grad_norm": 1.2470556330921112,
      "learning_rate": 4.997960926787362e-05,
      "loss": 2.1606,
      "num_input_tokens_seen": 1222634944,
      "step": 1554
    },
    {
      "epoch": 0.1649692340335243,
      "grad_norm": 0.9498385081960835,
      "learning_rate": 4.997958119495993e-05,
      "loss": 2.5395,
      "num_input_tokens_seen": 1223421584,
      "step": 1555
    },
    {
      "epoch": 0.1650753235730957,
      "grad_norm": 1.3686683984285655,
      "learning_rate": 4.997955310274277e-05,
      "loss": 2.1108,
      "num_input_tokens_seen": 1224208272,
      "step": 1556
    },
    {
      "epoch": 0.1651814131126671,
      "grad_norm": 0.8423317932604939,
      "learning_rate": 4.997952499122213e-05,
      "loss": 2.2327,
      "num_input_tokens_seen": 1224995072,
      "step": 1557
    },
    {
      "epoch": 0.1652875026522385,
      "grad_norm": 0.7925749088324014,
      "learning_rate": 4.9979496860398043e-05,
      "loss": 2.2152,
      "num_input_tokens_seen": 1225781856,
      "step": 1558
    },
    {
      "epoch": 0.16539359219180988,
      "grad_norm": 0.8853709205170788,
      "learning_rate": 4.9979468710270544e-05,
      "loss": 2.2783,
      "num_input_tokens_seen": 1226568672,
      "step": 1559
    },
    {
      "epoch": 0.1654996817313813,
      "grad_norm": 1.1458218883890325,
      "learning_rate": 4.997944054083964e-05,
      "loss": 2.1992,
      "num_input_tokens_seen": 1227355424,
      "step": 1560
    },
    {
      "epoch": 0.1656057712709527,
      "grad_norm": 1.5895855992293362,
      "learning_rate": 4.997941235210536e-05,
      "loss": 2.3881,
      "num_input_tokens_seen": 1228142208,
      "step": 1561
    },
    {
      "epoch": 0.16571186081052408,
      "grad_norm": 0.670198022206656,
      "learning_rate": 4.997938414406772e-05,
      "loss": 2.2884,
      "num_input_tokens_seen": 1228928944,
      "step": 1562
    },
    {
      "epoch": 0.16581795035009547,
      "grad_norm": 0.9918466243059232,
      "learning_rate": 4.9979355916726745e-05,
      "loss": 2.3051,
      "num_input_tokens_seen": 1229715696,
      "step": 1563
    },
    {
      "epoch": 0.1659240398896669,
      "grad_norm": 1.0524617558735394,
      "learning_rate": 4.997932767008246e-05,
      "loss": 2.3034,
      "num_input_tokens_seen": 1230502384,
      "step": 1564
    },
    {
      "epoch": 0.16603012942923828,
      "grad_norm": 0.9243742627355275,
      "learning_rate": 4.997929940413488e-05,
      "loss": 2.1864,
      "num_input_tokens_seen": 1231289248,
      "step": 1565
    },
    {
      "epoch": 0.16613621896880967,
      "grad_norm": 0.9582232567168707,
      "learning_rate": 4.997927111888403e-05,
      "loss": 2.3331,
      "num_input_tokens_seen": 1232076016,
      "step": 1566
    },
    {
      "epoch": 0.16624230850838106,
      "grad_norm": 1.008285083172332,
      "learning_rate": 4.997924281432993e-05,
      "loss": 2.2399,
      "num_input_tokens_seen": 1232862768,
      "step": 1567
    },
    {
      "epoch": 0.16634839804795248,
      "grad_norm": 0.7217066338716328,
      "learning_rate": 4.997921449047261e-05,
      "loss": 2.3226,
      "num_input_tokens_seen": 1233649536,
      "step": 1568
    },
    {
      "epoch": 0.16645448758752387,
      "grad_norm": 0.9100433000173301,
      "learning_rate": 4.9979186147312087e-05,
      "loss": 2.3715,
      "num_input_tokens_seen": 1234436256,
      "step": 1569
    },
    {
      "epoch": 0.16656057712709527,
      "grad_norm": 1.0656786902101678,
      "learning_rate": 4.9979157784848376e-05,
      "loss": 2.4451,
      "num_input_tokens_seen": 1235222928,
      "step": 1570
    },
    {
      "epoch": 0.16666666666666666,
      "grad_norm": 1.286457052884174,
      "learning_rate": 4.99791294030815e-05,
      "loss": 2.1088,
      "num_input_tokens_seen": 1236009680,
      "step": 1571
    },
    {
      "epoch": 0.16677275620623808,
      "grad_norm": 0.8621696437490205,
      "learning_rate": 4.99791010020115e-05,
      "loss": 2.4058,
      "num_input_tokens_seen": 1236796448,
      "step": 1572
    },
    {
      "epoch": 0.16687884574580947,
      "grad_norm": 1.260106315003484,
      "learning_rate": 4.9979072581638376e-05,
      "loss": 2.6297,
      "num_input_tokens_seen": 1237583104,
      "step": 1573
    },
    {
      "epoch": 0.16698493528538086,
      "grad_norm": 1.1167221698259553,
      "learning_rate": 4.997904414196215e-05,
      "loss": 2.2982,
      "num_input_tokens_seen": 1238369888,
      "step": 1574
    },
    {
      "epoch": 0.16709102482495225,
      "grad_norm": 1.2776481045107662,
      "learning_rate": 4.9979015682982863e-05,
      "loss": 2.4085,
      "num_input_tokens_seen": 1239156640,
      "step": 1575
    },
    {
      "epoch": 0.16719711436452367,
      "grad_norm": 0.8498159379195183,
      "learning_rate": 4.997898720470052e-05,
      "loss": 2.3648,
      "num_input_tokens_seen": 1239943344,
      "step": 1576
    },
    {
      "epoch": 0.16730320390409506,
      "grad_norm": 1.0701558785185856,
      "learning_rate": 4.9978958707115155e-05,
      "loss": 2.4693,
      "num_input_tokens_seen": 1240730080,
      "step": 1577
    },
    {
      "epoch": 0.16740929344366645,
      "grad_norm": 1.4174726688005987,
      "learning_rate": 4.997893019022678e-05,
      "loss": 2.142,
      "num_input_tokens_seen": 1241516848,
      "step": 1578
    },
    {
      "epoch": 0.16751538298323784,
      "grad_norm": 1.1062542099526347,
      "learning_rate": 4.997890165403541e-05,
      "loss": 2.2077,
      "num_input_tokens_seen": 1242303664,
      "step": 1579
    },
    {
      "epoch": 0.16762147252280926,
      "grad_norm": 1.4680719733620546,
      "learning_rate": 4.99788730985411e-05,
      "loss": 2.095,
      "num_input_tokens_seen": 1243090496,
      "step": 1580
    },
    {
      "epoch": 0.16772756206238065,
      "grad_norm": 1.5787361794781007,
      "learning_rate": 4.997884452374383e-05,
      "loss": 2.415,
      "num_input_tokens_seen": 1243877296,
      "step": 1581
    },
    {
      "epoch": 0.16783365160195204,
      "grad_norm": 1.6703750547776512,
      "learning_rate": 4.9978815929643655e-05,
      "loss": 2.3012,
      "num_input_tokens_seen": 1244664016,
      "step": 1582
    },
    {
      "epoch": 0.16793974114152344,
      "grad_norm": 1.5442497900204992,
      "learning_rate": 4.997878731624058e-05,
      "loss": 2.1832,
      "num_input_tokens_seen": 1245450832,
      "step": 1583
    },
    {
      "epoch": 0.16804583068109485,
      "grad_norm": 2.4049763757025198,
      "learning_rate": 4.9978758683534624e-05,
      "loss": 2.3033,
      "num_input_tokens_seen": 1246237536,
      "step": 1584
    },
    {
      "epoch": 0.16815192022066625,
      "grad_norm": 1.7602519079785919,
      "learning_rate": 4.997873003152582e-05,
      "loss": 2.3598,
      "num_input_tokens_seen": 1247024288,
      "step": 1585
    },
    {
      "epoch": 0.16825800976023764,
      "grad_norm": 1.8935105617469339,
      "learning_rate": 4.997870136021419e-05,
      "loss": 2.3063,
      "num_input_tokens_seen": 1247810992,
      "step": 1586
    },
    {
      "epoch": 0.16836409929980903,
      "grad_norm": 1.150370169814257,
      "learning_rate": 4.997867266959975e-05,
      "loss": 2.0939,
      "num_input_tokens_seen": 1248597808,
      "step": 1587
    },
    {
      "epoch": 0.16847018883938045,
      "grad_norm": 1.2265499800637323,
      "learning_rate": 4.997864395968252e-05,
      "loss": 2.1878,
      "num_input_tokens_seen": 1249384608,
      "step": 1588
    },
    {
      "epoch": 0.16857627837895184,
      "grad_norm": 1.09844687943424,
      "learning_rate": 4.9978615230462544e-05,
      "loss": 2.3807,
      "num_input_tokens_seen": 1250171392,
      "step": 1589
    },
    {
      "epoch": 0.16868236791852323,
      "grad_norm": 0.7485827572417499,
      "learning_rate": 4.997858648193982e-05,
      "loss": 2.082,
      "num_input_tokens_seen": 1250958192,
      "step": 1590
    },
    {
      "epoch": 0.16878845745809462,
      "grad_norm": 0.6956254061724774,
      "learning_rate": 4.997855771411436e-05,
      "loss": 2.1815,
      "num_input_tokens_seen": 1251744880,
      "step": 1591
    },
    {
      "epoch": 0.16889454699766604,
      "grad_norm": 1.1921456337199634,
      "learning_rate": 4.997852892698622e-05,
      "loss": 2.2378,
      "num_input_tokens_seen": 1252531616,
      "step": 1592
    },
    {
      "epoch": 0.16900063653723743,
      "grad_norm": 1.0876526580971289,
      "learning_rate": 4.9978500120555403e-05,
      "loss": 2.2327,
      "num_input_tokens_seen": 1253318352,
      "step": 1593
    },
    {
      "epoch": 0.16910672607680882,
      "grad_norm": 1.1102666042397142,
      "learning_rate": 4.997847129482193e-05,
      "loss": 2.1122,
      "num_input_tokens_seen": 1254105056,
      "step": 1594
    },
    {
      "epoch": 0.1692128156163802,
      "grad_norm": 0.9326865954695664,
      "learning_rate": 4.9978442449785836e-05,
      "loss": 2.1812,
      "num_input_tokens_seen": 1254891872,
      "step": 1595
    },
    {
      "epoch": 0.16931890515595163,
      "grad_norm": 0.99160667916074,
      "learning_rate": 4.997841358544713e-05,
      "loss": 2.2836,
      "num_input_tokens_seen": 1255678560,
      "step": 1596
    },
    {
      "epoch": 0.16942499469552302,
      "grad_norm": 1.0888596419511278,
      "learning_rate": 4.9978384701805833e-05,
      "loss": 2.2391,
      "num_input_tokens_seen": 1256465280,
      "step": 1597
    },
    {
      "epoch": 0.16953108423509441,
      "grad_norm": 1.0942662224272508,
      "learning_rate": 4.997835579886197e-05,
      "loss": 2.3654,
      "num_input_tokens_seen": 1257252064,
      "step": 1598
    },
    {
      "epoch": 0.1696371737746658,
      "grad_norm": 0.5637566622277035,
      "learning_rate": 4.997832687661558e-05,
      "loss": 2.2973,
      "num_input_tokens_seen": 1258038928,
      "step": 1599
    },
    {
      "epoch": 0.16974326331423722,
      "grad_norm": 1.2682294142070019,
      "learning_rate": 4.997829793506667e-05,
      "loss": 2.2159,
      "num_input_tokens_seen": 1258825776,
      "step": 1600
    },
    {
      "epoch": 0.16984935285380862,
      "grad_norm": 0.6050771795062868,
      "learning_rate": 4.997826897421526e-05,
      "loss": 2.1444,
      "num_input_tokens_seen": 1259612656,
      "step": 1601
    },
    {
      "epoch": 0.16995544239338,
      "grad_norm": 1.0822295823486003,
      "learning_rate": 4.9978239994061376e-05,
      "loss": 2.1109,
      "num_input_tokens_seen": 1260399440,
      "step": 1602
    },
    {
      "epoch": 0.1700615319329514,
      "grad_norm": 1.2044213340958436,
      "learning_rate": 4.997821099460504e-05,
      "loss": 2.3586,
      "num_input_tokens_seen": 1261186272,
      "step": 1603
    },
    {
      "epoch": 0.17016762147252282,
      "grad_norm": 0.7124424263401994,
      "learning_rate": 4.9978181975846286e-05,
      "loss": 2.2785,
      "num_input_tokens_seen": 1261973104,
      "step": 1604
    },
    {
      "epoch": 0.1702737110120942,
      "grad_norm": 0.7866870758933505,
      "learning_rate": 4.997815293778511e-05,
      "loss": 2.2991,
      "num_input_tokens_seen": 1262759872,
      "step": 1605
    },
    {
      "epoch": 0.1703798005516656,
      "grad_norm": 0.6778565319659361,
      "learning_rate": 4.9978123880421554e-05,
      "loss": 2.1467,
      "num_input_tokens_seen": 1263546704,
      "step": 1606
    },
    {
      "epoch": 0.170485890091237,
      "grad_norm": 0.8901064382317069,
      "learning_rate": 4.997809480375565e-05,
      "loss": 2.2836,
      "num_input_tokens_seen": 1264333440,
      "step": 1607
    },
    {
      "epoch": 0.1705919796308084,
      "grad_norm": 1.140175725633749,
      "learning_rate": 4.997806570778739e-05,
      "loss": 2.209,
      "num_input_tokens_seen": 1265120192,
      "step": 1608
    },
    {
      "epoch": 0.1706980691703798,
      "grad_norm": 0.7698715713949869,
      "learning_rate": 4.9978036592516826e-05,
      "loss": 2.1747,
      "num_input_tokens_seen": 1265907008,
      "step": 1609
    },
    {
      "epoch": 0.1708041587099512,
      "grad_norm": 0.8557213148820753,
      "learning_rate": 4.9978007457943966e-05,
      "loss": 2.2476,
      "num_input_tokens_seen": 1266693728,
      "step": 1610
    },
    {
      "epoch": 0.17091024824952258,
      "grad_norm": 1.1667442242904906,
      "learning_rate": 4.997797830406883e-05,
      "loss": 2.3078,
      "num_input_tokens_seen": 1267480480,
      "step": 1611
    },
    {
      "epoch": 0.171016337789094,
      "grad_norm": 1.51225198553053,
      "learning_rate": 4.997794913089144e-05,
      "loss": 2.1618,
      "num_input_tokens_seen": 1268267296,
      "step": 1612
    },
    {
      "epoch": 0.1711224273286654,
      "grad_norm": 0.7442880769722428,
      "learning_rate": 4.997791993841184e-05,
      "loss": 2.3482,
      "num_input_tokens_seen": 1269054064,
      "step": 1613
    },
    {
      "epoch": 0.17122851686823679,
      "grad_norm": 2.508793466018329,
      "learning_rate": 4.997789072663003e-05,
      "loss": 2.3197,
      "num_input_tokens_seen": 1269840832,
      "step": 1614
    },
    {
      "epoch": 0.17133460640780818,
      "grad_norm": 1.4902977929546213,
      "learning_rate": 4.997786149554603e-05,
      "loss": 2.2837,
      "num_input_tokens_seen": 1270627568,
      "step": 1615
    },
    {
      "epoch": 0.1714406959473796,
      "grad_norm": 1.319214632714301,
      "learning_rate": 4.9977832245159885e-05,
      "loss": 2.3979,
      "num_input_tokens_seen": 1271414240,
      "step": 1616
    },
    {
      "epoch": 0.171546785486951,
      "grad_norm": 1.6393419361938686,
      "learning_rate": 4.9977802975471596e-05,
      "loss": 2.3674,
      "num_input_tokens_seen": 1272200944,
      "step": 1617
    },
    {
      "epoch": 0.17165287502652238,
      "grad_norm": 0.7582330623349595,
      "learning_rate": 4.9977773686481193e-05,
      "loss": 2.4176,
      "num_input_tokens_seen": 1272987712,
      "step": 1618
    },
    {
      "epoch": 0.1717589645660938,
      "grad_norm": 1.58727222623672,
      "learning_rate": 4.99777443781887e-05,
      "loss": 2.3121,
      "num_input_tokens_seen": 1273774496,
      "step": 1619
    },
    {
      "epoch": 0.1718650541056652,
      "grad_norm": 0.8485881742963406,
      "learning_rate": 4.997771505059414e-05,
      "loss": 2.1738,
      "num_input_tokens_seen": 1274561328,
      "step": 1620
    },
    {
      "epoch": 0.17197114364523658,
      "grad_norm": 0.8972267691527916,
      "learning_rate": 4.9977685703697544e-05,
      "loss": 2.1738,
      "num_input_tokens_seen": 1275348112,
      "step": 1621
    },
    {
      "epoch": 0.17207723318480797,
      "grad_norm": 1.035927746986235,
      "learning_rate": 4.997765633749891e-05,
      "loss": 2.2721,
      "num_input_tokens_seen": 1276134848,
      "step": 1622
    },
    {
      "epoch": 0.1721833227243794,
      "grad_norm": 2.192991984973893,
      "learning_rate": 4.9977626951998285e-05,
      "loss": 2.1749,
      "num_input_tokens_seen": 1276921664,
      "step": 1623
    },
    {
      "epoch": 0.17228941226395078,
      "grad_norm": 1.3548901705170486,
      "learning_rate": 4.997759754719568e-05,
      "loss": 2.3304,
      "num_input_tokens_seen": 1277708320,
      "step": 1624
    },
    {
      "epoch": 0.17239550180352217,
      "grad_norm": 3.1252080952736523,
      "learning_rate": 4.9977568123091126e-05,
      "loss": 2.3265,
      "num_input_tokens_seen": 1278495072,
      "step": 1625
    },
    {
      "epoch": 0.17250159134309356,
      "grad_norm": 1.9905928732525804,
      "learning_rate": 4.997753867968463e-05,
      "loss": 2.0518,
      "num_input_tokens_seen": 1279281920,
      "step": 1626
    },
    {
      "epoch": 0.17260768088266498,
      "grad_norm": 1.5870387539465893,
      "learning_rate": 4.997750921697623e-05,
      "loss": 2.4827,
      "num_input_tokens_seen": 1280068608,
      "step": 1627
    },
    {
      "epoch": 0.17271377042223637,
      "grad_norm": 1.095896096712823,
      "learning_rate": 4.997747973496595e-05,
      "loss": 2.3228,
      "num_input_tokens_seen": 1280855408,
      "step": 1628
    },
    {
      "epoch": 0.17281985996180776,
      "grad_norm": 1.3735893139469677,
      "learning_rate": 4.99774502336538e-05,
      "loss": 2.2279,
      "num_input_tokens_seen": 1281642208,
      "step": 1629
    },
    {
      "epoch": 0.17292594950137916,
      "grad_norm": 1.0553660116779195,
      "learning_rate": 4.9977420713039804e-05,
      "loss": 2.5044,
      "num_input_tokens_seen": 1282428912,
      "step": 1630
    },
    {
      "epoch": 0.17303203904095057,
      "grad_norm": 0.9652919629969376,
      "learning_rate": 4.9977391173124e-05,
      "loss": 2.3898,
      "num_input_tokens_seen": 1283215680,
      "step": 1631
    },
    {
      "epoch": 0.17313812858052197,
      "grad_norm": 1.1787042742788254,
      "learning_rate": 4.9977361613906394e-05,
      "loss": 2.3435,
      "num_input_tokens_seen": 1284002512,
      "step": 1632
    },
    {
      "epoch": 0.17324421812009336,
      "grad_norm": 0.9954155277194057,
      "learning_rate": 4.997733203538702e-05,
      "loss": 2.3606,
      "num_input_tokens_seen": 1284789280,
      "step": 1633
    },
    {
      "epoch": 0.17335030765966475,
      "grad_norm": 2.164846667717607,
      "learning_rate": 4.9977302437565896e-05,
      "loss": 2.266,
      "num_input_tokens_seen": 1285576016,
      "step": 1634
    },
    {
      "epoch": 0.17345639719923617,
      "grad_norm": 1.3543170398358875,
      "learning_rate": 4.997727282044304e-05,
      "loss": 2.246,
      "num_input_tokens_seen": 1286362768,
      "step": 1635
    },
    {
      "epoch": 0.17356248673880756,
      "grad_norm": 1.9638088190148653,
      "learning_rate": 4.997724318401849e-05,
      "loss": 2.1997,
      "num_input_tokens_seen": 1287149520,
      "step": 1636
    },
    {
      "epoch": 0.17366857627837895,
      "grad_norm": 1.5114260698970263,
      "learning_rate": 4.9977213528292256e-05,
      "loss": 2.1914,
      "num_input_tokens_seen": 1287936336,
      "step": 1637
    },
    {
      "epoch": 0.17377466581795034,
      "grad_norm": 1.8308099892798617,
      "learning_rate": 4.9977183853264365e-05,
      "loss": 2.3899,
      "num_input_tokens_seen": 1288723168,
      "step": 1638
    },
    {
      "epoch": 0.17388075535752176,
      "grad_norm": 1.3558583224151144,
      "learning_rate": 4.997715415893484e-05,
      "loss": 2.2486,
      "num_input_tokens_seen": 1289509952,
      "step": 1639
    },
    {
      "epoch": 0.17398684489709315,
      "grad_norm": 1.8056405254074506,
      "learning_rate": 4.99771244453037e-05,
      "loss": 2.2447,
      "num_input_tokens_seen": 1290296768,
      "step": 1640
    },
    {
      "epoch": 0.17409293443666454,
      "grad_norm": 1.2979273280866899,
      "learning_rate": 4.997709471237096e-05,
      "loss": 2.1575,
      "num_input_tokens_seen": 1291083488,
      "step": 1641
    },
    {
      "epoch": 0.17419902397623593,
      "grad_norm": 1.1868668377284388,
      "learning_rate": 4.9977064960136675e-05,
      "loss": 2.2045,
      "num_input_tokens_seen": 1291870352,
      "step": 1642
    },
    {
      "epoch": 0.17430511351580735,
      "grad_norm": 1.3420353830429321,
      "learning_rate": 4.997703518860084e-05,
      "loss": 2.3211,
      "num_input_tokens_seen": 1292657152,
      "step": 1643
    },
    {
      "epoch": 0.17441120305537874,
      "grad_norm": 1.2312171401460135,
      "learning_rate": 4.997700539776347e-05,
      "loss": 2.3775,
      "num_input_tokens_seen": 1293443984,
      "step": 1644
    },
    {
      "epoch": 0.17451729259495014,
      "grad_norm": 1.0768173284782323,
      "learning_rate": 4.9976975587624626e-05,
      "loss": 2.2438,
      "num_input_tokens_seen": 1294230736,
      "step": 1645
    },
    {
      "epoch": 0.17462338213452153,
      "grad_norm": 0.8938154881582936,
      "learning_rate": 4.99769457581843e-05,
      "loss": 2.2272,
      "num_input_tokens_seen": 1295017568,
      "step": 1646
    },
    {
      "epoch": 0.17472947167409295,
      "grad_norm": 0.9572883718553152,
      "learning_rate": 4.9976915909442525e-05,
      "loss": 2.2948,
      "num_input_tokens_seen": 1295804272,
      "step": 1647
    },
    {
      "epoch": 0.17483556121366434,
      "grad_norm": 0.5866693161519478,
      "learning_rate": 4.997688604139931e-05,
      "loss": 2.3806,
      "num_input_tokens_seen": 1296591040,
      "step": 1648
    },
    {
      "epoch": 0.17494165075323573,
      "grad_norm": 1.388028735997158,
      "learning_rate": 4.99768561540547e-05,
      "loss": 2.17,
      "num_input_tokens_seen": 1297377760,
      "step": 1649
    },
    {
      "epoch": 0.17504774029280712,
      "grad_norm": 1.0408943086775577,
      "learning_rate": 4.997682624740871e-05,
      "loss": 2.2624,
      "num_input_tokens_seen": 1298164496,
      "step": 1650
    },
    {
      "epoch": 0.17515382983237854,
      "grad_norm": 0.7654790395376171,
      "learning_rate": 4.997679632146136e-05,
      "loss": 2.1892,
      "num_input_tokens_seen": 1298951216,
      "step": 1651
    },
    {
      "epoch": 0.17525991937194993,
      "grad_norm": 0.6793474325073361,
      "learning_rate": 4.997676637621267e-05,
      "loss": 2.1899,
      "num_input_tokens_seen": 1299738032,
      "step": 1652
    },
    {
      "epoch": 0.17536600891152132,
      "grad_norm": 0.80899363305284,
      "learning_rate": 4.997673641166267e-05,
      "loss": 2.2924,
      "num_input_tokens_seen": 1300524720,
      "step": 1653
    },
    {
      "epoch": 0.1754720984510927,
      "grad_norm": 0.7998378066400907,
      "learning_rate": 4.997670642781138e-05,
      "loss": 2.2424,
      "num_input_tokens_seen": 1301311456,
      "step": 1654
    },
    {
      "epoch": 0.17557818799066413,
      "grad_norm": 0.6514635668072749,
      "learning_rate": 4.997667642465883e-05,
      "loss": 2.3831,
      "num_input_tokens_seen": 1302098224,
      "step": 1655
    },
    {
      "epoch": 0.17568427753023552,
      "grad_norm": 0.881529876577252,
      "learning_rate": 4.9976646402205034e-05,
      "loss": 2.4153,
      "num_input_tokens_seen": 1302885024,
      "step": 1656
    },
    {
      "epoch": 0.1757903670698069,
      "grad_norm": 0.7771279197660105,
      "learning_rate": 4.997661636045002e-05,
      "loss": 2.287,
      "num_input_tokens_seen": 1303671760,
      "step": 1657
    },
    {
      "epoch": 0.1758964566093783,
      "grad_norm": 0.8692463731011253,
      "learning_rate": 4.9976586299393804e-05,
      "loss": 2.1824,
      "num_input_tokens_seen": 1304458608,
      "step": 1658
    },
    {
      "epoch": 0.17600254614894972,
      "grad_norm": 0.8651666890369691,
      "learning_rate": 4.9976556219036416e-05,
      "loss": 2.2619,
      "num_input_tokens_seen": 1305245344,
      "step": 1659
    },
    {
      "epoch": 0.17610863568852111,
      "grad_norm": 0.9262539594219693,
      "learning_rate": 4.9976526119377886e-05,
      "loss": 2.2664,
      "num_input_tokens_seen": 1306032064,
      "step": 1660
    },
    {
      "epoch": 0.1762147252280925,
      "grad_norm": 0.9617636862402276,
      "learning_rate": 4.9976496000418225e-05,
      "loss": 2.2442,
      "num_input_tokens_seen": 1306818816,
      "step": 1661
    },
    {
      "epoch": 0.1763208147676639,
      "grad_norm": 0.8504044718843315,
      "learning_rate": 4.997646586215746e-05,
      "loss": 2.249,
      "num_input_tokens_seen": 1307605472,
      "step": 1662
    },
    {
      "epoch": 0.17642690430723532,
      "grad_norm": 0.6269643418665809,
      "learning_rate": 4.9976435704595616e-05,
      "loss": 2.2973,
      "num_input_tokens_seen": 1308392256,
      "step": 1663
    },
    {
      "epoch": 0.1765329938468067,
      "grad_norm": 1.0769116162629895,
      "learning_rate": 4.9976405527732716e-05,
      "loss": 2.4654,
      "num_input_tokens_seen": 1309178960,
      "step": 1664
    },
    {
      "epoch": 0.1766390833863781,
      "grad_norm": 1.4340829646543154,
      "learning_rate": 4.997637533156878e-05,
      "loss": 2.0162,
      "num_input_tokens_seen": 1309965728,
      "step": 1665
    },
    {
      "epoch": 0.1767451729259495,
      "grad_norm": 0.5974002617023337,
      "learning_rate": 4.997634511610384e-05,
      "loss": 2.129,
      "num_input_tokens_seen": 1310752560,
      "step": 1666
    },
    {
      "epoch": 0.1768512624655209,
      "grad_norm": 1.2206504408854424,
      "learning_rate": 4.9976314881337906e-05,
      "loss": 2.2899,
      "num_input_tokens_seen": 1311539392,
      "step": 1667
    },
    {
      "epoch": 0.1769573520050923,
      "grad_norm": 1.9058698798228297,
      "learning_rate": 4.997628462727101e-05,
      "loss": 2.2896,
      "num_input_tokens_seen": 1312326096,
      "step": 1668
    },
    {
      "epoch": 0.1770634415446637,
      "grad_norm": 0.648195059716401,
      "learning_rate": 4.997625435390317e-05,
      "loss": 2.2835,
      "num_input_tokens_seen": 1313112912,
      "step": 1669
    },
    {
      "epoch": 0.17716953108423508,
      "grad_norm": 2.699891222603868,
      "learning_rate": 4.997622406123443e-05,
      "loss": 2.5134,
      "num_input_tokens_seen": 1313899696,
      "step": 1670
    },
    {
      "epoch": 0.1772756206238065,
      "grad_norm": 0.8057046799699458,
      "learning_rate": 4.9976193749264784e-05,
      "loss": 2.2209,
      "num_input_tokens_seen": 1314686448,
      "step": 1671
    },
    {
      "epoch": 0.1773817101633779,
      "grad_norm": 3.3746758814095035,
      "learning_rate": 4.997616341799427e-05,
      "loss": 2.4574,
      "num_input_tokens_seen": 1315473168,
      "step": 1672
    },
    {
      "epoch": 0.17748779970294928,
      "grad_norm": 1.672000177428865,
      "learning_rate": 4.997613306742291e-05,
      "loss": 2.4185,
      "num_input_tokens_seen": 1316259968,
      "step": 1673
    },
    {
      "epoch": 0.17759388924252067,
      "grad_norm": 3.311791182141814,
      "learning_rate": 4.9976102697550724e-05,
      "loss": 2.3348,
      "num_input_tokens_seen": 1317046720,
      "step": 1674
    },
    {
      "epoch": 0.1776999787820921,
      "grad_norm": 2.501374630417596,
      "learning_rate": 4.997607230837774e-05,
      "loss": 2.1126,
      "num_input_tokens_seen": 1317833552,
      "step": 1675
    },
    {
      "epoch": 0.17780606832166349,
      "grad_norm": 1.8051113956514475,
      "learning_rate": 4.997604189990399e-05,
      "loss": 2.3666,
      "num_input_tokens_seen": 1318620288,
      "step": 1676
    },
    {
      "epoch": 0.17791215786123488,
      "grad_norm": 1.350682782585033,
      "learning_rate": 4.997601147212948e-05,
      "loss": 2.3097,
      "num_input_tokens_seen": 1319407056,
      "step": 1677
    },
    {
      "epoch": 0.17801824740080627,
      "grad_norm": 1.9086571580094331,
      "learning_rate": 4.997598102505424e-05,
      "loss": 2.2323,
      "num_input_tokens_seen": 1320193808,
      "step": 1678
    },
    {
      "epoch": 0.1781243369403777,
      "grad_norm": 1.8329620970851903,
      "learning_rate": 4.9975950558678294e-05,
      "loss": 2.445,
      "num_input_tokens_seen": 1320980464,
      "step": 1679
    },
    {
      "epoch": 0.17823042647994908,
      "grad_norm": 1.5349118776383952,
      "learning_rate": 4.997592007300167e-05,
      "loss": 2.157,
      "num_input_tokens_seen": 1321767264,
      "step": 1680
    },
    {
      "epoch": 0.17833651601952047,
      "grad_norm": 1.451130271182525,
      "learning_rate": 4.997588956802438e-05,
      "loss": 2.3517,
      "num_input_tokens_seen": 1322553952,
      "step": 1681
    },
    {
      "epoch": 0.17844260555909186,
      "grad_norm": 1.5394599562738407,
      "learning_rate": 4.9975859043746465e-05,
      "loss": 2.3936,
      "num_input_tokens_seen": 1323340720,
      "step": 1682
    },
    {
      "epoch": 0.17854869509866328,
      "grad_norm": 1.3876698072068636,
      "learning_rate": 4.9975828500167934e-05,
      "loss": 2.3279,
      "num_input_tokens_seen": 1324127536,
      "step": 1683
    },
    {
      "epoch": 0.17865478463823467,
      "grad_norm": 1.1682855529585066,
      "learning_rate": 4.9975797937288816e-05,
      "loss": 2.4379,
      "num_input_tokens_seen": 1324914288,
      "step": 1684
    },
    {
      "epoch": 0.17876087417780606,
      "grad_norm": 1.2680756876166495,
      "learning_rate": 4.997576735510914e-05,
      "loss": 2.2267,
      "num_input_tokens_seen": 1325701040,
      "step": 1685
    },
    {
      "epoch": 0.17886696371737745,
      "grad_norm": 0.8983790857906516,
      "learning_rate": 4.997573675362891e-05,
      "loss": 2.2515,
      "num_input_tokens_seen": 1326487824,
      "step": 1686
    },
    {
      "epoch": 0.17897305325694887,
      "grad_norm": 0.9848502652429761,
      "learning_rate": 4.997570613284818e-05,
      "loss": 2.4008,
      "num_input_tokens_seen": 1327274624,
      "step": 1687
    },
    {
      "epoch": 0.17907914279652026,
      "grad_norm": 0.5652758529271741,
      "learning_rate": 4.997567549276695e-05,
      "loss": 2.1093,
      "num_input_tokens_seen": 1328061408,
      "step": 1688
    },
    {
      "epoch": 0.17918523233609165,
      "grad_norm": 0.7977126055037308,
      "learning_rate": 4.997564483338525e-05,
      "loss": 2.2763,
      "num_input_tokens_seen": 1328848160,
      "step": 1689
    },
    {
      "epoch": 0.17929132187566307,
      "grad_norm": 0.9555052363177302,
      "learning_rate": 4.99756141547031e-05,
      "loss": 2.4352,
      "num_input_tokens_seen": 1329634816,
      "step": 1690
    },
    {
      "epoch": 0.17939741141523446,
      "grad_norm": 0.7181700402580733,
      "learning_rate": 4.9975583456720534e-05,
      "loss": 2.0853,
      "num_input_tokens_seen": 1330421616,
      "step": 1691
    },
    {
      "epoch": 0.17950350095480586,
      "grad_norm": 0.6446418579086013,
      "learning_rate": 4.997555273943757e-05,
      "loss": 2.1766,
      "num_input_tokens_seen": 1331208288,
      "step": 1692
    },
    {
      "epoch": 0.17960959049437725,
      "grad_norm": 0.7576196573099707,
      "learning_rate": 4.9975522002854226e-05,
      "loss": 2.2943,
      "num_input_tokens_seen": 1331995008,
      "step": 1693
    },
    {
      "epoch": 0.17971568003394867,
      "grad_norm": 0.8553496826159798,
      "learning_rate": 4.997549124697054e-05,
      "loss": 2.2486,
      "num_input_tokens_seen": 1332781760,
      "step": 1694
    },
    {
      "epoch": 0.17982176957352006,
      "grad_norm": 0.7512745986242089,
      "learning_rate": 4.9975460471786516e-05,
      "loss": 2.0808,
      "num_input_tokens_seen": 1333568592,
      "step": 1695
    },
    {
      "epoch": 0.17992785911309145,
      "grad_norm": 1.1391310280446787,
      "learning_rate": 4.99754296773022e-05,
      "loss": 2.2643,
      "num_input_tokens_seen": 1334355344,
      "step": 1696
    },
    {
      "epoch": 0.18003394865266284,
      "grad_norm": 1.7427387797198597,
      "learning_rate": 4.9975398863517595e-05,
      "loss": 2.1437,
      "num_input_tokens_seen": 1335142112,
      "step": 1697
    },
    {
      "epoch": 0.18014003819223426,
      "grad_norm": 0.8212014015182153,
      "learning_rate": 4.9975368030432744e-05,
      "loss": 2.3422,
      "num_input_tokens_seen": 1335928880,
      "step": 1698
    },
    {
      "epoch": 0.18024612773180565,
      "grad_norm": 2.189612161900393,
      "learning_rate": 4.997533717804766e-05,
      "loss": 2.189,
      "num_input_tokens_seen": 1336715632,
      "step": 1699
    },
    {
      "epoch": 0.18035221727137704,
      "grad_norm": 1.157112852344745,
      "learning_rate": 4.997530630636237e-05,
      "loss": 2.1121,
      "num_input_tokens_seen": 1337502464,
      "step": 1700
    },
    {
      "epoch": 0.18045830681094843,
      "grad_norm": 2.582522871963334,
      "learning_rate": 4.997527541537689e-05,
      "loss": 2.269,
      "num_input_tokens_seen": 1338289296,
      "step": 1701
    },
    {
      "epoch": 0.18056439635051985,
      "grad_norm": 2.1392547333626832,
      "learning_rate": 4.9975244505091245e-05,
      "loss": 2.3872,
      "num_input_tokens_seen": 1339076048,
      "step": 1702
    },
    {
      "epoch": 0.18067048589009124,
      "grad_norm": 1.2861204511556135,
      "learning_rate": 4.9975213575505475e-05,
      "loss": 2.1914,
      "num_input_tokens_seen": 1339862848,
      "step": 1703
    },
    {
      "epoch": 0.18077657542966263,
      "grad_norm": 2.2465943674846782,
      "learning_rate": 4.9975182626619585e-05,
      "loss": 2.4676,
      "num_input_tokens_seen": 1340649552,
      "step": 1704
    },
    {
      "epoch": 0.18088266496923402,
      "grad_norm": 0.97213750873222,
      "learning_rate": 4.9975151658433616e-05,
      "loss": 2.2094,
      "num_input_tokens_seen": 1341436304,
      "step": 1705
    },
    {
      "epoch": 0.18098875450880544,
      "grad_norm": 1.353338471519467,
      "learning_rate": 4.9975120670947574e-05,
      "loss": 2.1834,
      "num_input_tokens_seen": 1342223056,
      "step": 1706
    },
    {
      "epoch": 0.18109484404837684,
      "grad_norm": 0.9762253983636737,
      "learning_rate": 4.9975089664161494e-05,
      "loss": 2.5383,
      "num_input_tokens_seen": 1343009888,
      "step": 1707
    },
    {
      "epoch": 0.18120093358794823,
      "grad_norm": 1.8407767056099913,
      "learning_rate": 4.99750586380754e-05,
      "loss": 2.392,
      "num_input_tokens_seen": 1343796656,
      "step": 1708
    },
    {
      "epoch": 0.18130702312751962,
      "grad_norm": 1.5925743176697815,
      "learning_rate": 4.997502759268931e-05,
      "loss": 2.432,
      "num_input_tokens_seen": 1344583408,
      "step": 1709
    },
    {
      "epoch": 0.18141311266709104,
      "grad_norm": 1.4715763414408327,
      "learning_rate": 4.997499652800326e-05,
      "loss": 2.2561,
      "num_input_tokens_seen": 1345370192,
      "step": 1710
    },
    {
      "epoch": 0.18151920220666243,
      "grad_norm": 3.1232677558396835,
      "learning_rate": 4.997496544401725e-05,
      "loss": 2.3341,
      "num_input_tokens_seen": 1346156976,
      "step": 1711
    },
    {
      "epoch": 0.18162529174623382,
      "grad_norm": 1.9100608711814124,
      "learning_rate": 4.997493434073133e-05,
      "loss": 2.4063,
      "num_input_tokens_seen": 1346943744,
      "step": 1712
    },
    {
      "epoch": 0.1817313812858052,
      "grad_norm": 2.681823156745278,
      "learning_rate": 4.997490321814551e-05,
      "loss": 2.1679,
      "num_input_tokens_seen": 1347730592,
      "step": 1713
    },
    {
      "epoch": 0.18183747082537663,
      "grad_norm": 1.9626321309630599,
      "learning_rate": 4.997487207625982e-05,
      "loss": 2.3497,
      "num_input_tokens_seen": 1348517280,
      "step": 1714
    },
    {
      "epoch": 0.18194356036494802,
      "grad_norm": 4.042663627233808,
      "learning_rate": 4.997484091507428e-05,
      "loss": 2.3212,
      "num_input_tokens_seen": 1349304000,
      "step": 1715
    },
    {
      "epoch": 0.1820496499045194,
      "grad_norm": 3.87941248002062,
      "learning_rate": 4.9974809734588916e-05,
      "loss": 2.4199,
      "num_input_tokens_seen": 1350090656,
      "step": 1716
    },
    {
      "epoch": 0.1821557394440908,
      "grad_norm": 1.479206883078438,
      "learning_rate": 4.9974778534803756e-05,
      "loss": 2.2031,
      "num_input_tokens_seen": 1350877424,
      "step": 1717
    },
    {
      "epoch": 0.18226182898366222,
      "grad_norm": 1.6236220957269103,
      "learning_rate": 4.9974747315718815e-05,
      "loss": 2.1045,
      "num_input_tokens_seen": 1351664256,
      "step": 1718
    },
    {
      "epoch": 0.1823679185232336,
      "grad_norm": 1.2141199849028885,
      "learning_rate": 4.9974716077334127e-05,
      "loss": 2.3274,
      "num_input_tokens_seen": 1352451024,
      "step": 1719
    },
    {
      "epoch": 0.182474008062805,
      "grad_norm": 1.6325939283894093,
      "learning_rate": 4.997468481964971e-05,
      "loss": 2.2304,
      "num_input_tokens_seen": 1353237744,
      "step": 1720
    },
    {
      "epoch": 0.1825800976023764,
      "grad_norm": 1.018149679960919,
      "learning_rate": 4.997465354266558e-05,
      "loss": 2.1534,
      "num_input_tokens_seen": 1354024576,
      "step": 1721
    },
    {
      "epoch": 0.18268618714194781,
      "grad_norm": 1.165138876778227,
      "learning_rate": 4.997462224638178e-05,
      "loss": 2.223,
      "num_input_tokens_seen": 1354811344,
      "step": 1722
    },
    {
      "epoch": 0.1827922766815192,
      "grad_norm": 0.9854631275882084,
      "learning_rate": 4.997459093079832e-05,
      "loss": 2.2168,
      "num_input_tokens_seen": 1355598016,
      "step": 1723
    },
    {
      "epoch": 0.1828983662210906,
      "grad_norm": 1.3430285739732126,
      "learning_rate": 4.997455959591523e-05,
      "loss": 2.254,
      "num_input_tokens_seen": 1356384848,
      "step": 1724
    },
    {
      "epoch": 0.183004455760662,
      "grad_norm": 1.1251056271320896,
      "learning_rate": 4.9974528241732535e-05,
      "loss": 2.3872,
      "num_input_tokens_seen": 1357171664,
      "step": 1725
    },
    {
      "epoch": 0.1831105453002334,
      "grad_norm": 1.7150464213294807,
      "learning_rate": 4.997449686825026e-05,
      "loss": 2.2901,
      "num_input_tokens_seen": 1357958448,
      "step": 1726
    },
    {
      "epoch": 0.1832166348398048,
      "grad_norm": 1.410278346826914,
      "learning_rate": 4.9974465475468425e-05,
      "loss": 2.2128,
      "num_input_tokens_seen": 1358745312,
      "step": 1727
    },
    {
      "epoch": 0.1833227243793762,
      "grad_norm": 0.993207365085967,
      "learning_rate": 4.9974434063387053e-05,
      "loss": 2.1488,
      "num_input_tokens_seen": 1359532032,
      "step": 1728
    },
    {
      "epoch": 0.18342881391894758,
      "grad_norm": 1.8317233297350506,
      "learning_rate": 4.9974402632006165e-05,
      "loss": 2.3127,
      "num_input_tokens_seen": 1360318816,
      "step": 1729
    },
    {
      "epoch": 0.183534903458519,
      "grad_norm": 1.327837978136491,
      "learning_rate": 4.997437118132581e-05,
      "loss": 2.2759,
      "num_input_tokens_seen": 1361105600,
      "step": 1730
    },
    {
      "epoch": 0.1836409929980904,
      "grad_norm": 2.184483097131476,
      "learning_rate": 4.9974339711345974e-05,
      "loss": 2.1326,
      "num_input_tokens_seen": 1361892352,
      "step": 1731
    },
    {
      "epoch": 0.18374708253766178,
      "grad_norm": 1.6526583356238265,
      "learning_rate": 4.997430822206671e-05,
      "loss": 2.2143,
      "num_input_tokens_seen": 1362679088,
      "step": 1732
    },
    {
      "epoch": 0.18385317207723317,
      "grad_norm": 1.861856570385224,
      "learning_rate": 4.997427671348803e-05,
      "loss": 2.1733,
      "num_input_tokens_seen": 1363465920,
      "step": 1733
    },
    {
      "epoch": 0.1839592616168046,
      "grad_norm": 1.0748168906854343,
      "learning_rate": 4.997424518560997e-05,
      "loss": 2.2913,
      "num_input_tokens_seen": 1364252720,
      "step": 1734
    },
    {
      "epoch": 0.18406535115637598,
      "grad_norm": 1.2768846849050162,
      "learning_rate": 4.9974213638432546e-05,
      "loss": 2.2276,
      "num_input_tokens_seen": 1365039520,
      "step": 1735
    },
    {
      "epoch": 0.18417144069594737,
      "grad_norm": 0.9459869690146739,
      "learning_rate": 4.997418207195578e-05,
      "loss": 2.2467,
      "num_input_tokens_seen": 1365826320,
      "step": 1736
    },
    {
      "epoch": 0.18427753023551877,
      "grad_norm": 0.7338196351459183,
      "learning_rate": 4.997415048617969e-05,
      "loss": 2.3011,
      "num_input_tokens_seen": 1366612976,
      "step": 1737
    },
    {
      "epoch": 0.18438361977509019,
      "grad_norm": 1.7381629327027566,
      "learning_rate": 4.9974118881104315e-05,
      "loss": 2.1916,
      "num_input_tokens_seen": 1367399744,
      "step": 1738
    },
    {
      "epoch": 0.18448970931466158,
      "grad_norm": 0.8133791226094624,
      "learning_rate": 4.997408725672967e-05,
      "loss": 2.075,
      "num_input_tokens_seen": 1368186592,
      "step": 1739
    },
    {
      "epoch": 0.18459579885423297,
      "grad_norm": 1.592489230451955,
      "learning_rate": 4.997405561305579e-05,
      "loss": 2.2204,
      "num_input_tokens_seen": 1368973360,
      "step": 1740
    },
    {
      "epoch": 0.18470188839380436,
      "grad_norm": 0.9964054353613134,
      "learning_rate": 4.9974023950082694e-05,
      "loss": 2.2744,
      "num_input_tokens_seen": 1369760112,
      "step": 1741
    },
    {
      "epoch": 0.18480797793337578,
      "grad_norm": 1.677279612095753,
      "learning_rate": 4.9973992267810396e-05,
      "loss": 2.1446,
      "num_input_tokens_seen": 1370546896,
      "step": 1742
    },
    {
      "epoch": 0.18491406747294717,
      "grad_norm": 1.6587578274505967,
      "learning_rate": 4.9973960566238934e-05,
      "loss": 2.3048,
      "num_input_tokens_seen": 1371333648,
      "step": 1743
    },
    {
      "epoch": 0.18502015701251856,
      "grad_norm": 1.728143910975682,
      "learning_rate": 4.9973928845368334e-05,
      "loss": 2.3424,
      "num_input_tokens_seen": 1372120320,
      "step": 1744
    },
    {
      "epoch": 0.18512624655208995,
      "grad_norm": 1.2842051419791083,
      "learning_rate": 4.997389710519861e-05,
      "loss": 2.3729,
      "num_input_tokens_seen": 1372907088,
      "step": 1745
    },
    {
      "epoch": 0.18523233609166137,
      "grad_norm": 1.561789159321775,
      "learning_rate": 4.997386534572979e-05,
      "loss": 2.1277,
      "num_input_tokens_seen": 1373693824,
      "step": 1746
    },
    {
      "epoch": 0.18533842563123276,
      "grad_norm": 1.0964024232756893,
      "learning_rate": 4.99738335669619e-05,
      "loss": 2.2035,
      "num_input_tokens_seen": 1374480560,
      "step": 1747
    },
    {
      "epoch": 0.18544451517080415,
      "grad_norm": 1.4633284772642874,
      "learning_rate": 4.997380176889496e-05,
      "loss": 2.3544,
      "num_input_tokens_seen": 1375267248,
      "step": 1748
    },
    {
      "epoch": 0.18555060471037554,
      "grad_norm": 1.0359457493513955,
      "learning_rate": 4.9973769951529004e-05,
      "loss": 2.2795,
      "num_input_tokens_seen": 1376053984,
      "step": 1749
    },
    {
      "epoch": 0.18565669424994696,
      "grad_norm": 1.1062265827189077,
      "learning_rate": 4.9973738114864054e-05,
      "loss": 2.3389,
      "num_input_tokens_seen": 1376840784,
      "step": 1750
    },
    {
      "epoch": 0.18576278378951835,
      "grad_norm": 0.948748933619456,
      "learning_rate": 4.997370625890012e-05,
      "loss": 2.1329,
      "num_input_tokens_seen": 1377627552,
      "step": 1751
    },
    {
      "epoch": 0.18586887332908975,
      "grad_norm": 1.0883742098397073,
      "learning_rate": 4.9973674383637256e-05,
      "loss": 2.1346,
      "num_input_tokens_seen": 1378414288,
      "step": 1752
    },
    {
      "epoch": 0.18597496286866114,
      "grad_norm": 0.8902388692814708,
      "learning_rate": 4.9973642489075455e-05,
      "loss": 2.2064,
      "num_input_tokens_seen": 1379201040,
      "step": 1753
    },
    {
      "epoch": 0.18608105240823256,
      "grad_norm": 2.0091626366672117,
      "learning_rate": 4.997361057521476e-05,
      "loss": 2.1014,
      "num_input_tokens_seen": 1379987840,
      "step": 1754
    },
    {
      "epoch": 0.18618714194780395,
      "grad_norm": 0.982088397142272,
      "learning_rate": 4.9973578642055194e-05,
      "loss": 2.3358,
      "num_input_tokens_seen": 1380774656,
      "step": 1755
    },
    {
      "epoch": 0.18629323148737534,
      "grad_norm": 1.024597874635068,
      "learning_rate": 4.997354668959678e-05,
      "loss": 2.288,
      "num_input_tokens_seen": 1381561424,
      "step": 1756
    },
    {
      "epoch": 0.18639932102694673,
      "grad_norm": 1.0513597567378778,
      "learning_rate": 4.9973514717839535e-05,
      "loss": 2.3168,
      "num_input_tokens_seen": 1382348176,
      "step": 1757
    },
    {
      "epoch": 0.18650541056651815,
      "grad_norm": 0.6845599200242278,
      "learning_rate": 4.997348272678349e-05,
      "loss": 2.3159,
      "num_input_tokens_seen": 1383134944,
      "step": 1758
    },
    {
      "epoch": 0.18661150010608954,
      "grad_norm": 0.7241079627873204,
      "learning_rate": 4.997345071642868e-05,
      "loss": 2.2268,
      "num_input_tokens_seen": 1383921728,
      "step": 1759
    },
    {
      "epoch": 0.18671758964566093,
      "grad_norm": 0.6367059760280642,
      "learning_rate": 4.997341868677512e-05,
      "loss": 2.2946,
      "num_input_tokens_seen": 1384708592,
      "step": 1760
    },
    {
      "epoch": 0.18682367918523235,
      "grad_norm": 0.9784919861954443,
      "learning_rate": 4.997338663782283e-05,
      "loss": 2.3037,
      "num_input_tokens_seen": 1385495296,
      "step": 1761
    },
    {
      "epoch": 0.18692976872480374,
      "grad_norm": 0.6593968326297142,
      "learning_rate": 4.997335456957184e-05,
      "loss": 2.3337,
      "num_input_tokens_seen": 1386281936,
      "step": 1762
    },
    {
      "epoch": 0.18703585826437513,
      "grad_norm": 1.1143727329010464,
      "learning_rate": 4.997332248202217e-05,
      "loss": 2.2238,
      "num_input_tokens_seen": 1387068720,
      "step": 1763
    },
    {
      "epoch": 0.18714194780394652,
      "grad_norm": 0.9758051196183158,
      "learning_rate": 4.9973290375173854e-05,
      "loss": 2.0777,
      "num_input_tokens_seen": 1387855616,
      "step": 1764
    },
    {
      "epoch": 0.18724803734351794,
      "grad_norm": 1.2797398090455192,
      "learning_rate": 4.997325824902691e-05,
      "loss": 2.2593,
      "num_input_tokens_seen": 1388642320,
      "step": 1765
    },
    {
      "epoch": 0.18735412688308933,
      "grad_norm": 0.7245287059158173,
      "learning_rate": 4.997322610358137e-05,
      "loss": 1.9838,
      "num_input_tokens_seen": 1389429152,
      "step": 1766
    },
    {
      "epoch": 0.18746021642266072,
      "grad_norm": 1.294149835888566,
      "learning_rate": 4.997319393883725e-05,
      "loss": 2.2761,
      "num_input_tokens_seen": 1390215952,
      "step": 1767
    },
    {
      "epoch": 0.18756630596223212,
      "grad_norm": 0.649056147479288,
      "learning_rate": 4.997316175479458e-05,
      "loss": 2.4925,
      "num_input_tokens_seen": 1391002688,
      "step": 1768
    },
    {
      "epoch": 0.18767239550180354,
      "grad_norm": 1.4670276240890159,
      "learning_rate": 4.997312955145338e-05,
      "loss": 2.5021,
      "num_input_tokens_seen": 1391789360,
      "step": 1769
    },
    {
      "epoch": 0.18777848504137493,
      "grad_norm": 0.9826293796948258,
      "learning_rate": 4.997309732881368e-05,
      "loss": 2.3311,
      "num_input_tokens_seen": 1392576208,
      "step": 1770
    },
    {
      "epoch": 0.18788457458094632,
      "grad_norm": 0.8164611379177276,
      "learning_rate": 4.99730650868755e-05,
      "loss": 2.1629,
      "num_input_tokens_seen": 1393362928,
      "step": 1771
    },
    {
      "epoch": 0.1879906641205177,
      "grad_norm": 1.079798486718667,
      "learning_rate": 4.997303282563888e-05,
      "loss": 2.2533,
      "num_input_tokens_seen": 1394149648,
      "step": 1772
    },
    {
      "epoch": 0.18809675366008913,
      "grad_norm": 0.7683732219601255,
      "learning_rate": 4.997300054510382e-05,
      "loss": 2.2528,
      "num_input_tokens_seen": 1394936432,
      "step": 1773
    },
    {
      "epoch": 0.18820284319966052,
      "grad_norm": 0.8690758515846522,
      "learning_rate": 4.997296824527036e-05,
      "loss": 2.179,
      "num_input_tokens_seen": 1395723312,
      "step": 1774
    },
    {
      "epoch": 0.1883089327392319,
      "grad_norm": 0.81526462504133,
      "learning_rate": 4.997293592613852e-05,
      "loss": 2.3462,
      "num_input_tokens_seen": 1396509984,
      "step": 1775
    },
    {
      "epoch": 0.1884150222788033,
      "grad_norm": 0.8083561392671219,
      "learning_rate": 4.9972903587708334e-05,
      "loss": 2.3367,
      "num_input_tokens_seen": 1397296736,
      "step": 1776
    },
    {
      "epoch": 0.18852111181837472,
      "grad_norm": 0.5383011952886622,
      "learning_rate": 4.9972871229979824e-05,
      "loss": 2.0828,
      "num_input_tokens_seen": 1398083536,
      "step": 1777
    },
    {
      "epoch": 0.1886272013579461,
      "grad_norm": 0.6188425666532442,
      "learning_rate": 4.997283885295301e-05,
      "loss": 2.1755,
      "num_input_tokens_seen": 1398870416,
      "step": 1778
    },
    {
      "epoch": 0.1887332908975175,
      "grad_norm": 0.7508422077568861,
      "learning_rate": 4.9972806456627906e-05,
      "loss": 2.3875,
      "num_input_tokens_seen": 1399657280,
      "step": 1779
    },
    {
      "epoch": 0.1888393804370889,
      "grad_norm": 0.6459542425296713,
      "learning_rate": 4.9972774041004566e-05,
      "loss": 2.111,
      "num_input_tokens_seen": 1400444096,
      "step": 1780
    },
    {
      "epoch": 0.1889454699766603,
      "grad_norm": 0.7476057789589525,
      "learning_rate": 4.9972741606082996e-05,
      "loss": 2.3209,
      "num_input_tokens_seen": 1401230832,
      "step": 1781
    },
    {
      "epoch": 0.1890515595162317,
      "grad_norm": 1.102398005271788,
      "learning_rate": 4.997270915186322e-05,
      "loss": 2.2102,
      "num_input_tokens_seen": 1402017616,
      "step": 1782
    },
    {
      "epoch": 0.1891576490558031,
      "grad_norm": 1.6268648863520145,
      "learning_rate": 4.997267667834526e-05,
      "loss": 2.2608,
      "num_input_tokens_seen": 1402804448,
      "step": 1783
    },
    {
      "epoch": 0.1892637385953745,
      "grad_norm": 0.6288996933637926,
      "learning_rate": 4.997264418552916e-05,
      "loss": 2.2084,
      "num_input_tokens_seen": 1403591216,
      "step": 1784
    },
    {
      "epoch": 0.1893698281349459,
      "grad_norm": 1.3653353749124748,
      "learning_rate": 4.997261167341493e-05,
      "loss": 2.1338,
      "num_input_tokens_seen": 1404378048,
      "step": 1785
    },
    {
      "epoch": 0.1894759176745173,
      "grad_norm": 1.1325595364172674,
      "learning_rate": 4.99725791420026e-05,
      "loss": 2.3061,
      "num_input_tokens_seen": 1405164864,
      "step": 1786
    },
    {
      "epoch": 0.1895820072140887,
      "grad_norm": 0.7898421221491287,
      "learning_rate": 4.997254659129219e-05,
      "loss": 2.1615,
      "num_input_tokens_seen": 1405951712,
      "step": 1787
    },
    {
      "epoch": 0.18968809675366008,
      "grad_norm": 1.0881628171055053,
      "learning_rate": 4.997251402128374e-05,
      "loss": 2.4092,
      "num_input_tokens_seen": 1406738480,
      "step": 1788
    },
    {
      "epoch": 0.1897941862932315,
      "grad_norm": 1.170266793806146,
      "learning_rate": 4.9972481431977246e-05,
      "loss": 2.4022,
      "num_input_tokens_seen": 1407525344,
      "step": 1789
    },
    {
      "epoch": 0.1899002758328029,
      "grad_norm": 0.8653449184306411,
      "learning_rate": 4.997244882337276e-05,
      "loss": 2.1571,
      "num_input_tokens_seen": 1408312096,
      "step": 1790
    },
    {
      "epoch": 0.19000636537237428,
      "grad_norm": 1.0487107031960674,
      "learning_rate": 4.9972416195470295e-05,
      "loss": 2.1578,
      "num_input_tokens_seen": 1409098928,
      "step": 1791
    },
    {
      "epoch": 0.19011245491194567,
      "grad_norm": 1.3328886762321286,
      "learning_rate": 4.997238354826989e-05,
      "loss": 2.1734,
      "num_input_tokens_seen": 1409885696,
      "step": 1792
    },
    {
      "epoch": 0.1902185444515171,
      "grad_norm": 0.6241464822584074,
      "learning_rate": 4.997235088177154e-05,
      "loss": 2.2163,
      "num_input_tokens_seen": 1410672432,
      "step": 1793
    },
    {
      "epoch": 0.19032463399108848,
      "grad_norm": 0.9679844821020401,
      "learning_rate": 4.997231819597531e-05,
      "loss": 2.2551,
      "num_input_tokens_seen": 1411459120,
      "step": 1794
    },
    {
      "epoch": 0.19043072353065987,
      "grad_norm": 0.648141081861324,
      "learning_rate": 4.99722854908812e-05,
      "loss": 2.4167,
      "num_input_tokens_seen": 1412245872,
      "step": 1795
    },
    {
      "epoch": 0.19053681307023126,
      "grad_norm": 1.2335556290501013,
      "learning_rate": 4.997225276648923e-05,
      "loss": 2.1443,
      "num_input_tokens_seen": 1413032688,
      "step": 1796
    },
    {
      "epoch": 0.19064290260980268,
      "grad_norm": 0.8646812888749119,
      "learning_rate": 4.997222002279945e-05,
      "loss": 2.2469,
      "num_input_tokens_seen": 1413819488,
      "step": 1797
    },
    {
      "epoch": 0.19074899214937407,
      "grad_norm": 0.7622759732784551,
      "learning_rate": 4.9972187259811866e-05,
      "loss": 2.2803,
      "num_input_tokens_seen": 1414606224,
      "step": 1798
    },
    {
      "epoch": 0.19085508168894547,
      "grad_norm": 1.0554857659096528,
      "learning_rate": 4.99721544775265e-05,
      "loss": 2.2545,
      "num_input_tokens_seen": 1415393072,
      "step": 1799
    },
    {
      "epoch": 0.19096117122851686,
      "grad_norm": 0.8115082876176122,
      "learning_rate": 4.99721216759434e-05,
      "loss": 2.2641,
      "num_input_tokens_seen": 1416179744,
      "step": 1800
    },
    {
      "epoch": 0.19106726076808828,
      "grad_norm": 0.9144528678131535,
      "learning_rate": 4.9972088855062565e-05,
      "loss": 2.2176,
      "num_input_tokens_seen": 1416966480,
      "step": 1801
    },
    {
      "epoch": 0.19117335030765967,
      "grad_norm": 1.1918041870988407,
      "learning_rate": 4.997205601488404e-05,
      "loss": 2.3334,
      "num_input_tokens_seen": 1417753296,
      "step": 1802
    },
    {
      "epoch": 0.19127943984723106,
      "grad_norm": 1.2124463746166043,
      "learning_rate": 4.997202315540784e-05,
      "loss": 2.3886,
      "num_input_tokens_seen": 1418540032,
      "step": 1803
    },
    {
      "epoch": 0.19138552938680245,
      "grad_norm": 1.285935850213478,
      "learning_rate": 4.9971990276633996e-05,
      "loss": 2.4076,
      "num_input_tokens_seen": 1419326768,
      "step": 1804
    },
    {
      "epoch": 0.19149161892637387,
      "grad_norm": 1.0902039266061494,
      "learning_rate": 4.997195737856253e-05,
      "loss": 2.3495,
      "num_input_tokens_seen": 1420113536,
      "step": 1805
    },
    {
      "epoch": 0.19159770846594526,
      "grad_norm": 1.89454591003675,
      "learning_rate": 4.997192446119346e-05,
      "loss": 2.2124,
      "num_input_tokens_seen": 1420900352,
      "step": 1806
    },
    {
      "epoch": 0.19170379800551665,
      "grad_norm": 1.1231596565430675,
      "learning_rate": 4.9971891524526823e-05,
      "loss": 2.1199,
      "num_input_tokens_seen": 1421687168,
      "step": 1807
    },
    {
      "epoch": 0.19180988754508804,
      "grad_norm": 1.972120094492668,
      "learning_rate": 4.9971858568562646e-05,
      "loss": 2.2065,
      "num_input_tokens_seen": 1422473968,
      "step": 1808
    },
    {
      "epoch": 0.19191597708465946,
      "grad_norm": 1.604910911242633,
      "learning_rate": 4.9971825593300945e-05,
      "loss": 2.1717,
      "num_input_tokens_seen": 1423260720,
      "step": 1809
    },
    {
      "epoch": 0.19202206662423085,
      "grad_norm": 0.9208124368314072,
      "learning_rate": 4.997179259874175e-05,
      "loss": 2.1458,
      "num_input_tokens_seen": 1424047488,
      "step": 1810
    },
    {
      "epoch": 0.19212815616380224,
      "grad_norm": 0.7155673013001619,
      "learning_rate": 4.997175958488509e-05,
      "loss": 2.2131,
      "num_input_tokens_seen": 1424834240,
      "step": 1811
    },
    {
      "epoch": 0.19223424570337364,
      "grad_norm": 0.6986837959939265,
      "learning_rate": 4.997172655173099e-05,
      "loss": 2.24,
      "num_input_tokens_seen": 1425621040,
      "step": 1812
    },
    {
      "epoch": 0.19234033524294505,
      "grad_norm": 0.747776445490988,
      "learning_rate": 4.9971693499279467e-05,
      "loss": 2.3625,
      "num_input_tokens_seen": 1426407728,
      "step": 1813
    },
    {
      "epoch": 0.19244642478251645,
      "grad_norm": 0.9421053975730439,
      "learning_rate": 4.9971660427530555e-05,
      "loss": 2.2315,
      "num_input_tokens_seen": 1427194528,
      "step": 1814
    },
    {
      "epoch": 0.19255251432208784,
      "grad_norm": 1.0630045294511021,
      "learning_rate": 4.9971627336484274e-05,
      "loss": 2.2676,
      "num_input_tokens_seen": 1427981296,
      "step": 1815
    },
    {
      "epoch": 0.19265860386165923,
      "grad_norm": 0.6409540088814971,
      "learning_rate": 4.997159422614065e-05,
      "loss": 2.2846,
      "num_input_tokens_seen": 1428768048,
      "step": 1816
    },
    {
      "epoch": 0.19276469340123065,
      "grad_norm": 1.3256585514700834,
      "learning_rate": 4.997156109649971e-05,
      "loss": 2.2101,
      "num_input_tokens_seen": 1429554880,
      "step": 1817
    },
    {
      "epoch": 0.19287078294080204,
      "grad_norm": 1.1799640955339334,
      "learning_rate": 4.997152794756148e-05,
      "loss": 2.2314,
      "num_input_tokens_seen": 1430341680,
      "step": 1818
    },
    {
      "epoch": 0.19297687248037343,
      "grad_norm": 0.5160807072207882,
      "learning_rate": 4.9971494779325997e-05,
      "loss": 2.2077,
      "num_input_tokens_seen": 1431128336,
      "step": 1819
    },
    {
      "epoch": 0.19308296201994482,
      "grad_norm": 0.9610922029412682,
      "learning_rate": 4.9971461591793264e-05,
      "loss": 2.3271,
      "num_input_tokens_seen": 1431915040,
      "step": 1820
    },
    {
      "epoch": 0.19318905155951624,
      "grad_norm": 1.0161138544638897,
      "learning_rate": 4.9971428384963326e-05,
      "loss": 2.1992,
      "num_input_tokens_seen": 1432701808,
      "step": 1821
    },
    {
      "epoch": 0.19329514109908763,
      "grad_norm": 0.8664640959121453,
      "learning_rate": 4.9971395158836195e-05,
      "loss": 2.1744,
      "num_input_tokens_seen": 1433488512,
      "step": 1822
    },
    {
      "epoch": 0.19340123063865902,
      "grad_norm": 0.5814376471371131,
      "learning_rate": 4.9971361913411905e-05,
      "loss": 2.4105,
      "num_input_tokens_seen": 1434275280,
      "step": 1823
    },
    {
      "epoch": 0.1935073201782304,
      "grad_norm": 0.9187816004105713,
      "learning_rate": 4.9971328648690476e-05,
      "loss": 2.2954,
      "num_input_tokens_seen": 1435062016,
      "step": 1824
    },
    {
      "epoch": 0.19361340971780183,
      "grad_norm": 1.071314837033167,
      "learning_rate": 4.9971295364671936e-05,
      "loss": 2.4123,
      "num_input_tokens_seen": 1435848816,
      "step": 1825
    },
    {
      "epoch": 0.19371949925737322,
      "grad_norm": 0.7886511678930973,
      "learning_rate": 4.997126206135632e-05,
      "loss": 2.4317,
      "num_input_tokens_seen": 1436635584,
      "step": 1826
    },
    {
      "epoch": 0.19382558879694461,
      "grad_norm": 0.7605135429726618,
      "learning_rate": 4.997122873874364e-05,
      "loss": 2.206,
      "num_input_tokens_seen": 1437422336,
      "step": 1827
    },
    {
      "epoch": 0.193931678336516,
      "grad_norm": 1.091962451218675,
      "learning_rate": 4.9971195396833926e-05,
      "loss": 2.2795,
      "num_input_tokens_seen": 1438209152,
      "step": 1828
    },
    {
      "epoch": 0.19403776787608742,
      "grad_norm": 1.1580605144696319,
      "learning_rate": 4.9971162035627205e-05,
      "loss": 2.3695,
      "num_input_tokens_seen": 1438995872,
      "step": 1829
    },
    {
      "epoch": 0.19414385741565882,
      "grad_norm": 0.854990160629485,
      "learning_rate": 4.997112865512351e-05,
      "loss": 2.2588,
      "num_input_tokens_seen": 1439782752,
      "step": 1830
    },
    {
      "epoch": 0.1942499469552302,
      "grad_norm": 1.0676362491670273,
      "learning_rate": 4.997109525532285e-05,
      "loss": 2.4294,
      "num_input_tokens_seen": 1440569456,
      "step": 1831
    },
    {
      "epoch": 0.19435603649480163,
      "grad_norm": 1.0925496709609768,
      "learning_rate": 4.997106183622526e-05,
      "loss": 2.1847,
      "num_input_tokens_seen": 1441356240,
      "step": 1832
    },
    {
      "epoch": 0.19446212603437302,
      "grad_norm": 1.4800368622710691,
      "learning_rate": 4.997102839783077e-05,
      "loss": 2.2358,
      "num_input_tokens_seen": 1442143024,
      "step": 1833
    },
    {
      "epoch": 0.1945682155739444,
      "grad_norm": 0.66347692050743,
      "learning_rate": 4.99709949401394e-05,
      "loss": 2.2387,
      "num_input_tokens_seen": 1442929744,
      "step": 1834
    },
    {
      "epoch": 0.1946743051135158,
      "grad_norm": 1.1651941684032556,
      "learning_rate": 4.9970961463151185e-05,
      "loss": 2.3432,
      "num_input_tokens_seen": 1443716480,
      "step": 1835
    },
    {
      "epoch": 0.19478039465308722,
      "grad_norm": 0.6600696076488316,
      "learning_rate": 4.997092796686614e-05,
      "loss": 2.3361,
      "num_input_tokens_seen": 1444503248,
      "step": 1836
    },
    {
      "epoch": 0.1948864841926586,
      "grad_norm": 1.105560087670858,
      "learning_rate": 4.997089445128429e-05,
      "loss": 2.265,
      "num_input_tokens_seen": 1445290000,
      "step": 1837
    },
    {
      "epoch": 0.19499257373223,
      "grad_norm": 1.1251445049560778,
      "learning_rate": 4.997086091640567e-05,
      "loss": 2.1848,
      "num_input_tokens_seen": 1446076816,
      "step": 1838
    },
    {
      "epoch": 0.1950986632718014,
      "grad_norm": 0.7130117594538701,
      "learning_rate": 4.99708273622303e-05,
      "loss": 2.1335,
      "num_input_tokens_seen": 1446863552,
      "step": 1839
    },
    {
      "epoch": 0.1952047528113728,
      "grad_norm": 0.6066667145262374,
      "learning_rate": 4.9970793788758206e-05,
      "loss": 2.116,
      "num_input_tokens_seen": 1447650336,
      "step": 1840
    },
    {
      "epoch": 0.1953108423509442,
      "grad_norm": 0.6006866710290625,
      "learning_rate": 4.997076019598942e-05,
      "loss": 2.193,
      "num_input_tokens_seen": 1448437056,
      "step": 1841
    },
    {
      "epoch": 0.1954169318905156,
      "grad_norm": 0.8049424312947036,
      "learning_rate": 4.997072658392395e-05,
      "loss": 2.3593,
      "num_input_tokens_seen": 1449223808,
      "step": 1842
    },
    {
      "epoch": 0.19552302143008699,
      "grad_norm": 1.1093035493329988,
      "learning_rate": 4.9970692952561845e-05,
      "loss": 2.2036,
      "num_input_tokens_seen": 1450010624,
      "step": 1843
    },
    {
      "epoch": 0.1956291109696584,
      "grad_norm": 0.6836410661205118,
      "learning_rate": 4.997065930190312e-05,
      "loss": 2.3795,
      "num_input_tokens_seen": 1450797296,
      "step": 1844
    },
    {
      "epoch": 0.1957352005092298,
      "grad_norm": 1.2655258241032823,
      "learning_rate": 4.997062563194781e-05,
      "loss": 2.2443,
      "num_input_tokens_seen": 1451584032,
      "step": 1845
    },
    {
      "epoch": 0.1958412900488012,
      "grad_norm": 0.9491074949909081,
      "learning_rate": 4.997059194269592e-05,
      "loss": 2.1732,
      "num_input_tokens_seen": 1452370816,
      "step": 1846
    },
    {
      "epoch": 0.19594737958837258,
      "grad_norm": 0.7659641244641588,
      "learning_rate": 4.9970558234147504e-05,
      "loss": 2.1871,
      "num_input_tokens_seen": 1453157632,
      "step": 1847
    },
    {
      "epoch": 0.196053469127944,
      "grad_norm": 0.6473964248614131,
      "learning_rate": 4.9970524506302565e-05,
      "loss": 2.3344,
      "num_input_tokens_seen": 1453944368,
      "step": 1848
    },
    {
      "epoch": 0.1961595586675154,
      "grad_norm": 0.809002663712425,
      "learning_rate": 4.997049075916114e-05,
      "loss": 2.1928,
      "num_input_tokens_seen": 1454731248,
      "step": 1849
    },
    {
      "epoch": 0.19626564820708678,
      "grad_norm": 0.6357819505102441,
      "learning_rate": 4.997045699272324e-05,
      "loss": 2.0847,
      "num_input_tokens_seen": 1455518064,
      "step": 1850
    },
    {
      "epoch": 0.19637173774665817,
      "grad_norm": 0.6509324096772247,
      "learning_rate": 4.9970423206988914e-05,
      "loss": 1.9341,
      "num_input_tokens_seen": 1456304912,
      "step": 1851
    },
    {
      "epoch": 0.1964778272862296,
      "grad_norm": 0.9873320870049854,
      "learning_rate": 4.997038940195818e-05,
      "loss": 2.3518,
      "num_input_tokens_seen": 1457091648,
      "step": 1852
    },
    {
      "epoch": 0.19658391682580098,
      "grad_norm": 1.3987734283646303,
      "learning_rate": 4.997035557763106e-05,
      "loss": 2.2064,
      "num_input_tokens_seen": 1457878432,
      "step": 1853
    },
    {
      "epoch": 0.19669000636537237,
      "grad_norm": 0.9375987827267716,
      "learning_rate": 4.997032173400758e-05,
      "loss": 2.1258,
      "num_input_tokens_seen": 1458665168,
      "step": 1854
    },
    {
      "epoch": 0.19679609590494376,
      "grad_norm": 1.697000105151686,
      "learning_rate": 4.9970287871087764e-05,
      "loss": 2.19,
      "num_input_tokens_seen": 1459451872,
      "step": 1855
    },
    {
      "epoch": 0.19690218544451518,
      "grad_norm": 1.1989514922948659,
      "learning_rate": 4.997025398887165e-05,
      "loss": 2.3477,
      "num_input_tokens_seen": 1460238624,
      "step": 1856
    },
    {
      "epoch": 0.19700827498408657,
      "grad_norm": 1.7900013223314157,
      "learning_rate": 4.997022008735926e-05,
      "loss": 2.3774,
      "num_input_tokens_seen": 1461025408,
      "step": 1857
    },
    {
      "epoch": 0.19711436452365796,
      "grad_norm": 0.8965646365225396,
      "learning_rate": 4.9970186166550604e-05,
      "loss": 2.241,
      "num_input_tokens_seen": 1461812176,
      "step": 1858
    },
    {
      "epoch": 0.19722045406322936,
      "grad_norm": 1.0077057858856642,
      "learning_rate": 4.997015222644572e-05,
      "loss": 2.1446,
      "num_input_tokens_seen": 1462598880,
      "step": 1859
    },
    {
      "epoch": 0.19732654360280077,
      "grad_norm": 1.2872661572796913,
      "learning_rate": 4.997011826704464e-05,
      "loss": 2.0996,
      "num_input_tokens_seen": 1463385744,
      "step": 1860
    },
    {
      "epoch": 0.19743263314237217,
      "grad_norm": 0.7187678007507151,
      "learning_rate": 4.997008428834739e-05,
      "loss": 2.2944,
      "num_input_tokens_seen": 1464172528,
      "step": 1861
    },
    {
      "epoch": 0.19753872268194356,
      "grad_norm": 1.5095846400027326,
      "learning_rate": 4.9970050290353985e-05,
      "loss": 2.3277,
      "num_input_tokens_seen": 1464959280,
      "step": 1862
    },
    {
      "epoch": 0.19764481222151495,
      "grad_norm": 0.7821807238584005,
      "learning_rate": 4.9970016273064464e-05,
      "loss": 2.2422,
      "num_input_tokens_seen": 1465746032,
      "step": 1863
    },
    {
      "epoch": 0.19775090176108637,
      "grad_norm": 1.4139009579161788,
      "learning_rate": 4.996998223647884e-05,
      "loss": 2.136,
      "num_input_tokens_seen": 1466532832,
      "step": 1864
    },
    {
      "epoch": 0.19785699130065776,
      "grad_norm": 1.4655382365012415,
      "learning_rate": 4.996994818059715e-05,
      "loss": 2.2277,
      "num_input_tokens_seen": 1467319504,
      "step": 1865
    },
    {
      "epoch": 0.19796308084022915,
      "grad_norm": 1.4093777560203695,
      "learning_rate": 4.9969914105419426e-05,
      "loss": 2.5263,
      "num_input_tokens_seen": 1468106192,
      "step": 1866
    },
    {
      "epoch": 0.19806917037980054,
      "grad_norm": 2.82156801380053,
      "learning_rate": 4.996988001094567e-05,
      "loss": 2.1357,
      "num_input_tokens_seen": 1468892960,
      "step": 1867
    },
    {
      "epoch": 0.19817525991937196,
      "grad_norm": 2.2344691842831144,
      "learning_rate": 4.996984589717593e-05,
      "loss": 2.4005,
      "num_input_tokens_seen": 1469679664,
      "step": 1868
    },
    {
      "epoch": 0.19828134945894335,
      "grad_norm": 1.670171867251438,
      "learning_rate": 4.996981176411023e-05,
      "loss": 2.0448,
      "num_input_tokens_seen": 1470466320,
      "step": 1869
    },
    {
      "epoch": 0.19838743899851474,
      "grad_norm": 1.8159540699984977,
      "learning_rate": 4.996977761174858e-05,
      "loss": 2.323,
      "num_input_tokens_seen": 1471252976,
      "step": 1870
    },
    {
      "epoch": 0.19849352853808613,
      "grad_norm": 1.4346454022935933,
      "learning_rate": 4.996974344009103e-05,
      "loss": 2.1571,
      "num_input_tokens_seen": 1472039760,
      "step": 1871
    },
    {
      "epoch": 0.19859961807765755,
      "grad_norm": 1.5274771382447623,
      "learning_rate": 4.996970924913759e-05,
      "loss": 2.4031,
      "num_input_tokens_seen": 1472826448,
      "step": 1872
    },
    {
      "epoch": 0.19870570761722894,
      "grad_norm": 1.3202322558238697,
      "learning_rate": 4.9969675038888294e-05,
      "loss": 2.1931,
      "num_input_tokens_seen": 1473613232,
      "step": 1873
    },
    {
      "epoch": 0.19881179715680034,
      "grad_norm": 1.0967850477528878,
      "learning_rate": 4.9969640809343165e-05,
      "loss": 2.2508,
      "num_input_tokens_seen": 1474399968,
      "step": 1874
    },
    {
      "epoch": 0.19891788669637173,
      "grad_norm": 1.550535858283687,
      "learning_rate": 4.9969606560502226e-05,
      "loss": 2.3887,
      "num_input_tokens_seen": 1475186704,
      "step": 1875
    },
    {
      "epoch": 0.19902397623594315,
      "grad_norm": 1.105184349260747,
      "learning_rate": 4.996957229236551e-05,
      "loss": 2.1917,
      "num_input_tokens_seen": 1475973488,
      "step": 1876
    },
    {
      "epoch": 0.19913006577551454,
      "grad_norm": 1.8712133016263464,
      "learning_rate": 4.9969538004933046e-05,
      "loss": 2.2512,
      "num_input_tokens_seen": 1476760272,
      "step": 1877
    },
    {
      "epoch": 0.19923615531508593,
      "grad_norm": 1.2871784232370058,
      "learning_rate": 4.996950369820485e-05,
      "loss": 2.1011,
      "num_input_tokens_seen": 1477547088,
      "step": 1878
    },
    {
      "epoch": 0.19934224485465732,
      "grad_norm": 1.0419181295451991,
      "learning_rate": 4.9969469372180956e-05,
      "loss": 2.3532,
      "num_input_tokens_seen": 1478333808,
      "step": 1879
    },
    {
      "epoch": 0.19944833439422874,
      "grad_norm": 1.180238287627739,
      "learning_rate": 4.9969435026861385e-05,
      "loss": 2.1755,
      "num_input_tokens_seen": 1479120592,
      "step": 1880
    },
    {
      "epoch": 0.19955442393380013,
      "grad_norm": 1.1393971335680553,
      "learning_rate": 4.9969400662246174e-05,
      "loss": 2.1073,
      "num_input_tokens_seen": 1479907376,
      "step": 1881
    },
    {
      "epoch": 0.19966051347337152,
      "grad_norm": 0.8576062045601827,
      "learning_rate": 4.996936627833534e-05,
      "loss": 2.27,
      "num_input_tokens_seen": 1480694160,
      "step": 1882
    },
    {
      "epoch": 0.1997666030129429,
      "grad_norm": 1.2891892498363122,
      "learning_rate": 4.996933187512891e-05,
      "loss": 2.2947,
      "num_input_tokens_seen": 1481480928,
      "step": 1883
    },
    {
      "epoch": 0.19987269255251433,
      "grad_norm": 1.2034438175296207,
      "learning_rate": 4.996929745262692e-05,
      "loss": 2.4084,
      "num_input_tokens_seen": 1482267680,
      "step": 1884
    },
    {
      "epoch": 0.19997878209208572,
      "grad_norm": 0.8829510212337401,
      "learning_rate": 4.996926301082938e-05,
      "loss": 2.2452,
      "num_input_tokens_seen": 1483054496,
      "step": 1885
    },
    {
      "epoch": 0.2000848716316571,
      "grad_norm": 0.7090820927211641,
      "learning_rate": 4.9969228549736335e-05,
      "loss": 2.0437,
      "num_input_tokens_seen": 1483841280,
      "step": 1886
    },
    {
      "epoch": 0.2001909611712285,
      "grad_norm": 0.7944937802677015,
      "learning_rate": 4.99691940693478e-05,
      "loss": 2.2907,
      "num_input_tokens_seen": 1484628080,
      "step": 1887
    },
    {
      "epoch": 0.20029705071079992,
      "grad_norm": 0.8067616340936985,
      "learning_rate": 4.99691595696638e-05,
      "loss": 2.3041,
      "num_input_tokens_seen": 1485414800,
      "step": 1888
    },
    {
      "epoch": 0.20040314025037131,
      "grad_norm": 0.8033503281279293,
      "learning_rate": 4.996912505068437e-05,
      "loss": 2.1753,
      "num_input_tokens_seen": 1486201600,
      "step": 1889
    },
    {
      "epoch": 0.2005092297899427,
      "grad_norm": 0.8626378196459817,
      "learning_rate": 4.9969090512409534e-05,
      "loss": 2.4422,
      "num_input_tokens_seen": 1486988368,
      "step": 1890
    },
    {
      "epoch": 0.2006153193295141,
      "grad_norm": 0.6289771952595027,
      "learning_rate": 4.996905595483931e-05,
      "loss": 2.2213,
      "num_input_tokens_seen": 1487775216,
      "step": 1891
    },
    {
      "epoch": 0.20072140886908552,
      "grad_norm": 0.7118432410520408,
      "learning_rate": 4.996902137797374e-05,
      "loss": 2.0922,
      "num_input_tokens_seen": 1488561984,
      "step": 1892
    },
    {
      "epoch": 0.2008274984086569,
      "grad_norm": 0.6544067641521015,
      "learning_rate": 4.9968986781812844e-05,
      "loss": 2.1825,
      "num_input_tokens_seen": 1489348752,
      "step": 1893
    },
    {
      "epoch": 0.2009335879482283,
      "grad_norm": 0.5673468747449656,
      "learning_rate": 4.9968952166356645e-05,
      "loss": 2.3368,
      "num_input_tokens_seen": 1490135472,
      "step": 1894
    },
    {
      "epoch": 0.2010396774877997,
      "grad_norm": 0.8583722304275355,
      "learning_rate": 4.9968917531605164e-05,
      "loss": 2.3142,
      "num_input_tokens_seen": 1490922208,
      "step": 1895
    },
    {
      "epoch": 0.2011457670273711,
      "grad_norm": 2.3419950179826405,
      "learning_rate": 4.996888287755845e-05,
      "loss": 2.3957,
      "num_input_tokens_seen": 1491708912,
      "step": 1896
    },
    {
      "epoch": 0.2012518565669425,
      "grad_norm": 0.7941301609233836,
      "learning_rate": 4.9968848204216506e-05,
      "loss": 2.1874,
      "num_input_tokens_seen": 1492495680,
      "step": 1897
    },
    {
      "epoch": 0.2013579461065139,
      "grad_norm": 0.9696685044501002,
      "learning_rate": 4.996881351157937e-05,
      "loss": 2.2373,
      "num_input_tokens_seen": 1493282544,
      "step": 1898
    },
    {
      "epoch": 0.20146403564608528,
      "grad_norm": 0.7954405650460722,
      "learning_rate": 4.996877879964707e-05,
      "loss": 1.8679,
      "num_input_tokens_seen": 1494069408,
      "step": 1899
    },
    {
      "epoch": 0.2015701251856567,
      "grad_norm": 0.8838373168736803,
      "learning_rate": 4.996874406841964e-05,
      "loss": 2.2772,
      "num_input_tokens_seen": 1494856160,
      "step": 1900
    },
    {
      "epoch": 0.2016762147252281,
      "grad_norm": 1.3274088765823788,
      "learning_rate": 4.996870931789708e-05,
      "loss": 2.228,
      "num_input_tokens_seen": 1495643008,
      "step": 1901
    },
    {
      "epoch": 0.20178230426479948,
      "grad_norm": 0.7481358926057349,
      "learning_rate": 4.996867454807944e-05,
      "loss": 2.2095,
      "num_input_tokens_seen": 1496429808,
      "step": 1902
    },
    {
      "epoch": 0.2018883938043709,
      "grad_norm": 0.9461875349761605,
      "learning_rate": 4.996863975896674e-05,
      "loss": 2.3353,
      "num_input_tokens_seen": 1497216528,
      "step": 1903
    },
    {
      "epoch": 0.2019944833439423,
      "grad_norm": 1.8534754380778402,
      "learning_rate": 4.9968604950559014e-05,
      "loss": 2.225,
      "num_input_tokens_seen": 1498003248,
      "step": 1904
    },
    {
      "epoch": 0.20210057288351368,
      "grad_norm": 1.0491957390832343,
      "learning_rate": 4.996857012285629e-05,
      "loss": 2.2542,
      "num_input_tokens_seen": 1498790016,
      "step": 1905
    },
    {
      "epoch": 0.20220666242308508,
      "grad_norm": 1.9228056268172897,
      "learning_rate": 4.996853527585857e-05,
      "loss": 2.1145,
      "num_input_tokens_seen": 1499576752,
      "step": 1906
    },
    {
      "epoch": 0.2023127519626565,
      "grad_norm": 1.4551996858887142,
      "learning_rate": 4.99685004095659e-05,
      "loss": 2.2722,
      "num_input_tokens_seen": 1500363504,
      "step": 1907
    },
    {
      "epoch": 0.2024188415022279,
      "grad_norm": 1.2742628039177155,
      "learning_rate": 4.9968465523978314e-05,
      "loss": 2.1944,
      "num_input_tokens_seen": 1501150304,
      "step": 1908
    },
    {
      "epoch": 0.20252493104179928,
      "grad_norm": 1.8130254572704743,
      "learning_rate": 4.996843061909583e-05,
      "loss": 2.029,
      "num_input_tokens_seen": 1501937072,
      "step": 1909
    },
    {
      "epoch": 0.20263102058137067,
      "grad_norm": 1.084390655062244,
      "learning_rate": 4.996839569491847e-05,
      "loss": 2.0453,
      "num_input_tokens_seen": 1502723840,
      "step": 1910
    },
    {
      "epoch": 0.2027371101209421,
      "grad_norm": 1.8394997168639666,
      "learning_rate": 4.996836075144627e-05,
      "loss": 2.322,
      "num_input_tokens_seen": 1503510624,
      "step": 1911
    },
    {
      "epoch": 0.20284319966051348,
      "grad_norm": 1.5228854208716316,
      "learning_rate": 4.996832578867926e-05,
      "loss": 2.36,
      "num_input_tokens_seen": 1504297392,
      "step": 1912
    },
    {
      "epoch": 0.20294928920008487,
      "grad_norm": 1.189381382761598,
      "learning_rate": 4.996829080661745e-05,
      "loss": 2.2416,
      "num_input_tokens_seen": 1505084192,
      "step": 1913
    },
    {
      "epoch": 0.20305537873965626,
      "grad_norm": 1.627976290460163,
      "learning_rate": 4.996825580526088e-05,
      "loss": 2.0125,
      "num_input_tokens_seen": 1505871088,
      "step": 1914
    },
    {
      "epoch": 0.20316146827922768,
      "grad_norm": 1.5518256316306367,
      "learning_rate": 4.9968220784609575e-05,
      "loss": 2.1297,
      "num_input_tokens_seen": 1506657888,
      "step": 1915
    },
    {
      "epoch": 0.20326755781879907,
      "grad_norm": 1.1382358968610216,
      "learning_rate": 4.996818574466356e-05,
      "loss": 2.2519,
      "num_input_tokens_seen": 1507444672,
      "step": 1916
    },
    {
      "epoch": 0.20337364735837046,
      "grad_norm": 1.517306399735977,
      "learning_rate": 4.9968150685422866e-05,
      "loss": 2.1003,
      "num_input_tokens_seen": 1508231632,
      "step": 1917
    },
    {
      "epoch": 0.20347973689794185,
      "grad_norm": 0.8839001057826991,
      "learning_rate": 4.9968115606887514e-05,
      "loss": 2.1852,
      "num_input_tokens_seen": 1509018384,
      "step": 1918
    },
    {
      "epoch": 0.20358582643751327,
      "grad_norm": 2.1764365244653012,
      "learning_rate": 4.996808050905754e-05,
      "loss": 2.2128,
      "num_input_tokens_seen": 1509805120,
      "step": 1919
    },
    {
      "epoch": 0.20369191597708466,
      "grad_norm": 1.234510766286764,
      "learning_rate": 4.996804539193296e-05,
      "loss": 2.4014,
      "num_input_tokens_seen": 1510591952,
      "step": 1920
    },
    {
      "epoch": 0.20379800551665606,
      "grad_norm": 1.0298293158273149,
      "learning_rate": 4.996801025551381e-05,
      "loss": 2.1572,
      "num_input_tokens_seen": 1511378768,
      "step": 1921
    },
    {
      "epoch": 0.20390409505622745,
      "grad_norm": 1.9347956056028714,
      "learning_rate": 4.9967975099800124e-05,
      "loss": 2.2347,
      "num_input_tokens_seen": 1512165584,
      "step": 1922
    },
    {
      "epoch": 0.20401018459579887,
      "grad_norm": 1.027085471760529,
      "learning_rate": 4.9967939924791907e-05,
      "loss": 2.2704,
      "num_input_tokens_seen": 1512952368,
      "step": 1923
    },
    {
      "epoch": 0.20411627413537026,
      "grad_norm": 1.4290438131092622,
      "learning_rate": 4.99679047304892e-05,
      "loss": 2.101,
      "num_input_tokens_seen": 1513739056,
      "step": 1924
    },
    {
      "epoch": 0.20422236367494165,
      "grad_norm": 1.1542410765057753,
      "learning_rate": 4.996786951689203e-05,
      "loss": 2.3104,
      "num_input_tokens_seen": 1514525792,
      "step": 1925
    },
    {
      "epoch": 0.20432845321451304,
      "grad_norm": 1.5671381204313781,
      "learning_rate": 4.996783428400042e-05,
      "loss": 2.256,
      "num_input_tokens_seen": 1515312576,
      "step": 1926
    },
    {
      "epoch": 0.20443454275408446,
      "grad_norm": 1.9395074786555149,
      "learning_rate": 4.996779903181441e-05,
      "loss": 2.3511,
      "num_input_tokens_seen": 1516099312,
      "step": 1927
    },
    {
      "epoch": 0.20454063229365585,
      "grad_norm": 1.4049196975636467,
      "learning_rate": 4.9967763760334014e-05,
      "loss": 2.2944,
      "num_input_tokens_seen": 1516886016,
      "step": 1928
    },
    {
      "epoch": 0.20464672183322724,
      "grad_norm": 1.6741456882189434,
      "learning_rate": 4.996772846955926e-05,
      "loss": 2.1962,
      "num_input_tokens_seen": 1517672800,
      "step": 1929
    },
    {
      "epoch": 0.20475281137279863,
      "grad_norm": 1.4148423117761275,
      "learning_rate": 4.996769315949018e-05,
      "loss": 2.2931,
      "num_input_tokens_seen": 1518459552,
      "step": 1930
    },
    {
      "epoch": 0.20485890091237005,
      "grad_norm": 1.9200967977002197,
      "learning_rate": 4.99676578301268e-05,
      "loss": 2.5021,
      "num_input_tokens_seen": 1519246272,
      "step": 1931
    },
    {
      "epoch": 0.20496499045194144,
      "grad_norm": 0.8986340114815051,
      "learning_rate": 4.9967622481469146e-05,
      "loss": 2.2606,
      "num_input_tokens_seen": 1520033024,
      "step": 1932
    },
    {
      "epoch": 0.20507107999151283,
      "grad_norm": 1.4215621364401687,
      "learning_rate": 4.9967587113517245e-05,
      "loss": 2.2223,
      "num_input_tokens_seen": 1520819840,
      "step": 1933
    },
    {
      "epoch": 0.20517716953108422,
      "grad_norm": 0.7653164140366718,
      "learning_rate": 4.996755172627112e-05,
      "loss": 2.0872,
      "num_input_tokens_seen": 1521606624,
      "step": 1934
    },
    {
      "epoch": 0.20528325907065564,
      "grad_norm": 1.517382198569318,
      "learning_rate": 4.996751631973081e-05,
      "loss": 2.2568,
      "num_input_tokens_seen": 1522393360,
      "step": 1935
    },
    {
      "epoch": 0.20538934861022703,
      "grad_norm": 0.7648874340693372,
      "learning_rate": 4.996748089389634e-05,
      "loss": 2.1468,
      "num_input_tokens_seen": 1523180288,
      "step": 1936
    },
    {
      "epoch": 0.20549543814979843,
      "grad_norm": 1.5222833781261442,
      "learning_rate": 4.996744544876773e-05,
      "loss": 2.3034,
      "num_input_tokens_seen": 1523966976,
      "step": 1937
    },
    {
      "epoch": 0.20560152768936982,
      "grad_norm": 1.8598017562930624,
      "learning_rate": 4.9967409984345e-05,
      "loss": 2.3266,
      "num_input_tokens_seen": 1524753680,
      "step": 1938
    },
    {
      "epoch": 0.20570761722894124,
      "grad_norm": 1.2504449900342385,
      "learning_rate": 4.99673745006282e-05,
      "loss": 2.2907,
      "num_input_tokens_seen": 1525540464,
      "step": 1939
    },
    {
      "epoch": 0.20581370676851263,
      "grad_norm": 2.7952037276533646,
      "learning_rate": 4.996733899761734e-05,
      "loss": 2.2874,
      "num_input_tokens_seen": 1526327232,
      "step": 1940
    },
    {
      "epoch": 0.20591979630808402,
      "grad_norm": 1.903473058799276,
      "learning_rate": 4.996730347531246e-05,
      "loss": 2.2466,
      "num_input_tokens_seen": 1527114016,
      "step": 1941
    },
    {
      "epoch": 0.2060258858476554,
      "grad_norm": 1.752295006351257,
      "learning_rate": 4.996726793371357e-05,
      "loss": 2.2406,
      "num_input_tokens_seen": 1527900784,
      "step": 1942
    },
    {
      "epoch": 0.20613197538722683,
      "grad_norm": 1.718546096021574,
      "learning_rate": 4.996723237282072e-05,
      "loss": 2.2651,
      "num_input_tokens_seen": 1528687712,
      "step": 1943
    },
    {
      "epoch": 0.20623806492679822,
      "grad_norm": 1.4094992626626497,
      "learning_rate": 4.996719679263392e-05,
      "loss": 2.2109,
      "num_input_tokens_seen": 1529474368,
      "step": 1944
    },
    {
      "epoch": 0.2063441544663696,
      "grad_norm": 0.99154458644047,
      "learning_rate": 4.99671611931532e-05,
      "loss": 2.1738,
      "num_input_tokens_seen": 1530261200,
      "step": 1945
    },
    {
      "epoch": 0.206450244005941,
      "grad_norm": 1.4525596100579465,
      "learning_rate": 4.996712557437859e-05,
      "loss": 2.3414,
      "num_input_tokens_seen": 1531048016,
      "step": 1946
    },
    {
      "epoch": 0.20655633354551242,
      "grad_norm": 1.3331684187427915,
      "learning_rate": 4.996708993631012e-05,
      "loss": 2.2857,
      "num_input_tokens_seen": 1531834832,
      "step": 1947
    },
    {
      "epoch": 0.2066624230850838,
      "grad_norm": 1.4618187238712639,
      "learning_rate": 4.9967054278947816e-05,
      "loss": 2.3018,
      "num_input_tokens_seen": 1532621536,
      "step": 1948
    },
    {
      "epoch": 0.2067685126246552,
      "grad_norm": 1.2727575886363565,
      "learning_rate": 4.99670186022917e-05,
      "loss": 2.3074,
      "num_input_tokens_seen": 1533408288,
      "step": 1949
    },
    {
      "epoch": 0.2068746021642266,
      "grad_norm": 1.5687184289245966,
      "learning_rate": 4.996698290634182e-05,
      "loss": 2.2553,
      "num_input_tokens_seen": 1534195040,
      "step": 1950
    },
    {
      "epoch": 0.20698069170379801,
      "grad_norm": 1.307132781203909,
      "learning_rate": 4.9966947191098174e-05,
      "loss": 2.3087,
      "num_input_tokens_seen": 1534981792,
      "step": 1951
    },
    {
      "epoch": 0.2070867812433694,
      "grad_norm": 1.2327091151718643,
      "learning_rate": 4.99669114565608e-05,
      "loss": 2.1652,
      "num_input_tokens_seen": 1535768576,
      "step": 1952
    },
    {
      "epoch": 0.2071928707829408,
      "grad_norm": 1.306865422453297,
      "learning_rate": 4.996687570272974e-05,
      "loss": 2.2169,
      "num_input_tokens_seen": 1536555344,
      "step": 1953
    },
    {
      "epoch": 0.2072989603225122,
      "grad_norm": 1.2779040629203362,
      "learning_rate": 4.9966839929605016e-05,
      "loss": 2.3221,
      "num_input_tokens_seen": 1537342048,
      "step": 1954
    },
    {
      "epoch": 0.2074050498620836,
      "grad_norm": 0.9756203965269076,
      "learning_rate": 4.996680413718664e-05,
      "loss": 2.1988,
      "num_input_tokens_seen": 1538128768,
      "step": 1955
    },
    {
      "epoch": 0.207511139401655,
      "grad_norm": 1.0457065442781974,
      "learning_rate": 4.9966768325474656e-05,
      "loss": 2.3497,
      "num_input_tokens_seen": 1538915520,
      "step": 1956
    },
    {
      "epoch": 0.2076172289412264,
      "grad_norm": 0.7472817126729147,
      "learning_rate": 4.996673249446908e-05,
      "loss": 2.1522,
      "num_input_tokens_seen": 1539702240,
      "step": 1957
    },
    {
      "epoch": 0.20772331848079778,
      "grad_norm": 0.8108414646128689,
      "learning_rate": 4.9966696644169945e-05,
      "loss": 2.1855,
      "num_input_tokens_seen": 1540489024,
      "step": 1958
    },
    {
      "epoch": 0.2078294080203692,
      "grad_norm": 0.7154941324498063,
      "learning_rate": 4.996666077457729e-05,
      "loss": 2.2687,
      "num_input_tokens_seen": 1541275712,
      "step": 1959
    },
    {
      "epoch": 0.2079354975599406,
      "grad_norm": 0.6375598789568325,
      "learning_rate": 4.996662488569112e-05,
      "loss": 2.1716,
      "num_input_tokens_seen": 1542062432,
      "step": 1960
    },
    {
      "epoch": 0.20804158709951198,
      "grad_norm": 0.6355406020981765,
      "learning_rate": 4.996658897751148e-05,
      "loss": 2.307,
      "num_input_tokens_seen": 1542849136,
      "step": 1961
    },
    {
      "epoch": 0.20814767663908337,
      "grad_norm": 0.5990820256456633,
      "learning_rate": 4.996655305003839e-05,
      "loss": 2.1009,
      "num_input_tokens_seen": 1543635888,
      "step": 1962
    },
    {
      "epoch": 0.2082537661786548,
      "grad_norm": 0.6438001739529671,
      "learning_rate": 4.9966517103271887e-05,
      "loss": 2.2149,
      "num_input_tokens_seen": 1544422544,
      "step": 1963
    },
    {
      "epoch": 0.20835985571822618,
      "grad_norm": 0.6231758666039245,
      "learning_rate": 4.996648113721198e-05,
      "loss": 2.2431,
      "num_input_tokens_seen": 1545209264,
      "step": 1964
    },
    {
      "epoch": 0.20846594525779757,
      "grad_norm": 0.6036496379686798,
      "learning_rate": 4.996644515185873e-05,
      "loss": 2.2025,
      "num_input_tokens_seen": 1545996016,
      "step": 1965
    },
    {
      "epoch": 0.20857203479736897,
      "grad_norm": 0.5105633710764967,
      "learning_rate": 4.9966409147212125e-05,
      "loss": 2.0881,
      "num_input_tokens_seen": 1546782736,
      "step": 1966
    },
    {
      "epoch": 0.20867812433694038,
      "grad_norm": 0.758279220972635,
      "learning_rate": 4.996637312327222e-05,
      "loss": 2.3135,
      "num_input_tokens_seen": 1547569504,
      "step": 1967
    },
    {
      "epoch": 0.20878421387651178,
      "grad_norm": 0.6989345241450621,
      "learning_rate": 4.996633708003903e-05,
      "loss": 2.336,
      "num_input_tokens_seen": 1548356288,
      "step": 1968
    },
    {
      "epoch": 0.20889030341608317,
      "grad_norm": 0.695247528371953,
      "learning_rate": 4.996630101751259e-05,
      "loss": 2.2843,
      "num_input_tokens_seen": 1549143072,
      "step": 1969
    },
    {
      "epoch": 0.2089963929556546,
      "grad_norm": 0.7540682299963384,
      "learning_rate": 4.996626493569293e-05,
      "loss": 2.1779,
      "num_input_tokens_seen": 1549929776,
      "step": 1970
    },
    {
      "epoch": 0.20910248249522598,
      "grad_norm": 0.7676974275873014,
      "learning_rate": 4.9966228834580065e-05,
      "loss": 2.2925,
      "num_input_tokens_seen": 1550716592,
      "step": 1971
    },
    {
      "epoch": 0.20920857203479737,
      "grad_norm": 0.5493399088417004,
      "learning_rate": 4.9966192714174035e-05,
      "loss": 2.0222,
      "num_input_tokens_seen": 1551503408,
      "step": 1972
    },
    {
      "epoch": 0.20931466157436876,
      "grad_norm": 0.614359990678733,
      "learning_rate": 4.996615657447485e-05,
      "loss": 2.3498,
      "num_input_tokens_seen": 1552290080,
      "step": 1973
    },
    {
      "epoch": 0.20942075111394018,
      "grad_norm": 0.7758670123629099,
      "learning_rate": 4.9966120415482573e-05,
      "loss": 2.2745,
      "num_input_tokens_seen": 1553076832,
      "step": 1974
    },
    {
      "epoch": 0.20952684065351157,
      "grad_norm": 0.8213152951721533,
      "learning_rate": 4.9966084237197196e-05,
      "loss": 2.2747,
      "num_input_tokens_seen": 1553863600,
      "step": 1975
    },
    {
      "epoch": 0.20963293019308296,
      "grad_norm": 0.8029551473818256,
      "learning_rate": 4.9966048039618774e-05,
      "loss": 2.3303,
      "num_input_tokens_seen": 1554650288,
      "step": 1976
    },
    {
      "epoch": 0.20973901973265435,
      "grad_norm": 0.496208082239535,
      "learning_rate": 4.996601182274731e-05,
      "loss": 2.1827,
      "num_input_tokens_seen": 1555436976,
      "step": 1977
    },
    {
      "epoch": 0.20984510927222577,
      "grad_norm": 0.6769672841243839,
      "learning_rate": 4.996597558658285e-05,
      "loss": 2.3268,
      "num_input_tokens_seen": 1556223696,
      "step": 1978
    },
    {
      "epoch": 0.20995119881179716,
      "grad_norm": 0.8472401691727179,
      "learning_rate": 4.996593933112542e-05,
      "loss": 2.3038,
      "num_input_tokens_seen": 1557010496,
      "step": 1979
    },
    {
      "epoch": 0.21005728835136855,
      "grad_norm": 1.2901582207453104,
      "learning_rate": 4.996590305637504e-05,
      "loss": 2.3338,
      "num_input_tokens_seen": 1557797216,
      "step": 1980
    },
    {
      "epoch": 0.21016337789093995,
      "grad_norm": 0.985085308293618,
      "learning_rate": 4.996586676233175e-05,
      "loss": 2.237,
      "num_input_tokens_seen": 1558583952,
      "step": 1981
    },
    {
      "epoch": 0.21026946743051136,
      "grad_norm": 0.7607054985543562,
      "learning_rate": 4.996583044899556e-05,
      "loss": 2.1783,
      "num_input_tokens_seen": 1559370672,
      "step": 1982
    },
    {
      "epoch": 0.21037555697008276,
      "grad_norm": 1.0937055085133531,
      "learning_rate": 4.996579411636652e-05,
      "loss": 2.078,
      "num_input_tokens_seen": 1560157376,
      "step": 1983
    },
    {
      "epoch": 0.21048164650965415,
      "grad_norm": 0.7945873691476758,
      "learning_rate": 4.996575776444463e-05,
      "loss": 2.0963,
      "num_input_tokens_seen": 1560944160,
      "step": 1984
    },
    {
      "epoch": 0.21058773604922554,
      "grad_norm": 0.6704286307498899,
      "learning_rate": 4.996572139322995e-05,
      "loss": 2.2487,
      "num_input_tokens_seen": 1561730928,
      "step": 1985
    },
    {
      "epoch": 0.21069382558879696,
      "grad_norm": 0.6877043787268751,
      "learning_rate": 4.9965685002722487e-05,
      "loss": 2.2214,
      "num_input_tokens_seen": 1562517744,
      "step": 1986
    },
    {
      "epoch": 0.21079991512836835,
      "grad_norm": 1.0394621867299232,
      "learning_rate": 4.9965648592922276e-05,
      "loss": 2.3732,
      "num_input_tokens_seen": 1563304416,
      "step": 1987
    },
    {
      "epoch": 0.21090600466793974,
      "grad_norm": 1.7164137153842325,
      "learning_rate": 4.9965612163829346e-05,
      "loss": 2.3196,
      "num_input_tokens_seen": 1564091184,
      "step": 1988
    },
    {
      "epoch": 0.21101209420751113,
      "grad_norm": 0.637035528649706,
      "learning_rate": 4.996557571544372e-05,
      "loss": 2.1723,
      "num_input_tokens_seen": 1564877888,
      "step": 1989
    },
    {
      "epoch": 0.21111818374708255,
      "grad_norm": 1.7403743373515022,
      "learning_rate": 4.996553924776544e-05,
      "loss": 2.1408,
      "num_input_tokens_seen": 1565664624,
      "step": 1990
    },
    {
      "epoch": 0.21122427328665394,
      "grad_norm": 0.7559648172212103,
      "learning_rate": 4.996550276079451e-05,
      "loss": 2.2559,
      "num_input_tokens_seen": 1566451344,
      "step": 1991
    },
    {
      "epoch": 0.21133036282622533,
      "grad_norm": 2.1600245949621844,
      "learning_rate": 4.9965466254530976e-05,
      "loss": 2.116,
      "num_input_tokens_seen": 1567238112,
      "step": 1992
    },
    {
      "epoch": 0.21143645236579672,
      "grad_norm": 1.414643317475453,
      "learning_rate": 4.9965429728974864e-05,
      "loss": 2.2267,
      "num_input_tokens_seen": 1568024880,
      "step": 1993
    },
    {
      "epoch": 0.21154254190536814,
      "grad_norm": 1.784375923948274,
      "learning_rate": 4.99653931841262e-05,
      "loss": 2.2131,
      "num_input_tokens_seen": 1568811664,
      "step": 1994
    },
    {
      "epoch": 0.21164863144493953,
      "grad_norm": 1.5089889106385372,
      "learning_rate": 4.9965356619985014e-05,
      "loss": 1.9382,
      "num_input_tokens_seen": 1569598496,
      "step": 1995
    },
    {
      "epoch": 0.21175472098451092,
      "grad_norm": 1.1477761006986509,
      "learning_rate": 4.996532003655133e-05,
      "loss": 2.5719,
      "num_input_tokens_seen": 1570385152,
      "step": 1996
    },
    {
      "epoch": 0.21186081052408232,
      "grad_norm": 1.0370735393015622,
      "learning_rate": 4.9965283433825184e-05,
      "loss": 2.2159,
      "num_input_tokens_seen": 1571171856,
      "step": 1997
    },
    {
      "epoch": 0.21196690006365373,
      "grad_norm": 1.1013952984308655,
      "learning_rate": 4.99652468118066e-05,
      "loss": 2.2295,
      "num_input_tokens_seen": 1571958672,
      "step": 1998
    },
    {
      "epoch": 0.21207298960322513,
      "grad_norm": 0.8183344670840761,
      "learning_rate": 4.9965210170495604e-05,
      "loss": 2.2366,
      "num_input_tokens_seen": 1572745472,
      "step": 1999
    },
    {
      "epoch": 0.21217907914279652,
      "grad_norm": 0.9427184354507033,
      "learning_rate": 4.996517350989222e-05,
      "loss": 2.2394,
      "num_input_tokens_seen": 1573532288,
      "step": 2000
    },
    {
      "epoch": 0.21217907914279652,
      "eval_loss": 2.197659492492676,
      "eval_runtime": 63.7523,
      "eval_samples_per_second": 47.057,
      "eval_steps_per_second": 0.502,
      "num_input_tokens_seen": 1573532288,
      "step": 2000
    },
    {
      "epoch": 0.2122851686823679,
      "grad_norm": 1.0239095491906989,
      "learning_rate": 4.996513682999649e-05,
      "loss": 2.3881,
      "num_input_tokens_seen": 1574318944,
      "step": 2001
    },
    {
      "epoch": 0.21239125822193933,
      "grad_norm": 1.398208786491427,
      "learning_rate": 4.996510013080843e-05,
      "loss": 2.2321,
      "num_input_tokens_seen": 1575105792,
      "step": 2002
    },
    {
      "epoch": 0.21249734776151072,
      "grad_norm": 2.3916096793827166,
      "learning_rate": 4.9965063412328076e-05,
      "loss": 2.1571,
      "num_input_tokens_seen": 1575892624,
      "step": 2003
    },
    {
      "epoch": 0.2126034373010821,
      "grad_norm": 1.4347551129584863,
      "learning_rate": 4.9965026674555455e-05,
      "loss": 2.2675,
      "num_input_tokens_seen": 1576679424,
      "step": 2004
    },
    {
      "epoch": 0.2127095268406535,
      "grad_norm": 1.7507253233242972,
      "learning_rate": 4.996498991749059e-05,
      "loss": 2.2763,
      "num_input_tokens_seen": 1577466176,
      "step": 2005
    },
    {
      "epoch": 0.21281561638022492,
      "grad_norm": 1.002291526862991,
      "learning_rate": 4.9964953141133516e-05,
      "loss": 2.1929,
      "num_input_tokens_seen": 1578252928,
      "step": 2006
    },
    {
      "epoch": 0.2129217059197963,
      "grad_norm": 0.8062098064899841,
      "learning_rate": 4.996491634548426e-05,
      "loss": 2.073,
      "num_input_tokens_seen": 1579039552,
      "step": 2007
    },
    {
      "epoch": 0.2130277954593677,
      "grad_norm": 0.6051253237048853,
      "learning_rate": 4.996487953054284e-05,
      "loss": 2.1237,
      "num_input_tokens_seen": 1579826304,
      "step": 2008
    },
    {
      "epoch": 0.2131338849989391,
      "grad_norm": 0.7735100695929976,
      "learning_rate": 4.99648426963093e-05,
      "loss": 2.2467,
      "num_input_tokens_seen": 1580613024,
      "step": 2009
    },
    {
      "epoch": 0.2132399745385105,
      "grad_norm": 0.7223297388452966,
      "learning_rate": 4.996480584278367e-05,
      "loss": 2.3789,
      "num_input_tokens_seen": 1581399808,
      "step": 2010
    },
    {
      "epoch": 0.2133460640780819,
      "grad_norm": 0.72504949755814,
      "learning_rate": 4.996476896996596e-05,
      "loss": 2.3102,
      "num_input_tokens_seen": 1582186576,
      "step": 2011
    },
    {
      "epoch": 0.2134521536176533,
      "grad_norm": 0.7407786653139051,
      "learning_rate": 4.996473207785621e-05,
      "loss": 2.1769,
      "num_input_tokens_seen": 1582973344,
      "step": 2012
    },
    {
      "epoch": 0.2135582431572247,
      "grad_norm": 0.5902285166851494,
      "learning_rate": 4.996469516645445e-05,
      "loss": 2.2382,
      "num_input_tokens_seen": 1583760096,
      "step": 2013
    },
    {
      "epoch": 0.2136643326967961,
      "grad_norm": 0.6754093335492897,
      "learning_rate": 4.996465823576071e-05,
      "loss": 2.1661,
      "num_input_tokens_seen": 1584546880,
      "step": 2014
    },
    {
      "epoch": 0.2137704222363675,
      "grad_norm": 0.5768500836661298,
      "learning_rate": 4.9964621285775e-05,
      "loss": 2.1576,
      "num_input_tokens_seen": 1585333712,
      "step": 2015
    },
    {
      "epoch": 0.2138765117759389,
      "grad_norm": 0.8437704303103258,
      "learning_rate": 4.996458431649737e-05,
      "loss": 2.2952,
      "num_input_tokens_seen": 1586120432,
      "step": 2016
    },
    {
      "epoch": 0.21398260131551028,
      "grad_norm": 1.07921309423488,
      "learning_rate": 4.996454732792786e-05,
      "loss": 2.3082,
      "num_input_tokens_seen": 1586907200,
      "step": 2017
    },
    {
      "epoch": 0.2140886908550817,
      "grad_norm": 1.3142278916387602,
      "learning_rate": 4.996451032006646e-05,
      "loss": 2.219,
      "num_input_tokens_seen": 1587694016,
      "step": 2018
    },
    {
      "epoch": 0.2141947803946531,
      "grad_norm": 1.0741312643781902,
      "learning_rate": 4.996447329291323e-05,
      "loss": 2.388,
      "num_input_tokens_seen": 1588480816,
      "step": 2019
    },
    {
      "epoch": 0.21430086993422448,
      "grad_norm": 0.9661176622691252,
      "learning_rate": 4.9964436246468174e-05,
      "loss": 2.2052,
      "num_input_tokens_seen": 1589267568,
      "step": 2020
    },
    {
      "epoch": 0.21440695947379587,
      "grad_norm": 1.231078961824737,
      "learning_rate": 4.996439918073135e-05,
      "loss": 2.2186,
      "num_input_tokens_seen": 1590054304,
      "step": 2021
    },
    {
      "epoch": 0.2145130490133673,
      "grad_norm": 0.8328158151372608,
      "learning_rate": 4.996436209570276e-05,
      "loss": 2.1698,
      "num_input_tokens_seen": 1590841104,
      "step": 2022
    },
    {
      "epoch": 0.21461913855293868,
      "grad_norm": 1.2266040706239738,
      "learning_rate": 4.996432499138244e-05,
      "loss": 2.2097,
      "num_input_tokens_seen": 1591627776,
      "step": 2023
    },
    {
      "epoch": 0.21472522809251007,
      "grad_norm": 2.0165343113671006,
      "learning_rate": 4.996428786777043e-05,
      "loss": 2.3666,
      "num_input_tokens_seen": 1592414528,
      "step": 2024
    },
    {
      "epoch": 0.21483131763208146,
      "grad_norm": 0.9850868708602205,
      "learning_rate": 4.996425072486675e-05,
      "loss": 2.0767,
      "num_input_tokens_seen": 1593201328,
      "step": 2025
    },
    {
      "epoch": 0.21493740717165288,
      "grad_norm": 1.9790937559277937,
      "learning_rate": 4.996421356267143e-05,
      "loss": 2.2437,
      "num_input_tokens_seen": 1593988080,
      "step": 2026
    },
    {
      "epoch": 0.21504349671122427,
      "grad_norm": 2.201240286536558,
      "learning_rate": 4.99641763811845e-05,
      "loss": 2.3026,
      "num_input_tokens_seen": 1594774784,
      "step": 2027
    },
    {
      "epoch": 0.21514958625079567,
      "grad_norm": 1.1821357515213033,
      "learning_rate": 4.9964139180405975e-05,
      "loss": 2.1635,
      "num_input_tokens_seen": 1595561584,
      "step": 2028
    },
    {
      "epoch": 0.21525567579036706,
      "grad_norm": 1.0528636881077944,
      "learning_rate": 4.996410196033591e-05,
      "loss": 2.1884,
      "num_input_tokens_seen": 1596348368,
      "step": 2029
    },
    {
      "epoch": 0.21536176532993848,
      "grad_norm": 1.5829257597467594,
      "learning_rate": 4.996406472097431e-05,
      "loss": 2.2718,
      "num_input_tokens_seen": 1597135136,
      "step": 2030
    },
    {
      "epoch": 0.21546785486950987,
      "grad_norm": 0.8600520126817797,
      "learning_rate": 4.996402746232122e-05,
      "loss": 2.1786,
      "num_input_tokens_seen": 1597921888,
      "step": 2031
    },
    {
      "epoch": 0.21557394440908126,
      "grad_norm": 1.3660984421594577,
      "learning_rate": 4.996399018437666e-05,
      "loss": 2.2645,
      "num_input_tokens_seen": 1598708720,
      "step": 2032
    },
    {
      "epoch": 0.21568003394865265,
      "grad_norm": 0.9478327564356023,
      "learning_rate": 4.996395288714066e-05,
      "loss": 2.247,
      "num_input_tokens_seen": 1599495552,
      "step": 2033
    },
    {
      "epoch": 0.21578612348822407,
      "grad_norm": 1.6751809511001052,
      "learning_rate": 4.996391557061325e-05,
      "loss": 2.3838,
      "num_input_tokens_seen": 1600282272,
      "step": 2034
    },
    {
      "epoch": 0.21589221302779546,
      "grad_norm": 0.7093696975889788,
      "learning_rate": 4.996387823479446e-05,
      "loss": 2.1456,
      "num_input_tokens_seen": 1601069056,
      "step": 2035
    },
    {
      "epoch": 0.21599830256736685,
      "grad_norm": 0.932822622477731,
      "learning_rate": 4.996384087968432e-05,
      "loss": 2.289,
      "num_input_tokens_seen": 1601855824,
      "step": 2036
    },
    {
      "epoch": 0.21610439210693824,
      "grad_norm": 0.7083793937449465,
      "learning_rate": 4.9963803505282854e-05,
      "loss": 2.1608,
      "num_input_tokens_seen": 1602642608,
      "step": 2037
    },
    {
      "epoch": 0.21621048164650966,
      "grad_norm": 0.6881738965550839,
      "learning_rate": 4.996376611159009e-05,
      "loss": 2.0574,
      "num_input_tokens_seen": 1603429392,
      "step": 2038
    },
    {
      "epoch": 0.21631657118608105,
      "grad_norm": 0.6188444957914315,
      "learning_rate": 4.9963728698606064e-05,
      "loss": 2.1258,
      "num_input_tokens_seen": 1604216208,
      "step": 2039
    },
    {
      "epoch": 0.21642266072565244,
      "grad_norm": 0.648989226392761,
      "learning_rate": 4.9963691266330794e-05,
      "loss": 2.1927,
      "num_input_tokens_seen": 1605002992,
      "step": 2040
    },
    {
      "epoch": 0.21652875026522386,
      "grad_norm": 0.5458136225488457,
      "learning_rate": 4.996365381476432e-05,
      "loss": 2.4245,
      "num_input_tokens_seen": 1605789856,
      "step": 2041
    },
    {
      "epoch": 0.21663483980479525,
      "grad_norm": 0.6710624911424344,
      "learning_rate": 4.9963616343906674e-05,
      "loss": 2.307,
      "num_input_tokens_seen": 1606576560,
      "step": 2042
    },
    {
      "epoch": 0.21674092934436665,
      "grad_norm": 0.616830125853907,
      "learning_rate": 4.9963578853757864e-05,
      "loss": 2.2691,
      "num_input_tokens_seen": 1607363312,
      "step": 2043
    },
    {
      "epoch": 0.21684701888393804,
      "grad_norm": 0.6065769622466062,
      "learning_rate": 4.996354134431794e-05,
      "loss": 2.2136,
      "num_input_tokens_seen": 1608150096,
      "step": 2044
    },
    {
      "epoch": 0.21695310842350946,
      "grad_norm": 0.6098944573984909,
      "learning_rate": 4.996350381558693e-05,
      "loss": 2.2269,
      "num_input_tokens_seen": 1608936864,
      "step": 2045
    },
    {
      "epoch": 0.21705919796308085,
      "grad_norm": 0.6253582359126066,
      "learning_rate": 4.9963466267564844e-05,
      "loss": 2.2519,
      "num_input_tokens_seen": 1609723648,
      "step": 2046
    },
    {
      "epoch": 0.21716528750265224,
      "grad_norm": 0.8952928983839358,
      "learning_rate": 4.996342870025173e-05,
      "loss": 2.3118,
      "num_input_tokens_seen": 1610510352,
      "step": 2047
    },
    {
      "epoch": 0.21727137704222363,
      "grad_norm": 0.713988296129289,
      "learning_rate": 4.996339111364761e-05,
      "loss": 2.2689,
      "num_input_tokens_seen": 1611297008,
      "step": 2048
    },
    {
      "epoch": 0.21737746658179505,
      "grad_norm": 0.7373305633244966,
      "learning_rate": 4.996335350775252e-05,
      "loss": 2.3121,
      "num_input_tokens_seen": 1612083824,
      "step": 2049
    },
    {
      "epoch": 0.21748355612136644,
      "grad_norm": 0.7288732506891672,
      "learning_rate": 4.996331588256647e-05,
      "loss": 2.2252,
      "num_input_tokens_seen": 1612870544,
      "step": 2050
    },
    {
      "epoch": 0.21758964566093783,
      "grad_norm": 0.6274809648160464,
      "learning_rate": 4.996327823808952e-05,
      "loss": 2.1811,
      "num_input_tokens_seen": 1613657296,
      "step": 2051
    },
    {
      "epoch": 0.21769573520050922,
      "grad_norm": 0.7178722442565411,
      "learning_rate": 4.996324057432167e-05,
      "loss": 2.2603,
      "num_input_tokens_seen": 1614444064,
      "step": 2052
    },
    {
      "epoch": 0.21780182474008064,
      "grad_norm": 0.7006827664248559,
      "learning_rate": 4.9963202891262956e-05,
      "loss": 2.0643,
      "num_input_tokens_seen": 1615230864,
      "step": 2053
    },
    {
      "epoch": 0.21790791427965203,
      "grad_norm": 1.0099142967105814,
      "learning_rate": 4.996316518891341e-05,
      "loss": 2.3128,
      "num_input_tokens_seen": 1616017648,
      "step": 2054
    },
    {
      "epoch": 0.21801400381922342,
      "grad_norm": 1.0947994998474764,
      "learning_rate": 4.9963127467273074e-05,
      "loss": 1.986,
      "num_input_tokens_seen": 1616804496,
      "step": 2055
    },
    {
      "epoch": 0.21812009335879481,
      "grad_norm": 0.7781626957567485,
      "learning_rate": 4.996308972634196e-05,
      "loss": 2.2915,
      "num_input_tokens_seen": 1617591264,
      "step": 2056
    },
    {
      "epoch": 0.21822618289836623,
      "grad_norm": 0.9556826495589945,
      "learning_rate": 4.99630519661201e-05,
      "loss": 2.2191,
      "num_input_tokens_seen": 1618378048,
      "step": 2057
    },
    {
      "epoch": 0.21833227243793762,
      "grad_norm": 0.7308697993463193,
      "learning_rate": 4.9963014186607526e-05,
      "loss": 2.0877,
      "num_input_tokens_seen": 1619164832,
      "step": 2058
    },
    {
      "epoch": 0.21843836197750902,
      "grad_norm": 0.6985550240054135,
      "learning_rate": 4.9962976387804274e-05,
      "loss": 2.3602,
      "num_input_tokens_seen": 1619951504,
      "step": 2059
    },
    {
      "epoch": 0.2185444515170804,
      "grad_norm": 1.1129260188331864,
      "learning_rate": 4.996293856971036e-05,
      "loss": 2.2833,
      "num_input_tokens_seen": 1620738272,
      "step": 2060
    },
    {
      "epoch": 0.21865054105665183,
      "grad_norm": 0.7227355780652834,
      "learning_rate": 4.9962900732325823e-05,
      "loss": 2.2495,
      "num_input_tokens_seen": 1621525072,
      "step": 2061
    },
    {
      "epoch": 0.21875663059622322,
      "grad_norm": 0.6300427621014716,
      "learning_rate": 4.9962862875650686e-05,
      "loss": 2.2771,
      "num_input_tokens_seen": 1622311840,
      "step": 2062
    },
    {
      "epoch": 0.2188627201357946,
      "grad_norm": 0.7572526892576116,
      "learning_rate": 4.996282499968498e-05,
      "loss": 2.2254,
      "num_input_tokens_seen": 1623098608,
      "step": 2063
    },
    {
      "epoch": 0.218968809675366,
      "grad_norm": 0.8891148935446693,
      "learning_rate": 4.996278710442874e-05,
      "loss": 2.1439,
      "num_input_tokens_seen": 1623885424,
      "step": 2064
    },
    {
      "epoch": 0.21907489921493742,
      "grad_norm": 0.9221107887439223,
      "learning_rate": 4.996274918988199e-05,
      "loss": 2.2316,
      "num_input_tokens_seen": 1624672256,
      "step": 2065
    },
    {
      "epoch": 0.2191809887545088,
      "grad_norm": 0.5604045006898463,
      "learning_rate": 4.996271125604476e-05,
      "loss": 2.2273,
      "num_input_tokens_seen": 1625458960,
      "step": 2066
    },
    {
      "epoch": 0.2192870782940802,
      "grad_norm": 0.5466116995062924,
      "learning_rate": 4.9962673302917076e-05,
      "loss": 2.1841,
      "num_input_tokens_seen": 1626245712,
      "step": 2067
    },
    {
      "epoch": 0.2193931678336516,
      "grad_norm": 0.506112032488481,
      "learning_rate": 4.996263533049897e-05,
      "loss": 2.2039,
      "num_input_tokens_seen": 1627032480,
      "step": 2068
    },
    {
      "epoch": 0.219499257373223,
      "grad_norm": 0.5228106691633302,
      "learning_rate": 4.996259733879047e-05,
      "loss": 2.3623,
      "num_input_tokens_seen": 1627819248,
      "step": 2069
    },
    {
      "epoch": 0.2196053469127944,
      "grad_norm": 0.5622340017800367,
      "learning_rate": 4.9962559327791616e-05,
      "loss": 2.3516,
      "num_input_tokens_seen": 1628606016,
      "step": 2070
    },
    {
      "epoch": 0.2197114364523658,
      "grad_norm": 0.6382440199850425,
      "learning_rate": 4.996252129750242e-05,
      "loss": 2.2004,
      "num_input_tokens_seen": 1629392672,
      "step": 2071
    },
    {
      "epoch": 0.21981752599193718,
      "grad_norm": 0.6017982542315423,
      "learning_rate": 4.996248324792292e-05,
      "loss": 2.2753,
      "num_input_tokens_seen": 1630179504,
      "step": 2072
    },
    {
      "epoch": 0.2199236155315086,
      "grad_norm": 0.6009923550570777,
      "learning_rate": 4.9962445179053154e-05,
      "loss": 2.1844,
      "num_input_tokens_seen": 1630966288,
      "step": 2073
    },
    {
      "epoch": 0.22002970507108,
      "grad_norm": 0.6580889503812165,
      "learning_rate": 4.9962407090893134e-05,
      "loss": 2.1919,
      "num_input_tokens_seen": 1631752992,
      "step": 2074
    },
    {
      "epoch": 0.2201357946106514,
      "grad_norm": 0.6401966006831572,
      "learning_rate": 4.99623689834429e-05,
      "loss": 2.2071,
      "num_input_tokens_seen": 1632539712,
      "step": 2075
    },
    {
      "epoch": 0.22024188415022278,
      "grad_norm": 0.9761079030994454,
      "learning_rate": 4.996233085670248e-05,
      "loss": 2.2614,
      "num_input_tokens_seen": 1633326448,
      "step": 2076
    },
    {
      "epoch": 0.2203479736897942,
      "grad_norm": 0.8272439528400245,
      "learning_rate": 4.996229271067191e-05,
      "loss": 2.1063,
      "num_input_tokens_seen": 1634113232,
      "step": 2077
    },
    {
      "epoch": 0.2204540632293656,
      "grad_norm": 0.5688973878456371,
      "learning_rate": 4.996225454535121e-05,
      "loss": 2.1216,
      "num_input_tokens_seen": 1634900032,
      "step": 2078
    },
    {
      "epoch": 0.22056015276893698,
      "grad_norm": 0.9456479648348253,
      "learning_rate": 4.996221636074041e-05,
      "loss": 2.1231,
      "num_input_tokens_seen": 1635686864,
      "step": 2079
    },
    {
      "epoch": 0.22066624230850837,
      "grad_norm": 1.1007018569351912,
      "learning_rate": 4.9962178156839535e-05,
      "loss": 2.2671,
      "num_input_tokens_seen": 1636473616,
      "step": 2080
    },
    {
      "epoch": 0.2207723318480798,
      "grad_norm": 0.6917326480981103,
      "learning_rate": 4.9962139933648626e-05,
      "loss": 2.2076,
      "num_input_tokens_seen": 1637260448,
      "step": 2081
    },
    {
      "epoch": 0.22087842138765118,
      "grad_norm": 0.7428292113261207,
      "learning_rate": 4.996210169116771e-05,
      "loss": 2.0625,
      "num_input_tokens_seen": 1638047152,
      "step": 2082
    },
    {
      "epoch": 0.22098451092722257,
      "grad_norm": 1.2978409786181733,
      "learning_rate": 4.996206342939681e-05,
      "loss": 2.1019,
      "num_input_tokens_seen": 1638833936,
      "step": 2083
    },
    {
      "epoch": 0.22109060046679396,
      "grad_norm": 0.8189595624010048,
      "learning_rate": 4.996202514833597e-05,
      "loss": 2.0939,
      "num_input_tokens_seen": 1639620720,
      "step": 2084
    },
    {
      "epoch": 0.22119669000636538,
      "grad_norm": 1.0790565343147078,
      "learning_rate": 4.99619868479852e-05,
      "loss": 2.1103,
      "num_input_tokens_seen": 1640407600,
      "step": 2085
    },
    {
      "epoch": 0.22130277954593677,
      "grad_norm": 1.245841865743716,
      "learning_rate": 4.996194852834454e-05,
      "loss": 2.2325,
      "num_input_tokens_seen": 1641194368,
      "step": 2086
    },
    {
      "epoch": 0.22140886908550816,
      "grad_norm": 1.1920756807323039,
      "learning_rate": 4.996191018941402e-05,
      "loss": 2.1417,
      "num_input_tokens_seen": 1641981120,
      "step": 2087
    },
    {
      "epoch": 0.22151495862507956,
      "grad_norm": 0.830410628947348,
      "learning_rate": 4.996187183119367e-05,
      "loss": 2.3791,
      "num_input_tokens_seen": 1642767952,
      "step": 2088
    },
    {
      "epoch": 0.22162104816465097,
      "grad_norm": 0.7695061806706736,
      "learning_rate": 4.9961833453683515e-05,
      "loss": 2.2087,
      "num_input_tokens_seen": 1643554752,
      "step": 2089
    },
    {
      "epoch": 0.22172713770422237,
      "grad_norm": 1.4727318877077034,
      "learning_rate": 4.996179505688359e-05,
      "loss": 2.1245,
      "num_input_tokens_seen": 1644341568,
      "step": 2090
    },
    {
      "epoch": 0.22183322724379376,
      "grad_norm": 0.7371580694126192,
      "learning_rate": 4.9961756640793916e-05,
      "loss": 2.2479,
      "num_input_tokens_seen": 1645128304,
      "step": 2091
    },
    {
      "epoch": 0.22193931678336515,
      "grad_norm": 1.5521507980290274,
      "learning_rate": 4.996171820541453e-05,
      "loss": 2.1537,
      "num_input_tokens_seen": 1645915040,
      "step": 2092
    },
    {
      "epoch": 0.22204540632293657,
      "grad_norm": 0.8034399795510445,
      "learning_rate": 4.996167975074547e-05,
      "loss": 2.0843,
      "num_input_tokens_seen": 1646701840,
      "step": 2093
    },
    {
      "epoch": 0.22215149586250796,
      "grad_norm": 0.9850664618919193,
      "learning_rate": 4.996164127678675e-05,
      "loss": 2.0832,
      "num_input_tokens_seen": 1647488656,
      "step": 2094
    },
    {
      "epoch": 0.22225758540207935,
      "grad_norm": 1.4474060552335075,
      "learning_rate": 4.996160278353841e-05,
      "loss": 2.4323,
      "num_input_tokens_seen": 1648275280,
      "step": 2095
    },
    {
      "epoch": 0.22236367494165074,
      "grad_norm": 0.9002173224199567,
      "learning_rate": 4.9961564271000474e-05,
      "loss": 2.1754,
      "num_input_tokens_seen": 1649062064,
      "step": 2096
    },
    {
      "epoch": 0.22246976448122216,
      "grad_norm": 0.7197753897011036,
      "learning_rate": 4.9961525739172965e-05,
      "loss": 2.2313,
      "num_input_tokens_seen": 1649848880,
      "step": 2097
    },
    {
      "epoch": 0.22257585402079355,
      "grad_norm": 0.7146155588065187,
      "learning_rate": 4.9961487188055934e-05,
      "loss": 2.143,
      "num_input_tokens_seen": 1650635616,
      "step": 2098
    },
    {
      "epoch": 0.22268194356036494,
      "grad_norm": 0.7134649634006204,
      "learning_rate": 4.996144861764939e-05,
      "loss": 2.0986,
      "num_input_tokens_seen": 1651422400,
      "step": 2099
    },
    {
      "epoch": 0.22278803309993633,
      "grad_norm": 1.0266884124505382,
      "learning_rate": 4.996141002795337e-05,
      "loss": 2.2474,
      "num_input_tokens_seen": 1652209184,
      "step": 2100
    },
    {
      "epoch": 0.22289412263950775,
      "grad_norm": 0.6236118627636782,
      "learning_rate": 4.9961371418967906e-05,
      "loss": 2.1563,
      "num_input_tokens_seen": 1652995936,
      "step": 2101
    },
    {
      "epoch": 0.22300021217907914,
      "grad_norm": 1.0503221139690424,
      "learning_rate": 4.9961332790693025e-05,
      "loss": 2.2905,
      "num_input_tokens_seen": 1653782640,
      "step": 2102
    },
    {
      "epoch": 0.22310630171865053,
      "grad_norm": 0.7684144470035764,
      "learning_rate": 4.996129414312877e-05,
      "loss": 2.2064,
      "num_input_tokens_seen": 1654569456,
      "step": 2103
    },
    {
      "epoch": 0.22321239125822193,
      "grad_norm": 0.9590134355878882,
      "learning_rate": 4.996125547627515e-05,
      "loss": 2.1806,
      "num_input_tokens_seen": 1655356144,
      "step": 2104
    },
    {
      "epoch": 0.22331848079779335,
      "grad_norm": 0.7469524527145384,
      "learning_rate": 4.9961216790132204e-05,
      "loss": 2.0474,
      "num_input_tokens_seen": 1656143008,
      "step": 2105
    },
    {
      "epoch": 0.22342457033736474,
      "grad_norm": 0.8033317747828058,
      "learning_rate": 4.9961178084699966e-05,
      "loss": 2.2112,
      "num_input_tokens_seen": 1656929664,
      "step": 2106
    },
    {
      "epoch": 0.22353065987693613,
      "grad_norm": 1.199822783766537,
      "learning_rate": 4.996113935997846e-05,
      "loss": 2.3626,
      "num_input_tokens_seen": 1657716480,
      "step": 2107
    },
    {
      "epoch": 0.22363674941650752,
      "grad_norm": 0.769477946614052,
      "learning_rate": 4.996110061596772e-05,
      "loss": 2.1817,
      "num_input_tokens_seen": 1658503280,
      "step": 2108
    },
    {
      "epoch": 0.22374283895607894,
      "grad_norm": 0.7662944523171498,
      "learning_rate": 4.996106185266777e-05,
      "loss": 2.367,
      "num_input_tokens_seen": 1659290112,
      "step": 2109
    },
    {
      "epoch": 0.22384892849565033,
      "grad_norm": 0.9619461638819996,
      "learning_rate": 4.996102307007864e-05,
      "loss": 2.0882,
      "num_input_tokens_seen": 1660076976,
      "step": 2110
    },
    {
      "epoch": 0.22395501803522172,
      "grad_norm": 0.8897566966629099,
      "learning_rate": 4.996098426820037e-05,
      "loss": 2.085,
      "num_input_tokens_seen": 1660863792,
      "step": 2111
    },
    {
      "epoch": 0.22406110757479314,
      "grad_norm": 0.7491544998798026,
      "learning_rate": 4.996094544703298e-05,
      "loss": 2.3354,
      "num_input_tokens_seen": 1661650544,
      "step": 2112
    },
    {
      "epoch": 0.22416719711436453,
      "grad_norm": 1.0816071807838892,
      "learning_rate": 4.996090660657651e-05,
      "loss": 2.1204,
      "num_input_tokens_seen": 1662437232,
      "step": 2113
    },
    {
      "epoch": 0.22427328665393592,
      "grad_norm": 0.9019860795573834,
      "learning_rate": 4.996086774683098e-05,
      "loss": 2.2897,
      "num_input_tokens_seen": 1663224032,
      "step": 2114
    },
    {
      "epoch": 0.2243793761935073,
      "grad_norm": 0.707464292819455,
      "learning_rate": 4.996082886779642e-05,
      "loss": 2.1459,
      "num_input_tokens_seen": 1664010880,
      "step": 2115
    },
    {
      "epoch": 0.22448546573307873,
      "grad_norm": 0.8592914555762284,
      "learning_rate": 4.996078996947287e-05,
      "loss": 2.2701,
      "num_input_tokens_seen": 1664797616,
      "step": 2116
    },
    {
      "epoch": 0.22459155527265012,
      "grad_norm": 1.2743255000864797,
      "learning_rate": 4.9960751051860355e-05,
      "loss": 2.348,
      "num_input_tokens_seen": 1665584384,
      "step": 2117
    },
    {
      "epoch": 0.22469764481222151,
      "grad_norm": 0.9496884721720086,
      "learning_rate": 4.9960712114958895e-05,
      "loss": 2.4899,
      "num_input_tokens_seen": 1666371120,
      "step": 2118
    },
    {
      "epoch": 0.2248037343517929,
      "grad_norm": 1.1100773347423982,
      "learning_rate": 4.996067315876854e-05,
      "loss": 2.5207,
      "num_input_tokens_seen": 1667157904,
      "step": 2119
    },
    {
      "epoch": 0.22490982389136432,
      "grad_norm": 1.1874354362001376,
      "learning_rate": 4.99606341832893e-05,
      "loss": 2.1388,
      "num_input_tokens_seen": 1667944672,
      "step": 2120
    },
    {
      "epoch": 0.22501591343093572,
      "grad_norm": 0.870448840241796,
      "learning_rate": 4.996059518852122e-05,
      "loss": 2.3398,
      "num_input_tokens_seen": 1668731472,
      "step": 2121
    },
    {
      "epoch": 0.2251220029705071,
      "grad_norm": 1.2100231152355534,
      "learning_rate": 4.996055617446432e-05,
      "loss": 2.1713,
      "num_input_tokens_seen": 1669518240,
      "step": 2122
    },
    {
      "epoch": 0.2252280925100785,
      "grad_norm": 0.7812666512571858,
      "learning_rate": 4.996051714111864e-05,
      "loss": 2.1996,
      "num_input_tokens_seen": 1670305152,
      "step": 2123
    },
    {
      "epoch": 0.22533418204964992,
      "grad_norm": 1.2444337728877624,
      "learning_rate": 4.9960478088484196e-05,
      "loss": 2.1818,
      "num_input_tokens_seen": 1671091920,
      "step": 2124
    },
    {
      "epoch": 0.2254402715892213,
      "grad_norm": 1.0970061501590107,
      "learning_rate": 4.9960439016561036e-05,
      "loss": 2.1521,
      "num_input_tokens_seen": 1671878784,
      "step": 2125
    },
    {
      "epoch": 0.2255463611287927,
      "grad_norm": 1.7168800541770914,
      "learning_rate": 4.9960399925349174e-05,
      "loss": 2.3749,
      "num_input_tokens_seen": 1672665552,
      "step": 2126
    },
    {
      "epoch": 0.2256524506683641,
      "grad_norm": 1.1561882413172555,
      "learning_rate": 4.996036081484866e-05,
      "loss": 2.4034,
      "num_input_tokens_seen": 1673452240,
      "step": 2127
    },
    {
      "epoch": 0.2257585402079355,
      "grad_norm": 1.05687266068624,
      "learning_rate": 4.99603216850595e-05,
      "loss": 2.1633,
      "num_input_tokens_seen": 1674238960,
      "step": 2128
    },
    {
      "epoch": 0.2258646297475069,
      "grad_norm": 2.00612512461826,
      "learning_rate": 4.996028253598174e-05,
      "loss": 2.172,
      "num_input_tokens_seen": 1675025808,
      "step": 2129
    },
    {
      "epoch": 0.2259707192870783,
      "grad_norm": 1.4050129059499665,
      "learning_rate": 4.9960243367615403e-05,
      "loss": 2.3024,
      "num_input_tokens_seen": 1675812592,
      "step": 2130
    },
    {
      "epoch": 0.22607680882664968,
      "grad_norm": 2.3359432392635067,
      "learning_rate": 4.9960204179960526e-05,
      "loss": 2.2403,
      "num_input_tokens_seen": 1676599392,
      "step": 2131
    },
    {
      "epoch": 0.2261828983662211,
      "grad_norm": 1.9313588687171512,
      "learning_rate": 4.996016497301713e-05,
      "loss": 2.1744,
      "num_input_tokens_seen": 1677386048,
      "step": 2132
    },
    {
      "epoch": 0.2262889879057925,
      "grad_norm": 1.0176392293439607,
      "learning_rate": 4.996012574678526e-05,
      "loss": 2.2689,
      "num_input_tokens_seen": 1678172784,
      "step": 2133
    },
    {
      "epoch": 0.22639507744536388,
      "grad_norm": 1.2945210695488643,
      "learning_rate": 4.996008650126492e-05,
      "loss": 2.1488,
      "num_input_tokens_seen": 1678959504,
      "step": 2134
    },
    {
      "epoch": 0.22650116698493528,
      "grad_norm": 0.9856450857841633,
      "learning_rate": 4.996004723645618e-05,
      "loss": 2.215,
      "num_input_tokens_seen": 1679746288,
      "step": 2135
    },
    {
      "epoch": 0.2266072565245067,
      "grad_norm": 1.374754749135823,
      "learning_rate": 4.9960007952359036e-05,
      "loss": 2.199,
      "num_input_tokens_seen": 1680533056,
      "step": 2136
    },
    {
      "epoch": 0.2267133460640781,
      "grad_norm": 1.0785562854074777,
      "learning_rate": 4.995996864897353e-05,
      "loss": 2.1805,
      "num_input_tokens_seen": 1681319840,
      "step": 2137
    },
    {
      "epoch": 0.22681943560364948,
      "grad_norm": 0.9826141756417726,
      "learning_rate": 4.995992932629969e-05,
      "loss": 2.2308,
      "num_input_tokens_seen": 1682106640,
      "step": 2138
    },
    {
      "epoch": 0.22692552514322087,
      "grad_norm": 1.120994681807843,
      "learning_rate": 4.9959889984337556e-05,
      "loss": 2.0351,
      "num_input_tokens_seen": 1682893328,
      "step": 2139
    },
    {
      "epoch": 0.2270316146827923,
      "grad_norm": 0.9717425796778362,
      "learning_rate": 4.9959850623087145e-05,
      "loss": 2.0492,
      "num_input_tokens_seen": 1683680096,
      "step": 2140
    },
    {
      "epoch": 0.22713770422236368,
      "grad_norm": 1.5264168887023664,
      "learning_rate": 4.99598112425485e-05,
      "loss": 2.3748,
      "num_input_tokens_seen": 1684466832,
      "step": 2141
    },
    {
      "epoch": 0.22724379376193507,
      "grad_norm": 0.5951007365444863,
      "learning_rate": 4.9959771842721634e-05,
      "loss": 2.1081,
      "num_input_tokens_seen": 1685253536,
      "step": 2142
    },
    {
      "epoch": 0.22734988330150646,
      "grad_norm": 1.2577877789003193,
      "learning_rate": 4.99597324236066e-05,
      "loss": 2.2203,
      "num_input_tokens_seen": 1686040272,
      "step": 2143
    },
    {
      "epoch": 0.22745597284107788,
      "grad_norm": 0.6945727553157489,
      "learning_rate": 4.995969298520342e-05,
      "loss": 2.0014,
      "num_input_tokens_seen": 1686827072,
      "step": 2144
    },
    {
      "epoch": 0.22756206238064927,
      "grad_norm": 1.500986952510879,
      "learning_rate": 4.995965352751211e-05,
      "loss": 2.2573,
      "num_input_tokens_seen": 1687613792,
      "step": 2145
    },
    {
      "epoch": 0.22766815192022066,
      "grad_norm": 0.9368989302855916,
      "learning_rate": 4.995961405053272e-05,
      "loss": 2.132,
      "num_input_tokens_seen": 1688400576,
      "step": 2146
    },
    {
      "epoch": 0.22777424145979205,
      "grad_norm": 1.6645584401549227,
      "learning_rate": 4.995957455426527e-05,
      "loss": 2.3392,
      "num_input_tokens_seen": 1689187344,
      "step": 2147
    },
    {
      "epoch": 0.22788033099936347,
      "grad_norm": 1.1168450556992753,
      "learning_rate": 4.9959535038709796e-05,
      "loss": 2.2553,
      "num_input_tokens_seen": 1689974128,
      "step": 2148
    },
    {
      "epoch": 0.22798642053893486,
      "grad_norm": 1.346944537913399,
      "learning_rate": 4.995949550386632e-05,
      "loss": 2.1223,
      "num_input_tokens_seen": 1690760928,
      "step": 2149
    },
    {
      "epoch": 0.22809251007850626,
      "grad_norm": 1.0709630152450098,
      "learning_rate": 4.995945594973488e-05,
      "loss": 2.2503,
      "num_input_tokens_seen": 1691547744,
      "step": 2150
    },
    {
      "epoch": 0.22819859961807765,
      "grad_norm": 1.3216085026824702,
      "learning_rate": 4.995941637631551e-05,
      "loss": 2.0286,
      "num_input_tokens_seen": 1692334464,
      "step": 2151
    },
    {
      "epoch": 0.22830468915764907,
      "grad_norm": 2.2023508510539855,
      "learning_rate": 4.995937678360823e-05,
      "loss": 2.3911,
      "num_input_tokens_seen": 1693121248,
      "step": 2152
    },
    {
      "epoch": 0.22841077869722046,
      "grad_norm": 0.9908032596120026,
      "learning_rate": 4.995933717161307e-05,
      "loss": 2.2133,
      "num_input_tokens_seen": 1693907936,
      "step": 2153
    },
    {
      "epoch": 0.22851686823679185,
      "grad_norm": 0.7690819171327764,
      "learning_rate": 4.995929754033008e-05,
      "loss": 2.1563,
      "num_input_tokens_seen": 1694694800,
      "step": 2154
    },
    {
      "epoch": 0.22862295777636324,
      "grad_norm": 0.8002916970458045,
      "learning_rate": 4.995925788975927e-05,
      "loss": 2.2223,
      "num_input_tokens_seen": 1695481616,
      "step": 2155
    },
    {
      "epoch": 0.22872904731593466,
      "grad_norm": 0.887169787989122,
      "learning_rate": 4.995921821990068e-05,
      "loss": 2.1133,
      "num_input_tokens_seen": 1696268416,
      "step": 2156
    },
    {
      "epoch": 0.22883513685550605,
      "grad_norm": 0.6258380763225815,
      "learning_rate": 4.995917853075434e-05,
      "loss": 2.0547,
      "num_input_tokens_seen": 1697055232,
      "step": 2157
    },
    {
      "epoch": 0.22894122639507744,
      "grad_norm": 1.3147592407940818,
      "learning_rate": 4.995913882232028e-05,
      "loss": 2.35,
      "num_input_tokens_seen": 1697842032,
      "step": 2158
    },
    {
      "epoch": 0.22904731593464883,
      "grad_norm": 0.899089001607969,
      "learning_rate": 4.995909909459853e-05,
      "loss": 2.3191,
      "num_input_tokens_seen": 1698628800,
      "step": 2159
    },
    {
      "epoch": 0.22915340547422025,
      "grad_norm": 0.7191050134484169,
      "learning_rate": 4.995905934758911e-05,
      "loss": 2.1129,
      "num_input_tokens_seen": 1699415536,
      "step": 2160
    },
    {
      "epoch": 0.22925949501379164,
      "grad_norm": 1.4315198804440186,
      "learning_rate": 4.9959019581292073e-05,
      "loss": 2.2933,
      "num_input_tokens_seen": 1700202192,
      "step": 2161
    },
    {
      "epoch": 0.22936558455336303,
      "grad_norm": 0.8945445323086733,
      "learning_rate": 4.995897979570743e-05,
      "loss": 2.4144,
      "num_input_tokens_seen": 1700988880,
      "step": 2162
    },
    {
      "epoch": 0.22947167409293442,
      "grad_norm": 1.1064013369251549,
      "learning_rate": 4.995893999083522e-05,
      "loss": 2.2693,
      "num_input_tokens_seen": 1701775712,
      "step": 2163
    },
    {
      "epoch": 0.22957776363250584,
      "grad_norm": 1.2270402789876176,
      "learning_rate": 4.9958900166675485e-05,
      "loss": 2.0345,
      "num_input_tokens_seen": 1702562624,
      "step": 2164
    },
    {
      "epoch": 0.22968385317207723,
      "grad_norm": 0.7385896863431902,
      "learning_rate": 4.995886032322823e-05,
      "loss": 2.1195,
      "num_input_tokens_seen": 1703349408,
      "step": 2165
    },
    {
      "epoch": 0.22978994271164863,
      "grad_norm": 1.4170439586241461,
      "learning_rate": 4.99588204604935e-05,
      "loss": 2.315,
      "num_input_tokens_seen": 1704136112,
      "step": 2166
    },
    {
      "epoch": 0.22989603225122002,
      "grad_norm": 1.1424675146057601,
      "learning_rate": 4.9958780578471345e-05,
      "loss": 2.2216,
      "num_input_tokens_seen": 1704922864,
      "step": 2167
    },
    {
      "epoch": 0.23000212179079144,
      "grad_norm": 1.2897921019458527,
      "learning_rate": 4.995874067716176e-05,
      "loss": 2.3343,
      "num_input_tokens_seen": 1705709568,
      "step": 2168
    },
    {
      "epoch": 0.23010821133036283,
      "grad_norm": 1.1315208050988619,
      "learning_rate": 4.9958700756564794e-05,
      "loss": 2.3548,
      "num_input_tokens_seen": 1706496464,
      "step": 2169
    },
    {
      "epoch": 0.23021430086993422,
      "grad_norm": 1.4548981440503765,
      "learning_rate": 4.995866081668048e-05,
      "loss": 2.3829,
      "num_input_tokens_seen": 1707283184,
      "step": 2170
    },
    {
      "epoch": 0.2303203904095056,
      "grad_norm": 0.7293180542302178,
      "learning_rate": 4.995862085750884e-05,
      "loss": 2.1848,
      "num_input_tokens_seen": 1708069872,
      "step": 2171
    },
    {
      "epoch": 0.23042647994907703,
      "grad_norm": 1.4349172718942078,
      "learning_rate": 4.9958580879049924e-05,
      "loss": 2.1538,
      "num_input_tokens_seen": 1708856592,
      "step": 2172
    },
    {
      "epoch": 0.23053256948864842,
      "grad_norm": 0.7912525009746877,
      "learning_rate": 4.995854088130373e-05,
      "loss": 2.2215,
      "num_input_tokens_seen": 1709643312,
      "step": 2173
    },
    {
      "epoch": 0.2306386590282198,
      "grad_norm": 1.448099111986664,
      "learning_rate": 4.995850086427032e-05,
      "loss": 2.4485,
      "num_input_tokens_seen": 1710430080,
      "step": 2174
    },
    {
      "epoch": 0.2307447485677912,
      "grad_norm": 1.3960966212354735,
      "learning_rate": 4.995846082794971e-05,
      "loss": 2.1454,
      "num_input_tokens_seen": 1711216800,
      "step": 2175
    },
    {
      "epoch": 0.23085083810736262,
      "grad_norm": 0.9528086961476128,
      "learning_rate": 4.9958420772341935e-05,
      "loss": 2.3833,
      "num_input_tokens_seen": 1712003600,
      "step": 2176
    },
    {
      "epoch": 0.230956927646934,
      "grad_norm": 2.619889699955854,
      "learning_rate": 4.995838069744702e-05,
      "loss": 2.3145,
      "num_input_tokens_seen": 1712790384,
      "step": 2177
    },
    {
      "epoch": 0.2310630171865054,
      "grad_norm": 1.428451853137765,
      "learning_rate": 4.9958340603265005e-05,
      "loss": 2.0786,
      "num_input_tokens_seen": 1713577152,
      "step": 2178
    },
    {
      "epoch": 0.2311691067260768,
      "grad_norm": 2.1392740854106957,
      "learning_rate": 4.995830048979592e-05,
      "loss": 2.259,
      "num_input_tokens_seen": 1714363952,
      "step": 2179
    },
    {
      "epoch": 0.23127519626564821,
      "grad_norm": 1.6234018287471064,
      "learning_rate": 4.9958260357039786e-05,
      "loss": 2.0545,
      "num_input_tokens_seen": 1715150768,
      "step": 2180
    },
    {
      "epoch": 0.2313812858052196,
      "grad_norm": 2.748882936372654,
      "learning_rate": 4.9958220204996644e-05,
      "loss": 2.2758,
      "num_input_tokens_seen": 1715937568,
      "step": 2181
    },
    {
      "epoch": 0.231487375344791,
      "grad_norm": 1.7185210015313426,
      "learning_rate": 4.995818003366652e-05,
      "loss": 2.2598,
      "num_input_tokens_seen": 1716724368,
      "step": 2182
    },
    {
      "epoch": 0.23159346488436242,
      "grad_norm": 0.9307967986592559,
      "learning_rate": 4.9958139843049445e-05,
      "loss": 2.1355,
      "num_input_tokens_seen": 1717511072,
      "step": 2183
    },
    {
      "epoch": 0.2316995544239338,
      "grad_norm": 1.317238085261376,
      "learning_rate": 4.995809963314546e-05,
      "loss": 2.0329,
      "num_input_tokens_seen": 1718297920,
      "step": 2184
    },
    {
      "epoch": 0.2318056439635052,
      "grad_norm": 0.9381874839611178,
      "learning_rate": 4.995805940395458e-05,
      "loss": 2.289,
      "num_input_tokens_seen": 1719084800,
      "step": 2185
    },
    {
      "epoch": 0.2319117335030766,
      "grad_norm": 0.9167105067456719,
      "learning_rate": 4.9958019155476845e-05,
      "loss": 2.1726,
      "num_input_tokens_seen": 1719871616,
      "step": 2186
    },
    {
      "epoch": 0.232017823042648,
      "grad_norm": 0.5853465853993731,
      "learning_rate": 4.9957978887712286e-05,
      "loss": 2.1521,
      "num_input_tokens_seen": 1720658416,
      "step": 2187
    },
    {
      "epoch": 0.2321239125822194,
      "grad_norm": 0.8896848650553826,
      "learning_rate": 4.9957938600660935e-05,
      "loss": 2.1805,
      "num_input_tokens_seen": 1721445216,
      "step": 2188
    },
    {
      "epoch": 0.2322300021217908,
      "grad_norm": 0.8673902406116764,
      "learning_rate": 4.995789829432283e-05,
      "loss": 2.1503,
      "num_input_tokens_seen": 1722232048,
      "step": 2189
    },
    {
      "epoch": 0.23233609166136218,
      "grad_norm": 0.7964975073418396,
      "learning_rate": 4.9957857968697975e-05,
      "loss": 2.2106,
      "num_input_tokens_seen": 1723018864,
      "step": 2190
    },
    {
      "epoch": 0.2324421812009336,
      "grad_norm": 1.0115000077791454,
      "learning_rate": 4.995781762378643e-05,
      "loss": 2.33,
      "num_input_tokens_seen": 1723805584,
      "step": 2191
    },
    {
      "epoch": 0.232548270740505,
      "grad_norm": 1.6399676912658327,
      "learning_rate": 4.995777725958821e-05,
      "loss": 2.2625,
      "num_input_tokens_seen": 1724592384,
      "step": 2192
    },
    {
      "epoch": 0.23265436028007638,
      "grad_norm": 1.1846054201859206,
      "learning_rate": 4.995773687610336e-05,
      "loss": 2.3229,
      "num_input_tokens_seen": 1725379136,
      "step": 2193
    },
    {
      "epoch": 0.23276044981964777,
      "grad_norm": 2.6663343948178055,
      "learning_rate": 4.99576964733319e-05,
      "loss": 2.3524,
      "num_input_tokens_seen": 1726165920,
      "step": 2194
    },
    {
      "epoch": 0.2328665393592192,
      "grad_norm": 1.616396326195786,
      "learning_rate": 4.995765605127386e-05,
      "loss": 2.1792,
      "num_input_tokens_seen": 1726952672,
      "step": 2195
    },
    {
      "epoch": 0.23297262889879058,
      "grad_norm": 1.2882852310782762,
      "learning_rate": 4.995761560992929e-05,
      "loss": 2.094,
      "num_input_tokens_seen": 1727739408,
      "step": 2196
    },
    {
      "epoch": 0.23307871843836198,
      "grad_norm": 1.2613167555691216,
      "learning_rate": 4.995757514929819e-05,
      "loss": 2.212,
      "num_input_tokens_seen": 1728526160,
      "step": 2197
    },
    {
      "epoch": 0.23318480797793337,
      "grad_norm": 1.2014728000667028,
      "learning_rate": 4.995753466938061e-05,
      "loss": 2.2194,
      "num_input_tokens_seen": 1729312960,
      "step": 2198
    },
    {
      "epoch": 0.23329089751750479,
      "grad_norm": 1.1035382298370429,
      "learning_rate": 4.995749417017659e-05,
      "loss": 2.2833,
      "num_input_tokens_seen": 1730099744,
      "step": 2199
    },
    {
      "epoch": 0.23339698705707618,
      "grad_norm": 1.576642690291744,
      "learning_rate": 4.9957453651686145e-05,
      "loss": 2.3134,
      "num_input_tokens_seen": 1730886400,
      "step": 2200
    },
    {
      "epoch": 0.23350307659664757,
      "grad_norm": 1.00849971951543,
      "learning_rate": 4.9957413113909315e-05,
      "loss": 2.2918,
      "num_input_tokens_seen": 1731673088,
      "step": 2201
    },
    {
      "epoch": 0.23360916613621896,
      "grad_norm": 1.506610368232525,
      "learning_rate": 4.995737255684613e-05,
      "loss": 2.2487,
      "num_input_tokens_seen": 1732459840,
      "step": 2202
    },
    {
      "epoch": 0.23371525567579038,
      "grad_norm": 1.2352032204961316,
      "learning_rate": 4.995733198049661e-05,
      "loss": 2.4016,
      "num_input_tokens_seen": 1733246576,
      "step": 2203
    },
    {
      "epoch": 0.23382134521536177,
      "grad_norm": 1.5065482208502556,
      "learning_rate": 4.99572913848608e-05,
      "loss": 2.2491,
      "num_input_tokens_seen": 1734033312,
      "step": 2204
    },
    {
      "epoch": 0.23392743475493316,
      "grad_norm": 1.2262448699346942,
      "learning_rate": 4.995725076993873e-05,
      "loss": 2.2607,
      "num_input_tokens_seen": 1734820016,
      "step": 2205
    },
    {
      "epoch": 0.23403352429450455,
      "grad_norm": 2.0587277102164947,
      "learning_rate": 4.995721013573043e-05,
      "loss": 2.3271,
      "num_input_tokens_seen": 1735606720,
      "step": 2206
    },
    {
      "epoch": 0.23413961383407597,
      "grad_norm": 1.5753693089179794,
      "learning_rate": 4.995716948223593e-05,
      "loss": 2.2989,
      "num_input_tokens_seen": 1736393568,
      "step": 2207
    },
    {
      "epoch": 0.23424570337364736,
      "grad_norm": 1.0787389790674717,
      "learning_rate": 4.995712880945526e-05,
      "loss": 2.2636,
      "num_input_tokens_seen": 1737180320,
      "step": 2208
    },
    {
      "epoch": 0.23435179291321875,
      "grad_norm": 1.1617948640874718,
      "learning_rate": 4.995708811738845e-05,
      "loss": 2.2714,
      "num_input_tokens_seen": 1737967120,
      "step": 2209
    },
    {
      "epoch": 0.23445788245279015,
      "grad_norm": 1.0203597747496023,
      "learning_rate": 4.995704740603554e-05,
      "loss": 2.0941,
      "num_input_tokens_seen": 1738753936,
      "step": 2210
    },
    {
      "epoch": 0.23456397199236156,
      "grad_norm": 1.2251728112525553,
      "learning_rate": 4.995700667539655e-05,
      "loss": 2.0138,
      "num_input_tokens_seen": 1739540752,
      "step": 2211
    },
    {
      "epoch": 0.23467006153193296,
      "grad_norm": 1.0085210089545809,
      "learning_rate": 4.995696592547152e-05,
      "loss": 2.155,
      "num_input_tokens_seen": 1740327456,
      "step": 2212
    },
    {
      "epoch": 0.23477615107150435,
      "grad_norm": 1.513119141434676,
      "learning_rate": 4.995692515626048e-05,
      "loss": 2.1309,
      "num_input_tokens_seen": 1741114096,
      "step": 2213
    },
    {
      "epoch": 0.23488224061107574,
      "grad_norm": 1.211937135928613,
      "learning_rate": 4.995688436776347e-05,
      "loss": 2.1307,
      "num_input_tokens_seen": 1741900816,
      "step": 2214
    },
    {
      "epoch": 0.23498833015064716,
      "grad_norm": 1.328136541951933,
      "learning_rate": 4.99568435599805e-05,
      "loss": 2.3275,
      "num_input_tokens_seen": 1742687520,
      "step": 2215
    },
    {
      "epoch": 0.23509441969021855,
      "grad_norm": 1.041755608824837,
      "learning_rate": 4.995680273291161e-05,
      "loss": 2.151,
      "num_input_tokens_seen": 1743474384,
      "step": 2216
    },
    {
      "epoch": 0.23520050922978994,
      "grad_norm": 0.8180807340557775,
      "learning_rate": 4.995676188655685e-05,
      "loss": 2.1759,
      "num_input_tokens_seen": 1744261200,
      "step": 2217
    },
    {
      "epoch": 0.23530659876936133,
      "grad_norm": 0.8089200243936819,
      "learning_rate": 4.9956721020916225e-05,
      "loss": 2.1978,
      "num_input_tokens_seen": 1745047952,
      "step": 2218
    },
    {
      "epoch": 0.23541268830893275,
      "grad_norm": 0.7787669809712036,
      "learning_rate": 4.995668013598978e-05,
      "loss": 2.095,
      "num_input_tokens_seen": 1745834816,
      "step": 2219
    },
    {
      "epoch": 0.23551877784850414,
      "grad_norm": 0.7874402595449514,
      "learning_rate": 4.9956639231777544e-05,
      "loss": 2.235,
      "num_input_tokens_seen": 1746621536,
      "step": 2220
    },
    {
      "epoch": 0.23562486738807553,
      "grad_norm": 1.1012313905000501,
      "learning_rate": 4.9956598308279555e-05,
      "loss": 2.248,
      "num_input_tokens_seen": 1747408240,
      "step": 2221
    },
    {
      "epoch": 0.23573095692764692,
      "grad_norm": 1.2299600541668239,
      "learning_rate": 4.995655736549584e-05,
      "loss": 2.357,
      "num_input_tokens_seen": 1748194896,
      "step": 2222
    },
    {
      "epoch": 0.23583704646721834,
      "grad_norm": 0.7118073941727342,
      "learning_rate": 4.995651640342642e-05,
      "loss": 1.9624,
      "num_input_tokens_seen": 1748981712,
      "step": 2223
    },
    {
      "epoch": 0.23594313600678973,
      "grad_norm": 1.1076946182663838,
      "learning_rate": 4.995647542207135e-05,
      "loss": 2.0479,
      "num_input_tokens_seen": 1749768512,
      "step": 2224
    },
    {
      "epoch": 0.23604922554636112,
      "grad_norm": 0.6249878367456679,
      "learning_rate": 4.995643442143064e-05,
      "loss": 2.3105,
      "num_input_tokens_seen": 1750555312,
      "step": 2225
    },
    {
      "epoch": 0.23615531508593252,
      "grad_norm": 1.0151048672546843,
      "learning_rate": 4.9956393401504326e-05,
      "loss": 2.0383,
      "num_input_tokens_seen": 1751342032,
      "step": 2226
    },
    {
      "epoch": 0.23626140462550393,
      "grad_norm": 0.8590664120959048,
      "learning_rate": 4.995635236229245e-05,
      "loss": 2.0301,
      "num_input_tokens_seen": 1752128880,
      "step": 2227
    },
    {
      "epoch": 0.23636749416507533,
      "grad_norm": 0.9524275150623818,
      "learning_rate": 4.995631130379503e-05,
      "loss": 2.2242,
      "num_input_tokens_seen": 1752915600,
      "step": 2228
    },
    {
      "epoch": 0.23647358370464672,
      "grad_norm": 0.9897701858697513,
      "learning_rate": 4.995627022601211e-05,
      "loss": 2.4115,
      "num_input_tokens_seen": 1753702352,
      "step": 2229
    },
    {
      "epoch": 0.2365796732442181,
      "grad_norm": 1.2581068976695486,
      "learning_rate": 4.9956229128943724e-05,
      "loss": 2.2789,
      "num_input_tokens_seen": 1754489104,
      "step": 2230
    },
    {
      "epoch": 0.23668576278378953,
      "grad_norm": 0.9475117304156427,
      "learning_rate": 4.9956188012589886e-05,
      "loss": 2.4378,
      "num_input_tokens_seen": 1755275904,
      "step": 2231
    },
    {
      "epoch": 0.23679185232336092,
      "grad_norm": 0.7230847128307486,
      "learning_rate": 4.995614687695064e-05,
      "loss": 2.3159,
      "num_input_tokens_seen": 1756062688,
      "step": 2232
    },
    {
      "epoch": 0.2368979418629323,
      "grad_norm": 0.7811956660794547,
      "learning_rate": 4.995610572202602e-05,
      "loss": 2.1708,
      "num_input_tokens_seen": 1756849360,
      "step": 2233
    },
    {
      "epoch": 0.2370040314025037,
      "grad_norm": 0.768622562087111,
      "learning_rate": 4.995606454781605e-05,
      "loss": 2.1002,
      "num_input_tokens_seen": 1757636208,
      "step": 2234
    },
    {
      "epoch": 0.23711012094207512,
      "grad_norm": 0.7463492538791686,
      "learning_rate": 4.995602335432076e-05,
      "loss": 2.1536,
      "num_input_tokens_seen": 1758423024,
      "step": 2235
    },
    {
      "epoch": 0.2372162104816465,
      "grad_norm": 1.1812215283089935,
      "learning_rate": 4.995598214154019e-05,
      "loss": 2.3458,
      "num_input_tokens_seen": 1759209712,
      "step": 2236
    },
    {
      "epoch": 0.2373223000212179,
      "grad_norm": 0.868743107764831,
      "learning_rate": 4.9955940909474376e-05,
      "loss": 2.3075,
      "num_input_tokens_seen": 1759996464,
      "step": 2237
    },
    {
      "epoch": 0.2374283895607893,
      "grad_norm": 1.0172720211794537,
      "learning_rate": 4.995589965812334e-05,
      "loss": 2.3792,
      "num_input_tokens_seen": 1760783184,
      "step": 2238
    },
    {
      "epoch": 0.2375344791003607,
      "grad_norm": 0.9122225330878082,
      "learning_rate": 4.995585838748712e-05,
      "loss": 2.2898,
      "num_input_tokens_seen": 1761569968,
      "step": 2239
    },
    {
      "epoch": 0.2376405686399321,
      "grad_norm": 1.3805639158599674,
      "learning_rate": 4.995581709756574e-05,
      "loss": 2.2437,
      "num_input_tokens_seen": 1762356752,
      "step": 2240
    },
    {
      "epoch": 0.2377466581795035,
      "grad_norm": 0.687777796879489,
      "learning_rate": 4.995577578835924e-05,
      "loss": 2.1176,
      "num_input_tokens_seen": 1763143568,
      "step": 2241
    },
    {
      "epoch": 0.2378527477190749,
      "grad_norm": 0.8961342214233703,
      "learning_rate": 4.9955734459867645e-05,
      "loss": 2.4071,
      "num_input_tokens_seen": 1763930304,
      "step": 2242
    },
    {
      "epoch": 0.2379588372586463,
      "grad_norm": 1.0574310709145736,
      "learning_rate": 4.9955693112090995e-05,
      "loss": 2.1342,
      "num_input_tokens_seen": 1764717104,
      "step": 2243
    },
    {
      "epoch": 0.2380649267982177,
      "grad_norm": 1.030823828922238,
      "learning_rate": 4.9955651745029316e-05,
      "loss": 2.2045,
      "num_input_tokens_seen": 1765503840,
      "step": 2244
    },
    {
      "epoch": 0.2381710163377891,
      "grad_norm": 0.8013228282780214,
      "learning_rate": 4.9955610358682634e-05,
      "loss": 2.1478,
      "num_input_tokens_seen": 1766290640,
      "step": 2245
    },
    {
      "epoch": 0.23827710587736048,
      "grad_norm": 0.5191254305291432,
      "learning_rate": 4.9955568953051005e-05,
      "loss": 2.0797,
      "num_input_tokens_seen": 1767077456,
      "step": 2246
    },
    {
      "epoch": 0.2383831954169319,
      "grad_norm": 0.7263766374954981,
      "learning_rate": 4.995552752813443e-05,
      "loss": 2.1291,
      "num_input_tokens_seen": 1767864256,
      "step": 2247
    },
    {
      "epoch": 0.2384892849565033,
      "grad_norm": 0.8434780359261608,
      "learning_rate": 4.995548608393296e-05,
      "loss": 1.9932,
      "num_input_tokens_seen": 1768651008,
      "step": 2248
    },
    {
      "epoch": 0.23859537449607468,
      "grad_norm": 0.8162416109673432,
      "learning_rate": 4.9955444620446626e-05,
      "loss": 2.1662,
      "num_input_tokens_seen": 1769437856,
      "step": 2249
    },
    {
      "epoch": 0.23870146403564607,
      "grad_norm": 2.1009796677998227,
      "learning_rate": 4.995540313767545e-05,
      "loss": 2.1407,
      "num_input_tokens_seen": 1770224592,
      "step": 2250
    },
    {
      "epoch": 0.2388075535752175,
      "grad_norm": 1.3880526078686575,
      "learning_rate": 4.995536163561948e-05,
      "loss": 2.2441,
      "num_input_tokens_seen": 1771011376,
      "step": 2251
    },
    {
      "epoch": 0.23891364311478888,
      "grad_norm": 3.028390306708729,
      "learning_rate": 4.9955320114278725e-05,
      "loss": 2.2701,
      "num_input_tokens_seen": 1771798160,
      "step": 2252
    },
    {
      "epoch": 0.23901973265436027,
      "grad_norm": 2.330366987948638,
      "learning_rate": 4.995527857365324e-05,
      "loss": 2.2523,
      "num_input_tokens_seen": 1772584960,
      "step": 2253
    },
    {
      "epoch": 0.2391258221939317,
      "grad_norm": 1.3709893447238863,
      "learning_rate": 4.995523701374305e-05,
      "loss": 2.1569,
      "num_input_tokens_seen": 1773371680,
      "step": 2254
    },
    {
      "epoch": 0.23923191173350308,
      "grad_norm": 1.0952514293564333,
      "learning_rate": 4.995519543454819e-05,
      "loss": 2.0845,
      "num_input_tokens_seen": 1774158384,
      "step": 2255
    },
    {
      "epoch": 0.23933800127307447,
      "grad_norm": 1.6643127174175893,
      "learning_rate": 4.995515383606867e-05,
      "loss": 2.2831,
      "num_input_tokens_seen": 1774945200,
      "step": 2256
    },
    {
      "epoch": 0.23944409081264587,
      "grad_norm": 1.0791476346958273,
      "learning_rate": 4.995511221830455e-05,
      "loss": 2.1466,
      "num_input_tokens_seen": 1775732000,
      "step": 2257
    },
    {
      "epoch": 0.23955018035221728,
      "grad_norm": 1.4040843042561435,
      "learning_rate": 4.995507058125585e-05,
      "loss": 2.1304,
      "num_input_tokens_seen": 1776518800,
      "step": 2258
    },
    {
      "epoch": 0.23965626989178868,
      "grad_norm": 1.4221151268606675,
      "learning_rate": 4.995502892492261e-05,
      "loss": 2.1367,
      "num_input_tokens_seen": 1777305584,
      "step": 2259
    },
    {
      "epoch": 0.23976235943136007,
      "grad_norm": 1.1561607996052294,
      "learning_rate": 4.9954987249304846e-05,
      "loss": 2.2382,
      "num_input_tokens_seen": 1778092368,
      "step": 2260
    },
    {
      "epoch": 0.23986844897093146,
      "grad_norm": 1.4036710945890785,
      "learning_rate": 4.99549455544026e-05,
      "loss": 2.2911,
      "num_input_tokens_seen": 1778879072,
      "step": 2261
    },
    {
      "epoch": 0.23997453851050288,
      "grad_norm": 1.3087653950689753,
      "learning_rate": 4.995490384021591e-05,
      "loss": 2.4046,
      "num_input_tokens_seen": 1779665824,
      "step": 2262
    },
    {
      "epoch": 0.24008062805007427,
      "grad_norm": 1.1231946541396403,
      "learning_rate": 4.995486210674481e-05,
      "loss": 2.2737,
      "num_input_tokens_seen": 1780452496,
      "step": 2263
    },
    {
      "epoch": 0.24018671758964566,
      "grad_norm": 1.1203816573021985,
      "learning_rate": 4.9954820353989305e-05,
      "loss": 2.258,
      "num_input_tokens_seen": 1781239312,
      "step": 2264
    },
    {
      "epoch": 0.24029280712921705,
      "grad_norm": 0.7988322907671817,
      "learning_rate": 4.995477858194946e-05,
      "loss": 2.0691,
      "num_input_tokens_seen": 1782026080,
      "step": 2265
    },
    {
      "epoch": 0.24039889666878847,
      "grad_norm": 0.8001851159980207,
      "learning_rate": 4.995473679062529e-05,
      "loss": 2.2638,
      "num_input_tokens_seen": 1782812928,
      "step": 2266
    },
    {
      "epoch": 0.24050498620835986,
      "grad_norm": 1.0841526241709865,
      "learning_rate": 4.995469498001684e-05,
      "loss": 2.0429,
      "num_input_tokens_seen": 1783599680,
      "step": 2267
    },
    {
      "epoch": 0.24061107574793125,
      "grad_norm": 0.7931289662016309,
      "learning_rate": 4.995465315012412e-05,
      "loss": 2.3015,
      "num_input_tokens_seen": 1784386384,
      "step": 2268
    },
    {
      "epoch": 0.24071716528750264,
      "grad_norm": 1.704920424236296,
      "learning_rate": 4.995461130094718e-05,
      "loss": 2.302,
      "num_input_tokens_seen": 1785173152,
      "step": 2269
    },
    {
      "epoch": 0.24082325482707406,
      "grad_norm": 0.9588646961828592,
      "learning_rate": 4.995456943248606e-05,
      "loss": 2.23,
      "num_input_tokens_seen": 1785959872,
      "step": 2270
    },
    {
      "epoch": 0.24092934436664545,
      "grad_norm": 1.5545616067881443,
      "learning_rate": 4.995452754474077e-05,
      "loss": 2.116,
      "num_input_tokens_seen": 1786746704,
      "step": 2271
    },
    {
      "epoch": 0.24103543390621684,
      "grad_norm": 1.1546984825816966,
      "learning_rate": 4.9954485637711356e-05,
      "loss": 2.1476,
      "num_input_tokens_seen": 1787533472,
      "step": 2272
    },
    {
      "epoch": 0.24114152344578824,
      "grad_norm": 1.2165029739997892,
      "learning_rate": 4.9954443711397854e-05,
      "loss": 2.0898,
      "num_input_tokens_seen": 1788320272,
      "step": 2273
    },
    {
      "epoch": 0.24124761298535966,
      "grad_norm": 1.1175124223925628,
      "learning_rate": 4.9954401765800285e-05,
      "loss": 2.0638,
      "num_input_tokens_seen": 1789107152,
      "step": 2274
    },
    {
      "epoch": 0.24135370252493105,
      "grad_norm": 1.9642161581749482,
      "learning_rate": 4.995435980091868e-05,
      "loss": 2.2332,
      "num_input_tokens_seen": 1789894000,
      "step": 2275
    },
    {
      "epoch": 0.24145979206450244,
      "grad_norm": 0.8971491026827609,
      "learning_rate": 4.995431781675308e-05,
      "loss": 2.1803,
      "num_input_tokens_seen": 1790680736,
      "step": 2276
    },
    {
      "epoch": 0.24156588160407383,
      "grad_norm": 1.9051722724159001,
      "learning_rate": 4.995427581330353e-05,
      "loss": 2.0165,
      "num_input_tokens_seen": 1791467536,
      "step": 2277
    },
    {
      "epoch": 0.24167197114364525,
      "grad_norm": 2.442593799352741,
      "learning_rate": 4.995423379057003e-05,
      "loss": 2.3479,
      "num_input_tokens_seen": 1792254336,
      "step": 2278
    },
    {
      "epoch": 0.24177806068321664,
      "grad_norm": 0.8710987199892717,
      "learning_rate": 4.9954191748552633e-05,
      "loss": 2.0949,
      "num_input_tokens_seen": 1793041120,
      "step": 2279
    },
    {
      "epoch": 0.24188415022278803,
      "grad_norm": 4.458458769356507,
      "learning_rate": 4.995414968725139e-05,
      "loss": 2.2099,
      "num_input_tokens_seen": 1793827808,
      "step": 2280
    },
    {
      "epoch": 0.24199023976235942,
      "grad_norm": 1.926263390714899,
      "learning_rate": 4.995410760666629e-05,
      "loss": 2.4122,
      "num_input_tokens_seen": 1794614608,
      "step": 2281
    },
    {
      "epoch": 0.24209632930193084,
      "grad_norm": 1.7652555204614393,
      "learning_rate": 4.9954065506797384e-05,
      "loss": 2.012,
      "num_input_tokens_seen": 1795401456,
      "step": 2282
    },
    {
      "epoch": 0.24220241884150223,
      "grad_norm": 1.1641565350055985,
      "learning_rate": 4.995402338764472e-05,
      "loss": 2.2263,
      "num_input_tokens_seen": 1796188208,
      "step": 2283
    },
    {
      "epoch": 0.24230850838107362,
      "grad_norm": 1.605816487979223,
      "learning_rate": 4.995398124920832e-05,
      "loss": 2.199,
      "num_input_tokens_seen": 1796974896,
      "step": 2284
    },
    {
      "epoch": 0.24241459792064501,
      "grad_norm": 0.681366251657172,
      "learning_rate": 4.995393909148821e-05,
      "loss": 2.1592,
      "num_input_tokens_seen": 1797761648,
      "step": 2285
    },
    {
      "epoch": 0.24252068746021643,
      "grad_norm": 1.6163871647913652,
      "learning_rate": 4.9953896914484436e-05,
      "loss": 2.3771,
      "num_input_tokens_seen": 1798548368,
      "step": 2286
    },
    {
      "epoch": 0.24262677699978782,
      "grad_norm": 0.6240433470530702,
      "learning_rate": 4.995385471819701e-05,
      "loss": 2.3254,
      "num_input_tokens_seen": 1799335168,
      "step": 2287
    },
    {
      "epoch": 0.24273286653935922,
      "grad_norm": 1.230437268951542,
      "learning_rate": 4.9953812502625985e-05,
      "loss": 2.1879,
      "num_input_tokens_seen": 1800121888,
      "step": 2288
    },
    {
      "epoch": 0.2428389560789306,
      "grad_norm": 0.7902927878754492,
      "learning_rate": 4.995377026777139e-05,
      "loss": 2.139,
      "num_input_tokens_seen": 1800908608,
      "step": 2289
    },
    {
      "epoch": 0.24294504561850203,
      "grad_norm": 0.6879073344616845,
      "learning_rate": 4.995372801363325e-05,
      "loss": 2.0661,
      "num_input_tokens_seen": 1801695392,
      "step": 2290
    },
    {
      "epoch": 0.24305113515807342,
      "grad_norm": 0.6676974199698228,
      "learning_rate": 4.99536857402116e-05,
      "loss": 2.1081,
      "num_input_tokens_seen": 1802482128,
      "step": 2291
    },
    {
      "epoch": 0.2431572246976448,
      "grad_norm": 0.6881942840764875,
      "learning_rate": 4.995364344750647e-05,
      "loss": 1.9373,
      "num_input_tokens_seen": 1803268944,
      "step": 2292
    },
    {
      "epoch": 0.2432633142372162,
      "grad_norm": 0.9282660661639744,
      "learning_rate": 4.9953601135517904e-05,
      "loss": 2.142,
      "num_input_tokens_seen": 1804055744,
      "step": 2293
    },
    {
      "epoch": 0.24336940377678762,
      "grad_norm": 0.7013033630729162,
      "learning_rate": 4.995355880424592e-05,
      "loss": 2.1871,
      "num_input_tokens_seen": 1804842464,
      "step": 2294
    },
    {
      "epoch": 0.243475493316359,
      "grad_norm": 0.6835892937183025,
      "learning_rate": 4.9953516453690565e-05,
      "loss": 2.127,
      "num_input_tokens_seen": 1805629200,
      "step": 2295
    },
    {
      "epoch": 0.2435815828559304,
      "grad_norm": 0.6065790559097828,
      "learning_rate": 4.995347408385186e-05,
      "loss": 2.1157,
      "num_input_tokens_seen": 1806416000,
      "step": 2296
    },
    {
      "epoch": 0.2436876723955018,
      "grad_norm": 0.9340022159913213,
      "learning_rate": 4.9953431694729844e-05,
      "loss": 2.3498,
      "num_input_tokens_seen": 1807202688,
      "step": 2297
    },
    {
      "epoch": 0.2437937619350732,
      "grad_norm": 0.601233903745856,
      "learning_rate": 4.9953389286324545e-05,
      "loss": 2.1286,
      "num_input_tokens_seen": 1807989360,
      "step": 2298
    },
    {
      "epoch": 0.2438998514746446,
      "grad_norm": 1.0574804925796475,
      "learning_rate": 4.9953346858636e-05,
      "loss": 2.3577,
      "num_input_tokens_seen": 1808776112,
      "step": 2299
    },
    {
      "epoch": 0.244005941014216,
      "grad_norm": 0.9134999457363792,
      "learning_rate": 4.9953304411664246e-05,
      "loss": 2.187,
      "num_input_tokens_seen": 1809562912,
      "step": 2300
    },
    {
      "epoch": 0.24411203055378738,
      "grad_norm": 0.6962346481645997,
      "learning_rate": 4.99532619454093e-05,
      "loss": 2.1911,
      "num_input_tokens_seen": 1810349760,
      "step": 2301
    },
    {
      "epoch": 0.2442181200933588,
      "grad_norm": 0.7927542546001326,
      "learning_rate": 4.9953219459871216e-05,
      "loss": 2.141,
      "num_input_tokens_seen": 1811136528,
      "step": 2302
    },
    {
      "epoch": 0.2443242096329302,
      "grad_norm": 0.7096936930852403,
      "learning_rate": 4.9953176955050006e-05,
      "loss": 2.3733,
      "num_input_tokens_seen": 1811923312,
      "step": 2303
    },
    {
      "epoch": 0.24443029917250159,
      "grad_norm": 0.8011899259008431,
      "learning_rate": 4.9953134430945726e-05,
      "loss": 2.2434,
      "num_input_tokens_seen": 1812710096,
      "step": 2304
    },
    {
      "epoch": 0.24453638871207298,
      "grad_norm": 0.745683741910697,
      "learning_rate": 4.995309188755839e-05,
      "loss": 2.2229,
      "num_input_tokens_seen": 1813496832,
      "step": 2305
    },
    {
      "epoch": 0.2446424782516444,
      "grad_norm": 0.7063312601547199,
      "learning_rate": 4.9953049324888033e-05,
      "loss": 2.3388,
      "num_input_tokens_seen": 1814283536,
      "step": 2306
    },
    {
      "epoch": 0.2447485677912158,
      "grad_norm": 0.7439297122232524,
      "learning_rate": 4.9953006742934696e-05,
      "loss": 2.2501,
      "num_input_tokens_seen": 1815070304,
      "step": 2307
    },
    {
      "epoch": 0.24485465733078718,
      "grad_norm": 0.6521717890429549,
      "learning_rate": 4.99529641416984e-05,
      "loss": 2.2119,
      "num_input_tokens_seen": 1815857088,
      "step": 2308
    },
    {
      "epoch": 0.24496074687035857,
      "grad_norm": 0.7430124321776158,
      "learning_rate": 4.9952921521179194e-05,
      "loss": 2.1045,
      "num_input_tokens_seen": 1816643840,
      "step": 2309
    },
    {
      "epoch": 0.24506683640993,
      "grad_norm": 0.7428215890746996,
      "learning_rate": 4.9952878881377105e-05,
      "loss": 1.9473,
      "num_input_tokens_seen": 1817430576,
      "step": 2310
    },
    {
      "epoch": 0.24517292594950138,
      "grad_norm": 0.8405909622014996,
      "learning_rate": 4.9952836222292154e-05,
      "loss": 2.1887,
      "num_input_tokens_seen": 1818217280,
      "step": 2311
    },
    {
      "epoch": 0.24527901548907277,
      "grad_norm": 0.6888459932869979,
      "learning_rate": 4.995279354392439e-05,
      "loss": 2.2461,
      "num_input_tokens_seen": 1819004112,
      "step": 2312
    },
    {
      "epoch": 0.24538510502864416,
      "grad_norm": 0.7755952456123322,
      "learning_rate": 4.995275084627383e-05,
      "loss": 2.3215,
      "num_input_tokens_seen": 1819790848,
      "step": 2313
    },
    {
      "epoch": 0.24549119456821558,
      "grad_norm": 0.8822395686037195,
      "learning_rate": 4.995270812934053e-05,
      "loss": 2.28,
      "num_input_tokens_seen": 1820577552,
      "step": 2314
    },
    {
      "epoch": 0.24559728410778697,
      "grad_norm": 1.0770959990858309,
      "learning_rate": 4.99526653931245e-05,
      "loss": 2.1664,
      "num_input_tokens_seen": 1821364240,
      "step": 2315
    },
    {
      "epoch": 0.24570337364735836,
      "grad_norm": 0.5294836997616185,
      "learning_rate": 4.995262263762579e-05,
      "loss": 2.1439,
      "num_input_tokens_seen": 1822150976,
      "step": 2316
    },
    {
      "epoch": 0.24580946318692976,
      "grad_norm": 1.3106024257545072,
      "learning_rate": 4.995257986284442e-05,
      "loss": 2.2833,
      "num_input_tokens_seen": 1822937728,
      "step": 2317
    },
    {
      "epoch": 0.24591555272650117,
      "grad_norm": 0.7680203609677025,
      "learning_rate": 4.9952537068780425e-05,
      "loss": 2.0917,
      "num_input_tokens_seen": 1823724560,
      "step": 2318
    },
    {
      "epoch": 0.24602164226607257,
      "grad_norm": 1.0798906790405276,
      "learning_rate": 4.995249425543385e-05,
      "loss": 2.22,
      "num_input_tokens_seen": 1824511424,
      "step": 2319
    },
    {
      "epoch": 0.24612773180564396,
      "grad_norm": 1.3383424560590746,
      "learning_rate": 4.9952451422804714e-05,
      "loss": 2.2317,
      "num_input_tokens_seen": 1825298176,
      "step": 2320
    },
    {
      "epoch": 0.24623382134521535,
      "grad_norm": 0.9003599362878181,
      "learning_rate": 4.995240857089305e-05,
      "loss": 2.1233,
      "num_input_tokens_seen": 1826084976,
      "step": 2321
    },
    {
      "epoch": 0.24633991088478677,
      "grad_norm": 1.0244217497975172,
      "learning_rate": 4.995236569969891e-05,
      "loss": 2.3574,
      "num_input_tokens_seen": 1826871712,
      "step": 2322
    },
    {
      "epoch": 0.24644600042435816,
      "grad_norm": 2.217927200212672,
      "learning_rate": 4.9952322809222304e-05,
      "loss": 2.1222,
      "num_input_tokens_seen": 1827658448,
      "step": 2323
    },
    {
      "epoch": 0.24655208996392955,
      "grad_norm": 1.1179441973980864,
      "learning_rate": 4.995227989946328e-05,
      "loss": 2.2015,
      "num_input_tokens_seen": 1828445200,
      "step": 2324
    },
    {
      "epoch": 0.24665817950350097,
      "grad_norm": 1.3416889114626955,
      "learning_rate": 4.995223697042186e-05,
      "loss": 2.0159,
      "num_input_tokens_seen": 1829232016,
      "step": 2325
    },
    {
      "epoch": 0.24676426904307236,
      "grad_norm": 1.2437276304931126,
      "learning_rate": 4.995219402209809e-05,
      "loss": 2.2702,
      "num_input_tokens_seen": 1830018784,
      "step": 2326
    },
    {
      "epoch": 0.24687035858264375,
      "grad_norm": 1.3088348899907232,
      "learning_rate": 4.9952151054492e-05,
      "loss": 2.1102,
      "num_input_tokens_seen": 1830805680,
      "step": 2327
    },
    {
      "epoch": 0.24697644812221514,
      "grad_norm": 1.6224772824748042,
      "learning_rate": 4.995210806760361e-05,
      "loss": 2.2004,
      "num_input_tokens_seen": 1831592448,
      "step": 2328
    },
    {
      "epoch": 0.24708253766178656,
      "grad_norm": 1.1644459536839566,
      "learning_rate": 4.9952065061432965e-05,
      "loss": 2.1059,
      "num_input_tokens_seen": 1832379216,
      "step": 2329
    },
    {
      "epoch": 0.24718862720135795,
      "grad_norm": 1.0975112617276728,
      "learning_rate": 4.99520220359801e-05,
      "loss": 2.1698,
      "num_input_tokens_seen": 1833166064,
      "step": 2330
    },
    {
      "epoch": 0.24729471674092934,
      "grad_norm": 0.8512426195790816,
      "learning_rate": 4.995197899124504e-05,
      "loss": 2.1207,
      "num_input_tokens_seen": 1833952832,
      "step": 2331
    },
    {
      "epoch": 0.24740080628050073,
      "grad_norm": 1.962577704075872,
      "learning_rate": 4.995193592722783e-05,
      "loss": 2.1269,
      "num_input_tokens_seen": 1834739648,
      "step": 2332
    },
    {
      "epoch": 0.24750689582007215,
      "grad_norm": 1.3721961149136837,
      "learning_rate": 4.9951892843928494e-05,
      "loss": 2.2297,
      "num_input_tokens_seen": 1835526416,
      "step": 2333
    },
    {
      "epoch": 0.24761298535964354,
      "grad_norm": 3.0969490195187777,
      "learning_rate": 4.995184974134707e-05,
      "loss": 2.2362,
      "num_input_tokens_seen": 1836313152,
      "step": 2334
    },
    {
      "epoch": 0.24771907489921494,
      "grad_norm": 3.0280636913908636,
      "learning_rate": 4.995180661948358e-05,
      "loss": 2.2788,
      "num_input_tokens_seen": 1837099872,
      "step": 2335
    },
    {
      "epoch": 0.24782516443878633,
      "grad_norm": 1.7594558676396508,
      "learning_rate": 4.995176347833806e-05,
      "loss": 2.2617,
      "num_input_tokens_seen": 1837886624,
      "step": 2336
    },
    {
      "epoch": 0.24793125397835775,
      "grad_norm": 1.6748580181423975,
      "learning_rate": 4.995172031791057e-05,
      "loss": 2.0973,
      "num_input_tokens_seen": 1838673456,
      "step": 2337
    },
    {
      "epoch": 0.24803734351792914,
      "grad_norm": 1.1048895762380546,
      "learning_rate": 4.995167713820111e-05,
      "loss": 2.0116,
      "num_input_tokens_seen": 1839460256,
      "step": 2338
    },
    {
      "epoch": 0.24814343305750053,
      "grad_norm": 1.3822814980889986,
      "learning_rate": 4.995163393920973e-05,
      "loss": 2.14,
      "num_input_tokens_seen": 1840247072,
      "step": 2339
    },
    {
      "epoch": 0.24824952259707192,
      "grad_norm": 1.1329007976623566,
      "learning_rate": 4.995159072093646e-05,
      "loss": 2.1241,
      "num_input_tokens_seen": 1841033776,
      "step": 2340
    },
    {
      "epoch": 0.24835561213664334,
      "grad_norm": 0.9439207265222874,
      "learning_rate": 4.995154748338132e-05,
      "loss": 2.2214,
      "num_input_tokens_seen": 1841820528,
      "step": 2341
    },
    {
      "epoch": 0.24846170167621473,
      "grad_norm": 1.0138334695865145,
      "learning_rate": 4.995150422654437e-05,
      "loss": 2.3428,
      "num_input_tokens_seen": 1842607328,
      "step": 2342
    },
    {
      "epoch": 0.24856779121578612,
      "grad_norm": 1.1935020398303007,
      "learning_rate": 4.9951460950425626e-05,
      "loss": 2.18,
      "num_input_tokens_seen": 1843394144,
      "step": 2343
    },
    {
      "epoch": 0.2486738807553575,
      "grad_norm": 1.2418243502317434,
      "learning_rate": 4.9951417655025124e-05,
      "loss": 2.1495,
      "num_input_tokens_seen": 1844181024,
      "step": 2344
    },
    {
      "epoch": 0.24877997029492893,
      "grad_norm": 0.9911787565695642,
      "learning_rate": 4.9951374340342907e-05,
      "loss": 2.1735,
      "num_input_tokens_seen": 1844967792,
      "step": 2345
    },
    {
      "epoch": 0.24888605983450032,
      "grad_norm": 1.2551850303529513,
      "learning_rate": 4.995133100637899e-05,
      "loss": 2.3664,
      "num_input_tokens_seen": 1845754544,
      "step": 2346
    },
    {
      "epoch": 0.24899214937407171,
      "grad_norm": 0.9084201270515504,
      "learning_rate": 4.995128765313342e-05,
      "loss": 2.1504,
      "num_input_tokens_seen": 1846541312,
      "step": 2347
    },
    {
      "epoch": 0.2490982389136431,
      "grad_norm": 1.1585591463908997,
      "learning_rate": 4.9951244280606224e-05,
      "loss": 2.2475,
      "num_input_tokens_seen": 1847328016,
      "step": 2348
    },
    {
      "epoch": 0.24920432845321452,
      "grad_norm": 0.8994170872370577,
      "learning_rate": 4.995120088879744e-05,
      "loss": 2.2664,
      "num_input_tokens_seen": 1848114800,
      "step": 2349
    },
    {
      "epoch": 0.24931041799278592,
      "grad_norm": 0.7395134272629025,
      "learning_rate": 4.99511574777071e-05,
      "loss": 2.1402,
      "num_input_tokens_seen": 1848901616,
      "step": 2350
    },
    {
      "epoch": 0.2494165075323573,
      "grad_norm": 0.9445869440238843,
      "learning_rate": 4.995111404733524e-05,
      "loss": 2.0448,
      "num_input_tokens_seen": 1849688432,
      "step": 2351
    },
    {
      "epoch": 0.2495225970719287,
      "grad_norm": 0.5236945754321527,
      "learning_rate": 4.995107059768189e-05,
      "loss": 2.1895,
      "num_input_tokens_seen": 1850475232,
      "step": 2352
    },
    {
      "epoch": 0.24962868661150012,
      "grad_norm": 1.0033405361660006,
      "learning_rate": 4.995102712874709e-05,
      "loss": 2.0744,
      "num_input_tokens_seen": 1851262064,
      "step": 2353
    },
    {
      "epoch": 0.2497347761510715,
      "grad_norm": 0.7092164223297991,
      "learning_rate": 4.995098364053086e-05,
      "loss": 2.0664,
      "num_input_tokens_seen": 1852048896,
      "step": 2354
    },
    {
      "epoch": 0.2498408656906429,
      "grad_norm": 0.7893970312924634,
      "learning_rate": 4.995094013303324e-05,
      "loss": 2.2908,
      "num_input_tokens_seen": 1852835696,
      "step": 2355
    },
    {
      "epoch": 0.2499469552302143,
      "grad_norm": 0.9247002922924329,
      "learning_rate": 4.995089660625427e-05,
      "loss": 2.2593,
      "num_input_tokens_seen": 1853622464,
      "step": 2356
    },
    {
      "epoch": 0.2500530447697857,
      "grad_norm": 0.6501531699001707,
      "learning_rate": 4.995085306019398e-05,
      "loss": 2.2762,
      "num_input_tokens_seen": 1854409184,
      "step": 2357
    },
    {
      "epoch": 0.2501591343093571,
      "grad_norm": 1.5798532940459644,
      "learning_rate": 4.9950809494852403e-05,
      "loss": 2.2293,
      "num_input_tokens_seen": 1855195888,
      "step": 2358
    },
    {
      "epoch": 0.2502652238489285,
      "grad_norm": 0.6552017011408204,
      "learning_rate": 4.995076591022957e-05,
      "loss": 2.1412,
      "num_input_tokens_seen": 1855982624,
      "step": 2359
    },
    {
      "epoch": 0.2503713133884999,
      "grad_norm": 1.0934069099429071,
      "learning_rate": 4.9950722306325524e-05,
      "loss": 2.103,
      "num_input_tokens_seen": 1856769440,
      "step": 2360
    },
    {
      "epoch": 0.2504774029280713,
      "grad_norm": 1.126821607277607,
      "learning_rate": 4.995067868314029e-05,
      "loss": 2.1906,
      "num_input_tokens_seen": 1857556224,
      "step": 2361
    },
    {
      "epoch": 0.25058349246764267,
      "grad_norm": 0.8716582181275225,
      "learning_rate": 4.99506350406739e-05,
      "loss": 2.0885,
      "num_input_tokens_seen": 1858343104,
      "step": 2362
    },
    {
      "epoch": 0.2506895820072141,
      "grad_norm": 0.9474378586010064,
      "learning_rate": 4.995059137892639e-05,
      "loss": 2.1446,
      "num_input_tokens_seen": 1859129888,
      "step": 2363
    },
    {
      "epoch": 0.2507956715467855,
      "grad_norm": 0.7933283110516225,
      "learning_rate": 4.99505476978978e-05,
      "loss": 2.1592,
      "num_input_tokens_seen": 1859916608,
      "step": 2364
    },
    {
      "epoch": 0.25090176108635687,
      "grad_norm": 1.1108998486397805,
      "learning_rate": 4.995050399758815e-05,
      "loss": 2.091,
      "num_input_tokens_seen": 1860703280,
      "step": 2365
    },
    {
      "epoch": 0.2510078506259283,
      "grad_norm": 0.5699161299197774,
      "learning_rate": 4.9950460277997493e-05,
      "loss": 2.0468,
      "num_input_tokens_seen": 1861490192,
      "step": 2366
    },
    {
      "epoch": 0.2511139401654997,
      "grad_norm": 0.8351979619785873,
      "learning_rate": 4.9950416539125845e-05,
      "loss": 2.0717,
      "num_input_tokens_seen": 1862277040,
      "step": 2367
    },
    {
      "epoch": 0.25122002970507107,
      "grad_norm": 0.7951627831944496,
      "learning_rate": 4.9950372780973246e-05,
      "loss": 2.057,
      "num_input_tokens_seen": 1863063808,
      "step": 2368
    },
    {
      "epoch": 0.2513261192446425,
      "grad_norm": 1.015893266911499,
      "learning_rate": 4.995032900353974e-05,
      "loss": 2.294,
      "num_input_tokens_seen": 1863850528,
      "step": 2369
    },
    {
      "epoch": 0.25143220878421385,
      "grad_norm": 0.7116939434406495,
      "learning_rate": 4.995028520682534e-05,
      "loss": 1.9893,
      "num_input_tokens_seen": 1864637408,
      "step": 2370
    },
    {
      "epoch": 0.25153829832378527,
      "grad_norm": 0.7064491260331014,
      "learning_rate": 4.9950241390830096e-05,
      "loss": 2.2773,
      "num_input_tokens_seen": 1865424128,
      "step": 2371
    },
    {
      "epoch": 0.2516443878633567,
      "grad_norm": 0.7005538641591366,
      "learning_rate": 4.995019755555404e-05,
      "loss": 2.1039,
      "num_input_tokens_seen": 1866210896,
      "step": 2372
    },
    {
      "epoch": 0.25175047740292805,
      "grad_norm": 0.5570839422724534,
      "learning_rate": 4.995015370099721e-05,
      "loss": 2.0884,
      "num_input_tokens_seen": 1866997776,
      "step": 2373
    },
    {
      "epoch": 0.25185656694249947,
      "grad_norm": 1.6946582281554023,
      "learning_rate": 4.995010982715963e-05,
      "loss": 2.1579,
      "num_input_tokens_seen": 1867784560,
      "step": 2374
    },
    {
      "epoch": 0.2519626564820709,
      "grad_norm": 0.6843136994949216,
      "learning_rate": 4.9950065934041336e-05,
      "loss": 2.2805,
      "num_input_tokens_seen": 1868571360,
      "step": 2375
    },
    {
      "epoch": 0.25206874602164225,
      "grad_norm": 1.3096132036022845,
      "learning_rate": 4.995002202164236e-05,
      "loss": 2.2468,
      "num_input_tokens_seen": 1869358176,
      "step": 2376
    },
    {
      "epoch": 0.2521748355612137,
      "grad_norm": 0.7364002723087064,
      "learning_rate": 4.994997808996273e-05,
      "loss": 2.2369,
      "num_input_tokens_seen": 1870144880,
      "step": 2377
    },
    {
      "epoch": 0.25228092510078504,
      "grad_norm": 0.9561822584323391,
      "learning_rate": 4.9949934139002505e-05,
      "loss": 2.0654,
      "num_input_tokens_seen": 1870931568,
      "step": 2378
    },
    {
      "epoch": 0.25238701464035646,
      "grad_norm": 0.7992612938348284,
      "learning_rate": 4.99498901687617e-05,
      "loss": 2.0512,
      "num_input_tokens_seen": 1871718336,
      "step": 2379
    },
    {
      "epoch": 0.2524931041799279,
      "grad_norm": 0.8143150327792079,
      "learning_rate": 4.9949846179240344e-05,
      "loss": 2.2368,
      "num_input_tokens_seen": 1872505136,
      "step": 2380
    },
    {
      "epoch": 0.25259919371949924,
      "grad_norm": 0.9640600265197703,
      "learning_rate": 4.9949802170438485e-05,
      "loss": 2.1892,
      "num_input_tokens_seen": 1873291968,
      "step": 2381
    },
    {
      "epoch": 0.25270528325907066,
      "grad_norm": 1.0136812770609873,
      "learning_rate": 4.994975814235615e-05,
      "loss": 2.0899,
      "num_input_tokens_seen": 1874078688,
      "step": 2382
    },
    {
      "epoch": 0.2528113727986421,
      "grad_norm": 0.8758184565140433,
      "learning_rate": 4.9949714094993375e-05,
      "loss": 2.2011,
      "num_input_tokens_seen": 1874865520,
      "step": 2383
    },
    {
      "epoch": 0.25291746233821344,
      "grad_norm": 1.8836198317489987,
      "learning_rate": 4.994967002835019e-05,
      "loss": 2.1841,
      "num_input_tokens_seen": 1875652272,
      "step": 2384
    },
    {
      "epoch": 0.25302355187778486,
      "grad_norm": 0.9846999887147462,
      "learning_rate": 4.994962594242663e-05,
      "loss": 2.3384,
      "num_input_tokens_seen": 1876439040,
      "step": 2385
    },
    {
      "epoch": 0.2531296414173562,
      "grad_norm": 2.4492971369284704,
      "learning_rate": 4.994958183722274e-05,
      "loss": 2.1863,
      "num_input_tokens_seen": 1877225760,
      "step": 2386
    },
    {
      "epoch": 0.25323573095692764,
      "grad_norm": 2.4868458118930485,
      "learning_rate": 4.9949537712738545e-05,
      "loss": 2.2053,
      "num_input_tokens_seen": 1878012448,
      "step": 2387
    },
    {
      "epoch": 0.25334182049649906,
      "grad_norm": 1.5989482171320986,
      "learning_rate": 4.994949356897407e-05,
      "loss": 2.4185,
      "num_input_tokens_seen": 1878799216,
      "step": 2388
    },
    {
      "epoch": 0.2534479100360704,
      "grad_norm": 1.551620333900808,
      "learning_rate": 4.9949449405929366e-05,
      "loss": 2.1302,
      "num_input_tokens_seen": 1879586016,
      "step": 2389
    },
    {
      "epoch": 0.25355399957564184,
      "grad_norm": 1.378149976639963,
      "learning_rate": 4.9949405223604454e-05,
      "loss": 2.1943,
      "num_input_tokens_seen": 1880372784,
      "step": 2390
    },
    {
      "epoch": 0.25366008911521326,
      "grad_norm": 1.1016086687704123,
      "learning_rate": 4.9949361021999383e-05,
      "loss": 2.116,
      "num_input_tokens_seen": 1881159584,
      "step": 2391
    },
    {
      "epoch": 0.2537661786547846,
      "grad_norm": 1.008744317544602,
      "learning_rate": 4.994931680111416e-05,
      "loss": 2.0129,
      "num_input_tokens_seen": 1881946336,
      "step": 2392
    },
    {
      "epoch": 0.25387226819435604,
      "grad_norm": 1.0548065034047938,
      "learning_rate": 4.994927256094886e-05,
      "loss": 2.1182,
      "num_input_tokens_seen": 1882733168,
      "step": 2393
    },
    {
      "epoch": 0.25397835773392746,
      "grad_norm": 0.9893202509047841,
      "learning_rate": 4.994922830150348e-05,
      "loss": 2.0484,
      "num_input_tokens_seen": 1883519952,
      "step": 2394
    },
    {
      "epoch": 0.2540844472734988,
      "grad_norm": 0.9636423499189615,
      "learning_rate": 4.9949184022778074e-05,
      "loss": 2.2458,
      "num_input_tokens_seen": 1884306784,
      "step": 2395
    },
    {
      "epoch": 0.25419053681307024,
      "grad_norm": 0.8816179554936855,
      "learning_rate": 4.9949139724772665e-05,
      "loss": 2.2903,
      "num_input_tokens_seen": 1885093536,
      "step": 2396
    },
    {
      "epoch": 0.2542966263526416,
      "grad_norm": 0.8161989925495683,
      "learning_rate": 4.994909540748729e-05,
      "loss": 2.2119,
      "num_input_tokens_seen": 1885880304,
      "step": 2397
    },
    {
      "epoch": 0.254402715892213,
      "grad_norm": 0.8189001633089495,
      "learning_rate": 4.994905107092199e-05,
      "loss": 2.17,
      "num_input_tokens_seen": 1886667184,
      "step": 2398
    },
    {
      "epoch": 0.25450880543178445,
      "grad_norm": 0.70969117161364,
      "learning_rate": 4.9949006715076804e-05,
      "loss": 2.4083,
      "num_input_tokens_seen": 1887453840,
      "step": 2399
    },
    {
      "epoch": 0.2546148949713558,
      "grad_norm": 0.8420188926285889,
      "learning_rate": 4.994896233995175e-05,
      "loss": 2.242,
      "num_input_tokens_seen": 1888240608,
      "step": 2400
    },
    {
      "epoch": 0.25472098451092723,
      "grad_norm": 0.9507135145181411,
      "learning_rate": 4.994891794554687e-05,
      "loss": 2.2829,
      "num_input_tokens_seen": 1889027360,
      "step": 2401
    },
    {
      "epoch": 0.25482707405049865,
      "grad_norm": 1.0051422173374045,
      "learning_rate": 4.99488735318622e-05,
      "loss": 2.127,
      "num_input_tokens_seen": 1889814032,
      "step": 2402
    },
    {
      "epoch": 0.25493316359007,
      "grad_norm": 0.4850414092585521,
      "learning_rate": 4.994882909889777e-05,
      "loss": 2.1682,
      "num_input_tokens_seen": 1890600800,
      "step": 2403
    },
    {
      "epoch": 0.25503925312964143,
      "grad_norm": 0.8343043263713052,
      "learning_rate": 4.994878464665362e-05,
      "loss": 2.0734,
      "num_input_tokens_seen": 1891387696,
      "step": 2404
    },
    {
      "epoch": 0.2551453426692128,
      "grad_norm": 0.8176553999408419,
      "learning_rate": 4.9948740175129775e-05,
      "loss": 2.1183,
      "num_input_tokens_seen": 1892174544,
      "step": 2405
    },
    {
      "epoch": 0.2552514322087842,
      "grad_norm": 0.706977145010166,
      "learning_rate": 4.9948695684326285e-05,
      "loss": 2.1368,
      "num_input_tokens_seen": 1892961264,
      "step": 2406
    },
    {
      "epoch": 0.25535752174835563,
      "grad_norm": 0.8540696314314746,
      "learning_rate": 4.9948651174243166e-05,
      "loss": 2.2815,
      "num_input_tokens_seen": 1893748016,
      "step": 2407
    },
    {
      "epoch": 0.255463611287927,
      "grad_norm": 0.7971318470635067,
      "learning_rate": 4.994860664488047e-05,
      "loss": 2.0757,
      "num_input_tokens_seen": 1894534864,
      "step": 2408
    },
    {
      "epoch": 0.2555697008274984,
      "grad_norm": 0.7859578556017126,
      "learning_rate": 4.994856209623822e-05,
      "loss": 2.1781,
      "num_input_tokens_seen": 1895321600,
      "step": 2409
    },
    {
      "epoch": 0.25567579036706983,
      "grad_norm": 1.0850614979330593,
      "learning_rate": 4.994851752831645e-05,
      "loss": 2.1512,
      "num_input_tokens_seen": 1896108304,
      "step": 2410
    },
    {
      "epoch": 0.2557818799066412,
      "grad_norm": 0.995412350079226,
      "learning_rate": 4.9948472941115195e-05,
      "loss": 2.3471,
      "num_input_tokens_seen": 1896895024,
      "step": 2411
    },
    {
      "epoch": 0.2558879694462126,
      "grad_norm": 0.6105680912303153,
      "learning_rate": 4.99484283346345e-05,
      "loss": 2.0339,
      "num_input_tokens_seen": 1897681824,
      "step": 2412
    },
    {
      "epoch": 0.255994058985784,
      "grad_norm": 0.7429147254353525,
      "learning_rate": 4.994838370887439e-05,
      "loss": 1.9911,
      "num_input_tokens_seen": 1898468624,
      "step": 2413
    },
    {
      "epoch": 0.2561001485253554,
      "grad_norm": 0.602850347517981,
      "learning_rate": 4.9948339063834894e-05,
      "loss": 2.3968,
      "num_input_tokens_seen": 1899255440,
      "step": 2414
    },
    {
      "epoch": 0.2562062380649268,
      "grad_norm": 1.053653447945916,
      "learning_rate": 4.994829439951606e-05,
      "loss": 2.2718,
      "num_input_tokens_seen": 1900042144,
      "step": 2415
    },
    {
      "epoch": 0.2563123276044982,
      "grad_norm": 0.5594417832434168,
      "learning_rate": 4.994824971591792e-05,
      "loss": 2.2641,
      "num_input_tokens_seen": 1900828880,
      "step": 2416
    },
    {
      "epoch": 0.2564184171440696,
      "grad_norm": 1.0973304178619816,
      "learning_rate": 4.99482050130405e-05,
      "loss": 2.174,
      "num_input_tokens_seen": 1901615712,
      "step": 2417
    },
    {
      "epoch": 0.256524506683641,
      "grad_norm": 0.8993803670603736,
      "learning_rate": 4.994816029088384e-05,
      "loss": 2.323,
      "num_input_tokens_seen": 1902402368,
      "step": 2418
    },
    {
      "epoch": 0.2566305962232124,
      "grad_norm": 1.0287606893569603,
      "learning_rate": 4.994811554944797e-05,
      "loss": 2.0968,
      "num_input_tokens_seen": 1903189120,
      "step": 2419
    },
    {
      "epoch": 0.2567366857627838,
      "grad_norm": 0.9745467723194274,
      "learning_rate": 4.9948070788732925e-05,
      "loss": 2.1068,
      "num_input_tokens_seen": 1903975888,
      "step": 2420
    },
    {
      "epoch": 0.25684277530235516,
      "grad_norm": 0.793859669805016,
      "learning_rate": 4.994802600873875e-05,
      "loss": 2.1451,
      "num_input_tokens_seen": 1904762592,
      "step": 2421
    },
    {
      "epoch": 0.2569488648419266,
      "grad_norm": 0.7576714372475605,
      "learning_rate": 4.994798120946547e-05,
      "loss": 2.0612,
      "num_input_tokens_seen": 1905549472,
      "step": 2422
    },
    {
      "epoch": 0.257054954381498,
      "grad_norm": 1.0498541534162709,
      "learning_rate": 4.9947936390913134e-05,
      "loss": 1.9214,
      "num_input_tokens_seen": 1906336304,
      "step": 2423
    },
    {
      "epoch": 0.25716104392106937,
      "grad_norm": 0.8513962421532939,
      "learning_rate": 4.994789155308175e-05,
      "loss": 2.0347,
      "num_input_tokens_seen": 1907123104,
      "step": 2424
    },
    {
      "epoch": 0.2572671334606408,
      "grad_norm": 0.8115929916098402,
      "learning_rate": 4.9947846695971366e-05,
      "loss": 2.3055,
      "num_input_tokens_seen": 1907909840,
      "step": 2425
    },
    {
      "epoch": 0.2573732230002122,
      "grad_norm": 0.6221332701406658,
      "learning_rate": 4.994780181958203e-05,
      "loss": 2.2769,
      "num_input_tokens_seen": 1908696528,
      "step": 2426
    },
    {
      "epoch": 0.25747931253978357,
      "grad_norm": 0.9000035316122378,
      "learning_rate": 4.994775692391376e-05,
      "loss": 2.2837,
      "num_input_tokens_seen": 1909483216,
      "step": 2427
    },
    {
      "epoch": 0.257585402079355,
      "grad_norm": 1.2472464198642783,
      "learning_rate": 4.9947712008966585e-05,
      "loss": 2.3807,
      "num_input_tokens_seen": 1910269920,
      "step": 2428
    },
    {
      "epoch": 0.25769149161892635,
      "grad_norm": 1.6274293359120793,
      "learning_rate": 4.994766707474057e-05,
      "loss": 2.154,
      "num_input_tokens_seen": 1911056656,
      "step": 2429
    },
    {
      "epoch": 0.25779758115849777,
      "grad_norm": 1.1889164681443418,
      "learning_rate": 4.9947622121235713e-05,
      "loss": 2.3446,
      "num_input_tokens_seen": 1911843328,
      "step": 2430
    },
    {
      "epoch": 0.2579036706980692,
      "grad_norm": 5.0544088312027124,
      "learning_rate": 4.994757714845207e-05,
      "loss": 2.2202,
      "num_input_tokens_seen": 1912630176,
      "step": 2431
    },
    {
      "epoch": 0.25800976023764055,
      "grad_norm": 4.3721279079215964,
      "learning_rate": 4.9947532156389675e-05,
      "loss": 2.334,
      "num_input_tokens_seen": 1913416896,
      "step": 2432
    },
    {
      "epoch": 0.25811584977721197,
      "grad_norm": 0.9892702113812766,
      "learning_rate": 4.994748714504856e-05,
      "loss": 2.2315,
      "num_input_tokens_seen": 1914203680,
      "step": 2433
    },
    {
      "epoch": 0.2582219393167834,
      "grad_norm": 2.639607506174632,
      "learning_rate": 4.9947442114428754e-05,
      "loss": 2.2047,
      "num_input_tokens_seen": 1914990512,
      "step": 2434
    },
    {
      "epoch": 0.25832802885635475,
      "grad_norm": 1.228804854048152,
      "learning_rate": 4.99473970645303e-05,
      "loss": 2.1114,
      "num_input_tokens_seen": 1915777216,
      "step": 2435
    },
    {
      "epoch": 0.25843411839592617,
      "grad_norm": 2.0667599602564897,
      "learning_rate": 4.994735199535322e-05,
      "loss": 2.2706,
      "num_input_tokens_seen": 1916564000,
      "step": 2436
    },
    {
      "epoch": 0.25854020793549753,
      "grad_norm": 1.1284837925057642,
      "learning_rate": 4.9947306906897575e-05,
      "loss": 2.2357,
      "num_input_tokens_seen": 1917350880,
      "step": 2437
    },
    {
      "epoch": 0.25864629747506895,
      "grad_norm": 2.2728752766058173,
      "learning_rate": 4.994726179916337e-05,
      "loss": 2.3765,
      "num_input_tokens_seen": 1918137664,
      "step": 2438
    },
    {
      "epoch": 0.2587523870146404,
      "grad_norm": 1.5909081580391187,
      "learning_rate": 4.994721667215066e-05,
      "loss": 2.2785,
      "num_input_tokens_seen": 1918924320,
      "step": 2439
    },
    {
      "epoch": 0.25885847655421174,
      "grad_norm": 1.8979597004638686,
      "learning_rate": 4.994717152585947e-05,
      "loss": 2.3077,
      "num_input_tokens_seen": 1919711024,
      "step": 2440
    },
    {
      "epoch": 0.25896456609378316,
      "grad_norm": 1.2915150918511116,
      "learning_rate": 4.994712636028984e-05,
      "loss": 2.088,
      "num_input_tokens_seen": 1920497792,
      "step": 2441
    },
    {
      "epoch": 0.2590706556333546,
      "grad_norm": 1.398023442704126,
      "learning_rate": 4.9947081175441804e-05,
      "loss": 1.9523,
      "num_input_tokens_seen": 1921284704,
      "step": 2442
    },
    {
      "epoch": 0.25917674517292594,
      "grad_norm": 1.373746868301696,
      "learning_rate": 4.994703597131539e-05,
      "loss": 2.3127,
      "num_input_tokens_seen": 1922071424,
      "step": 2443
    },
    {
      "epoch": 0.25928283471249736,
      "grad_norm": 1.178977604220254,
      "learning_rate": 4.9946990747910645e-05,
      "loss": 1.9856,
      "num_input_tokens_seen": 1922858224,
      "step": 2444
    },
    {
      "epoch": 0.2593889242520687,
      "grad_norm": 1.2881245151316731,
      "learning_rate": 4.994694550522759e-05,
      "loss": 2.2611,
      "num_input_tokens_seen": 1923644960,
      "step": 2445
    },
    {
      "epoch": 0.25949501379164014,
      "grad_norm": 0.9175916627240984,
      "learning_rate": 4.994690024326628e-05,
      "loss": 2.2728,
      "num_input_tokens_seen": 1924431744,
      "step": 2446
    },
    {
      "epoch": 0.25960110333121156,
      "grad_norm": 0.9500041368115768,
      "learning_rate": 4.9946854962026725e-05,
      "loss": 2.2832,
      "num_input_tokens_seen": 1925218464,
      "step": 2447
    },
    {
      "epoch": 0.2597071928707829,
      "grad_norm": 0.8176415842993785,
      "learning_rate": 4.994680966150897e-05,
      "loss": 1.9825,
      "num_input_tokens_seen": 1926005200,
      "step": 2448
    },
    {
      "epoch": 0.25981328241035434,
      "grad_norm": 0.9728927009577999,
      "learning_rate": 4.994676434171306e-05,
      "loss": 2.1697,
      "num_input_tokens_seen": 1926791888,
      "step": 2449
    },
    {
      "epoch": 0.25991937194992576,
      "grad_norm": 1.029573801449064,
      "learning_rate": 4.994671900263903e-05,
      "loss": 2.1709,
      "num_input_tokens_seen": 1927578704,
      "step": 2450
    },
    {
      "epoch": 0.2600254614894971,
      "grad_norm": 0.8442731478185656,
      "learning_rate": 4.99466736442869e-05,
      "loss": 2.1099,
      "num_input_tokens_seen": 1928365488,
      "step": 2451
    },
    {
      "epoch": 0.26013155102906854,
      "grad_norm": 0.9052177073169957,
      "learning_rate": 4.994662826665671e-05,
      "loss": 2.0191,
      "num_input_tokens_seen": 1929152320,
      "step": 2452
    },
    {
      "epoch": 0.2602376405686399,
      "grad_norm": 0.8389573138155851,
      "learning_rate": 4.99465828697485e-05,
      "loss": 2.1655,
      "num_input_tokens_seen": 1929939184,
      "step": 2453
    },
    {
      "epoch": 0.2603437301082113,
      "grad_norm": 0.7810265428824426,
      "learning_rate": 4.9946537453562306e-05,
      "loss": 2.0093,
      "num_input_tokens_seen": 1930725968,
      "step": 2454
    },
    {
      "epoch": 0.26044981964778274,
      "grad_norm": 1.2420261411178077,
      "learning_rate": 4.994649201809815e-05,
      "loss": 2.1679,
      "num_input_tokens_seen": 1931512752,
      "step": 2455
    },
    {
      "epoch": 0.2605559091873541,
      "grad_norm": 1.0659899889486315,
      "learning_rate": 4.994644656335608e-05,
      "loss": 1.9184,
      "num_input_tokens_seen": 1932299488,
      "step": 2456
    },
    {
      "epoch": 0.2606619987269255,
      "grad_norm": 0.9500600388600102,
      "learning_rate": 4.9946401089336134e-05,
      "loss": 2.2529,
      "num_input_tokens_seen": 1933086256,
      "step": 2457
    },
    {
      "epoch": 0.26076808826649694,
      "grad_norm": 0.6422794584716557,
      "learning_rate": 4.994635559603834e-05,
      "loss": 2.0206,
      "num_input_tokens_seen": 1933873152,
      "step": 2458
    },
    {
      "epoch": 0.2608741778060683,
      "grad_norm": 0.8806441281465901,
      "learning_rate": 4.994631008346273e-05,
      "loss": 2.1134,
      "num_input_tokens_seen": 1934659904,
      "step": 2459
    },
    {
      "epoch": 0.2609802673456397,
      "grad_norm": 0.8643172347257853,
      "learning_rate": 4.9946264551609344e-05,
      "loss": 2.231,
      "num_input_tokens_seen": 1935446640,
      "step": 2460
    },
    {
      "epoch": 0.2610863568852111,
      "grad_norm": 0.6616737742410054,
      "learning_rate": 4.994621900047822e-05,
      "loss": 2.1187,
      "num_input_tokens_seen": 1936233456,
      "step": 2461
    },
    {
      "epoch": 0.2611924464247825,
      "grad_norm": 0.795608842811785,
      "learning_rate": 4.994617343006939e-05,
      "loss": 2.2735,
      "num_input_tokens_seen": 1937020240,
      "step": 2462
    },
    {
      "epoch": 0.26129853596435393,
      "grad_norm": 1.0199144491042065,
      "learning_rate": 4.994612784038289e-05,
      "loss": 2.2139,
      "num_input_tokens_seen": 1937806960,
      "step": 2463
    },
    {
      "epoch": 0.2614046255039253,
      "grad_norm": 1.445911738155387,
      "learning_rate": 4.9946082231418756e-05,
      "loss": 2.1795,
      "num_input_tokens_seen": 1938593696,
      "step": 2464
    },
    {
      "epoch": 0.2615107150434967,
      "grad_norm": 0.7018584545805655,
      "learning_rate": 4.994603660317702e-05,
      "loss": 2.1332,
      "num_input_tokens_seen": 1939380432,
      "step": 2465
    },
    {
      "epoch": 0.26161680458306813,
      "grad_norm": 1.0832379500348581,
      "learning_rate": 4.994599095565771e-05,
      "loss": 2.2754,
      "num_input_tokens_seen": 1940167232,
      "step": 2466
    },
    {
      "epoch": 0.2617228941226395,
      "grad_norm": 1.6825278761226725,
      "learning_rate": 4.994594528886088e-05,
      "loss": 2.3621,
      "num_input_tokens_seen": 1940954000,
      "step": 2467
    },
    {
      "epoch": 0.2618289836622109,
      "grad_norm": 0.9153785153624475,
      "learning_rate": 4.994589960278655e-05,
      "loss": 2.2733,
      "num_input_tokens_seen": 1941740752,
      "step": 2468
    },
    {
      "epoch": 0.26193507320178233,
      "grad_norm": 2.1263846835525793,
      "learning_rate": 4.9945853897434766e-05,
      "loss": 2.1773,
      "num_input_tokens_seen": 1942527504,
      "step": 2469
    },
    {
      "epoch": 0.2620411627413537,
      "grad_norm": 1.3155790861945447,
      "learning_rate": 4.994580817280555e-05,
      "loss": 2.2183,
      "num_input_tokens_seen": 1943314304,
      "step": 2470
    },
    {
      "epoch": 0.2621472522809251,
      "grad_norm": 1.98799659054469,
      "learning_rate": 4.9945762428898956e-05,
      "loss": 2.2249,
      "num_input_tokens_seen": 1944101152,
      "step": 2471
    },
    {
      "epoch": 0.2622533418204965,
      "grad_norm": 1.1310271852685152,
      "learning_rate": 4.9945716665715e-05,
      "loss": 2.2505,
      "num_input_tokens_seen": 1944887856,
      "step": 2472
    },
    {
      "epoch": 0.2623594313600679,
      "grad_norm": 1.3332167900411385,
      "learning_rate": 4.994567088325373e-05,
      "loss": 2.1333,
      "num_input_tokens_seen": 1945674656,
      "step": 2473
    },
    {
      "epoch": 0.2624655208996393,
      "grad_norm": 0.9210816569231697,
      "learning_rate": 4.994562508151518e-05,
      "loss": 2.3256,
      "num_input_tokens_seen": 1946461472,
      "step": 2474
    },
    {
      "epoch": 0.2625716104392107,
      "grad_norm": 0.9363518929331669,
      "learning_rate": 4.994557926049937e-05,
      "loss": 2.2812,
      "num_input_tokens_seen": 1947248288,
      "step": 2475
    },
    {
      "epoch": 0.2626776999787821,
      "grad_norm": 0.6461079374806189,
      "learning_rate": 4.994553342020637e-05,
      "loss": 2.1618,
      "num_input_tokens_seen": 1948035104,
      "step": 2476
    },
    {
      "epoch": 0.2627837895183535,
      "grad_norm": 0.8176979016758185,
      "learning_rate": 4.994548756063618e-05,
      "loss": 2.3264,
      "num_input_tokens_seen": 1948821840,
      "step": 2477
    },
    {
      "epoch": 0.2628898790579249,
      "grad_norm": 0.6779395050622596,
      "learning_rate": 4.994544168178885e-05,
      "loss": 2.0043,
      "num_input_tokens_seen": 1949608576,
      "step": 2478
    },
    {
      "epoch": 0.2629959685974963,
      "grad_norm": 0.7746501633431649,
      "learning_rate": 4.994539578366442e-05,
      "loss": 2.2841,
      "num_input_tokens_seen": 1950395248,
      "step": 2479
    },
    {
      "epoch": 0.26310205813706766,
      "grad_norm": 0.9895337419458199,
      "learning_rate": 4.994534986626291e-05,
      "loss": 2.2287,
      "num_input_tokens_seen": 1951182064,
      "step": 2480
    },
    {
      "epoch": 0.2632081476766391,
      "grad_norm": 0.739409653927618,
      "learning_rate": 4.994530392958438e-05,
      "loss": 2.1936,
      "num_input_tokens_seen": 1951968784,
      "step": 2481
    },
    {
      "epoch": 0.2633142372162105,
      "grad_norm": 0.5333483271966719,
      "learning_rate": 4.994525797362883e-05,
      "loss": 2.3174,
      "num_input_tokens_seen": 1952755552,
      "step": 2482
    },
    {
      "epoch": 0.26342032675578186,
      "grad_norm": 0.7510653059187091,
      "learning_rate": 4.994521199839633e-05,
      "loss": 2.3099,
      "num_input_tokens_seen": 1953542240,
      "step": 2483
    },
    {
      "epoch": 0.2635264162953533,
      "grad_norm": 0.6856706019855756,
      "learning_rate": 4.99451660038869e-05,
      "loss": 2.1627,
      "num_input_tokens_seen": 1954329024,
      "step": 2484
    },
    {
      "epoch": 0.2636325058349247,
      "grad_norm": 0.7565797542589662,
      "learning_rate": 4.994511999010059e-05,
      "loss": 2.249,
      "num_input_tokens_seen": 1955115696,
      "step": 2485
    },
    {
      "epoch": 0.26373859537449607,
      "grad_norm": 0.5283362651216185,
      "learning_rate": 4.994507395703741e-05,
      "loss": 2.0852,
      "num_input_tokens_seen": 1955902528,
      "step": 2486
    },
    {
      "epoch": 0.2638446849140675,
      "grad_norm": 0.8245508361302515,
      "learning_rate": 4.99450279046974e-05,
      "loss": 2.1802,
      "num_input_tokens_seen": 1956689296,
      "step": 2487
    },
    {
      "epoch": 0.26395077445363885,
      "grad_norm": 0.7511817357965541,
      "learning_rate": 4.9944981833080626e-05,
      "loss": 2.1342,
      "num_input_tokens_seen": 1957476160,
      "step": 2488
    },
    {
      "epoch": 0.26405686399321027,
      "grad_norm": 0.6014336297969404,
      "learning_rate": 4.9944935742187086e-05,
      "loss": 2.2227,
      "num_input_tokens_seen": 1958262880,
      "step": 2489
    },
    {
      "epoch": 0.2641629535327817,
      "grad_norm": 0.47352004212323384,
      "learning_rate": 4.994488963201684e-05,
      "loss": 2.1815,
      "num_input_tokens_seen": 1959049600,
      "step": 2490
    },
    {
      "epoch": 0.26426904307235305,
      "grad_norm": 0.4434791725549217,
      "learning_rate": 4.994484350256991e-05,
      "loss": 2.1078,
      "num_input_tokens_seen": 1959836400,
      "step": 2491
    },
    {
      "epoch": 0.26437513261192447,
      "grad_norm": 0.538959518076782,
      "learning_rate": 4.994479735384634e-05,
      "loss": 2.2274,
      "num_input_tokens_seen": 1960623184,
      "step": 2492
    },
    {
      "epoch": 0.2644812221514959,
      "grad_norm": 0.5741959936131347,
      "learning_rate": 4.994475118584616e-05,
      "loss": 2.1271,
      "num_input_tokens_seen": 1961410032,
      "step": 2493
    },
    {
      "epoch": 0.26458731169106725,
      "grad_norm": 0.5939748159231865,
      "learning_rate": 4.994470499856941e-05,
      "loss": 2.2036,
      "num_input_tokens_seen": 1962196864,
      "step": 2494
    },
    {
      "epoch": 0.26469340123063867,
      "grad_norm": 0.8294245123034625,
      "learning_rate": 4.9944658792016126e-05,
      "loss": 2.1743,
      "num_input_tokens_seen": 1962983616,
      "step": 2495
    },
    {
      "epoch": 0.26479949077021003,
      "grad_norm": 0.4858114315447088,
      "learning_rate": 4.994461256618634e-05,
      "loss": 2.2121,
      "num_input_tokens_seen": 1963770384,
      "step": 2496
    },
    {
      "epoch": 0.26490558030978145,
      "grad_norm": 0.9285299527832849,
      "learning_rate": 4.9944566321080087e-05,
      "loss": 2.1465,
      "num_input_tokens_seen": 1964557152,
      "step": 2497
    },
    {
      "epoch": 0.26501166984935287,
      "grad_norm": 0.9996188711630656,
      "learning_rate": 4.994452005669741e-05,
      "loss": 2.1196,
      "num_input_tokens_seen": 1965343952,
      "step": 2498
    },
    {
      "epoch": 0.26511775938892423,
      "grad_norm": 0.7461114828365826,
      "learning_rate": 4.994447377303833e-05,
      "loss": 2.1376,
      "num_input_tokens_seen": 1966130720,
      "step": 2499
    },
    {
      "epoch": 0.26522384892849565,
      "grad_norm": 1.3178012392562901,
      "learning_rate": 4.99444274701029e-05,
      "loss": 2.2662,
      "num_input_tokens_seen": 1966917456,
      "step": 2500
    },
    {
      "epoch": 0.2653299384680671,
      "grad_norm": 2.452948992225957,
      "learning_rate": 4.994438114789115e-05,
      "loss": 2.1093,
      "num_input_tokens_seen": 1967704224,
      "step": 2501
    },
    {
      "epoch": 0.26543602800763844,
      "grad_norm": 1.8872822464054628,
      "learning_rate": 4.994433480640311e-05,
      "loss": 2.1025,
      "num_input_tokens_seen": 1968490992,
      "step": 2502
    },
    {
      "epoch": 0.26554211754720985,
      "grad_norm": 1.6446728835735804,
      "learning_rate": 4.994428844563882e-05,
      "loss": 2.2843,
      "num_input_tokens_seen": 1969277776,
      "step": 2503
    },
    {
      "epoch": 0.2656482070867812,
      "grad_norm": 1.3433824142327606,
      "learning_rate": 4.994424206559832e-05,
      "loss": 2.0718,
      "num_input_tokens_seen": 1970064624,
      "step": 2504
    },
    {
      "epoch": 0.26575429662635264,
      "grad_norm": 0.8005150708876314,
      "learning_rate": 4.9944195666281634e-05,
      "loss": 2.2338,
      "num_input_tokens_seen": 1970851392,
      "step": 2505
    },
    {
      "epoch": 0.26586038616592406,
      "grad_norm": 1.3009841702288492,
      "learning_rate": 4.994414924768881e-05,
      "loss": 2.2821,
      "num_input_tokens_seen": 1971638064,
      "step": 2506
    },
    {
      "epoch": 0.2659664757054954,
      "grad_norm": 0.7859710875916663,
      "learning_rate": 4.9944102809819883e-05,
      "loss": 2.1998,
      "num_input_tokens_seen": 1972424816,
      "step": 2507
    },
    {
      "epoch": 0.26607256524506684,
      "grad_norm": 1.1479980712627031,
      "learning_rate": 4.994405635267488e-05,
      "loss": 2.1923,
      "num_input_tokens_seen": 1973211552,
      "step": 2508
    },
    {
      "epoch": 0.26617865478463826,
      "grad_norm": 0.7586063651602462,
      "learning_rate": 4.994400987625384e-05,
      "loss": 2.0961,
      "num_input_tokens_seen": 1973998352,
      "step": 2509
    },
    {
      "epoch": 0.2662847443242096,
      "grad_norm": 0.7647162674163194,
      "learning_rate": 4.994396338055681e-05,
      "loss": 2.2536,
      "num_input_tokens_seen": 1974785216,
      "step": 2510
    },
    {
      "epoch": 0.26639083386378104,
      "grad_norm": 0.8842340056757878,
      "learning_rate": 4.9943916865583814e-05,
      "loss": 2.2799,
      "num_input_tokens_seen": 1975571952,
      "step": 2511
    },
    {
      "epoch": 0.2664969234033524,
      "grad_norm": 0.8134377860678572,
      "learning_rate": 4.994387033133489e-05,
      "loss": 2.1936,
      "num_input_tokens_seen": 1976358560,
      "step": 2512
    },
    {
      "epoch": 0.2666030129429238,
      "grad_norm": 0.840659866794999,
      "learning_rate": 4.994382377781007e-05,
      "loss": 2.2492,
      "num_input_tokens_seen": 1977145280,
      "step": 2513
    },
    {
      "epoch": 0.26670910248249524,
      "grad_norm": 0.6568259576326947,
      "learning_rate": 4.99437772050094e-05,
      "loss": 2.1201,
      "num_input_tokens_seen": 1977932016,
      "step": 2514
    },
    {
      "epoch": 0.2668151920220666,
      "grad_norm": 0.740216403898949,
      "learning_rate": 4.994373061293291e-05,
      "loss": 2.1796,
      "num_input_tokens_seen": 1978718800,
      "step": 2515
    },
    {
      "epoch": 0.266921281561638,
      "grad_norm": 0.5965229135065412,
      "learning_rate": 4.9943684001580635e-05,
      "loss": 2.2505,
      "num_input_tokens_seen": 1979505616,
      "step": 2516
    },
    {
      "epoch": 0.26702737110120944,
      "grad_norm": 1.0643970198116124,
      "learning_rate": 4.994363737095261e-05,
      "loss": 2.1694,
      "num_input_tokens_seen": 1980292400,
      "step": 2517
    },
    {
      "epoch": 0.2671334606407808,
      "grad_norm": 1.0088814062499942,
      "learning_rate": 4.9943590721048885e-05,
      "loss": 2.0584,
      "num_input_tokens_seen": 1981079216,
      "step": 2518
    },
    {
      "epoch": 0.2672395501803522,
      "grad_norm": 0.725328174901163,
      "learning_rate": 4.994354405186947e-05,
      "loss": 2.2147,
      "num_input_tokens_seen": 1981865952,
      "step": 2519
    },
    {
      "epoch": 0.2673456397199236,
      "grad_norm": 1.36211473235223,
      "learning_rate": 4.994349736341443e-05,
      "loss": 2.2024,
      "num_input_tokens_seen": 1982652800,
      "step": 2520
    },
    {
      "epoch": 0.267451729259495,
      "grad_norm": 0.8742376825798636,
      "learning_rate": 4.994345065568378e-05,
      "loss": 2.0347,
      "num_input_tokens_seen": 1983439600,
      "step": 2521
    },
    {
      "epoch": 0.2675578187990664,
      "grad_norm": 1.3348748743843966,
      "learning_rate": 4.994340392867757e-05,
      "loss": 1.9448,
      "num_input_tokens_seen": 1984226384,
      "step": 2522
    },
    {
      "epoch": 0.2676639083386378,
      "grad_norm": 0.8522749280088554,
      "learning_rate": 4.994335718239582e-05,
      "loss": 2.0443,
      "num_input_tokens_seen": 1985013168,
      "step": 2523
    },
    {
      "epoch": 0.2677699978782092,
      "grad_norm": 0.9602777280007885,
      "learning_rate": 4.994331041683858e-05,
      "loss": 2.189,
      "num_input_tokens_seen": 1985799904,
      "step": 2524
    },
    {
      "epoch": 0.26787608741778063,
      "grad_norm": 0.6737321923601062,
      "learning_rate": 4.994326363200588e-05,
      "loss": 2.1425,
      "num_input_tokens_seen": 1986586688,
      "step": 2525
    },
    {
      "epoch": 0.267982176957352,
      "grad_norm": 0.799313242684694,
      "learning_rate": 4.9943216827897765e-05,
      "loss": 2.1499,
      "num_input_tokens_seen": 1987373488,
      "step": 2526
    },
    {
      "epoch": 0.2680882664969234,
      "grad_norm": 0.6645574887619842,
      "learning_rate": 4.994317000451425e-05,
      "loss": 2.1328,
      "num_input_tokens_seen": 1988160224,
      "step": 2527
    },
    {
      "epoch": 0.2681943560364948,
      "grad_norm": 0.7390748792189619,
      "learning_rate": 4.99431231618554e-05,
      "loss": 2.3505,
      "num_input_tokens_seen": 1988946912,
      "step": 2528
    },
    {
      "epoch": 0.2683004455760662,
      "grad_norm": 0.5236169665940493,
      "learning_rate": 4.994307629992123e-05,
      "loss": 2.1977,
      "num_input_tokens_seen": 1989733696,
      "step": 2529
    },
    {
      "epoch": 0.2684065351156376,
      "grad_norm": 0.9913261386535964,
      "learning_rate": 4.9943029418711776e-05,
      "loss": 2.2487,
      "num_input_tokens_seen": 1990520512,
      "step": 2530
    },
    {
      "epoch": 0.268512624655209,
      "grad_norm": 1.0831247722973822,
      "learning_rate": 4.994298251822709e-05,
      "loss": 2.0973,
      "num_input_tokens_seen": 1991307328,
      "step": 2531
    },
    {
      "epoch": 0.2686187141947804,
      "grad_norm": 0.7942741205378785,
      "learning_rate": 4.9942935598467193e-05,
      "loss": 2.1768,
      "num_input_tokens_seen": 1992094176,
      "step": 2532
    },
    {
      "epoch": 0.2687248037343518,
      "grad_norm": 1.0918009875886543,
      "learning_rate": 4.994288865943213e-05,
      "loss": 2.3802,
      "num_input_tokens_seen": 1992880880,
      "step": 2533
    },
    {
      "epoch": 0.2688308932739232,
      "grad_norm": 1.0022546654431723,
      "learning_rate": 4.994284170112193e-05,
      "loss": 2.0992,
      "num_input_tokens_seen": 1993667552,
      "step": 2534
    },
    {
      "epoch": 0.2689369828134946,
      "grad_norm": 0.7058197766545955,
      "learning_rate": 4.9942794723536644e-05,
      "loss": 2.2559,
      "num_input_tokens_seen": 1994454288,
      "step": 2535
    },
    {
      "epoch": 0.269043072353066,
      "grad_norm": 1.1004026526303334,
      "learning_rate": 4.994274772667629e-05,
      "loss": 2.3469,
      "num_input_tokens_seen": 1995241024,
      "step": 2536
    },
    {
      "epoch": 0.2691491618926374,
      "grad_norm": 0.6134689983644246,
      "learning_rate": 4.994270071054091e-05,
      "loss": 2.3013,
      "num_input_tokens_seen": 1996027808,
      "step": 2537
    },
    {
      "epoch": 0.2692552514322088,
      "grad_norm": 1.1286144766011534,
      "learning_rate": 4.9942653675130555e-05,
      "loss": 2.2153,
      "num_input_tokens_seen": 1996814464,
      "step": 2538
    },
    {
      "epoch": 0.26936134097178016,
      "grad_norm": 0.8118281497279495,
      "learning_rate": 4.9942606620445245e-05,
      "loss": 2.1167,
      "num_input_tokens_seen": 1997601216,
      "step": 2539
    },
    {
      "epoch": 0.2694674305113516,
      "grad_norm": 0.9212398296094034,
      "learning_rate": 4.994255954648501e-05,
      "loss": 2.068,
      "num_input_tokens_seen": 1998387984,
      "step": 2540
    },
    {
      "epoch": 0.269573520050923,
      "grad_norm": 1.1347842111660926,
      "learning_rate": 4.99425124532499e-05,
      "loss": 2.2206,
      "num_input_tokens_seen": 1999174800,
      "step": 2541
    },
    {
      "epoch": 0.26967960959049436,
      "grad_norm": 0.6106396919858412,
      "learning_rate": 4.994246534073995e-05,
      "loss": 2.1863,
      "num_input_tokens_seen": 1999961600,
      "step": 2542
    },
    {
      "epoch": 0.2697856991300658,
      "grad_norm": 0.8499616959311246,
      "learning_rate": 4.99424182089552e-05,
      "loss": 2.1828,
      "num_input_tokens_seen": 2000748384,
      "step": 2543
    },
    {
      "epoch": 0.2698917886696372,
      "grad_norm": 0.6267097604999584,
      "learning_rate": 4.9942371057895676e-05,
      "loss": 2.2102,
      "num_input_tokens_seen": 2001535120,
      "step": 2544
    },
    {
      "epoch": 0.26999787820920856,
      "grad_norm": 0.9410923421880848,
      "learning_rate": 4.994232388756143e-05,
      "loss": 2.2668,
      "num_input_tokens_seen": 2002321856,
      "step": 2545
    },
    {
      "epoch": 0.27010396774878,
      "grad_norm": 0.9692861210396355,
      "learning_rate": 4.994227669795247e-05,
      "loss": 2.2208,
      "num_input_tokens_seen": 2003108576,
      "step": 2546
    },
    {
      "epoch": 0.27021005728835135,
      "grad_norm": 0.6981260603997804,
      "learning_rate": 4.994222948906886e-05,
      "loss": 2.171,
      "num_input_tokens_seen": 2003895312,
      "step": 2547
    },
    {
      "epoch": 0.27031614682792277,
      "grad_norm": 0.5957352122825161,
      "learning_rate": 4.994218226091063e-05,
      "loss": 2.1434,
      "num_input_tokens_seen": 2004682048,
      "step": 2548
    },
    {
      "epoch": 0.2704222363674942,
      "grad_norm": 0.9058942927266902,
      "learning_rate": 4.994213501347781e-05,
      "loss": 2.2124,
      "num_input_tokens_seen": 2005468784,
      "step": 2549
    },
    {
      "epoch": 0.27052832590706555,
      "grad_norm": 1.1177035436780578,
      "learning_rate": 4.994208774677044e-05,
      "loss": 2.0978,
      "num_input_tokens_seen": 2006255632,
      "step": 2550
    },
    {
      "epoch": 0.27063441544663697,
      "grad_norm": 0.7695663766458923,
      "learning_rate": 4.994204046078855e-05,
      "loss": 2.2525,
      "num_input_tokens_seen": 2007042368,
      "step": 2551
    },
    {
      "epoch": 0.2707405049862084,
      "grad_norm": 0.8556187392885863,
      "learning_rate": 4.9941993155532195e-05,
      "loss": 2.2026,
      "num_input_tokens_seen": 2007829200,
      "step": 2552
    },
    {
      "epoch": 0.27084659452577975,
      "grad_norm": 0.782144753602458,
      "learning_rate": 4.994194583100139e-05,
      "loss": 2.2422,
      "num_input_tokens_seen": 2008615952,
      "step": 2553
    },
    {
      "epoch": 0.27095268406535117,
      "grad_norm": 0.5481572748259099,
      "learning_rate": 4.9941898487196185e-05,
      "loss": 2.3367,
      "num_input_tokens_seen": 2009402752,
      "step": 2554
    },
    {
      "epoch": 0.27105877360492253,
      "grad_norm": 0.6144724791809208,
      "learning_rate": 4.9941851124116615e-05,
      "loss": 2.1564,
      "num_input_tokens_seen": 2010189616,
      "step": 2555
    },
    {
      "epoch": 0.27116486314449395,
      "grad_norm": 0.5709722228385224,
      "learning_rate": 4.994180374176271e-05,
      "loss": 2.0189,
      "num_input_tokens_seen": 2010976352,
      "step": 2556
    },
    {
      "epoch": 0.27127095268406537,
      "grad_norm": 0.6873712998696324,
      "learning_rate": 4.994175634013451e-05,
      "loss": 2.1446,
      "num_input_tokens_seen": 2011763136,
      "step": 2557
    },
    {
      "epoch": 0.27137704222363673,
      "grad_norm": 0.8236106785433155,
      "learning_rate": 4.9941708919232055e-05,
      "loss": 2.0897,
      "num_input_tokens_seen": 2012549968,
      "step": 2558
    },
    {
      "epoch": 0.27148313176320815,
      "grad_norm": 0.5091430789334125,
      "learning_rate": 4.994166147905538e-05,
      "loss": 2.1415,
      "num_input_tokens_seen": 2013336752,
      "step": 2559
    },
    {
      "epoch": 0.27158922130277957,
      "grad_norm": 1.6985714357448922,
      "learning_rate": 4.994161401960452e-05,
      "loss": 2.2637,
      "num_input_tokens_seen": 2014123536,
      "step": 2560
    },
    {
      "epoch": 0.27169531084235093,
      "grad_norm": 0.7507903442712298,
      "learning_rate": 4.994156654087951e-05,
      "loss": 2.143,
      "num_input_tokens_seen": 2014910288,
      "step": 2561
    },
    {
      "epoch": 0.27180140038192235,
      "grad_norm": 0.8945371203688502,
      "learning_rate": 4.9941519042880394e-05,
      "loss": 2.2514,
      "num_input_tokens_seen": 2015697088,
      "step": 2562
    },
    {
      "epoch": 0.2719074899214937,
      "grad_norm": 1.0182644327214287,
      "learning_rate": 4.994147152560721e-05,
      "loss": 2.1092,
      "num_input_tokens_seen": 2016483824,
      "step": 2563
    },
    {
      "epoch": 0.27201357946106514,
      "grad_norm": 1.032359032960509,
      "learning_rate": 4.9941423989059975e-05,
      "loss": 2.1996,
      "num_input_tokens_seen": 2017270608,
      "step": 2564
    },
    {
      "epoch": 0.27211966900063655,
      "grad_norm": 1.1163010121102135,
      "learning_rate": 4.994137643323875e-05,
      "loss": 2.2637,
      "num_input_tokens_seen": 2018057392,
      "step": 2565
    },
    {
      "epoch": 0.2722257585402079,
      "grad_norm": 0.570423582575597,
      "learning_rate": 4.994132885814355e-05,
      "loss": 1.9782,
      "num_input_tokens_seen": 2018844208,
      "step": 2566
    },
    {
      "epoch": 0.27233184807977934,
      "grad_norm": 0.7326167315571454,
      "learning_rate": 4.994128126377443e-05,
      "loss": 2.1219,
      "num_input_tokens_seen": 2019631008,
      "step": 2567
    },
    {
      "epoch": 0.27243793761935076,
      "grad_norm": 0.6155230690861195,
      "learning_rate": 4.994123365013142e-05,
      "loss": 2.2849,
      "num_input_tokens_seen": 2020417728,
      "step": 2568
    },
    {
      "epoch": 0.2725440271589221,
      "grad_norm": 0.5803446867071893,
      "learning_rate": 4.994118601721455e-05,
      "loss": 2.127,
      "num_input_tokens_seen": 2021204496,
      "step": 2569
    },
    {
      "epoch": 0.27265011669849354,
      "grad_norm": 0.6450230073224297,
      "learning_rate": 4.994113836502387e-05,
      "loss": 2.2891,
      "num_input_tokens_seen": 2021991264,
      "step": 2570
    },
    {
      "epoch": 0.2727562062380649,
      "grad_norm": 0.5406666878654816,
      "learning_rate": 4.9941090693559415e-05,
      "loss": 2.3779,
      "num_input_tokens_seen": 2022778032,
      "step": 2571
    },
    {
      "epoch": 0.2728622957776363,
      "grad_norm": 0.5986033594347192,
      "learning_rate": 4.994104300282121e-05,
      "loss": 2.2599,
      "num_input_tokens_seen": 2023564832,
      "step": 2572
    },
    {
      "epoch": 0.27296838531720774,
      "grad_norm": 0.5404027241679288,
      "learning_rate": 4.9940995292809296e-05,
      "loss": 2.1374,
      "num_input_tokens_seen": 2024351600,
      "step": 2573
    },
    {
      "epoch": 0.2730744748567791,
      "grad_norm": 0.5568959844140831,
      "learning_rate": 4.994094756352371e-05,
      "loss": 1.9313,
      "num_input_tokens_seen": 2025138384,
      "step": 2574
    },
    {
      "epoch": 0.2731805643963505,
      "grad_norm": 0.6962299678142198,
      "learning_rate": 4.99408998149645e-05,
      "loss": 2.1903,
      "num_input_tokens_seen": 2025925184,
      "step": 2575
    },
    {
      "epoch": 0.27328665393592194,
      "grad_norm": 0.8316602928804578,
      "learning_rate": 4.9940852047131695e-05,
      "loss": 2.3288,
      "num_input_tokens_seen": 2026711936,
      "step": 2576
    },
    {
      "epoch": 0.2733927434754933,
      "grad_norm": 0.9387867521968161,
      "learning_rate": 4.9940804260025324e-05,
      "loss": 2.3895,
      "num_input_tokens_seen": 2027498624,
      "step": 2577
    },
    {
      "epoch": 0.2734988330150647,
      "grad_norm": 0.764023649611208,
      "learning_rate": 4.9940756453645437e-05,
      "loss": 2.2621,
      "num_input_tokens_seen": 2028285360,
      "step": 2578
    },
    {
      "epoch": 0.2736049225546361,
      "grad_norm": 0.8246027982542822,
      "learning_rate": 4.994070862799206e-05,
      "loss": 2.1672,
      "num_input_tokens_seen": 2029072176,
      "step": 2579
    },
    {
      "epoch": 0.2737110120942075,
      "grad_norm": 0.5792880944836151,
      "learning_rate": 4.994066078306524e-05,
      "loss": 2.2314,
      "num_input_tokens_seen": 2029858928,
      "step": 2580
    },
    {
      "epoch": 0.2738171016337789,
      "grad_norm": 0.6996561327708133,
      "learning_rate": 4.994061291886501e-05,
      "loss": 2.2079,
      "num_input_tokens_seen": 2030645632,
      "step": 2581
    },
    {
      "epoch": 0.2739231911733503,
      "grad_norm": 0.642188201487686,
      "learning_rate": 4.994056503539141e-05,
      "loss": 2.2717,
      "num_input_tokens_seen": 2031432416,
      "step": 2582
    },
    {
      "epoch": 0.2740292807129217,
      "grad_norm": 0.8355077772788025,
      "learning_rate": 4.994051713264446e-05,
      "loss": 2.1331,
      "num_input_tokens_seen": 2032219216,
      "step": 2583
    },
    {
      "epoch": 0.2741353702524931,
      "grad_norm": 0.8795524812237612,
      "learning_rate": 4.994046921062422e-05,
      "loss": 2.0957,
      "num_input_tokens_seen": 2033006032,
      "step": 2584
    },
    {
      "epoch": 0.2742414597920645,
      "grad_norm": 0.7447297557048486,
      "learning_rate": 4.994042126933071e-05,
      "loss": 1.9987,
      "num_input_tokens_seen": 2033792816,
      "step": 2585
    },
    {
      "epoch": 0.2743475493316359,
      "grad_norm": 0.8482539282892029,
      "learning_rate": 4.994037330876398e-05,
      "loss": 1.902,
      "num_input_tokens_seen": 2034579616,
      "step": 2586
    },
    {
      "epoch": 0.2744536388712073,
      "grad_norm": 0.6643925005856728,
      "learning_rate": 4.994032532892406e-05,
      "loss": 2.2534,
      "num_input_tokens_seen": 2035366432,
      "step": 2587
    },
    {
      "epoch": 0.2745597284107787,
      "grad_norm": 0.7403774591468167,
      "learning_rate": 4.994027732981099e-05,
      "loss": 2.2122,
      "num_input_tokens_seen": 2036153200,
      "step": 2588
    },
    {
      "epoch": 0.2746658179503501,
      "grad_norm": 0.6286722769670677,
      "learning_rate": 4.99402293114248e-05,
      "loss": 2.047,
      "num_input_tokens_seen": 2036940016,
      "step": 2589
    },
    {
      "epoch": 0.2747719074899215,
      "grad_norm": 1.0086664718852094,
      "learning_rate": 4.994018127376554e-05,
      "loss": 2.3288,
      "num_input_tokens_seen": 2037726784,
      "step": 2590
    },
    {
      "epoch": 0.2748779970294929,
      "grad_norm": 1.0878342197060689,
      "learning_rate": 4.9940133216833235e-05,
      "loss": 2.056,
      "num_input_tokens_seen": 2038513568,
      "step": 2591
    },
    {
      "epoch": 0.2749840865690643,
      "grad_norm": 0.7492646136963579,
      "learning_rate": 4.9940085140627926e-05,
      "loss": 2.3025,
      "num_input_tokens_seen": 2039300288,
      "step": 2592
    },
    {
      "epoch": 0.2750901761086357,
      "grad_norm": 0.8064702916734533,
      "learning_rate": 4.9940037045149656e-05,
      "loss": 1.9971,
      "num_input_tokens_seen": 2040087024,
      "step": 2593
    },
    {
      "epoch": 0.2751962656482071,
      "grad_norm": 0.8338546513856265,
      "learning_rate": 4.993998893039845e-05,
      "loss": 2.1982,
      "num_input_tokens_seen": 2040873776,
      "step": 2594
    },
    {
      "epoch": 0.27530235518777846,
      "grad_norm": 0.8374263529598697,
      "learning_rate": 4.9939940796374355e-05,
      "loss": 2.0924,
      "num_input_tokens_seen": 2041660576,
      "step": 2595
    },
    {
      "epoch": 0.2754084447273499,
      "grad_norm": 1.0723968645767952,
      "learning_rate": 4.993989264307741e-05,
      "loss": 2.2656,
      "num_input_tokens_seen": 2042447328,
      "step": 2596
    },
    {
      "epoch": 0.2755145342669213,
      "grad_norm": 0.975921075602475,
      "learning_rate": 4.9939844470507645e-05,
      "loss": 2.3544,
      "num_input_tokens_seen": 2043234080,
      "step": 2597
    },
    {
      "epoch": 0.27562062380649266,
      "grad_norm": 0.561674801039465,
      "learning_rate": 4.993979627866509e-05,
      "loss": 1.9781,
      "num_input_tokens_seen": 2044020944,
      "step": 2598
    },
    {
      "epoch": 0.2757267133460641,
      "grad_norm": 0.6151506835345009,
      "learning_rate": 4.993974806754981e-05,
      "loss": 2.2015,
      "num_input_tokens_seen": 2044807776,
      "step": 2599
    },
    {
      "epoch": 0.2758328028856355,
      "grad_norm": 1.0936828445319917,
      "learning_rate": 4.993969983716182e-05,
      "loss": 2.2281,
      "num_input_tokens_seen": 2045594528,
      "step": 2600
    },
    {
      "epoch": 0.27593889242520686,
      "grad_norm": 1.22700451189826,
      "learning_rate": 4.9939651587501156e-05,
      "loss": 2.1408,
      "num_input_tokens_seen": 2046381280,
      "step": 2601
    },
    {
      "epoch": 0.2760449819647783,
      "grad_norm": 1.1319953744270739,
      "learning_rate": 4.9939603318567865e-05,
      "loss": 2.01,
      "num_input_tokens_seen": 2047168064,
      "step": 2602
    },
    {
      "epoch": 0.2761510715043497,
      "grad_norm": 1.4737928579604442,
      "learning_rate": 4.993955503036197e-05,
      "loss": 2.2052,
      "num_input_tokens_seen": 2047954832,
      "step": 2603
    },
    {
      "epoch": 0.27625716104392106,
      "grad_norm": 0.7225798570010509,
      "learning_rate": 4.993950672288353e-05,
      "loss": 2.1075,
      "num_input_tokens_seen": 2048741632,
      "step": 2604
    },
    {
      "epoch": 0.2763632505834925,
      "grad_norm": 1.7532881760183034,
      "learning_rate": 4.993945839613257e-05,
      "loss": 2.1838,
      "num_input_tokens_seen": 2049528416,
      "step": 2605
    },
    {
      "epoch": 0.27646934012306384,
      "grad_norm": 0.6212474729796943,
      "learning_rate": 4.9939410050109126e-05,
      "loss": 2.0951,
      "num_input_tokens_seen": 2050315152,
      "step": 2606
    },
    {
      "epoch": 0.27657542966263526,
      "grad_norm": 0.7875966767744542,
      "learning_rate": 4.9939361684813234e-05,
      "loss": 2.3281,
      "num_input_tokens_seen": 2051101936,
      "step": 2607
    },
    {
      "epoch": 0.2766815192022067,
      "grad_norm": 0.5669185351922685,
      "learning_rate": 4.9939313300244943e-05,
      "loss": 2.0493,
      "num_input_tokens_seen": 2051888688,
      "step": 2608
    },
    {
      "epoch": 0.27678760874177805,
      "grad_norm": 0.807177839895818,
      "learning_rate": 4.993926489640428e-05,
      "loss": 2.1912,
      "num_input_tokens_seen": 2052675456,
      "step": 2609
    },
    {
      "epoch": 0.27689369828134947,
      "grad_norm": 0.9140081998428657,
      "learning_rate": 4.993921647329128e-05,
      "loss": 2.0637,
      "num_input_tokens_seen": 2053462240,
      "step": 2610
    },
    {
      "epoch": 0.2769997878209209,
      "grad_norm": 0.48526895062595393,
      "learning_rate": 4.993916803090599e-05,
      "loss": 2.0804,
      "num_input_tokens_seen": 2054248992,
      "step": 2611
    },
    {
      "epoch": 0.27710587736049225,
      "grad_norm": 0.7344692597620786,
      "learning_rate": 4.993911956924844e-05,
      "loss": 2.1195,
      "num_input_tokens_seen": 2055035840,
      "step": 2612
    },
    {
      "epoch": 0.27721196690006367,
      "grad_norm": 0.5829302804409151,
      "learning_rate": 4.9939071088318674e-05,
      "loss": 2.1394,
      "num_input_tokens_seen": 2055822688,
      "step": 2613
    },
    {
      "epoch": 0.27731805643963503,
      "grad_norm": 1.0077965103658781,
      "learning_rate": 4.9939022588116725e-05,
      "loss": 2.1701,
      "num_input_tokens_seen": 2056609424,
      "step": 2614
    },
    {
      "epoch": 0.27742414597920645,
      "grad_norm": 0.6541524343642594,
      "learning_rate": 4.993897406864263e-05,
      "loss": 2.1295,
      "num_input_tokens_seen": 2057396144,
      "step": 2615
    },
    {
      "epoch": 0.27753023551877787,
      "grad_norm": 0.5934307882231751,
      "learning_rate": 4.9938925529896425e-05,
      "loss": 2.1947,
      "num_input_tokens_seen": 2058182912,
      "step": 2616
    },
    {
      "epoch": 0.27763632505834923,
      "grad_norm": 0.987813270233554,
      "learning_rate": 4.993887697187815e-05,
      "loss": 2.2176,
      "num_input_tokens_seen": 2058969632,
      "step": 2617
    },
    {
      "epoch": 0.27774241459792065,
      "grad_norm": 0.8887096750851717,
      "learning_rate": 4.9938828394587846e-05,
      "loss": 2.2612,
      "num_input_tokens_seen": 2059756400,
      "step": 2618
    },
    {
      "epoch": 0.27784850413749207,
      "grad_norm": 0.87733324379589,
      "learning_rate": 4.9938779798025545e-05,
      "loss": 2.2301,
      "num_input_tokens_seen": 2060543184,
      "step": 2619
    },
    {
      "epoch": 0.27795459367706343,
      "grad_norm": 0.750544422707185,
      "learning_rate": 4.9938731182191286e-05,
      "loss": 2.3251,
      "num_input_tokens_seen": 2061329920,
      "step": 2620
    },
    {
      "epoch": 0.27806068321663485,
      "grad_norm": 1.2069932167547126,
      "learning_rate": 4.993868254708512e-05,
      "loss": 2.245,
      "num_input_tokens_seen": 2062116688,
      "step": 2621
    },
    {
      "epoch": 0.2781667727562062,
      "grad_norm": 1.248342746337476,
      "learning_rate": 4.993863389270705e-05,
      "loss": 2.0817,
      "num_input_tokens_seen": 2062903456,
      "step": 2622
    },
    {
      "epoch": 0.27827286229577763,
      "grad_norm": 0.6027068871598574,
      "learning_rate": 4.993858521905714e-05,
      "loss": 2.2009,
      "num_input_tokens_seen": 2063690192,
      "step": 2623
    },
    {
      "epoch": 0.27837895183534905,
      "grad_norm": 0.7115875445376456,
      "learning_rate": 4.993853652613544e-05,
      "loss": 2.0607,
      "num_input_tokens_seen": 2064477040,
      "step": 2624
    },
    {
      "epoch": 0.2784850413749204,
      "grad_norm": 0.6522324814915677,
      "learning_rate": 4.993848781394196e-05,
      "loss": 2.1831,
      "num_input_tokens_seen": 2065263872,
      "step": 2625
    },
    {
      "epoch": 0.27859113091449184,
      "grad_norm": 0.6216176683914254,
      "learning_rate": 4.993843908247674e-05,
      "loss": 2.2117,
      "num_input_tokens_seen": 2066050656,
      "step": 2626
    },
    {
      "epoch": 0.27869722045406325,
      "grad_norm": 0.6238098431374013,
      "learning_rate": 4.993839033173984e-05,
      "loss": 2.1997,
      "num_input_tokens_seen": 2066837376,
      "step": 2627
    },
    {
      "epoch": 0.2788033099936346,
      "grad_norm": 0.8307864339734575,
      "learning_rate": 4.993834156173127e-05,
      "loss": 2.136,
      "num_input_tokens_seen": 2067624224,
      "step": 2628
    },
    {
      "epoch": 0.27890939953320604,
      "grad_norm": 0.8944930911853248,
      "learning_rate": 4.9938292772451094e-05,
      "loss": 2.0854,
      "num_input_tokens_seen": 2068410944,
      "step": 2629
    },
    {
      "epoch": 0.2790154890727774,
      "grad_norm": 0.9634576182723305,
      "learning_rate": 4.9938243963899337e-05,
      "loss": 2.1817,
      "num_input_tokens_seen": 2069197712,
      "step": 2630
    },
    {
      "epoch": 0.2791215786123488,
      "grad_norm": 0.9885819773393383,
      "learning_rate": 4.993819513607603e-05,
      "loss": 2.0768,
      "num_input_tokens_seen": 2069984528,
      "step": 2631
    },
    {
      "epoch": 0.27922766815192024,
      "grad_norm": 0.7235013051941429,
      "learning_rate": 4.993814628898122e-05,
      "loss": 2.1331,
      "num_input_tokens_seen": 2070771360,
      "step": 2632
    },
    {
      "epoch": 0.2793337576914916,
      "grad_norm": 0.8250565369546501,
      "learning_rate": 4.993809742261494e-05,
      "loss": 2.2444,
      "num_input_tokens_seen": 2071558064,
      "step": 2633
    },
    {
      "epoch": 0.279439847231063,
      "grad_norm": 0.6605023815563105,
      "learning_rate": 4.9938048536977235e-05,
      "loss": 1.9415,
      "num_input_tokens_seen": 2072344976,
      "step": 2634
    },
    {
      "epoch": 0.27954593677063444,
      "grad_norm": 0.9147168763151158,
      "learning_rate": 4.9937999632068134e-05,
      "loss": 2.0804,
      "num_input_tokens_seen": 2073131728,
      "step": 2635
    },
    {
      "epoch": 0.2796520263102058,
      "grad_norm": 0.8410958943469643,
      "learning_rate": 4.993795070788768e-05,
      "loss": 1.9975,
      "num_input_tokens_seen": 2073918560,
      "step": 2636
    },
    {
      "epoch": 0.2797581158497772,
      "grad_norm": 0.6931877989996984,
      "learning_rate": 4.99379017644359e-05,
      "loss": 2.2007,
      "num_input_tokens_seen": 2074705344,
      "step": 2637
    },
    {
      "epoch": 0.2798642053893486,
      "grad_norm": 1.1733521154884412,
      "learning_rate": 4.993785280171286e-05,
      "loss": 2.2937,
      "num_input_tokens_seen": 2075492016,
      "step": 2638
    },
    {
      "epoch": 0.27997029492892,
      "grad_norm": 1.823752475138647,
      "learning_rate": 4.9937803819718564e-05,
      "loss": 2.1432,
      "num_input_tokens_seen": 2076278784,
      "step": 2639
    },
    {
      "epoch": 0.2800763844684914,
      "grad_norm": 1.3796690001215575,
      "learning_rate": 4.993775481845307e-05,
      "loss": 2.2233,
      "num_input_tokens_seen": 2077065488,
      "step": 2640
    },
    {
      "epoch": 0.2801824740080628,
      "grad_norm": 1.211047102654634,
      "learning_rate": 4.9937705797916415e-05,
      "loss": 2.1196,
      "num_input_tokens_seen": 2077852272,
      "step": 2641
    },
    {
      "epoch": 0.2802885635476342,
      "grad_norm": 0.9991891936483426,
      "learning_rate": 4.9937656758108624e-05,
      "loss": 2.3627,
      "num_input_tokens_seen": 2078638992,
      "step": 2642
    },
    {
      "epoch": 0.2803946530872056,
      "grad_norm": 1.0204537982206248,
      "learning_rate": 4.993760769902975e-05,
      "loss": 2.0882,
      "num_input_tokens_seen": 2079425760,
      "step": 2643
    },
    {
      "epoch": 0.280500742626777,
      "grad_norm": 1.0143649032890707,
      "learning_rate": 4.9937558620679824e-05,
      "loss": 2.0685,
      "num_input_tokens_seen": 2080212528,
      "step": 2644
    },
    {
      "epoch": 0.2806068321663484,
      "grad_norm": 1.349437041274349,
      "learning_rate": 4.9937509523058876e-05,
      "loss": 2.2055,
      "num_input_tokens_seen": 2080999216,
      "step": 2645
    },
    {
      "epoch": 0.28071292170591977,
      "grad_norm": 1.1334949382451112,
      "learning_rate": 4.993746040616697e-05,
      "loss": 2.2898,
      "num_input_tokens_seen": 2081785888,
      "step": 2646
    },
    {
      "epoch": 0.2808190112454912,
      "grad_norm": 1.5123438656496946,
      "learning_rate": 4.993741127000411e-05,
      "loss": 2.2937,
      "num_input_tokens_seen": 2082572528,
      "step": 2647
    },
    {
      "epoch": 0.2809251007850626,
      "grad_norm": 1.1642502505738153,
      "learning_rate": 4.993736211457035e-05,
      "loss": 2.2844,
      "num_input_tokens_seen": 2083359328,
      "step": 2648
    },
    {
      "epoch": 0.281031190324634,
      "grad_norm": 0.8708398112176446,
      "learning_rate": 4.9937312939865746e-05,
      "loss": 2.2512,
      "num_input_tokens_seen": 2084146016,
      "step": 2649
    },
    {
      "epoch": 0.2811372798642054,
      "grad_norm": 1.311889941880598,
      "learning_rate": 4.99372637458903e-05,
      "loss": 2.3717,
      "num_input_tokens_seen": 2084932784,
      "step": 2650
    },
    {
      "epoch": 0.2812433694037768,
      "grad_norm": 1.084844029720021,
      "learning_rate": 4.993721453264407e-05,
      "loss": 2.2579,
      "num_input_tokens_seen": 2085719552,
      "step": 2651
    },
    {
      "epoch": 0.2813494589433482,
      "grad_norm": 0.9726435808760207,
      "learning_rate": 4.99371653001271e-05,
      "loss": 2.1832,
      "num_input_tokens_seen": 2086506240,
      "step": 2652
    },
    {
      "epoch": 0.2814555484829196,
      "grad_norm": 0.8595234291652589,
      "learning_rate": 4.9937116048339415e-05,
      "loss": 2.2477,
      "num_input_tokens_seen": 2087292992,
      "step": 2653
    },
    {
      "epoch": 0.28156163802249096,
      "grad_norm": 0.6800814751026475,
      "learning_rate": 4.9937066777281065e-05,
      "loss": 2.4049,
      "num_input_tokens_seen": 2088079824,
      "step": 2654
    },
    {
      "epoch": 0.2816677275620624,
      "grad_norm": 0.730716981209126,
      "learning_rate": 4.993701748695208e-05,
      "loss": 2.0428,
      "num_input_tokens_seen": 2088866608,
      "step": 2655
    },
    {
      "epoch": 0.2817738171016338,
      "grad_norm": 0.8585183759973671,
      "learning_rate": 4.9936968177352496e-05,
      "loss": 2.2771,
      "num_input_tokens_seen": 2089653296,
      "step": 2656
    },
    {
      "epoch": 0.28187990664120516,
      "grad_norm": 0.6959220274022722,
      "learning_rate": 4.993691884848235e-05,
      "loss": 2.1118,
      "num_input_tokens_seen": 2090440096,
      "step": 2657
    },
    {
      "epoch": 0.2819859961807766,
      "grad_norm": 0.817913963172474,
      "learning_rate": 4.993686950034169e-05,
      "loss": 2.0951,
      "num_input_tokens_seen": 2091226896,
      "step": 2658
    },
    {
      "epoch": 0.282092085720348,
      "grad_norm": 0.8062485027023889,
      "learning_rate": 4.993682013293055e-05,
      "loss": 2.2904,
      "num_input_tokens_seen": 2092013632,
      "step": 2659
    },
    {
      "epoch": 0.28219817525991936,
      "grad_norm": 1.197675768412827,
      "learning_rate": 4.993677074624897e-05,
      "loss": 2.1429,
      "num_input_tokens_seen": 2092800352,
      "step": 2660
    },
    {
      "epoch": 0.2823042647994908,
      "grad_norm": 1.1738979347206742,
      "learning_rate": 4.993672134029698e-05,
      "loss": 2.1898,
      "num_input_tokens_seen": 2093587072,
      "step": 2661
    },
    {
      "epoch": 0.28241035433906214,
      "grad_norm": 0.8812290039199737,
      "learning_rate": 4.993667191507463e-05,
      "loss": 2.2186,
      "num_input_tokens_seen": 2094373824,
      "step": 2662
    },
    {
      "epoch": 0.28251644387863356,
      "grad_norm": 0.7382269717924654,
      "learning_rate": 4.993662247058194e-05,
      "loss": 2.0336,
      "num_input_tokens_seen": 2095160656,
      "step": 2663
    },
    {
      "epoch": 0.282622533418205,
      "grad_norm": 0.9039109236679141,
      "learning_rate": 4.993657300681897e-05,
      "loss": 2.2616,
      "num_input_tokens_seen": 2095947456,
      "step": 2664
    },
    {
      "epoch": 0.28272862295777634,
      "grad_norm": 0.8120328820099403,
      "learning_rate": 4.993652352378574e-05,
      "loss": 2.1573,
      "num_input_tokens_seen": 2096734272,
      "step": 2665
    },
    {
      "epoch": 0.28283471249734776,
      "grad_norm": 0.9164270925365627,
      "learning_rate": 4.99364740214823e-05,
      "loss": 2.1181,
      "num_input_tokens_seen": 2097520960,
      "step": 2666
    },
    {
      "epoch": 0.2829408020369192,
      "grad_norm": 0.7764052654531679,
      "learning_rate": 4.993642449990869e-05,
      "loss": 2.139,
      "num_input_tokens_seen": 2098307760,
      "step": 2667
    },
    {
      "epoch": 0.28304689157649054,
      "grad_norm": 0.8743218608368692,
      "learning_rate": 4.9936374959064934e-05,
      "loss": 2.1916,
      "num_input_tokens_seen": 2099094544,
      "step": 2668
    },
    {
      "epoch": 0.28315298111606196,
      "grad_norm": 0.9765018925297194,
      "learning_rate": 4.993632539895109e-05,
      "loss": 2.1976,
      "num_input_tokens_seen": 2099881328,
      "step": 2669
    },
    {
      "epoch": 0.2832590706556333,
      "grad_norm": 1.4437437195408074,
      "learning_rate": 4.993627581956718e-05,
      "loss": 2.0902,
      "num_input_tokens_seen": 2100668080,
      "step": 2670
    },
    {
      "epoch": 0.28336516019520475,
      "grad_norm": 0.7987814170862666,
      "learning_rate": 4.993622622091324e-05,
      "loss": 2.156,
      "num_input_tokens_seen": 2101454896,
      "step": 2671
    },
    {
      "epoch": 0.28347124973477617,
      "grad_norm": 0.7327824515206272,
      "learning_rate": 4.9936176602989324e-05,
      "loss": 2.1844,
      "num_input_tokens_seen": 2102241712,
      "step": 2672
    },
    {
      "epoch": 0.28357733927434753,
      "grad_norm": 0.8395352783901104,
      "learning_rate": 4.993612696579546e-05,
      "loss": 2.1908,
      "num_input_tokens_seen": 2103028432,
      "step": 2673
    },
    {
      "epoch": 0.28368342881391895,
      "grad_norm": 0.5202983526774756,
      "learning_rate": 4.99360773093317e-05,
      "loss": 2.14,
      "num_input_tokens_seen": 2103815232,
      "step": 2674
    },
    {
      "epoch": 0.28378951835349037,
      "grad_norm": 1.0050595682116803,
      "learning_rate": 4.993602763359805e-05,
      "loss": 2.052,
      "num_input_tokens_seen": 2104602080,
      "step": 2675
    },
    {
      "epoch": 0.28389560789306173,
      "grad_norm": 0.8300677846888206,
      "learning_rate": 4.993597793859459e-05,
      "loss": 2.0528,
      "num_input_tokens_seen": 2105388768,
      "step": 2676
    },
    {
      "epoch": 0.28400169743263315,
      "grad_norm": 0.7545256787681017,
      "learning_rate": 4.993592822432133e-05,
      "loss": 2.1834,
      "num_input_tokens_seen": 2106175520,
      "step": 2677
    },
    {
      "epoch": 0.28410778697220457,
      "grad_norm": 0.8735789454311159,
      "learning_rate": 4.993587849077831e-05,
      "loss": 2.3089,
      "num_input_tokens_seen": 2106962240,
      "step": 2678
    },
    {
      "epoch": 0.28421387651177593,
      "grad_norm": 0.8636071198706002,
      "learning_rate": 4.993582873796557e-05,
      "loss": 2.1468,
      "num_input_tokens_seen": 2107748976,
      "step": 2679
    },
    {
      "epoch": 0.28431996605134735,
      "grad_norm": 1.2352373264820415,
      "learning_rate": 4.993577896588317e-05,
      "loss": 2.2597,
      "num_input_tokens_seen": 2108535776,
      "step": 2680
    },
    {
      "epoch": 0.2844260555909187,
      "grad_norm": 0.7170223594301529,
      "learning_rate": 4.993572917453112e-05,
      "loss": 2.1215,
      "num_input_tokens_seen": 2109322608,
      "step": 2681
    },
    {
      "epoch": 0.28453214513049013,
      "grad_norm": 0.6752152087571548,
      "learning_rate": 4.9935679363909484e-05,
      "loss": 2.2186,
      "num_input_tokens_seen": 2110109440,
      "step": 2682
    },
    {
      "epoch": 0.28463823467006155,
      "grad_norm": 0.9675083186230125,
      "learning_rate": 4.993562953401827e-05,
      "loss": 2.1816,
      "num_input_tokens_seen": 2110896208,
      "step": 2683
    },
    {
      "epoch": 0.2847443242096329,
      "grad_norm": 0.9152621645547577,
      "learning_rate": 4.9935579684857545e-05,
      "loss": 2.1744,
      "num_input_tokens_seen": 2111682992,
      "step": 2684
    },
    {
      "epoch": 0.28485041374920433,
      "grad_norm": 0.6742377410732278,
      "learning_rate": 4.993552981642733e-05,
      "loss": 2.246,
      "num_input_tokens_seen": 2112469776,
      "step": 2685
    },
    {
      "epoch": 0.28495650328877575,
      "grad_norm": 0.9855219312081807,
      "learning_rate": 4.993547992872767e-05,
      "loss": 2.326,
      "num_input_tokens_seen": 2113256528,
      "step": 2686
    },
    {
      "epoch": 0.2850625928283471,
      "grad_norm": 1.0126587997234207,
      "learning_rate": 4.99354300217586e-05,
      "loss": 2.142,
      "num_input_tokens_seen": 2114043152,
      "step": 2687
    },
    {
      "epoch": 0.28516868236791854,
      "grad_norm": 0.49593931444585276,
      "learning_rate": 4.9935380095520165e-05,
      "loss": 2.1172,
      "num_input_tokens_seen": 2114830032,
      "step": 2688
    },
    {
      "epoch": 0.2852747719074899,
      "grad_norm": 0.8504774502826401,
      "learning_rate": 4.99353301500124e-05,
      "loss": 2.2074,
      "num_input_tokens_seen": 2115616800,
      "step": 2689
    },
    {
      "epoch": 0.2853808614470613,
      "grad_norm": 0.6901038917600997,
      "learning_rate": 4.9935280185235346e-05,
      "loss": 2.2534,
      "num_input_tokens_seen": 2116403632,
      "step": 2690
    },
    {
      "epoch": 0.28548695098663274,
      "grad_norm": 0.7554889610175827,
      "learning_rate": 4.993523020118903e-05,
      "loss": 1.9638,
      "num_input_tokens_seen": 2117190400,
      "step": 2691
    },
    {
      "epoch": 0.2855930405262041,
      "grad_norm": 0.8691756440413959,
      "learning_rate": 4.993518019787351e-05,
      "loss": 1.9936,
      "num_input_tokens_seen": 2117977184,
      "step": 2692
    },
    {
      "epoch": 0.2856991300657755,
      "grad_norm": 0.7879017898194173,
      "learning_rate": 4.9935130175288804e-05,
      "loss": 2.1424,
      "num_input_tokens_seen": 2118763872,
      "step": 2693
    },
    {
      "epoch": 0.28580521960534694,
      "grad_norm": 0.8533625526992216,
      "learning_rate": 4.993508013343497e-05,
      "loss": 2.3221,
      "num_input_tokens_seen": 2119550544,
      "step": 2694
    },
    {
      "epoch": 0.2859113091449183,
      "grad_norm": 1.266675657179206,
      "learning_rate": 4.9935030072312034e-05,
      "loss": 2.176,
      "num_input_tokens_seen": 2120337232,
      "step": 2695
    },
    {
      "epoch": 0.2860173986844897,
      "grad_norm": 1.1112263688823618,
      "learning_rate": 4.993497999192004e-05,
      "loss": 2.1351,
      "num_input_tokens_seen": 2121123968,
      "step": 2696
    },
    {
      "epoch": 0.2861234882240611,
      "grad_norm": 0.9198212679035521,
      "learning_rate": 4.993492989225902e-05,
      "loss": 2.1155,
      "num_input_tokens_seen": 2121910784,
      "step": 2697
    },
    {
      "epoch": 0.2862295777636325,
      "grad_norm": 0.6310220692576998,
      "learning_rate": 4.9934879773329024e-05,
      "loss": 1.9055,
      "num_input_tokens_seen": 2122697504,
      "step": 2698
    },
    {
      "epoch": 0.2863356673032039,
      "grad_norm": 0.6002202466194978,
      "learning_rate": 4.9934829635130086e-05,
      "loss": 2.0873,
      "num_input_tokens_seen": 2123484272,
      "step": 2699
    },
    {
      "epoch": 0.2864417568427753,
      "grad_norm": 0.931606967638733,
      "learning_rate": 4.993477947766223e-05,
      "loss": 2.1413,
      "num_input_tokens_seen": 2124270960,
      "step": 2700
    },
    {
      "epoch": 0.2865478463823467,
      "grad_norm": 0.8610653527466962,
      "learning_rate": 4.9934729300925525e-05,
      "loss": 2.2382,
      "num_input_tokens_seen": 2125057744,
      "step": 2701
    },
    {
      "epoch": 0.2866539359219181,
      "grad_norm": 0.7873244422691501,
      "learning_rate": 4.993467910491998e-05,
      "loss": 2.2187,
      "num_input_tokens_seen": 2125844480,
      "step": 2702
    },
    {
      "epoch": 0.2867600254614895,
      "grad_norm": 1.1975710331826825,
      "learning_rate": 4.9934628889645655e-05,
      "loss": 2.1507,
      "num_input_tokens_seen": 2126631264,
      "step": 2703
    },
    {
      "epoch": 0.2868661150010609,
      "grad_norm": 1.037371651577141,
      "learning_rate": 4.993457865510258e-05,
      "loss": 2.1166,
      "num_input_tokens_seen": 2127418096,
      "step": 2704
    },
    {
      "epoch": 0.28697220454063227,
      "grad_norm": 1.1887788396799908,
      "learning_rate": 4.9934528401290794e-05,
      "loss": 2.2233,
      "num_input_tokens_seen": 2128204768,
      "step": 2705
    },
    {
      "epoch": 0.2870782940802037,
      "grad_norm": 0.7602860070013844,
      "learning_rate": 4.993447812821033e-05,
      "loss": 2.2003,
      "num_input_tokens_seen": 2128991520,
      "step": 2706
    },
    {
      "epoch": 0.2871843836197751,
      "grad_norm": 1.623530911051249,
      "learning_rate": 4.993442783586124e-05,
      "loss": 2.2919,
      "num_input_tokens_seen": 2129778272,
      "step": 2707
    },
    {
      "epoch": 0.28729047315934647,
      "grad_norm": 0.8022700044568049,
      "learning_rate": 4.9934377524243556e-05,
      "loss": 2.2263,
      "num_input_tokens_seen": 2130565008,
      "step": 2708
    },
    {
      "epoch": 0.2873965626989179,
      "grad_norm": 1.952733407707084,
      "learning_rate": 4.993432719335731e-05,
      "loss": 2.1377,
      "num_input_tokens_seen": 2131351712,
      "step": 2709
    },
    {
      "epoch": 0.2875026522384893,
      "grad_norm": 1.2656465576488651,
      "learning_rate": 4.993427684320255e-05,
      "loss": 2.2748,
      "num_input_tokens_seen": 2132138352,
      "step": 2710
    },
    {
      "epoch": 0.2876087417780607,
      "grad_norm": 2.5984199444957774,
      "learning_rate": 4.993422647377931e-05,
      "loss": 2.0296,
      "num_input_tokens_seen": 2132925168,
      "step": 2711
    },
    {
      "epoch": 0.2877148313176321,
      "grad_norm": 2.4127528633657818,
      "learning_rate": 4.993417608508764e-05,
      "loss": 2.2409,
      "num_input_tokens_seen": 2133711952,
      "step": 2712
    },
    {
      "epoch": 0.28782092085720345,
      "grad_norm": 0.8078193859630405,
      "learning_rate": 4.9934125677127566e-05,
      "loss": 2.0105,
      "num_input_tokens_seen": 2134498704,
      "step": 2713
    },
    {
      "epoch": 0.2879270103967749,
      "grad_norm": 3.407617454771117,
      "learning_rate": 4.9934075249899126e-05,
      "loss": 2.1293,
      "num_input_tokens_seen": 2135285488,
      "step": 2714
    },
    {
      "epoch": 0.2880330999363463,
      "grad_norm": 1.0155519705622884,
      "learning_rate": 4.993402480340237e-05,
      "loss": 2.1378,
      "num_input_tokens_seen": 2136072192,
      "step": 2715
    },
    {
      "epoch": 0.28813918947591766,
      "grad_norm": 1.4304729451571756,
      "learning_rate": 4.993397433763733e-05,
      "loss": 2.1289,
      "num_input_tokens_seen": 2136859040,
      "step": 2716
    },
    {
      "epoch": 0.2882452790154891,
      "grad_norm": 1.17955399007059,
      "learning_rate": 4.993392385260405e-05,
      "loss": 2.2707,
      "num_input_tokens_seen": 2137645776,
      "step": 2717
    },
    {
      "epoch": 0.2883513685550605,
      "grad_norm": 1.5147031295148916,
      "learning_rate": 4.9933873348302556e-05,
      "loss": 2.2075,
      "num_input_tokens_seen": 2138432480,
      "step": 2718
    },
    {
      "epoch": 0.28845745809463186,
      "grad_norm": 1.1034816707652697,
      "learning_rate": 4.99338228247329e-05,
      "loss": 2.1939,
      "num_input_tokens_seen": 2139219248,
      "step": 2719
    },
    {
      "epoch": 0.2885635476342033,
      "grad_norm": 1.415538610267398,
      "learning_rate": 4.993377228189512e-05,
      "loss": 2.2388,
      "num_input_tokens_seen": 2140006032,
      "step": 2720
    },
    {
      "epoch": 0.28866963717377464,
      "grad_norm": 0.8967480107240308,
      "learning_rate": 4.993372171978925e-05,
      "loss": 1.9849,
      "num_input_tokens_seen": 2140792864,
      "step": 2721
    },
    {
      "epoch": 0.28877572671334606,
      "grad_norm": 1.293966879233416,
      "learning_rate": 4.993367113841534e-05,
      "loss": 2.1914,
      "num_input_tokens_seen": 2141579664,
      "step": 2722
    },
    {
      "epoch": 0.2888818162529175,
      "grad_norm": 1.0300416367674392,
      "learning_rate": 4.9933620537773406e-05,
      "loss": 2.2388,
      "num_input_tokens_seen": 2142366448,
      "step": 2723
    },
    {
      "epoch": 0.28898790579248884,
      "grad_norm": 1.2215345812065572,
      "learning_rate": 4.993356991786351e-05,
      "loss": 2.325,
      "num_input_tokens_seen": 2143153200,
      "step": 2724
    },
    {
      "epoch": 0.28909399533206026,
      "grad_norm": 0.9069253132380807,
      "learning_rate": 4.993351927868568e-05,
      "loss": 2.1602,
      "num_input_tokens_seen": 2143940032,
      "step": 2725
    },
    {
      "epoch": 0.2892000848716317,
      "grad_norm": 1.1992746438279966,
      "learning_rate": 4.993346862023996e-05,
      "loss": 2.3132,
      "num_input_tokens_seen": 2144726736,
      "step": 2726
    },
    {
      "epoch": 0.28930617441120304,
      "grad_norm": 1.3186756848345866,
      "learning_rate": 4.99334179425264e-05,
      "loss": 2.0674,
      "num_input_tokens_seen": 2145513504,
      "step": 2727
    },
    {
      "epoch": 0.28941226395077446,
      "grad_norm": 1.6175042129361503,
      "learning_rate": 4.993336724554501e-05,
      "loss": 2.2006,
      "num_input_tokens_seen": 2146300368,
      "step": 2728
    },
    {
      "epoch": 0.2895183534903458,
      "grad_norm": 1.5751798270088722,
      "learning_rate": 4.993331652929584e-05,
      "loss": 2.371,
      "num_input_tokens_seen": 2147087104,
      "step": 2729
    },
    {
      "epoch": 0.28962444302991724,
      "grad_norm": 2.001746322565524,
      "learning_rate": 4.9933265793778945e-05,
      "loss": 2.1702,
      "num_input_tokens_seen": 2147873696,
      "step": 2730
    },
    {
      "epoch": 0.28973053256948866,
      "grad_norm": 1.3636483839064002,
      "learning_rate": 4.9933215038994354e-05,
      "loss": 2.1509,
      "num_input_tokens_seen": 2148660368,
      "step": 2731
    },
    {
      "epoch": 0.28983662210906,
      "grad_norm": 2.360050594120092,
      "learning_rate": 4.99331642649421e-05,
      "loss": 2.1342,
      "num_input_tokens_seen": 2149447072,
      "step": 2732
    },
    {
      "epoch": 0.28994271164863145,
      "grad_norm": 1.4958028577847045,
      "learning_rate": 4.993311347162223e-05,
      "loss": 2.1768,
      "num_input_tokens_seen": 2150233856,
      "step": 2733
    },
    {
      "epoch": 0.29004880118820286,
      "grad_norm": 0.8690393956960207,
      "learning_rate": 4.993306265903479e-05,
      "loss": 2.1448,
      "num_input_tokens_seen": 2151020592,
      "step": 2734
    },
    {
      "epoch": 0.29015489072777423,
      "grad_norm": 1.2810076209696408,
      "learning_rate": 4.99330118271798e-05,
      "loss": 2.1378,
      "num_input_tokens_seen": 2151807408,
      "step": 2735
    },
    {
      "epoch": 0.29026098026734565,
      "grad_norm": 0.7436546560623105,
      "learning_rate": 4.993296097605732e-05,
      "loss": 2.0357,
      "num_input_tokens_seen": 2152594240,
      "step": 2736
    },
    {
      "epoch": 0.290367069806917,
      "grad_norm": 1.4453518450377372,
      "learning_rate": 4.993291010566737e-05,
      "loss": 2.2733,
      "num_input_tokens_seen": 2153380992,
      "step": 2737
    },
    {
      "epoch": 0.29047315934648843,
      "grad_norm": 1.105664462003437,
      "learning_rate": 4.9932859216009995e-05,
      "loss": 2.0104,
      "num_input_tokens_seen": 2154167744,
      "step": 2738
    },
    {
      "epoch": 0.29057924888605985,
      "grad_norm": 0.907745290250524,
      "learning_rate": 4.9932808307085255e-05,
      "loss": 1.9537,
      "num_input_tokens_seen": 2154954528,
      "step": 2739
    },
    {
      "epoch": 0.2906853384256312,
      "grad_norm": 1.2893351669798663,
      "learning_rate": 4.993275737889316e-05,
      "loss": 2.1274,
      "num_input_tokens_seen": 2155741376,
      "step": 2740
    },
    {
      "epoch": 0.29079142796520263,
      "grad_norm": 0.8361990185048175,
      "learning_rate": 4.9932706431433765e-05,
      "loss": 2.082,
      "num_input_tokens_seen": 2156528096,
      "step": 2741
    },
    {
      "epoch": 0.29089751750477405,
      "grad_norm": 1.0310805319208651,
      "learning_rate": 4.9932655464707104e-05,
      "loss": 2.1244,
      "num_input_tokens_seen": 2157314880,
      "step": 2742
    },
    {
      "epoch": 0.2910036070443454,
      "grad_norm": 0.6165686185417687,
      "learning_rate": 4.993260447871322e-05,
      "loss": 2.2272,
      "num_input_tokens_seen": 2158101616,
      "step": 2743
    },
    {
      "epoch": 0.29110969658391683,
      "grad_norm": 1.3966575278561466,
      "learning_rate": 4.993255347345215e-05,
      "loss": 2.2255,
      "num_input_tokens_seen": 2158888384,
      "step": 2744
    },
    {
      "epoch": 0.29121578612348825,
      "grad_norm": 1.088039101829461,
      "learning_rate": 4.9932502448923934e-05,
      "loss": 2.2228,
      "num_input_tokens_seen": 2159675120,
      "step": 2745
    },
    {
      "epoch": 0.2913218756630596,
      "grad_norm": 0.4404323333778435,
      "learning_rate": 4.993245140512861e-05,
      "loss": 1.8312,
      "num_input_tokens_seen": 2160462000,
      "step": 2746
    },
    {
      "epoch": 0.29142796520263103,
      "grad_norm": 0.9375271623683767,
      "learning_rate": 4.993240034206622e-05,
      "loss": 2.1022,
      "num_input_tokens_seen": 2161248736,
      "step": 2747
    },
    {
      "epoch": 0.2915340547422024,
      "grad_norm": 0.8288536087583477,
      "learning_rate": 4.993234925973681e-05,
      "loss": 2.3569,
      "num_input_tokens_seen": 2162035424,
      "step": 2748
    },
    {
      "epoch": 0.2916401442817738,
      "grad_norm": 0.8059752302437355,
      "learning_rate": 4.99322981581404e-05,
      "loss": 2.3368,
      "num_input_tokens_seen": 2162822096,
      "step": 2749
    },
    {
      "epoch": 0.29174623382134524,
      "grad_norm": 0.5811702923122677,
      "learning_rate": 4.9932247037277044e-05,
      "loss": 2.054,
      "num_input_tokens_seen": 2163608944,
      "step": 2750
    },
    {
      "epoch": 0.2918523233609166,
      "grad_norm": 0.8936933056163122,
      "learning_rate": 4.993219589714679e-05,
      "loss": 2.2557,
      "num_input_tokens_seen": 2164395648,
      "step": 2751
    },
    {
      "epoch": 0.291958412900488,
      "grad_norm": 0.7852032347681424,
      "learning_rate": 4.993214473774966e-05,
      "loss": 2.1136,
      "num_input_tokens_seen": 2165182464,
      "step": 2752
    },
    {
      "epoch": 0.29206450244005944,
      "grad_norm": 0.6504340347016639,
      "learning_rate": 4.99320935590857e-05,
      "loss": 2.2514,
      "num_input_tokens_seen": 2165969216,
      "step": 2753
    },
    {
      "epoch": 0.2921705919796308,
      "grad_norm": 0.67345815442253,
      "learning_rate": 4.9932042361154944e-05,
      "loss": 2.1937,
      "num_input_tokens_seen": 2166755920,
      "step": 2754
    },
    {
      "epoch": 0.2922766815192022,
      "grad_norm": 0.5594857639641821,
      "learning_rate": 4.993199114395745e-05,
      "loss": 2.1904,
      "num_input_tokens_seen": 2167542704,
      "step": 2755
    },
    {
      "epoch": 0.2923827710587736,
      "grad_norm": 0.7174197207973695,
      "learning_rate": 4.993193990749323e-05,
      "loss": 2.1483,
      "num_input_tokens_seen": 2168329440,
      "step": 2756
    },
    {
      "epoch": 0.292488860598345,
      "grad_norm": 0.7990349901183654,
      "learning_rate": 4.993188865176235e-05,
      "loss": 2.1402,
      "num_input_tokens_seen": 2169116224,
      "step": 2757
    },
    {
      "epoch": 0.2925949501379164,
      "grad_norm": 0.8252937568731803,
      "learning_rate": 4.993183737676483e-05,
      "loss": 2.2496,
      "num_input_tokens_seen": 2169902864,
      "step": 2758
    },
    {
      "epoch": 0.2927010396774878,
      "grad_norm": 0.7197973526360608,
      "learning_rate": 4.993178608250072e-05,
      "loss": 2.2534,
      "num_input_tokens_seen": 2170689664,
      "step": 2759
    },
    {
      "epoch": 0.2928071292170592,
      "grad_norm": 0.6092499146800122,
      "learning_rate": 4.993173476897006e-05,
      "loss": 1.8821,
      "num_input_tokens_seen": 2171476512,
      "step": 2760
    },
    {
      "epoch": 0.2929132187566306,
      "grad_norm": 0.6223644259147775,
      "learning_rate": 4.993168343617288e-05,
      "loss": 2.0692,
      "num_input_tokens_seen": 2172263312,
      "step": 2761
    },
    {
      "epoch": 0.293019308296202,
      "grad_norm": 0.5876206614991804,
      "learning_rate": 4.9931632084109236e-05,
      "loss": 2.2219,
      "num_input_tokens_seen": 2173050144,
      "step": 2762
    },
    {
      "epoch": 0.2931253978357734,
      "grad_norm": 0.6170145741336883,
      "learning_rate": 4.993158071277916e-05,
      "loss": 2.1599,
      "num_input_tokens_seen": 2173836912,
      "step": 2763
    },
    {
      "epoch": 0.29323148737534477,
      "grad_norm": 0.559229260506414,
      "learning_rate": 4.993152932218268e-05,
      "loss": 2.1114,
      "num_input_tokens_seen": 2174623616,
      "step": 2764
    },
    {
      "epoch": 0.2933375769149162,
      "grad_norm": 0.621566173338053,
      "learning_rate": 4.9931477912319846e-05,
      "loss": 2.2337,
      "num_input_tokens_seen": 2175410304,
      "step": 2765
    },
    {
      "epoch": 0.2934436664544876,
      "grad_norm": 0.5896838138174432,
      "learning_rate": 4.99314264831907e-05,
      "loss": 2.2482,
      "num_input_tokens_seen": 2176197120,
      "step": 2766
    },
    {
      "epoch": 0.29354975599405897,
      "grad_norm": 1.106623401003823,
      "learning_rate": 4.993137503479528e-05,
      "loss": 2.3649,
      "num_input_tokens_seen": 2176983824,
      "step": 2767
    },
    {
      "epoch": 0.2936558455336304,
      "grad_norm": 1.47929973579789,
      "learning_rate": 4.9931323567133624e-05,
      "loss": 2.0978,
      "num_input_tokens_seen": 2177770576,
      "step": 2768
    },
    {
      "epoch": 0.2937619350732018,
      "grad_norm": 0.9192312866949947,
      "learning_rate": 4.993127208020578e-05,
      "loss": 2.1121,
      "num_input_tokens_seen": 2178557344,
      "step": 2769
    },
    {
      "epoch": 0.29386802461277317,
      "grad_norm": 2.9267504069151555,
      "learning_rate": 4.9931220574011774e-05,
      "loss": 2.2765,
      "num_input_tokens_seen": 2179344128,
      "step": 2770
    },
    {
      "epoch": 0.2939741141523446,
      "grad_norm": 1.6891348777123418,
      "learning_rate": 4.993116904855165e-05,
      "loss": 2.117,
      "num_input_tokens_seen": 2180130928,
      "step": 2771
    },
    {
      "epoch": 0.29408020369191595,
      "grad_norm": 1.564125202398628,
      "learning_rate": 4.993111750382545e-05,
      "loss": 2.0925,
      "num_input_tokens_seen": 2180917648,
      "step": 2772
    },
    {
      "epoch": 0.2941862932314874,
      "grad_norm": 1.3824225891316329,
      "learning_rate": 4.9931065939833224e-05,
      "loss": 2.0904,
      "num_input_tokens_seen": 2181704400,
      "step": 2773
    },
    {
      "epoch": 0.2942923827710588,
      "grad_norm": 1.245194802573995,
      "learning_rate": 4.993101435657499e-05,
      "loss": 2.0561,
      "num_input_tokens_seen": 2182491216,
      "step": 2774
    },
    {
      "epoch": 0.29439847231063015,
      "grad_norm": 0.7713639145867314,
      "learning_rate": 4.99309627540508e-05,
      "loss": 2.2635,
      "num_input_tokens_seen": 2183277968,
      "step": 2775
    },
    {
      "epoch": 0.2945045618502016,
      "grad_norm": 0.8379972259419444,
      "learning_rate": 4.99309111322607e-05,
      "loss": 2.0696,
      "num_input_tokens_seen": 2184064720,
      "step": 2776
    },
    {
      "epoch": 0.294610651389773,
      "grad_norm": 0.6969259022659524,
      "learning_rate": 4.993085949120472e-05,
      "loss": 2.2263,
      "num_input_tokens_seen": 2184851392,
      "step": 2777
    },
    {
      "epoch": 0.29471674092934436,
      "grad_norm": 0.4602048057421298,
      "learning_rate": 4.993080783088291e-05,
      "loss": 2.1228,
      "num_input_tokens_seen": 2185638224,
      "step": 2778
    },
    {
      "epoch": 0.2948228304689158,
      "grad_norm": 0.6691768584180754,
      "learning_rate": 4.9930756151295296e-05,
      "loss": 2.2088,
      "num_input_tokens_seen": 2186425008,
      "step": 2779
    },
    {
      "epoch": 0.29492892000848714,
      "grad_norm": 0.471721579790782,
      "learning_rate": 4.993070445244192e-05,
      "loss": 2.1966,
      "num_input_tokens_seen": 2187211840,
      "step": 2780
    },
    {
      "epoch": 0.29503500954805856,
      "grad_norm": 0.5749723226152478,
      "learning_rate": 4.9930652734322835e-05,
      "loss": 2.0631,
      "num_input_tokens_seen": 2187998592,
      "step": 2781
    },
    {
      "epoch": 0.29514109908763,
      "grad_norm": 0.5218591149923598,
      "learning_rate": 4.993060099693807e-05,
      "loss": 2.1733,
      "num_input_tokens_seen": 2188785392,
      "step": 2782
    },
    {
      "epoch": 0.29524718862720134,
      "grad_norm": 0.716476951155963,
      "learning_rate": 4.9930549240287675e-05,
      "loss": 2.1087,
      "num_input_tokens_seen": 2189572064,
      "step": 2783
    },
    {
      "epoch": 0.29535327816677276,
      "grad_norm": 1.1222948780267614,
      "learning_rate": 4.9930497464371676e-05,
      "loss": 2.2831,
      "num_input_tokens_seen": 2190358768,
      "step": 2784
    },
    {
      "epoch": 0.2954593677063442,
      "grad_norm": 0.6585919711784375,
      "learning_rate": 4.9930445669190115e-05,
      "loss": 2.133,
      "num_input_tokens_seen": 2191145536,
      "step": 2785
    },
    {
      "epoch": 0.29556545724591554,
      "grad_norm": 1.1002598264581156,
      "learning_rate": 4.9930393854743054e-05,
      "loss": 2.3316,
      "num_input_tokens_seen": 2191932304,
      "step": 2786
    },
    {
      "epoch": 0.29567154678548696,
      "grad_norm": 0.9455278085601749,
      "learning_rate": 4.99303420210305e-05,
      "loss": 2.2035,
      "num_input_tokens_seen": 2192719120,
      "step": 2787
    },
    {
      "epoch": 0.2957776363250583,
      "grad_norm": 1.0393415571486957,
      "learning_rate": 4.993029016805252e-05,
      "loss": 2.1155,
      "num_input_tokens_seen": 2193506016,
      "step": 2788
    },
    {
      "epoch": 0.29588372586462974,
      "grad_norm": 1.3047145412231123,
      "learning_rate": 4.993023829580914e-05,
      "loss": 2.2872,
      "num_input_tokens_seen": 2194292720,
      "step": 2789
    },
    {
      "epoch": 0.29598981540420116,
      "grad_norm": 0.8708267948613119,
      "learning_rate": 4.993018640430039e-05,
      "loss": 2.2298,
      "num_input_tokens_seen": 2195079440,
      "step": 2790
    },
    {
      "epoch": 0.2960959049437725,
      "grad_norm": 0.898413903404782,
      "learning_rate": 4.993013449352634e-05,
      "loss": 2.5093,
      "num_input_tokens_seen": 2195866144,
      "step": 2791
    },
    {
      "epoch": 0.29620199448334394,
      "grad_norm": 0.7951767130334133,
      "learning_rate": 4.993008256348701e-05,
      "loss": 2.1152,
      "num_input_tokens_seen": 2196652832,
      "step": 2792
    },
    {
      "epoch": 0.29630808402291536,
      "grad_norm": 1.1623764003197066,
      "learning_rate": 4.9930030614182445e-05,
      "loss": 2.1285,
      "num_input_tokens_seen": 2197439568,
      "step": 2793
    },
    {
      "epoch": 0.2964141735624867,
      "grad_norm": 1.2244151528092044,
      "learning_rate": 4.992997864561268e-05,
      "loss": 2.1896,
      "num_input_tokens_seen": 2198226336,
      "step": 2794
    },
    {
      "epoch": 0.29652026310205815,
      "grad_norm": 2.595011290332267,
      "learning_rate": 4.992992665777776e-05,
      "loss": 2.2365,
      "num_input_tokens_seen": 2199013056,
      "step": 2795
    },
    {
      "epoch": 0.2966263526416295,
      "grad_norm": 1.26906039204755,
      "learning_rate": 4.992987465067772e-05,
      "loss": 2.0851,
      "num_input_tokens_seen": 2199799760,
      "step": 2796
    },
    {
      "epoch": 0.29673244218120093,
      "grad_norm": 1.317606461593359,
      "learning_rate": 4.992982262431262e-05,
      "loss": 2.1621,
      "num_input_tokens_seen": 2200586512,
      "step": 2797
    },
    {
      "epoch": 0.29683853172077235,
      "grad_norm": 0.8919153893806278,
      "learning_rate": 4.992977057868247e-05,
      "loss": 2.0768,
      "num_input_tokens_seen": 2201373360,
      "step": 2798
    },
    {
      "epoch": 0.2969446212603437,
      "grad_norm": 1.3413932625399279,
      "learning_rate": 4.992971851378733e-05,
      "loss": 2.3121,
      "num_input_tokens_seen": 2202160016,
      "step": 2799
    },
    {
      "epoch": 0.29705071079991513,
      "grad_norm": 0.7387234185160232,
      "learning_rate": 4.992966642962723e-05,
      "loss": 2.2423,
      "num_input_tokens_seen": 2202946624,
      "step": 2800
    },
    {
      "epoch": 0.29715680033948655,
      "grad_norm": 1.3277592026081255,
      "learning_rate": 4.9929614326202216e-05,
      "loss": 2.2319,
      "num_input_tokens_seen": 2203733344,
      "step": 2801
    },
    {
      "epoch": 0.2972628898790579,
      "grad_norm": 0.6374002778600064,
      "learning_rate": 4.992956220351233e-05,
      "loss": 2.0212,
      "num_input_tokens_seen": 2204520032,
      "step": 2802
    },
    {
      "epoch": 0.29736897941862933,
      "grad_norm": 1.0693251985859245,
      "learning_rate": 4.992951006155761e-05,
      "loss": 2.2792,
      "num_input_tokens_seen": 2205306784,
      "step": 2803
    },
    {
      "epoch": 0.2974750689582007,
      "grad_norm": 0.6592972816808752,
      "learning_rate": 4.992945790033809e-05,
      "loss": 2.07,
      "num_input_tokens_seen": 2206093520,
      "step": 2804
    },
    {
      "epoch": 0.2975811584977721,
      "grad_norm": 0.6771163468848473,
      "learning_rate": 4.992940571985383e-05,
      "loss": 2.0073,
      "num_input_tokens_seen": 2206880320,
      "step": 2805
    },
    {
      "epoch": 0.29768724803734353,
      "grad_norm": 0.7479596349974659,
      "learning_rate": 4.992935352010485e-05,
      "loss": 1.9697,
      "num_input_tokens_seen": 2207667120,
      "step": 2806
    },
    {
      "epoch": 0.2977933375769149,
      "grad_norm": 0.5480958371005371,
      "learning_rate": 4.992930130109119e-05,
      "loss": 2.2502,
      "num_input_tokens_seen": 2208453840,
      "step": 2807
    },
    {
      "epoch": 0.2978994271164863,
      "grad_norm": 0.6317172743152665,
      "learning_rate": 4.992924906281291e-05,
      "loss": 2.1896,
      "num_input_tokens_seen": 2209240544,
      "step": 2808
    },
    {
      "epoch": 0.29800551665605773,
      "grad_norm": 0.597185110081487,
      "learning_rate": 4.992919680527003e-05,
      "loss": 1.9711,
      "num_input_tokens_seen": 2210027392,
      "step": 2809
    },
    {
      "epoch": 0.2981116061956291,
      "grad_norm": 0.6013770654152457,
      "learning_rate": 4.99291445284626e-05,
      "loss": 2.2152,
      "num_input_tokens_seen": 2210814128,
      "step": 2810
    },
    {
      "epoch": 0.2982176957352005,
      "grad_norm": 0.5963960647095674,
      "learning_rate": 4.992909223239066e-05,
      "loss": 2.2156,
      "num_input_tokens_seen": 2211600960,
      "step": 2811
    },
    {
      "epoch": 0.2983237852747719,
      "grad_norm": 0.6127741127890536,
      "learning_rate": 4.992903991705424e-05,
      "loss": 2.1628,
      "num_input_tokens_seen": 2212387744,
      "step": 2812
    },
    {
      "epoch": 0.2984298748143433,
      "grad_norm": 0.5541266647722223,
      "learning_rate": 4.9928987582453404e-05,
      "loss": 2.0315,
      "num_input_tokens_seen": 2213174560,
      "step": 2813
    },
    {
      "epoch": 0.2985359643539147,
      "grad_norm": 0.6786004735059843,
      "learning_rate": 4.992893522858817e-05,
      "loss": 2.0062,
      "num_input_tokens_seen": 2213961344,
      "step": 2814
    },
    {
      "epoch": 0.2986420538934861,
      "grad_norm": 0.6240705692440737,
      "learning_rate": 4.992888285545858e-05,
      "loss": 2.185,
      "num_input_tokens_seen": 2214748144,
      "step": 2815
    },
    {
      "epoch": 0.2987481434330575,
      "grad_norm": 0.7239188879530722,
      "learning_rate": 4.992883046306469e-05,
      "loss": 2.1881,
      "num_input_tokens_seen": 2215534928,
      "step": 2816
    },
    {
      "epoch": 0.2988542329726289,
      "grad_norm": 0.477272493645643,
      "learning_rate": 4.992877805140653e-05,
      "loss": 1.9828,
      "num_input_tokens_seen": 2216321696,
      "step": 2817
    },
    {
      "epoch": 0.2989603225122003,
      "grad_norm": 0.6865608077091812,
      "learning_rate": 4.992872562048414e-05,
      "loss": 2.3446,
      "num_input_tokens_seen": 2217108352,
      "step": 2818
    },
    {
      "epoch": 0.2990664120517717,
      "grad_norm": 0.6599108000694114,
      "learning_rate": 4.992867317029756e-05,
      "loss": 2.1039,
      "num_input_tokens_seen": 2217895136,
      "step": 2819
    },
    {
      "epoch": 0.2991725015913431,
      "grad_norm": 0.6074020053525753,
      "learning_rate": 4.992862070084684e-05,
      "loss": 2.4204,
      "num_input_tokens_seen": 2218681808,
      "step": 2820
    },
    {
      "epoch": 0.2992785911309145,
      "grad_norm": 1.039511878903861,
      "learning_rate": 4.992856821213201e-05,
      "loss": 2.1512,
      "num_input_tokens_seen": 2219468608,
      "step": 2821
    },
    {
      "epoch": 0.2993846806704859,
      "grad_norm": 1.3317822523841005,
      "learning_rate": 4.9928515704153115e-05,
      "loss": 2.3284,
      "num_input_tokens_seen": 2220255328,
      "step": 2822
    },
    {
      "epoch": 0.29949077021005727,
      "grad_norm": 0.6571008042277774,
      "learning_rate": 4.992846317691019e-05,
      "loss": 2.0888,
      "num_input_tokens_seen": 2221042032,
      "step": 2823
    },
    {
      "epoch": 0.2995968597496287,
      "grad_norm": 1.0460395280353925,
      "learning_rate": 4.992841063040328e-05,
      "loss": 2.1075,
      "num_input_tokens_seen": 2221828752,
      "step": 2824
    },
    {
      "epoch": 0.2997029492892001,
      "grad_norm": 0.735943895860358,
      "learning_rate": 4.992835806463243e-05,
      "loss": 2.0894,
      "num_input_tokens_seen": 2222615568,
      "step": 2825
    },
    {
      "epoch": 0.29980903882877147,
      "grad_norm": 0.6511521367838796,
      "learning_rate": 4.992830547959767e-05,
      "loss": 2.1575,
      "num_input_tokens_seen": 2223402304,
      "step": 2826
    },
    {
      "epoch": 0.2999151283683429,
      "grad_norm": 0.7590771376734936,
      "learning_rate": 4.992825287529905e-05,
      "loss": 2.1056,
      "num_input_tokens_seen": 2224189072,
      "step": 2827
    },
    {
      "epoch": 0.3000212179079143,
      "grad_norm": 0.9284990137248024,
      "learning_rate": 4.9928200251736614e-05,
      "loss": 2.2023,
      "num_input_tokens_seen": 2224975872,
      "step": 2828
    },
    {
      "epoch": 0.30012730744748567,
      "grad_norm": 1.085141124837812,
      "learning_rate": 4.992814760891039e-05,
      "loss": 2.1798,
      "num_input_tokens_seen": 2225762640,
      "step": 2829
    },
    {
      "epoch": 0.3002333969870571,
      "grad_norm": 0.9918723699903165,
      "learning_rate": 4.9928094946820426e-05,
      "loss": 2.0373,
      "num_input_tokens_seen": 2226549424,
      "step": 2830
    },
    {
      "epoch": 0.30033948652662845,
      "grad_norm": 0.8446849156128855,
      "learning_rate": 4.992804226546676e-05,
      "loss": 2.2659,
      "num_input_tokens_seen": 2227336256,
      "step": 2831
    },
    {
      "epoch": 0.30044557606619987,
      "grad_norm": 0.9147455744570344,
      "learning_rate": 4.992798956484944e-05,
      "loss": 2.1552,
      "num_input_tokens_seen": 2228123008,
      "step": 2832
    },
    {
      "epoch": 0.3005516656057713,
      "grad_norm": 0.8367696804227797,
      "learning_rate": 4.9927936844968496e-05,
      "loss": 2.1484,
      "num_input_tokens_seen": 2228909824,
      "step": 2833
    },
    {
      "epoch": 0.30065775514534265,
      "grad_norm": 0.7714974889897966,
      "learning_rate": 4.9927884105823976e-05,
      "loss": 2.2738,
      "num_input_tokens_seen": 2229696528,
      "step": 2834
    },
    {
      "epoch": 0.3007638446849141,
      "grad_norm": 0.6886394908760749,
      "learning_rate": 4.992783134741592e-05,
      "loss": 2.2839,
      "num_input_tokens_seen": 2230483312,
      "step": 2835
    },
    {
      "epoch": 0.3008699342244855,
      "grad_norm": 0.6719465539950814,
      "learning_rate": 4.9927778569744365e-05,
      "loss": 2.1653,
      "num_input_tokens_seen": 2231270112,
      "step": 2836
    },
    {
      "epoch": 0.30097602376405685,
      "grad_norm": 0.5855585961828713,
      "learning_rate": 4.9927725772809356e-05,
      "loss": 1.9942,
      "num_input_tokens_seen": 2232056944,
      "step": 2837
    },
    {
      "epoch": 0.3010821133036283,
      "grad_norm": 0.6184673009907864,
      "learning_rate": 4.9927672956610926e-05,
      "loss": 2.2941,
      "num_input_tokens_seen": 2232843696,
      "step": 2838
    },
    {
      "epoch": 0.30118820284319964,
      "grad_norm": 0.5606851132864046,
      "learning_rate": 4.9927620121149124e-05,
      "loss": 2.0181,
      "num_input_tokens_seen": 2233630448,
      "step": 2839
    },
    {
      "epoch": 0.30129429238277106,
      "grad_norm": 0.4956055221610373,
      "learning_rate": 4.992756726642399e-05,
      "loss": 2.0849,
      "num_input_tokens_seen": 2234417232,
      "step": 2840
    },
    {
      "epoch": 0.3014003819223425,
      "grad_norm": 0.6277644663924785,
      "learning_rate": 4.992751439243557e-05,
      "loss": 2.1768,
      "num_input_tokens_seen": 2235204064,
      "step": 2841
    },
    {
      "epoch": 0.30150647146191384,
      "grad_norm": 0.5240906136485073,
      "learning_rate": 4.992746149918389e-05,
      "loss": 2.1186,
      "num_input_tokens_seen": 2235990896,
      "step": 2842
    },
    {
      "epoch": 0.30161256100148526,
      "grad_norm": 0.6985591489666236,
      "learning_rate": 4.9927408586669e-05,
      "loss": 2.0985,
      "num_input_tokens_seen": 2236777680,
      "step": 2843
    },
    {
      "epoch": 0.3017186505410567,
      "grad_norm": 0.715640439436063,
      "learning_rate": 4.9927355654890946e-05,
      "loss": 2.1967,
      "num_input_tokens_seen": 2237564480,
      "step": 2844
    },
    {
      "epoch": 0.30182474008062804,
      "grad_norm": 0.5982005559770232,
      "learning_rate": 4.992730270384976e-05,
      "loss": 2.2757,
      "num_input_tokens_seen": 2238351264,
      "step": 2845
    },
    {
      "epoch": 0.30193082962019946,
      "grad_norm": 1.2446131444660589,
      "learning_rate": 4.992724973354548e-05,
      "loss": 2.1574,
      "num_input_tokens_seen": 2239138000,
      "step": 2846
    },
    {
      "epoch": 0.3020369191597708,
      "grad_norm": 1.0665774656486096,
      "learning_rate": 4.9927196743978156e-05,
      "loss": 2.3483,
      "num_input_tokens_seen": 2239924752,
      "step": 2847
    },
    {
      "epoch": 0.30214300869934224,
      "grad_norm": 0.9921239895507249,
      "learning_rate": 4.992714373514783e-05,
      "loss": 2.0299,
      "num_input_tokens_seen": 2240711520,
      "step": 2848
    },
    {
      "epoch": 0.30224909823891366,
      "grad_norm": 0.8913577489502746,
      "learning_rate": 4.9927090707054537e-05,
      "loss": 2.073,
      "num_input_tokens_seen": 2241498320,
      "step": 2849
    },
    {
      "epoch": 0.302355187778485,
      "grad_norm": 0.991231053549739,
      "learning_rate": 4.9927037659698315e-05,
      "loss": 2.2039,
      "num_input_tokens_seen": 2242285056,
      "step": 2850
    },
    {
      "epoch": 0.30246127731805644,
      "grad_norm": 0.6355172652763192,
      "learning_rate": 4.9926984593079216e-05,
      "loss": 2.1213,
      "num_input_tokens_seen": 2243071760,
      "step": 2851
    },
    {
      "epoch": 0.30256736685762786,
      "grad_norm": 0.8327425233701864,
      "learning_rate": 4.9926931507197274e-05,
      "loss": 2.1479,
      "num_input_tokens_seen": 2243858560,
      "step": 2852
    },
    {
      "epoch": 0.3026734563971992,
      "grad_norm": 1.0390584385983856,
      "learning_rate": 4.992687840205252e-05,
      "loss": 2.2342,
      "num_input_tokens_seen": 2244645280,
      "step": 2853
    },
    {
      "epoch": 0.30277954593677064,
      "grad_norm": 1.3464255784478187,
      "learning_rate": 4.992682527764502e-05,
      "loss": 2.2153,
      "num_input_tokens_seen": 2245432048,
      "step": 2854
    },
    {
      "epoch": 0.302885635476342,
      "grad_norm": 0.4957221490101735,
      "learning_rate": 4.9926772133974796e-05,
      "loss": 1.992,
      "num_input_tokens_seen": 2246218848,
      "step": 2855
    },
    {
      "epoch": 0.3029917250159134,
      "grad_norm": 2.2678942315600628,
      "learning_rate": 4.992671897104189e-05,
      "loss": 2.0951,
      "num_input_tokens_seen": 2247005632,
      "step": 2856
    },
    {
      "epoch": 0.30309781455548485,
      "grad_norm": 0.6975013699942624,
      "learning_rate": 4.992666578884635e-05,
      "loss": 2.3301,
      "num_input_tokens_seen": 2247792400,
      "step": 2857
    },
    {
      "epoch": 0.3032039040950562,
      "grad_norm": 1.1320499991858692,
      "learning_rate": 4.9926612587388215e-05,
      "loss": 1.9703,
      "num_input_tokens_seen": 2248579184,
      "step": 2858
    },
    {
      "epoch": 0.30330999363462763,
      "grad_norm": 0.8028405732770003,
      "learning_rate": 4.9926559366667524e-05,
      "loss": 2.0822,
      "num_input_tokens_seen": 2249365888,
      "step": 2859
    },
    {
      "epoch": 0.30341608317419905,
      "grad_norm": 1.209087636006259,
      "learning_rate": 4.992650612668433e-05,
      "loss": 2.3617,
      "num_input_tokens_seen": 2250152624,
      "step": 2860
    },
    {
      "epoch": 0.3035221727137704,
      "grad_norm": 1.0141893081128428,
      "learning_rate": 4.992645286743865e-05,
      "loss": 2.244,
      "num_input_tokens_seen": 2250939392,
      "step": 2861
    },
    {
      "epoch": 0.30362826225334183,
      "grad_norm": 1.3056644639351902,
      "learning_rate": 4.992639958893054e-05,
      "loss": 2.1775,
      "num_input_tokens_seen": 2251726144,
      "step": 2862
    },
    {
      "epoch": 0.3037343517929132,
      "grad_norm": 1.0426909841106642,
      "learning_rate": 4.992634629116004e-05,
      "loss": 2.29,
      "num_input_tokens_seen": 2252512880,
      "step": 2863
    },
    {
      "epoch": 0.3038404413324846,
      "grad_norm": 0.8897219085012605,
      "learning_rate": 4.9926292974127186e-05,
      "loss": 2.2358,
      "num_input_tokens_seen": 2253299584,
      "step": 2864
    },
    {
      "epoch": 0.30394653087205603,
      "grad_norm": 0.9650611933749454,
      "learning_rate": 4.9926239637832035e-05,
      "loss": 2.253,
      "num_input_tokens_seen": 2254086336,
      "step": 2865
    },
    {
      "epoch": 0.3040526204116274,
      "grad_norm": 0.9296369579136621,
      "learning_rate": 4.992618628227461e-05,
      "loss": 2.1192,
      "num_input_tokens_seen": 2254873024,
      "step": 2866
    },
    {
      "epoch": 0.3041587099511988,
      "grad_norm": 1.4413643304836516,
      "learning_rate": 4.992613290745497e-05,
      "loss": 2.1556,
      "num_input_tokens_seen": 2255659904,
      "step": 2867
    },
    {
      "epoch": 0.30426479949077023,
      "grad_norm": 0.6185428652385003,
      "learning_rate": 4.9926079513373136e-05,
      "loss": 2.0776,
      "num_input_tokens_seen": 2256446704,
      "step": 2868
    },
    {
      "epoch": 0.3043708890303416,
      "grad_norm": 1.317416462510018,
      "learning_rate": 4.9926026100029164e-05,
      "loss": 2.0898,
      "num_input_tokens_seen": 2257233584,
      "step": 2869
    },
    {
      "epoch": 0.304476978569913,
      "grad_norm": 0.5392343117946214,
      "learning_rate": 4.992597266742308e-05,
      "loss": 2.1947,
      "num_input_tokens_seen": 2258020368,
      "step": 2870
    },
    {
      "epoch": 0.3045830681094844,
      "grad_norm": 0.9374513760577657,
      "learning_rate": 4.992591921555495e-05,
      "loss": 2.216,
      "num_input_tokens_seen": 2258807152,
      "step": 2871
    },
    {
      "epoch": 0.3046891576490558,
      "grad_norm": 0.5535948633748432,
      "learning_rate": 4.992586574442479e-05,
      "loss": 2.223,
      "num_input_tokens_seen": 2259593888,
      "step": 2872
    },
    {
      "epoch": 0.3047952471886272,
      "grad_norm": 0.6977450494233787,
      "learning_rate": 4.9925812254032664e-05,
      "loss": 2.0282,
      "num_input_tokens_seen": 2260380752,
      "step": 2873
    },
    {
      "epoch": 0.3049013367281986,
      "grad_norm": 0.6888194319506722,
      "learning_rate": 4.992575874437859e-05,
      "loss": 2.2554,
      "num_input_tokens_seen": 2261167536,
      "step": 2874
    },
    {
      "epoch": 0.30500742626777,
      "grad_norm": 0.6518880703787528,
      "learning_rate": 4.9925705215462626e-05,
      "loss": 2.1806,
      "num_input_tokens_seen": 2261954320,
      "step": 2875
    },
    {
      "epoch": 0.3051135158073414,
      "grad_norm": 0.7027381220095815,
      "learning_rate": 4.992565166728481e-05,
      "loss": 2.2833,
      "num_input_tokens_seen": 2262741120,
      "step": 2876
    },
    {
      "epoch": 0.3052196053469128,
      "grad_norm": 0.6382708874591198,
      "learning_rate": 4.992559809984518e-05,
      "loss": 2.2117,
      "num_input_tokens_seen": 2263527808,
      "step": 2877
    },
    {
      "epoch": 0.3053256948864842,
      "grad_norm": 1.0572209316323051,
      "learning_rate": 4.9925544513143776e-05,
      "loss": 2.2257,
      "num_input_tokens_seen": 2264314640,
      "step": 2878
    },
    {
      "epoch": 0.30543178442605556,
      "grad_norm": 0.9847208506850291,
      "learning_rate": 4.992549090718065e-05,
      "loss": 2.1666,
      "num_input_tokens_seen": 2265101408,
      "step": 2879
    },
    {
      "epoch": 0.305537873965627,
      "grad_norm": 0.6263115858291677,
      "learning_rate": 4.992543728195583e-05,
      "loss": 2.2704,
      "num_input_tokens_seen": 2265888224,
      "step": 2880
    },
    {
      "epoch": 0.3056439635051984,
      "grad_norm": 0.646807631665175,
      "learning_rate": 4.992538363746936e-05,
      "loss": 2.03,
      "num_input_tokens_seen": 2266675072,
      "step": 2881
    },
    {
      "epoch": 0.30575005304476977,
      "grad_norm": 0.9360040529778516,
      "learning_rate": 4.9925329973721294e-05,
      "loss": 2.0477,
      "num_input_tokens_seen": 2267461840,
      "step": 2882
    },
    {
      "epoch": 0.3058561425843412,
      "grad_norm": 0.7893511313115235,
      "learning_rate": 4.992527629071166e-05,
      "loss": 2.2159,
      "num_input_tokens_seen": 2268248592,
      "step": 2883
    },
    {
      "epoch": 0.3059622321239126,
      "grad_norm": 0.5210183470433842,
      "learning_rate": 4.99252225884405e-05,
      "loss": 1.943,
      "num_input_tokens_seen": 2269035344,
      "step": 2884
    },
    {
      "epoch": 0.30606832166348397,
      "grad_norm": 0.7912402961152506,
      "learning_rate": 4.992516886690787e-05,
      "loss": 2.3102,
      "num_input_tokens_seen": 2269822096,
      "step": 2885
    },
    {
      "epoch": 0.3061744112030554,
      "grad_norm": 0.6847545649790747,
      "learning_rate": 4.992511512611379e-05,
      "loss": 2.055,
      "num_input_tokens_seen": 2270608896,
      "step": 2886
    },
    {
      "epoch": 0.3062805007426268,
      "grad_norm": 0.7917462714697873,
      "learning_rate": 4.992506136605832e-05,
      "loss": 2.3766,
      "num_input_tokens_seen": 2271395584,
      "step": 2887
    },
    {
      "epoch": 0.30638659028219817,
      "grad_norm": 1.0987961976166005,
      "learning_rate": 4.992500758674149e-05,
      "loss": 2.1698,
      "num_input_tokens_seen": 2272182368,
      "step": 2888
    },
    {
      "epoch": 0.3064926798217696,
      "grad_norm": 0.7597812931987116,
      "learning_rate": 4.992495378816334e-05,
      "loss": 2.0842,
      "num_input_tokens_seen": 2272969232,
      "step": 2889
    },
    {
      "epoch": 0.30659876936134095,
      "grad_norm": 1.6925710474962787,
      "learning_rate": 4.992489997032392e-05,
      "loss": 2.291,
      "num_input_tokens_seen": 2273755984,
      "step": 2890
    },
    {
      "epoch": 0.30670485890091237,
      "grad_norm": 1.0811508700480392,
      "learning_rate": 4.992484613322328e-05,
      "loss": 2.1487,
      "num_input_tokens_seen": 2274542720,
      "step": 2891
    },
    {
      "epoch": 0.3068109484404838,
      "grad_norm": 0.9875799450308258,
      "learning_rate": 4.9924792276861445e-05,
      "loss": 2.3834,
      "num_input_tokens_seen": 2275329440,
      "step": 2892
    },
    {
      "epoch": 0.30691703798005515,
      "grad_norm": 1.1018459136084764,
      "learning_rate": 4.992473840123846e-05,
      "loss": 1.946,
      "num_input_tokens_seen": 2276116208,
      "step": 2893
    },
    {
      "epoch": 0.30702312751962657,
      "grad_norm": 0.6568001690997487,
      "learning_rate": 4.992468450635436e-05,
      "loss": 2.1765,
      "num_input_tokens_seen": 2276902944,
      "step": 2894
    },
    {
      "epoch": 0.307129217059198,
      "grad_norm": 0.7833231621675669,
      "learning_rate": 4.9924630592209206e-05,
      "loss": 1.9786,
      "num_input_tokens_seen": 2277689728,
      "step": 2895
    },
    {
      "epoch": 0.30723530659876935,
      "grad_norm": 0.7848298860490471,
      "learning_rate": 4.992457665880302e-05,
      "loss": 2.1934,
      "num_input_tokens_seen": 2278476432,
      "step": 2896
    },
    {
      "epoch": 0.30734139613834077,
      "grad_norm": 1.0269458114425631,
      "learning_rate": 4.992452270613586e-05,
      "loss": 2.1398,
      "num_input_tokens_seen": 2279263168,
      "step": 2897
    },
    {
      "epoch": 0.30744748567791214,
      "grad_norm": 1.0899748023510234,
      "learning_rate": 4.9924468734207764e-05,
      "loss": 2.0166,
      "num_input_tokens_seen": 2280049968,
      "step": 2898
    },
    {
      "epoch": 0.30755357521748355,
      "grad_norm": 0.6086083975474177,
      "learning_rate": 4.992441474301876e-05,
      "loss": 2.0362,
      "num_input_tokens_seen": 2280836720,
      "step": 2899
    },
    {
      "epoch": 0.307659664757055,
      "grad_norm": 0.7282837086111025,
      "learning_rate": 4.99243607325689e-05,
      "loss": 2.2219,
      "num_input_tokens_seen": 2281623536,
      "step": 2900
    },
    {
      "epoch": 0.30776575429662634,
      "grad_norm": 0.5824489915916549,
      "learning_rate": 4.992430670285823e-05,
      "loss": 1.9742,
      "num_input_tokens_seen": 2282410400,
      "step": 2901
    },
    {
      "epoch": 0.30787184383619776,
      "grad_norm": 0.5864917495983656,
      "learning_rate": 4.992425265388679e-05,
      "loss": 2.0987,
      "num_input_tokens_seen": 2283197232,
      "step": 2902
    },
    {
      "epoch": 0.3079779333757692,
      "grad_norm": 0.5586947550220156,
      "learning_rate": 4.992419858565461e-05,
      "loss": 2.1586,
      "num_input_tokens_seen": 2283983984,
      "step": 2903
    },
    {
      "epoch": 0.30808402291534054,
      "grad_norm": 0.5994141622386803,
      "learning_rate": 4.992414449816175e-05,
      "loss": 2.0802,
      "num_input_tokens_seen": 2284770768,
      "step": 2904
    },
    {
      "epoch": 0.30819011245491196,
      "grad_norm": 0.6083621725848388,
      "learning_rate": 4.992409039140824e-05,
      "loss": 2.224,
      "num_input_tokens_seen": 2285557584,
      "step": 2905
    },
    {
      "epoch": 0.3082962019944833,
      "grad_norm": 0.8308980775187761,
      "learning_rate": 4.992403626539412e-05,
      "loss": 2.1089,
      "num_input_tokens_seen": 2286344272,
      "step": 2906
    },
    {
      "epoch": 0.30840229153405474,
      "grad_norm": 0.9133088630147922,
      "learning_rate": 4.992398212011944e-05,
      "loss": 2.2493,
      "num_input_tokens_seen": 2287131104,
      "step": 2907
    },
    {
      "epoch": 0.30850838107362616,
      "grad_norm": 0.5303746654854496,
      "learning_rate": 4.992392795558423e-05,
      "loss": 2.1125,
      "num_input_tokens_seen": 2287917856,
      "step": 2908
    },
    {
      "epoch": 0.3086144706131975,
      "grad_norm": 0.7701723635270481,
      "learning_rate": 4.992387377178855e-05,
      "loss": 2.1706,
      "num_input_tokens_seen": 2288704656,
      "step": 2909
    },
    {
      "epoch": 0.30872056015276894,
      "grad_norm": 0.9192443596990257,
      "learning_rate": 4.992381956873243e-05,
      "loss": 2.3556,
      "num_input_tokens_seen": 2289491408,
      "step": 2910
    },
    {
      "epoch": 0.30882664969234036,
      "grad_norm": 0.6068842625781707,
      "learning_rate": 4.9923765346415905e-05,
      "loss": 2.1857,
      "num_input_tokens_seen": 2290278096,
      "step": 2911
    },
    {
      "epoch": 0.3089327392319117,
      "grad_norm": 0.7749099240904567,
      "learning_rate": 4.992371110483903e-05,
      "loss": 2.0102,
      "num_input_tokens_seen": 2291064928,
      "step": 2912
    },
    {
      "epoch": 0.30903882877148314,
      "grad_norm": 1.1250421799551882,
      "learning_rate": 4.992365684400185e-05,
      "loss": 2.3109,
      "num_input_tokens_seen": 2291851632,
      "step": 2913
    },
    {
      "epoch": 0.3091449183110545,
      "grad_norm": 0.815303520844016,
      "learning_rate": 4.9923602563904395e-05,
      "loss": 2.2171,
      "num_input_tokens_seen": 2292638416,
      "step": 2914
    },
    {
      "epoch": 0.3092510078506259,
      "grad_norm": 0.47597726928794604,
      "learning_rate": 4.992354826454671e-05,
      "loss": 2.0123,
      "num_input_tokens_seen": 2293425264,
      "step": 2915
    },
    {
      "epoch": 0.30935709739019734,
      "grad_norm": 0.8540228220288718,
      "learning_rate": 4.992349394592883e-05,
      "loss": 2.118,
      "num_input_tokens_seen": 2294212080,
      "step": 2916
    },
    {
      "epoch": 0.3094631869297687,
      "grad_norm": 1.0613106957279914,
      "learning_rate": 4.992343960805082e-05,
      "loss": 2.3851,
      "num_input_tokens_seen": 2294998784,
      "step": 2917
    },
    {
      "epoch": 0.3095692764693401,
      "grad_norm": 0.7829422747829449,
      "learning_rate": 4.99233852509127e-05,
      "loss": 2.0206,
      "num_input_tokens_seen": 2295785632,
      "step": 2918
    },
    {
      "epoch": 0.30967536600891155,
      "grad_norm": 0.7042921706669606,
      "learning_rate": 4.992333087451452e-05,
      "loss": 2.1468,
      "num_input_tokens_seen": 2296572352,
      "step": 2919
    },
    {
      "epoch": 0.3097814555484829,
      "grad_norm": 0.6126978931229216,
      "learning_rate": 4.992327647885632e-05,
      "loss": 2.1747,
      "num_input_tokens_seen": 2297359136,
      "step": 2920
    },
    {
      "epoch": 0.30988754508805433,
      "grad_norm": 0.6641522327415998,
      "learning_rate": 4.992322206393814e-05,
      "loss": 2.0839,
      "num_input_tokens_seen": 2298145888,
      "step": 2921
    },
    {
      "epoch": 0.3099936346276257,
      "grad_norm": 0.7123363168160748,
      "learning_rate": 4.9923167629760024e-05,
      "loss": 2.2507,
      "num_input_tokens_seen": 2298932672,
      "step": 2922
    },
    {
      "epoch": 0.3100997241671971,
      "grad_norm": 0.6836001337710221,
      "learning_rate": 4.992311317632202e-05,
      "loss": 2.2364,
      "num_input_tokens_seen": 2299719488,
      "step": 2923
    },
    {
      "epoch": 0.31020581370676853,
      "grad_norm": 0.6579776831737725,
      "learning_rate": 4.992305870362417e-05,
      "loss": 2.0327,
      "num_input_tokens_seen": 2300506224,
      "step": 2924
    },
    {
      "epoch": 0.3103119032463399,
      "grad_norm": 0.6860131442614215,
      "learning_rate": 4.992300421166651e-05,
      "loss": 2.2314,
      "num_input_tokens_seen": 2301293024,
      "step": 2925
    },
    {
      "epoch": 0.3104179927859113,
      "grad_norm": 0.7383659830251372,
      "learning_rate": 4.992294970044908e-05,
      "loss": 2.1797,
      "num_input_tokens_seen": 2302079824,
      "step": 2926
    },
    {
      "epoch": 0.31052408232548273,
      "grad_norm": 0.6955709595387793,
      "learning_rate": 4.992289516997193e-05,
      "loss": 2.1589,
      "num_input_tokens_seen": 2302866560,
      "step": 2927
    },
    {
      "epoch": 0.3106301718650541,
      "grad_norm": 0.5610776012823122,
      "learning_rate": 4.992284062023509e-05,
      "loss": 2.1218,
      "num_input_tokens_seen": 2303653280,
      "step": 2928
    },
    {
      "epoch": 0.3107362614046255,
      "grad_norm": 0.6433778276724228,
      "learning_rate": 4.992278605123861e-05,
      "loss": 2.2297,
      "num_input_tokens_seen": 2304440096,
      "step": 2929
    },
    {
      "epoch": 0.3108423509441969,
      "grad_norm": 0.4871859166120996,
      "learning_rate": 4.9922731462982544e-05,
      "loss": 2.2166,
      "num_input_tokens_seen": 2305226864,
      "step": 2930
    },
    {
      "epoch": 0.3109484404837683,
      "grad_norm": 0.5002475527727989,
      "learning_rate": 4.992267685546691e-05,
      "loss": 2.3215,
      "num_input_tokens_seen": 2306013520,
      "step": 2931
    },
    {
      "epoch": 0.3110545300233397,
      "grad_norm": 0.6122043047313761,
      "learning_rate": 4.9922622228691776e-05,
      "loss": 2.2295,
      "num_input_tokens_seen": 2306800336,
      "step": 2932
    },
    {
      "epoch": 0.3111606195629111,
      "grad_norm": 0.6737328857556403,
      "learning_rate": 4.992256758265715e-05,
      "loss": 2.0996,
      "num_input_tokens_seen": 2307587104,
      "step": 2933
    },
    {
      "epoch": 0.3112667091024825,
      "grad_norm": 0.47285022709878266,
      "learning_rate": 4.992251291736312e-05,
      "loss": 2.1834,
      "num_input_tokens_seen": 2308373888,
      "step": 2934
    },
    {
      "epoch": 0.3113727986420539,
      "grad_norm": 1.1574227799441534,
      "learning_rate": 4.992245823280969e-05,
      "loss": 1.9323,
      "num_input_tokens_seen": 2309160608,
      "step": 2935
    },
    {
      "epoch": 0.3114788881816253,
      "grad_norm": 1.2487540635112377,
      "learning_rate": 4.992240352899691e-05,
      "loss": 2.1583,
      "num_input_tokens_seen": 2309947456,
      "step": 2936
    },
    {
      "epoch": 0.3115849777211967,
      "grad_norm": 0.6027494625246934,
      "learning_rate": 4.992234880592483e-05,
      "loss": 2.2441,
      "num_input_tokens_seen": 2310734128,
      "step": 2937
    },
    {
      "epoch": 0.31169106726076806,
      "grad_norm": 1.4150021061853904,
      "learning_rate": 4.99222940635935e-05,
      "loss": 1.9915,
      "num_input_tokens_seen": 2311520896,
      "step": 2938
    },
    {
      "epoch": 0.3117971568003395,
      "grad_norm": 0.8986359013309417,
      "learning_rate": 4.992223930200295e-05,
      "loss": 2.2962,
      "num_input_tokens_seen": 2312307680,
      "step": 2939
    },
    {
      "epoch": 0.3119032463399109,
      "grad_norm": 2.2039005507390597,
      "learning_rate": 4.9922184521153213e-05,
      "loss": 2.2056,
      "num_input_tokens_seen": 2313094432,
      "step": 2940
    },
    {
      "epoch": 0.31200933587948226,
      "grad_norm": 1.3775494620905655,
      "learning_rate": 4.992212972104436e-05,
      "loss": 2.1506,
      "num_input_tokens_seen": 2313881136,
      "step": 2941
    },
    {
      "epoch": 0.3121154254190537,
      "grad_norm": 2.053340847074431,
      "learning_rate": 4.992207490167641e-05,
      "loss": 2.2046,
      "num_input_tokens_seen": 2314667856,
      "step": 2942
    },
    {
      "epoch": 0.3122215149586251,
      "grad_norm": 1.3686610324974788,
      "learning_rate": 4.99220200630494e-05,
      "loss": 2.314,
      "num_input_tokens_seen": 2315454624,
      "step": 2943
    },
    {
      "epoch": 0.31232760449819646,
      "grad_norm": 2.254422758856717,
      "learning_rate": 4.99219652051634e-05,
      "loss": 2.2343,
      "num_input_tokens_seen": 2316241472,
      "step": 2944
    },
    {
      "epoch": 0.3124336940377679,
      "grad_norm": 0.8002131524262055,
      "learning_rate": 4.992191032801843e-05,
      "loss": 2.2023,
      "num_input_tokens_seen": 2317028208,
      "step": 2945
    },
    {
      "epoch": 0.31253978357733925,
      "grad_norm": 1.2355207515754716,
      "learning_rate": 4.992185543161454e-05,
      "loss": 2.3447,
      "num_input_tokens_seen": 2317814880,
      "step": 2946
    },
    {
      "epoch": 0.31264587311691067,
      "grad_norm": 0.5257424471028703,
      "learning_rate": 4.992180051595176e-05,
      "loss": 2.1002,
      "num_input_tokens_seen": 2318601648,
      "step": 2947
    },
    {
      "epoch": 0.3127519626564821,
      "grad_norm": 0.8415728216172081,
      "learning_rate": 4.992174558103017e-05,
      "loss": 2.0599,
      "num_input_tokens_seen": 2319388528,
      "step": 2948
    },
    {
      "epoch": 0.31285805219605345,
      "grad_norm": 0.7263865433908852,
      "learning_rate": 4.992169062684977e-05,
      "loss": 2.175,
      "num_input_tokens_seen": 2320175296,
      "step": 2949
    },
    {
      "epoch": 0.31296414173562487,
      "grad_norm": 0.9516670827829345,
      "learning_rate": 4.9921635653410617e-05,
      "loss": 2.4011,
      "num_input_tokens_seen": 2320962128,
      "step": 2950
    },
    {
      "epoch": 0.3130702312751963,
      "grad_norm": 1.0084197604681,
      "learning_rate": 4.9921580660712755e-05,
      "loss": 2.164,
      "num_input_tokens_seen": 2321748912,
      "step": 2951
    },
    {
      "epoch": 0.31317632081476765,
      "grad_norm": 0.5708442541054695,
      "learning_rate": 4.992152564875623e-05,
      "loss": 2.093,
      "num_input_tokens_seen": 2322535664,
      "step": 2952
    },
    {
      "epoch": 0.31328241035433907,
      "grad_norm": 0.7978403893336251,
      "learning_rate": 4.992147061754108e-05,
      "loss": 2.0015,
      "num_input_tokens_seen": 2323322496,
      "step": 2953
    },
    {
      "epoch": 0.31338849989391043,
      "grad_norm": 0.7137928251993819,
      "learning_rate": 4.9921415567067356e-05,
      "loss": 2.1955,
      "num_input_tokens_seen": 2324109216,
      "step": 2954
    },
    {
      "epoch": 0.31349458943348185,
      "grad_norm": 0.8901070072830981,
      "learning_rate": 4.992136049733508e-05,
      "loss": 2.1802,
      "num_input_tokens_seen": 2324895920,
      "step": 2955
    },
    {
      "epoch": 0.31360067897305327,
      "grad_norm": 0.6685821177029166,
      "learning_rate": 4.992130540834432e-05,
      "loss": 2.0233,
      "num_input_tokens_seen": 2325682784,
      "step": 2956
    },
    {
      "epoch": 0.31370676851262463,
      "grad_norm": 0.713036091081341,
      "learning_rate": 4.9921250300095095e-05,
      "loss": 2.1991,
      "num_input_tokens_seen": 2326469568,
      "step": 2957
    },
    {
      "epoch": 0.31381285805219605,
      "grad_norm": 0.8836927026423714,
      "learning_rate": 4.992119517258747e-05,
      "loss": 2.1547,
      "num_input_tokens_seen": 2327256336,
      "step": 2958
    },
    {
      "epoch": 0.31391894759176747,
      "grad_norm": 0.584863024144385,
      "learning_rate": 4.992114002582147e-05,
      "loss": 2.0975,
      "num_input_tokens_seen": 2328043056,
      "step": 2959
    },
    {
      "epoch": 0.31402503713133884,
      "grad_norm": 0.5882282297668942,
      "learning_rate": 4.992108485979714e-05,
      "loss": 2.0942,
      "num_input_tokens_seen": 2328829888,
      "step": 2960
    },
    {
      "epoch": 0.31413112667091025,
      "grad_norm": 0.935579822154489,
      "learning_rate": 4.992102967451453e-05,
      "loss": 2.2256,
      "num_input_tokens_seen": 2329616544,
      "step": 2961
    },
    {
      "epoch": 0.3142372162104817,
      "grad_norm": 1.8737484441975405,
      "learning_rate": 4.992097446997369e-05,
      "loss": 2.253,
      "num_input_tokens_seen": 2330403216,
      "step": 2962
    },
    {
      "epoch": 0.31434330575005304,
      "grad_norm": 0.8552464608676602,
      "learning_rate": 4.9920919246174646e-05,
      "loss": 2.042,
      "num_input_tokens_seen": 2331190032,
      "step": 2963
    },
    {
      "epoch": 0.31444939528962446,
      "grad_norm": 1.0996969410336326,
      "learning_rate": 4.992086400311744e-05,
      "loss": 2.2265,
      "num_input_tokens_seen": 2331976816,
      "step": 2964
    },
    {
      "epoch": 0.3145554848291958,
      "grad_norm": 0.6505194488018892,
      "learning_rate": 4.992080874080213e-05,
      "loss": 2.1064,
      "num_input_tokens_seen": 2332763584,
      "step": 2965
    },
    {
      "epoch": 0.31466157436876724,
      "grad_norm": 1.0431501559236298,
      "learning_rate": 4.992075345922875e-05,
      "loss": 2.3092,
      "num_input_tokens_seen": 2333550208,
      "step": 2966
    },
    {
      "epoch": 0.31476766390833866,
      "grad_norm": 0.5493558080219556,
      "learning_rate": 4.9920698158397335e-05,
      "loss": 2.2579,
      "num_input_tokens_seen": 2334336928,
      "step": 2967
    },
    {
      "epoch": 0.31487375344791,
      "grad_norm": 1.7617649352169613,
      "learning_rate": 4.992064283830794e-05,
      "loss": 2.3638,
      "num_input_tokens_seen": 2335123616,
      "step": 2968
    },
    {
      "epoch": 0.31497984298748144,
      "grad_norm": 0.7230119355177446,
      "learning_rate": 4.99205874989606e-05,
      "loss": 2.2362,
      "num_input_tokens_seen": 2335910384,
      "step": 2969
    },
    {
      "epoch": 0.31508593252705286,
      "grad_norm": 1.248108827397189,
      "learning_rate": 4.992053214035537e-05,
      "loss": 2.3059,
      "num_input_tokens_seen": 2336697072,
      "step": 2970
    },
    {
      "epoch": 0.3151920220666242,
      "grad_norm": 0.9562805172210253,
      "learning_rate": 4.992047676249228e-05,
      "loss": 2.0369,
      "num_input_tokens_seen": 2337483904,
      "step": 2971
    },
    {
      "epoch": 0.31529811160619564,
      "grad_norm": 0.7590055733655656,
      "learning_rate": 4.992042136537137e-05,
      "loss": 2.326,
      "num_input_tokens_seen": 2338270624,
      "step": 2972
    },
    {
      "epoch": 0.315404201145767,
      "grad_norm": 0.6456540240795112,
      "learning_rate": 4.99203659489927e-05,
      "loss": 1.9576,
      "num_input_tokens_seen": 2339057408,
      "step": 2973
    },
    {
      "epoch": 0.3155102906853384,
      "grad_norm": 0.7012951932207645,
      "learning_rate": 4.99203105133563e-05,
      "loss": 2.1592,
      "num_input_tokens_seen": 2339844096,
      "step": 2974
    },
    {
      "epoch": 0.31561638022490984,
      "grad_norm": 0.9048778371328439,
      "learning_rate": 4.9920255058462215e-05,
      "loss": 2.0654,
      "num_input_tokens_seen": 2340630832,
      "step": 2975
    },
    {
      "epoch": 0.3157224697644812,
      "grad_norm": 0.9630385673126646,
      "learning_rate": 4.992019958431049e-05,
      "loss": 2.2983,
      "num_input_tokens_seen": 2341417568,
      "step": 2976
    },
    {
      "epoch": 0.3158285593040526,
      "grad_norm": 1.4205323729251973,
      "learning_rate": 4.9920144090901154e-05,
      "loss": 2.1527,
      "num_input_tokens_seen": 2342204256,
      "step": 2977
    },
    {
      "epoch": 0.31593464884362404,
      "grad_norm": 1.0424796914207468,
      "learning_rate": 4.992008857823427e-05,
      "loss": 2.256,
      "num_input_tokens_seen": 2342990912,
      "step": 2978
    },
    {
      "epoch": 0.3160407383831954,
      "grad_norm": 1.4857694031078248,
      "learning_rate": 4.992003304630988e-05,
      "loss": 2.2664,
      "num_input_tokens_seen": 2343777616,
      "step": 2979
    },
    {
      "epoch": 0.3161468279227668,
      "grad_norm": 0.9967806241576782,
      "learning_rate": 4.991997749512801e-05,
      "loss": 2.1339,
      "num_input_tokens_seen": 2344564400,
      "step": 2980
    },
    {
      "epoch": 0.3162529174623382,
      "grad_norm": 1.2178696148477532,
      "learning_rate": 4.991992192468871e-05,
      "loss": 2.0296,
      "num_input_tokens_seen": 2345351232,
      "step": 2981
    },
    {
      "epoch": 0.3163590070019096,
      "grad_norm": 1.56460516152254,
      "learning_rate": 4.9919866334992034e-05,
      "loss": 2.2406,
      "num_input_tokens_seen": 2346138032,
      "step": 2982
    },
    {
      "epoch": 0.31646509654148103,
      "grad_norm": 1.261028967850983,
      "learning_rate": 4.9919810726038014e-05,
      "loss": 2.2662,
      "num_input_tokens_seen": 2346924768,
      "step": 2983
    },
    {
      "epoch": 0.3165711860810524,
      "grad_norm": 1.2877406150779922,
      "learning_rate": 4.9919755097826694e-05,
      "loss": 2.1771,
      "num_input_tokens_seen": 2347711504,
      "step": 2984
    },
    {
      "epoch": 0.3166772756206238,
      "grad_norm": 0.9861229026043953,
      "learning_rate": 4.9919699450358114e-05,
      "loss": 1.9971,
      "num_input_tokens_seen": 2348498304,
      "step": 2985
    },
    {
      "epoch": 0.31678336516019523,
      "grad_norm": 1.0514107103646806,
      "learning_rate": 4.991964378363233e-05,
      "loss": 2.1921,
      "num_input_tokens_seen": 2349285088,
      "step": 2986
    },
    {
      "epoch": 0.3168894546997666,
      "grad_norm": 0.8876684085210746,
      "learning_rate": 4.991958809764937e-05,
      "loss": 2.2553,
      "num_input_tokens_seen": 2350071840,
      "step": 2987
    },
    {
      "epoch": 0.316995544239338,
      "grad_norm": 0.7076021083791864,
      "learning_rate": 4.9919532392409286e-05,
      "loss": 2.1714,
      "num_input_tokens_seen": 2350858560,
      "step": 2988
    },
    {
      "epoch": 0.3171016337789094,
      "grad_norm": 0.9290005168613344,
      "learning_rate": 4.9919476667912126e-05,
      "loss": 2.0825,
      "num_input_tokens_seen": 2351645344,
      "step": 2989
    },
    {
      "epoch": 0.3172077233184808,
      "grad_norm": 0.5536317942449597,
      "learning_rate": 4.991942092415791e-05,
      "loss": 2.1237,
      "num_input_tokens_seen": 2352432128,
      "step": 2990
    },
    {
      "epoch": 0.3173138128580522,
      "grad_norm": 0.830594688718073,
      "learning_rate": 4.9919365161146717e-05,
      "loss": 2.1088,
      "num_input_tokens_seen": 2353218880,
      "step": 2991
    },
    {
      "epoch": 0.3174199023976236,
      "grad_norm": 0.8094803979517919,
      "learning_rate": 4.9919309378878555e-05,
      "loss": 2.3941,
      "num_input_tokens_seen": 2354005648,
      "step": 2992
    },
    {
      "epoch": 0.317525991937195,
      "grad_norm": 0.9005007612066575,
      "learning_rate": 4.991925357735348e-05,
      "loss": 2.0704,
      "num_input_tokens_seen": 2354792432,
      "step": 2993
    },
    {
      "epoch": 0.3176320814767664,
      "grad_norm": 0.5479494117676601,
      "learning_rate": 4.991919775657154e-05,
      "loss": 2.1646,
      "num_input_tokens_seen": 2355579296,
      "step": 2994
    },
    {
      "epoch": 0.3177381710163378,
      "grad_norm": 1.0255922114567757,
      "learning_rate": 4.991914191653278e-05,
      "loss": 2.0644,
      "num_input_tokens_seen": 2356366112,
      "step": 2995
    },
    {
      "epoch": 0.3178442605559092,
      "grad_norm": 1.1011561087955302,
      "learning_rate": 4.991908605723724e-05,
      "loss": 2.1869,
      "num_input_tokens_seen": 2357152816,
      "step": 2996
    },
    {
      "epoch": 0.31795035009548056,
      "grad_norm": 0.656934738605313,
      "learning_rate": 4.991903017868496e-05,
      "loss": 2.1045,
      "num_input_tokens_seen": 2357939600,
      "step": 2997
    },
    {
      "epoch": 0.318056439635052,
      "grad_norm": 1.2114397824270782,
      "learning_rate": 4.991897428087597e-05,
      "loss": 2.0243,
      "num_input_tokens_seen": 2358726256,
      "step": 2998
    },
    {
      "epoch": 0.3181625291746234,
      "grad_norm": 0.8814008038315577,
      "learning_rate": 4.991891836381034e-05,
      "loss": 2.2047,
      "num_input_tokens_seen": 2359512960,
      "step": 2999
    },
    {
      "epoch": 0.31826861871419476,
      "grad_norm": 0.8988029849776414,
      "learning_rate": 4.99188624274881e-05,
      "loss": 2.0984,
      "num_input_tokens_seen": 2360299792,
      "step": 3000
    },
    {
      "epoch": 0.31826861871419476,
      "eval_loss": 2.1045196056365967,
      "eval_runtime": 65.2977,
      "eval_samples_per_second": 45.943,
      "eval_steps_per_second": 0.49,
      "num_input_tokens_seen": 2360299792,
      "step": 3000
    },
    {
      "epoch": 0.3183747082537662,
      "grad_norm": 0.6773279664688255,
      "learning_rate": 4.99188064719093e-05,
      "loss": 2.0993,
      "num_input_tokens_seen": 2361086544,
      "step": 3001
    },
    {
      "epoch": 0.3184807977933376,
      "grad_norm": 0.7124778404376795,
      "learning_rate": 4.991875049707397e-05,
      "loss": 2.0823,
      "num_input_tokens_seen": 2361873264,
      "step": 3002
    },
    {
      "epoch": 0.31858688733290896,
      "grad_norm": 0.783097288247032,
      "learning_rate": 4.991869450298217e-05,
      "loss": 2.1532,
      "num_input_tokens_seen": 2362660080,
      "step": 3003
    },
    {
      "epoch": 0.3186929768724804,
      "grad_norm": 0.6013871108094816,
      "learning_rate": 4.991863848963392e-05,
      "loss": 2.2488,
      "num_input_tokens_seen": 2363446800,
      "step": 3004
    },
    {
      "epoch": 0.31879906641205175,
      "grad_norm": 0.6527067064133494,
      "learning_rate": 4.991858245702928e-05,
      "loss": 2.0696,
      "num_input_tokens_seen": 2364233552,
      "step": 3005
    },
    {
      "epoch": 0.31890515595162316,
      "grad_norm": 0.7029726903013002,
      "learning_rate": 4.99185264051683e-05,
      "loss": 2.2434,
      "num_input_tokens_seen": 2365020288,
      "step": 3006
    },
    {
      "epoch": 0.3190112454911946,
      "grad_norm": 0.9124062566378245,
      "learning_rate": 4.9918470334051e-05,
      "loss": 2.1908,
      "num_input_tokens_seen": 2365807024,
      "step": 3007
    },
    {
      "epoch": 0.31911733503076595,
      "grad_norm": 0.5770573912196774,
      "learning_rate": 4.991841424367746e-05,
      "loss": 2.0349,
      "num_input_tokens_seen": 2366593792,
      "step": 3008
    },
    {
      "epoch": 0.31922342457033737,
      "grad_norm": 0.8289067370664318,
      "learning_rate": 4.9918358134047685e-05,
      "loss": 2.2415,
      "num_input_tokens_seen": 2367380608,
      "step": 3009
    },
    {
      "epoch": 0.3193295141099088,
      "grad_norm": 0.6319196976466479,
      "learning_rate": 4.991830200516173e-05,
      "loss": 2.1641,
      "num_input_tokens_seen": 2368167328,
      "step": 3010
    },
    {
      "epoch": 0.31943560364948015,
      "grad_norm": 0.9956168410801518,
      "learning_rate": 4.991824585701965e-05,
      "loss": 2.3056,
      "num_input_tokens_seen": 2368954128,
      "step": 3011
    },
    {
      "epoch": 0.31954169318905157,
      "grad_norm": 0.7144621497429611,
      "learning_rate": 4.991818968962148e-05,
      "loss": 2.0474,
      "num_input_tokens_seen": 2369740896,
      "step": 3012
    },
    {
      "epoch": 0.31964778272862293,
      "grad_norm": 1.2348692809572552,
      "learning_rate": 4.9918133502967265e-05,
      "loss": 2.087,
      "num_input_tokens_seen": 2370527664,
      "step": 3013
    },
    {
      "epoch": 0.31975387226819435,
      "grad_norm": 0.9222858533488795,
      "learning_rate": 4.991807729705704e-05,
      "loss": 2.233,
      "num_input_tokens_seen": 2371314352,
      "step": 3014
    },
    {
      "epoch": 0.31985996180776577,
      "grad_norm": 1.2028731133403205,
      "learning_rate": 4.991802107189086e-05,
      "loss": 2.0766,
      "num_input_tokens_seen": 2372101088,
      "step": 3015
    },
    {
      "epoch": 0.31996605134733713,
      "grad_norm": 0.8016905352732493,
      "learning_rate": 4.991796482746877e-05,
      "loss": 1.9513,
      "num_input_tokens_seen": 2372887904,
      "step": 3016
    },
    {
      "epoch": 0.32007214088690855,
      "grad_norm": 1.2209470991182663,
      "learning_rate": 4.99179085637908e-05,
      "loss": 2.1678,
      "num_input_tokens_seen": 2373674656,
      "step": 3017
    },
    {
      "epoch": 0.32017823042647997,
      "grad_norm": 1.3842746648929827,
      "learning_rate": 4.991785228085702e-05,
      "loss": 2.0874,
      "num_input_tokens_seen": 2374461408,
      "step": 3018
    },
    {
      "epoch": 0.32028431996605133,
      "grad_norm": 0.804442055536202,
      "learning_rate": 4.991779597866743e-05,
      "loss": 2.2682,
      "num_input_tokens_seen": 2375248160,
      "step": 3019
    },
    {
      "epoch": 0.32039040950562275,
      "grad_norm": 0.7553349984749815,
      "learning_rate": 4.9917739657222105e-05,
      "loss": 2.1104,
      "num_input_tokens_seen": 2376034944,
      "step": 3020
    },
    {
      "epoch": 0.3204964990451941,
      "grad_norm": 0.8516449403035705,
      "learning_rate": 4.991768331652109e-05,
      "loss": 2.213,
      "num_input_tokens_seen": 2376821744,
      "step": 3021
    },
    {
      "epoch": 0.32060258858476554,
      "grad_norm": 0.6019676902541404,
      "learning_rate": 4.991762695656441e-05,
      "loss": 2.0627,
      "num_input_tokens_seen": 2377608544,
      "step": 3022
    },
    {
      "epoch": 0.32070867812433695,
      "grad_norm": 1.4890392052642731,
      "learning_rate": 4.991757057735213e-05,
      "loss": 2.2346,
      "num_input_tokens_seen": 2378395216,
      "step": 3023
    },
    {
      "epoch": 0.3208147676639083,
      "grad_norm": 0.7352724047026645,
      "learning_rate": 4.991751417888428e-05,
      "loss": 2.0149,
      "num_input_tokens_seen": 2379182000,
      "step": 3024
    },
    {
      "epoch": 0.32092085720347974,
      "grad_norm": 0.9205565372773871,
      "learning_rate": 4.99174577611609e-05,
      "loss": 2.0918,
      "num_input_tokens_seen": 2379968736,
      "step": 3025
    },
    {
      "epoch": 0.32102694674305116,
      "grad_norm": 1.0051924154280074,
      "learning_rate": 4.991740132418205e-05,
      "loss": 2.02,
      "num_input_tokens_seen": 2380755600,
      "step": 3026
    },
    {
      "epoch": 0.3211330362826225,
      "grad_norm": 1.0516625005015245,
      "learning_rate": 4.9917344867947754e-05,
      "loss": 2.0501,
      "num_input_tokens_seen": 2381542384,
      "step": 3027
    },
    {
      "epoch": 0.32123912582219394,
      "grad_norm": 0.6607784482684541,
      "learning_rate": 4.991728839245807e-05,
      "loss": 2.1124,
      "num_input_tokens_seen": 2382329056,
      "step": 3028
    },
    {
      "epoch": 0.32134521536176536,
      "grad_norm": 0.9518818443149608,
      "learning_rate": 4.991723189771304e-05,
      "loss": 2.1567,
      "num_input_tokens_seen": 2383115776,
      "step": 3029
    },
    {
      "epoch": 0.3214513049013367,
      "grad_norm": 0.791377580540283,
      "learning_rate": 4.991717538371269e-05,
      "loss": 2.1558,
      "num_input_tokens_seen": 2383902592,
      "step": 3030
    },
    {
      "epoch": 0.32155739444090814,
      "grad_norm": 0.8847222464970629,
      "learning_rate": 4.991711885045709e-05,
      "loss": 2.2138,
      "num_input_tokens_seen": 2384689328,
      "step": 3031
    },
    {
      "epoch": 0.3216634839804795,
      "grad_norm": 0.8694217150111473,
      "learning_rate": 4.9917062297946265e-05,
      "loss": 1.9377,
      "num_input_tokens_seen": 2385476128,
      "step": 3032
    },
    {
      "epoch": 0.3217695735200509,
      "grad_norm": 0.7762060729849146,
      "learning_rate": 4.991700572618027e-05,
      "loss": 2.3172,
      "num_input_tokens_seen": 2386262816,
      "step": 3033
    },
    {
      "epoch": 0.32187566305962234,
      "grad_norm": 0.7276620461564215,
      "learning_rate": 4.991694913515914e-05,
      "loss": 2.1596,
      "num_input_tokens_seen": 2387049600,
      "step": 3034
    },
    {
      "epoch": 0.3219817525991937,
      "grad_norm": 0.7297198066974582,
      "learning_rate": 4.991689252488293e-05,
      "loss": 2.0808,
      "num_input_tokens_seen": 2387836384,
      "step": 3035
    },
    {
      "epoch": 0.3220878421387651,
      "grad_norm": 0.6492858532549226,
      "learning_rate": 4.991683589535167e-05,
      "loss": 2.2636,
      "num_input_tokens_seen": 2388623072,
      "step": 3036
    },
    {
      "epoch": 0.32219393167833654,
      "grad_norm": 0.6673052269999654,
      "learning_rate": 4.9916779246565415e-05,
      "loss": 2.081,
      "num_input_tokens_seen": 2389409936,
      "step": 3037
    },
    {
      "epoch": 0.3223000212179079,
      "grad_norm": 0.7171830409615682,
      "learning_rate": 4.99167225785242e-05,
      "loss": 2.1301,
      "num_input_tokens_seen": 2390196624,
      "step": 3038
    },
    {
      "epoch": 0.3224061107574793,
      "grad_norm": 0.6317708783938598,
      "learning_rate": 4.991666589122808e-05,
      "loss": 2.2272,
      "num_input_tokens_seen": 2390983360,
      "step": 3039
    },
    {
      "epoch": 0.3225122002970507,
      "grad_norm": 0.5742026626473421,
      "learning_rate": 4.991660918467708e-05,
      "loss": 2.1646,
      "num_input_tokens_seen": 2391770080,
      "step": 3040
    },
    {
      "epoch": 0.3226182898366221,
      "grad_norm": 0.6033602215327001,
      "learning_rate": 4.991655245887126e-05,
      "loss": 2.2344,
      "num_input_tokens_seen": 2392556880,
      "step": 3041
    },
    {
      "epoch": 0.3227243793761935,
      "grad_norm": 0.6588620031138959,
      "learning_rate": 4.9916495713810665e-05,
      "loss": 2.0876,
      "num_input_tokens_seen": 2393343648,
      "step": 3042
    },
    {
      "epoch": 0.3228304689157649,
      "grad_norm": 0.6170726157213862,
      "learning_rate": 4.9916438949495324e-05,
      "loss": 2.2655,
      "num_input_tokens_seen": 2394130448,
      "step": 3043
    },
    {
      "epoch": 0.3229365584553363,
      "grad_norm": 0.6291237531718464,
      "learning_rate": 4.9916382165925304e-05,
      "loss": 2.0758,
      "num_input_tokens_seen": 2394917232,
      "step": 3044
    },
    {
      "epoch": 0.32304264799490773,
      "grad_norm": 1.0300145282061963,
      "learning_rate": 4.9916325363100626e-05,
      "loss": 2.13,
      "num_input_tokens_seen": 2395703904,
      "step": 3045
    },
    {
      "epoch": 0.3231487375344791,
      "grad_norm": 1.2872230823289934,
      "learning_rate": 4.991626854102134e-05,
      "loss": 2.1775,
      "num_input_tokens_seen": 2396490608,
      "step": 3046
    },
    {
      "epoch": 0.3232548270740505,
      "grad_norm": 1.0829424464747537,
      "learning_rate": 4.99162116996875e-05,
      "loss": 2.1531,
      "num_input_tokens_seen": 2397277440,
      "step": 3047
    },
    {
      "epoch": 0.3233609166136219,
      "grad_norm": 0.6429721939261472,
      "learning_rate": 4.991615483909914e-05,
      "loss": 2.103,
      "num_input_tokens_seen": 2398064128,
      "step": 3048
    },
    {
      "epoch": 0.3234670061531933,
      "grad_norm": 0.6717711491872567,
      "learning_rate": 4.99160979592563e-05,
      "loss": 1.9589,
      "num_input_tokens_seen": 2398850944,
      "step": 3049
    },
    {
      "epoch": 0.3235730956927647,
      "grad_norm": 0.5404983663938366,
      "learning_rate": 4.991604106015904e-05,
      "loss": 1.9251,
      "num_input_tokens_seen": 2399637760,
      "step": 3050
    },
    {
      "epoch": 0.3236791852323361,
      "grad_norm": 0.7888173969752236,
      "learning_rate": 4.991598414180739e-05,
      "loss": 2.0626,
      "num_input_tokens_seen": 2400424544,
      "step": 3051
    },
    {
      "epoch": 0.3237852747719075,
      "grad_norm": 0.5312695602646713,
      "learning_rate": 4.9915927204201397e-05,
      "loss": 2.0183,
      "num_input_tokens_seen": 2401211312,
      "step": 3052
    },
    {
      "epoch": 0.3238913643114789,
      "grad_norm": 0.9421109235599575,
      "learning_rate": 4.9915870247341114e-05,
      "loss": 2.0872,
      "num_input_tokens_seen": 2401998128,
      "step": 3053
    },
    {
      "epoch": 0.3239974538510503,
      "grad_norm": 0.8899935743442735,
      "learning_rate": 4.9915813271226566e-05,
      "loss": 2.0198,
      "num_input_tokens_seen": 2402784992,
      "step": 3054
    },
    {
      "epoch": 0.3241035433906217,
      "grad_norm": 0.5651411879741485,
      "learning_rate": 4.9915756275857815e-05,
      "loss": 2.2051,
      "num_input_tokens_seen": 2403571728,
      "step": 3055
    },
    {
      "epoch": 0.32420963293019306,
      "grad_norm": 0.7289810924704206,
      "learning_rate": 4.99156992612349e-05,
      "loss": 1.962,
      "num_input_tokens_seen": 2404358512,
      "step": 3056
    },
    {
      "epoch": 0.3243157224697645,
      "grad_norm": 0.7042037094260156,
      "learning_rate": 4.991564222735786e-05,
      "loss": 2.0051,
      "num_input_tokens_seen": 2405145408,
      "step": 3057
    },
    {
      "epoch": 0.3244218120093359,
      "grad_norm": 1.4338156836460172,
      "learning_rate": 4.991558517422674e-05,
      "loss": 2.2489,
      "num_input_tokens_seen": 2405932192,
      "step": 3058
    },
    {
      "epoch": 0.32452790154890726,
      "grad_norm": 2.3493940178426462,
      "learning_rate": 4.9915528101841594e-05,
      "loss": 2.155,
      "num_input_tokens_seen": 2406718896,
      "step": 3059
    },
    {
      "epoch": 0.3246339910884787,
      "grad_norm": 0.9696995276927975,
      "learning_rate": 4.9915471010202465e-05,
      "loss": 2.1079,
      "num_input_tokens_seen": 2407505664,
      "step": 3060
    },
    {
      "epoch": 0.3247400806280501,
      "grad_norm": 5.108312645705154,
      "learning_rate": 4.991541389930938e-05,
      "loss": 2.0908,
      "num_input_tokens_seen": 2408292448,
      "step": 3061
    },
    {
      "epoch": 0.32484617016762146,
      "grad_norm": 2.8360540095897533,
      "learning_rate": 4.991535676916239e-05,
      "loss": 2.2165,
      "num_input_tokens_seen": 2409079216,
      "step": 3062
    },
    {
      "epoch": 0.3249522597071929,
      "grad_norm": 1.839341215670482,
      "learning_rate": 4.9915299619761556e-05,
      "loss": 2.0431,
      "num_input_tokens_seen": 2409866016,
      "step": 3063
    },
    {
      "epoch": 0.32505834924676424,
      "grad_norm": 1.1979186514195823,
      "learning_rate": 4.9915242451106906e-05,
      "loss": 1.9885,
      "num_input_tokens_seen": 2410652848,
      "step": 3064
    },
    {
      "epoch": 0.32516443878633566,
      "grad_norm": 1.0822286450490346,
      "learning_rate": 4.9915185263198485e-05,
      "loss": 2.1494,
      "num_input_tokens_seen": 2411439568,
      "step": 3065
    },
    {
      "epoch": 0.3252705283259071,
      "grad_norm": 1.113897604359791,
      "learning_rate": 4.9915128056036334e-05,
      "loss": 2.167,
      "num_input_tokens_seen": 2412226320,
      "step": 3066
    },
    {
      "epoch": 0.32537661786547845,
      "grad_norm": 1.3231764812467746,
      "learning_rate": 4.9915070829620515e-05,
      "loss": 2.2482,
      "num_input_tokens_seen": 2413013152,
      "step": 3067
    },
    {
      "epoch": 0.32548270740504986,
      "grad_norm": 0.9723464639841226,
      "learning_rate": 4.9915013583951054e-05,
      "loss": 2.1433,
      "num_input_tokens_seen": 2413799808,
      "step": 3068
    },
    {
      "epoch": 0.3255887969446213,
      "grad_norm": 0.7123329088652308,
      "learning_rate": 4.9914956319028e-05,
      "loss": 2.1459,
      "num_input_tokens_seen": 2414586560,
      "step": 3069
    },
    {
      "epoch": 0.32569488648419265,
      "grad_norm": 0.6135896177961051,
      "learning_rate": 4.9914899034851404e-05,
      "loss": 2.0613,
      "num_input_tokens_seen": 2415373360,
      "step": 3070
    },
    {
      "epoch": 0.32580097602376407,
      "grad_norm": 0.812706650092675,
      "learning_rate": 4.99148417314213e-05,
      "loss": 2.2382,
      "num_input_tokens_seen": 2416160224,
      "step": 3071
    },
    {
      "epoch": 0.32590706556333543,
      "grad_norm": 1.3083124045981165,
      "learning_rate": 4.9914784408737736e-05,
      "loss": 2.0719,
      "num_input_tokens_seen": 2416946976,
      "step": 3072
    },
    {
      "epoch": 0.32601315510290685,
      "grad_norm": 0.5939809333783326,
      "learning_rate": 4.9914727066800764e-05,
      "loss": 2.3734,
      "num_input_tokens_seen": 2417733632,
      "step": 3073
    },
    {
      "epoch": 0.32611924464247827,
      "grad_norm": 1.2389700765021145,
      "learning_rate": 4.9914669705610416e-05,
      "loss": 2.1351,
      "num_input_tokens_seen": 2418520336,
      "step": 3074
    },
    {
      "epoch": 0.32622533418204963,
      "grad_norm": 1.0470624125320067,
      "learning_rate": 4.991461232516675e-05,
      "loss": 2.1327,
      "num_input_tokens_seen": 2419307040,
      "step": 3075
    },
    {
      "epoch": 0.32633142372162105,
      "grad_norm": 1.304895602046646,
      "learning_rate": 4.9914554925469796e-05,
      "loss": 2.1546,
      "num_input_tokens_seen": 2420093776,
      "step": 3076
    },
    {
      "epoch": 0.32643751326119247,
      "grad_norm": 1.6636197026655122,
      "learning_rate": 4.991449750651961e-05,
      "loss": 1.9325,
      "num_input_tokens_seen": 2420880560,
      "step": 3077
    },
    {
      "epoch": 0.32654360280076383,
      "grad_norm": 1.1859409348478576,
      "learning_rate": 4.991444006831622e-05,
      "loss": 2.099,
      "num_input_tokens_seen": 2421667424,
      "step": 3078
    },
    {
      "epoch": 0.32664969234033525,
      "grad_norm": 2.576931714802265,
      "learning_rate": 4.99143826108597e-05,
      "loss": 2.0891,
      "num_input_tokens_seen": 2422454240,
      "step": 3079
    },
    {
      "epoch": 0.3267557818799066,
      "grad_norm": 2.123434807263597,
      "learning_rate": 4.991432513415006e-05,
      "loss": 2.1335,
      "num_input_tokens_seen": 2423241040,
      "step": 3080
    },
    {
      "epoch": 0.32686187141947803,
      "grad_norm": 0.8688938434154716,
      "learning_rate": 4.991426763818737e-05,
      "loss": 2.1932,
      "num_input_tokens_seen": 2424027824,
      "step": 3081
    },
    {
      "epoch": 0.32696796095904945,
      "grad_norm": 0.9264526150975836,
      "learning_rate": 4.991421012297166e-05,
      "loss": 2.2447,
      "num_input_tokens_seen": 2424814736,
      "step": 3082
    },
    {
      "epoch": 0.3270740504986208,
      "grad_norm": 0.8556726672581618,
      "learning_rate": 4.991415258850298e-05,
      "loss": 2.1249,
      "num_input_tokens_seen": 2425601552,
      "step": 3083
    },
    {
      "epoch": 0.32718014003819224,
      "grad_norm": 0.5901793070848024,
      "learning_rate": 4.991409503478138e-05,
      "loss": 2.2936,
      "num_input_tokens_seen": 2426388224,
      "step": 3084
    },
    {
      "epoch": 0.32728622957776365,
      "grad_norm": 0.627630601807219,
      "learning_rate": 4.9914037461806894e-05,
      "loss": 2.1296,
      "num_input_tokens_seen": 2427175024,
      "step": 3085
    },
    {
      "epoch": 0.327392319117335,
      "grad_norm": 0.6665986849474153,
      "learning_rate": 4.991397986957957e-05,
      "loss": 2.1475,
      "num_input_tokens_seen": 2427961840,
      "step": 3086
    },
    {
      "epoch": 0.32749840865690644,
      "grad_norm": 0.6122174674580645,
      "learning_rate": 4.9913922258099454e-05,
      "loss": 2.1279,
      "num_input_tokens_seen": 2428748576,
      "step": 3087
    },
    {
      "epoch": 0.3276044981964778,
      "grad_norm": 0.7236908670993034,
      "learning_rate": 4.991386462736659e-05,
      "loss": 2.1497,
      "num_input_tokens_seen": 2429535248,
      "step": 3088
    },
    {
      "epoch": 0.3277105877360492,
      "grad_norm": 0.9528300390430472,
      "learning_rate": 4.991380697738102e-05,
      "loss": 2.1579,
      "num_input_tokens_seen": 2430322000,
      "step": 3089
    },
    {
      "epoch": 0.32781667727562064,
      "grad_norm": 1.412656054996621,
      "learning_rate": 4.991374930814279e-05,
      "loss": 2.246,
      "num_input_tokens_seen": 2431108704,
      "step": 3090
    },
    {
      "epoch": 0.327922766815192,
      "grad_norm": 0.8054766704538923,
      "learning_rate": 4.9913691619651945e-05,
      "loss": 1.9225,
      "num_input_tokens_seen": 2431895552,
      "step": 3091
    },
    {
      "epoch": 0.3280288563547634,
      "grad_norm": 0.9264166463497691,
      "learning_rate": 4.991363391190854e-05,
      "loss": 2.0993,
      "num_input_tokens_seen": 2432682368,
      "step": 3092
    },
    {
      "epoch": 0.32813494589433484,
      "grad_norm": 0.7158255826626868,
      "learning_rate": 4.99135761849126e-05,
      "loss": 2.1872,
      "num_input_tokens_seen": 2433469184,
      "step": 3093
    },
    {
      "epoch": 0.3282410354339062,
      "grad_norm": 0.7889883104138646,
      "learning_rate": 4.9913518438664186e-05,
      "loss": 2.185,
      "num_input_tokens_seen": 2434255888,
      "step": 3094
    },
    {
      "epoch": 0.3283471249734776,
      "grad_norm": 0.9506502215050965,
      "learning_rate": 4.9913460673163334e-05,
      "loss": 1.9962,
      "num_input_tokens_seen": 2435042704,
      "step": 3095
    },
    {
      "epoch": 0.32845321451304904,
      "grad_norm": 0.9159146227168002,
      "learning_rate": 4.991340288841009e-05,
      "loss": 2.2449,
      "num_input_tokens_seen": 2435829376,
      "step": 3096
    },
    {
      "epoch": 0.3285593040526204,
      "grad_norm": 0.5454622339745563,
      "learning_rate": 4.9913345084404494e-05,
      "loss": 1.9408,
      "num_input_tokens_seen": 2436616160,
      "step": 3097
    },
    {
      "epoch": 0.3286653935921918,
      "grad_norm": 0.6074080962280638,
      "learning_rate": 4.99132872611466e-05,
      "loss": 1.9072,
      "num_input_tokens_seen": 2437402976,
      "step": 3098
    },
    {
      "epoch": 0.3287714831317632,
      "grad_norm": 0.9585253808361143,
      "learning_rate": 4.9913229418636454e-05,
      "loss": 2.1242,
      "num_input_tokens_seen": 2438189808,
      "step": 3099
    },
    {
      "epoch": 0.3288775726713346,
      "grad_norm": 0.6228704650522704,
      "learning_rate": 4.991317155687409e-05,
      "loss": 2.2392,
      "num_input_tokens_seen": 2438976544,
      "step": 3100
    },
    {
      "epoch": 0.328983662210906,
      "grad_norm": 1.1204246754780993,
      "learning_rate": 4.991311367585956e-05,
      "loss": 2.0001,
      "num_input_tokens_seen": 2439763328,
      "step": 3101
    },
    {
      "epoch": 0.3290897517504774,
      "grad_norm": 1.143900003622177,
      "learning_rate": 4.9913055775592906e-05,
      "loss": 2.1749,
      "num_input_tokens_seen": 2440550144,
      "step": 3102
    },
    {
      "epoch": 0.3291958412900488,
      "grad_norm": 0.595842346566983,
      "learning_rate": 4.991299785607417e-05,
      "loss": 1.8739,
      "num_input_tokens_seen": 2441336912,
      "step": 3103
    },
    {
      "epoch": 0.3293019308296202,
      "grad_norm": 1.8053312838498867,
      "learning_rate": 4.9912939917303405e-05,
      "loss": 2.2169,
      "num_input_tokens_seen": 2442123728,
      "step": 3104
    },
    {
      "epoch": 0.3294080203691916,
      "grad_norm": 0.6095654237634431,
      "learning_rate": 4.9912881959280645e-05,
      "loss": 2.0616,
      "num_input_tokens_seen": 2442910544,
      "step": 3105
    },
    {
      "epoch": 0.329514109908763,
      "grad_norm": 1.9488495307314568,
      "learning_rate": 4.9912823982005944e-05,
      "loss": 2.2564,
      "num_input_tokens_seen": 2443697232,
      "step": 3106
    },
    {
      "epoch": 0.32962019944833437,
      "grad_norm": 0.6255614566288389,
      "learning_rate": 4.991276598547935e-05,
      "loss": 2.1945,
      "num_input_tokens_seen": 2444484032,
      "step": 3107
    },
    {
      "epoch": 0.3297262889879058,
      "grad_norm": 1.1468776711629043,
      "learning_rate": 4.9912707969700895e-05,
      "loss": 2.362,
      "num_input_tokens_seen": 2445270704,
      "step": 3108
    },
    {
      "epoch": 0.3298323785274772,
      "grad_norm": 0.8439339799337034,
      "learning_rate": 4.991264993467063e-05,
      "loss": 2.0528,
      "num_input_tokens_seen": 2446057552,
      "step": 3109
    },
    {
      "epoch": 0.3299384680670486,
      "grad_norm": 0.5794033735209234,
      "learning_rate": 4.9912591880388606e-05,
      "loss": 2.2468,
      "num_input_tokens_seen": 2446844240,
      "step": 3110
    },
    {
      "epoch": 0.33004455760662,
      "grad_norm": 0.6146203759435188,
      "learning_rate": 4.991253380685486e-05,
      "loss": 2.1786,
      "num_input_tokens_seen": 2447631008,
      "step": 3111
    },
    {
      "epoch": 0.3301506471461914,
      "grad_norm": 0.8693224207908092,
      "learning_rate": 4.991247571406943e-05,
      "loss": 2.1307,
      "num_input_tokens_seen": 2448417728,
      "step": 3112
    },
    {
      "epoch": 0.3302567366857628,
      "grad_norm": 0.8031949541194353,
      "learning_rate": 4.9912417602032374e-05,
      "loss": 2.249,
      "num_input_tokens_seen": 2449204560,
      "step": 3113
    },
    {
      "epoch": 0.3303628262253342,
      "grad_norm": 1.3986474229365575,
      "learning_rate": 4.991235947074374e-05,
      "loss": 2.3666,
      "num_input_tokens_seen": 2449991280,
      "step": 3114
    },
    {
      "epoch": 0.33046891576490556,
      "grad_norm": 0.5544719256780819,
      "learning_rate": 4.9912301320203556e-05,
      "loss": 2.1263,
      "num_input_tokens_seen": 2450778032,
      "step": 3115
    },
    {
      "epoch": 0.330575005304477,
      "grad_norm": 0.8815928278289263,
      "learning_rate": 4.991224315041188e-05,
      "loss": 1.9991,
      "num_input_tokens_seen": 2451564768,
      "step": 3116
    },
    {
      "epoch": 0.3306810948440484,
      "grad_norm": 0.5917097738239371,
      "learning_rate": 4.991218496136875e-05,
      "loss": 2.0441,
      "num_input_tokens_seen": 2452351632,
      "step": 3117
    },
    {
      "epoch": 0.33078718438361976,
      "grad_norm": 0.8644180655140968,
      "learning_rate": 4.9912126753074216e-05,
      "loss": 2.2396,
      "num_input_tokens_seen": 2453138384,
      "step": 3118
    },
    {
      "epoch": 0.3308932739231912,
      "grad_norm": 0.9166256593094001,
      "learning_rate": 4.991206852552833e-05,
      "loss": 2.099,
      "num_input_tokens_seen": 2453925104,
      "step": 3119
    },
    {
      "epoch": 0.3309993634627626,
      "grad_norm": 0.5425045845842672,
      "learning_rate": 4.9912010278731126e-05,
      "loss": 2.065,
      "num_input_tokens_seen": 2454711840,
      "step": 3120
    },
    {
      "epoch": 0.33110545300233396,
      "grad_norm": 1.2945374660663453,
      "learning_rate": 4.9911952012682646e-05,
      "loss": 2.1148,
      "num_input_tokens_seen": 2455498688,
      "step": 3121
    },
    {
      "epoch": 0.3312115425419054,
      "grad_norm": 0.5593916012317047,
      "learning_rate": 4.991189372738294e-05,
      "loss": 2.1222,
      "num_input_tokens_seen": 2456285424,
      "step": 3122
    },
    {
      "epoch": 0.33131763208147674,
      "grad_norm": 1.6544937337777366,
      "learning_rate": 4.991183542283205e-05,
      "loss": 2.127,
      "num_input_tokens_seen": 2457072224,
      "step": 3123
    },
    {
      "epoch": 0.33142372162104816,
      "grad_norm": 0.8590151595548625,
      "learning_rate": 4.991177709903003e-05,
      "loss": 2.0789,
      "num_input_tokens_seen": 2457858976,
      "step": 3124
    },
    {
      "epoch": 0.3315298111606196,
      "grad_norm": 2.3270586266960027,
      "learning_rate": 4.991171875597692e-05,
      "loss": 2.1228,
      "num_input_tokens_seen": 2458645760,
      "step": 3125
    },
    {
      "epoch": 0.33163590070019094,
      "grad_norm": 1.6310468226906198,
      "learning_rate": 4.991166039367277e-05,
      "loss": 2.1009,
      "num_input_tokens_seen": 2459432528,
      "step": 3126
    },
    {
      "epoch": 0.33174199023976236,
      "grad_norm": 1.5448565488259443,
      "learning_rate": 4.9911602012117617e-05,
      "loss": 2.4129,
      "num_input_tokens_seen": 2460219376,
      "step": 3127
    },
    {
      "epoch": 0.3318480797793338,
      "grad_norm": 1.4788810473375242,
      "learning_rate": 4.991154361131151e-05,
      "loss": 2.2061,
      "num_input_tokens_seen": 2461006144,
      "step": 3128
    },
    {
      "epoch": 0.33195416931890515,
      "grad_norm": 1.0099781423554235,
      "learning_rate": 4.991148519125448e-05,
      "loss": 2.306,
      "num_input_tokens_seen": 2461792832,
      "step": 3129
    },
    {
      "epoch": 0.33206025885847656,
      "grad_norm": 0.9616827979207381,
      "learning_rate": 4.9911426751946596e-05,
      "loss": 2.336,
      "num_input_tokens_seen": 2462579680,
      "step": 3130
    },
    {
      "epoch": 0.33216634839804793,
      "grad_norm": 1.2226674022766524,
      "learning_rate": 4.99113682933879e-05,
      "loss": 2.237,
      "num_input_tokens_seen": 2463366416,
      "step": 3131
    },
    {
      "epoch": 0.33227243793761935,
      "grad_norm": 0.740631122111528,
      "learning_rate": 4.991130981557841e-05,
      "loss": 2.1897,
      "num_input_tokens_seen": 2464153152,
      "step": 3132
    },
    {
      "epoch": 0.33237852747719077,
      "grad_norm": 1.0678598826871357,
      "learning_rate": 4.9911251318518205e-05,
      "loss": 2.1979,
      "num_input_tokens_seen": 2464939904,
      "step": 3133
    },
    {
      "epoch": 0.33248461701676213,
      "grad_norm": 0.694271151565869,
      "learning_rate": 4.991119280220731e-05,
      "loss": 2.0634,
      "num_input_tokens_seen": 2465726720,
      "step": 3134
    },
    {
      "epoch": 0.33259070655633355,
      "grad_norm": 1.2468987792809831,
      "learning_rate": 4.991113426664578e-05,
      "loss": 2.2124,
      "num_input_tokens_seen": 2466513424,
      "step": 3135
    },
    {
      "epoch": 0.33269679609590497,
      "grad_norm": 0.7723982580438054,
      "learning_rate": 4.991107571183366e-05,
      "loss": 2.0853,
      "num_input_tokens_seen": 2467300160,
      "step": 3136
    },
    {
      "epoch": 0.33280288563547633,
      "grad_norm": 0.5885159879836059,
      "learning_rate": 4.9911017137770976e-05,
      "loss": 2.1392,
      "num_input_tokens_seen": 2468086960,
      "step": 3137
    },
    {
      "epoch": 0.33290897517504775,
      "grad_norm": 0.7341723425046991,
      "learning_rate": 4.99109585444578e-05,
      "loss": 2.1117,
      "num_input_tokens_seen": 2468873680,
      "step": 3138
    },
    {
      "epoch": 0.3330150647146191,
      "grad_norm": 0.7315699063140859,
      "learning_rate": 4.991089993189417e-05,
      "loss": 2.153,
      "num_input_tokens_seen": 2469660336,
      "step": 3139
    },
    {
      "epoch": 0.33312115425419053,
      "grad_norm": 0.6609365888340736,
      "learning_rate": 4.991084130008012e-05,
      "loss": 2.06,
      "num_input_tokens_seen": 2470447104,
      "step": 3140
    },
    {
      "epoch": 0.33322724379376195,
      "grad_norm": 0.6647747740717074,
      "learning_rate": 4.9910782649015707e-05,
      "loss": 2.0892,
      "num_input_tokens_seen": 2471233904,
      "step": 3141
    },
    {
      "epoch": 0.3333333333333333,
      "grad_norm": 0.529380720499037,
      "learning_rate": 4.9910723978700966e-05,
      "loss": 2.0974,
      "num_input_tokens_seen": 2472020624,
      "step": 3142
    },
    {
      "epoch": 0.33343942287290473,
      "grad_norm": 0.6911293751697509,
      "learning_rate": 4.991066528913596e-05,
      "loss": 2.0171,
      "num_input_tokens_seen": 2472807408,
      "step": 3143
    },
    {
      "epoch": 0.33354551241247615,
      "grad_norm": 0.5163990501480477,
      "learning_rate": 4.991060658032071e-05,
      "loss": 2.1189,
      "num_input_tokens_seen": 2473594192,
      "step": 3144
    },
    {
      "epoch": 0.3336516019520475,
      "grad_norm": 0.5393823833078347,
      "learning_rate": 4.991054785225528e-05,
      "loss": 2.012,
      "num_input_tokens_seen": 2474380960,
      "step": 3145
    },
    {
      "epoch": 0.33375769149161894,
      "grad_norm": 0.6063930586295113,
      "learning_rate": 4.9910489104939704e-05,
      "loss": 2.2097,
      "num_input_tokens_seen": 2475167776,
      "step": 3146
    },
    {
      "epoch": 0.3338637810311903,
      "grad_norm": 0.48917081048465505,
      "learning_rate": 4.991043033837405e-05,
      "loss": 1.9808,
      "num_input_tokens_seen": 2475954576,
      "step": 3147
    },
    {
      "epoch": 0.3339698705707617,
      "grad_norm": 0.8965871209489908,
      "learning_rate": 4.9910371552558335e-05,
      "loss": 2.2033,
      "num_input_tokens_seen": 2476741376,
      "step": 3148
    },
    {
      "epoch": 0.33407596011033314,
      "grad_norm": 0.6424012317129729,
      "learning_rate": 4.991031274749261e-05,
      "loss": 2.1917,
      "num_input_tokens_seen": 2477528128,
      "step": 3149
    },
    {
      "epoch": 0.3341820496499045,
      "grad_norm": 0.5187245577543992,
      "learning_rate": 4.9910253923176934e-05,
      "loss": 1.9091,
      "num_input_tokens_seen": 2478314944,
      "step": 3150
    },
    {
      "epoch": 0.3342881391894759,
      "grad_norm": 0.8861506386669457,
      "learning_rate": 4.991019507961134e-05,
      "loss": 2.1767,
      "num_input_tokens_seen": 2479101696,
      "step": 3151
    },
    {
      "epoch": 0.33439422872904734,
      "grad_norm": 1.28785715345106,
      "learning_rate": 4.991013621679588e-05,
      "loss": 2.1783,
      "num_input_tokens_seen": 2479888416,
      "step": 3152
    },
    {
      "epoch": 0.3345003182686187,
      "grad_norm": 0.538555536792398,
      "learning_rate": 4.99100773347306e-05,
      "loss": 2.3088,
      "num_input_tokens_seen": 2480675168,
      "step": 3153
    },
    {
      "epoch": 0.3346064078081901,
      "grad_norm": 0.7841940527826008,
      "learning_rate": 4.991001843341554e-05,
      "loss": 2.2592,
      "num_input_tokens_seen": 2481461744,
      "step": 3154
    },
    {
      "epoch": 0.3347124973477615,
      "grad_norm": 0.8162350633442926,
      "learning_rate": 4.9909959512850744e-05,
      "loss": 2.2932,
      "num_input_tokens_seen": 2482248608,
      "step": 3155
    },
    {
      "epoch": 0.3348185868873329,
      "grad_norm": 2.140376860857282,
      "learning_rate": 4.990990057303627e-05,
      "loss": 2.1548,
      "num_input_tokens_seen": 2483035408,
      "step": 3156
    },
    {
      "epoch": 0.3349246764269043,
      "grad_norm": 1.2169555036659037,
      "learning_rate": 4.990984161397216e-05,
      "loss": 2.1581,
      "num_input_tokens_seen": 2483822224,
      "step": 3157
    },
    {
      "epoch": 0.3350307659664757,
      "grad_norm": 1.2710556423779562,
      "learning_rate": 4.990978263565844e-05,
      "loss": 1.9841,
      "num_input_tokens_seen": 2484608944,
      "step": 3158
    },
    {
      "epoch": 0.3351368555060471,
      "grad_norm": 1.1319573568298726,
      "learning_rate": 4.9909723638095185e-05,
      "loss": 2.0707,
      "num_input_tokens_seen": 2485395744,
      "step": 3159
    },
    {
      "epoch": 0.3352429450456185,
      "grad_norm": 1.6646346421571427,
      "learning_rate": 4.9909664621282427e-05,
      "loss": 2.1676,
      "num_input_tokens_seen": 2486182448,
      "step": 3160
    },
    {
      "epoch": 0.3353490345851899,
      "grad_norm": 0.9092899845763631,
      "learning_rate": 4.99096055852202e-05,
      "loss": 2.3422,
      "num_input_tokens_seen": 2486969200,
      "step": 3161
    },
    {
      "epoch": 0.3354551241247613,
      "grad_norm": 1.0212008398269128,
      "learning_rate": 4.990954652990857e-05,
      "loss": 2.1505,
      "num_input_tokens_seen": 2487755984,
      "step": 3162
    },
    {
      "epoch": 0.33556121366433267,
      "grad_norm": 0.7854670451637915,
      "learning_rate": 4.990948745534757e-05,
      "loss": 2.0817,
      "num_input_tokens_seen": 2488542784,
      "step": 3163
    },
    {
      "epoch": 0.3356673032039041,
      "grad_norm": 0.7951085053963055,
      "learning_rate": 4.990942836153725e-05,
      "loss": 2.3133,
      "num_input_tokens_seen": 2489329568,
      "step": 3164
    },
    {
      "epoch": 0.3357733927434755,
      "grad_norm": 0.8540893678742926,
      "learning_rate": 4.990936924847765e-05,
      "loss": 1.9228,
      "num_input_tokens_seen": 2490116464,
      "step": 3165
    },
    {
      "epoch": 0.33587948228304687,
      "grad_norm": 0.7802031616542885,
      "learning_rate": 4.990931011616882e-05,
      "loss": 1.9006,
      "num_input_tokens_seen": 2490903264,
      "step": 3166
    },
    {
      "epoch": 0.3359855718226183,
      "grad_norm": 0.9727532668510283,
      "learning_rate": 4.990925096461081e-05,
      "loss": 2.108,
      "num_input_tokens_seen": 2491689968,
      "step": 3167
    },
    {
      "epoch": 0.3360916613621897,
      "grad_norm": 1.1889825769696636,
      "learning_rate": 4.9909191793803664e-05,
      "loss": 2.2058,
      "num_input_tokens_seen": 2492476736,
      "step": 3168
    },
    {
      "epoch": 0.33619775090176107,
      "grad_norm": 0.8421377596645637,
      "learning_rate": 4.990913260374742e-05,
      "loss": 2.0326,
      "num_input_tokens_seen": 2493263488,
      "step": 3169
    },
    {
      "epoch": 0.3363038404413325,
      "grad_norm": 0.6608152679199687,
      "learning_rate": 4.9909073394442135e-05,
      "loss": 2.1838,
      "num_input_tokens_seen": 2494050272,
      "step": 3170
    },
    {
      "epoch": 0.3364099299809039,
      "grad_norm": 0.6775985346085267,
      "learning_rate": 4.990901416588785e-05,
      "loss": 2.3726,
      "num_input_tokens_seen": 2494836992,
      "step": 3171
    },
    {
      "epoch": 0.3365160195204753,
      "grad_norm": 0.7139760124338561,
      "learning_rate": 4.99089549180846e-05,
      "loss": 2.147,
      "num_input_tokens_seen": 2495623792,
      "step": 3172
    },
    {
      "epoch": 0.3366221090600467,
      "grad_norm": 0.5247770373766019,
      "learning_rate": 4.990889565103245e-05,
      "loss": 2.0606,
      "num_input_tokens_seen": 2496410496,
      "step": 3173
    },
    {
      "epoch": 0.33672819859961806,
      "grad_norm": 0.6247073145928933,
      "learning_rate": 4.990883636473143e-05,
      "loss": 2.2006,
      "num_input_tokens_seen": 2497197248,
      "step": 3174
    },
    {
      "epoch": 0.3368342881391895,
      "grad_norm": 0.7204101427854812,
      "learning_rate": 4.990877705918159e-05,
      "loss": 2.1564,
      "num_input_tokens_seen": 2497984064,
      "step": 3175
    },
    {
      "epoch": 0.3369403776787609,
      "grad_norm": 0.7299292378894523,
      "learning_rate": 4.9908717734382985e-05,
      "loss": 2.01,
      "num_input_tokens_seen": 2498770928,
      "step": 3176
    },
    {
      "epoch": 0.33704646721833226,
      "grad_norm": 1.2287678993742246,
      "learning_rate": 4.990865839033565e-05,
      "loss": 2.1188,
      "num_input_tokens_seen": 2499557808,
      "step": 3177
    },
    {
      "epoch": 0.3371525567579037,
      "grad_norm": 0.6470743405056081,
      "learning_rate": 4.990859902703964e-05,
      "loss": 2.1399,
      "num_input_tokens_seen": 2500344608,
      "step": 3178
    },
    {
      "epoch": 0.3372586462974751,
      "grad_norm": 0.7335399682593566,
      "learning_rate": 4.990853964449499e-05,
      "loss": 2.0104,
      "num_input_tokens_seen": 2501131360,
      "step": 3179
    },
    {
      "epoch": 0.33736473583704646,
      "grad_norm": 0.7476954606990609,
      "learning_rate": 4.990848024270175e-05,
      "loss": 2.1565,
      "num_input_tokens_seen": 2501918112,
      "step": 3180
    },
    {
      "epoch": 0.3374708253766179,
      "grad_norm": 0.508458688566033,
      "learning_rate": 4.990842082165997e-05,
      "loss": 2.1045,
      "num_input_tokens_seen": 2502704880,
      "step": 3181
    },
    {
      "epoch": 0.33757691491618924,
      "grad_norm": 0.629318912326259,
      "learning_rate": 4.99083613813697e-05,
      "loss": 2.0822,
      "num_input_tokens_seen": 2503491696,
      "step": 3182
    },
    {
      "epoch": 0.33768300445576066,
      "grad_norm": 0.6021269914603554,
      "learning_rate": 4.990830192183097e-05,
      "loss": 2.0602,
      "num_input_tokens_seen": 2504278528,
      "step": 3183
    },
    {
      "epoch": 0.3377890939953321,
      "grad_norm": 0.6428856554846357,
      "learning_rate": 4.990824244304384e-05,
      "loss": 2.2468,
      "num_input_tokens_seen": 2505065312,
      "step": 3184
    },
    {
      "epoch": 0.33789518353490344,
      "grad_norm": 0.6902505118057499,
      "learning_rate": 4.990818294500835e-05,
      "loss": 2.2748,
      "num_input_tokens_seen": 2505851968,
      "step": 3185
    },
    {
      "epoch": 0.33800127307447486,
      "grad_norm": 0.557080321124086,
      "learning_rate": 4.990812342772454e-05,
      "loss": 2.1026,
      "num_input_tokens_seen": 2506638688,
      "step": 3186
    },
    {
      "epoch": 0.3381073626140463,
      "grad_norm": 0.6501818724055892,
      "learning_rate": 4.990806389119247e-05,
      "loss": 2.1217,
      "num_input_tokens_seen": 2507425408,
      "step": 3187
    },
    {
      "epoch": 0.33821345215361764,
      "grad_norm": 0.5533361551487439,
      "learning_rate": 4.990800433541219e-05,
      "loss": 2.0578,
      "num_input_tokens_seen": 2508212240,
      "step": 3188
    },
    {
      "epoch": 0.33831954169318906,
      "grad_norm": 0.7078529209722424,
      "learning_rate": 4.990794476038371e-05,
      "loss": 2.1512,
      "num_input_tokens_seen": 2508998896,
      "step": 3189
    },
    {
      "epoch": 0.3384256312327604,
      "grad_norm": 0.6700720096452187,
      "learning_rate": 4.9907885166107114e-05,
      "loss": 2.226,
      "num_input_tokens_seen": 2509785680,
      "step": 3190
    },
    {
      "epoch": 0.33853172077233185,
      "grad_norm": 0.6798837349266222,
      "learning_rate": 4.9907825552582447e-05,
      "loss": 2.047,
      "num_input_tokens_seen": 2510572464,
      "step": 3191
    },
    {
      "epoch": 0.33863781031190326,
      "grad_norm": 1.3341040475761408,
      "learning_rate": 4.990776591980972e-05,
      "loss": 2.147,
      "num_input_tokens_seen": 2511359168,
      "step": 3192
    },
    {
      "epoch": 0.33874389985147463,
      "grad_norm": 0.7032093560087468,
      "learning_rate": 4.990770626778902e-05,
      "loss": 2.1275,
      "num_input_tokens_seen": 2512145968,
      "step": 3193
    },
    {
      "epoch": 0.33884998939104605,
      "grad_norm": 0.8119205163791442,
      "learning_rate": 4.990764659652037e-05,
      "loss": 2.1517,
      "num_input_tokens_seen": 2512932736,
      "step": 3194
    },
    {
      "epoch": 0.33895607893061747,
      "grad_norm": 0.48201777881487456,
      "learning_rate": 4.990758690600382e-05,
      "loss": 1.9385,
      "num_input_tokens_seen": 2513719488,
      "step": 3195
    },
    {
      "epoch": 0.33906216847018883,
      "grad_norm": 0.7469228266179138,
      "learning_rate": 4.990752719623942e-05,
      "loss": 2.1363,
      "num_input_tokens_seen": 2514506304,
      "step": 3196
    },
    {
      "epoch": 0.33916825800976025,
      "grad_norm": 0.9885887617394973,
      "learning_rate": 4.990746746722721e-05,
      "loss": 2.0356,
      "num_input_tokens_seen": 2515293088,
      "step": 3197
    },
    {
      "epoch": 0.3392743475493316,
      "grad_norm": 1.4402785532247566,
      "learning_rate": 4.9907407718967246e-05,
      "loss": 2.3058,
      "num_input_tokens_seen": 2516079712,
      "step": 3198
    },
    {
      "epoch": 0.33938043708890303,
      "grad_norm": 0.6546648762748362,
      "learning_rate": 4.990734795145956e-05,
      "loss": 2.0092,
      "num_input_tokens_seen": 2516866528,
      "step": 3199
    },
    {
      "epoch": 0.33948652662847445,
      "grad_norm": 1.0117952250513202,
      "learning_rate": 4.990728816470421e-05,
      "loss": 1.9991,
      "num_input_tokens_seen": 2517653328,
      "step": 3200
    },
    {
      "epoch": 0.3395926161680458,
      "grad_norm": 0.5191512962713554,
      "learning_rate": 4.990722835870124e-05,
      "loss": 2.1767,
      "num_input_tokens_seen": 2518440096,
      "step": 3201
    },
    {
      "epoch": 0.33969870570761723,
      "grad_norm": 1.0341976521863265,
      "learning_rate": 4.99071685334507e-05,
      "loss": 2.1455,
      "num_input_tokens_seen": 2519226880,
      "step": 3202
    },
    {
      "epoch": 0.33980479524718865,
      "grad_norm": 0.6870611479074424,
      "learning_rate": 4.990710868895262e-05,
      "loss": 2.2576,
      "num_input_tokens_seen": 2520013616,
      "step": 3203
    },
    {
      "epoch": 0.33991088478676,
      "grad_norm": 0.9825057886737941,
      "learning_rate": 4.990704882520706e-05,
      "loss": 2.0095,
      "num_input_tokens_seen": 2520800432,
      "step": 3204
    },
    {
      "epoch": 0.34001697432633143,
      "grad_norm": 0.7147202763755867,
      "learning_rate": 4.9906988942214076e-05,
      "loss": 2.1566,
      "num_input_tokens_seen": 2521587248,
      "step": 3205
    },
    {
      "epoch": 0.3401230638659028,
      "grad_norm": 0.7888530583286629,
      "learning_rate": 4.990692903997369e-05,
      "loss": 2.002,
      "num_input_tokens_seen": 2522374096,
      "step": 3206
    },
    {
      "epoch": 0.3402291534054742,
      "grad_norm": 0.9773376600225137,
      "learning_rate": 4.9906869118485954e-05,
      "loss": 2.2869,
      "num_input_tokens_seen": 2523160816,
      "step": 3207
    },
    {
      "epoch": 0.34033524294504564,
      "grad_norm": 1.428940141067027,
      "learning_rate": 4.9906809177750934e-05,
      "loss": 2.1482,
      "num_input_tokens_seen": 2523947568,
      "step": 3208
    },
    {
      "epoch": 0.340441332484617,
      "grad_norm": 0.8524050530017131,
      "learning_rate": 4.9906749217768656e-05,
      "loss": 2.1417,
      "num_input_tokens_seen": 2524734304,
      "step": 3209
    },
    {
      "epoch": 0.3405474220241884,
      "grad_norm": 0.8412900952609137,
      "learning_rate": 4.990668923853917e-05,
      "loss": 2.3248,
      "num_input_tokens_seen": 2525521088,
      "step": 3210
    },
    {
      "epoch": 0.34065351156375984,
      "grad_norm": 0.9409939997262723,
      "learning_rate": 4.990662924006253e-05,
      "loss": 2.0753,
      "num_input_tokens_seen": 2526307920,
      "step": 3211
    },
    {
      "epoch": 0.3407596011033312,
      "grad_norm": 1.268055161752903,
      "learning_rate": 4.9906569222338786e-05,
      "loss": 2.3007,
      "num_input_tokens_seen": 2527094656,
      "step": 3212
    },
    {
      "epoch": 0.3408656906429026,
      "grad_norm": 0.5717803952097134,
      "learning_rate": 4.990650918536796e-05,
      "loss": 2.2988,
      "num_input_tokens_seen": 2527881472,
      "step": 3213
    },
    {
      "epoch": 0.340971780182474,
      "grad_norm": 0.681439747458764,
      "learning_rate": 4.990644912915012e-05,
      "loss": 2.0354,
      "num_input_tokens_seen": 2528668176,
      "step": 3214
    },
    {
      "epoch": 0.3410778697220454,
      "grad_norm": 0.6970426446017837,
      "learning_rate": 4.990638905368531e-05,
      "loss": 2.2684,
      "num_input_tokens_seen": 2529454912,
      "step": 3215
    },
    {
      "epoch": 0.3411839592616168,
      "grad_norm": 0.6514828627595288,
      "learning_rate": 4.990632895897357e-05,
      "loss": 2.0457,
      "num_input_tokens_seen": 2530241648,
      "step": 3216
    },
    {
      "epoch": 0.3412900488011882,
      "grad_norm": 0.788459551947552,
      "learning_rate": 4.990626884501496e-05,
      "loss": 2.1344,
      "num_input_tokens_seen": 2531028320,
      "step": 3217
    },
    {
      "epoch": 0.3413961383407596,
      "grad_norm": 0.7583786076293989,
      "learning_rate": 4.99062087118095e-05,
      "loss": 2.0473,
      "num_input_tokens_seen": 2531815120,
      "step": 3218
    },
    {
      "epoch": 0.341502227880331,
      "grad_norm": 0.5948292470416291,
      "learning_rate": 4.9906148559357266e-05,
      "loss": 2.0019,
      "num_input_tokens_seen": 2532601824,
      "step": 3219
    },
    {
      "epoch": 0.3416083174199024,
      "grad_norm": 0.8388865312232269,
      "learning_rate": 4.9906088387658276e-05,
      "loss": 2.0707,
      "num_input_tokens_seen": 2533388528,
      "step": 3220
    },
    {
      "epoch": 0.3417144069594738,
      "grad_norm": 0.5516199487783021,
      "learning_rate": 4.9906028196712604e-05,
      "loss": 2.2343,
      "num_input_tokens_seen": 2534175312,
      "step": 3221
    },
    {
      "epoch": 0.34182049649904517,
      "grad_norm": 0.9572706677469068,
      "learning_rate": 4.990596798652028e-05,
      "loss": 2.1393,
      "num_input_tokens_seen": 2534962128,
      "step": 3222
    },
    {
      "epoch": 0.3419265860386166,
      "grad_norm": 0.8509201961544381,
      "learning_rate": 4.990590775708136e-05,
      "loss": 2.0395,
      "num_input_tokens_seen": 2535748992,
      "step": 3223
    },
    {
      "epoch": 0.342032675578188,
      "grad_norm": 1.0903487410527224,
      "learning_rate": 4.9905847508395885e-05,
      "loss": 2.0036,
      "num_input_tokens_seen": 2536535744,
      "step": 3224
    },
    {
      "epoch": 0.34213876511775937,
      "grad_norm": 0.9009865019603273,
      "learning_rate": 4.9905787240463896e-05,
      "loss": 2.2354,
      "num_input_tokens_seen": 2537322528,
      "step": 3225
    },
    {
      "epoch": 0.3422448546573308,
      "grad_norm": 0.7795642064042082,
      "learning_rate": 4.990572695328545e-05,
      "loss": 2.0426,
      "num_input_tokens_seen": 2538109280,
      "step": 3226
    },
    {
      "epoch": 0.3423509441969022,
      "grad_norm": 0.7267512814988273,
      "learning_rate": 4.990566664686058e-05,
      "loss": 2.3121,
      "num_input_tokens_seen": 2538895984,
      "step": 3227
    },
    {
      "epoch": 0.34245703373647357,
      "grad_norm": 0.9907877983994615,
      "learning_rate": 4.990560632118936e-05,
      "loss": 2.1483,
      "num_input_tokens_seen": 2539682752,
      "step": 3228
    },
    {
      "epoch": 0.342563123276045,
      "grad_norm": 0.9489530152484151,
      "learning_rate": 4.99055459762718e-05,
      "loss": 2.0464,
      "num_input_tokens_seen": 2540469520,
      "step": 3229
    },
    {
      "epoch": 0.34266921281561635,
      "grad_norm": 0.9623846271844896,
      "learning_rate": 4.990548561210797e-05,
      "loss": 2.128,
      "num_input_tokens_seen": 2541256304,
      "step": 3230
    },
    {
      "epoch": 0.34277530235518777,
      "grad_norm": 0.9702681903384585,
      "learning_rate": 4.990542522869791e-05,
      "loss": 2.0693,
      "num_input_tokens_seen": 2542043056,
      "step": 3231
    },
    {
      "epoch": 0.3428813918947592,
      "grad_norm": 0.6003152232981632,
      "learning_rate": 4.990536482604168e-05,
      "loss": 2.0087,
      "num_input_tokens_seen": 2542829792,
      "step": 3232
    },
    {
      "epoch": 0.34298748143433055,
      "grad_norm": 0.6605002394594122,
      "learning_rate": 4.99053044041393e-05,
      "loss": 2.0558,
      "num_input_tokens_seen": 2543616560,
      "step": 3233
    },
    {
      "epoch": 0.343093570973902,
      "grad_norm": 0.8161898134443577,
      "learning_rate": 4.990524396299084e-05,
      "loss": 2.238,
      "num_input_tokens_seen": 2544403312,
      "step": 3234
    },
    {
      "epoch": 0.3431996605134734,
      "grad_norm": 0.6681934739459819,
      "learning_rate": 4.990518350259633e-05,
      "loss": 2.1572,
      "num_input_tokens_seen": 2545189984,
      "step": 3235
    },
    {
      "epoch": 0.34330575005304476,
      "grad_norm": 0.98244822408259,
      "learning_rate": 4.9905123022955833e-05,
      "loss": 2.2102,
      "num_input_tokens_seen": 2545976672,
      "step": 3236
    },
    {
      "epoch": 0.3434118395926162,
      "grad_norm": 0.4774282522290806,
      "learning_rate": 4.990506252406939e-05,
      "loss": 1.9954,
      "num_input_tokens_seen": 2546763424,
      "step": 3237
    },
    {
      "epoch": 0.3435179291321876,
      "grad_norm": 0.9722824096016809,
      "learning_rate": 4.990500200593704e-05,
      "loss": 2.0943,
      "num_input_tokens_seen": 2547550176,
      "step": 3238
    },
    {
      "epoch": 0.34362401867175896,
      "grad_norm": 0.6629971985879132,
      "learning_rate": 4.9904941468558836e-05,
      "loss": 2.3872,
      "num_input_tokens_seen": 2548336832,
      "step": 3239
    },
    {
      "epoch": 0.3437301082113304,
      "grad_norm": 1.014867879017706,
      "learning_rate": 4.990488091193482e-05,
      "loss": 2.0708,
      "num_input_tokens_seen": 2549123648,
      "step": 3240
    },
    {
      "epoch": 0.34383619775090174,
      "grad_norm": 0.6995594775501792,
      "learning_rate": 4.990482033606505e-05,
      "loss": 2.2392,
      "num_input_tokens_seen": 2549910384,
      "step": 3241
    },
    {
      "epoch": 0.34394228729047316,
      "grad_norm": 0.6933809484082395,
      "learning_rate": 4.9904759740949557e-05,
      "loss": 2.062,
      "num_input_tokens_seen": 2550697248,
      "step": 3242
    },
    {
      "epoch": 0.3440483768300446,
      "grad_norm": 0.9094767213474472,
      "learning_rate": 4.9904699126588404e-05,
      "loss": 2.2316,
      "num_input_tokens_seen": 2551483984,
      "step": 3243
    },
    {
      "epoch": 0.34415446636961594,
      "grad_norm": 1.060287533152374,
      "learning_rate": 4.990463849298163e-05,
      "loss": 2.0611,
      "num_input_tokens_seen": 2552270704,
      "step": 3244
    },
    {
      "epoch": 0.34426055590918736,
      "grad_norm": 0.6138671124021011,
      "learning_rate": 4.990457784012928e-05,
      "loss": 2.1646,
      "num_input_tokens_seen": 2553057568,
      "step": 3245
    },
    {
      "epoch": 0.3443666454487588,
      "grad_norm": 0.9374477125268084,
      "learning_rate": 4.9904517168031404e-05,
      "loss": 2.1576,
      "num_input_tokens_seen": 2553844416,
      "step": 3246
    },
    {
      "epoch": 0.34447273498833014,
      "grad_norm": 1.0697271012619507,
      "learning_rate": 4.990445647668804e-05,
      "loss": 2.1002,
      "num_input_tokens_seen": 2554631168,
      "step": 3247
    },
    {
      "epoch": 0.34457882452790156,
      "grad_norm": 0.6276494360487208,
      "learning_rate": 4.9904395766099257e-05,
      "loss": 1.9338,
      "num_input_tokens_seen": 2555418032,
      "step": 3248
    },
    {
      "epoch": 0.3446849140674729,
      "grad_norm": 0.7707992824676153,
      "learning_rate": 4.9904335036265084e-05,
      "loss": 2.0695,
      "num_input_tokens_seen": 2556204784,
      "step": 3249
    },
    {
      "epoch": 0.34479100360704434,
      "grad_norm": 1.0062518898181114,
      "learning_rate": 4.9904274287185563e-05,
      "loss": 2.1678,
      "num_input_tokens_seen": 2556991456,
      "step": 3250
    },
    {
      "epoch": 0.34489709314661576,
      "grad_norm": 2.5893612257729037,
      "learning_rate": 4.9904213518860757e-05,
      "loss": 2.2587,
      "num_input_tokens_seen": 2557778160,
      "step": 3251
    },
    {
      "epoch": 0.3450031826861871,
      "grad_norm": 1.2237101512917885,
      "learning_rate": 4.99041527312907e-05,
      "loss": 2.1125,
      "num_input_tokens_seen": 2558564912,
      "step": 3252
    },
    {
      "epoch": 0.34510927222575855,
      "grad_norm": 3.431802477860824,
      "learning_rate": 4.9904091924475446e-05,
      "loss": 2.2504,
      "num_input_tokens_seen": 2559351584,
      "step": 3253
    },
    {
      "epoch": 0.34521536176532996,
      "grad_norm": 1.4448991688167163,
      "learning_rate": 4.990403109841505e-05,
      "loss": 2.0166,
      "num_input_tokens_seen": 2560138320,
      "step": 3254
    },
    {
      "epoch": 0.34532145130490133,
      "grad_norm": 0.863049666902152,
      "learning_rate": 4.990397025310953e-05,
      "loss": 2.1437,
      "num_input_tokens_seen": 2560925216,
      "step": 3255
    },
    {
      "epoch": 0.34542754084447275,
      "grad_norm": 1.349013703727488,
      "learning_rate": 4.990390938855897e-05,
      "loss": 2.0864,
      "num_input_tokens_seen": 2561712096,
      "step": 3256
    },
    {
      "epoch": 0.3455336303840441,
      "grad_norm": 0.7600863790501394,
      "learning_rate": 4.990384850476339e-05,
      "loss": 1.9731,
      "num_input_tokens_seen": 2562498912,
      "step": 3257
    },
    {
      "epoch": 0.34563971992361553,
      "grad_norm": 1.1904269190131254,
      "learning_rate": 4.9903787601722854e-05,
      "loss": 2.1669,
      "num_input_tokens_seen": 2563285648,
      "step": 3258
    },
    {
      "epoch": 0.34574580946318695,
      "grad_norm": 0.8412960861055844,
      "learning_rate": 4.99037266794374e-05,
      "loss": 2.0832,
      "num_input_tokens_seen": 2564072352,
      "step": 3259
    },
    {
      "epoch": 0.3458518990027583,
      "grad_norm": 0.6203889629911411,
      "learning_rate": 4.9903665737907076e-05,
      "loss": 2.2049,
      "num_input_tokens_seen": 2564859040,
      "step": 3260
    },
    {
      "epoch": 0.34595798854232973,
      "grad_norm": 0.9411635430740413,
      "learning_rate": 4.990360477713193e-05,
      "loss": 2.0139,
      "num_input_tokens_seen": 2565645888,
      "step": 3261
    },
    {
      "epoch": 0.34606407808190115,
      "grad_norm": 0.709771281607945,
      "learning_rate": 4.990354379711201e-05,
      "loss": 2.18,
      "num_input_tokens_seen": 2566432576,
      "step": 3262
    },
    {
      "epoch": 0.3461701676214725,
      "grad_norm": 0.739827974625655,
      "learning_rate": 4.9903482797847355e-05,
      "loss": 2.1583,
      "num_input_tokens_seen": 2567219360,
      "step": 3263
    },
    {
      "epoch": 0.34627625716104393,
      "grad_norm": 0.9424223783925827,
      "learning_rate": 4.9903421779338025e-05,
      "loss": 2.1244,
      "num_input_tokens_seen": 2568006160,
      "step": 3264
    },
    {
      "epoch": 0.3463823467006153,
      "grad_norm": 1.530090240869124,
      "learning_rate": 4.990336074158406e-05,
      "loss": 2.1563,
      "num_input_tokens_seen": 2568792960,
      "step": 3265
    },
    {
      "epoch": 0.3464884362401867,
      "grad_norm": 0.8418082012062547,
      "learning_rate": 4.9903299684585504e-05,
      "loss": 2.2578,
      "num_input_tokens_seen": 2569579760,
      "step": 3266
    },
    {
      "epoch": 0.34659452577975813,
      "grad_norm": 1.6334659952563628,
      "learning_rate": 4.9903238608342414e-05,
      "loss": 2.1282,
      "num_input_tokens_seen": 2570366560,
      "step": 3267
    },
    {
      "epoch": 0.3467006153193295,
      "grad_norm": 0.7991925361230021,
      "learning_rate": 4.990317751285483e-05,
      "loss": 2.0364,
      "num_input_tokens_seen": 2571153408,
      "step": 3268
    },
    {
      "epoch": 0.3468067048589009,
      "grad_norm": 1.02406055333491,
      "learning_rate": 4.990311639812281e-05,
      "loss": 2.1766,
      "num_input_tokens_seen": 2571940112,
      "step": 3269
    },
    {
      "epoch": 0.34691279439847234,
      "grad_norm": 0.8093630222845561,
      "learning_rate": 4.990305526414638e-05,
      "loss": 2.034,
      "num_input_tokens_seen": 2572726848,
      "step": 3270
    },
    {
      "epoch": 0.3470188839380437,
      "grad_norm": 1.0260675355941875,
      "learning_rate": 4.99029941109256e-05,
      "loss": 2.1641,
      "num_input_tokens_seen": 2573513664,
      "step": 3271
    },
    {
      "epoch": 0.3471249734776151,
      "grad_norm": 0.694482039111671,
      "learning_rate": 4.9902932938460525e-05,
      "loss": 1.9055,
      "num_input_tokens_seen": 2574300512,
      "step": 3272
    },
    {
      "epoch": 0.3472310630171865,
      "grad_norm": 0.9076079297975804,
      "learning_rate": 4.990287174675119e-05,
      "loss": 1.9255,
      "num_input_tokens_seen": 2575087296,
      "step": 3273
    },
    {
      "epoch": 0.3473371525567579,
      "grad_norm": 1.1073446789130112,
      "learning_rate": 4.990281053579765e-05,
      "loss": 2.3345,
      "num_input_tokens_seen": 2575874064,
      "step": 3274
    },
    {
      "epoch": 0.3474432420963293,
      "grad_norm": 0.6598696235737592,
      "learning_rate": 4.9902749305599946e-05,
      "loss": 2.0871,
      "num_input_tokens_seen": 2576660880,
      "step": 3275
    },
    {
      "epoch": 0.3475493316359007,
      "grad_norm": 1.4794828033217482,
      "learning_rate": 4.990268805615813e-05,
      "loss": 2.116,
      "num_input_tokens_seen": 2577447616,
      "step": 3276
    },
    {
      "epoch": 0.3476554211754721,
      "grad_norm": 0.5148255180257939,
      "learning_rate": 4.9902626787472237e-05,
      "loss": 2.0264,
      "num_input_tokens_seen": 2578234400,
      "step": 3277
    },
    {
      "epoch": 0.3477615107150435,
      "grad_norm": 1.7674714286467963,
      "learning_rate": 4.990256549954233e-05,
      "loss": 2.1598,
      "num_input_tokens_seen": 2579021120,
      "step": 3278
    },
    {
      "epoch": 0.3478676002546149,
      "grad_norm": 0.6501020302450201,
      "learning_rate": 4.990250419236846e-05,
      "loss": 2.1741,
      "num_input_tokens_seen": 2579807936,
      "step": 3279
    },
    {
      "epoch": 0.3479736897941863,
      "grad_norm": 1.0321294217385908,
      "learning_rate": 4.990244286595066e-05,
      "loss": 2.0759,
      "num_input_tokens_seen": 2580594672,
      "step": 3280
    },
    {
      "epoch": 0.34807977933375767,
      "grad_norm": 0.7500863655632058,
      "learning_rate": 4.990238152028898e-05,
      "loss": 2.2206,
      "num_input_tokens_seen": 2581381392,
      "step": 3281
    },
    {
      "epoch": 0.3481858688733291,
      "grad_norm": 1.0509709098807696,
      "learning_rate": 4.990232015538348e-05,
      "loss": 2.1955,
      "num_input_tokens_seen": 2582168192,
      "step": 3282
    },
    {
      "epoch": 0.3482919584129005,
      "grad_norm": 0.6344403410821331,
      "learning_rate": 4.990225877123418e-05,
      "loss": 2.0629,
      "num_input_tokens_seen": 2582954960,
      "step": 3283
    },
    {
      "epoch": 0.34839804795247187,
      "grad_norm": 1.1210374216033399,
      "learning_rate": 4.990219736784115e-05,
      "loss": 2.0708,
      "num_input_tokens_seen": 2583741744,
      "step": 3284
    },
    {
      "epoch": 0.3485041374920433,
      "grad_norm": 0.7401872659067869,
      "learning_rate": 4.9902135945204446e-05,
      "loss": 2.1871,
      "num_input_tokens_seen": 2584528512,
      "step": 3285
    },
    {
      "epoch": 0.3486102270316147,
      "grad_norm": 1.5340722778248839,
      "learning_rate": 4.9902074503324094e-05,
      "loss": 2.1812,
      "num_input_tokens_seen": 2585315216,
      "step": 3286
    },
    {
      "epoch": 0.34871631657118607,
      "grad_norm": 0.837346258502846,
      "learning_rate": 4.9902013042200144e-05,
      "loss": 2.1818,
      "num_input_tokens_seen": 2586101920,
      "step": 3287
    },
    {
      "epoch": 0.3488224061107575,
      "grad_norm": 0.8491878357810145,
      "learning_rate": 4.9901951561832655e-05,
      "loss": 2.1476,
      "num_input_tokens_seen": 2586888672,
      "step": 3288
    },
    {
      "epoch": 0.34892849565032885,
      "grad_norm": 0.8369143713887092,
      "learning_rate": 4.990189006222167e-05,
      "loss": 2.2148,
      "num_input_tokens_seen": 2587675536,
      "step": 3289
    },
    {
      "epoch": 0.34903458518990027,
      "grad_norm": 0.9300631815725487,
      "learning_rate": 4.990182854336723e-05,
      "loss": 1.968,
      "num_input_tokens_seen": 2588462320,
      "step": 3290
    },
    {
      "epoch": 0.3491406747294717,
      "grad_norm": 0.7930820469198867,
      "learning_rate": 4.990176700526939e-05,
      "loss": 2.0792,
      "num_input_tokens_seen": 2589249088,
      "step": 3291
    },
    {
      "epoch": 0.34924676426904305,
      "grad_norm": 0.66643891073369,
      "learning_rate": 4.990170544792819e-05,
      "loss": 2.1414,
      "num_input_tokens_seen": 2590035872,
      "step": 3292
    },
    {
      "epoch": 0.34935285380861447,
      "grad_norm": 0.8383390472243484,
      "learning_rate": 4.9901643871343695e-05,
      "loss": 2.0743,
      "num_input_tokens_seen": 2590822656,
      "step": 3293
    },
    {
      "epoch": 0.3494589433481859,
      "grad_norm": 0.724638946934638,
      "learning_rate": 4.990158227551593e-05,
      "loss": 2.3313,
      "num_input_tokens_seen": 2591609424,
      "step": 3294
    },
    {
      "epoch": 0.34956503288775725,
      "grad_norm": 0.9898519674331885,
      "learning_rate": 4.9901520660444956e-05,
      "loss": 2.2818,
      "num_input_tokens_seen": 2592396064,
      "step": 3295
    },
    {
      "epoch": 0.3496711224273287,
      "grad_norm": 1.2280943570831968,
      "learning_rate": 4.990145902613082e-05,
      "loss": 2.2041,
      "num_input_tokens_seen": 2593182816,
      "step": 3296
    },
    {
      "epoch": 0.34977721196690004,
      "grad_norm": 0.750775855496406,
      "learning_rate": 4.990139737257357e-05,
      "loss": 2.1371,
      "num_input_tokens_seen": 2593969520,
      "step": 3297
    },
    {
      "epoch": 0.34988330150647146,
      "grad_norm": 1.3543577409627934,
      "learning_rate": 4.990133569977324e-05,
      "loss": 2.2215,
      "num_input_tokens_seen": 2594756352,
      "step": 3298
    },
    {
      "epoch": 0.3499893910460429,
      "grad_norm": 1.060649146800745,
      "learning_rate": 4.990127400772989e-05,
      "loss": 2.266,
      "num_input_tokens_seen": 2595543152,
      "step": 3299
    },
    {
      "epoch": 0.35009548058561424,
      "grad_norm": 1.3406284586065023,
      "learning_rate": 4.990121229644357e-05,
      "loss": 2.2426,
      "num_input_tokens_seen": 2596329840,
      "step": 3300
    },
    {
      "epoch": 0.35020157012518566,
      "grad_norm": 0.6164569705712122,
      "learning_rate": 4.9901150565914326e-05,
      "loss": 1.943,
      "num_input_tokens_seen": 2597116624,
      "step": 3301
    },
    {
      "epoch": 0.3503076596647571,
      "grad_norm": 1.5352711612458174,
      "learning_rate": 4.99010888161422e-05,
      "loss": 2.2065,
      "num_input_tokens_seen": 2597903296,
      "step": 3302
    },
    {
      "epoch": 0.35041374920432844,
      "grad_norm": 0.8391256811703848,
      "learning_rate": 4.990102704712725e-05,
      "loss": 2.0459,
      "num_input_tokens_seen": 2598690096,
      "step": 3303
    },
    {
      "epoch": 0.35051983874389986,
      "grad_norm": 1.7554350232453375,
      "learning_rate": 4.9900965258869504e-05,
      "loss": 2.0782,
      "num_input_tokens_seen": 2599476816,
      "step": 3304
    },
    {
      "epoch": 0.3506259282834712,
      "grad_norm": 0.7248604644667784,
      "learning_rate": 4.990090345136903e-05,
      "loss": 2.1349,
      "num_input_tokens_seen": 2600263632,
      "step": 3305
    },
    {
      "epoch": 0.35073201782304264,
      "grad_norm": 1.0129461674299338,
      "learning_rate": 4.9900841624625874e-05,
      "loss": 2.1483,
      "num_input_tokens_seen": 2601050400,
      "step": 3306
    },
    {
      "epoch": 0.35083810736261406,
      "grad_norm": 0.9285177378431549,
      "learning_rate": 4.990077977864007e-05,
      "loss": 2.1858,
      "num_input_tokens_seen": 2601837120,
      "step": 3307
    },
    {
      "epoch": 0.3509441969021854,
      "grad_norm": 0.914865038178375,
      "learning_rate": 4.9900717913411675e-05,
      "loss": 2.037,
      "num_input_tokens_seen": 2602623920,
      "step": 3308
    },
    {
      "epoch": 0.35105028644175684,
      "grad_norm": 0.6076178795442673,
      "learning_rate": 4.990065602894074e-05,
      "loss": 2.0453,
      "num_input_tokens_seen": 2603410752,
      "step": 3309
    },
    {
      "epoch": 0.35115637598132826,
      "grad_norm": 1.0767475830459114,
      "learning_rate": 4.990059412522731e-05,
      "loss": 1.9937,
      "num_input_tokens_seen": 2604197552,
      "step": 3310
    },
    {
      "epoch": 0.3512624655208996,
      "grad_norm": 0.772498675002117,
      "learning_rate": 4.990053220227142e-05,
      "loss": 2.4105,
      "num_input_tokens_seen": 2604984304,
      "step": 3311
    },
    {
      "epoch": 0.35136855506047104,
      "grad_norm": 1.3375036672839187,
      "learning_rate": 4.990047026007314e-05,
      "loss": 2.0921,
      "num_input_tokens_seen": 2605771024,
      "step": 3312
    },
    {
      "epoch": 0.35147464460004246,
      "grad_norm": 0.8255190668765774,
      "learning_rate": 4.990040829863251e-05,
      "loss": 2.2352,
      "num_input_tokens_seen": 2606557792,
      "step": 3313
    },
    {
      "epoch": 0.3515807341396138,
      "grad_norm": 1.9529295605917574,
      "learning_rate": 4.9900346317949565e-05,
      "loss": 2.0243,
      "num_input_tokens_seen": 2607344576,
      "step": 3314
    },
    {
      "epoch": 0.35168682367918525,
      "grad_norm": 1.3483170219245524,
      "learning_rate": 4.9900284318024365e-05,
      "loss": 2.1868,
      "num_input_tokens_seen": 2608131344,
      "step": 3315
    },
    {
      "epoch": 0.3517929132187566,
      "grad_norm": 1.1216963082665499,
      "learning_rate": 4.9900222298856955e-05,
      "loss": 2.0503,
      "num_input_tokens_seen": 2608918160,
      "step": 3316
    },
    {
      "epoch": 0.35189900275832803,
      "grad_norm": 1.270096963331565,
      "learning_rate": 4.9900160260447396e-05,
      "loss": 1.9953,
      "num_input_tokens_seen": 2609704976,
      "step": 3317
    },
    {
      "epoch": 0.35200509229789945,
      "grad_norm": 1.3377671419022017,
      "learning_rate": 4.990009820279571e-05,
      "loss": 2.0112,
      "num_input_tokens_seen": 2610491712,
      "step": 3318
    },
    {
      "epoch": 0.3521111818374708,
      "grad_norm": 0.8137716451824346,
      "learning_rate": 4.990003612590196e-05,
      "loss": 2.1693,
      "num_input_tokens_seen": 2611278464,
      "step": 3319
    },
    {
      "epoch": 0.35221727137704223,
      "grad_norm": 0.6933422350170013,
      "learning_rate": 4.98999740297662e-05,
      "loss": 2.1308,
      "num_input_tokens_seen": 2612065248,
      "step": 3320
    },
    {
      "epoch": 0.35232336091661365,
      "grad_norm": 0.6586913463036468,
      "learning_rate": 4.989991191438846e-05,
      "loss": 1.8967,
      "num_input_tokens_seen": 2612852032,
      "step": 3321
    },
    {
      "epoch": 0.352429450456185,
      "grad_norm": 0.8985400828603748,
      "learning_rate": 4.989984977976881e-05,
      "loss": 2.1485,
      "num_input_tokens_seen": 2613638784,
      "step": 3322
    },
    {
      "epoch": 0.35253553999575643,
      "grad_norm": 0.5966163040316256,
      "learning_rate": 4.989978762590728e-05,
      "loss": 2.118,
      "num_input_tokens_seen": 2614425552,
      "step": 3323
    },
    {
      "epoch": 0.3526416295353278,
      "grad_norm": 0.8944260995700002,
      "learning_rate": 4.989972545280393e-05,
      "loss": 2.1028,
      "num_input_tokens_seen": 2615212256,
      "step": 3324
    },
    {
      "epoch": 0.3527477190748992,
      "grad_norm": 0.5866356337287699,
      "learning_rate": 4.9899663260458794e-05,
      "loss": 2.1004,
      "num_input_tokens_seen": 2615999024,
      "step": 3325
    },
    {
      "epoch": 0.35285380861447063,
      "grad_norm": 1.5260765197283939,
      "learning_rate": 4.989960104887193e-05,
      "loss": 2.1469,
      "num_input_tokens_seen": 2616785760,
      "step": 3326
    },
    {
      "epoch": 0.352959898154042,
      "grad_norm": 0.8482409026294903,
      "learning_rate": 4.98995388180434e-05,
      "loss": 2.1444,
      "num_input_tokens_seen": 2617572480,
      "step": 3327
    },
    {
      "epoch": 0.3530659876936134,
      "grad_norm": 2.414825882088512,
      "learning_rate": 4.9899476567973226e-05,
      "loss": 2.21,
      "num_input_tokens_seen": 2618359168,
      "step": 3328
    },
    {
      "epoch": 0.35317207723318483,
      "grad_norm": 1.8103743304150404,
      "learning_rate": 4.989941429866147e-05,
      "loss": 2.2255,
      "num_input_tokens_seen": 2619145952,
      "step": 3329
    },
    {
      "epoch": 0.3532781667727562,
      "grad_norm": 1.1436569747120686,
      "learning_rate": 4.989935201010817e-05,
      "loss": 2.1563,
      "num_input_tokens_seen": 2619932800,
      "step": 3330
    },
    {
      "epoch": 0.3533842563123276,
      "grad_norm": 1.2749881574839015,
      "learning_rate": 4.989928970231339e-05,
      "loss": 1.9995,
      "num_input_tokens_seen": 2620719616,
      "step": 3331
    },
    {
      "epoch": 0.353490345851899,
      "grad_norm": 0.8892483310303821,
      "learning_rate": 4.989922737527716e-05,
      "loss": 2.2551,
      "num_input_tokens_seen": 2621506448,
      "step": 3332
    },
    {
      "epoch": 0.3535964353914704,
      "grad_norm": 0.8789472834120281,
      "learning_rate": 4.9899165028999544e-05,
      "loss": 2.1628,
      "num_input_tokens_seen": 2622293248,
      "step": 3333
    },
    {
      "epoch": 0.3537025249310418,
      "grad_norm": 0.8249477789111566,
      "learning_rate": 4.9899102663480586e-05,
      "loss": 2.098,
      "num_input_tokens_seen": 2623080096,
      "step": 3334
    },
    {
      "epoch": 0.3538086144706132,
      "grad_norm": 0.7055190467741654,
      "learning_rate": 4.989904027872033e-05,
      "loss": 2.0814,
      "num_input_tokens_seen": 2623866896,
      "step": 3335
    },
    {
      "epoch": 0.3539147040101846,
      "grad_norm": 0.6634918684762298,
      "learning_rate": 4.9898977874718824e-05,
      "loss": 2.2162,
      "num_input_tokens_seen": 2624653680,
      "step": 3336
    },
    {
      "epoch": 0.354020793549756,
      "grad_norm": 0.8153677126502394,
      "learning_rate": 4.989891545147612e-05,
      "loss": 2.0312,
      "num_input_tokens_seen": 2625440448,
      "step": 3337
    },
    {
      "epoch": 0.3541268830893274,
      "grad_norm": 0.4860158142712765,
      "learning_rate": 4.989885300899227e-05,
      "loss": 2.0208,
      "num_input_tokens_seen": 2626227280,
      "step": 3338
    },
    {
      "epoch": 0.3542329726288988,
      "grad_norm": 0.6648181665482844,
      "learning_rate": 4.9898790547267306e-05,
      "loss": 2.1515,
      "num_input_tokens_seen": 2627014080,
      "step": 3339
    },
    {
      "epoch": 0.35433906216847016,
      "grad_norm": 0.5554752567189346,
      "learning_rate": 4.9898728066301294e-05,
      "loss": 2.1376,
      "num_input_tokens_seen": 2627800896,
      "step": 3340
    },
    {
      "epoch": 0.3544451517080416,
      "grad_norm": 0.6778200949060976,
      "learning_rate": 4.989866556609427e-05,
      "loss": 2.0458,
      "num_input_tokens_seen": 2628587584,
      "step": 3341
    },
    {
      "epoch": 0.354551241247613,
      "grad_norm": 0.7097596282084913,
      "learning_rate": 4.98986030466463e-05,
      "loss": 2.0107,
      "num_input_tokens_seen": 2629374336,
      "step": 3342
    },
    {
      "epoch": 0.35465733078718437,
      "grad_norm": 0.6716883237254314,
      "learning_rate": 4.989854050795741e-05,
      "loss": 2.3009,
      "num_input_tokens_seen": 2630161040,
      "step": 3343
    },
    {
      "epoch": 0.3547634203267558,
      "grad_norm": 0.6949243351725551,
      "learning_rate": 4.9898477950027655e-05,
      "loss": 1.8926,
      "num_input_tokens_seen": 2630947856,
      "step": 3344
    },
    {
      "epoch": 0.3548695098663272,
      "grad_norm": 0.5996550866373399,
      "learning_rate": 4.98984153728571e-05,
      "loss": 2.1,
      "num_input_tokens_seen": 2631734576,
      "step": 3345
    },
    {
      "epoch": 0.35497559940589857,
      "grad_norm": 0.5853402607551741,
      "learning_rate": 4.989835277644577e-05,
      "loss": 1.9725,
      "num_input_tokens_seen": 2632521360,
      "step": 3346
    },
    {
      "epoch": 0.35508168894547,
      "grad_norm": 0.6479124373697693,
      "learning_rate": 4.9898290160793724e-05,
      "loss": 1.9218,
      "num_input_tokens_seen": 2633308112,
      "step": 3347
    },
    {
      "epoch": 0.35518777848504135,
      "grad_norm": 0.6042913218463286,
      "learning_rate": 4.989822752590101e-05,
      "loss": 2.1421,
      "num_input_tokens_seen": 2634094880,
      "step": 3348
    },
    {
      "epoch": 0.35529386802461277,
      "grad_norm": 0.7286242063808256,
      "learning_rate": 4.989816487176768e-05,
      "loss": 2.1437,
      "num_input_tokens_seen": 2634881648,
      "step": 3349
    },
    {
      "epoch": 0.3553999575641842,
      "grad_norm": 0.6474315111358309,
      "learning_rate": 4.989810219839378e-05,
      "loss": 2.0945,
      "num_input_tokens_seen": 2635668384,
      "step": 3350
    },
    {
      "epoch": 0.35550604710375555,
      "grad_norm": 0.5446011264834602,
      "learning_rate": 4.9898039505779354e-05,
      "loss": 1.9786,
      "num_input_tokens_seen": 2636455152,
      "step": 3351
    },
    {
      "epoch": 0.35561213664332697,
      "grad_norm": 0.590408493271471,
      "learning_rate": 4.989797679392445e-05,
      "loss": 2.0683,
      "num_input_tokens_seen": 2637241872,
      "step": 3352
    },
    {
      "epoch": 0.3557182261828984,
      "grad_norm": 0.8067658842649795,
      "learning_rate": 4.989791406282912e-05,
      "loss": 2.1431,
      "num_input_tokens_seen": 2638028592,
      "step": 3353
    },
    {
      "epoch": 0.35582431572246975,
      "grad_norm": 0.7399235112000333,
      "learning_rate": 4.989785131249343e-05,
      "loss": 2.2223,
      "num_input_tokens_seen": 2638815344,
      "step": 3354
    },
    {
      "epoch": 0.35593040526204117,
      "grad_norm": 0.708811171917248,
      "learning_rate": 4.989778854291739e-05,
      "loss": 2.1368,
      "num_input_tokens_seen": 2639602080,
      "step": 3355
    },
    {
      "epoch": 0.35603649480161254,
      "grad_norm": 0.7893745882242611,
      "learning_rate": 4.9897725754101076e-05,
      "loss": 2.2023,
      "num_input_tokens_seen": 2640388864,
      "step": 3356
    },
    {
      "epoch": 0.35614258434118395,
      "grad_norm": 0.7312433503282143,
      "learning_rate": 4.989766294604453e-05,
      "loss": 2.1299,
      "num_input_tokens_seen": 2641175680,
      "step": 3357
    },
    {
      "epoch": 0.3562486738807554,
      "grad_norm": 0.6788479027306029,
      "learning_rate": 4.989760011874781e-05,
      "loss": 2.1201,
      "num_input_tokens_seen": 2641962464,
      "step": 3358
    },
    {
      "epoch": 0.35635476342032674,
      "grad_norm": 1.2681498451787299,
      "learning_rate": 4.989753727221094e-05,
      "loss": 2.2291,
      "num_input_tokens_seen": 2642749280,
      "step": 3359
    },
    {
      "epoch": 0.35646085295989816,
      "grad_norm": 0.5636456237414496,
      "learning_rate": 4.9897474406434e-05,
      "loss": 2.0636,
      "num_input_tokens_seen": 2643536016,
      "step": 3360
    },
    {
      "epoch": 0.3565669424994696,
      "grad_norm": 0.8915029003255618,
      "learning_rate": 4.989741152141701e-05,
      "loss": 2.0738,
      "num_input_tokens_seen": 2644322736,
      "step": 3361
    },
    {
      "epoch": 0.35667303203904094,
      "grad_norm": 0.6298067500107478,
      "learning_rate": 4.9897348617160035e-05,
      "loss": 2.0887,
      "num_input_tokens_seen": 2645109504,
      "step": 3362
    },
    {
      "epoch": 0.35677912157861236,
      "grad_norm": 1.3981470583030782,
      "learning_rate": 4.989728569366312e-05,
      "loss": 2.2193,
      "num_input_tokens_seen": 2645896304,
      "step": 3363
    },
    {
      "epoch": 0.3568852111181837,
      "grad_norm": 0.843378133319163,
      "learning_rate": 4.9897222750926306e-05,
      "loss": 2.1485,
      "num_input_tokens_seen": 2646683024,
      "step": 3364
    },
    {
      "epoch": 0.35699130065775514,
      "grad_norm": 0.7050058350967221,
      "learning_rate": 4.989715978894966e-05,
      "loss": 2.2218,
      "num_input_tokens_seen": 2647469744,
      "step": 3365
    },
    {
      "epoch": 0.35709739019732656,
      "grad_norm": 0.5983465084896776,
      "learning_rate": 4.989709680773321e-05,
      "loss": 1.9966,
      "num_input_tokens_seen": 2648256592,
      "step": 3366
    },
    {
      "epoch": 0.3572034797368979,
      "grad_norm": 0.6550101592836796,
      "learning_rate": 4.989703380727702e-05,
      "loss": 2.0515,
      "num_input_tokens_seen": 2649043360,
      "step": 3367
    },
    {
      "epoch": 0.35730956927646934,
      "grad_norm": 0.7098933637014403,
      "learning_rate": 4.989697078758113e-05,
      "loss": 2.0883,
      "num_input_tokens_seen": 2649830160,
      "step": 3368
    },
    {
      "epoch": 0.35741565881604076,
      "grad_norm": 0.8236790828589791,
      "learning_rate": 4.98969077486456e-05,
      "loss": 2.1346,
      "num_input_tokens_seen": 2650616912,
      "step": 3369
    },
    {
      "epoch": 0.3575217483556121,
      "grad_norm": 1.0484382696304297,
      "learning_rate": 4.9896844690470454e-05,
      "loss": 2.32,
      "num_input_tokens_seen": 2651403648,
      "step": 3370
    },
    {
      "epoch": 0.35762783789518354,
      "grad_norm": 0.45183029635369576,
      "learning_rate": 4.9896781613055763e-05,
      "loss": 1.9351,
      "num_input_tokens_seen": 2652190416,
      "step": 3371
    },
    {
      "epoch": 0.3577339274347549,
      "grad_norm": 0.9738533067283683,
      "learning_rate": 4.9896718516401573e-05,
      "loss": 1.9583,
      "num_input_tokens_seen": 2652977184,
      "step": 3372
    },
    {
      "epoch": 0.3578400169743263,
      "grad_norm": 0.5680662657274036,
      "learning_rate": 4.989665540050793e-05,
      "loss": 2.1821,
      "num_input_tokens_seen": 2653763984,
      "step": 3373
    },
    {
      "epoch": 0.35794610651389774,
      "grad_norm": 1.2653461655499956,
      "learning_rate": 4.989659226537488e-05,
      "loss": 2.0804,
      "num_input_tokens_seen": 2654550784,
      "step": 3374
    },
    {
      "epoch": 0.3580521960534691,
      "grad_norm": 0.7795996968181007,
      "learning_rate": 4.9896529111002474e-05,
      "loss": 2.1288,
      "num_input_tokens_seen": 2655337584,
      "step": 3375
    },
    {
      "epoch": 0.3581582855930405,
      "grad_norm": 0.9645997533110434,
      "learning_rate": 4.989646593739076e-05,
      "loss": 2.0972,
      "num_input_tokens_seen": 2656124384,
      "step": 3376
    },
    {
      "epoch": 0.35826437513261195,
      "grad_norm": 0.5310515872263974,
      "learning_rate": 4.98964027445398e-05,
      "loss": 2.0368,
      "num_input_tokens_seen": 2656911104,
      "step": 3377
    },
    {
      "epoch": 0.3583704646721833,
      "grad_norm": 1.1915444211540884,
      "learning_rate": 4.989633953244961e-05,
      "loss": 2.2821,
      "num_input_tokens_seen": 2657697872,
      "step": 3378
    },
    {
      "epoch": 0.3584765542117547,
      "grad_norm": 0.6842349522025623,
      "learning_rate": 4.9896276301120273e-05,
      "loss": 2.0794,
      "num_input_tokens_seen": 2658484704,
      "step": 3379
    },
    {
      "epoch": 0.35858264375132615,
      "grad_norm": 0.9140251935219664,
      "learning_rate": 4.989621305055182e-05,
      "loss": 2.1468,
      "num_input_tokens_seen": 2659271424,
      "step": 3380
    },
    {
      "epoch": 0.3586887332908975,
      "grad_norm": 1.2218027185645326,
      "learning_rate": 4.9896149780744304e-05,
      "loss": 2.1006,
      "num_input_tokens_seen": 2660058128,
      "step": 3381
    },
    {
      "epoch": 0.35879482283046893,
      "grad_norm": 0.566930942457401,
      "learning_rate": 4.9896086491697774e-05,
      "loss": 2.0595,
      "num_input_tokens_seen": 2660844976,
      "step": 3382
    },
    {
      "epoch": 0.3589009123700403,
      "grad_norm": 1.0032959956293848,
      "learning_rate": 4.989602318341228e-05,
      "loss": 2.1908,
      "num_input_tokens_seen": 2661631696,
      "step": 3383
    },
    {
      "epoch": 0.3590070019096117,
      "grad_norm": 0.6766151159778547,
      "learning_rate": 4.989595985588787e-05,
      "loss": 2.1967,
      "num_input_tokens_seen": 2662418544,
      "step": 3384
    },
    {
      "epoch": 0.35911309144918313,
      "grad_norm": 0.8495075464125199,
      "learning_rate": 4.989589650912459e-05,
      "loss": 2.0542,
      "num_input_tokens_seen": 2663205296,
      "step": 3385
    },
    {
      "epoch": 0.3592191809887545,
      "grad_norm": 0.5512951015528321,
      "learning_rate": 4.9895833143122494e-05,
      "loss": 2.1277,
      "num_input_tokens_seen": 2663992064,
      "step": 3386
    },
    {
      "epoch": 0.3593252705283259,
      "grad_norm": 0.8205547832753488,
      "learning_rate": 4.9895769757881624e-05,
      "loss": 2.2326,
      "num_input_tokens_seen": 2664778864,
      "step": 3387
    },
    {
      "epoch": 0.35943136006789733,
      "grad_norm": 0.4775315242536279,
      "learning_rate": 4.989570635340204e-05,
      "loss": 2.0771,
      "num_input_tokens_seen": 2665565664,
      "step": 3388
    },
    {
      "epoch": 0.3595374496074687,
      "grad_norm": 0.652653031776578,
      "learning_rate": 4.9895642929683785e-05,
      "loss": 2.1199,
      "num_input_tokens_seen": 2666352480,
      "step": 3389
    },
    {
      "epoch": 0.3596435391470401,
      "grad_norm": 0.584412566706864,
      "learning_rate": 4.98955794867269e-05,
      "loss": 2.0935,
      "num_input_tokens_seen": 2667139264,
      "step": 3390
    },
    {
      "epoch": 0.3597496286866115,
      "grad_norm": 0.8071770135798743,
      "learning_rate": 4.989551602453145e-05,
      "loss": 2.1038,
      "num_input_tokens_seen": 2667926080,
      "step": 3391
    },
    {
      "epoch": 0.3598557182261829,
      "grad_norm": 0.8416628073683574,
      "learning_rate": 4.9895452543097474e-05,
      "loss": 2.1171,
      "num_input_tokens_seen": 2668712896,
      "step": 3392
    },
    {
      "epoch": 0.3599618077657543,
      "grad_norm": 0.591337162209374,
      "learning_rate": 4.989538904242502e-05,
      "loss": 2.1259,
      "num_input_tokens_seen": 2669499680,
      "step": 3393
    },
    {
      "epoch": 0.3600678973053257,
      "grad_norm": 0.8606322928634792,
      "learning_rate": 4.989532552251414e-05,
      "loss": 2.1877,
      "num_input_tokens_seen": 2670286496,
      "step": 3394
    },
    {
      "epoch": 0.3601739868448971,
      "grad_norm": 0.741182895201419,
      "learning_rate": 4.989526198336488e-05,
      "loss": 2.1689,
      "num_input_tokens_seen": 2671073168,
      "step": 3395
    },
    {
      "epoch": 0.3602800763844685,
      "grad_norm": 0.5430397645421149,
      "learning_rate": 4.98951984249773e-05,
      "loss": 2.099,
      "num_input_tokens_seen": 2671859952,
      "step": 3396
    },
    {
      "epoch": 0.3603861659240399,
      "grad_norm": 0.55227579061076,
      "learning_rate": 4.9895134847351434e-05,
      "loss": 2.1325,
      "num_input_tokens_seen": 2672646688,
      "step": 3397
    },
    {
      "epoch": 0.3604922554636113,
      "grad_norm": 0.6557299330862618,
      "learning_rate": 4.9895071250487345e-05,
      "loss": 1.9515,
      "num_input_tokens_seen": 2673433488,
      "step": 3398
    },
    {
      "epoch": 0.36059834500318266,
      "grad_norm": 0.7114013643549609,
      "learning_rate": 4.989500763438507e-05,
      "loss": 2.0702,
      "num_input_tokens_seen": 2674220224,
      "step": 3399
    },
    {
      "epoch": 0.3607044345427541,
      "grad_norm": 0.5551145386254447,
      "learning_rate": 4.9894943999044665e-05,
      "loss": 2.061,
      "num_input_tokens_seen": 2675007136,
      "step": 3400
    },
    {
      "epoch": 0.3608105240823255,
      "grad_norm": 0.7988062936920146,
      "learning_rate": 4.9894880344466176e-05,
      "loss": 2.1367,
      "num_input_tokens_seen": 2675793872,
      "step": 3401
    },
    {
      "epoch": 0.36091661362189686,
      "grad_norm": 0.856983668111882,
      "learning_rate": 4.989481667064966e-05,
      "loss": 1.9633,
      "num_input_tokens_seen": 2676580688,
      "step": 3402
    },
    {
      "epoch": 0.3610227031614683,
      "grad_norm": 0.553711847366186,
      "learning_rate": 4.989475297759515e-05,
      "loss": 1.9366,
      "num_input_tokens_seen": 2677367568,
      "step": 3403
    },
    {
      "epoch": 0.3611287927010397,
      "grad_norm": 0.931946652439041,
      "learning_rate": 4.989468926530271e-05,
      "loss": 2.1334,
      "num_input_tokens_seen": 2678154320,
      "step": 3404
    },
    {
      "epoch": 0.36123488224061107,
      "grad_norm": 0.8326050685357662,
      "learning_rate": 4.989462553377239e-05,
      "loss": 2.1369,
      "num_input_tokens_seen": 2678941072,
      "step": 3405
    },
    {
      "epoch": 0.3613409717801825,
      "grad_norm": 1.1991232965256917,
      "learning_rate": 4.989456178300423e-05,
      "loss": 2.0531,
      "num_input_tokens_seen": 2679727840,
      "step": 3406
    },
    {
      "epoch": 0.36144706131975385,
      "grad_norm": 0.5518676597554153,
      "learning_rate": 4.989449801299828e-05,
      "loss": 2.1531,
      "num_input_tokens_seen": 2680514544,
      "step": 3407
    },
    {
      "epoch": 0.36155315085932527,
      "grad_norm": 1.175362081853213,
      "learning_rate": 4.9894434223754596e-05,
      "loss": 2.195,
      "num_input_tokens_seen": 2681301280,
      "step": 3408
    },
    {
      "epoch": 0.3616592403988967,
      "grad_norm": 0.5146503370799882,
      "learning_rate": 4.989437041527322e-05,
      "loss": 2.1809,
      "num_input_tokens_seen": 2682088032,
      "step": 3409
    },
    {
      "epoch": 0.36176532993846805,
      "grad_norm": 0.8021036658392328,
      "learning_rate": 4.9894306587554206e-05,
      "loss": 2.0895,
      "num_input_tokens_seen": 2682874800,
      "step": 3410
    },
    {
      "epoch": 0.36187141947803947,
      "grad_norm": 0.6033503812486847,
      "learning_rate": 4.989424274059761e-05,
      "loss": 2.0688,
      "num_input_tokens_seen": 2683661600,
      "step": 3411
    },
    {
      "epoch": 0.3619775090176109,
      "grad_norm": 0.5644868179116794,
      "learning_rate": 4.989417887440346e-05,
      "loss": 1.8194,
      "num_input_tokens_seen": 2684448400,
      "step": 3412
    },
    {
      "epoch": 0.36208359855718225,
      "grad_norm": 0.5749556615327382,
      "learning_rate": 4.989411498897183e-05,
      "loss": 1.9526,
      "num_input_tokens_seen": 2685235200,
      "step": 3413
    },
    {
      "epoch": 0.36218968809675367,
      "grad_norm": 0.5325833559942726,
      "learning_rate": 4.989405108430276e-05,
      "loss": 2.0296,
      "num_input_tokens_seen": 2686021984,
      "step": 3414
    },
    {
      "epoch": 0.36229577763632503,
      "grad_norm": 0.6108342745896289,
      "learning_rate": 4.989398716039629e-05,
      "loss": 2.125,
      "num_input_tokens_seen": 2686808848,
      "step": 3415
    },
    {
      "epoch": 0.36240186717589645,
      "grad_norm": 0.8268960610577117,
      "learning_rate": 4.989392321725248e-05,
      "loss": 1.9057,
      "num_input_tokens_seen": 2687595680,
      "step": 3416
    },
    {
      "epoch": 0.36250795671546787,
      "grad_norm": 0.7823595155595222,
      "learning_rate": 4.9893859254871375e-05,
      "loss": 2.2314,
      "num_input_tokens_seen": 2688382496,
      "step": 3417
    },
    {
      "epoch": 0.36261404625503924,
      "grad_norm": 1.0581364440102277,
      "learning_rate": 4.989379527325303e-05,
      "loss": 2.0116,
      "num_input_tokens_seen": 2689169280,
      "step": 3418
    },
    {
      "epoch": 0.36272013579461065,
      "grad_norm": 0.6171304692597495,
      "learning_rate": 4.989373127239749e-05,
      "loss": 2.2341,
      "num_input_tokens_seen": 2689956000,
      "step": 3419
    },
    {
      "epoch": 0.3628262253341821,
      "grad_norm": 1.155618207541552,
      "learning_rate": 4.98936672523048e-05,
      "loss": 2.0392,
      "num_input_tokens_seen": 2690742752,
      "step": 3420
    },
    {
      "epoch": 0.36293231487375344,
      "grad_norm": 0.7387770560613081,
      "learning_rate": 4.989360321297502e-05,
      "loss": 2.1055,
      "num_input_tokens_seen": 2691529600,
      "step": 3421
    },
    {
      "epoch": 0.36303840441332486,
      "grad_norm": 0.73988115711393,
      "learning_rate": 4.989353915440818e-05,
      "loss": 2.1818,
      "num_input_tokens_seen": 2692316336,
      "step": 3422
    },
    {
      "epoch": 0.3631444939528962,
      "grad_norm": 0.6067219449999657,
      "learning_rate": 4.989347507660437e-05,
      "loss": 2.1998,
      "num_input_tokens_seen": 2693103056,
      "step": 3423
    },
    {
      "epoch": 0.36325058349246764,
      "grad_norm": 0.7237763748277852,
      "learning_rate": 4.989341097956359e-05,
      "loss": 2.088,
      "num_input_tokens_seen": 2693889824,
      "step": 3424
    },
    {
      "epoch": 0.36335667303203906,
      "grad_norm": 0.9172319886958649,
      "learning_rate": 4.989334686328592e-05,
      "loss": 2.149,
      "num_input_tokens_seen": 2694676576,
      "step": 3425
    },
    {
      "epoch": 0.3634627625716104,
      "grad_norm": 0.5659571613524569,
      "learning_rate": 4.989328272777141e-05,
      "loss": 1.975,
      "num_input_tokens_seen": 2695463296,
      "step": 3426
    },
    {
      "epoch": 0.36356885211118184,
      "grad_norm": 0.6338846696483819,
      "learning_rate": 4.989321857302009e-05,
      "loss": 2.0345,
      "num_input_tokens_seen": 2696249984,
      "step": 3427
    },
    {
      "epoch": 0.36367494165075326,
      "grad_norm": 0.6394830535098273,
      "learning_rate": 4.9893154399032024e-05,
      "loss": 2.1101,
      "num_input_tokens_seen": 2697036720,
      "step": 3428
    },
    {
      "epoch": 0.3637810311903246,
      "grad_norm": 0.5592303951460297,
      "learning_rate": 4.989309020580726e-05,
      "loss": 1.9989,
      "num_input_tokens_seen": 2697823392,
      "step": 3429
    },
    {
      "epoch": 0.36388712072989604,
      "grad_norm": 0.7945241247863121,
      "learning_rate": 4.989302599334584e-05,
      "loss": 2.0144,
      "num_input_tokens_seen": 2698610288,
      "step": 3430
    },
    {
      "epoch": 0.3639932102694674,
      "grad_norm": 0.967419897652986,
      "learning_rate": 4.989296176164783e-05,
      "loss": 2.2249,
      "num_input_tokens_seen": 2699397024,
      "step": 3431
    },
    {
      "epoch": 0.3640992998090388,
      "grad_norm": 0.5322716410985231,
      "learning_rate": 4.989289751071326e-05,
      "loss": 2.285,
      "num_input_tokens_seen": 2700183696,
      "step": 3432
    },
    {
      "epoch": 0.36420538934861024,
      "grad_norm": 0.8229354539826237,
      "learning_rate": 4.989283324054219e-05,
      "loss": 1.9538,
      "num_input_tokens_seen": 2700970512,
      "step": 3433
    },
    {
      "epoch": 0.3643114788881816,
      "grad_norm": 0.5436574577162744,
      "learning_rate": 4.9892768951134676e-05,
      "loss": 2.1367,
      "num_input_tokens_seen": 2701757280,
      "step": 3434
    },
    {
      "epoch": 0.364417568427753,
      "grad_norm": 0.9294023478626301,
      "learning_rate": 4.989270464249076e-05,
      "loss": 2.1604,
      "num_input_tokens_seen": 2702544016,
      "step": 3435
    },
    {
      "epoch": 0.36452365796732444,
      "grad_norm": 0.7714718055602271,
      "learning_rate": 4.9892640314610486e-05,
      "loss": 2.1633,
      "num_input_tokens_seen": 2703330672,
      "step": 3436
    },
    {
      "epoch": 0.3646297475068958,
      "grad_norm": 0.784612797098626,
      "learning_rate": 4.9892575967493916e-05,
      "loss": 2.1686,
      "num_input_tokens_seen": 2704117408,
      "step": 3437
    },
    {
      "epoch": 0.3647358370464672,
      "grad_norm": 1.2191180082013298,
      "learning_rate": 4.989251160114109e-05,
      "loss": 2.0854,
      "num_input_tokens_seen": 2704904160,
      "step": 3438
    },
    {
      "epoch": 0.3648419265860386,
      "grad_norm": 0.5178542070144638,
      "learning_rate": 4.989244721555206e-05,
      "loss": 2.0588,
      "num_input_tokens_seen": 2705690992,
      "step": 3439
    },
    {
      "epoch": 0.36494801612561,
      "grad_norm": 0.8565675536652714,
      "learning_rate": 4.989238281072689e-05,
      "loss": 1.9461,
      "num_input_tokens_seen": 2706477920,
      "step": 3440
    },
    {
      "epoch": 0.3650541056651814,
      "grad_norm": 0.7600365982244253,
      "learning_rate": 4.9892318386665607e-05,
      "loss": 2.1719,
      "num_input_tokens_seen": 2707264688,
      "step": 3441
    },
    {
      "epoch": 0.3651601952047528,
      "grad_norm": 1.1698575705466663,
      "learning_rate": 4.989225394336827e-05,
      "loss": 2.2106,
      "num_input_tokens_seen": 2708051376,
      "step": 3442
    },
    {
      "epoch": 0.3652662847443242,
      "grad_norm": 0.6842739214142701,
      "learning_rate": 4.989218948083493e-05,
      "loss": 2.1303,
      "num_input_tokens_seen": 2708838112,
      "step": 3443
    },
    {
      "epoch": 0.36537237428389563,
      "grad_norm": 0.7814815349501739,
      "learning_rate": 4.989212499906563e-05,
      "loss": 2.1081,
      "num_input_tokens_seen": 2709624928,
      "step": 3444
    },
    {
      "epoch": 0.365478463823467,
      "grad_norm": 0.5490789476578184,
      "learning_rate": 4.9892060498060435e-05,
      "loss": 2.1203,
      "num_input_tokens_seen": 2710411600,
      "step": 3445
    },
    {
      "epoch": 0.3655845533630384,
      "grad_norm": 0.6758279744861267,
      "learning_rate": 4.9891995977819384e-05,
      "loss": 2.0055,
      "num_input_tokens_seen": 2711198432,
      "step": 3446
    },
    {
      "epoch": 0.36569064290260983,
      "grad_norm": 0.6416914252119361,
      "learning_rate": 4.989193143834253e-05,
      "loss": 2.2299,
      "num_input_tokens_seen": 2711985216,
      "step": 3447
    },
    {
      "epoch": 0.3657967324421812,
      "grad_norm": 1.1276837229486698,
      "learning_rate": 4.989186687962992e-05,
      "loss": 1.9892,
      "num_input_tokens_seen": 2712771984,
      "step": 3448
    },
    {
      "epoch": 0.3659028219817526,
      "grad_norm": 1.0908155452160373,
      "learning_rate": 4.989180230168161e-05,
      "loss": 2.1487,
      "num_input_tokens_seen": 2713558768,
      "step": 3449
    },
    {
      "epoch": 0.366008911521324,
      "grad_norm": 0.5815949964101378,
      "learning_rate": 4.9891737704497634e-05,
      "loss": 2.1385,
      "num_input_tokens_seen": 2714345520,
      "step": 3450
    },
    {
      "epoch": 0.3661150010608954,
      "grad_norm": 0.7764288712338244,
      "learning_rate": 4.989167308807806e-05,
      "loss": 1.9774,
      "num_input_tokens_seen": 2715132256,
      "step": 3451
    },
    {
      "epoch": 0.3662210906004668,
      "grad_norm": 0.5424365255109533,
      "learning_rate": 4.9891608452422934e-05,
      "loss": 2.2945,
      "num_input_tokens_seen": 2715918928,
      "step": 3452
    },
    {
      "epoch": 0.3663271801400382,
      "grad_norm": 0.8687694443764113,
      "learning_rate": 4.98915437975323e-05,
      "loss": 2.0483,
      "num_input_tokens_seen": 2716705648,
      "step": 3453
    },
    {
      "epoch": 0.3664332696796096,
      "grad_norm": 0.5533801728401573,
      "learning_rate": 4.989147912340621e-05,
      "loss": 2.1475,
      "num_input_tokens_seen": 2717492464,
      "step": 3454
    },
    {
      "epoch": 0.366539359219181,
      "grad_norm": 0.9470459895150439,
      "learning_rate": 4.9891414430044726e-05,
      "loss": 2.0017,
      "num_input_tokens_seen": 2718279264,
      "step": 3455
    },
    {
      "epoch": 0.3666454487587524,
      "grad_norm": 0.8230142100636332,
      "learning_rate": 4.989134971744788e-05,
      "loss": 2.2118,
      "num_input_tokens_seen": 2719065984,
      "step": 3456
    },
    {
      "epoch": 0.3667515382983238,
      "grad_norm": 0.5727141130879901,
      "learning_rate": 4.989128498561573e-05,
      "loss": 2.0119,
      "num_input_tokens_seen": 2719852768,
      "step": 3457
    },
    {
      "epoch": 0.36685762783789516,
      "grad_norm": 0.5785790118575073,
      "learning_rate": 4.989122023454832e-05,
      "loss": 2.0997,
      "num_input_tokens_seen": 2720639456,
      "step": 3458
    },
    {
      "epoch": 0.3669637173774666,
      "grad_norm": 0.5775914061340269,
      "learning_rate": 4.989115546424571e-05,
      "loss": 1.9184,
      "num_input_tokens_seen": 2721426224,
      "step": 3459
    },
    {
      "epoch": 0.367069806917038,
      "grad_norm": 1.2945577520618805,
      "learning_rate": 4.989109067470794e-05,
      "loss": 2.1071,
      "num_input_tokens_seen": 2722212928,
      "step": 3460
    },
    {
      "epoch": 0.36717589645660936,
      "grad_norm": 0.5619268440199652,
      "learning_rate": 4.989102586593508e-05,
      "loss": 2.1297,
      "num_input_tokens_seen": 2722999616,
      "step": 3461
    },
    {
      "epoch": 0.3672819859961808,
      "grad_norm": 2.3343682212965935,
      "learning_rate": 4.9890961037927154e-05,
      "loss": 2.1397,
      "num_input_tokens_seen": 2723786384,
      "step": 3462
    },
    {
      "epoch": 0.3673880755357522,
      "grad_norm": 1.4015638257180179,
      "learning_rate": 4.989089619068422e-05,
      "loss": 1.9959,
      "num_input_tokens_seen": 2724573264,
      "step": 3463
    },
    {
      "epoch": 0.36749416507532356,
      "grad_norm": 0.8063740910161433,
      "learning_rate": 4.9890831324206345e-05,
      "loss": 2.16,
      "num_input_tokens_seen": 2725360096,
      "step": 3464
    },
    {
      "epoch": 0.367600254614895,
      "grad_norm": 1.6391321148396443,
      "learning_rate": 4.9890766438493555e-05,
      "loss": 2.1092,
      "num_input_tokens_seen": 2726146896,
      "step": 3465
    },
    {
      "epoch": 0.36770634415446635,
      "grad_norm": 0.8034100782290914,
      "learning_rate": 4.9890701533545914e-05,
      "loss": 2.1777,
      "num_input_tokens_seen": 2726933584,
      "step": 3466
    },
    {
      "epoch": 0.36781243369403777,
      "grad_norm": 1.8317465558213417,
      "learning_rate": 4.989063660936347e-05,
      "loss": 2.0499,
      "num_input_tokens_seen": 2727720400,
      "step": 3467
    },
    {
      "epoch": 0.3679185232336092,
      "grad_norm": 0.8774196926564045,
      "learning_rate": 4.9890571665946275e-05,
      "loss": 2.1224,
      "num_input_tokens_seen": 2728507072,
      "step": 3468
    },
    {
      "epoch": 0.36802461277318055,
      "grad_norm": 4.764303300478165,
      "learning_rate": 4.989050670329437e-05,
      "loss": 2.1338,
      "num_input_tokens_seen": 2729293904,
      "step": 3469
    },
    {
      "epoch": 0.36813070231275197,
      "grad_norm": 3.608602403669991,
      "learning_rate": 4.9890441721407815e-05,
      "loss": 2.2183,
      "num_input_tokens_seen": 2730080624,
      "step": 3470
    },
    {
      "epoch": 0.3682367918523234,
      "grad_norm": 0.993959474551086,
      "learning_rate": 4.989037672028666e-05,
      "loss": 2.0969,
      "num_input_tokens_seen": 2730867312,
      "step": 3471
    },
    {
      "epoch": 0.36834288139189475,
      "grad_norm": 2.4576736847456293,
      "learning_rate": 4.989031169993095e-05,
      "loss": 2.128,
      "num_input_tokens_seen": 2731654048,
      "step": 3472
    },
    {
      "epoch": 0.36844897093146617,
      "grad_norm": 3.028107328979423,
      "learning_rate": 4.989024666034073e-05,
      "loss": 2.2297,
      "num_input_tokens_seen": 2732440768,
      "step": 3473
    },
    {
      "epoch": 0.36855506047103753,
      "grad_norm": 1.598796492997185,
      "learning_rate": 4.989018160151607e-05,
      "loss": 2.1411,
      "num_input_tokens_seen": 2733227552,
      "step": 3474
    },
    {
      "epoch": 0.36866115001060895,
      "grad_norm": 1.779963636674831,
      "learning_rate": 4.9890116523457006e-05,
      "loss": 2.2691,
      "num_input_tokens_seen": 2734014272,
      "step": 3475
    },
    {
      "epoch": 0.36876723955018037,
      "grad_norm": 2.1563295264387556,
      "learning_rate": 4.9890051426163585e-05,
      "loss": 2.0709,
      "num_input_tokens_seen": 2734801056,
      "step": 3476
    },
    {
      "epoch": 0.36887332908975173,
      "grad_norm": 1.290240901646093,
      "learning_rate": 4.988998630963586e-05,
      "loss": 2.3362,
      "num_input_tokens_seen": 2735587824,
      "step": 3477
    },
    {
      "epoch": 0.36897941862932315,
      "grad_norm": 1.6848060171258121,
      "learning_rate": 4.988992117387389e-05,
      "loss": 2.1593,
      "num_input_tokens_seen": 2736374544,
      "step": 3478
    },
    {
      "epoch": 0.36908550816889457,
      "grad_norm": 1.083053047686458,
      "learning_rate": 4.988985601887772e-05,
      "loss": 2.043,
      "num_input_tokens_seen": 2737161296,
      "step": 3479
    },
    {
      "epoch": 0.36919159770846594,
      "grad_norm": 2.2737017380434748,
      "learning_rate": 4.98897908446474e-05,
      "loss": 2.0397,
      "num_input_tokens_seen": 2737948064,
      "step": 3480
    },
    {
      "epoch": 0.36929768724803735,
      "grad_norm": 1.4071567482447178,
      "learning_rate": 4.988972565118297e-05,
      "loss": 2.1195,
      "num_input_tokens_seen": 2738734800,
      "step": 3481
    },
    {
      "epoch": 0.3694037767876087,
      "grad_norm": 1.3147842637232412,
      "learning_rate": 4.9889660438484496e-05,
      "loss": 2.0212,
      "num_input_tokens_seen": 2739521584,
      "step": 3482
    },
    {
      "epoch": 0.36950986632718014,
      "grad_norm": 1.2664458637615146,
      "learning_rate": 4.988959520655203e-05,
      "loss": 2.123,
      "num_input_tokens_seen": 2740308384,
      "step": 3483
    },
    {
      "epoch": 0.36961595586675156,
      "grad_norm": 1.1204300818193795,
      "learning_rate": 4.988952995538561e-05,
      "loss": 2.1689,
      "num_input_tokens_seen": 2741095216,
      "step": 3484
    },
    {
      "epoch": 0.3697220454063229,
      "grad_norm": 1.0209835157002713,
      "learning_rate": 4.988946468498529e-05,
      "loss": 2.0851,
      "num_input_tokens_seen": 2741882000,
      "step": 3485
    },
    {
      "epoch": 0.36982813494589434,
      "grad_norm": 1.4178255254808336,
      "learning_rate": 4.9889399395351125e-05,
      "loss": 2.1284,
      "num_input_tokens_seen": 2742668784,
      "step": 3486
    },
    {
      "epoch": 0.36993422448546576,
      "grad_norm": 1.622658022063689,
      "learning_rate": 4.988933408648315e-05,
      "loss": 2.0792,
      "num_input_tokens_seen": 2743455504,
      "step": 3487
    },
    {
      "epoch": 0.3700403140250371,
      "grad_norm": 1.7207573072470677,
      "learning_rate": 4.9889268758381445e-05,
      "loss": 2.0986,
      "num_input_tokens_seen": 2744242336,
      "step": 3488
    },
    {
      "epoch": 0.37014640356460854,
      "grad_norm": 2.849530301138246,
      "learning_rate": 4.988920341104604e-05,
      "loss": 2.308,
      "num_input_tokens_seen": 2745029056,
      "step": 3489
    },
    {
      "epoch": 0.3702524931041799,
      "grad_norm": 1.0733623455358845,
      "learning_rate": 4.988913804447698e-05,
      "loss": 2.1166,
      "num_input_tokens_seen": 2745815872,
      "step": 3490
    },
    {
      "epoch": 0.3703585826437513,
      "grad_norm": 1.1877908760829898,
      "learning_rate": 4.988907265867433e-05,
      "loss": 2.0961,
      "num_input_tokens_seen": 2746602688,
      "step": 3491
    },
    {
      "epoch": 0.37046467218332274,
      "grad_norm": 1.163238166199286,
      "learning_rate": 4.9889007253638136e-05,
      "loss": 2.1242,
      "num_input_tokens_seen": 2747389456,
      "step": 3492
    },
    {
      "epoch": 0.3705707617228941,
      "grad_norm": 1.1513737881624313,
      "learning_rate": 4.988894182936845e-05,
      "loss": 2.0854,
      "num_input_tokens_seen": 2748176256,
      "step": 3493
    },
    {
      "epoch": 0.3706768512624655,
      "grad_norm": 1.0947757999810508,
      "learning_rate": 4.9888876385865314e-05,
      "loss": 1.9908,
      "num_input_tokens_seen": 2748962976,
      "step": 3494
    },
    {
      "epoch": 0.37078294080203694,
      "grad_norm": 0.8412913757059973,
      "learning_rate": 4.9888810923128784e-05,
      "loss": 2.138,
      "num_input_tokens_seen": 2749749648,
      "step": 3495
    },
    {
      "epoch": 0.3708890303416083,
      "grad_norm": 0.7678171998821579,
      "learning_rate": 4.9888745441158915e-05,
      "loss": 1.9556,
      "num_input_tokens_seen": 2750536416,
      "step": 3496
    },
    {
      "epoch": 0.3709951198811797,
      "grad_norm": 1.4031206051786274,
      "learning_rate": 4.988867993995575e-05,
      "loss": 2.152,
      "num_input_tokens_seen": 2751323232,
      "step": 3497
    },
    {
      "epoch": 0.3711012094207511,
      "grad_norm": 0.7250300690054766,
      "learning_rate": 4.988861441951935e-05,
      "loss": 2.1634,
      "num_input_tokens_seen": 2752110000,
      "step": 3498
    },
    {
      "epoch": 0.3712072989603225,
      "grad_norm": 1.4198843040111837,
      "learning_rate": 4.9888548879849755e-05,
      "loss": 2.1092,
      "num_input_tokens_seen": 2752896720,
      "step": 3499
    },
    {
      "epoch": 0.3713133884998939,
      "grad_norm": 0.7662289822766026,
      "learning_rate": 4.988848332094702e-05,
      "loss": 2.1041,
      "num_input_tokens_seen": 2753683440,
      "step": 3500
    },
    {
      "epoch": 0.3714194780394653,
      "grad_norm": 1.2013402039285777,
      "learning_rate": 4.98884177428112e-05,
      "loss": 1.9907,
      "num_input_tokens_seen": 2754470160,
      "step": 3501
    },
    {
      "epoch": 0.3715255675790367,
      "grad_norm": 0.7703741492879018,
      "learning_rate": 4.988835214544233e-05,
      "loss": 2.0538,
      "num_input_tokens_seen": 2755256912,
      "step": 3502
    },
    {
      "epoch": 0.3716316571186081,
      "grad_norm": 1.153576799229395,
      "learning_rate": 4.988828652884048e-05,
      "loss": 2.2539,
      "num_input_tokens_seen": 2756043696,
      "step": 3503
    },
    {
      "epoch": 0.3717377466581795,
      "grad_norm": 0.6203991867258356,
      "learning_rate": 4.988822089300569e-05,
      "loss": 2.115,
      "num_input_tokens_seen": 2756830416,
      "step": 3504
    },
    {
      "epoch": 0.3718438361977509,
      "grad_norm": 0.835844403776216,
      "learning_rate": 4.988815523793802e-05,
      "loss": 2.0593,
      "num_input_tokens_seen": 2757617136,
      "step": 3505
    },
    {
      "epoch": 0.3719499257373223,
      "grad_norm": 0.5576954784629802,
      "learning_rate": 4.98880895636375e-05,
      "loss": 2.0948,
      "num_input_tokens_seen": 2758403920,
      "step": 3506
    },
    {
      "epoch": 0.3720560152768937,
      "grad_norm": 0.7642463428895432,
      "learning_rate": 4.9888023870104204e-05,
      "loss": 2.1222,
      "num_input_tokens_seen": 2759190736,
      "step": 3507
    },
    {
      "epoch": 0.3721621048164651,
      "grad_norm": 0.8082247492601109,
      "learning_rate": 4.988795815733818e-05,
      "loss": 2.174,
      "num_input_tokens_seen": 2759977440,
      "step": 3508
    },
    {
      "epoch": 0.3722681943560365,
      "grad_norm": 0.8345378494121146,
      "learning_rate": 4.9887892425339457e-05,
      "loss": 1.9647,
      "num_input_tokens_seen": 2760764112,
      "step": 3509
    },
    {
      "epoch": 0.3723742838956079,
      "grad_norm": 0.5140450945612188,
      "learning_rate": 4.9887826674108106e-05,
      "loss": 1.9545,
      "num_input_tokens_seen": 2761550912,
      "step": 3510
    },
    {
      "epoch": 0.3724803734351793,
      "grad_norm": 1.1546802927183317,
      "learning_rate": 4.9887760903644175e-05,
      "loss": 2.2174,
      "num_input_tokens_seen": 2762337600,
      "step": 3511
    },
    {
      "epoch": 0.3725864629747507,
      "grad_norm": 0.9905333106243178,
      "learning_rate": 4.988769511394771e-05,
      "loss": 2.2393,
      "num_input_tokens_seen": 2763124384,
      "step": 3512
    },
    {
      "epoch": 0.3726925525143221,
      "grad_norm": 0.9906564630627137,
      "learning_rate": 4.9887629305018766e-05,
      "loss": 2.1089,
      "num_input_tokens_seen": 2763911104,
      "step": 3513
    },
    {
      "epoch": 0.37279864205389346,
      "grad_norm": 0.7312342609787241,
      "learning_rate": 4.98875634768574e-05,
      "loss": 2.1871,
      "num_input_tokens_seen": 2764697904,
      "step": 3514
    },
    {
      "epoch": 0.3729047315934649,
      "grad_norm": 0.9585562042466782,
      "learning_rate": 4.988749762946365e-05,
      "loss": 1.9917,
      "num_input_tokens_seen": 2765484752,
      "step": 3515
    },
    {
      "epoch": 0.3730108211330363,
      "grad_norm": 0.6626388502877172,
      "learning_rate": 4.9887431762837565e-05,
      "loss": 2.0596,
      "num_input_tokens_seen": 2766271504,
      "step": 3516
    },
    {
      "epoch": 0.37311691067260766,
      "grad_norm": 0.7565373126411177,
      "learning_rate": 4.988736587697921e-05,
      "loss": 1.934,
      "num_input_tokens_seen": 2767058320,
      "step": 3517
    },
    {
      "epoch": 0.3732230002121791,
      "grad_norm": 0.6080668979375401,
      "learning_rate": 4.988729997188862e-05,
      "loss": 2.2196,
      "num_input_tokens_seen": 2767845024,
      "step": 3518
    },
    {
      "epoch": 0.3733290897517505,
      "grad_norm": 1.4046809105798452,
      "learning_rate": 4.9887234047565866e-05,
      "loss": 2.071,
      "num_input_tokens_seen": 2768631760,
      "step": 3519
    },
    {
      "epoch": 0.37343517929132186,
      "grad_norm": 0.5579116143991388,
      "learning_rate": 4.988716810401098e-05,
      "loss": 2.1874,
      "num_input_tokens_seen": 2769418528,
      "step": 3520
    },
    {
      "epoch": 0.3735412688308933,
      "grad_norm": 1.0771626658269406,
      "learning_rate": 4.988710214122403e-05,
      "loss": 2.1611,
      "num_input_tokens_seen": 2770205280,
      "step": 3521
    },
    {
      "epoch": 0.3736473583704647,
      "grad_norm": 0.5339016185230352,
      "learning_rate": 4.988703615920506e-05,
      "loss": 2.0824,
      "num_input_tokens_seen": 2770992064,
      "step": 3522
    },
    {
      "epoch": 0.37375344791003606,
      "grad_norm": 0.9617867597385161,
      "learning_rate": 4.9886970157954104e-05,
      "loss": 2.086,
      "num_input_tokens_seen": 2771778800,
      "step": 3523
    },
    {
      "epoch": 0.3738595374496075,
      "grad_norm": 0.8259123049505871,
      "learning_rate": 4.9886904137471234e-05,
      "loss": 2.1915,
      "num_input_tokens_seen": 2772565696,
      "step": 3524
    },
    {
      "epoch": 0.37396562698917885,
      "grad_norm": 0.9150189965207384,
      "learning_rate": 4.9886838097756495e-05,
      "loss": 2.198,
      "num_input_tokens_seen": 2773352560,
      "step": 3525
    },
    {
      "epoch": 0.37407171652875026,
      "grad_norm": 0.9703339783205585,
      "learning_rate": 4.988677203880994e-05,
      "loss": 2.1668,
      "num_input_tokens_seen": 2774139392,
      "step": 3526
    },
    {
      "epoch": 0.3741778060683217,
      "grad_norm": 0.8488068857951996,
      "learning_rate": 4.988670596063162e-05,
      "loss": 1.9272,
      "num_input_tokens_seen": 2774926176,
      "step": 3527
    },
    {
      "epoch": 0.37428389560789305,
      "grad_norm": 0.9487749849005795,
      "learning_rate": 4.9886639863221574e-05,
      "loss": 2.0473,
      "num_input_tokens_seen": 2775712960,
      "step": 3528
    },
    {
      "epoch": 0.37438998514746447,
      "grad_norm": 1.2031342158049048,
      "learning_rate": 4.9886573746579865e-05,
      "loss": 2.2252,
      "num_input_tokens_seen": 2776499632,
      "step": 3529
    },
    {
      "epoch": 0.3744960746870359,
      "grad_norm": 0.9060086689108376,
      "learning_rate": 4.988650761070655e-05,
      "loss": 2.0049,
      "num_input_tokens_seen": 2777286400,
      "step": 3530
    },
    {
      "epoch": 0.37460216422660725,
      "grad_norm": 0.8271170255266508,
      "learning_rate": 4.988644145560167e-05,
      "loss": 1.9649,
      "num_input_tokens_seen": 2778073216,
      "step": 3531
    },
    {
      "epoch": 0.37470825376617867,
      "grad_norm": 0.8138975903540502,
      "learning_rate": 4.9886375281265275e-05,
      "loss": 2.2302,
      "num_input_tokens_seen": 2778860032,
      "step": 3532
    },
    {
      "epoch": 0.37481434330575003,
      "grad_norm": 0.7988731110980888,
      "learning_rate": 4.988630908769742e-05,
      "loss": 2.064,
      "num_input_tokens_seen": 2779646752,
      "step": 3533
    },
    {
      "epoch": 0.37492043284532145,
      "grad_norm": 0.8407061845319591,
      "learning_rate": 4.988624287489816e-05,
      "loss": 2.1169,
      "num_input_tokens_seen": 2780433440,
      "step": 3534
    },
    {
      "epoch": 0.37502652238489287,
      "grad_norm": 1.1943937018333275,
      "learning_rate": 4.988617664286753e-05,
      "loss": 2.0066,
      "num_input_tokens_seen": 2781220272,
      "step": 3535
    },
    {
      "epoch": 0.37513261192446423,
      "grad_norm": 1.102236671448019,
      "learning_rate": 4.988611039160561e-05,
      "loss": 2.1242,
      "num_input_tokens_seen": 2782006944,
      "step": 3536
    },
    {
      "epoch": 0.37523870146403565,
      "grad_norm": 0.8828190189464167,
      "learning_rate": 4.988604412111242e-05,
      "loss": 2.1316,
      "num_input_tokens_seen": 2782793696,
      "step": 3537
    },
    {
      "epoch": 0.37534479100360707,
      "grad_norm": 0.6966594460307726,
      "learning_rate": 4.988597783138803e-05,
      "loss": 2.0534,
      "num_input_tokens_seen": 2783580416,
      "step": 3538
    },
    {
      "epoch": 0.37545088054317843,
      "grad_norm": 1.0069312119834732,
      "learning_rate": 4.9885911522432486e-05,
      "loss": 2.107,
      "num_input_tokens_seen": 2784367136,
      "step": 3539
    },
    {
      "epoch": 0.37555697008274985,
      "grad_norm": 1.5873505842989273,
      "learning_rate": 4.9885845194245836e-05,
      "loss": 2.0628,
      "num_input_tokens_seen": 2785154000,
      "step": 3540
    },
    {
      "epoch": 0.3756630596223212,
      "grad_norm": 1.156305874175356,
      "learning_rate": 4.9885778846828144e-05,
      "loss": 2.1908,
      "num_input_tokens_seen": 2785940784,
      "step": 3541
    },
    {
      "epoch": 0.37576914916189263,
      "grad_norm": 1.628731405570967,
      "learning_rate": 4.988571248017945e-05,
      "loss": 2.037,
      "num_input_tokens_seen": 2786727536,
      "step": 3542
    },
    {
      "epoch": 0.37587523870146405,
      "grad_norm": 1.1267667822517113,
      "learning_rate": 4.988564609429981e-05,
      "loss": 2.1291,
      "num_input_tokens_seen": 2787514304,
      "step": 3543
    },
    {
      "epoch": 0.3759813282410354,
      "grad_norm": 1.7671036647454583,
      "learning_rate": 4.9885579689189264e-05,
      "loss": 2.3843,
      "num_input_tokens_seen": 2788301072,
      "step": 3544
    },
    {
      "epoch": 0.37608741778060684,
      "grad_norm": 1.3696305435854754,
      "learning_rate": 4.9885513264847874e-05,
      "loss": 2.1241,
      "num_input_tokens_seen": 2789087840,
      "step": 3545
    },
    {
      "epoch": 0.37619350732017826,
      "grad_norm": 0.946813559307679,
      "learning_rate": 4.988544682127569e-05,
      "loss": 2.0982,
      "num_input_tokens_seen": 2789874656,
      "step": 3546
    },
    {
      "epoch": 0.3762995968597496,
      "grad_norm": 1.1535563902493113,
      "learning_rate": 4.9885380358472767e-05,
      "loss": 2.1234,
      "num_input_tokens_seen": 2790661424,
      "step": 3547
    },
    {
      "epoch": 0.37640568639932104,
      "grad_norm": 0.5583092435793066,
      "learning_rate": 4.988531387643915e-05,
      "loss": 1.97,
      "num_input_tokens_seen": 2791448176,
      "step": 3548
    },
    {
      "epoch": 0.3765117759388924,
      "grad_norm": 1.0282322717219678,
      "learning_rate": 4.988524737517489e-05,
      "loss": 2.0205,
      "num_input_tokens_seen": 2792234944,
      "step": 3549
    },
    {
      "epoch": 0.3766178654784638,
      "grad_norm": 0.5660050131389677,
      "learning_rate": 4.988518085468005e-05,
      "loss": 2.0337,
      "num_input_tokens_seen": 2793021696,
      "step": 3550
    },
    {
      "epoch": 0.37672395501803524,
      "grad_norm": 0.6918492171169288,
      "learning_rate": 4.988511431495466e-05,
      "loss": 2.1334,
      "num_input_tokens_seen": 2793808416,
      "step": 3551
    },
    {
      "epoch": 0.3768300445576066,
      "grad_norm": 0.8834139251799351,
      "learning_rate": 4.9885047755998796e-05,
      "loss": 2.1225,
      "num_input_tokens_seen": 2794595248,
      "step": 3552
    },
    {
      "epoch": 0.376936134097178,
      "grad_norm": 0.6110883478979828,
      "learning_rate": 4.9884981177812486e-05,
      "loss": 2.0844,
      "num_input_tokens_seen": 2795382032,
      "step": 3553
    },
    {
      "epoch": 0.37704222363674944,
      "grad_norm": 0.717071083029498,
      "learning_rate": 4.98849145803958e-05,
      "loss": 2.07,
      "num_input_tokens_seen": 2796168832,
      "step": 3554
    },
    {
      "epoch": 0.3771483131763208,
      "grad_norm": 0.6462908278689729,
      "learning_rate": 4.9884847963748784e-05,
      "loss": 2.1163,
      "num_input_tokens_seen": 2796955552,
      "step": 3555
    },
    {
      "epoch": 0.3772544027158922,
      "grad_norm": 0.49779742216780837,
      "learning_rate": 4.988478132787148e-05,
      "loss": 2.0015,
      "num_input_tokens_seen": 2797742272,
      "step": 3556
    },
    {
      "epoch": 0.3773604922554636,
      "grad_norm": 0.6516318715183215,
      "learning_rate": 4.988471467276395e-05,
      "loss": 2.114,
      "num_input_tokens_seen": 2798528944,
      "step": 3557
    },
    {
      "epoch": 0.377466581795035,
      "grad_norm": 0.5132022132272379,
      "learning_rate": 4.9884647998426245e-05,
      "loss": 2.001,
      "num_input_tokens_seen": 2799315680,
      "step": 3558
    },
    {
      "epoch": 0.3775726713346064,
      "grad_norm": 0.7711192673223347,
      "learning_rate": 4.9884581304858415e-05,
      "loss": 2.0442,
      "num_input_tokens_seen": 2800102448,
      "step": 3559
    },
    {
      "epoch": 0.3776787608741778,
      "grad_norm": 0.4992603649349852,
      "learning_rate": 4.9884514592060504e-05,
      "loss": 2.011,
      "num_input_tokens_seen": 2800889264,
      "step": 3560
    },
    {
      "epoch": 0.3777848504137492,
      "grad_norm": 0.6204468134455201,
      "learning_rate": 4.9884447860032574e-05,
      "loss": 2.3176,
      "num_input_tokens_seen": 2801675984,
      "step": 3561
    },
    {
      "epoch": 0.3778909399533206,
      "grad_norm": 0.7565738120607264,
      "learning_rate": 4.988438110877468e-05,
      "loss": 2.1058,
      "num_input_tokens_seen": 2802462768,
      "step": 3562
    },
    {
      "epoch": 0.377997029492892,
      "grad_norm": 0.49968261603201186,
      "learning_rate": 4.988431433828685e-05,
      "loss": 2.0271,
      "num_input_tokens_seen": 2803249584,
      "step": 3563
    },
    {
      "epoch": 0.3781031190324634,
      "grad_norm": 0.8335837444633438,
      "learning_rate": 4.988424754856916e-05,
      "loss": 2.1474,
      "num_input_tokens_seen": 2804036336,
      "step": 3564
    },
    {
      "epoch": 0.37820920857203477,
      "grad_norm": 0.6645790994678761,
      "learning_rate": 4.988418073962166e-05,
      "loss": 1.9861,
      "num_input_tokens_seen": 2804823056,
      "step": 3565
    },
    {
      "epoch": 0.3783152981116062,
      "grad_norm": 0.7493365980152034,
      "learning_rate": 4.988411391144439e-05,
      "loss": 2.0879,
      "num_input_tokens_seen": 2805609808,
      "step": 3566
    },
    {
      "epoch": 0.3784213876511776,
      "grad_norm": 0.8636403963319204,
      "learning_rate": 4.9884047064037406e-05,
      "loss": 2.1287,
      "num_input_tokens_seen": 2806396448,
      "step": 3567
    },
    {
      "epoch": 0.378527477190749,
      "grad_norm": 0.7423966385279139,
      "learning_rate": 4.988398019740077e-05,
      "loss": 2.1502,
      "num_input_tokens_seen": 2807183296,
      "step": 3568
    },
    {
      "epoch": 0.3786335667303204,
      "grad_norm": 1.0532245747839193,
      "learning_rate": 4.988391331153451e-05,
      "loss": 2.1905,
      "num_input_tokens_seen": 2807970016,
      "step": 3569
    },
    {
      "epoch": 0.3787396562698918,
      "grad_norm": 0.5851398708317712,
      "learning_rate": 4.988384640643871e-05,
      "loss": 2.0877,
      "num_input_tokens_seen": 2808756800,
      "step": 3570
    },
    {
      "epoch": 0.3788457458094632,
      "grad_norm": 0.8138963244361608,
      "learning_rate": 4.988377948211339e-05,
      "loss": 2.0745,
      "num_input_tokens_seen": 2809543520,
      "step": 3571
    },
    {
      "epoch": 0.3789518353490346,
      "grad_norm": 0.5850718546793017,
      "learning_rate": 4.9883712538558616e-05,
      "loss": 2.1153,
      "num_input_tokens_seen": 2810330432,
      "step": 3572
    },
    {
      "epoch": 0.37905792488860596,
      "grad_norm": 0.516841920281418,
      "learning_rate": 4.988364557577444e-05,
      "loss": 2.0838,
      "num_input_tokens_seen": 2811117232,
      "step": 3573
    },
    {
      "epoch": 0.3791640144281774,
      "grad_norm": 0.5408266446766292,
      "learning_rate": 4.988357859376091e-05,
      "loss": 2.0461,
      "num_input_tokens_seen": 2811904080,
      "step": 3574
    },
    {
      "epoch": 0.3792701039677488,
      "grad_norm": 0.537888057172376,
      "learning_rate": 4.988351159251808e-05,
      "loss": 2.1692,
      "num_input_tokens_seen": 2812690784,
      "step": 3575
    },
    {
      "epoch": 0.37937619350732016,
      "grad_norm": 0.6322394444183489,
      "learning_rate": 4.988344457204601e-05,
      "loss": 2.0879,
      "num_input_tokens_seen": 2813477520,
      "step": 3576
    },
    {
      "epoch": 0.3794822830468916,
      "grad_norm": 0.5841823606746801,
      "learning_rate": 4.9883377532344745e-05,
      "loss": 2.168,
      "num_input_tokens_seen": 2814264208,
      "step": 3577
    },
    {
      "epoch": 0.379588372586463,
      "grad_norm": 0.6217436905176693,
      "learning_rate": 4.988331047341432e-05,
      "loss": 1.9986,
      "num_input_tokens_seen": 2815050880,
      "step": 3578
    },
    {
      "epoch": 0.37969446212603436,
      "grad_norm": 0.6702708568615898,
      "learning_rate": 4.988324339525482e-05,
      "loss": 2.1345,
      "num_input_tokens_seen": 2815837568,
      "step": 3579
    },
    {
      "epoch": 0.3798005516656058,
      "grad_norm": 0.6445280799641045,
      "learning_rate": 4.9883176297866276e-05,
      "loss": 2.1119,
      "num_input_tokens_seen": 2816624272,
      "step": 3580
    },
    {
      "epoch": 0.37990664120517714,
      "grad_norm": 0.7282187771192133,
      "learning_rate": 4.988310918124874e-05,
      "loss": 2.1082,
      "num_input_tokens_seen": 2817411120,
      "step": 3581
    },
    {
      "epoch": 0.38001273074474856,
      "grad_norm": 0.5850564104155511,
      "learning_rate": 4.988304204540227e-05,
      "loss": 2.1248,
      "num_input_tokens_seen": 2818197968,
      "step": 3582
    },
    {
      "epoch": 0.38011882028432,
      "grad_norm": 0.510697238199471,
      "learning_rate": 4.9882974890326914e-05,
      "loss": 2.0874,
      "num_input_tokens_seen": 2818984800,
      "step": 3583
    },
    {
      "epoch": 0.38022490982389134,
      "grad_norm": 0.5394458724987642,
      "learning_rate": 4.988290771602272e-05,
      "loss": 2.0092,
      "num_input_tokens_seen": 2819771520,
      "step": 3584
    },
    {
      "epoch": 0.38033099936346276,
      "grad_norm": 0.5656048389902728,
      "learning_rate": 4.988284052248975e-05,
      "loss": 2.2471,
      "num_input_tokens_seen": 2820558304,
      "step": 3585
    },
    {
      "epoch": 0.3804370889030342,
      "grad_norm": 0.4924490407517226,
      "learning_rate": 4.988277330972806e-05,
      "loss": 2.017,
      "num_input_tokens_seen": 2821345024,
      "step": 3586
    },
    {
      "epoch": 0.38054317844260555,
      "grad_norm": 0.4605255155168578,
      "learning_rate": 4.988270607773768e-05,
      "loss": 2.1807,
      "num_input_tokens_seen": 2822131824,
      "step": 3587
    },
    {
      "epoch": 0.38064926798217696,
      "grad_norm": 0.5573932528968527,
      "learning_rate": 4.9882638826518676e-05,
      "loss": 2.149,
      "num_input_tokens_seen": 2822918528,
      "step": 3588
    },
    {
      "epoch": 0.3807553575217484,
      "grad_norm": 0.6108879211609851,
      "learning_rate": 4.98825715560711e-05,
      "loss": 2.0979,
      "num_input_tokens_seen": 2823705248,
      "step": 3589
    },
    {
      "epoch": 0.38086144706131975,
      "grad_norm": 0.7725758964072341,
      "learning_rate": 4.9882504266395006e-05,
      "loss": 1.938,
      "num_input_tokens_seen": 2824492064,
      "step": 3590
    },
    {
      "epoch": 0.38096753660089117,
      "grad_norm": 0.5623103120080021,
      "learning_rate": 4.988243695749044e-05,
      "loss": 2.1244,
      "num_input_tokens_seen": 2825278896,
      "step": 3591
    },
    {
      "epoch": 0.38107362614046253,
      "grad_norm": 0.6440819380495858,
      "learning_rate": 4.9882369629357464e-05,
      "loss": 2.0227,
      "num_input_tokens_seen": 2826065808,
      "step": 3592
    },
    {
      "epoch": 0.38117971568003395,
      "grad_norm": 0.7049000268255048,
      "learning_rate": 4.988230228199612e-05,
      "loss": 2.1352,
      "num_input_tokens_seen": 2826852544,
      "step": 3593
    },
    {
      "epoch": 0.38128580521960537,
      "grad_norm": 0.5000015903354755,
      "learning_rate": 4.988223491540646e-05,
      "loss": 2.1583,
      "num_input_tokens_seen": 2827639376,
      "step": 3594
    },
    {
      "epoch": 0.38139189475917673,
      "grad_norm": 0.4821750514320086,
      "learning_rate": 4.988216752958853e-05,
      "loss": 1.9852,
      "num_input_tokens_seen": 2828426144,
      "step": 3595
    },
    {
      "epoch": 0.38149798429874815,
      "grad_norm": 0.64779682760684,
      "learning_rate": 4.98821001245424e-05,
      "loss": 2.067,
      "num_input_tokens_seen": 2829212880,
      "step": 3596
    },
    {
      "epoch": 0.38160407383831957,
      "grad_norm": 0.6011220819178387,
      "learning_rate": 4.988203270026812e-05,
      "loss": 2.2005,
      "num_input_tokens_seen": 2829999600,
      "step": 3597
    },
    {
      "epoch": 0.38171016337789093,
      "grad_norm": 0.49751630669425606,
      "learning_rate": 4.9881965256765724e-05,
      "loss": 1.9444,
      "num_input_tokens_seen": 2830786272,
      "step": 3598
    },
    {
      "epoch": 0.38181625291746235,
      "grad_norm": 0.7623330758486416,
      "learning_rate": 4.988189779403528e-05,
      "loss": 2.1791,
      "num_input_tokens_seen": 2831573104,
      "step": 3599
    },
    {
      "epoch": 0.3819223424570337,
      "grad_norm": 1.1716874888437618,
      "learning_rate": 4.988183031207683e-05,
      "loss": 2.024,
      "num_input_tokens_seen": 2832359920,
      "step": 3600
    },
    {
      "epoch": 0.38202843199660513,
      "grad_norm": 0.6716492960138978,
      "learning_rate": 4.988176281089044e-05,
      "loss": 2.0677,
      "num_input_tokens_seen": 2833146672,
      "step": 3601
    },
    {
      "epoch": 0.38213452153617655,
      "grad_norm": 0.5651594011484151,
      "learning_rate": 4.9881695290476146e-05,
      "loss": 2.1029,
      "num_input_tokens_seen": 2833933456,
      "step": 3602
    },
    {
      "epoch": 0.3822406110757479,
      "grad_norm": 0.44967300781421876,
      "learning_rate": 4.9881627750834014e-05,
      "loss": 1.939,
      "num_input_tokens_seen": 2834720224,
      "step": 3603
    },
    {
      "epoch": 0.38234670061531933,
      "grad_norm": 0.9614482568470754,
      "learning_rate": 4.988156019196409e-05,
      "loss": 1.9572,
      "num_input_tokens_seen": 2835507024,
      "step": 3604
    },
    {
      "epoch": 0.38245279015489075,
      "grad_norm": 1.2447033982368925,
      "learning_rate": 4.9881492613866425e-05,
      "loss": 2.1148,
      "num_input_tokens_seen": 2836293696,
      "step": 3605
    },
    {
      "epoch": 0.3825588796944621,
      "grad_norm": 0.6077122214790543,
      "learning_rate": 4.988142501654107e-05,
      "loss": 1.9963,
      "num_input_tokens_seen": 2837080480,
      "step": 3606
    },
    {
      "epoch": 0.38266496923403354,
      "grad_norm": 1.2370408377416668,
      "learning_rate": 4.988135739998808e-05,
      "loss": 2.2282,
      "num_input_tokens_seen": 2837867168,
      "step": 3607
    },
    {
      "epoch": 0.3827710587736049,
      "grad_norm": 0.48019981537198064,
      "learning_rate": 4.9881289764207514e-05,
      "loss": 2.0876,
      "num_input_tokens_seen": 2838653936,
      "step": 3608
    },
    {
      "epoch": 0.3828771483131763,
      "grad_norm": 1.0327391054748418,
      "learning_rate": 4.988122210919941e-05,
      "loss": 2.3134,
      "num_input_tokens_seen": 2839440656,
      "step": 3609
    },
    {
      "epoch": 0.38298323785274774,
      "grad_norm": 0.6379866972422708,
      "learning_rate": 4.988115443496383e-05,
      "loss": 2.1337,
      "num_input_tokens_seen": 2840227376,
      "step": 3610
    },
    {
      "epoch": 0.3830893273923191,
      "grad_norm": 0.7719836832740385,
      "learning_rate": 4.988108674150083e-05,
      "loss": 2.0364,
      "num_input_tokens_seen": 2841014112,
      "step": 3611
    },
    {
      "epoch": 0.3831954169318905,
      "grad_norm": 0.7875067713532362,
      "learning_rate": 4.988101902881045e-05,
      "loss": 2.3424,
      "num_input_tokens_seen": 2841800832,
      "step": 3612
    },
    {
      "epoch": 0.38330150647146194,
      "grad_norm": 0.6861481811631058,
      "learning_rate": 4.9880951296892744e-05,
      "loss": 2.1489,
      "num_input_tokens_seen": 2842587552,
      "step": 3613
    },
    {
      "epoch": 0.3834075960110333,
      "grad_norm": 0.5996953175794474,
      "learning_rate": 4.988088354574777e-05,
      "loss": 2.0261,
      "num_input_tokens_seen": 2843374272,
      "step": 3614
    },
    {
      "epoch": 0.3835136855506047,
      "grad_norm": 0.5494755602208581,
      "learning_rate": 4.9880815775375586e-05,
      "loss": 1.9849,
      "num_input_tokens_seen": 2844161088,
      "step": 3615
    },
    {
      "epoch": 0.3836197750901761,
      "grad_norm": 0.7110507222591848,
      "learning_rate": 4.988074798577623e-05,
      "loss": 2.1584,
      "num_input_tokens_seen": 2844947872,
      "step": 3616
    },
    {
      "epoch": 0.3837258646297475,
      "grad_norm": 0.5368152923820746,
      "learning_rate": 4.9880680176949774e-05,
      "loss": 2.0224,
      "num_input_tokens_seen": 2845734672,
      "step": 3617
    },
    {
      "epoch": 0.3838319541693189,
      "grad_norm": 0.956729463071189,
      "learning_rate": 4.988061234889625e-05,
      "loss": 2.0598,
      "num_input_tokens_seen": 2846521440,
      "step": 3618
    },
    {
      "epoch": 0.3839380437088903,
      "grad_norm": 0.9659934505244477,
      "learning_rate": 4.988054450161572e-05,
      "loss": 2.1703,
      "num_input_tokens_seen": 2847308240,
      "step": 3619
    },
    {
      "epoch": 0.3840441332484617,
      "grad_norm": 0.5969111071175277,
      "learning_rate": 4.988047663510823e-05,
      "loss": 2.1024,
      "num_input_tokens_seen": 2848095056,
      "step": 3620
    },
    {
      "epoch": 0.3841502227880331,
      "grad_norm": 1.0946930820336942,
      "learning_rate": 4.988040874937385e-05,
      "loss": 1.9793,
      "num_input_tokens_seen": 2848881824,
      "step": 3621
    },
    {
      "epoch": 0.3842563123276045,
      "grad_norm": 0.7018717967025112,
      "learning_rate": 4.988034084441261e-05,
      "loss": 2.1355,
      "num_input_tokens_seen": 2849668544,
      "step": 3622
    },
    {
      "epoch": 0.3843624018671759,
      "grad_norm": 0.9079865717876214,
      "learning_rate": 4.988027292022458e-05,
      "loss": 1.8984,
      "num_input_tokens_seen": 2850455376,
      "step": 3623
    },
    {
      "epoch": 0.38446849140674727,
      "grad_norm": 0.5704883261031013,
      "learning_rate": 4.9880204976809794e-05,
      "loss": 2.0016,
      "num_input_tokens_seen": 2851242128,
      "step": 3624
    },
    {
      "epoch": 0.3845745809463187,
      "grad_norm": 1.0450820741931344,
      "learning_rate": 4.9880137014168325e-05,
      "loss": 2.0648,
      "num_input_tokens_seen": 2852028896,
      "step": 3625
    },
    {
      "epoch": 0.3846806704858901,
      "grad_norm": 0.5258972747975315,
      "learning_rate": 4.988006903230021e-05,
      "loss": 2.1998,
      "num_input_tokens_seen": 2852815696,
      "step": 3626
    },
    {
      "epoch": 0.38478676002546147,
      "grad_norm": 1.3241368101642492,
      "learning_rate": 4.988000103120551e-05,
      "loss": 2.2239,
      "num_input_tokens_seen": 2853602448,
      "step": 3627
    },
    {
      "epoch": 0.3848928495650329,
      "grad_norm": 0.5973314814961715,
      "learning_rate": 4.9879933010884285e-05,
      "loss": 2.2384,
      "num_input_tokens_seen": 2854389248,
      "step": 3628
    },
    {
      "epoch": 0.3849989391046043,
      "grad_norm": 0.8602764260662178,
      "learning_rate": 4.987986497133656e-05,
      "loss": 2.2404,
      "num_input_tokens_seen": 2855175920,
      "step": 3629
    },
    {
      "epoch": 0.3851050286441757,
      "grad_norm": 0.49783992527103377,
      "learning_rate": 4.987979691256242e-05,
      "loss": 2.0316,
      "num_input_tokens_seen": 2855962672,
      "step": 3630
    },
    {
      "epoch": 0.3852111181837471,
      "grad_norm": 0.6507267924980484,
      "learning_rate": 4.98797288345619e-05,
      "loss": 2.0212,
      "num_input_tokens_seen": 2856749616,
      "step": 3631
    },
    {
      "epoch": 0.38531720772331846,
      "grad_norm": 0.45112350877574453,
      "learning_rate": 4.987966073733505e-05,
      "loss": 1.9935,
      "num_input_tokens_seen": 2857536480,
      "step": 3632
    },
    {
      "epoch": 0.3854232972628899,
      "grad_norm": 0.8407275050107195,
      "learning_rate": 4.9879592620881934e-05,
      "loss": 2.1665,
      "num_input_tokens_seen": 2858323264,
      "step": 3633
    },
    {
      "epoch": 0.3855293868024613,
      "grad_norm": 0.9312356050126354,
      "learning_rate": 4.987952448520259e-05,
      "loss": 1.9866,
      "num_input_tokens_seen": 2859110064,
      "step": 3634
    },
    {
      "epoch": 0.38563547634203266,
      "grad_norm": 0.8545567952278528,
      "learning_rate": 4.9879456330297085e-05,
      "loss": 2.2576,
      "num_input_tokens_seen": 2859896816,
      "step": 3635
    },
    {
      "epoch": 0.3857415658816041,
      "grad_norm": 1.0858718716597022,
      "learning_rate": 4.987938815616547e-05,
      "loss": 2.1327,
      "num_input_tokens_seen": 2860683584,
      "step": 3636
    },
    {
      "epoch": 0.3858476554211755,
      "grad_norm": 0.6649365886900568,
      "learning_rate": 4.987931996280779e-05,
      "loss": 1.9497,
      "num_input_tokens_seen": 2861470416,
      "step": 3637
    },
    {
      "epoch": 0.38595374496074686,
      "grad_norm": 0.906429107841575,
      "learning_rate": 4.9879251750224096e-05,
      "loss": 1.9356,
      "num_input_tokens_seen": 2862257168,
      "step": 3638
    },
    {
      "epoch": 0.3860598345003183,
      "grad_norm": 0.641815389779497,
      "learning_rate": 4.9879183518414456e-05,
      "loss": 2.1834,
      "num_input_tokens_seen": 2863043904,
      "step": 3639
    },
    {
      "epoch": 0.38616592403988964,
      "grad_norm": 0.9555401014890013,
      "learning_rate": 4.987911526737891e-05,
      "loss": 2.3202,
      "num_input_tokens_seen": 2863830624,
      "step": 3640
    },
    {
      "epoch": 0.38627201357946106,
      "grad_norm": 0.5282027106242569,
      "learning_rate": 4.987904699711751e-05,
      "loss": 2.1967,
      "num_input_tokens_seen": 2864617344,
      "step": 3641
    },
    {
      "epoch": 0.3863781031190325,
      "grad_norm": 0.9274832599452268,
      "learning_rate": 4.987897870763032e-05,
      "loss": 2.1443,
      "num_input_tokens_seen": 2865404176,
      "step": 3642
    },
    {
      "epoch": 0.38648419265860384,
      "grad_norm": 0.7207529434559097,
      "learning_rate": 4.987891039891738e-05,
      "loss": 2.0672,
      "num_input_tokens_seen": 2866190960,
      "step": 3643
    },
    {
      "epoch": 0.38659028219817526,
      "grad_norm": 0.5882476760002648,
      "learning_rate": 4.987884207097875e-05,
      "loss": 2.2402,
      "num_input_tokens_seen": 2866977664,
      "step": 3644
    },
    {
      "epoch": 0.3866963717377467,
      "grad_norm": 0.4771729337576332,
      "learning_rate": 4.9878773723814475e-05,
      "loss": 2.0539,
      "num_input_tokens_seen": 2867764496,
      "step": 3645
    },
    {
      "epoch": 0.38680246127731804,
      "grad_norm": 0.5527176931513912,
      "learning_rate": 4.987870535742462e-05,
      "loss": 2.0186,
      "num_input_tokens_seen": 2868551296,
      "step": 3646
    },
    {
      "epoch": 0.38690855081688946,
      "grad_norm": 0.648759182529866,
      "learning_rate": 4.9878636971809234e-05,
      "loss": 2.2384,
      "num_input_tokens_seen": 2869338048,
      "step": 3647
    },
    {
      "epoch": 0.3870146403564608,
      "grad_norm": 1.1167856945244548,
      "learning_rate": 4.987856856696836e-05,
      "loss": 2.1368,
      "num_input_tokens_seen": 2870124784,
      "step": 3648
    },
    {
      "epoch": 0.38712072989603225,
      "grad_norm": 0.6155548028952019,
      "learning_rate": 4.987850014290206e-05,
      "loss": 2.0398,
      "num_input_tokens_seen": 2870911584,
      "step": 3649
    },
    {
      "epoch": 0.38722681943560366,
      "grad_norm": 0.817640799033765,
      "learning_rate": 4.9878431699610385e-05,
      "loss": 1.985,
      "num_input_tokens_seen": 2871698320,
      "step": 3650
    },
    {
      "epoch": 0.387332908975175,
      "grad_norm": 0.6638653992950295,
      "learning_rate": 4.987836323709339e-05,
      "loss": 2.2431,
      "num_input_tokens_seen": 2872485136,
      "step": 3651
    },
    {
      "epoch": 0.38743899851474645,
      "grad_norm": 0.6731195872478444,
      "learning_rate": 4.987829475535113e-05,
      "loss": 2.0365,
      "num_input_tokens_seen": 2873271872,
      "step": 3652
    },
    {
      "epoch": 0.38754508805431787,
      "grad_norm": 0.5791674483834617,
      "learning_rate": 4.987822625438364e-05,
      "loss": 2.0356,
      "num_input_tokens_seen": 2874058688,
      "step": 3653
    },
    {
      "epoch": 0.38765117759388923,
      "grad_norm": 0.6706224401802041,
      "learning_rate": 4.9878157734191e-05,
      "loss": 1.9864,
      "num_input_tokens_seen": 2874845392,
      "step": 3654
    },
    {
      "epoch": 0.38775726713346065,
      "grad_norm": 0.6291984598024318,
      "learning_rate": 4.987808919477325e-05,
      "loss": 2.2377,
      "num_input_tokens_seen": 2875632240,
      "step": 3655
    },
    {
      "epoch": 0.387863356673032,
      "grad_norm": 0.485599379147993,
      "learning_rate": 4.987802063613043e-05,
      "loss": 2.0672,
      "num_input_tokens_seen": 2876418976,
      "step": 3656
    },
    {
      "epoch": 0.38796944621260343,
      "grad_norm": 0.7340979901683116,
      "learning_rate": 4.9877952058262614e-05,
      "loss": 2.0261,
      "num_input_tokens_seen": 2877205728,
      "step": 3657
    },
    {
      "epoch": 0.38807553575217485,
      "grad_norm": 0.48713396357072536,
      "learning_rate": 4.987788346116985e-05,
      "loss": 2.049,
      "num_input_tokens_seen": 2877992608,
      "step": 3658
    },
    {
      "epoch": 0.3881816252917462,
      "grad_norm": 0.5935203356348987,
      "learning_rate": 4.987781484485218e-05,
      "loss": 1.9926,
      "num_input_tokens_seen": 2878779312,
      "step": 3659
    },
    {
      "epoch": 0.38828771483131763,
      "grad_norm": 0.4879469531507264,
      "learning_rate": 4.987774620930967e-05,
      "loss": 1.9719,
      "num_input_tokens_seen": 2879566128,
      "step": 3660
    },
    {
      "epoch": 0.38839380437088905,
      "grad_norm": 0.5774176355433419,
      "learning_rate": 4.987767755454237e-05,
      "loss": 2.0672,
      "num_input_tokens_seen": 2880352880,
      "step": 3661
    },
    {
      "epoch": 0.3884998939104604,
      "grad_norm": 0.606045255730075,
      "learning_rate": 4.987760888055032e-05,
      "loss": 2.3284,
      "num_input_tokens_seen": 2881139520,
      "step": 3662
    },
    {
      "epoch": 0.38860598345003183,
      "grad_norm": 0.6174248825696886,
      "learning_rate": 4.9877540187333595e-05,
      "loss": 2.1574,
      "num_input_tokens_seen": 2881926272,
      "step": 3663
    },
    {
      "epoch": 0.38871207298960325,
      "grad_norm": 0.49388341520516205,
      "learning_rate": 4.987747147489223e-05,
      "loss": 1.9991,
      "num_input_tokens_seen": 2882713088,
      "step": 3664
    },
    {
      "epoch": 0.3888181625291746,
      "grad_norm": 0.6240777990572886,
      "learning_rate": 4.9877402743226285e-05,
      "loss": 2.2107,
      "num_input_tokens_seen": 2883499760,
      "step": 3665
    },
    {
      "epoch": 0.38892425206874603,
      "grad_norm": 0.5394786787887925,
      "learning_rate": 4.987733399233582e-05,
      "loss": 2.1067,
      "num_input_tokens_seen": 2884286480,
      "step": 3666
    },
    {
      "epoch": 0.3890303416083174,
      "grad_norm": 0.7135045489272906,
      "learning_rate": 4.987726522222088e-05,
      "loss": 2.1469,
      "num_input_tokens_seen": 2885073168,
      "step": 3667
    },
    {
      "epoch": 0.3891364311478888,
      "grad_norm": 0.45586267551681203,
      "learning_rate": 4.9877196432881514e-05,
      "loss": 2.0217,
      "num_input_tokens_seen": 2885859920,
      "step": 3668
    },
    {
      "epoch": 0.38924252068746024,
      "grad_norm": 0.7324527526730732,
      "learning_rate": 4.987712762431778e-05,
      "loss": 2.0255,
      "num_input_tokens_seen": 2886646656,
      "step": 3669
    },
    {
      "epoch": 0.3893486102270316,
      "grad_norm": 0.6572721184197368,
      "learning_rate": 4.9877058796529735e-05,
      "loss": 2.1451,
      "num_input_tokens_seen": 2887433424,
      "step": 3670
    },
    {
      "epoch": 0.389454699766603,
      "grad_norm": 0.4582925657053132,
      "learning_rate": 4.987698994951743e-05,
      "loss": 2.0693,
      "num_input_tokens_seen": 2888220128,
      "step": 3671
    },
    {
      "epoch": 0.38956078930617444,
      "grad_norm": 0.6794205659588131,
      "learning_rate": 4.987692108328092e-05,
      "loss": 1.9765,
      "num_input_tokens_seen": 2889006960,
      "step": 3672
    },
    {
      "epoch": 0.3896668788457458,
      "grad_norm": 0.6305064197059832,
      "learning_rate": 4.987685219782025e-05,
      "loss": 2.1634,
      "num_input_tokens_seen": 2889793712,
      "step": 3673
    },
    {
      "epoch": 0.3897729683853172,
      "grad_norm": 0.6934881780963046,
      "learning_rate": 4.9876783293135474e-05,
      "loss": 2.1089,
      "num_input_tokens_seen": 2890580384,
      "step": 3674
    },
    {
      "epoch": 0.3898790579248886,
      "grad_norm": 1.682988675425153,
      "learning_rate": 4.987671436922666e-05,
      "loss": 1.9687,
      "num_input_tokens_seen": 2891367152,
      "step": 3675
    },
    {
      "epoch": 0.38998514746446,
      "grad_norm": 0.8348896233121704,
      "learning_rate": 4.9876645426093845e-05,
      "loss": 2.1816,
      "num_input_tokens_seen": 2892153824,
      "step": 3676
    },
    {
      "epoch": 0.3900912370040314,
      "grad_norm": 0.7112346234157836,
      "learning_rate": 4.987657646373709e-05,
      "loss": 2.1372,
      "num_input_tokens_seen": 2892940640,
      "step": 3677
    },
    {
      "epoch": 0.3901973265436028,
      "grad_norm": 0.5041713683908675,
      "learning_rate": 4.9876507482156444e-05,
      "loss": 1.9992,
      "num_input_tokens_seen": 2893727488,
      "step": 3678
    },
    {
      "epoch": 0.3903034160831742,
      "grad_norm": 0.7890123755354108,
      "learning_rate": 4.9876438481351964e-05,
      "loss": 2.0834,
      "num_input_tokens_seen": 2894514288,
      "step": 3679
    },
    {
      "epoch": 0.3904095056227456,
      "grad_norm": 0.5910325672012859,
      "learning_rate": 4.98763694613237e-05,
      "loss": 2.0913,
      "num_input_tokens_seen": 2895300992,
      "step": 3680
    },
    {
      "epoch": 0.390515595162317,
      "grad_norm": 0.6491043924482941,
      "learning_rate": 4.9876300422071715e-05,
      "loss": 2.0682,
      "num_input_tokens_seen": 2896087728,
      "step": 3681
    },
    {
      "epoch": 0.3906216847018884,
      "grad_norm": 0.6353152195866812,
      "learning_rate": 4.987623136359605e-05,
      "loss": 2.1499,
      "num_input_tokens_seen": 2896874464,
      "step": 3682
    },
    {
      "epoch": 0.39072777424145977,
      "grad_norm": 0.5305133340114538,
      "learning_rate": 4.9876162285896765e-05,
      "loss": 2.0324,
      "num_input_tokens_seen": 2897661296,
      "step": 3683
    },
    {
      "epoch": 0.3908338637810312,
      "grad_norm": 0.7312273562733181,
      "learning_rate": 4.987609318897391e-05,
      "loss": 2.1074,
      "num_input_tokens_seen": 2898448016,
      "step": 3684
    },
    {
      "epoch": 0.3909399533206026,
      "grad_norm": 0.7660897774540791,
      "learning_rate": 4.987602407282754e-05,
      "loss": 2.0711,
      "num_input_tokens_seen": 2899234896,
      "step": 3685
    },
    {
      "epoch": 0.39104604286017397,
      "grad_norm": 0.6108089651648138,
      "learning_rate": 4.9875954937457715e-05,
      "loss": 2.2225,
      "num_input_tokens_seen": 2900021712,
      "step": 3686
    },
    {
      "epoch": 0.3911521323997454,
      "grad_norm": 0.9495950750564152,
      "learning_rate": 4.9875885782864476e-05,
      "loss": 1.962,
      "num_input_tokens_seen": 2900808416,
      "step": 3687
    },
    {
      "epoch": 0.3912582219393168,
      "grad_norm": 0.7904049363231612,
      "learning_rate": 4.987581660904788e-05,
      "loss": 2.0797,
      "num_input_tokens_seen": 2901595120,
      "step": 3688
    },
    {
      "epoch": 0.39136431147888817,
      "grad_norm": 0.6176165327537622,
      "learning_rate": 4.987574741600798e-05,
      "loss": 2.0305,
      "num_input_tokens_seen": 2902381808,
      "step": 3689
    },
    {
      "epoch": 0.3914704010184596,
      "grad_norm": 0.6921937973949721,
      "learning_rate": 4.9875678203744845e-05,
      "loss": 2.053,
      "num_input_tokens_seen": 2903168656,
      "step": 3690
    },
    {
      "epoch": 0.39157649055803095,
      "grad_norm": 0.6793199464818369,
      "learning_rate": 4.9875608972258504e-05,
      "loss": 2.1003,
      "num_input_tokens_seen": 2903955440,
      "step": 3691
    },
    {
      "epoch": 0.3916825800976024,
      "grad_norm": 0.701428664783686,
      "learning_rate": 4.987553972154903e-05,
      "loss": 2.055,
      "num_input_tokens_seen": 2904742240,
      "step": 3692
    },
    {
      "epoch": 0.3917886696371738,
      "grad_norm": 0.7838664013056894,
      "learning_rate": 4.987547045161647e-05,
      "loss": 1.9739,
      "num_input_tokens_seen": 2905529136,
      "step": 3693
    },
    {
      "epoch": 0.39189475917674516,
      "grad_norm": 0.7696874391484659,
      "learning_rate": 4.987540116246087e-05,
      "loss": 2.1006,
      "num_input_tokens_seen": 2906315920,
      "step": 3694
    },
    {
      "epoch": 0.3920008487163166,
      "grad_norm": 0.6578053787201081,
      "learning_rate": 4.9875331854082286e-05,
      "loss": 2.0839,
      "num_input_tokens_seen": 2907102704,
      "step": 3695
    },
    {
      "epoch": 0.392106938255888,
      "grad_norm": 0.5937958343293878,
      "learning_rate": 4.987526252648078e-05,
      "loss": 2.3048,
      "num_input_tokens_seen": 2907889376,
      "step": 3696
    },
    {
      "epoch": 0.39221302779545936,
      "grad_norm": 0.7347636742959173,
      "learning_rate": 4.987519317965641e-05,
      "loss": 2.2023,
      "num_input_tokens_seen": 2908676128,
      "step": 3697
    },
    {
      "epoch": 0.3923191173350308,
      "grad_norm": 0.6119682208419072,
      "learning_rate": 4.9875123813609206e-05,
      "loss": 2.0922,
      "num_input_tokens_seen": 2909462960,
      "step": 3698
    },
    {
      "epoch": 0.39242520687460214,
      "grad_norm": 0.5964688135093429,
      "learning_rate": 4.987505442833925e-05,
      "loss": 1.9653,
      "num_input_tokens_seen": 2910249872,
      "step": 3699
    },
    {
      "epoch": 0.39253129641417356,
      "grad_norm": 0.7497711585554573,
      "learning_rate": 4.987498502384657e-05,
      "loss": 2.0592,
      "num_input_tokens_seen": 2911036688,
      "step": 3700
    },
    {
      "epoch": 0.392637385953745,
      "grad_norm": 0.687563202398919,
      "learning_rate": 4.987491560013124e-05,
      "loss": 2.0783,
      "num_input_tokens_seen": 2911823376,
      "step": 3701
    },
    {
      "epoch": 0.39274347549331634,
      "grad_norm": 0.5423173844884523,
      "learning_rate": 4.98748461571933e-05,
      "loss": 2.0296,
      "num_input_tokens_seen": 2912610080,
      "step": 3702
    },
    {
      "epoch": 0.39284956503288776,
      "grad_norm": 0.6594931819457508,
      "learning_rate": 4.987477669503281e-05,
      "loss": 2.1353,
      "num_input_tokens_seen": 2913396832,
      "step": 3703
    },
    {
      "epoch": 0.3929556545724592,
      "grad_norm": 0.5062828790514506,
      "learning_rate": 4.987470721364982e-05,
      "loss": 2.0092,
      "num_input_tokens_seen": 2914183584,
      "step": 3704
    },
    {
      "epoch": 0.39306174411203054,
      "grad_norm": 0.9423342653023482,
      "learning_rate": 4.987463771304439e-05,
      "loss": 2.2697,
      "num_input_tokens_seen": 2914970416,
      "step": 3705
    },
    {
      "epoch": 0.39316783365160196,
      "grad_norm": 1.0556468959056442,
      "learning_rate": 4.987456819321657e-05,
      "loss": 2.1957,
      "num_input_tokens_seen": 2915757136,
      "step": 3706
    },
    {
      "epoch": 0.3932739231911733,
      "grad_norm": 0.7075877668936563,
      "learning_rate": 4.987449865416641e-05,
      "loss": 2.1533,
      "num_input_tokens_seen": 2916543760,
      "step": 3707
    },
    {
      "epoch": 0.39338001273074474,
      "grad_norm": 0.8954857066786349,
      "learning_rate": 4.987442909589397e-05,
      "loss": 1.9816,
      "num_input_tokens_seen": 2917330576,
      "step": 3708
    },
    {
      "epoch": 0.39348610227031616,
      "grad_norm": 0.8761483760969067,
      "learning_rate": 4.987435951839931e-05,
      "loss": 2.1299,
      "num_input_tokens_seen": 2918117232,
      "step": 3709
    },
    {
      "epoch": 0.3935921918098875,
      "grad_norm": 0.9654589880961956,
      "learning_rate": 4.987428992168246e-05,
      "loss": 1.9905,
      "num_input_tokens_seen": 2918904032,
      "step": 3710
    },
    {
      "epoch": 0.39369828134945895,
      "grad_norm": 0.7964802848680369,
      "learning_rate": 4.9874220305743494e-05,
      "loss": 1.8822,
      "num_input_tokens_seen": 2919690880,
      "step": 3711
    },
    {
      "epoch": 0.39380437088903036,
      "grad_norm": 0.5525431595855214,
      "learning_rate": 4.987415067058246e-05,
      "loss": 2.0652,
      "num_input_tokens_seen": 2920477712,
      "step": 3712
    },
    {
      "epoch": 0.3939104604286017,
      "grad_norm": 0.7240578814756551,
      "learning_rate": 4.9874081016199416e-05,
      "loss": 2.2547,
      "num_input_tokens_seen": 2921264384,
      "step": 3713
    },
    {
      "epoch": 0.39401654996817315,
      "grad_norm": 0.4921726850047594,
      "learning_rate": 4.987401134259441e-05,
      "loss": 2.1876,
      "num_input_tokens_seen": 2922051120,
      "step": 3714
    },
    {
      "epoch": 0.3941226395077445,
      "grad_norm": 0.7545107154374047,
      "learning_rate": 4.9873941649767494e-05,
      "loss": 2.0227,
      "num_input_tokens_seen": 2922837872,
      "step": 3715
    },
    {
      "epoch": 0.39422872904731593,
      "grad_norm": 0.6030265190623695,
      "learning_rate": 4.9873871937718725e-05,
      "loss": 1.9634,
      "num_input_tokens_seen": 2923624672,
      "step": 3716
    },
    {
      "epoch": 0.39433481858688735,
      "grad_norm": 0.6663615826956502,
      "learning_rate": 4.987380220644816e-05,
      "loss": 2.1552,
      "num_input_tokens_seen": 2924411408,
      "step": 3717
    },
    {
      "epoch": 0.3944409081264587,
      "grad_norm": 0.907942994375194,
      "learning_rate": 4.9873732455955854e-05,
      "loss": 2.1694,
      "num_input_tokens_seen": 2925198128,
      "step": 3718
    },
    {
      "epoch": 0.39454699766603013,
      "grad_norm": 1.3872134669194882,
      "learning_rate": 4.987366268624185e-05,
      "loss": 2.2998,
      "num_input_tokens_seen": 2925984784,
      "step": 3719
    },
    {
      "epoch": 0.39465308720560155,
      "grad_norm": 0.5934869982872933,
      "learning_rate": 4.987359289730622e-05,
      "loss": 2.1562,
      "num_input_tokens_seen": 2926771632,
      "step": 3720
    },
    {
      "epoch": 0.3947591767451729,
      "grad_norm": 0.8577840482154411,
      "learning_rate": 4.9873523089149e-05,
      "loss": 2.0846,
      "num_input_tokens_seen": 2927558368,
      "step": 3721
    },
    {
      "epoch": 0.39486526628474433,
      "grad_norm": 0.7275644516889096,
      "learning_rate": 4.9873453261770255e-05,
      "loss": 2.0451,
      "num_input_tokens_seen": 2928345200,
      "step": 3722
    },
    {
      "epoch": 0.3949713558243157,
      "grad_norm": 0.7278913975483411,
      "learning_rate": 4.987338341517003e-05,
      "loss": 2.26,
      "num_input_tokens_seen": 2929131952,
      "step": 3723
    },
    {
      "epoch": 0.3950774453638871,
      "grad_norm": 0.484277833151661,
      "learning_rate": 4.9873313549348386e-05,
      "loss": 2.094,
      "num_input_tokens_seen": 2929918752,
      "step": 3724
    },
    {
      "epoch": 0.39518353490345853,
      "grad_norm": 0.6711275761691268,
      "learning_rate": 4.987324366430538e-05,
      "loss": 2.0695,
      "num_input_tokens_seen": 2930705504,
      "step": 3725
    },
    {
      "epoch": 0.3952896244430299,
      "grad_norm": 0.6653075497970697,
      "learning_rate": 4.987317376004105e-05,
      "loss": 2.1217,
      "num_input_tokens_seen": 2931492192,
      "step": 3726
    },
    {
      "epoch": 0.3953957139826013,
      "grad_norm": 0.5222882615603283,
      "learning_rate": 4.9873103836555465e-05,
      "loss": 2.0594,
      "num_input_tokens_seen": 2932279040,
      "step": 3727
    },
    {
      "epoch": 0.39550180352217273,
      "grad_norm": 0.6294790336358884,
      "learning_rate": 4.987303389384869e-05,
      "loss": 2.1631,
      "num_input_tokens_seen": 2933065728,
      "step": 3728
    },
    {
      "epoch": 0.3956078930617441,
      "grad_norm": 0.5048104542688862,
      "learning_rate": 4.9872963931920747e-05,
      "loss": 2.1299,
      "num_input_tokens_seen": 2933852448,
      "step": 3729
    },
    {
      "epoch": 0.3957139826013155,
      "grad_norm": 0.8873262250666352,
      "learning_rate": 4.987289395077172e-05,
      "loss": 2.211,
      "num_input_tokens_seen": 2934639152,
      "step": 3730
    },
    {
      "epoch": 0.39582007214088694,
      "grad_norm": 0.8776039837031037,
      "learning_rate": 4.9872823950401634e-05,
      "loss": 2.2098,
      "num_input_tokens_seen": 2935425904,
      "step": 3731
    },
    {
      "epoch": 0.3959261616804583,
      "grad_norm": 0.5631571245346998,
      "learning_rate": 4.987275393081057e-05,
      "loss": 2.3544,
      "num_input_tokens_seen": 2936212640,
      "step": 3732
    },
    {
      "epoch": 0.3960322512200297,
      "grad_norm": 1.1951071800245232,
      "learning_rate": 4.9872683891998573e-05,
      "loss": 1.984,
      "num_input_tokens_seen": 2936999376,
      "step": 3733
    },
    {
      "epoch": 0.3961383407596011,
      "grad_norm": 0.6389293915675296,
      "learning_rate": 4.987261383396569e-05,
      "loss": 2.1839,
      "num_input_tokens_seen": 2937786192,
      "step": 3734
    },
    {
      "epoch": 0.3962444302991725,
      "grad_norm": 1.044161590441012,
      "learning_rate": 4.9872543756711986e-05,
      "loss": 2.1215,
      "num_input_tokens_seen": 2938572944,
      "step": 3735
    },
    {
      "epoch": 0.3963505198387439,
      "grad_norm": 1.380375715811325,
      "learning_rate": 4.98724736602375e-05,
      "loss": 2.0953,
      "num_input_tokens_seen": 2939359680,
      "step": 3736
    },
    {
      "epoch": 0.3964566093783153,
      "grad_norm": 0.544080343124658,
      "learning_rate": 4.987240354454231e-05,
      "loss": 2.1405,
      "num_input_tokens_seen": 2940146608,
      "step": 3737
    },
    {
      "epoch": 0.3965626989178867,
      "grad_norm": 1.2800642670689157,
      "learning_rate": 4.987233340962645e-05,
      "loss": 2.2167,
      "num_input_tokens_seen": 2940933328,
      "step": 3738
    },
    {
      "epoch": 0.3966687884574581,
      "grad_norm": 0.7944452364791483,
      "learning_rate": 4.9872263255489984e-05,
      "loss": 2.0361,
      "num_input_tokens_seen": 2941720112,
      "step": 3739
    },
    {
      "epoch": 0.3967748779970295,
      "grad_norm": 0.5345711893371188,
      "learning_rate": 4.987219308213296e-05,
      "loss": 2.1788,
      "num_input_tokens_seen": 2942506864,
      "step": 3740
    },
    {
      "epoch": 0.3968809675366009,
      "grad_norm": 0.6296726810484918,
      "learning_rate": 4.987212288955543e-05,
      "loss": 2.1139,
      "num_input_tokens_seen": 2943293616,
      "step": 3741
    },
    {
      "epoch": 0.39698705707617227,
      "grad_norm": 0.4717718234404292,
      "learning_rate": 4.987205267775747e-05,
      "loss": 2.1473,
      "num_input_tokens_seen": 2944080400,
      "step": 3742
    },
    {
      "epoch": 0.3970931466157437,
      "grad_norm": 0.527709039256548,
      "learning_rate": 4.98719824467391e-05,
      "loss": 2.1299,
      "num_input_tokens_seen": 2944867184,
      "step": 3743
    },
    {
      "epoch": 0.3971992361553151,
      "grad_norm": 0.6128203990374431,
      "learning_rate": 4.9871912196500394e-05,
      "loss": 2.1429,
      "num_input_tokens_seen": 2945653824,
      "step": 3744
    },
    {
      "epoch": 0.39730532569488647,
      "grad_norm": 0.7189934188218371,
      "learning_rate": 4.987184192704141e-05,
      "loss": 2.041,
      "num_input_tokens_seen": 2946440576,
      "step": 3745
    },
    {
      "epoch": 0.3974114152344579,
      "grad_norm": 0.5017252609332495,
      "learning_rate": 4.987177163836219e-05,
      "loss": 2.1423,
      "num_input_tokens_seen": 2947227296,
      "step": 3746
    },
    {
      "epoch": 0.3975175047740293,
      "grad_norm": 0.8217564087234851,
      "learning_rate": 4.98717013304628e-05,
      "loss": 2.1719,
      "num_input_tokens_seen": 2948014048,
      "step": 3747
    },
    {
      "epoch": 0.39762359431360067,
      "grad_norm": 0.6592713087817837,
      "learning_rate": 4.987163100334329e-05,
      "loss": 2.1442,
      "num_input_tokens_seen": 2948800784,
      "step": 3748
    },
    {
      "epoch": 0.3977296838531721,
      "grad_norm": 0.604246913001043,
      "learning_rate": 4.987156065700371e-05,
      "loss": 2.0762,
      "num_input_tokens_seen": 2949587488,
      "step": 3749
    },
    {
      "epoch": 0.39783577339274345,
      "grad_norm": 0.6880450387577796,
      "learning_rate": 4.987149029144411e-05,
      "loss": 2.0746,
      "num_input_tokens_seen": 2950374304,
      "step": 3750
    },
    {
      "epoch": 0.39794186293231487,
      "grad_norm": 0.6969539385769408,
      "learning_rate": 4.9871419906664565e-05,
      "loss": 2.1194,
      "num_input_tokens_seen": 2951161088,
      "step": 3751
    },
    {
      "epoch": 0.3980479524718863,
      "grad_norm": 0.47678919351182547,
      "learning_rate": 4.987134950266511e-05,
      "loss": 2.0203,
      "num_input_tokens_seen": 2951947936,
      "step": 3752
    },
    {
      "epoch": 0.39815404201145765,
      "grad_norm": 0.628715682863006,
      "learning_rate": 4.987127907944581e-05,
      "loss": 2.0401,
      "num_input_tokens_seen": 2952734736,
      "step": 3753
    },
    {
      "epoch": 0.3982601315510291,
      "grad_norm": 0.5223407408808614,
      "learning_rate": 4.987120863700671e-05,
      "loss": 2.1846,
      "num_input_tokens_seen": 2953521440,
      "step": 3754
    },
    {
      "epoch": 0.3983662210906005,
      "grad_norm": 0.5467055257301102,
      "learning_rate": 4.987113817534788e-05,
      "loss": 2.0706,
      "num_input_tokens_seen": 2954308160,
      "step": 3755
    },
    {
      "epoch": 0.39847231063017186,
      "grad_norm": 0.4774426992312328,
      "learning_rate": 4.987106769446935e-05,
      "loss": 1.9822,
      "num_input_tokens_seen": 2955094992,
      "step": 3756
    },
    {
      "epoch": 0.3985784001697433,
      "grad_norm": 0.6019574227924116,
      "learning_rate": 4.9870997194371194e-05,
      "loss": 2.0687,
      "num_input_tokens_seen": 2955881792,
      "step": 3757
    },
    {
      "epoch": 0.39868448970931464,
      "grad_norm": 0.6756474937828314,
      "learning_rate": 4.9870926675053466e-05,
      "loss": 2.0793,
      "num_input_tokens_seen": 2956668576,
      "step": 3758
    },
    {
      "epoch": 0.39879057924888606,
      "grad_norm": 0.5280467818621243,
      "learning_rate": 4.987085613651621e-05,
      "loss": 2.1501,
      "num_input_tokens_seen": 2957455360,
      "step": 3759
    },
    {
      "epoch": 0.3988966687884575,
      "grad_norm": 0.4883817653948445,
      "learning_rate": 4.9870785578759496e-05,
      "loss": 2.0469,
      "num_input_tokens_seen": 2958242176,
      "step": 3760
    },
    {
      "epoch": 0.39900275832802884,
      "grad_norm": 0.555012503089525,
      "learning_rate": 4.9870715001783354e-05,
      "loss": 2.2205,
      "num_input_tokens_seen": 2959028880,
      "step": 3761
    },
    {
      "epoch": 0.39910884786760026,
      "grad_norm": 0.46767527256262764,
      "learning_rate": 4.9870644405587866e-05,
      "loss": 1.7602,
      "num_input_tokens_seen": 2959815712,
      "step": 3762
    },
    {
      "epoch": 0.3992149374071717,
      "grad_norm": 0.569548379644434,
      "learning_rate": 4.9870573790173065e-05,
      "loss": 2.0308,
      "num_input_tokens_seen": 2960602528,
      "step": 3763
    },
    {
      "epoch": 0.39932102694674304,
      "grad_norm": 0.4973617741124482,
      "learning_rate": 4.987050315553902e-05,
      "loss": 2.0161,
      "num_input_tokens_seen": 2961389344,
      "step": 3764
    },
    {
      "epoch": 0.39942711648631446,
      "grad_norm": 0.6741168816910945,
      "learning_rate": 4.9870432501685773e-05,
      "loss": 2.0072,
      "num_input_tokens_seen": 2962176176,
      "step": 3765
    },
    {
      "epoch": 0.3995332060258858,
      "grad_norm": 0.513203032962474,
      "learning_rate": 4.9870361828613385e-05,
      "loss": 2.1309,
      "num_input_tokens_seen": 2962962992,
      "step": 3766
    },
    {
      "epoch": 0.39963929556545724,
      "grad_norm": 0.7084279707377322,
      "learning_rate": 4.987029113632192e-05,
      "loss": 2.0346,
      "num_input_tokens_seen": 2963749744,
      "step": 3767
    },
    {
      "epoch": 0.39974538510502866,
      "grad_norm": 0.7058983991543769,
      "learning_rate": 4.987022042481142e-05,
      "loss": 2.0385,
      "num_input_tokens_seen": 2964536464,
      "step": 3768
    },
    {
      "epoch": 0.3998514746446,
      "grad_norm": 0.49765749950618593,
      "learning_rate": 4.987014969408194e-05,
      "loss": 2.0623,
      "num_input_tokens_seen": 2965323232,
      "step": 3769
    },
    {
      "epoch": 0.39995756418417144,
      "grad_norm": 0.5562463528656596,
      "learning_rate": 4.987007894413355e-05,
      "loss": 2.01,
      "num_input_tokens_seen": 2966109952,
      "step": 3770
    },
    {
      "epoch": 0.40006365372374286,
      "grad_norm": 0.5830945252453462,
      "learning_rate": 4.9870008174966274e-05,
      "loss": 1.8588,
      "num_input_tokens_seen": 2966896704,
      "step": 3771
    },
    {
      "epoch": 0.4001697432633142,
      "grad_norm": 0.9061047024845232,
      "learning_rate": 4.98699373865802e-05,
      "loss": 2.177,
      "num_input_tokens_seen": 2967683440,
      "step": 3772
    },
    {
      "epoch": 0.40027583280288564,
      "grad_norm": 1.8328236597623444,
      "learning_rate": 4.986986657897536e-05,
      "loss": 1.9586,
      "num_input_tokens_seen": 2968470256,
      "step": 3773
    },
    {
      "epoch": 0.400381922342457,
      "grad_norm": 0.8604198628925636,
      "learning_rate": 4.986979575215182e-05,
      "loss": 2.1135,
      "num_input_tokens_seen": 2969257040,
      "step": 3774
    },
    {
      "epoch": 0.4004880118820284,
      "grad_norm": 1.4047577139665979,
      "learning_rate": 4.986972490610963e-05,
      "loss": 2.1757,
      "num_input_tokens_seen": 2970043776,
      "step": 3775
    },
    {
      "epoch": 0.40059410142159985,
      "grad_norm": 1.0623543083116962,
      "learning_rate": 4.986965404084885e-05,
      "loss": 2.0748,
      "num_input_tokens_seen": 2970830432,
      "step": 3776
    },
    {
      "epoch": 0.4007001909611712,
      "grad_norm": 0.7071898973862469,
      "learning_rate": 4.986958315636953e-05,
      "loss": 2.2089,
      "num_input_tokens_seen": 2971617168,
      "step": 3777
    },
    {
      "epoch": 0.40080628050074263,
      "grad_norm": 0.639298556165414,
      "learning_rate": 4.9869512252671724e-05,
      "loss": 2.0515,
      "num_input_tokens_seen": 2972403920,
      "step": 3778
    },
    {
      "epoch": 0.40091237004031405,
      "grad_norm": 0.6763380461837392,
      "learning_rate": 4.986944132975549e-05,
      "loss": 2.031,
      "num_input_tokens_seen": 2973190752,
      "step": 3779
    },
    {
      "epoch": 0.4010184595798854,
      "grad_norm": 0.6320794822821116,
      "learning_rate": 4.986937038762088e-05,
      "loss": 2.2613,
      "num_input_tokens_seen": 2973977504,
      "step": 3780
    },
    {
      "epoch": 0.40112454911945683,
      "grad_norm": 0.9033232948128774,
      "learning_rate": 4.986929942626795e-05,
      "loss": 2.1435,
      "num_input_tokens_seen": 2974764272,
      "step": 3781
    },
    {
      "epoch": 0.4012306386590282,
      "grad_norm": 0.5899325440440368,
      "learning_rate": 4.986922844569676e-05,
      "loss": 2.0045,
      "num_input_tokens_seen": 2975551024,
      "step": 3782
    },
    {
      "epoch": 0.4013367281985996,
      "grad_norm": 1.0045777832241976,
      "learning_rate": 4.986915744590736e-05,
      "loss": 2.0231,
      "num_input_tokens_seen": 2976337712,
      "step": 3783
    },
    {
      "epoch": 0.40144281773817103,
      "grad_norm": 1.52393385111346,
      "learning_rate": 4.9869086426899796e-05,
      "loss": 2.0966,
      "num_input_tokens_seen": 2977124576,
      "step": 3784
    },
    {
      "epoch": 0.4015489072777424,
      "grad_norm": 0.8118528059013769,
      "learning_rate": 4.986901538867413e-05,
      "loss": 2.0967,
      "num_input_tokens_seen": 2977911328,
      "step": 3785
    },
    {
      "epoch": 0.4016549968173138,
      "grad_norm": 1.2042552407236187,
      "learning_rate": 4.986894433123043e-05,
      "loss": 2.1225,
      "num_input_tokens_seen": 2978698128,
      "step": 3786
    },
    {
      "epoch": 0.40176108635688523,
      "grad_norm": 0.778018616951665,
      "learning_rate": 4.986887325456874e-05,
      "loss": 2.0044,
      "num_input_tokens_seen": 2979484928,
      "step": 3787
    },
    {
      "epoch": 0.4018671758964566,
      "grad_norm": 0.8441611417672176,
      "learning_rate": 4.986880215868911e-05,
      "loss": 2.2235,
      "num_input_tokens_seen": 2980271568,
      "step": 3788
    },
    {
      "epoch": 0.401973265436028,
      "grad_norm": 0.8945191922679598,
      "learning_rate": 4.98687310435916e-05,
      "loss": 2.0501,
      "num_input_tokens_seen": 2981058304,
      "step": 3789
    },
    {
      "epoch": 0.4020793549755994,
      "grad_norm": 0.5219896518812237,
      "learning_rate": 4.986865990927626e-05,
      "loss": 2.1424,
      "num_input_tokens_seen": 2981844992,
      "step": 3790
    },
    {
      "epoch": 0.4021854445151708,
      "grad_norm": 0.7696141352562156,
      "learning_rate": 4.986858875574315e-05,
      "loss": 2.0126,
      "num_input_tokens_seen": 2982631792,
      "step": 3791
    },
    {
      "epoch": 0.4022915340547422,
      "grad_norm": 0.7738292646814849,
      "learning_rate": 4.9868517582992325e-05,
      "loss": 2.1383,
      "num_input_tokens_seen": 2983418512,
      "step": 3792
    },
    {
      "epoch": 0.4023976235943136,
      "grad_norm": 0.5983759363915175,
      "learning_rate": 4.986844639102384e-05,
      "loss": 2.0025,
      "num_input_tokens_seen": 2984205296,
      "step": 3793
    },
    {
      "epoch": 0.402503713133885,
      "grad_norm": 0.6680583983665662,
      "learning_rate": 4.9868375179837756e-05,
      "loss": 2.0935,
      "num_input_tokens_seen": 2984991984,
      "step": 3794
    },
    {
      "epoch": 0.4026098026734564,
      "grad_norm": 0.5142592829696087,
      "learning_rate": 4.9868303949434114e-05,
      "loss": 2.185,
      "num_input_tokens_seen": 2985778736,
      "step": 3795
    },
    {
      "epoch": 0.4027158922130278,
      "grad_norm": 0.6981173072806296,
      "learning_rate": 4.9868232699812975e-05,
      "loss": 2.2272,
      "num_input_tokens_seen": 2986565488,
      "step": 3796
    },
    {
      "epoch": 0.4028219817525992,
      "grad_norm": 0.5549496151348822,
      "learning_rate": 4.98681614309744e-05,
      "loss": 2.0704,
      "num_input_tokens_seen": 2987352176,
      "step": 3797
    },
    {
      "epoch": 0.40292807129217056,
      "grad_norm": 0.7369594977300936,
      "learning_rate": 4.9868090142918436e-05,
      "loss": 1.9914,
      "num_input_tokens_seen": 2988138928,
      "step": 3798
    },
    {
      "epoch": 0.403034160831742,
      "grad_norm": 1.1624317257074634,
      "learning_rate": 4.9868018835645145e-05,
      "loss": 2.0845,
      "num_input_tokens_seen": 2988925648,
      "step": 3799
    },
    {
      "epoch": 0.4031402503713134,
      "grad_norm": 0.7566429791401429,
      "learning_rate": 4.986794750915458e-05,
      "loss": 1.9699,
      "num_input_tokens_seen": 2989712432,
      "step": 3800
    },
    {
      "epoch": 0.40324633991088477,
      "grad_norm": 1.0453533280986647,
      "learning_rate": 4.986787616344679e-05,
      "loss": 2.1234,
      "num_input_tokens_seen": 2990499120,
      "step": 3801
    },
    {
      "epoch": 0.4033524294504562,
      "grad_norm": 0.8161738686091996,
      "learning_rate": 4.986780479852184e-05,
      "loss": 2.0318,
      "num_input_tokens_seen": 2991285888,
      "step": 3802
    },
    {
      "epoch": 0.4034585189900276,
      "grad_norm": 0.8859666290660688,
      "learning_rate": 4.9867733414379774e-05,
      "loss": 2.2154,
      "num_input_tokens_seen": 2992072560,
      "step": 3803
    },
    {
      "epoch": 0.40356460852959897,
      "grad_norm": 0.5926167770744489,
      "learning_rate": 4.986766201102066e-05,
      "loss": 2.1842,
      "num_input_tokens_seen": 2992859200,
      "step": 3804
    },
    {
      "epoch": 0.4036706980691704,
      "grad_norm": 0.9086358386042606,
      "learning_rate": 4.986759058844454e-05,
      "loss": 2.1743,
      "num_input_tokens_seen": 2993645856,
      "step": 3805
    },
    {
      "epoch": 0.4037767876087418,
      "grad_norm": 0.5488340137241411,
      "learning_rate": 4.986751914665148e-05,
      "loss": 2.0406,
      "num_input_tokens_seen": 2994432784,
      "step": 3806
    },
    {
      "epoch": 0.40388287714831317,
      "grad_norm": 1.5308726359299938,
      "learning_rate": 4.986744768564153e-05,
      "loss": 2.1282,
      "num_input_tokens_seen": 2995219584,
      "step": 3807
    },
    {
      "epoch": 0.4039889666878846,
      "grad_norm": 0.623958647330733,
      "learning_rate": 4.986737620541474e-05,
      "loss": 2.1535,
      "num_input_tokens_seen": 2996006368,
      "step": 3808
    },
    {
      "epoch": 0.40409505622745595,
      "grad_norm": 0.8221096593068062,
      "learning_rate": 4.9867304705971184e-05,
      "loss": 2.1251,
      "num_input_tokens_seen": 2996793056,
      "step": 3809
    },
    {
      "epoch": 0.40420114576702737,
      "grad_norm": 0.6697926220801634,
      "learning_rate": 4.9867233187310894e-05,
      "loss": 1.9842,
      "num_input_tokens_seen": 2997579872,
      "step": 3810
    },
    {
      "epoch": 0.4043072353065988,
      "grad_norm": 0.647950307676599,
      "learning_rate": 4.986716164943394e-05,
      "loss": 1.9018,
      "num_input_tokens_seen": 2998366720,
      "step": 3811
    },
    {
      "epoch": 0.40441332484617015,
      "grad_norm": 0.48105748425087796,
      "learning_rate": 4.9867090092340376e-05,
      "loss": 2.0479,
      "num_input_tokens_seen": 2999153456,
      "step": 3812
    },
    {
      "epoch": 0.40451941438574157,
      "grad_norm": 0.714954794496949,
      "learning_rate": 4.986701851603025e-05,
      "loss": 1.916,
      "num_input_tokens_seen": 2999940224,
      "step": 3813
    },
    {
      "epoch": 0.404625503925313,
      "grad_norm": 0.643949329429906,
      "learning_rate": 4.9866946920503624e-05,
      "loss": 1.9135,
      "num_input_tokens_seen": 3000727040,
      "step": 3814
    },
    {
      "epoch": 0.40473159346488435,
      "grad_norm": 0.5185489888673839,
      "learning_rate": 4.9866875305760544e-05,
      "loss": 2.085,
      "num_input_tokens_seen": 3001513760,
      "step": 3815
    },
    {
      "epoch": 0.4048376830044558,
      "grad_norm": 0.7104293103533288,
      "learning_rate": 4.9866803671801085e-05,
      "loss": 1.9222,
      "num_input_tokens_seen": 3002300624,
      "step": 3816
    },
    {
      "epoch": 0.40494377254402714,
      "grad_norm": 1.0178139395577444,
      "learning_rate": 4.986673201862528e-05,
      "loss": 2.3128,
      "num_input_tokens_seen": 3003087344,
      "step": 3817
    },
    {
      "epoch": 0.40504986208359856,
      "grad_norm": 0.6658042810004005,
      "learning_rate": 4.986666034623319e-05,
      "loss": 2.1409,
      "num_input_tokens_seen": 3003874048,
      "step": 3818
    },
    {
      "epoch": 0.40515595162317,
      "grad_norm": 0.6880992128500888,
      "learning_rate": 4.986658865462489e-05,
      "loss": 1.9623,
      "num_input_tokens_seen": 3004660768,
      "step": 3819
    },
    {
      "epoch": 0.40526204116274134,
      "grad_norm": 0.8569878671682049,
      "learning_rate": 4.9866516943800415e-05,
      "loss": 2.0496,
      "num_input_tokens_seen": 3005447504,
      "step": 3820
    },
    {
      "epoch": 0.40536813070231276,
      "grad_norm": 0.5919447549961268,
      "learning_rate": 4.9866445213759814e-05,
      "loss": 1.9971,
      "num_input_tokens_seen": 3006234320,
      "step": 3821
    },
    {
      "epoch": 0.4054742202418842,
      "grad_norm": 0.7346922661748159,
      "learning_rate": 4.9866373464503165e-05,
      "loss": 1.9946,
      "num_input_tokens_seen": 3007020976,
      "step": 3822
    },
    {
      "epoch": 0.40558030978145554,
      "grad_norm": 0.5602856386642877,
      "learning_rate": 4.98663016960305e-05,
      "loss": 2.2059,
      "num_input_tokens_seen": 3007807664,
      "step": 3823
    },
    {
      "epoch": 0.40568639932102696,
      "grad_norm": 0.6947301063328974,
      "learning_rate": 4.9866229908341896e-05,
      "loss": 2.0597,
      "num_input_tokens_seen": 3008594384,
      "step": 3824
    },
    {
      "epoch": 0.4057924888605983,
      "grad_norm": 0.5129380524084345,
      "learning_rate": 4.9866158101437405e-05,
      "loss": 2.0377,
      "num_input_tokens_seen": 3009381152,
      "step": 3825
    },
    {
      "epoch": 0.40589857840016974,
      "grad_norm": 1.1831358968166554,
      "learning_rate": 4.986608627531707e-05,
      "loss": 2.1654,
      "num_input_tokens_seen": 3010167936,
      "step": 3826
    },
    {
      "epoch": 0.40600466793974116,
      "grad_norm": 0.7044690757342194,
      "learning_rate": 4.986601442998096e-05,
      "loss": 1.8673,
      "num_input_tokens_seen": 3010954688,
      "step": 3827
    },
    {
      "epoch": 0.4061107574793125,
      "grad_norm": 0.879166178528025,
      "learning_rate": 4.9865942565429114e-05,
      "loss": 2.1631,
      "num_input_tokens_seen": 3011741488,
      "step": 3828
    },
    {
      "epoch": 0.40621684701888394,
      "grad_norm": 1.015031344915883,
      "learning_rate": 4.98658706816616e-05,
      "loss": 2.0719,
      "num_input_tokens_seen": 3012528224,
      "step": 3829
    },
    {
      "epoch": 0.40632293655845536,
      "grad_norm": 0.6123035391047246,
      "learning_rate": 4.9865798778678467e-05,
      "loss": 2.0958,
      "num_input_tokens_seen": 3013315088,
      "step": 3830
    },
    {
      "epoch": 0.4064290260980267,
      "grad_norm": 0.8978887153845877,
      "learning_rate": 4.986572685647978e-05,
      "loss": 2.0315,
      "num_input_tokens_seen": 3014101904,
      "step": 3831
    },
    {
      "epoch": 0.40653511563759814,
      "grad_norm": 0.7941227036029086,
      "learning_rate": 4.9865654915065583e-05,
      "loss": 2.1042,
      "num_input_tokens_seen": 3014888688,
      "step": 3832
    },
    {
      "epoch": 0.4066412051771695,
      "grad_norm": 0.5384739765420309,
      "learning_rate": 4.986558295443594e-05,
      "loss": 1.9636,
      "num_input_tokens_seen": 3015675568,
      "step": 3833
    },
    {
      "epoch": 0.4067472947167409,
      "grad_norm": 0.5805664183177914,
      "learning_rate": 4.986551097459091e-05,
      "loss": 1.9235,
      "num_input_tokens_seen": 3016462368,
      "step": 3834
    },
    {
      "epoch": 0.40685338425631234,
      "grad_norm": 0.7263553584869367,
      "learning_rate": 4.9865438975530545e-05,
      "loss": 2.1622,
      "num_input_tokens_seen": 3017249200,
      "step": 3835
    },
    {
      "epoch": 0.4069594737958837,
      "grad_norm": 0.5995541880745179,
      "learning_rate": 4.986536695725489e-05,
      "loss": 2.1395,
      "num_input_tokens_seen": 3018035968,
      "step": 3836
    },
    {
      "epoch": 0.4070655633354551,
      "grad_norm": 1.599611170569502,
      "learning_rate": 4.9865294919764e-05,
      "loss": 2.1319,
      "num_input_tokens_seen": 3018822704,
      "step": 3837
    },
    {
      "epoch": 0.40717165287502655,
      "grad_norm": 0.7716339783889928,
      "learning_rate": 4.986522286305796e-05,
      "loss": 2.0862,
      "num_input_tokens_seen": 3019609456,
      "step": 3838
    },
    {
      "epoch": 0.4072777424145979,
      "grad_norm": 1.1903071009262267,
      "learning_rate": 4.9865150787136796e-05,
      "loss": 2.1727,
      "num_input_tokens_seen": 3020396240,
      "step": 3839
    },
    {
      "epoch": 0.40738383195416933,
      "grad_norm": 1.2381052125588294,
      "learning_rate": 4.9865078692000566e-05,
      "loss": 2.1828,
      "num_input_tokens_seen": 3021183072,
      "step": 3840
    },
    {
      "epoch": 0.4074899214937407,
      "grad_norm": 0.7684251509602203,
      "learning_rate": 4.9865006577649346e-05,
      "loss": 1.9814,
      "num_input_tokens_seen": 3021969888,
      "step": 3841
    },
    {
      "epoch": 0.4075960110333121,
      "grad_norm": 1.5503242839979543,
      "learning_rate": 4.986493444408317e-05,
      "loss": 1.9858,
      "num_input_tokens_seen": 3022756656,
      "step": 3842
    },
    {
      "epoch": 0.40770210057288353,
      "grad_norm": 0.9064666455256357,
      "learning_rate": 4.9864862291302105e-05,
      "loss": 2.174,
      "num_input_tokens_seen": 3023543424,
      "step": 3843
    },
    {
      "epoch": 0.4078081901124549,
      "grad_norm": 1.3024636912252097,
      "learning_rate": 4.986479011930621e-05,
      "loss": 1.9746,
      "num_input_tokens_seen": 3024330176,
      "step": 3844
    },
    {
      "epoch": 0.4079142796520263,
      "grad_norm": 1.1276022773196799,
      "learning_rate": 4.9864717928095515e-05,
      "loss": 2.4298,
      "num_input_tokens_seen": 3025117024,
      "step": 3845
    },
    {
      "epoch": 0.40802036919159773,
      "grad_norm": 1.155780076896829,
      "learning_rate": 4.986464571767011e-05,
      "loss": 2.0692,
      "num_input_tokens_seen": 3025903872,
      "step": 3846
    },
    {
      "epoch": 0.4081264587311691,
      "grad_norm": 1.0219333945108795,
      "learning_rate": 4.986457348803004e-05,
      "loss": 2.1316,
      "num_input_tokens_seen": 3026690528,
      "step": 3847
    },
    {
      "epoch": 0.4082325482707405,
      "grad_norm": 0.8111454052320461,
      "learning_rate": 4.986450123917535e-05,
      "loss": 2.1279,
      "num_input_tokens_seen": 3027477232,
      "step": 3848
    },
    {
      "epoch": 0.4083386378103119,
      "grad_norm": 1.380085633688086,
      "learning_rate": 4.98644289711061e-05,
      "loss": 1.9725,
      "num_input_tokens_seen": 3028264080,
      "step": 3849
    },
    {
      "epoch": 0.4084447273498833,
      "grad_norm": 1.2311149307321816,
      "learning_rate": 4.986435668382236e-05,
      "loss": 2.0931,
      "num_input_tokens_seen": 3029050800,
      "step": 3850
    },
    {
      "epoch": 0.4085508168894547,
      "grad_norm": 1.8832216854832355,
      "learning_rate": 4.986428437732417e-05,
      "loss": 2.1302,
      "num_input_tokens_seen": 3029837632,
      "step": 3851
    },
    {
      "epoch": 0.4086569064290261,
      "grad_norm": 1.5475655288178305,
      "learning_rate": 4.986421205161159e-05,
      "loss": 2.1914,
      "num_input_tokens_seen": 3030624384,
      "step": 3852
    },
    {
      "epoch": 0.4087629959685975,
      "grad_norm": 1.072567225322472,
      "learning_rate": 4.986413970668467e-05,
      "loss": 2.1918,
      "num_input_tokens_seen": 3031411136,
      "step": 3853
    },
    {
      "epoch": 0.4088690855081689,
      "grad_norm": 0.7181693459566597,
      "learning_rate": 4.9864067342543484e-05,
      "loss": 2.1871,
      "num_input_tokens_seen": 3032197872,
      "step": 3854
    },
    {
      "epoch": 0.4089751750477403,
      "grad_norm": 1.1563655904348784,
      "learning_rate": 4.986399495918807e-05,
      "loss": 2.0586,
      "num_input_tokens_seen": 3032984624,
      "step": 3855
    },
    {
      "epoch": 0.4090812645873117,
      "grad_norm": 0.6424658521874236,
      "learning_rate": 4.9863922556618495e-05,
      "loss": 2.0649,
      "num_input_tokens_seen": 3033771504,
      "step": 3856
    },
    {
      "epoch": 0.40918735412688306,
      "grad_norm": 1.2988278095169359,
      "learning_rate": 4.98638501348348e-05,
      "loss": 2.0889,
      "num_input_tokens_seen": 3034558272,
      "step": 3857
    },
    {
      "epoch": 0.4092934436664545,
      "grad_norm": 0.75043995649467,
      "learning_rate": 4.986377769383706e-05,
      "loss": 2.1442,
      "num_input_tokens_seen": 3035345056,
      "step": 3858
    },
    {
      "epoch": 0.4093995332060259,
      "grad_norm": 1.2574355537500406,
      "learning_rate": 4.9863705233625316e-05,
      "loss": 2.1008,
      "num_input_tokens_seen": 3036131840,
      "step": 3859
    },
    {
      "epoch": 0.40950562274559726,
      "grad_norm": 0.7046870038948546,
      "learning_rate": 4.986363275419964e-05,
      "loss": 2.116,
      "num_input_tokens_seen": 3036918528,
      "step": 3860
    },
    {
      "epoch": 0.4096117122851687,
      "grad_norm": 1.5307056881596852,
      "learning_rate": 4.986356025556007e-05,
      "loss": 2.0554,
      "num_input_tokens_seen": 3037705360,
      "step": 3861
    },
    {
      "epoch": 0.4097178018247401,
      "grad_norm": 0.8613492837096899,
      "learning_rate": 4.986348773770667e-05,
      "loss": 2.124,
      "num_input_tokens_seen": 3038492176,
      "step": 3862
    },
    {
      "epoch": 0.40982389136431147,
      "grad_norm": 1.996869547437428,
      "learning_rate": 4.9863415200639495e-05,
      "loss": 2.1038,
      "num_input_tokens_seen": 3039278944,
      "step": 3863
    },
    {
      "epoch": 0.4099299809038829,
      "grad_norm": 1.364437363518814,
      "learning_rate": 4.9863342644358606e-05,
      "loss": 2.0014,
      "num_input_tokens_seen": 3040065776,
      "step": 3864
    },
    {
      "epoch": 0.41003607044345425,
      "grad_norm": 2.0594841597504794,
      "learning_rate": 4.9863270068864055e-05,
      "loss": 1.9947,
      "num_input_tokens_seen": 3040852560,
      "step": 3865
    },
    {
      "epoch": 0.41014215998302567,
      "grad_norm": 4.5845244721364296,
      "learning_rate": 4.98631974741559e-05,
      "loss": 2.074,
      "num_input_tokens_seen": 3041639264,
      "step": 3866
    },
    {
      "epoch": 0.4102482495225971,
      "grad_norm": 1.3450458997338728,
      "learning_rate": 4.986312486023419e-05,
      "loss": 1.9467,
      "num_input_tokens_seen": 3042426080,
      "step": 3867
    },
    {
      "epoch": 0.41035433906216845,
      "grad_norm": 4.329516050088217,
      "learning_rate": 4.9863052227098995e-05,
      "loss": 2.1576,
      "num_input_tokens_seen": 3043212880,
      "step": 3868
    },
    {
      "epoch": 0.41046042860173987,
      "grad_norm": 1.3965617471199112,
      "learning_rate": 4.986297957475036e-05,
      "loss": 2.1389,
      "num_input_tokens_seen": 3043999712,
      "step": 3869
    },
    {
      "epoch": 0.4105665181413113,
      "grad_norm": 2.7476921253694364,
      "learning_rate": 4.986290690318834e-05,
      "loss": 2.2349,
      "num_input_tokens_seen": 3044786416,
      "step": 3870
    },
    {
      "epoch": 0.41067260768088265,
      "grad_norm": 1.8139037471458872,
      "learning_rate": 4.986283421241299e-05,
      "loss": 1.9975,
      "num_input_tokens_seen": 3045573152,
      "step": 3871
    },
    {
      "epoch": 0.41077869722045407,
      "grad_norm": 1.3416195208438146,
      "learning_rate": 4.986276150242438e-05,
      "loss": 1.9062,
      "num_input_tokens_seen": 3046359920,
      "step": 3872
    },
    {
      "epoch": 0.4108847867600255,
      "grad_norm": 1.9362469793014903,
      "learning_rate": 4.986268877322256e-05,
      "loss": 2.0939,
      "num_input_tokens_seen": 3047146640,
      "step": 3873
    },
    {
      "epoch": 0.41099087629959685,
      "grad_norm": 0.8870928664751567,
      "learning_rate": 4.986261602480758e-05,
      "loss": 2.1139,
      "num_input_tokens_seen": 3047933376,
      "step": 3874
    },
    {
      "epoch": 0.41109696583916827,
      "grad_norm": 1.2204074623278953,
      "learning_rate": 4.9862543257179494e-05,
      "loss": 2.0827,
      "num_input_tokens_seen": 3048720144,
      "step": 3875
    },
    {
      "epoch": 0.41120305537873963,
      "grad_norm": 0.6511527264829003,
      "learning_rate": 4.986247047033837e-05,
      "loss": 2.1137,
      "num_input_tokens_seen": 3049506896,
      "step": 3876
    },
    {
      "epoch": 0.41130914491831105,
      "grad_norm": 1.0586192598917075,
      "learning_rate": 4.986239766428426e-05,
      "loss": 2.0215,
      "num_input_tokens_seen": 3050293632,
      "step": 3877
    },
    {
      "epoch": 0.4114152344578825,
      "grad_norm": 0.7025351573354159,
      "learning_rate": 4.9862324839017215e-05,
      "loss": 1.8872,
      "num_input_tokens_seen": 3051080496,
      "step": 3878
    },
    {
      "epoch": 0.41152132399745384,
      "grad_norm": 0.8851103678477212,
      "learning_rate": 4.98622519945373e-05,
      "loss": 2.1905,
      "num_input_tokens_seen": 3051867296,
      "step": 3879
    },
    {
      "epoch": 0.41162741353702526,
      "grad_norm": 0.5274644271698722,
      "learning_rate": 4.986217913084456e-05,
      "loss": 2.1211,
      "num_input_tokens_seen": 3052653984,
      "step": 3880
    },
    {
      "epoch": 0.4117335030765967,
      "grad_norm": 0.6494570782269335,
      "learning_rate": 4.986210624793906e-05,
      "loss": 1.985,
      "num_input_tokens_seen": 3053440752,
      "step": 3881
    },
    {
      "epoch": 0.41183959261616804,
      "grad_norm": 0.4938621761792658,
      "learning_rate": 4.986203334582086e-05,
      "loss": 2.1199,
      "num_input_tokens_seen": 3054227520,
      "step": 3882
    },
    {
      "epoch": 0.41194568215573946,
      "grad_norm": 0.6318469810971206,
      "learning_rate": 4.9861960424489994e-05,
      "loss": 1.9894,
      "num_input_tokens_seen": 3055014240,
      "step": 3883
    },
    {
      "epoch": 0.4120517716953108,
      "grad_norm": 0.5718726033562093,
      "learning_rate": 4.9861887483946544e-05,
      "loss": 2.0512,
      "num_input_tokens_seen": 3055801008,
      "step": 3884
    },
    {
      "epoch": 0.41215786123488224,
      "grad_norm": 0.6375976589561676,
      "learning_rate": 4.9861814524190564e-05,
      "loss": 2.207,
      "num_input_tokens_seen": 3056587728,
      "step": 3885
    },
    {
      "epoch": 0.41226395077445366,
      "grad_norm": 0.5822730073467431,
      "learning_rate": 4.9861741545222094e-05,
      "loss": 2.0163,
      "num_input_tokens_seen": 3057374512,
      "step": 3886
    },
    {
      "epoch": 0.412370040314025,
      "grad_norm": 0.5740320875331788,
      "learning_rate": 4.98616685470412e-05,
      "loss": 1.9376,
      "num_input_tokens_seen": 3058161312,
      "step": 3887
    },
    {
      "epoch": 0.41247612985359644,
      "grad_norm": 0.5010791279617722,
      "learning_rate": 4.9861595529647944e-05,
      "loss": 1.9972,
      "num_input_tokens_seen": 3058947984,
      "step": 3888
    },
    {
      "epoch": 0.41258221939316786,
      "grad_norm": 0.8274600927994128,
      "learning_rate": 4.9861522493042365e-05,
      "loss": 2.1085,
      "num_input_tokens_seen": 3059734720,
      "step": 3889
    },
    {
      "epoch": 0.4126883089327392,
      "grad_norm": 0.5407868673527565,
      "learning_rate": 4.986144943722454e-05,
      "loss": 2.0569,
      "num_input_tokens_seen": 3060521440,
      "step": 3890
    },
    {
      "epoch": 0.41279439847231064,
      "grad_norm": 0.8532806196124426,
      "learning_rate": 4.986137636219451e-05,
      "loss": 2.0468,
      "num_input_tokens_seen": 3061308128,
      "step": 3891
    },
    {
      "epoch": 0.412900488011882,
      "grad_norm": 0.5343986423182208,
      "learning_rate": 4.9861303267952345e-05,
      "loss": 1.9377,
      "num_input_tokens_seen": 3062094976,
      "step": 3892
    },
    {
      "epoch": 0.4130065775514534,
      "grad_norm": 0.7536996157429667,
      "learning_rate": 4.9861230154498096e-05,
      "loss": 2.0644,
      "num_input_tokens_seen": 3062881776,
      "step": 3893
    },
    {
      "epoch": 0.41311266709102484,
      "grad_norm": 0.7370194708253237,
      "learning_rate": 4.986115702183181e-05,
      "loss": 2.0072,
      "num_input_tokens_seen": 3063668560,
      "step": 3894
    },
    {
      "epoch": 0.4132187566305962,
      "grad_norm": 0.6038751902980731,
      "learning_rate": 4.986108386995355e-05,
      "loss": 2.1397,
      "num_input_tokens_seen": 3064455392,
      "step": 3895
    },
    {
      "epoch": 0.4133248461701676,
      "grad_norm": 0.5756428602200103,
      "learning_rate": 4.986101069886339e-05,
      "loss": 2.128,
      "num_input_tokens_seen": 3065242016,
      "step": 3896
    },
    {
      "epoch": 0.41343093570973904,
      "grad_norm": 0.8100458245493839,
      "learning_rate": 4.9860937508561357e-05,
      "loss": 2.1021,
      "num_input_tokens_seen": 3066028832,
      "step": 3897
    },
    {
      "epoch": 0.4135370252493104,
      "grad_norm": 0.8196755031916121,
      "learning_rate": 4.986086429904752e-05,
      "loss": 1.9967,
      "num_input_tokens_seen": 3066815552,
      "step": 3898
    },
    {
      "epoch": 0.4136431147888818,
      "grad_norm": 0.8504862804473947,
      "learning_rate": 4.986079107032195e-05,
      "loss": 2.0614,
      "num_input_tokens_seen": 3067602288,
      "step": 3899
    },
    {
      "epoch": 0.4137492043284532,
      "grad_norm": 1.2141887120598578,
      "learning_rate": 4.986071782238467e-05,
      "loss": 2.1048,
      "num_input_tokens_seen": 3068389152,
      "step": 3900
    },
    {
      "epoch": 0.4138552938680246,
      "grad_norm": 0.5661345249205488,
      "learning_rate": 4.986064455523577e-05,
      "loss": 2.1362,
      "num_input_tokens_seen": 3069176016,
      "step": 3901
    },
    {
      "epoch": 0.41396138340759603,
      "grad_norm": 0.7509829276160748,
      "learning_rate": 4.986057126887529e-05,
      "loss": 2.0717,
      "num_input_tokens_seen": 3069962784,
      "step": 3902
    },
    {
      "epoch": 0.4140674729471674,
      "grad_norm": 0.5272810303228969,
      "learning_rate": 4.986049796330329e-05,
      "loss": 1.9621,
      "num_input_tokens_seen": 3070749616,
      "step": 3903
    },
    {
      "epoch": 0.4141735624867388,
      "grad_norm": 0.5143166044194791,
      "learning_rate": 4.986042463851982e-05,
      "loss": 2.0162,
      "num_input_tokens_seen": 3071536320,
      "step": 3904
    },
    {
      "epoch": 0.41427965202631023,
      "grad_norm": 0.7505441390122067,
      "learning_rate": 4.986035129452496e-05,
      "loss": 2.0084,
      "num_input_tokens_seen": 3072323088,
      "step": 3905
    },
    {
      "epoch": 0.4143857415658816,
      "grad_norm": 0.6448885450975499,
      "learning_rate": 4.9860277931318734e-05,
      "loss": 2.1494,
      "num_input_tokens_seen": 3073109824,
      "step": 3906
    },
    {
      "epoch": 0.414491831105453,
      "grad_norm": 0.9077560372088913,
      "learning_rate": 4.9860204548901214e-05,
      "loss": 1.9687,
      "num_input_tokens_seen": 3073896640,
      "step": 3907
    },
    {
      "epoch": 0.4145979206450244,
      "grad_norm": 1.8644269401260574,
      "learning_rate": 4.9860131147272465e-05,
      "loss": 2.1938,
      "num_input_tokens_seen": 3074683408,
      "step": 3908
    },
    {
      "epoch": 0.4147040101845958,
      "grad_norm": 0.7089829576004252,
      "learning_rate": 4.9860057726432535e-05,
      "loss": 1.947,
      "num_input_tokens_seen": 3075470224,
      "step": 3909
    },
    {
      "epoch": 0.4148100997241672,
      "grad_norm": 1.421457957514679,
      "learning_rate": 4.9859984286381484e-05,
      "loss": 2.0127,
      "num_input_tokens_seen": 3076257024,
      "step": 3910
    },
    {
      "epoch": 0.4149161892637386,
      "grad_norm": 0.7339495822313121,
      "learning_rate": 4.985991082711936e-05,
      "loss": 2.0332,
      "num_input_tokens_seen": 3077043744,
      "step": 3911
    },
    {
      "epoch": 0.41502227880331,
      "grad_norm": 2.1192248913399565,
      "learning_rate": 4.985983734864623e-05,
      "loss": 2.0139,
      "num_input_tokens_seen": 3077830528,
      "step": 3912
    },
    {
      "epoch": 0.4151283683428814,
      "grad_norm": 0.7572561272168681,
      "learning_rate": 4.985976385096215e-05,
      "loss": 1.9153,
      "num_input_tokens_seen": 3078617376,
      "step": 3913
    },
    {
      "epoch": 0.4152344578824528,
      "grad_norm": 0.7809270542237525,
      "learning_rate": 4.985969033406717e-05,
      "loss": 1.8397,
      "num_input_tokens_seen": 3079404272,
      "step": 3914
    },
    {
      "epoch": 0.4153405474220242,
      "grad_norm": 1.4306798480856693,
      "learning_rate": 4.985961679796135e-05,
      "loss": 2.1162,
      "num_input_tokens_seen": 3080191024,
      "step": 3915
    },
    {
      "epoch": 0.41544663696159556,
      "grad_norm": 0.8163313780839158,
      "learning_rate": 4.9859543242644755e-05,
      "loss": 1.947,
      "num_input_tokens_seen": 3080977792,
      "step": 3916
    },
    {
      "epoch": 0.415552726501167,
      "grad_norm": 1.7056553905669967,
      "learning_rate": 4.985946966811743e-05,
      "loss": 2.1559,
      "num_input_tokens_seen": 3081764608,
      "step": 3917
    },
    {
      "epoch": 0.4156588160407384,
      "grad_norm": 0.9249610190585913,
      "learning_rate": 4.9859396074379435e-05,
      "loss": 2.2299,
      "num_input_tokens_seen": 3082551280,
      "step": 3918
    },
    {
      "epoch": 0.41576490558030976,
      "grad_norm": 1.2387465070500352,
      "learning_rate": 4.9859322461430826e-05,
      "loss": 2.1747,
      "num_input_tokens_seen": 3083337968,
      "step": 3919
    },
    {
      "epoch": 0.4158709951198812,
      "grad_norm": 0.8652991042478936,
      "learning_rate": 4.9859248829271666e-05,
      "loss": 1.978,
      "num_input_tokens_seen": 3084124688,
      "step": 3920
    },
    {
      "epoch": 0.4159770846594526,
      "grad_norm": 0.7122072620907471,
      "learning_rate": 4.985917517790201e-05,
      "loss": 2.0269,
      "num_input_tokens_seen": 3084911344,
      "step": 3921
    },
    {
      "epoch": 0.41608317419902396,
      "grad_norm": 0.7175277163178441,
      "learning_rate": 4.98591015073219e-05,
      "loss": 2.0442,
      "num_input_tokens_seen": 3085698160,
      "step": 3922
    },
    {
      "epoch": 0.4161892637385954,
      "grad_norm": 0.9444726866933914,
      "learning_rate": 4.9859027817531425e-05,
      "loss": 2.0865,
      "num_input_tokens_seen": 3086484880,
      "step": 3923
    },
    {
      "epoch": 0.41629535327816675,
      "grad_norm": 0.6516498422876272,
      "learning_rate": 4.985895410853061e-05,
      "loss": 2.189,
      "num_input_tokens_seen": 3087271648,
      "step": 3924
    },
    {
      "epoch": 0.41640144281773817,
      "grad_norm": 1.1180255820155338,
      "learning_rate": 4.985888038031953e-05,
      "loss": 2.1365,
      "num_input_tokens_seen": 3088058416,
      "step": 3925
    },
    {
      "epoch": 0.4165075323573096,
      "grad_norm": 0.7760978127539313,
      "learning_rate": 4.985880663289823e-05,
      "loss": 2.1812,
      "num_input_tokens_seen": 3088845056,
      "step": 3926
    },
    {
      "epoch": 0.41661362189688095,
      "grad_norm": 0.8238853834148345,
      "learning_rate": 4.985873286626678e-05,
      "loss": 2.1222,
      "num_input_tokens_seen": 3089631728,
      "step": 3927
    },
    {
      "epoch": 0.41671971143645237,
      "grad_norm": 0.766833319237888,
      "learning_rate": 4.985865908042523e-05,
      "loss": 2.2823,
      "num_input_tokens_seen": 3090418480,
      "step": 3928
    },
    {
      "epoch": 0.4168258009760238,
      "grad_norm": 0.8702070572232943,
      "learning_rate": 4.985858527537363e-05,
      "loss": 2.0522,
      "num_input_tokens_seen": 3091205200,
      "step": 3929
    },
    {
      "epoch": 0.41693189051559515,
      "grad_norm": 0.8079986891816624,
      "learning_rate": 4.9858511451112055e-05,
      "loss": 1.9354,
      "num_input_tokens_seen": 3091991904,
      "step": 3930
    },
    {
      "epoch": 0.41703798005516657,
      "grad_norm": 0.9739116081995512,
      "learning_rate": 4.985843760764054e-05,
      "loss": 1.9951,
      "num_input_tokens_seen": 3092778672,
      "step": 3931
    },
    {
      "epoch": 0.41714406959473793,
      "grad_norm": 1.1225958699090801,
      "learning_rate": 4.985836374495917e-05,
      "loss": 1.9533,
      "num_input_tokens_seen": 3093565520,
      "step": 3932
    },
    {
      "epoch": 0.41725015913430935,
      "grad_norm": 1.5726831248241413,
      "learning_rate": 4.985828986306797e-05,
      "loss": 2.1185,
      "num_input_tokens_seen": 3094352240,
      "step": 3933
    },
    {
      "epoch": 0.41735624867388077,
      "grad_norm": 1.7387367612422093,
      "learning_rate": 4.985821596196703e-05,
      "loss": 2.0422,
      "num_input_tokens_seen": 3095139008,
      "step": 3934
    },
    {
      "epoch": 0.41746233821345213,
      "grad_norm": 1.7265850752349887,
      "learning_rate": 4.985814204165637e-05,
      "loss": 1.9996,
      "num_input_tokens_seen": 3095925792,
      "step": 3935
    },
    {
      "epoch": 0.41756842775302355,
      "grad_norm": 1.9321505343956749,
      "learning_rate": 4.985806810213608e-05,
      "loss": 2.1107,
      "num_input_tokens_seen": 3096712496,
      "step": 3936
    },
    {
      "epoch": 0.41767451729259497,
      "grad_norm": 1.308549225131838,
      "learning_rate": 4.985799414340621e-05,
      "loss": 2.0213,
      "num_input_tokens_seen": 3097499280,
      "step": 3937
    },
    {
      "epoch": 0.41778060683216633,
      "grad_norm": 0.8343530934451977,
      "learning_rate": 4.98579201654668e-05,
      "loss": 2.1055,
      "num_input_tokens_seen": 3098286064,
      "step": 3938
    },
    {
      "epoch": 0.41788669637173775,
      "grad_norm": 0.9004901801975086,
      "learning_rate": 4.9857846168317916e-05,
      "loss": 2.0328,
      "num_input_tokens_seen": 3099072832,
      "step": 3939
    },
    {
      "epoch": 0.4179927859113092,
      "grad_norm": 0.5791919123181974,
      "learning_rate": 4.985777215195963e-05,
      "loss": 2.0948,
      "num_input_tokens_seen": 3099859568,
      "step": 3940
    },
    {
      "epoch": 0.41809887545088054,
      "grad_norm": 1.2304734143217753,
      "learning_rate": 4.985769811639198e-05,
      "loss": 2.1411,
      "num_input_tokens_seen": 3100646320,
      "step": 3941
    },
    {
      "epoch": 0.41820496499045196,
      "grad_norm": 1.2650876487234144,
      "learning_rate": 4.985762406161503e-05,
      "loss": 2.1052,
      "num_input_tokens_seen": 3101433136,
      "step": 3942
    },
    {
      "epoch": 0.4183110545300233,
      "grad_norm": 0.8409571188977583,
      "learning_rate": 4.985754998762884e-05,
      "loss": 2.0026,
      "num_input_tokens_seen": 3102219920,
      "step": 3943
    },
    {
      "epoch": 0.41841714406959474,
      "grad_norm": 2.4440087381994022,
      "learning_rate": 4.985747589443346e-05,
      "loss": 2.229,
      "num_input_tokens_seen": 3103006688,
      "step": 3944
    },
    {
      "epoch": 0.41852323360916616,
      "grad_norm": 0.9213992602915632,
      "learning_rate": 4.985740178202895e-05,
      "loss": 2.1175,
      "num_input_tokens_seen": 3103793392,
      "step": 3945
    },
    {
      "epoch": 0.4186293231487375,
      "grad_norm": 1.0430205978764135,
      "learning_rate": 4.985732765041538e-05,
      "loss": 1.9777,
      "num_input_tokens_seen": 3104580112,
      "step": 3946
    },
    {
      "epoch": 0.41873541268830894,
      "grad_norm": 1.2274770175329073,
      "learning_rate": 4.985725349959279e-05,
      "loss": 2.1494,
      "num_input_tokens_seen": 3105366832,
      "step": 3947
    },
    {
      "epoch": 0.41884150222788036,
      "grad_norm": 1.5325835485493722,
      "learning_rate": 4.9857179329561245e-05,
      "loss": 2.0812,
      "num_input_tokens_seen": 3106153600,
      "step": 3948
    },
    {
      "epoch": 0.4189475917674517,
      "grad_norm": 0.7701515769734384,
      "learning_rate": 4.98571051403208e-05,
      "loss": 2.0378,
      "num_input_tokens_seen": 3106940368,
      "step": 3949
    },
    {
      "epoch": 0.41905368130702314,
      "grad_norm": 1.2727121186938646,
      "learning_rate": 4.985703093187152e-05,
      "loss": 2.0384,
      "num_input_tokens_seen": 3107727088,
      "step": 3950
    },
    {
      "epoch": 0.4191597708465945,
      "grad_norm": 0.9551708102094368,
      "learning_rate": 4.985695670421345e-05,
      "loss": 2.0962,
      "num_input_tokens_seen": 3108513856,
      "step": 3951
    },
    {
      "epoch": 0.4192658603861659,
      "grad_norm": 1.2169240431600694,
      "learning_rate": 4.9856882457346656e-05,
      "loss": 2.1247,
      "num_input_tokens_seen": 3109300560,
      "step": 3952
    },
    {
      "epoch": 0.41937194992573734,
      "grad_norm": 0.6246017666574926,
      "learning_rate": 4.985680819127119e-05,
      "loss": 2.2184,
      "num_input_tokens_seen": 3110087328,
      "step": 3953
    },
    {
      "epoch": 0.4194780394653087,
      "grad_norm": 1.0027031850658337,
      "learning_rate": 4.985673390598711e-05,
      "loss": 1.9496,
      "num_input_tokens_seen": 3110874176,
      "step": 3954
    },
    {
      "epoch": 0.4195841290048801,
      "grad_norm": 0.5441870498638228,
      "learning_rate": 4.9856659601494475e-05,
      "loss": 1.8417,
      "num_input_tokens_seen": 3111661072,
      "step": 3955
    },
    {
      "epoch": 0.41969021854445154,
      "grad_norm": 1.1909301780794173,
      "learning_rate": 4.9856585277793344e-05,
      "loss": 1.9586,
      "num_input_tokens_seen": 3112447936,
      "step": 3956
    },
    {
      "epoch": 0.4197963080840229,
      "grad_norm": 0.7265873320105817,
      "learning_rate": 4.9856510934883776e-05,
      "loss": 2.05,
      "num_input_tokens_seen": 3113234672,
      "step": 3957
    },
    {
      "epoch": 0.4199023976235943,
      "grad_norm": 0.6914386170326382,
      "learning_rate": 4.9856436572765825e-05,
      "loss": 1.9554,
      "num_input_tokens_seen": 3114021408,
      "step": 3958
    },
    {
      "epoch": 0.4200084871631657,
      "grad_norm": 0.6563596731373548,
      "learning_rate": 4.985636219143955e-05,
      "loss": 2.0472,
      "num_input_tokens_seen": 3114808160,
      "step": 3959
    },
    {
      "epoch": 0.4201145767027371,
      "grad_norm": 0.6408122731908209,
      "learning_rate": 4.9856287790905004e-05,
      "loss": 1.9901,
      "num_input_tokens_seen": 3115594976,
      "step": 3960
    },
    {
      "epoch": 0.4202206662423085,
      "grad_norm": 0.950572454441226,
      "learning_rate": 4.9856213371162256e-05,
      "loss": 2.2311,
      "num_input_tokens_seen": 3116381664,
      "step": 3961
    },
    {
      "epoch": 0.4203267557818799,
      "grad_norm": 0.8781801562074971,
      "learning_rate": 4.985613893221135e-05,
      "loss": 1.9859,
      "num_input_tokens_seen": 3117168400,
      "step": 3962
    },
    {
      "epoch": 0.4204328453214513,
      "grad_norm": 0.8798475814969965,
      "learning_rate": 4.985606447405234e-05,
      "loss": 1.9807,
      "num_input_tokens_seen": 3117955168,
      "step": 3963
    },
    {
      "epoch": 0.42053893486102273,
      "grad_norm": 0.9335923704994178,
      "learning_rate": 4.985598999668531e-05,
      "loss": 2.0971,
      "num_input_tokens_seen": 3118741968,
      "step": 3964
    },
    {
      "epoch": 0.4206450244005941,
      "grad_norm": 0.8707042097782434,
      "learning_rate": 4.985591550011028e-05,
      "loss": 2.239,
      "num_input_tokens_seen": 3119528768,
      "step": 3965
    },
    {
      "epoch": 0.4207511139401655,
      "grad_norm": 0.8558378076143515,
      "learning_rate": 4.985584098432735e-05,
      "loss": 2.0471,
      "num_input_tokens_seen": 3120315584,
      "step": 3966
    },
    {
      "epoch": 0.4208572034797369,
      "grad_norm": 0.7977662572743142,
      "learning_rate": 4.985576644933654e-05,
      "loss": 2.0958,
      "num_input_tokens_seen": 3121102464,
      "step": 3967
    },
    {
      "epoch": 0.4209632930193083,
      "grad_norm": 0.6838725308228985,
      "learning_rate": 4.9855691895137934e-05,
      "loss": 2.2034,
      "num_input_tokens_seen": 3121889264,
      "step": 3968
    },
    {
      "epoch": 0.4210693825588797,
      "grad_norm": 0.5839300563579313,
      "learning_rate": 4.985561732173157e-05,
      "loss": 2.1095,
      "num_input_tokens_seen": 3122676000,
      "step": 3969
    },
    {
      "epoch": 0.4211754720984511,
      "grad_norm": 0.6113241438406743,
      "learning_rate": 4.985554272911752e-05,
      "loss": 2.104,
      "num_input_tokens_seen": 3123462752,
      "step": 3970
    },
    {
      "epoch": 0.4212815616380225,
      "grad_norm": 0.5610846675524993,
      "learning_rate": 4.985546811729583e-05,
      "loss": 2.0041,
      "num_input_tokens_seen": 3124249488,
      "step": 3971
    },
    {
      "epoch": 0.4213876511775939,
      "grad_norm": 0.5930138714809671,
      "learning_rate": 4.985539348626656e-05,
      "loss": 2.1614,
      "num_input_tokens_seen": 3125036304,
      "step": 3972
    },
    {
      "epoch": 0.4214937407171653,
      "grad_norm": 0.7165112248984813,
      "learning_rate": 4.9855318836029785e-05,
      "loss": 2.108,
      "num_input_tokens_seen": 3125822976,
      "step": 3973
    },
    {
      "epoch": 0.4215998302567367,
      "grad_norm": 0.5913992538345029,
      "learning_rate": 4.985524416658554e-05,
      "loss": 2.1047,
      "num_input_tokens_seen": 3126609696,
      "step": 3974
    },
    {
      "epoch": 0.42170591979630806,
      "grad_norm": 0.6172562584789519,
      "learning_rate": 4.9855169477933894e-05,
      "loss": 1.972,
      "num_input_tokens_seen": 3127396368,
      "step": 3975
    },
    {
      "epoch": 0.4218120093358795,
      "grad_norm": 0.5380103249334122,
      "learning_rate": 4.98550947700749e-05,
      "loss": 2.0241,
      "num_input_tokens_seen": 3128183152,
      "step": 3976
    },
    {
      "epoch": 0.4219180988754509,
      "grad_norm": 1.1132129295098345,
      "learning_rate": 4.9855020043008624e-05,
      "loss": 2.2323,
      "num_input_tokens_seen": 3128969872,
      "step": 3977
    },
    {
      "epoch": 0.42202418841502226,
      "grad_norm": 0.591404586161958,
      "learning_rate": 4.985494529673511e-05,
      "loss": 1.9433,
      "num_input_tokens_seen": 3129756672,
      "step": 3978
    },
    {
      "epoch": 0.4221302779545937,
      "grad_norm": 0.8161949198284235,
      "learning_rate": 4.985487053125443e-05,
      "loss": 2.2008,
      "num_input_tokens_seen": 3130543504,
      "step": 3979
    },
    {
      "epoch": 0.4222363674941651,
      "grad_norm": 0.5848158357270967,
      "learning_rate": 4.985479574656663e-05,
      "loss": 2.1654,
      "num_input_tokens_seen": 3131330208,
      "step": 3980
    },
    {
      "epoch": 0.42234245703373646,
      "grad_norm": 0.8239122709069483,
      "learning_rate": 4.985472094267177e-05,
      "loss": 2.0856,
      "num_input_tokens_seen": 3132117024,
      "step": 3981
    },
    {
      "epoch": 0.4224485465733079,
      "grad_norm": 0.5042817732280653,
      "learning_rate": 4.985464611956992e-05,
      "loss": 2.0535,
      "num_input_tokens_seen": 3132903792,
      "step": 3982
    },
    {
      "epoch": 0.42255463611287924,
      "grad_norm": 1.0664927362308154,
      "learning_rate": 4.9854571277261134e-05,
      "loss": 2.1405,
      "num_input_tokens_seen": 3133690496,
      "step": 3983
    },
    {
      "epoch": 0.42266072565245066,
      "grad_norm": 0.9451217976639812,
      "learning_rate": 4.985449641574545e-05,
      "loss": 2.1812,
      "num_input_tokens_seen": 3134477200,
      "step": 3984
    },
    {
      "epoch": 0.4227668151920221,
      "grad_norm": 1.0994879590504039,
      "learning_rate": 4.9854421535022946e-05,
      "loss": 2.0446,
      "num_input_tokens_seen": 3135263920,
      "step": 3985
    },
    {
      "epoch": 0.42287290473159345,
      "grad_norm": 1.5769722405839932,
      "learning_rate": 4.9854346635093676e-05,
      "loss": 1.9853,
      "num_input_tokens_seen": 3136050736,
      "step": 3986
    },
    {
      "epoch": 0.42297899427116487,
      "grad_norm": 0.7856601944183866,
      "learning_rate": 4.985427171595769e-05,
      "loss": 2.0215,
      "num_input_tokens_seen": 3136837504,
      "step": 3987
    },
    {
      "epoch": 0.4230850838107363,
      "grad_norm": 0.7365603038840443,
      "learning_rate": 4.985419677761506e-05,
      "loss": 2.0169,
      "num_input_tokens_seen": 3137624208,
      "step": 3988
    },
    {
      "epoch": 0.42319117335030765,
      "grad_norm": 0.8310122214044513,
      "learning_rate": 4.9854121820065836e-05,
      "loss": 2.0112,
      "num_input_tokens_seen": 3138411056,
      "step": 3989
    },
    {
      "epoch": 0.42329726288987907,
      "grad_norm": 0.8136870482810801,
      "learning_rate": 4.985404684331007e-05,
      "loss": 1.913,
      "num_input_tokens_seen": 3139197856,
      "step": 3990
    },
    {
      "epoch": 0.42340335242945043,
      "grad_norm": 1.0754895359529761,
      "learning_rate": 4.985397184734782e-05,
      "loss": 2.0412,
      "num_input_tokens_seen": 3139984608,
      "step": 3991
    },
    {
      "epoch": 0.42350944196902185,
      "grad_norm": 0.8289822599296004,
      "learning_rate": 4.9853896832179164e-05,
      "loss": 2.0708,
      "num_input_tokens_seen": 3140771376,
      "step": 3992
    },
    {
      "epoch": 0.42361553150859327,
      "grad_norm": 0.690008380835147,
      "learning_rate": 4.985382179780414e-05,
      "loss": 1.8579,
      "num_input_tokens_seen": 3141558224,
      "step": 3993
    },
    {
      "epoch": 0.42372162104816463,
      "grad_norm": 0.7773469074645397,
      "learning_rate": 4.985374674422281e-05,
      "loss": 2.0288,
      "num_input_tokens_seen": 3142345024,
      "step": 3994
    },
    {
      "epoch": 0.42382771058773605,
      "grad_norm": 1.607548016964333,
      "learning_rate": 4.9853671671435246e-05,
      "loss": 2.114,
      "num_input_tokens_seen": 3143131904,
      "step": 3995
    },
    {
      "epoch": 0.42393380012730747,
      "grad_norm": 0.8802349576654873,
      "learning_rate": 4.985359657944147e-05,
      "loss": 2.1184,
      "num_input_tokens_seen": 3143918688,
      "step": 3996
    },
    {
      "epoch": 0.42403988966687883,
      "grad_norm": 3.1573874022796358,
      "learning_rate": 4.985352146824158e-05,
      "loss": 2.3728,
      "num_input_tokens_seen": 3144705280,
      "step": 3997
    },
    {
      "epoch": 0.42414597920645025,
      "grad_norm": 1.6306214470359983,
      "learning_rate": 4.985344633783562e-05,
      "loss": 1.9737,
      "num_input_tokens_seen": 3145492000,
      "step": 3998
    },
    {
      "epoch": 0.4242520687460216,
      "grad_norm": 0.9033288462855109,
      "learning_rate": 4.985337118822364e-05,
      "loss": 2.1566,
      "num_input_tokens_seen": 3146278688,
      "step": 3999
    },
    {
      "epoch": 0.42435815828559303,
      "grad_norm": 1.075963669812082,
      "learning_rate": 4.98532960194057e-05,
      "loss": 2.169,
      "num_input_tokens_seen": 3147065440,
      "step": 4000
    },
    {
      "epoch": 0.42435815828559303,
      "eval_loss": 2.051567792892456,
      "eval_runtime": 65.3955,
      "eval_samples_per_second": 45.875,
      "eval_steps_per_second": 0.489,
      "num_input_tokens_seen": 3147065440,
      "step": 4000
    },
    {
      "epoch": 0.42446424782516445,
      "grad_norm": 0.9549657477579128,
      "learning_rate": 4.985322083138187e-05,
      "loss": 2.0822,
      "num_input_tokens_seen": 3147852176,
      "step": 4001
    },
    {
      "epoch": 0.4245703373647358,
      "grad_norm": 1.253450323774414,
      "learning_rate": 4.98531456241522e-05,
      "loss": 2.0859,
      "num_input_tokens_seen": 3148638976,
      "step": 4002
    },
    {
      "epoch": 0.42467642690430724,
      "grad_norm": 1.5214114877237734,
      "learning_rate": 4.985307039771675e-05,
      "loss": 2.2067,
      "num_input_tokens_seen": 3149425712,
      "step": 4003
    },
    {
      "epoch": 0.42478251644387865,
      "grad_norm": 1.0710480549020078,
      "learning_rate": 4.985299515207557e-05,
      "loss": 2.1477,
      "num_input_tokens_seen": 3150212528,
      "step": 4004
    },
    {
      "epoch": 0.42488860598345,
      "grad_norm": 1.7484945352773464,
      "learning_rate": 4.985291988722872e-05,
      "loss": 2.0621,
      "num_input_tokens_seen": 3150999344,
      "step": 4005
    },
    {
      "epoch": 0.42499469552302144,
      "grad_norm": 2.361240568915007,
      "learning_rate": 4.9852844603176273e-05,
      "loss": 2.1824,
      "num_input_tokens_seen": 3151786112,
      "step": 4006
    },
    {
      "epoch": 0.4251007850625928,
      "grad_norm": 1.6957314280078153,
      "learning_rate": 4.985276929991827e-05,
      "loss": 2.142,
      "num_input_tokens_seen": 3152572832,
      "step": 4007
    },
    {
      "epoch": 0.4252068746021642,
      "grad_norm": 1.3827910142970938,
      "learning_rate": 4.9852693977454776e-05,
      "loss": 1.9785,
      "num_input_tokens_seen": 3153359616,
      "step": 4008
    },
    {
      "epoch": 0.42531296414173564,
      "grad_norm": 1.046399450086116,
      "learning_rate": 4.985261863578586e-05,
      "loss": 2.2847,
      "num_input_tokens_seen": 3154146336,
      "step": 4009
    },
    {
      "epoch": 0.425419053681307,
      "grad_norm": 0.6653426640322078,
      "learning_rate": 4.9852543274911565e-05,
      "loss": 2.0552,
      "num_input_tokens_seen": 3154933072,
      "step": 4010
    },
    {
      "epoch": 0.4255251432208784,
      "grad_norm": 0.7540378732603453,
      "learning_rate": 4.9852467894831945e-05,
      "loss": 1.9699,
      "num_input_tokens_seen": 3155719888,
      "step": 4011
    },
    {
      "epoch": 0.42563123276044984,
      "grad_norm": 0.994514235081148,
      "learning_rate": 4.985239249554707e-05,
      "loss": 2.0252,
      "num_input_tokens_seen": 3156506624,
      "step": 4012
    },
    {
      "epoch": 0.4257373223000212,
      "grad_norm": 1.3496134638381083,
      "learning_rate": 4.9852317077057e-05,
      "loss": 2.2936,
      "num_input_tokens_seen": 3157293424,
      "step": 4013
    },
    {
      "epoch": 0.4258434118395926,
      "grad_norm": 1.2089049936634946,
      "learning_rate": 4.985224163936179e-05,
      "loss": 2.1082,
      "num_input_tokens_seen": 3158080192,
      "step": 4014
    },
    {
      "epoch": 0.42594950137916404,
      "grad_norm": 0.9719521356564584,
      "learning_rate": 4.985216618246149e-05,
      "loss": 2.0395,
      "num_input_tokens_seen": 3158866944,
      "step": 4015
    },
    {
      "epoch": 0.4260555909187354,
      "grad_norm": 1.702028611097451,
      "learning_rate": 4.9852090706356166e-05,
      "loss": 2.1409,
      "num_input_tokens_seen": 3159653696,
      "step": 4016
    },
    {
      "epoch": 0.4261616804583068,
      "grad_norm": 0.8750015132948264,
      "learning_rate": 4.9852015211045886e-05,
      "loss": 1.9103,
      "num_input_tokens_seen": 3160440464,
      "step": 4017
    },
    {
      "epoch": 0.4262677699978782,
      "grad_norm": 1.6638388054451574,
      "learning_rate": 4.985193969653069e-05,
      "loss": 2.1124,
      "num_input_tokens_seen": 3161227280,
      "step": 4018
    },
    {
      "epoch": 0.4263738595374496,
      "grad_norm": 1.0447019372768755,
      "learning_rate": 4.985186416281065e-05,
      "loss": 2.0276,
      "num_input_tokens_seen": 3162014032,
      "step": 4019
    },
    {
      "epoch": 0.426479949077021,
      "grad_norm": 1.529418242980498,
      "learning_rate": 4.985178860988581e-05,
      "loss": 2.0581,
      "num_input_tokens_seen": 3162800816,
      "step": 4020
    },
    {
      "epoch": 0.4265860386165924,
      "grad_norm": 1.0008679916763772,
      "learning_rate": 4.9851713037756234e-05,
      "loss": 1.9501,
      "num_input_tokens_seen": 3163587568,
      "step": 4021
    },
    {
      "epoch": 0.4266921281561638,
      "grad_norm": 1.2909495568579654,
      "learning_rate": 4.9851637446421996e-05,
      "loss": 2.1068,
      "num_input_tokens_seen": 3164374368,
      "step": 4022
    },
    {
      "epoch": 0.4267982176957352,
      "grad_norm": 1.0936905909051002,
      "learning_rate": 4.985156183588313e-05,
      "loss": 2.1088,
      "num_input_tokens_seen": 3165161120,
      "step": 4023
    },
    {
      "epoch": 0.4269043072353066,
      "grad_norm": 1.5862454569349618,
      "learning_rate": 4.9851486206139715e-05,
      "loss": 2.1985,
      "num_input_tokens_seen": 3165947872,
      "step": 4024
    },
    {
      "epoch": 0.427010396774878,
      "grad_norm": 1.180980708091047,
      "learning_rate": 4.9851410557191794e-05,
      "loss": 2.0347,
      "num_input_tokens_seen": 3166734624,
      "step": 4025
    },
    {
      "epoch": 0.4271164863144494,
      "grad_norm": 1.6817751726430956,
      "learning_rate": 4.985133488903943e-05,
      "loss": 2.1451,
      "num_input_tokens_seen": 3167521376,
      "step": 4026
    },
    {
      "epoch": 0.4272225758540208,
      "grad_norm": 1.3383609917403394,
      "learning_rate": 4.98512592016827e-05,
      "loss": 2.0984,
      "num_input_tokens_seen": 3168308240,
      "step": 4027
    },
    {
      "epoch": 0.4273286653935922,
      "grad_norm": 1.0267769087180683,
      "learning_rate": 4.9851183495121625e-05,
      "loss": 2.1694,
      "num_input_tokens_seen": 3169094960,
      "step": 4028
    },
    {
      "epoch": 0.4274347549331636,
      "grad_norm": 1.6149544339311157,
      "learning_rate": 4.98511077693563e-05,
      "loss": 2.1687,
      "num_input_tokens_seen": 3169881680,
      "step": 4029
    },
    {
      "epoch": 0.427540844472735,
      "grad_norm": 2.1187637635628014,
      "learning_rate": 4.9851032024386765e-05,
      "loss": 2.199,
      "num_input_tokens_seen": 3170668448,
      "step": 4030
    },
    {
      "epoch": 0.4276469340123064,
      "grad_norm": 2.742569374594951,
      "learning_rate": 4.9850956260213076e-05,
      "loss": 2.2139,
      "num_input_tokens_seen": 3171455232,
      "step": 4031
    },
    {
      "epoch": 0.4277530235518778,
      "grad_norm": 1.2321822189488867,
      "learning_rate": 4.98508804768353e-05,
      "loss": 2.2146,
      "num_input_tokens_seen": 3172242000,
      "step": 4032
    },
    {
      "epoch": 0.4278591130914492,
      "grad_norm": 2.4096116993979395,
      "learning_rate": 4.985080467425349e-05,
      "loss": 2.1328,
      "num_input_tokens_seen": 3173028736,
      "step": 4033
    },
    {
      "epoch": 0.42796520263102056,
      "grad_norm": 0.7201887814746578,
      "learning_rate": 4.985072885246771e-05,
      "loss": 2.0474,
      "num_input_tokens_seen": 3173815520,
      "step": 4034
    },
    {
      "epoch": 0.428071292170592,
      "grad_norm": 1.954388355408832,
      "learning_rate": 4.985065301147802e-05,
      "loss": 1.9608,
      "num_input_tokens_seen": 3174602352,
      "step": 4035
    },
    {
      "epoch": 0.4281773817101634,
      "grad_norm": 0.7210947249570527,
      "learning_rate": 4.985057715128447e-05,
      "loss": 2.0077,
      "num_input_tokens_seen": 3175389248,
      "step": 4036
    },
    {
      "epoch": 0.42828347124973476,
      "grad_norm": 1.2004177027027108,
      "learning_rate": 4.985050127188712e-05,
      "loss": 2.093,
      "num_input_tokens_seen": 3176175952,
      "step": 4037
    },
    {
      "epoch": 0.4283895607893062,
      "grad_norm": 0.7966817657828754,
      "learning_rate": 4.985042537328604e-05,
      "loss": 2.0144,
      "num_input_tokens_seen": 3176962832,
      "step": 4038
    },
    {
      "epoch": 0.4284956503288776,
      "grad_norm": 1.197149169300519,
      "learning_rate": 4.985034945548127e-05,
      "loss": 2.2001,
      "num_input_tokens_seen": 3177749552,
      "step": 4039
    },
    {
      "epoch": 0.42860173986844896,
      "grad_norm": 0.8715787077916234,
      "learning_rate": 4.985027351847289e-05,
      "loss": 2.1062,
      "num_input_tokens_seen": 3178536272,
      "step": 4040
    },
    {
      "epoch": 0.4287078294080204,
      "grad_norm": 1.1449774066274132,
      "learning_rate": 4.985019756226094e-05,
      "loss": 2.0771,
      "num_input_tokens_seen": 3179323056,
      "step": 4041
    },
    {
      "epoch": 0.42881391894759174,
      "grad_norm": 1.0231653099021976,
      "learning_rate": 4.985012158684549e-05,
      "loss": 2.1239,
      "num_input_tokens_seen": 3180109888,
      "step": 4042
    },
    {
      "epoch": 0.42892000848716316,
      "grad_norm": 1.1188045031598428,
      "learning_rate": 4.9850045592226594e-05,
      "loss": 1.9942,
      "num_input_tokens_seen": 3180896608,
      "step": 4043
    },
    {
      "epoch": 0.4290260980267346,
      "grad_norm": 0.9431984570399367,
      "learning_rate": 4.9849969578404316e-05,
      "loss": 2.073,
      "num_input_tokens_seen": 3181683328,
      "step": 4044
    },
    {
      "epoch": 0.42913218756630594,
      "grad_norm": 1.353724636889699,
      "learning_rate": 4.98498935453787e-05,
      "loss": 2.0924,
      "num_input_tokens_seen": 3182470096,
      "step": 4045
    },
    {
      "epoch": 0.42923827710587736,
      "grad_norm": 0.604292220606058,
      "learning_rate": 4.984981749314983e-05,
      "loss": 1.9618,
      "num_input_tokens_seen": 3183256944,
      "step": 4046
    },
    {
      "epoch": 0.4293443666454488,
      "grad_norm": 0.7415913948376912,
      "learning_rate": 4.9849741421717745e-05,
      "loss": 2.1576,
      "num_input_tokens_seen": 3184043696,
      "step": 4047
    },
    {
      "epoch": 0.42945045618502015,
      "grad_norm": 0.5235508257437962,
      "learning_rate": 4.984966533108251e-05,
      "loss": 1.9273,
      "num_input_tokens_seen": 3184830480,
      "step": 4048
    },
    {
      "epoch": 0.42955654572459157,
      "grad_norm": 0.583094332675135,
      "learning_rate": 4.9849589221244174e-05,
      "loss": 2.0296,
      "num_input_tokens_seen": 3185617216,
      "step": 4049
    },
    {
      "epoch": 0.42966263526416293,
      "grad_norm": 0.5856780942479318,
      "learning_rate": 4.98495130922028e-05,
      "loss": 1.9639,
      "num_input_tokens_seen": 3186404016,
      "step": 4050
    },
    {
      "epoch": 0.42976872480373435,
      "grad_norm": 0.48718780654082267,
      "learning_rate": 4.984943694395847e-05,
      "loss": 1.9966,
      "num_input_tokens_seen": 3187190768,
      "step": 4051
    },
    {
      "epoch": 0.42987481434330577,
      "grad_norm": 0.5582729024381282,
      "learning_rate": 4.984936077651121e-05,
      "loss": 2.0602,
      "num_input_tokens_seen": 3187977504,
      "step": 4052
    },
    {
      "epoch": 0.42998090388287713,
      "grad_norm": 0.4619907894450535,
      "learning_rate": 4.98492845898611e-05,
      "loss": 2.0672,
      "num_input_tokens_seen": 3188764224,
      "step": 4053
    },
    {
      "epoch": 0.43008699342244855,
      "grad_norm": 0.5317914618457936,
      "learning_rate": 4.984920838400819e-05,
      "loss": 2.1806,
      "num_input_tokens_seen": 3189550976,
      "step": 4054
    },
    {
      "epoch": 0.43019308296201997,
      "grad_norm": 0.5623940294282008,
      "learning_rate": 4.984913215895255e-05,
      "loss": 1.9873,
      "num_input_tokens_seen": 3190337792,
      "step": 4055
    },
    {
      "epoch": 0.43029917250159133,
      "grad_norm": 0.4481938988860562,
      "learning_rate": 4.984905591469422e-05,
      "loss": 2.0299,
      "num_input_tokens_seen": 3191124480,
      "step": 4056
    },
    {
      "epoch": 0.43040526204116275,
      "grad_norm": 0.5584779649667693,
      "learning_rate": 4.984897965123327e-05,
      "loss": 2.1238,
      "num_input_tokens_seen": 3191911392,
      "step": 4057
    },
    {
      "epoch": 0.4305113515807341,
      "grad_norm": 0.6906803840063188,
      "learning_rate": 4.9848903368569756e-05,
      "loss": 2.2401,
      "num_input_tokens_seen": 3192698224,
      "step": 4058
    },
    {
      "epoch": 0.43061744112030553,
      "grad_norm": 0.568354139695607,
      "learning_rate": 4.984882706670374e-05,
      "loss": 2.0104,
      "num_input_tokens_seen": 3193485024,
      "step": 4059
    },
    {
      "epoch": 0.43072353065987695,
      "grad_norm": 0.48091649537646836,
      "learning_rate": 4.984875074563528e-05,
      "loss": 2.0094,
      "num_input_tokens_seen": 3194271824,
      "step": 4060
    },
    {
      "epoch": 0.4308296201994483,
      "grad_norm": 0.6530511660740567,
      "learning_rate": 4.984867440536444e-05,
      "loss": 2.1394,
      "num_input_tokens_seen": 3195058576,
      "step": 4061
    },
    {
      "epoch": 0.43093570973901973,
      "grad_norm": 0.6186338911847854,
      "learning_rate": 4.984859804589126e-05,
      "loss": 2.0572,
      "num_input_tokens_seen": 3195845360,
      "step": 4062
    },
    {
      "epoch": 0.43104179927859115,
      "grad_norm": 0.5270656538846353,
      "learning_rate": 4.984852166721582e-05,
      "loss": 2.2272,
      "num_input_tokens_seen": 3196632064,
      "step": 4063
    },
    {
      "epoch": 0.4311478888181625,
      "grad_norm": 0.71059040807367,
      "learning_rate": 4.984844526933817e-05,
      "loss": 1.9481,
      "num_input_tokens_seen": 3197418800,
      "step": 4064
    },
    {
      "epoch": 0.43125397835773394,
      "grad_norm": 1.07186114182945,
      "learning_rate": 4.9848368852258376e-05,
      "loss": 2.1525,
      "num_input_tokens_seen": 3198205520,
      "step": 4065
    },
    {
      "epoch": 0.4313600678973053,
      "grad_norm": 0.6814959644590761,
      "learning_rate": 4.984829241597649e-05,
      "loss": 1.8787,
      "num_input_tokens_seen": 3198992352,
      "step": 4066
    },
    {
      "epoch": 0.4314661574368767,
      "grad_norm": 0.8232025038583877,
      "learning_rate": 4.984821596049257e-05,
      "loss": 1.9994,
      "num_input_tokens_seen": 3199779184,
      "step": 4067
    },
    {
      "epoch": 0.43157224697644814,
      "grad_norm": 1.1168405094449434,
      "learning_rate": 4.9848139485806675e-05,
      "loss": 1.9976,
      "num_input_tokens_seen": 3200565920,
      "step": 4068
    },
    {
      "epoch": 0.4316783365160195,
      "grad_norm": 0.4627949841757128,
      "learning_rate": 4.984806299191888e-05,
      "loss": 1.8147,
      "num_input_tokens_seen": 3201352736,
      "step": 4069
    },
    {
      "epoch": 0.4317844260555909,
      "grad_norm": 0.9766406951246702,
      "learning_rate": 4.984798647882922e-05,
      "loss": 2.0357,
      "num_input_tokens_seen": 3202139504,
      "step": 4070
    },
    {
      "epoch": 0.43189051559516234,
      "grad_norm": 0.5457026978688623,
      "learning_rate": 4.984790994653776e-05,
      "loss": 2.1311,
      "num_input_tokens_seen": 3202926304,
      "step": 4071
    },
    {
      "epoch": 0.4319966051347337,
      "grad_norm": 0.9884837012313158,
      "learning_rate": 4.984783339504458e-05,
      "loss": 2.0919,
      "num_input_tokens_seen": 3203713104,
      "step": 4072
    },
    {
      "epoch": 0.4321026946743051,
      "grad_norm": 0.7825560458741956,
      "learning_rate": 4.984775682434971e-05,
      "loss": 2.1015,
      "num_input_tokens_seen": 3204499904,
      "step": 4073
    },
    {
      "epoch": 0.4322087842138765,
      "grad_norm": 0.8990989852705138,
      "learning_rate": 4.984768023445322e-05,
      "loss": 1.9959,
      "num_input_tokens_seen": 3205286704,
      "step": 4074
    },
    {
      "epoch": 0.4323148737534479,
      "grad_norm": 1.204568566578532,
      "learning_rate": 4.984760362535519e-05,
      "loss": 2.1898,
      "num_input_tokens_seen": 3206073472,
      "step": 4075
    },
    {
      "epoch": 0.4324209632930193,
      "grad_norm": 0.8917157823975564,
      "learning_rate": 4.9847526997055646e-05,
      "loss": 2.1251,
      "num_input_tokens_seen": 3206860240,
      "step": 4076
    },
    {
      "epoch": 0.4325270528325907,
      "grad_norm": 0.5859234140314874,
      "learning_rate": 4.9847450349554665e-05,
      "loss": 1.8597,
      "num_input_tokens_seen": 3207647088,
      "step": 4077
    },
    {
      "epoch": 0.4326331423721621,
      "grad_norm": 0.7168841906379241,
      "learning_rate": 4.9847373682852306e-05,
      "loss": 2.0836,
      "num_input_tokens_seen": 3208433776,
      "step": 4078
    },
    {
      "epoch": 0.4327392319117335,
      "grad_norm": 0.8684158409857521,
      "learning_rate": 4.984729699694862e-05,
      "loss": 2.0857,
      "num_input_tokens_seen": 3209220528,
      "step": 4079
    },
    {
      "epoch": 0.4328453214513049,
      "grad_norm": 0.7202019335528286,
      "learning_rate": 4.984722029184368e-05,
      "loss": 2.0699,
      "num_input_tokens_seen": 3210007248,
      "step": 4080
    },
    {
      "epoch": 0.4329514109908763,
      "grad_norm": 0.7439299266753684,
      "learning_rate": 4.984714356753754e-05,
      "loss": 2.035,
      "num_input_tokens_seen": 3210794048,
      "step": 4081
    },
    {
      "epoch": 0.4330575005304477,
      "grad_norm": 0.5535250685036027,
      "learning_rate": 4.984706682403024e-05,
      "loss": 2.076,
      "num_input_tokens_seen": 3211580736,
      "step": 4082
    },
    {
      "epoch": 0.4331635900700191,
      "grad_norm": 0.8372941474702162,
      "learning_rate": 4.984699006132187e-05,
      "loss": 2.2072,
      "num_input_tokens_seen": 3212367472,
      "step": 4083
    },
    {
      "epoch": 0.4332696796095905,
      "grad_norm": 0.9733368156566181,
      "learning_rate": 4.984691327941247e-05,
      "loss": 2.1709,
      "num_input_tokens_seen": 3213154224,
      "step": 4084
    },
    {
      "epoch": 0.43337576914916187,
      "grad_norm": 0.5810895066092878,
      "learning_rate": 4.984683647830211e-05,
      "loss": 2.047,
      "num_input_tokens_seen": 3213940992,
      "step": 4085
    },
    {
      "epoch": 0.4334818586887333,
      "grad_norm": 0.5652537612855881,
      "learning_rate": 4.984675965799083e-05,
      "loss": 2.0774,
      "num_input_tokens_seen": 3214727776,
      "step": 4086
    },
    {
      "epoch": 0.4335879482283047,
      "grad_norm": 0.5216259012782019,
      "learning_rate": 4.984668281847872e-05,
      "loss": 2.1496,
      "num_input_tokens_seen": 3215514512,
      "step": 4087
    },
    {
      "epoch": 0.4336940377678761,
      "grad_norm": 0.6233663181143451,
      "learning_rate": 4.9846605959765814e-05,
      "loss": 2.1694,
      "num_input_tokens_seen": 3216301200,
      "step": 4088
    },
    {
      "epoch": 0.4338001273074475,
      "grad_norm": 0.9284057761911942,
      "learning_rate": 4.984652908185218e-05,
      "loss": 2.2841,
      "num_input_tokens_seen": 3217087984,
      "step": 4089
    },
    {
      "epoch": 0.4339062168470189,
      "grad_norm": 0.6014977105051373,
      "learning_rate": 4.984645218473788e-05,
      "loss": 2.1373,
      "num_input_tokens_seen": 3217874752,
      "step": 4090
    },
    {
      "epoch": 0.4340123063865903,
      "grad_norm": 0.5504308670136999,
      "learning_rate": 4.984637526842296e-05,
      "loss": 2.1323,
      "num_input_tokens_seen": 3218661504,
      "step": 4091
    },
    {
      "epoch": 0.4341183959261617,
      "grad_norm": 0.4883479981990304,
      "learning_rate": 4.98462983329075e-05,
      "loss": 2.0673,
      "num_input_tokens_seen": 3219448240,
      "step": 4092
    },
    {
      "epoch": 0.43422448546573306,
      "grad_norm": 0.586028708866972,
      "learning_rate": 4.984622137819155e-05,
      "loss": 2.0708,
      "num_input_tokens_seen": 3220235040,
      "step": 4093
    },
    {
      "epoch": 0.4343305750053045,
      "grad_norm": 0.47644256006173497,
      "learning_rate": 4.9846144404275176e-05,
      "loss": 1.9225,
      "num_input_tokens_seen": 3221021920,
      "step": 4094
    },
    {
      "epoch": 0.4344366645448759,
      "grad_norm": 0.7266149145128779,
      "learning_rate": 4.984606741115841e-05,
      "loss": 2.1605,
      "num_input_tokens_seen": 3221808688,
      "step": 4095
    },
    {
      "epoch": 0.43454275408444726,
      "grad_norm": 0.6763943221222356,
      "learning_rate": 4.984599039884135e-05,
      "loss": 2.2504,
      "num_input_tokens_seen": 3222595440,
      "step": 4096
    },
    {
      "epoch": 0.4346488436240187,
      "grad_norm": 0.6514884456393524,
      "learning_rate": 4.9845913367324036e-05,
      "loss": 2.1213,
      "num_input_tokens_seen": 3223382192,
      "step": 4097
    },
    {
      "epoch": 0.4347549331635901,
      "grad_norm": 0.6081104736394721,
      "learning_rate": 4.9845836316606524e-05,
      "loss": 2.0882,
      "num_input_tokens_seen": 3224168960,
      "step": 4098
    },
    {
      "epoch": 0.43486102270316146,
      "grad_norm": 0.6097188658865447,
      "learning_rate": 4.9845759246688884e-05,
      "loss": 2.1366,
      "num_input_tokens_seen": 3224955712,
      "step": 4099
    },
    {
      "epoch": 0.4349671122427329,
      "grad_norm": 0.7406671054575646,
      "learning_rate": 4.984568215757116e-05,
      "loss": 2.0408,
      "num_input_tokens_seen": 3225742512,
      "step": 4100
    },
    {
      "epoch": 0.43507320178230424,
      "grad_norm": 0.7848870238176665,
      "learning_rate": 4.984560504925343e-05,
      "loss": 2.1473,
      "num_input_tokens_seen": 3226529200,
      "step": 4101
    },
    {
      "epoch": 0.43517929132187566,
      "grad_norm": 0.5599771033593941,
      "learning_rate": 4.984552792173575e-05,
      "loss": 2.1161,
      "num_input_tokens_seen": 3227315984,
      "step": 4102
    },
    {
      "epoch": 0.4352853808614471,
      "grad_norm": 0.5974897406872349,
      "learning_rate": 4.9845450775018164e-05,
      "loss": 2.0389,
      "num_input_tokens_seen": 3228102768,
      "step": 4103
    },
    {
      "epoch": 0.43539147040101844,
      "grad_norm": 0.6256606201335546,
      "learning_rate": 4.984537360910075e-05,
      "loss": 2.0078,
      "num_input_tokens_seen": 3228889504,
      "step": 4104
    },
    {
      "epoch": 0.43549755994058986,
      "grad_norm": 0.543922447863046,
      "learning_rate": 4.984529642398356e-05,
      "loss": 2.2034,
      "num_input_tokens_seen": 3229676208,
      "step": 4105
    },
    {
      "epoch": 0.4356036494801613,
      "grad_norm": 0.6994377849296755,
      "learning_rate": 4.984521921966665e-05,
      "loss": 2.0787,
      "num_input_tokens_seen": 3230462944,
      "step": 4106
    },
    {
      "epoch": 0.43570973901973264,
      "grad_norm": 0.5150997584023421,
      "learning_rate": 4.984514199615008e-05,
      "loss": 2.0247,
      "num_input_tokens_seen": 3231249728,
      "step": 4107
    },
    {
      "epoch": 0.43581582855930406,
      "grad_norm": 0.6944530620694824,
      "learning_rate": 4.9845064753433926e-05,
      "loss": 2.0476,
      "num_input_tokens_seen": 3232036528,
      "step": 4108
    },
    {
      "epoch": 0.4359219180988754,
      "grad_norm": 0.5506235166961985,
      "learning_rate": 4.984498749151822e-05,
      "loss": 2.1459,
      "num_input_tokens_seen": 3232823344,
      "step": 4109
    },
    {
      "epoch": 0.43602800763844685,
      "grad_norm": 0.8485855959744213,
      "learning_rate": 4.9844910210403054e-05,
      "loss": 2.02,
      "num_input_tokens_seen": 3233610064,
      "step": 4110
    },
    {
      "epoch": 0.43613409717801827,
      "grad_norm": 0.8068089314226153,
      "learning_rate": 4.984483291008846e-05,
      "loss": 2.2103,
      "num_input_tokens_seen": 3234396800,
      "step": 4111
    },
    {
      "epoch": 0.43624018671758963,
      "grad_norm": 0.6555164305242382,
      "learning_rate": 4.98447555905745e-05,
      "loss": 2.0916,
      "num_input_tokens_seen": 3235183456,
      "step": 4112
    },
    {
      "epoch": 0.43634627625716105,
      "grad_norm": 0.5783673302226806,
      "learning_rate": 4.9844678251861256e-05,
      "loss": 1.9903,
      "num_input_tokens_seen": 3235970192,
      "step": 4113
    },
    {
      "epoch": 0.43645236579673247,
      "grad_norm": 0.540116472425626,
      "learning_rate": 4.984460089394877e-05,
      "loss": 1.9985,
      "num_input_tokens_seen": 3236757056,
      "step": 4114
    },
    {
      "epoch": 0.43655845533630383,
      "grad_norm": 0.5110483251067184,
      "learning_rate": 4.98445235168371e-05,
      "loss": 2.0072,
      "num_input_tokens_seen": 3237543744,
      "step": 4115
    },
    {
      "epoch": 0.43666454487587525,
      "grad_norm": 0.6327901946249527,
      "learning_rate": 4.984444612052631e-05,
      "loss": 2.0826,
      "num_input_tokens_seen": 3238330544,
      "step": 4116
    },
    {
      "epoch": 0.4367706344154466,
      "grad_norm": 0.39557751450804074,
      "learning_rate": 4.9844368705016475e-05,
      "loss": 1.9016,
      "num_input_tokens_seen": 3239117344,
      "step": 4117
    },
    {
      "epoch": 0.43687672395501803,
      "grad_norm": 0.5290428251062674,
      "learning_rate": 4.984429127030763e-05,
      "loss": 2.0159,
      "num_input_tokens_seen": 3239904064,
      "step": 4118
    },
    {
      "epoch": 0.43698281349458945,
      "grad_norm": 0.5059337514261568,
      "learning_rate": 4.984421381639984e-05,
      "loss": 2.1208,
      "num_input_tokens_seen": 3240690864,
      "step": 4119
    },
    {
      "epoch": 0.4370889030341608,
      "grad_norm": 0.6036721732142535,
      "learning_rate": 4.984413634329318e-05,
      "loss": 2.1663,
      "num_input_tokens_seen": 3241477648,
      "step": 4120
    },
    {
      "epoch": 0.43719499257373223,
      "grad_norm": 1.6735327009474064,
      "learning_rate": 4.98440588509877e-05,
      "loss": 2.055,
      "num_input_tokens_seen": 3242264320,
      "step": 4121
    },
    {
      "epoch": 0.43730108211330365,
      "grad_norm": 0.46024591518031244,
      "learning_rate": 4.984398133948346e-05,
      "loss": 2.125,
      "num_input_tokens_seen": 3243051120,
      "step": 4122
    },
    {
      "epoch": 0.437407171652875,
      "grad_norm": 1.2302089012792876,
      "learning_rate": 4.9843903808780526e-05,
      "loss": 2.1347,
      "num_input_tokens_seen": 3243837888,
      "step": 4123
    },
    {
      "epoch": 0.43751326119244643,
      "grad_norm": 0.46923721422596,
      "learning_rate": 4.984382625887894e-05,
      "loss": 1.9966,
      "num_input_tokens_seen": 3244624656,
      "step": 4124
    },
    {
      "epoch": 0.4376193507320178,
      "grad_norm": 1.2791161292332842,
      "learning_rate": 4.9843748689778777e-05,
      "loss": 2.0261,
      "num_input_tokens_seen": 3245411504,
      "step": 4125
    },
    {
      "epoch": 0.4377254402715892,
      "grad_norm": 0.5303943567303968,
      "learning_rate": 4.9843671101480096e-05,
      "loss": 1.9852,
      "num_input_tokens_seen": 3246198272,
      "step": 4126
    },
    {
      "epoch": 0.43783152981116064,
      "grad_norm": 0.9925436037555728,
      "learning_rate": 4.984359349398295e-05,
      "loss": 2.0396,
      "num_input_tokens_seen": 3246985040,
      "step": 4127
    },
    {
      "epoch": 0.437937619350732,
      "grad_norm": 0.6216552261809514,
      "learning_rate": 4.9843515867287415e-05,
      "loss": 2.1318,
      "num_input_tokens_seen": 3247771632,
      "step": 4128
    },
    {
      "epoch": 0.4380437088903034,
      "grad_norm": 0.49867151310627866,
      "learning_rate": 4.9843438221393537e-05,
      "loss": 1.9487,
      "num_input_tokens_seen": 3248558464,
      "step": 4129
    },
    {
      "epoch": 0.43814979842987484,
      "grad_norm": 0.7886937793315414,
      "learning_rate": 4.984336055630137e-05,
      "loss": 2.0387,
      "num_input_tokens_seen": 3249345152,
      "step": 4130
    },
    {
      "epoch": 0.4382558879694462,
      "grad_norm": 0.729397926187409,
      "learning_rate": 4.984328287201099e-05,
      "loss": 2.1354,
      "num_input_tokens_seen": 3250132032,
      "step": 4131
    },
    {
      "epoch": 0.4383619775090176,
      "grad_norm": 1.2891081187166018,
      "learning_rate": 4.984320516852245e-05,
      "loss": 2.229,
      "num_input_tokens_seen": 3250918816,
      "step": 4132
    },
    {
      "epoch": 0.438468067048589,
      "grad_norm": 0.46497798292042986,
      "learning_rate": 4.984312744583581e-05,
      "loss": 2.0139,
      "num_input_tokens_seen": 3251705584,
      "step": 4133
    },
    {
      "epoch": 0.4385741565881604,
      "grad_norm": 0.7529823083369926,
      "learning_rate": 4.984304970395113e-05,
      "loss": 2.1934,
      "num_input_tokens_seen": 3252492288,
      "step": 4134
    },
    {
      "epoch": 0.4386802461277318,
      "grad_norm": 0.5013864833884615,
      "learning_rate": 4.984297194286847e-05,
      "loss": 2.0452,
      "num_input_tokens_seen": 3253279104,
      "step": 4135
    },
    {
      "epoch": 0.4387863356673032,
      "grad_norm": 0.6218570983122051,
      "learning_rate": 4.9842894162587887e-05,
      "loss": 2.1077,
      "num_input_tokens_seen": 3254065792,
      "step": 4136
    },
    {
      "epoch": 0.4388924252068746,
      "grad_norm": 0.5064661154706486,
      "learning_rate": 4.984281636310944e-05,
      "loss": 2.1203,
      "num_input_tokens_seen": 3254852560,
      "step": 4137
    },
    {
      "epoch": 0.438998514746446,
      "grad_norm": 0.5249278219882191,
      "learning_rate": 4.98427385444332e-05,
      "loss": 1.9873,
      "num_input_tokens_seen": 3255639344,
      "step": 4138
    },
    {
      "epoch": 0.4391046042860174,
      "grad_norm": 0.4746019492099943,
      "learning_rate": 4.984266070655922e-05,
      "loss": 2.2153,
      "num_input_tokens_seen": 3256426080,
      "step": 4139
    },
    {
      "epoch": 0.4392106938255888,
      "grad_norm": 0.5448069382218862,
      "learning_rate": 4.984258284948756e-05,
      "loss": 2.1788,
      "num_input_tokens_seen": 3257212768,
      "step": 4140
    },
    {
      "epoch": 0.43931678336516017,
      "grad_norm": 0.5856401851068428,
      "learning_rate": 4.9842504973218285e-05,
      "loss": 2.0906,
      "num_input_tokens_seen": 3257999504,
      "step": 4141
    },
    {
      "epoch": 0.4394228729047316,
      "grad_norm": 0.5387154408444259,
      "learning_rate": 4.984242707775145e-05,
      "loss": 2.1594,
      "num_input_tokens_seen": 3258786256,
      "step": 4142
    },
    {
      "epoch": 0.439528962444303,
      "grad_norm": 0.6531512602731737,
      "learning_rate": 4.984234916308711e-05,
      "loss": 1.9632,
      "num_input_tokens_seen": 3259573136,
      "step": 4143
    },
    {
      "epoch": 0.43963505198387437,
      "grad_norm": 0.6875135529150602,
      "learning_rate": 4.984227122922533e-05,
      "loss": 2.0916,
      "num_input_tokens_seen": 3260359808,
      "step": 4144
    },
    {
      "epoch": 0.4397411415234458,
      "grad_norm": 0.6752767521829851,
      "learning_rate": 4.9842193276166185e-05,
      "loss": 2.0338,
      "num_input_tokens_seen": 3261146672,
      "step": 4145
    },
    {
      "epoch": 0.4398472310630172,
      "grad_norm": 0.7422016639170723,
      "learning_rate": 4.984211530390971e-05,
      "loss": 2.0798,
      "num_input_tokens_seen": 3261933472,
      "step": 4146
    },
    {
      "epoch": 0.43995332060258857,
      "grad_norm": 0.5232068861545088,
      "learning_rate": 4.984203731245598e-05,
      "loss": 1.9636,
      "num_input_tokens_seen": 3262720240,
      "step": 4147
    },
    {
      "epoch": 0.44005941014216,
      "grad_norm": 0.5899656454368389,
      "learning_rate": 4.984195930180506e-05,
      "loss": 2.0437,
      "num_input_tokens_seen": 3263507136,
      "step": 4148
    },
    {
      "epoch": 0.44016549968173135,
      "grad_norm": 0.6175359987420592,
      "learning_rate": 4.984188127195699e-05,
      "loss": 2.0333,
      "num_input_tokens_seen": 3264293920,
      "step": 4149
    },
    {
      "epoch": 0.4402715892213028,
      "grad_norm": 0.4819816837942814,
      "learning_rate": 4.9841803222911854e-05,
      "loss": 1.9816,
      "num_input_tokens_seen": 3265080736,
      "step": 4150
    },
    {
      "epoch": 0.4403776787608742,
      "grad_norm": 1.0961909062954294,
      "learning_rate": 4.98417251546697e-05,
      "loss": 2.2188,
      "num_input_tokens_seen": 3265867424,
      "step": 4151
    },
    {
      "epoch": 0.44048376830044556,
      "grad_norm": 1.6779371028174508,
      "learning_rate": 4.9841647067230586e-05,
      "loss": 2.1327,
      "num_input_tokens_seen": 3266654080,
      "step": 4152
    },
    {
      "epoch": 0.440589857840017,
      "grad_norm": 0.9444948387952684,
      "learning_rate": 4.984156896059457e-05,
      "loss": 2.1163,
      "num_input_tokens_seen": 3267440816,
      "step": 4153
    },
    {
      "epoch": 0.4406959473795884,
      "grad_norm": 0.8857769819253175,
      "learning_rate": 4.984149083476173e-05,
      "loss": 2.0932,
      "num_input_tokens_seen": 3268227520,
      "step": 4154
    },
    {
      "epoch": 0.44080203691915976,
      "grad_norm": 0.610883284655395,
      "learning_rate": 4.984141268973211e-05,
      "loss": 1.991,
      "num_input_tokens_seen": 3269014304,
      "step": 4155
    },
    {
      "epoch": 0.4409081264587312,
      "grad_norm": 0.554025081421772,
      "learning_rate": 4.984133452550578e-05,
      "loss": 1.8694,
      "num_input_tokens_seen": 3269801088,
      "step": 4156
    },
    {
      "epoch": 0.4410142159983026,
      "grad_norm": 0.5288059920582798,
      "learning_rate": 4.984125634208279e-05,
      "loss": 2.0244,
      "num_input_tokens_seen": 3270587840,
      "step": 4157
    },
    {
      "epoch": 0.44112030553787396,
      "grad_norm": 0.4882447702377739,
      "learning_rate": 4.984117813946321e-05,
      "loss": 2.1626,
      "num_input_tokens_seen": 3271374544,
      "step": 4158
    },
    {
      "epoch": 0.4412263950774454,
      "grad_norm": 0.5281099493374443,
      "learning_rate": 4.9841099917647086e-05,
      "loss": 2.1184,
      "num_input_tokens_seen": 3272161312,
      "step": 4159
    },
    {
      "epoch": 0.44133248461701674,
      "grad_norm": 0.5223229774011106,
      "learning_rate": 4.98410216766345e-05,
      "loss": 2.0601,
      "num_input_tokens_seen": 3272948080,
      "step": 4160
    },
    {
      "epoch": 0.44143857415658816,
      "grad_norm": 0.4723506529790529,
      "learning_rate": 4.98409434164255e-05,
      "loss": 1.9146,
      "num_input_tokens_seen": 3273734864,
      "step": 4161
    },
    {
      "epoch": 0.4415446636961596,
      "grad_norm": 0.5873277852254446,
      "learning_rate": 4.9840865137020146e-05,
      "loss": 2.0491,
      "num_input_tokens_seen": 3274521568,
      "step": 4162
    },
    {
      "epoch": 0.44165075323573094,
      "grad_norm": 0.49375803659382095,
      "learning_rate": 4.9840786838418494e-05,
      "loss": 2.1593,
      "num_input_tokens_seen": 3275308304,
      "step": 4163
    },
    {
      "epoch": 0.44175684277530236,
      "grad_norm": 0.6352557579032578,
      "learning_rate": 4.9840708520620616e-05,
      "loss": 2.2085,
      "num_input_tokens_seen": 3276095120,
      "step": 4164
    },
    {
      "epoch": 0.4418629323148738,
      "grad_norm": 0.8324681404299428,
      "learning_rate": 4.9840630183626566e-05,
      "loss": 2.0305,
      "num_input_tokens_seen": 3276881888,
      "step": 4165
    },
    {
      "epoch": 0.44196902185444514,
      "grad_norm": 0.45304148293029156,
      "learning_rate": 4.984055182743641e-05,
      "loss": 2.1304,
      "num_input_tokens_seen": 3277668752,
      "step": 4166
    },
    {
      "epoch": 0.44207511139401656,
      "grad_norm": 0.7013669020980277,
      "learning_rate": 4.98404734520502e-05,
      "loss": 2.1629,
      "num_input_tokens_seen": 3278455552,
      "step": 4167
    },
    {
      "epoch": 0.4421812009335879,
      "grad_norm": 0.5474630385454972,
      "learning_rate": 4.9840395057468005e-05,
      "loss": 2.0244,
      "num_input_tokens_seen": 3279242336,
      "step": 4168
    },
    {
      "epoch": 0.44228729047315934,
      "grad_norm": 0.43532502988396754,
      "learning_rate": 4.9840316643689876e-05,
      "loss": 1.9968,
      "num_input_tokens_seen": 3280029120,
      "step": 4169
    },
    {
      "epoch": 0.44239338001273076,
      "grad_norm": 0.7539038955237887,
      "learning_rate": 4.9840238210715886e-05,
      "loss": 2.0875,
      "num_input_tokens_seen": 3280815920,
      "step": 4170
    },
    {
      "epoch": 0.4424994695523021,
      "grad_norm": 0.5227262796228842,
      "learning_rate": 4.9840159758546084e-05,
      "loss": 2.1061,
      "num_input_tokens_seen": 3281602784,
      "step": 4171
    },
    {
      "epoch": 0.44260555909187355,
      "grad_norm": 0.6298548508925359,
      "learning_rate": 4.984008128718054e-05,
      "loss": 2.1322,
      "num_input_tokens_seen": 3282389488,
      "step": 4172
    },
    {
      "epoch": 0.44271164863144497,
      "grad_norm": 0.7474900556128103,
      "learning_rate": 4.98400027966193e-05,
      "loss": 2.0218,
      "num_input_tokens_seen": 3283176272,
      "step": 4173
    },
    {
      "epoch": 0.44281773817101633,
      "grad_norm": 0.45939933049952264,
      "learning_rate": 4.983992428686245e-05,
      "loss": 2.0345,
      "num_input_tokens_seen": 3283963008,
      "step": 4174
    },
    {
      "epoch": 0.44292382771058775,
      "grad_norm": 0.731540258017822,
      "learning_rate": 4.983984575791002e-05,
      "loss": 1.9581,
      "num_input_tokens_seen": 3284749744,
      "step": 4175
    },
    {
      "epoch": 0.4430299172501591,
      "grad_norm": 0.6604717769481203,
      "learning_rate": 4.983976720976209e-05,
      "loss": 1.9352,
      "num_input_tokens_seen": 3285536528,
      "step": 4176
    },
    {
      "epoch": 0.44313600678973053,
      "grad_norm": 0.658601541836748,
      "learning_rate": 4.9839688642418726e-05,
      "loss": 1.9021,
      "num_input_tokens_seen": 3286323328,
      "step": 4177
    },
    {
      "epoch": 0.44324209632930195,
      "grad_norm": 0.664672443769049,
      "learning_rate": 4.9839610055879973e-05,
      "loss": 2.0207,
      "num_input_tokens_seen": 3287110176,
      "step": 4178
    },
    {
      "epoch": 0.4433481858688733,
      "grad_norm": 0.5413007992230572,
      "learning_rate": 4.9839531450145896e-05,
      "loss": 2.0524,
      "num_input_tokens_seen": 3287896928,
      "step": 4179
    },
    {
      "epoch": 0.44345427540844473,
      "grad_norm": 0.6097437419086409,
      "learning_rate": 4.983945282521656e-05,
      "loss": 1.9998,
      "num_input_tokens_seen": 3288683824,
      "step": 4180
    },
    {
      "epoch": 0.44356036494801615,
      "grad_norm": 0.5173325807513974,
      "learning_rate": 4.9839374181092024e-05,
      "loss": 1.8572,
      "num_input_tokens_seen": 3289470656,
      "step": 4181
    },
    {
      "epoch": 0.4436664544875875,
      "grad_norm": 0.494257453703038,
      "learning_rate": 4.983929551777235e-05,
      "loss": 2.0169,
      "num_input_tokens_seen": 3290257392,
      "step": 4182
    },
    {
      "epoch": 0.44377254402715893,
      "grad_norm": 0.6874413687163156,
      "learning_rate": 4.9839216835257596e-05,
      "loss": 2.0712,
      "num_input_tokens_seen": 3291044224,
      "step": 4183
    },
    {
      "epoch": 0.4438786335667303,
      "grad_norm": 0.4635566748277041,
      "learning_rate": 4.983913813354782e-05,
      "loss": 2.0779,
      "num_input_tokens_seen": 3291830960,
      "step": 4184
    },
    {
      "epoch": 0.4439847231063017,
      "grad_norm": 0.7160614014840788,
      "learning_rate": 4.9839059412643095e-05,
      "loss": 2.245,
      "num_input_tokens_seen": 3292617744,
      "step": 4185
    },
    {
      "epoch": 0.44409081264587313,
      "grad_norm": 0.519190806277393,
      "learning_rate": 4.983898067254347e-05,
      "loss": 2.2825,
      "num_input_tokens_seen": 3293404496,
      "step": 4186
    },
    {
      "epoch": 0.4441969021854445,
      "grad_norm": 0.5824518841323516,
      "learning_rate": 4.9838901913249e-05,
      "loss": 2.0109,
      "num_input_tokens_seen": 3294191296,
      "step": 4187
    },
    {
      "epoch": 0.4443029917250159,
      "grad_norm": 0.5305053687104606,
      "learning_rate": 4.983882313475977e-05,
      "loss": 2.2351,
      "num_input_tokens_seen": 3294978032,
      "step": 4188
    },
    {
      "epoch": 0.44440908126458734,
      "grad_norm": 0.7401162412867416,
      "learning_rate": 4.983874433707582e-05,
      "loss": 2.1409,
      "num_input_tokens_seen": 3295764704,
      "step": 4189
    },
    {
      "epoch": 0.4445151708041587,
      "grad_norm": 0.5828233245709851,
      "learning_rate": 4.983866552019722e-05,
      "loss": 1.9244,
      "num_input_tokens_seen": 3296551488,
      "step": 4190
    },
    {
      "epoch": 0.4446212603437301,
      "grad_norm": 1.027267016262396,
      "learning_rate": 4.9838586684124025e-05,
      "loss": 2.1403,
      "num_input_tokens_seen": 3297338272,
      "step": 4191
    },
    {
      "epoch": 0.4447273498833015,
      "grad_norm": 0.9539800028294859,
      "learning_rate": 4.9838507828856304e-05,
      "loss": 2.08,
      "num_input_tokens_seen": 3298125056,
      "step": 4192
    },
    {
      "epoch": 0.4448334394228729,
      "grad_norm": 0.6269010240066865,
      "learning_rate": 4.98384289543941e-05,
      "loss": 1.9381,
      "num_input_tokens_seen": 3298911888,
      "step": 4193
    },
    {
      "epoch": 0.4449395289624443,
      "grad_norm": 0.6231519279743655,
      "learning_rate": 4.9838350060737504e-05,
      "loss": 2.0077,
      "num_input_tokens_seen": 3299698656,
      "step": 4194
    },
    {
      "epoch": 0.4450456185020157,
      "grad_norm": 0.6343314644691459,
      "learning_rate": 4.983827114788655e-05,
      "loss": 2.0785,
      "num_input_tokens_seen": 3300485488,
      "step": 4195
    },
    {
      "epoch": 0.4451517080415871,
      "grad_norm": 0.4739374250744169,
      "learning_rate": 4.9838192215841306e-05,
      "loss": 2.0237,
      "num_input_tokens_seen": 3301272256,
      "step": 4196
    },
    {
      "epoch": 0.4452577975811585,
      "grad_norm": 0.7957023436709832,
      "learning_rate": 4.9838113264601846e-05,
      "loss": 2.1725,
      "num_input_tokens_seen": 3302059008,
      "step": 4197
    },
    {
      "epoch": 0.4453638871207299,
      "grad_norm": 0.9548161471818282,
      "learning_rate": 4.983803429416821e-05,
      "loss": 2.1262,
      "num_input_tokens_seen": 3302845872,
      "step": 4198
    },
    {
      "epoch": 0.4454699766603013,
      "grad_norm": 0.6484272717409634,
      "learning_rate": 4.9837955304540474e-05,
      "loss": 2.3045,
      "num_input_tokens_seen": 3303632640,
      "step": 4199
    },
    {
      "epoch": 0.44557606619987267,
      "grad_norm": 0.759459040522604,
      "learning_rate": 4.98378762957187e-05,
      "loss": 2.02,
      "num_input_tokens_seen": 3304419456,
      "step": 4200
    },
    {
      "epoch": 0.4456821557394441,
      "grad_norm": 0.5413623591512352,
      "learning_rate": 4.983779726770294e-05,
      "loss": 2.0544,
      "num_input_tokens_seen": 3305206208,
      "step": 4201
    },
    {
      "epoch": 0.4457882452790155,
      "grad_norm": 0.9991966722542351,
      "learning_rate": 4.9837718220493255e-05,
      "loss": 1.9995,
      "num_input_tokens_seen": 3305992960,
      "step": 4202
    },
    {
      "epoch": 0.44589433481858687,
      "grad_norm": 0.664965408266462,
      "learning_rate": 4.983763915408972e-05,
      "loss": 2.0962,
      "num_input_tokens_seen": 3306779696,
      "step": 4203
    },
    {
      "epoch": 0.4460004243581583,
      "grad_norm": 1.2324148823638907,
      "learning_rate": 4.983756006849238e-05,
      "loss": 2.1115,
      "num_input_tokens_seen": 3307566448,
      "step": 4204
    },
    {
      "epoch": 0.4461065138977297,
      "grad_norm": 0.939759025462762,
      "learning_rate": 4.98374809637013e-05,
      "loss": 2.2016,
      "num_input_tokens_seen": 3308353136,
      "step": 4205
    },
    {
      "epoch": 0.44621260343730107,
      "grad_norm": 0.5054580406484971,
      "learning_rate": 4.983740183971655e-05,
      "loss": 1.9114,
      "num_input_tokens_seen": 3309140016,
      "step": 4206
    },
    {
      "epoch": 0.4463186929768725,
      "grad_norm": 0.5467443377172023,
      "learning_rate": 4.983732269653818e-05,
      "loss": 2.0353,
      "num_input_tokens_seen": 3309926816,
      "step": 4207
    },
    {
      "epoch": 0.44642478251644385,
      "grad_norm": 0.9423794759410405,
      "learning_rate": 4.983724353416625e-05,
      "loss": 2.0778,
      "num_input_tokens_seen": 3310713520,
      "step": 4208
    },
    {
      "epoch": 0.44653087205601527,
      "grad_norm": 0.6416533563145408,
      "learning_rate": 4.983716435260084e-05,
      "loss": 2.0631,
      "num_input_tokens_seen": 3311500368,
      "step": 4209
    },
    {
      "epoch": 0.4466369615955867,
      "grad_norm": 0.6007336898237908,
      "learning_rate": 4.983708515184199e-05,
      "loss": 2.0361,
      "num_input_tokens_seen": 3312287168,
      "step": 4210
    },
    {
      "epoch": 0.44674305113515805,
      "grad_norm": 0.5591791234443125,
      "learning_rate": 4.983700593188977e-05,
      "loss": 2.0964,
      "num_input_tokens_seen": 3313073984,
      "step": 4211
    },
    {
      "epoch": 0.4468491406747295,
      "grad_norm": 0.7999327180630009,
      "learning_rate": 4.9836926692744244e-05,
      "loss": 2.1126,
      "num_input_tokens_seen": 3313860704,
      "step": 4212
    },
    {
      "epoch": 0.4469552302143009,
      "grad_norm": 0.521674458611301,
      "learning_rate": 4.983684743440547e-05,
      "loss": 2.0018,
      "num_input_tokens_seen": 3314647616,
      "step": 4213
    },
    {
      "epoch": 0.44706131975387225,
      "grad_norm": 0.6301249233301944,
      "learning_rate": 4.9836768156873507e-05,
      "loss": 2.038,
      "num_input_tokens_seen": 3315434448,
      "step": 4214
    },
    {
      "epoch": 0.4471674092934437,
      "grad_norm": 0.42323867280590655,
      "learning_rate": 4.983668886014841e-05,
      "loss": 1.9451,
      "num_input_tokens_seen": 3316221376,
      "step": 4215
    },
    {
      "epoch": 0.44727349883301504,
      "grad_norm": 0.6501603097501065,
      "learning_rate": 4.9836609544230264e-05,
      "loss": 2.1297,
      "num_input_tokens_seen": 3317008208,
      "step": 4216
    },
    {
      "epoch": 0.44737958837258646,
      "grad_norm": 0.4666319543637452,
      "learning_rate": 4.9836530209119104e-05,
      "loss": 1.9641,
      "num_input_tokens_seen": 3317795088,
      "step": 4217
    },
    {
      "epoch": 0.4474856779121579,
      "grad_norm": 0.5696159432468645,
      "learning_rate": 4.9836450854815004e-05,
      "loss": 2.0841,
      "num_input_tokens_seen": 3318581840,
      "step": 4218
    },
    {
      "epoch": 0.44759176745172924,
      "grad_norm": 0.6294518377850152,
      "learning_rate": 4.9836371481318026e-05,
      "loss": 2.1573,
      "num_input_tokens_seen": 3319368560,
      "step": 4219
    },
    {
      "epoch": 0.44769785699130066,
      "grad_norm": 0.5911735952369929,
      "learning_rate": 4.983629208862823e-05,
      "loss": 1.9978,
      "num_input_tokens_seen": 3320155280,
      "step": 4220
    },
    {
      "epoch": 0.4478039465308721,
      "grad_norm": 0.7447799641099238,
      "learning_rate": 4.9836212676745676e-05,
      "loss": 2.0343,
      "num_input_tokens_seen": 3320942064,
      "step": 4221
    },
    {
      "epoch": 0.44791003607044344,
      "grad_norm": 0.6704369118437301,
      "learning_rate": 4.983613324567042e-05,
      "loss": 1.9462,
      "num_input_tokens_seen": 3321728848,
      "step": 4222
    },
    {
      "epoch": 0.44801612561001486,
      "grad_norm": 0.9764000725761041,
      "learning_rate": 4.9836053795402535e-05,
      "loss": 2.0558,
      "num_input_tokens_seen": 3322515728,
      "step": 4223
    },
    {
      "epoch": 0.4481222151495863,
      "grad_norm": 1.1589175889060603,
      "learning_rate": 4.983597432594207e-05,
      "loss": 2.0504,
      "num_input_tokens_seen": 3323302496,
      "step": 4224
    },
    {
      "epoch": 0.44822830468915764,
      "grad_norm": 0.6792094992294033,
      "learning_rate": 4.98358948372891e-05,
      "loss": 2.048,
      "num_input_tokens_seen": 3324089360,
      "step": 4225
    },
    {
      "epoch": 0.44833439422872906,
      "grad_norm": 0.6275161948331339,
      "learning_rate": 4.9835815329443676e-05,
      "loss": 1.837,
      "num_input_tokens_seen": 3324876160,
      "step": 4226
    },
    {
      "epoch": 0.4484404837683004,
      "grad_norm": 0.7978227763890283,
      "learning_rate": 4.983573580240586e-05,
      "loss": 2.0076,
      "num_input_tokens_seen": 3325662976,
      "step": 4227
    },
    {
      "epoch": 0.44854657330787184,
      "grad_norm": 0.668601567324539,
      "learning_rate": 4.9835656256175724e-05,
      "loss": 2.0712,
      "num_input_tokens_seen": 3326449744,
      "step": 4228
    },
    {
      "epoch": 0.44865266284744326,
      "grad_norm": 0.9525378531398859,
      "learning_rate": 4.983557669075331e-05,
      "loss": 2.1197,
      "num_input_tokens_seen": 3327236448,
      "step": 4229
    },
    {
      "epoch": 0.4487587523870146,
      "grad_norm": 2.424306360529937,
      "learning_rate": 4.9835497106138696e-05,
      "loss": 2.1427,
      "num_input_tokens_seen": 3328023168,
      "step": 4230
    },
    {
      "epoch": 0.44886484192658604,
      "grad_norm": 0.777722232352157,
      "learning_rate": 4.983541750233194e-05,
      "loss": 2.1329,
      "num_input_tokens_seen": 3328810000,
      "step": 4231
    },
    {
      "epoch": 0.44897093146615746,
      "grad_norm": 1.270439995656301,
      "learning_rate": 4.983533787933311e-05,
      "loss": 2.1283,
      "num_input_tokens_seen": 3329596768,
      "step": 4232
    },
    {
      "epoch": 0.4490770210057288,
      "grad_norm": 0.6658055328481256,
      "learning_rate": 4.983525823714225e-05,
      "loss": 2.0186,
      "num_input_tokens_seen": 3330383504,
      "step": 4233
    },
    {
      "epoch": 0.44918311054530025,
      "grad_norm": 1.1341483806725534,
      "learning_rate": 4.983517857575943e-05,
      "loss": 2.1149,
      "num_input_tokens_seen": 3331170240,
      "step": 4234
    },
    {
      "epoch": 0.4492892000848716,
      "grad_norm": 0.6615354492176043,
      "learning_rate": 4.983509889518472e-05,
      "loss": 2.0574,
      "num_input_tokens_seen": 3331957104,
      "step": 4235
    },
    {
      "epoch": 0.44939528962444303,
      "grad_norm": 1.2167081562116289,
      "learning_rate": 4.983501919541816e-05,
      "loss": 2.2988,
      "num_input_tokens_seen": 3332743808,
      "step": 4236
    },
    {
      "epoch": 0.44950137916401445,
      "grad_norm": 0.5035111603565974,
      "learning_rate": 4.983493947645984e-05,
      "loss": 2.0117,
      "num_input_tokens_seen": 3333530544,
      "step": 4237
    },
    {
      "epoch": 0.4496074687035858,
      "grad_norm": 0.8806566735473771,
      "learning_rate": 4.9834859738309805e-05,
      "loss": 2.1418,
      "num_input_tokens_seen": 3334317232,
      "step": 4238
    },
    {
      "epoch": 0.44971355824315723,
      "grad_norm": 0.6191194192273664,
      "learning_rate": 4.9834779980968116e-05,
      "loss": 2.0429,
      "num_input_tokens_seen": 3335104032,
      "step": 4239
    },
    {
      "epoch": 0.44981964778272865,
      "grad_norm": 0.7535474839957272,
      "learning_rate": 4.9834700204434836e-05,
      "loss": 1.9323,
      "num_input_tokens_seen": 3335890800,
      "step": 4240
    },
    {
      "epoch": 0.4499257373223,
      "grad_norm": 0.6964716922377131,
      "learning_rate": 4.983462040871003e-05,
      "loss": 2.06,
      "num_input_tokens_seen": 3336677584,
      "step": 4241
    },
    {
      "epoch": 0.45003182686187143,
      "grad_norm": 0.5509720661148502,
      "learning_rate": 4.983454059379377e-05,
      "loss": 2.2324,
      "num_input_tokens_seen": 3337464224,
      "step": 4242
    },
    {
      "epoch": 0.4501379164014428,
      "grad_norm": 0.9176457830199924,
      "learning_rate": 4.9834460759686086e-05,
      "loss": 2.1806,
      "num_input_tokens_seen": 3338250912,
      "step": 4243
    },
    {
      "epoch": 0.4502440059410142,
      "grad_norm": 0.5605909562492936,
      "learning_rate": 4.983438090638707e-05,
      "loss": 2.0009,
      "num_input_tokens_seen": 3339037632,
      "step": 4244
    },
    {
      "epoch": 0.45035009548058563,
      "grad_norm": 0.7110695073551214,
      "learning_rate": 4.983430103389677e-05,
      "loss": 1.9234,
      "num_input_tokens_seen": 3339824384,
      "step": 4245
    },
    {
      "epoch": 0.450456185020157,
      "grad_norm": 0.46951829982908966,
      "learning_rate": 4.9834221142215255e-05,
      "loss": 2.0806,
      "num_input_tokens_seen": 3340611088,
      "step": 4246
    },
    {
      "epoch": 0.4505622745597284,
      "grad_norm": 0.7776839930986799,
      "learning_rate": 4.983414123134258e-05,
      "loss": 1.9773,
      "num_input_tokens_seen": 3341397824,
      "step": 4247
    },
    {
      "epoch": 0.45066836409929983,
      "grad_norm": 0.5738933848417759,
      "learning_rate": 4.983406130127881e-05,
      "loss": 1.9296,
      "num_input_tokens_seen": 3342184528,
      "step": 4248
    },
    {
      "epoch": 0.4507744536388712,
      "grad_norm": 0.8662898314837314,
      "learning_rate": 4.9833981352024005e-05,
      "loss": 1.9275,
      "num_input_tokens_seen": 3342971296,
      "step": 4249
    },
    {
      "epoch": 0.4508805431784426,
      "grad_norm": 1.2691891948498968,
      "learning_rate": 4.9833901383578227e-05,
      "loss": 2.0371,
      "num_input_tokens_seen": 3343758032,
      "step": 4250
    },
    {
      "epoch": 0.450986632718014,
      "grad_norm": 0.9197927818803262,
      "learning_rate": 4.983382139594154e-05,
      "loss": 2.1572,
      "num_input_tokens_seen": 3344544832,
      "step": 4251
    },
    {
      "epoch": 0.4510927222575854,
      "grad_norm": 0.9769227432281664,
      "learning_rate": 4.983374138911401e-05,
      "loss": 2.0506,
      "num_input_tokens_seen": 3345331648,
      "step": 4252
    },
    {
      "epoch": 0.4511988117971568,
      "grad_norm": 1.626569473799472,
      "learning_rate": 4.9833661363095686e-05,
      "loss": 2.0777,
      "num_input_tokens_seen": 3346118352,
      "step": 4253
    },
    {
      "epoch": 0.4513049013367282,
      "grad_norm": 0.9496595373781637,
      "learning_rate": 4.983358131788664e-05,
      "loss": 1.9497,
      "num_input_tokens_seen": 3346905104,
      "step": 4254
    },
    {
      "epoch": 0.4514109908762996,
      "grad_norm": 0.9134996819205469,
      "learning_rate": 4.983350125348693e-05,
      "loss": 1.9438,
      "num_input_tokens_seen": 3347691808,
      "step": 4255
    },
    {
      "epoch": 0.451517080415871,
      "grad_norm": 0.7869712165272419,
      "learning_rate": 4.9833421169896615e-05,
      "loss": 2.2197,
      "num_input_tokens_seen": 3348478416,
      "step": 4256
    },
    {
      "epoch": 0.4516231699554424,
      "grad_norm": 0.8805288838352381,
      "learning_rate": 4.983334106711577e-05,
      "loss": 2.0159,
      "num_input_tokens_seen": 3349265184,
      "step": 4257
    },
    {
      "epoch": 0.4517292594950138,
      "grad_norm": 0.4967195240779402,
      "learning_rate": 4.983326094514444e-05,
      "loss": 2.1075,
      "num_input_tokens_seen": 3350051872,
      "step": 4258
    },
    {
      "epoch": 0.45183534903458517,
      "grad_norm": 0.9887794326434907,
      "learning_rate": 4.9833180803982695e-05,
      "loss": 2.1467,
      "num_input_tokens_seen": 3350838624,
      "step": 4259
    },
    {
      "epoch": 0.4519414385741566,
      "grad_norm": 0.5416205328410378,
      "learning_rate": 4.98331006436306e-05,
      "loss": 2.0015,
      "num_input_tokens_seen": 3351625504,
      "step": 4260
    },
    {
      "epoch": 0.452047528113728,
      "grad_norm": 0.9790306916671576,
      "learning_rate": 4.983302046408821e-05,
      "loss": 2.0823,
      "num_input_tokens_seen": 3352412224,
      "step": 4261
    },
    {
      "epoch": 0.45215361765329937,
      "grad_norm": 0.5704474201842987,
      "learning_rate": 4.983294026535559e-05,
      "loss": 2.0292,
      "num_input_tokens_seen": 3353198992,
      "step": 4262
    },
    {
      "epoch": 0.4522597071928708,
      "grad_norm": 0.7132071891107843,
      "learning_rate": 4.983286004743281e-05,
      "loss": 2.046,
      "num_input_tokens_seen": 3353985760,
      "step": 4263
    },
    {
      "epoch": 0.4523657967324422,
      "grad_norm": 0.5015041402054414,
      "learning_rate": 4.983277981031992e-05,
      "loss": 2.0353,
      "num_input_tokens_seen": 3354772464,
      "step": 4264
    },
    {
      "epoch": 0.45247188627201357,
      "grad_norm": 0.8049434891427909,
      "learning_rate": 4.983269955401698e-05,
      "loss": 2.1613,
      "num_input_tokens_seen": 3355559248,
      "step": 4265
    },
    {
      "epoch": 0.452577975811585,
      "grad_norm": 0.7330610409338983,
      "learning_rate": 4.9832619278524064e-05,
      "loss": 2.1322,
      "num_input_tokens_seen": 3356346016,
      "step": 4266
    },
    {
      "epoch": 0.45268406535115635,
      "grad_norm": 0.5545852989593825,
      "learning_rate": 4.9832538983841235e-05,
      "loss": 2.0661,
      "num_input_tokens_seen": 3357132784,
      "step": 4267
    },
    {
      "epoch": 0.45279015489072777,
      "grad_norm": 0.5177451732362454,
      "learning_rate": 4.983245866996854e-05,
      "loss": 1.9833,
      "num_input_tokens_seen": 3357919616,
      "step": 4268
    },
    {
      "epoch": 0.4528962444302992,
      "grad_norm": 0.5007452105035126,
      "learning_rate": 4.983237833690605e-05,
      "loss": 2.1053,
      "num_input_tokens_seen": 3358706368,
      "step": 4269
    },
    {
      "epoch": 0.45300233396987055,
      "grad_norm": 0.6447280448695304,
      "learning_rate": 4.983229798465383e-05,
      "loss": 1.9832,
      "num_input_tokens_seen": 3359493104,
      "step": 4270
    },
    {
      "epoch": 0.45310842350944197,
      "grad_norm": 0.5267980506347903,
      "learning_rate": 4.9832217613211935e-05,
      "loss": 2.1312,
      "num_input_tokens_seen": 3360279792,
      "step": 4271
    },
    {
      "epoch": 0.4532145130490134,
      "grad_norm": 0.6532609280001526,
      "learning_rate": 4.983213722258043e-05,
      "loss": 2.0115,
      "num_input_tokens_seen": 3361066544,
      "step": 4272
    },
    {
      "epoch": 0.45332060258858475,
      "grad_norm": 0.483955288387818,
      "learning_rate": 4.983205681275938e-05,
      "loss": 1.9278,
      "num_input_tokens_seen": 3361853296,
      "step": 4273
    },
    {
      "epoch": 0.4534266921281562,
      "grad_norm": 0.6663935564899409,
      "learning_rate": 4.983197638374885e-05,
      "loss": 1.9021,
      "num_input_tokens_seen": 3362640112,
      "step": 4274
    },
    {
      "epoch": 0.45353278166772754,
      "grad_norm": 0.553125876491326,
      "learning_rate": 4.9831895935548886e-05,
      "loss": 2.0776,
      "num_input_tokens_seen": 3363426784,
      "step": 4275
    },
    {
      "epoch": 0.45363887120729895,
      "grad_norm": 0.4545733055685534,
      "learning_rate": 4.983181546815957e-05,
      "loss": 1.9568,
      "num_input_tokens_seen": 3364213568,
      "step": 4276
    },
    {
      "epoch": 0.4537449607468704,
      "grad_norm": 0.45991451359644525,
      "learning_rate": 4.983173498158096e-05,
      "loss": 1.9633,
      "num_input_tokens_seen": 3365000464,
      "step": 4277
    },
    {
      "epoch": 0.45385105028644174,
      "grad_norm": 0.4611439492413637,
      "learning_rate": 4.983165447581311e-05,
      "loss": 2.1489,
      "num_input_tokens_seen": 3365787152,
      "step": 4278
    },
    {
      "epoch": 0.45395713982601316,
      "grad_norm": 0.4491273240895417,
      "learning_rate": 4.983157395085608e-05,
      "loss": 1.9777,
      "num_input_tokens_seen": 3366573920,
      "step": 4279
    },
    {
      "epoch": 0.4540632293655846,
      "grad_norm": 0.49847126905119454,
      "learning_rate": 4.983149340670994e-05,
      "loss": 2.1252,
      "num_input_tokens_seen": 3367360720,
      "step": 4280
    },
    {
      "epoch": 0.45416931890515594,
      "grad_norm": 0.49835101663120884,
      "learning_rate": 4.983141284337476e-05,
      "loss": 2.0713,
      "num_input_tokens_seen": 3368147536,
      "step": 4281
    },
    {
      "epoch": 0.45427540844472736,
      "grad_norm": 0.6038192690254437,
      "learning_rate": 4.9831332260850585e-05,
      "loss": 2.0612,
      "num_input_tokens_seen": 3368934304,
      "step": 4282
    },
    {
      "epoch": 0.4543814979842987,
      "grad_norm": 0.5164500626080738,
      "learning_rate": 4.9831251659137476e-05,
      "loss": 2.1942,
      "num_input_tokens_seen": 3369721040,
      "step": 4283
    },
    {
      "epoch": 0.45448758752387014,
      "grad_norm": 0.6928541712081421,
      "learning_rate": 4.983117103823552e-05,
      "loss": 2.1095,
      "num_input_tokens_seen": 3370507872,
      "step": 4284
    },
    {
      "epoch": 0.45459367706344156,
      "grad_norm": 0.6659651440699896,
      "learning_rate": 4.983109039814475e-05,
      "loss": 2.2311,
      "num_input_tokens_seen": 3371294640,
      "step": 4285
    },
    {
      "epoch": 0.4546997666030129,
      "grad_norm": 0.42847779756732274,
      "learning_rate": 4.983100973886525e-05,
      "loss": 2.0971,
      "num_input_tokens_seen": 3372081552,
      "step": 4286
    },
    {
      "epoch": 0.45480585614258434,
      "grad_norm": 0.45152016134594153,
      "learning_rate": 4.983092906039708e-05,
      "loss": 2.0682,
      "num_input_tokens_seen": 3372868352,
      "step": 4287
    },
    {
      "epoch": 0.45491194568215576,
      "grad_norm": 0.4638794301106216,
      "learning_rate": 4.983084836274029e-05,
      "loss": 1.9199,
      "num_input_tokens_seen": 3373655200,
      "step": 4288
    },
    {
      "epoch": 0.4550180352217271,
      "grad_norm": 0.46302280159313675,
      "learning_rate": 4.983076764589495e-05,
      "loss": 2.0303,
      "num_input_tokens_seen": 3374441968,
      "step": 4289
    },
    {
      "epoch": 0.45512412476129854,
      "grad_norm": 1.0494116246044791,
      "learning_rate": 4.983068690986112e-05,
      "loss": 2.04,
      "num_input_tokens_seen": 3375228720,
      "step": 4290
    },
    {
      "epoch": 0.45523021430086996,
      "grad_norm": 0.9504270677192056,
      "learning_rate": 4.983060615463886e-05,
      "loss": 2.1192,
      "num_input_tokens_seen": 3376015488,
      "step": 4291
    },
    {
      "epoch": 0.4553363038404413,
      "grad_norm": 0.6264115284462349,
      "learning_rate": 4.9830525380228243e-05,
      "loss": 2.163,
      "num_input_tokens_seen": 3376802144,
      "step": 4292
    },
    {
      "epoch": 0.45544239338001274,
      "grad_norm": 0.9489300134287352,
      "learning_rate": 4.983044458662932e-05,
      "loss": 2.1329,
      "num_input_tokens_seen": 3377589008,
      "step": 4293
    },
    {
      "epoch": 0.4555484829195841,
      "grad_norm": 0.5279029628790611,
      "learning_rate": 4.983036377384216e-05,
      "loss": 1.9909,
      "num_input_tokens_seen": 3378375760,
      "step": 4294
    },
    {
      "epoch": 0.4556545724591555,
      "grad_norm": 1.1758011327469324,
      "learning_rate": 4.9830282941866824e-05,
      "loss": 2.1053,
      "num_input_tokens_seen": 3379162448,
      "step": 4295
    },
    {
      "epoch": 0.45576066199872695,
      "grad_norm": 0.8688154573396728,
      "learning_rate": 4.983020209070338e-05,
      "loss": 2.0825,
      "num_input_tokens_seen": 3379949232,
      "step": 4296
    },
    {
      "epoch": 0.4558667515382983,
      "grad_norm": 0.829606904716924,
      "learning_rate": 4.9830121220351874e-05,
      "loss": 2.0615,
      "num_input_tokens_seen": 3380736048,
      "step": 4297
    },
    {
      "epoch": 0.45597284107786973,
      "grad_norm": 0.8070071017733351,
      "learning_rate": 4.9830040330812375e-05,
      "loss": 2.1364,
      "num_input_tokens_seen": 3381522864,
      "step": 4298
    },
    {
      "epoch": 0.45607893061744115,
      "grad_norm": 0.9411250913351678,
      "learning_rate": 4.982995942208496e-05,
      "loss": 2.0507,
      "num_input_tokens_seen": 3382309760,
      "step": 4299
    },
    {
      "epoch": 0.4561850201570125,
      "grad_norm": 0.6492679559882837,
      "learning_rate": 4.982987849416968e-05,
      "loss": 2.1328,
      "num_input_tokens_seen": 3383096464,
      "step": 4300
    },
    {
      "epoch": 0.45629110969658393,
      "grad_norm": 0.6130262347537994,
      "learning_rate": 4.98297975470666e-05,
      "loss": 1.9458,
      "num_input_tokens_seen": 3383883184,
      "step": 4301
    },
    {
      "epoch": 0.4563971992361553,
      "grad_norm": 0.5613519992440305,
      "learning_rate": 4.9829716580775776e-05,
      "loss": 2.0052,
      "num_input_tokens_seen": 3384669968,
      "step": 4302
    },
    {
      "epoch": 0.4565032887757267,
      "grad_norm": 0.5076753431765558,
      "learning_rate": 4.982963559529727e-05,
      "loss": 1.9827,
      "num_input_tokens_seen": 3385456768,
      "step": 4303
    },
    {
      "epoch": 0.45660937831529813,
      "grad_norm": 0.48925620459804037,
      "learning_rate": 4.9829554590631164e-05,
      "loss": 1.9785,
      "num_input_tokens_seen": 3386243504,
      "step": 4304
    },
    {
      "epoch": 0.4567154678548695,
      "grad_norm": 0.7187697607256599,
      "learning_rate": 4.9829473566777495e-05,
      "loss": 2.0113,
      "num_input_tokens_seen": 3387030288,
      "step": 4305
    },
    {
      "epoch": 0.4568215573944409,
      "grad_norm": 0.5093887584203387,
      "learning_rate": 4.982939252373635e-05,
      "loss": 2.1379,
      "num_input_tokens_seen": 3387817040,
      "step": 4306
    },
    {
      "epoch": 0.45692764693401233,
      "grad_norm": 0.670379785512967,
      "learning_rate": 4.982931146150777e-05,
      "loss": 2.1049,
      "num_input_tokens_seen": 3388603792,
      "step": 4307
    },
    {
      "epoch": 0.4570337364735837,
      "grad_norm": 0.5308556269217317,
      "learning_rate": 4.982923038009182e-05,
      "loss": 2.0282,
      "num_input_tokens_seen": 3389390512,
      "step": 4308
    },
    {
      "epoch": 0.4571398260131551,
      "grad_norm": 0.5482146001916809,
      "learning_rate": 4.9829149279488585e-05,
      "loss": 2.2246,
      "num_input_tokens_seen": 3390177232,
      "step": 4309
    },
    {
      "epoch": 0.4572459155527265,
      "grad_norm": 0.8873554795470489,
      "learning_rate": 4.98290681596981e-05,
      "loss": 2.0901,
      "num_input_tokens_seen": 3390964096,
      "step": 4310
    },
    {
      "epoch": 0.4573520050922979,
      "grad_norm": 0.5101937131651699,
      "learning_rate": 4.982898702072044e-05,
      "loss": 2.0048,
      "num_input_tokens_seen": 3391750832,
      "step": 4311
    },
    {
      "epoch": 0.4574580946318693,
      "grad_norm": 0.6770454617402448,
      "learning_rate": 4.982890586255567e-05,
      "loss": 2.0976,
      "num_input_tokens_seen": 3392537552,
      "step": 4312
    },
    {
      "epoch": 0.4575641841714407,
      "grad_norm": 0.7993558873840296,
      "learning_rate": 4.982882468520386e-05,
      "loss": 2.0161,
      "num_input_tokens_seen": 3393324320,
      "step": 4313
    },
    {
      "epoch": 0.4576702737110121,
      "grad_norm": 0.6807812964853571,
      "learning_rate": 4.9828743488665054e-05,
      "loss": 2.1483,
      "num_input_tokens_seen": 3394111024,
      "step": 4314
    },
    {
      "epoch": 0.4577763632505835,
      "grad_norm": 1.3178113173931063,
      "learning_rate": 4.982866227293932e-05,
      "loss": 2.245,
      "num_input_tokens_seen": 3394897728,
      "step": 4315
    },
    {
      "epoch": 0.4578824527901549,
      "grad_norm": 0.5683948680150005,
      "learning_rate": 4.9828581038026725e-05,
      "loss": 2.012,
      "num_input_tokens_seen": 3395684512,
      "step": 4316
    },
    {
      "epoch": 0.4579885423297263,
      "grad_norm": 0.7129053405600301,
      "learning_rate": 4.982849978392734e-05,
      "loss": 1.886,
      "num_input_tokens_seen": 3396471280,
      "step": 4317
    },
    {
      "epoch": 0.45809463186929766,
      "grad_norm": 0.6645621399649561,
      "learning_rate": 4.9828418510641207e-05,
      "loss": 2.1205,
      "num_input_tokens_seen": 3397258080,
      "step": 4318
    },
    {
      "epoch": 0.4582007214088691,
      "grad_norm": 0.7185955426054703,
      "learning_rate": 4.9828337218168406e-05,
      "loss": 2.0292,
      "num_input_tokens_seen": 3398044800,
      "step": 4319
    },
    {
      "epoch": 0.4583068109484405,
      "grad_norm": 0.820463815695053,
      "learning_rate": 4.9828255906508994e-05,
      "loss": 1.9476,
      "num_input_tokens_seen": 3398831632,
      "step": 4320
    },
    {
      "epoch": 0.45841290048801187,
      "grad_norm": 0.5711101364114586,
      "learning_rate": 4.982817457566304e-05,
      "loss": 2.0369,
      "num_input_tokens_seen": 3399618352,
      "step": 4321
    },
    {
      "epoch": 0.4585189900275833,
      "grad_norm": 0.903887350172656,
      "learning_rate": 4.9828093225630596e-05,
      "loss": 2.0612,
      "num_input_tokens_seen": 3400405120,
      "step": 4322
    },
    {
      "epoch": 0.4586250795671547,
      "grad_norm": 0.4344907894144629,
      "learning_rate": 4.9828011856411724e-05,
      "loss": 1.9348,
      "num_input_tokens_seen": 3401191920,
      "step": 4323
    },
    {
      "epoch": 0.45873116910672607,
      "grad_norm": 0.5439672806970043,
      "learning_rate": 4.9827930468006506e-05,
      "loss": 2.2573,
      "num_input_tokens_seen": 3401978656,
      "step": 4324
    },
    {
      "epoch": 0.4588372586462975,
      "grad_norm": 0.5120869564578044,
      "learning_rate": 4.982784906041499e-05,
      "loss": 2.1319,
      "num_input_tokens_seen": 3402765408,
      "step": 4325
    },
    {
      "epoch": 0.45894334818586885,
      "grad_norm": 0.4749811720575971,
      "learning_rate": 4.9827767633637234e-05,
      "loss": 2.0969,
      "num_input_tokens_seen": 3403552160,
      "step": 4326
    },
    {
      "epoch": 0.45904943772544027,
      "grad_norm": 0.5592535688031327,
      "learning_rate": 4.982768618767331e-05,
      "loss": 2.1392,
      "num_input_tokens_seen": 3404338960,
      "step": 4327
    },
    {
      "epoch": 0.4591555272650117,
      "grad_norm": 0.505389473649432,
      "learning_rate": 4.982760472252327e-05,
      "loss": 2.1243,
      "num_input_tokens_seen": 3405125728,
      "step": 4328
    },
    {
      "epoch": 0.45926161680458305,
      "grad_norm": 0.5804514868027291,
      "learning_rate": 4.98275232381872e-05,
      "loss": 1.9915,
      "num_input_tokens_seen": 3405912576,
      "step": 4329
    },
    {
      "epoch": 0.45936770634415447,
      "grad_norm": 0.45956534617450373,
      "learning_rate": 4.9827441734665145e-05,
      "loss": 1.9285,
      "num_input_tokens_seen": 3406699504,
      "step": 4330
    },
    {
      "epoch": 0.4594737958837259,
      "grad_norm": 0.47352553401165537,
      "learning_rate": 4.982736021195716e-05,
      "loss": 2.0567,
      "num_input_tokens_seen": 3407486208,
      "step": 4331
    },
    {
      "epoch": 0.45957988542329725,
      "grad_norm": 0.4769714069594226,
      "learning_rate": 4.982727867006334e-05,
      "loss": 2.2166,
      "num_input_tokens_seen": 3408272880,
      "step": 4332
    },
    {
      "epoch": 0.45968597496286867,
      "grad_norm": 0.4597209358239586,
      "learning_rate": 4.982719710898371e-05,
      "loss": 1.8738,
      "num_input_tokens_seen": 3409059728,
      "step": 4333
    },
    {
      "epoch": 0.45979206450244003,
      "grad_norm": 0.44780725102136576,
      "learning_rate": 4.982711552871836e-05,
      "loss": 1.9653,
      "num_input_tokens_seen": 3409846496,
      "step": 4334
    },
    {
      "epoch": 0.45989815404201145,
      "grad_norm": 0.5037124802902808,
      "learning_rate": 4.982703392926734e-05,
      "loss": 2.2366,
      "num_input_tokens_seen": 3410633216,
      "step": 4335
    },
    {
      "epoch": 0.4600042435815829,
      "grad_norm": 0.6350393912011943,
      "learning_rate": 4.982695231063072e-05,
      "loss": 1.9664,
      "num_input_tokens_seen": 3411419920,
      "step": 4336
    },
    {
      "epoch": 0.46011033312115424,
      "grad_norm": 0.5026380741470802,
      "learning_rate": 4.982687067280855e-05,
      "loss": 2.0197,
      "num_input_tokens_seen": 3412206704,
      "step": 4337
    },
    {
      "epoch": 0.46021642266072565,
      "grad_norm": 0.8227221403832468,
      "learning_rate": 4.982678901580091e-05,
      "loss": 2.1166,
      "num_input_tokens_seen": 3412993424,
      "step": 4338
    },
    {
      "epoch": 0.4603225122002971,
      "grad_norm": 0.5876296411775598,
      "learning_rate": 4.982670733960785e-05,
      "loss": 2.0777,
      "num_input_tokens_seen": 3413780128,
      "step": 4339
    },
    {
      "epoch": 0.46042860173986844,
      "grad_norm": 0.531785442579809,
      "learning_rate": 4.982662564422945e-05,
      "loss": 2.194,
      "num_input_tokens_seen": 3414566960,
      "step": 4340
    },
    {
      "epoch": 0.46053469127943986,
      "grad_norm": 0.6335370960116105,
      "learning_rate": 4.982654392966576e-05,
      "loss": 2.029,
      "num_input_tokens_seen": 3415353728,
      "step": 4341
    },
    {
      "epoch": 0.4606407808190112,
      "grad_norm": 0.45729326048801033,
      "learning_rate": 4.9826462195916834e-05,
      "loss": 2.1743,
      "num_input_tokens_seen": 3416140512,
      "step": 4342
    },
    {
      "epoch": 0.46074687035858264,
      "grad_norm": 0.6510631071271213,
      "learning_rate": 4.9826380442982754e-05,
      "loss": 2.1268,
      "num_input_tokens_seen": 3416927280,
      "step": 4343
    },
    {
      "epoch": 0.46085295989815406,
      "grad_norm": 0.8419855534229836,
      "learning_rate": 4.982629867086358e-05,
      "loss": 2.1681,
      "num_input_tokens_seen": 3417714048,
      "step": 4344
    },
    {
      "epoch": 0.4609590494377254,
      "grad_norm": 0.5351355219818767,
      "learning_rate": 4.982621687955936e-05,
      "loss": 1.9654,
      "num_input_tokens_seen": 3418500800,
      "step": 4345
    },
    {
      "epoch": 0.46106513897729684,
      "grad_norm": 0.6586127708170613,
      "learning_rate": 4.982613506907018e-05,
      "loss": 2.0434,
      "num_input_tokens_seen": 3419287568,
      "step": 4346
    },
    {
      "epoch": 0.46117122851686826,
      "grad_norm": 0.8217652875650816,
      "learning_rate": 4.982605323939609e-05,
      "loss": 2.0136,
      "num_input_tokens_seen": 3420074192,
      "step": 4347
    },
    {
      "epoch": 0.4612773180564396,
      "grad_norm": 0.5259519263149024,
      "learning_rate": 4.9825971390537145e-05,
      "loss": 1.9601,
      "num_input_tokens_seen": 3420861024,
      "step": 4348
    },
    {
      "epoch": 0.46138340759601104,
      "grad_norm": 0.8057555864912389,
      "learning_rate": 4.982588952249342e-05,
      "loss": 1.9325,
      "num_input_tokens_seen": 3421647728,
      "step": 4349
    },
    {
      "epoch": 0.4614894971355824,
      "grad_norm": 0.4968869520542263,
      "learning_rate": 4.9825807635264986e-05,
      "loss": 1.9971,
      "num_input_tokens_seen": 3422434464,
      "step": 4350
    },
    {
      "epoch": 0.4615955866751538,
      "grad_norm": 0.6780054395415348,
      "learning_rate": 4.982572572885189e-05,
      "loss": 2.1505,
      "num_input_tokens_seen": 3423221200,
      "step": 4351
    },
    {
      "epoch": 0.46170167621472524,
      "grad_norm": 0.6380264399727036,
      "learning_rate": 4.9825643803254195e-05,
      "loss": 2.1741,
      "num_input_tokens_seen": 3424007952,
      "step": 4352
    },
    {
      "epoch": 0.4618077657542966,
      "grad_norm": 0.7195603835850957,
      "learning_rate": 4.982556185847198e-05,
      "loss": 2.0898,
      "num_input_tokens_seen": 3424794784,
      "step": 4353
    },
    {
      "epoch": 0.461913855293868,
      "grad_norm": 0.6036790179375336,
      "learning_rate": 4.98254798945053e-05,
      "loss": 2.01,
      "num_input_tokens_seen": 3425581552,
      "step": 4354
    },
    {
      "epoch": 0.46201994483343944,
      "grad_norm": 0.6037775911844863,
      "learning_rate": 4.982539791135421e-05,
      "loss": 2.0899,
      "num_input_tokens_seen": 3426368320,
      "step": 4355
    },
    {
      "epoch": 0.4621260343730108,
      "grad_norm": 1.0436792028391035,
      "learning_rate": 4.982531590901879e-05,
      "loss": 2.1602,
      "num_input_tokens_seen": 3427155088,
      "step": 4356
    },
    {
      "epoch": 0.4622321239125822,
      "grad_norm": 0.6316413064642162,
      "learning_rate": 4.982523388749908e-05,
      "loss": 2.0749,
      "num_input_tokens_seen": 3427941824,
      "step": 4357
    },
    {
      "epoch": 0.4623382134521536,
      "grad_norm": 1.4181471445781415,
      "learning_rate": 4.982515184679517e-05,
      "loss": 2.2459,
      "num_input_tokens_seen": 3428728640,
      "step": 4358
    },
    {
      "epoch": 0.462444302991725,
      "grad_norm": 0.652730139521118,
      "learning_rate": 4.9825069786907107e-05,
      "loss": 1.9271,
      "num_input_tokens_seen": 3429515392,
      "step": 4359
    },
    {
      "epoch": 0.46255039253129643,
      "grad_norm": 1.0792223825239196,
      "learning_rate": 4.982498770783496e-05,
      "loss": 2.0841,
      "num_input_tokens_seen": 3430302144,
      "step": 4360
    },
    {
      "epoch": 0.4626564820708678,
      "grad_norm": 0.5570234757422514,
      "learning_rate": 4.9824905609578785e-05,
      "loss": 2.1961,
      "num_input_tokens_seen": 3431088896,
      "step": 4361
    },
    {
      "epoch": 0.4627625716104392,
      "grad_norm": 1.0817951332073115,
      "learning_rate": 4.982482349213866e-05,
      "loss": 2.0574,
      "num_input_tokens_seen": 3431875616,
      "step": 4362
    },
    {
      "epoch": 0.46286866115001063,
      "grad_norm": 0.6518299638874517,
      "learning_rate": 4.982474135551464e-05,
      "loss": 2.2255,
      "num_input_tokens_seen": 3432662368,
      "step": 4363
    },
    {
      "epoch": 0.462974750689582,
      "grad_norm": 0.5995594987050276,
      "learning_rate": 4.982465919970678e-05,
      "loss": 2.0109,
      "num_input_tokens_seen": 3433449152,
      "step": 4364
    },
    {
      "epoch": 0.4630808402291534,
      "grad_norm": 0.6234344670371026,
      "learning_rate": 4.9824577024715155e-05,
      "loss": 2.0635,
      "num_input_tokens_seen": 3434235968,
      "step": 4365
    },
    {
      "epoch": 0.46318692976872483,
      "grad_norm": 0.525243851939325,
      "learning_rate": 4.982449483053983e-05,
      "loss": 2.0521,
      "num_input_tokens_seen": 3435022752,
      "step": 4366
    },
    {
      "epoch": 0.4632930193082962,
      "grad_norm": 0.46271230047577133,
      "learning_rate": 4.982441261718086e-05,
      "loss": 2.0153,
      "num_input_tokens_seen": 3435809536,
      "step": 4367
    },
    {
      "epoch": 0.4633991088478676,
      "grad_norm": 0.5272526723446084,
      "learning_rate": 4.982433038463831e-05,
      "loss": 1.8862,
      "num_input_tokens_seen": 3436596256,
      "step": 4368
    },
    {
      "epoch": 0.463505198387439,
      "grad_norm": 0.5234365993660945,
      "learning_rate": 4.982424813291226e-05,
      "loss": 2.0724,
      "num_input_tokens_seen": 3437383008,
      "step": 4369
    },
    {
      "epoch": 0.4636112879270104,
      "grad_norm": 0.44275654035892786,
      "learning_rate": 4.982416586200274e-05,
      "loss": 1.8182,
      "num_input_tokens_seen": 3438169808,
      "step": 4370
    },
    {
      "epoch": 0.4637173774665818,
      "grad_norm": 0.5923174197100587,
      "learning_rate": 4.982408357190984e-05,
      "loss": 1.8894,
      "num_input_tokens_seen": 3438956464,
      "step": 4371
    },
    {
      "epoch": 0.4638234670061532,
      "grad_norm": 0.5321456228211916,
      "learning_rate": 4.9824001262633616e-05,
      "loss": 1.9952,
      "num_input_tokens_seen": 3439743216,
      "step": 4372
    },
    {
      "epoch": 0.4639295565457246,
      "grad_norm": 0.6137862803098791,
      "learning_rate": 4.982391893417414e-05,
      "loss": 2.0228,
      "num_input_tokens_seen": 3440529984,
      "step": 4373
    },
    {
      "epoch": 0.464035646085296,
      "grad_norm": 0.7325009614915352,
      "learning_rate": 4.982383658653146e-05,
      "loss": 2.0526,
      "num_input_tokens_seen": 3441316736,
      "step": 4374
    },
    {
      "epoch": 0.4641417356248674,
      "grad_norm": 0.5969271309272578,
      "learning_rate": 4.9823754219705645e-05,
      "loss": 2.1775,
      "num_input_tokens_seen": 3442103408,
      "step": 4375
    },
    {
      "epoch": 0.4642478251644388,
      "grad_norm": 0.7508723816458807,
      "learning_rate": 4.982367183369677e-05,
      "loss": 2.1177,
      "num_input_tokens_seen": 3442890160,
      "step": 4376
    },
    {
      "epoch": 0.46435391470401016,
      "grad_norm": 0.47099675853427436,
      "learning_rate": 4.982358942850488e-05,
      "loss": 2.0435,
      "num_input_tokens_seen": 3443676880,
      "step": 4377
    },
    {
      "epoch": 0.4644600042435816,
      "grad_norm": 0.891565962026773,
      "learning_rate": 4.982350700413005e-05,
      "loss": 1.9349,
      "num_input_tokens_seen": 3444463680,
      "step": 4378
    },
    {
      "epoch": 0.464566093783153,
      "grad_norm": 0.5213301286888242,
      "learning_rate": 4.9823424560572354e-05,
      "loss": 1.9752,
      "num_input_tokens_seen": 3445250432,
      "step": 4379
    },
    {
      "epoch": 0.46467218332272436,
      "grad_norm": 0.5679271461018526,
      "learning_rate": 4.9823342097831834e-05,
      "loss": 2.1149,
      "num_input_tokens_seen": 3446037200,
      "step": 4380
    },
    {
      "epoch": 0.4647782728622958,
      "grad_norm": 0.5952074727536637,
      "learning_rate": 4.9823259615908565e-05,
      "loss": 2.0228,
      "num_input_tokens_seen": 3446824016,
      "step": 4381
    },
    {
      "epoch": 0.4648843624018672,
      "grad_norm": 0.8253325298689017,
      "learning_rate": 4.982317711480261e-05,
      "loss": 2.0147,
      "num_input_tokens_seen": 3447610816,
      "step": 4382
    },
    {
      "epoch": 0.46499045194143857,
      "grad_norm": 0.8432033864373779,
      "learning_rate": 4.982309459451403e-05,
      "loss": 2.1088,
      "num_input_tokens_seen": 3448397536,
      "step": 4383
    },
    {
      "epoch": 0.46509654148101,
      "grad_norm": 0.7941090935807507,
      "learning_rate": 4.982301205504289e-05,
      "loss": 2.0467,
      "num_input_tokens_seen": 3449184272,
      "step": 4384
    },
    {
      "epoch": 0.46520263102058135,
      "grad_norm": 0.7423501951078099,
      "learning_rate": 4.982292949638926e-05,
      "loss": 1.9427,
      "num_input_tokens_seen": 3449971088,
      "step": 4385
    },
    {
      "epoch": 0.46530872056015277,
      "grad_norm": 0.6666669128498485,
      "learning_rate": 4.982284691855319e-05,
      "loss": 1.8836,
      "num_input_tokens_seen": 3450757840,
      "step": 4386
    },
    {
      "epoch": 0.4654148100997242,
      "grad_norm": 1.0351326218617054,
      "learning_rate": 4.982276432153476e-05,
      "loss": 2.1,
      "num_input_tokens_seen": 3451544624,
      "step": 4387
    },
    {
      "epoch": 0.46552089963929555,
      "grad_norm": 1.2342875371586497,
      "learning_rate": 4.9822681705334026e-05,
      "loss": 2.0612,
      "num_input_tokens_seen": 3452331424,
      "step": 4388
    },
    {
      "epoch": 0.46562698917886697,
      "grad_norm": 1.0530240171129837,
      "learning_rate": 4.982259906995105e-05,
      "loss": 1.9207,
      "num_input_tokens_seen": 3453118304,
      "step": 4389
    },
    {
      "epoch": 0.4657330787184384,
      "grad_norm": 0.9964213316980659,
      "learning_rate": 4.9822516415385896e-05,
      "loss": 2.1268,
      "num_input_tokens_seen": 3453905152,
      "step": 4390
    },
    {
      "epoch": 0.46583916825800975,
      "grad_norm": 1.4414149951946427,
      "learning_rate": 4.982243374163863e-05,
      "loss": 2.1144,
      "num_input_tokens_seen": 3454691936,
      "step": 4391
    },
    {
      "epoch": 0.46594525779758117,
      "grad_norm": 0.9294962227031441,
      "learning_rate": 4.982235104870931e-05,
      "loss": 1.9962,
      "num_input_tokens_seen": 3455478688,
      "step": 4392
    },
    {
      "epoch": 0.46605134733715253,
      "grad_norm": 1.662736422890129,
      "learning_rate": 4.982226833659802e-05,
      "loss": 2.1253,
      "num_input_tokens_seen": 3456265408,
      "step": 4393
    },
    {
      "epoch": 0.46615743687672395,
      "grad_norm": 0.9195496277273094,
      "learning_rate": 4.98221856053048e-05,
      "loss": 2.082,
      "num_input_tokens_seen": 3457052160,
      "step": 4394
    },
    {
      "epoch": 0.46626352641629537,
      "grad_norm": 0.7589382767217633,
      "learning_rate": 4.982210285482972e-05,
      "loss": 1.9975,
      "num_input_tokens_seen": 3457839008,
      "step": 4395
    },
    {
      "epoch": 0.46636961595586673,
      "grad_norm": 1.2153410935055629,
      "learning_rate": 4.9822020085172856e-05,
      "loss": 2.0613,
      "num_input_tokens_seen": 3458625840,
      "step": 4396
    },
    {
      "epoch": 0.46647570549543815,
      "grad_norm": 0.9973134060515959,
      "learning_rate": 4.982193729633426e-05,
      "loss": 2.2432,
      "num_input_tokens_seen": 3459412608,
      "step": 4397
    },
    {
      "epoch": 0.46658179503500957,
      "grad_norm": 0.644099085121067,
      "learning_rate": 4.9821854488314e-05,
      "loss": 2.0687,
      "num_input_tokens_seen": 3460199280,
      "step": 4398
    },
    {
      "epoch": 0.46668788457458094,
      "grad_norm": 0.6171266220394108,
      "learning_rate": 4.9821771661112134e-05,
      "loss": 2.1132,
      "num_input_tokens_seen": 3460986096,
      "step": 4399
    },
    {
      "epoch": 0.46679397411415235,
      "grad_norm": 0.7787101074685379,
      "learning_rate": 4.9821688814728735e-05,
      "loss": 2.0369,
      "num_input_tokens_seen": 3461772784,
      "step": 4400
    },
    {
      "epoch": 0.4669000636537237,
      "grad_norm": 0.3989313182016951,
      "learning_rate": 4.982160594916386e-05,
      "loss": 2.0988,
      "num_input_tokens_seen": 3462559552,
      "step": 4401
    },
    {
      "epoch": 0.46700615319329514,
      "grad_norm": 0.7526470130100663,
      "learning_rate": 4.982152306441758e-05,
      "loss": 1.9175,
      "num_input_tokens_seen": 3463346352,
      "step": 4402
    },
    {
      "epoch": 0.46711224273286656,
      "grad_norm": 0.6256365102655302,
      "learning_rate": 4.9821440160489955e-05,
      "loss": 2.1608,
      "num_input_tokens_seen": 3464133104,
      "step": 4403
    },
    {
      "epoch": 0.4672183322724379,
      "grad_norm": 0.5075759634723852,
      "learning_rate": 4.982135723738105e-05,
      "loss": 2.1492,
      "num_input_tokens_seen": 3464919952,
      "step": 4404
    },
    {
      "epoch": 0.46732442181200934,
      "grad_norm": 0.5459583177563406,
      "learning_rate": 4.982127429509092e-05,
      "loss": 2.0524,
      "num_input_tokens_seen": 3465706688,
      "step": 4405
    },
    {
      "epoch": 0.46743051135158076,
      "grad_norm": 0.5817231180561908,
      "learning_rate": 4.982119133361965e-05,
      "loss": 2.0652,
      "num_input_tokens_seen": 3466493520,
      "step": 4406
    },
    {
      "epoch": 0.4675366008911521,
      "grad_norm": 0.4749762878990476,
      "learning_rate": 4.982110835296729e-05,
      "loss": 1.9123,
      "num_input_tokens_seen": 3467280288,
      "step": 4407
    },
    {
      "epoch": 0.46764269043072354,
      "grad_norm": 0.5828408222534114,
      "learning_rate": 4.98210253531339e-05,
      "loss": 2.0784,
      "num_input_tokens_seen": 3468067008,
      "step": 4408
    },
    {
      "epoch": 0.4677487799702949,
      "grad_norm": 0.5269258372827257,
      "learning_rate": 4.982094233411955e-05,
      "loss": 1.982,
      "num_input_tokens_seen": 3468853792,
      "step": 4409
    },
    {
      "epoch": 0.4678548695098663,
      "grad_norm": 0.4524654760057342,
      "learning_rate": 4.9820859295924306e-05,
      "loss": 1.8644,
      "num_input_tokens_seen": 3469640560,
      "step": 4410
    },
    {
      "epoch": 0.46796095904943774,
      "grad_norm": 0.47280058917607926,
      "learning_rate": 4.9820776238548225e-05,
      "loss": 1.9547,
      "num_input_tokens_seen": 3470427456,
      "step": 4411
    },
    {
      "epoch": 0.4680670485890091,
      "grad_norm": 0.4779650809103113,
      "learning_rate": 4.982069316199139e-05,
      "loss": 1.9505,
      "num_input_tokens_seen": 3471214272,
      "step": 4412
    },
    {
      "epoch": 0.4681731381285805,
      "grad_norm": 0.6407218575287406,
      "learning_rate": 4.9820610066253836e-05,
      "loss": 2.1102,
      "num_input_tokens_seen": 3472001056,
      "step": 4413
    },
    {
      "epoch": 0.46827922766815194,
      "grad_norm": 0.43550662934293494,
      "learning_rate": 4.9820526951335656e-05,
      "loss": 2.0819,
      "num_input_tokens_seen": 3472787760,
      "step": 4414
    },
    {
      "epoch": 0.4683853172077233,
      "grad_norm": 0.6286400437716062,
      "learning_rate": 4.9820443817236896e-05,
      "loss": 1.8943,
      "num_input_tokens_seen": 3473574560,
      "step": 4415
    },
    {
      "epoch": 0.4684914067472947,
      "grad_norm": 0.4486733970628206,
      "learning_rate": 4.982036066395762e-05,
      "loss": 2.1243,
      "num_input_tokens_seen": 3474361264,
      "step": 4416
    },
    {
      "epoch": 0.4685974962868661,
      "grad_norm": 0.4745003427494884,
      "learning_rate": 4.98202774914979e-05,
      "loss": 1.9914,
      "num_input_tokens_seen": 3475148048,
      "step": 4417
    },
    {
      "epoch": 0.4687035858264375,
      "grad_norm": 0.503868421442303,
      "learning_rate": 4.9820194299857806e-05,
      "loss": 2.0028,
      "num_input_tokens_seen": 3475934880,
      "step": 4418
    },
    {
      "epoch": 0.4688096753660089,
      "grad_norm": 0.48646488810941474,
      "learning_rate": 4.9820111089037384e-05,
      "loss": 1.8325,
      "num_input_tokens_seen": 3476721760,
      "step": 4419
    },
    {
      "epoch": 0.4689157649055803,
      "grad_norm": 0.5144979191207865,
      "learning_rate": 4.982002785903671e-05,
      "loss": 2.0543,
      "num_input_tokens_seen": 3477508512,
      "step": 4420
    },
    {
      "epoch": 0.4690218544451517,
      "grad_norm": 0.5409653100874533,
      "learning_rate": 4.981994460985585e-05,
      "loss": 2.0086,
      "num_input_tokens_seen": 3478295264,
      "step": 4421
    },
    {
      "epoch": 0.46912794398472313,
      "grad_norm": 0.45159283790659716,
      "learning_rate": 4.9819861341494865e-05,
      "loss": 2.0909,
      "num_input_tokens_seen": 3479082048,
      "step": 4422
    },
    {
      "epoch": 0.4692340335242945,
      "grad_norm": 0.666058319301345,
      "learning_rate": 4.981977805395382e-05,
      "loss": 2.0371,
      "num_input_tokens_seen": 3479868816,
      "step": 4423
    },
    {
      "epoch": 0.4693401230638659,
      "grad_norm": 0.4828042847359871,
      "learning_rate": 4.981969474723278e-05,
      "loss": 2.0786,
      "num_input_tokens_seen": 3480655472,
      "step": 4424
    },
    {
      "epoch": 0.4694462126034373,
      "grad_norm": 0.7561184747934511,
      "learning_rate": 4.98196114213318e-05,
      "loss": 2.0713,
      "num_input_tokens_seen": 3481442272,
      "step": 4425
    },
    {
      "epoch": 0.4695523021430087,
      "grad_norm": 0.542487952368943,
      "learning_rate": 4.981952807625096e-05,
      "loss": 2.0961,
      "num_input_tokens_seen": 3482229024,
      "step": 4426
    },
    {
      "epoch": 0.4696583916825801,
      "grad_norm": 0.7490335386613898,
      "learning_rate": 4.9819444711990315e-05,
      "loss": 2.0336,
      "num_input_tokens_seen": 3483015744,
      "step": 4427
    },
    {
      "epoch": 0.4697644812221515,
      "grad_norm": 0.4604155863243903,
      "learning_rate": 4.981936132854993e-05,
      "loss": 2.0768,
      "num_input_tokens_seen": 3483802512,
      "step": 4428
    },
    {
      "epoch": 0.4698705707617229,
      "grad_norm": 0.9417424373080524,
      "learning_rate": 4.9819277925929875e-05,
      "loss": 2.201,
      "num_input_tokens_seen": 3484589216,
      "step": 4429
    },
    {
      "epoch": 0.4699766603012943,
      "grad_norm": 0.5284774021946348,
      "learning_rate": 4.981919450413021e-05,
      "loss": 1.9797,
      "num_input_tokens_seen": 3485375968,
      "step": 4430
    },
    {
      "epoch": 0.4700827498408657,
      "grad_norm": 1.0839509356985222,
      "learning_rate": 4.981911106315099e-05,
      "loss": 2.1992,
      "num_input_tokens_seen": 3486162624,
      "step": 4431
    },
    {
      "epoch": 0.4701888393804371,
      "grad_norm": 0.7138130789228614,
      "learning_rate": 4.98190276029923e-05,
      "loss": 2.0703,
      "num_input_tokens_seen": 3486949376,
      "step": 4432
    },
    {
      "epoch": 0.4702949289200085,
      "grad_norm": 0.9229363968066417,
      "learning_rate": 4.9818944123654185e-05,
      "loss": 2.0778,
      "num_input_tokens_seen": 3487736160,
      "step": 4433
    },
    {
      "epoch": 0.4704010184595799,
      "grad_norm": 0.8989386037607379,
      "learning_rate": 4.9818860625136724e-05,
      "loss": 1.8922,
      "num_input_tokens_seen": 3488522944,
      "step": 4434
    },
    {
      "epoch": 0.4705071079991513,
      "grad_norm": 0.533072918987019,
      "learning_rate": 4.981877710743998e-05,
      "loss": 1.9433,
      "num_input_tokens_seen": 3489309824,
      "step": 4435
    },
    {
      "epoch": 0.47061319753872266,
      "grad_norm": 1.3268076998894334,
      "learning_rate": 4.981869357056401e-05,
      "loss": 2.0814,
      "num_input_tokens_seen": 3490096576,
      "step": 4436
    },
    {
      "epoch": 0.4707192870782941,
      "grad_norm": 0.5548288678562673,
      "learning_rate": 4.981861001450887e-05,
      "loss": 2.0511,
      "num_input_tokens_seen": 3490883392,
      "step": 4437
    },
    {
      "epoch": 0.4708253766178655,
      "grad_norm": 1.5748632479179412,
      "learning_rate": 4.9818526439274656e-05,
      "loss": 2.0939,
      "num_input_tokens_seen": 3491670224,
      "step": 4438
    },
    {
      "epoch": 0.47093146615743686,
      "grad_norm": 0.6579036799984763,
      "learning_rate": 4.9818442844861404e-05,
      "loss": 1.9579,
      "num_input_tokens_seen": 3492457008,
      "step": 4439
    },
    {
      "epoch": 0.4710375556970083,
      "grad_norm": 1.6422342214676042,
      "learning_rate": 4.9818359231269185e-05,
      "loss": 2.0461,
      "num_input_tokens_seen": 3493243792,
      "step": 4440
    },
    {
      "epoch": 0.4711436452365797,
      "grad_norm": 0.5533243538898578,
      "learning_rate": 4.9818275598498067e-05,
      "loss": 1.9279,
      "num_input_tokens_seen": 3494030656,
      "step": 4441
    },
    {
      "epoch": 0.47124973477615106,
      "grad_norm": 2.123925465000073,
      "learning_rate": 4.9818191946548116e-05,
      "loss": 2.2017,
      "num_input_tokens_seen": 3494817376,
      "step": 4442
    },
    {
      "epoch": 0.4713558243157225,
      "grad_norm": 0.7864327380236699,
      "learning_rate": 4.9818108275419395e-05,
      "loss": 2.0044,
      "num_input_tokens_seen": 3495604160,
      "step": 4443
    },
    {
      "epoch": 0.47146191385529385,
      "grad_norm": 1.8234597366829828,
      "learning_rate": 4.9818024585111964e-05,
      "loss": 1.9932,
      "num_input_tokens_seen": 3496390976,
      "step": 4444
    },
    {
      "epoch": 0.47156800339486526,
      "grad_norm": 2.587588746290677,
      "learning_rate": 4.981794087562589e-05,
      "loss": 2.0996,
      "num_input_tokens_seen": 3497177696,
      "step": 4445
    },
    {
      "epoch": 0.4716740929344367,
      "grad_norm": 0.8872473247508981,
      "learning_rate": 4.9817857146961245e-05,
      "loss": 2.0477,
      "num_input_tokens_seen": 3497964384,
      "step": 4446
    },
    {
      "epoch": 0.47178018247400805,
      "grad_norm": 5.4111023440303,
      "learning_rate": 4.981777339911809e-05,
      "loss": 1.9804,
      "num_input_tokens_seen": 3498751136,
      "step": 4447
    },
    {
      "epoch": 0.47188627201357947,
      "grad_norm": 1.0712805220272619,
      "learning_rate": 4.9817689632096486e-05,
      "loss": 1.9903,
      "num_input_tokens_seen": 3499537936,
      "step": 4448
    },
    {
      "epoch": 0.4719923615531509,
      "grad_norm": 1.8256865529118302,
      "learning_rate": 4.9817605845896496e-05,
      "loss": 2.1079,
      "num_input_tokens_seen": 3500324752,
      "step": 4449
    },
    {
      "epoch": 0.47209845109272225,
      "grad_norm": 0.9191390207590412,
      "learning_rate": 4.9817522040518196e-05,
      "loss": 2.0246,
      "num_input_tokens_seen": 3501111472,
      "step": 4450
    },
    {
      "epoch": 0.47220454063229367,
      "grad_norm": 2.4256655232953634,
      "learning_rate": 4.9817438215961633e-05,
      "loss": 1.9873,
      "num_input_tokens_seen": 3501898272,
      "step": 4451
    },
    {
      "epoch": 0.47231063017186503,
      "grad_norm": 1.1713173321760038,
      "learning_rate": 4.981735437222689e-05,
      "loss": 2.048,
      "num_input_tokens_seen": 3502684992,
      "step": 4452
    },
    {
      "epoch": 0.47241671971143645,
      "grad_norm": 1.3290643643313438,
      "learning_rate": 4.981727050931402e-05,
      "loss": 2.1323,
      "num_input_tokens_seen": 3503471744,
      "step": 4453
    },
    {
      "epoch": 0.47252280925100787,
      "grad_norm": 1.106967359418392,
      "learning_rate": 4.981718662722309e-05,
      "loss": 2.2572,
      "num_input_tokens_seen": 3504258528,
      "step": 4454
    },
    {
      "epoch": 0.47262889879057923,
      "grad_norm": 0.7323203196715862,
      "learning_rate": 4.981710272595417e-05,
      "loss": 1.9257,
      "num_input_tokens_seen": 3505045248,
      "step": 4455
    },
    {
      "epoch": 0.47273498833015065,
      "grad_norm": 0.8519106242115705,
      "learning_rate": 4.981701880550732e-05,
      "loss": 2.1082,
      "num_input_tokens_seen": 3505832016,
      "step": 4456
    },
    {
      "epoch": 0.47284107786972207,
      "grad_norm": 0.7901765246877615,
      "learning_rate": 4.98169348658826e-05,
      "loss": 2.0586,
      "num_input_tokens_seen": 3506618832,
      "step": 4457
    },
    {
      "epoch": 0.47294716740929343,
      "grad_norm": 0.7459625186858043,
      "learning_rate": 4.981685090708009e-05,
      "loss": 1.7981,
      "num_input_tokens_seen": 3507405616,
      "step": 4458
    },
    {
      "epoch": 0.47305325694886485,
      "grad_norm": 0.7619928678268058,
      "learning_rate": 4.981676692909984e-05,
      "loss": 1.9618,
      "num_input_tokens_seen": 3508192352,
      "step": 4459
    },
    {
      "epoch": 0.4731593464884362,
      "grad_norm": 0.9920646639259976,
      "learning_rate": 4.9816682931941926e-05,
      "loss": 2.1851,
      "num_input_tokens_seen": 3508979056,
      "step": 4460
    },
    {
      "epoch": 0.47326543602800764,
      "grad_norm": 0.8004635036994837,
      "learning_rate": 4.9816598915606405e-05,
      "loss": 2.0303,
      "num_input_tokens_seen": 3509765904,
      "step": 4461
    },
    {
      "epoch": 0.47337152556757905,
      "grad_norm": 0.7794313929985843,
      "learning_rate": 4.9816514880093346e-05,
      "loss": 2.1201,
      "num_input_tokens_seen": 3510552592,
      "step": 4462
    },
    {
      "epoch": 0.4734776151071504,
      "grad_norm": 0.9474439732330072,
      "learning_rate": 4.981643082540282e-05,
      "loss": 2.0521,
      "num_input_tokens_seen": 3511339328,
      "step": 4463
    },
    {
      "epoch": 0.47358370464672184,
      "grad_norm": 0.9416367290747848,
      "learning_rate": 4.9816346751534873e-05,
      "loss": 2.1681,
      "num_input_tokens_seen": 3512126064,
      "step": 4464
    },
    {
      "epoch": 0.47368979418629326,
      "grad_norm": 0.8897341780036742,
      "learning_rate": 4.9816262658489575e-05,
      "loss": 2.0029,
      "num_input_tokens_seen": 3512912800,
      "step": 4465
    },
    {
      "epoch": 0.4737958837258646,
      "grad_norm": 0.5813185445105964,
      "learning_rate": 4.981617854626701e-05,
      "loss": 2.0384,
      "num_input_tokens_seen": 3513699664,
      "step": 4466
    },
    {
      "epoch": 0.47390197326543604,
      "grad_norm": 2.73354543099492,
      "learning_rate": 4.9816094414867226e-05,
      "loss": 2.1105,
      "num_input_tokens_seen": 3514486368,
      "step": 4467
    },
    {
      "epoch": 0.4740080628050074,
      "grad_norm": 0.778294948361337,
      "learning_rate": 4.981601026429029e-05,
      "loss": 2.3705,
      "num_input_tokens_seen": 3515273072,
      "step": 4468
    },
    {
      "epoch": 0.4741141523445788,
      "grad_norm": 2.80101447245641,
      "learning_rate": 4.981592609453628e-05,
      "loss": 2.0197,
      "num_input_tokens_seen": 3516059840,
      "step": 4469
    },
    {
      "epoch": 0.47422024188415024,
      "grad_norm": 0.602215407862862,
      "learning_rate": 4.9815841905605246e-05,
      "loss": 1.9166,
      "num_input_tokens_seen": 3516846624,
      "step": 4470
    },
    {
      "epoch": 0.4743263314237216,
      "grad_norm": 2.1201007929227904,
      "learning_rate": 4.981575769749724e-05,
      "loss": 2.0681,
      "num_input_tokens_seen": 3517633392,
      "step": 4471
    },
    {
      "epoch": 0.474432420963293,
      "grad_norm": 0.6743851995077409,
      "learning_rate": 4.981567347021237e-05,
      "loss": 1.9667,
      "num_input_tokens_seen": 3518420208,
      "step": 4472
    },
    {
      "epoch": 0.47453851050286444,
      "grad_norm": 0.7536501080098073,
      "learning_rate": 4.981558922375066e-05,
      "loss": 1.8413,
      "num_input_tokens_seen": 3519207056,
      "step": 4473
    },
    {
      "epoch": 0.4746446000424358,
      "grad_norm": 1.2488852407801805,
      "learning_rate": 4.98155049581122e-05,
      "loss": 2.2818,
      "num_input_tokens_seen": 3519993760,
      "step": 4474
    },
    {
      "epoch": 0.4747506895820072,
      "grad_norm": 0.62765545578516,
      "learning_rate": 4.9815420673297036e-05,
      "loss": 2.1651,
      "num_input_tokens_seen": 3520780464,
      "step": 4475
    },
    {
      "epoch": 0.4748567791215786,
      "grad_norm": 0.8316810687880676,
      "learning_rate": 4.981533636930525e-05,
      "loss": 2.164,
      "num_input_tokens_seen": 3521567280,
      "step": 4476
    },
    {
      "epoch": 0.47496286866115,
      "grad_norm": 0.7051182529454577,
      "learning_rate": 4.9815252046136895e-05,
      "loss": 1.9466,
      "num_input_tokens_seen": 3522354064,
      "step": 4477
    },
    {
      "epoch": 0.4750689582007214,
      "grad_norm": 0.6061025718664694,
      "learning_rate": 4.9815167703792046e-05,
      "loss": 2.0874,
      "num_input_tokens_seen": 3523140816,
      "step": 4478
    },
    {
      "epoch": 0.4751750477402928,
      "grad_norm": 0.7656717548349352,
      "learning_rate": 4.9815083342270764e-05,
      "loss": 2.0145,
      "num_input_tokens_seen": 3523927584,
      "step": 4479
    },
    {
      "epoch": 0.4752811372798642,
      "grad_norm": 0.6642201239640556,
      "learning_rate": 4.981499896157311e-05,
      "loss": 2.0996,
      "num_input_tokens_seen": 3524714336,
      "step": 4480
    },
    {
      "epoch": 0.4753872268194356,
      "grad_norm": 0.8342904658070845,
      "learning_rate": 4.981491456169915e-05,
      "loss": 2.0401,
      "num_input_tokens_seen": 3525501072,
      "step": 4481
    },
    {
      "epoch": 0.475493316359007,
      "grad_norm": 0.4381888633746102,
      "learning_rate": 4.981483014264896e-05,
      "loss": 2.0728,
      "num_input_tokens_seen": 3526287856,
      "step": 4482
    },
    {
      "epoch": 0.4755994058985784,
      "grad_norm": 0.9260220304284148,
      "learning_rate": 4.9814745704422596e-05,
      "loss": 2.0362,
      "num_input_tokens_seen": 3527074544,
      "step": 4483
    },
    {
      "epoch": 0.4757054954381498,
      "grad_norm": 0.5471879916562009,
      "learning_rate": 4.981466124702012e-05,
      "loss": 2.0082,
      "num_input_tokens_seen": 3527861408,
      "step": 4484
    },
    {
      "epoch": 0.4758115849777212,
      "grad_norm": 0.6542768086372297,
      "learning_rate": 4.981457677044161e-05,
      "loss": 2.1519,
      "num_input_tokens_seen": 3528648128,
      "step": 4485
    },
    {
      "epoch": 0.4759176745172926,
      "grad_norm": 0.9847723924215431,
      "learning_rate": 4.981449227468712e-05,
      "loss": 2.0924,
      "num_input_tokens_seen": 3529434896,
      "step": 4486
    },
    {
      "epoch": 0.476023764056864,
      "grad_norm": 0.4699416627511808,
      "learning_rate": 4.981440775975671e-05,
      "loss": 2.2137,
      "num_input_tokens_seen": 3530221744,
      "step": 4487
    },
    {
      "epoch": 0.4761298535964354,
      "grad_norm": 1.379423657491659,
      "learning_rate": 4.981432322565047e-05,
      "loss": 2.0393,
      "num_input_tokens_seen": 3531008464,
      "step": 4488
    },
    {
      "epoch": 0.4762359431360068,
      "grad_norm": 0.6107395184628711,
      "learning_rate": 4.981423867236844e-05,
      "loss": 1.9178,
      "num_input_tokens_seen": 3531795216,
      "step": 4489
    },
    {
      "epoch": 0.4763420326755782,
      "grad_norm": 1.4361817366347158,
      "learning_rate": 4.981415409991069e-05,
      "loss": 2.1004,
      "num_input_tokens_seen": 3532581888,
      "step": 4490
    },
    {
      "epoch": 0.4764481222151496,
      "grad_norm": 0.6801856146119835,
      "learning_rate": 4.9814069508277295e-05,
      "loss": 2.1438,
      "num_input_tokens_seen": 3533368688,
      "step": 4491
    },
    {
      "epoch": 0.47655421175472096,
      "grad_norm": 0.6606160465150189,
      "learning_rate": 4.9813984897468315e-05,
      "loss": 2.067,
      "num_input_tokens_seen": 3534155536,
      "step": 4492
    },
    {
      "epoch": 0.4766603012942924,
      "grad_norm": 0.8521249236805853,
      "learning_rate": 4.981390026748382e-05,
      "loss": 2.0649,
      "num_input_tokens_seen": 3534942304,
      "step": 4493
    },
    {
      "epoch": 0.4767663908338638,
      "grad_norm": 0.8617565381969087,
      "learning_rate": 4.9813815618323855e-05,
      "loss": 2.0964,
      "num_input_tokens_seen": 3535729056,
      "step": 4494
    },
    {
      "epoch": 0.47687248037343516,
      "grad_norm": 0.6534853434186859,
      "learning_rate": 4.981373094998851e-05,
      "loss": 2.2406,
      "num_input_tokens_seen": 3536515760,
      "step": 4495
    },
    {
      "epoch": 0.4769785699130066,
      "grad_norm": 0.49377939337469423,
      "learning_rate": 4.981364626247785e-05,
      "loss": 1.9221,
      "num_input_tokens_seen": 3537302512,
      "step": 4496
    },
    {
      "epoch": 0.477084659452578,
      "grad_norm": 0.45063018602164273,
      "learning_rate": 4.9813561555791924e-05,
      "loss": 1.9177,
      "num_input_tokens_seen": 3538089328,
      "step": 4497
    },
    {
      "epoch": 0.47719074899214936,
      "grad_norm": 0.5297838088732397,
      "learning_rate": 4.9813476829930804e-05,
      "loss": 2.0241,
      "num_input_tokens_seen": 3538876144,
      "step": 4498
    },
    {
      "epoch": 0.4772968385317208,
      "grad_norm": 0.5884946445993939,
      "learning_rate": 4.981339208489456e-05,
      "loss": 2.0445,
      "num_input_tokens_seen": 3539662832,
      "step": 4499
    },
    {
      "epoch": 0.47740292807129214,
      "grad_norm": 0.5537667275160321,
      "learning_rate": 4.981330732068326e-05,
      "loss": 2.0132,
      "num_input_tokens_seen": 3540449616,
      "step": 4500
    },
    {
      "epoch": 0.47750901761086356,
      "grad_norm": 0.5434567061919288,
      "learning_rate": 4.981322253729695e-05,
      "loss": 2.043,
      "num_input_tokens_seen": 3541236368,
      "step": 4501
    },
    {
      "epoch": 0.477615107150435,
      "grad_norm": 0.4518192137003199,
      "learning_rate": 4.9813137734735725e-05,
      "loss": 1.9168,
      "num_input_tokens_seen": 3542023264,
      "step": 4502
    },
    {
      "epoch": 0.47772119669000634,
      "grad_norm": 0.45811380824357967,
      "learning_rate": 4.981305291299963e-05,
      "loss": 1.9719,
      "num_input_tokens_seen": 3542810032,
      "step": 4503
    },
    {
      "epoch": 0.47782728622957776,
      "grad_norm": 0.4571393232443532,
      "learning_rate": 4.9812968072088736e-05,
      "loss": 1.9785,
      "num_input_tokens_seen": 3543596832,
      "step": 4504
    },
    {
      "epoch": 0.4779333757691492,
      "grad_norm": 0.588305946515972,
      "learning_rate": 4.981288321200311e-05,
      "loss": 2.0353,
      "num_input_tokens_seen": 3544383632,
      "step": 4505
    },
    {
      "epoch": 0.47803946530872055,
      "grad_norm": 0.5007163906127311,
      "learning_rate": 4.981279833274281e-05,
      "loss": 2.1286,
      "num_input_tokens_seen": 3545170432,
      "step": 4506
    },
    {
      "epoch": 0.47814555484829196,
      "grad_norm": 0.6729727933981846,
      "learning_rate": 4.981271343430791e-05,
      "loss": 1.9703,
      "num_input_tokens_seen": 3545957328,
      "step": 4507
    },
    {
      "epoch": 0.4782516443878634,
      "grad_norm": 0.5205807934448402,
      "learning_rate": 4.981262851669848e-05,
      "loss": 1.9846,
      "num_input_tokens_seen": 3546744240,
      "step": 4508
    },
    {
      "epoch": 0.47835773392743475,
      "grad_norm": 0.9685454878961001,
      "learning_rate": 4.981254357991457e-05,
      "loss": 2.0852,
      "num_input_tokens_seen": 3547530976,
      "step": 4509
    },
    {
      "epoch": 0.47846382346700617,
      "grad_norm": 0.4391800499028895,
      "learning_rate": 4.981245862395626e-05,
      "loss": 2.0884,
      "num_input_tokens_seen": 3548317808,
      "step": 4510
    },
    {
      "epoch": 0.47856991300657753,
      "grad_norm": 1.1269283329470297,
      "learning_rate": 4.981237364882361e-05,
      "loss": 1.9104,
      "num_input_tokens_seen": 3549104624,
      "step": 4511
    },
    {
      "epoch": 0.47867600254614895,
      "grad_norm": 0.548282449699195,
      "learning_rate": 4.9812288654516675e-05,
      "loss": 2.1179,
      "num_input_tokens_seen": 3549891312,
      "step": 4512
    },
    {
      "epoch": 0.47878209208572037,
      "grad_norm": 1.803109843090237,
      "learning_rate": 4.9812203641035536e-05,
      "loss": 2.1997,
      "num_input_tokens_seen": 3550678080,
      "step": 4513
    },
    {
      "epoch": 0.47888818162529173,
      "grad_norm": 0.8484162731862581,
      "learning_rate": 4.981211860838026e-05,
      "loss": 2.0644,
      "num_input_tokens_seen": 3551464800,
      "step": 4514
    },
    {
      "epoch": 0.47899427116486315,
      "grad_norm": 0.7508761146838269,
      "learning_rate": 4.9812033556550906e-05,
      "loss": 2.1492,
      "num_input_tokens_seen": 3552251632,
      "step": 4515
    },
    {
      "epoch": 0.47910036070443457,
      "grad_norm": 1.3189974072980533,
      "learning_rate": 4.981194848554754e-05,
      "loss": 2.0675,
      "num_input_tokens_seen": 3553038336,
      "step": 4516
    },
    {
      "epoch": 0.47920645024400593,
      "grad_norm": 0.5506604693083367,
      "learning_rate": 4.981186339537023e-05,
      "loss": 2.0658,
      "num_input_tokens_seen": 3553825024,
      "step": 4517
    },
    {
      "epoch": 0.47931253978357735,
      "grad_norm": 1.719718028256537,
      "learning_rate": 4.981177828601903e-05,
      "loss": 2.2373,
      "num_input_tokens_seen": 3554611696,
      "step": 4518
    },
    {
      "epoch": 0.4794186293231487,
      "grad_norm": 0.6569869173198744,
      "learning_rate": 4.9811693157494023e-05,
      "loss": 2.1407,
      "num_input_tokens_seen": 3555398512,
      "step": 4519
    },
    {
      "epoch": 0.47952471886272013,
      "grad_norm": 0.7552053533210104,
      "learning_rate": 4.981160800979527e-05,
      "loss": 2.0784,
      "num_input_tokens_seen": 3556185200,
      "step": 4520
    },
    {
      "epoch": 0.47963080840229155,
      "grad_norm": 0.6269200612643567,
      "learning_rate": 4.981152284292283e-05,
      "loss": 1.9958,
      "num_input_tokens_seen": 3556972000,
      "step": 4521
    },
    {
      "epoch": 0.4797368979418629,
      "grad_norm": 0.5133305508499132,
      "learning_rate": 4.981143765687678e-05,
      "loss": 1.8952,
      "num_input_tokens_seen": 3557758832,
      "step": 4522
    },
    {
      "epoch": 0.47984298748143434,
      "grad_norm": 0.864766050100253,
      "learning_rate": 4.981135245165717e-05,
      "loss": 2.0211,
      "num_input_tokens_seen": 3558545600,
      "step": 4523
    },
    {
      "epoch": 0.47994907702100575,
      "grad_norm": 0.7189833690302199,
      "learning_rate": 4.981126722726408e-05,
      "loss": 2.1245,
      "num_input_tokens_seen": 3559332368,
      "step": 4524
    },
    {
      "epoch": 0.4800551665605771,
      "grad_norm": 0.7709446619143345,
      "learning_rate": 4.981118198369756e-05,
      "loss": 1.9953,
      "num_input_tokens_seen": 3560119168,
      "step": 4525
    },
    {
      "epoch": 0.48016125610014854,
      "grad_norm": 0.6208056757641834,
      "learning_rate": 4.98110967209577e-05,
      "loss": 2.1498,
      "num_input_tokens_seen": 3560905920,
      "step": 4526
    },
    {
      "epoch": 0.4802673456397199,
      "grad_norm": 0.8080007540705918,
      "learning_rate": 4.981101143904455e-05,
      "loss": 2.1104,
      "num_input_tokens_seen": 3561692672,
      "step": 4527
    },
    {
      "epoch": 0.4803734351792913,
      "grad_norm": 0.45482143017913723,
      "learning_rate": 4.981092613795818e-05,
      "loss": 1.989,
      "num_input_tokens_seen": 3562479392,
      "step": 4528
    },
    {
      "epoch": 0.48047952471886274,
      "grad_norm": 0.6062945807229757,
      "learning_rate": 4.981084081769865e-05,
      "loss": 2.004,
      "num_input_tokens_seen": 3563266192,
      "step": 4529
    },
    {
      "epoch": 0.4805856142584341,
      "grad_norm": 0.737432625512949,
      "learning_rate": 4.9810755478266025e-05,
      "loss": 1.9054,
      "num_input_tokens_seen": 3564053008,
      "step": 4530
    },
    {
      "epoch": 0.4806917037980055,
      "grad_norm": 0.5285815100840214,
      "learning_rate": 4.9810670119660384e-05,
      "loss": 2.0491,
      "num_input_tokens_seen": 3564839824,
      "step": 4531
    },
    {
      "epoch": 0.48079779333757694,
      "grad_norm": 0.7873539848772159,
      "learning_rate": 4.9810584741881786e-05,
      "loss": 1.9394,
      "num_input_tokens_seen": 3565626592,
      "step": 4532
    },
    {
      "epoch": 0.4809038828771483,
      "grad_norm": 0.5878673614348199,
      "learning_rate": 4.981049934493029e-05,
      "loss": 2.006,
      "num_input_tokens_seen": 3566413360,
      "step": 4533
    },
    {
      "epoch": 0.4810099724167197,
      "grad_norm": 0.6717198376932866,
      "learning_rate": 4.981041392880598e-05,
      "loss": 1.8163,
      "num_input_tokens_seen": 3567200192,
      "step": 4534
    },
    {
      "epoch": 0.4811160619562911,
      "grad_norm": 0.7988055491593152,
      "learning_rate": 4.9810328493508896e-05,
      "loss": 1.9568,
      "num_input_tokens_seen": 3567987104,
      "step": 4535
    },
    {
      "epoch": 0.4812221514958625,
      "grad_norm": 0.8142553458456093,
      "learning_rate": 4.981024303903912e-05,
      "loss": 1.9657,
      "num_input_tokens_seen": 3568773840,
      "step": 4536
    },
    {
      "epoch": 0.4813282410354339,
      "grad_norm": 0.5833079218319989,
      "learning_rate": 4.981015756539672e-05,
      "loss": 1.9452,
      "num_input_tokens_seen": 3569560608,
      "step": 4537
    },
    {
      "epoch": 0.4814343305750053,
      "grad_norm": 0.6515856108399819,
      "learning_rate": 4.981007207258176e-05,
      "loss": 2.1375,
      "num_input_tokens_seen": 3570347360,
      "step": 4538
    },
    {
      "epoch": 0.4815404201145767,
      "grad_norm": 0.4333107310493715,
      "learning_rate": 4.98099865605943e-05,
      "loss": 1.9394,
      "num_input_tokens_seen": 3571134160,
      "step": 4539
    },
    {
      "epoch": 0.4816465096541481,
      "grad_norm": 0.6679714005978042,
      "learning_rate": 4.980990102943442e-05,
      "loss": 1.9385,
      "num_input_tokens_seen": 3571920944,
      "step": 4540
    },
    {
      "epoch": 0.4817525991937195,
      "grad_norm": 0.4945532459872251,
      "learning_rate": 4.9809815479102164e-05,
      "loss": 2.0493,
      "num_input_tokens_seen": 3572707632,
      "step": 4541
    },
    {
      "epoch": 0.4818586887332909,
      "grad_norm": 0.5130973550058742,
      "learning_rate": 4.980972990959761e-05,
      "loss": 1.9405,
      "num_input_tokens_seen": 3573494448,
      "step": 4542
    },
    {
      "epoch": 0.48196477827286227,
      "grad_norm": 0.7699475600921879,
      "learning_rate": 4.980964432092083e-05,
      "loss": 1.9889,
      "num_input_tokens_seen": 3574281184,
      "step": 4543
    },
    {
      "epoch": 0.4820708678124337,
      "grad_norm": 0.8860010458495576,
      "learning_rate": 4.980955871307189e-05,
      "loss": 2.1011,
      "num_input_tokens_seen": 3575067984,
      "step": 4544
    },
    {
      "epoch": 0.4821769573520051,
      "grad_norm": 0.5805255087734392,
      "learning_rate": 4.9809473086050854e-05,
      "loss": 1.9638,
      "num_input_tokens_seen": 3575854720,
      "step": 4545
    },
    {
      "epoch": 0.4822830468915765,
      "grad_norm": 1.1490418855389817,
      "learning_rate": 4.980938743985777e-05,
      "loss": 2.2774,
      "num_input_tokens_seen": 3576641456,
      "step": 4546
    },
    {
      "epoch": 0.4823891364311479,
      "grad_norm": 1.6766859787221324,
      "learning_rate": 4.980930177449273e-05,
      "loss": 2.0649,
      "num_input_tokens_seen": 3577428256,
      "step": 4547
    },
    {
      "epoch": 0.4824952259707193,
      "grad_norm": 1.3400221055280872,
      "learning_rate": 4.980921608995579e-05,
      "loss": 2.0483,
      "num_input_tokens_seen": 3578215008,
      "step": 4548
    },
    {
      "epoch": 0.4826013155102907,
      "grad_norm": 1.2022779705233728,
      "learning_rate": 4.9809130386247e-05,
      "loss": 2.069,
      "num_input_tokens_seen": 3579001792,
      "step": 4549
    },
    {
      "epoch": 0.4827074050498621,
      "grad_norm": 0.8499153009669509,
      "learning_rate": 4.980904466336646e-05,
      "loss": 2.0663,
      "num_input_tokens_seen": 3579788592,
      "step": 4550
    },
    {
      "epoch": 0.48281349458943346,
      "grad_norm": 1.0862755050421704,
      "learning_rate": 4.980895892131421e-05,
      "loss": 2.012,
      "num_input_tokens_seen": 3580575312,
      "step": 4551
    },
    {
      "epoch": 0.4829195841290049,
      "grad_norm": 0.8216797661493386,
      "learning_rate": 4.980887316009033e-05,
      "loss": 2.1457,
      "num_input_tokens_seen": 3581362080,
      "step": 4552
    },
    {
      "epoch": 0.4830256736685763,
      "grad_norm": 0.7215600730464309,
      "learning_rate": 4.980878737969488e-05,
      "loss": 1.946,
      "num_input_tokens_seen": 3582148880,
      "step": 4553
    },
    {
      "epoch": 0.48313176320814766,
      "grad_norm": 0.5617455061809153,
      "learning_rate": 4.980870158012792e-05,
      "loss": 2.0333,
      "num_input_tokens_seen": 3582935680,
      "step": 4554
    },
    {
      "epoch": 0.4832378527477191,
      "grad_norm": 0.9329397925678764,
      "learning_rate": 4.980861576138953e-05,
      "loss": 2.0532,
      "num_input_tokens_seen": 3583722432,
      "step": 4555
    },
    {
      "epoch": 0.4833439422872905,
      "grad_norm": 0.43427657323236524,
      "learning_rate": 4.980852992347976e-05,
      "loss": 2.0027,
      "num_input_tokens_seen": 3584509312,
      "step": 4556
    },
    {
      "epoch": 0.48345003182686186,
      "grad_norm": 0.7674390045647276,
      "learning_rate": 4.98084440663987e-05,
      "loss": 1.9918,
      "num_input_tokens_seen": 3585296032,
      "step": 4557
    },
    {
      "epoch": 0.4835561213664333,
      "grad_norm": 0.7186180879881147,
      "learning_rate": 4.9808358190146395e-05,
      "loss": 2.2117,
      "num_input_tokens_seen": 3586082784,
      "step": 4558
    },
    {
      "epoch": 0.48366221090600464,
      "grad_norm": 0.6822300621779552,
      "learning_rate": 4.980827229472292e-05,
      "loss": 1.9439,
      "num_input_tokens_seen": 3586869584,
      "step": 4559
    },
    {
      "epoch": 0.48376830044557606,
      "grad_norm": 0.4820452364709251,
      "learning_rate": 4.980818638012834e-05,
      "loss": 2.1241,
      "num_input_tokens_seen": 3587656416,
      "step": 4560
    },
    {
      "epoch": 0.4838743899851475,
      "grad_norm": 0.5715856005638499,
      "learning_rate": 4.980810044636272e-05,
      "loss": 1.8442,
      "num_input_tokens_seen": 3588443232,
      "step": 4561
    },
    {
      "epoch": 0.48398047952471884,
      "grad_norm": 0.5297788240620401,
      "learning_rate": 4.980801449342613e-05,
      "loss": 2.0208,
      "num_input_tokens_seen": 3589229952,
      "step": 4562
    },
    {
      "epoch": 0.48408656906429026,
      "grad_norm": 0.5152459103155264,
      "learning_rate": 4.9807928521318636e-05,
      "loss": 1.9638,
      "num_input_tokens_seen": 3590016720,
      "step": 4563
    },
    {
      "epoch": 0.4841926586038617,
      "grad_norm": 0.6224339222052636,
      "learning_rate": 4.9807842530040295e-05,
      "loss": 2.0467,
      "num_input_tokens_seen": 3590803504,
      "step": 4564
    },
    {
      "epoch": 0.48429874814343304,
      "grad_norm": 0.7556276151421686,
      "learning_rate": 4.9807756519591186e-05,
      "loss": 2.0536,
      "num_input_tokens_seen": 3591590128,
      "step": 4565
    },
    {
      "epoch": 0.48440483768300446,
      "grad_norm": 0.4918686124575458,
      "learning_rate": 4.980767048997137e-05,
      "loss": 2.005,
      "num_input_tokens_seen": 3592376800,
      "step": 4566
    },
    {
      "epoch": 0.4845109272225758,
      "grad_norm": 0.5726645263437828,
      "learning_rate": 4.980758444118092e-05,
      "loss": 2.0843,
      "num_input_tokens_seen": 3593163600,
      "step": 4567
    },
    {
      "epoch": 0.48461701676214725,
      "grad_norm": 0.4560132924467452,
      "learning_rate": 4.980749837321988e-05,
      "loss": 2.0052,
      "num_input_tokens_seen": 3593950384,
      "step": 4568
    },
    {
      "epoch": 0.48472310630171866,
      "grad_norm": 0.6547047904575548,
      "learning_rate": 4.980741228608835e-05,
      "loss": 2.2143,
      "num_input_tokens_seen": 3594737104,
      "step": 4569
    },
    {
      "epoch": 0.48482919584129003,
      "grad_norm": 0.5608117244403946,
      "learning_rate": 4.980732617978638e-05,
      "loss": 2.1556,
      "num_input_tokens_seen": 3595523920,
      "step": 4570
    },
    {
      "epoch": 0.48493528538086145,
      "grad_norm": 0.5289447169538779,
      "learning_rate": 4.980724005431403e-05,
      "loss": 2.0158,
      "num_input_tokens_seen": 3596310720,
      "step": 4571
    },
    {
      "epoch": 0.48504137492043287,
      "grad_norm": 0.5584125618695601,
      "learning_rate": 4.980715390967137e-05,
      "loss": 2.0298,
      "num_input_tokens_seen": 3597097552,
      "step": 4572
    },
    {
      "epoch": 0.48514746446000423,
      "grad_norm": 0.5485143022049767,
      "learning_rate": 4.9807067745858476e-05,
      "loss": 2.033,
      "num_input_tokens_seen": 3597884352,
      "step": 4573
    },
    {
      "epoch": 0.48525355399957565,
      "grad_norm": 0.5429949494436412,
      "learning_rate": 4.9806981562875403e-05,
      "loss": 2.1643,
      "num_input_tokens_seen": 3598671104,
      "step": 4574
    },
    {
      "epoch": 0.48535964353914707,
      "grad_norm": 0.560763939552083,
      "learning_rate": 4.980689536072223e-05,
      "loss": 1.7966,
      "num_input_tokens_seen": 3599457872,
      "step": 4575
    },
    {
      "epoch": 0.48546573307871843,
      "grad_norm": 0.6464817546583215,
      "learning_rate": 4.9806809139399e-05,
      "loss": 1.9665,
      "num_input_tokens_seen": 3600244608,
      "step": 4576
    },
    {
      "epoch": 0.48557182261828985,
      "grad_norm": 0.6114771045923362,
      "learning_rate": 4.980672289890581e-05,
      "loss": 2.021,
      "num_input_tokens_seen": 3601031392,
      "step": 4577
    },
    {
      "epoch": 0.4856779121578612,
      "grad_norm": 0.6665130722151257,
      "learning_rate": 4.980663663924271e-05,
      "loss": 2.1672,
      "num_input_tokens_seen": 3601818144,
      "step": 4578
    },
    {
      "epoch": 0.48578400169743263,
      "grad_norm": 0.7826566476901269,
      "learning_rate": 4.980655036040976e-05,
      "loss": 1.824,
      "num_input_tokens_seen": 3602604896,
      "step": 4579
    },
    {
      "epoch": 0.48589009123700405,
      "grad_norm": 0.5144683878158411,
      "learning_rate": 4.9806464062407056e-05,
      "loss": 2.1449,
      "num_input_tokens_seen": 3603391664,
      "step": 4580
    },
    {
      "epoch": 0.4859961807765754,
      "grad_norm": 0.6142954060362901,
      "learning_rate": 4.9806377745234625e-05,
      "loss": 2.1233,
      "num_input_tokens_seen": 3604178432,
      "step": 4581
    },
    {
      "epoch": 0.48610227031614683,
      "grad_norm": 0.6117232980296358,
      "learning_rate": 4.9806291408892565e-05,
      "loss": 1.9689,
      "num_input_tokens_seen": 3604965136,
      "step": 4582
    },
    {
      "epoch": 0.48620835985571825,
      "grad_norm": 0.4173148213456821,
      "learning_rate": 4.980620505338093e-05,
      "loss": 1.9275,
      "num_input_tokens_seen": 3605751904,
      "step": 4583
    },
    {
      "epoch": 0.4863144493952896,
      "grad_norm": 0.6569980149980817,
      "learning_rate": 4.980611867869978e-05,
      "loss": 2.109,
      "num_input_tokens_seen": 3606538672,
      "step": 4584
    },
    {
      "epoch": 0.48642053893486104,
      "grad_norm": 0.4723113400264556,
      "learning_rate": 4.980603228484919e-05,
      "loss": 1.9522,
      "num_input_tokens_seen": 3607325488,
      "step": 4585
    },
    {
      "epoch": 0.4865266284744324,
      "grad_norm": 0.49016695886431877,
      "learning_rate": 4.980594587182923e-05,
      "loss": 1.9136,
      "num_input_tokens_seen": 3608112304,
      "step": 4586
    },
    {
      "epoch": 0.4866327180140038,
      "grad_norm": 0.6309561305495173,
      "learning_rate": 4.9805859439639954e-05,
      "loss": 2.0767,
      "num_input_tokens_seen": 3608899104,
      "step": 4587
    },
    {
      "epoch": 0.48673880755357524,
      "grad_norm": 0.5802447746395216,
      "learning_rate": 4.980577298828145e-05,
      "loss": 2.1891,
      "num_input_tokens_seen": 3609685792,
      "step": 4588
    },
    {
      "epoch": 0.4868448970931466,
      "grad_norm": 0.5234934898188027,
      "learning_rate": 4.9805686517753766e-05,
      "loss": 2.0041,
      "num_input_tokens_seen": 3610472448,
      "step": 4589
    },
    {
      "epoch": 0.486950986632718,
      "grad_norm": 0.4297864292854564,
      "learning_rate": 4.980560002805698e-05,
      "loss": 2.0657,
      "num_input_tokens_seen": 3611259232,
      "step": 4590
    },
    {
      "epoch": 0.48705707617228944,
      "grad_norm": 0.5717258951604368,
      "learning_rate": 4.980551351919115e-05,
      "loss": 2.1006,
      "num_input_tokens_seen": 3612045984,
      "step": 4591
    },
    {
      "epoch": 0.4871631657118608,
      "grad_norm": 0.6557799853920299,
      "learning_rate": 4.980542699115635e-05,
      "loss": 2.1609,
      "num_input_tokens_seen": 3612832704,
      "step": 4592
    },
    {
      "epoch": 0.4872692552514322,
      "grad_norm": 0.5527772328346828,
      "learning_rate": 4.980534044395264e-05,
      "loss": 1.8627,
      "num_input_tokens_seen": 3613619440,
      "step": 4593
    },
    {
      "epoch": 0.4873753447910036,
      "grad_norm": 0.6608622565594584,
      "learning_rate": 4.980525387758009e-05,
      "loss": 1.9163,
      "num_input_tokens_seen": 3614406256,
      "step": 4594
    },
    {
      "epoch": 0.487481434330575,
      "grad_norm": 0.5743213069833214,
      "learning_rate": 4.980516729203878e-05,
      "loss": 1.8766,
      "num_input_tokens_seen": 3615193088,
      "step": 4595
    },
    {
      "epoch": 0.4875875238701464,
      "grad_norm": 0.6121595648396913,
      "learning_rate": 4.9805080687328755e-05,
      "loss": 2.0983,
      "num_input_tokens_seen": 3615979936,
      "step": 4596
    },
    {
      "epoch": 0.4876936134097178,
      "grad_norm": 0.7193178216621765,
      "learning_rate": 4.980499406345009e-05,
      "loss": 2.1754,
      "num_input_tokens_seen": 3616766624,
      "step": 4597
    },
    {
      "epoch": 0.4877997029492892,
      "grad_norm": 0.5585640907291588,
      "learning_rate": 4.9804907420402856e-05,
      "loss": 2.0611,
      "num_input_tokens_seen": 3617553328,
      "step": 4598
    },
    {
      "epoch": 0.4879057924888606,
      "grad_norm": 0.5507265555339358,
      "learning_rate": 4.9804820758187115e-05,
      "loss": 2.0108,
      "num_input_tokens_seen": 3618340064,
      "step": 4599
    },
    {
      "epoch": 0.488011882028432,
      "grad_norm": 0.5794952594825529,
      "learning_rate": 4.980473407680294e-05,
      "loss": 2.0639,
      "num_input_tokens_seen": 3619126784,
      "step": 4600
    },
    {
      "epoch": 0.4881179715680034,
      "grad_norm": 0.9397030458440735,
      "learning_rate": 4.980464737625039e-05,
      "loss": 2.2518,
      "num_input_tokens_seen": 3619913552,
      "step": 4601
    },
    {
      "epoch": 0.48822406110757477,
      "grad_norm": 0.8420803636070564,
      "learning_rate": 4.980456065652954e-05,
      "loss": 1.8958,
      "num_input_tokens_seen": 3620700336,
      "step": 4602
    },
    {
      "epoch": 0.4883301506471462,
      "grad_norm": 0.5980184963809612,
      "learning_rate": 4.980447391764045e-05,
      "loss": 1.9924,
      "num_input_tokens_seen": 3621487072,
      "step": 4603
    },
    {
      "epoch": 0.4884362401867176,
      "grad_norm": 0.6076082804205971,
      "learning_rate": 4.980438715958319e-05,
      "loss": 1.9757,
      "num_input_tokens_seen": 3622273840,
      "step": 4604
    },
    {
      "epoch": 0.48854232972628897,
      "grad_norm": 1.0515058334795788,
      "learning_rate": 4.980430038235783e-05,
      "loss": 2.0438,
      "num_input_tokens_seen": 3623060624,
      "step": 4605
    },
    {
      "epoch": 0.4886484192658604,
      "grad_norm": 1.6337652173915065,
      "learning_rate": 4.980421358596443e-05,
      "loss": 2.2411,
      "num_input_tokens_seen": 3623847280,
      "step": 4606
    },
    {
      "epoch": 0.4887545088054318,
      "grad_norm": 0.8802974325171335,
      "learning_rate": 4.9804126770403073e-05,
      "loss": 1.9611,
      "num_input_tokens_seen": 3624634064,
      "step": 4607
    },
    {
      "epoch": 0.48886059834500317,
      "grad_norm": 0.9735411873865965,
      "learning_rate": 4.9804039935673806e-05,
      "loss": 1.9642,
      "num_input_tokens_seen": 3625420928,
      "step": 4608
    },
    {
      "epoch": 0.4889666878845746,
      "grad_norm": 0.7435875615586056,
      "learning_rate": 4.9803953081776705e-05,
      "loss": 2.1493,
      "num_input_tokens_seen": 3626207712,
      "step": 4609
    },
    {
      "epoch": 0.48907277742414595,
      "grad_norm": 1.0913525345207247,
      "learning_rate": 4.980386620871184e-05,
      "loss": 2.0258,
      "num_input_tokens_seen": 3626994432,
      "step": 4610
    },
    {
      "epoch": 0.4891788669637174,
      "grad_norm": 0.620333513737345,
      "learning_rate": 4.980377931647927e-05,
      "loss": 1.9497,
      "num_input_tokens_seen": 3627781280,
      "step": 4611
    },
    {
      "epoch": 0.4892849565032888,
      "grad_norm": 0.7876247230310033,
      "learning_rate": 4.980369240507907e-05,
      "loss": 2.2031,
      "num_input_tokens_seen": 3628568016,
      "step": 4612
    },
    {
      "epoch": 0.48939104604286016,
      "grad_norm": 0.6467452173824607,
      "learning_rate": 4.9803605474511305e-05,
      "loss": 2.1539,
      "num_input_tokens_seen": 3629354768,
      "step": 4613
    },
    {
      "epoch": 0.4894971355824316,
      "grad_norm": 0.7672938964350189,
      "learning_rate": 4.980351852477604e-05,
      "loss": 2.0354,
      "num_input_tokens_seen": 3630141584,
      "step": 4614
    },
    {
      "epoch": 0.489603225122003,
      "grad_norm": 0.5316547076648133,
      "learning_rate": 4.9803431555873344e-05,
      "loss": 1.926,
      "num_input_tokens_seen": 3630928368,
      "step": 4615
    },
    {
      "epoch": 0.48970931466157436,
      "grad_norm": 0.5391725958931162,
      "learning_rate": 4.980334456780328e-05,
      "loss": 2.1001,
      "num_input_tokens_seen": 3631714992,
      "step": 4616
    },
    {
      "epoch": 0.4898154042011458,
      "grad_norm": 0.8694572052892486,
      "learning_rate": 4.980325756056593e-05,
      "loss": 2.1948,
      "num_input_tokens_seen": 3632501712,
      "step": 4617
    },
    {
      "epoch": 0.48992149374071714,
      "grad_norm": 1.3508797682792406,
      "learning_rate": 4.9803170534161334e-05,
      "loss": 2.0607,
      "num_input_tokens_seen": 3633288464,
      "step": 4618
    },
    {
      "epoch": 0.49002758328028856,
      "grad_norm": 0.7733734863600749,
      "learning_rate": 4.9803083488589595e-05,
      "loss": 2.0195,
      "num_input_tokens_seen": 3634075312,
      "step": 4619
    },
    {
      "epoch": 0.49013367281986,
      "grad_norm": 0.6932521549497608,
      "learning_rate": 4.9802996423850746e-05,
      "loss": 2.0048,
      "num_input_tokens_seen": 3634862032,
      "step": 4620
    },
    {
      "epoch": 0.49023976235943134,
      "grad_norm": 0.5626519264217007,
      "learning_rate": 4.980290933994488e-05,
      "loss": 2.0034,
      "num_input_tokens_seen": 3635648848,
      "step": 4621
    },
    {
      "epoch": 0.49034585189900276,
      "grad_norm": 0.5734786583748054,
      "learning_rate": 4.980282223687204e-05,
      "loss": 2.1488,
      "num_input_tokens_seen": 3636435584,
      "step": 4622
    },
    {
      "epoch": 0.4904519414385742,
      "grad_norm": 0.57064511833789,
      "learning_rate": 4.9802735114632315e-05,
      "loss": 1.9961,
      "num_input_tokens_seen": 3637222368,
      "step": 4623
    },
    {
      "epoch": 0.49055803097814554,
      "grad_norm": 0.6059096489214225,
      "learning_rate": 4.980264797322577e-05,
      "loss": 1.9947,
      "num_input_tokens_seen": 3638009152,
      "step": 4624
    },
    {
      "epoch": 0.49066412051771696,
      "grad_norm": 0.5736682908364321,
      "learning_rate": 4.9802560812652456e-05,
      "loss": 1.8487,
      "num_input_tokens_seen": 3638795968,
      "step": 4625
    },
    {
      "epoch": 0.4907702100572883,
      "grad_norm": 0.6509545199394362,
      "learning_rate": 4.9802473632912446e-05,
      "loss": 2.0747,
      "num_input_tokens_seen": 3639582704,
      "step": 4626
    },
    {
      "epoch": 0.49087629959685974,
      "grad_norm": 0.4711101411969229,
      "learning_rate": 4.980238643400583e-05,
      "loss": 2.1235,
      "num_input_tokens_seen": 3640369552,
      "step": 4627
    },
    {
      "epoch": 0.49098238913643116,
      "grad_norm": 0.6798780663683754,
      "learning_rate": 4.9802299215932645e-05,
      "loss": 2.242,
      "num_input_tokens_seen": 3641156208,
      "step": 4628
    },
    {
      "epoch": 0.4910884786760025,
      "grad_norm": 0.5280172639467643,
      "learning_rate": 4.9802211978692976e-05,
      "loss": 2.0588,
      "num_input_tokens_seen": 3641942928,
      "step": 4629
    },
    {
      "epoch": 0.49119456821557395,
      "grad_norm": 0.8467300039081295,
      "learning_rate": 4.980212472228688e-05,
      "loss": 2.1329,
      "num_input_tokens_seen": 3642729664,
      "step": 4630
    },
    {
      "epoch": 0.49130065775514536,
      "grad_norm": 0.6012860533800278,
      "learning_rate": 4.980203744671443e-05,
      "loss": 2.101,
      "num_input_tokens_seen": 3643516480,
      "step": 4631
    },
    {
      "epoch": 0.49140674729471673,
      "grad_norm": 0.7376035618868266,
      "learning_rate": 4.98019501519757e-05,
      "loss": 1.9933,
      "num_input_tokens_seen": 3644303232,
      "step": 4632
    },
    {
      "epoch": 0.49151283683428815,
      "grad_norm": 0.5874532172694987,
      "learning_rate": 4.980186283807075e-05,
      "loss": 2.145,
      "num_input_tokens_seen": 3645089936,
      "step": 4633
    },
    {
      "epoch": 0.4916189263738595,
      "grad_norm": 0.6110468931570447,
      "learning_rate": 4.980177550499964e-05,
      "loss": 2.1069,
      "num_input_tokens_seen": 3645876736,
      "step": 4634
    },
    {
      "epoch": 0.49172501591343093,
      "grad_norm": 0.6979162864587829,
      "learning_rate": 4.9801688152762455e-05,
      "loss": 2.0729,
      "num_input_tokens_seen": 3646663456,
      "step": 4635
    },
    {
      "epoch": 0.49183110545300235,
      "grad_norm": 0.645247210721268,
      "learning_rate": 4.9801600781359245e-05,
      "loss": 1.9444,
      "num_input_tokens_seen": 3647450256,
      "step": 4636
    },
    {
      "epoch": 0.4919371949925737,
      "grad_norm": 0.5941976869130059,
      "learning_rate": 4.980151339079009e-05,
      "loss": 2.0482,
      "num_input_tokens_seen": 3648237040,
      "step": 4637
    },
    {
      "epoch": 0.49204328453214513,
      "grad_norm": 0.5672563222995674,
      "learning_rate": 4.9801425981055056e-05,
      "loss": 1.9433,
      "num_input_tokens_seen": 3649023840,
      "step": 4638
    },
    {
      "epoch": 0.49214937407171655,
      "grad_norm": 0.44748310465020563,
      "learning_rate": 4.9801338552154206e-05,
      "loss": 2.0939,
      "num_input_tokens_seen": 3649810624,
      "step": 4639
    },
    {
      "epoch": 0.4922554636112879,
      "grad_norm": 0.6861840733630475,
      "learning_rate": 4.98012511040876e-05,
      "loss": 2.1476,
      "num_input_tokens_seen": 3650597408,
      "step": 4640
    },
    {
      "epoch": 0.49236155315085933,
      "grad_norm": 0.4767252821114796,
      "learning_rate": 4.980116363685533e-05,
      "loss": 1.9868,
      "num_input_tokens_seen": 3651384192,
      "step": 4641
    },
    {
      "epoch": 0.4924676426904307,
      "grad_norm": 0.908855626680865,
      "learning_rate": 4.980107615045744e-05,
      "loss": 2.185,
      "num_input_tokens_seen": 3652170896,
      "step": 4642
    },
    {
      "epoch": 0.4925737322300021,
      "grad_norm": 0.48640423382625725,
      "learning_rate": 4.980098864489401e-05,
      "loss": 1.967,
      "num_input_tokens_seen": 3652957568,
      "step": 4643
    },
    {
      "epoch": 0.49267982176957353,
      "grad_norm": 1.1749278076764778,
      "learning_rate": 4.98009011201651e-05,
      "loss": 2.1699,
      "num_input_tokens_seen": 3653744368,
      "step": 4644
    },
    {
      "epoch": 0.4927859113091449,
      "grad_norm": 0.918630934020709,
      "learning_rate": 4.9800813576270776e-05,
      "loss": 2.0537,
      "num_input_tokens_seen": 3654530992,
      "step": 4645
    },
    {
      "epoch": 0.4928920008487163,
      "grad_norm": 0.4970973476724573,
      "learning_rate": 4.9800726013211115e-05,
      "loss": 2.1182,
      "num_input_tokens_seen": 3655317792,
      "step": 4646
    },
    {
      "epoch": 0.49299809038828774,
      "grad_norm": 0.7382143635282167,
      "learning_rate": 4.980063843098619e-05,
      "loss": 2.0382,
      "num_input_tokens_seen": 3656104560,
      "step": 4647
    },
    {
      "epoch": 0.4931041799278591,
      "grad_norm": 1.5766451755173962,
      "learning_rate": 4.980055082959605e-05,
      "loss": 1.9668,
      "num_input_tokens_seen": 3656891344,
      "step": 4648
    },
    {
      "epoch": 0.4932102694674305,
      "grad_norm": 0.48235731302670876,
      "learning_rate": 4.980046320904077e-05,
      "loss": 1.8978,
      "num_input_tokens_seen": 3657678112,
      "step": 4649
    },
    {
      "epoch": 0.49331635900700194,
      "grad_norm": 1.050121321740685,
      "learning_rate": 4.9800375569320426e-05,
      "loss": 2.0107,
      "num_input_tokens_seen": 3658464944,
      "step": 4650
    },
    {
      "epoch": 0.4934224485465733,
      "grad_norm": 0.582695989044782,
      "learning_rate": 4.9800287910435074e-05,
      "loss": 2.0764,
      "num_input_tokens_seen": 3659251744,
      "step": 4651
    },
    {
      "epoch": 0.4935285380861447,
      "grad_norm": 0.6371435431045273,
      "learning_rate": 4.9800200232384795e-05,
      "loss": 2.0288,
      "num_input_tokens_seen": 3660038576,
      "step": 4652
    },
    {
      "epoch": 0.4936346276257161,
      "grad_norm": 0.6291776783036678,
      "learning_rate": 4.9800112535169643e-05,
      "loss": 2.115,
      "num_input_tokens_seen": 3660825360,
      "step": 4653
    },
    {
      "epoch": 0.4937407171652875,
      "grad_norm": 0.42364295473784547,
      "learning_rate": 4.9800024818789694e-05,
      "loss": 1.9225,
      "num_input_tokens_seen": 3661612144,
      "step": 4654
    },
    {
      "epoch": 0.4938468067048589,
      "grad_norm": 0.9685056235123581,
      "learning_rate": 4.979993708324501e-05,
      "loss": 2.1715,
      "num_input_tokens_seen": 3662398896,
      "step": 4655
    },
    {
      "epoch": 0.4939528962444303,
      "grad_norm": 0.6126384425319847,
      "learning_rate": 4.9799849328535665e-05,
      "loss": 2.0096,
      "num_input_tokens_seen": 3663185728,
      "step": 4656
    },
    {
      "epoch": 0.4940589857840017,
      "grad_norm": 0.8122197304562451,
      "learning_rate": 4.979976155466173e-05,
      "loss": 2.0098,
      "num_input_tokens_seen": 3663972544,
      "step": 4657
    },
    {
      "epoch": 0.4941650753235731,
      "grad_norm": 0.6050063062997765,
      "learning_rate": 4.979967376162326e-05,
      "loss": 1.9942,
      "num_input_tokens_seen": 3664759216,
      "step": 4658
    },
    {
      "epoch": 0.4942711648631445,
      "grad_norm": 0.9685842966814098,
      "learning_rate": 4.979958594942033e-05,
      "loss": 2.1565,
      "num_input_tokens_seen": 3665545920,
      "step": 4659
    },
    {
      "epoch": 0.4943772544027159,
      "grad_norm": 0.6690093439059834,
      "learning_rate": 4.9799498118053e-05,
      "loss": 2.1664,
      "num_input_tokens_seen": 3666332656,
      "step": 4660
    },
    {
      "epoch": 0.49448334394228727,
      "grad_norm": 0.7808348169845528,
      "learning_rate": 4.979941026752136e-05,
      "loss": 2.0485,
      "num_input_tokens_seen": 3667119408,
      "step": 4661
    },
    {
      "epoch": 0.4945894334818587,
      "grad_norm": 0.5781222761538177,
      "learning_rate": 4.979932239782545e-05,
      "loss": 1.9149,
      "num_input_tokens_seen": 3667906208,
      "step": 4662
    },
    {
      "epoch": 0.4946955230214301,
      "grad_norm": 0.5278590208372296,
      "learning_rate": 4.979923450896536e-05,
      "loss": 2.1806,
      "num_input_tokens_seen": 3668693008,
      "step": 4663
    },
    {
      "epoch": 0.49480161256100147,
      "grad_norm": 0.7900053523457718,
      "learning_rate": 4.9799146600941146e-05,
      "loss": 2.0569,
      "num_input_tokens_seen": 3669479696,
      "step": 4664
    },
    {
      "epoch": 0.4949077021005729,
      "grad_norm": 0.5237991435717891,
      "learning_rate": 4.9799058673752884e-05,
      "loss": 2.1097,
      "num_input_tokens_seen": 3670266496,
      "step": 4665
    },
    {
      "epoch": 0.4950137916401443,
      "grad_norm": 0.7993584818236658,
      "learning_rate": 4.9798970727400636e-05,
      "loss": 1.9564,
      "num_input_tokens_seen": 3671053328,
      "step": 4666
    },
    {
      "epoch": 0.49511988117971567,
      "grad_norm": 0.6038487024523568,
      "learning_rate": 4.979888276188447e-05,
      "loss": 2.102,
      "num_input_tokens_seen": 3671840224,
      "step": 4667
    },
    {
      "epoch": 0.4952259707192871,
      "grad_norm": 0.5157301479553447,
      "learning_rate": 4.979879477720445e-05,
      "loss": 2.0464,
      "num_input_tokens_seen": 3672626992,
      "step": 4668
    },
    {
      "epoch": 0.49533206025885845,
      "grad_norm": 0.46551755654020127,
      "learning_rate": 4.9798706773360655e-05,
      "loss": 1.9788,
      "num_input_tokens_seen": 3673413792,
      "step": 4669
    },
    {
      "epoch": 0.49543814979842987,
      "grad_norm": 0.6940851674711634,
      "learning_rate": 4.9798618750353146e-05,
      "loss": 2.0279,
      "num_input_tokens_seen": 3674200624,
      "step": 4670
    },
    {
      "epoch": 0.4955442393380013,
      "grad_norm": 0.6429503133223421,
      "learning_rate": 4.979853070818199e-05,
      "loss": 1.9966,
      "num_input_tokens_seen": 3674987392,
      "step": 4671
    },
    {
      "epoch": 0.49565032887757265,
      "grad_norm": 0.695865376071179,
      "learning_rate": 4.9798442646847256e-05,
      "loss": 1.9962,
      "num_input_tokens_seen": 3675774176,
      "step": 4672
    },
    {
      "epoch": 0.4957564184171441,
      "grad_norm": 0.5757383216658929,
      "learning_rate": 4.979835456634901e-05,
      "loss": 1.9122,
      "num_input_tokens_seen": 3676561056,
      "step": 4673
    },
    {
      "epoch": 0.4958625079567155,
      "grad_norm": 0.7903910399188494,
      "learning_rate": 4.979826646668734e-05,
      "loss": 2.0233,
      "num_input_tokens_seen": 3677347840,
      "step": 4674
    },
    {
      "epoch": 0.49596859749628686,
      "grad_norm": 0.510567392583532,
      "learning_rate": 4.9798178347862276e-05,
      "loss": 2.1511,
      "num_input_tokens_seen": 3678134656,
      "step": 4675
    },
    {
      "epoch": 0.4960746870358583,
      "grad_norm": 0.6975147911932481,
      "learning_rate": 4.979809020987393e-05,
      "loss": 2.106,
      "num_input_tokens_seen": 3678921376,
      "step": 4676
    },
    {
      "epoch": 0.49618077657542964,
      "grad_norm": 0.4731819618781142,
      "learning_rate": 4.9798002052722324e-05,
      "loss": 2.0227,
      "num_input_tokens_seen": 3679708176,
      "step": 4677
    },
    {
      "epoch": 0.49628686611500106,
      "grad_norm": 0.5836731439246716,
      "learning_rate": 4.9797913876407564e-05,
      "loss": 1.8781,
      "num_input_tokens_seen": 3680494992,
      "step": 4678
    },
    {
      "epoch": 0.4963929556545725,
      "grad_norm": 0.8474798247585826,
      "learning_rate": 4.97978256809297e-05,
      "loss": 2.0127,
      "num_input_tokens_seen": 3681281808,
      "step": 4679
    },
    {
      "epoch": 0.49649904519414384,
      "grad_norm": 0.5199919182192604,
      "learning_rate": 4.9797737466288805e-05,
      "loss": 2.0794,
      "num_input_tokens_seen": 3682068672,
      "step": 4680
    },
    {
      "epoch": 0.49660513473371526,
      "grad_norm": 0.7846655527313513,
      "learning_rate": 4.979764923248494e-05,
      "loss": 1.8745,
      "num_input_tokens_seen": 3682855504,
      "step": 4681
    },
    {
      "epoch": 0.4967112242732867,
      "grad_norm": 0.5530348131069496,
      "learning_rate": 4.979756097951819e-05,
      "loss": 2.1765,
      "num_input_tokens_seen": 3683642320,
      "step": 4682
    },
    {
      "epoch": 0.49681731381285804,
      "grad_norm": 0.5759038811672278,
      "learning_rate": 4.9797472707388604e-05,
      "loss": 2.0876,
      "num_input_tokens_seen": 3684428976,
      "step": 4683
    },
    {
      "epoch": 0.49692340335242946,
      "grad_norm": 0.6117951431540141,
      "learning_rate": 4.979738441609626e-05,
      "loss": 2.1859,
      "num_input_tokens_seen": 3685215712,
      "step": 4684
    },
    {
      "epoch": 0.4970294928920008,
      "grad_norm": 0.6785630579724058,
      "learning_rate": 4.979729610564123e-05,
      "loss": 1.9052,
      "num_input_tokens_seen": 3686002480,
      "step": 4685
    },
    {
      "epoch": 0.49713558243157224,
      "grad_norm": 0.7553995967299947,
      "learning_rate": 4.979720777602358e-05,
      "loss": 1.9655,
      "num_input_tokens_seen": 3686789184,
      "step": 4686
    },
    {
      "epoch": 0.49724167197114366,
      "grad_norm": 0.7997896552234413,
      "learning_rate": 4.979711942724337e-05,
      "loss": 2.1024,
      "num_input_tokens_seen": 3687575968,
      "step": 4687
    },
    {
      "epoch": 0.497347761510715,
      "grad_norm": 0.6077535205912412,
      "learning_rate": 4.979703105930067e-05,
      "loss": 2.0451,
      "num_input_tokens_seen": 3688362640,
      "step": 4688
    },
    {
      "epoch": 0.49745385105028644,
      "grad_norm": 0.5026691266662154,
      "learning_rate": 4.9796942672195554e-05,
      "loss": 1.9173,
      "num_input_tokens_seen": 3689149504,
      "step": 4689
    },
    {
      "epoch": 0.49755994058985786,
      "grad_norm": 0.6714925823074648,
      "learning_rate": 4.9796854265928086e-05,
      "loss": 1.9514,
      "num_input_tokens_seen": 3689936336,
      "step": 4690
    },
    {
      "epoch": 0.4976660301294292,
      "grad_norm": 0.5224892565058241,
      "learning_rate": 4.979676584049834e-05,
      "loss": 1.9737,
      "num_input_tokens_seen": 3690723152,
      "step": 4691
    },
    {
      "epoch": 0.49777211966900065,
      "grad_norm": 0.6790802416140852,
      "learning_rate": 4.9796677395906385e-05,
      "loss": 2.0999,
      "num_input_tokens_seen": 3691509952,
      "step": 4692
    },
    {
      "epoch": 0.497878209208572,
      "grad_norm": 0.5724712065743668,
      "learning_rate": 4.9796588932152275e-05,
      "loss": 1.9591,
      "num_input_tokens_seen": 3692296704,
      "step": 4693
    },
    {
      "epoch": 0.49798429874814343,
      "grad_norm": 0.5469097551718124,
      "learning_rate": 4.97965004492361e-05,
      "loss": 1.9147,
      "num_input_tokens_seen": 3693083424,
      "step": 4694
    },
    {
      "epoch": 0.49809038828771485,
      "grad_norm": 0.5160936766160568,
      "learning_rate": 4.9796411947157906e-05,
      "loss": 2.1264,
      "num_input_tokens_seen": 3693870144,
      "step": 4695
    },
    {
      "epoch": 0.4981964778272862,
      "grad_norm": 0.8617501771466262,
      "learning_rate": 4.979632342591778e-05,
      "loss": 1.9439,
      "num_input_tokens_seen": 3694656880,
      "step": 4696
    },
    {
      "epoch": 0.49830256736685763,
      "grad_norm": 0.5836418414707422,
      "learning_rate": 4.979623488551578e-05,
      "loss": 2.0071,
      "num_input_tokens_seen": 3695443648,
      "step": 4697
    },
    {
      "epoch": 0.49840865690642905,
      "grad_norm": 0.8703329036572377,
      "learning_rate": 4.9796146325951975e-05,
      "loss": 2.1812,
      "num_input_tokens_seen": 3696230384,
      "step": 4698
    },
    {
      "epoch": 0.4985147464460004,
      "grad_norm": 0.5622421135429162,
      "learning_rate": 4.979605774722644e-05,
      "loss": 2.0724,
      "num_input_tokens_seen": 3697017136,
      "step": 4699
    },
    {
      "epoch": 0.49862083598557183,
      "grad_norm": 0.8746451904791115,
      "learning_rate": 4.979596914933924e-05,
      "loss": 1.9166,
      "num_input_tokens_seen": 3697803952,
      "step": 4700
    },
    {
      "epoch": 0.4987269255251432,
      "grad_norm": 0.4675014366409336,
      "learning_rate": 4.979588053229044e-05,
      "loss": 1.8272,
      "num_input_tokens_seen": 3698590768,
      "step": 4701
    },
    {
      "epoch": 0.4988330150647146,
      "grad_norm": 0.7978354530826454,
      "learning_rate": 4.9795791896080116e-05,
      "loss": 2.1959,
      "num_input_tokens_seen": 3699377520,
      "step": 4702
    },
    {
      "epoch": 0.49893910460428603,
      "grad_norm": 0.9556834753205291,
      "learning_rate": 4.979570324070832e-05,
      "loss": 2.0687,
      "num_input_tokens_seen": 3700164288,
      "step": 4703
    },
    {
      "epoch": 0.4990451941438574,
      "grad_norm": 0.7838693168055072,
      "learning_rate": 4.9795614566175145e-05,
      "loss": 1.9665,
      "num_input_tokens_seen": 3700951104,
      "step": 4704
    },
    {
      "epoch": 0.4991512836834288,
      "grad_norm": 0.5655643937361294,
      "learning_rate": 4.979552587248064e-05,
      "loss": 1.9307,
      "num_input_tokens_seen": 3701737824,
      "step": 4705
    },
    {
      "epoch": 0.49925737322300023,
      "grad_norm": 0.605989372530282,
      "learning_rate": 4.979543715962488e-05,
      "loss": 1.9259,
      "num_input_tokens_seen": 3702524624,
      "step": 4706
    },
    {
      "epoch": 0.4993634627625716,
      "grad_norm": 0.5309013039523482,
      "learning_rate": 4.979534842760793e-05,
      "loss": 1.9966,
      "num_input_tokens_seen": 3703311424,
      "step": 4707
    },
    {
      "epoch": 0.499469552302143,
      "grad_norm": 0.475995864925615,
      "learning_rate": 4.9795259676429875e-05,
      "loss": 1.9701,
      "num_input_tokens_seen": 3704098272,
      "step": 4708
    },
    {
      "epoch": 0.4995756418417144,
      "grad_norm": 0.5067024736792289,
      "learning_rate": 4.979517090609076e-05,
      "loss": 2.1736,
      "num_input_tokens_seen": 3704884880,
      "step": 4709
    },
    {
      "epoch": 0.4996817313812858,
      "grad_norm": 0.5062585890664878,
      "learning_rate": 4.979508211659067e-05,
      "loss": 1.9967,
      "num_input_tokens_seen": 3705671712,
      "step": 4710
    },
    {
      "epoch": 0.4997878209208572,
      "grad_norm": 0.48928380541101507,
      "learning_rate": 4.979499330792966e-05,
      "loss": 2.0564,
      "num_input_tokens_seen": 3706458560,
      "step": 4711
    },
    {
      "epoch": 0.4998939104604286,
      "grad_norm": 0.4705338721878105,
      "learning_rate": 4.979490448010782e-05,
      "loss": 1.889,
      "num_input_tokens_seen": 3707245440,
      "step": 4712
    },
    {
      "epoch": 0.5,
      "grad_norm": 0.4402999827039151,
      "learning_rate": 4.979481563312519e-05,
      "loss": 1.9492,
      "num_input_tokens_seen": 3708032176,
      "step": 4713
    },
    {
      "epoch": 0.5001060895395714,
      "grad_norm": 0.4503360613913614,
      "learning_rate": 4.9794726766981866e-05,
      "loss": 1.9739,
      "num_input_tokens_seen": 3708819008,
      "step": 4714
    },
    {
      "epoch": 0.5002121790791428,
      "grad_norm": 0.5243700053287751,
      "learning_rate": 4.9794637881677896e-05,
      "loss": 2.0803,
      "num_input_tokens_seen": 3709605792,
      "step": 4715
    },
    {
      "epoch": 0.5003182686187142,
      "grad_norm": 0.4575810717260999,
      "learning_rate": 4.979454897721336e-05,
      "loss": 1.9369,
      "num_input_tokens_seen": 3710392592,
      "step": 4716
    },
    {
      "epoch": 0.5004243581582856,
      "grad_norm": 0.5507726220814764,
      "learning_rate": 4.9794460053588335e-05,
      "loss": 1.8787,
      "num_input_tokens_seen": 3711179344,
      "step": 4717
    },
    {
      "epoch": 0.500530447697857,
      "grad_norm": 0.48612529760866124,
      "learning_rate": 4.979437111080286e-05,
      "loss": 2.076,
      "num_input_tokens_seen": 3711966096,
      "step": 4718
    },
    {
      "epoch": 0.5006365372374284,
      "grad_norm": 0.5693976446401012,
      "learning_rate": 4.979428214885704e-05,
      "loss": 1.9207,
      "num_input_tokens_seen": 3712752880,
      "step": 4719
    },
    {
      "epoch": 0.5007426267769998,
      "grad_norm": 0.43362125052164713,
      "learning_rate": 4.979419316775091e-05,
      "loss": 2.0378,
      "num_input_tokens_seen": 3713539680,
      "step": 4720
    },
    {
      "epoch": 0.5008487163165712,
      "grad_norm": 0.4625045199008062,
      "learning_rate": 4.9794104167484566e-05,
      "loss": 2.1863,
      "num_input_tokens_seen": 3714326400,
      "step": 4721
    },
    {
      "epoch": 0.5009548058561426,
      "grad_norm": 0.6734543307988684,
      "learning_rate": 4.9794015148058065e-05,
      "loss": 2.1126,
      "num_input_tokens_seen": 3715113104,
      "step": 4722
    },
    {
      "epoch": 0.501060895395714,
      "grad_norm": 0.7606502207329423,
      "learning_rate": 4.9793926109471475e-05,
      "loss": 2.1062,
      "num_input_tokens_seen": 3715899856,
      "step": 4723
    },
    {
      "epoch": 0.5011669849352853,
      "grad_norm": 0.5851464707654107,
      "learning_rate": 4.9793837051724865e-05,
      "loss": 2.1066,
      "num_input_tokens_seen": 3716686624,
      "step": 4724
    },
    {
      "epoch": 0.5012730744748568,
      "grad_norm": 0.4581004632019193,
      "learning_rate": 4.979374797481831e-05,
      "loss": 2.1391,
      "num_input_tokens_seen": 3717473328,
      "step": 4725
    },
    {
      "epoch": 0.5013791640144282,
      "grad_norm": 0.46970566178763606,
      "learning_rate": 4.979365887875187e-05,
      "loss": 2.1039,
      "num_input_tokens_seen": 3718260160,
      "step": 4726
    },
    {
      "epoch": 0.5014852535539995,
      "grad_norm": 0.7129974986586234,
      "learning_rate": 4.9793569763525615e-05,
      "loss": 2.0193,
      "num_input_tokens_seen": 3719046928,
      "step": 4727
    },
    {
      "epoch": 0.501591343093571,
      "grad_norm": 0.43534134174917516,
      "learning_rate": 4.979348062913962e-05,
      "loss": 2.0211,
      "num_input_tokens_seen": 3719833696,
      "step": 4728
    },
    {
      "epoch": 0.5016974326331424,
      "grad_norm": 0.6159940286610068,
      "learning_rate": 4.9793391475593955e-05,
      "loss": 2.0085,
      "num_input_tokens_seen": 3720620368,
      "step": 4729
    },
    {
      "epoch": 0.5018035221727137,
      "grad_norm": 0.5776455246361398,
      "learning_rate": 4.979330230288868e-05,
      "loss": 1.8154,
      "num_input_tokens_seen": 3721407248,
      "step": 4730
    },
    {
      "epoch": 0.5019096117122852,
      "grad_norm": 0.5826502179253092,
      "learning_rate": 4.979321311102386e-05,
      "loss": 2.045,
      "num_input_tokens_seen": 3722193936,
      "step": 4731
    },
    {
      "epoch": 0.5020157012518566,
      "grad_norm": 1.2480306745269882,
      "learning_rate": 4.979312389999958e-05,
      "loss": 2.1654,
      "num_input_tokens_seen": 3722980720,
      "step": 4732
    },
    {
      "epoch": 0.5021217907914279,
      "grad_norm": 0.7736220015561758,
      "learning_rate": 4.979303466981591e-05,
      "loss": 1.9765,
      "num_input_tokens_seen": 3723767600,
      "step": 4733
    },
    {
      "epoch": 0.5022278803309994,
      "grad_norm": 0.705942867048448,
      "learning_rate": 4.97929454204729e-05,
      "loss": 1.9039,
      "num_input_tokens_seen": 3724554368,
      "step": 4734
    },
    {
      "epoch": 0.5023339698705708,
      "grad_norm": 0.6733545053013398,
      "learning_rate": 4.9792856151970635e-05,
      "loss": 2.1297,
      "num_input_tokens_seen": 3725341072,
      "step": 4735
    },
    {
      "epoch": 0.5024400594101421,
      "grad_norm": 0.770469542765957,
      "learning_rate": 4.979276686430917e-05,
      "loss": 2.0074,
      "num_input_tokens_seen": 3726127840,
      "step": 4736
    },
    {
      "epoch": 0.5025461489497136,
      "grad_norm": 0.4988412663019352,
      "learning_rate": 4.979267755748859e-05,
      "loss": 2.0774,
      "num_input_tokens_seen": 3726914576,
      "step": 4737
    },
    {
      "epoch": 0.502652238489285,
      "grad_norm": 0.6590315720564603,
      "learning_rate": 4.9792588231508953e-05,
      "loss": 2.1397,
      "num_input_tokens_seen": 3727701312,
      "step": 4738
    },
    {
      "epoch": 0.5027583280288563,
      "grad_norm": 0.6036983643356459,
      "learning_rate": 4.979249888637033e-05,
      "loss": 2.1085,
      "num_input_tokens_seen": 3728488128,
      "step": 4739
    },
    {
      "epoch": 0.5028644175684277,
      "grad_norm": 0.6188805256525892,
      "learning_rate": 4.9792409522072795e-05,
      "loss": 2.1621,
      "num_input_tokens_seen": 3729274816,
      "step": 4740
    },
    {
      "epoch": 0.5029705071079992,
      "grad_norm": 0.8319106253881827,
      "learning_rate": 4.979232013861641e-05,
      "loss": 1.8648,
      "num_input_tokens_seen": 3730061696,
      "step": 4741
    },
    {
      "epoch": 0.5030765966475705,
      "grad_norm": 0.5741257409221973,
      "learning_rate": 4.979223073600125e-05,
      "loss": 1.829,
      "num_input_tokens_seen": 3730848576,
      "step": 4742
    },
    {
      "epoch": 0.5031826861871419,
      "grad_norm": 1.3215435594897305,
      "learning_rate": 4.979214131422738e-05,
      "loss": 1.9714,
      "num_input_tokens_seen": 3731635280,
      "step": 4743
    },
    {
      "epoch": 0.5032887757267134,
      "grad_norm": 0.676339659435282,
      "learning_rate": 4.979205187329487e-05,
      "loss": 2.0382,
      "num_input_tokens_seen": 3732421904,
      "step": 4744
    },
    {
      "epoch": 0.5033948652662847,
      "grad_norm": 1.2405883522507086,
      "learning_rate": 4.979196241320379e-05,
      "loss": 2.1245,
      "num_input_tokens_seen": 3733208608,
      "step": 4745
    },
    {
      "epoch": 0.5035009548058561,
      "grad_norm": 0.5469401271272912,
      "learning_rate": 4.979187293395421e-05,
      "loss": 1.7242,
      "num_input_tokens_seen": 3733995392,
      "step": 4746
    },
    {
      "epoch": 0.5036070443454276,
      "grad_norm": 1.0226172811620213,
      "learning_rate": 4.9791783435546205e-05,
      "loss": 2.011,
      "num_input_tokens_seen": 3734782160,
      "step": 4747
    },
    {
      "epoch": 0.5037131338849989,
      "grad_norm": 0.6584330009062098,
      "learning_rate": 4.9791693917979824e-05,
      "loss": 1.9002,
      "num_input_tokens_seen": 3735568912,
      "step": 4748
    },
    {
      "epoch": 0.5038192234245703,
      "grad_norm": 1.232247279544789,
      "learning_rate": 4.979160438125515e-05,
      "loss": 2.1619,
      "num_input_tokens_seen": 3736355600,
      "step": 4749
    },
    {
      "epoch": 0.5039253129641418,
      "grad_norm": 0.5991451612459503,
      "learning_rate": 4.9791514825372266e-05,
      "loss": 1.966,
      "num_input_tokens_seen": 3737142384,
      "step": 4750
    },
    {
      "epoch": 0.5040314025037131,
      "grad_norm": 1.1524127091625234,
      "learning_rate": 4.979142525033122e-05,
      "loss": 2.2032,
      "num_input_tokens_seen": 3737929072,
      "step": 4751
    },
    {
      "epoch": 0.5041374920432845,
      "grad_norm": 0.7189413749277671,
      "learning_rate": 4.979133565613208e-05,
      "loss": 2.1437,
      "num_input_tokens_seen": 3738715856,
      "step": 4752
    },
    {
      "epoch": 0.504243581582856,
      "grad_norm": 0.5757020874839528,
      "learning_rate": 4.979124604277493e-05,
      "loss": 1.9017,
      "num_input_tokens_seen": 3739502576,
      "step": 4753
    },
    {
      "epoch": 0.5043496711224273,
      "grad_norm": 0.9409478583550795,
      "learning_rate": 4.979115641025983e-05,
      "loss": 2.1098,
      "num_input_tokens_seen": 3740289360,
      "step": 4754
    },
    {
      "epoch": 0.5044557606619987,
      "grad_norm": 0.8625571042015698,
      "learning_rate": 4.9791066758586857e-05,
      "loss": 2.0615,
      "num_input_tokens_seen": 3741076128,
      "step": 4755
    },
    {
      "epoch": 0.5045618502015701,
      "grad_norm": 0.6921526706344674,
      "learning_rate": 4.979097708775607e-05,
      "loss": 2.2627,
      "num_input_tokens_seen": 3741862816,
      "step": 4756
    },
    {
      "epoch": 0.5046679397411415,
      "grad_norm": 0.6133199516698,
      "learning_rate": 4.9790887397767535e-05,
      "loss": 1.9055,
      "num_input_tokens_seen": 3742649552,
      "step": 4757
    },
    {
      "epoch": 0.5047740292807129,
      "grad_norm": 0.532552231164066,
      "learning_rate": 4.979079768862135e-05,
      "loss": 2.1124,
      "num_input_tokens_seen": 3743436288,
      "step": 4758
    },
    {
      "epoch": 0.5048801188202843,
      "grad_norm": 0.7082588904190035,
      "learning_rate": 4.979070796031755e-05,
      "loss": 2.0162,
      "num_input_tokens_seen": 3744223040,
      "step": 4759
    },
    {
      "epoch": 0.5049862083598557,
      "grad_norm": 0.5318545995255695,
      "learning_rate": 4.979061821285622e-05,
      "loss": 2.0262,
      "num_input_tokens_seen": 3745009856,
      "step": 4760
    },
    {
      "epoch": 0.5050922978994271,
      "grad_norm": 0.5675181935868341,
      "learning_rate": 4.979052844623743e-05,
      "loss": 2.158,
      "num_input_tokens_seen": 3745796592,
      "step": 4761
    },
    {
      "epoch": 0.5051983874389985,
      "grad_norm": 0.5190696313537763,
      "learning_rate": 4.979043866046125e-05,
      "loss": 2.0415,
      "num_input_tokens_seen": 3746583440,
      "step": 4762
    },
    {
      "epoch": 0.50530447697857,
      "grad_norm": 0.4948006323435328,
      "learning_rate": 4.9790348855527734e-05,
      "loss": 1.881,
      "num_input_tokens_seen": 3747370192,
      "step": 4763
    },
    {
      "epoch": 0.5054105665181413,
      "grad_norm": 0.4675381298889284,
      "learning_rate": 4.9790259031436975e-05,
      "loss": 1.9915,
      "num_input_tokens_seen": 3748156944,
      "step": 4764
    },
    {
      "epoch": 0.5055166560577127,
      "grad_norm": 0.455229652514761,
      "learning_rate": 4.979016918818903e-05,
      "loss": 1.8213,
      "num_input_tokens_seen": 3748943760,
      "step": 4765
    },
    {
      "epoch": 0.5056227455972842,
      "grad_norm": 0.45981297524925313,
      "learning_rate": 4.979007932578397e-05,
      "loss": 2.1551,
      "num_input_tokens_seen": 3749730544,
      "step": 4766
    },
    {
      "epoch": 0.5057288351368555,
      "grad_norm": 0.5035246933567334,
      "learning_rate": 4.978998944422186e-05,
      "loss": 1.9567,
      "num_input_tokens_seen": 3750517376,
      "step": 4767
    },
    {
      "epoch": 0.5058349246764269,
      "grad_norm": 0.4547027153599632,
      "learning_rate": 4.978989954350277e-05,
      "loss": 2.1081,
      "num_input_tokens_seen": 3751304112,
      "step": 4768
    },
    {
      "epoch": 0.5059410142159984,
      "grad_norm": 0.5446328173858105,
      "learning_rate": 4.978980962362678e-05,
      "loss": 2.1538,
      "num_input_tokens_seen": 3752090832,
      "step": 4769
    },
    {
      "epoch": 0.5060471037555697,
      "grad_norm": 0.601099383503768,
      "learning_rate": 4.978971968459396e-05,
      "loss": 2.1445,
      "num_input_tokens_seen": 3752877600,
      "step": 4770
    },
    {
      "epoch": 0.5061531932951411,
      "grad_norm": 0.6643593629651631,
      "learning_rate": 4.978962972640436e-05,
      "loss": 1.9846,
      "num_input_tokens_seen": 3753664368,
      "step": 4771
    },
    {
      "epoch": 0.5062592828347124,
      "grad_norm": 0.49463306443887306,
      "learning_rate": 4.9789539749058064e-05,
      "loss": 1.9762,
      "num_input_tokens_seen": 3754451152,
      "step": 4772
    },
    {
      "epoch": 0.5063653723742839,
      "grad_norm": 0.5554659293615625,
      "learning_rate": 4.978944975255514e-05,
      "loss": 2.2597,
      "num_input_tokens_seen": 3755237920,
      "step": 4773
    },
    {
      "epoch": 0.5064714619138553,
      "grad_norm": 0.5418679158480323,
      "learning_rate": 4.9789359736895655e-05,
      "loss": 2.078,
      "num_input_tokens_seen": 3756024800,
      "step": 4774
    },
    {
      "epoch": 0.5065775514534266,
      "grad_norm": 0.7017170697130763,
      "learning_rate": 4.978926970207968e-05,
      "loss": 1.8508,
      "num_input_tokens_seen": 3756811600,
      "step": 4775
    },
    {
      "epoch": 0.5066836409929981,
      "grad_norm": 0.5854219546679598,
      "learning_rate": 4.978917964810729e-05,
      "loss": 2.112,
      "num_input_tokens_seen": 3757598400,
      "step": 4776
    },
    {
      "epoch": 0.5067897305325695,
      "grad_norm": 0.9709731485162615,
      "learning_rate": 4.9789089574978545e-05,
      "loss": 2.2065,
      "num_input_tokens_seen": 3758385216,
      "step": 4777
    },
    {
      "epoch": 0.5068958200721408,
      "grad_norm": 0.6243567689604812,
      "learning_rate": 4.978899948269352e-05,
      "loss": 2.1114,
      "num_input_tokens_seen": 3759172000,
      "step": 4778
    },
    {
      "epoch": 0.5070019096117123,
      "grad_norm": 0.5231225400153806,
      "learning_rate": 4.978890937125228e-05,
      "loss": 2.1241,
      "num_input_tokens_seen": 3759958752,
      "step": 4779
    },
    {
      "epoch": 0.5071079991512837,
      "grad_norm": 0.453400820677565,
      "learning_rate": 4.978881924065491e-05,
      "loss": 2.0213,
      "num_input_tokens_seen": 3760745520,
      "step": 4780
    },
    {
      "epoch": 0.507214088690855,
      "grad_norm": 0.469425796338943,
      "learning_rate": 4.9788729090901454e-05,
      "loss": 2.0071,
      "num_input_tokens_seen": 3761532336,
      "step": 4781
    },
    {
      "epoch": 0.5073201782304265,
      "grad_norm": 0.4692804617245964,
      "learning_rate": 4.9788638921992e-05,
      "loss": 1.981,
      "num_input_tokens_seen": 3762319136,
      "step": 4782
    },
    {
      "epoch": 0.5074262677699979,
      "grad_norm": 0.7570360943356945,
      "learning_rate": 4.978854873392661e-05,
      "loss": 2.0042,
      "num_input_tokens_seen": 3763105968,
      "step": 4783
    },
    {
      "epoch": 0.5075323573095692,
      "grad_norm": 0.804187008415034,
      "learning_rate": 4.978845852670536e-05,
      "loss": 1.92,
      "num_input_tokens_seen": 3763892736,
      "step": 4784
    },
    {
      "epoch": 0.5076384468491407,
      "grad_norm": 0.4936593179167114,
      "learning_rate": 4.9788368300328317e-05,
      "loss": 2.04,
      "num_input_tokens_seen": 3764679504,
      "step": 4785
    },
    {
      "epoch": 0.5077445363887121,
      "grad_norm": 0.5592770819795593,
      "learning_rate": 4.9788278054795556e-05,
      "loss": 2.0079,
      "num_input_tokens_seen": 3765466352,
      "step": 4786
    },
    {
      "epoch": 0.5078506259282835,
      "grad_norm": 0.5231883196821894,
      "learning_rate": 4.978818779010713e-05,
      "loss": 1.9762,
      "num_input_tokens_seen": 3766253104,
      "step": 4787
    },
    {
      "epoch": 0.5079567154678549,
      "grad_norm": 0.8970270922519344,
      "learning_rate": 4.978809750626313e-05,
      "loss": 2.0793,
      "num_input_tokens_seen": 3767039920,
      "step": 4788
    },
    {
      "epoch": 0.5080628050074263,
      "grad_norm": 0.5453530553763832,
      "learning_rate": 4.978800720326361e-05,
      "loss": 1.9546,
      "num_input_tokens_seen": 3767826656,
      "step": 4789
    },
    {
      "epoch": 0.5081688945469977,
      "grad_norm": 1.5210032927463228,
      "learning_rate": 4.9787916881108644e-05,
      "loss": 1.9726,
      "num_input_tokens_seen": 3768613456,
      "step": 4790
    },
    {
      "epoch": 0.508274984086569,
      "grad_norm": 0.6580592335348759,
      "learning_rate": 4.978782653979831e-05,
      "loss": 2.0712,
      "num_input_tokens_seen": 3769400256,
      "step": 4791
    },
    {
      "epoch": 0.5083810736261405,
      "grad_norm": 0.6491314356815961,
      "learning_rate": 4.9787736179332667e-05,
      "loss": 1.8383,
      "num_input_tokens_seen": 3770187040,
      "step": 4792
    },
    {
      "epoch": 0.5084871631657119,
      "grad_norm": 0.7611717225357917,
      "learning_rate": 4.9787645799711785e-05,
      "loss": 2.1084,
      "num_input_tokens_seen": 3770973728,
      "step": 4793
    },
    {
      "epoch": 0.5085932527052832,
      "grad_norm": 0.5851408785514625,
      "learning_rate": 4.9787555400935735e-05,
      "loss": 2.0701,
      "num_input_tokens_seen": 3771760480,
      "step": 4794
    },
    {
      "epoch": 0.5086993422448547,
      "grad_norm": 1.0990838713966538,
      "learning_rate": 4.97874649830046e-05,
      "loss": 2.077,
      "num_input_tokens_seen": 3772547152,
      "step": 4795
    },
    {
      "epoch": 0.508805431784426,
      "grad_norm": 1.226509454255728,
      "learning_rate": 4.978737454591843e-05,
      "loss": 2.0336,
      "num_input_tokens_seen": 3773333888,
      "step": 4796
    },
    {
      "epoch": 0.5089115213239974,
      "grad_norm": 0.7207604988627394,
      "learning_rate": 4.978728408967731e-05,
      "loss": 1.9773,
      "num_input_tokens_seen": 3774120656,
      "step": 4797
    },
    {
      "epoch": 0.5090176108635689,
      "grad_norm": 0.7507080853805712,
      "learning_rate": 4.978719361428131e-05,
      "loss": 2.1347,
      "num_input_tokens_seen": 3774907440,
      "step": 4798
    },
    {
      "epoch": 0.5091237004031403,
      "grad_norm": 0.732857056196051,
      "learning_rate": 4.9787103119730483e-05,
      "loss": 1.9104,
      "num_input_tokens_seen": 3775694144,
      "step": 4799
    },
    {
      "epoch": 0.5092297899427116,
      "grad_norm": 0.6174149605683603,
      "learning_rate": 4.978701260602492e-05,
      "loss": 1.9008,
      "num_input_tokens_seen": 3776480960,
      "step": 4800
    },
    {
      "epoch": 0.5093358794822831,
      "grad_norm": 0.7406791251593916,
      "learning_rate": 4.978692207316467e-05,
      "loss": 1.9686,
      "num_input_tokens_seen": 3777267760,
      "step": 4801
    },
    {
      "epoch": 0.5094419690218545,
      "grad_norm": 0.9591100099218411,
      "learning_rate": 4.978683152114982e-05,
      "loss": 2.0565,
      "num_input_tokens_seen": 3778054544,
      "step": 4802
    },
    {
      "epoch": 0.5095480585614258,
      "grad_norm": 0.5556863401599552,
      "learning_rate": 4.978674094998043e-05,
      "loss": 2.1587,
      "num_input_tokens_seen": 3778841200,
      "step": 4803
    },
    {
      "epoch": 0.5096541481009973,
      "grad_norm": 0.8883040332755248,
      "learning_rate": 4.9786650359656585e-05,
      "loss": 2.0776,
      "num_input_tokens_seen": 3779627904,
      "step": 4804
    },
    {
      "epoch": 0.5097602376405687,
      "grad_norm": 0.6660249461149783,
      "learning_rate": 4.978655975017833e-05,
      "loss": 2.0702,
      "num_input_tokens_seen": 3780414592,
      "step": 4805
    },
    {
      "epoch": 0.50986632718014,
      "grad_norm": 0.7605950802215232,
      "learning_rate": 4.9786469121545755e-05,
      "loss": 2.088,
      "num_input_tokens_seen": 3781201408,
      "step": 4806
    },
    {
      "epoch": 0.5099724167197114,
      "grad_norm": 0.9205576050188837,
      "learning_rate": 4.978637847375892e-05,
      "loss": 2.2006,
      "num_input_tokens_seen": 3781988096,
      "step": 4807
    },
    {
      "epoch": 0.5100785062592829,
      "grad_norm": 0.7287744481922903,
      "learning_rate": 4.97862878068179e-05,
      "loss": 1.8977,
      "num_input_tokens_seen": 3782774928,
      "step": 4808
    },
    {
      "epoch": 0.5101845957988542,
      "grad_norm": 0.645902702209143,
      "learning_rate": 4.9786197120722774e-05,
      "loss": 1.9733,
      "num_input_tokens_seen": 3783561680,
      "step": 4809
    },
    {
      "epoch": 0.5102906853384256,
      "grad_norm": 0.6436732576926111,
      "learning_rate": 4.9786106415473595e-05,
      "loss": 1.9842,
      "num_input_tokens_seen": 3784348480,
      "step": 4810
    },
    {
      "epoch": 0.5103967748779971,
      "grad_norm": 0.5445345588872951,
      "learning_rate": 4.978601569107044e-05,
      "loss": 2.2143,
      "num_input_tokens_seen": 3785135264,
      "step": 4811
    },
    {
      "epoch": 0.5105028644175684,
      "grad_norm": 0.542988532035217,
      "learning_rate": 4.978592494751338e-05,
      "loss": 2.0081,
      "num_input_tokens_seen": 3785922144,
      "step": 4812
    },
    {
      "epoch": 0.5106089539571398,
      "grad_norm": 0.5114320092321467,
      "learning_rate": 4.9785834184802484e-05,
      "loss": 2.0626,
      "num_input_tokens_seen": 3786708960,
      "step": 4813
    },
    {
      "epoch": 0.5107150434967113,
      "grad_norm": 0.5736615961983709,
      "learning_rate": 4.9785743402937826e-05,
      "loss": 2.0286,
      "num_input_tokens_seen": 3787495792,
      "step": 4814
    },
    {
      "epoch": 0.5108211330362826,
      "grad_norm": 0.40797771489756,
      "learning_rate": 4.978565260191946e-05,
      "loss": 1.8572,
      "num_input_tokens_seen": 3788282640,
      "step": 4815
    },
    {
      "epoch": 0.510927222575854,
      "grad_norm": 0.4509163863429407,
      "learning_rate": 4.978556178174748e-05,
      "loss": 1.958,
      "num_input_tokens_seen": 3789069472,
      "step": 4816
    },
    {
      "epoch": 0.5110333121154255,
      "grad_norm": 0.5445295482850054,
      "learning_rate": 4.978547094242194e-05,
      "loss": 1.9976,
      "num_input_tokens_seen": 3789856256,
      "step": 4817
    },
    {
      "epoch": 0.5111394016549968,
      "grad_norm": 0.7678487621355731,
      "learning_rate": 4.978538008394292e-05,
      "loss": 2.099,
      "num_input_tokens_seen": 3790643024,
      "step": 4818
    },
    {
      "epoch": 0.5112454911945682,
      "grad_norm": 0.46510048472311494,
      "learning_rate": 4.978528920631049e-05,
      "loss": 2.0821,
      "num_input_tokens_seen": 3791429792,
      "step": 4819
    },
    {
      "epoch": 0.5113515807341397,
      "grad_norm": 0.8879051106970269,
      "learning_rate": 4.9785198309524704e-05,
      "loss": 2.023,
      "num_input_tokens_seen": 3792216560,
      "step": 4820
    },
    {
      "epoch": 0.511457670273711,
      "grad_norm": 0.5355740579962878,
      "learning_rate": 4.978510739358565e-05,
      "loss": 1.8756,
      "num_input_tokens_seen": 3793003328,
      "step": 4821
    },
    {
      "epoch": 0.5115637598132824,
      "grad_norm": 0.9976009278871325,
      "learning_rate": 4.9785016458493394e-05,
      "loss": 2.1584,
      "num_input_tokens_seen": 3793790000,
      "step": 4822
    },
    {
      "epoch": 0.5116698493528538,
      "grad_norm": 0.5545953485174583,
      "learning_rate": 4.9784925504248004e-05,
      "loss": 2.0018,
      "num_input_tokens_seen": 3794576800,
      "step": 4823
    },
    {
      "epoch": 0.5117759388924252,
      "grad_norm": 0.8838110095292752,
      "learning_rate": 4.9784834530849546e-05,
      "loss": 1.9516,
      "num_input_tokens_seen": 3795363552,
      "step": 4824
    },
    {
      "epoch": 0.5118820284319966,
      "grad_norm": 0.6712131122228189,
      "learning_rate": 4.97847435382981e-05,
      "loss": 2.0871,
      "num_input_tokens_seen": 3796150304,
      "step": 4825
    },
    {
      "epoch": 0.511988117971568,
      "grad_norm": 0.6466432936133579,
      "learning_rate": 4.9784652526593736e-05,
      "loss": 2.0584,
      "num_input_tokens_seen": 3796936960,
      "step": 4826
    },
    {
      "epoch": 0.5120942075111394,
      "grad_norm": 0.5890347739112723,
      "learning_rate": 4.9784561495736506e-05,
      "loss": 2.0423,
      "num_input_tokens_seen": 3797723680,
      "step": 4827
    },
    {
      "epoch": 0.5122002970507108,
      "grad_norm": 0.7658162694997882,
      "learning_rate": 4.9784470445726506e-05,
      "loss": 2.1326,
      "num_input_tokens_seen": 3798510416,
      "step": 4828
    },
    {
      "epoch": 0.5123063865902822,
      "grad_norm": 1.4087729764469752,
      "learning_rate": 4.978437937656379e-05,
      "loss": 2.1516,
      "num_input_tokens_seen": 3799297168,
      "step": 4829
    },
    {
      "epoch": 0.5124124761298536,
      "grad_norm": 0.6249499378214263,
      "learning_rate": 4.978428828824843e-05,
      "loss": 1.9835,
      "num_input_tokens_seen": 3800083888,
      "step": 4830
    },
    {
      "epoch": 0.512518565669425,
      "grad_norm": 1.6352255126456392,
      "learning_rate": 4.97841971807805e-05,
      "loss": 2.1441,
      "num_input_tokens_seen": 3800870560,
      "step": 4831
    },
    {
      "epoch": 0.5126246552089964,
      "grad_norm": 0.8753465675932408,
      "learning_rate": 4.978410605416007e-05,
      "loss": 2.0536,
      "num_input_tokens_seen": 3801657280,
      "step": 4832
    },
    {
      "epoch": 0.5127307447485678,
      "grad_norm": 0.804288276704185,
      "learning_rate": 4.978401490838722e-05,
      "loss": 2.0666,
      "num_input_tokens_seen": 3802444112,
      "step": 4833
    },
    {
      "epoch": 0.5128368342881392,
      "grad_norm": 0.9993422696753846,
      "learning_rate": 4.9783923743462e-05,
      "loss": 2.0987,
      "num_input_tokens_seen": 3803230992,
      "step": 4834
    },
    {
      "epoch": 0.5129429238277106,
      "grad_norm": 0.6419052578541675,
      "learning_rate": 4.978383255938449e-05,
      "loss": 2.0274,
      "num_input_tokens_seen": 3804017712,
      "step": 4835
    },
    {
      "epoch": 0.513049013367282,
      "grad_norm": 0.8121813020522607,
      "learning_rate": 4.978374135615477e-05,
      "loss": 2.1026,
      "num_input_tokens_seen": 3804804400,
      "step": 4836
    },
    {
      "epoch": 0.5131551029068534,
      "grad_norm": 0.7541317580663672,
      "learning_rate": 4.9783650133772895e-05,
      "loss": 2.0101,
      "num_input_tokens_seen": 3805591200,
      "step": 4837
    },
    {
      "epoch": 0.5132611924464248,
      "grad_norm": 0.6286212886635938,
      "learning_rate": 4.978355889223895e-05,
      "loss": 2.1079,
      "num_input_tokens_seen": 3806377936,
      "step": 4838
    },
    {
      "epoch": 0.5133672819859961,
      "grad_norm": 0.6016178572586598,
      "learning_rate": 4.978346763155298e-05,
      "loss": 1.9359,
      "num_input_tokens_seen": 3807164752,
      "step": 4839
    },
    {
      "epoch": 0.5134733715255676,
      "grad_norm": 0.4590209620035465,
      "learning_rate": 4.978337635171509e-05,
      "loss": 1.9683,
      "num_input_tokens_seen": 3807951408,
      "step": 4840
    },
    {
      "epoch": 0.513579461065139,
      "grad_norm": 0.8416080854534888,
      "learning_rate": 4.978328505272533e-05,
      "loss": 1.9766,
      "num_input_tokens_seen": 3808738160,
      "step": 4841
    },
    {
      "epoch": 0.5136855506047103,
      "grad_norm": 1.0047095208767365,
      "learning_rate": 4.9783193734583776e-05,
      "loss": 2.1694,
      "num_input_tokens_seen": 3809524832,
      "step": 4842
    },
    {
      "epoch": 0.5137916401442818,
      "grad_norm": 0.6384683489050138,
      "learning_rate": 4.978310239729049e-05,
      "loss": 2.0369,
      "num_input_tokens_seen": 3810311632,
      "step": 4843
    },
    {
      "epoch": 0.5138977296838532,
      "grad_norm": 0.6621665467682348,
      "learning_rate": 4.978301104084556e-05,
      "loss": 2.1094,
      "num_input_tokens_seen": 3811098432,
      "step": 4844
    },
    {
      "epoch": 0.5140038192234245,
      "grad_norm": 0.6514120008129218,
      "learning_rate": 4.978291966524904e-05,
      "loss": 1.955,
      "num_input_tokens_seen": 3811885200,
      "step": 4845
    },
    {
      "epoch": 0.514109908762996,
      "grad_norm": 0.5084376707873305,
      "learning_rate": 4.9782828270501005e-05,
      "loss": 2.1047,
      "num_input_tokens_seen": 3812671888,
      "step": 4846
    },
    {
      "epoch": 0.5142159983025674,
      "grad_norm": 0.6163432918320427,
      "learning_rate": 4.978273685660153e-05,
      "loss": 2.0829,
      "num_input_tokens_seen": 3813458640,
      "step": 4847
    },
    {
      "epoch": 0.5143220878421387,
      "grad_norm": 0.4746513821341133,
      "learning_rate": 4.9782645423550683e-05,
      "loss": 1.9734,
      "num_input_tokens_seen": 3814245440,
      "step": 4848
    },
    {
      "epoch": 0.5144281773817102,
      "grad_norm": 0.50765938103447,
      "learning_rate": 4.9782553971348535e-05,
      "loss": 1.973,
      "num_input_tokens_seen": 3815032080,
      "step": 4849
    },
    {
      "epoch": 0.5145342669212816,
      "grad_norm": 0.4916543369685251,
      "learning_rate": 4.9782462499995156e-05,
      "loss": 2.1004,
      "num_input_tokens_seen": 3815818768,
      "step": 4850
    },
    {
      "epoch": 0.5146403564608529,
      "grad_norm": 0.5979557709057869,
      "learning_rate": 4.978237100949061e-05,
      "loss": 1.8512,
      "num_input_tokens_seen": 3816605472,
      "step": 4851
    },
    {
      "epoch": 0.5147464460004244,
      "grad_norm": 0.5509989247558491,
      "learning_rate": 4.978227949983499e-05,
      "loss": 1.8433,
      "num_input_tokens_seen": 3817392240,
      "step": 4852
    },
    {
      "epoch": 0.5148525355399958,
      "grad_norm": 0.5503589078869751,
      "learning_rate": 4.978218797102834e-05,
      "loss": 2.0988,
      "num_input_tokens_seen": 3818179008,
      "step": 4853
    },
    {
      "epoch": 0.5149586250795671,
      "grad_norm": 0.5795151510284263,
      "learning_rate": 4.978209642307075e-05,
      "loss": 1.997,
      "num_input_tokens_seen": 3818965776,
      "step": 4854
    },
    {
      "epoch": 0.5150647146191386,
      "grad_norm": 0.6475232654925807,
      "learning_rate": 4.9782004855962284e-05,
      "loss": 2.0558,
      "num_input_tokens_seen": 3819752624,
      "step": 4855
    },
    {
      "epoch": 0.51517080415871,
      "grad_norm": 0.6073311170535037,
      "learning_rate": 4.9781913269703e-05,
      "loss": 2.1304,
      "num_input_tokens_seen": 3820539376,
      "step": 4856
    },
    {
      "epoch": 0.5152768936982813,
      "grad_norm": 0.6271221184293888,
      "learning_rate": 4.978182166429299e-05,
      "loss": 2.0782,
      "num_input_tokens_seen": 3821326208,
      "step": 4857
    },
    {
      "epoch": 0.5153829832378527,
      "grad_norm": 0.7081858226286847,
      "learning_rate": 4.978173003973231e-05,
      "loss": 2.0168,
      "num_input_tokens_seen": 3822112960,
      "step": 4858
    },
    {
      "epoch": 0.5154890727774242,
      "grad_norm": 0.47987162100331926,
      "learning_rate": 4.978163839602104e-05,
      "loss": 1.8695,
      "num_input_tokens_seen": 3822899744,
      "step": 4859
    },
    {
      "epoch": 0.5155951623169955,
      "grad_norm": 0.7638178074782145,
      "learning_rate": 4.9781546733159244e-05,
      "loss": 2.0284,
      "num_input_tokens_seen": 3823686576,
      "step": 4860
    },
    {
      "epoch": 0.5157012518565669,
      "grad_norm": 0.44555516693673153,
      "learning_rate": 4.9781455051147e-05,
      "loss": 2.0405,
      "num_input_tokens_seen": 3824473376,
      "step": 4861
    },
    {
      "epoch": 0.5158073413961384,
      "grad_norm": 0.7818154441423713,
      "learning_rate": 4.978136334998438e-05,
      "loss": 1.9591,
      "num_input_tokens_seen": 3825260096,
      "step": 4862
    },
    {
      "epoch": 0.5159134309357097,
      "grad_norm": 0.43897452820234495,
      "learning_rate": 4.9781271629671436e-05,
      "loss": 1.9211,
      "num_input_tokens_seen": 3826046960,
      "step": 4863
    },
    {
      "epoch": 0.5160195204752811,
      "grad_norm": 0.7351100052892019,
      "learning_rate": 4.978117989020826e-05,
      "loss": 1.9887,
      "num_input_tokens_seen": 3826833664,
      "step": 4864
    },
    {
      "epoch": 0.5161256100148526,
      "grad_norm": 0.6192597064904137,
      "learning_rate": 4.9781088131594914e-05,
      "loss": 2.0274,
      "num_input_tokens_seen": 3827620368,
      "step": 4865
    },
    {
      "epoch": 0.5162316995544239,
      "grad_norm": 0.5729084382503509,
      "learning_rate": 4.9780996353831465e-05,
      "loss": 1.9482,
      "num_input_tokens_seen": 3828407136,
      "step": 4866
    },
    {
      "epoch": 0.5163377890939953,
      "grad_norm": 0.6071468994404837,
      "learning_rate": 4.9780904556918e-05,
      "loss": 2.0558,
      "num_input_tokens_seen": 3829193792,
      "step": 4867
    },
    {
      "epoch": 0.5164438786335668,
      "grad_norm": 0.855098400661629,
      "learning_rate": 4.978081274085457e-05,
      "loss": 2.007,
      "num_input_tokens_seen": 3829980496,
      "step": 4868
    },
    {
      "epoch": 0.5165499681731381,
      "grad_norm": 0.5338410638173425,
      "learning_rate": 4.978072090564126e-05,
      "loss": 2.0584,
      "num_input_tokens_seen": 3830767280,
      "step": 4869
    },
    {
      "epoch": 0.5166560577127095,
      "grad_norm": 0.8289064975494486,
      "learning_rate": 4.978062905127813e-05,
      "loss": 2.1505,
      "num_input_tokens_seen": 3831553968,
      "step": 4870
    },
    {
      "epoch": 0.516762147252281,
      "grad_norm": 0.5266725806370444,
      "learning_rate": 4.978053717776526e-05,
      "loss": 1.9842,
      "num_input_tokens_seen": 3832340672,
      "step": 4871
    },
    {
      "epoch": 0.5168682367918523,
      "grad_norm": 0.6002461672302437,
      "learning_rate": 4.978044528510273e-05,
      "loss": 1.7654,
      "num_input_tokens_seen": 3833127472,
      "step": 4872
    },
    {
      "epoch": 0.5169743263314237,
      "grad_norm": 0.5249258033214554,
      "learning_rate": 4.9780353373290584e-05,
      "loss": 2.1932,
      "num_input_tokens_seen": 3833914240,
      "step": 4873
    },
    {
      "epoch": 0.5170804158709951,
      "grad_norm": 0.6401591072836352,
      "learning_rate": 4.9780261442328915e-05,
      "loss": 1.9666,
      "num_input_tokens_seen": 3834701104,
      "step": 4874
    },
    {
      "epoch": 0.5171865054105665,
      "grad_norm": 0.5457217907544147,
      "learning_rate": 4.9780169492217774e-05,
      "loss": 1.9189,
      "num_input_tokens_seen": 3835487840,
      "step": 4875
    },
    {
      "epoch": 0.5172925949501379,
      "grad_norm": 0.4077423911253794,
      "learning_rate": 4.978007752295726e-05,
      "loss": 2.01,
      "num_input_tokens_seen": 3836274576,
      "step": 4876
    },
    {
      "epoch": 0.5173986844897093,
      "grad_norm": 0.6570215078950397,
      "learning_rate": 4.977998553454742e-05,
      "loss": 2.0587,
      "num_input_tokens_seen": 3837061408,
      "step": 4877
    },
    {
      "epoch": 0.5175047740292807,
      "grad_norm": 0.5080971919590843,
      "learning_rate": 4.977989352698834e-05,
      "loss": 2.0059,
      "num_input_tokens_seen": 3837848192,
      "step": 4878
    },
    {
      "epoch": 0.5176108635688521,
      "grad_norm": 0.594727802916293,
      "learning_rate": 4.9779801500280085e-05,
      "loss": 2.058,
      "num_input_tokens_seen": 3838634960,
      "step": 4879
    },
    {
      "epoch": 0.5177169531084235,
      "grad_norm": 0.7515171097487403,
      "learning_rate": 4.977970945442273e-05,
      "loss": 2.177,
      "num_input_tokens_seen": 3839421728,
      "step": 4880
    },
    {
      "epoch": 0.517823042647995,
      "grad_norm": 0.5827726636772624,
      "learning_rate": 4.977961738941634e-05,
      "loss": 1.9144,
      "num_input_tokens_seen": 3840208496,
      "step": 4881
    },
    {
      "epoch": 0.5179291321875663,
      "grad_norm": 0.5694941928410974,
      "learning_rate": 4.9779525305260986e-05,
      "loss": 2.0945,
      "num_input_tokens_seen": 3840995232,
      "step": 4882
    },
    {
      "epoch": 0.5180352217271377,
      "grad_norm": 0.6322728030477274,
      "learning_rate": 4.977943320195674e-05,
      "loss": 2.1246,
      "num_input_tokens_seen": 3841781888,
      "step": 4883
    },
    {
      "epoch": 0.5181413112667091,
      "grad_norm": 0.5049281753180334,
      "learning_rate": 4.977934107950368e-05,
      "loss": 2.1437,
      "num_input_tokens_seen": 3842568592,
      "step": 4884
    },
    {
      "epoch": 0.5182474008062805,
      "grad_norm": 0.5997507479489482,
      "learning_rate": 4.977924893790187e-05,
      "loss": 2.0912,
      "num_input_tokens_seen": 3843355344,
      "step": 4885
    },
    {
      "epoch": 0.5183534903458519,
      "grad_norm": 0.4571279797349679,
      "learning_rate": 4.977915677715138e-05,
      "loss": 2.0178,
      "num_input_tokens_seen": 3844142016,
      "step": 4886
    },
    {
      "epoch": 0.5184595798854233,
      "grad_norm": 0.5762859099685493,
      "learning_rate": 4.977906459725229e-05,
      "loss": 2.1313,
      "num_input_tokens_seen": 3844928768,
      "step": 4887
    },
    {
      "epoch": 0.5185656694249947,
      "grad_norm": 0.47410674627683286,
      "learning_rate": 4.977897239820467e-05,
      "loss": 1.92,
      "num_input_tokens_seen": 3845715488,
      "step": 4888
    },
    {
      "epoch": 0.5186717589645661,
      "grad_norm": 0.7500415749143126,
      "learning_rate": 4.977888018000858e-05,
      "loss": 2.0199,
      "num_input_tokens_seen": 3846502272,
      "step": 4889
    },
    {
      "epoch": 0.5187778485041374,
      "grad_norm": 0.8147007119057047,
      "learning_rate": 4.9778787942664095e-05,
      "loss": 2.044,
      "num_input_tokens_seen": 3847289008,
      "step": 4890
    },
    {
      "epoch": 0.5188839380437089,
      "grad_norm": 0.49425469102274466,
      "learning_rate": 4.977869568617129e-05,
      "loss": 1.9557,
      "num_input_tokens_seen": 3848075760,
      "step": 4891
    },
    {
      "epoch": 0.5189900275832803,
      "grad_norm": 0.6286789759325009,
      "learning_rate": 4.977860341053025e-05,
      "loss": 2.0244,
      "num_input_tokens_seen": 3848862512,
      "step": 4892
    },
    {
      "epoch": 0.5190961171228516,
      "grad_norm": 0.49534839093134836,
      "learning_rate": 4.977851111574102e-05,
      "loss": 1.9484,
      "num_input_tokens_seen": 3849649264,
      "step": 4893
    },
    {
      "epoch": 0.5192022066624231,
      "grad_norm": 0.602729847003305,
      "learning_rate": 4.977841880180369e-05,
      "loss": 2.0502,
      "num_input_tokens_seen": 3850436048,
      "step": 4894
    },
    {
      "epoch": 0.5193082962019945,
      "grad_norm": 0.5259213683657911,
      "learning_rate": 4.977832646871832e-05,
      "loss": 2.0939,
      "num_input_tokens_seen": 3851222784,
      "step": 4895
    },
    {
      "epoch": 0.5194143857415658,
      "grad_norm": 0.5844147222972031,
      "learning_rate": 4.977823411648499e-05,
      "loss": 1.9911,
      "num_input_tokens_seen": 3852009536,
      "step": 4896
    },
    {
      "epoch": 0.5195204752811373,
      "grad_norm": 0.5787189460636673,
      "learning_rate": 4.977814174510377e-05,
      "loss": 2.1227,
      "num_input_tokens_seen": 3852796240,
      "step": 4897
    },
    {
      "epoch": 0.5196265648207087,
      "grad_norm": 0.5774222227963558,
      "learning_rate": 4.977804935457472e-05,
      "loss": 1.9729,
      "num_input_tokens_seen": 3853583056,
      "step": 4898
    },
    {
      "epoch": 0.51973265436028,
      "grad_norm": 0.5319489707755318,
      "learning_rate": 4.977795694489793e-05,
      "loss": 2.1615,
      "num_input_tokens_seen": 3854369808,
      "step": 4899
    },
    {
      "epoch": 0.5198387438998515,
      "grad_norm": 0.5262679419491061,
      "learning_rate": 4.977786451607345e-05,
      "loss": 1.9243,
      "num_input_tokens_seen": 3855156624,
      "step": 4900
    },
    {
      "epoch": 0.5199448334394229,
      "grad_norm": 0.5295988100284666,
      "learning_rate": 4.9777772068101374e-05,
      "loss": 2.0794,
      "num_input_tokens_seen": 3855943344,
      "step": 4901
    },
    {
      "epoch": 0.5200509229789942,
      "grad_norm": 0.5124222276392305,
      "learning_rate": 4.977767960098176e-05,
      "loss": 2.0675,
      "num_input_tokens_seen": 3856730144,
      "step": 4902
    },
    {
      "epoch": 0.5201570125185657,
      "grad_norm": 0.49203304530210584,
      "learning_rate": 4.977758711471469e-05,
      "loss": 1.8818,
      "num_input_tokens_seen": 3857516848,
      "step": 4903
    },
    {
      "epoch": 0.5202631020581371,
      "grad_norm": 0.5974924304081006,
      "learning_rate": 4.9777494609300214e-05,
      "loss": 2.0897,
      "num_input_tokens_seen": 3858303648,
      "step": 4904
    },
    {
      "epoch": 0.5203691915977084,
      "grad_norm": 0.5280059003559902,
      "learning_rate": 4.9777402084738424e-05,
      "loss": 2.1364,
      "num_input_tokens_seen": 3859090416,
      "step": 4905
    },
    {
      "epoch": 0.5204752811372798,
      "grad_norm": 0.7493878855790449,
      "learning_rate": 4.977730954102938e-05,
      "loss": 2.0375,
      "num_input_tokens_seen": 3859877200,
      "step": 4906
    },
    {
      "epoch": 0.5205813706768513,
      "grad_norm": 0.46216115550339715,
      "learning_rate": 4.9777216978173155e-05,
      "loss": 2.0672,
      "num_input_tokens_seen": 3860664080,
      "step": 4907
    },
    {
      "epoch": 0.5206874602164226,
      "grad_norm": 0.651652678913386,
      "learning_rate": 4.977712439616984e-05,
      "loss": 1.943,
      "num_input_tokens_seen": 3861450864,
      "step": 4908
    },
    {
      "epoch": 0.520793549755994,
      "grad_norm": 0.5265048458089058,
      "learning_rate": 4.977703179501948e-05,
      "loss": 2.0681,
      "num_input_tokens_seen": 3862237728,
      "step": 4909
    },
    {
      "epoch": 0.5208996392955655,
      "grad_norm": 0.9035583597481855,
      "learning_rate": 4.9776939174722156e-05,
      "loss": 2.0876,
      "num_input_tokens_seen": 3863024464,
      "step": 4910
    },
    {
      "epoch": 0.5210057288351368,
      "grad_norm": 0.6485903987996584,
      "learning_rate": 4.977684653527794e-05,
      "loss": 2.1597,
      "num_input_tokens_seen": 3863811264,
      "step": 4911
    },
    {
      "epoch": 0.5211118183747082,
      "grad_norm": 0.5666778599776618,
      "learning_rate": 4.9776753876686906e-05,
      "loss": 2.0245,
      "num_input_tokens_seen": 3864597984,
      "step": 4912
    },
    {
      "epoch": 0.5212179079142797,
      "grad_norm": 0.4878946899700108,
      "learning_rate": 4.977666119894912e-05,
      "loss": 2.1616,
      "num_input_tokens_seen": 3865384752,
      "step": 4913
    },
    {
      "epoch": 0.521323997453851,
      "grad_norm": 0.495787205084998,
      "learning_rate": 4.9776568502064664e-05,
      "loss": 1.9985,
      "num_input_tokens_seen": 3866171520,
      "step": 4914
    },
    {
      "epoch": 0.5214300869934224,
      "grad_norm": 0.49182525702334395,
      "learning_rate": 4.97764757860336e-05,
      "loss": 2.0728,
      "num_input_tokens_seen": 3866958256,
      "step": 4915
    },
    {
      "epoch": 0.5215361765329939,
      "grad_norm": 0.5251581248621267,
      "learning_rate": 4.9776383050856e-05,
      "loss": 2.0519,
      "num_input_tokens_seen": 3867744944,
      "step": 4916
    },
    {
      "epoch": 0.5216422660725653,
      "grad_norm": 0.4369514083135996,
      "learning_rate": 4.9776290296531936e-05,
      "loss": 2.0558,
      "num_input_tokens_seen": 3868531632,
      "step": 4917
    },
    {
      "epoch": 0.5217483556121366,
      "grad_norm": 0.5054644824194084,
      "learning_rate": 4.977619752306149e-05,
      "loss": 1.9527,
      "num_input_tokens_seen": 3869318448,
      "step": 4918
    },
    {
      "epoch": 0.5218544451517081,
      "grad_norm": 0.614831688055014,
      "learning_rate": 4.9776104730444714e-05,
      "loss": 2.1815,
      "num_input_tokens_seen": 3870105200,
      "step": 4919
    },
    {
      "epoch": 0.5219605346912795,
      "grad_norm": 0.5084566819115717,
      "learning_rate": 4.977601191868171e-05,
      "loss": 1.9153,
      "num_input_tokens_seen": 3870891968,
      "step": 4920
    },
    {
      "epoch": 0.5220666242308508,
      "grad_norm": 0.8512040853301166,
      "learning_rate": 4.977591908777251e-05,
      "loss": 2.0978,
      "num_input_tokens_seen": 3871678736,
      "step": 4921
    },
    {
      "epoch": 0.5221727137704222,
      "grad_norm": 0.63608767802624,
      "learning_rate": 4.977582623771722e-05,
      "loss": 2.0551,
      "num_input_tokens_seen": 3872465488,
      "step": 4922
    },
    {
      "epoch": 0.5222788033099937,
      "grad_norm": 0.6900876287573338,
      "learning_rate": 4.9775733368515896e-05,
      "loss": 1.9603,
      "num_input_tokens_seen": 3873252304,
      "step": 4923
    },
    {
      "epoch": 0.522384892849565,
      "grad_norm": 0.6684534376921318,
      "learning_rate": 4.977564048016861e-05,
      "loss": 1.8922,
      "num_input_tokens_seen": 3874039152,
      "step": 4924
    },
    {
      "epoch": 0.5224909823891364,
      "grad_norm": 0.48980811233925653,
      "learning_rate": 4.977554757267544e-05,
      "loss": 1.9031,
      "num_input_tokens_seen": 3874825936,
      "step": 4925
    },
    {
      "epoch": 0.5225970719287079,
      "grad_norm": 1.0457591829128514,
      "learning_rate": 4.9775454646036446e-05,
      "loss": 2.0412,
      "num_input_tokens_seen": 3875612752,
      "step": 4926
    },
    {
      "epoch": 0.5227031614682792,
      "grad_norm": 0.6164542400879662,
      "learning_rate": 4.977536170025172e-05,
      "loss": 1.9507,
      "num_input_tokens_seen": 3876399488,
      "step": 4927
    },
    {
      "epoch": 0.5228092510078506,
      "grad_norm": 0.8459822741126515,
      "learning_rate": 4.977526873532131e-05,
      "loss": 2.0288,
      "num_input_tokens_seen": 3877186320,
      "step": 4928
    },
    {
      "epoch": 0.5229153405474221,
      "grad_norm": 0.7809439513814787,
      "learning_rate": 4.97751757512453e-05,
      "loss": 2.1705,
      "num_input_tokens_seen": 3877973056,
      "step": 4929
    },
    {
      "epoch": 0.5230214300869934,
      "grad_norm": 0.8311802624135914,
      "learning_rate": 4.977508274802377e-05,
      "loss": 2.0801,
      "num_input_tokens_seen": 3878759936,
      "step": 4930
    },
    {
      "epoch": 0.5231275196265648,
      "grad_norm": 1.4628972563061349,
      "learning_rate": 4.977498972565677e-05,
      "loss": 2.1597,
      "num_input_tokens_seen": 3879546592,
      "step": 4931
    },
    {
      "epoch": 0.5232336091661363,
      "grad_norm": 0.7216105355225624,
      "learning_rate": 4.97748966841444e-05,
      "loss": 2.0818,
      "num_input_tokens_seen": 3880333280,
      "step": 4932
    },
    {
      "epoch": 0.5233396987057076,
      "grad_norm": 1.186197694577176,
      "learning_rate": 4.977480362348671e-05,
      "loss": 1.9773,
      "num_input_tokens_seen": 3881120112,
      "step": 4933
    },
    {
      "epoch": 0.523445788245279,
      "grad_norm": 1.055210773815164,
      "learning_rate": 4.9774710543683774e-05,
      "loss": 2.1315,
      "num_input_tokens_seen": 3881906784,
      "step": 4934
    },
    {
      "epoch": 0.5235518777848505,
      "grad_norm": 1.61587515111969,
      "learning_rate": 4.9774617444735675e-05,
      "loss": 1.9773,
      "num_input_tokens_seen": 3882693552,
      "step": 4935
    },
    {
      "epoch": 0.5236579673244218,
      "grad_norm": 1.4568177855809012,
      "learning_rate": 4.977452432664247e-05,
      "loss": 1.9991,
      "num_input_tokens_seen": 3883480336,
      "step": 4936
    },
    {
      "epoch": 0.5237640568639932,
      "grad_norm": 0.9331313639952333,
      "learning_rate": 4.9774431189404245e-05,
      "loss": 2.1522,
      "num_input_tokens_seen": 3884267040,
      "step": 4937
    },
    {
      "epoch": 0.5238701464035647,
      "grad_norm": 1.037775144000271,
      "learning_rate": 4.977433803302107e-05,
      "loss": 1.9118,
      "num_input_tokens_seen": 3885053952,
      "step": 4938
    },
    {
      "epoch": 0.523976235943136,
      "grad_norm": 0.8844660161271507,
      "learning_rate": 4.977424485749301e-05,
      "loss": 1.9519,
      "num_input_tokens_seen": 3885840704,
      "step": 4939
    },
    {
      "epoch": 0.5240823254827074,
      "grad_norm": 0.7841688752248293,
      "learning_rate": 4.977415166282014e-05,
      "loss": 1.8808,
      "num_input_tokens_seen": 3886627504,
      "step": 4940
    },
    {
      "epoch": 0.5241884150222788,
      "grad_norm": 0.6119714699895961,
      "learning_rate": 4.977405844900253e-05,
      "loss": 1.9892,
      "num_input_tokens_seen": 3887414304,
      "step": 4941
    },
    {
      "epoch": 0.5242945045618502,
      "grad_norm": 0.852330763863743,
      "learning_rate": 4.9773965216040265e-05,
      "loss": 2.0584,
      "num_input_tokens_seen": 3888201104,
      "step": 4942
    },
    {
      "epoch": 0.5244005941014216,
      "grad_norm": 0.632864504918751,
      "learning_rate": 4.9773871963933396e-05,
      "loss": 2.2432,
      "num_input_tokens_seen": 3888987792,
      "step": 4943
    },
    {
      "epoch": 0.524506683640993,
      "grad_norm": 0.8037158262694896,
      "learning_rate": 4.9773778692682003e-05,
      "loss": 2.1669,
      "num_input_tokens_seen": 3889774624,
      "step": 4944
    },
    {
      "epoch": 0.5246127731805644,
      "grad_norm": 0.5553850494403468,
      "learning_rate": 4.9773685402286175e-05,
      "loss": 2.1038,
      "num_input_tokens_seen": 3890561408,
      "step": 4945
    },
    {
      "epoch": 0.5247188627201358,
      "grad_norm": 0.6170758869852442,
      "learning_rate": 4.977359209274596e-05,
      "loss": 1.9403,
      "num_input_tokens_seen": 3891348192,
      "step": 4946
    },
    {
      "epoch": 0.5248249522597072,
      "grad_norm": 0.5045676190896997,
      "learning_rate": 4.977349876406144e-05,
      "loss": 1.9611,
      "num_input_tokens_seen": 3892134912,
      "step": 4947
    },
    {
      "epoch": 0.5249310417992786,
      "grad_norm": 0.5895616700019424,
      "learning_rate": 4.977340541623269e-05,
      "loss": 2.1754,
      "num_input_tokens_seen": 3892921600,
      "step": 4948
    },
    {
      "epoch": 0.52503713133885,
      "grad_norm": 0.5157401899107072,
      "learning_rate": 4.9773312049259776e-05,
      "loss": 2.0437,
      "num_input_tokens_seen": 3893708272,
      "step": 4949
    },
    {
      "epoch": 0.5251432208784214,
      "grad_norm": 0.5137599793350254,
      "learning_rate": 4.9773218663142774e-05,
      "loss": 2.0768,
      "num_input_tokens_seen": 3894495024,
      "step": 4950
    },
    {
      "epoch": 0.5252493104179928,
      "grad_norm": 0.749359919337662,
      "learning_rate": 4.977312525788176e-05,
      "loss": 2.1293,
      "num_input_tokens_seen": 3895281808,
      "step": 4951
    },
    {
      "epoch": 0.5253553999575642,
      "grad_norm": 0.6265132863994627,
      "learning_rate": 4.97730318334768e-05,
      "loss": 2.0209,
      "num_input_tokens_seen": 3896068608,
      "step": 4952
    },
    {
      "epoch": 0.5254614894971356,
      "grad_norm": 0.4823315350449302,
      "learning_rate": 4.977293838992796e-05,
      "loss": 1.9727,
      "num_input_tokens_seen": 3896855360,
      "step": 4953
    },
    {
      "epoch": 0.525567579036707,
      "grad_norm": 0.6213289062292096,
      "learning_rate": 4.977284492723533e-05,
      "loss": 1.9514,
      "num_input_tokens_seen": 3897642144,
      "step": 4954
    },
    {
      "epoch": 0.5256736685762784,
      "grad_norm": 0.5273913813938687,
      "learning_rate": 4.977275144539897e-05,
      "loss": 2.1194,
      "num_input_tokens_seen": 3898428864,
      "step": 4955
    },
    {
      "epoch": 0.5257797581158498,
      "grad_norm": 0.6803411272409224,
      "learning_rate": 4.977265794441895e-05,
      "loss": 2.0482,
      "num_input_tokens_seen": 3899215680,
      "step": 4956
    },
    {
      "epoch": 0.5258858476554211,
      "grad_norm": 0.506508298613068,
      "learning_rate": 4.977256442429535e-05,
      "loss": 2.0588,
      "num_input_tokens_seen": 3900002384,
      "step": 4957
    },
    {
      "epoch": 0.5259919371949926,
      "grad_norm": 0.7854879788347527,
      "learning_rate": 4.977247088502824e-05,
      "loss": 2.1091,
      "num_input_tokens_seen": 3900789072,
      "step": 4958
    },
    {
      "epoch": 0.526098026734564,
      "grad_norm": 0.7412040346913731,
      "learning_rate": 4.977237732661769e-05,
      "loss": 1.9476,
      "num_input_tokens_seen": 3901575776,
      "step": 4959
    },
    {
      "epoch": 0.5262041162741353,
      "grad_norm": 0.6399903234982526,
      "learning_rate": 4.977228374906377e-05,
      "loss": 2.0306,
      "num_input_tokens_seen": 3902362432,
      "step": 4960
    },
    {
      "epoch": 0.5263102058137068,
      "grad_norm": 0.8409367058094342,
      "learning_rate": 4.977219015236656e-05,
      "loss": 2.0074,
      "num_input_tokens_seen": 3903149264,
      "step": 4961
    },
    {
      "epoch": 0.5264162953532782,
      "grad_norm": 0.6562823877853123,
      "learning_rate": 4.977209653652613e-05,
      "loss": 2.0289,
      "num_input_tokens_seen": 3903936096,
      "step": 4962
    },
    {
      "epoch": 0.5265223848928495,
      "grad_norm": 0.8154850126161168,
      "learning_rate": 4.977200290154255e-05,
      "loss": 1.9069,
      "num_input_tokens_seen": 3904722816,
      "step": 4963
    },
    {
      "epoch": 0.526628474432421,
      "grad_norm": 0.73787691396027,
      "learning_rate": 4.977190924741589e-05,
      "loss": 2.1466,
      "num_input_tokens_seen": 3905509552,
      "step": 4964
    },
    {
      "epoch": 0.5267345639719924,
      "grad_norm": 0.7683018050191357,
      "learning_rate": 4.977181557414623e-05,
      "loss": 2.1721,
      "num_input_tokens_seen": 3906296336,
      "step": 4965
    },
    {
      "epoch": 0.5268406535115637,
      "grad_norm": 0.5304622548810809,
      "learning_rate": 4.977172188173364e-05,
      "loss": 1.9034,
      "num_input_tokens_seen": 3907083072,
      "step": 4966
    },
    {
      "epoch": 0.5269467430511352,
      "grad_norm": 0.8145178329630463,
      "learning_rate": 4.977162817017818e-05,
      "loss": 1.9909,
      "num_input_tokens_seen": 3907869856,
      "step": 4967
    },
    {
      "epoch": 0.5270528325907066,
      "grad_norm": 0.7642387104172156,
      "learning_rate": 4.977153443947994e-05,
      "loss": 2.1441,
      "num_input_tokens_seen": 3908656528,
      "step": 4968
    },
    {
      "epoch": 0.5271589221302779,
      "grad_norm": 0.610644498108795,
      "learning_rate": 4.9771440689638984e-05,
      "loss": 2.0073,
      "num_input_tokens_seen": 3909443264,
      "step": 4969
    },
    {
      "epoch": 0.5272650116698494,
      "grad_norm": 0.5107810292268878,
      "learning_rate": 4.977134692065538e-05,
      "loss": 2.0273,
      "num_input_tokens_seen": 3910229952,
      "step": 4970
    },
    {
      "epoch": 0.5273711012094208,
      "grad_norm": 0.6628788920457023,
      "learning_rate": 4.9771253132529215e-05,
      "loss": 2.1236,
      "num_input_tokens_seen": 3911016736,
      "step": 4971
    },
    {
      "epoch": 0.5274771907489921,
      "grad_norm": 0.6014837797585101,
      "learning_rate": 4.977115932526055e-05,
      "loss": 2.0935,
      "num_input_tokens_seen": 3911803408,
      "step": 4972
    },
    {
      "epoch": 0.5275832802885635,
      "grad_norm": 0.494882816495818,
      "learning_rate": 4.9771065498849456e-05,
      "loss": 1.9386,
      "num_input_tokens_seen": 3912590160,
      "step": 4973
    },
    {
      "epoch": 0.527689369828135,
      "grad_norm": 0.6081801143629163,
      "learning_rate": 4.9770971653296e-05,
      "loss": 2.1339,
      "num_input_tokens_seen": 3913377024,
      "step": 4974
    },
    {
      "epoch": 0.5277954593677063,
      "grad_norm": 0.45668195453078975,
      "learning_rate": 4.977087778860028e-05,
      "loss": 1.9912,
      "num_input_tokens_seen": 3914163760,
      "step": 4975
    },
    {
      "epoch": 0.5279015489072777,
      "grad_norm": 0.5933621654430723,
      "learning_rate": 4.977078390476235e-05,
      "loss": 2.1963,
      "num_input_tokens_seen": 3914950640,
      "step": 4976
    },
    {
      "epoch": 0.5280076384468492,
      "grad_norm": 0.6802860972984639,
      "learning_rate": 4.977069000178228e-05,
      "loss": 2.0885,
      "num_input_tokens_seen": 3915737312,
      "step": 4977
    },
    {
      "epoch": 0.5281137279864205,
      "grad_norm": 0.497860691060039,
      "learning_rate": 4.977059607966015e-05,
      "loss": 2.075,
      "num_input_tokens_seen": 3916524064,
      "step": 4978
    },
    {
      "epoch": 0.5282198175259919,
      "grad_norm": 0.6660199285132241,
      "learning_rate": 4.9770502138396035e-05,
      "loss": 2.0145,
      "num_input_tokens_seen": 3917310880,
      "step": 4979
    },
    {
      "epoch": 0.5283259070655634,
      "grad_norm": 0.702729945705216,
      "learning_rate": 4.977040817799e-05,
      "loss": 2.1275,
      "num_input_tokens_seen": 3918097600,
      "step": 4980
    },
    {
      "epoch": 0.5284319966051347,
      "grad_norm": 0.5446791466954026,
      "learning_rate": 4.977031419844211e-05,
      "loss": 1.9564,
      "num_input_tokens_seen": 3918884320,
      "step": 4981
    },
    {
      "epoch": 0.5285380861447061,
      "grad_norm": 0.6563539704697514,
      "learning_rate": 4.977022019975246e-05,
      "loss": 1.9154,
      "num_input_tokens_seen": 3919671088,
      "step": 4982
    },
    {
      "epoch": 0.5286441756842776,
      "grad_norm": 0.647021861525289,
      "learning_rate": 4.9770126181921106e-05,
      "loss": 2.0292,
      "num_input_tokens_seen": 3920457824,
      "step": 4983
    },
    {
      "epoch": 0.5287502652238489,
      "grad_norm": 0.6226193165354643,
      "learning_rate": 4.9770032144948134e-05,
      "loss": 2.0543,
      "num_input_tokens_seen": 3921244480,
      "step": 4984
    },
    {
      "epoch": 0.5288563547634203,
      "grad_norm": 0.6747601576863428,
      "learning_rate": 4.976993808883359e-05,
      "loss": 1.9254,
      "num_input_tokens_seen": 3922031328,
      "step": 4985
    },
    {
      "epoch": 0.5289624443029918,
      "grad_norm": 0.5223668324584344,
      "learning_rate": 4.9769844013577585e-05,
      "loss": 2.0675,
      "num_input_tokens_seen": 3922818096,
      "step": 4986
    },
    {
      "epoch": 0.5290685338425631,
      "grad_norm": 0.5943785609202623,
      "learning_rate": 4.976974991918015e-05,
      "loss": 2.0515,
      "num_input_tokens_seen": 3923604864,
      "step": 4987
    },
    {
      "epoch": 0.5291746233821345,
      "grad_norm": 0.5949828680441699,
      "learning_rate": 4.97696558056414e-05,
      "loss": 2.1097,
      "num_input_tokens_seen": 3924391584,
      "step": 4988
    },
    {
      "epoch": 0.5292807129217059,
      "grad_norm": 0.7278169431900959,
      "learning_rate": 4.976956167296137e-05,
      "loss": 2.1915,
      "num_input_tokens_seen": 3925178320,
      "step": 4989
    },
    {
      "epoch": 0.5293868024612773,
      "grad_norm": 0.7485241393831592,
      "learning_rate": 4.976946752114016e-05,
      "loss": 2.0641,
      "num_input_tokens_seen": 3925965088,
      "step": 4990
    },
    {
      "epoch": 0.5294928920008487,
      "grad_norm": 0.5532995141800646,
      "learning_rate": 4.976937335017783e-05,
      "loss": 2.1154,
      "num_input_tokens_seen": 3926751840,
      "step": 4991
    },
    {
      "epoch": 0.5295989815404201,
      "grad_norm": 0.8899916474886314,
      "learning_rate": 4.9769279160074455e-05,
      "loss": 2.054,
      "num_input_tokens_seen": 3927538608,
      "step": 4992
    },
    {
      "epoch": 0.5297050710799915,
      "grad_norm": 0.5076465537995617,
      "learning_rate": 4.976918495083011e-05,
      "loss": 2.0973,
      "num_input_tokens_seen": 3928325440,
      "step": 4993
    },
    {
      "epoch": 0.5298111606195629,
      "grad_norm": 1.148373151787897,
      "learning_rate": 4.976909072244485e-05,
      "loss": 2.2027,
      "num_input_tokens_seen": 3929112160,
      "step": 4994
    },
    {
      "epoch": 0.5299172501591343,
      "grad_norm": 0.530101683987756,
      "learning_rate": 4.976899647491878e-05,
      "loss": 1.9458,
      "num_input_tokens_seen": 3929898928,
      "step": 4995
    },
    {
      "epoch": 0.5300233396987057,
      "grad_norm": 0.8790205699434221,
      "learning_rate": 4.976890220825196e-05,
      "loss": 1.7996,
      "num_input_tokens_seen": 3930685728,
      "step": 4996
    },
    {
      "epoch": 0.5301294292382771,
      "grad_norm": 0.5014964787283828,
      "learning_rate": 4.976880792244445e-05,
      "loss": 2.0329,
      "num_input_tokens_seen": 3931472672,
      "step": 4997
    },
    {
      "epoch": 0.5302355187778485,
      "grad_norm": 0.8788115311960214,
      "learning_rate": 4.9768713617496335e-05,
      "loss": 2.2067,
      "num_input_tokens_seen": 3932259344,
      "step": 4998
    },
    {
      "epoch": 0.5303416083174199,
      "grad_norm": 0.49717142441642587,
      "learning_rate": 4.976861929340768e-05,
      "loss": 2.0647,
      "num_input_tokens_seen": 3933046096,
      "step": 4999
    },
    {
      "epoch": 0.5304476978569913,
      "grad_norm": 0.7751946195797724,
      "learning_rate": 4.9768524950178564e-05,
      "loss": 1.9988,
      "num_input_tokens_seen": 3933832816,
      "step": 5000
    },
    {
      "epoch": 0.5304476978569913,
      "eval_loss": 1.9911590814590454,
      "eval_runtime": 65.6195,
      "eval_samples_per_second": 45.718,
      "eval_steps_per_second": 0.488,
      "num_input_tokens_seen": 3933832816,
      "step": 5000
    },
    {
      "epoch": 0.5305537873965627,
      "grad_norm": 0.5294821601286128,
      "learning_rate": 4.976843058780906e-05,
      "loss": 1.9761,
      "num_input_tokens_seen": 3934619632,
      "step": 5001
    },
    {
      "epoch": 0.5306598769361341,
      "grad_norm": 0.7120620140006594,
      "learning_rate": 4.976833620629924e-05,
      "loss": 1.9698,
      "num_input_tokens_seen": 3935406432,
      "step": 5002
    },
    {
      "epoch": 0.5307659664757055,
      "grad_norm": 0.5471359837620725,
      "learning_rate": 4.976824180564918e-05,
      "loss": 2.008,
      "num_input_tokens_seen": 3936193184,
      "step": 5003
    },
    {
      "epoch": 0.5308720560152769,
      "grad_norm": 0.6582328852679342,
      "learning_rate": 4.9768147385858945e-05,
      "loss": 2.0526,
      "num_input_tokens_seen": 3936979936,
      "step": 5004
    },
    {
      "epoch": 0.5309781455548483,
      "grad_norm": 0.5308011641744035,
      "learning_rate": 4.976805294692861e-05,
      "loss": 1.8987,
      "num_input_tokens_seen": 3937766640,
      "step": 5005
    },
    {
      "epoch": 0.5310842350944197,
      "grad_norm": 0.5666708700722958,
      "learning_rate": 4.9767958488858256e-05,
      "loss": 1.962,
      "num_input_tokens_seen": 3938553376,
      "step": 5006
    },
    {
      "epoch": 0.5311903246339911,
      "grad_norm": 0.443065663226314,
      "learning_rate": 4.9767864011647946e-05,
      "loss": 1.9874,
      "num_input_tokens_seen": 3939340112,
      "step": 5007
    },
    {
      "epoch": 0.5312964141735624,
      "grad_norm": 0.6461036795229245,
      "learning_rate": 4.976776951529776e-05,
      "loss": 2.1702,
      "num_input_tokens_seen": 3940126896,
      "step": 5008
    },
    {
      "epoch": 0.5314025037131339,
      "grad_norm": 0.6721412050397759,
      "learning_rate": 4.976767499980777e-05,
      "loss": 2.0905,
      "num_input_tokens_seen": 3940913664,
      "step": 5009
    },
    {
      "epoch": 0.5315085932527053,
      "grad_norm": 0.46051755631440405,
      "learning_rate": 4.9767580465178046e-05,
      "loss": 1.9434,
      "num_input_tokens_seen": 3941700512,
      "step": 5010
    },
    {
      "epoch": 0.5316146827922766,
      "grad_norm": 0.4590627685636421,
      "learning_rate": 4.9767485911408664e-05,
      "loss": 2.1261,
      "num_input_tokens_seen": 3942487248,
      "step": 5011
    },
    {
      "epoch": 0.5317207723318481,
      "grad_norm": 0.47539862787741044,
      "learning_rate": 4.976739133849969e-05,
      "loss": 1.9587,
      "num_input_tokens_seen": 3943274096,
      "step": 5012
    },
    {
      "epoch": 0.5318268618714195,
      "grad_norm": 0.5993182338930308,
      "learning_rate": 4.976729674645121e-05,
      "loss": 1.8806,
      "num_input_tokens_seen": 3944060944,
      "step": 5013
    },
    {
      "epoch": 0.5319329514109908,
      "grad_norm": 0.6690159302600801,
      "learning_rate": 4.976720213526329e-05,
      "loss": 1.9419,
      "num_input_tokens_seen": 3944847712,
      "step": 5014
    },
    {
      "epoch": 0.5320390409505623,
      "grad_norm": 0.44477640834621385,
      "learning_rate": 4.9767107504936e-05,
      "loss": 2.0889,
      "num_input_tokens_seen": 3945634496,
      "step": 5015
    },
    {
      "epoch": 0.5321451304901337,
      "grad_norm": 0.7901071479760889,
      "learning_rate": 4.976701285546941e-05,
      "loss": 1.9426,
      "num_input_tokens_seen": 3946421312,
      "step": 5016
    },
    {
      "epoch": 0.532251220029705,
      "grad_norm": 0.522566201483054,
      "learning_rate": 4.976691818686361e-05,
      "loss": 2.0785,
      "num_input_tokens_seen": 3947207984,
      "step": 5017
    },
    {
      "epoch": 0.5323573095692765,
      "grad_norm": 0.7941182614790578,
      "learning_rate": 4.976682349911865e-05,
      "loss": 1.9474,
      "num_input_tokens_seen": 3947994784,
      "step": 5018
    },
    {
      "epoch": 0.5324633991088479,
      "grad_norm": 1.186023804452711,
      "learning_rate": 4.976672879223463e-05,
      "loss": 1.966,
      "num_input_tokens_seen": 3948781536,
      "step": 5019
    },
    {
      "epoch": 0.5325694886484192,
      "grad_norm": 0.7195614449810144,
      "learning_rate": 4.9766634066211595e-05,
      "loss": 2.0399,
      "num_input_tokens_seen": 3949568336,
      "step": 5020
    },
    {
      "epoch": 0.5326755781879907,
      "grad_norm": 0.8479750046015978,
      "learning_rate": 4.976653932104964e-05,
      "loss": 1.9774,
      "num_input_tokens_seen": 3950355120,
      "step": 5021
    },
    {
      "epoch": 0.5327816677275621,
      "grad_norm": 0.6255069473166945,
      "learning_rate": 4.9766444556748826e-05,
      "loss": 1.895,
      "num_input_tokens_seen": 3951141984,
      "step": 5022
    },
    {
      "epoch": 0.5328877572671334,
      "grad_norm": 0.5969106637885144,
      "learning_rate": 4.976634977330923e-05,
      "loss": 1.9478,
      "num_input_tokens_seen": 3951928816,
      "step": 5023
    },
    {
      "epoch": 0.5329938468067048,
      "grad_norm": 0.7256419857732958,
      "learning_rate": 4.976625497073093e-05,
      "loss": 2.0043,
      "num_input_tokens_seen": 3952715680,
      "step": 5024
    },
    {
      "epoch": 0.5330999363462763,
      "grad_norm": 0.68511466760708,
      "learning_rate": 4.9766160149013995e-05,
      "loss": 2.0499,
      "num_input_tokens_seen": 3953502336,
      "step": 5025
    },
    {
      "epoch": 0.5332060258858476,
      "grad_norm": 0.6170547091060281,
      "learning_rate": 4.9766065308158496e-05,
      "loss": 1.8808,
      "num_input_tokens_seen": 3954289056,
      "step": 5026
    },
    {
      "epoch": 0.533312115425419,
      "grad_norm": 0.5185719330949158,
      "learning_rate": 4.976597044816451e-05,
      "loss": 2.0185,
      "num_input_tokens_seen": 3955075856,
      "step": 5027
    },
    {
      "epoch": 0.5334182049649905,
      "grad_norm": 0.482030844912156,
      "learning_rate": 4.976587556903211e-05,
      "loss": 1.892,
      "num_input_tokens_seen": 3955862608,
      "step": 5028
    },
    {
      "epoch": 0.5335242945045618,
      "grad_norm": 0.7125830272397872,
      "learning_rate": 4.976578067076136e-05,
      "loss": 2.2691,
      "num_input_tokens_seen": 3956649264,
      "step": 5029
    },
    {
      "epoch": 0.5336303840441332,
      "grad_norm": 0.7838345373659069,
      "learning_rate": 4.9765685753352346e-05,
      "loss": 2.0483,
      "num_input_tokens_seen": 3957436000,
      "step": 5030
    },
    {
      "epoch": 0.5337364735837047,
      "grad_norm": 0.5641004098882407,
      "learning_rate": 4.976559081680514e-05,
      "loss": 1.9972,
      "num_input_tokens_seen": 3958222736,
      "step": 5031
    },
    {
      "epoch": 0.533842563123276,
      "grad_norm": 0.5979904779665002,
      "learning_rate": 4.9765495861119806e-05,
      "loss": 2.1332,
      "num_input_tokens_seen": 3959009520,
      "step": 5032
    },
    {
      "epoch": 0.5339486526628474,
      "grad_norm": 0.7345850097314038,
      "learning_rate": 4.976540088629643e-05,
      "loss": 2.0718,
      "num_input_tokens_seen": 3959796272,
      "step": 5033
    },
    {
      "epoch": 0.5340547422024189,
      "grad_norm": 0.4866527163041882,
      "learning_rate": 4.976530589233507e-05,
      "loss": 2.0088,
      "num_input_tokens_seen": 3960582976,
      "step": 5034
    },
    {
      "epoch": 0.5341608317419902,
      "grad_norm": 0.5228117013239144,
      "learning_rate": 4.976521087923582e-05,
      "loss": 2.0418,
      "num_input_tokens_seen": 3961369616,
      "step": 5035
    },
    {
      "epoch": 0.5342669212815616,
      "grad_norm": 0.5739881139081422,
      "learning_rate": 4.976511584699873e-05,
      "loss": 2.1828,
      "num_input_tokens_seen": 3962156400,
      "step": 5036
    },
    {
      "epoch": 0.5343730108211331,
      "grad_norm": 0.4434213772573149,
      "learning_rate": 4.97650207956239e-05,
      "loss": 2.0129,
      "num_input_tokens_seen": 3962943168,
      "step": 5037
    },
    {
      "epoch": 0.5344791003607045,
      "grad_norm": 0.5266902665606954,
      "learning_rate": 4.976492572511138e-05,
      "loss": 1.7746,
      "num_input_tokens_seen": 3963730016,
      "step": 5038
    },
    {
      "epoch": 0.5345851899002758,
      "grad_norm": 0.5813731482026852,
      "learning_rate": 4.9764830635461244e-05,
      "loss": 2.0906,
      "num_input_tokens_seen": 3964516816,
      "step": 5039
    },
    {
      "epoch": 0.5346912794398472,
      "grad_norm": 0.47066568844804463,
      "learning_rate": 4.976473552667358e-05,
      "loss": 1.9153,
      "num_input_tokens_seen": 3965303552,
      "step": 5040
    },
    {
      "epoch": 0.5347973689794187,
      "grad_norm": 0.8276901545925857,
      "learning_rate": 4.9764640398748455e-05,
      "loss": 2.1324,
      "num_input_tokens_seen": 3966090320,
      "step": 5041
    },
    {
      "epoch": 0.53490345851899,
      "grad_norm": 0.6791847537121612,
      "learning_rate": 4.9764545251685944e-05,
      "loss": 2.0297,
      "num_input_tokens_seen": 3966877120,
      "step": 5042
    },
    {
      "epoch": 0.5350095480585614,
      "grad_norm": 0.725091374681488,
      "learning_rate": 4.976445008548613e-05,
      "loss": 1.9779,
      "num_input_tokens_seen": 3967663904,
      "step": 5043
    },
    {
      "epoch": 0.5351156375981329,
      "grad_norm": 0.6704276376952231,
      "learning_rate": 4.976435490014906e-05,
      "loss": 1.9962,
      "num_input_tokens_seen": 3968450672,
      "step": 5044
    },
    {
      "epoch": 0.5352217271377042,
      "grad_norm": 0.661944062855515,
      "learning_rate": 4.976425969567482e-05,
      "loss": 2.1461,
      "num_input_tokens_seen": 3969237392,
      "step": 5045
    },
    {
      "epoch": 0.5353278166772756,
      "grad_norm": 0.5452711548752799,
      "learning_rate": 4.97641644720635e-05,
      "loss": 2.0297,
      "num_input_tokens_seen": 3970024144,
      "step": 5046
    },
    {
      "epoch": 0.535433906216847,
      "grad_norm": 0.5848752169333942,
      "learning_rate": 4.9764069229315145e-05,
      "loss": 1.9266,
      "num_input_tokens_seen": 3970810880,
      "step": 5047
    },
    {
      "epoch": 0.5355399957564184,
      "grad_norm": 0.4976698390844496,
      "learning_rate": 4.976397396742986e-05,
      "loss": 1.8476,
      "num_input_tokens_seen": 3971597712,
      "step": 5048
    },
    {
      "epoch": 0.5356460852959898,
      "grad_norm": 0.5508238626938307,
      "learning_rate": 4.97638786864077e-05,
      "loss": 2.0181,
      "num_input_tokens_seen": 3972384544,
      "step": 5049
    },
    {
      "epoch": 0.5357521748355613,
      "grad_norm": 0.6011673972797681,
      "learning_rate": 4.976378338624873e-05,
      "loss": 2.0943,
      "num_input_tokens_seen": 3973171424,
      "step": 5050
    },
    {
      "epoch": 0.5358582643751326,
      "grad_norm": 0.5470151965046437,
      "learning_rate": 4.976368806695304e-05,
      "loss": 1.908,
      "num_input_tokens_seen": 3973958192,
      "step": 5051
    },
    {
      "epoch": 0.535964353914704,
      "grad_norm": 0.7088540703498801,
      "learning_rate": 4.97635927285207e-05,
      "loss": 2.1586,
      "num_input_tokens_seen": 3974744992,
      "step": 5052
    },
    {
      "epoch": 0.5360704434542755,
      "grad_norm": 0.5897053999928202,
      "learning_rate": 4.976349737095178e-05,
      "loss": 1.9934,
      "num_input_tokens_seen": 3975531760,
      "step": 5053
    },
    {
      "epoch": 0.5361765329938468,
      "grad_norm": 0.6527778809720606,
      "learning_rate": 4.976340199424636e-05,
      "loss": 1.9849,
      "num_input_tokens_seen": 3976318576,
      "step": 5054
    },
    {
      "epoch": 0.5362826225334182,
      "grad_norm": 1.2235273944466272,
      "learning_rate": 4.976330659840451e-05,
      "loss": 1.9732,
      "num_input_tokens_seen": 3977105312,
      "step": 5055
    },
    {
      "epoch": 0.5363887120729895,
      "grad_norm": 0.6670994020877418,
      "learning_rate": 4.976321118342631e-05,
      "loss": 2.1386,
      "num_input_tokens_seen": 3977892048,
      "step": 5056
    },
    {
      "epoch": 0.536494801612561,
      "grad_norm": 1.393237042662359,
      "learning_rate": 4.976311574931181e-05,
      "loss": 1.9383,
      "num_input_tokens_seen": 3978678848,
      "step": 5057
    },
    {
      "epoch": 0.5366008911521324,
      "grad_norm": 0.5979255324525591,
      "learning_rate": 4.9763020296061114e-05,
      "loss": 1.9354,
      "num_input_tokens_seen": 3979465584,
      "step": 5058
    },
    {
      "epoch": 0.5367069806917037,
      "grad_norm": 0.9875148806348811,
      "learning_rate": 4.9762924823674275e-05,
      "loss": 1.9548,
      "num_input_tokens_seen": 3980252384,
      "step": 5059
    },
    {
      "epoch": 0.5368130702312752,
      "grad_norm": 0.9450579098344083,
      "learning_rate": 4.976282933215137e-05,
      "loss": 2.1401,
      "num_input_tokens_seen": 3981039072,
      "step": 5060
    },
    {
      "epoch": 0.5369191597708466,
      "grad_norm": 0.6559184172719928,
      "learning_rate": 4.976273382149249e-05,
      "loss": 1.9728,
      "num_input_tokens_seen": 3981825776,
      "step": 5061
    },
    {
      "epoch": 0.537025249310418,
      "grad_norm": 0.6252283353404612,
      "learning_rate": 4.976263829169769e-05,
      "loss": 1.8449,
      "num_input_tokens_seen": 3982612528,
      "step": 5062
    },
    {
      "epoch": 0.5371313388499894,
      "grad_norm": 0.5044223008616172,
      "learning_rate": 4.976254274276705e-05,
      "loss": 1.7744,
      "num_input_tokens_seen": 3983399392,
      "step": 5063
    },
    {
      "epoch": 0.5372374283895608,
      "grad_norm": 0.8354613356234124,
      "learning_rate": 4.976244717470064e-05,
      "loss": 2.02,
      "num_input_tokens_seen": 3984186112,
      "step": 5064
    },
    {
      "epoch": 0.5373435179291322,
      "grad_norm": 0.5785092623682584,
      "learning_rate": 4.976235158749854e-05,
      "loss": 2.1265,
      "num_input_tokens_seen": 3984972784,
      "step": 5065
    },
    {
      "epoch": 0.5374496074687036,
      "grad_norm": 0.503831735483648,
      "learning_rate": 4.9762255981160824e-05,
      "loss": 1.8648,
      "num_input_tokens_seen": 3985759600,
      "step": 5066
    },
    {
      "epoch": 0.537555697008275,
      "grad_norm": 0.6678968108937009,
      "learning_rate": 4.976216035568756e-05,
      "loss": 1.9965,
      "num_input_tokens_seen": 3986546288,
      "step": 5067
    },
    {
      "epoch": 0.5376617865478464,
      "grad_norm": 0.8884177299085836,
      "learning_rate": 4.9762064711078824e-05,
      "loss": 1.9863,
      "num_input_tokens_seen": 3987333040,
      "step": 5068
    },
    {
      "epoch": 0.5377678760874178,
      "grad_norm": 0.7719910758511487,
      "learning_rate": 4.976196904733469e-05,
      "loss": 1.8843,
      "num_input_tokens_seen": 3988119776,
      "step": 5069
    },
    {
      "epoch": 0.5378739656269892,
      "grad_norm": 1.0690291712519657,
      "learning_rate": 4.976187336445523e-05,
      "loss": 2.0923,
      "num_input_tokens_seen": 3988906496,
      "step": 5070
    },
    {
      "epoch": 0.5379800551665606,
      "grad_norm": 0.7184295348317551,
      "learning_rate": 4.976177766244053e-05,
      "loss": 1.9556,
      "num_input_tokens_seen": 3989693312,
      "step": 5071
    },
    {
      "epoch": 0.538086144706132,
      "grad_norm": 0.5755110483125991,
      "learning_rate": 4.9761681941290655e-05,
      "loss": 2.0616,
      "num_input_tokens_seen": 3990480048,
      "step": 5072
    },
    {
      "epoch": 0.5381922342457034,
      "grad_norm": 0.9241518998835159,
      "learning_rate": 4.976158620100567e-05,
      "loss": 1.8886,
      "num_input_tokens_seen": 3991266752,
      "step": 5073
    },
    {
      "epoch": 0.5382983237852748,
      "grad_norm": 0.6031514431692363,
      "learning_rate": 4.9761490441585666e-05,
      "loss": 1.8442,
      "num_input_tokens_seen": 3992053552,
      "step": 5074
    },
    {
      "epoch": 0.5384044133248461,
      "grad_norm": 0.7702072867859451,
      "learning_rate": 4.9761394663030704e-05,
      "loss": 2.043,
      "num_input_tokens_seen": 3992840336,
      "step": 5075
    },
    {
      "epoch": 0.5385105028644176,
      "grad_norm": 0.6984708491702519,
      "learning_rate": 4.976129886534087e-05,
      "loss": 2.0909,
      "num_input_tokens_seen": 3993627104,
      "step": 5076
    },
    {
      "epoch": 0.538616592403989,
      "grad_norm": 0.575668858247,
      "learning_rate": 4.976120304851622e-05,
      "loss": 1.9281,
      "num_input_tokens_seen": 3994413984,
      "step": 5077
    },
    {
      "epoch": 0.5387226819435603,
      "grad_norm": 0.6199735381676699,
      "learning_rate": 4.9761107212556846e-05,
      "loss": 2.0254,
      "num_input_tokens_seen": 3995200688,
      "step": 5078
    },
    {
      "epoch": 0.5388287714831318,
      "grad_norm": 0.48587269102299363,
      "learning_rate": 4.976101135746281e-05,
      "loss": 1.9351,
      "num_input_tokens_seen": 3995987488,
      "step": 5079
    },
    {
      "epoch": 0.5389348610227032,
      "grad_norm": 0.6089901039431219,
      "learning_rate": 4.9760915483234195e-05,
      "loss": 2.0528,
      "num_input_tokens_seen": 3996774224,
      "step": 5080
    },
    {
      "epoch": 0.5390409505622745,
      "grad_norm": 0.4920861700935453,
      "learning_rate": 4.9760819589871066e-05,
      "loss": 1.8572,
      "num_input_tokens_seen": 3997561056,
      "step": 5081
    },
    {
      "epoch": 0.539147040101846,
      "grad_norm": 0.5433649560173344,
      "learning_rate": 4.976072367737351e-05,
      "loss": 2.0371,
      "num_input_tokens_seen": 3998347728,
      "step": 5082
    },
    {
      "epoch": 0.5392531296414174,
      "grad_norm": 0.4571650684698525,
      "learning_rate": 4.976062774574158e-05,
      "loss": 2.0853,
      "num_input_tokens_seen": 3999134416,
      "step": 5083
    },
    {
      "epoch": 0.5393592191809887,
      "grad_norm": 0.5480126411338787,
      "learning_rate": 4.976053179497538e-05,
      "loss": 1.9882,
      "num_input_tokens_seen": 3999921136,
      "step": 5084
    },
    {
      "epoch": 0.5394653087205602,
      "grad_norm": 0.5977864399893479,
      "learning_rate": 4.976043582507496e-05,
      "loss": 2.1961,
      "num_input_tokens_seen": 4000707888,
      "step": 5085
    },
    {
      "epoch": 0.5395713982601316,
      "grad_norm": 0.487960831285316,
      "learning_rate": 4.97603398360404e-05,
      "loss": 2.017,
      "num_input_tokens_seen": 4001494656,
      "step": 5086
    },
    {
      "epoch": 0.5396774877997029,
      "grad_norm": 0.6662389892336998,
      "learning_rate": 4.976024382787178e-05,
      "loss": 2.1215,
      "num_input_tokens_seen": 4002281392,
      "step": 5087
    },
    {
      "epoch": 0.5397835773392744,
      "grad_norm": 0.6534341814513906,
      "learning_rate": 4.9760147800569165e-05,
      "loss": 2.1613,
      "num_input_tokens_seen": 4003068112,
      "step": 5088
    },
    {
      "epoch": 0.5398896668788458,
      "grad_norm": 0.5940285452251958,
      "learning_rate": 4.9760051754132634e-05,
      "loss": 2.0521,
      "num_input_tokens_seen": 4003854944,
      "step": 5089
    },
    {
      "epoch": 0.5399957564184171,
      "grad_norm": 0.5521494915509099,
      "learning_rate": 4.9759955688562266e-05,
      "loss": 2.0274,
      "num_input_tokens_seen": 4004641776,
      "step": 5090
    },
    {
      "epoch": 0.5401018459579885,
      "grad_norm": 0.8604108070646469,
      "learning_rate": 4.975985960385813e-05,
      "loss": 2.1057,
      "num_input_tokens_seen": 4005428496,
      "step": 5091
    },
    {
      "epoch": 0.54020793549756,
      "grad_norm": 0.6796178601228082,
      "learning_rate": 4.97597635000203e-05,
      "loss": 1.9219,
      "num_input_tokens_seen": 4006215184,
      "step": 5092
    },
    {
      "epoch": 0.5403140250371313,
      "grad_norm": 1.1218540141943913,
      "learning_rate": 4.975966737704885e-05,
      "loss": 2.008,
      "num_input_tokens_seen": 4007001856,
      "step": 5093
    },
    {
      "epoch": 0.5404201145767027,
      "grad_norm": 1.150505609333195,
      "learning_rate": 4.975957123494386e-05,
      "loss": 2.136,
      "num_input_tokens_seen": 4007788608,
      "step": 5094
    },
    {
      "epoch": 0.5405262041162742,
      "grad_norm": 0.7120528991793814,
      "learning_rate": 4.97594750737054e-05,
      "loss": 1.9943,
      "num_input_tokens_seen": 4008575360,
      "step": 5095
    },
    {
      "epoch": 0.5406322936558455,
      "grad_norm": 0.8966462738925122,
      "learning_rate": 4.975937889333353e-05,
      "loss": 1.9758,
      "num_input_tokens_seen": 4009362208,
      "step": 5096
    },
    {
      "epoch": 0.5407383831954169,
      "grad_norm": 1.0101120896341276,
      "learning_rate": 4.975928269382836e-05,
      "loss": 2.1331,
      "num_input_tokens_seen": 4010148928,
      "step": 5097
    },
    {
      "epoch": 0.5408444727349884,
      "grad_norm": 1.3694845873741812,
      "learning_rate": 4.9759186475189927e-05,
      "loss": 1.87,
      "num_input_tokens_seen": 4010935728,
      "step": 5098
    },
    {
      "epoch": 0.5409505622745597,
      "grad_norm": 0.734491932409554,
      "learning_rate": 4.975909023741833e-05,
      "loss": 1.9217,
      "num_input_tokens_seen": 4011722432,
      "step": 5099
    },
    {
      "epoch": 0.5410566518141311,
      "grad_norm": 1.2403420944381396,
      "learning_rate": 4.975899398051363e-05,
      "loss": 1.9573,
      "num_input_tokens_seen": 4012509152,
      "step": 5100
    },
    {
      "epoch": 0.5411627413537026,
      "grad_norm": 0.8705067345631876,
      "learning_rate": 4.975889770447591e-05,
      "loss": 1.9342,
      "num_input_tokens_seen": 4013295936,
      "step": 5101
    },
    {
      "epoch": 0.5412688308932739,
      "grad_norm": 0.936758721480026,
      "learning_rate": 4.975880140930523e-05,
      "loss": 2.0782,
      "num_input_tokens_seen": 4014082736,
      "step": 5102
    },
    {
      "epoch": 0.5413749204328453,
      "grad_norm": 0.7179907370136223,
      "learning_rate": 4.9758705095001686e-05,
      "loss": 2.0391,
      "num_input_tokens_seen": 4014869504,
      "step": 5103
    },
    {
      "epoch": 0.5414810099724168,
      "grad_norm": 0.7598257181820628,
      "learning_rate": 4.9758608761565334e-05,
      "loss": 2.0384,
      "num_input_tokens_seen": 4015656288,
      "step": 5104
    },
    {
      "epoch": 0.5415870995119881,
      "grad_norm": 0.5697662779456082,
      "learning_rate": 4.975851240899626e-05,
      "loss": 2.0494,
      "num_input_tokens_seen": 4016442960,
      "step": 5105
    },
    {
      "epoch": 0.5416931890515595,
      "grad_norm": 0.6048838137816647,
      "learning_rate": 4.9758416037294534e-05,
      "loss": 1.9879,
      "num_input_tokens_seen": 4017229712,
      "step": 5106
    },
    {
      "epoch": 0.5417992785911309,
      "grad_norm": 0.44798734680963753,
      "learning_rate": 4.975831964646023e-05,
      "loss": 1.9552,
      "num_input_tokens_seen": 4018016544,
      "step": 5107
    },
    {
      "epoch": 0.5419053681307023,
      "grad_norm": 0.6306369228606473,
      "learning_rate": 4.975822323649342e-05,
      "loss": 1.9385,
      "num_input_tokens_seen": 4018803280,
      "step": 5108
    },
    {
      "epoch": 0.5420114576702737,
      "grad_norm": 0.8121913603181461,
      "learning_rate": 4.9758126807394175e-05,
      "loss": 2.0743,
      "num_input_tokens_seen": 4019590096,
      "step": 5109
    },
    {
      "epoch": 0.5421175472098451,
      "grad_norm": 0.51175391637478,
      "learning_rate": 4.9758030359162585e-05,
      "loss": 2.1603,
      "num_input_tokens_seen": 4020376816,
      "step": 5110
    },
    {
      "epoch": 0.5422236367494165,
      "grad_norm": 0.5728153532693174,
      "learning_rate": 4.9757933891798724e-05,
      "loss": 1.9603,
      "num_input_tokens_seen": 4021163552,
      "step": 5111
    },
    {
      "epoch": 0.5423297262889879,
      "grad_norm": 0.5182615370274226,
      "learning_rate": 4.975783740530265e-05,
      "loss": 1.848,
      "num_input_tokens_seen": 4021950352,
      "step": 5112
    },
    {
      "epoch": 0.5424358158285593,
      "grad_norm": 0.5607777106857493,
      "learning_rate": 4.975774089967444e-05,
      "loss": 1.9552,
      "num_input_tokens_seen": 4022737136,
      "step": 5113
    },
    {
      "epoch": 0.5425419053681307,
      "grad_norm": 0.8354269787289559,
      "learning_rate": 4.9757644374914184e-05,
      "loss": 2.1115,
      "num_input_tokens_seen": 4023523792,
      "step": 5114
    },
    {
      "epoch": 0.5426479949077021,
      "grad_norm": 0.8242206762115462,
      "learning_rate": 4.9757547831021945e-05,
      "loss": 2.0231,
      "num_input_tokens_seen": 4024310496,
      "step": 5115
    },
    {
      "epoch": 0.5427540844472735,
      "grad_norm": 0.802503182728987,
      "learning_rate": 4.975745126799779e-05,
      "loss": 1.8645,
      "num_input_tokens_seen": 4025097280,
      "step": 5116
    },
    {
      "epoch": 0.5428601739868449,
      "grad_norm": 0.6548690531524551,
      "learning_rate": 4.975735468584181e-05,
      "loss": 2.013,
      "num_input_tokens_seen": 4025884064,
      "step": 5117
    },
    {
      "epoch": 0.5429662635264163,
      "grad_norm": 1.106509274325189,
      "learning_rate": 4.975725808455408e-05,
      "loss": 1.9974,
      "num_input_tokens_seen": 4026670864,
      "step": 5118
    },
    {
      "epoch": 0.5430723530659877,
      "grad_norm": 1.1007946416628573,
      "learning_rate": 4.9757161464134656e-05,
      "loss": 2.1279,
      "num_input_tokens_seen": 4027457632,
      "step": 5119
    },
    {
      "epoch": 0.5431784426055591,
      "grad_norm": 0.8050113446534854,
      "learning_rate": 4.9757064824583626e-05,
      "loss": 2.2826,
      "num_input_tokens_seen": 4028244400,
      "step": 5120
    },
    {
      "epoch": 0.5432845321451305,
      "grad_norm": 0.8786452706430051,
      "learning_rate": 4.975696816590106e-05,
      "loss": 1.988,
      "num_input_tokens_seen": 4029031152,
      "step": 5121
    },
    {
      "epoch": 0.5433906216847019,
      "grad_norm": 0.7788704994965205,
      "learning_rate": 4.975687148808704e-05,
      "loss": 1.9604,
      "num_input_tokens_seen": 4029817856,
      "step": 5122
    },
    {
      "epoch": 0.5434967112242732,
      "grad_norm": 0.6767836176554891,
      "learning_rate": 4.975677479114164e-05,
      "loss": 1.8814,
      "num_input_tokens_seen": 4030604656,
      "step": 5123
    },
    {
      "epoch": 0.5436028007638447,
      "grad_norm": 0.9657538776297031,
      "learning_rate": 4.975667807506493e-05,
      "loss": 2.1896,
      "num_input_tokens_seen": 4031391376,
      "step": 5124
    },
    {
      "epoch": 0.5437088903034161,
      "grad_norm": 0.5352989024337047,
      "learning_rate": 4.9756581339856986e-05,
      "loss": 1.9694,
      "num_input_tokens_seen": 4032178192,
      "step": 5125
    },
    {
      "epoch": 0.5438149798429874,
      "grad_norm": 0.8706894597779601,
      "learning_rate": 4.9756484585517874e-05,
      "loss": 2.0644,
      "num_input_tokens_seen": 4032964928,
      "step": 5126
    },
    {
      "epoch": 0.5439210693825589,
      "grad_norm": 1.3034707704775674,
      "learning_rate": 4.975638781204768e-05,
      "loss": 1.9251,
      "num_input_tokens_seen": 4033751744,
      "step": 5127
    },
    {
      "epoch": 0.5440271589221303,
      "grad_norm": 0.697378648874942,
      "learning_rate": 4.9756291019446486e-05,
      "loss": 1.9964,
      "num_input_tokens_seen": 4034538560,
      "step": 5128
    },
    {
      "epoch": 0.5441332484617016,
      "grad_norm": 1.0486403189085551,
      "learning_rate": 4.9756194207714346e-05,
      "loss": 2.1381,
      "num_input_tokens_seen": 4035325200,
      "step": 5129
    },
    {
      "epoch": 0.5442393380012731,
      "grad_norm": 0.5707729372898173,
      "learning_rate": 4.975609737685134e-05,
      "loss": 1.9482,
      "num_input_tokens_seen": 4036111984,
      "step": 5130
    },
    {
      "epoch": 0.5443454275408445,
      "grad_norm": 0.6613397355217319,
      "learning_rate": 4.975600052685756e-05,
      "loss": 2.065,
      "num_input_tokens_seen": 4036898752,
      "step": 5131
    },
    {
      "epoch": 0.5444515170804158,
      "grad_norm": 0.5354057874760076,
      "learning_rate": 4.9755903657733075e-05,
      "loss": 2.1933,
      "num_input_tokens_seen": 4037685552,
      "step": 5132
    },
    {
      "epoch": 0.5445576066199873,
      "grad_norm": 0.6869736911132251,
      "learning_rate": 4.975580676947794e-05,
      "loss": 1.9245,
      "num_input_tokens_seen": 4038472176,
      "step": 5133
    },
    {
      "epoch": 0.5446636961595587,
      "grad_norm": 0.43350525798294165,
      "learning_rate": 4.975570986209225e-05,
      "loss": 2.0203,
      "num_input_tokens_seen": 4039258944,
      "step": 5134
    },
    {
      "epoch": 0.54476978569913,
      "grad_norm": 0.5708630245027403,
      "learning_rate": 4.975561293557607e-05,
      "loss": 1.8821,
      "num_input_tokens_seen": 4040045696,
      "step": 5135
    },
    {
      "epoch": 0.5448758752387015,
      "grad_norm": 0.688753477765548,
      "learning_rate": 4.975551598992948e-05,
      "loss": 2.0151,
      "num_input_tokens_seen": 4040832400,
      "step": 5136
    },
    {
      "epoch": 0.5449819647782729,
      "grad_norm": 0.6194353776619375,
      "learning_rate": 4.9755419025152555e-05,
      "loss": 1.9404,
      "num_input_tokens_seen": 4041619136,
      "step": 5137
    },
    {
      "epoch": 0.5450880543178442,
      "grad_norm": 0.7911785183017006,
      "learning_rate": 4.975532204124537e-05,
      "loss": 2.204,
      "num_input_tokens_seen": 4042405872,
      "step": 5138
    },
    {
      "epoch": 0.5451941438574157,
      "grad_norm": 0.5556232121548181,
      "learning_rate": 4.9755225038208e-05,
      "loss": 2.1861,
      "num_input_tokens_seen": 4043192736,
      "step": 5139
    },
    {
      "epoch": 0.5453002333969871,
      "grad_norm": 0.6596544604655057,
      "learning_rate": 4.975512801604051e-05,
      "loss": 1.8791,
      "num_input_tokens_seen": 4043979552,
      "step": 5140
    },
    {
      "epoch": 0.5454063229365584,
      "grad_norm": 0.5125741379578378,
      "learning_rate": 4.975503097474299e-05,
      "loss": 1.9928,
      "num_input_tokens_seen": 4044766288,
      "step": 5141
    },
    {
      "epoch": 0.5455124124761298,
      "grad_norm": 0.5100590037290705,
      "learning_rate": 4.97549339143155e-05,
      "loss": 1.9121,
      "num_input_tokens_seen": 4045553120,
      "step": 5142
    },
    {
      "epoch": 0.5456185020157013,
      "grad_norm": 0.5600274587732332,
      "learning_rate": 4.975483683475814e-05,
      "loss": 2.1095,
      "num_input_tokens_seen": 4046339872,
      "step": 5143
    },
    {
      "epoch": 0.5457245915552726,
      "grad_norm": 0.4144492039236748,
      "learning_rate": 4.9754739736070953e-05,
      "loss": 1.8854,
      "num_input_tokens_seen": 4047126704,
      "step": 5144
    },
    {
      "epoch": 0.545830681094844,
      "grad_norm": 0.5645339185678321,
      "learning_rate": 4.975464261825404e-05,
      "loss": 2.0292,
      "num_input_tokens_seen": 4047913600,
      "step": 5145
    },
    {
      "epoch": 0.5459367706344155,
      "grad_norm": 0.693808642555151,
      "learning_rate": 4.975454548130746e-05,
      "loss": 1.9397,
      "num_input_tokens_seen": 4048700352,
      "step": 5146
    },
    {
      "epoch": 0.5460428601739868,
      "grad_norm": 0.42182126112029666,
      "learning_rate": 4.9754448325231294e-05,
      "loss": 2.0822,
      "num_input_tokens_seen": 4049487120,
      "step": 5147
    },
    {
      "epoch": 0.5461489497135582,
      "grad_norm": 0.780016632097434,
      "learning_rate": 4.975435115002562e-05,
      "loss": 1.9769,
      "num_input_tokens_seen": 4050273856,
      "step": 5148
    },
    {
      "epoch": 0.5462550392531297,
      "grad_norm": 0.5576503617861734,
      "learning_rate": 4.975425395569051e-05,
      "loss": 1.9921,
      "num_input_tokens_seen": 4051060624,
      "step": 5149
    },
    {
      "epoch": 0.546361128792701,
      "grad_norm": 0.5796041228486172,
      "learning_rate": 4.9754156742226035e-05,
      "loss": 1.951,
      "num_input_tokens_seen": 4051847408,
      "step": 5150
    },
    {
      "epoch": 0.5464672183322724,
      "grad_norm": 0.8001189371985962,
      "learning_rate": 4.9754059509632273e-05,
      "loss": 2.0354,
      "num_input_tokens_seen": 4052634272,
      "step": 5151
    },
    {
      "epoch": 0.5465733078718439,
      "grad_norm": 0.5937410495189116,
      "learning_rate": 4.97539622579093e-05,
      "loss": 1.9758,
      "num_input_tokens_seen": 4053420976,
      "step": 5152
    },
    {
      "epoch": 0.5466793974114152,
      "grad_norm": 0.47420670197447384,
      "learning_rate": 4.97538649870572e-05,
      "loss": 2.2,
      "num_input_tokens_seen": 4054207632,
      "step": 5153
    },
    {
      "epoch": 0.5467854869509866,
      "grad_norm": 0.7246068387296786,
      "learning_rate": 4.9753767697076024e-05,
      "loss": 2.0922,
      "num_input_tokens_seen": 4054994288,
      "step": 5154
    },
    {
      "epoch": 0.5468915764905581,
      "grad_norm": 0.6231717626398166,
      "learning_rate": 4.975367038796587e-05,
      "loss": 2.0974,
      "num_input_tokens_seen": 4055781056,
      "step": 5155
    },
    {
      "epoch": 0.5469976660301294,
      "grad_norm": 0.8097679267519753,
      "learning_rate": 4.975357305972681e-05,
      "loss": 1.9571,
      "num_input_tokens_seen": 4056567856,
      "step": 5156
    },
    {
      "epoch": 0.5471037555697008,
      "grad_norm": 0.9106172263975355,
      "learning_rate": 4.975347571235891e-05,
      "loss": 1.8261,
      "num_input_tokens_seen": 4057354624,
      "step": 5157
    },
    {
      "epoch": 0.5472098451092722,
      "grad_norm": 0.7137610238373201,
      "learning_rate": 4.975337834586226e-05,
      "loss": 1.9625,
      "num_input_tokens_seen": 4058141408,
      "step": 5158
    },
    {
      "epoch": 0.5473159346488436,
      "grad_norm": 0.7923354207629467,
      "learning_rate": 4.975328096023692e-05,
      "loss": 1.9018,
      "num_input_tokens_seen": 4058928192,
      "step": 5159
    },
    {
      "epoch": 0.547422024188415,
      "grad_norm": 0.6249760512125927,
      "learning_rate": 4.9753183555482963e-05,
      "loss": 2.0373,
      "num_input_tokens_seen": 4059714928,
      "step": 5160
    },
    {
      "epoch": 0.5475281137279864,
      "grad_norm": 0.9290369858508927,
      "learning_rate": 4.975308613160048e-05,
      "loss": 1.9092,
      "num_input_tokens_seen": 4060501744,
      "step": 5161
    },
    {
      "epoch": 0.5476342032675579,
      "grad_norm": 0.46902046996416275,
      "learning_rate": 4.9752988688589536e-05,
      "loss": 2.0401,
      "num_input_tokens_seen": 4061288512,
      "step": 5162
    },
    {
      "epoch": 0.5477402928071292,
      "grad_norm": 1.251587587246187,
      "learning_rate": 4.9752891226450204e-05,
      "loss": 2.1242,
      "num_input_tokens_seen": 4062075296,
      "step": 5163
    },
    {
      "epoch": 0.5478463823467006,
      "grad_norm": 0.7783054504984142,
      "learning_rate": 4.975279374518257e-05,
      "loss": 2.1457,
      "num_input_tokens_seen": 4062862112,
      "step": 5164
    },
    {
      "epoch": 0.547952471886272,
      "grad_norm": 0.6235607373099432,
      "learning_rate": 4.9752696244786706e-05,
      "loss": 2.1346,
      "num_input_tokens_seen": 4063648912,
      "step": 5165
    },
    {
      "epoch": 0.5480585614258434,
      "grad_norm": 0.5418099550084445,
      "learning_rate": 4.975259872526268e-05,
      "loss": 2.1088,
      "num_input_tokens_seen": 4064435632,
      "step": 5166
    },
    {
      "epoch": 0.5481646509654148,
      "grad_norm": 0.5399080743944806,
      "learning_rate": 4.975250118661057e-05,
      "loss": 2.0628,
      "num_input_tokens_seen": 4065222448,
      "step": 5167
    },
    {
      "epoch": 0.5482707405049863,
      "grad_norm": 0.46473943693887254,
      "learning_rate": 4.975240362883046e-05,
      "loss": 2.1648,
      "num_input_tokens_seen": 4066009152,
      "step": 5168
    },
    {
      "epoch": 0.5483768300445576,
      "grad_norm": 0.4318721675362786,
      "learning_rate": 4.975230605192241e-05,
      "loss": 1.9228,
      "num_input_tokens_seen": 4066795856,
      "step": 5169
    },
    {
      "epoch": 0.548482919584129,
      "grad_norm": 0.510532870304954,
      "learning_rate": 4.975220845588651e-05,
      "loss": 2.0549,
      "num_input_tokens_seen": 4067582576,
      "step": 5170
    },
    {
      "epoch": 0.5485890091237005,
      "grad_norm": 0.49510307010452387,
      "learning_rate": 4.975211084072283e-05,
      "loss": 2.0932,
      "num_input_tokens_seen": 4068369408,
      "step": 5171
    },
    {
      "epoch": 0.5486950986632718,
      "grad_norm": 0.5189094395569986,
      "learning_rate": 4.9752013206431446e-05,
      "loss": 2.2204,
      "num_input_tokens_seen": 4069156176,
      "step": 5172
    },
    {
      "epoch": 0.5488011882028432,
      "grad_norm": 0.5375741634752956,
      "learning_rate": 4.975191555301243e-05,
      "loss": 1.9652,
      "num_input_tokens_seen": 4069942880,
      "step": 5173
    },
    {
      "epoch": 0.5489072777424145,
      "grad_norm": 0.4658893524789165,
      "learning_rate": 4.975181788046586e-05,
      "loss": 1.9946,
      "num_input_tokens_seen": 4070729648,
      "step": 5174
    },
    {
      "epoch": 0.549013367281986,
      "grad_norm": 0.5019666311544613,
      "learning_rate": 4.9751720188791814e-05,
      "loss": 2.0296,
      "num_input_tokens_seen": 4071516448,
      "step": 5175
    },
    {
      "epoch": 0.5491194568215574,
      "grad_norm": 0.4728263130206746,
      "learning_rate": 4.9751622477990355e-05,
      "loss": 1.9881,
      "num_input_tokens_seen": 4072303184,
      "step": 5176
    },
    {
      "epoch": 0.5492255463611287,
      "grad_norm": 0.5346442606823446,
      "learning_rate": 4.9751524748061584e-05,
      "loss": 2.0975,
      "num_input_tokens_seen": 4073089968,
      "step": 5177
    },
    {
      "epoch": 0.5493316359007002,
      "grad_norm": 0.6271036966816683,
      "learning_rate": 4.975142699900554e-05,
      "loss": 1.944,
      "num_input_tokens_seen": 4073876768,
      "step": 5178
    },
    {
      "epoch": 0.5494377254402716,
      "grad_norm": 0.6704353951193648,
      "learning_rate": 4.975132923082234e-05,
      "loss": 1.9003,
      "num_input_tokens_seen": 4074663424,
      "step": 5179
    },
    {
      "epoch": 0.549543814979843,
      "grad_norm": 0.4636310518413402,
      "learning_rate": 4.975123144351204e-05,
      "loss": 1.9619,
      "num_input_tokens_seen": 4075450224,
      "step": 5180
    },
    {
      "epoch": 0.5496499045194144,
      "grad_norm": 0.5907683105980148,
      "learning_rate": 4.97511336370747e-05,
      "loss": 2.0557,
      "num_input_tokens_seen": 4076237136,
      "step": 5181
    },
    {
      "epoch": 0.5497559940589858,
      "grad_norm": 0.4877912471497053,
      "learning_rate": 4.975103581151041e-05,
      "loss": 1.8781,
      "num_input_tokens_seen": 4077023888,
      "step": 5182
    },
    {
      "epoch": 0.5498620835985571,
      "grad_norm": 1.2663718956411514,
      "learning_rate": 4.9750937966819255e-05,
      "loss": 1.7723,
      "num_input_tokens_seen": 4077810784,
      "step": 5183
    },
    {
      "epoch": 0.5499681731381286,
      "grad_norm": 0.6100314845088783,
      "learning_rate": 4.9750840103001294e-05,
      "loss": 2.055,
      "num_input_tokens_seen": 4078597568,
      "step": 5184
    },
    {
      "epoch": 0.5500742626777,
      "grad_norm": 1.010789152801705,
      "learning_rate": 4.9750742220056625e-05,
      "loss": 2.017,
      "num_input_tokens_seen": 4079384368,
      "step": 5185
    },
    {
      "epoch": 0.5501803522172714,
      "grad_norm": 0.6277012409337773,
      "learning_rate": 4.9750644317985294e-05,
      "loss": 2.0348,
      "num_input_tokens_seen": 4080171152,
      "step": 5186
    },
    {
      "epoch": 0.5502864417568428,
      "grad_norm": 0.8517292407842009,
      "learning_rate": 4.975054639678739e-05,
      "loss": 2.075,
      "num_input_tokens_seen": 4080957952,
      "step": 5187
    },
    {
      "epoch": 0.5503925312964142,
      "grad_norm": 0.519846193725249,
      "learning_rate": 4.9750448456462994e-05,
      "loss": 2.077,
      "num_input_tokens_seen": 4081744656,
      "step": 5188
    },
    {
      "epoch": 0.5504986208359856,
      "grad_norm": 0.6378551722701333,
      "learning_rate": 4.975035049701218e-05,
      "loss": 2.0259,
      "num_input_tokens_seen": 4082531536,
      "step": 5189
    },
    {
      "epoch": 0.5506047103755569,
      "grad_norm": 0.5238543311194824,
      "learning_rate": 4.9750252518435025e-05,
      "loss": 2.0445,
      "num_input_tokens_seen": 4083318368,
      "step": 5190
    },
    {
      "epoch": 0.5507107999151284,
      "grad_norm": 0.5256947325790339,
      "learning_rate": 4.9750154520731595e-05,
      "loss": 1.9242,
      "num_input_tokens_seen": 4084105184,
      "step": 5191
    },
    {
      "epoch": 0.5508168894546998,
      "grad_norm": 0.5621140227135901,
      "learning_rate": 4.975005650390197e-05,
      "loss": 2.1008,
      "num_input_tokens_seen": 4084891968,
      "step": 5192
    },
    {
      "epoch": 0.5509229789942711,
      "grad_norm": 0.7046123983955703,
      "learning_rate": 4.974995846794623e-05,
      "loss": 2.0148,
      "num_input_tokens_seen": 4085678704,
      "step": 5193
    },
    {
      "epoch": 0.5510290685338426,
      "grad_norm": 0.6878210747138142,
      "learning_rate": 4.9749860412864445e-05,
      "loss": 1.7913,
      "num_input_tokens_seen": 4086465504,
      "step": 5194
    },
    {
      "epoch": 0.551135158073414,
      "grad_norm": 1.008355463473912,
      "learning_rate": 4.97497623386567e-05,
      "loss": 2.0598,
      "num_input_tokens_seen": 4087252336,
      "step": 5195
    },
    {
      "epoch": 0.5512412476129853,
      "grad_norm": 0.5955061731854826,
      "learning_rate": 4.9749664245323067e-05,
      "loss": 1.9749,
      "num_input_tokens_seen": 4088039056,
      "step": 5196
    },
    {
      "epoch": 0.5513473371525568,
      "grad_norm": 0.7362466673412543,
      "learning_rate": 4.974956613286361e-05,
      "loss": 1.971,
      "num_input_tokens_seen": 4088825808,
      "step": 5197
    },
    {
      "epoch": 0.5514534266921282,
      "grad_norm": 0.5495300663796163,
      "learning_rate": 4.974946800127842e-05,
      "loss": 1.9945,
      "num_input_tokens_seen": 4089612480,
      "step": 5198
    },
    {
      "epoch": 0.5515595162316995,
      "grad_norm": 0.6332099042936662,
      "learning_rate": 4.974936985056757e-05,
      "loss": 2.0846,
      "num_input_tokens_seen": 4090399200,
      "step": 5199
    },
    {
      "epoch": 0.551665605771271,
      "grad_norm": 0.5899542057121303,
      "learning_rate": 4.9749271680731136e-05,
      "loss": 2.0671,
      "num_input_tokens_seen": 4091186080,
      "step": 5200
    },
    {
      "epoch": 0.5517716953108424,
      "grad_norm": 0.46809520563788914,
      "learning_rate": 4.974917349176918e-05,
      "loss": 1.9833,
      "num_input_tokens_seen": 4091972880,
      "step": 5201
    },
    {
      "epoch": 0.5518777848504137,
      "grad_norm": 0.7957280486654401,
      "learning_rate": 4.9749075283681796e-05,
      "loss": 2.066,
      "num_input_tokens_seen": 4092759568,
      "step": 5202
    },
    {
      "epoch": 0.5519838743899852,
      "grad_norm": 0.9340503246628616,
      "learning_rate": 4.974897705646905e-05,
      "loss": 2.0525,
      "num_input_tokens_seen": 4093546304,
      "step": 5203
    },
    {
      "epoch": 0.5520899639295566,
      "grad_norm": 0.5162740437114168,
      "learning_rate": 4.974887881013102e-05,
      "loss": 2.0723,
      "num_input_tokens_seen": 4094333040,
      "step": 5204
    },
    {
      "epoch": 0.5521960534691279,
      "grad_norm": 0.6097299596199182,
      "learning_rate": 4.9748780544667785e-05,
      "loss": 1.9899,
      "num_input_tokens_seen": 4095119872,
      "step": 5205
    },
    {
      "epoch": 0.5523021430086994,
      "grad_norm": 0.5109122587391471,
      "learning_rate": 4.974868226007942e-05,
      "loss": 2.0046,
      "num_input_tokens_seen": 4095906688,
      "step": 5206
    },
    {
      "epoch": 0.5524082325482708,
      "grad_norm": 0.5294549196532338,
      "learning_rate": 4.9748583956365995e-05,
      "loss": 2.0337,
      "num_input_tokens_seen": 4096693504,
      "step": 5207
    },
    {
      "epoch": 0.5525143220878421,
      "grad_norm": 0.6637051821410578,
      "learning_rate": 4.97484856335276e-05,
      "loss": 2.1654,
      "num_input_tokens_seen": 4097480240,
      "step": 5208
    },
    {
      "epoch": 0.5526204116274135,
      "grad_norm": 0.666108278310289,
      "learning_rate": 4.974838729156429e-05,
      "loss": 1.9263,
      "num_input_tokens_seen": 4098267056,
      "step": 5209
    },
    {
      "epoch": 0.552726501166985,
      "grad_norm": 0.802324606731496,
      "learning_rate": 4.9748288930476155e-05,
      "loss": 2.0032,
      "num_input_tokens_seen": 4099053776,
      "step": 5210
    },
    {
      "epoch": 0.5528325907065563,
      "grad_norm": 0.3725325033191277,
      "learning_rate": 4.974819055026328e-05,
      "loss": 1.7985,
      "num_input_tokens_seen": 4099840592,
      "step": 5211
    },
    {
      "epoch": 0.5529386802461277,
      "grad_norm": 0.7782509089131504,
      "learning_rate": 4.974809215092571e-05,
      "loss": 2.1257,
      "num_input_tokens_seen": 4100627312,
      "step": 5212
    },
    {
      "epoch": 0.5530447697856992,
      "grad_norm": 0.6235168463763128,
      "learning_rate": 4.974799373246355e-05,
      "loss": 2.0798,
      "num_input_tokens_seen": 4101414144,
      "step": 5213
    },
    {
      "epoch": 0.5531508593252705,
      "grad_norm": 0.5142229065146658,
      "learning_rate": 4.9747895294876867e-05,
      "loss": 2.0349,
      "num_input_tokens_seen": 4102200912,
      "step": 5214
    },
    {
      "epoch": 0.5532569488648419,
      "grad_norm": 0.9689862453726645,
      "learning_rate": 4.974779683816574e-05,
      "loss": 2.0347,
      "num_input_tokens_seen": 4102987568,
      "step": 5215
    },
    {
      "epoch": 0.5533630384044134,
      "grad_norm": 0.735286024194093,
      "learning_rate": 4.9747698362330235e-05,
      "loss": 2.094,
      "num_input_tokens_seen": 4103774320,
      "step": 5216
    },
    {
      "epoch": 0.5534691279439847,
      "grad_norm": 0.6271578874458438,
      "learning_rate": 4.974759986737044e-05,
      "loss": 2.0628,
      "num_input_tokens_seen": 4104561008,
      "step": 5217
    },
    {
      "epoch": 0.5535752174835561,
      "grad_norm": 0.9354216569344914,
      "learning_rate": 4.9747501353286424e-05,
      "loss": 2.0337,
      "num_input_tokens_seen": 4105347808,
      "step": 5218
    },
    {
      "epoch": 0.5536813070231276,
      "grad_norm": 1.0817697035525278,
      "learning_rate": 4.974740282007827e-05,
      "loss": 1.9349,
      "num_input_tokens_seen": 4106134592,
      "step": 5219
    },
    {
      "epoch": 0.5537873965626989,
      "grad_norm": 1.2736905917101817,
      "learning_rate": 4.9747304267746045e-05,
      "loss": 2.0314,
      "num_input_tokens_seen": 4106921376,
      "step": 5220
    },
    {
      "epoch": 0.5538934861022703,
      "grad_norm": 0.7189657679220596,
      "learning_rate": 4.9747205696289825e-05,
      "loss": 2.0374,
      "num_input_tokens_seen": 4107708000,
      "step": 5221
    },
    {
      "epoch": 0.5539995756418418,
      "grad_norm": 0.9022726589442885,
      "learning_rate": 4.9747107105709694e-05,
      "loss": 1.8349,
      "num_input_tokens_seen": 4108494768,
      "step": 5222
    },
    {
      "epoch": 0.5541056651814131,
      "grad_norm": 1.8217286075106525,
      "learning_rate": 4.974700849600573e-05,
      "loss": 2.0529,
      "num_input_tokens_seen": 4109281568,
      "step": 5223
    },
    {
      "epoch": 0.5542117547209845,
      "grad_norm": 0.6849767871942477,
      "learning_rate": 4.9746909867177994e-05,
      "loss": 1.9624,
      "num_input_tokens_seen": 4110068416,
      "step": 5224
    },
    {
      "epoch": 0.5543178442605559,
      "grad_norm": 0.9180033783363271,
      "learning_rate": 4.974681121922657e-05,
      "loss": 1.9261,
      "num_input_tokens_seen": 4110855216,
      "step": 5225
    },
    {
      "epoch": 0.5544239338001273,
      "grad_norm": 0.736876008622085,
      "learning_rate": 4.9746712552151554e-05,
      "loss": 1.8865,
      "num_input_tokens_seen": 4111642016,
      "step": 5226
    },
    {
      "epoch": 0.5545300233396987,
      "grad_norm": 0.760041021398582,
      "learning_rate": 4.9746613865953e-05,
      "loss": 2.0925,
      "num_input_tokens_seen": 4112428736,
      "step": 5227
    },
    {
      "epoch": 0.5546361128792701,
      "grad_norm": 0.7290436655936942,
      "learning_rate": 4.974651516063097e-05,
      "loss": 2.1568,
      "num_input_tokens_seen": 4113215504,
      "step": 5228
    },
    {
      "epoch": 0.5547422024188415,
      "grad_norm": 0.5848405943438467,
      "learning_rate": 4.974641643618558e-05,
      "loss": 2.015,
      "num_input_tokens_seen": 4114002288,
      "step": 5229
    },
    {
      "epoch": 0.5548482919584129,
      "grad_norm": 0.726298215954441,
      "learning_rate": 4.974631769261687e-05,
      "loss": 1.8951,
      "num_input_tokens_seen": 4114789104,
      "step": 5230
    },
    {
      "epoch": 0.5549543814979843,
      "grad_norm": 0.8712987807304543,
      "learning_rate": 4.974621892992495e-05,
      "loss": 2.0609,
      "num_input_tokens_seen": 4115575840,
      "step": 5231
    },
    {
      "epoch": 0.5550604710375557,
      "grad_norm": 0.5007851918027728,
      "learning_rate": 4.9746120148109866e-05,
      "loss": 2.0009,
      "num_input_tokens_seen": 4116362672,
      "step": 5232
    },
    {
      "epoch": 0.5551665605771271,
      "grad_norm": 0.611875752816506,
      "learning_rate": 4.9746021347171705e-05,
      "loss": 2.0571,
      "num_input_tokens_seen": 4117149376,
      "step": 5233
    },
    {
      "epoch": 0.5552726501166985,
      "grad_norm": 0.49823592150203705,
      "learning_rate": 4.974592252711055e-05,
      "loss": 1.8922,
      "num_input_tokens_seen": 4117936176,
      "step": 5234
    },
    {
      "epoch": 0.5553787396562699,
      "grad_norm": 0.5068861251041966,
      "learning_rate": 4.9745823687926465e-05,
      "loss": 2.0332,
      "num_input_tokens_seen": 4118722912,
      "step": 5235
    },
    {
      "epoch": 0.5554848291958413,
      "grad_norm": 0.4717393237754313,
      "learning_rate": 4.974572482961954e-05,
      "loss": 2.1411,
      "num_input_tokens_seen": 4119509664,
      "step": 5236
    },
    {
      "epoch": 0.5555909187354127,
      "grad_norm": 1.3530955051143063,
      "learning_rate": 4.974562595218985e-05,
      "loss": 2.0917,
      "num_input_tokens_seen": 4120296528,
      "step": 5237
    },
    {
      "epoch": 0.5556970082749841,
      "grad_norm": 1.555845295362197,
      "learning_rate": 4.9745527055637455e-05,
      "loss": 1.7463,
      "num_input_tokens_seen": 4121083328,
      "step": 5238
    },
    {
      "epoch": 0.5558030978145555,
      "grad_norm": 1.215747980594278,
      "learning_rate": 4.9745428139962447e-05,
      "loss": 1.9939,
      "num_input_tokens_seen": 4121870144,
      "step": 5239
    },
    {
      "epoch": 0.5559091873541269,
      "grad_norm": 2.6511594169314487,
      "learning_rate": 4.9745329205164904e-05,
      "loss": 2.1201,
      "num_input_tokens_seen": 4122656848,
      "step": 5240
    },
    {
      "epoch": 0.5560152768936982,
      "grad_norm": 2.3804976331670917,
      "learning_rate": 4.974523025124489e-05,
      "loss": 1.9855,
      "num_input_tokens_seen": 4123443696,
      "step": 5241
    },
    {
      "epoch": 0.5561213664332697,
      "grad_norm": 0.9598642456315962,
      "learning_rate": 4.974513127820249e-05,
      "loss": 1.9513,
      "num_input_tokens_seen": 4124230528,
      "step": 5242
    },
    {
      "epoch": 0.5562274559728411,
      "grad_norm": 1.2412435858136814,
      "learning_rate": 4.974503228603778e-05,
      "loss": 1.975,
      "num_input_tokens_seen": 4125017344,
      "step": 5243
    },
    {
      "epoch": 0.5563335455124124,
      "grad_norm": 1.262382435680736,
      "learning_rate": 4.974493327475083e-05,
      "loss": 2.0248,
      "num_input_tokens_seen": 4125804128,
      "step": 5244
    },
    {
      "epoch": 0.5564396350519839,
      "grad_norm": 1.592958699770454,
      "learning_rate": 4.974483424434173e-05,
      "loss": 1.974,
      "num_input_tokens_seen": 4126591008,
      "step": 5245
    },
    {
      "epoch": 0.5565457245915553,
      "grad_norm": 1.9012604021150725,
      "learning_rate": 4.9744735194810545e-05,
      "loss": 2.0415,
      "num_input_tokens_seen": 4127377744,
      "step": 5246
    },
    {
      "epoch": 0.5566518141311266,
      "grad_norm": 1.553249855679619,
      "learning_rate": 4.974463612615735e-05,
      "loss": 2.0471,
      "num_input_tokens_seen": 4128164496,
      "step": 5247
    },
    {
      "epoch": 0.5567579036706981,
      "grad_norm": 9.739044761636219,
      "learning_rate": 4.9744537038382226e-05,
      "loss": 1.9305,
      "num_input_tokens_seen": 4128951280,
      "step": 5248
    },
    {
      "epoch": 0.5568639932102695,
      "grad_norm": 0.7948661969400213,
      "learning_rate": 4.9744437931485255e-05,
      "loss": 2.1049,
      "num_input_tokens_seen": 4129738016,
      "step": 5249
    },
    {
      "epoch": 0.5569700827498408,
      "grad_norm": 3.6512684803192554,
      "learning_rate": 4.974433880546651e-05,
      "loss": 2.0054,
      "num_input_tokens_seen": 4130524848,
      "step": 5250
    },
    {
      "epoch": 0.5570761722894123,
      "grad_norm": 1.123606515963275,
      "learning_rate": 4.974423966032606e-05,
      "loss": 1.857,
      "num_input_tokens_seen": 4131311648,
      "step": 5251
    },
    {
      "epoch": 0.5571822618289837,
      "grad_norm": 1.4175181812570392,
      "learning_rate": 4.974414049606399e-05,
      "loss": 2.1574,
      "num_input_tokens_seen": 4132098416,
      "step": 5252
    },
    {
      "epoch": 0.557288351368555,
      "grad_norm": 1.3455502773664423,
      "learning_rate": 4.974404131268037e-05,
      "loss": 1.9133,
      "num_input_tokens_seen": 4132885216,
      "step": 5253
    },
    {
      "epoch": 0.5573944409081265,
      "grad_norm": 3.9490045509399367,
      "learning_rate": 4.974394211017529e-05,
      "loss": 2.147,
      "num_input_tokens_seen": 4133671968,
      "step": 5254
    },
    {
      "epoch": 0.5575005304476979,
      "grad_norm": 2.4348745762098667,
      "learning_rate": 4.974384288854881e-05,
      "loss": 1.9735,
      "num_input_tokens_seen": 4134458768,
      "step": 5255
    },
    {
      "epoch": 0.5576066199872692,
      "grad_norm": 0.8090400175780419,
      "learning_rate": 4.974374364780102e-05,
      "loss": 2.1035,
      "num_input_tokens_seen": 4135245456,
      "step": 5256
    },
    {
      "epoch": 0.5577127095268406,
      "grad_norm": 2.102073189810786,
      "learning_rate": 4.9743644387931986e-05,
      "loss": 2.0341,
      "num_input_tokens_seen": 4136032256,
      "step": 5257
    },
    {
      "epoch": 0.5578187990664121,
      "grad_norm": 1.4731502246481616,
      "learning_rate": 4.974354510894179e-05,
      "loss": 2.021,
      "num_input_tokens_seen": 4136819040,
      "step": 5258
    },
    {
      "epoch": 0.5579248886059834,
      "grad_norm": 0.8867035265216451,
      "learning_rate": 4.9743445810830514e-05,
      "loss": 1.8815,
      "num_input_tokens_seen": 4137605856,
      "step": 5259
    },
    {
      "epoch": 0.5580309781455548,
      "grad_norm": 0.9556235344458118,
      "learning_rate": 4.9743346493598226e-05,
      "loss": 2.016,
      "num_input_tokens_seen": 4138392528,
      "step": 5260
    },
    {
      "epoch": 0.5581370676851263,
      "grad_norm": 1.0579669884336067,
      "learning_rate": 4.9743247157245e-05,
      "loss": 2.0529,
      "num_input_tokens_seen": 4139179280,
      "step": 5261
    },
    {
      "epoch": 0.5582431572246976,
      "grad_norm": 0.8800824841950898,
      "learning_rate": 4.9743147801770925e-05,
      "loss": 1.9456,
      "num_input_tokens_seen": 4139966000,
      "step": 5262
    },
    {
      "epoch": 0.558349246764269,
      "grad_norm": 0.8841976858073478,
      "learning_rate": 4.9743048427176075e-05,
      "loss": 1.7866,
      "num_input_tokens_seen": 4140752800,
      "step": 5263
    },
    {
      "epoch": 0.5584553363038405,
      "grad_norm": 0.974892009093993,
      "learning_rate": 4.974294903346052e-05,
      "loss": 2.0063,
      "num_input_tokens_seen": 4141539504,
      "step": 5264
    },
    {
      "epoch": 0.5585614258434118,
      "grad_norm": 0.7959403416168745,
      "learning_rate": 4.9742849620624335e-05,
      "loss": 1.8394,
      "num_input_tokens_seen": 4142326240,
      "step": 5265
    },
    {
      "epoch": 0.5586675153829832,
      "grad_norm": 2.824126729163662,
      "learning_rate": 4.974275018866761e-05,
      "loss": 1.9866,
      "num_input_tokens_seen": 4143113040,
      "step": 5266
    },
    {
      "epoch": 0.5587736049225547,
      "grad_norm": 0.9989229443980688,
      "learning_rate": 4.97426507375904e-05,
      "loss": 1.9858,
      "num_input_tokens_seen": 4143899792,
      "step": 5267
    },
    {
      "epoch": 0.558879694462126,
      "grad_norm": 2.234920929524667,
      "learning_rate": 4.9742551267392804e-05,
      "loss": 1.9505,
      "num_input_tokens_seen": 4144686528,
      "step": 5268
    },
    {
      "epoch": 0.5589857840016974,
      "grad_norm": 2.729539009472495,
      "learning_rate": 4.97424517780749e-05,
      "loss": 2.1044,
      "num_input_tokens_seen": 4145473280,
      "step": 5269
    },
    {
      "epoch": 0.5590918735412689,
      "grad_norm": 2.2977144398176677,
      "learning_rate": 4.974235226963674e-05,
      "loss": 2.0659,
      "num_input_tokens_seen": 4146259984,
      "step": 5270
    },
    {
      "epoch": 0.5591979630808402,
      "grad_norm": 1.703901174525452,
      "learning_rate": 4.974225274207842e-05,
      "loss": 2.1316,
      "num_input_tokens_seen": 4147046640,
      "step": 5271
    },
    {
      "epoch": 0.5593040526204116,
      "grad_norm": 1.3624375258940888,
      "learning_rate": 4.9742153195400016e-05,
      "loss": 2.0249,
      "num_input_tokens_seen": 4147833424,
      "step": 5272
    },
    {
      "epoch": 0.559410142159983,
      "grad_norm": 1.0886954819633905,
      "learning_rate": 4.9742053629601606e-05,
      "loss": 1.9324,
      "num_input_tokens_seen": 4148620160,
      "step": 5273
    },
    {
      "epoch": 0.5595162316995544,
      "grad_norm": 1.060146926875567,
      "learning_rate": 4.974195404468325e-05,
      "loss": 2.0954,
      "num_input_tokens_seen": 4149406928,
      "step": 5274
    },
    {
      "epoch": 0.5596223212391258,
      "grad_norm": 0.6899947079171427,
      "learning_rate": 4.974185444064505e-05,
      "loss": 2.0199,
      "num_input_tokens_seen": 4150193696,
      "step": 5275
    },
    {
      "epoch": 0.5597284107786972,
      "grad_norm": 0.9125989442495829,
      "learning_rate": 4.974175481748706e-05,
      "loss": 2.2059,
      "num_input_tokens_seen": 4150980368,
      "step": 5276
    },
    {
      "epoch": 0.5598345003182686,
      "grad_norm": 1.0170243145590352,
      "learning_rate": 4.974165517520938e-05,
      "loss": 1.8989,
      "num_input_tokens_seen": 4151767168,
      "step": 5277
    },
    {
      "epoch": 0.55994058985784,
      "grad_norm": 0.653998193351013,
      "learning_rate": 4.9741555513812065e-05,
      "loss": 2.0104,
      "num_input_tokens_seen": 4152553904,
      "step": 5278
    },
    {
      "epoch": 0.5600466793974114,
      "grad_norm": 0.69104808199278,
      "learning_rate": 4.974145583329521e-05,
      "loss": 2.1117,
      "num_input_tokens_seen": 4153340672,
      "step": 5279
    },
    {
      "epoch": 0.5601527689369828,
      "grad_norm": 0.6131579273756151,
      "learning_rate": 4.9741356133658876e-05,
      "loss": 1.9374,
      "num_input_tokens_seen": 4154127392,
      "step": 5280
    },
    {
      "epoch": 0.5602588584765542,
      "grad_norm": 0.7855082328153306,
      "learning_rate": 4.974125641490316e-05,
      "loss": 2.0307,
      "num_input_tokens_seen": 4154914144,
      "step": 5281
    },
    {
      "epoch": 0.5603649480161256,
      "grad_norm": 0.8055939030239126,
      "learning_rate": 4.974115667702812e-05,
      "loss": 1.852,
      "num_input_tokens_seen": 4155700912,
      "step": 5282
    },
    {
      "epoch": 0.560471037555697,
      "grad_norm": 0.8360828816739226,
      "learning_rate": 4.9741056920033835e-05,
      "loss": 2.0,
      "num_input_tokens_seen": 4156487648,
      "step": 5283
    },
    {
      "epoch": 0.5605771270952684,
      "grad_norm": 0.7602349219955556,
      "learning_rate": 4.974095714392039e-05,
      "loss": 2.0126,
      "num_input_tokens_seen": 4157274448,
      "step": 5284
    },
    {
      "epoch": 0.5606832166348398,
      "grad_norm": 0.7695397710164303,
      "learning_rate": 4.974085734868786e-05,
      "loss": 1.9235,
      "num_input_tokens_seen": 4158061264,
      "step": 5285
    },
    {
      "epoch": 0.5607893061744113,
      "grad_norm": 0.6911850343889054,
      "learning_rate": 4.974075753433633e-05,
      "loss": 1.9396,
      "num_input_tokens_seen": 4158848048,
      "step": 5286
    },
    {
      "epoch": 0.5608953957139826,
      "grad_norm": 0.711516500659024,
      "learning_rate": 4.974065770086586e-05,
      "loss": 2.1232,
      "num_input_tokens_seen": 4159634784,
      "step": 5287
    },
    {
      "epoch": 0.561001485253554,
      "grad_norm": 0.47223769524954146,
      "learning_rate": 4.974055784827653e-05,
      "loss": 2.1392,
      "num_input_tokens_seen": 4160421472,
      "step": 5288
    },
    {
      "epoch": 0.5611075747931255,
      "grad_norm": 0.584737478660786,
      "learning_rate": 4.9740457976568434e-05,
      "loss": 2.0367,
      "num_input_tokens_seen": 4161208240,
      "step": 5289
    },
    {
      "epoch": 0.5612136643326968,
      "grad_norm": 0.5314500462902826,
      "learning_rate": 4.974035808574163e-05,
      "loss": 2.1648,
      "num_input_tokens_seen": 4161994944,
      "step": 5290
    },
    {
      "epoch": 0.5613197538722682,
      "grad_norm": 0.5571770004880557,
      "learning_rate": 4.974025817579621e-05,
      "loss": 1.9786,
      "num_input_tokens_seen": 4162781744,
      "step": 5291
    },
    {
      "epoch": 0.5614258434118395,
      "grad_norm": 0.5392627610693791,
      "learning_rate": 4.974015824673224e-05,
      "loss": 1.8959,
      "num_input_tokens_seen": 4163568528,
      "step": 5292
    },
    {
      "epoch": 0.561531932951411,
      "grad_norm": 0.7877797801604525,
      "learning_rate": 4.974005829854979e-05,
      "loss": 1.9208,
      "num_input_tokens_seen": 4164355280,
      "step": 5293
    },
    {
      "epoch": 0.5616380224909824,
      "grad_norm": 0.5086942353456267,
      "learning_rate": 4.973995833124897e-05,
      "loss": 1.9606,
      "num_input_tokens_seen": 4165142064,
      "step": 5294
    },
    {
      "epoch": 0.5617441120305537,
      "grad_norm": 0.8372848336384826,
      "learning_rate": 4.973985834482982e-05,
      "loss": 2.1139,
      "num_input_tokens_seen": 4165928752,
      "step": 5295
    },
    {
      "epoch": 0.5618502015701252,
      "grad_norm": 0.6085630442704437,
      "learning_rate": 4.973975833929245e-05,
      "loss": 1.9097,
      "num_input_tokens_seen": 4166715504,
      "step": 5296
    },
    {
      "epoch": 0.5619562911096966,
      "grad_norm": 0.9752674060921358,
      "learning_rate": 4.9739658314636906e-05,
      "loss": 2.1587,
      "num_input_tokens_seen": 4167502192,
      "step": 5297
    },
    {
      "epoch": 0.562062380649268,
      "grad_norm": 0.979308163202372,
      "learning_rate": 4.973955827086329e-05,
      "loss": 2.0866,
      "num_input_tokens_seen": 4168288944,
      "step": 5298
    },
    {
      "epoch": 0.5621684701888394,
      "grad_norm": 0.566653688908466,
      "learning_rate": 4.973945820797166e-05,
      "loss": 1.9809,
      "num_input_tokens_seen": 4169075776,
      "step": 5299
    },
    {
      "epoch": 0.5622745597284108,
      "grad_norm": 0.5534158028917864,
      "learning_rate": 4.973935812596211e-05,
      "loss": 2.0864,
      "num_input_tokens_seen": 4169862592,
      "step": 5300
    },
    {
      "epoch": 0.5623806492679821,
      "grad_norm": 0.5126347643284149,
      "learning_rate": 4.9739258024834706e-05,
      "loss": 1.9325,
      "num_input_tokens_seen": 4170649424,
      "step": 5301
    },
    {
      "epoch": 0.5624867388075536,
      "grad_norm": 0.47307300906347416,
      "learning_rate": 4.973915790458953e-05,
      "loss": 2.0287,
      "num_input_tokens_seen": 4171436224,
      "step": 5302
    },
    {
      "epoch": 0.562592828347125,
      "grad_norm": 0.6758586854117763,
      "learning_rate": 4.973905776522666e-05,
      "loss": 2.0136,
      "num_input_tokens_seen": 4172222912,
      "step": 5303
    },
    {
      "epoch": 0.5626989178866963,
      "grad_norm": 0.6194203150309241,
      "learning_rate": 4.9738957606746175e-05,
      "loss": 1.8345,
      "num_input_tokens_seen": 4173009744,
      "step": 5304
    },
    {
      "epoch": 0.5628050074262678,
      "grad_norm": 0.6146006292342282,
      "learning_rate": 4.973885742914814e-05,
      "loss": 1.9515,
      "num_input_tokens_seen": 4173796512,
      "step": 5305
    },
    {
      "epoch": 0.5629110969658392,
      "grad_norm": 0.8129616511400648,
      "learning_rate": 4.9738757232432645e-05,
      "loss": 2.0436,
      "num_input_tokens_seen": 4174583248,
      "step": 5306
    },
    {
      "epoch": 0.5630171865054105,
      "grad_norm": 0.6687002391091452,
      "learning_rate": 4.9738657016599767e-05,
      "loss": 1.874,
      "num_input_tokens_seen": 4175370064,
      "step": 5307
    },
    {
      "epoch": 0.5631232760449819,
      "grad_norm": 0.6608205811976986,
      "learning_rate": 4.9738556781649584e-05,
      "loss": 1.8087,
      "num_input_tokens_seen": 4176156928,
      "step": 5308
    },
    {
      "epoch": 0.5632293655845534,
      "grad_norm": 0.6261551891107944,
      "learning_rate": 4.973845652758217e-05,
      "loss": 2.0837,
      "num_input_tokens_seen": 4176943664,
      "step": 5309
    },
    {
      "epoch": 0.5633354551241248,
      "grad_norm": 0.6389291188894268,
      "learning_rate": 4.9738356254397595e-05,
      "loss": 1.9992,
      "num_input_tokens_seen": 4177730416,
      "step": 5310
    },
    {
      "epoch": 0.5634415446636961,
      "grad_norm": 0.685875869686522,
      "learning_rate": 4.973825596209595e-05,
      "loss": 2.0629,
      "num_input_tokens_seen": 4178517184,
      "step": 5311
    },
    {
      "epoch": 0.5635476342032676,
      "grad_norm": 0.48508407099289463,
      "learning_rate": 4.97381556506773e-05,
      "loss": 2.04,
      "num_input_tokens_seen": 4179303920,
      "step": 5312
    },
    {
      "epoch": 0.563653723742839,
      "grad_norm": 0.5164628028192162,
      "learning_rate": 4.9738055320141734e-05,
      "loss": 1.9162,
      "num_input_tokens_seen": 4180090880,
      "step": 5313
    },
    {
      "epoch": 0.5637598132824103,
      "grad_norm": 0.5992299857771172,
      "learning_rate": 4.9737954970489325e-05,
      "loss": 2.0258,
      "num_input_tokens_seen": 4180877600,
      "step": 5314
    },
    {
      "epoch": 0.5638659028219818,
      "grad_norm": 0.5928291394033005,
      "learning_rate": 4.973785460172015e-05,
      "loss": 2.122,
      "num_input_tokens_seen": 4181664400,
      "step": 5315
    },
    {
      "epoch": 0.5639719923615532,
      "grad_norm": 0.5743260736143991,
      "learning_rate": 4.9737754213834285e-05,
      "loss": 2.0565,
      "num_input_tokens_seen": 4182451248,
      "step": 5316
    },
    {
      "epoch": 0.5640780819011245,
      "grad_norm": 0.9290280224844053,
      "learning_rate": 4.9737653806831816e-05,
      "loss": 1.9631,
      "num_input_tokens_seen": 4183238128,
      "step": 5317
    },
    {
      "epoch": 0.564184171440696,
      "grad_norm": 0.41489356570122654,
      "learning_rate": 4.973755338071281e-05,
      "loss": 1.9719,
      "num_input_tokens_seen": 4184024976,
      "step": 5318
    },
    {
      "epoch": 0.5642902609802674,
      "grad_norm": 1.0257857576483054,
      "learning_rate": 4.973745293547735e-05,
      "loss": 2.0423,
      "num_input_tokens_seen": 4184811840,
      "step": 5319
    },
    {
      "epoch": 0.5643963505198387,
      "grad_norm": 0.6578177360491013,
      "learning_rate": 4.973735247112551e-05,
      "loss": 2.0631,
      "num_input_tokens_seen": 4185598544,
      "step": 5320
    },
    {
      "epoch": 0.5645024400594102,
      "grad_norm": 0.6203385484303454,
      "learning_rate": 4.9737251987657366e-05,
      "loss": 2.0947,
      "num_input_tokens_seen": 4186385328,
      "step": 5321
    },
    {
      "epoch": 0.5646085295989816,
      "grad_norm": 0.6328266770572402,
      "learning_rate": 4.9737151485073e-05,
      "loss": 2.0391,
      "num_input_tokens_seen": 4187172080,
      "step": 5322
    },
    {
      "epoch": 0.5647146191385529,
      "grad_norm": 0.4847322229680529,
      "learning_rate": 4.97370509633725e-05,
      "loss": 1.9495,
      "num_input_tokens_seen": 4187958800,
      "step": 5323
    },
    {
      "epoch": 0.5648207086781243,
      "grad_norm": 0.4529611415822005,
      "learning_rate": 4.973695042255592e-05,
      "loss": 1.9138,
      "num_input_tokens_seen": 4188745584,
      "step": 5324
    },
    {
      "epoch": 0.5649267982176958,
      "grad_norm": 0.5329843650765144,
      "learning_rate": 4.9736849862623356e-05,
      "loss": 2.1027,
      "num_input_tokens_seen": 4189532480,
      "step": 5325
    },
    {
      "epoch": 0.5650328877572671,
      "grad_norm": 0.7158662840031651,
      "learning_rate": 4.973674928357488e-05,
      "loss": 1.9014,
      "num_input_tokens_seen": 4190319264,
      "step": 5326
    },
    {
      "epoch": 0.5651389772968385,
      "grad_norm": 1.0110649134666505,
      "learning_rate": 4.973664868541057e-05,
      "loss": 2.0571,
      "num_input_tokens_seen": 4191106032,
      "step": 5327
    },
    {
      "epoch": 0.56524506683641,
      "grad_norm": 0.45839858094008973,
      "learning_rate": 4.9736548068130504e-05,
      "loss": 1.976,
      "num_input_tokens_seen": 4191892752,
      "step": 5328
    },
    {
      "epoch": 0.5653511563759813,
      "grad_norm": 0.7272809046768928,
      "learning_rate": 4.973644743173476e-05,
      "loss": 2.0425,
      "num_input_tokens_seen": 4192679520,
      "step": 5329
    },
    {
      "epoch": 0.5654572459155527,
      "grad_norm": 0.6031071176084983,
      "learning_rate": 4.973634677622342e-05,
      "loss": 2.1518,
      "num_input_tokens_seen": 4193466320,
      "step": 5330
    },
    {
      "epoch": 0.5655633354551242,
      "grad_norm": 0.5234969292918352,
      "learning_rate": 4.973624610159655e-05,
      "loss": 1.9479,
      "num_input_tokens_seen": 4194253136,
      "step": 5331
    },
    {
      "epoch": 0.5656694249946955,
      "grad_norm": 0.8994537834579276,
      "learning_rate": 4.9736145407854234e-05,
      "loss": 1.9532,
      "num_input_tokens_seen": 4195039968,
      "step": 5332
    },
    {
      "epoch": 0.5657755145342669,
      "grad_norm": 0.7703739089656901,
      "learning_rate": 4.973604469499655e-05,
      "loss": 2.1015,
      "num_input_tokens_seen": 4195826656,
      "step": 5333
    },
    {
      "epoch": 0.5658816040738384,
      "grad_norm": 0.550726481398839,
      "learning_rate": 4.9735943963023576e-05,
      "loss": 1.9973,
      "num_input_tokens_seen": 4196613376,
      "step": 5334
    },
    {
      "epoch": 0.5659876936134097,
      "grad_norm": 0.47928656304297795,
      "learning_rate": 4.97358432119354e-05,
      "loss": 1.9399,
      "num_input_tokens_seen": 4197400192,
      "step": 5335
    },
    {
      "epoch": 0.5660937831529811,
      "grad_norm": 0.587368031173242,
      "learning_rate": 4.973574244173209e-05,
      "loss": 1.8534,
      "num_input_tokens_seen": 4198186976,
      "step": 5336
    },
    {
      "epoch": 0.5661998726925526,
      "grad_norm": 0.5304535971417992,
      "learning_rate": 4.973564165241371e-05,
      "loss": 2.1231,
      "num_input_tokens_seen": 4198973776,
      "step": 5337
    },
    {
      "epoch": 0.5663059622321239,
      "grad_norm": 0.47933946780811254,
      "learning_rate": 4.9735540843980364e-05,
      "loss": 2.0584,
      "num_input_tokens_seen": 4199760528,
      "step": 5338
    },
    {
      "epoch": 0.5664120517716953,
      "grad_norm": 0.5814965440066883,
      "learning_rate": 4.973544001643211e-05,
      "loss": 2.0757,
      "num_input_tokens_seen": 4200547232,
      "step": 5339
    },
    {
      "epoch": 0.5665181413112667,
      "grad_norm": 0.5977398247001299,
      "learning_rate": 4.973533916976904e-05,
      "loss": 2.1887,
      "num_input_tokens_seen": 4201333968,
      "step": 5340
    },
    {
      "epoch": 0.5666242308508381,
      "grad_norm": 0.524631854490096,
      "learning_rate": 4.973523830399123e-05,
      "loss": 2.1749,
      "num_input_tokens_seen": 4202120720,
      "step": 5341
    },
    {
      "epoch": 0.5667303203904095,
      "grad_norm": 0.49388955498074855,
      "learning_rate": 4.973513741909874e-05,
      "loss": 1.9103,
      "num_input_tokens_seen": 4202907520,
      "step": 5342
    },
    {
      "epoch": 0.5668364099299809,
      "grad_norm": 0.5220656333463971,
      "learning_rate": 4.973503651509167e-05,
      "loss": 1.9642,
      "num_input_tokens_seen": 4203694240,
      "step": 5343
    },
    {
      "epoch": 0.5669424994695523,
      "grad_norm": 0.5597781606161442,
      "learning_rate": 4.973493559197009e-05,
      "loss": 1.9481,
      "num_input_tokens_seen": 4204480992,
      "step": 5344
    },
    {
      "epoch": 0.5670485890091237,
      "grad_norm": 0.6363567962323411,
      "learning_rate": 4.9734834649734074e-05,
      "loss": 2.2283,
      "num_input_tokens_seen": 4205267728,
      "step": 5345
    },
    {
      "epoch": 0.5671546785486951,
      "grad_norm": 0.744390871341399,
      "learning_rate": 4.9734733688383704e-05,
      "loss": 1.9381,
      "num_input_tokens_seen": 4206054528,
      "step": 5346
    },
    {
      "epoch": 0.5672607680882665,
      "grad_norm": 0.5976101258695158,
      "learning_rate": 4.973463270791906e-05,
      "loss": 1.9226,
      "num_input_tokens_seen": 4206841200,
      "step": 5347
    },
    {
      "epoch": 0.5673668576278379,
      "grad_norm": 0.8620182863810764,
      "learning_rate": 4.9734531708340214e-05,
      "loss": 1.9909,
      "num_input_tokens_seen": 4207627840,
      "step": 5348
    },
    {
      "epoch": 0.5674729471674093,
      "grad_norm": 0.6217144752884427,
      "learning_rate": 4.973443068964725e-05,
      "loss": 2.0318,
      "num_input_tokens_seen": 4208414544,
      "step": 5349
    },
    {
      "epoch": 0.5675790367069807,
      "grad_norm": 0.6311478345069628,
      "learning_rate": 4.973432965184024e-05,
      "loss": 1.9643,
      "num_input_tokens_seen": 4209201344,
      "step": 5350
    },
    {
      "epoch": 0.5676851262465521,
      "grad_norm": 0.4509380700394178,
      "learning_rate": 4.9734228594919275e-05,
      "loss": 1.9923,
      "num_input_tokens_seen": 4209988080,
      "step": 5351
    },
    {
      "epoch": 0.5677912157861235,
      "grad_norm": 0.54333031084784,
      "learning_rate": 4.973412751888442e-05,
      "loss": 2.0475,
      "num_input_tokens_seen": 4210774816,
      "step": 5352
    },
    {
      "epoch": 0.5678973053256949,
      "grad_norm": 0.6026249614836344,
      "learning_rate": 4.9734026423735746e-05,
      "loss": 2.0275,
      "num_input_tokens_seen": 4211561600,
      "step": 5353
    },
    {
      "epoch": 0.5680033948652663,
      "grad_norm": 0.4262884120852377,
      "learning_rate": 4.973392530947336e-05,
      "loss": 1.9635,
      "num_input_tokens_seen": 4212348352,
      "step": 5354
    },
    {
      "epoch": 0.5681094844048377,
      "grad_norm": 0.49044082052773297,
      "learning_rate": 4.973382417609731e-05,
      "loss": 1.8968,
      "num_input_tokens_seen": 4213135152,
      "step": 5355
    },
    {
      "epoch": 0.5682155739444091,
      "grad_norm": 0.4671799482605369,
      "learning_rate": 4.973372302360769e-05,
      "loss": 1.9282,
      "num_input_tokens_seen": 4213921808,
      "step": 5356
    },
    {
      "epoch": 0.5683216634839805,
      "grad_norm": 0.5110564743224268,
      "learning_rate": 4.9733621852004575e-05,
      "loss": 1.908,
      "num_input_tokens_seen": 4214708672,
      "step": 5357
    },
    {
      "epoch": 0.5684277530235519,
      "grad_norm": 0.53817463405177,
      "learning_rate": 4.973352066128804e-05,
      "loss": 2.0374,
      "num_input_tokens_seen": 4215495440,
      "step": 5358
    },
    {
      "epoch": 0.5685338425631232,
      "grad_norm": 0.4484599504672068,
      "learning_rate": 4.9733419451458165e-05,
      "loss": 2.0311,
      "num_input_tokens_seen": 4216282160,
      "step": 5359
    },
    {
      "epoch": 0.5686399321026947,
      "grad_norm": 0.9657915035096363,
      "learning_rate": 4.9733318222515036e-05,
      "loss": 2.0635,
      "num_input_tokens_seen": 4217068928,
      "step": 5360
    },
    {
      "epoch": 0.5687460216422661,
      "grad_norm": 0.5274847847935293,
      "learning_rate": 4.973321697445872e-05,
      "loss": 2.1782,
      "num_input_tokens_seen": 4217855728,
      "step": 5361
    },
    {
      "epoch": 0.5688521111818374,
      "grad_norm": 1.3661179997236483,
      "learning_rate": 4.9733115707289304e-05,
      "loss": 1.9285,
      "num_input_tokens_seen": 4218642560,
      "step": 5362
    },
    {
      "epoch": 0.5689582007214089,
      "grad_norm": 0.6572799314004717,
      "learning_rate": 4.9733014421006855e-05,
      "loss": 1.9096,
      "num_input_tokens_seen": 4219429344,
      "step": 5363
    },
    {
      "epoch": 0.5690642902609803,
      "grad_norm": 1.0216918164023052,
      "learning_rate": 4.973291311561146e-05,
      "loss": 2.0503,
      "num_input_tokens_seen": 4220216112,
      "step": 5364
    },
    {
      "epoch": 0.5691703798005516,
      "grad_norm": 0.7767385841029707,
      "learning_rate": 4.97328117911032e-05,
      "loss": 1.8604,
      "num_input_tokens_seen": 4221002864,
      "step": 5365
    },
    {
      "epoch": 0.5692764693401231,
      "grad_norm": 0.6751245144940636,
      "learning_rate": 4.9732710447482146e-05,
      "loss": 1.919,
      "num_input_tokens_seen": 4221789632,
      "step": 5366
    },
    {
      "epoch": 0.5693825588796945,
      "grad_norm": 0.7280698057862895,
      "learning_rate": 4.973260908474838e-05,
      "loss": 1.9223,
      "num_input_tokens_seen": 4222576464,
      "step": 5367
    },
    {
      "epoch": 0.5694886484192658,
      "grad_norm": 0.7135176715913224,
      "learning_rate": 4.9732507702901975e-05,
      "loss": 2.076,
      "num_input_tokens_seen": 4223363216,
      "step": 5368
    },
    {
      "epoch": 0.5695947379588373,
      "grad_norm": 0.8230525689504027,
      "learning_rate": 4.9732406301943015e-05,
      "loss": 1.9227,
      "num_input_tokens_seen": 4224150032,
      "step": 5369
    },
    {
      "epoch": 0.5697008274984087,
      "grad_norm": 0.6064821819802467,
      "learning_rate": 4.9732304881871584e-05,
      "loss": 2.0457,
      "num_input_tokens_seen": 4224936768,
      "step": 5370
    },
    {
      "epoch": 0.56980691703798,
      "grad_norm": 0.49207384912506735,
      "learning_rate": 4.973220344268775e-05,
      "loss": 2.0082,
      "num_input_tokens_seen": 4225723520,
      "step": 5371
    },
    {
      "epoch": 0.5699130065775515,
      "grad_norm": 0.701713353795013,
      "learning_rate": 4.9732101984391585e-05,
      "loss": 2.0016,
      "num_input_tokens_seen": 4226510208,
      "step": 5372
    },
    {
      "epoch": 0.5700190961171229,
      "grad_norm": 0.42227007919090187,
      "learning_rate": 4.973200050698319e-05,
      "loss": 1.8468,
      "num_input_tokens_seen": 4227297024,
      "step": 5373
    },
    {
      "epoch": 0.5701251856566942,
      "grad_norm": 0.7054337202704601,
      "learning_rate": 4.973189901046263e-05,
      "loss": 2.0547,
      "num_input_tokens_seen": 4228083776,
      "step": 5374
    },
    {
      "epoch": 0.5702312751962656,
      "grad_norm": 0.7478725205720043,
      "learning_rate": 4.973179749482998e-05,
      "loss": 2.0618,
      "num_input_tokens_seen": 4228870496,
      "step": 5375
    },
    {
      "epoch": 0.5703373647358371,
      "grad_norm": 0.5788201740653771,
      "learning_rate": 4.973169596008532e-05,
      "loss": 2.0496,
      "num_input_tokens_seen": 4229657152,
      "step": 5376
    },
    {
      "epoch": 0.5704434542754084,
      "grad_norm": 0.5901080660106958,
      "learning_rate": 4.9731594406228735e-05,
      "loss": 2.033,
      "num_input_tokens_seen": 4230443888,
      "step": 5377
    },
    {
      "epoch": 0.5705495438149798,
      "grad_norm": 0.629362850237781,
      "learning_rate": 4.9731492833260294e-05,
      "loss": 2.0052,
      "num_input_tokens_seen": 4231230704,
      "step": 5378
    },
    {
      "epoch": 0.5706556333545513,
      "grad_norm": 0.6317665785429499,
      "learning_rate": 4.9731391241180094e-05,
      "loss": 2.0951,
      "num_input_tokens_seen": 4232017408,
      "step": 5379
    },
    {
      "epoch": 0.5707617228941226,
      "grad_norm": 0.6305188661331982,
      "learning_rate": 4.973128962998819e-05,
      "loss": 1.9923,
      "num_input_tokens_seen": 4232804128,
      "step": 5380
    },
    {
      "epoch": 0.570867812433694,
      "grad_norm": 0.4800360602523268,
      "learning_rate": 4.973118799968467e-05,
      "loss": 1.8812,
      "num_input_tokens_seen": 4233590992,
      "step": 5381
    },
    {
      "epoch": 0.5709739019732655,
      "grad_norm": 0.5259239315868899,
      "learning_rate": 4.9731086350269615e-05,
      "loss": 2.0246,
      "num_input_tokens_seen": 4234377776,
      "step": 5382
    },
    {
      "epoch": 0.5710799915128368,
      "grad_norm": 0.4870666540292143,
      "learning_rate": 4.973098468174311e-05,
      "loss": 1.9631,
      "num_input_tokens_seen": 4235164512,
      "step": 5383
    },
    {
      "epoch": 0.5711860810524082,
      "grad_norm": 0.6181788439059467,
      "learning_rate": 4.973088299410522e-05,
      "loss": 1.9355,
      "num_input_tokens_seen": 4235951360,
      "step": 5384
    },
    {
      "epoch": 0.5712921705919797,
      "grad_norm": 0.48527096083162463,
      "learning_rate": 4.9730781287356025e-05,
      "loss": 1.9348,
      "num_input_tokens_seen": 4236738048,
      "step": 5385
    },
    {
      "epoch": 0.571398260131551,
      "grad_norm": 0.5063768441927128,
      "learning_rate": 4.973067956149561e-05,
      "loss": 1.9559,
      "num_input_tokens_seen": 4237524784,
      "step": 5386
    },
    {
      "epoch": 0.5715043496711224,
      "grad_norm": 0.5421273076093235,
      "learning_rate": 4.973057781652406e-05,
      "loss": 2.003,
      "num_input_tokens_seen": 4238311568,
      "step": 5387
    },
    {
      "epoch": 0.5716104392106939,
      "grad_norm": 0.5600511622342615,
      "learning_rate": 4.973047605244143e-05,
      "loss": 1.942,
      "num_input_tokens_seen": 4239098368,
      "step": 5388
    },
    {
      "epoch": 0.5717165287502652,
      "grad_norm": 0.4813755546246045,
      "learning_rate": 4.973037426924782e-05,
      "loss": 1.9773,
      "num_input_tokens_seen": 4239885184,
      "step": 5389
    },
    {
      "epoch": 0.5718226182898366,
      "grad_norm": 0.7648365851392621,
      "learning_rate": 4.9730272466943315e-05,
      "loss": 2.1282,
      "num_input_tokens_seen": 4240671952,
      "step": 5390
    },
    {
      "epoch": 0.571928707829408,
      "grad_norm": 0.8364759024002874,
      "learning_rate": 4.973017064552796e-05,
      "loss": 2.0263,
      "num_input_tokens_seen": 4241458752,
      "step": 5391
    },
    {
      "epoch": 0.5720347973689794,
      "grad_norm": 0.531154569683376,
      "learning_rate": 4.973006880500187e-05,
      "loss": 2.1651,
      "num_input_tokens_seen": 4242245456,
      "step": 5392
    },
    {
      "epoch": 0.5721408869085508,
      "grad_norm": 0.7100444522185354,
      "learning_rate": 4.9729966945365104e-05,
      "loss": 2.1066,
      "num_input_tokens_seen": 4243032304,
      "step": 5393
    },
    {
      "epoch": 0.5722469764481222,
      "grad_norm": 0.6919681111919096,
      "learning_rate": 4.972986506661774e-05,
      "loss": 2.0648,
      "num_input_tokens_seen": 4243819104,
      "step": 5394
    },
    {
      "epoch": 0.5723530659876936,
      "grad_norm": 0.5069756180658098,
      "learning_rate": 4.972976316875987e-05,
      "loss": 2.0964,
      "num_input_tokens_seen": 4244605888,
      "step": 5395
    },
    {
      "epoch": 0.572459155527265,
      "grad_norm": 0.9089733905702653,
      "learning_rate": 4.972966125179157e-05,
      "loss": 2.0265,
      "num_input_tokens_seen": 4245392624,
      "step": 5396
    },
    {
      "epoch": 0.5725652450668364,
      "grad_norm": 0.5523306239591262,
      "learning_rate": 4.9729559315712897e-05,
      "loss": 2.2236,
      "num_input_tokens_seen": 4246179296,
      "step": 5397
    },
    {
      "epoch": 0.5726713346064078,
      "grad_norm": 0.8320969610592808,
      "learning_rate": 4.9729457360523956e-05,
      "loss": 1.9737,
      "num_input_tokens_seen": 4246966064,
      "step": 5398
    },
    {
      "epoch": 0.5727774241459792,
      "grad_norm": 0.6913670258454553,
      "learning_rate": 4.9729355386224814e-05,
      "loss": 1.9521,
      "num_input_tokens_seen": 4247752768,
      "step": 5399
    },
    {
      "epoch": 0.5728835136855506,
      "grad_norm": 0.606287919963466,
      "learning_rate": 4.972925339281555e-05,
      "loss": 2.0324,
      "num_input_tokens_seen": 4248539488,
      "step": 5400
    },
    {
      "epoch": 0.572989603225122,
      "grad_norm": 0.6828497661453803,
      "learning_rate": 4.972915138029625e-05,
      "loss": 2.2343,
      "num_input_tokens_seen": 4249326272,
      "step": 5401
    },
    {
      "epoch": 0.5730956927646934,
      "grad_norm": 0.6614744829701968,
      "learning_rate": 4.9729049348666976e-05,
      "loss": 2.1102,
      "num_input_tokens_seen": 4250113040,
      "step": 5402
    },
    {
      "epoch": 0.5732017823042648,
      "grad_norm": 0.6698033515873354,
      "learning_rate": 4.972894729792783e-05,
      "loss": 2.0627,
      "num_input_tokens_seen": 4250899840,
      "step": 5403
    },
    {
      "epoch": 0.5733078718438362,
      "grad_norm": 0.6352023260564098,
      "learning_rate": 4.972884522807888e-05,
      "loss": 2.0275,
      "num_input_tokens_seen": 4251686576,
      "step": 5404
    },
    {
      "epoch": 0.5734139613834076,
      "grad_norm": 0.49459166654806974,
      "learning_rate": 4.9728743139120196e-05,
      "loss": 1.8188,
      "num_input_tokens_seen": 4252473440,
      "step": 5405
    },
    {
      "epoch": 0.573520050922979,
      "grad_norm": 0.5520135629248043,
      "learning_rate": 4.972864103105187e-05,
      "loss": 1.8624,
      "num_input_tokens_seen": 4253260272,
      "step": 5406
    },
    {
      "epoch": 0.5736261404625503,
      "grad_norm": 0.5586441890600136,
      "learning_rate": 4.972853890387397e-05,
      "loss": 2.0267,
      "num_input_tokens_seen": 4254047008,
      "step": 5407
    },
    {
      "epoch": 0.5737322300021218,
      "grad_norm": 0.5607081105498676,
      "learning_rate": 4.972843675758658e-05,
      "loss": 1.955,
      "num_input_tokens_seen": 4254833824,
      "step": 5408
    },
    {
      "epoch": 0.5738383195416932,
      "grad_norm": 0.5467050660088539,
      "learning_rate": 4.972833459218979e-05,
      "loss": 1.9956,
      "num_input_tokens_seen": 4255620640,
      "step": 5409
    },
    {
      "epoch": 0.5739444090812645,
      "grad_norm": 0.537327294290992,
      "learning_rate": 4.972823240768366e-05,
      "loss": 2.0298,
      "num_input_tokens_seen": 4256407472,
      "step": 5410
    },
    {
      "epoch": 0.574050498620836,
      "grad_norm": 0.6823858651743254,
      "learning_rate": 4.972813020406828e-05,
      "loss": 2.048,
      "num_input_tokens_seen": 4257194240,
      "step": 5411
    },
    {
      "epoch": 0.5741565881604074,
      "grad_norm": 0.5663552498546727,
      "learning_rate": 4.9728027981343725e-05,
      "loss": 1.8718,
      "num_input_tokens_seen": 4257981040,
      "step": 5412
    },
    {
      "epoch": 0.5742626776999787,
      "grad_norm": 0.6368179485887219,
      "learning_rate": 4.972792573951009e-05,
      "loss": 2.0535,
      "num_input_tokens_seen": 4258767760,
      "step": 5413
    },
    {
      "epoch": 0.5743687672395502,
      "grad_norm": 0.6642114566649079,
      "learning_rate": 4.972782347856741e-05,
      "loss": 2.0672,
      "num_input_tokens_seen": 4259554624,
      "step": 5414
    },
    {
      "epoch": 0.5744748567791216,
      "grad_norm": 0.5553522164721195,
      "learning_rate": 4.972772119851582e-05,
      "loss": 1.9235,
      "num_input_tokens_seen": 4260341376,
      "step": 5415
    },
    {
      "epoch": 0.5745809463186929,
      "grad_norm": 0.591608072819293,
      "learning_rate": 4.972761889935536e-05,
      "loss": 2.1198,
      "num_input_tokens_seen": 4261128144,
      "step": 5416
    },
    {
      "epoch": 0.5746870358582644,
      "grad_norm": 0.5229784765397278,
      "learning_rate": 4.972751658108613e-05,
      "loss": 2.0451,
      "num_input_tokens_seen": 4261914848,
      "step": 5417
    },
    {
      "epoch": 0.5747931253978358,
      "grad_norm": 0.7494535781991639,
      "learning_rate": 4.972741424370819e-05,
      "loss": 2.1963,
      "num_input_tokens_seen": 4262701632,
      "step": 5418
    },
    {
      "epoch": 0.5748992149374071,
      "grad_norm": 1.062622211192056,
      "learning_rate": 4.972731188722164e-05,
      "loss": 2.2612,
      "num_input_tokens_seen": 4263488352,
      "step": 5419
    },
    {
      "epoch": 0.5750053044769786,
      "grad_norm": 0.5845415921826751,
      "learning_rate": 4.972720951162654e-05,
      "loss": 2.1912,
      "num_input_tokens_seen": 4264275104,
      "step": 5420
    },
    {
      "epoch": 0.57511139401655,
      "grad_norm": 0.8689998500438881,
      "learning_rate": 4.9727107116922984e-05,
      "loss": 1.9528,
      "num_input_tokens_seen": 4265061872,
      "step": 5421
    },
    {
      "epoch": 0.5752174835561213,
      "grad_norm": 0.5769732949174317,
      "learning_rate": 4.972700470311105e-05,
      "loss": 1.9534,
      "num_input_tokens_seen": 4265848736,
      "step": 5422
    },
    {
      "epoch": 0.5753235730956928,
      "grad_norm": 0.6548261039675289,
      "learning_rate": 4.97269022701908e-05,
      "loss": 2.0218,
      "num_input_tokens_seen": 4266635568,
      "step": 5423
    },
    {
      "epoch": 0.5754296626352642,
      "grad_norm": 0.521870090099812,
      "learning_rate": 4.972679981816233e-05,
      "loss": 2.0125,
      "num_input_tokens_seen": 4267422288,
      "step": 5424
    },
    {
      "epoch": 0.5755357521748355,
      "grad_norm": 0.7109707357162871,
      "learning_rate": 4.972669734702572e-05,
      "loss": 2.0525,
      "num_input_tokens_seen": 4268209040,
      "step": 5425
    },
    {
      "epoch": 0.5756418417144069,
      "grad_norm": 0.6150153477254356,
      "learning_rate": 4.972659485678103e-05,
      "loss": 2.0738,
      "num_input_tokens_seen": 4268995888,
      "step": 5426
    },
    {
      "epoch": 0.5757479312539784,
      "grad_norm": 0.6701199722827701,
      "learning_rate": 4.972649234742837e-05,
      "loss": 1.9952,
      "num_input_tokens_seen": 4269782608,
      "step": 5427
    },
    {
      "epoch": 0.5758540207935497,
      "grad_norm": 0.49343820945309935,
      "learning_rate": 4.9726389818967787e-05,
      "loss": 1.8353,
      "num_input_tokens_seen": 4270569520,
      "step": 5428
    },
    {
      "epoch": 0.5759601103331211,
      "grad_norm": 0.5167465584462395,
      "learning_rate": 4.972628727139939e-05,
      "loss": 2.0691,
      "num_input_tokens_seen": 4271356320,
      "step": 5429
    },
    {
      "epoch": 0.5760661998726926,
      "grad_norm": 0.4863789826943684,
      "learning_rate": 4.9726184704723234e-05,
      "loss": 2.0511,
      "num_input_tokens_seen": 4272143088,
      "step": 5430
    },
    {
      "epoch": 0.576172289412264,
      "grad_norm": 0.5917509222303297,
      "learning_rate": 4.972608211893941e-05,
      "loss": 1.9322,
      "num_input_tokens_seen": 4272929952,
      "step": 5431
    },
    {
      "epoch": 0.5762783789518353,
      "grad_norm": 0.5864695138908963,
      "learning_rate": 4.9725979514048e-05,
      "loss": 1.9717,
      "num_input_tokens_seen": 4273716720,
      "step": 5432
    },
    {
      "epoch": 0.5763844684914068,
      "grad_norm": 0.667484378399581,
      "learning_rate": 4.9725876890049074e-05,
      "loss": 2.1159,
      "num_input_tokens_seen": 4274503472,
      "step": 5433
    },
    {
      "epoch": 0.5764905580309782,
      "grad_norm": 0.6876556038867749,
      "learning_rate": 4.972577424694271e-05,
      "loss": 1.9891,
      "num_input_tokens_seen": 4275290176,
      "step": 5434
    },
    {
      "epoch": 0.5765966475705495,
      "grad_norm": 0.4714264730447232,
      "learning_rate": 4.9725671584729007e-05,
      "loss": 1.8921,
      "num_input_tokens_seen": 4276077008,
      "step": 5435
    },
    {
      "epoch": 0.576702737110121,
      "grad_norm": 0.7487430849421751,
      "learning_rate": 4.972556890340802e-05,
      "loss": 2.191,
      "num_input_tokens_seen": 4276863776,
      "step": 5436
    },
    {
      "epoch": 0.5768088266496924,
      "grad_norm": 0.47395096234548173,
      "learning_rate": 4.972546620297984e-05,
      "loss": 2.0282,
      "num_input_tokens_seen": 4277650560,
      "step": 5437
    },
    {
      "epoch": 0.5769149161892637,
      "grad_norm": 0.7674722814289164,
      "learning_rate": 4.972536348344455e-05,
      "loss": 1.9811,
      "num_input_tokens_seen": 4278437328,
      "step": 5438
    },
    {
      "epoch": 0.5770210057288352,
      "grad_norm": 0.5706740148989009,
      "learning_rate": 4.9725260744802224e-05,
      "loss": 1.8672,
      "num_input_tokens_seen": 4279224096,
      "step": 5439
    },
    {
      "epoch": 0.5771270952684066,
      "grad_norm": 0.9083608443758607,
      "learning_rate": 4.972515798705294e-05,
      "loss": 2.1204,
      "num_input_tokens_seen": 4280010928,
      "step": 5440
    },
    {
      "epoch": 0.5772331848079779,
      "grad_norm": 0.538506037451223,
      "learning_rate": 4.972505521019678e-05,
      "loss": 1.8592,
      "num_input_tokens_seen": 4280797680,
      "step": 5441
    },
    {
      "epoch": 0.5773392743475493,
      "grad_norm": 1.2807576155083635,
      "learning_rate": 4.972495241423382e-05,
      "loss": 2.1428,
      "num_input_tokens_seen": 4281584496,
      "step": 5442
    },
    {
      "epoch": 0.5774453638871208,
      "grad_norm": 0.5032437573365557,
      "learning_rate": 4.972484959916415e-05,
      "loss": 2.056,
      "num_input_tokens_seen": 4282371344,
      "step": 5443
    },
    {
      "epoch": 0.5775514534266921,
      "grad_norm": 0.9918296950140899,
      "learning_rate": 4.9724746764987826e-05,
      "loss": 2.0094,
      "num_input_tokens_seen": 4283158080,
      "step": 5444
    },
    {
      "epoch": 0.5776575429662635,
      "grad_norm": 0.5467224182630062,
      "learning_rate": 4.972464391170496e-05,
      "loss": 2.1535,
      "num_input_tokens_seen": 4283944800,
      "step": 5445
    },
    {
      "epoch": 0.577763632505835,
      "grad_norm": 0.8663315732581485,
      "learning_rate": 4.972454103931561e-05,
      "loss": 2.0258,
      "num_input_tokens_seen": 4284731504,
      "step": 5446
    },
    {
      "epoch": 0.5778697220454063,
      "grad_norm": 0.5560970012538454,
      "learning_rate": 4.972443814781985e-05,
      "loss": 2.0138,
      "num_input_tokens_seen": 4285518336,
      "step": 5447
    },
    {
      "epoch": 0.5779758115849777,
      "grad_norm": 0.8454883425013603,
      "learning_rate": 4.972433523721778e-05,
      "loss": 2.0487,
      "num_input_tokens_seen": 4286304992,
      "step": 5448
    },
    {
      "epoch": 0.5780819011245492,
      "grad_norm": 0.5448501074852924,
      "learning_rate": 4.9724232307509465e-05,
      "loss": 1.9172,
      "num_input_tokens_seen": 4287091824,
      "step": 5449
    },
    {
      "epoch": 0.5781879906641205,
      "grad_norm": 0.8427922746336738,
      "learning_rate": 4.9724129358694994e-05,
      "loss": 2.094,
      "num_input_tokens_seen": 4287878512,
      "step": 5450
    },
    {
      "epoch": 0.5782940802036919,
      "grad_norm": 0.5929285617934829,
      "learning_rate": 4.9724026390774433e-05,
      "loss": 1.8457,
      "num_input_tokens_seen": 4288665312,
      "step": 5451
    },
    {
      "epoch": 0.5784001697432634,
      "grad_norm": 0.7180205705232928,
      "learning_rate": 4.972392340374787e-05,
      "loss": 1.878,
      "num_input_tokens_seen": 4289452128,
      "step": 5452
    },
    {
      "epoch": 0.5785062592828347,
      "grad_norm": 0.7520521044155196,
      "learning_rate": 4.972382039761539e-05,
      "loss": 1.9963,
      "num_input_tokens_seen": 4290238816,
      "step": 5453
    },
    {
      "epoch": 0.5786123488224061,
      "grad_norm": 0.5727966925749807,
      "learning_rate": 4.9723717372377076e-05,
      "loss": 2.1482,
      "num_input_tokens_seen": 4291025584,
      "step": 5454
    },
    {
      "epoch": 0.5787184383619776,
      "grad_norm": 0.6570919169518967,
      "learning_rate": 4.972361432803299e-05,
      "loss": 2.0809,
      "num_input_tokens_seen": 4291812368,
      "step": 5455
    },
    {
      "epoch": 0.5788245279015489,
      "grad_norm": 0.6578769636683178,
      "learning_rate": 4.972351126458321e-05,
      "loss": 1.9627,
      "num_input_tokens_seen": 4292599136,
      "step": 5456
    },
    {
      "epoch": 0.5789306174411203,
      "grad_norm": 1.427171514088075,
      "learning_rate": 4.972340818202784e-05,
      "loss": 2.0363,
      "num_input_tokens_seen": 4293385904,
      "step": 5457
    },
    {
      "epoch": 0.5790367069806917,
      "grad_norm": 0.468581006335055,
      "learning_rate": 4.9723305080366946e-05,
      "loss": 1.9927,
      "num_input_tokens_seen": 4294172688,
      "step": 5458
    },
    {
      "epoch": 0.5791427965202631,
      "grad_norm": 1.425998915841908,
      "learning_rate": 4.97232019596006e-05,
      "loss": 2.0001,
      "num_input_tokens_seen": 4294959472,
      "step": 5459
    },
    {
      "epoch": 0.5792488860598345,
      "grad_norm": 0.5813787327209644,
      "learning_rate": 4.972309881972889e-05,
      "loss": 1.9577,
      "num_input_tokens_seen": 4295746192,
      "step": 5460
    },
    {
      "epoch": 0.5793549755994059,
      "grad_norm": 0.6944659956240681,
      "learning_rate": 4.9722995660751894e-05,
      "loss": 1.7881,
      "num_input_tokens_seen": 4296532944,
      "step": 5461
    },
    {
      "epoch": 0.5794610651389773,
      "grad_norm": 0.5750948234089608,
      "learning_rate": 4.972289248266969e-05,
      "loss": 1.9725,
      "num_input_tokens_seen": 4297319760,
      "step": 5462
    },
    {
      "epoch": 0.5795671546785487,
      "grad_norm": 0.5430394172470316,
      "learning_rate": 4.9722789285482366e-05,
      "loss": 1.8282,
      "num_input_tokens_seen": 4298106496,
      "step": 5463
    },
    {
      "epoch": 0.57967324421812,
      "grad_norm": 0.43314048393891585,
      "learning_rate": 4.9722686069189994e-05,
      "loss": 1.8407,
      "num_input_tokens_seen": 4298893328,
      "step": 5464
    },
    {
      "epoch": 0.5797793337576915,
      "grad_norm": 0.595878497531844,
      "learning_rate": 4.972258283379265e-05,
      "loss": 2.0577,
      "num_input_tokens_seen": 4299679984,
      "step": 5465
    },
    {
      "epoch": 0.5798854232972629,
      "grad_norm": 0.4615925284216527,
      "learning_rate": 4.9722479579290427e-05,
      "loss": 2.0963,
      "num_input_tokens_seen": 4300466704,
      "step": 5466
    },
    {
      "epoch": 0.5799915128368343,
      "grad_norm": 0.7764337785433413,
      "learning_rate": 4.9722376305683394e-05,
      "loss": 2.1025,
      "num_input_tokens_seen": 4301253456,
      "step": 5467
    },
    {
      "epoch": 0.5800976023764057,
      "grad_norm": 0.49978006102349576,
      "learning_rate": 4.9722273012971635e-05,
      "loss": 1.9747,
      "num_input_tokens_seen": 4302040272,
      "step": 5468
    },
    {
      "epoch": 0.5802036919159771,
      "grad_norm": 0.7119925363515903,
      "learning_rate": 4.972216970115523e-05,
      "loss": 1.8562,
      "num_input_tokens_seen": 4302827024,
      "step": 5469
    },
    {
      "epoch": 0.5803097814555485,
      "grad_norm": 0.6364760384697247,
      "learning_rate": 4.9722066370234256e-05,
      "loss": 1.899,
      "num_input_tokens_seen": 4303613888,
      "step": 5470
    },
    {
      "epoch": 0.5804158709951199,
      "grad_norm": 0.8306663062413989,
      "learning_rate": 4.97219630202088e-05,
      "loss": 2.0725,
      "num_input_tokens_seen": 4304400688,
      "step": 5471
    },
    {
      "epoch": 0.5805219605346913,
      "grad_norm": 0.6187455937776389,
      "learning_rate": 4.9721859651078926e-05,
      "loss": 1.9842,
      "num_input_tokens_seen": 4305187488,
      "step": 5472
    },
    {
      "epoch": 0.5806280500742627,
      "grad_norm": 0.7407774543110138,
      "learning_rate": 4.9721756262844734e-05,
      "loss": 2.0679,
      "num_input_tokens_seen": 4305974144,
      "step": 5473
    },
    {
      "epoch": 0.580734139613834,
      "grad_norm": 0.5810877086341609,
      "learning_rate": 4.972165285550628e-05,
      "loss": 2.0678,
      "num_input_tokens_seen": 4306760944,
      "step": 5474
    },
    {
      "epoch": 0.5808402291534055,
      "grad_norm": 0.8977574646172402,
      "learning_rate": 4.9721549429063674e-05,
      "loss": 1.9738,
      "num_input_tokens_seen": 4307547744,
      "step": 5475
    },
    {
      "epoch": 0.5809463186929769,
      "grad_norm": 0.4708943910979689,
      "learning_rate": 4.9721445983516977e-05,
      "loss": 1.8318,
      "num_input_tokens_seen": 4308334528,
      "step": 5476
    },
    {
      "epoch": 0.5810524082325482,
      "grad_norm": 0.8497638485875599,
      "learning_rate": 4.9721342518866264e-05,
      "loss": 2.0436,
      "num_input_tokens_seen": 4309121312,
      "step": 5477
    },
    {
      "epoch": 0.5811584977721197,
      "grad_norm": 0.46420299067515186,
      "learning_rate": 4.972123903511163e-05,
      "loss": 2.0303,
      "num_input_tokens_seen": 4309908144,
      "step": 5478
    },
    {
      "epoch": 0.5812645873116911,
      "grad_norm": 0.7174804846281388,
      "learning_rate": 4.972113553225315e-05,
      "loss": 1.9119,
      "num_input_tokens_seen": 4310694864,
      "step": 5479
    },
    {
      "epoch": 0.5813706768512624,
      "grad_norm": 0.7810379767186654,
      "learning_rate": 4.972103201029089e-05,
      "loss": 1.8447,
      "num_input_tokens_seen": 4311481680,
      "step": 5480
    },
    {
      "epoch": 0.5814767663908339,
      "grad_norm": 1.788613103431429,
      "learning_rate": 4.972092846922495e-05,
      "loss": 1.9831,
      "num_input_tokens_seen": 4312268448,
      "step": 5481
    },
    {
      "epoch": 0.5815828559304053,
      "grad_norm": 0.7774029573654331,
      "learning_rate": 4.97208249090554e-05,
      "loss": 2.0471,
      "num_input_tokens_seen": 4313055152,
      "step": 5482
    },
    {
      "epoch": 0.5816889454699766,
      "grad_norm": 1.6664286771863082,
      "learning_rate": 4.972072132978233e-05,
      "loss": 2.0005,
      "num_input_tokens_seen": 4313841920,
      "step": 5483
    },
    {
      "epoch": 0.5817950350095481,
      "grad_norm": 1.2227778369597053,
      "learning_rate": 4.97206177314058e-05,
      "loss": 2.135,
      "num_input_tokens_seen": 4314628640,
      "step": 5484
    },
    {
      "epoch": 0.5819011245491195,
      "grad_norm": 1.3130047729942091,
      "learning_rate": 4.972051411392591e-05,
      "loss": 2.0412,
      "num_input_tokens_seen": 4315415408,
      "step": 5485
    },
    {
      "epoch": 0.5820072140886908,
      "grad_norm": 1.531823237091059,
      "learning_rate": 4.972041047734273e-05,
      "loss": 1.9219,
      "num_input_tokens_seen": 4316202176,
      "step": 5486
    },
    {
      "epoch": 0.5821133036282623,
      "grad_norm": 1.1955982201895325,
      "learning_rate": 4.972030682165634e-05,
      "loss": 2.0548,
      "num_input_tokens_seen": 4316988912,
      "step": 5487
    },
    {
      "epoch": 0.5822193931678337,
      "grad_norm": 0.5271078158558378,
      "learning_rate": 4.972020314686682e-05,
      "loss": 1.9186,
      "num_input_tokens_seen": 4317775760,
      "step": 5488
    },
    {
      "epoch": 0.582325482707405,
      "grad_norm": 0.923055989385248,
      "learning_rate": 4.9720099452974256e-05,
      "loss": 1.9986,
      "num_input_tokens_seen": 4318562544,
      "step": 5489
    },
    {
      "epoch": 0.5824315722469765,
      "grad_norm": 0.8754987679516625,
      "learning_rate": 4.971999573997872e-05,
      "loss": 1.9292,
      "num_input_tokens_seen": 4319349344,
      "step": 5490
    },
    {
      "epoch": 0.5825376617865479,
      "grad_norm": 0.579676503844906,
      "learning_rate": 4.9719892007880296e-05,
      "loss": 1.9804,
      "num_input_tokens_seen": 4320136112,
      "step": 5491
    },
    {
      "epoch": 0.5826437513261192,
      "grad_norm": 0.6718098046032062,
      "learning_rate": 4.9719788256679076e-05,
      "loss": 2.051,
      "num_input_tokens_seen": 4320922880,
      "step": 5492
    },
    {
      "epoch": 0.5827498408656906,
      "grad_norm": 0.8363970110708754,
      "learning_rate": 4.9719684486375114e-05,
      "loss": 2.1712,
      "num_input_tokens_seen": 4321709552,
      "step": 5493
    },
    {
      "epoch": 0.5828559304052621,
      "grad_norm": 1.0982085024986907,
      "learning_rate": 4.9719580696968514e-05,
      "loss": 1.9611,
      "num_input_tokens_seen": 4322496272,
      "step": 5494
    },
    {
      "epoch": 0.5829620199448334,
      "grad_norm": 0.6094868092925627,
      "learning_rate": 4.971947688845935e-05,
      "loss": 2.1397,
      "num_input_tokens_seen": 4323282960,
      "step": 5495
    },
    {
      "epoch": 0.5830681094844048,
      "grad_norm": 0.6774010978482835,
      "learning_rate": 4.97193730608477e-05,
      "loss": 1.9717,
      "num_input_tokens_seen": 4324069792,
      "step": 5496
    },
    {
      "epoch": 0.5831741990239763,
      "grad_norm": 0.49667844742044504,
      "learning_rate": 4.9719269214133634e-05,
      "loss": 1.8977,
      "num_input_tokens_seen": 4324856608,
      "step": 5497
    },
    {
      "epoch": 0.5832802885635476,
      "grad_norm": 0.5961178302676718,
      "learning_rate": 4.9719165348317255e-05,
      "loss": 2.2299,
      "num_input_tokens_seen": 4325643360,
      "step": 5498
    },
    {
      "epoch": 0.583386378103119,
      "grad_norm": 0.8467654778708612,
      "learning_rate": 4.9719061463398616e-05,
      "loss": 2.0841,
      "num_input_tokens_seen": 4326430112,
      "step": 5499
    },
    {
      "epoch": 0.5834924676426905,
      "grad_norm": 0.5765415338626763,
      "learning_rate": 4.971895755937782e-05,
      "loss": 1.9606,
      "num_input_tokens_seen": 4327216944,
      "step": 5500
    },
    {
      "epoch": 0.5835985571822618,
      "grad_norm": 0.5791575463432431,
      "learning_rate": 4.9718853636254945e-05,
      "loss": 2.1315,
      "num_input_tokens_seen": 4328003680,
      "step": 5501
    },
    {
      "epoch": 0.5837046467218332,
      "grad_norm": 0.6704563549369223,
      "learning_rate": 4.9718749694030055e-05,
      "loss": 1.9537,
      "num_input_tokens_seen": 4328790448,
      "step": 5502
    },
    {
      "epoch": 0.5838107362614047,
      "grad_norm": 0.7317652778056226,
      "learning_rate": 4.971864573270324e-05,
      "loss": 1.8984,
      "num_input_tokens_seen": 4329577264,
      "step": 5503
    },
    {
      "epoch": 0.583916825800976,
      "grad_norm": 0.5437011128081085,
      "learning_rate": 4.9718541752274586e-05,
      "loss": 1.8724,
      "num_input_tokens_seen": 4330364128,
      "step": 5504
    },
    {
      "epoch": 0.5840229153405474,
      "grad_norm": 0.6032587645185978,
      "learning_rate": 4.971843775274417e-05,
      "loss": 2.0372,
      "num_input_tokens_seen": 4331150976,
      "step": 5505
    },
    {
      "epoch": 0.5841290048801189,
      "grad_norm": 0.575927094605428,
      "learning_rate": 4.971833373411206e-05,
      "loss": 1.97,
      "num_input_tokens_seen": 4331937680,
      "step": 5506
    },
    {
      "epoch": 0.5842350944196902,
      "grad_norm": 0.835084747949744,
      "learning_rate": 4.971822969637836e-05,
      "loss": 2.05,
      "num_input_tokens_seen": 4332724384,
      "step": 5507
    },
    {
      "epoch": 0.5843411839592616,
      "grad_norm": 0.9689010175346434,
      "learning_rate": 4.9718125639543136e-05,
      "loss": 1.9544,
      "num_input_tokens_seen": 4333511184,
      "step": 5508
    },
    {
      "epoch": 0.584447273498833,
      "grad_norm": 0.6770043428099922,
      "learning_rate": 4.971802156360646e-05,
      "loss": 2.1032,
      "num_input_tokens_seen": 4334298048,
      "step": 5509
    },
    {
      "epoch": 0.5845533630384044,
      "grad_norm": 1.0110079016625237,
      "learning_rate": 4.971791746856843e-05,
      "loss": 2.0049,
      "num_input_tokens_seen": 4335084688,
      "step": 5510
    },
    {
      "epoch": 0.5846594525779758,
      "grad_norm": 0.4157898214645685,
      "learning_rate": 4.971781335442911e-05,
      "loss": 1.8772,
      "num_input_tokens_seen": 4335871504,
      "step": 5511
    },
    {
      "epoch": 0.5847655421175472,
      "grad_norm": 1.023082401573952,
      "learning_rate": 4.9717709221188605e-05,
      "loss": 2.0878,
      "num_input_tokens_seen": 4336658208,
      "step": 5512
    },
    {
      "epoch": 0.5848716316571186,
      "grad_norm": 0.5994541161834223,
      "learning_rate": 4.971760506884696e-05,
      "loss": 1.9595,
      "num_input_tokens_seen": 4337445072,
      "step": 5513
    },
    {
      "epoch": 0.58497772119669,
      "grad_norm": 1.3563572320519273,
      "learning_rate": 4.971750089740429e-05,
      "loss": 2.101,
      "num_input_tokens_seen": 4338231824,
      "step": 5514
    },
    {
      "epoch": 0.5850838107362614,
      "grad_norm": 0.8322690489722426,
      "learning_rate": 4.971739670686065e-05,
      "loss": 2.0814,
      "num_input_tokens_seen": 4339018656,
      "step": 5515
    },
    {
      "epoch": 0.5851899002758328,
      "grad_norm": 0.7259481116287831,
      "learning_rate": 4.971729249721614e-05,
      "loss": 2.0063,
      "num_input_tokens_seen": 4339805424,
      "step": 5516
    },
    {
      "epoch": 0.5852959898154042,
      "grad_norm": 0.8414099034187328,
      "learning_rate": 4.9717188268470826e-05,
      "loss": 1.9947,
      "num_input_tokens_seen": 4340592176,
      "step": 5517
    },
    {
      "epoch": 0.5854020793549756,
      "grad_norm": 0.7405499603825261,
      "learning_rate": 4.97170840206248e-05,
      "loss": 1.8922,
      "num_input_tokens_seen": 4341378976,
      "step": 5518
    },
    {
      "epoch": 0.585508168894547,
      "grad_norm": 0.6254707876550545,
      "learning_rate": 4.971697975367813e-05,
      "loss": 1.8236,
      "num_input_tokens_seen": 4342165840,
      "step": 5519
    },
    {
      "epoch": 0.5856142584341184,
      "grad_norm": 0.6629497238436938,
      "learning_rate": 4.971687546763091e-05,
      "loss": 2.0633,
      "num_input_tokens_seen": 4342952592,
      "step": 5520
    },
    {
      "epoch": 0.5857203479736898,
      "grad_norm": 0.5521156161527099,
      "learning_rate": 4.971677116248321e-05,
      "loss": 2.143,
      "num_input_tokens_seen": 4343739344,
      "step": 5521
    },
    {
      "epoch": 0.5858264375132612,
      "grad_norm": 0.5234438215195794,
      "learning_rate": 4.971666683823511e-05,
      "loss": 1.936,
      "num_input_tokens_seen": 4344526064,
      "step": 5522
    },
    {
      "epoch": 0.5859325270528326,
      "grad_norm": 0.5938315619945668,
      "learning_rate": 4.97165624948867e-05,
      "loss": 2.042,
      "num_input_tokens_seen": 4345312800,
      "step": 5523
    },
    {
      "epoch": 0.586038616592404,
      "grad_norm": 0.5236542780695699,
      "learning_rate": 4.971645813243806e-05,
      "loss": 1.9518,
      "num_input_tokens_seen": 4346099488,
      "step": 5524
    },
    {
      "epoch": 0.5861447061319753,
      "grad_norm": 0.5285953433814352,
      "learning_rate": 4.971635375088926e-05,
      "loss": 2.0063,
      "num_input_tokens_seen": 4346886304,
      "step": 5525
    },
    {
      "epoch": 0.5862507956715468,
      "grad_norm": 0.5062918742769555,
      "learning_rate": 4.971624935024038e-05,
      "loss": 2.0933,
      "num_input_tokens_seen": 4347673072,
      "step": 5526
    },
    {
      "epoch": 0.5863568852111182,
      "grad_norm": 0.5206146567592659,
      "learning_rate": 4.971614493049153e-05,
      "loss": 2.1331,
      "num_input_tokens_seen": 4348459792,
      "step": 5527
    },
    {
      "epoch": 0.5864629747506895,
      "grad_norm": 0.7596263775553328,
      "learning_rate": 4.971604049164275e-05,
      "loss": 2.0298,
      "num_input_tokens_seen": 4349246544,
      "step": 5528
    },
    {
      "epoch": 0.586569064290261,
      "grad_norm": 1.0512140665797183,
      "learning_rate": 4.9715936033694145e-05,
      "loss": 2.0989,
      "num_input_tokens_seen": 4350033312,
      "step": 5529
    },
    {
      "epoch": 0.5866751538298324,
      "grad_norm": 0.7650711850250371,
      "learning_rate": 4.971583155664579e-05,
      "loss": 2.0396,
      "num_input_tokens_seen": 4350820048,
      "step": 5530
    },
    {
      "epoch": 0.5867812433694037,
      "grad_norm": 0.5917974893496349,
      "learning_rate": 4.9715727060497766e-05,
      "loss": 1.9327,
      "num_input_tokens_seen": 4351606880,
      "step": 5531
    },
    {
      "epoch": 0.5868873329089752,
      "grad_norm": 0.7169125730376762,
      "learning_rate": 4.9715622545250154e-05,
      "loss": 1.9589,
      "num_input_tokens_seen": 4352393744,
      "step": 5532
    },
    {
      "epoch": 0.5869934224485466,
      "grad_norm": 0.5686865983357023,
      "learning_rate": 4.9715518010903026e-05,
      "loss": 1.8639,
      "num_input_tokens_seen": 4353180528,
      "step": 5533
    },
    {
      "epoch": 0.5870995119881179,
      "grad_norm": 0.8932156549117637,
      "learning_rate": 4.971541345745648e-05,
      "loss": 2.042,
      "num_input_tokens_seen": 4353967280,
      "step": 5534
    },
    {
      "epoch": 0.5872056015276894,
      "grad_norm": 0.4956070240727788,
      "learning_rate": 4.9715308884910584e-05,
      "loss": 1.944,
      "num_input_tokens_seen": 4354754048,
      "step": 5535
    },
    {
      "epoch": 0.5873116910672608,
      "grad_norm": 0.5695852608294297,
      "learning_rate": 4.9715204293265424e-05,
      "loss": 2.0157,
      "num_input_tokens_seen": 4355540832,
      "step": 5536
    },
    {
      "epoch": 0.5874177806068321,
      "grad_norm": 0.5895471925821492,
      "learning_rate": 4.971509968252107e-05,
      "loss": 2.0566,
      "num_input_tokens_seen": 4356327632,
      "step": 5537
    },
    {
      "epoch": 0.5875238701464036,
      "grad_norm": 0.47379279190462226,
      "learning_rate": 4.971499505267762e-05,
      "loss": 2.0188,
      "num_input_tokens_seen": 4357114304,
      "step": 5538
    },
    {
      "epoch": 0.587629959685975,
      "grad_norm": 0.6052632748543013,
      "learning_rate": 4.971489040373515e-05,
      "loss": 2.0794,
      "num_input_tokens_seen": 4357900976,
      "step": 5539
    },
    {
      "epoch": 0.5877360492255463,
      "grad_norm": 0.5313014620074279,
      "learning_rate": 4.971478573569374e-05,
      "loss": 1.9104,
      "num_input_tokens_seen": 4358687808,
      "step": 5540
    },
    {
      "epoch": 0.5878421387651177,
      "grad_norm": 0.5519163674885045,
      "learning_rate": 4.971468104855346e-05,
      "loss": 2.0869,
      "num_input_tokens_seen": 4359474512,
      "step": 5541
    },
    {
      "epoch": 0.5879482283046892,
      "grad_norm": 0.679634758504436,
      "learning_rate": 4.971457634231441e-05,
      "loss": 2.1751,
      "num_input_tokens_seen": 4360261248,
      "step": 5542
    },
    {
      "epoch": 0.5880543178442605,
      "grad_norm": 0.48628830347312346,
      "learning_rate": 4.971447161697665e-05,
      "loss": 2.0806,
      "num_input_tokens_seen": 4361048048,
      "step": 5543
    },
    {
      "epoch": 0.5881604073838319,
      "grad_norm": 0.7972560018448213,
      "learning_rate": 4.9714366872540274e-05,
      "loss": 1.9829,
      "num_input_tokens_seen": 4361834768,
      "step": 5544
    },
    {
      "epoch": 0.5882664969234034,
      "grad_norm": 0.7091359047734719,
      "learning_rate": 4.971426210900536e-05,
      "loss": 1.982,
      "num_input_tokens_seen": 4362621552,
      "step": 5545
    },
    {
      "epoch": 0.5883725864629747,
      "grad_norm": 0.6743824427703153,
      "learning_rate": 4.9714157326371994e-05,
      "loss": 2.1019,
      "num_input_tokens_seen": 4363408336,
      "step": 5546
    },
    {
      "epoch": 0.5884786760025461,
      "grad_norm": 0.6979522360892811,
      "learning_rate": 4.9714052524640255e-05,
      "loss": 2.1231,
      "num_input_tokens_seen": 4364195056,
      "step": 5547
    },
    {
      "epoch": 0.5885847655421176,
      "grad_norm": 0.7285950783056023,
      "learning_rate": 4.971394770381021e-05,
      "loss": 2.0986,
      "num_input_tokens_seen": 4364981840,
      "step": 5548
    },
    {
      "epoch": 0.588690855081689,
      "grad_norm": 0.5273092560999496,
      "learning_rate": 4.9713842863881964e-05,
      "loss": 2.0224,
      "num_input_tokens_seen": 4365768592,
      "step": 5549
    },
    {
      "epoch": 0.5887969446212603,
      "grad_norm": 0.9585178120704333,
      "learning_rate": 4.971373800485558e-05,
      "loss": 1.952,
      "num_input_tokens_seen": 4366555344,
      "step": 5550
    },
    {
      "epoch": 0.5889030341608318,
      "grad_norm": 0.5262707845626181,
      "learning_rate": 4.971363312673114e-05,
      "loss": 2.1044,
      "num_input_tokens_seen": 4367342096,
      "step": 5551
    },
    {
      "epoch": 0.5890091237004031,
      "grad_norm": 0.8999083314362302,
      "learning_rate": 4.9713528229508735e-05,
      "loss": 2.0118,
      "num_input_tokens_seen": 4368128864,
      "step": 5552
    },
    {
      "epoch": 0.5891152132399745,
      "grad_norm": 0.5724057987234232,
      "learning_rate": 4.9713423313188434e-05,
      "loss": 1.9925,
      "num_input_tokens_seen": 4368915664,
      "step": 5553
    },
    {
      "epoch": 0.589221302779546,
      "grad_norm": 1.5969127043174436,
      "learning_rate": 4.971331837777034e-05,
      "loss": 1.9809,
      "num_input_tokens_seen": 4369702352,
      "step": 5554
    },
    {
      "epoch": 0.5893273923191173,
      "grad_norm": 0.6959509744526527,
      "learning_rate": 4.97132134232545e-05,
      "loss": 2.0245,
      "num_input_tokens_seen": 4370488992,
      "step": 5555
    },
    {
      "epoch": 0.5894334818586887,
      "grad_norm": 0.978432493415662,
      "learning_rate": 4.971310844964102e-05,
      "loss": 2.0044,
      "num_input_tokens_seen": 4371275760,
      "step": 5556
    },
    {
      "epoch": 0.5895395713982601,
      "grad_norm": 1.0406665190791524,
      "learning_rate": 4.971300345692998e-05,
      "loss": 2.0621,
      "num_input_tokens_seen": 4372062480,
      "step": 5557
    },
    {
      "epoch": 0.5896456609378316,
      "grad_norm": 0.49711488489476124,
      "learning_rate": 4.971289844512145e-05,
      "loss": 1.9908,
      "num_input_tokens_seen": 4372849264,
      "step": 5558
    },
    {
      "epoch": 0.5897517504774029,
      "grad_norm": 0.8704141685792955,
      "learning_rate": 4.971279341421552e-05,
      "loss": 1.9126,
      "num_input_tokens_seen": 4373636064,
      "step": 5559
    },
    {
      "epoch": 0.5898578400169743,
      "grad_norm": 0.5151155749456312,
      "learning_rate": 4.9712688364212265e-05,
      "loss": 1.8925,
      "num_input_tokens_seen": 4374422800,
      "step": 5560
    },
    {
      "epoch": 0.5899639295565458,
      "grad_norm": 1.022961392178509,
      "learning_rate": 4.9712583295111784e-05,
      "loss": 1.8532,
      "num_input_tokens_seen": 4375209648,
      "step": 5561
    },
    {
      "epoch": 0.5900700190961171,
      "grad_norm": 1.0170158052972096,
      "learning_rate": 4.9712478206914125e-05,
      "loss": 1.9841,
      "num_input_tokens_seen": 4375996384,
      "step": 5562
    },
    {
      "epoch": 0.5901761086356885,
      "grad_norm": 0.8845078495610798,
      "learning_rate": 4.97123730996194e-05,
      "loss": 2.0227,
      "num_input_tokens_seen": 4376783104,
      "step": 5563
    },
    {
      "epoch": 0.59028219817526,
      "grad_norm": 0.8171753237713705,
      "learning_rate": 4.971226797322767e-05,
      "loss": 1.7595,
      "num_input_tokens_seen": 4377569856,
      "step": 5564
    },
    {
      "epoch": 0.5903882877148313,
      "grad_norm": 1.5799282031323973,
      "learning_rate": 4.9712162827739025e-05,
      "loss": 2.0133,
      "num_input_tokens_seen": 4378356560,
      "step": 5565
    },
    {
      "epoch": 0.5904943772544027,
      "grad_norm": 0.5182547570542821,
      "learning_rate": 4.971205766315356e-05,
      "loss": 1.7705,
      "num_input_tokens_seen": 4379143440,
      "step": 5566
    },
    {
      "epoch": 0.5906004667939742,
      "grad_norm": 1.0348394286328118,
      "learning_rate": 4.9711952479471324e-05,
      "loss": 2.0036,
      "num_input_tokens_seen": 4379930176,
      "step": 5567
    },
    {
      "epoch": 0.5907065563335455,
      "grad_norm": 0.5801730381032053,
      "learning_rate": 4.971184727669242e-05,
      "loss": 1.9723,
      "num_input_tokens_seen": 4380717008,
      "step": 5568
    },
    {
      "epoch": 0.5908126458731169,
      "grad_norm": 0.6357166229226723,
      "learning_rate": 4.971174205481693e-05,
      "loss": 1.933,
      "num_input_tokens_seen": 4381503776,
      "step": 5569
    },
    {
      "epoch": 0.5909187354126884,
      "grad_norm": 0.7354984721855672,
      "learning_rate": 4.971163681384493e-05,
      "loss": 1.9833,
      "num_input_tokens_seen": 4382290560,
      "step": 5570
    },
    {
      "epoch": 0.5910248249522597,
      "grad_norm": 0.6008070268048922,
      "learning_rate": 4.9711531553776505e-05,
      "loss": 2.0011,
      "num_input_tokens_seen": 4383077312,
      "step": 5571
    },
    {
      "epoch": 0.5911309144918311,
      "grad_norm": 0.6038029937934818,
      "learning_rate": 4.9711426274611725e-05,
      "loss": 2.054,
      "num_input_tokens_seen": 4383864128,
      "step": 5572
    },
    {
      "epoch": 0.5912370040314026,
      "grad_norm": 0.5749598570273377,
      "learning_rate": 4.971132097635068e-05,
      "loss": 1.9824,
      "num_input_tokens_seen": 4384650848,
      "step": 5573
    },
    {
      "epoch": 0.5913430935709739,
      "grad_norm": 0.6704244098259976,
      "learning_rate": 4.971121565899346e-05,
      "loss": 2.0605,
      "num_input_tokens_seen": 4385437664,
      "step": 5574
    },
    {
      "epoch": 0.5914491831105453,
      "grad_norm": 0.7216598223422727,
      "learning_rate": 4.971111032254013e-05,
      "loss": 1.9209,
      "num_input_tokens_seen": 4386224464,
      "step": 5575
    },
    {
      "epoch": 0.5915552726501166,
      "grad_norm": 0.7161424704734237,
      "learning_rate": 4.9711004966990786e-05,
      "loss": 1.9694,
      "num_input_tokens_seen": 4387011280,
      "step": 5576
    },
    {
      "epoch": 0.5916613621896881,
      "grad_norm": 0.5423403788511392,
      "learning_rate": 4.97108995923455e-05,
      "loss": 1.9466,
      "num_input_tokens_seen": 4387798032,
      "step": 5577
    },
    {
      "epoch": 0.5917674517292595,
      "grad_norm": 0.726696732295923,
      "learning_rate": 4.971079419860435e-05,
      "loss": 1.9542,
      "num_input_tokens_seen": 4388584800,
      "step": 5578
    },
    {
      "epoch": 0.5918735412688308,
      "grad_norm": 0.6942863174998767,
      "learning_rate": 4.971068878576743e-05,
      "loss": 2.1287,
      "num_input_tokens_seen": 4389371472,
      "step": 5579
    },
    {
      "epoch": 0.5919796308084023,
      "grad_norm": 0.5207740188216634,
      "learning_rate": 4.971058335383482e-05,
      "loss": 1.9231,
      "num_input_tokens_seen": 4390158256,
      "step": 5580
    },
    {
      "epoch": 0.5920857203479737,
      "grad_norm": 0.6625260457485096,
      "learning_rate": 4.9710477902806585e-05,
      "loss": 2.0285,
      "num_input_tokens_seen": 4390944864,
      "step": 5581
    },
    {
      "epoch": 0.592191809887545,
      "grad_norm": 0.4788284284577902,
      "learning_rate": 4.971037243268282e-05,
      "loss": 1.8931,
      "num_input_tokens_seen": 4391731632,
      "step": 5582
    },
    {
      "epoch": 0.5922978994271165,
      "grad_norm": 0.7427387605471337,
      "learning_rate": 4.971026694346361e-05,
      "loss": 2.1441,
      "num_input_tokens_seen": 4392518336,
      "step": 5583
    },
    {
      "epoch": 0.5924039889666879,
      "grad_norm": 1.255697370202965,
      "learning_rate": 4.9710161435149025e-05,
      "loss": 1.9629,
      "num_input_tokens_seen": 4393305056,
      "step": 5584
    },
    {
      "epoch": 0.5925100785062593,
      "grad_norm": 0.5037498972251527,
      "learning_rate": 4.971005590773915e-05,
      "loss": 2.0484,
      "num_input_tokens_seen": 4394091728,
      "step": 5585
    },
    {
      "epoch": 0.5926161680458307,
      "grad_norm": 1.5572621609195194,
      "learning_rate": 4.970995036123407e-05,
      "loss": 2.0109,
      "num_input_tokens_seen": 4394878544,
      "step": 5586
    },
    {
      "epoch": 0.5927222575854021,
      "grad_norm": 0.6323039615726392,
      "learning_rate": 4.970984479563387e-05,
      "loss": 2.0313,
      "num_input_tokens_seen": 4395665232,
      "step": 5587
    },
    {
      "epoch": 0.5928283471249735,
      "grad_norm": 0.9951883727690557,
      "learning_rate": 4.970973921093863e-05,
      "loss": 1.9271,
      "num_input_tokens_seen": 4396452016,
      "step": 5588
    },
    {
      "epoch": 0.5929344366645449,
      "grad_norm": 0.5570536515005384,
      "learning_rate": 4.970963360714842e-05,
      "loss": 2.0204,
      "num_input_tokens_seen": 4397238736,
      "step": 5589
    },
    {
      "epoch": 0.5930405262041163,
      "grad_norm": 0.9729299684837883,
      "learning_rate": 4.970952798426334e-05,
      "loss": 2.1845,
      "num_input_tokens_seen": 4398025472,
      "step": 5590
    },
    {
      "epoch": 0.5931466157436877,
      "grad_norm": 0.7021733969152848,
      "learning_rate": 4.9709422342283455e-05,
      "loss": 1.9789,
      "num_input_tokens_seen": 4398812192,
      "step": 5591
    },
    {
      "epoch": 0.593252705283259,
      "grad_norm": 1.1703964467938908,
      "learning_rate": 4.970931668120885e-05,
      "loss": 2.2207,
      "num_input_tokens_seen": 4399598928,
      "step": 5592
    },
    {
      "epoch": 0.5933587948228305,
      "grad_norm": 0.5430327379060119,
      "learning_rate": 4.970921100103961e-05,
      "loss": 1.8557,
      "num_input_tokens_seen": 4400385760,
      "step": 5593
    },
    {
      "epoch": 0.5934648843624019,
      "grad_norm": 0.7980744856774609,
      "learning_rate": 4.9709105301775825e-05,
      "loss": 2.1196,
      "num_input_tokens_seen": 4401172464,
      "step": 5594
    },
    {
      "epoch": 0.5935709739019732,
      "grad_norm": 0.5930636536251948,
      "learning_rate": 4.970899958341757e-05,
      "loss": 1.9218,
      "num_input_tokens_seen": 4401959232,
      "step": 5595
    },
    {
      "epoch": 0.5936770634415447,
      "grad_norm": 0.553379693547805,
      "learning_rate": 4.970889384596492e-05,
      "loss": 1.9263,
      "num_input_tokens_seen": 4402746048,
      "step": 5596
    },
    {
      "epoch": 0.5937831529811161,
      "grad_norm": 0.7699890755939516,
      "learning_rate": 4.9708788089417956e-05,
      "loss": 2.0433,
      "num_input_tokens_seen": 4403532784,
      "step": 5597
    },
    {
      "epoch": 0.5938892425206874,
      "grad_norm": 0.5724759312573655,
      "learning_rate": 4.970868231377678e-05,
      "loss": 2.0798,
      "num_input_tokens_seen": 4404319648,
      "step": 5598
    },
    {
      "epoch": 0.5939953320602589,
      "grad_norm": 0.5657818590874257,
      "learning_rate": 4.970857651904144e-05,
      "loss": 1.948,
      "num_input_tokens_seen": 4405106384,
      "step": 5599
    },
    {
      "epoch": 0.5941014215998303,
      "grad_norm": 0.6974834520214203,
      "learning_rate": 4.970847070521205e-05,
      "loss": 2.1595,
      "num_input_tokens_seen": 4405893152,
      "step": 5600
    },
    {
      "epoch": 0.5942075111394016,
      "grad_norm": 0.9158531688154123,
      "learning_rate": 4.970836487228868e-05,
      "loss": 2.0327,
      "num_input_tokens_seen": 4406679904,
      "step": 5601
    },
    {
      "epoch": 0.5943136006789731,
      "grad_norm": 0.606867799475994,
      "learning_rate": 4.970825902027141e-05,
      "loss": 1.9413,
      "num_input_tokens_seen": 4407466608,
      "step": 5602
    },
    {
      "epoch": 0.5944196902185445,
      "grad_norm": 0.8888608542093673,
      "learning_rate": 4.970815314916031e-05,
      "loss": 2.136,
      "num_input_tokens_seen": 4408253408,
      "step": 5603
    },
    {
      "epoch": 0.5945257797581158,
      "grad_norm": 0.7297310798966709,
      "learning_rate": 4.970804725895549e-05,
      "loss": 2.0264,
      "num_input_tokens_seen": 4409040128,
      "step": 5604
    },
    {
      "epoch": 0.5946318692976873,
      "grad_norm": 0.824775907437163,
      "learning_rate": 4.970794134965701e-05,
      "loss": 2.1799,
      "num_input_tokens_seen": 4409826880,
      "step": 5605
    },
    {
      "epoch": 0.5947379588372587,
      "grad_norm": 0.8968456411764925,
      "learning_rate": 4.970783542126495e-05,
      "loss": 2.1588,
      "num_input_tokens_seen": 4410613664,
      "step": 5606
    },
    {
      "epoch": 0.59484404837683,
      "grad_norm": 0.6369981477868766,
      "learning_rate": 4.9707729473779406e-05,
      "loss": 1.9763,
      "num_input_tokens_seen": 4411400480,
      "step": 5607
    },
    {
      "epoch": 0.5949501379164014,
      "grad_norm": 0.8113716826501804,
      "learning_rate": 4.9707623507200464e-05,
      "loss": 1.9132,
      "num_input_tokens_seen": 4412187328,
      "step": 5608
    },
    {
      "epoch": 0.5950562274559729,
      "grad_norm": 0.847834701306494,
      "learning_rate": 4.970751752152818e-05,
      "loss": 1.9223,
      "num_input_tokens_seen": 4412974112,
      "step": 5609
    },
    {
      "epoch": 0.5951623169955442,
      "grad_norm": 0.5111405329892497,
      "learning_rate": 4.970741151676266e-05,
      "loss": 2.1513,
      "num_input_tokens_seen": 4413760896,
      "step": 5610
    },
    {
      "epoch": 0.5952684065351156,
      "grad_norm": 0.684946880507018,
      "learning_rate": 4.9707305492903974e-05,
      "loss": 1.9738,
      "num_input_tokens_seen": 4414547648,
      "step": 5611
    },
    {
      "epoch": 0.5953744960746871,
      "grad_norm": 0.5915193950426771,
      "learning_rate": 4.970719944995221e-05,
      "loss": 2.0591,
      "num_input_tokens_seen": 4415334352,
      "step": 5612
    },
    {
      "epoch": 0.5954805856142584,
      "grad_norm": 0.5920810155184297,
      "learning_rate": 4.9707093387907444e-05,
      "loss": 1.9312,
      "num_input_tokens_seen": 4416121104,
      "step": 5613
    },
    {
      "epoch": 0.5955866751538298,
      "grad_norm": 0.7298766583714921,
      "learning_rate": 4.970698730676976e-05,
      "loss": 2.0767,
      "num_input_tokens_seen": 4416907760,
      "step": 5614
    },
    {
      "epoch": 0.5956927646934013,
      "grad_norm": 0.6092904403073217,
      "learning_rate": 4.9706881206539245e-05,
      "loss": 2.0193,
      "num_input_tokens_seen": 4417694528,
      "step": 5615
    },
    {
      "epoch": 0.5957988542329726,
      "grad_norm": 0.6715619771665471,
      "learning_rate": 4.9706775087215975e-05,
      "loss": 2.0737,
      "num_input_tokens_seen": 4418481296,
      "step": 5616
    },
    {
      "epoch": 0.595904943772544,
      "grad_norm": 0.5859863914739507,
      "learning_rate": 4.970666894880004e-05,
      "loss": 2.0666,
      "num_input_tokens_seen": 4419268096,
      "step": 5617
    },
    {
      "epoch": 0.5960110333121155,
      "grad_norm": 0.8121078647598218,
      "learning_rate": 4.970656279129151e-05,
      "loss": 2.0882,
      "num_input_tokens_seen": 4420054848,
      "step": 5618
    },
    {
      "epoch": 0.5961171228516868,
      "grad_norm": 1.5162733199598677,
      "learning_rate": 4.970645661469048e-05,
      "loss": 1.9723,
      "num_input_tokens_seen": 4420841616,
      "step": 5619
    },
    {
      "epoch": 0.5962232123912582,
      "grad_norm": 0.6626054868057183,
      "learning_rate": 4.9706350418997016e-05,
      "loss": 2.0315,
      "num_input_tokens_seen": 4421628368,
      "step": 5620
    },
    {
      "epoch": 0.5963293019308297,
      "grad_norm": 1.2440650808532812,
      "learning_rate": 4.9706244204211216e-05,
      "loss": 1.9651,
      "num_input_tokens_seen": 4422415152,
      "step": 5621
    },
    {
      "epoch": 0.596435391470401,
      "grad_norm": 0.6845936060117583,
      "learning_rate": 4.970613797033315e-05,
      "loss": 2.1118,
      "num_input_tokens_seen": 4423201888,
      "step": 5622
    },
    {
      "epoch": 0.5965414810099724,
      "grad_norm": 0.9017264860938565,
      "learning_rate": 4.970603171736291e-05,
      "loss": 1.9692,
      "num_input_tokens_seen": 4423988704,
      "step": 5623
    },
    {
      "epoch": 0.5966475705495438,
      "grad_norm": 0.5213180987283762,
      "learning_rate": 4.970592544530057e-05,
      "loss": 1.9478,
      "num_input_tokens_seen": 4424775440,
      "step": 5624
    },
    {
      "epoch": 0.5967536600891152,
      "grad_norm": 0.8898275195463239,
      "learning_rate": 4.970581915414621e-05,
      "loss": 1.9081,
      "num_input_tokens_seen": 4425562272,
      "step": 5625
    },
    {
      "epoch": 0.5968597496286866,
      "grad_norm": 1.2282026334221323,
      "learning_rate": 4.9705712843899935e-05,
      "loss": 2.0536,
      "num_input_tokens_seen": 4426348992,
      "step": 5626
    },
    {
      "epoch": 0.596965839168258,
      "grad_norm": 0.7736253587824101,
      "learning_rate": 4.97056065145618e-05,
      "loss": 1.9231,
      "num_input_tokens_seen": 4427135808,
      "step": 5627
    },
    {
      "epoch": 0.5970719287078294,
      "grad_norm": 0.6323524098573579,
      "learning_rate": 4.970550016613189e-05,
      "loss": 2.0086,
      "num_input_tokens_seen": 4427922656,
      "step": 5628
    },
    {
      "epoch": 0.5971780182474008,
      "grad_norm": 0.6612768199924234,
      "learning_rate": 4.9705393798610304e-05,
      "loss": 2.0573,
      "num_input_tokens_seen": 4428709408,
      "step": 5629
    },
    {
      "epoch": 0.5972841077869722,
      "grad_norm": 0.9365912762017761,
      "learning_rate": 4.9705287411997115e-05,
      "loss": 2.117,
      "num_input_tokens_seen": 4429496224,
      "step": 5630
    },
    {
      "epoch": 0.5973901973265436,
      "grad_norm": 0.5102980516294103,
      "learning_rate": 4.97051810062924e-05,
      "loss": 2.0707,
      "num_input_tokens_seen": 4430282976,
      "step": 5631
    },
    {
      "epoch": 0.597496286866115,
      "grad_norm": 0.843555478644628,
      "learning_rate": 4.9705074581496245e-05,
      "loss": 2.0506,
      "num_input_tokens_seen": 4431069600,
      "step": 5632
    },
    {
      "epoch": 0.5976023764056864,
      "grad_norm": 0.5610023856752866,
      "learning_rate": 4.970496813760874e-05,
      "loss": 2.1475,
      "num_input_tokens_seen": 4431856416,
      "step": 5633
    },
    {
      "epoch": 0.5977084659452578,
      "grad_norm": 0.48541971995249344,
      "learning_rate": 4.970486167462996e-05,
      "loss": 1.9417,
      "num_input_tokens_seen": 4432643264,
      "step": 5634
    },
    {
      "epoch": 0.5978145554848292,
      "grad_norm": 0.6950867430331248,
      "learning_rate": 4.970475519255998e-05,
      "loss": 2.1313,
      "num_input_tokens_seen": 4433430032,
      "step": 5635
    },
    {
      "epoch": 0.5979206450244006,
      "grad_norm": 0.5572682561668666,
      "learning_rate": 4.97046486913989e-05,
      "loss": 1.8204,
      "num_input_tokens_seen": 4434216848,
      "step": 5636
    },
    {
      "epoch": 0.598026734563972,
      "grad_norm": 0.5625299459723762,
      "learning_rate": 4.970454217114678e-05,
      "loss": 2.0335,
      "num_input_tokens_seen": 4435003584,
      "step": 5637
    },
    {
      "epoch": 0.5981328241035434,
      "grad_norm": 0.6938575531802803,
      "learning_rate": 4.9704435631803726e-05,
      "loss": 2.0964,
      "num_input_tokens_seen": 4435790384,
      "step": 5638
    },
    {
      "epoch": 0.5982389136431148,
      "grad_norm": 0.42839216982104017,
      "learning_rate": 4.97043290733698e-05,
      "loss": 1.7715,
      "num_input_tokens_seen": 4436577248,
      "step": 5639
    },
    {
      "epoch": 0.5983450031826862,
      "grad_norm": 0.7044278299900473,
      "learning_rate": 4.97042224958451e-05,
      "loss": 1.999,
      "num_input_tokens_seen": 4437363968,
      "step": 5640
    },
    {
      "epoch": 0.5984510927222576,
      "grad_norm": 0.597965718668152,
      "learning_rate": 4.970411589922971e-05,
      "loss": 2.0425,
      "num_input_tokens_seen": 4438150704,
      "step": 5641
    },
    {
      "epoch": 0.598557182261829,
      "grad_norm": 0.5340362176913076,
      "learning_rate": 4.970400928352369e-05,
      "loss": 1.9451,
      "num_input_tokens_seen": 4438937472,
      "step": 5642
    },
    {
      "epoch": 0.5986632718014003,
      "grad_norm": 0.6358694216654823,
      "learning_rate": 4.970390264872714e-05,
      "loss": 2.0085,
      "num_input_tokens_seen": 4439724192,
      "step": 5643
    },
    {
      "epoch": 0.5987693613409718,
      "grad_norm": 0.5730376940544909,
      "learning_rate": 4.970379599484014e-05,
      "loss": 1.942,
      "num_input_tokens_seen": 4440510928,
      "step": 5644
    },
    {
      "epoch": 0.5988754508805432,
      "grad_norm": 0.6483696696481092,
      "learning_rate": 4.970368932186277e-05,
      "loss": 2.0456,
      "num_input_tokens_seen": 4441297680,
      "step": 5645
    },
    {
      "epoch": 0.5989815404201145,
      "grad_norm": 0.492008692703961,
      "learning_rate": 4.970358262979511e-05,
      "loss": 1.7408,
      "num_input_tokens_seen": 4442084480,
      "step": 5646
    },
    {
      "epoch": 0.599087629959686,
      "grad_norm": 0.5979902379308644,
      "learning_rate": 4.970347591863725e-05,
      "loss": 1.9062,
      "num_input_tokens_seen": 4442871312,
      "step": 5647
    },
    {
      "epoch": 0.5991937194992574,
      "grad_norm": 0.6330914078091694,
      "learning_rate": 4.970336918838927e-05,
      "loss": 1.8943,
      "num_input_tokens_seen": 4443658160,
      "step": 5648
    },
    {
      "epoch": 0.5992998090388287,
      "grad_norm": 0.6100987328936947,
      "learning_rate": 4.970326243905126e-05,
      "loss": 1.8529,
      "num_input_tokens_seen": 4444444864,
      "step": 5649
    },
    {
      "epoch": 0.5994058985784002,
      "grad_norm": 0.620360998691926,
      "learning_rate": 4.970315567062328e-05,
      "loss": 1.9122,
      "num_input_tokens_seen": 4445231616,
      "step": 5650
    },
    {
      "epoch": 0.5995119881179716,
      "grad_norm": 0.5673604859464547,
      "learning_rate": 4.970304888310543e-05,
      "loss": 2.0458,
      "num_input_tokens_seen": 4446018368,
      "step": 5651
    },
    {
      "epoch": 0.5996180776575429,
      "grad_norm": 0.6414261911943792,
      "learning_rate": 4.970294207649779e-05,
      "loss": 2.0891,
      "num_input_tokens_seen": 4446805136,
      "step": 5652
    },
    {
      "epoch": 0.5997241671971144,
      "grad_norm": 0.790817801932807,
      "learning_rate": 4.970283525080044e-05,
      "loss": 2.0016,
      "num_input_tokens_seen": 4447591888,
      "step": 5653
    },
    {
      "epoch": 0.5998302567366858,
      "grad_norm": 0.47716078901623865,
      "learning_rate": 4.9702728406013464e-05,
      "loss": 1.9198,
      "num_input_tokens_seen": 4448378608,
      "step": 5654
    },
    {
      "epoch": 0.5999363462762571,
      "grad_norm": 0.7203228397222693,
      "learning_rate": 4.970262154213694e-05,
      "loss": 2.1444,
      "num_input_tokens_seen": 4449165280,
      "step": 5655
    },
    {
      "epoch": 0.6000424358158286,
      "grad_norm": 0.5195129075810692,
      "learning_rate": 4.9702514659170966e-05,
      "loss": 2.0659,
      "num_input_tokens_seen": 4449952096,
      "step": 5656
    },
    {
      "epoch": 0.6001485253554,
      "grad_norm": 0.5171823450591223,
      "learning_rate": 4.97024077571156e-05,
      "loss": 2.0083,
      "num_input_tokens_seen": 4450738752,
      "step": 5657
    },
    {
      "epoch": 0.6002546148949713,
      "grad_norm": 0.6994515733751848,
      "learning_rate": 4.970230083597095e-05,
      "loss": 2.0642,
      "num_input_tokens_seen": 4451525504,
      "step": 5658
    },
    {
      "epoch": 0.6003607044345427,
      "grad_norm": 0.5474640643476474,
      "learning_rate": 4.970219389573708e-05,
      "loss": 2.024,
      "num_input_tokens_seen": 4452312352,
      "step": 5659
    },
    {
      "epoch": 0.6004667939741142,
      "grad_norm": 1.037188012162229,
      "learning_rate": 4.970208693641408e-05,
      "loss": 1.9297,
      "num_input_tokens_seen": 4453099104,
      "step": 5660
    },
    {
      "epoch": 0.6005728835136855,
      "grad_norm": 0.5058678872180616,
      "learning_rate": 4.970197995800203e-05,
      "loss": 1.8197,
      "num_input_tokens_seen": 4453885920,
      "step": 5661
    },
    {
      "epoch": 0.6006789730532569,
      "grad_norm": 1.1083101431018991,
      "learning_rate": 4.9701872960501016e-05,
      "loss": 1.9459,
      "num_input_tokens_seen": 4454672704,
      "step": 5662
    },
    {
      "epoch": 0.6007850625928284,
      "grad_norm": 1.2672032993473765,
      "learning_rate": 4.9701765943911124e-05,
      "loss": 2.0098,
      "num_input_tokens_seen": 4455459488,
      "step": 5663
    },
    {
      "epoch": 0.6008911521323997,
      "grad_norm": 0.4932705706790901,
      "learning_rate": 4.970165890823243e-05,
      "loss": 2.0527,
      "num_input_tokens_seen": 4456246160,
      "step": 5664
    },
    {
      "epoch": 0.6009972416719711,
      "grad_norm": 0.795745464284063,
      "learning_rate": 4.9701551853465015e-05,
      "loss": 2.0306,
      "num_input_tokens_seen": 4457032960,
      "step": 5665
    },
    {
      "epoch": 0.6011033312115426,
      "grad_norm": 0.42020733090973156,
      "learning_rate": 4.970144477960897e-05,
      "loss": 1.9217,
      "num_input_tokens_seen": 4457819808,
      "step": 5666
    },
    {
      "epoch": 0.6012094207511139,
      "grad_norm": 0.6082162818435685,
      "learning_rate": 4.9701337686664375e-05,
      "loss": 1.9853,
      "num_input_tokens_seen": 4458606512,
      "step": 5667
    },
    {
      "epoch": 0.6013155102906853,
      "grad_norm": 0.4928572520112763,
      "learning_rate": 4.9701230574631305e-05,
      "loss": 2.0812,
      "num_input_tokens_seen": 4459393168,
      "step": 5668
    },
    {
      "epoch": 0.6014215998302568,
      "grad_norm": 0.5160499211178755,
      "learning_rate": 4.970112344350985e-05,
      "loss": 2.0068,
      "num_input_tokens_seen": 4460179920,
      "step": 5669
    },
    {
      "epoch": 0.6015276893698281,
      "grad_norm": 0.6043996075695257,
      "learning_rate": 4.9701016293300094e-05,
      "loss": 1.9949,
      "num_input_tokens_seen": 4460966672,
      "step": 5670
    },
    {
      "epoch": 0.6016337789093995,
      "grad_norm": 0.7466373323711,
      "learning_rate": 4.9700909124002115e-05,
      "loss": 2.196,
      "num_input_tokens_seen": 4461753392,
      "step": 5671
    },
    {
      "epoch": 0.601739868448971,
      "grad_norm": 0.5659515495461014,
      "learning_rate": 4.9700801935616e-05,
      "loss": 1.9715,
      "num_input_tokens_seen": 4462540176,
      "step": 5672
    },
    {
      "epoch": 0.6018459579885423,
      "grad_norm": 0.9023226349915155,
      "learning_rate": 4.970069472814183e-05,
      "loss": 2.0394,
      "num_input_tokens_seen": 4463326928,
      "step": 5673
    },
    {
      "epoch": 0.6019520475281137,
      "grad_norm": 0.716684547322215,
      "learning_rate": 4.970058750157969e-05,
      "loss": 2.1129,
      "num_input_tokens_seen": 4464113712,
      "step": 5674
    },
    {
      "epoch": 0.6020581370676851,
      "grad_norm": 0.6188054104538856,
      "learning_rate": 4.970048025592965e-05,
      "loss": 1.9947,
      "num_input_tokens_seen": 4464900480,
      "step": 5675
    },
    {
      "epoch": 0.6021642266072565,
      "grad_norm": 0.6743003537768064,
      "learning_rate": 4.9700372991191815e-05,
      "loss": 2.0008,
      "num_input_tokens_seen": 4465687248,
      "step": 5676
    },
    {
      "epoch": 0.6022703161468279,
      "grad_norm": 0.5049798773706151,
      "learning_rate": 4.9700265707366254e-05,
      "loss": 1.8866,
      "num_input_tokens_seen": 4466474016,
      "step": 5677
    },
    {
      "epoch": 0.6023764056863993,
      "grad_norm": 0.729540628287882,
      "learning_rate": 4.970015840445305e-05,
      "loss": 1.9413,
      "num_input_tokens_seen": 4467260784,
      "step": 5678
    },
    {
      "epoch": 0.6024824952259707,
      "grad_norm": 0.41540730386936525,
      "learning_rate": 4.970005108245229e-05,
      "loss": 1.9118,
      "num_input_tokens_seen": 4468047600,
      "step": 5679
    },
    {
      "epoch": 0.6025885847655421,
      "grad_norm": 1.058520713485751,
      "learning_rate": 4.9699943741364055e-05,
      "loss": 2.0342,
      "num_input_tokens_seen": 4468834320,
      "step": 5680
    },
    {
      "epoch": 0.6026946743051135,
      "grad_norm": 0.664531885527413,
      "learning_rate": 4.969983638118843e-05,
      "loss": 1.9093,
      "num_input_tokens_seen": 4469621136,
      "step": 5681
    },
    {
      "epoch": 0.602800763844685,
      "grad_norm": 1.3707079818678223,
      "learning_rate": 4.9699729001925496e-05,
      "loss": 1.9523,
      "num_input_tokens_seen": 4470407856,
      "step": 5682
    },
    {
      "epoch": 0.6029068533842563,
      "grad_norm": 0.5004579201642125,
      "learning_rate": 4.969962160357533e-05,
      "loss": 1.8982,
      "num_input_tokens_seen": 4471194528,
      "step": 5683
    },
    {
      "epoch": 0.6030129429238277,
      "grad_norm": 0.7792358576502555,
      "learning_rate": 4.969951418613803e-05,
      "loss": 1.932,
      "num_input_tokens_seen": 4471981248,
      "step": 5684
    },
    {
      "epoch": 0.6031190324633992,
      "grad_norm": 0.4834028100212172,
      "learning_rate": 4.9699406749613666e-05,
      "loss": 1.9517,
      "num_input_tokens_seen": 4472768016,
      "step": 5685
    },
    {
      "epoch": 0.6032251220029705,
      "grad_norm": 0.5440061446338754,
      "learning_rate": 4.969929929400232e-05,
      "loss": 1.9994,
      "num_input_tokens_seen": 4473554800,
      "step": 5686
    },
    {
      "epoch": 0.6033312115425419,
      "grad_norm": 0.6141908871203205,
      "learning_rate": 4.969919181930409e-05,
      "loss": 2.0454,
      "num_input_tokens_seen": 4474341664,
      "step": 5687
    },
    {
      "epoch": 0.6034373010821134,
      "grad_norm": 0.4696498711630905,
      "learning_rate": 4.969908432551904e-05,
      "loss": 2.0256,
      "num_input_tokens_seen": 4475128384,
      "step": 5688
    },
    {
      "epoch": 0.6035433906216847,
      "grad_norm": 0.7941324002872966,
      "learning_rate": 4.9698976812647266e-05,
      "loss": 1.89,
      "num_input_tokens_seen": 4475915232,
      "step": 5689
    },
    {
      "epoch": 0.6036494801612561,
      "grad_norm": 0.548038527986945,
      "learning_rate": 4.969886928068885e-05,
      "loss": 2.0156,
      "num_input_tokens_seen": 4476701984,
      "step": 5690
    },
    {
      "epoch": 0.6037555697008274,
      "grad_norm": 0.6553673738253876,
      "learning_rate": 4.969876172964387e-05,
      "loss": 1.9632,
      "num_input_tokens_seen": 4477488656,
      "step": 5691
    },
    {
      "epoch": 0.6038616592403989,
      "grad_norm": 0.6336498366866192,
      "learning_rate": 4.969865415951242e-05,
      "loss": 1.9672,
      "num_input_tokens_seen": 4478275456,
      "step": 5692
    },
    {
      "epoch": 0.6039677487799703,
      "grad_norm": 0.6028787740142411,
      "learning_rate": 4.969854657029457e-05,
      "loss": 2.0746,
      "num_input_tokens_seen": 4479062144,
      "step": 5693
    },
    {
      "epoch": 0.6040738383195416,
      "grad_norm": 0.6573846981167291,
      "learning_rate": 4.9698438961990405e-05,
      "loss": 1.9118,
      "num_input_tokens_seen": 4479848896,
      "step": 5694
    },
    {
      "epoch": 0.6041799278591131,
      "grad_norm": 0.3899227600797693,
      "learning_rate": 4.9698331334600006e-05,
      "loss": 1.9123,
      "num_input_tokens_seen": 4480635648,
      "step": 5695
    },
    {
      "epoch": 0.6042860173986845,
      "grad_norm": 0.6826687672790757,
      "learning_rate": 4.969822368812347e-05,
      "loss": 2.0876,
      "num_input_tokens_seen": 4481422352,
      "step": 5696
    },
    {
      "epoch": 0.6043921069382558,
      "grad_norm": 0.5405822472686209,
      "learning_rate": 4.969811602256087e-05,
      "loss": 2.1043,
      "num_input_tokens_seen": 4482209104,
      "step": 5697
    },
    {
      "epoch": 0.6044981964778273,
      "grad_norm": 0.5598438169500984,
      "learning_rate": 4.969800833791228e-05,
      "loss": 1.91,
      "num_input_tokens_seen": 4482995968,
      "step": 5698
    },
    {
      "epoch": 0.6046042860173987,
      "grad_norm": 0.5267487417203695,
      "learning_rate": 4.969790063417781e-05,
      "loss": 1.8889,
      "num_input_tokens_seen": 4483782736,
      "step": 5699
    },
    {
      "epoch": 0.60471037555697,
      "grad_norm": 0.43566838672493835,
      "learning_rate": 4.969779291135752e-05,
      "loss": 2.0174,
      "num_input_tokens_seen": 4484569552,
      "step": 5700
    },
    {
      "epoch": 0.6048164650965415,
      "grad_norm": 0.640451080511106,
      "learning_rate": 4.96976851694515e-05,
      "loss": 1.9635,
      "num_input_tokens_seen": 4485356320,
      "step": 5701
    },
    {
      "epoch": 0.6049225546361129,
      "grad_norm": 0.44575538312665425,
      "learning_rate": 4.9697577408459826e-05,
      "loss": 2.0599,
      "num_input_tokens_seen": 4486142992,
      "step": 5702
    },
    {
      "epoch": 0.6050286441756842,
      "grad_norm": 0.7171899025428293,
      "learning_rate": 4.96974696283826e-05,
      "loss": 1.9452,
      "num_input_tokens_seen": 4486929728,
      "step": 5703
    },
    {
      "epoch": 0.6051347337152557,
      "grad_norm": 0.7022738610027927,
      "learning_rate": 4.969736182921989e-05,
      "loss": 1.9285,
      "num_input_tokens_seen": 4487716448,
      "step": 5704
    },
    {
      "epoch": 0.6052408232548271,
      "grad_norm": 0.6396365108913272,
      "learning_rate": 4.9697254010971784e-05,
      "loss": 2.0221,
      "num_input_tokens_seen": 4488503200,
      "step": 5705
    },
    {
      "epoch": 0.6053469127943985,
      "grad_norm": 0.7333232517431338,
      "learning_rate": 4.969714617363837e-05,
      "loss": 1.9575,
      "num_input_tokens_seen": 4489290032,
      "step": 5706
    },
    {
      "epoch": 0.6054530023339699,
      "grad_norm": 0.5861576828332457,
      "learning_rate": 4.969703831721971e-05,
      "loss": 1.9247,
      "num_input_tokens_seen": 4490076816,
      "step": 5707
    },
    {
      "epoch": 0.6055590918735413,
      "grad_norm": 0.9146079783037512,
      "learning_rate": 4.969693044171592e-05,
      "loss": 2.0883,
      "num_input_tokens_seen": 4490863536,
      "step": 5708
    },
    {
      "epoch": 0.6056651814131127,
      "grad_norm": 0.914142936586116,
      "learning_rate": 4.969682254712706e-05,
      "loss": 1.9526,
      "num_input_tokens_seen": 4491650352,
      "step": 5709
    },
    {
      "epoch": 0.605771270952684,
      "grad_norm": 0.7790484670370612,
      "learning_rate": 4.969671463345322e-05,
      "loss": 1.9162,
      "num_input_tokens_seen": 4492437136,
      "step": 5710
    },
    {
      "epoch": 0.6058773604922555,
      "grad_norm": 0.8162431482740047,
      "learning_rate": 4.9696606700694485e-05,
      "loss": 1.956,
      "num_input_tokens_seen": 4493223808,
      "step": 5711
    },
    {
      "epoch": 0.6059834500318269,
      "grad_norm": 1.122497156600525,
      "learning_rate": 4.969649874885094e-05,
      "loss": 2.06,
      "num_input_tokens_seen": 4494010560,
      "step": 5712
    },
    {
      "epoch": 0.6060895395713982,
      "grad_norm": 0.6958684429829942,
      "learning_rate": 4.969639077792266e-05,
      "loss": 2.0002,
      "num_input_tokens_seen": 4494797264,
      "step": 5713
    },
    {
      "epoch": 0.6061956291109697,
      "grad_norm": 0.7073301954244908,
      "learning_rate": 4.9696282787909734e-05,
      "loss": 2.0737,
      "num_input_tokens_seen": 4495584000,
      "step": 5714
    },
    {
      "epoch": 0.606301718650541,
      "grad_norm": 0.6859265973038007,
      "learning_rate": 4.969617477881225e-05,
      "loss": 2.2042,
      "num_input_tokens_seen": 4496370720,
      "step": 5715
    },
    {
      "epoch": 0.6064078081901124,
      "grad_norm": 0.6296326657830722,
      "learning_rate": 4.9696066750630285e-05,
      "loss": 2.0082,
      "num_input_tokens_seen": 4497157408,
      "step": 5716
    },
    {
      "epoch": 0.6065138977296839,
      "grad_norm": 0.7623640945873466,
      "learning_rate": 4.969595870336392e-05,
      "loss": 1.9169,
      "num_input_tokens_seen": 4497944192,
      "step": 5717
    },
    {
      "epoch": 0.6066199872692553,
      "grad_norm": 0.5540709433596377,
      "learning_rate": 4.969585063701325e-05,
      "loss": 2.0529,
      "num_input_tokens_seen": 4498730960,
      "step": 5718
    },
    {
      "epoch": 0.6067260768088266,
      "grad_norm": 0.62650407378113,
      "learning_rate": 4.969574255157835e-05,
      "loss": 2.0175,
      "num_input_tokens_seen": 4499517840,
      "step": 5719
    },
    {
      "epoch": 0.6068321663483981,
      "grad_norm": 0.5810193511711534,
      "learning_rate": 4.9695634447059306e-05,
      "loss": 2.0884,
      "num_input_tokens_seen": 4500304576,
      "step": 5720
    },
    {
      "epoch": 0.6069382558879695,
      "grad_norm": 0.6102095456286558,
      "learning_rate": 4.969552632345619e-05,
      "loss": 2.0521,
      "num_input_tokens_seen": 4501091296,
      "step": 5721
    },
    {
      "epoch": 0.6070443454275408,
      "grad_norm": 0.481968250083828,
      "learning_rate": 4.9695418180769104e-05,
      "loss": 1.9121,
      "num_input_tokens_seen": 4501878064,
      "step": 5722
    },
    {
      "epoch": 0.6071504349671123,
      "grad_norm": 0.7060573990526368,
      "learning_rate": 4.969531001899812e-05,
      "loss": 1.9493,
      "num_input_tokens_seen": 4502664816,
      "step": 5723
    },
    {
      "epoch": 0.6072565245066837,
      "grad_norm": 0.5531089084305778,
      "learning_rate": 4.9695201838143324e-05,
      "loss": 2.0299,
      "num_input_tokens_seen": 4503451600,
      "step": 5724
    },
    {
      "epoch": 0.607362614046255,
      "grad_norm": 0.5824714145277217,
      "learning_rate": 4.9695093638204806e-05,
      "loss": 2.0934,
      "num_input_tokens_seen": 4504238368,
      "step": 5725
    },
    {
      "epoch": 0.6074687035858264,
      "grad_norm": 0.44237000110358393,
      "learning_rate": 4.9694985419182636e-05,
      "loss": 2.0956,
      "num_input_tokens_seen": 4505025200,
      "step": 5726
    },
    {
      "epoch": 0.6075747931253979,
      "grad_norm": 0.4735767601293787,
      "learning_rate": 4.9694877181076916e-05,
      "loss": 1.9916,
      "num_input_tokens_seen": 4505811952,
      "step": 5727
    },
    {
      "epoch": 0.6076808826649692,
      "grad_norm": 0.6641967305342453,
      "learning_rate": 4.969476892388771e-05,
      "loss": 2.1602,
      "num_input_tokens_seen": 4506598560,
      "step": 5728
    },
    {
      "epoch": 0.6077869722045406,
      "grad_norm": 0.4682118282469611,
      "learning_rate": 4.969466064761512e-05,
      "loss": 1.8343,
      "num_input_tokens_seen": 4507385328,
      "step": 5729
    },
    {
      "epoch": 0.6078930617441121,
      "grad_norm": 0.8431409205790587,
      "learning_rate": 4.9694552352259216e-05,
      "loss": 1.9503,
      "num_input_tokens_seen": 4508172080,
      "step": 5730
    },
    {
      "epoch": 0.6079991512836834,
      "grad_norm": 0.5810792772427954,
      "learning_rate": 4.9694444037820086e-05,
      "loss": 2.0828,
      "num_input_tokens_seen": 4508958832,
      "step": 5731
    },
    {
      "epoch": 0.6081052408232548,
      "grad_norm": 0.5325793851679719,
      "learning_rate": 4.9694335704297825e-05,
      "loss": 1.9295,
      "num_input_tokens_seen": 4509745536,
      "step": 5732
    },
    {
      "epoch": 0.6082113303628263,
      "grad_norm": 0.43592564021399194,
      "learning_rate": 4.969422735169249e-05,
      "loss": 1.9691,
      "num_input_tokens_seen": 4510532320,
      "step": 5733
    },
    {
      "epoch": 0.6083174199023976,
      "grad_norm": 0.5232449302085945,
      "learning_rate": 4.969411898000419e-05,
      "loss": 1.9388,
      "num_input_tokens_seen": 4511319216,
      "step": 5734
    },
    {
      "epoch": 0.608423509441969,
      "grad_norm": 0.46583258003197947,
      "learning_rate": 4.9694010589233e-05,
      "loss": 2.0482,
      "num_input_tokens_seen": 4512106000,
      "step": 5735
    },
    {
      "epoch": 0.6085295989815405,
      "grad_norm": 0.4021288951208181,
      "learning_rate": 4.9693902179378994e-05,
      "loss": 1.927,
      "num_input_tokens_seen": 4512892832,
      "step": 5736
    },
    {
      "epoch": 0.6086356885211118,
      "grad_norm": 0.5055158899272375,
      "learning_rate": 4.969379375044227e-05,
      "loss": 2.1778,
      "num_input_tokens_seen": 4513679616,
      "step": 5737
    },
    {
      "epoch": 0.6087417780606832,
      "grad_norm": 0.5100340178229555,
      "learning_rate": 4.969368530242291e-05,
      "loss": 1.8102,
      "num_input_tokens_seen": 4514466512,
      "step": 5738
    },
    {
      "epoch": 0.6088478676002547,
      "grad_norm": 0.4952184758110205,
      "learning_rate": 4.969357683532099e-05,
      "loss": 2.1181,
      "num_input_tokens_seen": 4515253248,
      "step": 5739
    },
    {
      "epoch": 0.608953957139826,
      "grad_norm": 0.4438521965916124,
      "learning_rate": 4.96934683491366e-05,
      "loss": 1.9382,
      "num_input_tokens_seen": 4516040096,
      "step": 5740
    },
    {
      "epoch": 0.6090600466793974,
      "grad_norm": 0.474559155265122,
      "learning_rate": 4.9693359843869823e-05,
      "loss": 1.9958,
      "num_input_tokens_seen": 4516826816,
      "step": 5741
    },
    {
      "epoch": 0.6091661362189688,
      "grad_norm": 0.6992127702041009,
      "learning_rate": 4.969325131952074e-05,
      "loss": 1.9692,
      "num_input_tokens_seen": 4517613632,
      "step": 5742
    },
    {
      "epoch": 0.6092722257585402,
      "grad_norm": 0.5212983171168386,
      "learning_rate": 4.969314277608944e-05,
      "loss": 1.8144,
      "num_input_tokens_seen": 4518400464,
      "step": 5743
    },
    {
      "epoch": 0.6093783152981116,
      "grad_norm": 0.7044707278366038,
      "learning_rate": 4.9693034213576e-05,
      "loss": 2.0616,
      "num_input_tokens_seen": 4519187248,
      "step": 5744
    },
    {
      "epoch": 0.609484404837683,
      "grad_norm": 0.8045540383281398,
      "learning_rate": 4.969292563198051e-05,
      "loss": 2.0357,
      "num_input_tokens_seen": 4519974032,
      "step": 5745
    },
    {
      "epoch": 0.6095904943772544,
      "grad_norm": 0.5598689360026431,
      "learning_rate": 4.969281703130306e-05,
      "loss": 1.987,
      "num_input_tokens_seen": 4520760800,
      "step": 5746
    },
    {
      "epoch": 0.6096965839168258,
      "grad_norm": 0.7192447674046174,
      "learning_rate": 4.969270841154371e-05,
      "loss": 2.0278,
      "num_input_tokens_seen": 4521547648,
      "step": 5747
    },
    {
      "epoch": 0.6098026734563972,
      "grad_norm": 0.4687358370248905,
      "learning_rate": 4.969259977270258e-05,
      "loss": 1.9221,
      "num_input_tokens_seen": 4522334432,
      "step": 5748
    },
    {
      "epoch": 0.6099087629959686,
      "grad_norm": 0.8865547521439497,
      "learning_rate": 4.9692491114779715e-05,
      "loss": 1.9887,
      "num_input_tokens_seen": 4523121216,
      "step": 5749
    },
    {
      "epoch": 0.61001485253554,
      "grad_norm": 0.5613142694488367,
      "learning_rate": 4.969238243777522e-05,
      "loss": 2.1255,
      "num_input_tokens_seen": 4523907824,
      "step": 5750
    },
    {
      "epoch": 0.6101209420751114,
      "grad_norm": 0.786653663972909,
      "learning_rate": 4.969227374168918e-05,
      "loss": 1.9763,
      "num_input_tokens_seen": 4524694464,
      "step": 5751
    },
    {
      "epoch": 0.6102270316146828,
      "grad_norm": 0.481979071979559,
      "learning_rate": 4.9692165026521675e-05,
      "loss": 2.0576,
      "num_input_tokens_seen": 4525481264,
      "step": 5752
    },
    {
      "epoch": 0.6103331211542542,
      "grad_norm": 0.8844751592485913,
      "learning_rate": 4.969205629227279e-05,
      "loss": 2.0067,
      "num_input_tokens_seen": 4526268048,
      "step": 5753
    },
    {
      "epoch": 0.6104392106938256,
      "grad_norm": 0.6325396787081405,
      "learning_rate": 4.969194753894261e-05,
      "loss": 2.124,
      "num_input_tokens_seen": 4527054752,
      "step": 5754
    },
    {
      "epoch": 0.610545300233397,
      "grad_norm": 0.7951157420390609,
      "learning_rate": 4.969183876653121e-05,
      "loss": 2.0132,
      "num_input_tokens_seen": 4527841536,
      "step": 5755
    },
    {
      "epoch": 0.6106513897729684,
      "grad_norm": 0.6181754467806556,
      "learning_rate": 4.9691729975038684e-05,
      "loss": 1.9014,
      "num_input_tokens_seen": 4528628304,
      "step": 5756
    },
    {
      "epoch": 0.6107574793125398,
      "grad_norm": 0.6233091745235475,
      "learning_rate": 4.9691621164465116e-05,
      "loss": 2.0899,
      "num_input_tokens_seen": 4529415120,
      "step": 5757
    },
    {
      "epoch": 0.6108635688521111,
      "grad_norm": 0.516191047631906,
      "learning_rate": 4.9691512334810585e-05,
      "loss": 2.0149,
      "num_input_tokens_seen": 4530201840,
      "step": 5758
    },
    {
      "epoch": 0.6109696583916826,
      "grad_norm": 0.6031388628497145,
      "learning_rate": 4.969140348607518e-05,
      "loss": 2.0848,
      "num_input_tokens_seen": 4530988576,
      "step": 5759
    },
    {
      "epoch": 0.611075747931254,
      "grad_norm": 0.6698925126055195,
      "learning_rate": 4.969129461825899e-05,
      "loss": 1.9834,
      "num_input_tokens_seen": 4531775248,
      "step": 5760
    },
    {
      "epoch": 0.6111818374708253,
      "grad_norm": 0.49739709497727447,
      "learning_rate": 4.9691185731362076e-05,
      "loss": 1.9401,
      "num_input_tokens_seen": 4532561984,
      "step": 5761
    },
    {
      "epoch": 0.6112879270103968,
      "grad_norm": 0.5016096007492759,
      "learning_rate": 4.969107682538455e-05,
      "loss": 2.0676,
      "num_input_tokens_seen": 4533348752,
      "step": 5762
    },
    {
      "epoch": 0.6113940165499682,
      "grad_norm": 0.5472560869791598,
      "learning_rate": 4.969096790032648e-05,
      "loss": 2.1178,
      "num_input_tokens_seen": 4534135536,
      "step": 5763
    },
    {
      "epoch": 0.6115001060895395,
      "grad_norm": 0.4358321215880592,
      "learning_rate": 4.9690858956187956e-05,
      "loss": 1.9482,
      "num_input_tokens_seen": 4534922288,
      "step": 5764
    },
    {
      "epoch": 0.611606195629111,
      "grad_norm": 0.5901257045636402,
      "learning_rate": 4.969074999296906e-05,
      "loss": 1.94,
      "num_input_tokens_seen": 4535709136,
      "step": 5765
    },
    {
      "epoch": 0.6117122851686824,
      "grad_norm": 0.558735210334034,
      "learning_rate": 4.969064101066988e-05,
      "loss": 2.1025,
      "num_input_tokens_seen": 4536495856,
      "step": 5766
    },
    {
      "epoch": 0.6118183747082537,
      "grad_norm": 0.6226666395285899,
      "learning_rate": 4.96905320092905e-05,
      "loss": 2.1321,
      "num_input_tokens_seen": 4537282656,
      "step": 5767
    },
    {
      "epoch": 0.6119244642478252,
      "grad_norm": 0.47960562588319733,
      "learning_rate": 4.9690422988830994e-05,
      "loss": 1.8044,
      "num_input_tokens_seen": 4538069536,
      "step": 5768
    },
    {
      "epoch": 0.6120305537873966,
      "grad_norm": 0.6681817143015039,
      "learning_rate": 4.969031394929146e-05,
      "loss": 2.0154,
      "num_input_tokens_seen": 4538856384,
      "step": 5769
    },
    {
      "epoch": 0.6121366433269679,
      "grad_norm": 0.647369116357644,
      "learning_rate": 4.969020489067197e-05,
      "loss": 2.042,
      "num_input_tokens_seen": 4539643216,
      "step": 5770
    },
    {
      "epoch": 0.6122427328665394,
      "grad_norm": 0.6339455941761525,
      "learning_rate": 4.969009581297261e-05,
      "loss": 1.9785,
      "num_input_tokens_seen": 4540429904,
      "step": 5771
    },
    {
      "epoch": 0.6123488224061108,
      "grad_norm": 0.9136100072111654,
      "learning_rate": 4.968998671619347e-05,
      "loss": 2.0694,
      "num_input_tokens_seen": 4541216672,
      "step": 5772
    },
    {
      "epoch": 0.6124549119456821,
      "grad_norm": 0.6508567495457809,
      "learning_rate": 4.9689877600334646e-05,
      "loss": 2.0717,
      "num_input_tokens_seen": 4542003424,
      "step": 5773
    },
    {
      "epoch": 0.6125610014852536,
      "grad_norm": 0.7344319448488342,
      "learning_rate": 4.9689768465396194e-05,
      "loss": 2.0596,
      "num_input_tokens_seen": 4542790208,
      "step": 5774
    },
    {
      "epoch": 0.612667091024825,
      "grad_norm": 0.547657246465538,
      "learning_rate": 4.968965931137822e-05,
      "loss": 2.0205,
      "num_input_tokens_seen": 4543576976,
      "step": 5775
    },
    {
      "epoch": 0.6127731805643963,
      "grad_norm": 0.9770021981373581,
      "learning_rate": 4.96895501382808e-05,
      "loss": 1.8938,
      "num_input_tokens_seen": 4544363744,
      "step": 5776
    },
    {
      "epoch": 0.6128792701039677,
      "grad_norm": 0.7173637099393998,
      "learning_rate": 4.968944094610402e-05,
      "loss": 2.0389,
      "num_input_tokens_seen": 4545150592,
      "step": 5777
    },
    {
      "epoch": 0.6129853596435392,
      "grad_norm": 0.9211034188067487,
      "learning_rate": 4.9689331734847964e-05,
      "loss": 1.9881,
      "num_input_tokens_seen": 4545937344,
      "step": 5778
    },
    {
      "epoch": 0.6130914491831105,
      "grad_norm": 0.6947996325661228,
      "learning_rate": 4.9689222504512724e-05,
      "loss": 1.9054,
      "num_input_tokens_seen": 4546724080,
      "step": 5779
    },
    {
      "epoch": 0.6131975387226819,
      "grad_norm": 0.694111013181148,
      "learning_rate": 4.9689113255098365e-05,
      "loss": 2.0469,
      "num_input_tokens_seen": 4547510832,
      "step": 5780
    },
    {
      "epoch": 0.6133036282622534,
      "grad_norm": 1.016651748051172,
      "learning_rate": 4.968900398660499e-05,
      "loss": 2.0167,
      "num_input_tokens_seen": 4548297616,
      "step": 5781
    },
    {
      "epoch": 0.6134097178018247,
      "grad_norm": 0.5591144751862457,
      "learning_rate": 4.968889469903268e-05,
      "loss": 2.07,
      "num_input_tokens_seen": 4549084304,
      "step": 5782
    },
    {
      "epoch": 0.6135158073413961,
      "grad_norm": 1.0786303558933372,
      "learning_rate": 4.968878539238151e-05,
      "loss": 2.0027,
      "num_input_tokens_seen": 4549871024,
      "step": 5783
    },
    {
      "epoch": 0.6136218968809676,
      "grad_norm": 0.41798692081257893,
      "learning_rate": 4.968867606665158e-05,
      "loss": 1.9955,
      "num_input_tokens_seen": 4550657760,
      "step": 5784
    },
    {
      "epoch": 0.6137279864205389,
      "grad_norm": 0.9082911972679182,
      "learning_rate": 4.968856672184295e-05,
      "loss": 1.9386,
      "num_input_tokens_seen": 4551444464,
      "step": 5785
    },
    {
      "epoch": 0.6138340759601103,
      "grad_norm": 0.5376850424817142,
      "learning_rate": 4.9688457357955743e-05,
      "loss": 1.9711,
      "num_input_tokens_seen": 4552231312,
      "step": 5786
    },
    {
      "epoch": 0.6139401654996818,
      "grad_norm": 0.47822242169107115,
      "learning_rate": 4.968834797499e-05,
      "loss": 1.7057,
      "num_input_tokens_seen": 4553018160,
      "step": 5787
    },
    {
      "epoch": 0.6140462550392531,
      "grad_norm": 0.9125402610396913,
      "learning_rate": 4.968823857294584e-05,
      "loss": 2.0863,
      "num_input_tokens_seen": 4553804880,
      "step": 5788
    },
    {
      "epoch": 0.6141523445788245,
      "grad_norm": 0.4716156082039615,
      "learning_rate": 4.9688129151823326e-05,
      "loss": 1.9185,
      "num_input_tokens_seen": 4554591680,
      "step": 5789
    },
    {
      "epoch": 0.614258434118396,
      "grad_norm": 0.6700788003303982,
      "learning_rate": 4.9688019711622555e-05,
      "loss": 2.0295,
      "num_input_tokens_seen": 4555378432,
      "step": 5790
    },
    {
      "epoch": 0.6143645236579673,
      "grad_norm": 0.5706201838031939,
      "learning_rate": 4.96879102523436e-05,
      "loss": 2.0235,
      "num_input_tokens_seen": 4556165248,
      "step": 5791
    },
    {
      "epoch": 0.6144706131975387,
      "grad_norm": 0.42540688758350625,
      "learning_rate": 4.9687800773986556e-05,
      "loss": 1.9093,
      "num_input_tokens_seen": 4556952160,
      "step": 5792
    },
    {
      "epoch": 0.6145767027371101,
      "grad_norm": 0.8002505232487528,
      "learning_rate": 4.9687691276551504e-05,
      "loss": 1.9047,
      "num_input_tokens_seen": 4557739008,
      "step": 5793
    },
    {
      "epoch": 0.6146827922766815,
      "grad_norm": 0.5131712851685732,
      "learning_rate": 4.9687581760038526e-05,
      "loss": 2.0286,
      "num_input_tokens_seen": 4558525824,
      "step": 5794
    },
    {
      "epoch": 0.6147888818162529,
      "grad_norm": 0.6470257247548834,
      "learning_rate": 4.968747222444772e-05,
      "loss": 2.0962,
      "num_input_tokens_seen": 4559312576,
      "step": 5795
    },
    {
      "epoch": 0.6148949713558243,
      "grad_norm": 0.6358874915473528,
      "learning_rate": 4.968736266977915e-05,
      "loss": 2.1186,
      "num_input_tokens_seen": 4560099280,
      "step": 5796
    },
    {
      "epoch": 0.6150010608953957,
      "grad_norm": 0.4550528112829526,
      "learning_rate": 4.96872530960329e-05,
      "loss": 2.1911,
      "num_input_tokens_seen": 4560886096,
      "step": 5797
    },
    {
      "epoch": 0.6151071504349671,
      "grad_norm": 0.4640679356414202,
      "learning_rate": 4.9687143503209086e-05,
      "loss": 2.0402,
      "num_input_tokens_seen": 4561672800,
      "step": 5798
    },
    {
      "epoch": 0.6152132399745385,
      "grad_norm": 0.45824811475203525,
      "learning_rate": 4.968703389130776e-05,
      "loss": 1.9573,
      "num_input_tokens_seen": 4562459632,
      "step": 5799
    },
    {
      "epoch": 0.61531932951411,
      "grad_norm": 0.45021152372561446,
      "learning_rate": 4.968692426032903e-05,
      "loss": 1.9468,
      "num_input_tokens_seen": 4563246400,
      "step": 5800
    },
    {
      "epoch": 0.6154254190536813,
      "grad_norm": 0.6350104634028013,
      "learning_rate": 4.968681461027296e-05,
      "loss": 1.9883,
      "num_input_tokens_seen": 4564033168,
      "step": 5801
    },
    {
      "epoch": 0.6155315085932527,
      "grad_norm": 0.43622809926500355,
      "learning_rate": 4.968670494113964e-05,
      "loss": 2.0147,
      "num_input_tokens_seen": 4564819856,
      "step": 5802
    },
    {
      "epoch": 0.6156375981328241,
      "grad_norm": 0.459578884284886,
      "learning_rate": 4.968659525292916e-05,
      "loss": 2.0822,
      "num_input_tokens_seen": 4565606544,
      "step": 5803
    },
    {
      "epoch": 0.6157436876723955,
      "grad_norm": 0.6304677312326652,
      "learning_rate": 4.9686485545641615e-05,
      "loss": 1.962,
      "num_input_tokens_seen": 4566393344,
      "step": 5804
    },
    {
      "epoch": 0.6158497772119669,
      "grad_norm": 0.4193639744539903,
      "learning_rate": 4.9686375819277064e-05,
      "loss": 1.9159,
      "num_input_tokens_seen": 4567180064,
      "step": 5805
    },
    {
      "epoch": 0.6159558667515384,
      "grad_norm": 0.7540481736018706,
      "learning_rate": 4.968626607383562e-05,
      "loss": 2.1,
      "num_input_tokens_seen": 4567966832,
      "step": 5806
    },
    {
      "epoch": 0.6160619562911097,
      "grad_norm": 0.45751865599766317,
      "learning_rate": 4.968615630931734e-05,
      "loss": 1.8506,
      "num_input_tokens_seen": 4568753648,
      "step": 5807
    },
    {
      "epoch": 0.6161680458306811,
      "grad_norm": 0.6041534745122856,
      "learning_rate": 4.968604652572233e-05,
      "loss": 2.0477,
      "num_input_tokens_seen": 4569540480,
      "step": 5808
    },
    {
      "epoch": 0.6162741353702524,
      "grad_norm": 0.5280966956894216,
      "learning_rate": 4.968593672305067e-05,
      "loss": 1.8833,
      "num_input_tokens_seen": 4570327296,
      "step": 5809
    },
    {
      "epoch": 0.6163802249098239,
      "grad_norm": 0.8308381595716984,
      "learning_rate": 4.968582690130243e-05,
      "loss": 2.0345,
      "num_input_tokens_seen": 4571114096,
      "step": 5810
    },
    {
      "epoch": 0.6164863144493953,
      "grad_norm": 0.5338068858172611,
      "learning_rate": 4.968571706047772e-05,
      "loss": 1.9662,
      "num_input_tokens_seen": 4571900864,
      "step": 5811
    },
    {
      "epoch": 0.6165924039889666,
      "grad_norm": 1.002143639515469,
      "learning_rate": 4.968560720057661e-05,
      "loss": 2.0404,
      "num_input_tokens_seen": 4572687600,
      "step": 5812
    },
    {
      "epoch": 0.6166984935285381,
      "grad_norm": 1.3202894301516646,
      "learning_rate": 4.968549732159919e-05,
      "loss": 1.9914,
      "num_input_tokens_seen": 4573474368,
      "step": 5813
    },
    {
      "epoch": 0.6168045830681095,
      "grad_norm": 0.9115024443547434,
      "learning_rate": 4.968538742354554e-05,
      "loss": 2.2276,
      "num_input_tokens_seen": 4574261120,
      "step": 5814
    },
    {
      "epoch": 0.6169106726076808,
      "grad_norm": 0.5685137629668016,
      "learning_rate": 4.968527750641574e-05,
      "loss": 2.0016,
      "num_input_tokens_seen": 4575047952,
      "step": 5815
    },
    {
      "epoch": 0.6170167621472523,
      "grad_norm": 0.9528725493083151,
      "learning_rate": 4.968516757020989e-05,
      "loss": 2.0636,
      "num_input_tokens_seen": 4575834688,
      "step": 5816
    },
    {
      "epoch": 0.6171228516868237,
      "grad_norm": 0.8267622395864823,
      "learning_rate": 4.968505761492806e-05,
      "loss": 1.8698,
      "num_input_tokens_seen": 4576621472,
      "step": 5817
    },
    {
      "epoch": 0.617228941226395,
      "grad_norm": 0.4829860322661036,
      "learning_rate": 4.9684947640570345e-05,
      "loss": 1.9651,
      "num_input_tokens_seen": 4577408112,
      "step": 5818
    },
    {
      "epoch": 0.6173350307659665,
      "grad_norm": 0.807980893274901,
      "learning_rate": 4.968483764713683e-05,
      "loss": 2.03,
      "num_input_tokens_seen": 4578194944,
      "step": 5819
    },
    {
      "epoch": 0.6174411203055379,
      "grad_norm": 0.6885129256713121,
      "learning_rate": 4.9684727634627594e-05,
      "loss": 2.0163,
      "num_input_tokens_seen": 4578981760,
      "step": 5820
    },
    {
      "epoch": 0.6175472098451092,
      "grad_norm": 0.8490811488775876,
      "learning_rate": 4.968461760304273e-05,
      "loss": 1.9449,
      "num_input_tokens_seen": 4579768576,
      "step": 5821
    },
    {
      "epoch": 0.6176532993846807,
      "grad_norm": 0.8172155199805283,
      "learning_rate": 4.968450755238231e-05,
      "loss": 2.0699,
      "num_input_tokens_seen": 4580555216,
      "step": 5822
    },
    {
      "epoch": 0.6177593889242521,
      "grad_norm": 0.7675486042183418,
      "learning_rate": 4.968439748264643e-05,
      "loss": 2.0978,
      "num_input_tokens_seen": 4581342032,
      "step": 5823
    },
    {
      "epoch": 0.6178654784638234,
      "grad_norm": 0.5549681613360012,
      "learning_rate": 4.9684287393835164e-05,
      "loss": 2.0152,
      "num_input_tokens_seen": 4582128848,
      "step": 5824
    },
    {
      "epoch": 0.6179715680033948,
      "grad_norm": 0.4477841711932124,
      "learning_rate": 4.968417728594861e-05,
      "loss": 1.8359,
      "num_input_tokens_seen": 4582915600,
      "step": 5825
    },
    {
      "epoch": 0.6180776575429663,
      "grad_norm": 0.8711102073626965,
      "learning_rate": 4.9684067158986855e-05,
      "loss": 2.1106,
      "num_input_tokens_seen": 4583702304,
      "step": 5826
    },
    {
      "epoch": 0.6181837470825376,
      "grad_norm": 0.763118207235939,
      "learning_rate": 4.968395701294997e-05,
      "loss": 1.9099,
      "num_input_tokens_seen": 4584489088,
      "step": 5827
    },
    {
      "epoch": 0.618289836622109,
      "grad_norm": 0.7496061019292132,
      "learning_rate": 4.968384684783805e-05,
      "loss": 2.064,
      "num_input_tokens_seen": 4585275792,
      "step": 5828
    },
    {
      "epoch": 0.6183959261616805,
      "grad_norm": 1.2256020534123486,
      "learning_rate": 4.968373666365118e-05,
      "loss": 1.8722,
      "num_input_tokens_seen": 4586062672,
      "step": 5829
    },
    {
      "epoch": 0.6185020157012519,
      "grad_norm": 0.599083631077362,
      "learning_rate": 4.9683626460389435e-05,
      "loss": 1.8772,
      "num_input_tokens_seen": 4586849456,
      "step": 5830
    },
    {
      "epoch": 0.6186081052408232,
      "grad_norm": 0.7574294343176103,
      "learning_rate": 4.968351623805292e-05,
      "loss": 2.0126,
      "num_input_tokens_seen": 4587636208,
      "step": 5831
    },
    {
      "epoch": 0.6187141947803947,
      "grad_norm": 0.5339931246867051,
      "learning_rate": 4.96834059966417e-05,
      "loss": 1.886,
      "num_input_tokens_seen": 4588423040,
      "step": 5832
    },
    {
      "epoch": 0.618820284319966,
      "grad_norm": 0.4616471546816832,
      "learning_rate": 4.9683295736155866e-05,
      "loss": 2.1093,
      "num_input_tokens_seen": 4589209856,
      "step": 5833
    },
    {
      "epoch": 0.6189263738595374,
      "grad_norm": 0.44390211331715373,
      "learning_rate": 4.968318545659551e-05,
      "loss": 2.0365,
      "num_input_tokens_seen": 4589996624,
      "step": 5834
    },
    {
      "epoch": 0.6190324633991089,
      "grad_norm": 0.5148208882140831,
      "learning_rate": 4.9683075157960705e-05,
      "loss": 1.9452,
      "num_input_tokens_seen": 4590783392,
      "step": 5835
    },
    {
      "epoch": 0.6191385529386803,
      "grad_norm": 0.44387426014649467,
      "learning_rate": 4.968296484025155e-05,
      "loss": 1.8635,
      "num_input_tokens_seen": 4591570272,
      "step": 5836
    },
    {
      "epoch": 0.6192446424782516,
      "grad_norm": 0.5985366621945317,
      "learning_rate": 4.968285450346812e-05,
      "loss": 2.1209,
      "num_input_tokens_seen": 4592357008,
      "step": 5837
    },
    {
      "epoch": 0.6193507320178231,
      "grad_norm": 0.4372037373885162,
      "learning_rate": 4.968274414761051e-05,
      "loss": 1.9415,
      "num_input_tokens_seen": 4593143856,
      "step": 5838
    },
    {
      "epoch": 0.6194568215573945,
      "grad_norm": 0.6949917043974131,
      "learning_rate": 4.96826337726788e-05,
      "loss": 2.0401,
      "num_input_tokens_seen": 4593930688,
      "step": 5839
    },
    {
      "epoch": 0.6195629110969658,
      "grad_norm": 0.4775439099219554,
      "learning_rate": 4.9682523378673066e-05,
      "loss": 2.0631,
      "num_input_tokens_seen": 4594717488,
      "step": 5840
    },
    {
      "epoch": 0.6196690006365373,
      "grad_norm": 0.7627744037136224,
      "learning_rate": 4.968241296559341e-05,
      "loss": 1.8708,
      "num_input_tokens_seen": 4595504288,
      "step": 5841
    },
    {
      "epoch": 0.6197750901761087,
      "grad_norm": 0.4970538607295844,
      "learning_rate": 4.9682302533439906e-05,
      "loss": 1.9175,
      "num_input_tokens_seen": 4596291008,
      "step": 5842
    },
    {
      "epoch": 0.61988117971568,
      "grad_norm": 0.76877070914081,
      "learning_rate": 4.968219208221264e-05,
      "loss": 2.081,
      "num_input_tokens_seen": 4597077664,
      "step": 5843
    },
    {
      "epoch": 0.6199872692552514,
      "grad_norm": 0.5620105181653674,
      "learning_rate": 4.968208161191171e-05,
      "loss": 1.9342,
      "num_input_tokens_seen": 4597864352,
      "step": 5844
    },
    {
      "epoch": 0.6200933587948229,
      "grad_norm": 1.1434294112413488,
      "learning_rate": 4.9681971122537184e-05,
      "loss": 2.207,
      "num_input_tokens_seen": 4598651104,
      "step": 5845
    },
    {
      "epoch": 0.6201994483343942,
      "grad_norm": 0.4672452320889572,
      "learning_rate": 4.968186061408916e-05,
      "loss": 2.1266,
      "num_input_tokens_seen": 4599437840,
      "step": 5846
    },
    {
      "epoch": 0.6203055378739656,
      "grad_norm": 1.361544919805189,
      "learning_rate": 4.9681750086567715e-05,
      "loss": 1.9455,
      "num_input_tokens_seen": 4600224544,
      "step": 5847
    },
    {
      "epoch": 0.6204116274135371,
      "grad_norm": 0.6017930009548538,
      "learning_rate": 4.9681639539972935e-05,
      "loss": 2.0327,
      "num_input_tokens_seen": 4601011280,
      "step": 5848
    },
    {
      "epoch": 0.6205177169531084,
      "grad_norm": 1.2202868792224528,
      "learning_rate": 4.968152897430491e-05,
      "loss": 2.1876,
      "num_input_tokens_seen": 4601797936,
      "step": 5849
    },
    {
      "epoch": 0.6206238064926798,
      "grad_norm": 0.6087207348298548,
      "learning_rate": 4.9681418389563725e-05,
      "loss": 1.9428,
      "num_input_tokens_seen": 4602584720,
      "step": 5850
    },
    {
      "epoch": 0.6207298960322513,
      "grad_norm": 0.8051177329102281,
      "learning_rate": 4.9681307785749464e-05,
      "loss": 2.0162,
      "num_input_tokens_seen": 4603371424,
      "step": 5851
    },
    {
      "epoch": 0.6208359855718226,
      "grad_norm": 0.5131939081338615,
      "learning_rate": 4.9681197162862216e-05,
      "loss": 2.0112,
      "num_input_tokens_seen": 4604158240,
      "step": 5852
    },
    {
      "epoch": 0.620942075111394,
      "grad_norm": 0.8739456120346756,
      "learning_rate": 4.968108652090206e-05,
      "loss": 2.0875,
      "num_input_tokens_seen": 4604944912,
      "step": 5853
    },
    {
      "epoch": 0.6210481646509655,
      "grad_norm": 0.8594708501006598,
      "learning_rate": 4.968097585986908e-05,
      "loss": 2.0259,
      "num_input_tokens_seen": 4605731632,
      "step": 5854
    },
    {
      "epoch": 0.6211542541905368,
      "grad_norm": 0.6359031536572679,
      "learning_rate": 4.968086517976337e-05,
      "loss": 1.7955,
      "num_input_tokens_seen": 4606518448,
      "step": 5855
    },
    {
      "epoch": 0.6212603437301082,
      "grad_norm": 1.586583209844782,
      "learning_rate": 4.9680754480585015e-05,
      "loss": 2.0047,
      "num_input_tokens_seen": 4607305152,
      "step": 5856
    },
    {
      "epoch": 0.6213664332696797,
      "grad_norm": 0.5963226834587803,
      "learning_rate": 4.968064376233409e-05,
      "loss": 1.9671,
      "num_input_tokens_seen": 4608091872,
      "step": 5857
    },
    {
      "epoch": 0.621472522809251,
      "grad_norm": 1.050574355933215,
      "learning_rate": 4.968053302501069e-05,
      "loss": 2.0078,
      "num_input_tokens_seen": 4608878656,
      "step": 5858
    },
    {
      "epoch": 0.6215786123488224,
      "grad_norm": 0.6055028322027849,
      "learning_rate": 4.96804222686149e-05,
      "loss": 1.9369,
      "num_input_tokens_seen": 4609665456,
      "step": 5859
    },
    {
      "epoch": 0.6216847018883938,
      "grad_norm": 0.5712597191464691,
      "learning_rate": 4.96803114931468e-05,
      "loss": 1.9847,
      "num_input_tokens_seen": 4610452240,
      "step": 5860
    },
    {
      "epoch": 0.6217907914279652,
      "grad_norm": 0.571733542425011,
      "learning_rate": 4.968020069860648e-05,
      "loss": 2.119,
      "num_input_tokens_seen": 4611239008,
      "step": 5861
    },
    {
      "epoch": 0.6218968809675366,
      "grad_norm": 0.6048899152488579,
      "learning_rate": 4.968008988499404e-05,
      "loss": 1.9115,
      "num_input_tokens_seen": 4612025776,
      "step": 5862
    },
    {
      "epoch": 0.622002970507108,
      "grad_norm": 0.6680259577696654,
      "learning_rate": 4.967997905230953e-05,
      "loss": 2.1842,
      "num_input_tokens_seen": 4612812432,
      "step": 5863
    },
    {
      "epoch": 0.6221090600466794,
      "grad_norm": 0.6303206963479706,
      "learning_rate": 4.967986820055307e-05,
      "loss": 1.9775,
      "num_input_tokens_seen": 4613599184,
      "step": 5864
    },
    {
      "epoch": 0.6222151495862508,
      "grad_norm": 0.6454967588415519,
      "learning_rate": 4.9679757329724726e-05,
      "loss": 1.9704,
      "num_input_tokens_seen": 4614385904,
      "step": 5865
    },
    {
      "epoch": 0.6223212391258222,
      "grad_norm": 0.5426453584018708,
      "learning_rate": 4.967964643982459e-05,
      "loss": 2.0131,
      "num_input_tokens_seen": 4615172704,
      "step": 5866
    },
    {
      "epoch": 0.6224273286653936,
      "grad_norm": 0.561378846898651,
      "learning_rate": 4.967953553085275e-05,
      "loss": 2.1408,
      "num_input_tokens_seen": 4615959488,
      "step": 5867
    },
    {
      "epoch": 0.622533418204965,
      "grad_norm": 0.5160354414267531,
      "learning_rate": 4.967942460280929e-05,
      "loss": 2.0646,
      "num_input_tokens_seen": 4616746288,
      "step": 5868
    },
    {
      "epoch": 0.6226395077445364,
      "grad_norm": 0.4581187341920412,
      "learning_rate": 4.967931365569428e-05,
      "loss": 1.858,
      "num_input_tokens_seen": 4617533088,
      "step": 5869
    },
    {
      "epoch": 0.6227455972841078,
      "grad_norm": 0.559407970818064,
      "learning_rate": 4.9679202689507834e-05,
      "loss": 2.0882,
      "num_input_tokens_seen": 4618319824,
      "step": 5870
    },
    {
      "epoch": 0.6228516868236792,
      "grad_norm": 0.48120075880656127,
      "learning_rate": 4.9679091704250025e-05,
      "loss": 2.0185,
      "num_input_tokens_seen": 4619106592,
      "step": 5871
    },
    {
      "epoch": 0.6229577763632506,
      "grad_norm": 0.5736317382589369,
      "learning_rate": 4.967898069992094e-05,
      "loss": 1.9848,
      "num_input_tokens_seen": 4619893328,
      "step": 5872
    },
    {
      "epoch": 0.623063865902822,
      "grad_norm": 0.5620571904969923,
      "learning_rate": 4.967886967652066e-05,
      "loss": 2.1265,
      "num_input_tokens_seen": 4620680096,
      "step": 5873
    },
    {
      "epoch": 0.6231699554423934,
      "grad_norm": 0.6185377083484283,
      "learning_rate": 4.967875863404927e-05,
      "loss": 1.926,
      "num_input_tokens_seen": 4621466800,
      "step": 5874
    },
    {
      "epoch": 0.6232760449819648,
      "grad_norm": 0.4557734869500192,
      "learning_rate": 4.9678647572506856e-05,
      "loss": 1.9543,
      "num_input_tokens_seen": 4622253600,
      "step": 5875
    },
    {
      "epoch": 0.6233821345215361,
      "grad_norm": 0.5355530201771127,
      "learning_rate": 4.9678536491893514e-05,
      "loss": 1.8926,
      "num_input_tokens_seen": 4623040432,
      "step": 5876
    },
    {
      "epoch": 0.6234882240611076,
      "grad_norm": 0.5391260565835818,
      "learning_rate": 4.9678425392209326e-05,
      "loss": 2.1133,
      "num_input_tokens_seen": 4623827200,
      "step": 5877
    },
    {
      "epoch": 0.623594313600679,
      "grad_norm": 0.5030113437725905,
      "learning_rate": 4.967831427345437e-05,
      "loss": 1.9654,
      "num_input_tokens_seen": 4624613904,
      "step": 5878
    },
    {
      "epoch": 0.6237004031402503,
      "grad_norm": 0.5274664797621018,
      "learning_rate": 4.9678203135628735e-05,
      "loss": 1.9505,
      "num_input_tokens_seen": 4625400704,
      "step": 5879
    },
    {
      "epoch": 0.6238064926798218,
      "grad_norm": 0.3670565562081345,
      "learning_rate": 4.967809197873251e-05,
      "loss": 1.8461,
      "num_input_tokens_seen": 4626187408,
      "step": 5880
    },
    {
      "epoch": 0.6239125822193932,
      "grad_norm": 0.5129195612237303,
      "learning_rate": 4.9677980802765785e-05,
      "loss": 2.0955,
      "num_input_tokens_seen": 4626974112,
      "step": 5881
    },
    {
      "epoch": 0.6240186717589645,
      "grad_norm": 0.49318275968664055,
      "learning_rate": 4.967786960772863e-05,
      "loss": 1.9125,
      "num_input_tokens_seen": 4627760896,
      "step": 5882
    },
    {
      "epoch": 0.624124761298536,
      "grad_norm": 0.3713351641353064,
      "learning_rate": 4.9677758393621156e-05,
      "loss": 1.8061,
      "num_input_tokens_seen": 4628547728,
      "step": 5883
    },
    {
      "epoch": 0.6242308508381074,
      "grad_norm": 0.499542405579806,
      "learning_rate": 4.9677647160443424e-05,
      "loss": 1.9299,
      "num_input_tokens_seen": 4629334448,
      "step": 5884
    },
    {
      "epoch": 0.6243369403776787,
      "grad_norm": 0.42959992957710774,
      "learning_rate": 4.967753590819553e-05,
      "loss": 1.8356,
      "num_input_tokens_seen": 4630121104,
      "step": 5885
    },
    {
      "epoch": 0.6244430299172502,
      "grad_norm": 0.6299839222677602,
      "learning_rate": 4.9677424636877567e-05,
      "loss": 1.9001,
      "num_input_tokens_seen": 4630907888,
      "step": 5886
    },
    {
      "epoch": 0.6245491194568216,
      "grad_norm": 0.46049674132644647,
      "learning_rate": 4.967731334648961e-05,
      "loss": 1.9583,
      "num_input_tokens_seen": 4631694640,
      "step": 5887
    },
    {
      "epoch": 0.6246552089963929,
      "grad_norm": 0.6902708192786838,
      "learning_rate": 4.967720203703175e-05,
      "loss": 1.9944,
      "num_input_tokens_seen": 4632481456,
      "step": 5888
    },
    {
      "epoch": 0.6247612985359644,
      "grad_norm": 0.5276502873147141,
      "learning_rate": 4.967709070850407e-05,
      "loss": 1.9871,
      "num_input_tokens_seen": 4633268224,
      "step": 5889
    },
    {
      "epoch": 0.6248673880755358,
      "grad_norm": 0.5627760115111995,
      "learning_rate": 4.967697936090666e-05,
      "loss": 2.0425,
      "num_input_tokens_seen": 4634054992,
      "step": 5890
    },
    {
      "epoch": 0.6249734776151071,
      "grad_norm": 0.4636194640977146,
      "learning_rate": 4.9676867994239605e-05,
      "loss": 1.9693,
      "num_input_tokens_seen": 4634841744,
      "step": 5891
    },
    {
      "epoch": 0.6250795671546785,
      "grad_norm": 0.45570678151425814,
      "learning_rate": 4.967675660850299e-05,
      "loss": 1.9519,
      "num_input_tokens_seen": 4635628448,
      "step": 5892
    },
    {
      "epoch": 0.62518565669425,
      "grad_norm": 0.45404188495389963,
      "learning_rate": 4.9676645203696903e-05,
      "loss": 2.0525,
      "num_input_tokens_seen": 4636415200,
      "step": 5893
    },
    {
      "epoch": 0.6252917462338213,
      "grad_norm": 0.4727154186403433,
      "learning_rate": 4.967653377982143e-05,
      "loss": 1.9908,
      "num_input_tokens_seen": 4637202048,
      "step": 5894
    },
    {
      "epoch": 0.6253978357733927,
      "grad_norm": 0.5478582597304055,
      "learning_rate": 4.967642233687665e-05,
      "loss": 2.012,
      "num_input_tokens_seen": 4637988768,
      "step": 5895
    },
    {
      "epoch": 0.6255039253129642,
      "grad_norm": 0.5381643926268227,
      "learning_rate": 4.967631087486267e-05,
      "loss": 2.0047,
      "num_input_tokens_seen": 4638775520,
      "step": 5896
    },
    {
      "epoch": 0.6256100148525355,
      "grad_norm": 0.45835638924358174,
      "learning_rate": 4.967619939377954e-05,
      "loss": 1.9625,
      "num_input_tokens_seen": 4639562288,
      "step": 5897
    },
    {
      "epoch": 0.6257161043921069,
      "grad_norm": 0.48982930722499957,
      "learning_rate": 4.967608789362738e-05,
      "loss": 2.0328,
      "num_input_tokens_seen": 4640349040,
      "step": 5898
    },
    {
      "epoch": 0.6258221939316784,
      "grad_norm": 0.5005363692227666,
      "learning_rate": 4.967597637440625e-05,
      "loss": 2.0633,
      "num_input_tokens_seen": 4641135776,
      "step": 5899
    },
    {
      "epoch": 0.6259282834712497,
      "grad_norm": 0.4511846482069696,
      "learning_rate": 4.967586483611626e-05,
      "loss": 1.9255,
      "num_input_tokens_seen": 4641922560,
      "step": 5900
    },
    {
      "epoch": 0.6260343730108211,
      "grad_norm": 0.4527315738199734,
      "learning_rate": 4.967575327875749e-05,
      "loss": 1.98,
      "num_input_tokens_seen": 4642709312,
      "step": 5901
    },
    {
      "epoch": 0.6261404625503926,
      "grad_norm": 0.5704009940481496,
      "learning_rate": 4.9675641702330014e-05,
      "loss": 2.0591,
      "num_input_tokens_seen": 4643496064,
      "step": 5902
    },
    {
      "epoch": 0.6262465520899639,
      "grad_norm": 0.5109911035985089,
      "learning_rate": 4.967553010683393e-05,
      "loss": 1.8815,
      "num_input_tokens_seen": 4644282896,
      "step": 5903
    },
    {
      "epoch": 0.6263526416295353,
      "grad_norm": 0.5827370924755395,
      "learning_rate": 4.967541849226932e-05,
      "loss": 2.0557,
      "num_input_tokens_seen": 4645069648,
      "step": 5904
    },
    {
      "epoch": 0.6264587311691068,
      "grad_norm": 0.6048804523446014,
      "learning_rate": 4.9675306858636274e-05,
      "loss": 1.8904,
      "num_input_tokens_seen": 4645856400,
      "step": 5905
    },
    {
      "epoch": 0.6265648207086781,
      "grad_norm": 0.5547175625842762,
      "learning_rate": 4.9675195205934866e-05,
      "loss": 2.1045,
      "num_input_tokens_seen": 4646643136,
      "step": 5906
    },
    {
      "epoch": 0.6266709102482495,
      "grad_norm": 0.6000914899161399,
      "learning_rate": 4.9675083534165196e-05,
      "loss": 2.1229,
      "num_input_tokens_seen": 4647429888,
      "step": 5907
    },
    {
      "epoch": 0.6267769997878209,
      "grad_norm": 0.7473321239136601,
      "learning_rate": 4.967497184332734e-05,
      "loss": 2.1249,
      "num_input_tokens_seen": 4648216656,
      "step": 5908
    },
    {
      "epoch": 0.6268830893273923,
      "grad_norm": 0.8548715342840082,
      "learning_rate": 4.96748601334214e-05,
      "loss": 1.9377,
      "num_input_tokens_seen": 4649003440,
      "step": 5909
    },
    {
      "epoch": 0.6269891788669637,
      "grad_norm": 0.4254344071758727,
      "learning_rate": 4.967474840444745e-05,
      "loss": 1.9551,
      "num_input_tokens_seen": 4649790176,
      "step": 5910
    },
    {
      "epoch": 0.6270952684065351,
      "grad_norm": 0.7735788319483755,
      "learning_rate": 4.967463665640557e-05,
      "loss": 1.9764,
      "num_input_tokens_seen": 4650576880,
      "step": 5911
    },
    {
      "epoch": 0.6272013579461065,
      "grad_norm": 0.6038917313616062,
      "learning_rate": 4.9674524889295865e-05,
      "loss": 2.0549,
      "num_input_tokens_seen": 4651363632,
      "step": 5912
    },
    {
      "epoch": 0.6273074474856779,
      "grad_norm": 1.802968881110295,
      "learning_rate": 4.96744131031184e-05,
      "loss": 1.9844,
      "num_input_tokens_seen": 4652150320,
      "step": 5913
    },
    {
      "epoch": 0.6274135370252493,
      "grad_norm": 0.6458724519355543,
      "learning_rate": 4.967430129787328e-05,
      "loss": 2.1143,
      "num_input_tokens_seen": 4652937072,
      "step": 5914
    },
    {
      "epoch": 0.6275196265648207,
      "grad_norm": 1.1934978480273735,
      "learning_rate": 4.967418947356059e-05,
      "loss": 2.048,
      "num_input_tokens_seen": 4653723776,
      "step": 5915
    },
    {
      "epoch": 0.6276257161043921,
      "grad_norm": 0.6593394345034023,
      "learning_rate": 4.967407763018041e-05,
      "loss": 2.0777,
      "num_input_tokens_seen": 4654510576,
      "step": 5916
    },
    {
      "epoch": 0.6277318056439635,
      "grad_norm": 1.0867368212064217,
      "learning_rate": 4.967396576773281e-05,
      "loss": 2.0368,
      "num_input_tokens_seen": 4655297392,
      "step": 5917
    },
    {
      "epoch": 0.6278378951835349,
      "grad_norm": 0.7537424428258239,
      "learning_rate": 4.96738538862179e-05,
      "loss": 1.9453,
      "num_input_tokens_seen": 4656084192,
      "step": 5918
    },
    {
      "epoch": 0.6279439847231063,
      "grad_norm": 0.5349873030967275,
      "learning_rate": 4.967374198563577e-05,
      "loss": 1.8857,
      "num_input_tokens_seen": 4656870976,
      "step": 5919
    },
    {
      "epoch": 0.6280500742626777,
      "grad_norm": 0.8133506986146307,
      "learning_rate": 4.967363006598649e-05,
      "loss": 2.022,
      "num_input_tokens_seen": 4657657856,
      "step": 5920
    },
    {
      "epoch": 0.6281561638022491,
      "grad_norm": 0.5609329996402547,
      "learning_rate": 4.967351812727014e-05,
      "loss": 1.9978,
      "num_input_tokens_seen": 4658444560,
      "step": 5921
    },
    {
      "epoch": 0.6282622533418205,
      "grad_norm": 0.7018215595267981,
      "learning_rate": 4.967340616948684e-05,
      "loss": 2.1323,
      "num_input_tokens_seen": 4659231296,
      "step": 5922
    },
    {
      "epoch": 0.6283683428813919,
      "grad_norm": 0.6756514159507214,
      "learning_rate": 4.9673294192636645e-05,
      "loss": 1.9937,
      "num_input_tokens_seen": 4660017952,
      "step": 5923
    },
    {
      "epoch": 0.6284744324209633,
      "grad_norm": 0.5833084308311635,
      "learning_rate": 4.9673182196719656e-05,
      "loss": 1.9158,
      "num_input_tokens_seen": 4660804608,
      "step": 5924
    },
    {
      "epoch": 0.6285805219605347,
      "grad_norm": 0.7170692591988744,
      "learning_rate": 4.9673070181735955e-05,
      "loss": 1.8932,
      "num_input_tokens_seen": 4661591344,
      "step": 5925
    },
    {
      "epoch": 0.6286866115001061,
      "grad_norm": 0.5771834729237633,
      "learning_rate": 4.967295814768563e-05,
      "loss": 2.0457,
      "num_input_tokens_seen": 4662378064,
      "step": 5926
    },
    {
      "epoch": 0.6287927010396774,
      "grad_norm": 0.5440768857080124,
      "learning_rate": 4.967284609456876e-05,
      "loss": 1.8823,
      "num_input_tokens_seen": 4663164880,
      "step": 5927
    },
    {
      "epoch": 0.6288987905792489,
      "grad_norm": 0.614054043065393,
      "learning_rate": 4.967273402238545e-05,
      "loss": 1.8892,
      "num_input_tokens_seen": 4663951632,
      "step": 5928
    },
    {
      "epoch": 0.6290048801188203,
      "grad_norm": 0.5530546851055789,
      "learning_rate": 4.9672621931135764e-05,
      "loss": 1.87,
      "num_input_tokens_seen": 4664738368,
      "step": 5929
    },
    {
      "epoch": 0.6291109696583916,
      "grad_norm": 0.5484172666417972,
      "learning_rate": 4.96725098208198e-05,
      "loss": 2.0824,
      "num_input_tokens_seen": 4665525072,
      "step": 5930
    },
    {
      "epoch": 0.6292170591979631,
      "grad_norm": 0.6345798191439052,
      "learning_rate": 4.967239769143766e-05,
      "loss": 2.0188,
      "num_input_tokens_seen": 4666311760,
      "step": 5931
    },
    {
      "epoch": 0.6293231487375345,
      "grad_norm": 0.6290578595005902,
      "learning_rate": 4.9672285542989394e-05,
      "loss": 1.8865,
      "num_input_tokens_seen": 4667098480,
      "step": 5932
    },
    {
      "epoch": 0.6294292382771058,
      "grad_norm": 0.5808800447049752,
      "learning_rate": 4.9672173375475124e-05,
      "loss": 2.0782,
      "num_input_tokens_seen": 4667885296,
      "step": 5933
    },
    {
      "epoch": 0.6295353278166773,
      "grad_norm": 0.806423598457269,
      "learning_rate": 4.9672061188894915e-05,
      "loss": 2.0987,
      "num_input_tokens_seen": 4668671984,
      "step": 5934
    },
    {
      "epoch": 0.6296414173562487,
      "grad_norm": 0.6213410374494832,
      "learning_rate": 4.967194898324886e-05,
      "loss": 2.1644,
      "num_input_tokens_seen": 4669458656,
      "step": 5935
    },
    {
      "epoch": 0.62974750689582,
      "grad_norm": 0.662092799287975,
      "learning_rate": 4.967183675853705e-05,
      "loss": 1.9999,
      "num_input_tokens_seen": 4670245504,
      "step": 5936
    },
    {
      "epoch": 0.6298535964353915,
      "grad_norm": 0.5228003486817447,
      "learning_rate": 4.9671724514759574e-05,
      "loss": 1.7531,
      "num_input_tokens_seen": 4671032368,
      "step": 5937
    },
    {
      "epoch": 0.6299596859749629,
      "grad_norm": 0.49917420610574376,
      "learning_rate": 4.967161225191651e-05,
      "loss": 1.9894,
      "num_input_tokens_seen": 4671819088,
      "step": 5938
    },
    {
      "epoch": 0.6300657755145342,
      "grad_norm": 0.4491272965165775,
      "learning_rate": 4.967149997000794e-05,
      "loss": 1.9244,
      "num_input_tokens_seen": 4672605760,
      "step": 5939
    },
    {
      "epoch": 0.6301718650541057,
      "grad_norm": 0.58973196031015,
      "learning_rate": 4.9671387669033965e-05,
      "loss": 2.017,
      "num_input_tokens_seen": 4673392416,
      "step": 5940
    },
    {
      "epoch": 0.6302779545936771,
      "grad_norm": 0.4694299488349605,
      "learning_rate": 4.967127534899467e-05,
      "loss": 1.9346,
      "num_input_tokens_seen": 4674179168,
      "step": 5941
    },
    {
      "epoch": 0.6303840441332484,
      "grad_norm": 0.5117029808871006,
      "learning_rate": 4.967116300989013e-05,
      "loss": 1.8125,
      "num_input_tokens_seen": 4674966000,
      "step": 5942
    },
    {
      "epoch": 0.6304901336728198,
      "grad_norm": 0.4260892874277914,
      "learning_rate": 4.967105065172044e-05,
      "loss": 2.1119,
      "num_input_tokens_seen": 4675752752,
      "step": 5943
    },
    {
      "epoch": 0.6305962232123913,
      "grad_norm": 0.9636941808798009,
      "learning_rate": 4.967093827448569e-05,
      "loss": 2.1183,
      "num_input_tokens_seen": 4676539440,
      "step": 5944
    },
    {
      "epoch": 0.6307023127519626,
      "grad_norm": 0.8361489039832735,
      "learning_rate": 4.967082587818596e-05,
      "loss": 2.072,
      "num_input_tokens_seen": 4677326320,
      "step": 5945
    },
    {
      "epoch": 0.630808402291534,
      "grad_norm": 0.689841759959469,
      "learning_rate": 4.967071346282134e-05,
      "loss": 2.047,
      "num_input_tokens_seen": 4678113072,
      "step": 5946
    },
    {
      "epoch": 0.6309144918311055,
      "grad_norm": 0.7810187335043774,
      "learning_rate": 4.9670601028391915e-05,
      "loss": 1.9448,
      "num_input_tokens_seen": 4678899824,
      "step": 5947
    },
    {
      "epoch": 0.6310205813706768,
      "grad_norm": 0.5407487750196112,
      "learning_rate": 4.967048857489778e-05,
      "loss": 1.9727,
      "num_input_tokens_seen": 4679686608,
      "step": 5948
    },
    {
      "epoch": 0.6311266709102482,
      "grad_norm": 0.585831234063215,
      "learning_rate": 4.967037610233901e-05,
      "loss": 1.9905,
      "num_input_tokens_seen": 4680473392,
      "step": 5949
    },
    {
      "epoch": 0.6312327604498197,
      "grad_norm": 0.6508082857908348,
      "learning_rate": 4.96702636107157e-05,
      "loss": 1.9456,
      "num_input_tokens_seen": 4681260064,
      "step": 5950
    },
    {
      "epoch": 0.631338849989391,
      "grad_norm": 0.38865876488452933,
      "learning_rate": 4.967015110002793e-05,
      "loss": 1.871,
      "num_input_tokens_seen": 4682046816,
      "step": 5951
    },
    {
      "epoch": 0.6314449395289624,
      "grad_norm": 0.994236986838655,
      "learning_rate": 4.967003857027579e-05,
      "loss": 2.0084,
      "num_input_tokens_seen": 4682833632,
      "step": 5952
    },
    {
      "epoch": 0.6315510290685339,
      "grad_norm": 0.4435457907671344,
      "learning_rate": 4.9669926021459364e-05,
      "loss": 1.9291,
      "num_input_tokens_seen": 4683620416,
      "step": 5953
    },
    {
      "epoch": 0.6316571186081053,
      "grad_norm": 1.350605269254798,
      "learning_rate": 4.9669813453578756e-05,
      "loss": 1.9625,
      "num_input_tokens_seen": 4684407184,
      "step": 5954
    },
    {
      "epoch": 0.6317632081476766,
      "grad_norm": 0.6437441348495166,
      "learning_rate": 4.966970086663403e-05,
      "loss": 2.0362,
      "num_input_tokens_seen": 4685193920,
      "step": 5955
    },
    {
      "epoch": 0.6318692976872481,
      "grad_norm": 0.5824993686134644,
      "learning_rate": 4.9669588260625285e-05,
      "loss": 1.9516,
      "num_input_tokens_seen": 4685980672,
      "step": 5956
    },
    {
      "epoch": 0.6319753872268195,
      "grad_norm": 0.8230062239217197,
      "learning_rate": 4.9669475635552606e-05,
      "loss": 1.9435,
      "num_input_tokens_seen": 4686767520,
      "step": 5957
    },
    {
      "epoch": 0.6320814767663908,
      "grad_norm": 0.794602514795693,
      "learning_rate": 4.966936299141609e-05,
      "loss": 2.0248,
      "num_input_tokens_seen": 4687554320,
      "step": 5958
    },
    {
      "epoch": 0.6321875663059622,
      "grad_norm": 0.5919052134490718,
      "learning_rate": 4.9669250328215806e-05,
      "loss": 2.1668,
      "num_input_tokens_seen": 4688341104,
      "step": 5959
    },
    {
      "epoch": 0.6322936558455337,
      "grad_norm": 0.8206973305216929,
      "learning_rate": 4.966913764595185e-05,
      "loss": 1.9769,
      "num_input_tokens_seen": 4689127856,
      "step": 5960
    },
    {
      "epoch": 0.632399745385105,
      "grad_norm": 1.0043419992195595,
      "learning_rate": 4.96690249446243e-05,
      "loss": 1.9509,
      "num_input_tokens_seen": 4689914576,
      "step": 5961
    },
    {
      "epoch": 0.6325058349246764,
      "grad_norm": 0.5824102072184011,
      "learning_rate": 4.9668912224233264e-05,
      "loss": 2.026,
      "num_input_tokens_seen": 4690701344,
      "step": 5962
    },
    {
      "epoch": 0.6326119244642479,
      "grad_norm": 0.8322776756293284,
      "learning_rate": 4.966879948477881e-05,
      "loss": 2.1347,
      "num_input_tokens_seen": 4691488176,
      "step": 5963
    },
    {
      "epoch": 0.6327180140038192,
      "grad_norm": 0.6499525514116017,
      "learning_rate": 4.966868672626104e-05,
      "loss": 1.8603,
      "num_input_tokens_seen": 4692275008,
      "step": 5964
    },
    {
      "epoch": 0.6328241035433906,
      "grad_norm": 0.6784872398751741,
      "learning_rate": 4.966857394868002e-05,
      "loss": 1.9698,
      "num_input_tokens_seen": 4693061760,
      "step": 5965
    },
    {
      "epoch": 0.6329301930829621,
      "grad_norm": 0.459107534583629,
      "learning_rate": 4.9668461152035855e-05,
      "loss": 1.8919,
      "num_input_tokens_seen": 4693848544,
      "step": 5966
    },
    {
      "epoch": 0.6330362826225334,
      "grad_norm": 0.9626722621013456,
      "learning_rate": 4.966834833632863e-05,
      "loss": 2.0483,
      "num_input_tokens_seen": 4694635264,
      "step": 5967
    },
    {
      "epoch": 0.6331423721621048,
      "grad_norm": 0.6361991613636259,
      "learning_rate": 4.9668235501558426e-05,
      "loss": 2.0019,
      "num_input_tokens_seen": 4695422016,
      "step": 5968
    },
    {
      "epoch": 0.6332484617016763,
      "grad_norm": 0.4864529581051358,
      "learning_rate": 4.9668122647725336e-05,
      "loss": 1.9433,
      "num_input_tokens_seen": 4696208848,
      "step": 5969
    },
    {
      "epoch": 0.6333545512412476,
      "grad_norm": 0.545516128100487,
      "learning_rate": 4.966800977482944e-05,
      "loss": 2.0695,
      "num_input_tokens_seen": 4696995648,
      "step": 5970
    },
    {
      "epoch": 0.633460640780819,
      "grad_norm": 0.6894236713114682,
      "learning_rate": 4.966789688287083e-05,
      "loss": 1.9288,
      "num_input_tokens_seen": 4697782448,
      "step": 5971
    },
    {
      "epoch": 0.6335667303203905,
      "grad_norm": 0.7395093884841235,
      "learning_rate": 4.96677839718496e-05,
      "loss": 2.1012,
      "num_input_tokens_seen": 4698569184,
      "step": 5972
    },
    {
      "epoch": 0.6336728198599618,
      "grad_norm": 0.7934772407099935,
      "learning_rate": 4.9667671041765825e-05,
      "loss": 1.8903,
      "num_input_tokens_seen": 4699356016,
      "step": 5973
    },
    {
      "epoch": 0.6337789093995332,
      "grad_norm": 0.7751391218299906,
      "learning_rate": 4.96675580926196e-05,
      "loss": 2.0031,
      "num_input_tokens_seen": 4700142704,
      "step": 5974
    },
    {
      "epoch": 0.6338849989391045,
      "grad_norm": 0.6292593328670812,
      "learning_rate": 4.966744512441101e-05,
      "loss": 1.8347,
      "num_input_tokens_seen": 4700929520,
      "step": 5975
    },
    {
      "epoch": 0.633991088478676,
      "grad_norm": 0.661721416755113,
      "learning_rate": 4.9667332137140135e-05,
      "loss": 2.0955,
      "num_input_tokens_seen": 4701716320,
      "step": 5976
    },
    {
      "epoch": 0.6340971780182474,
      "grad_norm": 0.6241009242964991,
      "learning_rate": 4.966721913080708e-05,
      "loss": 2.0362,
      "num_input_tokens_seen": 4702503120,
      "step": 5977
    },
    {
      "epoch": 0.6342032675578188,
      "grad_norm": 0.6232147921889452,
      "learning_rate": 4.9667106105411916e-05,
      "loss": 1.9093,
      "num_input_tokens_seen": 4703289872,
      "step": 5978
    },
    {
      "epoch": 0.6343093570973902,
      "grad_norm": 0.5949199101817317,
      "learning_rate": 4.966699306095474e-05,
      "loss": 1.8165,
      "num_input_tokens_seen": 4704076672,
      "step": 5979
    },
    {
      "epoch": 0.6344154466369616,
      "grad_norm": 0.5325573124093469,
      "learning_rate": 4.966687999743563e-05,
      "loss": 2.0952,
      "num_input_tokens_seen": 4704863456,
      "step": 5980
    },
    {
      "epoch": 0.634521536176533,
      "grad_norm": 0.9309591064554789,
      "learning_rate": 4.9666766914854676e-05,
      "loss": 1.9115,
      "num_input_tokens_seen": 4705650160,
      "step": 5981
    },
    {
      "epoch": 0.6346276257161044,
      "grad_norm": 0.578972345070839,
      "learning_rate": 4.966665381321198e-05,
      "loss": 2.0266,
      "num_input_tokens_seen": 4706436848,
      "step": 5982
    },
    {
      "epoch": 0.6347337152556758,
      "grad_norm": 0.550984194785922,
      "learning_rate": 4.9666540692507614e-05,
      "loss": 2.041,
      "num_input_tokens_seen": 4707223568,
      "step": 5983
    },
    {
      "epoch": 0.6348398047952472,
      "grad_norm": 0.6482371068051233,
      "learning_rate": 4.9666427552741666e-05,
      "loss": 2.0481,
      "num_input_tokens_seen": 4708010320,
      "step": 5984
    },
    {
      "epoch": 0.6349458943348186,
      "grad_norm": 0.826164454856743,
      "learning_rate": 4.9666314393914225e-05,
      "loss": 1.7844,
      "num_input_tokens_seen": 4708797104,
      "step": 5985
    },
    {
      "epoch": 0.63505198387439,
      "grad_norm": 0.6628228201349413,
      "learning_rate": 4.9666201216025384e-05,
      "loss": 2.1106,
      "num_input_tokens_seen": 4709583856,
      "step": 5986
    },
    {
      "epoch": 0.6351580734139614,
      "grad_norm": 0.706899056456827,
      "learning_rate": 4.9666088019075225e-05,
      "loss": 1.9538,
      "num_input_tokens_seen": 4710370656,
      "step": 5987
    },
    {
      "epoch": 0.6352641629535328,
      "grad_norm": 0.5127368647244416,
      "learning_rate": 4.966597480306384e-05,
      "loss": 1.7971,
      "num_input_tokens_seen": 4711157520,
      "step": 5988
    },
    {
      "epoch": 0.6353702524931042,
      "grad_norm": 0.4001697217025199,
      "learning_rate": 4.966586156799131e-05,
      "loss": 1.8479,
      "num_input_tokens_seen": 4711944320,
      "step": 5989
    },
    {
      "epoch": 0.6354763420326756,
      "grad_norm": 0.6006223828710348,
      "learning_rate": 4.966574831385772e-05,
      "loss": 1.8938,
      "num_input_tokens_seen": 4712731104,
      "step": 5990
    },
    {
      "epoch": 0.635582431572247,
      "grad_norm": 0.5040056544337042,
      "learning_rate": 4.9665635040663175e-05,
      "loss": 1.9135,
      "num_input_tokens_seen": 4713517888,
      "step": 5991
    },
    {
      "epoch": 0.6356885211118184,
      "grad_norm": 0.4992897490470816,
      "learning_rate": 4.966552174840774e-05,
      "loss": 1.9255,
      "num_input_tokens_seen": 4714304704,
      "step": 5992
    },
    {
      "epoch": 0.6357946106513898,
      "grad_norm": 0.5273231261824216,
      "learning_rate": 4.966540843709152e-05,
      "loss": 1.9728,
      "num_input_tokens_seen": 4715091440,
      "step": 5993
    },
    {
      "epoch": 0.6359007001909611,
      "grad_norm": 0.5596274548210752,
      "learning_rate": 4.966529510671459e-05,
      "loss": 1.9817,
      "num_input_tokens_seen": 4715878224,
      "step": 5994
    },
    {
      "epoch": 0.6360067897305326,
      "grad_norm": 0.47086936447889655,
      "learning_rate": 4.9665181757277055e-05,
      "loss": 2.0421,
      "num_input_tokens_seen": 4716664928,
      "step": 5995
    },
    {
      "epoch": 0.636112879270104,
      "grad_norm": 0.6333560853139871,
      "learning_rate": 4.966506838877899e-05,
      "loss": 1.9768,
      "num_input_tokens_seen": 4717451744,
      "step": 5996
    },
    {
      "epoch": 0.6362189688096753,
      "grad_norm": 0.48910987095271524,
      "learning_rate": 4.966495500122047e-05,
      "loss": 1.8248,
      "num_input_tokens_seen": 4718238544,
      "step": 5997
    },
    {
      "epoch": 0.6363250583492468,
      "grad_norm": 0.5140045797514458,
      "learning_rate": 4.966484159460161e-05,
      "loss": 1.8393,
      "num_input_tokens_seen": 4719025280,
      "step": 5998
    },
    {
      "epoch": 0.6364311478888182,
      "grad_norm": 0.41854457208744944,
      "learning_rate": 4.966472816892248e-05,
      "loss": 1.9844,
      "num_input_tokens_seen": 4719812080,
      "step": 5999
    },
    {
      "epoch": 0.6365372374283895,
      "grad_norm": 0.525395239987986,
      "learning_rate": 4.966461472418317e-05,
      "loss": 2.0271,
      "num_input_tokens_seen": 4720598880,
      "step": 6000
    },
    {
      "epoch": 0.6365372374283895,
      "eval_loss": 1.9510971307754517,
      "eval_runtime": 66.1284,
      "eval_samples_per_second": 45.366,
      "eval_steps_per_second": 0.484,
      "num_input_tokens_seen": 4720598880,
      "step": 6000
    },
    {
      "epoch": 0.636643326967961,
      "grad_norm": 0.43297402530235435,
      "learning_rate": 4.9664501260383764e-05,
      "loss": 2.0589,
      "num_input_tokens_seen": 4721385696,
      "step": 6001
    },
    {
      "epoch": 0.6367494165075324,
      "grad_norm": 0.5265669989857412,
      "learning_rate": 4.966438777752437e-05,
      "loss": 1.889,
      "num_input_tokens_seen": 4722172432,
      "step": 6002
    },
    {
      "epoch": 0.6368555060471037,
      "grad_norm": 0.4953396789006712,
      "learning_rate": 4.9664274275605046e-05,
      "loss": 1.9684,
      "num_input_tokens_seen": 4722959200,
      "step": 6003
    },
    {
      "epoch": 0.6369615955866752,
      "grad_norm": 0.6200881186753202,
      "learning_rate": 4.96641607546259e-05,
      "loss": 1.9075,
      "num_input_tokens_seen": 4723745936,
      "step": 6004
    },
    {
      "epoch": 0.6370676851262466,
      "grad_norm": 0.47275596261367303,
      "learning_rate": 4.966404721458702e-05,
      "loss": 2.0335,
      "num_input_tokens_seen": 4724532640,
      "step": 6005
    },
    {
      "epoch": 0.6371737746658179,
      "grad_norm": 0.628318181327126,
      "learning_rate": 4.966393365548848e-05,
      "loss": 1.9104,
      "num_input_tokens_seen": 4725319376,
      "step": 6006
    },
    {
      "epoch": 0.6372798642053894,
      "grad_norm": 0.458053703477015,
      "learning_rate": 4.966382007733038e-05,
      "loss": 2.0267,
      "num_input_tokens_seen": 4726106064,
      "step": 6007
    },
    {
      "epoch": 0.6373859537449608,
      "grad_norm": 0.5999718728455101,
      "learning_rate": 4.96637064801128e-05,
      "loss": 2.2203,
      "num_input_tokens_seen": 4726892704,
      "step": 6008
    },
    {
      "epoch": 0.6374920432845321,
      "grad_norm": 0.3761334916352312,
      "learning_rate": 4.966359286383584e-05,
      "loss": 1.9834,
      "num_input_tokens_seen": 4727679488,
      "step": 6009
    },
    {
      "epoch": 0.6375981328241035,
      "grad_norm": 0.5664847624100742,
      "learning_rate": 4.966347922849958e-05,
      "loss": 2.0188,
      "num_input_tokens_seen": 4728466192,
      "step": 6010
    },
    {
      "epoch": 0.637704222363675,
      "grad_norm": 0.5563628846516929,
      "learning_rate": 4.966336557410409e-05,
      "loss": 1.8859,
      "num_input_tokens_seen": 4729252912,
      "step": 6011
    },
    {
      "epoch": 0.6378103119032463,
      "grad_norm": 0.7614920485022242,
      "learning_rate": 4.966325190064949e-05,
      "loss": 1.9749,
      "num_input_tokens_seen": 4730039696,
      "step": 6012
    },
    {
      "epoch": 0.6379164014428177,
      "grad_norm": 0.3953913009415019,
      "learning_rate": 4.966313820813584e-05,
      "loss": 2.0182,
      "num_input_tokens_seen": 4730826400,
      "step": 6013
    },
    {
      "epoch": 0.6380224909823892,
      "grad_norm": 0.7598142809267645,
      "learning_rate": 4.9663024496563254e-05,
      "loss": 2.0925,
      "num_input_tokens_seen": 4731613280,
      "step": 6014
    },
    {
      "epoch": 0.6381285805219605,
      "grad_norm": 0.4481689137780923,
      "learning_rate": 4.96629107659318e-05,
      "loss": 1.7539,
      "num_input_tokens_seen": 4732400064,
      "step": 6015
    },
    {
      "epoch": 0.6382346700615319,
      "grad_norm": 0.684724715367839,
      "learning_rate": 4.966279701624157e-05,
      "loss": 2.0493,
      "num_input_tokens_seen": 4733186880,
      "step": 6016
    },
    {
      "epoch": 0.6383407596011034,
      "grad_norm": 0.4492173997392034,
      "learning_rate": 4.966268324749266e-05,
      "loss": 2.0325,
      "num_input_tokens_seen": 4733973664,
      "step": 6017
    },
    {
      "epoch": 0.6384468491406747,
      "grad_norm": 0.6012721092313452,
      "learning_rate": 4.966256945968515e-05,
      "loss": 1.9593,
      "num_input_tokens_seen": 4734760400,
      "step": 6018
    },
    {
      "epoch": 0.6385529386802461,
      "grad_norm": 0.44620812718872327,
      "learning_rate": 4.9662455652819126e-05,
      "loss": 2.0464,
      "num_input_tokens_seen": 4735547088,
      "step": 6019
    },
    {
      "epoch": 0.6386590282198176,
      "grad_norm": 0.6636523174712499,
      "learning_rate": 4.9662341826894684e-05,
      "loss": 2.1202,
      "num_input_tokens_seen": 4736333824,
      "step": 6020
    },
    {
      "epoch": 0.6387651177593889,
      "grad_norm": 0.5071884888404686,
      "learning_rate": 4.96622279819119e-05,
      "loss": 1.9601,
      "num_input_tokens_seen": 4737120608,
      "step": 6021
    },
    {
      "epoch": 0.6388712072989603,
      "grad_norm": 0.5435311788862107,
      "learning_rate": 4.966211411787088e-05,
      "loss": 1.9075,
      "num_input_tokens_seen": 4737907424,
      "step": 6022
    },
    {
      "epoch": 0.6389772968385318,
      "grad_norm": 0.5617924162691663,
      "learning_rate": 4.96620002347717e-05,
      "loss": 2.1677,
      "num_input_tokens_seen": 4738694192,
      "step": 6023
    },
    {
      "epoch": 0.6390833863781031,
      "grad_norm": 0.4177283302920825,
      "learning_rate": 4.966188633261445e-05,
      "loss": 2.0891,
      "num_input_tokens_seen": 4739480896,
      "step": 6024
    },
    {
      "epoch": 0.6391894759176745,
      "grad_norm": 0.4649073801677866,
      "learning_rate": 4.966177241139921e-05,
      "loss": 1.921,
      "num_input_tokens_seen": 4740267632,
      "step": 6025
    },
    {
      "epoch": 0.6392955654572459,
      "grad_norm": 0.6478930080814691,
      "learning_rate": 4.966165847112608e-05,
      "loss": 2.1333,
      "num_input_tokens_seen": 4741054240,
      "step": 6026
    },
    {
      "epoch": 0.6394016549968173,
      "grad_norm": 0.552771987798004,
      "learning_rate": 4.966154451179515e-05,
      "loss": 1.9989,
      "num_input_tokens_seen": 4741841008,
      "step": 6027
    },
    {
      "epoch": 0.6395077445363887,
      "grad_norm": 0.5804289178405079,
      "learning_rate": 4.96614305334065e-05,
      "loss": 1.8734,
      "num_input_tokens_seen": 4742627760,
      "step": 6028
    },
    {
      "epoch": 0.6396138340759601,
      "grad_norm": 0.5688183399676228,
      "learning_rate": 4.9661316535960215e-05,
      "loss": 1.8623,
      "num_input_tokens_seen": 4743414528,
      "step": 6029
    },
    {
      "epoch": 0.6397199236155315,
      "grad_norm": 0.514049702122993,
      "learning_rate": 4.9661202519456396e-05,
      "loss": 1.8969,
      "num_input_tokens_seen": 4744201392,
      "step": 6030
    },
    {
      "epoch": 0.6398260131551029,
      "grad_norm": 0.7410443229412196,
      "learning_rate": 4.9661088483895115e-05,
      "loss": 1.9792,
      "num_input_tokens_seen": 4744988112,
      "step": 6031
    },
    {
      "epoch": 0.6399321026946743,
      "grad_norm": 0.6008429801057479,
      "learning_rate": 4.9660974429276474e-05,
      "loss": 1.9845,
      "num_input_tokens_seen": 4745774832,
      "step": 6032
    },
    {
      "epoch": 0.6400381922342457,
      "grad_norm": 0.540819848045763,
      "learning_rate": 4.966086035560055e-05,
      "loss": 1.8875,
      "num_input_tokens_seen": 4746561568,
      "step": 6033
    },
    {
      "epoch": 0.6401442817738171,
      "grad_norm": 0.48265305607510633,
      "learning_rate": 4.966074626286744e-05,
      "loss": 1.8658,
      "num_input_tokens_seen": 4747348416,
      "step": 6034
    },
    {
      "epoch": 0.6402503713133885,
      "grad_norm": 0.6139945630036497,
      "learning_rate": 4.966063215107722e-05,
      "loss": 1.9773,
      "num_input_tokens_seen": 4748135184,
      "step": 6035
    },
    {
      "epoch": 0.6403564608529599,
      "grad_norm": 0.7034548009409184,
      "learning_rate": 4.9660518020230006e-05,
      "loss": 2.1386,
      "num_input_tokens_seen": 4748921856,
      "step": 6036
    },
    {
      "epoch": 0.6404625503925313,
      "grad_norm": 0.545648184408988,
      "learning_rate": 4.9660403870325857e-05,
      "loss": 1.8816,
      "num_input_tokens_seen": 4749708608,
      "step": 6037
    },
    {
      "epoch": 0.6405686399321027,
      "grad_norm": 0.4967437049046076,
      "learning_rate": 4.966028970136487e-05,
      "loss": 1.9653,
      "num_input_tokens_seen": 4750495376,
      "step": 6038
    },
    {
      "epoch": 0.6406747294716741,
      "grad_norm": 0.4710692682517689,
      "learning_rate": 4.966017551334714e-05,
      "loss": 1.9771,
      "num_input_tokens_seen": 4751282160,
      "step": 6039
    },
    {
      "epoch": 0.6407808190112455,
      "grad_norm": 0.4776105641631326,
      "learning_rate": 4.9660061306272744e-05,
      "loss": 1.8443,
      "num_input_tokens_seen": 4752068976,
      "step": 6040
    },
    {
      "epoch": 0.6408869085508169,
      "grad_norm": 0.472902587789286,
      "learning_rate": 4.9659947080141776e-05,
      "loss": 1.9663,
      "num_input_tokens_seen": 4752855792,
      "step": 6041
    },
    {
      "epoch": 0.6409929980903882,
      "grad_norm": 0.5254540377076921,
      "learning_rate": 4.965983283495433e-05,
      "loss": 2.0747,
      "num_input_tokens_seen": 4753642640,
      "step": 6042
    },
    {
      "epoch": 0.6410990876299597,
      "grad_norm": 1.054429801854217,
      "learning_rate": 4.965971857071048e-05,
      "loss": 2.0678,
      "num_input_tokens_seen": 4754429312,
      "step": 6043
    },
    {
      "epoch": 0.6412051771695311,
      "grad_norm": 0.9859645496001298,
      "learning_rate": 4.965960428741033e-05,
      "loss": 1.9224,
      "num_input_tokens_seen": 4755216112,
      "step": 6044
    },
    {
      "epoch": 0.6413112667091024,
      "grad_norm": 0.46290785633285464,
      "learning_rate": 4.965948998505396e-05,
      "loss": 1.7789,
      "num_input_tokens_seen": 4756002896,
      "step": 6045
    },
    {
      "epoch": 0.6414173562486739,
      "grad_norm": 1.0735228826935839,
      "learning_rate": 4.9659375663641464e-05,
      "loss": 1.9808,
      "num_input_tokens_seen": 4756789696,
      "step": 6046
    },
    {
      "epoch": 0.6415234457882453,
      "grad_norm": 0.5889037730834865,
      "learning_rate": 4.965926132317292e-05,
      "loss": 1.9277,
      "num_input_tokens_seen": 4757576480,
      "step": 6047
    },
    {
      "epoch": 0.6416295353278166,
      "grad_norm": 0.9275701411730389,
      "learning_rate": 4.9659146963648425e-05,
      "loss": 2.0318,
      "num_input_tokens_seen": 4758363248,
      "step": 6048
    },
    {
      "epoch": 0.6417356248673881,
      "grad_norm": 0.7807160451137135,
      "learning_rate": 4.965903258506806e-05,
      "loss": 2.0414,
      "num_input_tokens_seen": 4759150000,
      "step": 6049
    },
    {
      "epoch": 0.6418417144069595,
      "grad_norm": 0.5807741689433651,
      "learning_rate": 4.965891818743193e-05,
      "loss": 1.9096,
      "num_input_tokens_seen": 4759936800,
      "step": 6050
    },
    {
      "epoch": 0.6419478039465308,
      "grad_norm": 0.5971993474485154,
      "learning_rate": 4.9658803770740095e-05,
      "loss": 1.9749,
      "num_input_tokens_seen": 4760723504,
      "step": 6051
    },
    {
      "epoch": 0.6420538934861023,
      "grad_norm": 0.5215107733261004,
      "learning_rate": 4.965868933499267e-05,
      "loss": 2.074,
      "num_input_tokens_seen": 4761510208,
      "step": 6052
    },
    {
      "epoch": 0.6421599830256737,
      "grad_norm": 0.6904514571660969,
      "learning_rate": 4.9658574880189735e-05,
      "loss": 1.947,
      "num_input_tokens_seen": 4762296976,
      "step": 6053
    },
    {
      "epoch": 0.642266072565245,
      "grad_norm": 0.47562370809089943,
      "learning_rate": 4.965846040633138e-05,
      "loss": 2.1365,
      "num_input_tokens_seen": 4763083744,
      "step": 6054
    },
    {
      "epoch": 0.6423721621048165,
      "grad_norm": 0.5345084450074038,
      "learning_rate": 4.965834591341767e-05,
      "loss": 2.0918,
      "num_input_tokens_seen": 4763870448,
      "step": 6055
    },
    {
      "epoch": 0.6424782516443879,
      "grad_norm": 0.4274056840002165,
      "learning_rate": 4.9658231401448734e-05,
      "loss": 1.9378,
      "num_input_tokens_seen": 4764657312,
      "step": 6056
    },
    {
      "epoch": 0.6425843411839592,
      "grad_norm": 0.521936939904029,
      "learning_rate": 4.965811687042463e-05,
      "loss": 2.0699,
      "num_input_tokens_seen": 4765443952,
      "step": 6057
    },
    {
      "epoch": 0.6426904307235307,
      "grad_norm": 0.46346422475069404,
      "learning_rate": 4.9658002320345465e-05,
      "loss": 2.1176,
      "num_input_tokens_seen": 4766230704,
      "step": 6058
    },
    {
      "epoch": 0.6427965202631021,
      "grad_norm": 0.5269882505013324,
      "learning_rate": 4.965788775121132e-05,
      "loss": 1.937,
      "num_input_tokens_seen": 4767017504,
      "step": 6059
    },
    {
      "epoch": 0.6429026098026734,
      "grad_norm": 0.5222885921955176,
      "learning_rate": 4.965777316302227e-05,
      "loss": 1.9378,
      "num_input_tokens_seen": 4767804304,
      "step": 6060
    },
    {
      "epoch": 0.6430086993422448,
      "grad_norm": 0.4366741021790659,
      "learning_rate": 4.965765855577843e-05,
      "loss": 2.0006,
      "num_input_tokens_seen": 4768590944,
      "step": 6061
    },
    {
      "epoch": 0.6431147888818163,
      "grad_norm": 0.5563285311925958,
      "learning_rate": 4.965754392947987e-05,
      "loss": 1.8567,
      "num_input_tokens_seen": 4769377744,
      "step": 6062
    },
    {
      "epoch": 0.6432208784213876,
      "grad_norm": 0.6016927496378741,
      "learning_rate": 4.9657429284126674e-05,
      "loss": 1.836,
      "num_input_tokens_seen": 4770164560,
      "step": 6063
    },
    {
      "epoch": 0.643326967960959,
      "grad_norm": 0.5656034138030579,
      "learning_rate": 4.965731461971895e-05,
      "loss": 2.1152,
      "num_input_tokens_seen": 4770951264,
      "step": 6064
    },
    {
      "epoch": 0.6434330575005305,
      "grad_norm": 0.6763444312296767,
      "learning_rate": 4.965719993625678e-05,
      "loss": 2.0948,
      "num_input_tokens_seen": 4771738000,
      "step": 6065
    },
    {
      "epoch": 0.6435391470401018,
      "grad_norm": 0.700646276649978,
      "learning_rate": 4.965708523374025e-05,
      "loss": 2.0726,
      "num_input_tokens_seen": 4772524784,
      "step": 6066
    },
    {
      "epoch": 0.6436452365796732,
      "grad_norm": 0.45588000674711326,
      "learning_rate": 4.965697051216944e-05,
      "loss": 2.068,
      "num_input_tokens_seen": 4773311664,
      "step": 6067
    },
    {
      "epoch": 0.6437513261192447,
      "grad_norm": 0.5501429706473403,
      "learning_rate": 4.9656855771544455e-05,
      "loss": 2.0307,
      "num_input_tokens_seen": 4774098384,
      "step": 6068
    },
    {
      "epoch": 0.643857415658816,
      "grad_norm": 0.5278161978716505,
      "learning_rate": 4.965674101186537e-05,
      "loss": 1.9304,
      "num_input_tokens_seen": 4774885136,
      "step": 6069
    },
    {
      "epoch": 0.6439635051983874,
      "grad_norm": 0.630406626824823,
      "learning_rate": 4.965662623313227e-05,
      "loss": 1.9294,
      "num_input_tokens_seen": 4775671904,
      "step": 6070
    },
    {
      "epoch": 0.6440695947379589,
      "grad_norm": 0.43835076018234664,
      "learning_rate": 4.9656511435345266e-05,
      "loss": 2.0452,
      "num_input_tokens_seen": 4776458592,
      "step": 6071
    },
    {
      "epoch": 0.6441756842775302,
      "grad_norm": 0.6025532098551858,
      "learning_rate": 4.965639661850443e-05,
      "loss": 1.9522,
      "num_input_tokens_seen": 4777245280,
      "step": 6072
    },
    {
      "epoch": 0.6442817738171016,
      "grad_norm": 0.6319959557802022,
      "learning_rate": 4.965628178260986e-05,
      "loss": 1.9935,
      "num_input_tokens_seen": 4778032064,
      "step": 6073
    },
    {
      "epoch": 0.6443878633566731,
      "grad_norm": 0.5491875450654433,
      "learning_rate": 4.965616692766163e-05,
      "loss": 1.9535,
      "num_input_tokens_seen": 4778818768,
      "step": 6074
    },
    {
      "epoch": 0.6444939528962444,
      "grad_norm": 0.41491428206686354,
      "learning_rate": 4.965605205365984e-05,
      "loss": 1.8864,
      "num_input_tokens_seen": 4779605584,
      "step": 6075
    },
    {
      "epoch": 0.6446000424358158,
      "grad_norm": 0.5115461168386395,
      "learning_rate": 4.965593716060457e-05,
      "loss": 1.872,
      "num_input_tokens_seen": 4780392352,
      "step": 6076
    },
    {
      "epoch": 0.6447061319753872,
      "grad_norm": 0.4552540266221498,
      "learning_rate": 4.9655822248495926e-05,
      "loss": 2.1716,
      "num_input_tokens_seen": 4781179104,
      "step": 6077
    },
    {
      "epoch": 0.6448122215149587,
      "grad_norm": 0.42297783278073453,
      "learning_rate": 4.965570731733398e-05,
      "loss": 1.9955,
      "num_input_tokens_seen": 4781965936,
      "step": 6078
    },
    {
      "epoch": 0.64491831105453,
      "grad_norm": 0.5590853713622891,
      "learning_rate": 4.965559236711883e-05,
      "loss": 1.8564,
      "num_input_tokens_seen": 4782752768,
      "step": 6079
    },
    {
      "epoch": 0.6450244005941014,
      "grad_norm": 0.4347408415213636,
      "learning_rate": 4.965547739785056e-05,
      "loss": 1.9611,
      "num_input_tokens_seen": 4783539520,
      "step": 6080
    },
    {
      "epoch": 0.6451304901336729,
      "grad_norm": 0.7067275980272482,
      "learning_rate": 4.965536240952926e-05,
      "loss": 2.0322,
      "num_input_tokens_seen": 4784326304,
      "step": 6081
    },
    {
      "epoch": 0.6452365796732442,
      "grad_norm": 0.5282533335786206,
      "learning_rate": 4.965524740215503e-05,
      "loss": 2.1927,
      "num_input_tokens_seen": 4785113056,
      "step": 6082
    },
    {
      "epoch": 0.6453426692128156,
      "grad_norm": 0.8719154374897344,
      "learning_rate": 4.965513237572793e-05,
      "loss": 1.9173,
      "num_input_tokens_seen": 4785899824,
      "step": 6083
    },
    {
      "epoch": 0.645448758752387,
      "grad_norm": 0.5606101649105675,
      "learning_rate": 4.9655017330248075e-05,
      "loss": 1.8323,
      "num_input_tokens_seen": 4786686672,
      "step": 6084
    },
    {
      "epoch": 0.6455548482919584,
      "grad_norm": 0.9353027193776221,
      "learning_rate": 4.9654902265715554e-05,
      "loss": 1.968,
      "num_input_tokens_seen": 4787473472,
      "step": 6085
    },
    {
      "epoch": 0.6456609378315298,
      "grad_norm": 1.0533842622086829,
      "learning_rate": 4.9654787182130436e-05,
      "loss": 2.186,
      "num_input_tokens_seen": 4788260240,
      "step": 6086
    },
    {
      "epoch": 0.6457670273711013,
      "grad_norm": 0.5811604036112454,
      "learning_rate": 4.965467207949282e-05,
      "loss": 2.2703,
      "num_input_tokens_seen": 4789046944,
      "step": 6087
    },
    {
      "epoch": 0.6458731169106726,
      "grad_norm": 0.9030792786719288,
      "learning_rate": 4.965455695780281e-05,
      "loss": 1.9762,
      "num_input_tokens_seen": 4789833776,
      "step": 6088
    },
    {
      "epoch": 0.645979206450244,
      "grad_norm": 0.5197663587777106,
      "learning_rate": 4.965444181706047e-05,
      "loss": 1.9835,
      "num_input_tokens_seen": 4790620624,
      "step": 6089
    },
    {
      "epoch": 0.6460852959898155,
      "grad_norm": 1.1291004632198034,
      "learning_rate": 4.965432665726591e-05,
      "loss": 2.1082,
      "num_input_tokens_seen": 4791407344,
      "step": 6090
    },
    {
      "epoch": 0.6461913855293868,
      "grad_norm": 0.8372156245011524,
      "learning_rate": 4.9654211478419204e-05,
      "loss": 2.0803,
      "num_input_tokens_seen": 4792194096,
      "step": 6091
    },
    {
      "epoch": 0.6462974750689582,
      "grad_norm": 0.7120259341102803,
      "learning_rate": 4.9654096280520445e-05,
      "loss": 1.9725,
      "num_input_tokens_seen": 4792980896,
      "step": 6092
    },
    {
      "epoch": 0.6464035646085295,
      "grad_norm": 0.5262826499812434,
      "learning_rate": 4.965398106356973e-05,
      "loss": 2.0882,
      "num_input_tokens_seen": 4793767664,
      "step": 6093
    },
    {
      "epoch": 0.646509654148101,
      "grad_norm": 0.6101635473154433,
      "learning_rate": 4.965386582756714e-05,
      "loss": 1.8964,
      "num_input_tokens_seen": 4794554416,
      "step": 6094
    },
    {
      "epoch": 0.6466157436876724,
      "grad_norm": 0.575238638336326,
      "learning_rate": 4.9653750572512766e-05,
      "loss": 1.9131,
      "num_input_tokens_seen": 4795341216,
      "step": 6095
    },
    {
      "epoch": 0.6467218332272437,
      "grad_norm": 0.6491887176129506,
      "learning_rate": 4.9653635298406696e-05,
      "loss": 1.9124,
      "num_input_tokens_seen": 4796128000,
      "step": 6096
    },
    {
      "epoch": 0.6468279227668152,
      "grad_norm": 0.43420571454721646,
      "learning_rate": 4.965352000524902e-05,
      "loss": 1.9068,
      "num_input_tokens_seen": 4796914784,
      "step": 6097
    },
    {
      "epoch": 0.6469340123063866,
      "grad_norm": 0.6847222148301831,
      "learning_rate": 4.965340469303983e-05,
      "loss": 1.8895,
      "num_input_tokens_seen": 4797701488,
      "step": 6098
    },
    {
      "epoch": 0.647040101845958,
      "grad_norm": 0.6336753951573946,
      "learning_rate": 4.965328936177921e-05,
      "loss": 1.8364,
      "num_input_tokens_seen": 4798488272,
      "step": 6099
    },
    {
      "epoch": 0.6471461913855294,
      "grad_norm": 0.639474185091431,
      "learning_rate": 4.9653174011467244e-05,
      "loss": 2.0423,
      "num_input_tokens_seen": 4799275008,
      "step": 6100
    },
    {
      "epoch": 0.6472522809251008,
      "grad_norm": 0.8169794229175804,
      "learning_rate": 4.965305864210403e-05,
      "loss": 2.1786,
      "num_input_tokens_seen": 4800061760,
      "step": 6101
    },
    {
      "epoch": 0.6473583704646722,
      "grad_norm": 0.44059137424776995,
      "learning_rate": 4.9652943253689666e-05,
      "loss": 1.9679,
      "num_input_tokens_seen": 4800848496,
      "step": 6102
    },
    {
      "epoch": 0.6474644600042436,
      "grad_norm": 1.2319979573482471,
      "learning_rate": 4.965282784622423e-05,
      "loss": 1.8229,
      "num_input_tokens_seen": 4801635312,
      "step": 6103
    },
    {
      "epoch": 0.647570549543815,
      "grad_norm": 0.5192000507400247,
      "learning_rate": 4.9652712419707806e-05,
      "loss": 1.9814,
      "num_input_tokens_seen": 4802422160,
      "step": 6104
    },
    {
      "epoch": 0.6476766390833864,
      "grad_norm": 0.7793730230035948,
      "learning_rate": 4.965259697414049e-05,
      "loss": 1.988,
      "num_input_tokens_seen": 4803208880,
      "step": 6105
    },
    {
      "epoch": 0.6477827286229578,
      "grad_norm": 0.5236700481555798,
      "learning_rate": 4.965248150952237e-05,
      "loss": 1.9227,
      "num_input_tokens_seen": 4803995632,
      "step": 6106
    },
    {
      "epoch": 0.6478888181625292,
      "grad_norm": 0.8779772760041172,
      "learning_rate": 4.965236602585354e-05,
      "loss": 2.0564,
      "num_input_tokens_seen": 4804782336,
      "step": 6107
    },
    {
      "epoch": 0.6479949077021006,
      "grad_norm": 0.740889837283836,
      "learning_rate": 4.965225052313408e-05,
      "loss": 2.0564,
      "num_input_tokens_seen": 4805569168,
      "step": 6108
    },
    {
      "epoch": 0.6481009972416719,
      "grad_norm": 0.731043449998073,
      "learning_rate": 4.965213500136408e-05,
      "loss": 2.0388,
      "num_input_tokens_seen": 4806355984,
      "step": 6109
    },
    {
      "epoch": 0.6482070867812434,
      "grad_norm": 0.7913321290796432,
      "learning_rate": 4.965201946054364e-05,
      "loss": 1.9526,
      "num_input_tokens_seen": 4807142736,
      "step": 6110
    },
    {
      "epoch": 0.6483131763208148,
      "grad_norm": 0.7001492563259649,
      "learning_rate": 4.9651903900672846e-05,
      "loss": 1.9721,
      "num_input_tokens_seen": 4807929504,
      "step": 6111
    },
    {
      "epoch": 0.6484192658603861,
      "grad_norm": 0.7427959372148969,
      "learning_rate": 4.965178832175178e-05,
      "loss": 1.9293,
      "num_input_tokens_seen": 4808716352,
      "step": 6112
    },
    {
      "epoch": 0.6485253553999576,
      "grad_norm": 0.5884797217975377,
      "learning_rate": 4.9651672723780534e-05,
      "loss": 2.1305,
      "num_input_tokens_seen": 4809503168,
      "step": 6113
    },
    {
      "epoch": 0.648631444939529,
      "grad_norm": 0.9801660593434732,
      "learning_rate": 4.96515571067592e-05,
      "loss": 2.0305,
      "num_input_tokens_seen": 4810289952,
      "step": 6114
    },
    {
      "epoch": 0.6487375344791003,
      "grad_norm": 0.5418006286852688,
      "learning_rate": 4.965144147068786e-05,
      "loss": 1.9178,
      "num_input_tokens_seen": 4811076672,
      "step": 6115
    },
    {
      "epoch": 0.6488436240186718,
      "grad_norm": 1.054416840928648,
      "learning_rate": 4.965132581556662e-05,
      "loss": 1.8407,
      "num_input_tokens_seen": 4811863376,
      "step": 6116
    },
    {
      "epoch": 0.6489497135582432,
      "grad_norm": 0.5348673172013289,
      "learning_rate": 4.965121014139555e-05,
      "loss": 2.1098,
      "num_input_tokens_seen": 4812650144,
      "step": 6117
    },
    {
      "epoch": 0.6490558030978145,
      "grad_norm": 1.058197467997755,
      "learning_rate": 4.9651094448174755e-05,
      "loss": 2.0968,
      "num_input_tokens_seen": 4813436944,
      "step": 6118
    },
    {
      "epoch": 0.649161892637386,
      "grad_norm": 0.5362310937750725,
      "learning_rate": 4.965097873590432e-05,
      "loss": 1.9664,
      "num_input_tokens_seen": 4814223664,
      "step": 6119
    },
    {
      "epoch": 0.6492679821769574,
      "grad_norm": 0.9147347627488268,
      "learning_rate": 4.965086300458433e-05,
      "loss": 2.0303,
      "num_input_tokens_seen": 4815010320,
      "step": 6120
    },
    {
      "epoch": 0.6493740717165287,
      "grad_norm": 0.5851138110568704,
      "learning_rate": 4.9650747254214866e-05,
      "loss": 1.8985,
      "num_input_tokens_seen": 4815797168,
      "step": 6121
    },
    {
      "epoch": 0.6494801612561002,
      "grad_norm": 0.7197184098207556,
      "learning_rate": 4.9650631484796035e-05,
      "loss": 1.9307,
      "num_input_tokens_seen": 4816583888,
      "step": 6122
    },
    {
      "epoch": 0.6495862507956716,
      "grad_norm": 0.6180885672087094,
      "learning_rate": 4.965051569632791e-05,
      "loss": 1.9294,
      "num_input_tokens_seen": 4817370608,
      "step": 6123
    },
    {
      "epoch": 0.6496923403352429,
      "grad_norm": 0.8805124627316091,
      "learning_rate": 4.96503998888106e-05,
      "loss": 1.8905,
      "num_input_tokens_seen": 4818157440,
      "step": 6124
    },
    {
      "epoch": 0.6497984298748144,
      "grad_norm": 0.8902430534814594,
      "learning_rate": 4.965028406224419e-05,
      "loss": 2.0715,
      "num_input_tokens_seen": 4818944160,
      "step": 6125
    },
    {
      "epoch": 0.6499045194143858,
      "grad_norm": 0.8697157326498978,
      "learning_rate": 4.965016821662876e-05,
      "loss": 1.9093,
      "num_input_tokens_seen": 4819730928,
      "step": 6126
    },
    {
      "epoch": 0.6500106089539571,
      "grad_norm": 0.638457601436167,
      "learning_rate": 4.965005235196439e-05,
      "loss": 2.0494,
      "num_input_tokens_seen": 4820517760,
      "step": 6127
    },
    {
      "epoch": 0.6501166984935285,
      "grad_norm": 0.6020321110154685,
      "learning_rate": 4.96499364682512e-05,
      "loss": 2.0306,
      "num_input_tokens_seen": 4821304544,
      "step": 6128
    },
    {
      "epoch": 0.6502227880331,
      "grad_norm": 0.664275181381092,
      "learning_rate": 4.964982056548926e-05,
      "loss": 1.9432,
      "num_input_tokens_seen": 4822091296,
      "step": 6129
    },
    {
      "epoch": 0.6503288775726713,
      "grad_norm": 0.4496433058481232,
      "learning_rate": 4.964970464367865e-05,
      "loss": 1.7982,
      "num_input_tokens_seen": 4822878048,
      "step": 6130
    },
    {
      "epoch": 0.6504349671122427,
      "grad_norm": 0.7963335792068443,
      "learning_rate": 4.964958870281948e-05,
      "loss": 2.0732,
      "num_input_tokens_seen": 4823664784,
      "step": 6131
    },
    {
      "epoch": 0.6505410566518142,
      "grad_norm": 0.7794634110504325,
      "learning_rate": 4.964947274291183e-05,
      "loss": 1.9617,
      "num_input_tokens_seen": 4824451584,
      "step": 6132
    },
    {
      "epoch": 0.6506471461913855,
      "grad_norm": 0.78813471883093,
      "learning_rate": 4.964935676395579e-05,
      "loss": 2.0341,
      "num_input_tokens_seen": 4825238480,
      "step": 6133
    },
    {
      "epoch": 0.6507532357309569,
      "grad_norm": 0.549787024834684,
      "learning_rate": 4.964924076595145e-05,
      "loss": 1.8269,
      "num_input_tokens_seen": 4826025280,
      "step": 6134
    },
    {
      "epoch": 0.6508593252705284,
      "grad_norm": 0.7176975703425054,
      "learning_rate": 4.96491247488989e-05,
      "loss": 1.8255,
      "num_input_tokens_seen": 4826812048,
      "step": 6135
    },
    {
      "epoch": 0.6509654148100997,
      "grad_norm": 0.5921152588672669,
      "learning_rate": 4.964900871279823e-05,
      "loss": 1.9095,
      "num_input_tokens_seen": 4827598816,
      "step": 6136
    },
    {
      "epoch": 0.6510715043496711,
      "grad_norm": 0.6523718161150248,
      "learning_rate": 4.964889265764953e-05,
      "loss": 1.9773,
      "num_input_tokens_seen": 4828385616,
      "step": 6137
    },
    {
      "epoch": 0.6511775938892426,
      "grad_norm": 0.5405380660667185,
      "learning_rate": 4.9648776583452895e-05,
      "loss": 2.0042,
      "num_input_tokens_seen": 4829172416,
      "step": 6138
    },
    {
      "epoch": 0.6512836834288139,
      "grad_norm": 0.472010041403394,
      "learning_rate": 4.96486604902084e-05,
      "loss": 1.9237,
      "num_input_tokens_seen": 4829959200,
      "step": 6139
    },
    {
      "epoch": 0.6513897729683853,
      "grad_norm": 0.54204172718646,
      "learning_rate": 4.964854437791614e-05,
      "loss": 1.9812,
      "num_input_tokens_seen": 4830745888,
      "step": 6140
    },
    {
      "epoch": 0.6514958625079568,
      "grad_norm": 0.6959432442437256,
      "learning_rate": 4.964842824657622e-05,
      "loss": 2.0366,
      "num_input_tokens_seen": 4831532752,
      "step": 6141
    },
    {
      "epoch": 0.6516019520475281,
      "grad_norm": 0.6717554127648478,
      "learning_rate": 4.964831209618871e-05,
      "loss": 1.854,
      "num_input_tokens_seen": 4832319648,
      "step": 6142
    },
    {
      "epoch": 0.6517080415870995,
      "grad_norm": 0.6899861823696642,
      "learning_rate": 4.964819592675371e-05,
      "loss": 2.057,
      "num_input_tokens_seen": 4833106448,
      "step": 6143
    },
    {
      "epoch": 0.6518141311266709,
      "grad_norm": 2.0309971068803248,
      "learning_rate": 4.96480797382713e-05,
      "loss": 2.218,
      "num_input_tokens_seen": 4833893120,
      "step": 6144
    },
    {
      "epoch": 0.6519202206662423,
      "grad_norm": 0.806448539450941,
      "learning_rate": 4.964796353074159e-05,
      "loss": 2.0326,
      "num_input_tokens_seen": 4834679840,
      "step": 6145
    },
    {
      "epoch": 0.6520263102058137,
      "grad_norm": 1.3612062433313108,
      "learning_rate": 4.964784730416465e-05,
      "loss": 2.0031,
      "num_input_tokens_seen": 4835466608,
      "step": 6146
    },
    {
      "epoch": 0.6521323997453851,
      "grad_norm": 0.5515126234179936,
      "learning_rate": 4.964773105854058e-05,
      "loss": 1.9266,
      "num_input_tokens_seen": 4836253504,
      "step": 6147
    },
    {
      "epoch": 0.6522384892849565,
      "grad_norm": 0.5928074713651065,
      "learning_rate": 4.964761479386946e-05,
      "loss": 1.903,
      "num_input_tokens_seen": 4837040304,
      "step": 6148
    },
    {
      "epoch": 0.6523445788245279,
      "grad_norm": 0.487018681536069,
      "learning_rate": 4.964749851015139e-05,
      "loss": 1.944,
      "num_input_tokens_seen": 4837827104,
      "step": 6149
    },
    {
      "epoch": 0.6524506683640993,
      "grad_norm": 0.5781504875813023,
      "learning_rate": 4.964738220738646e-05,
      "loss": 1.9304,
      "num_input_tokens_seen": 4838613856,
      "step": 6150
    },
    {
      "epoch": 0.6525567579036707,
      "grad_norm": 0.5184011606005654,
      "learning_rate": 4.9647265885574755e-05,
      "loss": 1.9606,
      "num_input_tokens_seen": 4839400656,
      "step": 6151
    },
    {
      "epoch": 0.6526628474432421,
      "grad_norm": 0.9965451733737646,
      "learning_rate": 4.964714954471637e-05,
      "loss": 1.9472,
      "num_input_tokens_seen": 4840187424,
      "step": 6152
    },
    {
      "epoch": 0.6527689369828135,
      "grad_norm": 0.8811183452631633,
      "learning_rate": 4.964703318481138e-05,
      "loss": 1.8532,
      "num_input_tokens_seen": 4840974176,
      "step": 6153
    },
    {
      "epoch": 0.6528750265223849,
      "grad_norm": 0.8167081106306548,
      "learning_rate": 4.9646916805859886e-05,
      "loss": 2.1168,
      "num_input_tokens_seen": 4841760880,
      "step": 6154
    },
    {
      "epoch": 0.6529811160619563,
      "grad_norm": 0.9917485870881811,
      "learning_rate": 4.964680040786199e-05,
      "loss": 1.899,
      "num_input_tokens_seen": 4842547680,
      "step": 6155
    },
    {
      "epoch": 0.6530872056015277,
      "grad_norm": 1.0033379372739286,
      "learning_rate": 4.9646683990817766e-05,
      "loss": 1.8796,
      "num_input_tokens_seen": 4843334528,
      "step": 6156
    },
    {
      "epoch": 0.6531932951410991,
      "grad_norm": 1.3427844102129707,
      "learning_rate": 4.96465675547273e-05,
      "loss": 2.0355,
      "num_input_tokens_seen": 4844121344,
      "step": 6157
    },
    {
      "epoch": 0.6532993846806705,
      "grad_norm": 1.2478292260852404,
      "learning_rate": 4.96464510995907e-05,
      "loss": 1.8702,
      "num_input_tokens_seen": 4844908080,
      "step": 6158
    },
    {
      "epoch": 0.6534054742202419,
      "grad_norm": 1.6516836066654028,
      "learning_rate": 4.964633462540804e-05,
      "loss": 2.0761,
      "num_input_tokens_seen": 4845694896,
      "step": 6159
    },
    {
      "epoch": 0.6535115637598132,
      "grad_norm": 1.1560776828519284,
      "learning_rate": 4.964621813217941e-05,
      "loss": 2.1063,
      "num_input_tokens_seen": 4846481600,
      "step": 6160
    },
    {
      "epoch": 0.6536176532993847,
      "grad_norm": 1.486103812787964,
      "learning_rate": 4.964610161990492e-05,
      "loss": 1.8907,
      "num_input_tokens_seen": 4847268352,
      "step": 6161
    },
    {
      "epoch": 0.6537237428389561,
      "grad_norm": 1.0672928997377795,
      "learning_rate": 4.9645985088584634e-05,
      "loss": 2.1676,
      "num_input_tokens_seen": 4848055088,
      "step": 6162
    },
    {
      "epoch": 0.6538298323785274,
      "grad_norm": 3.082259214838379,
      "learning_rate": 4.964586853821866e-05,
      "loss": 2.0838,
      "num_input_tokens_seen": 4848841920,
      "step": 6163
    },
    {
      "epoch": 0.6539359219180989,
      "grad_norm": 1.9270588343214994,
      "learning_rate": 4.964575196880708e-05,
      "loss": 1.8402,
      "num_input_tokens_seen": 4849628592,
      "step": 6164
    },
    {
      "epoch": 0.6540420114576703,
      "grad_norm": 1.1156894939191424,
      "learning_rate": 4.964563538034999e-05,
      "loss": 1.9945,
      "num_input_tokens_seen": 4850415360,
      "step": 6165
    },
    {
      "epoch": 0.6541481009972416,
      "grad_norm": 1.6866747385271068,
      "learning_rate": 4.9645518772847464e-05,
      "loss": 2.1474,
      "num_input_tokens_seen": 4851202048,
      "step": 6166
    },
    {
      "epoch": 0.6542541905368131,
      "grad_norm": 1.1342179979073073,
      "learning_rate": 4.9645402146299615e-05,
      "loss": 2.0281,
      "num_input_tokens_seen": 4851988816,
      "step": 6167
    },
    {
      "epoch": 0.6543602800763845,
      "grad_norm": 2.600763195788885,
      "learning_rate": 4.9645285500706514e-05,
      "loss": 1.9041,
      "num_input_tokens_seen": 4852775568,
      "step": 6168
    },
    {
      "epoch": 0.6544663696159558,
      "grad_norm": 2.0012998027938003,
      "learning_rate": 4.9645168836068264e-05,
      "loss": 1.9098,
      "num_input_tokens_seen": 4853562320,
      "step": 6169
    },
    {
      "epoch": 0.6545724591555273,
      "grad_norm": 2.923058446450306,
      "learning_rate": 4.964505215238496e-05,
      "loss": 2.0622,
      "num_input_tokens_seen": 4854349072,
      "step": 6170
    },
    {
      "epoch": 0.6546785486950987,
      "grad_norm": 0.9386853774732082,
      "learning_rate": 4.964493544965667e-05,
      "loss": 1.8753,
      "num_input_tokens_seen": 4855135920,
      "step": 6171
    },
    {
      "epoch": 0.65478463823467,
      "grad_norm": 1.819134709788821,
      "learning_rate": 4.9644818727883505e-05,
      "loss": 2.0092,
      "num_input_tokens_seen": 4855922656,
      "step": 6172
    },
    {
      "epoch": 0.6548907277742415,
      "grad_norm": 0.6881841068956593,
      "learning_rate": 4.9644701987065544e-05,
      "loss": 1.9705,
      "num_input_tokens_seen": 4856709408,
      "step": 6173
    },
    {
      "epoch": 0.6549968173138129,
      "grad_norm": 7.883127393984886,
      "learning_rate": 4.964458522720288e-05,
      "loss": 1.967,
      "num_input_tokens_seen": 4857496064,
      "step": 6174
    },
    {
      "epoch": 0.6551029068533842,
      "grad_norm": 1.8119845048042886,
      "learning_rate": 4.96444684482956e-05,
      "loss": 2.1114,
      "num_input_tokens_seen": 4858282832,
      "step": 6175
    },
    {
      "epoch": 0.6552089963929556,
      "grad_norm": 12.289193821965547,
      "learning_rate": 4.964435165034381e-05,
      "loss": 2.0854,
      "num_input_tokens_seen": 4859069616,
      "step": 6176
    },
    {
      "epoch": 0.6553150859325271,
      "grad_norm": 2.305806906497741,
      "learning_rate": 4.964423483334757e-05,
      "loss": 1.934,
      "num_input_tokens_seen": 4859856336,
      "step": 6177
    },
    {
      "epoch": 0.6554211754720984,
      "grad_norm": 11.531760003642212,
      "learning_rate": 4.9644117997307e-05,
      "loss": 2.0324,
      "num_input_tokens_seen": 4860643008,
      "step": 6178
    },
    {
      "epoch": 0.6555272650116698,
      "grad_norm": 7.215366535343697,
      "learning_rate": 4.964400114222218e-05,
      "loss": 1.9541,
      "num_input_tokens_seen": 4861429824,
      "step": 6179
    },
    {
      "epoch": 0.6556333545512413,
      "grad_norm": 1.238445270149871,
      "learning_rate": 4.96438842680932e-05,
      "loss": 2.0682,
      "num_input_tokens_seen": 4862216528,
      "step": 6180
    },
    {
      "epoch": 0.6557394440908126,
      "grad_norm": 1.9827504356724415,
      "learning_rate": 4.9643767374920144e-05,
      "loss": 2.1315,
      "num_input_tokens_seen": 4863003280,
      "step": 6181
    },
    {
      "epoch": 0.655845533630384,
      "grad_norm": 1.1263380762444417,
      "learning_rate": 4.964365046270311e-05,
      "loss": 1.9793,
      "num_input_tokens_seen": 4863790080,
      "step": 6182
    },
    {
      "epoch": 0.6559516231699555,
      "grad_norm": 0.7950075950231772,
      "learning_rate": 4.964353353144218e-05,
      "loss": 2.0266,
      "num_input_tokens_seen": 4864576768,
      "step": 6183
    },
    {
      "epoch": 0.6560577127095268,
      "grad_norm": 0.711017257395963,
      "learning_rate": 4.964341658113746e-05,
      "loss": 1.9287,
      "num_input_tokens_seen": 4865363504,
      "step": 6184
    },
    {
      "epoch": 0.6561638022490982,
      "grad_norm": 0.8845110313959635,
      "learning_rate": 4.9643299611789025e-05,
      "loss": 1.8889,
      "num_input_tokens_seen": 4866150320,
      "step": 6185
    },
    {
      "epoch": 0.6562698917886697,
      "grad_norm": 0.7947504097814606,
      "learning_rate": 4.9643182623396974e-05,
      "loss": 2.0687,
      "num_input_tokens_seen": 4866937104,
      "step": 6186
    },
    {
      "epoch": 0.656375981328241,
      "grad_norm": 0.7804047328331877,
      "learning_rate": 4.9643065615961394e-05,
      "loss": 2.0447,
      "num_input_tokens_seen": 4867723856,
      "step": 6187
    },
    {
      "epoch": 0.6564820708678124,
      "grad_norm": 0.8474404374535393,
      "learning_rate": 4.964294858948237e-05,
      "loss": 2.004,
      "num_input_tokens_seen": 4868510560,
      "step": 6188
    },
    {
      "epoch": 0.6565881604073839,
      "grad_norm": 0.6059833458543817,
      "learning_rate": 4.964283154396001e-05,
      "loss": 1.8341,
      "num_input_tokens_seen": 4869297392,
      "step": 6189
    },
    {
      "epoch": 0.6566942499469552,
      "grad_norm": 0.7717022708184325,
      "learning_rate": 4.964271447939438e-05,
      "loss": 2.0177,
      "num_input_tokens_seen": 4870084192,
      "step": 6190
    },
    {
      "epoch": 0.6568003394865266,
      "grad_norm": 0.8768193782011039,
      "learning_rate": 4.9642597395785594e-05,
      "loss": 1.9949,
      "num_input_tokens_seen": 4870871040,
      "step": 6191
    },
    {
      "epoch": 0.6569064290260981,
      "grad_norm": 0.5754954032449012,
      "learning_rate": 4.9642480293133725e-05,
      "loss": 1.8208,
      "num_input_tokens_seen": 4871657872,
      "step": 6192
    },
    {
      "epoch": 0.6570125185656694,
      "grad_norm": 0.7907803693509591,
      "learning_rate": 4.964236317143887e-05,
      "loss": 2.0817,
      "num_input_tokens_seen": 4872444624,
      "step": 6193
    },
    {
      "epoch": 0.6571186081052408,
      "grad_norm": 0.49270749815923764,
      "learning_rate": 4.9642246030701126e-05,
      "loss": 1.9119,
      "num_input_tokens_seen": 4873231424,
      "step": 6194
    },
    {
      "epoch": 0.6572246976448122,
      "grad_norm": 0.7925928861545661,
      "learning_rate": 4.964212887092057e-05,
      "loss": 2.045,
      "num_input_tokens_seen": 4874018160,
      "step": 6195
    },
    {
      "epoch": 0.6573307871843836,
      "grad_norm": 0.6086158655828885,
      "learning_rate": 4.9642011692097306e-05,
      "loss": 1.9099,
      "num_input_tokens_seen": 4874804944,
      "step": 6196
    },
    {
      "epoch": 0.657436876723955,
      "grad_norm": 0.6609039778761369,
      "learning_rate": 4.964189449423141e-05,
      "loss": 1.9445,
      "num_input_tokens_seen": 4875591792,
      "step": 6197
    },
    {
      "epoch": 0.6575429662635264,
      "grad_norm": 0.4228647617941007,
      "learning_rate": 4.964177727732299e-05,
      "loss": 1.9816,
      "num_input_tokens_seen": 4876378576,
      "step": 6198
    },
    {
      "epoch": 0.6576490558030978,
      "grad_norm": 0.5193342564964576,
      "learning_rate": 4.964166004137213e-05,
      "loss": 1.7224,
      "num_input_tokens_seen": 4877165456,
      "step": 6199
    },
    {
      "epoch": 0.6577551453426692,
      "grad_norm": 0.8021041437315949,
      "learning_rate": 4.964154278637891e-05,
      "loss": 1.8875,
      "num_input_tokens_seen": 4877952224,
      "step": 6200
    },
    {
      "epoch": 0.6578612348822406,
      "grad_norm": 1.1888710136254388,
      "learning_rate": 4.9641425512343434e-05,
      "loss": 1.9254,
      "num_input_tokens_seen": 4878738960,
      "step": 6201
    },
    {
      "epoch": 0.657967324421812,
      "grad_norm": 0.5177342045041349,
      "learning_rate": 4.964130821926578e-05,
      "loss": 1.979,
      "num_input_tokens_seen": 4879525728,
      "step": 6202
    },
    {
      "epoch": 0.6580734139613834,
      "grad_norm": 1.0707871078212852,
      "learning_rate": 4.964119090714605e-05,
      "loss": 1.8232,
      "num_input_tokens_seen": 4880312512,
      "step": 6203
    },
    {
      "epoch": 0.6581795035009548,
      "grad_norm": 0.5685093992859805,
      "learning_rate": 4.964107357598433e-05,
      "loss": 2.1159,
      "num_input_tokens_seen": 4881099232,
      "step": 6204
    },
    {
      "epoch": 0.6582855930405263,
      "grad_norm": 0.7379835706092138,
      "learning_rate": 4.964095622578072e-05,
      "loss": 2.1466,
      "num_input_tokens_seen": 4881886048,
      "step": 6205
    },
    {
      "epoch": 0.6583916825800976,
      "grad_norm": 0.5632670532170193,
      "learning_rate": 4.9640838856535286e-05,
      "loss": 2.0709,
      "num_input_tokens_seen": 4882672720,
      "step": 6206
    },
    {
      "epoch": 0.658497772119669,
      "grad_norm": 0.8605001287247133,
      "learning_rate": 4.9640721468248146e-05,
      "loss": 2.0196,
      "num_input_tokens_seen": 4883459440,
      "step": 6207
    },
    {
      "epoch": 0.6586038616592405,
      "grad_norm": 0.5199552182148609,
      "learning_rate": 4.964060406091938e-05,
      "loss": 2.0698,
      "num_input_tokens_seen": 4884246224,
      "step": 6208
    },
    {
      "epoch": 0.6587099511988118,
      "grad_norm": 0.6139383574089592,
      "learning_rate": 4.9640486634549076e-05,
      "loss": 1.8188,
      "num_input_tokens_seen": 4885032992,
      "step": 6209
    },
    {
      "epoch": 0.6588160407383832,
      "grad_norm": 0.5126840401545398,
      "learning_rate": 4.964036918913732e-05,
      "loss": 1.9106,
      "num_input_tokens_seen": 4885819824,
      "step": 6210
    },
    {
      "epoch": 0.6589221302779545,
      "grad_norm": 0.6411483710301271,
      "learning_rate": 4.9640251724684214e-05,
      "loss": 1.9313,
      "num_input_tokens_seen": 4886606656,
      "step": 6211
    },
    {
      "epoch": 0.659028219817526,
      "grad_norm": 0.4800025950292166,
      "learning_rate": 4.964013424118985e-05,
      "loss": 1.9522,
      "num_input_tokens_seen": 4887393472,
      "step": 6212
    },
    {
      "epoch": 0.6591343093570974,
      "grad_norm": 0.681743287603981,
      "learning_rate": 4.964001673865432e-05,
      "loss": 1.9503,
      "num_input_tokens_seen": 4888180272,
      "step": 6213
    },
    {
      "epoch": 0.6592403988966687,
      "grad_norm": 0.45556188712512363,
      "learning_rate": 4.963989921707769e-05,
      "loss": 2.0553,
      "num_input_tokens_seen": 4888967120,
      "step": 6214
    },
    {
      "epoch": 0.6593464884362402,
      "grad_norm": 0.493778809581813,
      "learning_rate": 4.9639781676460075e-05,
      "loss": 1.9516,
      "num_input_tokens_seen": 4889753792,
      "step": 6215
    },
    {
      "epoch": 0.6594525779758116,
      "grad_norm": 0.4460865748320985,
      "learning_rate": 4.963966411680157e-05,
      "loss": 1.9522,
      "num_input_tokens_seen": 4890540480,
      "step": 6216
    },
    {
      "epoch": 0.659558667515383,
      "grad_norm": 0.4627386253556679,
      "learning_rate": 4.963954653810224e-05,
      "loss": 1.9219,
      "num_input_tokens_seen": 4891327360,
      "step": 6217
    },
    {
      "epoch": 0.6596647570549544,
      "grad_norm": 0.4174710842637477,
      "learning_rate": 4.9639428940362196e-05,
      "loss": 1.8502,
      "num_input_tokens_seen": 4892114208,
      "step": 6218
    },
    {
      "epoch": 0.6597708465945258,
      "grad_norm": 0.49063730781581727,
      "learning_rate": 4.963931132358153e-05,
      "loss": 1.6888,
      "num_input_tokens_seen": 4892901024,
      "step": 6219
    },
    {
      "epoch": 0.6598769361340971,
      "grad_norm": 0.5523086812953132,
      "learning_rate": 4.963919368776032e-05,
      "loss": 2.0483,
      "num_input_tokens_seen": 4893687744,
      "step": 6220
    },
    {
      "epoch": 0.6599830256736686,
      "grad_norm": 0.8031098151997923,
      "learning_rate": 4.963907603289867e-05,
      "loss": 1.9879,
      "num_input_tokens_seen": 4894474416,
      "step": 6221
    },
    {
      "epoch": 0.66008911521324,
      "grad_norm": 1.2756591700454507,
      "learning_rate": 4.9638958358996655e-05,
      "loss": 2.0721,
      "num_input_tokens_seen": 4895261152,
      "step": 6222
    },
    {
      "epoch": 0.6601952047528113,
      "grad_norm": 0.6830189277286318,
      "learning_rate": 4.963884066605439e-05,
      "loss": 2.0521,
      "num_input_tokens_seen": 4896047920,
      "step": 6223
    },
    {
      "epoch": 0.6603012942923828,
      "grad_norm": 0.7304575639559869,
      "learning_rate": 4.963872295407195e-05,
      "loss": 2.0028,
      "num_input_tokens_seen": 4896834656,
      "step": 6224
    },
    {
      "epoch": 0.6604073838319542,
      "grad_norm": 0.7411663303696489,
      "learning_rate": 4.963860522304942e-05,
      "loss": 2.1395,
      "num_input_tokens_seen": 4897621408,
      "step": 6225
    },
    {
      "epoch": 0.6605134733715256,
      "grad_norm": 0.6472079938658802,
      "learning_rate": 4.96384874729869e-05,
      "loss": 2.0088,
      "num_input_tokens_seen": 4898408112,
      "step": 6226
    },
    {
      "epoch": 0.6606195629110969,
      "grad_norm": 0.5359037739859076,
      "learning_rate": 4.963836970388448e-05,
      "loss": 1.8948,
      "num_input_tokens_seen": 4899194960,
      "step": 6227
    },
    {
      "epoch": 0.6607256524506684,
      "grad_norm": 0.5371899372947974,
      "learning_rate": 4.963825191574225e-05,
      "loss": 1.974,
      "num_input_tokens_seen": 4899981664,
      "step": 6228
    },
    {
      "epoch": 0.6608317419902398,
      "grad_norm": 0.6765268167514374,
      "learning_rate": 4.963813410856031e-05,
      "loss": 1.921,
      "num_input_tokens_seen": 4900768384,
      "step": 6229
    },
    {
      "epoch": 0.6609378315298111,
      "grad_norm": 0.6192517931350578,
      "learning_rate": 4.963801628233874e-05,
      "loss": 2.019,
      "num_input_tokens_seen": 4901555168,
      "step": 6230
    },
    {
      "epoch": 0.6610439210693826,
      "grad_norm": 0.46157672357096724,
      "learning_rate": 4.963789843707762e-05,
      "loss": 1.993,
      "num_input_tokens_seen": 4902341984,
      "step": 6231
    },
    {
      "epoch": 0.661150010608954,
      "grad_norm": 0.5188664876630996,
      "learning_rate": 4.963778057277707e-05,
      "loss": 1.8313,
      "num_input_tokens_seen": 4903128832,
      "step": 6232
    },
    {
      "epoch": 0.6612561001485253,
      "grad_norm": 0.5368708441556704,
      "learning_rate": 4.963766268943717e-05,
      "loss": 1.9679,
      "num_input_tokens_seen": 4903915568,
      "step": 6233
    },
    {
      "epoch": 0.6613621896880968,
      "grad_norm": 0.4976639068725993,
      "learning_rate": 4.9637544787058e-05,
      "loss": 2.0485,
      "num_input_tokens_seen": 4904702288,
      "step": 6234
    },
    {
      "epoch": 0.6614682792276682,
      "grad_norm": 0.49394297276362764,
      "learning_rate": 4.963742686563966e-05,
      "loss": 1.8008,
      "num_input_tokens_seen": 4905489152,
      "step": 6235
    },
    {
      "epoch": 0.6615743687672395,
      "grad_norm": 0.5058951076544648,
      "learning_rate": 4.963730892518223e-05,
      "loss": 1.9512,
      "num_input_tokens_seen": 4906275776,
      "step": 6236
    },
    {
      "epoch": 0.661680458306811,
      "grad_norm": 0.507781483927534,
      "learning_rate": 4.963719096568582e-05,
      "loss": 1.8937,
      "num_input_tokens_seen": 4907062576,
      "step": 6237
    },
    {
      "epoch": 0.6617865478463824,
      "grad_norm": 0.4463362566486036,
      "learning_rate": 4.963707298715051e-05,
      "loss": 1.9422,
      "num_input_tokens_seen": 4907849344,
      "step": 6238
    },
    {
      "epoch": 0.6618926373859537,
      "grad_norm": 0.469696074932816,
      "learning_rate": 4.963695498957639e-05,
      "loss": 1.9158,
      "num_input_tokens_seen": 4908636048,
      "step": 6239
    },
    {
      "epoch": 0.6619987269255252,
      "grad_norm": 0.5077544687562533,
      "learning_rate": 4.9636836972963555e-05,
      "loss": 2.0312,
      "num_input_tokens_seen": 4909422704,
      "step": 6240
    },
    {
      "epoch": 0.6621048164650966,
      "grad_norm": 0.3924899007080258,
      "learning_rate": 4.96367189373121e-05,
      "loss": 2.0087,
      "num_input_tokens_seen": 4910209456,
      "step": 6241
    },
    {
      "epoch": 0.6622109060046679,
      "grad_norm": 0.4761745977348174,
      "learning_rate": 4.9636600882622106e-05,
      "loss": 2.1252,
      "num_input_tokens_seen": 4910996192,
      "step": 6242
    },
    {
      "epoch": 0.6623169955442393,
      "grad_norm": 0.4101636519540509,
      "learning_rate": 4.963648280889368e-05,
      "loss": 1.9796,
      "num_input_tokens_seen": 4911782944,
      "step": 6243
    },
    {
      "epoch": 0.6624230850838108,
      "grad_norm": 0.4029048168541307,
      "learning_rate": 4.963636471612689e-05,
      "loss": 1.8492,
      "num_input_tokens_seen": 4912569712,
      "step": 6244
    },
    {
      "epoch": 0.6625291746233821,
      "grad_norm": 0.45404417886358645,
      "learning_rate": 4.9636246604321846e-05,
      "loss": 1.904,
      "num_input_tokens_seen": 4913356512,
      "step": 6245
    },
    {
      "epoch": 0.6626352641629535,
      "grad_norm": 0.4306932690312993,
      "learning_rate": 4.963612847347863e-05,
      "loss": 1.8474,
      "num_input_tokens_seen": 4914143280,
      "step": 6246
    },
    {
      "epoch": 0.662741353702525,
      "grad_norm": 0.44174561617173486,
      "learning_rate": 4.9636010323597334e-05,
      "loss": 1.8763,
      "num_input_tokens_seen": 4914930032,
      "step": 6247
    },
    {
      "epoch": 0.6628474432420963,
      "grad_norm": 0.48197235984914155,
      "learning_rate": 4.9635892154678064e-05,
      "loss": 1.9778,
      "num_input_tokens_seen": 4915716688,
      "step": 6248
    },
    {
      "epoch": 0.6629535327816677,
      "grad_norm": 0.6202365055821749,
      "learning_rate": 4.9635773966720894e-05,
      "loss": 1.7971,
      "num_input_tokens_seen": 4916503552,
      "step": 6249
    },
    {
      "epoch": 0.6630596223212392,
      "grad_norm": 0.4214947035460421,
      "learning_rate": 4.963565575972592e-05,
      "loss": 1.9535,
      "num_input_tokens_seen": 4917290320,
      "step": 6250
    },
    {
      "epoch": 0.6631657118608105,
      "grad_norm": 0.5301802702799703,
      "learning_rate": 4.963553753369323e-05,
      "loss": 2.1418,
      "num_input_tokens_seen": 4918077072,
      "step": 6251
    },
    {
      "epoch": 0.6632718014003819,
      "grad_norm": 0.4768362268942684,
      "learning_rate": 4.963541928862293e-05,
      "loss": 1.9003,
      "num_input_tokens_seen": 4918863904,
      "step": 6252
    },
    {
      "epoch": 0.6633778909399534,
      "grad_norm": 0.4973904934006272,
      "learning_rate": 4.963530102451509e-05,
      "loss": 1.872,
      "num_input_tokens_seen": 4919650720,
      "step": 6253
    },
    {
      "epoch": 0.6634839804795247,
      "grad_norm": 0.5135160240255591,
      "learning_rate": 4.9635182741369815e-05,
      "loss": 1.9111,
      "num_input_tokens_seen": 4920437408,
      "step": 6254
    },
    {
      "epoch": 0.6635900700190961,
      "grad_norm": 0.3982882904523351,
      "learning_rate": 4.9635064439187196e-05,
      "loss": 1.8723,
      "num_input_tokens_seen": 4921224128,
      "step": 6255
    },
    {
      "epoch": 0.6636961595586676,
      "grad_norm": 0.43199590228417684,
      "learning_rate": 4.9634946117967316e-05,
      "loss": 1.9768,
      "num_input_tokens_seen": 4922010896,
      "step": 6256
    },
    {
      "epoch": 0.6638022490982389,
      "grad_norm": 0.6020609107573965,
      "learning_rate": 4.963482777771028e-05,
      "loss": 1.8759,
      "num_input_tokens_seen": 4922797760,
      "step": 6257
    },
    {
      "epoch": 0.6639083386378103,
      "grad_norm": 0.4769151043333989,
      "learning_rate": 4.963470941841617e-05,
      "loss": 1.9323,
      "num_input_tokens_seen": 4923584400,
      "step": 6258
    },
    {
      "epoch": 0.6640144281773817,
      "grad_norm": 0.7186075119268737,
      "learning_rate": 4.9634591040085085e-05,
      "loss": 2.176,
      "num_input_tokens_seen": 4924371152,
      "step": 6259
    },
    {
      "epoch": 0.6641205177169531,
      "grad_norm": 0.9121208945920736,
      "learning_rate": 4.96344726427171e-05,
      "loss": 1.8894,
      "num_input_tokens_seen": 4925157984,
      "step": 6260
    },
    {
      "epoch": 0.6642266072565245,
      "grad_norm": 0.647361684026569,
      "learning_rate": 4.9634354226312324e-05,
      "loss": 1.8506,
      "num_input_tokens_seen": 4925944832,
      "step": 6261
    },
    {
      "epoch": 0.6643326967960959,
      "grad_norm": 1.4803430291773765,
      "learning_rate": 4.9634235790870843e-05,
      "loss": 2.0533,
      "num_input_tokens_seen": 4926731520,
      "step": 6262
    },
    {
      "epoch": 0.6644387863356673,
      "grad_norm": 1.04216674916873,
      "learning_rate": 4.963411733639274e-05,
      "loss": 2.0755,
      "num_input_tokens_seen": 4927518256,
      "step": 6263
    },
    {
      "epoch": 0.6645448758752387,
      "grad_norm": 2.4703370507571036,
      "learning_rate": 4.9633998862878115e-05,
      "loss": 1.8301,
      "num_input_tokens_seen": 4928305088,
      "step": 6264
    },
    {
      "epoch": 0.6646509654148101,
      "grad_norm": 1.8830928651624492,
      "learning_rate": 4.963388037032707e-05,
      "loss": 1.9961,
      "num_input_tokens_seen": 4929091888,
      "step": 6265
    },
    {
      "epoch": 0.6647570549543815,
      "grad_norm": 0.5246811457206766,
      "learning_rate": 4.963376185873967e-05,
      "loss": 2.0304,
      "num_input_tokens_seen": 4929878528,
      "step": 6266
    },
    {
      "epoch": 0.6648631444939529,
      "grad_norm": 2.3234672824036715,
      "learning_rate": 4.963364332811603e-05,
      "loss": 2.1211,
      "num_input_tokens_seen": 4930665312,
      "step": 6267
    },
    {
      "epoch": 0.6649692340335243,
      "grad_norm": 1.046178814857362,
      "learning_rate": 4.963352477845623e-05,
      "loss": 2.0131,
      "num_input_tokens_seen": 4931452128,
      "step": 6268
    },
    {
      "epoch": 0.6650753235730957,
      "grad_norm": 0.7249594449721878,
      "learning_rate": 4.963340620976037e-05,
      "loss": 1.9371,
      "num_input_tokens_seen": 4932238896,
      "step": 6269
    },
    {
      "epoch": 0.6651814131126671,
      "grad_norm": 1.1588213010078987,
      "learning_rate": 4.9633287622028534e-05,
      "loss": 1.8749,
      "num_input_tokens_seen": 4933025696,
      "step": 6270
    },
    {
      "epoch": 0.6652875026522385,
      "grad_norm": 0.4790941712635226,
      "learning_rate": 4.963316901526081e-05,
      "loss": 1.9148,
      "num_input_tokens_seen": 4933812576,
      "step": 6271
    },
    {
      "epoch": 0.6653935921918099,
      "grad_norm": 1.069675008185777,
      "learning_rate": 4.96330503894573e-05,
      "loss": 2.044,
      "num_input_tokens_seen": 4934599312,
      "step": 6272
    },
    {
      "epoch": 0.6654996817313813,
      "grad_norm": 0.5730061157498858,
      "learning_rate": 4.9632931744618094e-05,
      "loss": 1.9024,
      "num_input_tokens_seen": 4935386048,
      "step": 6273
    },
    {
      "epoch": 0.6656057712709527,
      "grad_norm": 1.0804304382811885,
      "learning_rate": 4.963281308074328e-05,
      "loss": 2.1798,
      "num_input_tokens_seen": 4936172816,
      "step": 6274
    },
    {
      "epoch": 0.6657118608105241,
      "grad_norm": 0.49032785663124945,
      "learning_rate": 4.963269439783295e-05,
      "loss": 1.9267,
      "num_input_tokens_seen": 4936959616,
      "step": 6275
    },
    {
      "epoch": 0.6658179503500955,
      "grad_norm": 0.6912235301451101,
      "learning_rate": 4.96325756958872e-05,
      "loss": 1.8863,
      "num_input_tokens_seen": 4937746416,
      "step": 6276
    },
    {
      "epoch": 0.6659240398896669,
      "grad_norm": 0.6891368174446271,
      "learning_rate": 4.963245697490611e-05,
      "loss": 1.9744,
      "num_input_tokens_seen": 4938533232,
      "step": 6277
    },
    {
      "epoch": 0.6660301294292382,
      "grad_norm": 1.1992821839052008,
      "learning_rate": 4.9632338234889785e-05,
      "loss": 1.9801,
      "num_input_tokens_seen": 4939320032,
      "step": 6278
    },
    {
      "epoch": 0.6661362189688097,
      "grad_norm": 0.6704202167056091,
      "learning_rate": 4.9632219475838316e-05,
      "loss": 2.0281,
      "num_input_tokens_seen": 4940106848,
      "step": 6279
    },
    {
      "epoch": 0.6662423085083811,
      "grad_norm": 0.7187029125253295,
      "learning_rate": 4.963210069775178e-05,
      "loss": 1.9432,
      "num_input_tokens_seen": 4940893632,
      "step": 6280
    },
    {
      "epoch": 0.6663483980479524,
      "grad_norm": 0.8566255964193522,
      "learning_rate": 4.963198190063029e-05,
      "loss": 2.011,
      "num_input_tokens_seen": 4941680368,
      "step": 6281
    },
    {
      "epoch": 0.6664544875875239,
      "grad_norm": 0.5258085849948785,
      "learning_rate": 4.9631863084473925e-05,
      "loss": 2.0463,
      "num_input_tokens_seen": 4942467120,
      "step": 6282
    },
    {
      "epoch": 0.6665605771270953,
      "grad_norm": 0.8054875857888101,
      "learning_rate": 4.9631744249282774e-05,
      "loss": 2.0019,
      "num_input_tokens_seen": 4943253856,
      "step": 6283
    },
    {
      "epoch": 0.6666666666666666,
      "grad_norm": 0.6784059040262846,
      "learning_rate": 4.9631625395056935e-05,
      "loss": 2.0378,
      "num_input_tokens_seen": 4944040624,
      "step": 6284
    },
    {
      "epoch": 0.6667727562062381,
      "grad_norm": 1.3290044162414762,
      "learning_rate": 4.96315065217965e-05,
      "loss": 2.0394,
      "num_input_tokens_seen": 4944827440,
      "step": 6285
    },
    {
      "epoch": 0.6668788457458095,
      "grad_norm": 0.6544733590382048,
      "learning_rate": 4.9631387629501556e-05,
      "loss": 1.879,
      "num_input_tokens_seen": 4945614256,
      "step": 6286
    },
    {
      "epoch": 0.6669849352853808,
      "grad_norm": 0.8216005535931804,
      "learning_rate": 4.9631268718172205e-05,
      "loss": 2.0478,
      "num_input_tokens_seen": 4946401008,
      "step": 6287
    },
    {
      "epoch": 0.6670910248249523,
      "grad_norm": 0.7071457267006872,
      "learning_rate": 4.9631149787808526e-05,
      "loss": 1.9953,
      "num_input_tokens_seen": 4947187712,
      "step": 6288
    },
    {
      "epoch": 0.6671971143645237,
      "grad_norm": 1.137062059160919,
      "learning_rate": 4.963103083841063e-05,
      "loss": 1.9091,
      "num_input_tokens_seen": 4947974560,
      "step": 6289
    },
    {
      "epoch": 0.667303203904095,
      "grad_norm": 0.8829794858688943,
      "learning_rate": 4.963091186997858e-05,
      "loss": 2.0507,
      "num_input_tokens_seen": 4948761296,
      "step": 6290
    },
    {
      "epoch": 0.6674092934436665,
      "grad_norm": 2.3444060662014037,
      "learning_rate": 4.963079288251249e-05,
      "loss": 2.0274,
      "num_input_tokens_seen": 4949548000,
      "step": 6291
    },
    {
      "epoch": 0.6675153829832379,
      "grad_norm": 0.9422150069778329,
      "learning_rate": 4.963067387601244e-05,
      "loss": 2.0216,
      "num_input_tokens_seen": 4950334800,
      "step": 6292
    },
    {
      "epoch": 0.6676214725228092,
      "grad_norm": 0.9235424670146439,
      "learning_rate": 4.963055485047854e-05,
      "loss": 2.0144,
      "num_input_tokens_seen": 4951121536,
      "step": 6293
    },
    {
      "epoch": 0.6677275620623806,
      "grad_norm": 0.7319203869795395,
      "learning_rate": 4.963043580591087e-05,
      "loss": 2.0426,
      "num_input_tokens_seen": 4951908304,
      "step": 6294
    },
    {
      "epoch": 0.6678336516019521,
      "grad_norm": 1.0366993111511995,
      "learning_rate": 4.9630316742309516e-05,
      "loss": 1.9785,
      "num_input_tokens_seen": 4952695056,
      "step": 6295
    },
    {
      "epoch": 0.6679397411415234,
      "grad_norm": 0.6151769787924467,
      "learning_rate": 4.963019765967457e-05,
      "loss": 1.9523,
      "num_input_tokens_seen": 4953481728,
      "step": 6296
    },
    {
      "epoch": 0.6680458306810948,
      "grad_norm": 1.3606891842827005,
      "learning_rate": 4.963007855800615e-05,
      "loss": 2.0792,
      "num_input_tokens_seen": 4954268512,
      "step": 6297
    },
    {
      "epoch": 0.6681519202206663,
      "grad_norm": 0.5684245018095812,
      "learning_rate": 4.9629959437304305e-05,
      "loss": 1.8876,
      "num_input_tokens_seen": 4955055264,
      "step": 6298
    },
    {
      "epoch": 0.6682580097602376,
      "grad_norm": 0.9185848536607627,
      "learning_rate": 4.962984029756916e-05,
      "loss": 1.9572,
      "num_input_tokens_seen": 4955842000,
      "step": 6299
    },
    {
      "epoch": 0.668364099299809,
      "grad_norm": 0.6172948621663433,
      "learning_rate": 4.9629721138800796e-05,
      "loss": 2.0444,
      "num_input_tokens_seen": 4956628704,
      "step": 6300
    },
    {
      "epoch": 0.6684701888393805,
      "grad_norm": 0.8442082168420385,
      "learning_rate": 4.9629601960999305e-05,
      "loss": 1.9217,
      "num_input_tokens_seen": 4957415504,
      "step": 6301
    },
    {
      "epoch": 0.6685762783789518,
      "grad_norm": 0.6030750232234168,
      "learning_rate": 4.962948276416478e-05,
      "loss": 2.0969,
      "num_input_tokens_seen": 4958202176,
      "step": 6302
    },
    {
      "epoch": 0.6686823679185232,
      "grad_norm": 0.6724566386080906,
      "learning_rate": 4.962936354829732e-05,
      "loss": 1.9837,
      "num_input_tokens_seen": 4958988912,
      "step": 6303
    },
    {
      "epoch": 0.6687884574580947,
      "grad_norm": 0.6397791542327895,
      "learning_rate": 4.9629244313397e-05,
      "loss": 1.9766,
      "num_input_tokens_seen": 4959775648,
      "step": 6304
    },
    {
      "epoch": 0.668894546997666,
      "grad_norm": 0.8929582618700136,
      "learning_rate": 4.962912505946393e-05,
      "loss": 1.9962,
      "num_input_tokens_seen": 4960562432,
      "step": 6305
    },
    {
      "epoch": 0.6690006365372374,
      "grad_norm": 0.8411849075862661,
      "learning_rate": 4.9629005786498195e-05,
      "loss": 2.0561,
      "num_input_tokens_seen": 4961349168,
      "step": 6306
    },
    {
      "epoch": 0.6691067260768089,
      "grad_norm": 0.7070951553011672,
      "learning_rate": 4.9628886494499885e-05,
      "loss": 1.9517,
      "num_input_tokens_seen": 4962135952,
      "step": 6307
    },
    {
      "epoch": 0.6692128156163802,
      "grad_norm": 0.8532405027060714,
      "learning_rate": 4.9628767183469096e-05,
      "loss": 2.0866,
      "num_input_tokens_seen": 4962922592,
      "step": 6308
    },
    {
      "epoch": 0.6693189051559516,
      "grad_norm": 0.8875308481189526,
      "learning_rate": 4.962864785340591e-05,
      "loss": 2.0628,
      "num_input_tokens_seen": 4963709392,
      "step": 6309
    },
    {
      "epoch": 0.669424994695523,
      "grad_norm": 1.4044220386593476,
      "learning_rate": 4.962852850431043e-05,
      "loss": 2.0778,
      "num_input_tokens_seen": 4964496160,
      "step": 6310
    },
    {
      "epoch": 0.6695310842350944,
      "grad_norm": 0.9116810895519093,
      "learning_rate": 4.962840913618276e-05,
      "loss": 2.0462,
      "num_input_tokens_seen": 4965282960,
      "step": 6311
    },
    {
      "epoch": 0.6696371737746658,
      "grad_norm": 1.7635411496587934,
      "learning_rate": 4.9628289749022965e-05,
      "loss": 1.9398,
      "num_input_tokens_seen": 4966069824,
      "step": 6312
    },
    {
      "epoch": 0.6697432633142372,
      "grad_norm": 1.1892008489998296,
      "learning_rate": 4.9628170342831156e-05,
      "loss": 1.9339,
      "num_input_tokens_seen": 4966856528,
      "step": 6313
    },
    {
      "epoch": 0.6698493528538086,
      "grad_norm": 1.25317138153795,
      "learning_rate": 4.962805091760742e-05,
      "loss": 2.0745,
      "num_input_tokens_seen": 4967643216,
      "step": 6314
    },
    {
      "epoch": 0.66995544239338,
      "grad_norm": 1.437609672276645,
      "learning_rate": 4.962793147335184e-05,
      "loss": 2.0023,
      "num_input_tokens_seen": 4968429888,
      "step": 6315
    },
    {
      "epoch": 0.6700615319329514,
      "grad_norm": 0.7554822746767635,
      "learning_rate": 4.9627812010064526e-05,
      "loss": 1.9962,
      "num_input_tokens_seen": 4969216688,
      "step": 6316
    },
    {
      "epoch": 0.6701676214725228,
      "grad_norm": 1.209562653250768,
      "learning_rate": 4.9627692527745556e-05,
      "loss": 1.8045,
      "num_input_tokens_seen": 4970003376,
      "step": 6317
    },
    {
      "epoch": 0.6702737110120942,
      "grad_norm": 0.9421732606034258,
      "learning_rate": 4.962757302639503e-05,
      "loss": 2.1284,
      "num_input_tokens_seen": 4970790032,
      "step": 6318
    },
    {
      "epoch": 0.6703798005516656,
      "grad_norm": 0.8227149970287452,
      "learning_rate": 4.962745350601304e-05,
      "loss": 2.0084,
      "num_input_tokens_seen": 4971576832,
      "step": 6319
    },
    {
      "epoch": 0.670485890091237,
      "grad_norm": 1.213737479496655,
      "learning_rate": 4.962733396659967e-05,
      "loss": 2.0242,
      "num_input_tokens_seen": 4972363712,
      "step": 6320
    },
    {
      "epoch": 0.6705919796308084,
      "grad_norm": 0.6045366535312208,
      "learning_rate": 4.962721440815503e-05,
      "loss": 2.0286,
      "num_input_tokens_seen": 4973150432,
      "step": 6321
    },
    {
      "epoch": 0.6706980691703798,
      "grad_norm": 0.8350417151718147,
      "learning_rate": 4.9627094830679196e-05,
      "loss": 1.9729,
      "num_input_tokens_seen": 4973937184,
      "step": 6322
    },
    {
      "epoch": 0.6708041587099512,
      "grad_norm": 0.6399451863016852,
      "learning_rate": 4.962697523417226e-05,
      "loss": 1.9182,
      "num_input_tokens_seen": 4974723888,
      "step": 6323
    },
    {
      "epoch": 0.6709102482495226,
      "grad_norm": 0.7628347384296507,
      "learning_rate": 4.962685561863433e-05,
      "loss": 2.0133,
      "num_input_tokens_seen": 4975510688,
      "step": 6324
    },
    {
      "epoch": 0.671016337789094,
      "grad_norm": 0.840915265381188,
      "learning_rate": 4.962673598406548e-05,
      "loss": 1.8835,
      "num_input_tokens_seen": 4976297472,
      "step": 6325
    },
    {
      "epoch": 0.6711224273286653,
      "grad_norm": 0.6443027783552249,
      "learning_rate": 4.962661633046581e-05,
      "loss": 2.0014,
      "num_input_tokens_seen": 4977084112,
      "step": 6326
    },
    {
      "epoch": 0.6712285168682368,
      "grad_norm": 1.0040037850502357,
      "learning_rate": 4.9626496657835425e-05,
      "loss": 1.98,
      "num_input_tokens_seen": 4977870896,
      "step": 6327
    },
    {
      "epoch": 0.6713346064078082,
      "grad_norm": 1.0046801440933262,
      "learning_rate": 4.96263769661744e-05,
      "loss": 1.9846,
      "num_input_tokens_seen": 4978657600,
      "step": 6328
    },
    {
      "epoch": 0.6714406959473795,
      "grad_norm": 1.7260878742861234,
      "learning_rate": 4.9626257255482835e-05,
      "loss": 2.0124,
      "num_input_tokens_seen": 4979444304,
      "step": 6329
    },
    {
      "epoch": 0.671546785486951,
      "grad_norm": 1.327399515056082,
      "learning_rate": 4.962613752576082e-05,
      "loss": 2.1192,
      "num_input_tokens_seen": 4980231040,
      "step": 6330
    },
    {
      "epoch": 0.6716528750265224,
      "grad_norm": 0.9766078762728648,
      "learning_rate": 4.962601777700844e-05,
      "loss": 1.9595,
      "num_input_tokens_seen": 4981017776,
      "step": 6331
    },
    {
      "epoch": 0.6717589645660937,
      "grad_norm": 0.7991495361012507,
      "learning_rate": 4.9625898009225805e-05,
      "loss": 1.7176,
      "num_input_tokens_seen": 4981804544,
      "step": 6332
    },
    {
      "epoch": 0.6718650541056652,
      "grad_norm": 0.8654573718518334,
      "learning_rate": 4.9625778222413e-05,
      "loss": 2.1121,
      "num_input_tokens_seen": 4982591200,
      "step": 6333
    },
    {
      "epoch": 0.6719711436452366,
      "grad_norm": 1.0218668843019978,
      "learning_rate": 4.9625658416570106e-05,
      "loss": 2.0226,
      "num_input_tokens_seen": 4983377968,
      "step": 6334
    },
    {
      "epoch": 0.6720772331848079,
      "grad_norm": 1.039031253574157,
      "learning_rate": 4.9625538591697235e-05,
      "loss": 2.0946,
      "num_input_tokens_seen": 4984164688,
      "step": 6335
    },
    {
      "epoch": 0.6721833227243794,
      "grad_norm": 0.6966597778655721,
      "learning_rate": 4.962541874779447e-05,
      "loss": 2.0423,
      "num_input_tokens_seen": 4984951392,
      "step": 6336
    },
    {
      "epoch": 0.6722894122639508,
      "grad_norm": 0.603985657925683,
      "learning_rate": 4.96252988848619e-05,
      "loss": 1.8794,
      "num_input_tokens_seen": 4985738144,
      "step": 6337
    },
    {
      "epoch": 0.6723955018035221,
      "grad_norm": 0.5858222966830439,
      "learning_rate": 4.962517900289963e-05,
      "loss": 1.9145,
      "num_input_tokens_seen": 4986524944,
      "step": 6338
    },
    {
      "epoch": 0.6725015913430936,
      "grad_norm": 0.6322631044847178,
      "learning_rate": 4.9625059101907735e-05,
      "loss": 1.9757,
      "num_input_tokens_seen": 4987311648,
      "step": 6339
    },
    {
      "epoch": 0.672607680882665,
      "grad_norm": 0.43667529438362274,
      "learning_rate": 4.962493918188632e-05,
      "loss": 1.8889,
      "num_input_tokens_seen": 4988098480,
      "step": 6340
    },
    {
      "epoch": 0.6727137704222363,
      "grad_norm": 0.6844193396753356,
      "learning_rate": 4.9624819242835474e-05,
      "loss": 1.9141,
      "num_input_tokens_seen": 4988885248,
      "step": 6341
    },
    {
      "epoch": 0.6728198599618078,
      "grad_norm": 0.5529068254763652,
      "learning_rate": 4.962469928475529e-05,
      "loss": 1.9401,
      "num_input_tokens_seen": 4989671952,
      "step": 6342
    },
    {
      "epoch": 0.6729259495013792,
      "grad_norm": 0.582939186572066,
      "learning_rate": 4.962457930764586e-05,
      "loss": 1.8442,
      "num_input_tokens_seen": 4990458800,
      "step": 6343
    },
    {
      "epoch": 0.6730320390409505,
      "grad_norm": 0.6723786559070325,
      "learning_rate": 4.9624459311507276e-05,
      "loss": 1.9219,
      "num_input_tokens_seen": 4991245616,
      "step": 6344
    },
    {
      "epoch": 0.6731381285805219,
      "grad_norm": 0.9208571602673806,
      "learning_rate": 4.962433929633964e-05,
      "loss": 1.9814,
      "num_input_tokens_seen": 4992032336,
      "step": 6345
    },
    {
      "epoch": 0.6732442181200934,
      "grad_norm": 0.6645721452217335,
      "learning_rate": 4.9624219262143026e-05,
      "loss": 1.9855,
      "num_input_tokens_seen": 4992819120,
      "step": 6346
    },
    {
      "epoch": 0.6733503076596647,
      "grad_norm": 0.9427737933330871,
      "learning_rate": 4.962409920891755e-05,
      "loss": 1.9321,
      "num_input_tokens_seen": 4993605792,
      "step": 6347
    },
    {
      "epoch": 0.6734563971992361,
      "grad_norm": 0.5351264660447368,
      "learning_rate": 4.9623979136663285e-05,
      "loss": 1.9534,
      "num_input_tokens_seen": 4994392560,
      "step": 6348
    },
    {
      "epoch": 0.6735624867388076,
      "grad_norm": 0.9114125882980205,
      "learning_rate": 4.962385904538033e-05,
      "loss": 2.1362,
      "num_input_tokens_seen": 4995179312,
      "step": 6349
    },
    {
      "epoch": 0.673668576278379,
      "grad_norm": 0.47777782929848495,
      "learning_rate": 4.962373893506879e-05,
      "loss": 1.8989,
      "num_input_tokens_seen": 4995966064,
      "step": 6350
    },
    {
      "epoch": 0.6737746658179503,
      "grad_norm": 0.8868988985757424,
      "learning_rate": 4.9623618805728734e-05,
      "loss": 1.9171,
      "num_input_tokens_seen": 4996752832,
      "step": 6351
    },
    {
      "epoch": 0.6738807553575218,
      "grad_norm": 0.5731809478715424,
      "learning_rate": 4.962349865736027e-05,
      "loss": 2.0991,
      "num_input_tokens_seen": 4997539568,
      "step": 6352
    },
    {
      "epoch": 0.6739868448970932,
      "grad_norm": 0.6132951443020942,
      "learning_rate": 4.9623378489963494e-05,
      "loss": 1.8883,
      "num_input_tokens_seen": 4998326304,
      "step": 6353
    },
    {
      "epoch": 0.6740929344366645,
      "grad_norm": 0.5854059534727653,
      "learning_rate": 4.962325830353849e-05,
      "loss": 2.0314,
      "num_input_tokens_seen": 4999113056,
      "step": 6354
    },
    {
      "epoch": 0.674199023976236,
      "grad_norm": 0.662698748636107,
      "learning_rate": 4.9623138098085365e-05,
      "loss": 2.0068,
      "num_input_tokens_seen": 4999899856,
      "step": 6355
    },
    {
      "epoch": 0.6743051135158074,
      "grad_norm": 0.5138939701112697,
      "learning_rate": 4.962301787360419e-05,
      "loss": 2.1189,
      "num_input_tokens_seen": 5000686656,
      "step": 6356
    },
    {
      "epoch": 0.6744112030553787,
      "grad_norm": 0.5237723206832671,
      "learning_rate": 4.9622897630095064e-05,
      "loss": 2.0338,
      "num_input_tokens_seen": 5001473440,
      "step": 6357
    },
    {
      "epoch": 0.6745172925949502,
      "grad_norm": 0.5739985663422849,
      "learning_rate": 4.96227773675581e-05,
      "loss": 2.0251,
      "num_input_tokens_seen": 5002260208,
      "step": 6358
    },
    {
      "epoch": 0.6746233821345216,
      "grad_norm": 0.4405851594098384,
      "learning_rate": 4.962265708599337e-05,
      "loss": 2.065,
      "num_input_tokens_seen": 5003046896,
      "step": 6359
    },
    {
      "epoch": 0.6747294716740929,
      "grad_norm": 0.6441463232672948,
      "learning_rate": 4.962253678540097e-05,
      "loss": 1.9219,
      "num_input_tokens_seen": 5003833712,
      "step": 6360
    },
    {
      "epoch": 0.6748355612136643,
      "grad_norm": 0.44501263616418607,
      "learning_rate": 4.9622416465781e-05,
      "loss": 2.0042,
      "num_input_tokens_seen": 5004620512,
      "step": 6361
    },
    {
      "epoch": 0.6749416507532358,
      "grad_norm": 0.6413133736468456,
      "learning_rate": 4.962229612713355e-05,
      "loss": 2.0448,
      "num_input_tokens_seen": 5005407216,
      "step": 6362
    },
    {
      "epoch": 0.6750477402928071,
      "grad_norm": 0.5759104911572385,
      "learning_rate": 4.962217576945871e-05,
      "loss": 1.958,
      "num_input_tokens_seen": 5006194064,
      "step": 6363
    },
    {
      "epoch": 0.6751538298323785,
      "grad_norm": 0.6620791984866325,
      "learning_rate": 4.962205539275657e-05,
      "loss": 2.0839,
      "num_input_tokens_seen": 5006980784,
      "step": 6364
    },
    {
      "epoch": 0.67525991937195,
      "grad_norm": 0.5994423248997566,
      "learning_rate": 4.962193499702723e-05,
      "loss": 2.0934,
      "num_input_tokens_seen": 5007767584,
      "step": 6365
    },
    {
      "epoch": 0.6753660089115213,
      "grad_norm": 1.373773313553724,
      "learning_rate": 4.962181458227079e-05,
      "loss": 1.9512,
      "num_input_tokens_seen": 5008554384,
      "step": 6366
    },
    {
      "epoch": 0.6754720984510927,
      "grad_norm": 1.5325825060072595,
      "learning_rate": 4.9621694148487325e-05,
      "loss": 1.9438,
      "num_input_tokens_seen": 5009341136,
      "step": 6367
    },
    {
      "epoch": 0.6755781879906642,
      "grad_norm": 1.0009190630155231,
      "learning_rate": 4.962157369567694e-05,
      "loss": 2.0393,
      "num_input_tokens_seen": 5010127856,
      "step": 6368
    },
    {
      "epoch": 0.6756842775302355,
      "grad_norm": 0.7779703268277639,
      "learning_rate": 4.962145322383972e-05,
      "loss": 1.9055,
      "num_input_tokens_seen": 5010914592,
      "step": 6369
    },
    {
      "epoch": 0.6757903670698069,
      "grad_norm": 0.8679627413703211,
      "learning_rate": 4.962133273297577e-05,
      "loss": 1.9659,
      "num_input_tokens_seen": 5011701456,
      "step": 6370
    },
    {
      "epoch": 0.6758964566093784,
      "grad_norm": 0.4769147348746832,
      "learning_rate": 4.962121222308518e-05,
      "loss": 1.8934,
      "num_input_tokens_seen": 5012488192,
      "step": 6371
    },
    {
      "epoch": 0.6760025461489497,
      "grad_norm": 0.6267184082849399,
      "learning_rate": 4.962109169416803e-05,
      "loss": 1.8661,
      "num_input_tokens_seen": 5013274864,
      "step": 6372
    },
    {
      "epoch": 0.6761086356885211,
      "grad_norm": 0.499929659022494,
      "learning_rate": 4.962097114622443e-05,
      "loss": 1.8464,
      "num_input_tokens_seen": 5014061728,
      "step": 6373
    },
    {
      "epoch": 0.6762147252280926,
      "grad_norm": 0.4946867450850746,
      "learning_rate": 4.9620850579254466e-05,
      "loss": 1.9621,
      "num_input_tokens_seen": 5014848448,
      "step": 6374
    },
    {
      "epoch": 0.6763208147676639,
      "grad_norm": 0.4719039787353158,
      "learning_rate": 4.962072999325823e-05,
      "loss": 2.0078,
      "num_input_tokens_seen": 5015635232,
      "step": 6375
    },
    {
      "epoch": 0.6764269043072353,
      "grad_norm": 0.4616993431953645,
      "learning_rate": 4.962060938823581e-05,
      "loss": 1.994,
      "num_input_tokens_seen": 5016421872,
      "step": 6376
    },
    {
      "epoch": 0.6765329938468067,
      "grad_norm": 0.576506357173851,
      "learning_rate": 4.962048876418731e-05,
      "loss": 2.0319,
      "num_input_tokens_seen": 5017208640,
      "step": 6377
    },
    {
      "epoch": 0.6766390833863781,
      "grad_norm": 0.4523590446083195,
      "learning_rate": 4.962036812111282e-05,
      "loss": 2.0092,
      "num_input_tokens_seen": 5017995392,
      "step": 6378
    },
    {
      "epoch": 0.6767451729259495,
      "grad_norm": 0.7866451494809454,
      "learning_rate": 4.962024745901243e-05,
      "loss": 2.0211,
      "num_input_tokens_seen": 5018782176,
      "step": 6379
    },
    {
      "epoch": 0.6768512624655209,
      "grad_norm": 0.6601409663873501,
      "learning_rate": 4.962012677788623e-05,
      "loss": 1.8063,
      "num_input_tokens_seen": 5019568880,
      "step": 6380
    },
    {
      "epoch": 0.6769573520050923,
      "grad_norm": 0.6941088500747867,
      "learning_rate": 4.9620006077734334e-05,
      "loss": 1.9923,
      "num_input_tokens_seen": 5020355600,
      "step": 6381
    },
    {
      "epoch": 0.6770634415446637,
      "grad_norm": 1.4280919816131805,
      "learning_rate": 4.961988535855681e-05,
      "loss": 1.9561,
      "num_input_tokens_seen": 5021142432,
      "step": 6382
    },
    {
      "epoch": 0.677169531084235,
      "grad_norm": 0.6574280543024128,
      "learning_rate": 4.961976462035376e-05,
      "loss": 1.9815,
      "num_input_tokens_seen": 5021929216,
      "step": 6383
    },
    {
      "epoch": 0.6772756206238065,
      "grad_norm": 0.8750162146502333,
      "learning_rate": 4.961964386312528e-05,
      "loss": 1.8071,
      "num_input_tokens_seen": 5022716000,
      "step": 6384
    },
    {
      "epoch": 0.6773817101633779,
      "grad_norm": 0.8122334754230783,
      "learning_rate": 4.961952308687145e-05,
      "loss": 2.0959,
      "num_input_tokens_seen": 5023502752,
      "step": 6385
    },
    {
      "epoch": 0.6774877997029493,
      "grad_norm": 0.741198741245678,
      "learning_rate": 4.96194022915924e-05,
      "loss": 2.1861,
      "num_input_tokens_seen": 5024289520,
      "step": 6386
    },
    {
      "epoch": 0.6775938892425207,
      "grad_norm": 0.517019911942155,
      "learning_rate": 4.961928147728818e-05,
      "loss": 1.9326,
      "num_input_tokens_seen": 5025076208,
      "step": 6387
    },
    {
      "epoch": 0.6776999787820921,
      "grad_norm": 0.5066648636274743,
      "learning_rate": 4.9619160643958904e-05,
      "loss": 2.0782,
      "num_input_tokens_seen": 5025862976,
      "step": 6388
    },
    {
      "epoch": 0.6778060683216635,
      "grad_norm": 0.3959953716596946,
      "learning_rate": 4.9619039791604663e-05,
      "loss": 1.8482,
      "num_input_tokens_seen": 5026649744,
      "step": 6389
    },
    {
      "epoch": 0.6779121578612349,
      "grad_norm": 0.5418206910092288,
      "learning_rate": 4.9618918920225555e-05,
      "loss": 1.8437,
      "num_input_tokens_seen": 5027436592,
      "step": 6390
    },
    {
      "epoch": 0.6780182474008063,
      "grad_norm": 0.3934072238421781,
      "learning_rate": 4.9618798029821666e-05,
      "loss": 1.8104,
      "num_input_tokens_seen": 5028223328,
      "step": 6391
    },
    {
      "epoch": 0.6781243369403777,
      "grad_norm": 0.4863334139935372,
      "learning_rate": 4.961867712039309e-05,
      "loss": 1.9642,
      "num_input_tokens_seen": 5029010144,
      "step": 6392
    },
    {
      "epoch": 0.678230426479949,
      "grad_norm": 0.5110512041943197,
      "learning_rate": 4.961855619193992e-05,
      "loss": 1.9639,
      "num_input_tokens_seen": 5029796944,
      "step": 6393
    },
    {
      "epoch": 0.6783365160195205,
      "grad_norm": 0.6101730154677545,
      "learning_rate": 4.961843524446227e-05,
      "loss": 1.9638,
      "num_input_tokens_seen": 5030583696,
      "step": 6394
    },
    {
      "epoch": 0.6784426055590919,
      "grad_norm": 0.6172724924291053,
      "learning_rate": 4.96183142779602e-05,
      "loss": 2.0245,
      "num_input_tokens_seen": 5031370384,
      "step": 6395
    },
    {
      "epoch": 0.6785486950986632,
      "grad_norm": 0.8082031582029231,
      "learning_rate": 4.961819329243382e-05,
      "loss": 2.0613,
      "num_input_tokens_seen": 5032157136,
      "step": 6396
    },
    {
      "epoch": 0.6786547846382347,
      "grad_norm": 0.5890594461859882,
      "learning_rate": 4.9618072287883224e-05,
      "loss": 1.8819,
      "num_input_tokens_seen": 5032943840,
      "step": 6397
    },
    {
      "epoch": 0.6787608741778061,
      "grad_norm": 0.6799190590206297,
      "learning_rate": 4.9617951264308504e-05,
      "loss": 2.0206,
      "num_input_tokens_seen": 5033730512,
      "step": 6398
    },
    {
      "epoch": 0.6788669637173774,
      "grad_norm": 0.4732266137646246,
      "learning_rate": 4.9617830221709756e-05,
      "loss": 1.8999,
      "num_input_tokens_seen": 5034517296,
      "step": 6399
    },
    {
      "epoch": 0.6789730532569489,
      "grad_norm": 0.7011244266587825,
      "learning_rate": 4.961770916008707e-05,
      "loss": 2.0566,
      "num_input_tokens_seen": 5035304064,
      "step": 6400
    },
    {
      "epoch": 0.6790791427965203,
      "grad_norm": 0.45770837003526804,
      "learning_rate": 4.9617588079440535e-05,
      "loss": 1.9373,
      "num_input_tokens_seen": 5036090800,
      "step": 6401
    },
    {
      "epoch": 0.6791852323360916,
      "grad_norm": 0.6123669913196648,
      "learning_rate": 4.961746697977026e-05,
      "loss": 1.8657,
      "num_input_tokens_seen": 5036877584,
      "step": 6402
    },
    {
      "epoch": 0.6792913218756631,
      "grad_norm": 0.5306457074833699,
      "learning_rate": 4.9617345861076326e-05,
      "loss": 2.0642,
      "num_input_tokens_seen": 5037664320,
      "step": 6403
    },
    {
      "epoch": 0.6793974114152345,
      "grad_norm": 0.44772960581078924,
      "learning_rate": 4.961722472335882e-05,
      "loss": 1.9055,
      "num_input_tokens_seen": 5038451104,
      "step": 6404
    },
    {
      "epoch": 0.6795035009548058,
      "grad_norm": 0.6192399035473547,
      "learning_rate": 4.9617103566617856e-05,
      "loss": 1.8883,
      "num_input_tokens_seen": 5039237888,
      "step": 6405
    },
    {
      "epoch": 0.6796095904943773,
      "grad_norm": 0.48503325966098365,
      "learning_rate": 4.9616982390853515e-05,
      "loss": 2.0142,
      "num_input_tokens_seen": 5040024688,
      "step": 6406
    },
    {
      "epoch": 0.6797156800339487,
      "grad_norm": 0.5979480186897345,
      "learning_rate": 4.961686119606589e-05,
      "loss": 2.1047,
      "num_input_tokens_seen": 5040811472,
      "step": 6407
    },
    {
      "epoch": 0.67982176957352,
      "grad_norm": 0.5004065484838486,
      "learning_rate": 4.961673998225508e-05,
      "loss": 1.9394,
      "num_input_tokens_seen": 5041598208,
      "step": 6408
    },
    {
      "epoch": 0.6799278591130915,
      "grad_norm": 0.5429216526606218,
      "learning_rate": 4.961661874942117e-05,
      "loss": 1.9002,
      "num_input_tokens_seen": 5042385088,
      "step": 6409
    },
    {
      "epoch": 0.6800339486526629,
      "grad_norm": 0.5918429578242785,
      "learning_rate": 4.9616497497564263e-05,
      "loss": 2.18,
      "num_input_tokens_seen": 5043171824,
      "step": 6410
    },
    {
      "epoch": 0.6801400381922342,
      "grad_norm": 0.4811525148411802,
      "learning_rate": 4.9616376226684444e-05,
      "loss": 1.9988,
      "num_input_tokens_seen": 5043958656,
      "step": 6411
    },
    {
      "epoch": 0.6802461277318056,
      "grad_norm": 0.8160143962251731,
      "learning_rate": 4.961625493678182e-05,
      "loss": 2.0806,
      "num_input_tokens_seen": 5044745408,
      "step": 6412
    },
    {
      "epoch": 0.6803522172713771,
      "grad_norm": 0.5817197080850417,
      "learning_rate": 4.961613362785647e-05,
      "loss": 1.996,
      "num_input_tokens_seen": 5045532080,
      "step": 6413
    },
    {
      "epoch": 0.6804583068109484,
      "grad_norm": 0.7470293118474751,
      "learning_rate": 4.96160122999085e-05,
      "loss": 1.9963,
      "num_input_tokens_seen": 5046318928,
      "step": 6414
    },
    {
      "epoch": 0.6805643963505198,
      "grad_norm": 0.7483717762204731,
      "learning_rate": 4.961589095293799e-05,
      "loss": 1.9797,
      "num_input_tokens_seen": 5047105664,
      "step": 6415
    },
    {
      "epoch": 0.6806704858900913,
      "grad_norm": 0.4992896729378789,
      "learning_rate": 4.961576958694505e-05,
      "loss": 1.8933,
      "num_input_tokens_seen": 5047892496,
      "step": 6416
    },
    {
      "epoch": 0.6807765754296626,
      "grad_norm": 0.6192060843801199,
      "learning_rate": 4.9615648201929766e-05,
      "loss": 1.8498,
      "num_input_tokens_seen": 5048679200,
      "step": 6417
    },
    {
      "epoch": 0.680882664969234,
      "grad_norm": 0.48655878288549603,
      "learning_rate": 4.961552679789222e-05,
      "loss": 2.1047,
      "num_input_tokens_seen": 5049465920,
      "step": 6418
    },
    {
      "epoch": 0.6809887545088055,
      "grad_norm": 0.7351527331198918,
      "learning_rate": 4.961540537483252e-05,
      "loss": 2.001,
      "num_input_tokens_seen": 5050252672,
      "step": 6419
    },
    {
      "epoch": 0.6810948440483768,
      "grad_norm": 0.4091363529642284,
      "learning_rate": 4.961528393275077e-05,
      "loss": 1.9779,
      "num_input_tokens_seen": 5051039472,
      "step": 6420
    },
    {
      "epoch": 0.6812009335879482,
      "grad_norm": 0.9782929888044081,
      "learning_rate": 4.961516247164704e-05,
      "loss": 2.0055,
      "num_input_tokens_seen": 5051826272,
      "step": 6421
    },
    {
      "epoch": 0.6813070231275197,
      "grad_norm": 0.8480094371678858,
      "learning_rate": 4.961504099152144e-05,
      "loss": 1.9789,
      "num_input_tokens_seen": 5052612976,
      "step": 6422
    },
    {
      "epoch": 0.681413112667091,
      "grad_norm": 0.5191122955087252,
      "learning_rate": 4.9614919492374056e-05,
      "loss": 1.9508,
      "num_input_tokens_seen": 5053399776,
      "step": 6423
    },
    {
      "epoch": 0.6815192022066624,
      "grad_norm": 0.6410746312633494,
      "learning_rate": 4.9614797974204986e-05,
      "loss": 1.9815,
      "num_input_tokens_seen": 5054186608,
      "step": 6424
    },
    {
      "epoch": 0.6816252917462339,
      "grad_norm": 0.4059459767979088,
      "learning_rate": 4.9614676437014315e-05,
      "loss": 1.9759,
      "num_input_tokens_seen": 5054973376,
      "step": 6425
    },
    {
      "epoch": 0.6817313812858052,
      "grad_norm": 0.5494577663508992,
      "learning_rate": 4.961455488080216e-05,
      "loss": 1.9538,
      "num_input_tokens_seen": 5055760224,
      "step": 6426
    },
    {
      "epoch": 0.6818374708253766,
      "grad_norm": 0.7064991175973174,
      "learning_rate": 4.961443330556858e-05,
      "loss": 1.9705,
      "num_input_tokens_seen": 5056546976,
      "step": 6427
    },
    {
      "epoch": 0.681943560364948,
      "grad_norm": 0.5189221214939702,
      "learning_rate": 4.96143117113137e-05,
      "loss": 2.0579,
      "num_input_tokens_seen": 5057333632,
      "step": 6428
    },
    {
      "epoch": 0.6820496499045194,
      "grad_norm": 0.5456839495703217,
      "learning_rate": 4.9614190098037595e-05,
      "loss": 1.768,
      "num_input_tokens_seen": 5058120448,
      "step": 6429
    },
    {
      "epoch": 0.6821557394440908,
      "grad_norm": 0.5237500877747131,
      "learning_rate": 4.961406846574037e-05,
      "loss": 1.9357,
      "num_input_tokens_seen": 5058907248,
      "step": 6430
    },
    {
      "epoch": 0.6822618289836622,
      "grad_norm": 0.4634391126822546,
      "learning_rate": 4.961394681442212e-05,
      "loss": 1.8651,
      "num_input_tokens_seen": 5059694112,
      "step": 6431
    },
    {
      "epoch": 0.6823679185232336,
      "grad_norm": 0.4324973180295406,
      "learning_rate": 4.9613825144082924e-05,
      "loss": 2.0354,
      "num_input_tokens_seen": 5060480752,
      "step": 6432
    },
    {
      "epoch": 0.682474008062805,
      "grad_norm": 0.6446773897090787,
      "learning_rate": 4.961370345472289e-05,
      "loss": 2.0913,
      "num_input_tokens_seen": 5061267408,
      "step": 6433
    },
    {
      "epoch": 0.6825800976023764,
      "grad_norm": 0.4124639498568736,
      "learning_rate": 4.961358174634212e-05,
      "loss": 1.8507,
      "num_input_tokens_seen": 5062054176,
      "step": 6434
    },
    {
      "epoch": 0.6826861871419478,
      "grad_norm": 0.6828807818920469,
      "learning_rate": 4.9613460018940686e-05,
      "loss": 2.1287,
      "num_input_tokens_seen": 5062840848,
      "step": 6435
    },
    {
      "epoch": 0.6827922766815192,
      "grad_norm": 0.47139142365721837,
      "learning_rate": 4.961333827251869e-05,
      "loss": 1.7895,
      "num_input_tokens_seen": 5063627696,
      "step": 6436
    },
    {
      "epoch": 0.6828983662210906,
      "grad_norm": 0.7051872089761504,
      "learning_rate": 4.961321650707623e-05,
      "loss": 2.0333,
      "num_input_tokens_seen": 5064414448,
      "step": 6437
    },
    {
      "epoch": 0.683004455760662,
      "grad_norm": 0.462154638743884,
      "learning_rate": 4.9613094722613394e-05,
      "loss": 1.9598,
      "num_input_tokens_seen": 5065201216,
      "step": 6438
    },
    {
      "epoch": 0.6831105453002334,
      "grad_norm": 0.8303053249203921,
      "learning_rate": 4.961297291913029e-05,
      "loss": 1.8131,
      "num_input_tokens_seen": 5065988016,
      "step": 6439
    },
    {
      "epoch": 0.6832166348398048,
      "grad_norm": 0.55681901553861,
      "learning_rate": 4.9612851096627e-05,
      "loss": 2.0676,
      "num_input_tokens_seen": 5066774752,
      "step": 6440
    },
    {
      "epoch": 0.6833227243793762,
      "grad_norm": 0.48041597939739344,
      "learning_rate": 4.9612729255103616e-05,
      "loss": 1.8854,
      "num_input_tokens_seen": 5067561552,
      "step": 6441
    },
    {
      "epoch": 0.6834288139189476,
      "grad_norm": 0.6468575504948888,
      "learning_rate": 4.961260739456024e-05,
      "loss": 2.0563,
      "num_input_tokens_seen": 5068348224,
      "step": 6442
    },
    {
      "epoch": 0.683534903458519,
      "grad_norm": 0.46903267722070197,
      "learning_rate": 4.9612485514996966e-05,
      "loss": 1.9158,
      "num_input_tokens_seen": 5069134976,
      "step": 6443
    },
    {
      "epoch": 0.6836409929980903,
      "grad_norm": 0.8002834992217953,
      "learning_rate": 4.961236361641388e-05,
      "loss": 1.9519,
      "num_input_tokens_seen": 5069921680,
      "step": 6444
    },
    {
      "epoch": 0.6837470825376618,
      "grad_norm": 0.6315809737724281,
      "learning_rate": 4.961224169881109e-05,
      "loss": 1.9632,
      "num_input_tokens_seen": 5070708368,
      "step": 6445
    },
    {
      "epoch": 0.6838531720772332,
      "grad_norm": 0.563275032740106,
      "learning_rate": 4.961211976218868e-05,
      "loss": 1.844,
      "num_input_tokens_seen": 5071495200,
      "step": 6446
    },
    {
      "epoch": 0.6839592616168045,
      "grad_norm": 0.4521243304377696,
      "learning_rate": 4.961199780654674e-05,
      "loss": 1.8749,
      "num_input_tokens_seen": 5072281904,
      "step": 6447
    },
    {
      "epoch": 0.684065351156376,
      "grad_norm": 0.7342423737489012,
      "learning_rate": 4.9611875831885366e-05,
      "loss": 2.0682,
      "num_input_tokens_seen": 5073068672,
      "step": 6448
    },
    {
      "epoch": 0.6841714406959474,
      "grad_norm": 0.5431357696011755,
      "learning_rate": 4.9611753838204665e-05,
      "loss": 2.0073,
      "num_input_tokens_seen": 5073855440,
      "step": 6449
    },
    {
      "epoch": 0.6842775302355187,
      "grad_norm": 0.7048052205800588,
      "learning_rate": 4.961163182550472e-05,
      "loss": 1.9586,
      "num_input_tokens_seen": 5074642144,
      "step": 6450
    },
    {
      "epoch": 0.6843836197750902,
      "grad_norm": 0.49643695768796875,
      "learning_rate": 4.961150979378563e-05,
      "loss": 2.0008,
      "num_input_tokens_seen": 5075428768,
      "step": 6451
    },
    {
      "epoch": 0.6844897093146616,
      "grad_norm": 0.686972559760723,
      "learning_rate": 4.961138774304749e-05,
      "loss": 2.1302,
      "num_input_tokens_seen": 5076215600,
      "step": 6452
    },
    {
      "epoch": 0.6845957988542329,
      "grad_norm": 0.40173592803133584,
      "learning_rate": 4.9611265673290384e-05,
      "loss": 1.7855,
      "num_input_tokens_seen": 5077002416,
      "step": 6453
    },
    {
      "epoch": 0.6847018883938044,
      "grad_norm": 0.5605256359310673,
      "learning_rate": 4.961114358451442e-05,
      "loss": 1.8215,
      "num_input_tokens_seen": 5077789264,
      "step": 6454
    },
    {
      "epoch": 0.6848079779333758,
      "grad_norm": 0.5032029840168767,
      "learning_rate": 4.961102147671969e-05,
      "loss": 1.9113,
      "num_input_tokens_seen": 5078576000,
      "step": 6455
    },
    {
      "epoch": 0.6849140674729471,
      "grad_norm": 0.5224681611253189,
      "learning_rate": 4.9610899349906275e-05,
      "loss": 1.9704,
      "num_input_tokens_seen": 5079362816,
      "step": 6456
    },
    {
      "epoch": 0.6850201570125186,
      "grad_norm": 0.5790262891451993,
      "learning_rate": 4.9610777204074286e-05,
      "loss": 1.9251,
      "num_input_tokens_seen": 5080149600,
      "step": 6457
    },
    {
      "epoch": 0.68512624655209,
      "grad_norm": 0.48219688407547195,
      "learning_rate": 4.9610655039223805e-05,
      "loss": 2.0497,
      "num_input_tokens_seen": 5080936352,
      "step": 6458
    },
    {
      "epoch": 0.6852323360916613,
      "grad_norm": 0.5204180111837842,
      "learning_rate": 4.9610532855354934e-05,
      "loss": 1.784,
      "num_input_tokens_seen": 5081723200,
      "step": 6459
    },
    {
      "epoch": 0.6853384256312327,
      "grad_norm": 0.4278300523953081,
      "learning_rate": 4.961041065246777e-05,
      "loss": 1.769,
      "num_input_tokens_seen": 5082510000,
      "step": 6460
    },
    {
      "epoch": 0.6854445151708042,
      "grad_norm": 0.6653666869424597,
      "learning_rate": 4.9610288430562394e-05,
      "loss": 2.0019,
      "num_input_tokens_seen": 5083296784,
      "step": 6461
    },
    {
      "epoch": 0.6855506047103755,
      "grad_norm": 0.42282704920285774,
      "learning_rate": 4.9610166189638915e-05,
      "loss": 2.0111,
      "num_input_tokens_seen": 5084083536,
      "step": 6462
    },
    {
      "epoch": 0.6856566942499469,
      "grad_norm": 0.8179622625654346,
      "learning_rate": 4.9610043929697426e-05,
      "loss": 2.1286,
      "num_input_tokens_seen": 5084870288,
      "step": 6463
    },
    {
      "epoch": 0.6857627837895184,
      "grad_norm": 0.42862066178338387,
      "learning_rate": 4.9609921650738013e-05,
      "loss": 1.9244,
      "num_input_tokens_seen": 5085657040,
      "step": 6464
    },
    {
      "epoch": 0.6858688733290897,
      "grad_norm": 0.5397003911644507,
      "learning_rate": 4.960979935276077e-05,
      "loss": 1.896,
      "num_input_tokens_seen": 5086443808,
      "step": 6465
    },
    {
      "epoch": 0.6859749628686611,
      "grad_norm": 0.5508672192135011,
      "learning_rate": 4.96096770357658e-05,
      "loss": 1.6915,
      "num_input_tokens_seen": 5087230704,
      "step": 6466
    },
    {
      "epoch": 0.6860810524082326,
      "grad_norm": 0.45278109088869095,
      "learning_rate": 4.960955469975319e-05,
      "loss": 2.1084,
      "num_input_tokens_seen": 5088017472,
      "step": 6467
    },
    {
      "epoch": 0.686187141947804,
      "grad_norm": 0.510680972782721,
      "learning_rate": 4.9609432344723044e-05,
      "loss": 2.1014,
      "num_input_tokens_seen": 5088804112,
      "step": 6468
    },
    {
      "epoch": 0.6862932314873753,
      "grad_norm": 0.47954569804352337,
      "learning_rate": 4.960930997067545e-05,
      "loss": 2.0425,
      "num_input_tokens_seen": 5089590976,
      "step": 6469
    },
    {
      "epoch": 0.6863993210269468,
      "grad_norm": 0.9806614259876372,
      "learning_rate": 4.96091875776105e-05,
      "loss": 1.9181,
      "num_input_tokens_seen": 5090377744,
      "step": 6470
    },
    {
      "epoch": 0.6865054105665181,
      "grad_norm": 1.1822831099459046,
      "learning_rate": 4.960906516552829e-05,
      "loss": 1.9309,
      "num_input_tokens_seen": 5091164544,
      "step": 6471
    },
    {
      "epoch": 0.6866115001060895,
      "grad_norm": 0.818580749336721,
      "learning_rate": 4.960894273442892e-05,
      "loss": 1.9282,
      "num_input_tokens_seen": 5091951200,
      "step": 6472
    },
    {
      "epoch": 0.686717589645661,
      "grad_norm": 0.5072170632900483,
      "learning_rate": 4.9608820284312484e-05,
      "loss": 1.817,
      "num_input_tokens_seen": 5092737920,
      "step": 6473
    },
    {
      "epoch": 0.6868236791852323,
      "grad_norm": 0.7661302299815445,
      "learning_rate": 4.960869781517907e-05,
      "loss": 1.9922,
      "num_input_tokens_seen": 5093524640,
      "step": 6474
    },
    {
      "epoch": 0.6869297687248037,
      "grad_norm": 0.5308083509580898,
      "learning_rate": 4.9608575327028785e-05,
      "loss": 1.8966,
      "num_input_tokens_seen": 5094311360,
      "step": 6475
    },
    {
      "epoch": 0.6870358582643752,
      "grad_norm": 0.5120265287886248,
      "learning_rate": 4.960845281986171e-05,
      "loss": 1.8632,
      "num_input_tokens_seen": 5095098128,
      "step": 6476
    },
    {
      "epoch": 0.6871419478039466,
      "grad_norm": 0.7020428633488608,
      "learning_rate": 4.960833029367794e-05,
      "loss": 2.1346,
      "num_input_tokens_seen": 5095884768,
      "step": 6477
    },
    {
      "epoch": 0.6872480373435179,
      "grad_norm": 0.47542224761458807,
      "learning_rate": 4.960820774847757e-05,
      "loss": 1.8523,
      "num_input_tokens_seen": 5096671472,
      "step": 6478
    },
    {
      "epoch": 0.6873541268830893,
      "grad_norm": 0.5257701007951564,
      "learning_rate": 4.9608085184260704e-05,
      "loss": 1.9463,
      "num_input_tokens_seen": 5097458288,
      "step": 6479
    },
    {
      "epoch": 0.6874602164226608,
      "grad_norm": 0.6911417029553175,
      "learning_rate": 4.960796260102743e-05,
      "loss": 2.0655,
      "num_input_tokens_seen": 5098244992,
      "step": 6480
    },
    {
      "epoch": 0.6875663059622321,
      "grad_norm": 0.453774542027765,
      "learning_rate": 4.960783999877785e-05,
      "loss": 1.886,
      "num_input_tokens_seen": 5099031728,
      "step": 6481
    },
    {
      "epoch": 0.6876723955018035,
      "grad_norm": 0.5019786119004523,
      "learning_rate": 4.960771737751205e-05,
      "loss": 1.8944,
      "num_input_tokens_seen": 5099818512,
      "step": 6482
    },
    {
      "epoch": 0.687778485041375,
      "grad_norm": 0.5854489667163987,
      "learning_rate": 4.9607594737230134e-05,
      "loss": 1.7914,
      "num_input_tokens_seen": 5100605344,
      "step": 6483
    },
    {
      "epoch": 0.6878845745809463,
      "grad_norm": 0.45862238631389124,
      "learning_rate": 4.960747207793219e-05,
      "loss": 1.7804,
      "num_input_tokens_seen": 5101392208,
      "step": 6484
    },
    {
      "epoch": 0.6879906641205177,
      "grad_norm": 0.5821335763269188,
      "learning_rate": 4.960734939961831e-05,
      "loss": 2.0381,
      "num_input_tokens_seen": 5102178928,
      "step": 6485
    },
    {
      "epoch": 0.6880967536600892,
      "grad_norm": 0.5050940032297794,
      "learning_rate": 4.960722670228859e-05,
      "loss": 2.069,
      "num_input_tokens_seen": 5102965680,
      "step": 6486
    },
    {
      "epoch": 0.6882028431996605,
      "grad_norm": 0.4506944929227078,
      "learning_rate": 4.960710398594313e-05,
      "loss": 1.977,
      "num_input_tokens_seen": 5103752480,
      "step": 6487
    },
    {
      "epoch": 0.6883089327392319,
      "grad_norm": 0.4907291561834087,
      "learning_rate": 4.960698125058202e-05,
      "loss": 1.9177,
      "num_input_tokens_seen": 5104539296,
      "step": 6488
    },
    {
      "epoch": 0.6884150222788034,
      "grad_norm": 0.4398968247269666,
      "learning_rate": 4.960685849620536e-05,
      "loss": 2.0316,
      "num_input_tokens_seen": 5105326048,
      "step": 6489
    },
    {
      "epoch": 0.6885211118183747,
      "grad_norm": 0.4780519936409536,
      "learning_rate": 4.960673572281324e-05,
      "loss": 1.9904,
      "num_input_tokens_seen": 5106112736,
      "step": 6490
    },
    {
      "epoch": 0.6886272013579461,
      "grad_norm": 0.4923148821235083,
      "learning_rate": 4.9606612930405756e-05,
      "loss": 2.1278,
      "num_input_tokens_seen": 5106899472,
      "step": 6491
    },
    {
      "epoch": 0.6887332908975176,
      "grad_norm": 0.47558694904162235,
      "learning_rate": 4.960649011898301e-05,
      "loss": 2.0287,
      "num_input_tokens_seen": 5107686176,
      "step": 6492
    },
    {
      "epoch": 0.6888393804370889,
      "grad_norm": 0.6395895694401832,
      "learning_rate": 4.9606367288545077e-05,
      "loss": 2.0982,
      "num_input_tokens_seen": 5108472976,
      "step": 6493
    },
    {
      "epoch": 0.6889454699766603,
      "grad_norm": 0.3635598318177633,
      "learning_rate": 4.9606244439092074e-05,
      "loss": 1.9221,
      "num_input_tokens_seen": 5109259824,
      "step": 6494
    },
    {
      "epoch": 0.6890515595162316,
      "grad_norm": 0.5374068855203674,
      "learning_rate": 4.9606121570624084e-05,
      "loss": 1.9351,
      "num_input_tokens_seen": 5110046624,
      "step": 6495
    },
    {
      "epoch": 0.6891576490558031,
      "grad_norm": 0.4381293968989503,
      "learning_rate": 4.960599868314121e-05,
      "loss": 1.8733,
      "num_input_tokens_seen": 5110833488,
      "step": 6496
    },
    {
      "epoch": 0.6892637385953745,
      "grad_norm": 0.38772853906001514,
      "learning_rate": 4.960587577664354e-05,
      "loss": 2.051,
      "num_input_tokens_seen": 5111620320,
      "step": 6497
    },
    {
      "epoch": 0.6893698281349459,
      "grad_norm": 0.4497275029467687,
      "learning_rate": 4.960575285113117e-05,
      "loss": 2.1015,
      "num_input_tokens_seen": 5112407056,
      "step": 6498
    },
    {
      "epoch": 0.6894759176745173,
      "grad_norm": 0.3959654581748775,
      "learning_rate": 4.96056299066042e-05,
      "loss": 1.9757,
      "num_input_tokens_seen": 5113193872,
      "step": 6499
    },
    {
      "epoch": 0.6895820072140887,
      "grad_norm": 0.36735445220541246,
      "learning_rate": 4.960550694306272e-05,
      "loss": 1.9121,
      "num_input_tokens_seen": 5113980720,
      "step": 6500
    },
    {
      "epoch": 0.68968809675366,
      "grad_norm": 0.42818825832492174,
      "learning_rate": 4.9605383960506825e-05,
      "loss": 2.0543,
      "num_input_tokens_seen": 5114767536,
      "step": 6501
    },
    {
      "epoch": 0.6897941862932315,
      "grad_norm": 0.41339284779071916,
      "learning_rate": 4.9605260958936606e-05,
      "loss": 1.9918,
      "num_input_tokens_seen": 5115554208,
      "step": 6502
    },
    {
      "epoch": 0.6899002758328029,
      "grad_norm": 0.5190984585236822,
      "learning_rate": 4.960513793835217e-05,
      "loss": 1.9497,
      "num_input_tokens_seen": 5116340976,
      "step": 6503
    },
    {
      "epoch": 0.6900063653723743,
      "grad_norm": 0.5304929494975346,
      "learning_rate": 4.96050148987536e-05,
      "loss": 1.8974,
      "num_input_tokens_seen": 5117127744,
      "step": 6504
    },
    {
      "epoch": 0.6901124549119457,
      "grad_norm": 0.5939011113128545,
      "learning_rate": 4.9604891840141e-05,
      "loss": 2.0587,
      "num_input_tokens_seen": 5117914528,
      "step": 6505
    },
    {
      "epoch": 0.6902185444515171,
      "grad_norm": 0.6469845506785863,
      "learning_rate": 4.9604768762514464e-05,
      "loss": 1.8214,
      "num_input_tokens_seen": 5118701280,
      "step": 6506
    },
    {
      "epoch": 0.6903246339910885,
      "grad_norm": 0.5770072767264823,
      "learning_rate": 4.9604645665874086e-05,
      "loss": 1.8254,
      "num_input_tokens_seen": 5119488112,
      "step": 6507
    },
    {
      "epoch": 0.6904307235306599,
      "grad_norm": 0.8253001904163102,
      "learning_rate": 4.9604522550219954e-05,
      "loss": 2.1522,
      "num_input_tokens_seen": 5120274864,
      "step": 6508
    },
    {
      "epoch": 0.6905368130702313,
      "grad_norm": 0.6512067826590182,
      "learning_rate": 4.9604399415552175e-05,
      "loss": 2.1001,
      "num_input_tokens_seen": 5121061632,
      "step": 6509
    },
    {
      "epoch": 0.6906429026098027,
      "grad_norm": 0.5850823367218431,
      "learning_rate": 4.960427626187083e-05,
      "loss": 2.0667,
      "num_input_tokens_seen": 5121848368,
      "step": 6510
    },
    {
      "epoch": 0.690748992149374,
      "grad_norm": 0.4881545726391369,
      "learning_rate": 4.960415308917602e-05,
      "loss": 1.924,
      "num_input_tokens_seen": 5122635152,
      "step": 6511
    },
    {
      "epoch": 0.6908550816889455,
      "grad_norm": 0.641637034651146,
      "learning_rate": 4.960402989746785e-05,
      "loss": 2.014,
      "num_input_tokens_seen": 5123421920,
      "step": 6512
    },
    {
      "epoch": 0.6909611712285169,
      "grad_norm": 0.4125266716388904,
      "learning_rate": 4.9603906686746407e-05,
      "loss": 2.1052,
      "num_input_tokens_seen": 5124208608,
      "step": 6513
    },
    {
      "epoch": 0.6910672607680882,
      "grad_norm": 0.6947950026404107,
      "learning_rate": 4.960378345701179e-05,
      "loss": 1.9842,
      "num_input_tokens_seen": 5124995312,
      "step": 6514
    },
    {
      "epoch": 0.6911733503076597,
      "grad_norm": 0.7226680964148969,
      "learning_rate": 4.960366020826408e-05,
      "loss": 2.0254,
      "num_input_tokens_seen": 5125782128,
      "step": 6515
    },
    {
      "epoch": 0.6912794398472311,
      "grad_norm": 0.4024702080906632,
      "learning_rate": 4.960353694050339e-05,
      "loss": 1.8305,
      "num_input_tokens_seen": 5126568896,
      "step": 6516
    },
    {
      "epoch": 0.6913855293868024,
      "grad_norm": 0.5045867718182505,
      "learning_rate": 4.960341365372981e-05,
      "loss": 1.971,
      "num_input_tokens_seen": 5127355536,
      "step": 6517
    },
    {
      "epoch": 0.6914916189263739,
      "grad_norm": 0.43866378554327257,
      "learning_rate": 4.9603290347943434e-05,
      "loss": 2.2684,
      "num_input_tokens_seen": 5128142256,
      "step": 6518
    },
    {
      "epoch": 0.6915977084659453,
      "grad_norm": 0.4837494541585008,
      "learning_rate": 4.960316702314436e-05,
      "loss": 1.926,
      "num_input_tokens_seen": 5128928976,
      "step": 6519
    },
    {
      "epoch": 0.6917037980055166,
      "grad_norm": 0.5000254718146053,
      "learning_rate": 4.960304367933267e-05,
      "loss": 1.835,
      "num_input_tokens_seen": 5129715728,
      "step": 6520
    },
    {
      "epoch": 0.6918098875450881,
      "grad_norm": 0.5766325663480726,
      "learning_rate": 4.9602920316508484e-05,
      "loss": 2.0058,
      "num_input_tokens_seen": 5130502576,
      "step": 6521
    },
    {
      "epoch": 0.6919159770846595,
      "grad_norm": 0.4591338714481135,
      "learning_rate": 4.960279693467187e-05,
      "loss": 1.9846,
      "num_input_tokens_seen": 5131289376,
      "step": 6522
    },
    {
      "epoch": 0.6920220666242308,
      "grad_norm": 0.5965174495218908,
      "learning_rate": 4.960267353382294e-05,
      "loss": 1.8708,
      "num_input_tokens_seen": 5132076176,
      "step": 6523
    },
    {
      "epoch": 0.6921281561638023,
      "grad_norm": 0.49652726534856806,
      "learning_rate": 4.9602550113961786e-05,
      "loss": 2.0251,
      "num_input_tokens_seen": 5132862912,
      "step": 6524
    },
    {
      "epoch": 0.6922342457033737,
      "grad_norm": 0.5284490348569221,
      "learning_rate": 4.960242667508851e-05,
      "loss": 1.9177,
      "num_input_tokens_seen": 5133649632,
      "step": 6525
    },
    {
      "epoch": 0.692340335242945,
      "grad_norm": 0.5555276418036545,
      "learning_rate": 4.9602303217203194e-05,
      "loss": 1.9545,
      "num_input_tokens_seen": 5134436448,
      "step": 6526
    },
    {
      "epoch": 0.6924464247825164,
      "grad_norm": 0.42483856499030076,
      "learning_rate": 4.960217974030594e-05,
      "loss": 1.928,
      "num_input_tokens_seen": 5135223296,
      "step": 6527
    },
    {
      "epoch": 0.6925525143220879,
      "grad_norm": 0.48087839917650543,
      "learning_rate": 4.9602056244396846e-05,
      "loss": 2.0394,
      "num_input_tokens_seen": 5136010048,
      "step": 6528
    },
    {
      "epoch": 0.6926586038616592,
      "grad_norm": 0.40826440475288583,
      "learning_rate": 4.9601932729476e-05,
      "loss": 1.9121,
      "num_input_tokens_seen": 5136796816,
      "step": 6529
    },
    {
      "epoch": 0.6927646934012306,
      "grad_norm": 0.4693698394982988,
      "learning_rate": 4.96018091955435e-05,
      "loss": 2.144,
      "num_input_tokens_seen": 5137583600,
      "step": 6530
    },
    {
      "epoch": 0.6928707829408021,
      "grad_norm": 0.528013936365912,
      "learning_rate": 4.9601685642599454e-05,
      "loss": 2.0558,
      "num_input_tokens_seen": 5138370256,
      "step": 6531
    },
    {
      "epoch": 0.6929768724803734,
      "grad_norm": 0.5117047958410917,
      "learning_rate": 4.960156207064394e-05,
      "loss": 2.061,
      "num_input_tokens_seen": 5139156960,
      "step": 6532
    },
    {
      "epoch": 0.6930829620199448,
      "grad_norm": 0.5317962182047765,
      "learning_rate": 4.960143847967706e-05,
      "loss": 1.876,
      "num_input_tokens_seen": 5139943808,
      "step": 6533
    },
    {
      "epoch": 0.6931890515595163,
      "grad_norm": 0.5820288921142018,
      "learning_rate": 4.9601314869698926e-05,
      "loss": 1.9107,
      "num_input_tokens_seen": 5140730720,
      "step": 6534
    },
    {
      "epoch": 0.6932951410990876,
      "grad_norm": 0.7725691294493873,
      "learning_rate": 4.96011912407096e-05,
      "loss": 1.9677,
      "num_input_tokens_seen": 5141517472,
      "step": 6535
    },
    {
      "epoch": 0.693401230638659,
      "grad_norm": 0.7129991582682199,
      "learning_rate": 4.96010675927092e-05,
      "loss": 1.812,
      "num_input_tokens_seen": 5142304256,
      "step": 6536
    },
    {
      "epoch": 0.6935073201782305,
      "grad_norm": 0.5796177036339846,
      "learning_rate": 4.960094392569782e-05,
      "loss": 1.8862,
      "num_input_tokens_seen": 5143091008,
      "step": 6537
    },
    {
      "epoch": 0.6936134097178018,
      "grad_norm": 0.81036407970632,
      "learning_rate": 4.9600820239675544e-05,
      "loss": 1.9114,
      "num_input_tokens_seen": 5143877840,
      "step": 6538
    },
    {
      "epoch": 0.6937194992573732,
      "grad_norm": 0.6313446016375924,
      "learning_rate": 4.9600696534642483e-05,
      "loss": 2.0641,
      "num_input_tokens_seen": 5144664560,
      "step": 6539
    },
    {
      "epoch": 0.6938255887969447,
      "grad_norm": 0.5068937646633961,
      "learning_rate": 4.9600572810598724e-05,
      "loss": 1.9984,
      "num_input_tokens_seen": 5145451328,
      "step": 6540
    },
    {
      "epoch": 0.693931678336516,
      "grad_norm": 0.5965588250464491,
      "learning_rate": 4.9600449067544367e-05,
      "loss": 1.9806,
      "num_input_tokens_seen": 5146238128,
      "step": 6541
    },
    {
      "epoch": 0.6940377678760874,
      "grad_norm": 0.6988510873926457,
      "learning_rate": 4.96003253054795e-05,
      "loss": 1.9873,
      "num_input_tokens_seen": 5147024864,
      "step": 6542
    },
    {
      "epoch": 0.6941438574156589,
      "grad_norm": 0.4515789612833099,
      "learning_rate": 4.960020152440422e-05,
      "loss": 1.9626,
      "num_input_tokens_seen": 5147811600,
      "step": 6543
    },
    {
      "epoch": 0.6942499469552302,
      "grad_norm": 0.8998116168212675,
      "learning_rate": 4.960007772431863e-05,
      "loss": 1.9806,
      "num_input_tokens_seen": 5148598304,
      "step": 6544
    },
    {
      "epoch": 0.6943560364948016,
      "grad_norm": 0.47770189207103425,
      "learning_rate": 4.959995390522283e-05,
      "loss": 1.9645,
      "num_input_tokens_seen": 5149384944,
      "step": 6545
    },
    {
      "epoch": 0.694462126034373,
      "grad_norm": 0.73603124068517,
      "learning_rate": 4.959983006711689e-05,
      "loss": 2.1079,
      "num_input_tokens_seen": 5150171808,
      "step": 6546
    },
    {
      "epoch": 0.6945682155739444,
      "grad_norm": 0.4655013422501185,
      "learning_rate": 4.9599706210000944e-05,
      "loss": 2.043,
      "num_input_tokens_seen": 5150958480,
      "step": 6547
    },
    {
      "epoch": 0.6946743051135158,
      "grad_norm": 0.5551550253772157,
      "learning_rate": 4.959958233387505e-05,
      "loss": 2.1655,
      "num_input_tokens_seen": 5151745120,
      "step": 6548
    },
    {
      "epoch": 0.6947803946530872,
      "grad_norm": 0.45312469252929066,
      "learning_rate": 4.959945843873933e-05,
      "loss": 2.0055,
      "num_input_tokens_seen": 5152531824,
      "step": 6549
    },
    {
      "epoch": 0.6948864841926586,
      "grad_norm": 0.46622771487173414,
      "learning_rate": 4.959933452459387e-05,
      "loss": 2.0366,
      "num_input_tokens_seen": 5153318512,
      "step": 6550
    },
    {
      "epoch": 0.69499257373223,
      "grad_norm": 0.4655415313809975,
      "learning_rate": 4.959921059143876e-05,
      "loss": 2.0356,
      "num_input_tokens_seen": 5154105248,
      "step": 6551
    },
    {
      "epoch": 0.6950986632718014,
      "grad_norm": 0.5005538535656209,
      "learning_rate": 4.959908663927411e-05,
      "loss": 2.1433,
      "num_input_tokens_seen": 5154892000,
      "step": 6552
    },
    {
      "epoch": 0.6952047528113728,
      "grad_norm": 0.4145913261142565,
      "learning_rate": 4.9598962668099995e-05,
      "loss": 2.1371,
      "num_input_tokens_seen": 5155678832,
      "step": 6553
    },
    {
      "epoch": 0.6953108423509442,
      "grad_norm": 0.4050460071088616,
      "learning_rate": 4.959883867791654e-05,
      "loss": 1.9981,
      "num_input_tokens_seen": 5156465552,
      "step": 6554
    },
    {
      "epoch": 0.6954169318905156,
      "grad_norm": 0.4777899310793674,
      "learning_rate": 4.959871466872381e-05,
      "loss": 2.0571,
      "num_input_tokens_seen": 5157252400,
      "step": 6555
    },
    {
      "epoch": 0.695523021430087,
      "grad_norm": 0.455477403239558,
      "learning_rate": 4.959859064052192e-05,
      "loss": 2.0734,
      "num_input_tokens_seen": 5158039120,
      "step": 6556
    },
    {
      "epoch": 0.6956291109696584,
      "grad_norm": 0.5065024149903898,
      "learning_rate": 4.959846659331096e-05,
      "loss": 2.0163,
      "num_input_tokens_seen": 5158825760,
      "step": 6557
    },
    {
      "epoch": 0.6957352005092298,
      "grad_norm": 0.47745239079160984,
      "learning_rate": 4.959834252709103e-05,
      "loss": 1.9253,
      "num_input_tokens_seen": 5159612496,
      "step": 6558
    },
    {
      "epoch": 0.6958412900488012,
      "grad_norm": 0.4935771835260055,
      "learning_rate": 4.959821844186222e-05,
      "loss": 1.7738,
      "num_input_tokens_seen": 5160399280,
      "step": 6559
    },
    {
      "epoch": 0.6959473795883726,
      "grad_norm": 0.4902183671522554,
      "learning_rate": 4.959809433762463e-05,
      "loss": 1.984,
      "num_input_tokens_seen": 5161186096,
      "step": 6560
    },
    {
      "epoch": 0.696053469127944,
      "grad_norm": 0.41118463663924654,
      "learning_rate": 4.9597970214378353e-05,
      "loss": 2.0477,
      "num_input_tokens_seen": 5161972832,
      "step": 6561
    },
    {
      "epoch": 0.6961595586675153,
      "grad_norm": 0.5316195431271445,
      "learning_rate": 4.959784607212349e-05,
      "loss": 2.0219,
      "num_input_tokens_seen": 5162759568,
      "step": 6562
    },
    {
      "epoch": 0.6962656482070868,
      "grad_norm": 0.5347004799317665,
      "learning_rate": 4.959772191086013e-05,
      "loss": 1.997,
      "num_input_tokens_seen": 5163546336,
      "step": 6563
    },
    {
      "epoch": 0.6963717377466582,
      "grad_norm": 0.5414973164750638,
      "learning_rate": 4.9597597730588366e-05,
      "loss": 2.0569,
      "num_input_tokens_seen": 5164333024,
      "step": 6564
    },
    {
      "epoch": 0.6964778272862295,
      "grad_norm": 0.6978912896768025,
      "learning_rate": 4.9597473531308315e-05,
      "loss": 1.945,
      "num_input_tokens_seen": 5165119760,
      "step": 6565
    },
    {
      "epoch": 0.696583916825801,
      "grad_norm": 0.8401239851755351,
      "learning_rate": 4.9597349313020044e-05,
      "loss": 2.0192,
      "num_input_tokens_seen": 5165906592,
      "step": 6566
    },
    {
      "epoch": 0.6966900063653724,
      "grad_norm": 0.729143718979822,
      "learning_rate": 4.959722507572368e-05,
      "loss": 1.9218,
      "num_input_tokens_seen": 5166693408,
      "step": 6567
    },
    {
      "epoch": 0.6967960959049437,
      "grad_norm": 0.6497194167039786,
      "learning_rate": 4.959710081941929e-05,
      "loss": 2.0263,
      "num_input_tokens_seen": 5167480192,
      "step": 6568
    },
    {
      "epoch": 0.6969021854445152,
      "grad_norm": 0.588255844217134,
      "learning_rate": 4.9596976544106976e-05,
      "loss": 1.9809,
      "num_input_tokens_seen": 5168267024,
      "step": 6569
    },
    {
      "epoch": 0.6970082749840866,
      "grad_norm": 0.9359516874802287,
      "learning_rate": 4.959685224978685e-05,
      "loss": 2.009,
      "num_input_tokens_seen": 5169053712,
      "step": 6570
    },
    {
      "epoch": 0.6971143645236579,
      "grad_norm": 0.7249876408843179,
      "learning_rate": 4.9596727936459e-05,
      "loss": 2.0781,
      "num_input_tokens_seen": 5169840512,
      "step": 6571
    },
    {
      "epoch": 0.6972204540632294,
      "grad_norm": 0.46515053945431983,
      "learning_rate": 4.9596603604123516e-05,
      "loss": 2.034,
      "num_input_tokens_seen": 5170627328,
      "step": 6572
    },
    {
      "epoch": 0.6973265436028008,
      "grad_norm": 0.4536579852948444,
      "learning_rate": 4.959647925278049e-05,
      "loss": 1.7893,
      "num_input_tokens_seen": 5171414096,
      "step": 6573
    },
    {
      "epoch": 0.6974326331423721,
      "grad_norm": 0.4783037460235746,
      "learning_rate": 4.959635488243004e-05,
      "loss": 2.0843,
      "num_input_tokens_seen": 5172200944,
      "step": 6574
    },
    {
      "epoch": 0.6975387226819436,
      "grad_norm": 0.4937173971270461,
      "learning_rate": 4.9596230493072244e-05,
      "loss": 1.9714,
      "num_input_tokens_seen": 5172987712,
      "step": 6575
    },
    {
      "epoch": 0.697644812221515,
      "grad_norm": 0.5548093829134457,
      "learning_rate": 4.9596106084707205e-05,
      "loss": 1.9151,
      "num_input_tokens_seen": 5173774416,
      "step": 6576
    },
    {
      "epoch": 0.6977509017610863,
      "grad_norm": 0.4660623225160456,
      "learning_rate": 4.959598165733501e-05,
      "loss": 1.9961,
      "num_input_tokens_seen": 5174561232,
      "step": 6577
    },
    {
      "epoch": 0.6978569913006577,
      "grad_norm": 0.4287909658116031,
      "learning_rate": 4.959585721095577e-05,
      "loss": 1.9172,
      "num_input_tokens_seen": 5175347920,
      "step": 6578
    },
    {
      "epoch": 0.6979630808402292,
      "grad_norm": 0.45353879911565737,
      "learning_rate": 4.9595732745569565e-05,
      "loss": 1.9307,
      "num_input_tokens_seen": 5176134592,
      "step": 6579
    },
    {
      "epoch": 0.6980691703798005,
      "grad_norm": 0.422254961679579,
      "learning_rate": 4.959560826117651e-05,
      "loss": 1.9975,
      "num_input_tokens_seen": 5176921360,
      "step": 6580
    },
    {
      "epoch": 0.6981752599193719,
      "grad_norm": 0.49284799322411654,
      "learning_rate": 4.9595483757776684e-05,
      "loss": 1.9411,
      "num_input_tokens_seen": 5177708160,
      "step": 6581
    },
    {
      "epoch": 0.6982813494589434,
      "grad_norm": 0.4057837727073482,
      "learning_rate": 4.959535923537019e-05,
      "loss": 2.0088,
      "num_input_tokens_seen": 5178494960,
      "step": 6582
    },
    {
      "epoch": 0.6983874389985147,
      "grad_norm": 0.5346621922689136,
      "learning_rate": 4.959523469395713e-05,
      "loss": 1.9851,
      "num_input_tokens_seen": 5179281696,
      "step": 6583
    },
    {
      "epoch": 0.6984935285380861,
      "grad_norm": 0.4380872444856101,
      "learning_rate": 4.9595110133537586e-05,
      "loss": 1.6284,
      "num_input_tokens_seen": 5180068512,
      "step": 6584
    },
    {
      "epoch": 0.6985996180776576,
      "grad_norm": 0.5287127104816198,
      "learning_rate": 4.959498555411167e-05,
      "loss": 1.9179,
      "num_input_tokens_seen": 5180855232,
      "step": 6585
    },
    {
      "epoch": 0.6987057076172289,
      "grad_norm": 0.5583222450018123,
      "learning_rate": 4.959486095567947e-05,
      "loss": 2.0663,
      "num_input_tokens_seen": 5181641968,
      "step": 6586
    },
    {
      "epoch": 0.6988117971568003,
      "grad_norm": 0.43681842370071106,
      "learning_rate": 4.959473633824108e-05,
      "loss": 2.0482,
      "num_input_tokens_seen": 5182428736,
      "step": 6587
    },
    {
      "epoch": 0.6989178866963718,
      "grad_norm": 0.48128611909193103,
      "learning_rate": 4.959461170179659e-05,
      "loss": 1.7982,
      "num_input_tokens_seen": 5183215472,
      "step": 6588
    },
    {
      "epoch": 0.6990239762359431,
      "grad_norm": 0.5658055944550286,
      "learning_rate": 4.959448704634612e-05,
      "loss": 1.9048,
      "num_input_tokens_seen": 5184002256,
      "step": 6589
    },
    {
      "epoch": 0.6991300657755145,
      "grad_norm": 0.5179875042863278,
      "learning_rate": 4.9594362371889744e-05,
      "loss": 1.9703,
      "num_input_tokens_seen": 5184788944,
      "step": 6590
    },
    {
      "epoch": 0.699236155315086,
      "grad_norm": 0.41805225533779805,
      "learning_rate": 4.959423767842757e-05,
      "loss": 1.9435,
      "num_input_tokens_seen": 5185575712,
      "step": 6591
    },
    {
      "epoch": 0.6993422448546573,
      "grad_norm": 0.5182515218096634,
      "learning_rate": 4.959411296595969e-05,
      "loss": 1.926,
      "num_input_tokens_seen": 5186362576,
      "step": 6592
    },
    {
      "epoch": 0.6994483343942287,
      "grad_norm": 0.7085916108907165,
      "learning_rate": 4.95939882344862e-05,
      "loss": 2.0353,
      "num_input_tokens_seen": 5187149232,
      "step": 6593
    },
    {
      "epoch": 0.6995544239338001,
      "grad_norm": 0.6409699750094601,
      "learning_rate": 4.9593863484007194e-05,
      "loss": 2.0068,
      "num_input_tokens_seen": 5187936000,
      "step": 6594
    },
    {
      "epoch": 0.6996605134733715,
      "grad_norm": 0.6717501112213835,
      "learning_rate": 4.9593738714522784e-05,
      "loss": 2.0253,
      "num_input_tokens_seen": 5188722672,
      "step": 6595
    },
    {
      "epoch": 0.6997666030129429,
      "grad_norm": 0.6516819698702685,
      "learning_rate": 4.959361392603304e-05,
      "loss": 1.8647,
      "num_input_tokens_seen": 5189509408,
      "step": 6596
    },
    {
      "epoch": 0.6998726925525143,
      "grad_norm": 0.5623806842693854,
      "learning_rate": 4.959348911853808e-05,
      "loss": 2.0837,
      "num_input_tokens_seen": 5190296240,
      "step": 6597
    },
    {
      "epoch": 0.6999787820920857,
      "grad_norm": 0.7540229248095964,
      "learning_rate": 4.9593364292038e-05,
      "loss": 1.9039,
      "num_input_tokens_seen": 5191083040,
      "step": 6598
    },
    {
      "epoch": 0.7000848716316571,
      "grad_norm": 0.6026250009443298,
      "learning_rate": 4.959323944653288e-05,
      "loss": 2.07,
      "num_input_tokens_seen": 5191869808,
      "step": 6599
    },
    {
      "epoch": 0.7001909611712285,
      "grad_norm": 0.5311350477822793,
      "learning_rate": 4.959311458202283e-05,
      "loss": 1.8757,
      "num_input_tokens_seen": 5192656544,
      "step": 6600
    },
    {
      "epoch": 0.7002970507108,
      "grad_norm": 0.5253985308860641,
      "learning_rate": 4.9592989698507944e-05,
      "loss": 2.0095,
      "num_input_tokens_seen": 5193443376,
      "step": 6601
    },
    {
      "epoch": 0.7004031402503713,
      "grad_norm": 0.5893775875058891,
      "learning_rate": 4.9592864795988315e-05,
      "loss": 1.9736,
      "num_input_tokens_seen": 5194230096,
      "step": 6602
    },
    {
      "epoch": 0.7005092297899427,
      "grad_norm": 0.42209775263284016,
      "learning_rate": 4.9592739874464045e-05,
      "loss": 1.9177,
      "num_input_tokens_seen": 5195016912,
      "step": 6603
    },
    {
      "epoch": 0.7006153193295142,
      "grad_norm": 0.527706754646955,
      "learning_rate": 4.959261493393522e-05,
      "loss": 1.8326,
      "num_input_tokens_seen": 5195803728,
      "step": 6604
    },
    {
      "epoch": 0.7007214088690855,
      "grad_norm": 0.5303037398248611,
      "learning_rate": 4.959248997440195e-05,
      "loss": 1.9928,
      "num_input_tokens_seen": 5196590672,
      "step": 6605
    },
    {
      "epoch": 0.7008274984086569,
      "grad_norm": 0.6586182415936616,
      "learning_rate": 4.959236499586432e-05,
      "loss": 1.8743,
      "num_input_tokens_seen": 5197377488,
      "step": 6606
    },
    {
      "epoch": 0.7009335879482284,
      "grad_norm": 0.9830253078003395,
      "learning_rate": 4.959223999832243e-05,
      "loss": 1.9306,
      "num_input_tokens_seen": 5198164240,
      "step": 6607
    },
    {
      "epoch": 0.7010396774877997,
      "grad_norm": 0.4670258833623841,
      "learning_rate": 4.959211498177639e-05,
      "loss": 2.0875,
      "num_input_tokens_seen": 5198951008,
      "step": 6608
    },
    {
      "epoch": 0.7011457670273711,
      "grad_norm": 1.0278220812740042,
      "learning_rate": 4.959198994622628e-05,
      "loss": 1.8074,
      "num_input_tokens_seen": 5199737888,
      "step": 6609
    },
    {
      "epoch": 0.7012518565669424,
      "grad_norm": 0.6566357406683242,
      "learning_rate": 4.95918648916722e-05,
      "loss": 2.2009,
      "num_input_tokens_seen": 5200524560,
      "step": 6610
    },
    {
      "epoch": 0.7013579461065139,
      "grad_norm": 0.4873876202984115,
      "learning_rate": 4.959173981811425e-05,
      "loss": 1.856,
      "num_input_tokens_seen": 5201311424,
      "step": 6611
    },
    {
      "epoch": 0.7014640356460853,
      "grad_norm": 0.4514402020887992,
      "learning_rate": 4.959161472555252e-05,
      "loss": 1.856,
      "num_input_tokens_seen": 5202098208,
      "step": 6612
    },
    {
      "epoch": 0.7015701251856566,
      "grad_norm": 0.5004073720962505,
      "learning_rate": 4.959148961398711e-05,
      "loss": 1.914,
      "num_input_tokens_seen": 5202884992,
      "step": 6613
    },
    {
      "epoch": 0.7016762147252281,
      "grad_norm": 0.5669230235067076,
      "learning_rate": 4.9591364483418124e-05,
      "loss": 1.9534,
      "num_input_tokens_seen": 5203671696,
      "step": 6614
    },
    {
      "epoch": 0.7017823042647995,
      "grad_norm": 0.49504918095568234,
      "learning_rate": 4.9591239333845656e-05,
      "loss": 1.9345,
      "num_input_tokens_seen": 5204458544,
      "step": 6615
    },
    {
      "epoch": 0.7018883938043708,
      "grad_norm": 0.4649620914205293,
      "learning_rate": 4.9591114165269794e-05,
      "loss": 1.8129,
      "num_input_tokens_seen": 5205245264,
      "step": 6616
    },
    {
      "epoch": 0.7019944833439423,
      "grad_norm": 0.6854581762971589,
      "learning_rate": 4.9590988977690646e-05,
      "loss": 2.0185,
      "num_input_tokens_seen": 5206032096,
      "step": 6617
    },
    {
      "epoch": 0.7021005728835137,
      "grad_norm": 0.4543002003021711,
      "learning_rate": 4.95908637711083e-05,
      "loss": 1.9567,
      "num_input_tokens_seen": 5206818816,
      "step": 6618
    },
    {
      "epoch": 0.702206662423085,
      "grad_norm": 0.5148324777962342,
      "learning_rate": 4.959073854552285e-05,
      "loss": 1.9242,
      "num_input_tokens_seen": 5207605648,
      "step": 6619
    },
    {
      "epoch": 0.7023127519626565,
      "grad_norm": 0.61080079931741,
      "learning_rate": 4.959061330093441e-05,
      "loss": 2.0686,
      "num_input_tokens_seen": 5208392384,
      "step": 6620
    },
    {
      "epoch": 0.7024188415022279,
      "grad_norm": 0.4749788858768886,
      "learning_rate": 4.9590488037343066e-05,
      "loss": 1.8856,
      "num_input_tokens_seen": 5209179232,
      "step": 6621
    },
    {
      "epoch": 0.7025249310417992,
      "grad_norm": 0.6320891713509696,
      "learning_rate": 4.959036275474891e-05,
      "loss": 1.9308,
      "num_input_tokens_seen": 5209965936,
      "step": 6622
    },
    {
      "epoch": 0.7026310205813707,
      "grad_norm": 0.6710357926367418,
      "learning_rate": 4.959023745315204e-05,
      "loss": 2.1328,
      "num_input_tokens_seen": 5210752624,
      "step": 6623
    },
    {
      "epoch": 0.7027371101209421,
      "grad_norm": 0.5826290516727074,
      "learning_rate": 4.9590112132552556e-05,
      "loss": 1.9053,
      "num_input_tokens_seen": 5211539472,
      "step": 6624
    },
    {
      "epoch": 0.7028431996605135,
      "grad_norm": 0.7464330873560744,
      "learning_rate": 4.958998679295056e-05,
      "loss": 1.9349,
      "num_input_tokens_seen": 5212326240,
      "step": 6625
    },
    {
      "epoch": 0.7029492892000849,
      "grad_norm": 0.4008518755077227,
      "learning_rate": 4.958986143434614e-05,
      "loss": 1.8139,
      "num_input_tokens_seen": 5213113056,
      "step": 6626
    },
    {
      "epoch": 0.7030553787396563,
      "grad_norm": 0.5637660461793758,
      "learning_rate": 4.958973605673939e-05,
      "loss": 2.0508,
      "num_input_tokens_seen": 5213899824,
      "step": 6627
    },
    {
      "epoch": 0.7031614682792277,
      "grad_norm": 0.46365490124107395,
      "learning_rate": 4.958961066013042e-05,
      "loss": 1.7779,
      "num_input_tokens_seen": 5214686592,
      "step": 6628
    },
    {
      "epoch": 0.703267557818799,
      "grad_norm": 0.497030640204208,
      "learning_rate": 4.958948524451933e-05,
      "loss": 1.9116,
      "num_input_tokens_seen": 5215473376,
      "step": 6629
    },
    {
      "epoch": 0.7033736473583705,
      "grad_norm": 0.4526219267855609,
      "learning_rate": 4.95893598099062e-05,
      "loss": 1.9204,
      "num_input_tokens_seen": 5216260160,
      "step": 6630
    },
    {
      "epoch": 0.7034797368979419,
      "grad_norm": 0.45416880052048264,
      "learning_rate": 4.9589234356291124e-05,
      "loss": 2.1135,
      "num_input_tokens_seen": 5217046880,
      "step": 6631
    },
    {
      "epoch": 0.7035858264375132,
      "grad_norm": 0.5577347147608959,
      "learning_rate": 4.958910888367422e-05,
      "loss": 1.9808,
      "num_input_tokens_seen": 5217833632,
      "step": 6632
    },
    {
      "epoch": 0.7036919159770847,
      "grad_norm": 0.41598370827593867,
      "learning_rate": 4.958898339205558e-05,
      "loss": 2.0509,
      "num_input_tokens_seen": 5218620432,
      "step": 6633
    },
    {
      "epoch": 0.7037980055166561,
      "grad_norm": 0.5238261394191704,
      "learning_rate": 4.958885788143528e-05,
      "loss": 1.8186,
      "num_input_tokens_seen": 5219407216,
      "step": 6634
    },
    {
      "epoch": 0.7039040950562274,
      "grad_norm": 0.47588014528660944,
      "learning_rate": 4.9588732351813436e-05,
      "loss": 2.0486,
      "num_input_tokens_seen": 5220193984,
      "step": 6635
    },
    {
      "epoch": 0.7040101845957989,
      "grad_norm": 0.4535487150645969,
      "learning_rate": 4.9588606803190154e-05,
      "loss": 1.9357,
      "num_input_tokens_seen": 5220980752,
      "step": 6636
    },
    {
      "epoch": 0.7041162741353703,
      "grad_norm": 0.3885850971272321,
      "learning_rate": 4.95884812355655e-05,
      "loss": 1.9703,
      "num_input_tokens_seen": 5221767504,
      "step": 6637
    },
    {
      "epoch": 0.7042223636749416,
      "grad_norm": 0.4854000211094797,
      "learning_rate": 4.95883556489396e-05,
      "loss": 2.046,
      "num_input_tokens_seen": 5222554240,
      "step": 6638
    },
    {
      "epoch": 0.7043284532145131,
      "grad_norm": 0.5725837169919076,
      "learning_rate": 4.958823004331254e-05,
      "loss": 2.0522,
      "num_input_tokens_seen": 5223340992,
      "step": 6639
    },
    {
      "epoch": 0.7044345427540845,
      "grad_norm": 0.7221665999830084,
      "learning_rate": 4.958810441868441e-05,
      "loss": 2.0243,
      "num_input_tokens_seen": 5224127808,
      "step": 6640
    },
    {
      "epoch": 0.7045406322936558,
      "grad_norm": 0.648123884092759,
      "learning_rate": 4.958797877505532e-05,
      "loss": 1.8379,
      "num_input_tokens_seen": 5224914608,
      "step": 6641
    },
    {
      "epoch": 0.7046467218332273,
      "grad_norm": 0.7822790709098549,
      "learning_rate": 4.9587853112425367e-05,
      "loss": 1.9675,
      "num_input_tokens_seen": 5225701376,
      "step": 6642
    },
    {
      "epoch": 0.7047528113727987,
      "grad_norm": 1.5238400394762126,
      "learning_rate": 4.958772743079464e-05,
      "loss": 1.9074,
      "num_input_tokens_seen": 5226488128,
      "step": 6643
    },
    {
      "epoch": 0.70485890091237,
      "grad_norm": 0.7187902681915596,
      "learning_rate": 4.958760173016323e-05,
      "loss": 2.0869,
      "num_input_tokens_seen": 5227274928,
      "step": 6644
    },
    {
      "epoch": 0.7049649904519414,
      "grad_norm": 0.86645048371681,
      "learning_rate": 4.9587476010531256e-05,
      "loss": 1.9004,
      "num_input_tokens_seen": 5228061728,
      "step": 6645
    },
    {
      "epoch": 0.7050710799915129,
      "grad_norm": 0.5649048864384716,
      "learning_rate": 4.958735027189879e-05,
      "loss": 1.8432,
      "num_input_tokens_seen": 5228848528,
      "step": 6646
    },
    {
      "epoch": 0.7051771695310842,
      "grad_norm": 0.6215815389073593,
      "learning_rate": 4.958722451426594e-05,
      "loss": 1.8807,
      "num_input_tokens_seen": 5229635344,
      "step": 6647
    },
    {
      "epoch": 0.7052832590706556,
      "grad_norm": 0.5482288958430591,
      "learning_rate": 4.958709873763281e-05,
      "loss": 1.9681,
      "num_input_tokens_seen": 5230422064,
      "step": 6648
    },
    {
      "epoch": 0.7053893486102271,
      "grad_norm": 0.560078195060985,
      "learning_rate": 4.958697294199949e-05,
      "loss": 2.0529,
      "num_input_tokens_seen": 5231208800,
      "step": 6649
    },
    {
      "epoch": 0.7054954381497984,
      "grad_norm": 0.56963827195868,
      "learning_rate": 4.958684712736609e-05,
      "loss": 1.945,
      "num_input_tokens_seen": 5231995504,
      "step": 6650
    },
    {
      "epoch": 0.7056015276893698,
      "grad_norm": 0.8792867243440785,
      "learning_rate": 4.958672129373268e-05,
      "loss": 2.0056,
      "num_input_tokens_seen": 5232782176,
      "step": 6651
    },
    {
      "epoch": 0.7057076172289413,
      "grad_norm": 0.5709321689283551,
      "learning_rate": 4.9586595441099384e-05,
      "loss": 1.967,
      "num_input_tokens_seen": 5233568896,
      "step": 6652
    },
    {
      "epoch": 0.7058137067685126,
      "grad_norm": 0.8894405439827764,
      "learning_rate": 4.958646956946627e-05,
      "loss": 2.1415,
      "num_input_tokens_seen": 5234355616,
      "step": 6653
    },
    {
      "epoch": 0.705919796308084,
      "grad_norm": 0.5618690301242978,
      "learning_rate": 4.9586343678833475e-05,
      "loss": 1.9461,
      "num_input_tokens_seen": 5235142432,
      "step": 6654
    },
    {
      "epoch": 0.7060258858476555,
      "grad_norm": 0.8115863026293593,
      "learning_rate": 4.958621776920107e-05,
      "loss": 2.0375,
      "num_input_tokens_seen": 5235929200,
      "step": 6655
    },
    {
      "epoch": 0.7061319753872268,
      "grad_norm": 0.5317632764264759,
      "learning_rate": 4.958609184056915e-05,
      "loss": 1.9574,
      "num_input_tokens_seen": 5236715952,
      "step": 6656
    },
    {
      "epoch": 0.7062380649267982,
      "grad_norm": 0.7825397541963734,
      "learning_rate": 4.9585965892937823e-05,
      "loss": 2.1164,
      "num_input_tokens_seen": 5237502736,
      "step": 6657
    },
    {
      "epoch": 0.7063441544663697,
      "grad_norm": 0.4084456685904563,
      "learning_rate": 4.958583992630719e-05,
      "loss": 1.9829,
      "num_input_tokens_seen": 5238289472,
      "step": 6658
    },
    {
      "epoch": 0.706450244005941,
      "grad_norm": 0.9843259316531723,
      "learning_rate": 4.9585713940677336e-05,
      "loss": 1.9046,
      "num_input_tokens_seen": 5239076160,
      "step": 6659
    },
    {
      "epoch": 0.7065563335455124,
      "grad_norm": 0.4857566300392364,
      "learning_rate": 4.9585587936048364e-05,
      "loss": 2.0371,
      "num_input_tokens_seen": 5239862912,
      "step": 6660
    },
    {
      "epoch": 0.7066624230850838,
      "grad_norm": 0.7062946608788746,
      "learning_rate": 4.958546191242037e-05,
      "loss": 1.9111,
      "num_input_tokens_seen": 5240649696,
      "step": 6661
    },
    {
      "epoch": 0.7067685126246552,
      "grad_norm": 0.5667292347376367,
      "learning_rate": 4.958533586979345e-05,
      "loss": 1.8773,
      "num_input_tokens_seen": 5241436480,
      "step": 6662
    },
    {
      "epoch": 0.7068746021642266,
      "grad_norm": 0.7755988655520838,
      "learning_rate": 4.958520980816771e-05,
      "loss": 2.0147,
      "num_input_tokens_seen": 5242223216,
      "step": 6663
    },
    {
      "epoch": 0.706980691703798,
      "grad_norm": 0.8037362262529876,
      "learning_rate": 4.958508372754324e-05,
      "loss": 2.0397,
      "num_input_tokens_seen": 5243009920,
      "step": 6664
    },
    {
      "epoch": 0.7070867812433694,
      "grad_norm": 0.7946747619984678,
      "learning_rate": 4.958495762792012e-05,
      "loss": 1.8641,
      "num_input_tokens_seen": 5243796688,
      "step": 6665
    },
    {
      "epoch": 0.7071928707829408,
      "grad_norm": 1.105357714416483,
      "learning_rate": 4.9584831509298493e-05,
      "loss": 1.9276,
      "num_input_tokens_seen": 5244583408,
      "step": 6666
    },
    {
      "epoch": 0.7072989603225122,
      "grad_norm": 1.0503381659981315,
      "learning_rate": 4.9584705371678417e-05,
      "loss": 1.7834,
      "num_input_tokens_seen": 5245370272,
      "step": 6667
    },
    {
      "epoch": 0.7074050498620836,
      "grad_norm": 0.81779180652172,
      "learning_rate": 4.958457921506e-05,
      "loss": 1.9242,
      "num_input_tokens_seen": 5246156992,
      "step": 6668
    },
    {
      "epoch": 0.707511139401655,
      "grad_norm": 0.6350394766151217,
      "learning_rate": 4.958445303944335e-05,
      "loss": 1.8292,
      "num_input_tokens_seen": 5246943824,
      "step": 6669
    },
    {
      "epoch": 0.7076172289412264,
      "grad_norm": 1.0744460396958906,
      "learning_rate": 4.958432684482856e-05,
      "loss": 2.035,
      "num_input_tokens_seen": 5247730608,
      "step": 6670
    },
    {
      "epoch": 0.7077233184807978,
      "grad_norm": 0.584658555688678,
      "learning_rate": 4.958420063121571e-05,
      "loss": 2.0829,
      "num_input_tokens_seen": 5248517344,
      "step": 6671
    },
    {
      "epoch": 0.7078294080203692,
      "grad_norm": 0.6705062283482542,
      "learning_rate": 4.958407439860491e-05,
      "loss": 1.8916,
      "num_input_tokens_seen": 5249304096,
      "step": 6672
    },
    {
      "epoch": 0.7079354975599406,
      "grad_norm": 0.5952350672340752,
      "learning_rate": 4.958394814699627e-05,
      "loss": 1.989,
      "num_input_tokens_seen": 5250090912,
      "step": 6673
    },
    {
      "epoch": 0.708041587099512,
      "grad_norm": 0.6052202609498022,
      "learning_rate": 4.958382187638987e-05,
      "loss": 1.913,
      "num_input_tokens_seen": 5250877616,
      "step": 6674
    },
    {
      "epoch": 0.7081476766390834,
      "grad_norm": 0.6143988647060629,
      "learning_rate": 4.958369558678582e-05,
      "loss": 1.9632,
      "num_input_tokens_seen": 5251664384,
      "step": 6675
    },
    {
      "epoch": 0.7082537661786548,
      "grad_norm": 0.43919478421359276,
      "learning_rate": 4.95835692781842e-05,
      "loss": 1.897,
      "num_input_tokens_seen": 5252451136,
      "step": 6676
    },
    {
      "epoch": 0.7083598557182261,
      "grad_norm": 0.4888786245460219,
      "learning_rate": 4.958344295058512e-05,
      "loss": 1.9607,
      "num_input_tokens_seen": 5253237888,
      "step": 6677
    },
    {
      "epoch": 0.7084659452577976,
      "grad_norm": 0.6890078386463255,
      "learning_rate": 4.958331660398868e-05,
      "loss": 2.0144,
      "num_input_tokens_seen": 5254024640,
      "step": 6678
    },
    {
      "epoch": 0.708572034797369,
      "grad_norm": 0.5736533868298579,
      "learning_rate": 4.9583190238394986e-05,
      "loss": 1.9085,
      "num_input_tokens_seen": 5254811424,
      "step": 6679
    },
    {
      "epoch": 0.7086781243369403,
      "grad_norm": 0.6117853155926596,
      "learning_rate": 4.958306385380411e-05,
      "loss": 1.9265,
      "num_input_tokens_seen": 5255598160,
      "step": 6680
    },
    {
      "epoch": 0.7087842138765118,
      "grad_norm": 0.40800389609342225,
      "learning_rate": 4.958293745021617e-05,
      "loss": 1.9139,
      "num_input_tokens_seen": 5256384960,
      "step": 6681
    },
    {
      "epoch": 0.7088903034160832,
      "grad_norm": 0.5089347247362668,
      "learning_rate": 4.958281102763126e-05,
      "loss": 1.8042,
      "num_input_tokens_seen": 5257171840,
      "step": 6682
    },
    {
      "epoch": 0.7089963929556545,
      "grad_norm": 0.719111855380793,
      "learning_rate": 4.9582684586049464e-05,
      "loss": 1.9543,
      "num_input_tokens_seen": 5257958592,
      "step": 6683
    },
    {
      "epoch": 0.709102482495226,
      "grad_norm": 0.746512237634374,
      "learning_rate": 4.9582558125470896e-05,
      "loss": 1.9323,
      "num_input_tokens_seen": 5258745392,
      "step": 6684
    },
    {
      "epoch": 0.7092085720347974,
      "grad_norm": 0.8777435707707805,
      "learning_rate": 4.958243164589565e-05,
      "loss": 2.0884,
      "num_input_tokens_seen": 5259532208,
      "step": 6685
    },
    {
      "epoch": 0.7093146615743687,
      "grad_norm": 0.9353728736601153,
      "learning_rate": 4.958230514732382e-05,
      "loss": 1.9969,
      "num_input_tokens_seen": 5260318944,
      "step": 6686
    },
    {
      "epoch": 0.7094207511139402,
      "grad_norm": 0.597081392467811,
      "learning_rate": 4.9582178629755506e-05,
      "loss": 1.8252,
      "num_input_tokens_seen": 5261105728,
      "step": 6687
    },
    {
      "epoch": 0.7095268406535116,
      "grad_norm": 0.631199914315413,
      "learning_rate": 4.9582052093190805e-05,
      "loss": 1.9617,
      "num_input_tokens_seen": 5261892512,
      "step": 6688
    },
    {
      "epoch": 0.7096329301930829,
      "grad_norm": 0.5163804541656458,
      "learning_rate": 4.958192553762981e-05,
      "loss": 1.9734,
      "num_input_tokens_seen": 5262679296,
      "step": 6689
    },
    {
      "epoch": 0.7097390197326544,
      "grad_norm": 0.7371808739824136,
      "learning_rate": 4.958179896307264e-05,
      "loss": 1.7988,
      "num_input_tokens_seen": 5263466096,
      "step": 6690
    },
    {
      "epoch": 0.7098451092722258,
      "grad_norm": 1.00833840968051,
      "learning_rate": 4.958167236951937e-05,
      "loss": 1.9369,
      "num_input_tokens_seen": 5264252816,
      "step": 6691
    },
    {
      "epoch": 0.7099511988117971,
      "grad_norm": 0.7019450401873737,
      "learning_rate": 4.95815457569701e-05,
      "loss": 1.8867,
      "num_input_tokens_seen": 5265039664,
      "step": 6692
    },
    {
      "epoch": 0.7100572883513686,
      "grad_norm": 0.9811877875570125,
      "learning_rate": 4.958141912542493e-05,
      "loss": 2.0919,
      "num_input_tokens_seen": 5265826448,
      "step": 6693
    },
    {
      "epoch": 0.71016337789094,
      "grad_norm": 0.4677424766938047,
      "learning_rate": 4.958129247488397e-05,
      "loss": 1.8669,
      "num_input_tokens_seen": 5266613296,
      "step": 6694
    },
    {
      "epoch": 0.7102694674305113,
      "grad_norm": 0.7568181170967394,
      "learning_rate": 4.958116580534731e-05,
      "loss": 1.9881,
      "num_input_tokens_seen": 5267400080,
      "step": 6695
    },
    {
      "epoch": 0.7103755569700827,
      "grad_norm": 0.48821049522418497,
      "learning_rate": 4.958103911681504e-05,
      "loss": 1.8675,
      "num_input_tokens_seen": 5268186816,
      "step": 6696
    },
    {
      "epoch": 0.7104816465096542,
      "grad_norm": 0.7009725137477189,
      "learning_rate": 4.958091240928726e-05,
      "loss": 1.9014,
      "num_input_tokens_seen": 5268973600,
      "step": 6697
    },
    {
      "epoch": 0.7105877360492255,
      "grad_norm": 0.4813847213989124,
      "learning_rate": 4.958078568276408e-05,
      "loss": 1.8125,
      "num_input_tokens_seen": 5269760336,
      "step": 6698
    },
    {
      "epoch": 0.7106938255887969,
      "grad_norm": 0.4890524876579141,
      "learning_rate": 4.9580658937245584e-05,
      "loss": 1.9071,
      "num_input_tokens_seen": 5270547184,
      "step": 6699
    },
    {
      "epoch": 0.7107999151283684,
      "grad_norm": 0.7024992298039064,
      "learning_rate": 4.958053217273188e-05,
      "loss": 1.9985,
      "num_input_tokens_seen": 5271333968,
      "step": 6700
    },
    {
      "epoch": 0.7109060046679397,
      "grad_norm": 0.41053630854384215,
      "learning_rate": 4.958040538922306e-05,
      "loss": 1.737,
      "num_input_tokens_seen": 5272120800,
      "step": 6701
    },
    {
      "epoch": 0.7110120942075111,
      "grad_norm": 0.7410007232583333,
      "learning_rate": 4.958027858671923e-05,
      "loss": 1.922,
      "num_input_tokens_seen": 5272907504,
      "step": 6702
    },
    {
      "epoch": 0.7111181837470826,
      "grad_norm": 0.5289436556208219,
      "learning_rate": 4.958015176522047e-05,
      "loss": 2.1341,
      "num_input_tokens_seen": 5273694208,
      "step": 6703
    },
    {
      "epoch": 0.7112242732866539,
      "grad_norm": 0.6551403996541758,
      "learning_rate": 4.9580024924726904e-05,
      "loss": 2.0161,
      "num_input_tokens_seen": 5274480976,
      "step": 6704
    },
    {
      "epoch": 0.7113303628262253,
      "grad_norm": 0.46679401986970326,
      "learning_rate": 4.9579898065238604e-05,
      "loss": 1.9619,
      "num_input_tokens_seen": 5275267792,
      "step": 6705
    },
    {
      "epoch": 0.7114364523657968,
      "grad_norm": 0.5740614977267473,
      "learning_rate": 4.9579771186755684e-05,
      "loss": 1.9845,
      "num_input_tokens_seen": 5276054576,
      "step": 6706
    },
    {
      "epoch": 0.7115425419053681,
      "grad_norm": 0.4092526407328957,
      "learning_rate": 4.957964428927825e-05,
      "loss": 1.9863,
      "num_input_tokens_seen": 5276841360,
      "step": 6707
    },
    {
      "epoch": 0.7116486314449395,
      "grad_norm": 0.5233010100118599,
      "learning_rate": 4.9579517372806375e-05,
      "loss": 1.9843,
      "num_input_tokens_seen": 5277628144,
      "step": 6708
    },
    {
      "epoch": 0.711754720984511,
      "grad_norm": 0.41913374779329393,
      "learning_rate": 4.957939043734017e-05,
      "loss": 1.7697,
      "num_input_tokens_seen": 5278414912,
      "step": 6709
    },
    {
      "epoch": 0.7118608105240823,
      "grad_norm": 0.45434838794148263,
      "learning_rate": 4.9579263482879734e-05,
      "loss": 1.9499,
      "num_input_tokens_seen": 5279201728,
      "step": 6710
    },
    {
      "epoch": 0.7119669000636537,
      "grad_norm": 0.49863373150892726,
      "learning_rate": 4.957913650942517e-05,
      "loss": 1.9754,
      "num_input_tokens_seen": 5279988560,
      "step": 6711
    },
    {
      "epoch": 0.7120729896032251,
      "grad_norm": 0.44348550074030835,
      "learning_rate": 4.957900951697656e-05,
      "loss": 1.895,
      "num_input_tokens_seen": 5280775408,
      "step": 6712
    },
    {
      "epoch": 0.7121790791427965,
      "grad_norm": 0.41392795954329453,
      "learning_rate": 4.957888250553402e-05,
      "loss": 2.0245,
      "num_input_tokens_seen": 5281562080,
      "step": 6713
    },
    {
      "epoch": 0.7122851686823679,
      "grad_norm": 0.5639543302215703,
      "learning_rate": 4.957875547509765e-05,
      "loss": 1.9578,
      "num_input_tokens_seen": 5282348880,
      "step": 6714
    },
    {
      "epoch": 0.7123912582219393,
      "grad_norm": 0.44960965137409975,
      "learning_rate": 4.957862842566752e-05,
      "loss": 1.9958,
      "num_input_tokens_seen": 5283135600,
      "step": 6715
    },
    {
      "epoch": 0.7124973477615107,
      "grad_norm": 0.4802100992701187,
      "learning_rate": 4.957850135724376e-05,
      "loss": 1.8687,
      "num_input_tokens_seen": 5283922304,
      "step": 6716
    },
    {
      "epoch": 0.7126034373010821,
      "grad_norm": 0.4793767222611162,
      "learning_rate": 4.957837426982645e-05,
      "loss": 1.9782,
      "num_input_tokens_seen": 5284709008,
      "step": 6717
    },
    {
      "epoch": 0.7127095268406535,
      "grad_norm": 0.45812452668569215,
      "learning_rate": 4.957824716341569e-05,
      "loss": 1.9208,
      "num_input_tokens_seen": 5285495856,
      "step": 6718
    },
    {
      "epoch": 0.712815616380225,
      "grad_norm": 0.47855512397510525,
      "learning_rate": 4.9578120038011586e-05,
      "loss": 1.9341,
      "num_input_tokens_seen": 5286282576,
      "step": 6719
    },
    {
      "epoch": 0.7129217059197963,
      "grad_norm": 0.5108029762123759,
      "learning_rate": 4.957799289361424e-05,
      "loss": 1.9613,
      "num_input_tokens_seen": 5287069392,
      "step": 6720
    },
    {
      "epoch": 0.7130277954593677,
      "grad_norm": 0.6558806476601385,
      "learning_rate": 4.957786573022373e-05,
      "loss": 2.0459,
      "num_input_tokens_seen": 5287856160,
      "step": 6721
    },
    {
      "epoch": 0.7131338849989391,
      "grad_norm": 0.5300100419790733,
      "learning_rate": 4.957773854784018e-05,
      "loss": 2.0342,
      "num_input_tokens_seen": 5288642912,
      "step": 6722
    },
    {
      "epoch": 0.7132399745385105,
      "grad_norm": 0.5886576905282256,
      "learning_rate": 4.9577611346463656e-05,
      "loss": 2.0585,
      "num_input_tokens_seen": 5289429600,
      "step": 6723
    },
    {
      "epoch": 0.7133460640780819,
      "grad_norm": 0.7526051574352959,
      "learning_rate": 4.9577484126094285e-05,
      "loss": 2.0066,
      "num_input_tokens_seen": 5290216304,
      "step": 6724
    },
    {
      "epoch": 0.7134521536176534,
      "grad_norm": 0.48511458206478414,
      "learning_rate": 4.9577356886732166e-05,
      "loss": 1.8168,
      "num_input_tokens_seen": 5291002992,
      "step": 6725
    },
    {
      "epoch": 0.7135582431572247,
      "grad_norm": 0.7843728184600091,
      "learning_rate": 4.957722962837738e-05,
      "loss": 1.9363,
      "num_input_tokens_seen": 5291789760,
      "step": 6726
    },
    {
      "epoch": 0.7136643326967961,
      "grad_norm": 0.5846256968355003,
      "learning_rate": 4.9577102351030025e-05,
      "loss": 2.0181,
      "num_input_tokens_seen": 5292576448,
      "step": 6727
    },
    {
      "epoch": 0.7137704222363674,
      "grad_norm": 0.8937060509958401,
      "learning_rate": 4.957697505469021e-05,
      "loss": 1.9304,
      "num_input_tokens_seen": 5293363232,
      "step": 6728
    },
    {
      "epoch": 0.7138765117759389,
      "grad_norm": 0.5835740800722509,
      "learning_rate": 4.957684773935802e-05,
      "loss": 2.1304,
      "num_input_tokens_seen": 5294149936,
      "step": 6729
    },
    {
      "epoch": 0.7139826013155103,
      "grad_norm": 0.4787250459635395,
      "learning_rate": 4.957672040503358e-05,
      "loss": 1.8708,
      "num_input_tokens_seen": 5294936736,
      "step": 6730
    },
    {
      "epoch": 0.7140886908550816,
      "grad_norm": 0.9548950807743986,
      "learning_rate": 4.957659305171696e-05,
      "loss": 1.8519,
      "num_input_tokens_seen": 5295723440,
      "step": 6731
    },
    {
      "epoch": 0.7141947803946531,
      "grad_norm": 0.6334844848280753,
      "learning_rate": 4.957646567940828e-05,
      "loss": 2.0382,
      "num_input_tokens_seen": 5296510128,
      "step": 6732
    },
    {
      "epoch": 0.7143008699342245,
      "grad_norm": 0.9198648932965755,
      "learning_rate": 4.9576338288107624e-05,
      "loss": 2.0419,
      "num_input_tokens_seen": 5297296928,
      "step": 6733
    },
    {
      "epoch": 0.7144069594737958,
      "grad_norm": 0.5614919581035409,
      "learning_rate": 4.957621087781509e-05,
      "loss": 1.8808,
      "num_input_tokens_seen": 5298083680,
      "step": 6734
    },
    {
      "epoch": 0.7145130490133673,
      "grad_norm": 0.8428547305532695,
      "learning_rate": 4.957608344853079e-05,
      "loss": 1.944,
      "num_input_tokens_seen": 5298870528,
      "step": 6735
    },
    {
      "epoch": 0.7146191385529387,
      "grad_norm": 0.3808738594288409,
      "learning_rate": 4.957595600025481e-05,
      "loss": 1.8775,
      "num_input_tokens_seen": 5299657344,
      "step": 6736
    },
    {
      "epoch": 0.71472522809251,
      "grad_norm": 0.7375919407901392,
      "learning_rate": 4.9575828532987246e-05,
      "loss": 1.9397,
      "num_input_tokens_seen": 5300444096,
      "step": 6737
    },
    {
      "epoch": 0.7148313176320815,
      "grad_norm": 0.535739279785702,
      "learning_rate": 4.957570104672821e-05,
      "loss": 1.9568,
      "num_input_tokens_seen": 5301230928,
      "step": 6738
    },
    {
      "epoch": 0.7149374071716529,
      "grad_norm": 0.6714505332851186,
      "learning_rate": 4.957557354147779e-05,
      "loss": 1.8598,
      "num_input_tokens_seen": 5302017744,
      "step": 6739
    },
    {
      "epoch": 0.7150434967112242,
      "grad_norm": 0.6481958108368235,
      "learning_rate": 4.9575446017236096e-05,
      "loss": 1.9627,
      "num_input_tokens_seen": 5302804368,
      "step": 6740
    },
    {
      "epoch": 0.7151495862507957,
      "grad_norm": 0.5448495842233236,
      "learning_rate": 4.957531847400321e-05,
      "loss": 1.9394,
      "num_input_tokens_seen": 5303591232,
      "step": 6741
    },
    {
      "epoch": 0.7152556757903671,
      "grad_norm": 0.49098986102817677,
      "learning_rate": 4.9575190911779236e-05,
      "loss": 1.9875,
      "num_input_tokens_seen": 5304378000,
      "step": 6742
    },
    {
      "epoch": 0.7153617653299384,
      "grad_norm": 0.5888909322467188,
      "learning_rate": 4.957506333056429e-05,
      "loss": 2.0549,
      "num_input_tokens_seen": 5305164784,
      "step": 6743
    },
    {
      "epoch": 0.7154678548695098,
      "grad_norm": 0.4396001127694344,
      "learning_rate": 4.957493573035844e-05,
      "loss": 1.8461,
      "num_input_tokens_seen": 5305951632,
      "step": 6744
    },
    {
      "epoch": 0.7155739444090813,
      "grad_norm": 0.583337682234722,
      "learning_rate": 4.9574808111161806e-05,
      "loss": 2.0773,
      "num_input_tokens_seen": 5306738304,
      "step": 6745
    },
    {
      "epoch": 0.7156800339486526,
      "grad_norm": 0.5067344104988851,
      "learning_rate": 4.957468047297448e-05,
      "loss": 2.045,
      "num_input_tokens_seen": 5307525056,
      "step": 6746
    },
    {
      "epoch": 0.715786123488224,
      "grad_norm": 0.6507643593668007,
      "learning_rate": 4.957455281579657e-05,
      "loss": 1.9074,
      "num_input_tokens_seen": 5308311824,
      "step": 6747
    },
    {
      "epoch": 0.7158922130277955,
      "grad_norm": 0.4364953174129056,
      "learning_rate": 4.9574425139628156e-05,
      "loss": 1.9546,
      "num_input_tokens_seen": 5309098608,
      "step": 6748
    },
    {
      "epoch": 0.7159983025673669,
      "grad_norm": 0.4890298507944767,
      "learning_rate": 4.9574297444469354e-05,
      "loss": 1.9327,
      "num_input_tokens_seen": 5309885360,
      "step": 6749
    },
    {
      "epoch": 0.7161043921069382,
      "grad_norm": 0.5953317108927575,
      "learning_rate": 4.957416973032025e-05,
      "loss": 2.0633,
      "num_input_tokens_seen": 5310672096,
      "step": 6750
    },
    {
      "epoch": 0.7162104816465097,
      "grad_norm": 0.4130766008520884,
      "learning_rate": 4.957404199718096e-05,
      "loss": 1.9038,
      "num_input_tokens_seen": 5311458896,
      "step": 6751
    },
    {
      "epoch": 0.716316571186081,
      "grad_norm": 0.5721302091399457,
      "learning_rate": 4.9573914245051566e-05,
      "loss": 2.004,
      "num_input_tokens_seen": 5312245600,
      "step": 6752
    },
    {
      "epoch": 0.7164226607256524,
      "grad_norm": 0.4973991797908524,
      "learning_rate": 4.957378647393217e-05,
      "loss": 2.0162,
      "num_input_tokens_seen": 5313032304,
      "step": 6753
    },
    {
      "epoch": 0.7165287502652239,
      "grad_norm": 0.904821393807324,
      "learning_rate": 4.957365868382287e-05,
      "loss": 1.8631,
      "num_input_tokens_seen": 5313819136,
      "step": 6754
    },
    {
      "epoch": 0.7166348398047953,
      "grad_norm": 2.5372061367925456,
      "learning_rate": 4.957353087472377e-05,
      "loss": 2.0198,
      "num_input_tokens_seen": 5314605920,
      "step": 6755
    },
    {
      "epoch": 0.7167409293443666,
      "grad_norm": 0.786595037293016,
      "learning_rate": 4.957340304663497e-05,
      "loss": 2.0528,
      "num_input_tokens_seen": 5315392688,
      "step": 6756
    },
    {
      "epoch": 0.7168470188839381,
      "grad_norm": 0.883626764698365,
      "learning_rate": 4.9573275199556565e-05,
      "loss": 1.9644,
      "num_input_tokens_seen": 5316179504,
      "step": 6757
    },
    {
      "epoch": 0.7169531084235095,
      "grad_norm": 0.572541521903603,
      "learning_rate": 4.957314733348865e-05,
      "loss": 1.9668,
      "num_input_tokens_seen": 5316966176,
      "step": 6758
    },
    {
      "epoch": 0.7170591979630808,
      "grad_norm": 0.4643806948489213,
      "learning_rate": 4.957301944843133e-05,
      "loss": 1.9959,
      "num_input_tokens_seen": 5317752912,
      "step": 6759
    },
    {
      "epoch": 0.7171652875026523,
      "grad_norm": 0.7301065946165595,
      "learning_rate": 4.9572891544384704e-05,
      "loss": 1.8787,
      "num_input_tokens_seen": 5318539680,
      "step": 6760
    },
    {
      "epoch": 0.7172713770422237,
      "grad_norm": 1.1912528939354408,
      "learning_rate": 4.957276362134886e-05,
      "loss": 2.0247,
      "num_input_tokens_seen": 5319326384,
      "step": 6761
    },
    {
      "epoch": 0.717377466581795,
      "grad_norm": 0.6010850213625702,
      "learning_rate": 4.957263567932391e-05,
      "loss": 1.9836,
      "num_input_tokens_seen": 5320113136,
      "step": 6762
    },
    {
      "epoch": 0.7174835561213664,
      "grad_norm": 1.2969215167210197,
      "learning_rate": 4.957250771830995e-05,
      "loss": 1.9653,
      "num_input_tokens_seen": 5320899968,
      "step": 6763
    },
    {
      "epoch": 0.7175896456609379,
      "grad_norm": 0.614051586903391,
      "learning_rate": 4.9572379738307076e-05,
      "loss": 1.9427,
      "num_input_tokens_seen": 5321686768,
      "step": 6764
    },
    {
      "epoch": 0.7176957352005092,
      "grad_norm": 1.377760314088575,
      "learning_rate": 4.957225173931539e-05,
      "loss": 2.0498,
      "num_input_tokens_seen": 5322473536,
      "step": 6765
    },
    {
      "epoch": 0.7178018247400806,
      "grad_norm": 0.5796537224762149,
      "learning_rate": 4.957212372133498e-05,
      "loss": 2.0391,
      "num_input_tokens_seen": 5323260240,
      "step": 6766
    },
    {
      "epoch": 0.7179079142796521,
      "grad_norm": 0.8474831518231197,
      "learning_rate": 4.957199568436597e-05,
      "loss": 1.9559,
      "num_input_tokens_seen": 5324046976,
      "step": 6767
    },
    {
      "epoch": 0.7180140038192234,
      "grad_norm": 0.42361068847436867,
      "learning_rate": 4.957186762840843e-05,
      "loss": 1.9136,
      "num_input_tokens_seen": 5324833776,
      "step": 6768
    },
    {
      "epoch": 0.7181200933587948,
      "grad_norm": 0.72672841293623,
      "learning_rate": 4.957173955346247e-05,
      "loss": 1.7905,
      "num_input_tokens_seen": 5325620528,
      "step": 6769
    },
    {
      "epoch": 0.7182261828983663,
      "grad_norm": 0.5504472082522638,
      "learning_rate": 4.95716114595282e-05,
      "loss": 1.9704,
      "num_input_tokens_seen": 5326407312,
      "step": 6770
    },
    {
      "epoch": 0.7183322724379376,
      "grad_norm": 0.6432585443049967,
      "learning_rate": 4.9571483346605704e-05,
      "loss": 2.0439,
      "num_input_tokens_seen": 5327194048,
      "step": 6771
    },
    {
      "epoch": 0.718438361977509,
      "grad_norm": 0.5051235453482292,
      "learning_rate": 4.957135521469509e-05,
      "loss": 1.76,
      "num_input_tokens_seen": 5327980912,
      "step": 6772
    },
    {
      "epoch": 0.7185444515170805,
      "grad_norm": 0.4627818579765915,
      "learning_rate": 4.957122706379645e-05,
      "loss": 1.828,
      "num_input_tokens_seen": 5328767744,
      "step": 6773
    },
    {
      "epoch": 0.7186505410566518,
      "grad_norm": 0.69159463506057,
      "learning_rate": 4.957109889390989e-05,
      "loss": 1.9901,
      "num_input_tokens_seen": 5329554512,
      "step": 6774
    },
    {
      "epoch": 0.7187566305962232,
      "grad_norm": 0.47249439843287677,
      "learning_rate": 4.9570970705035505e-05,
      "loss": 1.9414,
      "num_input_tokens_seen": 5330341216,
      "step": 6775
    },
    {
      "epoch": 0.7188627201357947,
      "grad_norm": 0.6665596477918991,
      "learning_rate": 4.957084249717339e-05,
      "loss": 2.0987,
      "num_input_tokens_seen": 5331127984,
      "step": 6776
    },
    {
      "epoch": 0.718968809675366,
      "grad_norm": 0.43850951029917595,
      "learning_rate": 4.9570714270323655e-05,
      "loss": 2.1217,
      "num_input_tokens_seen": 5331914784,
      "step": 6777
    },
    {
      "epoch": 0.7190748992149374,
      "grad_norm": 0.4696844298915947,
      "learning_rate": 4.9570586024486385e-05,
      "loss": 1.8809,
      "num_input_tokens_seen": 5332701520,
      "step": 6778
    },
    {
      "epoch": 0.7191809887545088,
      "grad_norm": 0.6061346648632726,
      "learning_rate": 4.95704577596617e-05,
      "loss": 1.9435,
      "num_input_tokens_seen": 5333488304,
      "step": 6779
    },
    {
      "epoch": 0.7192870782940802,
      "grad_norm": 0.4862869431558975,
      "learning_rate": 4.9570329475849674e-05,
      "loss": 1.9582,
      "num_input_tokens_seen": 5334275056,
      "step": 6780
    },
    {
      "epoch": 0.7193931678336516,
      "grad_norm": 0.7237402246501926,
      "learning_rate": 4.957020117305042e-05,
      "loss": 1.9345,
      "num_input_tokens_seen": 5335061712,
      "step": 6781
    },
    {
      "epoch": 0.719499257373223,
      "grad_norm": 0.4455812125137163,
      "learning_rate": 4.9570072851264045e-05,
      "loss": 1.7887,
      "num_input_tokens_seen": 5335848560,
      "step": 6782
    },
    {
      "epoch": 0.7196053469127944,
      "grad_norm": 0.6030077524856352,
      "learning_rate": 4.956994451049063e-05,
      "loss": 1.9226,
      "num_input_tokens_seen": 5336635296,
      "step": 6783
    },
    {
      "epoch": 0.7197114364523658,
      "grad_norm": 0.5601889718928279,
      "learning_rate": 4.9569816150730284e-05,
      "loss": 2.0174,
      "num_input_tokens_seen": 5337422048,
      "step": 6784
    },
    {
      "epoch": 0.7198175259919372,
      "grad_norm": 0.5545602664435748,
      "learning_rate": 4.956968777198311e-05,
      "loss": 1.9149,
      "num_input_tokens_seen": 5338208912,
      "step": 6785
    },
    {
      "epoch": 0.7199236155315086,
      "grad_norm": 0.5302285052283883,
      "learning_rate": 4.95695593742492e-05,
      "loss": 2.1081,
      "num_input_tokens_seen": 5338995616,
      "step": 6786
    },
    {
      "epoch": 0.72002970507108,
      "grad_norm": 0.6229766019036175,
      "learning_rate": 4.956943095752865e-05,
      "loss": 1.9084,
      "num_input_tokens_seen": 5339782416,
      "step": 6787
    },
    {
      "epoch": 0.7201357946106514,
      "grad_norm": 0.5194505563730883,
      "learning_rate": 4.956930252182157e-05,
      "loss": 1.8767,
      "num_input_tokens_seen": 5340569184,
      "step": 6788
    },
    {
      "epoch": 0.7202418841502228,
      "grad_norm": 0.5950333183922113,
      "learning_rate": 4.956917406712805e-05,
      "loss": 1.9995,
      "num_input_tokens_seen": 5341355968,
      "step": 6789
    },
    {
      "epoch": 0.7203479736897942,
      "grad_norm": 0.4947402409468196,
      "learning_rate": 4.956904559344819e-05,
      "loss": 1.9839,
      "num_input_tokens_seen": 5342142720,
      "step": 6790
    },
    {
      "epoch": 0.7204540632293656,
      "grad_norm": 0.46864754182593693,
      "learning_rate": 4.95689171007821e-05,
      "loss": 1.9799,
      "num_input_tokens_seen": 5342929472,
      "step": 6791
    },
    {
      "epoch": 0.720560152768937,
      "grad_norm": 0.5400134338259397,
      "learning_rate": 4.956878858912987e-05,
      "loss": 1.9974,
      "num_input_tokens_seen": 5343716224,
      "step": 6792
    },
    {
      "epoch": 0.7206662423085084,
      "grad_norm": 0.6779088105371343,
      "learning_rate": 4.95686600584916e-05,
      "loss": 2.1534,
      "num_input_tokens_seen": 5344502912,
      "step": 6793
    },
    {
      "epoch": 0.7207723318480798,
      "grad_norm": 0.36895068494842054,
      "learning_rate": 4.956853150886739e-05,
      "loss": 1.8184,
      "num_input_tokens_seen": 5345289744,
      "step": 6794
    },
    {
      "epoch": 0.7208784213876511,
      "grad_norm": 0.8506910429736029,
      "learning_rate": 4.956840294025734e-05,
      "loss": 1.7871,
      "num_input_tokens_seen": 5346076576,
      "step": 6795
    },
    {
      "epoch": 0.7209845109272226,
      "grad_norm": 0.49548068800860934,
      "learning_rate": 4.956827435266156e-05,
      "loss": 1.9325,
      "num_input_tokens_seen": 5346863216,
      "step": 6796
    },
    {
      "epoch": 0.721090600466794,
      "grad_norm": 1.0355421127082578,
      "learning_rate": 4.9568145746080125e-05,
      "loss": 1.797,
      "num_input_tokens_seen": 5347650016,
      "step": 6797
    },
    {
      "epoch": 0.7211966900063653,
      "grad_norm": 0.7241832056106197,
      "learning_rate": 4.956801712051315e-05,
      "loss": 1.971,
      "num_input_tokens_seen": 5348436704,
      "step": 6798
    },
    {
      "epoch": 0.7213027795459368,
      "grad_norm": 0.4752363773499585,
      "learning_rate": 4.956788847596073e-05,
      "loss": 1.8752,
      "num_input_tokens_seen": 5349223584,
      "step": 6799
    },
    {
      "epoch": 0.7214088690855082,
      "grad_norm": 0.5140115566428326,
      "learning_rate": 4.9567759812422976e-05,
      "loss": 2.1177,
      "num_input_tokens_seen": 5350010304,
      "step": 6800
    },
    {
      "epoch": 0.7215149586250795,
      "grad_norm": 0.44977820776077204,
      "learning_rate": 4.956763112989997e-05,
      "loss": 1.8849,
      "num_input_tokens_seen": 5350797104,
      "step": 6801
    },
    {
      "epoch": 0.721621048164651,
      "grad_norm": 0.45572267538872596,
      "learning_rate": 4.956750242839182e-05,
      "loss": 1.8336,
      "num_input_tokens_seen": 5351583904,
      "step": 6802
    },
    {
      "epoch": 0.7217271377042224,
      "grad_norm": 0.5083071808021093,
      "learning_rate": 4.9567373707898626e-05,
      "loss": 2.0064,
      "num_input_tokens_seen": 5352370640,
      "step": 6803
    },
    {
      "epoch": 0.7218332272437937,
      "grad_norm": 0.499693206295504,
      "learning_rate": 4.956724496842049e-05,
      "loss": 2.0022,
      "num_input_tokens_seen": 5353157344,
      "step": 6804
    },
    {
      "epoch": 0.7219393167833652,
      "grad_norm": 0.5408862679607352,
      "learning_rate": 4.9567116209957505e-05,
      "loss": 1.9796,
      "num_input_tokens_seen": 5353944112,
      "step": 6805
    },
    {
      "epoch": 0.7220454063229366,
      "grad_norm": 0.5294106499584718,
      "learning_rate": 4.956698743250977e-05,
      "loss": 2.0399,
      "num_input_tokens_seen": 5354730864,
      "step": 6806
    },
    {
      "epoch": 0.7221514958625079,
      "grad_norm": 0.476563330960628,
      "learning_rate": 4.956685863607739e-05,
      "loss": 1.7669,
      "num_input_tokens_seen": 5355517680,
      "step": 6807
    },
    {
      "epoch": 0.7222575854020794,
      "grad_norm": 0.5039743187502235,
      "learning_rate": 4.956672982066047e-05,
      "loss": 1.9125,
      "num_input_tokens_seen": 5356304512,
      "step": 6808
    },
    {
      "epoch": 0.7223636749416508,
      "grad_norm": 0.5133860038462446,
      "learning_rate": 4.9566600986259096e-05,
      "loss": 1.9572,
      "num_input_tokens_seen": 5357091344,
      "step": 6809
    },
    {
      "epoch": 0.7224697644812221,
      "grad_norm": 0.5348455824382926,
      "learning_rate": 4.956647213287337e-05,
      "loss": 1.9753,
      "num_input_tokens_seen": 5357878064,
      "step": 6810
    },
    {
      "epoch": 0.7225758540207935,
      "grad_norm": 0.5717891696110151,
      "learning_rate": 4.95663432605034e-05,
      "loss": 2.0938,
      "num_input_tokens_seen": 5358664864,
      "step": 6811
    },
    {
      "epoch": 0.722681943560365,
      "grad_norm": 0.5156138639285648,
      "learning_rate": 4.9566214369149276e-05,
      "loss": 1.9131,
      "num_input_tokens_seen": 5359451616,
      "step": 6812
    },
    {
      "epoch": 0.7227880330999363,
      "grad_norm": 0.6063533533500166,
      "learning_rate": 4.956608545881111e-05,
      "loss": 2.0222,
      "num_input_tokens_seen": 5360238336,
      "step": 6813
    },
    {
      "epoch": 0.7228941226395077,
      "grad_norm": 0.46792118707644537,
      "learning_rate": 4.956595652948899e-05,
      "loss": 1.8625,
      "num_input_tokens_seen": 5361025024,
      "step": 6814
    },
    {
      "epoch": 0.7230002121790792,
      "grad_norm": 0.47193430562872823,
      "learning_rate": 4.956582758118302e-05,
      "loss": 2.0196,
      "num_input_tokens_seen": 5361811760,
      "step": 6815
    },
    {
      "epoch": 0.7231063017186505,
      "grad_norm": 0.5490270711041931,
      "learning_rate": 4.9565698613893295e-05,
      "loss": 1.9885,
      "num_input_tokens_seen": 5362598624,
      "step": 6816
    },
    {
      "epoch": 0.7232123912582219,
      "grad_norm": 0.3639228848910768,
      "learning_rate": 4.9565569627619925e-05,
      "loss": 1.8709,
      "num_input_tokens_seen": 5363385440,
      "step": 6817
    },
    {
      "epoch": 0.7233184807977934,
      "grad_norm": 0.5147261897485398,
      "learning_rate": 4.9565440622363e-05,
      "loss": 1.9653,
      "num_input_tokens_seen": 5364172208,
      "step": 6818
    },
    {
      "epoch": 0.7234245703373647,
      "grad_norm": 0.4772484299956846,
      "learning_rate": 4.956531159812262e-05,
      "loss": 2.0972,
      "num_input_tokens_seen": 5364958992,
      "step": 6819
    },
    {
      "epoch": 0.7235306598769361,
      "grad_norm": 0.4600550702436892,
      "learning_rate": 4.9565182554898895e-05,
      "loss": 1.8618,
      "num_input_tokens_seen": 5365745920,
      "step": 6820
    },
    {
      "epoch": 0.7236367494165076,
      "grad_norm": 0.5259714815148743,
      "learning_rate": 4.9565053492691915e-05,
      "loss": 1.9528,
      "num_input_tokens_seen": 5366532704,
      "step": 6821
    },
    {
      "epoch": 0.7237428389560789,
      "grad_norm": 0.5427892485787505,
      "learning_rate": 4.956492441150178e-05,
      "loss": 1.946,
      "num_input_tokens_seen": 5367319472,
      "step": 6822
    },
    {
      "epoch": 0.7238489284956503,
      "grad_norm": 0.45609467218900257,
      "learning_rate": 4.9564795311328596e-05,
      "loss": 1.8973,
      "num_input_tokens_seen": 5368106160,
      "step": 6823
    },
    {
      "epoch": 0.7239550180352218,
      "grad_norm": 0.8564564328602879,
      "learning_rate": 4.956466619217246e-05,
      "loss": 2.0996,
      "num_input_tokens_seen": 5368892960,
      "step": 6824
    },
    {
      "epoch": 0.7240611075747931,
      "grad_norm": 1.016928866701917,
      "learning_rate": 4.956453705403347e-05,
      "loss": 2.0635,
      "num_input_tokens_seen": 5369679648,
      "step": 6825
    },
    {
      "epoch": 0.7241671971143645,
      "grad_norm": 0.6866837133927157,
      "learning_rate": 4.9564407896911724e-05,
      "loss": 1.9617,
      "num_input_tokens_seen": 5370466400,
      "step": 6826
    },
    {
      "epoch": 0.724273286653936,
      "grad_norm": 0.5275084471896565,
      "learning_rate": 4.956427872080732e-05,
      "loss": 1.871,
      "num_input_tokens_seen": 5371253120,
      "step": 6827
    },
    {
      "epoch": 0.7243793761935073,
      "grad_norm": 0.5877543642613615,
      "learning_rate": 4.956414952572037e-05,
      "loss": 1.9871,
      "num_input_tokens_seen": 5372039888,
      "step": 6828
    },
    {
      "epoch": 0.7244854657330787,
      "grad_norm": 0.6961496899334279,
      "learning_rate": 4.956402031165096e-05,
      "loss": 1.85,
      "num_input_tokens_seen": 5372826624,
      "step": 6829
    },
    {
      "epoch": 0.7245915552726501,
      "grad_norm": 0.4998932791905294,
      "learning_rate": 4.9563891078599206e-05,
      "loss": 1.9344,
      "num_input_tokens_seen": 5373613328,
      "step": 6830
    },
    {
      "epoch": 0.7246976448122215,
      "grad_norm": 0.608294446004629,
      "learning_rate": 4.956376182656519e-05,
      "loss": 1.9223,
      "num_input_tokens_seen": 5374400064,
      "step": 6831
    },
    {
      "epoch": 0.7248037343517929,
      "grad_norm": 0.8187881293150494,
      "learning_rate": 4.9563632555549024e-05,
      "loss": 2.0288,
      "num_input_tokens_seen": 5375186784,
      "step": 6832
    },
    {
      "epoch": 0.7249098238913643,
      "grad_norm": 0.8407809712762998,
      "learning_rate": 4.95635032655508e-05,
      "loss": 2.0354,
      "num_input_tokens_seen": 5375973568,
      "step": 6833
    },
    {
      "epoch": 0.7250159134309357,
      "grad_norm": 0.5376039037064799,
      "learning_rate": 4.956337395657062e-05,
      "loss": 1.9717,
      "num_input_tokens_seen": 5376760400,
      "step": 6834
    },
    {
      "epoch": 0.7251220029705071,
      "grad_norm": 0.7008288265601648,
      "learning_rate": 4.956324462860858e-05,
      "loss": 1.9404,
      "num_input_tokens_seen": 5377547264,
      "step": 6835
    },
    {
      "epoch": 0.7252280925100785,
      "grad_norm": 0.5689603394005741,
      "learning_rate": 4.9563115281664795e-05,
      "loss": 1.9897,
      "num_input_tokens_seen": 5378333904,
      "step": 6836
    },
    {
      "epoch": 0.72533418204965,
      "grad_norm": 0.7234697207527674,
      "learning_rate": 4.956298591573936e-05,
      "loss": 1.9913,
      "num_input_tokens_seen": 5379120608,
      "step": 6837
    },
    {
      "epoch": 0.7254402715892213,
      "grad_norm": 1.2503829754959035,
      "learning_rate": 4.9562856530832355e-05,
      "loss": 1.9573,
      "num_input_tokens_seen": 5379907312,
      "step": 6838
    },
    {
      "epoch": 0.7255463611287927,
      "grad_norm": 0.4578350429918434,
      "learning_rate": 4.9562727126943906e-05,
      "loss": 1.932,
      "num_input_tokens_seen": 5380694096,
      "step": 6839
    },
    {
      "epoch": 0.7256524506683641,
      "grad_norm": 1.047647712610625,
      "learning_rate": 4.95625977040741e-05,
      "loss": 2.0751,
      "num_input_tokens_seen": 5381480848,
      "step": 6840
    },
    {
      "epoch": 0.7257585402079355,
      "grad_norm": 0.5909200941370446,
      "learning_rate": 4.956246826222304e-05,
      "loss": 2.0302,
      "num_input_tokens_seen": 5382267536,
      "step": 6841
    },
    {
      "epoch": 0.7258646297475069,
      "grad_norm": 0.7234480415291592,
      "learning_rate": 4.9562338801390816e-05,
      "loss": 1.9103,
      "num_input_tokens_seen": 5383054368,
      "step": 6842
    },
    {
      "epoch": 0.7259707192870783,
      "grad_norm": 0.5378430220964204,
      "learning_rate": 4.9562209321577545e-05,
      "loss": 1.9602,
      "num_input_tokens_seen": 5383841008,
      "step": 6843
    },
    {
      "epoch": 0.7260768088266497,
      "grad_norm": 0.5625443439243473,
      "learning_rate": 4.956207982278332e-05,
      "loss": 1.9437,
      "num_input_tokens_seen": 5384627760,
      "step": 6844
    },
    {
      "epoch": 0.7261828983662211,
      "grad_norm": 0.4989463445378231,
      "learning_rate": 4.9561950305008244e-05,
      "loss": 2.0646,
      "num_input_tokens_seen": 5385414448,
      "step": 6845
    },
    {
      "epoch": 0.7262889879057924,
      "grad_norm": 0.4910824045237926,
      "learning_rate": 4.956182076825241e-05,
      "loss": 1.9963,
      "num_input_tokens_seen": 5386201200,
      "step": 6846
    },
    {
      "epoch": 0.7263950774453639,
      "grad_norm": 0.4724031326792369,
      "learning_rate": 4.956169121251592e-05,
      "loss": 1.8793,
      "num_input_tokens_seen": 5386988048,
      "step": 6847
    },
    {
      "epoch": 0.7265011669849353,
      "grad_norm": 0.39450945682697347,
      "learning_rate": 4.956156163779887e-05,
      "loss": 1.8623,
      "num_input_tokens_seen": 5387774816,
      "step": 6848
    },
    {
      "epoch": 0.7266072565245066,
      "grad_norm": 0.5810178641413993,
      "learning_rate": 4.956143204410138e-05,
      "loss": 1.8098,
      "num_input_tokens_seen": 5388561632,
      "step": 6849
    },
    {
      "epoch": 0.7267133460640781,
      "grad_norm": 0.7413803918904815,
      "learning_rate": 4.956130243142353e-05,
      "loss": 1.8859,
      "num_input_tokens_seen": 5389348320,
      "step": 6850
    },
    {
      "epoch": 0.7268194356036495,
      "grad_norm": 0.6138312212145073,
      "learning_rate": 4.956117279976542e-05,
      "loss": 2.017,
      "num_input_tokens_seen": 5390135120,
      "step": 6851
    },
    {
      "epoch": 0.7269255251432208,
      "grad_norm": 1.0120995649883506,
      "learning_rate": 4.9561043149127163e-05,
      "loss": 1.9298,
      "num_input_tokens_seen": 5390921936,
      "step": 6852
    },
    {
      "epoch": 0.7270316146827923,
      "grad_norm": 1.495354055020719,
      "learning_rate": 4.9560913479508845e-05,
      "loss": 2.0237,
      "num_input_tokens_seen": 5391708720,
      "step": 6853
    },
    {
      "epoch": 0.7271377042223637,
      "grad_norm": 0.6520390440241006,
      "learning_rate": 4.956078379091058e-05,
      "loss": 1.8263,
      "num_input_tokens_seen": 5392495584,
      "step": 6854
    },
    {
      "epoch": 0.727243793761935,
      "grad_norm": 0.8014596048221355,
      "learning_rate": 4.956065408333246e-05,
      "loss": 1.9481,
      "num_input_tokens_seen": 5393282432,
      "step": 6855
    },
    {
      "epoch": 0.7273498833015065,
      "grad_norm": 0.5945091924272689,
      "learning_rate": 4.956052435677459e-05,
      "loss": 2.0325,
      "num_input_tokens_seen": 5394069216,
      "step": 6856
    },
    {
      "epoch": 0.7274559728410779,
      "grad_norm": 0.8697661525782906,
      "learning_rate": 4.956039461123706e-05,
      "loss": 1.9777,
      "num_input_tokens_seen": 5394856096,
      "step": 6857
    },
    {
      "epoch": 0.7275620623806492,
      "grad_norm": 1.1704974598187836,
      "learning_rate": 4.956026484671998e-05,
      "loss": 1.9806,
      "num_input_tokens_seen": 5395642816,
      "step": 6858
    },
    {
      "epoch": 0.7276681519202207,
      "grad_norm": 0.7307877007132357,
      "learning_rate": 4.9560135063223456e-05,
      "loss": 1.9922,
      "num_input_tokens_seen": 5396429552,
      "step": 6859
    },
    {
      "epoch": 0.7277742414597921,
      "grad_norm": 0.9490686609680105,
      "learning_rate": 4.956000526074758e-05,
      "loss": 1.9425,
      "num_input_tokens_seen": 5397216304,
      "step": 6860
    },
    {
      "epoch": 0.7278803309993634,
      "grad_norm": 0.9501351751725562,
      "learning_rate": 4.9559875439292447e-05,
      "loss": 2.0938,
      "num_input_tokens_seen": 5398003088,
      "step": 6861
    },
    {
      "epoch": 0.7279864205389348,
      "grad_norm": 0.5784880530644295,
      "learning_rate": 4.9559745598858164e-05,
      "loss": 1.9049,
      "num_input_tokens_seen": 5398789920,
      "step": 6862
    },
    {
      "epoch": 0.7280925100785063,
      "grad_norm": 0.6013779153802111,
      "learning_rate": 4.955961573944483e-05,
      "loss": 2.0847,
      "num_input_tokens_seen": 5399576720,
      "step": 6863
    },
    {
      "epoch": 0.7281985996180776,
      "grad_norm": 0.500429295394751,
      "learning_rate": 4.9559485861052546e-05,
      "loss": 1.8555,
      "num_input_tokens_seen": 5400363520,
      "step": 6864
    },
    {
      "epoch": 0.728304689157649,
      "grad_norm": 0.5627414415399712,
      "learning_rate": 4.955935596368141e-05,
      "loss": 1.9765,
      "num_input_tokens_seen": 5401150304,
      "step": 6865
    },
    {
      "epoch": 0.7284107786972205,
      "grad_norm": 0.4579094945590367,
      "learning_rate": 4.9559226047331526e-05,
      "loss": 1.8258,
      "num_input_tokens_seen": 5401937184,
      "step": 6866
    },
    {
      "epoch": 0.7285168682367918,
      "grad_norm": 0.43167063981228143,
      "learning_rate": 4.955909611200299e-05,
      "loss": 1.8836,
      "num_input_tokens_seen": 5402723984,
      "step": 6867
    },
    {
      "epoch": 0.7286229577763632,
      "grad_norm": 0.45289040284807286,
      "learning_rate": 4.955896615769591e-05,
      "loss": 2.0051,
      "num_input_tokens_seen": 5403510640,
      "step": 6868
    },
    {
      "epoch": 0.7287290473159347,
      "grad_norm": 0.46677910140520684,
      "learning_rate": 4.955883618441038e-05,
      "loss": 2.0417,
      "num_input_tokens_seen": 5404297392,
      "step": 6869
    },
    {
      "epoch": 0.728835136855506,
      "grad_norm": 0.44575935693880997,
      "learning_rate": 4.95587061921465e-05,
      "loss": 2.0004,
      "num_input_tokens_seen": 5405084112,
      "step": 6870
    },
    {
      "epoch": 0.7289412263950774,
      "grad_norm": 0.4452274342575609,
      "learning_rate": 4.955857618090437e-05,
      "loss": 2.0154,
      "num_input_tokens_seen": 5405870912,
      "step": 6871
    },
    {
      "epoch": 0.7290473159346489,
      "grad_norm": 0.569277383207706,
      "learning_rate": 4.95584461506841e-05,
      "loss": 1.9308,
      "num_input_tokens_seen": 5406657712,
      "step": 6872
    },
    {
      "epoch": 0.7291534054742203,
      "grad_norm": 0.5812965599699947,
      "learning_rate": 4.955831610148578e-05,
      "loss": 2.0842,
      "num_input_tokens_seen": 5407444432,
      "step": 6873
    },
    {
      "epoch": 0.7292594950137916,
      "grad_norm": 0.5114676812894212,
      "learning_rate": 4.9558186033309514e-05,
      "loss": 1.8107,
      "num_input_tokens_seen": 5408231280,
      "step": 6874
    },
    {
      "epoch": 0.7293655845533631,
      "grad_norm": 0.579990529750815,
      "learning_rate": 4.95580559461554e-05,
      "loss": 1.8871,
      "num_input_tokens_seen": 5409018064,
      "step": 6875
    },
    {
      "epoch": 0.7294716740929345,
      "grad_norm": 0.4862439101501433,
      "learning_rate": 4.955792584002354e-05,
      "loss": 1.8738,
      "num_input_tokens_seen": 5409804896,
      "step": 6876
    },
    {
      "epoch": 0.7295777636325058,
      "grad_norm": 0.6043628427515365,
      "learning_rate": 4.9557795714914044e-05,
      "loss": 2.0792,
      "num_input_tokens_seen": 5410591632,
      "step": 6877
    },
    {
      "epoch": 0.7296838531720772,
      "grad_norm": 0.5727956601002449,
      "learning_rate": 4.9557665570826995e-05,
      "loss": 1.8307,
      "num_input_tokens_seen": 5411378528,
      "step": 6878
    },
    {
      "epoch": 0.7297899427116487,
      "grad_norm": 0.5948158703991411,
      "learning_rate": 4.955753540776251e-05,
      "loss": 2.1495,
      "num_input_tokens_seen": 5412165232,
      "step": 6879
    },
    {
      "epoch": 0.72989603225122,
      "grad_norm": 0.5097490554124774,
      "learning_rate": 4.9557405225720675e-05,
      "loss": 1.9202,
      "num_input_tokens_seen": 5412951984,
      "step": 6880
    },
    {
      "epoch": 0.7300021217907914,
      "grad_norm": 0.5337482288902154,
      "learning_rate": 4.955727502470161e-05,
      "loss": 1.8574,
      "num_input_tokens_seen": 5413738704,
      "step": 6881
    },
    {
      "epoch": 0.7301082113303629,
      "grad_norm": 0.5768570978211006,
      "learning_rate": 4.955714480470539e-05,
      "loss": 2.0165,
      "num_input_tokens_seen": 5414525504,
      "step": 6882
    },
    {
      "epoch": 0.7302143008699342,
      "grad_norm": 0.6651884673416095,
      "learning_rate": 4.955701456573213e-05,
      "loss": 1.991,
      "num_input_tokens_seen": 5415312288,
      "step": 6883
    },
    {
      "epoch": 0.7303203904095056,
      "grad_norm": 0.4680815869745204,
      "learning_rate": 4.955688430778194e-05,
      "loss": 1.8515,
      "num_input_tokens_seen": 5416099104,
      "step": 6884
    },
    {
      "epoch": 0.7304264799490771,
      "grad_norm": 0.40858205959653454,
      "learning_rate": 4.9556754030854903e-05,
      "loss": 2.0616,
      "num_input_tokens_seen": 5416885824,
      "step": 6885
    },
    {
      "epoch": 0.7305325694886484,
      "grad_norm": 0.48147867038364733,
      "learning_rate": 4.9556623734951124e-05,
      "loss": 1.8383,
      "num_input_tokens_seen": 5417672672,
      "step": 6886
    },
    {
      "epoch": 0.7306386590282198,
      "grad_norm": 0.6215698003473044,
      "learning_rate": 4.9556493420070716e-05,
      "loss": 1.8809,
      "num_input_tokens_seen": 5418459408,
      "step": 6887
    },
    {
      "epoch": 0.7307447485677913,
      "grad_norm": 0.5357222198034491,
      "learning_rate": 4.955636308621376e-05,
      "loss": 1.9645,
      "num_input_tokens_seen": 5419246160,
      "step": 6888
    },
    {
      "epoch": 0.7308508381073626,
      "grad_norm": 0.5554833681683926,
      "learning_rate": 4.955623273338037e-05,
      "loss": 1.9612,
      "num_input_tokens_seen": 5420033008,
      "step": 6889
    },
    {
      "epoch": 0.730956927646934,
      "grad_norm": 0.4492363189168915,
      "learning_rate": 4.955610236157065e-05,
      "loss": 1.9094,
      "num_input_tokens_seen": 5420819824,
      "step": 6890
    },
    {
      "epoch": 0.7310630171865055,
      "grad_norm": 0.5338723971232492,
      "learning_rate": 4.955597197078469e-05,
      "loss": 2.0306,
      "num_input_tokens_seen": 5421606592,
      "step": 6891
    },
    {
      "epoch": 0.7311691067260768,
      "grad_norm": 0.7082496147743179,
      "learning_rate": 4.95558415610226e-05,
      "loss": 2.0519,
      "num_input_tokens_seen": 5422393264,
      "step": 6892
    },
    {
      "epoch": 0.7312751962656482,
      "grad_norm": 0.686009513665195,
      "learning_rate": 4.955571113228446e-05,
      "loss": 2.0537,
      "num_input_tokens_seen": 5423179936,
      "step": 6893
    },
    {
      "epoch": 0.7313812858052197,
      "grad_norm": 0.6089785661032564,
      "learning_rate": 4.9555580684570404e-05,
      "loss": 2.0115,
      "num_input_tokens_seen": 5423966672,
      "step": 6894
    },
    {
      "epoch": 0.731487375344791,
      "grad_norm": 0.8079656175989842,
      "learning_rate": 4.9555450217880516e-05,
      "loss": 1.9779,
      "num_input_tokens_seen": 5424753536,
      "step": 6895
    },
    {
      "epoch": 0.7315934648843624,
      "grad_norm": 0.5307918780387091,
      "learning_rate": 4.955531973221489e-05,
      "loss": 1.9248,
      "num_input_tokens_seen": 5425540256,
      "step": 6896
    },
    {
      "epoch": 0.7316995544239338,
      "grad_norm": 0.9793125821519979,
      "learning_rate": 4.9555189227573636e-05,
      "loss": 2.0441,
      "num_input_tokens_seen": 5426327008,
      "step": 6897
    },
    {
      "epoch": 0.7318056439635052,
      "grad_norm": 0.7051752359886453,
      "learning_rate": 4.9555058703956846e-05,
      "loss": 1.8698,
      "num_input_tokens_seen": 5427113712,
      "step": 6898
    },
    {
      "epoch": 0.7319117335030766,
      "grad_norm": 0.5274582713560889,
      "learning_rate": 4.9554928161364634e-05,
      "loss": 1.9513,
      "num_input_tokens_seen": 5427900512,
      "step": 6899
    },
    {
      "epoch": 0.732017823042648,
      "grad_norm": 0.8456813822869367,
      "learning_rate": 4.9554797599797095e-05,
      "loss": 2.0484,
      "num_input_tokens_seen": 5428687248,
      "step": 6900
    },
    {
      "epoch": 0.7321239125822194,
      "grad_norm": 0.7528738086001739,
      "learning_rate": 4.9554667019254324e-05,
      "loss": 1.8924,
      "num_input_tokens_seen": 5429473872,
      "step": 6901
    },
    {
      "epoch": 0.7322300021217908,
      "grad_norm": 0.5718349711255657,
      "learning_rate": 4.955453641973643e-05,
      "loss": 1.9256,
      "num_input_tokens_seen": 5430260576,
      "step": 6902
    },
    {
      "epoch": 0.7323360916613622,
      "grad_norm": 0.6822846200866363,
      "learning_rate": 4.9554405801243506e-05,
      "loss": 1.9314,
      "num_input_tokens_seen": 5431047328,
      "step": 6903
    },
    {
      "epoch": 0.7324421812009336,
      "grad_norm": 0.7617169000220246,
      "learning_rate": 4.955427516377566e-05,
      "loss": 2.1148,
      "num_input_tokens_seen": 5431833968,
      "step": 6904
    },
    {
      "epoch": 0.732548270740505,
      "grad_norm": 0.7028916375353559,
      "learning_rate": 4.9554144507333e-05,
      "loss": 1.9735,
      "num_input_tokens_seen": 5432620784,
      "step": 6905
    },
    {
      "epoch": 0.7326543602800764,
      "grad_norm": 0.5295709117065204,
      "learning_rate": 4.95540138319156e-05,
      "loss": 1.9302,
      "num_input_tokens_seen": 5433407376,
      "step": 6906
    },
    {
      "epoch": 0.7327604498196478,
      "grad_norm": 0.5779226998850372,
      "learning_rate": 4.955388313752359e-05,
      "loss": 1.9535,
      "num_input_tokens_seen": 5434194224,
      "step": 6907
    },
    {
      "epoch": 0.7328665393592192,
      "grad_norm": 0.5196901919076033,
      "learning_rate": 4.955375242415706e-05,
      "loss": 1.8156,
      "num_input_tokens_seen": 5434981056,
      "step": 6908
    },
    {
      "epoch": 0.7329726288987906,
      "grad_norm": 0.6558546552650079,
      "learning_rate": 4.955362169181611e-05,
      "loss": 2.0415,
      "num_input_tokens_seen": 5435767792,
      "step": 6909
    },
    {
      "epoch": 0.733078718438362,
      "grad_norm": 0.5850574829170652,
      "learning_rate": 4.955349094050084e-05,
      "loss": 1.961,
      "num_input_tokens_seen": 5436554576,
      "step": 6910
    },
    {
      "epoch": 0.7331848079779334,
      "grad_norm": 0.6179034770898955,
      "learning_rate": 4.955336017021135e-05,
      "loss": 2.026,
      "num_input_tokens_seen": 5437341408,
      "step": 6911
    },
    {
      "epoch": 0.7332908975175048,
      "grad_norm": 0.4663548381531537,
      "learning_rate": 4.955322938094775e-05,
      "loss": 1.8879,
      "num_input_tokens_seen": 5438128096,
      "step": 6912
    },
    {
      "epoch": 0.7333969870570761,
      "grad_norm": 0.5322204798000434,
      "learning_rate": 4.955309857271013e-05,
      "loss": 2.0331,
      "num_input_tokens_seen": 5438914752,
      "step": 6913
    },
    {
      "epoch": 0.7335030765966476,
      "grad_norm": 0.840597414060367,
      "learning_rate": 4.9552967745498594e-05,
      "loss": 1.9785,
      "num_input_tokens_seen": 5439701472,
      "step": 6914
    },
    {
      "epoch": 0.733609166136219,
      "grad_norm": 0.8034116566496098,
      "learning_rate": 4.9552836899313247e-05,
      "loss": 2.0741,
      "num_input_tokens_seen": 5440488208,
      "step": 6915
    },
    {
      "epoch": 0.7337152556757903,
      "grad_norm": 0.5805962276063314,
      "learning_rate": 4.955270603415419e-05,
      "loss": 2.0193,
      "num_input_tokens_seen": 5441274992,
      "step": 6916
    },
    {
      "epoch": 0.7338213452153618,
      "grad_norm": 0.6828050595804502,
      "learning_rate": 4.955257515002152e-05,
      "loss": 1.9431,
      "num_input_tokens_seen": 5442061744,
      "step": 6917
    },
    {
      "epoch": 0.7339274347549332,
      "grad_norm": 0.5696674243941615,
      "learning_rate": 4.955244424691534e-05,
      "loss": 1.952,
      "num_input_tokens_seen": 5442848464,
      "step": 6918
    },
    {
      "epoch": 0.7340335242945045,
      "grad_norm": 0.6510738720556579,
      "learning_rate": 4.955231332483575e-05,
      "loss": 1.975,
      "num_input_tokens_seen": 5443635216,
      "step": 6919
    },
    {
      "epoch": 0.734139613834076,
      "grad_norm": 0.6414874731687128,
      "learning_rate": 4.955218238378286e-05,
      "loss": 2.0918,
      "num_input_tokens_seen": 5444422000,
      "step": 6920
    },
    {
      "epoch": 0.7342457033736474,
      "grad_norm": 0.9737716032811211,
      "learning_rate": 4.955205142375676e-05,
      "loss": 1.945,
      "num_input_tokens_seen": 5445208736,
      "step": 6921
    },
    {
      "epoch": 0.7343517929132187,
      "grad_norm": 0.8201612123556873,
      "learning_rate": 4.9551920444757557e-05,
      "loss": 1.8987,
      "num_input_tokens_seen": 5445995504,
      "step": 6922
    },
    {
      "epoch": 0.7344578824527902,
      "grad_norm": 0.7133170857700426,
      "learning_rate": 4.955178944678535e-05,
      "loss": 2.1342,
      "num_input_tokens_seen": 5446782320,
      "step": 6923
    },
    {
      "epoch": 0.7345639719923616,
      "grad_norm": 0.5061052833747515,
      "learning_rate": 4.955165842984023e-05,
      "loss": 2.0209,
      "num_input_tokens_seen": 5447569088,
      "step": 6924
    },
    {
      "epoch": 0.7346700615319329,
      "grad_norm": 0.8756699623828786,
      "learning_rate": 4.9551527393922324e-05,
      "loss": 1.924,
      "num_input_tokens_seen": 5448355824,
      "step": 6925
    },
    {
      "epoch": 0.7347761510715044,
      "grad_norm": 0.4291199229081695,
      "learning_rate": 4.955139633903171e-05,
      "loss": 1.7701,
      "num_input_tokens_seen": 5449142576,
      "step": 6926
    },
    {
      "epoch": 0.7348822406110758,
      "grad_norm": 0.7524871144478151,
      "learning_rate": 4.95512652651685e-05,
      "loss": 1.9188,
      "num_input_tokens_seen": 5449929344,
      "step": 6927
    },
    {
      "epoch": 0.7349883301506471,
      "grad_norm": 0.6058996884994758,
      "learning_rate": 4.955113417233279e-05,
      "loss": 1.8943,
      "num_input_tokens_seen": 5450716080,
      "step": 6928
    },
    {
      "epoch": 0.7350944196902185,
      "grad_norm": 0.5742889559689595,
      "learning_rate": 4.955100306052468e-05,
      "loss": 1.9416,
      "num_input_tokens_seen": 5451502832,
      "step": 6929
    },
    {
      "epoch": 0.73520050922979,
      "grad_norm": 0.45205878031646934,
      "learning_rate": 4.955087192974428e-05,
      "loss": 1.8443,
      "num_input_tokens_seen": 5452289680,
      "step": 6930
    },
    {
      "epoch": 0.7353065987693613,
      "grad_norm": 0.6602470924597631,
      "learning_rate": 4.955074077999169e-05,
      "loss": 2.0274,
      "num_input_tokens_seen": 5453076320,
      "step": 6931
    },
    {
      "epoch": 0.7354126883089327,
      "grad_norm": 0.4578770473466098,
      "learning_rate": 4.955060961126701e-05,
      "loss": 2.0068,
      "num_input_tokens_seen": 5453863008,
      "step": 6932
    },
    {
      "epoch": 0.7355187778485042,
      "grad_norm": 0.5354235580899065,
      "learning_rate": 4.9550478423570324e-05,
      "loss": 1.8757,
      "num_input_tokens_seen": 5454649776,
      "step": 6933
    },
    {
      "epoch": 0.7356248673880755,
      "grad_norm": 0.4912872903999457,
      "learning_rate": 4.955034721690176e-05,
      "loss": 1.8533,
      "num_input_tokens_seen": 5455436624,
      "step": 6934
    },
    {
      "epoch": 0.7357309569276469,
      "grad_norm": 0.502230388877125,
      "learning_rate": 4.955021599126141e-05,
      "loss": 1.9863,
      "num_input_tokens_seen": 5456223328,
      "step": 6935
    },
    {
      "epoch": 0.7358370464672184,
      "grad_norm": 0.5386201309628098,
      "learning_rate": 4.9550084746649366e-05,
      "loss": 1.9359,
      "num_input_tokens_seen": 5457010064,
      "step": 6936
    },
    {
      "epoch": 0.7359431360067897,
      "grad_norm": 0.5483740729698682,
      "learning_rate": 4.954995348306574e-05,
      "loss": 2.0379,
      "num_input_tokens_seen": 5457796720,
      "step": 6937
    },
    {
      "epoch": 0.7360492255463611,
      "grad_norm": 0.4361864161913666,
      "learning_rate": 4.954982220051063e-05,
      "loss": 1.9136,
      "num_input_tokens_seen": 5458583472,
      "step": 6938
    },
    {
      "epoch": 0.7361553150859326,
      "grad_norm": 0.5509327862227289,
      "learning_rate": 4.9549690898984145e-05,
      "loss": 2.0104,
      "num_input_tokens_seen": 5459370272,
      "step": 6939
    },
    {
      "epoch": 0.7362614046255039,
      "grad_norm": 0.5234329270510089,
      "learning_rate": 4.954955957848637e-05,
      "loss": 1.9691,
      "num_input_tokens_seen": 5460156992,
      "step": 6940
    },
    {
      "epoch": 0.7363674941650753,
      "grad_norm": 0.4681572746803769,
      "learning_rate": 4.954942823901742e-05,
      "loss": 1.9474,
      "num_input_tokens_seen": 5460943712,
      "step": 6941
    },
    {
      "epoch": 0.7364735837046468,
      "grad_norm": 0.5220727202231259,
      "learning_rate": 4.954929688057739e-05,
      "loss": 2.0159,
      "num_input_tokens_seen": 5461730432,
      "step": 6942
    },
    {
      "epoch": 0.7365796732442181,
      "grad_norm": 0.3987328152063239,
      "learning_rate": 4.9549165503166384e-05,
      "loss": 1.9461,
      "num_input_tokens_seen": 5462517152,
      "step": 6943
    },
    {
      "epoch": 0.7366857627837895,
      "grad_norm": 0.4879659779795463,
      "learning_rate": 4.95490341067845e-05,
      "loss": 1.8944,
      "num_input_tokens_seen": 5463303920,
      "step": 6944
    },
    {
      "epoch": 0.7367918523233609,
      "grad_norm": 0.38980365326566546,
      "learning_rate": 4.954890269143185e-05,
      "loss": 1.8735,
      "num_input_tokens_seen": 5464090704,
      "step": 6945
    },
    {
      "epoch": 0.7368979418629323,
      "grad_norm": 0.4682726554817753,
      "learning_rate": 4.954877125710852e-05,
      "loss": 2.002,
      "num_input_tokens_seen": 5464877488,
      "step": 6946
    },
    {
      "epoch": 0.7370040314025037,
      "grad_norm": 0.5356847665219838,
      "learning_rate": 4.954863980381463e-05,
      "loss": 1.7722,
      "num_input_tokens_seen": 5465664368,
      "step": 6947
    },
    {
      "epoch": 0.7371101209420751,
      "grad_norm": 0.7348413203846009,
      "learning_rate": 4.954850833155026e-05,
      "loss": 1.9249,
      "num_input_tokens_seen": 5466451088,
      "step": 6948
    },
    {
      "epoch": 0.7372162104816465,
      "grad_norm": 0.538050219157249,
      "learning_rate": 4.954837684031554e-05,
      "loss": 1.8615,
      "num_input_tokens_seen": 5467237920,
      "step": 6949
    },
    {
      "epoch": 0.7373223000212179,
      "grad_norm": 0.8841327700383264,
      "learning_rate": 4.954824533011053e-05,
      "loss": 2.0374,
      "num_input_tokens_seen": 5468024672,
      "step": 6950
    },
    {
      "epoch": 0.7374283895607893,
      "grad_norm": 0.6226172336386799,
      "learning_rate": 4.954811380093538e-05,
      "loss": 2.044,
      "num_input_tokens_seen": 5468811376,
      "step": 6951
    },
    {
      "epoch": 0.7375344791003607,
      "grad_norm": 0.8856169733973146,
      "learning_rate": 4.954798225279015e-05,
      "loss": 1.9747,
      "num_input_tokens_seen": 5469598112,
      "step": 6952
    },
    {
      "epoch": 0.7376405686399321,
      "grad_norm": 0.9694208606976918,
      "learning_rate": 4.954785068567497e-05,
      "loss": 2.0079,
      "num_input_tokens_seen": 5470384896,
      "step": 6953
    },
    {
      "epoch": 0.7377466581795035,
      "grad_norm": 0.4919820350611566,
      "learning_rate": 4.954771909958993e-05,
      "loss": 1.9624,
      "num_input_tokens_seen": 5471171632,
      "step": 6954
    },
    {
      "epoch": 0.7378527477190749,
      "grad_norm": 0.7176167426852916,
      "learning_rate": 4.954758749453513e-05,
      "loss": 1.9658,
      "num_input_tokens_seen": 5471958400,
      "step": 6955
    },
    {
      "epoch": 0.7379588372586463,
      "grad_norm": 0.4374333779528638,
      "learning_rate": 4.954745587051068e-05,
      "loss": 1.799,
      "num_input_tokens_seen": 5472745200,
      "step": 6956
    },
    {
      "epoch": 0.7380649267982177,
      "grad_norm": 0.44683554616062626,
      "learning_rate": 4.9547324227516666e-05,
      "loss": 2.0944,
      "num_input_tokens_seen": 5473531952,
      "step": 6957
    },
    {
      "epoch": 0.7381710163377891,
      "grad_norm": 0.5668749938431673,
      "learning_rate": 4.9547192565553216e-05,
      "loss": 1.9792,
      "num_input_tokens_seen": 5474318768,
      "step": 6958
    },
    {
      "epoch": 0.7382771058773605,
      "grad_norm": 0.4749236904403033,
      "learning_rate": 4.95470608846204e-05,
      "loss": 1.9764,
      "num_input_tokens_seen": 5475105584,
      "step": 6959
    },
    {
      "epoch": 0.7383831954169319,
      "grad_norm": 0.5227759014216167,
      "learning_rate": 4.954692918471834e-05,
      "loss": 1.9876,
      "num_input_tokens_seen": 5475892352,
      "step": 6960
    },
    {
      "epoch": 0.7384892849565032,
      "grad_norm": 0.3962950638660983,
      "learning_rate": 4.954679746584714e-05,
      "loss": 1.9026,
      "num_input_tokens_seen": 5476679232,
      "step": 6961
    },
    {
      "epoch": 0.7385953744960747,
      "grad_norm": 0.5554637984949427,
      "learning_rate": 4.954666572800689e-05,
      "loss": 1.8194,
      "num_input_tokens_seen": 5477465952,
      "step": 6962
    },
    {
      "epoch": 0.7387014640356461,
      "grad_norm": 0.45968129154853754,
      "learning_rate": 4.954653397119769e-05,
      "loss": 1.9684,
      "num_input_tokens_seen": 5478252736,
      "step": 6963
    },
    {
      "epoch": 0.7388075535752174,
      "grad_norm": 0.4646701361650439,
      "learning_rate": 4.9546402195419665e-05,
      "loss": 1.8653,
      "num_input_tokens_seen": 5479039504,
      "step": 6964
    },
    {
      "epoch": 0.7389136431147889,
      "grad_norm": 0.6007321366825812,
      "learning_rate": 4.954627040067289e-05,
      "loss": 1.7912,
      "num_input_tokens_seen": 5479826272,
      "step": 6965
    },
    {
      "epoch": 0.7390197326543603,
      "grad_norm": 0.5500867180611303,
      "learning_rate": 4.954613858695748e-05,
      "loss": 1.9496,
      "num_input_tokens_seen": 5480613040,
      "step": 6966
    },
    {
      "epoch": 0.7391258221939316,
      "grad_norm": 0.4614521265514596,
      "learning_rate": 4.9546006754273535e-05,
      "loss": 2.0026,
      "num_input_tokens_seen": 5481399840,
      "step": 6967
    },
    {
      "epoch": 0.7392319117335031,
      "grad_norm": 0.651375750073261,
      "learning_rate": 4.9545874902621156e-05,
      "loss": 2.0553,
      "num_input_tokens_seen": 5482186624,
      "step": 6968
    },
    {
      "epoch": 0.7393380012730745,
      "grad_norm": 0.48199106720190954,
      "learning_rate": 4.9545743032000444e-05,
      "loss": 1.8454,
      "num_input_tokens_seen": 5482973408,
      "step": 6969
    },
    {
      "epoch": 0.7394440908126458,
      "grad_norm": 0.6990925125903227,
      "learning_rate": 4.95456111424115e-05,
      "loss": 1.9776,
      "num_input_tokens_seen": 5483760160,
      "step": 6970
    },
    {
      "epoch": 0.7395501803522173,
      "grad_norm": 0.6713486652342426,
      "learning_rate": 4.954547923385443e-05,
      "loss": 1.9425,
      "num_input_tokens_seen": 5484546912,
      "step": 6971
    },
    {
      "epoch": 0.7396562698917887,
      "grad_norm": 0.4902243378693772,
      "learning_rate": 4.954534730632934e-05,
      "loss": 1.8113,
      "num_input_tokens_seen": 5485333696,
      "step": 6972
    },
    {
      "epoch": 0.73976235943136,
      "grad_norm": 0.6311365975237433,
      "learning_rate": 4.9545215359836315e-05,
      "loss": 1.98,
      "num_input_tokens_seen": 5486120448,
      "step": 6973
    },
    {
      "epoch": 0.7398684489709315,
      "grad_norm": 0.5544342976641577,
      "learning_rate": 4.954508339437547e-05,
      "loss": 2.094,
      "num_input_tokens_seen": 5486907264,
      "step": 6974
    },
    {
      "epoch": 0.7399745385105029,
      "grad_norm": 0.4828826009076974,
      "learning_rate": 4.954495140994692e-05,
      "loss": 1.9137,
      "num_input_tokens_seen": 5487694000,
      "step": 6975
    },
    {
      "epoch": 0.7400806280500742,
      "grad_norm": 0.6511074148983408,
      "learning_rate": 4.9544819406550735e-05,
      "loss": 1.8935,
      "num_input_tokens_seen": 5488480800,
      "step": 6976
    },
    {
      "epoch": 0.7401867175896457,
      "grad_norm": 0.7245717022333973,
      "learning_rate": 4.954468738418703e-05,
      "loss": 1.8584,
      "num_input_tokens_seen": 5489267664,
      "step": 6977
    },
    {
      "epoch": 0.7402928071292171,
      "grad_norm": 0.6260560519440864,
      "learning_rate": 4.954455534285592e-05,
      "loss": 2.0256,
      "num_input_tokens_seen": 5490054448,
      "step": 6978
    },
    {
      "epoch": 0.7403988966687884,
      "grad_norm": 0.5813218325714258,
      "learning_rate": 4.9544423282557495e-05,
      "loss": 1.9332,
      "num_input_tokens_seen": 5490841216,
      "step": 6979
    },
    {
      "epoch": 0.7405049862083598,
      "grad_norm": 0.49139318428207973,
      "learning_rate": 4.9544291203291866e-05,
      "loss": 2.0299,
      "num_input_tokens_seen": 5491627952,
      "step": 6980
    },
    {
      "epoch": 0.7406110757479313,
      "grad_norm": 0.6853630519767332,
      "learning_rate": 4.954415910505912e-05,
      "loss": 2.1126,
      "num_input_tokens_seen": 5492414688,
      "step": 6981
    },
    {
      "epoch": 0.7407171652875026,
      "grad_norm": 0.4870470356377872,
      "learning_rate": 4.9544026987859374e-05,
      "loss": 1.9729,
      "num_input_tokens_seen": 5493201472,
      "step": 6982
    },
    {
      "epoch": 0.740823254827074,
      "grad_norm": 0.5316845874273053,
      "learning_rate": 4.954389485169272e-05,
      "loss": 1.9305,
      "num_input_tokens_seen": 5493988224,
      "step": 6983
    },
    {
      "epoch": 0.7409293443666455,
      "grad_norm": 0.9035320871038135,
      "learning_rate": 4.954376269655927e-05,
      "loss": 1.9871,
      "num_input_tokens_seen": 5494775024,
      "step": 6984
    },
    {
      "epoch": 0.7410354339062168,
      "grad_norm": 0.8738526376850327,
      "learning_rate": 4.954363052245912e-05,
      "loss": 1.8165,
      "num_input_tokens_seen": 5495561808,
      "step": 6985
    },
    {
      "epoch": 0.7411415234457882,
      "grad_norm": 0.6619465940175754,
      "learning_rate": 4.954349832939237e-05,
      "loss": 2.0404,
      "num_input_tokens_seen": 5496348448,
      "step": 6986
    },
    {
      "epoch": 0.7412476129853597,
      "grad_norm": 0.8327974843742414,
      "learning_rate": 4.954336611735912e-05,
      "loss": 1.9887,
      "num_input_tokens_seen": 5497135232,
      "step": 6987
    },
    {
      "epoch": 0.741353702524931,
      "grad_norm": 0.5056640737066959,
      "learning_rate": 4.954323388635949e-05,
      "loss": 1.9715,
      "num_input_tokens_seen": 5497922032,
      "step": 6988
    },
    {
      "epoch": 0.7414597920645024,
      "grad_norm": 1.079103209813202,
      "learning_rate": 4.954310163639355e-05,
      "loss": 2.052,
      "num_input_tokens_seen": 5498708832,
      "step": 6989
    },
    {
      "epoch": 0.7415658816040739,
      "grad_norm": 0.4462190031938026,
      "learning_rate": 4.954296936746143e-05,
      "loss": 1.9849,
      "num_input_tokens_seen": 5499495632,
      "step": 6990
    },
    {
      "epoch": 0.7416719711436452,
      "grad_norm": 1.433223525922672,
      "learning_rate": 4.954283707956323e-05,
      "loss": 1.8538,
      "num_input_tokens_seen": 5500282416,
      "step": 6991
    },
    {
      "epoch": 0.7417780606832166,
      "grad_norm": 0.5120078791756881,
      "learning_rate": 4.954270477269904e-05,
      "loss": 1.7351,
      "num_input_tokens_seen": 5501069264,
      "step": 6992
    },
    {
      "epoch": 0.7418841502227881,
      "grad_norm": 1.556851117261313,
      "learning_rate": 4.954257244686896e-05,
      "loss": 1.8567,
      "num_input_tokens_seen": 5501856032,
      "step": 6993
    },
    {
      "epoch": 0.7419902397623594,
      "grad_norm": 0.5311129240783068,
      "learning_rate": 4.954244010207312e-05,
      "loss": 1.9667,
      "num_input_tokens_seen": 5502642784,
      "step": 6994
    },
    {
      "epoch": 0.7420963293019308,
      "grad_norm": 0.8363959472395479,
      "learning_rate": 4.954230773831159e-05,
      "loss": 1.9974,
      "num_input_tokens_seen": 5503429504,
      "step": 6995
    },
    {
      "epoch": 0.7422024188415022,
      "grad_norm": 0.7303014751860646,
      "learning_rate": 4.954217535558448e-05,
      "loss": 1.9022,
      "num_input_tokens_seen": 5504216272,
      "step": 6996
    },
    {
      "epoch": 0.7423085083810737,
      "grad_norm": 0.7739630112418986,
      "learning_rate": 4.9542042953891896e-05,
      "loss": 1.9831,
      "num_input_tokens_seen": 5505003104,
      "step": 6997
    },
    {
      "epoch": 0.742414597920645,
      "grad_norm": 0.7859905919759761,
      "learning_rate": 4.9541910533233954e-05,
      "loss": 1.9498,
      "num_input_tokens_seen": 5505789824,
      "step": 6998
    },
    {
      "epoch": 0.7425206874602164,
      "grad_norm": 0.8180121179931357,
      "learning_rate": 4.9541778093610734e-05,
      "loss": 1.9951,
      "num_input_tokens_seen": 5506576560,
      "step": 6999
    },
    {
      "epoch": 0.7426267769997879,
      "grad_norm": 0.53613074406805,
      "learning_rate": 4.954164563502235e-05,
      "loss": 1.8899,
      "num_input_tokens_seen": 5507363360,
      "step": 7000
    },
    {
      "epoch": 0.7426267769997879,
      "eval_loss": 1.9176324605941772,
      "eval_runtime": 65.0557,
      "eval_samples_per_second": 46.114,
      "eval_steps_per_second": 0.492,
      "num_input_tokens_seen": 5507363360,
      "step": 7000
    },
    {
      "epoch": 0.7427328665393592,
      "grad_norm": 0.5223749907743039,
      "learning_rate": 4.954151315746891e-05,
      "loss": 1.9226,
      "num_input_tokens_seen": 5508150176,
      "step": 7001
    },
    {
      "epoch": 0.7428389560789306,
      "grad_norm": 0.5445306971394114,
      "learning_rate": 4.95413806609505e-05,
      "loss": 1.9001,
      "num_input_tokens_seen": 5508936976,
      "step": 7002
    },
    {
      "epoch": 0.742945045618502,
      "grad_norm": 0.461848157546614,
      "learning_rate": 4.954124814546723e-05,
      "loss": 1.9197,
      "num_input_tokens_seen": 5509723664,
      "step": 7003
    },
    {
      "epoch": 0.7430511351580734,
      "grad_norm": 0.597161929781615,
      "learning_rate": 4.9541115611019204e-05,
      "loss": 1.961,
      "num_input_tokens_seen": 5510510448,
      "step": 7004
    },
    {
      "epoch": 0.7431572246976448,
      "grad_norm": 0.4721290742137207,
      "learning_rate": 4.9540983057606534e-05,
      "loss": 1.941,
      "num_input_tokens_seen": 5511297232,
      "step": 7005
    },
    {
      "epoch": 0.7432633142372163,
      "grad_norm": 0.46097213979462137,
      "learning_rate": 4.9540850485229304e-05,
      "loss": 1.9112,
      "num_input_tokens_seen": 5512084048,
      "step": 7006
    },
    {
      "epoch": 0.7433694037767876,
      "grad_norm": 0.45981106491174295,
      "learning_rate": 4.954071789388762e-05,
      "loss": 2.1283,
      "num_input_tokens_seen": 5512870784,
      "step": 7007
    },
    {
      "epoch": 0.743475493316359,
      "grad_norm": 0.4676548272604411,
      "learning_rate": 4.95405852835816e-05,
      "loss": 1.9286,
      "num_input_tokens_seen": 5513657568,
      "step": 7008
    },
    {
      "epoch": 0.7435815828559305,
      "grad_norm": 0.6374828823695484,
      "learning_rate": 4.954045265431133e-05,
      "loss": 1.967,
      "num_input_tokens_seen": 5514444336,
      "step": 7009
    },
    {
      "epoch": 0.7436876723955018,
      "grad_norm": 0.4346650137080699,
      "learning_rate": 4.9540320006076925e-05,
      "loss": 1.9256,
      "num_input_tokens_seen": 5515231008,
      "step": 7010
    },
    {
      "epoch": 0.7437937619350732,
      "grad_norm": 0.4189416450149276,
      "learning_rate": 4.9540187338878477e-05,
      "loss": 1.9368,
      "num_input_tokens_seen": 5516017872,
      "step": 7011
    },
    {
      "epoch": 0.7438998514746445,
      "grad_norm": 0.5008798398589429,
      "learning_rate": 4.9540054652716086e-05,
      "loss": 1.8885,
      "num_input_tokens_seen": 5516804576,
      "step": 7012
    },
    {
      "epoch": 0.744005941014216,
      "grad_norm": 0.4902451643541979,
      "learning_rate": 4.953992194758986e-05,
      "loss": 1.9409,
      "num_input_tokens_seen": 5517591424,
      "step": 7013
    },
    {
      "epoch": 0.7441120305537874,
      "grad_norm": 0.6051774506395593,
      "learning_rate": 4.953978922349991e-05,
      "loss": 1.9224,
      "num_input_tokens_seen": 5518378240,
      "step": 7014
    },
    {
      "epoch": 0.7442181200933587,
      "grad_norm": 0.46060983959640367,
      "learning_rate": 4.9539656480446326e-05,
      "loss": 1.9317,
      "num_input_tokens_seen": 5519165024,
      "step": 7015
    },
    {
      "epoch": 0.7443242096329302,
      "grad_norm": 0.7340205766088123,
      "learning_rate": 4.953952371842922e-05,
      "loss": 1.8645,
      "num_input_tokens_seen": 5519951776,
      "step": 7016
    },
    {
      "epoch": 0.7444302991725016,
      "grad_norm": 0.3661174672133763,
      "learning_rate": 4.9539390937448695e-05,
      "loss": 1.7895,
      "num_input_tokens_seen": 5520738528,
      "step": 7017
    },
    {
      "epoch": 0.744536388712073,
      "grad_norm": 1.492837747564203,
      "learning_rate": 4.9539258137504835e-05,
      "loss": 1.9025,
      "num_input_tokens_seen": 5521525328,
      "step": 7018
    },
    {
      "epoch": 0.7446424782516444,
      "grad_norm": 0.6108483438774199,
      "learning_rate": 4.9539125318597765e-05,
      "loss": 1.8937,
      "num_input_tokens_seen": 5522312080,
      "step": 7019
    },
    {
      "epoch": 0.7447485677912158,
      "grad_norm": 0.7735224788453281,
      "learning_rate": 4.953899248072757e-05,
      "loss": 1.8949,
      "num_input_tokens_seen": 5523098816,
      "step": 7020
    },
    {
      "epoch": 0.7448546573307872,
      "grad_norm": 0.5120935484984781,
      "learning_rate": 4.953885962389437e-05,
      "loss": 2.025,
      "num_input_tokens_seen": 5523885584,
      "step": 7021
    },
    {
      "epoch": 0.7449607468703586,
      "grad_norm": 0.9052458579120372,
      "learning_rate": 4.9538726748098264e-05,
      "loss": 2.0214,
      "num_input_tokens_seen": 5524672304,
      "step": 7022
    },
    {
      "epoch": 0.74506683640993,
      "grad_norm": 0.7078970647002144,
      "learning_rate": 4.9538593853339346e-05,
      "loss": 1.962,
      "num_input_tokens_seen": 5525459088,
      "step": 7023
    },
    {
      "epoch": 0.7451729259495014,
      "grad_norm": 0.5675234881032744,
      "learning_rate": 4.953846093961771e-05,
      "loss": 2.07,
      "num_input_tokens_seen": 5526245856,
      "step": 7024
    },
    {
      "epoch": 0.7452790154890728,
      "grad_norm": 0.5252204715321901,
      "learning_rate": 4.953832800693349e-05,
      "loss": 1.7804,
      "num_input_tokens_seen": 5527032640,
      "step": 7025
    },
    {
      "epoch": 0.7453851050286442,
      "grad_norm": 0.6827946660574974,
      "learning_rate": 4.953819505528676e-05,
      "loss": 1.9822,
      "num_input_tokens_seen": 5527819440,
      "step": 7026
    },
    {
      "epoch": 0.7454911945682156,
      "grad_norm": 0.5102788121849795,
      "learning_rate": 4.953806208467764e-05,
      "loss": 1.9499,
      "num_input_tokens_seen": 5528606176,
      "step": 7027
    },
    {
      "epoch": 0.7455972841077869,
      "grad_norm": 0.6961235130774962,
      "learning_rate": 4.953792909510622e-05,
      "loss": 1.936,
      "num_input_tokens_seen": 5529392880,
      "step": 7028
    },
    {
      "epoch": 0.7457033736473584,
      "grad_norm": 0.48821427418140345,
      "learning_rate": 4.953779608657261e-05,
      "loss": 1.9251,
      "num_input_tokens_seen": 5530179760,
      "step": 7029
    },
    {
      "epoch": 0.7458094631869298,
      "grad_norm": 0.9141113875917636,
      "learning_rate": 4.9537663059076906e-05,
      "loss": 2.106,
      "num_input_tokens_seen": 5530966576,
      "step": 7030
    },
    {
      "epoch": 0.7459155527265011,
      "grad_norm": 0.46782459025399425,
      "learning_rate": 4.953753001261922e-05,
      "loss": 1.9903,
      "num_input_tokens_seen": 5531753376,
      "step": 7031
    },
    {
      "epoch": 0.7460216422660726,
      "grad_norm": 0.8050844583902073,
      "learning_rate": 4.9537396947199655e-05,
      "loss": 1.8252,
      "num_input_tokens_seen": 5532540160,
      "step": 7032
    },
    {
      "epoch": 0.746127731805644,
      "grad_norm": 0.4457887619274589,
      "learning_rate": 4.9537263862818304e-05,
      "loss": 2.0099,
      "num_input_tokens_seen": 5533326880,
      "step": 7033
    },
    {
      "epoch": 0.7462338213452153,
      "grad_norm": 0.8142642442253971,
      "learning_rate": 4.953713075947527e-05,
      "loss": 1.85,
      "num_input_tokens_seen": 5534113744,
      "step": 7034
    },
    {
      "epoch": 0.7463399108847868,
      "grad_norm": 0.5146295714845309,
      "learning_rate": 4.953699763717067e-05,
      "loss": 1.9629,
      "num_input_tokens_seen": 5534900560,
      "step": 7035
    },
    {
      "epoch": 0.7464460004243582,
      "grad_norm": 0.7111068951575265,
      "learning_rate": 4.95368644959046e-05,
      "loss": 2.0127,
      "num_input_tokens_seen": 5535687376,
      "step": 7036
    },
    {
      "epoch": 0.7465520899639295,
      "grad_norm": 0.7543565220931152,
      "learning_rate": 4.953673133567715e-05,
      "loss": 2.0203,
      "num_input_tokens_seen": 5536474096,
      "step": 7037
    },
    {
      "epoch": 0.746658179503501,
      "grad_norm": 0.6053161742577406,
      "learning_rate": 4.9536598156488446e-05,
      "loss": 1.9127,
      "num_input_tokens_seen": 5537260944,
      "step": 7038
    },
    {
      "epoch": 0.7467642690430724,
      "grad_norm": 1.0692886154686434,
      "learning_rate": 4.953646495833858e-05,
      "loss": 2.0771,
      "num_input_tokens_seen": 5538047728,
      "step": 7039
    },
    {
      "epoch": 0.7468703585826437,
      "grad_norm": 0.5263987066519923,
      "learning_rate": 4.953633174122765e-05,
      "loss": 1.935,
      "num_input_tokens_seen": 5538834368,
      "step": 7040
    },
    {
      "epoch": 0.7469764481222152,
      "grad_norm": 1.0055479138354595,
      "learning_rate": 4.9536198505155755e-05,
      "loss": 1.9231,
      "num_input_tokens_seen": 5539621104,
      "step": 7041
    },
    {
      "epoch": 0.7470825376617866,
      "grad_norm": 0.37948124712035775,
      "learning_rate": 4.953606525012301e-05,
      "loss": 1.7082,
      "num_input_tokens_seen": 5540408000,
      "step": 7042
    },
    {
      "epoch": 0.7471886272013579,
      "grad_norm": 1.3606368285136143,
      "learning_rate": 4.9535931976129516e-05,
      "loss": 1.9567,
      "num_input_tokens_seen": 5541194720,
      "step": 7043
    },
    {
      "epoch": 0.7472947167409294,
      "grad_norm": 0.5014483861742053,
      "learning_rate": 4.9535798683175374e-05,
      "loss": 1.9135,
      "num_input_tokens_seen": 5541981552,
      "step": 7044
    },
    {
      "epoch": 0.7474008062805008,
      "grad_norm": 0.6852228262311084,
      "learning_rate": 4.9535665371260685e-05,
      "loss": 2.0016,
      "num_input_tokens_seen": 5542768160,
      "step": 7045
    },
    {
      "epoch": 0.7475068958200721,
      "grad_norm": 0.7099201007751162,
      "learning_rate": 4.9535532040385556e-05,
      "loss": 2.1078,
      "num_input_tokens_seen": 5543554928,
      "step": 7046
    },
    {
      "epoch": 0.7476129853596435,
      "grad_norm": 0.693547032611728,
      "learning_rate": 4.953539869055008e-05,
      "loss": 1.9166,
      "num_input_tokens_seen": 5544341600,
      "step": 7047
    },
    {
      "epoch": 0.747719074899215,
      "grad_norm": 0.6224316159044582,
      "learning_rate": 4.953526532175438e-05,
      "loss": 1.9526,
      "num_input_tokens_seen": 5545128352,
      "step": 7048
    },
    {
      "epoch": 0.7478251644387863,
      "grad_norm": 0.5282879547042072,
      "learning_rate": 4.953513193399854e-05,
      "loss": 1.941,
      "num_input_tokens_seen": 5545915088,
      "step": 7049
    },
    {
      "epoch": 0.7479312539783577,
      "grad_norm": 0.45656317261793306,
      "learning_rate": 4.953499852728267e-05,
      "loss": 1.9536,
      "num_input_tokens_seen": 5546701776,
      "step": 7050
    },
    {
      "epoch": 0.7480373435179292,
      "grad_norm": 0.46563438460395945,
      "learning_rate": 4.953486510160688e-05,
      "loss": 2.0153,
      "num_input_tokens_seen": 5547488480,
      "step": 7051
    },
    {
      "epoch": 0.7481434330575005,
      "grad_norm": 0.832200782976246,
      "learning_rate": 4.953473165697125e-05,
      "loss": 1.9692,
      "num_input_tokens_seen": 5548275216,
      "step": 7052
    },
    {
      "epoch": 0.7482495225970719,
      "grad_norm": 0.9587111797316346,
      "learning_rate": 4.9534598193375914e-05,
      "loss": 1.904,
      "num_input_tokens_seen": 5549062000,
      "step": 7053
    },
    {
      "epoch": 0.7483556121366434,
      "grad_norm": 0.4558545516876264,
      "learning_rate": 4.953446471082096e-05,
      "loss": 2.0172,
      "num_input_tokens_seen": 5549848816,
      "step": 7054
    },
    {
      "epoch": 0.7484617016762147,
      "grad_norm": 0.5486785962452906,
      "learning_rate": 4.9534331209306486e-05,
      "loss": 1.7859,
      "num_input_tokens_seen": 5550635616,
      "step": 7055
    },
    {
      "epoch": 0.7485677912157861,
      "grad_norm": 0.502351848571285,
      "learning_rate": 4.95341976888326e-05,
      "loss": 2.0577,
      "num_input_tokens_seen": 5551422384,
      "step": 7056
    },
    {
      "epoch": 0.7486738807553576,
      "grad_norm": 0.5242494794200037,
      "learning_rate": 4.9534064149399406e-05,
      "loss": 1.9822,
      "num_input_tokens_seen": 5552209184,
      "step": 7057
    },
    {
      "epoch": 0.7487799702949289,
      "grad_norm": 0.5316197297324928,
      "learning_rate": 4.953393059100701e-05,
      "loss": 1.7382,
      "num_input_tokens_seen": 5552995952,
      "step": 7058
    },
    {
      "epoch": 0.7488860598345003,
      "grad_norm": 0.4903052665346286,
      "learning_rate": 4.9533797013655515e-05,
      "loss": 2.1534,
      "num_input_tokens_seen": 5553782656,
      "step": 7059
    },
    {
      "epoch": 0.7489921493740718,
      "grad_norm": 0.6279815530578559,
      "learning_rate": 4.9533663417345014e-05,
      "loss": 2.0095,
      "num_input_tokens_seen": 5554569456,
      "step": 7060
    },
    {
      "epoch": 0.7490982389136431,
      "grad_norm": 0.61736380411731,
      "learning_rate": 4.9533529802075625e-05,
      "loss": 2.0022,
      "num_input_tokens_seen": 5555356288,
      "step": 7061
    },
    {
      "epoch": 0.7492043284532145,
      "grad_norm": 0.5544131134486266,
      "learning_rate": 4.953339616784744e-05,
      "loss": 1.9118,
      "num_input_tokens_seen": 5556143008,
      "step": 7062
    },
    {
      "epoch": 0.7493104179927859,
      "grad_norm": 0.5083932732606239,
      "learning_rate": 4.9533262514660564e-05,
      "loss": 1.9569,
      "num_input_tokens_seen": 5556929712,
      "step": 7063
    },
    {
      "epoch": 0.7494165075323573,
      "grad_norm": 0.8968496079476708,
      "learning_rate": 4.953312884251511e-05,
      "loss": 1.9533,
      "num_input_tokens_seen": 5557716384,
      "step": 7064
    },
    {
      "epoch": 0.7495225970719287,
      "grad_norm": 0.702947908149766,
      "learning_rate": 4.9532995151411166e-05,
      "loss": 2.0309,
      "num_input_tokens_seen": 5558503152,
      "step": 7065
    },
    {
      "epoch": 0.7496286866115001,
      "grad_norm": 0.9456158670014729,
      "learning_rate": 4.953286144134885e-05,
      "loss": 2.0807,
      "num_input_tokens_seen": 5559289792,
      "step": 7066
    },
    {
      "epoch": 0.7497347761510715,
      "grad_norm": 0.6502678318931343,
      "learning_rate": 4.9532727712328256e-05,
      "loss": 1.8676,
      "num_input_tokens_seen": 5560076576,
      "step": 7067
    },
    {
      "epoch": 0.7498408656906429,
      "grad_norm": 0.9185357875641893,
      "learning_rate": 4.9532593964349485e-05,
      "loss": 1.8255,
      "num_input_tokens_seen": 5560863360,
      "step": 7068
    },
    {
      "epoch": 0.7499469552302143,
      "grad_norm": 0.5413461150184204,
      "learning_rate": 4.953246019741265e-05,
      "loss": 1.9637,
      "num_input_tokens_seen": 5561650128,
      "step": 7069
    },
    {
      "epoch": 0.7500530447697857,
      "grad_norm": 0.6921348148021379,
      "learning_rate": 4.953232641151785e-05,
      "loss": 1.7932,
      "num_input_tokens_seen": 5562436832,
      "step": 7070
    },
    {
      "epoch": 0.7501591343093571,
      "grad_norm": 0.5208037618835152,
      "learning_rate": 4.953219260666518e-05,
      "loss": 1.9233,
      "num_input_tokens_seen": 5563223584,
      "step": 7071
    },
    {
      "epoch": 0.7502652238489285,
      "grad_norm": 0.6398843216181463,
      "learning_rate": 4.953205878285476e-05,
      "loss": 1.9239,
      "num_input_tokens_seen": 5564010352,
      "step": 7072
    },
    {
      "epoch": 0.7503713133884999,
      "grad_norm": 0.4472704395825509,
      "learning_rate": 4.9531924940086684e-05,
      "loss": 1.8779,
      "num_input_tokens_seen": 5564797120,
      "step": 7073
    },
    {
      "epoch": 0.7504774029280713,
      "grad_norm": 0.5862688531675082,
      "learning_rate": 4.953179107836106e-05,
      "loss": 1.9318,
      "num_input_tokens_seen": 5565583808,
      "step": 7074
    },
    {
      "epoch": 0.7505834924676427,
      "grad_norm": 0.41630565067454434,
      "learning_rate": 4.953165719767798e-05,
      "loss": 1.9041,
      "num_input_tokens_seen": 5566370544,
      "step": 7075
    },
    {
      "epoch": 0.7506895820072141,
      "grad_norm": 0.41445316839178004,
      "learning_rate": 4.9531523298037556e-05,
      "loss": 1.9416,
      "num_input_tokens_seen": 5567157296,
      "step": 7076
    },
    {
      "epoch": 0.7507956715467855,
      "grad_norm": 0.6312902275931742,
      "learning_rate": 4.9531389379439896e-05,
      "loss": 2.013,
      "num_input_tokens_seen": 5567944080,
      "step": 7077
    },
    {
      "epoch": 0.7509017610863569,
      "grad_norm": 0.47762548102622043,
      "learning_rate": 4.9531255441885096e-05,
      "loss": 2.0327,
      "num_input_tokens_seen": 5568730816,
      "step": 7078
    },
    {
      "epoch": 0.7510078506259282,
      "grad_norm": 0.506025112963276,
      "learning_rate": 4.953112148537326e-05,
      "loss": 1.8971,
      "num_input_tokens_seen": 5569517536,
      "step": 7079
    },
    {
      "epoch": 0.7511139401654997,
      "grad_norm": 0.5696416650907459,
      "learning_rate": 4.953098750990449e-05,
      "loss": 2.0179,
      "num_input_tokens_seen": 5570304240,
      "step": 7080
    },
    {
      "epoch": 0.7512200297050711,
      "grad_norm": 0.5665152011119446,
      "learning_rate": 4.95308535154789e-05,
      "loss": 2.0405,
      "num_input_tokens_seen": 5571090944,
      "step": 7081
    },
    {
      "epoch": 0.7513261192446424,
      "grad_norm": 0.5719632906905233,
      "learning_rate": 4.9530719502096576e-05,
      "loss": 1.952,
      "num_input_tokens_seen": 5571877744,
      "step": 7082
    },
    {
      "epoch": 0.7514322087842139,
      "grad_norm": 0.47681621068367114,
      "learning_rate": 4.953058546975764e-05,
      "loss": 1.954,
      "num_input_tokens_seen": 5572664560,
      "step": 7083
    },
    {
      "epoch": 0.7515382983237853,
      "grad_norm": 0.5626312645876976,
      "learning_rate": 4.953045141846219e-05,
      "loss": 2.0179,
      "num_input_tokens_seen": 5573451280,
      "step": 7084
    },
    {
      "epoch": 0.7516443878633566,
      "grad_norm": 0.41279601689308365,
      "learning_rate": 4.953031734821032e-05,
      "loss": 1.8421,
      "num_input_tokens_seen": 5574238096,
      "step": 7085
    },
    {
      "epoch": 0.7517504774029281,
      "grad_norm": 0.45886619818411567,
      "learning_rate": 4.953018325900214e-05,
      "loss": 1.8272,
      "num_input_tokens_seen": 5575024800,
      "step": 7086
    },
    {
      "epoch": 0.7518565669424995,
      "grad_norm": 0.4114239507336063,
      "learning_rate": 4.953004915083775e-05,
      "loss": 1.8891,
      "num_input_tokens_seen": 5575811600,
      "step": 7087
    },
    {
      "epoch": 0.7519626564820708,
      "grad_norm": 0.48008053304806564,
      "learning_rate": 4.952991502371727e-05,
      "loss": 2.0943,
      "num_input_tokens_seen": 5576598400,
      "step": 7088
    },
    {
      "epoch": 0.7520687460216423,
      "grad_norm": 0.5198605818540863,
      "learning_rate": 4.952978087764079e-05,
      "loss": 1.8817,
      "num_input_tokens_seen": 5577385216,
      "step": 7089
    },
    {
      "epoch": 0.7521748355612137,
      "grad_norm": 0.7179181088288411,
      "learning_rate": 4.9529646712608405e-05,
      "loss": 2.1042,
      "num_input_tokens_seen": 5578171968,
      "step": 7090
    },
    {
      "epoch": 0.752280925100785,
      "grad_norm": 0.46134589240517215,
      "learning_rate": 4.952951252862024e-05,
      "loss": 1.9464,
      "num_input_tokens_seen": 5578958720,
      "step": 7091
    },
    {
      "epoch": 0.7523870146403565,
      "grad_norm": 0.6123734494363519,
      "learning_rate": 4.9529378325676376e-05,
      "loss": 2.013,
      "num_input_tokens_seen": 5579745472,
      "step": 7092
    },
    {
      "epoch": 0.7524931041799279,
      "grad_norm": 0.586160142217925,
      "learning_rate": 4.952924410377694e-05,
      "loss": 1.8648,
      "num_input_tokens_seen": 5580532272,
      "step": 7093
    },
    {
      "epoch": 0.7525991937194992,
      "grad_norm": 0.5519033804652098,
      "learning_rate": 4.9529109862922016e-05,
      "loss": 1.8098,
      "num_input_tokens_seen": 5581319120,
      "step": 7094
    },
    {
      "epoch": 0.7527052832590706,
      "grad_norm": 0.5187919468575545,
      "learning_rate": 4.9528975603111715e-05,
      "loss": 1.9352,
      "num_input_tokens_seen": 5582105824,
      "step": 7095
    },
    {
      "epoch": 0.7528113727986421,
      "grad_norm": 1.0476683009183785,
      "learning_rate": 4.9528841324346146e-05,
      "loss": 1.8669,
      "num_input_tokens_seen": 5582892528,
      "step": 7096
    },
    {
      "epoch": 0.7529174623382134,
      "grad_norm": 0.5453646534507398,
      "learning_rate": 4.952870702662541e-05,
      "loss": 1.9376,
      "num_input_tokens_seen": 5583679200,
      "step": 7097
    },
    {
      "epoch": 0.7530235518777848,
      "grad_norm": 0.9767776079893243,
      "learning_rate": 4.9528572709949605e-05,
      "loss": 1.9654,
      "num_input_tokens_seen": 5584465824,
      "step": 7098
    },
    {
      "epoch": 0.7531296414173563,
      "grad_norm": 0.9596721525005861,
      "learning_rate": 4.952843837431884e-05,
      "loss": 1.951,
      "num_input_tokens_seen": 5585252528,
      "step": 7099
    },
    {
      "epoch": 0.7532357309569276,
      "grad_norm": 0.51678464067957,
      "learning_rate": 4.952830401973322e-05,
      "loss": 2.0038,
      "num_input_tokens_seen": 5586039184,
      "step": 7100
    },
    {
      "epoch": 0.753341820496499,
      "grad_norm": 0.5095012209300556,
      "learning_rate": 4.9528169646192836e-05,
      "loss": 1.971,
      "num_input_tokens_seen": 5586826000,
      "step": 7101
    },
    {
      "epoch": 0.7534479100360705,
      "grad_norm": 0.5026051501688193,
      "learning_rate": 4.952803525369781e-05,
      "loss": 1.9472,
      "num_input_tokens_seen": 5587612768,
      "step": 7102
    },
    {
      "epoch": 0.7535539995756418,
      "grad_norm": 0.5415144747329512,
      "learning_rate": 4.952790084224824e-05,
      "loss": 1.9034,
      "num_input_tokens_seen": 5588399472,
      "step": 7103
    },
    {
      "epoch": 0.7536600891152132,
      "grad_norm": 0.5536617138210175,
      "learning_rate": 4.952776641184422e-05,
      "loss": 2.0136,
      "num_input_tokens_seen": 5589186144,
      "step": 7104
    },
    {
      "epoch": 0.7537661786547847,
      "grad_norm": 0.7414270666005021,
      "learning_rate": 4.9527631962485864e-05,
      "loss": 1.7901,
      "num_input_tokens_seen": 5589972912,
      "step": 7105
    },
    {
      "epoch": 0.753872268194356,
      "grad_norm": 0.5201379071972586,
      "learning_rate": 4.952749749417328e-05,
      "loss": 1.8683,
      "num_input_tokens_seen": 5590759712,
      "step": 7106
    },
    {
      "epoch": 0.7539783577339274,
      "grad_norm": 0.9304507526667581,
      "learning_rate": 4.9527363006906566e-05,
      "loss": 2.0134,
      "num_input_tokens_seen": 5591546480,
      "step": 7107
    },
    {
      "epoch": 0.7540844472734989,
      "grad_norm": 0.6057815919116902,
      "learning_rate": 4.9527228500685816e-05,
      "loss": 2.0171,
      "num_input_tokens_seen": 5592333152,
      "step": 7108
    },
    {
      "epoch": 0.7541905368130702,
      "grad_norm": 0.6397860641370461,
      "learning_rate": 4.952709397551115e-05,
      "loss": 1.8694,
      "num_input_tokens_seen": 5593119952,
      "step": 7109
    },
    {
      "epoch": 0.7542966263526416,
      "grad_norm": 0.686166160897097,
      "learning_rate": 4.952695943138267e-05,
      "loss": 2.0693,
      "num_input_tokens_seen": 5593906656,
      "step": 7110
    },
    {
      "epoch": 0.7544027158922131,
      "grad_norm": 0.5116977338005505,
      "learning_rate": 4.952682486830047e-05,
      "loss": 1.9268,
      "num_input_tokens_seen": 5594693424,
      "step": 7111
    },
    {
      "epoch": 0.7545088054317844,
      "grad_norm": 0.8210071937531407,
      "learning_rate": 4.952669028626465e-05,
      "loss": 2.0174,
      "num_input_tokens_seen": 5595480064,
      "step": 7112
    },
    {
      "epoch": 0.7546148949713558,
      "grad_norm": 0.6031319588067982,
      "learning_rate": 4.952655568527534e-05,
      "loss": 1.9211,
      "num_input_tokens_seen": 5596266832,
      "step": 7113
    },
    {
      "epoch": 0.7547209845109272,
      "grad_norm": 0.4839972528631048,
      "learning_rate": 4.952642106533262e-05,
      "loss": 1.9638,
      "num_input_tokens_seen": 5597053600,
      "step": 7114
    },
    {
      "epoch": 0.7548270740504986,
      "grad_norm": 0.6400567115911301,
      "learning_rate": 4.9526286426436605e-05,
      "loss": 1.9278,
      "num_input_tokens_seen": 5597840304,
      "step": 7115
    },
    {
      "epoch": 0.75493316359007,
      "grad_norm": 0.5091573646182613,
      "learning_rate": 4.952615176858739e-05,
      "loss": 1.9822,
      "num_input_tokens_seen": 5598627152,
      "step": 7116
    },
    {
      "epoch": 0.7550392531296414,
      "grad_norm": 0.48659919403976193,
      "learning_rate": 4.9526017091785086e-05,
      "loss": 2.189,
      "num_input_tokens_seen": 5599413904,
      "step": 7117
    },
    {
      "epoch": 0.7551453426692128,
      "grad_norm": 0.4456801138568411,
      "learning_rate": 4.95258823960298e-05,
      "loss": 2.0117,
      "num_input_tokens_seen": 5600200656,
      "step": 7118
    },
    {
      "epoch": 0.7552514322087842,
      "grad_norm": 0.45120632437882824,
      "learning_rate": 4.9525747681321625e-05,
      "loss": 1.9758,
      "num_input_tokens_seen": 5600987360,
      "step": 7119
    },
    {
      "epoch": 0.7553575217483556,
      "grad_norm": 0.4054604526561747,
      "learning_rate": 4.952561294766067e-05,
      "loss": 1.8536,
      "num_input_tokens_seen": 5601774080,
      "step": 7120
    },
    {
      "epoch": 0.755463611287927,
      "grad_norm": 0.437635406869221,
      "learning_rate": 4.952547819504705e-05,
      "loss": 1.937,
      "num_input_tokens_seen": 5602560880,
      "step": 7121
    },
    {
      "epoch": 0.7555697008274984,
      "grad_norm": 0.5058555055014378,
      "learning_rate": 4.952534342348086e-05,
      "loss": 1.908,
      "num_input_tokens_seen": 5603347712,
      "step": 7122
    },
    {
      "epoch": 0.7556757903670698,
      "grad_norm": 0.43386750864879936,
      "learning_rate": 4.9525208632962195e-05,
      "loss": 1.8299,
      "num_input_tokens_seen": 5604134512,
      "step": 7123
    },
    {
      "epoch": 0.7557818799066413,
      "grad_norm": 0.5264507035680013,
      "learning_rate": 4.9525073823491175e-05,
      "loss": 1.9427,
      "num_input_tokens_seen": 5604921184,
      "step": 7124
    },
    {
      "epoch": 0.7558879694462126,
      "grad_norm": 0.6677910959200232,
      "learning_rate": 4.9524938995067894e-05,
      "loss": 1.9516,
      "num_input_tokens_seen": 5605707888,
      "step": 7125
    },
    {
      "epoch": 0.755994058985784,
      "grad_norm": 0.4363608605478817,
      "learning_rate": 4.952480414769247e-05,
      "loss": 1.9774,
      "num_input_tokens_seen": 5606494704,
      "step": 7126
    },
    {
      "epoch": 0.7561001485253555,
      "grad_norm": 0.5024028419638458,
      "learning_rate": 4.9524669281364984e-05,
      "loss": 2.0042,
      "num_input_tokens_seen": 5607281440,
      "step": 7127
    },
    {
      "epoch": 0.7562062380649268,
      "grad_norm": 0.5815390893802267,
      "learning_rate": 4.952453439608556e-05,
      "loss": 1.8656,
      "num_input_tokens_seen": 5608068128,
      "step": 7128
    },
    {
      "epoch": 0.7563123276044982,
      "grad_norm": 0.4057556915922111,
      "learning_rate": 4.952439949185429e-05,
      "loss": 1.929,
      "num_input_tokens_seen": 5608854848,
      "step": 7129
    },
    {
      "epoch": 0.7564184171440695,
      "grad_norm": 0.5056101261484442,
      "learning_rate": 4.952426456867129e-05,
      "loss": 1.9119,
      "num_input_tokens_seen": 5609641648,
      "step": 7130
    },
    {
      "epoch": 0.756524506683641,
      "grad_norm": 0.46181704163078613,
      "learning_rate": 4.952412962653665e-05,
      "loss": 2.0618,
      "num_input_tokens_seen": 5610428400,
      "step": 7131
    },
    {
      "epoch": 0.7566305962232124,
      "grad_norm": 0.4308302996949704,
      "learning_rate": 4.952399466545049e-05,
      "loss": 1.8969,
      "num_input_tokens_seen": 5611215104,
      "step": 7132
    },
    {
      "epoch": 0.7567366857627837,
      "grad_norm": 0.3965324460619826,
      "learning_rate": 4.9523859685412904e-05,
      "loss": 1.9452,
      "num_input_tokens_seen": 5612001888,
      "step": 7133
    },
    {
      "epoch": 0.7568427753023552,
      "grad_norm": 0.447779314367892,
      "learning_rate": 4.9523724686424e-05,
      "loss": 1.7555,
      "num_input_tokens_seen": 5612788736,
      "step": 7134
    },
    {
      "epoch": 0.7569488648419266,
      "grad_norm": 0.40915386698038914,
      "learning_rate": 4.9523589668483875e-05,
      "loss": 2.0854,
      "num_input_tokens_seen": 5613575456,
      "step": 7135
    },
    {
      "epoch": 0.757054954381498,
      "grad_norm": 0.45062953985342563,
      "learning_rate": 4.952345463159265e-05,
      "loss": 2.001,
      "num_input_tokens_seen": 5614362304,
      "step": 7136
    },
    {
      "epoch": 0.7571610439210694,
      "grad_norm": 0.3894129006182371,
      "learning_rate": 4.952331957575041e-05,
      "loss": 1.9258,
      "num_input_tokens_seen": 5615149120,
      "step": 7137
    },
    {
      "epoch": 0.7572671334606408,
      "grad_norm": 0.48680441905382044,
      "learning_rate": 4.952318450095728e-05,
      "loss": 1.9086,
      "num_input_tokens_seen": 5615935872,
      "step": 7138
    },
    {
      "epoch": 0.7573732230002121,
      "grad_norm": 0.4058557474747457,
      "learning_rate": 4.952304940721333e-05,
      "loss": 1.7068,
      "num_input_tokens_seen": 5616722688,
      "step": 7139
    },
    {
      "epoch": 0.7574793125397836,
      "grad_norm": 0.4522623765081724,
      "learning_rate": 4.952291429451871e-05,
      "loss": 1.7668,
      "num_input_tokens_seen": 5617509520,
      "step": 7140
    },
    {
      "epoch": 0.757585402079355,
      "grad_norm": 0.504533440299467,
      "learning_rate": 4.952277916287349e-05,
      "loss": 2.0696,
      "num_input_tokens_seen": 5618296320,
      "step": 7141
    },
    {
      "epoch": 0.7576914916189263,
      "grad_norm": 0.5325633373001344,
      "learning_rate": 4.952264401227778e-05,
      "loss": 2.0279,
      "num_input_tokens_seen": 5619083072,
      "step": 7142
    },
    {
      "epoch": 0.7577975811584978,
      "grad_norm": 0.41771047592455046,
      "learning_rate": 4.952250884273171e-05,
      "loss": 2.0044,
      "num_input_tokens_seen": 5619869840,
      "step": 7143
    },
    {
      "epoch": 0.7579036706980692,
      "grad_norm": 0.434121798422257,
      "learning_rate": 4.9522373654235345e-05,
      "loss": 1.9608,
      "num_input_tokens_seen": 5620656624,
      "step": 7144
    },
    {
      "epoch": 0.7580097602376406,
      "grad_norm": 0.5439302685780587,
      "learning_rate": 4.9522238446788815e-05,
      "loss": 1.9048,
      "num_input_tokens_seen": 5621443472,
      "step": 7145
    },
    {
      "epoch": 0.7581158497772119,
      "grad_norm": 0.4089528994969968,
      "learning_rate": 4.9522103220392226e-05,
      "loss": 1.7588,
      "num_input_tokens_seen": 5622230272,
      "step": 7146
    },
    {
      "epoch": 0.7582219393167834,
      "grad_norm": 0.5273366913957578,
      "learning_rate": 4.952196797504567e-05,
      "loss": 2.0527,
      "num_input_tokens_seen": 5623016928,
      "step": 7147
    },
    {
      "epoch": 0.7583280288563548,
      "grad_norm": 0.49705607746426395,
      "learning_rate": 4.9521832710749254e-05,
      "loss": 1.8849,
      "num_input_tokens_seen": 5623803728,
      "step": 7148
    },
    {
      "epoch": 0.7584341183959261,
      "grad_norm": 0.4630633946976443,
      "learning_rate": 4.952169742750309e-05,
      "loss": 1.9681,
      "num_input_tokens_seen": 5624590528,
      "step": 7149
    },
    {
      "epoch": 0.7585402079354976,
      "grad_norm": 0.5771023019256974,
      "learning_rate": 4.9521562125307276e-05,
      "loss": 1.9495,
      "num_input_tokens_seen": 5625377280,
      "step": 7150
    },
    {
      "epoch": 0.758646297475069,
      "grad_norm": 0.472179468064332,
      "learning_rate": 4.952142680416192e-05,
      "loss": 1.999,
      "num_input_tokens_seen": 5626164096,
      "step": 7151
    },
    {
      "epoch": 0.7587523870146403,
      "grad_norm": 0.5672234713551765,
      "learning_rate": 4.9521291464067124e-05,
      "loss": 1.8819,
      "num_input_tokens_seen": 5626950928,
      "step": 7152
    },
    {
      "epoch": 0.7588584765542118,
      "grad_norm": 0.6195679194019749,
      "learning_rate": 4.952115610502299e-05,
      "loss": 1.9267,
      "num_input_tokens_seen": 5627737776,
      "step": 7153
    },
    {
      "epoch": 0.7589645660937832,
      "grad_norm": 0.6330614650984083,
      "learning_rate": 4.952102072702962e-05,
      "loss": 1.8038,
      "num_input_tokens_seen": 5628524608,
      "step": 7154
    },
    {
      "epoch": 0.7590706556333545,
      "grad_norm": 0.56210688021721,
      "learning_rate": 4.952088533008714e-05,
      "loss": 1.9275,
      "num_input_tokens_seen": 5629311360,
      "step": 7155
    },
    {
      "epoch": 0.759176745172926,
      "grad_norm": 0.7968681218399473,
      "learning_rate": 4.952074991419563e-05,
      "loss": 1.9737,
      "num_input_tokens_seen": 5630098192,
      "step": 7156
    },
    {
      "epoch": 0.7592828347124974,
      "grad_norm": 0.5312679868525455,
      "learning_rate": 4.95206144793552e-05,
      "loss": 2.0094,
      "num_input_tokens_seen": 5630884880,
      "step": 7157
    },
    {
      "epoch": 0.7593889242520687,
      "grad_norm": 0.5555374917027552,
      "learning_rate": 4.952047902556597e-05,
      "loss": 1.8704,
      "num_input_tokens_seen": 5631671680,
      "step": 7158
    },
    {
      "epoch": 0.7594950137916402,
      "grad_norm": 0.567352523928775,
      "learning_rate": 4.952034355282803e-05,
      "loss": 2.0206,
      "num_input_tokens_seen": 5632458448,
      "step": 7159
    },
    {
      "epoch": 0.7596011033312116,
      "grad_norm": 0.45600752571004816,
      "learning_rate": 4.9520208061141483e-05,
      "loss": 1.9891,
      "num_input_tokens_seen": 5633245152,
      "step": 7160
    },
    {
      "epoch": 0.7597071928707829,
      "grad_norm": 0.6645932019428271,
      "learning_rate": 4.952007255050644e-05,
      "loss": 1.9173,
      "num_input_tokens_seen": 5634031904,
      "step": 7161
    },
    {
      "epoch": 0.7598132824103543,
      "grad_norm": 0.4474985155854693,
      "learning_rate": 4.951993702092301e-05,
      "loss": 2.0962,
      "num_input_tokens_seen": 5634818656,
      "step": 7162
    },
    {
      "epoch": 0.7599193719499258,
      "grad_norm": 0.5361372634140208,
      "learning_rate": 4.951980147239129e-05,
      "loss": 1.971,
      "num_input_tokens_seen": 5635605440,
      "step": 7163
    },
    {
      "epoch": 0.7600254614894971,
      "grad_norm": 0.6378196450116921,
      "learning_rate": 4.951966590491138e-05,
      "loss": 1.8744,
      "num_input_tokens_seen": 5636392176,
      "step": 7164
    },
    {
      "epoch": 0.7601315510290685,
      "grad_norm": 0.541372231295063,
      "learning_rate": 4.95195303184834e-05,
      "loss": 1.9754,
      "num_input_tokens_seen": 5637178912,
      "step": 7165
    },
    {
      "epoch": 0.76023764056864,
      "grad_norm": 0.5285824057328068,
      "learning_rate": 4.951939471310744e-05,
      "loss": 1.9272,
      "num_input_tokens_seen": 5637965664,
      "step": 7166
    },
    {
      "epoch": 0.7603437301082113,
      "grad_norm": 0.42784981730211474,
      "learning_rate": 4.9519259088783615e-05,
      "loss": 1.8796,
      "num_input_tokens_seen": 5638752432,
      "step": 7167
    },
    {
      "epoch": 0.7604498196477827,
      "grad_norm": 0.7003089125379047,
      "learning_rate": 4.951912344551203e-05,
      "loss": 2.1353,
      "num_input_tokens_seen": 5639539248,
      "step": 7168
    },
    {
      "epoch": 0.7605559091873542,
      "grad_norm": 0.577201135547299,
      "learning_rate": 4.951898778329277e-05,
      "loss": 1.9681,
      "num_input_tokens_seen": 5640325984,
      "step": 7169
    },
    {
      "epoch": 0.7606619987269255,
      "grad_norm": 0.44757184356077256,
      "learning_rate": 4.9518852102125976e-05,
      "loss": 1.9385,
      "num_input_tokens_seen": 5641112864,
      "step": 7170
    },
    {
      "epoch": 0.7607680882664969,
      "grad_norm": 0.48065339494659476,
      "learning_rate": 4.9518716402011725e-05,
      "loss": 1.9813,
      "num_input_tokens_seen": 5641899568,
      "step": 7171
    },
    {
      "epoch": 0.7608741778060684,
      "grad_norm": 0.45829438698728675,
      "learning_rate": 4.9518580682950125e-05,
      "loss": 1.7892,
      "num_input_tokens_seen": 5642686464,
      "step": 7172
    },
    {
      "epoch": 0.7609802673456397,
      "grad_norm": 0.47516963324293326,
      "learning_rate": 4.9518444944941286e-05,
      "loss": 1.8915,
      "num_input_tokens_seen": 5643473216,
      "step": 7173
    },
    {
      "epoch": 0.7610863568852111,
      "grad_norm": 0.7344092227009431,
      "learning_rate": 4.951830918798531e-05,
      "loss": 1.9413,
      "num_input_tokens_seen": 5644259984,
      "step": 7174
    },
    {
      "epoch": 0.7611924464247826,
      "grad_norm": 0.5275124616281458,
      "learning_rate": 4.951817341208231e-05,
      "loss": 1.9599,
      "num_input_tokens_seen": 5645046704,
      "step": 7175
    },
    {
      "epoch": 0.7612985359643539,
      "grad_norm": 0.4195181801265466,
      "learning_rate": 4.9518037617232384e-05,
      "loss": 1.9648,
      "num_input_tokens_seen": 5645833408,
      "step": 7176
    },
    {
      "epoch": 0.7614046255039253,
      "grad_norm": 0.4891820999616747,
      "learning_rate": 4.951790180343564e-05,
      "loss": 1.9228,
      "num_input_tokens_seen": 5646620192,
      "step": 7177
    },
    {
      "epoch": 0.7615107150434968,
      "grad_norm": 0.4354618724764527,
      "learning_rate": 4.9517765970692175e-05,
      "loss": 1.9497,
      "num_input_tokens_seen": 5647406976,
      "step": 7178
    },
    {
      "epoch": 0.7616168045830681,
      "grad_norm": 0.4670941828874393,
      "learning_rate": 4.95176301190021e-05,
      "loss": 1.9355,
      "num_input_tokens_seen": 5648193744,
      "step": 7179
    },
    {
      "epoch": 0.7617228941226395,
      "grad_norm": 0.4533927086368444,
      "learning_rate": 4.951749424836553e-05,
      "loss": 1.9468,
      "num_input_tokens_seen": 5648980496,
      "step": 7180
    },
    {
      "epoch": 0.7618289836622109,
      "grad_norm": 0.4478257937033599,
      "learning_rate": 4.951735835878255e-05,
      "loss": 2.0833,
      "num_input_tokens_seen": 5649767216,
      "step": 7181
    },
    {
      "epoch": 0.7619350732017823,
      "grad_norm": 0.535384089745367,
      "learning_rate": 4.951722245025327e-05,
      "loss": 1.9625,
      "num_input_tokens_seen": 5650553888,
      "step": 7182
    },
    {
      "epoch": 0.7620411627413537,
      "grad_norm": 0.39120590659244764,
      "learning_rate": 4.9517086522777814e-05,
      "loss": 1.9434,
      "num_input_tokens_seen": 5651340640,
      "step": 7183
    },
    {
      "epoch": 0.7621472522809251,
      "grad_norm": 0.4798316961095062,
      "learning_rate": 4.951695057635627e-05,
      "loss": 1.9213,
      "num_input_tokens_seen": 5652127376,
      "step": 7184
    },
    {
      "epoch": 0.7622533418204965,
      "grad_norm": 0.4040280830728575,
      "learning_rate": 4.9516814610988736e-05,
      "loss": 1.9816,
      "num_input_tokens_seen": 5652914208,
      "step": 7185
    },
    {
      "epoch": 0.7623594313600679,
      "grad_norm": 0.48483551625155785,
      "learning_rate": 4.951667862667533e-05,
      "loss": 2.0184,
      "num_input_tokens_seen": 5653700944,
      "step": 7186
    },
    {
      "epoch": 0.7624655208996393,
      "grad_norm": 0.45570151762732336,
      "learning_rate": 4.951654262341616e-05,
      "loss": 1.8825,
      "num_input_tokens_seen": 5654487744,
      "step": 7187
    },
    {
      "epoch": 0.7625716104392107,
      "grad_norm": 0.4320080663620939,
      "learning_rate": 4.951640660121132e-05,
      "loss": 1.8514,
      "num_input_tokens_seen": 5655274528,
      "step": 7188
    },
    {
      "epoch": 0.7626776999787821,
      "grad_norm": 0.5000624556011699,
      "learning_rate": 4.9516270560060926e-05,
      "loss": 2.1292,
      "num_input_tokens_seen": 5656061248,
      "step": 7189
    },
    {
      "epoch": 0.7627837895183535,
      "grad_norm": 0.5310896966735988,
      "learning_rate": 4.951613449996507e-05,
      "loss": 1.8189,
      "num_input_tokens_seen": 5656848080,
      "step": 7190
    },
    {
      "epoch": 0.7628898790579249,
      "grad_norm": 0.5155900113004017,
      "learning_rate": 4.951599842092387e-05,
      "loss": 1.9585,
      "num_input_tokens_seen": 5657634848,
      "step": 7191
    },
    {
      "epoch": 0.7629959685974963,
      "grad_norm": 0.46212170702553224,
      "learning_rate": 4.951586232293743e-05,
      "loss": 1.9577,
      "num_input_tokens_seen": 5658421776,
      "step": 7192
    },
    {
      "epoch": 0.7631020581370677,
      "grad_norm": 0.611101713309363,
      "learning_rate": 4.951572620600584e-05,
      "loss": 1.8811,
      "num_input_tokens_seen": 5659208624,
      "step": 7193
    },
    {
      "epoch": 0.7632081476766391,
      "grad_norm": 0.5469539381510234,
      "learning_rate": 4.951559007012922e-05,
      "loss": 1.8724,
      "num_input_tokens_seen": 5659995408,
      "step": 7194
    },
    {
      "epoch": 0.7633142372162105,
      "grad_norm": 0.42586025046662407,
      "learning_rate": 4.9515453915307674e-05,
      "loss": 1.9385,
      "num_input_tokens_seen": 5660782240,
      "step": 7195
    },
    {
      "epoch": 0.7634203267557819,
      "grad_norm": 0.5840065369082135,
      "learning_rate": 4.951531774154131e-05,
      "loss": 1.8883,
      "num_input_tokens_seen": 5661569056,
      "step": 7196
    },
    {
      "epoch": 0.7635264162953532,
      "grad_norm": 0.48418595814227905,
      "learning_rate": 4.951518154883022e-05,
      "loss": 1.8527,
      "num_input_tokens_seen": 5662355824,
      "step": 7197
    },
    {
      "epoch": 0.7636325058349247,
      "grad_norm": 0.5066174650870655,
      "learning_rate": 4.9515045337174515e-05,
      "loss": 1.7388,
      "num_input_tokens_seen": 5663142656,
      "step": 7198
    },
    {
      "epoch": 0.7637385953744961,
      "grad_norm": 0.5511577314734651,
      "learning_rate": 4.951490910657431e-05,
      "loss": 2.1047,
      "num_input_tokens_seen": 5663929424,
      "step": 7199
    },
    {
      "epoch": 0.7638446849140674,
      "grad_norm": 0.5819988525728883,
      "learning_rate": 4.95147728570297e-05,
      "loss": 1.9274,
      "num_input_tokens_seen": 5664716160,
      "step": 7200
    },
    {
      "epoch": 0.7639507744536389,
      "grad_norm": 0.45896580234988565,
      "learning_rate": 4.9514636588540786e-05,
      "loss": 2.077,
      "num_input_tokens_seen": 5665502960,
      "step": 7201
    },
    {
      "epoch": 0.7640568639932103,
      "grad_norm": 0.42580807966407147,
      "learning_rate": 4.9514500301107685e-05,
      "loss": 1.9542,
      "num_input_tokens_seen": 5666289648,
      "step": 7202
    },
    {
      "epoch": 0.7641629535327816,
      "grad_norm": 0.614619635247947,
      "learning_rate": 4.9514363994730496e-05,
      "loss": 1.9413,
      "num_input_tokens_seen": 5667076448,
      "step": 7203
    },
    {
      "epoch": 0.7642690430723531,
      "grad_norm": 0.43688282944402973,
      "learning_rate": 4.951422766940933e-05,
      "loss": 1.8717,
      "num_input_tokens_seen": 5667863248,
      "step": 7204
    },
    {
      "epoch": 0.7643751326119245,
      "grad_norm": 0.6016250610891338,
      "learning_rate": 4.9514091325144286e-05,
      "loss": 1.9081,
      "num_input_tokens_seen": 5668650048,
      "step": 7205
    },
    {
      "epoch": 0.7644812221514958,
      "grad_norm": 0.5013267805020956,
      "learning_rate": 4.951395496193547e-05,
      "loss": 2.0351,
      "num_input_tokens_seen": 5669436688,
      "step": 7206
    },
    {
      "epoch": 0.7645873116910673,
      "grad_norm": 0.5135275970682209,
      "learning_rate": 4.951381857978299e-05,
      "loss": 1.9681,
      "num_input_tokens_seen": 5670223504,
      "step": 7207
    },
    {
      "epoch": 0.7646934012306387,
      "grad_norm": 0.448413200641353,
      "learning_rate": 4.951368217868695e-05,
      "loss": 2.138,
      "num_input_tokens_seen": 5671010192,
      "step": 7208
    },
    {
      "epoch": 0.76479949077021,
      "grad_norm": 0.8718602141234472,
      "learning_rate": 4.9513545758647454e-05,
      "loss": 2.0623,
      "num_input_tokens_seen": 5671796768,
      "step": 7209
    },
    {
      "epoch": 0.7649055803097815,
      "grad_norm": 0.42429757898932174,
      "learning_rate": 4.9513409319664614e-05,
      "loss": 1.8597,
      "num_input_tokens_seen": 5672583488,
      "step": 7210
    },
    {
      "epoch": 0.7650116698493529,
      "grad_norm": 1.6453654065837473,
      "learning_rate": 4.9513272861738526e-05,
      "loss": 1.9654,
      "num_input_tokens_seen": 5673370240,
      "step": 7211
    },
    {
      "epoch": 0.7651177593889242,
      "grad_norm": 0.4681765607015289,
      "learning_rate": 4.9513136384869305e-05,
      "loss": 1.9133,
      "num_input_tokens_seen": 5674157024,
      "step": 7212
    },
    {
      "epoch": 0.7652238489284956,
      "grad_norm": 1.0412786867024895,
      "learning_rate": 4.9512999889057046e-05,
      "loss": 1.8804,
      "num_input_tokens_seen": 5674943808,
      "step": 7213
    },
    {
      "epoch": 0.7653299384680671,
      "grad_norm": 0.475517663915659,
      "learning_rate": 4.9512863374301864e-05,
      "loss": 1.9057,
      "num_input_tokens_seen": 5675730576,
      "step": 7214
    },
    {
      "epoch": 0.7654360280076384,
      "grad_norm": 0.73781446970044,
      "learning_rate": 4.9512726840603854e-05,
      "loss": 1.8334,
      "num_input_tokens_seen": 5676517328,
      "step": 7215
    },
    {
      "epoch": 0.7655421175472098,
      "grad_norm": 0.5551039153517761,
      "learning_rate": 4.951259028796313e-05,
      "loss": 1.9149,
      "num_input_tokens_seen": 5677304064,
      "step": 7216
    },
    {
      "epoch": 0.7656482070867813,
      "grad_norm": 0.7096852759205514,
      "learning_rate": 4.9512453716379805e-05,
      "loss": 2.0016,
      "num_input_tokens_seen": 5678090848,
      "step": 7217
    },
    {
      "epoch": 0.7657542966263526,
      "grad_norm": 0.46475101868354074,
      "learning_rate": 4.951231712585397e-05,
      "loss": 1.8643,
      "num_input_tokens_seen": 5678877648,
      "step": 7218
    },
    {
      "epoch": 0.765860386165924,
      "grad_norm": 0.7549691792337034,
      "learning_rate": 4.951218051638573e-05,
      "loss": 2.0181,
      "num_input_tokens_seen": 5679664480,
      "step": 7219
    },
    {
      "epoch": 0.7659664757054955,
      "grad_norm": 0.7255279007530012,
      "learning_rate": 4.95120438879752e-05,
      "loss": 1.9541,
      "num_input_tokens_seen": 5680451248,
      "step": 7220
    },
    {
      "epoch": 0.7660725652450668,
      "grad_norm": 0.45615771405074246,
      "learning_rate": 4.951190724062248e-05,
      "loss": 1.9774,
      "num_input_tokens_seen": 5681238000,
      "step": 7221
    },
    {
      "epoch": 0.7661786547846382,
      "grad_norm": 0.580441835542996,
      "learning_rate": 4.9511770574327675e-05,
      "loss": 1.8832,
      "num_input_tokens_seen": 5682024752,
      "step": 7222
    },
    {
      "epoch": 0.7662847443242097,
      "grad_norm": 0.5345340318029602,
      "learning_rate": 4.9511633889090904e-05,
      "loss": 2.1592,
      "num_input_tokens_seen": 5682811584,
      "step": 7223
    },
    {
      "epoch": 0.766390833863781,
      "grad_norm": 0.5386224289762288,
      "learning_rate": 4.9511497184912246e-05,
      "loss": 1.8621,
      "num_input_tokens_seen": 5683598368,
      "step": 7224
    },
    {
      "epoch": 0.7664969234033524,
      "grad_norm": 0.5771897715915433,
      "learning_rate": 4.951136046179183e-05,
      "loss": 1.9201,
      "num_input_tokens_seen": 5684385104,
      "step": 7225
    },
    {
      "epoch": 0.7666030129429239,
      "grad_norm": 0.3776053170112729,
      "learning_rate": 4.951122371972976e-05,
      "loss": 1.869,
      "num_input_tokens_seen": 5685171840,
      "step": 7226
    },
    {
      "epoch": 0.7667091024824952,
      "grad_norm": 0.5504123900721822,
      "learning_rate": 4.951108695872613e-05,
      "loss": 1.7649,
      "num_input_tokens_seen": 5685958624,
      "step": 7227
    },
    {
      "epoch": 0.7668151920220666,
      "grad_norm": 0.4179531972558348,
      "learning_rate": 4.9510950178781046e-05,
      "loss": 1.881,
      "num_input_tokens_seen": 5686745408,
      "step": 7228
    },
    {
      "epoch": 0.766921281561638,
      "grad_norm": 0.49146862264723273,
      "learning_rate": 4.9510813379894625e-05,
      "loss": 1.9367,
      "num_input_tokens_seen": 5687532208,
      "step": 7229
    },
    {
      "epoch": 0.7670273711012094,
      "grad_norm": 0.7005069352009541,
      "learning_rate": 4.951067656206697e-05,
      "loss": 1.9021,
      "num_input_tokens_seen": 5688319104,
      "step": 7230
    },
    {
      "epoch": 0.7671334606407808,
      "grad_norm": 0.4733033137086934,
      "learning_rate": 4.951053972529818e-05,
      "loss": 1.8838,
      "num_input_tokens_seen": 5689105872,
      "step": 7231
    },
    {
      "epoch": 0.7672395501803522,
      "grad_norm": 0.4899383465661248,
      "learning_rate": 4.9510402869588355e-05,
      "loss": 1.8477,
      "num_input_tokens_seen": 5689892656,
      "step": 7232
    },
    {
      "epoch": 0.7673456397199236,
      "grad_norm": 0.5648280386502202,
      "learning_rate": 4.951026599493762e-05,
      "loss": 2.0889,
      "num_input_tokens_seen": 5690679376,
      "step": 7233
    },
    {
      "epoch": 0.767451729259495,
      "grad_norm": 0.43243185202550777,
      "learning_rate": 4.951012910134607e-05,
      "loss": 1.9196,
      "num_input_tokens_seen": 5691466176,
      "step": 7234
    },
    {
      "epoch": 0.7675578187990664,
      "grad_norm": 0.4061281205494646,
      "learning_rate": 4.9509992188813805e-05,
      "loss": 1.8715,
      "num_input_tokens_seen": 5692252960,
      "step": 7235
    },
    {
      "epoch": 0.7676639083386378,
      "grad_norm": 0.5238866659192956,
      "learning_rate": 4.9509855257340944e-05,
      "loss": 1.7492,
      "num_input_tokens_seen": 5693039728,
      "step": 7236
    },
    {
      "epoch": 0.7677699978782092,
      "grad_norm": 0.4253146864240701,
      "learning_rate": 4.950971830692758e-05,
      "loss": 1.7292,
      "num_input_tokens_seen": 5693826560,
      "step": 7237
    },
    {
      "epoch": 0.7678760874177806,
      "grad_norm": 0.5680107865219614,
      "learning_rate": 4.9509581337573827e-05,
      "loss": 2.0018,
      "num_input_tokens_seen": 5694613360,
      "step": 7238
    },
    {
      "epoch": 0.767982176957352,
      "grad_norm": 0.5806075535353096,
      "learning_rate": 4.950944434927979e-05,
      "loss": 1.8298,
      "num_input_tokens_seen": 5695400112,
      "step": 7239
    },
    {
      "epoch": 0.7680882664969234,
      "grad_norm": 0.7156503458844069,
      "learning_rate": 4.9509307342045575e-05,
      "loss": 1.9114,
      "num_input_tokens_seen": 5696186928,
      "step": 7240
    },
    {
      "epoch": 0.7681943560364948,
      "grad_norm": 0.5618539348644696,
      "learning_rate": 4.9509170315871286e-05,
      "loss": 1.9711,
      "num_input_tokens_seen": 5696973648,
      "step": 7241
    },
    {
      "epoch": 0.7683004455760662,
      "grad_norm": 0.7175696130960091,
      "learning_rate": 4.950903327075703e-05,
      "loss": 1.9211,
      "num_input_tokens_seen": 5697760432,
      "step": 7242
    },
    {
      "epoch": 0.7684065351156376,
      "grad_norm": 0.4826841538925858,
      "learning_rate": 4.950889620670291e-05,
      "loss": 1.994,
      "num_input_tokens_seen": 5698547168,
      "step": 7243
    },
    {
      "epoch": 0.768512624655209,
      "grad_norm": 0.8142253651578444,
      "learning_rate": 4.950875912370904e-05,
      "loss": 1.8877,
      "num_input_tokens_seen": 5699333952,
      "step": 7244
    },
    {
      "epoch": 0.7686187141947803,
      "grad_norm": 0.6459371033701042,
      "learning_rate": 4.9508622021775505e-05,
      "loss": 1.8223,
      "num_input_tokens_seen": 5700120784,
      "step": 7245
    },
    {
      "epoch": 0.7687248037343518,
      "grad_norm": 0.9525975488535143,
      "learning_rate": 4.950848490090244e-05,
      "loss": 1.7402,
      "num_input_tokens_seen": 5700907648,
      "step": 7246
    },
    {
      "epoch": 0.7688308932739232,
      "grad_norm": 0.6001599667690548,
      "learning_rate": 4.950834776108993e-05,
      "loss": 1.868,
      "num_input_tokens_seen": 5701694416,
      "step": 7247
    },
    {
      "epoch": 0.7689369828134945,
      "grad_norm": 0.6166730654091254,
      "learning_rate": 4.9508210602338094e-05,
      "loss": 1.6876,
      "num_input_tokens_seen": 5702481248,
      "step": 7248
    },
    {
      "epoch": 0.769043072353066,
      "grad_norm": 0.5247003211732916,
      "learning_rate": 4.9508073424647026e-05,
      "loss": 1.9219,
      "num_input_tokens_seen": 5703268016,
      "step": 7249
    },
    {
      "epoch": 0.7691491618926374,
      "grad_norm": 0.898496770284077,
      "learning_rate": 4.950793622801685e-05,
      "loss": 1.9147,
      "num_input_tokens_seen": 5704054688,
      "step": 7250
    },
    {
      "epoch": 0.7692552514322087,
      "grad_norm": 0.5055112092558797,
      "learning_rate": 4.950779901244765e-05,
      "loss": 2.0421,
      "num_input_tokens_seen": 5704841440,
      "step": 7251
    },
    {
      "epoch": 0.7693613409717802,
      "grad_norm": 0.7811416171193305,
      "learning_rate": 4.950766177793954e-05,
      "loss": 1.9494,
      "num_input_tokens_seen": 5705628112,
      "step": 7252
    },
    {
      "epoch": 0.7694674305113516,
      "grad_norm": 0.6296536473742178,
      "learning_rate": 4.950752452449263e-05,
      "loss": 1.8726,
      "num_input_tokens_seen": 5706414992,
      "step": 7253
    },
    {
      "epoch": 0.7695735200509229,
      "grad_norm": 0.7326285405916004,
      "learning_rate": 4.950738725210703e-05,
      "loss": 2.0759,
      "num_input_tokens_seen": 5707201728,
      "step": 7254
    },
    {
      "epoch": 0.7696796095904944,
      "grad_norm": 0.49885218232805456,
      "learning_rate": 4.950724996078283e-05,
      "loss": 1.8433,
      "num_input_tokens_seen": 5707988560,
      "step": 7255
    },
    {
      "epoch": 0.7697856991300658,
      "grad_norm": 0.6608517704143405,
      "learning_rate": 4.950711265052016e-05,
      "loss": 1.8946,
      "num_input_tokens_seen": 5708775488,
      "step": 7256
    },
    {
      "epoch": 0.7698917886696371,
      "grad_norm": 0.5597632343048453,
      "learning_rate": 4.950697532131909e-05,
      "loss": 1.8913,
      "num_input_tokens_seen": 5709562208,
      "step": 7257
    },
    {
      "epoch": 0.7699978782092086,
      "grad_norm": 0.6484008343413042,
      "learning_rate": 4.950683797317977e-05,
      "loss": 1.8542,
      "num_input_tokens_seen": 5710349008,
      "step": 7258
    },
    {
      "epoch": 0.77010396774878,
      "grad_norm": 0.8104640169359693,
      "learning_rate": 4.950670060610228e-05,
      "loss": 1.9913,
      "num_input_tokens_seen": 5711135728,
      "step": 7259
    },
    {
      "epoch": 0.7702100572883513,
      "grad_norm": 0.7728107994374473,
      "learning_rate": 4.950656322008673e-05,
      "loss": 1.9121,
      "num_input_tokens_seen": 5711922528,
      "step": 7260
    },
    {
      "epoch": 0.7703161468279228,
      "grad_norm": 0.734851327559249,
      "learning_rate": 4.950642581513322e-05,
      "loss": 1.9151,
      "num_input_tokens_seen": 5712709264,
      "step": 7261
    },
    {
      "epoch": 0.7704222363674942,
      "grad_norm": 0.8631864181381717,
      "learning_rate": 4.9506288391241873e-05,
      "loss": 1.9734,
      "num_input_tokens_seen": 5713495984,
      "step": 7262
    },
    {
      "epoch": 0.7705283259070655,
      "grad_norm": 0.7318132933245872,
      "learning_rate": 4.9506150948412776e-05,
      "loss": 2.0077,
      "num_input_tokens_seen": 5714282688,
      "step": 7263
    },
    {
      "epoch": 0.7706344154466369,
      "grad_norm": 0.6917273149500436,
      "learning_rate": 4.9506013486646055e-05,
      "loss": 2.074,
      "num_input_tokens_seen": 5715069472,
      "step": 7264
    },
    {
      "epoch": 0.7707405049862084,
      "grad_norm": 0.6061249073865312,
      "learning_rate": 4.95058760059418e-05,
      "loss": 1.9042,
      "num_input_tokens_seen": 5715856288,
      "step": 7265
    },
    {
      "epoch": 0.7708465945257797,
      "grad_norm": 0.7371710781233162,
      "learning_rate": 4.9505738506300114e-05,
      "loss": 1.9256,
      "num_input_tokens_seen": 5716643072,
      "step": 7266
    },
    {
      "epoch": 0.7709526840653511,
      "grad_norm": 0.6373101993654304,
      "learning_rate": 4.9505600987721124e-05,
      "loss": 2.0332,
      "num_input_tokens_seen": 5717429840,
      "step": 7267
    },
    {
      "epoch": 0.7710587736049226,
      "grad_norm": 0.7466035174725313,
      "learning_rate": 4.9505463450204924e-05,
      "loss": 2.0738,
      "num_input_tokens_seen": 5718216592,
      "step": 7268
    },
    {
      "epoch": 0.771164863144494,
      "grad_norm": 0.644118829696301,
      "learning_rate": 4.950532589375162e-05,
      "loss": 1.8757,
      "num_input_tokens_seen": 5719003408,
      "step": 7269
    },
    {
      "epoch": 0.7712709526840653,
      "grad_norm": 0.7562865893894004,
      "learning_rate": 4.950518831836132e-05,
      "loss": 1.8074,
      "num_input_tokens_seen": 5719790272,
      "step": 7270
    },
    {
      "epoch": 0.7713770422236368,
      "grad_norm": 0.49451326032354065,
      "learning_rate": 4.9505050724034125e-05,
      "loss": 1.7961,
      "num_input_tokens_seen": 5720576960,
      "step": 7271
    },
    {
      "epoch": 0.7714831317632082,
      "grad_norm": 0.6546696293633064,
      "learning_rate": 4.950491311077015e-05,
      "loss": 1.9116,
      "num_input_tokens_seen": 5721363728,
      "step": 7272
    },
    {
      "epoch": 0.7715892213027795,
      "grad_norm": 0.44709832860562637,
      "learning_rate": 4.95047754785695e-05,
      "loss": 1.9289,
      "num_input_tokens_seen": 5722150496,
      "step": 7273
    },
    {
      "epoch": 0.771695310842351,
      "grad_norm": 0.4833463101071598,
      "learning_rate": 4.950463782743227e-05,
      "loss": 1.9607,
      "num_input_tokens_seen": 5722937216,
      "step": 7274
    },
    {
      "epoch": 0.7718014003819224,
      "grad_norm": 0.68087027758004,
      "learning_rate": 4.950450015735858e-05,
      "loss": 1.8507,
      "num_input_tokens_seen": 5723723904,
      "step": 7275
    },
    {
      "epoch": 0.7719074899214937,
      "grad_norm": 0.48315266002732105,
      "learning_rate": 4.950436246834853e-05,
      "loss": 1.9549,
      "num_input_tokens_seen": 5724510688,
      "step": 7276
    },
    {
      "epoch": 0.7720135794610652,
      "grad_norm": 0.7893116998051076,
      "learning_rate": 4.950422476040223e-05,
      "loss": 1.9049,
      "num_input_tokens_seen": 5725297456,
      "step": 7277
    },
    {
      "epoch": 0.7721196690006366,
      "grad_norm": 0.6923440812364617,
      "learning_rate": 4.9504087033519774e-05,
      "loss": 1.9374,
      "num_input_tokens_seen": 5726084240,
      "step": 7278
    },
    {
      "epoch": 0.7722257585402079,
      "grad_norm": 0.5724279318471491,
      "learning_rate": 4.950394928770129e-05,
      "loss": 1.9232,
      "num_input_tokens_seen": 5726871024,
      "step": 7279
    },
    {
      "epoch": 0.7723318480797793,
      "grad_norm": 0.6997616555527459,
      "learning_rate": 4.9503811522946875e-05,
      "loss": 1.9472,
      "num_input_tokens_seen": 5727657696,
      "step": 7280
    },
    {
      "epoch": 0.7724379376193508,
      "grad_norm": 0.4505004246853993,
      "learning_rate": 4.950367373925663e-05,
      "loss": 1.7619,
      "num_input_tokens_seen": 5728444544,
      "step": 7281
    },
    {
      "epoch": 0.7725440271589221,
      "grad_norm": 0.9959210188050619,
      "learning_rate": 4.9503535936630656e-05,
      "loss": 1.8889,
      "num_input_tokens_seen": 5729231296,
      "step": 7282
    },
    {
      "epoch": 0.7726501166984935,
      "grad_norm": 0.4671859367269036,
      "learning_rate": 4.950339811506908e-05,
      "loss": 1.9107,
      "num_input_tokens_seen": 5730018048,
      "step": 7283
    },
    {
      "epoch": 0.772756206238065,
      "grad_norm": 0.9707481487952195,
      "learning_rate": 4.9503260274571986e-05,
      "loss": 2.0287,
      "num_input_tokens_seen": 5730804704,
      "step": 7284
    },
    {
      "epoch": 0.7728622957776363,
      "grad_norm": 0.5802703368932548,
      "learning_rate": 4.9503122415139505e-05,
      "loss": 2.039,
      "num_input_tokens_seen": 5731591552,
      "step": 7285
    },
    {
      "epoch": 0.7729683853172077,
      "grad_norm": 0.6485722651696615,
      "learning_rate": 4.950298453677172e-05,
      "loss": 1.8494,
      "num_input_tokens_seen": 5732378320,
      "step": 7286
    },
    {
      "epoch": 0.7730744748567792,
      "grad_norm": 0.4999316735851496,
      "learning_rate": 4.9502846639468746e-05,
      "loss": 1.8652,
      "num_input_tokens_seen": 5733165248,
      "step": 7287
    },
    {
      "epoch": 0.7731805643963505,
      "grad_norm": 0.5385643091679672,
      "learning_rate": 4.95027087232307e-05,
      "loss": 1.8591,
      "num_input_tokens_seen": 5733952064,
      "step": 7288
    },
    {
      "epoch": 0.7732866539359219,
      "grad_norm": 0.6141185601165645,
      "learning_rate": 4.9502570788057676e-05,
      "loss": 1.9151,
      "num_input_tokens_seen": 5734738864,
      "step": 7289
    },
    {
      "epoch": 0.7733927434754934,
      "grad_norm": 0.5315451894725003,
      "learning_rate": 4.950243283394978e-05,
      "loss": 1.8658,
      "num_input_tokens_seen": 5735525680,
      "step": 7290
    },
    {
      "epoch": 0.7734988330150647,
      "grad_norm": 0.6338706625318903,
      "learning_rate": 4.950229486090713e-05,
      "loss": 1.9464,
      "num_input_tokens_seen": 5736312496,
      "step": 7291
    },
    {
      "epoch": 0.7736049225546361,
      "grad_norm": 0.6292852303866333,
      "learning_rate": 4.9502156868929814e-05,
      "loss": 1.981,
      "num_input_tokens_seen": 5737099280,
      "step": 7292
    },
    {
      "epoch": 0.7737110120942076,
      "grad_norm": 0.9867920088139426,
      "learning_rate": 4.950201885801796e-05,
      "loss": 1.93,
      "num_input_tokens_seen": 5737886000,
      "step": 7293
    },
    {
      "epoch": 0.7738171016337789,
      "grad_norm": 7.0318575028312065,
      "learning_rate": 4.9501880828171665e-05,
      "loss": 2.1045,
      "num_input_tokens_seen": 5738672800,
      "step": 7294
    },
    {
      "epoch": 0.7739231911733503,
      "grad_norm": 3.413956727087254,
      "learning_rate": 4.950174277939103e-05,
      "loss": 2.1033,
      "num_input_tokens_seen": 5739459424,
      "step": 7295
    },
    {
      "epoch": 0.7740292807129217,
      "grad_norm": 1.1541357736490594,
      "learning_rate": 4.950160471167617e-05,
      "loss": 2.0023,
      "num_input_tokens_seen": 5740246096,
      "step": 7296
    },
    {
      "epoch": 0.7741353702524931,
      "grad_norm": 0.7355509807919675,
      "learning_rate": 4.950146662502719e-05,
      "loss": 1.9544,
      "num_input_tokens_seen": 5741032816,
      "step": 7297
    },
    {
      "epoch": 0.7742414597920645,
      "grad_norm": 1.0555241935435917,
      "learning_rate": 4.95013285194442e-05,
      "loss": 1.8895,
      "num_input_tokens_seen": 5741819536,
      "step": 7298
    },
    {
      "epoch": 0.7743475493316359,
      "grad_norm": 0.7938255472183099,
      "learning_rate": 4.9501190394927295e-05,
      "loss": 1.8344,
      "num_input_tokens_seen": 5742606256,
      "step": 7299
    },
    {
      "epoch": 0.7744536388712073,
      "grad_norm": 0.72926528505028,
      "learning_rate": 4.950105225147659e-05,
      "loss": 1.9766,
      "num_input_tokens_seen": 5743393056,
      "step": 7300
    },
    {
      "epoch": 0.7745597284107787,
      "grad_norm": 0.7162552398289757,
      "learning_rate": 4.950091408909219e-05,
      "loss": 1.8817,
      "num_input_tokens_seen": 5744179728,
      "step": 7301
    },
    {
      "epoch": 0.77466581795035,
      "grad_norm": 0.8270571811933605,
      "learning_rate": 4.95007759077742e-05,
      "loss": 2.0852,
      "num_input_tokens_seen": 5744966448,
      "step": 7302
    },
    {
      "epoch": 0.7747719074899215,
      "grad_norm": 0.802338733434503,
      "learning_rate": 4.950063770752274e-05,
      "loss": 1.9755,
      "num_input_tokens_seen": 5745753120,
      "step": 7303
    },
    {
      "epoch": 0.7748779970294929,
      "grad_norm": 0.6803127067646606,
      "learning_rate": 4.9500499488337895e-05,
      "loss": 1.9209,
      "num_input_tokens_seen": 5746539904,
      "step": 7304
    },
    {
      "epoch": 0.7749840865690643,
      "grad_norm": 0.730201655012891,
      "learning_rate": 4.9500361250219785e-05,
      "loss": 1.9781,
      "num_input_tokens_seen": 5747326656,
      "step": 7305
    },
    {
      "epoch": 0.7750901761086357,
      "grad_norm": 0.6027799752314007,
      "learning_rate": 4.9500222993168524e-05,
      "loss": 1.9075,
      "num_input_tokens_seen": 5748113392,
      "step": 7306
    },
    {
      "epoch": 0.7751962656482071,
      "grad_norm": 0.6909698402367346,
      "learning_rate": 4.95000847171842e-05,
      "loss": 1.9549,
      "num_input_tokens_seen": 5748900048,
      "step": 7307
    },
    {
      "epoch": 0.7753023551877785,
      "grad_norm": 0.5872411435572138,
      "learning_rate": 4.9499946422266927e-05,
      "loss": 1.9188,
      "num_input_tokens_seen": 5749686848,
      "step": 7308
    },
    {
      "epoch": 0.7754084447273499,
      "grad_norm": 0.5738204356800007,
      "learning_rate": 4.949980810841682e-05,
      "loss": 1.9335,
      "num_input_tokens_seen": 5750473680,
      "step": 7309
    },
    {
      "epoch": 0.7755145342669213,
      "grad_norm": 0.6665097688703783,
      "learning_rate": 4.949966977563398e-05,
      "loss": 1.8949,
      "num_input_tokens_seen": 5751260464,
      "step": 7310
    },
    {
      "epoch": 0.7756206238064927,
      "grad_norm": 0.6580827086401708,
      "learning_rate": 4.949953142391851e-05,
      "loss": 2.0917,
      "num_input_tokens_seen": 5752047232,
      "step": 7311
    },
    {
      "epoch": 0.775726713346064,
      "grad_norm": 0.5691370770815259,
      "learning_rate": 4.949939305327053e-05,
      "loss": 1.9503,
      "num_input_tokens_seen": 5752834032,
      "step": 7312
    },
    {
      "epoch": 0.7758328028856355,
      "grad_norm": 0.6002035535759263,
      "learning_rate": 4.949925466369013e-05,
      "loss": 1.9236,
      "num_input_tokens_seen": 5753620704,
      "step": 7313
    },
    {
      "epoch": 0.7759388924252069,
      "grad_norm": 0.4513156221714336,
      "learning_rate": 4.949911625517742e-05,
      "loss": 1.8129,
      "num_input_tokens_seen": 5754407424,
      "step": 7314
    },
    {
      "epoch": 0.7760449819647782,
      "grad_norm": 0.59055420122644,
      "learning_rate": 4.949897782773252e-05,
      "loss": 1.9111,
      "num_input_tokens_seen": 5755194208,
      "step": 7315
    },
    {
      "epoch": 0.7761510715043497,
      "grad_norm": 0.4575502401799152,
      "learning_rate": 4.949883938135553e-05,
      "loss": 1.8805,
      "num_input_tokens_seen": 5755981008,
      "step": 7316
    },
    {
      "epoch": 0.7762571610439211,
      "grad_norm": 1.034124327302553,
      "learning_rate": 4.949870091604655e-05,
      "loss": 2.0647,
      "num_input_tokens_seen": 5756767712,
      "step": 7317
    },
    {
      "epoch": 0.7763632505834924,
      "grad_norm": 0.798865832512588,
      "learning_rate": 4.94985624318057e-05,
      "loss": 1.97,
      "num_input_tokens_seen": 5757554448,
      "step": 7318
    },
    {
      "epoch": 0.7764693401230639,
      "grad_norm": 1.0198254064771326,
      "learning_rate": 4.9498423928633076e-05,
      "loss": 1.9409,
      "num_input_tokens_seen": 5758341216,
      "step": 7319
    },
    {
      "epoch": 0.7765754296626353,
      "grad_norm": 1.1547538533604347,
      "learning_rate": 4.9498285406528786e-05,
      "loss": 1.9471,
      "num_input_tokens_seen": 5759127904,
      "step": 7320
    },
    {
      "epoch": 0.7766815192022066,
      "grad_norm": 0.5591090629855522,
      "learning_rate": 4.9498146865492945e-05,
      "loss": 1.738,
      "num_input_tokens_seen": 5759914768,
      "step": 7321
    },
    {
      "epoch": 0.7767876087417781,
      "grad_norm": 0.6030237763549584,
      "learning_rate": 4.949800830552565e-05,
      "loss": 1.9241,
      "num_input_tokens_seen": 5760701552,
      "step": 7322
    },
    {
      "epoch": 0.7768936982813495,
      "grad_norm": 0.5777186761373257,
      "learning_rate": 4.949786972662702e-05,
      "loss": 1.8983,
      "num_input_tokens_seen": 5761488352,
      "step": 7323
    },
    {
      "epoch": 0.7769997878209208,
      "grad_norm": 0.6295275228162879,
      "learning_rate": 4.949773112879715e-05,
      "loss": 1.7558,
      "num_input_tokens_seen": 5762275216,
      "step": 7324
    },
    {
      "epoch": 0.7771058773604923,
      "grad_norm": 0.4988807215465748,
      "learning_rate": 4.949759251203615e-05,
      "loss": 1.9951,
      "num_input_tokens_seen": 5763061904,
      "step": 7325
    },
    {
      "epoch": 0.7772119669000637,
      "grad_norm": 0.4918260989625602,
      "learning_rate": 4.949745387634413e-05,
      "loss": 1.9155,
      "num_input_tokens_seen": 5763848688,
      "step": 7326
    },
    {
      "epoch": 0.777318056439635,
      "grad_norm": 0.4452837855571994,
      "learning_rate": 4.94973152217212e-05,
      "loss": 1.9272,
      "num_input_tokens_seen": 5764635456,
      "step": 7327
    },
    {
      "epoch": 0.7774241459792065,
      "grad_norm": 0.4465577062542913,
      "learning_rate": 4.949717654816746e-05,
      "loss": 1.932,
      "num_input_tokens_seen": 5765422176,
      "step": 7328
    },
    {
      "epoch": 0.7775302355187779,
      "grad_norm": 0.47948707431015697,
      "learning_rate": 4.949703785568303e-05,
      "loss": 1.8802,
      "num_input_tokens_seen": 5766208976,
      "step": 7329
    },
    {
      "epoch": 0.7776363250583492,
      "grad_norm": 0.43068616999183335,
      "learning_rate": 4.9496899144267994e-05,
      "loss": 1.8697,
      "num_input_tokens_seen": 5766995808,
      "step": 7330
    },
    {
      "epoch": 0.7777424145979206,
      "grad_norm": 0.4254510006678932,
      "learning_rate": 4.9496760413922485e-05,
      "loss": 1.8835,
      "num_input_tokens_seen": 5767782592,
      "step": 7331
    },
    {
      "epoch": 0.7778485041374921,
      "grad_norm": 0.4907277818593166,
      "learning_rate": 4.9496621664646595e-05,
      "loss": 1.8976,
      "num_input_tokens_seen": 5768569280,
      "step": 7332
    },
    {
      "epoch": 0.7779545936770634,
      "grad_norm": 0.3996794600931594,
      "learning_rate": 4.949648289644043e-05,
      "loss": 1.9548,
      "num_input_tokens_seen": 5769356064,
      "step": 7333
    },
    {
      "epoch": 0.7780606832166348,
      "grad_norm": 0.4640936419842463,
      "learning_rate": 4.94963441093041e-05,
      "loss": 1.8614,
      "num_input_tokens_seen": 5770142880,
      "step": 7334
    },
    {
      "epoch": 0.7781667727562063,
      "grad_norm": 0.5248533775761626,
      "learning_rate": 4.9496205303237716e-05,
      "loss": 1.9495,
      "num_input_tokens_seen": 5770929760,
      "step": 7335
    },
    {
      "epoch": 0.7782728622957776,
      "grad_norm": 0.5778225247196502,
      "learning_rate": 4.9496066478241384e-05,
      "loss": 1.9235,
      "num_input_tokens_seen": 5771716512,
      "step": 7336
    },
    {
      "epoch": 0.778378951835349,
      "grad_norm": 0.46516986408359784,
      "learning_rate": 4.949592763431522e-05,
      "loss": 2.0013,
      "num_input_tokens_seen": 5772503328,
      "step": 7337
    },
    {
      "epoch": 0.7784850413749205,
      "grad_norm": 0.42108975726423664,
      "learning_rate": 4.9495788771459314e-05,
      "loss": 1.953,
      "num_input_tokens_seen": 5773290096,
      "step": 7338
    },
    {
      "epoch": 0.7785911309144918,
      "grad_norm": 0.5616421786419502,
      "learning_rate": 4.949564988967378e-05,
      "loss": 1.9397,
      "num_input_tokens_seen": 5774076912,
      "step": 7339
    },
    {
      "epoch": 0.7786972204540632,
      "grad_norm": 0.4751415726809576,
      "learning_rate": 4.9495510988958726e-05,
      "loss": 2.0129,
      "num_input_tokens_seen": 5774863600,
      "step": 7340
    },
    {
      "epoch": 0.7788033099936347,
      "grad_norm": 0.5779204482228766,
      "learning_rate": 4.949537206931426e-05,
      "loss": 1.9392,
      "num_input_tokens_seen": 5775650448,
      "step": 7341
    },
    {
      "epoch": 0.778909399533206,
      "grad_norm": 0.4811164230589938,
      "learning_rate": 4.9495233130740495e-05,
      "loss": 1.9904,
      "num_input_tokens_seen": 5776437216,
      "step": 7342
    },
    {
      "epoch": 0.7790154890727774,
      "grad_norm": 0.4792502929746642,
      "learning_rate": 4.9495094173237526e-05,
      "loss": 1.7316,
      "num_input_tokens_seen": 5777224000,
      "step": 7343
    },
    {
      "epoch": 0.7791215786123489,
      "grad_norm": 0.4787194459077637,
      "learning_rate": 4.949495519680547e-05,
      "loss": 1.9671,
      "num_input_tokens_seen": 5778010784,
      "step": 7344
    },
    {
      "epoch": 0.7792276681519202,
      "grad_norm": 0.8910949362348195,
      "learning_rate": 4.9494816201444435e-05,
      "loss": 2.016,
      "num_input_tokens_seen": 5778797568,
      "step": 7345
    },
    {
      "epoch": 0.7793337576914916,
      "grad_norm": 0.6514236228927411,
      "learning_rate": 4.9494677187154514e-05,
      "loss": 1.8373,
      "num_input_tokens_seen": 5779584432,
      "step": 7346
    },
    {
      "epoch": 0.779439847231063,
      "grad_norm": 1.1787309387177707,
      "learning_rate": 4.949453815393583e-05,
      "loss": 1.9429,
      "num_input_tokens_seen": 5780371104,
      "step": 7347
    },
    {
      "epoch": 0.7795459367706344,
      "grad_norm": 1.224739425304847,
      "learning_rate": 4.9494399101788494e-05,
      "loss": 2.0471,
      "num_input_tokens_seen": 5781157824,
      "step": 7348
    },
    {
      "epoch": 0.7796520263102058,
      "grad_norm": 1.0768334062827318,
      "learning_rate": 4.94942600307126e-05,
      "loss": 2.0283,
      "num_input_tokens_seen": 5781944656,
      "step": 7349
    },
    {
      "epoch": 0.7797581158497772,
      "grad_norm": 3.390050627129696,
      "learning_rate": 4.949412094070826e-05,
      "loss": 1.9483,
      "num_input_tokens_seen": 5782731312,
      "step": 7350
    },
    {
      "epoch": 0.7798642053893486,
      "grad_norm": 1.2969640049804005,
      "learning_rate": 4.949398183177558e-05,
      "loss": 1.8265,
      "num_input_tokens_seen": 5783518080,
      "step": 7351
    },
    {
      "epoch": 0.77997029492892,
      "grad_norm": 10.014300697619996,
      "learning_rate": 4.9493842703914674e-05,
      "loss": 1.8167,
      "num_input_tokens_seen": 5784304928,
      "step": 7352
    },
    {
      "epoch": 0.7800763844684914,
      "grad_norm": 1.9732105026435645,
      "learning_rate": 4.949370355712564e-05,
      "loss": 1.9099,
      "num_input_tokens_seen": 5785091728,
      "step": 7353
    },
    {
      "epoch": 0.7801824740080628,
      "grad_norm": 0.8841484001566504,
      "learning_rate": 4.949356439140858e-05,
      "loss": 1.9828,
      "num_input_tokens_seen": 5785878400,
      "step": 7354
    },
    {
      "epoch": 0.7802885635476342,
      "grad_norm": 2.1959436913994828,
      "learning_rate": 4.9493425206763634e-05,
      "loss": 1.9762,
      "num_input_tokens_seen": 5786665184,
      "step": 7355
    },
    {
      "epoch": 0.7803946530872056,
      "grad_norm": 0.9693670310476786,
      "learning_rate": 4.949328600319087e-05,
      "loss": 1.9073,
      "num_input_tokens_seen": 5787451952,
      "step": 7356
    },
    {
      "epoch": 0.780500742626777,
      "grad_norm": 1.9943861768467441,
      "learning_rate": 4.949314678069043e-05,
      "loss": 1.9423,
      "num_input_tokens_seen": 5788238736,
      "step": 7357
    },
    {
      "epoch": 0.7806068321663484,
      "grad_norm": 1.3157680553305806,
      "learning_rate": 4.9493007539262395e-05,
      "loss": 2.0795,
      "num_input_tokens_seen": 5789025424,
      "step": 7358
    },
    {
      "epoch": 0.7807129217059198,
      "grad_norm": 1.154627669660762,
      "learning_rate": 4.9492868278906876e-05,
      "loss": 2.0296,
      "num_input_tokens_seen": 5789812192,
      "step": 7359
    },
    {
      "epoch": 0.7808190112454912,
      "grad_norm": 0.553942489260761,
      "learning_rate": 4.9492728999624006e-05,
      "loss": 1.9285,
      "num_input_tokens_seen": 5790599024,
      "step": 7360
    },
    {
      "epoch": 0.7809251007850626,
      "grad_norm": 1.2613187641599408,
      "learning_rate": 4.949258970141386e-05,
      "loss": 2.0351,
      "num_input_tokens_seen": 5791385696,
      "step": 7361
    },
    {
      "epoch": 0.781031190324634,
      "grad_norm": 0.8336156183792164,
      "learning_rate": 4.949245038427656e-05,
      "loss": 1.9422,
      "num_input_tokens_seen": 5792172400,
      "step": 7362
    },
    {
      "epoch": 0.7811372798642053,
      "grad_norm": 1.0935755412421335,
      "learning_rate": 4.949231104821221e-05,
      "loss": 2.0156,
      "num_input_tokens_seen": 5792959120,
      "step": 7363
    },
    {
      "epoch": 0.7812433694037768,
      "grad_norm": 0.8554704353104746,
      "learning_rate": 4.9492171693220926e-05,
      "loss": 1.8235,
      "num_input_tokens_seen": 5793745856,
      "step": 7364
    },
    {
      "epoch": 0.7813494589433482,
      "grad_norm": 0.8175776800196334,
      "learning_rate": 4.949203231930282e-05,
      "loss": 1.8576,
      "num_input_tokens_seen": 5794532672,
      "step": 7365
    },
    {
      "epoch": 0.7814555484829195,
      "grad_norm": 0.8091174847233885,
      "learning_rate": 4.949189292645797e-05,
      "loss": 1.9515,
      "num_input_tokens_seen": 5795319568,
      "step": 7366
    },
    {
      "epoch": 0.781561638022491,
      "grad_norm": 0.7234039495037082,
      "learning_rate": 4.949175351468652e-05,
      "loss": 1.9518,
      "num_input_tokens_seen": 5796106368,
      "step": 7367
    },
    {
      "epoch": 0.7816677275620624,
      "grad_norm": 1.0008454177146862,
      "learning_rate": 4.949161408398855e-05,
      "loss": 2.0347,
      "num_input_tokens_seen": 5796893136,
      "step": 7368
    },
    {
      "epoch": 0.7817738171016337,
      "grad_norm": 0.5150875397439649,
      "learning_rate": 4.9491474634364185e-05,
      "loss": 1.9092,
      "num_input_tokens_seen": 5797679824,
      "step": 7369
    },
    {
      "epoch": 0.7818799066412052,
      "grad_norm": 1.0501165829983339,
      "learning_rate": 4.9491335165813524e-05,
      "loss": 1.8293,
      "num_input_tokens_seen": 5798466592,
      "step": 7370
    },
    {
      "epoch": 0.7819859961807766,
      "grad_norm": 0.4862481215857162,
      "learning_rate": 4.9491195678336684e-05,
      "loss": 2.0455,
      "num_input_tokens_seen": 5799253296,
      "step": 7371
    },
    {
      "epoch": 0.7820920857203479,
      "grad_norm": 1.4565894533167842,
      "learning_rate": 4.949105617193376e-05,
      "loss": 1.9191,
      "num_input_tokens_seen": 5800040048,
      "step": 7372
    },
    {
      "epoch": 0.7821981752599194,
      "grad_norm": 0.7291508942835079,
      "learning_rate": 4.949091664660487e-05,
      "loss": 1.9467,
      "num_input_tokens_seen": 5800826880,
      "step": 7373
    },
    {
      "epoch": 0.7823042647994908,
      "grad_norm": 0.649952568537116,
      "learning_rate": 4.9490777102350116e-05,
      "loss": 1.8241,
      "num_input_tokens_seen": 5801613648,
      "step": 7374
    },
    {
      "epoch": 0.7824103543390621,
      "grad_norm": 0.7121897508268876,
      "learning_rate": 4.949063753916962e-05,
      "loss": 1.8655,
      "num_input_tokens_seen": 5802400400,
      "step": 7375
    },
    {
      "epoch": 0.7825164438786336,
      "grad_norm": 0.5153364967279331,
      "learning_rate": 4.949049795706346e-05,
      "loss": 1.8538,
      "num_input_tokens_seen": 5803187232,
      "step": 7376
    },
    {
      "epoch": 0.782622533418205,
      "grad_norm": 0.5122504247172087,
      "learning_rate": 4.949035835603177e-05,
      "loss": 2.0645,
      "num_input_tokens_seen": 5803973984,
      "step": 7377
    },
    {
      "epoch": 0.7827286229577763,
      "grad_norm": 0.5402334878684214,
      "learning_rate": 4.9490218736074645e-05,
      "loss": 2.0043,
      "num_input_tokens_seen": 5804760736,
      "step": 7378
    },
    {
      "epoch": 0.7828347124973477,
      "grad_norm": 0.49894115829029234,
      "learning_rate": 4.94900790971922e-05,
      "loss": 2.015,
      "num_input_tokens_seen": 5805547520,
      "step": 7379
    },
    {
      "epoch": 0.7829408020369192,
      "grad_norm": 0.6023602448643621,
      "learning_rate": 4.948993943938455e-05,
      "loss": 2.0391,
      "num_input_tokens_seen": 5806334352,
      "step": 7380
    },
    {
      "epoch": 0.7830468915764905,
      "grad_norm": 0.5032503529974892,
      "learning_rate": 4.948979976265178e-05,
      "loss": 2.0756,
      "num_input_tokens_seen": 5807121072,
      "step": 7381
    },
    {
      "epoch": 0.7831529811160619,
      "grad_norm": 0.5698473719172197,
      "learning_rate": 4.9489660066994016e-05,
      "loss": 1.8968,
      "num_input_tokens_seen": 5807907872,
      "step": 7382
    },
    {
      "epoch": 0.7832590706556334,
      "grad_norm": 0.4684720581050044,
      "learning_rate": 4.948952035241136e-05,
      "loss": 1.9143,
      "num_input_tokens_seen": 5808694656,
      "step": 7383
    },
    {
      "epoch": 0.7833651601952047,
      "grad_norm": 0.6374175235542198,
      "learning_rate": 4.948938061890392e-05,
      "loss": 1.9523,
      "num_input_tokens_seen": 5809481296,
      "step": 7384
    },
    {
      "epoch": 0.7834712497347761,
      "grad_norm": 0.49983398016331676,
      "learning_rate": 4.9489240866471815e-05,
      "loss": 1.8521,
      "num_input_tokens_seen": 5810268112,
      "step": 7385
    },
    {
      "epoch": 0.7835773392743476,
      "grad_norm": 0.6745592752714683,
      "learning_rate": 4.948910109511513e-05,
      "loss": 1.9879,
      "num_input_tokens_seen": 5811054896,
      "step": 7386
    },
    {
      "epoch": 0.783683428813919,
      "grad_norm": 0.5246688296041264,
      "learning_rate": 4.9488961304834e-05,
      "loss": 1.822,
      "num_input_tokens_seen": 5811841648,
      "step": 7387
    },
    {
      "epoch": 0.7837895183534903,
      "grad_norm": 1.17131266154903,
      "learning_rate": 4.948882149562851e-05,
      "loss": 1.9521,
      "num_input_tokens_seen": 5812628416,
      "step": 7388
    },
    {
      "epoch": 0.7838956078930618,
      "grad_norm": 0.5925554641819305,
      "learning_rate": 4.948868166749878e-05,
      "loss": 2.0244,
      "num_input_tokens_seen": 5813415152,
      "step": 7389
    },
    {
      "epoch": 0.7840016974326331,
      "grad_norm": 0.6371084490970543,
      "learning_rate": 4.948854182044491e-05,
      "loss": 1.9223,
      "num_input_tokens_seen": 5814201920,
      "step": 7390
    },
    {
      "epoch": 0.7841077869722045,
      "grad_norm": 0.6043422865749167,
      "learning_rate": 4.948840195446702e-05,
      "loss": 1.8444,
      "num_input_tokens_seen": 5814988736,
      "step": 7391
    },
    {
      "epoch": 0.784213876511776,
      "grad_norm": 0.5875391328858508,
      "learning_rate": 4.948826206956521e-05,
      "loss": 2.0281,
      "num_input_tokens_seen": 5815775568,
      "step": 7392
    },
    {
      "epoch": 0.7843199660513474,
      "grad_norm": 0.5857652966147772,
      "learning_rate": 4.948812216573959e-05,
      "loss": 1.8909,
      "num_input_tokens_seen": 5816562352,
      "step": 7393
    },
    {
      "epoch": 0.7844260555909187,
      "grad_norm": 0.8842892905961269,
      "learning_rate": 4.948798224299027e-05,
      "loss": 1.9874,
      "num_input_tokens_seen": 5817349040,
      "step": 7394
    },
    {
      "epoch": 0.7845321451304902,
      "grad_norm": 0.7744782129791337,
      "learning_rate": 4.948784230131735e-05,
      "loss": 2.0357,
      "num_input_tokens_seen": 5818135760,
      "step": 7395
    },
    {
      "epoch": 0.7846382346700616,
      "grad_norm": 0.5448697865339022,
      "learning_rate": 4.9487702340720944e-05,
      "loss": 1.9801,
      "num_input_tokens_seen": 5818922432,
      "step": 7396
    },
    {
      "epoch": 0.7847443242096329,
      "grad_norm": 0.5230861871175546,
      "learning_rate": 4.948756236120117e-05,
      "loss": 1.8143,
      "num_input_tokens_seen": 5819709264,
      "step": 7397
    },
    {
      "epoch": 0.7848504137492043,
      "grad_norm": 0.5465300132188267,
      "learning_rate": 4.948742236275811e-05,
      "loss": 2.0625,
      "num_input_tokens_seen": 5820496160,
      "step": 7398
    },
    {
      "epoch": 0.7849565032887758,
      "grad_norm": 0.5672947492868712,
      "learning_rate": 4.94872823453919e-05,
      "loss": 1.9464,
      "num_input_tokens_seen": 5821282976,
      "step": 7399
    },
    {
      "epoch": 0.7850625928283471,
      "grad_norm": 0.41655536748110317,
      "learning_rate": 4.9487142309102635e-05,
      "loss": 2.0528,
      "num_input_tokens_seen": 5822069696,
      "step": 7400
    },
    {
      "epoch": 0.7851686823679185,
      "grad_norm": 0.43314968512580804,
      "learning_rate": 4.948700225389042e-05,
      "loss": 1.7436,
      "num_input_tokens_seen": 5822856464,
      "step": 7401
    },
    {
      "epoch": 0.78527477190749,
      "grad_norm": 0.5511198019118541,
      "learning_rate": 4.948686217975538e-05,
      "loss": 1.8537,
      "num_input_tokens_seen": 5823643312,
      "step": 7402
    },
    {
      "epoch": 0.7853808614470613,
      "grad_norm": 0.42386049016903926,
      "learning_rate": 4.94867220866976e-05,
      "loss": 2.0554,
      "num_input_tokens_seen": 5824429904,
      "step": 7403
    },
    {
      "epoch": 0.7854869509866327,
      "grad_norm": 0.5317847611945583,
      "learning_rate": 4.9486581974717204e-05,
      "loss": 1.9692,
      "num_input_tokens_seen": 5825216624,
      "step": 7404
    },
    {
      "epoch": 0.7855930405262042,
      "grad_norm": 0.4493079713540054,
      "learning_rate": 4.948644184381429e-05,
      "loss": 2.0014,
      "num_input_tokens_seen": 5826003376,
      "step": 7405
    },
    {
      "epoch": 0.7856991300657755,
      "grad_norm": 0.3839571632811893,
      "learning_rate": 4.948630169398898e-05,
      "loss": 2.0337,
      "num_input_tokens_seen": 5826790144,
      "step": 7406
    },
    {
      "epoch": 0.7858052196053469,
      "grad_norm": 0.5751924969785854,
      "learning_rate": 4.948616152524137e-05,
      "loss": 1.9217,
      "num_input_tokens_seen": 5827576912,
      "step": 7407
    },
    {
      "epoch": 0.7859113091449184,
      "grad_norm": 0.40076692655154145,
      "learning_rate": 4.9486021337571575e-05,
      "loss": 1.9777,
      "num_input_tokens_seen": 5828363696,
      "step": 7408
    },
    {
      "epoch": 0.7860173986844897,
      "grad_norm": 0.37213009076463127,
      "learning_rate": 4.948588113097971e-05,
      "loss": 1.8731,
      "num_input_tokens_seen": 5829150464,
      "step": 7409
    },
    {
      "epoch": 0.7861234882240611,
      "grad_norm": 0.4541094504923543,
      "learning_rate": 4.948574090546586e-05,
      "loss": 1.9046,
      "num_input_tokens_seen": 5829937184,
      "step": 7410
    },
    {
      "epoch": 0.7862295777636326,
      "grad_norm": 0.4901000535024159,
      "learning_rate": 4.948560066103015e-05,
      "loss": 2.0216,
      "num_input_tokens_seen": 5830723904,
      "step": 7411
    },
    {
      "epoch": 0.7863356673032039,
      "grad_norm": 0.3605240161076283,
      "learning_rate": 4.948546039767269e-05,
      "loss": 1.7989,
      "num_input_tokens_seen": 5831510784,
      "step": 7412
    },
    {
      "epoch": 0.7864417568427753,
      "grad_norm": 0.4808715917355919,
      "learning_rate": 4.948532011539358e-05,
      "loss": 2.0819,
      "num_input_tokens_seen": 5832297568,
      "step": 7413
    },
    {
      "epoch": 0.7865478463823466,
      "grad_norm": 0.5465020469340222,
      "learning_rate": 4.9485179814192946e-05,
      "loss": 1.8591,
      "num_input_tokens_seen": 5833084240,
      "step": 7414
    },
    {
      "epoch": 0.7866539359219181,
      "grad_norm": 0.5141175640956072,
      "learning_rate": 4.9485039494070874e-05,
      "loss": 1.8213,
      "num_input_tokens_seen": 5833871040,
      "step": 7415
    },
    {
      "epoch": 0.7867600254614895,
      "grad_norm": 0.7385129885095174,
      "learning_rate": 4.948489915502749e-05,
      "loss": 1.8856,
      "num_input_tokens_seen": 5834657824,
      "step": 7416
    },
    {
      "epoch": 0.7868661150010609,
      "grad_norm": 0.6505406769871663,
      "learning_rate": 4.948475879706288e-05,
      "loss": 2.0158,
      "num_input_tokens_seen": 5835444528,
      "step": 7417
    },
    {
      "epoch": 0.7869722045406323,
      "grad_norm": 0.575585076176361,
      "learning_rate": 4.948461842017718e-05,
      "loss": 2.0586,
      "num_input_tokens_seen": 5836231248,
      "step": 7418
    },
    {
      "epoch": 0.7870782940802037,
      "grad_norm": 0.8038292573028059,
      "learning_rate": 4.9484478024370476e-05,
      "loss": 1.8966,
      "num_input_tokens_seen": 5837017904,
      "step": 7419
    },
    {
      "epoch": 0.787184383619775,
      "grad_norm": 0.5661134258269457,
      "learning_rate": 4.948433760964288e-05,
      "loss": 1.9694,
      "num_input_tokens_seen": 5837804688,
      "step": 7420
    },
    {
      "epoch": 0.7872904731593465,
      "grad_norm": 0.48271896070073944,
      "learning_rate": 4.9484197175994515e-05,
      "loss": 2.063,
      "num_input_tokens_seen": 5838591472,
      "step": 7421
    },
    {
      "epoch": 0.7873965626989179,
      "grad_norm": 0.5417731119501326,
      "learning_rate": 4.9484056723425486e-05,
      "loss": 1.9318,
      "num_input_tokens_seen": 5839378256,
      "step": 7422
    },
    {
      "epoch": 0.7875026522384893,
      "grad_norm": 0.5084714410099462,
      "learning_rate": 4.948391625193589e-05,
      "loss": 1.9399,
      "num_input_tokens_seen": 5840165056,
      "step": 7423
    },
    {
      "epoch": 0.7876087417780607,
      "grad_norm": 0.5186519929679174,
      "learning_rate": 4.9483775761525846e-05,
      "loss": 1.9297,
      "num_input_tokens_seen": 5840951824,
      "step": 7424
    },
    {
      "epoch": 0.7877148313176321,
      "grad_norm": 0.4218815510844557,
      "learning_rate": 4.948363525219546e-05,
      "loss": 1.7737,
      "num_input_tokens_seen": 5841738544,
      "step": 7425
    },
    {
      "epoch": 0.7878209208572035,
      "grad_norm": 0.5055814199531546,
      "learning_rate": 4.9483494723944835e-05,
      "loss": 1.9099,
      "num_input_tokens_seen": 5842525280,
      "step": 7426
    },
    {
      "epoch": 0.7879270103967749,
      "grad_norm": 0.5000417038263028,
      "learning_rate": 4.948335417677408e-05,
      "loss": 1.9753,
      "num_input_tokens_seen": 5843312032,
      "step": 7427
    },
    {
      "epoch": 0.7880330999363463,
      "grad_norm": 0.41397816303166657,
      "learning_rate": 4.948321361068331e-05,
      "loss": 1.9032,
      "num_input_tokens_seen": 5844098880,
      "step": 7428
    },
    {
      "epoch": 0.7881391894759177,
      "grad_norm": 0.5006665382823241,
      "learning_rate": 4.9483073025672634e-05,
      "loss": 2.0015,
      "num_input_tokens_seen": 5844885648,
      "step": 7429
    },
    {
      "epoch": 0.788245279015489,
      "grad_norm": 0.5281804079502932,
      "learning_rate": 4.948293242174216e-05,
      "loss": 1.7893,
      "num_input_tokens_seen": 5845672416,
      "step": 7430
    },
    {
      "epoch": 0.7883513685550605,
      "grad_norm": 0.40161784990878874,
      "learning_rate": 4.948279179889199e-05,
      "loss": 1.8269,
      "num_input_tokens_seen": 5846459168,
      "step": 7431
    },
    {
      "epoch": 0.7884574580946319,
      "grad_norm": 0.465207331743838,
      "learning_rate": 4.9482651157122225e-05,
      "loss": 2.0403,
      "num_input_tokens_seen": 5847245952,
      "step": 7432
    },
    {
      "epoch": 0.7885635476342032,
      "grad_norm": 0.4370922540174157,
      "learning_rate": 4.948251049643301e-05,
      "loss": 1.9983,
      "num_input_tokens_seen": 5848032640,
      "step": 7433
    },
    {
      "epoch": 0.7886696371737747,
      "grad_norm": 0.46836244915088565,
      "learning_rate": 4.9482369816824406e-05,
      "loss": 1.9878,
      "num_input_tokens_seen": 5848819344,
      "step": 7434
    },
    {
      "epoch": 0.7887757267133461,
      "grad_norm": 0.43088857098519723,
      "learning_rate": 4.948222911829656e-05,
      "loss": 1.8654,
      "num_input_tokens_seen": 5849606144,
      "step": 7435
    },
    {
      "epoch": 0.7888818162529174,
      "grad_norm": 0.47301937584068476,
      "learning_rate": 4.948208840084956e-05,
      "loss": 1.8783,
      "num_input_tokens_seen": 5850392896,
      "step": 7436
    },
    {
      "epoch": 0.7889879057924889,
      "grad_norm": 0.4344924055495244,
      "learning_rate": 4.948194766448352e-05,
      "loss": 2.0295,
      "num_input_tokens_seen": 5851179568,
      "step": 7437
    },
    {
      "epoch": 0.7890939953320603,
      "grad_norm": 0.49411958370395004,
      "learning_rate": 4.948180690919855e-05,
      "loss": 1.9579,
      "num_input_tokens_seen": 5851966320,
      "step": 7438
    },
    {
      "epoch": 0.7892000848716316,
      "grad_norm": 0.6716235998224672,
      "learning_rate": 4.948166613499476e-05,
      "loss": 1.8941,
      "num_input_tokens_seen": 5852753136,
      "step": 7439
    },
    {
      "epoch": 0.7893061744112031,
      "grad_norm": 0.4061357736125956,
      "learning_rate": 4.948152534187226e-05,
      "loss": 1.9518,
      "num_input_tokens_seen": 5853539872,
      "step": 7440
    },
    {
      "epoch": 0.7894122639507745,
      "grad_norm": 0.5491609230495313,
      "learning_rate": 4.948138452983114e-05,
      "loss": 1.9756,
      "num_input_tokens_seen": 5854326624,
      "step": 7441
    },
    {
      "epoch": 0.7895183534903458,
      "grad_norm": 0.6725837739126885,
      "learning_rate": 4.9481243698871544e-05,
      "loss": 2.0575,
      "num_input_tokens_seen": 5855113280,
      "step": 7442
    },
    {
      "epoch": 0.7896244430299173,
      "grad_norm": 0.7409271439908526,
      "learning_rate": 4.948110284899355e-05,
      "loss": 1.9487,
      "num_input_tokens_seen": 5855900176,
      "step": 7443
    },
    {
      "epoch": 0.7897305325694887,
      "grad_norm": 0.6146674297435345,
      "learning_rate": 4.948096198019728e-05,
      "loss": 1.9483,
      "num_input_tokens_seen": 5856686832,
      "step": 7444
    },
    {
      "epoch": 0.78983662210906,
      "grad_norm": 0.4337723121122854,
      "learning_rate": 4.9480821092482845e-05,
      "loss": 1.933,
      "num_input_tokens_seen": 5857473520,
      "step": 7445
    },
    {
      "epoch": 0.7899427116486314,
      "grad_norm": 1.0392456295062196,
      "learning_rate": 4.948068018585034e-05,
      "loss": 1.8592,
      "num_input_tokens_seen": 5858260240,
      "step": 7446
    },
    {
      "epoch": 0.7900488011882029,
      "grad_norm": 0.4713391184038685,
      "learning_rate": 4.9480539260299894e-05,
      "loss": 1.7752,
      "num_input_tokens_seen": 5859047040,
      "step": 7447
    },
    {
      "epoch": 0.7901548907277742,
      "grad_norm": 1.5130432709906687,
      "learning_rate": 4.94803983158316e-05,
      "loss": 1.9631,
      "num_input_tokens_seen": 5859833728,
      "step": 7448
    },
    {
      "epoch": 0.7902609802673456,
      "grad_norm": 0.5030406222567695,
      "learning_rate": 4.9480257352445575e-05,
      "loss": 1.951,
      "num_input_tokens_seen": 5860620416,
      "step": 7449
    },
    {
      "epoch": 0.7903670698069171,
      "grad_norm": 2.0618737271739556,
      "learning_rate": 4.9480116370141924e-05,
      "loss": 2.0193,
      "num_input_tokens_seen": 5861407104,
      "step": 7450
    },
    {
      "epoch": 0.7904731593464884,
      "grad_norm": 0.5614061219107123,
      "learning_rate": 4.947997536892076e-05,
      "loss": 1.9015,
      "num_input_tokens_seen": 5862193952,
      "step": 7451
    },
    {
      "epoch": 0.7905792488860598,
      "grad_norm": 0.6547733456768762,
      "learning_rate": 4.947983434878218e-05,
      "loss": 1.9326,
      "num_input_tokens_seen": 5862980720,
      "step": 7452
    },
    {
      "epoch": 0.7906853384256313,
      "grad_norm": 0.703220961460766,
      "learning_rate": 4.947969330972632e-05,
      "loss": 1.9465,
      "num_input_tokens_seen": 5863767456,
      "step": 7453
    },
    {
      "epoch": 0.7907914279652026,
      "grad_norm": 0.5836554792646056,
      "learning_rate": 4.947955225175325e-05,
      "loss": 1.9938,
      "num_input_tokens_seen": 5864554224,
      "step": 7454
    },
    {
      "epoch": 0.790897517504774,
      "grad_norm": 0.5699076210645292,
      "learning_rate": 4.947941117486311e-05,
      "loss": 1.9611,
      "num_input_tokens_seen": 5865340944,
      "step": 7455
    },
    {
      "epoch": 0.7910036070443455,
      "grad_norm": 0.6816092007134757,
      "learning_rate": 4.947927007905601e-05,
      "loss": 1.9196,
      "num_input_tokens_seen": 5866127680,
      "step": 7456
    },
    {
      "epoch": 0.7911096965839168,
      "grad_norm": 0.577908522490196,
      "learning_rate": 4.947912896433203e-05,
      "loss": 2.0185,
      "num_input_tokens_seen": 5866914448,
      "step": 7457
    },
    {
      "epoch": 0.7912157861234882,
      "grad_norm": 0.7434590967343041,
      "learning_rate": 4.9478987830691306e-05,
      "loss": 1.9787,
      "num_input_tokens_seen": 5867701232,
      "step": 7458
    },
    {
      "epoch": 0.7913218756630597,
      "grad_norm": 0.7141352905256004,
      "learning_rate": 4.947884667813394e-05,
      "loss": 1.9332,
      "num_input_tokens_seen": 5868488064,
      "step": 7459
    },
    {
      "epoch": 0.791427965202631,
      "grad_norm": 0.5980925510260189,
      "learning_rate": 4.947870550666004e-05,
      "loss": 1.9115,
      "num_input_tokens_seen": 5869274864,
      "step": 7460
    },
    {
      "epoch": 0.7915340547422024,
      "grad_norm": 0.7134233751632447,
      "learning_rate": 4.9478564316269715e-05,
      "loss": 2.0217,
      "num_input_tokens_seen": 5870061568,
      "step": 7461
    },
    {
      "epoch": 0.7916401442817739,
      "grad_norm": 0.4096135196086915,
      "learning_rate": 4.947842310696307e-05,
      "loss": 1.8976,
      "num_input_tokens_seen": 5870848400,
      "step": 7462
    },
    {
      "epoch": 0.7917462338213452,
      "grad_norm": 0.7214485374621706,
      "learning_rate": 4.947828187874022e-05,
      "loss": 2.007,
      "num_input_tokens_seen": 5871635216,
      "step": 7463
    },
    {
      "epoch": 0.7918523233609166,
      "grad_norm": 0.4617555546545987,
      "learning_rate": 4.947814063160126e-05,
      "loss": 1.8504,
      "num_input_tokens_seen": 5872422080,
      "step": 7464
    },
    {
      "epoch": 0.791958412900488,
      "grad_norm": 0.6273048635386526,
      "learning_rate": 4.947799936554633e-05,
      "loss": 1.8954,
      "num_input_tokens_seen": 5873208816,
      "step": 7465
    },
    {
      "epoch": 0.7920645024400594,
      "grad_norm": 0.44007501144868855,
      "learning_rate": 4.9477858080575515e-05,
      "loss": 1.8427,
      "num_input_tokens_seen": 5873995584,
      "step": 7466
    },
    {
      "epoch": 0.7921705919796308,
      "grad_norm": 1.4170826604596134,
      "learning_rate": 4.947771677668892e-05,
      "loss": 2.0247,
      "num_input_tokens_seen": 5874782272,
      "step": 7467
    },
    {
      "epoch": 0.7922766815192022,
      "grad_norm": 0.5507813683516357,
      "learning_rate": 4.947757545388668e-05,
      "loss": 1.9106,
      "num_input_tokens_seen": 5875569024,
      "step": 7468
    },
    {
      "epoch": 0.7923827710587736,
      "grad_norm": 1.382979062236055,
      "learning_rate": 4.9477434112168875e-05,
      "loss": 1.9236,
      "num_input_tokens_seen": 5876355872,
      "step": 7469
    },
    {
      "epoch": 0.792488860598345,
      "grad_norm": 0.6587342677561449,
      "learning_rate": 4.9477292751535633e-05,
      "loss": 2.0039,
      "num_input_tokens_seen": 5877142656,
      "step": 7470
    },
    {
      "epoch": 0.7925949501379164,
      "grad_norm": 1.9744134045233597,
      "learning_rate": 4.947715137198705e-05,
      "loss": 1.9929,
      "num_input_tokens_seen": 5877929456,
      "step": 7471
    },
    {
      "epoch": 0.7927010396774878,
      "grad_norm": 0.6000708428392605,
      "learning_rate": 4.947700997352325e-05,
      "loss": 1.9595,
      "num_input_tokens_seen": 5878716160,
      "step": 7472
    },
    {
      "epoch": 0.7928071292170592,
      "grad_norm": 1.6101828137640248,
      "learning_rate": 4.947686855614433e-05,
      "loss": 1.9366,
      "num_input_tokens_seen": 5879502880,
      "step": 7473
    },
    {
      "epoch": 0.7929132187566306,
      "grad_norm": 0.5670331493068818,
      "learning_rate": 4.9476727119850406e-05,
      "loss": 2.006,
      "num_input_tokens_seen": 5880289648,
      "step": 7474
    },
    {
      "epoch": 0.793019308296202,
      "grad_norm": 1.434323340785007,
      "learning_rate": 4.947658566464159e-05,
      "loss": 1.9674,
      "num_input_tokens_seen": 5881076336,
      "step": 7475
    },
    {
      "epoch": 0.7931253978357734,
      "grad_norm": 0.6227274870227476,
      "learning_rate": 4.947644419051798e-05,
      "loss": 1.9238,
      "num_input_tokens_seen": 5881863088,
      "step": 7476
    },
    {
      "epoch": 0.7932314873753448,
      "grad_norm": 1.3466437036143435,
      "learning_rate": 4.94763026974797e-05,
      "loss": 1.9914,
      "num_input_tokens_seen": 5882649760,
      "step": 7477
    },
    {
      "epoch": 0.7933375769149162,
      "grad_norm": 0.5069598616010553,
      "learning_rate": 4.9476161185526845e-05,
      "loss": 1.9808,
      "num_input_tokens_seen": 5883436544,
      "step": 7478
    },
    {
      "epoch": 0.7934436664544876,
      "grad_norm": 1.6193450777276905,
      "learning_rate": 4.947601965465953e-05,
      "loss": 1.8771,
      "num_input_tokens_seen": 5884223296,
      "step": 7479
    },
    {
      "epoch": 0.793549755994059,
      "grad_norm": 0.4309070019442719,
      "learning_rate": 4.947587810487787e-05,
      "loss": 1.8788,
      "num_input_tokens_seen": 5885010096,
      "step": 7480
    },
    {
      "epoch": 0.7936558455336303,
      "grad_norm": 2.418337239746984,
      "learning_rate": 4.947573653618197e-05,
      "loss": 2.0598,
      "num_input_tokens_seen": 5885796768,
      "step": 7481
    },
    {
      "epoch": 0.7937619350732018,
      "grad_norm": 0.6086593031441754,
      "learning_rate": 4.947559494857194e-05,
      "loss": 2.0197,
      "num_input_tokens_seen": 5886583488,
      "step": 7482
    },
    {
      "epoch": 0.7938680246127732,
      "grad_norm": 0.9517265301750497,
      "learning_rate": 4.947545334204788e-05,
      "loss": 1.9731,
      "num_input_tokens_seen": 5887370240,
      "step": 7483
    },
    {
      "epoch": 0.7939741141523445,
      "grad_norm": 0.901429971389832,
      "learning_rate": 4.9475311716609905e-05,
      "loss": 2.0139,
      "num_input_tokens_seen": 5888157056,
      "step": 7484
    },
    {
      "epoch": 0.794080203691916,
      "grad_norm": 1.440182566706472,
      "learning_rate": 4.947517007225814e-05,
      "loss": 1.8951,
      "num_input_tokens_seen": 5888943824,
      "step": 7485
    },
    {
      "epoch": 0.7941862932314874,
      "grad_norm": 0.9080083009983453,
      "learning_rate": 4.947502840899268e-05,
      "loss": 2.0078,
      "num_input_tokens_seen": 5889730464,
      "step": 7486
    },
    {
      "epoch": 0.7942923827710587,
      "grad_norm": 1.2909982180733706,
      "learning_rate": 4.947488672681363e-05,
      "loss": 1.89,
      "num_input_tokens_seen": 5890517232,
      "step": 7487
    },
    {
      "epoch": 0.7943984723106302,
      "grad_norm": 0.8727783175356966,
      "learning_rate": 4.94747450257211e-05,
      "loss": 1.8367,
      "num_input_tokens_seen": 5891304032,
      "step": 7488
    },
    {
      "epoch": 0.7945045618502016,
      "grad_norm": 1.0966168405459815,
      "learning_rate": 4.9474603305715215e-05,
      "loss": 1.9715,
      "num_input_tokens_seen": 5892090784,
      "step": 7489
    },
    {
      "epoch": 0.7946106513897729,
      "grad_norm": 1.0254416622894846,
      "learning_rate": 4.9474461566796076e-05,
      "loss": 1.9287,
      "num_input_tokens_seen": 5892877568,
      "step": 7490
    },
    {
      "epoch": 0.7947167409293444,
      "grad_norm": 1.1017104513889076,
      "learning_rate": 4.947431980896379e-05,
      "loss": 1.9932,
      "num_input_tokens_seen": 5893664288,
      "step": 7491
    },
    {
      "epoch": 0.7948228304689158,
      "grad_norm": 0.8889264028448101,
      "learning_rate": 4.9474178032218465e-05,
      "loss": 1.9371,
      "num_input_tokens_seen": 5894451088,
      "step": 7492
    },
    {
      "epoch": 0.7949289200084871,
      "grad_norm": 1.1195650566162416,
      "learning_rate": 4.9474036236560215e-05,
      "loss": 1.9222,
      "num_input_tokens_seen": 5895237840,
      "step": 7493
    },
    {
      "epoch": 0.7950350095480586,
      "grad_norm": 0.742957434927396,
      "learning_rate": 4.947389442198915e-05,
      "loss": 2.0318,
      "num_input_tokens_seen": 5896024688,
      "step": 7494
    },
    {
      "epoch": 0.79514109908763,
      "grad_norm": 0.795648047542072,
      "learning_rate": 4.9473752588505376e-05,
      "loss": 1.9168,
      "num_input_tokens_seen": 5896811456,
      "step": 7495
    },
    {
      "epoch": 0.7952471886272013,
      "grad_norm": 0.6310102994142687,
      "learning_rate": 4.9473610736108996e-05,
      "loss": 1.8878,
      "num_input_tokens_seen": 5897598128,
      "step": 7496
    },
    {
      "epoch": 0.7953532781667727,
      "grad_norm": 0.6841330011868381,
      "learning_rate": 4.947346886480014e-05,
      "loss": 1.8318,
      "num_input_tokens_seen": 5898384896,
      "step": 7497
    },
    {
      "epoch": 0.7954593677063442,
      "grad_norm": 0.7320570157528773,
      "learning_rate": 4.94733269745789e-05,
      "loss": 1.888,
      "num_input_tokens_seen": 5899171664,
      "step": 7498
    },
    {
      "epoch": 0.7955654572459155,
      "grad_norm": 1.0926246024982946,
      "learning_rate": 4.947318506544539e-05,
      "loss": 1.9268,
      "num_input_tokens_seen": 5899958512,
      "step": 7499
    },
    {
      "epoch": 0.7956715467854869,
      "grad_norm": 0.6901132896864559,
      "learning_rate": 4.9473043137399725e-05,
      "loss": 2.0104,
      "num_input_tokens_seen": 5900745360,
      "step": 7500
    },
    {
      "epoch": 0.7957776363250584,
      "grad_norm": 1.1632722029224492,
      "learning_rate": 4.9472901190442004e-05,
      "loss": 1.9277,
      "num_input_tokens_seen": 5901532144,
      "step": 7501
    },
    {
      "epoch": 0.7958837258646297,
      "grad_norm": 0.4980349647361368,
      "learning_rate": 4.947275922457234e-05,
      "loss": 1.9914,
      "num_input_tokens_seen": 5902318848,
      "step": 7502
    },
    {
      "epoch": 0.7959898154042011,
      "grad_norm": 0.6605347881305075,
      "learning_rate": 4.947261723979085e-05,
      "loss": 1.9942,
      "num_input_tokens_seen": 5903105648,
      "step": 7503
    },
    {
      "epoch": 0.7960959049437726,
      "grad_norm": 0.6220082979327581,
      "learning_rate": 4.947247523609765e-05,
      "loss": 1.9487,
      "num_input_tokens_seen": 5903892416,
      "step": 7504
    },
    {
      "epoch": 0.7962019944833439,
      "grad_norm": 0.5237323185121582,
      "learning_rate": 4.9472333213492826e-05,
      "loss": 2.0218,
      "num_input_tokens_seen": 5904679056,
      "step": 7505
    },
    {
      "epoch": 0.7963080840229153,
      "grad_norm": 0.4266101448716474,
      "learning_rate": 4.947219117197651e-05,
      "loss": 1.8379,
      "num_input_tokens_seen": 5905465888,
      "step": 7506
    },
    {
      "epoch": 0.7964141735624868,
      "grad_norm": 0.7570571270070497,
      "learning_rate": 4.9472049111548795e-05,
      "loss": 1.9849,
      "num_input_tokens_seen": 5906252592,
      "step": 7507
    },
    {
      "epoch": 0.7965202631020581,
      "grad_norm": 0.6241168212833755,
      "learning_rate": 4.94719070322098e-05,
      "loss": 1.951,
      "num_input_tokens_seen": 5907039360,
      "step": 7508
    },
    {
      "epoch": 0.7966263526416295,
      "grad_norm": 1.3651731308578758,
      "learning_rate": 4.9471764933959633e-05,
      "loss": 1.8847,
      "num_input_tokens_seen": 5907826128,
      "step": 7509
    },
    {
      "epoch": 0.796732442181201,
      "grad_norm": 1.195014228140488,
      "learning_rate": 4.9471622816798414e-05,
      "loss": 2.0157,
      "num_input_tokens_seen": 5908612848,
      "step": 7510
    },
    {
      "epoch": 0.7968385317207723,
      "grad_norm": 0.7739624404240708,
      "learning_rate": 4.9471480680726235e-05,
      "loss": 1.8167,
      "num_input_tokens_seen": 5909399664,
      "step": 7511
    },
    {
      "epoch": 0.7969446212603437,
      "grad_norm": 0.9957742763089915,
      "learning_rate": 4.947133852574321e-05,
      "loss": 1.9327,
      "num_input_tokens_seen": 5910186368,
      "step": 7512
    },
    {
      "epoch": 0.7970507107999151,
      "grad_norm": 0.9877570319883024,
      "learning_rate": 4.947119635184946e-05,
      "loss": 1.9822,
      "num_input_tokens_seen": 5910973136,
      "step": 7513
    },
    {
      "epoch": 0.7971568003394865,
      "grad_norm": 0.5025789692399033,
      "learning_rate": 4.947105415904508e-05,
      "loss": 1.7959,
      "num_input_tokens_seen": 5911759936,
      "step": 7514
    },
    {
      "epoch": 0.7972628898790579,
      "grad_norm": 1.730982816768102,
      "learning_rate": 4.947091194733019e-05,
      "loss": 1.8255,
      "num_input_tokens_seen": 5912546768,
      "step": 7515
    },
    {
      "epoch": 0.7973689794186293,
      "grad_norm": 0.8161761060966942,
      "learning_rate": 4.94707697167049e-05,
      "loss": 2.0797,
      "num_input_tokens_seen": 5913333520,
      "step": 7516
    },
    {
      "epoch": 0.7974750689582008,
      "grad_norm": 1.2431694672373275,
      "learning_rate": 4.947062746716932e-05,
      "loss": 2.1631,
      "num_input_tokens_seen": 5914120144,
      "step": 7517
    },
    {
      "epoch": 0.7975811584977721,
      "grad_norm": 1.4627908171195443,
      "learning_rate": 4.947048519872355e-05,
      "loss": 1.8387,
      "num_input_tokens_seen": 5914906928,
      "step": 7518
    },
    {
      "epoch": 0.7976872480373435,
      "grad_norm": 0.7671509932316481,
      "learning_rate": 4.947034291136771e-05,
      "loss": 1.9406,
      "num_input_tokens_seen": 5915693632,
      "step": 7519
    },
    {
      "epoch": 0.797793337576915,
      "grad_norm": 2.449031341444528,
      "learning_rate": 4.94702006051019e-05,
      "loss": 1.8979,
      "num_input_tokens_seen": 5916480448,
      "step": 7520
    },
    {
      "epoch": 0.7978994271164863,
      "grad_norm": 0.8461400165643109,
      "learning_rate": 4.947005827992625e-05,
      "loss": 1.9445,
      "num_input_tokens_seen": 5917267280,
      "step": 7521
    },
    {
      "epoch": 0.7980055166560577,
      "grad_norm": 1.0560493262659227,
      "learning_rate": 4.946991593584085e-05,
      "loss": 1.8518,
      "num_input_tokens_seen": 5918054080,
      "step": 7522
    },
    {
      "epoch": 0.7981116061956292,
      "grad_norm": 0.9262173692249591,
      "learning_rate": 4.946977357284581e-05,
      "loss": 2.0598,
      "num_input_tokens_seen": 5918840800,
      "step": 7523
    },
    {
      "epoch": 0.7982176957352005,
      "grad_norm": 1.0482873258335865,
      "learning_rate": 4.946963119094126e-05,
      "loss": 1.9666,
      "num_input_tokens_seen": 5919627616,
      "step": 7524
    },
    {
      "epoch": 0.7983237852747719,
      "grad_norm": 0.562388399411033,
      "learning_rate": 4.9469488790127294e-05,
      "loss": 1.9088,
      "num_input_tokens_seen": 5920414432,
      "step": 7525
    },
    {
      "epoch": 0.7984298748143434,
      "grad_norm": 0.8082481815593802,
      "learning_rate": 4.946934637040402e-05,
      "loss": 2.0136,
      "num_input_tokens_seen": 5921201232,
      "step": 7526
    },
    {
      "epoch": 0.7985359643539147,
      "grad_norm": 0.5993716526571933,
      "learning_rate": 4.946920393177156e-05,
      "loss": 1.7908,
      "num_input_tokens_seen": 5921988000,
      "step": 7527
    },
    {
      "epoch": 0.7986420538934861,
      "grad_norm": 0.6893354189965659,
      "learning_rate": 4.9469061474230014e-05,
      "loss": 1.8169,
      "num_input_tokens_seen": 5922774784,
      "step": 7528
    },
    {
      "epoch": 0.7987481434330576,
      "grad_norm": 0.7055768149095889,
      "learning_rate": 4.946891899777949e-05,
      "loss": 2.0081,
      "num_input_tokens_seen": 5923561504,
      "step": 7529
    },
    {
      "epoch": 0.7988542329726289,
      "grad_norm": 0.751911980944809,
      "learning_rate": 4.946877650242011e-05,
      "loss": 1.9074,
      "num_input_tokens_seen": 5924348224,
      "step": 7530
    },
    {
      "epoch": 0.7989603225122003,
      "grad_norm": 0.6419963408066537,
      "learning_rate": 4.946863398815197e-05,
      "loss": 1.9333,
      "num_input_tokens_seen": 5925135056,
      "step": 7531
    },
    {
      "epoch": 0.7990664120517716,
      "grad_norm": 0.8415914443489941,
      "learning_rate": 4.9468491454975194e-05,
      "loss": 2.0018,
      "num_input_tokens_seen": 5925921808,
      "step": 7532
    },
    {
      "epoch": 0.7991725015913431,
      "grad_norm": 0.5649277894693824,
      "learning_rate": 4.9468348902889884e-05,
      "loss": 2.0904,
      "num_input_tokens_seen": 5926708576,
      "step": 7533
    },
    {
      "epoch": 0.7992785911309145,
      "grad_norm": 0.5562470973673975,
      "learning_rate": 4.946820633189615e-05,
      "loss": 1.8152,
      "num_input_tokens_seen": 5927495344,
      "step": 7534
    },
    {
      "epoch": 0.7993846806704858,
      "grad_norm": 0.4705222509257234,
      "learning_rate": 4.9468063741994106e-05,
      "loss": 1.8941,
      "num_input_tokens_seen": 5928282096,
      "step": 7535
    },
    {
      "epoch": 0.7994907702100573,
      "grad_norm": 0.5965442131833234,
      "learning_rate": 4.946792113318386e-05,
      "loss": 1.975,
      "num_input_tokens_seen": 5929068896,
      "step": 7536
    },
    {
      "epoch": 0.7995968597496287,
      "grad_norm": 0.49118905320987855,
      "learning_rate": 4.946777850546553e-05,
      "loss": 2.0115,
      "num_input_tokens_seen": 5929855600,
      "step": 7537
    },
    {
      "epoch": 0.7997029492892,
      "grad_norm": 0.6094522108660415,
      "learning_rate": 4.9467635858839214e-05,
      "loss": 1.9959,
      "num_input_tokens_seen": 5930642352,
      "step": 7538
    },
    {
      "epoch": 0.7998090388287715,
      "grad_norm": 0.5788986300768413,
      "learning_rate": 4.946749319330502e-05,
      "loss": 1.8877,
      "num_input_tokens_seen": 5931429104,
      "step": 7539
    },
    {
      "epoch": 0.7999151283683429,
      "grad_norm": 0.6010721299882867,
      "learning_rate": 4.946735050886307e-05,
      "loss": 1.938,
      "num_input_tokens_seen": 5932215904,
      "step": 7540
    },
    {
      "epoch": 0.8000212179079143,
      "grad_norm": 0.5948050996240806,
      "learning_rate": 4.946720780551347e-05,
      "loss": 1.8267,
      "num_input_tokens_seen": 5933002736,
      "step": 7541
    },
    {
      "epoch": 0.8001273074474857,
      "grad_norm": 0.48423909854459396,
      "learning_rate": 4.946706508325632e-05,
      "loss": 1.9237,
      "num_input_tokens_seen": 5933789488,
      "step": 7542
    },
    {
      "epoch": 0.8002333969870571,
      "grad_norm": 1.2664891471375785,
      "learning_rate": 4.946692234209176e-05,
      "loss": 2.0458,
      "num_input_tokens_seen": 5934576192,
      "step": 7543
    },
    {
      "epoch": 0.8003394865266285,
      "grad_norm": 0.6696515229675253,
      "learning_rate": 4.9466779582019867e-05,
      "loss": 1.9685,
      "num_input_tokens_seen": 5935362912,
      "step": 7544
    },
    {
      "epoch": 0.8004455760661999,
      "grad_norm": 0.8361830452864636,
      "learning_rate": 4.946663680304077e-05,
      "loss": 1.938,
      "num_input_tokens_seen": 5936149616,
      "step": 7545
    },
    {
      "epoch": 0.8005516656057713,
      "grad_norm": 0.7544619139609954,
      "learning_rate": 4.946649400515457e-05,
      "loss": 1.8562,
      "num_input_tokens_seen": 5936936432,
      "step": 7546
    },
    {
      "epoch": 0.8006577551453427,
      "grad_norm": 0.7476807148912231,
      "learning_rate": 4.946635118836138e-05,
      "loss": 1.8952,
      "num_input_tokens_seen": 5937723200,
      "step": 7547
    },
    {
      "epoch": 0.800763844684914,
      "grad_norm": 0.6509455726771395,
      "learning_rate": 4.946620835266131e-05,
      "loss": 2.0197,
      "num_input_tokens_seen": 5938509904,
      "step": 7548
    },
    {
      "epoch": 0.8008699342244855,
      "grad_norm": 0.4901800832544786,
      "learning_rate": 4.946606549805448e-05,
      "loss": 1.989,
      "num_input_tokens_seen": 5939296592,
      "step": 7549
    },
    {
      "epoch": 0.8009760237640569,
      "grad_norm": 0.6901083401257624,
      "learning_rate": 4.946592262454099e-05,
      "loss": 2.0083,
      "num_input_tokens_seen": 5940083360,
      "step": 7550
    },
    {
      "epoch": 0.8010821133036282,
      "grad_norm": 0.39923725354899126,
      "learning_rate": 4.9465779732120953e-05,
      "loss": 1.9592,
      "num_input_tokens_seen": 5940870048,
      "step": 7551
    },
    {
      "epoch": 0.8011882028431997,
      "grad_norm": 0.6460212778107044,
      "learning_rate": 4.946563682079448e-05,
      "loss": 2.0093,
      "num_input_tokens_seen": 5941656912,
      "step": 7552
    },
    {
      "epoch": 0.8012942923827711,
      "grad_norm": 0.5671509541065722,
      "learning_rate": 4.9465493890561676e-05,
      "loss": 1.9025,
      "num_input_tokens_seen": 5942443760,
      "step": 7553
    },
    {
      "epoch": 0.8014003819223424,
      "grad_norm": 0.5962021220760396,
      "learning_rate": 4.946535094142266e-05,
      "loss": 1.7303,
      "num_input_tokens_seen": 5943230672,
      "step": 7554
    },
    {
      "epoch": 0.8015064714619139,
      "grad_norm": 0.5496896806725023,
      "learning_rate": 4.9465207973377535e-05,
      "loss": 1.8399,
      "num_input_tokens_seen": 5944017472,
      "step": 7555
    },
    {
      "epoch": 0.8016125610014853,
      "grad_norm": 0.5422024722360028,
      "learning_rate": 4.946506498642641e-05,
      "loss": 1.7713,
      "num_input_tokens_seen": 5944804288,
      "step": 7556
    },
    {
      "epoch": 0.8017186505410566,
      "grad_norm": 0.591224192031344,
      "learning_rate": 4.946492198056941e-05,
      "loss": 2.0636,
      "num_input_tokens_seen": 5945591040,
      "step": 7557
    },
    {
      "epoch": 0.8018247400806281,
      "grad_norm": 0.7167644395699437,
      "learning_rate": 4.946477895580664e-05,
      "loss": 2.0375,
      "num_input_tokens_seen": 5946377840,
      "step": 7558
    },
    {
      "epoch": 0.8019308296201995,
      "grad_norm": 0.62989962692069,
      "learning_rate": 4.94646359121382e-05,
      "loss": 1.8734,
      "num_input_tokens_seen": 5947164640,
      "step": 7559
    },
    {
      "epoch": 0.8020369191597708,
      "grad_norm": 0.5134413205959566,
      "learning_rate": 4.9464492849564206e-05,
      "loss": 1.9229,
      "num_input_tokens_seen": 5947951344,
      "step": 7560
    },
    {
      "epoch": 0.8021430086993423,
      "grad_norm": 0.7294328250967846,
      "learning_rate": 4.9464349768084775e-05,
      "loss": 1.9829,
      "num_input_tokens_seen": 5948738048,
      "step": 7561
    },
    {
      "epoch": 0.8022490982389137,
      "grad_norm": 0.490881298812718,
      "learning_rate": 4.946420666770001e-05,
      "loss": 1.9309,
      "num_input_tokens_seen": 5949524800,
      "step": 7562
    },
    {
      "epoch": 0.802355187778485,
      "grad_norm": 1.053489609404998,
      "learning_rate": 4.946406354841002e-05,
      "loss": 1.9034,
      "num_input_tokens_seen": 5950311584,
      "step": 7563
    },
    {
      "epoch": 0.8024612773180564,
      "grad_norm": 0.5322703650733958,
      "learning_rate": 4.9463920410214926e-05,
      "loss": 1.932,
      "num_input_tokens_seen": 5951098304,
      "step": 7564
    },
    {
      "epoch": 0.8025673668576279,
      "grad_norm": 1.2422525599082759,
      "learning_rate": 4.9463777253114827e-05,
      "loss": 2.1999,
      "num_input_tokens_seen": 5951885024,
      "step": 7565
    },
    {
      "epoch": 0.8026734563971992,
      "grad_norm": 0.5382784904828677,
      "learning_rate": 4.946363407710984e-05,
      "loss": 1.937,
      "num_input_tokens_seen": 5952671728,
      "step": 7566
    },
    {
      "epoch": 0.8027795459367706,
      "grad_norm": 1.1979715930871393,
      "learning_rate": 4.946349088220007e-05,
      "loss": 1.9978,
      "num_input_tokens_seen": 5953458512,
      "step": 7567
    },
    {
      "epoch": 0.8028856354763421,
      "grad_norm": 0.4618954319666291,
      "learning_rate": 4.946334766838564e-05,
      "loss": 1.8681,
      "num_input_tokens_seen": 5954245248,
      "step": 7568
    },
    {
      "epoch": 0.8029917250159134,
      "grad_norm": 1.188083583254422,
      "learning_rate": 4.946320443566665e-05,
      "loss": 1.962,
      "num_input_tokens_seen": 5955031968,
      "step": 7569
    },
    {
      "epoch": 0.8030978145554848,
      "grad_norm": 0.6092283466434117,
      "learning_rate": 4.9463061184043215e-05,
      "loss": 2.0012,
      "num_input_tokens_seen": 5955818768,
      "step": 7570
    },
    {
      "epoch": 0.8032039040950563,
      "grad_norm": 0.4844729427004163,
      "learning_rate": 4.9462917913515435e-05,
      "loss": 2.0227,
      "num_input_tokens_seen": 5956605552,
      "step": 7571
    },
    {
      "epoch": 0.8033099936346276,
      "grad_norm": 0.5429942683995442,
      "learning_rate": 4.946277462408344e-05,
      "loss": 2.0573,
      "num_input_tokens_seen": 5957392240,
      "step": 7572
    },
    {
      "epoch": 0.803416083174199,
      "grad_norm": 0.4031983436318288,
      "learning_rate": 4.9462631315747335e-05,
      "loss": 1.9495,
      "num_input_tokens_seen": 5958179104,
      "step": 7573
    },
    {
      "epoch": 0.8035221727137705,
      "grad_norm": 0.6592086304470555,
      "learning_rate": 4.946248798850721e-05,
      "loss": 1.9073,
      "num_input_tokens_seen": 5958965888,
      "step": 7574
    },
    {
      "epoch": 0.8036282622533418,
      "grad_norm": 0.44305278860229946,
      "learning_rate": 4.94623446423632e-05,
      "loss": 1.8868,
      "num_input_tokens_seen": 5959752736,
      "step": 7575
    },
    {
      "epoch": 0.8037343517929132,
      "grad_norm": 0.5399457290792604,
      "learning_rate": 4.9462201277315414e-05,
      "loss": 1.93,
      "num_input_tokens_seen": 5960539472,
      "step": 7576
    },
    {
      "epoch": 0.8038404413324847,
      "grad_norm": 0.47074922641657335,
      "learning_rate": 4.946205789336395e-05,
      "loss": 1.8336,
      "num_input_tokens_seen": 5961326224,
      "step": 7577
    },
    {
      "epoch": 0.803946530872056,
      "grad_norm": 0.45722057373611447,
      "learning_rate": 4.9461914490508926e-05,
      "loss": 2.0551,
      "num_input_tokens_seen": 5962112992,
      "step": 7578
    },
    {
      "epoch": 0.8040526204116274,
      "grad_norm": 0.5236976506589355,
      "learning_rate": 4.946177106875045e-05,
      "loss": 1.9798,
      "num_input_tokens_seen": 5962899792,
      "step": 7579
    },
    {
      "epoch": 0.8041587099511988,
      "grad_norm": 0.41783113032839,
      "learning_rate": 4.946162762808864e-05,
      "loss": 2.065,
      "num_input_tokens_seen": 5963686496,
      "step": 7580
    },
    {
      "epoch": 0.8042647994907702,
      "grad_norm": 0.5173614691052129,
      "learning_rate": 4.9461484168523605e-05,
      "loss": 2.0523,
      "num_input_tokens_seen": 5964473200,
      "step": 7581
    },
    {
      "epoch": 0.8043708890303416,
      "grad_norm": 0.5021636429599928,
      "learning_rate": 4.9461340690055444e-05,
      "loss": 2.0708,
      "num_input_tokens_seen": 5965259936,
      "step": 7582
    },
    {
      "epoch": 0.804476978569913,
      "grad_norm": 0.44017644069250805,
      "learning_rate": 4.9461197192684287e-05,
      "loss": 1.8687,
      "num_input_tokens_seen": 5966046720,
      "step": 7583
    },
    {
      "epoch": 0.8045830681094844,
      "grad_norm": 0.45948145728711903,
      "learning_rate": 4.946105367641022e-05,
      "loss": 1.9216,
      "num_input_tokens_seen": 5966833488,
      "step": 7584
    },
    {
      "epoch": 0.8046891576490558,
      "grad_norm": 0.38920395387512113,
      "learning_rate": 4.946091014123337e-05,
      "loss": 1.8671,
      "num_input_tokens_seen": 5967620336,
      "step": 7585
    },
    {
      "epoch": 0.8047952471886272,
      "grad_norm": 0.4384644238945252,
      "learning_rate": 4.946076658715386e-05,
      "loss": 1.9833,
      "num_input_tokens_seen": 5968407088,
      "step": 7586
    },
    {
      "epoch": 0.8049013367281986,
      "grad_norm": 0.45550266076129836,
      "learning_rate": 4.946062301417178e-05,
      "loss": 1.961,
      "num_input_tokens_seen": 5969193872,
      "step": 7587
    },
    {
      "epoch": 0.80500742626777,
      "grad_norm": 0.42107469581429063,
      "learning_rate": 4.946047942228725e-05,
      "loss": 1.9648,
      "num_input_tokens_seen": 5969980672,
      "step": 7588
    },
    {
      "epoch": 0.8051135158073414,
      "grad_norm": 0.43423597169697276,
      "learning_rate": 4.946033581150038e-05,
      "loss": 1.9508,
      "num_input_tokens_seen": 5970767472,
      "step": 7589
    },
    {
      "epoch": 0.8052196053469128,
      "grad_norm": 0.4448453335133491,
      "learning_rate": 4.9460192181811274e-05,
      "loss": 2.1412,
      "num_input_tokens_seen": 5971554144,
      "step": 7590
    },
    {
      "epoch": 0.8053256948864842,
      "grad_norm": 0.37787906477703487,
      "learning_rate": 4.946004853322005e-05,
      "loss": 1.7824,
      "num_input_tokens_seen": 5972340928,
      "step": 7591
    },
    {
      "epoch": 0.8054317844260556,
      "grad_norm": 0.3729945770520602,
      "learning_rate": 4.9459904865726824e-05,
      "loss": 1.802,
      "num_input_tokens_seen": 5973127808,
      "step": 7592
    },
    {
      "epoch": 0.805537873965627,
      "grad_norm": 0.5035942908147353,
      "learning_rate": 4.94597611793317e-05,
      "loss": 2.0096,
      "num_input_tokens_seen": 5973914512,
      "step": 7593
    },
    {
      "epoch": 0.8056439635051984,
      "grad_norm": 0.3992391272348834,
      "learning_rate": 4.945961747403479e-05,
      "loss": 2.0061,
      "num_input_tokens_seen": 5974701344,
      "step": 7594
    },
    {
      "epoch": 0.8057500530447698,
      "grad_norm": 0.4599333836727676,
      "learning_rate": 4.94594737498362e-05,
      "loss": 1.9186,
      "num_input_tokens_seen": 5975488064,
      "step": 7595
    },
    {
      "epoch": 0.8058561425843411,
      "grad_norm": 0.4926501306523569,
      "learning_rate": 4.945933000673605e-05,
      "loss": 1.9961,
      "num_input_tokens_seen": 5976274752,
      "step": 7596
    },
    {
      "epoch": 0.8059622321239126,
      "grad_norm": 0.4069832553786502,
      "learning_rate": 4.9459186244734447e-05,
      "loss": 1.8791,
      "num_input_tokens_seen": 5977061616,
      "step": 7597
    },
    {
      "epoch": 0.806068321663484,
      "grad_norm": 0.5049030388612126,
      "learning_rate": 4.9459042463831505e-05,
      "loss": 1.8051,
      "num_input_tokens_seen": 5977848400,
      "step": 7598
    },
    {
      "epoch": 0.8061744112030553,
      "grad_norm": 0.37322978158853504,
      "learning_rate": 4.945889866402733e-05,
      "loss": 1.8814,
      "num_input_tokens_seen": 5978635168,
      "step": 7599
    },
    {
      "epoch": 0.8062805007426268,
      "grad_norm": 0.40333561316379274,
      "learning_rate": 4.945875484532204e-05,
      "loss": 1.9138,
      "num_input_tokens_seen": 5979421936,
      "step": 7600
    },
    {
      "epoch": 0.8063865902821982,
      "grad_norm": 0.5229107854160495,
      "learning_rate": 4.9458611007715736e-05,
      "loss": 2.0318,
      "num_input_tokens_seen": 5980208720,
      "step": 7601
    },
    {
      "epoch": 0.8064926798217695,
      "grad_norm": 0.44705885474706014,
      "learning_rate": 4.945846715120854e-05,
      "loss": 1.8909,
      "num_input_tokens_seen": 5980995424,
      "step": 7602
    },
    {
      "epoch": 0.806598769361341,
      "grad_norm": 0.6812658076783692,
      "learning_rate": 4.945832327580056e-05,
      "loss": 1.9438,
      "num_input_tokens_seen": 5981782288,
      "step": 7603
    },
    {
      "epoch": 0.8067048589009124,
      "grad_norm": 0.4050142896540344,
      "learning_rate": 4.94581793814919e-05,
      "loss": 1.7819,
      "num_input_tokens_seen": 5982569168,
      "step": 7604
    },
    {
      "epoch": 0.8068109484404837,
      "grad_norm": 0.6409510984453064,
      "learning_rate": 4.945803546828267e-05,
      "loss": 2.0512,
      "num_input_tokens_seen": 5983355920,
      "step": 7605
    },
    {
      "epoch": 0.8069170379800552,
      "grad_norm": 0.4481471072749989,
      "learning_rate": 4.9457891536172996e-05,
      "loss": 1.7643,
      "num_input_tokens_seen": 5984142752,
      "step": 7606
    },
    {
      "epoch": 0.8070231275196266,
      "grad_norm": 0.4985902544369723,
      "learning_rate": 4.945774758516298e-05,
      "loss": 2.0684,
      "num_input_tokens_seen": 5984929552,
      "step": 7607
    },
    {
      "epoch": 0.8071292170591979,
      "grad_norm": 0.46082926920229905,
      "learning_rate": 4.9457603615252736e-05,
      "loss": 1.7724,
      "num_input_tokens_seen": 5985716448,
      "step": 7608
    },
    {
      "epoch": 0.8072353065987694,
      "grad_norm": 0.47871087743365753,
      "learning_rate": 4.945745962644237e-05,
      "loss": 1.8514,
      "num_input_tokens_seen": 5986503280,
      "step": 7609
    },
    {
      "epoch": 0.8073413961383408,
      "grad_norm": 0.83831472775593,
      "learning_rate": 4.9457315618732e-05,
      "loss": 2.0284,
      "num_input_tokens_seen": 5987289968,
      "step": 7610
    },
    {
      "epoch": 0.8074474856779121,
      "grad_norm": 0.47338723055117127,
      "learning_rate": 4.9457171592121735e-05,
      "loss": 2.1168,
      "num_input_tokens_seen": 5988076624,
      "step": 7611
    },
    {
      "epoch": 0.8075535752174836,
      "grad_norm": 0.9197197811714778,
      "learning_rate": 4.945702754661169e-05,
      "loss": 1.8826,
      "num_input_tokens_seen": 5988863376,
      "step": 7612
    },
    {
      "epoch": 0.807659664757055,
      "grad_norm": 0.6344923586634699,
      "learning_rate": 4.945688348220196e-05,
      "loss": 1.9199,
      "num_input_tokens_seen": 5989650160,
      "step": 7613
    },
    {
      "epoch": 0.8077657542966263,
      "grad_norm": 0.8429579679587673,
      "learning_rate": 4.9456739398892674e-05,
      "loss": 1.8796,
      "num_input_tokens_seen": 5990436896,
      "step": 7614
    },
    {
      "epoch": 0.8078718438361977,
      "grad_norm": 0.7258439784221079,
      "learning_rate": 4.945659529668394e-05,
      "loss": 2.0016,
      "num_input_tokens_seen": 5991223680,
      "step": 7615
    },
    {
      "epoch": 0.8079779333757692,
      "grad_norm": 0.7588082230049542,
      "learning_rate": 4.9456451175575865e-05,
      "loss": 1.9033,
      "num_input_tokens_seen": 5992010512,
      "step": 7616
    },
    {
      "epoch": 0.8080840229153405,
      "grad_norm": 0.528320012786893,
      "learning_rate": 4.945630703556856e-05,
      "loss": 2.0492,
      "num_input_tokens_seen": 5992797296,
      "step": 7617
    },
    {
      "epoch": 0.8081901124549119,
      "grad_norm": 0.48835935681489473,
      "learning_rate": 4.945616287666214e-05,
      "loss": 1.9566,
      "num_input_tokens_seen": 5993584000,
      "step": 7618
    },
    {
      "epoch": 0.8082962019944834,
      "grad_norm": 0.8582725849621582,
      "learning_rate": 4.945601869885671e-05,
      "loss": 2.0082,
      "num_input_tokens_seen": 5994370752,
      "step": 7619
    },
    {
      "epoch": 0.8084022915340547,
      "grad_norm": 0.8337196084799154,
      "learning_rate": 4.9455874502152394e-05,
      "loss": 1.8929,
      "num_input_tokens_seen": 5995157584,
      "step": 7620
    },
    {
      "epoch": 0.8085083810736261,
      "grad_norm": 1.0168944426978999,
      "learning_rate": 4.94557302865493e-05,
      "loss": 1.9669,
      "num_input_tokens_seen": 5995944352,
      "step": 7621
    },
    {
      "epoch": 0.8086144706131976,
      "grad_norm": 1.0193288623257564,
      "learning_rate": 4.945558605204752e-05,
      "loss": 1.9566,
      "num_input_tokens_seen": 5996731152,
      "step": 7622
    },
    {
      "epoch": 0.8087205601527689,
      "grad_norm": 0.8953582240917044,
      "learning_rate": 4.945544179864719e-05,
      "loss": 1.9277,
      "num_input_tokens_seen": 5997517936,
      "step": 7623
    },
    {
      "epoch": 0.8088266496923403,
      "grad_norm": 0.8928142588820989,
      "learning_rate": 4.945529752634841e-05,
      "loss": 1.8687,
      "num_input_tokens_seen": 5998304624,
      "step": 7624
    },
    {
      "epoch": 0.8089327392319118,
      "grad_norm": 0.8494139170392445,
      "learning_rate": 4.94551532351513e-05,
      "loss": 2.0069,
      "num_input_tokens_seen": 5999091424,
      "step": 7625
    },
    {
      "epoch": 0.8090388287714831,
      "grad_norm": 0.7485937518222291,
      "learning_rate": 4.945500892505595e-05,
      "loss": 1.974,
      "num_input_tokens_seen": 5999878208,
      "step": 7626
    },
    {
      "epoch": 0.8091449183110545,
      "grad_norm": 0.5891699848757417,
      "learning_rate": 4.94548645960625e-05,
      "loss": 1.8995,
      "num_input_tokens_seen": 6000664976,
      "step": 7627
    },
    {
      "epoch": 0.809251007850626,
      "grad_norm": 0.5832233654052589,
      "learning_rate": 4.9454720248171046e-05,
      "loss": 2.0069,
      "num_input_tokens_seen": 6001451712,
      "step": 7628
    },
    {
      "epoch": 0.8093570973901973,
      "grad_norm": 0.440639402766176,
      "learning_rate": 4.9454575881381696e-05,
      "loss": 2.0137,
      "num_input_tokens_seen": 6002238560,
      "step": 7629
    },
    {
      "epoch": 0.8094631869297687,
      "grad_norm": 0.5744859027339989,
      "learning_rate": 4.9454431495694574e-05,
      "loss": 1.9858,
      "num_input_tokens_seen": 6003025264,
      "step": 7630
    },
    {
      "epoch": 0.8095692764693401,
      "grad_norm": 0.4967803999368606,
      "learning_rate": 4.945428709110978e-05,
      "loss": 2.0298,
      "num_input_tokens_seen": 6003812016,
      "step": 7631
    },
    {
      "epoch": 0.8096753660089115,
      "grad_norm": 0.4846460151138723,
      "learning_rate": 4.945414266762743e-05,
      "loss": 2.0995,
      "num_input_tokens_seen": 6004598848,
      "step": 7632
    },
    {
      "epoch": 0.8097814555484829,
      "grad_norm": 0.4325008794052497,
      "learning_rate": 4.945399822524764e-05,
      "loss": 1.7796,
      "num_input_tokens_seen": 6005385536,
      "step": 7633
    },
    {
      "epoch": 0.8098875450880543,
      "grad_norm": 0.40202434059366476,
      "learning_rate": 4.9453853763970514e-05,
      "loss": 1.8597,
      "num_input_tokens_seen": 6006172352,
      "step": 7634
    },
    {
      "epoch": 0.8099936346276257,
      "grad_norm": 0.4953646105666381,
      "learning_rate": 4.9453709283796175e-05,
      "loss": 1.9013,
      "num_input_tokens_seen": 6006959120,
      "step": 7635
    },
    {
      "epoch": 0.8100997241671971,
      "grad_norm": 0.4489205410306922,
      "learning_rate": 4.945356478472472e-05,
      "loss": 1.8961,
      "num_input_tokens_seen": 6007745904,
      "step": 7636
    },
    {
      "epoch": 0.8102058137067685,
      "grad_norm": 0.39730640068379125,
      "learning_rate": 4.945342026675627e-05,
      "loss": 1.848,
      "num_input_tokens_seen": 6008532752,
      "step": 7637
    },
    {
      "epoch": 0.81031190324634,
      "grad_norm": 0.6078607622610042,
      "learning_rate": 4.9453275729890935e-05,
      "loss": 1.8193,
      "num_input_tokens_seen": 6009319536,
      "step": 7638
    },
    {
      "epoch": 0.8104179927859113,
      "grad_norm": 0.3925030178379136,
      "learning_rate": 4.945313117412882e-05,
      "loss": 1.9266,
      "num_input_tokens_seen": 6010106224,
      "step": 7639
    },
    {
      "epoch": 0.8105240823254827,
      "grad_norm": 0.8399169319871239,
      "learning_rate": 4.9452986599470056e-05,
      "loss": 1.9613,
      "num_input_tokens_seen": 6010893008,
      "step": 7640
    },
    {
      "epoch": 0.8106301718650541,
      "grad_norm": 0.4722502747719657,
      "learning_rate": 4.9452842005914726e-05,
      "loss": 2.0491,
      "num_input_tokens_seen": 6011679680,
      "step": 7641
    },
    {
      "epoch": 0.8107362614046255,
      "grad_norm": 0.6813674783181503,
      "learning_rate": 4.9452697393462966e-05,
      "loss": 1.8796,
      "num_input_tokens_seen": 6012466528,
      "step": 7642
    },
    {
      "epoch": 0.8108423509441969,
      "grad_norm": 0.47215750168264575,
      "learning_rate": 4.9452552762114876e-05,
      "loss": 1.9071,
      "num_input_tokens_seen": 6013253280,
      "step": 7643
    },
    {
      "epoch": 0.8109484404837684,
      "grad_norm": 0.5095236258156308,
      "learning_rate": 4.945240811187057e-05,
      "loss": 1.809,
      "num_input_tokens_seen": 6014040080,
      "step": 7644
    },
    {
      "epoch": 0.8110545300233397,
      "grad_norm": 0.6529261285379385,
      "learning_rate": 4.945226344273016e-05,
      "loss": 1.9756,
      "num_input_tokens_seen": 6014826896,
      "step": 7645
    },
    {
      "epoch": 0.8111606195629111,
      "grad_norm": 0.43594633754913253,
      "learning_rate": 4.945211875469377e-05,
      "loss": 1.9753,
      "num_input_tokens_seen": 6015613648,
      "step": 7646
    },
    {
      "epoch": 0.8112667091024824,
      "grad_norm": 0.4512962230679675,
      "learning_rate": 4.9451974047761487e-05,
      "loss": 1.8327,
      "num_input_tokens_seen": 6016400432,
      "step": 7647
    },
    {
      "epoch": 0.8113727986420539,
      "grad_norm": 0.7123418193469386,
      "learning_rate": 4.945182932193344e-05,
      "loss": 1.9659,
      "num_input_tokens_seen": 6017187168,
      "step": 7648
    },
    {
      "epoch": 0.8114788881816253,
      "grad_norm": 0.4389962049792234,
      "learning_rate": 4.945168457720974e-05,
      "loss": 1.8904,
      "num_input_tokens_seen": 6017973920,
      "step": 7649
    },
    {
      "epoch": 0.8115849777211966,
      "grad_norm": 0.7527419843502752,
      "learning_rate": 4.9451539813590486e-05,
      "loss": 2.0116,
      "num_input_tokens_seen": 6018760704,
      "step": 7650
    },
    {
      "epoch": 0.8116910672607681,
      "grad_norm": 0.40800897789779594,
      "learning_rate": 4.94513950310758e-05,
      "loss": 1.8956,
      "num_input_tokens_seen": 6019547488,
      "step": 7651
    },
    {
      "epoch": 0.8117971568003395,
      "grad_norm": 0.5260666950709517,
      "learning_rate": 4.94512502296658e-05,
      "loss": 1.889,
      "num_input_tokens_seen": 6020334144,
      "step": 7652
    },
    {
      "epoch": 0.8119032463399108,
      "grad_norm": 0.5539178723351678,
      "learning_rate": 4.945110540936059e-05,
      "loss": 2.0666,
      "num_input_tokens_seen": 6021120848,
      "step": 7653
    },
    {
      "epoch": 0.8120093358794823,
      "grad_norm": 0.4323567072587846,
      "learning_rate": 4.945096057016029e-05,
      "loss": 1.8702,
      "num_input_tokens_seen": 6021907712,
      "step": 7654
    },
    {
      "epoch": 0.8121154254190537,
      "grad_norm": 0.4551690567751551,
      "learning_rate": 4.945081571206499e-05,
      "loss": 1.9932,
      "num_input_tokens_seen": 6022694432,
      "step": 7655
    },
    {
      "epoch": 0.812221514958625,
      "grad_norm": 0.4411588283645989,
      "learning_rate": 4.945067083507483e-05,
      "loss": 1.7734,
      "num_input_tokens_seen": 6023481232,
      "step": 7656
    },
    {
      "epoch": 0.8123276044981965,
      "grad_norm": 0.5489441114013841,
      "learning_rate": 4.945052593918991e-05,
      "loss": 2.0703,
      "num_input_tokens_seen": 6024267984,
      "step": 7657
    },
    {
      "epoch": 0.8124336940377679,
      "grad_norm": 0.4539654165714289,
      "learning_rate": 4.945038102441033e-05,
      "loss": 1.7773,
      "num_input_tokens_seen": 6025054752,
      "step": 7658
    },
    {
      "epoch": 0.8125397835773392,
      "grad_norm": 0.5652407406198778,
      "learning_rate": 4.945023609073621e-05,
      "loss": 1.9375,
      "num_input_tokens_seen": 6025841456,
      "step": 7659
    },
    {
      "epoch": 0.8126458731169107,
      "grad_norm": 0.6219804407839276,
      "learning_rate": 4.9450091138167674e-05,
      "loss": 2.1358,
      "num_input_tokens_seen": 6026628208,
      "step": 7660
    },
    {
      "epoch": 0.8127519626564821,
      "grad_norm": 0.4983542585391089,
      "learning_rate": 4.944994616670483e-05,
      "loss": 1.9209,
      "num_input_tokens_seen": 6027414976,
      "step": 7661
    },
    {
      "epoch": 0.8128580521960534,
      "grad_norm": 0.5275745752621047,
      "learning_rate": 4.944980117634778e-05,
      "loss": 2.0431,
      "num_input_tokens_seen": 6028201728,
      "step": 7662
    },
    {
      "epoch": 0.8129641417356248,
      "grad_norm": 0.641434819206611,
      "learning_rate": 4.944965616709664e-05,
      "loss": 1.9831,
      "num_input_tokens_seen": 6028988544,
      "step": 7663
    },
    {
      "epoch": 0.8130702312751963,
      "grad_norm": 0.58869783374856,
      "learning_rate": 4.944951113895152e-05,
      "loss": 1.8273,
      "num_input_tokens_seen": 6029775328,
      "step": 7664
    },
    {
      "epoch": 0.8131763208147677,
      "grad_norm": 0.4290562230200532,
      "learning_rate": 4.944936609191254e-05,
      "loss": 1.8529,
      "num_input_tokens_seen": 6030562064,
      "step": 7665
    },
    {
      "epoch": 0.813282410354339,
      "grad_norm": 0.925420111124581,
      "learning_rate": 4.9449221025979807e-05,
      "loss": 2.0196,
      "num_input_tokens_seen": 6031348768,
      "step": 7666
    },
    {
      "epoch": 0.8133884998939105,
      "grad_norm": 0.4802975212499626,
      "learning_rate": 4.944907594115343e-05,
      "loss": 2.0919,
      "num_input_tokens_seen": 6032135472,
      "step": 7667
    },
    {
      "epoch": 0.8134945894334819,
      "grad_norm": 1.7884557934265815,
      "learning_rate": 4.9448930837433525e-05,
      "loss": 1.8088,
      "num_input_tokens_seen": 6032922224,
      "step": 7668
    },
    {
      "epoch": 0.8136006789730532,
      "grad_norm": 0.7469634516802768,
      "learning_rate": 4.944878571482021e-05,
      "loss": 1.9205,
      "num_input_tokens_seen": 6033708992,
      "step": 7669
    },
    {
      "epoch": 0.8137067685126247,
      "grad_norm": 1.2132828169925043,
      "learning_rate": 4.944864057331359e-05,
      "loss": 2.0802,
      "num_input_tokens_seen": 6034495696,
      "step": 7670
    },
    {
      "epoch": 0.813812858052196,
      "grad_norm": 0.7578125544983723,
      "learning_rate": 4.944849541291377e-05,
      "loss": 1.9616,
      "num_input_tokens_seen": 6035282432,
      "step": 7671
    },
    {
      "epoch": 0.8139189475917674,
      "grad_norm": 0.6402652500654532,
      "learning_rate": 4.944835023362088e-05,
      "loss": 1.8885,
      "num_input_tokens_seen": 6036069168,
      "step": 7672
    },
    {
      "epoch": 0.8140250371313389,
      "grad_norm": 0.7207283149277836,
      "learning_rate": 4.9448205035435006e-05,
      "loss": 1.8419,
      "num_input_tokens_seen": 6036855920,
      "step": 7673
    },
    {
      "epoch": 0.8141311266709103,
      "grad_norm": 0.48810912100806814,
      "learning_rate": 4.944805981835629e-05,
      "loss": 1.8683,
      "num_input_tokens_seen": 6037642688,
      "step": 7674
    },
    {
      "epoch": 0.8142372162104816,
      "grad_norm": 0.6826160838278071,
      "learning_rate": 4.9447914582384824e-05,
      "loss": 1.9968,
      "num_input_tokens_seen": 6038429392,
      "step": 7675
    },
    {
      "epoch": 0.8143433057500531,
      "grad_norm": 0.45942933084527143,
      "learning_rate": 4.944776932752073e-05,
      "loss": 1.8719,
      "num_input_tokens_seen": 6039216224,
      "step": 7676
    },
    {
      "epoch": 0.8144493952896245,
      "grad_norm": 0.4127833127435473,
      "learning_rate": 4.944762405376412e-05,
      "loss": 1.9008,
      "num_input_tokens_seen": 6040003024,
      "step": 7677
    },
    {
      "epoch": 0.8145554848291958,
      "grad_norm": 0.5125727285831111,
      "learning_rate": 4.9447478761115106e-05,
      "loss": 1.9361,
      "num_input_tokens_seen": 6040789760,
      "step": 7678
    },
    {
      "epoch": 0.8146615743687673,
      "grad_norm": 0.4275133048082485,
      "learning_rate": 4.944733344957379e-05,
      "loss": 1.8866,
      "num_input_tokens_seen": 6041576448,
      "step": 7679
    },
    {
      "epoch": 0.8147676639083387,
      "grad_norm": 0.5150795050615393,
      "learning_rate": 4.94471881191403e-05,
      "loss": 2.0047,
      "num_input_tokens_seen": 6042363184,
      "step": 7680
    },
    {
      "epoch": 0.81487375344791,
      "grad_norm": 0.4098021671467778,
      "learning_rate": 4.944704276981473e-05,
      "loss": 1.8388,
      "num_input_tokens_seen": 6043149952,
      "step": 7681
    },
    {
      "epoch": 0.8149798429874814,
      "grad_norm": 0.5344910812828777,
      "learning_rate": 4.944689740159721e-05,
      "loss": 1.9865,
      "num_input_tokens_seen": 6043936720,
      "step": 7682
    },
    {
      "epoch": 0.8150859325270529,
      "grad_norm": 0.847950852297647,
      "learning_rate": 4.944675201448784e-05,
      "loss": 1.9904,
      "num_input_tokens_seen": 6044723504,
      "step": 7683
    },
    {
      "epoch": 0.8151920220666242,
      "grad_norm": 0.474648020095906,
      "learning_rate": 4.944660660848674e-05,
      "loss": 1.8567,
      "num_input_tokens_seen": 6045510272,
      "step": 7684
    },
    {
      "epoch": 0.8152981116061956,
      "grad_norm": 0.6354771014355556,
      "learning_rate": 4.944646118359402e-05,
      "loss": 1.809,
      "num_input_tokens_seen": 6046297008,
      "step": 7685
    },
    {
      "epoch": 0.8154042011457671,
      "grad_norm": 0.4546271074573673,
      "learning_rate": 4.944631573980979e-05,
      "loss": 1.83,
      "num_input_tokens_seen": 6047083808,
      "step": 7686
    },
    {
      "epoch": 0.8155102906853384,
      "grad_norm": 0.4791290564591823,
      "learning_rate": 4.944617027713418e-05,
      "loss": 2.1088,
      "num_input_tokens_seen": 6047870464,
      "step": 7687
    },
    {
      "epoch": 0.8156163802249098,
      "grad_norm": 0.6231182378265324,
      "learning_rate": 4.9446024795567266e-05,
      "loss": 2.0394,
      "num_input_tokens_seen": 6048657280,
      "step": 7688
    },
    {
      "epoch": 0.8157224697644813,
      "grad_norm": 0.45614274308308805,
      "learning_rate": 4.944587929510919e-05,
      "loss": 1.9515,
      "num_input_tokens_seen": 6049444064,
      "step": 7689
    },
    {
      "epoch": 0.8158285593040526,
      "grad_norm": 0.5628200898006724,
      "learning_rate": 4.944573377576005e-05,
      "loss": 1.9395,
      "num_input_tokens_seen": 6050230896,
      "step": 7690
    },
    {
      "epoch": 0.815934648843624,
      "grad_norm": 0.45320931928202296,
      "learning_rate": 4.944558823751997e-05,
      "loss": 1.925,
      "num_input_tokens_seen": 6051017728,
      "step": 7691
    },
    {
      "epoch": 0.8160407383831955,
      "grad_norm": 0.4931859931853823,
      "learning_rate": 4.9445442680389055e-05,
      "loss": 1.8865,
      "num_input_tokens_seen": 6051804384,
      "step": 7692
    },
    {
      "epoch": 0.8161468279227668,
      "grad_norm": 0.5073875582587491,
      "learning_rate": 4.944529710436742e-05,
      "loss": 2.0066,
      "num_input_tokens_seen": 6052591200,
      "step": 7693
    },
    {
      "epoch": 0.8162529174623382,
      "grad_norm": 0.43587660465199574,
      "learning_rate": 4.944515150945518e-05,
      "loss": 1.7323,
      "num_input_tokens_seen": 6053378000,
      "step": 7694
    },
    {
      "epoch": 0.8163590070019097,
      "grad_norm": 0.469963153105359,
      "learning_rate": 4.944500589565244e-05,
      "loss": 1.8557,
      "num_input_tokens_seen": 6054164816,
      "step": 7695
    },
    {
      "epoch": 0.816465096541481,
      "grad_norm": 0.40959917919569555,
      "learning_rate": 4.9444860262959314e-05,
      "loss": 1.9123,
      "num_input_tokens_seen": 6054951664,
      "step": 7696
    },
    {
      "epoch": 0.8165711860810524,
      "grad_norm": 0.5230084823598894,
      "learning_rate": 4.944471461137592e-05,
      "loss": 2.0775,
      "num_input_tokens_seen": 6055738352,
      "step": 7697
    },
    {
      "epoch": 0.8166772756206238,
      "grad_norm": 0.43353032599519764,
      "learning_rate": 4.944456894090237e-05,
      "loss": 1.928,
      "num_input_tokens_seen": 6056525104,
      "step": 7698
    },
    {
      "epoch": 0.8167833651601952,
      "grad_norm": 0.4364150448525845,
      "learning_rate": 4.944442325153877e-05,
      "loss": 1.8438,
      "num_input_tokens_seen": 6057311840,
      "step": 7699
    },
    {
      "epoch": 0.8168894546997666,
      "grad_norm": 0.34020379196313805,
      "learning_rate": 4.9444277543285246e-05,
      "loss": 1.7862,
      "num_input_tokens_seen": 6058098592,
      "step": 7700
    },
    {
      "epoch": 0.816995544239338,
      "grad_norm": 0.4801590642829068,
      "learning_rate": 4.9444131816141894e-05,
      "loss": 2.0094,
      "num_input_tokens_seen": 6058885296,
      "step": 7701
    },
    {
      "epoch": 0.8171016337789094,
      "grad_norm": 0.44057488886831847,
      "learning_rate": 4.9443986070108834e-05,
      "loss": 1.8782,
      "num_input_tokens_seen": 6059672112,
      "step": 7702
    },
    {
      "epoch": 0.8172077233184808,
      "grad_norm": 0.5581668731023742,
      "learning_rate": 4.944384030518618e-05,
      "loss": 1.8666,
      "num_input_tokens_seen": 6060458784,
      "step": 7703
    },
    {
      "epoch": 0.8173138128580522,
      "grad_norm": 0.6005130407423844,
      "learning_rate": 4.944369452137404e-05,
      "loss": 1.8821,
      "num_input_tokens_seen": 6061245504,
      "step": 7704
    },
    {
      "epoch": 0.8174199023976236,
      "grad_norm": 0.48026125869677816,
      "learning_rate": 4.944354871867254e-05,
      "loss": 1.8839,
      "num_input_tokens_seen": 6062032128,
      "step": 7705
    },
    {
      "epoch": 0.817525991937195,
      "grad_norm": 0.5072703491769867,
      "learning_rate": 4.9443402897081766e-05,
      "loss": 1.9422,
      "num_input_tokens_seen": 6062818752,
      "step": 7706
    },
    {
      "epoch": 0.8176320814767664,
      "grad_norm": 0.4030301299342744,
      "learning_rate": 4.944325705660187e-05,
      "loss": 1.9303,
      "num_input_tokens_seen": 6063605552,
      "step": 7707
    },
    {
      "epoch": 0.8177381710163378,
      "grad_norm": 0.5305607824677027,
      "learning_rate": 4.944311119723293e-05,
      "loss": 1.8243,
      "num_input_tokens_seen": 6064392336,
      "step": 7708
    },
    {
      "epoch": 0.8178442605559092,
      "grad_norm": 0.35264061389000884,
      "learning_rate": 4.944296531897506e-05,
      "loss": 1.8119,
      "num_input_tokens_seen": 6065179168,
      "step": 7709
    },
    {
      "epoch": 0.8179503500954806,
      "grad_norm": 0.4307152909559897,
      "learning_rate": 4.9442819421828404e-05,
      "loss": 1.9594,
      "num_input_tokens_seen": 6065965952,
      "step": 7710
    },
    {
      "epoch": 0.818056439635052,
      "grad_norm": 0.4699164305281434,
      "learning_rate": 4.944267350579304e-05,
      "loss": 1.9283,
      "num_input_tokens_seen": 6066752704,
      "step": 7711
    },
    {
      "epoch": 0.8181625291746234,
      "grad_norm": 0.43042668728874905,
      "learning_rate": 4.9442527570869104e-05,
      "loss": 1.8519,
      "num_input_tokens_seen": 6067539424,
      "step": 7712
    },
    {
      "epoch": 0.8182686187141948,
      "grad_norm": 0.3898963810639094,
      "learning_rate": 4.944238161705669e-05,
      "loss": 1.9831,
      "num_input_tokens_seen": 6068326240,
      "step": 7713
    },
    {
      "epoch": 0.8183747082537661,
      "grad_norm": 0.5137353730702106,
      "learning_rate": 4.944223564435593e-05,
      "loss": 2.0408,
      "num_input_tokens_seen": 6069112960,
      "step": 7714
    },
    {
      "epoch": 0.8184807977933376,
      "grad_norm": 0.3722380112399869,
      "learning_rate": 4.944208965276692e-05,
      "loss": 1.806,
      "num_input_tokens_seen": 6069899792,
      "step": 7715
    },
    {
      "epoch": 0.818586887332909,
      "grad_norm": 0.3754239954530008,
      "learning_rate": 4.944194364228979e-05,
      "loss": 1.9392,
      "num_input_tokens_seen": 6070686592,
      "step": 7716
    },
    {
      "epoch": 0.8186929768724803,
      "grad_norm": 0.40397623024996665,
      "learning_rate": 4.944179761292463e-05,
      "loss": 1.8029,
      "num_input_tokens_seen": 6071473392,
      "step": 7717
    },
    {
      "epoch": 0.8187990664120518,
      "grad_norm": 0.4242909009794557,
      "learning_rate": 4.944165156467158e-05,
      "loss": 1.9808,
      "num_input_tokens_seen": 6072260160,
      "step": 7718
    },
    {
      "epoch": 0.8189051559516232,
      "grad_norm": 0.48010686323238316,
      "learning_rate": 4.9441505497530725e-05,
      "loss": 1.8544,
      "num_input_tokens_seen": 6073046912,
      "step": 7719
    },
    {
      "epoch": 0.8190112454911945,
      "grad_norm": 0.5066471657164561,
      "learning_rate": 4.944135941150221e-05,
      "loss": 1.9458,
      "num_input_tokens_seen": 6073833648,
      "step": 7720
    },
    {
      "epoch": 0.819117335030766,
      "grad_norm": 0.5534409732435683,
      "learning_rate": 4.944121330658611e-05,
      "loss": 1.8983,
      "num_input_tokens_seen": 6074620480,
      "step": 7721
    },
    {
      "epoch": 0.8192234245703374,
      "grad_norm": 0.6672683846571722,
      "learning_rate": 4.944106718278257e-05,
      "loss": 1.9356,
      "num_input_tokens_seen": 6075407152,
      "step": 7722
    },
    {
      "epoch": 0.8193295141099087,
      "grad_norm": 0.4998788938393506,
      "learning_rate": 4.944092104009169e-05,
      "loss": 1.9993,
      "num_input_tokens_seen": 6076193984,
      "step": 7723
    },
    {
      "epoch": 0.8194356036494802,
      "grad_norm": 0.5782288396063618,
      "learning_rate": 4.9440774878513575e-05,
      "loss": 2.0031,
      "num_input_tokens_seen": 6076980752,
      "step": 7724
    },
    {
      "epoch": 0.8195416931890516,
      "grad_norm": 0.4538260410955057,
      "learning_rate": 4.9440628698048355e-05,
      "loss": 2.0871,
      "num_input_tokens_seen": 6077767488,
      "step": 7725
    },
    {
      "epoch": 0.8196477827286229,
      "grad_norm": 0.5969215337404505,
      "learning_rate": 4.944048249869613e-05,
      "loss": 1.9831,
      "num_input_tokens_seen": 6078554256,
      "step": 7726
    },
    {
      "epoch": 0.8197538722681944,
      "grad_norm": 0.47300201427113425,
      "learning_rate": 4.9440336280457013e-05,
      "loss": 1.9645,
      "num_input_tokens_seen": 6079341024,
      "step": 7727
    },
    {
      "epoch": 0.8198599618077658,
      "grad_norm": 0.43178333947316017,
      "learning_rate": 4.944019004333112e-05,
      "loss": 1.8891,
      "num_input_tokens_seen": 6080127760,
      "step": 7728
    },
    {
      "epoch": 0.8199660513473371,
      "grad_norm": 0.4319003968869627,
      "learning_rate": 4.944004378731858e-05,
      "loss": 1.8287,
      "num_input_tokens_seen": 6080914544,
      "step": 7729
    },
    {
      "epoch": 0.8200721408869085,
      "grad_norm": 0.5171529159424423,
      "learning_rate": 4.943989751241948e-05,
      "loss": 1.9759,
      "num_input_tokens_seen": 6081701264,
      "step": 7730
    },
    {
      "epoch": 0.82017823042648,
      "grad_norm": 0.4792782115638582,
      "learning_rate": 4.943975121863394e-05,
      "loss": 1.8736,
      "num_input_tokens_seen": 6082488064,
      "step": 7731
    },
    {
      "epoch": 0.8202843199660513,
      "grad_norm": 0.46334151907725635,
      "learning_rate": 4.943960490596209e-05,
      "loss": 2.0133,
      "num_input_tokens_seen": 6083274832,
      "step": 7732
    },
    {
      "epoch": 0.8203904095056227,
      "grad_norm": 0.5360502285399812,
      "learning_rate": 4.943945857440403e-05,
      "loss": 1.8473,
      "num_input_tokens_seen": 6084061568,
      "step": 7733
    },
    {
      "epoch": 0.8204964990451942,
      "grad_norm": 0.845913587968165,
      "learning_rate": 4.943931222395987e-05,
      "loss": 1.9412,
      "num_input_tokens_seen": 6084848288,
      "step": 7734
    },
    {
      "epoch": 0.8206025885847655,
      "grad_norm": 0.9589608262705217,
      "learning_rate": 4.943916585462972e-05,
      "loss": 1.9545,
      "num_input_tokens_seen": 6085635072,
      "step": 7735
    },
    {
      "epoch": 0.8207086781243369,
      "grad_norm": 0.7174071940708379,
      "learning_rate": 4.94390194664137e-05,
      "loss": 1.8726,
      "num_input_tokens_seen": 6086421856,
      "step": 7736
    },
    {
      "epoch": 0.8208147676639084,
      "grad_norm": 0.5136924903145288,
      "learning_rate": 4.943887305931193e-05,
      "loss": 1.9588,
      "num_input_tokens_seen": 6087208672,
      "step": 7737
    },
    {
      "epoch": 0.8209208572034797,
      "grad_norm": 0.7142779235781451,
      "learning_rate": 4.943872663332452e-05,
      "loss": 1.9365,
      "num_input_tokens_seen": 6087995456,
      "step": 7738
    },
    {
      "epoch": 0.8210269467430511,
      "grad_norm": 0.4906569083834862,
      "learning_rate": 4.9438580188451566e-05,
      "loss": 1.8669,
      "num_input_tokens_seen": 6088782224,
      "step": 7739
    },
    {
      "epoch": 0.8211330362826226,
      "grad_norm": 0.494713280217501,
      "learning_rate": 4.94384337246932e-05,
      "loss": 1.8626,
      "num_input_tokens_seen": 6089569008,
      "step": 7740
    },
    {
      "epoch": 0.8212391258221939,
      "grad_norm": 0.5403641907674062,
      "learning_rate": 4.943828724204953e-05,
      "loss": 1.9308,
      "num_input_tokens_seen": 6090355824,
      "step": 7741
    },
    {
      "epoch": 0.8213452153617653,
      "grad_norm": 0.5245901166414197,
      "learning_rate": 4.943814074052067e-05,
      "loss": 1.8103,
      "num_input_tokens_seen": 6091142576,
      "step": 7742
    },
    {
      "epoch": 0.8214513049013368,
      "grad_norm": 0.45101919645675603,
      "learning_rate": 4.943799422010673e-05,
      "loss": 1.8382,
      "num_input_tokens_seen": 6091929376,
      "step": 7743
    },
    {
      "epoch": 0.8215573944409081,
      "grad_norm": 0.3996081178919343,
      "learning_rate": 4.9437847680807825e-05,
      "loss": 1.9586,
      "num_input_tokens_seen": 6092716064,
      "step": 7744
    },
    {
      "epoch": 0.8216634839804795,
      "grad_norm": 0.43271280207383905,
      "learning_rate": 4.943770112262407e-05,
      "loss": 1.9632,
      "num_input_tokens_seen": 6093502816,
      "step": 7745
    },
    {
      "epoch": 0.821769573520051,
      "grad_norm": 0.3903041306826338,
      "learning_rate": 4.9437554545555575e-05,
      "loss": 2.0148,
      "num_input_tokens_seen": 6094289648,
      "step": 7746
    },
    {
      "epoch": 0.8218756630596223,
      "grad_norm": 0.506903664984837,
      "learning_rate": 4.943740794960245e-05,
      "loss": 1.9589,
      "num_input_tokens_seen": 6095076416,
      "step": 7747
    },
    {
      "epoch": 0.8219817525991937,
      "grad_norm": 0.5021213658805315,
      "learning_rate": 4.943726133476483e-05,
      "loss": 1.7792,
      "num_input_tokens_seen": 6095863200,
      "step": 7748
    },
    {
      "epoch": 0.8220878421387651,
      "grad_norm": 0.49670666848590816,
      "learning_rate": 4.94371147010428e-05,
      "loss": 2.0157,
      "num_input_tokens_seen": 6096649984,
      "step": 7749
    },
    {
      "epoch": 0.8221939316783365,
      "grad_norm": 0.384965505817992,
      "learning_rate": 4.943696804843648e-05,
      "loss": 1.8771,
      "num_input_tokens_seen": 6097436768,
      "step": 7750
    },
    {
      "epoch": 0.8223000212179079,
      "grad_norm": 0.4156628062705056,
      "learning_rate": 4.9436821376946e-05,
      "loss": 1.8928,
      "num_input_tokens_seen": 6098223616,
      "step": 7751
    },
    {
      "epoch": 0.8224061107574793,
      "grad_norm": 0.49420002699078536,
      "learning_rate": 4.943667468657145e-05,
      "loss": 1.8765,
      "num_input_tokens_seen": 6099010416,
      "step": 7752
    },
    {
      "epoch": 0.8225122002970507,
      "grad_norm": 0.43619278363136227,
      "learning_rate": 4.943652797731296e-05,
      "loss": 1.8434,
      "num_input_tokens_seen": 6099797232,
      "step": 7753
    },
    {
      "epoch": 0.8226182898366221,
      "grad_norm": 0.5501914034747117,
      "learning_rate": 4.943638124917064e-05,
      "loss": 1.9355,
      "num_input_tokens_seen": 6100583904,
      "step": 7754
    },
    {
      "epoch": 0.8227243793761935,
      "grad_norm": 0.5590717379415162,
      "learning_rate": 4.9436234502144596e-05,
      "loss": 1.8466,
      "num_input_tokens_seen": 6101370704,
      "step": 7755
    },
    {
      "epoch": 0.822830468915765,
      "grad_norm": 1.0853780566143614,
      "learning_rate": 4.943608773623495e-05,
      "loss": 1.8934,
      "num_input_tokens_seen": 6102157472,
      "step": 7756
    },
    {
      "epoch": 0.8229365584553363,
      "grad_norm": 0.4235106446983187,
      "learning_rate": 4.9435940951441815e-05,
      "loss": 2.038,
      "num_input_tokens_seen": 6102944256,
      "step": 7757
    },
    {
      "epoch": 0.8230426479949077,
      "grad_norm": 0.9031495102632052,
      "learning_rate": 4.94357941477653e-05,
      "loss": 1.9457,
      "num_input_tokens_seen": 6103730992,
      "step": 7758
    },
    {
      "epoch": 0.8231487375344791,
      "grad_norm": 0.4702116518114145,
      "learning_rate": 4.943564732520551e-05,
      "loss": 1.8356,
      "num_input_tokens_seen": 6104517840,
      "step": 7759
    },
    {
      "epoch": 0.8232548270740505,
      "grad_norm": 0.8812898896443935,
      "learning_rate": 4.9435500483762584e-05,
      "loss": 2.0428,
      "num_input_tokens_seen": 6105304544,
      "step": 7760
    },
    {
      "epoch": 0.8233609166136219,
      "grad_norm": 0.45190512129012933,
      "learning_rate": 4.9435353623436614e-05,
      "loss": 1.9159,
      "num_input_tokens_seen": 6106091312,
      "step": 7761
    },
    {
      "epoch": 0.8234670061531933,
      "grad_norm": 0.8587671518059888,
      "learning_rate": 4.9435206744227725e-05,
      "loss": 1.7797,
      "num_input_tokens_seen": 6106878160,
      "step": 7762
    },
    {
      "epoch": 0.8235730956927647,
      "grad_norm": 0.5742156335765412,
      "learning_rate": 4.943505984613602e-05,
      "loss": 1.9738,
      "num_input_tokens_seen": 6107664960,
      "step": 7763
    },
    {
      "epoch": 0.8236791852323361,
      "grad_norm": 0.5780724094961611,
      "learning_rate": 4.943491292916162e-05,
      "loss": 1.9469,
      "num_input_tokens_seen": 6108451680,
      "step": 7764
    },
    {
      "epoch": 0.8237852747719074,
      "grad_norm": 0.5105971872978745,
      "learning_rate": 4.9434765993304635e-05,
      "loss": 1.8591,
      "num_input_tokens_seen": 6109238512,
      "step": 7765
    },
    {
      "epoch": 0.8238913643114789,
      "grad_norm": 0.5139000436887882,
      "learning_rate": 4.9434619038565174e-05,
      "loss": 1.7523,
      "num_input_tokens_seen": 6110025280,
      "step": 7766
    },
    {
      "epoch": 0.8239974538510503,
      "grad_norm": 0.4846904267169658,
      "learning_rate": 4.943447206494336e-05,
      "loss": 1.7993,
      "num_input_tokens_seen": 6110812016,
      "step": 7767
    },
    {
      "epoch": 0.8241035433906216,
      "grad_norm": 0.40279461856280685,
      "learning_rate": 4.9434325072439305e-05,
      "loss": 1.9864,
      "num_input_tokens_seen": 6111598768,
      "step": 7768
    },
    {
      "epoch": 0.8242096329301931,
      "grad_norm": 0.5721098147221594,
      "learning_rate": 4.943417806105312e-05,
      "loss": 2.0441,
      "num_input_tokens_seen": 6112385440,
      "step": 7769
    },
    {
      "epoch": 0.8243157224697645,
      "grad_norm": 0.4557665910448502,
      "learning_rate": 4.9434031030784924e-05,
      "loss": 1.9508,
      "num_input_tokens_seen": 6113172192,
      "step": 7770
    },
    {
      "epoch": 0.8244218120093358,
      "grad_norm": 0.418117311378594,
      "learning_rate": 4.943388398163482e-05,
      "loss": 1.8686,
      "num_input_tokens_seen": 6113959056,
      "step": 7771
    },
    {
      "epoch": 0.8245279015489073,
      "grad_norm": 0.6332791978649551,
      "learning_rate": 4.9433736913602926e-05,
      "loss": 1.8589,
      "num_input_tokens_seen": 6114745872,
      "step": 7772
    },
    {
      "epoch": 0.8246339910884787,
      "grad_norm": 0.5996818226922283,
      "learning_rate": 4.943358982668936e-05,
      "loss": 1.936,
      "num_input_tokens_seen": 6115532640,
      "step": 7773
    },
    {
      "epoch": 0.82474008062805,
      "grad_norm": 0.4247544953503944,
      "learning_rate": 4.943344272089423e-05,
      "loss": 1.852,
      "num_input_tokens_seen": 6116319424,
      "step": 7774
    },
    {
      "epoch": 0.8248461701676215,
      "grad_norm": 0.5769184587932573,
      "learning_rate": 4.9433295596217655e-05,
      "loss": 1.992,
      "num_input_tokens_seen": 6117106176,
      "step": 7775
    },
    {
      "epoch": 0.8249522597071929,
      "grad_norm": 0.4963966042403758,
      "learning_rate": 4.943314845265975e-05,
      "loss": 1.976,
      "num_input_tokens_seen": 6117892928,
      "step": 7776
    },
    {
      "epoch": 0.8250583492467642,
      "grad_norm": 0.6382974321497699,
      "learning_rate": 4.9433001290220615e-05,
      "loss": 1.959,
      "num_input_tokens_seen": 6118679760,
      "step": 7777
    },
    {
      "epoch": 0.8251644387863357,
      "grad_norm": 0.5431964488058256,
      "learning_rate": 4.943285410890038e-05,
      "loss": 2.0083,
      "num_input_tokens_seen": 6119466624,
      "step": 7778
    },
    {
      "epoch": 0.8252705283259071,
      "grad_norm": 0.4095126854055008,
      "learning_rate": 4.9432706908699157e-05,
      "loss": 1.8485,
      "num_input_tokens_seen": 6120253376,
      "step": 7779
    },
    {
      "epoch": 0.8253766178654784,
      "grad_norm": 0.6026533418004908,
      "learning_rate": 4.9432559689617044e-05,
      "loss": 1.9994,
      "num_input_tokens_seen": 6121040064,
      "step": 7780
    },
    {
      "epoch": 0.8254827074050498,
      "grad_norm": 0.3950844031962127,
      "learning_rate": 4.9432412451654174e-05,
      "loss": 1.9326,
      "num_input_tokens_seen": 6121826880,
      "step": 7781
    },
    {
      "epoch": 0.8255887969446213,
      "grad_norm": 0.7105190800185051,
      "learning_rate": 4.943226519481065e-05,
      "loss": 2.0564,
      "num_input_tokens_seen": 6122613600,
      "step": 7782
    },
    {
      "epoch": 0.8256948864841926,
      "grad_norm": 0.3850874915369832,
      "learning_rate": 4.943211791908659e-05,
      "loss": 1.8661,
      "num_input_tokens_seen": 6123400464,
      "step": 7783
    },
    {
      "epoch": 0.825800976023764,
      "grad_norm": 0.622137926333067,
      "learning_rate": 4.9431970624482096e-05,
      "loss": 1.8114,
      "num_input_tokens_seen": 6124187296,
      "step": 7784
    },
    {
      "epoch": 0.8259070655633355,
      "grad_norm": 0.40003667564568474,
      "learning_rate": 4.943182331099731e-05,
      "loss": 1.9755,
      "num_input_tokens_seen": 6124974032,
      "step": 7785
    },
    {
      "epoch": 0.8260131551029068,
      "grad_norm": 0.6145032935004512,
      "learning_rate": 4.943167597863231e-05,
      "loss": 1.9323,
      "num_input_tokens_seen": 6125760704,
      "step": 7786
    },
    {
      "epoch": 0.8261192446424782,
      "grad_norm": 0.5738456126695172,
      "learning_rate": 4.9431528627387234e-05,
      "loss": 1.867,
      "num_input_tokens_seen": 6126547456,
      "step": 7787
    },
    {
      "epoch": 0.8262253341820497,
      "grad_norm": 0.43965518635039263,
      "learning_rate": 4.943138125726219e-05,
      "loss": 1.7373,
      "num_input_tokens_seen": 6127334176,
      "step": 7788
    },
    {
      "epoch": 0.826331423721621,
      "grad_norm": 0.4834972919424659,
      "learning_rate": 4.94312338682573e-05,
      "loss": 1.9867,
      "num_input_tokens_seen": 6128120976,
      "step": 7789
    },
    {
      "epoch": 0.8264375132611924,
      "grad_norm": 0.6129688200502503,
      "learning_rate": 4.9431086460372656e-05,
      "loss": 1.8223,
      "num_input_tokens_seen": 6128907760,
      "step": 7790
    },
    {
      "epoch": 0.8265436028007639,
      "grad_norm": 0.49235433936970363,
      "learning_rate": 4.943093903360839e-05,
      "loss": 1.8868,
      "num_input_tokens_seen": 6129694480,
      "step": 7791
    },
    {
      "epoch": 0.8266496923403353,
      "grad_norm": 0.8342202307334831,
      "learning_rate": 4.943079158796462e-05,
      "loss": 2.0293,
      "num_input_tokens_seen": 6130481136,
      "step": 7792
    },
    {
      "epoch": 0.8267557818799066,
      "grad_norm": 0.49504295291723166,
      "learning_rate": 4.943064412344144e-05,
      "loss": 1.9251,
      "num_input_tokens_seen": 6131267888,
      "step": 7793
    },
    {
      "epoch": 0.8268618714194781,
      "grad_norm": 0.8004633017288489,
      "learning_rate": 4.9430496640038976e-05,
      "loss": 1.8427,
      "num_input_tokens_seen": 6132054640,
      "step": 7794
    },
    {
      "epoch": 0.8269679609590495,
      "grad_norm": 0.45501569086512655,
      "learning_rate": 4.9430349137757346e-05,
      "loss": 2.029,
      "num_input_tokens_seen": 6132841440,
      "step": 7795
    },
    {
      "epoch": 0.8270740504986208,
      "grad_norm": 0.6934129986168952,
      "learning_rate": 4.9430201616596654e-05,
      "loss": 2.0906,
      "num_input_tokens_seen": 6133628144,
      "step": 7796
    },
    {
      "epoch": 0.8271801400381922,
      "grad_norm": 0.43424676009225466,
      "learning_rate": 4.943005407655702e-05,
      "loss": 1.9805,
      "num_input_tokens_seen": 6134414896,
      "step": 7797
    },
    {
      "epoch": 0.8272862295777637,
      "grad_norm": 0.5377621251987944,
      "learning_rate": 4.942990651763856e-05,
      "loss": 2.1039,
      "num_input_tokens_seen": 6135201616,
      "step": 7798
    },
    {
      "epoch": 0.827392319117335,
      "grad_norm": 0.6321678537835624,
      "learning_rate": 4.942975893984139e-05,
      "loss": 1.9952,
      "num_input_tokens_seen": 6135988352,
      "step": 7799
    },
    {
      "epoch": 0.8274984086569064,
      "grad_norm": 0.3945684563769389,
      "learning_rate": 4.94296113431656e-05,
      "loss": 2.0001,
      "num_input_tokens_seen": 6136775104,
      "step": 7800
    },
    {
      "epoch": 0.8276044981964779,
      "grad_norm": 0.8467602550061875,
      "learning_rate": 4.942946372761134e-05,
      "loss": 2.0336,
      "num_input_tokens_seen": 6137561808,
      "step": 7801
    },
    {
      "epoch": 0.8277105877360492,
      "grad_norm": 0.5742436331970409,
      "learning_rate": 4.94293160931787e-05,
      "loss": 1.9412,
      "num_input_tokens_seen": 6138348528,
      "step": 7802
    },
    {
      "epoch": 0.8278166772756206,
      "grad_norm": 0.4672501815517693,
      "learning_rate": 4.942916843986781e-05,
      "loss": 1.9233,
      "num_input_tokens_seen": 6139135280,
      "step": 7803
    },
    {
      "epoch": 0.8279227668151921,
      "grad_norm": 0.7224555102199418,
      "learning_rate": 4.9429020767678766e-05,
      "loss": 2.052,
      "num_input_tokens_seen": 6139922032,
      "step": 7804
    },
    {
      "epoch": 0.8280288563547634,
      "grad_norm": 0.6960902085309618,
      "learning_rate": 4.94288730766117e-05,
      "loss": 1.9332,
      "num_input_tokens_seen": 6140708768,
      "step": 7805
    },
    {
      "epoch": 0.8281349458943348,
      "grad_norm": 0.6385708517579087,
      "learning_rate": 4.942872536666671e-05,
      "loss": 2.0335,
      "num_input_tokens_seen": 6141495488,
      "step": 7806
    },
    {
      "epoch": 0.8282410354339063,
      "grad_norm": 0.7642574658058408,
      "learning_rate": 4.942857763784392e-05,
      "loss": 2.0535,
      "num_input_tokens_seen": 6142282192,
      "step": 7807
    },
    {
      "epoch": 0.8283471249734776,
      "grad_norm": 0.6505654350200408,
      "learning_rate": 4.942842989014344e-05,
      "loss": 1.9964,
      "num_input_tokens_seen": 6143068896,
      "step": 7808
    },
    {
      "epoch": 0.828453214513049,
      "grad_norm": 0.44407486856630435,
      "learning_rate": 4.9428282123565397e-05,
      "loss": 1.8458,
      "num_input_tokens_seen": 6143855792,
      "step": 7809
    },
    {
      "epoch": 0.8285593040526205,
      "grad_norm": 0.6073968500582496,
      "learning_rate": 4.9428134338109886e-05,
      "loss": 1.9144,
      "num_input_tokens_seen": 6144642512,
      "step": 7810
    },
    {
      "epoch": 0.8286653935921918,
      "grad_norm": 0.5854860464818115,
      "learning_rate": 4.9427986533777026e-05,
      "loss": 1.9483,
      "num_input_tokens_seen": 6145429408,
      "step": 7811
    },
    {
      "epoch": 0.8287714831317632,
      "grad_norm": 0.5652760395646141,
      "learning_rate": 4.9427838710566946e-05,
      "loss": 2.0393,
      "num_input_tokens_seen": 6146216176,
      "step": 7812
    },
    {
      "epoch": 0.8288775726713347,
      "grad_norm": 0.7767184633280421,
      "learning_rate": 4.9427690868479734e-05,
      "loss": 1.8926,
      "num_input_tokens_seen": 6147002896,
      "step": 7813
    },
    {
      "epoch": 0.828983662210906,
      "grad_norm": 0.5893856731857424,
      "learning_rate": 4.942754300751553e-05,
      "loss": 1.8332,
      "num_input_tokens_seen": 6147789664,
      "step": 7814
    },
    {
      "epoch": 0.8290897517504774,
      "grad_norm": 0.6265792850141355,
      "learning_rate": 4.942739512767443e-05,
      "loss": 1.9625,
      "num_input_tokens_seen": 6148576416,
      "step": 7815
    },
    {
      "epoch": 0.8291958412900488,
      "grad_norm": 0.8645391820528494,
      "learning_rate": 4.9427247228956565e-05,
      "loss": 1.9265,
      "num_input_tokens_seen": 6149363136,
      "step": 7816
    },
    {
      "epoch": 0.8293019308296202,
      "grad_norm": 0.5625257999729381,
      "learning_rate": 4.942709931136204e-05,
      "loss": 1.8835,
      "num_input_tokens_seen": 6150149872,
      "step": 7817
    },
    {
      "epoch": 0.8294080203691916,
      "grad_norm": 0.7391226213278166,
      "learning_rate": 4.9426951374890954e-05,
      "loss": 1.9711,
      "num_input_tokens_seen": 6150936624,
      "step": 7818
    },
    {
      "epoch": 0.829514109908763,
      "grad_norm": 0.534486129311866,
      "learning_rate": 4.942680341954345e-05,
      "loss": 1.907,
      "num_input_tokens_seen": 6151723376,
      "step": 7819
    },
    {
      "epoch": 0.8296201994483344,
      "grad_norm": 0.6806175892274632,
      "learning_rate": 4.9426655445319626e-05,
      "loss": 2.0365,
      "num_input_tokens_seen": 6152510128,
      "step": 7820
    },
    {
      "epoch": 0.8297262889879058,
      "grad_norm": 0.5647767133871892,
      "learning_rate": 4.94265074522196e-05,
      "loss": 1.8728,
      "num_input_tokens_seen": 6153296896,
      "step": 7821
    },
    {
      "epoch": 0.8298323785274772,
      "grad_norm": 0.8815993382471783,
      "learning_rate": 4.942635944024348e-05,
      "loss": 1.9184,
      "num_input_tokens_seen": 6154083600,
      "step": 7822
    },
    {
      "epoch": 0.8299384680670486,
      "grad_norm": 0.5450350289734632,
      "learning_rate": 4.94262114093914e-05,
      "loss": 1.9108,
      "num_input_tokens_seen": 6154870320,
      "step": 7823
    },
    {
      "epoch": 0.83004455760662,
      "grad_norm": 0.606722879328573,
      "learning_rate": 4.942606335966345e-05,
      "loss": 2.0114,
      "num_input_tokens_seen": 6155657056,
      "step": 7824
    },
    {
      "epoch": 0.8301506471461914,
      "grad_norm": 0.5428858270082334,
      "learning_rate": 4.942591529105976e-05,
      "loss": 1.9901,
      "num_input_tokens_seen": 6156443824,
      "step": 7825
    },
    {
      "epoch": 0.8302567366857628,
      "grad_norm": 0.4478820954373589,
      "learning_rate": 4.942576720358043e-05,
      "loss": 1.949,
      "num_input_tokens_seen": 6157230656,
      "step": 7826
    },
    {
      "epoch": 0.8303628262253342,
      "grad_norm": 0.5123046154226456,
      "learning_rate": 4.9425619097225595e-05,
      "loss": 1.8941,
      "num_input_tokens_seen": 6158017312,
      "step": 7827
    },
    {
      "epoch": 0.8304689157649056,
      "grad_norm": 0.41323275302318835,
      "learning_rate": 4.942547097199535e-05,
      "loss": 1.931,
      "num_input_tokens_seen": 6158804096,
      "step": 7828
    },
    {
      "epoch": 0.830575005304477,
      "grad_norm": 0.560899056281487,
      "learning_rate": 4.942532282788982e-05,
      "loss": 1.9942,
      "num_input_tokens_seen": 6159590848,
      "step": 7829
    },
    {
      "epoch": 0.8306810948440484,
      "grad_norm": 0.641886528928262,
      "learning_rate": 4.9425174664909125e-05,
      "loss": 1.9097,
      "num_input_tokens_seen": 6160377600,
      "step": 7830
    },
    {
      "epoch": 0.8307871843836198,
      "grad_norm": 0.5719824289745857,
      "learning_rate": 4.942502648305336e-05,
      "loss": 1.9919,
      "num_input_tokens_seen": 6161164352,
      "step": 7831
    },
    {
      "epoch": 0.8308932739231911,
      "grad_norm": 0.5843325010177363,
      "learning_rate": 4.9424878282322656e-05,
      "loss": 1.9683,
      "num_input_tokens_seen": 6161951168,
      "step": 7832
    },
    {
      "epoch": 0.8309993634627626,
      "grad_norm": 0.4693012066347934,
      "learning_rate": 4.942473006271712e-05,
      "loss": 2.015,
      "num_input_tokens_seen": 6162737808,
      "step": 7833
    },
    {
      "epoch": 0.831105453002334,
      "grad_norm": 0.5515031747843547,
      "learning_rate": 4.9424581824236874e-05,
      "loss": 1.8033,
      "num_input_tokens_seen": 6163524560,
      "step": 7834
    },
    {
      "epoch": 0.8312115425419053,
      "grad_norm": 0.4472513018297851,
      "learning_rate": 4.942443356688203e-05,
      "loss": 1.8721,
      "num_input_tokens_seen": 6164311312,
      "step": 7835
    },
    {
      "epoch": 0.8313176320814768,
      "grad_norm": 0.7308628129363381,
      "learning_rate": 4.9424285290652694e-05,
      "loss": 1.9577,
      "num_input_tokens_seen": 6165098064,
      "step": 7836
    },
    {
      "epoch": 0.8314237216210482,
      "grad_norm": 0.406044087440892,
      "learning_rate": 4.9424136995548985e-05,
      "loss": 1.8756,
      "num_input_tokens_seen": 6165884816,
      "step": 7837
    },
    {
      "epoch": 0.8315298111606195,
      "grad_norm": 0.9804690134126315,
      "learning_rate": 4.942398868157103e-05,
      "loss": 1.908,
      "num_input_tokens_seen": 6166671648,
      "step": 7838
    },
    {
      "epoch": 0.831635900700191,
      "grad_norm": 0.7368233970464871,
      "learning_rate": 4.942384034871893e-05,
      "loss": 1.8941,
      "num_input_tokens_seen": 6167458384,
      "step": 7839
    },
    {
      "epoch": 0.8317419902397624,
      "grad_norm": 0.5950403937398301,
      "learning_rate": 4.942369199699279e-05,
      "loss": 1.8727,
      "num_input_tokens_seen": 6168245088,
      "step": 7840
    },
    {
      "epoch": 0.8318480797793337,
      "grad_norm": 0.5033277707642699,
      "learning_rate": 4.942354362639275e-05,
      "loss": 2.0176,
      "num_input_tokens_seen": 6169031840,
      "step": 7841
    },
    {
      "epoch": 0.8319541693189052,
      "grad_norm": 0.5548838601423198,
      "learning_rate": 4.9423395236918915e-05,
      "loss": 2.2153,
      "num_input_tokens_seen": 6169818544,
      "step": 7842
    },
    {
      "epoch": 0.8320602588584766,
      "grad_norm": 0.5937426693920034,
      "learning_rate": 4.942324682857139e-05,
      "loss": 1.9352,
      "num_input_tokens_seen": 6170605216,
      "step": 7843
    },
    {
      "epoch": 0.8321663483980479,
      "grad_norm": 0.7030483964358446,
      "learning_rate": 4.94230984013503e-05,
      "loss": 2.0752,
      "num_input_tokens_seen": 6171391888,
      "step": 7844
    },
    {
      "epoch": 0.8322724379376194,
      "grad_norm": 0.4468167442264369,
      "learning_rate": 4.942294995525575e-05,
      "loss": 1.7674,
      "num_input_tokens_seen": 6172178704,
      "step": 7845
    },
    {
      "epoch": 0.8323785274771908,
      "grad_norm": 0.5650334340002394,
      "learning_rate": 4.942280149028787e-05,
      "loss": 1.9422,
      "num_input_tokens_seen": 6172965424,
      "step": 7846
    },
    {
      "epoch": 0.8324846170167621,
      "grad_norm": 0.4536195354561047,
      "learning_rate": 4.942265300644676e-05,
      "loss": 1.9652,
      "num_input_tokens_seen": 6173752224,
      "step": 7847
    },
    {
      "epoch": 0.8325907065563335,
      "grad_norm": 0.47002406550555764,
      "learning_rate": 4.9422504503732534e-05,
      "loss": 1.8816,
      "num_input_tokens_seen": 6174538960,
      "step": 7848
    },
    {
      "epoch": 0.832696796095905,
      "grad_norm": 0.5324047342231445,
      "learning_rate": 4.942235598214533e-05,
      "loss": 1.9673,
      "num_input_tokens_seen": 6175325680,
      "step": 7849
    },
    {
      "epoch": 0.8328028856354763,
      "grad_norm": 0.6583182825791333,
      "learning_rate": 4.942220744168523e-05,
      "loss": 1.918,
      "num_input_tokens_seen": 6176112432,
      "step": 7850
    },
    {
      "epoch": 0.8329089751750477,
      "grad_norm": 0.46073160910445865,
      "learning_rate": 4.942205888235237e-05,
      "loss": 1.88,
      "num_input_tokens_seen": 6176899264,
      "step": 7851
    },
    {
      "epoch": 0.8330150647146192,
      "grad_norm": 0.6029063634966911,
      "learning_rate": 4.942191030414686e-05,
      "loss": 1.9481,
      "num_input_tokens_seen": 6177686064,
      "step": 7852
    },
    {
      "epoch": 0.8331211542541905,
      "grad_norm": 0.4814682748974826,
      "learning_rate": 4.942176170706881e-05,
      "loss": 2.0372,
      "num_input_tokens_seen": 6178472816,
      "step": 7853
    },
    {
      "epoch": 0.8332272437937619,
      "grad_norm": 0.42849317298115697,
      "learning_rate": 4.9421613091118346e-05,
      "loss": 1.9964,
      "num_input_tokens_seen": 6179259616,
      "step": 7854
    },
    {
      "epoch": 0.8333333333333334,
      "grad_norm": 0.8015712729001047,
      "learning_rate": 4.9421464456295574e-05,
      "loss": 2.1347,
      "num_input_tokens_seen": 6180046320,
      "step": 7855
    },
    {
      "epoch": 0.8334394228729047,
      "grad_norm": 0.5697152402724812,
      "learning_rate": 4.9421315802600616e-05,
      "loss": 1.9144,
      "num_input_tokens_seen": 6180833104,
      "step": 7856
    },
    {
      "epoch": 0.8335455124124761,
      "grad_norm": 0.6606640717618619,
      "learning_rate": 4.9421167130033574e-05,
      "loss": 1.9478,
      "num_input_tokens_seen": 6181619856,
      "step": 7857
    },
    {
      "epoch": 0.8336516019520476,
      "grad_norm": 0.4633949842023482,
      "learning_rate": 4.942101843859457e-05,
      "loss": 1.9359,
      "num_input_tokens_seen": 6182406624,
      "step": 7858
    },
    {
      "epoch": 0.8337576914916189,
      "grad_norm": 0.7064593589908494,
      "learning_rate": 4.942086972828373e-05,
      "loss": 1.7875,
      "num_input_tokens_seen": 6183193488,
      "step": 7859
    },
    {
      "epoch": 0.8338637810311903,
      "grad_norm": 0.46251715719670544,
      "learning_rate": 4.9420720999101146e-05,
      "loss": 1.8991,
      "num_input_tokens_seen": 6183980304,
      "step": 7860
    },
    {
      "epoch": 0.8339698705707618,
      "grad_norm": 0.5248269032146694,
      "learning_rate": 4.942057225104695e-05,
      "loss": 1.9152,
      "num_input_tokens_seen": 6184767136,
      "step": 7861
    },
    {
      "epoch": 0.8340759601103331,
      "grad_norm": 0.6449967657572189,
      "learning_rate": 4.942042348412125e-05,
      "loss": 1.9497,
      "num_input_tokens_seen": 6185554000,
      "step": 7862
    },
    {
      "epoch": 0.8341820496499045,
      "grad_norm": 0.5563074776904994,
      "learning_rate": 4.9420274698324164e-05,
      "loss": 1.9434,
      "num_input_tokens_seen": 6186340752,
      "step": 7863
    },
    {
      "epoch": 0.8342881391894759,
      "grad_norm": 0.7147508544671805,
      "learning_rate": 4.942012589365581e-05,
      "loss": 1.9018,
      "num_input_tokens_seen": 6187127424,
      "step": 7864
    },
    {
      "epoch": 0.8343942287290473,
      "grad_norm": 0.4292127364705136,
      "learning_rate": 4.94199770701163e-05,
      "loss": 1.9386,
      "num_input_tokens_seen": 6187914176,
      "step": 7865
    },
    {
      "epoch": 0.8345003182686187,
      "grad_norm": 0.604404786787275,
      "learning_rate": 4.941982822770575e-05,
      "loss": 1.9787,
      "num_input_tokens_seen": 6188701040,
      "step": 7866
    },
    {
      "epoch": 0.8346064078081901,
      "grad_norm": 0.6013746897754192,
      "learning_rate": 4.9419679366424264e-05,
      "loss": 1.9677,
      "num_input_tokens_seen": 6189487680,
      "step": 7867
    },
    {
      "epoch": 0.8347124973477615,
      "grad_norm": 0.48812099726005453,
      "learning_rate": 4.941953048627197e-05,
      "loss": 1.8075,
      "num_input_tokens_seen": 6190274496,
      "step": 7868
    },
    {
      "epoch": 0.8348185868873329,
      "grad_norm": 0.5214149052060364,
      "learning_rate": 4.9419381587248984e-05,
      "loss": 1.9383,
      "num_input_tokens_seen": 6191061328,
      "step": 7869
    },
    {
      "epoch": 0.8349246764269043,
      "grad_norm": 0.4337211681553494,
      "learning_rate": 4.941923266935541e-05,
      "loss": 1.9939,
      "num_input_tokens_seen": 6191848064,
      "step": 7870
    },
    {
      "epoch": 0.8350307659664757,
      "grad_norm": 0.6668373213742366,
      "learning_rate": 4.941908373259137e-05,
      "loss": 1.9027,
      "num_input_tokens_seen": 6192634752,
      "step": 7871
    },
    {
      "epoch": 0.8351368555060471,
      "grad_norm": 0.6233216008857196,
      "learning_rate": 4.9418934776956985e-05,
      "loss": 1.9199,
      "num_input_tokens_seen": 6193421472,
      "step": 7872
    },
    {
      "epoch": 0.8352429450456185,
      "grad_norm": 0.44083285942494854,
      "learning_rate": 4.941878580245236e-05,
      "loss": 2.0013,
      "num_input_tokens_seen": 6194208128,
      "step": 7873
    },
    {
      "epoch": 0.8353490345851899,
      "grad_norm": 0.47928467579029843,
      "learning_rate": 4.9418636809077604e-05,
      "loss": 1.8303,
      "num_input_tokens_seen": 6194994944,
      "step": 7874
    },
    {
      "epoch": 0.8354551241247613,
      "grad_norm": 0.3864318396051846,
      "learning_rate": 4.9418487796832854e-05,
      "loss": 1.8186,
      "num_input_tokens_seen": 6195781776,
      "step": 7875
    },
    {
      "epoch": 0.8355612136643327,
      "grad_norm": 0.49909709898408344,
      "learning_rate": 4.941833876571821e-05,
      "loss": 2.0869,
      "num_input_tokens_seen": 6196568512,
      "step": 7876
    },
    {
      "epoch": 0.8356673032039041,
      "grad_norm": 0.41139700158973,
      "learning_rate": 4.941818971573379e-05,
      "loss": 1.9015,
      "num_input_tokens_seen": 6197355296,
      "step": 7877
    },
    {
      "epoch": 0.8357733927434755,
      "grad_norm": 0.48728533326536516,
      "learning_rate": 4.9418040646879715e-05,
      "loss": 1.7909,
      "num_input_tokens_seen": 6198142096,
      "step": 7878
    },
    {
      "epoch": 0.8358794822830469,
      "grad_norm": 0.3844872847224379,
      "learning_rate": 4.941789155915609e-05,
      "loss": 2.0684,
      "num_input_tokens_seen": 6198928832,
      "step": 7879
    },
    {
      "epoch": 0.8359855718226183,
      "grad_norm": 0.44171429005948387,
      "learning_rate": 4.941774245256303e-05,
      "loss": 1.7856,
      "num_input_tokens_seen": 6199715648,
      "step": 7880
    },
    {
      "epoch": 0.8360916613621897,
      "grad_norm": 0.41575882224891664,
      "learning_rate": 4.9417593327100665e-05,
      "loss": 1.9263,
      "num_input_tokens_seen": 6200502416,
      "step": 7881
    },
    {
      "epoch": 0.8361977509017611,
      "grad_norm": 0.5236517358798753,
      "learning_rate": 4.941744418276909e-05,
      "loss": 1.81,
      "num_input_tokens_seen": 6201289184,
      "step": 7882
    },
    {
      "epoch": 0.8363038404413324,
      "grad_norm": 0.45383135876373565,
      "learning_rate": 4.941729501956843e-05,
      "loss": 1.9629,
      "num_input_tokens_seen": 6202075952,
      "step": 7883
    },
    {
      "epoch": 0.8364099299809039,
      "grad_norm": 0.6437123155734841,
      "learning_rate": 4.9417145837498814e-05,
      "loss": 1.9665,
      "num_input_tokens_seen": 6202862736,
      "step": 7884
    },
    {
      "epoch": 0.8365160195204753,
      "grad_norm": 0.43583227808490493,
      "learning_rate": 4.941699663656033e-05,
      "loss": 1.9611,
      "num_input_tokens_seen": 6203649456,
      "step": 7885
    },
    {
      "epoch": 0.8366221090600466,
      "grad_norm": 0.41649529270003777,
      "learning_rate": 4.941684741675312e-05,
      "loss": 1.7499,
      "num_input_tokens_seen": 6204436288,
      "step": 7886
    },
    {
      "epoch": 0.8367281985996181,
      "grad_norm": 0.5559394580056708,
      "learning_rate": 4.941669817807728e-05,
      "loss": 2.109,
      "num_input_tokens_seen": 6205223040,
      "step": 7887
    },
    {
      "epoch": 0.8368342881391895,
      "grad_norm": 0.4290141098676263,
      "learning_rate": 4.941654892053293e-05,
      "loss": 1.878,
      "num_input_tokens_seen": 6206009920,
      "step": 7888
    },
    {
      "epoch": 0.8369403776787608,
      "grad_norm": 0.5677766727320206,
      "learning_rate": 4.9416399644120195e-05,
      "loss": 1.9751,
      "num_input_tokens_seen": 6206796624,
      "step": 7889
    },
    {
      "epoch": 0.8370464672183323,
      "grad_norm": 0.42506104593977806,
      "learning_rate": 4.9416250348839176e-05,
      "loss": 1.9185,
      "num_input_tokens_seen": 6207583360,
      "step": 7890
    },
    {
      "epoch": 0.8371525567579037,
      "grad_norm": 0.425999695054795,
      "learning_rate": 4.9416101034689996e-05,
      "loss": 1.7875,
      "num_input_tokens_seen": 6208370160,
      "step": 7891
    },
    {
      "epoch": 0.837258646297475,
      "grad_norm": 0.6676879358025198,
      "learning_rate": 4.941595170167277e-05,
      "loss": 1.8433,
      "num_input_tokens_seen": 6209157040,
      "step": 7892
    },
    {
      "epoch": 0.8373647358370465,
      "grad_norm": 0.6144872268285372,
      "learning_rate": 4.9415802349787617e-05,
      "loss": 1.9315,
      "num_input_tokens_seen": 6209943840,
      "step": 7893
    },
    {
      "epoch": 0.8374708253766179,
      "grad_norm": 0.5743692632249219,
      "learning_rate": 4.941565297903464e-05,
      "loss": 1.8649,
      "num_input_tokens_seen": 6210730624,
      "step": 7894
    },
    {
      "epoch": 0.8375769149161892,
      "grad_norm": 0.45175447788557976,
      "learning_rate": 4.941550358941397e-05,
      "loss": 1.9079,
      "num_input_tokens_seen": 6211517280,
      "step": 7895
    },
    {
      "epoch": 0.8376830044557607,
      "grad_norm": 0.4669068918959687,
      "learning_rate": 4.941535418092571e-05,
      "loss": 1.8362,
      "num_input_tokens_seen": 6212304112,
      "step": 7896
    },
    {
      "epoch": 0.8377890939953321,
      "grad_norm": 0.5068907925100058,
      "learning_rate": 4.941520475356999e-05,
      "loss": 1.9959,
      "num_input_tokens_seen": 6213090864,
      "step": 7897
    },
    {
      "epoch": 0.8378951835349034,
      "grad_norm": 0.44316369084866125,
      "learning_rate": 4.9415055307346905e-05,
      "loss": 1.9348,
      "num_input_tokens_seen": 6213877632,
      "step": 7898
    },
    {
      "epoch": 0.8380012730744748,
      "grad_norm": 0.5057092187821686,
      "learning_rate": 4.941490584225659e-05,
      "loss": 1.905,
      "num_input_tokens_seen": 6214664336,
      "step": 7899
    },
    {
      "epoch": 0.8381073626140463,
      "grad_norm": 0.5107105032629005,
      "learning_rate": 4.9414756358299144e-05,
      "loss": 1.8614,
      "num_input_tokens_seen": 6215451120,
      "step": 7900
    },
    {
      "epoch": 0.8382134521536176,
      "grad_norm": 0.4720898804565027,
      "learning_rate": 4.94146068554747e-05,
      "loss": 1.9194,
      "num_input_tokens_seen": 6216237904,
      "step": 7901
    },
    {
      "epoch": 0.838319541693189,
      "grad_norm": 0.6960046465701936,
      "learning_rate": 4.941445733378336e-05,
      "loss": 1.9928,
      "num_input_tokens_seen": 6217024640,
      "step": 7902
    },
    {
      "epoch": 0.8384256312327605,
      "grad_norm": 0.46723824184589247,
      "learning_rate": 4.9414307793225245e-05,
      "loss": 1.9268,
      "num_input_tokens_seen": 6217811392,
      "step": 7903
    },
    {
      "epoch": 0.8385317207723318,
      "grad_norm": 0.74198837445547,
      "learning_rate": 4.9414158233800464e-05,
      "loss": 1.9373,
      "num_input_tokens_seen": 6218598096,
      "step": 7904
    },
    {
      "epoch": 0.8386378103119032,
      "grad_norm": 0.39689300739087763,
      "learning_rate": 4.941400865550914e-05,
      "loss": 1.9025,
      "num_input_tokens_seen": 6219384784,
      "step": 7905
    },
    {
      "epoch": 0.8387438998514747,
      "grad_norm": 0.6652588054810067,
      "learning_rate": 4.941385905835139e-05,
      "loss": 1.9205,
      "num_input_tokens_seen": 6220171504,
      "step": 7906
    },
    {
      "epoch": 0.838849989391046,
      "grad_norm": 0.6251361314405606,
      "learning_rate": 4.941370944232732e-05,
      "loss": 1.9596,
      "num_input_tokens_seen": 6220958320,
      "step": 7907
    },
    {
      "epoch": 0.8389560789306174,
      "grad_norm": 0.4448563579613785,
      "learning_rate": 4.941355980743706e-05,
      "loss": 1.8005,
      "num_input_tokens_seen": 6221745152,
      "step": 7908
    },
    {
      "epoch": 0.8390621684701889,
      "grad_norm": 0.9051427947275059,
      "learning_rate": 4.941341015368071e-05,
      "loss": 1.8911,
      "num_input_tokens_seen": 6222531888,
      "step": 7909
    },
    {
      "epoch": 0.8391682580097602,
      "grad_norm": 0.45246217144987544,
      "learning_rate": 4.94132604810584e-05,
      "loss": 1.8809,
      "num_input_tokens_seen": 6223318704,
      "step": 7910
    },
    {
      "epoch": 0.8392743475493316,
      "grad_norm": 0.8632603937777926,
      "learning_rate": 4.941311078957023e-05,
      "loss": 1.8993,
      "num_input_tokens_seen": 6224105536,
      "step": 7911
    },
    {
      "epoch": 0.8393804370889031,
      "grad_norm": 0.5289858719466931,
      "learning_rate": 4.941296107921633e-05,
      "loss": 2.0672,
      "num_input_tokens_seen": 6224892336,
      "step": 7912
    },
    {
      "epoch": 0.8394865266284744,
      "grad_norm": 0.5019412720873847,
      "learning_rate": 4.941281134999681e-05,
      "loss": 1.8024,
      "num_input_tokens_seen": 6225679120,
      "step": 7913
    },
    {
      "epoch": 0.8395926161680458,
      "grad_norm": 0.47793956740552934,
      "learning_rate": 4.941266160191178e-05,
      "loss": 1.9083,
      "num_input_tokens_seen": 6226465952,
      "step": 7914
    },
    {
      "epoch": 0.8396987057076172,
      "grad_norm": 0.4349780518169645,
      "learning_rate": 4.941251183496137e-05,
      "loss": 1.9383,
      "num_input_tokens_seen": 6227252688,
      "step": 7915
    },
    {
      "epoch": 0.8398047952471887,
      "grad_norm": 0.4572558730142815,
      "learning_rate": 4.941236204914568e-05,
      "loss": 1.861,
      "num_input_tokens_seen": 6228039536,
      "step": 7916
    },
    {
      "epoch": 0.83991088478676,
      "grad_norm": 0.6487934890518152,
      "learning_rate": 4.941221224446484e-05,
      "loss": 1.9365,
      "num_input_tokens_seen": 6228826224,
      "step": 7917
    },
    {
      "epoch": 0.8400169743263314,
      "grad_norm": 0.5438774232714048,
      "learning_rate": 4.941206242091895e-05,
      "loss": 1.9615,
      "num_input_tokens_seen": 6229612960,
      "step": 7918
    },
    {
      "epoch": 0.8401230638659029,
      "grad_norm": 0.7386703357176604,
      "learning_rate": 4.941191257850815e-05,
      "loss": 1.959,
      "num_input_tokens_seen": 6230399664,
      "step": 7919
    },
    {
      "epoch": 0.8402291534054742,
      "grad_norm": 0.4282795279099444,
      "learning_rate": 4.9411762717232524e-05,
      "loss": 1.8979,
      "num_input_tokens_seen": 6231186384,
      "step": 7920
    },
    {
      "epoch": 0.8403352429450456,
      "grad_norm": 0.7825010362437821,
      "learning_rate": 4.94116128370922e-05,
      "loss": 2.0712,
      "num_input_tokens_seen": 6231973072,
      "step": 7921
    },
    {
      "epoch": 0.840441332484617,
      "grad_norm": 0.5522899270727661,
      "learning_rate": 4.941146293808732e-05,
      "loss": 2.0126,
      "num_input_tokens_seen": 6232759840,
      "step": 7922
    },
    {
      "epoch": 0.8405474220241884,
      "grad_norm": 0.44962825756421115,
      "learning_rate": 4.941131302021796e-05,
      "loss": 1.8942,
      "num_input_tokens_seen": 6233546560,
      "step": 7923
    },
    {
      "epoch": 0.8406535115637598,
      "grad_norm": 0.5415015859177146,
      "learning_rate": 4.9411163083484256e-05,
      "loss": 1.8641,
      "num_input_tokens_seen": 6234333344,
      "step": 7924
    },
    {
      "epoch": 0.8407596011033313,
      "grad_norm": 0.5006864070854008,
      "learning_rate": 4.941101312788632e-05,
      "loss": 1.9213,
      "num_input_tokens_seen": 6235120160,
      "step": 7925
    },
    {
      "epoch": 0.8408656906429026,
      "grad_norm": 0.41765866456944045,
      "learning_rate": 4.941086315342428e-05,
      "loss": 1.9482,
      "num_input_tokens_seen": 6235906912,
      "step": 7926
    },
    {
      "epoch": 0.840971780182474,
      "grad_norm": 0.6051759896236559,
      "learning_rate": 4.941071316009823e-05,
      "loss": 2.1418,
      "num_input_tokens_seen": 6236693664,
      "step": 7927
    },
    {
      "epoch": 0.8410778697220455,
      "grad_norm": 0.5197484223119524,
      "learning_rate": 4.941056314790831e-05,
      "loss": 1.8719,
      "num_input_tokens_seen": 6237480448,
      "step": 7928
    },
    {
      "epoch": 0.8411839592616168,
      "grad_norm": 0.47982857607444007,
      "learning_rate": 4.941041311685461e-05,
      "loss": 1.9207,
      "num_input_tokens_seen": 6238267184,
      "step": 7929
    },
    {
      "epoch": 0.8412900488011882,
      "grad_norm": 0.6289240497623062,
      "learning_rate": 4.941026306693726e-05,
      "loss": 1.8876,
      "num_input_tokens_seen": 6239053872,
      "step": 7930
    },
    {
      "epoch": 0.8413961383407595,
      "grad_norm": 0.4083368508749759,
      "learning_rate": 4.941011299815638e-05,
      "loss": 1.9101,
      "num_input_tokens_seen": 6239840528,
      "step": 7931
    },
    {
      "epoch": 0.841502227880331,
      "grad_norm": 0.452358502471244,
      "learning_rate": 4.940996291051208e-05,
      "loss": 1.8689,
      "num_input_tokens_seen": 6240627328,
      "step": 7932
    },
    {
      "epoch": 0.8416083174199024,
      "grad_norm": 0.4949837959585366,
      "learning_rate": 4.9409812804004475e-05,
      "loss": 2.012,
      "num_input_tokens_seen": 6241414080,
      "step": 7933
    },
    {
      "epoch": 0.8417144069594737,
      "grad_norm": 0.4261179609823752,
      "learning_rate": 4.940966267863368e-05,
      "loss": 1.9833,
      "num_input_tokens_seen": 6242200800,
      "step": 7934
    },
    {
      "epoch": 0.8418204964990452,
      "grad_norm": 0.48489981856547765,
      "learning_rate": 4.940951253439982e-05,
      "loss": 1.9624,
      "num_input_tokens_seen": 6242987600,
      "step": 7935
    },
    {
      "epoch": 0.8419265860386166,
      "grad_norm": 0.4492894990488969,
      "learning_rate": 4.940936237130301e-05,
      "loss": 1.9125,
      "num_input_tokens_seen": 6243774288,
      "step": 7936
    },
    {
      "epoch": 0.842032675578188,
      "grad_norm": 0.3865883007262123,
      "learning_rate": 4.9409212189343354e-05,
      "loss": 1.9263,
      "num_input_tokens_seen": 6244561088,
      "step": 7937
    },
    {
      "epoch": 0.8421387651177594,
      "grad_norm": 0.4371647120401467,
      "learning_rate": 4.940906198852098e-05,
      "loss": 1.846,
      "num_input_tokens_seen": 6245347888,
      "step": 7938
    },
    {
      "epoch": 0.8422448546573308,
      "grad_norm": 0.374332287058018,
      "learning_rate": 4.940891176883599e-05,
      "loss": 1.8954,
      "num_input_tokens_seen": 6246134624,
      "step": 7939
    },
    {
      "epoch": 0.8423509441969022,
      "grad_norm": 0.43474090592999526,
      "learning_rate": 4.9408761530288514e-05,
      "loss": 1.9043,
      "num_input_tokens_seen": 6246921296,
      "step": 7940
    },
    {
      "epoch": 0.8424570337364736,
      "grad_norm": 0.424097768410362,
      "learning_rate": 4.940861127287866e-05,
      "loss": 1.9158,
      "num_input_tokens_seen": 6247708096,
      "step": 7941
    },
    {
      "epoch": 0.842563123276045,
      "grad_norm": 0.4533433183889165,
      "learning_rate": 4.9408460996606555e-05,
      "loss": 1.9148,
      "num_input_tokens_seen": 6248494816,
      "step": 7942
    },
    {
      "epoch": 0.8426692128156164,
      "grad_norm": 0.44795676062940903,
      "learning_rate": 4.9408310701472294e-05,
      "loss": 1.7981,
      "num_input_tokens_seen": 6249281520,
      "step": 7943
    },
    {
      "epoch": 0.8427753023551878,
      "grad_norm": 0.4227645619441783,
      "learning_rate": 4.9408160387476024e-05,
      "loss": 1.8561,
      "num_input_tokens_seen": 6250068288,
      "step": 7944
    },
    {
      "epoch": 0.8428813918947592,
      "grad_norm": 0.5575729546628192,
      "learning_rate": 4.940801005461783e-05,
      "loss": 1.9564,
      "num_input_tokens_seen": 6250854992,
      "step": 7945
    },
    {
      "epoch": 0.8429874814343306,
      "grad_norm": 0.4684520585783091,
      "learning_rate": 4.940785970289785e-05,
      "loss": 1.9115,
      "num_input_tokens_seen": 6251641808,
      "step": 7946
    },
    {
      "epoch": 0.8430935709739019,
      "grad_norm": 0.5384321182071248,
      "learning_rate": 4.940770933231619e-05,
      "loss": 2.0026,
      "num_input_tokens_seen": 6252428544,
      "step": 7947
    },
    {
      "epoch": 0.8431996605134734,
      "grad_norm": 0.4951378462153862,
      "learning_rate": 4.9407558942872966e-05,
      "loss": 1.9117,
      "num_input_tokens_seen": 6253215360,
      "step": 7948
    },
    {
      "epoch": 0.8433057500530448,
      "grad_norm": 0.4210631282153503,
      "learning_rate": 4.94074085345683e-05,
      "loss": 1.7202,
      "num_input_tokens_seen": 6254002224,
      "step": 7949
    },
    {
      "epoch": 0.8434118395926161,
      "grad_norm": 0.6421010062519606,
      "learning_rate": 4.9407258107402296e-05,
      "loss": 1.9293,
      "num_input_tokens_seen": 6254788960,
      "step": 7950
    },
    {
      "epoch": 0.8435179291321876,
      "grad_norm": 0.44519779285309546,
      "learning_rate": 4.940710766137509e-05,
      "loss": 1.8219,
      "num_input_tokens_seen": 6255575696,
      "step": 7951
    },
    {
      "epoch": 0.843624018671759,
      "grad_norm": 0.43236422191422363,
      "learning_rate": 4.940695719648678e-05,
      "loss": 1.7259,
      "num_input_tokens_seen": 6256362512,
      "step": 7952
    },
    {
      "epoch": 0.8437301082113303,
      "grad_norm": 0.4998249307224948,
      "learning_rate": 4.94068067127375e-05,
      "loss": 1.933,
      "num_input_tokens_seen": 6257149296,
      "step": 7953
    },
    {
      "epoch": 0.8438361977509018,
      "grad_norm": 0.39543789107147276,
      "learning_rate": 4.940665621012734e-05,
      "loss": 1.8419,
      "num_input_tokens_seen": 6257936016,
      "step": 7954
    },
    {
      "epoch": 0.8439422872904732,
      "grad_norm": 0.525499758246469,
      "learning_rate": 4.9406505688656444e-05,
      "loss": 1.8849,
      "num_input_tokens_seen": 6258722848,
      "step": 7955
    },
    {
      "epoch": 0.8440483768300445,
      "grad_norm": 0.5243500699129351,
      "learning_rate": 4.940635514832492e-05,
      "loss": 1.8399,
      "num_input_tokens_seen": 6259509632,
      "step": 7956
    },
    {
      "epoch": 0.844154466369616,
      "grad_norm": 0.5240566136248314,
      "learning_rate": 4.940620458913287e-05,
      "loss": 1.9796,
      "num_input_tokens_seen": 6260296352,
      "step": 7957
    },
    {
      "epoch": 0.8442605559091874,
      "grad_norm": 0.39359666351638356,
      "learning_rate": 4.9406054011080426e-05,
      "loss": 1.7606,
      "num_input_tokens_seen": 6261083200,
      "step": 7958
    },
    {
      "epoch": 0.8443666454487587,
      "grad_norm": 0.7917210914286182,
      "learning_rate": 4.94059034141677e-05,
      "loss": 1.8318,
      "num_input_tokens_seen": 6261869904,
      "step": 7959
    },
    {
      "epoch": 0.8444727349883302,
      "grad_norm": 0.37229264696036285,
      "learning_rate": 4.9405752798394814e-05,
      "loss": 1.8982,
      "num_input_tokens_seen": 6262656656,
      "step": 7960
    },
    {
      "epoch": 0.8445788245279016,
      "grad_norm": 0.6001348766816141,
      "learning_rate": 4.9405602163761866e-05,
      "loss": 1.9256,
      "num_input_tokens_seen": 6263443488,
      "step": 7961
    },
    {
      "epoch": 0.8446849140674729,
      "grad_norm": 0.5023085913247619,
      "learning_rate": 4.940545151026899e-05,
      "loss": 1.9629,
      "num_input_tokens_seen": 6264230288,
      "step": 7962
    },
    {
      "epoch": 0.8447910036070444,
      "grad_norm": 0.4042187876197579,
      "learning_rate": 4.9405300837916304e-05,
      "loss": 2.0919,
      "num_input_tokens_seen": 6265016944,
      "step": 7963
    },
    {
      "epoch": 0.8448970931466158,
      "grad_norm": 0.3654419156443282,
      "learning_rate": 4.940515014670391e-05,
      "loss": 1.7706,
      "num_input_tokens_seen": 6265803728,
      "step": 7964
    },
    {
      "epoch": 0.8450031826861871,
      "grad_norm": 0.4410171880802443,
      "learning_rate": 4.940499943663193e-05,
      "loss": 1.9667,
      "num_input_tokens_seen": 6266590528,
      "step": 7965
    },
    {
      "epoch": 0.8451092722257585,
      "grad_norm": 0.42936377753366733,
      "learning_rate": 4.940484870770048e-05,
      "loss": 1.9809,
      "num_input_tokens_seen": 6267377200,
      "step": 7966
    },
    {
      "epoch": 0.84521536176533,
      "grad_norm": 0.3913526847028537,
      "learning_rate": 4.940469795990969e-05,
      "loss": 1.6708,
      "num_input_tokens_seen": 6268164064,
      "step": 7967
    },
    {
      "epoch": 0.8453214513049013,
      "grad_norm": 0.5880918200637937,
      "learning_rate": 4.940454719325967e-05,
      "loss": 2.0758,
      "num_input_tokens_seen": 6268950864,
      "step": 7968
    },
    {
      "epoch": 0.8454275408444727,
      "grad_norm": 0.41866507772520806,
      "learning_rate": 4.9404396407750514e-05,
      "loss": 1.9796,
      "num_input_tokens_seen": 6269737696,
      "step": 7969
    },
    {
      "epoch": 0.8455336303840442,
      "grad_norm": 0.6733596625743371,
      "learning_rate": 4.940424560338237e-05,
      "loss": 1.8238,
      "num_input_tokens_seen": 6270524496,
      "step": 7970
    },
    {
      "epoch": 0.8456397199236155,
      "grad_norm": 0.488281284150409,
      "learning_rate": 4.940409478015533e-05,
      "loss": 1.8874,
      "num_input_tokens_seen": 6271311264,
      "step": 7971
    },
    {
      "epoch": 0.8457458094631869,
      "grad_norm": 0.5014492460550544,
      "learning_rate": 4.940394393806953e-05,
      "loss": 1.9453,
      "num_input_tokens_seen": 6272097904,
      "step": 7972
    },
    {
      "epoch": 0.8458518990027584,
      "grad_norm": 0.6251718241589399,
      "learning_rate": 4.940379307712507e-05,
      "loss": 1.9939,
      "num_input_tokens_seen": 6272884512,
      "step": 7973
    },
    {
      "epoch": 0.8459579885423297,
      "grad_norm": 0.4154011447350762,
      "learning_rate": 4.940364219732209e-05,
      "loss": 1.9297,
      "num_input_tokens_seen": 6273671200,
      "step": 7974
    },
    {
      "epoch": 0.8460640780819011,
      "grad_norm": 0.4724730460050924,
      "learning_rate": 4.940349129866068e-05,
      "loss": 1.919,
      "num_input_tokens_seen": 6274457904,
      "step": 7975
    },
    {
      "epoch": 0.8461701676214726,
      "grad_norm": 0.4364684269213567,
      "learning_rate": 4.9403340381140965e-05,
      "loss": 2.0382,
      "num_input_tokens_seen": 6275244592,
      "step": 7976
    },
    {
      "epoch": 0.8462762571610439,
      "grad_norm": 0.471322813612919,
      "learning_rate": 4.9403189444763074e-05,
      "loss": 1.9211,
      "num_input_tokens_seen": 6276031360,
      "step": 7977
    },
    {
      "epoch": 0.8463823467006153,
      "grad_norm": 0.4943674855692581,
      "learning_rate": 4.940303848952711e-05,
      "loss": 1.8462,
      "num_input_tokens_seen": 6276818208,
      "step": 7978
    },
    {
      "epoch": 0.8464884362401868,
      "grad_norm": 0.5090920329209271,
      "learning_rate": 4.9402887515433194e-05,
      "loss": 1.9684,
      "num_input_tokens_seen": 6277605008,
      "step": 7979
    },
    {
      "epoch": 0.8465945257797581,
      "grad_norm": 0.4314495159043827,
      "learning_rate": 4.9402736522481444e-05,
      "loss": 1.9018,
      "num_input_tokens_seen": 6278391744,
      "step": 7980
    },
    {
      "epoch": 0.8467006153193295,
      "grad_norm": 0.4717389120996121,
      "learning_rate": 4.940258551067197e-05,
      "loss": 1.817,
      "num_input_tokens_seen": 6279178528,
      "step": 7981
    },
    {
      "epoch": 0.8468067048589009,
      "grad_norm": 0.4785915858346663,
      "learning_rate": 4.94024344800049e-05,
      "loss": 1.9408,
      "num_input_tokens_seen": 6279965376,
      "step": 7982
    },
    {
      "epoch": 0.8469127943984723,
      "grad_norm": 0.49182164599947004,
      "learning_rate": 4.940228343048033e-05,
      "loss": 1.823,
      "num_input_tokens_seen": 6280752112,
      "step": 7983
    },
    {
      "epoch": 0.8470188839380437,
      "grad_norm": 0.49776607102142506,
      "learning_rate": 4.9402132362098406e-05,
      "loss": 1.9262,
      "num_input_tokens_seen": 6281538816,
      "step": 7984
    },
    {
      "epoch": 0.8471249734776151,
      "grad_norm": 0.7313244023719132,
      "learning_rate": 4.940198127485923e-05,
      "loss": 2.0487,
      "num_input_tokens_seen": 6282325584,
      "step": 7985
    },
    {
      "epoch": 0.8472310630171865,
      "grad_norm": 0.42463515582038036,
      "learning_rate": 4.940183016876292e-05,
      "loss": 1.9107,
      "num_input_tokens_seen": 6283112464,
      "step": 7986
    },
    {
      "epoch": 0.8473371525567579,
      "grad_norm": 0.808269763804281,
      "learning_rate": 4.940167904380959e-05,
      "loss": 1.8456,
      "num_input_tokens_seen": 6283899264,
      "step": 7987
    },
    {
      "epoch": 0.8474432420963293,
      "grad_norm": 0.40168266218313764,
      "learning_rate": 4.940152789999936e-05,
      "loss": 1.9617,
      "num_input_tokens_seen": 6284686016,
      "step": 7988
    },
    {
      "epoch": 0.8475493316359007,
      "grad_norm": 0.9394477532905335,
      "learning_rate": 4.940137673733233e-05,
      "loss": 1.906,
      "num_input_tokens_seen": 6285472784,
      "step": 7989
    },
    {
      "epoch": 0.8476554211754721,
      "grad_norm": 0.4098600008988722,
      "learning_rate": 4.940122555580865e-05,
      "loss": 1.8234,
      "num_input_tokens_seen": 6286259616,
      "step": 7990
    },
    {
      "epoch": 0.8477615107150435,
      "grad_norm": 1.1722089031654244,
      "learning_rate": 4.9401074355428414e-05,
      "loss": 1.9867,
      "num_input_tokens_seen": 6287046288,
      "step": 7991
    },
    {
      "epoch": 0.8478676002546149,
      "grad_norm": 0.5517802362931679,
      "learning_rate": 4.940092313619174e-05,
      "loss": 1.8837,
      "num_input_tokens_seen": 6287833104,
      "step": 7992
    },
    {
      "epoch": 0.8479736897941863,
      "grad_norm": 0.8949365138926192,
      "learning_rate": 4.940077189809875e-05,
      "loss": 1.914,
      "num_input_tokens_seen": 6288619856,
      "step": 7993
    },
    {
      "epoch": 0.8480797793337577,
      "grad_norm": 0.5332262451398836,
      "learning_rate": 4.940062064114956e-05,
      "loss": 1.7107,
      "num_input_tokens_seen": 6289406608,
      "step": 7994
    },
    {
      "epoch": 0.8481858688733291,
      "grad_norm": 1.221096389542616,
      "learning_rate": 4.940046936534429e-05,
      "loss": 2.0779,
      "num_input_tokens_seen": 6290193344,
      "step": 7995
    },
    {
      "epoch": 0.8482919584129005,
      "grad_norm": 0.718944975913047,
      "learning_rate": 4.940031807068305e-05,
      "loss": 1.7982,
      "num_input_tokens_seen": 6290980224,
      "step": 7996
    },
    {
      "epoch": 0.8483980479524719,
      "grad_norm": 1.0640747682122527,
      "learning_rate": 4.940016675716595e-05,
      "loss": 2.0304,
      "num_input_tokens_seen": 6291766992,
      "step": 7997
    },
    {
      "epoch": 0.8485041374920432,
      "grad_norm": 0.48918811479102914,
      "learning_rate": 4.940001542479313e-05,
      "loss": 1.8804,
      "num_input_tokens_seen": 6292553792,
      "step": 7998
    },
    {
      "epoch": 0.8486102270316147,
      "grad_norm": 1.1124236283603623,
      "learning_rate": 4.939986407356469e-05,
      "loss": 1.9492,
      "num_input_tokens_seen": 6293340480,
      "step": 7999
    },
    {
      "epoch": 0.8487163165711861,
      "grad_norm": 0.43836938267637243,
      "learning_rate": 4.939971270348076e-05,
      "loss": 1.8999,
      "num_input_tokens_seen": 6294127264,
      "step": 8000
    },
    {
      "epoch": 0.8487163165711861,
      "eval_loss": 1.8882676362991333,
      "eval_runtime": 65.4456,
      "eval_samples_per_second": 45.84,
      "eval_steps_per_second": 0.489,
      "num_input_tokens_seen": 6294127264,
      "step": 8000
    },
    {
      "epoch": 0.8488224061107574,
      "grad_norm": 0.6978111841168263,
      "learning_rate": 4.939956131454144e-05,
      "loss": 1.9254,
      "num_input_tokens_seen": 6294913968,
      "step": 8001
    },
    {
      "epoch": 0.8489284956503289,
      "grad_norm": 0.6550480578597738,
      "learning_rate": 4.939940990674685e-05,
      "loss": 1.9983,
      "num_input_tokens_seen": 6295700704,
      "step": 8002
    },
    {
      "epoch": 0.8490345851899003,
      "grad_norm": 0.5495416076784492,
      "learning_rate": 4.939925848009712e-05,
      "loss": 1.9749,
      "num_input_tokens_seen": 6296487488,
      "step": 8003
    },
    {
      "epoch": 0.8491406747294716,
      "grad_norm": 0.4700942438752258,
      "learning_rate": 4.939910703459235e-05,
      "loss": 1.8999,
      "num_input_tokens_seen": 6297274272,
      "step": 8004
    },
    {
      "epoch": 0.8492467642690431,
      "grad_norm": 0.5048054176076527,
      "learning_rate": 4.939895557023267e-05,
      "loss": 1.8535,
      "num_input_tokens_seen": 6298060960,
      "step": 8005
    },
    {
      "epoch": 0.8493528538086145,
      "grad_norm": 0.42556003555503946,
      "learning_rate": 4.9398804087018205e-05,
      "loss": 1.9161,
      "num_input_tokens_seen": 6298847696,
      "step": 8006
    },
    {
      "epoch": 0.8494589433481858,
      "grad_norm": 0.6244508312368973,
      "learning_rate": 4.939865258494905e-05,
      "loss": 1.8914,
      "num_input_tokens_seen": 6299634416,
      "step": 8007
    },
    {
      "epoch": 0.8495650328877573,
      "grad_norm": 0.4877644956726988,
      "learning_rate": 4.9398501064025324e-05,
      "loss": 1.8452,
      "num_input_tokens_seen": 6300421184,
      "step": 8008
    },
    {
      "epoch": 0.8496711224273287,
      "grad_norm": 0.42784450841692245,
      "learning_rate": 4.939834952424717e-05,
      "loss": 1.8401,
      "num_input_tokens_seen": 6301208016,
      "step": 8009
    },
    {
      "epoch": 0.8497772119669,
      "grad_norm": 0.5172487375340341,
      "learning_rate": 4.939819796561467e-05,
      "loss": 1.9977,
      "num_input_tokens_seen": 6301994832,
      "step": 8010
    },
    {
      "epoch": 0.8498833015064715,
      "grad_norm": 0.6197628008391335,
      "learning_rate": 4.939804638812797e-05,
      "loss": 1.8638,
      "num_input_tokens_seen": 6302781696,
      "step": 8011
    },
    {
      "epoch": 0.8499893910460429,
      "grad_norm": 0.5843064051869303,
      "learning_rate": 4.939789479178717e-05,
      "loss": 1.9729,
      "num_input_tokens_seen": 6303568368,
      "step": 8012
    },
    {
      "epoch": 0.8500954805856142,
      "grad_norm": 0.45868126159786426,
      "learning_rate": 4.939774317659239e-05,
      "loss": 1.899,
      "num_input_tokens_seen": 6304355040,
      "step": 8013
    },
    {
      "epoch": 0.8502015701251856,
      "grad_norm": 0.7768001347738868,
      "learning_rate": 4.939759154254376e-05,
      "loss": 1.9647,
      "num_input_tokens_seen": 6305141824,
      "step": 8014
    },
    {
      "epoch": 0.8503076596647571,
      "grad_norm": 0.3772971310985058,
      "learning_rate": 4.9397439889641384e-05,
      "loss": 1.6638,
      "num_input_tokens_seen": 6305928576,
      "step": 8015
    },
    {
      "epoch": 0.8504137492043284,
      "grad_norm": 0.5560242012390083,
      "learning_rate": 4.939728821788537e-05,
      "loss": 1.8623,
      "num_input_tokens_seen": 6306715360,
      "step": 8016
    },
    {
      "epoch": 0.8505198387438998,
      "grad_norm": 0.47698397892912714,
      "learning_rate": 4.939713652727587e-05,
      "loss": 1.8955,
      "num_input_tokens_seen": 6307502048,
      "step": 8017
    },
    {
      "epoch": 0.8506259282834713,
      "grad_norm": 0.4581469010296684,
      "learning_rate": 4.9396984817812965e-05,
      "loss": 1.9409,
      "num_input_tokens_seen": 6308288832,
      "step": 8018
    },
    {
      "epoch": 0.8507320178230426,
      "grad_norm": 0.3915135649359623,
      "learning_rate": 4.939683308949679e-05,
      "loss": 1.8553,
      "num_input_tokens_seen": 6309075552,
      "step": 8019
    },
    {
      "epoch": 0.850838107362614,
      "grad_norm": 0.5595727239140378,
      "learning_rate": 4.9396681342327446e-05,
      "loss": 1.9065,
      "num_input_tokens_seen": 6309862288,
      "step": 8020
    },
    {
      "epoch": 0.8509441969021855,
      "grad_norm": 0.47234342635392035,
      "learning_rate": 4.9396529576305076e-05,
      "loss": 1.9323,
      "num_input_tokens_seen": 6310649104,
      "step": 8021
    },
    {
      "epoch": 0.8510502864417568,
      "grad_norm": 0.5239005636620743,
      "learning_rate": 4.9396377791429785e-05,
      "loss": 1.9393,
      "num_input_tokens_seen": 6311435920,
      "step": 8022
    },
    {
      "epoch": 0.8511563759813282,
      "grad_norm": 0.5112532831526495,
      "learning_rate": 4.9396225987701675e-05,
      "loss": 1.9079,
      "num_input_tokens_seen": 6312222624,
      "step": 8023
    },
    {
      "epoch": 0.8512624655208997,
      "grad_norm": 0.45353263128830146,
      "learning_rate": 4.939607416512089e-05,
      "loss": 1.9364,
      "num_input_tokens_seen": 6313009424,
      "step": 8024
    },
    {
      "epoch": 0.851368555060471,
      "grad_norm": 0.4972969882318145,
      "learning_rate": 4.939592232368753e-05,
      "loss": 2.0961,
      "num_input_tokens_seen": 6313796304,
      "step": 8025
    },
    {
      "epoch": 0.8514746446000424,
      "grad_norm": 0.574449926873558,
      "learning_rate": 4.9395770463401714e-05,
      "loss": 2.0427,
      "num_input_tokens_seen": 6314583056,
      "step": 8026
    },
    {
      "epoch": 0.8515807341396139,
      "grad_norm": 0.5640467215003959,
      "learning_rate": 4.939561858426357e-05,
      "loss": 2.0075,
      "num_input_tokens_seen": 6315369840,
      "step": 8027
    },
    {
      "epoch": 0.8516868236791852,
      "grad_norm": 0.5061568671709079,
      "learning_rate": 4.939546668627321e-05,
      "loss": 1.9828,
      "num_input_tokens_seen": 6316156560,
      "step": 8028
    },
    {
      "epoch": 0.8517929132187566,
      "grad_norm": 0.5525812020363516,
      "learning_rate": 4.939531476943073e-05,
      "loss": 2.0547,
      "num_input_tokens_seen": 6316943200,
      "step": 8029
    },
    {
      "epoch": 0.8518990027583281,
      "grad_norm": 0.44479515638183914,
      "learning_rate": 4.9395162833736285e-05,
      "loss": 1.8728,
      "num_input_tokens_seen": 6317729920,
      "step": 8030
    },
    {
      "epoch": 0.8520050922978994,
      "grad_norm": 0.44961381378095466,
      "learning_rate": 4.9395010879189975e-05,
      "loss": 1.9109,
      "num_input_tokens_seen": 6318516656,
      "step": 8031
    },
    {
      "epoch": 0.8521111818374708,
      "grad_norm": 0.45145085141258096,
      "learning_rate": 4.939485890579191e-05,
      "loss": 2.0213,
      "num_input_tokens_seen": 6319303328,
      "step": 8032
    },
    {
      "epoch": 0.8522172713770422,
      "grad_norm": 0.5206281520811987,
      "learning_rate": 4.939470691354221e-05,
      "loss": 1.9062,
      "num_input_tokens_seen": 6320090128,
      "step": 8033
    },
    {
      "epoch": 0.8523233609166136,
      "grad_norm": 0.4098282883150986,
      "learning_rate": 4.9394554902441e-05,
      "loss": 1.8666,
      "num_input_tokens_seen": 6320877008,
      "step": 8034
    },
    {
      "epoch": 0.852429450456185,
      "grad_norm": 0.40186856657955783,
      "learning_rate": 4.9394402872488396e-05,
      "loss": 1.9779,
      "num_input_tokens_seen": 6321663824,
      "step": 8035
    },
    {
      "epoch": 0.8525355399957564,
      "grad_norm": 0.44132066333570336,
      "learning_rate": 4.939425082368451e-05,
      "loss": 1.9741,
      "num_input_tokens_seen": 6322450688,
      "step": 8036
    },
    {
      "epoch": 0.8526416295353278,
      "grad_norm": 0.45675480504868754,
      "learning_rate": 4.939409875602946e-05,
      "loss": 1.8713,
      "num_input_tokens_seen": 6323237408,
      "step": 8037
    },
    {
      "epoch": 0.8527477190748992,
      "grad_norm": 0.43934760375522863,
      "learning_rate": 4.939394666952337e-05,
      "loss": 2.038,
      "num_input_tokens_seen": 6324024112,
      "step": 8038
    },
    {
      "epoch": 0.8528538086144706,
      "grad_norm": 0.4725322788033198,
      "learning_rate": 4.939379456416636e-05,
      "loss": 1.9217,
      "num_input_tokens_seen": 6324810912,
      "step": 8039
    },
    {
      "epoch": 0.852959898154042,
      "grad_norm": 0.49023365230761,
      "learning_rate": 4.939364243995853e-05,
      "loss": 1.9331,
      "num_input_tokens_seen": 6325597744,
      "step": 8040
    },
    {
      "epoch": 0.8530659876936134,
      "grad_norm": 0.6254429912912763,
      "learning_rate": 4.939349029690002e-05,
      "loss": 1.9855,
      "num_input_tokens_seen": 6326384480,
      "step": 8041
    },
    {
      "epoch": 0.8531720772331848,
      "grad_norm": 0.3990760411644031,
      "learning_rate": 4.939333813499093e-05,
      "loss": 1.9153,
      "num_input_tokens_seen": 6327171328,
      "step": 8042
    },
    {
      "epoch": 0.8532781667727563,
      "grad_norm": 0.41148131241911245,
      "learning_rate": 4.939318595423138e-05,
      "loss": 1.8206,
      "num_input_tokens_seen": 6327958032,
      "step": 8043
    },
    {
      "epoch": 0.8533842563123276,
      "grad_norm": 0.4718196622496426,
      "learning_rate": 4.93930337546215e-05,
      "loss": 1.9921,
      "num_input_tokens_seen": 6328744928,
      "step": 8044
    },
    {
      "epoch": 0.853490345851899,
      "grad_norm": 0.4669418503886253,
      "learning_rate": 4.9392881536161394e-05,
      "loss": 1.8447,
      "num_input_tokens_seen": 6329531648,
      "step": 8045
    },
    {
      "epoch": 0.8535964353914705,
      "grad_norm": 0.43189342243822537,
      "learning_rate": 4.939272929885119e-05,
      "loss": 1.794,
      "num_input_tokens_seen": 6330318512,
      "step": 8046
    },
    {
      "epoch": 0.8537025249310418,
      "grad_norm": 0.4150453199793993,
      "learning_rate": 4.9392577042691e-05,
      "loss": 1.9816,
      "num_input_tokens_seen": 6331105168,
      "step": 8047
    },
    {
      "epoch": 0.8538086144706132,
      "grad_norm": 0.7128757314179232,
      "learning_rate": 4.939242476768093e-05,
      "loss": 1.8153,
      "num_input_tokens_seen": 6331892048,
      "step": 8048
    },
    {
      "epoch": 0.8539147040101845,
      "grad_norm": 0.49055460124220984,
      "learning_rate": 4.9392272473821125e-05,
      "loss": 2.0527,
      "num_input_tokens_seen": 6332678784,
      "step": 8049
    },
    {
      "epoch": 0.854020793549756,
      "grad_norm": 0.45185876788821877,
      "learning_rate": 4.939212016111168e-05,
      "loss": 1.9929,
      "num_input_tokens_seen": 6333465504,
      "step": 8050
    },
    {
      "epoch": 0.8541268830893274,
      "grad_norm": 0.3588871420024094,
      "learning_rate": 4.939196782955272e-05,
      "loss": 1.7924,
      "num_input_tokens_seen": 6334252224,
      "step": 8051
    },
    {
      "epoch": 0.8542329726288987,
      "grad_norm": 0.5202758068681984,
      "learning_rate": 4.9391815479144364e-05,
      "loss": 1.8948,
      "num_input_tokens_seen": 6335038944,
      "step": 8052
    },
    {
      "epoch": 0.8543390621684702,
      "grad_norm": 0.5752545591041263,
      "learning_rate": 4.939166310988673e-05,
      "loss": 1.8673,
      "num_input_tokens_seen": 6335825760,
      "step": 8053
    },
    {
      "epoch": 0.8544451517080416,
      "grad_norm": 0.5339650165389386,
      "learning_rate": 4.939151072177994e-05,
      "loss": 2.083,
      "num_input_tokens_seen": 6336612512,
      "step": 8054
    },
    {
      "epoch": 0.854551241247613,
      "grad_norm": 0.4503119922783021,
      "learning_rate": 4.9391358314824096e-05,
      "loss": 1.8693,
      "num_input_tokens_seen": 6337399232,
      "step": 8055
    },
    {
      "epoch": 0.8546573307871844,
      "grad_norm": 0.557131006012522,
      "learning_rate": 4.939120588901933e-05,
      "loss": 1.852,
      "num_input_tokens_seen": 6338186000,
      "step": 8056
    },
    {
      "epoch": 0.8547634203267558,
      "grad_norm": 0.5554155069648136,
      "learning_rate": 4.9391053444365756e-05,
      "loss": 1.8475,
      "num_input_tokens_seen": 6338972848,
      "step": 8057
    },
    {
      "epoch": 0.8548695098663271,
      "grad_norm": 0.39438283838243765,
      "learning_rate": 4.93909009808635e-05,
      "loss": 1.9743,
      "num_input_tokens_seen": 6339759728,
      "step": 8058
    },
    {
      "epoch": 0.8549755994058986,
      "grad_norm": 0.3829809939850493,
      "learning_rate": 4.9390748498512655e-05,
      "loss": 1.9273,
      "num_input_tokens_seen": 6340546592,
      "step": 8059
    },
    {
      "epoch": 0.85508168894547,
      "grad_norm": 0.41830253250740745,
      "learning_rate": 4.939059599731336e-05,
      "loss": 1.7857,
      "num_input_tokens_seen": 6341333392,
      "step": 8060
    },
    {
      "epoch": 0.8551877784850413,
      "grad_norm": 0.42551196404892444,
      "learning_rate": 4.9390443477265734e-05,
      "loss": 1.978,
      "num_input_tokens_seen": 6342120096,
      "step": 8061
    },
    {
      "epoch": 0.8552938680246128,
      "grad_norm": 0.573692881003453,
      "learning_rate": 4.9390290938369885e-05,
      "loss": 1.8133,
      "num_input_tokens_seen": 6342906896,
      "step": 8062
    },
    {
      "epoch": 0.8553999575641842,
      "grad_norm": 0.41136316027011854,
      "learning_rate": 4.939013838062594e-05,
      "loss": 1.9887,
      "num_input_tokens_seen": 6343693680,
      "step": 8063
    },
    {
      "epoch": 0.8555060471037556,
      "grad_norm": 0.7523291582938171,
      "learning_rate": 4.9389985804034e-05,
      "loss": 1.8091,
      "num_input_tokens_seen": 6344480432,
      "step": 8064
    },
    {
      "epoch": 0.8556121366433269,
      "grad_norm": 0.5911301780258043,
      "learning_rate": 4.9389833208594206e-05,
      "loss": 2.0806,
      "num_input_tokens_seen": 6345267200,
      "step": 8065
    },
    {
      "epoch": 0.8557182261828984,
      "grad_norm": 0.688440583402438,
      "learning_rate": 4.9389680594306665e-05,
      "loss": 1.9792,
      "num_input_tokens_seen": 6346053936,
      "step": 8066
    },
    {
      "epoch": 0.8558243157224698,
      "grad_norm": 0.6169368341359047,
      "learning_rate": 4.938952796117149e-05,
      "loss": 1.8946,
      "num_input_tokens_seen": 6346840800,
      "step": 8067
    },
    {
      "epoch": 0.8559304052620411,
      "grad_norm": 0.6460352121898318,
      "learning_rate": 4.93893753091888e-05,
      "loss": 1.7856,
      "num_input_tokens_seen": 6347627584,
      "step": 8068
    },
    {
      "epoch": 0.8560364948016126,
      "grad_norm": 0.6306101717783567,
      "learning_rate": 4.938922263835872e-05,
      "loss": 1.7899,
      "num_input_tokens_seen": 6348414384,
      "step": 8069
    },
    {
      "epoch": 0.856142584341184,
      "grad_norm": 0.45724290797389816,
      "learning_rate": 4.9389069948681366e-05,
      "loss": 1.9194,
      "num_input_tokens_seen": 6349201104,
      "step": 8070
    },
    {
      "epoch": 0.8562486738807553,
      "grad_norm": 0.6119620170940638,
      "learning_rate": 4.938891724015685e-05,
      "loss": 1.9031,
      "num_input_tokens_seen": 6349987840,
      "step": 8071
    },
    {
      "epoch": 0.8563547634203268,
      "grad_norm": 0.539527850471227,
      "learning_rate": 4.93887645127853e-05,
      "loss": 1.9003,
      "num_input_tokens_seen": 6350774656,
      "step": 8072
    },
    {
      "epoch": 0.8564608529598982,
      "grad_norm": 0.5586336069907865,
      "learning_rate": 4.938861176656683e-05,
      "loss": 1.8704,
      "num_input_tokens_seen": 6351561456,
      "step": 8073
    },
    {
      "epoch": 0.8565669424994695,
      "grad_norm": 0.5288185428165662,
      "learning_rate": 4.938845900150155e-05,
      "loss": 1.956,
      "num_input_tokens_seen": 6352348208,
      "step": 8074
    },
    {
      "epoch": 0.856673032039041,
      "grad_norm": 0.7238898677434037,
      "learning_rate": 4.9388306217589583e-05,
      "loss": 1.9073,
      "num_input_tokens_seen": 6353135040,
      "step": 8075
    },
    {
      "epoch": 0.8567791215786124,
      "grad_norm": 0.5404650747446302,
      "learning_rate": 4.938815341483105e-05,
      "loss": 1.8334,
      "num_input_tokens_seen": 6353921840,
      "step": 8076
    },
    {
      "epoch": 0.8568852111181837,
      "grad_norm": 1.1484254192578183,
      "learning_rate": 4.938800059322607e-05,
      "loss": 2.0948,
      "num_input_tokens_seen": 6354708624,
      "step": 8077
    },
    {
      "epoch": 0.8569913006577552,
      "grad_norm": 0.7161726689082878,
      "learning_rate": 4.9387847752774765e-05,
      "loss": 1.9659,
      "num_input_tokens_seen": 6355495440,
      "step": 8078
    },
    {
      "epoch": 0.8570973901973266,
      "grad_norm": 0.679837535223616,
      "learning_rate": 4.938769489347724e-05,
      "loss": 1.9049,
      "num_input_tokens_seen": 6356282256,
      "step": 8079
    },
    {
      "epoch": 0.8572034797368979,
      "grad_norm": 0.5479977949449081,
      "learning_rate": 4.938754201533362e-05,
      "loss": 2.0188,
      "num_input_tokens_seen": 6357069024,
      "step": 8080
    },
    {
      "epoch": 0.8573095692764693,
      "grad_norm": 0.5339253966586882,
      "learning_rate": 4.938738911834402e-05,
      "loss": 1.9804,
      "num_input_tokens_seen": 6357855872,
      "step": 8081
    },
    {
      "epoch": 0.8574156588160408,
      "grad_norm": 0.7254254510484962,
      "learning_rate": 4.938723620250857e-05,
      "loss": 1.9162,
      "num_input_tokens_seen": 6358642640,
      "step": 8082
    },
    {
      "epoch": 0.8575217483556121,
      "grad_norm": 0.5208383116365644,
      "learning_rate": 4.938708326782737e-05,
      "loss": 1.8768,
      "num_input_tokens_seen": 6359429488,
      "step": 8083
    },
    {
      "epoch": 0.8576278378951835,
      "grad_norm": 0.5901851531886994,
      "learning_rate": 4.938693031430055e-05,
      "loss": 1.7298,
      "num_input_tokens_seen": 6360216240,
      "step": 8084
    },
    {
      "epoch": 0.857733927434755,
      "grad_norm": 0.5788429057778508,
      "learning_rate": 4.9386777341928224e-05,
      "loss": 1.9288,
      "num_input_tokens_seen": 6361003040,
      "step": 8085
    },
    {
      "epoch": 0.8578400169743263,
      "grad_norm": 0.5507332866047592,
      "learning_rate": 4.938662435071052e-05,
      "loss": 1.8453,
      "num_input_tokens_seen": 6361789872,
      "step": 8086
    },
    {
      "epoch": 0.8579461065138977,
      "grad_norm": 0.7879530208524678,
      "learning_rate": 4.938647134064755e-05,
      "loss": 1.9969,
      "num_input_tokens_seen": 6362576624,
      "step": 8087
    },
    {
      "epoch": 0.8580521960534692,
      "grad_norm": 0.7839938404158401,
      "learning_rate": 4.938631831173942e-05,
      "loss": 1.8712,
      "num_input_tokens_seen": 6363363328,
      "step": 8088
    },
    {
      "epoch": 0.8581582855930405,
      "grad_norm": 0.6856948061668129,
      "learning_rate": 4.9386165263986264e-05,
      "loss": 1.948,
      "num_input_tokens_seen": 6364150112,
      "step": 8089
    },
    {
      "epoch": 0.8582643751326119,
      "grad_norm": 0.5329793665394112,
      "learning_rate": 4.938601219738819e-05,
      "loss": 1.9615,
      "num_input_tokens_seen": 6364936864,
      "step": 8090
    },
    {
      "epoch": 0.8583704646721834,
      "grad_norm": 0.7524368269997354,
      "learning_rate": 4.938585911194532e-05,
      "loss": 1.7904,
      "num_input_tokens_seen": 6365723696,
      "step": 8091
    },
    {
      "epoch": 0.8584765542117547,
      "grad_norm": 0.3937484930859358,
      "learning_rate": 4.938570600765778e-05,
      "loss": 1.956,
      "num_input_tokens_seen": 6366510512,
      "step": 8092
    },
    {
      "epoch": 0.8585826437513261,
      "grad_norm": 0.7920282942855629,
      "learning_rate": 4.938555288452569e-05,
      "loss": 1.8835,
      "num_input_tokens_seen": 6367297296,
      "step": 8093
    },
    {
      "epoch": 0.8586887332908976,
      "grad_norm": 0.44111447336467,
      "learning_rate": 4.938539974254915e-05,
      "loss": 1.9972,
      "num_input_tokens_seen": 6368083936,
      "step": 8094
    },
    {
      "epoch": 0.8587948228304689,
      "grad_norm": 1.1856020985836409,
      "learning_rate": 4.9385246581728285e-05,
      "loss": 1.9324,
      "num_input_tokens_seen": 6368870688,
      "step": 8095
    },
    {
      "epoch": 0.8589009123700403,
      "grad_norm": 0.4886843197862919,
      "learning_rate": 4.938509340206322e-05,
      "loss": 1.9694,
      "num_input_tokens_seen": 6369657424,
      "step": 8096
    },
    {
      "epoch": 0.8590070019096118,
      "grad_norm": 1.0037612098069988,
      "learning_rate": 4.938494020355408e-05,
      "loss": 2.0259,
      "num_input_tokens_seen": 6370444240,
      "step": 8097
    },
    {
      "epoch": 0.8591130914491831,
      "grad_norm": 0.552413212472535,
      "learning_rate": 4.938478698620096e-05,
      "loss": 1.9401,
      "num_input_tokens_seen": 6371230976,
      "step": 8098
    },
    {
      "epoch": 0.8592191809887545,
      "grad_norm": 0.4374905249160511,
      "learning_rate": 4.9384633750004e-05,
      "loss": 1.8836,
      "num_input_tokens_seen": 6372017792,
      "step": 8099
    },
    {
      "epoch": 0.8593252705283259,
      "grad_norm": 0.5266641551516915,
      "learning_rate": 4.93844804949633e-05,
      "loss": 1.8726,
      "num_input_tokens_seen": 6372804592,
      "step": 8100
    },
    {
      "epoch": 0.8594313600678973,
      "grad_norm": 0.4037953206169464,
      "learning_rate": 4.938432722107901e-05,
      "loss": 1.9237,
      "num_input_tokens_seen": 6373591408,
      "step": 8101
    },
    {
      "epoch": 0.8595374496074687,
      "grad_norm": 0.48677350738227,
      "learning_rate": 4.938417392835121e-05,
      "loss": 2.046,
      "num_input_tokens_seen": 6374378240,
      "step": 8102
    },
    {
      "epoch": 0.8596435391470401,
      "grad_norm": 0.5996957990289643,
      "learning_rate": 4.938402061678004e-05,
      "loss": 2.0167,
      "num_input_tokens_seen": 6375164960,
      "step": 8103
    },
    {
      "epoch": 0.8597496286866115,
      "grad_norm": 0.4701857191776112,
      "learning_rate": 4.938386728636561e-05,
      "loss": 1.997,
      "num_input_tokens_seen": 6375951712,
      "step": 8104
    },
    {
      "epoch": 0.8598557182261829,
      "grad_norm": 0.4881983078974386,
      "learning_rate": 4.938371393710806e-05,
      "loss": 1.7944,
      "num_input_tokens_seen": 6376738464,
      "step": 8105
    },
    {
      "epoch": 0.8599618077657543,
      "grad_norm": 0.5488178862051941,
      "learning_rate": 4.938356056900747e-05,
      "loss": 1.9856,
      "num_input_tokens_seen": 6377525216,
      "step": 8106
    },
    {
      "epoch": 0.8600678973053257,
      "grad_norm": 0.47510577766614376,
      "learning_rate": 4.938340718206399e-05,
      "loss": 2.044,
      "num_input_tokens_seen": 6378311856,
      "step": 8107
    },
    {
      "epoch": 0.8601739868448971,
      "grad_norm": 0.6013730720822842,
      "learning_rate": 4.938325377627773e-05,
      "loss": 2.053,
      "num_input_tokens_seen": 6379098640,
      "step": 8108
    },
    {
      "epoch": 0.8602800763844685,
      "grad_norm": 0.3903117781875563,
      "learning_rate": 4.93831003516488e-05,
      "loss": 1.7372,
      "num_input_tokens_seen": 6379885392,
      "step": 8109
    },
    {
      "epoch": 0.8603861659240399,
      "grad_norm": 0.7278847659868354,
      "learning_rate": 4.938294690817733e-05,
      "loss": 1.8302,
      "num_input_tokens_seen": 6380672144,
      "step": 8110
    },
    {
      "epoch": 0.8604922554636113,
      "grad_norm": 1.158119209271825,
      "learning_rate": 4.938279344586344e-05,
      "loss": 1.9868,
      "num_input_tokens_seen": 6381458864,
      "step": 8111
    },
    {
      "epoch": 0.8605983450031827,
      "grad_norm": 0.5499432955419183,
      "learning_rate": 4.9382639964707234e-05,
      "loss": 1.7956,
      "num_input_tokens_seen": 6382245600,
      "step": 8112
    },
    {
      "epoch": 0.8607044345427541,
      "grad_norm": 1.1325923626013734,
      "learning_rate": 4.9382486464708836e-05,
      "loss": 1.8986,
      "num_input_tokens_seen": 6383032320,
      "step": 8113
    },
    {
      "epoch": 0.8608105240823255,
      "grad_norm": 1.4753924387793733,
      "learning_rate": 4.9382332945868374e-05,
      "loss": 2.1313,
      "num_input_tokens_seen": 6383819008,
      "step": 8114
    },
    {
      "epoch": 0.8609166136218969,
      "grad_norm": 0.6436363694306162,
      "learning_rate": 4.9382179408185955e-05,
      "loss": 1.9545,
      "num_input_tokens_seen": 6384605792,
      "step": 8115
    },
    {
      "epoch": 0.8610227031614682,
      "grad_norm": 0.9237881134863142,
      "learning_rate": 4.9382025851661716e-05,
      "loss": 1.8857,
      "num_input_tokens_seen": 6385392592,
      "step": 8116
    },
    {
      "epoch": 0.8611287927010397,
      "grad_norm": 0.45453103704881176,
      "learning_rate": 4.9381872276295756e-05,
      "loss": 1.7518,
      "num_input_tokens_seen": 6386179392,
      "step": 8117
    },
    {
      "epoch": 0.8612348822406111,
      "grad_norm": 0.7115683692683137,
      "learning_rate": 4.938171868208819e-05,
      "loss": 2.0159,
      "num_input_tokens_seen": 6386966224,
      "step": 8118
    },
    {
      "epoch": 0.8613409717801824,
      "grad_norm": 0.4936102076797126,
      "learning_rate": 4.938156506903917e-05,
      "loss": 1.9119,
      "num_input_tokens_seen": 6387753024,
      "step": 8119
    },
    {
      "epoch": 0.8614470613197539,
      "grad_norm": 0.5972222132320159,
      "learning_rate": 4.9381411437148776e-05,
      "loss": 1.9924,
      "num_input_tokens_seen": 6388539744,
      "step": 8120
    },
    {
      "epoch": 0.8615531508593253,
      "grad_norm": 0.47397445114266956,
      "learning_rate": 4.9381257786417145e-05,
      "loss": 1.7699,
      "num_input_tokens_seen": 6389326528,
      "step": 8121
    },
    {
      "epoch": 0.8616592403988966,
      "grad_norm": 0.44273903358526456,
      "learning_rate": 4.938110411684439e-05,
      "loss": 1.923,
      "num_input_tokens_seen": 6390113216,
      "step": 8122
    },
    {
      "epoch": 0.8617653299384681,
      "grad_norm": 0.4891280178547722,
      "learning_rate": 4.938095042843064e-05,
      "loss": 1.945,
      "num_input_tokens_seen": 6390899984,
      "step": 8123
    },
    {
      "epoch": 0.8618714194780395,
      "grad_norm": 0.4324214949465291,
      "learning_rate": 4.9380796721176003e-05,
      "loss": 1.978,
      "num_input_tokens_seen": 6391686656,
      "step": 8124
    },
    {
      "epoch": 0.8619775090176108,
      "grad_norm": 0.5165057892856509,
      "learning_rate": 4.93806429950806e-05,
      "loss": 1.9463,
      "num_input_tokens_seen": 6392473424,
      "step": 8125
    },
    {
      "epoch": 0.8620835985571823,
      "grad_norm": 0.4087894780377065,
      "learning_rate": 4.938048925014456e-05,
      "loss": 1.7699,
      "num_input_tokens_seen": 6393260160,
      "step": 8126
    },
    {
      "epoch": 0.8621896880967537,
      "grad_norm": 0.45408363878060704,
      "learning_rate": 4.938033548636798e-05,
      "loss": 1.8715,
      "num_input_tokens_seen": 6394046960,
      "step": 8127
    },
    {
      "epoch": 0.862295777636325,
      "grad_norm": 0.4074199674063664,
      "learning_rate": 4.9380181703751e-05,
      "loss": 2.0313,
      "num_input_tokens_seen": 6394833648,
      "step": 8128
    },
    {
      "epoch": 0.8624018671758965,
      "grad_norm": 0.527714753397745,
      "learning_rate": 4.938002790229373e-05,
      "loss": 2.2279,
      "num_input_tokens_seen": 6395620432,
      "step": 8129
    },
    {
      "epoch": 0.8625079567154679,
      "grad_norm": 0.4461375646614995,
      "learning_rate": 4.937987408199629e-05,
      "loss": 1.9787,
      "num_input_tokens_seen": 6396407136,
      "step": 8130
    },
    {
      "epoch": 0.8626140462550392,
      "grad_norm": 0.41489255663558955,
      "learning_rate": 4.93797202428588e-05,
      "loss": 1.8114,
      "num_input_tokens_seen": 6397193920,
      "step": 8131
    },
    {
      "epoch": 0.8627201357946106,
      "grad_norm": 0.6587096901091699,
      "learning_rate": 4.9379566384881374e-05,
      "loss": 1.8067,
      "num_input_tokens_seen": 6397980768,
      "step": 8132
    },
    {
      "epoch": 0.8628262253341821,
      "grad_norm": 0.4956457032696454,
      "learning_rate": 4.937941250806414e-05,
      "loss": 1.9838,
      "num_input_tokens_seen": 6398767472,
      "step": 8133
    },
    {
      "epoch": 0.8629323148737534,
      "grad_norm": 0.5728089173500275,
      "learning_rate": 4.937925861240721e-05,
      "loss": 2.0274,
      "num_input_tokens_seen": 6399554208,
      "step": 8134
    },
    {
      "epoch": 0.8630384044133248,
      "grad_norm": 0.4335556086892699,
      "learning_rate": 4.93791046979107e-05,
      "loss": 1.904,
      "num_input_tokens_seen": 6400341008,
      "step": 8135
    },
    {
      "epoch": 0.8631444939528963,
      "grad_norm": 0.5979665474526794,
      "learning_rate": 4.937895076457473e-05,
      "loss": 1.9816,
      "num_input_tokens_seen": 6401127760,
      "step": 8136
    },
    {
      "epoch": 0.8632505834924676,
      "grad_norm": 0.513695490725328,
      "learning_rate": 4.937879681239943e-05,
      "loss": 1.9501,
      "num_input_tokens_seen": 6401914544,
      "step": 8137
    },
    {
      "epoch": 0.863356673032039,
      "grad_norm": 0.5274229932219868,
      "learning_rate": 4.937864284138491e-05,
      "loss": 1.8994,
      "num_input_tokens_seen": 6402701200,
      "step": 8138
    },
    {
      "epoch": 0.8634627625716105,
      "grad_norm": 0.47993017746818467,
      "learning_rate": 4.937848885153129e-05,
      "loss": 1.897,
      "num_input_tokens_seen": 6403488000,
      "step": 8139
    },
    {
      "epoch": 0.8635688521111818,
      "grad_norm": 0.48347763051881626,
      "learning_rate": 4.9378334842838685e-05,
      "loss": 1.9037,
      "num_input_tokens_seen": 6404274736,
      "step": 8140
    },
    {
      "epoch": 0.8636749416507532,
      "grad_norm": 0.822071921042675,
      "learning_rate": 4.9378180815307226e-05,
      "loss": 1.9771,
      "num_input_tokens_seen": 6405061424,
      "step": 8141
    },
    {
      "epoch": 0.8637810311903247,
      "grad_norm": 0.40457411742821553,
      "learning_rate": 4.9378026768937016e-05,
      "loss": 1.7291,
      "num_input_tokens_seen": 6405848256,
      "step": 8142
    },
    {
      "epoch": 0.863887120729896,
      "grad_norm": 0.8253647047609023,
      "learning_rate": 4.937787270372818e-05,
      "loss": 2.0249,
      "num_input_tokens_seen": 6406634976,
      "step": 8143
    },
    {
      "epoch": 0.8639932102694674,
      "grad_norm": 0.6084313999397527,
      "learning_rate": 4.937771861968084e-05,
      "loss": 1.9614,
      "num_input_tokens_seen": 6407421728,
      "step": 8144
    },
    {
      "epoch": 0.8640992998090389,
      "grad_norm": 0.8913139294667133,
      "learning_rate": 4.9377564516795124e-05,
      "loss": 2.0521,
      "num_input_tokens_seen": 6408208480,
      "step": 8145
    },
    {
      "epoch": 0.8642053893486102,
      "grad_norm": 0.5813585406756455,
      "learning_rate": 4.937741039507114e-05,
      "loss": 1.927,
      "num_input_tokens_seen": 6408995280,
      "step": 8146
    },
    {
      "epoch": 0.8643114788881816,
      "grad_norm": 1.2749993749853266,
      "learning_rate": 4.9377256254509005e-05,
      "loss": 1.9725,
      "num_input_tokens_seen": 6409782032,
      "step": 8147
    },
    {
      "epoch": 0.864417568427753,
      "grad_norm": 0.7663576735962547,
      "learning_rate": 4.937710209510884e-05,
      "loss": 1.9244,
      "num_input_tokens_seen": 6410568816,
      "step": 8148
    },
    {
      "epoch": 0.8645236579673244,
      "grad_norm": 0.6477485659697435,
      "learning_rate": 4.9376947916870766e-05,
      "loss": 2.0325,
      "num_input_tokens_seen": 6411355488,
      "step": 8149
    },
    {
      "epoch": 0.8646297475068958,
      "grad_norm": 1.473436891816555,
      "learning_rate": 4.937679371979491e-05,
      "loss": 1.8795,
      "num_input_tokens_seen": 6412142160,
      "step": 8150
    },
    {
      "epoch": 0.8647358370464672,
      "grad_norm": 0.4964456658645895,
      "learning_rate": 4.937663950388137e-05,
      "loss": 1.7307,
      "num_input_tokens_seen": 6412929008,
      "step": 8151
    },
    {
      "epoch": 0.8648419265860386,
      "grad_norm": 0.7579270030490661,
      "learning_rate": 4.937648526913029e-05,
      "loss": 1.8441,
      "num_input_tokens_seen": 6413715792,
      "step": 8152
    },
    {
      "epoch": 0.86494801612561,
      "grad_norm": 0.816016960703786,
      "learning_rate": 4.937633101554177e-05,
      "loss": 1.9726,
      "num_input_tokens_seen": 6414502576,
      "step": 8153
    },
    {
      "epoch": 0.8650541056651814,
      "grad_norm": 0.7019687727266092,
      "learning_rate": 4.937617674311594e-05,
      "loss": 1.9719,
      "num_input_tokens_seen": 6415289360,
      "step": 8154
    },
    {
      "epoch": 0.8651601952047528,
      "grad_norm": 0.6992955019791626,
      "learning_rate": 4.937602245185291e-05,
      "loss": 1.8744,
      "num_input_tokens_seen": 6416076080,
      "step": 8155
    },
    {
      "epoch": 0.8652662847443242,
      "grad_norm": 0.6881734176959331,
      "learning_rate": 4.9375868141752815e-05,
      "loss": 1.9311,
      "num_input_tokens_seen": 6416862800,
      "step": 8156
    },
    {
      "epoch": 0.8653723742838956,
      "grad_norm": 0.6212967811301269,
      "learning_rate": 4.937571381281576e-05,
      "loss": 1.8589,
      "num_input_tokens_seen": 6417649696,
      "step": 8157
    },
    {
      "epoch": 0.865478463823467,
      "grad_norm": 0.5872253333057105,
      "learning_rate": 4.937555946504187e-05,
      "loss": 1.8312,
      "num_input_tokens_seen": 6418436448,
      "step": 8158
    },
    {
      "epoch": 0.8655845533630384,
      "grad_norm": 0.711485064700092,
      "learning_rate": 4.9375405098431255e-05,
      "loss": 1.951,
      "num_input_tokens_seen": 6419223280,
      "step": 8159
    },
    {
      "epoch": 0.8656906429026098,
      "grad_norm": 0.45451472440358376,
      "learning_rate": 4.9375250712984045e-05,
      "loss": 1.8677,
      "num_input_tokens_seen": 6420010064,
      "step": 8160
    },
    {
      "epoch": 0.8657967324421812,
      "grad_norm": 0.6798359982961988,
      "learning_rate": 4.937509630870036e-05,
      "loss": 1.9874,
      "num_input_tokens_seen": 6420796816,
      "step": 8161
    },
    {
      "epoch": 0.8659028219817526,
      "grad_norm": 0.6883805277532703,
      "learning_rate": 4.937494188558032e-05,
      "loss": 1.9494,
      "num_input_tokens_seen": 6421583552,
      "step": 8162
    },
    {
      "epoch": 0.866008911521324,
      "grad_norm": 0.56151153049399,
      "learning_rate": 4.937478744362403e-05,
      "loss": 1.9028,
      "num_input_tokens_seen": 6422370432,
      "step": 8163
    },
    {
      "epoch": 0.8661150010608955,
      "grad_norm": 0.77270585021129,
      "learning_rate": 4.937463298283163e-05,
      "loss": 2.0364,
      "num_input_tokens_seen": 6423157136,
      "step": 8164
    },
    {
      "epoch": 0.8662210906004668,
      "grad_norm": 0.5571122023535345,
      "learning_rate": 4.937447850320322e-05,
      "loss": 1.8201,
      "num_input_tokens_seen": 6423943936,
      "step": 8165
    },
    {
      "epoch": 0.8663271801400382,
      "grad_norm": 1.0030416240814504,
      "learning_rate": 4.937432400473893e-05,
      "loss": 1.9093,
      "num_input_tokens_seen": 6424730656,
      "step": 8166
    },
    {
      "epoch": 0.8664332696796095,
      "grad_norm": 1.1668062397758103,
      "learning_rate": 4.937416948743888e-05,
      "loss": 1.882,
      "num_input_tokens_seen": 6425517360,
      "step": 8167
    },
    {
      "epoch": 0.866539359219181,
      "grad_norm": 1.790400550355789,
      "learning_rate": 4.937401495130318e-05,
      "loss": 2.0343,
      "num_input_tokens_seen": 6426304016,
      "step": 8168
    },
    {
      "epoch": 0.8666454487587524,
      "grad_norm": 2.5933033843622506,
      "learning_rate": 4.937386039633197e-05,
      "loss": 2.0433,
      "num_input_tokens_seen": 6427090768,
      "step": 8169
    },
    {
      "epoch": 0.8667515382983237,
      "grad_norm": 2.4429845475939134,
      "learning_rate": 4.937370582252535e-05,
      "loss": 1.9389,
      "num_input_tokens_seen": 6427877456,
      "step": 8170
    },
    {
      "epoch": 0.8668576278378952,
      "grad_norm": 1.2692625986625914,
      "learning_rate": 4.9373551229883445e-05,
      "loss": 1.946,
      "num_input_tokens_seen": 6428664240,
      "step": 8171
    },
    {
      "epoch": 0.8669637173774666,
      "grad_norm": 1.3179342035185477,
      "learning_rate": 4.937339661840637e-05,
      "loss": 1.9915,
      "num_input_tokens_seen": 6429451072,
      "step": 8172
    },
    {
      "epoch": 0.8670698069170379,
      "grad_norm": 0.628423135781118,
      "learning_rate": 4.937324198809425e-05,
      "loss": 1.902,
      "num_input_tokens_seen": 6430237840,
      "step": 8173
    },
    {
      "epoch": 0.8671758964566094,
      "grad_norm": 1.0594795299539812,
      "learning_rate": 4.937308733894721e-05,
      "loss": 1.9142,
      "num_input_tokens_seen": 6431024640,
      "step": 8174
    },
    {
      "epoch": 0.8672819859961808,
      "grad_norm": 0.5461690459162382,
      "learning_rate": 4.9372932670965356e-05,
      "loss": 1.9459,
      "num_input_tokens_seen": 6431811472,
      "step": 8175
    },
    {
      "epoch": 0.8673880755357521,
      "grad_norm": 1.8832210161952956,
      "learning_rate": 4.9372777984148824e-05,
      "loss": 1.7965,
      "num_input_tokens_seen": 6432598288,
      "step": 8176
    },
    {
      "epoch": 0.8674941650753236,
      "grad_norm": 1.1092827776922722,
      "learning_rate": 4.937262327849771e-05,
      "loss": 1.9581,
      "num_input_tokens_seen": 6433385024,
      "step": 8177
    },
    {
      "epoch": 0.867600254614895,
      "grad_norm": 2.611494945073576,
      "learning_rate": 4.9372468554012166e-05,
      "loss": 1.9408,
      "num_input_tokens_seen": 6434171792,
      "step": 8178
    },
    {
      "epoch": 0.8677063441544663,
      "grad_norm": 1.588805477995433,
      "learning_rate": 4.9372313810692276e-05,
      "loss": 1.9699,
      "num_input_tokens_seen": 6434958592,
      "step": 8179
    },
    {
      "epoch": 0.8678124336940378,
      "grad_norm": 1.3868410384916425,
      "learning_rate": 4.937215904853819e-05,
      "loss": 1.9495,
      "num_input_tokens_seen": 6435745328,
      "step": 8180
    },
    {
      "epoch": 0.8679185232336092,
      "grad_norm": 1.9652721585597919,
      "learning_rate": 4.937200426755001e-05,
      "loss": 2.0376,
      "num_input_tokens_seen": 6436532064,
      "step": 8181
    },
    {
      "epoch": 0.8680246127731805,
      "grad_norm": 0.9356172546555187,
      "learning_rate": 4.937184946772786e-05,
      "loss": 1.9839,
      "num_input_tokens_seen": 6437318832,
      "step": 8182
    },
    {
      "epoch": 0.8681307023127519,
      "grad_norm": 1.5065691690918825,
      "learning_rate": 4.937169464907185e-05,
      "loss": 2.0067,
      "num_input_tokens_seen": 6438105504,
      "step": 8183
    },
    {
      "epoch": 0.8682367918523234,
      "grad_norm": 0.8778979013613003,
      "learning_rate": 4.9371539811582125e-05,
      "loss": 1.8825,
      "num_input_tokens_seen": 6438892224,
      "step": 8184
    },
    {
      "epoch": 0.8683428813918947,
      "grad_norm": 0.6900245965816945,
      "learning_rate": 4.937138495525878e-05,
      "loss": 1.9718,
      "num_input_tokens_seen": 6439678960,
      "step": 8185
    },
    {
      "epoch": 0.8684489709314661,
      "grad_norm": 0.7372285994780174,
      "learning_rate": 4.937123008010195e-05,
      "loss": 2.0494,
      "num_input_tokens_seen": 6440465712,
      "step": 8186
    },
    {
      "epoch": 0.8685550604710376,
      "grad_norm": 0.7423546093219262,
      "learning_rate": 4.937107518611175e-05,
      "loss": 1.9714,
      "num_input_tokens_seen": 6441252512,
      "step": 8187
    },
    {
      "epoch": 0.868661150010609,
      "grad_norm": 0.6454851222647179,
      "learning_rate": 4.937092027328829e-05,
      "loss": 1.8014,
      "num_input_tokens_seen": 6442039248,
      "step": 8188
    },
    {
      "epoch": 0.8687672395501803,
      "grad_norm": 0.716018943521666,
      "learning_rate": 4.93707653416317e-05,
      "loss": 1.882,
      "num_input_tokens_seen": 6442826016,
      "step": 8189
    },
    {
      "epoch": 0.8688733290897518,
      "grad_norm": 0.8407775159323767,
      "learning_rate": 4.93706103911421e-05,
      "loss": 1.8533,
      "num_input_tokens_seen": 6443612784,
      "step": 8190
    },
    {
      "epoch": 0.8689794186293232,
      "grad_norm": 0.6106361016033456,
      "learning_rate": 4.9370455421819604e-05,
      "loss": 1.9336,
      "num_input_tokens_seen": 6444399520,
      "step": 8191
    },
    {
      "epoch": 0.8690855081688945,
      "grad_norm": 0.8445915756195288,
      "learning_rate": 4.937030043366434e-05,
      "loss": 1.8553,
      "num_input_tokens_seen": 6445186352,
      "step": 8192
    },
    {
      "epoch": 0.869191597708466,
      "grad_norm": 0.7609665275485199,
      "learning_rate": 4.937014542667642e-05,
      "loss": 1.8932,
      "num_input_tokens_seen": 6445973120,
      "step": 8193
    },
    {
      "epoch": 0.8692976872480374,
      "grad_norm": 0.6144172172259413,
      "learning_rate": 4.936999040085597e-05,
      "loss": 1.9445,
      "num_input_tokens_seen": 6446759904,
      "step": 8194
    },
    {
      "epoch": 0.8694037767876087,
      "grad_norm": 0.6763424241958194,
      "learning_rate": 4.93698353562031e-05,
      "loss": 2.1378,
      "num_input_tokens_seen": 6447546688,
      "step": 8195
    },
    {
      "epoch": 0.8695098663271802,
      "grad_norm": 0.492801134764506,
      "learning_rate": 4.9369680292717945e-05,
      "loss": 1.8616,
      "num_input_tokens_seen": 6448333424,
      "step": 8196
    },
    {
      "epoch": 0.8696159558667516,
      "grad_norm": 0.6735861257555624,
      "learning_rate": 4.9369525210400616e-05,
      "loss": 1.8565,
      "num_input_tokens_seen": 6449120048,
      "step": 8197
    },
    {
      "epoch": 0.8697220454063229,
      "grad_norm": 0.41467528319908975,
      "learning_rate": 4.9369370109251224e-05,
      "loss": 1.7838,
      "num_input_tokens_seen": 6449906816,
      "step": 8198
    },
    {
      "epoch": 0.8698281349458943,
      "grad_norm": 0.6010674162478694,
      "learning_rate": 4.93692149892699e-05,
      "loss": 2.0276,
      "num_input_tokens_seen": 6450693584,
      "step": 8199
    },
    {
      "epoch": 0.8699342244854658,
      "grad_norm": 0.39890514262103793,
      "learning_rate": 4.9369059850456765e-05,
      "loss": 1.6763,
      "num_input_tokens_seen": 6451480448,
      "step": 8200
    },
    {
      "epoch": 0.8700403140250371,
      "grad_norm": 0.696489333252992,
      "learning_rate": 4.9368904692811936e-05,
      "loss": 1.8121,
      "num_input_tokens_seen": 6452267152,
      "step": 8201
    },
    {
      "epoch": 0.8701464035646085,
      "grad_norm": 0.42141600347180835,
      "learning_rate": 4.9368749516335524e-05,
      "loss": 1.9157,
      "num_input_tokens_seen": 6453053968,
      "step": 8202
    },
    {
      "epoch": 0.87025249310418,
      "grad_norm": 0.5233823162332805,
      "learning_rate": 4.9368594321027666e-05,
      "loss": 1.9761,
      "num_input_tokens_seen": 6453840720,
      "step": 8203
    },
    {
      "epoch": 0.8703585826437513,
      "grad_norm": 0.45828624177814714,
      "learning_rate": 4.9368439106888477e-05,
      "loss": 1.8682,
      "num_input_tokens_seen": 6454627520,
      "step": 8204
    },
    {
      "epoch": 0.8704646721833227,
      "grad_norm": 0.5227727551020287,
      "learning_rate": 4.9368283873918064e-05,
      "loss": 1.9231,
      "num_input_tokens_seen": 6455414240,
      "step": 8205
    },
    {
      "epoch": 0.8705707617228942,
      "grad_norm": 0.6145187711157528,
      "learning_rate": 4.936812862211656e-05,
      "loss": 2.0828,
      "num_input_tokens_seen": 6456200960,
      "step": 8206
    },
    {
      "epoch": 0.8706768512624655,
      "grad_norm": 0.6686733341378366,
      "learning_rate": 4.936797335148408e-05,
      "loss": 2.0056,
      "num_input_tokens_seen": 6456987712,
      "step": 8207
    },
    {
      "epoch": 0.8707829408020369,
      "grad_norm": 0.6614821386789088,
      "learning_rate": 4.936781806202075e-05,
      "loss": 1.9873,
      "num_input_tokens_seen": 6457774528,
      "step": 8208
    },
    {
      "epoch": 0.8708890303416084,
      "grad_norm": 0.9264952564676617,
      "learning_rate": 4.936766275372668e-05,
      "loss": 2.0022,
      "num_input_tokens_seen": 6458561296,
      "step": 8209
    },
    {
      "epoch": 0.8709951198811797,
      "grad_norm": 0.5470650346491762,
      "learning_rate": 4.9367507426602e-05,
      "loss": 1.9346,
      "num_input_tokens_seen": 6459348096,
      "step": 8210
    },
    {
      "epoch": 0.8711012094207511,
      "grad_norm": 0.884764806238695,
      "learning_rate": 4.936735208064682e-05,
      "loss": 1.8889,
      "num_input_tokens_seen": 6460134864,
      "step": 8211
    },
    {
      "epoch": 0.8712072989603226,
      "grad_norm": 0.42411828913800015,
      "learning_rate": 4.936719671586126e-05,
      "loss": 1.8615,
      "num_input_tokens_seen": 6460921616,
      "step": 8212
    },
    {
      "epoch": 0.8713133884998939,
      "grad_norm": 0.7736607513266769,
      "learning_rate": 4.936704133224546e-05,
      "loss": 2.0042,
      "num_input_tokens_seen": 6461708320,
      "step": 8213
    },
    {
      "epoch": 0.8714194780394653,
      "grad_norm": 0.48449779225306866,
      "learning_rate": 4.9366885929799514e-05,
      "loss": 2.03,
      "num_input_tokens_seen": 6462495120,
      "step": 8214
    },
    {
      "epoch": 0.8715255675790367,
      "grad_norm": 0.5191179219082017,
      "learning_rate": 4.936673050852356e-05,
      "loss": 1.794,
      "num_input_tokens_seen": 6463281872,
      "step": 8215
    },
    {
      "epoch": 0.8716316571186081,
      "grad_norm": 0.6583405397430606,
      "learning_rate": 4.936657506841771e-05,
      "loss": 2.0367,
      "num_input_tokens_seen": 6464068624,
      "step": 8216
    },
    {
      "epoch": 0.8717377466581795,
      "grad_norm": 0.3871469274844041,
      "learning_rate": 4.9366419609482084e-05,
      "loss": 1.9026,
      "num_input_tokens_seen": 6464855344,
      "step": 8217
    },
    {
      "epoch": 0.8718438361977509,
      "grad_norm": 0.4285684027192306,
      "learning_rate": 4.9366264131716805e-05,
      "loss": 1.8495,
      "num_input_tokens_seen": 6465642096,
      "step": 8218
    },
    {
      "epoch": 0.8719499257373223,
      "grad_norm": 0.642650710348225,
      "learning_rate": 4.936610863512199e-05,
      "loss": 2.0767,
      "num_input_tokens_seen": 6466428912,
      "step": 8219
    },
    {
      "epoch": 0.8720560152768937,
      "grad_norm": 0.5375093979696458,
      "learning_rate": 4.936595311969777e-05,
      "loss": 1.7695,
      "num_input_tokens_seen": 6467215712,
      "step": 8220
    },
    {
      "epoch": 0.8721621048164651,
      "grad_norm": 0.5028796630784982,
      "learning_rate": 4.936579758544424e-05,
      "loss": 2.0374,
      "num_input_tokens_seen": 6468002448,
      "step": 8221
    },
    {
      "epoch": 0.8722681943560365,
      "grad_norm": 0.4685260276419078,
      "learning_rate": 4.9365642032361546e-05,
      "loss": 2.0415,
      "num_input_tokens_seen": 6468789184,
      "step": 8222
    },
    {
      "epoch": 0.8723742838956079,
      "grad_norm": 0.4581431923811818,
      "learning_rate": 4.936548646044981e-05,
      "loss": 1.8619,
      "num_input_tokens_seen": 6469576016,
      "step": 8223
    },
    {
      "epoch": 0.8724803734351793,
      "grad_norm": 0.41596568786843113,
      "learning_rate": 4.9365330869709126e-05,
      "loss": 1.9557,
      "num_input_tokens_seen": 6470362704,
      "step": 8224
    },
    {
      "epoch": 0.8725864629747507,
      "grad_norm": 0.3771509473408515,
      "learning_rate": 4.936517526013963e-05,
      "loss": 1.832,
      "num_input_tokens_seen": 6471149408,
      "step": 8225
    },
    {
      "epoch": 0.8726925525143221,
      "grad_norm": 0.41388098769622594,
      "learning_rate": 4.936501963174145e-05,
      "loss": 1.8165,
      "num_input_tokens_seen": 6471936208,
      "step": 8226
    },
    {
      "epoch": 0.8727986420538935,
      "grad_norm": 0.41013284200940814,
      "learning_rate": 4.9364863984514686e-05,
      "loss": 1.9061,
      "num_input_tokens_seen": 6472722976,
      "step": 8227
    },
    {
      "epoch": 0.8729047315934649,
      "grad_norm": 0.7066336793331892,
      "learning_rate": 4.936470831845948e-05,
      "loss": 1.8701,
      "num_input_tokens_seen": 6473509728,
      "step": 8228
    },
    {
      "epoch": 0.8730108211330363,
      "grad_norm": 0.4131595317391892,
      "learning_rate": 4.9364552633575935e-05,
      "loss": 2.0343,
      "num_input_tokens_seen": 6474296464,
      "step": 8229
    },
    {
      "epoch": 0.8731169106726077,
      "grad_norm": 0.47623638157998227,
      "learning_rate": 4.9364396929864184e-05,
      "loss": 1.9977,
      "num_input_tokens_seen": 6475083200,
      "step": 8230
    },
    {
      "epoch": 0.8732230002121791,
      "grad_norm": 0.428905610880044,
      "learning_rate": 4.936424120732434e-05,
      "loss": 2.0253,
      "num_input_tokens_seen": 6475870032,
      "step": 8231
    },
    {
      "epoch": 0.8733290897517505,
      "grad_norm": 0.46410207129039294,
      "learning_rate": 4.936408546595652e-05,
      "loss": 2.0682,
      "num_input_tokens_seen": 6476656688,
      "step": 8232
    },
    {
      "epoch": 0.8734351792913219,
      "grad_norm": 0.4192206798249979,
      "learning_rate": 4.936392970576086e-05,
      "loss": 1.872,
      "num_input_tokens_seen": 6477443376,
      "step": 8233
    },
    {
      "epoch": 0.8735412688308932,
      "grad_norm": 0.3759580764578403,
      "learning_rate": 4.936377392673747e-05,
      "loss": 1.7409,
      "num_input_tokens_seen": 6478230128,
      "step": 8234
    },
    {
      "epoch": 0.8736473583704647,
      "grad_norm": 0.587010582035692,
      "learning_rate": 4.9363618128886456e-05,
      "loss": 1.9479,
      "num_input_tokens_seen": 6479016880,
      "step": 8235
    },
    {
      "epoch": 0.8737534479100361,
      "grad_norm": 0.563601574726561,
      "learning_rate": 4.936346231220797e-05,
      "loss": 1.8542,
      "num_input_tokens_seen": 6479803632,
      "step": 8236
    },
    {
      "epoch": 0.8738595374496074,
      "grad_norm": 0.4184521597254822,
      "learning_rate": 4.9363306476702105e-05,
      "loss": 1.8455,
      "num_input_tokens_seen": 6480590416,
      "step": 8237
    },
    {
      "epoch": 0.8739656269891789,
      "grad_norm": 0.4685589133581459,
      "learning_rate": 4.936315062236899e-05,
      "loss": 1.7413,
      "num_input_tokens_seen": 6481377216,
      "step": 8238
    },
    {
      "epoch": 0.8740717165287503,
      "grad_norm": 0.48226450064440723,
      "learning_rate": 4.936299474920876e-05,
      "loss": 1.9376,
      "num_input_tokens_seen": 6482163920,
      "step": 8239
    },
    {
      "epoch": 0.8741778060683216,
      "grad_norm": 0.4253423788089817,
      "learning_rate": 4.9362838857221505e-05,
      "loss": 1.8996,
      "num_input_tokens_seen": 6482950624,
      "step": 8240
    },
    {
      "epoch": 0.8742838956078931,
      "grad_norm": 0.4801008746685187,
      "learning_rate": 4.936268294640738e-05,
      "loss": 1.8368,
      "num_input_tokens_seen": 6483737456,
      "step": 8241
    },
    {
      "epoch": 0.8743899851474645,
      "grad_norm": 0.5195828847064723,
      "learning_rate": 4.9362527016766476e-05,
      "loss": 1.7899,
      "num_input_tokens_seen": 6484524352,
      "step": 8242
    },
    {
      "epoch": 0.8744960746870358,
      "grad_norm": 0.40979719901141737,
      "learning_rate": 4.936237106829893e-05,
      "loss": 1.8878,
      "num_input_tokens_seen": 6485311088,
      "step": 8243
    },
    {
      "epoch": 0.8746021642266073,
      "grad_norm": 0.7782820330136414,
      "learning_rate": 4.936221510100486e-05,
      "loss": 1.8984,
      "num_input_tokens_seen": 6486097824,
      "step": 8244
    },
    {
      "epoch": 0.8747082537661787,
      "grad_norm": 0.5486468168387602,
      "learning_rate": 4.936205911488439e-05,
      "loss": 1.8626,
      "num_input_tokens_seen": 6486884512,
      "step": 8245
    },
    {
      "epoch": 0.87481434330575,
      "grad_norm": 1.1516099139609968,
      "learning_rate": 4.936190310993763e-05,
      "loss": 1.9203,
      "num_input_tokens_seen": 6487671232,
      "step": 8246
    },
    {
      "epoch": 0.8749204328453215,
      "grad_norm": 1.0433322698867944,
      "learning_rate": 4.936174708616469e-05,
      "loss": 1.9072,
      "num_input_tokens_seen": 6488457952,
      "step": 8247
    },
    {
      "epoch": 0.8750265223848929,
      "grad_norm": 0.6164678841055637,
      "learning_rate": 4.9361591043565724e-05,
      "loss": 1.8112,
      "num_input_tokens_seen": 6489244624,
      "step": 8248
    },
    {
      "epoch": 0.8751326119244642,
      "grad_norm": 0.655170721101409,
      "learning_rate": 4.936143498214084e-05,
      "loss": 1.9257,
      "num_input_tokens_seen": 6490031312,
      "step": 8249
    },
    {
      "epoch": 0.8752387014640356,
      "grad_norm": 0.5249324809062804,
      "learning_rate": 4.936127890189014e-05,
      "loss": 1.9212,
      "num_input_tokens_seen": 6490818064,
      "step": 8250
    },
    {
      "epoch": 0.8753447910036071,
      "grad_norm": 0.8957813080503001,
      "learning_rate": 4.936112280281377e-05,
      "loss": 2.0296,
      "num_input_tokens_seen": 6491604768,
      "step": 8251
    },
    {
      "epoch": 0.8754508805431784,
      "grad_norm": 0.501616674971622,
      "learning_rate": 4.9360966684911835e-05,
      "loss": 2.0175,
      "num_input_tokens_seen": 6492391600,
      "step": 8252
    },
    {
      "epoch": 0.8755569700827498,
      "grad_norm": 0.7948047172933435,
      "learning_rate": 4.9360810548184454e-05,
      "loss": 1.9649,
      "num_input_tokens_seen": 6493178336,
      "step": 8253
    },
    {
      "epoch": 0.8756630596223213,
      "grad_norm": 0.6290063731775362,
      "learning_rate": 4.936065439263176e-05,
      "loss": 1.9728,
      "num_input_tokens_seen": 6493965072,
      "step": 8254
    },
    {
      "epoch": 0.8757691491618926,
      "grad_norm": 0.6013612851701032,
      "learning_rate": 4.936049821825387e-05,
      "loss": 1.9973,
      "num_input_tokens_seen": 6494751776,
      "step": 8255
    },
    {
      "epoch": 0.875875238701464,
      "grad_norm": 0.4367824053779717,
      "learning_rate": 4.93603420250509e-05,
      "loss": 1.8518,
      "num_input_tokens_seen": 6495538544,
      "step": 8256
    },
    {
      "epoch": 0.8759813282410355,
      "grad_norm": 0.5678099755434605,
      "learning_rate": 4.936018581302296e-05,
      "loss": 1.985,
      "num_input_tokens_seen": 6496325392,
      "step": 8257
    },
    {
      "epoch": 0.8760874177806068,
      "grad_norm": 0.627920868233871,
      "learning_rate": 4.93600295821702e-05,
      "loss": 1.8924,
      "num_input_tokens_seen": 6497112192,
      "step": 8258
    },
    {
      "epoch": 0.8761935073201782,
      "grad_norm": 0.5301061688566686,
      "learning_rate": 4.9359873332492715e-05,
      "loss": 1.8374,
      "num_input_tokens_seen": 6497899008,
      "step": 8259
    },
    {
      "epoch": 0.8762995968597497,
      "grad_norm": 0.8354282351160967,
      "learning_rate": 4.935971706399064e-05,
      "loss": 1.838,
      "num_input_tokens_seen": 6498685744,
      "step": 8260
    },
    {
      "epoch": 0.876405686399321,
      "grad_norm": 0.5699738263197834,
      "learning_rate": 4.9359560776664084e-05,
      "loss": 1.8363,
      "num_input_tokens_seen": 6499472592,
      "step": 8261
    },
    {
      "epoch": 0.8765117759388924,
      "grad_norm": 0.9163009154492519,
      "learning_rate": 4.935940447051317e-05,
      "loss": 2.0644,
      "num_input_tokens_seen": 6500259344,
      "step": 8262
    },
    {
      "epoch": 0.8766178654784639,
      "grad_norm": 0.9794405531021356,
      "learning_rate": 4.935924814553804e-05,
      "loss": 1.971,
      "num_input_tokens_seen": 6501046128,
      "step": 8263
    },
    {
      "epoch": 0.8767239550180352,
      "grad_norm": 0.4461400023292142,
      "learning_rate": 4.935909180173879e-05,
      "loss": 1.7856,
      "num_input_tokens_seen": 6501832880,
      "step": 8264
    },
    {
      "epoch": 0.8768300445576066,
      "grad_norm": 1.0807075275234577,
      "learning_rate": 4.9358935439115536e-05,
      "loss": 1.86,
      "num_input_tokens_seen": 6502619600,
      "step": 8265
    },
    {
      "epoch": 0.876936134097178,
      "grad_norm": 0.527288416008173,
      "learning_rate": 4.9358779057668424e-05,
      "loss": 1.8466,
      "num_input_tokens_seen": 6503406448,
      "step": 8266
    },
    {
      "epoch": 0.8770422236367494,
      "grad_norm": 0.7168325927881714,
      "learning_rate": 4.935862265739756e-05,
      "loss": 1.7693,
      "num_input_tokens_seen": 6504193248,
      "step": 8267
    },
    {
      "epoch": 0.8771483131763208,
      "grad_norm": 0.45078991915487243,
      "learning_rate": 4.935846623830307e-05,
      "loss": 1.9603,
      "num_input_tokens_seen": 6504980000,
      "step": 8268
    },
    {
      "epoch": 0.8772544027158922,
      "grad_norm": 0.6941576569785213,
      "learning_rate": 4.935830980038507e-05,
      "loss": 1.9298,
      "num_input_tokens_seen": 6505766784,
      "step": 8269
    },
    {
      "epoch": 0.8773604922554636,
      "grad_norm": 0.40722465839723576,
      "learning_rate": 4.935815334364369e-05,
      "loss": 1.9443,
      "num_input_tokens_seen": 6506553424,
      "step": 8270
    },
    {
      "epoch": 0.877466581795035,
      "grad_norm": 0.7049381171968007,
      "learning_rate": 4.9357996868079026e-05,
      "loss": 1.9769,
      "num_input_tokens_seen": 6507340112,
      "step": 8271
    },
    {
      "epoch": 0.8775726713346064,
      "grad_norm": 0.6498697887734805,
      "learning_rate": 4.935784037369123e-05,
      "loss": 1.8772,
      "num_input_tokens_seen": 6508126784,
      "step": 8272
    },
    {
      "epoch": 0.8776787608741778,
      "grad_norm": 0.849676237445667,
      "learning_rate": 4.9357683860480405e-05,
      "loss": 1.9494,
      "num_input_tokens_seen": 6508913584,
      "step": 8273
    },
    {
      "epoch": 0.8777848504137492,
      "grad_norm": 0.38666040691791803,
      "learning_rate": 4.935752732844668e-05,
      "loss": 1.8835,
      "num_input_tokens_seen": 6509700368,
      "step": 8274
    },
    {
      "epoch": 0.8778909399533206,
      "grad_norm": 0.7353530414638869,
      "learning_rate": 4.935737077759017e-05,
      "loss": 1.8315,
      "num_input_tokens_seen": 6510487152,
      "step": 8275
    },
    {
      "epoch": 0.877997029492892,
      "grad_norm": 0.4953987876423868,
      "learning_rate": 4.9357214207911e-05,
      "loss": 1.9733,
      "num_input_tokens_seen": 6511273856,
      "step": 8276
    },
    {
      "epoch": 0.8781031190324634,
      "grad_norm": 0.7802056075258745,
      "learning_rate": 4.9357057619409286e-05,
      "loss": 2.0779,
      "num_input_tokens_seen": 6512060576,
      "step": 8277
    },
    {
      "epoch": 0.8782092085720348,
      "grad_norm": 0.5147607123784594,
      "learning_rate": 4.935690101208515e-05,
      "loss": 1.7842,
      "num_input_tokens_seen": 6512847360,
      "step": 8278
    },
    {
      "epoch": 0.8783152981116062,
      "grad_norm": 0.5138579205098406,
      "learning_rate": 4.935674438593873e-05,
      "loss": 1.8871,
      "num_input_tokens_seen": 6513634128,
      "step": 8279
    },
    {
      "epoch": 0.8784213876511776,
      "grad_norm": 0.8091572711939875,
      "learning_rate": 4.935658774097012e-05,
      "loss": 1.9706,
      "num_input_tokens_seen": 6514420896,
      "step": 8280
    },
    {
      "epoch": 0.878527477190749,
      "grad_norm": 0.3661443593965774,
      "learning_rate": 4.935643107717946e-05,
      "loss": 1.8707,
      "num_input_tokens_seen": 6515207632,
      "step": 8281
    },
    {
      "epoch": 0.8786335667303203,
      "grad_norm": 0.8475563829570544,
      "learning_rate": 4.935627439456686e-05,
      "loss": 1.9338,
      "num_input_tokens_seen": 6515994400,
      "step": 8282
    },
    {
      "epoch": 0.8787396562698918,
      "grad_norm": 0.4839969342451757,
      "learning_rate": 4.9356117693132454e-05,
      "loss": 2.0618,
      "num_input_tokens_seen": 6516781200,
      "step": 8283
    },
    {
      "epoch": 0.8788457458094632,
      "grad_norm": 0.5908975803185048,
      "learning_rate": 4.9355960972876345e-05,
      "loss": 2.069,
      "num_input_tokens_seen": 6517567920,
      "step": 8284
    },
    {
      "epoch": 0.8789518353490345,
      "grad_norm": 0.5434217843452466,
      "learning_rate": 4.935580423379866e-05,
      "loss": 1.9043,
      "num_input_tokens_seen": 6518354672,
      "step": 8285
    },
    {
      "epoch": 0.879057924888606,
      "grad_norm": 0.506252719570032,
      "learning_rate": 4.935564747589953e-05,
      "loss": 1.8014,
      "num_input_tokens_seen": 6519141456,
      "step": 8286
    },
    {
      "epoch": 0.8791640144281774,
      "grad_norm": 0.4883009684005163,
      "learning_rate": 4.935549069917908e-05,
      "loss": 1.7759,
      "num_input_tokens_seen": 6519928192,
      "step": 8287
    },
    {
      "epoch": 0.8792701039677487,
      "grad_norm": 0.6359641549692232,
      "learning_rate": 4.935533390363741e-05,
      "loss": 1.9577,
      "num_input_tokens_seen": 6520714944,
      "step": 8288
    },
    {
      "epoch": 0.8793761935073202,
      "grad_norm": 0.43121805724986495,
      "learning_rate": 4.9355177089274666e-05,
      "loss": 1.6412,
      "num_input_tokens_seen": 6521501728,
      "step": 8289
    },
    {
      "epoch": 0.8794822830468916,
      "grad_norm": 0.521905865753136,
      "learning_rate": 4.935502025609094e-05,
      "loss": 1.8815,
      "num_input_tokens_seen": 6522288416,
      "step": 8290
    },
    {
      "epoch": 0.8795883725864629,
      "grad_norm": 0.4905706952006123,
      "learning_rate": 4.9354863404086374e-05,
      "loss": 2.0658,
      "num_input_tokens_seen": 6523075184,
      "step": 8291
    },
    {
      "epoch": 0.8796944621260344,
      "grad_norm": 0.4075069108295476,
      "learning_rate": 4.9354706533261085e-05,
      "loss": 1.87,
      "num_input_tokens_seen": 6523861968,
      "step": 8292
    },
    {
      "epoch": 0.8798005516656058,
      "grad_norm": 0.49655322042440236,
      "learning_rate": 4.93545496436152e-05,
      "loss": 2.0249,
      "num_input_tokens_seen": 6524648688,
      "step": 8293
    },
    {
      "epoch": 0.8799066412051771,
      "grad_norm": 0.5356820042346897,
      "learning_rate": 4.935439273514883e-05,
      "loss": 1.9498,
      "num_input_tokens_seen": 6525435472,
      "step": 8294
    },
    {
      "epoch": 0.8800127307447486,
      "grad_norm": 0.5042595584423581,
      "learning_rate": 4.935423580786209e-05,
      "loss": 2.0421,
      "num_input_tokens_seen": 6526222224,
      "step": 8295
    },
    {
      "epoch": 0.88011882028432,
      "grad_norm": 0.44598782448174273,
      "learning_rate": 4.9354078861755114e-05,
      "loss": 1.9114,
      "num_input_tokens_seen": 6527008960,
      "step": 8296
    },
    {
      "epoch": 0.8802249098238913,
      "grad_norm": 0.5068008545930676,
      "learning_rate": 4.935392189682803e-05,
      "loss": 1.8446,
      "num_input_tokens_seen": 6527795760,
      "step": 8297
    },
    {
      "epoch": 0.8803309993634627,
      "grad_norm": 0.4836788770025368,
      "learning_rate": 4.935376491308094e-05,
      "loss": 1.9733,
      "num_input_tokens_seen": 6528582544,
      "step": 8298
    },
    {
      "epoch": 0.8804370889030342,
      "grad_norm": 0.4314755872180652,
      "learning_rate": 4.9353607910513974e-05,
      "loss": 1.9125,
      "num_input_tokens_seen": 6529369296,
      "step": 8299
    },
    {
      "epoch": 0.8805431784426055,
      "grad_norm": 0.7043002863871952,
      "learning_rate": 4.9353450889127264e-05,
      "loss": 1.8775,
      "num_input_tokens_seen": 6530156080,
      "step": 8300
    },
    {
      "epoch": 0.8806492679821769,
      "grad_norm": 0.44467137536625057,
      "learning_rate": 4.935329384892092e-05,
      "loss": 1.7389,
      "num_input_tokens_seen": 6530942864,
      "step": 8301
    },
    {
      "epoch": 0.8807553575217484,
      "grad_norm": 0.6954774699641846,
      "learning_rate": 4.935313678989506e-05,
      "loss": 1.9421,
      "num_input_tokens_seen": 6531729632,
      "step": 8302
    },
    {
      "epoch": 0.8808614470613197,
      "grad_norm": 0.5238954931867085,
      "learning_rate": 4.935297971204981e-05,
      "loss": 1.9653,
      "num_input_tokens_seen": 6532516400,
      "step": 8303
    },
    {
      "epoch": 0.8809675366008911,
      "grad_norm": 0.5499797296247183,
      "learning_rate": 4.93528226153853e-05,
      "loss": 1.9285,
      "num_input_tokens_seen": 6533303152,
      "step": 8304
    },
    {
      "epoch": 0.8810736261404626,
      "grad_norm": 0.4706166329118658,
      "learning_rate": 4.935266549990164e-05,
      "loss": 1.9089,
      "num_input_tokens_seen": 6534089952,
      "step": 8305
    },
    {
      "epoch": 0.881179715680034,
      "grad_norm": 0.6120994120178209,
      "learning_rate": 4.935250836559895e-05,
      "loss": 1.9142,
      "num_input_tokens_seen": 6534876752,
      "step": 8306
    },
    {
      "epoch": 0.8812858052196053,
      "grad_norm": 0.4786893583750042,
      "learning_rate": 4.935235121247735e-05,
      "loss": 1.8015,
      "num_input_tokens_seen": 6535663632,
      "step": 8307
    },
    {
      "epoch": 0.8813918947591768,
      "grad_norm": 0.5874614287554258,
      "learning_rate": 4.935219404053698e-05,
      "loss": 1.8243,
      "num_input_tokens_seen": 6536450384,
      "step": 8308
    },
    {
      "epoch": 0.8814979842987481,
      "grad_norm": 0.508255825322924,
      "learning_rate": 4.935203684977795e-05,
      "loss": 1.8699,
      "num_input_tokens_seen": 6537237184,
      "step": 8309
    },
    {
      "epoch": 0.8816040738383195,
      "grad_norm": 0.5551064576256295,
      "learning_rate": 4.935187964020037e-05,
      "loss": 1.8826,
      "num_input_tokens_seen": 6538023920,
      "step": 8310
    },
    {
      "epoch": 0.881710163377891,
      "grad_norm": 0.6156835590093958,
      "learning_rate": 4.935172241180438e-05,
      "loss": 1.9025,
      "num_input_tokens_seen": 6538810592,
      "step": 8311
    },
    {
      "epoch": 0.8818162529174624,
      "grad_norm": 0.40236467210477594,
      "learning_rate": 4.93515651645901e-05,
      "loss": 1.7596,
      "num_input_tokens_seen": 6539597408,
      "step": 8312
    },
    {
      "epoch": 0.8819223424570337,
      "grad_norm": 0.769916944037419,
      "learning_rate": 4.935140789855763e-05,
      "loss": 2.0481,
      "num_input_tokens_seen": 6540384160,
      "step": 8313
    },
    {
      "epoch": 0.8820284319966052,
      "grad_norm": 0.5043173506541843,
      "learning_rate": 4.935125061370711e-05,
      "loss": 1.8942,
      "num_input_tokens_seen": 6541171008,
      "step": 8314
    },
    {
      "epoch": 0.8821345215361766,
      "grad_norm": 0.558850047603211,
      "learning_rate": 4.935109331003867e-05,
      "loss": 2.0124,
      "num_input_tokens_seen": 6541957776,
      "step": 8315
    },
    {
      "epoch": 0.8822406110757479,
      "grad_norm": 0.3994736715964022,
      "learning_rate": 4.9350935987552404e-05,
      "loss": 1.9399,
      "num_input_tokens_seen": 6542744544,
      "step": 8316
    },
    {
      "epoch": 0.8823467006153193,
      "grad_norm": 0.5329242817884532,
      "learning_rate": 4.935077864624845e-05,
      "loss": 1.9906,
      "num_input_tokens_seen": 6543531296,
      "step": 8317
    },
    {
      "epoch": 0.8824527901548908,
      "grad_norm": 0.47049820977001133,
      "learning_rate": 4.935062128612694e-05,
      "loss": 1.9372,
      "num_input_tokens_seen": 6544318080,
      "step": 8318
    },
    {
      "epoch": 0.8825588796944621,
      "grad_norm": 0.47928616235448945,
      "learning_rate": 4.935046390718798e-05,
      "loss": 1.963,
      "num_input_tokens_seen": 6545104848,
      "step": 8319
    },
    {
      "epoch": 0.8826649692340335,
      "grad_norm": 0.5772880457202967,
      "learning_rate": 4.935030650943169e-05,
      "loss": 1.8509,
      "num_input_tokens_seen": 6545891648,
      "step": 8320
    },
    {
      "epoch": 0.882771058773605,
      "grad_norm": 0.6330989638267761,
      "learning_rate": 4.93501490928582e-05,
      "loss": 1.8562,
      "num_input_tokens_seen": 6546678560,
      "step": 8321
    },
    {
      "epoch": 0.8828771483131763,
      "grad_norm": 0.3893303399008039,
      "learning_rate": 4.934999165746763e-05,
      "loss": 1.8792,
      "num_input_tokens_seen": 6547465296,
      "step": 8322
    },
    {
      "epoch": 0.8829832378527477,
      "grad_norm": 0.448441543725363,
      "learning_rate": 4.9349834203260104e-05,
      "loss": 1.9635,
      "num_input_tokens_seen": 6548252080,
      "step": 8323
    },
    {
      "epoch": 0.8830893273923192,
      "grad_norm": 0.42889040473836126,
      "learning_rate": 4.934967673023574e-05,
      "loss": 1.97,
      "num_input_tokens_seen": 6549038800,
      "step": 8324
    },
    {
      "epoch": 0.8831954169318905,
      "grad_norm": 0.5406853530434208,
      "learning_rate": 4.9349519238394656e-05,
      "loss": 1.889,
      "num_input_tokens_seen": 6549825600,
      "step": 8325
    },
    {
      "epoch": 0.8833015064714619,
      "grad_norm": 0.4251819051929193,
      "learning_rate": 4.934936172773699e-05,
      "loss": 1.9395,
      "num_input_tokens_seen": 6550612272,
      "step": 8326
    },
    {
      "epoch": 0.8834075960110334,
      "grad_norm": 0.49338459353601755,
      "learning_rate": 4.9349204198262836e-05,
      "loss": 1.9127,
      "num_input_tokens_seen": 6551398976,
      "step": 8327
    },
    {
      "epoch": 0.8835136855506047,
      "grad_norm": 0.4030939293561396,
      "learning_rate": 4.934904664997234e-05,
      "loss": 1.7892,
      "num_input_tokens_seen": 6552185760,
      "step": 8328
    },
    {
      "epoch": 0.8836197750901761,
      "grad_norm": 0.39292282499350334,
      "learning_rate": 4.9348889082865614e-05,
      "loss": 1.85,
      "num_input_tokens_seen": 6552972608,
      "step": 8329
    },
    {
      "epoch": 0.8837258646297476,
      "grad_norm": 0.5320814550096884,
      "learning_rate": 4.934873149694278e-05,
      "loss": 1.9913,
      "num_input_tokens_seen": 6553759296,
      "step": 8330
    },
    {
      "epoch": 0.8838319541693189,
      "grad_norm": 0.4317197498543491,
      "learning_rate": 4.9348573892203964e-05,
      "loss": 1.843,
      "num_input_tokens_seen": 6554545968,
      "step": 8331
    },
    {
      "epoch": 0.8839380437088903,
      "grad_norm": 0.4568998628874869,
      "learning_rate": 4.934841626864928e-05,
      "loss": 2.0062,
      "num_input_tokens_seen": 6555332672,
      "step": 8332
    },
    {
      "epoch": 0.8840441332484616,
      "grad_norm": 0.39072045861115356,
      "learning_rate": 4.9348258626278856e-05,
      "loss": 1.7201,
      "num_input_tokens_seen": 6556119456,
      "step": 8333
    },
    {
      "epoch": 0.8841502227880331,
      "grad_norm": 0.43228984216439276,
      "learning_rate": 4.9348100965092816e-05,
      "loss": 1.9411,
      "num_input_tokens_seen": 6556906176,
      "step": 8334
    },
    {
      "epoch": 0.8842563123276045,
      "grad_norm": 0.4816601301885598,
      "learning_rate": 4.9347943285091266e-05,
      "loss": 1.9037,
      "num_input_tokens_seen": 6557692896,
      "step": 8335
    },
    {
      "epoch": 0.8843624018671759,
      "grad_norm": 0.4860565907803009,
      "learning_rate": 4.934778558627435e-05,
      "loss": 1.8546,
      "num_input_tokens_seen": 6558479680,
      "step": 8336
    },
    {
      "epoch": 0.8844684914067473,
      "grad_norm": 0.42645632748802614,
      "learning_rate": 4.9347627868642176e-05,
      "loss": 1.9568,
      "num_input_tokens_seen": 6559266448,
      "step": 8337
    },
    {
      "epoch": 0.8845745809463187,
      "grad_norm": 0.4211803902764292,
      "learning_rate": 4.934747013219487e-05,
      "loss": 1.9089,
      "num_input_tokens_seen": 6560053152,
      "step": 8338
    },
    {
      "epoch": 0.88468067048589,
      "grad_norm": 0.6836985610434871,
      "learning_rate": 4.9347312376932555e-05,
      "loss": 1.8187,
      "num_input_tokens_seen": 6560840000,
      "step": 8339
    },
    {
      "epoch": 0.8847867600254615,
      "grad_norm": 0.4144429108326963,
      "learning_rate": 4.934715460285535e-05,
      "loss": 1.9679,
      "num_input_tokens_seen": 6561626704,
      "step": 8340
    },
    {
      "epoch": 0.8848928495650329,
      "grad_norm": 0.450496852153735,
      "learning_rate": 4.9346996809963387e-05,
      "loss": 1.9403,
      "num_input_tokens_seen": 6562413488,
      "step": 8341
    },
    {
      "epoch": 0.8849989391046043,
      "grad_norm": 0.4917819993342986,
      "learning_rate": 4.934683899825677e-05,
      "loss": 1.8635,
      "num_input_tokens_seen": 6563200208,
      "step": 8342
    },
    {
      "epoch": 0.8851050286441757,
      "grad_norm": 0.35923684316693344,
      "learning_rate": 4.934668116773563e-05,
      "loss": 1.8131,
      "num_input_tokens_seen": 6563986960,
      "step": 8343
    },
    {
      "epoch": 0.8852111181837471,
      "grad_norm": 0.4617376034336692,
      "learning_rate": 4.9346523318400094e-05,
      "loss": 1.8176,
      "num_input_tokens_seen": 6564773792,
      "step": 8344
    },
    {
      "epoch": 0.8853172077233185,
      "grad_norm": 0.4235375899526004,
      "learning_rate": 4.934636545025027e-05,
      "loss": 1.7707,
      "num_input_tokens_seen": 6565560480,
      "step": 8345
    },
    {
      "epoch": 0.8854232972628899,
      "grad_norm": 0.48144799241945396,
      "learning_rate": 4.93462075632863e-05,
      "loss": 1.936,
      "num_input_tokens_seen": 6566347232,
      "step": 8346
    },
    {
      "epoch": 0.8855293868024613,
      "grad_norm": 0.47011878917009653,
      "learning_rate": 4.934604965750829e-05,
      "loss": 2.0016,
      "num_input_tokens_seen": 6567134080,
      "step": 8347
    },
    {
      "epoch": 0.8856354763420327,
      "grad_norm": 0.437108218098653,
      "learning_rate": 4.934589173291637e-05,
      "loss": 1.8873,
      "num_input_tokens_seen": 6567920928,
      "step": 8348
    },
    {
      "epoch": 0.885741565881604,
      "grad_norm": 0.4108587040487373,
      "learning_rate": 4.934573378951065e-05,
      "loss": 1.9175,
      "num_input_tokens_seen": 6568707648,
      "step": 8349
    },
    {
      "epoch": 0.8858476554211755,
      "grad_norm": 0.398174820117571,
      "learning_rate": 4.9345575827291275e-05,
      "loss": 1.9684,
      "num_input_tokens_seen": 6569494400,
      "step": 8350
    },
    {
      "epoch": 0.8859537449607469,
      "grad_norm": 0.4276221146347404,
      "learning_rate": 4.934541784625835e-05,
      "loss": 1.9154,
      "num_input_tokens_seen": 6570281168,
      "step": 8351
    },
    {
      "epoch": 0.8860598345003182,
      "grad_norm": 0.4848604160639914,
      "learning_rate": 4.9345259846411995e-05,
      "loss": 1.8453,
      "num_input_tokens_seen": 6571067920,
      "step": 8352
    },
    {
      "epoch": 0.8861659240398897,
      "grad_norm": 0.385814044453967,
      "learning_rate": 4.9345101827752335e-05,
      "loss": 1.9677,
      "num_input_tokens_seen": 6571854640,
      "step": 8353
    },
    {
      "epoch": 0.8862720135794611,
      "grad_norm": 0.45906348335034536,
      "learning_rate": 4.93449437902795e-05,
      "loss": 1.9274,
      "num_input_tokens_seen": 6572641408,
      "step": 8354
    },
    {
      "epoch": 0.8863781031190324,
      "grad_norm": 0.3784403447100241,
      "learning_rate": 4.93447857339936e-05,
      "loss": 1.8475,
      "num_input_tokens_seen": 6573428224,
      "step": 8355
    },
    {
      "epoch": 0.8864841926586039,
      "grad_norm": 0.39512031667121666,
      "learning_rate": 4.9344627658894775e-05,
      "loss": 1.7196,
      "num_input_tokens_seen": 6574215056,
      "step": 8356
    },
    {
      "epoch": 0.8865902821981753,
      "grad_norm": 0.49011086396966447,
      "learning_rate": 4.934446956498313e-05,
      "loss": 1.8765,
      "num_input_tokens_seen": 6575001936,
      "step": 8357
    },
    {
      "epoch": 0.8866963717377466,
      "grad_norm": 0.357333907295436,
      "learning_rate": 4.934431145225879e-05,
      "loss": 1.8744,
      "num_input_tokens_seen": 6575788656,
      "step": 8358
    },
    {
      "epoch": 0.8868024612773181,
      "grad_norm": 0.4783434364274561,
      "learning_rate": 4.934415332072189e-05,
      "loss": 1.9033,
      "num_input_tokens_seen": 6576575424,
      "step": 8359
    },
    {
      "epoch": 0.8869085508168895,
      "grad_norm": 0.3771702908748717,
      "learning_rate": 4.934399517037254e-05,
      "loss": 1.7589,
      "num_input_tokens_seen": 6577362192,
      "step": 8360
    },
    {
      "epoch": 0.8870146403564608,
      "grad_norm": 0.4653797863435167,
      "learning_rate": 4.934383700121086e-05,
      "loss": 1.8933,
      "num_input_tokens_seen": 6578148944,
      "step": 8361
    },
    {
      "epoch": 0.8871207298960323,
      "grad_norm": 0.3353989818530643,
      "learning_rate": 4.9343678813236976e-05,
      "loss": 1.787,
      "num_input_tokens_seen": 6578935696,
      "step": 8362
    },
    {
      "epoch": 0.8872268194356037,
      "grad_norm": 0.7397839334268493,
      "learning_rate": 4.9343520606451014e-05,
      "loss": 1.8392,
      "num_input_tokens_seen": 6579722448,
      "step": 8363
    },
    {
      "epoch": 0.887332908975175,
      "grad_norm": 0.4865187750809829,
      "learning_rate": 4.93433623808531e-05,
      "loss": 1.8534,
      "num_input_tokens_seen": 6580509200,
      "step": 8364
    },
    {
      "epoch": 0.8874389985147464,
      "grad_norm": 1.0342358585206313,
      "learning_rate": 4.9343204136443336e-05,
      "loss": 1.9524,
      "num_input_tokens_seen": 6581295984,
      "step": 8365
    },
    {
      "epoch": 0.8875450880543179,
      "grad_norm": 1.0482195820148217,
      "learning_rate": 4.934304587322187e-05,
      "loss": 1.9143,
      "num_input_tokens_seen": 6582082752,
      "step": 8366
    },
    {
      "epoch": 0.8876511775938892,
      "grad_norm": 0.6786057369918326,
      "learning_rate": 4.934288759118881e-05,
      "loss": 1.8623,
      "num_input_tokens_seen": 6582869648,
      "step": 8367
    },
    {
      "epoch": 0.8877572671334606,
      "grad_norm": 0.6299646987760963,
      "learning_rate": 4.934272929034428e-05,
      "loss": 1.8922,
      "num_input_tokens_seen": 6583656304,
      "step": 8368
    },
    {
      "epoch": 0.8878633566730321,
      "grad_norm": 1.1351092833375378,
      "learning_rate": 4.9342570970688396e-05,
      "loss": 1.9614,
      "num_input_tokens_seen": 6584443136,
      "step": 8369
    },
    {
      "epoch": 0.8879694462126034,
      "grad_norm": 0.5841257371492184,
      "learning_rate": 4.9342412632221295e-05,
      "loss": 1.8173,
      "num_input_tokens_seen": 6585229872,
      "step": 8370
    },
    {
      "epoch": 0.8880755357521748,
      "grad_norm": 1.328330336398131,
      "learning_rate": 4.934225427494309e-05,
      "loss": 1.9163,
      "num_input_tokens_seen": 6586016624,
      "step": 8371
    },
    {
      "epoch": 0.8881816252917463,
      "grad_norm": 0.46292986922966545,
      "learning_rate": 4.9342095898853904e-05,
      "loss": 1.7751,
      "num_input_tokens_seen": 6586803312,
      "step": 8372
    },
    {
      "epoch": 0.8882877148313176,
      "grad_norm": 0.9788911003293845,
      "learning_rate": 4.9341937503953864e-05,
      "loss": 1.846,
      "num_input_tokens_seen": 6587590048,
      "step": 8373
    },
    {
      "epoch": 0.888393804370889,
      "grad_norm": 0.7451728102629485,
      "learning_rate": 4.934177909024309e-05,
      "loss": 1.954,
      "num_input_tokens_seen": 6588376800,
      "step": 8374
    },
    {
      "epoch": 0.8884998939104605,
      "grad_norm": 0.7957251324323454,
      "learning_rate": 4.93416206577217e-05,
      "loss": 1.7721,
      "num_input_tokens_seen": 6589163552,
      "step": 8375
    },
    {
      "epoch": 0.8886059834500318,
      "grad_norm": 1.2683691196243665,
      "learning_rate": 4.9341462206389814e-05,
      "loss": 1.9527,
      "num_input_tokens_seen": 6589950288,
      "step": 8376
    },
    {
      "epoch": 0.8887120729896032,
      "grad_norm": 0.7922321390939845,
      "learning_rate": 4.9341303736247566e-05,
      "loss": 1.8897,
      "num_input_tokens_seen": 6590737072,
      "step": 8377
    },
    {
      "epoch": 0.8888181625291747,
      "grad_norm": 0.5970828907122561,
      "learning_rate": 4.9341145247295075e-05,
      "loss": 1.8517,
      "num_input_tokens_seen": 6591523824,
      "step": 8378
    },
    {
      "epoch": 0.888924252068746,
      "grad_norm": 0.5419892738331105,
      "learning_rate": 4.9340986739532454e-05,
      "loss": 1.7841,
      "num_input_tokens_seen": 6592310592,
      "step": 8379
    },
    {
      "epoch": 0.8890303416083174,
      "grad_norm": 0.5103843098126701,
      "learning_rate": 4.934082821295984e-05,
      "loss": 1.8136,
      "num_input_tokens_seen": 6593097392,
      "step": 8380
    },
    {
      "epoch": 0.8891364311478889,
      "grad_norm": 0.5094252518657872,
      "learning_rate": 4.934066966757735e-05,
      "loss": 1.9178,
      "num_input_tokens_seen": 6593884160,
      "step": 8381
    },
    {
      "epoch": 0.8892425206874602,
      "grad_norm": 0.532379495009108,
      "learning_rate": 4.9340511103385104e-05,
      "loss": 1.8369,
      "num_input_tokens_seen": 6594671024,
      "step": 8382
    },
    {
      "epoch": 0.8893486102270316,
      "grad_norm": 0.4957414196522629,
      "learning_rate": 4.934035252038322e-05,
      "loss": 1.8909,
      "num_input_tokens_seen": 6595457728,
      "step": 8383
    },
    {
      "epoch": 0.889454699766603,
      "grad_norm": 0.4591442836711693,
      "learning_rate": 4.9340193918571825e-05,
      "loss": 2.1098,
      "num_input_tokens_seen": 6596244464,
      "step": 8384
    },
    {
      "epoch": 0.8895607893061744,
      "grad_norm": 0.5049989739640779,
      "learning_rate": 4.934003529795104e-05,
      "loss": 1.9638,
      "num_input_tokens_seen": 6597031168,
      "step": 8385
    },
    {
      "epoch": 0.8896668788457458,
      "grad_norm": 0.4996956908232429,
      "learning_rate": 4.9339876658521e-05,
      "loss": 1.9026,
      "num_input_tokens_seen": 6597817872,
      "step": 8386
    },
    {
      "epoch": 0.8897729683853172,
      "grad_norm": 0.4150621557359684,
      "learning_rate": 4.933971800028181e-05,
      "loss": 1.7707,
      "num_input_tokens_seen": 6598604736,
      "step": 8387
    },
    {
      "epoch": 0.8898790579248886,
      "grad_norm": 0.48026232459043167,
      "learning_rate": 4.9339559323233606e-05,
      "loss": 1.7961,
      "num_input_tokens_seen": 6599391552,
      "step": 8388
    },
    {
      "epoch": 0.88998514746446,
      "grad_norm": 0.5603226510164349,
      "learning_rate": 4.93394006273765e-05,
      "loss": 1.9671,
      "num_input_tokens_seen": 6600178288,
      "step": 8389
    },
    {
      "epoch": 0.8900912370040314,
      "grad_norm": 0.43350557561190206,
      "learning_rate": 4.9339241912710624e-05,
      "loss": 2.0304,
      "num_input_tokens_seen": 6600965104,
      "step": 8390
    },
    {
      "epoch": 0.8901973265436028,
      "grad_norm": 0.4915058936413145,
      "learning_rate": 4.933908317923609e-05,
      "loss": 1.7909,
      "num_input_tokens_seen": 6601751904,
      "step": 8391
    },
    {
      "epoch": 0.8903034160831742,
      "grad_norm": 0.43047878206480544,
      "learning_rate": 4.9338924426953024e-05,
      "loss": 2.0519,
      "num_input_tokens_seen": 6602538592,
      "step": 8392
    },
    {
      "epoch": 0.8904095056227456,
      "grad_norm": 0.5576746956919998,
      "learning_rate": 4.9338765655861555e-05,
      "loss": 1.9031,
      "num_input_tokens_seen": 6603325328,
      "step": 8393
    },
    {
      "epoch": 0.890515595162317,
      "grad_norm": 0.4707215438527686,
      "learning_rate": 4.933860686596181e-05,
      "loss": 1.8483,
      "num_input_tokens_seen": 6604112112,
      "step": 8394
    },
    {
      "epoch": 0.8906216847018884,
      "grad_norm": 0.7998459200665821,
      "learning_rate": 4.93384480572539e-05,
      "loss": 1.9268,
      "num_input_tokens_seen": 6604898880,
      "step": 8395
    },
    {
      "epoch": 0.8907277742414598,
      "grad_norm": 0.4417889357285094,
      "learning_rate": 4.9338289229737946e-05,
      "loss": 2.1131,
      "num_input_tokens_seen": 6605685632,
      "step": 8396
    },
    {
      "epoch": 0.8908338637810312,
      "grad_norm": 1.001273978199043,
      "learning_rate": 4.9338130383414075e-05,
      "loss": 1.9364,
      "num_input_tokens_seen": 6606472352,
      "step": 8397
    },
    {
      "epoch": 0.8909399533206026,
      "grad_norm": 0.4956938880493817,
      "learning_rate": 4.933797151828241e-05,
      "loss": 1.8864,
      "num_input_tokens_seen": 6607259248,
      "step": 8398
    },
    {
      "epoch": 0.891046042860174,
      "grad_norm": 0.811894053825588,
      "learning_rate": 4.933781263434308e-05,
      "loss": 1.963,
      "num_input_tokens_seen": 6608046000,
      "step": 8399
    },
    {
      "epoch": 0.8911521323997453,
      "grad_norm": 0.5622375942705311,
      "learning_rate": 4.9337653731596206e-05,
      "loss": 1.9192,
      "num_input_tokens_seen": 6608832656,
      "step": 8400
    },
    {
      "epoch": 0.8912582219393168,
      "grad_norm": 0.7650931186505658,
      "learning_rate": 4.9337494810041904e-05,
      "loss": 1.9968,
      "num_input_tokens_seen": 6609619344,
      "step": 8401
    },
    {
      "epoch": 0.8913643114788882,
      "grad_norm": 0.4609109869100687,
      "learning_rate": 4.93373358696803e-05,
      "loss": 1.7807,
      "num_input_tokens_seen": 6610406128,
      "step": 8402
    },
    {
      "epoch": 0.8914704010184595,
      "grad_norm": 0.756671831760918,
      "learning_rate": 4.933717691051152e-05,
      "loss": 1.9475,
      "num_input_tokens_seen": 6611192832,
      "step": 8403
    },
    {
      "epoch": 0.891576490558031,
      "grad_norm": 0.4239134402365011,
      "learning_rate": 4.933701793253568e-05,
      "loss": 1.8299,
      "num_input_tokens_seen": 6611979664,
      "step": 8404
    },
    {
      "epoch": 0.8916825800976024,
      "grad_norm": 0.5896554637517113,
      "learning_rate": 4.93368589357529e-05,
      "loss": 1.9486,
      "num_input_tokens_seen": 6612766400,
      "step": 8405
    },
    {
      "epoch": 0.8917886696371737,
      "grad_norm": 0.4993438295746654,
      "learning_rate": 4.933669992016332e-05,
      "loss": 1.8377,
      "num_input_tokens_seen": 6613553248,
      "step": 8406
    },
    {
      "epoch": 0.8918947591767452,
      "grad_norm": 0.6103803483346072,
      "learning_rate": 4.9336540885767046e-05,
      "loss": 1.8703,
      "num_input_tokens_seen": 6614340016,
      "step": 8407
    },
    {
      "epoch": 0.8920008487163166,
      "grad_norm": 0.8883718819317088,
      "learning_rate": 4.933638183256421e-05,
      "loss": 2.0191,
      "num_input_tokens_seen": 6615126752,
      "step": 8408
    },
    {
      "epoch": 0.8921069382558879,
      "grad_norm": 0.5588995391656459,
      "learning_rate": 4.933622276055493e-05,
      "loss": 1.8333,
      "num_input_tokens_seen": 6615913408,
      "step": 8409
    },
    {
      "epoch": 0.8922130277954594,
      "grad_norm": 0.9005323575135169,
      "learning_rate": 4.933606366973934e-05,
      "loss": 1.9557,
      "num_input_tokens_seen": 6616700160,
      "step": 8410
    },
    {
      "epoch": 0.8923191173350308,
      "grad_norm": 0.5172244705196954,
      "learning_rate": 4.933590456011754e-05,
      "loss": 1.9414,
      "num_input_tokens_seen": 6617486976,
      "step": 8411
    },
    {
      "epoch": 0.8924252068746021,
      "grad_norm": 0.7053794276307725,
      "learning_rate": 4.9335745431689677e-05,
      "loss": 2.0146,
      "num_input_tokens_seen": 6618273824,
      "step": 8412
    },
    {
      "epoch": 0.8925312964141736,
      "grad_norm": 0.8329877250761855,
      "learning_rate": 4.933558628445586e-05,
      "loss": 2.0426,
      "num_input_tokens_seen": 6619060464,
      "step": 8413
    },
    {
      "epoch": 0.892637385953745,
      "grad_norm": 0.7377581018289353,
      "learning_rate": 4.9335427118416225e-05,
      "loss": 1.9106,
      "num_input_tokens_seen": 6619847200,
      "step": 8414
    },
    {
      "epoch": 0.8927434754933163,
      "grad_norm": 1.4625230331033336,
      "learning_rate": 4.933526793357087e-05,
      "loss": 1.925,
      "num_input_tokens_seen": 6620634000,
      "step": 8415
    },
    {
      "epoch": 0.8928495650328877,
      "grad_norm": 0.5757403912203088,
      "learning_rate": 4.9335108729919946e-05,
      "loss": 1.8473,
      "num_input_tokens_seen": 6621420848,
      "step": 8416
    },
    {
      "epoch": 0.8929556545724592,
      "grad_norm": 1.4032315320537736,
      "learning_rate": 4.933494950746356e-05,
      "loss": 1.858,
      "num_input_tokens_seen": 6622207584,
      "step": 8417
    },
    {
      "epoch": 0.8930617441120305,
      "grad_norm": 0.47829506431328705,
      "learning_rate": 4.9334790266201835e-05,
      "loss": 1.8768,
      "num_input_tokens_seen": 6622994336,
      "step": 8418
    },
    {
      "epoch": 0.8931678336516019,
      "grad_norm": 1.1128998371772736,
      "learning_rate": 4.933463100613491e-05,
      "loss": 1.9604,
      "num_input_tokens_seen": 6623780992,
      "step": 8419
    },
    {
      "epoch": 0.8932739231911734,
      "grad_norm": 0.5552849569514955,
      "learning_rate": 4.933447172726289e-05,
      "loss": 1.9382,
      "num_input_tokens_seen": 6624567808,
      "step": 8420
    },
    {
      "epoch": 0.8933800127307447,
      "grad_norm": 0.8248975295101145,
      "learning_rate": 4.933431242958589e-05,
      "loss": 2.0181,
      "num_input_tokens_seen": 6625354480,
      "step": 8421
    },
    {
      "epoch": 0.8934861022703161,
      "grad_norm": 0.5925960967255175,
      "learning_rate": 4.933415311310406e-05,
      "loss": 1.7983,
      "num_input_tokens_seen": 6626141280,
      "step": 8422
    },
    {
      "epoch": 0.8935921918098876,
      "grad_norm": 0.7365767600884751,
      "learning_rate": 4.933399377781752e-05,
      "loss": 1.9295,
      "num_input_tokens_seen": 6626928016,
      "step": 8423
    },
    {
      "epoch": 0.893698281349459,
      "grad_norm": 0.6187712615367686,
      "learning_rate": 4.933383442372638e-05,
      "loss": 1.8436,
      "num_input_tokens_seen": 6627714816,
      "step": 8424
    },
    {
      "epoch": 0.8938043708890303,
      "grad_norm": 0.865296106323139,
      "learning_rate": 4.9333675050830755e-05,
      "loss": 1.8775,
      "num_input_tokens_seen": 6628501568,
      "step": 8425
    },
    {
      "epoch": 0.8939104604286018,
      "grad_norm": 0.3846489695253315,
      "learning_rate": 4.933351565913078e-05,
      "loss": 1.8078,
      "num_input_tokens_seen": 6629288336,
      "step": 8426
    },
    {
      "epoch": 0.8940165499681731,
      "grad_norm": 1.1015037075143006,
      "learning_rate": 4.933335624862659e-05,
      "loss": 1.909,
      "num_input_tokens_seen": 6630075104,
      "step": 8427
    },
    {
      "epoch": 0.8941226395077445,
      "grad_norm": 0.4723302829727669,
      "learning_rate": 4.9333196819318286e-05,
      "loss": 1.95,
      "num_input_tokens_seen": 6630861792,
      "step": 8428
    },
    {
      "epoch": 0.894228729047316,
      "grad_norm": 1.3831160220390601,
      "learning_rate": 4.933303737120601e-05,
      "loss": 1.8328,
      "num_input_tokens_seen": 6631648480,
      "step": 8429
    },
    {
      "epoch": 0.8943348185868873,
      "grad_norm": 0.6193173162754451,
      "learning_rate": 4.9332877904289874e-05,
      "loss": 1.9833,
      "num_input_tokens_seen": 6632435216,
      "step": 8430
    },
    {
      "epoch": 0.8944409081264587,
      "grad_norm": 0.8179023817196347,
      "learning_rate": 4.933271841857e-05,
      "loss": 1.9868,
      "num_input_tokens_seen": 6633222032,
      "step": 8431
    },
    {
      "epoch": 0.8945469976660301,
      "grad_norm": 0.8265160688699574,
      "learning_rate": 4.9332558914046516e-05,
      "loss": 1.9886,
      "num_input_tokens_seen": 6634008784,
      "step": 8432
    },
    {
      "epoch": 0.8946530872056015,
      "grad_norm": 0.6701820730291651,
      "learning_rate": 4.933239939071955e-05,
      "loss": 1.935,
      "num_input_tokens_seen": 6634795584,
      "step": 8433
    },
    {
      "epoch": 0.8947591767451729,
      "grad_norm": 0.8285607806247368,
      "learning_rate": 4.933223984858921e-05,
      "loss": 1.9672,
      "num_input_tokens_seen": 6635582304,
      "step": 8434
    },
    {
      "epoch": 0.8948652662847443,
      "grad_norm": 0.5000608508823086,
      "learning_rate": 4.9332080287655635e-05,
      "loss": 1.8427,
      "num_input_tokens_seen": 6636369040,
      "step": 8435
    },
    {
      "epoch": 0.8949713558243158,
      "grad_norm": 1.2371401518014513,
      "learning_rate": 4.933192070791894e-05,
      "loss": 1.915,
      "num_input_tokens_seen": 6637155760,
      "step": 8436
    },
    {
      "epoch": 0.8950774453638871,
      "grad_norm": 0.6551985076585004,
      "learning_rate": 4.933176110937926e-05,
      "loss": 1.8713,
      "num_input_tokens_seen": 6637942512,
      "step": 8437
    },
    {
      "epoch": 0.8951835349034585,
      "grad_norm": 0.9237812464388997,
      "learning_rate": 4.93316014920367e-05,
      "loss": 1.8597,
      "num_input_tokens_seen": 6638729360,
      "step": 8438
    },
    {
      "epoch": 0.89528962444303,
      "grad_norm": 0.548798913715931,
      "learning_rate": 4.933144185589139e-05,
      "loss": 1.8773,
      "num_input_tokens_seen": 6639516096,
      "step": 8439
    },
    {
      "epoch": 0.8953957139826013,
      "grad_norm": 0.9341899138049273,
      "learning_rate": 4.933128220094346e-05,
      "loss": 1.8398,
      "num_input_tokens_seen": 6640302896,
      "step": 8440
    },
    {
      "epoch": 0.8955018035221727,
      "grad_norm": 0.6723056097673082,
      "learning_rate": 4.933112252719303e-05,
      "loss": 1.9471,
      "num_input_tokens_seen": 6641089744,
      "step": 8441
    },
    {
      "epoch": 0.8956078930617442,
      "grad_norm": 0.6771104495520935,
      "learning_rate": 4.933096283464023e-05,
      "loss": 1.7999,
      "num_input_tokens_seen": 6641876576,
      "step": 8442
    },
    {
      "epoch": 0.8957139826013155,
      "grad_norm": 0.4965033735923989,
      "learning_rate": 4.9330803123285165e-05,
      "loss": 1.8409,
      "num_input_tokens_seen": 6642663328,
      "step": 8443
    },
    {
      "epoch": 0.8958200721408869,
      "grad_norm": 0.6006280596142862,
      "learning_rate": 4.933064339312796e-05,
      "loss": 1.9133,
      "num_input_tokens_seen": 6643450096,
      "step": 8444
    },
    {
      "epoch": 0.8959261616804584,
      "grad_norm": 0.47773952850687734,
      "learning_rate": 4.9330483644168765e-05,
      "loss": 1.9593,
      "num_input_tokens_seen": 6644236816,
      "step": 8445
    },
    {
      "epoch": 0.8960322512200297,
      "grad_norm": 0.5449115633310451,
      "learning_rate": 4.933032387640768e-05,
      "loss": 1.8208,
      "num_input_tokens_seen": 6645023536,
      "step": 8446
    },
    {
      "epoch": 0.8961383407596011,
      "grad_norm": 0.5440528292564537,
      "learning_rate": 4.933016408984483e-05,
      "loss": 1.9259,
      "num_input_tokens_seen": 6645810256,
      "step": 8447
    },
    {
      "epoch": 0.8962444302991726,
      "grad_norm": 0.5459811730327945,
      "learning_rate": 4.9330004284480353e-05,
      "loss": 1.8473,
      "num_input_tokens_seen": 6646597008,
      "step": 8448
    },
    {
      "epoch": 0.8963505198387439,
      "grad_norm": 0.6386291020563305,
      "learning_rate": 4.932984446031435e-05,
      "loss": 1.9256,
      "num_input_tokens_seen": 6647383872,
      "step": 8449
    },
    {
      "epoch": 0.8964566093783153,
      "grad_norm": 0.4956299790783087,
      "learning_rate": 4.932968461734697e-05,
      "loss": 1.9182,
      "num_input_tokens_seen": 6648170592,
      "step": 8450
    },
    {
      "epoch": 0.8965626989178866,
      "grad_norm": 0.7911547199913961,
      "learning_rate": 4.9329524755578314e-05,
      "loss": 1.7699,
      "num_input_tokens_seen": 6648957360,
      "step": 8451
    },
    {
      "epoch": 0.8966687884574581,
      "grad_norm": 0.42172653799343135,
      "learning_rate": 4.932936487500852e-05,
      "loss": 1.8874,
      "num_input_tokens_seen": 6649744128,
      "step": 8452
    },
    {
      "epoch": 0.8967748779970295,
      "grad_norm": 1.1437261158455958,
      "learning_rate": 4.932920497563771e-05,
      "loss": 2.0033,
      "num_input_tokens_seen": 6650530928,
      "step": 8453
    },
    {
      "epoch": 0.8968809675366008,
      "grad_norm": 0.5514741892412791,
      "learning_rate": 4.9329045057466e-05,
      "loss": 1.9005,
      "num_input_tokens_seen": 6651317648,
      "step": 8454
    },
    {
      "epoch": 0.8969870570761723,
      "grad_norm": 1.7678925609766134,
      "learning_rate": 4.932888512049352e-05,
      "loss": 1.8792,
      "num_input_tokens_seen": 6652104448,
      "step": 8455
    },
    {
      "epoch": 0.8970931466157437,
      "grad_norm": 0.3316339317319483,
      "learning_rate": 4.9328725164720386e-05,
      "loss": 1.6848,
      "num_input_tokens_seen": 6652891296,
      "step": 8456
    },
    {
      "epoch": 0.897199236155315,
      "grad_norm": 0.5770858287291841,
      "learning_rate": 4.932856519014673e-05,
      "loss": 1.8646,
      "num_input_tokens_seen": 6653678096,
      "step": 8457
    },
    {
      "epoch": 0.8973053256948865,
      "grad_norm": 0.5885277512634712,
      "learning_rate": 4.932840519677267e-05,
      "loss": 1.8645,
      "num_input_tokens_seen": 6654464880,
      "step": 8458
    },
    {
      "epoch": 0.8974114152344579,
      "grad_norm": 0.45213145568486457,
      "learning_rate": 4.932824518459834e-05,
      "loss": 1.9117,
      "num_input_tokens_seen": 6655251728,
      "step": 8459
    },
    {
      "epoch": 0.8975175047740293,
      "grad_norm": 0.47102235373446444,
      "learning_rate": 4.932808515362385e-05,
      "loss": 1.9188,
      "num_input_tokens_seen": 6656038480,
      "step": 8460
    },
    {
      "epoch": 0.8976235943136007,
      "grad_norm": 0.49112031268824985,
      "learning_rate": 4.932792510384933e-05,
      "loss": 1.7853,
      "num_input_tokens_seen": 6656825296,
      "step": 8461
    },
    {
      "epoch": 0.8977296838531721,
      "grad_norm": 0.47274173014548937,
      "learning_rate": 4.932776503527491e-05,
      "loss": 1.9139,
      "num_input_tokens_seen": 6657612080,
      "step": 8462
    },
    {
      "epoch": 0.8978357733927435,
      "grad_norm": 0.43095106577582215,
      "learning_rate": 4.9327604947900696e-05,
      "loss": 1.9352,
      "num_input_tokens_seen": 6658398864,
      "step": 8463
    },
    {
      "epoch": 0.8979418629323149,
      "grad_norm": 0.5693991649344939,
      "learning_rate": 4.9327444841726826e-05,
      "loss": 1.9637,
      "num_input_tokens_seen": 6659185568,
      "step": 8464
    },
    {
      "epoch": 0.8980479524718863,
      "grad_norm": 0.4584676355500604,
      "learning_rate": 4.9327284716753426e-05,
      "loss": 1.8118,
      "num_input_tokens_seen": 6659972352,
      "step": 8465
    },
    {
      "epoch": 0.8981540420114577,
      "grad_norm": 0.4359007058486818,
      "learning_rate": 4.932712457298061e-05,
      "loss": 2.0191,
      "num_input_tokens_seen": 6660759088,
      "step": 8466
    },
    {
      "epoch": 0.898260131551029,
      "grad_norm": 0.46810542078146195,
      "learning_rate": 4.93269644104085e-05,
      "loss": 1.8964,
      "num_input_tokens_seen": 6661545840,
      "step": 8467
    },
    {
      "epoch": 0.8983662210906005,
      "grad_norm": 0.4299502449846565,
      "learning_rate": 4.9326804229037236e-05,
      "loss": 1.8703,
      "num_input_tokens_seen": 6662332624,
      "step": 8468
    },
    {
      "epoch": 0.8984723106301719,
      "grad_norm": 0.6124496040121241,
      "learning_rate": 4.9326644028866934e-05,
      "loss": 2.0094,
      "num_input_tokens_seen": 6663119376,
      "step": 8469
    },
    {
      "epoch": 0.8985784001697432,
      "grad_norm": 0.41614807279312577,
      "learning_rate": 4.9326483809897704e-05,
      "loss": 1.791,
      "num_input_tokens_seen": 6663906208,
      "step": 8470
    },
    {
      "epoch": 0.8986844897093147,
      "grad_norm": 0.7109544312004634,
      "learning_rate": 4.9326323572129684e-05,
      "loss": 1.9804,
      "num_input_tokens_seen": 6664692928,
      "step": 8471
    },
    {
      "epoch": 0.8987905792488861,
      "grad_norm": 0.41709943864394783,
      "learning_rate": 4.9326163315563e-05,
      "loss": 1.9845,
      "num_input_tokens_seen": 6665479680,
      "step": 8472
    },
    {
      "epoch": 0.8988966687884574,
      "grad_norm": 0.5803589641102713,
      "learning_rate": 4.932600304019777e-05,
      "loss": 1.9791,
      "num_input_tokens_seen": 6666266336,
      "step": 8473
    },
    {
      "epoch": 0.8990027583280289,
      "grad_norm": 0.4289620395869333,
      "learning_rate": 4.932584274603411e-05,
      "loss": 1.878,
      "num_input_tokens_seen": 6667053056,
      "step": 8474
    },
    {
      "epoch": 0.8991088478676003,
      "grad_norm": 0.47910545806482907,
      "learning_rate": 4.932568243307216e-05,
      "loss": 1.945,
      "num_input_tokens_seen": 6667839824,
      "step": 8475
    },
    {
      "epoch": 0.8992149374071716,
      "grad_norm": 0.4303528871631444,
      "learning_rate": 4.932552210131204e-05,
      "loss": 1.9051,
      "num_input_tokens_seen": 6668626640,
      "step": 8476
    },
    {
      "epoch": 0.8993210269467431,
      "grad_norm": 0.4500592710238057,
      "learning_rate": 4.9325361750753864e-05,
      "loss": 1.813,
      "num_input_tokens_seen": 6669413408,
      "step": 8477
    },
    {
      "epoch": 0.8994271164863145,
      "grad_norm": 0.45503172699939964,
      "learning_rate": 4.932520138139776e-05,
      "loss": 1.8975,
      "num_input_tokens_seen": 6670200192,
      "step": 8478
    },
    {
      "epoch": 0.8995332060258858,
      "grad_norm": 0.5179118358014677,
      "learning_rate": 4.932504099324386e-05,
      "loss": 1.9099,
      "num_input_tokens_seen": 6670986992,
      "step": 8479
    },
    {
      "epoch": 0.8996392955654573,
      "grad_norm": 0.5197308923526757,
      "learning_rate": 4.932488058629228e-05,
      "loss": 1.9863,
      "num_input_tokens_seen": 6671773776,
      "step": 8480
    },
    {
      "epoch": 0.8997453851050287,
      "grad_norm": 0.49028212825582024,
      "learning_rate": 4.932472016054315e-05,
      "loss": 1.917,
      "num_input_tokens_seen": 6672560624,
      "step": 8481
    },
    {
      "epoch": 0.8998514746446,
      "grad_norm": 0.4187506506032706,
      "learning_rate": 4.932455971599658e-05,
      "loss": 1.9075,
      "num_input_tokens_seen": 6673347376,
      "step": 8482
    },
    {
      "epoch": 0.8999575641841714,
      "grad_norm": 0.6916822192493216,
      "learning_rate": 4.932439925265271e-05,
      "loss": 1.9898,
      "num_input_tokens_seen": 6674134176,
      "step": 8483
    },
    {
      "epoch": 0.9000636537237429,
      "grad_norm": 0.5332545719708178,
      "learning_rate": 4.9324238770511654e-05,
      "loss": 1.9916,
      "num_input_tokens_seen": 6674920880,
      "step": 8484
    },
    {
      "epoch": 0.9001697432633142,
      "grad_norm": 0.4772425862264309,
      "learning_rate": 4.9324078269573545e-05,
      "loss": 1.9815,
      "num_input_tokens_seen": 6675707568,
      "step": 8485
    },
    {
      "epoch": 0.9002758328028856,
      "grad_norm": 0.500114298650129,
      "learning_rate": 4.93239177498385e-05,
      "loss": 1.906,
      "num_input_tokens_seen": 6676494240,
      "step": 8486
    },
    {
      "epoch": 0.9003819223424571,
      "grad_norm": 0.45012841145608207,
      "learning_rate": 4.9323757211306646e-05,
      "loss": 2.03,
      "num_input_tokens_seen": 6677280992,
      "step": 8487
    },
    {
      "epoch": 0.9004880118820284,
      "grad_norm": 0.5831901967986213,
      "learning_rate": 4.932359665397811e-05,
      "loss": 1.9671,
      "num_input_tokens_seen": 6678067840,
      "step": 8488
    },
    {
      "epoch": 0.9005941014215998,
      "grad_norm": 0.4443782848630346,
      "learning_rate": 4.9323436077853e-05,
      "loss": 1.8002,
      "num_input_tokens_seen": 6678854688,
      "step": 8489
    },
    {
      "epoch": 0.9007001909611713,
      "grad_norm": 0.5497956884580996,
      "learning_rate": 4.9323275482931465e-05,
      "loss": 1.9671,
      "num_input_tokens_seen": 6679641440,
      "step": 8490
    },
    {
      "epoch": 0.9008062805007426,
      "grad_norm": 0.5358745230842384,
      "learning_rate": 4.932311486921362e-05,
      "loss": 2.0156,
      "num_input_tokens_seen": 6680428256,
      "step": 8491
    },
    {
      "epoch": 0.900912370040314,
      "grad_norm": 0.4069777295059692,
      "learning_rate": 4.932295423669957e-05,
      "loss": 1.9737,
      "num_input_tokens_seen": 6681215056,
      "step": 8492
    },
    {
      "epoch": 0.9010184595798855,
      "grad_norm": 0.6639467740802243,
      "learning_rate": 4.932279358538946e-05,
      "loss": 1.9972,
      "num_input_tokens_seen": 6682001808,
      "step": 8493
    },
    {
      "epoch": 0.9011245491194568,
      "grad_norm": 0.39495593546867375,
      "learning_rate": 4.9322632915283415e-05,
      "loss": 1.9505,
      "num_input_tokens_seen": 6682788656,
      "step": 8494
    },
    {
      "epoch": 0.9012306386590282,
      "grad_norm": 0.4597587839269667,
      "learning_rate": 4.932247222638155e-05,
      "loss": 1.8919,
      "num_input_tokens_seen": 6683575472,
      "step": 8495
    },
    {
      "epoch": 0.9013367281985997,
      "grad_norm": 0.42416137422489497,
      "learning_rate": 4.932231151868399e-05,
      "loss": 2.082,
      "num_input_tokens_seen": 6684362160,
      "step": 8496
    },
    {
      "epoch": 0.901442817738171,
      "grad_norm": 0.4001945671499281,
      "learning_rate": 4.932215079219086e-05,
      "loss": 2.0341,
      "num_input_tokens_seen": 6685148864,
      "step": 8497
    },
    {
      "epoch": 0.9015489072777424,
      "grad_norm": 0.49576124819716016,
      "learning_rate": 4.932199004690229e-05,
      "loss": 1.8537,
      "num_input_tokens_seen": 6685935680,
      "step": 8498
    },
    {
      "epoch": 0.9016549968173138,
      "grad_norm": 0.49665142114251887,
      "learning_rate": 4.93218292828184e-05,
      "loss": 1.8686,
      "num_input_tokens_seen": 6686722464,
      "step": 8499
    },
    {
      "epoch": 0.9017610863568852,
      "grad_norm": 0.4500274952967142,
      "learning_rate": 4.932166849993931e-05,
      "loss": 1.8578,
      "num_input_tokens_seen": 6687509232,
      "step": 8500
    },
    {
      "epoch": 0.9018671758964566,
      "grad_norm": 0.496971860622266,
      "learning_rate": 4.932150769826515e-05,
      "loss": 1.8922,
      "num_input_tokens_seen": 6688296112,
      "step": 8501
    },
    {
      "epoch": 0.901973265436028,
      "grad_norm": 0.4439296038879549,
      "learning_rate": 4.9321346877796036e-05,
      "loss": 1.8013,
      "num_input_tokens_seen": 6689082944,
      "step": 8502
    },
    {
      "epoch": 0.9020793549755994,
      "grad_norm": 0.40219351524019376,
      "learning_rate": 4.9321186038532104e-05,
      "loss": 1.8454,
      "num_input_tokens_seen": 6689869616,
      "step": 8503
    },
    {
      "epoch": 0.9021854445151708,
      "grad_norm": 0.5927948378453403,
      "learning_rate": 4.932102518047348e-05,
      "loss": 1.9861,
      "num_input_tokens_seen": 6690656384,
      "step": 8504
    },
    {
      "epoch": 0.9022915340547422,
      "grad_norm": 0.4762400971972017,
      "learning_rate": 4.9320864303620273e-05,
      "loss": 1.9124,
      "num_input_tokens_seen": 6691443184,
      "step": 8505
    },
    {
      "epoch": 0.9023976235943136,
      "grad_norm": 0.4907707798239175,
      "learning_rate": 4.932070340797262e-05,
      "loss": 1.8655,
      "num_input_tokens_seen": 6692230032,
      "step": 8506
    },
    {
      "epoch": 0.902503713133885,
      "grad_norm": 0.5397815779349897,
      "learning_rate": 4.9320542493530636e-05,
      "loss": 1.837,
      "num_input_tokens_seen": 6693016784,
      "step": 8507
    },
    {
      "epoch": 0.9026098026734564,
      "grad_norm": 0.5910404821926961,
      "learning_rate": 4.932038156029446e-05,
      "loss": 1.9522,
      "num_input_tokens_seen": 6693803392,
      "step": 8508
    },
    {
      "epoch": 0.9027158922130278,
      "grad_norm": 0.4495491550264078,
      "learning_rate": 4.9320220608264196e-05,
      "loss": 1.8216,
      "num_input_tokens_seen": 6694590112,
      "step": 8509
    },
    {
      "epoch": 0.9028219817525992,
      "grad_norm": 0.5063731267570803,
      "learning_rate": 4.932005963743998e-05,
      "loss": 1.8727,
      "num_input_tokens_seen": 6695376896,
      "step": 8510
    },
    {
      "epoch": 0.9029280712921706,
      "grad_norm": 0.9095729299699966,
      "learning_rate": 4.931989864782194e-05,
      "loss": 1.8607,
      "num_input_tokens_seen": 6696163664,
      "step": 8511
    },
    {
      "epoch": 0.903034160831742,
      "grad_norm": 4.3510028189722645,
      "learning_rate": 4.931973763941019e-05,
      "loss": 1.9108,
      "num_input_tokens_seen": 6696950416,
      "step": 8512
    },
    {
      "epoch": 0.9031402503713134,
      "grad_norm": 0.6274587433581749,
      "learning_rate": 4.931957661220487e-05,
      "loss": 2.0392,
      "num_input_tokens_seen": 6697737248,
      "step": 8513
    },
    {
      "epoch": 0.9032463399108848,
      "grad_norm": 0.5319092753870789,
      "learning_rate": 4.931941556620609e-05,
      "loss": 1.8524,
      "num_input_tokens_seen": 6698524000,
      "step": 8514
    },
    {
      "epoch": 0.9033524294504562,
      "grad_norm": 1.0764889457037885,
      "learning_rate": 4.931925450141398e-05,
      "loss": 1.9379,
      "num_input_tokens_seen": 6699310752,
      "step": 8515
    },
    {
      "epoch": 0.9034585189900276,
      "grad_norm": 0.557678101953322,
      "learning_rate": 4.931909341782866e-05,
      "loss": 1.7088,
      "num_input_tokens_seen": 6700097616,
      "step": 8516
    },
    {
      "epoch": 0.903564608529599,
      "grad_norm": 0.8657001793175136,
      "learning_rate": 4.931893231545026e-05,
      "loss": 1.8359,
      "num_input_tokens_seen": 6700884272,
      "step": 8517
    },
    {
      "epoch": 0.9036706980691703,
      "grad_norm": 0.4862273485122466,
      "learning_rate": 4.9318771194278906e-05,
      "loss": 1.9372,
      "num_input_tokens_seen": 6701671136,
      "step": 8518
    },
    {
      "epoch": 0.9037767876087418,
      "grad_norm": 0.419926762141988,
      "learning_rate": 4.931861005431472e-05,
      "loss": 1.9561,
      "num_input_tokens_seen": 6702457904,
      "step": 8519
    },
    {
      "epoch": 0.9038828771483132,
      "grad_norm": 0.6502301490216031,
      "learning_rate": 4.9318448895557815e-05,
      "loss": 2.0014,
      "num_input_tokens_seen": 6703244688,
      "step": 8520
    },
    {
      "epoch": 0.9039889666878845,
      "grad_norm": 0.42947245686045843,
      "learning_rate": 4.931828771800834e-05,
      "loss": 2.0374,
      "num_input_tokens_seen": 6704031456,
      "step": 8521
    },
    {
      "epoch": 0.904095056227456,
      "grad_norm": 0.5167074452514266,
      "learning_rate": 4.93181265216664e-05,
      "loss": 1.8275,
      "num_input_tokens_seen": 6704818160,
      "step": 8522
    },
    {
      "epoch": 0.9042011457670274,
      "grad_norm": 0.403491932295609,
      "learning_rate": 4.931796530653212e-05,
      "loss": 2.0171,
      "num_input_tokens_seen": 6705604912,
      "step": 8523
    },
    {
      "epoch": 0.9043072353065987,
      "grad_norm": 0.4181400288317037,
      "learning_rate": 4.931780407260563e-05,
      "loss": 1.8525,
      "num_input_tokens_seen": 6706391808,
      "step": 8524
    },
    {
      "epoch": 0.9044133248461702,
      "grad_norm": 0.4499771771657653,
      "learning_rate": 4.9317642819887064e-05,
      "loss": 1.8983,
      "num_input_tokens_seen": 6707178496,
      "step": 8525
    },
    {
      "epoch": 0.9045194143857416,
      "grad_norm": 0.4615054908512461,
      "learning_rate": 4.9317481548376535e-05,
      "loss": 2.127,
      "num_input_tokens_seen": 6707965248,
      "step": 8526
    },
    {
      "epoch": 0.9046255039253129,
      "grad_norm": 0.45765812166470576,
      "learning_rate": 4.9317320258074165e-05,
      "loss": 1.9634,
      "num_input_tokens_seen": 6708751968,
      "step": 8527
    },
    {
      "epoch": 0.9047315934648844,
      "grad_norm": 0.5817708713795356,
      "learning_rate": 4.9317158948980086e-05,
      "loss": 1.8798,
      "num_input_tokens_seen": 6709538768,
      "step": 8528
    },
    {
      "epoch": 0.9048376830044558,
      "grad_norm": 0.47206429206920714,
      "learning_rate": 4.931699762109442e-05,
      "loss": 1.8002,
      "num_input_tokens_seen": 6710325488,
      "step": 8529
    },
    {
      "epoch": 0.9049437725440271,
      "grad_norm": 0.6963795594838836,
      "learning_rate": 4.931683627441729e-05,
      "loss": 1.9487,
      "num_input_tokens_seen": 6711112192,
      "step": 8530
    },
    {
      "epoch": 0.9050498620835986,
      "grad_norm": 0.8295441199833931,
      "learning_rate": 4.9316674908948823e-05,
      "loss": 1.9254,
      "num_input_tokens_seen": 6711898832,
      "step": 8531
    },
    {
      "epoch": 0.90515595162317,
      "grad_norm": 0.47246889842349105,
      "learning_rate": 4.931651352468915e-05,
      "loss": 1.9282,
      "num_input_tokens_seen": 6712685520,
      "step": 8532
    },
    {
      "epoch": 0.9052620411627413,
      "grad_norm": 0.7623162989066853,
      "learning_rate": 4.931635212163838e-05,
      "loss": 1.9511,
      "num_input_tokens_seen": 6713472240,
      "step": 8533
    },
    {
      "epoch": 0.9053681307023127,
      "grad_norm": 0.43922144415278735,
      "learning_rate": 4.931619069979665e-05,
      "loss": 1.8788,
      "num_input_tokens_seen": 6714259008,
      "step": 8534
    },
    {
      "epoch": 0.9054742202418842,
      "grad_norm": 0.5549683523427383,
      "learning_rate": 4.9316029259164075e-05,
      "loss": 2.0179,
      "num_input_tokens_seen": 6715045904,
      "step": 8535
    },
    {
      "epoch": 0.9055803097814555,
      "grad_norm": 0.48677242586270075,
      "learning_rate": 4.93158677997408e-05,
      "loss": 1.9144,
      "num_input_tokens_seen": 6715832640,
      "step": 8536
    },
    {
      "epoch": 0.9056863993210269,
      "grad_norm": 0.48893413632032806,
      "learning_rate": 4.931570632152692e-05,
      "loss": 1.9264,
      "num_input_tokens_seen": 6716619408,
      "step": 8537
    },
    {
      "epoch": 0.9057924888605984,
      "grad_norm": 0.4783927823462628,
      "learning_rate": 4.9315544824522585e-05,
      "loss": 1.9364,
      "num_input_tokens_seen": 6717406192,
      "step": 8538
    },
    {
      "epoch": 0.9058985784001697,
      "grad_norm": 0.4037640947289312,
      "learning_rate": 4.9315383308727916e-05,
      "loss": 1.836,
      "num_input_tokens_seen": 6718192976,
      "step": 8539
    },
    {
      "epoch": 0.9060046679397411,
      "grad_norm": 0.41484202693222905,
      "learning_rate": 4.9315221774143014e-05,
      "loss": 1.7913,
      "num_input_tokens_seen": 6718979792,
      "step": 8540
    },
    {
      "epoch": 0.9061107574793126,
      "grad_norm": 0.4166527212115167,
      "learning_rate": 4.931506022076804e-05,
      "loss": 1.9295,
      "num_input_tokens_seen": 6719766656,
      "step": 8541
    },
    {
      "epoch": 0.9062168470188839,
      "grad_norm": 0.41979205855508567,
      "learning_rate": 4.931489864860309e-05,
      "loss": 1.8248,
      "num_input_tokens_seen": 6720553376,
      "step": 8542
    },
    {
      "epoch": 0.9063229365584553,
      "grad_norm": 0.4823472517787346,
      "learning_rate": 4.931473705764831e-05,
      "loss": 2.0669,
      "num_input_tokens_seen": 6721340192,
      "step": 8543
    },
    {
      "epoch": 0.9064290260980268,
      "grad_norm": 0.4370543790979837,
      "learning_rate": 4.93145754479038e-05,
      "loss": 1.9544,
      "num_input_tokens_seen": 6722126848,
      "step": 8544
    },
    {
      "epoch": 0.9065351156375981,
      "grad_norm": 0.4151079243081062,
      "learning_rate": 4.931441381936971e-05,
      "loss": 1.9618,
      "num_input_tokens_seen": 6722913568,
      "step": 8545
    },
    {
      "epoch": 0.9066412051771695,
      "grad_norm": 0.4556781855491121,
      "learning_rate": 4.9314252172046146e-05,
      "loss": 1.8795,
      "num_input_tokens_seen": 6723700400,
      "step": 8546
    },
    {
      "epoch": 0.906747294716741,
      "grad_norm": 0.39485006601283873,
      "learning_rate": 4.9314090505933256e-05,
      "loss": 1.7956,
      "num_input_tokens_seen": 6724487296,
      "step": 8547
    },
    {
      "epoch": 0.9068533842563123,
      "grad_norm": 0.4254723916524083,
      "learning_rate": 4.931392882103114e-05,
      "loss": 1.836,
      "num_input_tokens_seen": 6725274048,
      "step": 8548
    },
    {
      "epoch": 0.9069594737958837,
      "grad_norm": 0.6607101595712662,
      "learning_rate": 4.931376711733994e-05,
      "loss": 1.9967,
      "num_input_tokens_seen": 6726060784,
      "step": 8549
    },
    {
      "epoch": 0.9070655633354551,
      "grad_norm": 0.6349369979643793,
      "learning_rate": 4.9313605394859765e-05,
      "loss": 1.864,
      "num_input_tokens_seen": 6726847632,
      "step": 8550
    },
    {
      "epoch": 0.9071716528750265,
      "grad_norm": 0.5439275049347306,
      "learning_rate": 4.931344365359075e-05,
      "loss": 1.9696,
      "num_input_tokens_seen": 6727634432,
      "step": 8551
    },
    {
      "epoch": 0.9072777424145979,
      "grad_norm": 0.514621093652657,
      "learning_rate": 4.9313281893533026e-05,
      "loss": 1.8816,
      "num_input_tokens_seen": 6728421184,
      "step": 8552
    },
    {
      "epoch": 0.9073838319541693,
      "grad_norm": 0.6399379256308015,
      "learning_rate": 4.9313120114686704e-05,
      "loss": 1.8411,
      "num_input_tokens_seen": 6729207904,
      "step": 8553
    },
    {
      "epoch": 0.9074899214937407,
      "grad_norm": 0.39099969873060303,
      "learning_rate": 4.931295831705192e-05,
      "loss": 1.8395,
      "num_input_tokens_seen": 6729994736,
      "step": 8554
    },
    {
      "epoch": 0.9075960110333121,
      "grad_norm": 0.9618797732028093,
      "learning_rate": 4.93127965006288e-05,
      "loss": 1.9467,
      "num_input_tokens_seen": 6730781392,
      "step": 8555
    },
    {
      "epoch": 0.9077021005728835,
      "grad_norm": 0.4993329946876885,
      "learning_rate": 4.9312634665417454e-05,
      "loss": 1.9307,
      "num_input_tokens_seen": 6731568112,
      "step": 8556
    },
    {
      "epoch": 0.907808190112455,
      "grad_norm": 0.7162951836754005,
      "learning_rate": 4.931247281141803e-05,
      "loss": 1.831,
      "num_input_tokens_seen": 6732354880,
      "step": 8557
    },
    {
      "epoch": 0.9079142796520263,
      "grad_norm": 0.5881284624387951,
      "learning_rate": 4.931231093863063e-05,
      "loss": 1.9275,
      "num_input_tokens_seen": 6733141648,
      "step": 8558
    },
    {
      "epoch": 0.9080203691915977,
      "grad_norm": 0.6703190157211036,
      "learning_rate": 4.931214904705539e-05,
      "loss": 1.9754,
      "num_input_tokens_seen": 6733928384,
      "step": 8559
    },
    {
      "epoch": 0.9081264587311692,
      "grad_norm": 0.5285141124585762,
      "learning_rate": 4.931198713669244e-05,
      "loss": 1.9561,
      "num_input_tokens_seen": 6734715232,
      "step": 8560
    },
    {
      "epoch": 0.9082325482707405,
      "grad_norm": 1.0631553920166381,
      "learning_rate": 4.9311825207541896e-05,
      "loss": 1.9864,
      "num_input_tokens_seen": 6735502064,
      "step": 8561
    },
    {
      "epoch": 0.9083386378103119,
      "grad_norm": 0.5264430492025757,
      "learning_rate": 4.9311663259603885e-05,
      "loss": 2.0582,
      "num_input_tokens_seen": 6736288768,
      "step": 8562
    },
    {
      "epoch": 0.9084447273498834,
      "grad_norm": 1.11329744356458,
      "learning_rate": 4.9311501292878535e-05,
      "loss": 1.886,
      "num_input_tokens_seen": 6737075488,
      "step": 8563
    },
    {
      "epoch": 0.9085508168894547,
      "grad_norm": 0.6480098404513368,
      "learning_rate": 4.931133930736598e-05,
      "loss": 1.754,
      "num_input_tokens_seen": 6737862304,
      "step": 8564
    },
    {
      "epoch": 0.9086569064290261,
      "grad_norm": 1.4319026657205451,
      "learning_rate": 4.931117730306632e-05,
      "loss": 1.9988,
      "num_input_tokens_seen": 6738649056,
      "step": 8565
    },
    {
      "epoch": 0.9087629959685974,
      "grad_norm": 1.1576701527287245,
      "learning_rate": 4.93110152799797e-05,
      "loss": 1.8632,
      "num_input_tokens_seen": 6739435856,
      "step": 8566
    },
    {
      "epoch": 0.9088690855081689,
      "grad_norm": 1.795197330129041,
      "learning_rate": 4.931085323810625e-05,
      "loss": 1.9347,
      "num_input_tokens_seen": 6740222704,
      "step": 8567
    },
    {
      "epoch": 0.9089751750477403,
      "grad_norm": 1.2907667820235693,
      "learning_rate": 4.9310691177446075e-05,
      "loss": 1.9261,
      "num_input_tokens_seen": 6741009424,
      "step": 8568
    },
    {
      "epoch": 0.9090812645873116,
      "grad_norm": 0.6170588655337604,
      "learning_rate": 4.9310529097999314e-05,
      "loss": 2.0607,
      "num_input_tokens_seen": 6741796144,
      "step": 8569
    },
    {
      "epoch": 0.9091873541268831,
      "grad_norm": 1.0828790071597827,
      "learning_rate": 4.931036699976609e-05,
      "loss": 1.8522,
      "num_input_tokens_seen": 6742582960,
      "step": 8570
    },
    {
      "epoch": 0.9092934436664545,
      "grad_norm": 0.6198701688955045,
      "learning_rate": 4.931020488274653e-05,
      "loss": 1.9297,
      "num_input_tokens_seen": 6743369760,
      "step": 8571
    },
    {
      "epoch": 0.9093995332060258,
      "grad_norm": 0.5854509253593457,
      "learning_rate": 4.931004274694075e-05,
      "loss": 1.9763,
      "num_input_tokens_seen": 6744156560,
      "step": 8572
    },
    {
      "epoch": 0.9095056227455973,
      "grad_norm": 0.842379172584184,
      "learning_rate": 4.9309880592348896e-05,
      "loss": 1.9993,
      "num_input_tokens_seen": 6744943328,
      "step": 8573
    },
    {
      "epoch": 0.9096117122851687,
      "grad_norm": 0.49398982016089094,
      "learning_rate": 4.930971841897107e-05,
      "loss": 1.8804,
      "num_input_tokens_seen": 6745730048,
      "step": 8574
    },
    {
      "epoch": 0.90971780182474,
      "grad_norm": 0.5925924460104289,
      "learning_rate": 4.930955622680741e-05,
      "loss": 1.8135,
      "num_input_tokens_seen": 6746516832,
      "step": 8575
    },
    {
      "epoch": 0.9098238913643115,
      "grad_norm": 0.49464744416003986,
      "learning_rate": 4.930939401585803e-05,
      "loss": 1.8776,
      "num_input_tokens_seen": 6747303648,
      "step": 8576
    },
    {
      "epoch": 0.9099299809038829,
      "grad_norm": 0.5098667733528641,
      "learning_rate": 4.930923178612307e-05,
      "loss": 1.9831,
      "num_input_tokens_seen": 6748090384,
      "step": 8577
    },
    {
      "epoch": 0.9100360704434542,
      "grad_norm": 0.525973367171763,
      "learning_rate": 4.930906953760265e-05,
      "loss": 1.9894,
      "num_input_tokens_seen": 6748877232,
      "step": 8578
    },
    {
      "epoch": 0.9101421599830257,
      "grad_norm": 0.4812053069422044,
      "learning_rate": 4.93089072702969e-05,
      "loss": 1.9253,
      "num_input_tokens_seen": 6749663872,
      "step": 8579
    },
    {
      "epoch": 0.9102482495225971,
      "grad_norm": 0.5169714286236098,
      "learning_rate": 4.9308744984205926e-05,
      "loss": 1.8705,
      "num_input_tokens_seen": 6750450640,
      "step": 8580
    },
    {
      "epoch": 0.9103543390621684,
      "grad_norm": 0.7857723427547613,
      "learning_rate": 4.930858267932987e-05,
      "loss": 2.0228,
      "num_input_tokens_seen": 6751237376,
      "step": 8581
    },
    {
      "epoch": 0.9104604286017399,
      "grad_norm": 0.7779160140007503,
      "learning_rate": 4.930842035566887e-05,
      "loss": 1.8259,
      "num_input_tokens_seen": 6752024064,
      "step": 8582
    },
    {
      "epoch": 0.9105665181413113,
      "grad_norm": 0.39242499568862843,
      "learning_rate": 4.930825801322302e-05,
      "loss": 1.8402,
      "num_input_tokens_seen": 6752810896,
      "step": 8583
    },
    {
      "epoch": 0.9106726076808827,
      "grad_norm": 0.5400435559971289,
      "learning_rate": 4.930809565199247e-05,
      "loss": 1.87,
      "num_input_tokens_seen": 6753597664,
      "step": 8584
    },
    {
      "epoch": 0.910778697220454,
      "grad_norm": 0.5459303695352528,
      "learning_rate": 4.930793327197733e-05,
      "loss": 1.8541,
      "num_input_tokens_seen": 6754384432,
      "step": 8585
    },
    {
      "epoch": 0.9108847867600255,
      "grad_norm": 0.4742432823744224,
      "learning_rate": 4.930777087317773e-05,
      "loss": 1.9703,
      "num_input_tokens_seen": 6755171152,
      "step": 8586
    },
    {
      "epoch": 0.9109908762995969,
      "grad_norm": 0.5449488912638223,
      "learning_rate": 4.9307608455593805e-05,
      "loss": 2.0023,
      "num_input_tokens_seen": 6755957808,
      "step": 8587
    },
    {
      "epoch": 0.9110969658391682,
      "grad_norm": 0.49566128074148813,
      "learning_rate": 4.930744601922568e-05,
      "loss": 1.9451,
      "num_input_tokens_seen": 6756744528,
      "step": 8588
    },
    {
      "epoch": 0.9112030553787397,
      "grad_norm": 0.6965990509804633,
      "learning_rate": 4.930728356407346e-05,
      "loss": 1.7342,
      "num_input_tokens_seen": 6757531216,
      "step": 8589
    },
    {
      "epoch": 0.911309144918311,
      "grad_norm": 0.5510874280729662,
      "learning_rate": 4.930712109013729e-05,
      "loss": 1.9771,
      "num_input_tokens_seen": 6758317968,
      "step": 8590
    },
    {
      "epoch": 0.9114152344578824,
      "grad_norm": 0.7181139453860202,
      "learning_rate": 4.930695859741729e-05,
      "loss": 1.8939,
      "num_input_tokens_seen": 6759104752,
      "step": 8591
    },
    {
      "epoch": 0.9115213239974539,
      "grad_norm": 0.6772686706759039,
      "learning_rate": 4.9306796085913586e-05,
      "loss": 1.8558,
      "num_input_tokens_seen": 6759891472,
      "step": 8592
    },
    {
      "epoch": 0.9116274135370253,
      "grad_norm": 0.7081609261201103,
      "learning_rate": 4.93066335556263e-05,
      "loss": 1.9815,
      "num_input_tokens_seen": 6760678208,
      "step": 8593
    },
    {
      "epoch": 0.9117335030765966,
      "grad_norm": 0.5981668208349223,
      "learning_rate": 4.930647100655557e-05,
      "loss": 1.9583,
      "num_input_tokens_seen": 6761464896,
      "step": 8594
    },
    {
      "epoch": 0.9118395926161681,
      "grad_norm": 0.4942739203085361,
      "learning_rate": 4.9306308438701505e-05,
      "loss": 1.7617,
      "num_input_tokens_seen": 6762251856,
      "step": 8595
    },
    {
      "epoch": 0.9119456821557395,
      "grad_norm": 0.7230574521070037,
      "learning_rate": 4.930614585206424e-05,
      "loss": 1.7798,
      "num_input_tokens_seen": 6763038608,
      "step": 8596
    },
    {
      "epoch": 0.9120517716953108,
      "grad_norm": 0.7783320432093132,
      "learning_rate": 4.93059832466439e-05,
      "loss": 1.8771,
      "num_input_tokens_seen": 6763825328,
      "step": 8597
    },
    {
      "epoch": 0.9121578612348823,
      "grad_norm": 0.5212302582121073,
      "learning_rate": 4.93058206224406e-05,
      "loss": 1.9146,
      "num_input_tokens_seen": 6764612144,
      "step": 8598
    },
    {
      "epoch": 0.9122639507744537,
      "grad_norm": 0.5119743030153814,
      "learning_rate": 4.930565797945449e-05,
      "loss": 1.9458,
      "num_input_tokens_seen": 6765398864,
      "step": 8599
    },
    {
      "epoch": 0.912370040314025,
      "grad_norm": 1.219977854908942,
      "learning_rate": 4.930549531768567e-05,
      "loss": 1.9385,
      "num_input_tokens_seen": 6766185616,
      "step": 8600
    },
    {
      "epoch": 0.9124761298535964,
      "grad_norm": 0.4766433063286043,
      "learning_rate": 4.930533263713428e-05,
      "loss": 1.9801,
      "num_input_tokens_seen": 6766972448,
      "step": 8601
    },
    {
      "epoch": 0.9125822193931679,
      "grad_norm": 0.9839950986501717,
      "learning_rate": 4.930516993780044e-05,
      "loss": 1.8802,
      "num_input_tokens_seen": 6767759136,
      "step": 8602
    },
    {
      "epoch": 0.9126883089327392,
      "grad_norm": 0.4696507237851986,
      "learning_rate": 4.930500721968427e-05,
      "loss": 1.7718,
      "num_input_tokens_seen": 6768545936,
      "step": 8603
    },
    {
      "epoch": 0.9127943984723106,
      "grad_norm": 0.7768300767672143,
      "learning_rate": 4.930484448278592e-05,
      "loss": 1.9139,
      "num_input_tokens_seen": 6769332720,
      "step": 8604
    },
    {
      "epoch": 0.9129004880118821,
      "grad_norm": 0.5016900002580915,
      "learning_rate": 4.930468172710549e-05,
      "loss": 1.8133,
      "num_input_tokens_seen": 6770119504,
      "step": 8605
    },
    {
      "epoch": 0.9130065775514534,
      "grad_norm": 0.9485499749707754,
      "learning_rate": 4.930451895264312e-05,
      "loss": 2.0691,
      "num_input_tokens_seen": 6770906288,
      "step": 8606
    },
    {
      "epoch": 0.9131126670910248,
      "grad_norm": 1.050796523239122,
      "learning_rate": 4.930435615939893e-05,
      "loss": 1.8336,
      "num_input_tokens_seen": 6771693104,
      "step": 8607
    },
    {
      "epoch": 0.9132187566305963,
      "grad_norm": 1.1774180931686122,
      "learning_rate": 4.930419334737304e-05,
      "loss": 1.9293,
      "num_input_tokens_seen": 6772479952,
      "step": 8608
    },
    {
      "epoch": 0.9133248461701676,
      "grad_norm": 1.309581020754098,
      "learning_rate": 4.9304030516565594e-05,
      "loss": 1.8512,
      "num_input_tokens_seen": 6773266736,
      "step": 8609
    },
    {
      "epoch": 0.913430935709739,
      "grad_norm": 1.456432509104537,
      "learning_rate": 4.930386766697669e-05,
      "loss": 1.9693,
      "num_input_tokens_seen": 6774053488,
      "step": 8610
    },
    {
      "epoch": 0.9135370252493105,
      "grad_norm": 1.2884253897939757,
      "learning_rate": 4.9303704798606486e-05,
      "loss": 1.9379,
      "num_input_tokens_seen": 6774840304,
      "step": 8611
    },
    {
      "epoch": 0.9136431147888818,
      "grad_norm": 1.5139481952192009,
      "learning_rate": 4.930354191145509e-05,
      "loss": 1.9243,
      "num_input_tokens_seen": 6775627136,
      "step": 8612
    },
    {
      "epoch": 0.9137492043284532,
      "grad_norm": 0.6545388623596973,
      "learning_rate": 4.930337900552262e-05,
      "loss": 1.8552,
      "num_input_tokens_seen": 6776413888,
      "step": 8613
    },
    {
      "epoch": 0.9138552938680247,
      "grad_norm": 1.2900569066437486,
      "learning_rate": 4.930321608080922e-05,
      "loss": 1.8541,
      "num_input_tokens_seen": 6777200704,
      "step": 8614
    },
    {
      "epoch": 0.913961383407596,
      "grad_norm": 0.579445266470654,
      "learning_rate": 4.9303053137315e-05,
      "loss": 1.9203,
      "num_input_tokens_seen": 6777987472,
      "step": 8615
    },
    {
      "epoch": 0.9140674729471674,
      "grad_norm": 1.132838923145391,
      "learning_rate": 4.930289017504011e-05,
      "loss": 1.9206,
      "num_input_tokens_seen": 6778774192,
      "step": 8616
    },
    {
      "epoch": 0.9141735624867388,
      "grad_norm": 0.6698733254735516,
      "learning_rate": 4.9302727193984645e-05,
      "loss": 2.0014,
      "num_input_tokens_seen": 6779560992,
      "step": 8617
    },
    {
      "epoch": 0.9142796520263102,
      "grad_norm": 0.6868467438707803,
      "learning_rate": 4.9302564194148747e-05,
      "loss": 1.9485,
      "num_input_tokens_seen": 6780347648,
      "step": 8618
    },
    {
      "epoch": 0.9143857415658816,
      "grad_norm": 1.000514427498555,
      "learning_rate": 4.930240117553254e-05,
      "loss": 1.9939,
      "num_input_tokens_seen": 6781134416,
      "step": 8619
    },
    {
      "epoch": 0.914491831105453,
      "grad_norm": 0.613690615620828,
      "learning_rate": 4.930223813813615e-05,
      "loss": 1.9759,
      "num_input_tokens_seen": 6781921120,
      "step": 8620
    },
    {
      "epoch": 0.9145979206450244,
      "grad_norm": 0.6468057765836689,
      "learning_rate": 4.930207508195971e-05,
      "loss": 2.0967,
      "num_input_tokens_seen": 6782707872,
      "step": 8621
    },
    {
      "epoch": 0.9147040101845958,
      "grad_norm": 0.5129693677722927,
      "learning_rate": 4.930191200700334e-05,
      "loss": 1.7533,
      "num_input_tokens_seen": 6783494608,
      "step": 8622
    },
    {
      "epoch": 0.9148100997241672,
      "grad_norm": 0.48330926253289397,
      "learning_rate": 4.930174891326716e-05,
      "loss": 1.8575,
      "num_input_tokens_seen": 6784281408,
      "step": 8623
    },
    {
      "epoch": 0.9149161892637386,
      "grad_norm": 0.8560511561687845,
      "learning_rate": 4.93015858007513e-05,
      "loss": 1.9816,
      "num_input_tokens_seen": 6785068224,
      "step": 8624
    },
    {
      "epoch": 0.91502227880331,
      "grad_norm": 0.6097809609245121,
      "learning_rate": 4.930142266945589e-05,
      "loss": 1.9974,
      "num_input_tokens_seen": 6785855104,
      "step": 8625
    },
    {
      "epoch": 0.9151283683428814,
      "grad_norm": 0.7934809846828137,
      "learning_rate": 4.930125951938106e-05,
      "loss": 2.0645,
      "num_input_tokens_seen": 6786641760,
      "step": 8626
    },
    {
      "epoch": 0.9152344578824528,
      "grad_norm": 0.7056120278335573,
      "learning_rate": 4.930109635052692e-05,
      "loss": 1.8814,
      "num_input_tokens_seen": 6787428464,
      "step": 8627
    },
    {
      "epoch": 0.9153405474220242,
      "grad_norm": 0.9792782971526542,
      "learning_rate": 4.93009331628936e-05,
      "loss": 1.77,
      "num_input_tokens_seen": 6788215152,
      "step": 8628
    },
    {
      "epoch": 0.9154466369615956,
      "grad_norm": 3.2403429281055085,
      "learning_rate": 4.9300769956481255e-05,
      "loss": 2.0883,
      "num_input_tokens_seen": 6789001936,
      "step": 8629
    },
    {
      "epoch": 0.915552726501167,
      "grad_norm": 1.4629254134359586,
      "learning_rate": 4.9300606731289964e-05,
      "loss": 1.8656,
      "num_input_tokens_seen": 6789788736,
      "step": 8630
    },
    {
      "epoch": 0.9156588160407384,
      "grad_norm": 0.7932060943332576,
      "learning_rate": 4.930044348731989e-05,
      "loss": 1.8588,
      "num_input_tokens_seen": 6790575424,
      "step": 8631
    },
    {
      "epoch": 0.9157649055803098,
      "grad_norm": 0.9496945529492574,
      "learning_rate": 4.9300280224571147e-05,
      "loss": 1.8534,
      "num_input_tokens_seen": 6791362208,
      "step": 8632
    },
    {
      "epoch": 0.9158709951198811,
      "grad_norm": 1.3858522032983194,
      "learning_rate": 4.930011694304386e-05,
      "loss": 2.0126,
      "num_input_tokens_seen": 6792148944,
      "step": 8633
    },
    {
      "epoch": 0.9159770846594526,
      "grad_norm": 0.5317514964296302,
      "learning_rate": 4.929995364273815e-05,
      "loss": 1.7252,
      "num_input_tokens_seen": 6792935760,
      "step": 8634
    },
    {
      "epoch": 0.916083174199024,
      "grad_norm": 0.43840880540303506,
      "learning_rate": 4.9299790323654147e-05,
      "loss": 1.844,
      "num_input_tokens_seen": 6793722592,
      "step": 8635
    },
    {
      "epoch": 0.9161892637385953,
      "grad_norm": 0.5480243890516726,
      "learning_rate": 4.929962698579198e-05,
      "loss": 1.9773,
      "num_input_tokens_seen": 6794509424,
      "step": 8636
    },
    {
      "epoch": 0.9162953532781668,
      "grad_norm": 0.41262450255689104,
      "learning_rate": 4.929946362915179e-05,
      "loss": 1.9554,
      "num_input_tokens_seen": 6795296224,
      "step": 8637
    },
    {
      "epoch": 0.9164014428177382,
      "grad_norm": 0.518037804030371,
      "learning_rate": 4.929930025373367e-05,
      "loss": 1.7459,
      "num_input_tokens_seen": 6796083024,
      "step": 8638
    },
    {
      "epoch": 0.9165075323573095,
      "grad_norm": 0.540730051492198,
      "learning_rate": 4.9299136859537765e-05,
      "loss": 2.0046,
      "num_input_tokens_seen": 6796869792,
      "step": 8639
    },
    {
      "epoch": 0.916613621896881,
      "grad_norm": 0.45875776755606457,
      "learning_rate": 4.929897344656421e-05,
      "loss": 1.944,
      "num_input_tokens_seen": 6797656560,
      "step": 8640
    },
    {
      "epoch": 0.9167197114364524,
      "grad_norm": 0.4489831792326981,
      "learning_rate": 4.929881001481311e-05,
      "loss": 1.8256,
      "num_input_tokens_seen": 6798443264,
      "step": 8641
    },
    {
      "epoch": 0.9168258009760237,
      "grad_norm": 0.5335318040219429,
      "learning_rate": 4.929864656428461e-05,
      "loss": 2.1226,
      "num_input_tokens_seen": 6799229968,
      "step": 8642
    },
    {
      "epoch": 0.9169318905155952,
      "grad_norm": 0.3981137855753658,
      "learning_rate": 4.929848309497883e-05,
      "loss": 1.8443,
      "num_input_tokens_seen": 6800016800,
      "step": 8643
    },
    {
      "epoch": 0.9170379800551666,
      "grad_norm": 0.4869049687663634,
      "learning_rate": 4.9298319606895895e-05,
      "loss": 2.0054,
      "num_input_tokens_seen": 6800803632,
      "step": 8644
    },
    {
      "epoch": 0.9171440695947379,
      "grad_norm": 0.4080461534241651,
      "learning_rate": 4.929815610003592e-05,
      "loss": 1.975,
      "num_input_tokens_seen": 6801590416,
      "step": 8645
    },
    {
      "epoch": 0.9172501591343094,
      "grad_norm": 0.3723512011781108,
      "learning_rate": 4.9297992574399055e-05,
      "loss": 1.9385,
      "num_input_tokens_seen": 6802377152,
      "step": 8646
    },
    {
      "epoch": 0.9173562486738808,
      "grad_norm": 0.38230117818244114,
      "learning_rate": 4.929782902998541e-05,
      "loss": 1.8931,
      "num_input_tokens_seen": 6803163952,
      "step": 8647
    },
    {
      "epoch": 0.9174623382134521,
      "grad_norm": 0.42611021747813216,
      "learning_rate": 4.929766546679512e-05,
      "loss": 1.8688,
      "num_input_tokens_seen": 6803950848,
      "step": 8648
    },
    {
      "epoch": 0.9175684277530235,
      "grad_norm": 0.4025350804736666,
      "learning_rate": 4.92975018848283e-05,
      "loss": 1.7964,
      "num_input_tokens_seen": 6804737712,
      "step": 8649
    },
    {
      "epoch": 0.917674517292595,
      "grad_norm": 0.4627699884798686,
      "learning_rate": 4.929733828408509e-05,
      "loss": 1.8761,
      "num_input_tokens_seen": 6805524464,
      "step": 8650
    },
    {
      "epoch": 0.9177806068321663,
      "grad_norm": 0.5534531172728361,
      "learning_rate": 4.9297174664565606e-05,
      "loss": 1.9523,
      "num_input_tokens_seen": 6806311168,
      "step": 8651
    },
    {
      "epoch": 0.9178866963717377,
      "grad_norm": 0.6376415460931681,
      "learning_rate": 4.929701102626998e-05,
      "loss": 1.9619,
      "num_input_tokens_seen": 6807097872,
      "step": 8652
    },
    {
      "epoch": 0.9179927859113092,
      "grad_norm": 0.6351847020176937,
      "learning_rate": 4.929684736919833e-05,
      "loss": 2.058,
      "num_input_tokens_seen": 6807884688,
      "step": 8653
    },
    {
      "epoch": 0.9180988754508805,
      "grad_norm": 0.6108463476768882,
      "learning_rate": 4.92966836933508e-05,
      "loss": 1.9394,
      "num_input_tokens_seen": 6808671472,
      "step": 8654
    },
    {
      "epoch": 0.9182049649904519,
      "grad_norm": 0.7070588950487643,
      "learning_rate": 4.9296519998727505e-05,
      "loss": 1.7093,
      "num_input_tokens_seen": 6809458320,
      "step": 8655
    },
    {
      "epoch": 0.9183110545300234,
      "grad_norm": 0.45045381383449346,
      "learning_rate": 4.929635628532857e-05,
      "loss": 1.8419,
      "num_input_tokens_seen": 6810245136,
      "step": 8656
    },
    {
      "epoch": 0.9184171440695947,
      "grad_norm": 0.85860411657214,
      "learning_rate": 4.9296192553154116e-05,
      "loss": 1.8516,
      "num_input_tokens_seen": 6811031824,
      "step": 8657
    },
    {
      "epoch": 0.9185232336091661,
      "grad_norm": 0.37289126907438813,
      "learning_rate": 4.9296028802204284e-05,
      "loss": 1.7159,
      "num_input_tokens_seen": 6811818640,
      "step": 8658
    },
    {
      "epoch": 0.9186293231487376,
      "grad_norm": 1.0546867406901312,
      "learning_rate": 4.9295865032479195e-05,
      "loss": 1.8848,
      "num_input_tokens_seen": 6812605504,
      "step": 8659
    },
    {
      "epoch": 0.9187354126883089,
      "grad_norm": 0.42769170147063973,
      "learning_rate": 4.9295701243978976e-05,
      "loss": 1.9882,
      "num_input_tokens_seen": 6813392224,
      "step": 8660
    },
    {
      "epoch": 0.9188415022278803,
      "grad_norm": 1.2309181879289486,
      "learning_rate": 4.9295537436703744e-05,
      "loss": 1.9176,
      "num_input_tokens_seen": 6814179008,
      "step": 8661
    },
    {
      "epoch": 0.9189475917674518,
      "grad_norm": 0.3891820636844596,
      "learning_rate": 4.929537361065364e-05,
      "loss": 1.9132,
      "num_input_tokens_seen": 6814965792,
      "step": 8662
    },
    {
      "epoch": 0.9190536813070231,
      "grad_norm": 0.935970661271091,
      "learning_rate": 4.929520976582878e-05,
      "loss": 1.8083,
      "num_input_tokens_seen": 6815752608,
      "step": 8663
    },
    {
      "epoch": 0.9191597708465945,
      "grad_norm": 0.5311023919842724,
      "learning_rate": 4.92950459022293e-05,
      "loss": 1.9389,
      "num_input_tokens_seen": 6816539376,
      "step": 8664
    },
    {
      "epoch": 0.919265860386166,
      "grad_norm": 0.8336993950147333,
      "learning_rate": 4.929488201985532e-05,
      "loss": 1.9387,
      "num_input_tokens_seen": 6817326096,
      "step": 8665
    },
    {
      "epoch": 0.9193719499257373,
      "grad_norm": 0.7953732818711741,
      "learning_rate": 4.929471811870696e-05,
      "loss": 1.9016,
      "num_input_tokens_seen": 6818112944,
      "step": 8666
    },
    {
      "epoch": 0.9194780394653087,
      "grad_norm": 0.7598020162243363,
      "learning_rate": 4.9294554198784363e-05,
      "loss": 1.8712,
      "num_input_tokens_seen": 6818899680,
      "step": 8667
    },
    {
      "epoch": 0.9195841290048801,
      "grad_norm": 0.7294599747644674,
      "learning_rate": 4.9294390260087646e-05,
      "loss": 1.8578,
      "num_input_tokens_seen": 6819686448,
      "step": 8668
    },
    {
      "epoch": 0.9196902185444515,
      "grad_norm": 0.46608493673720786,
      "learning_rate": 4.9294226302616945e-05,
      "loss": 1.8912,
      "num_input_tokens_seen": 6820473200,
      "step": 8669
    },
    {
      "epoch": 0.9197963080840229,
      "grad_norm": 0.6007694699963909,
      "learning_rate": 4.929406232637236e-05,
      "loss": 2.0007,
      "num_input_tokens_seen": 6821259904,
      "step": 8670
    },
    {
      "epoch": 0.9199023976235943,
      "grad_norm": 0.47502298368097806,
      "learning_rate": 4.929389833135405e-05,
      "loss": 1.9782,
      "num_input_tokens_seen": 6822046720,
      "step": 8671
    },
    {
      "epoch": 0.9200084871631657,
      "grad_norm": 0.5052871532023699,
      "learning_rate": 4.9293734317562123e-05,
      "loss": 1.9417,
      "num_input_tokens_seen": 6822833488,
      "step": 8672
    },
    {
      "epoch": 0.9201145767027371,
      "grad_norm": 0.5162343758564786,
      "learning_rate": 4.929357028499671e-05,
      "loss": 1.8896,
      "num_input_tokens_seen": 6823620240,
      "step": 8673
    },
    {
      "epoch": 0.9202206662423085,
      "grad_norm": 0.4305859164456851,
      "learning_rate": 4.929340623365794e-05,
      "loss": 1.8513,
      "num_input_tokens_seen": 6824407024,
      "step": 8674
    },
    {
      "epoch": 0.92032675578188,
      "grad_norm": 0.5990997986810576,
      "learning_rate": 4.929324216354595e-05,
      "loss": 1.8366,
      "num_input_tokens_seen": 6825193808,
      "step": 8675
    },
    {
      "epoch": 0.9204328453214513,
      "grad_norm": 0.4338725878901179,
      "learning_rate": 4.929307807466084e-05,
      "loss": 2.082,
      "num_input_tokens_seen": 6825980544,
      "step": 8676
    },
    {
      "epoch": 0.9205389348610227,
      "grad_norm": 0.4538377500456706,
      "learning_rate": 4.929291396700276e-05,
      "loss": 1.8011,
      "num_input_tokens_seen": 6826767344,
      "step": 8677
    },
    {
      "epoch": 0.9206450244005941,
      "grad_norm": 0.556507667927705,
      "learning_rate": 4.929274984057183e-05,
      "loss": 1.9705,
      "num_input_tokens_seen": 6827554032,
      "step": 8678
    },
    {
      "epoch": 0.9207511139401655,
      "grad_norm": 0.6021959421620908,
      "learning_rate": 4.929258569536816e-05,
      "loss": 1.8685,
      "num_input_tokens_seen": 6828340816,
      "step": 8679
    },
    {
      "epoch": 0.9208572034797369,
      "grad_norm": 0.41149936217940175,
      "learning_rate": 4.929242153139191e-05,
      "loss": 1.92,
      "num_input_tokens_seen": 6829127680,
      "step": 8680
    },
    {
      "epoch": 0.9209632930193083,
      "grad_norm": 0.5913613629458971,
      "learning_rate": 4.929225734864319e-05,
      "loss": 1.7893,
      "num_input_tokens_seen": 6829914592,
      "step": 8681
    },
    {
      "epoch": 0.9210693825588797,
      "grad_norm": 0.4695413953744043,
      "learning_rate": 4.929209314712212e-05,
      "loss": 2.1271,
      "num_input_tokens_seen": 6830701360,
      "step": 8682
    },
    {
      "epoch": 0.9211754720984511,
      "grad_norm": 0.4800302661233043,
      "learning_rate": 4.9291928926828836e-05,
      "loss": 1.9813,
      "num_input_tokens_seen": 6831488064,
      "step": 8683
    },
    {
      "epoch": 0.9212815616380224,
      "grad_norm": 0.5629246453616625,
      "learning_rate": 4.9291764687763454e-05,
      "loss": 1.9102,
      "num_input_tokens_seen": 6832274816,
      "step": 8684
    },
    {
      "epoch": 0.9213876511775939,
      "grad_norm": 0.6114606190022853,
      "learning_rate": 4.9291600429926115e-05,
      "loss": 1.966,
      "num_input_tokens_seen": 6833061616,
      "step": 8685
    },
    {
      "epoch": 0.9214937407171653,
      "grad_norm": 0.4689621568723635,
      "learning_rate": 4.929143615331694e-05,
      "loss": 1.8536,
      "num_input_tokens_seen": 6833848384,
      "step": 8686
    },
    {
      "epoch": 0.9215998302567366,
      "grad_norm": 0.5792874840554146,
      "learning_rate": 4.929127185793606e-05,
      "loss": 1.9611,
      "num_input_tokens_seen": 6834635152,
      "step": 8687
    },
    {
      "epoch": 0.9217059197963081,
      "grad_norm": 0.43706501776039947,
      "learning_rate": 4.929110754378359e-05,
      "loss": 2.0277,
      "num_input_tokens_seen": 6835421984,
      "step": 8688
    },
    {
      "epoch": 0.9218120093358795,
      "grad_norm": 0.5550759728175361,
      "learning_rate": 4.929094321085966e-05,
      "loss": 1.982,
      "num_input_tokens_seen": 6836208640,
      "step": 8689
    },
    {
      "epoch": 0.9219180988754508,
      "grad_norm": 0.5079219982463851,
      "learning_rate": 4.9290778859164416e-05,
      "loss": 1.8777,
      "num_input_tokens_seen": 6836995488,
      "step": 8690
    },
    {
      "epoch": 0.9220241884150223,
      "grad_norm": 1.0971482544676712,
      "learning_rate": 4.929061448869796e-05,
      "loss": 1.9145,
      "num_input_tokens_seen": 6837782208,
      "step": 8691
    },
    {
      "epoch": 0.9221302779545937,
      "grad_norm": 1.4986918791516857,
      "learning_rate": 4.929045009946044e-05,
      "loss": 1.9802,
      "num_input_tokens_seen": 6838568960,
      "step": 8692
    },
    {
      "epoch": 0.922236367494165,
      "grad_norm": 1.6420017000558715,
      "learning_rate": 4.9290285691451965e-05,
      "loss": 1.9322,
      "num_input_tokens_seen": 6839355648,
      "step": 8693
    },
    {
      "epoch": 0.9223424570337365,
      "grad_norm": 1.0751335986994253,
      "learning_rate": 4.929012126467267e-05,
      "loss": 1.9665,
      "num_input_tokens_seen": 6840142352,
      "step": 8694
    },
    {
      "epoch": 0.9224485465733079,
      "grad_norm": 0.8220443068382215,
      "learning_rate": 4.928995681912269e-05,
      "loss": 1.8515,
      "num_input_tokens_seen": 6840929056,
      "step": 8695
    },
    {
      "epoch": 0.9225546361128792,
      "grad_norm": 0.6928460892153603,
      "learning_rate": 4.928979235480214e-05,
      "loss": 1.85,
      "num_input_tokens_seen": 6841715776,
      "step": 8696
    },
    {
      "epoch": 0.9226607256524507,
      "grad_norm": 0.487722577965863,
      "learning_rate": 4.928962787171115e-05,
      "loss": 1.9873,
      "num_input_tokens_seen": 6842502576,
      "step": 8697
    },
    {
      "epoch": 0.9227668151920221,
      "grad_norm": 0.7444657161004989,
      "learning_rate": 4.9289463369849843e-05,
      "loss": 1.9509,
      "num_input_tokens_seen": 6843289328,
      "step": 8698
    },
    {
      "epoch": 0.9228729047315934,
      "grad_norm": 0.44663200048708157,
      "learning_rate": 4.928929884921836e-05,
      "loss": 1.9114,
      "num_input_tokens_seen": 6844076128,
      "step": 8699
    },
    {
      "epoch": 0.9229789942711648,
      "grad_norm": 0.5465023537007156,
      "learning_rate": 4.928913430981682e-05,
      "loss": 1.8297,
      "num_input_tokens_seen": 6844862928,
      "step": 8700
    },
    {
      "epoch": 0.9230850838107363,
      "grad_norm": 0.5680776199191854,
      "learning_rate": 4.928896975164534e-05,
      "loss": 1.8851,
      "num_input_tokens_seen": 6845649664,
      "step": 8701
    },
    {
      "epoch": 0.9231911733503076,
      "grad_norm": 0.38070168404206645,
      "learning_rate": 4.9288805174704064e-05,
      "loss": 1.7384,
      "num_input_tokens_seen": 6846436528,
      "step": 8702
    },
    {
      "epoch": 0.923297262889879,
      "grad_norm": 0.5056455540893342,
      "learning_rate": 4.928864057899311e-05,
      "loss": 1.8779,
      "num_input_tokens_seen": 6847223264,
      "step": 8703
    },
    {
      "epoch": 0.9234033524294505,
      "grad_norm": 0.5653150432495793,
      "learning_rate": 4.92884759645126e-05,
      "loss": 1.7904,
      "num_input_tokens_seen": 6848010064,
      "step": 8704
    },
    {
      "epoch": 0.9235094419690218,
      "grad_norm": 0.445237298350823,
      "learning_rate": 4.9288311331262684e-05,
      "loss": 1.9687,
      "num_input_tokens_seen": 6848796832,
      "step": 8705
    },
    {
      "epoch": 0.9236155315085932,
      "grad_norm": 0.42786000816595876,
      "learning_rate": 4.9288146679243465e-05,
      "loss": 1.8833,
      "num_input_tokens_seen": 6849583504,
      "step": 8706
    },
    {
      "epoch": 0.9237216210481647,
      "grad_norm": 0.6222381522763174,
      "learning_rate": 4.928798200845508e-05,
      "loss": 1.9323,
      "num_input_tokens_seen": 6850370256,
      "step": 8707
    },
    {
      "epoch": 0.923827710587736,
      "grad_norm": 0.4607079418865591,
      "learning_rate": 4.928781731889766e-05,
      "loss": 1.8813,
      "num_input_tokens_seen": 6851157040,
      "step": 8708
    },
    {
      "epoch": 0.9239338001273074,
      "grad_norm": 0.660320913410241,
      "learning_rate": 4.9287652610571314e-05,
      "loss": 1.965,
      "num_input_tokens_seen": 6851943808,
      "step": 8709
    },
    {
      "epoch": 0.9240398896668789,
      "grad_norm": 0.6332235089465321,
      "learning_rate": 4.928748788347619e-05,
      "loss": 2.0821,
      "num_input_tokens_seen": 6852730560,
      "step": 8710
    },
    {
      "epoch": 0.9241459792064503,
      "grad_norm": 0.8125950106465826,
      "learning_rate": 4.9287323137612416e-05,
      "loss": 1.9962,
      "num_input_tokens_seen": 6853517344,
      "step": 8711
    },
    {
      "epoch": 0.9242520687460216,
      "grad_norm": 0.5487859353417404,
      "learning_rate": 4.92871583729801e-05,
      "loss": 1.8852,
      "num_input_tokens_seen": 6854304144,
      "step": 8712
    },
    {
      "epoch": 0.9243581582855931,
      "grad_norm": 0.5414113387561948,
      "learning_rate": 4.928699358957939e-05,
      "loss": 1.9015,
      "num_input_tokens_seen": 6855090816,
      "step": 8713
    },
    {
      "epoch": 0.9244642478251645,
      "grad_norm": 0.4779208339754191,
      "learning_rate": 4.92868287874104e-05,
      "loss": 1.877,
      "num_input_tokens_seen": 6855877552,
      "step": 8714
    },
    {
      "epoch": 0.9245703373647358,
      "grad_norm": 0.513335240402495,
      "learning_rate": 4.9286663966473255e-05,
      "loss": 1.8598,
      "num_input_tokens_seen": 6856664304,
      "step": 8715
    },
    {
      "epoch": 0.9246764269043072,
      "grad_norm": 0.7126294580066269,
      "learning_rate": 4.928649912676809e-05,
      "loss": 1.8631,
      "num_input_tokens_seen": 6857451120,
      "step": 8716
    },
    {
      "epoch": 0.9247825164438787,
      "grad_norm": 0.7673250975568748,
      "learning_rate": 4.9286334268295046e-05,
      "loss": 2.0388,
      "num_input_tokens_seen": 6858237792,
      "step": 8717
    },
    {
      "epoch": 0.92488860598345,
      "grad_norm": 1.3433951398966808,
      "learning_rate": 4.928616939105422e-05,
      "loss": 1.8289,
      "num_input_tokens_seen": 6859024688,
      "step": 8718
    },
    {
      "epoch": 0.9249946955230214,
      "grad_norm": 3.2723271778416105,
      "learning_rate": 4.9286004495045756e-05,
      "loss": 2.0298,
      "num_input_tokens_seen": 6859811472,
      "step": 8719
    },
    {
      "epoch": 0.9251007850625929,
      "grad_norm": 1.1665430206685807,
      "learning_rate": 4.928583958026979e-05,
      "loss": 1.952,
      "num_input_tokens_seen": 6860598320,
      "step": 8720
    },
    {
      "epoch": 0.9252068746021642,
      "grad_norm": 1.326700114816578,
      "learning_rate": 4.928567464672643e-05,
      "loss": 1.9097,
      "num_input_tokens_seen": 6861385040,
      "step": 8721
    },
    {
      "epoch": 0.9253129641417356,
      "grad_norm": 1.1890181452683737,
      "learning_rate": 4.9285509694415824e-05,
      "loss": 1.9996,
      "num_input_tokens_seen": 6862171792,
      "step": 8722
    },
    {
      "epoch": 0.9254190536813071,
      "grad_norm": 1.0256417524658097,
      "learning_rate": 4.928534472333808e-05,
      "loss": 1.9447,
      "num_input_tokens_seen": 6862958560,
      "step": 8723
    },
    {
      "epoch": 0.9255251432208784,
      "grad_norm": 1.3595129650983468,
      "learning_rate": 4.9285179733493334e-05,
      "loss": 2.1105,
      "num_input_tokens_seen": 6863745280,
      "step": 8724
    },
    {
      "epoch": 0.9256312327604498,
      "grad_norm": 0.6336669818887766,
      "learning_rate": 4.9285014724881714e-05,
      "loss": 2.1007,
      "num_input_tokens_seen": 6864532032,
      "step": 8725
    },
    {
      "epoch": 0.9257373223000213,
      "grad_norm": 0.9522786603809487,
      "learning_rate": 4.928484969750334e-05,
      "loss": 1.8087,
      "num_input_tokens_seen": 6865318784,
      "step": 8726
    },
    {
      "epoch": 0.9258434118395926,
      "grad_norm": 9.860373014585424,
      "learning_rate": 4.928468465135836e-05,
      "loss": 1.9931,
      "num_input_tokens_seen": 6866105616,
      "step": 8727
    },
    {
      "epoch": 0.925949501379164,
      "grad_norm": 6.312625010699523,
      "learning_rate": 4.9284519586446884e-05,
      "loss": 2.0132,
      "num_input_tokens_seen": 6866892352,
      "step": 8728
    },
    {
      "epoch": 0.9260555909187355,
      "grad_norm": 1.4234786362545362,
      "learning_rate": 4.928435450276905e-05,
      "loss": 1.9653,
      "num_input_tokens_seen": 6867679120,
      "step": 8729
    },
    {
      "epoch": 0.9261616804583068,
      "grad_norm": 1.4548596957593483,
      "learning_rate": 4.9284189400324964e-05,
      "loss": 1.9012,
      "num_input_tokens_seen": 6868465856,
      "step": 8730
    },
    {
      "epoch": 0.9262677699978782,
      "grad_norm": 0.7641676099877038,
      "learning_rate": 4.928402427911478e-05,
      "loss": 1.904,
      "num_input_tokens_seen": 6869252640,
      "step": 8731
    },
    {
      "epoch": 0.9263738595374497,
      "grad_norm": 2.2754248885713415,
      "learning_rate": 4.928385913913861e-05,
      "loss": 1.9321,
      "num_input_tokens_seen": 6870039408,
      "step": 8732
    },
    {
      "epoch": 0.926479949077021,
      "grad_norm": 3.4612493991961273,
      "learning_rate": 4.9283693980396595e-05,
      "loss": 1.8534,
      "num_input_tokens_seen": 6870826160,
      "step": 8733
    },
    {
      "epoch": 0.9265860386165924,
      "grad_norm": 0.9019409483262604,
      "learning_rate": 4.928352880288884e-05,
      "loss": 1.9472,
      "num_input_tokens_seen": 6871612880,
      "step": 8734
    },
    {
      "epoch": 0.9266921281561638,
      "grad_norm": 1.6706501918460508,
      "learning_rate": 4.9283363606615495e-05,
      "loss": 1.909,
      "num_input_tokens_seen": 6872399616,
      "step": 8735
    },
    {
      "epoch": 0.9267982176957352,
      "grad_norm": 1.7575366579543208,
      "learning_rate": 4.928319839157668e-05,
      "loss": 1.8927,
      "num_input_tokens_seen": 6873186368,
      "step": 8736
    },
    {
      "epoch": 0.9269043072353066,
      "grad_norm": 1.5208352023636567,
      "learning_rate": 4.9283033157772517e-05,
      "loss": 1.8606,
      "num_input_tokens_seen": 6873973184,
      "step": 8737
    },
    {
      "epoch": 0.927010396774878,
      "grad_norm": 1.4275947421625974,
      "learning_rate": 4.9282867905203143e-05,
      "loss": 1.9048,
      "num_input_tokens_seen": 6874759888,
      "step": 8738
    },
    {
      "epoch": 0.9271164863144494,
      "grad_norm": 4.662925368346286,
      "learning_rate": 4.9282702633868684e-05,
      "loss": 1.9835,
      "num_input_tokens_seen": 6875546640,
      "step": 8739
    },
    {
      "epoch": 0.9272225758540208,
      "grad_norm": 0.9870650717932423,
      "learning_rate": 4.928253734376925e-05,
      "loss": 1.8411,
      "num_input_tokens_seen": 6876333248,
      "step": 8740
    },
    {
      "epoch": 0.9273286653935922,
      "grad_norm": 0.7396114147210548,
      "learning_rate": 4.9282372034905e-05,
      "loss": 1.8243,
      "num_input_tokens_seen": 6877120048,
      "step": 8741
    },
    {
      "epoch": 0.9274347549331636,
      "grad_norm": 0.6739753102425534,
      "learning_rate": 4.928220670727604e-05,
      "loss": 1.8197,
      "num_input_tokens_seen": 6877906848,
      "step": 8742
    },
    {
      "epoch": 0.927540844472735,
      "grad_norm": 1.2721438200391852,
      "learning_rate": 4.92820413608825e-05,
      "loss": 1.8793,
      "num_input_tokens_seen": 6878693712,
      "step": 8743
    },
    {
      "epoch": 0.9276469340123064,
      "grad_norm": 0.9277652584000607,
      "learning_rate": 4.928187599572451e-05,
      "loss": 1.998,
      "num_input_tokens_seen": 6879480432,
      "step": 8744
    },
    {
      "epoch": 0.9277530235518778,
      "grad_norm": 28.36990643095563,
      "learning_rate": 4.928171061180221e-05,
      "loss": 2.7349,
      "num_input_tokens_seen": 6880267184,
      "step": 8745
    },
    {
      "epoch": 0.9278591130914492,
      "grad_norm": 1.402246574218506,
      "learning_rate": 4.9281545209115706e-05,
      "loss": 1.7604,
      "num_input_tokens_seen": 6881053952,
      "step": 8746
    },
    {
      "epoch": 0.9279652026310206,
      "grad_norm": 0.9221869489813337,
      "learning_rate": 4.928137978766514e-05,
      "loss": 1.9113,
      "num_input_tokens_seen": 6881840752,
      "step": 8747
    },
    {
      "epoch": 0.928071292170592,
      "grad_norm": 0.6099750548577229,
      "learning_rate": 4.9281214347450635e-05,
      "loss": 1.9277,
      "num_input_tokens_seen": 6882627536,
      "step": 8748
    },
    {
      "epoch": 0.9281773817101634,
      "grad_norm": 1.266863878287524,
      "learning_rate": 4.9281048888472316e-05,
      "loss": 2.011,
      "num_input_tokens_seen": 6883414224,
      "step": 8749
    },
    {
      "epoch": 0.9282834712497348,
      "grad_norm": 0.6617999435215184,
      "learning_rate": 4.928088341073032e-05,
      "loss": 1.9773,
      "num_input_tokens_seen": 6884200976,
      "step": 8750
    },
    {
      "epoch": 0.9283895607893061,
      "grad_norm": 0.571856272703509,
      "learning_rate": 4.9280717914224775e-05,
      "loss": 1.9002,
      "num_input_tokens_seen": 6884987824,
      "step": 8751
    },
    {
      "epoch": 0.9284956503288776,
      "grad_norm": 0.5301475318660007,
      "learning_rate": 4.928055239895579e-05,
      "loss": 1.8172,
      "num_input_tokens_seen": 6885774560,
      "step": 8752
    },
    {
      "epoch": 0.928601739868449,
      "grad_norm": 0.5963578462305116,
      "learning_rate": 4.928038686492351e-05,
      "loss": 1.773,
      "num_input_tokens_seen": 6886561280,
      "step": 8753
    },
    {
      "epoch": 0.9287078294080203,
      "grad_norm": 0.8413611641962153,
      "learning_rate": 4.928022131212807e-05,
      "loss": 1.963,
      "num_input_tokens_seen": 6887347984,
      "step": 8754
    },
    {
      "epoch": 0.9288139189475918,
      "grad_norm": 0.46985275670731097,
      "learning_rate": 4.928005574056958e-05,
      "loss": 1.8346,
      "num_input_tokens_seen": 6888134768,
      "step": 8755
    },
    {
      "epoch": 0.9289200084871632,
      "grad_norm": 0.784045574885844,
      "learning_rate": 4.9279890150248176e-05,
      "loss": 1.8469,
      "num_input_tokens_seen": 6888921488,
      "step": 8756
    },
    {
      "epoch": 0.9290260980267345,
      "grad_norm": 0.5013013105476014,
      "learning_rate": 4.9279724541163984e-05,
      "loss": 1.6854,
      "num_input_tokens_seen": 6889708320,
      "step": 8757
    },
    {
      "epoch": 0.929132187566306,
      "grad_norm": 0.5327078935233602,
      "learning_rate": 4.927955891331714e-05,
      "loss": 1.8708,
      "num_input_tokens_seen": 6890495072,
      "step": 8758
    },
    {
      "epoch": 0.9292382771058774,
      "grad_norm": 0.5575943245639416,
      "learning_rate": 4.927939326670775e-05,
      "loss": 1.9269,
      "num_input_tokens_seen": 6891281888,
      "step": 8759
    },
    {
      "epoch": 0.9293443666454487,
      "grad_norm": 0.6295408314162845,
      "learning_rate": 4.927922760133598e-05,
      "loss": 1.9845,
      "num_input_tokens_seen": 6892068720,
      "step": 8760
    },
    {
      "epoch": 0.9294504561850202,
      "grad_norm": 0.5023980078818184,
      "learning_rate": 4.9279061917201916e-05,
      "loss": 1.9327,
      "num_input_tokens_seen": 6892855488,
      "step": 8761
    },
    {
      "epoch": 0.9295565457245916,
      "grad_norm": 1.4334308177570894,
      "learning_rate": 4.9278896214305715e-05,
      "loss": 2.0842,
      "num_input_tokens_seen": 6893642224,
      "step": 8762
    },
    {
      "epoch": 0.9296626352641629,
      "grad_norm": 0.653061557477891,
      "learning_rate": 4.927873049264748e-05,
      "loss": 1.9037,
      "num_input_tokens_seen": 6894429120,
      "step": 8763
    },
    {
      "epoch": 0.9297687248037344,
      "grad_norm": 0.5428061266460286,
      "learning_rate": 4.9278564752227376e-05,
      "loss": 1.7729,
      "num_input_tokens_seen": 6895215968,
      "step": 8764
    },
    {
      "epoch": 0.9298748143433058,
      "grad_norm": 0.5390708063423751,
      "learning_rate": 4.9278398993045497e-05,
      "loss": 1.9648,
      "num_input_tokens_seen": 6896002720,
      "step": 8765
    },
    {
      "epoch": 0.9299809038828771,
      "grad_norm": 0.5779807835329246,
      "learning_rate": 4.9278233215101986e-05,
      "loss": 1.9137,
      "num_input_tokens_seen": 6896789440,
      "step": 8766
    },
    {
      "epoch": 0.9300869934224485,
      "grad_norm": 0.8121833798368335,
      "learning_rate": 4.927806741839697e-05,
      "loss": 2.0048,
      "num_input_tokens_seen": 6897576256,
      "step": 8767
    },
    {
      "epoch": 0.93019308296202,
      "grad_norm": 0.48951112144951886,
      "learning_rate": 4.9277901602930575e-05,
      "loss": 1.6884,
      "num_input_tokens_seen": 6898363120,
      "step": 8768
    },
    {
      "epoch": 0.9302991725015913,
      "grad_norm": 0.7062921514318131,
      "learning_rate": 4.927773576870293e-05,
      "loss": 1.882,
      "num_input_tokens_seen": 6899149904,
      "step": 8769
    },
    {
      "epoch": 0.9304052620411627,
      "grad_norm": 0.6526800750317739,
      "learning_rate": 4.927756991571416e-05,
      "loss": 1.8816,
      "num_input_tokens_seen": 6899936688,
      "step": 8770
    },
    {
      "epoch": 0.9305113515807342,
      "grad_norm": 0.9157270686557903,
      "learning_rate": 4.9277404043964406e-05,
      "loss": 1.9391,
      "num_input_tokens_seen": 6900723472,
      "step": 8771
    },
    {
      "epoch": 0.9306174411203055,
      "grad_norm": 0.5932273708478895,
      "learning_rate": 4.9277238153453775e-05,
      "loss": 1.8908,
      "num_input_tokens_seen": 6901510240,
      "step": 8772
    },
    {
      "epoch": 0.9307235306598769,
      "grad_norm": 0.7832026923206641,
      "learning_rate": 4.9277072244182414e-05,
      "loss": 1.8707,
      "num_input_tokens_seen": 6902297040,
      "step": 8773
    },
    {
      "epoch": 0.9308296201994484,
      "grad_norm": 0.4226697090699497,
      "learning_rate": 4.9276906316150445e-05,
      "loss": 1.77,
      "num_input_tokens_seen": 6903083824,
      "step": 8774
    },
    {
      "epoch": 0.9309357097390197,
      "grad_norm": 0.8928686286043966,
      "learning_rate": 4.9276740369357985e-05,
      "loss": 1.7762,
      "num_input_tokens_seen": 6903870672,
      "step": 8775
    },
    {
      "epoch": 0.9310417992785911,
      "grad_norm": 0.48054669550930607,
      "learning_rate": 4.927657440380519e-05,
      "loss": 2.0023,
      "num_input_tokens_seen": 6904657376,
      "step": 8776
    },
    {
      "epoch": 0.9311478888181626,
      "grad_norm": 0.8198630027807723,
      "learning_rate": 4.927640841949216e-05,
      "loss": 1.9844,
      "num_input_tokens_seen": 6905444224,
      "step": 8777
    },
    {
      "epoch": 0.9312539783577339,
      "grad_norm": 0.45940439488114254,
      "learning_rate": 4.9276242416419024e-05,
      "loss": 1.6677,
      "num_input_tokens_seen": 6906231136,
      "step": 8778
    },
    {
      "epoch": 0.9313600678973053,
      "grad_norm": 0.607413861471612,
      "learning_rate": 4.9276076394585936e-05,
      "loss": 1.9486,
      "num_input_tokens_seen": 6907017872,
      "step": 8779
    },
    {
      "epoch": 0.9314661574368768,
      "grad_norm": 0.8236284971339265,
      "learning_rate": 4.9275910353993006e-05,
      "loss": 1.9615,
      "num_input_tokens_seen": 6907804544,
      "step": 8780
    },
    {
      "epoch": 0.9315722469764481,
      "grad_norm": 0.6542303630935375,
      "learning_rate": 4.927574429464036e-05,
      "loss": 1.9342,
      "num_input_tokens_seen": 6908591248,
      "step": 8781
    },
    {
      "epoch": 0.9316783365160195,
      "grad_norm": 0.8583746961122372,
      "learning_rate": 4.927557821652813e-05,
      "loss": 1.9939,
      "num_input_tokens_seen": 6909378016,
      "step": 8782
    },
    {
      "epoch": 0.9317844260555909,
      "grad_norm": 0.618139925696274,
      "learning_rate": 4.927541211965645e-05,
      "loss": 2.0391,
      "num_input_tokens_seen": 6910164768,
      "step": 8783
    },
    {
      "epoch": 0.9318905155951623,
      "grad_norm": 0.731871834532068,
      "learning_rate": 4.927524600402544e-05,
      "loss": 1.9718,
      "num_input_tokens_seen": 6910951472,
      "step": 8784
    },
    {
      "epoch": 0.9319966051347337,
      "grad_norm": 0.5244272324478593,
      "learning_rate": 4.927507986963523e-05,
      "loss": 1.9122,
      "num_input_tokens_seen": 6911738288,
      "step": 8785
    },
    {
      "epoch": 0.9321026946743051,
      "grad_norm": 0.5690759518242503,
      "learning_rate": 4.927491371648596e-05,
      "loss": 1.9498,
      "num_input_tokens_seen": 6912525008,
      "step": 8786
    },
    {
      "epoch": 0.9322087842138765,
      "grad_norm": 0.5044863802802614,
      "learning_rate": 4.9274747544577736e-05,
      "loss": 2.07,
      "num_input_tokens_seen": 6913311776,
      "step": 8787
    },
    {
      "epoch": 0.9323148737534479,
      "grad_norm": 0.5331745414092671,
      "learning_rate": 4.9274581353910707e-05,
      "loss": 2.0608,
      "num_input_tokens_seen": 6914098512,
      "step": 8788
    },
    {
      "epoch": 0.9324209632930193,
      "grad_norm": 0.6505031884852559,
      "learning_rate": 4.9274415144484994e-05,
      "loss": 1.8487,
      "num_input_tokens_seen": 6914885424,
      "step": 8789
    },
    {
      "epoch": 0.9325270528325907,
      "grad_norm": 0.5835452592055734,
      "learning_rate": 4.927424891630073e-05,
      "loss": 1.9686,
      "num_input_tokens_seen": 6915672224,
      "step": 8790
    },
    {
      "epoch": 0.9326331423721621,
      "grad_norm": 0.6484076541103492,
      "learning_rate": 4.9274082669358036e-05,
      "loss": 2.0898,
      "num_input_tokens_seen": 6916459008,
      "step": 8791
    },
    {
      "epoch": 0.9327392319117335,
      "grad_norm": 0.539153062694701,
      "learning_rate": 4.927391640365704e-05,
      "loss": 1.9173,
      "num_input_tokens_seen": 6917245728,
      "step": 8792
    },
    {
      "epoch": 0.9328453214513049,
      "grad_norm": 0.7229029404142094,
      "learning_rate": 4.927375011919787e-05,
      "loss": 1.8385,
      "num_input_tokens_seen": 6918032480,
      "step": 8793
    },
    {
      "epoch": 0.9329514109908763,
      "grad_norm": 0.4008333290083285,
      "learning_rate": 4.927358381598066e-05,
      "loss": 1.8719,
      "num_input_tokens_seen": 6918819280,
      "step": 8794
    },
    {
      "epoch": 0.9330575005304477,
      "grad_norm": 0.5410390498987458,
      "learning_rate": 4.927341749400554e-05,
      "loss": 1.8149,
      "num_input_tokens_seen": 6919606144,
      "step": 8795
    },
    {
      "epoch": 0.9331635900700191,
      "grad_norm": 0.4892290774312055,
      "learning_rate": 4.927325115327264e-05,
      "loss": 1.8326,
      "num_input_tokens_seen": 6920392912,
      "step": 8796
    },
    {
      "epoch": 0.9332696796095905,
      "grad_norm": 0.48978944260538243,
      "learning_rate": 4.927308479378208e-05,
      "loss": 2.0573,
      "num_input_tokens_seen": 6921179616,
      "step": 8797
    },
    {
      "epoch": 0.9333757691491619,
      "grad_norm": 0.831835734417727,
      "learning_rate": 4.9272918415533984e-05,
      "loss": 1.7983,
      "num_input_tokens_seen": 6921966368,
      "step": 8798
    },
    {
      "epoch": 0.9334818586887333,
      "grad_norm": 0.5426654316302704,
      "learning_rate": 4.9272752018528496e-05,
      "loss": 1.7952,
      "num_input_tokens_seen": 6922753248,
      "step": 8799
    },
    {
      "epoch": 0.9335879482283047,
      "grad_norm": 0.9187529216459187,
      "learning_rate": 4.9272585602765734e-05,
      "loss": 2.0558,
      "num_input_tokens_seen": 6923539920,
      "step": 8800
    },
    {
      "epoch": 0.9336940377678761,
      "grad_norm": 0.6402057589778334,
      "learning_rate": 4.9272419168245834e-05,
      "loss": 1.996,
      "num_input_tokens_seen": 6924326656,
      "step": 8801
    },
    {
      "epoch": 0.9338001273074474,
      "grad_norm": 0.5591094550982441,
      "learning_rate": 4.927225271496892e-05,
      "loss": 2.0213,
      "num_input_tokens_seen": 6925113424,
      "step": 8802
    },
    {
      "epoch": 0.9339062168470189,
      "grad_norm": 0.506716283319608,
      "learning_rate": 4.927208624293512e-05,
      "loss": 1.8331,
      "num_input_tokens_seen": 6925900160,
      "step": 8803
    },
    {
      "epoch": 0.9340123063865903,
      "grad_norm": 0.4555256119237482,
      "learning_rate": 4.9271919752144566e-05,
      "loss": 1.7274,
      "num_input_tokens_seen": 6926686992,
      "step": 8804
    },
    {
      "epoch": 0.9341183959261616,
      "grad_norm": 0.5004326056848024,
      "learning_rate": 4.927175324259739e-05,
      "loss": 1.8896,
      "num_input_tokens_seen": 6927473728,
      "step": 8805
    },
    {
      "epoch": 0.9342244854657331,
      "grad_norm": 0.49321867626441984,
      "learning_rate": 4.92715867142937e-05,
      "loss": 1.8759,
      "num_input_tokens_seen": 6928260576,
      "step": 8806
    },
    {
      "epoch": 0.9343305750053045,
      "grad_norm": 0.4829728348577367,
      "learning_rate": 4.927142016723365e-05,
      "loss": 2.0071,
      "num_input_tokens_seen": 6929047328,
      "step": 8807
    },
    {
      "epoch": 0.9344366645448758,
      "grad_norm": 0.5151291521851242,
      "learning_rate": 4.9271253601417355e-05,
      "loss": 1.82,
      "num_input_tokens_seen": 6929834064,
      "step": 8808
    },
    {
      "epoch": 0.9345427540844473,
      "grad_norm": 0.47163668646583035,
      "learning_rate": 4.927108701684495e-05,
      "loss": 1.8674,
      "num_input_tokens_seen": 6930620832,
      "step": 8809
    },
    {
      "epoch": 0.9346488436240187,
      "grad_norm": 0.4017085152887423,
      "learning_rate": 4.9270920413516556e-05,
      "loss": 1.87,
      "num_input_tokens_seen": 6931407600,
      "step": 8810
    },
    {
      "epoch": 0.93475493316359,
      "grad_norm": 0.8083936724461716,
      "learning_rate": 4.927075379143231e-05,
      "loss": 1.9205,
      "num_input_tokens_seen": 6932194400,
      "step": 8811
    },
    {
      "epoch": 0.9348610227031615,
      "grad_norm": 0.5393286000644844,
      "learning_rate": 4.927058715059234e-05,
      "loss": 1.9589,
      "num_input_tokens_seen": 6932981200,
      "step": 8812
    },
    {
      "epoch": 0.9349671122427329,
      "grad_norm": 0.6009537624474257,
      "learning_rate": 4.927042049099677e-05,
      "loss": 1.8543,
      "num_input_tokens_seen": 6933767952,
      "step": 8813
    },
    {
      "epoch": 0.9350732017823042,
      "grad_norm": 0.45249858442277213,
      "learning_rate": 4.927025381264574e-05,
      "loss": 1.8432,
      "num_input_tokens_seen": 6934554672,
      "step": 8814
    },
    {
      "epoch": 0.9351792913218757,
      "grad_norm": 0.7063635856081658,
      "learning_rate": 4.927008711553936e-05,
      "loss": 1.9179,
      "num_input_tokens_seen": 6935341344,
      "step": 8815
    },
    {
      "epoch": 0.9352853808614471,
      "grad_norm": 0.4983017327506462,
      "learning_rate": 4.926992039967777e-05,
      "loss": 1.9709,
      "num_input_tokens_seen": 6936128160,
      "step": 8816
    },
    {
      "epoch": 0.9353914704010184,
      "grad_norm": 0.4651108437325845,
      "learning_rate": 4.9269753665061104e-05,
      "loss": 1.7636,
      "num_input_tokens_seen": 6936914976,
      "step": 8817
    },
    {
      "epoch": 0.9354975599405898,
      "grad_norm": 0.5487580444134319,
      "learning_rate": 4.9269586911689474e-05,
      "loss": 1.8841,
      "num_input_tokens_seen": 6937701680,
      "step": 8818
    },
    {
      "epoch": 0.9356036494801613,
      "grad_norm": 0.39525057261239804,
      "learning_rate": 4.9269420139563024e-05,
      "loss": 1.8696,
      "num_input_tokens_seen": 6938488448,
      "step": 8819
    },
    {
      "epoch": 0.9357097390197326,
      "grad_norm": 0.9287207683310887,
      "learning_rate": 4.926925334868188e-05,
      "loss": 1.9277,
      "num_input_tokens_seen": 6939275248,
      "step": 8820
    },
    {
      "epoch": 0.935815828559304,
      "grad_norm": 0.3717749699876829,
      "learning_rate": 4.926908653904617e-05,
      "loss": 1.8882,
      "num_input_tokens_seen": 6940061968,
      "step": 8821
    },
    {
      "epoch": 0.9359219180988755,
      "grad_norm": 0.8234704226038527,
      "learning_rate": 4.926891971065602e-05,
      "loss": 2.0775,
      "num_input_tokens_seen": 6940848656,
      "step": 8822
    },
    {
      "epoch": 0.9360280076384468,
      "grad_norm": 0.46745690461844414,
      "learning_rate": 4.926875286351156e-05,
      "loss": 1.776,
      "num_input_tokens_seen": 6941635440,
      "step": 8823
    },
    {
      "epoch": 0.9361340971780182,
      "grad_norm": 0.7803458247618807,
      "learning_rate": 4.926858599761292e-05,
      "loss": 1.8605,
      "num_input_tokens_seen": 6942422256,
      "step": 8824
    },
    {
      "epoch": 0.9362401867175897,
      "grad_norm": 0.645642211942242,
      "learning_rate": 4.926841911296023e-05,
      "loss": 1.8755,
      "num_input_tokens_seen": 6943209024,
      "step": 8825
    },
    {
      "epoch": 0.936346276257161,
      "grad_norm": 0.6704082692012655,
      "learning_rate": 4.926825220955362e-05,
      "loss": 2.0276,
      "num_input_tokens_seen": 6943995696,
      "step": 8826
    },
    {
      "epoch": 0.9364523657967324,
      "grad_norm": 0.6807611468601267,
      "learning_rate": 4.926808528739321e-05,
      "loss": 1.915,
      "num_input_tokens_seen": 6944782448,
      "step": 8827
    },
    {
      "epoch": 0.9365584553363039,
      "grad_norm": 0.5708325934556884,
      "learning_rate": 4.9267918346479144e-05,
      "loss": 1.9341,
      "num_input_tokens_seen": 6945569232,
      "step": 8828
    },
    {
      "epoch": 0.9366645448758752,
      "grad_norm": 0.5520599879525002,
      "learning_rate": 4.9267751386811536e-05,
      "loss": 1.7662,
      "num_input_tokens_seen": 6946356000,
      "step": 8829
    },
    {
      "epoch": 0.9367706344154466,
      "grad_norm": 0.40625426703094125,
      "learning_rate": 4.9267584408390524e-05,
      "loss": 1.6842,
      "num_input_tokens_seen": 6947142848,
      "step": 8830
    },
    {
      "epoch": 0.9368767239550181,
      "grad_norm": 0.5561109486386994,
      "learning_rate": 4.9267417411216236e-05,
      "loss": 1.9173,
      "num_input_tokens_seen": 6947929584,
      "step": 8831
    },
    {
      "epoch": 0.9369828134945895,
      "grad_norm": 0.4115302078298566,
      "learning_rate": 4.92672503952888e-05,
      "loss": 1.7838,
      "num_input_tokens_seen": 6948716432,
      "step": 8832
    },
    {
      "epoch": 0.9370889030341608,
      "grad_norm": 0.48189908789319247,
      "learning_rate": 4.926708336060835e-05,
      "loss": 1.8881,
      "num_input_tokens_seen": 6949503248,
      "step": 8833
    },
    {
      "epoch": 0.9371949925737322,
      "grad_norm": 0.5561325792688852,
      "learning_rate": 4.9266916307175e-05,
      "loss": 1.9672,
      "num_input_tokens_seen": 6950290096,
      "step": 8834
    },
    {
      "epoch": 0.9373010821133037,
      "grad_norm": 0.43936502827069734,
      "learning_rate": 4.926674923498889e-05,
      "loss": 1.7535,
      "num_input_tokens_seen": 6951076816,
      "step": 8835
    },
    {
      "epoch": 0.937407171652875,
      "grad_norm": 0.6221598049355542,
      "learning_rate": 4.9266582144050154e-05,
      "loss": 1.8787,
      "num_input_tokens_seen": 6951863616,
      "step": 8836
    },
    {
      "epoch": 0.9375132611924464,
      "grad_norm": 0.4199492356004946,
      "learning_rate": 4.9266415034358917e-05,
      "loss": 1.8587,
      "num_input_tokens_seen": 6952650320,
      "step": 8837
    },
    {
      "epoch": 0.9376193507320179,
      "grad_norm": 0.5094393756083904,
      "learning_rate": 4.92662479059153e-05,
      "loss": 1.85,
      "num_input_tokens_seen": 6953437136,
      "step": 8838
    },
    {
      "epoch": 0.9377254402715892,
      "grad_norm": 0.7925117102575253,
      "learning_rate": 4.926608075871943e-05,
      "loss": 2.011,
      "num_input_tokens_seen": 6954223888,
      "step": 8839
    },
    {
      "epoch": 0.9378315298111606,
      "grad_norm": 0.48222371404046305,
      "learning_rate": 4.9265913592771465e-05,
      "loss": 1.8366,
      "num_input_tokens_seen": 6955010624,
      "step": 8840
    },
    {
      "epoch": 0.937937619350732,
      "grad_norm": 0.6343631341893585,
      "learning_rate": 4.92657464080715e-05,
      "loss": 1.859,
      "num_input_tokens_seen": 6955797424,
      "step": 8841
    },
    {
      "epoch": 0.9380437088903034,
      "grad_norm": 0.6057297010713465,
      "learning_rate": 4.926557920461968e-05,
      "loss": 1.889,
      "num_input_tokens_seen": 6956584128,
      "step": 8842
    },
    {
      "epoch": 0.9381497984298748,
      "grad_norm": 0.6874593332641928,
      "learning_rate": 4.926541198241614e-05,
      "loss": 1.861,
      "num_input_tokens_seen": 6957370912,
      "step": 8843
    },
    {
      "epoch": 0.9382558879694463,
      "grad_norm": 0.5091809951172301,
      "learning_rate": 4.9265244741461e-05,
      "loss": 1.7252,
      "num_input_tokens_seen": 6958157792,
      "step": 8844
    },
    {
      "epoch": 0.9383619775090176,
      "grad_norm": 0.545325119443639,
      "learning_rate": 4.926507748175439e-05,
      "loss": 1.849,
      "num_input_tokens_seen": 6958944512,
      "step": 8845
    },
    {
      "epoch": 0.938468067048589,
      "grad_norm": 0.7079971328268021,
      "learning_rate": 4.9264910203296436e-05,
      "loss": 1.9786,
      "num_input_tokens_seen": 6959731200,
      "step": 8846
    },
    {
      "epoch": 0.9385741565881605,
      "grad_norm": 0.43849527607929456,
      "learning_rate": 4.926474290608727e-05,
      "loss": 1.7993,
      "num_input_tokens_seen": 6960517888,
      "step": 8847
    },
    {
      "epoch": 0.9386802461277318,
      "grad_norm": 0.7835521384222396,
      "learning_rate": 4.926457559012703e-05,
      "loss": 2.016,
      "num_input_tokens_seen": 6961304640,
      "step": 8848
    },
    {
      "epoch": 0.9387863356673032,
      "grad_norm": 0.45167481072334853,
      "learning_rate": 4.926440825541583e-05,
      "loss": 2.001,
      "num_input_tokens_seen": 6962091440,
      "step": 8849
    },
    {
      "epoch": 0.9388924252068745,
      "grad_norm": 0.4386340190179619,
      "learning_rate": 4.926424090195381e-05,
      "loss": 1.8513,
      "num_input_tokens_seen": 6962878304,
      "step": 8850
    },
    {
      "epoch": 0.938998514746446,
      "grad_norm": 0.5383025149302731,
      "learning_rate": 4.92640735297411e-05,
      "loss": 1.9851,
      "num_input_tokens_seen": 6963665136,
      "step": 8851
    },
    {
      "epoch": 0.9391046042860174,
      "grad_norm": 0.47931890534008276,
      "learning_rate": 4.926390613877783e-05,
      "loss": 1.8969,
      "num_input_tokens_seen": 6964451920,
      "step": 8852
    },
    {
      "epoch": 0.9392106938255887,
      "grad_norm": 0.584284510294688,
      "learning_rate": 4.926373872906411e-05,
      "loss": 2.0733,
      "num_input_tokens_seen": 6965238656,
      "step": 8853
    },
    {
      "epoch": 0.9393167833651602,
      "grad_norm": 0.3903456361697026,
      "learning_rate": 4.9263571300600095e-05,
      "loss": 1.8334,
      "num_input_tokens_seen": 6966025488,
      "step": 8854
    },
    {
      "epoch": 0.9394228729047316,
      "grad_norm": 0.6631682649707049,
      "learning_rate": 4.9263403853385906e-05,
      "loss": 1.926,
      "num_input_tokens_seen": 6966812256,
      "step": 8855
    },
    {
      "epoch": 0.939528962444303,
      "grad_norm": 0.38048455308963697,
      "learning_rate": 4.926323638742166e-05,
      "loss": 1.8404,
      "num_input_tokens_seen": 6967599120,
      "step": 8856
    },
    {
      "epoch": 0.9396350519838744,
      "grad_norm": 0.42186107199363887,
      "learning_rate": 4.9263068902707507e-05,
      "loss": 1.7433,
      "num_input_tokens_seen": 6968385968,
      "step": 8857
    },
    {
      "epoch": 0.9397411415234458,
      "grad_norm": 0.5263846584246308,
      "learning_rate": 4.926290139924357e-05,
      "loss": 2.0479,
      "num_input_tokens_seen": 6969172672,
      "step": 8858
    },
    {
      "epoch": 0.9398472310630172,
      "grad_norm": 0.5400469260411435,
      "learning_rate": 4.9262733877029964e-05,
      "loss": 1.9766,
      "num_input_tokens_seen": 6969959360,
      "step": 8859
    },
    {
      "epoch": 0.9399533206025886,
      "grad_norm": 0.5606406986068067,
      "learning_rate": 4.9262566336066826e-05,
      "loss": 2.1203,
      "num_input_tokens_seen": 6970746096,
      "step": 8860
    },
    {
      "epoch": 0.94005941014216,
      "grad_norm": 0.8266856956031721,
      "learning_rate": 4.92623987763543e-05,
      "loss": 1.8913,
      "num_input_tokens_seen": 6971532976,
      "step": 8861
    },
    {
      "epoch": 0.9401654996817314,
      "grad_norm": 0.3982447324157858,
      "learning_rate": 4.9262231197892506e-05,
      "loss": 1.8075,
      "num_input_tokens_seen": 6972319824,
      "step": 8862
    },
    {
      "epoch": 0.9402715892213028,
      "grad_norm": 0.9897958884234114,
      "learning_rate": 4.926206360068156e-05,
      "loss": 1.9764,
      "num_input_tokens_seen": 6973106480,
      "step": 8863
    },
    {
      "epoch": 0.9403776787608742,
      "grad_norm": 0.5986969070440529,
      "learning_rate": 4.9261895984721605e-05,
      "loss": 1.857,
      "num_input_tokens_seen": 6973893248,
      "step": 8864
    },
    {
      "epoch": 0.9404837683004456,
      "grad_norm": 0.9188482495497345,
      "learning_rate": 4.926172835001278e-05,
      "loss": 1.9685,
      "num_input_tokens_seen": 6974680000,
      "step": 8865
    },
    {
      "epoch": 0.940589857840017,
      "grad_norm": 0.48561854199362264,
      "learning_rate": 4.926156069655519e-05,
      "loss": 1.95,
      "num_input_tokens_seen": 6975466816,
      "step": 8866
    },
    {
      "epoch": 0.9406959473795884,
      "grad_norm": 0.7964775632104848,
      "learning_rate": 4.926139302434899e-05,
      "loss": 1.8662,
      "num_input_tokens_seen": 6976253696,
      "step": 8867
    },
    {
      "epoch": 0.9408020369191598,
      "grad_norm": 0.43072629737111506,
      "learning_rate": 4.926122533339429e-05,
      "loss": 1.8412,
      "num_input_tokens_seen": 6977040368,
      "step": 8868
    },
    {
      "epoch": 0.9409081264587311,
      "grad_norm": 0.4286422670426688,
      "learning_rate": 4.926105762369122e-05,
      "loss": 1.9651,
      "num_input_tokens_seen": 6977827024,
      "step": 8869
    },
    {
      "epoch": 0.9410142159983026,
      "grad_norm": 0.4375868341754761,
      "learning_rate": 4.926088989523993e-05,
      "loss": 1.8062,
      "num_input_tokens_seen": 6978613792,
      "step": 8870
    },
    {
      "epoch": 0.941120305537874,
      "grad_norm": 0.516277767608608,
      "learning_rate": 4.926072214804053e-05,
      "loss": 1.9021,
      "num_input_tokens_seen": 6979400448,
      "step": 8871
    },
    {
      "epoch": 0.9412263950774453,
      "grad_norm": 0.45950821293134936,
      "learning_rate": 4.9260554382093156e-05,
      "loss": 1.9364,
      "num_input_tokens_seen": 6980187232,
      "step": 8872
    },
    {
      "epoch": 0.9413324846170168,
      "grad_norm": 0.48581898888309405,
      "learning_rate": 4.926038659739793e-05,
      "loss": 1.9056,
      "num_input_tokens_seen": 6980973936,
      "step": 8873
    },
    {
      "epoch": 0.9414385741565882,
      "grad_norm": 0.51938644437776,
      "learning_rate": 4.9260218793955006e-05,
      "loss": 1.8066,
      "num_input_tokens_seen": 6981760672,
      "step": 8874
    },
    {
      "epoch": 0.9415446636961595,
      "grad_norm": 0.4111994479892971,
      "learning_rate": 4.926005097176448e-05,
      "loss": 1.9425,
      "num_input_tokens_seen": 6982547408,
      "step": 8875
    },
    {
      "epoch": 0.941650753235731,
      "grad_norm": 0.5920934486104339,
      "learning_rate": 4.9259883130826515e-05,
      "loss": 1.8985,
      "num_input_tokens_seen": 6983334160,
      "step": 8876
    },
    {
      "epoch": 0.9417568427753024,
      "grad_norm": 0.40947972410460676,
      "learning_rate": 4.92597152711412e-05,
      "loss": 1.9192,
      "num_input_tokens_seen": 6984120880,
      "step": 8877
    },
    {
      "epoch": 0.9418629323148737,
      "grad_norm": 0.396027999487742,
      "learning_rate": 4.925954739270871e-05,
      "loss": 1.87,
      "num_input_tokens_seen": 6984907568,
      "step": 8878
    },
    {
      "epoch": 0.9419690218544452,
      "grad_norm": 0.44304361541292053,
      "learning_rate": 4.925937949552915e-05,
      "loss": 1.9149,
      "num_input_tokens_seen": 6985694368,
      "step": 8879
    },
    {
      "epoch": 0.9420751113940166,
      "grad_norm": 0.5081344165030195,
      "learning_rate": 4.925921157960265e-05,
      "loss": 2.0026,
      "num_input_tokens_seen": 6986481184,
      "step": 8880
    },
    {
      "epoch": 0.9421812009335879,
      "grad_norm": 0.3837317158813509,
      "learning_rate": 4.925904364492934e-05,
      "loss": 1.9271,
      "num_input_tokens_seen": 6987267904,
      "step": 8881
    },
    {
      "epoch": 0.9422872904731594,
      "grad_norm": 0.3916732398366984,
      "learning_rate": 4.925887569150936e-05,
      "loss": 1.9399,
      "num_input_tokens_seen": 6988054640,
      "step": 8882
    },
    {
      "epoch": 0.9423933800127308,
      "grad_norm": 0.3702245940274393,
      "learning_rate": 4.925870771934283e-05,
      "loss": 1.8784,
      "num_input_tokens_seen": 6988841360,
      "step": 8883
    },
    {
      "epoch": 0.9424994695523021,
      "grad_norm": 0.3373056905273413,
      "learning_rate": 4.925853972842988e-05,
      "loss": 1.8178,
      "num_input_tokens_seen": 6989628160,
      "step": 8884
    },
    {
      "epoch": 0.9426055590918735,
      "grad_norm": 0.45890792748073095,
      "learning_rate": 4.925837171877065e-05,
      "loss": 1.9065,
      "num_input_tokens_seen": 6990414944,
      "step": 8885
    },
    {
      "epoch": 0.942711648631445,
      "grad_norm": 0.5240131597777758,
      "learning_rate": 4.925820369036525e-05,
      "loss": 1.7304,
      "num_input_tokens_seen": 6991201664,
      "step": 8886
    },
    {
      "epoch": 0.9428177381710163,
      "grad_norm": 0.40759687707137104,
      "learning_rate": 4.9258035643213826e-05,
      "loss": 1.9164,
      "num_input_tokens_seen": 6991988528,
      "step": 8887
    },
    {
      "epoch": 0.9429238277105877,
      "grad_norm": 0.5274963769463702,
      "learning_rate": 4.9257867577316506e-05,
      "loss": 1.8161,
      "num_input_tokens_seen": 6992775280,
      "step": 8888
    },
    {
      "epoch": 0.9430299172501592,
      "grad_norm": 0.36643533911471055,
      "learning_rate": 4.925769949267342e-05,
      "loss": 1.8905,
      "num_input_tokens_seen": 6993562064,
      "step": 8889
    },
    {
      "epoch": 0.9431360067897305,
      "grad_norm": 0.40135012615669674,
      "learning_rate": 4.925753138928469e-05,
      "loss": 1.8016,
      "num_input_tokens_seen": 6994348880,
      "step": 8890
    },
    {
      "epoch": 0.9432420963293019,
      "grad_norm": 0.3991384520451508,
      "learning_rate": 4.925736326715046e-05,
      "loss": 1.815,
      "num_input_tokens_seen": 6995135664,
      "step": 8891
    },
    {
      "epoch": 0.9433481858688734,
      "grad_norm": 0.49217145386908534,
      "learning_rate": 4.925719512627085e-05,
      "loss": 1.9348,
      "num_input_tokens_seen": 6995922432,
      "step": 8892
    },
    {
      "epoch": 0.9434542754084447,
      "grad_norm": 0.42158945722520497,
      "learning_rate": 4.925702696664598e-05,
      "loss": 1.8636,
      "num_input_tokens_seen": 6996709184,
      "step": 8893
    },
    {
      "epoch": 0.9435603649480161,
      "grad_norm": 0.6393351210826417,
      "learning_rate": 4.9256858788276e-05,
      "loss": 1.8543,
      "num_input_tokens_seen": 6997495936,
      "step": 8894
    },
    {
      "epoch": 0.9436664544875876,
      "grad_norm": 0.6324657658473143,
      "learning_rate": 4.925669059116103e-05,
      "loss": 2.0176,
      "num_input_tokens_seen": 6998282752,
      "step": 8895
    },
    {
      "epoch": 0.9437725440271589,
      "grad_norm": 0.7431867155384478,
      "learning_rate": 4.92565223753012e-05,
      "loss": 1.9129,
      "num_input_tokens_seen": 6999069616,
      "step": 8896
    },
    {
      "epoch": 0.9438786335667303,
      "grad_norm": 0.6948072319760791,
      "learning_rate": 4.925635414069665e-05,
      "loss": 1.8145,
      "num_input_tokens_seen": 6999856416,
      "step": 8897
    },
    {
      "epoch": 0.9439847231063018,
      "grad_norm": 0.8221499200599542,
      "learning_rate": 4.925618588734749e-05,
      "loss": 1.8053,
      "num_input_tokens_seen": 7000643296,
      "step": 8898
    },
    {
      "epoch": 0.9440908126458731,
      "grad_norm": 1.2185807095131493,
      "learning_rate": 4.9256017615253864e-05,
      "loss": 2.0184,
      "num_input_tokens_seen": 7001430080,
      "step": 8899
    },
    {
      "epoch": 0.9441969021854445,
      "grad_norm": 1.3144894835188543,
      "learning_rate": 4.925584932441591e-05,
      "loss": 1.8834,
      "num_input_tokens_seen": 7002216864,
      "step": 8900
    },
    {
      "epoch": 0.9443029917250159,
      "grad_norm": 0.6914359631631888,
      "learning_rate": 4.925568101483373e-05,
      "loss": 2.0791,
      "num_input_tokens_seen": 7003003680,
      "step": 8901
    },
    {
      "epoch": 0.9444090812645873,
      "grad_norm": 0.5191106044740327,
      "learning_rate": 4.9255512686507474e-05,
      "loss": 1.9919,
      "num_input_tokens_seen": 7003790528,
      "step": 8902
    },
    {
      "epoch": 0.9445151708041587,
      "grad_norm": 0.7306254884798034,
      "learning_rate": 4.9255344339437276e-05,
      "loss": 1.8922,
      "num_input_tokens_seen": 7004577248,
      "step": 8903
    },
    {
      "epoch": 0.9446212603437301,
      "grad_norm": 0.5245908604634796,
      "learning_rate": 4.9255175973623255e-05,
      "loss": 1.7671,
      "num_input_tokens_seen": 7005364032,
      "step": 8904
    },
    {
      "epoch": 0.9447273498833015,
      "grad_norm": 0.46145765823199275,
      "learning_rate": 4.925500758906555e-05,
      "loss": 1.835,
      "num_input_tokens_seen": 7006150832,
      "step": 8905
    },
    {
      "epoch": 0.9448334394228729,
      "grad_norm": 0.5848734641964436,
      "learning_rate": 4.925483918576429e-05,
      "loss": 1.9275,
      "num_input_tokens_seen": 7006937568,
      "step": 8906
    },
    {
      "epoch": 0.9449395289624443,
      "grad_norm": 0.49803737488758626,
      "learning_rate": 4.92546707637196e-05,
      "loss": 1.9274,
      "num_input_tokens_seen": 7007724416,
      "step": 8907
    },
    {
      "epoch": 0.9450456185020157,
      "grad_norm": 0.45659874126487326,
      "learning_rate": 4.925450232293161e-05,
      "loss": 1.9655,
      "num_input_tokens_seen": 7008511168,
      "step": 8908
    },
    {
      "epoch": 0.9451517080415871,
      "grad_norm": 0.42751147494984026,
      "learning_rate": 4.925433386340045e-05,
      "loss": 1.8269,
      "num_input_tokens_seen": 7009297952,
      "step": 8909
    },
    {
      "epoch": 0.9452577975811585,
      "grad_norm": 0.48733192735734854,
      "learning_rate": 4.925416538512625e-05,
      "loss": 1.9294,
      "num_input_tokens_seen": 7010084704,
      "step": 8910
    },
    {
      "epoch": 0.9453638871207299,
      "grad_norm": 0.4836271014638759,
      "learning_rate": 4.925399688810915e-05,
      "loss": 1.9637,
      "num_input_tokens_seen": 7010871408,
      "step": 8911
    },
    {
      "epoch": 0.9454699766603013,
      "grad_norm": 0.4217112616320907,
      "learning_rate": 4.925382837234927e-05,
      "loss": 2.0407,
      "num_input_tokens_seen": 7011658208,
      "step": 8912
    },
    {
      "epoch": 0.9455760661998727,
      "grad_norm": 0.46308802584794456,
      "learning_rate": 4.9253659837846746e-05,
      "loss": 1.9198,
      "num_input_tokens_seen": 7012444960,
      "step": 8913
    },
    {
      "epoch": 0.9456821557394441,
      "grad_norm": 0.455623701653976,
      "learning_rate": 4.92534912846017e-05,
      "loss": 1.9851,
      "num_input_tokens_seen": 7013231712,
      "step": 8914
    },
    {
      "epoch": 0.9457882452790155,
      "grad_norm": 0.532003745213726,
      "learning_rate": 4.925332271261427e-05,
      "loss": 1.8786,
      "num_input_tokens_seen": 7014018400,
      "step": 8915
    },
    {
      "epoch": 0.9458943348185869,
      "grad_norm": 0.4186740538782488,
      "learning_rate": 4.9253154121884584e-05,
      "loss": 2.0606,
      "num_input_tokens_seen": 7014805184,
      "step": 8916
    },
    {
      "epoch": 0.9460004243581582,
      "grad_norm": 0.37390763224016144,
      "learning_rate": 4.9252985512412774e-05,
      "loss": 1.8193,
      "num_input_tokens_seen": 7015591984,
      "step": 8917
    },
    {
      "epoch": 0.9461065138977297,
      "grad_norm": 0.4918752298110374,
      "learning_rate": 4.925281688419896e-05,
      "loss": 2.0206,
      "num_input_tokens_seen": 7016378736,
      "step": 8918
    },
    {
      "epoch": 0.9462126034373011,
      "grad_norm": 0.4031941763335707,
      "learning_rate": 4.925264823724329e-05,
      "loss": 1.9944,
      "num_input_tokens_seen": 7017165424,
      "step": 8919
    },
    {
      "epoch": 0.9463186929768724,
      "grad_norm": 0.33035453388290126,
      "learning_rate": 4.925247957154588e-05,
      "loss": 1.7485,
      "num_input_tokens_seen": 7017952128,
      "step": 8920
    },
    {
      "epoch": 0.9464247825164439,
      "grad_norm": 0.40613743993518936,
      "learning_rate": 4.9252310887106865e-05,
      "loss": 1.8217,
      "num_input_tokens_seen": 7018738832,
      "step": 8921
    },
    {
      "epoch": 0.9465308720560153,
      "grad_norm": 0.3759583118224414,
      "learning_rate": 4.9252142183926385e-05,
      "loss": 1.9205,
      "num_input_tokens_seen": 7019525664,
      "step": 8922
    },
    {
      "epoch": 0.9466369615955866,
      "grad_norm": 0.4181678623287795,
      "learning_rate": 4.9251973462004555e-05,
      "loss": 1.9233,
      "num_input_tokens_seen": 7020312464,
      "step": 8923
    },
    {
      "epoch": 0.9467430511351581,
      "grad_norm": 0.3744847558856702,
      "learning_rate": 4.925180472134151e-05,
      "loss": 1.8182,
      "num_input_tokens_seen": 7021099200,
      "step": 8924
    },
    {
      "epoch": 0.9468491406747295,
      "grad_norm": 0.49784277943197847,
      "learning_rate": 4.925163596193738e-05,
      "loss": 1.7591,
      "num_input_tokens_seen": 7021885984,
      "step": 8925
    },
    {
      "epoch": 0.9469552302143008,
      "grad_norm": 0.3772055324671586,
      "learning_rate": 4.9251467183792296e-05,
      "loss": 1.8818,
      "num_input_tokens_seen": 7022672736,
      "step": 8926
    },
    {
      "epoch": 0.9470613197538723,
      "grad_norm": 0.4222695372834369,
      "learning_rate": 4.92512983869064e-05,
      "loss": 1.8041,
      "num_input_tokens_seen": 7023459520,
      "step": 8927
    },
    {
      "epoch": 0.9471674092934437,
      "grad_norm": 0.40812039960177926,
      "learning_rate": 4.9251129571279805e-05,
      "loss": 1.8419,
      "num_input_tokens_seen": 7024246192,
      "step": 8928
    },
    {
      "epoch": 0.947273498833015,
      "grad_norm": 0.40723783509556033,
      "learning_rate": 4.925096073691266e-05,
      "loss": 1.9129,
      "num_input_tokens_seen": 7025032960,
      "step": 8929
    },
    {
      "epoch": 0.9473795883725865,
      "grad_norm": 0.3655760388829698,
      "learning_rate": 4.925079188380506e-05,
      "loss": 1.7648,
      "num_input_tokens_seen": 7025819728,
      "step": 8930
    },
    {
      "epoch": 0.9474856779121579,
      "grad_norm": 0.38403643006414506,
      "learning_rate": 4.925062301195717e-05,
      "loss": 2.0726,
      "num_input_tokens_seen": 7026606448,
      "step": 8931
    },
    {
      "epoch": 0.9475917674517292,
      "grad_norm": 0.3956025375712189,
      "learning_rate": 4.925045412136912e-05,
      "loss": 1.8986,
      "num_input_tokens_seen": 7027393248,
      "step": 8932
    },
    {
      "epoch": 0.9476978569913006,
      "grad_norm": 0.40862390047871683,
      "learning_rate": 4.925028521204103e-05,
      "loss": 1.9171,
      "num_input_tokens_seen": 7028180016,
      "step": 8933
    },
    {
      "epoch": 0.9478039465308721,
      "grad_norm": 0.4001349507694781,
      "learning_rate": 4.925011628397302e-05,
      "loss": 1.7668,
      "num_input_tokens_seen": 7028966976,
      "step": 8934
    },
    {
      "epoch": 0.9479100360704434,
      "grad_norm": 0.43960624783583324,
      "learning_rate": 4.924994733716524e-05,
      "loss": 1.969,
      "num_input_tokens_seen": 7029753712,
      "step": 8935
    },
    {
      "epoch": 0.9480161256100148,
      "grad_norm": 0.44540397624295697,
      "learning_rate": 4.9249778371617807e-05,
      "loss": 1.874,
      "num_input_tokens_seen": 7030540432,
      "step": 8936
    },
    {
      "epoch": 0.9481222151495863,
      "grad_norm": 0.4206554336417947,
      "learning_rate": 4.924960938733086e-05,
      "loss": 2.1071,
      "num_input_tokens_seen": 7031327088,
      "step": 8937
    },
    {
      "epoch": 0.9482283046891576,
      "grad_norm": 0.39319883165522745,
      "learning_rate": 4.9249440384304526e-05,
      "loss": 1.8574,
      "num_input_tokens_seen": 7032113856,
      "step": 8938
    },
    {
      "epoch": 0.948334394228729,
      "grad_norm": 0.4503216494395554,
      "learning_rate": 4.9249271362538935e-05,
      "loss": 1.8612,
      "num_input_tokens_seen": 7032900592,
      "step": 8939
    },
    {
      "epoch": 0.9484404837683005,
      "grad_norm": 0.44764169978321133,
      "learning_rate": 4.9249102322034216e-05,
      "loss": 1.9104,
      "num_input_tokens_seen": 7033687344,
      "step": 8940
    },
    {
      "epoch": 0.9485465733078718,
      "grad_norm": 0.5611389753358371,
      "learning_rate": 4.924893326279051e-05,
      "loss": 1.9293,
      "num_input_tokens_seen": 7034474144,
      "step": 8941
    },
    {
      "epoch": 0.9486526628474432,
      "grad_norm": 0.43038207818983537,
      "learning_rate": 4.924876418480793e-05,
      "loss": 1.8741,
      "num_input_tokens_seen": 7035260928,
      "step": 8942
    },
    {
      "epoch": 0.9487587523870147,
      "grad_norm": 0.4424985799366537,
      "learning_rate": 4.924859508808662e-05,
      "loss": 1.9242,
      "num_input_tokens_seen": 7036047616,
      "step": 8943
    },
    {
      "epoch": 0.948864841926586,
      "grad_norm": 0.4628592205793588,
      "learning_rate": 4.924842597262671e-05,
      "loss": 1.9208,
      "num_input_tokens_seen": 7036834480,
      "step": 8944
    },
    {
      "epoch": 0.9489709314661574,
      "grad_norm": 0.3472988381175371,
      "learning_rate": 4.924825683842833e-05,
      "loss": 1.9145,
      "num_input_tokens_seen": 7037621200,
      "step": 8945
    },
    {
      "epoch": 0.9490770210057289,
      "grad_norm": 0.45026734840058646,
      "learning_rate": 4.9248087685491606e-05,
      "loss": 1.8646,
      "num_input_tokens_seen": 7038407888,
      "step": 8946
    },
    {
      "epoch": 0.9491831105453002,
      "grad_norm": 0.3673301120316317,
      "learning_rate": 4.924791851381667e-05,
      "loss": 1.8982,
      "num_input_tokens_seen": 7039194576,
      "step": 8947
    },
    {
      "epoch": 0.9492892000848716,
      "grad_norm": 0.36061447284181036,
      "learning_rate": 4.924774932340365e-05,
      "loss": 1.9125,
      "num_input_tokens_seen": 7039981312,
      "step": 8948
    },
    {
      "epoch": 0.9493952896244431,
      "grad_norm": 0.4535457356990047,
      "learning_rate": 4.924758011425269e-05,
      "loss": 2.0784,
      "num_input_tokens_seen": 7040768016,
      "step": 8949
    },
    {
      "epoch": 0.9495013791640144,
      "grad_norm": 0.41818991023474106,
      "learning_rate": 4.924741088636391e-05,
      "loss": 1.833,
      "num_input_tokens_seen": 7041554864,
      "step": 8950
    },
    {
      "epoch": 0.9496074687035858,
      "grad_norm": 0.5690369650433545,
      "learning_rate": 4.924724163973743e-05,
      "loss": 1.8528,
      "num_input_tokens_seen": 7042341664,
      "step": 8951
    },
    {
      "epoch": 0.9497135582431572,
      "grad_norm": 0.3915984148154589,
      "learning_rate": 4.9247072374373406e-05,
      "loss": 1.9564,
      "num_input_tokens_seen": 7043128384,
      "step": 8952
    },
    {
      "epoch": 0.9498196477827286,
      "grad_norm": 0.514484471532326,
      "learning_rate": 4.924690309027196e-05,
      "loss": 1.8407,
      "num_input_tokens_seen": 7043915168,
      "step": 8953
    },
    {
      "epoch": 0.9499257373223,
      "grad_norm": 0.4697444979691025,
      "learning_rate": 4.924673378743321e-05,
      "loss": 1.8986,
      "num_input_tokens_seen": 7044701952,
      "step": 8954
    },
    {
      "epoch": 0.9500318268618714,
      "grad_norm": 0.43423688406036437,
      "learning_rate": 4.924656446585729e-05,
      "loss": 1.889,
      "num_input_tokens_seen": 7045488704,
      "step": 8955
    },
    {
      "epoch": 0.9501379164014429,
      "grad_norm": 0.5457247004480525,
      "learning_rate": 4.924639512554434e-05,
      "loss": 1.8778,
      "num_input_tokens_seen": 7046275520,
      "step": 8956
    },
    {
      "epoch": 0.9502440059410142,
      "grad_norm": 0.6684343062100218,
      "learning_rate": 4.924622576649449e-05,
      "loss": 1.8155,
      "num_input_tokens_seen": 7047062352,
      "step": 8957
    },
    {
      "epoch": 0.9503500954805856,
      "grad_norm": 0.6205095874936017,
      "learning_rate": 4.9246056388707874e-05,
      "loss": 1.8837,
      "num_input_tokens_seen": 7047849024,
      "step": 8958
    },
    {
      "epoch": 0.950456185020157,
      "grad_norm": 0.40897002432785096,
      "learning_rate": 4.924588699218461e-05,
      "loss": 1.9484,
      "num_input_tokens_seen": 7048635776,
      "step": 8959
    },
    {
      "epoch": 0.9505622745597284,
      "grad_norm": 0.5402132044508753,
      "learning_rate": 4.9245717576924835e-05,
      "loss": 1.9077,
      "num_input_tokens_seen": 7049422592,
      "step": 8960
    },
    {
      "epoch": 0.9506683640992998,
      "grad_norm": 0.4617716855214283,
      "learning_rate": 4.924554814292869e-05,
      "loss": 2.0301,
      "num_input_tokens_seen": 7050209344,
      "step": 8961
    },
    {
      "epoch": 0.9507744536388713,
      "grad_norm": 0.7278369193312711,
      "learning_rate": 4.924537869019629e-05,
      "loss": 1.84,
      "num_input_tokens_seen": 7050996064,
      "step": 8962
    },
    {
      "epoch": 0.9508805431784426,
      "grad_norm": 0.4955866339667076,
      "learning_rate": 4.924520921872777e-05,
      "loss": 1.9673,
      "num_input_tokens_seen": 7051782848,
      "step": 8963
    },
    {
      "epoch": 0.950986632718014,
      "grad_norm": 0.4817437419089478,
      "learning_rate": 4.924503972852327e-05,
      "loss": 1.9786,
      "num_input_tokens_seen": 7052569616,
      "step": 8964
    },
    {
      "epoch": 0.9510927222575855,
      "grad_norm": 0.3692486873141137,
      "learning_rate": 4.924487021958291e-05,
      "loss": 2.0082,
      "num_input_tokens_seen": 7053356400,
      "step": 8965
    },
    {
      "epoch": 0.9511988117971568,
      "grad_norm": 0.46135919610981463,
      "learning_rate": 4.9244700691906825e-05,
      "loss": 1.8307,
      "num_input_tokens_seen": 7054143264,
      "step": 8966
    },
    {
      "epoch": 0.9513049013367282,
      "grad_norm": 0.5719256454686074,
      "learning_rate": 4.924453114549515e-05,
      "loss": 2.1362,
      "num_input_tokens_seen": 7054930032,
      "step": 8967
    },
    {
      "epoch": 0.9514109908762995,
      "grad_norm": 0.4076166822360545,
      "learning_rate": 4.924436158034801e-05,
      "loss": 1.9857,
      "num_input_tokens_seen": 7055716816,
      "step": 8968
    },
    {
      "epoch": 0.951517080415871,
      "grad_norm": 0.3914703149687726,
      "learning_rate": 4.924419199646554e-05,
      "loss": 1.843,
      "num_input_tokens_seen": 7056503552,
      "step": 8969
    },
    {
      "epoch": 0.9516231699554424,
      "grad_norm": 0.47682741537244633,
      "learning_rate": 4.924402239384787e-05,
      "loss": 1.9122,
      "num_input_tokens_seen": 7057290160,
      "step": 8970
    },
    {
      "epoch": 0.9517292594950137,
      "grad_norm": 0.45515818843430683,
      "learning_rate": 4.924385277249514e-05,
      "loss": 2.0787,
      "num_input_tokens_seen": 7058076944,
      "step": 8971
    },
    {
      "epoch": 0.9518353490345852,
      "grad_norm": 0.4161496993014804,
      "learning_rate": 4.9243683132407456e-05,
      "loss": 2.0222,
      "num_input_tokens_seen": 7058863648,
      "step": 8972
    },
    {
      "epoch": 0.9519414385741566,
      "grad_norm": 0.4257388003427143,
      "learning_rate": 4.924351347358497e-05,
      "loss": 1.8881,
      "num_input_tokens_seen": 7059650336,
      "step": 8973
    },
    {
      "epoch": 0.952047528113728,
      "grad_norm": 0.5297207966194374,
      "learning_rate": 4.924334379602781e-05,
      "loss": 1.9688,
      "num_input_tokens_seen": 7060437120,
      "step": 8974
    },
    {
      "epoch": 0.9521536176532994,
      "grad_norm": 0.4406980517106257,
      "learning_rate": 4.924317409973611e-05,
      "loss": 1.7663,
      "num_input_tokens_seen": 7061223952,
      "step": 8975
    },
    {
      "epoch": 0.9522597071928708,
      "grad_norm": 0.5674076297379839,
      "learning_rate": 4.924300438470999e-05,
      "loss": 1.8776,
      "num_input_tokens_seen": 7062010832,
      "step": 8976
    },
    {
      "epoch": 0.9523657967324421,
      "grad_norm": 0.44374008376863305,
      "learning_rate": 4.9242834650949586e-05,
      "loss": 1.6835,
      "num_input_tokens_seen": 7062797680,
      "step": 8977
    },
    {
      "epoch": 0.9524718862720136,
      "grad_norm": 0.5001963269518364,
      "learning_rate": 4.924266489845504e-05,
      "loss": 1.9827,
      "num_input_tokens_seen": 7063584352,
      "step": 8978
    },
    {
      "epoch": 0.952577975811585,
      "grad_norm": 0.45943884166016224,
      "learning_rate": 4.9242495127226464e-05,
      "loss": 1.8199,
      "num_input_tokens_seen": 7064371136,
      "step": 8979
    },
    {
      "epoch": 0.9526840653511564,
      "grad_norm": 0.4387964612891363,
      "learning_rate": 4.9242325337264e-05,
      "loss": 1.8227,
      "num_input_tokens_seen": 7065157872,
      "step": 8980
    },
    {
      "epoch": 0.9527901548907278,
      "grad_norm": 0.3855645883013608,
      "learning_rate": 4.924215552856778e-05,
      "loss": 1.7316,
      "num_input_tokens_seen": 7065944640,
      "step": 8981
    },
    {
      "epoch": 0.9528962444302992,
      "grad_norm": 0.3677370865808816,
      "learning_rate": 4.924198570113794e-05,
      "loss": 1.9189,
      "num_input_tokens_seen": 7066731472,
      "step": 8982
    },
    {
      "epoch": 0.9530023339698706,
      "grad_norm": 0.4214615313881769,
      "learning_rate": 4.9241815854974594e-05,
      "loss": 1.7706,
      "num_input_tokens_seen": 7067518288,
      "step": 8983
    },
    {
      "epoch": 0.9531084235094419,
      "grad_norm": 0.4610753513676305,
      "learning_rate": 4.924164599007789e-05,
      "loss": 1.8757,
      "num_input_tokens_seen": 7068304976,
      "step": 8984
    },
    {
      "epoch": 0.9532145130490134,
      "grad_norm": 0.9019307976962803,
      "learning_rate": 4.924147610644795e-05,
      "loss": 1.8352,
      "num_input_tokens_seen": 7069091824,
      "step": 8985
    },
    {
      "epoch": 0.9533206025885848,
      "grad_norm": 2.4388376994411347,
      "learning_rate": 4.924130620408491e-05,
      "loss": 1.9735,
      "num_input_tokens_seen": 7069878576,
      "step": 8986
    },
    {
      "epoch": 0.9534266921281561,
      "grad_norm": 0.5078626135779308,
      "learning_rate": 4.924113628298891e-05,
      "loss": 1.8598,
      "num_input_tokens_seen": 7070665376,
      "step": 8987
    },
    {
      "epoch": 0.9535327816677276,
      "grad_norm": 0.899010460779178,
      "learning_rate": 4.9240966343160056e-05,
      "loss": 1.8425,
      "num_input_tokens_seen": 7071452128,
      "step": 8988
    },
    {
      "epoch": 0.953638871207299,
      "grad_norm": 0.48087593335739215,
      "learning_rate": 4.92407963845985e-05,
      "loss": 1.8101,
      "num_input_tokens_seen": 7072238848,
      "step": 8989
    },
    {
      "epoch": 0.9537449607468703,
      "grad_norm": 0.7820535432425854,
      "learning_rate": 4.924062640730437e-05,
      "loss": 1.8782,
      "num_input_tokens_seen": 7073025744,
      "step": 8990
    },
    {
      "epoch": 0.9538510502864418,
      "grad_norm": 0.5301089693741348,
      "learning_rate": 4.924045641127779e-05,
      "loss": 1.8331,
      "num_input_tokens_seen": 7073812512,
      "step": 8991
    },
    {
      "epoch": 0.9539571398260132,
      "grad_norm": 0.5354499164745243,
      "learning_rate": 4.924028639651891e-05,
      "loss": 1.9342,
      "num_input_tokens_seen": 7074599280,
      "step": 8992
    },
    {
      "epoch": 0.9540632293655845,
      "grad_norm": 0.48719026405939364,
      "learning_rate": 4.924011636302783e-05,
      "loss": 2.0615,
      "num_input_tokens_seen": 7075386096,
      "step": 8993
    },
    {
      "epoch": 0.954169318905156,
      "grad_norm": 0.4238978321747309,
      "learning_rate": 4.923994631080471e-05,
      "loss": 1.883,
      "num_input_tokens_seen": 7076172928,
      "step": 8994
    },
    {
      "epoch": 0.9542754084447274,
      "grad_norm": 0.8079874639743179,
      "learning_rate": 4.923977623984967e-05,
      "loss": 1.9239,
      "num_input_tokens_seen": 7076959728,
      "step": 8995
    },
    {
      "epoch": 0.9543814979842987,
      "grad_norm": 0.42036200024480636,
      "learning_rate": 4.923960615016284e-05,
      "loss": 1.9941,
      "num_input_tokens_seen": 7077746544,
      "step": 8996
    },
    {
      "epoch": 0.9544875875238702,
      "grad_norm": 0.9861393279246699,
      "learning_rate": 4.923943604174436e-05,
      "loss": 2.0032,
      "num_input_tokens_seen": 7078533296,
      "step": 8997
    },
    {
      "epoch": 0.9545936770634416,
      "grad_norm": 0.43566622566219826,
      "learning_rate": 4.923926591459435e-05,
      "loss": 1.8724,
      "num_input_tokens_seen": 7079320176,
      "step": 8998
    },
    {
      "epoch": 0.9546997666030129,
      "grad_norm": 1.1009321103372147,
      "learning_rate": 4.923909576871294e-05,
      "loss": 1.8853,
      "num_input_tokens_seen": 7080106928,
      "step": 8999
    },
    {
      "epoch": 0.9548058561425843,
      "grad_norm": 0.5928162312502628,
      "learning_rate": 4.9238925604100275e-05,
      "loss": 1.8546,
      "num_input_tokens_seen": 7080893664,
      "step": 9000
    },
    {
      "epoch": 0.9548058561425843,
      "eval_loss": 1.8638468980789185,
      "eval_runtime": 66.3838,
      "eval_samples_per_second": 45.192,
      "eval_steps_per_second": 0.482,
      "num_input_tokens_seen": 7080893664,
      "step": 9000
    },
    {
      "epoch": 0.9549119456821558,
      "grad_norm": 0.6982203264462047,
      "learning_rate": 4.923875542075648e-05,
      "loss": 1.8261,
      "num_input_tokens_seen": 7081680432,
      "step": 9001
    },
    {
      "epoch": 0.9550180352217271,
      "grad_norm": 0.5771349060202843,
      "learning_rate": 4.923858521868168e-05,
      "loss": 1.9676,
      "num_input_tokens_seen": 7082467152,
      "step": 9002
    },
    {
      "epoch": 0.9551241247612985,
      "grad_norm": 0.44436819268153205,
      "learning_rate": 4.9238414997876015e-05,
      "loss": 1.7902,
      "num_input_tokens_seen": 7083253840,
      "step": 9003
    },
    {
      "epoch": 0.95523021430087,
      "grad_norm": 0.5439855136472174,
      "learning_rate": 4.923824475833961e-05,
      "loss": 1.9303,
      "num_input_tokens_seen": 7084040576,
      "step": 9004
    },
    {
      "epoch": 0.9553363038404413,
      "grad_norm": 0.5628018615938266,
      "learning_rate": 4.9238074500072613e-05,
      "loss": 1.8558,
      "num_input_tokens_seen": 7084827424,
      "step": 9005
    },
    {
      "epoch": 0.9554423933800127,
      "grad_norm": 0.49193540826571086,
      "learning_rate": 4.9237904223075135e-05,
      "loss": 1.8867,
      "num_input_tokens_seen": 7085614256,
      "step": 9006
    },
    {
      "epoch": 0.9555484829195842,
      "grad_norm": 0.5547409889282015,
      "learning_rate": 4.923773392734732e-05,
      "loss": 1.9931,
      "num_input_tokens_seen": 7086401008,
      "step": 9007
    },
    {
      "epoch": 0.9556545724591555,
      "grad_norm": 0.4906372497648702,
      "learning_rate": 4.923756361288929e-05,
      "loss": 1.7453,
      "num_input_tokens_seen": 7087187888,
      "step": 9008
    },
    {
      "epoch": 0.9557606619987269,
      "grad_norm": 0.5098387204205889,
      "learning_rate": 4.923739327970118e-05,
      "loss": 1.926,
      "num_input_tokens_seen": 7087974624,
      "step": 9009
    },
    {
      "epoch": 0.9558667515382984,
      "grad_norm": 0.47476100546972805,
      "learning_rate": 4.9237222927783136e-05,
      "loss": 1.9689,
      "num_input_tokens_seen": 7088761376,
      "step": 9010
    },
    {
      "epoch": 0.9559728410778697,
      "grad_norm": 0.3964672474035015,
      "learning_rate": 4.923705255713527e-05,
      "loss": 1.937,
      "num_input_tokens_seen": 7089548192,
      "step": 9011
    },
    {
      "epoch": 0.9560789306174411,
      "grad_norm": 0.4337896005247675,
      "learning_rate": 4.923688216775772e-05,
      "loss": 1.7701,
      "num_input_tokens_seen": 7090334976,
      "step": 9012
    },
    {
      "epoch": 0.9561850201570126,
      "grad_norm": 0.4532834658264472,
      "learning_rate": 4.923671175965062e-05,
      "loss": 1.8951,
      "num_input_tokens_seen": 7091121824,
      "step": 9013
    },
    {
      "epoch": 0.9562911096965839,
      "grad_norm": 0.392862361364198,
      "learning_rate": 4.92365413328141e-05,
      "loss": 1.9624,
      "num_input_tokens_seen": 7091908624,
      "step": 9014
    },
    {
      "epoch": 0.9563971992361553,
      "grad_norm": 0.5054243935789959,
      "learning_rate": 4.923637088724829e-05,
      "loss": 1.9314,
      "num_input_tokens_seen": 7092695312,
      "step": 9015
    },
    {
      "epoch": 0.9565032887757268,
      "grad_norm": 0.4246036523648765,
      "learning_rate": 4.923620042295333e-05,
      "loss": 1.8305,
      "num_input_tokens_seen": 7093482112,
      "step": 9016
    },
    {
      "epoch": 0.9566093783152981,
      "grad_norm": 0.4959495632204202,
      "learning_rate": 4.9236029939929334e-05,
      "loss": 1.9429,
      "num_input_tokens_seen": 7094268912,
      "step": 9017
    },
    {
      "epoch": 0.9567154678548695,
      "grad_norm": 0.41622177639402835,
      "learning_rate": 4.9235859438176454e-05,
      "loss": 2.0076,
      "num_input_tokens_seen": 7095055584,
      "step": 9018
    },
    {
      "epoch": 0.9568215573944409,
      "grad_norm": 0.46667805185786027,
      "learning_rate": 4.923568891769481e-05,
      "loss": 1.8111,
      "num_input_tokens_seen": 7095842368,
      "step": 9019
    },
    {
      "epoch": 0.9569276469340123,
      "grad_norm": 0.4242158982684173,
      "learning_rate": 4.923551837848454e-05,
      "loss": 1.8733,
      "num_input_tokens_seen": 7096629184,
      "step": 9020
    },
    {
      "epoch": 0.9570337364735837,
      "grad_norm": 0.62306470917201,
      "learning_rate": 4.923534782054577e-05,
      "loss": 1.8031,
      "num_input_tokens_seen": 7097415872,
      "step": 9021
    },
    {
      "epoch": 0.9571398260131551,
      "grad_norm": 0.5158489529319831,
      "learning_rate": 4.923517724387863e-05,
      "loss": 1.8886,
      "num_input_tokens_seen": 7098202672,
      "step": 9022
    },
    {
      "epoch": 0.9572459155527265,
      "grad_norm": 0.7068802815309714,
      "learning_rate": 4.923500664848326e-05,
      "loss": 1.9531,
      "num_input_tokens_seen": 7098989376,
      "step": 9023
    },
    {
      "epoch": 0.9573520050922979,
      "grad_norm": 0.42627129545962955,
      "learning_rate": 4.9234836034359787e-05,
      "loss": 1.9228,
      "num_input_tokens_seen": 7099776144,
      "step": 9024
    },
    {
      "epoch": 0.9574580946318693,
      "grad_norm": 0.4002740434266461,
      "learning_rate": 4.923466540150835e-05,
      "loss": 1.9157,
      "num_input_tokens_seen": 7100563008,
      "step": 9025
    },
    {
      "epoch": 0.9575641841714407,
      "grad_norm": 0.5760736146851269,
      "learning_rate": 4.923449474992907e-05,
      "loss": 1.8783,
      "num_input_tokens_seen": 7101349744,
      "step": 9026
    },
    {
      "epoch": 0.9576702737110121,
      "grad_norm": 0.491731610512634,
      "learning_rate": 4.923432407962208e-05,
      "loss": 1.9851,
      "num_input_tokens_seen": 7102136432,
      "step": 9027
    },
    {
      "epoch": 0.9577763632505835,
      "grad_norm": 0.5982419235838674,
      "learning_rate": 4.923415339058752e-05,
      "loss": 2.0376,
      "num_input_tokens_seen": 7102923120,
      "step": 9028
    },
    {
      "epoch": 0.9578824527901549,
      "grad_norm": 0.47870574811040234,
      "learning_rate": 4.923398268282552e-05,
      "loss": 1.7956,
      "num_input_tokens_seen": 7103709920,
      "step": 9029
    },
    {
      "epoch": 0.9579885423297263,
      "grad_norm": 0.4671079529038371,
      "learning_rate": 4.9233811956336206e-05,
      "loss": 1.7711,
      "num_input_tokens_seen": 7104496736,
      "step": 9030
    },
    {
      "epoch": 0.9580946318692977,
      "grad_norm": 0.46834070782872655,
      "learning_rate": 4.923364121111971e-05,
      "loss": 1.847,
      "num_input_tokens_seen": 7105283584,
      "step": 9031
    },
    {
      "epoch": 0.9582007214088691,
      "grad_norm": 0.5295699777849149,
      "learning_rate": 4.9233470447176164e-05,
      "loss": 1.9541,
      "num_input_tokens_seen": 7106070256,
      "step": 9032
    },
    {
      "epoch": 0.9583068109484405,
      "grad_norm": 0.40220781454058385,
      "learning_rate": 4.9233299664505715e-05,
      "loss": 1.9835,
      "num_input_tokens_seen": 7106856976,
      "step": 9033
    },
    {
      "epoch": 0.9584129004880119,
      "grad_norm": 0.4138677669910481,
      "learning_rate": 4.923312886310848e-05,
      "loss": 1.8729,
      "num_input_tokens_seen": 7107643728,
      "step": 9034
    },
    {
      "epoch": 0.9585189900275832,
      "grad_norm": 0.42640213199616517,
      "learning_rate": 4.923295804298459e-05,
      "loss": 1.8142,
      "num_input_tokens_seen": 7108430560,
      "step": 9035
    },
    {
      "epoch": 0.9586250795671547,
      "grad_norm": 0.3938325362320203,
      "learning_rate": 4.923278720413418e-05,
      "loss": 1.8354,
      "num_input_tokens_seen": 7109217408,
      "step": 9036
    },
    {
      "epoch": 0.9587311691067261,
      "grad_norm": 0.6029178977883163,
      "learning_rate": 4.923261634655739e-05,
      "loss": 2.0776,
      "num_input_tokens_seen": 7110004080,
      "step": 9037
    },
    {
      "epoch": 0.9588372586462974,
      "grad_norm": 0.39296765135235884,
      "learning_rate": 4.923244547025433e-05,
      "loss": 1.8293,
      "num_input_tokens_seen": 7110790880,
      "step": 9038
    },
    {
      "epoch": 0.9589433481858689,
      "grad_norm": 0.4093508993976011,
      "learning_rate": 4.9232274575225165e-05,
      "loss": 1.823,
      "num_input_tokens_seen": 7111577648,
      "step": 9039
    },
    {
      "epoch": 0.9590494377254403,
      "grad_norm": 0.5042830839023427,
      "learning_rate": 4.923210366147e-05,
      "loss": 1.7532,
      "num_input_tokens_seen": 7112364416,
      "step": 9040
    },
    {
      "epoch": 0.9591555272650116,
      "grad_norm": 0.48612397007196545,
      "learning_rate": 4.923193272898898e-05,
      "loss": 1.972,
      "num_input_tokens_seen": 7113151152,
      "step": 9041
    },
    {
      "epoch": 0.9592616168045831,
      "grad_norm": 0.4726423961776692,
      "learning_rate": 4.923176177778223e-05,
      "loss": 1.7605,
      "num_input_tokens_seen": 7113937984,
      "step": 9042
    },
    {
      "epoch": 0.9593677063441545,
      "grad_norm": 0.45403292010659857,
      "learning_rate": 4.9231590807849885e-05,
      "loss": 1.8883,
      "num_input_tokens_seen": 7114724752,
      "step": 9043
    },
    {
      "epoch": 0.9594737958837258,
      "grad_norm": 0.5530251262357874,
      "learning_rate": 4.923141981919208e-05,
      "loss": 2.0715,
      "num_input_tokens_seen": 7115511424,
      "step": 9044
    },
    {
      "epoch": 0.9595798854232973,
      "grad_norm": 0.3780830112088024,
      "learning_rate": 4.923124881180894e-05,
      "loss": 1.8433,
      "num_input_tokens_seen": 7116298080,
      "step": 9045
    },
    {
      "epoch": 0.9596859749628687,
      "grad_norm": 0.4255160021196549,
      "learning_rate": 4.923107778570061e-05,
      "loss": 1.9714,
      "num_input_tokens_seen": 7117084736,
      "step": 9046
    },
    {
      "epoch": 0.95979206450244,
      "grad_norm": 0.4049748044063504,
      "learning_rate": 4.923090674086721e-05,
      "loss": 1.8635,
      "num_input_tokens_seen": 7117871504,
      "step": 9047
    },
    {
      "epoch": 0.9598981540420115,
      "grad_norm": 0.4599812928692458,
      "learning_rate": 4.923073567730888e-05,
      "loss": 1.8655,
      "num_input_tokens_seen": 7118658224,
      "step": 9048
    },
    {
      "epoch": 0.9600042435815829,
      "grad_norm": 0.47005831919078445,
      "learning_rate": 4.923056459502574e-05,
      "loss": 2.0441,
      "num_input_tokens_seen": 7119444992,
      "step": 9049
    },
    {
      "epoch": 0.9601103331211542,
      "grad_norm": 0.4884579351173949,
      "learning_rate": 4.9230393494017936e-05,
      "loss": 2.0076,
      "num_input_tokens_seen": 7120231696,
      "step": 9050
    },
    {
      "epoch": 0.9602164226607256,
      "grad_norm": 0.4488179672872625,
      "learning_rate": 4.923022237428559e-05,
      "loss": 1.9909,
      "num_input_tokens_seen": 7121018464,
      "step": 9051
    },
    {
      "epoch": 0.9603225122002971,
      "grad_norm": 0.43533664347599205,
      "learning_rate": 4.923005123582885e-05,
      "loss": 1.9394,
      "num_input_tokens_seen": 7121805120,
      "step": 9052
    },
    {
      "epoch": 0.9604286017398684,
      "grad_norm": 0.4306791401434331,
      "learning_rate": 4.922988007864783e-05,
      "loss": 1.9545,
      "num_input_tokens_seen": 7122591984,
      "step": 9053
    },
    {
      "epoch": 0.9605346912794398,
      "grad_norm": 0.49573617827966754,
      "learning_rate": 4.922970890274267e-05,
      "loss": 1.941,
      "num_input_tokens_seen": 7123378592,
      "step": 9054
    },
    {
      "epoch": 0.9606407808190113,
      "grad_norm": 0.5105323877551056,
      "learning_rate": 4.922953770811351e-05,
      "loss": 1.9981,
      "num_input_tokens_seen": 7124165280,
      "step": 9055
    },
    {
      "epoch": 0.9607468703585826,
      "grad_norm": 0.410845913366224,
      "learning_rate": 4.922936649476046e-05,
      "loss": 1.8616,
      "num_input_tokens_seen": 7124952064,
      "step": 9056
    },
    {
      "epoch": 0.960852959898154,
      "grad_norm": 0.6446033751488689,
      "learning_rate": 4.922919526268367e-05,
      "loss": 2.0313,
      "num_input_tokens_seen": 7125738752,
      "step": 9057
    },
    {
      "epoch": 0.9609590494377255,
      "grad_norm": 0.46703251740424623,
      "learning_rate": 4.9229024011883274e-05,
      "loss": 1.8905,
      "num_input_tokens_seen": 7126525456,
      "step": 9058
    },
    {
      "epoch": 0.9610651389772968,
      "grad_norm": 0.4924885935019042,
      "learning_rate": 4.92288527423594e-05,
      "loss": 1.9641,
      "num_input_tokens_seen": 7127312272,
      "step": 9059
    },
    {
      "epoch": 0.9611712285168682,
      "grad_norm": 0.41023028622939106,
      "learning_rate": 4.922868145411218e-05,
      "loss": 1.8678,
      "num_input_tokens_seen": 7128099008,
      "step": 9060
    },
    {
      "epoch": 0.9612773180564397,
      "grad_norm": 0.824898620545677,
      "learning_rate": 4.922851014714174e-05,
      "loss": 1.9841,
      "num_input_tokens_seen": 7128885760,
      "step": 9061
    },
    {
      "epoch": 0.961383407596011,
      "grad_norm": 0.6549582271798027,
      "learning_rate": 4.922833882144822e-05,
      "loss": 1.8372,
      "num_input_tokens_seen": 7129672608,
      "step": 9062
    },
    {
      "epoch": 0.9614894971355824,
      "grad_norm": 0.6105007217733879,
      "learning_rate": 4.922816747703175e-05,
      "loss": 1.7236,
      "num_input_tokens_seen": 7130459424,
      "step": 9063
    },
    {
      "epoch": 0.9615955866751539,
      "grad_norm": 0.37138176552305063,
      "learning_rate": 4.922799611389246e-05,
      "loss": 1.8099,
      "num_input_tokens_seen": 7131246304,
      "step": 9064
    },
    {
      "epoch": 0.9617016762147252,
      "grad_norm": 0.6053733363470877,
      "learning_rate": 4.9227824732030493e-05,
      "loss": 1.6962,
      "num_input_tokens_seen": 7132033104,
      "step": 9065
    },
    {
      "epoch": 0.9618077657542966,
      "grad_norm": 0.6749606732671519,
      "learning_rate": 4.922765333144597e-05,
      "loss": 1.9393,
      "num_input_tokens_seen": 7132819872,
      "step": 9066
    },
    {
      "epoch": 0.961913855293868,
      "grad_norm": 0.543693374125232,
      "learning_rate": 4.922748191213903e-05,
      "loss": 1.8806,
      "num_input_tokens_seen": 7133606768,
      "step": 9067
    },
    {
      "epoch": 0.9620199448334394,
      "grad_norm": 1.0270045819614135,
      "learning_rate": 4.92273104741098e-05,
      "loss": 1.8929,
      "num_input_tokens_seen": 7134393520,
      "step": 9068
    },
    {
      "epoch": 0.9621260343730108,
      "grad_norm": 0.670173482931275,
      "learning_rate": 4.922713901735842e-05,
      "loss": 1.8398,
      "num_input_tokens_seen": 7135180336,
      "step": 9069
    },
    {
      "epoch": 0.9622321239125822,
      "grad_norm": 0.5610019604627081,
      "learning_rate": 4.9226967541885016e-05,
      "loss": 1.9836,
      "num_input_tokens_seen": 7135967008,
      "step": 9070
    },
    {
      "epoch": 0.9623382134521536,
      "grad_norm": 0.5115307147149606,
      "learning_rate": 4.9226796047689713e-05,
      "loss": 2.0557,
      "num_input_tokens_seen": 7136753808,
      "step": 9071
    },
    {
      "epoch": 0.962444302991725,
      "grad_norm": 0.5519935057141937,
      "learning_rate": 4.922662453477267e-05,
      "loss": 1.9325,
      "num_input_tokens_seen": 7137540640,
      "step": 9072
    },
    {
      "epoch": 0.9625503925312964,
      "grad_norm": 0.42441481346779586,
      "learning_rate": 4.9226453003133986e-05,
      "loss": 1.952,
      "num_input_tokens_seen": 7138327344,
      "step": 9073
    },
    {
      "epoch": 0.9626564820708678,
      "grad_norm": 0.40234139690002224,
      "learning_rate": 4.922628145277382e-05,
      "loss": 1.8229,
      "num_input_tokens_seen": 7139114048,
      "step": 9074
    },
    {
      "epoch": 0.9627625716104392,
      "grad_norm": 0.46451002894837085,
      "learning_rate": 4.9226109883692293e-05,
      "loss": 1.964,
      "num_input_tokens_seen": 7139900720,
      "step": 9075
    },
    {
      "epoch": 0.9628686611500106,
      "grad_norm": 0.609603330099739,
      "learning_rate": 4.922593829588954e-05,
      "loss": 1.9023,
      "num_input_tokens_seen": 7140687488,
      "step": 9076
    },
    {
      "epoch": 0.962974750689582,
      "grad_norm": 0.40950567243064384,
      "learning_rate": 4.9225766689365685e-05,
      "loss": 1.8786,
      "num_input_tokens_seen": 7141474336,
      "step": 9077
    },
    {
      "epoch": 0.9630808402291534,
      "grad_norm": 0.5717540094944351,
      "learning_rate": 4.922559506412088e-05,
      "loss": 1.9686,
      "num_input_tokens_seen": 7142261072,
      "step": 9078
    },
    {
      "epoch": 0.9631869297687248,
      "grad_norm": 0.5015154352393266,
      "learning_rate": 4.922542342015524e-05,
      "loss": 1.9511,
      "num_input_tokens_seen": 7143047824,
      "step": 9079
    },
    {
      "epoch": 0.9632930193082963,
      "grad_norm": 0.4197774481305875,
      "learning_rate": 4.92252517574689e-05,
      "loss": 1.9172,
      "num_input_tokens_seen": 7143834624,
      "step": 9080
    },
    {
      "epoch": 0.9633991088478676,
      "grad_norm": 0.42760637697464593,
      "learning_rate": 4.9225080076061996e-05,
      "loss": 1.9219,
      "num_input_tokens_seen": 7144621424,
      "step": 9081
    },
    {
      "epoch": 0.963505198387439,
      "grad_norm": 0.45351554682896916,
      "learning_rate": 4.922490837593466e-05,
      "loss": 2.0306,
      "num_input_tokens_seen": 7145408192,
      "step": 9082
    },
    {
      "epoch": 0.9636112879270105,
      "grad_norm": 0.4939674890043966,
      "learning_rate": 4.922473665708704e-05,
      "loss": 1.7518,
      "num_input_tokens_seen": 7146194960,
      "step": 9083
    },
    {
      "epoch": 0.9637173774665818,
      "grad_norm": 0.4133060304955945,
      "learning_rate": 4.922456491951924e-05,
      "loss": 1.9326,
      "num_input_tokens_seen": 7146981712,
      "step": 9084
    },
    {
      "epoch": 0.9638234670061532,
      "grad_norm": 0.463325572686312,
      "learning_rate": 4.922439316323141e-05,
      "loss": 1.9793,
      "num_input_tokens_seen": 7147768432,
      "step": 9085
    },
    {
      "epoch": 0.9639295565457245,
      "grad_norm": 0.513211734640071,
      "learning_rate": 4.922422138822368e-05,
      "loss": 2.0185,
      "num_input_tokens_seen": 7148555200,
      "step": 9086
    },
    {
      "epoch": 0.964035646085296,
      "grad_norm": 0.3941624615842579,
      "learning_rate": 4.922404959449619e-05,
      "loss": 1.8748,
      "num_input_tokens_seen": 7149342048,
      "step": 9087
    },
    {
      "epoch": 0.9641417356248674,
      "grad_norm": 0.5810828623441747,
      "learning_rate": 4.922387778204905e-05,
      "loss": 1.8902,
      "num_input_tokens_seen": 7150128960,
      "step": 9088
    },
    {
      "epoch": 0.9642478251644387,
      "grad_norm": 0.4277132404158313,
      "learning_rate": 4.922370595088242e-05,
      "loss": 1.8536,
      "num_input_tokens_seen": 7150915632,
      "step": 9089
    },
    {
      "epoch": 0.9643539147040102,
      "grad_norm": 0.5004339882528364,
      "learning_rate": 4.9223534100996414e-05,
      "loss": 1.9656,
      "num_input_tokens_seen": 7151702304,
      "step": 9090
    },
    {
      "epoch": 0.9644600042435816,
      "grad_norm": 0.41492323411985227,
      "learning_rate": 4.9223362232391177e-05,
      "loss": 1.9457,
      "num_input_tokens_seen": 7152489040,
      "step": 9091
    },
    {
      "epoch": 0.964566093783153,
      "grad_norm": 0.42757740474454003,
      "learning_rate": 4.9223190345066836e-05,
      "loss": 1.9438,
      "num_input_tokens_seen": 7153275696,
      "step": 9092
    },
    {
      "epoch": 0.9646721833227244,
      "grad_norm": 0.4132133043601668,
      "learning_rate": 4.922301843902353e-05,
      "loss": 1.8407,
      "num_input_tokens_seen": 7154062448,
      "step": 9093
    },
    {
      "epoch": 0.9647782728622958,
      "grad_norm": 0.3786393596067886,
      "learning_rate": 4.922284651426138e-05,
      "loss": 1.7573,
      "num_input_tokens_seen": 7154849216,
      "step": 9094
    },
    {
      "epoch": 0.9648843624018671,
      "grad_norm": 0.35493044493340553,
      "learning_rate": 4.922267457078052e-05,
      "loss": 1.8314,
      "num_input_tokens_seen": 7155636000,
      "step": 9095
    },
    {
      "epoch": 0.9649904519414386,
      "grad_norm": 0.4537252800009989,
      "learning_rate": 4.922250260858109e-05,
      "loss": 1.8984,
      "num_input_tokens_seen": 7156422736,
      "step": 9096
    },
    {
      "epoch": 0.96509654148101,
      "grad_norm": 0.37415087540873776,
      "learning_rate": 4.922233062766322e-05,
      "loss": 1.8953,
      "num_input_tokens_seen": 7157209520,
      "step": 9097
    },
    {
      "epoch": 0.9652026310205813,
      "grad_norm": 0.3442464348764156,
      "learning_rate": 4.9222158628027045e-05,
      "loss": 1.7813,
      "num_input_tokens_seen": 7157996368,
      "step": 9098
    },
    {
      "epoch": 0.9653087205601528,
      "grad_norm": 0.4096304570271717,
      "learning_rate": 4.92219866096727e-05,
      "loss": 1.9086,
      "num_input_tokens_seen": 7158783104,
      "step": 9099
    },
    {
      "epoch": 0.9654148100997242,
      "grad_norm": 0.37697400420993843,
      "learning_rate": 4.922181457260031e-05,
      "loss": 1.9234,
      "num_input_tokens_seen": 7159569824,
      "step": 9100
    },
    {
      "epoch": 0.9655208996392955,
      "grad_norm": 0.48440484200810313,
      "learning_rate": 4.9221642516810015e-05,
      "loss": 1.9004,
      "num_input_tokens_seen": 7160356592,
      "step": 9101
    },
    {
      "epoch": 0.9656269891788669,
      "grad_norm": 0.3768756024603363,
      "learning_rate": 4.922147044230195e-05,
      "loss": 1.9692,
      "num_input_tokens_seen": 7161143360,
      "step": 9102
    },
    {
      "epoch": 0.9657330787184384,
      "grad_norm": 0.5653522946882596,
      "learning_rate": 4.922129834907624e-05,
      "loss": 1.9761,
      "num_input_tokens_seen": 7161930160,
      "step": 9103
    },
    {
      "epoch": 0.9658391682580098,
      "grad_norm": 0.382019290669691,
      "learning_rate": 4.922112623713302e-05,
      "loss": 1.8078,
      "num_input_tokens_seen": 7162716912,
      "step": 9104
    },
    {
      "epoch": 0.9659452577975811,
      "grad_norm": 0.5165266740811263,
      "learning_rate": 4.922095410647242e-05,
      "loss": 1.6277,
      "num_input_tokens_seen": 7163503712,
      "step": 9105
    },
    {
      "epoch": 0.9660513473371526,
      "grad_norm": 0.5343981914715421,
      "learning_rate": 4.922078195709458e-05,
      "loss": 1.8834,
      "num_input_tokens_seen": 7164290544,
      "step": 9106
    },
    {
      "epoch": 0.966157436876724,
      "grad_norm": 0.4204607897512371,
      "learning_rate": 4.9220609788999636e-05,
      "loss": 2.0015,
      "num_input_tokens_seen": 7165077360,
      "step": 9107
    },
    {
      "epoch": 0.9662635264162953,
      "grad_norm": 0.5070273818040303,
      "learning_rate": 4.922043760218771e-05,
      "loss": 1.9733,
      "num_input_tokens_seen": 7165864128,
      "step": 9108
    },
    {
      "epoch": 0.9663696159558668,
      "grad_norm": 0.43859144223811014,
      "learning_rate": 4.922026539665894e-05,
      "loss": 2.0512,
      "num_input_tokens_seen": 7166650864,
      "step": 9109
    },
    {
      "epoch": 0.9664757054954382,
      "grad_norm": 0.5913238658099557,
      "learning_rate": 4.922009317241346e-05,
      "loss": 2.0274,
      "num_input_tokens_seen": 7167437536,
      "step": 9110
    },
    {
      "epoch": 0.9665817950350095,
      "grad_norm": 0.4204377299297012,
      "learning_rate": 4.92199209294514e-05,
      "loss": 1.9432,
      "num_input_tokens_seen": 7168224256,
      "step": 9111
    },
    {
      "epoch": 0.966687884574581,
      "grad_norm": 0.3985560748757116,
      "learning_rate": 4.92197486677729e-05,
      "loss": 1.9033,
      "num_input_tokens_seen": 7169010960,
      "step": 9112
    },
    {
      "epoch": 0.9667939741141524,
      "grad_norm": 0.6389040784294757,
      "learning_rate": 4.921957638737809e-05,
      "loss": 2.0131,
      "num_input_tokens_seen": 7169797664,
      "step": 9113
    },
    {
      "epoch": 0.9669000636537237,
      "grad_norm": 0.4449381488143152,
      "learning_rate": 4.9219404088267104e-05,
      "loss": 1.8682,
      "num_input_tokens_seen": 7170584368,
      "step": 9114
    },
    {
      "epoch": 0.9670061531932952,
      "grad_norm": 0.5799303563461113,
      "learning_rate": 4.9219231770440064e-05,
      "loss": 1.9312,
      "num_input_tokens_seen": 7171371056,
      "step": 9115
    },
    {
      "epoch": 0.9671122427328666,
      "grad_norm": 0.3892247034951994,
      "learning_rate": 4.921905943389712e-05,
      "loss": 1.7243,
      "num_input_tokens_seen": 7172157888,
      "step": 9116
    },
    {
      "epoch": 0.9672183322724379,
      "grad_norm": 0.6155295158032472,
      "learning_rate": 4.92188870786384e-05,
      "loss": 1.8496,
      "num_input_tokens_seen": 7172944608,
      "step": 9117
    },
    {
      "epoch": 0.9673244218120093,
      "grad_norm": 0.38880177836688745,
      "learning_rate": 4.9218714704664024e-05,
      "loss": 1.9333,
      "num_input_tokens_seen": 7173731440,
      "step": 9118
    },
    {
      "epoch": 0.9674305113515808,
      "grad_norm": 0.6454861025943396,
      "learning_rate": 4.9218542311974145e-05,
      "loss": 1.71,
      "num_input_tokens_seen": 7174518240,
      "step": 9119
    },
    {
      "epoch": 0.9675366008911521,
      "grad_norm": 0.45533455021864044,
      "learning_rate": 4.9218369900568884e-05,
      "loss": 1.9802,
      "num_input_tokens_seen": 7175304912,
      "step": 9120
    },
    {
      "epoch": 0.9676426904307235,
      "grad_norm": 0.8102333189981931,
      "learning_rate": 4.921819747044838e-05,
      "loss": 1.8851,
      "num_input_tokens_seen": 7176091744,
      "step": 9121
    },
    {
      "epoch": 0.967748779970295,
      "grad_norm": 0.45187430714996657,
      "learning_rate": 4.9218025021612754e-05,
      "loss": 1.747,
      "num_input_tokens_seen": 7176878560,
      "step": 9122
    },
    {
      "epoch": 0.9678548695098663,
      "grad_norm": 0.551689212871096,
      "learning_rate": 4.921785255406216e-05,
      "loss": 1.9547,
      "num_input_tokens_seen": 7177665360,
      "step": 9123
    },
    {
      "epoch": 0.9679609590494377,
      "grad_norm": 0.5020057897862972,
      "learning_rate": 4.921768006779672e-05,
      "loss": 1.8351,
      "num_input_tokens_seen": 7178452208,
      "step": 9124
    },
    {
      "epoch": 0.9680670485890092,
      "grad_norm": 0.4189505695404418,
      "learning_rate": 4.9217507562816565e-05,
      "loss": 1.8847,
      "num_input_tokens_seen": 7179238944,
      "step": 9125
    },
    {
      "epoch": 0.9681731381285805,
      "grad_norm": 0.7089090035861517,
      "learning_rate": 4.9217335039121826e-05,
      "loss": 1.9557,
      "num_input_tokens_seen": 7180025680,
      "step": 9126
    },
    {
      "epoch": 0.9682792276681519,
      "grad_norm": 0.48174783670197496,
      "learning_rate": 4.9217162496712646e-05,
      "loss": 1.8285,
      "num_input_tokens_seen": 7180812416,
      "step": 9127
    },
    {
      "epoch": 0.9683853172077234,
      "grad_norm": 0.47832199860472907,
      "learning_rate": 4.9216989935589154e-05,
      "loss": 1.7784,
      "num_input_tokens_seen": 7181599168,
      "step": 9128
    },
    {
      "epoch": 0.9684914067472947,
      "grad_norm": 0.6415608053025252,
      "learning_rate": 4.921681735575148e-05,
      "loss": 1.8464,
      "num_input_tokens_seen": 7182385984,
      "step": 9129
    },
    {
      "epoch": 0.9685974962868661,
      "grad_norm": 0.41735999992728273,
      "learning_rate": 4.9216644757199756e-05,
      "loss": 1.7735,
      "num_input_tokens_seen": 7183172784,
      "step": 9130
    },
    {
      "epoch": 0.9687035858264376,
      "grad_norm": 0.5909062536029337,
      "learning_rate": 4.921647213993412e-05,
      "loss": 1.9817,
      "num_input_tokens_seen": 7183959488,
      "step": 9131
    },
    {
      "epoch": 0.9688096753660089,
      "grad_norm": 0.4544878122556943,
      "learning_rate": 4.921629950395471e-05,
      "loss": 1.8672,
      "num_input_tokens_seen": 7184746288,
      "step": 9132
    },
    {
      "epoch": 0.9689157649055803,
      "grad_norm": 0.6987811278914503,
      "learning_rate": 4.9216126849261656e-05,
      "loss": 1.735,
      "num_input_tokens_seen": 7185533072,
      "step": 9133
    },
    {
      "epoch": 0.9690218544451517,
      "grad_norm": 0.44337215003864683,
      "learning_rate": 4.921595417585509e-05,
      "loss": 1.9061,
      "num_input_tokens_seen": 7186319856,
      "step": 9134
    },
    {
      "epoch": 0.9691279439847231,
      "grad_norm": 0.5642842718964542,
      "learning_rate": 4.921578148373514e-05,
      "loss": 1.9086,
      "num_input_tokens_seen": 7187106608,
      "step": 9135
    },
    {
      "epoch": 0.9692340335242945,
      "grad_norm": 0.4089838994732461,
      "learning_rate": 4.9215608772901944e-05,
      "loss": 1.8769,
      "num_input_tokens_seen": 7187893456,
      "step": 9136
    },
    {
      "epoch": 0.9693401230638659,
      "grad_norm": 0.6448407689472152,
      "learning_rate": 4.921543604335565e-05,
      "loss": 1.8908,
      "num_input_tokens_seen": 7188680208,
      "step": 9137
    },
    {
      "epoch": 0.9694462126034373,
      "grad_norm": 0.48471674707157064,
      "learning_rate": 4.921526329509636e-05,
      "loss": 1.8502,
      "num_input_tokens_seen": 7189467008,
      "step": 9138
    },
    {
      "epoch": 0.9695523021430087,
      "grad_norm": 0.8522346058892192,
      "learning_rate": 4.921509052812423e-05,
      "loss": 2.0532,
      "num_input_tokens_seen": 7190253712,
      "step": 9139
    },
    {
      "epoch": 0.9696583916825801,
      "grad_norm": 0.5165017072169894,
      "learning_rate": 4.921491774243939e-05,
      "loss": 1.9339,
      "num_input_tokens_seen": 7191040416,
      "step": 9140
    },
    {
      "epoch": 0.9697644812221515,
      "grad_norm": 0.7930988548737324,
      "learning_rate": 4.921474493804197e-05,
      "loss": 2.0224,
      "num_input_tokens_seen": 7191827104,
      "step": 9141
    },
    {
      "epoch": 0.9698705707617229,
      "grad_norm": 0.43717623900540503,
      "learning_rate": 4.921457211493211e-05,
      "loss": 1.9058,
      "num_input_tokens_seen": 7192613888,
      "step": 9142
    },
    {
      "epoch": 0.9699766603012943,
      "grad_norm": 0.6730884844489222,
      "learning_rate": 4.9214399273109936e-05,
      "loss": 1.842,
      "num_input_tokens_seen": 7193400592,
      "step": 9143
    },
    {
      "epoch": 0.9700827498408657,
      "grad_norm": 0.4094944391339564,
      "learning_rate": 4.9214226412575585e-05,
      "loss": 1.9257,
      "num_input_tokens_seen": 7194187280,
      "step": 9144
    },
    {
      "epoch": 0.9701888393804371,
      "grad_norm": 0.44752110562509456,
      "learning_rate": 4.921405353332919e-05,
      "loss": 1.8135,
      "num_input_tokens_seen": 7194974064,
      "step": 9145
    },
    {
      "epoch": 0.9702949289200085,
      "grad_norm": 0.4900932548006158,
      "learning_rate": 4.921388063537089e-05,
      "loss": 1.8503,
      "num_input_tokens_seen": 7195760864,
      "step": 9146
    },
    {
      "epoch": 0.9704010184595799,
      "grad_norm": 0.48597184326632326,
      "learning_rate": 4.921370771870081e-05,
      "loss": 1.9398,
      "num_input_tokens_seen": 7196547632,
      "step": 9147
    },
    {
      "epoch": 0.9705071079991513,
      "grad_norm": 0.5188138828608437,
      "learning_rate": 4.921353478331908e-05,
      "loss": 2.1204,
      "num_input_tokens_seen": 7197334400,
      "step": 9148
    },
    {
      "epoch": 0.9706131975387227,
      "grad_norm": 0.39187701032681393,
      "learning_rate": 4.921336182922585e-05,
      "loss": 1.7903,
      "num_input_tokens_seen": 7198121136,
      "step": 9149
    },
    {
      "epoch": 0.9707192870782941,
      "grad_norm": 0.5335032806568768,
      "learning_rate": 4.921318885642124e-05,
      "loss": 2.0211,
      "num_input_tokens_seen": 7198907776,
      "step": 9150
    },
    {
      "epoch": 0.9708253766178655,
      "grad_norm": 0.39311229196817743,
      "learning_rate": 4.921301586490539e-05,
      "loss": 1.933,
      "num_input_tokens_seen": 7199694576,
      "step": 9151
    },
    {
      "epoch": 0.9709314661574369,
      "grad_norm": 0.47661354314627447,
      "learning_rate": 4.921284285467843e-05,
      "loss": 1.8014,
      "num_input_tokens_seen": 7200481392,
      "step": 9152
    },
    {
      "epoch": 0.9710375556970082,
      "grad_norm": 0.4971987263163651,
      "learning_rate": 4.9212669825740496e-05,
      "loss": 1.8865,
      "num_input_tokens_seen": 7201268160,
      "step": 9153
    },
    {
      "epoch": 0.9711436452365797,
      "grad_norm": 0.47491814173640634,
      "learning_rate": 4.921249677809173e-05,
      "loss": 1.7651,
      "num_input_tokens_seen": 7202054912,
      "step": 9154
    },
    {
      "epoch": 0.9712497347761511,
      "grad_norm": 0.44437562641733885,
      "learning_rate": 4.921232371173225e-05,
      "loss": 2.0027,
      "num_input_tokens_seen": 7202841648,
      "step": 9155
    },
    {
      "epoch": 0.9713558243157224,
      "grad_norm": 0.45913113972651604,
      "learning_rate": 4.921215062666219e-05,
      "loss": 1.8338,
      "num_input_tokens_seen": 7203628400,
      "step": 9156
    },
    {
      "epoch": 0.9714619138552939,
      "grad_norm": 0.46955488402933027,
      "learning_rate": 4.92119775228817e-05,
      "loss": 1.828,
      "num_input_tokens_seen": 7204415168,
      "step": 9157
    },
    {
      "epoch": 0.9715680033948653,
      "grad_norm": 0.45910580865542056,
      "learning_rate": 4.92118044003909e-05,
      "loss": 1.9186,
      "num_input_tokens_seen": 7205201952,
      "step": 9158
    },
    {
      "epoch": 0.9716740929344366,
      "grad_norm": 0.4358988909278131,
      "learning_rate": 4.921163125918993e-05,
      "loss": 1.821,
      "num_input_tokens_seen": 7205988736,
      "step": 9159
    },
    {
      "epoch": 0.9717801824740081,
      "grad_norm": 0.4430169292712745,
      "learning_rate": 4.9211458099278916e-05,
      "loss": 1.9322,
      "num_input_tokens_seen": 7206775456,
      "step": 9160
    },
    {
      "epoch": 0.9718862720135795,
      "grad_norm": 0.49516990167437464,
      "learning_rate": 4.9211284920658004e-05,
      "loss": 2.006,
      "num_input_tokens_seen": 7207562288,
      "step": 9161
    },
    {
      "epoch": 0.9719923615531508,
      "grad_norm": 0.6930237745810347,
      "learning_rate": 4.921111172332732e-05,
      "loss": 1.7486,
      "num_input_tokens_seen": 7208349072,
      "step": 9162
    },
    {
      "epoch": 0.9720984510927223,
      "grad_norm": 0.4918028477776124,
      "learning_rate": 4.9210938507287e-05,
      "loss": 1.8899,
      "num_input_tokens_seen": 7209135840,
      "step": 9163
    },
    {
      "epoch": 0.9722045406322937,
      "grad_norm": 0.4776379686051055,
      "learning_rate": 4.921076527253717e-05,
      "loss": 1.7803,
      "num_input_tokens_seen": 7209922752,
      "step": 9164
    },
    {
      "epoch": 0.972310630171865,
      "grad_norm": 0.41691224497344087,
      "learning_rate": 4.921059201907798e-05,
      "loss": 1.9937,
      "num_input_tokens_seen": 7210709408,
      "step": 9165
    },
    {
      "epoch": 0.9724167197114365,
      "grad_norm": 0.41906531362441324,
      "learning_rate": 4.921041874690955e-05,
      "loss": 1.7711,
      "num_input_tokens_seen": 7211496224,
      "step": 9166
    },
    {
      "epoch": 0.9725228092510079,
      "grad_norm": 0.5706581636210829,
      "learning_rate": 4.9210245456032024e-05,
      "loss": 2.0032,
      "num_input_tokens_seen": 7212282944,
      "step": 9167
    },
    {
      "epoch": 0.9726288987905792,
      "grad_norm": 0.47217769302681856,
      "learning_rate": 4.921007214644552e-05,
      "loss": 1.915,
      "num_input_tokens_seen": 7213069712,
      "step": 9168
    },
    {
      "epoch": 0.9727349883301506,
      "grad_norm": 0.6035543692851806,
      "learning_rate": 4.9209898818150194e-05,
      "loss": 1.6881,
      "num_input_tokens_seen": 7213856432,
      "step": 9169
    },
    {
      "epoch": 0.9728410778697221,
      "grad_norm": 0.5462539459540677,
      "learning_rate": 4.920972547114616e-05,
      "loss": 1.8529,
      "num_input_tokens_seen": 7214643184,
      "step": 9170
    },
    {
      "epoch": 0.9729471674092934,
      "grad_norm": 0.6440792589492116,
      "learning_rate": 4.9209552105433565e-05,
      "loss": 2.0002,
      "num_input_tokens_seen": 7215429920,
      "step": 9171
    },
    {
      "epoch": 0.9730532569488648,
      "grad_norm": 0.5636195404728703,
      "learning_rate": 4.920937872101254e-05,
      "loss": 1.8685,
      "num_input_tokens_seen": 7216216720,
      "step": 9172
    },
    {
      "epoch": 0.9731593464884363,
      "grad_norm": 0.6600453095758441,
      "learning_rate": 4.920920531788321e-05,
      "loss": 1.9314,
      "num_input_tokens_seen": 7217003472,
      "step": 9173
    },
    {
      "epoch": 0.9732654360280076,
      "grad_norm": 0.4217359289353374,
      "learning_rate": 4.9209031896045723e-05,
      "loss": 1.889,
      "num_input_tokens_seen": 7217790272,
      "step": 9174
    },
    {
      "epoch": 0.973371525567579,
      "grad_norm": 0.5909809562737036,
      "learning_rate": 4.920885845550021e-05,
      "loss": 1.7769,
      "num_input_tokens_seen": 7218577056,
      "step": 9175
    },
    {
      "epoch": 0.9734776151071505,
      "grad_norm": 0.38893642617140084,
      "learning_rate": 4.92086849962468e-05,
      "loss": 1.7457,
      "num_input_tokens_seen": 7219363888,
      "step": 9176
    },
    {
      "epoch": 0.9735837046467218,
      "grad_norm": 0.41768076294476186,
      "learning_rate": 4.920851151828562e-05,
      "loss": 1.7969,
      "num_input_tokens_seen": 7220150672,
      "step": 9177
    },
    {
      "epoch": 0.9736897941862932,
      "grad_norm": 0.4733822172989253,
      "learning_rate": 4.9208338021616815e-05,
      "loss": 1.9212,
      "num_input_tokens_seen": 7220937408,
      "step": 9178
    },
    {
      "epoch": 0.9737958837258647,
      "grad_norm": 0.42451116763382907,
      "learning_rate": 4.9208164506240526e-05,
      "loss": 1.8426,
      "num_input_tokens_seen": 7221724208,
      "step": 9179
    },
    {
      "epoch": 0.973901973265436,
      "grad_norm": 0.5268710480119456,
      "learning_rate": 4.920799097215687e-05,
      "loss": 1.7461,
      "num_input_tokens_seen": 7222511008,
      "step": 9180
    },
    {
      "epoch": 0.9740080628050074,
      "grad_norm": 0.4129758972464317,
      "learning_rate": 4.9207817419365985e-05,
      "loss": 1.8127,
      "num_input_tokens_seen": 7223297792,
      "step": 9181
    },
    {
      "epoch": 0.9741141523445789,
      "grad_norm": 0.4029978476341839,
      "learning_rate": 4.9207643847868024e-05,
      "loss": 1.6759,
      "num_input_tokens_seen": 7224084720,
      "step": 9182
    },
    {
      "epoch": 0.9742202418841502,
      "grad_norm": 0.5148943492423875,
      "learning_rate": 4.920747025766309e-05,
      "loss": 1.9024,
      "num_input_tokens_seen": 7224871472,
      "step": 9183
    },
    {
      "epoch": 0.9743263314237216,
      "grad_norm": 0.43084531901828327,
      "learning_rate": 4.9207296648751345e-05,
      "loss": 1.9861,
      "num_input_tokens_seen": 7225658224,
      "step": 9184
    },
    {
      "epoch": 0.974432420963293,
      "grad_norm": 0.562120936009672,
      "learning_rate": 4.9207123021132904e-05,
      "loss": 1.9449,
      "num_input_tokens_seen": 7226444976,
      "step": 9185
    },
    {
      "epoch": 0.9745385105028644,
      "grad_norm": 0.4201545324806557,
      "learning_rate": 4.920694937480791e-05,
      "loss": 1.827,
      "num_input_tokens_seen": 7227231728,
      "step": 9186
    },
    {
      "epoch": 0.9746446000424358,
      "grad_norm": 0.8860710269786211,
      "learning_rate": 4.92067757097765e-05,
      "loss": 1.8944,
      "num_input_tokens_seen": 7228018480,
      "step": 9187
    },
    {
      "epoch": 0.9747506895820072,
      "grad_norm": 0.5069891524677952,
      "learning_rate": 4.920660202603879e-05,
      "loss": 1.8522,
      "num_input_tokens_seen": 7228805168,
      "step": 9188
    },
    {
      "epoch": 0.9748567791215786,
      "grad_norm": 0.6604973906720241,
      "learning_rate": 4.9206428323594945e-05,
      "loss": 1.9131,
      "num_input_tokens_seen": 7229591936,
      "step": 9189
    },
    {
      "epoch": 0.97496286866115,
      "grad_norm": 0.40840289103580313,
      "learning_rate": 4.920625460244508e-05,
      "loss": 1.8166,
      "num_input_tokens_seen": 7230378688,
      "step": 9190
    },
    {
      "epoch": 0.9750689582007214,
      "grad_norm": 0.6601960819821983,
      "learning_rate": 4.9206080862589326e-05,
      "loss": 2.0153,
      "num_input_tokens_seen": 7231165424,
      "step": 9191
    },
    {
      "epoch": 0.9751750477402928,
      "grad_norm": 0.34720289944132837,
      "learning_rate": 4.9205907104027825e-05,
      "loss": 1.8694,
      "num_input_tokens_seen": 7231952288,
      "step": 9192
    },
    {
      "epoch": 0.9752811372798642,
      "grad_norm": 0.5137291016713812,
      "learning_rate": 4.920573332676071e-05,
      "loss": 1.8694,
      "num_input_tokens_seen": 7232739088,
      "step": 9193
    },
    {
      "epoch": 0.9753872268194356,
      "grad_norm": 0.7127589349745042,
      "learning_rate": 4.920555953078812e-05,
      "loss": 1.9286,
      "num_input_tokens_seen": 7233525856,
      "step": 9194
    },
    {
      "epoch": 0.975493316359007,
      "grad_norm": 0.4714793751556091,
      "learning_rate": 4.9205385716110175e-05,
      "loss": 1.7727,
      "num_input_tokens_seen": 7234312576,
      "step": 9195
    },
    {
      "epoch": 0.9755994058985784,
      "grad_norm": 0.6392325861621665,
      "learning_rate": 4.920521188272702e-05,
      "loss": 1.9498,
      "num_input_tokens_seen": 7235099456,
      "step": 9196
    },
    {
      "epoch": 0.9757054954381498,
      "grad_norm": 0.4418243821025805,
      "learning_rate": 4.9205038030638786e-05,
      "loss": 1.8265,
      "num_input_tokens_seen": 7235886320,
      "step": 9197
    },
    {
      "epoch": 0.9758115849777212,
      "grad_norm": 0.6696466379523256,
      "learning_rate": 4.920486415984561e-05,
      "loss": 1.9295,
      "num_input_tokens_seen": 7236673104,
      "step": 9198
    },
    {
      "epoch": 0.9759176745172926,
      "grad_norm": 0.4286509400908114,
      "learning_rate": 4.9204690270347634e-05,
      "loss": 2.075,
      "num_input_tokens_seen": 7237459920,
      "step": 9199
    },
    {
      "epoch": 0.976023764056864,
      "grad_norm": 0.5494211403107645,
      "learning_rate": 4.920451636214497e-05,
      "loss": 1.9122,
      "num_input_tokens_seen": 7238246656,
      "step": 9200
    },
    {
      "epoch": 0.9761298535964353,
      "grad_norm": 0.4413054164525232,
      "learning_rate": 4.920434243523777e-05,
      "loss": 1.9136,
      "num_input_tokens_seen": 7239033424,
      "step": 9201
    },
    {
      "epoch": 0.9762359431360068,
      "grad_norm": 0.4111253299286517,
      "learning_rate": 4.920416848962617e-05,
      "loss": 1.8305,
      "num_input_tokens_seen": 7239820192,
      "step": 9202
    },
    {
      "epoch": 0.9763420326755782,
      "grad_norm": 0.40820888728452054,
      "learning_rate": 4.920399452531029e-05,
      "loss": 1.9691,
      "num_input_tokens_seen": 7240606944,
      "step": 9203
    },
    {
      "epoch": 0.9764481222151495,
      "grad_norm": 0.5042356386991678,
      "learning_rate": 4.920382054229028e-05,
      "loss": 1.9034,
      "num_input_tokens_seen": 7241393712,
      "step": 9204
    },
    {
      "epoch": 0.976554211754721,
      "grad_norm": 0.4668029318542745,
      "learning_rate": 4.9203646540566266e-05,
      "loss": 1.9544,
      "num_input_tokens_seen": 7242180656,
      "step": 9205
    },
    {
      "epoch": 0.9766603012942924,
      "grad_norm": 0.39464962127903513,
      "learning_rate": 4.920347252013838e-05,
      "loss": 1.839,
      "num_input_tokens_seen": 7242967360,
      "step": 9206
    },
    {
      "epoch": 0.9767663908338637,
      "grad_norm": 0.4546615078945548,
      "learning_rate": 4.9203298481006766e-05,
      "loss": 1.9561,
      "num_input_tokens_seen": 7243754128,
      "step": 9207
    },
    {
      "epoch": 0.9768724803734352,
      "grad_norm": 0.4112050247486111,
      "learning_rate": 4.920312442317155e-05,
      "loss": 1.9878,
      "num_input_tokens_seen": 7244540880,
      "step": 9208
    },
    {
      "epoch": 0.9769785699130066,
      "grad_norm": 0.39151118157661907,
      "learning_rate": 4.920295034663288e-05,
      "loss": 1.9324,
      "num_input_tokens_seen": 7245327680,
      "step": 9209
    },
    {
      "epoch": 0.9770846594525779,
      "grad_norm": 0.33086786803677043,
      "learning_rate": 4.920277625139087e-05,
      "loss": 1.8006,
      "num_input_tokens_seen": 7246114448,
      "step": 9210
    },
    {
      "epoch": 0.9771907489921494,
      "grad_norm": 0.3991399115781368,
      "learning_rate": 4.9202602137445666e-05,
      "loss": 1.9207,
      "num_input_tokens_seen": 7246901152,
      "step": 9211
    },
    {
      "epoch": 0.9772968385317208,
      "grad_norm": 0.3262141225616353,
      "learning_rate": 4.9202428004797396e-05,
      "loss": 1.8728,
      "num_input_tokens_seen": 7247687872,
      "step": 9212
    },
    {
      "epoch": 0.9774029280712921,
      "grad_norm": 0.3536148320182824,
      "learning_rate": 4.920225385344621e-05,
      "loss": 1.8258,
      "num_input_tokens_seen": 7248474640,
      "step": 9213
    },
    {
      "epoch": 0.9775090176108636,
      "grad_norm": 0.5180975476936014,
      "learning_rate": 4.920207968339223e-05,
      "loss": 1.9489,
      "num_input_tokens_seen": 7249261408,
      "step": 9214
    },
    {
      "epoch": 0.977615107150435,
      "grad_norm": 0.4510385350701858,
      "learning_rate": 4.9201905494635584e-05,
      "loss": 1.8717,
      "num_input_tokens_seen": 7250048208,
      "step": 9215
    },
    {
      "epoch": 0.9777211966900063,
      "grad_norm": 0.45441877470459535,
      "learning_rate": 4.920173128717642e-05,
      "loss": 1.9497,
      "num_input_tokens_seen": 7250834976,
      "step": 9216
    },
    {
      "epoch": 0.9778272862295778,
      "grad_norm": 0.42578858909653294,
      "learning_rate": 4.9201557061014876e-05,
      "loss": 1.8145,
      "num_input_tokens_seen": 7251621760,
      "step": 9217
    },
    {
      "epoch": 0.9779333757691492,
      "grad_norm": 0.5036280182632827,
      "learning_rate": 4.920138281615107e-05,
      "loss": 1.7911,
      "num_input_tokens_seen": 7252408528,
      "step": 9218
    },
    {
      "epoch": 0.9780394653087205,
      "grad_norm": 0.48210380069201153,
      "learning_rate": 4.9201208552585146e-05,
      "loss": 1.9155,
      "num_input_tokens_seen": 7253195184,
      "step": 9219
    },
    {
      "epoch": 0.9781455548482919,
      "grad_norm": 0.45108575402346135,
      "learning_rate": 4.920103427031725e-05,
      "loss": 1.9915,
      "num_input_tokens_seen": 7253981856,
      "step": 9220
    },
    {
      "epoch": 0.9782516443878634,
      "grad_norm": 0.46215121934326503,
      "learning_rate": 4.920085996934749e-05,
      "loss": 1.871,
      "num_input_tokens_seen": 7254768608,
      "step": 9221
    },
    {
      "epoch": 0.9783577339274347,
      "grad_norm": 0.5766245234372039,
      "learning_rate": 4.920068564967602e-05,
      "loss": 1.9195,
      "num_input_tokens_seen": 7255555360,
      "step": 9222
    },
    {
      "epoch": 0.9784638234670061,
      "grad_norm": 0.4930692266924311,
      "learning_rate": 4.920051131130297e-05,
      "loss": 1.9932,
      "num_input_tokens_seen": 7256342064,
      "step": 9223
    },
    {
      "epoch": 0.9785699130065776,
      "grad_norm": 0.7422105759831675,
      "learning_rate": 4.920033695422848e-05,
      "loss": 1.9078,
      "num_input_tokens_seen": 7257128832,
      "step": 9224
    },
    {
      "epoch": 0.978676002546149,
      "grad_norm": 0.48074042805469863,
      "learning_rate": 4.920016257845268e-05,
      "loss": 2.0143,
      "num_input_tokens_seen": 7257915504,
      "step": 9225
    },
    {
      "epoch": 0.9787820920857203,
      "grad_norm": 0.5597402618641786,
      "learning_rate": 4.9199988183975695e-05,
      "loss": 1.8284,
      "num_input_tokens_seen": 7258702352,
      "step": 9226
    },
    {
      "epoch": 0.9788881816252918,
      "grad_norm": 0.5283848806499009,
      "learning_rate": 4.9199813770797676e-05,
      "loss": 1.9213,
      "num_input_tokens_seen": 7259489088,
      "step": 9227
    },
    {
      "epoch": 0.9789942711648632,
      "grad_norm": 0.5354566006316809,
      "learning_rate": 4.919963933891875e-05,
      "loss": 1.8529,
      "num_input_tokens_seen": 7260275808,
      "step": 9228
    },
    {
      "epoch": 0.9791003607044345,
      "grad_norm": 0.41606394638313615,
      "learning_rate": 4.919946488833905e-05,
      "loss": 1.9006,
      "num_input_tokens_seen": 7261062576,
      "step": 9229
    },
    {
      "epoch": 0.979206450244006,
      "grad_norm": 0.5349097468560498,
      "learning_rate": 4.9199290419058716e-05,
      "loss": 1.862,
      "num_input_tokens_seen": 7261849440,
      "step": 9230
    },
    {
      "epoch": 0.9793125397835774,
      "grad_norm": 0.5081875995327163,
      "learning_rate": 4.9199115931077876e-05,
      "loss": 1.8751,
      "num_input_tokens_seen": 7262636208,
      "step": 9231
    },
    {
      "epoch": 0.9794186293231487,
      "grad_norm": 0.40807912666378543,
      "learning_rate": 4.9198941424396676e-05,
      "loss": 1.9461,
      "num_input_tokens_seen": 7263422960,
      "step": 9232
    },
    {
      "epoch": 0.9795247188627202,
      "grad_norm": 0.4034942205747698,
      "learning_rate": 4.9198766899015245e-05,
      "loss": 1.8593,
      "num_input_tokens_seen": 7264209712,
      "step": 9233
    },
    {
      "epoch": 0.9796308084022916,
      "grad_norm": 0.43013066140153344,
      "learning_rate": 4.919859235493371e-05,
      "loss": 1.7084,
      "num_input_tokens_seen": 7264996528,
      "step": 9234
    },
    {
      "epoch": 0.9797368979418629,
      "grad_norm": 0.5367352400994734,
      "learning_rate": 4.919841779215222e-05,
      "loss": 2.0059,
      "num_input_tokens_seen": 7265783248,
      "step": 9235
    },
    {
      "epoch": 0.9798429874814343,
      "grad_norm": 0.6536090428784893,
      "learning_rate": 4.9198243210670894e-05,
      "loss": 1.7477,
      "num_input_tokens_seen": 7266570048,
      "step": 9236
    },
    {
      "epoch": 0.9799490770210058,
      "grad_norm": 0.7964285997265158,
      "learning_rate": 4.919806861048988e-05,
      "loss": 1.9888,
      "num_input_tokens_seen": 7267356800,
      "step": 9237
    },
    {
      "epoch": 0.9800551665605771,
      "grad_norm": 0.6255640287080909,
      "learning_rate": 4.9197893991609314e-05,
      "loss": 1.9384,
      "num_input_tokens_seen": 7268143520,
      "step": 9238
    },
    {
      "epoch": 0.9801612561001485,
      "grad_norm": 1.1143058851072103,
      "learning_rate": 4.919771935402932e-05,
      "loss": 1.7858,
      "num_input_tokens_seen": 7268930368,
      "step": 9239
    },
    {
      "epoch": 0.98026734563972,
      "grad_norm": 0.4977388059615598,
      "learning_rate": 4.919754469775004e-05,
      "loss": 1.9853,
      "num_input_tokens_seen": 7269717088,
      "step": 9240
    },
    {
      "epoch": 0.9803734351792913,
      "grad_norm": 1.2432621144968325,
      "learning_rate": 4.91973700227716e-05,
      "loss": 1.6951,
      "num_input_tokens_seen": 7270503968,
      "step": 9241
    },
    {
      "epoch": 0.9804795247188627,
      "grad_norm": 0.5149274884030671,
      "learning_rate": 4.919719532909415e-05,
      "loss": 1.9163,
      "num_input_tokens_seen": 7271290720,
      "step": 9242
    },
    {
      "epoch": 0.9805856142584342,
      "grad_norm": 0.8135132045895062,
      "learning_rate": 4.919702061671782e-05,
      "loss": 1.9439,
      "num_input_tokens_seen": 7272077408,
      "step": 9243
    },
    {
      "epoch": 0.9806917037980055,
      "grad_norm": 0.7979547201614353,
      "learning_rate": 4.919684588564274e-05,
      "loss": 2.0092,
      "num_input_tokens_seen": 7272864176,
      "step": 9244
    },
    {
      "epoch": 0.9807977933375769,
      "grad_norm": 0.5483839217589929,
      "learning_rate": 4.919667113586904e-05,
      "loss": 1.8452,
      "num_input_tokens_seen": 7273650896,
      "step": 9245
    },
    {
      "epoch": 0.9809038828771484,
      "grad_norm": 0.6601394649697873,
      "learning_rate": 4.919649636739688e-05,
      "loss": 1.8368,
      "num_input_tokens_seen": 7274437680,
      "step": 9246
    },
    {
      "epoch": 0.9810099724167197,
      "grad_norm": 0.4296603434024172,
      "learning_rate": 4.9196321580226364e-05,
      "loss": 1.8488,
      "num_input_tokens_seen": 7275224544,
      "step": 9247
    },
    {
      "epoch": 0.9811160619562911,
      "grad_norm": 0.5355619852137283,
      "learning_rate": 4.919614677435764e-05,
      "loss": 1.9434,
      "num_input_tokens_seen": 7276011408,
      "step": 9248
    },
    {
      "epoch": 0.9812221514958626,
      "grad_norm": 0.5269904027734524,
      "learning_rate": 4.919597194979085e-05,
      "loss": 1.9121,
      "num_input_tokens_seen": 7276798176,
      "step": 9249
    },
    {
      "epoch": 0.9813282410354339,
      "grad_norm": 0.6110821728799403,
      "learning_rate": 4.919579710652612e-05,
      "loss": 2.0253,
      "num_input_tokens_seen": 7277584960,
      "step": 9250
    },
    {
      "epoch": 0.9814343305750053,
      "grad_norm": 0.4964914914660374,
      "learning_rate": 4.9195622244563586e-05,
      "loss": 1.7989,
      "num_input_tokens_seen": 7278371712,
      "step": 9251
    },
    {
      "epoch": 0.9815404201145767,
      "grad_norm": 0.9356033238171063,
      "learning_rate": 4.919544736390339e-05,
      "loss": 1.9866,
      "num_input_tokens_seen": 7279158336,
      "step": 9252
    },
    {
      "epoch": 0.9816465096541481,
      "grad_norm": 0.6410151495225818,
      "learning_rate": 4.919527246454566e-05,
      "loss": 1.8533,
      "num_input_tokens_seen": 7279945216,
      "step": 9253
    },
    {
      "epoch": 0.9817525991937195,
      "grad_norm": 1.035663501529383,
      "learning_rate": 4.919509754649053e-05,
      "loss": 1.6564,
      "num_input_tokens_seen": 7280732016,
      "step": 9254
    },
    {
      "epoch": 0.9818586887332909,
      "grad_norm": 0.5569291788784844,
      "learning_rate": 4.919492260973814e-05,
      "loss": 1.9123,
      "num_input_tokens_seen": 7281518880,
      "step": 9255
    },
    {
      "epoch": 0.9819647782728623,
      "grad_norm": 1.2933075464714807,
      "learning_rate": 4.919474765428863e-05,
      "loss": 1.9524,
      "num_input_tokens_seen": 7282305600,
      "step": 9256
    },
    {
      "epoch": 0.9820708678124337,
      "grad_norm": 0.5524431211988682,
      "learning_rate": 4.919457268014212e-05,
      "loss": 1.8871,
      "num_input_tokens_seen": 7283092400,
      "step": 9257
    },
    {
      "epoch": 0.982176957352005,
      "grad_norm": 0.723852594599646,
      "learning_rate": 4.919439768729875e-05,
      "loss": 1.8706,
      "num_input_tokens_seen": 7283879104,
      "step": 9258
    },
    {
      "epoch": 0.9822830468915765,
      "grad_norm": 0.5982288485183006,
      "learning_rate": 4.9194222675758675e-05,
      "loss": 1.8671,
      "num_input_tokens_seen": 7284665920,
      "step": 9259
    },
    {
      "epoch": 0.9823891364311479,
      "grad_norm": 0.7003945868710607,
      "learning_rate": 4.9194047645522005e-05,
      "loss": 1.8871,
      "num_input_tokens_seen": 7285452624,
      "step": 9260
    },
    {
      "epoch": 0.9824952259707193,
      "grad_norm": 0.9158663478660574,
      "learning_rate": 4.9193872596588886e-05,
      "loss": 1.9293,
      "num_input_tokens_seen": 7286239280,
      "step": 9261
    },
    {
      "epoch": 0.9826013155102907,
      "grad_norm": 0.7175572397017173,
      "learning_rate": 4.919369752895946e-05,
      "loss": 1.7644,
      "num_input_tokens_seen": 7287026096,
      "step": 9262
    },
    {
      "epoch": 0.9827074050498621,
      "grad_norm": 1.005644290395731,
      "learning_rate": 4.919352244263384e-05,
      "loss": 1.8521,
      "num_input_tokens_seen": 7287812928,
      "step": 9263
    },
    {
      "epoch": 0.9828134945894335,
      "grad_norm": 0.6650556304349244,
      "learning_rate": 4.9193347337612185e-05,
      "loss": 1.9014,
      "num_input_tokens_seen": 7288599696,
      "step": 9264
    },
    {
      "epoch": 0.9829195841290049,
      "grad_norm": 1.1996336788269144,
      "learning_rate": 4.919317221389462e-05,
      "loss": 1.8282,
      "num_input_tokens_seen": 7289386624,
      "step": 9265
    },
    {
      "epoch": 0.9830256736685763,
      "grad_norm": 0.540285564091108,
      "learning_rate": 4.9192997071481287e-05,
      "loss": 1.8177,
      "num_input_tokens_seen": 7290173392,
      "step": 9266
    },
    {
      "epoch": 0.9831317632081477,
      "grad_norm": 0.6712535933028999,
      "learning_rate": 4.91928219103723e-05,
      "loss": 1.8023,
      "num_input_tokens_seen": 7290960144,
      "step": 9267
    },
    {
      "epoch": 0.983237852747719,
      "grad_norm": 0.5161263514079383,
      "learning_rate": 4.919264673056782e-05,
      "loss": 1.984,
      "num_input_tokens_seen": 7291746896,
      "step": 9268
    },
    {
      "epoch": 0.9833439422872905,
      "grad_norm": 1.1188939111798206,
      "learning_rate": 4.9192471532067975e-05,
      "loss": 1.9126,
      "num_input_tokens_seen": 7292533696,
      "step": 9269
    },
    {
      "epoch": 0.9834500318268619,
      "grad_norm": 1.1010184250191843,
      "learning_rate": 4.919229631487289e-05,
      "loss": 1.8917,
      "num_input_tokens_seen": 7293320528,
      "step": 9270
    },
    {
      "epoch": 0.9835561213664332,
      "grad_norm": 0.5637893350783215,
      "learning_rate": 4.9192121078982716e-05,
      "loss": 2.1317,
      "num_input_tokens_seen": 7294107200,
      "step": 9271
    },
    {
      "epoch": 0.9836622109060047,
      "grad_norm": 0.5694250368287532,
      "learning_rate": 4.919194582439758e-05,
      "loss": 1.7737,
      "num_input_tokens_seen": 7294894000,
      "step": 9272
    },
    {
      "epoch": 0.9837683004455761,
      "grad_norm": 0.6818230505469112,
      "learning_rate": 4.919177055111761e-05,
      "loss": 1.8886,
      "num_input_tokens_seen": 7295680736,
      "step": 9273
    },
    {
      "epoch": 0.9838743899851474,
      "grad_norm": 0.4524379861305917,
      "learning_rate": 4.919159525914296e-05,
      "loss": 1.9189,
      "num_input_tokens_seen": 7296467472,
      "step": 9274
    },
    {
      "epoch": 0.9839804795247189,
      "grad_norm": 0.5269443290780499,
      "learning_rate": 4.919141994847375e-05,
      "loss": 1.7615,
      "num_input_tokens_seen": 7297254272,
      "step": 9275
    },
    {
      "epoch": 0.9840865690642903,
      "grad_norm": 0.5398938572362639,
      "learning_rate": 4.919124461911012e-05,
      "loss": 1.8024,
      "num_input_tokens_seen": 7298040944,
      "step": 9276
    },
    {
      "epoch": 0.9841926586038616,
      "grad_norm": 0.5280755825581821,
      "learning_rate": 4.91910692710522e-05,
      "loss": 1.9914,
      "num_input_tokens_seen": 7298827728,
      "step": 9277
    },
    {
      "epoch": 0.9842987481434331,
      "grad_norm": 0.5058108733762927,
      "learning_rate": 4.9190893904300145e-05,
      "loss": 1.8727,
      "num_input_tokens_seen": 7299614480,
      "step": 9278
    },
    {
      "epoch": 0.9844048376830045,
      "grad_norm": 0.52224914265936,
      "learning_rate": 4.9190718518854076e-05,
      "loss": 1.9541,
      "num_input_tokens_seen": 7300401184,
      "step": 9279
    },
    {
      "epoch": 0.9845109272225758,
      "grad_norm": 0.43621698814242216,
      "learning_rate": 4.919054311471411e-05,
      "loss": 1.84,
      "num_input_tokens_seen": 7301187952,
      "step": 9280
    },
    {
      "epoch": 0.9846170167621473,
      "grad_norm": 0.4967804831619042,
      "learning_rate": 4.9190367691880424e-05,
      "loss": 1.8912,
      "num_input_tokens_seen": 7301974688,
      "step": 9281
    },
    {
      "epoch": 0.9847231063017187,
      "grad_norm": 0.4153887144934521,
      "learning_rate": 4.9190192250353124e-05,
      "loss": 1.8374,
      "num_input_tokens_seen": 7302761408,
      "step": 9282
    },
    {
      "epoch": 0.98482919584129,
      "grad_norm": 0.5460443123713783,
      "learning_rate": 4.9190016790132356e-05,
      "loss": 1.7861,
      "num_input_tokens_seen": 7303548192,
      "step": 9283
    },
    {
      "epoch": 0.9849352853808614,
      "grad_norm": 0.4640127541288159,
      "learning_rate": 4.918984131121824e-05,
      "loss": 1.8638,
      "num_input_tokens_seen": 7304334976,
      "step": 9284
    },
    {
      "epoch": 0.9850413749204329,
      "grad_norm": 0.6933492983772921,
      "learning_rate": 4.9189665813610943e-05,
      "loss": 1.8784,
      "num_input_tokens_seen": 7305121728,
      "step": 9285
    },
    {
      "epoch": 0.9851474644600042,
      "grad_norm": 0.4235979195985775,
      "learning_rate": 4.918949029731057e-05,
      "loss": 1.9431,
      "num_input_tokens_seen": 7305908496,
      "step": 9286
    },
    {
      "epoch": 0.9852535539995756,
      "grad_norm": 0.9087775743506377,
      "learning_rate": 4.918931476231727e-05,
      "loss": 1.867,
      "num_input_tokens_seen": 7306695344,
      "step": 9287
    },
    {
      "epoch": 0.9853596435391471,
      "grad_norm": 0.39214583135502246,
      "learning_rate": 4.9189139208631174e-05,
      "loss": 1.9018,
      "num_input_tokens_seen": 7307482096,
      "step": 9288
    },
    {
      "epoch": 0.9854657330787184,
      "grad_norm": 0.8947601934136294,
      "learning_rate": 4.918896363625243e-05,
      "loss": 1.8674,
      "num_input_tokens_seen": 7308268864,
      "step": 9289
    },
    {
      "epoch": 0.9855718226182898,
      "grad_norm": 0.4408340698212521,
      "learning_rate": 4.9188788045181164e-05,
      "loss": 1.849,
      "num_input_tokens_seen": 7309055648,
      "step": 9290
    },
    {
      "epoch": 0.9856779121578613,
      "grad_norm": 0.6654205726149366,
      "learning_rate": 4.91886124354175e-05,
      "loss": 1.7484,
      "num_input_tokens_seen": 7309842432,
      "step": 9291
    },
    {
      "epoch": 0.9857840016974326,
      "grad_norm": 0.5794932434280539,
      "learning_rate": 4.9188436806961604e-05,
      "loss": 1.7142,
      "num_input_tokens_seen": 7310629264,
      "step": 9292
    },
    {
      "epoch": 0.985890091237004,
      "grad_norm": 0.43371802856289693,
      "learning_rate": 4.918826115981358e-05,
      "loss": 1.7634,
      "num_input_tokens_seen": 7311416000,
      "step": 9293
    },
    {
      "epoch": 0.9859961807765755,
      "grad_norm": 0.8163894383063105,
      "learning_rate": 4.918808549397358e-05,
      "loss": 1.8801,
      "num_input_tokens_seen": 7312202768,
      "step": 9294
    },
    {
      "epoch": 0.9861022703161468,
      "grad_norm": 0.43965246261927804,
      "learning_rate": 4.918790980944175e-05,
      "loss": 1.8989,
      "num_input_tokens_seen": 7312989536,
      "step": 9295
    },
    {
      "epoch": 0.9862083598557182,
      "grad_norm": 0.7400816344889456,
      "learning_rate": 4.91877341062182e-05,
      "loss": 1.842,
      "num_input_tokens_seen": 7313776336,
      "step": 9296
    },
    {
      "epoch": 0.9863144493952897,
      "grad_norm": 0.4760079353064684,
      "learning_rate": 4.918755838430308e-05,
      "loss": 2.1202,
      "num_input_tokens_seen": 7314563040,
      "step": 9297
    },
    {
      "epoch": 0.986420538934861,
      "grad_norm": 0.399573595401985,
      "learning_rate": 4.918738264369652e-05,
      "loss": 1.9154,
      "num_input_tokens_seen": 7315349680,
      "step": 9298
    },
    {
      "epoch": 0.9865266284744324,
      "grad_norm": 0.7300589520387746,
      "learning_rate": 4.9187206884398666e-05,
      "loss": 2.0054,
      "num_input_tokens_seen": 7316136432,
      "step": 9299
    },
    {
      "epoch": 0.9866327180140039,
      "grad_norm": 0.40284791104919515,
      "learning_rate": 4.918703110640965e-05,
      "loss": 1.9332,
      "num_input_tokens_seen": 7316923136,
      "step": 9300
    },
    {
      "epoch": 0.9867388075535752,
      "grad_norm": 0.5459374137093196,
      "learning_rate": 4.918685530972961e-05,
      "loss": 2.0239,
      "num_input_tokens_seen": 7317709920,
      "step": 9301
    },
    {
      "epoch": 0.9868448970931466,
      "grad_norm": 0.5323236856210981,
      "learning_rate": 4.918667949435867e-05,
      "loss": 1.8346,
      "num_input_tokens_seen": 7318496704,
      "step": 9302
    },
    {
      "epoch": 0.986950986632718,
      "grad_norm": 0.4857620959286958,
      "learning_rate": 4.9186503660296974e-05,
      "loss": 1.9719,
      "num_input_tokens_seen": 7319283456,
      "step": 9303
    },
    {
      "epoch": 0.9870570761722894,
      "grad_norm": 0.4737131754605501,
      "learning_rate": 4.918632780754466e-05,
      "loss": 1.9824,
      "num_input_tokens_seen": 7320070240,
      "step": 9304
    },
    {
      "epoch": 0.9871631657118608,
      "grad_norm": 0.4185165029339973,
      "learning_rate": 4.918615193610186e-05,
      "loss": 1.8634,
      "num_input_tokens_seen": 7320856960,
      "step": 9305
    },
    {
      "epoch": 0.9872692552514322,
      "grad_norm": 0.41107556951954277,
      "learning_rate": 4.918597604596871e-05,
      "loss": 1.7819,
      "num_input_tokens_seen": 7321643776,
      "step": 9306
    },
    {
      "epoch": 0.9873753447910036,
      "grad_norm": 0.4089182495124587,
      "learning_rate": 4.9185800137145353e-05,
      "loss": 1.9405,
      "num_input_tokens_seen": 7322430624,
      "step": 9307
    },
    {
      "epoch": 0.987481434330575,
      "grad_norm": 0.3460879318443245,
      "learning_rate": 4.918562420963191e-05,
      "loss": 1.8156,
      "num_input_tokens_seen": 7323217424,
      "step": 9308
    },
    {
      "epoch": 0.9875875238701464,
      "grad_norm": 0.4152836537755902,
      "learning_rate": 4.918544826342854e-05,
      "loss": 1.9184,
      "num_input_tokens_seen": 7324004176,
      "step": 9309
    },
    {
      "epoch": 0.9876936134097178,
      "grad_norm": 0.39595293205226123,
      "learning_rate": 4.9185272298535354e-05,
      "loss": 1.909,
      "num_input_tokens_seen": 7324790960,
      "step": 9310
    },
    {
      "epoch": 0.9877997029492892,
      "grad_norm": 0.44160181964856227,
      "learning_rate": 4.9185096314952505e-05,
      "loss": 1.8284,
      "num_input_tokens_seen": 7325577808,
      "step": 9311
    },
    {
      "epoch": 0.9879057924888606,
      "grad_norm": 0.32631285337204624,
      "learning_rate": 4.9184920312680124e-05,
      "loss": 1.8277,
      "num_input_tokens_seen": 7326364576,
      "step": 9312
    },
    {
      "epoch": 0.988011882028432,
      "grad_norm": 0.4410115520407505,
      "learning_rate": 4.918474429171834e-05,
      "loss": 1.9713,
      "num_input_tokens_seen": 7327151408,
      "step": 9313
    },
    {
      "epoch": 0.9881179715680034,
      "grad_norm": 0.38082636232558215,
      "learning_rate": 4.91845682520673e-05,
      "loss": 1.8825,
      "num_input_tokens_seen": 7327938224,
      "step": 9314
    },
    {
      "epoch": 0.9882240611075748,
      "grad_norm": 0.4074980572710472,
      "learning_rate": 4.9184392193727136e-05,
      "loss": 1.9651,
      "num_input_tokens_seen": 7328724960,
      "step": 9315
    },
    {
      "epoch": 0.9883301506471462,
      "grad_norm": 0.3683605481969268,
      "learning_rate": 4.918421611669798e-05,
      "loss": 2.0037,
      "num_input_tokens_seen": 7329511712,
      "step": 9316
    },
    {
      "epoch": 0.9884362401867176,
      "grad_norm": 0.4070570973384866,
      "learning_rate": 4.9184040020979974e-05,
      "loss": 1.8639,
      "num_input_tokens_seen": 7330298496,
      "step": 9317
    },
    {
      "epoch": 0.988542329726289,
      "grad_norm": 0.44439366533148095,
      "learning_rate": 4.9183863906573245e-05,
      "loss": 1.7623,
      "num_input_tokens_seen": 7331085264,
      "step": 9318
    },
    {
      "epoch": 0.9886484192658603,
      "grad_norm": 0.4001490262829416,
      "learning_rate": 4.918368777347794e-05,
      "loss": 1.7639,
      "num_input_tokens_seen": 7331872000,
      "step": 9319
    },
    {
      "epoch": 0.9887545088054318,
      "grad_norm": 0.5455611507265682,
      "learning_rate": 4.9183511621694195e-05,
      "loss": 2.0712,
      "num_input_tokens_seen": 7332658720,
      "step": 9320
    },
    {
      "epoch": 0.9888605983450032,
      "grad_norm": 0.38466023602506,
      "learning_rate": 4.918333545122213e-05,
      "loss": 1.8285,
      "num_input_tokens_seen": 7333445440,
      "step": 9321
    },
    {
      "epoch": 0.9889666878845745,
      "grad_norm": 0.4012999640948067,
      "learning_rate": 4.9183159262061906e-05,
      "loss": 1.8396,
      "num_input_tokens_seen": 7334232208,
      "step": 9322
    },
    {
      "epoch": 0.989072777424146,
      "grad_norm": 0.430061985918405,
      "learning_rate": 4.9182983054213646e-05,
      "loss": 1.881,
      "num_input_tokens_seen": 7335019040,
      "step": 9323
    },
    {
      "epoch": 0.9891788669637174,
      "grad_norm": 0.4196878955451753,
      "learning_rate": 4.918280682767748e-05,
      "loss": 1.783,
      "num_input_tokens_seen": 7335805856,
      "step": 9324
    },
    {
      "epoch": 0.9892849565032887,
      "grad_norm": 0.5670138439614845,
      "learning_rate": 4.918263058245355e-05,
      "loss": 2.1117,
      "num_input_tokens_seen": 7336592560,
      "step": 9325
    },
    {
      "epoch": 0.9893910460428602,
      "grad_norm": 0.45918883735759386,
      "learning_rate": 4.918245431854199e-05,
      "loss": 1.7733,
      "num_input_tokens_seen": 7337379376,
      "step": 9326
    },
    {
      "epoch": 0.9894971355824316,
      "grad_norm": 0.5596414512445251,
      "learning_rate": 4.9182278035942954e-05,
      "loss": 1.9504,
      "num_input_tokens_seen": 7338166096,
      "step": 9327
    },
    {
      "epoch": 0.9896032251220029,
      "grad_norm": 0.4483049083379266,
      "learning_rate": 4.918210173465655e-05,
      "loss": 1.9399,
      "num_input_tokens_seen": 7338952912,
      "step": 9328
    },
    {
      "epoch": 0.9897093146615744,
      "grad_norm": 0.5792932499574573,
      "learning_rate": 4.918192541468293e-05,
      "loss": 1.9054,
      "num_input_tokens_seen": 7339739824,
      "step": 9329
    },
    {
      "epoch": 0.9898154042011458,
      "grad_norm": 0.590108402893024,
      "learning_rate": 4.918174907602223e-05,
      "loss": 1.9251,
      "num_input_tokens_seen": 7340526592,
      "step": 9330
    },
    {
      "epoch": 0.9899214937407171,
      "grad_norm": 0.5846313124908351,
      "learning_rate": 4.918157271867457e-05,
      "loss": 1.915,
      "num_input_tokens_seen": 7341313360,
      "step": 9331
    },
    {
      "epoch": 0.9900275832802886,
      "grad_norm": 0.7025352544290301,
      "learning_rate": 4.918139634264012e-05,
      "loss": 1.7931,
      "num_input_tokens_seen": 7342100160,
      "step": 9332
    },
    {
      "epoch": 0.99013367281986,
      "grad_norm": 0.3843374507174728,
      "learning_rate": 4.918121994791899e-05,
      "loss": 1.7995,
      "num_input_tokens_seen": 7342886880,
      "step": 9333
    },
    {
      "epoch": 0.9902397623594313,
      "grad_norm": 0.6083569677191969,
      "learning_rate": 4.918104353451132e-05,
      "loss": 1.9398,
      "num_input_tokens_seen": 7343673568,
      "step": 9334
    },
    {
      "epoch": 0.9903458518990027,
      "grad_norm": 0.4821108289333365,
      "learning_rate": 4.918086710241725e-05,
      "loss": 1.8147,
      "num_input_tokens_seen": 7344460336,
      "step": 9335
    },
    {
      "epoch": 0.9904519414385742,
      "grad_norm": 0.35308756116510903,
      "learning_rate": 4.918069065163691e-05,
      "loss": 1.7484,
      "num_input_tokens_seen": 7345247216,
      "step": 9336
    },
    {
      "epoch": 0.9905580309781455,
      "grad_norm": 0.6842583537294169,
      "learning_rate": 4.918051418217045e-05,
      "loss": 1.9275,
      "num_input_tokens_seen": 7346033904,
      "step": 9337
    },
    {
      "epoch": 0.9906641205177169,
      "grad_norm": 0.37040104153398884,
      "learning_rate": 4.9180337694018e-05,
      "loss": 1.8101,
      "num_input_tokens_seen": 7346820752,
      "step": 9338
    },
    {
      "epoch": 0.9907702100572884,
      "grad_norm": 0.4346272362143866,
      "learning_rate": 4.9180161187179686e-05,
      "loss": 1.931,
      "num_input_tokens_seen": 7347607552,
      "step": 9339
    },
    {
      "epoch": 0.9908762995968597,
      "grad_norm": 0.4484406936880002,
      "learning_rate": 4.9179984661655656e-05,
      "loss": 1.7942,
      "num_input_tokens_seen": 7348394336,
      "step": 9340
    },
    {
      "epoch": 0.9909823891364311,
      "grad_norm": 0.4822248347384384,
      "learning_rate": 4.917980811744604e-05,
      "loss": 1.8932,
      "num_input_tokens_seen": 7349181088,
      "step": 9341
    },
    {
      "epoch": 0.9910884786760026,
      "grad_norm": 0.35894952083095605,
      "learning_rate": 4.9179631554550984e-05,
      "loss": 1.7833,
      "num_input_tokens_seen": 7349967888,
      "step": 9342
    },
    {
      "epoch": 0.991194568215574,
      "grad_norm": 0.45359519382212143,
      "learning_rate": 4.917945497297062e-05,
      "loss": 2.0035,
      "num_input_tokens_seen": 7350754592,
      "step": 9343
    },
    {
      "epoch": 0.9913006577551453,
      "grad_norm": 0.46306063365828326,
      "learning_rate": 4.917927837270507e-05,
      "loss": 1.9407,
      "num_input_tokens_seen": 7351541296,
      "step": 9344
    },
    {
      "epoch": 0.9914067472947168,
      "grad_norm": 0.5159129787092642,
      "learning_rate": 4.9179101753754495e-05,
      "loss": 1.8632,
      "num_input_tokens_seen": 7352328096,
      "step": 9345
    },
    {
      "epoch": 0.9915128368342881,
      "grad_norm": 0.42681295427365334,
      "learning_rate": 4.9178925116119014e-05,
      "loss": 1.8278,
      "num_input_tokens_seen": 7353114848,
      "step": 9346
    },
    {
      "epoch": 0.9916189263738595,
      "grad_norm": 0.44187599288881363,
      "learning_rate": 4.917874845979877e-05,
      "loss": 1.8833,
      "num_input_tokens_seen": 7353901632,
      "step": 9347
    },
    {
      "epoch": 0.991725015913431,
      "grad_norm": 0.5640176011973334,
      "learning_rate": 4.9178571784793906e-05,
      "loss": 1.8573,
      "num_input_tokens_seen": 7354688432,
      "step": 9348
    },
    {
      "epoch": 0.9918311054530023,
      "grad_norm": 0.4778516429123644,
      "learning_rate": 4.917839509110454e-05,
      "loss": 1.9368,
      "num_input_tokens_seen": 7355475184,
      "step": 9349
    },
    {
      "epoch": 0.9919371949925737,
      "grad_norm": 0.4718837587102462,
      "learning_rate": 4.9178218378730825e-05,
      "loss": 1.8388,
      "num_input_tokens_seen": 7356261952,
      "step": 9350
    },
    {
      "epoch": 0.9920432845321451,
      "grad_norm": 0.48675487818337027,
      "learning_rate": 4.917804164767289e-05,
      "loss": 1.9947,
      "num_input_tokens_seen": 7357048784,
      "step": 9351
    },
    {
      "epoch": 0.9921493740717165,
      "grad_norm": 0.5785946603275752,
      "learning_rate": 4.917786489793088e-05,
      "loss": 1.9706,
      "num_input_tokens_seen": 7357835584,
      "step": 9352
    },
    {
      "epoch": 0.9922554636112879,
      "grad_norm": 0.4489598166218898,
      "learning_rate": 4.9177688129504916e-05,
      "loss": 1.9184,
      "num_input_tokens_seen": 7358622368,
      "step": 9353
    },
    {
      "epoch": 0.9923615531508593,
      "grad_norm": 0.4277061959734495,
      "learning_rate": 4.917751134239516e-05,
      "loss": 1.9531,
      "num_input_tokens_seen": 7359409072,
      "step": 9354
    },
    {
      "epoch": 0.9924676426904308,
      "grad_norm": 0.4887546207744762,
      "learning_rate": 4.9177334536601715e-05,
      "loss": 1.8416,
      "num_input_tokens_seen": 7360195712,
      "step": 9355
    },
    {
      "epoch": 0.9925737322300021,
      "grad_norm": 0.48419950571141607,
      "learning_rate": 4.9177157712124746e-05,
      "loss": 1.9338,
      "num_input_tokens_seen": 7360982496,
      "step": 9356
    },
    {
      "epoch": 0.9926798217695735,
      "grad_norm": 0.4152909511834507,
      "learning_rate": 4.917698086896437e-05,
      "loss": 1.8766,
      "num_input_tokens_seen": 7361769280,
      "step": 9357
    },
    {
      "epoch": 0.992785911309145,
      "grad_norm": 0.41021325637757294,
      "learning_rate": 4.917680400712074e-05,
      "loss": 1.7459,
      "num_input_tokens_seen": 7362556032,
      "step": 9358
    },
    {
      "epoch": 0.9928920008487163,
      "grad_norm": 0.4254590719027935,
      "learning_rate": 4.917662712659398e-05,
      "loss": 1.843,
      "num_input_tokens_seen": 7363342800,
      "step": 9359
    },
    {
      "epoch": 0.9929980903882877,
      "grad_norm": 0.4541229235107311,
      "learning_rate": 4.917645022738424e-05,
      "loss": 1.873,
      "num_input_tokens_seen": 7364129520,
      "step": 9360
    },
    {
      "epoch": 0.9931041799278592,
      "grad_norm": 0.3819892867784431,
      "learning_rate": 4.917627330949164e-05,
      "loss": 1.8473,
      "num_input_tokens_seen": 7364916272,
      "step": 9361
    },
    {
      "epoch": 0.9932102694674305,
      "grad_norm": 0.5633419209392643,
      "learning_rate": 4.917609637291633e-05,
      "loss": 2.0023,
      "num_input_tokens_seen": 7365703024,
      "step": 9362
    },
    {
      "epoch": 0.9933163590070019,
      "grad_norm": 0.5562782157964254,
      "learning_rate": 4.9175919417658444e-05,
      "loss": 2.0096,
      "num_input_tokens_seen": 7366489824,
      "step": 9363
    },
    {
      "epoch": 0.9934224485465734,
      "grad_norm": 0.4574437802698856,
      "learning_rate": 4.917574244371811e-05,
      "loss": 1.7993,
      "num_input_tokens_seen": 7367276528,
      "step": 9364
    },
    {
      "epoch": 0.9935285380861447,
      "grad_norm": 0.41078689730980145,
      "learning_rate": 4.917556545109548e-05,
      "loss": 1.7419,
      "num_input_tokens_seen": 7368063360,
      "step": 9365
    },
    {
      "epoch": 0.9936346276257161,
      "grad_norm": 0.4870650860830119,
      "learning_rate": 4.917538843979068e-05,
      "loss": 1.8053,
      "num_input_tokens_seen": 7368850160,
      "step": 9366
    },
    {
      "epoch": 0.9937407171652876,
      "grad_norm": 0.3941345716894401,
      "learning_rate": 4.9175211409803844e-05,
      "loss": 1.8643,
      "num_input_tokens_seen": 7369636864,
      "step": 9367
    },
    {
      "epoch": 0.9938468067048589,
      "grad_norm": 0.43411428972885446,
      "learning_rate": 4.917503436113512e-05,
      "loss": 1.7881,
      "num_input_tokens_seen": 7370423616,
      "step": 9368
    },
    {
      "epoch": 0.9939528962444303,
      "grad_norm": 0.4064497361870628,
      "learning_rate": 4.9174857293784634e-05,
      "loss": 1.8675,
      "num_input_tokens_seen": 7371210432,
      "step": 9369
    },
    {
      "epoch": 0.9940589857840016,
      "grad_norm": 0.4650413460049159,
      "learning_rate": 4.9174680207752524e-05,
      "loss": 1.9917,
      "num_input_tokens_seen": 7371997136,
      "step": 9370
    },
    {
      "epoch": 0.9941650753235731,
      "grad_norm": 0.4524836284772143,
      "learning_rate": 4.917450310303894e-05,
      "loss": 1.7102,
      "num_input_tokens_seen": 7372783856,
      "step": 9371
    },
    {
      "epoch": 0.9942711648631445,
      "grad_norm": 0.5574287466102441,
      "learning_rate": 4.9174325979644e-05,
      "loss": 1.7597,
      "num_input_tokens_seen": 7373570608,
      "step": 9372
    },
    {
      "epoch": 0.9943772544027158,
      "grad_norm": 0.4427404302671174,
      "learning_rate": 4.9174148837567854e-05,
      "loss": 1.9466,
      "num_input_tokens_seen": 7374357360,
      "step": 9373
    },
    {
      "epoch": 0.9944833439422873,
      "grad_norm": 0.5569535730999291,
      "learning_rate": 4.9173971676810646e-05,
      "loss": 1.873,
      "num_input_tokens_seen": 7375144096,
      "step": 9374
    },
    {
      "epoch": 0.9945894334818587,
      "grad_norm": 0.53343998214964,
      "learning_rate": 4.9173794497372485e-05,
      "loss": 2.1222,
      "num_input_tokens_seen": 7375930848,
      "step": 9375
    },
    {
      "epoch": 0.99469552302143,
      "grad_norm": 0.5610890221580994,
      "learning_rate": 4.917361729925354e-05,
      "loss": 1.8261,
      "num_input_tokens_seen": 7376717664,
      "step": 9376
    },
    {
      "epoch": 0.9948016125610015,
      "grad_norm": 0.5088720889936248,
      "learning_rate": 4.917344008245392e-05,
      "loss": 1.8173,
      "num_input_tokens_seen": 7377504336,
      "step": 9377
    },
    {
      "epoch": 0.9949077021005729,
      "grad_norm": 0.43631938177074947,
      "learning_rate": 4.917326284697378e-05,
      "loss": 1.7451,
      "num_input_tokens_seen": 7378291184,
      "step": 9378
    },
    {
      "epoch": 0.9950137916401443,
      "grad_norm": 0.6306319722933725,
      "learning_rate": 4.917308559281325e-05,
      "loss": 1.9517,
      "num_input_tokens_seen": 7379077888,
      "step": 9379
    },
    {
      "epoch": 0.9951198811797157,
      "grad_norm": 0.3926651043380656,
      "learning_rate": 4.9172908319972476e-05,
      "loss": 1.8694,
      "num_input_tokens_seen": 7379864736,
      "step": 9380
    },
    {
      "epoch": 0.9952259707192871,
      "grad_norm": 0.4784944196372723,
      "learning_rate": 4.917273102845158e-05,
      "loss": 1.8529,
      "num_input_tokens_seen": 7380651456,
      "step": 9381
    },
    {
      "epoch": 0.9953320602588585,
      "grad_norm": 0.4275516349889473,
      "learning_rate": 4.917255371825071e-05,
      "loss": 1.9125,
      "num_input_tokens_seen": 7381438176,
      "step": 9382
    },
    {
      "epoch": 0.9954381497984299,
      "grad_norm": 0.4801285589990251,
      "learning_rate": 4.917237638937e-05,
      "loss": 1.9063,
      "num_input_tokens_seen": 7382224912,
      "step": 9383
    },
    {
      "epoch": 0.9955442393380013,
      "grad_norm": 0.44252583496911285,
      "learning_rate": 4.917219904180959e-05,
      "loss": 1.9171,
      "num_input_tokens_seen": 7383011632,
      "step": 9384
    },
    {
      "epoch": 0.9956503288775727,
      "grad_norm": 0.44482059242334443,
      "learning_rate": 4.91720216755696e-05,
      "loss": 1.7893,
      "num_input_tokens_seen": 7383798400,
      "step": 9385
    },
    {
      "epoch": 0.995756418417144,
      "grad_norm": 0.4333844118920426,
      "learning_rate": 4.917184429065019e-05,
      "loss": 1.8479,
      "num_input_tokens_seen": 7384585200,
      "step": 9386
    },
    {
      "epoch": 0.9958625079567155,
      "grad_norm": 0.3911103492012124,
      "learning_rate": 4.9171666887051496e-05,
      "loss": 1.824,
      "num_input_tokens_seen": 7385371936,
      "step": 9387
    },
    {
      "epoch": 0.9959685974962869,
      "grad_norm": 0.5136386283992312,
      "learning_rate": 4.917148946477364e-05,
      "loss": 2.005,
      "num_input_tokens_seen": 7386158720,
      "step": 9388
    },
    {
      "epoch": 0.9960746870358582,
      "grad_norm": 0.35811451590517296,
      "learning_rate": 4.9171312023816765e-05,
      "loss": 1.8398,
      "num_input_tokens_seen": 7386945376,
      "step": 9389
    },
    {
      "epoch": 0.9961807765754297,
      "grad_norm": 0.5245147353837313,
      "learning_rate": 4.9171134564181006e-05,
      "loss": 1.9548,
      "num_input_tokens_seen": 7387732160,
      "step": 9390
    },
    {
      "epoch": 0.9962868661150011,
      "grad_norm": 0.3830092548181772,
      "learning_rate": 4.917095708586651e-05,
      "loss": 1.9545,
      "num_input_tokens_seen": 7388518880,
      "step": 9391
    },
    {
      "epoch": 0.9963929556545724,
      "grad_norm": 0.4934505399969365,
      "learning_rate": 4.91707795888734e-05,
      "loss": 2.0557,
      "num_input_tokens_seen": 7389305552,
      "step": 9392
    },
    {
      "epoch": 0.9964990451941439,
      "grad_norm": 0.48078877538572806,
      "learning_rate": 4.9170602073201826e-05,
      "loss": 1.922,
      "num_input_tokens_seen": 7390092384,
      "step": 9393
    },
    {
      "epoch": 0.9966051347337153,
      "grad_norm": 0.3783165118711092,
      "learning_rate": 4.917042453885192e-05,
      "loss": 1.6732,
      "num_input_tokens_seen": 7390879168,
      "step": 9394
    },
    {
      "epoch": 0.9967112242732866,
      "grad_norm": 0.5074099250035013,
      "learning_rate": 4.917024698582382e-05,
      "loss": 1.8835,
      "num_input_tokens_seen": 7391665968,
      "step": 9395
    },
    {
      "epoch": 0.9968173138128581,
      "grad_norm": 0.40514699130509796,
      "learning_rate": 4.917006941411766e-05,
      "loss": 1.8984,
      "num_input_tokens_seen": 7392452832,
      "step": 9396
    },
    {
      "epoch": 0.9969234033524295,
      "grad_norm": 0.4406663088493952,
      "learning_rate": 4.9169891823733585e-05,
      "loss": 1.9554,
      "num_input_tokens_seen": 7393239600,
      "step": 9397
    },
    {
      "epoch": 0.9970294928920008,
      "grad_norm": 0.388929019582668,
      "learning_rate": 4.9169714214671715e-05,
      "loss": 1.82,
      "num_input_tokens_seen": 7394026368,
      "step": 9398
    },
    {
      "epoch": 0.9971355824315723,
      "grad_norm": 0.4735047310558823,
      "learning_rate": 4.9169536586932205e-05,
      "loss": 1.9514,
      "num_input_tokens_seen": 7394813152,
      "step": 9399
    },
    {
      "epoch": 0.9972416719711437,
      "grad_norm": 0.5048368210512915,
      "learning_rate": 4.916935894051519e-05,
      "loss": 1.9418,
      "num_input_tokens_seen": 7395599856,
      "step": 9400
    },
    {
      "epoch": 0.997347761510715,
      "grad_norm": 0.4625087378577652,
      "learning_rate": 4.9169181275420804e-05,
      "loss": 1.7862,
      "num_input_tokens_seen": 7396386672,
      "step": 9401
    },
    {
      "epoch": 0.9974538510502864,
      "grad_norm": 0.3864119490428742,
      "learning_rate": 4.916900359164918e-05,
      "loss": 1.9032,
      "num_input_tokens_seen": 7397173360,
      "step": 9402
    },
    {
      "epoch": 0.9975599405898579,
      "grad_norm": 0.4445999014559755,
      "learning_rate": 4.916882588920046e-05,
      "loss": 1.9502,
      "num_input_tokens_seen": 7397960160,
      "step": 9403
    },
    {
      "epoch": 0.9976660301294292,
      "grad_norm": 0.3988796161711141,
      "learning_rate": 4.916864816807478e-05,
      "loss": 1.8937,
      "num_input_tokens_seen": 7398746848,
      "step": 9404
    },
    {
      "epoch": 0.9977721196690006,
      "grad_norm": 0.4045117527184672,
      "learning_rate": 4.916847042827228e-05,
      "loss": 1.8853,
      "num_input_tokens_seen": 7399533552,
      "step": 9405
    },
    {
      "epoch": 0.9978782092085721,
      "grad_norm": 0.3868308465732729,
      "learning_rate": 4.916829266979309e-05,
      "loss": 1.7374,
      "num_input_tokens_seen": 7400320304,
      "step": 9406
    },
    {
      "epoch": 0.9979842987481434,
      "grad_norm": 0.5047658959341651,
      "learning_rate": 4.916811489263736e-05,
      "loss": 1.8625,
      "num_input_tokens_seen": 7401107040,
      "step": 9407
    },
    {
      "epoch": 0.9980903882877148,
      "grad_norm": 0.4117704951542445,
      "learning_rate": 4.9167937096805215e-05,
      "loss": 1.8333,
      "num_input_tokens_seen": 7401893760,
      "step": 9408
    },
    {
      "epoch": 0.9981964778272863,
      "grad_norm": 0.4997720093039094,
      "learning_rate": 4.91677592822968e-05,
      "loss": 2.0162,
      "num_input_tokens_seen": 7402680464,
      "step": 9409
    },
    {
      "epoch": 0.9983025673668576,
      "grad_norm": 0.5950135997082349,
      "learning_rate": 4.916758144911225e-05,
      "loss": 1.9361,
      "num_input_tokens_seen": 7403467280,
      "step": 9410
    },
    {
      "epoch": 0.998408656906429,
      "grad_norm": 0.4113418249825381,
      "learning_rate": 4.91674035972517e-05,
      "loss": 1.9671,
      "num_input_tokens_seen": 7404254032,
      "step": 9411
    },
    {
      "epoch": 0.9985147464460005,
      "grad_norm": 0.5964999331040277,
      "learning_rate": 4.9167225726715286e-05,
      "loss": 1.7874,
      "num_input_tokens_seen": 7405040832,
      "step": 9412
    },
    {
      "epoch": 0.9986208359855718,
      "grad_norm": 0.5176565655675478,
      "learning_rate": 4.9167047837503156e-05,
      "loss": 1.8402,
      "num_input_tokens_seen": 7405827632,
      "step": 9413
    },
    {
      "epoch": 0.9987269255251432,
      "grad_norm": 0.6589488259345146,
      "learning_rate": 4.916686992961544e-05,
      "loss": 1.9493,
      "num_input_tokens_seen": 7406614336,
      "step": 9414
    },
    {
      "epoch": 0.9988330150647147,
      "grad_norm": 0.5056398866323218,
      "learning_rate": 4.9166692003052276e-05,
      "loss": 1.7589,
      "num_input_tokens_seen": 7407401104,
      "step": 9415
    },
    {
      "epoch": 0.998939104604286,
      "grad_norm": 0.4703083996066868,
      "learning_rate": 4.9166514057813796e-05,
      "loss": 1.9078,
      "num_input_tokens_seen": 7408187936,
      "step": 9416
    },
    {
      "epoch": 0.9990451941438574,
      "grad_norm": 0.6266594918533138,
      "learning_rate": 4.9166336093900144e-05,
      "loss": 1.9197,
      "num_input_tokens_seen": 7408974752,
      "step": 9417
    },
    {
      "epoch": 0.9991512836834288,
      "grad_norm": 0.5615461614285567,
      "learning_rate": 4.916615811131146e-05,
      "loss": 1.9203,
      "num_input_tokens_seen": 7409761520,
      "step": 9418
    },
    {
      "epoch": 0.9992573732230002,
      "grad_norm": 0.4328057742380831,
      "learning_rate": 4.916598011004788e-05,
      "loss": 1.7446,
      "num_input_tokens_seen": 7410548384,
      "step": 9419
    },
    {
      "epoch": 0.9993634627625716,
      "grad_norm": 0.4346543796467174,
      "learning_rate": 4.9165802090109535e-05,
      "loss": 2.0207,
      "num_input_tokens_seen": 7411335120,
      "step": 9420
    },
    {
      "epoch": 0.999469552302143,
      "grad_norm": 0.692448891970212,
      "learning_rate": 4.916562405149657e-05,
      "loss": 2.0028,
      "num_input_tokens_seen": 7412121920,
      "step": 9421
    },
    {
      "epoch": 0.9995756418417144,
      "grad_norm": 0.6067635059354642,
      "learning_rate": 4.9165445994209115e-05,
      "loss": 1.7769,
      "num_input_tokens_seen": 7412908720,
      "step": 9422
    },
    {
      "epoch": 0.9996817313812858,
      "grad_norm": 0.44763121781682325,
      "learning_rate": 4.9165267918247315e-05,
      "loss": 2.0716,
      "num_input_tokens_seen": 7413695440,
      "step": 9423
    },
    {
      "epoch": 0.9997878209208572,
      "grad_norm": 0.42229013518032593,
      "learning_rate": 4.916508982361131e-05,
      "loss": 1.9037,
      "num_input_tokens_seen": 7414482224,
      "step": 9424
    },
    {
      "epoch": 0.9998939104604286,
      "grad_norm": 0.4457875092437086,
      "learning_rate": 4.916491171030123e-05,
      "loss": 1.9565,
      "num_input_tokens_seen": 7415269072,
      "step": 9425
    },
    {
      "epoch": 1.0,
      "grad_norm": 0.500223692285922,
      "learning_rate": 4.916473357831721e-05,
      "loss": 1.9731,
      "num_input_tokens_seen": 7416055808,
      "step": 9426
    },
    {
      "epoch": 1.0001060895395715,
      "grad_norm": 0.4275831906251911,
      "learning_rate": 4.91645554276594e-05,
      "loss": 1.6931,
      "num_input_tokens_seen": 7416842608,
      "step": 9427
    },
    {
      "epoch": 1.0002121790791427,
      "grad_norm": 0.3733148318293918,
      "learning_rate": 4.916437725832793e-05,
      "loss": 1.7564,
      "num_input_tokens_seen": 7417629472,
      "step": 9428
    },
    {
      "epoch": 1.0003182686187142,
      "grad_norm": 0.606569373841648,
      "learning_rate": 4.916419907032293e-05,
      "loss": 1.6973,
      "num_input_tokens_seen": 7418416288,
      "step": 9429
    },
    {
      "epoch": 1.0004243581582857,
      "grad_norm": 0.43212034613844047,
      "learning_rate": 4.916402086364456e-05,
      "loss": 1.7043,
      "num_input_tokens_seen": 7419202992,
      "step": 9430
    },
    {
      "epoch": 1.000530447697857,
      "grad_norm": 0.5086802069610968,
      "learning_rate": 4.9163842638292926e-05,
      "loss": 1.8238,
      "num_input_tokens_seen": 7419989712,
      "step": 9431
    },
    {
      "epoch": 1.0006365372374284,
      "grad_norm": 0.5397897005080755,
      "learning_rate": 4.9163664394268195e-05,
      "loss": 1.9303,
      "num_input_tokens_seen": 7420776432,
      "step": 9432
    },
    {
      "epoch": 1.0007426267769999,
      "grad_norm": 0.7113558219055549,
      "learning_rate": 4.916348613157049e-05,
      "loss": 1.8402,
      "num_input_tokens_seen": 7421563232,
      "step": 9433
    },
    {
      "epoch": 1.0008487163165711,
      "grad_norm": 0.5021888240212647,
      "learning_rate": 4.916330785019996e-05,
      "loss": 1.8398,
      "num_input_tokens_seen": 7422349968,
      "step": 9434
    },
    {
      "epoch": 1.0009548058561426,
      "grad_norm": 0.9686996243203659,
      "learning_rate": 4.9163129550156725e-05,
      "loss": 1.9932,
      "num_input_tokens_seen": 7423136672,
      "step": 9435
    },
    {
      "epoch": 1.001060895395714,
      "grad_norm": 0.37411719046446534,
      "learning_rate": 4.9162951231440934e-05,
      "loss": 1.6681,
      "num_input_tokens_seen": 7423923456,
      "step": 9436
    },
    {
      "epoch": 1.0011669849352853,
      "grad_norm": 0.6456284693537231,
      "learning_rate": 4.916277289405272e-05,
      "loss": 1.8326,
      "num_input_tokens_seen": 7424710176,
      "step": 9437
    },
    {
      "epoch": 1.0012730744748568,
      "grad_norm": 0.7899212428214337,
      "learning_rate": 4.916259453799223e-05,
      "loss": 1.8421,
      "num_input_tokens_seen": 7425496912,
      "step": 9438
    },
    {
      "epoch": 1.0013791640144283,
      "grad_norm": 0.8496215366834106,
      "learning_rate": 4.9162416163259596e-05,
      "loss": 1.901,
      "num_input_tokens_seen": 7426283552,
      "step": 9439
    },
    {
      "epoch": 1.0014852535539995,
      "grad_norm": 0.5658881524317361,
      "learning_rate": 4.9162237769854954e-05,
      "loss": 1.9016,
      "num_input_tokens_seen": 7427070304,
      "step": 9440
    },
    {
      "epoch": 1.001591343093571,
      "grad_norm": 0.6840419532598314,
      "learning_rate": 4.9162059357778446e-05,
      "loss": 1.9421,
      "num_input_tokens_seen": 7427857056,
      "step": 9441
    },
    {
      "epoch": 1.0016974326331425,
      "grad_norm": 0.4731979500384404,
      "learning_rate": 4.91618809270302e-05,
      "loss": 1.9455,
      "num_input_tokens_seen": 7428643808,
      "step": 9442
    },
    {
      "epoch": 1.0018035221727137,
      "grad_norm": 0.5257735008150308,
      "learning_rate": 4.916170247761037e-05,
      "loss": 1.8879,
      "num_input_tokens_seen": 7429430608,
      "step": 9443
    },
    {
      "epoch": 1.0019096117122852,
      "grad_norm": 0.4334438823331426,
      "learning_rate": 4.916152400951908e-05,
      "loss": 1.6725,
      "num_input_tokens_seen": 7430217360,
      "step": 9444
    },
    {
      "epoch": 1.0020157012518565,
      "grad_norm": 0.5461378218945718,
      "learning_rate": 4.9161345522756476e-05,
      "loss": 1.9124,
      "num_input_tokens_seen": 7431004000,
      "step": 9445
    },
    {
      "epoch": 1.002121790791428,
      "grad_norm": 0.43458856169301974,
      "learning_rate": 4.916116701732269e-05,
      "loss": 1.9544,
      "num_input_tokens_seen": 7431790768,
      "step": 9446
    },
    {
      "epoch": 1.0022278803309994,
      "grad_norm": 0.4608841134214873,
      "learning_rate": 4.9160988493217866e-05,
      "loss": 1.8288,
      "num_input_tokens_seen": 7432577584,
      "step": 9447
    },
    {
      "epoch": 1.0023339698705707,
      "grad_norm": 0.5043224895319021,
      "learning_rate": 4.916080995044214e-05,
      "loss": 1.8495,
      "num_input_tokens_seen": 7433364288,
      "step": 9448
    },
    {
      "epoch": 1.0024400594101421,
      "grad_norm": 0.7617584272030563,
      "learning_rate": 4.916063138899565e-05,
      "loss": 1.8587,
      "num_input_tokens_seen": 7434151072,
      "step": 9449
    },
    {
      "epoch": 1.0025461489497136,
      "grad_norm": 0.48457116309486303,
      "learning_rate": 4.9160452808878524e-05,
      "loss": 1.9021,
      "num_input_tokens_seen": 7434937888,
      "step": 9450
    },
    {
      "epoch": 1.0026522384892849,
      "grad_norm": 0.8834574650989915,
      "learning_rate": 4.916027421009092e-05,
      "loss": 1.9159,
      "num_input_tokens_seen": 7435724624,
      "step": 9451
    },
    {
      "epoch": 1.0027583280288563,
      "grad_norm": 0.7662480582725829,
      "learning_rate": 4.916009559263296e-05,
      "loss": 1.7957,
      "num_input_tokens_seen": 7436511392,
      "step": 9452
    },
    {
      "epoch": 1.0028644175684278,
      "grad_norm": 1.0491035933860282,
      "learning_rate": 4.915991695650478e-05,
      "loss": 1.9209,
      "num_input_tokens_seen": 7437298128,
      "step": 9453
    },
    {
      "epoch": 1.002970507107999,
      "grad_norm": 0.4740460252182852,
      "learning_rate": 4.9159738301706536e-05,
      "loss": 1.8037,
      "num_input_tokens_seen": 7438084880,
      "step": 9454
    },
    {
      "epoch": 1.0030765966475705,
      "grad_norm": 1.5564378055941475,
      "learning_rate": 4.915955962823835e-05,
      "loss": 2.028,
      "num_input_tokens_seen": 7438871664,
      "step": 9455
    },
    {
      "epoch": 1.003182686187142,
      "grad_norm": 0.5523336672972627,
      "learning_rate": 4.915938093610037e-05,
      "loss": 1.7593,
      "num_input_tokens_seen": 7439658416,
      "step": 9456
    },
    {
      "epoch": 1.0032887757267133,
      "grad_norm": 0.6556925363910974,
      "learning_rate": 4.915920222529272e-05,
      "loss": 1.759,
      "num_input_tokens_seen": 7440445152,
      "step": 9457
    },
    {
      "epoch": 1.0033948652662847,
      "grad_norm": 0.7753105725041074,
      "learning_rate": 4.915902349581556e-05,
      "loss": 1.7868,
      "num_input_tokens_seen": 7441231872,
      "step": 9458
    },
    {
      "epoch": 1.0035009548058562,
      "grad_norm": 0.4218986078780918,
      "learning_rate": 4.915884474766901e-05,
      "loss": 1.7407,
      "num_input_tokens_seen": 7442018656,
      "step": 9459
    },
    {
      "epoch": 1.0036070443454275,
      "grad_norm": 0.39821731634920665,
      "learning_rate": 4.915866598085321e-05,
      "loss": 1.8023,
      "num_input_tokens_seen": 7442805552,
      "step": 9460
    },
    {
      "epoch": 1.003713133884999,
      "grad_norm": 0.4709028027167941,
      "learning_rate": 4.91584871953683e-05,
      "loss": 1.9224,
      "num_input_tokens_seen": 7443592272,
      "step": 9461
    },
    {
      "epoch": 1.0038192234245704,
      "grad_norm": 0.49046354094267164,
      "learning_rate": 4.915830839121443e-05,
      "loss": 1.8557,
      "num_input_tokens_seen": 7444379008,
      "step": 9462
    },
    {
      "epoch": 1.0039253129641417,
      "grad_norm": 0.4183017511359064,
      "learning_rate": 4.915812956839172e-05,
      "loss": 1.7924,
      "num_input_tokens_seen": 7445165920,
      "step": 9463
    },
    {
      "epoch": 1.0040314025037131,
      "grad_norm": 0.5158016465546773,
      "learning_rate": 4.915795072690031e-05,
      "loss": 1.7657,
      "num_input_tokens_seen": 7445952688,
      "step": 9464
    },
    {
      "epoch": 1.0041374920432846,
      "grad_norm": 0.4806624450139032,
      "learning_rate": 4.915777186674037e-05,
      "loss": 1.9132,
      "num_input_tokens_seen": 7446739472,
      "step": 9465
    },
    {
      "epoch": 1.0042435815828559,
      "grad_norm": 0.6191517829875044,
      "learning_rate": 4.9157592987911985e-05,
      "loss": 1.9401,
      "num_input_tokens_seen": 7447526240,
      "step": 9466
    },
    {
      "epoch": 1.0043496711224273,
      "grad_norm": 0.3794661613762048,
      "learning_rate": 4.9157414090415336e-05,
      "loss": 1.6489,
      "num_input_tokens_seen": 7448313072,
      "step": 9467
    },
    {
      "epoch": 1.0044557606619988,
      "grad_norm": 0.6812637713193166,
      "learning_rate": 4.915723517425054e-05,
      "loss": 1.6428,
      "num_input_tokens_seen": 7449099888,
      "step": 9468
    },
    {
      "epoch": 1.00456185020157,
      "grad_norm": 0.42253716340236247,
      "learning_rate": 4.915705623941774e-05,
      "loss": 1.6813,
      "num_input_tokens_seen": 7449886640,
      "step": 9469
    },
    {
      "epoch": 1.0046679397411415,
      "grad_norm": 0.514683823132349,
      "learning_rate": 4.915687728591708e-05,
      "loss": 1.749,
      "num_input_tokens_seen": 7450673360,
      "step": 9470
    },
    {
      "epoch": 1.004774029280713,
      "grad_norm": 0.45838629832111294,
      "learning_rate": 4.915669831374869e-05,
      "loss": 1.8162,
      "num_input_tokens_seen": 7451460160,
      "step": 9471
    },
    {
      "epoch": 1.0048801188202843,
      "grad_norm": 0.5834659624468272,
      "learning_rate": 4.915651932291272e-05,
      "loss": 1.8682,
      "num_input_tokens_seen": 7452246960,
      "step": 9472
    },
    {
      "epoch": 1.0049862083598557,
      "grad_norm": 0.47282292812478466,
      "learning_rate": 4.91563403134093e-05,
      "loss": 1.768,
      "num_input_tokens_seen": 7453033744,
      "step": 9473
    },
    {
      "epoch": 1.0050922978994272,
      "grad_norm": 0.6472065269706005,
      "learning_rate": 4.9156161285238564e-05,
      "loss": 1.895,
      "num_input_tokens_seen": 7453820528,
      "step": 9474
    },
    {
      "epoch": 1.0051983874389985,
      "grad_norm": 0.4854331346832637,
      "learning_rate": 4.9155982238400654e-05,
      "loss": 1.7858,
      "num_input_tokens_seen": 7454607344,
      "step": 9475
    },
    {
      "epoch": 1.00530447697857,
      "grad_norm": 0.40993377627886834,
      "learning_rate": 4.915580317289572e-05,
      "loss": 1.6587,
      "num_input_tokens_seen": 7455394112,
      "step": 9476
    },
    {
      "epoch": 1.0054105665181412,
      "grad_norm": 0.4415632543898917,
      "learning_rate": 4.9155624088723875e-05,
      "loss": 1.8663,
      "num_input_tokens_seen": 7456180848,
      "step": 9477
    },
    {
      "epoch": 1.0055166560577127,
      "grad_norm": 0.6233047666237146,
      "learning_rate": 4.915544498588528e-05,
      "loss": 1.8935,
      "num_input_tokens_seen": 7456967568,
      "step": 9478
    },
    {
      "epoch": 1.0056227455972842,
      "grad_norm": 0.5897336805961509,
      "learning_rate": 4.9155265864380065e-05,
      "loss": 1.9347,
      "num_input_tokens_seen": 7457754320,
      "step": 9479
    },
    {
      "epoch": 1.0057288351368554,
      "grad_norm": 0.4201440471530817,
      "learning_rate": 4.9155086724208374e-05,
      "loss": 1.8163,
      "num_input_tokens_seen": 7458541184,
      "step": 9480
    },
    {
      "epoch": 1.0058349246764269,
      "grad_norm": 0.5244020943666515,
      "learning_rate": 4.915490756537033e-05,
      "loss": 1.7415,
      "num_input_tokens_seen": 7459328000,
      "step": 9481
    },
    {
      "epoch": 1.0059410142159984,
      "grad_norm": 0.47087741575027714,
      "learning_rate": 4.915472838786609e-05,
      "loss": 1.9778,
      "num_input_tokens_seen": 7460114768,
      "step": 9482
    },
    {
      "epoch": 1.0060471037555696,
      "grad_norm": 0.5325167791973702,
      "learning_rate": 4.9154549191695786e-05,
      "loss": 1.9353,
      "num_input_tokens_seen": 7460901440,
      "step": 9483
    },
    {
      "epoch": 1.006153193295141,
      "grad_norm": 0.45596019952776456,
      "learning_rate": 4.915436997685956e-05,
      "loss": 1.9025,
      "num_input_tokens_seen": 7461688208,
      "step": 9484
    },
    {
      "epoch": 1.0062592828347126,
      "grad_norm": 0.36561876627599743,
      "learning_rate": 4.915419074335753e-05,
      "loss": 1.7035,
      "num_input_tokens_seen": 7462474912,
      "step": 9485
    },
    {
      "epoch": 1.0063653723742838,
      "grad_norm": 0.39789336909595585,
      "learning_rate": 4.915401149118986e-05,
      "loss": 1.8644,
      "num_input_tokens_seen": 7463261696,
      "step": 9486
    },
    {
      "epoch": 1.0064714619138553,
      "grad_norm": 0.4243516117057825,
      "learning_rate": 4.9153832220356676e-05,
      "loss": 1.7289,
      "num_input_tokens_seen": 7464048448,
      "step": 9487
    },
    {
      "epoch": 1.0065775514534268,
      "grad_norm": 0.48523386420451997,
      "learning_rate": 4.9153652930858125e-05,
      "loss": 1.8243,
      "num_input_tokens_seen": 7464835200,
      "step": 9488
    },
    {
      "epoch": 1.006683640992998,
      "grad_norm": 0.3729715619333733,
      "learning_rate": 4.9153473622694336e-05,
      "loss": 1.8329,
      "num_input_tokens_seen": 7465621968,
      "step": 9489
    },
    {
      "epoch": 1.0067897305325695,
      "grad_norm": 0.3772553564555165,
      "learning_rate": 4.915329429586545e-05,
      "loss": 1.7455,
      "num_input_tokens_seen": 7466408752,
      "step": 9490
    },
    {
      "epoch": 1.006895820072141,
      "grad_norm": 0.4102035689949706,
      "learning_rate": 4.9153114950371604e-05,
      "loss": 1.8452,
      "num_input_tokens_seen": 7467195536,
      "step": 9491
    },
    {
      "epoch": 1.0070019096117122,
      "grad_norm": 0.423806419713995,
      "learning_rate": 4.915293558621295e-05,
      "loss": 1.9097,
      "num_input_tokens_seen": 7467982192,
      "step": 9492
    },
    {
      "epoch": 1.0071079991512837,
      "grad_norm": 0.4432360153631313,
      "learning_rate": 4.9152756203389607e-05,
      "loss": 1.9048,
      "num_input_tokens_seen": 7468768832,
      "step": 9493
    },
    {
      "epoch": 1.0072140886908552,
      "grad_norm": 0.39882567205061864,
      "learning_rate": 4.915257680190172e-05,
      "loss": 1.737,
      "num_input_tokens_seen": 7469555520,
      "step": 9494
    },
    {
      "epoch": 1.0073201782304264,
      "grad_norm": 0.3794514038659438,
      "learning_rate": 4.915239738174944e-05,
      "loss": 1.6477,
      "num_input_tokens_seen": 7470342240,
      "step": 9495
    },
    {
      "epoch": 1.0074262677699979,
      "grad_norm": 0.4055465834767286,
      "learning_rate": 4.9152217942932886e-05,
      "loss": 1.9184,
      "num_input_tokens_seen": 7471128896,
      "step": 9496
    },
    {
      "epoch": 1.0075323573095694,
      "grad_norm": 0.47528554544884777,
      "learning_rate": 4.915203848545221e-05,
      "loss": 1.9226,
      "num_input_tokens_seen": 7471915584,
      "step": 9497
    },
    {
      "epoch": 1.0076384468491406,
      "grad_norm": 0.402360998884108,
      "learning_rate": 4.915185900930755e-05,
      "loss": 1.7452,
      "num_input_tokens_seen": 7472702368,
      "step": 9498
    },
    {
      "epoch": 1.007744536388712,
      "grad_norm": 0.41977461809849076,
      "learning_rate": 4.9151679514499035e-05,
      "loss": 1.6783,
      "num_input_tokens_seen": 7473489152,
      "step": 9499
    },
    {
      "epoch": 1.0078506259282836,
      "grad_norm": 0.547656423052785,
      "learning_rate": 4.915150000102682e-05,
      "loss": 1.7824,
      "num_input_tokens_seen": 7474275904,
      "step": 9500
    },
    {
      "epoch": 1.0079567154678548,
      "grad_norm": 0.41180639509677847,
      "learning_rate": 4.915132046889103e-05,
      "loss": 1.8241,
      "num_input_tokens_seen": 7475062752,
      "step": 9501
    },
    {
      "epoch": 1.0080628050074263,
      "grad_norm": 0.6458531226616007,
      "learning_rate": 4.915114091809181e-05,
      "loss": 1.6827,
      "num_input_tokens_seen": 7475849536,
      "step": 9502
    },
    {
      "epoch": 1.0081688945469978,
      "grad_norm": 0.44814144203876166,
      "learning_rate": 4.91509613486293e-05,
      "loss": 2.0217,
      "num_input_tokens_seen": 7476636288,
      "step": 9503
    },
    {
      "epoch": 1.008274984086569,
      "grad_norm": 0.5829915952332378,
      "learning_rate": 4.915078176050363e-05,
      "loss": 1.8466,
      "num_input_tokens_seen": 7477423120,
      "step": 9504
    },
    {
      "epoch": 1.0083810736261405,
      "grad_norm": 0.5871871609227646,
      "learning_rate": 4.915060215371494e-05,
      "loss": 1.937,
      "num_input_tokens_seen": 7478209856,
      "step": 9505
    },
    {
      "epoch": 1.008487163165712,
      "grad_norm": 0.4320681013338322,
      "learning_rate": 4.915042252826338e-05,
      "loss": 1.9422,
      "num_input_tokens_seen": 7478996624,
      "step": 9506
    },
    {
      "epoch": 1.0085932527052832,
      "grad_norm": 0.47173883494408303,
      "learning_rate": 4.915024288414909e-05,
      "loss": 1.8672,
      "num_input_tokens_seen": 7479783408,
      "step": 9507
    },
    {
      "epoch": 1.0086993422448547,
      "grad_norm": 0.4380759933237878,
      "learning_rate": 4.915006322137219e-05,
      "loss": 1.8864,
      "num_input_tokens_seen": 7480570128,
      "step": 9508
    },
    {
      "epoch": 1.0088054317844262,
      "grad_norm": 0.420749451325466,
      "learning_rate": 4.9149883539932826e-05,
      "loss": 1.8074,
      "num_input_tokens_seen": 7481356832,
      "step": 9509
    },
    {
      "epoch": 1.0089115213239974,
      "grad_norm": 0.38614128557439387,
      "learning_rate": 4.914970383983115e-05,
      "loss": 1.7233,
      "num_input_tokens_seen": 7482143568,
      "step": 9510
    },
    {
      "epoch": 1.009017610863569,
      "grad_norm": 0.5533644187349498,
      "learning_rate": 4.914952412106729e-05,
      "loss": 1.924,
      "num_input_tokens_seen": 7482930320,
      "step": 9511
    },
    {
      "epoch": 1.0091237004031401,
      "grad_norm": 0.7573948502748624,
      "learning_rate": 4.914934438364138e-05,
      "loss": 1.8864,
      "num_input_tokens_seen": 7483717104,
      "step": 9512
    },
    {
      "epoch": 1.0092297899427116,
      "grad_norm": 0.4189644624251191,
      "learning_rate": 4.914916462755357e-05,
      "loss": 1.7758,
      "num_input_tokens_seen": 7484503856,
      "step": 9513
    },
    {
      "epoch": 1.009335879482283,
      "grad_norm": 0.666201887289449,
      "learning_rate": 4.9148984852803996e-05,
      "loss": 1.8213,
      "num_input_tokens_seen": 7485290592,
      "step": 9514
    },
    {
      "epoch": 1.0094419690218543,
      "grad_norm": 0.46896026364146154,
      "learning_rate": 4.914880505939279e-05,
      "loss": 1.8711,
      "num_input_tokens_seen": 7486077344,
      "step": 9515
    },
    {
      "epoch": 1.0095480585614258,
      "grad_norm": 0.5537429852384681,
      "learning_rate": 4.91486252473201e-05,
      "loss": 1.8809,
      "num_input_tokens_seen": 7486864112,
      "step": 9516
    },
    {
      "epoch": 1.0096541481009973,
      "grad_norm": 0.47665882982763824,
      "learning_rate": 4.9148445416586065e-05,
      "loss": 1.8637,
      "num_input_tokens_seen": 7487650880,
      "step": 9517
    },
    {
      "epoch": 1.0097602376405685,
      "grad_norm": 0.5107650849035389,
      "learning_rate": 4.914826556719081e-05,
      "loss": 1.8978,
      "num_input_tokens_seen": 7488437632,
      "step": 9518
    },
    {
      "epoch": 1.00986632718014,
      "grad_norm": 0.4375198908622084,
      "learning_rate": 4.914808569913449e-05,
      "loss": 1.8435,
      "num_input_tokens_seen": 7489224416,
      "step": 9519
    },
    {
      "epoch": 1.0099724167197115,
      "grad_norm": 0.7859669576474076,
      "learning_rate": 4.9147905812417236e-05,
      "loss": 1.6825,
      "num_input_tokens_seen": 7490011168,
      "step": 9520
    },
    {
      "epoch": 1.0100785062592827,
      "grad_norm": 0.5026141328178657,
      "learning_rate": 4.914772590703919e-05,
      "loss": 1.9501,
      "num_input_tokens_seen": 7490797936,
      "step": 9521
    },
    {
      "epoch": 1.0101845957988542,
      "grad_norm": 0.651816295830668,
      "learning_rate": 4.914754598300049e-05,
      "loss": 1.7322,
      "num_input_tokens_seen": 7491584736,
      "step": 9522
    },
    {
      "epoch": 1.0102906853384257,
      "grad_norm": 0.4583321434318383,
      "learning_rate": 4.914736604030128e-05,
      "loss": 1.8136,
      "num_input_tokens_seen": 7492371520,
      "step": 9523
    },
    {
      "epoch": 1.010396774877997,
      "grad_norm": 0.5000508775925506,
      "learning_rate": 4.9147186078941686e-05,
      "loss": 1.8444,
      "num_input_tokens_seen": 7493158304,
      "step": 9524
    },
    {
      "epoch": 1.0105028644175684,
      "grad_norm": 0.46076895757753655,
      "learning_rate": 4.914700609892185e-05,
      "loss": 1.8067,
      "num_input_tokens_seen": 7493945024,
      "step": 9525
    },
    {
      "epoch": 1.01060895395714,
      "grad_norm": 0.5158348566499412,
      "learning_rate": 4.914682610024193e-05,
      "loss": 1.8546,
      "num_input_tokens_seen": 7494731824,
      "step": 9526
    },
    {
      "epoch": 1.0107150434967112,
      "grad_norm": 0.5447744097914403,
      "learning_rate": 4.914664608290205e-05,
      "loss": 2.1042,
      "num_input_tokens_seen": 7495518624,
      "step": 9527
    },
    {
      "epoch": 1.0108211330362826,
      "grad_norm": 0.3765060093895628,
      "learning_rate": 4.914646604690234e-05,
      "loss": 1.7669,
      "num_input_tokens_seen": 7496305280,
      "step": 9528
    },
    {
      "epoch": 1.010927222575854,
      "grad_norm": 0.49834411845923615,
      "learning_rate": 4.9146285992242956e-05,
      "loss": 1.903,
      "num_input_tokens_seen": 7497092096,
      "step": 9529
    },
    {
      "epoch": 1.0110333121154254,
      "grad_norm": 0.46046646656224016,
      "learning_rate": 4.9146105918924036e-05,
      "loss": 1.7682,
      "num_input_tokens_seen": 7497878800,
      "step": 9530
    },
    {
      "epoch": 1.0111394016549968,
      "grad_norm": 0.38329651011498383,
      "learning_rate": 4.9145925826945705e-05,
      "loss": 1.8402,
      "num_input_tokens_seen": 7498665504,
      "step": 9531
    },
    {
      "epoch": 1.0112454911945683,
      "grad_norm": 0.5234915962951829,
      "learning_rate": 4.914574571630811e-05,
      "loss": 1.7345,
      "num_input_tokens_seen": 7499452384,
      "step": 9532
    },
    {
      "epoch": 1.0113515807341396,
      "grad_norm": 0.41150668829627873,
      "learning_rate": 4.91455655870114e-05,
      "loss": 1.8211,
      "num_input_tokens_seen": 7500239088,
      "step": 9533
    },
    {
      "epoch": 1.011457670273711,
      "grad_norm": 0.4086790792319672,
      "learning_rate": 4.9145385439055704e-05,
      "loss": 1.9245,
      "num_input_tokens_seen": 7501025792,
      "step": 9534
    },
    {
      "epoch": 1.0115637598132825,
      "grad_norm": 0.39916273776125666,
      "learning_rate": 4.914520527244115e-05,
      "loss": 1.896,
      "num_input_tokens_seen": 7501812560,
      "step": 9535
    },
    {
      "epoch": 1.0116698493528538,
      "grad_norm": 0.48403606695174967,
      "learning_rate": 4.914502508716791e-05,
      "loss": 1.8844,
      "num_input_tokens_seen": 7502599280,
      "step": 9536
    },
    {
      "epoch": 1.0117759388924252,
      "grad_norm": 0.6699954206219991,
      "learning_rate": 4.914484488323608e-05,
      "loss": 1.7027,
      "num_input_tokens_seen": 7503385984,
      "step": 9537
    },
    {
      "epoch": 1.0118820284319967,
      "grad_norm": 0.41247421226666064,
      "learning_rate": 4.914466466064584e-05,
      "loss": 1.8283,
      "num_input_tokens_seen": 7504172816,
      "step": 9538
    },
    {
      "epoch": 1.011988117971568,
      "grad_norm": 0.4813888250084107,
      "learning_rate": 4.9144484419397305e-05,
      "loss": 1.8459,
      "num_input_tokens_seen": 7504959616,
      "step": 9539
    },
    {
      "epoch": 1.0120942075111394,
      "grad_norm": 0.6093746769394582,
      "learning_rate": 4.914430415949062e-05,
      "loss": 1.7564,
      "num_input_tokens_seen": 7505746352,
      "step": 9540
    },
    {
      "epoch": 1.012200297050711,
      "grad_norm": 0.4588949239891444,
      "learning_rate": 4.914412388092593e-05,
      "loss": 1.7193,
      "num_input_tokens_seen": 7506533168,
      "step": 9541
    },
    {
      "epoch": 1.0123063865902822,
      "grad_norm": 0.4752845153099946,
      "learning_rate": 4.914394358370337e-05,
      "loss": 1.6931,
      "num_input_tokens_seen": 7507319952,
      "step": 9542
    },
    {
      "epoch": 1.0124124761298536,
      "grad_norm": 0.4898499234584438,
      "learning_rate": 4.914376326782307e-05,
      "loss": 1.8756,
      "num_input_tokens_seen": 7508106816,
      "step": 9543
    },
    {
      "epoch": 1.0125185656694249,
      "grad_norm": 0.5179633728585378,
      "learning_rate": 4.914358293328518e-05,
      "loss": 1.9185,
      "num_input_tokens_seen": 7508893648,
      "step": 9544
    },
    {
      "epoch": 1.0126246552089964,
      "grad_norm": 0.47721038345831757,
      "learning_rate": 4.914340258008985e-05,
      "loss": 1.8427,
      "num_input_tokens_seen": 7509680432,
      "step": 9545
    },
    {
      "epoch": 1.0127307447485678,
      "grad_norm": 0.6459224869552094,
      "learning_rate": 4.9143222208237196e-05,
      "loss": 1.7646,
      "num_input_tokens_seen": 7510467248,
      "step": 9546
    },
    {
      "epoch": 1.012836834288139,
      "grad_norm": 0.5887601399946862,
      "learning_rate": 4.914304181772736e-05,
      "loss": 1.8929,
      "num_input_tokens_seen": 7511254016,
      "step": 9547
    },
    {
      "epoch": 1.0129429238277106,
      "grad_norm": 0.7310195721876993,
      "learning_rate": 4.91428614085605e-05,
      "loss": 1.9058,
      "num_input_tokens_seen": 7512040736,
      "step": 9548
    },
    {
      "epoch": 1.013049013367282,
      "grad_norm": 0.39672797749345823,
      "learning_rate": 4.914268098073675e-05,
      "loss": 1.7863,
      "num_input_tokens_seen": 7512827472,
      "step": 9549
    },
    {
      "epoch": 1.0131551029068533,
      "grad_norm": 0.7082487464624164,
      "learning_rate": 4.914250053425624e-05,
      "loss": 1.7705,
      "num_input_tokens_seen": 7513614208,
      "step": 9550
    },
    {
      "epoch": 1.0132611924464248,
      "grad_norm": 0.4328822038347004,
      "learning_rate": 4.9142320069119115e-05,
      "loss": 1.8994,
      "num_input_tokens_seen": 7514400992,
      "step": 9551
    },
    {
      "epoch": 1.0133672819859962,
      "grad_norm": 0.6114530731501414,
      "learning_rate": 4.914213958532551e-05,
      "loss": 1.7857,
      "num_input_tokens_seen": 7515187680,
      "step": 9552
    },
    {
      "epoch": 1.0134733715255675,
      "grad_norm": 0.44480238630954094,
      "learning_rate": 4.9141959082875566e-05,
      "loss": 1.8605,
      "num_input_tokens_seen": 7515974448,
      "step": 9553
    },
    {
      "epoch": 1.013579461065139,
      "grad_norm": 0.444314978781556,
      "learning_rate": 4.914177856176943e-05,
      "loss": 1.7732,
      "num_input_tokens_seen": 7516761280,
      "step": 9554
    },
    {
      "epoch": 1.0136855506047104,
      "grad_norm": 0.49642564356099395,
      "learning_rate": 4.914159802200724e-05,
      "loss": 1.795,
      "num_input_tokens_seen": 7517548048,
      "step": 9555
    },
    {
      "epoch": 1.0137916401442817,
      "grad_norm": 0.40471742635768815,
      "learning_rate": 4.9141417463589125e-05,
      "loss": 1.8152,
      "num_input_tokens_seen": 7518334848,
      "step": 9556
    },
    {
      "epoch": 1.0138977296838532,
      "grad_norm": 0.5636150997441868,
      "learning_rate": 4.914123688651523e-05,
      "loss": 1.9491,
      "num_input_tokens_seen": 7519121536,
      "step": 9557
    },
    {
      "epoch": 1.0140038192234246,
      "grad_norm": 0.3606167308827164,
      "learning_rate": 4.9141056290785695e-05,
      "loss": 1.7304,
      "num_input_tokens_seen": 7519908352,
      "step": 9558
    },
    {
      "epoch": 1.014109908762996,
      "grad_norm": 0.46880174304583977,
      "learning_rate": 4.914087567640066e-05,
      "loss": 1.7181,
      "num_input_tokens_seen": 7520695200,
      "step": 9559
    },
    {
      "epoch": 1.0142159983025674,
      "grad_norm": 0.626348286922787,
      "learning_rate": 4.914069504336027e-05,
      "loss": 1.9118,
      "num_input_tokens_seen": 7521481968,
      "step": 9560
    },
    {
      "epoch": 1.0143220878421388,
      "grad_norm": 0.46767112148880946,
      "learning_rate": 4.914051439166465e-05,
      "loss": 1.8839,
      "num_input_tokens_seen": 7522268656,
      "step": 9561
    },
    {
      "epoch": 1.01442817738171,
      "grad_norm": 0.8199295648231099,
      "learning_rate": 4.914033372131396e-05,
      "loss": 1.8165,
      "num_input_tokens_seen": 7523055424,
      "step": 9562
    },
    {
      "epoch": 1.0145342669212816,
      "grad_norm": 0.49824694971182304,
      "learning_rate": 4.914015303230832e-05,
      "loss": 1.7758,
      "num_input_tokens_seen": 7523842144,
      "step": 9563
    },
    {
      "epoch": 1.014640356460853,
      "grad_norm": 0.6730456676781921,
      "learning_rate": 4.9139972324647885e-05,
      "loss": 1.6975,
      "num_input_tokens_seen": 7524628848,
      "step": 9564
    },
    {
      "epoch": 1.0147464460004243,
      "grad_norm": 0.4960584150457061,
      "learning_rate": 4.913979159833278e-05,
      "loss": 1.7173,
      "num_input_tokens_seen": 7525415632,
      "step": 9565
    },
    {
      "epoch": 1.0148525355399958,
      "grad_norm": 0.4488005525617949,
      "learning_rate": 4.9139610853363164e-05,
      "loss": 1.8254,
      "num_input_tokens_seen": 7526202432,
      "step": 9566
    },
    {
      "epoch": 1.0149586250795672,
      "grad_norm": 0.6112932558966949,
      "learning_rate": 4.9139430089739144e-05,
      "loss": 1.7903,
      "num_input_tokens_seen": 7526989328,
      "step": 9567
    },
    {
      "epoch": 1.0150647146191385,
      "grad_norm": 0.4893461518949428,
      "learning_rate": 4.91392493074609e-05,
      "loss": 1.9197,
      "num_input_tokens_seen": 7527775984,
      "step": 9568
    },
    {
      "epoch": 1.01517080415871,
      "grad_norm": 0.731441328126886,
      "learning_rate": 4.9139068506528546e-05,
      "loss": 1.8149,
      "num_input_tokens_seen": 7528562768,
      "step": 9569
    },
    {
      "epoch": 1.0152768936982814,
      "grad_norm": 0.5342977180046523,
      "learning_rate": 4.9138887686942225e-05,
      "loss": 1.7291,
      "num_input_tokens_seen": 7529349568,
      "step": 9570
    },
    {
      "epoch": 1.0153829832378527,
      "grad_norm": 0.857720520497414,
      "learning_rate": 4.9138706848702084e-05,
      "loss": 1.8633,
      "num_input_tokens_seen": 7530136384,
      "step": 9571
    },
    {
      "epoch": 1.0154890727774242,
      "grad_norm": 0.7379316372952928,
      "learning_rate": 4.913852599180826e-05,
      "loss": 1.9141,
      "num_input_tokens_seen": 7530923120,
      "step": 9572
    },
    {
      "epoch": 1.0155951623169956,
      "grad_norm": 0.629807010870981,
      "learning_rate": 4.913834511626089e-05,
      "loss": 1.8123,
      "num_input_tokens_seen": 7531709840,
      "step": 9573
    },
    {
      "epoch": 1.015701251856567,
      "grad_norm": 0.581243068768949,
      "learning_rate": 4.9138164222060114e-05,
      "loss": 1.8799,
      "num_input_tokens_seen": 7532496560,
      "step": 9574
    },
    {
      "epoch": 1.0158073413961384,
      "grad_norm": 0.4719616255855536,
      "learning_rate": 4.9137983309206074e-05,
      "loss": 1.7547,
      "num_input_tokens_seen": 7533283376,
      "step": 9575
    },
    {
      "epoch": 1.0159134309357096,
      "grad_norm": 0.6036036849718578,
      "learning_rate": 4.9137802377698904e-05,
      "loss": 1.8837,
      "num_input_tokens_seen": 7534070112,
      "step": 9576
    },
    {
      "epoch": 1.016019520475281,
      "grad_norm": 0.3950952817561,
      "learning_rate": 4.9137621427538755e-05,
      "loss": 1.7268,
      "num_input_tokens_seen": 7534856752,
      "step": 9577
    },
    {
      "epoch": 1.0161256100148526,
      "grad_norm": 0.5108096836216673,
      "learning_rate": 4.913744045872576e-05,
      "loss": 1.9155,
      "num_input_tokens_seen": 7535643456,
      "step": 9578
    },
    {
      "epoch": 1.0162316995544238,
      "grad_norm": 0.5832451395306841,
      "learning_rate": 4.913725947126006e-05,
      "loss": 1.8182,
      "num_input_tokens_seen": 7536430256,
      "step": 9579
    },
    {
      "epoch": 1.0163377890939953,
      "grad_norm": 0.431952500367973,
      "learning_rate": 4.913707846514178e-05,
      "loss": 1.9122,
      "num_input_tokens_seen": 7537217024,
      "step": 9580
    },
    {
      "epoch": 1.0164438786335668,
      "grad_norm": 0.6124425491546911,
      "learning_rate": 4.913689744037109e-05,
      "loss": 1.96,
      "num_input_tokens_seen": 7538003664,
      "step": 9581
    },
    {
      "epoch": 1.016549968173138,
      "grad_norm": 0.433273005475526,
      "learning_rate": 4.913671639694811e-05,
      "loss": 1.8533,
      "num_input_tokens_seen": 7538790480,
      "step": 9582
    },
    {
      "epoch": 1.0166560577127095,
      "grad_norm": 0.3811986952429218,
      "learning_rate": 4.913653533487299e-05,
      "loss": 1.8386,
      "num_input_tokens_seen": 7539577200,
      "step": 9583
    },
    {
      "epoch": 1.016762147252281,
      "grad_norm": 0.4241685067005884,
      "learning_rate": 4.913635425414585e-05,
      "loss": 1.7584,
      "num_input_tokens_seen": 7540364016,
      "step": 9584
    },
    {
      "epoch": 1.0168682367918522,
      "grad_norm": 0.4161251375768694,
      "learning_rate": 4.913617315476685e-05,
      "loss": 1.8914,
      "num_input_tokens_seen": 7541150816,
      "step": 9585
    },
    {
      "epoch": 1.0169743263314237,
      "grad_norm": 0.5242335536390719,
      "learning_rate": 4.913599203673612e-05,
      "loss": 1.9824,
      "num_input_tokens_seen": 7541937584,
      "step": 9586
    },
    {
      "epoch": 1.0170804158709952,
      "grad_norm": 0.42835194678271304,
      "learning_rate": 4.9135810900053814e-05,
      "loss": 1.9232,
      "num_input_tokens_seen": 7542724384,
      "step": 9587
    },
    {
      "epoch": 1.0171865054105664,
      "grad_norm": 0.5846290322362544,
      "learning_rate": 4.913562974472006e-05,
      "loss": 1.9977,
      "num_input_tokens_seen": 7543511104,
      "step": 9588
    },
    {
      "epoch": 1.017292594950138,
      "grad_norm": 0.5580216009959669,
      "learning_rate": 4.913544857073499e-05,
      "loss": 1.8413,
      "num_input_tokens_seen": 7544297856,
      "step": 9589
    },
    {
      "epoch": 1.0173986844897094,
      "grad_norm": 0.5826256785010987,
      "learning_rate": 4.913526737809876e-05,
      "loss": 1.8232,
      "num_input_tokens_seen": 7545084592,
      "step": 9590
    },
    {
      "epoch": 1.0175047740292806,
      "grad_norm": 0.5323885716542505,
      "learning_rate": 4.9135086166811496e-05,
      "loss": 1.9434,
      "num_input_tokens_seen": 7545871360,
      "step": 9591
    },
    {
      "epoch": 1.017610863568852,
      "grad_norm": 0.5645235466109744,
      "learning_rate": 4.913490493687335e-05,
      "loss": 1.8878,
      "num_input_tokens_seen": 7546658160,
      "step": 9592
    },
    {
      "epoch": 1.0177169531084236,
      "grad_norm": 0.4344781245733008,
      "learning_rate": 4.9134723688284464e-05,
      "loss": 1.921,
      "num_input_tokens_seen": 7547444864,
      "step": 9593
    },
    {
      "epoch": 1.0178230426479948,
      "grad_norm": 0.5061210003821152,
      "learning_rate": 4.9134542421044964e-05,
      "loss": 1.7895,
      "num_input_tokens_seen": 7548231632,
      "step": 9594
    },
    {
      "epoch": 1.0179291321875663,
      "grad_norm": 0.49546777470163667,
      "learning_rate": 4.9134361135155005e-05,
      "loss": 1.8585,
      "num_input_tokens_seen": 7549018432,
      "step": 9595
    },
    {
      "epoch": 1.0180352217271378,
      "grad_norm": 0.4699455190322874,
      "learning_rate": 4.9134179830614715e-05,
      "loss": 1.8793,
      "num_input_tokens_seen": 7549805184,
      "step": 9596
    },
    {
      "epoch": 1.018141311266709,
      "grad_norm": 0.4896875815070174,
      "learning_rate": 4.913399850742424e-05,
      "loss": 1.7075,
      "num_input_tokens_seen": 7550592096,
      "step": 9597
    },
    {
      "epoch": 1.0182474008062805,
      "grad_norm": 0.4460778998835081,
      "learning_rate": 4.913381716558371e-05,
      "loss": 1.7392,
      "num_input_tokens_seen": 7551378896,
      "step": 9598
    },
    {
      "epoch": 1.018353490345852,
      "grad_norm": 0.5224889765365291,
      "learning_rate": 4.9133635805093286e-05,
      "loss": 1.7214,
      "num_input_tokens_seen": 7552165696,
      "step": 9599
    },
    {
      "epoch": 1.0184595798854232,
      "grad_norm": 0.5325264493170814,
      "learning_rate": 4.91334544259531e-05,
      "loss": 1.7542,
      "num_input_tokens_seen": 7552952528,
      "step": 9600
    },
    {
      "epoch": 1.0185656694249947,
      "grad_norm": 0.40868881020559783,
      "learning_rate": 4.9133273028163275e-05,
      "loss": 1.9116,
      "num_input_tokens_seen": 7553739248,
      "step": 9601
    },
    {
      "epoch": 1.0186717589645662,
      "grad_norm": 0.4856212543767812,
      "learning_rate": 4.913309161172397e-05,
      "loss": 1.9073,
      "num_input_tokens_seen": 7554526000,
      "step": 9602
    },
    {
      "epoch": 1.0187778485041374,
      "grad_norm": 0.4643317793344932,
      "learning_rate": 4.913291017663532e-05,
      "loss": 1.8371,
      "num_input_tokens_seen": 7555312816,
      "step": 9603
    },
    {
      "epoch": 1.018883938043709,
      "grad_norm": 0.47395993936067426,
      "learning_rate": 4.913272872289747e-05,
      "loss": 1.8126,
      "num_input_tokens_seen": 7556099552,
      "step": 9604
    },
    {
      "epoch": 1.0189900275832804,
      "grad_norm": 0.48047452956939596,
      "learning_rate": 4.913254725051055e-05,
      "loss": 1.9876,
      "num_input_tokens_seen": 7556886256,
      "step": 9605
    },
    {
      "epoch": 1.0190961171228516,
      "grad_norm": 0.43372442921713467,
      "learning_rate": 4.9132365759474706e-05,
      "loss": 1.8211,
      "num_input_tokens_seen": 7557672976,
      "step": 9606
    },
    {
      "epoch": 1.0192022066624231,
      "grad_norm": 0.47201287505001793,
      "learning_rate": 4.9132184249790084e-05,
      "loss": 1.6969,
      "num_input_tokens_seen": 7558459728,
      "step": 9607
    },
    {
      "epoch": 1.0193082962019946,
      "grad_norm": 0.35926872977376567,
      "learning_rate": 4.9132002721456805e-05,
      "loss": 1.7142,
      "num_input_tokens_seen": 7559246528,
      "step": 9608
    },
    {
      "epoch": 1.0194143857415658,
      "grad_norm": 0.6672415654389506,
      "learning_rate": 4.913182117447503e-05,
      "loss": 1.858,
      "num_input_tokens_seen": 7560033328,
      "step": 9609
    },
    {
      "epoch": 1.0195204752811373,
      "grad_norm": 0.43735545622218314,
      "learning_rate": 4.913163960884489e-05,
      "loss": 1.7908,
      "num_input_tokens_seen": 7560820160,
      "step": 9610
    },
    {
      "epoch": 1.0196265648207086,
      "grad_norm": 0.4801751758409743,
      "learning_rate": 4.913145802456654e-05,
      "loss": 1.9383,
      "num_input_tokens_seen": 7561606848,
      "step": 9611
    },
    {
      "epoch": 1.01973265436028,
      "grad_norm": 0.5311546280790193,
      "learning_rate": 4.913127642164009e-05,
      "loss": 2.0017,
      "num_input_tokens_seen": 7562393616,
      "step": 9612
    },
    {
      "epoch": 1.0198387438998515,
      "grad_norm": 0.5304973674380464,
      "learning_rate": 4.91310948000657e-05,
      "loss": 1.7713,
      "num_input_tokens_seen": 7563180432,
      "step": 9613
    },
    {
      "epoch": 1.0199448334394228,
      "grad_norm": 0.5011913178231336,
      "learning_rate": 4.9130913159843516e-05,
      "loss": 1.8087,
      "num_input_tokens_seen": 7563967344,
      "step": 9614
    },
    {
      "epoch": 1.0200509229789942,
      "grad_norm": 0.4393703467251846,
      "learning_rate": 4.9130731500973664e-05,
      "loss": 1.8349,
      "num_input_tokens_seen": 7564754128,
      "step": 9615
    },
    {
      "epoch": 1.0201570125185657,
      "grad_norm": 0.4844350416198929,
      "learning_rate": 4.9130549823456294e-05,
      "loss": 1.8545,
      "num_input_tokens_seen": 7565540944,
      "step": 9616
    },
    {
      "epoch": 1.020263102058137,
      "grad_norm": 0.37882657544892473,
      "learning_rate": 4.9130368127291534e-05,
      "loss": 1.7874,
      "num_input_tokens_seen": 7566327648,
      "step": 9617
    },
    {
      "epoch": 1.0203691915977084,
      "grad_norm": 0.39945594480516233,
      "learning_rate": 4.9130186412479554e-05,
      "loss": 1.8359,
      "num_input_tokens_seen": 7567114256,
      "step": 9618
    },
    {
      "epoch": 1.02047528113728,
      "grad_norm": 0.3739229432859566,
      "learning_rate": 4.9130004679020455e-05,
      "loss": 1.838,
      "num_input_tokens_seen": 7567901040,
      "step": 9619
    },
    {
      "epoch": 1.0205813706768512,
      "grad_norm": 0.3651821571795457,
      "learning_rate": 4.912982292691441e-05,
      "loss": 1.8066,
      "num_input_tokens_seen": 7568687760,
      "step": 9620
    },
    {
      "epoch": 1.0206874602164226,
      "grad_norm": 0.47367879160326126,
      "learning_rate": 4.912964115616153e-05,
      "loss": 1.914,
      "num_input_tokens_seen": 7569474528,
      "step": 9621
    },
    {
      "epoch": 1.0207935497559941,
      "grad_norm": 0.40165194444716845,
      "learning_rate": 4.912945936676198e-05,
      "loss": 1.8335,
      "num_input_tokens_seen": 7570261312,
      "step": 9622
    },
    {
      "epoch": 1.0208996392955654,
      "grad_norm": 0.62148512937663,
      "learning_rate": 4.912927755871589e-05,
      "loss": 1.7461,
      "num_input_tokens_seen": 7571048112,
      "step": 9623
    },
    {
      "epoch": 1.0210057288351368,
      "grad_norm": 0.4057638091333325,
      "learning_rate": 4.912909573202341e-05,
      "loss": 1.8186,
      "num_input_tokens_seen": 7571834864,
      "step": 9624
    },
    {
      "epoch": 1.0211118183747083,
      "grad_norm": 0.6428687243987826,
      "learning_rate": 4.9128913886684666e-05,
      "loss": 1.8785,
      "num_input_tokens_seen": 7572621616,
      "step": 9625
    },
    {
      "epoch": 1.0212179079142796,
      "grad_norm": 0.43507051583514333,
      "learning_rate": 4.912873202269981e-05,
      "loss": 1.7179,
      "num_input_tokens_seen": 7573408272,
      "step": 9626
    },
    {
      "epoch": 1.021323997453851,
      "grad_norm": 0.6556282053029341,
      "learning_rate": 4.912855014006897e-05,
      "loss": 1.9326,
      "num_input_tokens_seen": 7574195024,
      "step": 9627
    },
    {
      "epoch": 1.0214300869934225,
      "grad_norm": 0.42950870160855437,
      "learning_rate": 4.91283682387923e-05,
      "loss": 1.7361,
      "num_input_tokens_seen": 7574981808,
      "step": 9628
    },
    {
      "epoch": 1.0215361765329938,
      "grad_norm": 0.6021369053204105,
      "learning_rate": 4.912818631886993e-05,
      "loss": 1.7772,
      "num_input_tokens_seen": 7575768624,
      "step": 9629
    },
    {
      "epoch": 1.0216422660725653,
      "grad_norm": 0.45182424489366124,
      "learning_rate": 4.912800438030201e-05,
      "loss": 1.9348,
      "num_input_tokens_seen": 7576555392,
      "step": 9630
    },
    {
      "epoch": 1.0217483556121367,
      "grad_norm": 0.4793463848760956,
      "learning_rate": 4.9127822423088676e-05,
      "loss": 1.7594,
      "num_input_tokens_seen": 7577342224,
      "step": 9631
    },
    {
      "epoch": 1.021854445151708,
      "grad_norm": 0.46390036925156497,
      "learning_rate": 4.912764044723007e-05,
      "loss": 1.9437,
      "num_input_tokens_seen": 7578128992,
      "step": 9632
    },
    {
      "epoch": 1.0219605346912795,
      "grad_norm": 0.49440250252317236,
      "learning_rate": 4.912745845272633e-05,
      "loss": 1.7383,
      "num_input_tokens_seen": 7578915840,
      "step": 9633
    },
    {
      "epoch": 1.022066624230851,
      "grad_norm": 0.508422363130103,
      "learning_rate": 4.9127276439577595e-05,
      "loss": 1.8918,
      "num_input_tokens_seen": 7579702656,
      "step": 9634
    },
    {
      "epoch": 1.0221727137704222,
      "grad_norm": 0.4780335528252498,
      "learning_rate": 4.912709440778401e-05,
      "loss": 1.7986,
      "num_input_tokens_seen": 7580489488,
      "step": 9635
    },
    {
      "epoch": 1.0222788033099937,
      "grad_norm": 0.3834255652671282,
      "learning_rate": 4.9126912357345716e-05,
      "loss": 1.7093,
      "num_input_tokens_seen": 7581276272,
      "step": 9636
    },
    {
      "epoch": 1.0223848928495651,
      "grad_norm": 0.4478008048756693,
      "learning_rate": 4.9126730288262856e-05,
      "loss": 1.9041,
      "num_input_tokens_seen": 7582062992,
      "step": 9637
    },
    {
      "epoch": 1.0224909823891364,
      "grad_norm": 0.5035875252784722,
      "learning_rate": 4.912654820053556e-05,
      "loss": 1.8206,
      "num_input_tokens_seen": 7582849680,
      "step": 9638
    },
    {
      "epoch": 1.0225970719287079,
      "grad_norm": 0.3551053435581468,
      "learning_rate": 4.912636609416398e-05,
      "loss": 1.7898,
      "num_input_tokens_seen": 7583636416,
      "step": 9639
    },
    {
      "epoch": 1.0227031614682793,
      "grad_norm": 0.41520123350685095,
      "learning_rate": 4.912618396914825e-05,
      "loss": 1.7626,
      "num_input_tokens_seen": 7584423216,
      "step": 9640
    },
    {
      "epoch": 1.0228092510078506,
      "grad_norm": 0.47879796358875704,
      "learning_rate": 4.912600182548851e-05,
      "loss": 1.7556,
      "num_input_tokens_seen": 7585210032,
      "step": 9641
    },
    {
      "epoch": 1.022915340547422,
      "grad_norm": 0.48621317616062104,
      "learning_rate": 4.912581966318491e-05,
      "loss": 1.8511,
      "num_input_tokens_seen": 7585996752,
      "step": 9642
    },
    {
      "epoch": 1.0230214300869935,
      "grad_norm": 0.4814464575029677,
      "learning_rate": 4.912563748223758e-05,
      "loss": 1.8181,
      "num_input_tokens_seen": 7586783536,
      "step": 9643
    },
    {
      "epoch": 1.0231275196265648,
      "grad_norm": 0.3940569764504285,
      "learning_rate": 4.912545528264667e-05,
      "loss": 1.7949,
      "num_input_tokens_seen": 7587570240,
      "step": 9644
    },
    {
      "epoch": 1.0232336091661363,
      "grad_norm": 0.5782254087216023,
      "learning_rate": 4.912527306441231e-05,
      "loss": 1.9426,
      "num_input_tokens_seen": 7588356976,
      "step": 9645
    },
    {
      "epoch": 1.0233396987057075,
      "grad_norm": 0.41226324099342043,
      "learning_rate": 4.912509082753465e-05,
      "loss": 1.7899,
      "num_input_tokens_seen": 7589143712,
      "step": 9646
    },
    {
      "epoch": 1.023445788245279,
      "grad_norm": 0.4842749068392022,
      "learning_rate": 4.912490857201383e-05,
      "loss": 1.8255,
      "num_input_tokens_seen": 7589930384,
      "step": 9647
    },
    {
      "epoch": 1.0235518777848505,
      "grad_norm": 0.38756146340828873,
      "learning_rate": 4.912472629784998e-05,
      "loss": 1.7528,
      "num_input_tokens_seen": 7590717136,
      "step": 9648
    },
    {
      "epoch": 1.0236579673244217,
      "grad_norm": 0.3867556704377923,
      "learning_rate": 4.9124544005043255e-05,
      "loss": 1.8264,
      "num_input_tokens_seen": 7591503920,
      "step": 9649
    },
    {
      "epoch": 1.0237640568639932,
      "grad_norm": 0.4502764334654448,
      "learning_rate": 4.912436169359379e-05,
      "loss": 1.9149,
      "num_input_tokens_seen": 7592290720,
      "step": 9650
    },
    {
      "epoch": 1.0238701464035647,
      "grad_norm": 0.40762807112017463,
      "learning_rate": 4.9124179363501725e-05,
      "loss": 1.7815,
      "num_input_tokens_seen": 7593077376,
      "step": 9651
    },
    {
      "epoch": 1.023976235943136,
      "grad_norm": 0.4965482190739541,
      "learning_rate": 4.912399701476721e-05,
      "loss": 1.7853,
      "num_input_tokens_seen": 7593864128,
      "step": 9652
    },
    {
      "epoch": 1.0240823254827074,
      "grad_norm": 0.43396897429159276,
      "learning_rate": 4.912381464739036e-05,
      "loss": 1.7936,
      "num_input_tokens_seen": 7594650912,
      "step": 9653
    },
    {
      "epoch": 1.0241884150222789,
      "grad_norm": 0.4963686419360104,
      "learning_rate": 4.9123632261371355e-05,
      "loss": 1.8265,
      "num_input_tokens_seen": 7595437728,
      "step": 9654
    },
    {
      "epoch": 1.0242945045618501,
      "grad_norm": 0.5252232095137206,
      "learning_rate": 4.9123449856710304e-05,
      "loss": 1.8182,
      "num_input_tokens_seen": 7596224512,
      "step": 9655
    },
    {
      "epoch": 1.0244005941014216,
      "grad_norm": 0.3827772592309116,
      "learning_rate": 4.912326743340736e-05,
      "loss": 1.7998,
      "num_input_tokens_seen": 7597011360,
      "step": 9656
    },
    {
      "epoch": 1.024506683640993,
      "grad_norm": 0.47763170107141945,
      "learning_rate": 4.9123084991462656e-05,
      "loss": 1.8677,
      "num_input_tokens_seen": 7597798032,
      "step": 9657
    },
    {
      "epoch": 1.0246127731805643,
      "grad_norm": 0.46168299500667215,
      "learning_rate": 4.9122902530876344e-05,
      "loss": 1.8724,
      "num_input_tokens_seen": 7598584784,
      "step": 9658
    },
    {
      "epoch": 1.0247188627201358,
      "grad_norm": 0.41638737209185345,
      "learning_rate": 4.912272005164857e-05,
      "loss": 1.93,
      "num_input_tokens_seen": 7599371616,
      "step": 9659
    },
    {
      "epoch": 1.0248249522597073,
      "grad_norm": 0.4358923823120467,
      "learning_rate": 4.912253755377946e-05,
      "loss": 1.905,
      "num_input_tokens_seen": 7600158272,
      "step": 9660
    },
    {
      "epoch": 1.0249310417992785,
      "grad_norm": 0.4651098407490858,
      "learning_rate": 4.912235503726916e-05,
      "loss": 1.854,
      "num_input_tokens_seen": 7600945056,
      "step": 9661
    },
    {
      "epoch": 1.02503713133885,
      "grad_norm": 0.40475973585828645,
      "learning_rate": 4.912217250211781e-05,
      "loss": 1.8706,
      "num_input_tokens_seen": 7601731840,
      "step": 9662
    },
    {
      "epoch": 1.0251432208784215,
      "grad_norm": 0.7543456654170752,
      "learning_rate": 4.912198994832555e-05,
      "loss": 1.8026,
      "num_input_tokens_seen": 7602518592,
      "step": 9663
    },
    {
      "epoch": 1.0252493104179927,
      "grad_norm": 0.4819342355993146,
      "learning_rate": 4.9121807375892534e-05,
      "loss": 1.7102,
      "num_input_tokens_seen": 7603305376,
      "step": 9664
    },
    {
      "epoch": 1.0253553999575642,
      "grad_norm": 0.5945631282680669,
      "learning_rate": 4.9121624784818885e-05,
      "loss": 1.8566,
      "num_input_tokens_seen": 7604092144,
      "step": 9665
    },
    {
      "epoch": 1.0254614894971357,
      "grad_norm": 0.5088434110293166,
      "learning_rate": 4.912144217510475e-05,
      "loss": 1.838,
      "num_input_tokens_seen": 7604878880,
      "step": 9666
    },
    {
      "epoch": 1.025567579036707,
      "grad_norm": 0.6445346771032202,
      "learning_rate": 4.912125954675028e-05,
      "loss": 1.7513,
      "num_input_tokens_seen": 7605665616,
      "step": 9667
    },
    {
      "epoch": 1.0256736685762784,
      "grad_norm": 0.5344954143149927,
      "learning_rate": 4.9121076899755606e-05,
      "loss": 1.8349,
      "num_input_tokens_seen": 7606452464,
      "step": 9668
    },
    {
      "epoch": 1.0257797581158499,
      "grad_norm": 0.597790743303735,
      "learning_rate": 4.912089423412087e-05,
      "loss": 1.7983,
      "num_input_tokens_seen": 7607239312,
      "step": 9669
    },
    {
      "epoch": 1.0258858476554211,
      "grad_norm": 0.3808860744486121,
      "learning_rate": 4.9120711549846215e-05,
      "loss": 1.7783,
      "num_input_tokens_seen": 7608025984,
      "step": 9670
    },
    {
      "epoch": 1.0259919371949926,
      "grad_norm": 0.5554281599138342,
      "learning_rate": 4.912052884693178e-05,
      "loss": 1.7352,
      "num_input_tokens_seen": 7608812784,
      "step": 9671
    },
    {
      "epoch": 1.026098026734564,
      "grad_norm": 0.4712836156079429,
      "learning_rate": 4.912034612537771e-05,
      "loss": 1.8067,
      "num_input_tokens_seen": 7609599600,
      "step": 9672
    },
    {
      "epoch": 1.0262041162741353,
      "grad_norm": 0.4395113453410029,
      "learning_rate": 4.912016338518415e-05,
      "loss": 1.8144,
      "num_input_tokens_seen": 7610386432,
      "step": 9673
    },
    {
      "epoch": 1.0263102058137068,
      "grad_norm": 0.9763519790131379,
      "learning_rate": 4.911998062635123e-05,
      "loss": 1.8988,
      "num_input_tokens_seen": 7611173184,
      "step": 9674
    },
    {
      "epoch": 1.0264162953532783,
      "grad_norm": 0.5673395584245853,
      "learning_rate": 4.911979784887909e-05,
      "loss": 1.7844,
      "num_input_tokens_seen": 7611959920,
      "step": 9675
    },
    {
      "epoch": 1.0265223848928495,
      "grad_norm": 0.7282181203308085,
      "learning_rate": 4.911961505276789e-05,
      "loss": 1.8818,
      "num_input_tokens_seen": 7612746784,
      "step": 9676
    },
    {
      "epoch": 1.026628474432421,
      "grad_norm": 0.5119689367532929,
      "learning_rate": 4.9119432238017746e-05,
      "loss": 1.8702,
      "num_input_tokens_seen": 7613533584,
      "step": 9677
    },
    {
      "epoch": 1.0267345639719923,
      "grad_norm": 0.42023782063988324,
      "learning_rate": 4.911924940462883e-05,
      "loss": 1.8461,
      "num_input_tokens_seen": 7614320432,
      "step": 9678
    },
    {
      "epoch": 1.0268406535115637,
      "grad_norm": 0.6775850113966841,
      "learning_rate": 4.911906655260125e-05,
      "loss": 1.9223,
      "num_input_tokens_seen": 7615107152,
      "step": 9679
    },
    {
      "epoch": 1.0269467430511352,
      "grad_norm": 0.40735844230757284,
      "learning_rate": 4.911888368193517e-05,
      "loss": 1.8939,
      "num_input_tokens_seen": 7615893872,
      "step": 9680
    },
    {
      "epoch": 1.0270528325907065,
      "grad_norm": 0.36911182779709284,
      "learning_rate": 4.9118700792630726e-05,
      "loss": 1.7596,
      "num_input_tokens_seen": 7616680720,
      "step": 9681
    },
    {
      "epoch": 1.027158922130278,
      "grad_norm": 0.40435745252445854,
      "learning_rate": 4.9118517884688055e-05,
      "loss": 1.8576,
      "num_input_tokens_seen": 7617467584,
      "step": 9682
    },
    {
      "epoch": 1.0272650116698494,
      "grad_norm": 0.5159026659068561,
      "learning_rate": 4.91183349581073e-05,
      "loss": 1.8146,
      "num_input_tokens_seen": 7618254272,
      "step": 9683
    },
    {
      "epoch": 1.0273711012094207,
      "grad_norm": 0.4972442180512387,
      "learning_rate": 4.9118152012888605e-05,
      "loss": 1.8943,
      "num_input_tokens_seen": 7619040912,
      "step": 9684
    },
    {
      "epoch": 1.0274771907489921,
      "grad_norm": 0.507057342567016,
      "learning_rate": 4.911796904903211e-05,
      "loss": 1.7052,
      "num_input_tokens_seen": 7619827744,
      "step": 9685
    },
    {
      "epoch": 1.0275832802885636,
      "grad_norm": 0.48023766184722455,
      "learning_rate": 4.911778606653795e-05,
      "loss": 1.8441,
      "num_input_tokens_seen": 7620614448,
      "step": 9686
    },
    {
      "epoch": 1.0276893698281349,
      "grad_norm": 0.43445267959526834,
      "learning_rate": 4.911760306540628e-05,
      "loss": 1.9816,
      "num_input_tokens_seen": 7621401232,
      "step": 9687
    },
    {
      "epoch": 1.0277954593677063,
      "grad_norm": 0.37339741865909565,
      "learning_rate": 4.911742004563723e-05,
      "loss": 1.7226,
      "num_input_tokens_seen": 7622188064,
      "step": 9688
    },
    {
      "epoch": 1.0279015489072778,
      "grad_norm": 0.39036357240697056,
      "learning_rate": 4.911723700723096e-05,
      "loss": 1.7053,
      "num_input_tokens_seen": 7622974848,
      "step": 9689
    },
    {
      "epoch": 1.028007638446849,
      "grad_norm": 0.3715104278026478,
      "learning_rate": 4.9117053950187577e-05,
      "loss": 1.6908,
      "num_input_tokens_seen": 7623761632,
      "step": 9690
    },
    {
      "epoch": 1.0281137279864205,
      "grad_norm": 0.37258376258414005,
      "learning_rate": 4.911687087450725e-05,
      "loss": 1.9052,
      "num_input_tokens_seen": 7624548352,
      "step": 9691
    },
    {
      "epoch": 1.028219817525992,
      "grad_norm": 0.3844909869970443,
      "learning_rate": 4.911668778019011e-05,
      "loss": 1.8765,
      "num_input_tokens_seen": 7625335152,
      "step": 9692
    },
    {
      "epoch": 1.0283259070655633,
      "grad_norm": 0.6229142013623489,
      "learning_rate": 4.911650466723631e-05,
      "loss": 1.868,
      "num_input_tokens_seen": 7626121824,
      "step": 9693
    },
    {
      "epoch": 1.0284319966051347,
      "grad_norm": 0.4081764706805893,
      "learning_rate": 4.911632153564597e-05,
      "loss": 1.7425,
      "num_input_tokens_seen": 7626908560,
      "step": 9694
    },
    {
      "epoch": 1.0285380861447062,
      "grad_norm": 0.6374314018383321,
      "learning_rate": 4.9116138385419255e-05,
      "loss": 1.8073,
      "num_input_tokens_seen": 7627695296,
      "step": 9695
    },
    {
      "epoch": 1.0286441756842775,
      "grad_norm": 0.4027085004481692,
      "learning_rate": 4.9115955216556284e-05,
      "loss": 1.7869,
      "num_input_tokens_seen": 7628482112,
      "step": 9696
    },
    {
      "epoch": 1.028750265223849,
      "grad_norm": 0.6817259956446742,
      "learning_rate": 4.911577202905722e-05,
      "loss": 1.6967,
      "num_input_tokens_seen": 7629268864,
      "step": 9697
    },
    {
      "epoch": 1.0288563547634204,
      "grad_norm": 0.4094995878670837,
      "learning_rate": 4.91155888229222e-05,
      "loss": 1.8986,
      "num_input_tokens_seen": 7630055664,
      "step": 9698
    },
    {
      "epoch": 1.0289624443029917,
      "grad_norm": 0.6444662316997706,
      "learning_rate": 4.911540559815135e-05,
      "loss": 1.7564,
      "num_input_tokens_seen": 7630842480,
      "step": 9699
    },
    {
      "epoch": 1.0290685338425631,
      "grad_norm": 0.40115938628705744,
      "learning_rate": 4.9115222354744826e-05,
      "loss": 1.7974,
      "num_input_tokens_seen": 7631629280,
      "step": 9700
    },
    {
      "epoch": 1.0291746233821346,
      "grad_norm": 0.4397002820106053,
      "learning_rate": 4.911503909270276e-05,
      "loss": 1.8782,
      "num_input_tokens_seen": 7632415968,
      "step": 9701
    },
    {
      "epoch": 1.0292807129217059,
      "grad_norm": 0.42000634326259917,
      "learning_rate": 4.911485581202531e-05,
      "loss": 1.6897,
      "num_input_tokens_seen": 7633202768,
      "step": 9702
    },
    {
      "epoch": 1.0293868024612773,
      "grad_norm": 0.5317441537258542,
      "learning_rate": 4.91146725127126e-05,
      "loss": 1.9444,
      "num_input_tokens_seen": 7633989552,
      "step": 9703
    },
    {
      "epoch": 1.0294928920008488,
      "grad_norm": 0.3910913249846827,
      "learning_rate": 4.911448919476478e-05,
      "loss": 1.7896,
      "num_input_tokens_seen": 7634776304,
      "step": 9704
    },
    {
      "epoch": 1.02959898154042,
      "grad_norm": 0.3460390930380467,
      "learning_rate": 4.9114305858182e-05,
      "loss": 1.6804,
      "num_input_tokens_seen": 7635563024,
      "step": 9705
    },
    {
      "epoch": 1.0297050710799915,
      "grad_norm": 0.39146431926759917,
      "learning_rate": 4.9114122502964374e-05,
      "loss": 1.5552,
      "num_input_tokens_seen": 7636349744,
      "step": 9706
    },
    {
      "epoch": 1.029811160619563,
      "grad_norm": 0.34875999426194143,
      "learning_rate": 4.911393912911208e-05,
      "loss": 1.683,
      "num_input_tokens_seen": 7637136560,
      "step": 9707
    },
    {
      "epoch": 1.0299172501591343,
      "grad_norm": 0.389559330059209,
      "learning_rate": 4.911375573662522e-05,
      "loss": 1.7524,
      "num_input_tokens_seen": 7637923264,
      "step": 9708
    },
    {
      "epoch": 1.0300233396987057,
      "grad_norm": 0.3926181816926134,
      "learning_rate": 4.9113572325503974e-05,
      "loss": 1.8196,
      "num_input_tokens_seen": 7638710016,
      "step": 9709
    },
    {
      "epoch": 1.030129429238277,
      "grad_norm": 0.4734293234248322,
      "learning_rate": 4.9113388895748465e-05,
      "loss": 1.7668,
      "num_input_tokens_seen": 7639496768,
      "step": 9710
    },
    {
      "epoch": 1.0302355187778485,
      "grad_norm": 0.4234763564072436,
      "learning_rate": 4.9113205447358835e-05,
      "loss": 1.6722,
      "num_input_tokens_seen": 7640283520,
      "step": 9711
    },
    {
      "epoch": 1.03034160831742,
      "grad_norm": 0.38914350456945757,
      "learning_rate": 4.9113021980335225e-05,
      "loss": 1.7907,
      "num_input_tokens_seen": 7641070256,
      "step": 9712
    },
    {
      "epoch": 1.0304476978569912,
      "grad_norm": 0.4181436177270326,
      "learning_rate": 4.911283849467778e-05,
      "loss": 1.8342,
      "num_input_tokens_seen": 7641857008,
      "step": 9713
    },
    {
      "epoch": 1.0305537873965627,
      "grad_norm": 0.3805238220188134,
      "learning_rate": 4.911265499038664e-05,
      "loss": 1.8268,
      "num_input_tokens_seen": 7642643744,
      "step": 9714
    },
    {
      "epoch": 1.0306598769361341,
      "grad_norm": 0.3512440382976915,
      "learning_rate": 4.9112471467461954e-05,
      "loss": 1.6813,
      "num_input_tokens_seen": 7643430544,
      "step": 9715
    },
    {
      "epoch": 1.0307659664757054,
      "grad_norm": 0.4284770088180081,
      "learning_rate": 4.911228792590384e-05,
      "loss": 1.8592,
      "num_input_tokens_seen": 7644217280,
      "step": 9716
    },
    {
      "epoch": 1.0308720560152769,
      "grad_norm": 0.38110864922034143,
      "learning_rate": 4.9112104365712477e-05,
      "loss": 1.7369,
      "num_input_tokens_seen": 7645004160,
      "step": 9717
    },
    {
      "epoch": 1.0309781455548483,
      "grad_norm": 0.34621203067287487,
      "learning_rate": 4.911192078688798e-05,
      "loss": 1.8373,
      "num_input_tokens_seen": 7645790944,
      "step": 9718
    },
    {
      "epoch": 1.0310842350944196,
      "grad_norm": 0.35146266404850585,
      "learning_rate": 4.9111737189430496e-05,
      "loss": 1.6735,
      "num_input_tokens_seen": 7646577760,
      "step": 9719
    },
    {
      "epoch": 1.031190324633991,
      "grad_norm": 0.38157868591751654,
      "learning_rate": 4.9111553573340174e-05,
      "loss": 1.8698,
      "num_input_tokens_seen": 7647364448,
      "step": 9720
    },
    {
      "epoch": 1.0312964141735625,
      "grad_norm": 0.3497102923548879,
      "learning_rate": 4.9111369938617145e-05,
      "loss": 1.7196,
      "num_input_tokens_seen": 7648151168,
      "step": 9721
    },
    {
      "epoch": 1.0314025037131338,
      "grad_norm": 0.40975676453909904,
      "learning_rate": 4.9111186285261554e-05,
      "loss": 1.8521,
      "num_input_tokens_seen": 7648937952,
      "step": 9722
    },
    {
      "epoch": 1.0315085932527053,
      "grad_norm": 0.4172647023780112,
      "learning_rate": 4.911100261327356e-05,
      "loss": 1.8085,
      "num_input_tokens_seen": 7649724736,
      "step": 9723
    },
    {
      "epoch": 1.0316146827922767,
      "grad_norm": 0.3775756908506447,
      "learning_rate": 4.911081892265328e-05,
      "loss": 1.724,
      "num_input_tokens_seen": 7650511616,
      "step": 9724
    },
    {
      "epoch": 1.031720772331848,
      "grad_norm": 0.35595524825324026,
      "learning_rate": 4.911063521340087e-05,
      "loss": 1.6265,
      "num_input_tokens_seen": 7651298368,
      "step": 9725
    },
    {
      "epoch": 1.0318268618714195,
      "grad_norm": 0.4574029054439261,
      "learning_rate": 4.911045148551646e-05,
      "loss": 1.8266,
      "num_input_tokens_seen": 7652085152,
      "step": 9726
    },
    {
      "epoch": 1.031932951410991,
      "grad_norm": 0.37191682426009115,
      "learning_rate": 4.9110267739000217e-05,
      "loss": 1.8281,
      "num_input_tokens_seen": 7652871840,
      "step": 9727
    },
    {
      "epoch": 1.0320390409505622,
      "grad_norm": 0.5289377323003188,
      "learning_rate": 4.911008397385225e-05,
      "loss": 1.7245,
      "num_input_tokens_seen": 7653658560,
      "step": 9728
    },
    {
      "epoch": 1.0321451304901337,
      "grad_norm": 0.3821181536614129,
      "learning_rate": 4.9109900190072725e-05,
      "loss": 1.8332,
      "num_input_tokens_seen": 7654445344,
      "step": 9729
    },
    {
      "epoch": 1.0322512200297052,
      "grad_norm": 0.3964948799203624,
      "learning_rate": 4.910971638766178e-05,
      "loss": 1.7608,
      "num_input_tokens_seen": 7655232128,
      "step": 9730
    },
    {
      "epoch": 1.0323573095692764,
      "grad_norm": 0.5752154588810425,
      "learning_rate": 4.910953256661955e-05,
      "loss": 1.9399,
      "num_input_tokens_seen": 7656018816,
      "step": 9731
    },
    {
      "epoch": 1.0324633991088479,
      "grad_norm": 0.45341781602640435,
      "learning_rate": 4.910934872694618e-05,
      "loss": 1.8629,
      "num_input_tokens_seen": 7656805552,
      "step": 9732
    },
    {
      "epoch": 1.0325694886484194,
      "grad_norm": 0.49507790184021194,
      "learning_rate": 4.910916486864181e-05,
      "loss": 2.0068,
      "num_input_tokens_seen": 7657592272,
      "step": 9733
    },
    {
      "epoch": 1.0326755781879906,
      "grad_norm": 0.4583839727093949,
      "learning_rate": 4.910898099170659e-05,
      "loss": 1.8086,
      "num_input_tokens_seen": 7658378928,
      "step": 9734
    },
    {
      "epoch": 1.032781667727562,
      "grad_norm": 0.5195066938661053,
      "learning_rate": 4.910879709614066e-05,
      "loss": 1.8182,
      "num_input_tokens_seen": 7659165664,
      "step": 9735
    },
    {
      "epoch": 1.0328877572671336,
      "grad_norm": 0.4357585945488485,
      "learning_rate": 4.910861318194415e-05,
      "loss": 1.7662,
      "num_input_tokens_seen": 7659952320,
      "step": 9736
    },
    {
      "epoch": 1.0329938468067048,
      "grad_norm": 0.41323279145131653,
      "learning_rate": 4.910842924911721e-05,
      "loss": 1.8714,
      "num_input_tokens_seen": 7660739168,
      "step": 9737
    },
    {
      "epoch": 1.0330999363462763,
      "grad_norm": 0.4960530729699642,
      "learning_rate": 4.910824529766e-05,
      "loss": 1.8352,
      "num_input_tokens_seen": 7661526000,
      "step": 9738
    },
    {
      "epoch": 1.0332060258858478,
      "grad_norm": 0.38662630917162194,
      "learning_rate": 4.910806132757263e-05,
      "loss": 1.7587,
      "num_input_tokens_seen": 7662312768,
      "step": 9739
    },
    {
      "epoch": 1.033312115425419,
      "grad_norm": 0.5254366984129792,
      "learning_rate": 4.9107877338855254e-05,
      "loss": 1.8713,
      "num_input_tokens_seen": 7663099600,
      "step": 9740
    },
    {
      "epoch": 1.0334182049649905,
      "grad_norm": 0.4276331474998265,
      "learning_rate": 4.910769333150803e-05,
      "loss": 1.8426,
      "num_input_tokens_seen": 7663886480,
      "step": 9741
    },
    {
      "epoch": 1.033524294504562,
      "grad_norm": 0.4425685204071593,
      "learning_rate": 4.910750930553109e-05,
      "loss": 1.9126,
      "num_input_tokens_seen": 7664673152,
      "step": 9742
    },
    {
      "epoch": 1.0336303840441332,
      "grad_norm": 0.42042457555253476,
      "learning_rate": 4.910732526092456e-05,
      "loss": 1.8251,
      "num_input_tokens_seen": 7665459872,
      "step": 9743
    },
    {
      "epoch": 1.0337364735837047,
      "grad_norm": 0.8637326598263236,
      "learning_rate": 4.91071411976886e-05,
      "loss": 1.8523,
      "num_input_tokens_seen": 7666246624,
      "step": 9744
    },
    {
      "epoch": 1.033842563123276,
      "grad_norm": 0.9684438889662623,
      "learning_rate": 4.910695711582336e-05,
      "loss": 1.7398,
      "num_input_tokens_seen": 7667033440,
      "step": 9745
    },
    {
      "epoch": 1.0339486526628474,
      "grad_norm": 0.5080581226343961,
      "learning_rate": 4.9106773015328953e-05,
      "loss": 1.7843,
      "num_input_tokens_seen": 7667820224,
      "step": 9746
    },
    {
      "epoch": 1.0340547422024189,
      "grad_norm": 0.5872429728286144,
      "learning_rate": 4.910658889620555e-05,
      "loss": 1.7127,
      "num_input_tokens_seen": 7668606976,
      "step": 9747
    },
    {
      "epoch": 1.0341608317419901,
      "grad_norm": 0.6957235839595495,
      "learning_rate": 4.910640475845328e-05,
      "loss": 1.7953,
      "num_input_tokens_seen": 7669393712,
      "step": 9748
    },
    {
      "epoch": 1.0342669212815616,
      "grad_norm": 0.36949622042535624,
      "learning_rate": 4.9106220602072295e-05,
      "loss": 1.6485,
      "num_input_tokens_seen": 7670180496,
      "step": 9749
    },
    {
      "epoch": 1.034373010821133,
      "grad_norm": 0.7962890956904686,
      "learning_rate": 4.910603642706273e-05,
      "loss": 1.9676,
      "num_input_tokens_seen": 7670967232,
      "step": 9750
    },
    {
      "epoch": 1.0344791003607043,
      "grad_norm": 0.6027952545216442,
      "learning_rate": 4.910585223342472e-05,
      "loss": 2.0136,
      "num_input_tokens_seen": 7671753888,
      "step": 9751
    },
    {
      "epoch": 1.0345851899002758,
      "grad_norm": 0.5278985105937939,
      "learning_rate": 4.9105668021158414e-05,
      "loss": 1.7618,
      "num_input_tokens_seen": 7672540752,
      "step": 9752
    },
    {
      "epoch": 1.0346912794398473,
      "grad_norm": 0.4495738954183159,
      "learning_rate": 4.910548379026396e-05,
      "loss": 1.7899,
      "num_input_tokens_seen": 7673327600,
      "step": 9753
    },
    {
      "epoch": 1.0347973689794185,
      "grad_norm": 0.5234297352184062,
      "learning_rate": 4.910529954074149e-05,
      "loss": 1.8388,
      "num_input_tokens_seen": 7674114272,
      "step": 9754
    },
    {
      "epoch": 1.03490345851899,
      "grad_norm": 0.49736193817965574,
      "learning_rate": 4.910511527259116e-05,
      "loss": 1.7911,
      "num_input_tokens_seen": 7674901024,
      "step": 9755
    },
    {
      "epoch": 1.0350095480585615,
      "grad_norm": 0.7268255639514989,
      "learning_rate": 4.910493098581309e-05,
      "loss": 1.9328,
      "num_input_tokens_seen": 7675687744,
      "step": 9756
    },
    {
      "epoch": 1.0351156375981327,
      "grad_norm": 0.5016433329327179,
      "learning_rate": 4.9104746680407455e-05,
      "loss": 1.8314,
      "num_input_tokens_seen": 7676474448,
      "step": 9757
    },
    {
      "epoch": 1.0352217271377042,
      "grad_norm": 0.5752612544603222,
      "learning_rate": 4.910456235637436e-05,
      "loss": 1.8732,
      "num_input_tokens_seen": 7677261184,
      "step": 9758
    },
    {
      "epoch": 1.0353278166772757,
      "grad_norm": 0.39214539187344216,
      "learning_rate": 4.910437801371398e-05,
      "loss": 1.9092,
      "num_input_tokens_seen": 7678047872,
      "step": 9759
    },
    {
      "epoch": 1.035433906216847,
      "grad_norm": 0.5454612467786933,
      "learning_rate": 4.910419365242645e-05,
      "loss": 1.8302,
      "num_input_tokens_seen": 7678834624,
      "step": 9760
    },
    {
      "epoch": 1.0355399957564184,
      "grad_norm": 0.3990835981254364,
      "learning_rate": 4.9104009272511886e-05,
      "loss": 1.8236,
      "num_input_tokens_seen": 7679621472,
      "step": 9761
    },
    {
      "epoch": 1.03564608529599,
      "grad_norm": 0.45584141588526805,
      "learning_rate": 4.910382487397046e-05,
      "loss": 1.9725,
      "num_input_tokens_seen": 7680408256,
      "step": 9762
    },
    {
      "epoch": 1.0357521748355611,
      "grad_norm": 0.4461158359843868,
      "learning_rate": 4.910364045680231e-05,
      "loss": 1.8313,
      "num_input_tokens_seen": 7681194960,
      "step": 9763
    },
    {
      "epoch": 1.0358582643751326,
      "grad_norm": 0.4471780514907085,
      "learning_rate": 4.910345602100757e-05,
      "loss": 1.9214,
      "num_input_tokens_seen": 7681981648,
      "step": 9764
    },
    {
      "epoch": 1.035964353914704,
      "grad_norm": 0.36715659631320857,
      "learning_rate": 4.9103271566586385e-05,
      "loss": 1.731,
      "num_input_tokens_seen": 7682768384,
      "step": 9765
    },
    {
      "epoch": 1.0360704434542753,
      "grad_norm": 0.4951760893084269,
      "learning_rate": 4.9103087093538904e-05,
      "loss": 1.862,
      "num_input_tokens_seen": 7683555232,
      "step": 9766
    },
    {
      "epoch": 1.0361765329938468,
      "grad_norm": 0.3748337867512197,
      "learning_rate": 4.9102902601865264e-05,
      "loss": 1.7779,
      "num_input_tokens_seen": 7684342000,
      "step": 9767
    },
    {
      "epoch": 1.0362826225334183,
      "grad_norm": 0.5002384383476702,
      "learning_rate": 4.9102718091565606e-05,
      "loss": 1.764,
      "num_input_tokens_seen": 7685128704,
      "step": 9768
    },
    {
      "epoch": 1.0363887120729895,
      "grad_norm": 0.40718553553163117,
      "learning_rate": 4.910253356264007e-05,
      "loss": 1.7414,
      "num_input_tokens_seen": 7685915488,
      "step": 9769
    },
    {
      "epoch": 1.036494801612561,
      "grad_norm": 0.42084819950120406,
      "learning_rate": 4.9102349015088814e-05,
      "loss": 1.8587,
      "num_input_tokens_seen": 7686702256,
      "step": 9770
    },
    {
      "epoch": 1.0366008911521325,
      "grad_norm": 0.39239869403910116,
      "learning_rate": 4.910216444891196e-05,
      "loss": 1.8625,
      "num_input_tokens_seen": 7687489120,
      "step": 9771
    },
    {
      "epoch": 1.0367069806917037,
      "grad_norm": 0.38520802059745785,
      "learning_rate": 4.910197986410966e-05,
      "loss": 1.7895,
      "num_input_tokens_seen": 7688275872,
      "step": 9772
    },
    {
      "epoch": 1.0368130702312752,
      "grad_norm": 0.37349221893332685,
      "learning_rate": 4.910179526068206e-05,
      "loss": 1.8702,
      "num_input_tokens_seen": 7689062624,
      "step": 9773
    },
    {
      "epoch": 1.0369191597708467,
      "grad_norm": 0.4682041575445521,
      "learning_rate": 4.9101610638629305e-05,
      "loss": 1.8459,
      "num_input_tokens_seen": 7689849424,
      "step": 9774
    },
    {
      "epoch": 1.037025249310418,
      "grad_norm": 0.35873182553768607,
      "learning_rate": 4.910142599795153e-05,
      "loss": 1.8351,
      "num_input_tokens_seen": 7690636160,
      "step": 9775
    },
    {
      "epoch": 1.0371313388499894,
      "grad_norm": 0.5027076423603751,
      "learning_rate": 4.910124133864887e-05,
      "loss": 1.7788,
      "num_input_tokens_seen": 7691422928,
      "step": 9776
    },
    {
      "epoch": 1.037237428389561,
      "grad_norm": 0.4054302442221566,
      "learning_rate": 4.910105666072149e-05,
      "loss": 1.7909,
      "num_input_tokens_seen": 7692209808,
      "step": 9777
    },
    {
      "epoch": 1.0373435179291322,
      "grad_norm": 0.583815359757539,
      "learning_rate": 4.910087196416952e-05,
      "loss": 1.9421,
      "num_input_tokens_seen": 7692996480,
      "step": 9778
    },
    {
      "epoch": 1.0374496074687036,
      "grad_norm": 0.3785562464510976,
      "learning_rate": 4.91006872489931e-05,
      "loss": 1.7167,
      "num_input_tokens_seen": 7693783216,
      "step": 9779
    },
    {
      "epoch": 1.0375556970082749,
      "grad_norm": 0.384839132421365,
      "learning_rate": 4.9100502515192375e-05,
      "loss": 1.748,
      "num_input_tokens_seen": 7694569952,
      "step": 9780
    },
    {
      "epoch": 1.0376617865478464,
      "grad_norm": 0.4195032900389044,
      "learning_rate": 4.910031776276749e-05,
      "loss": 1.6737,
      "num_input_tokens_seen": 7695356816,
      "step": 9781
    },
    {
      "epoch": 1.0377678760874178,
      "grad_norm": 0.43677128618006483,
      "learning_rate": 4.910013299171859e-05,
      "loss": 1.7505,
      "num_input_tokens_seen": 7696143632,
      "step": 9782
    },
    {
      "epoch": 1.037873965626989,
      "grad_norm": 0.3687387492093543,
      "learning_rate": 4.909994820204581e-05,
      "loss": 1.9031,
      "num_input_tokens_seen": 7696930384,
      "step": 9783
    },
    {
      "epoch": 1.0379800551665606,
      "grad_norm": 0.43379454859039557,
      "learning_rate": 4.9099763393749296e-05,
      "loss": 1.722,
      "num_input_tokens_seen": 7697717056,
      "step": 9784
    },
    {
      "epoch": 1.038086144706132,
      "grad_norm": 0.45104833190572485,
      "learning_rate": 4.9099578566829196e-05,
      "loss": 1.9515,
      "num_input_tokens_seen": 7698503776,
      "step": 9785
    },
    {
      "epoch": 1.0381922342457033,
      "grad_norm": 0.4096315551319999,
      "learning_rate": 4.909939372128565e-05,
      "loss": 1.7102,
      "num_input_tokens_seen": 7699290528,
      "step": 9786
    },
    {
      "epoch": 1.0382983237852748,
      "grad_norm": 0.3931896708935397,
      "learning_rate": 4.909920885711879e-05,
      "loss": 1.8532,
      "num_input_tokens_seen": 7700077360,
      "step": 9787
    },
    {
      "epoch": 1.0384044133248462,
      "grad_norm": 0.45608988361999686,
      "learning_rate": 4.909902397432879e-05,
      "loss": 1.8499,
      "num_input_tokens_seen": 7700864080,
      "step": 9788
    },
    {
      "epoch": 1.0385105028644175,
      "grad_norm": 0.4836238628388372,
      "learning_rate": 4.9098839072915745e-05,
      "loss": 1.7763,
      "num_input_tokens_seen": 7701650880,
      "step": 9789
    },
    {
      "epoch": 1.038616592403989,
      "grad_norm": 0.4567536362379099,
      "learning_rate": 4.909865415287984e-05,
      "loss": 1.8747,
      "num_input_tokens_seen": 7702437584,
      "step": 9790
    },
    {
      "epoch": 1.0387226819435604,
      "grad_norm": 0.4233385741170802,
      "learning_rate": 4.90984692142212e-05,
      "loss": 1.8502,
      "num_input_tokens_seen": 7703224352,
      "step": 9791
    },
    {
      "epoch": 1.0388287714831317,
      "grad_norm": 0.3934300400366863,
      "learning_rate": 4.9098284256939964e-05,
      "loss": 1.7737,
      "num_input_tokens_seen": 7704011184,
      "step": 9792
    },
    {
      "epoch": 1.0389348610227032,
      "grad_norm": 0.6797975108220004,
      "learning_rate": 4.909809928103628e-05,
      "loss": 1.8832,
      "num_input_tokens_seen": 7704797936,
      "step": 9793
    },
    {
      "epoch": 1.0390409505622746,
      "grad_norm": 0.43757484081890685,
      "learning_rate": 4.9097914286510305e-05,
      "loss": 1.8604,
      "num_input_tokens_seen": 7705584640,
      "step": 9794
    },
    {
      "epoch": 1.0391470401018459,
      "grad_norm": 1.3059794434477403,
      "learning_rate": 4.909772927336216e-05,
      "loss": 1.9269,
      "num_input_tokens_seen": 7706371440,
      "step": 9795
    },
    {
      "epoch": 1.0392531296414174,
      "grad_norm": 0.3900467216182378,
      "learning_rate": 4.9097544241592e-05,
      "loss": 1.8067,
      "num_input_tokens_seen": 7707158224,
      "step": 9796
    },
    {
      "epoch": 1.0393592191809888,
      "grad_norm": 0.7223674794960154,
      "learning_rate": 4.909735919119996e-05,
      "loss": 1.7892,
      "num_input_tokens_seen": 7707944912,
      "step": 9797
    },
    {
      "epoch": 1.03946530872056,
      "grad_norm": 0.6121009079152719,
      "learning_rate": 4.9097174122186194e-05,
      "loss": 1.7338,
      "num_input_tokens_seen": 7708731776,
      "step": 9798
    },
    {
      "epoch": 1.0395713982601316,
      "grad_norm": 0.541852411379722,
      "learning_rate": 4.909698903455083e-05,
      "loss": 1.6379,
      "num_input_tokens_seen": 7709518576,
      "step": 9799
    },
    {
      "epoch": 1.039677487799703,
      "grad_norm": 0.6094540277857008,
      "learning_rate": 4.9096803928294024e-05,
      "loss": 1.6793,
      "num_input_tokens_seen": 7710305376,
      "step": 9800
    },
    {
      "epoch": 1.0397835773392743,
      "grad_norm": 0.5340601653416073,
      "learning_rate": 4.909661880341592e-05,
      "loss": 1.9102,
      "num_input_tokens_seen": 7711092128,
      "step": 9801
    },
    {
      "epoch": 1.0398896668788458,
      "grad_norm": 0.5021903412736121,
      "learning_rate": 4.909643365991665e-05,
      "loss": 1.9862,
      "num_input_tokens_seen": 7711878800,
      "step": 9802
    },
    {
      "epoch": 1.0399957564184172,
      "grad_norm": 0.4178071455016446,
      "learning_rate": 4.909624849779637e-05,
      "loss": 1.6959,
      "num_input_tokens_seen": 7712665600,
      "step": 9803
    },
    {
      "epoch": 1.0401018459579885,
      "grad_norm": 0.4625626161744728,
      "learning_rate": 4.9096063317055204e-05,
      "loss": 1.831,
      "num_input_tokens_seen": 7713452400,
      "step": 9804
    },
    {
      "epoch": 1.04020793549756,
      "grad_norm": 0.4848129992816132,
      "learning_rate": 4.9095878117693316e-05,
      "loss": 1.9526,
      "num_input_tokens_seen": 7714239184,
      "step": 9805
    },
    {
      "epoch": 1.0403140250371314,
      "grad_norm": 0.45370734821612735,
      "learning_rate": 4.9095692899710844e-05,
      "loss": 1.8516,
      "num_input_tokens_seen": 7715025936,
      "step": 9806
    },
    {
      "epoch": 1.0404201145767027,
      "grad_norm": 0.47298319681602347,
      "learning_rate": 4.909550766310792e-05,
      "loss": 1.8712,
      "num_input_tokens_seen": 7715812816,
      "step": 9807
    },
    {
      "epoch": 1.0405262041162742,
      "grad_norm": 0.41872619500019326,
      "learning_rate": 4.90953224078847e-05,
      "loss": 1.7746,
      "num_input_tokens_seen": 7716599520,
      "step": 9808
    },
    {
      "epoch": 1.0406322936558454,
      "grad_norm": 0.5028318190911745,
      "learning_rate": 4.909513713404132e-05,
      "loss": 1.952,
      "num_input_tokens_seen": 7717386288,
      "step": 9809
    },
    {
      "epoch": 1.040738383195417,
      "grad_norm": 0.5125052247154795,
      "learning_rate": 4.909495184157792e-05,
      "loss": 1.7866,
      "num_input_tokens_seen": 7718173104,
      "step": 9810
    },
    {
      "epoch": 1.0408444727349884,
      "grad_norm": 0.5530514789178451,
      "learning_rate": 4.909476653049466e-05,
      "loss": 1.7971,
      "num_input_tokens_seen": 7718959856,
      "step": 9811
    },
    {
      "epoch": 1.0409505622745596,
      "grad_norm": 0.6649299832224578,
      "learning_rate": 4.9094581200791665e-05,
      "loss": 1.7677,
      "num_input_tokens_seen": 7719746592,
      "step": 9812
    },
    {
      "epoch": 1.041056651814131,
      "grad_norm": 0.4355030590507641,
      "learning_rate": 4.909439585246908e-05,
      "loss": 1.7143,
      "num_input_tokens_seen": 7720533376,
      "step": 9813
    },
    {
      "epoch": 1.0411627413537026,
      "grad_norm": 0.6973418551392587,
      "learning_rate": 4.909421048552706e-05,
      "loss": 1.6814,
      "num_input_tokens_seen": 7721320128,
      "step": 9814
    },
    {
      "epoch": 1.0412688308932738,
      "grad_norm": 0.6222160660883191,
      "learning_rate": 4.9094025099965734e-05,
      "loss": 1.8776,
      "num_input_tokens_seen": 7722106944,
      "step": 9815
    },
    {
      "epoch": 1.0413749204328453,
      "grad_norm": 0.613847522603798,
      "learning_rate": 4.909383969578526e-05,
      "loss": 1.789,
      "num_input_tokens_seen": 7722893760,
      "step": 9816
    },
    {
      "epoch": 1.0414810099724168,
      "grad_norm": 0.631558002296199,
      "learning_rate": 4.9093654272985764e-05,
      "loss": 1.8748,
      "num_input_tokens_seen": 7723680624,
      "step": 9817
    },
    {
      "epoch": 1.041587099511988,
      "grad_norm": 0.8445096647512603,
      "learning_rate": 4.9093468831567406e-05,
      "loss": 1.8386,
      "num_input_tokens_seen": 7724467360,
      "step": 9818
    },
    {
      "epoch": 1.0416931890515595,
      "grad_norm": 1.1301223133723342,
      "learning_rate": 4.909328337153032e-05,
      "loss": 1.8009,
      "num_input_tokens_seen": 7725254112,
      "step": 9819
    },
    {
      "epoch": 1.041799278591131,
      "grad_norm": 0.4807655329237451,
      "learning_rate": 4.909309789287465e-05,
      "loss": 1.8614,
      "num_input_tokens_seen": 7726040864,
      "step": 9820
    },
    {
      "epoch": 1.0419053681307022,
      "grad_norm": 1.0029083374365229,
      "learning_rate": 4.909291239560055e-05,
      "loss": 1.8866,
      "num_input_tokens_seen": 7726827552,
      "step": 9821
    },
    {
      "epoch": 1.0420114576702737,
      "grad_norm": 0.8158691687131615,
      "learning_rate": 4.909272687970815e-05,
      "loss": 1.8736,
      "num_input_tokens_seen": 7727614224,
      "step": 9822
    },
    {
      "epoch": 1.0421175472098452,
      "grad_norm": 1.0110902727326692,
      "learning_rate": 4.909254134519759e-05,
      "loss": 1.7137,
      "num_input_tokens_seen": 7728400976,
      "step": 9823
    },
    {
      "epoch": 1.0422236367494164,
      "grad_norm": 1.07324109394087,
      "learning_rate": 4.909235579206903e-05,
      "loss": 1.6955,
      "num_input_tokens_seen": 7729187760,
      "step": 9824
    },
    {
      "epoch": 1.042329726288988,
      "grad_norm": 0.6398162429216122,
      "learning_rate": 4.9092170220322596e-05,
      "loss": 1.7177,
      "num_input_tokens_seen": 7729974560,
      "step": 9825
    },
    {
      "epoch": 1.0424358158285594,
      "grad_norm": 1.2364939249459745,
      "learning_rate": 4.909198462995844e-05,
      "loss": 1.8016,
      "num_input_tokens_seen": 7730761344,
      "step": 9826
    },
    {
      "epoch": 1.0425419053681306,
      "grad_norm": 1.010148987197756,
      "learning_rate": 4.909179902097672e-05,
      "loss": 1.7792,
      "num_input_tokens_seen": 7731548112,
      "step": 9827
    },
    {
      "epoch": 1.042647994907702,
      "grad_norm": 1.034199694535815,
      "learning_rate": 4.909161339337755e-05,
      "loss": 1.8167,
      "num_input_tokens_seen": 7732334864,
      "step": 9828
    },
    {
      "epoch": 1.0427540844472736,
      "grad_norm": 1.4438091748132296,
      "learning_rate": 4.909142774716109e-05,
      "loss": 1.7992,
      "num_input_tokens_seen": 7733121552,
      "step": 9829
    },
    {
      "epoch": 1.0428601739868448,
      "grad_norm": 0.8072858685055683,
      "learning_rate": 4.909124208232748e-05,
      "loss": 1.8192,
      "num_input_tokens_seen": 7733908352,
      "step": 9830
    },
    {
      "epoch": 1.0429662635264163,
      "grad_norm": 0.8093269362489304,
      "learning_rate": 4.9091056398876876e-05,
      "loss": 1.9597,
      "num_input_tokens_seen": 7734695040,
      "step": 9831
    },
    {
      "epoch": 1.0430723530659878,
      "grad_norm": 0.7278534697672807,
      "learning_rate": 4.90908706968094e-05,
      "loss": 1.8039,
      "num_input_tokens_seen": 7735481872,
      "step": 9832
    },
    {
      "epoch": 1.043178442605559,
      "grad_norm": 0.7524568518654494,
      "learning_rate": 4.909068497612521e-05,
      "loss": 1.8852,
      "num_input_tokens_seen": 7736268576,
      "step": 9833
    },
    {
      "epoch": 1.0432845321451305,
      "grad_norm": 1.2365099144079348,
      "learning_rate": 4.9090499236824447e-05,
      "loss": 1.7995,
      "num_input_tokens_seen": 7737055264,
      "step": 9834
    },
    {
      "epoch": 1.043390621684702,
      "grad_norm": 0.5712765860327117,
      "learning_rate": 4.909031347890725e-05,
      "loss": 1.8606,
      "num_input_tokens_seen": 7737842000,
      "step": 9835
    },
    {
      "epoch": 1.0434967112242732,
      "grad_norm": 0.8232841945245112,
      "learning_rate": 4.909012770237377e-05,
      "loss": 1.8059,
      "num_input_tokens_seen": 7738628704,
      "step": 9836
    },
    {
      "epoch": 1.0436028007638447,
      "grad_norm": 0.4234390232350066,
      "learning_rate": 4.9089941907224136e-05,
      "loss": 1.787,
      "num_input_tokens_seen": 7739415520,
      "step": 9837
    },
    {
      "epoch": 1.0437088903034162,
      "grad_norm": 1.01889720217568,
      "learning_rate": 4.9089756093458504e-05,
      "loss": 1.8138,
      "num_input_tokens_seen": 7740202192,
      "step": 9838
    },
    {
      "epoch": 1.0438149798429874,
      "grad_norm": 0.8383458756211675,
      "learning_rate": 4.9089570261077025e-05,
      "loss": 1.8892,
      "num_input_tokens_seen": 7740988960,
      "step": 9839
    },
    {
      "epoch": 1.043921069382559,
      "grad_norm": 0.6829183359656085,
      "learning_rate": 4.908938441007983e-05,
      "loss": 1.6734,
      "num_input_tokens_seen": 7741775776,
      "step": 9840
    },
    {
      "epoch": 1.0440271589221304,
      "grad_norm": 0.6566366492352345,
      "learning_rate": 4.9089198540467064e-05,
      "loss": 1.7054,
      "num_input_tokens_seen": 7742562528,
      "step": 9841
    },
    {
      "epoch": 1.0441332484617016,
      "grad_norm": 0.5918263431796004,
      "learning_rate": 4.9089012652238866e-05,
      "loss": 1.8633,
      "num_input_tokens_seen": 7743349328,
      "step": 9842
    },
    {
      "epoch": 1.044239338001273,
      "grad_norm": 0.6402481838986507,
      "learning_rate": 4.908882674539539e-05,
      "loss": 1.8218,
      "num_input_tokens_seen": 7744136096,
      "step": 9843
    },
    {
      "epoch": 1.0443454275408444,
      "grad_norm": 0.7130946592853655,
      "learning_rate": 4.908864081993678e-05,
      "loss": 1.7816,
      "num_input_tokens_seen": 7744922880,
      "step": 9844
    },
    {
      "epoch": 1.0444515170804158,
      "grad_norm": 0.44019768451613783,
      "learning_rate": 4.9088454875863174e-05,
      "loss": 1.7704,
      "num_input_tokens_seen": 7745709680,
      "step": 9845
    },
    {
      "epoch": 1.0445576066199873,
      "grad_norm": 0.5602443810856222,
      "learning_rate": 4.908826891317471e-05,
      "loss": 1.9159,
      "num_input_tokens_seen": 7746496480,
      "step": 9846
    },
    {
      "epoch": 1.0446636961595586,
      "grad_norm": 0.6882565683481208,
      "learning_rate": 4.908808293187154e-05,
      "loss": 1.9134,
      "num_input_tokens_seen": 7747283232,
      "step": 9847
    },
    {
      "epoch": 1.04476978569913,
      "grad_norm": 0.5315995460709235,
      "learning_rate": 4.908789693195381e-05,
      "loss": 1.8019,
      "num_input_tokens_seen": 7748069984,
      "step": 9848
    },
    {
      "epoch": 1.0448758752387015,
      "grad_norm": 0.6296208468179565,
      "learning_rate": 4.9087710913421663e-05,
      "loss": 1.8131,
      "num_input_tokens_seen": 7748856752,
      "step": 9849
    },
    {
      "epoch": 1.0449819647782728,
      "grad_norm": 0.8035243487724337,
      "learning_rate": 4.9087524876275235e-05,
      "loss": 1.8207,
      "num_input_tokens_seen": 7749643440,
      "step": 9850
    },
    {
      "epoch": 1.0450880543178442,
      "grad_norm": 0.8590761122152837,
      "learning_rate": 4.908733882051468e-05,
      "loss": 1.839,
      "num_input_tokens_seen": 7750430208,
      "step": 9851
    },
    {
      "epoch": 1.0451941438574157,
      "grad_norm": 0.6706950844672525,
      "learning_rate": 4.908715274614013e-05,
      "loss": 1.7052,
      "num_input_tokens_seen": 7751216912,
      "step": 9852
    },
    {
      "epoch": 1.045300233396987,
      "grad_norm": 1.108913578593982,
      "learning_rate": 4.9086966653151734e-05,
      "loss": 1.9182,
      "num_input_tokens_seen": 7752003696,
      "step": 9853
    },
    {
      "epoch": 1.0454063229365584,
      "grad_norm": 0.7210324928362121,
      "learning_rate": 4.9086780541549645e-05,
      "loss": 1.8142,
      "num_input_tokens_seen": 7752790416,
      "step": 9854
    },
    {
      "epoch": 1.04551241247613,
      "grad_norm": 0.6903424824642136,
      "learning_rate": 4.9086594411333994e-05,
      "loss": 1.7927,
      "num_input_tokens_seen": 7753577152,
      "step": 9855
    },
    {
      "epoch": 1.0456185020157012,
      "grad_norm": 1.0067514257411925,
      "learning_rate": 4.908640826250492e-05,
      "loss": 1.8537,
      "num_input_tokens_seen": 7754363888,
      "step": 9856
    },
    {
      "epoch": 1.0457245915552726,
      "grad_norm": 0.6537929479583752,
      "learning_rate": 4.9086222095062594e-05,
      "loss": 1.6455,
      "num_input_tokens_seen": 7755150656,
      "step": 9857
    },
    {
      "epoch": 1.0458306810948441,
      "grad_norm": 0.6818091360403884,
      "learning_rate": 4.9086035909007136e-05,
      "loss": 1.6357,
      "num_input_tokens_seen": 7755937424,
      "step": 9858
    },
    {
      "epoch": 1.0459367706344154,
      "grad_norm": 1.689682329229122,
      "learning_rate": 4.908584970433869e-05,
      "loss": 1.9047,
      "num_input_tokens_seen": 7756724320,
      "step": 9859
    },
    {
      "epoch": 1.0460428601739868,
      "grad_norm": 0.8761859404511857,
      "learning_rate": 4.908566348105741e-05,
      "loss": 1.8618,
      "num_input_tokens_seen": 7757511104,
      "step": 9860
    },
    {
      "epoch": 1.0461489497135583,
      "grad_norm": 1.1847336182380217,
      "learning_rate": 4.908547723916343e-05,
      "loss": 1.7522,
      "num_input_tokens_seen": 7758297952,
      "step": 9861
    },
    {
      "epoch": 1.0462550392531296,
      "grad_norm": 0.9198542485053686,
      "learning_rate": 4.9085290978656916e-05,
      "loss": 1.7201,
      "num_input_tokens_seen": 7759084672,
      "step": 9862
    },
    {
      "epoch": 1.046361128792701,
      "grad_norm": 0.6060966336642865,
      "learning_rate": 4.908510469953799e-05,
      "loss": 1.7669,
      "num_input_tokens_seen": 7759871424,
      "step": 9863
    },
    {
      "epoch": 1.0464672183322725,
      "grad_norm": 0.6772678545881854,
      "learning_rate": 4.908491840180679e-05,
      "loss": 1.8101,
      "num_input_tokens_seen": 7760658160,
      "step": 9864
    },
    {
      "epoch": 1.0465733078718438,
      "grad_norm": 0.5394343781820357,
      "learning_rate": 4.908473208546348e-05,
      "loss": 1.7236,
      "num_input_tokens_seen": 7761445120,
      "step": 9865
    },
    {
      "epoch": 1.0466793974114152,
      "grad_norm": 0.6617128416317869,
      "learning_rate": 4.90845457505082e-05,
      "loss": 1.94,
      "num_input_tokens_seen": 7762231904,
      "step": 9866
    },
    {
      "epoch": 1.0467854869509867,
      "grad_norm": 0.48616171781443157,
      "learning_rate": 4.908435939694108e-05,
      "loss": 1.8199,
      "num_input_tokens_seen": 7763018688,
      "step": 9867
    },
    {
      "epoch": 1.046891576490558,
      "grad_norm": 0.6627622559986467,
      "learning_rate": 4.908417302476228e-05,
      "loss": 1.9511,
      "num_input_tokens_seen": 7763805456,
      "step": 9868
    },
    {
      "epoch": 1.0469976660301294,
      "grad_norm": 0.621038465789662,
      "learning_rate": 4.908398663397194e-05,
      "loss": 1.6889,
      "num_input_tokens_seen": 7764592272,
      "step": 9869
    },
    {
      "epoch": 1.047103755569701,
      "grad_norm": 0.5927145927602748,
      "learning_rate": 4.90838002245702e-05,
      "loss": 1.7738,
      "num_input_tokens_seen": 7765379056,
      "step": 9870
    },
    {
      "epoch": 1.0472098451092722,
      "grad_norm": 0.8897441455472797,
      "learning_rate": 4.9083613796557205e-05,
      "loss": 1.8042,
      "num_input_tokens_seen": 7766165760,
      "step": 9871
    },
    {
      "epoch": 1.0473159346488436,
      "grad_norm": 0.8735317200214203,
      "learning_rate": 4.90834273499331e-05,
      "loss": 1.9072,
      "num_input_tokens_seen": 7766952480,
      "step": 9872
    },
    {
      "epoch": 1.0474220241884151,
      "grad_norm": 0.5455040908267182,
      "learning_rate": 4.908324088469802e-05,
      "loss": 1.7956,
      "num_input_tokens_seen": 7767739280,
      "step": 9873
    },
    {
      "epoch": 1.0475281137279864,
      "grad_norm": 1.0962622181521287,
      "learning_rate": 4.908305440085213e-05,
      "loss": 1.9044,
      "num_input_tokens_seen": 7768525968,
      "step": 9874
    },
    {
      "epoch": 1.0476342032675579,
      "grad_norm": 0.5132383529286528,
      "learning_rate": 4.9082867898395555e-05,
      "loss": 1.8797,
      "num_input_tokens_seen": 7769312704,
      "step": 9875
    },
    {
      "epoch": 1.0477402928071293,
      "grad_norm": 0.5535017342754943,
      "learning_rate": 4.9082681377328456e-05,
      "loss": 1.7451,
      "num_input_tokens_seen": 7770099552,
      "step": 9876
    },
    {
      "epoch": 1.0478463823467006,
      "grad_norm": 0.772794474137139,
      "learning_rate": 4.908249483765096e-05,
      "loss": 1.8454,
      "num_input_tokens_seen": 7770886288,
      "step": 9877
    },
    {
      "epoch": 1.047952471886272,
      "grad_norm": 0.4979416630460959,
      "learning_rate": 4.908230827936322e-05,
      "loss": 1.8372,
      "num_input_tokens_seen": 7771673040,
      "step": 9878
    },
    {
      "epoch": 1.0480585614258433,
      "grad_norm": 0.7244760647148137,
      "learning_rate": 4.9082121702465375e-05,
      "loss": 1.7689,
      "num_input_tokens_seen": 7772459824,
      "step": 9879
    },
    {
      "epoch": 1.0481646509654148,
      "grad_norm": 0.6151541887259071,
      "learning_rate": 4.908193510695758e-05,
      "loss": 1.9297,
      "num_input_tokens_seen": 7773246592,
      "step": 9880
    },
    {
      "epoch": 1.0482707405049863,
      "grad_norm": 0.4779455081138549,
      "learning_rate": 4.908174849283997e-05,
      "loss": 1.8117,
      "num_input_tokens_seen": 7774033360,
      "step": 9881
    },
    {
      "epoch": 1.0483768300445575,
      "grad_norm": 0.4764749848739411,
      "learning_rate": 4.908156186011269e-05,
      "loss": 1.9144,
      "num_input_tokens_seen": 7774820112,
      "step": 9882
    },
    {
      "epoch": 1.048482919584129,
      "grad_norm": 0.5849894486420667,
      "learning_rate": 4.908137520877588e-05,
      "loss": 1.7004,
      "num_input_tokens_seen": 7775606864,
      "step": 9883
    },
    {
      "epoch": 1.0485890091237005,
      "grad_norm": 0.6579994052595537,
      "learning_rate": 4.9081188538829703e-05,
      "loss": 1.7773,
      "num_input_tokens_seen": 7776393648,
      "step": 9884
    },
    {
      "epoch": 1.0486950986632717,
      "grad_norm": 0.5313035525069054,
      "learning_rate": 4.908100185027428e-05,
      "loss": 1.7151,
      "num_input_tokens_seen": 7777180400,
      "step": 9885
    },
    {
      "epoch": 1.0488011882028432,
      "grad_norm": 0.8794553874588387,
      "learning_rate": 4.908081514310977e-05,
      "loss": 1.7684,
      "num_input_tokens_seen": 7777967136,
      "step": 9886
    },
    {
      "epoch": 1.0489072777424147,
      "grad_norm": 0.6890426800944583,
      "learning_rate": 4.908062841733631e-05,
      "loss": 1.9629,
      "num_input_tokens_seen": 7778753872,
      "step": 9887
    },
    {
      "epoch": 1.049013367281986,
      "grad_norm": 0.4469548587737055,
      "learning_rate": 4.908044167295405e-05,
      "loss": 1.8155,
      "num_input_tokens_seen": 7779540592,
      "step": 9888
    },
    {
      "epoch": 1.0491194568215574,
      "grad_norm": 0.46149943562967377,
      "learning_rate": 4.9080254909963124e-05,
      "loss": 1.7518,
      "num_input_tokens_seen": 7780327392,
      "step": 9889
    },
    {
      "epoch": 1.0492255463611289,
      "grad_norm": 0.3951605839918167,
      "learning_rate": 4.9080068128363686e-05,
      "loss": 1.6074,
      "num_input_tokens_seen": 7781114240,
      "step": 9890
    },
    {
      "epoch": 1.0493316359007,
      "grad_norm": 0.5637171854291109,
      "learning_rate": 4.9079881328155884e-05,
      "loss": 1.7893,
      "num_input_tokens_seen": 7781901024,
      "step": 9891
    },
    {
      "epoch": 1.0494377254402716,
      "grad_norm": 0.5062419898371451,
      "learning_rate": 4.907969450933985e-05,
      "loss": 1.8584,
      "num_input_tokens_seen": 7782687856,
      "step": 9892
    },
    {
      "epoch": 1.049543814979843,
      "grad_norm": 0.5547821759592314,
      "learning_rate": 4.907950767191574e-05,
      "loss": 1.8601,
      "num_input_tokens_seen": 7783474672,
      "step": 9893
    },
    {
      "epoch": 1.0496499045194143,
      "grad_norm": 0.6392907125102836,
      "learning_rate": 4.907932081588369e-05,
      "loss": 1.8735,
      "num_input_tokens_seen": 7784261424,
      "step": 9894
    },
    {
      "epoch": 1.0497559940589858,
      "grad_norm": 0.5465892183267168,
      "learning_rate": 4.907913394124385e-05,
      "loss": 1.803,
      "num_input_tokens_seen": 7785048192,
      "step": 9895
    },
    {
      "epoch": 1.0498620835985573,
      "grad_norm": 0.5085164969300786,
      "learning_rate": 4.9078947047996353e-05,
      "loss": 1.7435,
      "num_input_tokens_seen": 7785834992,
      "step": 9896
    },
    {
      "epoch": 1.0499681731381285,
      "grad_norm": 0.608534416265549,
      "learning_rate": 4.907876013614136e-05,
      "loss": 1.8632,
      "num_input_tokens_seen": 7786621680,
      "step": 9897
    },
    {
      "epoch": 1.0500742626777,
      "grad_norm": 0.4095521774308664,
      "learning_rate": 4.907857320567901e-05,
      "loss": 1.8133,
      "num_input_tokens_seen": 7787408368,
      "step": 9898
    },
    {
      "epoch": 1.0501803522172715,
      "grad_norm": 0.5630444131755985,
      "learning_rate": 4.907838625660944e-05,
      "loss": 1.778,
      "num_input_tokens_seen": 7788195088,
      "step": 9899
    },
    {
      "epoch": 1.0502864417568427,
      "grad_norm": 0.38476534568781484,
      "learning_rate": 4.90781992889328e-05,
      "loss": 1.799,
      "num_input_tokens_seen": 7788981904,
      "step": 9900
    },
    {
      "epoch": 1.0503925312964142,
      "grad_norm": 0.606265065126589,
      "learning_rate": 4.9078012302649235e-05,
      "loss": 1.7958,
      "num_input_tokens_seen": 7789768800,
      "step": 9901
    },
    {
      "epoch": 1.0504986208359857,
      "grad_norm": 0.5687132865812234,
      "learning_rate": 4.907782529775889e-05,
      "loss": 1.9687,
      "num_input_tokens_seen": 7790555632,
      "step": 9902
    },
    {
      "epoch": 1.050604710375557,
      "grad_norm": 0.4175944474273723,
      "learning_rate": 4.9077638274261906e-05,
      "loss": 1.8606,
      "num_input_tokens_seen": 7791342480,
      "step": 9903
    },
    {
      "epoch": 1.0507107999151284,
      "grad_norm": 0.8075173113332444,
      "learning_rate": 4.9077451232158434e-05,
      "loss": 1.9075,
      "num_input_tokens_seen": 7792129200,
      "step": 9904
    },
    {
      "epoch": 1.0508168894546999,
      "grad_norm": 0.4161534337835972,
      "learning_rate": 4.90772641714486e-05,
      "loss": 1.6882,
      "num_input_tokens_seen": 7792916032,
      "step": 9905
    },
    {
      "epoch": 1.0509229789942711,
      "grad_norm": 0.7586859186330103,
      "learning_rate": 4.9077077092132575e-05,
      "loss": 1.8658,
      "num_input_tokens_seen": 7793702784,
      "step": 9906
    },
    {
      "epoch": 1.0510290685338426,
      "grad_norm": 0.6230718135788532,
      "learning_rate": 4.907688999421049e-05,
      "loss": 1.7636,
      "num_input_tokens_seen": 7794489600,
      "step": 9907
    },
    {
      "epoch": 1.051135158073414,
      "grad_norm": 0.44387475524931175,
      "learning_rate": 4.90767028776825e-05,
      "loss": 1.6478,
      "num_input_tokens_seen": 7795276384,
      "step": 9908
    },
    {
      "epoch": 1.0512412476129853,
      "grad_norm": 1.2758236911893586,
      "learning_rate": 4.907651574254872e-05,
      "loss": 1.7701,
      "num_input_tokens_seen": 7796063280,
      "step": 9909
    },
    {
      "epoch": 1.0513473371525568,
      "grad_norm": 0.5814501946147012,
      "learning_rate": 4.907632858880933e-05,
      "loss": 1.7777,
      "num_input_tokens_seen": 7796850064,
      "step": 9910
    },
    {
      "epoch": 1.0514534266921283,
      "grad_norm": 0.5085418123409913,
      "learning_rate": 4.907614141646446e-05,
      "loss": 1.8135,
      "num_input_tokens_seen": 7797636864,
      "step": 9911
    },
    {
      "epoch": 1.0515595162316995,
      "grad_norm": 0.7413697311289639,
      "learning_rate": 4.9075954225514245e-05,
      "loss": 1.6946,
      "num_input_tokens_seen": 7798423664,
      "step": 9912
    },
    {
      "epoch": 1.051665605771271,
      "grad_norm": 0.5798394363924603,
      "learning_rate": 4.9075767015958844e-05,
      "loss": 1.821,
      "num_input_tokens_seen": 7799210448,
      "step": 9913
    },
    {
      "epoch": 1.0517716953108422,
      "grad_norm": 0.6698725862013616,
      "learning_rate": 4.90755797877984e-05,
      "loss": 1.8058,
      "num_input_tokens_seen": 7799997200,
      "step": 9914
    },
    {
      "epoch": 1.0518777848504137,
      "grad_norm": 0.49833450818484937,
      "learning_rate": 4.907539254103305e-05,
      "loss": 1.7891,
      "num_input_tokens_seen": 7800783984,
      "step": 9915
    },
    {
      "epoch": 1.0519838743899852,
      "grad_norm": 0.5444845808433527,
      "learning_rate": 4.9075205275662943e-05,
      "loss": 1.7854,
      "num_input_tokens_seen": 7801570768,
      "step": 9916
    },
    {
      "epoch": 1.0520899639295564,
      "grad_norm": 0.4869142718923007,
      "learning_rate": 4.9075017991688224e-05,
      "loss": 1.9164,
      "num_input_tokens_seen": 7802357456,
      "step": 9917
    },
    {
      "epoch": 1.052196053469128,
      "grad_norm": 0.4306595507580781,
      "learning_rate": 4.907483068910904e-05,
      "loss": 1.7702,
      "num_input_tokens_seen": 7803144240,
      "step": 9918
    },
    {
      "epoch": 1.0523021430086994,
      "grad_norm": 0.6346039660397986,
      "learning_rate": 4.9074643367925536e-05,
      "loss": 1.7852,
      "num_input_tokens_seen": 7803930960,
      "step": 9919
    },
    {
      "epoch": 1.0524082325482707,
      "grad_norm": 0.45610715585074796,
      "learning_rate": 4.907445602813785e-05,
      "loss": 1.7915,
      "num_input_tokens_seen": 7804717712,
      "step": 9920
    },
    {
      "epoch": 1.0525143220878421,
      "grad_norm": 0.5780296095013332,
      "learning_rate": 4.9074268669746124e-05,
      "loss": 1.7415,
      "num_input_tokens_seen": 7805504400,
      "step": 9921
    },
    {
      "epoch": 1.0526204116274136,
      "grad_norm": 0.3913600989608183,
      "learning_rate": 4.907408129275052e-05,
      "loss": 1.8665,
      "num_input_tokens_seen": 7806291136,
      "step": 9922
    },
    {
      "epoch": 1.0527265011669849,
      "grad_norm": 0.47025053829554075,
      "learning_rate": 4.907389389715117e-05,
      "loss": 1.7883,
      "num_input_tokens_seen": 7807077920,
      "step": 9923
    },
    {
      "epoch": 1.0528325907065563,
      "grad_norm": 0.41035607504489835,
      "learning_rate": 4.9073706482948216e-05,
      "loss": 1.7561,
      "num_input_tokens_seen": 7807864688,
      "step": 9924
    },
    {
      "epoch": 1.0529386802461278,
      "grad_norm": 0.4705442096360625,
      "learning_rate": 4.907351905014181e-05,
      "loss": 1.7153,
      "num_input_tokens_seen": 7808651392,
      "step": 9925
    },
    {
      "epoch": 1.053044769785699,
      "grad_norm": 0.4081796080157867,
      "learning_rate": 4.90733315987321e-05,
      "loss": 1.6348,
      "num_input_tokens_seen": 7809438208,
      "step": 9926
    },
    {
      "epoch": 1.0531508593252705,
      "grad_norm": 0.4521135374634955,
      "learning_rate": 4.9073144128719216e-05,
      "loss": 1.811,
      "num_input_tokens_seen": 7810224928,
      "step": 9927
    },
    {
      "epoch": 1.053256948864842,
      "grad_norm": 0.492482541732968,
      "learning_rate": 4.907295664010332e-05,
      "loss": 1.6443,
      "num_input_tokens_seen": 7811011728,
      "step": 9928
    },
    {
      "epoch": 1.0533630384044133,
      "grad_norm": 0.4460577785650379,
      "learning_rate": 4.907276913288455e-05,
      "loss": 1.8183,
      "num_input_tokens_seen": 7811798496,
      "step": 9929
    },
    {
      "epoch": 1.0534691279439847,
      "grad_norm": 0.4115042882619445,
      "learning_rate": 4.907258160706305e-05,
      "loss": 1.8037,
      "num_input_tokens_seen": 7812585280,
      "step": 9930
    },
    {
      "epoch": 1.0535752174835562,
      "grad_norm": 0.4126863242888721,
      "learning_rate": 4.907239406263896e-05,
      "loss": 1.9121,
      "num_input_tokens_seen": 7813372096,
      "step": 9931
    },
    {
      "epoch": 1.0536813070231275,
      "grad_norm": 0.4617789571879378,
      "learning_rate": 4.907220649961244e-05,
      "loss": 1.8119,
      "num_input_tokens_seen": 7814158832,
      "step": 9932
    },
    {
      "epoch": 1.053787396562699,
      "grad_norm": 0.40327834636775745,
      "learning_rate": 4.9072018917983615e-05,
      "loss": 1.7525,
      "num_input_tokens_seen": 7814945600,
      "step": 9933
    },
    {
      "epoch": 1.0538934861022704,
      "grad_norm": 0.42515371810817537,
      "learning_rate": 4.9071831317752645e-05,
      "loss": 1.7848,
      "num_input_tokens_seen": 7815732416,
      "step": 9934
    },
    {
      "epoch": 1.0539995756418417,
      "grad_norm": 0.41513357106561244,
      "learning_rate": 4.9071643698919665e-05,
      "loss": 1.7278,
      "num_input_tokens_seen": 7816519296,
      "step": 9935
    },
    {
      "epoch": 1.0541056651814131,
      "grad_norm": 0.45338145852951917,
      "learning_rate": 4.907145606148483e-05,
      "loss": 1.7544,
      "num_input_tokens_seen": 7817306064,
      "step": 9936
    },
    {
      "epoch": 1.0542117547209846,
      "grad_norm": 0.4450233644370572,
      "learning_rate": 4.9071268405448276e-05,
      "loss": 1.771,
      "num_input_tokens_seen": 7818092880,
      "step": 9937
    },
    {
      "epoch": 1.0543178442605559,
      "grad_norm": 0.5253025638050404,
      "learning_rate": 4.907108073081016e-05,
      "loss": 1.9639,
      "num_input_tokens_seen": 7818879680,
      "step": 9938
    },
    {
      "epoch": 1.0544239338001273,
      "grad_norm": 0.36885988890851346,
      "learning_rate": 4.907089303757062e-05,
      "loss": 1.7622,
      "num_input_tokens_seen": 7819666432,
      "step": 9939
    },
    {
      "epoch": 1.0545300233396988,
      "grad_norm": 0.4507802805086179,
      "learning_rate": 4.907070532572979e-05,
      "loss": 1.7314,
      "num_input_tokens_seen": 7820453248,
      "step": 9940
    },
    {
      "epoch": 1.05463611287927,
      "grad_norm": 0.3542660893408082,
      "learning_rate": 4.907051759528783e-05,
      "loss": 1.7218,
      "num_input_tokens_seen": 7821240032,
      "step": 9941
    },
    {
      "epoch": 1.0547422024188415,
      "grad_norm": 0.40994617646413434,
      "learning_rate": 4.907032984624488e-05,
      "loss": 1.9118,
      "num_input_tokens_seen": 7822026752,
      "step": 9942
    },
    {
      "epoch": 1.0548482919584128,
      "grad_norm": 0.43913721931429317,
      "learning_rate": 4.907014207860109e-05,
      "loss": 1.8078,
      "num_input_tokens_seen": 7822813440,
      "step": 9943
    },
    {
      "epoch": 1.0549543814979843,
      "grad_norm": 0.4446326519378509,
      "learning_rate": 4.906995429235659e-05,
      "loss": 1.7845,
      "num_input_tokens_seen": 7823600240,
      "step": 9944
    },
    {
      "epoch": 1.0550604710375557,
      "grad_norm": 0.37641696025805765,
      "learning_rate": 4.9069766487511543e-05,
      "loss": 1.7541,
      "num_input_tokens_seen": 7824387136,
      "step": 9945
    },
    {
      "epoch": 1.055166560577127,
      "grad_norm": 0.6243859933875026,
      "learning_rate": 4.906957866406609e-05,
      "loss": 1.9147,
      "num_input_tokens_seen": 7825173904,
      "step": 9946
    },
    {
      "epoch": 1.0552726501166985,
      "grad_norm": 0.5113981975554103,
      "learning_rate": 4.906939082202037e-05,
      "loss": 1.7658,
      "num_input_tokens_seen": 7825960592,
      "step": 9947
    },
    {
      "epoch": 1.05537873965627,
      "grad_norm": 0.5370498857440543,
      "learning_rate": 4.906920296137452e-05,
      "loss": 1.8668,
      "num_input_tokens_seen": 7826747296,
      "step": 9948
    },
    {
      "epoch": 1.0554848291958412,
      "grad_norm": 0.4038326499610585,
      "learning_rate": 4.906901508212871e-05,
      "loss": 1.9004,
      "num_input_tokens_seen": 7827534080,
      "step": 9949
    },
    {
      "epoch": 1.0555909187354127,
      "grad_norm": 0.6036170861081742,
      "learning_rate": 4.9068827184283064e-05,
      "loss": 1.7388,
      "num_input_tokens_seen": 7828320768,
      "step": 9950
    },
    {
      "epoch": 1.0556970082749841,
      "grad_norm": 0.4064644200844283,
      "learning_rate": 4.906863926783773e-05,
      "loss": 1.7833,
      "num_input_tokens_seen": 7829107648,
      "step": 9951
    },
    {
      "epoch": 1.0558030978145554,
      "grad_norm": 0.4277698099838935,
      "learning_rate": 4.9068451332792874e-05,
      "loss": 1.7774,
      "num_input_tokens_seen": 7829894480,
      "step": 9952
    },
    {
      "epoch": 1.0559091873541269,
      "grad_norm": 0.3891809468987717,
      "learning_rate": 4.9068263379148615e-05,
      "loss": 1.8525,
      "num_input_tokens_seen": 7830681312,
      "step": 9953
    },
    {
      "epoch": 1.0560152768936983,
      "grad_norm": 0.47483287538392255,
      "learning_rate": 4.906807540690511e-05,
      "loss": 1.7319,
      "num_input_tokens_seen": 7831468144,
      "step": 9954
    },
    {
      "epoch": 1.0561213664332696,
      "grad_norm": 0.4463524449480019,
      "learning_rate": 4.90678874160625e-05,
      "loss": 1.8409,
      "num_input_tokens_seen": 7832254752,
      "step": 9955
    },
    {
      "epoch": 1.056227455972841,
      "grad_norm": 0.4158342202636391,
      "learning_rate": 4.906769940662094e-05,
      "loss": 1.6889,
      "num_input_tokens_seen": 7833041488,
      "step": 9956
    },
    {
      "epoch": 1.0563335455124125,
      "grad_norm": 0.47044312771395985,
      "learning_rate": 4.906751137858056e-05,
      "loss": 1.6325,
      "num_input_tokens_seen": 7833828320,
      "step": 9957
    },
    {
      "epoch": 1.0564396350519838,
      "grad_norm": 0.3679497483032472,
      "learning_rate": 4.906732333194152e-05,
      "loss": 1.7708,
      "num_input_tokens_seen": 7834615072,
      "step": 9958
    },
    {
      "epoch": 1.0565457245915553,
      "grad_norm": 0.4778288214420284,
      "learning_rate": 4.906713526670395e-05,
      "loss": 1.687,
      "num_input_tokens_seen": 7835401856,
      "step": 9959
    },
    {
      "epoch": 1.0566518141311267,
      "grad_norm": 0.447455722283203,
      "learning_rate": 4.906694718286801e-05,
      "loss": 1.6877,
      "num_input_tokens_seen": 7836188656,
      "step": 9960
    },
    {
      "epoch": 1.056757903670698,
      "grad_norm": 0.4649994463345011,
      "learning_rate": 4.906675908043383e-05,
      "loss": 1.8029,
      "num_input_tokens_seen": 7836975360,
      "step": 9961
    },
    {
      "epoch": 1.0568639932102695,
      "grad_norm": 0.5432981869313853,
      "learning_rate": 4.906657095940158e-05,
      "loss": 1.8077,
      "num_input_tokens_seen": 7837762144,
      "step": 9962
    },
    {
      "epoch": 1.056970082749841,
      "grad_norm": 0.4891823997018055,
      "learning_rate": 4.906638281977138e-05,
      "loss": 1.8629,
      "num_input_tokens_seen": 7838548912,
      "step": 9963
    },
    {
      "epoch": 1.0570761722894122,
      "grad_norm": 0.5081715741956161,
      "learning_rate": 4.906619466154339e-05,
      "loss": 1.8811,
      "num_input_tokens_seen": 7839335664,
      "step": 9964
    },
    {
      "epoch": 1.0571822618289837,
      "grad_norm": 0.44244396489879345,
      "learning_rate": 4.906600648471775e-05,
      "loss": 1.7751,
      "num_input_tokens_seen": 7840122400,
      "step": 9965
    },
    {
      "epoch": 1.0572883513685551,
      "grad_norm": 0.515374793424833,
      "learning_rate": 4.9065818289294606e-05,
      "loss": 1.8743,
      "num_input_tokens_seen": 7840909184,
      "step": 9966
    },
    {
      "epoch": 1.0573944409081264,
      "grad_norm": 0.4220427562178806,
      "learning_rate": 4.9065630075274106e-05,
      "loss": 1.9347,
      "num_input_tokens_seen": 7841695920,
      "step": 9967
    },
    {
      "epoch": 1.0575005304476979,
      "grad_norm": 0.3993391331080192,
      "learning_rate": 4.906544184265639e-05,
      "loss": 1.7727,
      "num_input_tokens_seen": 7842482672,
      "step": 9968
    },
    {
      "epoch": 1.0576066199872693,
      "grad_norm": 0.3778773511708537,
      "learning_rate": 4.9065253591441607e-05,
      "loss": 1.5509,
      "num_input_tokens_seen": 7843269536,
      "step": 9969
    },
    {
      "epoch": 1.0577127095268406,
      "grad_norm": 0.45117749046032335,
      "learning_rate": 4.90650653216299e-05,
      "loss": 1.9748,
      "num_input_tokens_seen": 7844056272,
      "step": 9970
    },
    {
      "epoch": 1.057818799066412,
      "grad_norm": 0.5220886800208625,
      "learning_rate": 4.906487703322142e-05,
      "loss": 1.8676,
      "num_input_tokens_seen": 7844842976,
      "step": 9971
    },
    {
      "epoch": 1.0579248886059835,
      "grad_norm": 0.53857247495926,
      "learning_rate": 4.9064688726216306e-05,
      "loss": 1.8852,
      "num_input_tokens_seen": 7845629808,
      "step": 9972
    },
    {
      "epoch": 1.0580309781455548,
      "grad_norm": 0.45031176951855556,
      "learning_rate": 4.906450040061471e-05,
      "loss": 1.7855,
      "num_input_tokens_seen": 7846416688,
      "step": 9973
    },
    {
      "epoch": 1.0581370676851263,
      "grad_norm": 0.4580332894014379,
      "learning_rate": 4.9064312056416775e-05,
      "loss": 1.7779,
      "num_input_tokens_seen": 7847203392,
      "step": 9974
    },
    {
      "epoch": 1.0582431572246978,
      "grad_norm": 0.41739809720347165,
      "learning_rate": 4.906412369362264e-05,
      "loss": 1.9041,
      "num_input_tokens_seen": 7847990064,
      "step": 9975
    },
    {
      "epoch": 1.058349246764269,
      "grad_norm": 0.43539272497769727,
      "learning_rate": 4.9063935312232464e-05,
      "loss": 1.8502,
      "num_input_tokens_seen": 7848776832,
      "step": 9976
    },
    {
      "epoch": 1.0584553363038405,
      "grad_norm": 0.39940583093238097,
      "learning_rate": 4.9063746912246375e-05,
      "loss": 1.7345,
      "num_input_tokens_seen": 7849563584,
      "step": 9977
    },
    {
      "epoch": 1.0585614258434117,
      "grad_norm": 0.4061626811864166,
      "learning_rate": 4.906355849366454e-05,
      "loss": 1.9459,
      "num_input_tokens_seen": 7850350288,
      "step": 9978
    },
    {
      "epoch": 1.0586675153829832,
      "grad_norm": 0.39797017802035034,
      "learning_rate": 4.906337005648709e-05,
      "loss": 1.8147,
      "num_input_tokens_seen": 7851137008,
      "step": 9979
    },
    {
      "epoch": 1.0587736049225547,
      "grad_norm": 0.4167874740589869,
      "learning_rate": 4.906318160071417e-05,
      "loss": 1.8486,
      "num_input_tokens_seen": 7851923680,
      "step": 9980
    },
    {
      "epoch": 1.058879694462126,
      "grad_norm": 0.39376880301480954,
      "learning_rate": 4.906299312634592e-05,
      "loss": 1.8605,
      "num_input_tokens_seen": 7852710464,
      "step": 9981
    },
    {
      "epoch": 1.0589857840016974,
      "grad_norm": 0.45858500196098023,
      "learning_rate": 4.906280463338251e-05,
      "loss": 1.871,
      "num_input_tokens_seen": 7853497264,
      "step": 9982
    },
    {
      "epoch": 1.0590918735412689,
      "grad_norm": 0.34774838808854963,
      "learning_rate": 4.906261612182407e-05,
      "loss": 1.7224,
      "num_input_tokens_seen": 7854284128,
      "step": 9983
    },
    {
      "epoch": 1.0591979630808401,
      "grad_norm": 0.48757733080889915,
      "learning_rate": 4.906242759167074e-05,
      "loss": 1.9637,
      "num_input_tokens_seen": 7855070896,
      "step": 9984
    },
    {
      "epoch": 1.0593040526204116,
      "grad_norm": 0.41854444088809056,
      "learning_rate": 4.9062239042922676e-05,
      "loss": 1.7989,
      "num_input_tokens_seen": 7855857648,
      "step": 9985
    },
    {
      "epoch": 1.059410142159983,
      "grad_norm": 0.3959446762222978,
      "learning_rate": 4.906205047558002e-05,
      "loss": 1.7696,
      "num_input_tokens_seen": 7856644352,
      "step": 9986
    },
    {
      "epoch": 1.0595162316995543,
      "grad_norm": 0.42688090105092236,
      "learning_rate": 4.906186188964291e-05,
      "loss": 1.9171,
      "num_input_tokens_seen": 7857430976,
      "step": 9987
    },
    {
      "epoch": 1.0596223212391258,
      "grad_norm": 0.49098208717208164,
      "learning_rate": 4.906167328511151e-05,
      "loss": 2.0058,
      "num_input_tokens_seen": 7858217712,
      "step": 9988
    },
    {
      "epoch": 1.0597284107786973,
      "grad_norm": 0.571885608903697,
      "learning_rate": 4.906148466198594e-05,
      "loss": 1.8911,
      "num_input_tokens_seen": 7859004480,
      "step": 9989
    },
    {
      "epoch": 1.0598345003182685,
      "grad_norm": 0.42408036357762496,
      "learning_rate": 4.906129602026638e-05,
      "loss": 1.7641,
      "num_input_tokens_seen": 7859791328,
      "step": 9990
    },
    {
      "epoch": 1.05994058985784,
      "grad_norm": 0.405167913139619,
      "learning_rate": 4.906110735995295e-05,
      "loss": 1.7404,
      "num_input_tokens_seen": 7860578112,
      "step": 9991
    },
    {
      "epoch": 1.0600466793974115,
      "grad_norm": 0.4787660078652364,
      "learning_rate": 4.9060918681045795e-05,
      "loss": 1.7511,
      "num_input_tokens_seen": 7861364928,
      "step": 9992
    },
    {
      "epoch": 1.0601527689369827,
      "grad_norm": 0.46221740469401634,
      "learning_rate": 4.9060729983545075e-05,
      "loss": 1.7976,
      "num_input_tokens_seen": 7862151680,
      "step": 9993
    },
    {
      "epoch": 1.0602588584765542,
      "grad_norm": 0.4580127683604317,
      "learning_rate": 4.906054126745092e-05,
      "loss": 1.7943,
      "num_input_tokens_seen": 7862938432,
      "step": 9994
    },
    {
      "epoch": 1.0603649480161257,
      "grad_norm": 0.36979864977063803,
      "learning_rate": 4.9060352532763494e-05,
      "loss": 1.8661,
      "num_input_tokens_seen": 7863725200,
      "step": 9995
    },
    {
      "epoch": 1.060471037555697,
      "grad_norm": 0.6681428787394819,
      "learning_rate": 4.9060163779482924e-05,
      "loss": 1.9189,
      "num_input_tokens_seen": 7864511904,
      "step": 9996
    },
    {
      "epoch": 1.0605771270952684,
      "grad_norm": 0.3924292482036144,
      "learning_rate": 4.905997500760938e-05,
      "loss": 1.8207,
      "num_input_tokens_seen": 7865298624,
      "step": 9997
    },
    {
      "epoch": 1.0606832166348399,
      "grad_norm": 0.5907840041109791,
      "learning_rate": 4.905978621714298e-05,
      "loss": 1.7995,
      "num_input_tokens_seen": 7866085424,
      "step": 9998
    },
    {
      "epoch": 1.0607893061744111,
      "grad_norm": 0.42674396582885454,
      "learning_rate": 4.905959740808389e-05,
      "loss": 1.7941,
      "num_input_tokens_seen": 7866872176,
      "step": 9999
    },
    {
      "epoch": 1.0608953957139826,
      "grad_norm": 0.3743549267513656,
      "learning_rate": 4.905940858043224e-05,
      "loss": 1.7132,
      "num_input_tokens_seen": 7867658944,
      "step": 10000
    },
    {
      "epoch": 1.0608953957139826,
      "eval_loss": 1.8426023721694946,
      "eval_runtime": 64.0958,
      "eval_samples_per_second": 46.805,
      "eval_steps_per_second": 0.499,
      "num_input_tokens_seen": 7867658944,
      "step": 10000
    },
    {
      "epoch": 1.061001485253554,
      "grad_norm": 0.5711362555242465,
      "learning_rate": 4.90592197341882e-05,
      "loss": 1.7915,
      "num_input_tokens_seen": 7868445648,
      "step": 10001
    },
    {
      "epoch": 1.0611075747931253,
      "grad_norm": 0.4114288671430972,
      "learning_rate": 4.9059030869351894e-05,
      "loss": 1.855,
      "num_input_tokens_seen": 7869232368,
      "step": 10002
    },
    {
      "epoch": 1.0612136643326968,
      "grad_norm": 0.6218531901751009,
      "learning_rate": 4.905884198592347e-05,
      "loss": 1.9672,
      "num_input_tokens_seen": 7870019152,
      "step": 10003
    },
    {
      "epoch": 1.0613197538722683,
      "grad_norm": 0.3928271959416784,
      "learning_rate": 4.905865308390308e-05,
      "loss": 1.8979,
      "num_input_tokens_seen": 7870805984,
      "step": 10004
    },
    {
      "epoch": 1.0614258434118395,
      "grad_norm": 0.46693701042985153,
      "learning_rate": 4.9058464163290876e-05,
      "loss": 1.7649,
      "num_input_tokens_seen": 7871592768,
      "step": 10005
    },
    {
      "epoch": 1.061531932951411,
      "grad_norm": 0.5718264955973216,
      "learning_rate": 4.9058275224086994e-05,
      "loss": 1.9091,
      "num_input_tokens_seen": 7872379552,
      "step": 10006
    },
    {
      "epoch": 1.0616380224909825,
      "grad_norm": 0.6000961921033243,
      "learning_rate": 4.905808626629158e-05,
      "loss": 1.9099,
      "num_input_tokens_seen": 7873166208,
      "step": 10007
    },
    {
      "epoch": 1.0617441120305537,
      "grad_norm": 0.45296629114440295,
      "learning_rate": 4.905789728990478e-05,
      "loss": 1.905,
      "num_input_tokens_seen": 7873953040,
      "step": 10008
    },
    {
      "epoch": 1.0618502015701252,
      "grad_norm": 0.37571253680200345,
      "learning_rate": 4.905770829492675e-05,
      "loss": 1.7135,
      "num_input_tokens_seen": 7874739808,
      "step": 10009
    },
    {
      "epoch": 1.0619562911096967,
      "grad_norm": 0.4804221132583969,
      "learning_rate": 4.905751928135762e-05,
      "loss": 1.8362,
      "num_input_tokens_seen": 7875526640,
      "step": 10010
    },
    {
      "epoch": 1.062062380649268,
      "grad_norm": 0.37889156435086496,
      "learning_rate": 4.905733024919755e-05,
      "loss": 1.763,
      "num_input_tokens_seen": 7876313376,
      "step": 10011
    },
    {
      "epoch": 1.0621684701888394,
      "grad_norm": 0.6040788404247086,
      "learning_rate": 4.905714119844669e-05,
      "loss": 1.9586,
      "num_input_tokens_seen": 7877100032,
      "step": 10012
    },
    {
      "epoch": 1.0622745597284107,
      "grad_norm": 0.4103491644789653,
      "learning_rate": 4.9056952129105165e-05,
      "loss": 1.7722,
      "num_input_tokens_seen": 7877886736,
      "step": 10013
    },
    {
      "epoch": 1.0623806492679821,
      "grad_norm": 0.5811463201173157,
      "learning_rate": 4.905676304117314e-05,
      "loss": 1.8314,
      "num_input_tokens_seen": 7878673424,
      "step": 10014
    },
    {
      "epoch": 1.0624867388075536,
      "grad_norm": 0.4905503509444016,
      "learning_rate": 4.9056573934650754e-05,
      "loss": 1.7944,
      "num_input_tokens_seen": 7879460240,
      "step": 10015
    },
    {
      "epoch": 1.0625928283471249,
      "grad_norm": 0.49792078782896865,
      "learning_rate": 4.905638480953815e-05,
      "loss": 1.927,
      "num_input_tokens_seen": 7880247024,
      "step": 10016
    },
    {
      "epoch": 1.0626989178866963,
      "grad_norm": 0.5227769084809637,
      "learning_rate": 4.9056195665835476e-05,
      "loss": 1.8551,
      "num_input_tokens_seen": 7881033792,
      "step": 10017
    },
    {
      "epoch": 1.0628050074262678,
      "grad_norm": 0.3715751891139862,
      "learning_rate": 4.905600650354288e-05,
      "loss": 1.8809,
      "num_input_tokens_seen": 7881820592,
      "step": 10018
    },
    {
      "epoch": 1.062911096965839,
      "grad_norm": 0.5546417917483967,
      "learning_rate": 4.905581732266051e-05,
      "loss": 1.7334,
      "num_input_tokens_seen": 7882607360,
      "step": 10019
    },
    {
      "epoch": 1.0630171865054105,
      "grad_norm": 0.46627610196361247,
      "learning_rate": 4.9055628123188516e-05,
      "loss": 1.7387,
      "num_input_tokens_seen": 7883394176,
      "step": 10020
    },
    {
      "epoch": 1.063123276044982,
      "grad_norm": 0.4120601770840979,
      "learning_rate": 4.905543890512703e-05,
      "loss": 1.7878,
      "num_input_tokens_seen": 7884181024,
      "step": 10021
    },
    {
      "epoch": 1.0632293655845533,
      "grad_norm": 0.41620380650161903,
      "learning_rate": 4.905524966847621e-05,
      "loss": 1.9925,
      "num_input_tokens_seen": 7884967712,
      "step": 10022
    },
    {
      "epoch": 1.0633354551241248,
      "grad_norm": 0.5405263069071942,
      "learning_rate": 4.90550604132362e-05,
      "loss": 1.7403,
      "num_input_tokens_seen": 7885754544,
      "step": 10023
    },
    {
      "epoch": 1.0634415446636962,
      "grad_norm": 0.38782146544085516,
      "learning_rate": 4.9054871139407147e-05,
      "loss": 1.8768,
      "num_input_tokens_seen": 7886541312,
      "step": 10024
    },
    {
      "epoch": 1.0635476342032675,
      "grad_norm": 0.4061949994500101,
      "learning_rate": 4.9054681846989184e-05,
      "loss": 1.791,
      "num_input_tokens_seen": 7887328064,
      "step": 10025
    },
    {
      "epoch": 1.063653723742839,
      "grad_norm": 0.4412335227317193,
      "learning_rate": 4.905449253598248e-05,
      "loss": 1.7779,
      "num_input_tokens_seen": 7888114816,
      "step": 10026
    },
    {
      "epoch": 1.0637598132824104,
      "grad_norm": 0.3889596016252739,
      "learning_rate": 4.9054303206387164e-05,
      "loss": 1.7192,
      "num_input_tokens_seen": 7888901520,
      "step": 10027
    },
    {
      "epoch": 1.0638659028219817,
      "grad_norm": 0.4524919863945976,
      "learning_rate": 4.905411385820339e-05,
      "loss": 1.6971,
      "num_input_tokens_seen": 7889688384,
      "step": 10028
    },
    {
      "epoch": 1.0639719923615532,
      "grad_norm": 0.4058711177386475,
      "learning_rate": 4.9053924491431305e-05,
      "loss": 1.7819,
      "num_input_tokens_seen": 7890475168,
      "step": 10029
    },
    {
      "epoch": 1.0640780819011246,
      "grad_norm": 0.47398881366598783,
      "learning_rate": 4.905373510607105e-05,
      "loss": 1.7539,
      "num_input_tokens_seen": 7891262048,
      "step": 10030
    },
    {
      "epoch": 1.0641841714406959,
      "grad_norm": 0.44932567599677525,
      "learning_rate": 4.9053545702122785e-05,
      "loss": 1.8908,
      "num_input_tokens_seen": 7892048832,
      "step": 10031
    },
    {
      "epoch": 1.0642902609802674,
      "grad_norm": 0.3841249476555414,
      "learning_rate": 4.905335627958663e-05,
      "loss": 1.7396,
      "num_input_tokens_seen": 7892835648,
      "step": 10032
    },
    {
      "epoch": 1.0643963505198388,
      "grad_norm": 0.38695786916884767,
      "learning_rate": 4.9053166838462756e-05,
      "loss": 1.8537,
      "num_input_tokens_seen": 7893622464,
      "step": 10033
    },
    {
      "epoch": 1.06450244005941,
      "grad_norm": 0.47456645208885406,
      "learning_rate": 4.9052977378751294e-05,
      "loss": 1.9195,
      "num_input_tokens_seen": 7894409200,
      "step": 10034
    },
    {
      "epoch": 1.0646085295989816,
      "grad_norm": 0.4568701842098695,
      "learning_rate": 4.9052787900452405e-05,
      "loss": 1.8807,
      "num_input_tokens_seen": 7895196016,
      "step": 10035
    },
    {
      "epoch": 1.064714619138553,
      "grad_norm": 0.5670373983735315,
      "learning_rate": 4.9052598403566225e-05,
      "loss": 1.8616,
      "num_input_tokens_seen": 7895982752,
      "step": 10036
    },
    {
      "epoch": 1.0648207086781243,
      "grad_norm": 0.39734393906288956,
      "learning_rate": 4.9052408888092897e-05,
      "loss": 1.7458,
      "num_input_tokens_seen": 7896769648,
      "step": 10037
    },
    {
      "epoch": 1.0649267982176958,
      "grad_norm": 0.6633812689226001,
      "learning_rate": 4.905221935403258e-05,
      "loss": 2.1021,
      "num_input_tokens_seen": 7897556352,
      "step": 10038
    },
    {
      "epoch": 1.0650328877572672,
      "grad_norm": 0.3925901021359744,
      "learning_rate": 4.905202980138541e-05,
      "loss": 1.9522,
      "num_input_tokens_seen": 7898343152,
      "step": 10039
    },
    {
      "epoch": 1.0651389772968385,
      "grad_norm": 0.52697641660077,
      "learning_rate": 4.9051840230151537e-05,
      "loss": 1.7632,
      "num_input_tokens_seen": 7899129904,
      "step": 10040
    },
    {
      "epoch": 1.06524506683641,
      "grad_norm": 0.35571273649886775,
      "learning_rate": 4.905165064033111e-05,
      "loss": 1.7722,
      "num_input_tokens_seen": 7899916688,
      "step": 10041
    },
    {
      "epoch": 1.0653511563759812,
      "grad_norm": 0.4689111076323623,
      "learning_rate": 4.9051461031924275e-05,
      "loss": 1.9488,
      "num_input_tokens_seen": 7900703376,
      "step": 10042
    },
    {
      "epoch": 1.0654572459155527,
      "grad_norm": 0.42198155351069283,
      "learning_rate": 4.905127140493117e-05,
      "loss": 1.8214,
      "num_input_tokens_seen": 7901490144,
      "step": 10043
    },
    {
      "epoch": 1.0655633354551242,
      "grad_norm": 0.39972640678832966,
      "learning_rate": 4.905108175935195e-05,
      "loss": 1.7904,
      "num_input_tokens_seen": 7902276864,
      "step": 10044
    },
    {
      "epoch": 1.0656694249946956,
      "grad_norm": 0.40893405494924695,
      "learning_rate": 4.9050892095186764e-05,
      "loss": 1.8462,
      "num_input_tokens_seen": 7903063680,
      "step": 10045
    },
    {
      "epoch": 1.0657755145342669,
      "grad_norm": 0.4219462883192394,
      "learning_rate": 4.9050702412435744e-05,
      "loss": 1.7141,
      "num_input_tokens_seen": 7903850464,
      "step": 10046
    },
    {
      "epoch": 1.0658816040738384,
      "grad_norm": 0.5037877773478981,
      "learning_rate": 4.905051271109906e-05,
      "loss": 1.9445,
      "num_input_tokens_seen": 7904637184,
      "step": 10047
    },
    {
      "epoch": 1.0659876936134096,
      "grad_norm": 0.38828218128591185,
      "learning_rate": 4.905032299117684e-05,
      "loss": 1.8355,
      "num_input_tokens_seen": 7905424000,
      "step": 10048
    },
    {
      "epoch": 1.066093783152981,
      "grad_norm": 0.5008100965807822,
      "learning_rate": 4.9050133252669234e-05,
      "loss": 1.8812,
      "num_input_tokens_seen": 7906210736,
      "step": 10049
    },
    {
      "epoch": 1.0661998726925526,
      "grad_norm": 0.5743027858051044,
      "learning_rate": 4.904994349557639e-05,
      "loss": 2.0034,
      "num_input_tokens_seen": 7906997568,
      "step": 10050
    },
    {
      "epoch": 1.0663059622321238,
      "grad_norm": 0.485950823209606,
      "learning_rate": 4.904975371989846e-05,
      "loss": 1.797,
      "num_input_tokens_seen": 7907784432,
      "step": 10051
    },
    {
      "epoch": 1.0664120517716953,
      "grad_norm": 0.34774862085304814,
      "learning_rate": 4.904956392563558e-05,
      "loss": 1.6718,
      "num_input_tokens_seen": 7908571328,
      "step": 10052
    },
    {
      "epoch": 1.0665181413112668,
      "grad_norm": 0.4198229457527388,
      "learning_rate": 4.904937411278791e-05,
      "loss": 1.9639,
      "num_input_tokens_seen": 7909357984,
      "step": 10053
    },
    {
      "epoch": 1.066624230850838,
      "grad_norm": 0.4790370656088958,
      "learning_rate": 4.904918428135559e-05,
      "loss": 1.952,
      "num_input_tokens_seen": 7910144656,
      "step": 10054
    },
    {
      "epoch": 1.0667303203904095,
      "grad_norm": 0.43490581580420556,
      "learning_rate": 4.9048994431338756e-05,
      "loss": 1.7073,
      "num_input_tokens_seen": 7910931392,
      "step": 10055
    },
    {
      "epoch": 1.066836409929981,
      "grad_norm": 0.3987098455009466,
      "learning_rate": 4.904880456273757e-05,
      "loss": 1.6981,
      "num_input_tokens_seen": 7911718128,
      "step": 10056
    },
    {
      "epoch": 1.0669424994695522,
      "grad_norm": 0.5037776871853635,
      "learning_rate": 4.904861467555217e-05,
      "loss": 1.702,
      "num_input_tokens_seen": 7912504896,
      "step": 10057
    },
    {
      "epoch": 1.0670485890091237,
      "grad_norm": 0.7075303087628078,
      "learning_rate": 4.904842476978272e-05,
      "loss": 1.9449,
      "num_input_tokens_seen": 7913291552,
      "step": 10058
    },
    {
      "epoch": 1.0671546785486952,
      "grad_norm": 0.39128773622184465,
      "learning_rate": 4.904823484542934e-05,
      "loss": 1.7895,
      "num_input_tokens_seen": 7914078288,
      "step": 10059
    },
    {
      "epoch": 1.0672607680882664,
      "grad_norm": 0.5835475874217527,
      "learning_rate": 4.9048044902492195e-05,
      "loss": 1.769,
      "num_input_tokens_seen": 7914864960,
      "step": 10060
    },
    {
      "epoch": 1.067366857627838,
      "grad_norm": 0.39600960789135825,
      "learning_rate": 4.9047854940971425e-05,
      "loss": 1.6496,
      "num_input_tokens_seen": 7915651808,
      "step": 10061
    },
    {
      "epoch": 1.0674729471674094,
      "grad_norm": 0.4910289030036685,
      "learning_rate": 4.904766496086717e-05,
      "loss": 1.7655,
      "num_input_tokens_seen": 7916438624,
      "step": 10062
    },
    {
      "epoch": 1.0675790367069806,
      "grad_norm": 0.3560369886998733,
      "learning_rate": 4.90474749621796e-05,
      "loss": 1.5782,
      "num_input_tokens_seen": 7917225456,
      "step": 10063
    },
    {
      "epoch": 1.067685126246552,
      "grad_norm": 0.5359789090660735,
      "learning_rate": 4.9047284944908834e-05,
      "loss": 1.7448,
      "num_input_tokens_seen": 7918012240,
      "step": 10064
    },
    {
      "epoch": 1.0677912157861236,
      "grad_norm": 0.5614068879813975,
      "learning_rate": 4.904709490905504e-05,
      "loss": 1.7894,
      "num_input_tokens_seen": 7918799056,
      "step": 10065
    },
    {
      "epoch": 1.0678973053256948,
      "grad_norm": 0.36260061772086544,
      "learning_rate": 4.904690485461836e-05,
      "loss": 1.6677,
      "num_input_tokens_seen": 7919585824,
      "step": 10066
    },
    {
      "epoch": 1.0680033948652663,
      "grad_norm": 0.40346449640689497,
      "learning_rate": 4.9046714781598924e-05,
      "loss": 1.7982,
      "num_input_tokens_seen": 7920372560,
      "step": 10067
    },
    {
      "epoch": 1.0681094844048378,
      "grad_norm": 0.4739428180604599,
      "learning_rate": 4.9046524689996906e-05,
      "loss": 1.8608,
      "num_input_tokens_seen": 7921159376,
      "step": 10068
    },
    {
      "epoch": 1.068215573944409,
      "grad_norm": 0.41174051561269703,
      "learning_rate": 4.904633457981243e-05,
      "loss": 1.7168,
      "num_input_tokens_seen": 7921946112,
      "step": 10069
    },
    {
      "epoch": 1.0683216634839805,
      "grad_norm": 0.41567722658256756,
      "learning_rate": 4.904614445104565e-05,
      "loss": 1.8644,
      "num_input_tokens_seen": 7922732912,
      "step": 10070
    },
    {
      "epoch": 1.068427753023552,
      "grad_norm": 0.5348333967481828,
      "learning_rate": 4.904595430369673e-05,
      "loss": 2.0912,
      "num_input_tokens_seen": 7923519552,
      "step": 10071
    },
    {
      "epoch": 1.0685338425631232,
      "grad_norm": 0.38446759885648785,
      "learning_rate": 4.9045764137765794e-05,
      "loss": 1.7605,
      "num_input_tokens_seen": 7924306304,
      "step": 10072
    },
    {
      "epoch": 1.0686399321026947,
      "grad_norm": 0.526182346482501,
      "learning_rate": 4.904557395325299e-05,
      "loss": 1.6734,
      "num_input_tokens_seen": 7925093056,
      "step": 10073
    },
    {
      "epoch": 1.0687460216422662,
      "grad_norm": 0.3851584634765107,
      "learning_rate": 4.904538375015848e-05,
      "loss": 1.8362,
      "num_input_tokens_seen": 7925879696,
      "step": 10074
    },
    {
      "epoch": 1.0688521111818374,
      "grad_norm": 0.46765027794417174,
      "learning_rate": 4.9045193528482406e-05,
      "loss": 1.6471,
      "num_input_tokens_seen": 7926666448,
      "step": 10075
    },
    {
      "epoch": 1.068958200721409,
      "grad_norm": 0.3908322862198835,
      "learning_rate": 4.90450032882249e-05,
      "loss": 1.6873,
      "num_input_tokens_seen": 7927453296,
      "step": 10076
    },
    {
      "epoch": 1.0690642902609802,
      "grad_norm": 0.4086503148612029,
      "learning_rate": 4.9044813029386125e-05,
      "loss": 1.8837,
      "num_input_tokens_seen": 7928240000,
      "step": 10077
    },
    {
      "epoch": 1.0691703798005516,
      "grad_norm": 0.4383108861418342,
      "learning_rate": 4.9044622751966226e-05,
      "loss": 1.8806,
      "num_input_tokens_seen": 7929026752,
      "step": 10078
    },
    {
      "epoch": 1.069276469340123,
      "grad_norm": 0.477805445330266,
      "learning_rate": 4.904443245596535e-05,
      "loss": 1.8488,
      "num_input_tokens_seen": 7929813520,
      "step": 10079
    },
    {
      "epoch": 1.0693825588796946,
      "grad_norm": 0.5936442198601997,
      "learning_rate": 4.9044242141383645e-05,
      "loss": 1.8957,
      "num_input_tokens_seen": 7930600368,
      "step": 10080
    },
    {
      "epoch": 1.0694886484192658,
      "grad_norm": 0.4425104243755653,
      "learning_rate": 4.904405180822125e-05,
      "loss": 1.9002,
      "num_input_tokens_seen": 7931387072,
      "step": 10081
    },
    {
      "epoch": 1.0695947379588373,
      "grad_norm": 0.5827312730330945,
      "learning_rate": 4.904386145647832e-05,
      "loss": 1.9113,
      "num_input_tokens_seen": 7932173760,
      "step": 10082
    },
    {
      "epoch": 1.0697008274984086,
      "grad_norm": 0.5216193556832368,
      "learning_rate": 4.9043671086154994e-05,
      "loss": 1.9056,
      "num_input_tokens_seen": 7932960464,
      "step": 10083
    },
    {
      "epoch": 1.06980691703798,
      "grad_norm": 0.8369679878257968,
      "learning_rate": 4.904348069725143e-05,
      "loss": 1.8078,
      "num_input_tokens_seen": 7933747280,
      "step": 10084
    },
    {
      "epoch": 1.0699130065775515,
      "grad_norm": 0.5505170421082699,
      "learning_rate": 4.904329028976776e-05,
      "loss": 1.8583,
      "num_input_tokens_seen": 7934534096,
      "step": 10085
    },
    {
      "epoch": 1.0700190961171228,
      "grad_norm": 0.46567488013031805,
      "learning_rate": 4.904309986370416e-05,
      "loss": 1.737,
      "num_input_tokens_seen": 7935320944,
      "step": 10086
    },
    {
      "epoch": 1.0701251856566942,
      "grad_norm": 0.5074336611868271,
      "learning_rate": 4.904290941906074e-05,
      "loss": 1.8942,
      "num_input_tokens_seen": 7936107600,
      "step": 10087
    },
    {
      "epoch": 1.0702312751962657,
      "grad_norm": 0.685664470414468,
      "learning_rate": 4.9042718955837677e-05,
      "loss": 1.908,
      "num_input_tokens_seen": 7936894432,
      "step": 10088
    },
    {
      "epoch": 1.070337364735837,
      "grad_norm": 0.7822618907613156,
      "learning_rate": 4.90425284740351e-05,
      "loss": 1.7992,
      "num_input_tokens_seen": 7937681280,
      "step": 10089
    },
    {
      "epoch": 1.0704434542754084,
      "grad_norm": 0.6378026455396987,
      "learning_rate": 4.904233797365316e-05,
      "loss": 1.8345,
      "num_input_tokens_seen": 7938467984,
      "step": 10090
    },
    {
      "epoch": 1.07054954381498,
      "grad_norm": 0.5670644188123403,
      "learning_rate": 4.9042147454692014e-05,
      "loss": 1.9025,
      "num_input_tokens_seen": 7939254784,
      "step": 10091
    },
    {
      "epoch": 1.0706556333545512,
      "grad_norm": 0.5040996575084445,
      "learning_rate": 4.9041956917151794e-05,
      "loss": 1.7657,
      "num_input_tokens_seen": 7940041632,
      "step": 10092
    },
    {
      "epoch": 1.0707617228941226,
      "grad_norm": 0.5358799867775782,
      "learning_rate": 4.904176636103266e-05,
      "loss": 1.8419,
      "num_input_tokens_seen": 7940828464,
      "step": 10093
    },
    {
      "epoch": 1.070867812433694,
      "grad_norm": 0.4368247976702921,
      "learning_rate": 4.904157578633475e-05,
      "loss": 1.7954,
      "num_input_tokens_seen": 7941615152,
      "step": 10094
    },
    {
      "epoch": 1.0709739019732654,
      "grad_norm": 0.494173308213899,
      "learning_rate": 4.904138519305822e-05,
      "loss": 1.8619,
      "num_input_tokens_seen": 7942401936,
      "step": 10095
    },
    {
      "epoch": 1.0710799915128368,
      "grad_norm": 0.45599460750670484,
      "learning_rate": 4.904119458120321e-05,
      "loss": 1.7876,
      "num_input_tokens_seen": 7943188656,
      "step": 10096
    },
    {
      "epoch": 1.0711860810524083,
      "grad_norm": 0.40471231754371123,
      "learning_rate": 4.9041003950769874e-05,
      "loss": 1.7268,
      "num_input_tokens_seen": 7943975440,
      "step": 10097
    },
    {
      "epoch": 1.0712921705919796,
      "grad_norm": 0.4398559777042233,
      "learning_rate": 4.904081330175835e-05,
      "loss": 1.8983,
      "num_input_tokens_seen": 7944762224,
      "step": 10098
    },
    {
      "epoch": 1.071398260131551,
      "grad_norm": 0.46374542861551726,
      "learning_rate": 4.90406226341688e-05,
      "loss": 1.8285,
      "num_input_tokens_seen": 7945548992,
      "step": 10099
    },
    {
      "epoch": 1.0715043496711225,
      "grad_norm": 0.43962812325196415,
      "learning_rate": 4.904043194800135e-05,
      "loss": 1.8512,
      "num_input_tokens_seen": 7946335616,
      "step": 10100
    },
    {
      "epoch": 1.0716104392106938,
      "grad_norm": 0.5446160889539599,
      "learning_rate": 4.904024124325617e-05,
      "loss": 1.853,
      "num_input_tokens_seen": 7947122512,
      "step": 10101
    },
    {
      "epoch": 1.0717165287502652,
      "grad_norm": 0.48691015521893666,
      "learning_rate": 4.904005051993339e-05,
      "loss": 1.8583,
      "num_input_tokens_seen": 7947909200,
      "step": 10102
    },
    {
      "epoch": 1.0718226182898367,
      "grad_norm": 0.44437243993426967,
      "learning_rate": 4.903985977803317e-05,
      "loss": 1.7914,
      "num_input_tokens_seen": 7948696016,
      "step": 10103
    },
    {
      "epoch": 1.071928707829408,
      "grad_norm": 0.5611808784977745,
      "learning_rate": 4.9039669017555645e-05,
      "loss": 1.8363,
      "num_input_tokens_seen": 7949482768,
      "step": 10104
    },
    {
      "epoch": 1.0720347973689794,
      "grad_norm": 0.7625828513156734,
      "learning_rate": 4.903947823850098e-05,
      "loss": 1.8749,
      "num_input_tokens_seen": 7950269568,
      "step": 10105
    },
    {
      "epoch": 1.072140886908551,
      "grad_norm": 0.5434713617138957,
      "learning_rate": 4.90392874408693e-05,
      "loss": 2.0118,
      "num_input_tokens_seen": 7951056304,
      "step": 10106
    },
    {
      "epoch": 1.0722469764481222,
      "grad_norm": 0.4968371636604308,
      "learning_rate": 4.9039096624660776e-05,
      "loss": 1.9397,
      "num_input_tokens_seen": 7951843056,
      "step": 10107
    },
    {
      "epoch": 1.0723530659876936,
      "grad_norm": 0.7314260987067728,
      "learning_rate": 4.903890578987553e-05,
      "loss": 1.805,
      "num_input_tokens_seen": 7952629936,
      "step": 10108
    },
    {
      "epoch": 1.0724591555272651,
      "grad_norm": 0.5190297225522466,
      "learning_rate": 4.903871493651373e-05,
      "loss": 1.7557,
      "num_input_tokens_seen": 7953416736,
      "step": 10109
    },
    {
      "epoch": 1.0725652450668364,
      "grad_norm": 0.5314000193883155,
      "learning_rate": 4.903852406457552e-05,
      "loss": 1.7553,
      "num_input_tokens_seen": 7954203536,
      "step": 10110
    },
    {
      "epoch": 1.0726713346064078,
      "grad_norm": 0.4823663977082254,
      "learning_rate": 4.9038333174061033e-05,
      "loss": 1.8014,
      "num_input_tokens_seen": 7954990448,
      "step": 10111
    },
    {
      "epoch": 1.072777424145979,
      "grad_norm": 0.5522967047438696,
      "learning_rate": 4.903814226497044e-05,
      "loss": 1.8611,
      "num_input_tokens_seen": 7955777232,
      "step": 10112
    },
    {
      "epoch": 1.0728835136855506,
      "grad_norm": 0.34626055860020744,
      "learning_rate": 4.903795133730387e-05,
      "loss": 1.6812,
      "num_input_tokens_seen": 7956564032,
      "step": 10113
    },
    {
      "epoch": 1.072989603225122,
      "grad_norm": 0.6552177307211886,
      "learning_rate": 4.903776039106147e-05,
      "loss": 1.7258,
      "num_input_tokens_seen": 7957350880,
      "step": 10114
    },
    {
      "epoch": 1.0730956927646933,
      "grad_norm": 0.38089981192023487,
      "learning_rate": 4.90375694262434e-05,
      "loss": 1.6528,
      "num_input_tokens_seen": 7958137744,
      "step": 10115
    },
    {
      "epoch": 1.0732017823042648,
      "grad_norm": 0.49250698814737515,
      "learning_rate": 4.903737844284981e-05,
      "loss": 1.8873,
      "num_input_tokens_seen": 7958924512,
      "step": 10116
    },
    {
      "epoch": 1.0733078718438362,
      "grad_norm": 0.4964279021823291,
      "learning_rate": 4.903718744088083e-05,
      "loss": 1.7128,
      "num_input_tokens_seen": 7959711248,
      "step": 10117
    },
    {
      "epoch": 1.0734139613834075,
      "grad_norm": 0.42580636190102755,
      "learning_rate": 4.903699642033662e-05,
      "loss": 1.672,
      "num_input_tokens_seen": 7960498096,
      "step": 10118
    },
    {
      "epoch": 1.073520050922979,
      "grad_norm": 0.5610284455693569,
      "learning_rate": 4.903680538121732e-05,
      "loss": 1.8128,
      "num_input_tokens_seen": 7961284784,
      "step": 10119
    },
    {
      "epoch": 1.0736261404625504,
      "grad_norm": 0.38338465381197684,
      "learning_rate": 4.903661432352309e-05,
      "loss": 1.816,
      "num_input_tokens_seen": 7962071552,
      "step": 10120
    },
    {
      "epoch": 1.0737322300021217,
      "grad_norm": 0.4190543495811076,
      "learning_rate": 4.903642324725406e-05,
      "loss": 1.7468,
      "num_input_tokens_seen": 7962858368,
      "step": 10121
    },
    {
      "epoch": 1.0738383195416932,
      "grad_norm": 0.5279499810130276,
      "learning_rate": 4.903623215241039e-05,
      "loss": 1.8855,
      "num_input_tokens_seen": 7963645136,
      "step": 10122
    },
    {
      "epoch": 1.0739444090812647,
      "grad_norm": 0.44516787698698,
      "learning_rate": 4.903604103899223e-05,
      "loss": 1.783,
      "num_input_tokens_seen": 7964431904,
      "step": 10123
    },
    {
      "epoch": 1.074050498620836,
      "grad_norm": 0.5345701462887671,
      "learning_rate": 4.903584990699972e-05,
      "loss": 1.8178,
      "num_input_tokens_seen": 7965218608,
      "step": 10124
    },
    {
      "epoch": 1.0741565881604074,
      "grad_norm": 0.3774414135265474,
      "learning_rate": 4.903565875643301e-05,
      "loss": 1.8544,
      "num_input_tokens_seen": 7966005392,
      "step": 10125
    },
    {
      "epoch": 1.0742626776999789,
      "grad_norm": 0.48384322541593233,
      "learning_rate": 4.903546758729225e-05,
      "loss": 1.7164,
      "num_input_tokens_seen": 7966792176,
      "step": 10126
    },
    {
      "epoch": 1.07436876723955,
      "grad_norm": 0.5014109238644628,
      "learning_rate": 4.903527639957758e-05,
      "loss": 1.8132,
      "num_input_tokens_seen": 7967579024,
      "step": 10127
    },
    {
      "epoch": 1.0744748567791216,
      "grad_norm": 0.3790798832020708,
      "learning_rate": 4.9035085193289164e-05,
      "loss": 1.7734,
      "num_input_tokens_seen": 7968365776,
      "step": 10128
    },
    {
      "epoch": 1.074580946318693,
      "grad_norm": 0.5858667323105646,
      "learning_rate": 4.903489396842713e-05,
      "loss": 1.8867,
      "num_input_tokens_seen": 7969152448,
      "step": 10129
    },
    {
      "epoch": 1.0746870358582643,
      "grad_norm": 0.3354691903649614,
      "learning_rate": 4.9034702724991646e-05,
      "loss": 1.7535,
      "num_input_tokens_seen": 7969939232,
      "step": 10130
    },
    {
      "epoch": 1.0747931253978358,
      "grad_norm": 0.5375504748999977,
      "learning_rate": 4.903451146298284e-05,
      "loss": 1.8644,
      "num_input_tokens_seen": 7970726048,
      "step": 10131
    },
    {
      "epoch": 1.0748992149374073,
      "grad_norm": 0.3883325125324965,
      "learning_rate": 4.903432018240086e-05,
      "loss": 1.73,
      "num_input_tokens_seen": 7971512832,
      "step": 10132
    },
    {
      "epoch": 1.0750053044769785,
      "grad_norm": 0.4366786938133907,
      "learning_rate": 4.903412888324588e-05,
      "loss": 1.6693,
      "num_input_tokens_seen": 7972299600,
      "step": 10133
    },
    {
      "epoch": 1.07511139401655,
      "grad_norm": 0.4670614346219751,
      "learning_rate": 4.9033937565518016e-05,
      "loss": 1.9314,
      "num_input_tokens_seen": 7973086336,
      "step": 10134
    },
    {
      "epoch": 1.0752174835561215,
      "grad_norm": 0.44998099934692337,
      "learning_rate": 4.903374622921744e-05,
      "loss": 1.8073,
      "num_input_tokens_seen": 7973873136,
      "step": 10135
    },
    {
      "epoch": 1.0753235730956927,
      "grad_norm": 0.38564848090060877,
      "learning_rate": 4.903355487434429e-05,
      "loss": 1.8147,
      "num_input_tokens_seen": 7974659888,
      "step": 10136
    },
    {
      "epoch": 1.0754296626352642,
      "grad_norm": 0.4106010970372606,
      "learning_rate": 4.903336350089871e-05,
      "loss": 1.8335,
      "num_input_tokens_seen": 7975446656,
      "step": 10137
    },
    {
      "epoch": 1.0755357521748357,
      "grad_norm": 0.3834144735322465,
      "learning_rate": 4.9033172108880854e-05,
      "loss": 1.6222,
      "num_input_tokens_seen": 7976233520,
      "step": 10138
    },
    {
      "epoch": 1.075641841714407,
      "grad_norm": 0.4842981311066537,
      "learning_rate": 4.903298069829087e-05,
      "loss": 1.7496,
      "num_input_tokens_seen": 7977020256,
      "step": 10139
    },
    {
      "epoch": 1.0757479312539784,
      "grad_norm": 0.42845843044371834,
      "learning_rate": 4.9032789269128896e-05,
      "loss": 1.6431,
      "num_input_tokens_seen": 7977807072,
      "step": 10140
    },
    {
      "epoch": 1.0758540207935499,
      "grad_norm": 0.7218678023227807,
      "learning_rate": 4.90325978213951e-05,
      "loss": 1.6207,
      "num_input_tokens_seen": 7978593920,
      "step": 10141
    },
    {
      "epoch": 1.0759601103331211,
      "grad_norm": 0.5608581622868136,
      "learning_rate": 4.903240635508961e-05,
      "loss": 1.9066,
      "num_input_tokens_seen": 7979380656,
      "step": 10142
    },
    {
      "epoch": 1.0760661998726926,
      "grad_norm": 0.6567972472795751,
      "learning_rate": 4.903221487021258e-05,
      "loss": 1.8169,
      "num_input_tokens_seen": 7980167360,
      "step": 10143
    },
    {
      "epoch": 1.076172289412264,
      "grad_norm": 0.3256397056229851,
      "learning_rate": 4.903202336676416e-05,
      "loss": 1.6716,
      "num_input_tokens_seen": 7980954192,
      "step": 10144
    },
    {
      "epoch": 1.0762783789518353,
      "grad_norm": 0.6118829618220197,
      "learning_rate": 4.90318318447445e-05,
      "loss": 1.884,
      "num_input_tokens_seen": 7981740960,
      "step": 10145
    },
    {
      "epoch": 1.0763844684914068,
      "grad_norm": 0.5643714235493381,
      "learning_rate": 4.903164030415374e-05,
      "loss": 1.8357,
      "num_input_tokens_seen": 7982527776,
      "step": 10146
    },
    {
      "epoch": 1.076490558030978,
      "grad_norm": 0.7361422575187617,
      "learning_rate": 4.903144874499204e-05,
      "loss": 1.827,
      "num_input_tokens_seen": 7983314464,
      "step": 10147
    },
    {
      "epoch": 1.0765966475705495,
      "grad_norm": 0.6425032178395014,
      "learning_rate": 4.903125716725954e-05,
      "loss": 1.8959,
      "num_input_tokens_seen": 7984101152,
      "step": 10148
    },
    {
      "epoch": 1.076702737110121,
      "grad_norm": 0.4398541602810973,
      "learning_rate": 4.903106557095639e-05,
      "loss": 1.8841,
      "num_input_tokens_seen": 7984887904,
      "step": 10149
    },
    {
      "epoch": 1.0768088266496922,
      "grad_norm": 0.41691361476537625,
      "learning_rate": 4.903087395608273e-05,
      "loss": 1.851,
      "num_input_tokens_seen": 7985674656,
      "step": 10150
    },
    {
      "epoch": 1.0769149161892637,
      "grad_norm": 0.5262345039822013,
      "learning_rate": 4.903068232263873e-05,
      "loss": 1.8145,
      "num_input_tokens_seen": 7986461376,
      "step": 10151
    },
    {
      "epoch": 1.0770210057288352,
      "grad_norm": 0.3557035314906668,
      "learning_rate": 4.903049067062451e-05,
      "loss": 1.8206,
      "num_input_tokens_seen": 7987248128,
      "step": 10152
    },
    {
      "epoch": 1.0771270952684064,
      "grad_norm": 0.4683108579457073,
      "learning_rate": 4.903029900004024e-05,
      "loss": 1.7905,
      "num_input_tokens_seen": 7988034944,
      "step": 10153
    },
    {
      "epoch": 1.077233184807978,
      "grad_norm": 0.4916840753886326,
      "learning_rate": 4.903010731088606e-05,
      "loss": 1.7386,
      "num_input_tokens_seen": 7988821680,
      "step": 10154
    },
    {
      "epoch": 1.0773392743475494,
      "grad_norm": 0.4036815948031814,
      "learning_rate": 4.902991560316211e-05,
      "loss": 1.8401,
      "num_input_tokens_seen": 7989608416,
      "step": 10155
    },
    {
      "epoch": 1.0774453638871206,
      "grad_norm": 0.5224435113453201,
      "learning_rate": 4.9029723876868563e-05,
      "loss": 1.9364,
      "num_input_tokens_seen": 7990395168,
      "step": 10156
    },
    {
      "epoch": 1.0775514534266921,
      "grad_norm": 0.5335242524222311,
      "learning_rate": 4.9029532132005534e-05,
      "loss": 1.785,
      "num_input_tokens_seen": 7991181936,
      "step": 10157
    },
    {
      "epoch": 1.0776575429662636,
      "grad_norm": 0.38017108095869473,
      "learning_rate": 4.90293403685732e-05,
      "loss": 1.7325,
      "num_input_tokens_seen": 7991968720,
      "step": 10158
    },
    {
      "epoch": 1.0777636325058348,
      "grad_norm": 0.439997519830555,
      "learning_rate": 4.9029148586571684e-05,
      "loss": 1.6469,
      "num_input_tokens_seen": 7992755424,
      "step": 10159
    },
    {
      "epoch": 1.0778697220454063,
      "grad_norm": 0.655607435176839,
      "learning_rate": 4.9028956786001154e-05,
      "loss": 1.8084,
      "num_input_tokens_seen": 7993542160,
      "step": 10160
    },
    {
      "epoch": 1.0779758115849778,
      "grad_norm": 0.5150843678756607,
      "learning_rate": 4.902876496686175e-05,
      "loss": 1.7425,
      "num_input_tokens_seen": 7994328960,
      "step": 10161
    },
    {
      "epoch": 1.078081901124549,
      "grad_norm": 0.6011715276513406,
      "learning_rate": 4.902857312915362e-05,
      "loss": 1.8818,
      "num_input_tokens_seen": 7995115792,
      "step": 10162
    },
    {
      "epoch": 1.0781879906641205,
      "grad_norm": 0.5455783577105248,
      "learning_rate": 4.902838127287692e-05,
      "loss": 1.8326,
      "num_input_tokens_seen": 7995902560,
      "step": 10163
    },
    {
      "epoch": 1.078294080203692,
      "grad_norm": 0.4677609410781454,
      "learning_rate": 4.902818939803179e-05,
      "loss": 1.9788,
      "num_input_tokens_seen": 7996689296,
      "step": 10164
    },
    {
      "epoch": 1.0784001697432632,
      "grad_norm": 0.3758707778774671,
      "learning_rate": 4.902799750461837e-05,
      "loss": 1.8157,
      "num_input_tokens_seen": 7997476080,
      "step": 10165
    },
    {
      "epoch": 1.0785062592828347,
      "grad_norm": 0.4256195754335457,
      "learning_rate": 4.9027805592636826e-05,
      "loss": 1.8047,
      "num_input_tokens_seen": 7998262864,
      "step": 10166
    },
    {
      "epoch": 1.0786123488224062,
      "grad_norm": 0.5450625752566723,
      "learning_rate": 4.90276136620873e-05,
      "loss": 1.8786,
      "num_input_tokens_seen": 7999049696,
      "step": 10167
    },
    {
      "epoch": 1.0787184383619774,
      "grad_norm": 0.4287155595278582,
      "learning_rate": 4.902742171296994e-05,
      "loss": 1.9502,
      "num_input_tokens_seen": 7999836464,
      "step": 10168
    },
    {
      "epoch": 1.078824527901549,
      "grad_norm": 0.5552028796747566,
      "learning_rate": 4.902722974528489e-05,
      "loss": 1.9525,
      "num_input_tokens_seen": 8000623136,
      "step": 10169
    },
    {
      "epoch": 1.0789306174411204,
      "grad_norm": 0.43666764708136824,
      "learning_rate": 4.902703775903231e-05,
      "loss": 1.8839,
      "num_input_tokens_seen": 8001409872,
      "step": 10170
    },
    {
      "epoch": 1.0790367069806917,
      "grad_norm": 0.48344771294956856,
      "learning_rate": 4.902684575421233e-05,
      "loss": 1.7862,
      "num_input_tokens_seen": 8002196576,
      "step": 10171
    },
    {
      "epoch": 1.0791427965202631,
      "grad_norm": 0.6394932038925623,
      "learning_rate": 4.902665373082511e-05,
      "loss": 1.9005,
      "num_input_tokens_seen": 8002983312,
      "step": 10172
    },
    {
      "epoch": 1.0792488860598346,
      "grad_norm": 0.4342296414129204,
      "learning_rate": 4.9026461688870804e-05,
      "loss": 1.8231,
      "num_input_tokens_seen": 8003770112,
      "step": 10173
    },
    {
      "epoch": 1.0793549755994059,
      "grad_norm": 0.5599749807922668,
      "learning_rate": 4.902626962834955e-05,
      "loss": 1.73,
      "num_input_tokens_seen": 8004556976,
      "step": 10174
    },
    {
      "epoch": 1.0794610651389773,
      "grad_norm": 0.505305989968105,
      "learning_rate": 4.9026077549261495e-05,
      "loss": 1.8892,
      "num_input_tokens_seen": 8005343680,
      "step": 10175
    },
    {
      "epoch": 1.0795671546785486,
      "grad_norm": 0.5921298401832468,
      "learning_rate": 4.9025885451606803e-05,
      "loss": 1.7859,
      "num_input_tokens_seen": 8006130416,
      "step": 10176
    },
    {
      "epoch": 1.07967324421812,
      "grad_norm": 0.4641862074789094,
      "learning_rate": 4.9025693335385604e-05,
      "loss": 1.815,
      "num_input_tokens_seen": 8006917136,
      "step": 10177
    },
    {
      "epoch": 1.0797793337576915,
      "grad_norm": 0.6540806413884425,
      "learning_rate": 4.902550120059805e-05,
      "loss": 1.9521,
      "num_input_tokens_seen": 8007703936,
      "step": 10178
    },
    {
      "epoch": 1.079885423297263,
      "grad_norm": 0.433019878470686,
      "learning_rate": 4.90253090472443e-05,
      "loss": 1.8733,
      "num_input_tokens_seen": 8008490704,
      "step": 10179
    },
    {
      "epoch": 1.0799915128368343,
      "grad_norm": 0.6389925881661073,
      "learning_rate": 4.9025116875324495e-05,
      "loss": 1.7594,
      "num_input_tokens_seen": 8009277488,
      "step": 10180
    },
    {
      "epoch": 1.0800976023764057,
      "grad_norm": 0.49519582169616977,
      "learning_rate": 4.902492468483878e-05,
      "loss": 1.9576,
      "num_input_tokens_seen": 8010064272,
      "step": 10181
    },
    {
      "epoch": 1.080203691915977,
      "grad_norm": 0.465780036343068,
      "learning_rate": 4.9024732475787317e-05,
      "loss": 1.7038,
      "num_input_tokens_seen": 8010851072,
      "step": 10182
    },
    {
      "epoch": 1.0803097814555485,
      "grad_norm": 0.6387292289169502,
      "learning_rate": 4.902454024817024e-05,
      "loss": 1.8848,
      "num_input_tokens_seen": 8011637808,
      "step": 10183
    },
    {
      "epoch": 1.08041587099512,
      "grad_norm": 0.4208341841175655,
      "learning_rate": 4.902434800198771e-05,
      "loss": 1.7379,
      "num_input_tokens_seen": 8012424608,
      "step": 10184
    },
    {
      "epoch": 1.0805219605346912,
      "grad_norm": 0.5486810660963181,
      "learning_rate": 4.902415573723986e-05,
      "loss": 1.7316,
      "num_input_tokens_seen": 8013211424,
      "step": 10185
    },
    {
      "epoch": 1.0806280500742627,
      "grad_norm": 0.3961165373486276,
      "learning_rate": 4.902396345392685e-05,
      "loss": 1.7604,
      "num_input_tokens_seen": 8013998240,
      "step": 10186
    },
    {
      "epoch": 1.0807341396138341,
      "grad_norm": 0.3943183950950394,
      "learning_rate": 4.902377115204883e-05,
      "loss": 1.7582,
      "num_input_tokens_seen": 8014784960,
      "step": 10187
    },
    {
      "epoch": 1.0808402291534054,
      "grad_norm": 0.4629328891989628,
      "learning_rate": 4.902357883160593e-05,
      "loss": 1.738,
      "num_input_tokens_seen": 8015571680,
      "step": 10188
    },
    {
      "epoch": 1.0809463186929769,
      "grad_norm": 0.38157775064076294,
      "learning_rate": 4.902338649259833e-05,
      "loss": 1.6706,
      "num_input_tokens_seen": 8016358432,
      "step": 10189
    },
    {
      "epoch": 1.0810524082325483,
      "grad_norm": 0.4444949791599702,
      "learning_rate": 4.902319413502616e-05,
      "loss": 1.965,
      "num_input_tokens_seen": 8017145200,
      "step": 10190
    },
    {
      "epoch": 1.0811584977721196,
      "grad_norm": 0.3875088226855354,
      "learning_rate": 4.9023001758889565e-05,
      "loss": 1.708,
      "num_input_tokens_seen": 8017932096,
      "step": 10191
    },
    {
      "epoch": 1.081264587311691,
      "grad_norm": 0.5034061725757337,
      "learning_rate": 4.90228093641887e-05,
      "loss": 1.8502,
      "num_input_tokens_seen": 8018718848,
      "step": 10192
    },
    {
      "epoch": 1.0813706768512625,
      "grad_norm": 0.4204103755868315,
      "learning_rate": 4.902261695092371e-05,
      "loss": 1.8839,
      "num_input_tokens_seen": 8019505648,
      "step": 10193
    },
    {
      "epoch": 1.0814767663908338,
      "grad_norm": 0.47820716318644585,
      "learning_rate": 4.902242451909475e-05,
      "loss": 1.7944,
      "num_input_tokens_seen": 8020292384,
      "step": 10194
    },
    {
      "epoch": 1.0815828559304053,
      "grad_norm": 0.3944478391544667,
      "learning_rate": 4.902223206870197e-05,
      "loss": 1.808,
      "num_input_tokens_seen": 8021079024,
      "step": 10195
    },
    {
      "epoch": 1.0816889454699767,
      "grad_norm": 0.5536995093102388,
      "learning_rate": 4.9022039599745506e-05,
      "loss": 1.89,
      "num_input_tokens_seen": 8021865712,
      "step": 10196
    },
    {
      "epoch": 1.081795035009548,
      "grad_norm": 0.4105292186632536,
      "learning_rate": 4.902184711222552e-05,
      "loss": 1.9017,
      "num_input_tokens_seen": 8022652416,
      "step": 10197
    },
    {
      "epoch": 1.0819011245491195,
      "grad_norm": 0.4648694297094321,
      "learning_rate": 4.902165460614215e-05,
      "loss": 1.7902,
      "num_input_tokens_seen": 8023439136,
      "step": 10198
    },
    {
      "epoch": 1.082007214088691,
      "grad_norm": 0.390930230410274,
      "learning_rate": 4.902146208149555e-05,
      "loss": 1.6527,
      "num_input_tokens_seen": 8024225968,
      "step": 10199
    },
    {
      "epoch": 1.0821133036282622,
      "grad_norm": 0.447021353689877,
      "learning_rate": 4.902126953828587e-05,
      "loss": 1.7324,
      "num_input_tokens_seen": 8025012736,
      "step": 10200
    },
    {
      "epoch": 1.0822193931678337,
      "grad_norm": 0.4224686972966081,
      "learning_rate": 4.902107697651326e-05,
      "loss": 1.7738,
      "num_input_tokens_seen": 8025799536,
      "step": 10201
    },
    {
      "epoch": 1.0823254827074051,
      "grad_norm": 0.38891184360951164,
      "learning_rate": 4.902088439617787e-05,
      "loss": 1.8617,
      "num_input_tokens_seen": 8026586352,
      "step": 10202
    },
    {
      "epoch": 1.0824315722469764,
      "grad_norm": 0.4055431111526573,
      "learning_rate": 4.9020691797279836e-05,
      "loss": 1.9608,
      "num_input_tokens_seen": 8027373104,
      "step": 10203
    },
    {
      "epoch": 1.0825376617865479,
      "grad_norm": 0.3515075306140098,
      "learning_rate": 4.902049917981933e-05,
      "loss": 1.7905,
      "num_input_tokens_seen": 8028159744,
      "step": 10204
    },
    {
      "epoch": 1.0826437513261193,
      "grad_norm": 0.48155792340732123,
      "learning_rate": 4.902030654379648e-05,
      "loss": 1.9625,
      "num_input_tokens_seen": 8028946528,
      "step": 10205
    },
    {
      "epoch": 1.0827498408656906,
      "grad_norm": 0.47757096966115087,
      "learning_rate": 4.902011388921144e-05,
      "loss": 1.8387,
      "num_input_tokens_seen": 8029733360,
      "step": 10206
    },
    {
      "epoch": 1.082855930405262,
      "grad_norm": 0.582530927398559,
      "learning_rate": 4.9019921216064355e-05,
      "loss": 1.8633,
      "num_input_tokens_seen": 8030520128,
      "step": 10207
    },
    {
      "epoch": 1.0829620199448335,
      "grad_norm": 0.815372462584013,
      "learning_rate": 4.901972852435539e-05,
      "loss": 1.7528,
      "num_input_tokens_seen": 8031306944,
      "step": 10208
    },
    {
      "epoch": 1.0830681094844048,
      "grad_norm": 0.3544916774583718,
      "learning_rate": 4.901953581408468e-05,
      "loss": 1.6381,
      "num_input_tokens_seen": 8032093680,
      "step": 10209
    },
    {
      "epoch": 1.0831741990239763,
      "grad_norm": 1.169013815962684,
      "learning_rate": 4.901934308525238e-05,
      "loss": 1.8268,
      "num_input_tokens_seen": 8032880384,
      "step": 10210
    },
    {
      "epoch": 1.0832802885635475,
      "grad_norm": 0.41542359411755386,
      "learning_rate": 4.901915033785863e-05,
      "loss": 1.877,
      "num_input_tokens_seen": 8033667136,
      "step": 10211
    },
    {
      "epoch": 1.083386378103119,
      "grad_norm": 0.7066829137478577,
      "learning_rate": 4.901895757190359e-05,
      "loss": 1.7296,
      "num_input_tokens_seen": 8034453920,
      "step": 10212
    },
    {
      "epoch": 1.0834924676426905,
      "grad_norm": 0.5774868538996897,
      "learning_rate": 4.901876478738741e-05,
      "loss": 1.909,
      "num_input_tokens_seen": 8035240576,
      "step": 10213
    },
    {
      "epoch": 1.083598557182262,
      "grad_norm": 1.0087915691647582,
      "learning_rate": 4.901857198431022e-05,
      "loss": 1.8033,
      "num_input_tokens_seen": 8036027344,
      "step": 10214
    },
    {
      "epoch": 1.0837046467218332,
      "grad_norm": 0.5672461115494287,
      "learning_rate": 4.901837916267219e-05,
      "loss": 1.912,
      "num_input_tokens_seen": 8036814080,
      "step": 10215
    },
    {
      "epoch": 1.0838107362614047,
      "grad_norm": 0.9428331285417197,
      "learning_rate": 4.901818632247346e-05,
      "loss": 1.7318,
      "num_input_tokens_seen": 8037600944,
      "step": 10216
    },
    {
      "epoch": 1.083916825800976,
      "grad_norm": 0.4255285723913669,
      "learning_rate": 4.901799346371418e-05,
      "loss": 1.5678,
      "num_input_tokens_seen": 8038387696,
      "step": 10217
    },
    {
      "epoch": 1.0840229153405474,
      "grad_norm": 0.6001753077741141,
      "learning_rate": 4.90178005863945e-05,
      "loss": 1.6707,
      "num_input_tokens_seen": 8039174528,
      "step": 10218
    },
    {
      "epoch": 1.0841290048801189,
      "grad_norm": 0.6835115903353076,
      "learning_rate": 4.901760769051457e-05,
      "loss": 1.8057,
      "num_input_tokens_seen": 8039961296,
      "step": 10219
    },
    {
      "epoch": 1.0842350944196901,
      "grad_norm": 0.4257942453958145,
      "learning_rate": 4.901741477607453e-05,
      "loss": 1.8743,
      "num_input_tokens_seen": 8040748048,
      "step": 10220
    },
    {
      "epoch": 1.0843411839592616,
      "grad_norm": 0.848321694442396,
      "learning_rate": 4.9017221843074545e-05,
      "loss": 1.7741,
      "num_input_tokens_seen": 8041534832,
      "step": 10221
    },
    {
      "epoch": 1.084447273498833,
      "grad_norm": 0.41487186094128553,
      "learning_rate": 4.901702889151476e-05,
      "loss": 1.7469,
      "num_input_tokens_seen": 8042321696,
      "step": 10222
    },
    {
      "epoch": 1.0845533630384043,
      "grad_norm": 0.7787152895910904,
      "learning_rate": 4.901683592139531e-05,
      "loss": 1.7331,
      "num_input_tokens_seen": 8043108512,
      "step": 10223
    },
    {
      "epoch": 1.0846594525779758,
      "grad_norm": 0.5656342924830323,
      "learning_rate": 4.9016642932716356e-05,
      "loss": 1.8181,
      "num_input_tokens_seen": 8043895280,
      "step": 10224
    },
    {
      "epoch": 1.0847655421175473,
      "grad_norm": 0.680299808005956,
      "learning_rate": 4.9016449925478045e-05,
      "loss": 1.8676,
      "num_input_tokens_seen": 8044681952,
      "step": 10225
    },
    {
      "epoch": 1.0848716316571185,
      "grad_norm": 0.60386397367854,
      "learning_rate": 4.901625689968053e-05,
      "loss": 1.6881,
      "num_input_tokens_seen": 8045468656,
      "step": 10226
    },
    {
      "epoch": 1.08497772119669,
      "grad_norm": 0.8272996041136974,
      "learning_rate": 4.901606385532395e-05,
      "loss": 1.6902,
      "num_input_tokens_seen": 8046255376,
      "step": 10227
    },
    {
      "epoch": 1.0850838107362615,
      "grad_norm": 0.6629524920687851,
      "learning_rate": 4.901587079240847e-05,
      "loss": 1.806,
      "num_input_tokens_seen": 8047042112,
      "step": 10228
    },
    {
      "epoch": 1.0851899002758327,
      "grad_norm": 0.6742148320191157,
      "learning_rate": 4.9015677710934224e-05,
      "loss": 1.8097,
      "num_input_tokens_seen": 8047828912,
      "step": 10229
    },
    {
      "epoch": 1.0852959898154042,
      "grad_norm": 0.40525917957682356,
      "learning_rate": 4.9015484610901366e-05,
      "loss": 1.8326,
      "num_input_tokens_seen": 8048615712,
      "step": 10230
    },
    {
      "epoch": 1.0854020793549757,
      "grad_norm": 0.9636934076529858,
      "learning_rate": 4.9015291492310044e-05,
      "loss": 2.0238,
      "num_input_tokens_seen": 8049402384,
      "step": 10231
    },
    {
      "epoch": 1.085508168894547,
      "grad_norm": 0.4090670824190659,
      "learning_rate": 4.901509835516042e-05,
      "loss": 1.6449,
      "num_input_tokens_seen": 8050189120,
      "step": 10232
    },
    {
      "epoch": 1.0856142584341184,
      "grad_norm": 0.7377881078757991,
      "learning_rate": 4.901490519945262e-05,
      "loss": 1.728,
      "num_input_tokens_seen": 8050975888,
      "step": 10233
    },
    {
      "epoch": 1.0857203479736899,
      "grad_norm": 0.4856538550403671,
      "learning_rate": 4.901471202518681e-05,
      "loss": 1.8795,
      "num_input_tokens_seen": 8051762672,
      "step": 10234
    },
    {
      "epoch": 1.0858264375132611,
      "grad_norm": 0.800173789500677,
      "learning_rate": 4.9014518832363135e-05,
      "loss": 1.7299,
      "num_input_tokens_seen": 8052549424,
      "step": 10235
    },
    {
      "epoch": 1.0859325270528326,
      "grad_norm": 0.6536724720743303,
      "learning_rate": 4.901432562098175e-05,
      "loss": 1.9065,
      "num_input_tokens_seen": 8053336080,
      "step": 10236
    },
    {
      "epoch": 1.086038616592404,
      "grad_norm": 0.8518737708248679,
      "learning_rate": 4.9014132391042785e-05,
      "loss": 1.8279,
      "num_input_tokens_seen": 8054122880,
      "step": 10237
    },
    {
      "epoch": 1.0861447061319753,
      "grad_norm": 0.7106386253394326,
      "learning_rate": 4.901393914254642e-05,
      "loss": 1.9112,
      "num_input_tokens_seen": 8054909648,
      "step": 10238
    },
    {
      "epoch": 1.0862507956715468,
      "grad_norm": 0.688810985810491,
      "learning_rate": 4.901374587549278e-05,
      "loss": 1.7822,
      "num_input_tokens_seen": 8055696416,
      "step": 10239
    },
    {
      "epoch": 1.0863568852111183,
      "grad_norm": 0.5754545964266496,
      "learning_rate": 4.9013552589882015e-05,
      "loss": 1.9005,
      "num_input_tokens_seen": 8056483184,
      "step": 10240
    },
    {
      "epoch": 1.0864629747506895,
      "grad_norm": 0.6959348371460793,
      "learning_rate": 4.901335928571429e-05,
      "loss": 1.7771,
      "num_input_tokens_seen": 8057269936,
      "step": 10241
    },
    {
      "epoch": 1.086569064290261,
      "grad_norm": 0.42741329935043154,
      "learning_rate": 4.901316596298974e-05,
      "loss": 1.994,
      "num_input_tokens_seen": 8058056688,
      "step": 10242
    },
    {
      "epoch": 1.0866751538298325,
      "grad_norm": 0.6779824721508042,
      "learning_rate": 4.901297262170853e-05,
      "loss": 1.8945,
      "num_input_tokens_seen": 8058843408,
      "step": 10243
    },
    {
      "epoch": 1.0867812433694037,
      "grad_norm": 0.4501462360274451,
      "learning_rate": 4.901277926187079e-05,
      "loss": 1.8756,
      "num_input_tokens_seen": 8059630096,
      "step": 10244
    },
    {
      "epoch": 1.0868873329089752,
      "grad_norm": 0.49806664632769543,
      "learning_rate": 4.901258588347668e-05,
      "loss": 1.9643,
      "num_input_tokens_seen": 8060416832,
      "step": 10245
    },
    {
      "epoch": 1.0869934224485465,
      "grad_norm": 0.5177986541565245,
      "learning_rate": 4.901239248652635e-05,
      "loss": 1.7893,
      "num_input_tokens_seen": 8061203616,
      "step": 10246
    },
    {
      "epoch": 1.087099511988118,
      "grad_norm": 0.44424062560285343,
      "learning_rate": 4.901219907101995e-05,
      "loss": 1.6744,
      "num_input_tokens_seen": 8061990400,
      "step": 10247
    },
    {
      "epoch": 1.0872056015276894,
      "grad_norm": 0.9378589444077848,
      "learning_rate": 4.901200563695763e-05,
      "loss": 1.7853,
      "num_input_tokens_seen": 8062777088,
      "step": 10248
    },
    {
      "epoch": 1.0873116910672607,
      "grad_norm": 0.6835674693011148,
      "learning_rate": 4.901181218433952e-05,
      "loss": 1.8163,
      "num_input_tokens_seen": 8063563824,
      "step": 10249
    },
    {
      "epoch": 1.0874177806068321,
      "grad_norm": 0.9988050574102191,
      "learning_rate": 4.90116187131658e-05,
      "loss": 1.8036,
      "num_input_tokens_seen": 8064350512,
      "step": 10250
    },
    {
      "epoch": 1.0875238701464036,
      "grad_norm": 0.8518435278854359,
      "learning_rate": 4.90114252234366e-05,
      "loss": 1.865,
      "num_input_tokens_seen": 8065137280,
      "step": 10251
    },
    {
      "epoch": 1.0876299596859749,
      "grad_norm": 1.1924109018960467,
      "learning_rate": 4.9011231715152087e-05,
      "loss": 1.7912,
      "num_input_tokens_seen": 8065923984,
      "step": 10252
    },
    {
      "epoch": 1.0877360492255463,
      "grad_norm": 1.1098620698007897,
      "learning_rate": 4.9011038188312385e-05,
      "loss": 1.8837,
      "num_input_tokens_seen": 8066710720,
      "step": 10253
    },
    {
      "epoch": 1.0878421387651178,
      "grad_norm": 1.2091271427177976,
      "learning_rate": 4.901084464291766e-05,
      "loss": 1.7266,
      "num_input_tokens_seen": 8067497408,
      "step": 10254
    },
    {
      "epoch": 1.087948228304689,
      "grad_norm": 0.8864033492322185,
      "learning_rate": 4.901065107896806e-05,
      "loss": 1.8308,
      "num_input_tokens_seen": 8068284208,
      "step": 10255
    },
    {
      "epoch": 1.0880543178442605,
      "grad_norm": 1.738223369205198,
      "learning_rate": 4.9010457496463734e-05,
      "loss": 1.7028,
      "num_input_tokens_seen": 8069070912,
      "step": 10256
    },
    {
      "epoch": 1.088160407383832,
      "grad_norm": 0.666544934357973,
      "learning_rate": 4.901026389540483e-05,
      "loss": 1.7499,
      "num_input_tokens_seen": 8069857776,
      "step": 10257
    },
    {
      "epoch": 1.0882664969234033,
      "grad_norm": 1.05832371089953,
      "learning_rate": 4.90100702757915e-05,
      "loss": 1.8065,
      "num_input_tokens_seen": 8070644624,
      "step": 10258
    },
    {
      "epoch": 1.0883725864629747,
      "grad_norm": 0.5398856811836791,
      "learning_rate": 4.900987663762389e-05,
      "loss": 1.7182,
      "num_input_tokens_seen": 8071431472,
      "step": 10259
    },
    {
      "epoch": 1.0884786760025462,
      "grad_norm": 2.733793672599934,
      "learning_rate": 4.900968298090216e-05,
      "loss": 1.8517,
      "num_input_tokens_seen": 8072218176,
      "step": 10260
    },
    {
      "epoch": 1.0885847655421175,
      "grad_norm": 0.46829044213206134,
      "learning_rate": 4.900948930562644e-05,
      "loss": 1.6336,
      "num_input_tokens_seen": 8073005024,
      "step": 10261
    },
    {
      "epoch": 1.088690855081689,
      "grad_norm": 4.849898226820334,
      "learning_rate": 4.900929561179689e-05,
      "loss": 1.8094,
      "num_input_tokens_seen": 8073791872,
      "step": 10262
    },
    {
      "epoch": 1.0887969446212604,
      "grad_norm": 1.1553462486100399,
      "learning_rate": 4.900910189941367e-05,
      "loss": 1.8128,
      "num_input_tokens_seen": 8074578544,
      "step": 10263
    },
    {
      "epoch": 1.0889030341608317,
      "grad_norm": 1.0151829715255116,
      "learning_rate": 4.900890816847692e-05,
      "loss": 1.814,
      "num_input_tokens_seen": 8075365216,
      "step": 10264
    },
    {
      "epoch": 1.0890091237004031,
      "grad_norm": 0.8097581682673488,
      "learning_rate": 4.900871441898679e-05,
      "loss": 1.87,
      "num_input_tokens_seen": 8076151904,
      "step": 10265
    },
    {
      "epoch": 1.0891152132399746,
      "grad_norm": 1.0705076718959687,
      "learning_rate": 4.900852065094342e-05,
      "loss": 1.8193,
      "num_input_tokens_seen": 8076938624,
      "step": 10266
    },
    {
      "epoch": 1.0892213027795459,
      "grad_norm": 0.6304552449346938,
      "learning_rate": 4.900832686434698e-05,
      "loss": 1.8189,
      "num_input_tokens_seen": 8077725392,
      "step": 10267
    },
    {
      "epoch": 1.0893273923191173,
      "grad_norm": 1.0314612400063836,
      "learning_rate": 4.90081330591976e-05,
      "loss": 1.8907,
      "num_input_tokens_seen": 8078512096,
      "step": 10268
    },
    {
      "epoch": 1.0894334818586888,
      "grad_norm": 0.7128010825645325,
      "learning_rate": 4.9007939235495456e-05,
      "loss": 1.8055,
      "num_input_tokens_seen": 8079298848,
      "step": 10269
    },
    {
      "epoch": 1.08953957139826,
      "grad_norm": 1.0450533526911316,
      "learning_rate": 4.900774539324067e-05,
      "loss": 1.7331,
      "num_input_tokens_seen": 8080085584,
      "step": 10270
    },
    {
      "epoch": 1.0896456609378316,
      "grad_norm": 0.6469475565977872,
      "learning_rate": 4.9007551532433405e-05,
      "loss": 1.8152,
      "num_input_tokens_seen": 8080872272,
      "step": 10271
    },
    {
      "epoch": 1.089751750477403,
      "grad_norm": 0.7019286960614259,
      "learning_rate": 4.9007357653073804e-05,
      "loss": 1.8145,
      "num_input_tokens_seen": 8081659008,
      "step": 10272
    },
    {
      "epoch": 1.0898578400169743,
      "grad_norm": 0.6160253489240701,
      "learning_rate": 4.9007163755162025e-05,
      "loss": 1.6399,
      "num_input_tokens_seen": 8082445888,
      "step": 10273
    },
    {
      "epoch": 1.0899639295565458,
      "grad_norm": 0.47234038139236023,
      "learning_rate": 4.900696983869821e-05,
      "loss": 1.751,
      "num_input_tokens_seen": 8083232672,
      "step": 10274
    },
    {
      "epoch": 1.0900700190961172,
      "grad_norm": 0.7938194054556932,
      "learning_rate": 4.900677590368252e-05,
      "loss": 1.6803,
      "num_input_tokens_seen": 8084019504,
      "step": 10275
    },
    {
      "epoch": 1.0901761086356885,
      "grad_norm": 0.6304823509369161,
      "learning_rate": 4.9006581950115096e-05,
      "loss": 1.9229,
      "num_input_tokens_seen": 8084806320,
      "step": 10276
    },
    {
      "epoch": 1.09028219817526,
      "grad_norm": 0.6164998320514204,
      "learning_rate": 4.900638797799609e-05,
      "loss": 1.9264,
      "num_input_tokens_seen": 8085593024,
      "step": 10277
    },
    {
      "epoch": 1.0903882877148314,
      "grad_norm": 0.4755995804836436,
      "learning_rate": 4.9006193987325645e-05,
      "loss": 1.7877,
      "num_input_tokens_seen": 8086379824,
      "step": 10278
    },
    {
      "epoch": 1.0904943772544027,
      "grad_norm": 0.45674796077937074,
      "learning_rate": 4.9005999978103925e-05,
      "loss": 1.8104,
      "num_input_tokens_seen": 8087166464,
      "step": 10279
    },
    {
      "epoch": 1.0906004667939742,
      "grad_norm": 0.5180022821009438,
      "learning_rate": 4.900580595033107e-05,
      "loss": 1.8535,
      "num_input_tokens_seen": 8087953248,
      "step": 10280
    },
    {
      "epoch": 1.0907065563335454,
      "grad_norm": 0.4042017729920368,
      "learning_rate": 4.900561190400723e-05,
      "loss": 1.7789,
      "num_input_tokens_seen": 8088740096,
      "step": 10281
    },
    {
      "epoch": 1.0908126458731169,
      "grad_norm": 0.5059005512046423,
      "learning_rate": 4.9005417839132566e-05,
      "loss": 2.0422,
      "num_input_tokens_seen": 8089526784,
      "step": 10282
    },
    {
      "epoch": 1.0909187354126884,
      "grad_norm": 0.465287669123627,
      "learning_rate": 4.9005223755707216e-05,
      "loss": 1.8129,
      "num_input_tokens_seen": 8090313472,
      "step": 10283
    },
    {
      "epoch": 1.0910248249522596,
      "grad_norm": 0.5753176549665169,
      "learning_rate": 4.900502965373133e-05,
      "loss": 1.726,
      "num_input_tokens_seen": 8091100208,
      "step": 10284
    },
    {
      "epoch": 1.091130914491831,
      "grad_norm": 0.3757988263366065,
      "learning_rate": 4.900483553320506e-05,
      "loss": 1.8445,
      "num_input_tokens_seen": 8091886912,
      "step": 10285
    },
    {
      "epoch": 1.0912370040314026,
      "grad_norm": 0.5413203648782994,
      "learning_rate": 4.9004641394128564e-05,
      "loss": 1.9519,
      "num_input_tokens_seen": 8092673712,
      "step": 10286
    },
    {
      "epoch": 1.0913430935709738,
      "grad_norm": 0.4343587263438702,
      "learning_rate": 4.900444723650198e-05,
      "loss": 1.6837,
      "num_input_tokens_seen": 8093460528,
      "step": 10287
    },
    {
      "epoch": 1.0914491831105453,
      "grad_norm": 0.3970515393304812,
      "learning_rate": 4.900425306032547e-05,
      "loss": 1.7168,
      "num_input_tokens_seen": 8094247264,
      "step": 10288
    },
    {
      "epoch": 1.0915552726501168,
      "grad_norm": 0.4597326610611579,
      "learning_rate": 4.900405886559917e-05,
      "loss": 1.8373,
      "num_input_tokens_seen": 8095034016,
      "step": 10289
    },
    {
      "epoch": 1.091661362189688,
      "grad_norm": 0.3623724064075428,
      "learning_rate": 4.900386465232324e-05,
      "loss": 1.6471,
      "num_input_tokens_seen": 8095820832,
      "step": 10290
    },
    {
      "epoch": 1.0917674517292595,
      "grad_norm": 0.40639378753780475,
      "learning_rate": 4.900367042049783e-05,
      "loss": 1.9076,
      "num_input_tokens_seen": 8096607552,
      "step": 10291
    },
    {
      "epoch": 1.091873541268831,
      "grad_norm": 0.3726715514163631,
      "learning_rate": 4.9003476170123085e-05,
      "loss": 1.7907,
      "num_input_tokens_seen": 8097394336,
      "step": 10292
    },
    {
      "epoch": 1.0919796308084022,
      "grad_norm": 0.5071278196727348,
      "learning_rate": 4.900328190119916e-05,
      "loss": 1.8368,
      "num_input_tokens_seen": 8098181088,
      "step": 10293
    },
    {
      "epoch": 1.0920857203479737,
      "grad_norm": 0.38558708390351,
      "learning_rate": 4.900308761372621e-05,
      "loss": 1.8282,
      "num_input_tokens_seen": 8098967808,
      "step": 10294
    },
    {
      "epoch": 1.0921918098875452,
      "grad_norm": 0.37570641674104305,
      "learning_rate": 4.900289330770437e-05,
      "loss": 1.7944,
      "num_input_tokens_seen": 8099754576,
      "step": 10295
    },
    {
      "epoch": 1.0922978994271164,
      "grad_norm": 0.37405591295623736,
      "learning_rate": 4.9002698983133793e-05,
      "loss": 1.8755,
      "num_input_tokens_seen": 8100541408,
      "step": 10296
    },
    {
      "epoch": 1.0924039889666879,
      "grad_norm": 0.44127465670048993,
      "learning_rate": 4.900250464001464e-05,
      "loss": 1.8565,
      "num_input_tokens_seen": 8101328176,
      "step": 10297
    },
    {
      "epoch": 1.0925100785062594,
      "grad_norm": 0.35879866177409603,
      "learning_rate": 4.900231027834705e-05,
      "loss": 1.7511,
      "num_input_tokens_seen": 8102114960,
      "step": 10298
    },
    {
      "epoch": 1.0926161680458306,
      "grad_norm": 0.38400449657850894,
      "learning_rate": 4.900211589813119e-05,
      "loss": 1.7732,
      "num_input_tokens_seen": 8102901760,
      "step": 10299
    },
    {
      "epoch": 1.092722257585402,
      "grad_norm": 0.4996721018080221,
      "learning_rate": 4.90019214993672e-05,
      "loss": 1.8262,
      "num_input_tokens_seen": 8103688592,
      "step": 10300
    },
    {
      "epoch": 1.0928283471249736,
      "grad_norm": 0.40988493016879757,
      "learning_rate": 4.9001727082055215e-05,
      "loss": 1.9368,
      "num_input_tokens_seen": 8104475376,
      "step": 10301
    },
    {
      "epoch": 1.0929344366645448,
      "grad_norm": 0.4273162995665026,
      "learning_rate": 4.9001532646195414e-05,
      "loss": 1.6992,
      "num_input_tokens_seen": 8105262192,
      "step": 10302
    },
    {
      "epoch": 1.0930405262041163,
      "grad_norm": 0.6816740946257356,
      "learning_rate": 4.900133819178793e-05,
      "loss": 1.8576,
      "num_input_tokens_seen": 8106048896,
      "step": 10303
    },
    {
      "epoch": 1.0931466157436878,
      "grad_norm": 0.4500148333552327,
      "learning_rate": 4.900114371883291e-05,
      "loss": 1.874,
      "num_input_tokens_seen": 8106835600,
      "step": 10304
    },
    {
      "epoch": 1.093252705283259,
      "grad_norm": 0.43985425693877256,
      "learning_rate": 4.9000949227330505e-05,
      "loss": 1.8306,
      "num_input_tokens_seen": 8107622352,
      "step": 10305
    },
    {
      "epoch": 1.0933587948228305,
      "grad_norm": 0.5144421510999923,
      "learning_rate": 4.9000754717280884e-05,
      "loss": 1.8826,
      "num_input_tokens_seen": 8108409104,
      "step": 10306
    },
    {
      "epoch": 1.093464884362402,
      "grad_norm": 0.3960277697387637,
      "learning_rate": 4.9000560188684175e-05,
      "loss": 1.677,
      "num_input_tokens_seen": 8109195856,
      "step": 10307
    },
    {
      "epoch": 1.0935709739019732,
      "grad_norm": 0.43939723396250935,
      "learning_rate": 4.900036564154055e-05,
      "loss": 1.8132,
      "num_input_tokens_seen": 8109982608,
      "step": 10308
    },
    {
      "epoch": 1.0936770634415447,
      "grad_norm": 0.5416522948848552,
      "learning_rate": 4.900017107585013e-05,
      "loss": 1.7701,
      "num_input_tokens_seen": 8110769472,
      "step": 10309
    },
    {
      "epoch": 1.093783152981116,
      "grad_norm": 0.43400831819699603,
      "learning_rate": 4.899997649161309e-05,
      "loss": 1.8475,
      "num_input_tokens_seen": 8111556240,
      "step": 10310
    },
    {
      "epoch": 1.0938892425206874,
      "grad_norm": 0.5348939887329325,
      "learning_rate": 4.899978188882958e-05,
      "loss": 1.7947,
      "num_input_tokens_seen": 8112343136,
      "step": 10311
    },
    {
      "epoch": 1.093995332060259,
      "grad_norm": 0.34462080515047455,
      "learning_rate": 4.899958726749972e-05,
      "loss": 1.7762,
      "num_input_tokens_seen": 8113129904,
      "step": 10312
    },
    {
      "epoch": 1.0941014215998304,
      "grad_norm": 0.4642893693353588,
      "learning_rate": 4.899939262762371e-05,
      "loss": 1.7883,
      "num_input_tokens_seen": 8113916656,
      "step": 10313
    },
    {
      "epoch": 1.0942075111394016,
      "grad_norm": 0.40563723674748764,
      "learning_rate": 4.899919796920166e-05,
      "loss": 1.8928,
      "num_input_tokens_seen": 8114703376,
      "step": 10314
    },
    {
      "epoch": 1.094313600678973,
      "grad_norm": 0.3589868300568629,
      "learning_rate": 4.899900329223374e-05,
      "loss": 1.7647,
      "num_input_tokens_seen": 8115490208,
      "step": 10315
    },
    {
      "epoch": 1.0944196902185443,
      "grad_norm": 0.3773669558583494,
      "learning_rate": 4.899880859672008e-05,
      "loss": 1.8273,
      "num_input_tokens_seen": 8116276992,
      "step": 10316
    },
    {
      "epoch": 1.0945257797581158,
      "grad_norm": 0.5312993562437078,
      "learning_rate": 4.899861388266086e-05,
      "loss": 1.7607,
      "num_input_tokens_seen": 8117063728,
      "step": 10317
    },
    {
      "epoch": 1.0946318692976873,
      "grad_norm": 0.4083365489199895,
      "learning_rate": 4.899841915005621e-05,
      "loss": 1.7733,
      "num_input_tokens_seen": 8117850480,
      "step": 10318
    },
    {
      "epoch": 1.0947379588372586,
      "grad_norm": 0.4552534495855857,
      "learning_rate": 4.8998224398906284e-05,
      "loss": 1.7365,
      "num_input_tokens_seen": 8118637232,
      "step": 10319
    },
    {
      "epoch": 1.09484404837683,
      "grad_norm": 0.41343415771700925,
      "learning_rate": 4.899802962921124e-05,
      "loss": 1.888,
      "num_input_tokens_seen": 8119424000,
      "step": 10320
    },
    {
      "epoch": 1.0949501379164015,
      "grad_norm": 0.5265271179814581,
      "learning_rate": 4.8997834840971214e-05,
      "loss": 1.8317,
      "num_input_tokens_seen": 8120210800,
      "step": 10321
    },
    {
      "epoch": 1.0950562274559728,
      "grad_norm": 0.41184665866533354,
      "learning_rate": 4.8997640034186374e-05,
      "loss": 1.7644,
      "num_input_tokens_seen": 8120997440,
      "step": 10322
    },
    {
      "epoch": 1.0951623169955442,
      "grad_norm": 0.5019291711623873,
      "learning_rate": 4.899744520885686e-05,
      "loss": 1.73,
      "num_input_tokens_seen": 8121784160,
      "step": 10323
    },
    {
      "epoch": 1.0952684065351157,
      "grad_norm": 0.5453413623449632,
      "learning_rate": 4.899725036498281e-05,
      "loss": 1.8955,
      "num_input_tokens_seen": 8122570912,
      "step": 10324
    },
    {
      "epoch": 1.095374496074687,
      "grad_norm": 0.39339521769907676,
      "learning_rate": 4.8997055502564416e-05,
      "loss": 1.8791,
      "num_input_tokens_seen": 8123357616,
      "step": 10325
    },
    {
      "epoch": 1.0954805856142584,
      "grad_norm": 0.4232148226163894,
      "learning_rate": 4.899686062160178e-05,
      "loss": 1.8374,
      "num_input_tokens_seen": 8124144352,
      "step": 10326
    },
    {
      "epoch": 1.09558667515383,
      "grad_norm": 0.39242172718948576,
      "learning_rate": 4.899666572209509e-05,
      "loss": 1.7206,
      "num_input_tokens_seen": 8124931168,
      "step": 10327
    },
    {
      "epoch": 1.0956927646934012,
      "grad_norm": 0.4434104620066857,
      "learning_rate": 4.899647080404447e-05,
      "loss": 1.9201,
      "num_input_tokens_seen": 8125717920,
      "step": 10328
    },
    {
      "epoch": 1.0957988542329726,
      "grad_norm": 0.4425876930272251,
      "learning_rate": 4.899627586745008e-05,
      "loss": 1.7212,
      "num_input_tokens_seen": 8126504720,
      "step": 10329
    },
    {
      "epoch": 1.095904943772544,
      "grad_norm": 0.3546748974649768,
      "learning_rate": 4.8996080912312084e-05,
      "loss": 1.6604,
      "num_input_tokens_seen": 8127291584,
      "step": 10330
    },
    {
      "epoch": 1.0960110333121154,
      "grad_norm": 0.382084813384653,
      "learning_rate": 4.899588593863061e-05,
      "loss": 1.75,
      "num_input_tokens_seen": 8128078368,
      "step": 10331
    },
    {
      "epoch": 1.0961171228516868,
      "grad_norm": 0.4486597556755628,
      "learning_rate": 4.899569094640582e-05,
      "loss": 1.8586,
      "num_input_tokens_seen": 8128865168,
      "step": 10332
    },
    {
      "epoch": 1.0962232123912583,
      "grad_norm": 0.37921408686565883,
      "learning_rate": 4.899549593563787e-05,
      "loss": 1.8297,
      "num_input_tokens_seen": 8129651920,
      "step": 10333
    },
    {
      "epoch": 1.0963293019308296,
      "grad_norm": 0.4836059870731781,
      "learning_rate": 4.89953009063269e-05,
      "loss": 1.8154,
      "num_input_tokens_seen": 8130438736,
      "step": 10334
    },
    {
      "epoch": 1.096435391470401,
      "grad_norm": 0.4805825869681674,
      "learning_rate": 4.8995105858473064e-05,
      "loss": 1.7258,
      "num_input_tokens_seen": 8131225504,
      "step": 10335
    },
    {
      "epoch": 1.0965414810099725,
      "grad_norm": 0.5070251883397551,
      "learning_rate": 4.899491079207652e-05,
      "loss": 1.9527,
      "num_input_tokens_seen": 8132012112,
      "step": 10336
    },
    {
      "epoch": 1.0966475705495438,
      "grad_norm": 0.3514083565940503,
      "learning_rate": 4.899471570713741e-05,
      "loss": 1.7477,
      "num_input_tokens_seen": 8132798944,
      "step": 10337
    },
    {
      "epoch": 1.0967536600891152,
      "grad_norm": 0.5664003643036924,
      "learning_rate": 4.899452060365589e-05,
      "loss": 1.7775,
      "num_input_tokens_seen": 8133585616,
      "step": 10338
    },
    {
      "epoch": 1.0968597496286867,
      "grad_norm": 0.43706403885113304,
      "learning_rate": 4.89943254816321e-05,
      "loss": 1.7493,
      "num_input_tokens_seen": 8134372272,
      "step": 10339
    },
    {
      "epoch": 1.096965839168258,
      "grad_norm": 0.5532751258177981,
      "learning_rate": 4.8994130341066206e-05,
      "loss": 1.847,
      "num_input_tokens_seen": 8135158960,
      "step": 10340
    },
    {
      "epoch": 1.0970719287078294,
      "grad_norm": 0.506852783800604,
      "learning_rate": 4.899393518195836e-05,
      "loss": 1.9444,
      "num_input_tokens_seen": 8135945712,
      "step": 10341
    },
    {
      "epoch": 1.097178018247401,
      "grad_norm": 0.42463710866767757,
      "learning_rate": 4.899374000430869e-05,
      "loss": 1.694,
      "num_input_tokens_seen": 8136732512,
      "step": 10342
    },
    {
      "epoch": 1.0972841077869722,
      "grad_norm": 0.4857015117549841,
      "learning_rate": 4.899354480811737e-05,
      "loss": 1.814,
      "num_input_tokens_seen": 8137519360,
      "step": 10343
    },
    {
      "epoch": 1.0973901973265436,
      "grad_norm": 0.49104350262695423,
      "learning_rate": 4.899334959338454e-05,
      "loss": 1.7735,
      "num_input_tokens_seen": 8138306240,
      "step": 10344
    },
    {
      "epoch": 1.097496286866115,
      "grad_norm": 0.4262785371485126,
      "learning_rate": 4.8993154360110357e-05,
      "loss": 1.8271,
      "num_input_tokens_seen": 8139092992,
      "step": 10345
    },
    {
      "epoch": 1.0976023764056864,
      "grad_norm": 0.5507399963464128,
      "learning_rate": 4.899295910829497e-05,
      "loss": 1.7522,
      "num_input_tokens_seen": 8139879760,
      "step": 10346
    },
    {
      "epoch": 1.0977084659452578,
      "grad_norm": 0.43128143640889316,
      "learning_rate": 4.899276383793852e-05,
      "loss": 1.8741,
      "num_input_tokens_seen": 8140666512,
      "step": 10347
    },
    {
      "epoch": 1.0978145554848293,
      "grad_norm": 0.4311636248557768,
      "learning_rate": 4.899256854904117e-05,
      "loss": 1.737,
      "num_input_tokens_seen": 8141453264,
      "step": 10348
    },
    {
      "epoch": 1.0979206450244006,
      "grad_norm": 0.5400612340498614,
      "learning_rate": 4.8992373241603065e-05,
      "loss": 1.8838,
      "num_input_tokens_seen": 8142240016,
      "step": 10349
    },
    {
      "epoch": 1.098026734563972,
      "grad_norm": 0.41634917374291674,
      "learning_rate": 4.899217791562436e-05,
      "loss": 1.7793,
      "num_input_tokens_seen": 8143026816,
      "step": 10350
    },
    {
      "epoch": 1.0981328241035433,
      "grad_norm": 0.4673991389289524,
      "learning_rate": 4.899198257110521e-05,
      "loss": 1.7744,
      "num_input_tokens_seen": 8143813696,
      "step": 10351
    },
    {
      "epoch": 1.0982389136431148,
      "grad_norm": 0.6647092186384196,
      "learning_rate": 4.8991787208045744e-05,
      "loss": 1.6994,
      "num_input_tokens_seen": 8144600400,
      "step": 10352
    },
    {
      "epoch": 1.0983450031826862,
      "grad_norm": 0.500421379676374,
      "learning_rate": 4.8991591826446146e-05,
      "loss": 1.9726,
      "num_input_tokens_seen": 8145387136,
      "step": 10353
    },
    {
      "epoch": 1.0984510927222575,
      "grad_norm": 0.5425834063254117,
      "learning_rate": 4.899139642630654e-05,
      "loss": 1.6872,
      "num_input_tokens_seen": 8146173952,
      "step": 10354
    },
    {
      "epoch": 1.098557182261829,
      "grad_norm": 0.6749898509859715,
      "learning_rate": 4.899120100762709e-05,
      "loss": 1.9463,
      "num_input_tokens_seen": 8146960608,
      "step": 10355
    },
    {
      "epoch": 1.0986632718014004,
      "grad_norm": 0.5255692128528875,
      "learning_rate": 4.8991005570407944e-05,
      "loss": 1.8137,
      "num_input_tokens_seen": 8147747488,
      "step": 10356
    },
    {
      "epoch": 1.0987693613409717,
      "grad_norm": 0.9184084212641523,
      "learning_rate": 4.899081011464925e-05,
      "loss": 1.8836,
      "num_input_tokens_seen": 8148534192,
      "step": 10357
    },
    {
      "epoch": 1.0988754508805432,
      "grad_norm": 0.5937910478204653,
      "learning_rate": 4.8990614640351165e-05,
      "loss": 1.782,
      "num_input_tokens_seen": 8149320928,
      "step": 10358
    },
    {
      "epoch": 1.0989815404201146,
      "grad_norm": 0.6917665391475958,
      "learning_rate": 4.8990419147513833e-05,
      "loss": 1.6687,
      "num_input_tokens_seen": 8150107648,
      "step": 10359
    },
    {
      "epoch": 1.099087629959686,
      "grad_norm": 0.559581069185732,
      "learning_rate": 4.899022363613741e-05,
      "loss": 1.8711,
      "num_input_tokens_seen": 8150894368,
      "step": 10360
    },
    {
      "epoch": 1.0991937194992574,
      "grad_norm": 0.6685656035865781,
      "learning_rate": 4.899002810622205e-05,
      "loss": 1.9806,
      "num_input_tokens_seen": 8151681168,
      "step": 10361
    },
    {
      "epoch": 1.0992998090388288,
      "grad_norm": 0.5414841115417965,
      "learning_rate": 4.89898325577679e-05,
      "loss": 2.1466,
      "num_input_tokens_seen": 8152467856,
      "step": 10362
    },
    {
      "epoch": 1.0994058985784,
      "grad_norm": 0.8217753328573426,
      "learning_rate": 4.8989636990775104e-05,
      "loss": 1.8488,
      "num_input_tokens_seen": 8153254576,
      "step": 10363
    },
    {
      "epoch": 1.0995119881179716,
      "grad_norm": 0.6410688296194919,
      "learning_rate": 4.898944140524383e-05,
      "loss": 1.8687,
      "num_input_tokens_seen": 8154041456,
      "step": 10364
    },
    {
      "epoch": 1.099618077657543,
      "grad_norm": 0.637872949613589,
      "learning_rate": 4.898924580117421e-05,
      "loss": 1.6923,
      "num_input_tokens_seen": 8154828288,
      "step": 10365
    },
    {
      "epoch": 1.0997241671971143,
      "grad_norm": 1.1034145343989372,
      "learning_rate": 4.8989050178566415e-05,
      "loss": 1.9247,
      "num_input_tokens_seen": 8155615072,
      "step": 10366
    },
    {
      "epoch": 1.0998302567366858,
      "grad_norm": 0.7057967907911997,
      "learning_rate": 4.898885453742058e-05,
      "loss": 1.9301,
      "num_input_tokens_seen": 8156401792,
      "step": 10367
    },
    {
      "epoch": 1.0999363462762572,
      "grad_norm": 0.7912287183579806,
      "learning_rate": 4.898865887773686e-05,
      "loss": 1.8881,
      "num_input_tokens_seen": 8157188368,
      "step": 10368
    },
    {
      "epoch": 1.1000424358158285,
      "grad_norm": 0.539826671737876,
      "learning_rate": 4.898846319951541e-05,
      "loss": 1.8011,
      "num_input_tokens_seen": 8157975136,
      "step": 10369
    },
    {
      "epoch": 1.1001485253554,
      "grad_norm": 0.6957287199586861,
      "learning_rate": 4.898826750275639e-05,
      "loss": 1.8207,
      "num_input_tokens_seen": 8158761904,
      "step": 10370
    },
    {
      "epoch": 1.1002546148949714,
      "grad_norm": 0.5347251905658467,
      "learning_rate": 4.898807178745992e-05,
      "loss": 1.774,
      "num_input_tokens_seen": 8159548688,
      "step": 10371
    },
    {
      "epoch": 1.1003607044345427,
      "grad_norm": 0.6596447562848845,
      "learning_rate": 4.898787605362619e-05,
      "loss": 1.8401,
      "num_input_tokens_seen": 8160335424,
      "step": 10372
    },
    {
      "epoch": 1.1004667939741142,
      "grad_norm": 0.9208291388959561,
      "learning_rate": 4.898768030125532e-05,
      "loss": 1.7852,
      "num_input_tokens_seen": 8161122192,
      "step": 10373
    },
    {
      "epoch": 1.1005728835136857,
      "grad_norm": 0.6356135472988196,
      "learning_rate": 4.898748453034749e-05,
      "loss": 1.8229,
      "num_input_tokens_seen": 8161908944,
      "step": 10374
    },
    {
      "epoch": 1.100678973053257,
      "grad_norm": 0.5885131102825832,
      "learning_rate": 4.898728874090283e-05,
      "loss": 1.8192,
      "num_input_tokens_seen": 8162695696,
      "step": 10375
    },
    {
      "epoch": 1.1007850625928284,
      "grad_norm": 0.5741289508651052,
      "learning_rate": 4.898709293292149e-05,
      "loss": 1.9543,
      "num_input_tokens_seen": 8163482432,
      "step": 10376
    },
    {
      "epoch": 1.1008911521323999,
      "grad_norm": 0.45396289750937313,
      "learning_rate": 4.898689710640363e-05,
      "loss": 1.7976,
      "num_input_tokens_seen": 8164269264,
      "step": 10377
    },
    {
      "epoch": 1.100997241671971,
      "grad_norm": 0.45389399176917655,
      "learning_rate": 4.89867012613494e-05,
      "loss": 1.8378,
      "num_input_tokens_seen": 8165056176,
      "step": 10378
    },
    {
      "epoch": 1.1011033312115426,
      "grad_norm": 0.5523151164109995,
      "learning_rate": 4.898650539775895e-05,
      "loss": 1.8127,
      "num_input_tokens_seen": 8165842944,
      "step": 10379
    },
    {
      "epoch": 1.1012094207511138,
      "grad_norm": 0.49249147480540895,
      "learning_rate": 4.8986309515632445e-05,
      "loss": 1.8411,
      "num_input_tokens_seen": 8166629680,
      "step": 10380
    },
    {
      "epoch": 1.1013155102906853,
      "grad_norm": 0.5181672304338374,
      "learning_rate": 4.898611361497001e-05,
      "loss": 1.8168,
      "num_input_tokens_seen": 8167416432,
      "step": 10381
    },
    {
      "epoch": 1.1014215998302568,
      "grad_norm": 0.48359440754513966,
      "learning_rate": 4.898591769577182e-05,
      "loss": 1.7641,
      "num_input_tokens_seen": 8168203248,
      "step": 10382
    },
    {
      "epoch": 1.101527689369828,
      "grad_norm": 0.5366084022372933,
      "learning_rate": 4.8985721758038006e-05,
      "loss": 1.8957,
      "num_input_tokens_seen": 8168990000,
      "step": 10383
    },
    {
      "epoch": 1.1016337789093995,
      "grad_norm": 0.4168247313150317,
      "learning_rate": 4.898552580176874e-05,
      "loss": 1.7916,
      "num_input_tokens_seen": 8169776800,
      "step": 10384
    },
    {
      "epoch": 1.101739868448971,
      "grad_norm": 0.5439494060631869,
      "learning_rate": 4.8985329826964154e-05,
      "loss": 1.8256,
      "num_input_tokens_seen": 8170563440,
      "step": 10385
    },
    {
      "epoch": 1.1018459579885422,
      "grad_norm": 0.531677326909414,
      "learning_rate": 4.898513383362441e-05,
      "loss": 1.7879,
      "num_input_tokens_seen": 8171350352,
      "step": 10386
    },
    {
      "epoch": 1.1019520475281137,
      "grad_norm": 0.5530397661599523,
      "learning_rate": 4.8984937821749665e-05,
      "loss": 1.9196,
      "num_input_tokens_seen": 8172137056,
      "step": 10387
    },
    {
      "epoch": 1.1020581370676852,
      "grad_norm": 0.3903505178937454,
      "learning_rate": 4.898474179134006e-05,
      "loss": 1.7774,
      "num_input_tokens_seen": 8172923856,
      "step": 10388
    },
    {
      "epoch": 1.1021642266072564,
      "grad_norm": 0.5709217824270074,
      "learning_rate": 4.898454574239576e-05,
      "loss": 1.7395,
      "num_input_tokens_seen": 8173710624,
      "step": 10389
    },
    {
      "epoch": 1.102270316146828,
      "grad_norm": 0.41628667438693173,
      "learning_rate": 4.898434967491689e-05,
      "loss": 1.854,
      "num_input_tokens_seen": 8174497344,
      "step": 10390
    },
    {
      "epoch": 1.1023764056863994,
      "grad_norm": 0.6626075197647213,
      "learning_rate": 4.898415358890362e-05,
      "loss": 1.861,
      "num_input_tokens_seen": 8175284160,
      "step": 10391
    },
    {
      "epoch": 1.1024824952259706,
      "grad_norm": 0.4559542883669334,
      "learning_rate": 4.898395748435611e-05,
      "loss": 1.8278,
      "num_input_tokens_seen": 8176070944,
      "step": 10392
    },
    {
      "epoch": 1.1025885847655421,
      "grad_norm": 0.48393257998323225,
      "learning_rate": 4.8983761361274504e-05,
      "loss": 1.8186,
      "num_input_tokens_seen": 8176857760,
      "step": 10393
    },
    {
      "epoch": 1.1026946743051136,
      "grad_norm": 0.3949886234643325,
      "learning_rate": 4.898356521965895e-05,
      "loss": 1.7207,
      "num_input_tokens_seen": 8177644512,
      "step": 10394
    },
    {
      "epoch": 1.1028007638446848,
      "grad_norm": 0.41052217165008775,
      "learning_rate": 4.8983369059509585e-05,
      "loss": 1.7656,
      "num_input_tokens_seen": 8178431296,
      "step": 10395
    },
    {
      "epoch": 1.1029068533842563,
      "grad_norm": 0.3987849238950481,
      "learning_rate": 4.8983172880826586e-05,
      "loss": 1.8757,
      "num_input_tokens_seen": 8179218032,
      "step": 10396
    },
    {
      "epoch": 1.1030129429238278,
      "grad_norm": 0.5110022683458721,
      "learning_rate": 4.898297668361009e-05,
      "loss": 1.738,
      "num_input_tokens_seen": 8180004800,
      "step": 10397
    },
    {
      "epoch": 1.103119032463399,
      "grad_norm": 0.4466976948512943,
      "learning_rate": 4.898278046786027e-05,
      "loss": 1.7689,
      "num_input_tokens_seen": 8180791552,
      "step": 10398
    },
    {
      "epoch": 1.1032251220029705,
      "grad_norm": 0.4807309745670176,
      "learning_rate": 4.898258423357725e-05,
      "loss": 1.7668,
      "num_input_tokens_seen": 8181578320,
      "step": 10399
    },
    {
      "epoch": 1.103331211542542,
      "grad_norm": 0.4986110321763807,
      "learning_rate": 4.8982387980761186e-05,
      "loss": 1.8781,
      "num_input_tokens_seen": 8182364992,
      "step": 10400
    },
    {
      "epoch": 1.1034373010821132,
      "grad_norm": 0.5884524422118392,
      "learning_rate": 4.898219170941224e-05,
      "loss": 1.7961,
      "num_input_tokens_seen": 8183151824,
      "step": 10401
    },
    {
      "epoch": 1.1035433906216847,
      "grad_norm": 0.45594871063642944,
      "learning_rate": 4.8981995419530566e-05,
      "loss": 1.8547,
      "num_input_tokens_seen": 8183938608,
      "step": 10402
    },
    {
      "epoch": 1.1036494801612562,
      "grad_norm": 0.5757626973921485,
      "learning_rate": 4.89817991111163e-05,
      "loss": 1.8253,
      "num_input_tokens_seen": 8184725376,
      "step": 10403
    },
    {
      "epoch": 1.1037555697008274,
      "grad_norm": 0.41603731825532436,
      "learning_rate": 4.898160278416961e-05,
      "loss": 1.839,
      "num_input_tokens_seen": 8185512112,
      "step": 10404
    },
    {
      "epoch": 1.103861659240399,
      "grad_norm": 0.5299675716861884,
      "learning_rate": 4.898140643869064e-05,
      "loss": 1.9024,
      "num_input_tokens_seen": 8186298848,
      "step": 10405
    },
    {
      "epoch": 1.1039677487799704,
      "grad_norm": 0.6254199522914077,
      "learning_rate": 4.898121007467954e-05,
      "loss": 1.8623,
      "num_input_tokens_seen": 8187085648,
      "step": 10406
    },
    {
      "epoch": 1.1040738383195416,
      "grad_norm": 0.4431111552659153,
      "learning_rate": 4.8981013692136466e-05,
      "loss": 1.8256,
      "num_input_tokens_seen": 8187872400,
      "step": 10407
    },
    {
      "epoch": 1.1041799278591131,
      "grad_norm": 0.9482528367660937,
      "learning_rate": 4.898081729106158e-05,
      "loss": 1.8446,
      "num_input_tokens_seen": 8188659104,
      "step": 10408
    },
    {
      "epoch": 1.1042860173986844,
      "grad_norm": 0.9808999534695751,
      "learning_rate": 4.8980620871455006e-05,
      "loss": 1.8571,
      "num_input_tokens_seen": 8189445856,
      "step": 10409
    },
    {
      "epoch": 1.1043921069382558,
      "grad_norm": 0.6324994697938,
      "learning_rate": 4.898042443331692e-05,
      "loss": 1.785,
      "num_input_tokens_seen": 8190232576,
      "step": 10410
    },
    {
      "epoch": 1.1044981964778273,
      "grad_norm": 0.6358839804582224,
      "learning_rate": 4.8980227976647456e-05,
      "loss": 1.6377,
      "num_input_tokens_seen": 8191019408,
      "step": 10411
    },
    {
      "epoch": 1.1046042860173988,
      "grad_norm": 0.5347178045006726,
      "learning_rate": 4.8980031501446785e-05,
      "loss": 1.9725,
      "num_input_tokens_seen": 8191806192,
      "step": 10412
    },
    {
      "epoch": 1.10471037555697,
      "grad_norm": 0.4594540386884163,
      "learning_rate": 4.8979835007715044e-05,
      "loss": 1.8056,
      "num_input_tokens_seen": 8192592976,
      "step": 10413
    },
    {
      "epoch": 1.1048164650965415,
      "grad_norm": 0.722022685759976,
      "learning_rate": 4.89796384954524e-05,
      "loss": 1.8057,
      "num_input_tokens_seen": 8193379696,
      "step": 10414
    },
    {
      "epoch": 1.1049225546361128,
      "grad_norm": 0.6076033815028836,
      "learning_rate": 4.8979441964658976e-05,
      "loss": 1.9066,
      "num_input_tokens_seen": 8194166496,
      "step": 10415
    },
    {
      "epoch": 1.1050286441756842,
      "grad_norm": 0.6086628525612563,
      "learning_rate": 4.8979245415334965e-05,
      "loss": 1.9216,
      "num_input_tokens_seen": 8194953232,
      "step": 10416
    },
    {
      "epoch": 1.1051347337152557,
      "grad_norm": 0.5251530782474632,
      "learning_rate": 4.8979048847480477e-05,
      "loss": 1.9655,
      "num_input_tokens_seen": 8195740032,
      "step": 10417
    },
    {
      "epoch": 1.105240823254827,
      "grad_norm": 0.5759105057293145,
      "learning_rate": 4.89788522610957e-05,
      "loss": 1.8438,
      "num_input_tokens_seen": 8196526720,
      "step": 10418
    },
    {
      "epoch": 1.1053469127943985,
      "grad_norm": 0.6674481545556832,
      "learning_rate": 4.897865565618076e-05,
      "loss": 1.9552,
      "num_input_tokens_seen": 8197313424,
      "step": 10419
    },
    {
      "epoch": 1.10545300233397,
      "grad_norm": 0.44237810926677384,
      "learning_rate": 4.897845903273582e-05,
      "loss": 1.771,
      "num_input_tokens_seen": 8198100128,
      "step": 10420
    },
    {
      "epoch": 1.1055590918735412,
      "grad_norm": 0.6260724603082991,
      "learning_rate": 4.897826239076103e-05,
      "loss": 1.896,
      "num_input_tokens_seen": 8198886896,
      "step": 10421
    },
    {
      "epoch": 1.1056651814131127,
      "grad_norm": 0.49189613486239275,
      "learning_rate": 4.897806573025654e-05,
      "loss": 1.802,
      "num_input_tokens_seen": 8199673712,
      "step": 10422
    },
    {
      "epoch": 1.1057712709526841,
      "grad_norm": 0.42562309444442775,
      "learning_rate": 4.8977869051222514e-05,
      "loss": 1.767,
      "num_input_tokens_seen": 8200460480,
      "step": 10423
    },
    {
      "epoch": 1.1058773604922554,
      "grad_norm": 0.4869650663735366,
      "learning_rate": 4.8977672353659085e-05,
      "loss": 1.7666,
      "num_input_tokens_seen": 8201247248,
      "step": 10424
    },
    {
      "epoch": 1.1059834500318269,
      "grad_norm": 0.405472587334271,
      "learning_rate": 4.897747563756642e-05,
      "loss": 1.8255,
      "num_input_tokens_seen": 8202034032,
      "step": 10425
    },
    {
      "epoch": 1.1060895395713983,
      "grad_norm": 0.44552370782921835,
      "learning_rate": 4.897727890294466e-05,
      "loss": 1.8322,
      "num_input_tokens_seen": 8202820784,
      "step": 10426
    },
    {
      "epoch": 1.1061956291109696,
      "grad_norm": 0.4818630332072661,
      "learning_rate": 4.897708214979397e-05,
      "loss": 1.8643,
      "num_input_tokens_seen": 8203607632,
      "step": 10427
    },
    {
      "epoch": 1.106301718650541,
      "grad_norm": 0.5147928747902732,
      "learning_rate": 4.897688537811449e-05,
      "loss": 2.0085,
      "num_input_tokens_seen": 8204394352,
      "step": 10428
    },
    {
      "epoch": 1.1064078081901125,
      "grad_norm": 0.46546025857707074,
      "learning_rate": 4.8976688587906374e-05,
      "loss": 1.7228,
      "num_input_tokens_seen": 8205181168,
      "step": 10429
    },
    {
      "epoch": 1.1065138977296838,
      "grad_norm": 0.5670950035074167,
      "learning_rate": 4.8976491779169775e-05,
      "loss": 1.7971,
      "num_input_tokens_seen": 8205967952,
      "step": 10430
    },
    {
      "epoch": 1.1066199872692553,
      "grad_norm": 0.4574044184331461,
      "learning_rate": 4.897629495190485e-05,
      "loss": 1.7795,
      "num_input_tokens_seen": 8206754672,
      "step": 10431
    },
    {
      "epoch": 1.1067260768088267,
      "grad_norm": 0.4864094734081074,
      "learning_rate": 4.8976098106111756e-05,
      "loss": 1.765,
      "num_input_tokens_seen": 8207541344,
      "step": 10432
    },
    {
      "epoch": 1.106832166348398,
      "grad_norm": 0.514556856238943,
      "learning_rate": 4.8975901241790626e-05,
      "loss": 1.7381,
      "num_input_tokens_seen": 8208328144,
      "step": 10433
    },
    {
      "epoch": 1.1069382558879695,
      "grad_norm": 0.47336294709319815,
      "learning_rate": 4.8975704358941626e-05,
      "loss": 1.839,
      "num_input_tokens_seen": 8209115008,
      "step": 10434
    },
    {
      "epoch": 1.107044345427541,
      "grad_norm": 0.4139981222094054,
      "learning_rate": 4.8975507457564906e-05,
      "loss": 1.8317,
      "num_input_tokens_seen": 8209901760,
      "step": 10435
    },
    {
      "epoch": 1.1071504349671122,
      "grad_norm": 0.4585209817966625,
      "learning_rate": 4.8975310537660613e-05,
      "loss": 1.6743,
      "num_input_tokens_seen": 8210688608,
      "step": 10436
    },
    {
      "epoch": 1.1072565245066837,
      "grad_norm": 0.4303708889090642,
      "learning_rate": 4.897511359922891e-05,
      "loss": 1.7152,
      "num_input_tokens_seen": 8211475392,
      "step": 10437
    },
    {
      "epoch": 1.1073626140462551,
      "grad_norm": 0.39477141859445797,
      "learning_rate": 4.8974916642269944e-05,
      "loss": 1.9136,
      "num_input_tokens_seen": 8212262080,
      "step": 10438
    },
    {
      "epoch": 1.1074687035858264,
      "grad_norm": 0.398492459861118,
      "learning_rate": 4.897471966678386e-05,
      "loss": 1.7997,
      "num_input_tokens_seen": 8213048848,
      "step": 10439
    },
    {
      "epoch": 1.1075747931253979,
      "grad_norm": 0.9645551906258862,
      "learning_rate": 4.8974522672770816e-05,
      "loss": 1.8757,
      "num_input_tokens_seen": 8213835696,
      "step": 10440
    },
    {
      "epoch": 1.1076808826649693,
      "grad_norm": 2.4245250339744073,
      "learning_rate": 4.897432566023097e-05,
      "loss": 1.821,
      "num_input_tokens_seen": 8214622400,
      "step": 10441
    },
    {
      "epoch": 1.1077869722045406,
      "grad_norm": 0.5702443670043891,
      "learning_rate": 4.8974128629164465e-05,
      "loss": 1.8534,
      "num_input_tokens_seen": 8215409200,
      "step": 10442
    },
    {
      "epoch": 1.107893061744112,
      "grad_norm": 0.7325894774020565,
      "learning_rate": 4.897393157957145e-05,
      "loss": 1.7689,
      "num_input_tokens_seen": 8216196016,
      "step": 10443
    },
    {
      "epoch": 1.1079991512836833,
      "grad_norm": 0.5802193089439672,
      "learning_rate": 4.8973734511452095e-05,
      "loss": 1.9337,
      "num_input_tokens_seen": 8216982720,
      "step": 10444
    },
    {
      "epoch": 1.1081052408232548,
      "grad_norm": 0.5203936048510633,
      "learning_rate": 4.8973537424806534e-05,
      "loss": 1.8205,
      "num_input_tokens_seen": 8217769568,
      "step": 10445
    },
    {
      "epoch": 1.1082113303628263,
      "grad_norm": 0.5814311507345765,
      "learning_rate": 4.8973340319634934e-05,
      "loss": 1.8605,
      "num_input_tokens_seen": 8218556288,
      "step": 10446
    },
    {
      "epoch": 1.1083174199023977,
      "grad_norm": 0.41708874168568605,
      "learning_rate": 4.8973143195937435e-05,
      "loss": 1.7584,
      "num_input_tokens_seen": 8219343104,
      "step": 10447
    },
    {
      "epoch": 1.108423509441969,
      "grad_norm": 0.7348540280040365,
      "learning_rate": 4.89729460537142e-05,
      "loss": 1.8461,
      "num_input_tokens_seen": 8220129776,
      "step": 10448
    },
    {
      "epoch": 1.1085295989815405,
      "grad_norm": 0.39668059865737226,
      "learning_rate": 4.8972748892965366e-05,
      "loss": 1.7468,
      "num_input_tokens_seen": 8220916496,
      "step": 10449
    },
    {
      "epoch": 1.1086356885211117,
      "grad_norm": 0.5454128773060368,
      "learning_rate": 4.89725517136911e-05,
      "loss": 1.7074,
      "num_input_tokens_seen": 8221703248,
      "step": 10450
    },
    {
      "epoch": 1.1087417780606832,
      "grad_norm": 0.39497998091159664,
      "learning_rate": 4.897235451589155e-05,
      "loss": 1.7539,
      "num_input_tokens_seen": 8222490032,
      "step": 10451
    },
    {
      "epoch": 1.1088478676002547,
      "grad_norm": 0.4457655334773025,
      "learning_rate": 4.897215729956687e-05,
      "loss": 1.805,
      "num_input_tokens_seen": 8223276768,
      "step": 10452
    },
    {
      "epoch": 1.108953957139826,
      "grad_norm": 0.5923235944771874,
      "learning_rate": 4.89719600647172e-05,
      "loss": 1.8984,
      "num_input_tokens_seen": 8224063472,
      "step": 10453
    },
    {
      "epoch": 1.1090600466793974,
      "grad_norm": 0.41231498876242895,
      "learning_rate": 4.897176281134271e-05,
      "loss": 1.8624,
      "num_input_tokens_seen": 8224850128,
      "step": 10454
    },
    {
      "epoch": 1.1091661362189689,
      "grad_norm": 0.6452997325359408,
      "learning_rate": 4.8971565539443546e-05,
      "loss": 1.7698,
      "num_input_tokens_seen": 8225636896,
      "step": 10455
    },
    {
      "epoch": 1.1092722257585401,
      "grad_norm": 0.44987842272612194,
      "learning_rate": 4.897136824901986e-05,
      "loss": 1.8467,
      "num_input_tokens_seen": 8226423712,
      "step": 10456
    },
    {
      "epoch": 1.1093783152981116,
      "grad_norm": 0.5655885750125955,
      "learning_rate": 4.8971170940071806e-05,
      "loss": 1.9202,
      "num_input_tokens_seen": 8227210432,
      "step": 10457
    },
    {
      "epoch": 1.109484404837683,
      "grad_norm": 0.5355546605424514,
      "learning_rate": 4.897097361259953e-05,
      "loss": 1.6788,
      "num_input_tokens_seen": 8227997232,
      "step": 10458
    },
    {
      "epoch": 1.1095904943772543,
      "grad_norm": 0.4913584445506194,
      "learning_rate": 4.897077626660319e-05,
      "loss": 1.7633,
      "num_input_tokens_seen": 8228783952,
      "step": 10459
    },
    {
      "epoch": 1.1096965839168258,
      "grad_norm": 0.45837535519869954,
      "learning_rate": 4.8970578902082935e-05,
      "loss": 1.788,
      "num_input_tokens_seen": 8229570688,
      "step": 10460
    },
    {
      "epoch": 1.1098026734563973,
      "grad_norm": 0.41780832487147707,
      "learning_rate": 4.897038151903892e-05,
      "loss": 1.7879,
      "num_input_tokens_seen": 8230357408,
      "step": 10461
    },
    {
      "epoch": 1.1099087629959685,
      "grad_norm": 0.39495532738008493,
      "learning_rate": 4.897018411747131e-05,
      "loss": 1.8504,
      "num_input_tokens_seen": 8231144208,
      "step": 10462
    },
    {
      "epoch": 1.11001485253554,
      "grad_norm": 0.3676662290388626,
      "learning_rate": 4.896998669738023e-05,
      "loss": 1.8197,
      "num_input_tokens_seen": 8231931072,
      "step": 10463
    },
    {
      "epoch": 1.1101209420751115,
      "grad_norm": 0.4459023457356387,
      "learning_rate": 4.896978925876585e-05,
      "loss": 1.8595,
      "num_input_tokens_seen": 8232717904,
      "step": 10464
    },
    {
      "epoch": 1.1102270316146827,
      "grad_norm": 0.3872173740893827,
      "learning_rate": 4.8969591801628324e-05,
      "loss": 1.7251,
      "num_input_tokens_seen": 8233504608,
      "step": 10465
    },
    {
      "epoch": 1.1103331211542542,
      "grad_norm": 0.44989130014422174,
      "learning_rate": 4.89693943259678e-05,
      "loss": 1.5651,
      "num_input_tokens_seen": 8234291424,
      "step": 10466
    },
    {
      "epoch": 1.1104392106938257,
      "grad_norm": 0.3444875436258756,
      "learning_rate": 4.896919683178443e-05,
      "loss": 1.7409,
      "num_input_tokens_seen": 8235078176,
      "step": 10467
    },
    {
      "epoch": 1.110545300233397,
      "grad_norm": 0.41200296206257747,
      "learning_rate": 4.896899931907837e-05,
      "loss": 1.8967,
      "num_input_tokens_seen": 8235864880,
      "step": 10468
    },
    {
      "epoch": 1.1106513897729684,
      "grad_norm": 0.35234621596417415,
      "learning_rate": 4.896880178784977e-05,
      "loss": 1.7506,
      "num_input_tokens_seen": 8236651712,
      "step": 10469
    },
    {
      "epoch": 1.1107574793125399,
      "grad_norm": 0.45240291955470874,
      "learning_rate": 4.896860423809878e-05,
      "loss": 1.7478,
      "num_input_tokens_seen": 8237438480,
      "step": 10470
    },
    {
      "epoch": 1.1108635688521111,
      "grad_norm": 0.3929994020703687,
      "learning_rate": 4.8968406669825564e-05,
      "loss": 1.7112,
      "num_input_tokens_seen": 8238225248,
      "step": 10471
    },
    {
      "epoch": 1.1109696583916826,
      "grad_norm": 0.5737959204840981,
      "learning_rate": 4.896820908303026e-05,
      "loss": 1.9743,
      "num_input_tokens_seen": 8239011952,
      "step": 10472
    },
    {
      "epoch": 1.111075747931254,
      "grad_norm": 0.45935780407137694,
      "learning_rate": 4.896801147771303e-05,
      "loss": 1.8358,
      "num_input_tokens_seen": 8239798752,
      "step": 10473
    },
    {
      "epoch": 1.1111818374708253,
      "grad_norm": 0.5294453073268711,
      "learning_rate": 4.8967813853874024e-05,
      "loss": 1.9334,
      "num_input_tokens_seen": 8240585568,
      "step": 10474
    },
    {
      "epoch": 1.1112879270103968,
      "grad_norm": 0.42013100071814086,
      "learning_rate": 4.896761621151339e-05,
      "loss": 1.9156,
      "num_input_tokens_seen": 8241372256,
      "step": 10475
    },
    {
      "epoch": 1.1113940165499683,
      "grad_norm": 0.4369236695618666,
      "learning_rate": 4.896741855063129e-05,
      "loss": 1.7612,
      "num_input_tokens_seen": 8242159024,
      "step": 10476
    },
    {
      "epoch": 1.1115001060895395,
      "grad_norm": 0.4008778777067996,
      "learning_rate": 4.896722087122787e-05,
      "loss": 1.8294,
      "num_input_tokens_seen": 8242945776,
      "step": 10477
    },
    {
      "epoch": 1.111606195629111,
      "grad_norm": 0.4949676647564224,
      "learning_rate": 4.896702317330328e-05,
      "loss": 1.8284,
      "num_input_tokens_seen": 8243732544,
      "step": 10478
    },
    {
      "epoch": 1.1117122851686823,
      "grad_norm": 0.5676128146595475,
      "learning_rate": 4.896682545685769e-05,
      "loss": 1.8434,
      "num_input_tokens_seen": 8244519296,
      "step": 10479
    },
    {
      "epoch": 1.1118183747082537,
      "grad_norm": 0.42178195679262576,
      "learning_rate": 4.8966627721891236e-05,
      "loss": 1.8775,
      "num_input_tokens_seen": 8245305984,
      "step": 10480
    },
    {
      "epoch": 1.1119244642478252,
      "grad_norm": 0.5886407601235382,
      "learning_rate": 4.896642996840407e-05,
      "loss": 1.9468,
      "num_input_tokens_seen": 8246092688,
      "step": 10481
    },
    {
      "epoch": 1.1120305537873967,
      "grad_norm": 0.5154929663292726,
      "learning_rate": 4.896623219639635e-05,
      "loss": 1.8885,
      "num_input_tokens_seen": 8246879360,
      "step": 10482
    },
    {
      "epoch": 1.112136643326968,
      "grad_norm": 0.43001989493761267,
      "learning_rate": 4.8966034405868235e-05,
      "loss": 1.9251,
      "num_input_tokens_seen": 8247666080,
      "step": 10483
    },
    {
      "epoch": 1.1122427328665394,
      "grad_norm": 0.6807106399483868,
      "learning_rate": 4.896583659681987e-05,
      "loss": 1.8348,
      "num_input_tokens_seen": 8248452832,
      "step": 10484
    },
    {
      "epoch": 1.1123488224061107,
      "grad_norm": 0.3663367467936017,
      "learning_rate": 4.896563876925141e-05,
      "loss": 1.726,
      "num_input_tokens_seen": 8249239648,
      "step": 10485
    },
    {
      "epoch": 1.1124549119456821,
      "grad_norm": 0.5600210016956266,
      "learning_rate": 4.896544092316301e-05,
      "loss": 1.85,
      "num_input_tokens_seen": 8250026336,
      "step": 10486
    },
    {
      "epoch": 1.1125610014852536,
      "grad_norm": 0.4075391845432259,
      "learning_rate": 4.896524305855481e-05,
      "loss": 1.8598,
      "num_input_tokens_seen": 8250813088,
      "step": 10487
    },
    {
      "epoch": 1.1126670910248249,
      "grad_norm": 0.8190898510914382,
      "learning_rate": 4.896504517542698e-05,
      "loss": 1.8148,
      "num_input_tokens_seen": 8251599840,
      "step": 10488
    },
    {
      "epoch": 1.1127731805643963,
      "grad_norm": 0.48175384062722026,
      "learning_rate": 4.896484727377967e-05,
      "loss": 2.0187,
      "num_input_tokens_seen": 8252386592,
      "step": 10489
    },
    {
      "epoch": 1.1128792701039678,
      "grad_norm": 1.4122608662979168,
      "learning_rate": 4.896464935361302e-05,
      "loss": 1.8586,
      "num_input_tokens_seen": 8253173312,
      "step": 10490
    },
    {
      "epoch": 1.112985359643539,
      "grad_norm": 0.4570137731161455,
      "learning_rate": 4.89644514149272e-05,
      "loss": 1.7605,
      "num_input_tokens_seen": 8253960016,
      "step": 10491
    },
    {
      "epoch": 1.1130914491831105,
      "grad_norm": 1.6005591948184181,
      "learning_rate": 4.896425345772236e-05,
      "loss": 1.8474,
      "num_input_tokens_seen": 8254746848,
      "step": 10492
    },
    {
      "epoch": 1.113197538722682,
      "grad_norm": 0.42403720725177696,
      "learning_rate": 4.896405548199864e-05,
      "loss": 1.7996,
      "num_input_tokens_seen": 8255533600,
      "step": 10493
    },
    {
      "epoch": 1.1133036282622533,
      "grad_norm": 0.682630860567112,
      "learning_rate": 4.89638574877562e-05,
      "loss": 1.8052,
      "num_input_tokens_seen": 8256320416,
      "step": 10494
    },
    {
      "epoch": 1.1134097178018247,
      "grad_norm": 0.6099326847377569,
      "learning_rate": 4.89636594749952e-05,
      "loss": 1.6722,
      "num_input_tokens_seen": 8257107184,
      "step": 10495
    },
    {
      "epoch": 1.1135158073413962,
      "grad_norm": 0.40809647359123874,
      "learning_rate": 4.896346144371578e-05,
      "loss": 1.8386,
      "num_input_tokens_seen": 8257894032,
      "step": 10496
    },
    {
      "epoch": 1.1136218968809675,
      "grad_norm": 0.5344462117142778,
      "learning_rate": 4.8963263393918105e-05,
      "loss": 1.7175,
      "num_input_tokens_seen": 8258680864,
      "step": 10497
    },
    {
      "epoch": 1.113727986420539,
      "grad_norm": 0.6014604818223597,
      "learning_rate": 4.896306532560232e-05,
      "loss": 1.8663,
      "num_input_tokens_seen": 8259467600,
      "step": 10498
    },
    {
      "epoch": 1.1138340759601104,
      "grad_norm": 0.40038371143930596,
      "learning_rate": 4.896286723876858e-05,
      "loss": 1.5952,
      "num_input_tokens_seen": 8260254336,
      "step": 10499
    },
    {
      "epoch": 1.1139401654996817,
      "grad_norm": 0.4757368437379103,
      "learning_rate": 4.896266913341705e-05,
      "loss": 1.8875,
      "num_input_tokens_seen": 8261041072,
      "step": 10500
    },
    {
      "epoch": 1.1140462550392531,
      "grad_norm": 0.4866063452272054,
      "learning_rate": 4.896247100954786e-05,
      "loss": 1.8827,
      "num_input_tokens_seen": 8261827792,
      "step": 10501
    },
    {
      "epoch": 1.1141523445788246,
      "grad_norm": 0.47399503017545774,
      "learning_rate": 4.896227286716119e-05,
      "loss": 1.8668,
      "num_input_tokens_seen": 8262614496,
      "step": 10502
    },
    {
      "epoch": 1.1142584341183959,
      "grad_norm": 0.42395183868858033,
      "learning_rate": 4.896207470625716e-05,
      "loss": 1.7005,
      "num_input_tokens_seen": 8263401264,
      "step": 10503
    },
    {
      "epoch": 1.1143645236579673,
      "grad_norm": 0.4258775223865227,
      "learning_rate": 4.896187652683595e-05,
      "loss": 1.7643,
      "num_input_tokens_seen": 8264188016,
      "step": 10504
    },
    {
      "epoch": 1.1144706131975388,
      "grad_norm": 0.45790907216768184,
      "learning_rate": 4.896167832889771e-05,
      "loss": 1.8325,
      "num_input_tokens_seen": 8264974800,
      "step": 10505
    },
    {
      "epoch": 1.11457670273711,
      "grad_norm": 0.48469045750635154,
      "learning_rate": 4.896148011244258e-05,
      "loss": 1.7742,
      "num_input_tokens_seen": 8265761552,
      "step": 10506
    },
    {
      "epoch": 1.1146827922766815,
      "grad_norm": 0.4403229932779453,
      "learning_rate": 4.896128187747073e-05,
      "loss": 1.7332,
      "num_input_tokens_seen": 8266548304,
      "step": 10507
    },
    {
      "epoch": 1.114788881816253,
      "grad_norm": 0.4376429954259142,
      "learning_rate": 4.89610836239823e-05,
      "loss": 2.0198,
      "num_input_tokens_seen": 8267335040,
      "step": 10508
    },
    {
      "epoch": 1.1148949713558243,
      "grad_norm": 0.462362680182234,
      "learning_rate": 4.896088535197744e-05,
      "loss": 1.7169,
      "num_input_tokens_seen": 8268121936,
      "step": 10509
    },
    {
      "epoch": 1.1150010608953957,
      "grad_norm": 0.4381452107519922,
      "learning_rate": 4.8960687061456324e-05,
      "loss": 1.7636,
      "num_input_tokens_seen": 8268908736,
      "step": 10510
    },
    {
      "epoch": 1.1151071504349672,
      "grad_norm": 0.4268216434655933,
      "learning_rate": 4.896048875241908e-05,
      "loss": 1.7667,
      "num_input_tokens_seen": 8269695520,
      "step": 10511
    },
    {
      "epoch": 1.1152132399745385,
      "grad_norm": 0.3981222713589642,
      "learning_rate": 4.8960290424865884e-05,
      "loss": 1.7204,
      "num_input_tokens_seen": 8270482272,
      "step": 10512
    },
    {
      "epoch": 1.11531932951411,
      "grad_norm": 0.5621230852517471,
      "learning_rate": 4.896009207879687e-05,
      "loss": 1.7457,
      "num_input_tokens_seen": 8271268976,
      "step": 10513
    },
    {
      "epoch": 1.1154254190536812,
      "grad_norm": 0.5013977497267088,
      "learning_rate": 4.8959893714212204e-05,
      "loss": 1.7583,
      "num_input_tokens_seen": 8272055728,
      "step": 10514
    },
    {
      "epoch": 1.1155315085932527,
      "grad_norm": 0.981643571375024,
      "learning_rate": 4.8959695331112034e-05,
      "loss": 1.7641,
      "num_input_tokens_seen": 8272842496,
      "step": 10515
    },
    {
      "epoch": 1.1156375981328241,
      "grad_norm": 0.742466522360326,
      "learning_rate": 4.895949692949652e-05,
      "loss": 1.6954,
      "num_input_tokens_seen": 8273629296,
      "step": 10516
    },
    {
      "epoch": 1.1157436876723954,
      "grad_norm": 1.0470850868914374,
      "learning_rate": 4.89592985093658e-05,
      "loss": 1.7694,
      "num_input_tokens_seen": 8274416144,
      "step": 10517
    },
    {
      "epoch": 1.1158497772119669,
      "grad_norm": 0.49358032563586873,
      "learning_rate": 4.8959100070720045e-05,
      "loss": 1.6291,
      "num_input_tokens_seen": 8275202848,
      "step": 10518
    },
    {
      "epoch": 1.1159558667515384,
      "grad_norm": 1.7650925444146814,
      "learning_rate": 4.8958901613559394e-05,
      "loss": 1.8384,
      "num_input_tokens_seen": 8275989568,
      "step": 10519
    },
    {
      "epoch": 1.1160619562911096,
      "grad_norm": 0.4628948138535463,
      "learning_rate": 4.895870313788401e-05,
      "loss": 1.7433,
      "num_input_tokens_seen": 8276776368,
      "step": 10520
    },
    {
      "epoch": 1.116168045830681,
      "grad_norm": 1.2446869140633277,
      "learning_rate": 4.895850464369405e-05,
      "loss": 1.8532,
      "num_input_tokens_seen": 8277563184,
      "step": 10521
    },
    {
      "epoch": 1.1162741353702526,
      "grad_norm": 0.4714014552195579,
      "learning_rate": 4.895830613098965e-05,
      "loss": 1.7865,
      "num_input_tokens_seen": 8278349952,
      "step": 10522
    },
    {
      "epoch": 1.1163802249098238,
      "grad_norm": 0.6231405851363977,
      "learning_rate": 4.895810759977098e-05,
      "loss": 1.7515,
      "num_input_tokens_seen": 8279136720,
      "step": 10523
    },
    {
      "epoch": 1.1164863144493953,
      "grad_norm": 0.5788078397676594,
      "learning_rate": 4.8957909050038186e-05,
      "loss": 1.774,
      "num_input_tokens_seen": 8279923472,
      "step": 10524
    },
    {
      "epoch": 1.1165924039889668,
      "grad_norm": 0.5588468834325805,
      "learning_rate": 4.895771048179142e-05,
      "loss": 1.7569,
      "num_input_tokens_seen": 8280710160,
      "step": 10525
    },
    {
      "epoch": 1.116698493528538,
      "grad_norm": 0.5215986153030493,
      "learning_rate": 4.895751189503084e-05,
      "loss": 1.7633,
      "num_input_tokens_seen": 8281496944,
      "step": 10526
    },
    {
      "epoch": 1.1168045830681095,
      "grad_norm": 0.550220413278254,
      "learning_rate": 4.8957313289756604e-05,
      "loss": 1.8522,
      "num_input_tokens_seen": 8282283680,
      "step": 10527
    },
    {
      "epoch": 1.116910672607681,
      "grad_norm": 0.5444850759755108,
      "learning_rate": 4.895711466596885e-05,
      "loss": 1.6555,
      "num_input_tokens_seen": 8283070496,
      "step": 10528
    },
    {
      "epoch": 1.1170167621472522,
      "grad_norm": 0.4679360411982281,
      "learning_rate": 4.895691602366774e-05,
      "loss": 1.7423,
      "num_input_tokens_seen": 8283857232,
      "step": 10529
    },
    {
      "epoch": 1.1171228516868237,
      "grad_norm": 0.6768641634103066,
      "learning_rate": 4.8956717362853436e-05,
      "loss": 1.7524,
      "num_input_tokens_seen": 8284644064,
      "step": 10530
    },
    {
      "epoch": 1.1172289412263952,
      "grad_norm": 0.37876285734821635,
      "learning_rate": 4.895651868352608e-05,
      "loss": 1.6571,
      "num_input_tokens_seen": 8285430848,
      "step": 10531
    },
    {
      "epoch": 1.1173350307659664,
      "grad_norm": 0.6882475085819829,
      "learning_rate": 4.895631998568583e-05,
      "loss": 1.7789,
      "num_input_tokens_seen": 8286217648,
      "step": 10532
    },
    {
      "epoch": 1.1174411203055379,
      "grad_norm": 0.45511611911011984,
      "learning_rate": 4.895612126933284e-05,
      "loss": 1.7551,
      "num_input_tokens_seen": 8287004416,
      "step": 10533
    },
    {
      "epoch": 1.1175472098451094,
      "grad_norm": 0.6997903431558408,
      "learning_rate": 4.895592253446726e-05,
      "loss": 1.7032,
      "num_input_tokens_seen": 8287791216,
      "step": 10534
    },
    {
      "epoch": 1.1176532993846806,
      "grad_norm": 0.4500132645036801,
      "learning_rate": 4.895572378108925e-05,
      "loss": 1.7462,
      "num_input_tokens_seen": 8288578016,
      "step": 10535
    },
    {
      "epoch": 1.117759388924252,
      "grad_norm": 0.4862308015383522,
      "learning_rate": 4.895552500919895e-05,
      "loss": 1.7551,
      "num_input_tokens_seen": 8289364704,
      "step": 10536
    },
    {
      "epoch": 1.1178654784638236,
      "grad_norm": 0.6284207249664192,
      "learning_rate": 4.895532621879654e-05,
      "loss": 1.8915,
      "num_input_tokens_seen": 8290151472,
      "step": 10537
    },
    {
      "epoch": 1.1179715680033948,
      "grad_norm": 0.47561644081541526,
      "learning_rate": 4.895512740988214e-05,
      "loss": 1.8798,
      "num_input_tokens_seen": 8290938144,
      "step": 10538
    },
    {
      "epoch": 1.1180776575429663,
      "grad_norm": 0.6222712167268679,
      "learning_rate": 4.895492858245593e-05,
      "loss": 1.8054,
      "num_input_tokens_seen": 8291724864,
      "step": 10539
    },
    {
      "epoch": 1.1181837470825378,
      "grad_norm": 0.4281662705768666,
      "learning_rate": 4.895472973651805e-05,
      "loss": 1.7219,
      "num_input_tokens_seen": 8292511664,
      "step": 10540
    },
    {
      "epoch": 1.118289836622109,
      "grad_norm": 0.4729773841946228,
      "learning_rate": 4.895453087206866e-05,
      "loss": 1.6488,
      "num_input_tokens_seen": 8293298560,
      "step": 10541
    },
    {
      "epoch": 1.1183959261616805,
      "grad_norm": 0.7122686368958712,
      "learning_rate": 4.895433198910791e-05,
      "loss": 1.6949,
      "num_input_tokens_seen": 8294085312,
      "step": 10542
    },
    {
      "epoch": 1.1185020157012517,
      "grad_norm": 0.4388788611299513,
      "learning_rate": 4.8954133087635956e-05,
      "loss": 1.8197,
      "num_input_tokens_seen": 8294872128,
      "step": 10543
    },
    {
      "epoch": 1.1186081052408232,
      "grad_norm": 0.7175114515995311,
      "learning_rate": 4.8953934167652945e-05,
      "loss": 1.8178,
      "num_input_tokens_seen": 8295658848,
      "step": 10544
    },
    {
      "epoch": 1.1187141947803947,
      "grad_norm": 0.8358128779094574,
      "learning_rate": 4.8953735229159046e-05,
      "loss": 1.6638,
      "num_input_tokens_seen": 8296445616,
      "step": 10545
    },
    {
      "epoch": 1.1188202843199662,
      "grad_norm": 0.5316489043620707,
      "learning_rate": 4.89535362721544e-05,
      "loss": 1.7757,
      "num_input_tokens_seen": 8297232304,
      "step": 10546
    },
    {
      "epoch": 1.1189263738595374,
      "grad_norm": 0.5402206040574571,
      "learning_rate": 4.8953337296639163e-05,
      "loss": 1.773,
      "num_input_tokens_seen": 8298019072,
      "step": 10547
    },
    {
      "epoch": 1.119032463399109,
      "grad_norm": 0.8921059131359083,
      "learning_rate": 4.8953138302613486e-05,
      "loss": 1.9555,
      "num_input_tokens_seen": 8298805840,
      "step": 10548
    },
    {
      "epoch": 1.1191385529386801,
      "grad_norm": 0.44795126479556735,
      "learning_rate": 4.895293929007753e-05,
      "loss": 1.6743,
      "num_input_tokens_seen": 8299592640,
      "step": 10549
    },
    {
      "epoch": 1.1192446424782516,
      "grad_norm": 0.5444357374608412,
      "learning_rate": 4.895274025903145e-05,
      "loss": 1.7102,
      "num_input_tokens_seen": 8300379440,
      "step": 10550
    },
    {
      "epoch": 1.119350732017823,
      "grad_norm": 0.8755647437756052,
      "learning_rate": 4.895254120947539e-05,
      "loss": 1.9094,
      "num_input_tokens_seen": 8301166208,
      "step": 10551
    },
    {
      "epoch": 1.1194568215573943,
      "grad_norm": 0.5668387407874856,
      "learning_rate": 4.8952342141409505e-05,
      "loss": 1.7798,
      "num_input_tokens_seen": 8301953040,
      "step": 10552
    },
    {
      "epoch": 1.1195629110969658,
      "grad_norm": 1.0611408992250309,
      "learning_rate": 4.895214305483396e-05,
      "loss": 1.7966,
      "num_input_tokens_seen": 8302739712,
      "step": 10553
    },
    {
      "epoch": 1.1196690006365373,
      "grad_norm": 0.39845876933802105,
      "learning_rate": 4.8951943949748905e-05,
      "loss": 1.5873,
      "num_input_tokens_seen": 8303526528,
      "step": 10554
    },
    {
      "epoch": 1.1197750901761085,
      "grad_norm": 0.6779821935941218,
      "learning_rate": 4.895174482615448e-05,
      "loss": 1.7613,
      "num_input_tokens_seen": 8304313296,
      "step": 10555
    },
    {
      "epoch": 1.11988117971568,
      "grad_norm": 0.5886593684190723,
      "learning_rate": 4.8951545684050856e-05,
      "loss": 1.68,
      "num_input_tokens_seen": 8305100064,
      "step": 10556
    },
    {
      "epoch": 1.1199872692552515,
      "grad_norm": 0.6233935115307048,
      "learning_rate": 4.895134652343817e-05,
      "loss": 1.8696,
      "num_input_tokens_seen": 8305886800,
      "step": 10557
    },
    {
      "epoch": 1.1200933587948227,
      "grad_norm": 0.4696635213166902,
      "learning_rate": 4.89511473443166e-05,
      "loss": 1.8136,
      "num_input_tokens_seen": 8306673488,
      "step": 10558
    },
    {
      "epoch": 1.1201994483343942,
      "grad_norm": 0.6524212138472868,
      "learning_rate": 4.895094814668628e-05,
      "loss": 1.7864,
      "num_input_tokens_seen": 8307460336,
      "step": 10559
    },
    {
      "epoch": 1.1203055378739657,
      "grad_norm": 0.41446318930373216,
      "learning_rate": 4.895074893054738e-05,
      "loss": 1.5919,
      "num_input_tokens_seen": 8308247104,
      "step": 10560
    },
    {
      "epoch": 1.120411627413537,
      "grad_norm": 0.4597863045422033,
      "learning_rate": 4.895054969590003e-05,
      "loss": 1.815,
      "num_input_tokens_seen": 8309033872,
      "step": 10561
    },
    {
      "epoch": 1.1205177169531084,
      "grad_norm": 0.4778963699152106,
      "learning_rate": 4.8950350442744394e-05,
      "loss": 1.8661,
      "num_input_tokens_seen": 8309820656,
      "step": 10562
    },
    {
      "epoch": 1.12062380649268,
      "grad_norm": 0.43052504575507494,
      "learning_rate": 4.895015117108064e-05,
      "loss": 1.7536,
      "num_input_tokens_seen": 8310607392,
      "step": 10563
    },
    {
      "epoch": 1.1207298960322511,
      "grad_norm": 0.42055073110288693,
      "learning_rate": 4.8949951880908915e-05,
      "loss": 1.8029,
      "num_input_tokens_seen": 8311394032,
      "step": 10564
    },
    {
      "epoch": 1.1208359855718226,
      "grad_norm": 0.454081568209473,
      "learning_rate": 4.894975257222936e-05,
      "loss": 1.6324,
      "num_input_tokens_seen": 8312180832,
      "step": 10565
    },
    {
      "epoch": 1.120942075111394,
      "grad_norm": 0.768015984354998,
      "learning_rate": 4.894955324504215e-05,
      "loss": 1.7356,
      "num_input_tokens_seen": 8312967648,
      "step": 10566
    },
    {
      "epoch": 1.1210481646509654,
      "grad_norm": 1.1405968999519946,
      "learning_rate": 4.894935389934742e-05,
      "loss": 1.8166,
      "num_input_tokens_seen": 8313754416,
      "step": 10567
    },
    {
      "epoch": 1.1211542541905368,
      "grad_norm": 0.46473160076863795,
      "learning_rate": 4.8949154535145336e-05,
      "loss": 1.684,
      "num_input_tokens_seen": 8314541168,
      "step": 10568
    },
    {
      "epoch": 1.1212603437301083,
      "grad_norm": 0.5170435196722732,
      "learning_rate": 4.8948955152436046e-05,
      "loss": 1.9463,
      "num_input_tokens_seen": 8315328032,
      "step": 10569
    },
    {
      "epoch": 1.1213664332696796,
      "grad_norm": 0.48347223183461124,
      "learning_rate": 4.89487557512197e-05,
      "loss": 1.7078,
      "num_input_tokens_seen": 8316114864,
      "step": 10570
    },
    {
      "epoch": 1.121472522809251,
      "grad_norm": 0.5044691958826798,
      "learning_rate": 4.894855633149647e-05,
      "loss": 1.7508,
      "num_input_tokens_seen": 8316901632,
      "step": 10571
    },
    {
      "epoch": 1.1215786123488225,
      "grad_norm": 0.3800483928849912,
      "learning_rate": 4.894835689326649e-05,
      "loss": 1.8455,
      "num_input_tokens_seen": 8317688400,
      "step": 10572
    },
    {
      "epoch": 1.1216847018883938,
      "grad_norm": 0.44743344825670306,
      "learning_rate": 4.894815743652993e-05,
      "loss": 1.8474,
      "num_input_tokens_seen": 8318475104,
      "step": 10573
    },
    {
      "epoch": 1.1217907914279652,
      "grad_norm": 0.4306518591684704,
      "learning_rate": 4.8947957961286926e-05,
      "loss": 1.7636,
      "num_input_tokens_seen": 8319261856,
      "step": 10574
    },
    {
      "epoch": 1.1218968809675367,
      "grad_norm": 0.43502194389288573,
      "learning_rate": 4.8947758467537654e-05,
      "loss": 1.7324,
      "num_input_tokens_seen": 8320048704,
      "step": 10575
    },
    {
      "epoch": 1.122002970507108,
      "grad_norm": 0.5575888664653731,
      "learning_rate": 4.894755895528225e-05,
      "loss": 1.9951,
      "num_input_tokens_seen": 8320835440,
      "step": 10576
    },
    {
      "epoch": 1.1221090600466794,
      "grad_norm": 0.45340517881129794,
      "learning_rate": 4.894735942452088e-05,
      "loss": 1.8074,
      "num_input_tokens_seen": 8321622208,
      "step": 10577
    },
    {
      "epoch": 1.1222151495862507,
      "grad_norm": 0.5137308071285054,
      "learning_rate": 4.894715987525369e-05,
      "loss": 1.7983,
      "num_input_tokens_seen": 8322409008,
      "step": 10578
    },
    {
      "epoch": 1.1223212391258222,
      "grad_norm": 0.6156970466058755,
      "learning_rate": 4.8946960307480835e-05,
      "loss": 1.9396,
      "num_input_tokens_seen": 8323195792,
      "step": 10579
    },
    {
      "epoch": 1.1224273286653936,
      "grad_norm": 0.601979928833439,
      "learning_rate": 4.894676072120248e-05,
      "loss": 1.8657,
      "num_input_tokens_seen": 8323982576,
      "step": 10580
    },
    {
      "epoch": 1.122533418204965,
      "grad_norm": 0.725647578409277,
      "learning_rate": 4.8946561116418766e-05,
      "loss": 1.9355,
      "num_input_tokens_seen": 8324769408,
      "step": 10581
    },
    {
      "epoch": 1.1226395077445364,
      "grad_norm": 0.43060260443462894,
      "learning_rate": 4.8946361493129845e-05,
      "loss": 1.8916,
      "num_input_tokens_seen": 8325556144,
      "step": 10582
    },
    {
      "epoch": 1.1227455972841078,
      "grad_norm": 1.002434478602714,
      "learning_rate": 4.8946161851335884e-05,
      "loss": 1.8455,
      "num_input_tokens_seen": 8326342864,
      "step": 10583
    },
    {
      "epoch": 1.122851686823679,
      "grad_norm": 0.6962336808447964,
      "learning_rate": 4.894596219103704e-05,
      "loss": 1.9543,
      "num_input_tokens_seen": 8327129600,
      "step": 10584
    },
    {
      "epoch": 1.1229577763632506,
      "grad_norm": 1.3670262332255865,
      "learning_rate": 4.894576251223345e-05,
      "loss": 1.9355,
      "num_input_tokens_seen": 8327916320,
      "step": 10585
    },
    {
      "epoch": 1.123063865902822,
      "grad_norm": 0.5607791320529697,
      "learning_rate": 4.894556281492528e-05,
      "loss": 1.6229,
      "num_input_tokens_seen": 8328703088,
      "step": 10586
    },
    {
      "epoch": 1.1231699554423933,
      "grad_norm": 1.0139301881142964,
      "learning_rate": 4.894536309911268e-05,
      "loss": 1.8804,
      "num_input_tokens_seen": 8329489856,
      "step": 10587
    },
    {
      "epoch": 1.1232760449819648,
      "grad_norm": 0.47280161886695754,
      "learning_rate": 4.8945163364795805e-05,
      "loss": 1.7864,
      "num_input_tokens_seen": 8330276640,
      "step": 10588
    },
    {
      "epoch": 1.1233821345215362,
      "grad_norm": 0.6777873402899993,
      "learning_rate": 4.894496361197481e-05,
      "loss": 1.8454,
      "num_input_tokens_seen": 8331063344,
      "step": 10589
    },
    {
      "epoch": 1.1234882240611075,
      "grad_norm": 0.4950103726784535,
      "learning_rate": 4.8944763840649854e-05,
      "loss": 1.8263,
      "num_input_tokens_seen": 8331850144,
      "step": 10590
    },
    {
      "epoch": 1.123594313600679,
      "grad_norm": 0.5015182179179956,
      "learning_rate": 4.894456405082108e-05,
      "loss": 1.7997,
      "num_input_tokens_seen": 8332636880,
      "step": 10591
    },
    {
      "epoch": 1.1237004031402504,
      "grad_norm": 0.4921923001493602,
      "learning_rate": 4.894436424248866e-05,
      "loss": 1.6442,
      "num_input_tokens_seen": 8333423696,
      "step": 10592
    },
    {
      "epoch": 1.1238064926798217,
      "grad_norm": 0.4544914973032032,
      "learning_rate": 4.8944164415652735e-05,
      "loss": 1.8028,
      "num_input_tokens_seen": 8334210528,
      "step": 10593
    },
    {
      "epoch": 1.1239125822193932,
      "grad_norm": 0.4662928114824944,
      "learning_rate": 4.894396457031346e-05,
      "loss": 1.7658,
      "num_input_tokens_seen": 8334997200,
      "step": 10594
    },
    {
      "epoch": 1.1240186717589646,
      "grad_norm": 0.44727404151804295,
      "learning_rate": 4.8943764706470986e-05,
      "loss": 1.76,
      "num_input_tokens_seen": 8335784032,
      "step": 10595
    },
    {
      "epoch": 1.124124761298536,
      "grad_norm": 0.6488577687140011,
      "learning_rate": 4.8943564824125475e-05,
      "loss": 1.8391,
      "num_input_tokens_seen": 8336570768,
      "step": 10596
    },
    {
      "epoch": 1.1242308508381074,
      "grad_norm": 0.4447124251174075,
      "learning_rate": 4.894336492327709e-05,
      "loss": 1.7249,
      "num_input_tokens_seen": 8337357648,
      "step": 10597
    },
    {
      "epoch": 1.1243369403776788,
      "grad_norm": 0.568075395774632,
      "learning_rate": 4.8943165003925964e-05,
      "loss": 1.8811,
      "num_input_tokens_seen": 8338144352,
      "step": 10598
    },
    {
      "epoch": 1.12444302991725,
      "grad_norm": 0.44675475333032444,
      "learning_rate": 4.894296506607227e-05,
      "loss": 1.8622,
      "num_input_tokens_seen": 8338931120,
      "step": 10599
    },
    {
      "epoch": 1.1245491194568216,
      "grad_norm": 0.4179721287181127,
      "learning_rate": 4.894276510971615e-05,
      "loss": 1.8583,
      "num_input_tokens_seen": 8339717904,
      "step": 10600
    },
    {
      "epoch": 1.124655208996393,
      "grad_norm": 0.40130619333307277,
      "learning_rate": 4.894256513485777e-05,
      "loss": 1.7001,
      "num_input_tokens_seen": 8340504688,
      "step": 10601
    },
    {
      "epoch": 1.1247612985359643,
      "grad_norm": 0.4658586219923953,
      "learning_rate": 4.894236514149727e-05,
      "loss": 1.8444,
      "num_input_tokens_seen": 8341291376,
      "step": 10602
    },
    {
      "epoch": 1.1248673880755358,
      "grad_norm": 0.38172407982931933,
      "learning_rate": 4.894216512963482e-05,
      "loss": 1.6505,
      "num_input_tokens_seen": 8342078128,
      "step": 10603
    },
    {
      "epoch": 1.1249734776151072,
      "grad_norm": 0.40254404223356727,
      "learning_rate": 4.894196509927056e-05,
      "loss": 1.7692,
      "num_input_tokens_seen": 8342864848,
      "step": 10604
    },
    {
      "epoch": 1.1250795671546785,
      "grad_norm": 0.40687417084822647,
      "learning_rate": 4.894176505040466e-05,
      "loss": 1.8061,
      "num_input_tokens_seen": 8343651680,
      "step": 10605
    },
    {
      "epoch": 1.12518565669425,
      "grad_norm": 0.5060820202957299,
      "learning_rate": 4.894156498303726e-05,
      "loss": 1.8099,
      "num_input_tokens_seen": 8344438416,
      "step": 10606
    },
    {
      "epoch": 1.1252917462338212,
      "grad_norm": 0.38708801951961297,
      "learning_rate": 4.894136489716852e-05,
      "loss": 1.7238,
      "num_input_tokens_seen": 8345225136,
      "step": 10607
    },
    {
      "epoch": 1.1253978357733927,
      "grad_norm": 0.39637056249219205,
      "learning_rate": 4.89411647927986e-05,
      "loss": 1.8526,
      "num_input_tokens_seen": 8346011904,
      "step": 10608
    },
    {
      "epoch": 1.1255039253129642,
      "grad_norm": 0.36608026044776404,
      "learning_rate": 4.8940964669927654e-05,
      "loss": 1.7978,
      "num_input_tokens_seen": 8346798720,
      "step": 10609
    },
    {
      "epoch": 1.1256100148525356,
      "grad_norm": 0.4830544972756185,
      "learning_rate": 4.894076452855583e-05,
      "loss": 1.9046,
      "num_input_tokens_seen": 8347585376,
      "step": 10610
    },
    {
      "epoch": 1.125716104392107,
      "grad_norm": 0.3541928000012692,
      "learning_rate": 4.8940564368683286e-05,
      "loss": 1.7371,
      "num_input_tokens_seen": 8348372224,
      "step": 10611
    },
    {
      "epoch": 1.1258221939316784,
      "grad_norm": 0.5065195326488462,
      "learning_rate": 4.8940364190310175e-05,
      "loss": 1.8717,
      "num_input_tokens_seen": 8349158928,
      "step": 10612
    },
    {
      "epoch": 1.1259282834712496,
      "grad_norm": 0.389021663382829,
      "learning_rate": 4.894016399343665e-05,
      "loss": 1.741,
      "num_input_tokens_seen": 8349945744,
      "step": 10613
    },
    {
      "epoch": 1.126034373010821,
      "grad_norm": 0.46083608563444145,
      "learning_rate": 4.893996377806287e-05,
      "loss": 1.8261,
      "num_input_tokens_seen": 8350732544,
      "step": 10614
    },
    {
      "epoch": 1.1261404625503926,
      "grad_norm": 0.4090517160228082,
      "learning_rate": 4.893976354418899e-05,
      "loss": 1.7385,
      "num_input_tokens_seen": 8351519232,
      "step": 10615
    },
    {
      "epoch": 1.126246552089964,
      "grad_norm": 0.3284176370957213,
      "learning_rate": 4.893956329181516e-05,
      "loss": 1.7279,
      "num_input_tokens_seen": 8352306048,
      "step": 10616
    },
    {
      "epoch": 1.1263526416295353,
      "grad_norm": 0.5224172805361855,
      "learning_rate": 4.893936302094154e-05,
      "loss": 1.8386,
      "num_input_tokens_seen": 8353092816,
      "step": 10617
    },
    {
      "epoch": 1.1264587311691068,
      "grad_norm": 0.36868842349303615,
      "learning_rate": 4.8939162731568286e-05,
      "loss": 1.6957,
      "num_input_tokens_seen": 8353879632,
      "step": 10618
    },
    {
      "epoch": 1.126564820708678,
      "grad_norm": 0.4136993664566908,
      "learning_rate": 4.8938962423695546e-05,
      "loss": 1.7581,
      "num_input_tokens_seen": 8354666384,
      "step": 10619
    },
    {
      "epoch": 1.1266709102482495,
      "grad_norm": 0.511024182155728,
      "learning_rate": 4.893876209732348e-05,
      "loss": 1.7522,
      "num_input_tokens_seen": 8355453280,
      "step": 10620
    },
    {
      "epoch": 1.126776999787821,
      "grad_norm": 0.5287561922699091,
      "learning_rate": 4.893856175245224e-05,
      "loss": 1.7087,
      "num_input_tokens_seen": 8356240080,
      "step": 10621
    },
    {
      "epoch": 1.1268830893273922,
      "grad_norm": 1.0825148787348868,
      "learning_rate": 4.8938361389081974e-05,
      "loss": 1.9503,
      "num_input_tokens_seen": 8357026848,
      "step": 10622
    },
    {
      "epoch": 1.1269891788669637,
      "grad_norm": 0.4024760726048148,
      "learning_rate": 4.893816100721286e-05,
      "loss": 1.7049,
      "num_input_tokens_seen": 8357813728,
      "step": 10623
    },
    {
      "epoch": 1.1270952684065352,
      "grad_norm": 0.760005276276481,
      "learning_rate": 4.893796060684503e-05,
      "loss": 1.7697,
      "num_input_tokens_seen": 8358600512,
      "step": 10624
    },
    {
      "epoch": 1.1272013579461064,
      "grad_norm": 0.48022741357179405,
      "learning_rate": 4.893776018797864e-05,
      "loss": 1.833,
      "num_input_tokens_seen": 8359387264,
      "step": 10625
    },
    {
      "epoch": 1.127307447485678,
      "grad_norm": 0.45718442577235946,
      "learning_rate": 4.893755975061386e-05,
      "loss": 1.7612,
      "num_input_tokens_seen": 8360174032,
      "step": 10626
    },
    {
      "epoch": 1.1274135370252494,
      "grad_norm": 0.7159567902849169,
      "learning_rate": 4.893735929475084e-05,
      "loss": 1.8478,
      "num_input_tokens_seen": 8360960848,
      "step": 10627
    },
    {
      "epoch": 1.1275196265648206,
      "grad_norm": 0.47884457414751774,
      "learning_rate": 4.8937158820389724e-05,
      "loss": 1.8917,
      "num_input_tokens_seen": 8361747664,
      "step": 10628
    },
    {
      "epoch": 1.127625716104392,
      "grad_norm": 0.7250284645077031,
      "learning_rate": 4.8936958327530674e-05,
      "loss": 1.8696,
      "num_input_tokens_seen": 8362534416,
      "step": 10629
    },
    {
      "epoch": 1.1277318056439636,
      "grad_norm": 0.37128982083114825,
      "learning_rate": 4.893675781617385e-05,
      "loss": 1.7268,
      "num_input_tokens_seen": 8363321152,
      "step": 10630
    },
    {
      "epoch": 1.1278378951835348,
      "grad_norm": 0.44147629443962166,
      "learning_rate": 4.8936557286319394e-05,
      "loss": 1.7906,
      "num_input_tokens_seen": 8364107856,
      "step": 10631
    },
    {
      "epoch": 1.1279439847231063,
      "grad_norm": 0.5906802592791096,
      "learning_rate": 4.893635673796747e-05,
      "loss": 1.7391,
      "num_input_tokens_seen": 8364894608,
      "step": 10632
    },
    {
      "epoch": 1.1280500742626778,
      "grad_norm": 0.41443260140685245,
      "learning_rate": 4.8936156171118233e-05,
      "loss": 1.8555,
      "num_input_tokens_seen": 8365681360,
      "step": 10633
    },
    {
      "epoch": 1.128156163802249,
      "grad_norm": 0.5786548323394389,
      "learning_rate": 4.893595558577184e-05,
      "loss": 1.8272,
      "num_input_tokens_seen": 8366468192,
      "step": 10634
    },
    {
      "epoch": 1.1282622533418205,
      "grad_norm": 0.39163954277840074,
      "learning_rate": 4.893575498192845e-05,
      "loss": 1.7526,
      "num_input_tokens_seen": 8367255024,
      "step": 10635
    },
    {
      "epoch": 1.128368342881392,
      "grad_norm": 0.4742131831491396,
      "learning_rate": 4.89355543595882e-05,
      "loss": 1.8478,
      "num_input_tokens_seen": 8368041872,
      "step": 10636
    },
    {
      "epoch": 1.1284744324209632,
      "grad_norm": 0.4008511243238894,
      "learning_rate": 4.8935353718751255e-05,
      "loss": 1.7884,
      "num_input_tokens_seen": 8368828720,
      "step": 10637
    },
    {
      "epoch": 1.1285805219605347,
      "grad_norm": 0.4161196868420941,
      "learning_rate": 4.893515305941777e-05,
      "loss": 1.8065,
      "num_input_tokens_seen": 8369615552,
      "step": 10638
    },
    {
      "epoch": 1.1286866115001062,
      "grad_norm": 0.46221264978411736,
      "learning_rate": 4.893495238158791e-05,
      "loss": 1.8734,
      "num_input_tokens_seen": 8370402256,
      "step": 10639
    },
    {
      "epoch": 1.1287927010396774,
      "grad_norm": 0.38689801028970144,
      "learning_rate": 4.8934751685261815e-05,
      "loss": 1.7569,
      "num_input_tokens_seen": 8371189040,
      "step": 10640
    },
    {
      "epoch": 1.128898790579249,
      "grad_norm": 0.5148561556310778,
      "learning_rate": 4.893455097043965e-05,
      "loss": 1.8021,
      "num_input_tokens_seen": 8371975728,
      "step": 10641
    },
    {
      "epoch": 1.1290048801188202,
      "grad_norm": 0.31095549598309996,
      "learning_rate": 4.893435023712156e-05,
      "loss": 1.6878,
      "num_input_tokens_seen": 8372762416,
      "step": 10642
    },
    {
      "epoch": 1.1291109696583916,
      "grad_norm": 0.4454237534592811,
      "learning_rate": 4.8934149485307714e-05,
      "loss": 1.6555,
      "num_input_tokens_seen": 8373549264,
      "step": 10643
    },
    {
      "epoch": 1.1292170591979631,
      "grad_norm": 0.46358142614898934,
      "learning_rate": 4.893394871499826e-05,
      "loss": 1.8543,
      "num_input_tokens_seen": 8374335952,
      "step": 10644
    },
    {
      "epoch": 1.1293231487375346,
      "grad_norm": 0.39527446308314124,
      "learning_rate": 4.8933747926193344e-05,
      "loss": 1.91,
      "num_input_tokens_seen": 8375122720,
      "step": 10645
    },
    {
      "epoch": 1.1294292382771058,
      "grad_norm": 0.4201345462138271,
      "learning_rate": 4.893354711889313e-05,
      "loss": 1.8637,
      "num_input_tokens_seen": 8375909392,
      "step": 10646
    },
    {
      "epoch": 1.1295353278166773,
      "grad_norm": 0.4986268754111237,
      "learning_rate": 4.893334629309778e-05,
      "loss": 1.7863,
      "num_input_tokens_seen": 8376696128,
      "step": 10647
    },
    {
      "epoch": 1.1296414173562486,
      "grad_norm": 0.35172886889717947,
      "learning_rate": 4.893314544880744e-05,
      "loss": 1.7388,
      "num_input_tokens_seen": 8377482944,
      "step": 10648
    },
    {
      "epoch": 1.12974750689582,
      "grad_norm": 0.3926393887246972,
      "learning_rate": 4.8932944586022266e-05,
      "loss": 1.7923,
      "num_input_tokens_seen": 8378269728,
      "step": 10649
    },
    {
      "epoch": 1.1298535964353915,
      "grad_norm": 0.5469395331215737,
      "learning_rate": 4.8932743704742414e-05,
      "loss": 1.8942,
      "num_input_tokens_seen": 8379056448,
      "step": 10650
    },
    {
      "epoch": 1.129959685974963,
      "grad_norm": 0.4132694004152385,
      "learning_rate": 4.893254280496804e-05,
      "loss": 1.9095,
      "num_input_tokens_seen": 8379843152,
      "step": 10651
    },
    {
      "epoch": 1.1300657755145342,
      "grad_norm": 0.9616884963763576,
      "learning_rate": 4.893234188669931e-05,
      "loss": 1.8385,
      "num_input_tokens_seen": 8380629936,
      "step": 10652
    },
    {
      "epoch": 1.1301718650541057,
      "grad_norm": 0.34153964345356097,
      "learning_rate": 4.893214094993636e-05,
      "loss": 1.8172,
      "num_input_tokens_seen": 8381416688,
      "step": 10653
    },
    {
      "epoch": 1.130277954593677,
      "grad_norm": 0.5711441760421464,
      "learning_rate": 4.8931939994679347e-05,
      "loss": 1.6191,
      "num_input_tokens_seen": 8382203568,
      "step": 10654
    },
    {
      "epoch": 1.1303840441332484,
      "grad_norm": 0.494499392033502,
      "learning_rate": 4.8931739020928434e-05,
      "loss": 1.7433,
      "num_input_tokens_seen": 8382990384,
      "step": 10655
    },
    {
      "epoch": 1.13049013367282,
      "grad_norm": 0.4043413116289246,
      "learning_rate": 4.893153802868379e-05,
      "loss": 1.8328,
      "num_input_tokens_seen": 8383777168,
      "step": 10656
    },
    {
      "epoch": 1.1305962232123912,
      "grad_norm": 0.3801746627456471,
      "learning_rate": 4.8931337017945536e-05,
      "loss": 1.7212,
      "num_input_tokens_seen": 8384563984,
      "step": 10657
    },
    {
      "epoch": 1.1307023127519626,
      "grad_norm": 0.5665743118930628,
      "learning_rate": 4.8931135988713864e-05,
      "loss": 1.969,
      "num_input_tokens_seen": 8385350784,
      "step": 10658
    },
    {
      "epoch": 1.1308084022915341,
      "grad_norm": 0.3678732010087532,
      "learning_rate": 4.893093494098891e-05,
      "loss": 1.7493,
      "num_input_tokens_seen": 8386137552,
      "step": 10659
    },
    {
      "epoch": 1.1309144918311054,
      "grad_norm": 0.5247703157676161,
      "learning_rate": 4.8930733874770816e-05,
      "loss": 1.7754,
      "num_input_tokens_seen": 8386924384,
      "step": 10660
    },
    {
      "epoch": 1.1310205813706768,
      "grad_norm": 0.38274953247301285,
      "learning_rate": 4.8930532790059766e-05,
      "loss": 1.7889,
      "num_input_tokens_seen": 8387711200,
      "step": 10661
    },
    {
      "epoch": 1.1311266709102483,
      "grad_norm": 0.3909432885706584,
      "learning_rate": 4.89303316868559e-05,
      "loss": 1.7404,
      "num_input_tokens_seen": 8388498032,
      "step": 10662
    },
    {
      "epoch": 1.1312327604498196,
      "grad_norm": 0.34477905319177016,
      "learning_rate": 4.893013056515937e-05,
      "loss": 1.8009,
      "num_input_tokens_seen": 8389284816,
      "step": 10663
    },
    {
      "epoch": 1.131338849989391,
      "grad_norm": 0.45680907116837827,
      "learning_rate": 4.892992942497034e-05,
      "loss": 1.8782,
      "num_input_tokens_seen": 8390071504,
      "step": 10664
    },
    {
      "epoch": 1.1314449395289625,
      "grad_norm": 0.3848202574951557,
      "learning_rate": 4.8929728266288975e-05,
      "loss": 1.843,
      "num_input_tokens_seen": 8390858240,
      "step": 10665
    },
    {
      "epoch": 1.1315510290685338,
      "grad_norm": 0.3822111487673948,
      "learning_rate": 4.892952708911541e-05,
      "loss": 1.8257,
      "num_input_tokens_seen": 8391644944,
      "step": 10666
    },
    {
      "epoch": 1.1316571186081053,
      "grad_norm": 0.4902261402849548,
      "learning_rate": 4.8929325893449805e-05,
      "loss": 1.8023,
      "num_input_tokens_seen": 8392431616,
      "step": 10667
    },
    {
      "epoch": 1.1317632081476767,
      "grad_norm": 0.36083861505839254,
      "learning_rate": 4.892912467929232e-05,
      "loss": 1.7671,
      "num_input_tokens_seen": 8393218368,
      "step": 10668
    },
    {
      "epoch": 1.131869297687248,
      "grad_norm": 0.41677548448714635,
      "learning_rate": 4.892892344664312e-05,
      "loss": 1.7458,
      "num_input_tokens_seen": 8394005088,
      "step": 10669
    },
    {
      "epoch": 1.1319753872268195,
      "grad_norm": 0.3699111536562012,
      "learning_rate": 4.892872219550233e-05,
      "loss": 1.732,
      "num_input_tokens_seen": 8394791984,
      "step": 10670
    },
    {
      "epoch": 1.132081476766391,
      "grad_norm": 0.44338895171537995,
      "learning_rate": 4.8928520925870145e-05,
      "loss": 1.875,
      "num_input_tokens_seen": 8395578688,
      "step": 10671
    },
    {
      "epoch": 1.1321875663059622,
      "grad_norm": 0.5502450181334192,
      "learning_rate": 4.892831963774669e-05,
      "loss": 1.8044,
      "num_input_tokens_seen": 8396365488,
      "step": 10672
    },
    {
      "epoch": 1.1322936558455337,
      "grad_norm": 0.40736222235445835,
      "learning_rate": 4.8928118331132134e-05,
      "loss": 1.7422,
      "num_input_tokens_seen": 8397152240,
      "step": 10673
    },
    {
      "epoch": 1.1323997453851051,
      "grad_norm": 0.4017997673985742,
      "learning_rate": 4.892791700602663e-05,
      "loss": 1.7953,
      "num_input_tokens_seen": 8397938960,
      "step": 10674
    },
    {
      "epoch": 1.1325058349246764,
      "grad_norm": 0.4270196073015908,
      "learning_rate": 4.892771566243033e-05,
      "loss": 1.828,
      "num_input_tokens_seen": 8398725744,
      "step": 10675
    },
    {
      "epoch": 1.1326119244642479,
      "grad_norm": 0.35916742486752856,
      "learning_rate": 4.89275143003434e-05,
      "loss": 1.6588,
      "num_input_tokens_seen": 8399512560,
      "step": 10676
    },
    {
      "epoch": 1.132718014003819,
      "grad_norm": 0.4266777363696424,
      "learning_rate": 4.892731291976599e-05,
      "loss": 1.8596,
      "num_input_tokens_seen": 8400299376,
      "step": 10677
    },
    {
      "epoch": 1.1328241035433906,
      "grad_norm": 0.36012978522490086,
      "learning_rate": 4.8927111520698256e-05,
      "loss": 1.8053,
      "num_input_tokens_seen": 8401086160,
      "step": 10678
    },
    {
      "epoch": 1.132930193082962,
      "grad_norm": 0.5003580333224157,
      "learning_rate": 4.8926910103140344e-05,
      "loss": 1.7638,
      "num_input_tokens_seen": 8401872896,
      "step": 10679
    },
    {
      "epoch": 1.1330362826225335,
      "grad_norm": 0.3776595190554651,
      "learning_rate": 4.892670866709243e-05,
      "loss": 1.7844,
      "num_input_tokens_seen": 8402659520,
      "step": 10680
    },
    {
      "epoch": 1.1331423721621048,
      "grad_norm": 0.39276841071151847,
      "learning_rate": 4.8926507212554637e-05,
      "loss": 1.8705,
      "num_input_tokens_seen": 8403446288,
      "step": 10681
    },
    {
      "epoch": 1.1332484617016763,
      "grad_norm": 0.36102551478184775,
      "learning_rate": 4.892630573952716e-05,
      "loss": 1.6805,
      "num_input_tokens_seen": 8404233056,
      "step": 10682
    },
    {
      "epoch": 1.1333545512412475,
      "grad_norm": 0.3780908991531852,
      "learning_rate": 4.892610424801013e-05,
      "loss": 1.8077,
      "num_input_tokens_seen": 8405019744,
      "step": 10683
    },
    {
      "epoch": 1.133460640780819,
      "grad_norm": 0.4562455076675797,
      "learning_rate": 4.8925902738003704e-05,
      "loss": 1.7987,
      "num_input_tokens_seen": 8405806480,
      "step": 10684
    },
    {
      "epoch": 1.1335667303203905,
      "grad_norm": 0.35931083835279837,
      "learning_rate": 4.892570120950805e-05,
      "loss": 1.8458,
      "num_input_tokens_seen": 8406593280,
      "step": 10685
    },
    {
      "epoch": 1.1336728198599617,
      "grad_norm": 0.3802939540621937,
      "learning_rate": 4.892549966252331e-05,
      "loss": 1.7521,
      "num_input_tokens_seen": 8407380096,
      "step": 10686
    },
    {
      "epoch": 1.1337789093995332,
      "grad_norm": 0.5063197290454055,
      "learning_rate": 4.892529809704965e-05,
      "loss": 1.8241,
      "num_input_tokens_seen": 8408166800,
      "step": 10687
    },
    {
      "epoch": 1.1338849989391047,
      "grad_norm": 0.32282805129834063,
      "learning_rate": 4.892509651308722e-05,
      "loss": 1.6809,
      "num_input_tokens_seen": 8408953696,
      "step": 10688
    },
    {
      "epoch": 1.133991088478676,
      "grad_norm": 0.3969718634685224,
      "learning_rate": 4.892489491063618e-05,
      "loss": 1.6753,
      "num_input_tokens_seen": 8409740496,
      "step": 10689
    },
    {
      "epoch": 1.1340971780182474,
      "grad_norm": 0.5466100812608122,
      "learning_rate": 4.892469328969668e-05,
      "loss": 1.8356,
      "num_input_tokens_seen": 8410527232,
      "step": 10690
    },
    {
      "epoch": 1.1342032675578189,
      "grad_norm": 0.389161068553408,
      "learning_rate": 4.892449165026888e-05,
      "loss": 1.7773,
      "num_input_tokens_seen": 8411313888,
      "step": 10691
    },
    {
      "epoch": 1.1343093570973901,
      "grad_norm": 0.4604991146293256,
      "learning_rate": 4.8924289992352933e-05,
      "loss": 1.8451,
      "num_input_tokens_seen": 8412100640,
      "step": 10692
    },
    {
      "epoch": 1.1344154466369616,
      "grad_norm": 0.42130012926500954,
      "learning_rate": 4.8924088315949004e-05,
      "loss": 1.8757,
      "num_input_tokens_seen": 8412887360,
      "step": 10693
    },
    {
      "epoch": 1.134521536176533,
      "grad_norm": 0.40608983797815335,
      "learning_rate": 4.892388662105724e-05,
      "loss": 1.8335,
      "num_input_tokens_seen": 8413674128,
      "step": 10694
    },
    {
      "epoch": 1.1346276257161043,
      "grad_norm": 0.3994820879576297,
      "learning_rate": 4.892368490767779e-05,
      "loss": 1.6519,
      "num_input_tokens_seen": 8414460880,
      "step": 10695
    },
    {
      "epoch": 1.1347337152556758,
      "grad_norm": 0.5002231566958784,
      "learning_rate": 4.892348317581082e-05,
      "loss": 1.8791,
      "num_input_tokens_seen": 8415247696,
      "step": 10696
    },
    {
      "epoch": 1.1348398047952473,
      "grad_norm": 0.42488724748797807,
      "learning_rate": 4.892328142545649e-05,
      "loss": 1.781,
      "num_input_tokens_seen": 8416034464,
      "step": 10697
    },
    {
      "epoch": 1.1349458943348185,
      "grad_norm": 0.4336058117339977,
      "learning_rate": 4.892307965661495e-05,
      "loss": 1.7518,
      "num_input_tokens_seen": 8416821344,
      "step": 10698
    },
    {
      "epoch": 1.13505198387439,
      "grad_norm": 0.45157500189499955,
      "learning_rate": 4.892287786928635e-05,
      "loss": 1.8263,
      "num_input_tokens_seen": 8417608000,
      "step": 10699
    },
    {
      "epoch": 1.1351580734139615,
      "grad_norm": 0.4521230648455445,
      "learning_rate": 4.8922676063470855e-05,
      "loss": 1.9075,
      "num_input_tokens_seen": 8418394784,
      "step": 10700
    },
    {
      "epoch": 1.1352641629535327,
      "grad_norm": 0.4674092237337076,
      "learning_rate": 4.8922474239168616e-05,
      "loss": 1.9289,
      "num_input_tokens_seen": 8419181536,
      "step": 10701
    },
    {
      "epoch": 1.1353702524931042,
      "grad_norm": 0.37527306117436016,
      "learning_rate": 4.8922272396379795e-05,
      "loss": 1.7648,
      "num_input_tokens_seen": 8419968208,
      "step": 10702
    },
    {
      "epoch": 1.1354763420326757,
      "grad_norm": 0.41392341650596165,
      "learning_rate": 4.892207053510454e-05,
      "loss": 1.8445,
      "num_input_tokens_seen": 8420754848,
      "step": 10703
    },
    {
      "epoch": 1.135582431572247,
      "grad_norm": 0.3909751494420355,
      "learning_rate": 4.892186865534301e-05,
      "loss": 1.8112,
      "num_input_tokens_seen": 8421541632,
      "step": 10704
    },
    {
      "epoch": 1.1356885211118184,
      "grad_norm": 0.46382062272598223,
      "learning_rate": 4.8921666757095365e-05,
      "loss": 1.8884,
      "num_input_tokens_seen": 8422328368,
      "step": 10705
    },
    {
      "epoch": 1.1357946106513899,
      "grad_norm": 0.3823030129727599,
      "learning_rate": 4.892146484036176e-05,
      "loss": 1.7343,
      "num_input_tokens_seen": 8423115264,
      "step": 10706
    },
    {
      "epoch": 1.1359007001909611,
      "grad_norm": 0.38155058686579646,
      "learning_rate": 4.8921262905142346e-05,
      "loss": 1.9126,
      "num_input_tokens_seen": 8423902032,
      "step": 10707
    },
    {
      "epoch": 1.1360067897305326,
      "grad_norm": 0.4621973360004359,
      "learning_rate": 4.892106095143728e-05,
      "loss": 1.8749,
      "num_input_tokens_seen": 8424688784,
      "step": 10708
    },
    {
      "epoch": 1.136112879270104,
      "grad_norm": 0.4380207035352573,
      "learning_rate": 4.892085897924672e-05,
      "loss": 1.937,
      "num_input_tokens_seen": 8425475504,
      "step": 10709
    },
    {
      "epoch": 1.1362189688096753,
      "grad_norm": 0.45067164294420825,
      "learning_rate": 4.8920656988570825e-05,
      "loss": 1.9514,
      "num_input_tokens_seen": 8426262240,
      "step": 10710
    },
    {
      "epoch": 1.1363250583492468,
      "grad_norm": 0.40260718642539073,
      "learning_rate": 4.8920454979409744e-05,
      "loss": 1.804,
      "num_input_tokens_seen": 8427048992,
      "step": 10711
    },
    {
      "epoch": 1.136431147888818,
      "grad_norm": 0.47392728301439024,
      "learning_rate": 4.892025295176365e-05,
      "loss": 1.7987,
      "num_input_tokens_seen": 8427835776,
      "step": 10712
    },
    {
      "epoch": 1.1365372374283895,
      "grad_norm": 0.36672795570920186,
      "learning_rate": 4.8920050905632675e-05,
      "loss": 1.6208,
      "num_input_tokens_seen": 8428622640,
      "step": 10713
    },
    {
      "epoch": 1.136643326967961,
      "grad_norm": 0.4379759724064636,
      "learning_rate": 4.891984884101698e-05,
      "loss": 1.5954,
      "num_input_tokens_seen": 8429409392,
      "step": 10714
    },
    {
      "epoch": 1.1367494165075325,
      "grad_norm": 0.4513089058188358,
      "learning_rate": 4.891964675791674e-05,
      "loss": 1.8274,
      "num_input_tokens_seen": 8430196160,
      "step": 10715
    },
    {
      "epoch": 1.1368555060471037,
      "grad_norm": 0.5444800310330336,
      "learning_rate": 4.891944465633209e-05,
      "loss": 1.9219,
      "num_input_tokens_seen": 8430982912,
      "step": 10716
    },
    {
      "epoch": 1.1369615955866752,
      "grad_norm": 0.41352056000248405,
      "learning_rate": 4.8919242536263205e-05,
      "loss": 1.895,
      "num_input_tokens_seen": 8431769776,
      "step": 10717
    },
    {
      "epoch": 1.1370676851262465,
      "grad_norm": 0.4616420836134401,
      "learning_rate": 4.8919040397710226e-05,
      "loss": 1.8963,
      "num_input_tokens_seen": 8432556512,
      "step": 10718
    },
    {
      "epoch": 1.137173774665818,
      "grad_norm": 0.480848979978878,
      "learning_rate": 4.891883824067331e-05,
      "loss": 1.8209,
      "num_input_tokens_seen": 8433343360,
      "step": 10719
    },
    {
      "epoch": 1.1372798642053894,
      "grad_norm": 0.6152458160568386,
      "learning_rate": 4.8918636065152624e-05,
      "loss": 1.8614,
      "num_input_tokens_seen": 8434130224,
      "step": 10720
    },
    {
      "epoch": 1.1373859537449607,
      "grad_norm": 0.44236835206568614,
      "learning_rate": 4.891843387114832e-05,
      "loss": 1.7958,
      "num_input_tokens_seen": 8434917088,
      "step": 10721
    },
    {
      "epoch": 1.1374920432845321,
      "grad_norm": 0.6364613200873706,
      "learning_rate": 4.8918231658660545e-05,
      "loss": 1.868,
      "num_input_tokens_seen": 8435704000,
      "step": 10722
    },
    {
      "epoch": 1.1375981328241036,
      "grad_norm": 0.4632423909891254,
      "learning_rate": 4.891802942768947e-05,
      "loss": 1.7837,
      "num_input_tokens_seen": 8436490736,
      "step": 10723
    },
    {
      "epoch": 1.1377042223636749,
      "grad_norm": 0.6800759015337762,
      "learning_rate": 4.891782717823523e-05,
      "loss": 1.8382,
      "num_input_tokens_seen": 8437277472,
      "step": 10724
    },
    {
      "epoch": 1.1378103119032463,
      "grad_norm": 0.40314700105019113,
      "learning_rate": 4.891762491029801e-05,
      "loss": 1.6833,
      "num_input_tokens_seen": 8438064272,
      "step": 10725
    },
    {
      "epoch": 1.1379164014428178,
      "grad_norm": 0.5017650499686169,
      "learning_rate": 4.891742262387794e-05,
      "loss": 1.7435,
      "num_input_tokens_seen": 8438851056,
      "step": 10726
    },
    {
      "epoch": 1.138022490982389,
      "grad_norm": 0.6468173092813552,
      "learning_rate": 4.89172203189752e-05,
      "loss": 1.928,
      "num_input_tokens_seen": 8439637808,
      "step": 10727
    },
    {
      "epoch": 1.1381285805219605,
      "grad_norm": 0.381608962486717,
      "learning_rate": 4.891701799558992e-05,
      "loss": 1.8118,
      "num_input_tokens_seen": 8440424592,
      "step": 10728
    },
    {
      "epoch": 1.138234670061532,
      "grad_norm": 0.5542530523354755,
      "learning_rate": 4.891681565372228e-05,
      "loss": 1.8382,
      "num_input_tokens_seen": 8441211408,
      "step": 10729
    },
    {
      "epoch": 1.1383407596011033,
      "grad_norm": 0.4134536342634362,
      "learning_rate": 4.8916613293372423e-05,
      "loss": 1.7905,
      "num_input_tokens_seen": 8441998304,
      "step": 10730
    },
    {
      "epoch": 1.1384468491406747,
      "grad_norm": 0.4205087710407881,
      "learning_rate": 4.891641091454051e-05,
      "loss": 1.8307,
      "num_input_tokens_seen": 8442785152,
      "step": 10731
    },
    {
      "epoch": 1.1385529386802462,
      "grad_norm": 0.35893974838150317,
      "learning_rate": 4.891620851722669e-05,
      "loss": 1.6118,
      "num_input_tokens_seen": 8443571920,
      "step": 10732
    },
    {
      "epoch": 1.1386590282198175,
      "grad_norm": 0.5326702170802678,
      "learning_rate": 4.891600610143113e-05,
      "loss": 1.8128,
      "num_input_tokens_seen": 8444358640,
      "step": 10733
    },
    {
      "epoch": 1.138765117759389,
      "grad_norm": 0.4278785332338703,
      "learning_rate": 4.891580366715399e-05,
      "loss": 1.8454,
      "num_input_tokens_seen": 8445145440,
      "step": 10734
    },
    {
      "epoch": 1.1388712072989604,
      "grad_norm": 0.4922849683855717,
      "learning_rate": 4.8915601214395415e-05,
      "loss": 1.7791,
      "num_input_tokens_seen": 8445932208,
      "step": 10735
    },
    {
      "epoch": 1.1389772968385317,
      "grad_norm": 0.46092365464095286,
      "learning_rate": 4.891539874315556e-05,
      "loss": 1.7452,
      "num_input_tokens_seen": 8446718976,
      "step": 10736
    },
    {
      "epoch": 1.1390833863781031,
      "grad_norm": 0.47887082666730657,
      "learning_rate": 4.8915196253434593e-05,
      "loss": 1.7983,
      "num_input_tokens_seen": 8447505808,
      "step": 10737
    },
    {
      "epoch": 1.1391894759176746,
      "grad_norm": 0.44074465765401305,
      "learning_rate": 4.8914993745232654e-05,
      "loss": 1.8013,
      "num_input_tokens_seen": 8448292528,
      "step": 10738
    },
    {
      "epoch": 1.1392955654572459,
      "grad_norm": 0.7844350568067049,
      "learning_rate": 4.891479121854991e-05,
      "loss": 1.9414,
      "num_input_tokens_seen": 8449079200,
      "step": 10739
    },
    {
      "epoch": 1.1394016549968173,
      "grad_norm": 0.5764873640657,
      "learning_rate": 4.891458867338653e-05,
      "loss": 1.781,
      "num_input_tokens_seen": 8449865984,
      "step": 10740
    },
    {
      "epoch": 1.1395077445363886,
      "grad_norm": 0.7475970196891195,
      "learning_rate": 4.891438610974265e-05,
      "loss": 1.9002,
      "num_input_tokens_seen": 8450652608,
      "step": 10741
    },
    {
      "epoch": 1.13961383407596,
      "grad_norm": 0.5011929657515587,
      "learning_rate": 4.891418352761844e-05,
      "loss": 1.8289,
      "num_input_tokens_seen": 8451439424,
      "step": 10742
    },
    {
      "epoch": 1.1397199236155315,
      "grad_norm": 0.7455011666216909,
      "learning_rate": 4.891398092701404e-05,
      "loss": 1.9555,
      "num_input_tokens_seen": 8452226128,
      "step": 10743
    },
    {
      "epoch": 1.139826013155103,
      "grad_norm": 0.417502445241831,
      "learning_rate": 4.8913778307929625e-05,
      "loss": 1.6485,
      "num_input_tokens_seen": 8453012928,
      "step": 10744
    },
    {
      "epoch": 1.1399321026946743,
      "grad_norm": 0.6816520288659427,
      "learning_rate": 4.8913575670365344e-05,
      "loss": 1.8599,
      "num_input_tokens_seen": 8453799632,
      "step": 10745
    },
    {
      "epoch": 1.1400381922342457,
      "grad_norm": 0.4184469851843111,
      "learning_rate": 4.8913373014321346e-05,
      "loss": 1.9158,
      "num_input_tokens_seen": 8454586464,
      "step": 10746
    },
    {
      "epoch": 1.140144281773817,
      "grad_norm": 0.5303710443259344,
      "learning_rate": 4.89131703397978e-05,
      "loss": 1.8507,
      "num_input_tokens_seen": 8455373248,
      "step": 10747
    },
    {
      "epoch": 1.1402503713133885,
      "grad_norm": 0.4284720976351163,
      "learning_rate": 4.891296764679486e-05,
      "loss": 1.8177,
      "num_input_tokens_seen": 8456159968,
      "step": 10748
    },
    {
      "epoch": 1.14035646085296,
      "grad_norm": 0.4477066628324073,
      "learning_rate": 4.891276493531267e-05,
      "loss": 1.6789,
      "num_input_tokens_seen": 8456946672,
      "step": 10749
    },
    {
      "epoch": 1.1404625503925314,
      "grad_norm": 0.5011575550124014,
      "learning_rate": 4.891256220535141e-05,
      "loss": 1.8659,
      "num_input_tokens_seen": 8457733440,
      "step": 10750
    },
    {
      "epoch": 1.1405686399321027,
      "grad_norm": 0.40639543875835976,
      "learning_rate": 4.891235945691122e-05,
      "loss": 1.7238,
      "num_input_tokens_seen": 8458520256,
      "step": 10751
    },
    {
      "epoch": 1.1406747294716741,
      "grad_norm": 0.409940873076833,
      "learning_rate": 4.8912156689992255e-05,
      "loss": 1.8141,
      "num_input_tokens_seen": 8459306960,
      "step": 10752
    },
    {
      "epoch": 1.1407808190112454,
      "grad_norm": 0.4949223520960093,
      "learning_rate": 4.891195390459468e-05,
      "loss": 1.8434,
      "num_input_tokens_seen": 8460093680,
      "step": 10753
    },
    {
      "epoch": 1.1408869085508169,
      "grad_norm": 0.39084177576807944,
      "learning_rate": 4.891175110071865e-05,
      "loss": 1.9343,
      "num_input_tokens_seen": 8460880368,
      "step": 10754
    },
    {
      "epoch": 1.1409929980903883,
      "grad_norm": 0.39574863985009634,
      "learning_rate": 4.891154827836432e-05,
      "loss": 1.6591,
      "num_input_tokens_seen": 8461667184,
      "step": 10755
    },
    {
      "epoch": 1.1410990876299596,
      "grad_norm": 0.4201489315611716,
      "learning_rate": 4.8911345437531843e-05,
      "loss": 1.7362,
      "num_input_tokens_seen": 8462454016,
      "step": 10756
    },
    {
      "epoch": 1.141205177169531,
      "grad_norm": 0.38935532094179887,
      "learning_rate": 4.891114257822138e-05,
      "loss": 1.6571,
      "num_input_tokens_seen": 8463240768,
      "step": 10757
    },
    {
      "epoch": 1.1413112667091025,
      "grad_norm": 0.4950621562375525,
      "learning_rate": 4.891093970043309e-05,
      "loss": 1.8124,
      "num_input_tokens_seen": 8464027440,
      "step": 10758
    },
    {
      "epoch": 1.1414173562486738,
      "grad_norm": 0.416902714949089,
      "learning_rate": 4.8910736804167135e-05,
      "loss": 1.8564,
      "num_input_tokens_seen": 8464814256,
      "step": 10759
    },
    {
      "epoch": 1.1415234457882453,
      "grad_norm": 0.4668421483886524,
      "learning_rate": 4.8910533889423655e-05,
      "loss": 1.7606,
      "num_input_tokens_seen": 8465601056,
      "step": 10760
    },
    {
      "epoch": 1.1416295353278167,
      "grad_norm": 0.38307125262595126,
      "learning_rate": 4.891033095620282e-05,
      "loss": 1.7613,
      "num_input_tokens_seen": 8466387824,
      "step": 10761
    },
    {
      "epoch": 1.141735624867388,
      "grad_norm": 0.370027591047579,
      "learning_rate": 4.891012800450478e-05,
      "loss": 1.7241,
      "num_input_tokens_seen": 8467174560,
      "step": 10762
    },
    {
      "epoch": 1.1418417144069595,
      "grad_norm": 0.3860975397119142,
      "learning_rate": 4.8909925034329696e-05,
      "loss": 1.7759,
      "num_input_tokens_seen": 8467961296,
      "step": 10763
    },
    {
      "epoch": 1.141947803946531,
      "grad_norm": 0.3745382198173552,
      "learning_rate": 4.890972204567772e-05,
      "loss": 1.8001,
      "num_input_tokens_seen": 8468748064,
      "step": 10764
    },
    {
      "epoch": 1.1420538934861022,
      "grad_norm": 0.4000842224568421,
      "learning_rate": 4.890951903854902e-05,
      "loss": 1.863,
      "num_input_tokens_seen": 8469534832,
      "step": 10765
    },
    {
      "epoch": 1.1421599830256737,
      "grad_norm": 0.390897069346438,
      "learning_rate": 4.890931601294374e-05,
      "loss": 1.8834,
      "num_input_tokens_seen": 8470321520,
      "step": 10766
    },
    {
      "epoch": 1.1422660725652451,
      "grad_norm": 0.4585066398141845,
      "learning_rate": 4.8909112968862044e-05,
      "loss": 1.8384,
      "num_input_tokens_seen": 8471108336,
      "step": 10767
    },
    {
      "epoch": 1.1423721621048164,
      "grad_norm": 0.4109326115223947,
      "learning_rate": 4.890890990630408e-05,
      "loss": 1.879,
      "num_input_tokens_seen": 8471895040,
      "step": 10768
    },
    {
      "epoch": 1.1424782516443879,
      "grad_norm": 0.4130036830037502,
      "learning_rate": 4.8908706825270026e-05,
      "loss": 2.0275,
      "num_input_tokens_seen": 8472681680,
      "step": 10769
    },
    {
      "epoch": 1.1425843411839594,
      "grad_norm": 0.4720391971862927,
      "learning_rate": 4.890850372576001e-05,
      "loss": 1.9539,
      "num_input_tokens_seen": 8473468464,
      "step": 10770
    },
    {
      "epoch": 1.1426904307235306,
      "grad_norm": 0.4158003839269632,
      "learning_rate": 4.8908300607774214e-05,
      "loss": 1.7153,
      "num_input_tokens_seen": 8474255264,
      "step": 10771
    },
    {
      "epoch": 1.142796520263102,
      "grad_norm": 0.4180490543264372,
      "learning_rate": 4.890809747131278e-05,
      "loss": 1.8514,
      "num_input_tokens_seen": 8475042080,
      "step": 10772
    },
    {
      "epoch": 1.1429026098026736,
      "grad_norm": 0.3848753212067447,
      "learning_rate": 4.890789431637587e-05,
      "loss": 1.8123,
      "num_input_tokens_seen": 8475828832,
      "step": 10773
    },
    {
      "epoch": 1.1430086993422448,
      "grad_norm": 0.44732367994134314,
      "learning_rate": 4.890769114296364e-05,
      "loss": 1.757,
      "num_input_tokens_seen": 8476615600,
      "step": 10774
    },
    {
      "epoch": 1.1431147888818163,
      "grad_norm": 0.4235045942302685,
      "learning_rate": 4.890748795107625e-05,
      "loss": 1.7128,
      "num_input_tokens_seen": 8477402368,
      "step": 10775
    },
    {
      "epoch": 1.1432208784213875,
      "grad_norm": 0.44755654397133776,
      "learning_rate": 4.8907284740713854e-05,
      "loss": 1.9837,
      "num_input_tokens_seen": 8478189040,
      "step": 10776
    },
    {
      "epoch": 1.143326967960959,
      "grad_norm": 0.6494793603889284,
      "learning_rate": 4.890708151187661e-05,
      "loss": 1.7785,
      "num_input_tokens_seen": 8478975936,
      "step": 10777
    },
    {
      "epoch": 1.1434330575005305,
      "grad_norm": 0.44878496527668904,
      "learning_rate": 4.890687826456468e-05,
      "loss": 1.8071,
      "num_input_tokens_seen": 8479762560,
      "step": 10778
    },
    {
      "epoch": 1.143539147040102,
      "grad_norm": 0.4664651317390865,
      "learning_rate": 4.8906674998778215e-05,
      "loss": 1.8268,
      "num_input_tokens_seen": 8480549360,
      "step": 10779
    },
    {
      "epoch": 1.1436452365796732,
      "grad_norm": 0.5970930994127053,
      "learning_rate": 4.8906471714517364e-05,
      "loss": 1.8442,
      "num_input_tokens_seen": 8481336208,
      "step": 10780
    },
    {
      "epoch": 1.1437513261192447,
      "grad_norm": 0.4364469396341191,
      "learning_rate": 4.89062684117823e-05,
      "loss": 1.7776,
      "num_input_tokens_seen": 8482123008,
      "step": 10781
    },
    {
      "epoch": 1.143857415658816,
      "grad_norm": 0.8104884726169488,
      "learning_rate": 4.890606509057317e-05,
      "loss": 1.8094,
      "num_input_tokens_seen": 8482909840,
      "step": 10782
    },
    {
      "epoch": 1.1439635051983874,
      "grad_norm": 0.48106419244772497,
      "learning_rate": 4.8905861750890136e-05,
      "loss": 1.6561,
      "num_input_tokens_seen": 8483696576,
      "step": 10783
    },
    {
      "epoch": 1.1440695947379589,
      "grad_norm": 0.842514739118494,
      "learning_rate": 4.890565839273336e-05,
      "loss": 1.9899,
      "num_input_tokens_seen": 8484483216,
      "step": 10784
    },
    {
      "epoch": 1.1441756842775304,
      "grad_norm": 0.44453574839568527,
      "learning_rate": 4.890545501610298e-05,
      "loss": 1.732,
      "num_input_tokens_seen": 8485270000,
      "step": 10785
    },
    {
      "epoch": 1.1442817738171016,
      "grad_norm": 0.674483487959963,
      "learning_rate": 4.890525162099917e-05,
      "loss": 1.902,
      "num_input_tokens_seen": 8486056720,
      "step": 10786
    },
    {
      "epoch": 1.144387863356673,
      "grad_norm": 0.4854542821157609,
      "learning_rate": 4.890504820742209e-05,
      "loss": 1.7515,
      "num_input_tokens_seen": 8486843488,
      "step": 10787
    },
    {
      "epoch": 1.1444939528962443,
      "grad_norm": 0.5549821710168191,
      "learning_rate": 4.890484477537188e-05,
      "loss": 1.781,
      "num_input_tokens_seen": 8487630256,
      "step": 10788
    },
    {
      "epoch": 1.1446000424358158,
      "grad_norm": 0.5810730608368,
      "learning_rate": 4.890464132484871e-05,
      "loss": 1.7845,
      "num_input_tokens_seen": 8488417008,
      "step": 10789
    },
    {
      "epoch": 1.1447061319753873,
      "grad_norm": 0.41050438255582866,
      "learning_rate": 4.8904437855852736e-05,
      "loss": 1.6999,
      "num_input_tokens_seen": 8489203680,
      "step": 10790
    },
    {
      "epoch": 1.1448122215149585,
      "grad_norm": 0.9282400714007073,
      "learning_rate": 4.8904234368384114e-05,
      "loss": 1.8676,
      "num_input_tokens_seen": 8489990448,
      "step": 10791
    },
    {
      "epoch": 1.14491831105453,
      "grad_norm": 0.4353543674567389,
      "learning_rate": 4.8904030862443004e-05,
      "loss": 1.8472,
      "num_input_tokens_seen": 8490777232,
      "step": 10792
    },
    {
      "epoch": 1.1450244005941015,
      "grad_norm": 0.8618522946164813,
      "learning_rate": 4.890382733802956e-05,
      "loss": 1.9227,
      "num_input_tokens_seen": 8491563984,
      "step": 10793
    },
    {
      "epoch": 1.1451304901336727,
      "grad_norm": 0.41828380658304526,
      "learning_rate": 4.890362379514394e-05,
      "loss": 1.7523,
      "num_input_tokens_seen": 8492350784,
      "step": 10794
    },
    {
      "epoch": 1.1452365796732442,
      "grad_norm": 0.5961562381987289,
      "learning_rate": 4.8903420233786296e-05,
      "loss": 1.8652,
      "num_input_tokens_seen": 8493137488,
      "step": 10795
    },
    {
      "epoch": 1.1453426692128157,
      "grad_norm": 0.4877755169525608,
      "learning_rate": 4.8903216653956795e-05,
      "loss": 1.8621,
      "num_input_tokens_seen": 8493924176,
      "step": 10796
    },
    {
      "epoch": 1.145448758752387,
      "grad_norm": 0.3667827290670022,
      "learning_rate": 4.890301305565559e-05,
      "loss": 1.7666,
      "num_input_tokens_seen": 8494711024,
      "step": 10797
    },
    {
      "epoch": 1.1455548482919584,
      "grad_norm": 0.5847933494031538,
      "learning_rate": 4.890280943888283e-05,
      "loss": 1.877,
      "num_input_tokens_seen": 8495497744,
      "step": 10798
    },
    {
      "epoch": 1.14566093783153,
      "grad_norm": 0.4205955778383156,
      "learning_rate": 4.8902605803638686e-05,
      "loss": 2.0058,
      "num_input_tokens_seen": 8496284560,
      "step": 10799
    },
    {
      "epoch": 1.1457670273711011,
      "grad_norm": 0.4258790803471459,
      "learning_rate": 4.890240214992331e-05,
      "loss": 1.779,
      "num_input_tokens_seen": 8497071280,
      "step": 10800
    },
    {
      "epoch": 1.1458731169106726,
      "grad_norm": 0.5641570126275619,
      "learning_rate": 4.890219847773686e-05,
      "loss": 1.8628,
      "num_input_tokens_seen": 8497857984,
      "step": 10801
    },
    {
      "epoch": 1.145979206450244,
      "grad_norm": 0.39133885036026667,
      "learning_rate": 4.8901994787079485e-05,
      "loss": 1.6437,
      "num_input_tokens_seen": 8498644736,
      "step": 10802
    },
    {
      "epoch": 1.1460852959898153,
      "grad_norm": 0.4463509097635783,
      "learning_rate": 4.890179107795135e-05,
      "loss": 1.8242,
      "num_input_tokens_seen": 8499431584,
      "step": 10803
    },
    {
      "epoch": 1.1461913855293868,
      "grad_norm": 0.43089171404177895,
      "learning_rate": 4.8901587350352624e-05,
      "loss": 1.8185,
      "num_input_tokens_seen": 8500218288,
      "step": 10804
    },
    {
      "epoch": 1.1462974750689583,
      "grad_norm": 0.5468925233660811,
      "learning_rate": 4.890138360428345e-05,
      "loss": 1.7725,
      "num_input_tokens_seen": 8501004944,
      "step": 10805
    },
    {
      "epoch": 1.1464035646085295,
      "grad_norm": 0.3887707694715515,
      "learning_rate": 4.890117983974398e-05,
      "loss": 1.7955,
      "num_input_tokens_seen": 8501791808,
      "step": 10806
    },
    {
      "epoch": 1.146509654148101,
      "grad_norm": 0.45126637017601984,
      "learning_rate": 4.890097605673438e-05,
      "loss": 1.804,
      "num_input_tokens_seen": 8502578608,
      "step": 10807
    },
    {
      "epoch": 1.1466157436876725,
      "grad_norm": 0.38309362129287783,
      "learning_rate": 4.890077225525481e-05,
      "loss": 1.7587,
      "num_input_tokens_seen": 8503365376,
      "step": 10808
    },
    {
      "epoch": 1.1467218332272437,
      "grad_norm": 0.4195546910354162,
      "learning_rate": 4.890056843530543e-05,
      "loss": 1.773,
      "num_input_tokens_seen": 8504152128,
      "step": 10809
    },
    {
      "epoch": 1.1468279227668152,
      "grad_norm": 0.3899080676861252,
      "learning_rate": 4.890036459688638e-05,
      "loss": 1.7927,
      "num_input_tokens_seen": 8504938864,
      "step": 10810
    },
    {
      "epoch": 1.1469340123063865,
      "grad_norm": 0.36966653981510617,
      "learning_rate": 4.890016073999784e-05,
      "loss": 1.8309,
      "num_input_tokens_seen": 8505725552,
      "step": 10811
    },
    {
      "epoch": 1.147040101845958,
      "grad_norm": 0.4754455681101282,
      "learning_rate": 4.889995686463996e-05,
      "loss": 2.0159,
      "num_input_tokens_seen": 8506512288,
      "step": 10812
    },
    {
      "epoch": 1.1471461913855294,
      "grad_norm": 0.44470357275148514,
      "learning_rate": 4.8899752970812885e-05,
      "loss": 1.9,
      "num_input_tokens_seen": 8507299024,
      "step": 10813
    },
    {
      "epoch": 1.147252280925101,
      "grad_norm": 0.40412100636463416,
      "learning_rate": 4.889954905851678e-05,
      "loss": 1.9065,
      "num_input_tokens_seen": 8508085712,
      "step": 10814
    },
    {
      "epoch": 1.1473583704646722,
      "grad_norm": 0.39782755027886957,
      "learning_rate": 4.889934512775182e-05,
      "loss": 1.8151,
      "num_input_tokens_seen": 8508872512,
      "step": 10815
    },
    {
      "epoch": 1.1474644600042436,
      "grad_norm": 0.4180730189708159,
      "learning_rate": 4.889914117851813e-05,
      "loss": 1.9319,
      "num_input_tokens_seen": 8509659216,
      "step": 10816
    },
    {
      "epoch": 1.1475705495438149,
      "grad_norm": 0.4295405100313818,
      "learning_rate": 4.889893721081589e-05,
      "loss": 1.8086,
      "num_input_tokens_seen": 8510445984,
      "step": 10817
    },
    {
      "epoch": 1.1476766390833864,
      "grad_norm": 0.4732137937568427,
      "learning_rate": 4.889873322464526e-05,
      "loss": 1.8876,
      "num_input_tokens_seen": 8511232832,
      "step": 10818
    },
    {
      "epoch": 1.1477827286229578,
      "grad_norm": 0.3813495167967186,
      "learning_rate": 4.8898529220006385e-05,
      "loss": 1.7655,
      "num_input_tokens_seen": 8512019584,
      "step": 10819
    },
    {
      "epoch": 1.147888818162529,
      "grad_norm": 0.43456678663619625,
      "learning_rate": 4.889832519689943e-05,
      "loss": 1.9333,
      "num_input_tokens_seen": 8512806352,
      "step": 10820
    },
    {
      "epoch": 1.1479949077021006,
      "grad_norm": 0.5359931607049016,
      "learning_rate": 4.889812115532455e-05,
      "loss": 1.8468,
      "num_input_tokens_seen": 8513593072,
      "step": 10821
    },
    {
      "epoch": 1.148100997241672,
      "grad_norm": 0.37013714970600764,
      "learning_rate": 4.88979170952819e-05,
      "loss": 1.6686,
      "num_input_tokens_seen": 8514379888,
      "step": 10822
    },
    {
      "epoch": 1.1482070867812433,
      "grad_norm": 0.47923486334976817,
      "learning_rate": 4.889771301677164e-05,
      "loss": 1.8593,
      "num_input_tokens_seen": 8515166688,
      "step": 10823
    },
    {
      "epoch": 1.1483131763208148,
      "grad_norm": 0.36320553332023764,
      "learning_rate": 4.889750891979393e-05,
      "loss": 1.8399,
      "num_input_tokens_seen": 8515953440,
      "step": 10824
    },
    {
      "epoch": 1.1484192658603862,
      "grad_norm": 0.5389788558310806,
      "learning_rate": 4.889730480434893e-05,
      "loss": 1.9142,
      "num_input_tokens_seen": 8516740096,
      "step": 10825
    },
    {
      "epoch": 1.1485253553999575,
      "grad_norm": 0.41492791144783303,
      "learning_rate": 4.889710067043679e-05,
      "loss": 1.769,
      "num_input_tokens_seen": 8517526880,
      "step": 10826
    },
    {
      "epoch": 1.148631444939529,
      "grad_norm": 0.4507771025862415,
      "learning_rate": 4.8896896518057675e-05,
      "loss": 1.8173,
      "num_input_tokens_seen": 8518313648,
      "step": 10827
    },
    {
      "epoch": 1.1487375344791004,
      "grad_norm": 0.41731233937880025,
      "learning_rate": 4.8896692347211735e-05,
      "loss": 1.9062,
      "num_input_tokens_seen": 8519100400,
      "step": 10828
    },
    {
      "epoch": 1.1488436240186717,
      "grad_norm": 0.35235334606417806,
      "learning_rate": 4.8896488157899134e-05,
      "loss": 1.7595,
      "num_input_tokens_seen": 8519887200,
      "step": 10829
    },
    {
      "epoch": 1.1489497135582432,
      "grad_norm": 0.3534332647423517,
      "learning_rate": 4.889628395012003e-05,
      "loss": 1.8081,
      "num_input_tokens_seen": 8520674096,
      "step": 10830
    },
    {
      "epoch": 1.1490558030978146,
      "grad_norm": 0.3651952691348487,
      "learning_rate": 4.889607972387458e-05,
      "loss": 1.7398,
      "num_input_tokens_seen": 8521460912,
      "step": 10831
    },
    {
      "epoch": 1.1491618926373859,
      "grad_norm": 0.4345368971927444,
      "learning_rate": 4.889587547916293e-05,
      "loss": 1.9291,
      "num_input_tokens_seen": 8522247728,
      "step": 10832
    },
    {
      "epoch": 1.1492679821769574,
      "grad_norm": 0.3644554325160696,
      "learning_rate": 4.8895671215985264e-05,
      "loss": 1.8085,
      "num_input_tokens_seen": 8523034432,
      "step": 10833
    },
    {
      "epoch": 1.1493740717165288,
      "grad_norm": 0.39429819134005106,
      "learning_rate": 4.8895466934341715e-05,
      "loss": 1.7467,
      "num_input_tokens_seen": 8523821136,
      "step": 10834
    },
    {
      "epoch": 1.1494801612561,
      "grad_norm": 0.583794875540592,
      "learning_rate": 4.8895262634232455e-05,
      "loss": 1.8149,
      "num_input_tokens_seen": 8524607952,
      "step": 10835
    },
    {
      "epoch": 1.1495862507956716,
      "grad_norm": 0.4644688976982592,
      "learning_rate": 4.889505831565764e-05,
      "loss": 1.8139,
      "num_input_tokens_seen": 8525394736,
      "step": 10836
    },
    {
      "epoch": 1.149692340335243,
      "grad_norm": 0.4435718995279779,
      "learning_rate": 4.889485397861742e-05,
      "loss": 1.7444,
      "num_input_tokens_seen": 8526181424,
      "step": 10837
    },
    {
      "epoch": 1.1497984298748143,
      "grad_norm": 0.35902518704157976,
      "learning_rate": 4.889464962311195e-05,
      "loss": 1.6781,
      "num_input_tokens_seen": 8526968160,
      "step": 10838
    },
    {
      "epoch": 1.1499045194143858,
      "grad_norm": 0.5989837457443538,
      "learning_rate": 4.8894445249141406e-05,
      "loss": 1.8683,
      "num_input_tokens_seen": 8527754944,
      "step": 10839
    },
    {
      "epoch": 1.1500106089539572,
      "grad_norm": 0.42253723514891833,
      "learning_rate": 4.8894240856705934e-05,
      "loss": 1.8752,
      "num_input_tokens_seen": 8528541696,
      "step": 10840
    },
    {
      "epoch": 1.1501166984935285,
      "grad_norm": 0.38629626399066275,
      "learning_rate": 4.889403644580569e-05,
      "loss": 1.8222,
      "num_input_tokens_seen": 8529328480,
      "step": 10841
    },
    {
      "epoch": 1.1502227880331,
      "grad_norm": 0.3905392985986941,
      "learning_rate": 4.8893832016440845e-05,
      "loss": 1.8561,
      "num_input_tokens_seen": 8530115264,
      "step": 10842
    },
    {
      "epoch": 1.1503288775726714,
      "grad_norm": 0.3627553800905971,
      "learning_rate": 4.8893627568611547e-05,
      "loss": 1.7487,
      "num_input_tokens_seen": 8530901984,
      "step": 10843
    },
    {
      "epoch": 1.1504349671122427,
      "grad_norm": 0.38011726217681663,
      "learning_rate": 4.8893423102317946e-05,
      "loss": 1.8102,
      "num_input_tokens_seen": 8531688704,
      "step": 10844
    },
    {
      "epoch": 1.1505410566518142,
      "grad_norm": 0.4408770909162253,
      "learning_rate": 4.889321861756021e-05,
      "loss": 1.859,
      "num_input_tokens_seen": 8532475536,
      "step": 10845
    },
    {
      "epoch": 1.1506471461913854,
      "grad_norm": 0.5185970065634732,
      "learning_rate": 4.88930141143385e-05,
      "loss": 1.6858,
      "num_input_tokens_seen": 8533262288,
      "step": 10846
    },
    {
      "epoch": 1.150753235730957,
      "grad_norm": 0.5424347740216424,
      "learning_rate": 4.8892809592652966e-05,
      "loss": 1.9171,
      "num_input_tokens_seen": 8534049008,
      "step": 10847
    },
    {
      "epoch": 1.1508593252705284,
      "grad_norm": 0.38129858864020777,
      "learning_rate": 4.889260505250377e-05,
      "loss": 1.7816,
      "num_input_tokens_seen": 8534835760,
      "step": 10848
    },
    {
      "epoch": 1.1509654148100998,
      "grad_norm": 0.44864093702045343,
      "learning_rate": 4.8892400493891074e-05,
      "loss": 1.8525,
      "num_input_tokens_seen": 8535622560,
      "step": 10849
    },
    {
      "epoch": 1.151071504349671,
      "grad_norm": 0.48978760888544404,
      "learning_rate": 4.889219591681503e-05,
      "loss": 1.7328,
      "num_input_tokens_seen": 8536409296,
      "step": 10850
    },
    {
      "epoch": 1.1511775938892426,
      "grad_norm": 0.4269623470752065,
      "learning_rate": 4.8891991321275796e-05,
      "loss": 1.7411,
      "num_input_tokens_seen": 8537196016,
      "step": 10851
    },
    {
      "epoch": 1.1512836834288138,
      "grad_norm": 0.43388505519790366,
      "learning_rate": 4.8891786707273534e-05,
      "loss": 1.6615,
      "num_input_tokens_seen": 8537982864,
      "step": 10852
    },
    {
      "epoch": 1.1513897729683853,
      "grad_norm": 0.4281993742652404,
      "learning_rate": 4.889158207480841e-05,
      "loss": 1.8676,
      "num_input_tokens_seen": 8538769648,
      "step": 10853
    },
    {
      "epoch": 1.1514958625079568,
      "grad_norm": 0.42492600041021794,
      "learning_rate": 4.889137742388056e-05,
      "loss": 1.8343,
      "num_input_tokens_seen": 8539556464,
      "step": 10854
    },
    {
      "epoch": 1.151601952047528,
      "grad_norm": 0.3979726164639733,
      "learning_rate": 4.889117275449015e-05,
      "loss": 1.7499,
      "num_input_tokens_seen": 8540343216,
      "step": 10855
    },
    {
      "epoch": 1.1517080415870995,
      "grad_norm": 0.4262894431623787,
      "learning_rate": 4.889096806663735e-05,
      "loss": 1.8448,
      "num_input_tokens_seen": 8541130096,
      "step": 10856
    },
    {
      "epoch": 1.151814131126671,
      "grad_norm": 0.39130848496200843,
      "learning_rate": 4.889076336032231e-05,
      "loss": 1.7244,
      "num_input_tokens_seen": 8541916912,
      "step": 10857
    },
    {
      "epoch": 1.1519202206662422,
      "grad_norm": 0.3625252740057641,
      "learning_rate": 4.889055863554519e-05,
      "loss": 1.8179,
      "num_input_tokens_seen": 8542703648,
      "step": 10858
    },
    {
      "epoch": 1.1520263102058137,
      "grad_norm": 0.4740541846575506,
      "learning_rate": 4.8890353892306154e-05,
      "loss": 1.8624,
      "num_input_tokens_seen": 8543490352,
      "step": 10859
    },
    {
      "epoch": 1.1521323997453852,
      "grad_norm": 0.3810790597169478,
      "learning_rate": 4.889014913060535e-05,
      "loss": 1.7259,
      "num_input_tokens_seen": 8544277120,
      "step": 10860
    },
    {
      "epoch": 1.1522384892849564,
      "grad_norm": 0.5437052792215955,
      "learning_rate": 4.888994435044293e-05,
      "loss": 1.8647,
      "num_input_tokens_seen": 8545063888,
      "step": 10861
    },
    {
      "epoch": 1.152344578824528,
      "grad_norm": 0.367336264942543,
      "learning_rate": 4.888973955181907e-05,
      "loss": 1.7893,
      "num_input_tokens_seen": 8545850656,
      "step": 10862
    },
    {
      "epoch": 1.1524506683640994,
      "grad_norm": 0.65469060630209,
      "learning_rate": 4.8889534734733915e-05,
      "loss": 1.8416,
      "num_input_tokens_seen": 8546637504,
      "step": 10863
    },
    {
      "epoch": 1.1525567579036706,
      "grad_norm": 0.5741289311585951,
      "learning_rate": 4.888932989918763e-05,
      "loss": 1.8951,
      "num_input_tokens_seen": 8547424208,
      "step": 10864
    },
    {
      "epoch": 1.152662847443242,
      "grad_norm": 0.562766534146884,
      "learning_rate": 4.888912504518037e-05,
      "loss": 1.8448,
      "num_input_tokens_seen": 8548210928,
      "step": 10865
    },
    {
      "epoch": 1.1527689369828136,
      "grad_norm": 0.4149558780697981,
      "learning_rate": 4.88889201727123e-05,
      "loss": 1.7694,
      "num_input_tokens_seen": 8548997760,
      "step": 10866
    },
    {
      "epoch": 1.1528750265223848,
      "grad_norm": 0.6264280371305765,
      "learning_rate": 4.8888715281783575e-05,
      "loss": 1.8718,
      "num_input_tokens_seen": 8549784512,
      "step": 10867
    },
    {
      "epoch": 1.1529811160619563,
      "grad_norm": 0.37451925960475385,
      "learning_rate": 4.8888510372394354e-05,
      "loss": 1.667,
      "num_input_tokens_seen": 8550571216,
      "step": 10868
    },
    {
      "epoch": 1.1530872056015278,
      "grad_norm": 0.48437608921185343,
      "learning_rate": 4.888830544454478e-05,
      "loss": 1.8314,
      "num_input_tokens_seen": 8551357952,
      "step": 10869
    },
    {
      "epoch": 1.153193295141099,
      "grad_norm": 0.4833661556247952,
      "learning_rate": 4.8888100498235036e-05,
      "loss": 1.8479,
      "num_input_tokens_seen": 8552144720,
      "step": 10870
    },
    {
      "epoch": 1.1532993846806705,
      "grad_norm": 0.5904335903668362,
      "learning_rate": 4.888789553346527e-05,
      "loss": 1.9677,
      "num_input_tokens_seen": 8552931536,
      "step": 10871
    },
    {
      "epoch": 1.153405474220242,
      "grad_norm": 0.4254063779739225,
      "learning_rate": 4.8887690550235634e-05,
      "loss": 1.8348,
      "num_input_tokens_seen": 8553718320,
      "step": 10872
    },
    {
      "epoch": 1.1535115637598132,
      "grad_norm": 0.49010874867206156,
      "learning_rate": 4.888748554854629e-05,
      "loss": 1.9505,
      "num_input_tokens_seen": 8554505024,
      "step": 10873
    },
    {
      "epoch": 1.1536176532993847,
      "grad_norm": 0.4568274312107073,
      "learning_rate": 4.88872805283974e-05,
      "loss": 1.7758,
      "num_input_tokens_seen": 8555291840,
      "step": 10874
    },
    {
      "epoch": 1.153723742838956,
      "grad_norm": 0.45607479116259847,
      "learning_rate": 4.8887075489789124e-05,
      "loss": 1.8664,
      "num_input_tokens_seen": 8556078656,
      "step": 10875
    },
    {
      "epoch": 1.1538298323785274,
      "grad_norm": 0.5412954452700935,
      "learning_rate": 4.888687043272161e-05,
      "loss": 1.923,
      "num_input_tokens_seen": 8556865520,
      "step": 10876
    },
    {
      "epoch": 1.153935921918099,
      "grad_norm": 0.41744443273570436,
      "learning_rate": 4.8886665357195025e-05,
      "loss": 1.8301,
      "num_input_tokens_seen": 8557652192,
      "step": 10877
    },
    {
      "epoch": 1.1540420114576704,
      "grad_norm": 0.727700444437802,
      "learning_rate": 4.888646026320953e-05,
      "loss": 1.9138,
      "num_input_tokens_seen": 8558439008,
      "step": 10878
    },
    {
      "epoch": 1.1541481009972416,
      "grad_norm": 0.3573495924791833,
      "learning_rate": 4.888625515076528e-05,
      "loss": 1.7961,
      "num_input_tokens_seen": 8559225872,
      "step": 10879
    },
    {
      "epoch": 1.154254190536813,
      "grad_norm": 0.5314916232730409,
      "learning_rate": 4.888605001986243e-05,
      "loss": 1.8526,
      "num_input_tokens_seen": 8560012672,
      "step": 10880
    },
    {
      "epoch": 1.1543602800763844,
      "grad_norm": 0.39993362480247885,
      "learning_rate": 4.888584487050114e-05,
      "loss": 1.8698,
      "num_input_tokens_seen": 8560799488,
      "step": 10881
    },
    {
      "epoch": 1.1544663696159558,
      "grad_norm": 0.41445581982533475,
      "learning_rate": 4.888563970268158e-05,
      "loss": 1.7343,
      "num_input_tokens_seen": 8561586208,
      "step": 10882
    },
    {
      "epoch": 1.1545724591555273,
      "grad_norm": 0.4709868100523546,
      "learning_rate": 4.8885434516403886e-05,
      "loss": 1.9404,
      "num_input_tokens_seen": 8562372992,
      "step": 10883
    },
    {
      "epoch": 1.1546785486950988,
      "grad_norm": 0.4052996498958667,
      "learning_rate": 4.8885229311668236e-05,
      "loss": 1.8613,
      "num_input_tokens_seen": 8563159776,
      "step": 10884
    },
    {
      "epoch": 1.15478463823467,
      "grad_norm": 0.4166787707042383,
      "learning_rate": 4.8885024088474776e-05,
      "loss": 1.8993,
      "num_input_tokens_seen": 8563946496,
      "step": 10885
    },
    {
      "epoch": 1.1548907277742415,
      "grad_norm": 0.3761179786065828,
      "learning_rate": 4.888481884682367e-05,
      "loss": 1.8296,
      "num_input_tokens_seen": 8564733216,
      "step": 10886
    },
    {
      "epoch": 1.1549968173138128,
      "grad_norm": 0.44082758595532384,
      "learning_rate": 4.888461358671508e-05,
      "loss": 1.8604,
      "num_input_tokens_seen": 8565519920,
      "step": 10887
    },
    {
      "epoch": 1.1551029068533842,
      "grad_norm": 0.3701080084342454,
      "learning_rate": 4.888440830814917e-05,
      "loss": 1.8301,
      "num_input_tokens_seen": 8566306640,
      "step": 10888
    },
    {
      "epoch": 1.1552089963929557,
      "grad_norm": 0.36845471732514473,
      "learning_rate": 4.888420301112607e-05,
      "loss": 1.6876,
      "num_input_tokens_seen": 8567093440,
      "step": 10889
    },
    {
      "epoch": 1.155315085932527,
      "grad_norm": 0.4738448583798032,
      "learning_rate": 4.888399769564598e-05,
      "loss": 1.8216,
      "num_input_tokens_seen": 8567880224,
      "step": 10890
    },
    {
      "epoch": 1.1554211754720984,
      "grad_norm": 0.3738770450885628,
      "learning_rate": 4.888379236170903e-05,
      "loss": 1.7904,
      "num_input_tokens_seen": 8568666976,
      "step": 10891
    },
    {
      "epoch": 1.15552726501167,
      "grad_norm": 0.38369732001133544,
      "learning_rate": 4.888358700931538e-05,
      "loss": 1.7043,
      "num_input_tokens_seen": 8569453744,
      "step": 10892
    },
    {
      "epoch": 1.1556333545512412,
      "grad_norm": 0.4247546712263503,
      "learning_rate": 4.88833816384652e-05,
      "loss": 1.7191,
      "num_input_tokens_seen": 8570240496,
      "step": 10893
    },
    {
      "epoch": 1.1557394440908126,
      "grad_norm": 0.3534416530794126,
      "learning_rate": 4.888317624915864e-05,
      "loss": 1.7707,
      "num_input_tokens_seen": 8571027280,
      "step": 10894
    },
    {
      "epoch": 1.1558455336303841,
      "grad_norm": 0.4978624432542496,
      "learning_rate": 4.888297084139586e-05,
      "loss": 1.8187,
      "num_input_tokens_seen": 8571814064,
      "step": 10895
    },
    {
      "epoch": 1.1559516231699554,
      "grad_norm": 0.383525545416769,
      "learning_rate": 4.8882765415177024e-05,
      "loss": 1.7241,
      "num_input_tokens_seen": 8572600800,
      "step": 10896
    },
    {
      "epoch": 1.1560577127095268,
      "grad_norm": 0.43632939011244276,
      "learning_rate": 4.888255997050229e-05,
      "loss": 1.8223,
      "num_input_tokens_seen": 8573387584,
      "step": 10897
    },
    {
      "epoch": 1.1561638022490983,
      "grad_norm": 0.35213562715473373,
      "learning_rate": 4.888235450737181e-05,
      "loss": 1.6989,
      "num_input_tokens_seen": 8574174352,
      "step": 10898
    },
    {
      "epoch": 1.1562698917886696,
      "grad_norm": 0.40503351099492935,
      "learning_rate": 4.888214902578575e-05,
      "loss": 1.8287,
      "num_input_tokens_seen": 8574961088,
      "step": 10899
    },
    {
      "epoch": 1.156375981328241,
      "grad_norm": 0.397362607658758,
      "learning_rate": 4.8881943525744265e-05,
      "loss": 1.6174,
      "num_input_tokens_seen": 8575747888,
      "step": 10900
    },
    {
      "epoch": 1.1564820708678125,
      "grad_norm": 0.6063713446698461,
      "learning_rate": 4.8881738007247526e-05,
      "loss": 1.9612,
      "num_input_tokens_seen": 8576534688,
      "step": 10901
    },
    {
      "epoch": 1.1565881604073838,
      "grad_norm": 0.45343293364344955,
      "learning_rate": 4.888153247029567e-05,
      "loss": 1.866,
      "num_input_tokens_seen": 8577321520,
      "step": 10902
    },
    {
      "epoch": 1.1566942499469552,
      "grad_norm": 0.5625411484601447,
      "learning_rate": 4.888132691488886e-05,
      "loss": 1.797,
      "num_input_tokens_seen": 8578108384,
      "step": 10903
    },
    {
      "epoch": 1.1568003394865267,
      "grad_norm": 0.3791818976978669,
      "learning_rate": 4.888112134102727e-05,
      "loss": 1.9257,
      "num_input_tokens_seen": 8578895232,
      "step": 10904
    },
    {
      "epoch": 1.156906429026098,
      "grad_norm": 0.5075142502044392,
      "learning_rate": 4.8880915748711046e-05,
      "loss": 1.6792,
      "num_input_tokens_seen": 8579682080,
      "step": 10905
    },
    {
      "epoch": 1.1570125185656694,
      "grad_norm": 0.49447734169538354,
      "learning_rate": 4.8880710137940354e-05,
      "loss": 1.7496,
      "num_input_tokens_seen": 8580468848,
      "step": 10906
    },
    {
      "epoch": 1.157118608105241,
      "grad_norm": 0.6045038947897325,
      "learning_rate": 4.8880504508715355e-05,
      "loss": 1.6197,
      "num_input_tokens_seen": 8581255680,
      "step": 10907
    },
    {
      "epoch": 1.1572246976448122,
      "grad_norm": 0.695143390315443,
      "learning_rate": 4.888029886103619e-05,
      "loss": 1.8397,
      "num_input_tokens_seen": 8582042384,
      "step": 10908
    },
    {
      "epoch": 1.1573307871843836,
      "grad_norm": 0.5750702921933848,
      "learning_rate": 4.888009319490304e-05,
      "loss": 1.7488,
      "num_input_tokens_seen": 8582829120,
      "step": 10909
    },
    {
      "epoch": 1.157436876723955,
      "grad_norm": 0.8566788185705833,
      "learning_rate": 4.887988751031605e-05,
      "loss": 1.7994,
      "num_input_tokens_seen": 8583615872,
      "step": 10910
    },
    {
      "epoch": 1.1575429662635264,
      "grad_norm": 0.4754394354734871,
      "learning_rate": 4.887968180727539e-05,
      "loss": 1.8712,
      "num_input_tokens_seen": 8584402624,
      "step": 10911
    },
    {
      "epoch": 1.1576490558030978,
      "grad_norm": 0.8122489903795459,
      "learning_rate": 4.887947608578121e-05,
      "loss": 1.7132,
      "num_input_tokens_seen": 8585189376,
      "step": 10912
    },
    {
      "epoch": 1.1577551453426693,
      "grad_norm": 0.41967790762943386,
      "learning_rate": 4.8879270345833675e-05,
      "loss": 1.7755,
      "num_input_tokens_seen": 8585976144,
      "step": 10913
    },
    {
      "epoch": 1.1578612348822406,
      "grad_norm": 0.5101477266565233,
      "learning_rate": 4.8879064587432933e-05,
      "loss": 1.8476,
      "num_input_tokens_seen": 8586762928,
      "step": 10914
    },
    {
      "epoch": 1.157967324421812,
      "grad_norm": 0.44824818130471566,
      "learning_rate": 4.887885881057915e-05,
      "loss": 1.7435,
      "num_input_tokens_seen": 8587549696,
      "step": 10915
    },
    {
      "epoch": 1.1580734139613833,
      "grad_norm": 0.4117979644909844,
      "learning_rate": 4.8878653015272493e-05,
      "loss": 1.7333,
      "num_input_tokens_seen": 8588336432,
      "step": 10916
    },
    {
      "epoch": 1.1581795035009548,
      "grad_norm": 0.4153418787873155,
      "learning_rate": 4.887844720151311e-05,
      "loss": 1.8239,
      "num_input_tokens_seen": 8589123168,
      "step": 10917
    },
    {
      "epoch": 1.1582855930405263,
      "grad_norm": 0.438290511321943,
      "learning_rate": 4.887824136930116e-05,
      "loss": 1.8614,
      "num_input_tokens_seen": 8589909888,
      "step": 10918
    },
    {
      "epoch": 1.1583916825800977,
      "grad_norm": 0.46577548260204504,
      "learning_rate": 4.8878035518636814e-05,
      "loss": 1.8452,
      "num_input_tokens_seen": 8590696656,
      "step": 10919
    },
    {
      "epoch": 1.158497772119669,
      "grad_norm": 0.40606684754893846,
      "learning_rate": 4.887782964952021e-05,
      "loss": 1.8268,
      "num_input_tokens_seen": 8591483472,
      "step": 10920
    },
    {
      "epoch": 1.1586038616592405,
      "grad_norm": 0.5201252741391242,
      "learning_rate": 4.887762376195153e-05,
      "loss": 1.7818,
      "num_input_tokens_seen": 8592270272,
      "step": 10921
    },
    {
      "epoch": 1.1587099511988117,
      "grad_norm": 0.43372257297256017,
      "learning_rate": 4.887741785593092e-05,
      "loss": 1.9392,
      "num_input_tokens_seen": 8593057056,
      "step": 10922
    },
    {
      "epoch": 1.1588160407383832,
      "grad_norm": 0.4346805289008439,
      "learning_rate": 4.887721193145854e-05,
      "loss": 1.7934,
      "num_input_tokens_seen": 8593843776,
      "step": 10923
    },
    {
      "epoch": 1.1589221302779547,
      "grad_norm": 0.47634253063348364,
      "learning_rate": 4.887700598853455e-05,
      "loss": 1.7561,
      "num_input_tokens_seen": 8594630624,
      "step": 10924
    },
    {
      "epoch": 1.159028219817526,
      "grad_norm": 0.4015824158916893,
      "learning_rate": 4.887680002715912e-05,
      "loss": 1.7534,
      "num_input_tokens_seen": 8595417424,
      "step": 10925
    },
    {
      "epoch": 1.1591343093570974,
      "grad_norm": 0.3221218034842577,
      "learning_rate": 4.887659404733239e-05,
      "loss": 1.5703,
      "num_input_tokens_seen": 8596204240,
      "step": 10926
    },
    {
      "epoch": 1.1592403988966689,
      "grad_norm": 0.5674722859357353,
      "learning_rate": 4.8876388049054537e-05,
      "loss": 1.8929,
      "num_input_tokens_seen": 8596990960,
      "step": 10927
    },
    {
      "epoch": 1.15934648843624,
      "grad_norm": 0.3554298920583078,
      "learning_rate": 4.88761820323257e-05,
      "loss": 1.7584,
      "num_input_tokens_seen": 8597777776,
      "step": 10928
    },
    {
      "epoch": 1.1594525779758116,
      "grad_norm": 0.37652927065635294,
      "learning_rate": 4.887597599714606e-05,
      "loss": 1.7661,
      "num_input_tokens_seen": 8598564432,
      "step": 10929
    },
    {
      "epoch": 1.159558667515383,
      "grad_norm": 0.4437519381886491,
      "learning_rate": 4.887576994351577e-05,
      "loss": 1.7852,
      "num_input_tokens_seen": 8599351152,
      "step": 10930
    },
    {
      "epoch": 1.1596647570549543,
      "grad_norm": 0.3647340699872204,
      "learning_rate": 4.887556387143498e-05,
      "loss": 1.7752,
      "num_input_tokens_seen": 8600137888,
      "step": 10931
    },
    {
      "epoch": 1.1597708465945258,
      "grad_norm": 0.3401909617909994,
      "learning_rate": 4.887535778090385e-05,
      "loss": 1.7659,
      "num_input_tokens_seen": 8600924688,
      "step": 10932
    },
    {
      "epoch": 1.1598769361340973,
      "grad_norm": 0.40084739044103057,
      "learning_rate": 4.887515167192255e-05,
      "loss": 1.9846,
      "num_input_tokens_seen": 8601711504,
      "step": 10933
    },
    {
      "epoch": 1.1599830256736685,
      "grad_norm": 0.36839267887941013,
      "learning_rate": 4.887494554449123e-05,
      "loss": 1.8458,
      "num_input_tokens_seen": 8602498160,
      "step": 10934
    },
    {
      "epoch": 1.16008911521324,
      "grad_norm": 0.37638374486368115,
      "learning_rate": 4.8874739398610054e-05,
      "loss": 1.7425,
      "num_input_tokens_seen": 8603284928,
      "step": 10935
    },
    {
      "epoch": 1.1601952047528115,
      "grad_norm": 0.36178760904903756,
      "learning_rate": 4.887453323427918e-05,
      "loss": 1.8339,
      "num_input_tokens_seen": 8604071616,
      "step": 10936
    },
    {
      "epoch": 1.1603012942923827,
      "grad_norm": 0.3520546655623554,
      "learning_rate": 4.887432705149877e-05,
      "loss": 1.7666,
      "num_input_tokens_seen": 8604858432,
      "step": 10937
    },
    {
      "epoch": 1.1604073838319542,
      "grad_norm": 0.38325013437065913,
      "learning_rate": 4.8874120850268974e-05,
      "loss": 1.8541,
      "num_input_tokens_seen": 8605645200,
      "step": 10938
    },
    {
      "epoch": 1.1605134733715257,
      "grad_norm": 0.39240082361512896,
      "learning_rate": 4.887391463058996e-05,
      "loss": 1.9132,
      "num_input_tokens_seen": 8606432048,
      "step": 10939
    },
    {
      "epoch": 1.160619562911097,
      "grad_norm": 0.4162231966402571,
      "learning_rate": 4.887370839246189e-05,
      "loss": 1.8637,
      "num_input_tokens_seen": 8607218832,
      "step": 10940
    },
    {
      "epoch": 1.1607256524506684,
      "grad_norm": 0.4070074888179735,
      "learning_rate": 4.887350213588491e-05,
      "loss": 1.7427,
      "num_input_tokens_seen": 8608005616,
      "step": 10941
    },
    {
      "epoch": 1.1608317419902399,
      "grad_norm": 0.4222360476164213,
      "learning_rate": 4.88732958608592e-05,
      "loss": 1.746,
      "num_input_tokens_seen": 8608792368,
      "step": 10942
    },
    {
      "epoch": 1.1609378315298111,
      "grad_norm": 0.7142972317629182,
      "learning_rate": 4.88730895673849e-05,
      "loss": 1.8739,
      "num_input_tokens_seen": 8609579040,
      "step": 10943
    },
    {
      "epoch": 1.1610439210693826,
      "grad_norm": 0.3699642936834044,
      "learning_rate": 4.887288325546217e-05,
      "loss": 1.7168,
      "num_input_tokens_seen": 8610365824,
      "step": 10944
    },
    {
      "epoch": 1.1611500106089538,
      "grad_norm": 0.4897691697562729,
      "learning_rate": 4.8872676925091185e-05,
      "loss": 1.7002,
      "num_input_tokens_seen": 8611152672,
      "step": 10945
    },
    {
      "epoch": 1.1612561001485253,
      "grad_norm": 0.39805039209994564,
      "learning_rate": 4.88724705762721e-05,
      "loss": 1.6985,
      "num_input_tokens_seen": 8611939456,
      "step": 10946
    },
    {
      "epoch": 1.1613621896880968,
      "grad_norm": 0.5201748719512466,
      "learning_rate": 4.8872264209005066e-05,
      "loss": 1.8071,
      "num_input_tokens_seen": 8612726320,
      "step": 10947
    },
    {
      "epoch": 1.1614682792276683,
      "grad_norm": 0.49651328432913333,
      "learning_rate": 4.887205782329024e-05,
      "loss": 1.916,
      "num_input_tokens_seen": 8613513008,
      "step": 10948
    },
    {
      "epoch": 1.1615743687672395,
      "grad_norm": 0.4213728462860287,
      "learning_rate": 4.88718514191278e-05,
      "loss": 1.7422,
      "num_input_tokens_seen": 8614299856,
      "step": 10949
    },
    {
      "epoch": 1.161680458306811,
      "grad_norm": 0.4912661577042935,
      "learning_rate": 4.8871644996517886e-05,
      "loss": 1.8662,
      "num_input_tokens_seen": 8615086608,
      "step": 10950
    },
    {
      "epoch": 1.1617865478463822,
      "grad_norm": 0.4053793487810694,
      "learning_rate": 4.887143855546067e-05,
      "loss": 1.7711,
      "num_input_tokens_seen": 8615873344,
      "step": 10951
    },
    {
      "epoch": 1.1618926373859537,
      "grad_norm": 0.40810843454554,
      "learning_rate": 4.88712320959563e-05,
      "loss": 1.8789,
      "num_input_tokens_seen": 8616660096,
      "step": 10952
    },
    {
      "epoch": 1.1619987269255252,
      "grad_norm": 0.35600016316291894,
      "learning_rate": 4.8871025618004944e-05,
      "loss": 1.8469,
      "num_input_tokens_seen": 8617446880,
      "step": 10953
    },
    {
      "epoch": 1.1621048164650964,
      "grad_norm": 0.368514140806466,
      "learning_rate": 4.887081912160676e-05,
      "loss": 1.7435,
      "num_input_tokens_seen": 8618233680,
      "step": 10954
    },
    {
      "epoch": 1.162210906004668,
      "grad_norm": 0.35285597276563985,
      "learning_rate": 4.887061260676191e-05,
      "loss": 1.7214,
      "num_input_tokens_seen": 8619020496,
      "step": 10955
    },
    {
      "epoch": 1.1623169955442394,
      "grad_norm": 0.36954212366187256,
      "learning_rate": 4.8870406073470556e-05,
      "loss": 1.7805,
      "num_input_tokens_seen": 8619807264,
      "step": 10956
    },
    {
      "epoch": 1.1624230850838106,
      "grad_norm": 0.32940102378408603,
      "learning_rate": 4.887019952173284e-05,
      "loss": 1.6908,
      "num_input_tokens_seen": 8620594016,
      "step": 10957
    },
    {
      "epoch": 1.1625291746233821,
      "grad_norm": 0.420684597361044,
      "learning_rate": 4.886999295154894e-05,
      "loss": 1.7744,
      "num_input_tokens_seen": 8621380752,
      "step": 10958
    },
    {
      "epoch": 1.1626352641629536,
      "grad_norm": 0.3750418769513542,
      "learning_rate": 4.886978636291901e-05,
      "loss": 1.8378,
      "num_input_tokens_seen": 8622167408,
      "step": 10959
    },
    {
      "epoch": 1.1627413537025248,
      "grad_norm": 0.4958616925397133,
      "learning_rate": 4.8869579755843216e-05,
      "loss": 1.9068,
      "num_input_tokens_seen": 8622954208,
      "step": 10960
    },
    {
      "epoch": 1.1628474432420963,
      "grad_norm": 0.37894772192797077,
      "learning_rate": 4.886937313032171e-05,
      "loss": 1.8186,
      "num_input_tokens_seen": 8623741040,
      "step": 10961
    },
    {
      "epoch": 1.1629535327816678,
      "grad_norm": 0.6264011110738904,
      "learning_rate": 4.8869166486354646e-05,
      "loss": 1.9124,
      "num_input_tokens_seen": 8624527824,
      "step": 10962
    },
    {
      "epoch": 1.163059622321239,
      "grad_norm": 0.4614496562695244,
      "learning_rate": 4.886895982394218e-05,
      "loss": 1.9007,
      "num_input_tokens_seen": 8625314576,
      "step": 10963
    },
    {
      "epoch": 1.1631657118608105,
      "grad_norm": 0.5364246801255489,
      "learning_rate": 4.88687531430845e-05,
      "loss": 1.6602,
      "num_input_tokens_seen": 8626101296,
      "step": 10964
    },
    {
      "epoch": 1.163271801400382,
      "grad_norm": 0.3871163075137837,
      "learning_rate": 4.886854644378175e-05,
      "loss": 1.8288,
      "num_input_tokens_seen": 8626888112,
      "step": 10965
    },
    {
      "epoch": 1.1633778909399533,
      "grad_norm": 0.5171128284922886,
      "learning_rate": 4.8868339726034075e-05,
      "loss": 1.726,
      "num_input_tokens_seen": 8627674896,
      "step": 10966
    },
    {
      "epoch": 1.1634839804795247,
      "grad_norm": 0.4399720775424767,
      "learning_rate": 4.886813298984165e-05,
      "loss": 1.7989,
      "num_input_tokens_seen": 8628461616,
      "step": 10967
    },
    {
      "epoch": 1.1635900700190962,
      "grad_norm": 0.3885542709951517,
      "learning_rate": 4.8867926235204635e-05,
      "loss": 1.8717,
      "num_input_tokens_seen": 8629248400,
      "step": 10968
    },
    {
      "epoch": 1.1636961595586675,
      "grad_norm": 0.5136942712105093,
      "learning_rate": 4.886771946212319e-05,
      "loss": 1.9239,
      "num_input_tokens_seen": 8630035200,
      "step": 10969
    },
    {
      "epoch": 1.163802249098239,
      "grad_norm": 0.42880902699032086,
      "learning_rate": 4.8867512670597474e-05,
      "loss": 1.7671,
      "num_input_tokens_seen": 8630821984,
      "step": 10970
    },
    {
      "epoch": 1.1639083386378104,
      "grad_norm": 0.4306421593314684,
      "learning_rate": 4.8867305860627635e-05,
      "loss": 1.8329,
      "num_input_tokens_seen": 8631608640,
      "step": 10971
    },
    {
      "epoch": 1.1640144281773817,
      "grad_norm": 0.42201627671733244,
      "learning_rate": 4.8867099032213844e-05,
      "loss": 1.6846,
      "num_input_tokens_seen": 8632395408,
      "step": 10972
    },
    {
      "epoch": 1.1641205177169531,
      "grad_norm": 0.48373521398919794,
      "learning_rate": 4.886689218535626e-05,
      "loss": 1.707,
      "num_input_tokens_seen": 8633182128,
      "step": 10973
    },
    {
      "epoch": 1.1642266072565246,
      "grad_norm": 0.3932502457075636,
      "learning_rate": 4.886668532005504e-05,
      "loss": 1.8852,
      "num_input_tokens_seen": 8633968992,
      "step": 10974
    },
    {
      "epoch": 1.1643326967960959,
      "grad_norm": 0.46851075598590536,
      "learning_rate": 4.886647843631036e-05,
      "loss": 1.759,
      "num_input_tokens_seen": 8634755728,
      "step": 10975
    },
    {
      "epoch": 1.1644387863356673,
      "grad_norm": 0.4075819302956419,
      "learning_rate": 4.886627153412235e-05,
      "loss": 1.7604,
      "num_input_tokens_seen": 8635542416,
      "step": 10976
    },
    {
      "epoch": 1.1645448758752388,
      "grad_norm": 0.3562600678226832,
      "learning_rate": 4.886606461349119e-05,
      "loss": 1.7217,
      "num_input_tokens_seen": 8636329168,
      "step": 10977
    },
    {
      "epoch": 1.16465096541481,
      "grad_norm": 0.4609828121100979,
      "learning_rate": 4.8865857674417036e-05,
      "loss": 1.799,
      "num_input_tokens_seen": 8637115936,
      "step": 10978
    },
    {
      "epoch": 1.1647570549543815,
      "grad_norm": 0.41794740978171174,
      "learning_rate": 4.886565071690005e-05,
      "loss": 1.8666,
      "num_input_tokens_seen": 8637902640,
      "step": 10979
    },
    {
      "epoch": 1.1648631444939528,
      "grad_norm": 0.3911382259083161,
      "learning_rate": 4.886544374094039e-05,
      "loss": 1.7838,
      "num_input_tokens_seen": 8638689424,
      "step": 10980
    },
    {
      "epoch": 1.1649692340335243,
      "grad_norm": 0.4000714243776934,
      "learning_rate": 4.8865236746538213e-05,
      "loss": 1.7897,
      "num_input_tokens_seen": 8639476192,
      "step": 10981
    },
    {
      "epoch": 1.1650753235730957,
      "grad_norm": 0.42852875110818917,
      "learning_rate": 4.886502973369368e-05,
      "loss": 1.5994,
      "num_input_tokens_seen": 8640263024,
      "step": 10982
    },
    {
      "epoch": 1.1651814131126672,
      "grad_norm": 0.44525755208887946,
      "learning_rate": 4.886482270240695e-05,
      "loss": 1.8496,
      "num_input_tokens_seen": 8641049696,
      "step": 10983
    },
    {
      "epoch": 1.1652875026522385,
      "grad_norm": 0.4822073661926403,
      "learning_rate": 4.886461565267819e-05,
      "loss": 1.7771,
      "num_input_tokens_seen": 8641836416,
      "step": 10984
    },
    {
      "epoch": 1.16539359219181,
      "grad_norm": 0.4954203731213458,
      "learning_rate": 4.886440858450755e-05,
      "loss": 1.7688,
      "num_input_tokens_seen": 8642623264,
      "step": 10985
    },
    {
      "epoch": 1.1654996817313812,
      "grad_norm": 0.7390100401389937,
      "learning_rate": 4.8864201497895204e-05,
      "loss": 1.8971,
      "num_input_tokens_seen": 8643410016,
      "step": 10986
    },
    {
      "epoch": 1.1656057712709527,
      "grad_norm": 1.2109895695166204,
      "learning_rate": 4.886399439284129e-05,
      "loss": 1.8472,
      "num_input_tokens_seen": 8644196800,
      "step": 10987
    },
    {
      "epoch": 1.1657118608105241,
      "grad_norm": 0.5434293137977645,
      "learning_rate": 4.8863787269346e-05,
      "loss": 1.7808,
      "num_input_tokens_seen": 8644983520,
      "step": 10988
    },
    {
      "epoch": 1.1658179503500954,
      "grad_norm": 1.092382315771074,
      "learning_rate": 4.886358012740946e-05,
      "loss": 1.6868,
      "num_input_tokens_seen": 8645770320,
      "step": 10989
    },
    {
      "epoch": 1.1659240398896669,
      "grad_norm": 1.086747412086025,
      "learning_rate": 4.886337296703185e-05,
      "loss": 1.9211,
      "num_input_tokens_seen": 8646557168,
      "step": 10990
    },
    {
      "epoch": 1.1660301294292383,
      "grad_norm": 0.490528029476071,
      "learning_rate": 4.886316578821333e-05,
      "loss": 1.8206,
      "num_input_tokens_seen": 8647343968,
      "step": 10991
    },
    {
      "epoch": 1.1661362189688096,
      "grad_norm": 0.540006119019195,
      "learning_rate": 4.8862958590954045e-05,
      "loss": 1.6409,
      "num_input_tokens_seen": 8648130768,
      "step": 10992
    },
    {
      "epoch": 1.166242308508381,
      "grad_norm": 0.5171021339109326,
      "learning_rate": 4.886275137525417e-05,
      "loss": 1.8073,
      "num_input_tokens_seen": 8648917488,
      "step": 10993
    },
    {
      "epoch": 1.1663483980479525,
      "grad_norm": 0.514087685896178,
      "learning_rate": 4.886254414111386e-05,
      "loss": 1.9623,
      "num_input_tokens_seen": 8649704256,
      "step": 10994
    },
    {
      "epoch": 1.1664544875875238,
      "grad_norm": 0.521042268584046,
      "learning_rate": 4.8862336888533286e-05,
      "loss": 1.8268,
      "num_input_tokens_seen": 8650491024,
      "step": 10995
    },
    {
      "epoch": 1.1665605771270953,
      "grad_norm": 0.4002775728594172,
      "learning_rate": 4.886212961751259e-05,
      "loss": 1.8903,
      "num_input_tokens_seen": 8651277760,
      "step": 10996
    },
    {
      "epoch": 1.1666666666666667,
      "grad_norm": 0.615310211790963,
      "learning_rate": 4.8861922328051945e-05,
      "loss": 1.8874,
      "num_input_tokens_seen": 8652064464,
      "step": 10997
    },
    {
      "epoch": 1.166772756206238,
      "grad_norm": 0.42253183262202076,
      "learning_rate": 4.88617150201515e-05,
      "loss": 1.7005,
      "num_input_tokens_seen": 8652851200,
      "step": 10998
    },
    {
      "epoch": 1.1668788457458095,
      "grad_norm": 0.4553044676534517,
      "learning_rate": 4.886150769381143e-05,
      "loss": 1.7453,
      "num_input_tokens_seen": 8653637888,
      "step": 10999
    },
    {
      "epoch": 1.166984935285381,
      "grad_norm": 0.4752756597399731,
      "learning_rate": 4.886130034903188e-05,
      "loss": 1.8595,
      "num_input_tokens_seen": 8654424736,
      "step": 11000
    },
    {
      "epoch": 1.166984935285381,
      "eval_loss": 1.8227615356445312,
      "eval_runtime": 64.2294,
      "eval_samples_per_second": 46.708,
      "eval_steps_per_second": 0.498,
      "num_input_tokens_seen": 8654424736,
      "step": 11000
    },
    {
      "epoch": 1.1670910248249522,
      "grad_norm": 0.3896220003250037,
      "learning_rate": 4.886109298581302e-05,
      "loss": 1.7721,
      "num_input_tokens_seen": 8655211504,
      "step": 11001
    },
    {
      "epoch": 1.1671971143645237,
      "grad_norm": 0.5271552344740004,
      "learning_rate": 4.8860885604155e-05,
      "loss": 1.7599,
      "num_input_tokens_seen": 8655998272,
      "step": 11002
    },
    {
      "epoch": 1.1673032039040951,
      "grad_norm": 0.49936674250926205,
      "learning_rate": 4.8860678204058e-05,
      "loss": 1.784,
      "num_input_tokens_seen": 8656784992,
      "step": 11003
    },
    {
      "epoch": 1.1674092934436664,
      "grad_norm": 0.429444391615549,
      "learning_rate": 4.886047078552216e-05,
      "loss": 1.7658,
      "num_input_tokens_seen": 8657571824,
      "step": 11004
    },
    {
      "epoch": 1.1675153829832379,
      "grad_norm": 0.48859101167081215,
      "learning_rate": 4.886026334854765e-05,
      "loss": 1.686,
      "num_input_tokens_seen": 8658358624,
      "step": 11005
    },
    {
      "epoch": 1.1676214725228093,
      "grad_norm": 0.8636554059587878,
      "learning_rate": 4.886005589313464e-05,
      "loss": 1.8561,
      "num_input_tokens_seen": 8659145344,
      "step": 11006
    },
    {
      "epoch": 1.1677275620623806,
      "grad_norm": 0.7980005721309854,
      "learning_rate": 4.885984841928326e-05,
      "loss": 1.8585,
      "num_input_tokens_seen": 8659932160,
      "step": 11007
    },
    {
      "epoch": 1.167833651601952,
      "grad_norm": 0.8079205868440096,
      "learning_rate": 4.88596409269937e-05,
      "loss": 1.8309,
      "num_input_tokens_seen": 8660718928,
      "step": 11008
    },
    {
      "epoch": 1.1679397411415233,
      "grad_norm": 0.7190584551017055,
      "learning_rate": 4.885943341626611e-05,
      "loss": 1.9309,
      "num_input_tokens_seen": 8661505680,
      "step": 11009
    },
    {
      "epoch": 1.1680458306810948,
      "grad_norm": 0.7220572862290695,
      "learning_rate": 4.8859225887100645e-05,
      "loss": 1.7687,
      "num_input_tokens_seen": 8662292384,
      "step": 11010
    },
    {
      "epoch": 1.1681519202206663,
      "grad_norm": 0.4147786322935888,
      "learning_rate": 4.885901833949748e-05,
      "loss": 1.6102,
      "num_input_tokens_seen": 8663079264,
      "step": 11011
    },
    {
      "epoch": 1.1682580097602377,
      "grad_norm": 1.1368628110426393,
      "learning_rate": 4.885881077345675e-05,
      "loss": 1.7304,
      "num_input_tokens_seen": 8663866080,
      "step": 11012
    },
    {
      "epoch": 1.168364099299809,
      "grad_norm": 0.5292033079996895,
      "learning_rate": 4.885860318897864e-05,
      "loss": 1.7946,
      "num_input_tokens_seen": 8664652816,
      "step": 11013
    },
    {
      "epoch": 1.1684701888393805,
      "grad_norm": 0.7798323581201284,
      "learning_rate": 4.88583955860633e-05,
      "loss": 1.7146,
      "num_input_tokens_seen": 8665439584,
      "step": 11014
    },
    {
      "epoch": 1.1685762783789517,
      "grad_norm": 0.6516283120880799,
      "learning_rate": 4.885818796471089e-05,
      "loss": 1.8973,
      "num_input_tokens_seen": 8666226384,
      "step": 11015
    },
    {
      "epoch": 1.1686823679185232,
      "grad_norm": 0.47625421621673525,
      "learning_rate": 4.885798032492158e-05,
      "loss": 1.8425,
      "num_input_tokens_seen": 8667013168,
      "step": 11016
    },
    {
      "epoch": 1.1687884574580947,
      "grad_norm": 0.7154059313563758,
      "learning_rate": 4.8857772666695515e-05,
      "loss": 1.8402,
      "num_input_tokens_seen": 8667799984,
      "step": 11017
    },
    {
      "epoch": 1.1688945469976662,
      "grad_norm": 0.6342467464125281,
      "learning_rate": 4.8857564990032864e-05,
      "loss": 1.9321,
      "num_input_tokens_seen": 8668586768,
      "step": 11018
    },
    {
      "epoch": 1.1690006365372374,
      "grad_norm": 0.5567803584269918,
      "learning_rate": 4.885735729493379e-05,
      "loss": 1.7814,
      "num_input_tokens_seen": 8669373584,
      "step": 11019
    },
    {
      "epoch": 1.1691067260768089,
      "grad_norm": 0.5091004227312529,
      "learning_rate": 4.885714958139845e-05,
      "loss": 1.7589,
      "num_input_tokens_seen": 8670160368,
      "step": 11020
    },
    {
      "epoch": 1.1692128156163801,
      "grad_norm": 0.4874358872720745,
      "learning_rate": 4.885694184942701e-05,
      "loss": 1.7203,
      "num_input_tokens_seen": 8670947152,
      "step": 11021
    },
    {
      "epoch": 1.1693189051559516,
      "grad_norm": 0.534359228160213,
      "learning_rate": 4.885673409901962e-05,
      "loss": 1.7121,
      "num_input_tokens_seen": 8671734032,
      "step": 11022
    },
    {
      "epoch": 1.169424994695523,
      "grad_norm": 0.49072398328590056,
      "learning_rate": 4.8856526330176445e-05,
      "loss": 1.7862,
      "num_input_tokens_seen": 8672520848,
      "step": 11023
    },
    {
      "epoch": 1.1695310842350943,
      "grad_norm": 0.39035247938711065,
      "learning_rate": 4.885631854289765e-05,
      "loss": 1.6645,
      "num_input_tokens_seen": 8673307696,
      "step": 11024
    },
    {
      "epoch": 1.1696371737746658,
      "grad_norm": 0.4479347523208932,
      "learning_rate": 4.885611073718338e-05,
      "loss": 1.8048,
      "num_input_tokens_seen": 8674094400,
      "step": 11025
    },
    {
      "epoch": 1.1697432633142373,
      "grad_norm": 0.45403843319496445,
      "learning_rate": 4.885590291303382e-05,
      "loss": 1.8581,
      "num_input_tokens_seen": 8674881216,
      "step": 11026
    },
    {
      "epoch": 1.1698493528538085,
      "grad_norm": 0.4094200694336564,
      "learning_rate": 4.885569507044911e-05,
      "loss": 1.7836,
      "num_input_tokens_seen": 8675667968,
      "step": 11027
    },
    {
      "epoch": 1.16995544239338,
      "grad_norm": 0.6067573074377263,
      "learning_rate": 4.885548720942943e-05,
      "loss": 1.8576,
      "num_input_tokens_seen": 8676454720,
      "step": 11028
    },
    {
      "epoch": 1.1700615319329515,
      "grad_norm": 0.4007475674212769,
      "learning_rate": 4.885527932997492e-05,
      "loss": 1.8444,
      "num_input_tokens_seen": 8677241504,
      "step": 11029
    },
    {
      "epoch": 1.1701676214725227,
      "grad_norm": 0.43110597161390696,
      "learning_rate": 4.885507143208575e-05,
      "loss": 1.7395,
      "num_input_tokens_seen": 8678028272,
      "step": 11030
    },
    {
      "epoch": 1.1702737110120942,
      "grad_norm": 0.45877505796624757,
      "learning_rate": 4.8854863515762086e-05,
      "loss": 1.6885,
      "num_input_tokens_seen": 8678815104,
      "step": 11031
    },
    {
      "epoch": 1.1703798005516657,
      "grad_norm": 0.3289671611302243,
      "learning_rate": 4.8854655581004085e-05,
      "loss": 1.6894,
      "num_input_tokens_seen": 8679601872,
      "step": 11032
    },
    {
      "epoch": 1.170485890091237,
      "grad_norm": 0.4311360046878865,
      "learning_rate": 4.88544476278119e-05,
      "loss": 1.8134,
      "num_input_tokens_seen": 8680388592,
      "step": 11033
    },
    {
      "epoch": 1.1705919796308084,
      "grad_norm": 0.3879227046434703,
      "learning_rate": 4.8854239656185695e-05,
      "loss": 1.7389,
      "num_input_tokens_seen": 8681175440,
      "step": 11034
    },
    {
      "epoch": 1.1706980691703799,
      "grad_norm": 0.5349782141102855,
      "learning_rate": 4.8854031666125644e-05,
      "loss": 1.8104,
      "num_input_tokens_seen": 8681962240,
      "step": 11035
    },
    {
      "epoch": 1.1708041587099511,
      "grad_norm": 0.39426812533941274,
      "learning_rate": 4.8853823657631894e-05,
      "loss": 1.9766,
      "num_input_tokens_seen": 8682748976,
      "step": 11036
    },
    {
      "epoch": 1.1709102482495226,
      "grad_norm": 0.4291010990564386,
      "learning_rate": 4.8853615630704605e-05,
      "loss": 1.773,
      "num_input_tokens_seen": 8683535744,
      "step": 11037
    },
    {
      "epoch": 1.171016337789094,
      "grad_norm": 0.4671958772221579,
      "learning_rate": 4.885340758534395e-05,
      "loss": 1.7799,
      "num_input_tokens_seen": 8684322528,
      "step": 11038
    },
    {
      "epoch": 1.1711224273286653,
      "grad_norm": 0.4586971961431871,
      "learning_rate": 4.885319952155007e-05,
      "loss": 1.8174,
      "num_input_tokens_seen": 8685109360,
      "step": 11039
    },
    {
      "epoch": 1.1712285168682368,
      "grad_norm": 0.4019699533525767,
      "learning_rate": 4.8852991439323135e-05,
      "loss": 1.7576,
      "num_input_tokens_seen": 8685896080,
      "step": 11040
    },
    {
      "epoch": 1.1713346064078083,
      "grad_norm": 0.37138825807130293,
      "learning_rate": 4.885278333866332e-05,
      "loss": 1.7876,
      "num_input_tokens_seen": 8686682816,
      "step": 11041
    },
    {
      "epoch": 1.1714406959473795,
      "grad_norm": 0.4642173989643145,
      "learning_rate": 4.885257521957077e-05,
      "loss": 1.7665,
      "num_input_tokens_seen": 8687469504,
      "step": 11042
    },
    {
      "epoch": 1.171546785486951,
      "grad_norm": 0.3728101378661071,
      "learning_rate": 4.885236708204565e-05,
      "loss": 1.8865,
      "num_input_tokens_seen": 8688256224,
      "step": 11043
    },
    {
      "epoch": 1.1716528750265223,
      "grad_norm": 0.40530807582254796,
      "learning_rate": 4.885215892608812e-05,
      "loss": 1.7419,
      "num_input_tokens_seen": 8689043152,
      "step": 11044
    },
    {
      "epoch": 1.1717589645660937,
      "grad_norm": 0.37181714077002437,
      "learning_rate": 4.885195075169834e-05,
      "loss": 1.6924,
      "num_input_tokens_seen": 8689829904,
      "step": 11045
    },
    {
      "epoch": 1.1718650541056652,
      "grad_norm": 0.4043934046417323,
      "learning_rate": 4.885174255887647e-05,
      "loss": 1.664,
      "num_input_tokens_seen": 8690616704,
      "step": 11046
    },
    {
      "epoch": 1.1719711436452367,
      "grad_norm": 0.3846229191491772,
      "learning_rate": 4.885153434762268e-05,
      "loss": 1.8673,
      "num_input_tokens_seen": 8691403440,
      "step": 11047
    },
    {
      "epoch": 1.172077233184808,
      "grad_norm": 0.3460553315640201,
      "learning_rate": 4.885132611793712e-05,
      "loss": 1.7937,
      "num_input_tokens_seen": 8692190128,
      "step": 11048
    },
    {
      "epoch": 1.1721833227243794,
      "grad_norm": 0.37926535338727024,
      "learning_rate": 4.885111786981995e-05,
      "loss": 1.7501,
      "num_input_tokens_seen": 8692976896,
      "step": 11049
    },
    {
      "epoch": 1.1722894122639507,
      "grad_norm": 0.39463801660256154,
      "learning_rate": 4.885090960327135e-05,
      "loss": 1.7627,
      "num_input_tokens_seen": 8693763616,
      "step": 11050
    },
    {
      "epoch": 1.1723955018035221,
      "grad_norm": 0.399236144884814,
      "learning_rate": 4.885070131829146e-05,
      "loss": 1.8296,
      "num_input_tokens_seen": 8694550352,
      "step": 11051
    },
    {
      "epoch": 1.1725015913430936,
      "grad_norm": 0.39925462510675336,
      "learning_rate": 4.885049301488044e-05,
      "loss": 1.8179,
      "num_input_tokens_seen": 8695337088,
      "step": 11052
    },
    {
      "epoch": 1.172607680882665,
      "grad_norm": 0.42379221473581624,
      "learning_rate": 4.885028469303847e-05,
      "loss": 1.9361,
      "num_input_tokens_seen": 8696123840,
      "step": 11053
    },
    {
      "epoch": 1.1727137704222363,
      "grad_norm": 0.4181003478735431,
      "learning_rate": 4.885007635276569e-05,
      "loss": 1.7896,
      "num_input_tokens_seen": 8696910560,
      "step": 11054
    },
    {
      "epoch": 1.1728198599618078,
      "grad_norm": 0.33832354908015844,
      "learning_rate": 4.884986799406228e-05,
      "loss": 1.7096,
      "num_input_tokens_seen": 8697697424,
      "step": 11055
    },
    {
      "epoch": 1.172925949501379,
      "grad_norm": 0.4310406237536179,
      "learning_rate": 4.884965961692839e-05,
      "loss": 1.7992,
      "num_input_tokens_seen": 8698484176,
      "step": 11056
    },
    {
      "epoch": 1.1730320390409505,
      "grad_norm": 0.34507057737764335,
      "learning_rate": 4.884945122136418e-05,
      "loss": 1.7304,
      "num_input_tokens_seen": 8699270912,
      "step": 11057
    },
    {
      "epoch": 1.173138128580522,
      "grad_norm": 0.36807441262856655,
      "learning_rate": 4.884924280736981e-05,
      "loss": 1.7597,
      "num_input_tokens_seen": 8700057712,
      "step": 11058
    },
    {
      "epoch": 1.1732442181200933,
      "grad_norm": 0.5526083798757819,
      "learning_rate": 4.8849034374945455e-05,
      "loss": 1.8267,
      "num_input_tokens_seen": 8700844496,
      "step": 11059
    },
    {
      "epoch": 1.1733503076596647,
      "grad_norm": 0.4272223403662384,
      "learning_rate": 4.8848825924091255e-05,
      "loss": 1.8994,
      "num_input_tokens_seen": 8701631264,
      "step": 11060
    },
    {
      "epoch": 1.1734563971992362,
      "grad_norm": 0.3981655142314455,
      "learning_rate": 4.884861745480739e-05,
      "loss": 1.8914,
      "num_input_tokens_seen": 8702418000,
      "step": 11061
    },
    {
      "epoch": 1.1735624867388075,
      "grad_norm": 0.3614565638583549,
      "learning_rate": 4.884840896709401e-05,
      "loss": 1.7203,
      "num_input_tokens_seen": 8703204784,
      "step": 11062
    },
    {
      "epoch": 1.173668576278379,
      "grad_norm": 0.3561595845393782,
      "learning_rate": 4.884820046095128e-05,
      "loss": 1.8445,
      "num_input_tokens_seen": 8703991552,
      "step": 11063
    },
    {
      "epoch": 1.1737746658179504,
      "grad_norm": 0.33288081151100296,
      "learning_rate": 4.8847991936379364e-05,
      "loss": 1.7619,
      "num_input_tokens_seen": 8704778240,
      "step": 11064
    },
    {
      "epoch": 1.1738807553575217,
      "grad_norm": 0.4366825868330648,
      "learning_rate": 4.8847783393378415e-05,
      "loss": 1.9021,
      "num_input_tokens_seen": 8705564976,
      "step": 11065
    },
    {
      "epoch": 1.1739868448970932,
      "grad_norm": 0.3462093923176699,
      "learning_rate": 4.8847574831948604e-05,
      "loss": 1.6907,
      "num_input_tokens_seen": 8706351712,
      "step": 11066
    },
    {
      "epoch": 1.1740929344366646,
      "grad_norm": 0.3775157146302799,
      "learning_rate": 4.884736625209008e-05,
      "loss": 1.7343,
      "num_input_tokens_seen": 8707138512,
      "step": 11067
    },
    {
      "epoch": 1.1741990239762359,
      "grad_norm": 0.42458591175949706,
      "learning_rate": 4.884715765380301e-05,
      "loss": 1.8189,
      "num_input_tokens_seen": 8707925264,
      "step": 11068
    },
    {
      "epoch": 1.1743051135158074,
      "grad_norm": 0.38688527884474455,
      "learning_rate": 4.8846949037087563e-05,
      "loss": 1.9037,
      "num_input_tokens_seen": 8708712000,
      "step": 11069
    },
    {
      "epoch": 1.1744112030553788,
      "grad_norm": 0.3780604001005807,
      "learning_rate": 4.884674040194389e-05,
      "loss": 1.7187,
      "num_input_tokens_seen": 8709498832,
      "step": 11070
    },
    {
      "epoch": 1.17451729259495,
      "grad_norm": 0.47644492499109004,
      "learning_rate": 4.884653174837216e-05,
      "loss": 1.8027,
      "num_input_tokens_seen": 8710285632,
      "step": 11071
    },
    {
      "epoch": 1.1746233821345216,
      "grad_norm": 0.3531211259692691,
      "learning_rate": 4.8846323076372526e-05,
      "loss": 1.745,
      "num_input_tokens_seen": 8711072368,
      "step": 11072
    },
    {
      "epoch": 1.174729471674093,
      "grad_norm": 0.3986469982756797,
      "learning_rate": 4.884611438594515e-05,
      "loss": 1.7876,
      "num_input_tokens_seen": 8711859104,
      "step": 11073
    },
    {
      "epoch": 1.1748355612136643,
      "grad_norm": 0.47912808619306724,
      "learning_rate": 4.88459056770902e-05,
      "loss": 1.9226,
      "num_input_tokens_seen": 8712645840,
      "step": 11074
    },
    {
      "epoch": 1.1749416507532358,
      "grad_norm": 0.378089009827922,
      "learning_rate": 4.8845696949807834e-05,
      "loss": 1.8195,
      "num_input_tokens_seen": 8713432624,
      "step": 11075
    },
    {
      "epoch": 1.1750477402928072,
      "grad_norm": 0.3469127696233659,
      "learning_rate": 4.884548820409821e-05,
      "loss": 1.6876,
      "num_input_tokens_seen": 8714219360,
      "step": 11076
    },
    {
      "epoch": 1.1751538298323785,
      "grad_norm": 0.4358963878407054,
      "learning_rate": 4.88452794399615e-05,
      "loss": 1.7143,
      "num_input_tokens_seen": 8715006064,
      "step": 11077
    },
    {
      "epoch": 1.17525991937195,
      "grad_norm": 0.39755115401999563,
      "learning_rate": 4.884507065739785e-05,
      "loss": 1.743,
      "num_input_tokens_seen": 8715792864,
      "step": 11078
    },
    {
      "epoch": 1.1753660089115212,
      "grad_norm": 0.3645025948726317,
      "learning_rate": 4.884486185640743e-05,
      "loss": 1.6549,
      "num_input_tokens_seen": 8716579712,
      "step": 11079
    },
    {
      "epoch": 1.1754720984510927,
      "grad_norm": 0.36799789343471856,
      "learning_rate": 4.8844653036990405e-05,
      "loss": 1.6754,
      "num_input_tokens_seen": 8717366416,
      "step": 11080
    },
    {
      "epoch": 1.1755781879906642,
      "grad_norm": 0.40200564321575716,
      "learning_rate": 4.8844444199146936e-05,
      "loss": 1.737,
      "num_input_tokens_seen": 8718153264,
      "step": 11081
    },
    {
      "epoch": 1.1756842775302356,
      "grad_norm": 0.3932234576227067,
      "learning_rate": 4.8844235342877166e-05,
      "loss": 1.701,
      "num_input_tokens_seen": 8718939952,
      "step": 11082
    },
    {
      "epoch": 1.1757903670698069,
      "grad_norm": 0.42693301295750613,
      "learning_rate": 4.884402646818128e-05,
      "loss": 1.7632,
      "num_input_tokens_seen": 8719726576,
      "step": 11083
    },
    {
      "epoch": 1.1758964566093784,
      "grad_norm": 0.36114740105398035,
      "learning_rate": 4.8843817575059424e-05,
      "loss": 1.8267,
      "num_input_tokens_seen": 8720513360,
      "step": 11084
    },
    {
      "epoch": 1.1760025461489496,
      "grad_norm": 0.36727632115747305,
      "learning_rate": 4.884360866351177e-05,
      "loss": 1.8081,
      "num_input_tokens_seen": 8721300192,
      "step": 11085
    },
    {
      "epoch": 1.176108635688521,
      "grad_norm": 0.44426144745206186,
      "learning_rate": 4.884339973353847e-05,
      "loss": 1.9151,
      "num_input_tokens_seen": 8722086944,
      "step": 11086
    },
    {
      "epoch": 1.1762147252280926,
      "grad_norm": 0.31558648932464595,
      "learning_rate": 4.88431907851397e-05,
      "loss": 1.6083,
      "num_input_tokens_seen": 8722873744,
      "step": 11087
    },
    {
      "epoch": 1.1763208147676638,
      "grad_norm": 0.4473474043370985,
      "learning_rate": 4.8842981818315604e-05,
      "loss": 1.9379,
      "num_input_tokens_seen": 8723660560,
      "step": 11088
    },
    {
      "epoch": 1.1764269043072353,
      "grad_norm": 0.3690144371336988,
      "learning_rate": 4.884277283306635e-05,
      "loss": 1.6755,
      "num_input_tokens_seen": 8724447312,
      "step": 11089
    },
    {
      "epoch": 1.1765329938468068,
      "grad_norm": 0.44609712454396755,
      "learning_rate": 4.884256382939211e-05,
      "loss": 1.9144,
      "num_input_tokens_seen": 8725234128,
      "step": 11090
    },
    {
      "epoch": 1.176639083386378,
      "grad_norm": 0.3956231299710346,
      "learning_rate": 4.884235480729303e-05,
      "loss": 1.6754,
      "num_input_tokens_seen": 8726020928,
      "step": 11091
    },
    {
      "epoch": 1.1767451729259495,
      "grad_norm": 0.4752252746502998,
      "learning_rate": 4.884214576676928e-05,
      "loss": 1.8276,
      "num_input_tokens_seen": 8726807744,
      "step": 11092
    },
    {
      "epoch": 1.176851262465521,
      "grad_norm": 0.4003239867921877,
      "learning_rate": 4.884193670782101e-05,
      "loss": 1.6981,
      "num_input_tokens_seen": 8727594512,
      "step": 11093
    },
    {
      "epoch": 1.1769573520050922,
      "grad_norm": 0.51150661296135,
      "learning_rate": 4.88417276304484e-05,
      "loss": 1.8023,
      "num_input_tokens_seen": 8728381328,
      "step": 11094
    },
    {
      "epoch": 1.1770634415446637,
      "grad_norm": 0.3622601375074874,
      "learning_rate": 4.884151853465161e-05,
      "loss": 1.7748,
      "num_input_tokens_seen": 8729168000,
      "step": 11095
    },
    {
      "epoch": 1.1771695310842352,
      "grad_norm": 0.43556711948973936,
      "learning_rate": 4.884130942043078e-05,
      "loss": 1.6832,
      "num_input_tokens_seen": 8729954800,
      "step": 11096
    },
    {
      "epoch": 1.1772756206238064,
      "grad_norm": 0.4164291499248162,
      "learning_rate": 4.884110028778609e-05,
      "loss": 1.7251,
      "num_input_tokens_seen": 8730741552,
      "step": 11097
    },
    {
      "epoch": 1.177381710163378,
      "grad_norm": 0.4959296150624595,
      "learning_rate": 4.8840891136717695e-05,
      "loss": 1.8373,
      "num_input_tokens_seen": 8731528352,
      "step": 11098
    },
    {
      "epoch": 1.1774877997029494,
      "grad_norm": 0.48072378539044985,
      "learning_rate": 4.8840681967225767e-05,
      "loss": 1.6566,
      "num_input_tokens_seen": 8732315120,
      "step": 11099
    },
    {
      "epoch": 1.1775938892425206,
      "grad_norm": 0.6561389744687041,
      "learning_rate": 4.884047277931045e-05,
      "loss": 1.8154,
      "num_input_tokens_seen": 8733101856,
      "step": 11100
    },
    {
      "epoch": 1.177699978782092,
      "grad_norm": 0.5440072856046745,
      "learning_rate": 4.884026357297192e-05,
      "loss": 1.9632,
      "num_input_tokens_seen": 8733888656,
      "step": 11101
    },
    {
      "epoch": 1.1778060683216636,
      "grad_norm": 0.5022893686008956,
      "learning_rate": 4.8840054348210326e-05,
      "loss": 1.8053,
      "num_input_tokens_seen": 8734675440,
      "step": 11102
    },
    {
      "epoch": 1.1779121578612348,
      "grad_norm": 0.4376093500318013,
      "learning_rate": 4.883984510502585e-05,
      "loss": 1.7435,
      "num_input_tokens_seen": 8735462240,
      "step": 11103
    },
    {
      "epoch": 1.1780182474008063,
      "grad_norm": 0.5080704828389527,
      "learning_rate": 4.883963584341863e-05,
      "loss": 1.8672,
      "num_input_tokens_seen": 8736249008,
      "step": 11104
    },
    {
      "epoch": 1.1781243369403778,
      "grad_norm": 0.3562097963464817,
      "learning_rate": 4.883942656338885e-05,
      "loss": 1.7463,
      "num_input_tokens_seen": 8737035760,
      "step": 11105
    },
    {
      "epoch": 1.178230426479949,
      "grad_norm": 0.5236829798333451,
      "learning_rate": 4.883921726493666e-05,
      "loss": 1.7943,
      "num_input_tokens_seen": 8737822576,
      "step": 11106
    },
    {
      "epoch": 1.1783365160195205,
      "grad_norm": 0.42236039789473706,
      "learning_rate": 4.883900794806221e-05,
      "loss": 1.8554,
      "num_input_tokens_seen": 8738609344,
      "step": 11107
    },
    {
      "epoch": 1.1784426055590917,
      "grad_norm": 0.48001766763885756,
      "learning_rate": 4.883879861276568e-05,
      "loss": 1.9598,
      "num_input_tokens_seen": 8739395984,
      "step": 11108
    },
    {
      "epoch": 1.1785486950986632,
      "grad_norm": 0.5823290433219229,
      "learning_rate": 4.883858925904723e-05,
      "loss": 1.8897,
      "num_input_tokens_seen": 8740182672,
      "step": 11109
    },
    {
      "epoch": 1.1786547846382347,
      "grad_norm": 0.5797678459146077,
      "learning_rate": 4.8838379886907016e-05,
      "loss": 1.7279,
      "num_input_tokens_seen": 8740969504,
      "step": 11110
    },
    {
      "epoch": 1.1787608741778062,
      "grad_norm": 0.4105904970336835,
      "learning_rate": 4.88381704963452e-05,
      "loss": 1.7775,
      "num_input_tokens_seen": 8741756272,
      "step": 11111
    },
    {
      "epoch": 1.1788669637173774,
      "grad_norm": 0.42335964402937226,
      "learning_rate": 4.883796108736195e-05,
      "loss": 1.9377,
      "num_input_tokens_seen": 8742543024,
      "step": 11112
    },
    {
      "epoch": 1.178973053256949,
      "grad_norm": 0.4096423053105968,
      "learning_rate": 4.883775165995742e-05,
      "loss": 1.7479,
      "num_input_tokens_seen": 8743329760,
      "step": 11113
    },
    {
      "epoch": 1.1790791427965202,
      "grad_norm": 0.4152044652141158,
      "learning_rate": 4.883754221413177e-05,
      "loss": 1.8322,
      "num_input_tokens_seen": 8744116496,
      "step": 11114
    },
    {
      "epoch": 1.1791852323360916,
      "grad_norm": 0.34745391988103447,
      "learning_rate": 4.8837332749885175e-05,
      "loss": 1.8195,
      "num_input_tokens_seen": 8744903312,
      "step": 11115
    },
    {
      "epoch": 1.179291321875663,
      "grad_norm": 0.38548034968669764,
      "learning_rate": 4.883712326721779e-05,
      "loss": 1.7473,
      "num_input_tokens_seen": 8745690096,
      "step": 11116
    },
    {
      "epoch": 1.1793974114152346,
      "grad_norm": 0.3701246785080895,
      "learning_rate": 4.883691376612976e-05,
      "loss": 1.7627,
      "num_input_tokens_seen": 8746476736,
      "step": 11117
    },
    {
      "epoch": 1.1795035009548058,
      "grad_norm": 0.3664506003599533,
      "learning_rate": 4.8836704246621277e-05,
      "loss": 1.6889,
      "num_input_tokens_seen": 8747263408,
      "step": 11118
    },
    {
      "epoch": 1.1796095904943773,
      "grad_norm": 0.43983734845727634,
      "learning_rate": 4.883649470869248e-05,
      "loss": 1.874,
      "num_input_tokens_seen": 8748050160,
      "step": 11119
    },
    {
      "epoch": 1.1797156800339486,
      "grad_norm": 0.3921521495552928,
      "learning_rate": 4.883628515234355e-05,
      "loss": 1.7386,
      "num_input_tokens_seen": 8748836960,
      "step": 11120
    },
    {
      "epoch": 1.17982176957352,
      "grad_norm": 0.5960412212533573,
      "learning_rate": 4.883607557757463e-05,
      "loss": 1.7854,
      "num_input_tokens_seen": 8749623696,
      "step": 11121
    },
    {
      "epoch": 1.1799278591130915,
      "grad_norm": 0.4021328209919726,
      "learning_rate": 4.883586598438589e-05,
      "loss": 1.8809,
      "num_input_tokens_seen": 8750410480,
      "step": 11122
    },
    {
      "epoch": 1.1800339486526628,
      "grad_norm": 0.47419602086581814,
      "learning_rate": 4.8835656372777496e-05,
      "loss": 1.8344,
      "num_input_tokens_seen": 8751197296,
      "step": 11123
    },
    {
      "epoch": 1.1801400381922342,
      "grad_norm": 0.4113627137785179,
      "learning_rate": 4.88354467427496e-05,
      "loss": 1.8419,
      "num_input_tokens_seen": 8751984000,
      "step": 11124
    },
    {
      "epoch": 1.1802461277318057,
      "grad_norm": 0.4210728514642379,
      "learning_rate": 4.883523709430238e-05,
      "loss": 1.7265,
      "num_input_tokens_seen": 8752770752,
      "step": 11125
    },
    {
      "epoch": 1.180352217271377,
      "grad_norm": 0.4738330085926303,
      "learning_rate": 4.883502742743598e-05,
      "loss": 1.8223,
      "num_input_tokens_seen": 8753557648,
      "step": 11126
    },
    {
      "epoch": 1.1804583068109484,
      "grad_norm": 0.41287102633959577,
      "learning_rate": 4.883481774215057e-05,
      "loss": 1.8057,
      "num_input_tokens_seen": 8754344400,
      "step": 11127
    },
    {
      "epoch": 1.18056439635052,
      "grad_norm": 0.38773474601785285,
      "learning_rate": 4.8834608038446314e-05,
      "loss": 1.8156,
      "num_input_tokens_seen": 8755131184,
      "step": 11128
    },
    {
      "epoch": 1.1806704858900912,
      "grad_norm": 0.3915651020955635,
      "learning_rate": 4.883439831632338e-05,
      "loss": 1.8331,
      "num_input_tokens_seen": 8755917952,
      "step": 11129
    },
    {
      "epoch": 1.1807765754296626,
      "grad_norm": 0.37276104208929844,
      "learning_rate": 4.8834188575781916e-05,
      "loss": 1.7463,
      "num_input_tokens_seen": 8756704576,
      "step": 11130
    },
    {
      "epoch": 1.180882664969234,
      "grad_norm": 0.4298721121510402,
      "learning_rate": 4.883397881682209e-05,
      "loss": 1.7387,
      "num_input_tokens_seen": 8757491360,
      "step": 11131
    },
    {
      "epoch": 1.1809887545088054,
      "grad_norm": 0.42553516762967136,
      "learning_rate": 4.8833769039444056e-05,
      "loss": 1.7888,
      "num_input_tokens_seen": 8758278144,
      "step": 11132
    },
    {
      "epoch": 1.1810948440483768,
      "grad_norm": 0.38064027268146977,
      "learning_rate": 4.8833559243648e-05,
      "loss": 1.8846,
      "num_input_tokens_seen": 8759064912,
      "step": 11133
    },
    {
      "epoch": 1.1812009335879483,
      "grad_norm": 0.48040282658726546,
      "learning_rate": 4.883334942943406e-05,
      "loss": 1.7959,
      "num_input_tokens_seen": 8759851792,
      "step": 11134
    },
    {
      "epoch": 1.1813070231275196,
      "grad_norm": 0.3647717591712904,
      "learning_rate": 4.8833139596802405e-05,
      "loss": 1.8804,
      "num_input_tokens_seen": 8760638528,
      "step": 11135
    },
    {
      "epoch": 1.181413112667091,
      "grad_norm": 0.47379505340861705,
      "learning_rate": 4.88329297457532e-05,
      "loss": 1.8467,
      "num_input_tokens_seen": 8761425216,
      "step": 11136
    },
    {
      "epoch": 1.1815192022066625,
      "grad_norm": 0.4473426162440053,
      "learning_rate": 4.8832719876286615e-05,
      "loss": 1.9827,
      "num_input_tokens_seen": 8762211984,
      "step": 11137
    },
    {
      "epoch": 1.1816252917462338,
      "grad_norm": 0.38764034136054587,
      "learning_rate": 4.8832509988402795e-05,
      "loss": 1.8801,
      "num_input_tokens_seen": 8762998752,
      "step": 11138
    },
    {
      "epoch": 1.1817313812858052,
      "grad_norm": 0.4309668362812182,
      "learning_rate": 4.883230008210191e-05,
      "loss": 1.8732,
      "num_input_tokens_seen": 8763785520,
      "step": 11139
    },
    {
      "epoch": 1.1818374708253767,
      "grad_norm": 0.4255211772647173,
      "learning_rate": 4.8832090157384125e-05,
      "loss": 1.8799,
      "num_input_tokens_seen": 8764572256,
      "step": 11140
    },
    {
      "epoch": 1.181943560364948,
      "grad_norm": 0.39640821106850715,
      "learning_rate": 4.8831880214249606e-05,
      "loss": 1.8439,
      "num_input_tokens_seen": 8765358992,
      "step": 11141
    },
    {
      "epoch": 1.1820496499045194,
      "grad_norm": 0.43896426003818956,
      "learning_rate": 4.8831670252698504e-05,
      "loss": 1.7734,
      "num_input_tokens_seen": 8766145744,
      "step": 11142
    },
    {
      "epoch": 1.1821557394440907,
      "grad_norm": 0.38962972010542196,
      "learning_rate": 4.883146027273098e-05,
      "loss": 1.9157,
      "num_input_tokens_seen": 8766932544,
      "step": 11143
    },
    {
      "epoch": 1.1822618289836622,
      "grad_norm": 0.43353743297677527,
      "learning_rate": 4.883125027434721e-05,
      "loss": 1.6573,
      "num_input_tokens_seen": 8767719376,
      "step": 11144
    },
    {
      "epoch": 1.1823679185232336,
      "grad_norm": 0.34613007835522047,
      "learning_rate": 4.883104025754735e-05,
      "loss": 1.7487,
      "num_input_tokens_seen": 8768506160,
      "step": 11145
    },
    {
      "epoch": 1.1824740080628051,
      "grad_norm": 0.3767008381952071,
      "learning_rate": 4.883083022233156e-05,
      "loss": 1.7998,
      "num_input_tokens_seen": 8769292928,
      "step": 11146
    },
    {
      "epoch": 1.1825800976023764,
      "grad_norm": 0.5359580263609683,
      "learning_rate": 4.88306201687e-05,
      "loss": 1.6848,
      "num_input_tokens_seen": 8770079776,
      "step": 11147
    },
    {
      "epoch": 1.1826861871419478,
      "grad_norm": 0.47801490382431217,
      "learning_rate": 4.883041009665284e-05,
      "loss": 1.6925,
      "num_input_tokens_seen": 8770866544,
      "step": 11148
    },
    {
      "epoch": 1.182792276681519,
      "grad_norm": 0.5508114412086427,
      "learning_rate": 4.8830200006190244e-05,
      "loss": 1.9197,
      "num_input_tokens_seen": 8771653264,
      "step": 11149
    },
    {
      "epoch": 1.1828983662210906,
      "grad_norm": 0.40957792953988437,
      "learning_rate": 4.882998989731236e-05,
      "loss": 1.7614,
      "num_input_tokens_seen": 8772440016,
      "step": 11150
    },
    {
      "epoch": 1.183004455760662,
      "grad_norm": 0.45689910978341514,
      "learning_rate": 4.882977977001936e-05,
      "loss": 1.6573,
      "num_input_tokens_seen": 8773226864,
      "step": 11151
    },
    {
      "epoch": 1.1831105453002335,
      "grad_norm": 0.3442228950604074,
      "learning_rate": 4.88295696243114e-05,
      "loss": 1.7344,
      "num_input_tokens_seen": 8774013696,
      "step": 11152
    },
    {
      "epoch": 1.1832166348398048,
      "grad_norm": 0.4876515731109573,
      "learning_rate": 4.8829359460188655e-05,
      "loss": 1.9073,
      "num_input_tokens_seen": 8774800400,
      "step": 11153
    },
    {
      "epoch": 1.1833227243793762,
      "grad_norm": 0.4241437949405519,
      "learning_rate": 4.882914927765128e-05,
      "loss": 1.773,
      "num_input_tokens_seen": 8775587184,
      "step": 11154
    },
    {
      "epoch": 1.1834288139189475,
      "grad_norm": 0.44533460034850986,
      "learning_rate": 4.882893907669944e-05,
      "loss": 1.7585,
      "num_input_tokens_seen": 8776374016,
      "step": 11155
    },
    {
      "epoch": 1.183534903458519,
      "grad_norm": 0.4099143707263828,
      "learning_rate": 4.882872885733329e-05,
      "loss": 1.8185,
      "num_input_tokens_seen": 8777160864,
      "step": 11156
    },
    {
      "epoch": 1.1836409929980904,
      "grad_norm": 0.35660306285843046,
      "learning_rate": 4.8828518619553e-05,
      "loss": 1.7835,
      "num_input_tokens_seen": 8777947568,
      "step": 11157
    },
    {
      "epoch": 1.1837470825376617,
      "grad_norm": 0.38863440116921666,
      "learning_rate": 4.882830836335873e-05,
      "loss": 1.6809,
      "num_input_tokens_seen": 8778734384,
      "step": 11158
    },
    {
      "epoch": 1.1838531720772332,
      "grad_norm": 0.44599814025171,
      "learning_rate": 4.882809808875064e-05,
      "loss": 1.8521,
      "num_input_tokens_seen": 8779521088,
      "step": 11159
    },
    {
      "epoch": 1.1839592616168046,
      "grad_norm": 0.4638878862869758,
      "learning_rate": 4.88278877957289e-05,
      "loss": 1.7894,
      "num_input_tokens_seen": 8780307888,
      "step": 11160
    },
    {
      "epoch": 1.184065351156376,
      "grad_norm": 0.4032560263430954,
      "learning_rate": 4.8827677484293666e-05,
      "loss": 1.8991,
      "num_input_tokens_seen": 8781094720,
      "step": 11161
    },
    {
      "epoch": 1.1841714406959474,
      "grad_norm": 0.5850807586471845,
      "learning_rate": 4.88274671544451e-05,
      "loss": 1.7888,
      "num_input_tokens_seen": 8781881456,
      "step": 11162
    },
    {
      "epoch": 1.1842775302355188,
      "grad_norm": 0.5561605012310675,
      "learning_rate": 4.8827256806183366e-05,
      "loss": 1.7179,
      "num_input_tokens_seen": 8782668240,
      "step": 11163
    },
    {
      "epoch": 1.18438361977509,
      "grad_norm": 0.41724750827809803,
      "learning_rate": 4.882704643950863e-05,
      "loss": 1.7518,
      "num_input_tokens_seen": 8783455008,
      "step": 11164
    },
    {
      "epoch": 1.1844897093146616,
      "grad_norm": 0.5606666952826215,
      "learning_rate": 4.8826836054421043e-05,
      "loss": 1.9316,
      "num_input_tokens_seen": 8784241664,
      "step": 11165
    },
    {
      "epoch": 1.184595798854233,
      "grad_norm": 0.47232531281099555,
      "learning_rate": 4.882662565092079e-05,
      "loss": 1.8996,
      "num_input_tokens_seen": 8785028400,
      "step": 11166
    },
    {
      "epoch": 1.1847018883938043,
      "grad_norm": 0.4817109227632932,
      "learning_rate": 4.882641522900801e-05,
      "loss": 1.8686,
      "num_input_tokens_seen": 8785815136,
      "step": 11167
    },
    {
      "epoch": 1.1848079779333758,
      "grad_norm": 0.447345972575895,
      "learning_rate": 4.8826204788682875e-05,
      "loss": 1.8322,
      "num_input_tokens_seen": 8786601792,
      "step": 11168
    },
    {
      "epoch": 1.1849140674729473,
      "grad_norm": 0.5867077241114786,
      "learning_rate": 4.882599432994555e-05,
      "loss": 1.7523,
      "num_input_tokens_seen": 8787388496,
      "step": 11169
    },
    {
      "epoch": 1.1850201570125185,
      "grad_norm": 0.36523554104630346,
      "learning_rate": 4.8825783852796196e-05,
      "loss": 1.7724,
      "num_input_tokens_seen": 8788175376,
      "step": 11170
    },
    {
      "epoch": 1.18512624655209,
      "grad_norm": 0.47934165140539264,
      "learning_rate": 4.8825573357234975e-05,
      "loss": 1.8675,
      "num_input_tokens_seen": 8788962224,
      "step": 11171
    },
    {
      "epoch": 1.1852323360916615,
      "grad_norm": 0.5046073678791461,
      "learning_rate": 4.8825362843262056e-05,
      "loss": 1.9207,
      "num_input_tokens_seen": 8789748896,
      "step": 11172
    },
    {
      "epoch": 1.1853384256312327,
      "grad_norm": 0.4762110856569675,
      "learning_rate": 4.882515231087759e-05,
      "loss": 1.7793,
      "num_input_tokens_seen": 8790535664,
      "step": 11173
    },
    {
      "epoch": 1.1854445151708042,
      "grad_norm": 0.4413490986609291,
      "learning_rate": 4.882494176008174e-05,
      "loss": 1.8019,
      "num_input_tokens_seen": 8791322448,
      "step": 11174
    },
    {
      "epoch": 1.1855506047103757,
      "grad_norm": 0.34206396297759667,
      "learning_rate": 4.8824731190874685e-05,
      "loss": 1.7457,
      "num_input_tokens_seen": 8792109200,
      "step": 11175
    },
    {
      "epoch": 1.185656694249947,
      "grad_norm": 0.41884278801666147,
      "learning_rate": 4.8824520603256575e-05,
      "loss": 1.7294,
      "num_input_tokens_seen": 8792895952,
      "step": 11176
    },
    {
      "epoch": 1.1857627837895184,
      "grad_norm": 0.3474976626112296,
      "learning_rate": 4.8824309997227566e-05,
      "loss": 1.7121,
      "num_input_tokens_seen": 8793682736,
      "step": 11177
    },
    {
      "epoch": 1.1858688733290896,
      "grad_norm": 0.3634522881006567,
      "learning_rate": 4.8824099372787836e-05,
      "loss": 1.8127,
      "num_input_tokens_seen": 8794469568,
      "step": 11178
    },
    {
      "epoch": 1.185974962868661,
      "grad_norm": 0.5048505986543003,
      "learning_rate": 4.882388872993754e-05,
      "loss": 1.7513,
      "num_input_tokens_seen": 8795256288,
      "step": 11179
    },
    {
      "epoch": 1.1860810524082326,
      "grad_norm": 0.44137916657776144,
      "learning_rate": 4.882367806867684e-05,
      "loss": 1.9359,
      "num_input_tokens_seen": 8796042976,
      "step": 11180
    },
    {
      "epoch": 1.186187141947804,
      "grad_norm": 0.44651501378123104,
      "learning_rate": 4.8823467389005906e-05,
      "loss": 1.8115,
      "num_input_tokens_seen": 8796829696,
      "step": 11181
    },
    {
      "epoch": 1.1862932314873753,
      "grad_norm": 0.38951583327665024,
      "learning_rate": 4.882325669092489e-05,
      "loss": 1.7513,
      "num_input_tokens_seen": 8797616384,
      "step": 11182
    },
    {
      "epoch": 1.1863993210269468,
      "grad_norm": 0.33331824167824214,
      "learning_rate": 4.882304597443396e-05,
      "loss": 1.7199,
      "num_input_tokens_seen": 8798403184,
      "step": 11183
    },
    {
      "epoch": 1.186505410566518,
      "grad_norm": 0.3776014016945464,
      "learning_rate": 4.882283523953328e-05,
      "loss": 1.8294,
      "num_input_tokens_seen": 8799190048,
      "step": 11184
    },
    {
      "epoch": 1.1866115001060895,
      "grad_norm": 0.40039036096986425,
      "learning_rate": 4.8822624486223015e-05,
      "loss": 1.7712,
      "num_input_tokens_seen": 8799976784,
      "step": 11185
    },
    {
      "epoch": 1.186717589645661,
      "grad_norm": 0.821755114116563,
      "learning_rate": 4.8822413714503324e-05,
      "loss": 1.8018,
      "num_input_tokens_seen": 8800763472,
      "step": 11186
    },
    {
      "epoch": 1.1868236791852325,
      "grad_norm": 1.4551658790365178,
      "learning_rate": 4.8822202924374374e-05,
      "loss": 1.7848,
      "num_input_tokens_seen": 8801550304,
      "step": 11187
    },
    {
      "epoch": 1.1869297687248037,
      "grad_norm": 0.4285127018414935,
      "learning_rate": 4.8821992115836315e-05,
      "loss": 1.7904,
      "num_input_tokens_seen": 8802336992,
      "step": 11188
    },
    {
      "epoch": 1.1870358582643752,
      "grad_norm": 0.706363222856607,
      "learning_rate": 4.882178128888932e-05,
      "loss": 1.8512,
      "num_input_tokens_seen": 8803123712,
      "step": 11189
    },
    {
      "epoch": 1.1871419478039464,
      "grad_norm": 0.41824574726440883,
      "learning_rate": 4.882157044353356e-05,
      "loss": 1.7744,
      "num_input_tokens_seen": 8803910464,
      "step": 11190
    },
    {
      "epoch": 1.187248037343518,
      "grad_norm": 0.394803703332796,
      "learning_rate": 4.882135957976919e-05,
      "loss": 1.7842,
      "num_input_tokens_seen": 8804697232,
      "step": 11191
    },
    {
      "epoch": 1.1873541268830894,
      "grad_norm": 0.44565725057990807,
      "learning_rate": 4.882114869759636e-05,
      "loss": 1.847,
      "num_input_tokens_seen": 8805483952,
      "step": 11192
    },
    {
      "epoch": 1.1874602164226606,
      "grad_norm": 0.491246087062277,
      "learning_rate": 4.882093779701525e-05,
      "loss": 1.8329,
      "num_input_tokens_seen": 8806270720,
      "step": 11193
    },
    {
      "epoch": 1.1875663059622321,
      "grad_norm": 0.3793574323014942,
      "learning_rate": 4.882072687802602e-05,
      "loss": 1.7758,
      "num_input_tokens_seen": 8807057440,
      "step": 11194
    },
    {
      "epoch": 1.1876723955018036,
      "grad_norm": 0.4482247454263572,
      "learning_rate": 4.882051594062884e-05,
      "loss": 1.8498,
      "num_input_tokens_seen": 8807844240,
      "step": 11195
    },
    {
      "epoch": 1.1877784850413748,
      "grad_norm": 0.3652630429897526,
      "learning_rate": 4.882030498482386e-05,
      "loss": 1.8898,
      "num_input_tokens_seen": 8808630976,
      "step": 11196
    },
    {
      "epoch": 1.1878845745809463,
      "grad_norm": 0.4234822213678364,
      "learning_rate": 4.8820094010611236e-05,
      "loss": 1.849,
      "num_input_tokens_seen": 8809417648,
      "step": 11197
    },
    {
      "epoch": 1.1879906641205178,
      "grad_norm": 0.36643325258529963,
      "learning_rate": 4.881988301799115e-05,
      "loss": 1.8305,
      "num_input_tokens_seen": 8810204368,
      "step": 11198
    },
    {
      "epoch": 1.188096753660089,
      "grad_norm": 0.48260229601647525,
      "learning_rate": 4.8819672006963756e-05,
      "loss": 1.7459,
      "num_input_tokens_seen": 8810991216,
      "step": 11199
    },
    {
      "epoch": 1.1882028431996605,
      "grad_norm": 0.3839235620168566,
      "learning_rate": 4.881946097752922e-05,
      "loss": 1.7641,
      "num_input_tokens_seen": 8811777984,
      "step": 11200
    },
    {
      "epoch": 1.188308932739232,
      "grad_norm": 0.32300863575522515,
      "learning_rate": 4.8819249929687705e-05,
      "loss": 1.7578,
      "num_input_tokens_seen": 8812564672,
      "step": 11201
    },
    {
      "epoch": 1.1884150222788032,
      "grad_norm": 0.33962880030166515,
      "learning_rate": 4.881903886343937e-05,
      "loss": 1.7361,
      "num_input_tokens_seen": 8813351440,
      "step": 11202
    },
    {
      "epoch": 1.1885211118183747,
      "grad_norm": 0.3629792163748457,
      "learning_rate": 4.881882777878438e-05,
      "loss": 1.7609,
      "num_input_tokens_seen": 8814138288,
      "step": 11203
    },
    {
      "epoch": 1.1886272013579462,
      "grad_norm": 0.3491522079393481,
      "learning_rate": 4.88186166757229e-05,
      "loss": 1.6617,
      "num_input_tokens_seen": 8814925024,
      "step": 11204
    },
    {
      "epoch": 1.1887332908975174,
      "grad_norm": 0.3318212335749703,
      "learning_rate": 4.8818405554255095e-05,
      "loss": 1.7142,
      "num_input_tokens_seen": 8815711792,
      "step": 11205
    },
    {
      "epoch": 1.188839380437089,
      "grad_norm": 0.3517110719331294,
      "learning_rate": 4.8818194414381125e-05,
      "loss": 1.8214,
      "num_input_tokens_seen": 8816498576,
      "step": 11206
    },
    {
      "epoch": 1.1889454699766604,
      "grad_norm": 0.3716222471908251,
      "learning_rate": 4.881798325610115e-05,
      "loss": 1.7956,
      "num_input_tokens_seen": 8817285296,
      "step": 11207
    },
    {
      "epoch": 1.1890515595162316,
      "grad_norm": 0.3751253809682369,
      "learning_rate": 4.881777207941534e-05,
      "loss": 1.859,
      "num_input_tokens_seen": 8818071984,
      "step": 11208
    },
    {
      "epoch": 1.1891576490558031,
      "grad_norm": 0.3767068441845211,
      "learning_rate": 4.8817560884323846e-05,
      "loss": 1.7942,
      "num_input_tokens_seen": 8818858816,
      "step": 11209
    },
    {
      "epoch": 1.1892637385953746,
      "grad_norm": 0.43477942758625654,
      "learning_rate": 4.8817349670826836e-05,
      "loss": 1.8235,
      "num_input_tokens_seen": 8819645696,
      "step": 11210
    },
    {
      "epoch": 1.1893698281349459,
      "grad_norm": 0.48742759444114,
      "learning_rate": 4.881713843892449e-05,
      "loss": 1.8782,
      "num_input_tokens_seen": 8820432480,
      "step": 11211
    },
    {
      "epoch": 1.1894759176745173,
      "grad_norm": 0.43869238129119176,
      "learning_rate": 4.8816927188616955e-05,
      "loss": 1.8554,
      "num_input_tokens_seen": 8821219280,
      "step": 11212
    },
    {
      "epoch": 1.1895820072140886,
      "grad_norm": 0.5460068362787124,
      "learning_rate": 4.88167159199044e-05,
      "loss": 1.7608,
      "num_input_tokens_seen": 8822006112,
      "step": 11213
    },
    {
      "epoch": 1.18968809675366,
      "grad_norm": 0.4233228728909516,
      "learning_rate": 4.881650463278699e-05,
      "loss": 1.6829,
      "num_input_tokens_seen": 8822793024,
      "step": 11214
    },
    {
      "epoch": 1.1897941862932315,
      "grad_norm": 0.5936091349425614,
      "learning_rate": 4.881629332726487e-05,
      "loss": 1.7605,
      "num_input_tokens_seen": 8823579792,
      "step": 11215
    },
    {
      "epoch": 1.189900275832803,
      "grad_norm": 0.48604155950874806,
      "learning_rate": 4.8816082003338224e-05,
      "loss": 1.796,
      "num_input_tokens_seen": 8824366496,
      "step": 11216
    },
    {
      "epoch": 1.1900063653723743,
      "grad_norm": 0.4569612048005625,
      "learning_rate": 4.8815870661007205e-05,
      "loss": 1.6543,
      "num_input_tokens_seen": 8825153248,
      "step": 11217
    },
    {
      "epoch": 1.1901124549119457,
      "grad_norm": 0.521875018485519,
      "learning_rate": 4.881565930027199e-05,
      "loss": 1.7365,
      "num_input_tokens_seen": 8825939984,
      "step": 11218
    },
    {
      "epoch": 1.190218544451517,
      "grad_norm": 0.36853354774902897,
      "learning_rate": 4.881544792113272e-05,
      "loss": 1.8485,
      "num_input_tokens_seen": 8826726816,
      "step": 11219
    },
    {
      "epoch": 1.1903246339910885,
      "grad_norm": 0.4667581538073907,
      "learning_rate": 4.881523652358958e-05,
      "loss": 1.8053,
      "num_input_tokens_seen": 8827513488,
      "step": 11220
    },
    {
      "epoch": 1.19043072353066,
      "grad_norm": 0.453843198484096,
      "learning_rate": 4.8815025107642723e-05,
      "loss": 1.8401,
      "num_input_tokens_seen": 8828300192,
      "step": 11221
    },
    {
      "epoch": 1.1905368130702312,
      "grad_norm": 0.38769112003995004,
      "learning_rate": 4.88148136732923e-05,
      "loss": 1.9088,
      "num_input_tokens_seen": 8829086848,
      "step": 11222
    },
    {
      "epoch": 1.1906429026098027,
      "grad_norm": 0.44504964776819467,
      "learning_rate": 4.881460222053851e-05,
      "loss": 1.8115,
      "num_input_tokens_seen": 8829873536,
      "step": 11223
    },
    {
      "epoch": 1.1907489921493741,
      "grad_norm": 0.4097059852899479,
      "learning_rate": 4.881439074938148e-05,
      "loss": 1.868,
      "num_input_tokens_seen": 8830660256,
      "step": 11224
    },
    {
      "epoch": 1.1908550816889454,
      "grad_norm": 0.3612076780647009,
      "learning_rate": 4.8814179259821394e-05,
      "loss": 1.6799,
      "num_input_tokens_seen": 8831447072,
      "step": 11225
    },
    {
      "epoch": 1.1909611712285169,
      "grad_norm": 0.47503145440148303,
      "learning_rate": 4.8813967751858394e-05,
      "loss": 1.9029,
      "num_input_tokens_seen": 8832233856,
      "step": 11226
    },
    {
      "epoch": 1.1910672607680883,
      "grad_norm": 0.40384013999726104,
      "learning_rate": 4.8813756225492676e-05,
      "loss": 1.8504,
      "num_input_tokens_seen": 8833020576,
      "step": 11227
    },
    {
      "epoch": 1.1911733503076596,
      "grad_norm": 0.39676390174596576,
      "learning_rate": 4.8813544680724374e-05,
      "loss": 1.7221,
      "num_input_tokens_seen": 8833807296,
      "step": 11228
    },
    {
      "epoch": 1.191279439847231,
      "grad_norm": 0.489339380561826,
      "learning_rate": 4.881333311755367e-05,
      "loss": 1.7956,
      "num_input_tokens_seen": 8834594080,
      "step": 11229
    },
    {
      "epoch": 1.1913855293868025,
      "grad_norm": 0.48887392499664484,
      "learning_rate": 4.8813121535980724e-05,
      "loss": 2.0033,
      "num_input_tokens_seen": 8835380816,
      "step": 11230
    },
    {
      "epoch": 1.1914916189263738,
      "grad_norm": 0.3595119268096943,
      "learning_rate": 4.8812909936005694e-05,
      "loss": 1.8285,
      "num_input_tokens_seen": 8836167568,
      "step": 11231
    },
    {
      "epoch": 1.1915977084659453,
      "grad_norm": 0.5322373633811922,
      "learning_rate": 4.881269831762874e-05,
      "loss": 1.8013,
      "num_input_tokens_seen": 8836954400,
      "step": 11232
    },
    {
      "epoch": 1.1917037980055167,
      "grad_norm": 0.39520855660578397,
      "learning_rate": 4.881248668085003e-05,
      "loss": 1.8847,
      "num_input_tokens_seen": 8837741184,
      "step": 11233
    },
    {
      "epoch": 1.191809887545088,
      "grad_norm": 0.4436807778153418,
      "learning_rate": 4.881227502566974e-05,
      "loss": 1.632,
      "num_input_tokens_seen": 8838527936,
      "step": 11234
    },
    {
      "epoch": 1.1919159770846595,
      "grad_norm": 0.6937085136199072,
      "learning_rate": 4.881206335208802e-05,
      "loss": 1.7713,
      "num_input_tokens_seen": 8839314688,
      "step": 11235
    },
    {
      "epoch": 1.192022066624231,
      "grad_norm": 0.8570870071057657,
      "learning_rate": 4.881185166010503e-05,
      "loss": 1.8981,
      "num_input_tokens_seen": 8840101344,
      "step": 11236
    },
    {
      "epoch": 1.1921281561638022,
      "grad_norm": 0.4803524121961299,
      "learning_rate": 4.8811639949720946e-05,
      "loss": 1.8577,
      "num_input_tokens_seen": 8840888176,
      "step": 11237
    },
    {
      "epoch": 1.1922342457033737,
      "grad_norm": 0.44412259749704097,
      "learning_rate": 4.8811428220935915e-05,
      "loss": 1.8526,
      "num_input_tokens_seen": 8841674912,
      "step": 11238
    },
    {
      "epoch": 1.1923403352429451,
      "grad_norm": 0.3947003570327711,
      "learning_rate": 4.881121647375012e-05,
      "loss": 1.696,
      "num_input_tokens_seen": 8842461696,
      "step": 11239
    },
    {
      "epoch": 1.1924464247825164,
      "grad_norm": 0.4637914945236808,
      "learning_rate": 4.881100470816372e-05,
      "loss": 1.8394,
      "num_input_tokens_seen": 8843248416,
      "step": 11240
    },
    {
      "epoch": 1.1925525143220879,
      "grad_norm": 0.37854583054818175,
      "learning_rate": 4.881079292417687e-05,
      "loss": 1.768,
      "num_input_tokens_seen": 8844035280,
      "step": 11241
    },
    {
      "epoch": 1.1926586038616591,
      "grad_norm": 0.5502253089232276,
      "learning_rate": 4.8810581121789736e-05,
      "loss": 1.8392,
      "num_input_tokens_seen": 8844822080,
      "step": 11242
    },
    {
      "epoch": 1.1927646934012306,
      "grad_norm": 0.35617654142354166,
      "learning_rate": 4.881036930100248e-05,
      "loss": 1.5568,
      "num_input_tokens_seen": 8845608896,
      "step": 11243
    },
    {
      "epoch": 1.192870782940802,
      "grad_norm": 0.6917113351619363,
      "learning_rate": 4.8810157461815276e-05,
      "loss": 1.9919,
      "num_input_tokens_seen": 8846395568,
      "step": 11244
    },
    {
      "epoch": 1.1929768724803735,
      "grad_norm": 0.42016142322103894,
      "learning_rate": 4.880994560422828e-05,
      "loss": 1.8259,
      "num_input_tokens_seen": 8847182416,
      "step": 11245
    },
    {
      "epoch": 1.1930829620199448,
      "grad_norm": 0.6544005248033524,
      "learning_rate": 4.880973372824165e-05,
      "loss": 1.7633,
      "num_input_tokens_seen": 8847969168,
      "step": 11246
    },
    {
      "epoch": 1.1931890515595163,
      "grad_norm": 0.37444748477185763,
      "learning_rate": 4.8809521833855566e-05,
      "loss": 1.8839,
      "num_input_tokens_seen": 8848755952,
      "step": 11247
    },
    {
      "epoch": 1.1932951410990875,
      "grad_norm": 0.6106017708458822,
      "learning_rate": 4.880930992107017e-05,
      "loss": 1.8331,
      "num_input_tokens_seen": 8849542672,
      "step": 11248
    },
    {
      "epoch": 1.193401230638659,
      "grad_norm": 0.4054831932193258,
      "learning_rate": 4.880909798988564e-05,
      "loss": 1.8537,
      "num_input_tokens_seen": 8850329440,
      "step": 11249
    },
    {
      "epoch": 1.1935073201782305,
      "grad_norm": 0.4558217034960263,
      "learning_rate": 4.880888604030215e-05,
      "loss": 1.8069,
      "num_input_tokens_seen": 8851116128,
      "step": 11250
    },
    {
      "epoch": 1.193613409717802,
      "grad_norm": 0.5815759446370956,
      "learning_rate": 4.8808674072319844e-05,
      "loss": 1.866,
      "num_input_tokens_seen": 8851902880,
      "step": 11251
    },
    {
      "epoch": 1.1937194992573732,
      "grad_norm": 0.4768716127662342,
      "learning_rate": 4.880846208593889e-05,
      "loss": 1.6988,
      "num_input_tokens_seen": 8852689616,
      "step": 11252
    },
    {
      "epoch": 1.1938255887969447,
      "grad_norm": 0.6152210825804361,
      "learning_rate": 4.880825008115946e-05,
      "loss": 1.8195,
      "num_input_tokens_seen": 8853476400,
      "step": 11253
    },
    {
      "epoch": 1.193931678336516,
      "grad_norm": 0.48433089025814435,
      "learning_rate": 4.880803805798171e-05,
      "loss": 1.6408,
      "num_input_tokens_seen": 8854263184,
      "step": 11254
    },
    {
      "epoch": 1.1940377678760874,
      "grad_norm": 0.5932844520946489,
      "learning_rate": 4.880782601640581e-05,
      "loss": 1.9043,
      "num_input_tokens_seen": 8855049920,
      "step": 11255
    },
    {
      "epoch": 1.1941438574156589,
      "grad_norm": 0.37704940477527077,
      "learning_rate": 4.880761395643192e-05,
      "loss": 1.6528,
      "num_input_tokens_seen": 8855836688,
      "step": 11256
    },
    {
      "epoch": 1.1942499469552301,
      "grad_norm": 0.43256565356975574,
      "learning_rate": 4.88074018780602e-05,
      "loss": 1.8039,
      "num_input_tokens_seen": 8856623472,
      "step": 11257
    },
    {
      "epoch": 1.1943560364948016,
      "grad_norm": 0.4382029018826315,
      "learning_rate": 4.880718978129082e-05,
      "loss": 1.8018,
      "num_input_tokens_seen": 8857410240,
      "step": 11258
    },
    {
      "epoch": 1.194462126034373,
      "grad_norm": 0.48814210503131794,
      "learning_rate": 4.880697766612395e-05,
      "loss": 1.7552,
      "num_input_tokens_seen": 8858197104,
      "step": 11259
    },
    {
      "epoch": 1.1945682155739443,
      "grad_norm": 0.491060006285411,
      "learning_rate": 4.880676553255974e-05,
      "loss": 1.9183,
      "num_input_tokens_seen": 8858983776,
      "step": 11260
    },
    {
      "epoch": 1.1946743051135158,
      "grad_norm": 0.7546553219878702,
      "learning_rate": 4.880655338059836e-05,
      "loss": 1.9234,
      "num_input_tokens_seen": 8859770464,
      "step": 11261
    },
    {
      "epoch": 1.1947803946530873,
      "grad_norm": 0.4185414151715722,
      "learning_rate": 4.880634121023997e-05,
      "loss": 1.8802,
      "num_input_tokens_seen": 8860557136,
      "step": 11262
    },
    {
      "epoch": 1.1948864841926585,
      "grad_norm": 0.7780185191792839,
      "learning_rate": 4.880612902148474e-05,
      "loss": 1.8092,
      "num_input_tokens_seen": 8861343744,
      "step": 11263
    },
    {
      "epoch": 1.19499257373223,
      "grad_norm": 0.40213716566681407,
      "learning_rate": 4.8805916814332844e-05,
      "loss": 1.7654,
      "num_input_tokens_seen": 8862130448,
      "step": 11264
    },
    {
      "epoch": 1.1950986632718015,
      "grad_norm": 0.5554669768753263,
      "learning_rate": 4.8805704588784416e-05,
      "loss": 1.7089,
      "num_input_tokens_seen": 8862917232,
      "step": 11265
    },
    {
      "epoch": 1.1952047528113727,
      "grad_norm": 0.3787056069304157,
      "learning_rate": 4.8805492344839646e-05,
      "loss": 1.7501,
      "num_input_tokens_seen": 8863704032,
      "step": 11266
    },
    {
      "epoch": 1.1953108423509442,
      "grad_norm": 0.46989040216530853,
      "learning_rate": 4.8805280082498695e-05,
      "loss": 1.9008,
      "num_input_tokens_seen": 8864490848,
      "step": 11267
    },
    {
      "epoch": 1.1954169318905157,
      "grad_norm": 0.5188071308621991,
      "learning_rate": 4.8805067801761714e-05,
      "loss": 1.9096,
      "num_input_tokens_seen": 8865277632,
      "step": 11268
    },
    {
      "epoch": 1.195523021430087,
      "grad_norm": 0.3916129175488903,
      "learning_rate": 4.880485550262888e-05,
      "loss": 1.7991,
      "num_input_tokens_seen": 8866064272,
      "step": 11269
    },
    {
      "epoch": 1.1956291109696584,
      "grad_norm": 0.49421602527124864,
      "learning_rate": 4.880464318510035e-05,
      "loss": 1.7861,
      "num_input_tokens_seen": 8866850976,
      "step": 11270
    },
    {
      "epoch": 1.1957352005092299,
      "grad_norm": 0.49925861721131337,
      "learning_rate": 4.880443084917629e-05,
      "loss": 1.7741,
      "num_input_tokens_seen": 8867637808,
      "step": 11271
    },
    {
      "epoch": 1.1958412900488011,
      "grad_norm": 0.46624480565908655,
      "learning_rate": 4.880421849485687e-05,
      "loss": 1.8068,
      "num_input_tokens_seen": 8868424560,
      "step": 11272
    },
    {
      "epoch": 1.1959473795883726,
      "grad_norm": 0.4959853085776472,
      "learning_rate": 4.8804006122142245e-05,
      "loss": 1.7288,
      "num_input_tokens_seen": 8869211296,
      "step": 11273
    },
    {
      "epoch": 1.196053469127944,
      "grad_norm": 0.6316521618348516,
      "learning_rate": 4.8803793731032574e-05,
      "loss": 1.762,
      "num_input_tokens_seen": 8869998032,
      "step": 11274
    },
    {
      "epoch": 1.1961595586675153,
      "grad_norm": 0.4552861440679856,
      "learning_rate": 4.880358132152804e-05,
      "loss": 1.8823,
      "num_input_tokens_seen": 8870784896,
      "step": 11275
    },
    {
      "epoch": 1.1962656482070868,
      "grad_norm": 0.5942450041422206,
      "learning_rate": 4.8803368893628785e-05,
      "loss": 1.9394,
      "num_input_tokens_seen": 8871571680,
      "step": 11276
    },
    {
      "epoch": 1.196371737746658,
      "grad_norm": 0.4402270268922302,
      "learning_rate": 4.8803156447335e-05,
      "loss": 1.784,
      "num_input_tokens_seen": 8872358480,
      "step": 11277
    },
    {
      "epoch": 1.1964778272862295,
      "grad_norm": 0.46896502708788323,
      "learning_rate": 4.880294398264682e-05,
      "loss": 1.8566,
      "num_input_tokens_seen": 8873145232,
      "step": 11278
    },
    {
      "epoch": 1.196583916825801,
      "grad_norm": 0.4438121494948817,
      "learning_rate": 4.880273149956444e-05,
      "loss": 1.7562,
      "num_input_tokens_seen": 8873932032,
      "step": 11279
    },
    {
      "epoch": 1.1966900063653725,
      "grad_norm": 0.4090936164356107,
      "learning_rate": 4.8802518998088e-05,
      "loss": 1.7713,
      "num_input_tokens_seen": 8874718864,
      "step": 11280
    },
    {
      "epoch": 1.1967960959049437,
      "grad_norm": 0.3922671030648722,
      "learning_rate": 4.880230647821766e-05,
      "loss": 1.8579,
      "num_input_tokens_seen": 8875505616,
      "step": 11281
    },
    {
      "epoch": 1.1969021854445152,
      "grad_norm": 0.3987635754535276,
      "learning_rate": 4.8802093939953606e-05,
      "loss": 1.8261,
      "num_input_tokens_seen": 8876292496,
      "step": 11282
    },
    {
      "epoch": 1.1970082749840865,
      "grad_norm": 0.3919830525447884,
      "learning_rate": 4.8801881383296e-05,
      "loss": 1.7534,
      "num_input_tokens_seen": 8877079280,
      "step": 11283
    },
    {
      "epoch": 1.197114364523658,
      "grad_norm": 0.39967825828439874,
      "learning_rate": 4.880166880824499e-05,
      "loss": 1.7968,
      "num_input_tokens_seen": 8877866016,
      "step": 11284
    },
    {
      "epoch": 1.1972204540632294,
      "grad_norm": 0.39514376903561893,
      "learning_rate": 4.880145621480074e-05,
      "loss": 1.914,
      "num_input_tokens_seen": 8878652688,
      "step": 11285
    },
    {
      "epoch": 1.1973265436028009,
      "grad_norm": 0.38768115840206097,
      "learning_rate": 4.880124360296344e-05,
      "loss": 1.9022,
      "num_input_tokens_seen": 8879439456,
      "step": 11286
    },
    {
      "epoch": 1.1974326331423721,
      "grad_norm": 0.4231623417580805,
      "learning_rate": 4.880103097273323e-05,
      "loss": 1.7604,
      "num_input_tokens_seen": 8880226336,
      "step": 11287
    },
    {
      "epoch": 1.1975387226819436,
      "grad_norm": 0.3814003315714277,
      "learning_rate": 4.8800818324110284e-05,
      "loss": 1.8421,
      "num_input_tokens_seen": 8881013088,
      "step": 11288
    },
    {
      "epoch": 1.1976448122215149,
      "grad_norm": 0.3622569524758731,
      "learning_rate": 4.8800605657094755e-05,
      "loss": 1.7536,
      "num_input_tokens_seen": 8881799872,
      "step": 11289
    },
    {
      "epoch": 1.1977509017610863,
      "grad_norm": 0.4183852374429943,
      "learning_rate": 4.880039297168683e-05,
      "loss": 1.8587,
      "num_input_tokens_seen": 8882586672,
      "step": 11290
    },
    {
      "epoch": 1.1978569913006578,
      "grad_norm": 0.5250567035714748,
      "learning_rate": 4.8800180267886644e-05,
      "loss": 1.9277,
      "num_input_tokens_seen": 8883373488,
      "step": 11291
    },
    {
      "epoch": 1.197963080840229,
      "grad_norm": 0.493117801339445,
      "learning_rate": 4.879996754569439e-05,
      "loss": 1.8963,
      "num_input_tokens_seen": 8884160304,
      "step": 11292
    },
    {
      "epoch": 1.1980691703798005,
      "grad_norm": 0.5490104682079959,
      "learning_rate": 4.879975480511022e-05,
      "loss": 1.8562,
      "num_input_tokens_seen": 8884947168,
      "step": 11293
    },
    {
      "epoch": 1.198175259919372,
      "grad_norm": 0.3956270278625548,
      "learning_rate": 4.879954204613428e-05,
      "loss": 1.6597,
      "num_input_tokens_seen": 8885733888,
      "step": 11294
    },
    {
      "epoch": 1.1982813494589433,
      "grad_norm": 0.5368784216495607,
      "learning_rate": 4.879932926876677e-05,
      "loss": 1.8486,
      "num_input_tokens_seen": 8886520608,
      "step": 11295
    },
    {
      "epoch": 1.1983874389985147,
      "grad_norm": 0.39195300509833386,
      "learning_rate": 4.879911647300783e-05,
      "loss": 1.8566,
      "num_input_tokens_seen": 8887307376,
      "step": 11296
    },
    {
      "epoch": 1.1984935285380862,
      "grad_norm": 0.3898623979460827,
      "learning_rate": 4.879890365885764e-05,
      "loss": 1.8838,
      "num_input_tokens_seen": 8888094080,
      "step": 11297
    },
    {
      "epoch": 1.1985996180776575,
      "grad_norm": 0.3928574281043246,
      "learning_rate": 4.879869082631634e-05,
      "loss": 1.8716,
      "num_input_tokens_seen": 8888880864,
      "step": 11298
    },
    {
      "epoch": 1.198705707617229,
      "grad_norm": 0.3854420226428939,
      "learning_rate": 4.879847797538412e-05,
      "loss": 1.8684,
      "num_input_tokens_seen": 8889667680,
      "step": 11299
    },
    {
      "epoch": 1.1988117971568004,
      "grad_norm": 0.4111714716289162,
      "learning_rate": 4.8798265106061137e-05,
      "loss": 1.7133,
      "num_input_tokens_seen": 8890454448,
      "step": 11300
    },
    {
      "epoch": 1.1989178866963717,
      "grad_norm": 0.35389338763688344,
      "learning_rate": 4.879805221834755e-05,
      "loss": 1.6697,
      "num_input_tokens_seen": 8891241296,
      "step": 11301
    },
    {
      "epoch": 1.1990239762359431,
      "grad_norm": 0.4551560131641212,
      "learning_rate": 4.879783931224352e-05,
      "loss": 1.8057,
      "num_input_tokens_seen": 8892028064,
      "step": 11302
    },
    {
      "epoch": 1.1991300657755146,
      "grad_norm": 0.503126281191391,
      "learning_rate": 4.8797626387749226e-05,
      "loss": 1.8034,
      "num_input_tokens_seen": 8892814864,
      "step": 11303
    },
    {
      "epoch": 1.1992361553150859,
      "grad_norm": 0.45373375709382746,
      "learning_rate": 4.879741344486482e-05,
      "loss": 1.6936,
      "num_input_tokens_seen": 8893601632,
      "step": 11304
    },
    {
      "epoch": 1.1993422448546573,
      "grad_norm": 0.44474706317813845,
      "learning_rate": 4.879720048359047e-05,
      "loss": 1.8042,
      "num_input_tokens_seen": 8894388384,
      "step": 11305
    },
    {
      "epoch": 1.1994483343942288,
      "grad_norm": 0.5961365766784708,
      "learning_rate": 4.879698750392635e-05,
      "loss": 1.8102,
      "num_input_tokens_seen": 8895175152,
      "step": 11306
    },
    {
      "epoch": 1.1995544239338,
      "grad_norm": 0.474582912321996,
      "learning_rate": 4.879677450587261e-05,
      "loss": 1.7319,
      "num_input_tokens_seen": 8895962000,
      "step": 11307
    },
    {
      "epoch": 1.1996605134733715,
      "grad_norm": 0.7457784409000857,
      "learning_rate": 4.879656148942941e-05,
      "loss": 1.7261,
      "num_input_tokens_seen": 8896748752,
      "step": 11308
    },
    {
      "epoch": 1.199766603012943,
      "grad_norm": 0.49186519508525567,
      "learning_rate": 4.879634845459695e-05,
      "loss": 1.8601,
      "num_input_tokens_seen": 8897535504,
      "step": 11309
    },
    {
      "epoch": 1.1998726925525143,
      "grad_norm": 0.7783711411494292,
      "learning_rate": 4.879613540137535e-05,
      "loss": 1.7695,
      "num_input_tokens_seen": 8898322352,
      "step": 11310
    },
    {
      "epoch": 1.1999787820920857,
      "grad_norm": 0.4084372111009679,
      "learning_rate": 4.879592232976481e-05,
      "loss": 1.7244,
      "num_input_tokens_seen": 8899109104,
      "step": 11311
    },
    {
      "epoch": 1.200084871631657,
      "grad_norm": 0.5477426516870985,
      "learning_rate": 4.879570923976547e-05,
      "loss": 1.7862,
      "num_input_tokens_seen": 8899895840,
      "step": 11312
    },
    {
      "epoch": 1.2001909611712285,
      "grad_norm": 0.5958353113321104,
      "learning_rate": 4.879549613137751e-05,
      "loss": 1.7727,
      "num_input_tokens_seen": 8900682592,
      "step": 11313
    },
    {
      "epoch": 1.2002970507108,
      "grad_norm": 0.4000504702574621,
      "learning_rate": 4.879528300460108e-05,
      "loss": 1.7836,
      "num_input_tokens_seen": 8901469264,
      "step": 11314
    },
    {
      "epoch": 1.2004031402503714,
      "grad_norm": 0.6861313967530143,
      "learning_rate": 4.879506985943636e-05,
      "loss": 1.8345,
      "num_input_tokens_seen": 8902256000,
      "step": 11315
    },
    {
      "epoch": 1.2005092297899427,
      "grad_norm": 0.4601801891905523,
      "learning_rate": 4.8794856695883505e-05,
      "loss": 1.665,
      "num_input_tokens_seen": 8903042752,
      "step": 11316
    },
    {
      "epoch": 1.2006153193295142,
      "grad_norm": 0.47691030329433887,
      "learning_rate": 4.879464351394268e-05,
      "loss": 1.7159,
      "num_input_tokens_seen": 8903829488,
      "step": 11317
    },
    {
      "epoch": 1.2007214088690854,
      "grad_norm": 0.7497269335970936,
      "learning_rate": 4.879443031361406e-05,
      "loss": 1.7444,
      "num_input_tokens_seen": 8904616240,
      "step": 11318
    },
    {
      "epoch": 1.2008274984086569,
      "grad_norm": 0.48572663049764453,
      "learning_rate": 4.87942170948978e-05,
      "loss": 1.6723,
      "num_input_tokens_seen": 8905403040,
      "step": 11319
    },
    {
      "epoch": 1.2009335879482284,
      "grad_norm": 0.8254530211674358,
      "learning_rate": 4.879400385779407e-05,
      "loss": 1.857,
      "num_input_tokens_seen": 8906189904,
      "step": 11320
    },
    {
      "epoch": 1.2010396774877996,
      "grad_norm": 0.5846051776896141,
      "learning_rate": 4.8793790602303024e-05,
      "loss": 1.9639,
      "num_input_tokens_seen": 8906976656,
      "step": 11321
    },
    {
      "epoch": 1.201145767027371,
      "grad_norm": 0.5536039518435708,
      "learning_rate": 4.879357732842484e-05,
      "loss": 1.818,
      "num_input_tokens_seen": 8907763408,
      "step": 11322
    },
    {
      "epoch": 1.2012518565669426,
      "grad_norm": 0.5158787104966813,
      "learning_rate": 4.8793364036159675e-05,
      "loss": 1.7761,
      "num_input_tokens_seen": 8908550176,
      "step": 11323
    },
    {
      "epoch": 1.2013579461065138,
      "grad_norm": 0.5495362336882356,
      "learning_rate": 4.8793150725507696e-05,
      "loss": 1.7951,
      "num_input_tokens_seen": 8909336960,
      "step": 11324
    },
    {
      "epoch": 1.2014640356460853,
      "grad_norm": 0.43092825645942634,
      "learning_rate": 4.879293739646907e-05,
      "loss": 1.8833,
      "num_input_tokens_seen": 8910123648,
      "step": 11325
    },
    {
      "epoch": 1.2015701251856568,
      "grad_norm": 0.48634587770856375,
      "learning_rate": 4.8792724049043963e-05,
      "loss": 1.7412,
      "num_input_tokens_seen": 8910910368,
      "step": 11326
    },
    {
      "epoch": 1.201676214725228,
      "grad_norm": 0.4909129796147109,
      "learning_rate": 4.8792510683232535e-05,
      "loss": 1.6994,
      "num_input_tokens_seen": 8911697200,
      "step": 11327
    },
    {
      "epoch": 1.2017823042647995,
      "grad_norm": 0.46960825243258725,
      "learning_rate": 4.879229729903495e-05,
      "loss": 1.8437,
      "num_input_tokens_seen": 8912484000,
      "step": 11328
    },
    {
      "epoch": 1.201888393804371,
      "grad_norm": 0.4723227586691264,
      "learning_rate": 4.879208389645138e-05,
      "loss": 1.8519,
      "num_input_tokens_seen": 8913270800,
      "step": 11329
    },
    {
      "epoch": 1.2019944833439422,
      "grad_norm": 0.46527521105547526,
      "learning_rate": 4.879187047548198e-05,
      "loss": 1.8158,
      "num_input_tokens_seen": 8914057520,
      "step": 11330
    },
    {
      "epoch": 1.2021005728835137,
      "grad_norm": 0.41671395818835166,
      "learning_rate": 4.879165703612692e-05,
      "loss": 1.919,
      "num_input_tokens_seen": 8914844176,
      "step": 11331
    },
    {
      "epoch": 1.2022066624230852,
      "grad_norm": 0.44064512744512047,
      "learning_rate": 4.879144357838638e-05,
      "loss": 1.9034,
      "num_input_tokens_seen": 8915631008,
      "step": 11332
    },
    {
      "epoch": 1.2023127519626564,
      "grad_norm": 0.3815496065853542,
      "learning_rate": 4.87912301022605e-05,
      "loss": 1.7546,
      "num_input_tokens_seen": 8916417840,
      "step": 11333
    },
    {
      "epoch": 1.2024188415022279,
      "grad_norm": 0.3895966727788079,
      "learning_rate": 4.879101660774945e-05,
      "loss": 1.7203,
      "num_input_tokens_seen": 8917204672,
      "step": 11334
    },
    {
      "epoch": 1.2025249310417994,
      "grad_norm": 0.3833630874351869,
      "learning_rate": 4.879080309485341e-05,
      "loss": 1.8603,
      "num_input_tokens_seen": 8917991408,
      "step": 11335
    },
    {
      "epoch": 1.2026310205813706,
      "grad_norm": 0.4044388358049535,
      "learning_rate": 4.879058956357253e-05,
      "loss": 1.7619,
      "num_input_tokens_seen": 8918778112,
      "step": 11336
    },
    {
      "epoch": 1.202737110120942,
      "grad_norm": 0.36480424868105155,
      "learning_rate": 4.879037601390699e-05,
      "loss": 1.8713,
      "num_input_tokens_seen": 8919564896,
      "step": 11337
    },
    {
      "epoch": 1.2028431996605136,
      "grad_norm": 0.3807814487174783,
      "learning_rate": 4.8790162445856936e-05,
      "loss": 1.7053,
      "num_input_tokens_seen": 8920351728,
      "step": 11338
    },
    {
      "epoch": 1.2029492892000848,
      "grad_norm": 0.5241947427465031,
      "learning_rate": 4.878994885942254e-05,
      "loss": 1.8177,
      "num_input_tokens_seen": 8921138480,
      "step": 11339
    },
    {
      "epoch": 1.2030553787396563,
      "grad_norm": 0.3831641063249249,
      "learning_rate": 4.8789735254603976e-05,
      "loss": 1.7581,
      "num_input_tokens_seen": 8921925248,
      "step": 11340
    },
    {
      "epoch": 1.2031614682792278,
      "grad_norm": 0.5980820778491053,
      "learning_rate": 4.87895216314014e-05,
      "loss": 1.9199,
      "num_input_tokens_seen": 8922712032,
      "step": 11341
    },
    {
      "epoch": 1.203267557818799,
      "grad_norm": 0.4092604357968303,
      "learning_rate": 4.8789307989814984e-05,
      "loss": 1.8403,
      "num_input_tokens_seen": 8923498736,
      "step": 11342
    },
    {
      "epoch": 1.2033736473583705,
      "grad_norm": 0.45009712555758696,
      "learning_rate": 4.878909432984488e-05,
      "loss": 1.6944,
      "num_input_tokens_seen": 8924285520,
      "step": 11343
    },
    {
      "epoch": 1.203479736897942,
      "grad_norm": 0.4249559584170957,
      "learning_rate": 4.8788880651491266e-05,
      "loss": 1.9111,
      "num_input_tokens_seen": 8925072240,
      "step": 11344
    },
    {
      "epoch": 1.2035858264375132,
      "grad_norm": 0.42429129298625406,
      "learning_rate": 4.8788666954754304e-05,
      "loss": 1.7767,
      "num_input_tokens_seen": 8925859072,
      "step": 11345
    },
    {
      "epoch": 1.2036919159770847,
      "grad_norm": 0.5376940418003927,
      "learning_rate": 4.878845323963416e-05,
      "loss": 1.7662,
      "num_input_tokens_seen": 8926645824,
      "step": 11346
    },
    {
      "epoch": 1.203798005516656,
      "grad_norm": 0.4752065431938462,
      "learning_rate": 4.8788239506130993e-05,
      "loss": 1.7503,
      "num_input_tokens_seen": 8927432608,
      "step": 11347
    },
    {
      "epoch": 1.2039040950562274,
      "grad_norm": 0.47591959149618207,
      "learning_rate": 4.878802575424498e-05,
      "loss": 1.8891,
      "num_input_tokens_seen": 8928219392,
      "step": 11348
    },
    {
      "epoch": 1.204010184595799,
      "grad_norm": 0.3926049784243716,
      "learning_rate": 4.878781198397627e-05,
      "loss": 1.8108,
      "num_input_tokens_seen": 8929006160,
      "step": 11349
    },
    {
      "epoch": 1.2041162741353704,
      "grad_norm": 0.4743078984259624,
      "learning_rate": 4.878759819532504e-05,
      "loss": 1.9793,
      "num_input_tokens_seen": 8929792944,
      "step": 11350
    },
    {
      "epoch": 1.2042223636749416,
      "grad_norm": 0.4752307490056327,
      "learning_rate": 4.878738438829145e-05,
      "loss": 1.8664,
      "num_input_tokens_seen": 8930579728,
      "step": 11351
    },
    {
      "epoch": 1.204328453214513,
      "grad_norm": 0.43532690376178584,
      "learning_rate": 4.878717056287567e-05,
      "loss": 1.7381,
      "num_input_tokens_seen": 8931366480,
      "step": 11352
    },
    {
      "epoch": 1.2044345427540843,
      "grad_norm": 0.5917080646535042,
      "learning_rate": 4.8786956719077865e-05,
      "loss": 1.7486,
      "num_input_tokens_seen": 8932153264,
      "step": 11353
    },
    {
      "epoch": 1.2045406322936558,
      "grad_norm": 0.5192385926560065,
      "learning_rate": 4.878674285689819e-05,
      "loss": 1.818,
      "num_input_tokens_seen": 8932940016,
      "step": 11354
    },
    {
      "epoch": 1.2046467218332273,
      "grad_norm": 0.6791111183144607,
      "learning_rate": 4.878652897633683e-05,
      "loss": 1.7222,
      "num_input_tokens_seen": 8933726736,
      "step": 11355
    },
    {
      "epoch": 1.2047528113727985,
      "grad_norm": 0.5860832169692385,
      "learning_rate": 4.878631507739393e-05,
      "loss": 1.834,
      "num_input_tokens_seen": 8934513472,
      "step": 11356
    },
    {
      "epoch": 1.20485890091237,
      "grad_norm": 0.7580627808000483,
      "learning_rate": 4.8786101160069664e-05,
      "loss": 1.7571,
      "num_input_tokens_seen": 8935300192,
      "step": 11357
    },
    {
      "epoch": 1.2049649904519415,
      "grad_norm": 0.6554446305596174,
      "learning_rate": 4.87858872243642e-05,
      "loss": 1.8738,
      "num_input_tokens_seen": 8936086960,
      "step": 11358
    },
    {
      "epoch": 1.2050710799915128,
      "grad_norm": 0.7003897174639607,
      "learning_rate": 4.87856732702777e-05,
      "loss": 1.789,
      "num_input_tokens_seen": 8936873776,
      "step": 11359
    },
    {
      "epoch": 1.2051771695310842,
      "grad_norm": 0.6927838390168782,
      "learning_rate": 4.878545929781032e-05,
      "loss": 1.766,
      "num_input_tokens_seen": 8937660624,
      "step": 11360
    },
    {
      "epoch": 1.2052832590706557,
      "grad_norm": 0.4300609244176797,
      "learning_rate": 4.8785245306962245e-05,
      "loss": 1.8376,
      "num_input_tokens_seen": 8938447472,
      "step": 11361
    },
    {
      "epoch": 1.205389348610227,
      "grad_norm": 0.5051216198605818,
      "learning_rate": 4.878503129773363e-05,
      "loss": 1.8413,
      "num_input_tokens_seen": 8939234256,
      "step": 11362
    },
    {
      "epoch": 1.2054954381497984,
      "grad_norm": 0.6681602773337723,
      "learning_rate": 4.878481727012464e-05,
      "loss": 1.9149,
      "num_input_tokens_seen": 8940020912,
      "step": 11363
    },
    {
      "epoch": 1.20560152768937,
      "grad_norm": 0.4880436917591854,
      "learning_rate": 4.878460322413544e-05,
      "loss": 1.8761,
      "num_input_tokens_seen": 8940807568,
      "step": 11364
    },
    {
      "epoch": 1.2057076172289412,
      "grad_norm": 0.8045544108770718,
      "learning_rate": 4.87843891597662e-05,
      "loss": 1.8132,
      "num_input_tokens_seen": 8941594368,
      "step": 11365
    },
    {
      "epoch": 1.2058137067685126,
      "grad_norm": 0.4552787828255224,
      "learning_rate": 4.878417507701707e-05,
      "loss": 1.8429,
      "num_input_tokens_seen": 8942381072,
      "step": 11366
    },
    {
      "epoch": 1.205919796308084,
      "grad_norm": 0.5961281670863156,
      "learning_rate": 4.8783960975888244e-05,
      "loss": 1.9474,
      "num_input_tokens_seen": 8943167888,
      "step": 11367
    },
    {
      "epoch": 1.2060258858476554,
      "grad_norm": 0.4865192926323725,
      "learning_rate": 4.8783746856379865e-05,
      "loss": 1.7813,
      "num_input_tokens_seen": 8943954624,
      "step": 11368
    },
    {
      "epoch": 1.2061319753872268,
      "grad_norm": 0.45276948695014696,
      "learning_rate": 4.87835327184921e-05,
      "loss": 1.8507,
      "num_input_tokens_seen": 8944741280,
      "step": 11369
    },
    {
      "epoch": 1.2062380649267983,
      "grad_norm": 0.6611083704987598,
      "learning_rate": 4.878331856222512e-05,
      "loss": 1.7826,
      "num_input_tokens_seen": 8945528048,
      "step": 11370
    },
    {
      "epoch": 1.2063441544663696,
      "grad_norm": 0.45456442934961944,
      "learning_rate": 4.878310438757909e-05,
      "loss": 1.7426,
      "num_input_tokens_seen": 8946314784,
      "step": 11371
    },
    {
      "epoch": 1.206450244005941,
      "grad_norm": 0.6261896760022893,
      "learning_rate": 4.8782890194554174e-05,
      "loss": 1.7289,
      "num_input_tokens_seen": 8947101520,
      "step": 11372
    },
    {
      "epoch": 1.2065563335455125,
      "grad_norm": 0.4980532214569909,
      "learning_rate": 4.878267598315054e-05,
      "loss": 1.9263,
      "num_input_tokens_seen": 8947888288,
      "step": 11373
    },
    {
      "epoch": 1.2066624230850838,
      "grad_norm": 0.5323841725628493,
      "learning_rate": 4.8782461753368345e-05,
      "loss": 1.8563,
      "num_input_tokens_seen": 8948675024,
      "step": 11374
    },
    {
      "epoch": 1.2067685126246552,
      "grad_norm": 0.37399254036749796,
      "learning_rate": 4.878224750520777e-05,
      "loss": 1.7831,
      "num_input_tokens_seen": 8949461856,
      "step": 11375
    },
    {
      "epoch": 1.2068746021642265,
      "grad_norm": 0.4340558501171578,
      "learning_rate": 4.878203323866897e-05,
      "loss": 1.8531,
      "num_input_tokens_seen": 8950248656,
      "step": 11376
    },
    {
      "epoch": 1.206980691703798,
      "grad_norm": 0.5273123453585173,
      "learning_rate": 4.878181895375211e-05,
      "loss": 1.7915,
      "num_input_tokens_seen": 8951035328,
      "step": 11377
    },
    {
      "epoch": 1.2070867812433694,
      "grad_norm": 0.43059369141461784,
      "learning_rate": 4.878160465045736e-05,
      "loss": 1.7847,
      "num_input_tokens_seen": 8951822144,
      "step": 11378
    },
    {
      "epoch": 1.207192870782941,
      "grad_norm": 0.43111631648073045,
      "learning_rate": 4.8781390328784884e-05,
      "loss": 1.7462,
      "num_input_tokens_seen": 8952609008,
      "step": 11379
    },
    {
      "epoch": 1.2072989603225122,
      "grad_norm": 0.40775405693189853,
      "learning_rate": 4.878117598873485e-05,
      "loss": 1.8222,
      "num_input_tokens_seen": 8953395792,
      "step": 11380
    },
    {
      "epoch": 1.2074050498620836,
      "grad_norm": 0.42579288096757983,
      "learning_rate": 4.878096163030742e-05,
      "loss": 1.7791,
      "num_input_tokens_seen": 8954182496,
      "step": 11381
    },
    {
      "epoch": 1.2075111394016549,
      "grad_norm": 0.4253373147203783,
      "learning_rate": 4.878074725350276e-05,
      "loss": 1.7737,
      "num_input_tokens_seen": 8954969200,
      "step": 11382
    },
    {
      "epoch": 1.2076172289412264,
      "grad_norm": 0.4584324343125089,
      "learning_rate": 4.878053285832103e-05,
      "loss": 1.7975,
      "num_input_tokens_seen": 8955755936,
      "step": 11383
    },
    {
      "epoch": 1.2077233184807978,
      "grad_norm": 0.3705920900107676,
      "learning_rate": 4.8780318444762405e-05,
      "loss": 1.617,
      "num_input_tokens_seen": 8956542816,
      "step": 11384
    },
    {
      "epoch": 1.2078294080203693,
      "grad_norm": 0.44183409928106376,
      "learning_rate": 4.8780104012827055e-05,
      "loss": 1.5922,
      "num_input_tokens_seen": 8957329600,
      "step": 11385
    },
    {
      "epoch": 1.2079354975599406,
      "grad_norm": 0.35863469005042115,
      "learning_rate": 4.877988956251513e-05,
      "loss": 1.8045,
      "num_input_tokens_seen": 8958116352,
      "step": 11386
    },
    {
      "epoch": 1.208041587099512,
      "grad_norm": 0.3629489418087452,
      "learning_rate": 4.87796750938268e-05,
      "loss": 1.795,
      "num_input_tokens_seen": 8958903104,
      "step": 11387
    },
    {
      "epoch": 1.2081476766390833,
      "grad_norm": 0.4220339792782144,
      "learning_rate": 4.877946060676225e-05,
      "loss": 1.7998,
      "num_input_tokens_seen": 8959689824,
      "step": 11388
    },
    {
      "epoch": 1.2082537661786548,
      "grad_norm": 0.7001682879671328,
      "learning_rate": 4.877924610132162e-05,
      "loss": 1.9737,
      "num_input_tokens_seen": 8960476592,
      "step": 11389
    },
    {
      "epoch": 1.2083598557182262,
      "grad_norm": 0.8372598304160123,
      "learning_rate": 4.8779031577505085e-05,
      "loss": 1.7709,
      "num_input_tokens_seen": 8961263456,
      "step": 11390
    },
    {
      "epoch": 1.2084659452577975,
      "grad_norm": 0.6110573581608125,
      "learning_rate": 4.877881703531282e-05,
      "loss": 1.6828,
      "num_input_tokens_seen": 8962050304,
      "step": 11391
    },
    {
      "epoch": 1.208572034797369,
      "grad_norm": 0.552520353094904,
      "learning_rate": 4.877860247474498e-05,
      "loss": 1.8229,
      "num_input_tokens_seen": 8962836976,
      "step": 11392
    },
    {
      "epoch": 1.2086781243369404,
      "grad_norm": 0.5391191162489981,
      "learning_rate": 4.877838789580173e-05,
      "loss": 1.708,
      "num_input_tokens_seen": 8963623824,
      "step": 11393
    },
    {
      "epoch": 1.2087842138765117,
      "grad_norm": 0.4775977420202979,
      "learning_rate": 4.877817329848324e-05,
      "loss": 1.6724,
      "num_input_tokens_seen": 8964410688,
      "step": 11394
    },
    {
      "epoch": 1.2088903034160832,
      "grad_norm": 0.8055263880517494,
      "learning_rate": 4.877795868278968e-05,
      "loss": 1.7876,
      "num_input_tokens_seen": 8965197440,
      "step": 11395
    },
    {
      "epoch": 1.2089963929556546,
      "grad_norm": 0.7295405828286465,
      "learning_rate": 4.8777744048721206e-05,
      "loss": 1.7334,
      "num_input_tokens_seen": 8965984160,
      "step": 11396
    },
    {
      "epoch": 1.209102482495226,
      "grad_norm": 0.6464831713157654,
      "learning_rate": 4.877752939627799e-05,
      "loss": 1.816,
      "num_input_tokens_seen": 8966770928,
      "step": 11397
    },
    {
      "epoch": 1.2092085720347974,
      "grad_norm": 0.8036370450362728,
      "learning_rate": 4.87773147254602e-05,
      "loss": 1.7735,
      "num_input_tokens_seen": 8967557792,
      "step": 11398
    },
    {
      "epoch": 1.2093146615743688,
      "grad_norm": 0.5484768120607639,
      "learning_rate": 4.8777100036268e-05,
      "loss": 1.7608,
      "num_input_tokens_seen": 8968344544,
      "step": 11399
    },
    {
      "epoch": 1.20942075111394,
      "grad_norm": 0.6476081701383695,
      "learning_rate": 4.8776885328701546e-05,
      "loss": 1.8287,
      "num_input_tokens_seen": 8969131344,
      "step": 11400
    },
    {
      "epoch": 1.2095268406535116,
      "grad_norm": 0.44149458553180077,
      "learning_rate": 4.877667060276103e-05,
      "loss": 1.8877,
      "num_input_tokens_seen": 8969918064,
      "step": 11401
    },
    {
      "epoch": 1.209632930193083,
      "grad_norm": 0.5383356314619125,
      "learning_rate": 4.877645585844659e-05,
      "loss": 1.8246,
      "num_input_tokens_seen": 8970704880,
      "step": 11402
    },
    {
      "epoch": 1.2097390197326543,
      "grad_norm": 0.47985403987059955,
      "learning_rate": 4.87762410957584e-05,
      "loss": 1.7036,
      "num_input_tokens_seen": 8971491632,
      "step": 11403
    },
    {
      "epoch": 1.2098451092722258,
      "grad_norm": 0.4451264159881285,
      "learning_rate": 4.8776026314696626e-05,
      "loss": 1.936,
      "num_input_tokens_seen": 8972278448,
      "step": 11404
    },
    {
      "epoch": 1.2099511988117972,
      "grad_norm": 0.4030678876209118,
      "learning_rate": 4.8775811515261436e-05,
      "loss": 1.668,
      "num_input_tokens_seen": 8973065280,
      "step": 11405
    },
    {
      "epoch": 1.2100572883513685,
      "grad_norm": 0.4393018488956005,
      "learning_rate": 4.877559669745301e-05,
      "loss": 1.7812,
      "num_input_tokens_seen": 8973851952,
      "step": 11406
    },
    {
      "epoch": 1.21016337789094,
      "grad_norm": 0.43604465628215655,
      "learning_rate": 4.877538186127149e-05,
      "loss": 1.7957,
      "num_input_tokens_seen": 8974638688,
      "step": 11407
    },
    {
      "epoch": 1.2102694674305114,
      "grad_norm": 0.43893936494118124,
      "learning_rate": 4.8775167006717056e-05,
      "loss": 1.7802,
      "num_input_tokens_seen": 8975425488,
      "step": 11408
    },
    {
      "epoch": 1.2103755569700827,
      "grad_norm": 0.4028765712292866,
      "learning_rate": 4.8774952133789865e-05,
      "loss": 1.7086,
      "num_input_tokens_seen": 8976212304,
      "step": 11409
    },
    {
      "epoch": 1.2104816465096542,
      "grad_norm": 0.4345460929265214,
      "learning_rate": 4.87747372424901e-05,
      "loss": 1.6855,
      "num_input_tokens_seen": 8976999104,
      "step": 11410
    },
    {
      "epoch": 1.2105877360492254,
      "grad_norm": 0.35264790631984816,
      "learning_rate": 4.8774522332817906e-05,
      "loss": 1.7683,
      "num_input_tokens_seen": 8977785808,
      "step": 11411
    },
    {
      "epoch": 1.210693825588797,
      "grad_norm": 0.44724471532099314,
      "learning_rate": 4.8774307404773455e-05,
      "loss": 1.8117,
      "num_input_tokens_seen": 8978572576,
      "step": 11412
    },
    {
      "epoch": 1.2107999151283684,
      "grad_norm": 0.5425530576956826,
      "learning_rate": 4.877409245835693e-05,
      "loss": 1.877,
      "num_input_tokens_seen": 8979359376,
      "step": 11413
    },
    {
      "epoch": 1.2109060046679399,
      "grad_norm": 0.4082213520917047,
      "learning_rate": 4.877387749356848e-05,
      "loss": 1.8345,
      "num_input_tokens_seen": 8980146080,
      "step": 11414
    },
    {
      "epoch": 1.211012094207511,
      "grad_norm": 0.5100325245391211,
      "learning_rate": 4.877366251040827e-05,
      "loss": 1.8511,
      "num_input_tokens_seen": 8980932736,
      "step": 11415
    },
    {
      "epoch": 1.2111181837470826,
      "grad_norm": 0.3849250943385767,
      "learning_rate": 4.877344750887647e-05,
      "loss": 1.7269,
      "num_input_tokens_seen": 8981719488,
      "step": 11416
    },
    {
      "epoch": 1.2112242732866538,
      "grad_norm": 0.41453957568392213,
      "learning_rate": 4.8773232488973245e-05,
      "loss": 1.7654,
      "num_input_tokens_seen": 8982506240,
      "step": 11417
    },
    {
      "epoch": 1.2113303628262253,
      "grad_norm": 0.4996679344605105,
      "learning_rate": 4.877301745069877e-05,
      "loss": 1.7517,
      "num_input_tokens_seen": 8983292928,
      "step": 11418
    },
    {
      "epoch": 1.2114364523657968,
      "grad_norm": 0.40611613630961935,
      "learning_rate": 4.8772802394053206e-05,
      "loss": 1.7255,
      "num_input_tokens_seen": 8984079760,
      "step": 11419
    },
    {
      "epoch": 1.2115425419053683,
      "grad_norm": 0.4666421711284284,
      "learning_rate": 4.8772587319036714e-05,
      "loss": 1.8976,
      "num_input_tokens_seen": 8984866544,
      "step": 11420
    },
    {
      "epoch": 1.2116486314449395,
      "grad_norm": 0.6095184362878254,
      "learning_rate": 4.8772372225649466e-05,
      "loss": 1.9642,
      "num_input_tokens_seen": 8985653312,
      "step": 11421
    },
    {
      "epoch": 1.211754720984511,
      "grad_norm": 0.40765548608827334,
      "learning_rate": 4.8772157113891626e-05,
      "loss": 1.786,
      "num_input_tokens_seen": 8986440160,
      "step": 11422
    },
    {
      "epoch": 1.2118608105240822,
      "grad_norm": 0.5033013920426619,
      "learning_rate": 4.8771941983763355e-05,
      "loss": 1.8318,
      "num_input_tokens_seen": 8987226912,
      "step": 11423
    },
    {
      "epoch": 1.2119669000636537,
      "grad_norm": 0.5086017241244678,
      "learning_rate": 4.877172683526483e-05,
      "loss": 1.7439,
      "num_input_tokens_seen": 8988013744,
      "step": 11424
    },
    {
      "epoch": 1.2120729896032252,
      "grad_norm": 0.3927175507535689,
      "learning_rate": 4.877151166839622e-05,
      "loss": 1.8981,
      "num_input_tokens_seen": 8988800480,
      "step": 11425
    },
    {
      "epoch": 1.2121790791427964,
      "grad_norm": 0.4142675106020117,
      "learning_rate": 4.877129648315767e-05,
      "loss": 1.7691,
      "num_input_tokens_seen": 8989587360,
      "step": 11426
    },
    {
      "epoch": 1.212285168682368,
      "grad_norm": 0.44177877084440736,
      "learning_rate": 4.8771081279549366e-05,
      "loss": 1.8147,
      "num_input_tokens_seen": 8990374032,
      "step": 11427
    },
    {
      "epoch": 1.2123912582219394,
      "grad_norm": 0.4609688464840885,
      "learning_rate": 4.8770866057571465e-05,
      "loss": 1.8213,
      "num_input_tokens_seen": 8991160816,
      "step": 11428
    },
    {
      "epoch": 1.2124973477615106,
      "grad_norm": 0.42185815404899596,
      "learning_rate": 4.877065081722414e-05,
      "loss": 1.7917,
      "num_input_tokens_seen": 8991947616,
      "step": 11429
    },
    {
      "epoch": 1.212603437301082,
      "grad_norm": 0.40232569937550966,
      "learning_rate": 4.877043555850755e-05,
      "loss": 1.7629,
      "num_input_tokens_seen": 8992734400,
      "step": 11430
    },
    {
      "epoch": 1.2127095268406536,
      "grad_norm": 0.5140188753884147,
      "learning_rate": 4.877022028142186e-05,
      "loss": 1.8519,
      "num_input_tokens_seen": 8993521136,
      "step": 11431
    },
    {
      "epoch": 1.2128156163802248,
      "grad_norm": 0.3817523624825231,
      "learning_rate": 4.8770004985967255e-05,
      "loss": 1.8597,
      "num_input_tokens_seen": 8994307888,
      "step": 11432
    },
    {
      "epoch": 1.2129217059197963,
      "grad_norm": 0.42204824096358573,
      "learning_rate": 4.876978967214388e-05,
      "loss": 1.613,
      "num_input_tokens_seen": 8995094736,
      "step": 11433
    },
    {
      "epoch": 1.2130277954593678,
      "grad_norm": 0.40708277890249744,
      "learning_rate": 4.8769574339951907e-05,
      "loss": 1.8031,
      "num_input_tokens_seen": 8995881584,
      "step": 11434
    },
    {
      "epoch": 1.213133884998939,
      "grad_norm": 0.3833711109561438,
      "learning_rate": 4.8769358989391504e-05,
      "loss": 1.8524,
      "num_input_tokens_seen": 8996668352,
      "step": 11435
    },
    {
      "epoch": 1.2132399745385105,
      "grad_norm": 0.3831184813899205,
      "learning_rate": 4.876914362046284e-05,
      "loss": 1.7697,
      "num_input_tokens_seen": 8997455136,
      "step": 11436
    },
    {
      "epoch": 1.213346064078082,
      "grad_norm": 0.4104437424913048,
      "learning_rate": 4.876892823316608e-05,
      "loss": 1.8425,
      "num_input_tokens_seen": 8998241936,
      "step": 11437
    },
    {
      "epoch": 1.2134521536176532,
      "grad_norm": 0.449581744457325,
      "learning_rate": 4.8768712827501396e-05,
      "loss": 1.8324,
      "num_input_tokens_seen": 8999028688,
      "step": 11438
    },
    {
      "epoch": 1.2135582431572247,
      "grad_norm": 0.4359224594581945,
      "learning_rate": 4.8768497403468936e-05,
      "loss": 1.9073,
      "num_input_tokens_seen": 8999815344,
      "step": 11439
    },
    {
      "epoch": 1.2136643326967962,
      "grad_norm": 0.40802592291463646,
      "learning_rate": 4.8768281961068884e-05,
      "loss": 1.8095,
      "num_input_tokens_seen": 9000602160,
      "step": 11440
    },
    {
      "epoch": 1.2137704222363674,
      "grad_norm": 0.657749888465157,
      "learning_rate": 4.8768066500301405e-05,
      "loss": 1.9116,
      "num_input_tokens_seen": 9001388912,
      "step": 11441
    },
    {
      "epoch": 1.213876511775939,
      "grad_norm": 0.3716771727279501,
      "learning_rate": 4.876785102116665e-05,
      "loss": 1.6755,
      "num_input_tokens_seen": 9002175760,
      "step": 11442
    },
    {
      "epoch": 1.2139826013155104,
      "grad_norm": 0.4752341648024558,
      "learning_rate": 4.876763552366481e-05,
      "loss": 1.75,
      "num_input_tokens_seen": 9002962576,
      "step": 11443
    },
    {
      "epoch": 1.2140886908550816,
      "grad_norm": 0.5059278854991087,
      "learning_rate": 4.8767420007796035e-05,
      "loss": 1.8334,
      "num_input_tokens_seen": 9003749344,
      "step": 11444
    },
    {
      "epoch": 1.2141947803946531,
      "grad_norm": 0.4284681802308635,
      "learning_rate": 4.876720447356049e-05,
      "loss": 1.7082,
      "num_input_tokens_seen": 9004536192,
      "step": 11445
    },
    {
      "epoch": 1.2143008699342244,
      "grad_norm": 0.6366154641385695,
      "learning_rate": 4.8766988920958354e-05,
      "loss": 1.8291,
      "num_input_tokens_seen": 9005322928,
      "step": 11446
    },
    {
      "epoch": 1.2144069594737958,
      "grad_norm": 0.4575977086350409,
      "learning_rate": 4.876677334998978e-05,
      "loss": 1.8632,
      "num_input_tokens_seen": 9006109712,
      "step": 11447
    },
    {
      "epoch": 1.2145130490133673,
      "grad_norm": 0.6513766769504196,
      "learning_rate": 4.8766557760654944e-05,
      "loss": 1.8413,
      "num_input_tokens_seen": 9006896528,
      "step": 11448
    },
    {
      "epoch": 1.2146191385529388,
      "grad_norm": 0.5475322374690026,
      "learning_rate": 4.876634215295401e-05,
      "loss": 1.7942,
      "num_input_tokens_seen": 9007683232,
      "step": 11449
    },
    {
      "epoch": 1.21472522809251,
      "grad_norm": 0.39557743362984066,
      "learning_rate": 4.876612652688714e-05,
      "loss": 1.6936,
      "num_input_tokens_seen": 9008469952,
      "step": 11450
    },
    {
      "epoch": 1.2148313176320815,
      "grad_norm": 0.4503326541492565,
      "learning_rate": 4.876591088245451e-05,
      "loss": 1.8901,
      "num_input_tokens_seen": 9009256768,
      "step": 11451
    },
    {
      "epoch": 1.2149374071716528,
      "grad_norm": 0.5954997024449399,
      "learning_rate": 4.876569521965628e-05,
      "loss": 1.7741,
      "num_input_tokens_seen": 9010043488,
      "step": 11452
    },
    {
      "epoch": 1.2150434967112242,
      "grad_norm": 0.410627632305929,
      "learning_rate": 4.876547953849261e-05,
      "loss": 1.781,
      "num_input_tokens_seen": 9010830224,
      "step": 11453
    },
    {
      "epoch": 1.2151495862507957,
      "grad_norm": 0.4391359103643946,
      "learning_rate": 4.876526383896369e-05,
      "loss": 1.697,
      "num_input_tokens_seen": 9011616992,
      "step": 11454
    },
    {
      "epoch": 1.215255675790367,
      "grad_norm": 0.3837971338608446,
      "learning_rate": 4.876504812106966e-05,
      "loss": 1.7433,
      "num_input_tokens_seen": 9012403776,
      "step": 11455
    },
    {
      "epoch": 1.2153617653299384,
      "grad_norm": 0.43212885160527725,
      "learning_rate": 4.87648323848107e-05,
      "loss": 1.8804,
      "num_input_tokens_seen": 9013190576,
      "step": 11456
    },
    {
      "epoch": 1.21546785486951,
      "grad_norm": 0.4357696382299448,
      "learning_rate": 4.876461663018698e-05,
      "loss": 1.8481,
      "num_input_tokens_seen": 9013977376,
      "step": 11457
    },
    {
      "epoch": 1.2155739444090812,
      "grad_norm": 0.4357103305487365,
      "learning_rate": 4.8764400857198654e-05,
      "loss": 1.8128,
      "num_input_tokens_seen": 9014764112,
      "step": 11458
    },
    {
      "epoch": 1.2156800339486526,
      "grad_norm": 0.43867040457545725,
      "learning_rate": 4.8764185065845904e-05,
      "loss": 1.8922,
      "num_input_tokens_seen": 9015550832,
      "step": 11459
    },
    {
      "epoch": 1.2157861234882241,
      "grad_norm": 0.4382055575716706,
      "learning_rate": 4.876396925612888e-05,
      "loss": 1.7482,
      "num_input_tokens_seen": 9016337696,
      "step": 11460
    },
    {
      "epoch": 1.2158922130277954,
      "grad_norm": 0.46098175471786373,
      "learning_rate": 4.876375342804777e-05,
      "loss": 1.683,
      "num_input_tokens_seen": 9017124528,
      "step": 11461
    },
    {
      "epoch": 1.2159983025673669,
      "grad_norm": 0.5439279978802443,
      "learning_rate": 4.876353758160272e-05,
      "loss": 1.8414,
      "num_input_tokens_seen": 9017911232,
      "step": 11462
    },
    {
      "epoch": 1.2161043921069383,
      "grad_norm": 0.3894016517329575,
      "learning_rate": 4.8763321716793905e-05,
      "loss": 1.6691,
      "num_input_tokens_seen": 9018698096,
      "step": 11463
    },
    {
      "epoch": 1.2162104816465096,
      "grad_norm": 0.41647635640895536,
      "learning_rate": 4.8763105833621496e-05,
      "loss": 1.8045,
      "num_input_tokens_seen": 9019484816,
      "step": 11464
    },
    {
      "epoch": 1.216316571186081,
      "grad_norm": 0.38989787890880434,
      "learning_rate": 4.876288993208566e-05,
      "loss": 1.7635,
      "num_input_tokens_seen": 9020271616,
      "step": 11465
    },
    {
      "epoch": 1.2164226607256525,
      "grad_norm": 0.46680170758231776,
      "learning_rate": 4.876267401218655e-05,
      "loss": 1.661,
      "num_input_tokens_seen": 9021058352,
      "step": 11466
    },
    {
      "epoch": 1.2165287502652238,
      "grad_norm": 0.3958022632083729,
      "learning_rate": 4.8762458073924344e-05,
      "loss": 1.792,
      "num_input_tokens_seen": 9021845120,
      "step": 11467
    },
    {
      "epoch": 1.2166348398047953,
      "grad_norm": 0.43313871327392883,
      "learning_rate": 4.876224211729922e-05,
      "loss": 1.8179,
      "num_input_tokens_seen": 9022631904,
      "step": 11468
    },
    {
      "epoch": 1.2167409293443667,
      "grad_norm": 0.39021347405946105,
      "learning_rate": 4.8762026142311316e-05,
      "loss": 1.8099,
      "num_input_tokens_seen": 9023418720,
      "step": 11469
    },
    {
      "epoch": 1.216847018883938,
      "grad_norm": 0.46540135094065144,
      "learning_rate": 4.8761810148960825e-05,
      "loss": 1.8702,
      "num_input_tokens_seen": 9024205424,
      "step": 11470
    },
    {
      "epoch": 1.2169531084235095,
      "grad_norm": 0.33684919258556634,
      "learning_rate": 4.87615941372479e-05,
      "loss": 1.6803,
      "num_input_tokens_seen": 9024992224,
      "step": 11471
    },
    {
      "epoch": 1.217059197963081,
      "grad_norm": 0.5373555919234966,
      "learning_rate": 4.876137810717272e-05,
      "loss": 2.0319,
      "num_input_tokens_seen": 9025778896,
      "step": 11472
    },
    {
      "epoch": 1.2171652875026522,
      "grad_norm": 0.439300754213806,
      "learning_rate": 4.876116205873543e-05,
      "loss": 1.6833,
      "num_input_tokens_seen": 9026565680,
      "step": 11473
    },
    {
      "epoch": 1.2172713770422237,
      "grad_norm": 0.5580378152639682,
      "learning_rate": 4.876094599193622e-05,
      "loss": 1.8246,
      "num_input_tokens_seen": 9027352384,
      "step": 11474
    },
    {
      "epoch": 1.2173774665817951,
      "grad_norm": 0.45578849468348914,
      "learning_rate": 4.8760729906775246e-05,
      "loss": 1.891,
      "num_input_tokens_seen": 9028139104,
      "step": 11475
    },
    {
      "epoch": 1.2174835561213664,
      "grad_norm": 0.4493008939039843,
      "learning_rate": 4.8760513803252685e-05,
      "loss": 1.709,
      "num_input_tokens_seen": 9028925952,
      "step": 11476
    },
    {
      "epoch": 1.2175896456609379,
      "grad_norm": 0.48023494785656756,
      "learning_rate": 4.876029768136869e-05,
      "loss": 1.748,
      "num_input_tokens_seen": 9029712800,
      "step": 11477
    },
    {
      "epoch": 1.2176957352005093,
      "grad_norm": 0.3977392270982911,
      "learning_rate": 4.8760081541123436e-05,
      "loss": 1.7345,
      "num_input_tokens_seen": 9030499584,
      "step": 11478
    },
    {
      "epoch": 1.2178018247400806,
      "grad_norm": 0.5682381663374534,
      "learning_rate": 4.875986538251709e-05,
      "loss": 1.6735,
      "num_input_tokens_seen": 9031286464,
      "step": 11479
    },
    {
      "epoch": 1.217907914279652,
      "grad_norm": 0.4774369344631544,
      "learning_rate": 4.8759649205549804e-05,
      "loss": 1.8597,
      "num_input_tokens_seen": 9032073232,
      "step": 11480
    },
    {
      "epoch": 1.2180140038192233,
      "grad_norm": 0.5305608212654076,
      "learning_rate": 4.875943301022177e-05,
      "loss": 1.8166,
      "num_input_tokens_seen": 9032859936,
      "step": 11481
    },
    {
      "epoch": 1.2181200933587948,
      "grad_norm": 0.513392550908158,
      "learning_rate": 4.8759216796533144e-05,
      "loss": 1.9165,
      "num_input_tokens_seen": 9033646592,
      "step": 11482
    },
    {
      "epoch": 1.2182261828983663,
      "grad_norm": 0.5653725075635031,
      "learning_rate": 4.875900056448409e-05,
      "loss": 1.7773,
      "num_input_tokens_seen": 9034433344,
      "step": 11483
    },
    {
      "epoch": 1.2183322724379377,
      "grad_norm": 0.4946809991698455,
      "learning_rate": 4.8758784314074776e-05,
      "loss": 1.8519,
      "num_input_tokens_seen": 9035220080,
      "step": 11484
    },
    {
      "epoch": 1.218438361977509,
      "grad_norm": 0.4911821418794036,
      "learning_rate": 4.875856804530538e-05,
      "loss": 1.7462,
      "num_input_tokens_seen": 9036006816,
      "step": 11485
    },
    {
      "epoch": 1.2185444515170805,
      "grad_norm": 0.520865782860306,
      "learning_rate": 4.8758351758176043e-05,
      "loss": 1.8695,
      "num_input_tokens_seen": 9036793520,
      "step": 11486
    },
    {
      "epoch": 1.2186505410566517,
      "grad_norm": 0.3739146238932618,
      "learning_rate": 4.875813545268696e-05,
      "loss": 1.8952,
      "num_input_tokens_seen": 9037580240,
      "step": 11487
    },
    {
      "epoch": 1.2187566305962232,
      "grad_norm": 0.6834553937495307,
      "learning_rate": 4.875791912883828e-05,
      "loss": 1.7881,
      "num_input_tokens_seen": 9038366896,
      "step": 11488
    },
    {
      "epoch": 1.2188627201357947,
      "grad_norm": 0.3947004449777589,
      "learning_rate": 4.875770278663018e-05,
      "loss": 1.8238,
      "num_input_tokens_seen": 9039153648,
      "step": 11489
    },
    {
      "epoch": 1.218968809675366,
      "grad_norm": 0.4877648162152888,
      "learning_rate": 4.875748642606283e-05,
      "loss": 1.781,
      "num_input_tokens_seen": 9039940480,
      "step": 11490
    },
    {
      "epoch": 1.2190748992149374,
      "grad_norm": 0.45364859332700924,
      "learning_rate": 4.875727004713638e-05,
      "loss": 1.9443,
      "num_input_tokens_seen": 9040727184,
      "step": 11491
    },
    {
      "epoch": 1.2191809887545089,
      "grad_norm": 0.5913761255375344,
      "learning_rate": 4.875705364985103e-05,
      "loss": 1.7859,
      "num_input_tokens_seen": 9041513840,
      "step": 11492
    },
    {
      "epoch": 1.2192870782940801,
      "grad_norm": 0.4228384351649213,
      "learning_rate": 4.875683723420691e-05,
      "loss": 1.9454,
      "num_input_tokens_seen": 9042300608,
      "step": 11493
    },
    {
      "epoch": 1.2193931678336516,
      "grad_norm": 0.40033574536760425,
      "learning_rate": 4.87566208002042e-05,
      "loss": 1.6421,
      "num_input_tokens_seen": 9043087408,
      "step": 11494
    },
    {
      "epoch": 1.219499257373223,
      "grad_norm": 0.4760345878955487,
      "learning_rate": 4.8756404347843076e-05,
      "loss": 1.8506,
      "num_input_tokens_seen": 9043874080,
      "step": 11495
    },
    {
      "epoch": 1.2196053469127943,
      "grad_norm": 0.4470768735608911,
      "learning_rate": 4.87561878771237e-05,
      "loss": 1.7829,
      "num_input_tokens_seen": 9044660832,
      "step": 11496
    },
    {
      "epoch": 1.2197114364523658,
      "grad_norm": 0.5346650429967488,
      "learning_rate": 4.8755971388046237e-05,
      "loss": 1.8908,
      "num_input_tokens_seen": 9045447632,
      "step": 11497
    },
    {
      "epoch": 1.2198175259919373,
      "grad_norm": 0.4824374900286372,
      "learning_rate": 4.875575488061086e-05,
      "loss": 1.8784,
      "num_input_tokens_seen": 9046234368,
      "step": 11498
    },
    {
      "epoch": 1.2199236155315085,
      "grad_norm": 0.5027436280545388,
      "learning_rate": 4.875553835481773e-05,
      "loss": 1.7138,
      "num_input_tokens_seen": 9047021232,
      "step": 11499
    },
    {
      "epoch": 1.22002970507108,
      "grad_norm": 0.44745708884225543,
      "learning_rate": 4.875532181066702e-05,
      "loss": 1.7932,
      "num_input_tokens_seen": 9047808064,
      "step": 11500
    },
    {
      "epoch": 1.2201357946106515,
      "grad_norm": 0.48095317767483947,
      "learning_rate": 4.875510524815889e-05,
      "loss": 1.7878,
      "num_input_tokens_seen": 9048594784,
      "step": 11501
    },
    {
      "epoch": 1.2202418841502227,
      "grad_norm": 0.5272069555614685,
      "learning_rate": 4.8754888667293515e-05,
      "loss": 1.7254,
      "num_input_tokens_seen": 9049381632,
      "step": 11502
    },
    {
      "epoch": 1.2203479736897942,
      "grad_norm": 0.7167603705752922,
      "learning_rate": 4.8754672068071064e-05,
      "loss": 1.7942,
      "num_input_tokens_seen": 9050168448,
      "step": 11503
    },
    {
      "epoch": 1.2204540632293657,
      "grad_norm": 0.4941377409001561,
      "learning_rate": 4.875445545049169e-05,
      "loss": 1.8071,
      "num_input_tokens_seen": 9050955152,
      "step": 11504
    },
    {
      "epoch": 1.220560152768937,
      "grad_norm": 0.5695910690000667,
      "learning_rate": 4.875423881455557e-05,
      "loss": 1.7461,
      "num_input_tokens_seen": 9051741920,
      "step": 11505
    },
    {
      "epoch": 1.2206662423085084,
      "grad_norm": 0.5398347108465203,
      "learning_rate": 4.875402216026288e-05,
      "loss": 1.8167,
      "num_input_tokens_seen": 9052528656,
      "step": 11506
    },
    {
      "epoch": 1.2207723318480799,
      "grad_norm": 0.4337521822462159,
      "learning_rate": 4.875380548761377e-05,
      "loss": 1.8188,
      "num_input_tokens_seen": 9053315424,
      "step": 11507
    },
    {
      "epoch": 1.2208784213876511,
      "grad_norm": 0.3792658050648256,
      "learning_rate": 4.875358879660842e-05,
      "loss": 1.7643,
      "num_input_tokens_seen": 9054102128,
      "step": 11508
    },
    {
      "epoch": 1.2209845109272226,
      "grad_norm": 0.4844749534503769,
      "learning_rate": 4.875337208724699e-05,
      "loss": 1.8097,
      "num_input_tokens_seen": 9054888864,
      "step": 11509
    },
    {
      "epoch": 1.2210906004667939,
      "grad_norm": 0.49715960994330244,
      "learning_rate": 4.8753155359529656e-05,
      "loss": 1.7478,
      "num_input_tokens_seen": 9055675648,
      "step": 11510
    },
    {
      "epoch": 1.2211966900063653,
      "grad_norm": 0.49262490744726556,
      "learning_rate": 4.875293861345658e-05,
      "loss": 1.8693,
      "num_input_tokens_seen": 9056462384,
      "step": 11511
    },
    {
      "epoch": 1.2213027795459368,
      "grad_norm": 0.4826465998837151,
      "learning_rate": 4.875272184902793e-05,
      "loss": 1.7784,
      "num_input_tokens_seen": 9057249120,
      "step": 11512
    },
    {
      "epoch": 1.2214088690855083,
      "grad_norm": 0.45118781204575725,
      "learning_rate": 4.875250506624386e-05,
      "loss": 1.9367,
      "num_input_tokens_seen": 9058035936,
      "step": 11513
    },
    {
      "epoch": 1.2215149586250795,
      "grad_norm": 0.4143373331804494,
      "learning_rate": 4.8752288265104566e-05,
      "loss": 1.8582,
      "num_input_tokens_seen": 9058822720,
      "step": 11514
    },
    {
      "epoch": 1.221621048164651,
      "grad_norm": 0.4701951481146964,
      "learning_rate": 4.87520714456102e-05,
      "loss": 1.7058,
      "num_input_tokens_seen": 9059609472,
      "step": 11515
    },
    {
      "epoch": 1.2217271377042223,
      "grad_norm": 0.4985922082098659,
      "learning_rate": 4.875185460776093e-05,
      "loss": 1.7739,
      "num_input_tokens_seen": 9060396176,
      "step": 11516
    },
    {
      "epoch": 1.2218332272437937,
      "grad_norm": 0.48664852058292773,
      "learning_rate": 4.8751637751556915e-05,
      "loss": 1.7623,
      "num_input_tokens_seen": 9061182944,
      "step": 11517
    },
    {
      "epoch": 1.2219393167833652,
      "grad_norm": 0.4184742725487279,
      "learning_rate": 4.875142087699834e-05,
      "loss": 1.755,
      "num_input_tokens_seen": 9061969680,
      "step": 11518
    },
    {
      "epoch": 1.2220454063229367,
      "grad_norm": 0.5058962331634133,
      "learning_rate": 4.875120398408536e-05,
      "loss": 1.7909,
      "num_input_tokens_seen": 9062756496,
      "step": 11519
    },
    {
      "epoch": 1.222151495862508,
      "grad_norm": 0.46904499212719264,
      "learning_rate": 4.875098707281815e-05,
      "loss": 1.7152,
      "num_input_tokens_seen": 9063543344,
      "step": 11520
    },
    {
      "epoch": 1.2222575854020794,
      "grad_norm": 0.40304087738976657,
      "learning_rate": 4.875077014319687e-05,
      "loss": 1.8976,
      "num_input_tokens_seen": 9064330096,
      "step": 11521
    },
    {
      "epoch": 1.2223636749416507,
      "grad_norm": 0.48101431175045817,
      "learning_rate": 4.875055319522169e-05,
      "loss": 1.7677,
      "num_input_tokens_seen": 9065116848,
      "step": 11522
    },
    {
      "epoch": 1.2224697644812221,
      "grad_norm": 0.40079785334521406,
      "learning_rate": 4.875033622889278e-05,
      "loss": 1.9314,
      "num_input_tokens_seen": 9065903632,
      "step": 11523
    },
    {
      "epoch": 1.2225758540207936,
      "grad_norm": 0.3955397102965834,
      "learning_rate": 4.875011924421031e-05,
      "loss": 1.8145,
      "num_input_tokens_seen": 9066690368,
      "step": 11524
    },
    {
      "epoch": 1.2226819435603649,
      "grad_norm": 0.42902185103395113,
      "learning_rate": 4.874990224117445e-05,
      "loss": 1.8914,
      "num_input_tokens_seen": 9067477168,
      "step": 11525
    },
    {
      "epoch": 1.2227880330999363,
      "grad_norm": 0.38306039022821325,
      "learning_rate": 4.8749685219785355e-05,
      "loss": 1.7214,
      "num_input_tokens_seen": 9068264048,
      "step": 11526
    },
    {
      "epoch": 1.2228941226395078,
      "grad_norm": 0.388486686440255,
      "learning_rate": 4.87494681800432e-05,
      "loss": 1.8041,
      "num_input_tokens_seen": 9069050816,
      "step": 11527
    },
    {
      "epoch": 1.223000212179079,
      "grad_norm": 0.3517512677344197,
      "learning_rate": 4.874925112194816e-05,
      "loss": 1.6799,
      "num_input_tokens_seen": 9069837696,
      "step": 11528
    },
    {
      "epoch": 1.2231063017186505,
      "grad_norm": 0.4072426539435536,
      "learning_rate": 4.874903404550039e-05,
      "loss": 1.6532,
      "num_input_tokens_seen": 9070624480,
      "step": 11529
    },
    {
      "epoch": 1.223212391258222,
      "grad_norm": 0.5800595740942047,
      "learning_rate": 4.874881695070006e-05,
      "loss": 1.7337,
      "num_input_tokens_seen": 9071411200,
      "step": 11530
    },
    {
      "epoch": 1.2233184807977933,
      "grad_norm": 0.37052293867785413,
      "learning_rate": 4.874859983754735e-05,
      "loss": 1.7564,
      "num_input_tokens_seen": 9072198048,
      "step": 11531
    },
    {
      "epoch": 1.2234245703373647,
      "grad_norm": 0.47996292770360904,
      "learning_rate": 4.8748382706042416e-05,
      "loss": 1.8486,
      "num_input_tokens_seen": 9072984768,
      "step": 11532
    },
    {
      "epoch": 1.2235306598769362,
      "grad_norm": 0.34489998362981744,
      "learning_rate": 4.874816555618542e-05,
      "loss": 1.6922,
      "num_input_tokens_seen": 9073771600,
      "step": 11533
    },
    {
      "epoch": 1.2236367494165075,
      "grad_norm": 0.3498446464911581,
      "learning_rate": 4.874794838797655e-05,
      "loss": 1.8792,
      "num_input_tokens_seen": 9074558400,
      "step": 11534
    },
    {
      "epoch": 1.223742838956079,
      "grad_norm": 0.4653988798286657,
      "learning_rate": 4.874773120141596e-05,
      "loss": 1.799,
      "num_input_tokens_seen": 9075345152,
      "step": 11535
    },
    {
      "epoch": 1.2238489284956504,
      "grad_norm": 0.38101339815711105,
      "learning_rate": 4.874751399650381e-05,
      "loss": 1.7437,
      "num_input_tokens_seen": 9076131888,
      "step": 11536
    },
    {
      "epoch": 1.2239550180352217,
      "grad_norm": 0.40936497662390187,
      "learning_rate": 4.874729677324029e-05,
      "loss": 1.737,
      "num_input_tokens_seen": 9076918656,
      "step": 11537
    },
    {
      "epoch": 1.2240611075747931,
      "grad_norm": 0.39644937334914465,
      "learning_rate": 4.874707953162555e-05,
      "loss": 1.8223,
      "num_input_tokens_seen": 9077705488,
      "step": 11538
    },
    {
      "epoch": 1.2241671971143646,
      "grad_norm": 0.36539646420659067,
      "learning_rate": 4.8746862271659765e-05,
      "loss": 1.8475,
      "num_input_tokens_seen": 9078492288,
      "step": 11539
    },
    {
      "epoch": 1.2242732866539359,
      "grad_norm": 0.42333448053719563,
      "learning_rate": 4.87466449933431e-05,
      "loss": 1.823,
      "num_input_tokens_seen": 9079279088,
      "step": 11540
    },
    {
      "epoch": 1.2243793761935073,
      "grad_norm": 0.34714042360492536,
      "learning_rate": 4.874642769667572e-05,
      "loss": 1.8073,
      "num_input_tokens_seen": 9080065840,
      "step": 11541
    },
    {
      "epoch": 1.2244854657330788,
      "grad_norm": 0.4125018345404327,
      "learning_rate": 4.874621038165781e-05,
      "loss": 1.8715,
      "num_input_tokens_seen": 9080852576,
      "step": 11542
    },
    {
      "epoch": 1.22459155527265,
      "grad_norm": 0.36498702310223585,
      "learning_rate": 4.8745993048289516e-05,
      "loss": 1.8225,
      "num_input_tokens_seen": 9081639328,
      "step": 11543
    },
    {
      "epoch": 1.2246976448122215,
      "grad_norm": 0.44347859391516614,
      "learning_rate": 4.8745775696571024e-05,
      "loss": 1.7712,
      "num_input_tokens_seen": 9082426096,
      "step": 11544
    },
    {
      "epoch": 1.2248037343517928,
      "grad_norm": 0.33752165128061196,
      "learning_rate": 4.8745558326502485e-05,
      "loss": 1.7605,
      "num_input_tokens_seen": 9083212800,
      "step": 11545
    },
    {
      "epoch": 1.2249098238913643,
      "grad_norm": 0.3914992498442424,
      "learning_rate": 4.8745340938084075e-05,
      "loss": 1.8589,
      "num_input_tokens_seen": 9083999504,
      "step": 11546
    },
    {
      "epoch": 1.2250159134309357,
      "grad_norm": 0.41242956576048834,
      "learning_rate": 4.874512353131597e-05,
      "loss": 1.758,
      "num_input_tokens_seen": 9084786336,
      "step": 11547
    },
    {
      "epoch": 1.2251220029705072,
      "grad_norm": 0.40458191627596485,
      "learning_rate": 4.874490610619832e-05,
      "loss": 1.8797,
      "num_input_tokens_seen": 9085573120,
      "step": 11548
    },
    {
      "epoch": 1.2252280925100785,
      "grad_norm": 0.6906375167414525,
      "learning_rate": 4.8744688662731305e-05,
      "loss": 1.7941,
      "num_input_tokens_seen": 9086359872,
      "step": 11549
    },
    {
      "epoch": 1.22533418204965,
      "grad_norm": 0.44325603342562164,
      "learning_rate": 4.87444712009151e-05,
      "loss": 1.8142,
      "num_input_tokens_seen": 9087146672,
      "step": 11550
    },
    {
      "epoch": 1.2254402715892212,
      "grad_norm": 0.5198148309116009,
      "learning_rate": 4.874425372074986e-05,
      "loss": 1.7322,
      "num_input_tokens_seen": 9087933424,
      "step": 11551
    },
    {
      "epoch": 1.2255463611287927,
      "grad_norm": 0.4204448767174933,
      "learning_rate": 4.8744036222235755e-05,
      "loss": 1.854,
      "num_input_tokens_seen": 9088720192,
      "step": 11552
    },
    {
      "epoch": 1.2256524506683641,
      "grad_norm": 0.5925071759014947,
      "learning_rate": 4.8743818705372957e-05,
      "loss": 1.748,
      "num_input_tokens_seen": 9089506896,
      "step": 11553
    },
    {
      "epoch": 1.2257585402079356,
      "grad_norm": 0.36484230524268585,
      "learning_rate": 4.8743601170161636e-05,
      "loss": 1.8606,
      "num_input_tokens_seen": 9090293760,
      "step": 11554
    },
    {
      "epoch": 1.2258646297475069,
      "grad_norm": 0.42066667936109786,
      "learning_rate": 4.874338361660195e-05,
      "loss": 1.8006,
      "num_input_tokens_seen": 9091080512,
      "step": 11555
    },
    {
      "epoch": 1.2259707192870783,
      "grad_norm": 0.5864315451862154,
      "learning_rate": 4.874316604469408e-05,
      "loss": 1.8099,
      "num_input_tokens_seen": 9091867280,
      "step": 11556
    },
    {
      "epoch": 1.2260768088266496,
      "grad_norm": 0.3961925022535579,
      "learning_rate": 4.8742948454438186e-05,
      "loss": 1.8064,
      "num_input_tokens_seen": 9092654112,
      "step": 11557
    },
    {
      "epoch": 1.226182898366221,
      "grad_norm": 0.5517902651102796,
      "learning_rate": 4.874273084583444e-05,
      "loss": 1.6841,
      "num_input_tokens_seen": 9093440864,
      "step": 11558
    },
    {
      "epoch": 1.2262889879057925,
      "grad_norm": 0.40920913995248265,
      "learning_rate": 4.8742513218883e-05,
      "loss": 1.8306,
      "num_input_tokens_seen": 9094227584,
      "step": 11559
    },
    {
      "epoch": 1.2263950774453638,
      "grad_norm": 0.5995967835492519,
      "learning_rate": 4.874229557358405e-05,
      "loss": 1.6575,
      "num_input_tokens_seen": 9095014320,
      "step": 11560
    },
    {
      "epoch": 1.2265011669849353,
      "grad_norm": 0.5065986260553207,
      "learning_rate": 4.8742077909937747e-05,
      "loss": 1.7999,
      "num_input_tokens_seen": 9095800976,
      "step": 11561
    },
    {
      "epoch": 1.2266072565245068,
      "grad_norm": 0.7454033473727251,
      "learning_rate": 4.874186022794426e-05,
      "loss": 1.701,
      "num_input_tokens_seen": 9096587808,
      "step": 11562
    },
    {
      "epoch": 1.226713346064078,
      "grad_norm": 0.4895359508371299,
      "learning_rate": 4.874164252760377e-05,
      "loss": 1.9076,
      "num_input_tokens_seen": 9097374576,
      "step": 11563
    },
    {
      "epoch": 1.2268194356036495,
      "grad_norm": 0.722207147875595,
      "learning_rate": 4.8741424808916424e-05,
      "loss": 1.7521,
      "num_input_tokens_seen": 9098161392,
      "step": 11564
    },
    {
      "epoch": 1.226925525143221,
      "grad_norm": 0.3699966751669159,
      "learning_rate": 4.8741207071882414e-05,
      "loss": 1.7624,
      "num_input_tokens_seen": 9098948160,
      "step": 11565
    },
    {
      "epoch": 1.2270316146827922,
      "grad_norm": 0.9025108589591696,
      "learning_rate": 4.874098931650189e-05,
      "loss": 1.8625,
      "num_input_tokens_seen": 9099734896,
      "step": 11566
    },
    {
      "epoch": 1.2271377042223637,
      "grad_norm": 0.7046710604067852,
      "learning_rate": 4.874077154277502e-05,
      "loss": 1.8085,
      "num_input_tokens_seen": 9100521648,
      "step": 11567
    },
    {
      "epoch": 1.2272437937619352,
      "grad_norm": 0.7794201779819734,
      "learning_rate": 4.874055375070198e-05,
      "loss": 1.663,
      "num_input_tokens_seen": 9101308544,
      "step": 11568
    },
    {
      "epoch": 1.2273498833015064,
      "grad_norm": 0.5874281238364408,
      "learning_rate": 4.874033594028295e-05,
      "loss": 1.9242,
      "num_input_tokens_seen": 9102095280,
      "step": 11569
    },
    {
      "epoch": 1.2274559728410779,
      "grad_norm": 0.9958503668309899,
      "learning_rate": 4.8740118111518075e-05,
      "loss": 1.7428,
      "num_input_tokens_seen": 9102882144,
      "step": 11570
    },
    {
      "epoch": 1.2275620623806494,
      "grad_norm": 0.507293589320889,
      "learning_rate": 4.8739900264407525e-05,
      "loss": 1.7218,
      "num_input_tokens_seen": 9103668896,
      "step": 11571
    },
    {
      "epoch": 1.2276681519202206,
      "grad_norm": 1.266031109914602,
      "learning_rate": 4.873968239895149e-05,
      "loss": 1.8312,
      "num_input_tokens_seen": 9104455664,
      "step": 11572
    },
    {
      "epoch": 1.227774241459792,
      "grad_norm": 0.6931957580751811,
      "learning_rate": 4.8739464515150115e-05,
      "loss": 1.7772,
      "num_input_tokens_seen": 9105242480,
      "step": 11573
    },
    {
      "epoch": 1.2278803309993636,
      "grad_norm": 1.0152165441959196,
      "learning_rate": 4.873924661300359e-05,
      "loss": 1.7597,
      "num_input_tokens_seen": 9106029168,
      "step": 11574
    },
    {
      "epoch": 1.2279864205389348,
      "grad_norm": 1.1287318447385806,
      "learning_rate": 4.873902869251206e-05,
      "loss": 1.7754,
      "num_input_tokens_seen": 9106815840,
      "step": 11575
    },
    {
      "epoch": 1.2280925100785063,
      "grad_norm": 0.5904111097390844,
      "learning_rate": 4.873881075367571e-05,
      "loss": 1.8113,
      "num_input_tokens_seen": 9107602672,
      "step": 11576
    },
    {
      "epoch": 1.2281985996180778,
      "grad_norm": 1.2972682401310027,
      "learning_rate": 4.8738592796494705e-05,
      "loss": 1.8883,
      "num_input_tokens_seen": 9108389424,
      "step": 11577
    },
    {
      "epoch": 1.228304689157649,
      "grad_norm": 0.5979823851299133,
      "learning_rate": 4.873837482096921e-05,
      "loss": 1.8922,
      "num_input_tokens_seen": 9109176128,
      "step": 11578
    },
    {
      "epoch": 1.2284107786972205,
      "grad_norm": 1.056057543206394,
      "learning_rate": 4.87381568270994e-05,
      "loss": 1.7413,
      "num_input_tokens_seen": 9109962960,
      "step": 11579
    },
    {
      "epoch": 1.2285168682367917,
      "grad_norm": 0.743239777680125,
      "learning_rate": 4.873793881488543e-05,
      "loss": 1.8726,
      "num_input_tokens_seen": 9110749760,
      "step": 11580
    },
    {
      "epoch": 1.2286229577763632,
      "grad_norm": 0.6239527336668766,
      "learning_rate": 4.873772078432749e-05,
      "loss": 1.8269,
      "num_input_tokens_seen": 9111536512,
      "step": 11581
    },
    {
      "epoch": 1.2287290473159347,
      "grad_norm": 0.5151502407462708,
      "learning_rate": 4.873750273542572e-05,
      "loss": 1.6299,
      "num_input_tokens_seen": 9112323296,
      "step": 11582
    },
    {
      "epoch": 1.2288351368555062,
      "grad_norm": 0.6144264235078555,
      "learning_rate": 4.8737284668180315e-05,
      "loss": 1.8121,
      "num_input_tokens_seen": 9113110176,
      "step": 11583
    },
    {
      "epoch": 1.2289412263950774,
      "grad_norm": 0.4334629287010214,
      "learning_rate": 4.8737066582591435e-05,
      "loss": 1.7026,
      "num_input_tokens_seen": 9113897040,
      "step": 11584
    },
    {
      "epoch": 1.2290473159346489,
      "grad_norm": 0.8012371320566746,
      "learning_rate": 4.873684847865924e-05,
      "loss": 1.7983,
      "num_input_tokens_seen": 9114683888,
      "step": 11585
    },
    {
      "epoch": 1.2291534054742201,
      "grad_norm": 0.5060849464544818,
      "learning_rate": 4.873663035638391e-05,
      "loss": 1.9438,
      "num_input_tokens_seen": 9115470544,
      "step": 11586
    },
    {
      "epoch": 1.2292594950137916,
      "grad_norm": 0.646078498067208,
      "learning_rate": 4.8736412215765607e-05,
      "loss": 1.8692,
      "num_input_tokens_seen": 9116257216,
      "step": 11587
    },
    {
      "epoch": 1.229365584553363,
      "grad_norm": 0.6350291232538724,
      "learning_rate": 4.8736194056804496e-05,
      "loss": 1.756,
      "num_input_tokens_seen": 9117043952,
      "step": 11588
    },
    {
      "epoch": 1.2294716740929343,
      "grad_norm": 0.5696795290957863,
      "learning_rate": 4.873597587950076e-05,
      "loss": 1.8602,
      "num_input_tokens_seen": 9117830688,
      "step": 11589
    },
    {
      "epoch": 1.2295777636325058,
      "grad_norm": 0.6688004273817265,
      "learning_rate": 4.873575768385455e-05,
      "loss": 1.9163,
      "num_input_tokens_seen": 9118617392,
      "step": 11590
    },
    {
      "epoch": 1.2296838531720773,
      "grad_norm": 0.5109641316027921,
      "learning_rate": 4.873553946986604e-05,
      "loss": 1.9569,
      "num_input_tokens_seen": 9119404144,
      "step": 11591
    },
    {
      "epoch": 1.2297899427116485,
      "grad_norm": 0.5703824161047886,
      "learning_rate": 4.873532123753541e-05,
      "loss": 1.6771,
      "num_input_tokens_seen": 9120190944,
      "step": 11592
    },
    {
      "epoch": 1.22989603225122,
      "grad_norm": 0.5133945374230352,
      "learning_rate": 4.873510298686282e-05,
      "loss": 1.778,
      "num_input_tokens_seen": 9120977632,
      "step": 11593
    },
    {
      "epoch": 1.2300021217907915,
      "grad_norm": 0.44082044506723933,
      "learning_rate": 4.873488471784843e-05,
      "loss": 1.7632,
      "num_input_tokens_seen": 9121764368,
      "step": 11594
    },
    {
      "epoch": 1.2301082113303627,
      "grad_norm": 0.506206284630619,
      "learning_rate": 4.873466643049243e-05,
      "loss": 1.8931,
      "num_input_tokens_seen": 9122551136,
      "step": 11595
    },
    {
      "epoch": 1.2302143008699342,
      "grad_norm": 0.5501160342396165,
      "learning_rate": 4.873444812479497e-05,
      "loss": 1.8185,
      "num_input_tokens_seen": 9123337952,
      "step": 11596
    },
    {
      "epoch": 1.2303203904095057,
      "grad_norm": 0.521702043451301,
      "learning_rate": 4.873422980075623e-05,
      "loss": 1.8617,
      "num_input_tokens_seen": 9124124752,
      "step": 11597
    },
    {
      "epoch": 1.230426479949077,
      "grad_norm": 0.5061555573142401,
      "learning_rate": 4.873401145837636e-05,
      "loss": 1.8618,
      "num_input_tokens_seen": 9124911504,
      "step": 11598
    },
    {
      "epoch": 1.2305325694886484,
      "grad_norm": 0.7047485648636052,
      "learning_rate": 4.873379309765556e-05,
      "loss": 1.8436,
      "num_input_tokens_seen": 9125698240,
      "step": 11599
    },
    {
      "epoch": 1.23063865902822,
      "grad_norm": 0.43080637739563155,
      "learning_rate": 4.8733574718593966e-05,
      "loss": 1.7779,
      "num_input_tokens_seen": 9126485024,
      "step": 11600
    },
    {
      "epoch": 1.2307447485677911,
      "grad_norm": 0.46939004235326437,
      "learning_rate": 4.873335632119177e-05,
      "loss": 1.7823,
      "num_input_tokens_seen": 9127271808,
      "step": 11601
    },
    {
      "epoch": 1.2308508381073626,
      "grad_norm": 0.41315361624830543,
      "learning_rate": 4.873313790544913e-05,
      "loss": 1.7865,
      "num_input_tokens_seen": 9128058528,
      "step": 11602
    },
    {
      "epoch": 1.230956927646934,
      "grad_norm": 0.46260371952452106,
      "learning_rate": 4.873291947136621e-05,
      "loss": 1.9986,
      "num_input_tokens_seen": 9128845264,
      "step": 11603
    },
    {
      "epoch": 1.2310630171865053,
      "grad_norm": 0.45324343102332587,
      "learning_rate": 4.87327010189432e-05,
      "loss": 1.7668,
      "num_input_tokens_seen": 9129632000,
      "step": 11604
    },
    {
      "epoch": 1.2311691067260768,
      "grad_norm": 0.4257351896898671,
      "learning_rate": 4.873248254818025e-05,
      "loss": 1.7931,
      "num_input_tokens_seen": 9130418768,
      "step": 11605
    },
    {
      "epoch": 1.2312751962656483,
      "grad_norm": 0.5346091602285831,
      "learning_rate": 4.873226405907753e-05,
      "loss": 1.8061,
      "num_input_tokens_seen": 9131205520,
      "step": 11606
    },
    {
      "epoch": 1.2313812858052195,
      "grad_norm": 0.513956229364888,
      "learning_rate": 4.873204555163522e-05,
      "loss": 1.7325,
      "num_input_tokens_seen": 9131992272,
      "step": 11607
    },
    {
      "epoch": 1.231487375344791,
      "grad_norm": 0.3907256887971512,
      "learning_rate": 4.873182702585347e-05,
      "loss": 1.8239,
      "num_input_tokens_seen": 9132779056,
      "step": 11608
    },
    {
      "epoch": 1.2315934648843625,
      "grad_norm": 0.42578088215493815,
      "learning_rate": 4.8731608481732473e-05,
      "loss": 1.8413,
      "num_input_tokens_seen": 9133565776,
      "step": 11609
    },
    {
      "epoch": 1.2316995544239338,
      "grad_norm": 0.39426027309028183,
      "learning_rate": 4.873138991927238e-05,
      "loss": 1.8101,
      "num_input_tokens_seen": 9134352656,
      "step": 11610
    },
    {
      "epoch": 1.2318056439635052,
      "grad_norm": 0.4012004223738718,
      "learning_rate": 4.873117133847336e-05,
      "loss": 1.7506,
      "num_input_tokens_seen": 9135139360,
      "step": 11611
    },
    {
      "epoch": 1.2319117335030767,
      "grad_norm": 0.43911158732641603,
      "learning_rate": 4.87309527393356e-05,
      "loss": 1.914,
      "num_input_tokens_seen": 9135926128,
      "step": 11612
    },
    {
      "epoch": 1.232017823042648,
      "grad_norm": 0.45317483664983615,
      "learning_rate": 4.8730734121859246e-05,
      "loss": 1.6835,
      "num_input_tokens_seen": 9136712912,
      "step": 11613
    },
    {
      "epoch": 1.2321239125822194,
      "grad_norm": 0.39782496632317205,
      "learning_rate": 4.8730515486044485e-05,
      "loss": 1.83,
      "num_input_tokens_seen": 9137499648,
      "step": 11614
    },
    {
      "epoch": 1.2322300021217907,
      "grad_norm": 0.45357015437979026,
      "learning_rate": 4.873029683189147e-05,
      "loss": 1.9154,
      "num_input_tokens_seen": 9138286352,
      "step": 11615
    },
    {
      "epoch": 1.2323360916613622,
      "grad_norm": 0.376294224445596,
      "learning_rate": 4.8730078159400375e-05,
      "loss": 1.717,
      "num_input_tokens_seen": 9139073024,
      "step": 11616
    },
    {
      "epoch": 1.2324421812009336,
      "grad_norm": 0.36252219166385263,
      "learning_rate": 4.872985946857137e-05,
      "loss": 1.8843,
      "num_input_tokens_seen": 9139859664,
      "step": 11617
    },
    {
      "epoch": 1.232548270740505,
      "grad_norm": 0.36862069468611935,
      "learning_rate": 4.8729640759404636e-05,
      "loss": 1.7318,
      "num_input_tokens_seen": 9140646416,
      "step": 11618
    },
    {
      "epoch": 1.2326543602800764,
      "grad_norm": 0.36563944476559324,
      "learning_rate": 4.8729422031900326e-05,
      "loss": 1.6343,
      "num_input_tokens_seen": 9141433104,
      "step": 11619
    },
    {
      "epoch": 1.2327604498196478,
      "grad_norm": 0.5093955851547736,
      "learning_rate": 4.872920328605862e-05,
      "loss": 1.9152,
      "num_input_tokens_seen": 9142219888,
      "step": 11620
    },
    {
      "epoch": 1.232866539359219,
      "grad_norm": 0.47718542075062376,
      "learning_rate": 4.872898452187968e-05,
      "loss": 1.9638,
      "num_input_tokens_seen": 9143006576,
      "step": 11621
    },
    {
      "epoch": 1.2329726288987906,
      "grad_norm": 0.4193607999307755,
      "learning_rate": 4.872876573936368e-05,
      "loss": 1.8835,
      "num_input_tokens_seen": 9143793280,
      "step": 11622
    },
    {
      "epoch": 1.233078718438362,
      "grad_norm": 0.5648564936126086,
      "learning_rate": 4.872854693851078e-05,
      "loss": 1.8669,
      "num_input_tokens_seen": 9144580096,
      "step": 11623
    },
    {
      "epoch": 1.2331848079779333,
      "grad_norm": 0.4312145603916902,
      "learning_rate": 4.872832811932116e-05,
      "loss": 1.8963,
      "num_input_tokens_seen": 9145366944,
      "step": 11624
    },
    {
      "epoch": 1.2332908975175048,
      "grad_norm": 0.5330386174308042,
      "learning_rate": 4.872810928179498e-05,
      "loss": 1.8983,
      "num_input_tokens_seen": 9146153744,
      "step": 11625
    },
    {
      "epoch": 1.2333969870570762,
      "grad_norm": 0.4488296922548267,
      "learning_rate": 4.872789042593241e-05,
      "loss": 1.9983,
      "num_input_tokens_seen": 9146940448,
      "step": 11626
    },
    {
      "epoch": 1.2335030765966475,
      "grad_norm": 0.6235669940412559,
      "learning_rate": 4.872767155173363e-05,
      "loss": 1.842,
      "num_input_tokens_seen": 9147727264,
      "step": 11627
    },
    {
      "epoch": 1.233609166136219,
      "grad_norm": 0.3775858522521467,
      "learning_rate": 4.87274526591988e-05,
      "loss": 1.8495,
      "num_input_tokens_seen": 9148514016,
      "step": 11628
    },
    {
      "epoch": 1.2337152556757904,
      "grad_norm": 0.4100706834270432,
      "learning_rate": 4.8727233748328096e-05,
      "loss": 1.9261,
      "num_input_tokens_seen": 9149300720,
      "step": 11629
    },
    {
      "epoch": 1.2338213452153617,
      "grad_norm": 0.5190684675474463,
      "learning_rate": 4.8727014819121675e-05,
      "loss": 1.717,
      "num_input_tokens_seen": 9150087456,
      "step": 11630
    },
    {
      "epoch": 1.2339274347549332,
      "grad_norm": 0.49698485436941653,
      "learning_rate": 4.8726795871579713e-05,
      "loss": 1.9089,
      "num_input_tokens_seen": 9150874224,
      "step": 11631
    },
    {
      "epoch": 1.2340335242945046,
      "grad_norm": 0.3690018770205989,
      "learning_rate": 4.872657690570238e-05,
      "loss": 1.9599,
      "num_input_tokens_seen": 9151660944,
      "step": 11632
    },
    {
      "epoch": 1.2341396138340759,
      "grad_norm": 0.4144624214938197,
      "learning_rate": 4.8726357921489844e-05,
      "loss": 1.8059,
      "num_input_tokens_seen": 9152447664,
      "step": 11633
    },
    {
      "epoch": 1.2342457033736474,
      "grad_norm": 0.4023891790871596,
      "learning_rate": 4.8726138918942275e-05,
      "loss": 1.8532,
      "num_input_tokens_seen": 9153234416,
      "step": 11634
    },
    {
      "epoch": 1.2343517929132188,
      "grad_norm": 0.43214212812370933,
      "learning_rate": 4.8725919898059844e-05,
      "loss": 1.8792,
      "num_input_tokens_seen": 9154021072,
      "step": 11635
    },
    {
      "epoch": 1.23445788245279,
      "grad_norm": 0.3708688899219129,
      "learning_rate": 4.872570085884272e-05,
      "loss": 1.7128,
      "num_input_tokens_seen": 9154807856,
      "step": 11636
    },
    {
      "epoch": 1.2345639719923616,
      "grad_norm": 0.36327634456886626,
      "learning_rate": 4.872548180129107e-05,
      "loss": 1.6114,
      "num_input_tokens_seen": 9155594672,
      "step": 11637
    },
    {
      "epoch": 1.234670061531933,
      "grad_norm": 0.44008135110579216,
      "learning_rate": 4.872526272540506e-05,
      "loss": 1.9029,
      "num_input_tokens_seen": 9156381456,
      "step": 11638
    },
    {
      "epoch": 1.2347761510715043,
      "grad_norm": 0.3445297473355701,
      "learning_rate": 4.8725043631184866e-05,
      "loss": 1.7533,
      "num_input_tokens_seen": 9157168160,
      "step": 11639
    },
    {
      "epoch": 1.2348822406110758,
      "grad_norm": 0.3459590582975969,
      "learning_rate": 4.8724824518630654e-05,
      "loss": 1.7996,
      "num_input_tokens_seen": 9157954880,
      "step": 11640
    },
    {
      "epoch": 1.2349883301506472,
      "grad_norm": 0.36911190434483615,
      "learning_rate": 4.87246053877426e-05,
      "loss": 1.7341,
      "num_input_tokens_seen": 9158741712,
      "step": 11641
    },
    {
      "epoch": 1.2350944196902185,
      "grad_norm": 0.3747664214517904,
      "learning_rate": 4.8724386238520845e-05,
      "loss": 1.8389,
      "num_input_tokens_seen": 9159528400,
      "step": 11642
    },
    {
      "epoch": 1.23520050922979,
      "grad_norm": 0.3871332275719039,
      "learning_rate": 4.87241670709656e-05,
      "loss": 1.9073,
      "num_input_tokens_seen": 9160315104,
      "step": 11643
    },
    {
      "epoch": 1.2353065987693612,
      "grad_norm": 0.37228266448150715,
      "learning_rate": 4.872394788507702e-05,
      "loss": 1.679,
      "num_input_tokens_seen": 9161101808,
      "step": 11644
    },
    {
      "epoch": 1.2354126883089327,
      "grad_norm": 0.4168538452120118,
      "learning_rate": 4.872372868085525e-05,
      "loss": 1.7627,
      "num_input_tokens_seen": 9161888576,
      "step": 11645
    },
    {
      "epoch": 1.2355187778485042,
      "grad_norm": 0.38224482686952593,
      "learning_rate": 4.8723509458300485e-05,
      "loss": 1.7608,
      "num_input_tokens_seen": 9162675488,
      "step": 11646
    },
    {
      "epoch": 1.2356248673880756,
      "grad_norm": 0.37486547556556044,
      "learning_rate": 4.87232902174129e-05,
      "loss": 1.8186,
      "num_input_tokens_seen": 9163462240,
      "step": 11647
    },
    {
      "epoch": 1.235730956927647,
      "grad_norm": 0.35897684452497897,
      "learning_rate": 4.872307095819264e-05,
      "loss": 1.7839,
      "num_input_tokens_seen": 9164249024,
      "step": 11648
    },
    {
      "epoch": 1.2358370464672184,
      "grad_norm": 0.4765266312625756,
      "learning_rate": 4.872285168063989e-05,
      "loss": 1.7661,
      "num_input_tokens_seen": 9165035760,
      "step": 11649
    },
    {
      "epoch": 1.2359431360067896,
      "grad_norm": 0.4807832268007427,
      "learning_rate": 4.872263238475482e-05,
      "loss": 1.7832,
      "num_input_tokens_seen": 9165822432,
      "step": 11650
    },
    {
      "epoch": 1.236049225546361,
      "grad_norm": 0.5830550994170142,
      "learning_rate": 4.8722413070537585e-05,
      "loss": 1.795,
      "num_input_tokens_seen": 9166609216,
      "step": 11651
    },
    {
      "epoch": 1.2361553150859326,
      "grad_norm": 0.588400337622754,
      "learning_rate": 4.872219373798838e-05,
      "loss": 1.7943,
      "num_input_tokens_seen": 9167396032,
      "step": 11652
    },
    {
      "epoch": 1.236261404625504,
      "grad_norm": 0.47390761904893547,
      "learning_rate": 4.872197438710735e-05,
      "loss": 1.8468,
      "num_input_tokens_seen": 9168182800,
      "step": 11653
    },
    {
      "epoch": 1.2363674941650753,
      "grad_norm": 0.8508630468111964,
      "learning_rate": 4.872175501789468e-05,
      "loss": 1.7514,
      "num_input_tokens_seen": 9168969568,
      "step": 11654
    },
    {
      "epoch": 1.2364735837046468,
      "grad_norm": 0.7088568752349192,
      "learning_rate": 4.872153563035052e-05,
      "loss": 1.7985,
      "num_input_tokens_seen": 9169756304,
      "step": 11655
    },
    {
      "epoch": 1.236579673244218,
      "grad_norm": 0.5507433091012858,
      "learning_rate": 4.872131622447507e-05,
      "loss": 1.9107,
      "num_input_tokens_seen": 9170543008,
      "step": 11656
    },
    {
      "epoch": 1.2366857627837895,
      "grad_norm": 0.4680621434225422,
      "learning_rate": 4.8721096800268474e-05,
      "loss": 1.8178,
      "num_input_tokens_seen": 9171329840,
      "step": 11657
    },
    {
      "epoch": 1.236791852323361,
      "grad_norm": 0.716758965952756,
      "learning_rate": 4.872087735773091e-05,
      "loss": 1.9409,
      "num_input_tokens_seen": 9172116592,
      "step": 11658
    },
    {
      "epoch": 1.2368979418629322,
      "grad_norm": 0.48682685171121887,
      "learning_rate": 4.872065789686255e-05,
      "loss": 1.8662,
      "num_input_tokens_seen": 9172903392,
      "step": 11659
    },
    {
      "epoch": 1.2370040314025037,
      "grad_norm": 1.303829015612908,
      "learning_rate": 4.872043841766356e-05,
      "loss": 1.8612,
      "num_input_tokens_seen": 9173690128,
      "step": 11660
    },
    {
      "epoch": 1.2371101209420752,
      "grad_norm": 1.6210499127501148,
      "learning_rate": 4.872021892013412e-05,
      "loss": 1.7059,
      "num_input_tokens_seen": 9174476800,
      "step": 11661
    },
    {
      "epoch": 1.2372162104816464,
      "grad_norm": 0.6029085537838823,
      "learning_rate": 4.8719999404274384e-05,
      "loss": 1.7647,
      "num_input_tokens_seen": 9175263536,
      "step": 11662
    },
    {
      "epoch": 1.237322300021218,
      "grad_norm": 2.3526961377427784,
      "learning_rate": 4.8719779870084525e-05,
      "loss": 1.8073,
      "num_input_tokens_seen": 9176050304,
      "step": 11663
    },
    {
      "epoch": 1.2374283895607894,
      "grad_norm": 0.5372777705556152,
      "learning_rate": 4.8719560317564725e-05,
      "loss": 1.7625,
      "num_input_tokens_seen": 9176837056,
      "step": 11664
    },
    {
      "epoch": 1.2375344791003606,
      "grad_norm": 0.702490613362855,
      "learning_rate": 4.871934074671514e-05,
      "loss": 1.7644,
      "num_input_tokens_seen": 9177623872,
      "step": 11665
    },
    {
      "epoch": 1.237640568639932,
      "grad_norm": 0.8971037032931657,
      "learning_rate": 4.871912115753594e-05,
      "loss": 1.8265,
      "num_input_tokens_seen": 9178410608,
      "step": 11666
    },
    {
      "epoch": 1.2377466581795036,
      "grad_norm": 1.0186232122306123,
      "learning_rate": 4.871890155002731e-05,
      "loss": 1.8294,
      "num_input_tokens_seen": 9179197440,
      "step": 11667
    },
    {
      "epoch": 1.2378527477190748,
      "grad_norm": 1.2207283662110087,
      "learning_rate": 4.8718681924189395e-05,
      "loss": 1.8776,
      "num_input_tokens_seen": 9179984128,
      "step": 11668
    },
    {
      "epoch": 1.2379588372586463,
      "grad_norm": 0.43970668321075357,
      "learning_rate": 4.8718462280022384e-05,
      "loss": 1.6836,
      "num_input_tokens_seen": 9180770960,
      "step": 11669
    },
    {
      "epoch": 1.2380649267982178,
      "grad_norm": 0.5931010049080816,
      "learning_rate": 4.871824261752644e-05,
      "loss": 1.8004,
      "num_input_tokens_seen": 9181557744,
      "step": 11670
    },
    {
      "epoch": 1.238171016337789,
      "grad_norm": 0.6483993116592982,
      "learning_rate": 4.871802293670175e-05,
      "loss": 1.5845,
      "num_input_tokens_seen": 9182344496,
      "step": 11671
    },
    {
      "epoch": 1.2382771058773605,
      "grad_norm": 0.5595558597196277,
      "learning_rate": 4.871780323754845e-05,
      "loss": 1.7243,
      "num_input_tokens_seen": 9183131344,
      "step": 11672
    },
    {
      "epoch": 1.238383195416932,
      "grad_norm": 0.5858619172557673,
      "learning_rate": 4.871758352006673e-05,
      "loss": 1.8962,
      "num_input_tokens_seen": 9183918112,
      "step": 11673
    },
    {
      "epoch": 1.2384892849565032,
      "grad_norm": 1.0080719652511119,
      "learning_rate": 4.871736378425676e-05,
      "loss": 1.9597,
      "num_input_tokens_seen": 9184704848,
      "step": 11674
    },
    {
      "epoch": 1.2385953744960747,
      "grad_norm": 0.6399842966401115,
      "learning_rate": 4.8717144030118705e-05,
      "loss": 1.8371,
      "num_input_tokens_seen": 9185491536,
      "step": 11675
    },
    {
      "epoch": 1.2387014640356462,
      "grad_norm": 1.43263964210925,
      "learning_rate": 4.871692425765274e-05,
      "loss": 1.8571,
      "num_input_tokens_seen": 9186278352,
      "step": 11676
    },
    {
      "epoch": 1.2388075535752174,
      "grad_norm": 0.6036236636174348,
      "learning_rate": 4.871670446685903e-05,
      "loss": 1.7997,
      "num_input_tokens_seen": 9187065168,
      "step": 11677
    },
    {
      "epoch": 1.238913643114789,
      "grad_norm": 1.5842901935474074,
      "learning_rate": 4.871648465773775e-05,
      "loss": 1.7479,
      "num_input_tokens_seen": 9187851952,
      "step": 11678
    },
    {
      "epoch": 1.2390197326543602,
      "grad_norm": 0.7471159689027078,
      "learning_rate": 4.871626483028906e-05,
      "loss": 1.7985,
      "num_input_tokens_seen": 9188638736,
      "step": 11679
    },
    {
      "epoch": 1.2391258221939316,
      "grad_norm": 0.46541371919811125,
      "learning_rate": 4.871604498451314e-05,
      "loss": 1.804,
      "num_input_tokens_seen": 9189425552,
      "step": 11680
    },
    {
      "epoch": 1.239231911733503,
      "grad_norm": 1.324275486523419,
      "learning_rate": 4.8715825120410166e-05,
      "loss": 1.7937,
      "num_input_tokens_seen": 9190212304,
      "step": 11681
    },
    {
      "epoch": 1.2393380012730746,
      "grad_norm": 0.6787282136931619,
      "learning_rate": 4.871560523798028e-05,
      "loss": 1.8586,
      "num_input_tokens_seen": 9190999056,
      "step": 11682
    },
    {
      "epoch": 1.2394440908126458,
      "grad_norm": 0.6413134316576454,
      "learning_rate": 4.871538533722369e-05,
      "loss": 1.7651,
      "num_input_tokens_seen": 9191785872,
      "step": 11683
    },
    {
      "epoch": 1.2395501803522173,
      "grad_norm": 0.6663827743693651,
      "learning_rate": 4.8715165418140527e-05,
      "loss": 1.7977,
      "num_input_tokens_seen": 9192572624,
      "step": 11684
    },
    {
      "epoch": 1.2396562698917886,
      "grad_norm": 0.6126101962956463,
      "learning_rate": 4.871494548073099e-05,
      "loss": 1.7794,
      "num_input_tokens_seen": 9193359456,
      "step": 11685
    },
    {
      "epoch": 1.23976235943136,
      "grad_norm": 0.7068312395847137,
      "learning_rate": 4.8714725524995234e-05,
      "loss": 1.8301,
      "num_input_tokens_seen": 9194146192,
      "step": 11686
    },
    {
      "epoch": 1.2398684489709315,
      "grad_norm": 0.8813439489931861,
      "learning_rate": 4.8714505550933434e-05,
      "loss": 1.8151,
      "num_input_tokens_seen": 9194933056,
      "step": 11687
    },
    {
      "epoch": 1.239974538510503,
      "grad_norm": 0.5052863688539567,
      "learning_rate": 4.871428555854577e-05,
      "loss": 1.621,
      "num_input_tokens_seen": 9195719840,
      "step": 11688
    },
    {
      "epoch": 1.2400806280500742,
      "grad_norm": 0.9079352973231781,
      "learning_rate": 4.871406554783239e-05,
      "loss": 1.6994,
      "num_input_tokens_seen": 9196506608,
      "step": 11689
    },
    {
      "epoch": 1.2401867175896457,
      "grad_norm": 0.8375224755940144,
      "learning_rate": 4.871384551879348e-05,
      "loss": 1.6367,
      "num_input_tokens_seen": 9197293392,
      "step": 11690
    },
    {
      "epoch": 1.240292807129217,
      "grad_norm": 0.9858840230916864,
      "learning_rate": 4.8713625471429206e-05,
      "loss": 1.9046,
      "num_input_tokens_seen": 9198080096,
      "step": 11691
    },
    {
      "epoch": 1.2403988966687884,
      "grad_norm": 0.8359950835329072,
      "learning_rate": 4.871340540573974e-05,
      "loss": 1.799,
      "num_input_tokens_seen": 9198866864,
      "step": 11692
    },
    {
      "epoch": 1.24050498620836,
      "grad_norm": 0.9123080101065124,
      "learning_rate": 4.871318532172525e-05,
      "loss": 1.6936,
      "num_input_tokens_seen": 9199653728,
      "step": 11693
    },
    {
      "epoch": 1.2406110757479312,
      "grad_norm": 0.5446731508833835,
      "learning_rate": 4.871296521938591e-05,
      "loss": 1.8507,
      "num_input_tokens_seen": 9200440560,
      "step": 11694
    },
    {
      "epoch": 1.2407171652875026,
      "grad_norm": 0.7780601797916478,
      "learning_rate": 4.871274509872188e-05,
      "loss": 1.8855,
      "num_input_tokens_seen": 9201227312,
      "step": 11695
    },
    {
      "epoch": 1.2408232548270741,
      "grad_norm": 0.88837958630557,
      "learning_rate": 4.8712524959733334e-05,
      "loss": 1.7615,
      "num_input_tokens_seen": 9202014000,
      "step": 11696
    },
    {
      "epoch": 1.2409293443666454,
      "grad_norm": 0.392533628039795,
      "learning_rate": 4.871230480242045e-05,
      "loss": 1.6691,
      "num_input_tokens_seen": 9202800912,
      "step": 11697
    },
    {
      "epoch": 1.2410354339062168,
      "grad_norm": 0.5972962482624438,
      "learning_rate": 4.871208462678339e-05,
      "loss": 1.7302,
      "num_input_tokens_seen": 9203587584,
      "step": 11698
    },
    {
      "epoch": 1.2411415234457883,
      "grad_norm": 0.6706909046116463,
      "learning_rate": 4.871186443282233e-05,
      "loss": 1.7584,
      "num_input_tokens_seen": 9204374304,
      "step": 11699
    },
    {
      "epoch": 1.2412476129853596,
      "grad_norm": 0.6306504898525837,
      "learning_rate": 4.871164422053743e-05,
      "loss": 1.8357,
      "num_input_tokens_seen": 9205161104,
      "step": 11700
    },
    {
      "epoch": 1.241353702524931,
      "grad_norm": 0.6836278597208675,
      "learning_rate": 4.8711423989928875e-05,
      "loss": 1.8377,
      "num_input_tokens_seen": 9205947824,
      "step": 11701
    },
    {
      "epoch": 1.2414597920645025,
      "grad_norm": 1.0155557207844157,
      "learning_rate": 4.8711203740996827e-05,
      "loss": 1.7637,
      "num_input_tokens_seen": 9206734576,
      "step": 11702
    },
    {
      "epoch": 1.2415658816040738,
      "grad_norm": 0.5419540880215747,
      "learning_rate": 4.871098347374144e-05,
      "loss": 1.7178,
      "num_input_tokens_seen": 9207521376,
      "step": 11703
    },
    {
      "epoch": 1.2416719711436452,
      "grad_norm": 0.81117551682503,
      "learning_rate": 4.871076318816292e-05,
      "loss": 1.8465,
      "num_input_tokens_seen": 9208308128,
      "step": 11704
    },
    {
      "epoch": 1.2417780606832167,
      "grad_norm": 1.7821852401725096,
      "learning_rate": 4.871054288426141e-05,
      "loss": 1.9051,
      "num_input_tokens_seen": 9209094832,
      "step": 11705
    },
    {
      "epoch": 1.241884150222788,
      "grad_norm": 0.7752891757656094,
      "learning_rate": 4.871032256203709e-05,
      "loss": 1.8095,
      "num_input_tokens_seen": 9209881648,
      "step": 11706
    },
    {
      "epoch": 1.2419902397623594,
      "grad_norm": 1.1360962417563922,
      "learning_rate": 4.871010222149013e-05,
      "loss": 1.7517,
      "num_input_tokens_seen": 9210668384,
      "step": 11707
    },
    {
      "epoch": 1.242096329301931,
      "grad_norm": 0.7172251402385742,
      "learning_rate": 4.87098818626207e-05,
      "loss": 1.8334,
      "num_input_tokens_seen": 9211455088,
      "step": 11708
    },
    {
      "epoch": 1.2422024188415022,
      "grad_norm": 0.9027509780703525,
      "learning_rate": 4.870966148542896e-05,
      "loss": 1.7816,
      "num_input_tokens_seen": 9212241856,
      "step": 11709
    },
    {
      "epoch": 1.2423085083810737,
      "grad_norm": 0.6487316391191237,
      "learning_rate": 4.87094410899151e-05,
      "loss": 1.8616,
      "num_input_tokens_seen": 9213028544,
      "step": 11710
    },
    {
      "epoch": 1.2424145979206451,
      "grad_norm": 0.9100923055700534,
      "learning_rate": 4.8709220676079275e-05,
      "loss": 1.9883,
      "num_input_tokens_seen": 9213815280,
      "step": 11711
    },
    {
      "epoch": 1.2425206874602164,
      "grad_norm": 0.7616555680471307,
      "learning_rate": 4.870900024392167e-05,
      "loss": 1.7411,
      "num_input_tokens_seen": 9214601968,
      "step": 11712
    },
    {
      "epoch": 1.2426267769997879,
      "grad_norm": 0.6650396938306848,
      "learning_rate": 4.8708779793442426e-05,
      "loss": 1.6912,
      "num_input_tokens_seen": 9215388752,
      "step": 11713
    },
    {
      "epoch": 1.242732866539359,
      "grad_norm": 0.6485073726396048,
      "learning_rate": 4.8708559324641746e-05,
      "loss": 1.7859,
      "num_input_tokens_seen": 9216175504,
      "step": 11714
    },
    {
      "epoch": 1.2428389560789306,
      "grad_norm": 0.780393091748896,
      "learning_rate": 4.870833883751978e-05,
      "loss": 1.8183,
      "num_input_tokens_seen": 9216962160,
      "step": 11715
    },
    {
      "epoch": 1.242945045618502,
      "grad_norm": 0.5085192542978519,
      "learning_rate": 4.870811833207671e-05,
      "loss": 1.8316,
      "num_input_tokens_seen": 9217748896,
      "step": 11716
    },
    {
      "epoch": 1.2430511351580735,
      "grad_norm": 0.7872128734819689,
      "learning_rate": 4.87078978083127e-05,
      "loss": 1.8104,
      "num_input_tokens_seen": 9218535680,
      "step": 11717
    },
    {
      "epoch": 1.2431572246976448,
      "grad_norm": 0.49799964623482235,
      "learning_rate": 4.870767726622792e-05,
      "loss": 1.7635,
      "num_input_tokens_seen": 9219322368,
      "step": 11718
    },
    {
      "epoch": 1.2432633142372163,
      "grad_norm": 1.142073512473248,
      "learning_rate": 4.870745670582255e-05,
      "loss": 1.7728,
      "num_input_tokens_seen": 9220109120,
      "step": 11719
    },
    {
      "epoch": 1.2433694037767875,
      "grad_norm": 0.5366465181874629,
      "learning_rate": 4.8707236127096743e-05,
      "loss": 1.8472,
      "num_input_tokens_seen": 9220895968,
      "step": 11720
    },
    {
      "epoch": 1.243475493316359,
      "grad_norm": 0.8682668703494797,
      "learning_rate": 4.870701553005068e-05,
      "loss": 1.7554,
      "num_input_tokens_seen": 9221682704,
      "step": 11721
    },
    {
      "epoch": 1.2435815828559305,
      "grad_norm": 0.8222890150747261,
      "learning_rate": 4.8706794914684537e-05,
      "loss": 1.877,
      "num_input_tokens_seen": 9222469504,
      "step": 11722
    },
    {
      "epoch": 1.2436876723955017,
      "grad_norm": 1.0654768329887083,
      "learning_rate": 4.870657428099848e-05,
      "loss": 1.7362,
      "num_input_tokens_seen": 9223256304,
      "step": 11723
    },
    {
      "epoch": 1.2437937619350732,
      "grad_norm": 0.6376848767998455,
      "learning_rate": 4.870635362899268e-05,
      "loss": 1.7929,
      "num_input_tokens_seen": 9224043120,
      "step": 11724
    },
    {
      "epoch": 1.2438998514746447,
      "grad_norm": 0.5808374524939743,
      "learning_rate": 4.8706132958667294e-05,
      "loss": 1.8427,
      "num_input_tokens_seen": 9224829856,
      "step": 11725
    },
    {
      "epoch": 1.244005941014216,
      "grad_norm": 0.6279724650749361,
      "learning_rate": 4.870591227002251e-05,
      "loss": 1.7311,
      "num_input_tokens_seen": 9225616672,
      "step": 11726
    },
    {
      "epoch": 1.2441120305537874,
      "grad_norm": 0.6887123794472507,
      "learning_rate": 4.8705691563058496e-05,
      "loss": 1.6354,
      "num_input_tokens_seen": 9226403424,
      "step": 11727
    },
    {
      "epoch": 1.2442181200933589,
      "grad_norm": 0.6797386981605471,
      "learning_rate": 4.8705470837775414e-05,
      "loss": 1.7872,
      "num_input_tokens_seen": 9227190144,
      "step": 11728
    },
    {
      "epoch": 1.2443242096329301,
      "grad_norm": 1.2211606528835965,
      "learning_rate": 4.870525009417344e-05,
      "loss": 1.7942,
      "num_input_tokens_seen": 9227976912,
      "step": 11729
    },
    {
      "epoch": 1.2444302991725016,
      "grad_norm": 1.3250401148547493,
      "learning_rate": 4.870502933225275e-05,
      "loss": 1.8733,
      "num_input_tokens_seen": 9228763600,
      "step": 11730
    },
    {
      "epoch": 1.244536388712073,
      "grad_norm": 1.0146198131952529,
      "learning_rate": 4.87048085520135e-05,
      "loss": 1.8516,
      "num_input_tokens_seen": 9229550352,
      "step": 11731
    },
    {
      "epoch": 1.2446424782516443,
      "grad_norm": 1.5438479675536507,
      "learning_rate": 4.870458775345588e-05,
      "loss": 1.8834,
      "num_input_tokens_seen": 9230337152,
      "step": 11732
    },
    {
      "epoch": 1.2447485677912158,
      "grad_norm": 1.1492298617017653,
      "learning_rate": 4.8704366936580045e-05,
      "loss": 1.6791,
      "num_input_tokens_seen": 9231124048,
      "step": 11733
    },
    {
      "epoch": 1.2448546573307873,
      "grad_norm": 2.352518559572111,
      "learning_rate": 4.870414610138617e-05,
      "loss": 1.8871,
      "num_input_tokens_seen": 9231910784,
      "step": 11734
    },
    {
      "epoch": 1.2449607468703585,
      "grad_norm": 2.286718363121902,
      "learning_rate": 4.870392524787443e-05,
      "loss": 1.8126,
      "num_input_tokens_seen": 9232697536,
      "step": 11735
    },
    {
      "epoch": 1.24506683640993,
      "grad_norm": 0.8460996520745777,
      "learning_rate": 4.870370437604499e-05,
      "loss": 1.7484,
      "num_input_tokens_seen": 9233484288,
      "step": 11736
    },
    {
      "epoch": 1.2451729259495015,
      "grad_norm": 0.9305597807791277,
      "learning_rate": 4.8703483485898016e-05,
      "loss": 1.8025,
      "num_input_tokens_seen": 9234271072,
      "step": 11737
    },
    {
      "epoch": 1.2452790154890727,
      "grad_norm": 0.9940178444693073,
      "learning_rate": 4.87032625774337e-05,
      "loss": 1.8245,
      "num_input_tokens_seen": 9235057776,
      "step": 11738
    },
    {
      "epoch": 1.2453851050286442,
      "grad_norm": 0.7460071541561734,
      "learning_rate": 4.8703041650652184e-05,
      "loss": 1.8248,
      "num_input_tokens_seen": 9235844512,
      "step": 11739
    },
    {
      "epoch": 1.2454911945682157,
      "grad_norm": 0.8713238356627594,
      "learning_rate": 4.8702820705553656e-05,
      "loss": 1.677,
      "num_input_tokens_seen": 9236631264,
      "step": 11740
    },
    {
      "epoch": 1.245597284107787,
      "grad_norm": 0.687635924585292,
      "learning_rate": 4.8702599742138285e-05,
      "loss": 1.73,
      "num_input_tokens_seen": 9237417984,
      "step": 11741
    },
    {
      "epoch": 1.2457033736473584,
      "grad_norm": 0.5813546407738625,
      "learning_rate": 4.870237876040624e-05,
      "loss": 1.8947,
      "num_input_tokens_seen": 9238204640,
      "step": 11742
    },
    {
      "epoch": 1.2458094631869296,
      "grad_norm": 0.6409065697334255,
      "learning_rate": 4.87021577603577e-05,
      "loss": 1.752,
      "num_input_tokens_seen": 9238991392,
      "step": 11743
    },
    {
      "epoch": 1.2459155527265011,
      "grad_norm": 0.9761964158275591,
      "learning_rate": 4.870193674199281e-05,
      "loss": 1.7519,
      "num_input_tokens_seen": 9239778144,
      "step": 11744
    },
    {
      "epoch": 1.2460216422660726,
      "grad_norm": 0.6619132783647177,
      "learning_rate": 4.870171570531178e-05,
      "loss": 1.8687,
      "num_input_tokens_seen": 9240564928,
      "step": 11745
    },
    {
      "epoch": 1.246127731805644,
      "grad_norm": 0.7724689622891997,
      "learning_rate": 4.870149465031475e-05,
      "loss": 1.7686,
      "num_input_tokens_seen": 9241351760,
      "step": 11746
    },
    {
      "epoch": 1.2462338213452153,
      "grad_norm": 0.8706591634527833,
      "learning_rate": 4.870127357700189e-05,
      "loss": 1.8307,
      "num_input_tokens_seen": 9242138464,
      "step": 11747
    },
    {
      "epoch": 1.2463399108847868,
      "grad_norm": 0.8830430701685511,
      "learning_rate": 4.87010524853734e-05,
      "loss": 2.0419,
      "num_input_tokens_seen": 9242925232,
      "step": 11748
    },
    {
      "epoch": 1.246446000424358,
      "grad_norm": 2.018270526030629,
      "learning_rate": 4.870083137542942e-05,
      "loss": 1.7295,
      "num_input_tokens_seen": 9243711984,
      "step": 11749
    },
    {
      "epoch": 1.2465520899639295,
      "grad_norm": 1.2415070196165816,
      "learning_rate": 4.870061024717014e-05,
      "loss": 1.8561,
      "num_input_tokens_seen": 9244498704,
      "step": 11750
    },
    {
      "epoch": 1.246658179503501,
      "grad_norm": 2.1419029010684105,
      "learning_rate": 4.870038910059572e-05,
      "loss": 1.8487,
      "num_input_tokens_seen": 9245285424,
      "step": 11751
    },
    {
      "epoch": 1.2467642690430725,
      "grad_norm": 1.0062663311442073,
      "learning_rate": 4.8700167935706334e-05,
      "loss": 1.7375,
      "num_input_tokens_seen": 9246072224,
      "step": 11752
    },
    {
      "epoch": 1.2468703585826437,
      "grad_norm": 1.0208824540328114,
      "learning_rate": 4.8699946752502156e-05,
      "loss": 1.7701,
      "num_input_tokens_seen": 9246858912,
      "step": 11753
    },
    {
      "epoch": 1.2469764481222152,
      "grad_norm": 2.1629295336522216,
      "learning_rate": 4.869972555098336e-05,
      "loss": 1.7548,
      "num_input_tokens_seen": 9247645696,
      "step": 11754
    },
    {
      "epoch": 1.2470825376617864,
      "grad_norm": 0.8232038568524292,
      "learning_rate": 4.869950433115009e-05,
      "loss": 1.6647,
      "num_input_tokens_seen": 9248432432,
      "step": 11755
    },
    {
      "epoch": 1.247188627201358,
      "grad_norm": 0.5451898609952575,
      "learning_rate": 4.8699283093002554e-05,
      "loss": 1.7699,
      "num_input_tokens_seen": 9249219264,
      "step": 11756
    },
    {
      "epoch": 1.2472947167409294,
      "grad_norm": 1.0701605061380983,
      "learning_rate": 4.869906183654091e-05,
      "loss": 1.7708,
      "num_input_tokens_seen": 9250005968,
      "step": 11757
    },
    {
      "epoch": 1.2474008062805007,
      "grad_norm": 0.6521589659308829,
      "learning_rate": 4.869884056176533e-05,
      "loss": 1.8091,
      "num_input_tokens_seen": 9250792704,
      "step": 11758
    },
    {
      "epoch": 1.2475068958200721,
      "grad_norm": 0.5799737896457886,
      "learning_rate": 4.869861926867597e-05,
      "loss": 1.7369,
      "num_input_tokens_seen": 9251579440,
      "step": 11759
    },
    {
      "epoch": 1.2476129853596436,
      "grad_norm": 0.4782942696081657,
      "learning_rate": 4.869839795727301e-05,
      "loss": 1.7905,
      "num_input_tokens_seen": 9252366192,
      "step": 11760
    },
    {
      "epoch": 1.2477190748992149,
      "grad_norm": 0.6329826091476028,
      "learning_rate": 4.8698176627556636e-05,
      "loss": 1.8361,
      "num_input_tokens_seen": 9253153008,
      "step": 11761
    },
    {
      "epoch": 1.2478251644387863,
      "grad_norm": 0.5120702770806814,
      "learning_rate": 4.8697955279526995e-05,
      "loss": 1.7542,
      "num_input_tokens_seen": 9253939760,
      "step": 11762
    },
    {
      "epoch": 1.2479312539783578,
      "grad_norm": 0.6126578217775034,
      "learning_rate": 4.869773391318428e-05,
      "loss": 1.744,
      "num_input_tokens_seen": 9254726528,
      "step": 11763
    },
    {
      "epoch": 1.248037343517929,
      "grad_norm": 1.2104075759648203,
      "learning_rate": 4.869751252852864e-05,
      "loss": 1.8764,
      "num_input_tokens_seen": 9255513216,
      "step": 11764
    },
    {
      "epoch": 1.2481434330575005,
      "grad_norm": 2.1884733822082665,
      "learning_rate": 4.869729112556027e-05,
      "loss": 1.8439,
      "num_input_tokens_seen": 9256299888,
      "step": 11765
    },
    {
      "epoch": 1.248249522597072,
      "grad_norm": 2.4333900795575385,
      "learning_rate": 4.869706970427932e-05,
      "loss": 1.9307,
      "num_input_tokens_seen": 9257086608,
      "step": 11766
    },
    {
      "epoch": 1.2483556121366433,
      "grad_norm": 1.3244912598939735,
      "learning_rate": 4.8696848264685974e-05,
      "loss": 1.7743,
      "num_input_tokens_seen": 9257873344,
      "step": 11767
    },
    {
      "epoch": 1.2484617016762147,
      "grad_norm": 0.9331295872659114,
      "learning_rate": 4.86966268067804e-05,
      "loss": 1.8072,
      "num_input_tokens_seen": 9258660176,
      "step": 11768
    },
    {
      "epoch": 1.2485677912157862,
      "grad_norm": 0.7729569539149743,
      "learning_rate": 4.8696405330562763e-05,
      "loss": 1.7505,
      "num_input_tokens_seen": 9259446960,
      "step": 11769
    },
    {
      "epoch": 1.2486738807553575,
      "grad_norm": 0.8246339051664872,
      "learning_rate": 4.8696183836033245e-05,
      "loss": 1.8113,
      "num_input_tokens_seen": 9260233792,
      "step": 11770
    },
    {
      "epoch": 1.248779970294929,
      "grad_norm": 0.7304112356327623,
      "learning_rate": 4.8695962323192006e-05,
      "loss": 1.852,
      "num_input_tokens_seen": 9261020464,
      "step": 11771
    },
    {
      "epoch": 1.2488860598345004,
      "grad_norm": 0.6409501658833345,
      "learning_rate": 4.869574079203922e-05,
      "loss": 1.9363,
      "num_input_tokens_seen": 9261807232,
      "step": 11772
    },
    {
      "epoch": 1.2489921493740717,
      "grad_norm": 0.8032554591365021,
      "learning_rate": 4.869551924257507e-05,
      "loss": 1.7052,
      "num_input_tokens_seen": 9262593936,
      "step": 11773
    },
    {
      "epoch": 1.2490982389136431,
      "grad_norm": 0.7104047321928917,
      "learning_rate": 4.8695297674799714e-05,
      "loss": 1.6506,
      "num_input_tokens_seen": 9263380688,
      "step": 11774
    },
    {
      "epoch": 1.2492043284532146,
      "grad_norm": 0.45597758509919695,
      "learning_rate": 4.8695076088713333e-05,
      "loss": 1.6897,
      "num_input_tokens_seen": 9264167456,
      "step": 11775
    },
    {
      "epoch": 1.2493104179927859,
      "grad_norm": 0.5153876982434339,
      "learning_rate": 4.869485448431608e-05,
      "loss": 1.8669,
      "num_input_tokens_seen": 9264954128,
      "step": 11776
    },
    {
      "epoch": 1.2494165075323573,
      "grad_norm": 0.6252371619033529,
      "learning_rate": 4.869463286160815e-05,
      "loss": 1.7652,
      "num_input_tokens_seen": 9265740928,
      "step": 11777
    },
    {
      "epoch": 1.2495225970719286,
      "grad_norm": 0.48397867300941444,
      "learning_rate": 4.8694411220589696e-05,
      "loss": 1.816,
      "num_input_tokens_seen": 9266527744,
      "step": 11778
    },
    {
      "epoch": 1.2496286866115,
      "grad_norm": 0.5223974950509729,
      "learning_rate": 4.869418956126089e-05,
      "loss": 1.8551,
      "num_input_tokens_seen": 9267314400,
      "step": 11779
    },
    {
      "epoch": 1.2497347761510715,
      "grad_norm": 0.604851455070363,
      "learning_rate": 4.8693967883621926e-05,
      "loss": 2.0055,
      "num_input_tokens_seen": 9268101120,
      "step": 11780
    },
    {
      "epoch": 1.249840865690643,
      "grad_norm": 0.5484815219482858,
      "learning_rate": 4.8693746187672953e-05,
      "loss": 1.7573,
      "num_input_tokens_seen": 9268887824,
      "step": 11781
    },
    {
      "epoch": 1.2499469552302143,
      "grad_norm": 0.5863142602709659,
      "learning_rate": 4.8693524473414144e-05,
      "loss": 1.9451,
      "num_input_tokens_seen": 9269674560,
      "step": 11782
    },
    {
      "epoch": 1.2500530447697857,
      "grad_norm": 0.5761873256229079,
      "learning_rate": 4.8693302740845674e-05,
      "loss": 1.8255,
      "num_input_tokens_seen": 9270461376,
      "step": 11783
    },
    {
      "epoch": 1.250159134309357,
      "grad_norm": 0.41872032138057624,
      "learning_rate": 4.869308098996772e-05,
      "loss": 1.9016,
      "num_input_tokens_seen": 9271248272,
      "step": 11784
    },
    {
      "epoch": 1.2502652238489285,
      "grad_norm": 0.6033310496603058,
      "learning_rate": 4.869285922078044e-05,
      "loss": 1.9163,
      "num_input_tokens_seen": 9272035056,
      "step": 11785
    },
    {
      "epoch": 1.2503713133885,
      "grad_norm": 0.6594835825405444,
      "learning_rate": 4.869263743328402e-05,
      "loss": 1.8191,
      "num_input_tokens_seen": 9272821728,
      "step": 11786
    },
    {
      "epoch": 1.2504774029280714,
      "grad_norm": 0.6443935824873435,
      "learning_rate": 4.869241562747863e-05,
      "loss": 1.7678,
      "num_input_tokens_seen": 9273608480,
      "step": 11787
    },
    {
      "epoch": 1.2505834924676427,
      "grad_norm": 0.8416642272238718,
      "learning_rate": 4.869219380336443e-05,
      "loss": 1.6805,
      "num_input_tokens_seen": 9274395312,
      "step": 11788
    },
    {
      "epoch": 1.2506895820072141,
      "grad_norm": 0.648969855772871,
      "learning_rate": 4.8691971960941594e-05,
      "loss": 1.8332,
      "num_input_tokens_seen": 9275182032,
      "step": 11789
    },
    {
      "epoch": 1.2507956715467854,
      "grad_norm": 1.356495127381386,
      "learning_rate": 4.86917501002103e-05,
      "loss": 1.8473,
      "num_input_tokens_seen": 9275968832,
      "step": 11790
    },
    {
      "epoch": 1.2509017610863569,
      "grad_norm": 0.9488773032115363,
      "learning_rate": 4.869152822117072e-05,
      "loss": 1.9286,
      "num_input_tokens_seen": 9276755568,
      "step": 11791
    },
    {
      "epoch": 1.2510078506259283,
      "grad_norm": 0.5481045325112223,
      "learning_rate": 4.869130632382302e-05,
      "loss": 1.8824,
      "num_input_tokens_seen": 9277542320,
      "step": 11792
    },
    {
      "epoch": 1.2511139401654998,
      "grad_norm": 0.9593752498765169,
      "learning_rate": 4.869108440816738e-05,
      "loss": 1.7173,
      "num_input_tokens_seen": 9278329040,
      "step": 11793
    },
    {
      "epoch": 1.251220029705071,
      "grad_norm": 0.5120311414850773,
      "learning_rate": 4.8690862474203956e-05,
      "loss": 1.8219,
      "num_input_tokens_seen": 9279115856,
      "step": 11794
    },
    {
      "epoch": 1.2513261192446425,
      "grad_norm": 1.0439442641240881,
      "learning_rate": 4.869064052193293e-05,
      "loss": 1.9053,
      "num_input_tokens_seen": 9279902592,
      "step": 11795
    },
    {
      "epoch": 1.2514322087842138,
      "grad_norm": 0.7843710197311108,
      "learning_rate": 4.869041855135448e-05,
      "loss": 1.8816,
      "num_input_tokens_seen": 9280689376,
      "step": 11796
    },
    {
      "epoch": 1.2515382983237853,
      "grad_norm": 0.6913130225647582,
      "learning_rate": 4.869019656246876e-05,
      "loss": 1.7848,
      "num_input_tokens_seen": 9281476128,
      "step": 11797
    },
    {
      "epoch": 1.2516443878633567,
      "grad_norm": 0.49274920211306855,
      "learning_rate": 4.868997455527595e-05,
      "loss": 1.8815,
      "num_input_tokens_seen": 9282262896,
      "step": 11798
    },
    {
      "epoch": 1.251750477402928,
      "grad_norm": 0.6037902816565452,
      "learning_rate": 4.8689752529776226e-05,
      "loss": 1.7645,
      "num_input_tokens_seen": 9283049616,
      "step": 11799
    },
    {
      "epoch": 1.2518565669424995,
      "grad_norm": 0.752377521276094,
      "learning_rate": 4.868953048596976e-05,
      "loss": 1.87,
      "num_input_tokens_seen": 9283836304,
      "step": 11800
    },
    {
      "epoch": 1.251962656482071,
      "grad_norm": 0.5563411719665652,
      "learning_rate": 4.868930842385671e-05,
      "loss": 1.8039,
      "num_input_tokens_seen": 9284623008,
      "step": 11801
    },
    {
      "epoch": 1.2520687460216422,
      "grad_norm": 0.5455580090983585,
      "learning_rate": 4.868908634343727e-05,
      "loss": 1.8467,
      "num_input_tokens_seen": 9285409728,
      "step": 11802
    },
    {
      "epoch": 1.2521748355612137,
      "grad_norm": 0.6727216671881675,
      "learning_rate": 4.8688864244711595e-05,
      "loss": 1.9281,
      "num_input_tokens_seen": 9286196480,
      "step": 11803
    },
    {
      "epoch": 1.2522809251007851,
      "grad_norm": 0.6453252836381614,
      "learning_rate": 4.8688642127679864e-05,
      "loss": 1.8898,
      "num_input_tokens_seen": 9286983232,
      "step": 11804
    },
    {
      "epoch": 1.2523870146403564,
      "grad_norm": 0.8678999017936105,
      "learning_rate": 4.868841999234224e-05,
      "loss": 1.8434,
      "num_input_tokens_seen": 9287769968,
      "step": 11805
    },
    {
      "epoch": 1.2524931041799279,
      "grad_norm": 0.436007066643912,
      "learning_rate": 4.86881978386989e-05,
      "loss": 1.8472,
      "num_input_tokens_seen": 9288556704,
      "step": 11806
    },
    {
      "epoch": 1.2525991937194991,
      "grad_norm": 0.6283567731102021,
      "learning_rate": 4.868797566675002e-05,
      "loss": 1.6859,
      "num_input_tokens_seen": 9289343536,
      "step": 11807
    },
    {
      "epoch": 1.2527052832590706,
      "grad_norm": 1.9159104151010196,
      "learning_rate": 4.8687753476495765e-05,
      "loss": 1.7759,
      "num_input_tokens_seen": 9290130336,
      "step": 11808
    },
    {
      "epoch": 1.252811372798642,
      "grad_norm": 1.0324433063235507,
      "learning_rate": 4.868753126793631e-05,
      "loss": 1.784,
      "num_input_tokens_seen": 9290917120,
      "step": 11809
    },
    {
      "epoch": 1.2529174623382136,
      "grad_norm": 1.0629040405045478,
      "learning_rate": 4.868730904107183e-05,
      "loss": 1.7271,
      "num_input_tokens_seen": 9291703856,
      "step": 11810
    },
    {
      "epoch": 1.2530235518777848,
      "grad_norm": 0.6714597011133719,
      "learning_rate": 4.868708679590248e-05,
      "loss": 1.732,
      "num_input_tokens_seen": 9292490592,
      "step": 11811
    },
    {
      "epoch": 1.2531296414173563,
      "grad_norm": 0.8312318470114655,
      "learning_rate": 4.8686864532428456e-05,
      "loss": 1.802,
      "num_input_tokens_seen": 9293277424,
      "step": 11812
    },
    {
      "epoch": 1.2532357309569275,
      "grad_norm": 0.5764164553021824,
      "learning_rate": 4.868664225064991e-05,
      "loss": 1.7394,
      "num_input_tokens_seen": 9294064160,
      "step": 11813
    },
    {
      "epoch": 1.253341820496499,
      "grad_norm": 0.6645940742594894,
      "learning_rate": 4.868641995056703e-05,
      "loss": 1.8216,
      "num_input_tokens_seen": 9294850848,
      "step": 11814
    },
    {
      "epoch": 1.2534479100360705,
      "grad_norm": 0.5195989950900751,
      "learning_rate": 4.868619763217998e-05,
      "loss": 1.7094,
      "num_input_tokens_seen": 9295637696,
      "step": 11815
    },
    {
      "epoch": 1.253553999575642,
      "grad_norm": 0.5405048226266133,
      "learning_rate": 4.868597529548892e-05,
      "loss": 1.8564,
      "num_input_tokens_seen": 9296424400,
      "step": 11816
    },
    {
      "epoch": 1.2536600891152132,
      "grad_norm": 0.5280388751996415,
      "learning_rate": 4.868575294049404e-05,
      "loss": 1.6456,
      "num_input_tokens_seen": 9297211216,
      "step": 11817
    },
    {
      "epoch": 1.2537661786547847,
      "grad_norm": 0.48461960847294755,
      "learning_rate": 4.86855305671955e-05,
      "loss": 1.7603,
      "num_input_tokens_seen": 9297997968,
      "step": 11818
    },
    {
      "epoch": 1.253872268194356,
      "grad_norm": 0.44898113902193243,
      "learning_rate": 4.868530817559349e-05,
      "loss": 1.7846,
      "num_input_tokens_seen": 9298784768,
      "step": 11819
    },
    {
      "epoch": 1.2539783577339274,
      "grad_norm": 0.4940307463163772,
      "learning_rate": 4.8685085765688157e-05,
      "loss": 1.794,
      "num_input_tokens_seen": 9299571472,
      "step": 11820
    },
    {
      "epoch": 1.2540844472734989,
      "grad_norm": 0.3950818353138804,
      "learning_rate": 4.868486333747969e-05,
      "loss": 1.8004,
      "num_input_tokens_seen": 9300358240,
      "step": 11821
    },
    {
      "epoch": 1.2541905368130704,
      "grad_norm": 0.417375594138765,
      "learning_rate": 4.8684640890968256e-05,
      "loss": 1.8608,
      "num_input_tokens_seen": 9301144992,
      "step": 11822
    },
    {
      "epoch": 1.2542966263526416,
      "grad_norm": 0.4641870159040424,
      "learning_rate": 4.868441842615402e-05,
      "loss": 1.7263,
      "num_input_tokens_seen": 9301931808,
      "step": 11823
    },
    {
      "epoch": 1.254402715892213,
      "grad_norm": 0.4607554759887903,
      "learning_rate": 4.868419594303717e-05,
      "loss": 1.8944,
      "num_input_tokens_seen": 9302718544,
      "step": 11824
    },
    {
      "epoch": 1.2545088054317843,
      "grad_norm": 0.42656511101044187,
      "learning_rate": 4.8683973441617855e-05,
      "loss": 1.792,
      "num_input_tokens_seen": 9303505360,
      "step": 11825
    },
    {
      "epoch": 1.2546148949713558,
      "grad_norm": 0.7009093536439611,
      "learning_rate": 4.868375092189627e-05,
      "loss": 1.6673,
      "num_input_tokens_seen": 9304291984,
      "step": 11826
    },
    {
      "epoch": 1.2547209845109273,
      "grad_norm": 1.5335566251666626,
      "learning_rate": 4.868352838387258e-05,
      "loss": 1.822,
      "num_input_tokens_seen": 9305078768,
      "step": 11827
    },
    {
      "epoch": 1.2548270740504988,
      "grad_norm": 0.5325839388183757,
      "learning_rate": 4.8683305827546957e-05,
      "loss": 1.8382,
      "num_input_tokens_seen": 9305865536,
      "step": 11828
    },
    {
      "epoch": 1.25493316359007,
      "grad_norm": 1.240627178913353,
      "learning_rate": 4.868308325291956e-05,
      "loss": 1.7118,
      "num_input_tokens_seen": 9306652416,
      "step": 11829
    },
    {
      "epoch": 1.2550392531296415,
      "grad_norm": 0.49891199356324145,
      "learning_rate": 4.868286065999057e-05,
      "loss": 1.8154,
      "num_input_tokens_seen": 9307439200,
      "step": 11830
    },
    {
      "epoch": 1.2551453426692127,
      "grad_norm": 1.0280484487069836,
      "learning_rate": 4.868263804876017e-05,
      "loss": 1.7948,
      "num_input_tokens_seen": 9308226064,
      "step": 11831
    },
    {
      "epoch": 1.2552514322087842,
      "grad_norm": 0.46519832981485776,
      "learning_rate": 4.868241541922851e-05,
      "loss": 1.8245,
      "num_input_tokens_seen": 9309012816,
      "step": 11832
    },
    {
      "epoch": 1.2553575217483557,
      "grad_norm": 1.4125285575155875,
      "learning_rate": 4.868219277139578e-05,
      "loss": 1.739,
      "num_input_tokens_seen": 9309799536,
      "step": 11833
    },
    {
      "epoch": 1.255463611287927,
      "grad_norm": 0.48844336970773705,
      "learning_rate": 4.868197010526215e-05,
      "loss": 1.7385,
      "num_input_tokens_seen": 9310586304,
      "step": 11834
    },
    {
      "epoch": 1.2555697008274984,
      "grad_norm": 4.947122565285063,
      "learning_rate": 4.868174742082779e-05,
      "loss": 1.8782,
      "num_input_tokens_seen": 9311373120,
      "step": 11835
    },
    {
      "epoch": 1.2556757903670699,
      "grad_norm": 0.6644264521122459,
      "learning_rate": 4.8681524718092866e-05,
      "loss": 1.8255,
      "num_input_tokens_seen": 9312159952,
      "step": 11836
    },
    {
      "epoch": 1.2557818799066411,
      "grad_norm": 1.3454260208767677,
      "learning_rate": 4.8681301997057546e-05,
      "loss": 1.7411,
      "num_input_tokens_seen": 9312946784,
      "step": 11837
    },
    {
      "epoch": 1.2558879694462126,
      "grad_norm": 0.6891194482973755,
      "learning_rate": 4.8681079257722025e-05,
      "loss": 1.7096,
      "num_input_tokens_seen": 9313733568,
      "step": 11838
    },
    {
      "epoch": 1.255994058985784,
      "grad_norm": 0.7994255033675454,
      "learning_rate": 4.868085650008646e-05,
      "loss": 1.7373,
      "num_input_tokens_seen": 9314520368,
      "step": 11839
    },
    {
      "epoch": 1.2561001485253553,
      "grad_norm": 0.39594700212531947,
      "learning_rate": 4.868063372415102e-05,
      "loss": 1.6847,
      "num_input_tokens_seen": 9315307264,
      "step": 11840
    },
    {
      "epoch": 1.2562062380649268,
      "grad_norm": 0.8659479649441578,
      "learning_rate": 4.8680410929915876e-05,
      "loss": 1.7966,
      "num_input_tokens_seen": 9316094112,
      "step": 11841
    },
    {
      "epoch": 1.256312327604498,
      "grad_norm": 0.41507852841749726,
      "learning_rate": 4.868018811738121e-05,
      "loss": 1.8297,
      "num_input_tokens_seen": 9316880912,
      "step": 11842
    },
    {
      "epoch": 1.2564184171440695,
      "grad_norm": 0.9494755189235367,
      "learning_rate": 4.867996528654719e-05,
      "loss": 1.8243,
      "num_input_tokens_seen": 9317667552,
      "step": 11843
    },
    {
      "epoch": 1.256524506683641,
      "grad_norm": 0.7806227791901899,
      "learning_rate": 4.867974243741399e-05,
      "loss": 1.7681,
      "num_input_tokens_seen": 9318454400,
      "step": 11844
    },
    {
      "epoch": 1.2566305962232125,
      "grad_norm": 0.5609744036628962,
      "learning_rate": 4.867951956998177e-05,
      "loss": 1.9371,
      "num_input_tokens_seen": 9319241232,
      "step": 11845
    },
    {
      "epoch": 1.2567366857627837,
      "grad_norm": 0.8408644012753758,
      "learning_rate": 4.867929668425072e-05,
      "loss": 1.948,
      "num_input_tokens_seen": 9320028000,
      "step": 11846
    },
    {
      "epoch": 1.2568427753023552,
      "grad_norm": 0.41355295286274,
      "learning_rate": 4.867907378022101e-05,
      "loss": 1.7861,
      "num_input_tokens_seen": 9320814784,
      "step": 11847
    },
    {
      "epoch": 1.2569488648419265,
      "grad_norm": 0.6322814270006122,
      "learning_rate": 4.867885085789279e-05,
      "loss": 1.6136,
      "num_input_tokens_seen": 9321601632,
      "step": 11848
    },
    {
      "epoch": 1.257054954381498,
      "grad_norm": 0.6989923048668089,
      "learning_rate": 4.867862791726626e-05,
      "loss": 1.8427,
      "num_input_tokens_seen": 9322388464,
      "step": 11849
    },
    {
      "epoch": 1.2571610439210694,
      "grad_norm": 0.5071771894338891,
      "learning_rate": 4.867840495834158e-05,
      "loss": 1.8059,
      "num_input_tokens_seen": 9323175232,
      "step": 11850
    },
    {
      "epoch": 1.257267133460641,
      "grad_norm": 0.956240829654421,
      "learning_rate": 4.867818198111892e-05,
      "loss": 1.9937,
      "num_input_tokens_seen": 9323961936,
      "step": 11851
    },
    {
      "epoch": 1.2573732230002121,
      "grad_norm": 0.6300950934886009,
      "learning_rate": 4.867795898559846e-05,
      "loss": 1.7797,
      "num_input_tokens_seen": 9324748688,
      "step": 11852
    },
    {
      "epoch": 1.2574793125397836,
      "grad_norm": 0.6575348768141657,
      "learning_rate": 4.867773597178037e-05,
      "loss": 1.7311,
      "num_input_tokens_seen": 9325535440,
      "step": 11853
    },
    {
      "epoch": 1.2575854020793549,
      "grad_norm": 0.9398164395533923,
      "learning_rate": 4.867751293966482e-05,
      "loss": 1.9136,
      "num_input_tokens_seen": 9326322240,
      "step": 11854
    },
    {
      "epoch": 1.2576914916189263,
      "grad_norm": 0.4530767480749897,
      "learning_rate": 4.8677289889251975e-05,
      "loss": 1.7613,
      "num_input_tokens_seen": 9327108992,
      "step": 11855
    },
    {
      "epoch": 1.2577975811584978,
      "grad_norm": 0.7538640044171775,
      "learning_rate": 4.8677066820542014e-05,
      "loss": 1.8331,
      "num_input_tokens_seen": 9327895744,
      "step": 11856
    },
    {
      "epoch": 1.2579036706980693,
      "grad_norm": 0.4933559696999375,
      "learning_rate": 4.867684373353512e-05,
      "loss": 1.7379,
      "num_input_tokens_seen": 9328682544,
      "step": 11857
    },
    {
      "epoch": 1.2580097602376406,
      "grad_norm": 0.4334206576252501,
      "learning_rate": 4.867662062823145e-05,
      "loss": 1.8304,
      "num_input_tokens_seen": 9329469360,
      "step": 11858
    },
    {
      "epoch": 1.258115849777212,
      "grad_norm": 0.5602718429083982,
      "learning_rate": 4.867639750463119e-05,
      "loss": 1.733,
      "num_input_tokens_seen": 9330256176,
      "step": 11859
    },
    {
      "epoch": 1.2582219393167833,
      "grad_norm": 0.5043419568051671,
      "learning_rate": 4.8676174362734496e-05,
      "loss": 1.8808,
      "num_input_tokens_seen": 9331042928,
      "step": 11860
    },
    {
      "epoch": 1.2583280288563548,
      "grad_norm": 0.4739282065756221,
      "learning_rate": 4.8675951202541555e-05,
      "loss": 1.7518,
      "num_input_tokens_seen": 9331829664,
      "step": 11861
    },
    {
      "epoch": 1.2584341183959262,
      "grad_norm": 0.4075768571702113,
      "learning_rate": 4.867572802405253e-05,
      "loss": 1.7239,
      "num_input_tokens_seen": 9332616480,
      "step": 11862
    },
    {
      "epoch": 1.2585402079354975,
      "grad_norm": 0.41283446790050143,
      "learning_rate": 4.86755048272676e-05,
      "loss": 1.7863,
      "num_input_tokens_seen": 9333403216,
      "step": 11863
    },
    {
      "epoch": 1.258646297475069,
      "grad_norm": 0.46302276939374554,
      "learning_rate": 4.867528161218693e-05,
      "loss": 1.8538,
      "num_input_tokens_seen": 9334189888,
      "step": 11864
    },
    {
      "epoch": 1.2587523870146404,
      "grad_norm": 0.42058306005500184,
      "learning_rate": 4.86750583788107e-05,
      "loss": 1.9916,
      "num_input_tokens_seen": 9334976576,
      "step": 11865
    },
    {
      "epoch": 1.2588584765542117,
      "grad_norm": 0.4290718451199293,
      "learning_rate": 4.867483512713908e-05,
      "loss": 1.7757,
      "num_input_tokens_seen": 9335763344,
      "step": 11866
    },
    {
      "epoch": 1.2589645660937832,
      "grad_norm": 0.5003860644827941,
      "learning_rate": 4.867461185717224e-05,
      "loss": 1.7947,
      "num_input_tokens_seen": 9336550080,
      "step": 11867
    },
    {
      "epoch": 1.2590706556333546,
      "grad_norm": 0.4013293288356584,
      "learning_rate": 4.867438856891035e-05,
      "loss": 1.7968,
      "num_input_tokens_seen": 9337336864,
      "step": 11868
    },
    {
      "epoch": 1.2591767451729259,
      "grad_norm": 0.4729454202436296,
      "learning_rate": 4.86741652623536e-05,
      "loss": 1.7852,
      "num_input_tokens_seen": 9338123712,
      "step": 11869
    },
    {
      "epoch": 1.2592828347124974,
      "grad_norm": 0.4546555324790215,
      "learning_rate": 4.8673941937502145e-05,
      "loss": 1.8623,
      "num_input_tokens_seen": 9338910432,
      "step": 11870
    },
    {
      "epoch": 1.2593889242520686,
      "grad_norm": 0.4689803174661091,
      "learning_rate": 4.867371859435615e-05,
      "loss": 1.7762,
      "num_input_tokens_seen": 9339697232,
      "step": 11871
    },
    {
      "epoch": 1.25949501379164,
      "grad_norm": 0.3883885315027577,
      "learning_rate": 4.867349523291582e-05,
      "loss": 1.7374,
      "num_input_tokens_seen": 9340484016,
      "step": 11872
    },
    {
      "epoch": 1.2596011033312116,
      "grad_norm": 0.3800534701209427,
      "learning_rate": 4.867327185318129e-05,
      "loss": 1.6726,
      "num_input_tokens_seen": 9341270880,
      "step": 11873
    },
    {
      "epoch": 1.259707192870783,
      "grad_norm": 0.43156629737713137,
      "learning_rate": 4.867304845515276e-05,
      "loss": 1.7867,
      "num_input_tokens_seen": 9342057680,
      "step": 11874
    },
    {
      "epoch": 1.2598132824103543,
      "grad_norm": 0.48543422291401195,
      "learning_rate": 4.86728250388304e-05,
      "loss": 1.8558,
      "num_input_tokens_seen": 9342844448,
      "step": 11875
    },
    {
      "epoch": 1.2599193719499258,
      "grad_norm": 0.45658378670878685,
      "learning_rate": 4.867260160421436e-05,
      "loss": 1.7837,
      "num_input_tokens_seen": 9343631264,
      "step": 11876
    },
    {
      "epoch": 1.260025461489497,
      "grad_norm": 0.44595361079708296,
      "learning_rate": 4.867237815130483e-05,
      "loss": 1.8375,
      "num_input_tokens_seen": 9344418112,
      "step": 11877
    },
    {
      "epoch": 1.2601315510290685,
      "grad_norm": 0.5935600605837652,
      "learning_rate": 4.867215468010199e-05,
      "loss": 1.881,
      "num_input_tokens_seen": 9345204832,
      "step": 11878
    },
    {
      "epoch": 1.26023764056864,
      "grad_norm": 0.36819896528891977,
      "learning_rate": 4.8671931190606e-05,
      "loss": 1.7118,
      "num_input_tokens_seen": 9345991632,
      "step": 11879
    },
    {
      "epoch": 1.2603437301082114,
      "grad_norm": 0.5821230559959638,
      "learning_rate": 4.8671707682817026e-05,
      "loss": 1.7819,
      "num_input_tokens_seen": 9346778352,
      "step": 11880
    },
    {
      "epoch": 1.2604498196477827,
      "grad_norm": 0.4761925806266829,
      "learning_rate": 4.867148415673526e-05,
      "loss": 1.811,
      "num_input_tokens_seen": 9347565056,
      "step": 11881
    },
    {
      "epoch": 1.2605559091873542,
      "grad_norm": 0.41923882533109313,
      "learning_rate": 4.867126061236087e-05,
      "loss": 1.8741,
      "num_input_tokens_seen": 9348351824,
      "step": 11882
    },
    {
      "epoch": 1.2606619987269254,
      "grad_norm": 0.607193328299631,
      "learning_rate": 4.867103704969401e-05,
      "loss": 1.8056,
      "num_input_tokens_seen": 9349138464,
      "step": 11883
    },
    {
      "epoch": 1.260768088266497,
      "grad_norm": 0.4257617040400109,
      "learning_rate": 4.8670813468734884e-05,
      "loss": 1.8184,
      "num_input_tokens_seen": 9349925248,
      "step": 11884
    },
    {
      "epoch": 1.2608741778060684,
      "grad_norm": 0.4823609493322316,
      "learning_rate": 4.867058986948364e-05,
      "loss": 1.822,
      "num_input_tokens_seen": 9350712048,
      "step": 11885
    },
    {
      "epoch": 1.2609802673456398,
      "grad_norm": 0.4332876614244094,
      "learning_rate": 4.867036625194046e-05,
      "loss": 1.6851,
      "num_input_tokens_seen": 9351498800,
      "step": 11886
    },
    {
      "epoch": 1.261086356885211,
      "grad_norm": 0.4433103885940984,
      "learning_rate": 4.867014261610551e-05,
      "loss": 1.8196,
      "num_input_tokens_seen": 9352285552,
      "step": 11887
    },
    {
      "epoch": 1.2611924464247826,
      "grad_norm": 0.42578711016628773,
      "learning_rate": 4.866991896197897e-05,
      "loss": 1.673,
      "num_input_tokens_seen": 9353072352,
      "step": 11888
    },
    {
      "epoch": 1.2612985359643538,
      "grad_norm": 0.46248965614277143,
      "learning_rate": 4.866969528956102e-05,
      "loss": 1.6789,
      "num_input_tokens_seen": 9353859168,
      "step": 11889
    },
    {
      "epoch": 1.2614046255039253,
      "grad_norm": 0.4206427196051207,
      "learning_rate": 4.866947159885181e-05,
      "loss": 1.7998,
      "num_input_tokens_seen": 9354645968,
      "step": 11890
    },
    {
      "epoch": 1.2615107150434968,
      "grad_norm": 0.49508456608507995,
      "learning_rate": 4.866924788985154e-05,
      "loss": 1.7045,
      "num_input_tokens_seen": 9355432688,
      "step": 11891
    },
    {
      "epoch": 1.2616168045830682,
      "grad_norm": 0.36647304562185323,
      "learning_rate": 4.8669024162560364e-05,
      "loss": 1.7379,
      "num_input_tokens_seen": 9356219536,
      "step": 11892
    },
    {
      "epoch": 1.2617228941226395,
      "grad_norm": 0.4626477976508766,
      "learning_rate": 4.866880041697846e-05,
      "loss": 1.6523,
      "num_input_tokens_seen": 9357006384,
      "step": 11893
    },
    {
      "epoch": 1.261828983662211,
      "grad_norm": 0.48735514517073975,
      "learning_rate": 4.8668576653106e-05,
      "loss": 1.8057,
      "num_input_tokens_seen": 9357793152,
      "step": 11894
    },
    {
      "epoch": 1.2619350732017822,
      "grad_norm": 0.3653599299524511,
      "learning_rate": 4.866835287094316e-05,
      "loss": 1.5987,
      "num_input_tokens_seen": 9358579888,
      "step": 11895
    },
    {
      "epoch": 1.2620411627413537,
      "grad_norm": 0.6150282823648038,
      "learning_rate": 4.866812907049012e-05,
      "loss": 1.7222,
      "num_input_tokens_seen": 9359366592,
      "step": 11896
    },
    {
      "epoch": 1.2621472522809252,
      "grad_norm": 0.4792984676972619,
      "learning_rate": 4.866790525174703e-05,
      "loss": 1.751,
      "num_input_tokens_seen": 9360153216,
      "step": 11897
    },
    {
      "epoch": 1.2622533418204964,
      "grad_norm": 0.48641693157915933,
      "learning_rate": 4.866768141471408e-05,
      "loss": 1.6752,
      "num_input_tokens_seen": 9360940064,
      "step": 11898
    },
    {
      "epoch": 1.262359431360068,
      "grad_norm": 0.42886594749164786,
      "learning_rate": 4.866745755939145e-05,
      "loss": 1.8322,
      "num_input_tokens_seen": 9361726800,
      "step": 11899
    },
    {
      "epoch": 1.2624655208996394,
      "grad_norm": 0.5993324697633268,
      "learning_rate": 4.86672336857793e-05,
      "loss": 1.8088,
      "num_input_tokens_seen": 9362513568,
      "step": 11900
    },
    {
      "epoch": 1.2625716104392106,
      "grad_norm": 0.41108446128378595,
      "learning_rate": 4.86670097938778e-05,
      "loss": 1.7002,
      "num_input_tokens_seen": 9363300336,
      "step": 11901
    },
    {
      "epoch": 1.262677699978782,
      "grad_norm": 0.9307660035926051,
      "learning_rate": 4.866678588368713e-05,
      "loss": 1.6877,
      "num_input_tokens_seen": 9364087104,
      "step": 11902
    },
    {
      "epoch": 1.2627837895183536,
      "grad_norm": 0.4912494903288255,
      "learning_rate": 4.866656195520747e-05,
      "loss": 1.7639,
      "num_input_tokens_seen": 9364873840,
      "step": 11903
    },
    {
      "epoch": 1.2628898790579248,
      "grad_norm": 0.49580015454877047,
      "learning_rate": 4.866633800843898e-05,
      "loss": 1.7293,
      "num_input_tokens_seen": 9365660576,
      "step": 11904
    },
    {
      "epoch": 1.2629959685974963,
      "grad_norm": 0.38759698543201665,
      "learning_rate": 4.866611404338184e-05,
      "loss": 1.7125,
      "num_input_tokens_seen": 9366447392,
      "step": 11905
    },
    {
      "epoch": 1.2631020581370676,
      "grad_norm": 0.41792622170325866,
      "learning_rate": 4.8665890060036215e-05,
      "loss": 1.8121,
      "num_input_tokens_seen": 9367234176,
      "step": 11906
    },
    {
      "epoch": 1.263208147676639,
      "grad_norm": 0.36100490882299074,
      "learning_rate": 4.8665666058402296e-05,
      "loss": 1.684,
      "num_input_tokens_seen": 9368020912,
      "step": 11907
    },
    {
      "epoch": 1.2633142372162105,
      "grad_norm": 0.40719927677178164,
      "learning_rate": 4.866544203848024e-05,
      "loss": 1.7819,
      "num_input_tokens_seen": 9368807696,
      "step": 11908
    },
    {
      "epoch": 1.263420326755782,
      "grad_norm": 0.3972331573267063,
      "learning_rate": 4.8665218000270216e-05,
      "loss": 1.7976,
      "num_input_tokens_seen": 9369594432,
      "step": 11909
    },
    {
      "epoch": 1.2635264162953532,
      "grad_norm": 0.3808308336825861,
      "learning_rate": 4.866499394377242e-05,
      "loss": 1.7071,
      "num_input_tokens_seen": 9370381200,
      "step": 11910
    },
    {
      "epoch": 1.2636325058349247,
      "grad_norm": 0.46098846152399303,
      "learning_rate": 4.8664769868987e-05,
      "loss": 1.848,
      "num_input_tokens_seen": 9371167984,
      "step": 11911
    },
    {
      "epoch": 1.263738595374496,
      "grad_norm": 0.401369824826525,
      "learning_rate": 4.866454577591414e-05,
      "loss": 1.8422,
      "num_input_tokens_seen": 9371954736,
      "step": 11912
    },
    {
      "epoch": 1.2638446849140674,
      "grad_norm": 0.37707799210288234,
      "learning_rate": 4.866432166455402e-05,
      "loss": 1.7445,
      "num_input_tokens_seen": 9372741520,
      "step": 11913
    },
    {
      "epoch": 1.263950774453639,
      "grad_norm": 0.553789329028818,
      "learning_rate": 4.866409753490681e-05,
      "loss": 1.889,
      "num_input_tokens_seen": 9373528272,
      "step": 11914
    },
    {
      "epoch": 1.2640568639932104,
      "grad_norm": 0.3763271390992394,
      "learning_rate": 4.8663873386972666e-05,
      "loss": 1.7689,
      "num_input_tokens_seen": 9374315040,
      "step": 11915
    },
    {
      "epoch": 1.2641629535327816,
      "grad_norm": 0.5154118776623718,
      "learning_rate": 4.866364922075178e-05,
      "loss": 1.8079,
      "num_input_tokens_seen": 9375101952,
      "step": 11916
    },
    {
      "epoch": 1.264269043072353,
      "grad_norm": 0.4024682753973708,
      "learning_rate": 4.866342503624433e-05,
      "loss": 1.7272,
      "num_input_tokens_seen": 9375888832,
      "step": 11917
    },
    {
      "epoch": 1.2643751326119244,
      "grad_norm": 0.5512289112593766,
      "learning_rate": 4.8663200833450474e-05,
      "loss": 1.8317,
      "num_input_tokens_seen": 9376675600,
      "step": 11918
    },
    {
      "epoch": 1.2644812221514958,
      "grad_norm": 0.3453770329625048,
      "learning_rate": 4.866297661237039e-05,
      "loss": 1.8528,
      "num_input_tokens_seen": 9377462240,
      "step": 11919
    },
    {
      "epoch": 1.2645873116910673,
      "grad_norm": 0.48881604561835523,
      "learning_rate": 4.866275237300425e-05,
      "loss": 1.888,
      "num_input_tokens_seen": 9378249008,
      "step": 11920
    },
    {
      "epoch": 1.2646934012306388,
      "grad_norm": 0.35584868602938957,
      "learning_rate": 4.8662528115352234e-05,
      "loss": 1.7784,
      "num_input_tokens_seen": 9379035824,
      "step": 11921
    },
    {
      "epoch": 1.26479949077021,
      "grad_norm": 0.38406044262430133,
      "learning_rate": 4.86623038394145e-05,
      "loss": 1.7098,
      "num_input_tokens_seen": 9379822624,
      "step": 11922
    },
    {
      "epoch": 1.2649055803097815,
      "grad_norm": 0.5230516664616766,
      "learning_rate": 4.8662079545191244e-05,
      "loss": 1.8848,
      "num_input_tokens_seen": 9380609360,
      "step": 11923
    },
    {
      "epoch": 1.2650116698493528,
      "grad_norm": 0.4512157021614553,
      "learning_rate": 4.8661855232682627e-05,
      "loss": 1.7519,
      "num_input_tokens_seen": 9381396080,
      "step": 11924
    },
    {
      "epoch": 1.2651177593889242,
      "grad_norm": 0.5165210445785583,
      "learning_rate": 4.866163090188881e-05,
      "loss": 1.7547,
      "num_input_tokens_seen": 9382182848,
      "step": 11925
    },
    {
      "epoch": 1.2652238489284957,
      "grad_norm": 0.46899015430555213,
      "learning_rate": 4.866140655280999e-05,
      "loss": 1.716,
      "num_input_tokens_seen": 9382969696,
      "step": 11926
    },
    {
      "epoch": 1.2653299384680672,
      "grad_norm": 0.49209028923970266,
      "learning_rate": 4.866118218544633e-05,
      "loss": 1.7981,
      "num_input_tokens_seen": 9383756464,
      "step": 11927
    },
    {
      "epoch": 1.2654360280076384,
      "grad_norm": 0.39878369271685526,
      "learning_rate": 4.8660957799797995e-05,
      "loss": 1.8219,
      "num_input_tokens_seen": 9384543296,
      "step": 11928
    },
    {
      "epoch": 1.26554211754721,
      "grad_norm": 0.46622946720270725,
      "learning_rate": 4.866073339586517e-05,
      "loss": 1.7549,
      "num_input_tokens_seen": 9385330048,
      "step": 11929
    },
    {
      "epoch": 1.2656482070867812,
      "grad_norm": 0.356014983545852,
      "learning_rate": 4.866050897364802e-05,
      "loss": 1.8019,
      "num_input_tokens_seen": 9386116864,
      "step": 11930
    },
    {
      "epoch": 1.2657542966263526,
      "grad_norm": 0.5627895637715566,
      "learning_rate": 4.866028453314673e-05,
      "loss": 1.6955,
      "num_input_tokens_seen": 9386903648,
      "step": 11931
    },
    {
      "epoch": 1.2658603861659241,
      "grad_norm": 0.3973899976637872,
      "learning_rate": 4.8660060074361465e-05,
      "loss": 1.8996,
      "num_input_tokens_seen": 9387690400,
      "step": 11932
    },
    {
      "epoch": 1.2659664757054954,
      "grad_norm": 0.3805913616088656,
      "learning_rate": 4.8659835597292405e-05,
      "loss": 1.8012,
      "num_input_tokens_seen": 9388477104,
      "step": 11933
    },
    {
      "epoch": 1.2660725652450668,
      "grad_norm": 0.533495112983259,
      "learning_rate": 4.8659611101939705e-05,
      "loss": 1.6872,
      "num_input_tokens_seen": 9389263776,
      "step": 11934
    },
    {
      "epoch": 1.2661786547846383,
      "grad_norm": 0.3819217006180026,
      "learning_rate": 4.8659386588303554e-05,
      "loss": 1.7341,
      "num_input_tokens_seen": 9390050560,
      "step": 11935
    },
    {
      "epoch": 1.2662847443242096,
      "grad_norm": 0.536674714722696,
      "learning_rate": 4.8659162056384137e-05,
      "loss": 1.9609,
      "num_input_tokens_seen": 9390837344,
      "step": 11936
    },
    {
      "epoch": 1.266390833863781,
      "grad_norm": 0.3603340012353644,
      "learning_rate": 4.86589375061816e-05,
      "loss": 1.7598,
      "num_input_tokens_seen": 9391624112,
      "step": 11937
    },
    {
      "epoch": 1.2664969234033525,
      "grad_norm": 0.512985064995052,
      "learning_rate": 4.865871293769614e-05,
      "loss": 1.7243,
      "num_input_tokens_seen": 9392410896,
      "step": 11938
    },
    {
      "epoch": 1.2666030129429238,
      "grad_norm": 0.42973220430918185,
      "learning_rate": 4.8658488350927914e-05,
      "loss": 1.6907,
      "num_input_tokens_seen": 9393197760,
      "step": 11939
    },
    {
      "epoch": 1.2667091024824952,
      "grad_norm": 0.3991883783246379,
      "learning_rate": 4.86582637458771e-05,
      "loss": 1.7795,
      "num_input_tokens_seen": 9393984592,
      "step": 11940
    },
    {
      "epoch": 1.2668151920220665,
      "grad_norm": 0.40218734705679327,
      "learning_rate": 4.865803912254388e-05,
      "loss": 1.826,
      "num_input_tokens_seen": 9394771440,
      "step": 11941
    },
    {
      "epoch": 1.266921281561638,
      "grad_norm": 0.3958582364887605,
      "learning_rate": 4.865781448092842e-05,
      "loss": 1.7363,
      "num_input_tokens_seen": 9395558128,
      "step": 11942
    },
    {
      "epoch": 1.2670273711012094,
      "grad_norm": 0.4055339083200228,
      "learning_rate": 4.865758982103089e-05,
      "loss": 1.7745,
      "num_input_tokens_seen": 9396344848,
      "step": 11943
    },
    {
      "epoch": 1.267133460640781,
      "grad_norm": 0.3517400571419705,
      "learning_rate": 4.865736514285147e-05,
      "loss": 1.6804,
      "num_input_tokens_seen": 9397131616,
      "step": 11944
    },
    {
      "epoch": 1.2672395501803522,
      "grad_norm": 0.35147141340135896,
      "learning_rate": 4.865714044639034e-05,
      "loss": 1.6151,
      "num_input_tokens_seen": 9397918384,
      "step": 11945
    },
    {
      "epoch": 1.2673456397199236,
      "grad_norm": 0.4242438967199455,
      "learning_rate": 4.8656915731647665e-05,
      "loss": 1.8078,
      "num_input_tokens_seen": 9398705136,
      "step": 11946
    },
    {
      "epoch": 1.267451729259495,
      "grad_norm": 0.3883464885038138,
      "learning_rate": 4.865669099862362e-05,
      "loss": 1.7167,
      "num_input_tokens_seen": 9399491952,
      "step": 11947
    },
    {
      "epoch": 1.2675578187990664,
      "grad_norm": 0.46286638175121964,
      "learning_rate": 4.865646624731837e-05,
      "loss": 1.8687,
      "num_input_tokens_seen": 9400278656,
      "step": 11948
    },
    {
      "epoch": 1.2676639083386378,
      "grad_norm": 0.4126631610057919,
      "learning_rate": 4.86562414777321e-05,
      "loss": 1.6726,
      "num_input_tokens_seen": 9401065424,
      "step": 11949
    },
    {
      "epoch": 1.2677699978782093,
      "grad_norm": 0.5025964321632673,
      "learning_rate": 4.865601668986499e-05,
      "loss": 1.7462,
      "num_input_tokens_seen": 9401852176,
      "step": 11950
    },
    {
      "epoch": 1.2678760874177806,
      "grad_norm": 0.42750165225281356,
      "learning_rate": 4.86557918837172e-05,
      "loss": 1.8944,
      "num_input_tokens_seen": 9402638944,
      "step": 11951
    },
    {
      "epoch": 1.267982176957352,
      "grad_norm": 0.4981516336297324,
      "learning_rate": 4.8655567059288896e-05,
      "loss": 1.8101,
      "num_input_tokens_seen": 9403425664,
      "step": 11952
    },
    {
      "epoch": 1.2680882664969233,
      "grad_norm": 0.550982131509499,
      "learning_rate": 4.8655342216580277e-05,
      "loss": 2.0104,
      "num_input_tokens_seen": 9404212400,
      "step": 11953
    },
    {
      "epoch": 1.2681943560364948,
      "grad_norm": 0.4202506030663543,
      "learning_rate": 4.865511735559149e-05,
      "loss": 1.6888,
      "num_input_tokens_seen": 9404999184,
      "step": 11954
    },
    {
      "epoch": 1.2683004455760662,
      "grad_norm": 0.43485502905200085,
      "learning_rate": 4.8654892476322736e-05,
      "loss": 1.6434,
      "num_input_tokens_seen": 9405786000,
      "step": 11955
    },
    {
      "epoch": 1.2684065351156377,
      "grad_norm": 0.415835552271955,
      "learning_rate": 4.8654667578774174e-05,
      "loss": 1.6699,
      "num_input_tokens_seen": 9406572752,
      "step": 11956
    },
    {
      "epoch": 1.268512624655209,
      "grad_norm": 0.4720293696249986,
      "learning_rate": 4.865444266294598e-05,
      "loss": 1.7547,
      "num_input_tokens_seen": 9407359440,
      "step": 11957
    },
    {
      "epoch": 1.2686187141947805,
      "grad_norm": 0.3999188766554653,
      "learning_rate": 4.865421772883832e-05,
      "loss": 1.6413,
      "num_input_tokens_seen": 9408146160,
      "step": 11958
    },
    {
      "epoch": 1.2687248037343517,
      "grad_norm": 0.37868492776683954,
      "learning_rate": 4.8653992776451376e-05,
      "loss": 1.7493,
      "num_input_tokens_seen": 9408932912,
      "step": 11959
    },
    {
      "epoch": 1.2688308932739232,
      "grad_norm": 0.4648689344044082,
      "learning_rate": 4.8653767805785324e-05,
      "loss": 1.7608,
      "num_input_tokens_seen": 9409719632,
      "step": 11960
    },
    {
      "epoch": 1.2689369828134947,
      "grad_norm": 0.4336808628553065,
      "learning_rate": 4.865354281684033e-05,
      "loss": 1.6969,
      "num_input_tokens_seen": 9410506496,
      "step": 11961
    },
    {
      "epoch": 1.2690430723530661,
      "grad_norm": 0.43633474163517916,
      "learning_rate": 4.865331780961657e-05,
      "loss": 1.7844,
      "num_input_tokens_seen": 9411293200,
      "step": 11962
    },
    {
      "epoch": 1.2691491618926374,
      "grad_norm": 0.4638355231067889,
      "learning_rate": 4.865309278411423e-05,
      "loss": 1.8104,
      "num_input_tokens_seen": 9412079936,
      "step": 11963
    },
    {
      "epoch": 1.2692552514322089,
      "grad_norm": 0.45184024644615306,
      "learning_rate": 4.865286774033346e-05,
      "loss": 1.7439,
      "num_input_tokens_seen": 9412866752,
      "step": 11964
    },
    {
      "epoch": 1.26936134097178,
      "grad_norm": 0.42303847677563816,
      "learning_rate": 4.8652642678274464e-05,
      "loss": 1.8167,
      "num_input_tokens_seen": 9413653552,
      "step": 11965
    },
    {
      "epoch": 1.2694674305113516,
      "grad_norm": 0.3816930667108699,
      "learning_rate": 4.865241759793739e-05,
      "loss": 1.6868,
      "num_input_tokens_seen": 9414440288,
      "step": 11966
    },
    {
      "epoch": 1.269573520050923,
      "grad_norm": 0.39953053560108254,
      "learning_rate": 4.8652192499322425e-05,
      "loss": 1.7747,
      "num_input_tokens_seen": 9415227088,
      "step": 11967
    },
    {
      "epoch": 1.2696796095904943,
      "grad_norm": 0.46783894348431215,
      "learning_rate": 4.8651967382429735e-05,
      "loss": 1.751,
      "num_input_tokens_seen": 9416013808,
      "step": 11968
    },
    {
      "epoch": 1.2697856991300658,
      "grad_norm": 0.39503001887259914,
      "learning_rate": 4.8651742247259504e-05,
      "loss": 1.9288,
      "num_input_tokens_seen": 9416800560,
      "step": 11969
    },
    {
      "epoch": 1.2698917886696373,
      "grad_norm": 0.3851607948290117,
      "learning_rate": 4.86515170938119e-05,
      "loss": 1.7359,
      "num_input_tokens_seen": 9417587296,
      "step": 11970
    },
    {
      "epoch": 1.2699978782092085,
      "grad_norm": 0.5069417780348422,
      "learning_rate": 4.8651291922087095e-05,
      "loss": 1.7242,
      "num_input_tokens_seen": 9418373952,
      "step": 11971
    },
    {
      "epoch": 1.27010396774878,
      "grad_norm": 0.4468387352382256,
      "learning_rate": 4.865106673208526e-05,
      "loss": 1.7221,
      "num_input_tokens_seen": 9419160752,
      "step": 11972
    },
    {
      "epoch": 1.2702100572883515,
      "grad_norm": 0.428132037326381,
      "learning_rate": 4.865084152380659e-05,
      "loss": 1.8327,
      "num_input_tokens_seen": 9419947520,
      "step": 11973
    },
    {
      "epoch": 1.2703161468279227,
      "grad_norm": 0.4001219172058452,
      "learning_rate": 4.8650616297251226e-05,
      "loss": 1.8542,
      "num_input_tokens_seen": 9420734288,
      "step": 11974
    },
    {
      "epoch": 1.2704222363674942,
      "grad_norm": 0.48744402050425595,
      "learning_rate": 4.865039105241937e-05,
      "loss": 1.838,
      "num_input_tokens_seen": 9421520992,
      "step": 11975
    },
    {
      "epoch": 1.2705283259070654,
      "grad_norm": 0.44922314017919796,
      "learning_rate": 4.8650165789311184e-05,
      "loss": 1.9649,
      "num_input_tokens_seen": 9422307680,
      "step": 11976
    },
    {
      "epoch": 1.270634415446637,
      "grad_norm": 0.39729174847577764,
      "learning_rate": 4.864994050792685e-05,
      "loss": 1.7259,
      "num_input_tokens_seen": 9423094384,
      "step": 11977
    },
    {
      "epoch": 1.2707405049862084,
      "grad_norm": 0.4136880875555339,
      "learning_rate": 4.864971520826653e-05,
      "loss": 1.8501,
      "num_input_tokens_seen": 9423881088,
      "step": 11978
    },
    {
      "epoch": 1.2708465945257799,
      "grad_norm": 0.4043308175589628,
      "learning_rate": 4.8649489890330404e-05,
      "loss": 1.703,
      "num_input_tokens_seen": 9424667920,
      "step": 11979
    },
    {
      "epoch": 1.2709526840653511,
      "grad_norm": 0.5365134279055093,
      "learning_rate": 4.8649264554118644e-05,
      "loss": 1.927,
      "num_input_tokens_seen": 9425454576,
      "step": 11980
    },
    {
      "epoch": 1.2710587736049226,
      "grad_norm": 0.4364653403747014,
      "learning_rate": 4.864903919963143e-05,
      "loss": 1.7995,
      "num_input_tokens_seen": 9426241344,
      "step": 11981
    },
    {
      "epoch": 1.2711648631444938,
      "grad_norm": 0.6229617481246222,
      "learning_rate": 4.8648813826868924e-05,
      "loss": 1.8207,
      "num_input_tokens_seen": 9427028080,
      "step": 11982
    },
    {
      "epoch": 1.2712709526840653,
      "grad_norm": 0.4831709098281969,
      "learning_rate": 4.8648588435831324e-05,
      "loss": 1.8955,
      "num_input_tokens_seen": 9427814832,
      "step": 11983
    },
    {
      "epoch": 1.2713770422236368,
      "grad_norm": 0.45708450514461396,
      "learning_rate": 4.864836302651877e-05,
      "loss": 1.6652,
      "num_input_tokens_seen": 9428601696,
      "step": 11984
    },
    {
      "epoch": 1.2714831317632083,
      "grad_norm": 0.5390125054259833,
      "learning_rate": 4.864813759893147e-05,
      "loss": 1.8572,
      "num_input_tokens_seen": 9429388464,
      "step": 11985
    },
    {
      "epoch": 1.2715892213027795,
      "grad_norm": 0.4148048173500555,
      "learning_rate": 4.864791215306957e-05,
      "loss": 1.6217,
      "num_input_tokens_seen": 9430175280,
      "step": 11986
    },
    {
      "epoch": 1.271695310842351,
      "grad_norm": 0.4634267919519729,
      "learning_rate": 4.864768668893327e-05,
      "loss": 1.8454,
      "num_input_tokens_seen": 9430962096,
      "step": 11987
    },
    {
      "epoch": 1.2718014003819222,
      "grad_norm": 0.49138692885424246,
      "learning_rate": 4.8647461206522724e-05,
      "loss": 1.8075,
      "num_input_tokens_seen": 9431748912,
      "step": 11988
    },
    {
      "epoch": 1.2719074899214937,
      "grad_norm": 0.5009585507214402,
      "learning_rate": 4.8647235705838125e-05,
      "loss": 1.7048,
      "num_input_tokens_seen": 9432535632,
      "step": 11989
    },
    {
      "epoch": 1.2720135794610652,
      "grad_norm": 0.549446576192868,
      "learning_rate": 4.864701018687963e-05,
      "loss": 1.7656,
      "num_input_tokens_seen": 9433322400,
      "step": 11990
    },
    {
      "epoch": 1.2721196690006367,
      "grad_norm": 0.5692371880479207,
      "learning_rate": 4.8646784649647416e-05,
      "loss": 1.8503,
      "num_input_tokens_seen": 9434109216,
      "step": 11991
    },
    {
      "epoch": 1.272225758540208,
      "grad_norm": 0.4468455078301753,
      "learning_rate": 4.864655909414166e-05,
      "loss": 1.7619,
      "num_input_tokens_seen": 9434895936,
      "step": 11992
    },
    {
      "epoch": 1.2723318480797794,
      "grad_norm": 0.43015993909898237,
      "learning_rate": 4.864633352036254e-05,
      "loss": 1.7581,
      "num_input_tokens_seen": 9435682720,
      "step": 11993
    },
    {
      "epoch": 1.2724379376193506,
      "grad_norm": 0.42816433092997985,
      "learning_rate": 4.8646107928310225e-05,
      "loss": 1.8152,
      "num_input_tokens_seen": 9436469472,
      "step": 11994
    },
    {
      "epoch": 1.2725440271589221,
      "grad_norm": 0.4599061099268887,
      "learning_rate": 4.8645882317984895e-05,
      "loss": 1.809,
      "num_input_tokens_seen": 9437256336,
      "step": 11995
    },
    {
      "epoch": 1.2726501166984936,
      "grad_norm": 0.4106185348720854,
      "learning_rate": 4.864565668938671e-05,
      "loss": 1.7052,
      "num_input_tokens_seen": 9438043040,
      "step": 11996
    },
    {
      "epoch": 1.2727562062380648,
      "grad_norm": 0.3884075519139061,
      "learning_rate": 4.864543104251587e-05,
      "loss": 1.7406,
      "num_input_tokens_seen": 9438829888,
      "step": 11997
    },
    {
      "epoch": 1.2728622957776363,
      "grad_norm": 0.42038703529117655,
      "learning_rate": 4.8645205377372524e-05,
      "loss": 1.816,
      "num_input_tokens_seen": 9439616592,
      "step": 11998
    },
    {
      "epoch": 1.2729683853172078,
      "grad_norm": 0.7087066769464214,
      "learning_rate": 4.8644979693956864e-05,
      "loss": 1.8777,
      "num_input_tokens_seen": 9440403344,
      "step": 11999
    },
    {
      "epoch": 1.273074474856779,
      "grad_norm": 0.3987176778622292,
      "learning_rate": 4.8644753992269055e-05,
      "loss": 1.7229,
      "num_input_tokens_seen": 9441190144,
      "step": 12000
    },
    {
      "epoch": 1.273074474856779,
      "eval_loss": 1.806195855140686,
      "eval_runtime": 66.003,
      "eval_samples_per_second": 45.452,
      "eval_steps_per_second": 0.485,
      "num_input_tokens_seen": 9441190144,
      "step": 12000
    },
    {
      "epoch": 1.2731805643963505,
      "grad_norm": 0.6135461660249139,
      "learning_rate": 4.8644528272309276e-05,
      "loss": 1.6747,
      "num_input_tokens_seen": 9441977008,
      "step": 12001
    },
    {
      "epoch": 1.273286653935922,
      "grad_norm": 0.33987039606926484,
      "learning_rate": 4.86443025340777e-05,
      "loss": 1.6667,
      "num_input_tokens_seen": 9442763744,
      "step": 12002
    },
    {
      "epoch": 1.2733927434754932,
      "grad_norm": 0.7477768944550279,
      "learning_rate": 4.8644076777574496e-05,
      "loss": 1.8906,
      "num_input_tokens_seen": 9443550528,
      "step": 12003
    },
    {
      "epoch": 1.2734988330150647,
      "grad_norm": 0.3577112107846633,
      "learning_rate": 4.864385100279985e-05,
      "loss": 1.7365,
      "num_input_tokens_seen": 9444337296,
      "step": 12004
    },
    {
      "epoch": 1.273604922554636,
      "grad_norm": 0.565981680499621,
      "learning_rate": 4.864362520975392e-05,
      "loss": 1.7428,
      "num_input_tokens_seen": 9445124016,
      "step": 12005
    },
    {
      "epoch": 1.2737110120942075,
      "grad_norm": 0.3511601560935769,
      "learning_rate": 4.86433993984369e-05,
      "loss": 1.6599,
      "num_input_tokens_seen": 9445910784,
      "step": 12006
    },
    {
      "epoch": 1.273817101633779,
      "grad_norm": 0.38302543208120576,
      "learning_rate": 4.8643173568848945e-05,
      "loss": 1.9461,
      "num_input_tokens_seen": 9446697616,
      "step": 12007
    },
    {
      "epoch": 1.2739231911733504,
      "grad_norm": 0.5074171710995469,
      "learning_rate": 4.864294772099025e-05,
      "loss": 1.7194,
      "num_input_tokens_seen": 9447484384,
      "step": 12008
    },
    {
      "epoch": 1.2740292807129217,
      "grad_norm": 0.36202260395964,
      "learning_rate": 4.864272185486097e-05,
      "loss": 1.7423,
      "num_input_tokens_seen": 9448271328,
      "step": 12009
    },
    {
      "epoch": 1.2741353702524931,
      "grad_norm": 0.4498849570261209,
      "learning_rate": 4.864249597046129e-05,
      "loss": 1.8509,
      "num_input_tokens_seen": 9449058160,
      "step": 12010
    },
    {
      "epoch": 1.2742414597920644,
      "grad_norm": 0.4562942213290564,
      "learning_rate": 4.8642270067791385e-05,
      "loss": 1.7186,
      "num_input_tokens_seen": 9449844912,
      "step": 12011
    },
    {
      "epoch": 1.2743475493316359,
      "grad_norm": 0.37095809427567233,
      "learning_rate": 4.864204414685143e-05,
      "loss": 1.7821,
      "num_input_tokens_seen": 9450631680,
      "step": 12012
    },
    {
      "epoch": 1.2744536388712073,
      "grad_norm": 0.5059379651041944,
      "learning_rate": 4.864181820764159e-05,
      "loss": 1.8087,
      "num_input_tokens_seen": 9451418336,
      "step": 12013
    },
    {
      "epoch": 1.2745597284107788,
      "grad_norm": 0.3830997390602132,
      "learning_rate": 4.864159225016205e-05,
      "loss": 1.9007,
      "num_input_tokens_seen": 9452205072,
      "step": 12014
    },
    {
      "epoch": 1.27466581795035,
      "grad_norm": 0.410546036631487,
      "learning_rate": 4.864136627441298e-05,
      "loss": 1.8293,
      "num_input_tokens_seen": 9452991856,
      "step": 12015
    },
    {
      "epoch": 1.2747719074899215,
      "grad_norm": 0.3970234792188743,
      "learning_rate": 4.864114028039456e-05,
      "loss": 1.7306,
      "num_input_tokens_seen": 9453778672,
      "step": 12016
    },
    {
      "epoch": 1.2748779970294928,
      "grad_norm": 0.3840684370434249,
      "learning_rate": 4.864091426810695e-05,
      "loss": 1.7809,
      "num_input_tokens_seen": 9454565376,
      "step": 12017
    },
    {
      "epoch": 1.2749840865690643,
      "grad_norm": 0.5517280575857239,
      "learning_rate": 4.8640688237550347e-05,
      "loss": 1.7265,
      "num_input_tokens_seen": 9455352208,
      "step": 12018
    },
    {
      "epoch": 1.2750901761086357,
      "grad_norm": 0.41406566447957055,
      "learning_rate": 4.864046218872491e-05,
      "loss": 1.7965,
      "num_input_tokens_seen": 9456138992,
      "step": 12019
    },
    {
      "epoch": 1.2751962656482072,
      "grad_norm": 0.666263784980005,
      "learning_rate": 4.8640236121630815e-05,
      "loss": 1.8624,
      "num_input_tokens_seen": 9456925776,
      "step": 12020
    },
    {
      "epoch": 1.2753023551877785,
      "grad_norm": 0.44532860035244687,
      "learning_rate": 4.8640010036268246e-05,
      "loss": 1.9975,
      "num_input_tokens_seen": 9457712592,
      "step": 12021
    },
    {
      "epoch": 1.27540844472735,
      "grad_norm": 0.5904884056855169,
      "learning_rate": 4.8639783932637365e-05,
      "loss": 1.7358,
      "num_input_tokens_seen": 9458499312,
      "step": 12022
    },
    {
      "epoch": 1.2755145342669212,
      "grad_norm": 0.4117018194139404,
      "learning_rate": 4.863955781073835e-05,
      "loss": 1.8013,
      "num_input_tokens_seen": 9459286112,
      "step": 12023
    },
    {
      "epoch": 1.2756206238064927,
      "grad_norm": 0.5117941155015268,
      "learning_rate": 4.8639331670571385e-05,
      "loss": 1.8178,
      "num_input_tokens_seen": 9460072928,
      "step": 12024
    },
    {
      "epoch": 1.2757267133460641,
      "grad_norm": 0.4884364557207597,
      "learning_rate": 4.863910551213663e-05,
      "loss": 1.8382,
      "num_input_tokens_seen": 9460859600,
      "step": 12025
    },
    {
      "epoch": 1.2758328028856356,
      "grad_norm": 0.516582173151462,
      "learning_rate": 4.863887933543427e-05,
      "loss": 1.7556,
      "num_input_tokens_seen": 9461646384,
      "step": 12026
    },
    {
      "epoch": 1.2759388924252069,
      "grad_norm": 0.5482036788106548,
      "learning_rate": 4.863865314046449e-05,
      "loss": 1.6973,
      "num_input_tokens_seen": 9462433232,
      "step": 12027
    },
    {
      "epoch": 1.2760449819647783,
      "grad_norm": 0.352940190871155,
      "learning_rate": 4.863842692722744e-05,
      "loss": 1.6953,
      "num_input_tokens_seen": 9463220000,
      "step": 12028
    },
    {
      "epoch": 1.2761510715043496,
      "grad_norm": 0.4739272078642381,
      "learning_rate": 4.863820069572331e-05,
      "loss": 1.7572,
      "num_input_tokens_seen": 9464006752,
      "step": 12029
    },
    {
      "epoch": 1.276257161043921,
      "grad_norm": 0.4908050779036775,
      "learning_rate": 4.8637974445952275e-05,
      "loss": 1.8815,
      "num_input_tokens_seen": 9464793408,
      "step": 12030
    },
    {
      "epoch": 1.2763632505834925,
      "grad_norm": 0.5229907775695386,
      "learning_rate": 4.86377481779145e-05,
      "loss": 1.8739,
      "num_input_tokens_seen": 9465580112,
      "step": 12031
    },
    {
      "epoch": 1.2764693401230638,
      "grad_norm": 0.3746326526861597,
      "learning_rate": 4.863752189161017e-05,
      "loss": 1.7954,
      "num_input_tokens_seen": 9466366960,
      "step": 12032
    },
    {
      "epoch": 1.2765754296626353,
      "grad_norm": 0.4672344037283819,
      "learning_rate": 4.863729558703946e-05,
      "loss": 1.7629,
      "num_input_tokens_seen": 9467153712,
      "step": 12033
    },
    {
      "epoch": 1.2766815192022067,
      "grad_norm": 0.45692770927636145,
      "learning_rate": 4.863706926420254e-05,
      "loss": 1.9071,
      "num_input_tokens_seen": 9467940480,
      "step": 12034
    },
    {
      "epoch": 1.276787608741778,
      "grad_norm": 0.37613468090854096,
      "learning_rate": 4.8636842923099586e-05,
      "loss": 1.8599,
      "num_input_tokens_seen": 9468727216,
      "step": 12035
    },
    {
      "epoch": 1.2768936982813495,
      "grad_norm": 0.3830275553686769,
      "learning_rate": 4.8636616563730776e-05,
      "loss": 1.7084,
      "num_input_tokens_seen": 9469514048,
      "step": 12036
    },
    {
      "epoch": 1.276999787820921,
      "grad_norm": 0.4035638332902923,
      "learning_rate": 4.8636390186096276e-05,
      "loss": 1.7906,
      "num_input_tokens_seen": 9470300768,
      "step": 12037
    },
    {
      "epoch": 1.2771058773604922,
      "grad_norm": 0.37776661397192346,
      "learning_rate": 4.863616379019627e-05,
      "loss": 1.6985,
      "num_input_tokens_seen": 9471087552,
      "step": 12038
    },
    {
      "epoch": 1.2772119669000637,
      "grad_norm": 0.4681451074733131,
      "learning_rate": 4.8635937376030927e-05,
      "loss": 1.7872,
      "num_input_tokens_seen": 9471874336,
      "step": 12039
    },
    {
      "epoch": 1.277318056439635,
      "grad_norm": 0.38610778137472157,
      "learning_rate": 4.863571094360043e-05,
      "loss": 1.9107,
      "num_input_tokens_seen": 9472661104,
      "step": 12040
    },
    {
      "epoch": 1.2774241459792064,
      "grad_norm": 0.39130311647545357,
      "learning_rate": 4.863548449290495e-05,
      "loss": 1.8071,
      "num_input_tokens_seen": 9473447856,
      "step": 12041
    },
    {
      "epoch": 1.2775302355187779,
      "grad_norm": 0.5039750249648692,
      "learning_rate": 4.8635258023944656e-05,
      "loss": 1.7713,
      "num_input_tokens_seen": 9474234688,
      "step": 12042
    },
    {
      "epoch": 1.2776363250583493,
      "grad_norm": 0.385626959765025,
      "learning_rate": 4.863503153671973e-05,
      "loss": 1.7202,
      "num_input_tokens_seen": 9475021472,
      "step": 12043
    },
    {
      "epoch": 1.2777424145979206,
      "grad_norm": 0.445360328676299,
      "learning_rate": 4.863480503123035e-05,
      "loss": 1.748,
      "num_input_tokens_seen": 9475808256,
      "step": 12044
    },
    {
      "epoch": 1.277848504137492,
      "grad_norm": 0.3793046401452663,
      "learning_rate": 4.863457850747668e-05,
      "loss": 1.7654,
      "num_input_tokens_seen": 9476595056,
      "step": 12045
    },
    {
      "epoch": 1.2779545936770633,
      "grad_norm": 0.3850531787848143,
      "learning_rate": 4.86343519654589e-05,
      "loss": 1.7008,
      "num_input_tokens_seen": 9477381872,
      "step": 12046
    },
    {
      "epoch": 1.2780606832166348,
      "grad_norm": 0.33825200183435983,
      "learning_rate": 4.863412540517719e-05,
      "loss": 1.6181,
      "num_input_tokens_seen": 9478168704,
      "step": 12047
    },
    {
      "epoch": 1.2781667727562063,
      "grad_norm": 0.3698065003833637,
      "learning_rate": 4.863389882663173e-05,
      "loss": 1.9594,
      "num_input_tokens_seen": 9478955392,
      "step": 12048
    },
    {
      "epoch": 1.2782728622957777,
      "grad_norm": 0.4530884922141259,
      "learning_rate": 4.8633672229822676e-05,
      "loss": 1.8821,
      "num_input_tokens_seen": 9479742208,
      "step": 12049
    },
    {
      "epoch": 1.278378951835349,
      "grad_norm": 0.3846722267843845,
      "learning_rate": 4.863344561475022e-05,
      "loss": 1.8279,
      "num_input_tokens_seen": 9480528928,
      "step": 12050
    },
    {
      "epoch": 1.2784850413749205,
      "grad_norm": 0.37281791628139954,
      "learning_rate": 4.863321898141452e-05,
      "loss": 1.8646,
      "num_input_tokens_seen": 9481315632,
      "step": 12051
    },
    {
      "epoch": 1.2785911309144917,
      "grad_norm": 0.39541673236290514,
      "learning_rate": 4.863299232981576e-05,
      "loss": 1.7496,
      "num_input_tokens_seen": 9482102384,
      "step": 12052
    },
    {
      "epoch": 1.2786972204540632,
      "grad_norm": 0.3529866993469734,
      "learning_rate": 4.863276565995413e-05,
      "loss": 1.7855,
      "num_input_tokens_seen": 9482889152,
      "step": 12053
    },
    {
      "epoch": 1.2788033099936347,
      "grad_norm": 0.38527694765007464,
      "learning_rate": 4.863253897182979e-05,
      "loss": 1.7003,
      "num_input_tokens_seen": 9483675888,
      "step": 12054
    },
    {
      "epoch": 1.2789093995332061,
      "grad_norm": 0.48663138396475336,
      "learning_rate": 4.863231226544291e-05,
      "loss": 1.8444,
      "num_input_tokens_seen": 9484462640,
      "step": 12055
    },
    {
      "epoch": 1.2790154890727774,
      "grad_norm": 0.39292292164212783,
      "learning_rate": 4.8632085540793685e-05,
      "loss": 1.838,
      "num_input_tokens_seen": 9485249488,
      "step": 12056
    },
    {
      "epoch": 1.2791215786123489,
      "grad_norm": 0.4115991916119656,
      "learning_rate": 4.8631858797882264e-05,
      "loss": 1.7429,
      "num_input_tokens_seen": 9486036272,
      "step": 12057
    },
    {
      "epoch": 1.2792276681519201,
      "grad_norm": 0.5833326807012346,
      "learning_rate": 4.863163203670884e-05,
      "loss": 1.8571,
      "num_input_tokens_seen": 9486823056,
      "step": 12058
    },
    {
      "epoch": 1.2793337576914916,
      "grad_norm": 0.5048295257635329,
      "learning_rate": 4.863140525727359e-05,
      "loss": 1.8068,
      "num_input_tokens_seen": 9487609808,
      "step": 12059
    },
    {
      "epoch": 1.279439847231063,
      "grad_norm": 0.510780306049493,
      "learning_rate": 4.8631178459576675e-05,
      "loss": 1.7817,
      "num_input_tokens_seen": 9488396560,
      "step": 12060
    },
    {
      "epoch": 1.2795459367706346,
      "grad_norm": 0.36135493120877926,
      "learning_rate": 4.8630951643618285e-05,
      "loss": 1.8789,
      "num_input_tokens_seen": 9489183328,
      "step": 12061
    },
    {
      "epoch": 1.2796520263102058,
      "grad_norm": 0.6217489729005687,
      "learning_rate": 4.863072480939858e-05,
      "loss": 1.7739,
      "num_input_tokens_seen": 9489970128,
      "step": 12062
    },
    {
      "epoch": 1.2797581158497773,
      "grad_norm": 0.35371823537943325,
      "learning_rate": 4.863049795691775e-05,
      "loss": 1.7499,
      "num_input_tokens_seen": 9490756976,
      "step": 12063
    },
    {
      "epoch": 1.2798642053893485,
      "grad_norm": 0.39505912173378366,
      "learning_rate": 4.863027108617597e-05,
      "loss": 1.6566,
      "num_input_tokens_seen": 9491543824,
      "step": 12064
    },
    {
      "epoch": 1.27997029492892,
      "grad_norm": 0.44561442234122933,
      "learning_rate": 4.86300441971734e-05,
      "loss": 1.8258,
      "num_input_tokens_seen": 9492330592,
      "step": 12065
    },
    {
      "epoch": 1.2800763844684915,
      "grad_norm": 0.3456735717871135,
      "learning_rate": 4.862981728991023e-05,
      "loss": 1.8168,
      "num_input_tokens_seen": 9493117344,
      "step": 12066
    },
    {
      "epoch": 1.2801824740080627,
      "grad_norm": 0.5206109866241387,
      "learning_rate": 4.8629590364386634e-05,
      "loss": 1.9322,
      "num_input_tokens_seen": 9493904064,
      "step": 12067
    },
    {
      "epoch": 1.2802885635476342,
      "grad_norm": 0.39107457494270087,
      "learning_rate": 4.862936342060278e-05,
      "loss": 1.7492,
      "num_input_tokens_seen": 9494690816,
      "step": 12068
    },
    {
      "epoch": 1.2803946530872057,
      "grad_norm": 0.567113654966515,
      "learning_rate": 4.862913645855885e-05,
      "loss": 1.7783,
      "num_input_tokens_seen": 9495477552,
      "step": 12069
    },
    {
      "epoch": 1.280500742626777,
      "grad_norm": 0.38142321506642507,
      "learning_rate": 4.862890947825501e-05,
      "loss": 1.6083,
      "num_input_tokens_seen": 9496264320,
      "step": 12070
    },
    {
      "epoch": 1.2806068321663484,
      "grad_norm": 0.4261713234417553,
      "learning_rate": 4.862868247969144e-05,
      "loss": 1.871,
      "num_input_tokens_seen": 9497051040,
      "step": 12071
    },
    {
      "epoch": 1.2807129217059199,
      "grad_norm": 0.4095896202134704,
      "learning_rate": 4.862845546286833e-05,
      "loss": 1.8482,
      "num_input_tokens_seen": 9497837712,
      "step": 12072
    },
    {
      "epoch": 1.2808190112454911,
      "grad_norm": 0.5740800153157575,
      "learning_rate": 4.862822842778584e-05,
      "loss": 1.8724,
      "num_input_tokens_seen": 9498624464,
      "step": 12073
    },
    {
      "epoch": 1.2809251007850626,
      "grad_norm": 0.6509052988550499,
      "learning_rate": 4.862800137444414e-05,
      "loss": 1.9607,
      "num_input_tokens_seen": 9499411216,
      "step": 12074
    },
    {
      "epoch": 1.2810311903246339,
      "grad_norm": 0.4040481436079342,
      "learning_rate": 4.862777430284342e-05,
      "loss": 1.7811,
      "num_input_tokens_seen": 9500198000,
      "step": 12075
    },
    {
      "epoch": 1.2811372798642053,
      "grad_norm": 0.6212566990054105,
      "learning_rate": 4.8627547212983856e-05,
      "loss": 1.9013,
      "num_input_tokens_seen": 9500984752,
      "step": 12076
    },
    {
      "epoch": 1.2812433694037768,
      "grad_norm": 0.35191624279265676,
      "learning_rate": 4.86273201048656e-05,
      "loss": 1.7322,
      "num_input_tokens_seen": 9501771616,
      "step": 12077
    },
    {
      "epoch": 1.2813494589433483,
      "grad_norm": 0.5365445281905067,
      "learning_rate": 4.862709297848886e-05,
      "loss": 1.6404,
      "num_input_tokens_seen": 9502558384,
      "step": 12078
    },
    {
      "epoch": 1.2814555484829195,
      "grad_norm": 0.356438272405236,
      "learning_rate": 4.862686583385378e-05,
      "loss": 1.6358,
      "num_input_tokens_seen": 9503345200,
      "step": 12079
    },
    {
      "epoch": 1.281561638022491,
      "grad_norm": 0.39982386512629586,
      "learning_rate": 4.8626638670960564e-05,
      "loss": 1.7295,
      "num_input_tokens_seen": 9504131984,
      "step": 12080
    },
    {
      "epoch": 1.2816677275620623,
      "grad_norm": 0.4176984956547792,
      "learning_rate": 4.8626411489809374e-05,
      "loss": 1.815,
      "num_input_tokens_seen": 9504918736,
      "step": 12081
    },
    {
      "epoch": 1.2817738171016337,
      "grad_norm": 0.4253208539028614,
      "learning_rate": 4.862618429040039e-05,
      "loss": 1.8282,
      "num_input_tokens_seen": 9505705376,
      "step": 12082
    },
    {
      "epoch": 1.2818799066412052,
      "grad_norm": 0.36127461459802035,
      "learning_rate": 4.862595707273377e-05,
      "loss": 1.7023,
      "num_input_tokens_seen": 9506492096,
      "step": 12083
    },
    {
      "epoch": 1.2819859961807767,
      "grad_norm": 0.3896865382053703,
      "learning_rate": 4.862572983680972e-05,
      "loss": 1.809,
      "num_input_tokens_seen": 9507278880,
      "step": 12084
    },
    {
      "epoch": 1.282092085720348,
      "grad_norm": 0.5479474652732749,
      "learning_rate": 4.862550258262839e-05,
      "loss": 1.8014,
      "num_input_tokens_seen": 9508065568,
      "step": 12085
    },
    {
      "epoch": 1.2821981752599194,
      "grad_norm": 0.4119986405432604,
      "learning_rate": 4.8625275310189965e-05,
      "loss": 1.7311,
      "num_input_tokens_seen": 9508852304,
      "step": 12086
    },
    {
      "epoch": 1.2823042647994907,
      "grad_norm": 0.5175997935485178,
      "learning_rate": 4.862504801949463e-05,
      "loss": 1.7675,
      "num_input_tokens_seen": 9509639008,
      "step": 12087
    },
    {
      "epoch": 1.2824103543390621,
      "grad_norm": 0.36117150247210844,
      "learning_rate": 4.862482071054253e-05,
      "loss": 1.7059,
      "num_input_tokens_seen": 9510425840,
      "step": 12088
    },
    {
      "epoch": 1.2825164438786336,
      "grad_norm": 0.6273671737322194,
      "learning_rate": 4.862459338333387e-05,
      "loss": 1.8042,
      "num_input_tokens_seen": 9511212560,
      "step": 12089
    },
    {
      "epoch": 1.282622533418205,
      "grad_norm": 0.5727505856514035,
      "learning_rate": 4.862436603786883e-05,
      "loss": 1.7807,
      "num_input_tokens_seen": 9511999328,
      "step": 12090
    },
    {
      "epoch": 1.2827286229577763,
      "grad_norm": 0.47717168329450016,
      "learning_rate": 4.8624138674147565e-05,
      "loss": 1.9564,
      "num_input_tokens_seen": 9512786160,
      "step": 12091
    },
    {
      "epoch": 1.2828347124973478,
      "grad_norm": 0.6352609123665314,
      "learning_rate": 4.8623911292170256e-05,
      "loss": 1.8116,
      "num_input_tokens_seen": 9513572976,
      "step": 12092
    },
    {
      "epoch": 1.282940802036919,
      "grad_norm": 0.43219832890824406,
      "learning_rate": 4.8623683891937085e-05,
      "loss": 1.6735,
      "num_input_tokens_seen": 9514359776,
      "step": 12093
    },
    {
      "epoch": 1.2830468915764905,
      "grad_norm": 0.6222560071807953,
      "learning_rate": 4.862345647344822e-05,
      "loss": 1.8535,
      "num_input_tokens_seen": 9515146560,
      "step": 12094
    },
    {
      "epoch": 1.283152981116062,
      "grad_norm": 0.44408530416048403,
      "learning_rate": 4.862322903670385e-05,
      "loss": 1.6964,
      "num_input_tokens_seen": 9515933440,
      "step": 12095
    },
    {
      "epoch": 1.2832590706556333,
      "grad_norm": 0.4333767660555669,
      "learning_rate": 4.862300158170413e-05,
      "loss": 1.7941,
      "num_input_tokens_seen": 9516720208,
      "step": 12096
    },
    {
      "epoch": 1.2833651601952047,
      "grad_norm": 0.42500523114019145,
      "learning_rate": 4.8622774108449254e-05,
      "loss": 1.6671,
      "num_input_tokens_seen": 9517507072,
      "step": 12097
    },
    {
      "epoch": 1.2834712497347762,
      "grad_norm": 0.4307635723998257,
      "learning_rate": 4.862254661693939e-05,
      "loss": 1.7976,
      "num_input_tokens_seen": 9518293776,
      "step": 12098
    },
    {
      "epoch": 1.2835773392743475,
      "grad_norm": 0.4073701010907266,
      "learning_rate": 4.8622319107174715e-05,
      "loss": 1.7628,
      "num_input_tokens_seen": 9519080464,
      "step": 12099
    },
    {
      "epoch": 1.283683428813919,
      "grad_norm": 0.4352356520255843,
      "learning_rate": 4.86220915791554e-05,
      "loss": 1.8261,
      "num_input_tokens_seen": 9519867200,
      "step": 12100
    },
    {
      "epoch": 1.2837895183534904,
      "grad_norm": 0.39538341984893555,
      "learning_rate": 4.8621864032881634e-05,
      "loss": 1.8152,
      "num_input_tokens_seen": 9520654000,
      "step": 12101
    },
    {
      "epoch": 1.2838956078930617,
      "grad_norm": 0.5780165023168696,
      "learning_rate": 4.862163646835358e-05,
      "loss": 1.8801,
      "num_input_tokens_seen": 9521440768,
      "step": 12102
    },
    {
      "epoch": 1.2840016974326331,
      "grad_norm": 0.40477117650037664,
      "learning_rate": 4.862140888557143e-05,
      "loss": 1.8175,
      "num_input_tokens_seen": 9522227552,
      "step": 12103
    },
    {
      "epoch": 1.2841077869722046,
      "grad_norm": 0.41152287784812275,
      "learning_rate": 4.862118128453533e-05,
      "loss": 1.7463,
      "num_input_tokens_seen": 9523014336,
      "step": 12104
    },
    {
      "epoch": 1.2842138765117759,
      "grad_norm": 0.581078793037788,
      "learning_rate": 4.8620953665245486e-05,
      "loss": 1.7973,
      "num_input_tokens_seen": 9523801056,
      "step": 12105
    },
    {
      "epoch": 1.2843199660513474,
      "grad_norm": 0.4109623267722728,
      "learning_rate": 4.8620726027702055e-05,
      "loss": 1.8272,
      "num_input_tokens_seen": 9524587824,
      "step": 12106
    },
    {
      "epoch": 1.2844260555909188,
      "grad_norm": 0.5879384041147667,
      "learning_rate": 4.862049837190523e-05,
      "loss": 1.7024,
      "num_input_tokens_seen": 9525374576,
      "step": 12107
    },
    {
      "epoch": 1.28453214513049,
      "grad_norm": 0.38281008458835014,
      "learning_rate": 4.862027069785517e-05,
      "loss": 1.6844,
      "num_input_tokens_seen": 9526161328,
      "step": 12108
    },
    {
      "epoch": 1.2846382346700616,
      "grad_norm": 0.3741790337985176,
      "learning_rate": 4.862004300555206e-05,
      "loss": 1.6863,
      "num_input_tokens_seen": 9526948080,
      "step": 12109
    },
    {
      "epoch": 1.2847443242096328,
      "grad_norm": 0.5631574834584309,
      "learning_rate": 4.8619815294996076e-05,
      "loss": 1.726,
      "num_input_tokens_seen": 9527734880,
      "step": 12110
    },
    {
      "epoch": 1.2848504137492043,
      "grad_norm": 0.4637121375257235,
      "learning_rate": 4.8619587566187385e-05,
      "loss": 1.864,
      "num_input_tokens_seen": 9528521744,
      "step": 12111
    },
    {
      "epoch": 1.2849565032887758,
      "grad_norm": 0.46210376532639164,
      "learning_rate": 4.861935981912618e-05,
      "loss": 1.8391,
      "num_input_tokens_seen": 9529308528,
      "step": 12112
    },
    {
      "epoch": 1.2850625928283472,
      "grad_norm": 0.4470838863005656,
      "learning_rate": 4.861913205381261e-05,
      "loss": 1.7953,
      "num_input_tokens_seen": 9530095376,
      "step": 12113
    },
    {
      "epoch": 1.2851686823679185,
      "grad_norm": 0.5776810349666978,
      "learning_rate": 4.861890427024688e-05,
      "loss": 1.7526,
      "num_input_tokens_seen": 9530882080,
      "step": 12114
    },
    {
      "epoch": 1.28527477190749,
      "grad_norm": 0.38704512052951756,
      "learning_rate": 4.8618676468429146e-05,
      "loss": 1.8727,
      "num_input_tokens_seen": 9531668880,
      "step": 12115
    },
    {
      "epoch": 1.2853808614470612,
      "grad_norm": 0.5713187845816454,
      "learning_rate": 4.861844864835961e-05,
      "loss": 1.6488,
      "num_input_tokens_seen": 9532455600,
      "step": 12116
    },
    {
      "epoch": 1.2854869509866327,
      "grad_norm": 0.4433132739361877,
      "learning_rate": 4.861822081003841e-05,
      "loss": 1.6662,
      "num_input_tokens_seen": 9533242368,
      "step": 12117
    },
    {
      "epoch": 1.2855930405262042,
      "grad_norm": 0.41018079138386654,
      "learning_rate": 4.861799295346575e-05,
      "loss": 1.6898,
      "num_input_tokens_seen": 9534029184,
      "step": 12118
    },
    {
      "epoch": 1.2856991300657756,
      "grad_norm": 0.7118980700246468,
      "learning_rate": 4.8617765078641796e-05,
      "loss": 1.8067,
      "num_input_tokens_seen": 9534815888,
      "step": 12119
    },
    {
      "epoch": 1.2858052196053469,
      "grad_norm": 0.4122561011542942,
      "learning_rate": 4.861753718556673e-05,
      "loss": 1.7475,
      "num_input_tokens_seen": 9535602704,
      "step": 12120
    },
    {
      "epoch": 1.2859113091449184,
      "grad_norm": 0.47637770380364675,
      "learning_rate": 4.861730927424072e-05,
      "loss": 1.7124,
      "num_input_tokens_seen": 9536389600,
      "step": 12121
    },
    {
      "epoch": 1.2860173986844896,
      "grad_norm": 0.48217289897357346,
      "learning_rate": 4.861708134466395e-05,
      "loss": 1.8276,
      "num_input_tokens_seen": 9537176384,
      "step": 12122
    },
    {
      "epoch": 1.286123488224061,
      "grad_norm": 0.37118129089975926,
      "learning_rate": 4.8616853396836586e-05,
      "loss": 1.78,
      "num_input_tokens_seen": 9537963136,
      "step": 12123
    },
    {
      "epoch": 1.2862295777636326,
      "grad_norm": 0.35840577932885076,
      "learning_rate": 4.8616625430758815e-05,
      "loss": 1.7578,
      "num_input_tokens_seen": 9538749840,
      "step": 12124
    },
    {
      "epoch": 1.286335667303204,
      "grad_norm": 0.4623312778001052,
      "learning_rate": 4.8616397446430805e-05,
      "loss": 1.746,
      "num_input_tokens_seen": 9539536576,
      "step": 12125
    },
    {
      "epoch": 1.2864417568427753,
      "grad_norm": 0.33337264366382846,
      "learning_rate": 4.8616169443852744e-05,
      "loss": 1.8118,
      "num_input_tokens_seen": 9540323376,
      "step": 12126
    },
    {
      "epoch": 1.2865478463823468,
      "grad_norm": 0.3425359326044791,
      "learning_rate": 4.86159414230248e-05,
      "loss": 1.7151,
      "num_input_tokens_seen": 9541110112,
      "step": 12127
    },
    {
      "epoch": 1.286653935921918,
      "grad_norm": 0.40713269528055795,
      "learning_rate": 4.8615713383947145e-05,
      "loss": 1.7385,
      "num_input_tokens_seen": 9541896928,
      "step": 12128
    },
    {
      "epoch": 1.2867600254614895,
      "grad_norm": 0.37279119550499296,
      "learning_rate": 4.861548532661996e-05,
      "loss": 1.8313,
      "num_input_tokens_seen": 9542683696,
      "step": 12129
    },
    {
      "epoch": 1.286866115001061,
      "grad_norm": 0.40423133943630285,
      "learning_rate": 4.861525725104342e-05,
      "loss": 1.7964,
      "num_input_tokens_seen": 9543470512,
      "step": 12130
    },
    {
      "epoch": 1.2869722045406322,
      "grad_norm": 0.44207882839184665,
      "learning_rate": 4.86150291572177e-05,
      "loss": 1.76,
      "num_input_tokens_seen": 9544257360,
      "step": 12131
    },
    {
      "epoch": 1.2870782940802037,
      "grad_norm": 0.40669067131352565,
      "learning_rate": 4.8614801045142984e-05,
      "loss": 1.777,
      "num_input_tokens_seen": 9545044192,
      "step": 12132
    },
    {
      "epoch": 1.2871843836197752,
      "grad_norm": 0.37695516772706195,
      "learning_rate": 4.861457291481944e-05,
      "loss": 1.9562,
      "num_input_tokens_seen": 9545830976,
      "step": 12133
    },
    {
      "epoch": 1.2872904731593464,
      "grad_norm": 0.37299862960708563,
      "learning_rate": 4.861434476624724e-05,
      "loss": 1.6944,
      "num_input_tokens_seen": 9546617792,
      "step": 12134
    },
    {
      "epoch": 1.287396562698918,
      "grad_norm": 0.39951871646395304,
      "learning_rate": 4.861411659942658e-05,
      "loss": 1.7238,
      "num_input_tokens_seen": 9547404592,
      "step": 12135
    },
    {
      "epoch": 1.2875026522384894,
      "grad_norm": 0.43650841209560826,
      "learning_rate": 4.8613888414357614e-05,
      "loss": 1.8283,
      "num_input_tokens_seen": 9548191472,
      "step": 12136
    },
    {
      "epoch": 1.2876087417780606,
      "grad_norm": 0.404869782697321,
      "learning_rate": 4.861366021104054e-05,
      "loss": 1.7929,
      "num_input_tokens_seen": 9548978288,
      "step": 12137
    },
    {
      "epoch": 1.287714831317632,
      "grad_norm": 0.6043338540156777,
      "learning_rate": 4.861343198947551e-05,
      "loss": 1.8296,
      "num_input_tokens_seen": 9549765040,
      "step": 12138
    },
    {
      "epoch": 1.2878209208572033,
      "grad_norm": 0.40933553128589434,
      "learning_rate": 4.8613203749662714e-05,
      "loss": 1.7576,
      "num_input_tokens_seen": 9550551792,
      "step": 12139
    },
    {
      "epoch": 1.2879270103967748,
      "grad_norm": 0.8946809856852137,
      "learning_rate": 4.861297549160233e-05,
      "loss": 1.7909,
      "num_input_tokens_seen": 9551338528,
      "step": 12140
    },
    {
      "epoch": 1.2880330999363463,
      "grad_norm": 0.44542228433143904,
      "learning_rate": 4.861274721529453e-05,
      "loss": 1.732,
      "num_input_tokens_seen": 9552125280,
      "step": 12141
    },
    {
      "epoch": 1.2881391894759178,
      "grad_norm": 1.1983975863302436,
      "learning_rate": 4.8612518920739496e-05,
      "loss": 1.9121,
      "num_input_tokens_seen": 9552911968,
      "step": 12142
    },
    {
      "epoch": 1.288245279015489,
      "grad_norm": 0.5794569626456205,
      "learning_rate": 4.8612290607937394e-05,
      "loss": 1.6805,
      "num_input_tokens_seen": 9553698752,
      "step": 12143
    },
    {
      "epoch": 1.2883513685550605,
      "grad_norm": 0.6838945642995461,
      "learning_rate": 4.8612062276888414e-05,
      "loss": 1.6584,
      "num_input_tokens_seen": 9554485632,
      "step": 12144
    },
    {
      "epoch": 1.2884574580946317,
      "grad_norm": 0.5419402280648623,
      "learning_rate": 4.861183392759272e-05,
      "loss": 1.777,
      "num_input_tokens_seen": 9555272352,
      "step": 12145
    },
    {
      "epoch": 1.2885635476342032,
      "grad_norm": 0.6046157042580735,
      "learning_rate": 4.8611605560050495e-05,
      "loss": 1.8987,
      "num_input_tokens_seen": 9556059120,
      "step": 12146
    },
    {
      "epoch": 1.2886696371737747,
      "grad_norm": 0.5762651936295535,
      "learning_rate": 4.8611377174261915e-05,
      "loss": 1.7171,
      "num_input_tokens_seen": 9556845792,
      "step": 12147
    },
    {
      "epoch": 1.2887757267133462,
      "grad_norm": 0.4654437113040904,
      "learning_rate": 4.861114877022715e-05,
      "loss": 1.6962,
      "num_input_tokens_seen": 9557632512,
      "step": 12148
    },
    {
      "epoch": 1.2888818162529174,
      "grad_norm": 0.4367148985094965,
      "learning_rate": 4.861092034794639e-05,
      "loss": 1.6738,
      "num_input_tokens_seen": 9558419376,
      "step": 12149
    },
    {
      "epoch": 1.288987905792489,
      "grad_norm": 0.6141637557399122,
      "learning_rate": 4.86106919074198e-05,
      "loss": 1.8396,
      "num_input_tokens_seen": 9559206016,
      "step": 12150
    },
    {
      "epoch": 1.2890939953320601,
      "grad_norm": 0.4720280127796326,
      "learning_rate": 4.861046344864756e-05,
      "loss": 1.8153,
      "num_input_tokens_seen": 9559992768,
      "step": 12151
    },
    {
      "epoch": 1.2892000848716316,
      "grad_norm": 0.36802706689987824,
      "learning_rate": 4.8610234971629844e-05,
      "loss": 1.8123,
      "num_input_tokens_seen": 9560779504,
      "step": 12152
    },
    {
      "epoch": 1.289306174411203,
      "grad_norm": 0.4428928532269694,
      "learning_rate": 4.861000647636683e-05,
      "loss": 1.8664,
      "num_input_tokens_seen": 9561566208,
      "step": 12153
    },
    {
      "epoch": 1.2894122639507746,
      "grad_norm": 0.4316393907276842,
      "learning_rate": 4.86097779628587e-05,
      "loss": 1.8751,
      "num_input_tokens_seen": 9562352992,
      "step": 12154
    },
    {
      "epoch": 1.2895183534903458,
      "grad_norm": 0.4143745146828817,
      "learning_rate": 4.860954943110563e-05,
      "loss": 1.7488,
      "num_input_tokens_seen": 9563139712,
      "step": 12155
    },
    {
      "epoch": 1.2896244430299173,
      "grad_norm": 0.38883867660968585,
      "learning_rate": 4.8609320881107785e-05,
      "loss": 1.876,
      "num_input_tokens_seen": 9563926416,
      "step": 12156
    },
    {
      "epoch": 1.2897305325694886,
      "grad_norm": 0.35160247512252785,
      "learning_rate": 4.860909231286535e-05,
      "loss": 1.6611,
      "num_input_tokens_seen": 9564713152,
      "step": 12157
    },
    {
      "epoch": 1.28983662210906,
      "grad_norm": 0.38550623810495904,
      "learning_rate": 4.8608863726378505e-05,
      "loss": 1.7359,
      "num_input_tokens_seen": 9565499888,
      "step": 12158
    },
    {
      "epoch": 1.2899427116486315,
      "grad_norm": 0.40414450015387077,
      "learning_rate": 4.860863512164742e-05,
      "loss": 1.8134,
      "num_input_tokens_seen": 9566286624,
      "step": 12159
    },
    {
      "epoch": 1.290048801188203,
      "grad_norm": 0.3417470508859224,
      "learning_rate": 4.8608406498672274e-05,
      "loss": 1.6843,
      "num_input_tokens_seen": 9567073456,
      "step": 12160
    },
    {
      "epoch": 1.2901548907277742,
      "grad_norm": 0.42809545903988033,
      "learning_rate": 4.860817785745325e-05,
      "loss": 1.7158,
      "num_input_tokens_seen": 9567860336,
      "step": 12161
    },
    {
      "epoch": 1.2902609802673457,
      "grad_norm": 0.4007267743591693,
      "learning_rate": 4.860794919799052e-05,
      "loss": 1.7694,
      "num_input_tokens_seen": 9568647056,
      "step": 12162
    },
    {
      "epoch": 1.290367069806917,
      "grad_norm": 0.43209637032948245,
      "learning_rate": 4.860772052028425e-05,
      "loss": 1.8775,
      "num_input_tokens_seen": 9569433760,
      "step": 12163
    },
    {
      "epoch": 1.2904731593464884,
      "grad_norm": 0.37801766583025675,
      "learning_rate": 4.860749182433463e-05,
      "loss": 1.8031,
      "num_input_tokens_seen": 9570220528,
      "step": 12164
    },
    {
      "epoch": 1.29057924888606,
      "grad_norm": 0.4279510444897707,
      "learning_rate": 4.860726311014184e-05,
      "loss": 1.8531,
      "num_input_tokens_seen": 9571007344,
      "step": 12165
    },
    {
      "epoch": 1.2906853384256312,
      "grad_norm": 0.42828831173886,
      "learning_rate": 4.860703437770604e-05,
      "loss": 1.8781,
      "num_input_tokens_seen": 9571794096,
      "step": 12166
    },
    {
      "epoch": 1.2907914279652026,
      "grad_norm": 0.34336222805699934,
      "learning_rate": 4.860680562702742e-05,
      "loss": 1.6949,
      "num_input_tokens_seen": 9572580880,
      "step": 12167
    },
    {
      "epoch": 1.290897517504774,
      "grad_norm": 0.3465489431997383,
      "learning_rate": 4.860657685810616e-05,
      "loss": 1.6567,
      "num_input_tokens_seen": 9573367728,
      "step": 12168
    },
    {
      "epoch": 1.2910036070443454,
      "grad_norm": 0.37860767905758536,
      "learning_rate": 4.860634807094242e-05,
      "loss": 1.72,
      "num_input_tokens_seen": 9574154496,
      "step": 12169
    },
    {
      "epoch": 1.2911096965839168,
      "grad_norm": 0.46536417654899614,
      "learning_rate": 4.8606119265536386e-05,
      "loss": 1.7266,
      "num_input_tokens_seen": 9574941232,
      "step": 12170
    },
    {
      "epoch": 1.2912157861234883,
      "grad_norm": 0.4292423840105502,
      "learning_rate": 4.8605890441888246e-05,
      "loss": 1.7332,
      "num_input_tokens_seen": 9575727984,
      "step": 12171
    },
    {
      "epoch": 1.2913218756630596,
      "grad_norm": 0.5052867333015597,
      "learning_rate": 4.860566159999817e-05,
      "loss": 1.7841,
      "num_input_tokens_seen": 9576514720,
      "step": 12172
    },
    {
      "epoch": 1.291427965202631,
      "grad_norm": 0.4979167510814773,
      "learning_rate": 4.860543273986631e-05,
      "loss": 1.8651,
      "num_input_tokens_seen": 9577301536,
      "step": 12173
    },
    {
      "epoch": 1.2915340547422023,
      "grad_norm": 0.5251769325798511,
      "learning_rate": 4.860520386149288e-05,
      "loss": 1.7923,
      "num_input_tokens_seen": 9578088256,
      "step": 12174
    },
    {
      "epoch": 1.2916401442817738,
      "grad_norm": 0.3987057023478345,
      "learning_rate": 4.8604974964878034e-05,
      "loss": 1.7953,
      "num_input_tokens_seen": 9578875008,
      "step": 12175
    },
    {
      "epoch": 1.2917462338213452,
      "grad_norm": 0.4458094778538388,
      "learning_rate": 4.860474605002196e-05,
      "loss": 1.7642,
      "num_input_tokens_seen": 9579661856,
      "step": 12176
    },
    {
      "epoch": 1.2918523233609167,
      "grad_norm": 0.554032446618889,
      "learning_rate": 4.860451711692483e-05,
      "loss": 1.9407,
      "num_input_tokens_seen": 9580448640,
      "step": 12177
    },
    {
      "epoch": 1.291958412900488,
      "grad_norm": 1.0847750078064062,
      "learning_rate": 4.860428816558683e-05,
      "loss": 1.944,
      "num_input_tokens_seen": 9581235408,
      "step": 12178
    },
    {
      "epoch": 1.2920645024400594,
      "grad_norm": 0.8622900637672961,
      "learning_rate": 4.860405919600811e-05,
      "loss": 2.0855,
      "num_input_tokens_seen": 9582022208,
      "step": 12179
    },
    {
      "epoch": 1.2921705919796307,
      "grad_norm": 1.3472639379935278,
      "learning_rate": 4.860383020818888e-05,
      "loss": 1.6601,
      "num_input_tokens_seen": 9582808976,
      "step": 12180
    },
    {
      "epoch": 1.2922766815192022,
      "grad_norm": 0.6180849016472653,
      "learning_rate": 4.86036012021293e-05,
      "loss": 1.8926,
      "num_input_tokens_seen": 9583595600,
      "step": 12181
    },
    {
      "epoch": 1.2923827710587736,
      "grad_norm": 1.1606102457573335,
      "learning_rate": 4.860337217782955e-05,
      "loss": 1.8405,
      "num_input_tokens_seen": 9584382416,
      "step": 12182
    },
    {
      "epoch": 1.2924888605983451,
      "grad_norm": 0.5828324086698214,
      "learning_rate": 4.860314313528981e-05,
      "loss": 1.5827,
      "num_input_tokens_seen": 9585169264,
      "step": 12183
    },
    {
      "epoch": 1.2925949501379164,
      "grad_norm": 0.5564328166025925,
      "learning_rate": 4.860291407451024e-05,
      "loss": 1.7772,
      "num_input_tokens_seen": 9585956112,
      "step": 12184
    },
    {
      "epoch": 1.2927010396774878,
      "grad_norm": 0.7267475703498643,
      "learning_rate": 4.860268499549104e-05,
      "loss": 1.7322,
      "num_input_tokens_seen": 9586742832,
      "step": 12185
    },
    {
      "epoch": 1.292807129217059,
      "grad_norm": 0.4815708506037094,
      "learning_rate": 4.860245589823238e-05,
      "loss": 1.8881,
      "num_input_tokens_seen": 9587529536,
      "step": 12186
    },
    {
      "epoch": 1.2929132187566306,
      "grad_norm": 0.8734010793584477,
      "learning_rate": 4.860222678273443e-05,
      "loss": 1.823,
      "num_input_tokens_seen": 9588316272,
      "step": 12187
    },
    {
      "epoch": 1.293019308296202,
      "grad_norm": 0.41181475981278354,
      "learning_rate": 4.8601997648997374e-05,
      "loss": 1.8404,
      "num_input_tokens_seen": 9589103072,
      "step": 12188
    },
    {
      "epoch": 1.2931253978357735,
      "grad_norm": 0.7000979718271577,
      "learning_rate": 4.860176849702138e-05,
      "loss": 1.6451,
      "num_input_tokens_seen": 9589889824,
      "step": 12189
    },
    {
      "epoch": 1.2932314873753448,
      "grad_norm": 0.5906865626110783,
      "learning_rate": 4.860153932680664e-05,
      "loss": 1.9244,
      "num_input_tokens_seen": 9590676512,
      "step": 12190
    },
    {
      "epoch": 1.2933375769149162,
      "grad_norm": 0.6956212091078748,
      "learning_rate": 4.860131013835333e-05,
      "loss": 1.7942,
      "num_input_tokens_seen": 9591463296,
      "step": 12191
    },
    {
      "epoch": 1.2934436664544875,
      "grad_norm": 0.49956845156086727,
      "learning_rate": 4.8601080931661605e-05,
      "loss": 1.7148,
      "num_input_tokens_seen": 9592250032,
      "step": 12192
    },
    {
      "epoch": 1.293549755994059,
      "grad_norm": 0.5728570092109413,
      "learning_rate": 4.860085170673167e-05,
      "loss": 1.8211,
      "num_input_tokens_seen": 9593036768,
      "step": 12193
    },
    {
      "epoch": 1.2936558455336304,
      "grad_norm": 0.6803152160399444,
      "learning_rate": 4.860062246356367e-05,
      "loss": 1.9251,
      "num_input_tokens_seen": 9593823536,
      "step": 12194
    },
    {
      "epoch": 1.293761935073202,
      "grad_norm": 0.43090710917455244,
      "learning_rate": 4.860039320215782e-05,
      "loss": 1.8744,
      "num_input_tokens_seen": 9594610320,
      "step": 12195
    },
    {
      "epoch": 1.2938680246127732,
      "grad_norm": 0.4794972646508794,
      "learning_rate": 4.860016392251428e-05,
      "loss": 1.8542,
      "num_input_tokens_seen": 9595397024,
      "step": 12196
    },
    {
      "epoch": 1.2939741141523446,
      "grad_norm": 0.42651892130687197,
      "learning_rate": 4.859993462463321e-05,
      "loss": 1.9584,
      "num_input_tokens_seen": 9596183696,
      "step": 12197
    },
    {
      "epoch": 1.294080203691916,
      "grad_norm": 0.4468996027271792,
      "learning_rate": 4.859970530851481e-05,
      "loss": 1.7021,
      "num_input_tokens_seen": 9596970432,
      "step": 12198
    },
    {
      "epoch": 1.2941862932314874,
      "grad_norm": 0.36895490075013954,
      "learning_rate": 4.859947597415925e-05,
      "loss": 1.7434,
      "num_input_tokens_seen": 9597757248,
      "step": 12199
    },
    {
      "epoch": 1.2942923827710588,
      "grad_norm": 0.4484589806431061,
      "learning_rate": 4.859924662156671e-05,
      "loss": 1.7481,
      "num_input_tokens_seen": 9598544000,
      "step": 12200
    },
    {
      "epoch": 1.29439847231063,
      "grad_norm": 0.4037647936053242,
      "learning_rate": 4.8599017250737365e-05,
      "loss": 1.8281,
      "num_input_tokens_seen": 9599330800,
      "step": 12201
    },
    {
      "epoch": 1.2945045618502016,
      "grad_norm": 0.41224967903874804,
      "learning_rate": 4.859878786167139e-05,
      "loss": 1.6635,
      "num_input_tokens_seen": 9600117520,
      "step": 12202
    },
    {
      "epoch": 1.294610651389773,
      "grad_norm": 0.4102713487949257,
      "learning_rate": 4.859855845436896e-05,
      "loss": 1.7033,
      "num_input_tokens_seen": 9600904288,
      "step": 12203
    },
    {
      "epoch": 1.2947167409293443,
      "grad_norm": 0.45469677313082685,
      "learning_rate": 4.859832902883026e-05,
      "loss": 1.6789,
      "num_input_tokens_seen": 9601691072,
      "step": 12204
    },
    {
      "epoch": 1.2948228304689158,
      "grad_norm": 0.43796849874178023,
      "learning_rate": 4.859809958505547e-05,
      "loss": 1.8834,
      "num_input_tokens_seen": 9602477744,
      "step": 12205
    },
    {
      "epoch": 1.2949289200084872,
      "grad_norm": 0.44232493859225486,
      "learning_rate": 4.859787012304475e-05,
      "loss": 1.7138,
      "num_input_tokens_seen": 9603264496,
      "step": 12206
    },
    {
      "epoch": 1.2950350095480585,
      "grad_norm": 0.5675612971122584,
      "learning_rate": 4.85976406427983e-05,
      "loss": 1.832,
      "num_input_tokens_seen": 9604051296,
      "step": 12207
    },
    {
      "epoch": 1.29514109908763,
      "grad_norm": 0.415259157431139,
      "learning_rate": 4.8597411144316274e-05,
      "loss": 1.8524,
      "num_input_tokens_seen": 9604838064,
      "step": 12208
    },
    {
      "epoch": 1.2952471886272012,
      "grad_norm": 0.5576486378313674,
      "learning_rate": 4.859718162759887e-05,
      "loss": 1.6312,
      "num_input_tokens_seen": 9605624896,
      "step": 12209
    },
    {
      "epoch": 1.2953532781667727,
      "grad_norm": 0.4251552374401045,
      "learning_rate": 4.859695209264625e-05,
      "loss": 1.7595,
      "num_input_tokens_seen": 9606411600,
      "step": 12210
    },
    {
      "epoch": 1.2954593677063442,
      "grad_norm": 0.49997335662079795,
      "learning_rate": 4.85967225394586e-05,
      "loss": 1.9385,
      "num_input_tokens_seen": 9607198384,
      "step": 12211
    },
    {
      "epoch": 1.2955654572459157,
      "grad_norm": 0.38265529901507433,
      "learning_rate": 4.85964929680361e-05,
      "loss": 1.6597,
      "num_input_tokens_seen": 9607985152,
      "step": 12212
    },
    {
      "epoch": 1.295671546785487,
      "grad_norm": 0.6002798842836408,
      "learning_rate": 4.8596263378378914e-05,
      "loss": 1.8552,
      "num_input_tokens_seen": 9608771936,
      "step": 12213
    },
    {
      "epoch": 1.2957776363250584,
      "grad_norm": 0.4153460518245094,
      "learning_rate": 4.8596033770487234e-05,
      "loss": 1.8801,
      "num_input_tokens_seen": 9609558720,
      "step": 12214
    },
    {
      "epoch": 1.2958837258646296,
      "grad_norm": 0.5262393738149638,
      "learning_rate": 4.859580414436123e-05,
      "loss": 1.8854,
      "num_input_tokens_seen": 9610345552,
      "step": 12215
    },
    {
      "epoch": 1.295989815404201,
      "grad_norm": 0.40689004311309096,
      "learning_rate": 4.8595574500001084e-05,
      "loss": 1.7426,
      "num_input_tokens_seen": 9611132352,
      "step": 12216
    },
    {
      "epoch": 1.2960959049437726,
      "grad_norm": 0.45115631342564194,
      "learning_rate": 4.8595344837406966e-05,
      "loss": 1.7116,
      "num_input_tokens_seen": 9611919200,
      "step": 12217
    },
    {
      "epoch": 1.296201994483344,
      "grad_norm": 0.4605710805966639,
      "learning_rate": 4.859511515657906e-05,
      "loss": 1.7792,
      "num_input_tokens_seen": 9612706048,
      "step": 12218
    },
    {
      "epoch": 1.2963080840229153,
      "grad_norm": 0.510683221414682,
      "learning_rate": 4.859488545751754e-05,
      "loss": 1.7425,
      "num_input_tokens_seen": 9613492832,
      "step": 12219
    },
    {
      "epoch": 1.2964141735624868,
      "grad_norm": 0.48693550658847823,
      "learning_rate": 4.859465574022258e-05,
      "loss": 1.7529,
      "num_input_tokens_seen": 9614279664,
      "step": 12220
    },
    {
      "epoch": 1.296520263102058,
      "grad_norm": 0.5024505942553461,
      "learning_rate": 4.859442600469437e-05,
      "loss": 1.7608,
      "num_input_tokens_seen": 9615066384,
      "step": 12221
    },
    {
      "epoch": 1.2966263526416295,
      "grad_norm": 0.5644817343415541,
      "learning_rate": 4.859419625093308e-05,
      "loss": 1.8303,
      "num_input_tokens_seen": 9615853248,
      "step": 12222
    },
    {
      "epoch": 1.296732442181201,
      "grad_norm": 0.37406565513564793,
      "learning_rate": 4.859396647893889e-05,
      "loss": 1.6367,
      "num_input_tokens_seen": 9616639984,
      "step": 12223
    },
    {
      "epoch": 1.2968385317207725,
      "grad_norm": 0.6315038049976351,
      "learning_rate": 4.8593736688711966e-05,
      "loss": 1.7585,
      "num_input_tokens_seen": 9617426816,
      "step": 12224
    },
    {
      "epoch": 1.2969446212603437,
      "grad_norm": 0.5657652197444483,
      "learning_rate": 4.85935068802525e-05,
      "loss": 1.6605,
      "num_input_tokens_seen": 9618213600,
      "step": 12225
    },
    {
      "epoch": 1.2970507107999152,
      "grad_norm": 0.4076821620632398,
      "learning_rate": 4.859327705356066e-05,
      "loss": 1.8228,
      "num_input_tokens_seen": 9619000336,
      "step": 12226
    },
    {
      "epoch": 1.2971568003394864,
      "grad_norm": 0.5511765348993662,
      "learning_rate": 4.859304720863663e-05,
      "loss": 1.6384,
      "num_input_tokens_seen": 9619787056,
      "step": 12227
    },
    {
      "epoch": 1.297262889879058,
      "grad_norm": 0.43275401263886965,
      "learning_rate": 4.859281734548059e-05,
      "loss": 1.5993,
      "num_input_tokens_seen": 9620573920,
      "step": 12228
    },
    {
      "epoch": 1.2973689794186294,
      "grad_norm": 0.5505029962011614,
      "learning_rate": 4.859258746409271e-05,
      "loss": 1.6697,
      "num_input_tokens_seen": 9621360672,
      "step": 12229
    },
    {
      "epoch": 1.2974750689582006,
      "grad_norm": 0.5400549765534154,
      "learning_rate": 4.8592357564473166e-05,
      "loss": 1.8432,
      "num_input_tokens_seen": 9622147296,
      "step": 12230
    },
    {
      "epoch": 1.2975811584977721,
      "grad_norm": 0.5987908852283229,
      "learning_rate": 4.8592127646622146e-05,
      "loss": 1.9093,
      "num_input_tokens_seen": 9622934048,
      "step": 12231
    },
    {
      "epoch": 1.2976872480373436,
      "grad_norm": 0.3696290046761399,
      "learning_rate": 4.859189771053982e-05,
      "loss": 1.6968,
      "num_input_tokens_seen": 9623720832,
      "step": 12232
    },
    {
      "epoch": 1.2977933375769148,
      "grad_norm": 0.6112728106610992,
      "learning_rate": 4.859166775622637e-05,
      "loss": 1.7932,
      "num_input_tokens_seen": 9624507664,
      "step": 12233
    },
    {
      "epoch": 1.2978994271164863,
      "grad_norm": 0.4247864651668886,
      "learning_rate": 4.859143778368196e-05,
      "loss": 1.9102,
      "num_input_tokens_seen": 9625294368,
      "step": 12234
    },
    {
      "epoch": 1.2980055166560578,
      "grad_norm": 0.4510830973784602,
      "learning_rate": 4.859120779290679e-05,
      "loss": 1.7313,
      "num_input_tokens_seen": 9626081072,
      "step": 12235
    },
    {
      "epoch": 1.298111606195629,
      "grad_norm": 0.49677163925654627,
      "learning_rate": 4.859097778390103e-05,
      "loss": 1.8584,
      "num_input_tokens_seen": 9626867712,
      "step": 12236
    },
    {
      "epoch": 1.2982176957352005,
      "grad_norm": 0.3732662324608957,
      "learning_rate": 4.859074775666484e-05,
      "loss": 1.6141,
      "num_input_tokens_seen": 9627654512,
      "step": 12237
    },
    {
      "epoch": 1.2983237852747718,
      "grad_norm": 0.3685196602304963,
      "learning_rate": 4.859051771119843e-05,
      "loss": 1.7957,
      "num_input_tokens_seen": 9628441296,
      "step": 12238
    },
    {
      "epoch": 1.2984298748143432,
      "grad_norm": 0.44998605497881977,
      "learning_rate": 4.8590287647501955e-05,
      "loss": 1.8725,
      "num_input_tokens_seen": 9629228160,
      "step": 12239
    },
    {
      "epoch": 1.2985359643539147,
      "grad_norm": 0.3867157114146945,
      "learning_rate": 4.859005756557559e-05,
      "loss": 1.8026,
      "num_input_tokens_seen": 9630014960,
      "step": 12240
    },
    {
      "epoch": 1.2986420538934862,
      "grad_norm": 0.42313812557715674,
      "learning_rate": 4.8589827465419526e-05,
      "loss": 1.8252,
      "num_input_tokens_seen": 9630801776,
      "step": 12241
    },
    {
      "epoch": 1.2987481434330574,
      "grad_norm": 0.44151408930166414,
      "learning_rate": 4.858959734703393e-05,
      "loss": 1.8621,
      "num_input_tokens_seen": 9631588528,
      "step": 12242
    },
    {
      "epoch": 1.298854232972629,
      "grad_norm": 0.37160903118306854,
      "learning_rate": 4.8589367210419e-05,
      "loss": 1.6925,
      "num_input_tokens_seen": 9632375264,
      "step": 12243
    },
    {
      "epoch": 1.2989603225122002,
      "grad_norm": 0.481449111401386,
      "learning_rate": 4.858913705557488e-05,
      "loss": 1.9162,
      "num_input_tokens_seen": 9633161936,
      "step": 12244
    },
    {
      "epoch": 1.2990664120517716,
      "grad_norm": 0.45768706109542057,
      "learning_rate": 4.858890688250178e-05,
      "loss": 1.8197,
      "num_input_tokens_seen": 9633948768,
      "step": 12245
    },
    {
      "epoch": 1.2991725015913431,
      "grad_norm": 0.516581628849679,
      "learning_rate": 4.858867669119986e-05,
      "loss": 1.802,
      "num_input_tokens_seen": 9634735600,
      "step": 12246
    },
    {
      "epoch": 1.2992785911309146,
      "grad_norm": 0.3908770623328564,
      "learning_rate": 4.858844648166931e-05,
      "loss": 1.7197,
      "num_input_tokens_seen": 9635522368,
      "step": 12247
    },
    {
      "epoch": 1.2993846806704858,
      "grad_norm": 0.4150925760216654,
      "learning_rate": 4.858821625391029e-05,
      "loss": 1.8123,
      "num_input_tokens_seen": 9636309104,
      "step": 12248
    },
    {
      "epoch": 1.2994907702100573,
      "grad_norm": 0.38593426961549115,
      "learning_rate": 4.8587986007922995e-05,
      "loss": 1.7016,
      "num_input_tokens_seen": 9637095856,
      "step": 12249
    },
    {
      "epoch": 1.2995968597496286,
      "grad_norm": 0.3988971099503955,
      "learning_rate": 4.85877557437076e-05,
      "loss": 1.7397,
      "num_input_tokens_seen": 9637882720,
      "step": 12250
    },
    {
      "epoch": 1.2997029492892,
      "grad_norm": 0.37069556546974836,
      "learning_rate": 4.858752546126427e-05,
      "loss": 1.6395,
      "num_input_tokens_seen": 9638669504,
      "step": 12251
    },
    {
      "epoch": 1.2998090388287715,
      "grad_norm": 0.3975625181263709,
      "learning_rate": 4.858729516059319e-05,
      "loss": 1.7447,
      "num_input_tokens_seen": 9639456256,
      "step": 12252
    },
    {
      "epoch": 1.299915128368343,
      "grad_norm": 0.3696657187807517,
      "learning_rate": 4.858706484169455e-05,
      "loss": 1.8672,
      "num_input_tokens_seen": 9640243008,
      "step": 12253
    },
    {
      "epoch": 1.3000212179079143,
      "grad_norm": 0.4141354259318949,
      "learning_rate": 4.858683450456852e-05,
      "loss": 1.6938,
      "num_input_tokens_seen": 9641029776,
      "step": 12254
    },
    {
      "epoch": 1.3001273074474857,
      "grad_norm": 0.4529810235095265,
      "learning_rate": 4.858660414921527e-05,
      "loss": 1.7921,
      "num_input_tokens_seen": 9641816448,
      "step": 12255
    },
    {
      "epoch": 1.300233396987057,
      "grad_norm": 0.3690928320172531,
      "learning_rate": 4.858637377563499e-05,
      "loss": 1.5754,
      "num_input_tokens_seen": 9642603232,
      "step": 12256
    },
    {
      "epoch": 1.3003394865266285,
      "grad_norm": 0.478840193755202,
      "learning_rate": 4.858614338382785e-05,
      "loss": 1.8062,
      "num_input_tokens_seen": 9643390032,
      "step": 12257
    },
    {
      "epoch": 1.3004455760662,
      "grad_norm": 0.4334359193981923,
      "learning_rate": 4.858591297379402e-05,
      "loss": 1.9036,
      "num_input_tokens_seen": 9644176832,
      "step": 12258
    },
    {
      "epoch": 1.3005516656057714,
      "grad_norm": 0.5427961562160284,
      "learning_rate": 4.8585682545533706e-05,
      "loss": 1.7789,
      "num_input_tokens_seen": 9644963568,
      "step": 12259
    },
    {
      "epoch": 1.3006577551453427,
      "grad_norm": 0.4265386175622269,
      "learning_rate": 4.858545209904706e-05,
      "loss": 1.7682,
      "num_input_tokens_seen": 9645750384,
      "step": 12260
    },
    {
      "epoch": 1.3007638446849141,
      "grad_norm": 0.5713970267901031,
      "learning_rate": 4.858522163433427e-05,
      "loss": 1.6976,
      "num_input_tokens_seen": 9646537184,
      "step": 12261
    },
    {
      "epoch": 1.3008699342244854,
      "grad_norm": 0.44162050307431844,
      "learning_rate": 4.858499115139551e-05,
      "loss": 1.8399,
      "num_input_tokens_seen": 9647323968,
      "step": 12262
    },
    {
      "epoch": 1.3009760237640569,
      "grad_norm": 0.6337952523442381,
      "learning_rate": 4.858476065023097e-05,
      "loss": 1.8704,
      "num_input_tokens_seen": 9648110736,
      "step": 12263
    },
    {
      "epoch": 1.3010821133036283,
      "grad_norm": 0.395972537042248,
      "learning_rate": 4.85845301308408e-05,
      "loss": 1.6695,
      "num_input_tokens_seen": 9648897504,
      "step": 12264
    },
    {
      "epoch": 1.3011882028431996,
      "grad_norm": 0.6550639629115934,
      "learning_rate": 4.8584299593225216e-05,
      "loss": 1.9106,
      "num_input_tokens_seen": 9649684272,
      "step": 12265
    },
    {
      "epoch": 1.301294292382771,
      "grad_norm": 0.42800839649047395,
      "learning_rate": 4.8584069037384365e-05,
      "loss": 1.8231,
      "num_input_tokens_seen": 9650470976,
      "step": 12266
    },
    {
      "epoch": 1.3014003819223425,
      "grad_norm": 0.4111941263040844,
      "learning_rate": 4.858383846331844e-05,
      "loss": 1.7731,
      "num_input_tokens_seen": 9651257808,
      "step": 12267
    },
    {
      "epoch": 1.3015064714619138,
      "grad_norm": 0.756291782481302,
      "learning_rate": 4.858360787102763e-05,
      "loss": 1.802,
      "num_input_tokens_seen": 9652044608,
      "step": 12268
    },
    {
      "epoch": 1.3016125610014853,
      "grad_norm": 0.4927517633886008,
      "learning_rate": 4.858337726051208e-05,
      "loss": 1.6996,
      "num_input_tokens_seen": 9652831392,
      "step": 12269
    },
    {
      "epoch": 1.3017186505410567,
      "grad_norm": 0.8664434953533657,
      "learning_rate": 4.8583146631772e-05,
      "loss": 1.7188,
      "num_input_tokens_seen": 9653618128,
      "step": 12270
    },
    {
      "epoch": 1.301824740080628,
      "grad_norm": 0.5711592216958535,
      "learning_rate": 4.858291598480755e-05,
      "loss": 1.8887,
      "num_input_tokens_seen": 9654404896,
      "step": 12271
    },
    {
      "epoch": 1.3019308296201995,
      "grad_norm": 0.6724286687102097,
      "learning_rate": 4.8582685319618915e-05,
      "loss": 1.6503,
      "num_input_tokens_seen": 9655191744,
      "step": 12272
    },
    {
      "epoch": 1.3020369191597707,
      "grad_norm": 0.4140546896802652,
      "learning_rate": 4.8582454636206276e-05,
      "loss": 1.6908,
      "num_input_tokens_seen": 9655978432,
      "step": 12273
    },
    {
      "epoch": 1.3021430086993422,
      "grad_norm": 0.45444674788118467,
      "learning_rate": 4.858222393456981e-05,
      "loss": 1.8353,
      "num_input_tokens_seen": 9656765232,
      "step": 12274
    },
    {
      "epoch": 1.3022490982389137,
      "grad_norm": 0.6312017295832035,
      "learning_rate": 4.858199321470969e-05,
      "loss": 1.7828,
      "num_input_tokens_seen": 9657552048,
      "step": 12275
    },
    {
      "epoch": 1.3023551877784851,
      "grad_norm": 0.5064068690095638,
      "learning_rate": 4.85817624766261e-05,
      "loss": 1.8635,
      "num_input_tokens_seen": 9658338768,
      "step": 12276
    },
    {
      "epoch": 1.3024612773180564,
      "grad_norm": 0.43143866815326365,
      "learning_rate": 4.858153172031922e-05,
      "loss": 1.8006,
      "num_input_tokens_seen": 9659125616,
      "step": 12277
    },
    {
      "epoch": 1.3025673668576279,
      "grad_norm": 0.5432513518704168,
      "learning_rate": 4.858130094578921e-05,
      "loss": 1.8892,
      "num_input_tokens_seen": 9659912320,
      "step": 12278
    },
    {
      "epoch": 1.3026734563971991,
      "grad_norm": 0.5244920292240184,
      "learning_rate": 4.8581070153036274e-05,
      "loss": 1.7832,
      "num_input_tokens_seen": 9660699040,
      "step": 12279
    },
    {
      "epoch": 1.3027795459367706,
      "grad_norm": 0.4044733879870232,
      "learning_rate": 4.8580839342060575e-05,
      "loss": 1.7406,
      "num_input_tokens_seen": 9661485792,
      "step": 12280
    },
    {
      "epoch": 1.302885635476342,
      "grad_norm": 0.8702453155245008,
      "learning_rate": 4.85806085128623e-05,
      "loss": 1.8897,
      "num_input_tokens_seen": 9662272512,
      "step": 12281
    },
    {
      "epoch": 1.3029917250159135,
      "grad_norm": 0.5106925210073967,
      "learning_rate": 4.858037766544161e-05,
      "loss": 1.6389,
      "num_input_tokens_seen": 9663059296,
      "step": 12282
    },
    {
      "epoch": 1.3030978145554848,
      "grad_norm": 0.8507618752798265,
      "learning_rate": 4.858014679979871e-05,
      "loss": 1.7727,
      "num_input_tokens_seen": 9663846112,
      "step": 12283
    },
    {
      "epoch": 1.3032039040950563,
      "grad_norm": 0.5468351096656724,
      "learning_rate": 4.857991591593376e-05,
      "loss": 1.8566,
      "num_input_tokens_seen": 9664632896,
      "step": 12284
    },
    {
      "epoch": 1.3033099936346275,
      "grad_norm": 0.5107302304702558,
      "learning_rate": 4.857968501384694e-05,
      "loss": 1.8479,
      "num_input_tokens_seen": 9665419696,
      "step": 12285
    },
    {
      "epoch": 1.303416083174199,
      "grad_norm": 0.5221564136124734,
      "learning_rate": 4.857945409353844e-05,
      "loss": 1.8036,
      "num_input_tokens_seen": 9666206448,
      "step": 12286
    },
    {
      "epoch": 1.3035221727137705,
      "grad_norm": 0.5091995179540287,
      "learning_rate": 4.857922315500841e-05,
      "loss": 1.8208,
      "num_input_tokens_seen": 9666993232,
      "step": 12287
    },
    {
      "epoch": 1.303628262253342,
      "grad_norm": 0.4447245862679184,
      "learning_rate": 4.857899219825707e-05,
      "loss": 1.7816,
      "num_input_tokens_seen": 9667780016,
      "step": 12288
    },
    {
      "epoch": 1.3037343517929132,
      "grad_norm": 0.4020565507042362,
      "learning_rate": 4.857876122328456e-05,
      "loss": 1.729,
      "num_input_tokens_seen": 9668566784,
      "step": 12289
    },
    {
      "epoch": 1.3038404413324847,
      "grad_norm": 0.7452534667967701,
      "learning_rate": 4.857853023009109e-05,
      "loss": 1.8498,
      "num_input_tokens_seen": 9669353568,
      "step": 12290
    },
    {
      "epoch": 1.303946530872056,
      "grad_norm": 0.3959765330734672,
      "learning_rate": 4.8578299218676815e-05,
      "loss": 1.8402,
      "num_input_tokens_seen": 9670140384,
      "step": 12291
    },
    {
      "epoch": 1.3040526204116274,
      "grad_norm": 1.0113426198809,
      "learning_rate": 4.8578068189041925e-05,
      "loss": 1.8161,
      "num_input_tokens_seen": 9670927216,
      "step": 12292
    },
    {
      "epoch": 1.3041587099511989,
      "grad_norm": 0.8846984114887826,
      "learning_rate": 4.85778371411866e-05,
      "loss": 1.8563,
      "num_input_tokens_seen": 9671713936,
      "step": 12293
    },
    {
      "epoch": 1.3042647994907703,
      "grad_norm": 0.8199165314233393,
      "learning_rate": 4.8577606075111e-05,
      "loss": 1.9121,
      "num_input_tokens_seen": 9672500720,
      "step": 12294
    },
    {
      "epoch": 1.3043708890303416,
      "grad_norm": 1.5680747006924423,
      "learning_rate": 4.857737499081533e-05,
      "loss": 1.7264,
      "num_input_tokens_seen": 9673287536,
      "step": 12295
    },
    {
      "epoch": 1.304476978569913,
      "grad_norm": 0.948486323340754,
      "learning_rate": 4.857714388829975e-05,
      "loss": 1.8242,
      "num_input_tokens_seen": 9674074352,
      "step": 12296
    },
    {
      "epoch": 1.3045830681094843,
      "grad_norm": 0.7674920469947559,
      "learning_rate": 4.857691276756445e-05,
      "loss": 1.8617,
      "num_input_tokens_seen": 9674860976,
      "step": 12297
    },
    {
      "epoch": 1.3046891576490558,
      "grad_norm": 1.0335537574101668,
      "learning_rate": 4.8576681628609605e-05,
      "loss": 1.7133,
      "num_input_tokens_seen": 9675647744,
      "step": 12298
    },
    {
      "epoch": 1.3047952471886273,
      "grad_norm": 0.42393648003215584,
      "learning_rate": 4.8576450471435385e-05,
      "loss": 1.6866,
      "num_input_tokens_seen": 9676434480,
      "step": 12299
    },
    {
      "epoch": 1.3049013367281985,
      "grad_norm": 0.9092201247360584,
      "learning_rate": 4.857621929604198e-05,
      "loss": 1.6598,
      "num_input_tokens_seen": 9677221232,
      "step": 12300
    },
    {
      "epoch": 1.30500742626777,
      "grad_norm": 0.6623066138778052,
      "learning_rate": 4.857598810242957e-05,
      "loss": 1.8526,
      "num_input_tokens_seen": 9678008000,
      "step": 12301
    },
    {
      "epoch": 1.3051135158073415,
      "grad_norm": 0.7687955321738316,
      "learning_rate": 4.857575689059832e-05,
      "loss": 1.8004,
      "num_input_tokens_seen": 9678794672,
      "step": 12302
    },
    {
      "epoch": 1.3052196053469127,
      "grad_norm": 0.6471171775424024,
      "learning_rate": 4.857552566054842e-05,
      "loss": 1.8186,
      "num_input_tokens_seen": 9679581456,
      "step": 12303
    },
    {
      "epoch": 1.3053256948864842,
      "grad_norm": 0.834173693069357,
      "learning_rate": 4.8575294412280045e-05,
      "loss": 1.7335,
      "num_input_tokens_seen": 9680368304,
      "step": 12304
    },
    {
      "epoch": 1.3054317844260557,
      "grad_norm": 0.4123618716475189,
      "learning_rate": 4.857506314579338e-05,
      "loss": 1.7752,
      "num_input_tokens_seen": 9681155072,
      "step": 12305
    },
    {
      "epoch": 1.305537873965627,
      "grad_norm": 0.8843238290552161,
      "learning_rate": 4.857483186108859e-05,
      "loss": 1.7498,
      "num_input_tokens_seen": 9681941824,
      "step": 12306
    },
    {
      "epoch": 1.3056439635051984,
      "grad_norm": 0.5659458097227142,
      "learning_rate": 4.857460055816586e-05,
      "loss": 1.7372,
      "num_input_tokens_seen": 9682728592,
      "step": 12307
    },
    {
      "epoch": 1.3057500530447697,
      "grad_norm": 0.8091029561341788,
      "learning_rate": 4.8574369237025374e-05,
      "loss": 1.7611,
      "num_input_tokens_seen": 9683515392,
      "step": 12308
    },
    {
      "epoch": 1.3058561425843411,
      "grad_norm": 0.5478452580405365,
      "learning_rate": 4.8574137897667304e-05,
      "loss": 1.7398,
      "num_input_tokens_seen": 9684302256,
      "step": 12309
    },
    {
      "epoch": 1.3059622321239126,
      "grad_norm": 0.6079224693160872,
      "learning_rate": 4.857390654009184e-05,
      "loss": 1.7201,
      "num_input_tokens_seen": 9685089120,
      "step": 12310
    },
    {
      "epoch": 1.306068321663484,
      "grad_norm": 0.6794656368962406,
      "learning_rate": 4.857367516429915e-05,
      "loss": 1.9228,
      "num_input_tokens_seen": 9685875840,
      "step": 12311
    },
    {
      "epoch": 1.3061744112030553,
      "grad_norm": 0.8758692557953388,
      "learning_rate": 4.8573443770289407e-05,
      "loss": 1.9185,
      "num_input_tokens_seen": 9686662592,
      "step": 12312
    },
    {
      "epoch": 1.3062805007426268,
      "grad_norm": 0.48980916871621966,
      "learning_rate": 4.8573212358062806e-05,
      "loss": 1.7473,
      "num_input_tokens_seen": 9687449344,
      "step": 12313
    },
    {
      "epoch": 1.306386590282198,
      "grad_norm": 0.4213365390752026,
      "learning_rate": 4.8572980927619515e-05,
      "loss": 1.7911,
      "num_input_tokens_seen": 9688236080,
      "step": 12314
    },
    {
      "epoch": 1.3064926798217695,
      "grad_norm": 0.5020369823757322,
      "learning_rate": 4.8572749478959724e-05,
      "loss": 1.542,
      "num_input_tokens_seen": 9689022912,
      "step": 12315
    },
    {
      "epoch": 1.306598769361341,
      "grad_norm": 0.4913120818000694,
      "learning_rate": 4.8572518012083595e-05,
      "loss": 2.0262,
      "num_input_tokens_seen": 9689809600,
      "step": 12316
    },
    {
      "epoch": 1.3067048589009125,
      "grad_norm": 0.4934632268746767,
      "learning_rate": 4.857228652699132e-05,
      "loss": 1.7954,
      "num_input_tokens_seen": 9690596352,
      "step": 12317
    },
    {
      "epoch": 1.3068109484404837,
      "grad_norm": 0.5632855471603516,
      "learning_rate": 4.8572055023683074e-05,
      "loss": 2.0179,
      "num_input_tokens_seen": 9691383104,
      "step": 12318
    },
    {
      "epoch": 1.3069170379800552,
      "grad_norm": 0.47771884587878066,
      "learning_rate": 4.857182350215903e-05,
      "loss": 1.7103,
      "num_input_tokens_seen": 9692169824,
      "step": 12319
    },
    {
      "epoch": 1.3070231275196265,
      "grad_norm": 0.4384911836297711,
      "learning_rate": 4.8571591962419377e-05,
      "loss": 1.7156,
      "num_input_tokens_seen": 9692956624,
      "step": 12320
    },
    {
      "epoch": 1.307129217059198,
      "grad_norm": 0.5800463093477704,
      "learning_rate": 4.857136040446429e-05,
      "loss": 1.9237,
      "num_input_tokens_seen": 9693743424,
      "step": 12321
    },
    {
      "epoch": 1.3072353065987694,
      "grad_norm": 0.45312415921401156,
      "learning_rate": 4.8571128828293946e-05,
      "loss": 1.8318,
      "num_input_tokens_seen": 9694530208,
      "step": 12322
    },
    {
      "epoch": 1.3073413961383409,
      "grad_norm": 0.441782259263475,
      "learning_rate": 4.8570897233908526e-05,
      "loss": 1.7358,
      "num_input_tokens_seen": 9695316928,
      "step": 12323
    },
    {
      "epoch": 1.3074474856779121,
      "grad_norm": 0.5247134048595496,
      "learning_rate": 4.857066562130821e-05,
      "loss": 1.9859,
      "num_input_tokens_seen": 9696103648,
      "step": 12324
    },
    {
      "epoch": 1.3075535752174836,
      "grad_norm": 0.482955796300213,
      "learning_rate": 4.857043399049317e-05,
      "loss": 1.774,
      "num_input_tokens_seen": 9696890336,
      "step": 12325
    },
    {
      "epoch": 1.3076596647570549,
      "grad_norm": 0.4522214043659934,
      "learning_rate": 4.857020234146359e-05,
      "loss": 1.8699,
      "num_input_tokens_seen": 9697677152,
      "step": 12326
    },
    {
      "epoch": 1.3077657542966263,
      "grad_norm": 0.46200660968182905,
      "learning_rate": 4.8569970674219654e-05,
      "loss": 1.7612,
      "num_input_tokens_seen": 9698463920,
      "step": 12327
    },
    {
      "epoch": 1.3078718438361978,
      "grad_norm": 0.4148274015051372,
      "learning_rate": 4.856973898876153e-05,
      "loss": 1.8472,
      "num_input_tokens_seen": 9699250672,
      "step": 12328
    },
    {
      "epoch": 1.3079779333757693,
      "grad_norm": 0.44438025307024975,
      "learning_rate": 4.856950728508941e-05,
      "loss": 1.7863,
      "num_input_tokens_seen": 9700037408,
      "step": 12329
    },
    {
      "epoch": 1.3080840229153405,
      "grad_norm": 0.38324831631624784,
      "learning_rate": 4.856927556320346e-05,
      "loss": 1.7682,
      "num_input_tokens_seen": 9700824160,
      "step": 12330
    },
    {
      "epoch": 1.308190112454912,
      "grad_norm": 0.502257667177878,
      "learning_rate": 4.856904382310388e-05,
      "loss": 1.9735,
      "num_input_tokens_seen": 9701610960,
      "step": 12331
    },
    {
      "epoch": 1.3082962019944833,
      "grad_norm": 0.4095586798887402,
      "learning_rate": 4.856881206479081e-05,
      "loss": 1.8023,
      "num_input_tokens_seen": 9702397712,
      "step": 12332
    },
    {
      "epoch": 1.3084022915340547,
      "grad_norm": 0.4369751980931197,
      "learning_rate": 4.8568580288264475e-05,
      "loss": 1.6172,
      "num_input_tokens_seen": 9703184576,
      "step": 12333
    },
    {
      "epoch": 1.3085083810736262,
      "grad_norm": 0.4782570456822158,
      "learning_rate": 4.8568348493525026e-05,
      "loss": 1.8363,
      "num_input_tokens_seen": 9703971248,
      "step": 12334
    },
    {
      "epoch": 1.3086144706131975,
      "grad_norm": 0.3985225244841047,
      "learning_rate": 4.856811668057265e-05,
      "loss": 1.7365,
      "num_input_tokens_seen": 9704757936,
      "step": 12335
    },
    {
      "epoch": 1.308720560152769,
      "grad_norm": 0.39819225319569407,
      "learning_rate": 4.856788484940752e-05,
      "loss": 1.7414,
      "num_input_tokens_seen": 9705544816,
      "step": 12336
    },
    {
      "epoch": 1.3088266496923404,
      "grad_norm": 0.387870353417658,
      "learning_rate": 4.856765300002982e-05,
      "loss": 1.8365,
      "num_input_tokens_seen": 9706331536,
      "step": 12337
    },
    {
      "epoch": 1.3089327392319117,
      "grad_norm": 0.4327716423534204,
      "learning_rate": 4.8567421132439737e-05,
      "loss": 1.843,
      "num_input_tokens_seen": 9707118240,
      "step": 12338
    },
    {
      "epoch": 1.3090388287714831,
      "grad_norm": 0.45981806414873055,
      "learning_rate": 4.8567189246637435e-05,
      "loss": 1.7303,
      "num_input_tokens_seen": 9707905072,
      "step": 12339
    },
    {
      "epoch": 1.3091449183110546,
      "grad_norm": 0.4401385368447314,
      "learning_rate": 4.8566957342623106e-05,
      "loss": 1.7735,
      "num_input_tokens_seen": 9708691840,
      "step": 12340
    },
    {
      "epoch": 1.3092510078506259,
      "grad_norm": 0.39124512283801943,
      "learning_rate": 4.856672542039692e-05,
      "loss": 1.6567,
      "num_input_tokens_seen": 9709478640,
      "step": 12341
    },
    {
      "epoch": 1.3093570973901973,
      "grad_norm": 0.40309212751218887,
      "learning_rate": 4.856649347995906e-05,
      "loss": 1.7907,
      "num_input_tokens_seen": 9710265392,
      "step": 12342
    },
    {
      "epoch": 1.3094631869297686,
      "grad_norm": 0.5070116003537485,
      "learning_rate": 4.856626152130971e-05,
      "loss": 1.8502,
      "num_input_tokens_seen": 9711052080,
      "step": 12343
    },
    {
      "epoch": 1.30956927646934,
      "grad_norm": 0.3536189195433771,
      "learning_rate": 4.8566029544449036e-05,
      "loss": 1.7868,
      "num_input_tokens_seen": 9711838864,
      "step": 12344
    },
    {
      "epoch": 1.3096753660089115,
      "grad_norm": 0.4592506359621515,
      "learning_rate": 4.8565797549377235e-05,
      "loss": 1.8575,
      "num_input_tokens_seen": 9712625568,
      "step": 12345
    },
    {
      "epoch": 1.309781455548483,
      "grad_norm": 0.5121033418294292,
      "learning_rate": 4.856556553609447e-05,
      "loss": 1.7737,
      "num_input_tokens_seen": 9713412304,
      "step": 12346
    },
    {
      "epoch": 1.3098875450880543,
      "grad_norm": 0.45448976098516447,
      "learning_rate": 4.856533350460093e-05,
      "loss": 1.8334,
      "num_input_tokens_seen": 9714199120,
      "step": 12347
    },
    {
      "epoch": 1.3099936346276257,
      "grad_norm": 0.4803866888389009,
      "learning_rate": 4.856510145489679e-05,
      "loss": 1.6935,
      "num_input_tokens_seen": 9714985968,
      "step": 12348
    },
    {
      "epoch": 1.310099724167197,
      "grad_norm": 0.37748613756334226,
      "learning_rate": 4.856486938698224e-05,
      "loss": 1.6581,
      "num_input_tokens_seen": 9715772816,
      "step": 12349
    },
    {
      "epoch": 1.3102058137067685,
      "grad_norm": 0.3806518293039525,
      "learning_rate": 4.856463730085744e-05,
      "loss": 1.7411,
      "num_input_tokens_seen": 9716559520,
      "step": 12350
    },
    {
      "epoch": 1.31031190324634,
      "grad_norm": 0.37089701292382166,
      "learning_rate": 4.8564405196522587e-05,
      "loss": 1.8091,
      "num_input_tokens_seen": 9717346128,
      "step": 12351
    },
    {
      "epoch": 1.3104179927859114,
      "grad_norm": 0.4592273645898112,
      "learning_rate": 4.856417307397785e-05,
      "loss": 1.9019,
      "num_input_tokens_seen": 9718132880,
      "step": 12352
    },
    {
      "epoch": 1.3105240823254827,
      "grad_norm": 0.3925785696108415,
      "learning_rate": 4.856394093322341e-05,
      "loss": 1.7247,
      "num_input_tokens_seen": 9718919584,
      "step": 12353
    },
    {
      "epoch": 1.3106301718650541,
      "grad_norm": 0.3787766064713306,
      "learning_rate": 4.856370877425944e-05,
      "loss": 1.6319,
      "num_input_tokens_seen": 9719706368,
      "step": 12354
    },
    {
      "epoch": 1.3107362614046254,
      "grad_norm": 0.3911301354058436,
      "learning_rate": 4.8563476597086146e-05,
      "loss": 1.7046,
      "num_input_tokens_seen": 9720493168,
      "step": 12355
    },
    {
      "epoch": 1.3108423509441969,
      "grad_norm": 0.39691316714980107,
      "learning_rate": 4.856324440170368e-05,
      "loss": 1.7146,
      "num_input_tokens_seen": 9721280000,
      "step": 12356
    },
    {
      "epoch": 1.3109484404837684,
      "grad_norm": 0.5057798652860566,
      "learning_rate": 4.856301218811222e-05,
      "loss": 1.8102,
      "num_input_tokens_seen": 9722066784,
      "step": 12357
    },
    {
      "epoch": 1.3110545300233398,
      "grad_norm": 0.40351010430919215,
      "learning_rate": 4.8562779956311966e-05,
      "loss": 1.7458,
      "num_input_tokens_seen": 9722853616,
      "step": 12358
    },
    {
      "epoch": 1.311160619562911,
      "grad_norm": 0.7221984497949621,
      "learning_rate": 4.856254770630309e-05,
      "loss": 1.8151,
      "num_input_tokens_seen": 9723640400,
      "step": 12359
    },
    {
      "epoch": 1.3112667091024826,
      "grad_norm": 0.3365097007247912,
      "learning_rate": 4.856231543808576e-05,
      "loss": 1.7074,
      "num_input_tokens_seen": 9724427264,
      "step": 12360
    },
    {
      "epoch": 1.3113727986420538,
      "grad_norm": 0.4671133209899547,
      "learning_rate": 4.856208315166017e-05,
      "loss": 1.7018,
      "num_input_tokens_seen": 9725214048,
      "step": 12361
    },
    {
      "epoch": 1.3114788881816253,
      "grad_norm": 0.5789279681753794,
      "learning_rate": 4.856185084702649e-05,
      "loss": 1.787,
      "num_input_tokens_seen": 9726000848,
      "step": 12362
    },
    {
      "epoch": 1.3115849777211968,
      "grad_norm": 0.4232643030186384,
      "learning_rate": 4.8561618524184905e-05,
      "loss": 1.8996,
      "num_input_tokens_seen": 9726787520,
      "step": 12363
    },
    {
      "epoch": 1.311691067260768,
      "grad_norm": 0.5025823713317469,
      "learning_rate": 4.856138618313559e-05,
      "loss": 1.7865,
      "num_input_tokens_seen": 9727574368,
      "step": 12364
    },
    {
      "epoch": 1.3117971568003395,
      "grad_norm": 0.39651057228155706,
      "learning_rate": 4.856115382387873e-05,
      "loss": 1.7696,
      "num_input_tokens_seen": 9728361184,
      "step": 12365
    },
    {
      "epoch": 1.311903246339911,
      "grad_norm": 0.42108326500531684,
      "learning_rate": 4.85609214464145e-05,
      "loss": 1.7633,
      "num_input_tokens_seen": 9729147856,
      "step": 12366
    },
    {
      "epoch": 1.3120093358794822,
      "grad_norm": 0.3695453652898695,
      "learning_rate": 4.856068905074308e-05,
      "loss": 1.7595,
      "num_input_tokens_seen": 9729934592,
      "step": 12367
    },
    {
      "epoch": 1.3121154254190537,
      "grad_norm": 0.6101222491991136,
      "learning_rate": 4.856045663686466e-05,
      "loss": 1.7541,
      "num_input_tokens_seen": 9730721328,
      "step": 12368
    },
    {
      "epoch": 1.3122215149586252,
      "grad_norm": 0.4083751849622719,
      "learning_rate": 4.8560224204779406e-05,
      "loss": 1.7571,
      "num_input_tokens_seen": 9731508096,
      "step": 12369
    },
    {
      "epoch": 1.3123276044981964,
      "grad_norm": 0.43175299483420454,
      "learning_rate": 4.855999175448749e-05,
      "loss": 1.8784,
      "num_input_tokens_seen": 9732294960,
      "step": 12370
    },
    {
      "epoch": 1.3124336940377679,
      "grad_norm": 0.5204046868867227,
      "learning_rate": 4.855975928598912e-05,
      "loss": 1.7044,
      "num_input_tokens_seen": 9733081760,
      "step": 12371
    },
    {
      "epoch": 1.3125397835773391,
      "grad_norm": 0.363705750336264,
      "learning_rate": 4.855952679928445e-05,
      "loss": 1.7708,
      "num_input_tokens_seen": 9733868560,
      "step": 12372
    },
    {
      "epoch": 1.3126458731169106,
      "grad_norm": 0.5605118514323645,
      "learning_rate": 4.855929429437367e-05,
      "loss": 1.8087,
      "num_input_tokens_seen": 9734655248,
      "step": 12373
    },
    {
      "epoch": 1.312751962656482,
      "grad_norm": 0.5709002449447911,
      "learning_rate": 4.855906177125696e-05,
      "loss": 1.751,
      "num_input_tokens_seen": 9735442032,
      "step": 12374
    },
    {
      "epoch": 1.3128580521960536,
      "grad_norm": 0.48488389543222377,
      "learning_rate": 4.85588292299345e-05,
      "loss": 1.7736,
      "num_input_tokens_seen": 9736228928,
      "step": 12375
    },
    {
      "epoch": 1.3129641417356248,
      "grad_norm": 1.1284715365159452,
      "learning_rate": 4.855859667040646e-05,
      "loss": 1.8524,
      "num_input_tokens_seen": 9737015760,
      "step": 12376
    },
    {
      "epoch": 1.3130702312751963,
      "grad_norm": 0.8499169874176625,
      "learning_rate": 4.8558364092673035e-05,
      "loss": 1.8812,
      "num_input_tokens_seen": 9737802480,
      "step": 12377
    },
    {
      "epoch": 1.3131763208147675,
      "grad_norm": 0.6045347586213133,
      "learning_rate": 4.85581314967344e-05,
      "loss": 1.7773,
      "num_input_tokens_seen": 9738589264,
      "step": 12378
    },
    {
      "epoch": 1.313282410354339,
      "grad_norm": 0.46875424174514835,
      "learning_rate": 4.8557898882590726e-05,
      "loss": 1.8112,
      "num_input_tokens_seen": 9739376032,
      "step": 12379
    },
    {
      "epoch": 1.3133884998939105,
      "grad_norm": 0.6915000102985432,
      "learning_rate": 4.85576662502422e-05,
      "loss": 1.6896,
      "num_input_tokens_seen": 9740162752,
      "step": 12380
    },
    {
      "epoch": 1.313494589433482,
      "grad_norm": 0.4537724578539327,
      "learning_rate": 4.855743359968901e-05,
      "loss": 1.7655,
      "num_input_tokens_seen": 9740949536,
      "step": 12381
    },
    {
      "epoch": 1.3136006789730532,
      "grad_norm": 0.5791389367899448,
      "learning_rate": 4.855720093093131e-05,
      "loss": 1.8298,
      "num_input_tokens_seen": 9741736240,
      "step": 12382
    },
    {
      "epoch": 1.3137067685126247,
      "grad_norm": 0.41485636540734555,
      "learning_rate": 4.855696824396931e-05,
      "loss": 1.6334,
      "num_input_tokens_seen": 9742522976,
      "step": 12383
    },
    {
      "epoch": 1.313812858052196,
      "grad_norm": 0.5565358333395997,
      "learning_rate": 4.8556735538803165e-05,
      "loss": 1.7984,
      "num_input_tokens_seen": 9743309712,
      "step": 12384
    },
    {
      "epoch": 1.3139189475917674,
      "grad_norm": 0.3816621002516493,
      "learning_rate": 4.855650281543308e-05,
      "loss": 1.6867,
      "num_input_tokens_seen": 9744096464,
      "step": 12385
    },
    {
      "epoch": 1.314025037131339,
      "grad_norm": 0.574735572675885,
      "learning_rate": 4.855627007385921e-05,
      "loss": 1.7062,
      "num_input_tokens_seen": 9744883216,
      "step": 12386
    },
    {
      "epoch": 1.3141311266709104,
      "grad_norm": 0.4552531395010213,
      "learning_rate": 4.855603731408175e-05,
      "loss": 1.7993,
      "num_input_tokens_seen": 9745669952,
      "step": 12387
    },
    {
      "epoch": 1.3142372162104816,
      "grad_norm": 0.43919018959965017,
      "learning_rate": 4.8555804536100865e-05,
      "loss": 1.6696,
      "num_input_tokens_seen": 9746456752,
      "step": 12388
    },
    {
      "epoch": 1.314343305750053,
      "grad_norm": 0.534582845320939,
      "learning_rate": 4.855557173991676e-05,
      "loss": 1.6972,
      "num_input_tokens_seen": 9747243504,
      "step": 12389
    },
    {
      "epoch": 1.3144493952896243,
      "grad_norm": 0.4790363532916556,
      "learning_rate": 4.85553389255296e-05,
      "loss": 1.9149,
      "num_input_tokens_seen": 9748030224,
      "step": 12390
    },
    {
      "epoch": 1.3145554848291958,
      "grad_norm": 0.4003100411210621,
      "learning_rate": 4.8555106092939554e-05,
      "loss": 1.7583,
      "num_input_tokens_seen": 9748816944,
      "step": 12391
    },
    {
      "epoch": 1.3146615743687673,
      "grad_norm": 0.41997791767703163,
      "learning_rate": 4.855487324214682e-05,
      "loss": 1.7523,
      "num_input_tokens_seen": 9749603808,
      "step": 12392
    },
    {
      "epoch": 1.3147676639083388,
      "grad_norm": 0.40755457006116597,
      "learning_rate": 4.855464037315157e-05,
      "loss": 1.7752,
      "num_input_tokens_seen": 9750390608,
      "step": 12393
    },
    {
      "epoch": 1.31487375344791,
      "grad_norm": 0.3836931484945754,
      "learning_rate": 4.855440748595399e-05,
      "loss": 1.7043,
      "num_input_tokens_seen": 9751177440,
      "step": 12394
    },
    {
      "epoch": 1.3149798429874815,
      "grad_norm": 0.39233256418094165,
      "learning_rate": 4.8554174580554246e-05,
      "loss": 1.7692,
      "num_input_tokens_seen": 9751964240,
      "step": 12395
    },
    {
      "epoch": 1.3150859325270527,
      "grad_norm": 0.46673295990308755,
      "learning_rate": 4.8553941656952535e-05,
      "loss": 1.588,
      "num_input_tokens_seen": 9752751120,
      "step": 12396
    },
    {
      "epoch": 1.3151920220666242,
      "grad_norm": 0.48556636351257126,
      "learning_rate": 4.855370871514903e-05,
      "loss": 1.7774,
      "num_input_tokens_seen": 9753537840,
      "step": 12397
    },
    {
      "epoch": 1.3152981116061957,
      "grad_norm": 0.3970970796188978,
      "learning_rate": 4.85534757551439e-05,
      "loss": 1.6857,
      "num_input_tokens_seen": 9754324624,
      "step": 12398
    },
    {
      "epoch": 1.315404201145767,
      "grad_norm": 0.5794983201803906,
      "learning_rate": 4.855324277693734e-05,
      "loss": 1.8043,
      "num_input_tokens_seen": 9755111392,
      "step": 12399
    },
    {
      "epoch": 1.3155102906853384,
      "grad_norm": 0.39930503846672866,
      "learning_rate": 4.855300978052952e-05,
      "loss": 1.6436,
      "num_input_tokens_seen": 9755898192,
      "step": 12400
    },
    {
      "epoch": 1.31561638022491,
      "grad_norm": 0.3670699681082826,
      "learning_rate": 4.855277676592064e-05,
      "loss": 1.7873,
      "num_input_tokens_seen": 9756684960,
      "step": 12401
    },
    {
      "epoch": 1.3157224697644812,
      "grad_norm": 0.5522439845980905,
      "learning_rate": 4.8552543733110855e-05,
      "loss": 1.869,
      "num_input_tokens_seen": 9757471744,
      "step": 12402
    },
    {
      "epoch": 1.3158285593040526,
      "grad_norm": 0.38219015475582074,
      "learning_rate": 4.855231068210035e-05,
      "loss": 1.6429,
      "num_input_tokens_seen": 9758258560,
      "step": 12403
    },
    {
      "epoch": 1.315934648843624,
      "grad_norm": 0.4122773198526554,
      "learning_rate": 4.8552077612889326e-05,
      "loss": 1.7574,
      "num_input_tokens_seen": 9759045216,
      "step": 12404
    },
    {
      "epoch": 1.3160407383831954,
      "grad_norm": 0.3820813572854077,
      "learning_rate": 4.8551844525477934e-05,
      "loss": 1.7365,
      "num_input_tokens_seen": 9759831968,
      "step": 12405
    },
    {
      "epoch": 1.3161468279227668,
      "grad_norm": 0.452642063350181,
      "learning_rate": 4.855161141986637e-05,
      "loss": 1.6702,
      "num_input_tokens_seen": 9760618768,
      "step": 12406
    },
    {
      "epoch": 1.316252917462338,
      "grad_norm": 0.4297183119792664,
      "learning_rate": 4.855137829605482e-05,
      "loss": 1.768,
      "num_input_tokens_seen": 9761405552,
      "step": 12407
    },
    {
      "epoch": 1.3163590070019096,
      "grad_norm": 0.3752123131012342,
      "learning_rate": 4.8551145154043444e-05,
      "loss": 1.6325,
      "num_input_tokens_seen": 9762192368,
      "step": 12408
    },
    {
      "epoch": 1.316465096541481,
      "grad_norm": 0.5095934387701594,
      "learning_rate": 4.855091199383244e-05,
      "loss": 1.8256,
      "num_input_tokens_seen": 9762979120,
      "step": 12409
    },
    {
      "epoch": 1.3165711860810525,
      "grad_norm": 0.41250012771382116,
      "learning_rate": 4.855067881542198e-05,
      "loss": 1.8201,
      "num_input_tokens_seen": 9763765808,
      "step": 12410
    },
    {
      "epoch": 1.3166772756206238,
      "grad_norm": 0.4505902167974201,
      "learning_rate": 4.855044561881225e-05,
      "loss": 1.8206,
      "num_input_tokens_seen": 9764552592,
      "step": 12411
    },
    {
      "epoch": 1.3167833651601952,
      "grad_norm": 0.45353869751749587,
      "learning_rate": 4.8550212404003424e-05,
      "loss": 1.8763,
      "num_input_tokens_seen": 9765339344,
      "step": 12412
    },
    {
      "epoch": 1.3168894546997665,
      "grad_norm": 0.4579200648776122,
      "learning_rate": 4.854997917099569e-05,
      "loss": 1.7085,
      "num_input_tokens_seen": 9766126192,
      "step": 12413
    },
    {
      "epoch": 1.316995544239338,
      "grad_norm": 0.5646698507268465,
      "learning_rate": 4.854974591978921e-05,
      "loss": 1.8317,
      "num_input_tokens_seen": 9766913040,
      "step": 12414
    },
    {
      "epoch": 1.3171016337789094,
      "grad_norm": 0.4451386098763412,
      "learning_rate": 4.8549512650384185e-05,
      "loss": 1.7761,
      "num_input_tokens_seen": 9767699760,
      "step": 12415
    },
    {
      "epoch": 1.317207723318481,
      "grad_norm": 0.449588156013196,
      "learning_rate": 4.85492793627808e-05,
      "loss": 1.8619,
      "num_input_tokens_seen": 9768486544,
      "step": 12416
    },
    {
      "epoch": 1.3173138128580522,
      "grad_norm": 0.4269595880193641,
      "learning_rate": 4.8549046056979206e-05,
      "loss": 1.818,
      "num_input_tokens_seen": 9769273312,
      "step": 12417
    },
    {
      "epoch": 1.3174199023976236,
      "grad_norm": 0.42700962040344825,
      "learning_rate": 4.8548812732979606e-05,
      "loss": 1.8732,
      "num_input_tokens_seen": 9770060096,
      "step": 12418
    },
    {
      "epoch": 1.3175259919371949,
      "grad_norm": 0.3807747197746499,
      "learning_rate": 4.854857939078218e-05,
      "loss": 1.7507,
      "num_input_tokens_seen": 9770846752,
      "step": 12419
    },
    {
      "epoch": 1.3176320814767664,
      "grad_norm": 0.3960647488563585,
      "learning_rate": 4.854834603038709e-05,
      "loss": 1.7649,
      "num_input_tokens_seen": 9771633424,
      "step": 12420
    },
    {
      "epoch": 1.3177381710163378,
      "grad_norm": 0.38710888154477907,
      "learning_rate": 4.854811265179454e-05,
      "loss": 1.8007,
      "num_input_tokens_seen": 9772420288,
      "step": 12421
    },
    {
      "epoch": 1.3178442605559093,
      "grad_norm": 0.4080357029827872,
      "learning_rate": 4.854787925500469e-05,
      "loss": 1.7753,
      "num_input_tokens_seen": 9773207088,
      "step": 12422
    },
    {
      "epoch": 1.3179503500954806,
      "grad_norm": 0.39564540970573847,
      "learning_rate": 4.8547645840017745e-05,
      "loss": 1.7953,
      "num_input_tokens_seen": 9773993840,
      "step": 12423
    },
    {
      "epoch": 1.318056439635052,
      "grad_norm": 0.4620448377323383,
      "learning_rate": 4.8547412406833856e-05,
      "loss": 1.7327,
      "num_input_tokens_seen": 9774780592,
      "step": 12424
    },
    {
      "epoch": 1.3181625291746233,
      "grad_norm": 0.37247809037368507,
      "learning_rate": 4.854717895545322e-05,
      "loss": 1.8003,
      "num_input_tokens_seen": 9775567344,
      "step": 12425
    },
    {
      "epoch": 1.3182686187141948,
      "grad_norm": 0.35642012338871243,
      "learning_rate": 4.854694548587602e-05,
      "loss": 1.7711,
      "num_input_tokens_seen": 9776354112,
      "step": 12426
    },
    {
      "epoch": 1.3183747082537662,
      "grad_norm": 0.4463485373976285,
      "learning_rate": 4.854671199810242e-05,
      "loss": 1.8766,
      "num_input_tokens_seen": 9777140880,
      "step": 12427
    },
    {
      "epoch": 1.3184807977933377,
      "grad_norm": 0.4363734975861617,
      "learning_rate": 4.854647849213263e-05,
      "loss": 1.7285,
      "num_input_tokens_seen": 9777927568,
      "step": 12428
    },
    {
      "epoch": 1.318586887332909,
      "grad_norm": 0.4717220821836745,
      "learning_rate": 4.85462449679668e-05,
      "loss": 1.9167,
      "num_input_tokens_seen": 9778714400,
      "step": 12429
    },
    {
      "epoch": 1.3186929768724804,
      "grad_norm": 0.3821177185087881,
      "learning_rate": 4.8546011425605124e-05,
      "loss": 1.7624,
      "num_input_tokens_seen": 9779501184,
      "step": 12430
    },
    {
      "epoch": 1.3187990664120517,
      "grad_norm": 0.3968947187914225,
      "learning_rate": 4.854577786504778e-05,
      "loss": 1.7458,
      "num_input_tokens_seen": 9780288032,
      "step": 12431
    },
    {
      "epoch": 1.3189051559516232,
      "grad_norm": 0.471385416534816,
      "learning_rate": 4.854554428629496e-05,
      "loss": 1.7343,
      "num_input_tokens_seen": 9781074768,
      "step": 12432
    },
    {
      "epoch": 1.3190112454911946,
      "grad_norm": 0.43283578598634365,
      "learning_rate": 4.8545310689346825e-05,
      "loss": 1.7597,
      "num_input_tokens_seen": 9781861584,
      "step": 12433
    },
    {
      "epoch": 1.319117335030766,
      "grad_norm": 0.40269706802177635,
      "learning_rate": 4.854507707420357e-05,
      "loss": 1.8395,
      "num_input_tokens_seen": 9782648256,
      "step": 12434
    },
    {
      "epoch": 1.3192234245703374,
      "grad_norm": 0.41655660095569114,
      "learning_rate": 4.854484344086536e-05,
      "loss": 1.8577,
      "num_input_tokens_seen": 9783434944,
      "step": 12435
    },
    {
      "epoch": 1.3193295141099088,
      "grad_norm": 0.3885719082223582,
      "learning_rate": 4.854460978933239e-05,
      "loss": 1.8452,
      "num_input_tokens_seen": 9784221680,
      "step": 12436
    },
    {
      "epoch": 1.31943560364948,
      "grad_norm": 0.3286769053207174,
      "learning_rate": 4.8544376119604843e-05,
      "loss": 1.7908,
      "num_input_tokens_seen": 9785008432,
      "step": 12437
    },
    {
      "epoch": 1.3195416931890516,
      "grad_norm": 0.39726904851427913,
      "learning_rate": 4.854414243168289e-05,
      "loss": 1.8801,
      "num_input_tokens_seen": 9785795088,
      "step": 12438
    },
    {
      "epoch": 1.319647782728623,
      "grad_norm": 0.3603719667015673,
      "learning_rate": 4.854390872556672e-05,
      "loss": 1.7899,
      "num_input_tokens_seen": 9786581888,
      "step": 12439
    },
    {
      "epoch": 1.3197538722681943,
      "grad_norm": 0.4042661659136609,
      "learning_rate": 4.8543675001256494e-05,
      "loss": 1.905,
      "num_input_tokens_seen": 9787368688,
      "step": 12440
    },
    {
      "epoch": 1.3198599618077658,
      "grad_norm": 0.3915141876349082,
      "learning_rate": 4.854344125875242e-05,
      "loss": 1.9129,
      "num_input_tokens_seen": 9788155488,
      "step": 12441
    },
    {
      "epoch": 1.319966051347337,
      "grad_norm": 0.322764293347628,
      "learning_rate": 4.8543207498054654e-05,
      "loss": 1.7101,
      "num_input_tokens_seen": 9788942304,
      "step": 12442
    },
    {
      "epoch": 1.3200721408869085,
      "grad_norm": 0.3880551222647786,
      "learning_rate": 4.8542973719163395e-05,
      "loss": 1.8119,
      "num_input_tokens_seen": 9789729040,
      "step": 12443
    },
    {
      "epoch": 1.32017823042648,
      "grad_norm": 0.3822866485473718,
      "learning_rate": 4.854273992207882e-05,
      "loss": 1.7485,
      "num_input_tokens_seen": 9790515744,
      "step": 12444
    },
    {
      "epoch": 1.3202843199660514,
      "grad_norm": 0.3687982751920189,
      "learning_rate": 4.85425061068011e-05,
      "loss": 1.6949,
      "num_input_tokens_seen": 9791302512,
      "step": 12445
    },
    {
      "epoch": 1.3203904095056227,
      "grad_norm": 0.4505015619057975,
      "learning_rate": 4.8542272273330425e-05,
      "loss": 1.7899,
      "num_input_tokens_seen": 9792089328,
      "step": 12446
    },
    {
      "epoch": 1.3204964990451942,
      "grad_norm": 0.36395464703679997,
      "learning_rate": 4.8542038421666975e-05,
      "loss": 1.7558,
      "num_input_tokens_seen": 9792876080,
      "step": 12447
    },
    {
      "epoch": 1.3206025885847654,
      "grad_norm": 0.4036763780256875,
      "learning_rate": 4.8541804551810924e-05,
      "loss": 1.7192,
      "num_input_tokens_seen": 9793662880,
      "step": 12448
    },
    {
      "epoch": 1.320708678124337,
      "grad_norm": 0.3730254127476918,
      "learning_rate": 4.854157066376246e-05,
      "loss": 1.8735,
      "num_input_tokens_seen": 9794449632,
      "step": 12449
    },
    {
      "epoch": 1.3208147676639084,
      "grad_norm": 0.48720762077514,
      "learning_rate": 4.854133675752176e-05,
      "loss": 1.6089,
      "num_input_tokens_seen": 9795236448,
      "step": 12450
    },
    {
      "epoch": 1.3209208572034798,
      "grad_norm": 0.3121948390070891,
      "learning_rate": 4.8541102833089003e-05,
      "loss": 1.6716,
      "num_input_tokens_seen": 9796023216,
      "step": 12451
    },
    {
      "epoch": 1.321026946743051,
      "grad_norm": 0.40661509648999705,
      "learning_rate": 4.854086889046437e-05,
      "loss": 1.6665,
      "num_input_tokens_seen": 9796810048,
      "step": 12452
    },
    {
      "epoch": 1.3211330362826226,
      "grad_norm": 0.4336156605827487,
      "learning_rate": 4.8540634929648055e-05,
      "loss": 1.6957,
      "num_input_tokens_seen": 9797596880,
      "step": 12453
    },
    {
      "epoch": 1.3212391258221938,
      "grad_norm": 0.35973477447042407,
      "learning_rate": 4.854040095064022e-05,
      "loss": 1.7455,
      "num_input_tokens_seen": 9798383616,
      "step": 12454
    },
    {
      "epoch": 1.3213452153617653,
      "grad_norm": 0.39355886223430775,
      "learning_rate": 4.8540166953441055e-05,
      "loss": 1.7302,
      "num_input_tokens_seen": 9799170352,
      "step": 12455
    },
    {
      "epoch": 1.3214513049013368,
      "grad_norm": 0.38375895201572285,
      "learning_rate": 4.8539932938050744e-05,
      "loss": 1.7793,
      "num_input_tokens_seen": 9799957072,
      "step": 12456
    },
    {
      "epoch": 1.3215573944409083,
      "grad_norm": 0.399776207599047,
      "learning_rate": 4.853969890446946e-05,
      "loss": 1.9275,
      "num_input_tokens_seen": 9800743760,
      "step": 12457
    },
    {
      "epoch": 1.3216634839804795,
      "grad_norm": 0.39034549859413653,
      "learning_rate": 4.853946485269739e-05,
      "loss": 1.725,
      "num_input_tokens_seen": 9801530512,
      "step": 12458
    },
    {
      "epoch": 1.321769573520051,
      "grad_norm": 0.3641708287922413,
      "learning_rate": 4.853923078273471e-05,
      "loss": 1.6415,
      "num_input_tokens_seen": 9802317328,
      "step": 12459
    },
    {
      "epoch": 1.3218756630596222,
      "grad_norm": 0.42101700974228407,
      "learning_rate": 4.85389966945816e-05,
      "loss": 1.9156,
      "num_input_tokens_seen": 9803104096,
      "step": 12460
    },
    {
      "epoch": 1.3219817525991937,
      "grad_norm": 0.3532900545978968,
      "learning_rate": 4.8538762588238245e-05,
      "loss": 1.8235,
      "num_input_tokens_seen": 9803890800,
      "step": 12461
    },
    {
      "epoch": 1.3220878421387652,
      "grad_norm": 0.37914861869832495,
      "learning_rate": 4.853852846370483e-05,
      "loss": 1.7391,
      "num_input_tokens_seen": 9804677568,
      "step": 12462
    },
    {
      "epoch": 1.3221939316783367,
      "grad_norm": 0.41076905592362045,
      "learning_rate": 4.853829432098153e-05,
      "loss": 1.7202,
      "num_input_tokens_seen": 9805464304,
      "step": 12463
    },
    {
      "epoch": 1.322300021217908,
      "grad_norm": 0.34373511908857757,
      "learning_rate": 4.8538060160068525e-05,
      "loss": 1.7266,
      "num_input_tokens_seen": 9806251104,
      "step": 12464
    },
    {
      "epoch": 1.3224061107574794,
      "grad_norm": 0.38147620452287684,
      "learning_rate": 4.853782598096599e-05,
      "loss": 1.7665,
      "num_input_tokens_seen": 9807037952,
      "step": 12465
    },
    {
      "epoch": 1.3225122002970506,
      "grad_norm": 0.4529684157366547,
      "learning_rate": 4.853759178367413e-05,
      "loss": 1.9489,
      "num_input_tokens_seen": 9807824608,
      "step": 12466
    },
    {
      "epoch": 1.322618289836622,
      "grad_norm": 0.41451407555917197,
      "learning_rate": 4.85373575681931e-05,
      "loss": 1.9116,
      "num_input_tokens_seen": 9808611360,
      "step": 12467
    },
    {
      "epoch": 1.3227243793761936,
      "grad_norm": 0.45541882753718055,
      "learning_rate": 4.853712333452309e-05,
      "loss": 1.9264,
      "num_input_tokens_seen": 9809398128,
      "step": 12468
    },
    {
      "epoch": 1.3228304689157648,
      "grad_norm": 0.412983529539172,
      "learning_rate": 4.8536889082664286e-05,
      "loss": 1.8054,
      "num_input_tokens_seen": 9810184880,
      "step": 12469
    },
    {
      "epoch": 1.3229365584553363,
      "grad_norm": 0.45126956831648524,
      "learning_rate": 4.853665481261685e-05,
      "loss": 1.6382,
      "num_input_tokens_seen": 9810971696,
      "step": 12470
    },
    {
      "epoch": 1.3230426479949078,
      "grad_norm": 0.39745241573813833,
      "learning_rate": 4.8536420524381e-05,
      "loss": 1.8457,
      "num_input_tokens_seen": 9811758416,
      "step": 12471
    },
    {
      "epoch": 1.323148737534479,
      "grad_norm": 0.38815164457381024,
      "learning_rate": 4.853618621795688e-05,
      "loss": 1.7702,
      "num_input_tokens_seen": 9812545184,
      "step": 12472
    },
    {
      "epoch": 1.3232548270740505,
      "grad_norm": 0.4020129058291973,
      "learning_rate": 4.853595189334469e-05,
      "loss": 1.8296,
      "num_input_tokens_seen": 9813332080,
      "step": 12473
    },
    {
      "epoch": 1.323360916613622,
      "grad_norm": 0.44878202829645486,
      "learning_rate": 4.8535717550544605e-05,
      "loss": 1.7864,
      "num_input_tokens_seen": 9814118768,
      "step": 12474
    },
    {
      "epoch": 1.3234670061531932,
      "grad_norm": 0.3881920090617533,
      "learning_rate": 4.8535483189556815e-05,
      "loss": 1.738,
      "num_input_tokens_seen": 9814905488,
      "step": 12475
    },
    {
      "epoch": 1.3235730956927647,
      "grad_norm": 0.42259718116313155,
      "learning_rate": 4.8535248810381486e-05,
      "loss": 1.6868,
      "num_input_tokens_seen": 9815692208,
      "step": 12476
    },
    {
      "epoch": 1.323679185232336,
      "grad_norm": 0.38778478082742757,
      "learning_rate": 4.853501441301881e-05,
      "loss": 1.7852,
      "num_input_tokens_seen": 9816478960,
      "step": 12477
    },
    {
      "epoch": 1.3237852747719074,
      "grad_norm": 0.3829841925696214,
      "learning_rate": 4.853477999746897e-05,
      "loss": 1.7839,
      "num_input_tokens_seen": 9817265648,
      "step": 12478
    },
    {
      "epoch": 1.323891364311479,
      "grad_norm": 0.38947758900001256,
      "learning_rate": 4.8534545563732137e-05,
      "loss": 1.604,
      "num_input_tokens_seen": 9818052384,
      "step": 12479
    },
    {
      "epoch": 1.3239974538510504,
      "grad_norm": 0.46601014515665706,
      "learning_rate": 4.85343111118085e-05,
      "loss": 1.7248,
      "num_input_tokens_seen": 9818839120,
      "step": 12480
    },
    {
      "epoch": 1.3241035433906216,
      "grad_norm": 0.3806034217814536,
      "learning_rate": 4.853407664169824e-05,
      "loss": 1.6489,
      "num_input_tokens_seen": 9819625936,
      "step": 12481
    },
    {
      "epoch": 1.3242096329301931,
      "grad_norm": 0.5602220457780911,
      "learning_rate": 4.853384215340153e-05,
      "loss": 1.8813,
      "num_input_tokens_seen": 9820412688,
      "step": 12482
    },
    {
      "epoch": 1.3243157224697644,
      "grad_norm": 0.36481584906342246,
      "learning_rate": 4.8533607646918566e-05,
      "loss": 1.8592,
      "num_input_tokens_seen": 9821199472,
      "step": 12483
    },
    {
      "epoch": 1.3244218120093358,
      "grad_norm": 0.4371378181953821,
      "learning_rate": 4.853337312224951e-05,
      "loss": 1.6969,
      "num_input_tokens_seen": 9821986224,
      "step": 12484
    },
    {
      "epoch": 1.3245279015489073,
      "grad_norm": 0.43579402057809213,
      "learning_rate": 4.853313857939456e-05,
      "loss": 1.7501,
      "num_input_tokens_seen": 9822773008,
      "step": 12485
    },
    {
      "epoch": 1.3246339910884788,
      "grad_norm": 0.4707413104570074,
      "learning_rate": 4.853290401835389e-05,
      "loss": 1.9766,
      "num_input_tokens_seen": 9823559680,
      "step": 12486
    },
    {
      "epoch": 1.32474008062805,
      "grad_norm": 0.6198159696756642,
      "learning_rate": 4.853266943912769e-05,
      "loss": 1.8914,
      "num_input_tokens_seen": 9824346448,
      "step": 12487
    },
    {
      "epoch": 1.3248461701676215,
      "grad_norm": 0.3677256293573298,
      "learning_rate": 4.8532434841716124e-05,
      "loss": 1.673,
      "num_input_tokens_seen": 9825133232,
      "step": 12488
    },
    {
      "epoch": 1.3249522597071928,
      "grad_norm": 0.5699007818985853,
      "learning_rate": 4.8532200226119385e-05,
      "loss": 1.7694,
      "num_input_tokens_seen": 9825920000,
      "step": 12489
    },
    {
      "epoch": 1.3250583492467642,
      "grad_norm": 0.47108019123072614,
      "learning_rate": 4.853196559233765e-05,
      "loss": 1.7767,
      "num_input_tokens_seen": 9826706832,
      "step": 12490
    },
    {
      "epoch": 1.3251644387863357,
      "grad_norm": 0.4360900049418875,
      "learning_rate": 4.85317309403711e-05,
      "loss": 1.7207,
      "num_input_tokens_seen": 9827493584,
      "step": 12491
    },
    {
      "epoch": 1.3252705283259072,
      "grad_norm": 0.9009154343874404,
      "learning_rate": 4.8531496270219926e-05,
      "loss": 1.9075,
      "num_input_tokens_seen": 9828280352,
      "step": 12492
    },
    {
      "epoch": 1.3253766178654784,
      "grad_norm": 0.7477698918563642,
      "learning_rate": 4.85312615818843e-05,
      "loss": 1.7278,
      "num_input_tokens_seen": 9829067088,
      "step": 12493
    },
    {
      "epoch": 1.32548270740505,
      "grad_norm": 1.3928745604978496,
      "learning_rate": 4.853102687536441e-05,
      "loss": 1.8279,
      "num_input_tokens_seen": 9829853872,
      "step": 12494
    },
    {
      "epoch": 1.3255887969446212,
      "grad_norm": 0.8225318289182594,
      "learning_rate": 4.853079215066042e-05,
      "loss": 1.8625,
      "num_input_tokens_seen": 9830640576,
      "step": 12495
    },
    {
      "epoch": 1.3256948864841926,
      "grad_norm": 1.9265595031822356,
      "learning_rate": 4.853055740777254e-05,
      "loss": 1.8072,
      "num_input_tokens_seen": 9831427280,
      "step": 12496
    },
    {
      "epoch": 1.3258009760237641,
      "grad_norm": 0.47789543629792725,
      "learning_rate": 4.853032264670092e-05,
      "loss": 1.7769,
      "num_input_tokens_seen": 9832213952,
      "step": 12497
    },
    {
      "epoch": 1.3259070655633354,
      "grad_norm": 2.968563858924793,
      "learning_rate": 4.8530087867445766e-05,
      "loss": 1.6704,
      "num_input_tokens_seen": 9833000768,
      "step": 12498
    },
    {
      "epoch": 1.3260131551029068,
      "grad_norm": 0.5107315534100821,
      "learning_rate": 4.852985307000725e-05,
      "loss": 1.7481,
      "num_input_tokens_seen": 9833787520,
      "step": 12499
    },
    {
      "epoch": 1.3261192446424783,
      "grad_norm": 0.8846192692549371,
      "learning_rate": 4.8529618254385556e-05,
      "loss": 1.8816,
      "num_input_tokens_seen": 9834574272,
      "step": 12500
    },
    {
      "epoch": 1.3262253341820496,
      "grad_norm": 0.579301610697021,
      "learning_rate": 4.852938342058085e-05,
      "loss": 1.7113,
      "num_input_tokens_seen": 9835361072,
      "step": 12501
    },
    {
      "epoch": 1.326331423721621,
      "grad_norm": 0.5857971141672657,
      "learning_rate": 4.852914856859334e-05,
      "loss": 1.7345,
      "num_input_tokens_seen": 9836147824,
      "step": 12502
    },
    {
      "epoch": 1.3264375132611925,
      "grad_norm": 0.8241598975059495,
      "learning_rate": 4.8528913698423196e-05,
      "loss": 1.8264,
      "num_input_tokens_seen": 9836934592,
      "step": 12503
    },
    {
      "epoch": 1.3265436028007638,
      "grad_norm": 0.4145359526852498,
      "learning_rate": 4.852867881007059e-05,
      "loss": 1.852,
      "num_input_tokens_seen": 9837721296,
      "step": 12504
    },
    {
      "epoch": 1.3266496923403353,
      "grad_norm": 0.6730537294124165,
      "learning_rate": 4.852844390353572e-05,
      "loss": 1.6971,
      "num_input_tokens_seen": 9838508048,
      "step": 12505
    },
    {
      "epoch": 1.3267557818799065,
      "grad_norm": 0.47459699128082417,
      "learning_rate": 4.8528208978818754e-05,
      "loss": 1.6899,
      "num_input_tokens_seen": 9839294832,
      "step": 12506
    },
    {
      "epoch": 1.326861871419478,
      "grad_norm": 0.4369351364403994,
      "learning_rate": 4.852797403591988e-05,
      "loss": 1.7025,
      "num_input_tokens_seen": 9840081568,
      "step": 12507
    },
    {
      "epoch": 1.3269679609590495,
      "grad_norm": 0.6629074720013556,
      "learning_rate": 4.852773907483927e-05,
      "loss": 1.859,
      "num_input_tokens_seen": 9840868272,
      "step": 12508
    },
    {
      "epoch": 1.327074050498621,
      "grad_norm": 0.455692776512192,
      "learning_rate": 4.852750409557713e-05,
      "loss": 1.8696,
      "num_input_tokens_seen": 9841655120,
      "step": 12509
    },
    {
      "epoch": 1.3271801400381922,
      "grad_norm": 0.45995077029429376,
      "learning_rate": 4.852726909813361e-05,
      "loss": 1.6914,
      "num_input_tokens_seen": 9842441920,
      "step": 12510
    },
    {
      "epoch": 1.3272862295777637,
      "grad_norm": 0.4522558118504334,
      "learning_rate": 4.8527034082508915e-05,
      "loss": 1.9029,
      "num_input_tokens_seen": 9843228624,
      "step": 12511
    },
    {
      "epoch": 1.327392319117335,
      "grad_norm": 0.49143615897617315,
      "learning_rate": 4.852679904870321e-05,
      "loss": 1.8571,
      "num_input_tokens_seen": 9844015408,
      "step": 12512
    },
    {
      "epoch": 1.3274984086569064,
      "grad_norm": 0.4117743371120269,
      "learning_rate": 4.852656399671669e-05,
      "loss": 1.7571,
      "num_input_tokens_seen": 9844802192,
      "step": 12513
    },
    {
      "epoch": 1.3276044981964779,
      "grad_norm": 0.46837257602957055,
      "learning_rate": 4.8526328926549534e-05,
      "loss": 1.8228,
      "num_input_tokens_seen": 9845588880,
      "step": 12514
    },
    {
      "epoch": 1.3277105877360493,
      "grad_norm": 0.38744580178563265,
      "learning_rate": 4.852609383820193e-05,
      "loss": 1.7784,
      "num_input_tokens_seen": 9846375632,
      "step": 12515
    },
    {
      "epoch": 1.3278166772756206,
      "grad_norm": 0.5122757695497604,
      "learning_rate": 4.8525858731674033e-05,
      "loss": 1.7719,
      "num_input_tokens_seen": 9847162368,
      "step": 12516
    },
    {
      "epoch": 1.327922766815192,
      "grad_norm": 0.37605642578568105,
      "learning_rate": 4.852562360696605e-05,
      "loss": 1.8807,
      "num_input_tokens_seen": 9847949120,
      "step": 12517
    },
    {
      "epoch": 1.3280288563547633,
      "grad_norm": 0.4874460175822987,
      "learning_rate": 4.852538846407815e-05,
      "loss": 1.8218,
      "num_input_tokens_seen": 9848735824,
      "step": 12518
    },
    {
      "epoch": 1.3281349458943348,
      "grad_norm": 0.4375147665383524,
      "learning_rate": 4.852515330301053e-05,
      "loss": 1.8736,
      "num_input_tokens_seen": 9849522656,
      "step": 12519
    },
    {
      "epoch": 1.3282410354339063,
      "grad_norm": 0.43100685521620824,
      "learning_rate": 4.8524918123763355e-05,
      "loss": 1.7818,
      "num_input_tokens_seen": 9850309360,
      "step": 12520
    },
    {
      "epoch": 1.3283471249734777,
      "grad_norm": 0.4571777564748626,
      "learning_rate": 4.852468292633682e-05,
      "loss": 1.8391,
      "num_input_tokens_seen": 9851096016,
      "step": 12521
    },
    {
      "epoch": 1.328453214513049,
      "grad_norm": 0.37394475784764963,
      "learning_rate": 4.852444771073109e-05,
      "loss": 1.7244,
      "num_input_tokens_seen": 9851882864,
      "step": 12522
    },
    {
      "epoch": 1.3285593040526205,
      "grad_norm": 0.4921702669575132,
      "learning_rate": 4.852421247694637e-05,
      "loss": 1.7157,
      "num_input_tokens_seen": 9852669600,
      "step": 12523
    },
    {
      "epoch": 1.3286653935921917,
      "grad_norm": 0.3969089901942959,
      "learning_rate": 4.852397722498282e-05,
      "loss": 1.8113,
      "num_input_tokens_seen": 9853456368,
      "step": 12524
    },
    {
      "epoch": 1.3287714831317632,
      "grad_norm": 0.4309581219526382,
      "learning_rate": 4.852374195484063e-05,
      "loss": 1.7141,
      "num_input_tokens_seen": 9854243136,
      "step": 12525
    },
    {
      "epoch": 1.3288775726713347,
      "grad_norm": 0.402743306339061,
      "learning_rate": 4.852350666651999e-05,
      "loss": 1.7825,
      "num_input_tokens_seen": 9855029888,
      "step": 12526
    },
    {
      "epoch": 1.3289836622109061,
      "grad_norm": 0.36577383483486825,
      "learning_rate": 4.8523271360021065e-05,
      "loss": 1.8096,
      "num_input_tokens_seen": 9855816656,
      "step": 12527
    },
    {
      "epoch": 1.3290897517504774,
      "grad_norm": 0.3878090196880531,
      "learning_rate": 4.852303603534405e-05,
      "loss": 1.6994,
      "num_input_tokens_seen": 9856603504,
      "step": 12528
    },
    {
      "epoch": 1.3291958412900489,
      "grad_norm": 0.4039662818417003,
      "learning_rate": 4.8522800692489125e-05,
      "loss": 1.7892,
      "num_input_tokens_seen": 9857390240,
      "step": 12529
    },
    {
      "epoch": 1.3293019308296201,
      "grad_norm": 0.3413249035325591,
      "learning_rate": 4.8522565331456474e-05,
      "loss": 1.728,
      "num_input_tokens_seen": 9858176992,
      "step": 12530
    },
    {
      "epoch": 1.3294080203691916,
      "grad_norm": 0.4499391733730759,
      "learning_rate": 4.8522329952246264e-05,
      "loss": 1.753,
      "num_input_tokens_seen": 9858963760,
      "step": 12531
    },
    {
      "epoch": 1.329514109908763,
      "grad_norm": 0.406763506927068,
      "learning_rate": 4.8522094554858694e-05,
      "loss": 1.8761,
      "num_input_tokens_seen": 9859750464,
      "step": 12532
    },
    {
      "epoch": 1.3296201994483343,
      "grad_norm": 0.44414840523990917,
      "learning_rate": 4.852185913929393e-05,
      "loss": 1.781,
      "num_input_tokens_seen": 9860537232,
      "step": 12533
    },
    {
      "epoch": 1.3297262889879058,
      "grad_norm": 0.4144058355698526,
      "learning_rate": 4.8521623705552176e-05,
      "loss": 1.8935,
      "num_input_tokens_seen": 9861323968,
      "step": 12534
    },
    {
      "epoch": 1.3298323785274773,
      "grad_norm": 0.4032626814648756,
      "learning_rate": 4.85213882536336e-05,
      "loss": 1.7562,
      "num_input_tokens_seen": 9862110656,
      "step": 12535
    },
    {
      "epoch": 1.3299384680670485,
      "grad_norm": 0.4604307507498241,
      "learning_rate": 4.852115278353838e-05,
      "loss": 1.8527,
      "num_input_tokens_seen": 9862897440,
      "step": 12536
    },
    {
      "epoch": 1.33004455760662,
      "grad_norm": 0.4834959180016342,
      "learning_rate": 4.852091729526671e-05,
      "loss": 1.8948,
      "num_input_tokens_seen": 9863684224,
      "step": 12537
    },
    {
      "epoch": 1.3301506471461915,
      "grad_norm": 0.5354332483356196,
      "learning_rate": 4.852068178881876e-05,
      "loss": 1.765,
      "num_input_tokens_seen": 9864470992,
      "step": 12538
    },
    {
      "epoch": 1.3302567366857627,
      "grad_norm": 0.5483988619486714,
      "learning_rate": 4.8520446264194716e-05,
      "loss": 1.8535,
      "num_input_tokens_seen": 9865257712,
      "step": 12539
    },
    {
      "epoch": 1.3303628262253342,
      "grad_norm": 0.4642128668211081,
      "learning_rate": 4.8520210721394763e-05,
      "loss": 1.689,
      "num_input_tokens_seen": 9866044576,
      "step": 12540
    },
    {
      "epoch": 1.3304689157649054,
      "grad_norm": 0.5382639750992125,
      "learning_rate": 4.851997516041908e-05,
      "loss": 1.6616,
      "num_input_tokens_seen": 9866831248,
      "step": 12541
    },
    {
      "epoch": 1.330575005304477,
      "grad_norm": 0.3844596955943317,
      "learning_rate": 4.851973958126785e-05,
      "loss": 1.7186,
      "num_input_tokens_seen": 9867618096,
      "step": 12542
    },
    {
      "epoch": 1.3306810948440484,
      "grad_norm": 0.4345644299870111,
      "learning_rate": 4.8519503983941264e-05,
      "loss": 1.6015,
      "num_input_tokens_seen": 9868404864,
      "step": 12543
    },
    {
      "epoch": 1.3307871843836199,
      "grad_norm": 0.4770566639275342,
      "learning_rate": 4.8519268368439485e-05,
      "loss": 1.9507,
      "num_input_tokens_seen": 9869191664,
      "step": 12544
    },
    {
      "epoch": 1.3308932739231911,
      "grad_norm": 0.35473700435401334,
      "learning_rate": 4.851903273476271e-05,
      "loss": 1.6422,
      "num_input_tokens_seen": 9869978544,
      "step": 12545
    },
    {
      "epoch": 1.3309993634627626,
      "grad_norm": 0.3604836967781251,
      "learning_rate": 4.8518797082911114e-05,
      "loss": 1.7275,
      "num_input_tokens_seen": 9870765280,
      "step": 12546
    },
    {
      "epoch": 1.3311054530023338,
      "grad_norm": 0.42034685879133854,
      "learning_rate": 4.851856141288488e-05,
      "loss": 1.7987,
      "num_input_tokens_seen": 9871551984,
      "step": 12547
    },
    {
      "epoch": 1.3312115425419053,
      "grad_norm": 0.38438410761744257,
      "learning_rate": 4.85183257246842e-05,
      "loss": 1.784,
      "num_input_tokens_seen": 9872338784,
      "step": 12548
    },
    {
      "epoch": 1.3313176320814768,
      "grad_norm": 0.4197482295181419,
      "learning_rate": 4.8518090018309245e-05,
      "loss": 1.7855,
      "num_input_tokens_seen": 9873125584,
      "step": 12549
    },
    {
      "epoch": 1.3314237216210483,
      "grad_norm": 0.42647785471431626,
      "learning_rate": 4.8517854293760194e-05,
      "loss": 1.7754,
      "num_input_tokens_seen": 9873912400,
      "step": 12550
    },
    {
      "epoch": 1.3315298111606195,
      "grad_norm": 0.4299664569598446,
      "learning_rate": 4.8517618551037244e-05,
      "loss": 1.9333,
      "num_input_tokens_seen": 9874699136,
      "step": 12551
    },
    {
      "epoch": 1.331635900700191,
      "grad_norm": 0.5056128879673005,
      "learning_rate": 4.8517382790140565e-05,
      "loss": 1.6843,
      "num_input_tokens_seen": 9875485872,
      "step": 12552
    },
    {
      "epoch": 1.3317419902397623,
      "grad_norm": 0.4177878306341513,
      "learning_rate": 4.851714701107034e-05,
      "loss": 1.643,
      "num_input_tokens_seen": 9876272624,
      "step": 12553
    },
    {
      "epoch": 1.3318480797793337,
      "grad_norm": 0.40541222274796335,
      "learning_rate": 4.851691121382675e-05,
      "loss": 1.8391,
      "num_input_tokens_seen": 9877059424,
      "step": 12554
    },
    {
      "epoch": 1.3319541693189052,
      "grad_norm": 0.35488497853699236,
      "learning_rate": 4.851667539840999e-05,
      "loss": 1.6733,
      "num_input_tokens_seen": 9877846176,
      "step": 12555
    },
    {
      "epoch": 1.3320602588584767,
      "grad_norm": 0.42321524771201857,
      "learning_rate": 4.8516439564820226e-05,
      "loss": 1.91,
      "num_input_tokens_seen": 9878632864,
      "step": 12556
    },
    {
      "epoch": 1.332166348398048,
      "grad_norm": 0.5505027249432857,
      "learning_rate": 4.8516203713057654e-05,
      "loss": 1.7058,
      "num_input_tokens_seen": 9879419664,
      "step": 12557
    },
    {
      "epoch": 1.3322724379376194,
      "grad_norm": 0.382094505841028,
      "learning_rate": 4.8515967843122444e-05,
      "loss": 1.6315,
      "num_input_tokens_seen": 9880206560,
      "step": 12558
    },
    {
      "epoch": 1.3323785274771907,
      "grad_norm": 0.5217798258267797,
      "learning_rate": 4.8515731955014786e-05,
      "loss": 1.7301,
      "num_input_tokens_seen": 9880993312,
      "step": 12559
    },
    {
      "epoch": 1.3324846170167621,
      "grad_norm": 0.3454566135360458,
      "learning_rate": 4.851549604873486e-05,
      "loss": 1.6297,
      "num_input_tokens_seen": 9881780096,
      "step": 12560
    },
    {
      "epoch": 1.3325907065563336,
      "grad_norm": 0.42687874457650155,
      "learning_rate": 4.851526012428286e-05,
      "loss": 1.7533,
      "num_input_tokens_seen": 9882566832,
      "step": 12561
    },
    {
      "epoch": 1.332696796095905,
      "grad_norm": 0.5059828926833528,
      "learning_rate": 4.851502418165894e-05,
      "loss": 1.8412,
      "num_input_tokens_seen": 9883353488,
      "step": 12562
    },
    {
      "epoch": 1.3328028856354763,
      "grad_norm": 0.5154628771495696,
      "learning_rate": 4.851478822086331e-05,
      "loss": 1.8181,
      "num_input_tokens_seen": 9884140288,
      "step": 12563
    },
    {
      "epoch": 1.3329089751750478,
      "grad_norm": 0.4796818811574811,
      "learning_rate": 4.851455224189614e-05,
      "loss": 1.7324,
      "num_input_tokens_seen": 9884927072,
      "step": 12564
    },
    {
      "epoch": 1.333015064714619,
      "grad_norm": 0.5235971551196642,
      "learning_rate": 4.8514316244757605e-05,
      "loss": 1.809,
      "num_input_tokens_seen": 9885713872,
      "step": 12565
    },
    {
      "epoch": 1.3331211542541905,
      "grad_norm": 0.5760247329569802,
      "learning_rate": 4.851408022944791e-05,
      "loss": 1.7448,
      "num_input_tokens_seen": 9886500640,
      "step": 12566
    },
    {
      "epoch": 1.333227243793762,
      "grad_norm": 0.4360924130088931,
      "learning_rate": 4.8513844195967215e-05,
      "loss": 1.8261,
      "num_input_tokens_seen": 9887287408,
      "step": 12567
    },
    {
      "epoch": 1.3333333333333333,
      "grad_norm": 1.0462923549978016,
      "learning_rate": 4.8513608144315716e-05,
      "loss": 1.9051,
      "num_input_tokens_seen": 9888074192,
      "step": 12568
    },
    {
      "epoch": 1.3334394228729047,
      "grad_norm": 0.4649869850173885,
      "learning_rate": 4.8513372074493585e-05,
      "loss": 1.7902,
      "num_input_tokens_seen": 9888861024,
      "step": 12569
    },
    {
      "epoch": 1.3335455124124762,
      "grad_norm": 1.1696441357789085,
      "learning_rate": 4.851313598650101e-05,
      "loss": 1.8262,
      "num_input_tokens_seen": 9889647760,
      "step": 12570
    },
    {
      "epoch": 1.3336516019520475,
      "grad_norm": 0.5081781212866622,
      "learning_rate": 4.851289988033818e-05,
      "loss": 1.8744,
      "num_input_tokens_seen": 9890434512,
      "step": 12571
    },
    {
      "epoch": 1.333757691491619,
      "grad_norm": 0.6316896177013003,
      "learning_rate": 4.8512663756005263e-05,
      "loss": 1.7766,
      "num_input_tokens_seen": 9891221280,
      "step": 12572
    },
    {
      "epoch": 1.3338637810311904,
      "grad_norm": 0.45909269091251564,
      "learning_rate": 4.8512427613502454e-05,
      "loss": 1.6847,
      "num_input_tokens_seen": 9892007984,
      "step": 12573
    },
    {
      "epoch": 1.3339698705707617,
      "grad_norm": 0.4926974195992021,
      "learning_rate": 4.8512191452829934e-05,
      "loss": 1.7769,
      "num_input_tokens_seen": 9892794784,
      "step": 12574
    },
    {
      "epoch": 1.3340759601103331,
      "grad_norm": 0.5737442764776743,
      "learning_rate": 4.851195527398787e-05,
      "loss": 1.7661,
      "num_input_tokens_seen": 9893581584,
      "step": 12575
    },
    {
      "epoch": 1.3341820496499044,
      "grad_norm": 0.44914150729766283,
      "learning_rate": 4.851171907697647e-05,
      "loss": 1.8009,
      "num_input_tokens_seen": 9894368336,
      "step": 12576
    },
    {
      "epoch": 1.3342881391894759,
      "grad_norm": 0.40968978458308764,
      "learning_rate": 4.85114828617959e-05,
      "loss": 1.7636,
      "num_input_tokens_seen": 9895155200,
      "step": 12577
    },
    {
      "epoch": 1.3343942287290473,
      "grad_norm": 0.3998850873515683,
      "learning_rate": 4.851124662844635e-05,
      "loss": 1.7897,
      "num_input_tokens_seen": 9895941952,
      "step": 12578
    },
    {
      "epoch": 1.3345003182686188,
      "grad_norm": 0.355540461627775,
      "learning_rate": 4.851101037692799e-05,
      "loss": 1.7387,
      "num_input_tokens_seen": 9896728672,
      "step": 12579
    },
    {
      "epoch": 1.33460640780819,
      "grad_norm": 0.3809298873398636,
      "learning_rate": 4.851077410724101e-05,
      "loss": 1.6856,
      "num_input_tokens_seen": 9897515472,
      "step": 12580
    },
    {
      "epoch": 1.3347124973477615,
      "grad_norm": 0.3847623441147994,
      "learning_rate": 4.8510537819385606e-05,
      "loss": 1.8179,
      "num_input_tokens_seen": 9898302240,
      "step": 12581
    },
    {
      "epoch": 1.3348185868873328,
      "grad_norm": 0.4114729875371485,
      "learning_rate": 4.8510301513361934e-05,
      "loss": 1.8482,
      "num_input_tokens_seen": 9899088896,
      "step": 12582
    },
    {
      "epoch": 1.3349246764269043,
      "grad_norm": 0.3616467523103609,
      "learning_rate": 4.85100651891702e-05,
      "loss": 1.6752,
      "num_input_tokens_seen": 9899875648,
      "step": 12583
    },
    {
      "epoch": 1.3350307659664757,
      "grad_norm": 0.32387577911558285,
      "learning_rate": 4.850982884681057e-05,
      "loss": 1.6741,
      "num_input_tokens_seen": 9900662464,
      "step": 12584
    },
    {
      "epoch": 1.3351368555060472,
      "grad_norm": 0.4113310743230189,
      "learning_rate": 4.850959248628324e-05,
      "loss": 1.8193,
      "num_input_tokens_seen": 9901449152,
      "step": 12585
    },
    {
      "epoch": 1.3352429450456185,
      "grad_norm": 0.4950379047773798,
      "learning_rate": 4.850935610758839e-05,
      "loss": 1.8979,
      "num_input_tokens_seen": 9902235904,
      "step": 12586
    },
    {
      "epoch": 1.33534903458519,
      "grad_norm": 0.41189778329056737,
      "learning_rate": 4.8509119710726194e-05,
      "loss": 1.7902,
      "num_input_tokens_seen": 9903022688,
      "step": 12587
    },
    {
      "epoch": 1.3354551241247612,
      "grad_norm": 0.445503376053233,
      "learning_rate": 4.8508883295696836e-05,
      "loss": 1.8394,
      "num_input_tokens_seen": 9903809488,
      "step": 12588
    },
    {
      "epoch": 1.3355612136643327,
      "grad_norm": 0.37550925664580437,
      "learning_rate": 4.8508646862500505e-05,
      "loss": 1.7407,
      "num_input_tokens_seen": 9904596304,
      "step": 12589
    },
    {
      "epoch": 1.3356673032039041,
      "grad_norm": 0.42272883240688186,
      "learning_rate": 4.8508410411137384e-05,
      "loss": 1.9689,
      "num_input_tokens_seen": 9905383120,
      "step": 12590
    },
    {
      "epoch": 1.3357733927434756,
      "grad_norm": 0.41927770858712005,
      "learning_rate": 4.850817394160766e-05,
      "loss": 1.6946,
      "num_input_tokens_seen": 9906169904,
      "step": 12591
    },
    {
      "epoch": 1.3358794822830469,
      "grad_norm": 0.4576452374204771,
      "learning_rate": 4.8507937453911504e-05,
      "loss": 1.8635,
      "num_input_tokens_seen": 9906956688,
      "step": 12592
    },
    {
      "epoch": 1.3359855718226183,
      "grad_norm": 0.3702677463193997,
      "learning_rate": 4.85077009480491e-05,
      "loss": 1.6912,
      "num_input_tokens_seen": 9907743456,
      "step": 12593
    },
    {
      "epoch": 1.3360916613621896,
      "grad_norm": 0.37947204280576496,
      "learning_rate": 4.850746442402063e-05,
      "loss": 1.6546,
      "num_input_tokens_seen": 9908530240,
      "step": 12594
    },
    {
      "epoch": 1.336197750901761,
      "grad_norm": 0.5102985949933669,
      "learning_rate": 4.850722788182629e-05,
      "loss": 1.9481,
      "num_input_tokens_seen": 9909316944,
      "step": 12595
    },
    {
      "epoch": 1.3363038404413325,
      "grad_norm": 0.3812925857719924,
      "learning_rate": 4.850699132146625e-05,
      "loss": 1.7596,
      "num_input_tokens_seen": 9910103696,
      "step": 12596
    },
    {
      "epoch": 1.336409929980904,
      "grad_norm": 0.43146748385148787,
      "learning_rate": 4.85067547429407e-05,
      "loss": 1.8353,
      "num_input_tokens_seen": 9910890416,
      "step": 12597
    },
    {
      "epoch": 1.3365160195204753,
      "grad_norm": 0.4331581169122553,
      "learning_rate": 4.8506518146249816e-05,
      "loss": 1.7768,
      "num_input_tokens_seen": 9911677120,
      "step": 12598
    },
    {
      "epoch": 1.3366221090600467,
      "grad_norm": 0.5008195281315307,
      "learning_rate": 4.8506281531393785e-05,
      "loss": 1.8521,
      "num_input_tokens_seen": 9912463856,
      "step": 12599
    },
    {
      "epoch": 1.336728198599618,
      "grad_norm": 0.39800603910165905,
      "learning_rate": 4.850604489837279e-05,
      "loss": 1.7198,
      "num_input_tokens_seen": 9913250704,
      "step": 12600
    },
    {
      "epoch": 1.3368342881391895,
      "grad_norm": 0.4547496535234906,
      "learning_rate": 4.850580824718702e-05,
      "loss": 1.7617,
      "num_input_tokens_seen": 9914037424,
      "step": 12601
    },
    {
      "epoch": 1.336940377678761,
      "grad_norm": 0.40324272285701035,
      "learning_rate": 4.850557157783664e-05,
      "loss": 1.8515,
      "num_input_tokens_seen": 9914824080,
      "step": 12602
    },
    {
      "epoch": 1.3370464672183322,
      "grad_norm": 0.4079188679348922,
      "learning_rate": 4.850533489032185e-05,
      "loss": 1.7295,
      "num_input_tokens_seen": 9915610848,
      "step": 12603
    },
    {
      "epoch": 1.3371525567579037,
      "grad_norm": 0.4233132326301258,
      "learning_rate": 4.850509818464283e-05,
      "loss": 1.864,
      "num_input_tokens_seen": 9916397664,
      "step": 12604
    },
    {
      "epoch": 1.3372586462974752,
      "grad_norm": 0.41568162900285466,
      "learning_rate": 4.850486146079976e-05,
      "loss": 1.7099,
      "num_input_tokens_seen": 9917184384,
      "step": 12605
    },
    {
      "epoch": 1.3373647358370464,
      "grad_norm": 0.3956573704913638,
      "learning_rate": 4.850462471879281e-05,
      "loss": 1.802,
      "num_input_tokens_seen": 9917971120,
      "step": 12606
    },
    {
      "epoch": 1.3374708253766179,
      "grad_norm": 0.3946921880383263,
      "learning_rate": 4.8504387958622186e-05,
      "loss": 1.6806,
      "num_input_tokens_seen": 9918757808,
      "step": 12607
    },
    {
      "epoch": 1.3375769149161894,
      "grad_norm": 0.4674487661720839,
      "learning_rate": 4.850415118028806e-05,
      "loss": 1.8376,
      "num_input_tokens_seen": 9919544496,
      "step": 12608
    },
    {
      "epoch": 1.3376830044557606,
      "grad_norm": 0.5443662177668643,
      "learning_rate": 4.8503914383790615e-05,
      "loss": 1.7959,
      "num_input_tokens_seen": 9920331248,
      "step": 12609
    },
    {
      "epoch": 1.337789093995332,
      "grad_norm": 0.5710728319894837,
      "learning_rate": 4.8503677569130035e-05,
      "loss": 1.8841,
      "num_input_tokens_seen": 9921118032,
      "step": 12610
    },
    {
      "epoch": 1.3378951835349033,
      "grad_norm": 0.5130578877819757,
      "learning_rate": 4.85034407363065e-05,
      "loss": 1.8766,
      "num_input_tokens_seen": 9921904816,
      "step": 12611
    },
    {
      "epoch": 1.3380012730744748,
      "grad_norm": 0.5649147486502257,
      "learning_rate": 4.850320388532019e-05,
      "loss": 1.7698,
      "num_input_tokens_seen": 9922691568,
      "step": 12612
    },
    {
      "epoch": 1.3381073626140463,
      "grad_norm": 0.44327587897174997,
      "learning_rate": 4.8502967016171305e-05,
      "loss": 1.7422,
      "num_input_tokens_seen": 9923478256,
      "step": 12613
    },
    {
      "epoch": 1.3382134521536178,
      "grad_norm": 0.5124309730447836,
      "learning_rate": 4.850273012886001e-05,
      "loss": 1.6203,
      "num_input_tokens_seen": 9924265072,
      "step": 12614
    },
    {
      "epoch": 1.338319541693189,
      "grad_norm": 0.45882043183470334,
      "learning_rate": 4.85024932233865e-05,
      "loss": 1.7705,
      "num_input_tokens_seen": 9925051840,
      "step": 12615
    },
    {
      "epoch": 1.3384256312327605,
      "grad_norm": 0.41534933624542814,
      "learning_rate": 4.850225629975095e-05,
      "loss": 1.7515,
      "num_input_tokens_seen": 9925838592,
      "step": 12616
    },
    {
      "epoch": 1.3385317207723317,
      "grad_norm": 0.7125060706203754,
      "learning_rate": 4.850201935795355e-05,
      "loss": 1.802,
      "num_input_tokens_seen": 9926625328,
      "step": 12617
    },
    {
      "epoch": 1.3386378103119032,
      "grad_norm": 0.5041374941428682,
      "learning_rate": 4.850178239799448e-05,
      "loss": 1.7757,
      "num_input_tokens_seen": 9927412112,
      "step": 12618
    },
    {
      "epoch": 1.3387438998514747,
      "grad_norm": 0.7340954658489253,
      "learning_rate": 4.850154541987391e-05,
      "loss": 1.6399,
      "num_input_tokens_seen": 9928198928,
      "step": 12619
    },
    {
      "epoch": 1.3388499893910462,
      "grad_norm": 0.42810674189029874,
      "learning_rate": 4.850130842359204e-05,
      "loss": 1.6741,
      "num_input_tokens_seen": 9928985680,
      "step": 12620
    },
    {
      "epoch": 1.3389560789306174,
      "grad_norm": 0.9449903295751271,
      "learning_rate": 4.8501071409149056e-05,
      "loss": 1.9693,
      "num_input_tokens_seen": 9929772416,
      "step": 12621
    },
    {
      "epoch": 1.3390621684701889,
      "grad_norm": 0.5498463642352907,
      "learning_rate": 4.850083437654512e-05,
      "loss": 1.7539,
      "num_input_tokens_seen": 9930559232,
      "step": 12622
    },
    {
      "epoch": 1.3391682580097601,
      "grad_norm": 0.6980621699035612,
      "learning_rate": 4.8500597325780445e-05,
      "loss": 1.6546,
      "num_input_tokens_seen": 9931346016,
      "step": 12623
    },
    {
      "epoch": 1.3392743475493316,
      "grad_norm": 0.5215998040498694,
      "learning_rate": 4.850036025685519e-05,
      "loss": 1.8285,
      "num_input_tokens_seen": 9932132752,
      "step": 12624
    },
    {
      "epoch": 1.339380437088903,
      "grad_norm": 0.4586103464859947,
      "learning_rate": 4.850012316976954e-05,
      "loss": 1.6455,
      "num_input_tokens_seen": 9932919536,
      "step": 12625
    },
    {
      "epoch": 1.3394865266284746,
      "grad_norm": 0.614824553039905,
      "learning_rate": 4.84998860645237e-05,
      "loss": 1.8671,
      "num_input_tokens_seen": 9933706336,
      "step": 12626
    },
    {
      "epoch": 1.3395926161680458,
      "grad_norm": 0.5043488044916344,
      "learning_rate": 4.849964894111783e-05,
      "loss": 1.7362,
      "num_input_tokens_seen": 9934492976,
      "step": 12627
    },
    {
      "epoch": 1.3396987057076173,
      "grad_norm": 0.514932384634664,
      "learning_rate": 4.849941179955212e-05,
      "loss": 1.719,
      "num_input_tokens_seen": 9935279680,
      "step": 12628
    },
    {
      "epoch": 1.3398047952471885,
      "grad_norm": 0.5043712277149862,
      "learning_rate": 4.849917463982675e-05,
      "loss": 1.8621,
      "num_input_tokens_seen": 9936066480,
      "step": 12629
    },
    {
      "epoch": 1.33991088478676,
      "grad_norm": 0.5889708439199717,
      "learning_rate": 4.8498937461941905e-05,
      "loss": 1.9664,
      "num_input_tokens_seen": 9936853280,
      "step": 12630
    },
    {
      "epoch": 1.3400169743263315,
      "grad_norm": 0.3700485029352492,
      "learning_rate": 4.849870026589778e-05,
      "loss": 1.7008,
      "num_input_tokens_seen": 9937640032,
      "step": 12631
    },
    {
      "epoch": 1.3401230638659027,
      "grad_norm": 0.43202879743758926,
      "learning_rate": 4.8498463051694545e-05,
      "loss": 1.8251,
      "num_input_tokens_seen": 9938426752,
      "step": 12632
    },
    {
      "epoch": 1.3402291534054742,
      "grad_norm": 0.5748983262412982,
      "learning_rate": 4.8498225819332386e-05,
      "loss": 1.8113,
      "num_input_tokens_seen": 9939213552,
      "step": 12633
    },
    {
      "epoch": 1.3403352429450457,
      "grad_norm": 0.42366032793400193,
      "learning_rate": 4.8497988568811494e-05,
      "loss": 1.7909,
      "num_input_tokens_seen": 9940000288,
      "step": 12634
    },
    {
      "epoch": 1.340441332484617,
      "grad_norm": 0.5072092661546482,
      "learning_rate": 4.849775130013204e-05,
      "loss": 1.8727,
      "num_input_tokens_seen": 9940787056,
      "step": 12635
    },
    {
      "epoch": 1.3405474220241884,
      "grad_norm": 0.45392299924389456,
      "learning_rate": 4.849751401329421e-05,
      "loss": 1.8932,
      "num_input_tokens_seen": 9941573824,
      "step": 12636
    },
    {
      "epoch": 1.34065351156376,
      "grad_norm": 0.4542060658295715,
      "learning_rate": 4.84972767082982e-05,
      "loss": 1.6802,
      "num_input_tokens_seen": 9942360528,
      "step": 12637
    },
    {
      "epoch": 1.3407596011033311,
      "grad_norm": 0.43054708353326465,
      "learning_rate": 4.849703938514418e-05,
      "loss": 1.904,
      "num_input_tokens_seen": 9943147344,
      "step": 12638
    },
    {
      "epoch": 1.3408656906429026,
      "grad_norm": 0.44003472852481573,
      "learning_rate": 4.8496802043832334e-05,
      "loss": 1.8593,
      "num_input_tokens_seen": 9943934096,
      "step": 12639
    },
    {
      "epoch": 1.3409717801824739,
      "grad_norm": 0.40593910587448184,
      "learning_rate": 4.849656468436285e-05,
      "loss": 1.8476,
      "num_input_tokens_seen": 9944720848,
      "step": 12640
    },
    {
      "epoch": 1.3410778697220453,
      "grad_norm": 0.5312588328637439,
      "learning_rate": 4.849632730673591e-05,
      "loss": 1.7741,
      "num_input_tokens_seen": 9945507664,
      "step": 12641
    },
    {
      "epoch": 1.3411839592616168,
      "grad_norm": 0.561050969810834,
      "learning_rate": 4.84960899109517e-05,
      "loss": 1.7922,
      "num_input_tokens_seen": 9946294496,
      "step": 12642
    },
    {
      "epoch": 1.3412900488011883,
      "grad_norm": 0.5369968908261675,
      "learning_rate": 4.84958524970104e-05,
      "loss": 1.6659,
      "num_input_tokens_seen": 9947081264,
      "step": 12643
    },
    {
      "epoch": 1.3413961383407595,
      "grad_norm": 0.4273516242535358,
      "learning_rate": 4.849561506491219e-05,
      "loss": 1.8154,
      "num_input_tokens_seen": 9947868032,
      "step": 12644
    },
    {
      "epoch": 1.341502227880331,
      "grad_norm": 0.4585395225090276,
      "learning_rate": 4.8495377614657265e-05,
      "loss": 1.8013,
      "num_input_tokens_seen": 9948654864,
      "step": 12645
    },
    {
      "epoch": 1.3416083174199023,
      "grad_norm": 0.43556218314882034,
      "learning_rate": 4.84951401462458e-05,
      "loss": 1.7679,
      "num_input_tokens_seen": 9949441664,
      "step": 12646
    },
    {
      "epoch": 1.3417144069594737,
      "grad_norm": 0.608558006030654,
      "learning_rate": 4.849490265967798e-05,
      "loss": 1.7459,
      "num_input_tokens_seen": 9950228384,
      "step": 12647
    },
    {
      "epoch": 1.3418204964990452,
      "grad_norm": 0.5364195931093759,
      "learning_rate": 4.849466515495399e-05,
      "loss": 1.6943,
      "num_input_tokens_seen": 9951015152,
      "step": 12648
    },
    {
      "epoch": 1.3419265860386167,
      "grad_norm": 0.6677139810931754,
      "learning_rate": 4.849442763207401e-05,
      "loss": 1.8426,
      "num_input_tokens_seen": 9951801872,
      "step": 12649
    },
    {
      "epoch": 1.342032675578188,
      "grad_norm": 0.3676862979266134,
      "learning_rate": 4.849419009103823e-05,
      "loss": 1.74,
      "num_input_tokens_seen": 9952588656,
      "step": 12650
    },
    {
      "epoch": 1.3421387651177594,
      "grad_norm": 0.5569858197422585,
      "learning_rate": 4.849395253184682e-05,
      "loss": 1.829,
      "num_input_tokens_seen": 9953375408,
      "step": 12651
    },
    {
      "epoch": 1.3422448546573307,
      "grad_norm": 0.46153492241597155,
      "learning_rate": 4.849371495449998e-05,
      "loss": 1.8036,
      "num_input_tokens_seen": 9954162128,
      "step": 12652
    },
    {
      "epoch": 1.3423509441969022,
      "grad_norm": 0.40824512123792395,
      "learning_rate": 4.849347735899788e-05,
      "loss": 1.7274,
      "num_input_tokens_seen": 9954948832,
      "step": 12653
    },
    {
      "epoch": 1.3424570337364736,
      "grad_norm": 0.46154732739674426,
      "learning_rate": 4.849323974534072e-05,
      "loss": 1.8609,
      "num_input_tokens_seen": 9955735648,
      "step": 12654
    },
    {
      "epoch": 1.342563123276045,
      "grad_norm": 0.4383940544655127,
      "learning_rate": 4.849300211352866e-05,
      "loss": 1.9314,
      "num_input_tokens_seen": 9956522432,
      "step": 12655
    },
    {
      "epoch": 1.3426692128156164,
      "grad_norm": 0.435168362958726,
      "learning_rate": 4.8492764463561914e-05,
      "loss": 1.8497,
      "num_input_tokens_seen": 9957309136,
      "step": 12656
    },
    {
      "epoch": 1.3427753023551878,
      "grad_norm": 0.3909424438261208,
      "learning_rate": 4.849252679544064e-05,
      "loss": 1.848,
      "num_input_tokens_seen": 9958095936,
      "step": 12657
    },
    {
      "epoch": 1.342881391894759,
      "grad_norm": 0.3916835120056167,
      "learning_rate": 4.849228910916503e-05,
      "loss": 1.8298,
      "num_input_tokens_seen": 9958882720,
      "step": 12658
    },
    {
      "epoch": 1.3429874814343306,
      "grad_norm": 0.4193197407956347,
      "learning_rate": 4.849205140473527e-05,
      "loss": 1.8142,
      "num_input_tokens_seen": 9959669520,
      "step": 12659
    },
    {
      "epoch": 1.343093570973902,
      "grad_norm": 0.3797334807508152,
      "learning_rate": 4.849181368215154e-05,
      "loss": 1.7158,
      "num_input_tokens_seen": 9960456288,
      "step": 12660
    },
    {
      "epoch": 1.3431996605134735,
      "grad_norm": 0.3925707059858158,
      "learning_rate": 4.849157594141403e-05,
      "loss": 1.7794,
      "num_input_tokens_seen": 9961242992,
      "step": 12661
    },
    {
      "epoch": 1.3433057500530448,
      "grad_norm": 0.3923470843033481,
      "learning_rate": 4.849133818252291e-05,
      "loss": 1.8754,
      "num_input_tokens_seen": 9962029808,
      "step": 12662
    },
    {
      "epoch": 1.3434118395926162,
      "grad_norm": 0.37727867340161086,
      "learning_rate": 4.8491100405478386e-05,
      "loss": 1.8151,
      "num_input_tokens_seen": 9962816640,
      "step": 12663
    },
    {
      "epoch": 1.3435179291321875,
      "grad_norm": 0.36227035634908666,
      "learning_rate": 4.849086261028062e-05,
      "loss": 1.7549,
      "num_input_tokens_seen": 9963603328,
      "step": 12664
    },
    {
      "epoch": 1.343624018671759,
      "grad_norm": 0.4247368198948641,
      "learning_rate": 4.849062479692981e-05,
      "loss": 1.7947,
      "num_input_tokens_seen": 9964390176,
      "step": 12665
    },
    {
      "epoch": 1.3437301082113304,
      "grad_norm": 0.36374462252304834,
      "learning_rate": 4.8490386965426124e-05,
      "loss": 1.7683,
      "num_input_tokens_seen": 9965176944,
      "step": 12666
    },
    {
      "epoch": 1.3438361977509017,
      "grad_norm": 0.5115075653267901,
      "learning_rate": 4.8490149115769765e-05,
      "loss": 1.7738,
      "num_input_tokens_seen": 9965963680,
      "step": 12667
    },
    {
      "epoch": 1.3439422872904732,
      "grad_norm": 0.3886291954566339,
      "learning_rate": 4.848991124796091e-05,
      "loss": 1.6667,
      "num_input_tokens_seen": 9966750384,
      "step": 12668
    },
    {
      "epoch": 1.3440483768300446,
      "grad_norm": 0.44663809298464147,
      "learning_rate": 4.8489673361999734e-05,
      "loss": 1.868,
      "num_input_tokens_seen": 9967537088,
      "step": 12669
    },
    {
      "epoch": 1.3441544663696159,
      "grad_norm": 0.3603926146965302,
      "learning_rate": 4.8489435457886434e-05,
      "loss": 1.6905,
      "num_input_tokens_seen": 9968323856,
      "step": 12670
    },
    {
      "epoch": 1.3442605559091874,
      "grad_norm": 0.3854349594032518,
      "learning_rate": 4.8489197535621184e-05,
      "loss": 1.8458,
      "num_input_tokens_seen": 9969110624,
      "step": 12671
    },
    {
      "epoch": 1.3443666454487588,
      "grad_norm": 0.6046250680934269,
      "learning_rate": 4.848895959520417e-05,
      "loss": 1.7866,
      "num_input_tokens_seen": 9969897392,
      "step": 12672
    },
    {
      "epoch": 1.34447273498833,
      "grad_norm": 0.44364991660260056,
      "learning_rate": 4.848872163663558e-05,
      "loss": 1.929,
      "num_input_tokens_seen": 9970684208,
      "step": 12673
    },
    {
      "epoch": 1.3445788245279016,
      "grad_norm": 0.43331865018595406,
      "learning_rate": 4.84884836599156e-05,
      "loss": 1.7539,
      "num_input_tokens_seen": 9971470912,
      "step": 12674
    },
    {
      "epoch": 1.3446849140674728,
      "grad_norm": 0.6347131477361729,
      "learning_rate": 4.84882456650444e-05,
      "loss": 1.8204,
      "num_input_tokens_seen": 9972257808,
      "step": 12675
    },
    {
      "epoch": 1.3447910036070443,
      "grad_norm": 0.4411683230267352,
      "learning_rate": 4.848800765202217e-05,
      "loss": 1.7492,
      "num_input_tokens_seen": 9973044528,
      "step": 12676
    },
    {
      "epoch": 1.3448970931466158,
      "grad_norm": 0.7525998682230338,
      "learning_rate": 4.8487769620849104e-05,
      "loss": 1.7238,
      "num_input_tokens_seen": 9973831200,
      "step": 12677
    },
    {
      "epoch": 1.3450031826861872,
      "grad_norm": 0.4681083819879393,
      "learning_rate": 4.848753157152538e-05,
      "loss": 1.8702,
      "num_input_tokens_seen": 9974617904,
      "step": 12678
    },
    {
      "epoch": 1.3451092722257585,
      "grad_norm": 0.5457068279717876,
      "learning_rate": 4.848729350405118e-05,
      "loss": 1.7913,
      "num_input_tokens_seen": 9975404704,
      "step": 12679
    },
    {
      "epoch": 1.34521536176533,
      "grad_norm": 0.5024266930020771,
      "learning_rate": 4.848705541842669e-05,
      "loss": 1.7062,
      "num_input_tokens_seen": 9976191472,
      "step": 12680
    },
    {
      "epoch": 1.3453214513049012,
      "grad_norm": 0.544038230793112,
      "learning_rate": 4.848681731465209e-05,
      "loss": 1.9018,
      "num_input_tokens_seen": 9976978224,
      "step": 12681
    },
    {
      "epoch": 1.3454275408444727,
      "grad_norm": 0.4652690405962393,
      "learning_rate": 4.848657919272757e-05,
      "loss": 1.8818,
      "num_input_tokens_seen": 9977764976,
      "step": 12682
    },
    {
      "epoch": 1.3455336303840442,
      "grad_norm": 0.5691492743944699,
      "learning_rate": 4.84863410526533e-05,
      "loss": 1.6658,
      "num_input_tokens_seen": 9978551792,
      "step": 12683
    },
    {
      "epoch": 1.3456397199236156,
      "grad_norm": 0.49619269152381257,
      "learning_rate": 4.8486102894429484e-05,
      "loss": 1.8829,
      "num_input_tokens_seen": 9979338544,
      "step": 12684
    },
    {
      "epoch": 1.345745809463187,
      "grad_norm": 0.5046839647202145,
      "learning_rate": 4.8485864718056295e-05,
      "loss": 1.6982,
      "num_input_tokens_seen": 9980125328,
      "step": 12685
    },
    {
      "epoch": 1.3458518990027584,
      "grad_norm": 0.4690547893283076,
      "learning_rate": 4.8485626523533914e-05,
      "loss": 1.7607,
      "num_input_tokens_seen": 9980912240,
      "step": 12686
    },
    {
      "epoch": 1.3459579885423296,
      "grad_norm": 0.5162530503959278,
      "learning_rate": 4.848538831086254e-05,
      "loss": 1.8435,
      "num_input_tokens_seen": 9981699072,
      "step": 12687
    },
    {
      "epoch": 1.346064078081901,
      "grad_norm": 0.3504820924470884,
      "learning_rate": 4.848515008004234e-05,
      "loss": 1.6679,
      "num_input_tokens_seen": 9982485920,
      "step": 12688
    },
    {
      "epoch": 1.3461701676214726,
      "grad_norm": 0.3873478121530458,
      "learning_rate": 4.848491183107351e-05,
      "loss": 1.6218,
      "num_input_tokens_seen": 9983272784,
      "step": 12689
    },
    {
      "epoch": 1.346276257161044,
      "grad_norm": 0.4024017327399709,
      "learning_rate": 4.848467356395622e-05,
      "loss": 1.9234,
      "num_input_tokens_seen": 9984059648,
      "step": 12690
    },
    {
      "epoch": 1.3463823467006153,
      "grad_norm": 0.4892414978008703,
      "learning_rate": 4.8484435278690674e-05,
      "loss": 1.8801,
      "num_input_tokens_seen": 9984846400,
      "step": 12691
    },
    {
      "epoch": 1.3464884362401868,
      "grad_norm": 0.5681222551315388,
      "learning_rate": 4.8484196975277044e-05,
      "loss": 1.7935,
      "num_input_tokens_seen": 9985633200,
      "step": 12692
    },
    {
      "epoch": 1.346594525779758,
      "grad_norm": 0.36133259336777207,
      "learning_rate": 4.848395865371551e-05,
      "loss": 1.9073,
      "num_input_tokens_seen": 9986419968,
      "step": 12693
    },
    {
      "epoch": 1.3467006153193295,
      "grad_norm": 0.4125700729258162,
      "learning_rate": 4.848372031400627e-05,
      "loss": 1.6867,
      "num_input_tokens_seen": 9987206768,
      "step": 12694
    },
    {
      "epoch": 1.346806704858901,
      "grad_norm": 0.6077472340700146,
      "learning_rate": 4.848348195614949e-05,
      "loss": 1.831,
      "num_input_tokens_seen": 9987993472,
      "step": 12695
    },
    {
      "epoch": 1.3469127943984724,
      "grad_norm": 0.4013552332203143,
      "learning_rate": 4.848324358014536e-05,
      "loss": 1.8328,
      "num_input_tokens_seen": 9988780192,
      "step": 12696
    },
    {
      "epoch": 1.3470188839380437,
      "grad_norm": 0.4157646695421172,
      "learning_rate": 4.848300518599409e-05,
      "loss": 1.8593,
      "num_input_tokens_seen": 9989566928,
      "step": 12697
    },
    {
      "epoch": 1.3471249734776152,
      "grad_norm": 0.43143442514011904,
      "learning_rate": 4.848276677369583e-05,
      "loss": 1.8214,
      "num_input_tokens_seen": 9990353696,
      "step": 12698
    },
    {
      "epoch": 1.3472310630171864,
      "grad_norm": 0.64060459264974,
      "learning_rate": 4.848252834325077e-05,
      "loss": 1.7235,
      "num_input_tokens_seen": 9991140432,
      "step": 12699
    },
    {
      "epoch": 1.347337152556758,
      "grad_norm": 0.47529960789790854,
      "learning_rate": 4.848228989465911e-05,
      "loss": 1.5775,
      "num_input_tokens_seen": 9991927264,
      "step": 12700
    },
    {
      "epoch": 1.3474432420963294,
      "grad_norm": 0.43302359452943634,
      "learning_rate": 4.848205142792102e-05,
      "loss": 1.857,
      "num_input_tokens_seen": 9992714016,
      "step": 12701
    },
    {
      "epoch": 1.3475493316359006,
      "grad_norm": 0.42372341115572565,
      "learning_rate": 4.84818129430367e-05,
      "loss": 1.7316,
      "num_input_tokens_seen": 9993500720,
      "step": 12702
    },
    {
      "epoch": 1.347655421175472,
      "grad_norm": 0.390017018962373,
      "learning_rate": 4.848157444000631e-05,
      "loss": 1.7813,
      "num_input_tokens_seen": 9994287552,
      "step": 12703
    },
    {
      "epoch": 1.3477615107150436,
      "grad_norm": 0.38548198365668557,
      "learning_rate": 4.848133591883006e-05,
      "loss": 1.7145,
      "num_input_tokens_seen": 9995074336,
      "step": 12704
    },
    {
      "epoch": 1.3478676002546148,
      "grad_norm": 0.5772264675671973,
      "learning_rate": 4.848109737950811e-05,
      "loss": 1.7672,
      "num_input_tokens_seen": 9995861120,
      "step": 12705
    },
    {
      "epoch": 1.3479736897941863,
      "grad_norm": 0.42472192213119037,
      "learning_rate": 4.848085882204067e-05,
      "loss": 1.8445,
      "num_input_tokens_seen": 9996647904,
      "step": 12706
    },
    {
      "epoch": 1.3480797793337578,
      "grad_norm": 0.5303074217075036,
      "learning_rate": 4.8480620246427905e-05,
      "loss": 1.8648,
      "num_input_tokens_seen": 9997434688,
      "step": 12707
    },
    {
      "epoch": 1.348185868873329,
      "grad_norm": 0.4851765069676528,
      "learning_rate": 4.848038165267e-05,
      "loss": 1.7109,
      "num_input_tokens_seen": 9998221472,
      "step": 12708
    },
    {
      "epoch": 1.3482919584129005,
      "grad_norm": 0.5804483786155594,
      "learning_rate": 4.8480143040767155e-05,
      "loss": 1.7942,
      "num_input_tokens_seen": 9999008256,
      "step": 12709
    },
    {
      "epoch": 1.3483980479524718,
      "grad_norm": 0.4367357962944681,
      "learning_rate": 4.847990441071955e-05,
      "loss": 1.7929,
      "num_input_tokens_seen": 9999795072,
      "step": 12710
    },
    {
      "epoch": 1.3485041374920432,
      "grad_norm": 1.0336540506522445,
      "learning_rate": 4.847966576252735e-05,
      "loss": 1.8603,
      "num_input_tokens_seen": 10000581872,
      "step": 12711
    },
    {
      "epoch": 1.3486102270316147,
      "grad_norm": 0.6132834096015464,
      "learning_rate": 4.847942709619076e-05,
      "loss": 1.8339,
      "num_input_tokens_seen": 10001368496,
      "step": 12712
    },
    {
      "epoch": 1.3487163165711862,
      "grad_norm": 1.3558255810533106,
      "learning_rate": 4.8479188411709955e-05,
      "loss": 1.6801,
      "num_input_tokens_seen": 10002155232,
      "step": 12713
    },
    {
      "epoch": 1.3488224061107574,
      "grad_norm": 0.43730137414248843,
      "learning_rate": 4.847894970908512e-05,
      "loss": 1.9101,
      "num_input_tokens_seen": 10002941984,
      "step": 12714
    },
    {
      "epoch": 1.348928495650329,
      "grad_norm": 0.991498312095692,
      "learning_rate": 4.8478710988316445e-05,
      "loss": 1.783,
      "num_input_tokens_seen": 10003728816,
      "step": 12715
    },
    {
      "epoch": 1.3490345851899002,
      "grad_norm": 0.4356491811110581,
      "learning_rate": 4.8478472249404105e-05,
      "loss": 1.779,
      "num_input_tokens_seen": 10004515728,
      "step": 12716
    },
    {
      "epoch": 1.3491406747294716,
      "grad_norm": 0.43365482945801115,
      "learning_rate": 4.84782334923483e-05,
      "loss": 1.7442,
      "num_input_tokens_seen": 10005302448,
      "step": 12717
    },
    {
      "epoch": 1.349246764269043,
      "grad_norm": 0.4313610105134872,
      "learning_rate": 4.84779947171492e-05,
      "loss": 1.6624,
      "num_input_tokens_seen": 10006089248,
      "step": 12718
    },
    {
      "epoch": 1.3493528538086146,
      "grad_norm": 0.4581064204897269,
      "learning_rate": 4.8477755923807e-05,
      "loss": 1.88,
      "num_input_tokens_seen": 10006876032,
      "step": 12719
    },
    {
      "epoch": 1.3494589433481858,
      "grad_norm": 0.4117126892150675,
      "learning_rate": 4.8477517112321866e-05,
      "loss": 1.8218,
      "num_input_tokens_seen": 10007662896,
      "step": 12720
    },
    {
      "epoch": 1.3495650328877573,
      "grad_norm": 0.40693633831714376,
      "learning_rate": 4.8477278282694004e-05,
      "loss": 1.846,
      "num_input_tokens_seen": 10008449648,
      "step": 12721
    },
    {
      "epoch": 1.3496711224273286,
      "grad_norm": 0.41452058302293615,
      "learning_rate": 4.84770394349236e-05,
      "loss": 1.7989,
      "num_input_tokens_seen": 10009236352,
      "step": 12722
    },
    {
      "epoch": 1.3497772119669,
      "grad_norm": 0.4434862799846082,
      "learning_rate": 4.847680056901082e-05,
      "loss": 1.8263,
      "num_input_tokens_seen": 10010023056,
      "step": 12723
    },
    {
      "epoch": 1.3498833015064715,
      "grad_norm": 0.420568427068821,
      "learning_rate": 4.847656168495585e-05,
      "loss": 1.7626,
      "num_input_tokens_seen": 10010809808,
      "step": 12724
    },
    {
      "epoch": 1.349989391046043,
      "grad_norm": 0.506879717952129,
      "learning_rate": 4.847632278275889e-05,
      "loss": 1.6999,
      "num_input_tokens_seen": 10011596544,
      "step": 12725
    },
    {
      "epoch": 1.3500954805856142,
      "grad_norm": 0.49135934381382956,
      "learning_rate": 4.8476083862420116e-05,
      "loss": 1.8019,
      "num_input_tokens_seen": 10012383264,
      "step": 12726
    },
    {
      "epoch": 1.3502015701251857,
      "grad_norm": 0.378247933120729,
      "learning_rate": 4.847584492393971e-05,
      "loss": 1.7968,
      "num_input_tokens_seen": 10013170080,
      "step": 12727
    },
    {
      "epoch": 1.350307659664757,
      "grad_norm": 0.3904958965688855,
      "learning_rate": 4.847560596731786e-05,
      "loss": 1.6514,
      "num_input_tokens_seen": 10013956832,
      "step": 12728
    },
    {
      "epoch": 1.3504137492043284,
      "grad_norm": 0.3985435916475389,
      "learning_rate": 4.847536699255476e-05,
      "loss": 1.7127,
      "num_input_tokens_seen": 10014743616,
      "step": 12729
    },
    {
      "epoch": 1.3505198387439,
      "grad_norm": 0.3775858320709244,
      "learning_rate": 4.847512799965057e-05,
      "loss": 1.7235,
      "num_input_tokens_seen": 10015530336,
      "step": 12730
    },
    {
      "epoch": 1.3506259282834712,
      "grad_norm": 0.3869753731590581,
      "learning_rate": 4.8474888988605505e-05,
      "loss": 1.7181,
      "num_input_tokens_seen": 10016317168,
      "step": 12731
    },
    {
      "epoch": 1.3507320178230426,
      "grad_norm": 0.4084088022402547,
      "learning_rate": 4.8474649959419724e-05,
      "loss": 1.7974,
      "num_input_tokens_seen": 10017103920,
      "step": 12732
    },
    {
      "epoch": 1.3508381073626141,
      "grad_norm": 0.3248786602578411,
      "learning_rate": 4.8474410912093425e-05,
      "loss": 1.7666,
      "num_input_tokens_seen": 10017890720,
      "step": 12733
    },
    {
      "epoch": 1.3509441969021854,
      "grad_norm": 0.365821884625418,
      "learning_rate": 4.847417184662679e-05,
      "loss": 1.7221,
      "num_input_tokens_seen": 10018677520,
      "step": 12734
    },
    {
      "epoch": 1.3510502864417568,
      "grad_norm": 0.39868885001773163,
      "learning_rate": 4.847393276302001e-05,
      "loss": 1.8797,
      "num_input_tokens_seen": 10019464272,
      "step": 12735
    },
    {
      "epoch": 1.3511563759813283,
      "grad_norm": 0.3737978445289638,
      "learning_rate": 4.847369366127326e-05,
      "loss": 1.6151,
      "num_input_tokens_seen": 10020251088,
      "step": 12736
    },
    {
      "epoch": 1.3512624655208996,
      "grad_norm": 0.43697470529445887,
      "learning_rate": 4.847345454138672e-05,
      "loss": 1.8386,
      "num_input_tokens_seen": 10021037808,
      "step": 12737
    },
    {
      "epoch": 1.351368555060471,
      "grad_norm": 0.3410938668580945,
      "learning_rate": 4.8473215403360596e-05,
      "loss": 1.776,
      "num_input_tokens_seen": 10021824608,
      "step": 12738
    },
    {
      "epoch": 1.3514746446000425,
      "grad_norm": 0.36985413855242777,
      "learning_rate": 4.847297624719505e-05,
      "loss": 1.7795,
      "num_input_tokens_seen": 10022611360,
      "step": 12739
    },
    {
      "epoch": 1.3515807341396138,
      "grad_norm": 0.4035559658926646,
      "learning_rate": 4.847273707289028e-05,
      "loss": 1.8418,
      "num_input_tokens_seen": 10023398096,
      "step": 12740
    },
    {
      "epoch": 1.3516868236791852,
      "grad_norm": 0.45516236957230444,
      "learning_rate": 4.8472497880446465e-05,
      "loss": 1.696,
      "num_input_tokens_seen": 10024184864,
      "step": 12741
    },
    {
      "epoch": 1.3517929132187567,
      "grad_norm": 0.40050147539299097,
      "learning_rate": 4.8472258669863794e-05,
      "loss": 1.8634,
      "num_input_tokens_seen": 10024971632,
      "step": 12742
    },
    {
      "epoch": 1.351899002758328,
      "grad_norm": 0.4415448297776598,
      "learning_rate": 4.8472019441142455e-05,
      "loss": 1.7179,
      "num_input_tokens_seen": 10025758384,
      "step": 12743
    },
    {
      "epoch": 1.3520050922978994,
      "grad_norm": 0.42727791056389136,
      "learning_rate": 4.847178019428262e-05,
      "loss": 1.6912,
      "num_input_tokens_seen": 10026545168,
      "step": 12744
    },
    {
      "epoch": 1.3521111818374707,
      "grad_norm": 0.4418257397522145,
      "learning_rate": 4.847154092928449e-05,
      "loss": 1.7706,
      "num_input_tokens_seen": 10027331936,
      "step": 12745
    },
    {
      "epoch": 1.3522172713770422,
      "grad_norm": 0.36690186289966714,
      "learning_rate": 4.8471301646148236e-05,
      "loss": 1.7104,
      "num_input_tokens_seen": 10028118800,
      "step": 12746
    },
    {
      "epoch": 1.3523233609166136,
      "grad_norm": 0.3892333547547999,
      "learning_rate": 4.847106234487405e-05,
      "loss": 1.7639,
      "num_input_tokens_seen": 10028905552,
      "step": 12747
    },
    {
      "epoch": 1.3524294504561851,
      "grad_norm": 0.33101504528267967,
      "learning_rate": 4.847082302546212e-05,
      "loss": 1.6759,
      "num_input_tokens_seen": 10029692336,
      "step": 12748
    },
    {
      "epoch": 1.3525355399957564,
      "grad_norm": 0.33214893783753363,
      "learning_rate": 4.847058368791262e-05,
      "loss": 1.6714,
      "num_input_tokens_seen": 10030479104,
      "step": 12749
    },
    {
      "epoch": 1.3526416295353278,
      "grad_norm": 0.4495107245508359,
      "learning_rate": 4.8470344332225746e-05,
      "loss": 1.7414,
      "num_input_tokens_seen": 10031265840,
      "step": 12750
    },
    {
      "epoch": 1.352747719074899,
      "grad_norm": 0.3694476630889147,
      "learning_rate": 4.847010495840167e-05,
      "loss": 1.8735,
      "num_input_tokens_seen": 10032052640,
      "step": 12751
    },
    {
      "epoch": 1.3528538086144706,
      "grad_norm": 0.4676003682440039,
      "learning_rate": 4.84698655664406e-05,
      "loss": 1.8,
      "num_input_tokens_seen": 10032839360,
      "step": 12752
    },
    {
      "epoch": 1.352959898154042,
      "grad_norm": 0.37492386159417057,
      "learning_rate": 4.84696261563427e-05,
      "loss": 1.7837,
      "num_input_tokens_seen": 10033626128,
      "step": 12753
    },
    {
      "epoch": 1.3530659876936135,
      "grad_norm": 0.3527287344792198,
      "learning_rate": 4.8469386728108155e-05,
      "loss": 1.773,
      "num_input_tokens_seen": 10034412864,
      "step": 12754
    },
    {
      "epoch": 1.3531720772331848,
      "grad_norm": 0.4635070903164972,
      "learning_rate": 4.846914728173717e-05,
      "loss": 1.8626,
      "num_input_tokens_seen": 10035199648,
      "step": 12755
    },
    {
      "epoch": 1.3532781667727563,
      "grad_norm": 0.3741215932078384,
      "learning_rate": 4.84689078172299e-05,
      "loss": 1.7156,
      "num_input_tokens_seen": 10035986432,
      "step": 12756
    },
    {
      "epoch": 1.3533842563123275,
      "grad_norm": 0.7863082860426657,
      "learning_rate": 4.8468668334586564e-05,
      "loss": 1.8556,
      "num_input_tokens_seen": 10036773232,
      "step": 12757
    },
    {
      "epoch": 1.353490345851899,
      "grad_norm": 0.483494828197985,
      "learning_rate": 4.846842883380732e-05,
      "loss": 1.8916,
      "num_input_tokens_seen": 10037559936,
      "step": 12758
    },
    {
      "epoch": 1.3535964353914705,
      "grad_norm": 0.6308422807701098,
      "learning_rate": 4.8468189314892367e-05,
      "loss": 1.7423,
      "num_input_tokens_seen": 10038346768,
      "step": 12759
    },
    {
      "epoch": 1.353702524931042,
      "grad_norm": 0.43745103683670644,
      "learning_rate": 4.846794977784188e-05,
      "loss": 1.8133,
      "num_input_tokens_seen": 10039133536,
      "step": 12760
    },
    {
      "epoch": 1.3538086144706132,
      "grad_norm": 0.654507605856888,
      "learning_rate": 4.846771022265605e-05,
      "loss": 1.7457,
      "num_input_tokens_seen": 10039920368,
      "step": 12761
    },
    {
      "epoch": 1.3539147040101847,
      "grad_norm": 0.4951459796132943,
      "learning_rate": 4.8467470649335065e-05,
      "loss": 1.8409,
      "num_input_tokens_seen": 10040707168,
      "step": 12762
    },
    {
      "epoch": 1.354020793549756,
      "grad_norm": 0.4425157728257757,
      "learning_rate": 4.846723105787912e-05,
      "loss": 1.7,
      "num_input_tokens_seen": 10041493936,
      "step": 12763
    },
    {
      "epoch": 1.3541268830893274,
      "grad_norm": 0.6055652074795133,
      "learning_rate": 4.846699144828837e-05,
      "loss": 1.83,
      "num_input_tokens_seen": 10042280736,
      "step": 12764
    },
    {
      "epoch": 1.3542329726288989,
      "grad_norm": 0.42123580161191304,
      "learning_rate": 4.846675182056302e-05,
      "loss": 1.8282,
      "num_input_tokens_seen": 10043067440,
      "step": 12765
    },
    {
      "epoch": 1.35433906216847,
      "grad_norm": 0.755880489799131,
      "learning_rate": 4.8466512174703256e-05,
      "loss": 1.7939,
      "num_input_tokens_seen": 10043854176,
      "step": 12766
    },
    {
      "epoch": 1.3544451517080416,
      "grad_norm": 0.7223890409024458,
      "learning_rate": 4.8466272510709256e-05,
      "loss": 1.7466,
      "num_input_tokens_seen": 10044641088,
      "step": 12767
    },
    {
      "epoch": 1.354551241247613,
      "grad_norm": 0.5996697450388775,
      "learning_rate": 4.8466032828581216e-05,
      "loss": 1.8021,
      "num_input_tokens_seen": 10045427872,
      "step": 12768
    },
    {
      "epoch": 1.3546573307871843,
      "grad_norm": 0.8143404591896353,
      "learning_rate": 4.846579312831931e-05,
      "loss": 1.8911,
      "num_input_tokens_seen": 10046214576,
      "step": 12769
    },
    {
      "epoch": 1.3547634203267558,
      "grad_norm": 0.49494771265038645,
      "learning_rate": 4.8465553409923726e-05,
      "loss": 1.8899,
      "num_input_tokens_seen": 10047001344,
      "step": 12770
    },
    {
      "epoch": 1.3548695098663273,
      "grad_norm": 0.64091202915152,
      "learning_rate": 4.846531367339465e-05,
      "loss": 1.7742,
      "num_input_tokens_seen": 10047788112,
      "step": 12771
    },
    {
      "epoch": 1.3549755994058985,
      "grad_norm": 0.6466230021661696,
      "learning_rate": 4.846507391873227e-05,
      "loss": 1.7641,
      "num_input_tokens_seen": 10048574896,
      "step": 12772
    },
    {
      "epoch": 1.35508168894547,
      "grad_norm": 0.4844034280173887,
      "learning_rate": 4.846483414593678e-05,
      "loss": 1.8265,
      "num_input_tokens_seen": 10049361568,
      "step": 12773
    },
    {
      "epoch": 1.3551877784850412,
      "grad_norm": 0.4552609487471636,
      "learning_rate": 4.846459435500834e-05,
      "loss": 1.8342,
      "num_input_tokens_seen": 10050148384,
      "step": 12774
    },
    {
      "epoch": 1.3552938680246127,
      "grad_norm": 0.5457237615198021,
      "learning_rate": 4.8464354545947155e-05,
      "loss": 1.7977,
      "num_input_tokens_seen": 10050935168,
      "step": 12775
    },
    {
      "epoch": 1.3553999575641842,
      "grad_norm": 0.4544189235361397,
      "learning_rate": 4.8464114718753406e-05,
      "loss": 1.8941,
      "num_input_tokens_seen": 10051721872,
      "step": 12776
    },
    {
      "epoch": 1.3555060471037557,
      "grad_norm": 0.39235518636729927,
      "learning_rate": 4.846387487342728e-05,
      "loss": 1.7596,
      "num_input_tokens_seen": 10052508704,
      "step": 12777
    },
    {
      "epoch": 1.355612136643327,
      "grad_norm": 0.4353395821708371,
      "learning_rate": 4.846363500996896e-05,
      "loss": 1.8019,
      "num_input_tokens_seen": 10053295520,
      "step": 12778
    },
    {
      "epoch": 1.3557182261828984,
      "grad_norm": 0.4396193209573808,
      "learning_rate": 4.8463395128378625e-05,
      "loss": 1.7607,
      "num_input_tokens_seen": 10054082192,
      "step": 12779
    },
    {
      "epoch": 1.3558243157224696,
      "grad_norm": 0.4827126230666149,
      "learning_rate": 4.8463155228656474e-05,
      "loss": 1.8932,
      "num_input_tokens_seen": 10054868944,
      "step": 12780
    },
    {
      "epoch": 1.3559304052620411,
      "grad_norm": 0.4777949205261134,
      "learning_rate": 4.846291531080268e-05,
      "loss": 1.7994,
      "num_input_tokens_seen": 10055655696,
      "step": 12781
    },
    {
      "epoch": 1.3560364948016126,
      "grad_norm": 0.4270965927219049,
      "learning_rate": 4.846267537481744e-05,
      "loss": 1.7849,
      "num_input_tokens_seen": 10056442448,
      "step": 12782
    },
    {
      "epoch": 1.356142584341184,
      "grad_norm": 0.5077593425630521,
      "learning_rate": 4.846243542070092e-05,
      "loss": 1.7969,
      "num_input_tokens_seen": 10057229184,
      "step": 12783
    },
    {
      "epoch": 1.3562486738807553,
      "grad_norm": 0.3997023364323602,
      "learning_rate": 4.846219544845333e-05,
      "loss": 1.6998,
      "num_input_tokens_seen": 10058015920,
      "step": 12784
    },
    {
      "epoch": 1.3563547634203268,
      "grad_norm": 0.39270700376176465,
      "learning_rate": 4.8461955458074837e-05,
      "loss": 1.745,
      "num_input_tokens_seen": 10058802656,
      "step": 12785
    },
    {
      "epoch": 1.356460852959898,
      "grad_norm": 0.4343658787717298,
      "learning_rate": 4.8461715449565635e-05,
      "loss": 1.8177,
      "num_input_tokens_seen": 10059589472,
      "step": 12786
    },
    {
      "epoch": 1.3565669424994695,
      "grad_norm": 0.3128632115245378,
      "learning_rate": 4.8461475422925904e-05,
      "loss": 1.7929,
      "num_input_tokens_seen": 10060376272,
      "step": 12787
    },
    {
      "epoch": 1.356673032039041,
      "grad_norm": 0.4532903504140899,
      "learning_rate": 4.8461235378155845e-05,
      "loss": 1.9159,
      "num_input_tokens_seen": 10061162992,
      "step": 12788
    },
    {
      "epoch": 1.3567791215786125,
      "grad_norm": 0.37023751089984386,
      "learning_rate": 4.846099531525562e-05,
      "loss": 1.8137,
      "num_input_tokens_seen": 10061949712,
      "step": 12789
    },
    {
      "epoch": 1.3568852111181837,
      "grad_norm": 0.38589004974580193,
      "learning_rate": 4.846075523422543e-05,
      "loss": 1.8364,
      "num_input_tokens_seen": 10062736448,
      "step": 12790
    },
    {
      "epoch": 1.3569913006577552,
      "grad_norm": 0.33260362879638045,
      "learning_rate": 4.846051513506546e-05,
      "loss": 1.6269,
      "num_input_tokens_seen": 10063523328,
      "step": 12791
    },
    {
      "epoch": 1.3570973901973264,
      "grad_norm": 0.4384199118678569,
      "learning_rate": 4.8460275017775894e-05,
      "loss": 1.7546,
      "num_input_tokens_seen": 10064310016,
      "step": 12792
    },
    {
      "epoch": 1.357203479736898,
      "grad_norm": 0.4402124457778694,
      "learning_rate": 4.846003488235691e-05,
      "loss": 1.7829,
      "num_input_tokens_seen": 10065096912,
      "step": 12793
    },
    {
      "epoch": 1.3573095692764694,
      "grad_norm": 0.41895436817016174,
      "learning_rate": 4.84597947288087e-05,
      "loss": 1.7434,
      "num_input_tokens_seen": 10065883696,
      "step": 12794
    },
    {
      "epoch": 1.3574156588160409,
      "grad_norm": 0.3895358626337057,
      "learning_rate": 4.845955455713145e-05,
      "loss": 1.7319,
      "num_input_tokens_seen": 10066670480,
      "step": 12795
    },
    {
      "epoch": 1.3575217483556121,
      "grad_norm": 0.397962209561325,
      "learning_rate": 4.845931436732535e-05,
      "loss": 1.7508,
      "num_input_tokens_seen": 10067457184,
      "step": 12796
    },
    {
      "epoch": 1.3576278378951836,
      "grad_norm": 0.45217018827550526,
      "learning_rate": 4.8459074159390574e-05,
      "loss": 1.7484,
      "num_input_tokens_seen": 10068243968,
      "step": 12797
    },
    {
      "epoch": 1.3577339274347549,
      "grad_norm": 0.4045804587669792,
      "learning_rate": 4.845883393332731e-05,
      "loss": 1.7583,
      "num_input_tokens_seen": 10069030752,
      "step": 12798
    },
    {
      "epoch": 1.3578400169743263,
      "grad_norm": 0.4419162067003032,
      "learning_rate": 4.845859368913576e-05,
      "loss": 1.8626,
      "num_input_tokens_seen": 10069817376,
      "step": 12799
    },
    {
      "epoch": 1.3579461065138978,
      "grad_norm": 0.5114210698118481,
      "learning_rate": 4.845835342681608e-05,
      "loss": 1.9189,
      "num_input_tokens_seen": 10070604160,
      "step": 12800
    },
    {
      "epoch": 1.358052196053469,
      "grad_norm": 0.3801604222970595,
      "learning_rate": 4.8458113146368484e-05,
      "loss": 1.8319,
      "num_input_tokens_seen": 10071390976,
      "step": 12801
    },
    {
      "epoch": 1.3581582855930405,
      "grad_norm": 0.4902875710729091,
      "learning_rate": 4.845787284779315e-05,
      "loss": 1.7113,
      "num_input_tokens_seen": 10072177728,
      "step": 12802
    },
    {
      "epoch": 1.358264375132612,
      "grad_norm": 0.43085846746245476,
      "learning_rate": 4.845763253109025e-05,
      "loss": 1.7613,
      "num_input_tokens_seen": 10072964448,
      "step": 12803
    },
    {
      "epoch": 1.3583704646721833,
      "grad_norm": 0.4928652553359341,
      "learning_rate": 4.8457392196259986e-05,
      "loss": 1.7663,
      "num_input_tokens_seen": 10073751184,
      "step": 12804
    },
    {
      "epoch": 1.3584765542117547,
      "grad_norm": 0.36231184379577197,
      "learning_rate": 4.845715184330253e-05,
      "loss": 1.7892,
      "num_input_tokens_seen": 10074537952,
      "step": 12805
    },
    {
      "epoch": 1.3585826437513262,
      "grad_norm": 0.6069709156589234,
      "learning_rate": 4.845691147221809e-05,
      "loss": 1.8346,
      "num_input_tokens_seen": 10075324736,
      "step": 12806
    },
    {
      "epoch": 1.3586887332908975,
      "grad_norm": 0.4540460942463199,
      "learning_rate": 4.8456671083006824e-05,
      "loss": 1.7088,
      "num_input_tokens_seen": 10076111552,
      "step": 12807
    },
    {
      "epoch": 1.358794822830469,
      "grad_norm": 0.4104136348380708,
      "learning_rate": 4.8456430675668934e-05,
      "loss": 1.8704,
      "num_input_tokens_seen": 10076898256,
      "step": 12808
    },
    {
      "epoch": 1.3589009123700402,
      "grad_norm": 0.46886081499321836,
      "learning_rate": 4.84561902502046e-05,
      "loss": 1.6366,
      "num_input_tokens_seen": 10077685088,
      "step": 12809
    },
    {
      "epoch": 1.3590070019096117,
      "grad_norm": 0.3818536976390784,
      "learning_rate": 4.845594980661402e-05,
      "loss": 1.8239,
      "num_input_tokens_seen": 10078471856,
      "step": 12810
    },
    {
      "epoch": 1.3591130914491831,
      "grad_norm": 0.44817416591417325,
      "learning_rate": 4.8455709344897365e-05,
      "loss": 1.7732,
      "num_input_tokens_seen": 10079258624,
      "step": 12811
    },
    {
      "epoch": 1.3592191809887546,
      "grad_norm": 0.37271586707325116,
      "learning_rate": 4.845546886505482e-05,
      "loss": 1.8101,
      "num_input_tokens_seen": 10080045408,
      "step": 12812
    },
    {
      "epoch": 1.3593252705283259,
      "grad_norm": 0.4726927991129319,
      "learning_rate": 4.845522836708659e-05,
      "loss": 1.7586,
      "num_input_tokens_seen": 10080832224,
      "step": 12813
    },
    {
      "epoch": 1.3594313600678973,
      "grad_norm": 0.4593687619483873,
      "learning_rate": 4.845498785099284e-05,
      "loss": 1.8546,
      "num_input_tokens_seen": 10081618976,
      "step": 12814
    },
    {
      "epoch": 1.3595374496074686,
      "grad_norm": 0.3632946501758142,
      "learning_rate": 4.8454747316773765e-05,
      "loss": 1.7838,
      "num_input_tokens_seen": 10082405696,
      "step": 12815
    },
    {
      "epoch": 1.35964353914704,
      "grad_norm": 0.38313470442420033,
      "learning_rate": 4.845450676442954e-05,
      "loss": 1.7235,
      "num_input_tokens_seen": 10083192464,
      "step": 12816
    },
    {
      "epoch": 1.3597496286866115,
      "grad_norm": 0.34419350466821746,
      "learning_rate": 4.8454266193960375e-05,
      "loss": 1.8254,
      "num_input_tokens_seen": 10083979232,
      "step": 12817
    },
    {
      "epoch": 1.359855718226183,
      "grad_norm": 0.4222267635931985,
      "learning_rate": 4.845402560536644e-05,
      "loss": 1.925,
      "num_input_tokens_seen": 10084765984,
      "step": 12818
    },
    {
      "epoch": 1.3599618077657543,
      "grad_norm": 0.4005855622259779,
      "learning_rate": 4.845378499864791e-05,
      "loss": 1.7957,
      "num_input_tokens_seen": 10085552608,
      "step": 12819
    },
    {
      "epoch": 1.3600678973053257,
      "grad_norm": 0.3750639217075636,
      "learning_rate": 4.845354437380499e-05,
      "loss": 1.8301,
      "num_input_tokens_seen": 10086339376,
      "step": 12820
    },
    {
      "epoch": 1.360173986844897,
      "grad_norm": 0.36586975813625305,
      "learning_rate": 4.845330373083786e-05,
      "loss": 1.8531,
      "num_input_tokens_seen": 10087126112,
      "step": 12821
    },
    {
      "epoch": 1.3602800763844685,
      "grad_norm": 0.4820025513716287,
      "learning_rate": 4.845306306974671e-05,
      "loss": 1.9053,
      "num_input_tokens_seen": 10087912896,
      "step": 12822
    },
    {
      "epoch": 1.36038616592404,
      "grad_norm": 0.43125331485023155,
      "learning_rate": 4.8452822390531715e-05,
      "loss": 1.8732,
      "num_input_tokens_seen": 10088699632,
      "step": 12823
    },
    {
      "epoch": 1.3604922554636114,
      "grad_norm": 0.4515348964641978,
      "learning_rate": 4.845258169319307e-05,
      "loss": 1.8029,
      "num_input_tokens_seen": 10089486368,
      "step": 12824
    },
    {
      "epoch": 1.3605983450031827,
      "grad_norm": 0.38991124855452197,
      "learning_rate": 4.845234097773095e-05,
      "loss": 1.7433,
      "num_input_tokens_seen": 10090273120,
      "step": 12825
    },
    {
      "epoch": 1.3607044345427541,
      "grad_norm": 0.4382191773769423,
      "learning_rate": 4.8452100244145554e-05,
      "loss": 1.7487,
      "num_input_tokens_seen": 10091059904,
      "step": 12826
    },
    {
      "epoch": 1.3608105240823254,
      "grad_norm": 0.39247826713397754,
      "learning_rate": 4.845185949243706e-05,
      "loss": 1.8801,
      "num_input_tokens_seen": 10091846736,
      "step": 12827
    },
    {
      "epoch": 1.3609166136218969,
      "grad_norm": 0.5001694601005795,
      "learning_rate": 4.845161872260566e-05,
      "loss": 1.8495,
      "num_input_tokens_seen": 10092633472,
      "step": 12828
    },
    {
      "epoch": 1.3610227031614683,
      "grad_norm": 0.5465500653515785,
      "learning_rate": 4.8451377934651545e-05,
      "loss": 1.7284,
      "num_input_tokens_seen": 10093420192,
      "step": 12829
    },
    {
      "epoch": 1.3611287927010398,
      "grad_norm": 0.43356425135655424,
      "learning_rate": 4.845113712857489e-05,
      "loss": 1.8682,
      "num_input_tokens_seen": 10094206928,
      "step": 12830
    },
    {
      "epoch": 1.361234882240611,
      "grad_norm": 0.4075215603835351,
      "learning_rate": 4.845089630437587e-05,
      "loss": 1.7506,
      "num_input_tokens_seen": 10094993600,
      "step": 12831
    },
    {
      "epoch": 1.3613409717801825,
      "grad_norm": 0.5209167258449953,
      "learning_rate": 4.84506554620547e-05,
      "loss": 1.7659,
      "num_input_tokens_seen": 10095780352,
      "step": 12832
    },
    {
      "epoch": 1.3614470613197538,
      "grad_norm": 0.32188314172371074,
      "learning_rate": 4.845041460161155e-05,
      "loss": 1.7551,
      "num_input_tokens_seen": 10096567104,
      "step": 12833
    },
    {
      "epoch": 1.3615531508593253,
      "grad_norm": 0.42969164216940325,
      "learning_rate": 4.84501737230466e-05,
      "loss": 1.584,
      "num_input_tokens_seen": 10097353920,
      "step": 12834
    },
    {
      "epoch": 1.3616592403988967,
      "grad_norm": 0.5615343093707847,
      "learning_rate": 4.844993282636005e-05,
      "loss": 1.9838,
      "num_input_tokens_seen": 10098140560,
      "step": 12835
    },
    {
      "epoch": 1.361765329938468,
      "grad_norm": 0.5172069003490897,
      "learning_rate": 4.8449691911552084e-05,
      "loss": 1.813,
      "num_input_tokens_seen": 10098927376,
      "step": 12836
    },
    {
      "epoch": 1.3618714194780395,
      "grad_norm": 0.5628154930908786,
      "learning_rate": 4.844945097862288e-05,
      "loss": 1.8034,
      "num_input_tokens_seen": 10099714160,
      "step": 12837
    },
    {
      "epoch": 1.361977509017611,
      "grad_norm": 0.34353800622954,
      "learning_rate": 4.844921002757262e-05,
      "loss": 1.6976,
      "num_input_tokens_seen": 10100501008,
      "step": 12838
    },
    {
      "epoch": 1.3620835985571822,
      "grad_norm": 0.5171762501573967,
      "learning_rate": 4.8448969058401504e-05,
      "loss": 1.711,
      "num_input_tokens_seen": 10101287872,
      "step": 12839
    },
    {
      "epoch": 1.3621896880967537,
      "grad_norm": 0.668844112617731,
      "learning_rate": 4.8448728071109716e-05,
      "loss": 1.7498,
      "num_input_tokens_seen": 10102074720,
      "step": 12840
    },
    {
      "epoch": 1.3622957776363251,
      "grad_norm": 0.40738274369932215,
      "learning_rate": 4.844848706569744e-05,
      "loss": 1.8114,
      "num_input_tokens_seen": 10102861472,
      "step": 12841
    },
    {
      "epoch": 1.3624018671758964,
      "grad_norm": 1.087704730882924,
      "learning_rate": 4.844824604216486e-05,
      "loss": 1.7582,
      "num_input_tokens_seen": 10103648256,
      "step": 12842
    },
    {
      "epoch": 1.3625079567154679,
      "grad_norm": 0.4135770730678992,
      "learning_rate": 4.8448005000512165e-05,
      "loss": 1.63,
      "num_input_tokens_seen": 10104435056,
      "step": 12843
    },
    {
      "epoch": 1.3626140462550391,
      "grad_norm": 0.8438221278255285,
      "learning_rate": 4.844776394073953e-05,
      "loss": 1.8962,
      "num_input_tokens_seen": 10105221792,
      "step": 12844
    },
    {
      "epoch": 1.3627201357946106,
      "grad_norm": 0.5127216226335636,
      "learning_rate": 4.844752286284716e-05,
      "loss": 1.8953,
      "num_input_tokens_seen": 10106008512,
      "step": 12845
    },
    {
      "epoch": 1.362826225334182,
      "grad_norm": 0.7807711490625033,
      "learning_rate": 4.844728176683523e-05,
      "loss": 1.9659,
      "num_input_tokens_seen": 10106795200,
      "step": 12846
    },
    {
      "epoch": 1.3629323148737535,
      "grad_norm": 0.987780089646002,
      "learning_rate": 4.844704065270393e-05,
      "loss": 1.7449,
      "num_input_tokens_seen": 10107581984,
      "step": 12847
    },
    {
      "epoch": 1.3630384044133248,
      "grad_norm": 0.7635454880685598,
      "learning_rate": 4.844679952045345e-05,
      "loss": 1.7535,
      "num_input_tokens_seen": 10108368784,
      "step": 12848
    },
    {
      "epoch": 1.3631444939528963,
      "grad_norm": 1.2141162465717428,
      "learning_rate": 4.844655837008396e-05,
      "loss": 1.8116,
      "num_input_tokens_seen": 10109155536,
      "step": 12849
    },
    {
      "epoch": 1.3632505834924675,
      "grad_norm": 0.4768208027703256,
      "learning_rate": 4.844631720159566e-05,
      "loss": 1.7792,
      "num_input_tokens_seen": 10109942336,
      "step": 12850
    },
    {
      "epoch": 1.363356673032039,
      "grad_norm": 0.5598448740764894,
      "learning_rate": 4.844607601498874e-05,
      "loss": 1.6744,
      "num_input_tokens_seen": 10110729120,
      "step": 12851
    },
    {
      "epoch": 1.3634627625716105,
      "grad_norm": 0.5670496026731333,
      "learning_rate": 4.844583481026338e-05,
      "loss": 1.6587,
      "num_input_tokens_seen": 10111515968,
      "step": 12852
    },
    {
      "epoch": 1.363568852111182,
      "grad_norm": 0.42380715214952086,
      "learning_rate": 4.8445593587419765e-05,
      "loss": 1.7756,
      "num_input_tokens_seen": 10112302752,
      "step": 12853
    },
    {
      "epoch": 1.3636749416507532,
      "grad_norm": 0.5094514149531132,
      "learning_rate": 4.844535234645808e-05,
      "loss": 1.972,
      "num_input_tokens_seen": 10113089456,
      "step": 12854
    },
    {
      "epoch": 1.3637810311903247,
      "grad_norm": 0.4585203930251729,
      "learning_rate": 4.8445111087378514e-05,
      "loss": 1.7486,
      "num_input_tokens_seen": 10113876192,
      "step": 12855
    },
    {
      "epoch": 1.363887120729896,
      "grad_norm": 0.41773097499156026,
      "learning_rate": 4.844486981018126e-05,
      "loss": 1.7624,
      "num_input_tokens_seen": 10114662976,
      "step": 12856
    },
    {
      "epoch": 1.3639932102694674,
      "grad_norm": 0.36303081420689676,
      "learning_rate": 4.8444628514866494e-05,
      "loss": 1.7324,
      "num_input_tokens_seen": 10115449824,
      "step": 12857
    },
    {
      "epoch": 1.3640992998090389,
      "grad_norm": 0.3909586052088489,
      "learning_rate": 4.844438720143441e-05,
      "loss": 1.7411,
      "num_input_tokens_seen": 10116236656,
      "step": 12858
    },
    {
      "epoch": 1.3642053893486104,
      "grad_norm": 0.35558090566318246,
      "learning_rate": 4.8444145869885194e-05,
      "loss": 1.647,
      "num_input_tokens_seen": 10117023472,
      "step": 12859
    },
    {
      "epoch": 1.3643114788881816,
      "grad_norm": 0.4450770967084712,
      "learning_rate": 4.8443904520219016e-05,
      "loss": 1.8302,
      "num_input_tokens_seen": 10117810224,
      "step": 12860
    },
    {
      "epoch": 1.364417568427753,
      "grad_norm": 0.37663978189499625,
      "learning_rate": 4.844366315243609e-05,
      "loss": 1.7777,
      "num_input_tokens_seen": 10118596944,
      "step": 12861
    },
    {
      "epoch": 1.3645236579673243,
      "grad_norm": 0.371604705175283,
      "learning_rate": 4.844342176653659e-05,
      "loss": 1.8014,
      "num_input_tokens_seen": 10119383776,
      "step": 12862
    },
    {
      "epoch": 1.3646297475068958,
      "grad_norm": 0.40877587123329345,
      "learning_rate": 4.84431803625207e-05,
      "loss": 1.7068,
      "num_input_tokens_seen": 10120170528,
      "step": 12863
    },
    {
      "epoch": 1.3647358370464673,
      "grad_norm": 0.3729754977498619,
      "learning_rate": 4.8442938940388596e-05,
      "loss": 1.8376,
      "num_input_tokens_seen": 10120957264,
      "step": 12864
    },
    {
      "epoch": 1.3648419265860385,
      "grad_norm": 0.43657677337442957,
      "learning_rate": 4.8442697500140485e-05,
      "loss": 1.8011,
      "num_input_tokens_seen": 10121744048,
      "step": 12865
    },
    {
      "epoch": 1.36494801612561,
      "grad_norm": 0.3729314820855726,
      "learning_rate": 4.8442456041776555e-05,
      "loss": 1.7317,
      "num_input_tokens_seen": 10122530944,
      "step": 12866
    },
    {
      "epoch": 1.3650541056651815,
      "grad_norm": 0.37680339039029337,
      "learning_rate": 4.8442214565296975e-05,
      "loss": 1.6766,
      "num_input_tokens_seen": 10123317808,
      "step": 12867
    },
    {
      "epoch": 1.3651601952047527,
      "grad_norm": 0.4074293123518648,
      "learning_rate": 4.844197307070193e-05,
      "loss": 1.7685,
      "num_input_tokens_seen": 10124104608,
      "step": 12868
    },
    {
      "epoch": 1.3652662847443242,
      "grad_norm": 0.3993409793546408,
      "learning_rate": 4.8441731557991626e-05,
      "loss": 1.7813,
      "num_input_tokens_seen": 10124891392,
      "step": 12869
    },
    {
      "epoch": 1.3653723742838957,
      "grad_norm": 0.3859598529493247,
      "learning_rate": 4.844149002716624e-05,
      "loss": 1.8853,
      "num_input_tokens_seen": 10125678096,
      "step": 12870
    },
    {
      "epoch": 1.365478463823467,
      "grad_norm": 0.35391487839242747,
      "learning_rate": 4.8441248478225957e-05,
      "loss": 1.7905,
      "num_input_tokens_seen": 10126464864,
      "step": 12871
    },
    {
      "epoch": 1.3655845533630384,
      "grad_norm": 0.3956289403210543,
      "learning_rate": 4.844100691117096e-05,
      "loss": 1.7696,
      "num_input_tokens_seen": 10127251568,
      "step": 12872
    },
    {
      "epoch": 1.3656906429026099,
      "grad_norm": 0.3394503850752082,
      "learning_rate": 4.844076532600145e-05,
      "loss": 1.7532,
      "num_input_tokens_seen": 10128038320,
      "step": 12873
    },
    {
      "epoch": 1.3657967324421811,
      "grad_norm": 0.4192785432590289,
      "learning_rate": 4.8440523722717595e-05,
      "loss": 1.699,
      "num_input_tokens_seen": 10128825184,
      "step": 12874
    },
    {
      "epoch": 1.3659028219817526,
      "grad_norm": 0.37363407777290214,
      "learning_rate": 4.84402821013196e-05,
      "loss": 1.7043,
      "num_input_tokens_seen": 10129611952,
      "step": 12875
    },
    {
      "epoch": 1.366008911521324,
      "grad_norm": 0.36576529111978795,
      "learning_rate": 4.8440040461807635e-05,
      "loss": 1.7019,
      "num_input_tokens_seen": 10130398800,
      "step": 12876
    },
    {
      "epoch": 1.3661150010608953,
      "grad_norm": 0.42476162346680696,
      "learning_rate": 4.84397988041819e-05,
      "loss": 1.9387,
      "num_input_tokens_seen": 10131185552,
      "step": 12877
    },
    {
      "epoch": 1.3662210906004668,
      "grad_norm": 0.3620653931298825,
      "learning_rate": 4.843955712844257e-05,
      "loss": 1.6968,
      "num_input_tokens_seen": 10131972352,
      "step": 12878
    },
    {
      "epoch": 1.366327180140038,
      "grad_norm": 0.355864128239528,
      "learning_rate": 4.843931543458984e-05,
      "loss": 1.8218,
      "num_input_tokens_seen": 10132759104,
      "step": 12879
    },
    {
      "epoch": 1.3664332696796095,
      "grad_norm": 0.37456233848864173,
      "learning_rate": 4.8439073722623893e-05,
      "loss": 1.7219,
      "num_input_tokens_seen": 10133545904,
      "step": 12880
    },
    {
      "epoch": 1.366539359219181,
      "grad_norm": 0.3554871421279039,
      "learning_rate": 4.843883199254493e-05,
      "loss": 1.7541,
      "num_input_tokens_seen": 10134332656,
      "step": 12881
    },
    {
      "epoch": 1.3666454487587525,
      "grad_norm": 0.374883745985467,
      "learning_rate": 4.843859024435311e-05,
      "loss": 1.816,
      "num_input_tokens_seen": 10135119456,
      "step": 12882
    },
    {
      "epoch": 1.3667515382983237,
      "grad_norm": 0.3771884637135387,
      "learning_rate": 4.843834847804864e-05,
      "loss": 1.7646,
      "num_input_tokens_seen": 10135906256,
      "step": 12883
    },
    {
      "epoch": 1.3668576278378952,
      "grad_norm": 0.3737960607410395,
      "learning_rate": 4.843810669363171e-05,
      "loss": 1.7207,
      "num_input_tokens_seen": 10136693056,
      "step": 12884
    },
    {
      "epoch": 1.3669637173774665,
      "grad_norm": 0.3592445027653528,
      "learning_rate": 4.843786489110249e-05,
      "loss": 1.6918,
      "num_input_tokens_seen": 10137479936,
      "step": 12885
    },
    {
      "epoch": 1.367069806917038,
      "grad_norm": 0.3435316007161122,
      "learning_rate": 4.843762307046118e-05,
      "loss": 1.8073,
      "num_input_tokens_seen": 10138266656,
      "step": 12886
    },
    {
      "epoch": 1.3671758964566094,
      "grad_norm": 0.41935849031137545,
      "learning_rate": 4.843738123170796e-05,
      "loss": 1.846,
      "num_input_tokens_seen": 10139053504,
      "step": 12887
    },
    {
      "epoch": 1.367281985996181,
      "grad_norm": 0.3398569800525005,
      "learning_rate": 4.8437139374843024e-05,
      "loss": 1.8097,
      "num_input_tokens_seen": 10139840352,
      "step": 12888
    },
    {
      "epoch": 1.3673880755357521,
      "grad_norm": 0.3620831324473182,
      "learning_rate": 4.843689749986655e-05,
      "loss": 1.8951,
      "num_input_tokens_seen": 10140626944,
      "step": 12889
    },
    {
      "epoch": 1.3674941650753236,
      "grad_norm": 0.3260443595996003,
      "learning_rate": 4.843665560677873e-05,
      "loss": 1.6847,
      "num_input_tokens_seen": 10141413776,
      "step": 12890
    },
    {
      "epoch": 1.3676002546148949,
      "grad_norm": 0.4424593534734436,
      "learning_rate": 4.8436413695579755e-05,
      "loss": 1.8193,
      "num_input_tokens_seen": 10142200560,
      "step": 12891
    },
    {
      "epoch": 1.3677063441544663,
      "grad_norm": 0.49879062629599585,
      "learning_rate": 4.84361717662698e-05,
      "loss": 1.7562,
      "num_input_tokens_seen": 10142987312,
      "step": 12892
    },
    {
      "epoch": 1.3678124336940378,
      "grad_norm": 0.4334138329465333,
      "learning_rate": 4.843592981884906e-05,
      "loss": 1.7485,
      "num_input_tokens_seen": 10143774112,
      "step": 12893
    },
    {
      "epoch": 1.3679185232336093,
      "grad_norm": 0.4174811471115195,
      "learning_rate": 4.843568785331772e-05,
      "loss": 1.7762,
      "num_input_tokens_seen": 10144560848,
      "step": 12894
    },
    {
      "epoch": 1.3680246127731805,
      "grad_norm": 0.5451949929655527,
      "learning_rate": 4.843544586967597e-05,
      "loss": 1.7564,
      "num_input_tokens_seen": 10145347680,
      "step": 12895
    },
    {
      "epoch": 1.368130702312752,
      "grad_norm": 0.5034043617334052,
      "learning_rate": 4.843520386792399e-05,
      "loss": 1.8476,
      "num_input_tokens_seen": 10146134448,
      "step": 12896
    },
    {
      "epoch": 1.3682367918523233,
      "grad_norm": 0.4804185699515448,
      "learning_rate": 4.843496184806199e-05,
      "loss": 1.7056,
      "num_input_tokens_seen": 10146921232,
      "step": 12897
    },
    {
      "epoch": 1.3683428813918947,
      "grad_norm": 0.3707404451144134,
      "learning_rate": 4.8434719810090125e-05,
      "loss": 1.5826,
      "num_input_tokens_seen": 10147708048,
      "step": 12898
    },
    {
      "epoch": 1.3684489709314662,
      "grad_norm": 0.5089632392186195,
      "learning_rate": 4.843447775400859e-05,
      "loss": 1.9491,
      "num_input_tokens_seen": 10148494784,
      "step": 12899
    },
    {
      "epoch": 1.3685550604710375,
      "grad_norm": 0.45859830738331103,
      "learning_rate": 4.843423567981759e-05,
      "loss": 1.6591,
      "num_input_tokens_seen": 10149281488,
      "step": 12900
    },
    {
      "epoch": 1.368661150010609,
      "grad_norm": 0.3433731416936162,
      "learning_rate": 4.8433993587517304e-05,
      "loss": 1.7143,
      "num_input_tokens_seen": 10150068288,
      "step": 12901
    },
    {
      "epoch": 1.3687672395501804,
      "grad_norm": 0.4162696320518764,
      "learning_rate": 4.8433751477107906e-05,
      "loss": 1.7254,
      "num_input_tokens_seen": 10150855008,
      "step": 12902
    },
    {
      "epoch": 1.3688733290897517,
      "grad_norm": 0.3949300948740997,
      "learning_rate": 4.843350934858959e-05,
      "loss": 1.7208,
      "num_input_tokens_seen": 10151641808,
      "step": 12903
    },
    {
      "epoch": 1.3689794186293232,
      "grad_norm": 0.3980563151372965,
      "learning_rate": 4.843326720196255e-05,
      "loss": 1.8503,
      "num_input_tokens_seen": 10152428544,
      "step": 12904
    },
    {
      "epoch": 1.3690855081688946,
      "grad_norm": 0.4284272005879529,
      "learning_rate": 4.843302503722697e-05,
      "loss": 1.7876,
      "num_input_tokens_seen": 10153215312,
      "step": 12905
    },
    {
      "epoch": 1.3691915977084659,
      "grad_norm": 0.4368087261118161,
      "learning_rate": 4.843278285438304e-05,
      "loss": 1.7459,
      "num_input_tokens_seen": 10154002000,
      "step": 12906
    },
    {
      "epoch": 1.3692976872480374,
      "grad_norm": 0.4380890609817432,
      "learning_rate": 4.843254065343093e-05,
      "loss": 1.7458,
      "num_input_tokens_seen": 10154788672,
      "step": 12907
    },
    {
      "epoch": 1.3694037767876086,
      "grad_norm": 0.4070028202523427,
      "learning_rate": 4.843229843437085e-05,
      "loss": 1.6832,
      "num_input_tokens_seen": 10155575488,
      "step": 12908
    },
    {
      "epoch": 1.36950986632718,
      "grad_norm": 0.44845949721157485,
      "learning_rate": 4.843205619720297e-05,
      "loss": 1.7906,
      "num_input_tokens_seen": 10156362208,
      "step": 12909
    },
    {
      "epoch": 1.3696159558667516,
      "grad_norm": 0.5345598261672921,
      "learning_rate": 4.843181394192749e-05,
      "loss": 1.7833,
      "num_input_tokens_seen": 10157148928,
      "step": 12910
    },
    {
      "epoch": 1.369722045406323,
      "grad_norm": 0.41387369693367854,
      "learning_rate": 4.843157166854459e-05,
      "loss": 1.6777,
      "num_input_tokens_seen": 10157935744,
      "step": 12911
    },
    {
      "epoch": 1.3698281349458943,
      "grad_norm": 0.4077407295917075,
      "learning_rate": 4.843132937705447e-05,
      "loss": 1.7836,
      "num_input_tokens_seen": 10158722464,
      "step": 12912
    },
    {
      "epoch": 1.3699342244854658,
      "grad_norm": 0.4403233724796917,
      "learning_rate": 4.843108706745729e-05,
      "loss": 1.7171,
      "num_input_tokens_seen": 10159509312,
      "step": 12913
    },
    {
      "epoch": 1.370040314025037,
      "grad_norm": 0.4070715989592107,
      "learning_rate": 4.8430844739753254e-05,
      "loss": 1.7647,
      "num_input_tokens_seen": 10160296048,
      "step": 12914
    },
    {
      "epoch": 1.3701464035646085,
      "grad_norm": 0.4207698344083421,
      "learning_rate": 4.843060239394256e-05,
      "loss": 1.8346,
      "num_input_tokens_seen": 10161082768,
      "step": 12915
    },
    {
      "epoch": 1.37025249310418,
      "grad_norm": 0.34654623661269857,
      "learning_rate": 4.843036003002538e-05,
      "loss": 1.6807,
      "num_input_tokens_seen": 10161869552,
      "step": 12916
    },
    {
      "epoch": 1.3703585826437514,
      "grad_norm": 0.4298894409262083,
      "learning_rate": 4.8430117648001904e-05,
      "loss": 1.7623,
      "num_input_tokens_seen": 10162656304,
      "step": 12917
    },
    {
      "epoch": 1.3704646721833227,
      "grad_norm": 0.3859183337442578,
      "learning_rate": 4.842987524787232e-05,
      "loss": 1.7648,
      "num_input_tokens_seen": 10163442976,
      "step": 12918
    },
    {
      "epoch": 1.3705707617228942,
      "grad_norm": 0.3626268257331661,
      "learning_rate": 4.842963282963682e-05,
      "loss": 1.7074,
      "num_input_tokens_seen": 10164229760,
      "step": 12919
    },
    {
      "epoch": 1.3706768512624654,
      "grad_norm": 0.3826984748522861,
      "learning_rate": 4.8429390393295585e-05,
      "loss": 1.7537,
      "num_input_tokens_seen": 10165016528,
      "step": 12920
    },
    {
      "epoch": 1.3707829408020369,
      "grad_norm": 0.3723531660471938,
      "learning_rate": 4.842914793884879e-05,
      "loss": 1.8913,
      "num_input_tokens_seen": 10165803264,
      "step": 12921
    },
    {
      "epoch": 1.3708890303416084,
      "grad_norm": 0.3419623900960873,
      "learning_rate": 4.842890546629666e-05,
      "loss": 1.7723,
      "num_input_tokens_seen": 10166589936,
      "step": 12922
    },
    {
      "epoch": 1.3709951198811798,
      "grad_norm": 0.4073578274923145,
      "learning_rate": 4.8428662975639344e-05,
      "loss": 1.8182,
      "num_input_tokens_seen": 10167376768,
      "step": 12923
    },
    {
      "epoch": 1.371101209420751,
      "grad_norm": 0.36186827209676425,
      "learning_rate": 4.842842046687705e-05,
      "loss": 1.6634,
      "num_input_tokens_seen": 10168163616,
      "step": 12924
    },
    {
      "epoch": 1.3712072989603226,
      "grad_norm": 0.3772664406242119,
      "learning_rate": 4.8428177940009953e-05,
      "loss": 1.9561,
      "num_input_tokens_seen": 10168950352,
      "step": 12925
    },
    {
      "epoch": 1.3713133884998938,
      "grad_norm": 0.4174397715037929,
      "learning_rate": 4.842793539503826e-05,
      "loss": 1.7995,
      "num_input_tokens_seen": 10169737008,
      "step": 12926
    },
    {
      "epoch": 1.3714194780394653,
      "grad_norm": 0.379738950348372,
      "learning_rate": 4.842769283196214e-05,
      "loss": 1.8799,
      "num_input_tokens_seen": 10170523712,
      "step": 12927
    },
    {
      "epoch": 1.3715255675790368,
      "grad_norm": 0.411479112120161,
      "learning_rate": 4.842745025078178e-05,
      "loss": 1.8029,
      "num_input_tokens_seen": 10171310560,
      "step": 12928
    },
    {
      "epoch": 1.3716316571186082,
      "grad_norm": 0.37164607458381616,
      "learning_rate": 4.8427207651497386e-05,
      "loss": 1.7512,
      "num_input_tokens_seen": 10172097200,
      "step": 12929
    },
    {
      "epoch": 1.3717377466581795,
      "grad_norm": 0.40354403603366457,
      "learning_rate": 4.842696503410913e-05,
      "loss": 1.8449,
      "num_input_tokens_seen": 10172884016,
      "step": 12930
    },
    {
      "epoch": 1.371843836197751,
      "grad_norm": 0.39960703465673253,
      "learning_rate": 4.84267223986172e-05,
      "loss": 1.6867,
      "num_input_tokens_seen": 10173670800,
      "step": 12931
    },
    {
      "epoch": 1.3719499257373222,
      "grad_norm": 0.32539640599334824,
      "learning_rate": 4.842647974502179e-05,
      "loss": 1.7201,
      "num_input_tokens_seen": 10174457584,
      "step": 12932
    },
    {
      "epoch": 1.3720560152768937,
      "grad_norm": 0.3835701955105432,
      "learning_rate": 4.842623707332308e-05,
      "loss": 1.8293,
      "num_input_tokens_seen": 10175244320,
      "step": 12933
    },
    {
      "epoch": 1.3721621048164652,
      "grad_norm": 0.34160344167304585,
      "learning_rate": 4.842599438352126e-05,
      "loss": 1.8738,
      "num_input_tokens_seen": 10176030992,
      "step": 12934
    },
    {
      "epoch": 1.3722681943560364,
      "grad_norm": 0.40884034536558683,
      "learning_rate": 4.8425751675616524e-05,
      "loss": 1.7302,
      "num_input_tokens_seen": 10176817808,
      "step": 12935
    },
    {
      "epoch": 1.372374283895608,
      "grad_norm": 0.359061124442901,
      "learning_rate": 4.842550894960905e-05,
      "loss": 1.7245,
      "num_input_tokens_seen": 10177604512,
      "step": 12936
    },
    {
      "epoch": 1.3724803734351794,
      "grad_norm": 0.3422962602445851,
      "learning_rate": 4.842526620549903e-05,
      "loss": 1.7959,
      "num_input_tokens_seen": 10178391312,
      "step": 12937
    },
    {
      "epoch": 1.3725864629747506,
      "grad_norm": 0.3922462042249401,
      "learning_rate": 4.842502344328666e-05,
      "loss": 1.6509,
      "num_input_tokens_seen": 10179178032,
      "step": 12938
    },
    {
      "epoch": 1.372692552514322,
      "grad_norm": 0.4302434433034814,
      "learning_rate": 4.84247806629721e-05,
      "loss": 1.7363,
      "num_input_tokens_seen": 10179964832,
      "step": 12939
    },
    {
      "epoch": 1.3727986420538936,
      "grad_norm": 0.3979798614218439,
      "learning_rate": 4.842453786455558e-05,
      "loss": 1.7263,
      "num_input_tokens_seen": 10180751632,
      "step": 12940
    },
    {
      "epoch": 1.3729047315934648,
      "grad_norm": 0.3961111836596392,
      "learning_rate": 4.842429504803725e-05,
      "loss": 1.91,
      "num_input_tokens_seen": 10181538384,
      "step": 12941
    },
    {
      "epoch": 1.3730108211330363,
      "grad_norm": 0.36133540848312795,
      "learning_rate": 4.8424052213417315e-05,
      "loss": 1.7788,
      "num_input_tokens_seen": 10182325104,
      "step": 12942
    },
    {
      "epoch": 1.3731169106726075,
      "grad_norm": 0.3786687563236923,
      "learning_rate": 4.842380936069596e-05,
      "loss": 1.7632,
      "num_input_tokens_seen": 10183111840,
      "step": 12943
    },
    {
      "epoch": 1.373223000212179,
      "grad_norm": 0.37716402304770263,
      "learning_rate": 4.8423566489873376e-05,
      "loss": 1.8996,
      "num_input_tokens_seen": 10183898576,
      "step": 12944
    },
    {
      "epoch": 1.3733290897517505,
      "grad_norm": 0.4677943720385657,
      "learning_rate": 4.842332360094974e-05,
      "loss": 1.8579,
      "num_input_tokens_seen": 10184685376,
      "step": 12945
    },
    {
      "epoch": 1.373435179291322,
      "grad_norm": 0.37454801801234877,
      "learning_rate": 4.842308069392525e-05,
      "loss": 1.7432,
      "num_input_tokens_seen": 10185472112,
      "step": 12946
    },
    {
      "epoch": 1.3735412688308932,
      "grad_norm": 0.45419670507141185,
      "learning_rate": 4.842283776880009e-05,
      "loss": 1.7912,
      "num_input_tokens_seen": 10186258912,
      "step": 12947
    },
    {
      "epoch": 1.3736473583704647,
      "grad_norm": 0.34267039408467787,
      "learning_rate": 4.8422594825574455e-05,
      "loss": 1.7877,
      "num_input_tokens_seen": 10187045696,
      "step": 12948
    },
    {
      "epoch": 1.373753447910036,
      "grad_norm": 0.35545961734933257,
      "learning_rate": 4.842235186424852e-05,
      "loss": 1.7921,
      "num_input_tokens_seen": 10187832432,
      "step": 12949
    },
    {
      "epoch": 1.3738595374496074,
      "grad_norm": 0.37988919213886513,
      "learning_rate": 4.8422108884822475e-05,
      "loss": 1.6769,
      "num_input_tokens_seen": 10188619200,
      "step": 12950
    },
    {
      "epoch": 1.373965626989179,
      "grad_norm": 0.3696620866020924,
      "learning_rate": 4.842186588729651e-05,
      "loss": 1.6902,
      "num_input_tokens_seen": 10189405968,
      "step": 12951
    },
    {
      "epoch": 1.3740717165287504,
      "grad_norm": 0.4032202661201885,
      "learning_rate": 4.842162287167082e-05,
      "loss": 1.8243,
      "num_input_tokens_seen": 10190192752,
      "step": 12952
    },
    {
      "epoch": 1.3741778060683216,
      "grad_norm": 0.34942931660884463,
      "learning_rate": 4.842137983794559e-05,
      "loss": 1.7431,
      "num_input_tokens_seen": 10190979584,
      "step": 12953
    },
    {
      "epoch": 1.374283895607893,
      "grad_norm": 0.3765329973665442,
      "learning_rate": 4.842113678612101e-05,
      "loss": 1.8028,
      "num_input_tokens_seen": 10191766400,
      "step": 12954
    },
    {
      "epoch": 1.3743899851474644,
      "grad_norm": 0.3707038703103025,
      "learning_rate": 4.842089371619725e-05,
      "loss": 1.9013,
      "num_input_tokens_seen": 10192553072,
      "step": 12955
    },
    {
      "epoch": 1.3744960746870358,
      "grad_norm": 0.38824012889020443,
      "learning_rate": 4.842065062817451e-05,
      "loss": 1.794,
      "num_input_tokens_seen": 10193339808,
      "step": 12956
    },
    {
      "epoch": 1.3746021642266073,
      "grad_norm": 0.41848769809225966,
      "learning_rate": 4.842040752205299e-05,
      "loss": 1.8097,
      "num_input_tokens_seen": 10194126592,
      "step": 12957
    },
    {
      "epoch": 1.3747082537661788,
      "grad_norm": 0.40148717227269637,
      "learning_rate": 4.842016439783286e-05,
      "loss": 1.8025,
      "num_input_tokens_seen": 10194913424,
      "step": 12958
    },
    {
      "epoch": 1.37481434330575,
      "grad_norm": 0.39088924704241573,
      "learning_rate": 4.841992125551431e-05,
      "loss": 1.8498,
      "num_input_tokens_seen": 10195700128,
      "step": 12959
    },
    {
      "epoch": 1.3749204328453215,
      "grad_norm": 0.36239606835052657,
      "learning_rate": 4.841967809509754e-05,
      "loss": 1.7405,
      "num_input_tokens_seen": 10196486912,
      "step": 12960
    },
    {
      "epoch": 1.3750265223848928,
      "grad_norm": 0.39698508881203465,
      "learning_rate": 4.841943491658273e-05,
      "loss": 1.745,
      "num_input_tokens_seen": 10197273616,
      "step": 12961
    },
    {
      "epoch": 1.3751326119244642,
      "grad_norm": 0.37586036426942737,
      "learning_rate": 4.841919171997006e-05,
      "loss": 1.7605,
      "num_input_tokens_seen": 10198060336,
      "step": 12962
    },
    {
      "epoch": 1.3752387014640357,
      "grad_norm": 0.3997306533378124,
      "learning_rate": 4.841894850525973e-05,
      "loss": 1.8522,
      "num_input_tokens_seen": 10198847072,
      "step": 12963
    },
    {
      "epoch": 1.3753447910036072,
      "grad_norm": 0.3772773315312868,
      "learning_rate": 4.841870527245193e-05,
      "loss": 1.6757,
      "num_input_tokens_seen": 10199633888,
      "step": 12964
    },
    {
      "epoch": 1.3754508805431784,
      "grad_norm": 0.40988859165334357,
      "learning_rate": 4.841846202154683e-05,
      "loss": 1.7844,
      "num_input_tokens_seen": 10200420768,
      "step": 12965
    },
    {
      "epoch": 1.37555697008275,
      "grad_norm": 0.3890940919362658,
      "learning_rate": 4.841821875254463e-05,
      "loss": 1.7842,
      "num_input_tokens_seen": 10201207536,
      "step": 12966
    },
    {
      "epoch": 1.3756630596223212,
      "grad_norm": 0.46345455166176447,
      "learning_rate": 4.841797546544553e-05,
      "loss": 1.7691,
      "num_input_tokens_seen": 10201994320,
      "step": 12967
    },
    {
      "epoch": 1.3757691491618926,
      "grad_norm": 0.429883103774914,
      "learning_rate": 4.84177321602497e-05,
      "loss": 1.7389,
      "num_input_tokens_seen": 10202781104,
      "step": 12968
    },
    {
      "epoch": 1.375875238701464,
      "grad_norm": 0.39292021696027346,
      "learning_rate": 4.841748883695732e-05,
      "loss": 1.8747,
      "num_input_tokens_seen": 10203567856,
      "step": 12969
    },
    {
      "epoch": 1.3759813282410354,
      "grad_norm": 0.4457197421649548,
      "learning_rate": 4.841724549556861e-05,
      "loss": 1.6183,
      "num_input_tokens_seen": 10204354688,
      "step": 12970
    },
    {
      "epoch": 1.3760874177806068,
      "grad_norm": 0.42679674323075767,
      "learning_rate": 4.841700213608373e-05,
      "loss": 1.7252,
      "num_input_tokens_seen": 10205141504,
      "step": 12971
    },
    {
      "epoch": 1.3761935073201783,
      "grad_norm": 0.35829784010564464,
      "learning_rate": 4.8416758758502885e-05,
      "loss": 1.768,
      "num_input_tokens_seen": 10205928240,
      "step": 12972
    },
    {
      "epoch": 1.3762995968597496,
      "grad_norm": 0.36133428727815925,
      "learning_rate": 4.841651536282625e-05,
      "loss": 1.6988,
      "num_input_tokens_seen": 10206715056,
      "step": 12973
    },
    {
      "epoch": 1.376405686399321,
      "grad_norm": 0.45192806273892394,
      "learning_rate": 4.841627194905403e-05,
      "loss": 1.7665,
      "num_input_tokens_seen": 10207501888,
      "step": 12974
    },
    {
      "epoch": 1.3765117759388925,
      "grad_norm": 0.4541711577824553,
      "learning_rate": 4.8416028517186386e-05,
      "loss": 1.7389,
      "num_input_tokens_seen": 10208288704,
      "step": 12975
    },
    {
      "epoch": 1.3766178654784638,
      "grad_norm": 0.3989445856966109,
      "learning_rate": 4.841578506722353e-05,
      "loss": 1.7868,
      "num_input_tokens_seen": 10209075472,
      "step": 12976
    },
    {
      "epoch": 1.3767239550180352,
      "grad_norm": 0.3727807019166621,
      "learning_rate": 4.841554159916564e-05,
      "loss": 1.7002,
      "num_input_tokens_seen": 10209862320,
      "step": 12977
    },
    {
      "epoch": 1.3768300445576065,
      "grad_norm": 0.36757114989627176,
      "learning_rate": 4.841529811301291e-05,
      "loss": 1.7388,
      "num_input_tokens_seen": 10210648960,
      "step": 12978
    },
    {
      "epoch": 1.376936134097178,
      "grad_norm": 0.36560846995672003,
      "learning_rate": 4.841505460876552e-05,
      "loss": 1.6086,
      "num_input_tokens_seen": 10211435696,
      "step": 12979
    },
    {
      "epoch": 1.3770422236367494,
      "grad_norm": 0.39676036811951987,
      "learning_rate": 4.8414811086423666e-05,
      "loss": 1.7843,
      "num_input_tokens_seen": 10212222512,
      "step": 12980
    },
    {
      "epoch": 1.377148313176321,
      "grad_norm": 0.3667226101624701,
      "learning_rate": 4.841456754598753e-05,
      "loss": 1.6393,
      "num_input_tokens_seen": 10213009328,
      "step": 12981
    },
    {
      "epoch": 1.3772544027158922,
      "grad_norm": 0.40430113622398645,
      "learning_rate": 4.841432398745731e-05,
      "loss": 1.7473,
      "num_input_tokens_seen": 10213796080,
      "step": 12982
    },
    {
      "epoch": 1.3773604922554636,
      "grad_norm": 0.36048010358798144,
      "learning_rate": 4.8414080410833185e-05,
      "loss": 1.7267,
      "num_input_tokens_seen": 10214582912,
      "step": 12983
    },
    {
      "epoch": 1.377466581795035,
      "grad_norm": 0.3477120837799876,
      "learning_rate": 4.841383681611534e-05,
      "loss": 1.7814,
      "num_input_tokens_seen": 10215369712,
      "step": 12984
    },
    {
      "epoch": 1.3775726713346064,
      "grad_norm": 0.39804099830605283,
      "learning_rate": 4.8413593203303975e-05,
      "loss": 1.755,
      "num_input_tokens_seen": 10216156512,
      "step": 12985
    },
    {
      "epoch": 1.3776787608741778,
      "grad_norm": 0.34985240573672693,
      "learning_rate": 4.841334957239927e-05,
      "loss": 1.8725,
      "num_input_tokens_seen": 10216943216,
      "step": 12986
    },
    {
      "epoch": 1.3777848504137493,
      "grad_norm": 0.46125598939267515,
      "learning_rate": 4.841310592340142e-05,
      "loss": 2.0295,
      "num_input_tokens_seen": 10217729872,
      "step": 12987
    },
    {
      "epoch": 1.3778909399533206,
      "grad_norm": 0.3928464380680231,
      "learning_rate": 4.8412862256310606e-05,
      "loss": 1.8196,
      "num_input_tokens_seen": 10218516688,
      "step": 12988
    },
    {
      "epoch": 1.377997029492892,
      "grad_norm": 0.41786788958029747,
      "learning_rate": 4.841261857112701e-05,
      "loss": 1.7747,
      "num_input_tokens_seen": 10219303472,
      "step": 12989
    },
    {
      "epoch": 1.3781031190324633,
      "grad_norm": 0.42098314225310013,
      "learning_rate": 4.841237486785084e-05,
      "loss": 1.9492,
      "num_input_tokens_seen": 10220090192,
      "step": 12990
    },
    {
      "epoch": 1.3782092085720348,
      "grad_norm": 0.3877452547488105,
      "learning_rate": 4.8412131146482275e-05,
      "loss": 1.9473,
      "num_input_tokens_seen": 10220876976,
      "step": 12991
    },
    {
      "epoch": 1.3783152981116062,
      "grad_norm": 0.4068385966884706,
      "learning_rate": 4.84118874070215e-05,
      "loss": 1.8364,
      "num_input_tokens_seen": 10221663712,
      "step": 12992
    },
    {
      "epoch": 1.3784213876511777,
      "grad_norm": 0.49807620246493106,
      "learning_rate": 4.84116436494687e-05,
      "loss": 1.7143,
      "num_input_tokens_seen": 10222450368,
      "step": 12993
    },
    {
      "epoch": 1.378527477190749,
      "grad_norm": 0.40980445409170235,
      "learning_rate": 4.841139987382407e-05,
      "loss": 1.7967,
      "num_input_tokens_seen": 10223237056,
      "step": 12994
    },
    {
      "epoch": 1.3786335667303204,
      "grad_norm": 0.4250152549940107,
      "learning_rate": 4.841115608008779e-05,
      "loss": 1.8414,
      "num_input_tokens_seen": 10224023808,
      "step": 12995
    },
    {
      "epoch": 1.3787396562698917,
      "grad_norm": 0.48081218499376294,
      "learning_rate": 4.841091226826007e-05,
      "loss": 1.6706,
      "num_input_tokens_seen": 10224810576,
      "step": 12996
    },
    {
      "epoch": 1.3788457458094632,
      "grad_norm": 0.36064841984072,
      "learning_rate": 4.841066843834108e-05,
      "loss": 1.7788,
      "num_input_tokens_seen": 10225597408,
      "step": 12997
    },
    {
      "epoch": 1.3789518353490346,
      "grad_norm": 0.40107232796200654,
      "learning_rate": 4.841042459033101e-05,
      "loss": 1.7983,
      "num_input_tokens_seen": 10226384192,
      "step": 12998
    },
    {
      "epoch": 1.379057924888606,
      "grad_norm": 0.3632582130815033,
      "learning_rate": 4.841018072423005e-05,
      "loss": 1.7406,
      "num_input_tokens_seen": 10227170912,
      "step": 12999
    },
    {
      "epoch": 1.3791640144281774,
      "grad_norm": 0.3416415651003872,
      "learning_rate": 4.84099368400384e-05,
      "loss": 1.551,
      "num_input_tokens_seen": 10227957712,
      "step": 13000
    },
    {
      "epoch": 1.3791640144281774,
      "eval_loss": 1.7871206998825073,
      "eval_runtime": 65.3953,
      "eval_samples_per_second": 45.875,
      "eval_steps_per_second": 0.489,
      "num_input_tokens_seen": 10227957712,
      "step": 13000
    },
    {
      "epoch": 1.3792701039677489,
      "grad_norm": 0.3925676780603684,
      "learning_rate": 4.8409692937756224e-05,
      "loss": 1.9088,
      "num_input_tokens_seen": 10228744512,
      "step": 13001
    },
    {
      "epoch": 1.37937619350732,
      "grad_norm": 0.33279513760255647,
      "learning_rate": 4.840944901738372e-05,
      "loss": 1.6707,
      "num_input_tokens_seen": 10229531344,
      "step": 13002
    },
    {
      "epoch": 1.3794822830468916,
      "grad_norm": 0.41470884669162034,
      "learning_rate": 4.840920507892109e-05,
      "loss": 1.8833,
      "num_input_tokens_seen": 10230318112,
      "step": 13003
    },
    {
      "epoch": 1.379588372586463,
      "grad_norm": 0.49369898293330927,
      "learning_rate": 4.8408961122368516e-05,
      "loss": 1.8683,
      "num_input_tokens_seen": 10231104736,
      "step": 13004
    },
    {
      "epoch": 1.3796944621260343,
      "grad_norm": 0.385780387473887,
      "learning_rate": 4.840871714772618e-05,
      "loss": 1.7682,
      "num_input_tokens_seen": 10231891520,
      "step": 13005
    },
    {
      "epoch": 1.3798005516656058,
      "grad_norm": 0.458994558878782,
      "learning_rate": 4.840847315499427e-05,
      "loss": 1.8119,
      "num_input_tokens_seen": 10232678272,
      "step": 13006
    },
    {
      "epoch": 1.379906641205177,
      "grad_norm": 0.44023219754060977,
      "learning_rate": 4.840822914417299e-05,
      "loss": 1.788,
      "num_input_tokens_seen": 10233465056,
      "step": 13007
    },
    {
      "epoch": 1.3800127307447485,
      "grad_norm": 0.37471360749621596,
      "learning_rate": 4.840798511526251e-05,
      "loss": 1.71,
      "num_input_tokens_seen": 10234251808,
      "step": 13008
    },
    {
      "epoch": 1.38011882028432,
      "grad_norm": 0.4117378556932749,
      "learning_rate": 4.840774106826302e-05,
      "loss": 1.8555,
      "num_input_tokens_seen": 10235038528,
      "step": 13009
    },
    {
      "epoch": 1.3802249098238915,
      "grad_norm": 0.7499401286082412,
      "learning_rate": 4.8407497003174726e-05,
      "loss": 1.8908,
      "num_input_tokens_seen": 10235825248,
      "step": 13010
    },
    {
      "epoch": 1.3803309993634627,
      "grad_norm": 0.6562066212057547,
      "learning_rate": 4.84072529199978e-05,
      "loss": 1.6637,
      "num_input_tokens_seen": 10236612032,
      "step": 13011
    },
    {
      "epoch": 1.3804370889030342,
      "grad_norm": 0.8556445451246796,
      "learning_rate": 4.840700881873243e-05,
      "loss": 1.8246,
      "num_input_tokens_seen": 10237398816,
      "step": 13012
    },
    {
      "epoch": 1.3805431784426054,
      "grad_norm": 1.1374640654890928,
      "learning_rate": 4.840676469937882e-05,
      "loss": 1.8377,
      "num_input_tokens_seen": 10238185584,
      "step": 13013
    },
    {
      "epoch": 1.380649267982177,
      "grad_norm": 0.784502505617196,
      "learning_rate": 4.840652056193714e-05,
      "loss": 1.7853,
      "num_input_tokens_seen": 10238972336,
      "step": 13014
    },
    {
      "epoch": 1.3807553575217484,
      "grad_norm": 0.7281905113562781,
      "learning_rate": 4.84062764064076e-05,
      "loss": 1.9478,
      "num_input_tokens_seen": 10239759056,
      "step": 13015
    },
    {
      "epoch": 1.3808614470613199,
      "grad_norm": 1.2536451992081112,
      "learning_rate": 4.840603223279037e-05,
      "loss": 1.8807,
      "num_input_tokens_seen": 10240545856,
      "step": 13016
    },
    {
      "epoch": 1.380967536600891,
      "grad_norm": 0.4887819879195682,
      "learning_rate": 4.840578804108564e-05,
      "loss": 1.7462,
      "num_input_tokens_seen": 10241332608,
      "step": 13017
    },
    {
      "epoch": 1.3810736261404626,
      "grad_norm": 2.0052870863829306,
      "learning_rate": 4.840554383129361e-05,
      "loss": 1.9557,
      "num_input_tokens_seen": 10242119376,
      "step": 13018
    },
    {
      "epoch": 1.3811797156800338,
      "grad_norm": 0.6163884156090779,
      "learning_rate": 4.840529960341445e-05,
      "loss": 1.8597,
      "num_input_tokens_seen": 10242906176,
      "step": 13019
    },
    {
      "epoch": 1.3812858052196053,
      "grad_norm": 1.0675129532768117,
      "learning_rate": 4.8405055357448384e-05,
      "loss": 1.7726,
      "num_input_tokens_seen": 10243692912,
      "step": 13020
    },
    {
      "epoch": 1.3813918947591768,
      "grad_norm": 0.6564320254100122,
      "learning_rate": 4.8404811093395565e-05,
      "loss": 1.7486,
      "num_input_tokens_seen": 10244479680,
      "step": 13021
    },
    {
      "epoch": 1.3814979842987483,
      "grad_norm": 0.6985635208567814,
      "learning_rate": 4.8404566811256194e-05,
      "loss": 1.6717,
      "num_input_tokens_seen": 10245266448,
      "step": 13022
    },
    {
      "epoch": 1.3816040738383195,
      "grad_norm": 0.7434253799979018,
      "learning_rate": 4.840432251103046e-05,
      "loss": 1.8285,
      "num_input_tokens_seen": 10246053264,
      "step": 13023
    },
    {
      "epoch": 1.381710163377891,
      "grad_norm": 0.5181663077675172,
      "learning_rate": 4.8404078192718555e-05,
      "loss": 1.7406,
      "num_input_tokens_seen": 10246840208,
      "step": 13024
    },
    {
      "epoch": 1.3818162529174622,
      "grad_norm": 0.7126479600061367,
      "learning_rate": 4.8403833856320666e-05,
      "loss": 1.8553,
      "num_input_tokens_seen": 10247626928,
      "step": 13025
    },
    {
      "epoch": 1.3819223424570337,
      "grad_norm": 0.5324620400147568,
      "learning_rate": 4.840358950183698e-05,
      "loss": 1.886,
      "num_input_tokens_seen": 10248413616,
      "step": 13026
    },
    {
      "epoch": 1.3820284319966052,
      "grad_norm": 0.4342796184614229,
      "learning_rate": 4.8403345129267685e-05,
      "loss": 1.7489,
      "num_input_tokens_seen": 10249200432,
      "step": 13027
    },
    {
      "epoch": 1.3821345215361767,
      "grad_norm": 0.47494043966518373,
      "learning_rate": 4.840310073861297e-05,
      "loss": 1.8344,
      "num_input_tokens_seen": 10249987280,
      "step": 13028
    },
    {
      "epoch": 1.382240611075748,
      "grad_norm": 0.38656709427943065,
      "learning_rate": 4.840285632987303e-05,
      "loss": 1.5904,
      "num_input_tokens_seen": 10250774048,
      "step": 13029
    },
    {
      "epoch": 1.3823467006153194,
      "grad_norm": 0.5745334956865753,
      "learning_rate": 4.840261190304804e-05,
      "loss": 1.8985,
      "num_input_tokens_seen": 10251560768,
      "step": 13030
    },
    {
      "epoch": 1.3824527901548906,
      "grad_norm": 0.4762702463836624,
      "learning_rate": 4.840236745813821e-05,
      "loss": 1.7998,
      "num_input_tokens_seen": 10252347472,
      "step": 13031
    },
    {
      "epoch": 1.3825588796944621,
      "grad_norm": 0.5805653694921923,
      "learning_rate": 4.8402122995143714e-05,
      "loss": 1.8337,
      "num_input_tokens_seen": 10253134256,
      "step": 13032
    },
    {
      "epoch": 1.3826649692340336,
      "grad_norm": 0.4302308274044634,
      "learning_rate": 4.8401878514064744e-05,
      "loss": 1.6907,
      "num_input_tokens_seen": 10253921072,
      "step": 13033
    },
    {
      "epoch": 1.3827710587736048,
      "grad_norm": 0.6804142500750426,
      "learning_rate": 4.8401634014901485e-05,
      "loss": 1.7563,
      "num_input_tokens_seen": 10254707888,
      "step": 13034
    },
    {
      "epoch": 1.3828771483131763,
      "grad_norm": 0.48959075371027905,
      "learning_rate": 4.8401389497654134e-05,
      "loss": 1.8166,
      "num_input_tokens_seen": 10255494704,
      "step": 13035
    },
    {
      "epoch": 1.3829832378527478,
      "grad_norm": 0.625681817880212,
      "learning_rate": 4.840114496232287e-05,
      "loss": 1.7682,
      "num_input_tokens_seen": 10256281552,
      "step": 13036
    },
    {
      "epoch": 1.383089327392319,
      "grad_norm": 0.5397583600361581,
      "learning_rate": 4.840090040890789e-05,
      "loss": 1.9837,
      "num_input_tokens_seen": 10257068288,
      "step": 13037
    },
    {
      "epoch": 1.3831954169318905,
      "grad_norm": 0.41865848349443285,
      "learning_rate": 4.8400655837409395e-05,
      "loss": 1.8719,
      "num_input_tokens_seen": 10257855168,
      "step": 13038
    },
    {
      "epoch": 1.383301506471462,
      "grad_norm": 0.7291458490796842,
      "learning_rate": 4.840041124782754e-05,
      "loss": 1.8545,
      "num_input_tokens_seen": 10258641904,
      "step": 13039
    },
    {
      "epoch": 1.3834075960110332,
      "grad_norm": 0.39545372447155797,
      "learning_rate": 4.840016664016254e-05,
      "loss": 1.8355,
      "num_input_tokens_seen": 10259428624,
      "step": 13040
    },
    {
      "epoch": 1.3835136855506047,
      "grad_norm": 0.5167546736092639,
      "learning_rate": 4.839992201441458e-05,
      "loss": 1.8145,
      "num_input_tokens_seen": 10260215440,
      "step": 13041
    },
    {
      "epoch": 1.383619775090176,
      "grad_norm": 0.5461588765940052,
      "learning_rate": 4.8399677370583854e-05,
      "loss": 1.7185,
      "num_input_tokens_seen": 10261002144,
      "step": 13042
    },
    {
      "epoch": 1.3837258646297474,
      "grad_norm": 0.4045884499361856,
      "learning_rate": 4.839943270867053e-05,
      "loss": 1.9068,
      "num_input_tokens_seen": 10261788768,
      "step": 13043
    },
    {
      "epoch": 1.383831954169319,
      "grad_norm": 0.5256962322702925,
      "learning_rate": 4.839918802867481e-05,
      "loss": 1.6297,
      "num_input_tokens_seen": 10262575536,
      "step": 13044
    },
    {
      "epoch": 1.3839380437088904,
      "grad_norm": 0.425613710542677,
      "learning_rate": 4.83989433305969e-05,
      "loss": 1.7083,
      "num_input_tokens_seen": 10263362240,
      "step": 13045
    },
    {
      "epoch": 1.3840441332484616,
      "grad_norm": 0.41261386647395215,
      "learning_rate": 4.839869861443696e-05,
      "loss": 1.7337,
      "num_input_tokens_seen": 10264148976,
      "step": 13046
    },
    {
      "epoch": 1.3841502227880331,
      "grad_norm": 0.5759601825383941,
      "learning_rate": 4.83984538801952e-05,
      "loss": 1.9459,
      "num_input_tokens_seen": 10264935968,
      "step": 13047
    },
    {
      "epoch": 1.3842563123276044,
      "grad_norm": 0.46672083592850155,
      "learning_rate": 4.83982091278718e-05,
      "loss": 1.6332,
      "num_input_tokens_seen": 10265722768,
      "step": 13048
    },
    {
      "epoch": 1.3843624018671759,
      "grad_norm": 0.3915860856674175,
      "learning_rate": 4.839796435746694e-05,
      "loss": 1.6407,
      "num_input_tokens_seen": 10266509632,
      "step": 13049
    },
    {
      "epoch": 1.3844684914067473,
      "grad_norm": 0.5392342378506306,
      "learning_rate": 4.8397719568980834e-05,
      "loss": 1.8907,
      "num_input_tokens_seen": 10267296384,
      "step": 13050
    },
    {
      "epoch": 1.3845745809463188,
      "grad_norm": 0.5593621775550423,
      "learning_rate": 4.839747476241365e-05,
      "loss": 1.8453,
      "num_input_tokens_seen": 10268083088,
      "step": 13051
    },
    {
      "epoch": 1.38468067048589,
      "grad_norm": 0.6149443782369758,
      "learning_rate": 4.839722993776559e-05,
      "loss": 1.6617,
      "num_input_tokens_seen": 10268869840,
      "step": 13052
    },
    {
      "epoch": 1.3847867600254615,
      "grad_norm": 0.6120667962290176,
      "learning_rate": 4.839698509503683e-05,
      "loss": 1.8148,
      "num_input_tokens_seen": 10269656672,
      "step": 13053
    },
    {
      "epoch": 1.3848928495650328,
      "grad_norm": 0.4320743724775506,
      "learning_rate": 4.839674023422757e-05,
      "loss": 1.64,
      "num_input_tokens_seen": 10270443520,
      "step": 13054
    },
    {
      "epoch": 1.3849989391046043,
      "grad_norm": 0.6282358614029924,
      "learning_rate": 4.839649535533799e-05,
      "loss": 1.7029,
      "num_input_tokens_seen": 10271230352,
      "step": 13055
    },
    {
      "epoch": 1.3851050286441757,
      "grad_norm": 0.5523613937000313,
      "learning_rate": 4.839625045836829e-05,
      "loss": 1.8613,
      "num_input_tokens_seen": 10272017120,
      "step": 13056
    },
    {
      "epoch": 1.3852111181837472,
      "grad_norm": 0.44444559108154125,
      "learning_rate": 4.839600554331865e-05,
      "loss": 1.6731,
      "num_input_tokens_seen": 10272803840,
      "step": 13057
    },
    {
      "epoch": 1.3853172077233185,
      "grad_norm": 0.4979426845075272,
      "learning_rate": 4.8395760610189266e-05,
      "loss": 1.7756,
      "num_input_tokens_seen": 10273590576,
      "step": 13058
    },
    {
      "epoch": 1.38542329726289,
      "grad_norm": 0.607530201897487,
      "learning_rate": 4.8395515658980326e-05,
      "loss": 1.7651,
      "num_input_tokens_seen": 10274377312,
      "step": 13059
    },
    {
      "epoch": 1.3855293868024612,
      "grad_norm": 0.3547848639609998,
      "learning_rate": 4.8395270689692015e-05,
      "loss": 1.8419,
      "num_input_tokens_seen": 10275164096,
      "step": 13060
    },
    {
      "epoch": 1.3856354763420327,
      "grad_norm": 0.5392751273979831,
      "learning_rate": 4.839502570232453e-05,
      "loss": 1.829,
      "num_input_tokens_seen": 10275950896,
      "step": 13061
    },
    {
      "epoch": 1.3857415658816041,
      "grad_norm": 0.4088068325132087,
      "learning_rate": 4.839478069687805e-05,
      "loss": 1.668,
      "num_input_tokens_seen": 10276737680,
      "step": 13062
    },
    {
      "epoch": 1.3858476554211756,
      "grad_norm": 0.39638001413680857,
      "learning_rate": 4.839453567335277e-05,
      "loss": 1.7557,
      "num_input_tokens_seen": 10277524320,
      "step": 13063
    },
    {
      "epoch": 1.3859537449607469,
      "grad_norm": 0.4425972015361867,
      "learning_rate": 4.839429063174889e-05,
      "loss": 1.8746,
      "num_input_tokens_seen": 10278311088,
      "step": 13064
    },
    {
      "epoch": 1.3860598345003183,
      "grad_norm": 0.45907901521563416,
      "learning_rate": 4.8394045572066585e-05,
      "loss": 1.7696,
      "num_input_tokens_seen": 10279097824,
      "step": 13065
    },
    {
      "epoch": 1.3861659240398896,
      "grad_norm": 0.4087508461561712,
      "learning_rate": 4.839380049430604e-05,
      "loss": 1.7935,
      "num_input_tokens_seen": 10279884544,
      "step": 13066
    },
    {
      "epoch": 1.386272013579461,
      "grad_norm": 0.4629896013085893,
      "learning_rate": 4.8393555398467453e-05,
      "loss": 1.8606,
      "num_input_tokens_seen": 10280671296,
      "step": 13067
    },
    {
      "epoch": 1.3863781031190325,
      "grad_norm": 0.41437185923675135,
      "learning_rate": 4.839331028455102e-05,
      "loss": 1.8056,
      "num_input_tokens_seen": 10281458096,
      "step": 13068
    },
    {
      "epoch": 1.3864841926586038,
      "grad_norm": 0.39018001522459256,
      "learning_rate": 4.8393065152556916e-05,
      "loss": 1.7457,
      "num_input_tokens_seen": 10282245008,
      "step": 13069
    },
    {
      "epoch": 1.3865902821981753,
      "grad_norm": 0.47381739120522204,
      "learning_rate": 4.839282000248534e-05,
      "loss": 1.9412,
      "num_input_tokens_seen": 10283031728,
      "step": 13070
    },
    {
      "epoch": 1.3866963717377467,
      "grad_norm": 0.37720551581387146,
      "learning_rate": 4.8392574834336476e-05,
      "loss": 1.701,
      "num_input_tokens_seen": 10283818528,
      "step": 13071
    },
    {
      "epoch": 1.386802461277318,
      "grad_norm": 0.43314445414048924,
      "learning_rate": 4.8392329648110526e-05,
      "loss": 1.8554,
      "num_input_tokens_seen": 10284605248,
      "step": 13072
    },
    {
      "epoch": 1.3869085508168895,
      "grad_norm": 0.47395161156979654,
      "learning_rate": 4.8392084443807666e-05,
      "loss": 1.8918,
      "num_input_tokens_seen": 10285391920,
      "step": 13073
    },
    {
      "epoch": 1.387014640356461,
      "grad_norm": 0.3672232889279559,
      "learning_rate": 4.8391839221428093e-05,
      "loss": 1.7549,
      "num_input_tokens_seen": 10286178544,
      "step": 13074
    },
    {
      "epoch": 1.3871207298960322,
      "grad_norm": 0.35302584101057194,
      "learning_rate": 4.8391593980971984e-05,
      "loss": 1.7753,
      "num_input_tokens_seen": 10286965360,
      "step": 13075
    },
    {
      "epoch": 1.3872268194356037,
      "grad_norm": 0.3641297549849759,
      "learning_rate": 4.839134872243955e-05,
      "loss": 1.8249,
      "num_input_tokens_seen": 10287752112,
      "step": 13076
    },
    {
      "epoch": 1.387332908975175,
      "grad_norm": 0.5124376704705046,
      "learning_rate": 4.839110344583095e-05,
      "loss": 1.7551,
      "num_input_tokens_seen": 10288539008,
      "step": 13077
    },
    {
      "epoch": 1.3874389985147464,
      "grad_norm": 0.3579309087940028,
      "learning_rate": 4.83908581511464e-05,
      "loss": 1.6738,
      "num_input_tokens_seen": 10289325744,
      "step": 13078
    },
    {
      "epoch": 1.3875450880543179,
      "grad_norm": 0.4991259411886773,
      "learning_rate": 4.8390612838386086e-05,
      "loss": 1.7316,
      "num_input_tokens_seen": 10290112448,
      "step": 13079
    },
    {
      "epoch": 1.3876511775938893,
      "grad_norm": 0.3217848386721732,
      "learning_rate": 4.8390367507550185e-05,
      "loss": 1.766,
      "num_input_tokens_seen": 10290899248,
      "step": 13080
    },
    {
      "epoch": 1.3877572671334606,
      "grad_norm": 0.5983431482495678,
      "learning_rate": 4.83901221586389e-05,
      "loss": 1.8376,
      "num_input_tokens_seen": 10291685984,
      "step": 13081
    },
    {
      "epoch": 1.387863356673032,
      "grad_norm": 0.44075872540246314,
      "learning_rate": 4.838987679165241e-05,
      "loss": 1.88,
      "num_input_tokens_seen": 10292472672,
      "step": 13082
    },
    {
      "epoch": 1.3879694462126033,
      "grad_norm": 0.4178708649195085,
      "learning_rate": 4.838963140659092e-05,
      "loss": 1.6303,
      "num_input_tokens_seen": 10293259440,
      "step": 13083
    },
    {
      "epoch": 1.3880755357521748,
      "grad_norm": 0.4619769584476508,
      "learning_rate": 4.83893860034546e-05,
      "loss": 1.8803,
      "num_input_tokens_seen": 10294046160,
      "step": 13084
    },
    {
      "epoch": 1.3881816252917463,
      "grad_norm": 0.5697627210409301,
      "learning_rate": 4.8389140582243655e-05,
      "loss": 1.7343,
      "num_input_tokens_seen": 10294832976,
      "step": 13085
    },
    {
      "epoch": 1.3882877148313177,
      "grad_norm": 0.42160930094917737,
      "learning_rate": 4.8388895142958257e-05,
      "loss": 1.7586,
      "num_input_tokens_seen": 10295619744,
      "step": 13086
    },
    {
      "epoch": 1.388393804370889,
      "grad_norm": 0.5415703933326044,
      "learning_rate": 4.838864968559862e-05,
      "loss": 1.7584,
      "num_input_tokens_seen": 10296406496,
      "step": 13087
    },
    {
      "epoch": 1.3884998939104605,
      "grad_norm": 0.3513582159356399,
      "learning_rate": 4.838840421016491e-05,
      "loss": 1.7059,
      "num_input_tokens_seen": 10297193248,
      "step": 13088
    },
    {
      "epoch": 1.3886059834500317,
      "grad_norm": 0.5122102683486298,
      "learning_rate": 4.838815871665734e-05,
      "loss": 1.6766,
      "num_input_tokens_seen": 10297980048,
      "step": 13089
    },
    {
      "epoch": 1.3887120729896032,
      "grad_norm": 0.42265187538433396,
      "learning_rate": 4.8387913205076075e-05,
      "loss": 1.6971,
      "num_input_tokens_seen": 10298766848,
      "step": 13090
    },
    {
      "epoch": 1.3888181625291747,
      "grad_norm": 0.46185208330812394,
      "learning_rate": 4.838766767542132e-05,
      "loss": 1.7589,
      "num_input_tokens_seen": 10299553792,
      "step": 13091
    },
    {
      "epoch": 1.3889242520687461,
      "grad_norm": 0.39302650004845685,
      "learning_rate": 4.838742212769326e-05,
      "loss": 1.6903,
      "num_input_tokens_seen": 10300340512,
      "step": 13092
    },
    {
      "epoch": 1.3890303416083174,
      "grad_norm": 0.44250932162282247,
      "learning_rate": 4.8387176561892097e-05,
      "loss": 1.7653,
      "num_input_tokens_seen": 10301127376,
      "step": 13093
    },
    {
      "epoch": 1.3891364311478889,
      "grad_norm": 0.6565993110774534,
      "learning_rate": 4.8386930978018e-05,
      "loss": 1.7525,
      "num_input_tokens_seen": 10301914160,
      "step": 13094
    },
    {
      "epoch": 1.3892425206874601,
      "grad_norm": 0.48291957783651906,
      "learning_rate": 4.838668537607117e-05,
      "loss": 1.7647,
      "num_input_tokens_seen": 10302700944,
      "step": 13095
    },
    {
      "epoch": 1.3893486102270316,
      "grad_norm": 0.6385971483365548,
      "learning_rate": 4.83864397560518e-05,
      "loss": 1.6669,
      "num_input_tokens_seen": 10303487664,
      "step": 13096
    },
    {
      "epoch": 1.389454699766603,
      "grad_norm": 0.4527364783280671,
      "learning_rate": 4.838619411796007e-05,
      "loss": 1.7475,
      "num_input_tokens_seen": 10304274464,
      "step": 13097
    },
    {
      "epoch": 1.3895607893061745,
      "grad_norm": 0.6108647231259309,
      "learning_rate": 4.838594846179618e-05,
      "loss": 1.8655,
      "num_input_tokens_seen": 10305061264,
      "step": 13098
    },
    {
      "epoch": 1.3896668788457458,
      "grad_norm": 0.678199076110676,
      "learning_rate": 4.8385702787560316e-05,
      "loss": 1.8002,
      "num_input_tokens_seen": 10305848016,
      "step": 13099
    },
    {
      "epoch": 1.3897729683853173,
      "grad_norm": 0.5209787800327519,
      "learning_rate": 4.8385457095252665e-05,
      "loss": 1.8186,
      "num_input_tokens_seen": 10306634848,
      "step": 13100
    },
    {
      "epoch": 1.3898790579248885,
      "grad_norm": 0.4034697924295032,
      "learning_rate": 4.838521138487342e-05,
      "loss": 1.7675,
      "num_input_tokens_seen": 10307421712,
      "step": 13101
    },
    {
      "epoch": 1.38998514746446,
      "grad_norm": 0.7092248065520874,
      "learning_rate": 4.838496565642277e-05,
      "loss": 1.8021,
      "num_input_tokens_seen": 10308208432,
      "step": 13102
    },
    {
      "epoch": 1.3900912370040315,
      "grad_norm": 0.44554815215938015,
      "learning_rate": 4.83847199099009e-05,
      "loss": 1.6208,
      "num_input_tokens_seen": 10308995280,
      "step": 13103
    },
    {
      "epoch": 1.3901973265436027,
      "grad_norm": 0.40971190940528307,
      "learning_rate": 4.8384474145308014e-05,
      "loss": 1.7492,
      "num_input_tokens_seen": 10309782208,
      "step": 13104
    },
    {
      "epoch": 1.3903034160831742,
      "grad_norm": 0.7878190292119448,
      "learning_rate": 4.838422836264428e-05,
      "loss": 1.8384,
      "num_input_tokens_seen": 10310568928,
      "step": 13105
    },
    {
      "epoch": 1.3904095056227457,
      "grad_norm": 0.3869411243724466,
      "learning_rate": 4.838398256190991e-05,
      "loss": 1.7312,
      "num_input_tokens_seen": 10311355680,
      "step": 13106
    },
    {
      "epoch": 1.390515595162317,
      "grad_norm": 0.5795900065803777,
      "learning_rate": 4.838373674310508e-05,
      "loss": 1.8351,
      "num_input_tokens_seen": 10312142416,
      "step": 13107
    },
    {
      "epoch": 1.3906216847018884,
      "grad_norm": 0.4402954248411707,
      "learning_rate": 4.838349090622999e-05,
      "loss": 1.7791,
      "num_input_tokens_seen": 10312929200,
      "step": 13108
    },
    {
      "epoch": 1.3907277742414599,
      "grad_norm": 0.5047321292688793,
      "learning_rate": 4.8383245051284814e-05,
      "loss": 1.6737,
      "num_input_tokens_seen": 10313716016,
      "step": 13109
    },
    {
      "epoch": 1.3908338637810311,
      "grad_norm": 0.4589759362961844,
      "learning_rate": 4.8382999178269764e-05,
      "loss": 1.8116,
      "num_input_tokens_seen": 10314502816,
      "step": 13110
    },
    {
      "epoch": 1.3909399533206026,
      "grad_norm": 0.6802676937650275,
      "learning_rate": 4.8382753287185015e-05,
      "loss": 1.7498,
      "num_input_tokens_seen": 10315289584,
      "step": 13111
    },
    {
      "epoch": 1.3910460428601739,
      "grad_norm": 0.4314691816320665,
      "learning_rate": 4.838250737803075e-05,
      "loss": 1.8682,
      "num_input_tokens_seen": 10316076304,
      "step": 13112
    },
    {
      "epoch": 1.3911521323997453,
      "grad_norm": 0.7544098483212178,
      "learning_rate": 4.8382261450807176e-05,
      "loss": 1.6778,
      "num_input_tokens_seen": 10316863072,
      "step": 13113
    },
    {
      "epoch": 1.3912582219393168,
      "grad_norm": 0.49332144461348104,
      "learning_rate": 4.838201550551448e-05,
      "loss": 1.7883,
      "num_input_tokens_seen": 10317649920,
      "step": 13114
    },
    {
      "epoch": 1.3913643114788883,
      "grad_norm": 0.45608311863077916,
      "learning_rate": 4.838176954215284e-05,
      "loss": 1.9364,
      "num_input_tokens_seen": 10318436752,
      "step": 13115
    },
    {
      "epoch": 1.3914704010184595,
      "grad_norm": 0.373782620661786,
      "learning_rate": 4.838152356072246e-05,
      "loss": 1.7531,
      "num_input_tokens_seen": 10319223504,
      "step": 13116
    },
    {
      "epoch": 1.391576490558031,
      "grad_norm": 0.5439866684603037,
      "learning_rate": 4.838127756122354e-05,
      "loss": 1.7793,
      "num_input_tokens_seen": 10320010320,
      "step": 13117
    },
    {
      "epoch": 1.3916825800976023,
      "grad_norm": 0.3920246957668113,
      "learning_rate": 4.838103154365623e-05,
      "loss": 1.7559,
      "num_input_tokens_seen": 10320797088,
      "step": 13118
    },
    {
      "epoch": 1.3917886696371737,
      "grad_norm": 0.5150769416145529,
      "learning_rate": 4.838078550802076e-05,
      "loss": 1.9457,
      "num_input_tokens_seen": 10321583856,
      "step": 13119
    },
    {
      "epoch": 1.3918947591767452,
      "grad_norm": 0.479237584016003,
      "learning_rate": 4.83805394543173e-05,
      "loss": 1.7679,
      "num_input_tokens_seen": 10322370688,
      "step": 13120
    },
    {
      "epoch": 1.3920008487163167,
      "grad_norm": 0.4506647552366441,
      "learning_rate": 4.838029338254604e-05,
      "loss": 1.7355,
      "num_input_tokens_seen": 10323157440,
      "step": 13121
    },
    {
      "epoch": 1.392106938255888,
      "grad_norm": 0.39509853926167565,
      "learning_rate": 4.8380047292707186e-05,
      "loss": 1.6577,
      "num_input_tokens_seen": 10323944272,
      "step": 13122
    },
    {
      "epoch": 1.3922130277954594,
      "grad_norm": 0.5298261778515534,
      "learning_rate": 4.837980118480091e-05,
      "loss": 1.8285,
      "num_input_tokens_seen": 10324731088,
      "step": 13123
    },
    {
      "epoch": 1.3923191173350307,
      "grad_norm": 0.47841418941915975,
      "learning_rate": 4.837955505882741e-05,
      "loss": 1.8196,
      "num_input_tokens_seen": 10325517920,
      "step": 13124
    },
    {
      "epoch": 1.3924252068746021,
      "grad_norm": 0.42486865566864224,
      "learning_rate": 4.8379308914786884e-05,
      "loss": 1.6711,
      "num_input_tokens_seen": 10326304768,
      "step": 13125
    },
    {
      "epoch": 1.3925312964141736,
      "grad_norm": 0.3846024438023389,
      "learning_rate": 4.83790627526795e-05,
      "loss": 1.6839,
      "num_input_tokens_seen": 10327091552,
      "step": 13126
    },
    {
      "epoch": 1.392637385953745,
      "grad_norm": 0.36003743287615014,
      "learning_rate": 4.837881657250547e-05,
      "loss": 1.8385,
      "num_input_tokens_seen": 10327878240,
      "step": 13127
    },
    {
      "epoch": 1.3927434754933163,
      "grad_norm": 0.41659446690356655,
      "learning_rate": 4.837857037426497e-05,
      "loss": 1.6167,
      "num_input_tokens_seen": 10328665008,
      "step": 13128
    },
    {
      "epoch": 1.3928495650328878,
      "grad_norm": 0.4390299227335528,
      "learning_rate": 4.837832415795821e-05,
      "loss": 1.8377,
      "num_input_tokens_seen": 10329451744,
      "step": 13129
    },
    {
      "epoch": 1.392955654572459,
      "grad_norm": 0.3913257837203628,
      "learning_rate": 4.8378077923585367e-05,
      "loss": 1.9581,
      "num_input_tokens_seen": 10330238592,
      "step": 13130
    },
    {
      "epoch": 1.3930617441120305,
      "grad_norm": 0.4652945987547944,
      "learning_rate": 4.8377831671146625e-05,
      "loss": 1.6294,
      "num_input_tokens_seen": 10331025408,
      "step": 13131
    },
    {
      "epoch": 1.393167833651602,
      "grad_norm": 0.4165171518627302,
      "learning_rate": 4.837758540064218e-05,
      "loss": 1.7409,
      "num_input_tokens_seen": 10331812128,
      "step": 13132
    },
    {
      "epoch": 1.3932739231911733,
      "grad_norm": 0.4412156977676496,
      "learning_rate": 4.837733911207222e-05,
      "loss": 1.7947,
      "num_input_tokens_seen": 10332598768,
      "step": 13133
    },
    {
      "epoch": 1.3933800127307447,
      "grad_norm": 0.470133778734863,
      "learning_rate": 4.837709280543694e-05,
      "loss": 1.7515,
      "num_input_tokens_seen": 10333385552,
      "step": 13134
    },
    {
      "epoch": 1.3934861022703162,
      "grad_norm": 0.38197203495127247,
      "learning_rate": 4.837684648073653e-05,
      "loss": 1.6958,
      "num_input_tokens_seen": 10334172352,
      "step": 13135
    },
    {
      "epoch": 1.3935921918098875,
      "grad_norm": 0.42821994366079663,
      "learning_rate": 4.837660013797118e-05,
      "loss": 1.6197,
      "num_input_tokens_seen": 10334959200,
      "step": 13136
    },
    {
      "epoch": 1.393698281349459,
      "grad_norm": 0.5304651637444635,
      "learning_rate": 4.837635377714108e-05,
      "loss": 1.8724,
      "num_input_tokens_seen": 10335745952,
      "step": 13137
    },
    {
      "epoch": 1.3938043708890304,
      "grad_norm": 0.44304739321251835,
      "learning_rate": 4.8376107398246416e-05,
      "loss": 1.6961,
      "num_input_tokens_seen": 10336532704,
      "step": 13138
    },
    {
      "epoch": 1.3939104604286017,
      "grad_norm": 0.44866417185965146,
      "learning_rate": 4.837586100128738e-05,
      "loss": 1.7407,
      "num_input_tokens_seen": 10337319488,
      "step": 13139
    },
    {
      "epoch": 1.3940165499681731,
      "grad_norm": 0.39403097533822745,
      "learning_rate": 4.8375614586264174e-05,
      "loss": 1.7651,
      "num_input_tokens_seen": 10338106320,
      "step": 13140
    },
    {
      "epoch": 1.3941226395077444,
      "grad_norm": 0.468551876417627,
      "learning_rate": 4.837536815317697e-05,
      "loss": 1.7547,
      "num_input_tokens_seen": 10338893136,
      "step": 13141
    },
    {
      "epoch": 1.3942287290473159,
      "grad_norm": 0.6100494971522452,
      "learning_rate": 4.837512170202597e-05,
      "loss": 1.6819,
      "num_input_tokens_seen": 10339679984,
      "step": 13142
    },
    {
      "epoch": 1.3943348185868873,
      "grad_norm": 0.4467634538829108,
      "learning_rate": 4.8374875232811364e-05,
      "loss": 1.7509,
      "num_input_tokens_seen": 10340466736,
      "step": 13143
    },
    {
      "epoch": 1.3944409081264588,
      "grad_norm": 0.45308498514274254,
      "learning_rate": 4.837462874553334e-05,
      "loss": 1.8196,
      "num_input_tokens_seen": 10341253504,
      "step": 13144
    },
    {
      "epoch": 1.39454699766603,
      "grad_norm": 0.4252899684929085,
      "learning_rate": 4.837438224019208e-05,
      "loss": 1.8404,
      "num_input_tokens_seen": 10342040224,
      "step": 13145
    },
    {
      "epoch": 1.3946530872056015,
      "grad_norm": 0.4515934908310885,
      "learning_rate": 4.83741357167878e-05,
      "loss": 1.7124,
      "num_input_tokens_seen": 10342826992,
      "step": 13146
    },
    {
      "epoch": 1.3947591767451728,
      "grad_norm": 0.5120309903188213,
      "learning_rate": 4.8373889175320666e-05,
      "loss": 1.7152,
      "num_input_tokens_seen": 10343613744,
      "step": 13147
    },
    {
      "epoch": 1.3948652662847443,
      "grad_norm": 0.45397490632680826,
      "learning_rate": 4.837364261579087e-05,
      "loss": 1.8045,
      "num_input_tokens_seen": 10344400416,
      "step": 13148
    },
    {
      "epoch": 1.3949713558243158,
      "grad_norm": 0.3821973997972989,
      "learning_rate": 4.8373396038198613e-05,
      "loss": 1.8845,
      "num_input_tokens_seen": 10345187264,
      "step": 13149
    },
    {
      "epoch": 1.3950774453638872,
      "grad_norm": 0.42411694175342596,
      "learning_rate": 4.8373149442544086e-05,
      "loss": 1.7653,
      "num_input_tokens_seen": 10345973968,
      "step": 13150
    },
    {
      "epoch": 1.3951835349034585,
      "grad_norm": 0.36893894796338,
      "learning_rate": 4.837290282882747e-05,
      "loss": 1.7603,
      "num_input_tokens_seen": 10346760736,
      "step": 13151
    },
    {
      "epoch": 1.39528962444303,
      "grad_norm": 0.4209205355125278,
      "learning_rate": 4.837265619704896e-05,
      "loss": 1.7446,
      "num_input_tokens_seen": 10347547552,
      "step": 13152
    },
    {
      "epoch": 1.3953957139826012,
      "grad_norm": 0.38356025815409384,
      "learning_rate": 4.837240954720875e-05,
      "loss": 1.7387,
      "num_input_tokens_seen": 10348334272,
      "step": 13153
    },
    {
      "epoch": 1.3955018035221727,
      "grad_norm": 0.4225127242897121,
      "learning_rate": 4.8372162879307024e-05,
      "loss": 1.7878,
      "num_input_tokens_seen": 10349121008,
      "step": 13154
    },
    {
      "epoch": 1.3956078930617442,
      "grad_norm": 0.41358366375642625,
      "learning_rate": 4.837191619334398e-05,
      "loss": 1.7757,
      "num_input_tokens_seen": 10349907872,
      "step": 13155
    },
    {
      "epoch": 1.3957139826013156,
      "grad_norm": 0.3364359385915551,
      "learning_rate": 4.8371669489319805e-05,
      "loss": 1.7579,
      "num_input_tokens_seen": 10350694576,
      "step": 13156
    },
    {
      "epoch": 1.3958200721408869,
      "grad_norm": 0.4871150492730709,
      "learning_rate": 4.837142276723469e-05,
      "loss": 1.657,
      "num_input_tokens_seen": 10351481424,
      "step": 13157
    },
    {
      "epoch": 1.3959261616804584,
      "grad_norm": 0.438240062872727,
      "learning_rate": 4.837117602708883e-05,
      "loss": 1.7516,
      "num_input_tokens_seen": 10352268320,
      "step": 13158
    },
    {
      "epoch": 1.3960322512200296,
      "grad_norm": 0.6334477620950836,
      "learning_rate": 4.83709292688824e-05,
      "loss": 1.844,
      "num_input_tokens_seen": 10353055104,
      "step": 13159
    },
    {
      "epoch": 1.396138340759601,
      "grad_norm": 0.48627816241159816,
      "learning_rate": 4.8370682492615604e-05,
      "loss": 1.8034,
      "num_input_tokens_seen": 10353841936,
      "step": 13160
    },
    {
      "epoch": 1.3962444302991726,
      "grad_norm": 0.5171371582163246,
      "learning_rate": 4.837043569828863e-05,
      "loss": 1.8135,
      "num_input_tokens_seen": 10354628624,
      "step": 13161
    },
    {
      "epoch": 1.396350519838744,
      "grad_norm": 0.4689401211788598,
      "learning_rate": 4.837018888590168e-05,
      "loss": 1.8179,
      "num_input_tokens_seen": 10355415456,
      "step": 13162
    },
    {
      "epoch": 1.3964566093783153,
      "grad_norm": 0.40449632306830935,
      "learning_rate": 4.836994205545492e-05,
      "loss": 1.8087,
      "num_input_tokens_seen": 10356202224,
      "step": 13163
    },
    {
      "epoch": 1.3965626989178868,
      "grad_norm": 0.46159630200538193,
      "learning_rate": 4.836969520694856e-05,
      "loss": 1.7567,
      "num_input_tokens_seen": 10356989008,
      "step": 13164
    },
    {
      "epoch": 1.396668788457458,
      "grad_norm": 0.46284938087067407,
      "learning_rate": 4.836944834038278e-05,
      "loss": 1.9026,
      "num_input_tokens_seen": 10357775792,
      "step": 13165
    },
    {
      "epoch": 1.3967748779970295,
      "grad_norm": 0.5798718052628152,
      "learning_rate": 4.836920145575779e-05,
      "loss": 1.793,
      "num_input_tokens_seen": 10358562576,
      "step": 13166
    },
    {
      "epoch": 1.396880967536601,
      "grad_norm": 0.3897021589153581,
      "learning_rate": 4.836895455307375e-05,
      "loss": 1.7555,
      "num_input_tokens_seen": 10359349344,
      "step": 13167
    },
    {
      "epoch": 1.3969870570761722,
      "grad_norm": 0.6314674449970481,
      "learning_rate": 4.836870763233088e-05,
      "loss": 1.8572,
      "num_input_tokens_seen": 10360136080,
      "step": 13168
    },
    {
      "epoch": 1.3970931466157437,
      "grad_norm": 0.4328719641572109,
      "learning_rate": 4.836846069352935e-05,
      "loss": 1.7811,
      "num_input_tokens_seen": 10360922912,
      "step": 13169
    },
    {
      "epoch": 1.3971992361553152,
      "grad_norm": 0.4030509975280136,
      "learning_rate": 4.836821373666936e-05,
      "loss": 1.7113,
      "num_input_tokens_seen": 10361709696,
      "step": 13170
    },
    {
      "epoch": 1.3973053256948864,
      "grad_norm": 0.5066233155050663,
      "learning_rate": 4.8367966761751104e-05,
      "loss": 1.7393,
      "num_input_tokens_seen": 10362496496,
      "step": 13171
    },
    {
      "epoch": 1.3974114152344579,
      "grad_norm": 0.387475711269283,
      "learning_rate": 4.8367719768774767e-05,
      "loss": 1.7184,
      "num_input_tokens_seen": 10363283184,
      "step": 13172
    },
    {
      "epoch": 1.3975175047740294,
      "grad_norm": 0.41452432173657344,
      "learning_rate": 4.836747275774055e-05,
      "loss": 1.8816,
      "num_input_tokens_seen": 10364069904,
      "step": 13173
    },
    {
      "epoch": 1.3976235943136006,
      "grad_norm": 0.4584479758930685,
      "learning_rate": 4.836722572864862e-05,
      "loss": 1.8279,
      "num_input_tokens_seen": 10364856672,
      "step": 13174
    },
    {
      "epoch": 1.397729683853172,
      "grad_norm": 0.44087803141831905,
      "learning_rate": 4.8366978681499195e-05,
      "loss": 1.8108,
      "num_input_tokens_seen": 10365643424,
      "step": 13175
    },
    {
      "epoch": 1.3978357733927433,
      "grad_norm": 0.4232483201793344,
      "learning_rate": 4.836673161629245e-05,
      "loss": 1.7456,
      "num_input_tokens_seen": 10366430160,
      "step": 13176
    },
    {
      "epoch": 1.3979418629323148,
      "grad_norm": 0.5068160738194679,
      "learning_rate": 4.8366484533028586e-05,
      "loss": 1.852,
      "num_input_tokens_seen": 10367216864,
      "step": 13177
    },
    {
      "epoch": 1.3980479524718863,
      "grad_norm": 0.39208344966125275,
      "learning_rate": 4.836623743170778e-05,
      "loss": 1.7702,
      "num_input_tokens_seen": 10368003712,
      "step": 13178
    },
    {
      "epoch": 1.3981540420114578,
      "grad_norm": 0.48859985772068903,
      "learning_rate": 4.8365990312330236e-05,
      "loss": 1.8214,
      "num_input_tokens_seen": 10368790480,
      "step": 13179
    },
    {
      "epoch": 1.398260131551029,
      "grad_norm": 0.403940947549204,
      "learning_rate": 4.8365743174896137e-05,
      "loss": 1.824,
      "num_input_tokens_seen": 10369577184,
      "step": 13180
    },
    {
      "epoch": 1.3983662210906005,
      "grad_norm": 0.45873795239441295,
      "learning_rate": 4.8365496019405686e-05,
      "loss": 1.783,
      "num_input_tokens_seen": 10370363936,
      "step": 13181
    },
    {
      "epoch": 1.3984723106301717,
      "grad_norm": 0.47352043002166666,
      "learning_rate": 4.8365248845859055e-05,
      "loss": 1.7426,
      "num_input_tokens_seen": 10371150720,
      "step": 13182
    },
    {
      "epoch": 1.3985784001697432,
      "grad_norm": 0.4629597745477994,
      "learning_rate": 4.836500165425645e-05,
      "loss": 1.8035,
      "num_input_tokens_seen": 10371937520,
      "step": 13183
    },
    {
      "epoch": 1.3986844897093147,
      "grad_norm": 0.57932881089299,
      "learning_rate": 4.836475444459806e-05,
      "loss": 1.849,
      "num_input_tokens_seen": 10372724256,
      "step": 13184
    },
    {
      "epoch": 1.3987905792488862,
      "grad_norm": 0.3950130717558173,
      "learning_rate": 4.836450721688407e-05,
      "loss": 1.7384,
      "num_input_tokens_seen": 10373511088,
      "step": 13185
    },
    {
      "epoch": 1.3988966687884574,
      "grad_norm": 0.5154961551138162,
      "learning_rate": 4.8364259971114677e-05,
      "loss": 1.8208,
      "num_input_tokens_seen": 10374297936,
      "step": 13186
    },
    {
      "epoch": 1.399002758328029,
      "grad_norm": 0.43625766376754516,
      "learning_rate": 4.836401270729006e-05,
      "loss": 1.7893,
      "num_input_tokens_seen": 10375084800,
      "step": 13187
    },
    {
      "epoch": 1.3991088478676001,
      "grad_norm": 0.5604709408871444,
      "learning_rate": 4.8363765425410436e-05,
      "loss": 1.9559,
      "num_input_tokens_seen": 10375871552,
      "step": 13188
    },
    {
      "epoch": 1.3992149374071716,
      "grad_norm": 0.43220572471810265,
      "learning_rate": 4.836351812547597e-05,
      "loss": 1.8421,
      "num_input_tokens_seen": 10376658256,
      "step": 13189
    },
    {
      "epoch": 1.399321026946743,
      "grad_norm": 0.3734977237194722,
      "learning_rate": 4.836327080748686e-05,
      "loss": 1.84,
      "num_input_tokens_seen": 10377444976,
      "step": 13190
    },
    {
      "epoch": 1.3994271164863146,
      "grad_norm": 0.48067933951007763,
      "learning_rate": 4.8363023471443306e-05,
      "loss": 1.8013,
      "num_input_tokens_seen": 10378231680,
      "step": 13191
    },
    {
      "epoch": 1.3995332060258858,
      "grad_norm": 0.38001177973025596,
      "learning_rate": 4.836277611734549e-05,
      "loss": 1.8003,
      "num_input_tokens_seen": 10379018400,
      "step": 13192
    },
    {
      "epoch": 1.3996392955654573,
      "grad_norm": 0.45284352829633534,
      "learning_rate": 4.83625287451936e-05,
      "loss": 1.7666,
      "num_input_tokens_seen": 10379805168,
      "step": 13193
    },
    {
      "epoch": 1.3997453851050286,
      "grad_norm": 0.3903094142132292,
      "learning_rate": 4.836228135498784e-05,
      "loss": 1.8958,
      "num_input_tokens_seen": 10380592016,
      "step": 13194
    },
    {
      "epoch": 1.3998514746446,
      "grad_norm": 0.3837826240921982,
      "learning_rate": 4.83620339467284e-05,
      "loss": 1.7513,
      "num_input_tokens_seen": 10381378800,
      "step": 13195
    },
    {
      "epoch": 1.3999575641841715,
      "grad_norm": 0.37109652760531936,
      "learning_rate": 4.8361786520415454e-05,
      "loss": 1.8031,
      "num_input_tokens_seen": 10382165584,
      "step": 13196
    },
    {
      "epoch": 1.400063653723743,
      "grad_norm": 0.536846330851749,
      "learning_rate": 4.8361539076049214e-05,
      "loss": 1.8703,
      "num_input_tokens_seen": 10382952320,
      "step": 13197
    },
    {
      "epoch": 1.4001697432633142,
      "grad_norm": 0.43559859297518055,
      "learning_rate": 4.836129161362986e-05,
      "loss": 1.8456,
      "num_input_tokens_seen": 10383739168,
      "step": 13198
    },
    {
      "epoch": 1.4002758328028857,
      "grad_norm": 0.4313581991115366,
      "learning_rate": 4.836104413315758e-05,
      "loss": 1.5867,
      "num_input_tokens_seen": 10384526016,
      "step": 13199
    },
    {
      "epoch": 1.400381922342457,
      "grad_norm": 0.3509773224907673,
      "learning_rate": 4.836079663463258e-05,
      "loss": 1.6927,
      "num_input_tokens_seen": 10385312800,
      "step": 13200
    },
    {
      "epoch": 1.4004880118820284,
      "grad_norm": 0.8612135338688222,
      "learning_rate": 4.8360549118055034e-05,
      "loss": 1.9151,
      "num_input_tokens_seen": 10386099424,
      "step": 13201
    },
    {
      "epoch": 1.4005941014216,
      "grad_norm": 0.4373003885287886,
      "learning_rate": 4.836030158342514e-05,
      "loss": 1.7405,
      "num_input_tokens_seen": 10386886176,
      "step": 13202
    },
    {
      "epoch": 1.4007001909611712,
      "grad_norm": 0.7603059087760089,
      "learning_rate": 4.8360054030743094e-05,
      "loss": 1.7446,
      "num_input_tokens_seen": 10387672992,
      "step": 13203
    },
    {
      "epoch": 1.4008062805007426,
      "grad_norm": 0.481719482415526,
      "learning_rate": 4.8359806460009086e-05,
      "loss": 1.7379,
      "num_input_tokens_seen": 10388459792,
      "step": 13204
    },
    {
      "epoch": 1.400912370040314,
      "grad_norm": 0.6057501307606408,
      "learning_rate": 4.8359558871223296e-05,
      "loss": 1.6222,
      "num_input_tokens_seen": 10389246608,
      "step": 13205
    },
    {
      "epoch": 1.4010184595798854,
      "grad_norm": 0.6304285736799699,
      "learning_rate": 4.835931126438593e-05,
      "loss": 1.7918,
      "num_input_tokens_seen": 10390033360,
      "step": 13206
    },
    {
      "epoch": 1.4011245491194568,
      "grad_norm": 0.5432805070383635,
      "learning_rate": 4.835906363949718e-05,
      "loss": 1.7203,
      "num_input_tokens_seen": 10390820112,
      "step": 13207
    },
    {
      "epoch": 1.4012306386590283,
      "grad_norm": 0.520588222395861,
      "learning_rate": 4.8358815996557223e-05,
      "loss": 1.8086,
      "num_input_tokens_seen": 10391606864,
      "step": 13208
    },
    {
      "epoch": 1.4013367281985996,
      "grad_norm": 0.6855039583654864,
      "learning_rate": 4.835856833556626e-05,
      "loss": 1.8192,
      "num_input_tokens_seen": 10392393664,
      "step": 13209
    },
    {
      "epoch": 1.401442817738171,
      "grad_norm": 0.4626266987824381,
      "learning_rate": 4.835832065652448e-05,
      "loss": 1.736,
      "num_input_tokens_seen": 10393180384,
      "step": 13210
    },
    {
      "epoch": 1.4015489072777423,
      "grad_norm": 0.5038816357104949,
      "learning_rate": 4.8358072959432075e-05,
      "loss": 1.759,
      "num_input_tokens_seen": 10393967200,
      "step": 13211
    },
    {
      "epoch": 1.4016549968173138,
      "grad_norm": 0.5604109625351198,
      "learning_rate": 4.8357825244289237e-05,
      "loss": 1.7821,
      "num_input_tokens_seen": 10394753968,
      "step": 13212
    },
    {
      "epoch": 1.4017610863568852,
      "grad_norm": 0.4499112502723122,
      "learning_rate": 4.8357577511096167e-05,
      "loss": 1.8736,
      "num_input_tokens_seen": 10395540688,
      "step": 13213
    },
    {
      "epoch": 1.4018671758964567,
      "grad_norm": 0.440050286434868,
      "learning_rate": 4.8357329759853035e-05,
      "loss": 1.797,
      "num_input_tokens_seen": 10396327424,
      "step": 13214
    },
    {
      "epoch": 1.401973265436028,
      "grad_norm": 0.5378677582899682,
      "learning_rate": 4.835708199056004e-05,
      "loss": 1.8138,
      "num_input_tokens_seen": 10397114096,
      "step": 13215
    },
    {
      "epoch": 1.4020793549755994,
      "grad_norm": 0.6030580256110489,
      "learning_rate": 4.8356834203217384e-05,
      "loss": 1.8275,
      "num_input_tokens_seen": 10397900928,
      "step": 13216
    },
    {
      "epoch": 1.4021854445151707,
      "grad_norm": 0.5136833474944962,
      "learning_rate": 4.835658639782525e-05,
      "loss": 1.935,
      "num_input_tokens_seen": 10398687600,
      "step": 13217
    },
    {
      "epoch": 1.4022915340547422,
      "grad_norm": 0.6158572785793711,
      "learning_rate": 4.8356338574383837e-05,
      "loss": 1.8356,
      "num_input_tokens_seen": 10399474272,
      "step": 13218
    },
    {
      "epoch": 1.4023976235943136,
      "grad_norm": 0.3993582353202134,
      "learning_rate": 4.835609073289332e-05,
      "loss": 1.6976,
      "num_input_tokens_seen": 10400261152,
      "step": 13219
    },
    {
      "epoch": 1.402503713133885,
      "grad_norm": 0.38919849526482875,
      "learning_rate": 4.835584287335391e-05,
      "loss": 1.7957,
      "num_input_tokens_seen": 10401047968,
      "step": 13220
    },
    {
      "epoch": 1.4026098026734564,
      "grad_norm": 0.5342284079218622,
      "learning_rate": 4.83555949957658e-05,
      "loss": 1.7836,
      "num_input_tokens_seen": 10401834624,
      "step": 13221
    },
    {
      "epoch": 1.4027158922130278,
      "grad_norm": 0.4549687049846944,
      "learning_rate": 4.835534710012915e-05,
      "loss": 1.7535,
      "num_input_tokens_seen": 10402621376,
      "step": 13222
    },
    {
      "epoch": 1.402821981752599,
      "grad_norm": 0.41852394906312884,
      "learning_rate": 4.835509918644419e-05,
      "loss": 1.7863,
      "num_input_tokens_seen": 10403408064,
      "step": 13223
    },
    {
      "epoch": 1.4029280712921706,
      "grad_norm": 0.4574758971888303,
      "learning_rate": 4.835485125471108e-05,
      "loss": 1.9423,
      "num_input_tokens_seen": 10404194896,
      "step": 13224
    },
    {
      "epoch": 1.403034160831742,
      "grad_norm": 0.37824825004123314,
      "learning_rate": 4.835460330493003e-05,
      "loss": 1.7565,
      "num_input_tokens_seen": 10404981616,
      "step": 13225
    },
    {
      "epoch": 1.4031402503713135,
      "grad_norm": 0.4030428564917112,
      "learning_rate": 4.835435533710124e-05,
      "loss": 1.7315,
      "num_input_tokens_seen": 10405768400,
      "step": 13226
    },
    {
      "epoch": 1.4032463399108848,
      "grad_norm": 0.3976891582424765,
      "learning_rate": 4.835410735122487e-05,
      "loss": 1.7663,
      "num_input_tokens_seen": 10406555168,
      "step": 13227
    },
    {
      "epoch": 1.4033524294504562,
      "grad_norm": 0.46621451564061955,
      "learning_rate": 4.8353859347301146e-05,
      "loss": 1.9222,
      "num_input_tokens_seen": 10407341952,
      "step": 13228
    },
    {
      "epoch": 1.4034585189900275,
      "grad_norm": 0.553423935609733,
      "learning_rate": 4.8353611325330245e-05,
      "loss": 1.6596,
      "num_input_tokens_seen": 10408128896,
      "step": 13229
    },
    {
      "epoch": 1.403564608529599,
      "grad_norm": 0.5163591211698575,
      "learning_rate": 4.835336328531235e-05,
      "loss": 1.8119,
      "num_input_tokens_seen": 10408915712,
      "step": 13230
    },
    {
      "epoch": 1.4036706980691704,
      "grad_norm": 0.46153921321842517,
      "learning_rate": 4.835311522724767e-05,
      "loss": 1.7761,
      "num_input_tokens_seen": 10409702448,
      "step": 13231
    },
    {
      "epoch": 1.403776787608742,
      "grad_norm": 0.48742278701305963,
      "learning_rate": 4.8352867151136386e-05,
      "loss": 1.818,
      "num_input_tokens_seen": 10410489216,
      "step": 13232
    },
    {
      "epoch": 1.4038828771483132,
      "grad_norm": 0.5042648674235415,
      "learning_rate": 4.835261905697868e-05,
      "loss": 1.7436,
      "num_input_tokens_seen": 10411275904,
      "step": 13233
    },
    {
      "epoch": 1.4039889666878846,
      "grad_norm": 0.3684374875666108,
      "learning_rate": 4.835237094477477e-05,
      "loss": 1.6,
      "num_input_tokens_seen": 10412062736,
      "step": 13234
    },
    {
      "epoch": 1.404095056227456,
      "grad_norm": 0.3441810711211284,
      "learning_rate": 4.8352122814524827e-05,
      "loss": 1.7867,
      "num_input_tokens_seen": 10412849456,
      "step": 13235
    },
    {
      "epoch": 1.4042011457670274,
      "grad_norm": 0.3967086656218295,
      "learning_rate": 4.8351874666229044e-05,
      "loss": 1.6881,
      "num_input_tokens_seen": 10413636240,
      "step": 13236
    },
    {
      "epoch": 1.4043072353065988,
      "grad_norm": 0.3819189201022736,
      "learning_rate": 4.835162649988762e-05,
      "loss": 1.7552,
      "num_input_tokens_seen": 10414423104,
      "step": 13237
    },
    {
      "epoch": 1.40441332484617,
      "grad_norm": 0.3850847156447724,
      "learning_rate": 4.835137831550075e-05,
      "loss": 1.7433,
      "num_input_tokens_seen": 10415209776,
      "step": 13238
    },
    {
      "epoch": 1.4045194143857416,
      "grad_norm": 0.44635014195865197,
      "learning_rate": 4.835113011306861e-05,
      "loss": 1.7268,
      "num_input_tokens_seen": 10415996448,
      "step": 13239
    },
    {
      "epoch": 1.404625503925313,
      "grad_norm": 0.388671316515784,
      "learning_rate": 4.835088189259141e-05,
      "loss": 1.7223,
      "num_input_tokens_seen": 10416783168,
      "step": 13240
    },
    {
      "epoch": 1.4047315934648843,
      "grad_norm": 0.42730543266629534,
      "learning_rate": 4.8350633654069336e-05,
      "loss": 1.9526,
      "num_input_tokens_seen": 10417569792,
      "step": 13241
    },
    {
      "epoch": 1.4048376830044558,
      "grad_norm": 0.40330434895508416,
      "learning_rate": 4.835038539750257e-05,
      "loss": 1.8151,
      "num_input_tokens_seen": 10418356496,
      "step": 13242
    },
    {
      "epoch": 1.4049437725440272,
      "grad_norm": 0.5226943993474308,
      "learning_rate": 4.835013712289131e-05,
      "loss": 1.5997,
      "num_input_tokens_seen": 10419143216,
      "step": 13243
    },
    {
      "epoch": 1.4050498620835985,
      "grad_norm": 0.4573101526356905,
      "learning_rate": 4.834988883023576e-05,
      "loss": 1.738,
      "num_input_tokens_seen": 10419929952,
      "step": 13244
    },
    {
      "epoch": 1.40515595162317,
      "grad_norm": 0.9004326025674538,
      "learning_rate": 4.8349640519536086e-05,
      "loss": 1.7308,
      "num_input_tokens_seen": 10420716768,
      "step": 13245
    },
    {
      "epoch": 1.4052620411627412,
      "grad_norm": 0.4291020839589641,
      "learning_rate": 4.834939219079251e-05,
      "loss": 1.7371,
      "num_input_tokens_seen": 10421503568,
      "step": 13246
    },
    {
      "epoch": 1.4053681307023127,
      "grad_norm": 0.5783838681143337,
      "learning_rate": 4.8349143844005196e-05,
      "loss": 1.766,
      "num_input_tokens_seen": 10422290304,
      "step": 13247
    },
    {
      "epoch": 1.4054742202418842,
      "grad_norm": 0.7961833963774281,
      "learning_rate": 4.834889547917436e-05,
      "loss": 1.9068,
      "num_input_tokens_seen": 10423077008,
      "step": 13248
    },
    {
      "epoch": 1.4055803097814557,
      "grad_norm": 1.179533172112341,
      "learning_rate": 4.8348647096300174e-05,
      "loss": 1.9066,
      "num_input_tokens_seen": 10423863728,
      "step": 13249
    },
    {
      "epoch": 1.405686399321027,
      "grad_norm": 0.44180204669832435,
      "learning_rate": 4.8348398695382846e-05,
      "loss": 1.7759,
      "num_input_tokens_seen": 10424650480,
      "step": 13250
    },
    {
      "epoch": 1.4057924888605984,
      "grad_norm": 0.7390832401835344,
      "learning_rate": 4.834815027642256e-05,
      "loss": 1.8171,
      "num_input_tokens_seen": 10425437216,
      "step": 13251
    },
    {
      "epoch": 1.4058985784001696,
      "grad_norm": 0.46965603638692777,
      "learning_rate": 4.83479018394195e-05,
      "loss": 1.7407,
      "num_input_tokens_seen": 10426223984,
      "step": 13252
    },
    {
      "epoch": 1.406004667939741,
      "grad_norm": 0.5625592942459438,
      "learning_rate": 4.834765338437387e-05,
      "loss": 1.8105,
      "num_input_tokens_seen": 10427010752,
      "step": 13253
    },
    {
      "epoch": 1.4061107574793126,
      "grad_norm": 0.5636495675554113,
      "learning_rate": 4.8347404911285866e-05,
      "loss": 1.8143,
      "num_input_tokens_seen": 10427797504,
      "step": 13254
    },
    {
      "epoch": 1.406216847018884,
      "grad_norm": 0.4530350142168216,
      "learning_rate": 4.834715642015566e-05,
      "loss": 1.8278,
      "num_input_tokens_seen": 10428584160,
      "step": 13255
    },
    {
      "epoch": 1.4063229365584553,
      "grad_norm": 0.4408398555468626,
      "learning_rate": 4.834690791098346e-05,
      "loss": 1.6717,
      "num_input_tokens_seen": 10429371024,
      "step": 13256
    },
    {
      "epoch": 1.4064290260980268,
      "grad_norm": 0.49501051728030493,
      "learning_rate": 4.834665938376946e-05,
      "loss": 1.7341,
      "num_input_tokens_seen": 10430157776,
      "step": 13257
    },
    {
      "epoch": 1.406535115637598,
      "grad_norm": 0.42093152895672115,
      "learning_rate": 4.8346410838513845e-05,
      "loss": 1.787,
      "num_input_tokens_seen": 10430944576,
      "step": 13258
    },
    {
      "epoch": 1.4066412051771695,
      "grad_norm": 0.5438479538731971,
      "learning_rate": 4.834616227521681e-05,
      "loss": 1.7363,
      "num_input_tokens_seen": 10431731344,
      "step": 13259
    },
    {
      "epoch": 1.406747294716741,
      "grad_norm": 0.4486334392280338,
      "learning_rate": 4.8345913693878545e-05,
      "loss": 1.8316,
      "num_input_tokens_seen": 10432518080,
      "step": 13260
    },
    {
      "epoch": 1.4068533842563125,
      "grad_norm": 0.5496068655523751,
      "learning_rate": 4.834566509449924e-05,
      "loss": 1.768,
      "num_input_tokens_seen": 10433304848,
      "step": 13261
    },
    {
      "epoch": 1.4069594737958837,
      "grad_norm": 0.4075247250031917,
      "learning_rate": 4.83454164770791e-05,
      "loss": 1.7452,
      "num_input_tokens_seen": 10434091616,
      "step": 13262
    },
    {
      "epoch": 1.4070655633354552,
      "grad_norm": 0.5519724545461518,
      "learning_rate": 4.8345167841618295e-05,
      "loss": 1.7693,
      "num_input_tokens_seen": 10434878400,
      "step": 13263
    },
    {
      "epoch": 1.4071716528750264,
      "grad_norm": 0.5253208903299387,
      "learning_rate": 4.834491918811703e-05,
      "loss": 1.7398,
      "num_input_tokens_seen": 10435665136,
      "step": 13264
    },
    {
      "epoch": 1.407277742414598,
      "grad_norm": 0.40081436548426963,
      "learning_rate": 4.83446705165755e-05,
      "loss": 1.7464,
      "num_input_tokens_seen": 10436451904,
      "step": 13265
    },
    {
      "epoch": 1.4073838319541694,
      "grad_norm": 0.5092069575439667,
      "learning_rate": 4.834442182699389e-05,
      "loss": 1.7894,
      "num_input_tokens_seen": 10437238608,
      "step": 13266
    },
    {
      "epoch": 1.4074899214937406,
      "grad_norm": 0.37124131781893865,
      "learning_rate": 4.8344173119372404e-05,
      "loss": 1.7675,
      "num_input_tokens_seen": 10438025280,
      "step": 13267
    },
    {
      "epoch": 1.4075960110333121,
      "grad_norm": 0.5024616863434673,
      "learning_rate": 4.834392439371122e-05,
      "loss": 1.7083,
      "num_input_tokens_seen": 10438812032,
      "step": 13268
    },
    {
      "epoch": 1.4077021005728836,
      "grad_norm": 0.4599105050227558,
      "learning_rate": 4.834367565001054e-05,
      "loss": 1.8243,
      "num_input_tokens_seen": 10439598672,
      "step": 13269
    },
    {
      "epoch": 1.4078081901124548,
      "grad_norm": 0.46070974411839055,
      "learning_rate": 4.834342688827055e-05,
      "loss": 1.7014,
      "num_input_tokens_seen": 10440385376,
      "step": 13270
    },
    {
      "epoch": 1.4079142796520263,
      "grad_norm": 0.47547129306491054,
      "learning_rate": 4.8343178108491444e-05,
      "loss": 1.6371,
      "num_input_tokens_seen": 10441172128,
      "step": 13271
    },
    {
      "epoch": 1.4080203691915978,
      "grad_norm": 0.5720282001610376,
      "learning_rate": 4.834292931067341e-05,
      "loss": 1.862,
      "num_input_tokens_seen": 10441958800,
      "step": 13272
    },
    {
      "epoch": 1.408126458731169,
      "grad_norm": 0.40807703639692977,
      "learning_rate": 4.834268049481666e-05,
      "loss": 1.8752,
      "num_input_tokens_seen": 10442745616,
      "step": 13273
    },
    {
      "epoch": 1.4082325482707405,
      "grad_norm": 0.48965664259684943,
      "learning_rate": 4.8342431660921355e-05,
      "loss": 1.7734,
      "num_input_tokens_seen": 10443532400,
      "step": 13274
    },
    {
      "epoch": 1.4083386378103118,
      "grad_norm": 0.440162691173897,
      "learning_rate": 4.8342182808987714e-05,
      "loss": 1.8317,
      "num_input_tokens_seen": 10444319200,
      "step": 13275
    },
    {
      "epoch": 1.4084447273498832,
      "grad_norm": 0.39676621417361924,
      "learning_rate": 4.8341933939015917e-05,
      "loss": 1.7226,
      "num_input_tokens_seen": 10445106016,
      "step": 13276
    },
    {
      "epoch": 1.4085508168894547,
      "grad_norm": 0.5162759141866364,
      "learning_rate": 4.834168505100616e-05,
      "loss": 1.8638,
      "num_input_tokens_seen": 10445892656,
      "step": 13277
    },
    {
      "epoch": 1.4086569064290262,
      "grad_norm": 0.42821215351310754,
      "learning_rate": 4.8341436144958626e-05,
      "loss": 1.8474,
      "num_input_tokens_seen": 10446679328,
      "step": 13278
    },
    {
      "epoch": 1.4087629959685974,
      "grad_norm": 0.40905252240197665,
      "learning_rate": 4.834118722087352e-05,
      "loss": 1.6731,
      "num_input_tokens_seen": 10447466128,
      "step": 13279
    },
    {
      "epoch": 1.408869085508169,
      "grad_norm": 0.5413779667308561,
      "learning_rate": 4.834093827875102e-05,
      "loss": 1.793,
      "num_input_tokens_seen": 10448252896,
      "step": 13280
    },
    {
      "epoch": 1.4089751750477402,
      "grad_norm": 0.39314445366516315,
      "learning_rate": 4.834068931859135e-05,
      "loss": 1.7353,
      "num_input_tokens_seen": 10449039680,
      "step": 13281
    },
    {
      "epoch": 1.4090812645873116,
      "grad_norm": 0.390063625210368,
      "learning_rate": 4.834044034039466e-05,
      "loss": 1.8734,
      "num_input_tokens_seen": 10449826464,
      "step": 13282
    },
    {
      "epoch": 1.4091873541268831,
      "grad_norm": 0.5329345630691124,
      "learning_rate": 4.8340191344161166e-05,
      "loss": 1.8531,
      "num_input_tokens_seen": 10450613168,
      "step": 13283
    },
    {
      "epoch": 1.4092934436664546,
      "grad_norm": 0.3806168826068896,
      "learning_rate": 4.8339942329891065e-05,
      "loss": 1.6713,
      "num_input_tokens_seen": 10451399968,
      "step": 13284
    },
    {
      "epoch": 1.4093995332060258,
      "grad_norm": 0.5054548892174918,
      "learning_rate": 4.8339693297584536e-05,
      "loss": 1.8247,
      "num_input_tokens_seen": 10452186688,
      "step": 13285
    },
    {
      "epoch": 1.4095056227455973,
      "grad_norm": 0.45102208653774106,
      "learning_rate": 4.833944424724178e-05,
      "loss": 1.7372,
      "num_input_tokens_seen": 10452973488,
      "step": 13286
    },
    {
      "epoch": 1.4096117122851686,
      "grad_norm": 0.39227200233019305,
      "learning_rate": 4.8339195178862986e-05,
      "loss": 1.7157,
      "num_input_tokens_seen": 10453760272,
      "step": 13287
    },
    {
      "epoch": 1.40971780182474,
      "grad_norm": 0.4587360651353164,
      "learning_rate": 4.8338946092448345e-05,
      "loss": 1.7011,
      "num_input_tokens_seen": 10454546992,
      "step": 13288
    },
    {
      "epoch": 1.4098238913643115,
      "grad_norm": 0.38680704786429354,
      "learning_rate": 4.833869698799804e-05,
      "loss": 1.7803,
      "num_input_tokens_seen": 10455333840,
      "step": 13289
    },
    {
      "epoch": 1.409929980903883,
      "grad_norm": 0.4781526618231655,
      "learning_rate": 4.833844786551229e-05,
      "loss": 1.7277,
      "num_input_tokens_seen": 10456120624,
      "step": 13290
    },
    {
      "epoch": 1.4100360704434542,
      "grad_norm": 0.43613974306421954,
      "learning_rate": 4.8338198724991267e-05,
      "loss": 1.8357,
      "num_input_tokens_seen": 10456907472,
      "step": 13291
    },
    {
      "epoch": 1.4101421599830257,
      "grad_norm": 0.39131283469135725,
      "learning_rate": 4.8337949566435175e-05,
      "loss": 1.6719,
      "num_input_tokens_seen": 10457694224,
      "step": 13292
    },
    {
      "epoch": 1.410248249522597,
      "grad_norm": 0.4392496367158161,
      "learning_rate": 4.83377003898442e-05,
      "loss": 1.7819,
      "num_input_tokens_seen": 10458480976,
      "step": 13293
    },
    {
      "epoch": 1.4103543390621684,
      "grad_norm": 0.4929031162834035,
      "learning_rate": 4.8337451195218525e-05,
      "loss": 1.7667,
      "num_input_tokens_seen": 10459267840,
      "step": 13294
    },
    {
      "epoch": 1.41046042860174,
      "grad_norm": 0.38800888252025323,
      "learning_rate": 4.833720198255835e-05,
      "loss": 1.6625,
      "num_input_tokens_seen": 10460054720,
      "step": 13295
    },
    {
      "epoch": 1.4105665181413114,
      "grad_norm": 0.4903738012097271,
      "learning_rate": 4.8336952751863886e-05,
      "loss": 1.7417,
      "num_input_tokens_seen": 10460841600,
      "step": 13296
    },
    {
      "epoch": 1.4106726076808827,
      "grad_norm": 0.4375477793758458,
      "learning_rate": 4.83367035031353e-05,
      "loss": 1.8026,
      "num_input_tokens_seen": 10461628368,
      "step": 13297
    },
    {
      "epoch": 1.4107786972204541,
      "grad_norm": 0.48297134275252745,
      "learning_rate": 4.83364542363728e-05,
      "loss": 1.8521,
      "num_input_tokens_seen": 10462415056,
      "step": 13298
    },
    {
      "epoch": 1.4108847867600254,
      "grad_norm": 0.44047088847623983,
      "learning_rate": 4.833620495157657e-05,
      "loss": 1.7331,
      "num_input_tokens_seen": 10463201824,
      "step": 13299
    },
    {
      "epoch": 1.4109908762995969,
      "grad_norm": 0.43082637014999664,
      "learning_rate": 4.83359556487468e-05,
      "loss": 1.7564,
      "num_input_tokens_seen": 10463988528,
      "step": 13300
    },
    {
      "epoch": 1.4110969658391683,
      "grad_norm": 0.5801803905024888,
      "learning_rate": 4.833570632788369e-05,
      "loss": 1.8638,
      "num_input_tokens_seen": 10464775248,
      "step": 13301
    },
    {
      "epoch": 1.4112030553787396,
      "grad_norm": 0.544715549607027,
      "learning_rate": 4.833545698898744e-05,
      "loss": 1.7668,
      "num_input_tokens_seen": 10465561952,
      "step": 13302
    },
    {
      "epoch": 1.411309144918311,
      "grad_norm": 0.4115504209921332,
      "learning_rate": 4.833520763205822e-05,
      "loss": 1.7191,
      "num_input_tokens_seen": 10466348816,
      "step": 13303
    },
    {
      "epoch": 1.4114152344578825,
      "grad_norm": 0.33577236032289354,
      "learning_rate": 4.833495825709625e-05,
      "loss": 1.7019,
      "num_input_tokens_seen": 10467135648,
      "step": 13304
    },
    {
      "epoch": 1.4115213239974538,
      "grad_norm": 0.48869627013530287,
      "learning_rate": 4.8334708864101696e-05,
      "loss": 1.755,
      "num_input_tokens_seen": 10467922432,
      "step": 13305
    },
    {
      "epoch": 1.4116274135370253,
      "grad_norm": 0.40469712345295844,
      "learning_rate": 4.833445945307477e-05,
      "loss": 1.7421,
      "num_input_tokens_seen": 10468709184,
      "step": 13306
    },
    {
      "epoch": 1.4117335030765967,
      "grad_norm": 0.482828539102295,
      "learning_rate": 4.833421002401566e-05,
      "loss": 1.856,
      "num_input_tokens_seen": 10469495904,
      "step": 13307
    },
    {
      "epoch": 1.411839592616168,
      "grad_norm": 0.3717407358018566,
      "learning_rate": 4.8333960576924554e-05,
      "loss": 1.7838,
      "num_input_tokens_seen": 10470282752,
      "step": 13308
    },
    {
      "epoch": 1.4119456821557395,
      "grad_norm": 0.4681694443972252,
      "learning_rate": 4.833371111180165e-05,
      "loss": 1.735,
      "num_input_tokens_seen": 10471069568,
      "step": 13309
    },
    {
      "epoch": 1.4120517716953107,
      "grad_norm": 0.3796965925559705,
      "learning_rate": 4.833346162864714e-05,
      "loss": 1.8501,
      "num_input_tokens_seen": 10471856272,
      "step": 13310
    },
    {
      "epoch": 1.4121578612348822,
      "grad_norm": 0.43456827274123644,
      "learning_rate": 4.833321212746121e-05,
      "loss": 1.6826,
      "num_input_tokens_seen": 10472643168,
      "step": 13311
    },
    {
      "epoch": 1.4122639507744537,
      "grad_norm": 0.3438216855997217,
      "learning_rate": 4.833296260824406e-05,
      "loss": 1.6788,
      "num_input_tokens_seen": 10473429968,
      "step": 13312
    },
    {
      "epoch": 1.4123700403140251,
      "grad_norm": 0.5383623416311814,
      "learning_rate": 4.8332713070995884e-05,
      "loss": 1.789,
      "num_input_tokens_seen": 10474216672,
      "step": 13313
    },
    {
      "epoch": 1.4124761298535964,
      "grad_norm": 0.5319007458956333,
      "learning_rate": 4.8332463515716875e-05,
      "loss": 1.8336,
      "num_input_tokens_seen": 10475003440,
      "step": 13314
    },
    {
      "epoch": 1.4125822193931679,
      "grad_norm": 0.5545424917255561,
      "learning_rate": 4.833221394240721e-05,
      "loss": 1.7872,
      "num_input_tokens_seen": 10475790176,
      "step": 13315
    },
    {
      "epoch": 1.4126883089327391,
      "grad_norm": 0.4886280891032332,
      "learning_rate": 4.83319643510671e-05,
      "loss": 1.6349,
      "num_input_tokens_seen": 10476576848,
      "step": 13316
    },
    {
      "epoch": 1.4127943984723106,
      "grad_norm": 0.3922959203841259,
      "learning_rate": 4.8331714741696745e-05,
      "loss": 1.6844,
      "num_input_tokens_seen": 10477363568,
      "step": 13317
    },
    {
      "epoch": 1.412900488011882,
      "grad_norm": 0.4959608717177911,
      "learning_rate": 4.8331465114296316e-05,
      "loss": 1.7513,
      "num_input_tokens_seen": 10478150368,
      "step": 13318
    },
    {
      "epoch": 1.4130065775514535,
      "grad_norm": 0.37117501030908956,
      "learning_rate": 4.833121546886602e-05,
      "loss": 1.7529,
      "num_input_tokens_seen": 10478937136,
      "step": 13319
    },
    {
      "epoch": 1.4131126670910248,
      "grad_norm": 0.4027811844514294,
      "learning_rate": 4.8330965805406034e-05,
      "loss": 1.7683,
      "num_input_tokens_seen": 10479723904,
      "step": 13320
    },
    {
      "epoch": 1.4132187566305963,
      "grad_norm": 0.4004976006052398,
      "learning_rate": 4.833071612391657e-05,
      "loss": 1.8261,
      "num_input_tokens_seen": 10480510752,
      "step": 13321
    },
    {
      "epoch": 1.4133248461701675,
      "grad_norm": 0.3710301389993322,
      "learning_rate": 4.8330466424397816e-05,
      "loss": 1.7493,
      "num_input_tokens_seen": 10481297504,
      "step": 13322
    },
    {
      "epoch": 1.413430935709739,
      "grad_norm": 0.4074569102484129,
      "learning_rate": 4.8330216706849954e-05,
      "loss": 1.8031,
      "num_input_tokens_seen": 10482084368,
      "step": 13323
    },
    {
      "epoch": 1.4135370252493105,
      "grad_norm": 0.4204979707286227,
      "learning_rate": 4.8329966971273185e-05,
      "loss": 1.7706,
      "num_input_tokens_seen": 10482871136,
      "step": 13324
    },
    {
      "epoch": 1.413643114788882,
      "grad_norm": 0.403625004673846,
      "learning_rate": 4.8329717217667714e-05,
      "loss": 1.7857,
      "num_input_tokens_seen": 10483657840,
      "step": 13325
    },
    {
      "epoch": 1.4137492043284532,
      "grad_norm": 0.5427784157588235,
      "learning_rate": 4.832946744603371e-05,
      "loss": 1.7627,
      "num_input_tokens_seen": 10484444592,
      "step": 13326
    },
    {
      "epoch": 1.4138552938680247,
      "grad_norm": 0.40865279746385763,
      "learning_rate": 4.8329217656371385e-05,
      "loss": 1.6478,
      "num_input_tokens_seen": 10485231312,
      "step": 13327
    },
    {
      "epoch": 1.413961383407596,
      "grad_norm": 0.420137661878879,
      "learning_rate": 4.832896784868092e-05,
      "loss": 1.8186,
      "num_input_tokens_seen": 10486018112,
      "step": 13328
    },
    {
      "epoch": 1.4140674729471674,
      "grad_norm": 0.38440864233601246,
      "learning_rate": 4.8328718022962514e-05,
      "loss": 1.7659,
      "num_input_tokens_seen": 10486804896,
      "step": 13329
    },
    {
      "epoch": 1.4141735624867389,
      "grad_norm": 0.421595183361026,
      "learning_rate": 4.832846817921637e-05,
      "loss": 1.9776,
      "num_input_tokens_seen": 10487591600,
      "step": 13330
    },
    {
      "epoch": 1.4142796520263103,
      "grad_norm": 0.4648114158852938,
      "learning_rate": 4.832821831744265e-05,
      "loss": 1.8423,
      "num_input_tokens_seen": 10488378448,
      "step": 13331
    },
    {
      "epoch": 1.4143857415658816,
      "grad_norm": 0.3888941225727641,
      "learning_rate": 4.832796843764158e-05,
      "loss": 1.7294,
      "num_input_tokens_seen": 10489165216,
      "step": 13332
    },
    {
      "epoch": 1.414491831105453,
      "grad_norm": 0.361396415127201,
      "learning_rate": 4.832771853981334e-05,
      "loss": 1.7038,
      "num_input_tokens_seen": 10489952064,
      "step": 13333
    },
    {
      "epoch": 1.4145979206450243,
      "grad_norm": 0.42666038926023847,
      "learning_rate": 4.832746862395813e-05,
      "loss": 1.8694,
      "num_input_tokens_seen": 10490738800,
      "step": 13334
    },
    {
      "epoch": 1.4147040101845958,
      "grad_norm": 0.4232987565910137,
      "learning_rate": 4.8327218690076126e-05,
      "loss": 1.7823,
      "num_input_tokens_seen": 10491525504,
      "step": 13335
    },
    {
      "epoch": 1.4148100997241673,
      "grad_norm": 0.40490081420658924,
      "learning_rate": 4.8326968738167535e-05,
      "loss": 1.8169,
      "num_input_tokens_seen": 10492312304,
      "step": 13336
    },
    {
      "epoch": 1.4149161892637385,
      "grad_norm": 0.5115689210004468,
      "learning_rate": 4.8326718768232546e-05,
      "loss": 1.8068,
      "num_input_tokens_seen": 10493098960,
      "step": 13337
    },
    {
      "epoch": 1.41502227880331,
      "grad_norm": 0.38854545918746625,
      "learning_rate": 4.832646878027135e-05,
      "loss": 1.7581,
      "num_input_tokens_seen": 10493885776,
      "step": 13338
    },
    {
      "epoch": 1.4151283683428815,
      "grad_norm": 0.38177455642226665,
      "learning_rate": 4.8326218774284155e-05,
      "loss": 1.8953,
      "num_input_tokens_seen": 10494672592,
      "step": 13339
    },
    {
      "epoch": 1.4152344578824527,
      "grad_norm": 0.5520426926564206,
      "learning_rate": 4.832596875027113e-05,
      "loss": 1.9458,
      "num_input_tokens_seen": 10495459360,
      "step": 13340
    },
    {
      "epoch": 1.4153405474220242,
      "grad_norm": 0.3799872136302303,
      "learning_rate": 4.832571870823249e-05,
      "loss": 1.7107,
      "num_input_tokens_seen": 10496246064,
      "step": 13341
    },
    {
      "epoch": 1.4154466369615957,
      "grad_norm": 0.5046135127405214,
      "learning_rate": 4.832546864816842e-05,
      "loss": 1.7564,
      "num_input_tokens_seen": 10497032784,
      "step": 13342
    },
    {
      "epoch": 1.415552726501167,
      "grad_norm": 0.3646919290463248,
      "learning_rate": 4.83252185700791e-05,
      "loss": 1.6285,
      "num_input_tokens_seen": 10497819584,
      "step": 13343
    },
    {
      "epoch": 1.4156588160407384,
      "grad_norm": 0.8344070136830121,
      "learning_rate": 4.832496847396475e-05,
      "loss": 1.8648,
      "num_input_tokens_seen": 10498606304,
      "step": 13344
    },
    {
      "epoch": 1.4157649055803097,
      "grad_norm": 0.5221542414184424,
      "learning_rate": 4.8324718359825536e-05,
      "loss": 1.7218,
      "num_input_tokens_seen": 10499393088,
      "step": 13345
    },
    {
      "epoch": 1.4158709951198811,
      "grad_norm": 1.0741552191218167,
      "learning_rate": 4.832446822766167e-05,
      "loss": 1.7112,
      "num_input_tokens_seen": 10500179840,
      "step": 13346
    },
    {
      "epoch": 1.4159770846594526,
      "grad_norm": 0.5522308905792824,
      "learning_rate": 4.8324218077473336e-05,
      "loss": 1.8317,
      "num_input_tokens_seen": 10500966624,
      "step": 13347
    },
    {
      "epoch": 1.416083174199024,
      "grad_norm": 1.9304659888866094,
      "learning_rate": 4.8323967909260734e-05,
      "loss": 1.7501,
      "num_input_tokens_seen": 10501753456,
      "step": 13348
    },
    {
      "epoch": 1.4161892637385953,
      "grad_norm": 1.1912690019592185,
      "learning_rate": 4.832371772302406e-05,
      "loss": 1.7758,
      "num_input_tokens_seen": 10502540160,
      "step": 13349
    },
    {
      "epoch": 1.4162953532781668,
      "grad_norm": 2.36372753854036,
      "learning_rate": 4.8323467518763494e-05,
      "loss": 1.8188,
      "num_input_tokens_seen": 10503326864,
      "step": 13350
    },
    {
      "epoch": 1.416401442817738,
      "grad_norm": 0.5990848964764968,
      "learning_rate": 4.832321729647924e-05,
      "loss": 1.7187,
      "num_input_tokens_seen": 10504113632,
      "step": 13351
    },
    {
      "epoch": 1.4165075323573095,
      "grad_norm": 1.8938232554226218,
      "learning_rate": 4.8322967056171486e-05,
      "loss": 1.7732,
      "num_input_tokens_seen": 10504900400,
      "step": 13352
    },
    {
      "epoch": 1.416613621896881,
      "grad_norm": 1.1038416339660566,
      "learning_rate": 4.8322716797840426e-05,
      "loss": 1.8138,
      "num_input_tokens_seen": 10505687152,
      "step": 13353
    },
    {
      "epoch": 1.4167197114364525,
      "grad_norm": 0.9774802730048638,
      "learning_rate": 4.832246652148625e-05,
      "loss": 1.908,
      "num_input_tokens_seen": 10506473920,
      "step": 13354
    },
    {
      "epoch": 1.4168258009760237,
      "grad_norm": 0.8609528114665508,
      "learning_rate": 4.8322216227109164e-05,
      "loss": 1.8257,
      "num_input_tokens_seen": 10507260672,
      "step": 13355
    },
    {
      "epoch": 1.4169318905155952,
      "grad_norm": 0.6153292897709323,
      "learning_rate": 4.8321965914709355e-05,
      "loss": 1.667,
      "num_input_tokens_seen": 10508047488,
      "step": 13356
    },
    {
      "epoch": 1.4170379800551665,
      "grad_norm": 0.5000301300587392,
      "learning_rate": 4.832171558428701e-05,
      "loss": 1.9777,
      "num_input_tokens_seen": 10508834288,
      "step": 13357
    },
    {
      "epoch": 1.417144069594738,
      "grad_norm": 0.6678223385742251,
      "learning_rate": 4.832146523584233e-05,
      "loss": 1.7641,
      "num_input_tokens_seen": 10509620976,
      "step": 13358
    },
    {
      "epoch": 1.4172501591343094,
      "grad_norm": 0.6732077014605435,
      "learning_rate": 4.83212148693755e-05,
      "loss": 1.8309,
      "num_input_tokens_seen": 10510407696,
      "step": 13359
    },
    {
      "epoch": 1.4173562486738809,
      "grad_norm": 0.48794090016427105,
      "learning_rate": 4.832096448488673e-05,
      "loss": 1.8405,
      "num_input_tokens_seen": 10511194368,
      "step": 13360
    },
    {
      "epoch": 1.4174623382134521,
      "grad_norm": 0.4474687525716287,
      "learning_rate": 4.8320714082376195e-05,
      "loss": 1.6893,
      "num_input_tokens_seen": 10511981120,
      "step": 13361
    },
    {
      "epoch": 1.4175684277530236,
      "grad_norm": 0.6332582556642662,
      "learning_rate": 4.83204636618441e-05,
      "loss": 1.6659,
      "num_input_tokens_seen": 10512767872,
      "step": 13362
    },
    {
      "epoch": 1.4176745172925949,
      "grad_norm": 0.44580759664529684,
      "learning_rate": 4.832021322329063e-05,
      "loss": 1.8414,
      "num_input_tokens_seen": 10513554576,
      "step": 13363
    },
    {
      "epoch": 1.4177806068321663,
      "grad_norm": 0.7346503619173533,
      "learning_rate": 4.831996276671599e-05,
      "loss": 1.7177,
      "num_input_tokens_seen": 10514341296,
      "step": 13364
    },
    {
      "epoch": 1.4178866963717378,
      "grad_norm": 0.402575679452823,
      "learning_rate": 4.831971229212037e-05,
      "loss": 1.7716,
      "num_input_tokens_seen": 10515128112,
      "step": 13365
    },
    {
      "epoch": 1.4179927859113093,
      "grad_norm": 0.4932816994991867,
      "learning_rate": 4.8319461799503954e-05,
      "loss": 1.7565,
      "num_input_tokens_seen": 10515914864,
      "step": 13366
    },
    {
      "epoch": 1.4180988754508805,
      "grad_norm": 0.6828028624040755,
      "learning_rate": 4.831921128886694e-05,
      "loss": 1.762,
      "num_input_tokens_seen": 10516701584,
      "step": 13367
    },
    {
      "epoch": 1.418204964990452,
      "grad_norm": 0.5406865309342456,
      "learning_rate": 4.831896076020953e-05,
      "loss": 1.7509,
      "num_input_tokens_seen": 10517488368,
      "step": 13368
    },
    {
      "epoch": 1.4183110545300233,
      "grad_norm": 1.2385599027632865,
      "learning_rate": 4.8318710213531906e-05,
      "loss": 1.8131,
      "num_input_tokens_seen": 10518275072,
      "step": 13369
    },
    {
      "epoch": 1.4184171440695947,
      "grad_norm": 0.7649803122539173,
      "learning_rate": 4.831845964883427e-05,
      "loss": 1.6793,
      "num_input_tokens_seen": 10519061888,
      "step": 13370
    },
    {
      "epoch": 1.4185232336091662,
      "grad_norm": 1.3343686144645905,
      "learning_rate": 4.831820906611681e-05,
      "loss": 1.7558,
      "num_input_tokens_seen": 10519848656,
      "step": 13371
    },
    {
      "epoch": 1.4186293231487375,
      "grad_norm": 0.6930712871648366,
      "learning_rate": 4.831795846537972e-05,
      "loss": 1.8717,
      "num_input_tokens_seen": 10520635376,
      "step": 13372
    },
    {
      "epoch": 1.418735412688309,
      "grad_norm": 0.5896547067504977,
      "learning_rate": 4.8317707846623206e-05,
      "loss": 1.8057,
      "num_input_tokens_seen": 10521422176,
      "step": 13373
    },
    {
      "epoch": 1.4188415022278804,
      "grad_norm": 0.5987043812677231,
      "learning_rate": 4.831745720984745e-05,
      "loss": 1.7922,
      "num_input_tokens_seen": 10522208896,
      "step": 13374
    },
    {
      "epoch": 1.4189475917674517,
      "grad_norm": 0.5138219652640625,
      "learning_rate": 4.8317206555052635e-05,
      "loss": 1.847,
      "num_input_tokens_seen": 10522995600,
      "step": 13375
    },
    {
      "epoch": 1.4190536813070231,
      "grad_norm": 0.6865149038583471,
      "learning_rate": 4.831695588223898e-05,
      "loss": 1.7133,
      "num_input_tokens_seen": 10523782368,
      "step": 13376
    },
    {
      "epoch": 1.4191597708465946,
      "grad_norm": 0.6539856914975037,
      "learning_rate": 4.8316705191406656e-05,
      "loss": 1.7057,
      "num_input_tokens_seen": 10524569120,
      "step": 13377
    },
    {
      "epoch": 1.4192658603861659,
      "grad_norm": 0.499762080632991,
      "learning_rate": 4.8316454482555874e-05,
      "loss": 1.5925,
      "num_input_tokens_seen": 10525356000,
      "step": 13378
    },
    {
      "epoch": 1.4193719499257373,
      "grad_norm": 1.1112703668291224,
      "learning_rate": 4.831620375568681e-05,
      "loss": 1.8655,
      "num_input_tokens_seen": 10526142832,
      "step": 13379
    },
    {
      "epoch": 1.4194780394653086,
      "grad_norm": 0.40643679351702827,
      "learning_rate": 4.831595301079968e-05,
      "loss": 1.7411,
      "num_input_tokens_seen": 10526929680,
      "step": 13380
    },
    {
      "epoch": 1.41958412900488,
      "grad_norm": 0.7021478933869115,
      "learning_rate": 4.8315702247894656e-05,
      "loss": 1.7513,
      "num_input_tokens_seen": 10527716464,
      "step": 13381
    },
    {
      "epoch": 1.4196902185444515,
      "grad_norm": 0.7494340636528967,
      "learning_rate": 4.831545146697195e-05,
      "loss": 1.7458,
      "num_input_tokens_seen": 10528503200,
      "step": 13382
    },
    {
      "epoch": 1.419796308084023,
      "grad_norm": 0.5792670537638027,
      "learning_rate": 4.831520066803174e-05,
      "loss": 1.8087,
      "num_input_tokens_seen": 10529289952,
      "step": 13383
    },
    {
      "epoch": 1.4199023976235943,
      "grad_norm": 0.6236846183484326,
      "learning_rate": 4.831494985107423e-05,
      "loss": 1.8339,
      "num_input_tokens_seen": 10530076768,
      "step": 13384
    },
    {
      "epoch": 1.4200084871631657,
      "grad_norm": 0.5278467741203936,
      "learning_rate": 4.8314699016099614e-05,
      "loss": 1.7722,
      "num_input_tokens_seen": 10530863504,
      "step": 13385
    },
    {
      "epoch": 1.420114576702737,
      "grad_norm": 0.4310461895144826,
      "learning_rate": 4.831444816310808e-05,
      "loss": 1.6406,
      "num_input_tokens_seen": 10531650304,
      "step": 13386
    },
    {
      "epoch": 1.4202206662423085,
      "grad_norm": 0.4813430526379092,
      "learning_rate": 4.8314197292099824e-05,
      "loss": 1.8306,
      "num_input_tokens_seen": 10532437024,
      "step": 13387
    },
    {
      "epoch": 1.42032675578188,
      "grad_norm": 0.3950931215155359,
      "learning_rate": 4.831394640307504e-05,
      "loss": 1.7569,
      "num_input_tokens_seen": 10533223760,
      "step": 13388
    },
    {
      "epoch": 1.4204328453214514,
      "grad_norm": 0.44304611352325063,
      "learning_rate": 4.8313695496033916e-05,
      "loss": 1.823,
      "num_input_tokens_seen": 10534010416,
      "step": 13389
    },
    {
      "epoch": 1.4205389348610227,
      "grad_norm": 0.5781069456735615,
      "learning_rate": 4.831344457097666e-05,
      "loss": 1.7035,
      "num_input_tokens_seen": 10534797184,
      "step": 13390
    },
    {
      "epoch": 1.4206450244005941,
      "grad_norm": 0.40488522857338094,
      "learning_rate": 4.831319362790346e-05,
      "loss": 1.7455,
      "num_input_tokens_seen": 10535584048,
      "step": 13391
    },
    {
      "epoch": 1.4207511139401654,
      "grad_norm": 0.4434746980124874,
      "learning_rate": 4.831294266681451e-05,
      "loss": 1.7269,
      "num_input_tokens_seen": 10536370864,
      "step": 13392
    },
    {
      "epoch": 1.4208572034797369,
      "grad_norm": 0.4568530463120568,
      "learning_rate": 4.831269168770999e-05,
      "loss": 1.768,
      "num_input_tokens_seen": 10537157552,
      "step": 13393
    },
    {
      "epoch": 1.4209632930193083,
      "grad_norm": 0.4956124929538207,
      "learning_rate": 4.8312440690590114e-05,
      "loss": 1.835,
      "num_input_tokens_seen": 10537944384,
      "step": 13394
    },
    {
      "epoch": 1.4210693825588798,
      "grad_norm": 0.43933732768031564,
      "learning_rate": 4.8312189675455065e-05,
      "loss": 1.9488,
      "num_input_tokens_seen": 10538731072,
      "step": 13395
    },
    {
      "epoch": 1.421175472098451,
      "grad_norm": 0.3770424175534107,
      "learning_rate": 4.831193864230504e-05,
      "loss": 1.6356,
      "num_input_tokens_seen": 10539517904,
      "step": 13396
    },
    {
      "epoch": 1.4212815616380226,
      "grad_norm": 0.9529022533440262,
      "learning_rate": 4.831168759114024e-05,
      "loss": 1.7776,
      "num_input_tokens_seen": 10540304704,
      "step": 13397
    },
    {
      "epoch": 1.4213876511775938,
      "grad_norm": 0.49291472236247963,
      "learning_rate": 4.831143652196084e-05,
      "loss": 1.8819,
      "num_input_tokens_seen": 10541091456,
      "step": 13398
    },
    {
      "epoch": 1.4214937407171653,
      "grad_norm": 1.4891358874395464,
      "learning_rate": 4.831118543476706e-05,
      "loss": 1.7013,
      "num_input_tokens_seen": 10541878192,
      "step": 13399
    },
    {
      "epoch": 1.4215998302567368,
      "grad_norm": 0.5044924978821148,
      "learning_rate": 4.831093432955907e-05,
      "loss": 1.7616,
      "num_input_tokens_seen": 10542665088,
      "step": 13400
    },
    {
      "epoch": 1.421705919796308,
      "grad_norm": 0.7029885113835335,
      "learning_rate": 4.8310683206337075e-05,
      "loss": 1.6912,
      "num_input_tokens_seen": 10543451904,
      "step": 13401
    },
    {
      "epoch": 1.4218120093358795,
      "grad_norm": 0.6070027098397872,
      "learning_rate": 4.831043206510127e-05,
      "loss": 1.7573,
      "num_input_tokens_seen": 10544238688,
      "step": 13402
    },
    {
      "epoch": 1.421918098875451,
      "grad_norm": 0.5950584701234917,
      "learning_rate": 4.8310180905851846e-05,
      "loss": 1.6545,
      "num_input_tokens_seen": 10545025488,
      "step": 13403
    },
    {
      "epoch": 1.4220241884150222,
      "grad_norm": 0.8681157402279944,
      "learning_rate": 4.8309929728589e-05,
      "loss": 1.9892,
      "num_input_tokens_seen": 10545812160,
      "step": 13404
    },
    {
      "epoch": 1.4221302779545937,
      "grad_norm": 2.0449408662254633,
      "learning_rate": 4.830967853331292e-05,
      "loss": 1.8428,
      "num_input_tokens_seen": 10546598864,
      "step": 13405
    },
    {
      "epoch": 1.4222363674941652,
      "grad_norm": 0.6586436439497595,
      "learning_rate": 4.83094273200238e-05,
      "loss": 1.8999,
      "num_input_tokens_seen": 10547385552,
      "step": 13406
    },
    {
      "epoch": 1.4223424570337364,
      "grad_norm": 1.0640290324746062,
      "learning_rate": 4.830917608872185e-05,
      "loss": 1.7564,
      "num_input_tokens_seen": 10548172336,
      "step": 13407
    },
    {
      "epoch": 1.4224485465733079,
      "grad_norm": 0.6329424642123298,
      "learning_rate": 4.830892483940725e-05,
      "loss": 1.8361,
      "num_input_tokens_seen": 10548959072,
      "step": 13408
    },
    {
      "epoch": 1.4225546361128791,
      "grad_norm": 1.219118823657441,
      "learning_rate": 4.83086735720802e-05,
      "loss": 1.8299,
      "num_input_tokens_seen": 10549745872,
      "step": 13409
    },
    {
      "epoch": 1.4226607256524506,
      "grad_norm": 1.693962586123344,
      "learning_rate": 4.8308422286740887e-05,
      "loss": 1.7501,
      "num_input_tokens_seen": 10550532736,
      "step": 13410
    },
    {
      "epoch": 1.422766815192022,
      "grad_norm": 1.9177124444069604,
      "learning_rate": 4.83081709833895e-05,
      "loss": 1.9255,
      "num_input_tokens_seen": 10551319520,
      "step": 13411
    },
    {
      "epoch": 1.4228729047315936,
      "grad_norm": 0.9105223369469416,
      "learning_rate": 4.830791966202625e-05,
      "loss": 1.7561,
      "num_input_tokens_seen": 10552106272,
      "step": 13412
    },
    {
      "epoch": 1.4229789942711648,
      "grad_norm": 1.0600064463655876,
      "learning_rate": 4.830766832265132e-05,
      "loss": 1.792,
      "num_input_tokens_seen": 10552893040,
      "step": 13413
    },
    {
      "epoch": 1.4230850838107363,
      "grad_norm": 1.3485925093670414,
      "learning_rate": 4.830741696526492e-05,
      "loss": 1.8906,
      "num_input_tokens_seen": 10553679792,
      "step": 13414
    },
    {
      "epoch": 1.4231911733503075,
      "grad_norm": 0.552129344521367,
      "learning_rate": 4.830716558986722e-05,
      "loss": 1.6211,
      "num_input_tokens_seen": 10554466640,
      "step": 13415
    },
    {
      "epoch": 1.423297262889879,
      "grad_norm": 0.5926980396953249,
      "learning_rate": 4.830691419645843e-05,
      "loss": 1.8476,
      "num_input_tokens_seen": 10555253392,
      "step": 13416
    },
    {
      "epoch": 1.4234033524294505,
      "grad_norm": 0.6180185647358424,
      "learning_rate": 4.830666278503874e-05,
      "loss": 1.7979,
      "num_input_tokens_seen": 10556040112,
      "step": 13417
    },
    {
      "epoch": 1.423509441969022,
      "grad_norm": 0.4618273295718776,
      "learning_rate": 4.830641135560835e-05,
      "loss": 1.5898,
      "num_input_tokens_seen": 10556826816,
      "step": 13418
    },
    {
      "epoch": 1.4236155315085932,
      "grad_norm": 0.4585887063451586,
      "learning_rate": 4.8306159908167445e-05,
      "loss": 1.7639,
      "num_input_tokens_seen": 10557613552,
      "step": 13419
    },
    {
      "epoch": 1.4237216210481647,
      "grad_norm": 0.5655007285915254,
      "learning_rate": 4.830590844271622e-05,
      "loss": 1.8585,
      "num_input_tokens_seen": 10558400320,
      "step": 13420
    },
    {
      "epoch": 1.423827710587736,
      "grad_norm": 0.39241973771866184,
      "learning_rate": 4.830565695925487e-05,
      "loss": 1.6378,
      "num_input_tokens_seen": 10559187152,
      "step": 13421
    },
    {
      "epoch": 1.4239338001273074,
      "grad_norm": 0.4100281952586776,
      "learning_rate": 4.8305405457783605e-05,
      "loss": 1.8647,
      "num_input_tokens_seen": 10559973920,
      "step": 13422
    },
    {
      "epoch": 1.4240398896668789,
      "grad_norm": 0.595707189650869,
      "learning_rate": 4.83051539383026e-05,
      "loss": 1.6659,
      "num_input_tokens_seen": 10560760656,
      "step": 13423
    },
    {
      "epoch": 1.4241459792064504,
      "grad_norm": 0.3850628922042665,
      "learning_rate": 4.830490240081206e-05,
      "loss": 1.8935,
      "num_input_tokens_seen": 10561547520,
      "step": 13424
    },
    {
      "epoch": 1.4242520687460216,
      "grad_norm": 0.4278638179001815,
      "learning_rate": 4.8304650845312164e-05,
      "loss": 1.8184,
      "num_input_tokens_seen": 10562334256,
      "step": 13425
    },
    {
      "epoch": 1.424358158285593,
      "grad_norm": 0.45713364959687264,
      "learning_rate": 4.8304399271803124e-05,
      "loss": 1.8651,
      "num_input_tokens_seen": 10563121008,
      "step": 13426
    },
    {
      "epoch": 1.4244642478251643,
      "grad_norm": 0.4218124054702183,
      "learning_rate": 4.8304147680285126e-05,
      "loss": 1.7934,
      "num_input_tokens_seen": 10563907776,
      "step": 13427
    },
    {
      "epoch": 1.4245703373647358,
      "grad_norm": 0.6121935167304676,
      "learning_rate": 4.830389607075837e-05,
      "loss": 1.7677,
      "num_input_tokens_seen": 10564694480,
      "step": 13428
    },
    {
      "epoch": 1.4246764269043073,
      "grad_norm": 0.4559839080458075,
      "learning_rate": 4.830364444322305e-05,
      "loss": 1.8579,
      "num_input_tokens_seen": 10565481216,
      "step": 13429
    },
    {
      "epoch": 1.4247825164438788,
      "grad_norm": 0.39078675057380946,
      "learning_rate": 4.8303392797679347e-05,
      "loss": 1.6764,
      "num_input_tokens_seen": 10566268016,
      "step": 13430
    },
    {
      "epoch": 1.42488860598345,
      "grad_norm": 0.4372334783190917,
      "learning_rate": 4.830314113412747e-05,
      "loss": 1.7445,
      "num_input_tokens_seen": 10567054736,
      "step": 13431
    },
    {
      "epoch": 1.4249946955230215,
      "grad_norm": 0.48400949535586324,
      "learning_rate": 4.830288945256762e-05,
      "loss": 1.778,
      "num_input_tokens_seen": 10567841424,
      "step": 13432
    },
    {
      "epoch": 1.4251007850625927,
      "grad_norm": 0.3591098984024318,
      "learning_rate": 4.8302637752999966e-05,
      "loss": 1.6461,
      "num_input_tokens_seen": 10568628176,
      "step": 13433
    },
    {
      "epoch": 1.4252068746021642,
      "grad_norm": 0.4563696976137775,
      "learning_rate": 4.830238603542473e-05,
      "loss": 1.8328,
      "num_input_tokens_seen": 10569414880,
      "step": 13434
    },
    {
      "epoch": 1.4253129641417357,
      "grad_norm": 0.36990000423375485,
      "learning_rate": 4.830213429984209e-05,
      "loss": 1.7286,
      "num_input_tokens_seen": 10570201696,
      "step": 13435
    },
    {
      "epoch": 1.425419053681307,
      "grad_norm": 0.4354233830700985,
      "learning_rate": 4.830188254625223e-05,
      "loss": 1.8196,
      "num_input_tokens_seen": 10570988432,
      "step": 13436
    },
    {
      "epoch": 1.4255251432208784,
      "grad_norm": 0.4587414050229767,
      "learning_rate": 4.830163077465537e-05,
      "loss": 1.8669,
      "num_input_tokens_seen": 10571775152,
      "step": 13437
    },
    {
      "epoch": 1.42563123276045,
      "grad_norm": 0.44743932365350364,
      "learning_rate": 4.83013789850517e-05,
      "loss": 1.834,
      "num_input_tokens_seen": 10572561856,
      "step": 13438
    },
    {
      "epoch": 1.4257373223000211,
      "grad_norm": 0.5927101246672363,
      "learning_rate": 4.83011271774414e-05,
      "loss": 1.8158,
      "num_input_tokens_seen": 10573348624,
      "step": 13439
    },
    {
      "epoch": 1.4258434118395926,
      "grad_norm": 0.42674214009410866,
      "learning_rate": 4.830087535182467e-05,
      "loss": 1.8947,
      "num_input_tokens_seen": 10574135344,
      "step": 13440
    },
    {
      "epoch": 1.425949501379164,
      "grad_norm": 0.6279407265730922,
      "learning_rate": 4.8300623508201716e-05,
      "loss": 1.7836,
      "num_input_tokens_seen": 10574922080,
      "step": 13441
    },
    {
      "epoch": 1.4260555909187353,
      "grad_norm": 0.3726648532396126,
      "learning_rate": 4.830037164657272e-05,
      "loss": 1.7425,
      "num_input_tokens_seen": 10575708896,
      "step": 13442
    },
    {
      "epoch": 1.4261616804583068,
      "grad_norm": 0.49947327511093786,
      "learning_rate": 4.830011976693788e-05,
      "loss": 1.7795,
      "num_input_tokens_seen": 10576495664,
      "step": 13443
    },
    {
      "epoch": 1.426267769997878,
      "grad_norm": 0.3727097580649275,
      "learning_rate": 4.829986786929739e-05,
      "loss": 1.8914,
      "num_input_tokens_seen": 10577282368,
      "step": 13444
    },
    {
      "epoch": 1.4263738595374496,
      "grad_norm": 0.424797644411812,
      "learning_rate": 4.8299615953651446e-05,
      "loss": 1.8062,
      "num_input_tokens_seen": 10578069152,
      "step": 13445
    },
    {
      "epoch": 1.426479949077021,
      "grad_norm": 0.3843991274819542,
      "learning_rate": 4.8299364020000246e-05,
      "loss": 1.772,
      "num_input_tokens_seen": 10578855824,
      "step": 13446
    },
    {
      "epoch": 1.4265860386165925,
      "grad_norm": 0.4189453042276708,
      "learning_rate": 4.829911206834398e-05,
      "loss": 1.8666,
      "num_input_tokens_seen": 10579642624,
      "step": 13447
    },
    {
      "epoch": 1.4266921281561638,
      "grad_norm": 0.5014401472676164,
      "learning_rate": 4.829886009868284e-05,
      "loss": 1.9681,
      "num_input_tokens_seen": 10580429344,
      "step": 13448
    },
    {
      "epoch": 1.4267982176957352,
      "grad_norm": 0.4172850663476913,
      "learning_rate": 4.829860811101702e-05,
      "loss": 1.9298,
      "num_input_tokens_seen": 10581215968,
      "step": 13449
    },
    {
      "epoch": 1.4269043072353065,
      "grad_norm": 0.4822223425578822,
      "learning_rate": 4.829835610534673e-05,
      "loss": 1.7384,
      "num_input_tokens_seen": 10582002816,
      "step": 13450
    },
    {
      "epoch": 1.427010396774878,
      "grad_norm": 0.5077698324927037,
      "learning_rate": 4.8298104081672145e-05,
      "loss": 1.8988,
      "num_input_tokens_seen": 10582789536,
      "step": 13451
    },
    {
      "epoch": 1.4271164863144494,
      "grad_norm": 0.38616913690767324,
      "learning_rate": 4.829785203999347e-05,
      "loss": 1.7504,
      "num_input_tokens_seen": 10583576304,
      "step": 13452
    },
    {
      "epoch": 1.427222575854021,
      "grad_norm": 0.4621511629309728,
      "learning_rate": 4.829759998031091e-05,
      "loss": 1.9016,
      "num_input_tokens_seen": 10584363056,
      "step": 13453
    },
    {
      "epoch": 1.4273286653935922,
      "grad_norm": 0.34491415851714985,
      "learning_rate": 4.829734790262464e-05,
      "loss": 1.7387,
      "num_input_tokens_seen": 10585149872,
      "step": 13454
    },
    {
      "epoch": 1.4274347549331636,
      "grad_norm": 0.4753392372096341,
      "learning_rate": 4.829709580693486e-05,
      "loss": 1.7869,
      "num_input_tokens_seen": 10585936560,
      "step": 13455
    },
    {
      "epoch": 1.4275408444727349,
      "grad_norm": 0.3724721976448342,
      "learning_rate": 4.8296843693241775e-05,
      "loss": 1.8294,
      "num_input_tokens_seen": 10586723312,
      "step": 13456
    },
    {
      "epoch": 1.4276469340123064,
      "grad_norm": 0.6029101636333779,
      "learning_rate": 4.829659156154557e-05,
      "loss": 1.6289,
      "num_input_tokens_seen": 10587510112,
      "step": 13457
    },
    {
      "epoch": 1.4277530235518778,
      "grad_norm": 0.3589400985342954,
      "learning_rate": 4.829633941184644e-05,
      "loss": 1.7448,
      "num_input_tokens_seen": 10588296864,
      "step": 13458
    },
    {
      "epoch": 1.4278591130914493,
      "grad_norm": 0.5424987491576785,
      "learning_rate": 4.829608724414459e-05,
      "loss": 1.8386,
      "num_input_tokens_seen": 10589083680,
      "step": 13459
    },
    {
      "epoch": 1.4279652026310206,
      "grad_norm": 0.4069968237562113,
      "learning_rate": 4.82958350584402e-05,
      "loss": 1.8517,
      "num_input_tokens_seen": 10589870448,
      "step": 13460
    },
    {
      "epoch": 1.428071292170592,
      "grad_norm": 0.4262249075863109,
      "learning_rate": 4.829558285473347e-05,
      "loss": 1.7923,
      "num_input_tokens_seen": 10590657264,
      "step": 13461
    },
    {
      "epoch": 1.4281773817101633,
      "grad_norm": 0.39348684138842643,
      "learning_rate": 4.8295330633024605e-05,
      "loss": 1.8056,
      "num_input_tokens_seen": 10591444000,
      "step": 13462
    },
    {
      "epoch": 1.4282834712497348,
      "grad_norm": 0.37273599251884854,
      "learning_rate": 4.8295078393313784e-05,
      "loss": 1.7708,
      "num_input_tokens_seen": 10592230768,
      "step": 13463
    },
    {
      "epoch": 1.4283895607893062,
      "grad_norm": 0.4067353125388032,
      "learning_rate": 4.8294826135601215e-05,
      "loss": 1.6718,
      "num_input_tokens_seen": 10593017552,
      "step": 13464
    },
    {
      "epoch": 1.4284956503288777,
      "grad_norm": 0.38983919679449713,
      "learning_rate": 4.829457385988709e-05,
      "loss": 1.7064,
      "num_input_tokens_seen": 10593804288,
      "step": 13465
    },
    {
      "epoch": 1.428601739868449,
      "grad_norm": 0.5374452817381042,
      "learning_rate": 4.8294321566171594e-05,
      "loss": 1.7853,
      "num_input_tokens_seen": 10594591008,
      "step": 13466
    },
    {
      "epoch": 1.4287078294080204,
      "grad_norm": 0.430069989538248,
      "learning_rate": 4.829406925445493e-05,
      "loss": 1.7709,
      "num_input_tokens_seen": 10595377776,
      "step": 13467
    },
    {
      "epoch": 1.4288139189475917,
      "grad_norm": 0.5993395555338638,
      "learning_rate": 4.82938169247373e-05,
      "loss": 1.8698,
      "num_input_tokens_seen": 10596164448,
      "step": 13468
    },
    {
      "epoch": 1.4289200084871632,
      "grad_norm": 0.3538160131938485,
      "learning_rate": 4.829356457701889e-05,
      "loss": 1.6131,
      "num_input_tokens_seen": 10596951200,
      "step": 13469
    },
    {
      "epoch": 1.4290260980267346,
      "grad_norm": 0.7896330676192634,
      "learning_rate": 4.8293312211299904e-05,
      "loss": 1.7243,
      "num_input_tokens_seen": 10597738096,
      "step": 13470
    },
    {
      "epoch": 1.429132187566306,
      "grad_norm": 0.5310528943109973,
      "learning_rate": 4.829305982758052e-05,
      "loss": 1.7914,
      "num_input_tokens_seen": 10598524816,
      "step": 13471
    },
    {
      "epoch": 1.4292382771058774,
      "grad_norm": 0.6300867191645868,
      "learning_rate": 4.8292807425860944e-05,
      "loss": 1.8383,
      "num_input_tokens_seen": 10599311472,
      "step": 13472
    },
    {
      "epoch": 1.4293443666454488,
      "grad_norm": 0.42198940912198046,
      "learning_rate": 4.8292555006141364e-05,
      "loss": 1.797,
      "num_input_tokens_seen": 10600098224,
      "step": 13473
    },
    {
      "epoch": 1.42945045618502,
      "grad_norm": 0.5294112068186033,
      "learning_rate": 4.829230256842199e-05,
      "loss": 1.7865,
      "num_input_tokens_seen": 10600884992,
      "step": 13474
    },
    {
      "epoch": 1.4295565457245916,
      "grad_norm": 0.5645899588622234,
      "learning_rate": 4.8292050112703e-05,
      "loss": 1.804,
      "num_input_tokens_seen": 10601671744,
      "step": 13475
    },
    {
      "epoch": 1.429662635264163,
      "grad_norm": 0.5495376297889404,
      "learning_rate": 4.82917976389846e-05,
      "loss": 1.7432,
      "num_input_tokens_seen": 10602458512,
      "step": 13476
    },
    {
      "epoch": 1.4297687248037343,
      "grad_norm": 0.4517999938392571,
      "learning_rate": 4.829154514726699e-05,
      "loss": 1.706,
      "num_input_tokens_seen": 10603245312,
      "step": 13477
    },
    {
      "epoch": 1.4298748143433058,
      "grad_norm": 0.4846434527395752,
      "learning_rate": 4.829129263755036e-05,
      "loss": 1.8443,
      "num_input_tokens_seen": 10604032096,
      "step": 13478
    },
    {
      "epoch": 1.429980903882877,
      "grad_norm": 0.3670272587215577,
      "learning_rate": 4.829104010983488e-05,
      "loss": 1.6885,
      "num_input_tokens_seen": 10604818912,
      "step": 13479
    },
    {
      "epoch": 1.4300869934224485,
      "grad_norm": 0.36066203092438004,
      "learning_rate": 4.8290787564120785e-05,
      "loss": 1.598,
      "num_input_tokens_seen": 10605605664,
      "step": 13480
    },
    {
      "epoch": 1.43019308296202,
      "grad_norm": 0.38280486129714375,
      "learning_rate": 4.829053500040825e-05,
      "loss": 1.7688,
      "num_input_tokens_seen": 10606392384,
      "step": 13481
    },
    {
      "epoch": 1.4302991725015914,
      "grad_norm": 0.3443205323093276,
      "learning_rate": 4.829028241869748e-05,
      "loss": 1.6235,
      "num_input_tokens_seen": 10607179232,
      "step": 13482
    },
    {
      "epoch": 1.4304052620411627,
      "grad_norm": 0.4063878056334411,
      "learning_rate": 4.8290029818988655e-05,
      "loss": 1.7727,
      "num_input_tokens_seen": 10607965856,
      "step": 13483
    },
    {
      "epoch": 1.4305113515807342,
      "grad_norm": 0.3361987112236374,
      "learning_rate": 4.8289777201281974e-05,
      "loss": 1.7297,
      "num_input_tokens_seen": 10608752688,
      "step": 13484
    },
    {
      "epoch": 1.4306174411203054,
      "grad_norm": 0.4154689449647179,
      "learning_rate": 4.8289524565577646e-05,
      "loss": 1.9032,
      "num_input_tokens_seen": 10609539312,
      "step": 13485
    },
    {
      "epoch": 1.430723530659877,
      "grad_norm": 0.317265468859676,
      "learning_rate": 4.828927191187585e-05,
      "loss": 1.6203,
      "num_input_tokens_seen": 10610326064,
      "step": 13486
    },
    {
      "epoch": 1.4308296201994484,
      "grad_norm": 0.39219873771397795,
      "learning_rate": 4.828901924017679e-05,
      "loss": 1.7792,
      "num_input_tokens_seen": 10611112880,
      "step": 13487
    },
    {
      "epoch": 1.4309357097390198,
      "grad_norm": 0.3925405145793819,
      "learning_rate": 4.828876655048066e-05,
      "loss": 1.6911,
      "num_input_tokens_seen": 10611899632,
      "step": 13488
    },
    {
      "epoch": 1.431041799278591,
      "grad_norm": 0.39746885869023607,
      "learning_rate": 4.828851384278765e-05,
      "loss": 1.7873,
      "num_input_tokens_seen": 10612686288,
      "step": 13489
    },
    {
      "epoch": 1.4311478888181626,
      "grad_norm": 0.4245866807848081,
      "learning_rate": 4.8288261117097965e-05,
      "loss": 1.6777,
      "num_input_tokens_seen": 10613473104,
      "step": 13490
    },
    {
      "epoch": 1.4312539783577338,
      "grad_norm": 0.5282365022420537,
      "learning_rate": 4.8288008373411796e-05,
      "loss": 1.6632,
      "num_input_tokens_seen": 10614259920,
      "step": 13491
    },
    {
      "epoch": 1.4313600678973053,
      "grad_norm": 0.3878707787107842,
      "learning_rate": 4.8287755611729335e-05,
      "loss": 1.7948,
      "num_input_tokens_seen": 10615046656,
      "step": 13492
    },
    {
      "epoch": 1.4314661574368768,
      "grad_norm": 0.7301983518394515,
      "learning_rate": 4.828750283205078e-05,
      "loss": 1.9218,
      "num_input_tokens_seen": 10615833296,
      "step": 13493
    },
    {
      "epoch": 1.4315722469764482,
      "grad_norm": 0.4508409702227326,
      "learning_rate": 4.828725003437633e-05,
      "loss": 1.8832,
      "num_input_tokens_seen": 10616620000,
      "step": 13494
    },
    {
      "epoch": 1.4316783365160195,
      "grad_norm": 0.6729779116709192,
      "learning_rate": 4.8286997218706176e-05,
      "loss": 1.6812,
      "num_input_tokens_seen": 10617406768,
      "step": 13495
    },
    {
      "epoch": 1.431784426055591,
      "grad_norm": 0.45353507007962635,
      "learning_rate": 4.8286744385040503e-05,
      "loss": 1.7123,
      "num_input_tokens_seen": 10618193520,
      "step": 13496
    },
    {
      "epoch": 1.4318905155951622,
      "grad_norm": 0.483803832449218,
      "learning_rate": 4.828649153337953e-05,
      "loss": 1.7353,
      "num_input_tokens_seen": 10618980224,
      "step": 13497
    },
    {
      "epoch": 1.4319966051347337,
      "grad_norm": 0.3928762201253598,
      "learning_rate": 4.828623866372344e-05,
      "loss": 1.7344,
      "num_input_tokens_seen": 10619766912,
      "step": 13498
    },
    {
      "epoch": 1.4321026946743052,
      "grad_norm": 0.420394559683254,
      "learning_rate": 4.828598577607242e-05,
      "loss": 1.6746,
      "num_input_tokens_seen": 10620553728,
      "step": 13499
    },
    {
      "epoch": 1.4322087842138764,
      "grad_norm": 0.41500769644836744,
      "learning_rate": 4.828573287042667e-05,
      "loss": 1.9018,
      "num_input_tokens_seen": 10621340464,
      "step": 13500
    },
    {
      "epoch": 1.432314873753448,
      "grad_norm": 0.4295136859747153,
      "learning_rate": 4.828547994678639e-05,
      "loss": 1.7127,
      "num_input_tokens_seen": 10622127200,
      "step": 13501
    },
    {
      "epoch": 1.4324209632930194,
      "grad_norm": 0.3801847802949842,
      "learning_rate": 4.828522700515179e-05,
      "loss": 1.8035,
      "num_input_tokens_seen": 10622914000,
      "step": 13502
    },
    {
      "epoch": 1.4325270528325906,
      "grad_norm": 0.3525501960004174,
      "learning_rate": 4.828497404552303e-05,
      "loss": 1.6246,
      "num_input_tokens_seen": 10623700832,
      "step": 13503
    },
    {
      "epoch": 1.432633142372162,
      "grad_norm": 0.38861526572567057,
      "learning_rate": 4.828472106790034e-05,
      "loss": 1.8778,
      "num_input_tokens_seen": 10624487648,
      "step": 13504
    },
    {
      "epoch": 1.4327392319117336,
      "grad_norm": 0.3473125759310212,
      "learning_rate": 4.8284468072283895e-05,
      "loss": 1.6647,
      "num_input_tokens_seen": 10625274368,
      "step": 13505
    },
    {
      "epoch": 1.4328453214513048,
      "grad_norm": 0.4558820383545445,
      "learning_rate": 4.82842150586739e-05,
      "loss": 1.8454,
      "num_input_tokens_seen": 10626061072,
      "step": 13506
    },
    {
      "epoch": 1.4329514109908763,
      "grad_norm": 0.37471807615168423,
      "learning_rate": 4.828396202707054e-05,
      "loss": 1.7787,
      "num_input_tokens_seen": 10626847776,
      "step": 13507
    },
    {
      "epoch": 1.4330575005304478,
      "grad_norm": 0.3753727208277625,
      "learning_rate": 4.828370897747402e-05,
      "loss": 1.6653,
      "num_input_tokens_seen": 10627634528,
      "step": 13508
    },
    {
      "epoch": 1.433163590070019,
      "grad_norm": 0.5184660660075229,
      "learning_rate": 4.8283455909884537e-05,
      "loss": 1.7792,
      "num_input_tokens_seen": 10628421232,
      "step": 13509
    },
    {
      "epoch": 1.4332696796095905,
      "grad_norm": 0.5062408346878798,
      "learning_rate": 4.8283202824302274e-05,
      "loss": 1.8286,
      "num_input_tokens_seen": 10629208064,
      "step": 13510
    },
    {
      "epoch": 1.433375769149162,
      "grad_norm": 0.38849455459209775,
      "learning_rate": 4.8282949720727445e-05,
      "loss": 1.6959,
      "num_input_tokens_seen": 10629994832,
      "step": 13511
    },
    {
      "epoch": 1.4334818586887332,
      "grad_norm": 0.3684685879338517,
      "learning_rate": 4.828269659916023e-05,
      "loss": 1.7366,
      "num_input_tokens_seen": 10630781680,
      "step": 13512
    },
    {
      "epoch": 1.4335879482283047,
      "grad_norm": 0.43585252326472407,
      "learning_rate": 4.8282443459600824e-05,
      "loss": 1.7479,
      "num_input_tokens_seen": 10631568448,
      "step": 13513
    },
    {
      "epoch": 1.433694037767876,
      "grad_norm": 0.3944376993667703,
      "learning_rate": 4.828219030204944e-05,
      "loss": 1.7236,
      "num_input_tokens_seen": 10632355232,
      "step": 13514
    },
    {
      "epoch": 1.4338001273074474,
      "grad_norm": 0.45729008998640286,
      "learning_rate": 4.828193712650626e-05,
      "loss": 1.718,
      "num_input_tokens_seen": 10633142064,
      "step": 13515
    },
    {
      "epoch": 1.433906216847019,
      "grad_norm": 0.3823300821846075,
      "learning_rate": 4.8281683932971476e-05,
      "loss": 1.7867,
      "num_input_tokens_seen": 10633928864,
      "step": 13516
    },
    {
      "epoch": 1.4340123063865904,
      "grad_norm": 0.4108949767121525,
      "learning_rate": 4.82814307214453e-05,
      "loss": 1.7886,
      "num_input_tokens_seen": 10634715520,
      "step": 13517
    },
    {
      "epoch": 1.4341183959261616,
      "grad_norm": 0.3602726199527549,
      "learning_rate": 4.828117749192791e-05,
      "loss": 1.7719,
      "num_input_tokens_seen": 10635502224,
      "step": 13518
    },
    {
      "epoch": 1.4342244854657331,
      "grad_norm": 0.3706450507193531,
      "learning_rate": 4.828092424441951e-05,
      "loss": 1.7756,
      "num_input_tokens_seen": 10636289072,
      "step": 13519
    },
    {
      "epoch": 1.4343305750053044,
      "grad_norm": 0.4705344594134021,
      "learning_rate": 4.828067097892029e-05,
      "loss": 1.8119,
      "num_input_tokens_seen": 10637075888,
      "step": 13520
    },
    {
      "epoch": 1.4344366645448758,
      "grad_norm": 0.5964187285424947,
      "learning_rate": 4.828041769543046e-05,
      "loss": 1.8491,
      "num_input_tokens_seen": 10637862656,
      "step": 13521
    },
    {
      "epoch": 1.4345427540844473,
      "grad_norm": 0.4599553021155363,
      "learning_rate": 4.82801643939502e-05,
      "loss": 1.6755,
      "num_input_tokens_seen": 10638649344,
      "step": 13522
    },
    {
      "epoch": 1.4346488436240188,
      "grad_norm": 0.6498259426697578,
      "learning_rate": 4.827991107447971e-05,
      "loss": 1.6855,
      "num_input_tokens_seen": 10639436032,
      "step": 13523
    },
    {
      "epoch": 1.43475493316359,
      "grad_norm": 0.4382282106359244,
      "learning_rate": 4.82796577370192e-05,
      "loss": 1.7451,
      "num_input_tokens_seen": 10640222720,
      "step": 13524
    },
    {
      "epoch": 1.4348610227031615,
      "grad_norm": 0.518960297599318,
      "learning_rate": 4.827940438156884e-05,
      "loss": 1.7122,
      "num_input_tokens_seen": 10641009488,
      "step": 13525
    },
    {
      "epoch": 1.4349671122427328,
      "grad_norm": 0.45640303226674506,
      "learning_rate": 4.827915100812885e-05,
      "loss": 1.7992,
      "num_input_tokens_seen": 10641796208,
      "step": 13526
    },
    {
      "epoch": 1.4350732017823042,
      "grad_norm": 0.516099549788494,
      "learning_rate": 4.827889761669941e-05,
      "loss": 1.7459,
      "num_input_tokens_seen": 10642582960,
      "step": 13527
    },
    {
      "epoch": 1.4351792913218757,
      "grad_norm": 0.40620208088327653,
      "learning_rate": 4.827864420728072e-05,
      "loss": 1.8399,
      "num_input_tokens_seen": 10643369648,
      "step": 13528
    },
    {
      "epoch": 1.4352853808614472,
      "grad_norm": 0.3672063062326753,
      "learning_rate": 4.827839077987298e-05,
      "loss": 1.5789,
      "num_input_tokens_seen": 10644156384,
      "step": 13529
    },
    {
      "epoch": 1.4353914704010184,
      "grad_norm": 0.4345387362947353,
      "learning_rate": 4.827813733447638e-05,
      "loss": 1.7823,
      "num_input_tokens_seen": 10644943152,
      "step": 13530
    },
    {
      "epoch": 1.43549755994059,
      "grad_norm": 0.4710070677759088,
      "learning_rate": 4.8277883871091117e-05,
      "loss": 1.967,
      "num_input_tokens_seen": 10645729888,
      "step": 13531
    },
    {
      "epoch": 1.4356036494801612,
      "grad_norm": 0.49450528838775154,
      "learning_rate": 4.827763038971739e-05,
      "loss": 1.6863,
      "num_input_tokens_seen": 10646516688,
      "step": 13532
    },
    {
      "epoch": 1.4357097390197326,
      "grad_norm": 0.41234173557982656,
      "learning_rate": 4.82773768903554e-05,
      "loss": 1.7818,
      "num_input_tokens_seen": 10647303424,
      "step": 13533
    },
    {
      "epoch": 1.4358158285593041,
      "grad_norm": 0.48809207996595305,
      "learning_rate": 4.8277123373005326e-05,
      "loss": 1.9409,
      "num_input_tokens_seen": 10648090256,
      "step": 13534
    },
    {
      "epoch": 1.4359219180988754,
      "grad_norm": 0.39332608310336536,
      "learning_rate": 4.827686983766737e-05,
      "loss": 1.7772,
      "num_input_tokens_seen": 10648876960,
      "step": 13535
    },
    {
      "epoch": 1.4360280076384468,
      "grad_norm": 0.3609659514286417,
      "learning_rate": 4.8276616284341745e-05,
      "loss": 1.7447,
      "num_input_tokens_seen": 10649663728,
      "step": 13536
    },
    {
      "epoch": 1.4361340971780183,
      "grad_norm": 0.3750159043556773,
      "learning_rate": 4.827636271302863e-05,
      "loss": 1.7111,
      "num_input_tokens_seen": 10650450464,
      "step": 13537
    },
    {
      "epoch": 1.4362401867175896,
      "grad_norm": 0.4098646538395927,
      "learning_rate": 4.827610912372822e-05,
      "loss": 1.7641,
      "num_input_tokens_seen": 10651237168,
      "step": 13538
    },
    {
      "epoch": 1.436346276257161,
      "grad_norm": 0.3766721880476081,
      "learning_rate": 4.8275855516440724e-05,
      "loss": 1.765,
      "num_input_tokens_seen": 10652023968,
      "step": 13539
    },
    {
      "epoch": 1.4364523657967325,
      "grad_norm": 0.4998524638497446,
      "learning_rate": 4.8275601891166323e-05,
      "loss": 1.9225,
      "num_input_tokens_seen": 10652810672,
      "step": 13540
    },
    {
      "epoch": 1.4365584553363038,
      "grad_norm": 0.37100428144640163,
      "learning_rate": 4.8275348247905225e-05,
      "loss": 1.7644,
      "num_input_tokens_seen": 10653597376,
      "step": 13541
    },
    {
      "epoch": 1.4366645448758752,
      "grad_norm": 0.4531767226873175,
      "learning_rate": 4.827509458665761e-05,
      "loss": 1.7972,
      "num_input_tokens_seen": 10654384080,
      "step": 13542
    },
    {
      "epoch": 1.4367706344154465,
      "grad_norm": 0.38910899923180664,
      "learning_rate": 4.8274840907423696e-05,
      "loss": 1.8098,
      "num_input_tokens_seen": 10655170848,
      "step": 13543
    },
    {
      "epoch": 1.436876723955018,
      "grad_norm": 0.427511071658858,
      "learning_rate": 4.8274587210203665e-05,
      "loss": 1.812,
      "num_input_tokens_seen": 10655957600,
      "step": 13544
    },
    {
      "epoch": 1.4369828134945895,
      "grad_norm": 0.4601763403212877,
      "learning_rate": 4.8274333494997716e-05,
      "loss": 1.7864,
      "num_input_tokens_seen": 10656744352,
      "step": 13545
    },
    {
      "epoch": 1.437088903034161,
      "grad_norm": 0.44951397447077285,
      "learning_rate": 4.8274079761806046e-05,
      "loss": 1.7604,
      "num_input_tokens_seen": 10657531056,
      "step": 13546
    },
    {
      "epoch": 1.4371949925737322,
      "grad_norm": 0.3869486565659907,
      "learning_rate": 4.827382601062885e-05,
      "loss": 1.8715,
      "num_input_tokens_seen": 10658317936,
      "step": 13547
    },
    {
      "epoch": 1.4373010821133037,
      "grad_norm": 0.41918673137479806,
      "learning_rate": 4.827357224146632e-05,
      "loss": 1.7268,
      "num_input_tokens_seen": 10659104768,
      "step": 13548
    },
    {
      "epoch": 1.437407171652875,
      "grad_norm": 0.3520183860916985,
      "learning_rate": 4.8273318454318664e-05,
      "loss": 1.5912,
      "num_input_tokens_seen": 10659891648,
      "step": 13549
    },
    {
      "epoch": 1.4375132611924464,
      "grad_norm": 0.36377804488309373,
      "learning_rate": 4.827306464918606e-05,
      "loss": 1.6924,
      "num_input_tokens_seen": 10660678480,
      "step": 13550
    },
    {
      "epoch": 1.4376193507320179,
      "grad_norm": 0.39908573211017473,
      "learning_rate": 4.827281082606872e-05,
      "loss": 1.8224,
      "num_input_tokens_seen": 10661465248,
      "step": 13551
    },
    {
      "epoch": 1.4377254402715893,
      "grad_norm": 0.34376868120101506,
      "learning_rate": 4.827255698496683e-05,
      "loss": 1.7245,
      "num_input_tokens_seen": 10662251968,
      "step": 13552
    },
    {
      "epoch": 1.4378315298111606,
      "grad_norm": 0.3789033300165402,
      "learning_rate": 4.8272303125880606e-05,
      "loss": 1.738,
      "num_input_tokens_seen": 10663038688,
      "step": 13553
    },
    {
      "epoch": 1.437937619350732,
      "grad_norm": 0.38359138824017996,
      "learning_rate": 4.827204924881021e-05,
      "loss": 1.8133,
      "num_input_tokens_seen": 10663825456,
      "step": 13554
    },
    {
      "epoch": 1.4380437088903033,
      "grad_norm": 0.35456380758101963,
      "learning_rate": 4.8271795353755864e-05,
      "loss": 1.6133,
      "num_input_tokens_seen": 10664612272,
      "step": 13555
    },
    {
      "epoch": 1.4381497984298748,
      "grad_norm": 0.41095595959495385,
      "learning_rate": 4.827154144071776e-05,
      "loss": 1.8507,
      "num_input_tokens_seen": 10665398928,
      "step": 13556
    },
    {
      "epoch": 1.4382558879694463,
      "grad_norm": 0.4648336047205929,
      "learning_rate": 4.82712875096961e-05,
      "loss": 1.7841,
      "num_input_tokens_seen": 10666185648,
      "step": 13557
    },
    {
      "epoch": 1.4383619775090177,
      "grad_norm": 0.4205247707036758,
      "learning_rate": 4.827103356069106e-05,
      "loss": 1.7472,
      "num_input_tokens_seen": 10666972416,
      "step": 13558
    },
    {
      "epoch": 1.438468067048589,
      "grad_norm": 0.34865924833631967,
      "learning_rate": 4.827077959370284e-05,
      "loss": 1.9416,
      "num_input_tokens_seen": 10667759152,
      "step": 13559
    },
    {
      "epoch": 1.4385741565881605,
      "grad_norm": 0.35595329871607895,
      "learning_rate": 4.827052560873166e-05,
      "loss": 1.7705,
      "num_input_tokens_seen": 10668545872,
      "step": 13560
    },
    {
      "epoch": 1.4386802461277317,
      "grad_norm": 0.35021639037887325,
      "learning_rate": 4.8270271605777694e-05,
      "loss": 1.8035,
      "num_input_tokens_seen": 10669332720,
      "step": 13561
    },
    {
      "epoch": 1.4387863356673032,
      "grad_norm": 0.3498070778879114,
      "learning_rate": 4.8270017584841146e-05,
      "loss": 1.7878,
      "num_input_tokens_seen": 10670119440,
      "step": 13562
    },
    {
      "epoch": 1.4388924252068747,
      "grad_norm": 0.3564109689227757,
      "learning_rate": 4.8269763545922217e-05,
      "loss": 1.6131,
      "num_input_tokens_seen": 10670906272,
      "step": 13563
    },
    {
      "epoch": 1.4389985147464461,
      "grad_norm": 0.4349322076239399,
      "learning_rate": 4.826950948902109e-05,
      "loss": 1.7991,
      "num_input_tokens_seen": 10671693040,
      "step": 13564
    },
    {
      "epoch": 1.4391046042860174,
      "grad_norm": 0.37283048105808775,
      "learning_rate": 4.826925541413797e-05,
      "loss": 1.8076,
      "num_input_tokens_seen": 10672479872,
      "step": 13565
    },
    {
      "epoch": 1.4392106938255889,
      "grad_norm": 0.34116125467258557,
      "learning_rate": 4.8269001321273055e-05,
      "loss": 1.7121,
      "num_input_tokens_seen": 10673266608,
      "step": 13566
    },
    {
      "epoch": 1.4393167833651601,
      "grad_norm": 0.5679898268532712,
      "learning_rate": 4.8268747210426534e-05,
      "loss": 1.7757,
      "num_input_tokens_seen": 10674053440,
      "step": 13567
    },
    {
      "epoch": 1.4394228729047316,
      "grad_norm": 0.42814410963950256,
      "learning_rate": 4.826849308159861e-05,
      "loss": 1.6966,
      "num_input_tokens_seen": 10674840176,
      "step": 13568
    },
    {
      "epoch": 1.439528962444303,
      "grad_norm": 0.4067657232925755,
      "learning_rate": 4.826823893478948e-05,
      "loss": 1.7891,
      "num_input_tokens_seen": 10675626960,
      "step": 13569
    },
    {
      "epoch": 1.4396350519838743,
      "grad_norm": 0.3605347296381827,
      "learning_rate": 4.826798476999933e-05,
      "loss": 1.8402,
      "num_input_tokens_seen": 10676413680,
      "step": 13570
    },
    {
      "epoch": 1.4397411415234458,
      "grad_norm": 0.39945238995969695,
      "learning_rate": 4.826773058722837e-05,
      "loss": 1.784,
      "num_input_tokens_seen": 10677200416,
      "step": 13571
    },
    {
      "epoch": 1.4398472310630173,
      "grad_norm": 0.43104997765687714,
      "learning_rate": 4.826747638647679e-05,
      "loss": 1.7397,
      "num_input_tokens_seen": 10677987248,
      "step": 13572
    },
    {
      "epoch": 1.4399533206025885,
      "grad_norm": 0.45170970731355936,
      "learning_rate": 4.826722216774478e-05,
      "loss": 1.8124,
      "num_input_tokens_seen": 10678774000,
      "step": 13573
    },
    {
      "epoch": 1.44005941014216,
      "grad_norm": 0.3664373233635881,
      "learning_rate": 4.826696793103256e-05,
      "loss": 1.7914,
      "num_input_tokens_seen": 10679560848,
      "step": 13574
    },
    {
      "epoch": 1.4401654996817315,
      "grad_norm": 0.39146901098006576,
      "learning_rate": 4.82667136763403e-05,
      "loss": 1.6215,
      "num_input_tokens_seen": 10680347632,
      "step": 13575
    },
    {
      "epoch": 1.4402715892213027,
      "grad_norm": 0.4402114090433275,
      "learning_rate": 4.8266459403668205e-05,
      "loss": 1.7285,
      "num_input_tokens_seen": 10681134336,
      "step": 13576
    },
    {
      "epoch": 1.4403776787608742,
      "grad_norm": 0.339276506293148,
      "learning_rate": 4.826620511301647e-05,
      "loss": 1.6449,
      "num_input_tokens_seen": 10681921072,
      "step": 13577
    },
    {
      "epoch": 1.4404837683004454,
      "grad_norm": 0.40254661591583,
      "learning_rate": 4.8265950804385304e-05,
      "loss": 1.7637,
      "num_input_tokens_seen": 10682707856,
      "step": 13578
    },
    {
      "epoch": 1.440589857840017,
      "grad_norm": 0.3936704904356038,
      "learning_rate": 4.8265696477774894e-05,
      "loss": 1.733,
      "num_input_tokens_seen": 10683494656,
      "step": 13579
    },
    {
      "epoch": 1.4406959473795884,
      "grad_norm": 0.37320796595606187,
      "learning_rate": 4.826544213318542e-05,
      "loss": 1.7937,
      "num_input_tokens_seen": 10684281376,
      "step": 13580
    },
    {
      "epoch": 1.4408020369191599,
      "grad_norm": 0.38444708762334423,
      "learning_rate": 4.8265187770617115e-05,
      "loss": 1.8643,
      "num_input_tokens_seen": 10685068144,
      "step": 13581
    },
    {
      "epoch": 1.4409081264587311,
      "grad_norm": 0.40649377894110034,
      "learning_rate": 4.826493339007014e-05,
      "loss": 1.6308,
      "num_input_tokens_seen": 10685854960,
      "step": 13582
    },
    {
      "epoch": 1.4410142159983026,
      "grad_norm": 0.38345325151995724,
      "learning_rate": 4.8264678991544715e-05,
      "loss": 1.7289,
      "num_input_tokens_seen": 10686641760,
      "step": 13583
    },
    {
      "epoch": 1.4411203055378738,
      "grad_norm": 0.5921898792951089,
      "learning_rate": 4.826442457504103e-05,
      "loss": 1.9454,
      "num_input_tokens_seen": 10687428544,
      "step": 13584
    },
    {
      "epoch": 1.4412263950774453,
      "grad_norm": 0.4839332132380895,
      "learning_rate": 4.826417014055927e-05,
      "loss": 1.783,
      "num_input_tokens_seen": 10688215312,
      "step": 13585
    },
    {
      "epoch": 1.4413324846170168,
      "grad_norm": 0.4269002140772832,
      "learning_rate": 4.826391568809966e-05,
      "loss": 1.6953,
      "num_input_tokens_seen": 10689002144,
      "step": 13586
    },
    {
      "epoch": 1.4414385741565883,
      "grad_norm": 0.36141669246685,
      "learning_rate": 4.8263661217662365e-05,
      "loss": 1.7938,
      "num_input_tokens_seen": 10689788880,
      "step": 13587
    },
    {
      "epoch": 1.4415446636961595,
      "grad_norm": 0.4941793350088234,
      "learning_rate": 4.8263406729247594e-05,
      "loss": 1.8427,
      "num_input_tokens_seen": 10690575664,
      "step": 13588
    },
    {
      "epoch": 1.441650753235731,
      "grad_norm": 0.4153509517917395,
      "learning_rate": 4.826315222285556e-05,
      "loss": 1.8897,
      "num_input_tokens_seen": 10691362384,
      "step": 13589
    },
    {
      "epoch": 1.4417568427753022,
      "grad_norm": 0.4974087612035136,
      "learning_rate": 4.826289769848643e-05,
      "loss": 1.6781,
      "num_input_tokens_seen": 10692149136,
      "step": 13590
    },
    {
      "epoch": 1.4418629323148737,
      "grad_norm": 0.5105334804900605,
      "learning_rate": 4.826264315614042e-05,
      "loss": 1.6474,
      "num_input_tokens_seen": 10692935920,
      "step": 13591
    },
    {
      "epoch": 1.4419690218544452,
      "grad_norm": 0.5754881783947972,
      "learning_rate": 4.826238859581772e-05,
      "loss": 1.8117,
      "num_input_tokens_seen": 10693722752,
      "step": 13592
    },
    {
      "epoch": 1.4420751113940167,
      "grad_norm": 0.47637075461205,
      "learning_rate": 4.8262134017518525e-05,
      "loss": 1.6826,
      "num_input_tokens_seen": 10694509520,
      "step": 13593
    },
    {
      "epoch": 1.442181200933588,
      "grad_norm": 0.40471077753627305,
      "learning_rate": 4.826187942124304e-05,
      "loss": 1.8208,
      "num_input_tokens_seen": 10695296288,
      "step": 13594
    },
    {
      "epoch": 1.4422872904731594,
      "grad_norm": 0.5297427503705437,
      "learning_rate": 4.8261624806991455e-05,
      "loss": 1.8735,
      "num_input_tokens_seen": 10696083024,
      "step": 13595
    },
    {
      "epoch": 1.4423933800127307,
      "grad_norm": 0.5337412774024689,
      "learning_rate": 4.8261370174763974e-05,
      "loss": 1.9415,
      "num_input_tokens_seen": 10696869760,
      "step": 13596
    },
    {
      "epoch": 1.4424994695523021,
      "grad_norm": 0.5148626148897085,
      "learning_rate": 4.826111552456079e-05,
      "loss": 1.8263,
      "num_input_tokens_seen": 10697656464,
      "step": 13597
    },
    {
      "epoch": 1.4426055590918736,
      "grad_norm": 0.6453576013752285,
      "learning_rate": 4.826086085638209e-05,
      "loss": 1.7881,
      "num_input_tokens_seen": 10698443184,
      "step": 13598
    },
    {
      "epoch": 1.442711648631445,
      "grad_norm": 0.47463017820021297,
      "learning_rate": 4.826060617022808e-05,
      "loss": 1.7094,
      "num_input_tokens_seen": 10699229984,
      "step": 13599
    },
    {
      "epoch": 1.4428177381710163,
      "grad_norm": 0.95467107793639,
      "learning_rate": 4.8260351466098963e-05,
      "loss": 1.8686,
      "num_input_tokens_seen": 10700016752,
      "step": 13600
    },
    {
      "epoch": 1.4429238277105878,
      "grad_norm": 0.8701866027651702,
      "learning_rate": 4.8260096743994924e-05,
      "loss": 1.7222,
      "num_input_tokens_seen": 10700803584,
      "step": 13601
    },
    {
      "epoch": 1.443029917250159,
      "grad_norm": 0.5987852519083469,
      "learning_rate": 4.825984200391617e-05,
      "loss": 1.7568,
      "num_input_tokens_seen": 10701590352,
      "step": 13602
    },
    {
      "epoch": 1.4431360067897305,
      "grad_norm": 0.44326587478289764,
      "learning_rate": 4.8259587245862886e-05,
      "loss": 1.6475,
      "num_input_tokens_seen": 10702377088,
      "step": 13603
    },
    {
      "epoch": 1.443242096329302,
      "grad_norm": 0.5328984356396557,
      "learning_rate": 4.825933246983528e-05,
      "loss": 1.7122,
      "num_input_tokens_seen": 10703163856,
      "step": 13604
    },
    {
      "epoch": 1.4433481858688733,
      "grad_norm": 0.6001481102043842,
      "learning_rate": 4.825907767583354e-05,
      "loss": 1.7823,
      "num_input_tokens_seen": 10703950560,
      "step": 13605
    },
    {
      "epoch": 1.4434542754084447,
      "grad_norm": 0.5142589178475906,
      "learning_rate": 4.825882286385787e-05,
      "loss": 1.783,
      "num_input_tokens_seen": 10704737296,
      "step": 13606
    },
    {
      "epoch": 1.4435603649480162,
      "grad_norm": 0.5081048639573553,
      "learning_rate": 4.825856803390846e-05,
      "loss": 1.7138,
      "num_input_tokens_seen": 10705524080,
      "step": 13607
    },
    {
      "epoch": 1.4436664544875875,
      "grad_norm": 0.47205740995923534,
      "learning_rate": 4.825831318598552e-05,
      "loss": 1.7653,
      "num_input_tokens_seen": 10706310832,
      "step": 13608
    },
    {
      "epoch": 1.443772544027159,
      "grad_norm": 0.47599971461500873,
      "learning_rate": 4.825805832008923e-05,
      "loss": 1.8769,
      "num_input_tokens_seen": 10707097536,
      "step": 13609
    },
    {
      "epoch": 1.4438786335667304,
      "grad_norm": 0.5365162346856627,
      "learning_rate": 4.82578034362198e-05,
      "loss": 1.7745,
      "num_input_tokens_seen": 10707884304,
      "step": 13610
    },
    {
      "epoch": 1.4439847231063017,
      "grad_norm": 0.45052397761506746,
      "learning_rate": 4.8257548534377414e-05,
      "loss": 1.8872,
      "num_input_tokens_seen": 10708671024,
      "step": 13611
    },
    {
      "epoch": 1.4440908126458731,
      "grad_norm": 0.37918061735263453,
      "learning_rate": 4.8257293614562285e-05,
      "loss": 1.7797,
      "num_input_tokens_seen": 10709457808,
      "step": 13612
    },
    {
      "epoch": 1.4441969021854444,
      "grad_norm": 0.4532795845170089,
      "learning_rate": 4.82570386767746e-05,
      "loss": 1.6925,
      "num_input_tokens_seen": 10710244592,
      "step": 13613
    },
    {
      "epoch": 1.4443029917250159,
      "grad_norm": 0.3966115530922979,
      "learning_rate": 4.825678372101456e-05,
      "loss": 1.8199,
      "num_input_tokens_seen": 10711031392,
      "step": 13614
    },
    {
      "epoch": 1.4444090812645873,
      "grad_norm": 0.42153542745466005,
      "learning_rate": 4.825652874728236e-05,
      "loss": 1.6383,
      "num_input_tokens_seen": 10711818192,
      "step": 13615
    },
    {
      "epoch": 1.4445151708041588,
      "grad_norm": 0.5266932739077899,
      "learning_rate": 4.825627375557819e-05,
      "loss": 1.722,
      "num_input_tokens_seen": 10712604912,
      "step": 13616
    },
    {
      "epoch": 1.44462126034373,
      "grad_norm": 0.401688577410795,
      "learning_rate": 4.825601874590226e-05,
      "loss": 1.6662,
      "num_input_tokens_seen": 10713391760,
      "step": 13617
    },
    {
      "epoch": 1.4447273498833015,
      "grad_norm": 0.7458369752846638,
      "learning_rate": 4.825576371825476e-05,
      "loss": 1.7931,
      "num_input_tokens_seen": 10714178560,
      "step": 13618
    },
    {
      "epoch": 1.4448334394228728,
      "grad_norm": 0.42062384462452573,
      "learning_rate": 4.8255508672635885e-05,
      "loss": 1.6212,
      "num_input_tokens_seen": 10714965424,
      "step": 13619
    },
    {
      "epoch": 1.4449395289624443,
      "grad_norm": 0.7287667006035086,
      "learning_rate": 4.825525360904584e-05,
      "loss": 1.8459,
      "num_input_tokens_seen": 10715752256,
      "step": 13620
    },
    {
      "epoch": 1.4450456185020157,
      "grad_norm": 0.5911624005948202,
      "learning_rate": 4.825499852748482e-05,
      "loss": 1.8395,
      "num_input_tokens_seen": 10716538960,
      "step": 13621
    },
    {
      "epoch": 1.4451517080415872,
      "grad_norm": 0.4922392221309975,
      "learning_rate": 4.825474342795301e-05,
      "loss": 1.7401,
      "num_input_tokens_seen": 10717325792,
      "step": 13622
    },
    {
      "epoch": 1.4452577975811585,
      "grad_norm": 0.7797940368080026,
      "learning_rate": 4.825448831045062e-05,
      "loss": 1.7845,
      "num_input_tokens_seen": 10718112592,
      "step": 13623
    },
    {
      "epoch": 1.44536388712073,
      "grad_norm": 0.5404613735291932,
      "learning_rate": 4.825423317497785e-05,
      "loss": 1.8875,
      "num_input_tokens_seen": 10718899312,
      "step": 13624
    },
    {
      "epoch": 1.4454699766603012,
      "grad_norm": 0.42337123156656764,
      "learning_rate": 4.825397802153489e-05,
      "loss": 1.7877,
      "num_input_tokens_seen": 10719686064,
      "step": 13625
    },
    {
      "epoch": 1.4455760661998727,
      "grad_norm": 0.4291743528055961,
      "learning_rate": 4.825372285012193e-05,
      "loss": 1.7924,
      "num_input_tokens_seen": 10720472800,
      "step": 13626
    },
    {
      "epoch": 1.4456821557394441,
      "grad_norm": 0.4893956227564528,
      "learning_rate": 4.8253467660739175e-05,
      "loss": 1.8466,
      "num_input_tokens_seen": 10721259552,
      "step": 13627
    },
    {
      "epoch": 1.4457882452790156,
      "grad_norm": 0.42076678515569144,
      "learning_rate": 4.8253212453386826e-05,
      "loss": 1.7768,
      "num_input_tokens_seen": 10722046336,
      "step": 13628
    },
    {
      "epoch": 1.4458943348185869,
      "grad_norm": 0.425244842475523,
      "learning_rate": 4.8252957228065074e-05,
      "loss": 1.7785,
      "num_input_tokens_seen": 10722833088,
      "step": 13629
    },
    {
      "epoch": 1.4460004243581583,
      "grad_norm": 0.4813892979101254,
      "learning_rate": 4.825270198477413e-05,
      "loss": 1.7757,
      "num_input_tokens_seen": 10723619872,
      "step": 13630
    },
    {
      "epoch": 1.4461065138977296,
      "grad_norm": 0.3657493151843459,
      "learning_rate": 4.825244672351417e-05,
      "loss": 1.7351,
      "num_input_tokens_seen": 10724406560,
      "step": 13631
    },
    {
      "epoch": 1.446212603437301,
      "grad_norm": 0.4652324663420457,
      "learning_rate": 4.8252191444285404e-05,
      "loss": 1.8175,
      "num_input_tokens_seen": 10725193296,
      "step": 13632
    },
    {
      "epoch": 1.4463186929768725,
      "grad_norm": 0.46434269797561356,
      "learning_rate": 4.8251936147088027e-05,
      "loss": 1.8588,
      "num_input_tokens_seen": 10725980016,
      "step": 13633
    },
    {
      "epoch": 1.4464247825164438,
      "grad_norm": 0.5122811187554325,
      "learning_rate": 4.8251680831922235e-05,
      "loss": 1.8202,
      "num_input_tokens_seen": 10726766896,
      "step": 13634
    },
    {
      "epoch": 1.4465308720560153,
      "grad_norm": 0.43185570261097717,
      "learning_rate": 4.8251425498788224e-05,
      "loss": 1.7605,
      "num_input_tokens_seen": 10727553648,
      "step": 13635
    },
    {
      "epoch": 1.4466369615955867,
      "grad_norm": 0.4071697550993003,
      "learning_rate": 4.82511701476862e-05,
      "loss": 1.8304,
      "num_input_tokens_seen": 10728340432,
      "step": 13636
    },
    {
      "epoch": 1.446743051135158,
      "grad_norm": 0.39829177709999253,
      "learning_rate": 4.825091477861635e-05,
      "loss": 1.6831,
      "num_input_tokens_seen": 10729127104,
      "step": 13637
    },
    {
      "epoch": 1.4468491406747295,
      "grad_norm": 0.4092405562781706,
      "learning_rate": 4.8250659391578876e-05,
      "loss": 1.7514,
      "num_input_tokens_seen": 10729913792,
      "step": 13638
    },
    {
      "epoch": 1.446955230214301,
      "grad_norm": 0.4162668776601765,
      "learning_rate": 4.825040398657398e-05,
      "loss": 1.6175,
      "num_input_tokens_seen": 10730700704,
      "step": 13639
    },
    {
      "epoch": 1.4470613197538722,
      "grad_norm": 0.38193010365232327,
      "learning_rate": 4.825014856360185e-05,
      "loss": 1.6803,
      "num_input_tokens_seen": 10731487520,
      "step": 13640
    },
    {
      "epoch": 1.4471674092934437,
      "grad_norm": 0.38493348211984624,
      "learning_rate": 4.8249893122662684e-05,
      "loss": 1.7441,
      "num_input_tokens_seen": 10732274352,
      "step": 13641
    },
    {
      "epoch": 1.447273498833015,
      "grad_norm": 0.34692870234910683,
      "learning_rate": 4.824963766375669e-05,
      "loss": 1.7209,
      "num_input_tokens_seen": 10733061200,
      "step": 13642
    },
    {
      "epoch": 1.4473795883725864,
      "grad_norm": 0.37248533102721526,
      "learning_rate": 4.824938218688405e-05,
      "loss": 1.7582,
      "num_input_tokens_seen": 10733848032,
      "step": 13643
    },
    {
      "epoch": 1.4474856779121579,
      "grad_norm": 0.36913648698674156,
      "learning_rate": 4.824912669204497e-05,
      "loss": 1.8544,
      "num_input_tokens_seen": 10734634704,
      "step": 13644
    },
    {
      "epoch": 1.4475917674517293,
      "grad_norm": 0.43785756215660304,
      "learning_rate": 4.824887117923965e-05,
      "loss": 1.8006,
      "num_input_tokens_seen": 10735421424,
      "step": 13645
    },
    {
      "epoch": 1.4476978569913006,
      "grad_norm": 0.3915043443206759,
      "learning_rate": 4.8248615648468284e-05,
      "loss": 1.6923,
      "num_input_tokens_seen": 10736208192,
      "step": 13646
    },
    {
      "epoch": 1.447803946530872,
      "grad_norm": 0.36360570725423885,
      "learning_rate": 4.824836009973107e-05,
      "loss": 1.876,
      "num_input_tokens_seen": 10736994944,
      "step": 13647
    },
    {
      "epoch": 1.4479100360704433,
      "grad_norm": 0.4097425100180325,
      "learning_rate": 4.8248104533028205e-05,
      "loss": 1.7615,
      "num_input_tokens_seen": 10737781600,
      "step": 13648
    },
    {
      "epoch": 1.4480161256100148,
      "grad_norm": 0.37974770757840964,
      "learning_rate": 4.824784894835989e-05,
      "loss": 1.7847,
      "num_input_tokens_seen": 10738568400,
      "step": 13649
    },
    {
      "epoch": 1.4481222151495863,
      "grad_norm": 0.3661856483223459,
      "learning_rate": 4.824759334572632e-05,
      "loss": 1.9147,
      "num_input_tokens_seen": 10739355184,
      "step": 13650
    },
    {
      "epoch": 1.4482283046891578,
      "grad_norm": 0.40887754733312387,
      "learning_rate": 4.8247337725127683e-05,
      "loss": 1.7086,
      "num_input_tokens_seen": 10740141856,
      "step": 13651
    },
    {
      "epoch": 1.448334394228729,
      "grad_norm": 0.4112805583328863,
      "learning_rate": 4.824708208656419e-05,
      "loss": 1.8632,
      "num_input_tokens_seen": 10740928608,
      "step": 13652
    },
    {
      "epoch": 1.4484404837683005,
      "grad_norm": 0.3527693188678663,
      "learning_rate": 4.8246826430036044e-05,
      "loss": 1.6576,
      "num_input_tokens_seen": 10741715424,
      "step": 13653
    },
    {
      "epoch": 1.4485465733078717,
      "grad_norm": 0.47071568322814167,
      "learning_rate": 4.824657075554342e-05,
      "loss": 1.6706,
      "num_input_tokens_seen": 10742502224,
      "step": 13654
    },
    {
      "epoch": 1.4486526628474432,
      "grad_norm": 0.35287298571530124,
      "learning_rate": 4.824631506308653e-05,
      "loss": 1.8212,
      "num_input_tokens_seen": 10743289024,
      "step": 13655
    },
    {
      "epoch": 1.4487587523870147,
      "grad_norm": 0.4621377488296051,
      "learning_rate": 4.8246059352665576e-05,
      "loss": 1.7469,
      "num_input_tokens_seen": 10744075696,
      "step": 13656
    },
    {
      "epoch": 1.4488648419265862,
      "grad_norm": 0.39824722864881984,
      "learning_rate": 4.824580362428074e-05,
      "loss": 1.9111,
      "num_input_tokens_seen": 10744862400,
      "step": 13657
    },
    {
      "epoch": 1.4489709314661574,
      "grad_norm": 0.34029669816363844,
      "learning_rate": 4.824554787793224e-05,
      "loss": 1.7515,
      "num_input_tokens_seen": 10745649136,
      "step": 13658
    },
    {
      "epoch": 1.4490770210057289,
      "grad_norm": 0.43926611850701053,
      "learning_rate": 4.8245292113620256e-05,
      "loss": 1.8056,
      "num_input_tokens_seen": 10746435920,
      "step": 13659
    },
    {
      "epoch": 1.4491831105453001,
      "grad_norm": 0.32975191697953854,
      "learning_rate": 4.824503633134499e-05,
      "loss": 1.7293,
      "num_input_tokens_seen": 10747222672,
      "step": 13660
    },
    {
      "epoch": 1.4492892000848716,
      "grad_norm": 0.38233125322709405,
      "learning_rate": 4.824478053110665e-05,
      "loss": 1.781,
      "num_input_tokens_seen": 10748009424,
      "step": 13661
    },
    {
      "epoch": 1.449395289624443,
      "grad_norm": 0.3894497339885069,
      "learning_rate": 4.824452471290542e-05,
      "loss": 1.9267,
      "num_input_tokens_seen": 10748796128,
      "step": 13662
    },
    {
      "epoch": 1.4495013791640146,
      "grad_norm": 0.3537928525499892,
      "learning_rate": 4.8244268876741504e-05,
      "loss": 1.8199,
      "num_input_tokens_seen": 10749582960,
      "step": 13663
    },
    {
      "epoch": 1.4496074687035858,
      "grad_norm": 0.3825645141730453,
      "learning_rate": 4.82440130226151e-05,
      "loss": 1.7777,
      "num_input_tokens_seen": 10750369664,
      "step": 13664
    },
    {
      "epoch": 1.4497135582431573,
      "grad_norm": 0.38559461129748596,
      "learning_rate": 4.8243757150526404e-05,
      "loss": 1.7565,
      "num_input_tokens_seen": 10751156448,
      "step": 13665
    },
    {
      "epoch": 1.4498196477827285,
      "grad_norm": 0.4167999560260042,
      "learning_rate": 4.824350126047562e-05,
      "loss": 1.7229,
      "num_input_tokens_seen": 10751943152,
      "step": 13666
    },
    {
      "epoch": 1.4499257373223,
      "grad_norm": 0.39967811972769696,
      "learning_rate": 4.824324535246293e-05,
      "loss": 1.7032,
      "num_input_tokens_seen": 10752729984,
      "step": 13667
    },
    {
      "epoch": 1.4500318268618715,
      "grad_norm": 0.40429340853855306,
      "learning_rate": 4.824298942648855e-05,
      "loss": 1.7846,
      "num_input_tokens_seen": 10753516704,
      "step": 13668
    },
    {
      "epoch": 1.4501379164014427,
      "grad_norm": 0.34156538190356955,
      "learning_rate": 4.8242733482552666e-05,
      "loss": 1.7342,
      "num_input_tokens_seen": 10754303456,
      "step": 13669
    },
    {
      "epoch": 1.4502440059410142,
      "grad_norm": 0.3953337292686685,
      "learning_rate": 4.824247752065548e-05,
      "loss": 1.778,
      "num_input_tokens_seen": 10755090192,
      "step": 13670
    },
    {
      "epoch": 1.4503500954805857,
      "grad_norm": 0.38681077961207816,
      "learning_rate": 4.824222154079719e-05,
      "loss": 1.6977,
      "num_input_tokens_seen": 10755876896,
      "step": 13671
    },
    {
      "epoch": 1.450456185020157,
      "grad_norm": 0.43215081674130784,
      "learning_rate": 4.8241965542977997e-05,
      "loss": 1.6479,
      "num_input_tokens_seen": 10756663696,
      "step": 13672
    },
    {
      "epoch": 1.4505622745597284,
      "grad_norm": 0.40012554748894197,
      "learning_rate": 4.8241709527198084e-05,
      "loss": 1.7658,
      "num_input_tokens_seen": 10757450512,
      "step": 13673
    },
    {
      "epoch": 1.4506683640993,
      "grad_norm": 0.3877254443845753,
      "learning_rate": 4.8241453493457665e-05,
      "loss": 1.8513,
      "num_input_tokens_seen": 10758237248,
      "step": 13674
    },
    {
      "epoch": 1.4507744536388711,
      "grad_norm": 0.3900277202151307,
      "learning_rate": 4.8241197441756935e-05,
      "loss": 1.7178,
      "num_input_tokens_seen": 10759024032,
      "step": 13675
    },
    {
      "epoch": 1.4508805431784426,
      "grad_norm": 0.3584261436109828,
      "learning_rate": 4.824094137209609e-05,
      "loss": 1.7572,
      "num_input_tokens_seen": 10759810768,
      "step": 13676
    },
    {
      "epoch": 1.4509866327180139,
      "grad_norm": 0.3681855504283665,
      "learning_rate": 4.824068528447533e-05,
      "loss": 1.6823,
      "num_input_tokens_seen": 10760597504,
      "step": 13677
    },
    {
      "epoch": 1.4510927222575853,
      "grad_norm": 0.32884616441606257,
      "learning_rate": 4.824042917889485e-05,
      "loss": 1.608,
      "num_input_tokens_seen": 10761384304,
      "step": 13678
    },
    {
      "epoch": 1.4511988117971568,
      "grad_norm": 0.3246521309749842,
      "learning_rate": 4.824017305535484e-05,
      "loss": 1.6438,
      "num_input_tokens_seen": 10762171120,
      "step": 13679
    },
    {
      "epoch": 1.4513049013367283,
      "grad_norm": 0.3166876930399292,
      "learning_rate": 4.823991691385551e-05,
      "loss": 1.6572,
      "num_input_tokens_seen": 10762957856,
      "step": 13680
    },
    {
      "epoch": 1.4514109908762995,
      "grad_norm": 0.40181599447306254,
      "learning_rate": 4.8239660754397056e-05,
      "loss": 1.7753,
      "num_input_tokens_seen": 10763744608,
      "step": 13681
    },
    {
      "epoch": 1.451517080415871,
      "grad_norm": 0.31168422695772097,
      "learning_rate": 4.8239404576979676e-05,
      "loss": 1.6035,
      "num_input_tokens_seen": 10764531472,
      "step": 13682
    },
    {
      "epoch": 1.4516231699554423,
      "grad_norm": 0.3976067882105577,
      "learning_rate": 4.8239148381603564e-05,
      "loss": 1.7194,
      "num_input_tokens_seen": 10765318192,
      "step": 13683
    },
    {
      "epoch": 1.4517292594950137,
      "grad_norm": 0.35807641643409616,
      "learning_rate": 4.823889216826892e-05,
      "loss": 1.7336,
      "num_input_tokens_seen": 10766104896,
      "step": 13684
    },
    {
      "epoch": 1.4518353490345852,
      "grad_norm": 0.4386880078481639,
      "learning_rate": 4.823863593697594e-05,
      "loss": 1.7253,
      "num_input_tokens_seen": 10766891632,
      "step": 13685
    },
    {
      "epoch": 1.4519414385741567,
      "grad_norm": 0.5250375791989002,
      "learning_rate": 4.8238379687724825e-05,
      "loss": 1.65,
      "num_input_tokens_seen": 10767678400,
      "step": 13686
    },
    {
      "epoch": 1.452047528113728,
      "grad_norm": 0.4365210094046356,
      "learning_rate": 4.8238123420515766e-05,
      "loss": 1.8942,
      "num_input_tokens_seen": 10768465120,
      "step": 13687
    },
    {
      "epoch": 1.4521536176532994,
      "grad_norm": 0.47147065721023096,
      "learning_rate": 4.823786713534898e-05,
      "loss": 1.8639,
      "num_input_tokens_seen": 10769251888,
      "step": 13688
    },
    {
      "epoch": 1.4522597071928707,
      "grad_norm": 0.47197799151304826,
      "learning_rate": 4.8237610832224644e-05,
      "loss": 1.6324,
      "num_input_tokens_seen": 10770038656,
      "step": 13689
    },
    {
      "epoch": 1.4523657967324421,
      "grad_norm": 0.427087142525157,
      "learning_rate": 4.823735451114297e-05,
      "loss": 1.6708,
      "num_input_tokens_seen": 10770825488,
      "step": 13690
    },
    {
      "epoch": 1.4524718862720136,
      "grad_norm": 0.40548162569596835,
      "learning_rate": 4.8237098172104146e-05,
      "loss": 1.7235,
      "num_input_tokens_seen": 10771612336,
      "step": 13691
    },
    {
      "epoch": 1.452577975811585,
      "grad_norm": 0.35850424894404814,
      "learning_rate": 4.823684181510837e-05,
      "loss": 1.7544,
      "num_input_tokens_seen": 10772399040,
      "step": 13692
    },
    {
      "epoch": 1.4526840653511564,
      "grad_norm": 0.5054361102238886,
      "learning_rate": 4.823658544015585e-05,
      "loss": 1.7604,
      "num_input_tokens_seen": 10773185792,
      "step": 13693
    },
    {
      "epoch": 1.4527901548907278,
      "grad_norm": 0.41618946278639785,
      "learning_rate": 4.8236329047246776e-05,
      "loss": 1.853,
      "num_input_tokens_seen": 10773972480,
      "step": 13694
    },
    {
      "epoch": 1.452896244430299,
      "grad_norm": 0.4869427124191976,
      "learning_rate": 4.8236072636381356e-05,
      "loss": 1.7924,
      "num_input_tokens_seen": 10774759248,
      "step": 13695
    },
    {
      "epoch": 1.4530023339698706,
      "grad_norm": 0.36971998929920913,
      "learning_rate": 4.823581620755977e-05,
      "loss": 1.6636,
      "num_input_tokens_seen": 10775546064,
      "step": 13696
    },
    {
      "epoch": 1.453108423509442,
      "grad_norm": 0.5584591996302112,
      "learning_rate": 4.8235559760782236e-05,
      "loss": 1.9557,
      "num_input_tokens_seen": 10776332736,
      "step": 13697
    },
    {
      "epoch": 1.4532145130490135,
      "grad_norm": 0.38637185853480116,
      "learning_rate": 4.823530329604894e-05,
      "loss": 1.7329,
      "num_input_tokens_seen": 10777119504,
      "step": 13698
    },
    {
      "epoch": 1.4533206025885848,
      "grad_norm": 0.5366169687403367,
      "learning_rate": 4.823504681336008e-05,
      "loss": 1.7871,
      "num_input_tokens_seen": 10777906192,
      "step": 13699
    },
    {
      "epoch": 1.4534266921281562,
      "grad_norm": 0.5348911733835278,
      "learning_rate": 4.8234790312715864e-05,
      "loss": 1.7179,
      "num_input_tokens_seen": 10778693056,
      "step": 13700
    },
    {
      "epoch": 1.4535327816677275,
      "grad_norm": 0.47252892600624924,
      "learning_rate": 4.823453379411648e-05,
      "loss": 1.6248,
      "num_input_tokens_seen": 10779479856,
      "step": 13701
    },
    {
      "epoch": 1.453638871207299,
      "grad_norm": 0.6844311513491652,
      "learning_rate": 4.823427725756213e-05,
      "loss": 1.8292,
      "num_input_tokens_seen": 10780266656,
      "step": 13702
    },
    {
      "epoch": 1.4537449607468704,
      "grad_norm": 0.421404086523346,
      "learning_rate": 4.823402070305301e-05,
      "loss": 1.7518,
      "num_input_tokens_seen": 10781053520,
      "step": 13703
    },
    {
      "epoch": 1.4538510502864417,
      "grad_norm": 0.6903383492783188,
      "learning_rate": 4.823376413058932e-05,
      "loss": 1.8126,
      "num_input_tokens_seen": 10781840160,
      "step": 13704
    },
    {
      "epoch": 1.4539571398260132,
      "grad_norm": 0.4458176672083045,
      "learning_rate": 4.8233507540171265e-05,
      "loss": 1.7601,
      "num_input_tokens_seen": 10782626976,
      "step": 13705
    },
    {
      "epoch": 1.4540632293655846,
      "grad_norm": 0.7307957570948221,
      "learning_rate": 4.823325093179903e-05,
      "loss": 1.7004,
      "num_input_tokens_seen": 10783413696,
      "step": 13706
    },
    {
      "epoch": 1.4541693189051559,
      "grad_norm": 0.3971611626704138,
      "learning_rate": 4.8232994305472824e-05,
      "loss": 1.7399,
      "num_input_tokens_seen": 10784200432,
      "step": 13707
    },
    {
      "epoch": 1.4542754084447274,
      "grad_norm": 0.6809353769611619,
      "learning_rate": 4.8232737661192846e-05,
      "loss": 1.7126,
      "num_input_tokens_seen": 10784987216,
      "step": 13708
    },
    {
      "epoch": 1.4543814979842988,
      "grad_norm": 0.4089125650029631,
      "learning_rate": 4.8232480998959285e-05,
      "loss": 1.5692,
      "num_input_tokens_seen": 10785773968,
      "step": 13709
    },
    {
      "epoch": 1.45448758752387,
      "grad_norm": 0.8483487188967421,
      "learning_rate": 4.8232224318772347e-05,
      "loss": 1.7921,
      "num_input_tokens_seen": 10786560688,
      "step": 13710
    },
    {
      "epoch": 1.4545936770634416,
      "grad_norm": 0.5480200528900854,
      "learning_rate": 4.8231967620632226e-05,
      "loss": 1.7489,
      "num_input_tokens_seen": 10787347504,
      "step": 13711
    },
    {
      "epoch": 1.4546997666030128,
      "grad_norm": 0.5280408288698748,
      "learning_rate": 4.823171090453912e-05,
      "loss": 1.7717,
      "num_input_tokens_seen": 10788134272,
      "step": 13712
    },
    {
      "epoch": 1.4548058561425843,
      "grad_norm": 0.6590817303132832,
      "learning_rate": 4.8231454170493226e-05,
      "loss": 1.7839,
      "num_input_tokens_seen": 10788921088,
      "step": 13713
    },
    {
      "epoch": 1.4549119456821558,
      "grad_norm": 0.5580043226229644,
      "learning_rate": 4.823119741849475e-05,
      "loss": 1.8224,
      "num_input_tokens_seen": 10789707904,
      "step": 13714
    },
    {
      "epoch": 1.4550180352217272,
      "grad_norm": 0.7412708268742354,
      "learning_rate": 4.82309406485439e-05,
      "loss": 1.9443,
      "num_input_tokens_seen": 10790494672,
      "step": 13715
    },
    {
      "epoch": 1.4551241247612985,
      "grad_norm": 0.4556227117621455,
      "learning_rate": 4.823068386064085e-05,
      "loss": 1.8974,
      "num_input_tokens_seen": 10791281424,
      "step": 13716
    },
    {
      "epoch": 1.45523021430087,
      "grad_norm": 0.44412825052172417,
      "learning_rate": 4.82304270547858e-05,
      "loss": 1.6405,
      "num_input_tokens_seen": 10792068208,
      "step": 13717
    },
    {
      "epoch": 1.4553363038404412,
      "grad_norm": 0.40887550628051483,
      "learning_rate": 4.823017023097897e-05,
      "loss": 1.7187,
      "num_input_tokens_seen": 10792854960,
      "step": 13718
    },
    {
      "epoch": 1.4554423933800127,
      "grad_norm": 0.4222196827546865,
      "learning_rate": 4.8229913389220536e-05,
      "loss": 1.8457,
      "num_input_tokens_seen": 10793641680,
      "step": 13719
    },
    {
      "epoch": 1.4555484829195842,
      "grad_norm": 0.4000233783697789,
      "learning_rate": 4.822965652951072e-05,
      "loss": 1.6752,
      "num_input_tokens_seen": 10794428480,
      "step": 13720
    },
    {
      "epoch": 1.4556545724591556,
      "grad_norm": 0.4508620560957794,
      "learning_rate": 4.8229399651849695e-05,
      "loss": 1.6726,
      "num_input_tokens_seen": 10795215248,
      "step": 13721
    },
    {
      "epoch": 1.455760661998727,
      "grad_norm": 0.4211793505887226,
      "learning_rate": 4.822914275623767e-05,
      "loss": 1.787,
      "num_input_tokens_seen": 10796002080,
      "step": 13722
    },
    {
      "epoch": 1.4558667515382984,
      "grad_norm": 0.47177978153219763,
      "learning_rate": 4.8228885842674855e-05,
      "loss": 1.8234,
      "num_input_tokens_seen": 10796788896,
      "step": 13723
    },
    {
      "epoch": 1.4559728410778696,
      "grad_norm": 0.5209314053083419,
      "learning_rate": 4.822862891116143e-05,
      "loss": 1.7657,
      "num_input_tokens_seen": 10797575680,
      "step": 13724
    },
    {
      "epoch": 1.456078930617441,
      "grad_norm": 0.38820318997374254,
      "learning_rate": 4.822837196169761e-05,
      "loss": 1.7445,
      "num_input_tokens_seen": 10798362400,
      "step": 13725
    },
    {
      "epoch": 1.4561850201570126,
      "grad_norm": 0.4428229142882496,
      "learning_rate": 4.822811499428358e-05,
      "loss": 1.8575,
      "num_input_tokens_seen": 10799149152,
      "step": 13726
    },
    {
      "epoch": 1.456291109696584,
      "grad_norm": 0.5079724709189669,
      "learning_rate": 4.8227858008919546e-05,
      "loss": 1.7816,
      "num_input_tokens_seen": 10799935872,
      "step": 13727
    },
    {
      "epoch": 1.4563971992361553,
      "grad_norm": 0.36554921653103634,
      "learning_rate": 4.8227601005605706e-05,
      "loss": 1.7403,
      "num_input_tokens_seen": 10800722640,
      "step": 13728
    },
    {
      "epoch": 1.4565032887757268,
      "grad_norm": 0.49763964862781807,
      "learning_rate": 4.8227343984342256e-05,
      "loss": 1.7696,
      "num_input_tokens_seen": 10801509424,
      "step": 13729
    },
    {
      "epoch": 1.456609378315298,
      "grad_norm": 0.4147308884539264,
      "learning_rate": 4.82270869451294e-05,
      "loss": 1.8456,
      "num_input_tokens_seen": 10802296176,
      "step": 13730
    },
    {
      "epoch": 1.4567154678548695,
      "grad_norm": 0.4284095229964608,
      "learning_rate": 4.822682988796732e-05,
      "loss": 1.754,
      "num_input_tokens_seen": 10803082912,
      "step": 13731
    },
    {
      "epoch": 1.456821557394441,
      "grad_norm": 0.43345278470848714,
      "learning_rate": 4.822657281285624e-05,
      "loss": 1.6898,
      "num_input_tokens_seen": 10803869680,
      "step": 13732
    },
    {
      "epoch": 1.4569276469340124,
      "grad_norm": 0.36272995216009907,
      "learning_rate": 4.8226315719796344e-05,
      "loss": 1.66,
      "num_input_tokens_seen": 10804656480,
      "step": 13733
    },
    {
      "epoch": 1.4570337364735837,
      "grad_norm": 0.4075780957269904,
      "learning_rate": 4.822605860878783e-05,
      "loss": 1.7147,
      "num_input_tokens_seen": 10805443200,
      "step": 13734
    },
    {
      "epoch": 1.4571398260131552,
      "grad_norm": 0.384832244319139,
      "learning_rate": 4.82258014798309e-05,
      "loss": 1.7543,
      "num_input_tokens_seen": 10806229920,
      "step": 13735
    },
    {
      "epoch": 1.4572459155527264,
      "grad_norm": 0.48280143226823585,
      "learning_rate": 4.822554433292575e-05,
      "loss": 2.0152,
      "num_input_tokens_seen": 10807016656,
      "step": 13736
    },
    {
      "epoch": 1.457352005092298,
      "grad_norm": 0.42276484414945764,
      "learning_rate": 4.8225287168072585e-05,
      "loss": 1.6903,
      "num_input_tokens_seen": 10807803408,
      "step": 13737
    },
    {
      "epoch": 1.4574580946318694,
      "grad_norm": 0.5532464876074044,
      "learning_rate": 4.82250299852716e-05,
      "loss": 1.7142,
      "num_input_tokens_seen": 10808590256,
      "step": 13738
    },
    {
      "epoch": 1.4575641841714406,
      "grad_norm": 0.43286497512794936,
      "learning_rate": 4.822477278452299e-05,
      "loss": 1.6785,
      "num_input_tokens_seen": 10809377088,
      "step": 13739
    },
    {
      "epoch": 1.457670273711012,
      "grad_norm": 0.637945263619984,
      "learning_rate": 4.822451556582696e-05,
      "loss": 1.7077,
      "num_input_tokens_seen": 10810163808,
      "step": 13740
    },
    {
      "epoch": 1.4577763632505836,
      "grad_norm": 0.3623302917607308,
      "learning_rate": 4.8224258329183705e-05,
      "loss": 1.7855,
      "num_input_tokens_seen": 10810950528,
      "step": 13741
    },
    {
      "epoch": 1.4578824527901548,
      "grad_norm": 0.4983505986262267,
      "learning_rate": 4.822400107459343e-05,
      "loss": 1.8063,
      "num_input_tokens_seen": 10811737280,
      "step": 13742
    },
    {
      "epoch": 1.4579885423297263,
      "grad_norm": 0.4934462134347328,
      "learning_rate": 4.822374380205632e-05,
      "loss": 1.8032,
      "num_input_tokens_seen": 10812523952,
      "step": 13743
    },
    {
      "epoch": 1.4580946318692978,
      "grad_norm": 0.3485377613621598,
      "learning_rate": 4.822348651157258e-05,
      "loss": 1.6383,
      "num_input_tokens_seen": 10813310720,
      "step": 13744
    },
    {
      "epoch": 1.458200721408869,
      "grad_norm": 0.4925138933758819,
      "learning_rate": 4.8223229203142416e-05,
      "loss": 1.8159,
      "num_input_tokens_seen": 10814097456,
      "step": 13745
    },
    {
      "epoch": 1.4583068109484405,
      "grad_norm": 0.5012604358136393,
      "learning_rate": 4.822297187676602e-05,
      "loss": 1.6589,
      "num_input_tokens_seen": 10814884208,
      "step": 13746
    },
    {
      "epoch": 1.4584129004880118,
      "grad_norm": 0.3677798513533037,
      "learning_rate": 4.8222714532443596e-05,
      "loss": 1.7811,
      "num_input_tokens_seen": 10815671056,
      "step": 13747
    },
    {
      "epoch": 1.4585189900275832,
      "grad_norm": 0.4765688899668175,
      "learning_rate": 4.822245717017534e-05,
      "loss": 1.7359,
      "num_input_tokens_seen": 10816457904,
      "step": 13748
    },
    {
      "epoch": 1.4586250795671547,
      "grad_norm": 0.38084747432141747,
      "learning_rate": 4.822219978996145e-05,
      "loss": 1.757,
      "num_input_tokens_seen": 10817244688,
      "step": 13749
    },
    {
      "epoch": 1.4587311691067262,
      "grad_norm": 0.34278237874210704,
      "learning_rate": 4.8221942391802125e-05,
      "loss": 1.8247,
      "num_input_tokens_seen": 10818031536,
      "step": 13750
    },
    {
      "epoch": 1.4588372586462974,
      "grad_norm": 0.4267505856881101,
      "learning_rate": 4.822168497569756e-05,
      "loss": 1.795,
      "num_input_tokens_seen": 10818818272,
      "step": 13751
    },
    {
      "epoch": 1.458943348185869,
      "grad_norm": 0.4936401398203096,
      "learning_rate": 4.8221427541647964e-05,
      "loss": 1.7063,
      "num_input_tokens_seen": 10819605024,
      "step": 13752
    },
    {
      "epoch": 1.4590494377254402,
      "grad_norm": 0.418310852443435,
      "learning_rate": 4.822117008965352e-05,
      "loss": 1.873,
      "num_input_tokens_seen": 10820391760,
      "step": 13753
    },
    {
      "epoch": 1.4591555272650116,
      "grad_norm": 0.4484376851255271,
      "learning_rate": 4.822091261971445e-05,
      "loss": 1.887,
      "num_input_tokens_seen": 10821178528,
      "step": 13754
    },
    {
      "epoch": 1.459261616804583,
      "grad_norm": 0.470390181295427,
      "learning_rate": 4.8220655131830935e-05,
      "loss": 1.8515,
      "num_input_tokens_seen": 10821965216,
      "step": 13755
    },
    {
      "epoch": 1.4593677063441546,
      "grad_norm": 0.4053903637400164,
      "learning_rate": 4.822039762600318e-05,
      "loss": 1.9047,
      "num_input_tokens_seen": 10822751952,
      "step": 13756
    },
    {
      "epoch": 1.4594737958837258,
      "grad_norm": 0.5016947417864596,
      "learning_rate": 4.822014010223138e-05,
      "loss": 1.7942,
      "num_input_tokens_seen": 10823538752,
      "step": 13757
    },
    {
      "epoch": 1.4595798854232973,
      "grad_norm": 0.42220227194543886,
      "learning_rate": 4.821988256051574e-05,
      "loss": 1.8302,
      "num_input_tokens_seen": 10824325536,
      "step": 13758
    },
    {
      "epoch": 1.4596859749628686,
      "grad_norm": 0.4285136055729091,
      "learning_rate": 4.821962500085645e-05,
      "loss": 1.8437,
      "num_input_tokens_seen": 10825112320,
      "step": 13759
    },
    {
      "epoch": 1.45979206450244,
      "grad_norm": 0.444435641327906,
      "learning_rate": 4.821936742325373e-05,
      "loss": 1.6406,
      "num_input_tokens_seen": 10825899136,
      "step": 13760
    },
    {
      "epoch": 1.4598981540420115,
      "grad_norm": 0.3726646651252901,
      "learning_rate": 4.821910982770774e-05,
      "loss": 1.7246,
      "num_input_tokens_seen": 10826685856,
      "step": 13761
    },
    {
      "epoch": 1.460004243581583,
      "grad_norm": 0.5191889669532116,
      "learning_rate": 4.821885221421872e-05,
      "loss": 1.7802,
      "num_input_tokens_seen": 10827472640,
      "step": 13762
    },
    {
      "epoch": 1.4601103331211542,
      "grad_norm": 0.3958684615045215,
      "learning_rate": 4.821859458278685e-05,
      "loss": 1.7251,
      "num_input_tokens_seen": 10828259376,
      "step": 13763
    },
    {
      "epoch": 1.4602164226607257,
      "grad_norm": 0.4271354977861665,
      "learning_rate": 4.8218336933412334e-05,
      "loss": 1.8032,
      "num_input_tokens_seen": 10829046144,
      "step": 13764
    },
    {
      "epoch": 1.460322512200297,
      "grad_norm": 0.4067606784189309,
      "learning_rate": 4.821807926609536e-05,
      "loss": 1.8021,
      "num_input_tokens_seen": 10829832944,
      "step": 13765
    },
    {
      "epoch": 1.4604286017398684,
      "grad_norm": 0.45077695311498167,
      "learning_rate": 4.821782158083615e-05,
      "loss": 1.844,
      "num_input_tokens_seen": 10830619760,
      "step": 13766
    },
    {
      "epoch": 1.46053469127944,
      "grad_norm": 0.3917044922750327,
      "learning_rate": 4.8217563877634875e-05,
      "loss": 1.7233,
      "num_input_tokens_seen": 10831406592,
      "step": 13767
    },
    {
      "epoch": 1.4606407808190112,
      "grad_norm": 0.400867720708725,
      "learning_rate": 4.8217306156491756e-05,
      "loss": 1.8516,
      "num_input_tokens_seen": 10832193424,
      "step": 13768
    },
    {
      "epoch": 1.4607468703585826,
      "grad_norm": 0.4190492358014341,
      "learning_rate": 4.821704841740698e-05,
      "loss": 1.7357,
      "num_input_tokens_seen": 10832980096,
      "step": 13769
    },
    {
      "epoch": 1.4608529598981541,
      "grad_norm": 0.49931936161829554,
      "learning_rate": 4.821679066038075e-05,
      "loss": 1.7215,
      "num_input_tokens_seen": 10833766912,
      "step": 13770
    },
    {
      "epoch": 1.4609590494377254,
      "grad_norm": 0.389662201178862,
      "learning_rate": 4.8216532885413266e-05,
      "loss": 1.657,
      "num_input_tokens_seen": 10834553760,
      "step": 13771
    },
    {
      "epoch": 1.4610651389772968,
      "grad_norm": 0.41792411482789726,
      "learning_rate": 4.8216275092504725e-05,
      "loss": 1.7808,
      "num_input_tokens_seen": 10835340576,
      "step": 13772
    },
    {
      "epoch": 1.4611712285168683,
      "grad_norm": 0.4207739977030292,
      "learning_rate": 4.8216017281655335e-05,
      "loss": 1.7584,
      "num_input_tokens_seen": 10836127296,
      "step": 13773
    },
    {
      "epoch": 1.4612773180564396,
      "grad_norm": 0.42403274734800456,
      "learning_rate": 4.8215759452865286e-05,
      "loss": 1.7885,
      "num_input_tokens_seen": 10836914016,
      "step": 13774
    },
    {
      "epoch": 1.461383407596011,
      "grad_norm": 0.5121291754091032,
      "learning_rate": 4.8215501606134773e-05,
      "loss": 1.7314,
      "num_input_tokens_seen": 10837700768,
      "step": 13775
    },
    {
      "epoch": 1.4614894971355823,
      "grad_norm": 0.3430500871808615,
      "learning_rate": 4.8215243741464e-05,
      "loss": 1.7791,
      "num_input_tokens_seen": 10838487472,
      "step": 13776
    },
    {
      "epoch": 1.4615955866751538,
      "grad_norm": 0.41375194342089916,
      "learning_rate": 4.8214985858853174e-05,
      "loss": 1.687,
      "num_input_tokens_seen": 10839274208,
      "step": 13777
    },
    {
      "epoch": 1.4617016762147252,
      "grad_norm": 0.512716636325695,
      "learning_rate": 4.821472795830249e-05,
      "loss": 1.8113,
      "num_input_tokens_seen": 10840060944,
      "step": 13778
    },
    {
      "epoch": 1.4618077657542967,
      "grad_norm": 0.41464865914971055,
      "learning_rate": 4.8214470039812136e-05,
      "loss": 1.7045,
      "num_input_tokens_seen": 10840847792,
      "step": 13779
    },
    {
      "epoch": 1.461913855293868,
      "grad_norm": 0.37525100774399744,
      "learning_rate": 4.8214212103382326e-05,
      "loss": 1.8047,
      "num_input_tokens_seen": 10841634560,
      "step": 13780
    },
    {
      "epoch": 1.4620199448334394,
      "grad_norm": 0.46785863716623965,
      "learning_rate": 4.821395414901326e-05,
      "loss": 1.7743,
      "num_input_tokens_seen": 10842421312,
      "step": 13781
    },
    {
      "epoch": 1.4621260343730107,
      "grad_norm": 0.38143625678798726,
      "learning_rate": 4.8213696176705125e-05,
      "loss": 1.7043,
      "num_input_tokens_seen": 10843208096,
      "step": 13782
    },
    {
      "epoch": 1.4622321239125822,
      "grad_norm": 0.4283080016800106,
      "learning_rate": 4.821343818645813e-05,
      "loss": 1.8532,
      "num_input_tokens_seen": 10843994928,
      "step": 13783
    },
    {
      "epoch": 1.4623382134521536,
      "grad_norm": 0.5209789513639173,
      "learning_rate": 4.821318017827246e-05,
      "loss": 1.9406,
      "num_input_tokens_seen": 10844781632,
      "step": 13784
    },
    {
      "epoch": 1.4624443029917251,
      "grad_norm": 0.4236776029958278,
      "learning_rate": 4.821292215214834e-05,
      "loss": 1.7244,
      "num_input_tokens_seen": 10845568384,
      "step": 13785
    },
    {
      "epoch": 1.4625503925312964,
      "grad_norm": 0.42443228117242715,
      "learning_rate": 4.8212664108085946e-05,
      "loss": 1.6388,
      "num_input_tokens_seen": 10846355120,
      "step": 13786
    },
    {
      "epoch": 1.4626564820708678,
      "grad_norm": 0.44762517275645164,
      "learning_rate": 4.821240604608549e-05,
      "loss": 1.7982,
      "num_input_tokens_seen": 10847141920,
      "step": 13787
    },
    {
      "epoch": 1.462762571610439,
      "grad_norm": 0.3744170064227958,
      "learning_rate": 4.821214796614717e-05,
      "loss": 1.8294,
      "num_input_tokens_seen": 10847928576,
      "step": 13788
    },
    {
      "epoch": 1.4628686611500106,
      "grad_norm": 0.4996273090959677,
      "learning_rate": 4.8211889868271175e-05,
      "loss": 1.8106,
      "num_input_tokens_seen": 10848715168,
      "step": 13789
    },
    {
      "epoch": 1.462974750689582,
      "grad_norm": 0.40142674331989286,
      "learning_rate": 4.821163175245772e-05,
      "loss": 1.713,
      "num_input_tokens_seen": 10849501856,
      "step": 13790
    },
    {
      "epoch": 1.4630808402291535,
      "grad_norm": 0.42968351505962005,
      "learning_rate": 4.8211373618707e-05,
      "loss": 1.821,
      "num_input_tokens_seen": 10850288672,
      "step": 13791
    },
    {
      "epoch": 1.4631869297687248,
      "grad_norm": 0.3599104866413458,
      "learning_rate": 4.821111546701921e-05,
      "loss": 1.8201,
      "num_input_tokens_seen": 10851075440,
      "step": 13792
    },
    {
      "epoch": 1.4632930193082963,
      "grad_norm": 0.3380862942627065,
      "learning_rate": 4.821085729739454e-05,
      "loss": 1.7924,
      "num_input_tokens_seen": 10851862336,
      "step": 13793
    },
    {
      "epoch": 1.4633991088478675,
      "grad_norm": 0.41183918071114356,
      "learning_rate": 4.821059910983321e-05,
      "loss": 1.7211,
      "num_input_tokens_seen": 10852649136,
      "step": 13794
    },
    {
      "epoch": 1.463505198387439,
      "grad_norm": 0.32484287723897987,
      "learning_rate": 4.821034090433541e-05,
      "loss": 1.7007,
      "num_input_tokens_seen": 10853435856,
      "step": 13795
    },
    {
      "epoch": 1.4636112879270105,
      "grad_norm": 0.38813339854448903,
      "learning_rate": 4.821008268090134e-05,
      "loss": 1.7072,
      "num_input_tokens_seen": 10854222624,
      "step": 13796
    },
    {
      "epoch": 1.463717377466582,
      "grad_norm": 0.3656850932814083,
      "learning_rate": 4.820982443953119e-05,
      "loss": 1.7006,
      "num_input_tokens_seen": 10855009392,
      "step": 13797
    },
    {
      "epoch": 1.4638234670061532,
      "grad_norm": 0.41988003207792124,
      "learning_rate": 4.820956618022517e-05,
      "loss": 1.8414,
      "num_input_tokens_seen": 10855796224,
      "step": 13798
    },
    {
      "epoch": 1.4639295565457247,
      "grad_norm": 0.48793628604557937,
      "learning_rate": 4.820930790298349e-05,
      "loss": 1.6284,
      "num_input_tokens_seen": 10856583008,
      "step": 13799
    },
    {
      "epoch": 1.464035646085296,
      "grad_norm": 0.4252691019453365,
      "learning_rate": 4.820904960780633e-05,
      "loss": 1.6701,
      "num_input_tokens_seen": 10857369840,
      "step": 13800
    },
    {
      "epoch": 1.4641417356248674,
      "grad_norm": 0.39561501257376214,
      "learning_rate": 4.82087912946939e-05,
      "loss": 1.6197,
      "num_input_tokens_seen": 10858156672,
      "step": 13801
    },
    {
      "epoch": 1.4642478251644389,
      "grad_norm": 0.46754364471990634,
      "learning_rate": 4.82085329636464e-05,
      "loss": 1.8343,
      "num_input_tokens_seen": 10858943408,
      "step": 13802
    },
    {
      "epoch": 1.46435391470401,
      "grad_norm": 0.4014278475226497,
      "learning_rate": 4.820827461466402e-05,
      "loss": 1.7367,
      "num_input_tokens_seen": 10859730224,
      "step": 13803
    },
    {
      "epoch": 1.4644600042435816,
      "grad_norm": 0.3556232992673398,
      "learning_rate": 4.8208016247746966e-05,
      "loss": 1.8395,
      "num_input_tokens_seen": 10860517024,
      "step": 13804
    },
    {
      "epoch": 1.464566093783153,
      "grad_norm": 0.3945880274724168,
      "learning_rate": 4.820775786289544e-05,
      "loss": 1.737,
      "num_input_tokens_seen": 10861303792,
      "step": 13805
    },
    {
      "epoch": 1.4646721833227243,
      "grad_norm": 0.3808832102595165,
      "learning_rate": 4.8207499460109645e-05,
      "loss": 1.7434,
      "num_input_tokens_seen": 10862090480,
      "step": 13806
    },
    {
      "epoch": 1.4647782728622958,
      "grad_norm": 0.4588342768586855,
      "learning_rate": 4.820724103938977e-05,
      "loss": 1.8404,
      "num_input_tokens_seen": 10862877248,
      "step": 13807
    },
    {
      "epoch": 1.4648843624018673,
      "grad_norm": 0.38472383170930563,
      "learning_rate": 4.8206982600736026e-05,
      "loss": 1.7213,
      "num_input_tokens_seen": 10863664096,
      "step": 13808
    },
    {
      "epoch": 1.4649904519414385,
      "grad_norm": 0.40830740318131364,
      "learning_rate": 4.8206724144148595e-05,
      "loss": 1.6066,
      "num_input_tokens_seen": 10864450944,
      "step": 13809
    },
    {
      "epoch": 1.46509654148101,
      "grad_norm": 0.4022824022415242,
      "learning_rate": 4.82064656696277e-05,
      "loss": 1.7312,
      "num_input_tokens_seen": 10865237696,
      "step": 13810
    },
    {
      "epoch": 1.4652026310205812,
      "grad_norm": 0.4757421805608527,
      "learning_rate": 4.820620717717352e-05,
      "loss": 1.7528,
      "num_input_tokens_seen": 10866024448,
      "step": 13811
    },
    {
      "epoch": 1.4653087205601527,
      "grad_norm": 0.3930806927827102,
      "learning_rate": 4.820594866678627e-05,
      "loss": 1.8417,
      "num_input_tokens_seen": 10866811280,
      "step": 13812
    },
    {
      "epoch": 1.4654148100997242,
      "grad_norm": 0.3598747169190347,
      "learning_rate": 4.820569013846614e-05,
      "loss": 1.5352,
      "num_input_tokens_seen": 10867598112,
      "step": 13813
    },
    {
      "epoch": 1.4655208996392957,
      "grad_norm": 0.5558637861240106,
      "learning_rate": 4.820543159221335e-05,
      "loss": 1.8491,
      "num_input_tokens_seen": 10868384944,
      "step": 13814
    },
    {
      "epoch": 1.465626989178867,
      "grad_norm": 0.3369613464064959,
      "learning_rate": 4.820517302802806e-05,
      "loss": 1.7424,
      "num_input_tokens_seen": 10869171744,
      "step": 13815
    },
    {
      "epoch": 1.4657330787184384,
      "grad_norm": 0.3460567427720012,
      "learning_rate": 4.82049144459105e-05,
      "loss": 1.6965,
      "num_input_tokens_seen": 10869958480,
      "step": 13816
    },
    {
      "epoch": 1.4658391682580096,
      "grad_norm": 0.40166538682668224,
      "learning_rate": 4.820465584586087e-05,
      "loss": 1.659,
      "num_input_tokens_seen": 10870745232,
      "step": 13817
    },
    {
      "epoch": 1.4659452577975811,
      "grad_norm": 0.3460752660628029,
      "learning_rate": 4.820439722787936e-05,
      "loss": 1.7435,
      "num_input_tokens_seen": 10871532048,
      "step": 13818
    },
    {
      "epoch": 1.4660513473371526,
      "grad_norm": 0.41480980710706433,
      "learning_rate": 4.820413859196617e-05,
      "loss": 1.7178,
      "num_input_tokens_seen": 10872318944,
      "step": 13819
    },
    {
      "epoch": 1.466157436876724,
      "grad_norm": 0.45142486890506717,
      "learning_rate": 4.82038799381215e-05,
      "loss": 1.8848,
      "num_input_tokens_seen": 10873105744,
      "step": 13820
    },
    {
      "epoch": 1.4662635264162953,
      "grad_norm": 0.43296780383840505,
      "learning_rate": 4.820362126634556e-05,
      "loss": 1.8644,
      "num_input_tokens_seen": 10873892528,
      "step": 13821
    },
    {
      "epoch": 1.4663696159558668,
      "grad_norm": 0.3728139894930897,
      "learning_rate": 4.820336257663854e-05,
      "loss": 1.6568,
      "num_input_tokens_seen": 10874679328,
      "step": 13822
    },
    {
      "epoch": 1.466475705495438,
      "grad_norm": 0.3753941792879978,
      "learning_rate": 4.820310386900064e-05,
      "loss": 1.739,
      "num_input_tokens_seen": 10875466096,
      "step": 13823
    },
    {
      "epoch": 1.4665817950350095,
      "grad_norm": 0.3527101617549747,
      "learning_rate": 4.820284514343206e-05,
      "loss": 1.8856,
      "num_input_tokens_seen": 10876252848,
      "step": 13824
    },
    {
      "epoch": 1.466687884574581,
      "grad_norm": 0.37984691011571453,
      "learning_rate": 4.8202586399933e-05,
      "loss": 1.7795,
      "num_input_tokens_seen": 10877039600,
      "step": 13825
    },
    {
      "epoch": 1.4667939741141525,
      "grad_norm": 0.35697899205956035,
      "learning_rate": 4.820232763850367e-05,
      "loss": 1.6714,
      "num_input_tokens_seen": 10877826400,
      "step": 13826
    },
    {
      "epoch": 1.4669000636537237,
      "grad_norm": 0.3266887668949437,
      "learning_rate": 4.820206885914426e-05,
      "loss": 1.7386,
      "num_input_tokens_seen": 10878613184,
      "step": 13827
    },
    {
      "epoch": 1.4670061531932952,
      "grad_norm": 0.4052178684602773,
      "learning_rate": 4.820181006185497e-05,
      "loss": 1.8311,
      "num_input_tokens_seen": 10879399920,
      "step": 13828
    },
    {
      "epoch": 1.4671122427328664,
      "grad_norm": 0.4694243687425038,
      "learning_rate": 4.8201551246636006e-05,
      "loss": 1.7714,
      "num_input_tokens_seen": 10880186720,
      "step": 13829
    },
    {
      "epoch": 1.467218332272438,
      "grad_norm": 0.32929995587764443,
      "learning_rate": 4.820129241348756e-05,
      "loss": 1.7512,
      "num_input_tokens_seen": 10880973456,
      "step": 13830
    },
    {
      "epoch": 1.4673244218120094,
      "grad_norm": 0.36512681423676063,
      "learning_rate": 4.820103356240984e-05,
      "loss": 1.6404,
      "num_input_tokens_seen": 10881760240,
      "step": 13831
    },
    {
      "epoch": 1.4674305113515809,
      "grad_norm": 0.3282831755509919,
      "learning_rate": 4.820077469340304e-05,
      "loss": 1.6733,
      "num_input_tokens_seen": 10882546944,
      "step": 13832
    },
    {
      "epoch": 1.4675366008911521,
      "grad_norm": 0.3476037472939805,
      "learning_rate": 4.820051580646736e-05,
      "loss": 1.8894,
      "num_input_tokens_seen": 10883333680,
      "step": 13833
    },
    {
      "epoch": 1.4676426904307236,
      "grad_norm": 0.35507178466375866,
      "learning_rate": 4.8200256901603004e-05,
      "loss": 1.7244,
      "num_input_tokens_seen": 10884120432,
      "step": 13834
    },
    {
      "epoch": 1.4677487799702948,
      "grad_norm": 0.3308443574886848,
      "learning_rate": 4.8199997978810164e-05,
      "loss": 1.8004,
      "num_input_tokens_seen": 10884907168,
      "step": 13835
    },
    {
      "epoch": 1.4678548695098663,
      "grad_norm": 0.45014955698621434,
      "learning_rate": 4.819973903808905e-05,
      "loss": 1.8863,
      "num_input_tokens_seen": 10885693984,
      "step": 13836
    },
    {
      "epoch": 1.4679609590494378,
      "grad_norm": 0.4292621065407349,
      "learning_rate": 4.819948007943986e-05,
      "loss": 1.7534,
      "num_input_tokens_seen": 10886480800,
      "step": 13837
    },
    {
      "epoch": 1.468067048589009,
      "grad_norm": 0.44200431358858844,
      "learning_rate": 4.8199221102862795e-05,
      "loss": 1.8823,
      "num_input_tokens_seen": 10887267520,
      "step": 13838
    },
    {
      "epoch": 1.4681731381285805,
      "grad_norm": 0.41031731740132876,
      "learning_rate": 4.8198962108358045e-05,
      "loss": 1.7449,
      "num_input_tokens_seen": 10888054320,
      "step": 13839
    },
    {
      "epoch": 1.468279227668152,
      "grad_norm": 0.32713730331742935,
      "learning_rate": 4.819870309592583e-05,
      "loss": 1.7665,
      "num_input_tokens_seen": 10888841104,
      "step": 13840
    },
    {
      "epoch": 1.4683853172077233,
      "grad_norm": 0.4063857492721078,
      "learning_rate": 4.819844406556633e-05,
      "loss": 1.7353,
      "num_input_tokens_seen": 10889627872,
      "step": 13841
    },
    {
      "epoch": 1.4684914067472947,
      "grad_norm": 0.38508616015198965,
      "learning_rate": 4.819818501727975e-05,
      "loss": 1.7333,
      "num_input_tokens_seen": 10890414672,
      "step": 13842
    },
    {
      "epoch": 1.4685974962868662,
      "grad_norm": 0.427980443251905,
      "learning_rate": 4.81979259510663e-05,
      "loss": 1.7401,
      "num_input_tokens_seen": 10891201472,
      "step": 13843
    },
    {
      "epoch": 1.4687035858264375,
      "grad_norm": 0.37789924289618976,
      "learning_rate": 4.8197666866926175e-05,
      "loss": 1.8756,
      "num_input_tokens_seen": 10891988176,
      "step": 13844
    },
    {
      "epoch": 1.468809675366009,
      "grad_norm": 0.36837865789440205,
      "learning_rate": 4.819740776485956e-05,
      "loss": 1.8787,
      "num_input_tokens_seen": 10892774880,
      "step": 13845
    },
    {
      "epoch": 1.4689157649055802,
      "grad_norm": 0.3502672987596823,
      "learning_rate": 4.8197148644866685e-05,
      "loss": 1.6819,
      "num_input_tokens_seen": 10893561680,
      "step": 13846
    },
    {
      "epoch": 1.4690218544451517,
      "grad_norm": 0.4050922453268656,
      "learning_rate": 4.819688950694773e-05,
      "loss": 1.7401,
      "num_input_tokens_seen": 10894348432,
      "step": 13847
    },
    {
      "epoch": 1.4691279439847231,
      "grad_norm": 0.3721343715087132,
      "learning_rate": 4.8196630351102896e-05,
      "loss": 1.6498,
      "num_input_tokens_seen": 10895135184,
      "step": 13848
    },
    {
      "epoch": 1.4692340335242946,
      "grad_norm": 0.6757212054494927,
      "learning_rate": 4.819637117733239e-05,
      "loss": 1.6394,
      "num_input_tokens_seen": 10895922000,
      "step": 13849
    },
    {
      "epoch": 1.4693401230638659,
      "grad_norm": 0.7651250214978947,
      "learning_rate": 4.8196111985636405e-05,
      "loss": 1.7658,
      "num_input_tokens_seen": 10896708784,
      "step": 13850
    },
    {
      "epoch": 1.4694462126034373,
      "grad_norm": 0.503843934914094,
      "learning_rate": 4.819585277601514e-05,
      "loss": 1.7888,
      "num_input_tokens_seen": 10897495520,
      "step": 13851
    },
    {
      "epoch": 1.4695523021430086,
      "grad_norm": 0.722375443001927,
      "learning_rate": 4.8195593548468806e-05,
      "loss": 1.8336,
      "num_input_tokens_seen": 10898282192,
      "step": 13852
    },
    {
      "epoch": 1.46965839168258,
      "grad_norm": 0.5600649583575688,
      "learning_rate": 4.8195334302997606e-05,
      "loss": 1.8486,
      "num_input_tokens_seen": 10899068960,
      "step": 13853
    },
    {
      "epoch": 1.4697644812221515,
      "grad_norm": 0.4428035829030017,
      "learning_rate": 4.8195075039601725e-05,
      "loss": 1.7236,
      "num_input_tokens_seen": 10899855744,
      "step": 13854
    },
    {
      "epoch": 1.469870570761723,
      "grad_norm": 0.6644502049946399,
      "learning_rate": 4.819481575828137e-05,
      "loss": 1.895,
      "num_input_tokens_seen": 10900642432,
      "step": 13855
    },
    {
      "epoch": 1.4699766603012943,
      "grad_norm": 0.41807372191128006,
      "learning_rate": 4.819455645903675e-05,
      "loss": 1.847,
      "num_input_tokens_seen": 10901429200,
      "step": 13856
    },
    {
      "epoch": 1.4700827498408657,
      "grad_norm": 0.5892462548713485,
      "learning_rate": 4.819429714186804e-05,
      "loss": 1.665,
      "num_input_tokens_seen": 10902216000,
      "step": 13857
    },
    {
      "epoch": 1.470188839380437,
      "grad_norm": 0.49236979649428025,
      "learning_rate": 4.819403780677547e-05,
      "loss": 1.8528,
      "num_input_tokens_seen": 10903002816,
      "step": 13858
    },
    {
      "epoch": 1.4702949289200085,
      "grad_norm": 0.696777315704362,
      "learning_rate": 4.819377845375923e-05,
      "loss": 1.7315,
      "num_input_tokens_seen": 10903789632,
      "step": 13859
    },
    {
      "epoch": 1.47040101845958,
      "grad_norm": 0.4644745343145738,
      "learning_rate": 4.819351908281952e-05,
      "loss": 1.838,
      "num_input_tokens_seen": 10904576432,
      "step": 13860
    },
    {
      "epoch": 1.4705071079991514,
      "grad_norm": 0.6267697852627393,
      "learning_rate": 4.819325969395653e-05,
      "loss": 1.8096,
      "num_input_tokens_seen": 10905363168,
      "step": 13861
    },
    {
      "epoch": 1.4706131975387227,
      "grad_norm": 0.36786959577657175,
      "learning_rate": 4.819300028717047e-05,
      "loss": 1.6902,
      "num_input_tokens_seen": 10906149936,
      "step": 13862
    },
    {
      "epoch": 1.4707192870782941,
      "grad_norm": 0.4659097569513432,
      "learning_rate": 4.8192740862461544e-05,
      "loss": 1.5938,
      "num_input_tokens_seen": 10906936720,
      "step": 13863
    },
    {
      "epoch": 1.4708253766178654,
      "grad_norm": 0.44636224549114284,
      "learning_rate": 4.819248141982995e-05,
      "loss": 1.7298,
      "num_input_tokens_seen": 10907723472,
      "step": 13864
    },
    {
      "epoch": 1.4709314661574369,
      "grad_norm": 0.43147178580691786,
      "learning_rate": 4.8192221959275885e-05,
      "loss": 1.7012,
      "num_input_tokens_seen": 10908510224,
      "step": 13865
    },
    {
      "epoch": 1.4710375556970083,
      "grad_norm": 0.41220843070905644,
      "learning_rate": 4.819196248079955e-05,
      "loss": 1.7608,
      "num_input_tokens_seen": 10909296928,
      "step": 13866
    },
    {
      "epoch": 1.4711436452365798,
      "grad_norm": 0.40638223618117125,
      "learning_rate": 4.8191702984401146e-05,
      "loss": 1.7352,
      "num_input_tokens_seen": 10910083760,
      "step": 13867
    },
    {
      "epoch": 1.471249734776151,
      "grad_norm": 0.4275713245376585,
      "learning_rate": 4.8191443470080875e-05,
      "loss": 1.7413,
      "num_input_tokens_seen": 10910870560,
      "step": 13868
    },
    {
      "epoch": 1.4713558243157225,
      "grad_norm": 0.4046055865724712,
      "learning_rate": 4.819118393783894e-05,
      "loss": 1.8117,
      "num_input_tokens_seen": 10911657312,
      "step": 13869
    },
    {
      "epoch": 1.4714619138552938,
      "grad_norm": 0.3521066561306902,
      "learning_rate": 4.819092438767554e-05,
      "loss": 1.6885,
      "num_input_tokens_seen": 10912444128,
      "step": 13870
    },
    {
      "epoch": 1.4715680033948653,
      "grad_norm": 0.4524493190545748,
      "learning_rate": 4.819066481959087e-05,
      "loss": 1.6753,
      "num_input_tokens_seen": 10913230960,
      "step": 13871
    },
    {
      "epoch": 1.4716740929344367,
      "grad_norm": 0.4064504838450813,
      "learning_rate": 4.8190405233585136e-05,
      "loss": 1.7669,
      "num_input_tokens_seen": 10914017712,
      "step": 13872
    },
    {
      "epoch": 1.471780182474008,
      "grad_norm": 0.46087332394021296,
      "learning_rate": 4.819014562965853e-05,
      "loss": 1.6507,
      "num_input_tokens_seen": 10914804544,
      "step": 13873
    },
    {
      "epoch": 1.4718862720135795,
      "grad_norm": 0.43920274338617155,
      "learning_rate": 4.818988600781127e-05,
      "loss": 1.8798,
      "num_input_tokens_seen": 10915591344,
      "step": 13874
    },
    {
      "epoch": 1.471992361553151,
      "grad_norm": 0.42579454544286727,
      "learning_rate": 4.818962636804354e-05,
      "loss": 1.7763,
      "num_input_tokens_seen": 10916378016,
      "step": 13875
    },
    {
      "epoch": 1.4720984510927222,
      "grad_norm": 0.680478013098954,
      "learning_rate": 4.818936671035555e-05,
      "loss": 1.6731,
      "num_input_tokens_seen": 10917164816,
      "step": 13876
    },
    {
      "epoch": 1.4722045406322937,
      "grad_norm": 0.3981463903487961,
      "learning_rate": 4.81891070347475e-05,
      "loss": 1.6685,
      "num_input_tokens_seen": 10917951616,
      "step": 13877
    },
    {
      "epoch": 1.4723106301718651,
      "grad_norm": 0.4306488825774907,
      "learning_rate": 4.818884734121959e-05,
      "loss": 1.7372,
      "num_input_tokens_seen": 10918738352,
      "step": 13878
    },
    {
      "epoch": 1.4724167197114364,
      "grad_norm": 0.5011466506642289,
      "learning_rate": 4.818858762977201e-05,
      "loss": 1.7044,
      "num_input_tokens_seen": 10919525088,
      "step": 13879
    },
    {
      "epoch": 1.4725228092510079,
      "grad_norm": 0.34494920084145586,
      "learning_rate": 4.818832790040498e-05,
      "loss": 1.7054,
      "num_input_tokens_seen": 10920311888,
      "step": 13880
    },
    {
      "epoch": 1.4726288987905791,
      "grad_norm": 0.38391190668398584,
      "learning_rate": 4.818806815311869e-05,
      "loss": 1.8503,
      "num_input_tokens_seen": 10921098736,
      "step": 13881
    },
    {
      "epoch": 1.4727349883301506,
      "grad_norm": 0.47781913366636314,
      "learning_rate": 4.8187808387913336e-05,
      "loss": 1.8228,
      "num_input_tokens_seen": 10921885472,
      "step": 13882
    },
    {
      "epoch": 1.472841077869722,
      "grad_norm": 0.41248082107496764,
      "learning_rate": 4.8187548604789124e-05,
      "loss": 1.712,
      "num_input_tokens_seen": 10922672224,
      "step": 13883
    },
    {
      "epoch": 1.4729471674092935,
      "grad_norm": 0.40255830549340593,
      "learning_rate": 4.8187288803746256e-05,
      "loss": 1.6835,
      "num_input_tokens_seen": 10923459008,
      "step": 13884
    },
    {
      "epoch": 1.4730532569488648,
      "grad_norm": 0.47060973113807675,
      "learning_rate": 4.8187028984784934e-05,
      "loss": 1.8073,
      "num_input_tokens_seen": 10924245728,
      "step": 13885
    },
    {
      "epoch": 1.4731593464884363,
      "grad_norm": 0.5271336958747201,
      "learning_rate": 4.8186769147905355e-05,
      "loss": 1.7755,
      "num_input_tokens_seen": 10925032480,
      "step": 13886
    },
    {
      "epoch": 1.4732654360280075,
      "grad_norm": 0.416243942803865,
      "learning_rate": 4.8186509293107716e-05,
      "loss": 1.7266,
      "num_input_tokens_seen": 10925819264,
      "step": 13887
    },
    {
      "epoch": 1.473371525567579,
      "grad_norm": 0.4995053837695419,
      "learning_rate": 4.818624942039223e-05,
      "loss": 1.7371,
      "num_input_tokens_seen": 10926605968,
      "step": 13888
    },
    {
      "epoch": 1.4734776151071505,
      "grad_norm": 0.36971574922104494,
      "learning_rate": 4.818598952975909e-05,
      "loss": 1.7195,
      "num_input_tokens_seen": 10927392752,
      "step": 13889
    },
    {
      "epoch": 1.473583704646722,
      "grad_norm": 0.38417901792441217,
      "learning_rate": 4.818572962120849e-05,
      "loss": 1.8118,
      "num_input_tokens_seen": 10928179520,
      "step": 13890
    },
    {
      "epoch": 1.4736897941862932,
      "grad_norm": 0.45615587339715746,
      "learning_rate": 4.818546969474065e-05,
      "loss": 1.7901,
      "num_input_tokens_seen": 10928966144,
      "step": 13891
    },
    {
      "epoch": 1.4737958837258647,
      "grad_norm": 0.4573216438168748,
      "learning_rate": 4.8185209750355756e-05,
      "loss": 1.8639,
      "num_input_tokens_seen": 10929752912,
      "step": 13892
    },
    {
      "epoch": 1.473901973265436,
      "grad_norm": 0.3948286593017075,
      "learning_rate": 4.8184949788054e-05,
      "loss": 1.8289,
      "num_input_tokens_seen": 10930539744,
      "step": 13893
    },
    {
      "epoch": 1.4740080628050074,
      "grad_norm": 0.6278964567232811,
      "learning_rate": 4.8184689807835606e-05,
      "loss": 1.6631,
      "num_input_tokens_seen": 10931326528,
      "step": 13894
    },
    {
      "epoch": 1.4741141523445789,
      "grad_norm": 0.4127183624600617,
      "learning_rate": 4.818442980970077e-05,
      "loss": 1.7731,
      "num_input_tokens_seen": 10932113280,
      "step": 13895
    },
    {
      "epoch": 1.4742202418841504,
      "grad_norm": 0.3867412180664704,
      "learning_rate": 4.818416979364968e-05,
      "loss": 1.7981,
      "num_input_tokens_seen": 10932900016,
      "step": 13896
    },
    {
      "epoch": 1.4743263314237216,
      "grad_norm": 0.6400302346336093,
      "learning_rate": 4.818390975968254e-05,
      "loss": 1.7269,
      "num_input_tokens_seen": 10933686816,
      "step": 13897
    },
    {
      "epoch": 1.474432420963293,
      "grad_norm": 0.37440159044738214,
      "learning_rate": 4.818364970779956e-05,
      "loss": 1.6744,
      "num_input_tokens_seen": 10934473536,
      "step": 13898
    },
    {
      "epoch": 1.4745385105028643,
      "grad_norm": 0.5039736774075972,
      "learning_rate": 4.818338963800093e-05,
      "loss": 1.7053,
      "num_input_tokens_seen": 10935260304,
      "step": 13899
    },
    {
      "epoch": 1.4746446000424358,
      "grad_norm": 0.4102421044226988,
      "learning_rate": 4.818312955028686e-05,
      "loss": 1.6937,
      "num_input_tokens_seen": 10936047152,
      "step": 13900
    },
    {
      "epoch": 1.4747506895820073,
      "grad_norm": 0.47781952228222835,
      "learning_rate": 4.818286944465755e-05,
      "loss": 1.75,
      "num_input_tokens_seen": 10936833856,
      "step": 13901
    },
    {
      "epoch": 1.4748567791215785,
      "grad_norm": 0.4441137800981365,
      "learning_rate": 4.8182609321113205e-05,
      "loss": 1.7797,
      "num_input_tokens_seen": 10937620560,
      "step": 13902
    },
    {
      "epoch": 1.47496286866115,
      "grad_norm": 0.45531512147425396,
      "learning_rate": 4.818234917965401e-05,
      "loss": 1.7378,
      "num_input_tokens_seen": 10938407216,
      "step": 13903
    },
    {
      "epoch": 1.4750689582007215,
      "grad_norm": 0.8334555574839608,
      "learning_rate": 4.8182089020280175e-05,
      "loss": 1.8005,
      "num_input_tokens_seen": 10939194016,
      "step": 13904
    },
    {
      "epoch": 1.4751750477402927,
      "grad_norm": 0.6019000892946286,
      "learning_rate": 4.8181828842991906e-05,
      "loss": 1.7555,
      "num_input_tokens_seen": 10939980704,
      "step": 13905
    },
    {
      "epoch": 1.4752811372798642,
      "grad_norm": 1.6924127538281004,
      "learning_rate": 4.81815686477894e-05,
      "loss": 1.7872,
      "num_input_tokens_seen": 10940767536,
      "step": 13906
    },
    {
      "epoch": 1.4753872268194357,
      "grad_norm": 0.7178372981810425,
      "learning_rate": 4.8181308434672854e-05,
      "loss": 1.7668,
      "num_input_tokens_seen": 10941554256,
      "step": 13907
    },
    {
      "epoch": 1.475493316359007,
      "grad_norm": 1.235794244547347,
      "learning_rate": 4.818104820364248e-05,
      "loss": 1.8502,
      "num_input_tokens_seen": 10942340880,
      "step": 13908
    },
    {
      "epoch": 1.4755994058985784,
      "grad_norm": 0.7652636410830699,
      "learning_rate": 4.818078795469847e-05,
      "loss": 1.6702,
      "num_input_tokens_seen": 10943127776,
      "step": 13909
    },
    {
      "epoch": 1.4757054954381497,
      "grad_norm": 0.7416139813736587,
      "learning_rate": 4.818052768784102e-05,
      "loss": 1.9055,
      "num_input_tokens_seen": 10943914480,
      "step": 13910
    },
    {
      "epoch": 1.4758115849777211,
      "grad_norm": 0.5062130140984616,
      "learning_rate": 4.8180267403070345e-05,
      "loss": 1.6684,
      "num_input_tokens_seen": 10944701264,
      "step": 13911
    },
    {
      "epoch": 1.4759176745172926,
      "grad_norm": 0.692818073373751,
      "learning_rate": 4.818000710038664e-05,
      "loss": 1.7378,
      "num_input_tokens_seen": 10945487984,
      "step": 13912
    },
    {
      "epoch": 1.476023764056864,
      "grad_norm": 0.5318726602063814,
      "learning_rate": 4.81797467797901e-05,
      "loss": 1.8127,
      "num_input_tokens_seen": 10946274752,
      "step": 13913
    },
    {
      "epoch": 1.4761298535964353,
      "grad_norm": 0.4809806783764568,
      "learning_rate": 4.817948644128093e-05,
      "loss": 1.7291,
      "num_input_tokens_seen": 10947061456,
      "step": 13914
    },
    {
      "epoch": 1.4762359431360068,
      "grad_norm": 0.6507961977753864,
      "learning_rate": 4.8179226084859344e-05,
      "loss": 1.8795,
      "num_input_tokens_seen": 10947848192,
      "step": 13915
    },
    {
      "epoch": 1.476342032675578,
      "grad_norm": 0.5143990421150926,
      "learning_rate": 4.817896571052552e-05,
      "loss": 1.8683,
      "num_input_tokens_seen": 10948634960,
      "step": 13916
    },
    {
      "epoch": 1.4764481222151495,
      "grad_norm": 0.5709217544282599,
      "learning_rate": 4.8178705318279684e-05,
      "loss": 1.7869,
      "num_input_tokens_seen": 10949421744,
      "step": 13917
    },
    {
      "epoch": 1.476554211754721,
      "grad_norm": 0.5652074025359982,
      "learning_rate": 4.8178444908122013e-05,
      "loss": 1.8686,
      "num_input_tokens_seen": 10950208544,
      "step": 13918
    },
    {
      "epoch": 1.4766603012942925,
      "grad_norm": 0.36635357031758176,
      "learning_rate": 4.8178184480052726e-05,
      "loss": 1.6286,
      "num_input_tokens_seen": 10950995264,
      "step": 13919
    },
    {
      "epoch": 1.4767663908338637,
      "grad_norm": 0.45658891336189306,
      "learning_rate": 4.817792403407202e-05,
      "loss": 1.6441,
      "num_input_tokens_seen": 10951782000,
      "step": 13920
    },
    {
      "epoch": 1.4768724803734352,
      "grad_norm": 0.48212755144385083,
      "learning_rate": 4.817766357018009e-05,
      "loss": 1.8793,
      "num_input_tokens_seen": 10952568752,
      "step": 13921
    },
    {
      "epoch": 1.4769785699130065,
      "grad_norm": 0.3641303664578823,
      "learning_rate": 4.8177403088377146e-05,
      "loss": 1.7858,
      "num_input_tokens_seen": 10953355616,
      "step": 13922
    },
    {
      "epoch": 1.477084659452578,
      "grad_norm": 0.43891184097001185,
      "learning_rate": 4.817714258866338e-05,
      "loss": 1.6945,
      "num_input_tokens_seen": 10954142400,
      "step": 13923
    },
    {
      "epoch": 1.4771907489921494,
      "grad_norm": 0.5306737402116851,
      "learning_rate": 4.8176882071039e-05,
      "loss": 1.7494,
      "num_input_tokens_seen": 10954929168,
      "step": 13924
    },
    {
      "epoch": 1.477296838531721,
      "grad_norm": 0.39143806354846156,
      "learning_rate": 4.817662153550421e-05,
      "loss": 1.7959,
      "num_input_tokens_seen": 10955715968,
      "step": 13925
    },
    {
      "epoch": 1.4774029280712921,
      "grad_norm": 0.37691324020720723,
      "learning_rate": 4.81763609820592e-05,
      "loss": 1.5624,
      "num_input_tokens_seen": 10956502784,
      "step": 13926
    },
    {
      "epoch": 1.4775090176108636,
      "grad_norm": 0.39540550193738905,
      "learning_rate": 4.8176100410704187e-05,
      "loss": 1.6951,
      "num_input_tokens_seen": 10957289600,
      "step": 13927
    },
    {
      "epoch": 1.4776151071504349,
      "grad_norm": 0.34782644693231757,
      "learning_rate": 4.817583982143935e-05,
      "loss": 1.788,
      "num_input_tokens_seen": 10958076432,
      "step": 13928
    },
    {
      "epoch": 1.4777211966900063,
      "grad_norm": 0.43290615387116166,
      "learning_rate": 4.8175579214264915e-05,
      "loss": 1.6212,
      "num_input_tokens_seen": 10958863200,
      "step": 13929
    },
    {
      "epoch": 1.4778272862295778,
      "grad_norm": 0.4954461646863963,
      "learning_rate": 4.817531858918107e-05,
      "loss": 1.8387,
      "num_input_tokens_seen": 10959649936,
      "step": 13930
    },
    {
      "epoch": 1.4779333757691493,
      "grad_norm": 0.36026607436755576,
      "learning_rate": 4.817505794618802e-05,
      "loss": 1.7294,
      "num_input_tokens_seen": 10960436752,
      "step": 13931
    },
    {
      "epoch": 1.4780394653087205,
      "grad_norm": 0.3763974064665975,
      "learning_rate": 4.8174797285285965e-05,
      "loss": 1.8774,
      "num_input_tokens_seen": 10961223472,
      "step": 13932
    },
    {
      "epoch": 1.478145554848292,
      "grad_norm": 0.3676547782144814,
      "learning_rate": 4.81745366064751e-05,
      "loss": 1.8376,
      "num_input_tokens_seen": 10962010256,
      "step": 13933
    },
    {
      "epoch": 1.4782516443878633,
      "grad_norm": 0.4472360426561159,
      "learning_rate": 4.817427590975564e-05,
      "loss": 1.7326,
      "num_input_tokens_seen": 10962797072,
      "step": 13934
    },
    {
      "epoch": 1.4783577339274347,
      "grad_norm": 0.3779236489987931,
      "learning_rate": 4.817401519512777e-05,
      "loss": 1.9025,
      "num_input_tokens_seen": 10963583792,
      "step": 13935
    },
    {
      "epoch": 1.4784638234670062,
      "grad_norm": 0.3790625930181379,
      "learning_rate": 4.817375446259171e-05,
      "loss": 1.7528,
      "num_input_tokens_seen": 10964370592,
      "step": 13936
    },
    {
      "epoch": 1.4785699130065775,
      "grad_norm": 0.31924338375345335,
      "learning_rate": 4.8173493712147656e-05,
      "loss": 1.6488,
      "num_input_tokens_seen": 10965157392,
      "step": 13937
    },
    {
      "epoch": 1.478676002546149,
      "grad_norm": 0.39733477839569853,
      "learning_rate": 4.8173232943795805e-05,
      "loss": 1.6995,
      "num_input_tokens_seen": 10965944160,
      "step": 13938
    },
    {
      "epoch": 1.4787820920857204,
      "grad_norm": 0.3692174247020451,
      "learning_rate": 4.8172972157536356e-05,
      "loss": 1.7676,
      "num_input_tokens_seen": 10966730784,
      "step": 13939
    },
    {
      "epoch": 1.4788881816252917,
      "grad_norm": 0.5928942819045673,
      "learning_rate": 4.817271135336951e-05,
      "loss": 1.8046,
      "num_input_tokens_seen": 10967517440,
      "step": 13940
    },
    {
      "epoch": 1.4789942711648632,
      "grad_norm": 0.3738359089394796,
      "learning_rate": 4.817245053129548e-05,
      "loss": 1.6419,
      "num_input_tokens_seen": 10968304304,
      "step": 13941
    },
    {
      "epoch": 1.4791003607044346,
      "grad_norm": 0.4468990657942841,
      "learning_rate": 4.8172189691314454e-05,
      "loss": 1.6892,
      "num_input_tokens_seen": 10969091088,
      "step": 13942
    },
    {
      "epoch": 1.4792064502440059,
      "grad_norm": 0.4317427015515722,
      "learning_rate": 4.8171928833426646e-05,
      "loss": 1.6794,
      "num_input_tokens_seen": 10969877920,
      "step": 13943
    },
    {
      "epoch": 1.4793125397835774,
      "grad_norm": 0.5287846194158417,
      "learning_rate": 4.817166795763225e-05,
      "loss": 1.7943,
      "num_input_tokens_seen": 10970664624,
      "step": 13944
    },
    {
      "epoch": 1.4794186293231486,
      "grad_norm": 0.451628507336567,
      "learning_rate": 4.817140706393146e-05,
      "loss": 1.8343,
      "num_input_tokens_seen": 10971451392,
      "step": 13945
    },
    {
      "epoch": 1.47952471886272,
      "grad_norm": 0.5191888408624584,
      "learning_rate": 4.81711461523245e-05,
      "loss": 1.6767,
      "num_input_tokens_seen": 10972238128,
      "step": 13946
    },
    {
      "epoch": 1.4796308084022916,
      "grad_norm": 0.418269579555092,
      "learning_rate": 4.8170885222811545e-05,
      "loss": 1.7744,
      "num_input_tokens_seen": 10973024784,
      "step": 13947
    },
    {
      "epoch": 1.479736897941863,
      "grad_norm": 0.552444906732844,
      "learning_rate": 4.8170624275392815e-05,
      "loss": 1.7501,
      "num_input_tokens_seen": 10973811584,
      "step": 13948
    },
    {
      "epoch": 1.4798429874814343,
      "grad_norm": 0.38617342483696326,
      "learning_rate": 4.8170363310068514e-05,
      "loss": 1.6478,
      "num_input_tokens_seen": 10974598400,
      "step": 13949
    },
    {
      "epoch": 1.4799490770210058,
      "grad_norm": 0.4542166882929946,
      "learning_rate": 4.817010232683883e-05,
      "loss": 1.6803,
      "num_input_tokens_seen": 10975385120,
      "step": 13950
    },
    {
      "epoch": 1.480055166560577,
      "grad_norm": 0.4497028912339581,
      "learning_rate": 4.816984132570397e-05,
      "loss": 1.7181,
      "num_input_tokens_seen": 10976171824,
      "step": 13951
    },
    {
      "epoch": 1.4801612561001485,
      "grad_norm": 0.3977448646944727,
      "learning_rate": 4.816958030666413e-05,
      "loss": 1.7297,
      "num_input_tokens_seen": 10976958592,
      "step": 13952
    },
    {
      "epoch": 1.48026734563972,
      "grad_norm": 0.4583270267791806,
      "learning_rate": 4.816931926971953e-05,
      "loss": 1.6932,
      "num_input_tokens_seen": 10977745376,
      "step": 13953
    },
    {
      "epoch": 1.4803734351792914,
      "grad_norm": 0.37722942542271476,
      "learning_rate": 4.8169058214870356e-05,
      "loss": 1.6714,
      "num_input_tokens_seen": 10978532176,
      "step": 13954
    },
    {
      "epoch": 1.4804795247188627,
      "grad_norm": 0.39213911125340306,
      "learning_rate": 4.816879714211681e-05,
      "loss": 1.7081,
      "num_input_tokens_seen": 10979319008,
      "step": 13955
    },
    {
      "epoch": 1.4805856142584342,
      "grad_norm": 0.4643003378551433,
      "learning_rate": 4.81685360514591e-05,
      "loss": 1.7959,
      "num_input_tokens_seen": 10980105760,
      "step": 13956
    },
    {
      "epoch": 1.4806917037980054,
      "grad_norm": 0.4164820415977987,
      "learning_rate": 4.816827494289743e-05,
      "loss": 1.8341,
      "num_input_tokens_seen": 10980892528,
      "step": 13957
    },
    {
      "epoch": 1.4807977933375769,
      "grad_norm": 0.3649324162757149,
      "learning_rate": 4.816801381643199e-05,
      "loss": 1.7275,
      "num_input_tokens_seen": 10981679280,
      "step": 13958
    },
    {
      "epoch": 1.4809038828771484,
      "grad_norm": 0.36463099674451405,
      "learning_rate": 4.816775267206299e-05,
      "loss": 1.7163,
      "num_input_tokens_seen": 10982466128,
      "step": 13959
    },
    {
      "epoch": 1.4810099724167198,
      "grad_norm": 0.3332338450151539,
      "learning_rate": 4.816749150979063e-05,
      "loss": 1.737,
      "num_input_tokens_seen": 10983252832,
      "step": 13960
    },
    {
      "epoch": 1.481116061956291,
      "grad_norm": 0.39416587650873447,
      "learning_rate": 4.816723032961511e-05,
      "loss": 1.7196,
      "num_input_tokens_seen": 10984039552,
      "step": 13961
    },
    {
      "epoch": 1.4812221514958626,
      "grad_norm": 0.4065501829792242,
      "learning_rate": 4.8166969131536644e-05,
      "loss": 1.8716,
      "num_input_tokens_seen": 10984826336,
      "step": 13962
    },
    {
      "epoch": 1.4813282410354338,
      "grad_norm": 0.4180412008225637,
      "learning_rate": 4.816670791555541e-05,
      "loss": 1.8749,
      "num_input_tokens_seen": 10985612992,
      "step": 13963
    },
    {
      "epoch": 1.4814343305750053,
      "grad_norm": 0.4663881642455079,
      "learning_rate": 4.816644668167164e-05,
      "loss": 1.8953,
      "num_input_tokens_seen": 10986399648,
      "step": 13964
    },
    {
      "epoch": 1.4815404201145768,
      "grad_norm": 0.3804243093412164,
      "learning_rate": 4.816618542988551e-05,
      "loss": 1.7471,
      "num_input_tokens_seen": 10987186432,
      "step": 13965
    },
    {
      "epoch": 1.4816465096541482,
      "grad_norm": 0.4482665744950892,
      "learning_rate": 4.816592416019723e-05,
      "loss": 1.6727,
      "num_input_tokens_seen": 10987973152,
      "step": 13966
    },
    {
      "epoch": 1.4817525991937195,
      "grad_norm": 0.3869789726396402,
      "learning_rate": 4.816566287260701e-05,
      "loss": 1.712,
      "num_input_tokens_seen": 10988759920,
      "step": 13967
    },
    {
      "epoch": 1.481858688733291,
      "grad_norm": 0.38273870030364454,
      "learning_rate": 4.8165401567115034e-05,
      "loss": 1.885,
      "num_input_tokens_seen": 10989546608,
      "step": 13968
    },
    {
      "epoch": 1.4819647782728622,
      "grad_norm": 0.44666145840924826,
      "learning_rate": 4.816514024372153e-05,
      "loss": 1.747,
      "num_input_tokens_seen": 10990333424,
      "step": 13969
    },
    {
      "epoch": 1.4820708678124337,
      "grad_norm": 0.4001680642368026,
      "learning_rate": 4.816487890242668e-05,
      "loss": 1.8155,
      "num_input_tokens_seen": 10991120224,
      "step": 13970
    },
    {
      "epoch": 1.4821769573520052,
      "grad_norm": 0.38742343907106097,
      "learning_rate": 4.8164617543230685e-05,
      "loss": 1.8653,
      "num_input_tokens_seen": 10991907056,
      "step": 13971
    },
    {
      "epoch": 1.4822830468915764,
      "grad_norm": 0.4181225214454484,
      "learning_rate": 4.8164356166133765e-05,
      "loss": 1.7105,
      "num_input_tokens_seen": 10992693776,
      "step": 13972
    },
    {
      "epoch": 1.482389136431148,
      "grad_norm": 0.4630836485826918,
      "learning_rate": 4.81640947711361e-05,
      "loss": 1.7925,
      "num_input_tokens_seen": 10993480512,
      "step": 13973
    },
    {
      "epoch": 1.4824952259707194,
      "grad_norm": 0.39366226091892037,
      "learning_rate": 4.8163833358237906e-05,
      "loss": 1.7109,
      "num_input_tokens_seen": 10994267280,
      "step": 13974
    },
    {
      "epoch": 1.4826013155102906,
      "grad_norm": 0.48753140961026464,
      "learning_rate": 4.8163571927439374e-05,
      "loss": 1.7579,
      "num_input_tokens_seen": 10995054032,
      "step": 13975
    },
    {
      "epoch": 1.482707405049862,
      "grad_norm": 0.3642554685625193,
      "learning_rate": 4.8163310478740725e-05,
      "loss": 1.5568,
      "num_input_tokens_seen": 10995840832,
      "step": 13976
    },
    {
      "epoch": 1.4828134945894336,
      "grad_norm": 0.4411434380479213,
      "learning_rate": 4.816304901214215e-05,
      "loss": 1.6506,
      "num_input_tokens_seen": 10996627600,
      "step": 13977
    },
    {
      "epoch": 1.4829195841290048,
      "grad_norm": 0.4534251708431521,
      "learning_rate": 4.8162787527643837e-05,
      "loss": 1.7579,
      "num_input_tokens_seen": 10997414400,
      "step": 13978
    },
    {
      "epoch": 1.4830256736685763,
      "grad_norm": 0.5109487438539999,
      "learning_rate": 4.8162526025246016e-05,
      "loss": 1.6695,
      "num_input_tokens_seen": 10998201136,
      "step": 13979
    },
    {
      "epoch": 1.4831317632081475,
      "grad_norm": 0.451618923810497,
      "learning_rate": 4.816226450494886e-05,
      "loss": 1.6992,
      "num_input_tokens_seen": 10998987984,
      "step": 13980
    },
    {
      "epoch": 1.483237852747719,
      "grad_norm": 0.5040897438821211,
      "learning_rate": 4.8162002966752594e-05,
      "loss": 1.8196,
      "num_input_tokens_seen": 10999774688,
      "step": 13981
    },
    {
      "epoch": 1.4833439422872905,
      "grad_norm": 0.5998609690909629,
      "learning_rate": 4.816174141065741e-05,
      "loss": 1.9019,
      "num_input_tokens_seen": 11000561440,
      "step": 13982
    },
    {
      "epoch": 1.483450031826862,
      "grad_norm": 0.456531620457897,
      "learning_rate": 4.8161479836663514e-05,
      "loss": 1.902,
      "num_input_tokens_seen": 11001348144,
      "step": 13983
    },
    {
      "epoch": 1.4835561213664332,
      "grad_norm": 0.4254697355716918,
      "learning_rate": 4.8161218244771114e-05,
      "loss": 1.7902,
      "num_input_tokens_seen": 11002134976,
      "step": 13984
    },
    {
      "epoch": 1.4836622109060047,
      "grad_norm": 0.45952718018687977,
      "learning_rate": 4.816095663498039e-05,
      "loss": 1.638,
      "num_input_tokens_seen": 11002921744,
      "step": 13985
    },
    {
      "epoch": 1.483768300445576,
      "grad_norm": 0.5367961903751475,
      "learning_rate": 4.816069500729156e-05,
      "loss": 1.7606,
      "num_input_tokens_seen": 11003708528,
      "step": 13986
    },
    {
      "epoch": 1.4838743899851474,
      "grad_norm": 0.5518862157471408,
      "learning_rate": 4.8160433361704825e-05,
      "loss": 1.811,
      "num_input_tokens_seen": 11004495376,
      "step": 13987
    },
    {
      "epoch": 1.483980479524719,
      "grad_norm": 0.4927635046697259,
      "learning_rate": 4.816017169822039e-05,
      "loss": 1.7711,
      "num_input_tokens_seen": 11005282064,
      "step": 13988
    },
    {
      "epoch": 1.4840865690642904,
      "grad_norm": 0.5576629467031848,
      "learning_rate": 4.815991001683846e-05,
      "loss": 1.6997,
      "num_input_tokens_seen": 11006068784,
      "step": 13989
    },
    {
      "epoch": 1.4841926586038616,
      "grad_norm": 0.3746010047714153,
      "learning_rate": 4.815964831755922e-05,
      "loss": 1.7268,
      "num_input_tokens_seen": 11006855696,
      "step": 13990
    },
    {
      "epoch": 1.484298748143433,
      "grad_norm": 0.5117579905800549,
      "learning_rate": 4.8159386600382896e-05,
      "loss": 1.7363,
      "num_input_tokens_seen": 11007642416,
      "step": 13991
    },
    {
      "epoch": 1.4844048376830044,
      "grad_norm": 0.44001804304289077,
      "learning_rate": 4.8159124865309665e-05,
      "loss": 1.8971,
      "num_input_tokens_seen": 11008429152,
      "step": 13992
    },
    {
      "epoch": 1.4845109272225758,
      "grad_norm": 0.37638852529393535,
      "learning_rate": 4.8158863112339746e-05,
      "loss": 1.7958,
      "num_input_tokens_seen": 11009215808,
      "step": 13993
    },
    {
      "epoch": 1.4846170167621473,
      "grad_norm": 0.3922139482251925,
      "learning_rate": 4.8158601341473336e-05,
      "loss": 1.7964,
      "num_input_tokens_seen": 11010002608,
      "step": 13994
    },
    {
      "epoch": 1.4847231063017188,
      "grad_norm": 0.48535670934497815,
      "learning_rate": 4.815833955271064e-05,
      "loss": 1.7472,
      "num_input_tokens_seen": 11010789360,
      "step": 13995
    },
    {
      "epoch": 1.48482919584129,
      "grad_norm": 0.3755179593759761,
      "learning_rate": 4.8158077746051854e-05,
      "loss": 1.7008,
      "num_input_tokens_seen": 11011576208,
      "step": 13996
    },
    {
      "epoch": 1.4849352853808615,
      "grad_norm": 0.37188679107852984,
      "learning_rate": 4.8157815921497195e-05,
      "loss": 1.7471,
      "num_input_tokens_seen": 11012363008,
      "step": 13997
    },
    {
      "epoch": 1.4850413749204328,
      "grad_norm": 0.4587894971082966,
      "learning_rate": 4.815755407904685e-05,
      "loss": 1.8838,
      "num_input_tokens_seen": 11013149840,
      "step": 13998
    },
    {
      "epoch": 1.4851474644600042,
      "grad_norm": 0.47194896280795445,
      "learning_rate": 4.815729221870102e-05,
      "loss": 1.7364,
      "num_input_tokens_seen": 11013936640,
      "step": 13999
    },
    {
      "epoch": 1.4852535539995757,
      "grad_norm": 0.4808721622881608,
      "learning_rate": 4.815703034045993e-05,
      "loss": 1.7368,
      "num_input_tokens_seen": 11014723344,
      "step": 14000
    },
    {
      "epoch": 1.4852535539995757,
      "eval_loss": 1.7736831903457642,
      "eval_runtime": 66.1996,
      "eval_samples_per_second": 45.318,
      "eval_steps_per_second": 0.483,
      "num_input_tokens_seen": 11014723344,
      "step": 14000
    },
    {
      "epoch": 1.4853596435391472,
      "grad_norm": 0.47315098274574696,
      "learning_rate": 4.8156768444323755e-05,
      "loss": 1.7793,
      "num_input_tokens_seen": 11015510032,
      "step": 14001
    },
    {
      "epoch": 1.4854657330787184,
      "grad_norm": 0.5855337931048145,
      "learning_rate": 4.815650653029271e-05,
      "loss": 1.7178,
      "num_input_tokens_seen": 11016296848,
      "step": 14002
    },
    {
      "epoch": 1.48557182261829,
      "grad_norm": 0.43976533468139883,
      "learning_rate": 4.8156244598366997e-05,
      "loss": 1.7823,
      "num_input_tokens_seen": 11017083600,
      "step": 14003
    },
    {
      "epoch": 1.4856779121578612,
      "grad_norm": 0.3981241556379362,
      "learning_rate": 4.815598264854682e-05,
      "loss": 1.788,
      "num_input_tokens_seen": 11017870336,
      "step": 14004
    },
    {
      "epoch": 1.4857840016974326,
      "grad_norm": 0.4211328687636218,
      "learning_rate": 4.815572068083237e-05,
      "loss": 1.7638,
      "num_input_tokens_seen": 11018657152,
      "step": 14005
    },
    {
      "epoch": 1.485890091237004,
      "grad_norm": 0.44773959232886507,
      "learning_rate": 4.815545869522386e-05,
      "loss": 1.6912,
      "num_input_tokens_seen": 11019443904,
      "step": 14006
    },
    {
      "epoch": 1.4859961807765754,
      "grad_norm": 0.4066146389659338,
      "learning_rate": 4.8155196691721506e-05,
      "loss": 1.7581,
      "num_input_tokens_seen": 11020230656,
      "step": 14007
    },
    {
      "epoch": 1.4861022703161468,
      "grad_norm": 0.42878562096739914,
      "learning_rate": 4.815493467032548e-05,
      "loss": 1.6874,
      "num_input_tokens_seen": 11021017456,
      "step": 14008
    },
    {
      "epoch": 1.4862083598557183,
      "grad_norm": 0.4023310239200722,
      "learning_rate": 4.8154672631036014e-05,
      "loss": 1.7873,
      "num_input_tokens_seen": 11021804240,
      "step": 14009
    },
    {
      "epoch": 1.4863144493952896,
      "grad_norm": 0.353023945929316,
      "learning_rate": 4.8154410573853283e-05,
      "loss": 1.6075,
      "num_input_tokens_seen": 11022591104,
      "step": 14010
    },
    {
      "epoch": 1.486420538934861,
      "grad_norm": 0.6590857169332163,
      "learning_rate": 4.8154148498777504e-05,
      "loss": 1.8271,
      "num_input_tokens_seen": 11023377856,
      "step": 14011
    },
    {
      "epoch": 1.4865266284744325,
      "grad_norm": 0.3255047204902679,
      "learning_rate": 4.8153886405808886e-05,
      "loss": 1.6067,
      "num_input_tokens_seen": 11024164656,
      "step": 14012
    },
    {
      "epoch": 1.4866327180140038,
      "grad_norm": 0.6762955512696687,
      "learning_rate": 4.815362429494762e-05,
      "loss": 1.7932,
      "num_input_tokens_seen": 11024951392,
      "step": 14013
    },
    {
      "epoch": 1.4867388075535752,
      "grad_norm": 0.6770550701283184,
      "learning_rate": 4.815336216619392e-05,
      "loss": 1.7722,
      "num_input_tokens_seen": 11025738144,
      "step": 14014
    },
    {
      "epoch": 1.4868448970931465,
      "grad_norm": 0.4678053294429335,
      "learning_rate": 4.815310001954797e-05,
      "loss": 1.8614,
      "num_input_tokens_seen": 11026524880,
      "step": 14015
    },
    {
      "epoch": 1.486950986632718,
      "grad_norm": 0.6618878974629371,
      "learning_rate": 4.815283785500998e-05,
      "loss": 1.8304,
      "num_input_tokens_seen": 11027311680,
      "step": 14016
    },
    {
      "epoch": 1.4870570761722894,
      "grad_norm": 0.4790479763677374,
      "learning_rate": 4.815257567258017e-05,
      "loss": 1.5952,
      "num_input_tokens_seen": 11028098496,
      "step": 14017
    },
    {
      "epoch": 1.487163165711861,
      "grad_norm": 0.40644335297559897,
      "learning_rate": 4.815231347225872e-05,
      "loss": 1.8323,
      "num_input_tokens_seen": 11028885264,
      "step": 14018
    },
    {
      "epoch": 1.4872692552514322,
      "grad_norm": 0.6530452517420957,
      "learning_rate": 4.8152051254045844e-05,
      "loss": 1.9088,
      "num_input_tokens_seen": 11029672080,
      "step": 14019
    },
    {
      "epoch": 1.4873753447910036,
      "grad_norm": 0.3927368783006503,
      "learning_rate": 4.815178901794174e-05,
      "loss": 1.7992,
      "num_input_tokens_seen": 11030458832,
      "step": 14020
    },
    {
      "epoch": 1.487481434330575,
      "grad_norm": 0.5210273752000826,
      "learning_rate": 4.815152676394662e-05,
      "loss": 1.7224,
      "num_input_tokens_seen": 11031245536,
      "step": 14021
    },
    {
      "epoch": 1.4875875238701464,
      "grad_norm": 0.48178941831390837,
      "learning_rate": 4.815126449206067e-05,
      "loss": 1.7117,
      "num_input_tokens_seen": 11032032320,
      "step": 14022
    },
    {
      "epoch": 1.4876936134097178,
      "grad_norm": 0.4299731653099258,
      "learning_rate": 4.8151002202284105e-05,
      "loss": 1.6685,
      "num_input_tokens_seen": 11032819136,
      "step": 14023
    },
    {
      "epoch": 1.4877997029492893,
      "grad_norm": 0.4834802715462103,
      "learning_rate": 4.815073989461712e-05,
      "loss": 1.7664,
      "num_input_tokens_seen": 11033605792,
      "step": 14024
    },
    {
      "epoch": 1.4879057924888606,
      "grad_norm": 0.46672278060796085,
      "learning_rate": 4.815047756905994e-05,
      "loss": 1.7213,
      "num_input_tokens_seen": 11034392640,
      "step": 14025
    },
    {
      "epoch": 1.488011882028432,
      "grad_norm": 0.41541585621705124,
      "learning_rate": 4.815021522561274e-05,
      "loss": 1.8563,
      "num_input_tokens_seen": 11035179456,
      "step": 14026
    },
    {
      "epoch": 1.4881179715680033,
      "grad_norm": 0.46612356835798024,
      "learning_rate": 4.8149952864275726e-05,
      "loss": 1.8101,
      "num_input_tokens_seen": 11035966224,
      "step": 14027
    },
    {
      "epoch": 1.4882240611075748,
      "grad_norm": 0.7525553656573514,
      "learning_rate": 4.814969048504912e-05,
      "loss": 1.7882,
      "num_input_tokens_seen": 11036752928,
      "step": 14028
    },
    {
      "epoch": 1.4883301506471462,
      "grad_norm": 0.5332038650318599,
      "learning_rate": 4.81494280879331e-05,
      "loss": 1.7181,
      "num_input_tokens_seen": 11037539760,
      "step": 14029
    },
    {
      "epoch": 1.4884362401867177,
      "grad_norm": 1.5348929275856265,
      "learning_rate": 4.814916567292789e-05,
      "loss": 1.8711,
      "num_input_tokens_seen": 11038326496,
      "step": 14030
    },
    {
      "epoch": 1.488542329726289,
      "grad_norm": 0.43432579665336474,
      "learning_rate": 4.814890324003368e-05,
      "loss": 1.7118,
      "num_input_tokens_seen": 11039113248,
      "step": 14031
    },
    {
      "epoch": 1.4886484192658604,
      "grad_norm": 2.0050594800357944,
      "learning_rate": 4.8148640789250675e-05,
      "loss": 1.7837,
      "num_input_tokens_seen": 11039899952,
      "step": 14032
    },
    {
      "epoch": 1.4887545088054317,
      "grad_norm": 0.4377676347324592,
      "learning_rate": 4.814837832057908e-05,
      "loss": 1.6587,
      "num_input_tokens_seen": 11040686672,
      "step": 14033
    },
    {
      "epoch": 1.4888605983450032,
      "grad_norm": 0.8584464552882098,
      "learning_rate": 4.81481158340191e-05,
      "loss": 1.8047,
      "num_input_tokens_seen": 11041473376,
      "step": 14034
    },
    {
      "epoch": 1.4889666878845746,
      "grad_norm": 0.48281224777122156,
      "learning_rate": 4.8147853329570936e-05,
      "loss": 1.7878,
      "num_input_tokens_seen": 11042260128,
      "step": 14035
    },
    {
      "epoch": 1.489072777424146,
      "grad_norm": 0.6947242406567863,
      "learning_rate": 4.814759080723479e-05,
      "loss": 1.6621,
      "num_input_tokens_seen": 11043046960,
      "step": 14036
    },
    {
      "epoch": 1.4891788669637174,
      "grad_norm": 0.431725138798042,
      "learning_rate": 4.814732826701087e-05,
      "loss": 1.7238,
      "num_input_tokens_seen": 11043833696,
      "step": 14037
    },
    {
      "epoch": 1.4892849565032888,
      "grad_norm": 0.36670988661320236,
      "learning_rate": 4.8147065708899366e-05,
      "loss": 1.5924,
      "num_input_tokens_seen": 11044620464,
      "step": 14038
    },
    {
      "epoch": 1.48939104604286,
      "grad_norm": 0.5705408473626339,
      "learning_rate": 4.8146803132900485e-05,
      "loss": 1.6129,
      "num_input_tokens_seen": 11045407312,
      "step": 14039
    },
    {
      "epoch": 1.4894971355824316,
      "grad_norm": 0.5069578803511949,
      "learning_rate": 4.8146540539014444e-05,
      "loss": 1.9377,
      "num_input_tokens_seen": 11046194032,
      "step": 14040
    },
    {
      "epoch": 1.489603225122003,
      "grad_norm": 0.5806742139595826,
      "learning_rate": 4.814627792724143e-05,
      "loss": 1.8346,
      "num_input_tokens_seen": 11046980848,
      "step": 14041
    },
    {
      "epoch": 1.4897093146615743,
      "grad_norm": 0.4594254286822914,
      "learning_rate": 4.814601529758166e-05,
      "loss": 1.7323,
      "num_input_tokens_seen": 11047767680,
      "step": 14042
    },
    {
      "epoch": 1.4898154042011458,
      "grad_norm": 0.4468024415880448,
      "learning_rate": 4.8145752650035314e-05,
      "loss": 1.8004,
      "num_input_tokens_seen": 11048554432,
      "step": 14043
    },
    {
      "epoch": 1.489921493740717,
      "grad_norm": 0.40956924387837,
      "learning_rate": 4.814548998460262e-05,
      "loss": 1.9055,
      "num_input_tokens_seen": 11049341184,
      "step": 14044
    },
    {
      "epoch": 1.4900275832802885,
      "grad_norm": 0.38139951009114553,
      "learning_rate": 4.8145227301283766e-05,
      "loss": 1.675,
      "num_input_tokens_seen": 11050128096,
      "step": 14045
    },
    {
      "epoch": 1.49013367281986,
      "grad_norm": 0.5027050721014054,
      "learning_rate": 4.814496460007896e-05,
      "loss": 1.8381,
      "num_input_tokens_seen": 11050914864,
      "step": 14046
    },
    {
      "epoch": 1.4902397623594315,
      "grad_norm": 0.3858343851272025,
      "learning_rate": 4.814470188098841e-05,
      "loss": 1.6831,
      "num_input_tokens_seen": 11051701744,
      "step": 14047
    },
    {
      "epoch": 1.4903458518990027,
      "grad_norm": 0.40108518341876553,
      "learning_rate": 4.814443914401231e-05,
      "loss": 1.7885,
      "num_input_tokens_seen": 11052488560,
      "step": 14048
    },
    {
      "epoch": 1.4904519414385742,
      "grad_norm": 0.5710904761256712,
      "learning_rate": 4.814417638915086e-05,
      "loss": 1.6547,
      "num_input_tokens_seen": 11053275312,
      "step": 14049
    },
    {
      "epoch": 1.4905580309781454,
      "grad_norm": 0.42989356780885807,
      "learning_rate": 4.814391361640428e-05,
      "loss": 1.7872,
      "num_input_tokens_seen": 11054062176,
      "step": 14050
    },
    {
      "epoch": 1.490664120517717,
      "grad_norm": 0.4063807525463638,
      "learning_rate": 4.814365082577276e-05,
      "loss": 1.7195,
      "num_input_tokens_seen": 11054848912,
      "step": 14051
    },
    {
      "epoch": 1.4907702100572884,
      "grad_norm": 0.4315215990257967,
      "learning_rate": 4.81433880172565e-05,
      "loss": 1.9165,
      "num_input_tokens_seen": 11055635648,
      "step": 14052
    },
    {
      "epoch": 1.4908762995968599,
      "grad_norm": 0.3899433514955249,
      "learning_rate": 4.814312519085571e-05,
      "loss": 1.6479,
      "num_input_tokens_seen": 11056422416,
      "step": 14053
    },
    {
      "epoch": 1.490982389136431,
      "grad_norm": 0.4263823687892097,
      "learning_rate": 4.81428623465706e-05,
      "loss": 1.7572,
      "num_input_tokens_seen": 11057209184,
      "step": 14054
    },
    {
      "epoch": 1.4910884786760026,
      "grad_norm": 0.4264948706811899,
      "learning_rate": 4.814259948440135e-05,
      "loss": 1.7972,
      "num_input_tokens_seen": 11057995984,
      "step": 14055
    },
    {
      "epoch": 1.4911945682155738,
      "grad_norm": 0.4089824687817248,
      "learning_rate": 4.8142336604348196e-05,
      "loss": 1.8196,
      "num_input_tokens_seen": 11058782768,
      "step": 14056
    },
    {
      "epoch": 1.4913006577551453,
      "grad_norm": 0.5607872090336278,
      "learning_rate": 4.81420737064113e-05,
      "loss": 1.7814,
      "num_input_tokens_seen": 11059569616,
      "step": 14057
    },
    {
      "epoch": 1.4914067472947168,
      "grad_norm": 0.724279488313094,
      "learning_rate": 4.8141810790590915e-05,
      "loss": 1.7762,
      "num_input_tokens_seen": 11060356304,
      "step": 14058
    },
    {
      "epoch": 1.4915128368342883,
      "grad_norm": 0.44320177083360635,
      "learning_rate": 4.81415478568872e-05,
      "loss": 1.8071,
      "num_input_tokens_seen": 11061142976,
      "step": 14059
    },
    {
      "epoch": 1.4916189263738595,
      "grad_norm": 0.39797115930626464,
      "learning_rate": 4.814128490530039e-05,
      "loss": 1.734,
      "num_input_tokens_seen": 11061929776,
      "step": 14060
    },
    {
      "epoch": 1.491725015913431,
      "grad_norm": 0.6289964497772992,
      "learning_rate": 4.814102193583066e-05,
      "loss": 1.815,
      "num_input_tokens_seen": 11062716544,
      "step": 14061
    },
    {
      "epoch": 1.4918311054530022,
      "grad_norm": 0.41856315190643056,
      "learning_rate": 4.814075894847824e-05,
      "loss": 1.6938,
      "num_input_tokens_seen": 11063503360,
      "step": 14062
    },
    {
      "epoch": 1.4919371949925737,
      "grad_norm": 0.4727919762956318,
      "learning_rate": 4.814049594324331e-05,
      "loss": 1.6266,
      "num_input_tokens_seen": 11064290096,
      "step": 14063
    },
    {
      "epoch": 1.4920432845321452,
      "grad_norm": 0.37702726596797864,
      "learning_rate": 4.814023292012608e-05,
      "loss": 1.802,
      "num_input_tokens_seen": 11065076800,
      "step": 14064
    },
    {
      "epoch": 1.4921493740717167,
      "grad_norm": 0.5295646708540183,
      "learning_rate": 4.8139969879126767e-05,
      "loss": 1.7245,
      "num_input_tokens_seen": 11065863584,
      "step": 14065
    },
    {
      "epoch": 1.492255463611288,
      "grad_norm": 0.6323807325278005,
      "learning_rate": 4.813970682024556e-05,
      "loss": 1.7634,
      "num_input_tokens_seen": 11066650352,
      "step": 14066
    },
    {
      "epoch": 1.4923615531508594,
      "grad_norm": 0.4960851070319241,
      "learning_rate": 4.813944374348267e-05,
      "loss": 1.7851,
      "num_input_tokens_seen": 11067437136,
      "step": 14067
    },
    {
      "epoch": 1.4924676426904306,
      "grad_norm": 0.5196788233817127,
      "learning_rate": 4.8139180648838297e-05,
      "loss": 1.8968,
      "num_input_tokens_seen": 11068223872,
      "step": 14068
    },
    {
      "epoch": 1.4925737322300021,
      "grad_norm": 0.5732577181685071,
      "learning_rate": 4.813891753631264e-05,
      "loss": 1.8289,
      "num_input_tokens_seen": 11069010608,
      "step": 14069
    },
    {
      "epoch": 1.4926798217695736,
      "grad_norm": 0.3839510162748899,
      "learning_rate": 4.81386544059059e-05,
      "loss": 1.6817,
      "num_input_tokens_seen": 11069797392,
      "step": 14070
    },
    {
      "epoch": 1.4927859113091448,
      "grad_norm": 0.5155067200946568,
      "learning_rate": 4.8138391257618296e-05,
      "loss": 1.8154,
      "num_input_tokens_seen": 11070584096,
      "step": 14071
    },
    {
      "epoch": 1.4928920008487163,
      "grad_norm": 0.45809770773794134,
      "learning_rate": 4.813812809145003e-05,
      "loss": 1.6984,
      "num_input_tokens_seen": 11071370976,
      "step": 14072
    },
    {
      "epoch": 1.4929980903882878,
      "grad_norm": 0.37897122451439413,
      "learning_rate": 4.8137864907401284e-05,
      "loss": 1.7106,
      "num_input_tokens_seen": 11072157744,
      "step": 14073
    },
    {
      "epoch": 1.493104179927859,
      "grad_norm": 0.43826228802851086,
      "learning_rate": 4.813760170547228e-05,
      "loss": 1.6915,
      "num_input_tokens_seen": 11072944512,
      "step": 14074
    },
    {
      "epoch": 1.4932102694674305,
      "grad_norm": 0.4041770577325892,
      "learning_rate": 4.813733848566322e-05,
      "loss": 1.6775,
      "num_input_tokens_seen": 11073731344,
      "step": 14075
    },
    {
      "epoch": 1.493316359007002,
      "grad_norm": 0.37477644528969384,
      "learning_rate": 4.81370752479743e-05,
      "loss": 1.7712,
      "num_input_tokens_seen": 11074518080,
      "step": 14076
    },
    {
      "epoch": 1.4934224485465732,
      "grad_norm": 0.4136402513299263,
      "learning_rate": 4.813681199240572e-05,
      "loss": 1.6307,
      "num_input_tokens_seen": 11075304832,
      "step": 14077
    },
    {
      "epoch": 1.4935285380861447,
      "grad_norm": 0.5203099167229898,
      "learning_rate": 4.8136548718957703e-05,
      "loss": 1.936,
      "num_input_tokens_seen": 11076091552,
      "step": 14078
    },
    {
      "epoch": 1.493634627625716,
      "grad_norm": 0.4768596765213081,
      "learning_rate": 4.813628542763043e-05,
      "loss": 1.8041,
      "num_input_tokens_seen": 11076878416,
      "step": 14079
    },
    {
      "epoch": 1.4937407171652874,
      "grad_norm": 0.4517608971972114,
      "learning_rate": 4.813602211842412e-05,
      "loss": 1.7751,
      "num_input_tokens_seen": 11077665104,
      "step": 14080
    },
    {
      "epoch": 1.493846806704859,
      "grad_norm": 0.3735631302403086,
      "learning_rate": 4.813575879133897e-05,
      "loss": 1.6242,
      "num_input_tokens_seen": 11078451840,
      "step": 14081
    },
    {
      "epoch": 1.4939528962444304,
      "grad_norm": 0.44555294833101367,
      "learning_rate": 4.813549544637518e-05,
      "loss": 1.7989,
      "num_input_tokens_seen": 11079238544,
      "step": 14082
    },
    {
      "epoch": 1.4940589857840016,
      "grad_norm": 0.3937868257192427,
      "learning_rate": 4.813523208353297e-05,
      "loss": 1.7595,
      "num_input_tokens_seen": 11080025296,
      "step": 14083
    },
    {
      "epoch": 1.4941650753235731,
      "grad_norm": 0.4107546315392471,
      "learning_rate": 4.813496870281252e-05,
      "loss": 1.7132,
      "num_input_tokens_seen": 11080812064,
      "step": 14084
    },
    {
      "epoch": 1.4942711648631444,
      "grad_norm": 0.38725590562995277,
      "learning_rate": 4.813470530421405e-05,
      "loss": 1.7349,
      "num_input_tokens_seen": 11081598912,
      "step": 14085
    },
    {
      "epoch": 1.4943772544027158,
      "grad_norm": 0.41109778972490374,
      "learning_rate": 4.8134441887737756e-05,
      "loss": 1.8064,
      "num_input_tokens_seen": 11082385744,
      "step": 14086
    },
    {
      "epoch": 1.4944833439422873,
      "grad_norm": 0.4313720266994758,
      "learning_rate": 4.813417845338385e-05,
      "loss": 1.6356,
      "num_input_tokens_seen": 11083172576,
      "step": 14087
    },
    {
      "epoch": 1.4945894334818588,
      "grad_norm": 0.38753946897992536,
      "learning_rate": 4.813391500115252e-05,
      "loss": 1.819,
      "num_input_tokens_seen": 11083959408,
      "step": 14088
    },
    {
      "epoch": 1.49469552302143,
      "grad_norm": 0.3867780585047195,
      "learning_rate": 4.813365153104399e-05,
      "loss": 1.7486,
      "num_input_tokens_seen": 11084746240,
      "step": 14089
    },
    {
      "epoch": 1.4948016125610015,
      "grad_norm": 0.3788573730813753,
      "learning_rate": 4.813338804305844e-05,
      "loss": 1.7924,
      "num_input_tokens_seen": 11085533056,
      "step": 14090
    },
    {
      "epoch": 1.4949077021005728,
      "grad_norm": 0.40801903584760824,
      "learning_rate": 4.8133124537196095e-05,
      "loss": 1.647,
      "num_input_tokens_seen": 11086319872,
      "step": 14091
    },
    {
      "epoch": 1.4950137916401443,
      "grad_norm": 0.37778796416307786,
      "learning_rate": 4.813286101345715e-05,
      "loss": 1.6895,
      "num_input_tokens_seen": 11087106672,
      "step": 14092
    },
    {
      "epoch": 1.4951198811797157,
      "grad_norm": 0.40941025910929013,
      "learning_rate": 4.81325974718418e-05,
      "loss": 1.7073,
      "num_input_tokens_seen": 11087893392,
      "step": 14093
    },
    {
      "epoch": 1.4952259707192872,
      "grad_norm": 0.4291447488310696,
      "learning_rate": 4.813233391235027e-05,
      "loss": 1.6645,
      "num_input_tokens_seen": 11088680160,
      "step": 14094
    },
    {
      "epoch": 1.4953320602588585,
      "grad_norm": 0.5506878310908151,
      "learning_rate": 4.813207033498275e-05,
      "loss": 1.635,
      "num_input_tokens_seen": 11089466912,
      "step": 14095
    },
    {
      "epoch": 1.49543814979843,
      "grad_norm": 0.5236386092984121,
      "learning_rate": 4.8131806739739435e-05,
      "loss": 1.8664,
      "num_input_tokens_seen": 11090253600,
      "step": 14096
    },
    {
      "epoch": 1.4955442393380012,
      "grad_norm": 0.5742113321969985,
      "learning_rate": 4.8131543126620545e-05,
      "loss": 1.7661,
      "num_input_tokens_seen": 11091040400,
      "step": 14097
    },
    {
      "epoch": 1.4956503288775727,
      "grad_norm": 0.3756762229055697,
      "learning_rate": 4.813127949562628e-05,
      "loss": 1.7022,
      "num_input_tokens_seen": 11091827184,
      "step": 14098
    },
    {
      "epoch": 1.4957564184171441,
      "grad_norm": 0.47497669314042706,
      "learning_rate": 4.813101584675683e-05,
      "loss": 1.7469,
      "num_input_tokens_seen": 11092613920,
      "step": 14099
    },
    {
      "epoch": 1.4958625079567156,
      "grad_norm": 0.36511440467824247,
      "learning_rate": 4.813075218001243e-05,
      "loss": 1.7941,
      "num_input_tokens_seen": 11093400640,
      "step": 14100
    },
    {
      "epoch": 1.4959685974962869,
      "grad_norm": 0.47282682282966926,
      "learning_rate": 4.8130488495393247e-05,
      "loss": 1.6925,
      "num_input_tokens_seen": 11094187408,
      "step": 14101
    },
    {
      "epoch": 1.4960746870358583,
      "grad_norm": 0.45965184894446975,
      "learning_rate": 4.8130224792899506e-05,
      "loss": 1.7828,
      "num_input_tokens_seen": 11094974144,
      "step": 14102
    },
    {
      "epoch": 1.4961807765754296,
      "grad_norm": 0.5559274739573684,
      "learning_rate": 4.8129961072531406e-05,
      "loss": 1.7442,
      "num_input_tokens_seen": 11095760912,
      "step": 14103
    },
    {
      "epoch": 1.496286866115001,
      "grad_norm": 0.474292925829885,
      "learning_rate": 4.812969733428915e-05,
      "loss": 1.8516,
      "num_input_tokens_seen": 11096547584,
      "step": 14104
    },
    {
      "epoch": 1.4963929556545725,
      "grad_norm": 0.579106811412616,
      "learning_rate": 4.812943357817293e-05,
      "loss": 1.7591,
      "num_input_tokens_seen": 11097334384,
      "step": 14105
    },
    {
      "epoch": 1.4964990451941438,
      "grad_norm": 0.4262421817231153,
      "learning_rate": 4.812916980418298e-05,
      "loss": 1.7685,
      "num_input_tokens_seen": 11098121184,
      "step": 14106
    },
    {
      "epoch": 1.4966051347337153,
      "grad_norm": 0.4200674274748926,
      "learning_rate": 4.812890601231948e-05,
      "loss": 1.844,
      "num_input_tokens_seen": 11098907920,
      "step": 14107
    },
    {
      "epoch": 1.4967112242732867,
      "grad_norm": 0.4495023437859097,
      "learning_rate": 4.812864220258264e-05,
      "loss": 1.7753,
      "num_input_tokens_seen": 11099694736,
      "step": 14108
    },
    {
      "epoch": 1.496817313812858,
      "grad_norm": 0.4331026053644904,
      "learning_rate": 4.812837837497267e-05,
      "loss": 1.8657,
      "num_input_tokens_seen": 11100481504,
      "step": 14109
    },
    {
      "epoch": 1.4969234033524295,
      "grad_norm": 0.37066624980106866,
      "learning_rate": 4.812811452948976e-05,
      "loss": 1.6759,
      "num_input_tokens_seen": 11101268240,
      "step": 14110
    },
    {
      "epoch": 1.497029492892001,
      "grad_norm": 0.6211573569456612,
      "learning_rate": 4.812785066613412e-05,
      "loss": 1.7967,
      "num_input_tokens_seen": 11102054944,
      "step": 14111
    },
    {
      "epoch": 1.4971355824315722,
      "grad_norm": 0.399634149047427,
      "learning_rate": 4.8127586784905965e-05,
      "loss": 1.6756,
      "num_input_tokens_seen": 11102841712,
      "step": 14112
    },
    {
      "epoch": 1.4972416719711437,
      "grad_norm": 0.6734184558371775,
      "learning_rate": 4.812732288580548e-05,
      "loss": 1.9096,
      "num_input_tokens_seen": 11103628416,
      "step": 14113
    },
    {
      "epoch": 1.497347761510715,
      "grad_norm": 0.47802917787389027,
      "learning_rate": 4.8127058968832884e-05,
      "loss": 1.7035,
      "num_input_tokens_seen": 11104415136,
      "step": 14114
    },
    {
      "epoch": 1.4974538510502864,
      "grad_norm": 0.7976226732175953,
      "learning_rate": 4.812679503398838e-05,
      "loss": 1.8645,
      "num_input_tokens_seen": 11105201936,
      "step": 14115
    },
    {
      "epoch": 1.4975599405898579,
      "grad_norm": 0.5158791624124608,
      "learning_rate": 4.812653108127215e-05,
      "loss": 1.8139,
      "num_input_tokens_seen": 11105988640,
      "step": 14116
    },
    {
      "epoch": 1.4976660301294293,
      "grad_norm": 0.5621961626446512,
      "learning_rate": 4.812626711068443e-05,
      "loss": 1.8308,
      "num_input_tokens_seen": 11106775392,
      "step": 14117
    },
    {
      "epoch": 1.4977721196690006,
      "grad_norm": 0.40920437511220914,
      "learning_rate": 4.812600312222541e-05,
      "loss": 1.7147,
      "num_input_tokens_seen": 11107562048,
      "step": 14118
    },
    {
      "epoch": 1.497878209208572,
      "grad_norm": 0.4498037992770801,
      "learning_rate": 4.812573911589528e-05,
      "loss": 1.6559,
      "num_input_tokens_seen": 11108348960,
      "step": 14119
    },
    {
      "epoch": 1.4979842987481433,
      "grad_norm": 0.42097720082604945,
      "learning_rate": 4.8125475091694275e-05,
      "loss": 1.7004,
      "num_input_tokens_seen": 11109135680,
      "step": 14120
    },
    {
      "epoch": 1.4980903882877148,
      "grad_norm": 0.6029497397373876,
      "learning_rate": 4.812521104962257e-05,
      "loss": 1.7766,
      "num_input_tokens_seen": 11109922400,
      "step": 14121
    },
    {
      "epoch": 1.4981964778272863,
      "grad_norm": 0.46499572210544315,
      "learning_rate": 4.812494698968039e-05,
      "loss": 1.9589,
      "num_input_tokens_seen": 11110709152,
      "step": 14122
    },
    {
      "epoch": 1.4983025673668577,
      "grad_norm": 0.5695165546864771,
      "learning_rate": 4.8124682911867926e-05,
      "loss": 1.7522,
      "num_input_tokens_seen": 11111495952,
      "step": 14123
    },
    {
      "epoch": 1.498408656906429,
      "grad_norm": 0.4839353737654469,
      "learning_rate": 4.812441881618538e-05,
      "loss": 1.8763,
      "num_input_tokens_seen": 11112282704,
      "step": 14124
    },
    {
      "epoch": 1.4985147464460005,
      "grad_norm": 0.3963077130051391,
      "learning_rate": 4.812415470263296e-05,
      "loss": 1.8301,
      "num_input_tokens_seen": 11113069472,
      "step": 14125
    },
    {
      "epoch": 1.4986208359855717,
      "grad_norm": 0.4597688810399669,
      "learning_rate": 4.8123890571210886e-05,
      "loss": 1.7193,
      "num_input_tokens_seen": 11113856208,
      "step": 14126
    },
    {
      "epoch": 1.4987269255251432,
      "grad_norm": 0.44142573303762134,
      "learning_rate": 4.8123626421919334e-05,
      "loss": 1.8364,
      "num_input_tokens_seen": 11114642960,
      "step": 14127
    },
    {
      "epoch": 1.4988330150647147,
      "grad_norm": 0.44402579540685344,
      "learning_rate": 4.812336225475852e-05,
      "loss": 1.72,
      "num_input_tokens_seen": 11115429760,
      "step": 14128
    },
    {
      "epoch": 1.4989391046042861,
      "grad_norm": 0.4112635388548648,
      "learning_rate": 4.8123098069728655e-05,
      "loss": 1.5982,
      "num_input_tokens_seen": 11116216496,
      "step": 14129
    },
    {
      "epoch": 1.4990451941438574,
      "grad_norm": 0.48735751393594223,
      "learning_rate": 4.812283386682994e-05,
      "loss": 1.7343,
      "num_input_tokens_seen": 11117003264,
      "step": 14130
    },
    {
      "epoch": 1.4991512836834289,
      "grad_norm": 0.4032891176986245,
      "learning_rate": 4.8122569646062584e-05,
      "loss": 1.8066,
      "num_input_tokens_seen": 11117790112,
      "step": 14131
    },
    {
      "epoch": 1.4992573732230001,
      "grad_norm": 0.5740620420317557,
      "learning_rate": 4.812230540742677e-05,
      "loss": 1.8023,
      "num_input_tokens_seen": 11118576848,
      "step": 14132
    },
    {
      "epoch": 1.4993634627625716,
      "grad_norm": 0.39453800445746184,
      "learning_rate": 4.812204115092273e-05,
      "loss": 1.6307,
      "num_input_tokens_seen": 11119363664,
      "step": 14133
    },
    {
      "epoch": 1.499469552302143,
      "grad_norm": 0.4463965344676716,
      "learning_rate": 4.812177687655065e-05,
      "loss": 1.6962,
      "num_input_tokens_seen": 11120150336,
      "step": 14134
    },
    {
      "epoch": 1.4995756418417143,
      "grad_norm": 0.410300161089828,
      "learning_rate": 4.812151258431073e-05,
      "loss": 1.709,
      "num_input_tokens_seen": 11120937184,
      "step": 14135
    },
    {
      "epoch": 1.4996817313812858,
      "grad_norm": 0.4070505521059149,
      "learning_rate": 4.81212482742032e-05,
      "loss": 1.8027,
      "num_input_tokens_seen": 11121723952,
      "step": 14136
    },
    {
      "epoch": 1.4997878209208573,
      "grad_norm": 0.3825651655325276,
      "learning_rate": 4.812098394622824e-05,
      "loss": 1.5784,
      "num_input_tokens_seen": 11122510768,
      "step": 14137
    },
    {
      "epoch": 1.4998939104604285,
      "grad_norm": 0.39941731336688097,
      "learning_rate": 4.812071960038606e-05,
      "loss": 1.8661,
      "num_input_tokens_seen": 11123297536,
      "step": 14138
    },
    {
      "epoch": 1.5,
      "grad_norm": 0.40005046986284937,
      "learning_rate": 4.8120455236676873e-05,
      "loss": 1.7289,
      "num_input_tokens_seen": 11124084256,
      "step": 14139
    },
    {
      "epoch": 1.5001060895395715,
      "grad_norm": 0.35741652098918064,
      "learning_rate": 4.812019085510087e-05,
      "loss": 1.7787,
      "num_input_tokens_seen": 11124871040,
      "step": 14140
    },
    {
      "epoch": 1.500212179079143,
      "grad_norm": 0.3941753532076252,
      "learning_rate": 4.811992645565826e-05,
      "loss": 1.7371,
      "num_input_tokens_seen": 11125657648,
      "step": 14141
    },
    {
      "epoch": 1.5003182686187142,
      "grad_norm": 0.43159321574566334,
      "learning_rate": 4.8119662038349256e-05,
      "loss": 1.7767,
      "num_input_tokens_seen": 11126444400,
      "step": 14142
    },
    {
      "epoch": 1.5004243581582855,
      "grad_norm": 0.37061942400085446,
      "learning_rate": 4.8119397603174056e-05,
      "loss": 1.7524,
      "num_input_tokens_seen": 11127231216,
      "step": 14143
    },
    {
      "epoch": 1.500530447697857,
      "grad_norm": 0.44427858907706835,
      "learning_rate": 4.811913315013286e-05,
      "loss": 1.6897,
      "num_input_tokens_seen": 11128018000,
      "step": 14144
    },
    {
      "epoch": 1.5006365372374284,
      "grad_norm": 0.37642637891652786,
      "learning_rate": 4.811886867922587e-05,
      "loss": 1.7867,
      "num_input_tokens_seen": 11128804768,
      "step": 14145
    },
    {
      "epoch": 1.5007426267769999,
      "grad_norm": 0.4269300520042764,
      "learning_rate": 4.8118604190453306e-05,
      "loss": 1.784,
      "num_input_tokens_seen": 11129591584,
      "step": 14146
    },
    {
      "epoch": 1.5008487163165714,
      "grad_norm": 0.4283921607947014,
      "learning_rate": 4.811833968381536e-05,
      "loss": 1.7746,
      "num_input_tokens_seen": 11130378352,
      "step": 14147
    },
    {
      "epoch": 1.5009548058561426,
      "grad_norm": 0.4703946416051123,
      "learning_rate": 4.8118075159312234e-05,
      "loss": 1.6947,
      "num_input_tokens_seen": 11131165072,
      "step": 14148
    },
    {
      "epoch": 1.5010608953957139,
      "grad_norm": 0.4466006560859161,
      "learning_rate": 4.811781061694415e-05,
      "loss": 1.7365,
      "num_input_tokens_seen": 11131951776,
      "step": 14149
    },
    {
      "epoch": 1.5011669849352853,
      "grad_norm": 0.508803021472917,
      "learning_rate": 4.8117546056711296e-05,
      "loss": 1.7632,
      "num_input_tokens_seen": 11132738512,
      "step": 14150
    },
    {
      "epoch": 1.5012730744748568,
      "grad_norm": 0.3709625856330138,
      "learning_rate": 4.8117281478613875e-05,
      "loss": 1.8308,
      "num_input_tokens_seen": 11133525248,
      "step": 14151
    },
    {
      "epoch": 1.5013791640144283,
      "grad_norm": 0.5172479925447522,
      "learning_rate": 4.8117016882652096e-05,
      "loss": 1.7039,
      "num_input_tokens_seen": 11134312064,
      "step": 14152
    },
    {
      "epoch": 1.5014852535539995,
      "grad_norm": 0.37133834347647954,
      "learning_rate": 4.811675226882617e-05,
      "loss": 1.8548,
      "num_input_tokens_seen": 11135098848,
      "step": 14153
    },
    {
      "epoch": 1.501591343093571,
      "grad_norm": 0.42296003012597144,
      "learning_rate": 4.8116487637136296e-05,
      "loss": 1.7596,
      "num_input_tokens_seen": 11135885520,
      "step": 14154
    },
    {
      "epoch": 1.5016974326331423,
      "grad_norm": 0.34197277507441576,
      "learning_rate": 4.811622298758268e-05,
      "loss": 1.6215,
      "num_input_tokens_seen": 11136672272,
      "step": 14155
    },
    {
      "epoch": 1.5018035221727137,
      "grad_norm": 0.4099577645592649,
      "learning_rate": 4.811595832016552e-05,
      "loss": 1.7992,
      "num_input_tokens_seen": 11137458960,
      "step": 14156
    },
    {
      "epoch": 1.5019096117122852,
      "grad_norm": 0.3773432634871769,
      "learning_rate": 4.811569363488503e-05,
      "loss": 1.7992,
      "num_input_tokens_seen": 11138245792,
      "step": 14157
    },
    {
      "epoch": 1.5020157012518567,
      "grad_norm": 0.3520265681082409,
      "learning_rate": 4.811542893174141e-05,
      "loss": 1.8345,
      "num_input_tokens_seen": 11139032544,
      "step": 14158
    },
    {
      "epoch": 1.502121790791428,
      "grad_norm": 0.3874584317594839,
      "learning_rate": 4.811516421073486e-05,
      "loss": 1.8291,
      "num_input_tokens_seen": 11139819296,
      "step": 14159
    },
    {
      "epoch": 1.5022278803309994,
      "grad_norm": 0.3664269686807698,
      "learning_rate": 4.81148994718656e-05,
      "loss": 1.903,
      "num_input_tokens_seen": 11140606016,
      "step": 14160
    },
    {
      "epoch": 1.5023339698705707,
      "grad_norm": 0.3512963129679838,
      "learning_rate": 4.811463471513382e-05,
      "loss": 1.8067,
      "num_input_tokens_seen": 11141392784,
      "step": 14161
    },
    {
      "epoch": 1.5024400594101421,
      "grad_norm": 0.39378052273493663,
      "learning_rate": 4.811436994053973e-05,
      "loss": 1.7076,
      "num_input_tokens_seen": 11142179536,
      "step": 14162
    },
    {
      "epoch": 1.5025461489497136,
      "grad_norm": 0.35130394023759326,
      "learning_rate": 4.811410514808352e-05,
      "loss": 1.7989,
      "num_input_tokens_seen": 11142966368,
      "step": 14163
    },
    {
      "epoch": 1.502652238489285,
      "grad_norm": 0.360823275996863,
      "learning_rate": 4.811384033776542e-05,
      "loss": 1.8098,
      "num_input_tokens_seen": 11143753104,
      "step": 14164
    },
    {
      "epoch": 1.5027583280288563,
      "grad_norm": 0.36001006743673936,
      "learning_rate": 4.811357550958562e-05,
      "loss": 1.7662,
      "num_input_tokens_seen": 11144539856,
      "step": 14165
    },
    {
      "epoch": 1.5028644175684276,
      "grad_norm": 0.3440168416867929,
      "learning_rate": 4.8113310663544326e-05,
      "loss": 1.7415,
      "num_input_tokens_seen": 11145326704,
      "step": 14166
    },
    {
      "epoch": 1.502970507107999,
      "grad_norm": 0.3575276075051889,
      "learning_rate": 4.811304579964174e-05,
      "loss": 1.7453,
      "num_input_tokens_seen": 11146113376,
      "step": 14167
    },
    {
      "epoch": 1.5030765966475705,
      "grad_norm": 0.446648347230638,
      "learning_rate": 4.8112780917878075e-05,
      "loss": 1.903,
      "num_input_tokens_seen": 11146900080,
      "step": 14168
    },
    {
      "epoch": 1.503182686187142,
      "grad_norm": 0.36601233634696273,
      "learning_rate": 4.811251601825353e-05,
      "loss": 1.8365,
      "num_input_tokens_seen": 11147686832,
      "step": 14169
    },
    {
      "epoch": 1.5032887757267135,
      "grad_norm": 0.3928667151363275,
      "learning_rate": 4.8112251100768314e-05,
      "loss": 1.8134,
      "num_input_tokens_seen": 11148473504,
      "step": 14170
    },
    {
      "epoch": 1.5033948652662847,
      "grad_norm": 0.4361413857781214,
      "learning_rate": 4.8111986165422625e-05,
      "loss": 1.8398,
      "num_input_tokens_seen": 11149260352,
      "step": 14171
    },
    {
      "epoch": 1.503500954805856,
      "grad_norm": 0.3339314550108862,
      "learning_rate": 4.811172121221667e-05,
      "loss": 1.6445,
      "num_input_tokens_seen": 11150047152,
      "step": 14172
    },
    {
      "epoch": 1.5036070443454275,
      "grad_norm": 0.37679753278986544,
      "learning_rate": 4.8111456241150654e-05,
      "loss": 1.8422,
      "num_input_tokens_seen": 11150833872,
      "step": 14173
    },
    {
      "epoch": 1.503713133884999,
      "grad_norm": 0.31051689201334676,
      "learning_rate": 4.8111191252224785e-05,
      "loss": 1.7263,
      "num_input_tokens_seen": 11151620656,
      "step": 14174
    },
    {
      "epoch": 1.5038192234245704,
      "grad_norm": 0.36312997291452687,
      "learning_rate": 4.811092624543927e-05,
      "loss": 1.7939,
      "num_input_tokens_seen": 11152407456,
      "step": 14175
    },
    {
      "epoch": 1.503925312964142,
      "grad_norm": 0.35581672391098623,
      "learning_rate": 4.811066122079431e-05,
      "loss": 1.64,
      "num_input_tokens_seen": 11153194288,
      "step": 14176
    },
    {
      "epoch": 1.5040314025037131,
      "grad_norm": 0.3112666964356524,
      "learning_rate": 4.8110396178290097e-05,
      "loss": 1.7008,
      "num_input_tokens_seen": 11153981056,
      "step": 14177
    },
    {
      "epoch": 1.5041374920432844,
      "grad_norm": 0.3621355199209201,
      "learning_rate": 4.811013111792686e-05,
      "loss": 1.5663,
      "num_input_tokens_seen": 11154767888,
      "step": 14178
    },
    {
      "epoch": 1.5042435815828559,
      "grad_norm": 0.3092514205567026,
      "learning_rate": 4.810986603970479e-05,
      "loss": 1.7075,
      "num_input_tokens_seen": 11155554672,
      "step": 14179
    },
    {
      "epoch": 1.5043496711224273,
      "grad_norm": 0.46711536403665416,
      "learning_rate": 4.810960094362409e-05,
      "loss": 1.79,
      "num_input_tokens_seen": 11156341408,
      "step": 14180
    },
    {
      "epoch": 1.5044557606619988,
      "grad_norm": 0.3958860099233824,
      "learning_rate": 4.8109335829684966e-05,
      "loss": 1.6798,
      "num_input_tokens_seen": 11157128224,
      "step": 14181
    },
    {
      "epoch": 1.50456185020157,
      "grad_norm": 0.39191965273834833,
      "learning_rate": 4.8109070697887624e-05,
      "loss": 1.8173,
      "num_input_tokens_seen": 11157914976,
      "step": 14182
    },
    {
      "epoch": 1.5046679397411415,
      "grad_norm": 0.5189442686755991,
      "learning_rate": 4.810880554823228e-05,
      "loss": 1.6557,
      "num_input_tokens_seen": 11158701728,
      "step": 14183
    },
    {
      "epoch": 1.5047740292807128,
      "grad_norm": 0.33534462974126383,
      "learning_rate": 4.810854038071912e-05,
      "loss": 1.589,
      "num_input_tokens_seen": 11159488432,
      "step": 14184
    },
    {
      "epoch": 1.5048801188202843,
      "grad_norm": 0.42855077745411446,
      "learning_rate": 4.810827519534836e-05,
      "loss": 1.6065,
      "num_input_tokens_seen": 11160275248,
      "step": 14185
    },
    {
      "epoch": 1.5049862083598557,
      "grad_norm": 0.44192461035338915,
      "learning_rate": 4.810800999212021e-05,
      "loss": 1.7732,
      "num_input_tokens_seen": 11161062064,
      "step": 14186
    },
    {
      "epoch": 1.5050922978994272,
      "grad_norm": 0.3744271251649205,
      "learning_rate": 4.810774477103486e-05,
      "loss": 1.629,
      "num_input_tokens_seen": 11161848896,
      "step": 14187
    },
    {
      "epoch": 1.5051983874389985,
      "grad_norm": 0.5124050796386719,
      "learning_rate": 4.810747953209253e-05,
      "loss": 1.7462,
      "num_input_tokens_seen": 11162635568,
      "step": 14188
    },
    {
      "epoch": 1.50530447697857,
      "grad_norm": 0.41865938183608775,
      "learning_rate": 4.810721427529341e-05,
      "loss": 1.8529,
      "num_input_tokens_seen": 11163422272,
      "step": 14189
    },
    {
      "epoch": 1.5054105665181412,
      "grad_norm": 0.4126793818166873,
      "learning_rate": 4.810694900063771e-05,
      "loss": 1.9127,
      "num_input_tokens_seen": 11164209072,
      "step": 14190
    },
    {
      "epoch": 1.5055166560577127,
      "grad_norm": 0.367237497006591,
      "learning_rate": 4.8106683708125654e-05,
      "loss": 1.756,
      "num_input_tokens_seen": 11164995840,
      "step": 14191
    },
    {
      "epoch": 1.5056227455972842,
      "grad_norm": 0.4121946728988755,
      "learning_rate": 4.8106418397757416e-05,
      "loss": 1.8691,
      "num_input_tokens_seen": 11165782592,
      "step": 14192
    },
    {
      "epoch": 1.5057288351368556,
      "grad_norm": 0.383458670677046,
      "learning_rate": 4.810615306953322e-05,
      "loss": 1.9615,
      "num_input_tokens_seen": 11166569344,
      "step": 14193
    },
    {
      "epoch": 1.5058349246764269,
      "grad_norm": 0.3924893832547514,
      "learning_rate": 4.810588772345327e-05,
      "loss": 1.7501,
      "num_input_tokens_seen": 11167356080,
      "step": 14194
    },
    {
      "epoch": 1.5059410142159984,
      "grad_norm": 0.3689878686286021,
      "learning_rate": 4.8105622359517763e-05,
      "loss": 1.774,
      "num_input_tokens_seen": 11168142752,
      "step": 14195
    },
    {
      "epoch": 1.5060471037555696,
      "grad_norm": 0.3975546011637148,
      "learning_rate": 4.8105356977726914e-05,
      "loss": 1.7671,
      "num_input_tokens_seen": 11168929520,
      "step": 14196
    },
    {
      "epoch": 1.506153193295141,
      "grad_norm": 0.4841940023861302,
      "learning_rate": 4.810509157808092e-05,
      "loss": 1.7913,
      "num_input_tokens_seen": 11169716288,
      "step": 14197
    },
    {
      "epoch": 1.5062592828347126,
      "grad_norm": 0.41824552765471174,
      "learning_rate": 4.810482616057999e-05,
      "loss": 1.6658,
      "num_input_tokens_seen": 11170503104,
      "step": 14198
    },
    {
      "epoch": 1.506365372374284,
      "grad_norm": 0.4380418574675572,
      "learning_rate": 4.810456072522433e-05,
      "loss": 1.8052,
      "num_input_tokens_seen": 11171289696,
      "step": 14199
    },
    {
      "epoch": 1.5064714619138553,
      "grad_norm": 0.4048228826893981,
      "learning_rate": 4.810429527201414e-05,
      "loss": 1.6841,
      "num_input_tokens_seen": 11172076480,
      "step": 14200
    },
    {
      "epoch": 1.5065775514534265,
      "grad_norm": 0.5890596319972033,
      "learning_rate": 4.810402980094964e-05,
      "loss": 1.8037,
      "num_input_tokens_seen": 11172863216,
      "step": 14201
    },
    {
      "epoch": 1.506683640992998,
      "grad_norm": 0.41523759170300445,
      "learning_rate": 4.810376431203101e-05,
      "loss": 1.7522,
      "num_input_tokens_seen": 11173649952,
      "step": 14202
    },
    {
      "epoch": 1.5067897305325695,
      "grad_norm": 0.5040796421606033,
      "learning_rate": 4.810349880525847e-05,
      "loss": 1.6719,
      "num_input_tokens_seen": 11174436688,
      "step": 14203
    },
    {
      "epoch": 1.506895820072141,
      "grad_norm": 0.4229784433831545,
      "learning_rate": 4.810323328063222e-05,
      "loss": 1.7191,
      "num_input_tokens_seen": 11175223344,
      "step": 14204
    },
    {
      "epoch": 1.5070019096117124,
      "grad_norm": 0.5335665361235561,
      "learning_rate": 4.810296773815248e-05,
      "loss": 1.6388,
      "num_input_tokens_seen": 11176010192,
      "step": 14205
    },
    {
      "epoch": 1.5071079991512837,
      "grad_norm": 0.563952055008933,
      "learning_rate": 4.810270217781944e-05,
      "loss": 1.8058,
      "num_input_tokens_seen": 11176796928,
      "step": 14206
    },
    {
      "epoch": 1.507214088690855,
      "grad_norm": 0.5580532939112193,
      "learning_rate": 4.810243659963331e-05,
      "loss": 1.7201,
      "num_input_tokens_seen": 11177583712,
      "step": 14207
    },
    {
      "epoch": 1.5073201782304264,
      "grad_norm": 0.6025450476960651,
      "learning_rate": 4.8102171003594295e-05,
      "loss": 1.8365,
      "num_input_tokens_seen": 11178370432,
      "step": 14208
    },
    {
      "epoch": 1.5074262677699979,
      "grad_norm": 0.5992340140463948,
      "learning_rate": 4.81019053897026e-05,
      "loss": 1.7872,
      "num_input_tokens_seen": 11179157184,
      "step": 14209
    },
    {
      "epoch": 1.5075323573095694,
      "grad_norm": 0.5278312653927348,
      "learning_rate": 4.810163975795843e-05,
      "loss": 1.7036,
      "num_input_tokens_seen": 11179944000,
      "step": 14210
    },
    {
      "epoch": 1.5076384468491408,
      "grad_norm": 0.3964934266691001,
      "learning_rate": 4.810137410836199e-05,
      "loss": 1.7021,
      "num_input_tokens_seen": 11180730800,
      "step": 14211
    },
    {
      "epoch": 1.507744536388712,
      "grad_norm": 0.6812414198814648,
      "learning_rate": 4.810110844091349e-05,
      "loss": 1.9477,
      "num_input_tokens_seen": 11181517584,
      "step": 14212
    },
    {
      "epoch": 1.5078506259282833,
      "grad_norm": 0.4812729843727134,
      "learning_rate": 4.810084275561312e-05,
      "loss": 1.791,
      "num_input_tokens_seen": 11182304336,
      "step": 14213
    },
    {
      "epoch": 1.5079567154678548,
      "grad_norm": 0.6214511944903391,
      "learning_rate": 4.810057705246111e-05,
      "loss": 1.7968,
      "num_input_tokens_seen": 11183091104,
      "step": 14214
    },
    {
      "epoch": 1.5080628050074263,
      "grad_norm": 0.517570219950724,
      "learning_rate": 4.810031133145765e-05,
      "loss": 1.8257,
      "num_input_tokens_seen": 11183877856,
      "step": 14215
    },
    {
      "epoch": 1.5081688945469978,
      "grad_norm": 0.5800363345854569,
      "learning_rate": 4.810004559260294e-05,
      "loss": 1.7177,
      "num_input_tokens_seen": 11184664624,
      "step": 14216
    },
    {
      "epoch": 1.508274984086569,
      "grad_norm": 0.5615296182899924,
      "learning_rate": 4.8099779835897194e-05,
      "loss": 1.727,
      "num_input_tokens_seen": 11185451488,
      "step": 14217
    },
    {
      "epoch": 1.5083810736261405,
      "grad_norm": 0.41704368099835254,
      "learning_rate": 4.809951406134062e-05,
      "loss": 1.7358,
      "num_input_tokens_seen": 11186238288,
      "step": 14218
    },
    {
      "epoch": 1.5084871631657117,
      "grad_norm": 0.4557843505301267,
      "learning_rate": 4.8099248268933415e-05,
      "loss": 1.8446,
      "num_input_tokens_seen": 11187024976,
      "step": 14219
    },
    {
      "epoch": 1.5085932527052832,
      "grad_norm": 0.4695098971673979,
      "learning_rate": 4.809898245867579e-05,
      "loss": 1.763,
      "num_input_tokens_seen": 11187811728,
      "step": 14220
    },
    {
      "epoch": 1.5086993422448547,
      "grad_norm": 0.5186882500983222,
      "learning_rate": 4.809871663056795e-05,
      "loss": 1.8371,
      "num_input_tokens_seen": 11188598528,
      "step": 14221
    },
    {
      "epoch": 1.5088054317844262,
      "grad_norm": 0.47220931957915346,
      "learning_rate": 4.8098450784610106e-05,
      "loss": 1.7681,
      "num_input_tokens_seen": 11189385328,
      "step": 14222
    },
    {
      "epoch": 1.5089115213239974,
      "grad_norm": 0.5114535251840363,
      "learning_rate": 4.8098184920802445e-05,
      "loss": 1.8176,
      "num_input_tokens_seen": 11190172064,
      "step": 14223
    },
    {
      "epoch": 1.509017610863569,
      "grad_norm": 0.5537144708600007,
      "learning_rate": 4.809791903914519e-05,
      "loss": 1.7717,
      "num_input_tokens_seen": 11190958816,
      "step": 14224
    },
    {
      "epoch": 1.5091237004031401,
      "grad_norm": 0.5218325777368287,
      "learning_rate": 4.809765313963854e-05,
      "loss": 1.8272,
      "num_input_tokens_seen": 11191745648,
      "step": 14225
    },
    {
      "epoch": 1.5092297899427116,
      "grad_norm": 0.4260035900292303,
      "learning_rate": 4.8097387222282705e-05,
      "loss": 1.7459,
      "num_input_tokens_seen": 11192532464,
      "step": 14226
    },
    {
      "epoch": 1.509335879482283,
      "grad_norm": 0.469105960691144,
      "learning_rate": 4.8097121287077885e-05,
      "loss": 1.7448,
      "num_input_tokens_seen": 11193319168,
      "step": 14227
    },
    {
      "epoch": 1.5094419690218546,
      "grad_norm": 0.5049617079361121,
      "learning_rate": 4.8096855334024285e-05,
      "loss": 1.8686,
      "num_input_tokens_seen": 11194105952,
      "step": 14228
    },
    {
      "epoch": 1.5095480585614258,
      "grad_norm": 0.5752937136516466,
      "learning_rate": 4.8096589363122116e-05,
      "loss": 1.8553,
      "num_input_tokens_seen": 11194892736,
      "step": 14229
    },
    {
      "epoch": 1.5096541481009973,
      "grad_norm": 0.3684755909528881,
      "learning_rate": 4.809632337437158e-05,
      "loss": 1.7444,
      "num_input_tokens_seen": 11195679600,
      "step": 14230
    },
    {
      "epoch": 1.5097602376405685,
      "grad_norm": 0.5115494460219818,
      "learning_rate": 4.809605736777289e-05,
      "loss": 1.9228,
      "num_input_tokens_seen": 11196466336,
      "step": 14231
    },
    {
      "epoch": 1.50986632718014,
      "grad_norm": 0.3842925434886228,
      "learning_rate": 4.809579134332623e-05,
      "loss": 1.8639,
      "num_input_tokens_seen": 11197253120,
      "step": 14232
    },
    {
      "epoch": 1.5099724167197115,
      "grad_norm": 0.4691971781968123,
      "learning_rate": 4.809552530103183e-05,
      "loss": 1.7577,
      "num_input_tokens_seen": 11198039904,
      "step": 14233
    },
    {
      "epoch": 1.510078506259283,
      "grad_norm": 0.43822415261523084,
      "learning_rate": 4.8095259240889876e-05,
      "loss": 1.6315,
      "num_input_tokens_seen": 11198826752,
      "step": 14234
    },
    {
      "epoch": 1.5101845957988542,
      "grad_norm": 0.4923272226096208,
      "learning_rate": 4.809499316290059e-05,
      "loss": 1.843,
      "num_input_tokens_seen": 11199613456,
      "step": 14235
    },
    {
      "epoch": 1.5102906853384255,
      "grad_norm": 0.4309790087728749,
      "learning_rate": 4.809472706706417e-05,
      "loss": 1.8651,
      "num_input_tokens_seen": 11200400240,
      "step": 14236
    },
    {
      "epoch": 1.510396774877997,
      "grad_norm": 0.39587907638644226,
      "learning_rate": 4.809446095338083e-05,
      "loss": 1.7209,
      "num_input_tokens_seen": 11201186992,
      "step": 14237
    },
    {
      "epoch": 1.5105028644175684,
      "grad_norm": 0.4160104196273524,
      "learning_rate": 4.809419482185076e-05,
      "loss": 1.699,
      "num_input_tokens_seen": 11201973728,
      "step": 14238
    },
    {
      "epoch": 1.51060895395714,
      "grad_norm": 0.4451994181628282,
      "learning_rate": 4.8093928672474175e-05,
      "loss": 1.8627,
      "num_input_tokens_seen": 11202760480,
      "step": 14239
    },
    {
      "epoch": 1.5107150434967114,
      "grad_norm": 0.42389085761532425,
      "learning_rate": 4.809366250525128e-05,
      "loss": 1.7363,
      "num_input_tokens_seen": 11203547248,
      "step": 14240
    },
    {
      "epoch": 1.5108211330362826,
      "grad_norm": 0.3825460848491671,
      "learning_rate": 4.8093396320182274e-05,
      "loss": 1.7402,
      "num_input_tokens_seen": 11204334096,
      "step": 14241
    },
    {
      "epoch": 1.5109272225758539,
      "grad_norm": 0.4061259270494057,
      "learning_rate": 4.809313011726738e-05,
      "loss": 1.7718,
      "num_input_tokens_seen": 11205120800,
      "step": 14242
    },
    {
      "epoch": 1.5110333121154254,
      "grad_norm": 0.4097380512805586,
      "learning_rate": 4.809286389650679e-05,
      "loss": 1.8366,
      "num_input_tokens_seen": 11205907520,
      "step": 14243
    },
    {
      "epoch": 1.5111394016549968,
      "grad_norm": 0.47385417489088116,
      "learning_rate": 4.809259765790071e-05,
      "loss": 1.6285,
      "num_input_tokens_seen": 11206694368,
      "step": 14244
    },
    {
      "epoch": 1.5112454911945683,
      "grad_norm": 0.38200712455045766,
      "learning_rate": 4.809233140144934e-05,
      "loss": 1.7463,
      "num_input_tokens_seen": 11207481136,
      "step": 14245
    },
    {
      "epoch": 1.5113515807341398,
      "grad_norm": 0.5962987971581636,
      "learning_rate": 4.809206512715291e-05,
      "loss": 1.8528,
      "num_input_tokens_seen": 11208267808,
      "step": 14246
    },
    {
      "epoch": 1.511457670273711,
      "grad_norm": 0.35011094003910287,
      "learning_rate": 4.80917988350116e-05,
      "loss": 1.6882,
      "num_input_tokens_seen": 11209054624,
      "step": 14247
    },
    {
      "epoch": 1.5115637598132823,
      "grad_norm": 0.7972541875557354,
      "learning_rate": 4.8091532525025627e-05,
      "loss": 1.9039,
      "num_input_tokens_seen": 11209841392,
      "step": 14248
    },
    {
      "epoch": 1.5116698493528538,
      "grad_norm": 0.8260197204324367,
      "learning_rate": 4.80912661971952e-05,
      "loss": 1.7692,
      "num_input_tokens_seen": 11210628192,
      "step": 14249
    },
    {
      "epoch": 1.5117759388924252,
      "grad_norm": 0.4128038053832068,
      "learning_rate": 4.809099985152051e-05,
      "loss": 1.6743,
      "num_input_tokens_seen": 11211414928,
      "step": 14250
    },
    {
      "epoch": 1.5118820284319967,
      "grad_norm": 0.6227465624740838,
      "learning_rate": 4.809073348800178e-05,
      "loss": 1.6304,
      "num_input_tokens_seen": 11212201696,
      "step": 14251
    },
    {
      "epoch": 1.511988117971568,
      "grad_norm": 0.49138287718931406,
      "learning_rate": 4.8090467106639205e-05,
      "loss": 1.8154,
      "num_input_tokens_seen": 11212988400,
      "step": 14252
    },
    {
      "epoch": 1.5120942075111394,
      "grad_norm": 0.6633505423538316,
      "learning_rate": 4.8090200707432996e-05,
      "loss": 1.8145,
      "num_input_tokens_seen": 11213775184,
      "step": 14253
    },
    {
      "epoch": 1.5122002970507107,
      "grad_norm": 0.5597938595517334,
      "learning_rate": 4.808993429038335e-05,
      "loss": 1.692,
      "num_input_tokens_seen": 11214561936,
      "step": 14254
    },
    {
      "epoch": 1.5123063865902822,
      "grad_norm": 0.4785051986548008,
      "learning_rate": 4.8089667855490494e-05,
      "loss": 1.6785,
      "num_input_tokens_seen": 11215348576,
      "step": 14255
    },
    {
      "epoch": 1.5124124761298536,
      "grad_norm": 0.7803955034645464,
      "learning_rate": 4.8089401402754615e-05,
      "loss": 1.8981,
      "num_input_tokens_seen": 11216135296,
      "step": 14256
    },
    {
      "epoch": 1.512518565669425,
      "grad_norm": 0.5920604513419684,
      "learning_rate": 4.808913493217592e-05,
      "loss": 1.9352,
      "num_input_tokens_seen": 11216922112,
      "step": 14257
    },
    {
      "epoch": 1.5126246552089964,
      "grad_norm": 0.6346185159345258,
      "learning_rate": 4.8088868443754624e-05,
      "loss": 1.7198,
      "num_input_tokens_seen": 11217708880,
      "step": 14258
    },
    {
      "epoch": 1.5127307447485678,
      "grad_norm": 0.4966307500165942,
      "learning_rate": 4.808860193749093e-05,
      "loss": 1.5612,
      "num_input_tokens_seen": 11218495664,
      "step": 14259
    },
    {
      "epoch": 1.512836834288139,
      "grad_norm": 0.901875574065743,
      "learning_rate": 4.808833541338503e-05,
      "loss": 1.8016,
      "num_input_tokens_seen": 11219282368,
      "step": 14260
    },
    {
      "epoch": 1.5129429238277106,
      "grad_norm": 0.5103119120802811,
      "learning_rate": 4.8088068871437156e-05,
      "loss": 1.6233,
      "num_input_tokens_seen": 11220069136,
      "step": 14261
    },
    {
      "epoch": 1.513049013367282,
      "grad_norm": 1.0077778772603536,
      "learning_rate": 4.8087802311647487e-05,
      "loss": 1.8458,
      "num_input_tokens_seen": 11220855888,
      "step": 14262
    },
    {
      "epoch": 1.5131551029068535,
      "grad_norm": 0.3870810144652589,
      "learning_rate": 4.8087535734016254e-05,
      "loss": 1.8603,
      "num_input_tokens_seen": 11221642672,
      "step": 14263
    },
    {
      "epoch": 1.5132611924464248,
      "grad_norm": 0.5333865599415101,
      "learning_rate": 4.808726913854365e-05,
      "loss": 1.697,
      "num_input_tokens_seen": 11222429440,
      "step": 14264
    },
    {
      "epoch": 1.513367281985996,
      "grad_norm": 0.5377186366946283,
      "learning_rate": 4.808700252522987e-05,
      "loss": 1.6788,
      "num_input_tokens_seen": 11223216192,
      "step": 14265
    },
    {
      "epoch": 1.5134733715255675,
      "grad_norm": 0.3811450061436967,
      "learning_rate": 4.808673589407514e-05,
      "loss": 1.6087,
      "num_input_tokens_seen": 11224002960,
      "step": 14266
    },
    {
      "epoch": 1.513579461065139,
      "grad_norm": 0.4655328136159907,
      "learning_rate": 4.8086469245079655e-05,
      "loss": 1.6842,
      "num_input_tokens_seen": 11224789728,
      "step": 14267
    },
    {
      "epoch": 1.5136855506047104,
      "grad_norm": 0.5225810256832343,
      "learning_rate": 4.808620257824363e-05,
      "loss": 1.6596,
      "num_input_tokens_seen": 11225576528,
      "step": 14268
    },
    {
      "epoch": 1.513791640144282,
      "grad_norm": 0.4044999154951127,
      "learning_rate": 4.808593589356726e-05,
      "loss": 1.7304,
      "num_input_tokens_seen": 11226363376,
      "step": 14269
    },
    {
      "epoch": 1.5138977296838532,
      "grad_norm": 0.39842164852211254,
      "learning_rate": 4.8085669191050756e-05,
      "loss": 1.7185,
      "num_input_tokens_seen": 11227150128,
      "step": 14270
    },
    {
      "epoch": 1.5140038192234244,
      "grad_norm": 0.4675971611402294,
      "learning_rate": 4.808540247069433e-05,
      "loss": 1.7939,
      "num_input_tokens_seen": 11227936848,
      "step": 14271
    },
    {
      "epoch": 1.514109908762996,
      "grad_norm": 0.4588400455949902,
      "learning_rate": 4.8085135732498176e-05,
      "loss": 1.8206,
      "num_input_tokens_seen": 11228723648,
      "step": 14272
    },
    {
      "epoch": 1.5142159983025674,
      "grad_norm": 0.39873091738382843,
      "learning_rate": 4.8084868976462506e-05,
      "loss": 1.8004,
      "num_input_tokens_seen": 11229510368,
      "step": 14273
    },
    {
      "epoch": 1.5143220878421388,
      "grad_norm": 0.44820024781190665,
      "learning_rate": 4.808460220258752e-05,
      "loss": 1.8134,
      "num_input_tokens_seen": 11230297136,
      "step": 14274
    },
    {
      "epoch": 1.5144281773817103,
      "grad_norm": 0.4200367405422925,
      "learning_rate": 4.808433541087345e-05,
      "loss": 1.6867,
      "num_input_tokens_seen": 11231083920,
      "step": 14275
    },
    {
      "epoch": 1.5145342669212816,
      "grad_norm": 0.42299456919395356,
      "learning_rate": 4.808406860132047e-05,
      "loss": 1.7441,
      "num_input_tokens_seen": 11231870576,
      "step": 14276
    },
    {
      "epoch": 1.5146403564608528,
      "grad_norm": 0.41383740693910975,
      "learning_rate": 4.8083801773928805e-05,
      "loss": 1.7145,
      "num_input_tokens_seen": 11232657344,
      "step": 14277
    },
    {
      "epoch": 1.5147464460004243,
      "grad_norm": 0.4695608960185667,
      "learning_rate": 4.808353492869865e-05,
      "loss": 1.6742,
      "num_input_tokens_seen": 11233444144,
      "step": 14278
    },
    {
      "epoch": 1.5148525355399958,
      "grad_norm": 0.462890800016932,
      "learning_rate": 4.8083268065630213e-05,
      "loss": 1.7438,
      "num_input_tokens_seen": 11234230960,
      "step": 14279
    },
    {
      "epoch": 1.5149586250795672,
      "grad_norm": 0.9397575879376241,
      "learning_rate": 4.808300118472371e-05,
      "loss": 1.834,
      "num_input_tokens_seen": 11235017648,
      "step": 14280
    },
    {
      "epoch": 1.5150647146191387,
      "grad_norm": 0.5167492288508455,
      "learning_rate": 4.808273428597935e-05,
      "loss": 1.8093,
      "num_input_tokens_seen": 11235804416,
      "step": 14281
    },
    {
      "epoch": 1.51517080415871,
      "grad_norm": 1.2478703635477852,
      "learning_rate": 4.808246736939731e-05,
      "loss": 1.8269,
      "num_input_tokens_seen": 11236591168,
      "step": 14282
    },
    {
      "epoch": 1.5152768936982812,
      "grad_norm": 0.45036896637003715,
      "learning_rate": 4.808220043497783e-05,
      "loss": 1.7133,
      "num_input_tokens_seen": 11237377888,
      "step": 14283
    },
    {
      "epoch": 1.5153829832378527,
      "grad_norm": 1.0726302790242042,
      "learning_rate": 4.8081933482721097e-05,
      "loss": 1.7883,
      "num_input_tokens_seen": 11238164656,
      "step": 14284
    },
    {
      "epoch": 1.5154890727774242,
      "grad_norm": 1.035030140520428,
      "learning_rate": 4.808166651262733e-05,
      "loss": 1.8683,
      "num_input_tokens_seen": 11238951424,
      "step": 14285
    },
    {
      "epoch": 1.5155951623169956,
      "grad_norm": 0.9100204926418256,
      "learning_rate": 4.808139952469672e-05,
      "loss": 1.7515,
      "num_input_tokens_seen": 11239738224,
      "step": 14286
    },
    {
      "epoch": 1.515701251856567,
      "grad_norm": 2.3094265692981657,
      "learning_rate": 4.808113251892948e-05,
      "loss": 1.6784,
      "num_input_tokens_seen": 11240525024,
      "step": 14287
    },
    {
      "epoch": 1.5158073413961384,
      "grad_norm": 0.7891582399047783,
      "learning_rate": 4.808086549532583e-05,
      "loss": 1.7244,
      "num_input_tokens_seen": 11241311824,
      "step": 14288
    },
    {
      "epoch": 1.5159134309357096,
      "grad_norm": 1.7107540563784747,
      "learning_rate": 4.808059845388596e-05,
      "loss": 1.7657,
      "num_input_tokens_seen": 11242098544,
      "step": 14289
    },
    {
      "epoch": 1.516019520475281,
      "grad_norm": 0.9988042032190769,
      "learning_rate": 4.808033139461008e-05,
      "loss": 1.9503,
      "num_input_tokens_seen": 11242885264,
      "step": 14290
    },
    {
      "epoch": 1.5161256100148526,
      "grad_norm": 0.4488095801752083,
      "learning_rate": 4.8080064317498397e-05,
      "loss": 1.6721,
      "num_input_tokens_seen": 11243671984,
      "step": 14291
    },
    {
      "epoch": 1.516231699554424,
      "grad_norm": 0.7681366700055173,
      "learning_rate": 4.8079797222551116e-05,
      "loss": 1.8365,
      "num_input_tokens_seen": 11244458720,
      "step": 14292
    },
    {
      "epoch": 1.5163377890939953,
      "grad_norm": 0.7379713877066911,
      "learning_rate": 4.8079530109768444e-05,
      "loss": 1.87,
      "num_input_tokens_seen": 11245245456,
      "step": 14293
    },
    {
      "epoch": 1.5164438786335668,
      "grad_norm": 0.5442173254063561,
      "learning_rate": 4.807926297915059e-05,
      "loss": 1.7249,
      "num_input_tokens_seen": 11246032224,
      "step": 14294
    },
    {
      "epoch": 1.516549968173138,
      "grad_norm": 0.4753716849262596,
      "learning_rate": 4.807899583069776e-05,
      "loss": 1.6649,
      "num_input_tokens_seen": 11246818976,
      "step": 14295
    },
    {
      "epoch": 1.5166560577127095,
      "grad_norm": 0.6053868814927728,
      "learning_rate": 4.807872866441016e-05,
      "loss": 1.7754,
      "num_input_tokens_seen": 11247605792,
      "step": 14296
    },
    {
      "epoch": 1.516762147252281,
      "grad_norm": 0.4636755562417502,
      "learning_rate": 4.807846148028799e-05,
      "loss": 1.714,
      "num_input_tokens_seen": 11248392512,
      "step": 14297
    },
    {
      "epoch": 1.5168682367918525,
      "grad_norm": 0.46135014894555143,
      "learning_rate": 4.807819427833147e-05,
      "loss": 1.6768,
      "num_input_tokens_seen": 11249179232,
      "step": 14298
    },
    {
      "epoch": 1.5169743263314237,
      "grad_norm": 0.4585642394449149,
      "learning_rate": 4.807792705854078e-05,
      "loss": 1.8824,
      "num_input_tokens_seen": 11249966048,
      "step": 14299
    },
    {
      "epoch": 1.517080415870995,
      "grad_norm": 0.48396953990049213,
      "learning_rate": 4.807765982091617e-05,
      "loss": 1.7158,
      "num_input_tokens_seen": 11250752832,
      "step": 14300
    },
    {
      "epoch": 1.5171865054105664,
      "grad_norm": 0.43706224802017557,
      "learning_rate": 4.807739256545781e-05,
      "loss": 1.8789,
      "num_input_tokens_seen": 11251539536,
      "step": 14301
    },
    {
      "epoch": 1.517292594950138,
      "grad_norm": 0.35301056691457566,
      "learning_rate": 4.807712529216591e-05,
      "loss": 1.6214,
      "num_input_tokens_seen": 11252326384,
      "step": 14302
    },
    {
      "epoch": 1.5173986844897094,
      "grad_norm": 0.4847484868602406,
      "learning_rate": 4.8076858001040704e-05,
      "loss": 1.8488,
      "num_input_tokens_seen": 11253113152,
      "step": 14303
    },
    {
      "epoch": 1.5175047740292809,
      "grad_norm": 0.44630090384747795,
      "learning_rate": 4.807659069208237e-05,
      "loss": 1.8179,
      "num_input_tokens_seen": 11253900016,
      "step": 14304
    },
    {
      "epoch": 1.517610863568852,
      "grad_norm": 0.4775247450235152,
      "learning_rate": 4.807632336529112e-05,
      "loss": 1.7928,
      "num_input_tokens_seen": 11254686768,
      "step": 14305
    },
    {
      "epoch": 1.5177169531084234,
      "grad_norm": 0.4549157756075365,
      "learning_rate": 4.807605602066716e-05,
      "loss": 1.7388,
      "num_input_tokens_seen": 11255473664,
      "step": 14306
    },
    {
      "epoch": 1.5178230426479948,
      "grad_norm": 0.4171915899247766,
      "learning_rate": 4.8075788658210715e-05,
      "loss": 1.7734,
      "num_input_tokens_seen": 11256260368,
      "step": 14307
    },
    {
      "epoch": 1.5179291321875663,
      "grad_norm": 0.48449604152054565,
      "learning_rate": 4.807552127792197e-05,
      "loss": 1.7011,
      "num_input_tokens_seen": 11257047136,
      "step": 14308
    },
    {
      "epoch": 1.5180352217271378,
      "grad_norm": 0.43733781932256277,
      "learning_rate": 4.8075253879801144e-05,
      "loss": 1.5903,
      "num_input_tokens_seen": 11257833936,
      "step": 14309
    },
    {
      "epoch": 1.5181413112667093,
      "grad_norm": 0.42170232838435956,
      "learning_rate": 4.807498646384843e-05,
      "loss": 1.7628,
      "num_input_tokens_seen": 11258620624,
      "step": 14310
    },
    {
      "epoch": 1.5182474008062805,
      "grad_norm": 0.522059839679901,
      "learning_rate": 4.8074719030064046e-05,
      "loss": 1.7553,
      "num_input_tokens_seen": 11259407488,
      "step": 14311
    },
    {
      "epoch": 1.5183534903458518,
      "grad_norm": 0.440925051954747,
      "learning_rate": 4.80744515784482e-05,
      "loss": 1.6881,
      "num_input_tokens_seen": 11260194304,
      "step": 14312
    },
    {
      "epoch": 1.5184595798854232,
      "grad_norm": 0.4540493256829153,
      "learning_rate": 4.8074184109001096e-05,
      "loss": 1.8087,
      "num_input_tokens_seen": 11260981056,
      "step": 14313
    },
    {
      "epoch": 1.5185656694249947,
      "grad_norm": 0.36454710234450455,
      "learning_rate": 4.807391662172293e-05,
      "loss": 1.8116,
      "num_input_tokens_seen": 11261767792,
      "step": 14314
    },
    {
      "epoch": 1.5186717589645662,
      "grad_norm": 0.4094373971521964,
      "learning_rate": 4.807364911661393e-05,
      "loss": 1.7105,
      "num_input_tokens_seen": 11262554688,
      "step": 14315
    },
    {
      "epoch": 1.5187778485041374,
      "grad_norm": 0.37105492628463527,
      "learning_rate": 4.807338159367428e-05,
      "loss": 1.692,
      "num_input_tokens_seen": 11263341456,
      "step": 14316
    },
    {
      "epoch": 1.518883938043709,
      "grad_norm": 0.38732446451095254,
      "learning_rate": 4.807311405290421e-05,
      "loss": 1.7996,
      "num_input_tokens_seen": 11264128240,
      "step": 14317
    },
    {
      "epoch": 1.5189900275832802,
      "grad_norm": 0.3768462322058381,
      "learning_rate": 4.807284649430391e-05,
      "loss": 1.7527,
      "num_input_tokens_seen": 11264914992,
      "step": 14318
    },
    {
      "epoch": 1.5190961171228516,
      "grad_norm": 0.38174469962128804,
      "learning_rate": 4.807257891787359e-05,
      "loss": 1.6093,
      "num_input_tokens_seen": 11265701824,
      "step": 14319
    },
    {
      "epoch": 1.5192022066624231,
      "grad_norm": 0.3657979510246643,
      "learning_rate": 4.807231132361346e-05,
      "loss": 1.8063,
      "num_input_tokens_seen": 11266488592,
      "step": 14320
    },
    {
      "epoch": 1.5193082962019946,
      "grad_norm": 0.3636776082676258,
      "learning_rate": 4.8072043711523716e-05,
      "loss": 1.7003,
      "num_input_tokens_seen": 11267275360,
      "step": 14321
    },
    {
      "epoch": 1.5194143857415658,
      "grad_norm": 0.3892964365406573,
      "learning_rate": 4.807177608160458e-05,
      "loss": 1.7909,
      "num_input_tokens_seen": 11268062176,
      "step": 14322
    },
    {
      "epoch": 1.5195204752811373,
      "grad_norm": 0.37988912195045743,
      "learning_rate": 4.8071508433856256e-05,
      "loss": 1.6191,
      "num_input_tokens_seen": 11268848944,
      "step": 14323
    },
    {
      "epoch": 1.5196265648207086,
      "grad_norm": 0.3429321384817239,
      "learning_rate": 4.807124076827894e-05,
      "loss": 1.6258,
      "num_input_tokens_seen": 11269635776,
      "step": 14324
    },
    {
      "epoch": 1.51973265436028,
      "grad_norm": 0.42306731515461826,
      "learning_rate": 4.807097308487285e-05,
      "loss": 1.7837,
      "num_input_tokens_seen": 11270422512,
      "step": 14325
    },
    {
      "epoch": 1.5198387438998515,
      "grad_norm": 0.3852332692045078,
      "learning_rate": 4.807070538363819e-05,
      "loss": 1.739,
      "num_input_tokens_seen": 11271209216,
      "step": 14326
    },
    {
      "epoch": 1.519944833439423,
      "grad_norm": 0.45952262000752514,
      "learning_rate": 4.807043766457516e-05,
      "loss": 1.7418,
      "num_input_tokens_seen": 11271995952,
      "step": 14327
    },
    {
      "epoch": 1.5200509229789942,
      "grad_norm": 0.3851676356438794,
      "learning_rate": 4.807016992768398e-05,
      "loss": 1.7904,
      "num_input_tokens_seen": 11272782720,
      "step": 14328
    },
    {
      "epoch": 1.5201570125185657,
      "grad_norm": 0.3992053045661489,
      "learning_rate": 4.806990217296485e-05,
      "loss": 1.8927,
      "num_input_tokens_seen": 11273569424,
      "step": 14329
    },
    {
      "epoch": 1.520263102058137,
      "grad_norm": 0.46834365946680473,
      "learning_rate": 4.806963440041797e-05,
      "loss": 1.7643,
      "num_input_tokens_seen": 11274356176,
      "step": 14330
    },
    {
      "epoch": 1.5203691915977084,
      "grad_norm": 0.4177531560479222,
      "learning_rate": 4.806936661004356e-05,
      "loss": 1.6869,
      "num_input_tokens_seen": 11275142944,
      "step": 14331
    },
    {
      "epoch": 1.52047528113728,
      "grad_norm": 0.47380479071554427,
      "learning_rate": 4.806909880184181e-05,
      "loss": 1.8234,
      "num_input_tokens_seen": 11275929728,
      "step": 14332
    },
    {
      "epoch": 1.5205813706768514,
      "grad_norm": 0.3766547561017228,
      "learning_rate": 4.806883097581295e-05,
      "loss": 1.8685,
      "num_input_tokens_seen": 11276716368,
      "step": 14333
    },
    {
      "epoch": 1.5206874602164226,
      "grad_norm": 0.43711822361458536,
      "learning_rate": 4.806856313195717e-05,
      "loss": 1.8098,
      "num_input_tokens_seen": 11277503152,
      "step": 14334
    },
    {
      "epoch": 1.520793549755994,
      "grad_norm": 0.5192447123252547,
      "learning_rate": 4.8068295270274676e-05,
      "loss": 1.9197,
      "num_input_tokens_seen": 11278289856,
      "step": 14335
    },
    {
      "epoch": 1.5208996392955654,
      "grad_norm": 0.37956661269990266,
      "learning_rate": 4.806802739076569e-05,
      "loss": 1.7151,
      "num_input_tokens_seen": 11279076496,
      "step": 14336
    },
    {
      "epoch": 1.5210057288351368,
      "grad_norm": 0.36655454178644936,
      "learning_rate": 4.80677594934304e-05,
      "loss": 1.6065,
      "num_input_tokens_seen": 11279863200,
      "step": 14337
    },
    {
      "epoch": 1.5211118183747083,
      "grad_norm": 0.4954671575770031,
      "learning_rate": 4.806749157826903e-05,
      "loss": 1.886,
      "num_input_tokens_seen": 11280649936,
      "step": 14338
    },
    {
      "epoch": 1.5212179079142798,
      "grad_norm": 0.5407246627850467,
      "learning_rate": 4.806722364528177e-05,
      "loss": 1.9755,
      "num_input_tokens_seen": 11281436704,
      "step": 14339
    },
    {
      "epoch": 1.521323997453851,
      "grad_norm": 0.4175945456350972,
      "learning_rate": 4.806695569446884e-05,
      "loss": 1.8193,
      "num_input_tokens_seen": 11282223472,
      "step": 14340
    },
    {
      "epoch": 1.5214300869934223,
      "grad_norm": 0.7300897806795683,
      "learning_rate": 4.806668772583045e-05,
      "loss": 1.7773,
      "num_input_tokens_seen": 11283010240,
      "step": 14341
    },
    {
      "epoch": 1.5215361765329938,
      "grad_norm": 0.4156776785745395,
      "learning_rate": 4.8066419739366796e-05,
      "loss": 1.9566,
      "num_input_tokens_seen": 11283796896,
      "step": 14342
    },
    {
      "epoch": 1.5216422660725653,
      "grad_norm": 0.6354230235285988,
      "learning_rate": 4.806615173507809e-05,
      "loss": 1.7191,
      "num_input_tokens_seen": 11284583632,
      "step": 14343
    },
    {
      "epoch": 1.5217483556121367,
      "grad_norm": 0.4579256522898117,
      "learning_rate": 4.8065883712964535e-05,
      "loss": 1.82,
      "num_input_tokens_seen": 11285370336,
      "step": 14344
    },
    {
      "epoch": 1.5218544451517082,
      "grad_norm": 0.4605934621072541,
      "learning_rate": 4.806561567302634e-05,
      "loss": 1.8574,
      "num_input_tokens_seen": 11286157152,
      "step": 14345
    },
    {
      "epoch": 1.5219605346912795,
      "grad_norm": 0.3633241026987599,
      "learning_rate": 4.8065347615263724e-05,
      "loss": 1.7317,
      "num_input_tokens_seen": 11286943920,
      "step": 14346
    },
    {
      "epoch": 1.5220666242308507,
      "grad_norm": 0.39851828731567607,
      "learning_rate": 4.806507953967688e-05,
      "loss": 1.7422,
      "num_input_tokens_seen": 11287730608,
      "step": 14347
    },
    {
      "epoch": 1.5221727137704222,
      "grad_norm": 0.4156906253571665,
      "learning_rate": 4.806481144626602e-05,
      "loss": 1.7302,
      "num_input_tokens_seen": 11288517408,
      "step": 14348
    },
    {
      "epoch": 1.5222788033099937,
      "grad_norm": 0.3896850028710436,
      "learning_rate": 4.806454333503135e-05,
      "loss": 1.8093,
      "num_input_tokens_seen": 11289304224,
      "step": 14349
    },
    {
      "epoch": 1.5223848928495651,
      "grad_norm": 0.4043128283186239,
      "learning_rate": 4.8064275205973074e-05,
      "loss": 1.8475,
      "num_input_tokens_seen": 11290091008,
      "step": 14350
    },
    {
      "epoch": 1.5224909823891364,
      "grad_norm": 0.40351734031040226,
      "learning_rate": 4.806400705909141e-05,
      "loss": 1.7177,
      "num_input_tokens_seen": 11290877808,
      "step": 14351
    },
    {
      "epoch": 1.5225970719287079,
      "grad_norm": 0.43060881932129585,
      "learning_rate": 4.806373889438655e-05,
      "loss": 1.8346,
      "num_input_tokens_seen": 11291664592,
      "step": 14352
    },
    {
      "epoch": 1.522703161468279,
      "grad_norm": 0.44792386040802945,
      "learning_rate": 4.8063470711858716e-05,
      "loss": 1.8187,
      "num_input_tokens_seen": 11292451344,
      "step": 14353
    },
    {
      "epoch": 1.5228092510078506,
      "grad_norm": 0.41883291002444134,
      "learning_rate": 4.8063202511508096e-05,
      "loss": 1.7204,
      "num_input_tokens_seen": 11293238128,
      "step": 14354
    },
    {
      "epoch": 1.522915340547422,
      "grad_norm": 0.41000074994836594,
      "learning_rate": 4.8062934293334926e-05,
      "loss": 1.7994,
      "num_input_tokens_seen": 11294024864,
      "step": 14355
    },
    {
      "epoch": 1.5230214300869935,
      "grad_norm": 0.5118164912804949,
      "learning_rate": 4.806266605733939e-05,
      "loss": 1.7549,
      "num_input_tokens_seen": 11294811648,
      "step": 14356
    },
    {
      "epoch": 1.5231275196265648,
      "grad_norm": 0.43985170401861523,
      "learning_rate": 4.8062397803521706e-05,
      "loss": 1.7174,
      "num_input_tokens_seen": 11295598512,
      "step": 14357
    },
    {
      "epoch": 1.5232336091661363,
      "grad_norm": 0.43037254044307893,
      "learning_rate": 4.806212953188207e-05,
      "loss": 1.8395,
      "num_input_tokens_seen": 11296385184,
      "step": 14358
    },
    {
      "epoch": 1.5233396987057075,
      "grad_norm": 0.36512873612385655,
      "learning_rate": 4.80618612424207e-05,
      "loss": 1.7992,
      "num_input_tokens_seen": 11297172016,
      "step": 14359
    },
    {
      "epoch": 1.523445788245279,
      "grad_norm": 0.3815292232497865,
      "learning_rate": 4.80615929351378e-05,
      "loss": 1.6348,
      "num_input_tokens_seen": 11297958880,
      "step": 14360
    },
    {
      "epoch": 1.5235518777848505,
      "grad_norm": 0.3914926922130703,
      "learning_rate": 4.806132461003358e-05,
      "loss": 1.8133,
      "num_input_tokens_seen": 11298745632,
      "step": 14361
    },
    {
      "epoch": 1.523657967324422,
      "grad_norm": 0.40698947590070783,
      "learning_rate": 4.806105626710825e-05,
      "loss": 1.7903,
      "num_input_tokens_seen": 11299532400,
      "step": 14362
    },
    {
      "epoch": 1.5237640568639932,
      "grad_norm": 0.43144182659992203,
      "learning_rate": 4.8060787906362005e-05,
      "loss": 1.5597,
      "num_input_tokens_seen": 11300319232,
      "step": 14363
    },
    {
      "epoch": 1.5238701464035647,
      "grad_norm": 0.37944847512051416,
      "learning_rate": 4.8060519527795056e-05,
      "loss": 1.7678,
      "num_input_tokens_seen": 11301106016,
      "step": 14364
    },
    {
      "epoch": 1.523976235943136,
      "grad_norm": 0.44049656023739026,
      "learning_rate": 4.806025113140762e-05,
      "loss": 1.807,
      "num_input_tokens_seen": 11301892688,
      "step": 14365
    },
    {
      "epoch": 1.5240823254827074,
      "grad_norm": 0.387064722316048,
      "learning_rate": 4.80599827171999e-05,
      "loss": 1.7867,
      "num_input_tokens_seen": 11302679392,
      "step": 14366
    },
    {
      "epoch": 1.5241884150222789,
      "grad_norm": 0.366856512221598,
      "learning_rate": 4.8059714285172095e-05,
      "loss": 1.7982,
      "num_input_tokens_seen": 11303466160,
      "step": 14367
    },
    {
      "epoch": 1.5242945045618503,
      "grad_norm": 0.4517322862271112,
      "learning_rate": 4.805944583532443e-05,
      "loss": 1.733,
      "num_input_tokens_seen": 11304252864,
      "step": 14368
    },
    {
      "epoch": 1.5244005941014216,
      "grad_norm": 0.40986949111209503,
      "learning_rate": 4.8059177367657096e-05,
      "loss": 1.6512,
      "num_input_tokens_seen": 11305039696,
      "step": 14369
    },
    {
      "epoch": 1.5245066836409928,
      "grad_norm": 0.4301408074558369,
      "learning_rate": 4.80589088821703e-05,
      "loss": 1.7965,
      "num_input_tokens_seen": 11305826400,
      "step": 14370
    },
    {
      "epoch": 1.5246127731805643,
      "grad_norm": 0.4342213066317394,
      "learning_rate": 4.8058640378864275e-05,
      "loss": 1.8942,
      "num_input_tokens_seen": 11306613056,
      "step": 14371
    },
    {
      "epoch": 1.5247188627201358,
      "grad_norm": 0.3244095921442371,
      "learning_rate": 4.8058371857739194e-05,
      "loss": 1.7943,
      "num_input_tokens_seen": 11307399744,
      "step": 14372
    },
    {
      "epoch": 1.5248249522597073,
      "grad_norm": 0.4317113752822433,
      "learning_rate": 4.805810331879528e-05,
      "loss": 1.7336,
      "num_input_tokens_seen": 11308186560,
      "step": 14373
    },
    {
      "epoch": 1.5249310417992787,
      "grad_norm": 0.4011729314915408,
      "learning_rate": 4.8057834762032736e-05,
      "loss": 1.6437,
      "num_input_tokens_seen": 11308973328,
      "step": 14374
    },
    {
      "epoch": 1.52503713133885,
      "grad_norm": 0.3924274746454805,
      "learning_rate": 4.8057566187451785e-05,
      "loss": 1.6316,
      "num_input_tokens_seen": 11309760048,
      "step": 14375
    },
    {
      "epoch": 1.5251432208784212,
      "grad_norm": 0.4767393664611242,
      "learning_rate": 4.805729759505262e-05,
      "loss": 1.9013,
      "num_input_tokens_seen": 11310546720,
      "step": 14376
    },
    {
      "epoch": 1.5252493104179927,
      "grad_norm": 0.3922521940653144,
      "learning_rate": 4.805702898483545e-05,
      "loss": 1.8228,
      "num_input_tokens_seen": 11311333504,
      "step": 14377
    },
    {
      "epoch": 1.5253553999575642,
      "grad_norm": 0.524037022343504,
      "learning_rate": 4.805676035680049e-05,
      "loss": 1.7863,
      "num_input_tokens_seen": 11312120128,
      "step": 14378
    },
    {
      "epoch": 1.5254614894971357,
      "grad_norm": 0.3804881073536775,
      "learning_rate": 4.8056491710947934e-05,
      "loss": 1.7244,
      "num_input_tokens_seen": 11312906960,
      "step": 14379
    },
    {
      "epoch": 1.5255675790367071,
      "grad_norm": 0.4500801552899325,
      "learning_rate": 4.8056223047278e-05,
      "loss": 1.8023,
      "num_input_tokens_seen": 11313693664,
      "step": 14380
    },
    {
      "epoch": 1.5256736685762784,
      "grad_norm": 0.44106268423769823,
      "learning_rate": 4.80559543657909e-05,
      "loss": 1.682,
      "num_input_tokens_seen": 11314480464,
      "step": 14381
    },
    {
      "epoch": 1.5257797581158496,
      "grad_norm": 0.353852069360575,
      "learning_rate": 4.8055685666486825e-05,
      "loss": 1.7141,
      "num_input_tokens_seen": 11315267232,
      "step": 14382
    },
    {
      "epoch": 1.5258858476554211,
      "grad_norm": 0.45835497870785274,
      "learning_rate": 4.8055416949366e-05,
      "loss": 1.7992,
      "num_input_tokens_seen": 11316054064,
      "step": 14383
    },
    {
      "epoch": 1.5259919371949926,
      "grad_norm": 0.37247374376406045,
      "learning_rate": 4.8055148214428625e-05,
      "loss": 1.8731,
      "num_input_tokens_seen": 11316840800,
      "step": 14384
    },
    {
      "epoch": 1.526098026734564,
      "grad_norm": 0.4553454097492954,
      "learning_rate": 4.8054879461674904e-05,
      "loss": 1.817,
      "num_input_tokens_seen": 11317627488,
      "step": 14385
    },
    {
      "epoch": 1.5262041162741353,
      "grad_norm": 0.3836827463397003,
      "learning_rate": 4.805461069110505e-05,
      "loss": 1.7551,
      "num_input_tokens_seen": 11318414256,
      "step": 14386
    },
    {
      "epoch": 1.5263102058137068,
      "grad_norm": 0.4849894541899514,
      "learning_rate": 4.805434190271927e-05,
      "loss": 1.8936,
      "num_input_tokens_seen": 11319201008,
      "step": 14387
    },
    {
      "epoch": 1.526416295353278,
      "grad_norm": 0.4390785989014263,
      "learning_rate": 4.805407309651777e-05,
      "loss": 1.6641,
      "num_input_tokens_seen": 11319987872,
      "step": 14388
    },
    {
      "epoch": 1.5265223848928495,
      "grad_norm": 0.45847533261432094,
      "learning_rate": 4.805380427250076e-05,
      "loss": 1.6981,
      "num_input_tokens_seen": 11320774688,
      "step": 14389
    },
    {
      "epoch": 1.526628474432421,
      "grad_norm": 0.39015370608417044,
      "learning_rate": 4.805353543066844e-05,
      "loss": 1.8353,
      "num_input_tokens_seen": 11321561440,
      "step": 14390
    },
    {
      "epoch": 1.5267345639719925,
      "grad_norm": 0.40069492286374064,
      "learning_rate": 4.805326657102103e-05,
      "loss": 1.71,
      "num_input_tokens_seen": 11322348240,
      "step": 14391
    },
    {
      "epoch": 1.5268406535115637,
      "grad_norm": 0.3535534985686875,
      "learning_rate": 4.805299769355873e-05,
      "loss": 1.5541,
      "num_input_tokens_seen": 11323135056,
      "step": 14392
    },
    {
      "epoch": 1.5269467430511352,
      "grad_norm": 0.43541214389827254,
      "learning_rate": 4.8052728798281754e-05,
      "loss": 1.8596,
      "num_input_tokens_seen": 11323921808,
      "step": 14393
    },
    {
      "epoch": 1.5270528325907065,
      "grad_norm": 0.33878671668713006,
      "learning_rate": 4.805245988519031e-05,
      "loss": 1.748,
      "num_input_tokens_seen": 11324708640,
      "step": 14394
    },
    {
      "epoch": 1.527158922130278,
      "grad_norm": 0.5347180427618223,
      "learning_rate": 4.805219095428459e-05,
      "loss": 1.9326,
      "num_input_tokens_seen": 11325495344,
      "step": 14395
    },
    {
      "epoch": 1.5272650116698494,
      "grad_norm": 0.3820540063597249,
      "learning_rate": 4.805192200556482e-05,
      "loss": 1.6612,
      "num_input_tokens_seen": 11326282208,
      "step": 14396
    },
    {
      "epoch": 1.5273711012094209,
      "grad_norm": 0.37866366821473657,
      "learning_rate": 4.8051653039031194e-05,
      "loss": 1.719,
      "num_input_tokens_seen": 11327068944,
      "step": 14397
    },
    {
      "epoch": 1.5274771907489921,
      "grad_norm": 0.37019800406169984,
      "learning_rate": 4.8051384054683934e-05,
      "loss": 1.7189,
      "num_input_tokens_seen": 11327855696,
      "step": 14398
    },
    {
      "epoch": 1.5275832802885634,
      "grad_norm": 0.38282787920571637,
      "learning_rate": 4.8051115052523245e-05,
      "loss": 1.6516,
      "num_input_tokens_seen": 11328642512,
      "step": 14399
    },
    {
      "epoch": 1.5276893698281349,
      "grad_norm": 0.4022197177514811,
      "learning_rate": 4.8050846032549325e-05,
      "loss": 1.7757,
      "num_input_tokens_seen": 11329429328,
      "step": 14400
    },
    {
      "epoch": 1.5277954593677063,
      "grad_norm": 0.34967950022244615,
      "learning_rate": 4.805057699476239e-05,
      "loss": 1.7144,
      "num_input_tokens_seen": 11330216144,
      "step": 14401
    },
    {
      "epoch": 1.5279015489072778,
      "grad_norm": 0.4004150415484846,
      "learning_rate": 4.805030793916263e-05,
      "loss": 1.7985,
      "num_input_tokens_seen": 11331002912,
      "step": 14402
    },
    {
      "epoch": 1.5280076384468493,
      "grad_norm": 0.4594227656317728,
      "learning_rate": 4.805003886575029e-05,
      "loss": 1.8879,
      "num_input_tokens_seen": 11331789728,
      "step": 14403
    },
    {
      "epoch": 1.5281137279864205,
      "grad_norm": 0.5172927400491899,
      "learning_rate": 4.804976977452554e-05,
      "loss": 1.6937,
      "num_input_tokens_seen": 11332576496,
      "step": 14404
    },
    {
      "epoch": 1.5282198175259918,
      "grad_norm": 0.5506520497379063,
      "learning_rate": 4.8049500665488614e-05,
      "loss": 1.6909,
      "num_input_tokens_seen": 11333363248,
      "step": 14405
    },
    {
      "epoch": 1.5283259070655633,
      "grad_norm": 0.4499058495946957,
      "learning_rate": 4.80492315386397e-05,
      "loss": 1.739,
      "num_input_tokens_seen": 11334149968,
      "step": 14406
    },
    {
      "epoch": 1.5284319966051347,
      "grad_norm": 0.6187207952131338,
      "learning_rate": 4.804896239397903e-05,
      "loss": 1.6553,
      "num_input_tokens_seen": 11334936720,
      "step": 14407
    },
    {
      "epoch": 1.5285380861447062,
      "grad_norm": 0.4889675432343273,
      "learning_rate": 4.804869323150679e-05,
      "loss": 1.8122,
      "num_input_tokens_seen": 11335723440,
      "step": 14408
    },
    {
      "epoch": 1.5286441756842777,
      "grad_norm": 0.4851965452988057,
      "learning_rate": 4.8048424051223204e-05,
      "loss": 1.843,
      "num_input_tokens_seen": 11336510208,
      "step": 14409
    },
    {
      "epoch": 1.528750265223849,
      "grad_norm": 0.7369762538835318,
      "learning_rate": 4.804815485312846e-05,
      "loss": 1.7194,
      "num_input_tokens_seen": 11337297008,
      "step": 14410
    },
    {
      "epoch": 1.5288563547634202,
      "grad_norm": 0.656962929476364,
      "learning_rate": 4.804788563722279e-05,
      "loss": 1.7813,
      "num_input_tokens_seen": 11338083792,
      "step": 14411
    },
    {
      "epoch": 1.5289624443029917,
      "grad_norm": 0.7138758474539043,
      "learning_rate": 4.804761640350638e-05,
      "loss": 1.7333,
      "num_input_tokens_seen": 11338870544,
      "step": 14412
    },
    {
      "epoch": 1.5290685338425631,
      "grad_norm": 0.5789342683437445,
      "learning_rate": 4.8047347151979454e-05,
      "loss": 1.6668,
      "num_input_tokens_seen": 11339657328,
      "step": 14413
    },
    {
      "epoch": 1.5291746233821346,
      "grad_norm": 0.49508084407234026,
      "learning_rate": 4.804707788264221e-05,
      "loss": 1.7273,
      "num_input_tokens_seen": 11340444176,
      "step": 14414
    },
    {
      "epoch": 1.5292807129217059,
      "grad_norm": 1.190729209294748,
      "learning_rate": 4.804680859549487e-05,
      "loss": 1.8119,
      "num_input_tokens_seen": 11341230848,
      "step": 14415
    },
    {
      "epoch": 1.5293868024612773,
      "grad_norm": 0.3384850327111257,
      "learning_rate": 4.804653929053762e-05,
      "loss": 1.7774,
      "num_input_tokens_seen": 11342017696,
      "step": 14416
    },
    {
      "epoch": 1.5294928920008486,
      "grad_norm": 1.0893034387504554,
      "learning_rate": 4.8046269967770694e-05,
      "loss": 1.6422,
      "num_input_tokens_seen": 11342804384,
      "step": 14417
    },
    {
      "epoch": 1.52959898154042,
      "grad_norm": 0.49958103510843016,
      "learning_rate": 4.8046000627194274e-05,
      "loss": 1.8374,
      "num_input_tokens_seen": 11343591104,
      "step": 14418
    },
    {
      "epoch": 1.5297050710799915,
      "grad_norm": 0.5350189344393962,
      "learning_rate": 4.8045731268808594e-05,
      "loss": 1.7193,
      "num_input_tokens_seen": 11344377888,
      "step": 14419
    },
    {
      "epoch": 1.529811160619563,
      "grad_norm": 0.5951934138830036,
      "learning_rate": 4.804546189261384e-05,
      "loss": 1.6651,
      "num_input_tokens_seen": 11345164720,
      "step": 14420
    },
    {
      "epoch": 1.5299172501591343,
      "grad_norm": 0.4405178250302089,
      "learning_rate": 4.8045192498610224e-05,
      "loss": 1.8258,
      "num_input_tokens_seen": 11345951536,
      "step": 14421
    },
    {
      "epoch": 1.5300233396987057,
      "grad_norm": 0.4743692071054267,
      "learning_rate": 4.8044923086797974e-05,
      "loss": 1.7012,
      "num_input_tokens_seen": 11346738352,
      "step": 14422
    },
    {
      "epoch": 1.530129429238277,
      "grad_norm": 0.6256417308268549,
      "learning_rate": 4.804465365717728e-05,
      "loss": 1.8569,
      "num_input_tokens_seen": 11347525040,
      "step": 14423
    },
    {
      "epoch": 1.5302355187778485,
      "grad_norm": 0.42939373889026416,
      "learning_rate": 4.8044384209748336e-05,
      "loss": 1.8309,
      "num_input_tokens_seen": 11348311760,
      "step": 14424
    },
    {
      "epoch": 1.53034160831742,
      "grad_norm": 0.5118328960276863,
      "learning_rate": 4.8044114744511394e-05,
      "loss": 1.7587,
      "num_input_tokens_seen": 11349098544,
      "step": 14425
    },
    {
      "epoch": 1.5304476978569914,
      "grad_norm": 0.5318505345303359,
      "learning_rate": 4.804384526146662e-05,
      "loss": 1.739,
      "num_input_tokens_seen": 11349885280,
      "step": 14426
    },
    {
      "epoch": 1.5305537873965627,
      "grad_norm": 0.3647207075914779,
      "learning_rate": 4.804357576061425e-05,
      "loss": 1.769,
      "num_input_tokens_seen": 11350671968,
      "step": 14427
    },
    {
      "epoch": 1.5306598769361341,
      "grad_norm": 0.5520677536324965,
      "learning_rate": 4.8043306241954464e-05,
      "loss": 1.9079,
      "num_input_tokens_seen": 11351458704,
      "step": 14428
    },
    {
      "epoch": 1.5307659664757054,
      "grad_norm": 0.4254314447418513,
      "learning_rate": 4.80430367054875e-05,
      "loss": 1.6782,
      "num_input_tokens_seen": 11352245456,
      "step": 14429
    },
    {
      "epoch": 1.5308720560152769,
      "grad_norm": 0.4463387556068467,
      "learning_rate": 4.8042767151213545e-05,
      "loss": 1.7694,
      "num_input_tokens_seen": 11353032208,
      "step": 14430
    },
    {
      "epoch": 1.5309781455548483,
      "grad_norm": 0.44683311694530214,
      "learning_rate": 4.804249757913282e-05,
      "loss": 1.8048,
      "num_input_tokens_seen": 11353819008,
      "step": 14431
    },
    {
      "epoch": 1.5310842350944198,
      "grad_norm": 0.3766351050550545,
      "learning_rate": 4.8042227989245537e-05,
      "loss": 1.7416,
      "num_input_tokens_seen": 11354605760,
      "step": 14432
    },
    {
      "epoch": 1.531190324633991,
      "grad_norm": 0.4746831129016355,
      "learning_rate": 4.804195838155188e-05,
      "loss": 1.7617,
      "num_input_tokens_seen": 11355392480,
      "step": 14433
    },
    {
      "epoch": 1.5312964141735623,
      "grad_norm": 0.4921929119505205,
      "learning_rate": 4.8041688756052086e-05,
      "loss": 1.7272,
      "num_input_tokens_seen": 11356179200,
      "step": 14434
    },
    {
      "epoch": 1.5314025037131338,
      "grad_norm": 0.3640484188631181,
      "learning_rate": 4.804141911274634e-05,
      "loss": 1.8102,
      "num_input_tokens_seen": 11356965920,
      "step": 14435
    },
    {
      "epoch": 1.5315085932527053,
      "grad_norm": 0.4910247683138734,
      "learning_rate": 4.8041149451634875e-05,
      "loss": 1.9162,
      "num_input_tokens_seen": 11357752656,
      "step": 14436
    },
    {
      "epoch": 1.5316146827922767,
      "grad_norm": 0.43109964764639624,
      "learning_rate": 4.804087977271789e-05,
      "loss": 1.7732,
      "num_input_tokens_seen": 11358539472,
      "step": 14437
    },
    {
      "epoch": 1.5317207723318482,
      "grad_norm": 0.36471690875030477,
      "learning_rate": 4.8040610075995575e-05,
      "loss": 1.6537,
      "num_input_tokens_seen": 11359326320,
      "step": 14438
    },
    {
      "epoch": 1.5318268618714195,
      "grad_norm": 0.4461556546954743,
      "learning_rate": 4.804034036146815e-05,
      "loss": 1.6963,
      "num_input_tokens_seen": 11360113152,
      "step": 14439
    },
    {
      "epoch": 1.5319329514109907,
      "grad_norm": 0.41802200239610493,
      "learning_rate": 4.8040070629135835e-05,
      "loss": 1.7633,
      "num_input_tokens_seen": 11360899872,
      "step": 14440
    },
    {
      "epoch": 1.5320390409505622,
      "grad_norm": 0.46239207161984636,
      "learning_rate": 4.8039800878998826e-05,
      "loss": 1.8446,
      "num_input_tokens_seen": 11361686720,
      "step": 14441
    },
    {
      "epoch": 1.5321451304901337,
      "grad_norm": 0.44439843735021994,
      "learning_rate": 4.8039531111057334e-05,
      "loss": 1.9974,
      "num_input_tokens_seen": 11362473456,
      "step": 14442
    },
    {
      "epoch": 1.5322512200297052,
      "grad_norm": 0.426938820628281,
      "learning_rate": 4.803926132531157e-05,
      "loss": 1.8104,
      "num_input_tokens_seen": 11363260256,
      "step": 14443
    },
    {
      "epoch": 1.5323573095692766,
      "grad_norm": 0.36076141557920505,
      "learning_rate": 4.8038991521761746e-05,
      "loss": 1.6959,
      "num_input_tokens_seen": 11364046992,
      "step": 14444
    },
    {
      "epoch": 1.5324633991088479,
      "grad_norm": 0.5341513894845173,
      "learning_rate": 4.8038721700408056e-05,
      "loss": 1.8545,
      "num_input_tokens_seen": 11364833680,
      "step": 14445
    },
    {
      "epoch": 1.5325694886484191,
      "grad_norm": 0.3555356486537618,
      "learning_rate": 4.8038451861250724e-05,
      "loss": 1.6166,
      "num_input_tokens_seen": 11365620512,
      "step": 14446
    },
    {
      "epoch": 1.5326755781879906,
      "grad_norm": 0.5416402237835493,
      "learning_rate": 4.803818200428995e-05,
      "loss": 1.9113,
      "num_input_tokens_seen": 11366407184,
      "step": 14447
    },
    {
      "epoch": 1.532781667727562,
      "grad_norm": 0.38380475535461944,
      "learning_rate": 4.803791212952595e-05,
      "loss": 1.7357,
      "num_input_tokens_seen": 11367193936,
      "step": 14448
    },
    {
      "epoch": 1.5328877572671336,
      "grad_norm": 0.429080025199792,
      "learning_rate": 4.803764223695892e-05,
      "loss": 1.8383,
      "num_input_tokens_seen": 11367980720,
      "step": 14449
    },
    {
      "epoch": 1.5329938468067048,
      "grad_norm": 0.3970155945747902,
      "learning_rate": 4.803737232658908e-05,
      "loss": 1.7874,
      "num_input_tokens_seen": 11368767424,
      "step": 14450
    },
    {
      "epoch": 1.5330999363462763,
      "grad_norm": 0.5817492288445965,
      "learning_rate": 4.803710239841663e-05,
      "loss": 1.8209,
      "num_input_tokens_seen": 11369554224,
      "step": 14451
    },
    {
      "epoch": 1.5332060258858475,
      "grad_norm": 0.43773576398425207,
      "learning_rate": 4.8036832452441796e-05,
      "loss": 1.7887,
      "num_input_tokens_seen": 11370341072,
      "step": 14452
    },
    {
      "epoch": 1.533312115425419,
      "grad_norm": 0.584208142703133,
      "learning_rate": 4.803656248866476e-05,
      "loss": 1.7069,
      "num_input_tokens_seen": 11371127920,
      "step": 14453
    },
    {
      "epoch": 1.5334182049649905,
      "grad_norm": 0.6790638181967446,
      "learning_rate": 4.8036292507085745e-05,
      "loss": 1.9196,
      "num_input_tokens_seen": 11371914656,
      "step": 14454
    },
    {
      "epoch": 1.533524294504562,
      "grad_norm": 0.6056158751916701,
      "learning_rate": 4.803602250770496e-05,
      "loss": 1.6279,
      "num_input_tokens_seen": 11372701440,
      "step": 14455
    },
    {
      "epoch": 1.5336303840441332,
      "grad_norm": 0.49601450529987073,
      "learning_rate": 4.803575249052262e-05,
      "loss": 1.6876,
      "num_input_tokens_seen": 11373488256,
      "step": 14456
    },
    {
      "epoch": 1.5337364735837047,
      "grad_norm": 0.6141010708436011,
      "learning_rate": 4.803548245553893e-05,
      "loss": 1.6215,
      "num_input_tokens_seen": 11374275088,
      "step": 14457
    },
    {
      "epoch": 1.533842563123276,
      "grad_norm": 0.39399583122660936,
      "learning_rate": 4.803521240275408e-05,
      "loss": 1.8417,
      "num_input_tokens_seen": 11375061808,
      "step": 14458
    },
    {
      "epoch": 1.5339486526628474,
      "grad_norm": 0.4449694790003057,
      "learning_rate": 4.8034942332168305e-05,
      "loss": 1.7121,
      "num_input_tokens_seen": 11375848640,
      "step": 14459
    },
    {
      "epoch": 1.5340547422024189,
      "grad_norm": 0.4383083836476856,
      "learning_rate": 4.80346722437818e-05,
      "loss": 1.7606,
      "num_input_tokens_seen": 11376635472,
      "step": 14460
    },
    {
      "epoch": 1.5341608317419904,
      "grad_norm": 0.4663881217759111,
      "learning_rate": 4.803440213759477e-05,
      "loss": 1.8184,
      "num_input_tokens_seen": 11377422352,
      "step": 14461
    },
    {
      "epoch": 1.5342669212815616,
      "grad_norm": 0.3998883013922307,
      "learning_rate": 4.803413201360744e-05,
      "loss": 1.7462,
      "num_input_tokens_seen": 11378209104,
      "step": 14462
    },
    {
      "epoch": 1.534373010821133,
      "grad_norm": 0.49913761116983374,
      "learning_rate": 4.803386187182e-05,
      "loss": 1.7135,
      "num_input_tokens_seen": 11378995936,
      "step": 14463
    },
    {
      "epoch": 1.5344791003607043,
      "grad_norm": 0.47790789108652404,
      "learning_rate": 4.803359171223267e-05,
      "loss": 1.853,
      "num_input_tokens_seen": 11379782704,
      "step": 14464
    },
    {
      "epoch": 1.5345851899002758,
      "grad_norm": 0.39963084093645346,
      "learning_rate": 4.803332153484566e-05,
      "loss": 1.6871,
      "num_input_tokens_seen": 11380569424,
      "step": 14465
    },
    {
      "epoch": 1.5346912794398473,
      "grad_norm": 0.5361692465669231,
      "learning_rate": 4.803305133965917e-05,
      "loss": 1.875,
      "num_input_tokens_seen": 11381356160,
      "step": 14466
    },
    {
      "epoch": 1.5347973689794188,
      "grad_norm": 0.410615892849013,
      "learning_rate": 4.803278112667342e-05,
      "loss": 1.6704,
      "num_input_tokens_seen": 11382142976,
      "step": 14467
    },
    {
      "epoch": 1.53490345851899,
      "grad_norm": 0.38363404367722115,
      "learning_rate": 4.803251089588861e-05,
      "loss": 1.6823,
      "num_input_tokens_seen": 11382929728,
      "step": 14468
    },
    {
      "epoch": 1.5350095480585613,
      "grad_norm": 0.43553941199057655,
      "learning_rate": 4.803224064730494e-05,
      "loss": 1.7505,
      "num_input_tokens_seen": 11383716432,
      "step": 14469
    },
    {
      "epoch": 1.5351156375981327,
      "grad_norm": 0.36287907960672083,
      "learning_rate": 4.8031970380922644e-05,
      "loss": 1.7205,
      "num_input_tokens_seen": 11384503248,
      "step": 14470
    },
    {
      "epoch": 1.5352217271377042,
      "grad_norm": 0.36539750725041154,
      "learning_rate": 4.803170009674191e-05,
      "loss": 1.6988,
      "num_input_tokens_seen": 11385289984,
      "step": 14471
    },
    {
      "epoch": 1.5353278166772757,
      "grad_norm": 0.46650411404826153,
      "learning_rate": 4.803142979476296e-05,
      "loss": 1.6735,
      "num_input_tokens_seen": 11386076720,
      "step": 14472
    },
    {
      "epoch": 1.5354339062168472,
      "grad_norm": 0.32727980252537553,
      "learning_rate": 4.803115947498599e-05,
      "loss": 1.6381,
      "num_input_tokens_seen": 11386863584,
      "step": 14473
    },
    {
      "epoch": 1.5355399957564184,
      "grad_norm": 0.42816201765133155,
      "learning_rate": 4.8030889137411225e-05,
      "loss": 1.6988,
      "num_input_tokens_seen": 11387650336,
      "step": 14474
    },
    {
      "epoch": 1.5356460852959897,
      "grad_norm": 0.41869928818116064,
      "learning_rate": 4.803061878203885e-05,
      "loss": 1.7564,
      "num_input_tokens_seen": 11388437136,
      "step": 14475
    },
    {
      "epoch": 1.5357521748355611,
      "grad_norm": 0.3994110653658576,
      "learning_rate": 4.8030348408869103e-05,
      "loss": 1.7244,
      "num_input_tokens_seen": 11389223920,
      "step": 14476
    },
    {
      "epoch": 1.5358582643751326,
      "grad_norm": 0.46603179742008094,
      "learning_rate": 4.8030078017902176e-05,
      "loss": 1.9042,
      "num_input_tokens_seen": 11390010736,
      "step": 14477
    },
    {
      "epoch": 1.535964353914704,
      "grad_norm": 0.3310324867477932,
      "learning_rate": 4.802980760913828e-05,
      "loss": 1.7686,
      "num_input_tokens_seen": 11390797440,
      "step": 14478
    },
    {
      "epoch": 1.5360704434542756,
      "grad_norm": 0.3171737884473962,
      "learning_rate": 4.802953718257762e-05,
      "loss": 1.7076,
      "num_input_tokens_seen": 11391584208,
      "step": 14479
    },
    {
      "epoch": 1.5361765329938468,
      "grad_norm": 0.329628321736908,
      "learning_rate": 4.802926673822041e-05,
      "loss": 1.7287,
      "num_input_tokens_seen": 11392371056,
      "step": 14480
    },
    {
      "epoch": 1.536282622533418,
      "grad_norm": 0.3317575633984143,
      "learning_rate": 4.8028996276066855e-05,
      "loss": 1.6339,
      "num_input_tokens_seen": 11393157904,
      "step": 14481
    },
    {
      "epoch": 1.5363887120729895,
      "grad_norm": 0.3278197720636399,
      "learning_rate": 4.802872579611717e-05,
      "loss": 1.5487,
      "num_input_tokens_seen": 11393944784,
      "step": 14482
    },
    {
      "epoch": 1.536494801612561,
      "grad_norm": 0.3213230093568287,
      "learning_rate": 4.802845529837156e-05,
      "loss": 1.7285,
      "num_input_tokens_seen": 11394731520,
      "step": 14483
    },
    {
      "epoch": 1.5366008911521325,
      "grad_norm": 0.3785112341105643,
      "learning_rate": 4.802818478283025e-05,
      "loss": 1.7729,
      "num_input_tokens_seen": 11395518240,
      "step": 14484
    },
    {
      "epoch": 1.5367069806917037,
      "grad_norm": 0.556892365613521,
      "learning_rate": 4.802791424949342e-05,
      "loss": 1.7448,
      "num_input_tokens_seen": 11396305088,
      "step": 14485
    },
    {
      "epoch": 1.5368130702312752,
      "grad_norm": 0.3786632491620474,
      "learning_rate": 4.80276436983613e-05,
      "loss": 1.5101,
      "num_input_tokens_seen": 11397091968,
      "step": 14486
    },
    {
      "epoch": 1.5369191597708465,
      "grad_norm": 0.5218720705649295,
      "learning_rate": 4.802737312943409e-05,
      "loss": 1.7869,
      "num_input_tokens_seen": 11397878656,
      "step": 14487
    },
    {
      "epoch": 1.537025249310418,
      "grad_norm": 0.38217447696997575,
      "learning_rate": 4.8027102542712e-05,
      "loss": 1.7985,
      "num_input_tokens_seen": 11398665472,
      "step": 14488
    },
    {
      "epoch": 1.5371313388499894,
      "grad_norm": 0.5078938521749851,
      "learning_rate": 4.802683193819524e-05,
      "loss": 1.7669,
      "num_input_tokens_seen": 11399452320,
      "step": 14489
    },
    {
      "epoch": 1.537237428389561,
      "grad_norm": 0.3656507353335804,
      "learning_rate": 4.802656131588402e-05,
      "loss": 1.7257,
      "num_input_tokens_seen": 11400239200,
      "step": 14490
    },
    {
      "epoch": 1.5373435179291322,
      "grad_norm": 0.40336797559010223,
      "learning_rate": 4.802629067577855e-05,
      "loss": 1.6858,
      "num_input_tokens_seen": 11401026016,
      "step": 14491
    },
    {
      "epoch": 1.5374496074687036,
      "grad_norm": 0.3960267254996097,
      "learning_rate": 4.802602001787905e-05,
      "loss": 1.7172,
      "num_input_tokens_seen": 11401812736,
      "step": 14492
    },
    {
      "epoch": 1.5375556970082749,
      "grad_norm": 0.4329516127810886,
      "learning_rate": 4.80257493421857e-05,
      "loss": 1.8432,
      "num_input_tokens_seen": 11402599520,
      "step": 14493
    },
    {
      "epoch": 1.5376617865478464,
      "grad_norm": 0.3662049316493642,
      "learning_rate": 4.8025478648698735e-05,
      "loss": 1.789,
      "num_input_tokens_seen": 11403386304,
      "step": 14494
    },
    {
      "epoch": 1.5377678760874178,
      "grad_norm": 0.39036085544928506,
      "learning_rate": 4.802520793741836e-05,
      "loss": 1.7647,
      "num_input_tokens_seen": 11404173040,
      "step": 14495
    },
    {
      "epoch": 1.5378739656269893,
      "grad_norm": 0.4193755763459715,
      "learning_rate": 4.8024937208344765e-05,
      "loss": 1.7091,
      "num_input_tokens_seen": 11404959728,
      "step": 14496
    },
    {
      "epoch": 1.5379800551665606,
      "grad_norm": 0.35772635270541314,
      "learning_rate": 4.802466646147819e-05,
      "loss": 1.736,
      "num_input_tokens_seen": 11405746512,
      "step": 14497
    },
    {
      "epoch": 1.538086144706132,
      "grad_norm": 0.4577372703783624,
      "learning_rate": 4.802439569681882e-05,
      "loss": 1.8237,
      "num_input_tokens_seen": 11406533248,
      "step": 14498
    },
    {
      "epoch": 1.5381922342457033,
      "grad_norm": 0.3549508297736575,
      "learning_rate": 4.8024124914366875e-05,
      "loss": 1.5805,
      "num_input_tokens_seen": 11407319984,
      "step": 14499
    },
    {
      "epoch": 1.5382983237852748,
      "grad_norm": 0.47093813728444356,
      "learning_rate": 4.802385411412256e-05,
      "loss": 1.9087,
      "num_input_tokens_seen": 11408106752,
      "step": 14500
    },
    {
      "epoch": 1.5384044133248462,
      "grad_norm": 0.36567379248534937,
      "learning_rate": 4.8023583296086085e-05,
      "loss": 1.749,
      "num_input_tokens_seen": 11408893504,
      "step": 14501
    },
    {
      "epoch": 1.5385105028644177,
      "grad_norm": 0.33261042249093886,
      "learning_rate": 4.8023312460257664e-05,
      "loss": 1.8235,
      "num_input_tokens_seen": 11409680288,
      "step": 14502
    },
    {
      "epoch": 1.538616592403989,
      "grad_norm": 0.34688558878098164,
      "learning_rate": 4.80230416066375e-05,
      "loss": 1.6414,
      "num_input_tokens_seen": 11410467200,
      "step": 14503
    },
    {
      "epoch": 1.5387226819435602,
      "grad_norm": 0.47298937942430086,
      "learning_rate": 4.8022770735225806e-05,
      "loss": 1.8243,
      "num_input_tokens_seen": 11411254032,
      "step": 14504
    },
    {
      "epoch": 1.5388287714831317,
      "grad_norm": 0.4263391448022612,
      "learning_rate": 4.802249984602278e-05,
      "loss": 1.6453,
      "num_input_tokens_seen": 11412040944,
      "step": 14505
    },
    {
      "epoch": 1.5389348610227032,
      "grad_norm": 0.4052592590355132,
      "learning_rate": 4.802222893902866e-05,
      "loss": 1.8752,
      "num_input_tokens_seen": 11412827680,
      "step": 14506
    },
    {
      "epoch": 1.5390409505622746,
      "grad_norm": 0.43836055989861256,
      "learning_rate": 4.802195801424363e-05,
      "loss": 1.8961,
      "num_input_tokens_seen": 11413614384,
      "step": 14507
    },
    {
      "epoch": 1.539147040101846,
      "grad_norm": 0.43781943249637434,
      "learning_rate": 4.8021687071667904e-05,
      "loss": 1.7903,
      "num_input_tokens_seen": 11414401216,
      "step": 14508
    },
    {
      "epoch": 1.5392531296414174,
      "grad_norm": 0.35910919889541815,
      "learning_rate": 4.80214161113017e-05,
      "loss": 1.7024,
      "num_input_tokens_seen": 11415187936,
      "step": 14509
    },
    {
      "epoch": 1.5393592191809886,
      "grad_norm": 0.49826329285667553,
      "learning_rate": 4.802114513314521e-05,
      "loss": 1.8428,
      "num_input_tokens_seen": 11415974640,
      "step": 14510
    },
    {
      "epoch": 1.53946530872056,
      "grad_norm": 0.3786143771977783,
      "learning_rate": 4.802087413719866e-05,
      "loss": 1.8289,
      "num_input_tokens_seen": 11416761456,
      "step": 14511
    },
    {
      "epoch": 1.5395713982601316,
      "grad_norm": 0.29013341749930355,
      "learning_rate": 4.802060312346226e-05,
      "loss": 1.5383,
      "num_input_tokens_seen": 11417548304,
      "step": 14512
    },
    {
      "epoch": 1.539677487799703,
      "grad_norm": 0.6247349327743483,
      "learning_rate": 4.80203320919362e-05,
      "loss": 1.7743,
      "num_input_tokens_seen": 11418335056,
      "step": 14513
    },
    {
      "epoch": 1.5397835773392745,
      "grad_norm": 0.47226325119063245,
      "learning_rate": 4.802006104262071e-05,
      "loss": 1.7202,
      "num_input_tokens_seen": 11419121808,
      "step": 14514
    },
    {
      "epoch": 1.5398896668788458,
      "grad_norm": 0.30950442878254264,
      "learning_rate": 4.8019789975515994e-05,
      "loss": 1.7132,
      "num_input_tokens_seen": 11419908624,
      "step": 14515
    },
    {
      "epoch": 1.539995756418417,
      "grad_norm": 0.3934714814971838,
      "learning_rate": 4.8019518890622265e-05,
      "loss": 1.8782,
      "num_input_tokens_seen": 11420695488,
      "step": 14516
    },
    {
      "epoch": 1.5401018459579885,
      "grad_norm": 0.41883735041948117,
      "learning_rate": 4.801924778793972e-05,
      "loss": 1.7555,
      "num_input_tokens_seen": 11421482224,
      "step": 14517
    },
    {
      "epoch": 1.54020793549756,
      "grad_norm": 0.4495069189414431,
      "learning_rate": 4.801897666746857e-05,
      "loss": 1.7158,
      "num_input_tokens_seen": 11422269008,
      "step": 14518
    },
    {
      "epoch": 1.5403140250371314,
      "grad_norm": 0.3910932810610469,
      "learning_rate": 4.8018705529209043e-05,
      "loss": 1.8211,
      "num_input_tokens_seen": 11423055760,
      "step": 14519
    },
    {
      "epoch": 1.5404201145767027,
      "grad_norm": 0.42605833194090664,
      "learning_rate": 4.801843437316133e-05,
      "loss": 1.6343,
      "num_input_tokens_seen": 11423842560,
      "step": 14520
    },
    {
      "epoch": 1.5405262041162742,
      "grad_norm": 0.4436897458936811,
      "learning_rate": 4.801816319932564e-05,
      "loss": 1.7195,
      "num_input_tokens_seen": 11424629280,
      "step": 14521
    },
    {
      "epoch": 1.5406322936558454,
      "grad_norm": 0.4030987339817171,
      "learning_rate": 4.8017892007702204e-05,
      "loss": 1.7306,
      "num_input_tokens_seen": 11425416000,
      "step": 14522
    },
    {
      "epoch": 1.540738383195417,
      "grad_norm": 0.4203134333055146,
      "learning_rate": 4.80176207982912e-05,
      "loss": 1.6056,
      "num_input_tokens_seen": 11426202912,
      "step": 14523
    },
    {
      "epoch": 1.5408444727349884,
      "grad_norm": 0.3981336888343773,
      "learning_rate": 4.801734957109286e-05,
      "loss": 1.7691,
      "num_input_tokens_seen": 11426989712,
      "step": 14524
    },
    {
      "epoch": 1.5409505622745598,
      "grad_norm": 0.3836273654185001,
      "learning_rate": 4.801707832610739e-05,
      "loss": 1.7669,
      "num_input_tokens_seen": 11427776432,
      "step": 14525
    },
    {
      "epoch": 1.541056651814131,
      "grad_norm": 0.4339378773167931,
      "learning_rate": 4.8016807063335e-05,
      "loss": 1.8219,
      "num_input_tokens_seen": 11428563200,
      "step": 14526
    },
    {
      "epoch": 1.5411627413537026,
      "grad_norm": 0.3463374585210101,
      "learning_rate": 4.8016535782775895e-05,
      "loss": 1.7292,
      "num_input_tokens_seen": 11429350032,
      "step": 14527
    },
    {
      "epoch": 1.5412688308932738,
      "grad_norm": 0.35435774109688745,
      "learning_rate": 4.8016264484430283e-05,
      "loss": 1.6766,
      "num_input_tokens_seen": 11430136800,
      "step": 14528
    },
    {
      "epoch": 1.5413749204328453,
      "grad_norm": 0.3344977686022443,
      "learning_rate": 4.8015993168298375e-05,
      "loss": 1.7063,
      "num_input_tokens_seen": 11430923664,
      "step": 14529
    },
    {
      "epoch": 1.5414810099724168,
      "grad_norm": 0.36750536903039893,
      "learning_rate": 4.801572183438039e-05,
      "loss": 1.5801,
      "num_input_tokens_seen": 11431710384,
      "step": 14530
    },
    {
      "epoch": 1.5415870995119882,
      "grad_norm": 0.3548495046228008,
      "learning_rate": 4.8015450482676525e-05,
      "loss": 1.7722,
      "num_input_tokens_seen": 11432497120,
      "step": 14531
    },
    {
      "epoch": 1.5416931890515595,
      "grad_norm": 0.36802064909684573,
      "learning_rate": 4.8015179113187e-05,
      "loss": 1.5534,
      "num_input_tokens_seen": 11433284000,
      "step": 14532
    },
    {
      "epoch": 1.5417992785911308,
      "grad_norm": 0.4419084603002601,
      "learning_rate": 4.801490772591202e-05,
      "loss": 1.9051,
      "num_input_tokens_seen": 11434070752,
      "step": 14533
    },
    {
      "epoch": 1.5419053681307022,
      "grad_norm": 0.38275041565133944,
      "learning_rate": 4.801463632085179e-05,
      "loss": 1.7485,
      "num_input_tokens_seen": 11434857520,
      "step": 14534
    },
    {
      "epoch": 1.5420114576702737,
      "grad_norm": 0.3676075732006705,
      "learning_rate": 4.801436489800652e-05,
      "loss": 1.7446,
      "num_input_tokens_seen": 11435644224,
      "step": 14535
    },
    {
      "epoch": 1.5421175472098452,
      "grad_norm": 0.3378182748432764,
      "learning_rate": 4.801409345737643e-05,
      "loss": 1.6901,
      "num_input_tokens_seen": 11436430976,
      "step": 14536
    },
    {
      "epoch": 1.5422236367494166,
      "grad_norm": 0.3205655258344353,
      "learning_rate": 4.8013821998961725e-05,
      "loss": 1.7149,
      "num_input_tokens_seen": 11437217744,
      "step": 14537
    },
    {
      "epoch": 1.542329726288988,
      "grad_norm": 0.357086483887186,
      "learning_rate": 4.801355052276262e-05,
      "loss": 1.8113,
      "num_input_tokens_seen": 11438004464,
      "step": 14538
    },
    {
      "epoch": 1.5424358158285592,
      "grad_norm": 0.4172374875880946,
      "learning_rate": 4.8013279028779306e-05,
      "loss": 1.8558,
      "num_input_tokens_seen": 11438791200,
      "step": 14539
    },
    {
      "epoch": 1.5425419053681306,
      "grad_norm": 0.3939554678034886,
      "learning_rate": 4.801300751701201e-05,
      "loss": 1.7977,
      "num_input_tokens_seen": 11439577952,
      "step": 14540
    },
    {
      "epoch": 1.542647994907702,
      "grad_norm": 0.4362066072383322,
      "learning_rate": 4.801273598746093e-05,
      "loss": 1.8602,
      "num_input_tokens_seen": 11440364704,
      "step": 14541
    },
    {
      "epoch": 1.5427540844472736,
      "grad_norm": 0.4869855926195099,
      "learning_rate": 4.80124644401263e-05,
      "loss": 1.5774,
      "num_input_tokens_seen": 11441151664,
      "step": 14542
    },
    {
      "epoch": 1.542860173986845,
      "grad_norm": 0.46488857598028455,
      "learning_rate": 4.8012192875008296e-05,
      "loss": 1.6938,
      "num_input_tokens_seen": 11441938416,
      "step": 14543
    },
    {
      "epoch": 1.5429662635264163,
      "grad_norm": 0.4742549856506674,
      "learning_rate": 4.8011921292107156e-05,
      "loss": 1.875,
      "num_input_tokens_seen": 11442725216,
      "step": 14544
    },
    {
      "epoch": 1.5430723530659876,
      "grad_norm": 0.4181992696250299,
      "learning_rate": 4.8011649691423075e-05,
      "loss": 1.7096,
      "num_input_tokens_seen": 11443512064,
      "step": 14545
    },
    {
      "epoch": 1.543178442605559,
      "grad_norm": 0.49797933820920753,
      "learning_rate": 4.801137807295626e-05,
      "loss": 1.8954,
      "num_input_tokens_seen": 11444298784,
      "step": 14546
    },
    {
      "epoch": 1.5432845321451305,
      "grad_norm": 0.3315551117474768,
      "learning_rate": 4.801110643670694e-05,
      "loss": 1.6637,
      "num_input_tokens_seen": 11445085488,
      "step": 14547
    },
    {
      "epoch": 1.543390621684702,
      "grad_norm": 0.5308897252113225,
      "learning_rate": 4.80108347826753e-05,
      "loss": 1.6704,
      "num_input_tokens_seen": 11445872272,
      "step": 14548
    },
    {
      "epoch": 1.5434967112242732,
      "grad_norm": 0.437419424320569,
      "learning_rate": 4.8010563110861566e-05,
      "loss": 1.7065,
      "num_input_tokens_seen": 11446659040,
      "step": 14549
    },
    {
      "epoch": 1.5436028007638447,
      "grad_norm": 0.3493034630862005,
      "learning_rate": 4.8010291421265947e-05,
      "loss": 1.7246,
      "num_input_tokens_seen": 11447445856,
      "step": 14550
    },
    {
      "epoch": 1.543708890303416,
      "grad_norm": 0.3968528558953245,
      "learning_rate": 4.8010019713888646e-05,
      "loss": 1.6697,
      "num_input_tokens_seen": 11448232656,
      "step": 14551
    },
    {
      "epoch": 1.5438149798429874,
      "grad_norm": 0.43985534400362625,
      "learning_rate": 4.800974798872988e-05,
      "loss": 1.839,
      "num_input_tokens_seen": 11449019328,
      "step": 14552
    },
    {
      "epoch": 1.543921069382559,
      "grad_norm": 0.331429666680107,
      "learning_rate": 4.8009476245789855e-05,
      "loss": 1.7645,
      "num_input_tokens_seen": 11449806080,
      "step": 14553
    },
    {
      "epoch": 1.5440271589221304,
      "grad_norm": 0.4513125347850366,
      "learning_rate": 4.8009204485068784e-05,
      "loss": 1.7049,
      "num_input_tokens_seen": 11450592752,
      "step": 14554
    },
    {
      "epoch": 1.5441332484617016,
      "grad_norm": 0.36261412399968873,
      "learning_rate": 4.8008932706566866e-05,
      "loss": 1.7569,
      "num_input_tokens_seen": 11451379488,
      "step": 14555
    },
    {
      "epoch": 1.544239338001273,
      "grad_norm": 0.35382106151732345,
      "learning_rate": 4.800866091028432e-05,
      "loss": 1.7894,
      "num_input_tokens_seen": 11452166272,
      "step": 14556
    },
    {
      "epoch": 1.5443454275408444,
      "grad_norm": 0.3436230518907063,
      "learning_rate": 4.8008389096221367e-05,
      "loss": 1.7127,
      "num_input_tokens_seen": 11452953104,
      "step": 14557
    },
    {
      "epoch": 1.5444515170804158,
      "grad_norm": 0.3746185390702797,
      "learning_rate": 4.8008117264378206e-05,
      "loss": 1.7665,
      "num_input_tokens_seen": 11453739888,
      "step": 14558
    },
    {
      "epoch": 1.5445576066199873,
      "grad_norm": 0.33661523265293125,
      "learning_rate": 4.800784541475504e-05,
      "loss": 1.8177,
      "num_input_tokens_seen": 11454526656,
      "step": 14559
    },
    {
      "epoch": 1.5446636961595588,
      "grad_norm": 0.600940588590703,
      "learning_rate": 4.8007573547352084e-05,
      "loss": 1.7419,
      "num_input_tokens_seen": 11455313360,
      "step": 14560
    },
    {
      "epoch": 1.54476978569913,
      "grad_norm": 0.47153994519692866,
      "learning_rate": 4.800730166216956e-05,
      "loss": 1.6667,
      "num_input_tokens_seen": 11456100096,
      "step": 14561
    },
    {
      "epoch": 1.5448758752387015,
      "grad_norm": 0.56129071835588,
      "learning_rate": 4.800702975920766e-05,
      "loss": 1.7094,
      "num_input_tokens_seen": 11456886912,
      "step": 14562
    },
    {
      "epoch": 1.5449819647782728,
      "grad_norm": 0.443179698578494,
      "learning_rate": 4.800675783846661e-05,
      "loss": 1.7688,
      "num_input_tokens_seen": 11457673664,
      "step": 14563
    },
    {
      "epoch": 1.5450880543178442,
      "grad_norm": 0.4833549397583982,
      "learning_rate": 4.800648589994661e-05,
      "loss": 1.7599,
      "num_input_tokens_seen": 11458460400,
      "step": 14564
    },
    {
      "epoch": 1.5451941438574157,
      "grad_norm": 0.6634321489053401,
      "learning_rate": 4.8006213943647867e-05,
      "loss": 1.8412,
      "num_input_tokens_seen": 11459247136,
      "step": 14565
    },
    {
      "epoch": 1.5453002333969872,
      "grad_norm": 0.4391837166062848,
      "learning_rate": 4.80059419695706e-05,
      "loss": 1.8238,
      "num_input_tokens_seen": 11460033872,
      "step": 14566
    },
    {
      "epoch": 1.5454063229365584,
      "grad_norm": 0.6571160934489454,
      "learning_rate": 4.8005669977715015e-05,
      "loss": 1.6467,
      "num_input_tokens_seen": 11460820672,
      "step": 14567
    },
    {
      "epoch": 1.5455124124761297,
      "grad_norm": 0.4178027503696057,
      "learning_rate": 4.8005397968081326e-05,
      "loss": 1.6246,
      "num_input_tokens_seen": 11461607472,
      "step": 14568
    },
    {
      "epoch": 1.5456185020157012,
      "grad_norm": 0.4447509242343679,
      "learning_rate": 4.8005125940669736e-05,
      "loss": 1.8022,
      "num_input_tokens_seen": 11462394304,
      "step": 14569
    },
    {
      "epoch": 1.5457245915552726,
      "grad_norm": 0.5313826221832457,
      "learning_rate": 4.8004853895480464e-05,
      "loss": 1.7927,
      "num_input_tokens_seen": 11463180992,
      "step": 14570
    },
    {
      "epoch": 1.5458306810948441,
      "grad_norm": 0.4347723304545334,
      "learning_rate": 4.800458183251372e-05,
      "loss": 1.833,
      "num_input_tokens_seen": 11463967760,
      "step": 14571
    },
    {
      "epoch": 1.5459367706344156,
      "grad_norm": 0.3479643140004752,
      "learning_rate": 4.800430975176971e-05,
      "loss": 1.6874,
      "num_input_tokens_seen": 11464754512,
      "step": 14572
    },
    {
      "epoch": 1.5460428601739868,
      "grad_norm": 0.5410299262103628,
      "learning_rate": 4.800403765324863e-05,
      "loss": 1.765,
      "num_input_tokens_seen": 11465541344,
      "step": 14573
    },
    {
      "epoch": 1.546148949713558,
      "grad_norm": 0.44785673270819476,
      "learning_rate": 4.800376553695072e-05,
      "loss": 1.7137,
      "num_input_tokens_seen": 11466328128,
      "step": 14574
    },
    {
      "epoch": 1.5462550392531296,
      "grad_norm": 0.3834397718423822,
      "learning_rate": 4.800349340287617e-05,
      "loss": 1.7491,
      "num_input_tokens_seen": 11467114928,
      "step": 14575
    },
    {
      "epoch": 1.546361128792701,
      "grad_norm": 0.5087574184985867,
      "learning_rate": 4.8003221251025186e-05,
      "loss": 1.8019,
      "num_input_tokens_seen": 11467901728,
      "step": 14576
    },
    {
      "epoch": 1.5464672183322725,
      "grad_norm": 0.4155370639196924,
      "learning_rate": 4.8002949081398e-05,
      "loss": 1.6437,
      "num_input_tokens_seen": 11468688512,
      "step": 14577
    },
    {
      "epoch": 1.546573307871844,
      "grad_norm": 0.396316677114533,
      "learning_rate": 4.80026768939948e-05,
      "loss": 1.7634,
      "num_input_tokens_seen": 11469475344,
      "step": 14578
    },
    {
      "epoch": 1.5466793974114152,
      "grad_norm": 0.5206143777811609,
      "learning_rate": 4.8002404688815816e-05,
      "loss": 1.6472,
      "num_input_tokens_seen": 11470262144,
      "step": 14579
    },
    {
      "epoch": 1.5467854869509865,
      "grad_norm": 0.36931194867617073,
      "learning_rate": 4.800213246586124e-05,
      "loss": 1.6491,
      "num_input_tokens_seen": 11471048864,
      "step": 14580
    },
    {
      "epoch": 1.546891576490558,
      "grad_norm": 0.35397949952874336,
      "learning_rate": 4.8001860225131304e-05,
      "loss": 1.7274,
      "num_input_tokens_seen": 11471835680,
      "step": 14581
    },
    {
      "epoch": 1.5469976660301294,
      "grad_norm": 0.38800374196761284,
      "learning_rate": 4.8001587966626196e-05,
      "loss": 1.7186,
      "num_input_tokens_seen": 11472622416,
      "step": 14582
    },
    {
      "epoch": 1.547103755569701,
      "grad_norm": 0.4728675278949964,
      "learning_rate": 4.8001315690346135e-05,
      "loss": 1.827,
      "num_input_tokens_seen": 11473409136,
      "step": 14583
    },
    {
      "epoch": 1.5472098451092722,
      "grad_norm": 0.3888823516720995,
      "learning_rate": 4.800104339629133e-05,
      "loss": 1.848,
      "num_input_tokens_seen": 11474196000,
      "step": 14584
    },
    {
      "epoch": 1.5473159346488436,
      "grad_norm": 0.34940571846742036,
      "learning_rate": 4.8000771084462e-05,
      "loss": 1.7218,
      "num_input_tokens_seen": 11474982736,
      "step": 14585
    },
    {
      "epoch": 1.547422024188415,
      "grad_norm": 0.3558291714842336,
      "learning_rate": 4.8000498754858344e-05,
      "loss": 1.7825,
      "num_input_tokens_seen": 11475769584,
      "step": 14586
    },
    {
      "epoch": 1.5475281137279864,
      "grad_norm": 0.39536800306607234,
      "learning_rate": 4.800022640748059e-05,
      "loss": 1.6987,
      "num_input_tokens_seen": 11476556400,
      "step": 14587
    },
    {
      "epoch": 1.5476342032675579,
      "grad_norm": 0.3548798446797808,
      "learning_rate": 4.799995404232892e-05,
      "loss": 1.7927,
      "num_input_tokens_seen": 11477343136,
      "step": 14588
    },
    {
      "epoch": 1.5477402928071293,
      "grad_norm": 0.3861559596010113,
      "learning_rate": 4.7999681659403564e-05,
      "loss": 1.7834,
      "num_input_tokens_seen": 11478129840,
      "step": 14589
    },
    {
      "epoch": 1.5478463823467006,
      "grad_norm": 0.3845752741972519,
      "learning_rate": 4.799940925870473e-05,
      "loss": 1.6739,
      "num_input_tokens_seen": 11478916736,
      "step": 14590
    },
    {
      "epoch": 1.547952471886272,
      "grad_norm": 0.3522725444067363,
      "learning_rate": 4.7999136840232626e-05,
      "loss": 1.7256,
      "num_input_tokens_seen": 11479703568,
      "step": 14591
    },
    {
      "epoch": 1.5480585614258433,
      "grad_norm": 0.3500855885219728,
      "learning_rate": 4.799886440398747e-05,
      "loss": 1.7572,
      "num_input_tokens_seen": 11480490416,
      "step": 14592
    },
    {
      "epoch": 1.5481646509654148,
      "grad_norm": 0.37554843347366373,
      "learning_rate": 4.799859194996946e-05,
      "loss": 1.7775,
      "num_input_tokens_seen": 11481277136,
      "step": 14593
    },
    {
      "epoch": 1.5482707405049863,
      "grad_norm": 0.3612633588904519,
      "learning_rate": 4.799831947817882e-05,
      "loss": 1.7767,
      "num_input_tokens_seen": 11482064016,
      "step": 14594
    },
    {
      "epoch": 1.5483768300445577,
      "grad_norm": 0.3328965729874997,
      "learning_rate": 4.7998046988615754e-05,
      "loss": 1.7449,
      "num_input_tokens_seen": 11482850704,
      "step": 14595
    },
    {
      "epoch": 1.548482919584129,
      "grad_norm": 0.38140969839336153,
      "learning_rate": 4.799777448128046e-05,
      "loss": 1.8835,
      "num_input_tokens_seen": 11483637440,
      "step": 14596
    },
    {
      "epoch": 1.5485890091237005,
      "grad_norm": 0.36140021114503634,
      "learning_rate": 4.799750195617317e-05,
      "loss": 1.7501,
      "num_input_tokens_seen": 11484424208,
      "step": 14597
    },
    {
      "epoch": 1.5486950986632717,
      "grad_norm": 0.3362424808567253,
      "learning_rate": 4.799722941329408e-05,
      "loss": 1.7803,
      "num_input_tokens_seen": 11485210928,
      "step": 14598
    },
    {
      "epoch": 1.5488011882028432,
      "grad_norm": 0.3986400995939355,
      "learning_rate": 4.799695685264341e-05,
      "loss": 1.7952,
      "num_input_tokens_seen": 11485997584,
      "step": 14599
    },
    {
      "epoch": 1.5489072777424147,
      "grad_norm": 0.3907349421130646,
      "learning_rate": 4.799668427422137e-05,
      "loss": 1.7885,
      "num_input_tokens_seen": 11486784368,
      "step": 14600
    },
    {
      "epoch": 1.5490133672819861,
      "grad_norm": 0.463749850209498,
      "learning_rate": 4.799641167802816e-05,
      "loss": 1.7642,
      "num_input_tokens_seen": 11487571120,
      "step": 14601
    },
    {
      "epoch": 1.5491194568215574,
      "grad_norm": 0.39882862656742085,
      "learning_rate": 4.7996139064064e-05,
      "loss": 1.8806,
      "num_input_tokens_seen": 11488357840,
      "step": 14602
    },
    {
      "epoch": 1.5492255463611286,
      "grad_norm": 0.4073124160160335,
      "learning_rate": 4.79958664323291e-05,
      "loss": 1.7738,
      "num_input_tokens_seen": 11489144560,
      "step": 14603
    },
    {
      "epoch": 1.5493316359007,
      "grad_norm": 0.4175551600035704,
      "learning_rate": 4.799559378282367e-05,
      "loss": 1.6955,
      "num_input_tokens_seen": 11489931328,
      "step": 14604
    },
    {
      "epoch": 1.5494377254402716,
      "grad_norm": 0.37809561578365447,
      "learning_rate": 4.799532111554792e-05,
      "loss": 1.6297,
      "num_input_tokens_seen": 11490718160,
      "step": 14605
    },
    {
      "epoch": 1.549543814979843,
      "grad_norm": 0.363638799318799,
      "learning_rate": 4.799504843050205e-05,
      "loss": 1.7621,
      "num_input_tokens_seen": 11491504976,
      "step": 14606
    },
    {
      "epoch": 1.5496499045194145,
      "grad_norm": 0.4632279443041857,
      "learning_rate": 4.799477572768629e-05,
      "loss": 1.6753,
      "num_input_tokens_seen": 11492291776,
      "step": 14607
    },
    {
      "epoch": 1.5497559940589858,
      "grad_norm": 0.47726545762988926,
      "learning_rate": 4.7994503007100844e-05,
      "loss": 1.7659,
      "num_input_tokens_seen": 11493078576,
      "step": 14608
    },
    {
      "epoch": 1.549862083598557,
      "grad_norm": 0.6728864565578878,
      "learning_rate": 4.799423026874592e-05,
      "loss": 1.8379,
      "num_input_tokens_seen": 11493865312,
      "step": 14609
    },
    {
      "epoch": 1.5499681731381285,
      "grad_norm": 0.4304645325754974,
      "learning_rate": 4.799395751262173e-05,
      "loss": 1.8772,
      "num_input_tokens_seen": 11494652144,
      "step": 14610
    },
    {
      "epoch": 1.5500742626777,
      "grad_norm": 0.734450930286392,
      "learning_rate": 4.7993684738728486e-05,
      "loss": 1.6777,
      "num_input_tokens_seen": 11495439008,
      "step": 14611
    },
    {
      "epoch": 1.5501803522172715,
      "grad_norm": 0.4407460537362432,
      "learning_rate": 4.799341194706639e-05,
      "loss": 1.8234,
      "num_input_tokens_seen": 11496225744,
      "step": 14612
    },
    {
      "epoch": 1.550286441756843,
      "grad_norm": 0.7007025515684654,
      "learning_rate": 4.7993139137635664e-05,
      "loss": 1.7549,
      "num_input_tokens_seen": 11497012480,
      "step": 14613
    },
    {
      "epoch": 1.5503925312964142,
      "grad_norm": 0.46038802961544933,
      "learning_rate": 4.799286631043651e-05,
      "loss": 1.8378,
      "num_input_tokens_seen": 11497799280,
      "step": 14614
    },
    {
      "epoch": 1.5504986208359854,
      "grad_norm": 0.495744710156881,
      "learning_rate": 4.799259346546915e-05,
      "loss": 1.6793,
      "num_input_tokens_seen": 11498586000,
      "step": 14615
    },
    {
      "epoch": 1.550604710375557,
      "grad_norm": 0.5698288372143706,
      "learning_rate": 4.7992320602733784e-05,
      "loss": 1.7419,
      "num_input_tokens_seen": 11499372816,
      "step": 14616
    },
    {
      "epoch": 1.5507107999151284,
      "grad_norm": 0.320540029519524,
      "learning_rate": 4.799204772223064e-05,
      "loss": 1.5886,
      "num_input_tokens_seen": 11500159696,
      "step": 14617
    },
    {
      "epoch": 1.5508168894546999,
      "grad_norm": 0.8647671610747627,
      "learning_rate": 4.79917748239599e-05,
      "loss": 1.8541,
      "num_input_tokens_seen": 11500946576,
      "step": 14618
    },
    {
      "epoch": 1.5509229789942711,
      "grad_norm": 0.3767312671310837,
      "learning_rate": 4.79915019079218e-05,
      "loss": 1.8833,
      "num_input_tokens_seen": 11501733344,
      "step": 14619
    },
    {
      "epoch": 1.5510290685338426,
      "grad_norm": 0.7604008024628568,
      "learning_rate": 4.799122897411653e-05,
      "loss": 1.8154,
      "num_input_tokens_seen": 11502520112,
      "step": 14620
    },
    {
      "epoch": 1.5511351580734138,
      "grad_norm": 0.36709516493169814,
      "learning_rate": 4.7990956022544325e-05,
      "loss": 1.7555,
      "num_input_tokens_seen": 11503306800,
      "step": 14621
    },
    {
      "epoch": 1.5512412476129853,
      "grad_norm": 0.7097096044132439,
      "learning_rate": 4.799068305320538e-05,
      "loss": 1.8077,
      "num_input_tokens_seen": 11504093568,
      "step": 14622
    },
    {
      "epoch": 1.5513473371525568,
      "grad_norm": 0.4677190948336702,
      "learning_rate": 4.799041006609991e-05,
      "loss": 1.8484,
      "num_input_tokens_seen": 11504880240,
      "step": 14623
    },
    {
      "epoch": 1.5514534266921283,
      "grad_norm": 0.5732655970907636,
      "learning_rate": 4.799013706122812e-05,
      "loss": 1.7844,
      "num_input_tokens_seen": 11505667040,
      "step": 14624
    },
    {
      "epoch": 1.5515595162316995,
      "grad_norm": 0.5454908463342534,
      "learning_rate": 4.798986403859024e-05,
      "loss": 1.8088,
      "num_input_tokens_seen": 11506453744,
      "step": 14625
    },
    {
      "epoch": 1.551665605771271,
      "grad_norm": 0.4956030339294351,
      "learning_rate": 4.798959099818646e-05,
      "loss": 1.6506,
      "num_input_tokens_seen": 11507240608,
      "step": 14626
    },
    {
      "epoch": 1.5517716953108422,
      "grad_norm": 0.5632601681831741,
      "learning_rate": 4.7989317940017e-05,
      "loss": 1.7929,
      "num_input_tokens_seen": 11508027408,
      "step": 14627
    },
    {
      "epoch": 1.5518777848504137,
      "grad_norm": 0.4777700937763212,
      "learning_rate": 4.7989044864082065e-05,
      "loss": 1.6355,
      "num_input_tokens_seen": 11508814192,
      "step": 14628
    },
    {
      "epoch": 1.5519838743899852,
      "grad_norm": 0.8359562812093057,
      "learning_rate": 4.798877177038187e-05,
      "loss": 1.8828,
      "num_input_tokens_seen": 11509600880,
      "step": 14629
    },
    {
      "epoch": 1.5520899639295567,
      "grad_norm": 0.5249090470634596,
      "learning_rate": 4.798849865891664e-05,
      "loss": 1.7816,
      "num_input_tokens_seen": 11510387824,
      "step": 14630
    },
    {
      "epoch": 1.552196053469128,
      "grad_norm": 0.6884051225679665,
      "learning_rate": 4.798822552968656e-05,
      "loss": 1.7435,
      "num_input_tokens_seen": 11511174576,
      "step": 14631
    },
    {
      "epoch": 1.5523021430086994,
      "grad_norm": 0.4090119092092616,
      "learning_rate": 4.798795238269186e-05,
      "loss": 1.6779,
      "num_input_tokens_seen": 11511961408,
      "step": 14632
    },
    {
      "epoch": 1.5524082325482707,
      "grad_norm": 0.6397122592333432,
      "learning_rate": 4.798767921793274e-05,
      "loss": 1.719,
      "num_input_tokens_seen": 11512748192,
      "step": 14633
    },
    {
      "epoch": 1.5525143220878421,
      "grad_norm": 0.46513241633508373,
      "learning_rate": 4.7987406035409417e-05,
      "loss": 1.74,
      "num_input_tokens_seen": 11513534992,
      "step": 14634
    },
    {
      "epoch": 1.5526204116274136,
      "grad_norm": 0.533531201556049,
      "learning_rate": 4.7987132835122106e-05,
      "loss": 1.9006,
      "num_input_tokens_seen": 11514321728,
      "step": 14635
    },
    {
      "epoch": 1.552726501166985,
      "grad_norm": 0.4140599062538007,
      "learning_rate": 4.7986859617071004e-05,
      "loss": 1.7569,
      "num_input_tokens_seen": 11515108496,
      "step": 14636
    },
    {
      "epoch": 1.5528325907065563,
      "grad_norm": 0.43745923198683107,
      "learning_rate": 4.798658638125634e-05,
      "loss": 1.6177,
      "num_input_tokens_seen": 11515895264,
      "step": 14637
    },
    {
      "epoch": 1.5529386802461276,
      "grad_norm": 0.4035485867141748,
      "learning_rate": 4.798631312767831e-05,
      "loss": 1.7615,
      "num_input_tokens_seen": 11516682048,
      "step": 14638
    },
    {
      "epoch": 1.553044769785699,
      "grad_norm": 0.3609991423320253,
      "learning_rate": 4.798603985633714e-05,
      "loss": 1.7027,
      "num_input_tokens_seen": 11517468768,
      "step": 14639
    },
    {
      "epoch": 1.5531508593252705,
      "grad_norm": 0.4335596700352355,
      "learning_rate": 4.7985766567233026e-05,
      "loss": 1.6569,
      "num_input_tokens_seen": 11518255488,
      "step": 14640
    },
    {
      "epoch": 1.553256948864842,
      "grad_norm": 0.38905173923922687,
      "learning_rate": 4.798549326036619e-05,
      "loss": 1.7857,
      "num_input_tokens_seen": 11519042208,
      "step": 14641
    },
    {
      "epoch": 1.5533630384044135,
      "grad_norm": 0.5357556115115749,
      "learning_rate": 4.7985219935736834e-05,
      "loss": 1.6966,
      "num_input_tokens_seen": 11519828944,
      "step": 14642
    },
    {
      "epoch": 1.5534691279439847,
      "grad_norm": 0.5720019401424224,
      "learning_rate": 4.798494659334518e-05,
      "loss": 1.8197,
      "num_input_tokens_seen": 11520615696,
      "step": 14643
    },
    {
      "epoch": 1.553575217483556,
      "grad_norm": 0.5655083552187825,
      "learning_rate": 4.798467323319143e-05,
      "loss": 1.7905,
      "num_input_tokens_seen": 11521402512,
      "step": 14644
    },
    {
      "epoch": 1.5536813070231275,
      "grad_norm": 0.5757687843231012,
      "learning_rate": 4.7984399855275796e-05,
      "loss": 1.7183,
      "num_input_tokens_seen": 11522189264,
      "step": 14645
    },
    {
      "epoch": 1.553787396562699,
      "grad_norm": 0.5727449194764803,
      "learning_rate": 4.7984126459598496e-05,
      "loss": 1.8364,
      "num_input_tokens_seen": 11522976112,
      "step": 14646
    },
    {
      "epoch": 1.5538934861022704,
      "grad_norm": 0.42555939777497054,
      "learning_rate": 4.798385304615974e-05,
      "loss": 1.8128,
      "num_input_tokens_seen": 11523762928,
      "step": 14647
    },
    {
      "epoch": 1.5539995756418419,
      "grad_norm": 0.589618581203575,
      "learning_rate": 4.798357961495974e-05,
      "loss": 1.849,
      "num_input_tokens_seen": 11524549712,
      "step": 14648
    },
    {
      "epoch": 1.5541056651814131,
      "grad_norm": 0.5555317740943048,
      "learning_rate": 4.79833061659987e-05,
      "loss": 1.7409,
      "num_input_tokens_seen": 11525336448,
      "step": 14649
    },
    {
      "epoch": 1.5542117547209844,
      "grad_norm": 0.4969137312975284,
      "learning_rate": 4.798303269927683e-05,
      "loss": 1.7963,
      "num_input_tokens_seen": 11526123248,
      "step": 14650
    },
    {
      "epoch": 1.5543178442605559,
      "grad_norm": 0.6999143623630574,
      "learning_rate": 4.798275921479435e-05,
      "loss": 1.6217,
      "num_input_tokens_seen": 11526910096,
      "step": 14651
    },
    {
      "epoch": 1.5544239338001273,
      "grad_norm": 0.3989941677666732,
      "learning_rate": 4.798248571255147e-05,
      "loss": 1.9231,
      "num_input_tokens_seen": 11527696896,
      "step": 14652
    },
    {
      "epoch": 1.5545300233396988,
      "grad_norm": 0.5605698471915014,
      "learning_rate": 4.79822121925484e-05,
      "loss": 1.7773,
      "num_input_tokens_seen": 11528483584,
      "step": 14653
    },
    {
      "epoch": 1.55463611287927,
      "grad_norm": 0.6935227868214859,
      "learning_rate": 4.798193865478535e-05,
      "loss": 1.8541,
      "num_input_tokens_seen": 11529270336,
      "step": 14654
    },
    {
      "epoch": 1.5547422024188415,
      "grad_norm": 0.4356823325825681,
      "learning_rate": 4.798166509926253e-05,
      "loss": 1.7586,
      "num_input_tokens_seen": 11530057104,
      "step": 14655
    },
    {
      "epoch": 1.5548482919584128,
      "grad_norm": 0.7227012516476417,
      "learning_rate": 4.798139152598015e-05,
      "loss": 1.8452,
      "num_input_tokens_seen": 11530844016,
      "step": 14656
    },
    {
      "epoch": 1.5549543814979843,
      "grad_norm": 0.4183988817345883,
      "learning_rate": 4.7981117934938427e-05,
      "loss": 1.8314,
      "num_input_tokens_seen": 11531630848,
      "step": 14657
    },
    {
      "epoch": 1.5550604710375557,
      "grad_norm": 0.635868073032176,
      "learning_rate": 4.7980844326137575e-05,
      "loss": 1.7171,
      "num_input_tokens_seen": 11532417632,
      "step": 14658
    },
    {
      "epoch": 1.5551665605771272,
      "grad_norm": 0.35572575443698456,
      "learning_rate": 4.79805706995778e-05,
      "loss": 1.8642,
      "num_input_tokens_seen": 11533204432,
      "step": 14659
    },
    {
      "epoch": 1.5552726501166985,
      "grad_norm": 0.37039587566696064,
      "learning_rate": 4.7980297055259315e-05,
      "loss": 1.6142,
      "num_input_tokens_seen": 11533991136,
      "step": 14660
    },
    {
      "epoch": 1.55537873965627,
      "grad_norm": 0.49431555304498176,
      "learning_rate": 4.798002339318233e-05,
      "loss": 1.6679,
      "num_input_tokens_seen": 11534777904,
      "step": 14661
    },
    {
      "epoch": 1.5554848291958412,
      "grad_norm": 0.3406092409765922,
      "learning_rate": 4.797974971334706e-05,
      "loss": 1.7307,
      "num_input_tokens_seen": 11535564624,
      "step": 14662
    },
    {
      "epoch": 1.5555909187354127,
      "grad_norm": 0.5553371731314164,
      "learning_rate": 4.79794760157537e-05,
      "loss": 1.7893,
      "num_input_tokens_seen": 11536351408,
      "step": 14663
    },
    {
      "epoch": 1.5556970082749841,
      "grad_norm": 0.4044455509841768,
      "learning_rate": 4.7979202300402486e-05,
      "loss": 1.572,
      "num_input_tokens_seen": 11537138208,
      "step": 14664
    },
    {
      "epoch": 1.5558030978145556,
      "grad_norm": 0.39092792052043335,
      "learning_rate": 4.797892856729362e-05,
      "loss": 1.8332,
      "num_input_tokens_seen": 11537924864,
      "step": 14665
    },
    {
      "epoch": 1.5559091873541269,
      "grad_norm": 0.40627801931542235,
      "learning_rate": 4.797865481642731e-05,
      "loss": 1.8409,
      "num_input_tokens_seen": 11538711536,
      "step": 14666
    },
    {
      "epoch": 1.5560152768936981,
      "grad_norm": 0.4073219936113558,
      "learning_rate": 4.7978381047803764e-05,
      "loss": 1.7893,
      "num_input_tokens_seen": 11539498288,
      "step": 14667
    },
    {
      "epoch": 1.5561213664332696,
      "grad_norm": 0.4537120357065468,
      "learning_rate": 4.7978107261423214e-05,
      "loss": 1.9866,
      "num_input_tokens_seen": 11540285008,
      "step": 14668
    },
    {
      "epoch": 1.556227455972841,
      "grad_norm": 0.40325729802741533,
      "learning_rate": 4.7977833457285845e-05,
      "loss": 1.887,
      "num_input_tokens_seen": 11541071776,
      "step": 14669
    },
    {
      "epoch": 1.5563335455124125,
      "grad_norm": 0.407554829938711,
      "learning_rate": 4.797755963539188e-05,
      "loss": 1.6864,
      "num_input_tokens_seen": 11541858480,
      "step": 14670
    },
    {
      "epoch": 1.556439635051984,
      "grad_norm": 0.4166274274572404,
      "learning_rate": 4.7977285795741536e-05,
      "loss": 1.6699,
      "num_input_tokens_seen": 11542645248,
      "step": 14671
    },
    {
      "epoch": 1.5565457245915553,
      "grad_norm": 0.3445863652756995,
      "learning_rate": 4.7977011938335017e-05,
      "loss": 1.8379,
      "num_input_tokens_seen": 11543432000,
      "step": 14672
    },
    {
      "epoch": 1.5566518141311265,
      "grad_norm": 0.4246265226705135,
      "learning_rate": 4.797673806317254e-05,
      "loss": 1.7156,
      "num_input_tokens_seen": 11544218752,
      "step": 14673
    },
    {
      "epoch": 1.556757903670698,
      "grad_norm": 0.44295259154064787,
      "learning_rate": 4.797646417025431e-05,
      "loss": 1.6322,
      "num_input_tokens_seen": 11545005568,
      "step": 14674
    },
    {
      "epoch": 1.5568639932102695,
      "grad_norm": 0.4167699748755656,
      "learning_rate": 4.797619025958055e-05,
      "loss": 1.7578,
      "num_input_tokens_seen": 11545792320,
      "step": 14675
    },
    {
      "epoch": 1.556970082749841,
      "grad_norm": 0.4051380191571257,
      "learning_rate": 4.797591633115146e-05,
      "loss": 1.8464,
      "num_input_tokens_seen": 11546579088,
      "step": 14676
    },
    {
      "epoch": 1.5570761722894124,
      "grad_norm": 0.34485468337420017,
      "learning_rate": 4.797564238496725e-05,
      "loss": 1.5602,
      "num_input_tokens_seen": 11547365840,
      "step": 14677
    },
    {
      "epoch": 1.5571822618289837,
      "grad_norm": 0.43865963713503764,
      "learning_rate": 4.797536842102814e-05,
      "loss": 1.9465,
      "num_input_tokens_seen": 11548152512,
      "step": 14678
    },
    {
      "epoch": 1.557288351368555,
      "grad_norm": 0.34886339679388395,
      "learning_rate": 4.7975094439334344e-05,
      "loss": 1.7834,
      "num_input_tokens_seen": 11548939232,
      "step": 14679
    },
    {
      "epoch": 1.5573944409081264,
      "grad_norm": 0.4289929096327592,
      "learning_rate": 4.797482043988607e-05,
      "loss": 1.7146,
      "num_input_tokens_seen": 11549725984,
      "step": 14680
    },
    {
      "epoch": 1.5575005304476979,
      "grad_norm": 0.4589370604027467,
      "learning_rate": 4.7974546422683534e-05,
      "loss": 1.8695,
      "num_input_tokens_seen": 11550512656,
      "step": 14681
    },
    {
      "epoch": 1.5576066199872693,
      "grad_norm": 0.4419469605808127,
      "learning_rate": 4.797427238772693e-05,
      "loss": 1.662,
      "num_input_tokens_seen": 11551299504,
      "step": 14682
    },
    {
      "epoch": 1.5577127095268406,
      "grad_norm": 0.3895636749441475,
      "learning_rate": 4.797399833501649e-05,
      "loss": 1.7082,
      "num_input_tokens_seen": 11552086304,
      "step": 14683
    },
    {
      "epoch": 1.557818799066412,
      "grad_norm": 0.39786802133476534,
      "learning_rate": 4.797372426455241e-05,
      "loss": 1.6571,
      "num_input_tokens_seen": 11552873072,
      "step": 14684
    },
    {
      "epoch": 1.5579248886059833,
      "grad_norm": 0.3793216800529987,
      "learning_rate": 4.797345017633492e-05,
      "loss": 1.7521,
      "num_input_tokens_seen": 11553659872,
      "step": 14685
    },
    {
      "epoch": 1.5580309781455548,
      "grad_norm": 0.44772189005932655,
      "learning_rate": 4.797317607036422e-05,
      "loss": 1.8903,
      "num_input_tokens_seen": 11554446560,
      "step": 14686
    },
    {
      "epoch": 1.5581370676851263,
      "grad_norm": 0.3724496176240299,
      "learning_rate": 4.797290194664052e-05,
      "loss": 1.6691,
      "num_input_tokens_seen": 11555233376,
      "step": 14687
    },
    {
      "epoch": 1.5582431572246978,
      "grad_norm": 0.3949071141092997,
      "learning_rate": 4.797262780516404e-05,
      "loss": 1.7734,
      "num_input_tokens_seen": 11556020192,
      "step": 14688
    },
    {
      "epoch": 1.558349246764269,
      "grad_norm": 0.4410971247322784,
      "learning_rate": 4.797235364593498e-05,
      "loss": 1.7345,
      "num_input_tokens_seen": 11556806896,
      "step": 14689
    },
    {
      "epoch": 1.5584553363038405,
      "grad_norm": 0.405949711196075,
      "learning_rate": 4.797207946895356e-05,
      "loss": 1.7918,
      "num_input_tokens_seen": 11557593648,
      "step": 14690
    },
    {
      "epoch": 1.5585614258434117,
      "grad_norm": 0.4469984079506572,
      "learning_rate": 4.797180527421999e-05,
      "loss": 1.6003,
      "num_input_tokens_seen": 11558380464,
      "step": 14691
    },
    {
      "epoch": 1.5586675153829832,
      "grad_norm": 0.43702440116454033,
      "learning_rate": 4.797153106173449e-05,
      "loss": 1.9084,
      "num_input_tokens_seen": 11559167184,
      "step": 14692
    },
    {
      "epoch": 1.5587736049225547,
      "grad_norm": 0.4040705756913926,
      "learning_rate": 4.797125683149727e-05,
      "loss": 1.6848,
      "num_input_tokens_seen": 11559953920,
      "step": 14693
    },
    {
      "epoch": 1.5588796944621262,
      "grad_norm": 0.43274759449581074,
      "learning_rate": 4.7970982583508525e-05,
      "loss": 1.7833,
      "num_input_tokens_seen": 11560740784,
      "step": 14694
    },
    {
      "epoch": 1.5589857840016974,
      "grad_norm": 0.3786865100265438,
      "learning_rate": 4.797070831776848e-05,
      "loss": 1.8616,
      "num_input_tokens_seen": 11561527488,
      "step": 14695
    },
    {
      "epoch": 1.5590918735412689,
      "grad_norm": 0.3620686075547537,
      "learning_rate": 4.7970434034277354e-05,
      "loss": 1.7597,
      "num_input_tokens_seen": 11562314304,
      "step": 14696
    },
    {
      "epoch": 1.5591979630808401,
      "grad_norm": 0.3432963721517352,
      "learning_rate": 4.797015973303534e-05,
      "loss": 1.6293,
      "num_input_tokens_seen": 11563101120,
      "step": 14697
    },
    {
      "epoch": 1.5593040526204116,
      "grad_norm": 0.41374592924713205,
      "learning_rate": 4.796988541404266e-05,
      "loss": 1.7237,
      "num_input_tokens_seen": 11563887840,
      "step": 14698
    },
    {
      "epoch": 1.559410142159983,
      "grad_norm": 0.39287430463492423,
      "learning_rate": 4.7969611077299535e-05,
      "loss": 1.7769,
      "num_input_tokens_seen": 11564674624,
      "step": 14699
    },
    {
      "epoch": 1.5595162316995546,
      "grad_norm": 0.40256435118500344,
      "learning_rate": 4.796933672280617e-05,
      "loss": 1.8015,
      "num_input_tokens_seen": 11565461456,
      "step": 14700
    },
    {
      "epoch": 1.5596223212391258,
      "grad_norm": 0.4975582271208005,
      "learning_rate": 4.796906235056276e-05,
      "loss": 1.6493,
      "num_input_tokens_seen": 11566248160,
      "step": 14701
    },
    {
      "epoch": 1.559728410778697,
      "grad_norm": 0.43582275568096424,
      "learning_rate": 4.796878796056955e-05,
      "loss": 1.7054,
      "num_input_tokens_seen": 11567035024,
      "step": 14702
    },
    {
      "epoch": 1.5598345003182685,
      "grad_norm": 0.3843636580277267,
      "learning_rate": 4.7968513552826735e-05,
      "loss": 1.678,
      "num_input_tokens_seen": 11567821728,
      "step": 14703
    },
    {
      "epoch": 1.55994058985784,
      "grad_norm": 0.4981445069279408,
      "learning_rate": 4.7968239127334516e-05,
      "loss": 1.7732,
      "num_input_tokens_seen": 11568608544,
      "step": 14704
    },
    {
      "epoch": 1.5600466793974115,
      "grad_norm": 0.37826347129609067,
      "learning_rate": 4.7967964684093116e-05,
      "loss": 1.7532,
      "num_input_tokens_seen": 11569395328,
      "step": 14705
    },
    {
      "epoch": 1.560152768936983,
      "grad_norm": 0.484740240519635,
      "learning_rate": 4.796769022310275e-05,
      "loss": 1.9072,
      "num_input_tokens_seen": 11570182112,
      "step": 14706
    },
    {
      "epoch": 1.5602588584765542,
      "grad_norm": 0.43486518287076614,
      "learning_rate": 4.796741574436363e-05,
      "loss": 1.7463,
      "num_input_tokens_seen": 11570968896,
      "step": 14707
    },
    {
      "epoch": 1.5603649480161255,
      "grad_norm": 0.37222859803176195,
      "learning_rate": 4.7967141247875954e-05,
      "loss": 1.76,
      "num_input_tokens_seen": 11571755568,
      "step": 14708
    },
    {
      "epoch": 1.560471037555697,
      "grad_norm": 0.36131124252086044,
      "learning_rate": 4.796686673363996e-05,
      "loss": 1.6217,
      "num_input_tokens_seen": 11572542304,
      "step": 14709
    },
    {
      "epoch": 1.5605771270952684,
      "grad_norm": 0.4018477642043657,
      "learning_rate": 4.796659220165584e-05,
      "loss": 1.8074,
      "num_input_tokens_seen": 11573328960,
      "step": 14710
    },
    {
      "epoch": 1.5606832166348399,
      "grad_norm": 0.36280109741929967,
      "learning_rate": 4.796631765192381e-05,
      "loss": 1.8108,
      "num_input_tokens_seen": 11574115712,
      "step": 14711
    },
    {
      "epoch": 1.5607893061744114,
      "grad_norm": 0.4091370111693328,
      "learning_rate": 4.796604308444408e-05,
      "loss": 1.792,
      "num_input_tokens_seen": 11574902528,
      "step": 14712
    },
    {
      "epoch": 1.5608953957139826,
      "grad_norm": 0.442450232427371,
      "learning_rate": 4.7965768499216865e-05,
      "loss": 1.7995,
      "num_input_tokens_seen": 11575689248,
      "step": 14713
    },
    {
      "epoch": 1.5610014852535539,
      "grad_norm": 0.38711724629321514,
      "learning_rate": 4.7965493896242384e-05,
      "loss": 1.8211,
      "num_input_tokens_seen": 11576475952,
      "step": 14714
    },
    {
      "epoch": 1.5611075747931253,
      "grad_norm": 0.40273407410888157,
      "learning_rate": 4.796521927552084e-05,
      "loss": 1.6276,
      "num_input_tokens_seen": 11577262736,
      "step": 14715
    },
    {
      "epoch": 1.5612136643326968,
      "grad_norm": 0.391743425561153,
      "learning_rate": 4.7964944637052456e-05,
      "loss": 1.7398,
      "num_input_tokens_seen": 11578049552,
      "step": 14716
    },
    {
      "epoch": 1.5613197538722683,
      "grad_norm": 0.33591915331891964,
      "learning_rate": 4.796466998083743e-05,
      "loss": 1.7244,
      "num_input_tokens_seen": 11578836256,
      "step": 14717
    },
    {
      "epoch": 1.5614258434118395,
      "grad_norm": 0.35800559871977267,
      "learning_rate": 4.7964395306875975e-05,
      "loss": 1.7743,
      "num_input_tokens_seen": 11579623024,
      "step": 14718
    },
    {
      "epoch": 1.561531932951411,
      "grad_norm": 0.3600172510569826,
      "learning_rate": 4.7964120615168315e-05,
      "loss": 1.7783,
      "num_input_tokens_seen": 11580409712,
      "step": 14719
    },
    {
      "epoch": 1.5616380224909823,
      "grad_norm": 0.4181580540026788,
      "learning_rate": 4.796384590571466e-05,
      "loss": 1.7094,
      "num_input_tokens_seen": 11581196336,
      "step": 14720
    },
    {
      "epoch": 1.5617441120305537,
      "grad_norm": 0.3078517200217849,
      "learning_rate": 4.796357117851522e-05,
      "loss": 1.6836,
      "num_input_tokens_seen": 11581983088,
      "step": 14721
    },
    {
      "epoch": 1.5618502015701252,
      "grad_norm": 0.4654287239344225,
      "learning_rate": 4.79632964335702e-05,
      "loss": 1.8293,
      "num_input_tokens_seen": 11582769840,
      "step": 14722
    },
    {
      "epoch": 1.5619562911096967,
      "grad_norm": 0.41593313574437585,
      "learning_rate": 4.7963021670879814e-05,
      "loss": 1.743,
      "num_input_tokens_seen": 11583556736,
      "step": 14723
    },
    {
      "epoch": 1.562062380649268,
      "grad_norm": 0.32774149584573076,
      "learning_rate": 4.796274689044429e-05,
      "loss": 1.7911,
      "num_input_tokens_seen": 11584343504,
      "step": 14724
    },
    {
      "epoch": 1.5621684701888394,
      "grad_norm": 0.37582254610070154,
      "learning_rate": 4.796247209226382e-05,
      "loss": 1.6737,
      "num_input_tokens_seen": 11585130384,
      "step": 14725
    },
    {
      "epoch": 1.5622745597284107,
      "grad_norm": 0.41544965647506427,
      "learning_rate": 4.796219727633863e-05,
      "loss": 1.7058,
      "num_input_tokens_seen": 11585917168,
      "step": 14726
    },
    {
      "epoch": 1.5623806492679821,
      "grad_norm": 0.3929266358830552,
      "learning_rate": 4.7961922442668925e-05,
      "loss": 1.6713,
      "num_input_tokens_seen": 11586703984,
      "step": 14727
    },
    {
      "epoch": 1.5624867388075536,
      "grad_norm": 0.4856929731657596,
      "learning_rate": 4.7961647591254923e-05,
      "loss": 1.7662,
      "num_input_tokens_seen": 11587490640,
      "step": 14728
    },
    {
      "epoch": 1.562592828347125,
      "grad_norm": 0.34745069666333933,
      "learning_rate": 4.796137272209683e-05,
      "loss": 1.7644,
      "num_input_tokens_seen": 11588277408,
      "step": 14729
    },
    {
      "epoch": 1.5626989178866963,
      "grad_norm": 0.49341360099504045,
      "learning_rate": 4.796109783519487e-05,
      "loss": 1.8043,
      "num_input_tokens_seen": 11589064160,
      "step": 14730
    },
    {
      "epoch": 1.5628050074262678,
      "grad_norm": 0.3298086143592038,
      "learning_rate": 4.796082293054924e-05,
      "loss": 1.7369,
      "num_input_tokens_seen": 11589850896,
      "step": 14731
    },
    {
      "epoch": 1.562911096965839,
      "grad_norm": 0.35263542313936475,
      "learning_rate": 4.7960548008160153e-05,
      "loss": 1.7472,
      "num_input_tokens_seen": 11590637712,
      "step": 14732
    },
    {
      "epoch": 1.5630171865054105,
      "grad_norm": 0.3663808301623639,
      "learning_rate": 4.796027306802784e-05,
      "loss": 1.8467,
      "num_input_tokens_seen": 11591424464,
      "step": 14733
    },
    {
      "epoch": 1.563123276044982,
      "grad_norm": 0.35243436996470595,
      "learning_rate": 4.79599981101525e-05,
      "loss": 1.8173,
      "num_input_tokens_seen": 11592211200,
      "step": 14734
    },
    {
      "epoch": 1.5632293655845535,
      "grad_norm": 0.3298273352931345,
      "learning_rate": 4.795972313453434e-05,
      "loss": 1.745,
      "num_input_tokens_seen": 11592997920,
      "step": 14735
    },
    {
      "epoch": 1.5633354551241248,
      "grad_norm": 0.3193533333569482,
      "learning_rate": 4.795944814117359e-05,
      "loss": 1.6809,
      "num_input_tokens_seen": 11593784736,
      "step": 14736
    },
    {
      "epoch": 1.563441544663696,
      "grad_norm": 0.36122623605537835,
      "learning_rate": 4.7959173130070446e-05,
      "loss": 1.8746,
      "num_input_tokens_seen": 11594571536,
      "step": 14737
    },
    {
      "epoch": 1.5635476342032675,
      "grad_norm": 0.35525057024955575,
      "learning_rate": 4.795889810122513e-05,
      "loss": 1.6758,
      "num_input_tokens_seen": 11595358320,
      "step": 14738
    },
    {
      "epoch": 1.563653723742839,
      "grad_norm": 0.32105210436243714,
      "learning_rate": 4.795862305463784e-05,
      "loss": 1.6242,
      "num_input_tokens_seen": 11596145072,
      "step": 14739
    },
    {
      "epoch": 1.5637598132824104,
      "grad_norm": 0.38758877554221455,
      "learning_rate": 4.7958347990308814e-05,
      "loss": 1.9033,
      "num_input_tokens_seen": 11596931776,
      "step": 14740
    },
    {
      "epoch": 1.563865902821982,
      "grad_norm": 0.38599763833107764,
      "learning_rate": 4.795807290823824e-05,
      "loss": 1.7638,
      "num_input_tokens_seen": 11597718496,
      "step": 14741
    },
    {
      "epoch": 1.5639719923615532,
      "grad_norm": 0.3671987309945485,
      "learning_rate": 4.7957797808426346e-05,
      "loss": 1.8637,
      "num_input_tokens_seen": 11598505216,
      "step": 14742
    },
    {
      "epoch": 1.5640780819011244,
      "grad_norm": 0.369188363728603,
      "learning_rate": 4.795752269087334e-05,
      "loss": 1.653,
      "num_input_tokens_seen": 11599292048,
      "step": 14743
    },
    {
      "epoch": 1.5641841714406959,
      "grad_norm": 0.37286321970153236,
      "learning_rate": 4.795724755557943e-05,
      "loss": 1.8237,
      "num_input_tokens_seen": 11600078800,
      "step": 14744
    },
    {
      "epoch": 1.5642902609802674,
      "grad_norm": 0.3698142098803468,
      "learning_rate": 4.7956972402544844e-05,
      "loss": 1.6943,
      "num_input_tokens_seen": 11600865600,
      "step": 14745
    },
    {
      "epoch": 1.5643963505198388,
      "grad_norm": 0.3531458011612249,
      "learning_rate": 4.795669723176977e-05,
      "loss": 1.8246,
      "num_input_tokens_seen": 11601652400,
      "step": 14746
    },
    {
      "epoch": 1.5645024400594103,
      "grad_norm": 0.40905797060861504,
      "learning_rate": 4.795642204325444e-05,
      "loss": 1.7981,
      "num_input_tokens_seen": 11602439152,
      "step": 14747
    },
    {
      "epoch": 1.5646085295989816,
      "grad_norm": 0.3690114839557563,
      "learning_rate": 4.795614683699906e-05,
      "loss": 1.8426,
      "num_input_tokens_seen": 11603225904,
      "step": 14748
    },
    {
      "epoch": 1.5647146191385528,
      "grad_norm": 0.35167384206940455,
      "learning_rate": 4.795587161300384e-05,
      "loss": 1.6046,
      "num_input_tokens_seen": 11604012720,
      "step": 14749
    },
    {
      "epoch": 1.5648207086781243,
      "grad_norm": 0.48727085653271823,
      "learning_rate": 4.7955596371268996e-05,
      "loss": 1.6809,
      "num_input_tokens_seen": 11604799456,
      "step": 14750
    },
    {
      "epoch": 1.5649267982176958,
      "grad_norm": 0.3934785493731789,
      "learning_rate": 4.795532111179475e-05,
      "loss": 1.7303,
      "num_input_tokens_seen": 11605586240,
      "step": 14751
    },
    {
      "epoch": 1.5650328877572672,
      "grad_norm": 0.5459878691149189,
      "learning_rate": 4.79550458345813e-05,
      "loss": 1.8835,
      "num_input_tokens_seen": 11606372960,
      "step": 14752
    },
    {
      "epoch": 1.5651389772968385,
      "grad_norm": 0.4144475308854416,
      "learning_rate": 4.7954770539628856e-05,
      "loss": 1.7664,
      "num_input_tokens_seen": 11607159664,
      "step": 14753
    },
    {
      "epoch": 1.56524506683641,
      "grad_norm": 0.4347557254904398,
      "learning_rate": 4.795449522693765e-05,
      "loss": 1.7935,
      "num_input_tokens_seen": 11607946448,
      "step": 14754
    },
    {
      "epoch": 1.5653511563759812,
      "grad_norm": 0.44668430167326445,
      "learning_rate": 4.795421989650788e-05,
      "loss": 1.6675,
      "num_input_tokens_seen": 11608733200,
      "step": 14755
    },
    {
      "epoch": 1.5654572459155527,
      "grad_norm": 0.43845298098873087,
      "learning_rate": 4.795394454833976e-05,
      "loss": 1.7372,
      "num_input_tokens_seen": 11609519984,
      "step": 14756
    },
    {
      "epoch": 1.5655633354551242,
      "grad_norm": 0.4281752772832839,
      "learning_rate": 4.7953669182433505e-05,
      "loss": 1.7818,
      "num_input_tokens_seen": 11610306784,
      "step": 14757
    },
    {
      "epoch": 1.5656694249946956,
      "grad_norm": 0.40044258419945944,
      "learning_rate": 4.7953393798789333e-05,
      "loss": 1.6999,
      "num_input_tokens_seen": 11611093520,
      "step": 14758
    },
    {
      "epoch": 1.5657755145342669,
      "grad_norm": 0.3956479266095621,
      "learning_rate": 4.795311839740745e-05,
      "loss": 1.6803,
      "num_input_tokens_seen": 11611880304,
      "step": 14759
    },
    {
      "epoch": 1.5658816040738384,
      "grad_norm": 0.3987725691375693,
      "learning_rate": 4.795284297828807e-05,
      "loss": 1.8142,
      "num_input_tokens_seen": 11612667008,
      "step": 14760
    },
    {
      "epoch": 1.5659876936134096,
      "grad_norm": 0.4117685134087328,
      "learning_rate": 4.7952567541431404e-05,
      "loss": 1.6905,
      "num_input_tokens_seen": 11613453808,
      "step": 14761
    },
    {
      "epoch": 1.566093783152981,
      "grad_norm": 0.4319313872533379,
      "learning_rate": 4.795229208683767e-05,
      "loss": 1.6661,
      "num_input_tokens_seen": 11614240624,
      "step": 14762
    },
    {
      "epoch": 1.5661998726925526,
      "grad_norm": 0.49698064649520574,
      "learning_rate": 4.795201661450708e-05,
      "loss": 1.7444,
      "num_input_tokens_seen": 11615027376,
      "step": 14763
    },
    {
      "epoch": 1.566305962232124,
      "grad_norm": 0.44860061737810103,
      "learning_rate": 4.795174112443984e-05,
      "loss": 1.8573,
      "num_input_tokens_seen": 11615814080,
      "step": 14764
    },
    {
      "epoch": 1.5664120517716953,
      "grad_norm": 0.4653406166431851,
      "learning_rate": 4.795146561663617e-05,
      "loss": 1.819,
      "num_input_tokens_seen": 11616600832,
      "step": 14765
    },
    {
      "epoch": 1.5665181413112665,
      "grad_norm": 0.39371417518769064,
      "learning_rate": 4.7951190091096274e-05,
      "loss": 1.7634,
      "num_input_tokens_seen": 11617387616,
      "step": 14766
    },
    {
      "epoch": 1.566624230850838,
      "grad_norm": 0.4736882836637635,
      "learning_rate": 4.795091454782038e-05,
      "loss": 1.707,
      "num_input_tokens_seen": 11618174416,
      "step": 14767
    },
    {
      "epoch": 1.5667303203904095,
      "grad_norm": 0.4189573012296128,
      "learning_rate": 4.7950638986808696e-05,
      "loss": 1.8321,
      "num_input_tokens_seen": 11618961152,
      "step": 14768
    },
    {
      "epoch": 1.566836409929981,
      "grad_norm": 0.5743225116503792,
      "learning_rate": 4.795036340806143e-05,
      "loss": 1.8261,
      "num_input_tokens_seen": 11619747824,
      "step": 14769
    },
    {
      "epoch": 1.5669424994695524,
      "grad_norm": 0.39699644549703317,
      "learning_rate": 4.795008781157879e-05,
      "loss": 1.8242,
      "num_input_tokens_seen": 11620534640,
      "step": 14770
    },
    {
      "epoch": 1.5670485890091237,
      "grad_norm": 0.503460733612352,
      "learning_rate": 4.7949812197361e-05,
      "loss": 1.7746,
      "num_input_tokens_seen": 11621321392,
      "step": 14771
    },
    {
      "epoch": 1.567154678548695,
      "grad_norm": 0.4636379006934701,
      "learning_rate": 4.794953656540827e-05,
      "loss": 1.7379,
      "num_input_tokens_seen": 11622108144,
      "step": 14772
    },
    {
      "epoch": 1.5672607680882664,
      "grad_norm": 0.43263028316768337,
      "learning_rate": 4.79492609157208e-05,
      "loss": 1.7376,
      "num_input_tokens_seen": 11622894848,
      "step": 14773
    },
    {
      "epoch": 1.567366857627838,
      "grad_norm": 0.4777108203167405,
      "learning_rate": 4.794898524829883e-05,
      "loss": 1.798,
      "num_input_tokens_seen": 11623681520,
      "step": 14774
    },
    {
      "epoch": 1.5674729471674094,
      "grad_norm": 0.3855536900797039,
      "learning_rate": 4.7948709563142545e-05,
      "loss": 1.6915,
      "num_input_tokens_seen": 11624468320,
      "step": 14775
    },
    {
      "epoch": 1.5675790367069808,
      "grad_norm": 0.4605677379313073,
      "learning_rate": 4.7948433860252184e-05,
      "loss": 1.8117,
      "num_input_tokens_seen": 11625255072,
      "step": 14776
    },
    {
      "epoch": 1.567685126246552,
      "grad_norm": 0.4603197497415129,
      "learning_rate": 4.794815813962794e-05,
      "loss": 1.7915,
      "num_input_tokens_seen": 11626041856,
      "step": 14777
    },
    {
      "epoch": 1.5677912157861233,
      "grad_norm": 0.4886796448895348,
      "learning_rate": 4.794788240127003e-05,
      "loss": 1.7736,
      "num_input_tokens_seen": 11626828608,
      "step": 14778
    },
    {
      "epoch": 1.5678973053256948,
      "grad_norm": 0.4869477693182402,
      "learning_rate": 4.794760664517867e-05,
      "loss": 1.7748,
      "num_input_tokens_seen": 11627615312,
      "step": 14779
    },
    {
      "epoch": 1.5680033948652663,
      "grad_norm": 0.37166808984614563,
      "learning_rate": 4.794733087135408e-05,
      "loss": 1.5399,
      "num_input_tokens_seen": 11628402176,
      "step": 14780
    },
    {
      "epoch": 1.5681094844048378,
      "grad_norm": 0.4083100854279386,
      "learning_rate": 4.794705507979646e-05,
      "loss": 1.6557,
      "num_input_tokens_seen": 11629188944,
      "step": 14781
    },
    {
      "epoch": 1.5682155739444092,
      "grad_norm": 0.5833891752369774,
      "learning_rate": 4.7946779270506025e-05,
      "loss": 1.7488,
      "num_input_tokens_seen": 11629975760,
      "step": 14782
    },
    {
      "epoch": 1.5683216634839805,
      "grad_norm": 0.30560988465878464,
      "learning_rate": 4.7946503443483006e-05,
      "loss": 1.7155,
      "num_input_tokens_seen": 11630762528,
      "step": 14783
    },
    {
      "epoch": 1.5684277530235518,
      "grad_norm": 0.39029697974388405,
      "learning_rate": 4.794622759872759e-05,
      "loss": 1.7576,
      "num_input_tokens_seen": 11631549296,
      "step": 14784
    },
    {
      "epoch": 1.5685338425631232,
      "grad_norm": 0.40980258119310636,
      "learning_rate": 4.7945951736240005e-05,
      "loss": 1.6197,
      "num_input_tokens_seen": 11632336144,
      "step": 14785
    },
    {
      "epoch": 1.5686399321026947,
      "grad_norm": 0.5171399149884265,
      "learning_rate": 4.7945675856020464e-05,
      "loss": 1.7878,
      "num_input_tokens_seen": 11633122864,
      "step": 14786
    },
    {
      "epoch": 1.5687460216422662,
      "grad_norm": 0.3884061537221834,
      "learning_rate": 4.7945399958069176e-05,
      "loss": 1.7118,
      "num_input_tokens_seen": 11633909712,
      "step": 14787
    },
    {
      "epoch": 1.5688521111818374,
      "grad_norm": 0.4474747879323879,
      "learning_rate": 4.794512404238636e-05,
      "loss": 1.7697,
      "num_input_tokens_seen": 11634696528,
      "step": 14788
    },
    {
      "epoch": 1.568958200721409,
      "grad_norm": 0.4487631748951484,
      "learning_rate": 4.794484810897222e-05,
      "loss": 1.7804,
      "num_input_tokens_seen": 11635483328,
      "step": 14789
    },
    {
      "epoch": 1.5690642902609802,
      "grad_norm": 0.39319300951981306,
      "learning_rate": 4.794457215782697e-05,
      "loss": 1.7818,
      "num_input_tokens_seen": 11636270096,
      "step": 14790
    },
    {
      "epoch": 1.5691703798005516,
      "grad_norm": 0.45806603105942223,
      "learning_rate": 4.794429618895084e-05,
      "loss": 1.6936,
      "num_input_tokens_seen": 11637056896,
      "step": 14791
    },
    {
      "epoch": 1.569276469340123,
      "grad_norm": 0.3622335472062585,
      "learning_rate": 4.794402020234403e-05,
      "loss": 1.6513,
      "num_input_tokens_seen": 11637843776,
      "step": 14792
    },
    {
      "epoch": 1.5693825588796946,
      "grad_norm": 0.4497177190929807,
      "learning_rate": 4.7943744198006745e-05,
      "loss": 1.8568,
      "num_input_tokens_seen": 11638630592,
      "step": 14793
    },
    {
      "epoch": 1.5694886484192658,
      "grad_norm": 0.451305500731339,
      "learning_rate": 4.794346817593922e-05,
      "loss": 1.8769,
      "num_input_tokens_seen": 11639417360,
      "step": 14794
    },
    {
      "epoch": 1.5695947379588373,
      "grad_norm": 0.3755778838843876,
      "learning_rate": 4.7943192136141644e-05,
      "loss": 1.6904,
      "num_input_tokens_seen": 11640204192,
      "step": 14795
    },
    {
      "epoch": 1.5697008274984086,
      "grad_norm": 0.39175296360967843,
      "learning_rate": 4.7942916078614255e-05,
      "loss": 1.8738,
      "num_input_tokens_seen": 11640990976,
      "step": 14796
    },
    {
      "epoch": 1.56980691703798,
      "grad_norm": 0.3891147375826479,
      "learning_rate": 4.794264000335724e-05,
      "loss": 1.6916,
      "num_input_tokens_seen": 11641777696,
      "step": 14797
    },
    {
      "epoch": 1.5699130065775515,
      "grad_norm": 0.38990232086507737,
      "learning_rate": 4.7942363910370834e-05,
      "loss": 1.7664,
      "num_input_tokens_seen": 11642564400,
      "step": 14798
    },
    {
      "epoch": 1.570019096117123,
      "grad_norm": 0.5372732960984966,
      "learning_rate": 4.7942087799655244e-05,
      "loss": 1.922,
      "num_input_tokens_seen": 11643351104,
      "step": 14799
    },
    {
      "epoch": 1.5701251856566942,
      "grad_norm": 0.3680236510138192,
      "learning_rate": 4.794181167121067e-05,
      "loss": 1.7314,
      "num_input_tokens_seen": 11644137792,
      "step": 14800
    },
    {
      "epoch": 1.5702312751962655,
      "grad_norm": 0.45710388837581156,
      "learning_rate": 4.7941535525037354e-05,
      "loss": 1.6474,
      "num_input_tokens_seen": 11644924544,
      "step": 14801
    },
    {
      "epoch": 1.570337364735837,
      "grad_norm": 0.3573088615267693,
      "learning_rate": 4.794125936113548e-05,
      "loss": 1.6706,
      "num_input_tokens_seen": 11645711264,
      "step": 14802
    },
    {
      "epoch": 1.5704434542754084,
      "grad_norm": 0.504909488775114,
      "learning_rate": 4.7940983179505276e-05,
      "loss": 1.656,
      "num_input_tokens_seen": 11646498016,
      "step": 14803
    },
    {
      "epoch": 1.57054954381498,
      "grad_norm": 0.3590164046706339,
      "learning_rate": 4.7940706980146956e-05,
      "loss": 1.6045,
      "num_input_tokens_seen": 11647284800,
      "step": 14804
    },
    {
      "epoch": 1.5706556333545514,
      "grad_norm": 0.5068129040324673,
      "learning_rate": 4.794043076306073e-05,
      "loss": 1.6747,
      "num_input_tokens_seen": 11648071664,
      "step": 14805
    },
    {
      "epoch": 1.5707617228941226,
      "grad_norm": 0.3840757635646051,
      "learning_rate": 4.794015452824682e-05,
      "loss": 1.7672,
      "num_input_tokens_seen": 11648858496,
      "step": 14806
    },
    {
      "epoch": 1.5708678124336939,
      "grad_norm": 0.3569387179998587,
      "learning_rate": 4.793987827570542e-05,
      "loss": 1.6627,
      "num_input_tokens_seen": 11649645312,
      "step": 14807
    },
    {
      "epoch": 1.5709739019732654,
      "grad_norm": 0.4723208673587933,
      "learning_rate": 4.7939602005436755e-05,
      "loss": 1.877,
      "num_input_tokens_seen": 11650432096,
      "step": 14808
    },
    {
      "epoch": 1.5710799915128368,
      "grad_norm": 0.3167487165134223,
      "learning_rate": 4.793932571744104e-05,
      "loss": 1.6041,
      "num_input_tokens_seen": 11651218976,
      "step": 14809
    },
    {
      "epoch": 1.5711860810524083,
      "grad_norm": 0.34980648318756075,
      "learning_rate": 4.7939049411718494e-05,
      "loss": 1.6544,
      "num_input_tokens_seen": 11652005760,
      "step": 14810
    },
    {
      "epoch": 1.5712921705919798,
      "grad_norm": 0.3833513609569379,
      "learning_rate": 4.793877308826932e-05,
      "loss": 1.7953,
      "num_input_tokens_seen": 11652792464,
      "step": 14811
    },
    {
      "epoch": 1.571398260131551,
      "grad_norm": 0.3730502106103674,
      "learning_rate": 4.793849674709373e-05,
      "loss": 1.7368,
      "num_input_tokens_seen": 11653579232,
      "step": 14812
    },
    {
      "epoch": 1.5715043496711223,
      "grad_norm": 0.4349771543997941,
      "learning_rate": 4.793822038819195e-05,
      "loss": 1.66,
      "num_input_tokens_seen": 11654366016,
      "step": 14813
    },
    {
      "epoch": 1.5716104392106938,
      "grad_norm": 0.3438413226471144,
      "learning_rate": 4.793794401156418e-05,
      "loss": 1.7071,
      "num_input_tokens_seen": 11655152816,
      "step": 14814
    },
    {
      "epoch": 1.5717165287502652,
      "grad_norm": 0.3651448300706245,
      "learning_rate": 4.7937667617210645e-05,
      "loss": 1.7782,
      "num_input_tokens_seen": 11655939568,
      "step": 14815
    },
    {
      "epoch": 1.5718226182898367,
      "grad_norm": 0.36199941925897583,
      "learning_rate": 4.7937391205131554e-05,
      "loss": 1.6695,
      "num_input_tokens_seen": 11656726432,
      "step": 14816
    },
    {
      "epoch": 1.571928707829408,
      "grad_norm": 0.412045376532672,
      "learning_rate": 4.793711477532712e-05,
      "loss": 1.7584,
      "num_input_tokens_seen": 11657513152,
      "step": 14817
    },
    {
      "epoch": 1.5720347973689794,
      "grad_norm": 0.4519829825471954,
      "learning_rate": 4.793683832779755e-05,
      "loss": 1.7928,
      "num_input_tokens_seen": 11658300048,
      "step": 14818
    },
    {
      "epoch": 1.5721408869085507,
      "grad_norm": 0.4235387654899457,
      "learning_rate": 4.7936561862543074e-05,
      "loss": 1.7493,
      "num_input_tokens_seen": 11659086784,
      "step": 14819
    },
    {
      "epoch": 1.5722469764481222,
      "grad_norm": 0.36926674115223346,
      "learning_rate": 4.7936285379563896e-05,
      "loss": 1.6865,
      "num_input_tokens_seen": 11659873520,
      "step": 14820
    },
    {
      "epoch": 1.5723530659876936,
      "grad_norm": 0.5464106085709708,
      "learning_rate": 4.7936008878860215e-05,
      "loss": 1.8829,
      "num_input_tokens_seen": 11660660272,
      "step": 14821
    },
    {
      "epoch": 1.5724591555272651,
      "grad_norm": 0.36515104423277656,
      "learning_rate": 4.7935732360432275e-05,
      "loss": 1.6154,
      "num_input_tokens_seen": 11661447120,
      "step": 14822
    },
    {
      "epoch": 1.5725652450668364,
      "grad_norm": 0.4663954719185319,
      "learning_rate": 4.7935455824280266e-05,
      "loss": 1.6965,
      "num_input_tokens_seen": 11662233856,
      "step": 14823
    },
    {
      "epoch": 1.5726713346064078,
      "grad_norm": 0.3861370234419191,
      "learning_rate": 4.793517927040442e-05,
      "loss": 1.8134,
      "num_input_tokens_seen": 11663020624,
      "step": 14824
    },
    {
      "epoch": 1.572777424145979,
      "grad_norm": 0.466237508657484,
      "learning_rate": 4.7934902698804925e-05,
      "loss": 1.8277,
      "num_input_tokens_seen": 11663807360,
      "step": 14825
    },
    {
      "epoch": 1.5728835136855506,
      "grad_norm": 0.3580814034631348,
      "learning_rate": 4.7934626109482015e-05,
      "loss": 1.7811,
      "num_input_tokens_seen": 11664594160,
      "step": 14826
    },
    {
      "epoch": 1.572989603225122,
      "grad_norm": 0.3576212138719278,
      "learning_rate": 4.79343495024359e-05,
      "loss": 1.577,
      "num_input_tokens_seen": 11665381056,
      "step": 14827
    },
    {
      "epoch": 1.5730956927646935,
      "grad_norm": 0.41760528372549793,
      "learning_rate": 4.7934072877666804e-05,
      "loss": 1.9402,
      "num_input_tokens_seen": 11666167824,
      "step": 14828
    },
    {
      "epoch": 1.5732017823042648,
      "grad_norm": 0.4085707776781383,
      "learning_rate": 4.793379623517492e-05,
      "loss": 1.7418,
      "num_input_tokens_seen": 11666954624,
      "step": 14829
    },
    {
      "epoch": 1.5733078718438362,
      "grad_norm": 0.4087079403025176,
      "learning_rate": 4.7933519574960465e-05,
      "loss": 1.6171,
      "num_input_tokens_seen": 11667741296,
      "step": 14830
    },
    {
      "epoch": 1.5734139613834075,
      "grad_norm": 0.3702229358526797,
      "learning_rate": 4.7933242897023665e-05,
      "loss": 1.8221,
      "num_input_tokens_seen": 11668527984,
      "step": 14831
    },
    {
      "epoch": 1.573520050922979,
      "grad_norm": 0.31445964715059366,
      "learning_rate": 4.7932966201364726e-05,
      "loss": 1.7459,
      "num_input_tokens_seen": 11669314720,
      "step": 14832
    },
    {
      "epoch": 1.5736261404625504,
      "grad_norm": 0.3668916301701991,
      "learning_rate": 4.7932689487983866e-05,
      "loss": 1.7149,
      "num_input_tokens_seen": 11670101552,
      "step": 14833
    },
    {
      "epoch": 1.573732230002122,
      "grad_norm": 0.3904251726203517,
      "learning_rate": 4.7932412756881294e-05,
      "loss": 1.7019,
      "num_input_tokens_seen": 11670888368,
      "step": 14834
    },
    {
      "epoch": 1.5738383195416932,
      "grad_norm": 0.3357828725700702,
      "learning_rate": 4.793213600805723e-05,
      "loss": 1.8385,
      "num_input_tokens_seen": 11671675104,
      "step": 14835
    },
    {
      "epoch": 1.5739444090812644,
      "grad_norm": 0.421461881438795,
      "learning_rate": 4.7931859241511884e-05,
      "loss": 1.8109,
      "num_input_tokens_seen": 11672461856,
      "step": 14836
    },
    {
      "epoch": 1.574050498620836,
      "grad_norm": 0.3786669867021651,
      "learning_rate": 4.7931582457245466e-05,
      "loss": 1.7689,
      "num_input_tokens_seen": 11673248592,
      "step": 14837
    },
    {
      "epoch": 1.5741565881604074,
      "grad_norm": 0.3503404894844712,
      "learning_rate": 4.7931305655258196e-05,
      "loss": 1.6059,
      "num_input_tokens_seen": 11674035360,
      "step": 14838
    },
    {
      "epoch": 1.5742626776999789,
      "grad_norm": 0.4528302477896455,
      "learning_rate": 4.7931028835550286e-05,
      "loss": 1.7497,
      "num_input_tokens_seen": 11674822160,
      "step": 14839
    },
    {
      "epoch": 1.5743687672395503,
      "grad_norm": 0.5277433406341022,
      "learning_rate": 4.7930751998121946e-05,
      "loss": 1.8688,
      "num_input_tokens_seen": 11675608832,
      "step": 14840
    },
    {
      "epoch": 1.5744748567791216,
      "grad_norm": 0.36172217404529267,
      "learning_rate": 4.7930475142973405e-05,
      "loss": 1.7763,
      "num_input_tokens_seen": 11676395584,
      "step": 14841
    },
    {
      "epoch": 1.5745809463186928,
      "grad_norm": 0.5796296805641353,
      "learning_rate": 4.793019827010485e-05,
      "loss": 1.8068,
      "num_input_tokens_seen": 11677182368,
      "step": 14842
    },
    {
      "epoch": 1.5746870358582643,
      "grad_norm": 0.4603684707129558,
      "learning_rate": 4.792992137951652e-05,
      "loss": 1.8232,
      "num_input_tokens_seen": 11677969168,
      "step": 14843
    },
    {
      "epoch": 1.5747931253978358,
      "grad_norm": 0.3831422916687557,
      "learning_rate": 4.7929644471208626e-05,
      "loss": 1.7984,
      "num_input_tokens_seen": 11678755872,
      "step": 14844
    },
    {
      "epoch": 1.5748992149374073,
      "grad_norm": 0.35983185639267945,
      "learning_rate": 4.7929367545181364e-05,
      "loss": 1.7319,
      "num_input_tokens_seen": 11679542608,
      "step": 14845
    },
    {
      "epoch": 1.5750053044769787,
      "grad_norm": 0.3686246226799329,
      "learning_rate": 4.792909060143496e-05,
      "loss": 1.6331,
      "num_input_tokens_seen": 11680329408,
      "step": 14846
    },
    {
      "epoch": 1.57511139401655,
      "grad_norm": 0.3890419463525043,
      "learning_rate": 4.7928813639969634e-05,
      "loss": 1.8601,
      "num_input_tokens_seen": 11681116112,
      "step": 14847
    },
    {
      "epoch": 1.5752174835561212,
      "grad_norm": 0.40862473879595645,
      "learning_rate": 4.7928536660785587e-05,
      "loss": 1.6511,
      "num_input_tokens_seen": 11681902896,
      "step": 14848
    },
    {
      "epoch": 1.5753235730956927,
      "grad_norm": 0.377377313583328,
      "learning_rate": 4.7928259663883046e-05,
      "loss": 1.6206,
      "num_input_tokens_seen": 11682689776,
      "step": 14849
    },
    {
      "epoch": 1.5754296626352642,
      "grad_norm": 0.36553748512783163,
      "learning_rate": 4.7927982649262216e-05,
      "loss": 1.6885,
      "num_input_tokens_seen": 11683476496,
      "step": 14850
    },
    {
      "epoch": 1.5755357521748357,
      "grad_norm": 0.35972390415466166,
      "learning_rate": 4.7927705616923314e-05,
      "loss": 1.7195,
      "num_input_tokens_seen": 11684263232,
      "step": 14851
    },
    {
      "epoch": 1.575641841714407,
      "grad_norm": 0.466737783677004,
      "learning_rate": 4.792742856686655e-05,
      "loss": 1.7689,
      "num_input_tokens_seen": 11685050016,
      "step": 14852
    },
    {
      "epoch": 1.5757479312539784,
      "grad_norm": 0.35543587818132244,
      "learning_rate": 4.792715149909215e-05,
      "loss": 1.6397,
      "num_input_tokens_seen": 11685836816,
      "step": 14853
    },
    {
      "epoch": 1.5758540207935496,
      "grad_norm": 0.35898666905403986,
      "learning_rate": 4.792687441360031e-05,
      "loss": 1.714,
      "num_input_tokens_seen": 11686623632,
      "step": 14854
    },
    {
      "epoch": 1.5759601103331211,
      "grad_norm": 0.3740692795768438,
      "learning_rate": 4.792659731039126e-05,
      "loss": 1.6587,
      "num_input_tokens_seen": 11687410496,
      "step": 14855
    },
    {
      "epoch": 1.5760661998726926,
      "grad_norm": 0.49744892854140565,
      "learning_rate": 4.7926320189465214e-05,
      "loss": 1.7167,
      "num_input_tokens_seen": 11688197280,
      "step": 14856
    },
    {
      "epoch": 1.576172289412264,
      "grad_norm": 0.33955860357626644,
      "learning_rate": 4.792604305082237e-05,
      "loss": 1.6576,
      "num_input_tokens_seen": 11688984112,
      "step": 14857
    },
    {
      "epoch": 1.5762783789518353,
      "grad_norm": 0.39187745099999743,
      "learning_rate": 4.792576589446296e-05,
      "loss": 1.7355,
      "num_input_tokens_seen": 11689770832,
      "step": 14858
    },
    {
      "epoch": 1.5763844684914068,
      "grad_norm": 0.36884593320981074,
      "learning_rate": 4.792548872038718e-05,
      "loss": 1.7189,
      "num_input_tokens_seen": 11690557696,
      "step": 14859
    },
    {
      "epoch": 1.576490558030978,
      "grad_norm": 0.3697718235175156,
      "learning_rate": 4.7925211528595264e-05,
      "loss": 1.697,
      "num_input_tokens_seen": 11691344576,
      "step": 14860
    },
    {
      "epoch": 1.5765966475705495,
      "grad_norm": 0.35217703470330647,
      "learning_rate": 4.7924934319087413e-05,
      "loss": 1.756,
      "num_input_tokens_seen": 11692131488,
      "step": 14861
    },
    {
      "epoch": 1.576702737110121,
      "grad_norm": 0.373416242685249,
      "learning_rate": 4.7924657091863855e-05,
      "loss": 1.7914,
      "num_input_tokens_seen": 11692918256,
      "step": 14862
    },
    {
      "epoch": 1.5768088266496925,
      "grad_norm": 0.39166949253613514,
      "learning_rate": 4.7924379846924785e-05,
      "loss": 1.7735,
      "num_input_tokens_seen": 11693705024,
      "step": 14863
    },
    {
      "epoch": 1.5769149161892637,
      "grad_norm": 0.3901636664725773,
      "learning_rate": 4.792410258427043e-05,
      "loss": 1.7608,
      "num_input_tokens_seen": 11694491808,
      "step": 14864
    },
    {
      "epoch": 1.5770210057288352,
      "grad_norm": 0.3835537101697274,
      "learning_rate": 4.792382530390101e-05,
      "loss": 1.8461,
      "num_input_tokens_seen": 11695278544,
      "step": 14865
    },
    {
      "epoch": 1.5771270952684064,
      "grad_norm": 0.40955235264371065,
      "learning_rate": 4.792354800581671e-05,
      "loss": 1.9153,
      "num_input_tokens_seen": 11696065280,
      "step": 14866
    },
    {
      "epoch": 1.577233184807978,
      "grad_norm": 0.32518904663157605,
      "learning_rate": 4.792327069001777e-05,
      "loss": 1.843,
      "num_input_tokens_seen": 11696852032,
      "step": 14867
    },
    {
      "epoch": 1.5773392743475494,
      "grad_norm": 0.37724740138475404,
      "learning_rate": 4.792299335650441e-05,
      "loss": 1.8007,
      "num_input_tokens_seen": 11697638800,
      "step": 14868
    },
    {
      "epoch": 1.5774453638871209,
      "grad_norm": 0.37751897432119264,
      "learning_rate": 4.792271600527684e-05,
      "loss": 1.6824,
      "num_input_tokens_seen": 11698425472,
      "step": 14869
    },
    {
      "epoch": 1.5775514534266921,
      "grad_norm": 0.3746805950868351,
      "learning_rate": 4.792243863633525e-05,
      "loss": 1.8659,
      "num_input_tokens_seen": 11699212256,
      "step": 14870
    },
    {
      "epoch": 1.5776575429662634,
      "grad_norm": 0.3452488183940125,
      "learning_rate": 4.7922161249679875e-05,
      "loss": 1.7451,
      "num_input_tokens_seen": 11699999088,
      "step": 14871
    },
    {
      "epoch": 1.5777636325058348,
      "grad_norm": 0.42602550286367347,
      "learning_rate": 4.7921883845310936e-05,
      "loss": 1.8252,
      "num_input_tokens_seen": 11700785744,
      "step": 14872
    },
    {
      "epoch": 1.5778697220454063,
      "grad_norm": 0.3554499823671697,
      "learning_rate": 4.7921606423228627e-05,
      "loss": 1.6722,
      "num_input_tokens_seen": 11701572496,
      "step": 14873
    },
    {
      "epoch": 1.5779758115849778,
      "grad_norm": 0.41247818661143265,
      "learning_rate": 4.792132898343318e-05,
      "loss": 1.7286,
      "num_input_tokens_seen": 11702359264,
      "step": 14874
    },
    {
      "epoch": 1.5780819011245493,
      "grad_norm": 0.3320777791679454,
      "learning_rate": 4.79210515259248e-05,
      "loss": 1.8312,
      "num_input_tokens_seen": 11703146000,
      "step": 14875
    },
    {
      "epoch": 1.5781879906641205,
      "grad_norm": 0.4344155620366345,
      "learning_rate": 4.7920774050703696e-05,
      "loss": 1.7843,
      "num_input_tokens_seen": 11703932752,
      "step": 14876
    },
    {
      "epoch": 1.5782940802036918,
      "grad_norm": 0.3446922308776448,
      "learning_rate": 4.7920496557770104e-05,
      "loss": 1.6483,
      "num_input_tokens_seen": 11704719488,
      "step": 14877
    },
    {
      "epoch": 1.5784001697432632,
      "grad_norm": 0.5275459064621238,
      "learning_rate": 4.792021904712422e-05,
      "loss": 1.7767,
      "num_input_tokens_seen": 11705506240,
      "step": 14878
    },
    {
      "epoch": 1.5785062592828347,
      "grad_norm": 0.3747918680275666,
      "learning_rate": 4.791994151876626e-05,
      "loss": 1.694,
      "num_input_tokens_seen": 11706292960,
      "step": 14879
    },
    {
      "epoch": 1.5786123488224062,
      "grad_norm": 0.34450037103961123,
      "learning_rate": 4.791966397269644e-05,
      "loss": 1.6052,
      "num_input_tokens_seen": 11707079744,
      "step": 14880
    },
    {
      "epoch": 1.5787184383619777,
      "grad_norm": 0.37559279250184857,
      "learning_rate": 4.7919386408914976e-05,
      "loss": 1.8583,
      "num_input_tokens_seen": 11707866576,
      "step": 14881
    },
    {
      "epoch": 1.578824527901549,
      "grad_norm": 0.3593409364799203,
      "learning_rate": 4.791910882742209e-05,
      "loss": 1.7022,
      "num_input_tokens_seen": 11708653456,
      "step": 14882
    },
    {
      "epoch": 1.5789306174411202,
      "grad_norm": 0.34055752306606735,
      "learning_rate": 4.791883122821799e-05,
      "loss": 1.7406,
      "num_input_tokens_seen": 11709440272,
      "step": 14883
    },
    {
      "epoch": 1.5790367069806917,
      "grad_norm": 0.3943134753226841,
      "learning_rate": 4.791855361130288e-05,
      "loss": 1.7554,
      "num_input_tokens_seen": 11710227040,
      "step": 14884
    },
    {
      "epoch": 1.5791427965202631,
      "grad_norm": 0.35684136293708946,
      "learning_rate": 4.7918275976676995e-05,
      "loss": 1.6577,
      "num_input_tokens_seen": 11711013840,
      "step": 14885
    },
    {
      "epoch": 1.5792488860598346,
      "grad_norm": 0.35061260825869156,
      "learning_rate": 4.791799832434053e-05,
      "loss": 1.7747,
      "num_input_tokens_seen": 11711800592,
      "step": 14886
    },
    {
      "epoch": 1.5793549755994059,
      "grad_norm": 0.4394065708898336,
      "learning_rate": 4.7917720654293716e-05,
      "loss": 1.8108,
      "num_input_tokens_seen": 11712587344,
      "step": 14887
    },
    {
      "epoch": 1.5794610651389773,
      "grad_norm": 0.3877983079560739,
      "learning_rate": 4.791744296653675e-05,
      "loss": 1.7028,
      "num_input_tokens_seen": 11713374128,
      "step": 14888
    },
    {
      "epoch": 1.5795671546785486,
      "grad_norm": 0.3782858291498112,
      "learning_rate": 4.7917165261069866e-05,
      "loss": 1.6836,
      "num_input_tokens_seen": 11714160896,
      "step": 14889
    },
    {
      "epoch": 1.57967324421812,
      "grad_norm": 0.34089782063791746,
      "learning_rate": 4.7916887537893263e-05,
      "loss": 1.6045,
      "num_input_tokens_seen": 11714947728,
      "step": 14890
    },
    {
      "epoch": 1.5797793337576915,
      "grad_norm": 0.3816316736398195,
      "learning_rate": 4.791660979700717e-05,
      "loss": 1.6721,
      "num_input_tokens_seen": 11715734512,
      "step": 14891
    },
    {
      "epoch": 1.579885423297263,
      "grad_norm": 0.5275795172678154,
      "learning_rate": 4.791633203841178e-05,
      "loss": 1.818,
      "num_input_tokens_seen": 11716521280,
      "step": 14892
    },
    {
      "epoch": 1.5799915128368343,
      "grad_norm": 0.6461105979586453,
      "learning_rate": 4.791605426210733e-05,
      "loss": 1.8242,
      "num_input_tokens_seen": 11717308048,
      "step": 14893
    },
    {
      "epoch": 1.5800976023764057,
      "grad_norm": 0.41818239706601557,
      "learning_rate": 4.791577646809402e-05,
      "loss": 1.8221,
      "num_input_tokens_seen": 11718094656,
      "step": 14894
    },
    {
      "epoch": 1.580203691915977,
      "grad_norm": 0.5153596935506288,
      "learning_rate": 4.791549865637208e-05,
      "loss": 1.7999,
      "num_input_tokens_seen": 11718881424,
      "step": 14895
    },
    {
      "epoch": 1.5803097814555485,
      "grad_norm": 0.4208408203522592,
      "learning_rate": 4.791522082694171e-05,
      "loss": 1.6857,
      "num_input_tokens_seen": 11719668208,
      "step": 14896
    },
    {
      "epoch": 1.58041587099512,
      "grad_norm": 0.525477796093069,
      "learning_rate": 4.791494297980313e-05,
      "loss": 1.6995,
      "num_input_tokens_seen": 11720455056,
      "step": 14897
    },
    {
      "epoch": 1.5805219605346914,
      "grad_norm": 0.3701744819082611,
      "learning_rate": 4.7914665114956555e-05,
      "loss": 1.6841,
      "num_input_tokens_seen": 11721241744,
      "step": 14898
    },
    {
      "epoch": 1.5806280500742627,
      "grad_norm": 0.5498378854871064,
      "learning_rate": 4.79143872324022e-05,
      "loss": 1.94,
      "num_input_tokens_seen": 11722028480,
      "step": 14899
    },
    {
      "epoch": 1.580734139613834,
      "grad_norm": 0.4169889525948278,
      "learning_rate": 4.791410933214028e-05,
      "loss": 1.6782,
      "num_input_tokens_seen": 11722815248,
      "step": 14900
    },
    {
      "epoch": 1.5808402291534054,
      "grad_norm": 0.3693621939335651,
      "learning_rate": 4.7913831414170997e-05,
      "loss": 1.7175,
      "num_input_tokens_seen": 11723602016,
      "step": 14901
    },
    {
      "epoch": 1.5809463186929769,
      "grad_norm": 0.40149880152013134,
      "learning_rate": 4.791355347849459e-05,
      "loss": 1.7534,
      "num_input_tokens_seen": 11724388880,
      "step": 14902
    },
    {
      "epoch": 1.5810524082325483,
      "grad_norm": 0.38393908256821735,
      "learning_rate": 4.791327552511126e-05,
      "loss": 1.7202,
      "num_input_tokens_seen": 11725175648,
      "step": 14903
    },
    {
      "epoch": 1.5811584977721198,
      "grad_norm": 0.39689425776883197,
      "learning_rate": 4.791299755402122e-05,
      "loss": 1.6569,
      "num_input_tokens_seen": 11725962480,
      "step": 14904
    },
    {
      "epoch": 1.581264587311691,
      "grad_norm": 0.3693159943648166,
      "learning_rate": 4.7912719565224684e-05,
      "loss": 1.8565,
      "num_input_tokens_seen": 11726749200,
      "step": 14905
    },
    {
      "epoch": 1.5813706768512623,
      "grad_norm": 0.4228185763844312,
      "learning_rate": 4.7912441558721876e-05,
      "loss": 1.8188,
      "num_input_tokens_seen": 11727535984,
      "step": 14906
    },
    {
      "epoch": 1.5814767663908338,
      "grad_norm": 0.4328607746662286,
      "learning_rate": 4.7912163534512996e-05,
      "loss": 1.8279,
      "num_input_tokens_seen": 11728322752,
      "step": 14907
    },
    {
      "epoch": 1.5815828559304053,
      "grad_norm": 0.4859319030980551,
      "learning_rate": 4.791188549259828e-05,
      "loss": 1.7948,
      "num_input_tokens_seen": 11729109456,
      "step": 14908
    },
    {
      "epoch": 1.5816889454699767,
      "grad_norm": 0.4338813279857375,
      "learning_rate": 4.791160743297793e-05,
      "loss": 1.7579,
      "num_input_tokens_seen": 11729896224,
      "step": 14909
    },
    {
      "epoch": 1.5817950350095482,
      "grad_norm": 0.5062942630066043,
      "learning_rate": 4.7911329355652156e-05,
      "loss": 1.9084,
      "num_input_tokens_seen": 11730682928,
      "step": 14910
    },
    {
      "epoch": 1.5819011245491195,
      "grad_norm": 0.4978282569700817,
      "learning_rate": 4.7911051260621184e-05,
      "loss": 1.77,
      "num_input_tokens_seen": 11731469696,
      "step": 14911
    },
    {
      "epoch": 1.5820072140886907,
      "grad_norm": 0.439197737553866,
      "learning_rate": 4.7910773147885225e-05,
      "loss": 1.7926,
      "num_input_tokens_seen": 11732256480,
      "step": 14912
    },
    {
      "epoch": 1.5821133036282622,
      "grad_norm": 0.4546826542043484,
      "learning_rate": 4.791049501744449e-05,
      "loss": 1.7795,
      "num_input_tokens_seen": 11733043232,
      "step": 14913
    },
    {
      "epoch": 1.5822193931678337,
      "grad_norm": 0.36519228323944253,
      "learning_rate": 4.79102168692992e-05,
      "loss": 1.7924,
      "num_input_tokens_seen": 11733829920,
      "step": 14914
    },
    {
      "epoch": 1.5823254827074051,
      "grad_norm": 0.47792063084387815,
      "learning_rate": 4.790993870344955e-05,
      "loss": 1.9079,
      "num_input_tokens_seen": 11734616576,
      "step": 14915
    },
    {
      "epoch": 1.5824315722469766,
      "grad_norm": 0.49648740972645095,
      "learning_rate": 4.7909660519895796e-05,
      "loss": 1.8943,
      "num_input_tokens_seen": 11735403296,
      "step": 14916
    },
    {
      "epoch": 1.5825376617865479,
      "grad_norm": 0.3656953561264167,
      "learning_rate": 4.790938231863811e-05,
      "loss": 1.6763,
      "num_input_tokens_seen": 11736189984,
      "step": 14917
    },
    {
      "epoch": 1.5826437513261191,
      "grad_norm": 0.3321852634652945,
      "learning_rate": 4.790910409967674e-05,
      "loss": 1.541,
      "num_input_tokens_seen": 11736976816,
      "step": 14918
    },
    {
      "epoch": 1.5827498408656906,
      "grad_norm": 0.43144441538881767,
      "learning_rate": 4.790882586301188e-05,
      "loss": 1.9375,
      "num_input_tokens_seen": 11737763536,
      "step": 14919
    },
    {
      "epoch": 1.582855930405262,
      "grad_norm": 0.3274692438802328,
      "learning_rate": 4.790854760864375e-05,
      "loss": 1.6933,
      "num_input_tokens_seen": 11738550320,
      "step": 14920
    },
    {
      "epoch": 1.5829620199448335,
      "grad_norm": 0.3824892946602269,
      "learning_rate": 4.7908269336572565e-05,
      "loss": 1.5857,
      "num_input_tokens_seen": 11739337184,
      "step": 14921
    },
    {
      "epoch": 1.5830681094844048,
      "grad_norm": 0.3575048615177671,
      "learning_rate": 4.790799104679855e-05,
      "loss": 1.6104,
      "num_input_tokens_seen": 11740124032,
      "step": 14922
    },
    {
      "epoch": 1.5831741990239763,
      "grad_norm": 0.4017619064443826,
      "learning_rate": 4.7907712739321895e-05,
      "loss": 1.638,
      "num_input_tokens_seen": 11740910800,
      "step": 14923
    },
    {
      "epoch": 1.5832802885635475,
      "grad_norm": 0.6346312891659621,
      "learning_rate": 4.790743441414285e-05,
      "loss": 1.7392,
      "num_input_tokens_seen": 11741697520,
      "step": 14924
    },
    {
      "epoch": 1.583386378103119,
      "grad_norm": 0.38615910349888416,
      "learning_rate": 4.790715607126161e-05,
      "loss": 1.7499,
      "num_input_tokens_seen": 11742484352,
      "step": 14925
    },
    {
      "epoch": 1.5834924676426905,
      "grad_norm": 0.5725138037909646,
      "learning_rate": 4.790687771067838e-05,
      "loss": 1.7805,
      "num_input_tokens_seen": 11743271168,
      "step": 14926
    },
    {
      "epoch": 1.583598557182262,
      "grad_norm": 0.37071229295200275,
      "learning_rate": 4.790659933239339e-05,
      "loss": 1.6807,
      "num_input_tokens_seen": 11744058016,
      "step": 14927
    },
    {
      "epoch": 1.5837046467218332,
      "grad_norm": 0.5578431324178894,
      "learning_rate": 4.790632093640686e-05,
      "loss": 1.7063,
      "num_input_tokens_seen": 11744844800,
      "step": 14928
    },
    {
      "epoch": 1.5838107362614047,
      "grad_norm": 0.415102717822826,
      "learning_rate": 4.7906042522718994e-05,
      "loss": 1.655,
      "num_input_tokens_seen": 11745631568,
      "step": 14929
    },
    {
      "epoch": 1.583916825800976,
      "grad_norm": 0.3995273495861769,
      "learning_rate": 4.7905764091330006e-05,
      "loss": 1.5542,
      "num_input_tokens_seen": 11746418288,
      "step": 14930
    },
    {
      "epoch": 1.5840229153405474,
      "grad_norm": 0.3773670477422424,
      "learning_rate": 4.7905485642240116e-05,
      "loss": 1.7566,
      "num_input_tokens_seen": 11747205088,
      "step": 14931
    },
    {
      "epoch": 1.5841290048801189,
      "grad_norm": 0.4282925411538206,
      "learning_rate": 4.790520717544954e-05,
      "loss": 1.8587,
      "num_input_tokens_seen": 11747991824,
      "step": 14932
    },
    {
      "epoch": 1.5842350944196903,
      "grad_norm": 0.4868843823603159,
      "learning_rate": 4.790492869095849e-05,
      "loss": 1.8301,
      "num_input_tokens_seen": 11748778608,
      "step": 14933
    },
    {
      "epoch": 1.5843411839592616,
      "grad_norm": 0.47374865879475014,
      "learning_rate": 4.79046501887672e-05,
      "loss": 1.7972,
      "num_input_tokens_seen": 11749565408,
      "step": 14934
    },
    {
      "epoch": 1.5844472734988329,
      "grad_norm": 0.6303064871852204,
      "learning_rate": 4.7904371668875846e-05,
      "loss": 1.7201,
      "num_input_tokens_seen": 11750352224,
      "step": 14935
    },
    {
      "epoch": 1.5845533630384043,
      "grad_norm": 0.37518771528549916,
      "learning_rate": 4.7904093131284674e-05,
      "loss": 1.8212,
      "num_input_tokens_seen": 11751139008,
      "step": 14936
    },
    {
      "epoch": 1.5846594525779758,
      "grad_norm": 0.42397447782170655,
      "learning_rate": 4.79038145759939e-05,
      "loss": 1.6332,
      "num_input_tokens_seen": 11751925808,
      "step": 14937
    },
    {
      "epoch": 1.5847655421175473,
      "grad_norm": 0.5955953287846597,
      "learning_rate": 4.790353600300372e-05,
      "loss": 1.8139,
      "num_input_tokens_seen": 11752712592,
      "step": 14938
    },
    {
      "epoch": 1.5848716316571188,
      "grad_norm": 0.3993093217282894,
      "learning_rate": 4.790325741231436e-05,
      "loss": 1.5863,
      "num_input_tokens_seen": 11753499360,
      "step": 14939
    },
    {
      "epoch": 1.58497772119669,
      "grad_norm": 0.3847295595664907,
      "learning_rate": 4.7902978803926036e-05,
      "loss": 1.7129,
      "num_input_tokens_seen": 11754286080,
      "step": 14940
    },
    {
      "epoch": 1.5850838107362613,
      "grad_norm": 0.5199314952960542,
      "learning_rate": 4.790270017783896e-05,
      "loss": 1.8472,
      "num_input_tokens_seen": 11755072752,
      "step": 14941
    },
    {
      "epoch": 1.5851899002758327,
      "grad_norm": 0.35530640872864966,
      "learning_rate": 4.790242153405335e-05,
      "loss": 1.7091,
      "num_input_tokens_seen": 11755859520,
      "step": 14942
    },
    {
      "epoch": 1.5852959898154042,
      "grad_norm": 0.3728464262645374,
      "learning_rate": 4.7902142872569423e-05,
      "loss": 1.61,
      "num_input_tokens_seen": 11756646320,
      "step": 14943
    },
    {
      "epoch": 1.5854020793549757,
      "grad_norm": 0.38747455971584166,
      "learning_rate": 4.790186419338739e-05,
      "loss": 1.7628,
      "num_input_tokens_seen": 11757433136,
      "step": 14944
    },
    {
      "epoch": 1.5855081688945472,
      "grad_norm": 0.44932232834329305,
      "learning_rate": 4.790158549650747e-05,
      "loss": 1.7658,
      "num_input_tokens_seen": 11758219824,
      "step": 14945
    },
    {
      "epoch": 1.5856142584341184,
      "grad_norm": 0.3828714621650267,
      "learning_rate": 4.790130678192988e-05,
      "loss": 1.7387,
      "num_input_tokens_seen": 11759006576,
      "step": 14946
    },
    {
      "epoch": 1.5857203479736897,
      "grad_norm": 0.4562257254470743,
      "learning_rate": 4.790102804965483e-05,
      "loss": 1.7995,
      "num_input_tokens_seen": 11759793376,
      "step": 14947
    },
    {
      "epoch": 1.5858264375132611,
      "grad_norm": 0.5272407546554834,
      "learning_rate": 4.7900749299682535e-05,
      "loss": 1.696,
      "num_input_tokens_seen": 11760580112,
      "step": 14948
    },
    {
      "epoch": 1.5859325270528326,
      "grad_norm": 0.40920057277831645,
      "learning_rate": 4.7900470532013206e-05,
      "loss": 1.772,
      "num_input_tokens_seen": 11761366864,
      "step": 14949
    },
    {
      "epoch": 1.586038616592404,
      "grad_norm": 0.5187323023792448,
      "learning_rate": 4.7900191746647076e-05,
      "loss": 1.8614,
      "num_input_tokens_seen": 11762153600,
      "step": 14950
    },
    {
      "epoch": 1.5861447061319753,
      "grad_norm": 0.5087923321566162,
      "learning_rate": 4.789991294358435e-05,
      "loss": 1.8075,
      "num_input_tokens_seen": 11762940368,
      "step": 14951
    },
    {
      "epoch": 1.5862507956715468,
      "grad_norm": 0.49194158201041716,
      "learning_rate": 4.7899634122825237e-05,
      "loss": 1.7355,
      "num_input_tokens_seen": 11763727184,
      "step": 14952
    },
    {
      "epoch": 1.586356885211118,
      "grad_norm": 0.537730718463897,
      "learning_rate": 4.789935528436996e-05,
      "loss": 1.8408,
      "num_input_tokens_seen": 11764513952,
      "step": 14953
    },
    {
      "epoch": 1.5864629747506895,
      "grad_norm": 0.37616144919314576,
      "learning_rate": 4.789907642821874e-05,
      "loss": 1.7446,
      "num_input_tokens_seen": 11765300704,
      "step": 14954
    },
    {
      "epoch": 1.586569064290261,
      "grad_norm": 0.47899334453905623,
      "learning_rate": 4.7898797554371776e-05,
      "loss": 1.7302,
      "num_input_tokens_seen": 11766087456,
      "step": 14955
    },
    {
      "epoch": 1.5866751538298325,
      "grad_norm": 0.4896148079817812,
      "learning_rate": 4.7898518662829293e-05,
      "loss": 1.7601,
      "num_input_tokens_seen": 11766874256,
      "step": 14956
    },
    {
      "epoch": 1.5867812433694037,
      "grad_norm": 0.4433526956222543,
      "learning_rate": 4.789823975359151e-05,
      "loss": 1.7028,
      "num_input_tokens_seen": 11767661056,
      "step": 14957
    },
    {
      "epoch": 1.5868873329089752,
      "grad_norm": 0.4019254966467069,
      "learning_rate": 4.7897960826658646e-05,
      "loss": 1.8197,
      "num_input_tokens_seen": 11768447744,
      "step": 14958
    },
    {
      "epoch": 1.5869934224485465,
      "grad_norm": 0.3840945464647754,
      "learning_rate": 4.78976818820309e-05,
      "loss": 1.6678,
      "num_input_tokens_seen": 11769234432,
      "step": 14959
    },
    {
      "epoch": 1.587099511988118,
      "grad_norm": 0.44103360730719554,
      "learning_rate": 4.78974029197085e-05,
      "loss": 1.6423,
      "num_input_tokens_seen": 11770021152,
      "step": 14960
    },
    {
      "epoch": 1.5872056015276894,
      "grad_norm": 0.3645904111579881,
      "learning_rate": 4.7897123939691666e-05,
      "loss": 1.7247,
      "num_input_tokens_seen": 11770808048,
      "step": 14961
    },
    {
      "epoch": 1.5873116910672609,
      "grad_norm": 0.3798440563278179,
      "learning_rate": 4.78968449419806e-05,
      "loss": 1.7046,
      "num_input_tokens_seen": 11771594832,
      "step": 14962
    },
    {
      "epoch": 1.5874177806068321,
      "grad_norm": 0.4122312310939243,
      "learning_rate": 4.789656592657552e-05,
      "loss": 1.7712,
      "num_input_tokens_seen": 11772381664,
      "step": 14963
    },
    {
      "epoch": 1.5875238701464036,
      "grad_norm": 0.37310490948723624,
      "learning_rate": 4.789628689347665e-05,
      "loss": 1.8221,
      "num_input_tokens_seen": 11773168432,
      "step": 14964
    },
    {
      "epoch": 1.5876299596859749,
      "grad_norm": 0.4003213054195632,
      "learning_rate": 4.78960078426842e-05,
      "loss": 1.6999,
      "num_input_tokens_seen": 11773955264,
      "step": 14965
    },
    {
      "epoch": 1.5877360492255463,
      "grad_norm": 0.3408961741663751,
      "learning_rate": 4.789572877419839e-05,
      "loss": 1.7169,
      "num_input_tokens_seen": 11774742064,
      "step": 14966
    },
    {
      "epoch": 1.5878421387651178,
      "grad_norm": 0.3733043365245232,
      "learning_rate": 4.7895449688019435e-05,
      "loss": 1.8407,
      "num_input_tokens_seen": 11775528800,
      "step": 14967
    },
    {
      "epoch": 1.5879482283046893,
      "grad_norm": 0.34324207209699853,
      "learning_rate": 4.7895170584147544e-05,
      "loss": 1.6129,
      "num_input_tokens_seen": 11776315568,
      "step": 14968
    },
    {
      "epoch": 1.5880543178442605,
      "grad_norm": 0.4185118340021085,
      "learning_rate": 4.789489146258294e-05,
      "loss": 1.743,
      "num_input_tokens_seen": 11777102272,
      "step": 14969
    },
    {
      "epoch": 1.5881604073838318,
      "grad_norm": 0.38593363319935775,
      "learning_rate": 4.7894612323325825e-05,
      "loss": 1.6918,
      "num_input_tokens_seen": 11777889008,
      "step": 14970
    },
    {
      "epoch": 1.5882664969234033,
      "grad_norm": 0.38022603133641275,
      "learning_rate": 4.789433316637644e-05,
      "loss": 1.7105,
      "num_input_tokens_seen": 11778675760,
      "step": 14971
    },
    {
      "epoch": 1.5883725864629747,
      "grad_norm": 0.47180217387910767,
      "learning_rate": 4.789405399173498e-05,
      "loss": 1.6183,
      "num_input_tokens_seen": 11779462624,
      "step": 14972
    },
    {
      "epoch": 1.5884786760025462,
      "grad_norm": 0.4334875449126184,
      "learning_rate": 4.789377479940166e-05,
      "loss": 1.78,
      "num_input_tokens_seen": 11780249344,
      "step": 14973
    },
    {
      "epoch": 1.5885847655421177,
      "grad_norm": 0.5047039359773298,
      "learning_rate": 4.789349558937672e-05,
      "loss": 1.6618,
      "num_input_tokens_seen": 11781036080,
      "step": 14974
    },
    {
      "epoch": 1.588690855081689,
      "grad_norm": 0.427075223200816,
      "learning_rate": 4.789321636166034e-05,
      "loss": 1.8963,
      "num_input_tokens_seen": 11781822784,
      "step": 14975
    },
    {
      "epoch": 1.5887969446212602,
      "grad_norm": 0.40684978259962246,
      "learning_rate": 4.789293711625276e-05,
      "loss": 1.6069,
      "num_input_tokens_seen": 11782609664,
      "step": 14976
    },
    {
      "epoch": 1.5889030341608317,
      "grad_norm": 0.4943940508393045,
      "learning_rate": 4.789265785315419e-05,
      "loss": 1.7551,
      "num_input_tokens_seen": 11783396464,
      "step": 14977
    },
    {
      "epoch": 1.5890091237004031,
      "grad_norm": 0.377905018847465,
      "learning_rate": 4.789237857236485e-05,
      "loss": 1.6998,
      "num_input_tokens_seen": 11784183216,
      "step": 14978
    },
    {
      "epoch": 1.5891152132399746,
      "grad_norm": 0.40647502277139413,
      "learning_rate": 4.789209927388495e-05,
      "loss": 1.7654,
      "num_input_tokens_seen": 11784969920,
      "step": 14979
    },
    {
      "epoch": 1.589221302779546,
      "grad_norm": 0.3506371149220168,
      "learning_rate": 4.78918199577147e-05,
      "loss": 1.8087,
      "num_input_tokens_seen": 11785756640,
      "step": 14980
    },
    {
      "epoch": 1.5893273923191173,
      "grad_norm": 0.38478844209963436,
      "learning_rate": 4.789154062385434e-05,
      "loss": 1.6612,
      "num_input_tokens_seen": 11786543424,
      "step": 14981
    },
    {
      "epoch": 1.5894334818586886,
      "grad_norm": 0.3353068024317592,
      "learning_rate": 4.789126127230405e-05,
      "loss": 1.6962,
      "num_input_tokens_seen": 11787330224,
      "step": 14982
    },
    {
      "epoch": 1.58953957139826,
      "grad_norm": 0.4481859573333308,
      "learning_rate": 4.7890981903064076e-05,
      "loss": 1.766,
      "num_input_tokens_seen": 11788117008,
      "step": 14983
    },
    {
      "epoch": 1.5896456609378316,
      "grad_norm": 0.5253213947073456,
      "learning_rate": 4.7890702516134625e-05,
      "loss": 1.7517,
      "num_input_tokens_seen": 11788903808,
      "step": 14984
    },
    {
      "epoch": 1.589751750477403,
      "grad_norm": 0.37322406066754726,
      "learning_rate": 4.78904231115159e-05,
      "loss": 1.7328,
      "num_input_tokens_seen": 11789690624,
      "step": 14985
    },
    {
      "epoch": 1.5898578400169743,
      "grad_norm": 0.38713634534087943,
      "learning_rate": 4.789014368920813e-05,
      "loss": 1.7867,
      "num_input_tokens_seen": 11790477344,
      "step": 14986
    },
    {
      "epoch": 1.5899639295565458,
      "grad_norm": 0.35546017935152724,
      "learning_rate": 4.788986424921154e-05,
      "loss": 1.7294,
      "num_input_tokens_seen": 11791264064,
      "step": 14987
    },
    {
      "epoch": 1.590070019096117,
      "grad_norm": 0.38483199139672347,
      "learning_rate": 4.788958479152632e-05,
      "loss": 1.7426,
      "num_input_tokens_seen": 11792050832,
      "step": 14988
    },
    {
      "epoch": 1.5901761086356885,
      "grad_norm": 0.3836954612206899,
      "learning_rate": 4.788930531615271e-05,
      "loss": 1.7145,
      "num_input_tokens_seen": 11792837584,
      "step": 14989
    },
    {
      "epoch": 1.59028219817526,
      "grad_norm": 0.5727200037450634,
      "learning_rate": 4.788902582309091e-05,
      "loss": 1.7265,
      "num_input_tokens_seen": 11793624336,
      "step": 14990
    },
    {
      "epoch": 1.5903882877148314,
      "grad_norm": 0.5807536722094201,
      "learning_rate": 4.788874631234115e-05,
      "loss": 1.949,
      "num_input_tokens_seen": 11794411136,
      "step": 14991
    },
    {
      "epoch": 1.5904943772544027,
      "grad_norm": 0.476986660249567,
      "learning_rate": 4.788846678390363e-05,
      "loss": 1.5349,
      "num_input_tokens_seen": 11795197936,
      "step": 14992
    },
    {
      "epoch": 1.5906004667939742,
      "grad_norm": 0.3959477041242915,
      "learning_rate": 4.788818723777858e-05,
      "loss": 1.6361,
      "num_input_tokens_seen": 11795984704,
      "step": 14993
    },
    {
      "epoch": 1.5907065563335454,
      "grad_norm": 0.4157225165852487,
      "learning_rate": 4.788790767396621e-05,
      "loss": 1.7632,
      "num_input_tokens_seen": 11796771440,
      "step": 14994
    },
    {
      "epoch": 1.5908126458731169,
      "grad_norm": 0.4521546506923737,
      "learning_rate": 4.788762809246673e-05,
      "loss": 1.8747,
      "num_input_tokens_seen": 11797558144,
      "step": 14995
    },
    {
      "epoch": 1.5909187354126884,
      "grad_norm": 0.46783127510450434,
      "learning_rate": 4.788734849328037e-05,
      "loss": 1.8027,
      "num_input_tokens_seen": 11798344960,
      "step": 14996
    },
    {
      "epoch": 1.5910248249522598,
      "grad_norm": 0.5961497416129692,
      "learning_rate": 4.7887068876407335e-05,
      "loss": 1.6869,
      "num_input_tokens_seen": 11799131792,
      "step": 14997
    },
    {
      "epoch": 1.591130914491831,
      "grad_norm": 0.5009719529801757,
      "learning_rate": 4.788678924184785e-05,
      "loss": 1.7626,
      "num_input_tokens_seen": 11799918544,
      "step": 14998
    },
    {
      "epoch": 1.5912370040314026,
      "grad_norm": 0.8076599934586401,
      "learning_rate": 4.7886509589602126e-05,
      "loss": 1.6825,
      "num_input_tokens_seen": 11800705264,
      "step": 14999
    },
    {
      "epoch": 1.5913430935709738,
      "grad_norm": 0.4713753807266759,
      "learning_rate": 4.7886229919670375e-05,
      "loss": 1.6749,
      "num_input_tokens_seen": 11801492016,
      "step": 15000
    },
    {
      "epoch": 1.5913430935709738,
      "eval_loss": 1.7602148056030273,
      "eval_runtime": 65.6762,
      "eval_samples_per_second": 45.679,
      "eval_steps_per_second": 0.487,
      "num_input_tokens_seen": 11801492016,
      "step": 15000
    },
    {
      "epoch": 1.5914491831105453,
      "grad_norm": 0.6780487424937512,
      "learning_rate": 4.788595023205282e-05,
      "loss": 1.7596,
      "num_input_tokens_seen": 11802278816,
      "step": 15001
    },
    {
      "epoch": 1.5915552726501168,
      "grad_norm": 0.39946374780809113,
      "learning_rate": 4.788567052674967e-05,
      "loss": 1.7388,
      "num_input_tokens_seen": 11803065584,
      "step": 15002
    },
    {
      "epoch": 1.5916613621896882,
      "grad_norm": 0.5186934086350994,
      "learning_rate": 4.7885390803761144e-05,
      "loss": 1.7396,
      "num_input_tokens_seen": 11803852208,
      "step": 15003
    },
    {
      "epoch": 1.5917674517292595,
      "grad_norm": 0.5252355177309215,
      "learning_rate": 4.7885111063087465e-05,
      "loss": 1.7371,
      "num_input_tokens_seen": 11804638976,
      "step": 15004
    },
    {
      "epoch": 1.5918735412688307,
      "grad_norm": 0.47965846387338046,
      "learning_rate": 4.788483130472884e-05,
      "loss": 1.8532,
      "num_input_tokens_seen": 11805425872,
      "step": 15005
    },
    {
      "epoch": 1.5919796308084022,
      "grad_norm": 0.47232994159979735,
      "learning_rate": 4.788455152868549e-05,
      "loss": 1.7534,
      "num_input_tokens_seen": 11806212672,
      "step": 15006
    },
    {
      "epoch": 1.5920857203479737,
      "grad_norm": 0.5426377394892281,
      "learning_rate": 4.788427173495763e-05,
      "loss": 1.7306,
      "num_input_tokens_seen": 11806999424,
      "step": 15007
    },
    {
      "epoch": 1.5921918098875452,
      "grad_norm": 0.45944464421722975,
      "learning_rate": 4.788399192354548e-05,
      "loss": 1.8653,
      "num_input_tokens_seen": 11807786112,
      "step": 15008
    },
    {
      "epoch": 1.5922978994271166,
      "grad_norm": 0.4907939146766766,
      "learning_rate": 4.7883712094449245e-05,
      "loss": 1.7339,
      "num_input_tokens_seen": 11808572880,
      "step": 15009
    },
    {
      "epoch": 1.5924039889666879,
      "grad_norm": 0.5495138520965063,
      "learning_rate": 4.788343224766915e-05,
      "loss": 1.849,
      "num_input_tokens_seen": 11809359632,
      "step": 15010
    },
    {
      "epoch": 1.5925100785062591,
      "grad_norm": 0.4239609989517993,
      "learning_rate": 4.7883152383205415e-05,
      "loss": 1.8925,
      "num_input_tokens_seen": 11810146368,
      "step": 15011
    },
    {
      "epoch": 1.5926161680458306,
      "grad_norm": 0.8330193263569504,
      "learning_rate": 4.788287250105825e-05,
      "loss": 1.7803,
      "num_input_tokens_seen": 11810933152,
      "step": 15012
    },
    {
      "epoch": 1.592722257585402,
      "grad_norm": 0.5599287384323095,
      "learning_rate": 4.788259260122787e-05,
      "loss": 1.6818,
      "num_input_tokens_seen": 11811719792,
      "step": 15013
    },
    {
      "epoch": 1.5928283471249736,
      "grad_norm": 1.020533535371324,
      "learning_rate": 4.78823126837145e-05,
      "loss": 1.7461,
      "num_input_tokens_seen": 11812506480,
      "step": 15014
    },
    {
      "epoch": 1.592934436664545,
      "grad_norm": 0.563386079304712,
      "learning_rate": 4.788203274851834e-05,
      "loss": 1.7807,
      "num_input_tokens_seen": 11813293216,
      "step": 15015
    },
    {
      "epoch": 1.5930405262041163,
      "grad_norm": 1.4457139056192292,
      "learning_rate": 4.7881752795639625e-05,
      "loss": 1.7929,
      "num_input_tokens_seen": 11814079888,
      "step": 15016
    },
    {
      "epoch": 1.5931466157436875,
      "grad_norm": 0.7413460061249522,
      "learning_rate": 4.7881472825078554e-05,
      "loss": 1.7701,
      "num_input_tokens_seen": 11814866592,
      "step": 15017
    },
    {
      "epoch": 1.593252705283259,
      "grad_norm": 0.610188278390307,
      "learning_rate": 4.7881192836835365e-05,
      "loss": 1.8376,
      "num_input_tokens_seen": 11815653328,
      "step": 15018
    },
    {
      "epoch": 1.5933587948228305,
      "grad_norm": 0.5150551972296581,
      "learning_rate": 4.7880912830910255e-05,
      "loss": 1.7734,
      "num_input_tokens_seen": 11816440128,
      "step": 15019
    },
    {
      "epoch": 1.593464884362402,
      "grad_norm": 0.651282358869518,
      "learning_rate": 4.788063280730344e-05,
      "loss": 1.8233,
      "num_input_tokens_seen": 11817226960,
      "step": 15020
    },
    {
      "epoch": 1.5935709739019732,
      "grad_norm": 0.4932081935010962,
      "learning_rate": 4.788035276601516e-05,
      "loss": 1.7186,
      "num_input_tokens_seen": 11818013776,
      "step": 15021
    },
    {
      "epoch": 1.5936770634415447,
      "grad_norm": 0.38234773979371606,
      "learning_rate": 4.78800727070456e-05,
      "loss": 1.7501,
      "num_input_tokens_seen": 11818800528,
      "step": 15022
    },
    {
      "epoch": 1.593783152981116,
      "grad_norm": 0.4405889916496158,
      "learning_rate": 4.7879792630394994e-05,
      "loss": 1.7066,
      "num_input_tokens_seen": 11819587328,
      "step": 15023
    },
    {
      "epoch": 1.5938892425206874,
      "grad_norm": 0.4359479183716011,
      "learning_rate": 4.787951253606355e-05,
      "loss": 1.7157,
      "num_input_tokens_seen": 11820374112,
      "step": 15024
    },
    {
      "epoch": 1.593995332060259,
      "grad_norm": 0.42367774200031977,
      "learning_rate": 4.78792324240515e-05,
      "loss": 1.6943,
      "num_input_tokens_seen": 11821160832,
      "step": 15025
    },
    {
      "epoch": 1.5941014215998304,
      "grad_norm": 0.6083435748451995,
      "learning_rate": 4.787895229435905e-05,
      "loss": 1.7015,
      "num_input_tokens_seen": 11821947664,
      "step": 15026
    },
    {
      "epoch": 1.5942075111394016,
      "grad_norm": 0.4805355028325888,
      "learning_rate": 4.7878672146986416e-05,
      "loss": 1.6543,
      "num_input_tokens_seen": 11822734544,
      "step": 15027
    },
    {
      "epoch": 1.594313600678973,
      "grad_norm": 0.6185085958393093,
      "learning_rate": 4.7878391981933814e-05,
      "loss": 1.9055,
      "num_input_tokens_seen": 11823521280,
      "step": 15028
    },
    {
      "epoch": 1.5944196902185443,
      "grad_norm": 0.3876537464727536,
      "learning_rate": 4.7878111799201466e-05,
      "loss": 1.5295,
      "num_input_tokens_seen": 11824308192,
      "step": 15029
    },
    {
      "epoch": 1.5945257797581158,
      "grad_norm": 0.4607819399007746,
      "learning_rate": 4.787783159878958e-05,
      "loss": 1.6954,
      "num_input_tokens_seen": 11825094960,
      "step": 15030
    },
    {
      "epoch": 1.5946318692976873,
      "grad_norm": 0.5128235737924172,
      "learning_rate": 4.787755138069837e-05,
      "loss": 1.8464,
      "num_input_tokens_seen": 11825881680,
      "step": 15031
    },
    {
      "epoch": 1.5947379588372588,
      "grad_norm": 0.4161993582969741,
      "learning_rate": 4.787727114492807e-05,
      "loss": 1.7535,
      "num_input_tokens_seen": 11826668432,
      "step": 15032
    },
    {
      "epoch": 1.59484404837683,
      "grad_norm": 0.49340166302968297,
      "learning_rate": 4.787699089147888e-05,
      "loss": 1.7336,
      "num_input_tokens_seen": 11827455200,
      "step": 15033
    },
    {
      "epoch": 1.5949501379164013,
      "grad_norm": 0.38110823455876275,
      "learning_rate": 4.787671062035103e-05,
      "loss": 1.6329,
      "num_input_tokens_seen": 11828242000,
      "step": 15034
    },
    {
      "epoch": 1.5950562274559728,
      "grad_norm": 0.44130748674905707,
      "learning_rate": 4.7876430331544725e-05,
      "loss": 1.8276,
      "num_input_tokens_seen": 11829028768,
      "step": 15035
    },
    {
      "epoch": 1.5951623169955442,
      "grad_norm": 0.4212091827569577,
      "learning_rate": 4.7876150025060185e-05,
      "loss": 1.7008,
      "num_input_tokens_seen": 11829815488,
      "step": 15036
    },
    {
      "epoch": 1.5952684065351157,
      "grad_norm": 0.4071478694892366,
      "learning_rate": 4.787586970089763e-05,
      "loss": 1.5929,
      "num_input_tokens_seen": 11830602320,
      "step": 15037
    },
    {
      "epoch": 1.5953744960746872,
      "grad_norm": 0.4521787933998525,
      "learning_rate": 4.787558935905727e-05,
      "loss": 1.7265,
      "num_input_tokens_seen": 11831389104,
      "step": 15038
    },
    {
      "epoch": 1.5954805856142584,
      "grad_norm": 0.40885406236845784,
      "learning_rate": 4.787530899953934e-05,
      "loss": 1.7173,
      "num_input_tokens_seen": 11832175968,
      "step": 15039
    },
    {
      "epoch": 1.5955866751538297,
      "grad_norm": 0.3939820513523617,
      "learning_rate": 4.787502862234402e-05,
      "loss": 1.8918,
      "num_input_tokens_seen": 11832962816,
      "step": 15040
    },
    {
      "epoch": 1.5956927646934012,
      "grad_norm": 0.4006530948284083,
      "learning_rate": 4.787474822747157e-05,
      "loss": 1.8983,
      "num_input_tokens_seen": 11833749568,
      "step": 15041
    },
    {
      "epoch": 1.5957988542329726,
      "grad_norm": 0.5274757256044237,
      "learning_rate": 4.787446781492217e-05,
      "loss": 1.7398,
      "num_input_tokens_seen": 11834536432,
      "step": 15042
    },
    {
      "epoch": 1.595904943772544,
      "grad_norm": 0.3525593091824611,
      "learning_rate": 4.787418738469605e-05,
      "loss": 1.6244,
      "num_input_tokens_seen": 11835323232,
      "step": 15043
    },
    {
      "epoch": 1.5960110333121156,
      "grad_norm": 0.6197859222764527,
      "learning_rate": 4.787390693679345e-05,
      "loss": 1.7372,
      "num_input_tokens_seen": 11836109968,
      "step": 15044
    },
    {
      "epoch": 1.5961171228516868,
      "grad_norm": 0.3989826007129532,
      "learning_rate": 4.787362647121455e-05,
      "loss": 1.8524,
      "num_input_tokens_seen": 11836896704,
      "step": 15045
    },
    {
      "epoch": 1.596223212391258,
      "grad_norm": 0.6939646628476815,
      "learning_rate": 4.787334598795958e-05,
      "loss": 1.7956,
      "num_input_tokens_seen": 11837683408,
      "step": 15046
    },
    {
      "epoch": 1.5963293019308296,
      "grad_norm": 0.5075789937039714,
      "learning_rate": 4.787306548702877e-05,
      "loss": 1.7626,
      "num_input_tokens_seen": 11838470032,
      "step": 15047
    },
    {
      "epoch": 1.596435391470401,
      "grad_norm": 0.47930609980584504,
      "learning_rate": 4.7872784968422326e-05,
      "loss": 1.7388,
      "num_input_tokens_seen": 11839256688,
      "step": 15048
    },
    {
      "epoch": 1.5965414810099725,
      "grad_norm": 0.43150393145621546,
      "learning_rate": 4.787250443214045e-05,
      "loss": 1.7345,
      "num_input_tokens_seen": 11840043456,
      "step": 15049
    },
    {
      "epoch": 1.5966475705495438,
      "grad_norm": 0.5984016220542953,
      "learning_rate": 4.7872223878183385e-05,
      "loss": 1.781,
      "num_input_tokens_seen": 11840830192,
      "step": 15050
    },
    {
      "epoch": 1.5967536600891152,
      "grad_norm": 0.44559319182725327,
      "learning_rate": 4.7871943306551336e-05,
      "loss": 1.848,
      "num_input_tokens_seen": 11841616912,
      "step": 15051
    },
    {
      "epoch": 1.5968597496286865,
      "grad_norm": 0.5997654861046483,
      "learning_rate": 4.787166271724453e-05,
      "loss": 1.7205,
      "num_input_tokens_seen": 11842403712,
      "step": 15052
    },
    {
      "epoch": 1.596965839168258,
      "grad_norm": 0.3954872632374545,
      "learning_rate": 4.787138211026316e-05,
      "loss": 1.7957,
      "num_input_tokens_seen": 11843190528,
      "step": 15053
    },
    {
      "epoch": 1.5970719287078294,
      "grad_norm": 0.44890677968590764,
      "learning_rate": 4.7871101485607464e-05,
      "loss": 1.7432,
      "num_input_tokens_seen": 11843977328,
      "step": 15054
    },
    {
      "epoch": 1.597178018247401,
      "grad_norm": 0.748997744052491,
      "learning_rate": 4.787082084327764e-05,
      "loss": 1.7951,
      "num_input_tokens_seen": 11844764096,
      "step": 15055
    },
    {
      "epoch": 1.5972841077869722,
      "grad_norm": 0.43201334954599485,
      "learning_rate": 4.7870540183273926e-05,
      "loss": 1.6712,
      "num_input_tokens_seen": 11845550880,
      "step": 15056
    },
    {
      "epoch": 1.5973901973265436,
      "grad_norm": 0.45815158022975133,
      "learning_rate": 4.787025950559653e-05,
      "loss": 1.7065,
      "num_input_tokens_seen": 11846337632,
      "step": 15057
    },
    {
      "epoch": 1.597496286866115,
      "grad_norm": 0.49581419198286464,
      "learning_rate": 4.786997881024567e-05,
      "loss": 1.7401,
      "num_input_tokens_seen": 11847124272,
      "step": 15058
    },
    {
      "epoch": 1.5976023764056864,
      "grad_norm": 0.4483910878838009,
      "learning_rate": 4.786969809722156e-05,
      "loss": 1.8525,
      "num_input_tokens_seen": 11847910944,
      "step": 15059
    },
    {
      "epoch": 1.5977084659452578,
      "grad_norm": 0.5057269918183822,
      "learning_rate": 4.786941736652442e-05,
      "loss": 1.7498,
      "num_input_tokens_seen": 11848697776,
      "step": 15060
    },
    {
      "epoch": 1.5978145554848293,
      "grad_norm": 0.5147435659909684,
      "learning_rate": 4.786913661815446e-05,
      "loss": 1.8889,
      "num_input_tokens_seen": 11849484560,
      "step": 15061
    },
    {
      "epoch": 1.5979206450244006,
      "grad_norm": 0.40186211168831953,
      "learning_rate": 4.786885585211191e-05,
      "loss": 1.7261,
      "num_input_tokens_seen": 11850271312,
      "step": 15062
    },
    {
      "epoch": 1.598026734563972,
      "grad_norm": 0.5243095300735305,
      "learning_rate": 4.786857506839697e-05,
      "loss": 1.8659,
      "num_input_tokens_seen": 11851058032,
      "step": 15063
    },
    {
      "epoch": 1.5981328241035433,
      "grad_norm": 0.47217096312386564,
      "learning_rate": 4.7868294267009865e-05,
      "loss": 1.8322,
      "num_input_tokens_seen": 11851844752,
      "step": 15064
    },
    {
      "epoch": 1.5982389136431148,
      "grad_norm": 0.4000951262286287,
      "learning_rate": 4.786801344795082e-05,
      "loss": 1.6578,
      "num_input_tokens_seen": 11852631568,
      "step": 15065
    },
    {
      "epoch": 1.5983450031826862,
      "grad_norm": 0.5355172815645303,
      "learning_rate": 4.786773261122004e-05,
      "loss": 1.7758,
      "num_input_tokens_seen": 11853418288,
      "step": 15066
    },
    {
      "epoch": 1.5984510927222577,
      "grad_norm": 0.4499443548850206,
      "learning_rate": 4.786745175681775e-05,
      "loss": 1.7402,
      "num_input_tokens_seen": 11854205088,
      "step": 15067
    },
    {
      "epoch": 1.598557182261829,
      "grad_norm": 0.4765144094606232,
      "learning_rate": 4.7867170884744175e-05,
      "loss": 1.8791,
      "num_input_tokens_seen": 11854991840,
      "step": 15068
    },
    {
      "epoch": 1.5986632718014002,
      "grad_norm": 0.3950643366850149,
      "learning_rate": 4.786688999499951e-05,
      "loss": 1.7316,
      "num_input_tokens_seen": 11855778512,
      "step": 15069
    },
    {
      "epoch": 1.5987693613409717,
      "grad_norm": 0.33753778247047067,
      "learning_rate": 4.786660908758398e-05,
      "loss": 1.7225,
      "num_input_tokens_seen": 11856565248,
      "step": 15070
    },
    {
      "epoch": 1.5988754508805432,
      "grad_norm": 0.39876496380081633,
      "learning_rate": 4.786632816249781e-05,
      "loss": 1.653,
      "num_input_tokens_seen": 11857352048,
      "step": 15071
    },
    {
      "epoch": 1.5989815404201146,
      "grad_norm": 0.40629007566348074,
      "learning_rate": 4.786604721974122e-05,
      "loss": 1.7698,
      "num_input_tokens_seen": 11858138960,
      "step": 15072
    },
    {
      "epoch": 1.5990876299596861,
      "grad_norm": 0.37748107172240314,
      "learning_rate": 4.7865766259314406e-05,
      "loss": 1.6472,
      "num_input_tokens_seen": 11858925680,
      "step": 15073
    },
    {
      "epoch": 1.5991937194992574,
      "grad_norm": 0.4636452667771099,
      "learning_rate": 4.7865485281217605e-05,
      "loss": 1.5814,
      "num_input_tokens_seen": 11859712576,
      "step": 15074
    },
    {
      "epoch": 1.5992998090388286,
      "grad_norm": 0.4110682510430828,
      "learning_rate": 4.7865204285451026e-05,
      "loss": 1.9018,
      "num_input_tokens_seen": 11860499312,
      "step": 15075
    },
    {
      "epoch": 1.5994058985784,
      "grad_norm": 0.4722921738999009,
      "learning_rate": 4.786492327201489e-05,
      "loss": 1.8929,
      "num_input_tokens_seen": 11861286048,
      "step": 15076
    },
    {
      "epoch": 1.5995119881179716,
      "grad_norm": 0.40693433583097965,
      "learning_rate": 4.786464224090942e-05,
      "loss": 1.6282,
      "num_input_tokens_seen": 11862072816,
      "step": 15077
    },
    {
      "epoch": 1.599618077657543,
      "grad_norm": 0.4228422849171522,
      "learning_rate": 4.786436119213481e-05,
      "loss": 1.737,
      "num_input_tokens_seen": 11862859664,
      "step": 15078
    },
    {
      "epoch": 1.5997241671971145,
      "grad_norm": 0.45831861321864836,
      "learning_rate": 4.78640801256913e-05,
      "loss": 1.7105,
      "num_input_tokens_seen": 11863646416,
      "step": 15079
    },
    {
      "epoch": 1.5998302567366858,
      "grad_norm": 0.41210384447674825,
      "learning_rate": 4.7863799041579104e-05,
      "loss": 1.6929,
      "num_input_tokens_seen": 11864433184,
      "step": 15080
    },
    {
      "epoch": 1.599936346276257,
      "grad_norm": 0.4529549682865865,
      "learning_rate": 4.786351793979843e-05,
      "loss": 1.8376,
      "num_input_tokens_seen": 11865219936,
      "step": 15081
    },
    {
      "epoch": 1.6000424358158285,
      "grad_norm": 0.39160557986093886,
      "learning_rate": 4.7863236820349496e-05,
      "loss": 1.7798,
      "num_input_tokens_seen": 11866006800,
      "step": 15082
    },
    {
      "epoch": 1.6001485253554,
      "grad_norm": 0.6656402361200744,
      "learning_rate": 4.786295568323253e-05,
      "loss": 1.7888,
      "num_input_tokens_seen": 11866793536,
      "step": 15083
    },
    {
      "epoch": 1.6002546148949714,
      "grad_norm": 0.4395149055866289,
      "learning_rate": 4.786267452844775e-05,
      "loss": 1.5911,
      "num_input_tokens_seen": 11867580384,
      "step": 15084
    },
    {
      "epoch": 1.6003607044345427,
      "grad_norm": 0.7111303422377591,
      "learning_rate": 4.786239335599535e-05,
      "loss": 1.8641,
      "num_input_tokens_seen": 11868367152,
      "step": 15085
    },
    {
      "epoch": 1.6004667939741142,
      "grad_norm": 0.4178981824513209,
      "learning_rate": 4.786211216587557e-05,
      "loss": 1.6879,
      "num_input_tokens_seen": 11869153888,
      "step": 15086
    },
    {
      "epoch": 1.6005728835136854,
      "grad_norm": 0.596474856724791,
      "learning_rate": 4.786183095808863e-05,
      "loss": 1.7086,
      "num_input_tokens_seen": 11869940544,
      "step": 15087
    },
    {
      "epoch": 1.600678973053257,
      "grad_norm": 0.46109445886569295,
      "learning_rate": 4.786154973263473e-05,
      "loss": 1.7567,
      "num_input_tokens_seen": 11870727296,
      "step": 15088
    },
    {
      "epoch": 1.6007850625928284,
      "grad_norm": 0.4550442147256225,
      "learning_rate": 4.786126848951409e-05,
      "loss": 1.6651,
      "num_input_tokens_seen": 11871514016,
      "step": 15089
    },
    {
      "epoch": 1.6008911521323999,
      "grad_norm": 0.47885315468440426,
      "learning_rate": 4.7860987228726935e-05,
      "loss": 1.765,
      "num_input_tokens_seen": 11872300800,
      "step": 15090
    },
    {
      "epoch": 1.600997241671971,
      "grad_norm": 0.41452664004226075,
      "learning_rate": 4.786070595027348e-05,
      "loss": 1.7036,
      "num_input_tokens_seen": 11873087600,
      "step": 15091
    },
    {
      "epoch": 1.6011033312115426,
      "grad_norm": 0.40789913182073545,
      "learning_rate": 4.786042465415395e-05,
      "loss": 1.7657,
      "num_input_tokens_seen": 11873874336,
      "step": 15092
    },
    {
      "epoch": 1.6012094207511138,
      "grad_norm": 0.5585259321485313,
      "learning_rate": 4.786014334036854e-05,
      "loss": 1.8766,
      "num_input_tokens_seen": 11874661040,
      "step": 15093
    },
    {
      "epoch": 1.6013155102906853,
      "grad_norm": 0.37426168664051285,
      "learning_rate": 4.785986200891749e-05,
      "loss": 1.7689,
      "num_input_tokens_seen": 11875447872,
      "step": 15094
    },
    {
      "epoch": 1.6014215998302568,
      "grad_norm": 0.37426747389449105,
      "learning_rate": 4.785958065980101e-05,
      "loss": 1.5994,
      "num_input_tokens_seen": 11876234704,
      "step": 15095
    },
    {
      "epoch": 1.6015276893698283,
      "grad_norm": 0.4477118425932376,
      "learning_rate": 4.785929929301931e-05,
      "loss": 1.7672,
      "num_input_tokens_seen": 11877021520,
      "step": 15096
    },
    {
      "epoch": 1.6016337789093995,
      "grad_norm": 0.36136303673318804,
      "learning_rate": 4.7859017908572625e-05,
      "loss": 1.8091,
      "num_input_tokens_seen": 11877808240,
      "step": 15097
    },
    {
      "epoch": 1.601739868448971,
      "grad_norm": 0.581315486368564,
      "learning_rate": 4.785873650646115e-05,
      "loss": 1.8418,
      "num_input_tokens_seen": 11878594976,
      "step": 15098
    },
    {
      "epoch": 1.6018459579885422,
      "grad_norm": 0.41835886511477466,
      "learning_rate": 4.785845508668513e-05,
      "loss": 1.7969,
      "num_input_tokens_seen": 11879381632,
      "step": 15099
    },
    {
      "epoch": 1.6019520475281137,
      "grad_norm": 0.38991110401125256,
      "learning_rate": 4.785817364924476e-05,
      "loss": 1.6931,
      "num_input_tokens_seen": 11880168352,
      "step": 15100
    },
    {
      "epoch": 1.6020581370676852,
      "grad_norm": 0.4428164993993745,
      "learning_rate": 4.785789219414026e-05,
      "loss": 1.6983,
      "num_input_tokens_seen": 11880955008,
      "step": 15101
    },
    {
      "epoch": 1.6021642266072567,
      "grad_norm": 0.38530704396795984,
      "learning_rate": 4.785761072137186e-05,
      "loss": 1.7518,
      "num_input_tokens_seen": 11881741728,
      "step": 15102
    },
    {
      "epoch": 1.602270316146828,
      "grad_norm": 0.35796519622516537,
      "learning_rate": 4.785732923093976e-05,
      "loss": 1.7428,
      "num_input_tokens_seen": 11882528496,
      "step": 15103
    },
    {
      "epoch": 1.6023764056863992,
      "grad_norm": 0.3740184280113446,
      "learning_rate": 4.785704772284418e-05,
      "loss": 1.6735,
      "num_input_tokens_seen": 11883315216,
      "step": 15104
    },
    {
      "epoch": 1.6024824952259706,
      "grad_norm": 0.35121342087055124,
      "learning_rate": 4.7856766197085355e-05,
      "loss": 1.8053,
      "num_input_tokens_seen": 11884101968,
      "step": 15105
    },
    {
      "epoch": 1.6025885847655421,
      "grad_norm": 0.5230168151216211,
      "learning_rate": 4.78564846536635e-05,
      "loss": 1.7426,
      "num_input_tokens_seen": 11884888784,
      "step": 15106
    },
    {
      "epoch": 1.6026946743051136,
      "grad_norm": 0.3632152850383146,
      "learning_rate": 4.785620309257881e-05,
      "loss": 1.7827,
      "num_input_tokens_seen": 11885675568,
      "step": 15107
    },
    {
      "epoch": 1.602800763844685,
      "grad_norm": 0.4296179176131135,
      "learning_rate": 4.7855921513831525e-05,
      "loss": 1.7231,
      "num_input_tokens_seen": 11886462384,
      "step": 15108
    },
    {
      "epoch": 1.6029068533842563,
      "grad_norm": 0.4191092232227917,
      "learning_rate": 4.785563991742185e-05,
      "loss": 1.8058,
      "num_input_tokens_seen": 11887249056,
      "step": 15109
    },
    {
      "epoch": 1.6030129429238276,
      "grad_norm": 0.36435997965314265,
      "learning_rate": 4.7855358303350004e-05,
      "loss": 1.6997,
      "num_input_tokens_seen": 11888035840,
      "step": 15110
    },
    {
      "epoch": 1.603119032463399,
      "grad_norm": 0.417090183518963,
      "learning_rate": 4.7855076671616215e-05,
      "loss": 1.8199,
      "num_input_tokens_seen": 11888822656,
      "step": 15111
    },
    {
      "epoch": 1.6032251220029705,
      "grad_norm": 0.3475538662529627,
      "learning_rate": 4.785479502222069e-05,
      "loss": 1.7281,
      "num_input_tokens_seen": 11889609408,
      "step": 15112
    },
    {
      "epoch": 1.603331211542542,
      "grad_norm": 0.36217844666007687,
      "learning_rate": 4.785451335516365e-05,
      "loss": 1.7005,
      "num_input_tokens_seen": 11890396160,
      "step": 15113
    },
    {
      "epoch": 1.6034373010821135,
      "grad_norm": 0.39083841814255016,
      "learning_rate": 4.785423167044531e-05,
      "loss": 1.7848,
      "num_input_tokens_seen": 11891182912,
      "step": 15114
    },
    {
      "epoch": 1.6035433906216847,
      "grad_norm": 0.34795782467293196,
      "learning_rate": 4.785394996806589e-05,
      "loss": 1.8793,
      "num_input_tokens_seen": 11891969696,
      "step": 15115
    },
    {
      "epoch": 1.603649480161256,
      "grad_norm": 0.33548185374581263,
      "learning_rate": 4.785366824802562e-05,
      "loss": 1.588,
      "num_input_tokens_seen": 11892756528,
      "step": 15116
    },
    {
      "epoch": 1.6037555697008274,
      "grad_norm": 0.3769081602592802,
      "learning_rate": 4.785338651032469e-05,
      "loss": 1.6951,
      "num_input_tokens_seen": 11893543312,
      "step": 15117
    },
    {
      "epoch": 1.603861659240399,
      "grad_norm": 0.4084441973710129,
      "learning_rate": 4.785310475496335e-05,
      "loss": 1.7613,
      "num_input_tokens_seen": 11894330144,
      "step": 15118
    },
    {
      "epoch": 1.6039677487799704,
      "grad_norm": 0.3653000780102379,
      "learning_rate": 4.7852822981941786e-05,
      "loss": 1.7562,
      "num_input_tokens_seen": 11895116896,
      "step": 15119
    },
    {
      "epoch": 1.6040738383195416,
      "grad_norm": 0.5224116869017376,
      "learning_rate": 4.785254119126024e-05,
      "loss": 1.86,
      "num_input_tokens_seen": 11895903728,
      "step": 15120
    },
    {
      "epoch": 1.6041799278591131,
      "grad_norm": 0.434661715681843,
      "learning_rate": 4.785225938291892e-05,
      "loss": 1.8106,
      "num_input_tokens_seen": 11896690400,
      "step": 15121
    },
    {
      "epoch": 1.6042860173986844,
      "grad_norm": 0.3987110431096583,
      "learning_rate": 4.7851977556918036e-05,
      "loss": 1.8318,
      "num_input_tokens_seen": 11897477200,
      "step": 15122
    },
    {
      "epoch": 1.6043921069382558,
      "grad_norm": 0.395635530626898,
      "learning_rate": 4.7851695713257816e-05,
      "loss": 1.5825,
      "num_input_tokens_seen": 11898263968,
      "step": 15123
    },
    {
      "epoch": 1.6044981964778273,
      "grad_norm": 0.3914995813215351,
      "learning_rate": 4.7851413851938484e-05,
      "loss": 1.6835,
      "num_input_tokens_seen": 11899050816,
      "step": 15124
    },
    {
      "epoch": 1.6046042860173988,
      "grad_norm": 0.34827799936293724,
      "learning_rate": 4.785113197296025e-05,
      "loss": 1.7565,
      "num_input_tokens_seen": 11899837568,
      "step": 15125
    },
    {
      "epoch": 1.60471037555697,
      "grad_norm": 0.6279647835629085,
      "learning_rate": 4.785085007632333e-05,
      "loss": 1.6335,
      "num_input_tokens_seen": 11900624304,
      "step": 15126
    },
    {
      "epoch": 1.6048164650965415,
      "grad_norm": 0.33485710684398823,
      "learning_rate": 4.7850568162027934e-05,
      "loss": 1.7953,
      "num_input_tokens_seen": 11901411088,
      "step": 15127
    },
    {
      "epoch": 1.6049225546361128,
      "grad_norm": 0.8484089030523708,
      "learning_rate": 4.78502862300743e-05,
      "loss": 1.7967,
      "num_input_tokens_seen": 11902197776,
      "step": 15128
    },
    {
      "epoch": 1.6050286441756842,
      "grad_norm": 0.5139108379850273,
      "learning_rate": 4.7850004280462626e-05,
      "loss": 1.6453,
      "num_input_tokens_seen": 11902984480,
      "step": 15129
    },
    {
      "epoch": 1.6051347337152557,
      "grad_norm": 0.74020177594627,
      "learning_rate": 4.784972231319315e-05,
      "loss": 1.6942,
      "num_input_tokens_seen": 11903771328,
      "step": 15130
    },
    {
      "epoch": 1.6052408232548272,
      "grad_norm": 0.4602248973998679,
      "learning_rate": 4.784944032826607e-05,
      "loss": 1.7885,
      "num_input_tokens_seen": 11904558064,
      "step": 15131
    },
    {
      "epoch": 1.6053469127943985,
      "grad_norm": 0.6918856730634337,
      "learning_rate": 4.784915832568162e-05,
      "loss": 1.7978,
      "num_input_tokens_seen": 11905344896,
      "step": 15132
    },
    {
      "epoch": 1.60545300233397,
      "grad_norm": 0.6171755407825407,
      "learning_rate": 4.784887630544e-05,
      "loss": 1.7187,
      "num_input_tokens_seen": 11906131648,
      "step": 15133
    },
    {
      "epoch": 1.6055590918735412,
      "grad_norm": 0.5004913251645985,
      "learning_rate": 4.784859426754146e-05,
      "loss": 1.908,
      "num_input_tokens_seen": 11906918480,
      "step": 15134
    },
    {
      "epoch": 1.6056651814131127,
      "grad_norm": 0.5925146366462858,
      "learning_rate": 4.784831221198618e-05,
      "loss": 1.712,
      "num_input_tokens_seen": 11907705248,
      "step": 15135
    },
    {
      "epoch": 1.6057712709526841,
      "grad_norm": 0.3663104089579631,
      "learning_rate": 4.78480301387744e-05,
      "loss": 1.6876,
      "num_input_tokens_seen": 11908492000,
      "step": 15136
    },
    {
      "epoch": 1.6058773604922556,
      "grad_norm": 0.3967885643757953,
      "learning_rate": 4.7847748047906324e-05,
      "loss": 1.7035,
      "num_input_tokens_seen": 11909278800,
      "step": 15137
    },
    {
      "epoch": 1.6059834500318269,
      "grad_norm": 0.3851407866293839,
      "learning_rate": 4.784746593938219e-05,
      "loss": 1.8841,
      "num_input_tokens_seen": 11910065504,
      "step": 15138
    },
    {
      "epoch": 1.606089539571398,
      "grad_norm": 0.40093781555937635,
      "learning_rate": 4.78471838132022e-05,
      "loss": 1.8232,
      "num_input_tokens_seen": 11910852176,
      "step": 15139
    },
    {
      "epoch": 1.6061956291109696,
      "grad_norm": 0.35355800581556807,
      "learning_rate": 4.784690166936658e-05,
      "loss": 1.6893,
      "num_input_tokens_seen": 11911639088,
      "step": 15140
    },
    {
      "epoch": 1.606301718650541,
      "grad_norm": 0.4399145768623323,
      "learning_rate": 4.7846619507875536e-05,
      "loss": 1.7232,
      "num_input_tokens_seen": 11912425856,
      "step": 15141
    },
    {
      "epoch": 1.6064078081901125,
      "grad_norm": 0.3480467961413624,
      "learning_rate": 4.784633732872931e-05,
      "loss": 1.7032,
      "num_input_tokens_seen": 11913212592,
      "step": 15142
    },
    {
      "epoch": 1.606513897729684,
      "grad_norm": 0.4329636905874873,
      "learning_rate": 4.784605513192809e-05,
      "loss": 1.8166,
      "num_input_tokens_seen": 11913999328,
      "step": 15143
    },
    {
      "epoch": 1.6066199872692553,
      "grad_norm": 0.4646480915215364,
      "learning_rate": 4.784577291747212e-05,
      "loss": 1.7405,
      "num_input_tokens_seen": 11914786160,
      "step": 15144
    },
    {
      "epoch": 1.6067260768088265,
      "grad_norm": 0.5394258542615974,
      "learning_rate": 4.784549068536159e-05,
      "loss": 1.8516,
      "num_input_tokens_seen": 11915572880,
      "step": 15145
    },
    {
      "epoch": 1.606832166348398,
      "grad_norm": 0.34956578872142957,
      "learning_rate": 4.784520843559676e-05,
      "loss": 1.6963,
      "num_input_tokens_seen": 11916359552,
      "step": 15146
    },
    {
      "epoch": 1.6069382558879695,
      "grad_norm": 0.5376966966472386,
      "learning_rate": 4.7844926168177807e-05,
      "loss": 1.6503,
      "num_input_tokens_seen": 11917146384,
      "step": 15147
    },
    {
      "epoch": 1.607044345427541,
      "grad_norm": 0.3872971107034079,
      "learning_rate": 4.784464388310497e-05,
      "loss": 1.6384,
      "num_input_tokens_seen": 11917933168,
      "step": 15148
    },
    {
      "epoch": 1.6071504349671124,
      "grad_norm": 0.4877932283771747,
      "learning_rate": 4.7844361580378457e-05,
      "loss": 1.7002,
      "num_input_tokens_seen": 11918719872,
      "step": 15149
    },
    {
      "epoch": 1.6072565245066837,
      "grad_norm": 0.40358288738299364,
      "learning_rate": 4.784407925999849e-05,
      "loss": 1.7044,
      "num_input_tokens_seen": 11919506464,
      "step": 15150
    },
    {
      "epoch": 1.607362614046255,
      "grad_norm": 0.4699401484201396,
      "learning_rate": 4.7843796921965304e-05,
      "loss": 1.6602,
      "num_input_tokens_seen": 11920293296,
      "step": 15151
    },
    {
      "epoch": 1.6074687035858264,
      "grad_norm": 0.3753370756559294,
      "learning_rate": 4.784351456627909e-05,
      "loss": 1.6606,
      "num_input_tokens_seen": 11921080128,
      "step": 15152
    },
    {
      "epoch": 1.6075747931253979,
      "grad_norm": 0.3836665576943603,
      "learning_rate": 4.7843232192940076e-05,
      "loss": 1.7421,
      "num_input_tokens_seen": 11921866848,
      "step": 15153
    },
    {
      "epoch": 1.6076808826649693,
      "grad_norm": 0.3611613183695728,
      "learning_rate": 4.784294980194849e-05,
      "loss": 1.6462,
      "num_input_tokens_seen": 11922653504,
      "step": 15154
    },
    {
      "epoch": 1.6077869722045406,
      "grad_norm": 0.47423261829027685,
      "learning_rate": 4.7842667393304535e-05,
      "loss": 1.9375,
      "num_input_tokens_seen": 11923440240,
      "step": 15155
    },
    {
      "epoch": 1.607893061744112,
      "grad_norm": 0.36466256167809347,
      "learning_rate": 4.784238496700844e-05,
      "loss": 1.5921,
      "num_input_tokens_seen": 11924227072,
      "step": 15156
    },
    {
      "epoch": 1.6079991512836833,
      "grad_norm": 0.47397124468594026,
      "learning_rate": 4.784210252306043e-05,
      "loss": 1.8326,
      "num_input_tokens_seen": 11925013920,
      "step": 15157
    },
    {
      "epoch": 1.6081052408232548,
      "grad_norm": 0.37439396218900745,
      "learning_rate": 4.78418200614607e-05,
      "loss": 1.7103,
      "num_input_tokens_seen": 11925800720,
      "step": 15158
    },
    {
      "epoch": 1.6082113303628263,
      "grad_norm": 0.4876822163312055,
      "learning_rate": 4.7841537582209486e-05,
      "loss": 1.7194,
      "num_input_tokens_seen": 11926587504,
      "step": 15159
    },
    {
      "epoch": 1.6083174199023977,
      "grad_norm": 0.42206018961587505,
      "learning_rate": 4.7841255085307e-05,
      "loss": 1.7718,
      "num_input_tokens_seen": 11927374240,
      "step": 15160
    },
    {
      "epoch": 1.608423509441969,
      "grad_norm": 0.5546472736287043,
      "learning_rate": 4.784097257075347e-05,
      "loss": 1.8202,
      "num_input_tokens_seen": 11928161056,
      "step": 15161
    },
    {
      "epoch": 1.6085295989815405,
      "grad_norm": 0.403321039607946,
      "learning_rate": 4.7840690038549096e-05,
      "loss": 1.6824,
      "num_input_tokens_seen": 11928947760,
      "step": 15162
    },
    {
      "epoch": 1.6086356885211117,
      "grad_norm": 0.636546051820885,
      "learning_rate": 4.784040748869412e-05,
      "loss": 1.8013,
      "num_input_tokens_seen": 11929734528,
      "step": 15163
    },
    {
      "epoch": 1.6087417780606832,
      "grad_norm": 0.4073150977533525,
      "learning_rate": 4.784012492118873e-05,
      "loss": 1.7298,
      "num_input_tokens_seen": 11930521264,
      "step": 15164
    },
    {
      "epoch": 1.6088478676002547,
      "grad_norm": 0.5837101117366806,
      "learning_rate": 4.783984233603317e-05,
      "loss": 1.7022,
      "num_input_tokens_seen": 11931308048,
      "step": 15165
    },
    {
      "epoch": 1.6089539571398261,
      "grad_norm": 0.4045051674555395,
      "learning_rate": 4.783955973322766e-05,
      "loss": 1.69,
      "num_input_tokens_seen": 11932094848,
      "step": 15166
    },
    {
      "epoch": 1.6090600466793974,
      "grad_norm": 0.5983479952908307,
      "learning_rate": 4.783927711277239e-05,
      "loss": 1.7006,
      "num_input_tokens_seen": 11932881664,
      "step": 15167
    },
    {
      "epoch": 1.6091661362189686,
      "grad_norm": 0.571741168431244,
      "learning_rate": 4.783899447466761e-05,
      "loss": 1.9637,
      "num_input_tokens_seen": 11933668352,
      "step": 15168
    },
    {
      "epoch": 1.6092722257585401,
      "grad_norm": 0.5479543830441375,
      "learning_rate": 4.783871181891353e-05,
      "loss": 1.8251,
      "num_input_tokens_seen": 11934455072,
      "step": 15169
    },
    {
      "epoch": 1.6093783152981116,
      "grad_norm": 0.4642108142978237,
      "learning_rate": 4.783842914551035e-05,
      "loss": 1.6961,
      "num_input_tokens_seen": 11935241808,
      "step": 15170
    },
    {
      "epoch": 1.609484404837683,
      "grad_norm": 0.5447404018091891,
      "learning_rate": 4.783814645445831e-05,
      "loss": 1.8074,
      "num_input_tokens_seen": 11936028512,
      "step": 15171
    },
    {
      "epoch": 1.6095904943772545,
      "grad_norm": 0.45518209792358644,
      "learning_rate": 4.783786374575762e-05,
      "loss": 1.6553,
      "num_input_tokens_seen": 11936815280,
      "step": 15172
    },
    {
      "epoch": 1.6096965839168258,
      "grad_norm": 0.6027288200249418,
      "learning_rate": 4.783758101940849e-05,
      "loss": 1.8321,
      "num_input_tokens_seen": 11937602112,
      "step": 15173
    },
    {
      "epoch": 1.609802673456397,
      "grad_norm": 0.3492557160778833,
      "learning_rate": 4.7837298275411155e-05,
      "loss": 1.6924,
      "num_input_tokens_seen": 11938388928,
      "step": 15174
    },
    {
      "epoch": 1.6099087629959685,
      "grad_norm": 0.4406940142494994,
      "learning_rate": 4.7837015513765826e-05,
      "loss": 1.7664,
      "num_input_tokens_seen": 11939175648,
      "step": 15175
    },
    {
      "epoch": 1.61001485253554,
      "grad_norm": 0.4778380412688388,
      "learning_rate": 4.783673273447272e-05,
      "loss": 1.8502,
      "num_input_tokens_seen": 11939962384,
      "step": 15176
    },
    {
      "epoch": 1.6101209420751115,
      "grad_norm": 0.3765807794590114,
      "learning_rate": 4.783644993753206e-05,
      "loss": 1.6669,
      "num_input_tokens_seen": 11940749104,
      "step": 15177
    },
    {
      "epoch": 1.610227031614683,
      "grad_norm": 0.49286115506299577,
      "learning_rate": 4.783616712294406e-05,
      "loss": 1.8943,
      "num_input_tokens_seen": 11941535888,
      "step": 15178
    },
    {
      "epoch": 1.6103331211542542,
      "grad_norm": 0.46698185931741687,
      "learning_rate": 4.783588429070894e-05,
      "loss": 1.8622,
      "num_input_tokens_seen": 11942322640,
      "step": 15179
    },
    {
      "epoch": 1.6104392106938255,
      "grad_norm": 0.42407426347672156,
      "learning_rate": 4.7835601440826916e-05,
      "loss": 1.7596,
      "num_input_tokens_seen": 11943109344,
      "step": 15180
    },
    {
      "epoch": 1.610545300233397,
      "grad_norm": 0.4442527531335434,
      "learning_rate": 4.783531857329821e-05,
      "loss": 1.7436,
      "num_input_tokens_seen": 11943896160,
      "step": 15181
    },
    {
      "epoch": 1.6106513897729684,
      "grad_norm": 0.6202220065432926,
      "learning_rate": 4.783503568812304e-05,
      "loss": 1.802,
      "num_input_tokens_seen": 11944682928,
      "step": 15182
    },
    {
      "epoch": 1.6107574793125399,
      "grad_norm": 0.40108068976214645,
      "learning_rate": 4.783475278530163e-05,
      "loss": 1.77,
      "num_input_tokens_seen": 11945469728,
      "step": 15183
    },
    {
      "epoch": 1.6108635688521111,
      "grad_norm": 0.44069990879435716,
      "learning_rate": 4.7834469864834184e-05,
      "loss": 1.6092,
      "num_input_tokens_seen": 11946256464,
      "step": 15184
    },
    {
      "epoch": 1.6109696583916826,
      "grad_norm": 0.4518729483243658,
      "learning_rate": 4.783418692672094e-05,
      "loss": 1.9071,
      "num_input_tokens_seen": 11947043264,
      "step": 15185
    },
    {
      "epoch": 1.6110757479312539,
      "grad_norm": 0.4413434601870142,
      "learning_rate": 4.7833903970962105e-05,
      "loss": 1.7148,
      "num_input_tokens_seen": 11947830048,
      "step": 15186
    },
    {
      "epoch": 1.6111818374708253,
      "grad_norm": 0.3940646520552309,
      "learning_rate": 4.7833620997557895e-05,
      "loss": 1.699,
      "num_input_tokens_seen": 11948616832,
      "step": 15187
    },
    {
      "epoch": 1.6112879270103968,
      "grad_norm": 0.41636117212410817,
      "learning_rate": 4.7833338006508525e-05,
      "loss": 1.8071,
      "num_input_tokens_seen": 11949403632,
      "step": 15188
    },
    {
      "epoch": 1.6113940165499683,
      "grad_norm": 0.5757101969549347,
      "learning_rate": 4.783305499781423e-05,
      "loss": 1.6966,
      "num_input_tokens_seen": 11950190384,
      "step": 15189
    },
    {
      "epoch": 1.6115001060895395,
      "grad_norm": 0.45140818362416896,
      "learning_rate": 4.783277197147522e-05,
      "loss": 1.7323,
      "num_input_tokens_seen": 11950977248,
      "step": 15190
    },
    {
      "epoch": 1.611606195629111,
      "grad_norm": 0.5313776083831808,
      "learning_rate": 4.783248892749171e-05,
      "loss": 1.8815,
      "num_input_tokens_seen": 11951763952,
      "step": 15191
    },
    {
      "epoch": 1.6117122851686823,
      "grad_norm": 0.3834844458493479,
      "learning_rate": 4.7832205865863926e-05,
      "loss": 1.6898,
      "num_input_tokens_seen": 11952550624,
      "step": 15192
    },
    {
      "epoch": 1.6118183747082537,
      "grad_norm": 0.41478400956494765,
      "learning_rate": 4.783192278659209e-05,
      "loss": 1.7346,
      "num_input_tokens_seen": 11953337344,
      "step": 15193
    },
    {
      "epoch": 1.6119244642478252,
      "grad_norm": 0.5170898086599338,
      "learning_rate": 4.78316396896764e-05,
      "loss": 1.7048,
      "num_input_tokens_seen": 11954124192,
      "step": 15194
    },
    {
      "epoch": 1.6120305537873967,
      "grad_norm": 0.45246812264962577,
      "learning_rate": 4.783135657511709e-05,
      "loss": 1.7599,
      "num_input_tokens_seen": 11954910960,
      "step": 15195
    },
    {
      "epoch": 1.612136643326968,
      "grad_norm": 0.485715014171527,
      "learning_rate": 4.7831073442914385e-05,
      "loss": 1.7832,
      "num_input_tokens_seen": 11955697712,
      "step": 15196
    },
    {
      "epoch": 1.6122427328665394,
      "grad_norm": 0.7515977013222629,
      "learning_rate": 4.7830790293068496e-05,
      "loss": 1.6968,
      "num_input_tokens_seen": 11956484480,
      "step": 15197
    },
    {
      "epoch": 1.6123488224061107,
      "grad_norm": 0.7718984910612612,
      "learning_rate": 4.783050712557964e-05,
      "loss": 1.6817,
      "num_input_tokens_seen": 11957271296,
      "step": 15198
    },
    {
      "epoch": 1.6124549119456821,
      "grad_norm": 0.44176919681101656,
      "learning_rate": 4.7830223940448035e-05,
      "loss": 1.8264,
      "num_input_tokens_seen": 11958058080,
      "step": 15199
    },
    {
      "epoch": 1.6125610014852536,
      "grad_norm": 0.5113308366338416,
      "learning_rate": 4.782994073767391e-05,
      "loss": 1.7388,
      "num_input_tokens_seen": 11958844848,
      "step": 15200
    },
    {
      "epoch": 1.612667091024825,
      "grad_norm": 0.5452775567813498,
      "learning_rate": 4.782965751725748e-05,
      "loss": 1.6869,
      "num_input_tokens_seen": 11959631632,
      "step": 15201
    },
    {
      "epoch": 1.6127731805643963,
      "grad_norm": 0.491572723457686,
      "learning_rate": 4.782937427919895e-05,
      "loss": 1.7601,
      "num_input_tokens_seen": 11960418448,
      "step": 15202
    },
    {
      "epoch": 1.6128792701039676,
      "grad_norm": 0.3810235464053816,
      "learning_rate": 4.782909102349855e-05,
      "loss": 1.5969,
      "num_input_tokens_seen": 11961205264,
      "step": 15203
    },
    {
      "epoch": 1.612985359643539,
      "grad_norm": 0.4695643100609002,
      "learning_rate": 4.78288077501565e-05,
      "loss": 1.693,
      "num_input_tokens_seen": 11961992032,
      "step": 15204
    },
    {
      "epoch": 1.6130914491831105,
      "grad_norm": 0.3594704482223804,
      "learning_rate": 4.782852445917302e-05,
      "loss": 1.8594,
      "num_input_tokens_seen": 11962778768,
      "step": 15205
    },
    {
      "epoch": 1.613197538722682,
      "grad_norm": 0.5296164623376395,
      "learning_rate": 4.7828241150548325e-05,
      "loss": 1.7097,
      "num_input_tokens_seen": 11963565424,
      "step": 15206
    },
    {
      "epoch": 1.6133036282622535,
      "grad_norm": 0.4699943577747466,
      "learning_rate": 4.782795782428263e-05,
      "loss": 1.695,
      "num_input_tokens_seen": 11964352256,
      "step": 15207
    },
    {
      "epoch": 1.6134097178018247,
      "grad_norm": 0.48746337208639906,
      "learning_rate": 4.782767448037617e-05,
      "loss": 1.7888,
      "num_input_tokens_seen": 11965139072,
      "step": 15208
    },
    {
      "epoch": 1.613515807341396,
      "grad_norm": 0.5574386910796291,
      "learning_rate": 4.7827391118829145e-05,
      "loss": 1.8624,
      "num_input_tokens_seen": 11965925792,
      "step": 15209
    },
    {
      "epoch": 1.6136218968809675,
      "grad_norm": 0.5273112328574913,
      "learning_rate": 4.782710773964179e-05,
      "loss": 1.9276,
      "num_input_tokens_seen": 11966712528,
      "step": 15210
    },
    {
      "epoch": 1.613727986420539,
      "grad_norm": 0.5804259621277025,
      "learning_rate": 4.7826824342814305e-05,
      "loss": 1.7394,
      "num_input_tokens_seen": 11967499328,
      "step": 15211
    },
    {
      "epoch": 1.6138340759601104,
      "grad_norm": 0.4039654848437118,
      "learning_rate": 4.782654092834692e-05,
      "loss": 1.7164,
      "num_input_tokens_seen": 11968286128,
      "step": 15212
    },
    {
      "epoch": 1.613940165499682,
      "grad_norm": 0.5270089383102311,
      "learning_rate": 4.782625749623986e-05,
      "loss": 1.8122,
      "num_input_tokens_seen": 11969072832,
      "step": 15213
    },
    {
      "epoch": 1.6140462550392531,
      "grad_norm": 0.5176749741837282,
      "learning_rate": 4.7825974046493335e-05,
      "loss": 1.6685,
      "num_input_tokens_seen": 11969859616,
      "step": 15214
    },
    {
      "epoch": 1.6141523445788244,
      "grad_norm": 0.44253812843036583,
      "learning_rate": 4.782569057910756e-05,
      "loss": 1.8712,
      "num_input_tokens_seen": 11970646416,
      "step": 15215
    },
    {
      "epoch": 1.6142584341183959,
      "grad_norm": 0.5094008301755769,
      "learning_rate": 4.782540709408277e-05,
      "loss": 1.7006,
      "num_input_tokens_seen": 11971433264,
      "step": 15216
    },
    {
      "epoch": 1.6143645236579673,
      "grad_norm": 0.48215762400283924,
      "learning_rate": 4.782512359141918e-05,
      "loss": 1.7873,
      "num_input_tokens_seen": 11972220032,
      "step": 15217
    },
    {
      "epoch": 1.6144706131975388,
      "grad_norm": 0.549035920404916,
      "learning_rate": 4.7824840071117e-05,
      "loss": 1.7022,
      "num_input_tokens_seen": 11973006832,
      "step": 15218
    },
    {
      "epoch": 1.61457670273711,
      "grad_norm": 0.38566822862984734,
      "learning_rate": 4.782455653317645e-05,
      "loss": 1.7778,
      "num_input_tokens_seen": 11973793600,
      "step": 15219
    },
    {
      "epoch": 1.6146827922766815,
      "grad_norm": 0.34475086905661867,
      "learning_rate": 4.782427297759775e-05,
      "loss": 1.5842,
      "num_input_tokens_seen": 11974580448,
      "step": 15220
    },
    {
      "epoch": 1.6147888818162528,
      "grad_norm": 0.49744548755078877,
      "learning_rate": 4.782398940438113e-05,
      "loss": 1.8901,
      "num_input_tokens_seen": 11975367120,
      "step": 15221
    },
    {
      "epoch": 1.6148949713558243,
      "grad_norm": 0.40323653535085735,
      "learning_rate": 4.78237058135268e-05,
      "loss": 1.8892,
      "num_input_tokens_seen": 11976153888,
      "step": 15222
    },
    {
      "epoch": 1.6150010608953957,
      "grad_norm": 0.46001956412571315,
      "learning_rate": 4.782342220503497e-05,
      "loss": 1.744,
      "num_input_tokens_seen": 11976940704,
      "step": 15223
    },
    {
      "epoch": 1.6151071504349672,
      "grad_norm": 0.5513370157271728,
      "learning_rate": 4.782313857890588e-05,
      "loss": 1.7396,
      "num_input_tokens_seen": 11977727504,
      "step": 15224
    },
    {
      "epoch": 1.6152132399745385,
      "grad_norm": 0.40978073609351273,
      "learning_rate": 4.7822854935139736e-05,
      "loss": 1.6839,
      "num_input_tokens_seen": 11978514208,
      "step": 15225
    },
    {
      "epoch": 1.61531932951411,
      "grad_norm": 0.561554295928013,
      "learning_rate": 4.782257127373675e-05,
      "loss": 1.7478,
      "num_input_tokens_seen": 11979301104,
      "step": 15226
    },
    {
      "epoch": 1.6154254190536812,
      "grad_norm": 0.4151280701850361,
      "learning_rate": 4.782228759469716e-05,
      "loss": 1.8085,
      "num_input_tokens_seen": 11980087968,
      "step": 15227
    },
    {
      "epoch": 1.6155315085932527,
      "grad_norm": 0.4966736582134437,
      "learning_rate": 4.782200389802117e-05,
      "loss": 1.6999,
      "num_input_tokens_seen": 11980874752,
      "step": 15228
    },
    {
      "epoch": 1.6156375981328241,
      "grad_norm": 0.41655610860288567,
      "learning_rate": 4.782172018370901e-05,
      "loss": 1.9473,
      "num_input_tokens_seen": 11981661552,
      "step": 15229
    },
    {
      "epoch": 1.6157436876723956,
      "grad_norm": 0.4066460007388335,
      "learning_rate": 4.782143645176089e-05,
      "loss": 1.8263,
      "num_input_tokens_seen": 11982448240,
      "step": 15230
    },
    {
      "epoch": 1.6158497772119669,
      "grad_norm": 0.5171899224413886,
      "learning_rate": 4.782115270217704e-05,
      "loss": 1.8673,
      "num_input_tokens_seen": 11983234944,
      "step": 15231
    },
    {
      "epoch": 1.6159558667515384,
      "grad_norm": 0.3864734365070079,
      "learning_rate": 4.782086893495767e-05,
      "loss": 1.6181,
      "num_input_tokens_seen": 11984021760,
      "step": 15232
    },
    {
      "epoch": 1.6160619562911096,
      "grad_norm": 0.46310669144190336,
      "learning_rate": 4.7820585150103007e-05,
      "loss": 1.7912,
      "num_input_tokens_seen": 11984808464,
      "step": 15233
    },
    {
      "epoch": 1.616168045830681,
      "grad_norm": 0.4072980063316249,
      "learning_rate": 4.782030134761325e-05,
      "loss": 1.7281,
      "num_input_tokens_seen": 11985595216,
      "step": 15234
    },
    {
      "epoch": 1.6162741353702526,
      "grad_norm": 0.4623864554866107,
      "learning_rate": 4.782001752748865e-05,
      "loss": 1.8816,
      "num_input_tokens_seen": 11986382000,
      "step": 15235
    },
    {
      "epoch": 1.616380224909824,
      "grad_norm": 0.3696526211335867,
      "learning_rate": 4.78197336897294e-05,
      "loss": 1.7641,
      "num_input_tokens_seen": 11987168656,
      "step": 15236
    },
    {
      "epoch": 1.6164863144493953,
      "grad_norm": 0.39579325513807306,
      "learning_rate": 4.7819449834335726e-05,
      "loss": 1.6803,
      "num_input_tokens_seen": 11987955424,
      "step": 15237
    },
    {
      "epoch": 1.6165924039889665,
      "grad_norm": 0.3458540330617328,
      "learning_rate": 4.781916596130786e-05,
      "loss": 1.7167,
      "num_input_tokens_seen": 11988742144,
      "step": 15238
    },
    {
      "epoch": 1.616698493528538,
      "grad_norm": 0.3274655455529891,
      "learning_rate": 4.781888207064601e-05,
      "loss": 1.802,
      "num_input_tokens_seen": 11989528928,
      "step": 15239
    },
    {
      "epoch": 1.6168045830681095,
      "grad_norm": 0.3805390564815541,
      "learning_rate": 4.7818598162350396e-05,
      "loss": 1.8641,
      "num_input_tokens_seen": 11990315712,
      "step": 15240
    },
    {
      "epoch": 1.616910672607681,
      "grad_norm": 0.35335667358231915,
      "learning_rate": 4.781831423642124e-05,
      "loss": 1.7958,
      "num_input_tokens_seen": 11991102448,
      "step": 15241
    },
    {
      "epoch": 1.6170167621472524,
      "grad_norm": 0.39653113692986197,
      "learning_rate": 4.781803029285876e-05,
      "loss": 1.7545,
      "num_input_tokens_seen": 11991889120,
      "step": 15242
    },
    {
      "epoch": 1.6171228516868237,
      "grad_norm": 0.38051085985339855,
      "learning_rate": 4.781774633166318e-05,
      "loss": 1.6672,
      "num_input_tokens_seen": 11992676016,
      "step": 15243
    },
    {
      "epoch": 1.617228941226395,
      "grad_norm": 0.38230488818589714,
      "learning_rate": 4.781746235283471e-05,
      "loss": 1.6211,
      "num_input_tokens_seen": 11993462768,
      "step": 15244
    },
    {
      "epoch": 1.6173350307659664,
      "grad_norm": 0.42202172281820605,
      "learning_rate": 4.781717835637357e-05,
      "loss": 1.7759,
      "num_input_tokens_seen": 11994249536,
      "step": 15245
    },
    {
      "epoch": 1.6174411203055379,
      "grad_norm": 0.411435216085599,
      "learning_rate": 4.781689434227999e-05,
      "loss": 1.8043,
      "num_input_tokens_seen": 11995036272,
      "step": 15246
    },
    {
      "epoch": 1.6175472098451094,
      "grad_norm": 0.5303152248560645,
      "learning_rate": 4.781661031055419e-05,
      "loss": 1.847,
      "num_input_tokens_seen": 11995823040,
      "step": 15247
    },
    {
      "epoch": 1.6176532993846808,
      "grad_norm": 0.3800986606845126,
      "learning_rate": 4.781632626119637e-05,
      "loss": 1.6838,
      "num_input_tokens_seen": 11996609872,
      "step": 15248
    },
    {
      "epoch": 1.617759388924252,
      "grad_norm": 0.3670803952205493,
      "learning_rate": 4.7816042194206765e-05,
      "loss": 1.6792,
      "num_input_tokens_seen": 11997396640,
      "step": 15249
    },
    {
      "epoch": 1.6178654784638233,
      "grad_norm": 0.467474035054995,
      "learning_rate": 4.78157581095856e-05,
      "loss": 1.8171,
      "num_input_tokens_seen": 11998183376,
      "step": 15250
    },
    {
      "epoch": 1.6179715680033948,
      "grad_norm": 0.39034640144537686,
      "learning_rate": 4.781547400733308e-05,
      "loss": 1.8059,
      "num_input_tokens_seen": 11998970048,
      "step": 15251
    },
    {
      "epoch": 1.6180776575429663,
      "grad_norm": 0.4047076127229938,
      "learning_rate": 4.7815189887449435e-05,
      "loss": 1.6478,
      "num_input_tokens_seen": 11999756832,
      "step": 15252
    },
    {
      "epoch": 1.6181837470825378,
      "grad_norm": 0.5059908516004334,
      "learning_rate": 4.781490574993488e-05,
      "loss": 1.8122,
      "num_input_tokens_seen": 12000543632,
      "step": 15253
    },
    {
      "epoch": 1.618289836622109,
      "grad_norm": 0.38067009081769343,
      "learning_rate": 4.781462159478963e-05,
      "loss": 1.8341,
      "num_input_tokens_seen": 12001330416,
      "step": 15254
    },
    {
      "epoch": 1.6183959261616805,
      "grad_norm": 0.38980621068553933,
      "learning_rate": 4.781433742201392e-05,
      "loss": 1.6789,
      "num_input_tokens_seen": 12002117200,
      "step": 15255
    },
    {
      "epoch": 1.6185020157012517,
      "grad_norm": 0.36084037670823677,
      "learning_rate": 4.781405323160795e-05,
      "loss": 1.6493,
      "num_input_tokens_seen": 12002903952,
      "step": 15256
    },
    {
      "epoch": 1.6186081052408232,
      "grad_norm": 0.365932484185209,
      "learning_rate": 4.781376902357195e-05,
      "loss": 1.8167,
      "num_input_tokens_seen": 12003690720,
      "step": 15257
    },
    {
      "epoch": 1.6187141947803947,
      "grad_norm": 0.38929959458591756,
      "learning_rate": 4.781348479790615e-05,
      "loss": 1.7857,
      "num_input_tokens_seen": 12004477568,
      "step": 15258
    },
    {
      "epoch": 1.6188202843199662,
      "grad_norm": 0.3783274005361858,
      "learning_rate": 4.781320055461075e-05,
      "loss": 1.6469,
      "num_input_tokens_seen": 12005264320,
      "step": 15259
    },
    {
      "epoch": 1.6189263738595374,
      "grad_norm": 0.39997454195746807,
      "learning_rate": 4.7812916293685975e-05,
      "loss": 1.7903,
      "num_input_tokens_seen": 12006051088,
      "step": 15260
    },
    {
      "epoch": 1.619032463399109,
      "grad_norm": 0.3919882609476935,
      "learning_rate": 4.7812632015132045e-05,
      "loss": 1.8345,
      "num_input_tokens_seen": 12006837760,
      "step": 15261
    },
    {
      "epoch": 1.6191385529386801,
      "grad_norm": 0.3541922972991155,
      "learning_rate": 4.781234771894919e-05,
      "loss": 1.6514,
      "num_input_tokens_seen": 12007624592,
      "step": 15262
    },
    {
      "epoch": 1.6192446424782516,
      "grad_norm": 0.3353102813372463,
      "learning_rate": 4.781206340513762e-05,
      "loss": 1.7038,
      "num_input_tokens_seen": 12008411392,
      "step": 15263
    },
    {
      "epoch": 1.619350732017823,
      "grad_norm": 0.4274879312268349,
      "learning_rate": 4.781177907369756e-05,
      "loss": 1.737,
      "num_input_tokens_seen": 12009198128,
      "step": 15264
    },
    {
      "epoch": 1.6194568215573946,
      "grad_norm": 0.34032961732106154,
      "learning_rate": 4.781149472462922e-05,
      "loss": 1.6871,
      "num_input_tokens_seen": 12009984944,
      "step": 15265
    },
    {
      "epoch": 1.6195629110969658,
      "grad_norm": 0.37513475368503607,
      "learning_rate": 4.781121035793283e-05,
      "loss": 1.8239,
      "num_input_tokens_seen": 12010771744,
      "step": 15266
    },
    {
      "epoch": 1.6196690006365373,
      "grad_norm": 0.46793784543024397,
      "learning_rate": 4.78109259736086e-05,
      "loss": 1.7399,
      "num_input_tokens_seen": 12011558464,
      "step": 15267
    },
    {
      "epoch": 1.6197750901761085,
      "grad_norm": 0.43150689254900604,
      "learning_rate": 4.781064157165677e-05,
      "loss": 1.7969,
      "num_input_tokens_seen": 12012345232,
      "step": 15268
    },
    {
      "epoch": 1.61988117971568,
      "grad_norm": 0.3806761020263657,
      "learning_rate": 4.781035715207754e-05,
      "loss": 1.7438,
      "num_input_tokens_seen": 12013131952,
      "step": 15269
    },
    {
      "epoch": 1.6199872692552515,
      "grad_norm": 0.5049040705003596,
      "learning_rate": 4.781007271487112e-05,
      "loss": 1.7409,
      "num_input_tokens_seen": 12013918656,
      "step": 15270
    },
    {
      "epoch": 1.620093358794823,
      "grad_norm": 0.3877478875651838,
      "learning_rate": 4.780978826003776e-05,
      "loss": 1.9761,
      "num_input_tokens_seen": 12014705456,
      "step": 15271
    },
    {
      "epoch": 1.6201994483343942,
      "grad_norm": 0.6547923866851761,
      "learning_rate": 4.780950378757766e-05,
      "loss": 1.8159,
      "num_input_tokens_seen": 12015492240,
      "step": 15272
    },
    {
      "epoch": 1.6203055378739655,
      "grad_norm": 0.3544129922353586,
      "learning_rate": 4.780921929749105e-05,
      "loss": 1.6704,
      "num_input_tokens_seen": 12016279120,
      "step": 15273
    },
    {
      "epoch": 1.620411627413537,
      "grad_norm": 0.592702695722079,
      "learning_rate": 4.780893478977814e-05,
      "loss": 1.672,
      "num_input_tokens_seen": 12017065952,
      "step": 15274
    },
    {
      "epoch": 1.6205177169531084,
      "grad_norm": 0.4010212662000794,
      "learning_rate": 4.780865026443915e-05,
      "loss": 1.7524,
      "num_input_tokens_seen": 12017852656,
      "step": 15275
    },
    {
      "epoch": 1.62062380649268,
      "grad_norm": 0.5124514669875566,
      "learning_rate": 4.780836572147431e-05,
      "loss": 1.7044,
      "num_input_tokens_seen": 12018639456,
      "step": 15276
    },
    {
      "epoch": 1.6207298960322514,
      "grad_norm": 0.3572501536481662,
      "learning_rate": 4.7808081160883834e-05,
      "loss": 1.6644,
      "num_input_tokens_seen": 12019426256,
      "step": 15277
    },
    {
      "epoch": 1.6208359855718226,
      "grad_norm": 0.44364142473858437,
      "learning_rate": 4.780779658266794e-05,
      "loss": 1.6246,
      "num_input_tokens_seen": 12020213024,
      "step": 15278
    },
    {
      "epoch": 1.6209420751113939,
      "grad_norm": 0.38040403322599575,
      "learning_rate": 4.780751198682686e-05,
      "loss": 1.7061,
      "num_input_tokens_seen": 12020999776,
      "step": 15279
    },
    {
      "epoch": 1.6210481646509654,
      "grad_norm": 0.4380885533938015,
      "learning_rate": 4.78072273733608e-05,
      "loss": 1.7797,
      "num_input_tokens_seen": 12021786512,
      "step": 15280
    },
    {
      "epoch": 1.6211542541905368,
      "grad_norm": 0.7310464170432552,
      "learning_rate": 4.7806942742269974e-05,
      "loss": 1.8163,
      "num_input_tokens_seen": 12022573280,
      "step": 15281
    },
    {
      "epoch": 1.6212603437301083,
      "grad_norm": 0.3086518049186749,
      "learning_rate": 4.7806658093554616e-05,
      "loss": 1.5893,
      "num_input_tokens_seen": 12023359968,
      "step": 15282
    },
    {
      "epoch": 1.6213664332696798,
      "grad_norm": 0.5088541518091219,
      "learning_rate": 4.780637342721495e-05,
      "loss": 1.7659,
      "num_input_tokens_seen": 12024146720,
      "step": 15283
    },
    {
      "epoch": 1.621472522809251,
      "grad_norm": 0.5327334285579952,
      "learning_rate": 4.7806088743251174e-05,
      "loss": 1.6959,
      "num_input_tokens_seen": 12024933488,
      "step": 15284
    },
    {
      "epoch": 1.6215786123488223,
      "grad_norm": 0.40492451216862424,
      "learning_rate": 4.7805804041663524e-05,
      "loss": 1.7981,
      "num_input_tokens_seen": 12025720224,
      "step": 15285
    },
    {
      "epoch": 1.6216847018883938,
      "grad_norm": 0.590394130270392,
      "learning_rate": 4.780551932245223e-05,
      "loss": 1.8981,
      "num_input_tokens_seen": 12026506832,
      "step": 15286
    },
    {
      "epoch": 1.6217907914279652,
      "grad_norm": 0.4147402674840784,
      "learning_rate": 4.780523458561749e-05,
      "loss": 1.6966,
      "num_input_tokens_seen": 12027293664,
      "step": 15287
    },
    {
      "epoch": 1.6218968809675367,
      "grad_norm": 0.3311927850576586,
      "learning_rate": 4.780494983115954e-05,
      "loss": 1.6764,
      "num_input_tokens_seen": 12028080496,
      "step": 15288
    },
    {
      "epoch": 1.622002970507108,
      "grad_norm": 0.4823624422481432,
      "learning_rate": 4.780466505907859e-05,
      "loss": 1.7059,
      "num_input_tokens_seen": 12028867232,
      "step": 15289
    },
    {
      "epoch": 1.6221090600466794,
      "grad_norm": 0.4279721430893703,
      "learning_rate": 4.780438026937486e-05,
      "loss": 1.7065,
      "num_input_tokens_seen": 12029653872,
      "step": 15290
    },
    {
      "epoch": 1.6222151495862507,
      "grad_norm": 0.3673166994809343,
      "learning_rate": 4.780409546204858e-05,
      "loss": 1.7482,
      "num_input_tokens_seen": 12030440544,
      "step": 15291
    },
    {
      "epoch": 1.6223212391258222,
      "grad_norm": 0.499031268974372,
      "learning_rate": 4.7803810637099963e-05,
      "loss": 1.8444,
      "num_input_tokens_seen": 12031227296,
      "step": 15292
    },
    {
      "epoch": 1.6224273286653936,
      "grad_norm": 0.415133561887717,
      "learning_rate": 4.780352579452923e-05,
      "loss": 1.6786,
      "num_input_tokens_seen": 12032014000,
      "step": 15293
    },
    {
      "epoch": 1.622533418204965,
      "grad_norm": 0.4233663006525139,
      "learning_rate": 4.78032409343366e-05,
      "loss": 1.6461,
      "num_input_tokens_seen": 12032800736,
      "step": 15294
    },
    {
      "epoch": 1.6226395077445364,
      "grad_norm": 0.4999726630351411,
      "learning_rate": 4.7802956056522294e-05,
      "loss": 1.8087,
      "num_input_tokens_seen": 12033587456,
      "step": 15295
    },
    {
      "epoch": 1.6227455972841078,
      "grad_norm": 0.47948071471384296,
      "learning_rate": 4.780267116108654e-05,
      "loss": 1.7217,
      "num_input_tokens_seen": 12034374240,
      "step": 15296
    },
    {
      "epoch": 1.622851686823679,
      "grad_norm": 0.48716066028234806,
      "learning_rate": 4.780238624802954e-05,
      "loss": 1.6999,
      "num_input_tokens_seen": 12035161008,
      "step": 15297
    },
    {
      "epoch": 1.6229577763632506,
      "grad_norm": 0.44978171627276975,
      "learning_rate": 4.7802101317351536e-05,
      "loss": 1.7475,
      "num_input_tokens_seen": 12035947792,
      "step": 15298
    },
    {
      "epoch": 1.623063865902822,
      "grad_norm": 0.42940953228940765,
      "learning_rate": 4.7801816369052734e-05,
      "loss": 1.712,
      "num_input_tokens_seen": 12036734512,
      "step": 15299
    },
    {
      "epoch": 1.6231699554423935,
      "grad_norm": 0.3969766910815427,
      "learning_rate": 4.780153140313335e-05,
      "loss": 1.733,
      "num_input_tokens_seen": 12037521328,
      "step": 15300
    },
    {
      "epoch": 1.6232760449819648,
      "grad_norm": 0.4066567329993059,
      "learning_rate": 4.780124641959362e-05,
      "loss": 1.723,
      "num_input_tokens_seen": 12038308096,
      "step": 15301
    },
    {
      "epoch": 1.623382134521536,
      "grad_norm": 0.43269318883117125,
      "learning_rate": 4.7800961418433746e-05,
      "loss": 1.7665,
      "num_input_tokens_seen": 12039094848,
      "step": 15302
    },
    {
      "epoch": 1.6234882240611075,
      "grad_norm": 0.40799261370417217,
      "learning_rate": 4.780067639965396e-05,
      "loss": 1.7254,
      "num_input_tokens_seen": 12039881584,
      "step": 15303
    },
    {
      "epoch": 1.623594313600679,
      "grad_norm": 0.4055264286171035,
      "learning_rate": 4.780039136325449e-05,
      "loss": 1.8338,
      "num_input_tokens_seen": 12040668272,
      "step": 15304
    },
    {
      "epoch": 1.6237004031402504,
      "grad_norm": 0.3591057285294806,
      "learning_rate": 4.780010630923554e-05,
      "loss": 1.7014,
      "num_input_tokens_seen": 12041454976,
      "step": 15305
    },
    {
      "epoch": 1.623806492679822,
      "grad_norm": 0.33832629779119183,
      "learning_rate": 4.779982123759734e-05,
      "loss": 1.6164,
      "num_input_tokens_seen": 12042241712,
      "step": 15306
    },
    {
      "epoch": 1.6239125822193932,
      "grad_norm": 0.3529267917778138,
      "learning_rate": 4.779953614834011e-05,
      "loss": 1.6848,
      "num_input_tokens_seen": 12043028368,
      "step": 15307
    },
    {
      "epoch": 1.6240186717589644,
      "grad_norm": 0.46761284977408996,
      "learning_rate": 4.779925104146405e-05,
      "loss": 1.8637,
      "num_input_tokens_seen": 12043815120,
      "step": 15308
    },
    {
      "epoch": 1.624124761298536,
      "grad_norm": 0.4179479353998879,
      "learning_rate": 4.779896591696942e-05,
      "loss": 1.9536,
      "num_input_tokens_seen": 12044601856,
      "step": 15309
    },
    {
      "epoch": 1.6242308508381074,
      "grad_norm": 0.4389338613407482,
      "learning_rate": 4.77986807748564e-05,
      "loss": 1.7749,
      "num_input_tokens_seen": 12045388608,
      "step": 15310
    },
    {
      "epoch": 1.6243369403776788,
      "grad_norm": 0.3811974624787535,
      "learning_rate": 4.779839561512524e-05,
      "loss": 1.7755,
      "num_input_tokens_seen": 12046175376,
      "step": 15311
    },
    {
      "epoch": 1.6244430299172503,
      "grad_norm": 0.392844363562356,
      "learning_rate": 4.7798110437776144e-05,
      "loss": 1.7079,
      "num_input_tokens_seen": 12046962160,
      "step": 15312
    },
    {
      "epoch": 1.6245491194568216,
      "grad_norm": 0.4080652174253672,
      "learning_rate": 4.779782524280934e-05,
      "loss": 1.7094,
      "num_input_tokens_seen": 12047748912,
      "step": 15313
    },
    {
      "epoch": 1.6246552089963928,
      "grad_norm": 0.3668025267997859,
      "learning_rate": 4.779754003022505e-05,
      "loss": 1.7249,
      "num_input_tokens_seen": 12048535680,
      "step": 15314
    },
    {
      "epoch": 1.6247612985359643,
      "grad_norm": 0.40923545094196573,
      "learning_rate": 4.7797254800023484e-05,
      "loss": 1.824,
      "num_input_tokens_seen": 12049322432,
      "step": 15315
    },
    {
      "epoch": 1.6248673880755358,
      "grad_norm": 0.39875227787061995,
      "learning_rate": 4.779696955220486e-05,
      "loss": 1.817,
      "num_input_tokens_seen": 12050109120,
      "step": 15316
    },
    {
      "epoch": 1.6249734776151072,
      "grad_norm": 0.36100222608208293,
      "learning_rate": 4.779668428676942e-05,
      "loss": 1.7485,
      "num_input_tokens_seen": 12050895840,
      "step": 15317
    },
    {
      "epoch": 1.6250795671546785,
      "grad_norm": 0.4249259879437404,
      "learning_rate": 4.779639900371736e-05,
      "loss": 1.7536,
      "num_input_tokens_seen": 12051682560,
      "step": 15318
    },
    {
      "epoch": 1.62518565669425,
      "grad_norm": 0.384066830575856,
      "learning_rate": 4.779611370304893e-05,
      "loss": 1.742,
      "num_input_tokens_seen": 12052469280,
      "step": 15319
    },
    {
      "epoch": 1.6252917462338212,
      "grad_norm": 0.5173370996648967,
      "learning_rate": 4.779582838476432e-05,
      "loss": 1.797,
      "num_input_tokens_seen": 12053256016,
      "step": 15320
    },
    {
      "epoch": 1.6253978357733927,
      "grad_norm": 0.42318471858185785,
      "learning_rate": 4.7795543048863756e-05,
      "loss": 1.7679,
      "num_input_tokens_seen": 12054042720,
      "step": 15321
    },
    {
      "epoch": 1.6255039253129642,
      "grad_norm": 0.5260581608356427,
      "learning_rate": 4.7795257695347475e-05,
      "loss": 1.6849,
      "num_input_tokens_seen": 12054829408,
      "step": 15322
    },
    {
      "epoch": 1.6256100148525356,
      "grad_norm": 0.40053752191251507,
      "learning_rate": 4.7794972324215687e-05,
      "loss": 1.6734,
      "num_input_tokens_seen": 12055616256,
      "step": 15323
    },
    {
      "epoch": 1.625716104392107,
      "grad_norm": 0.7790673226930698,
      "learning_rate": 4.7794686935468615e-05,
      "loss": 1.7765,
      "num_input_tokens_seen": 12056403120,
      "step": 15324
    },
    {
      "epoch": 1.6258221939316784,
      "grad_norm": 0.399182878468037,
      "learning_rate": 4.779440152910647e-05,
      "loss": 1.7098,
      "num_input_tokens_seen": 12057189776,
      "step": 15325
    },
    {
      "epoch": 1.6259282834712496,
      "grad_norm": 0.503419770253065,
      "learning_rate": 4.779411610512948e-05,
      "loss": 1.7172,
      "num_input_tokens_seen": 12057976640,
      "step": 15326
    },
    {
      "epoch": 1.626034373010821,
      "grad_norm": 0.4473866939016332,
      "learning_rate": 4.7793830663537874e-05,
      "loss": 1.7176,
      "num_input_tokens_seen": 12058763440,
      "step": 15327
    },
    {
      "epoch": 1.6261404625503926,
      "grad_norm": 0.44321698189895736,
      "learning_rate": 4.779354520433186e-05,
      "loss": 1.7177,
      "num_input_tokens_seen": 12059550224,
      "step": 15328
    },
    {
      "epoch": 1.626246552089964,
      "grad_norm": 0.5805845397573195,
      "learning_rate": 4.779325972751166e-05,
      "loss": 1.6829,
      "num_input_tokens_seen": 12060336976,
      "step": 15329
    },
    {
      "epoch": 1.6263526416295353,
      "grad_norm": 0.44505794639337687,
      "learning_rate": 4.7792974233077504e-05,
      "loss": 1.7437,
      "num_input_tokens_seen": 12061123824,
      "step": 15330
    },
    {
      "epoch": 1.6264587311691068,
      "grad_norm": 0.6466620861077553,
      "learning_rate": 4.779268872102961e-05,
      "loss": 1.6841,
      "num_input_tokens_seen": 12061910624,
      "step": 15331
    },
    {
      "epoch": 1.626564820708678,
      "grad_norm": 0.4933557993793959,
      "learning_rate": 4.7792403191368183e-05,
      "loss": 1.6524,
      "num_input_tokens_seen": 12062697440,
      "step": 15332
    },
    {
      "epoch": 1.6266709102482495,
      "grad_norm": 0.4848692905006054,
      "learning_rate": 4.779211764409347e-05,
      "loss": 1.8224,
      "num_input_tokens_seen": 12063484160,
      "step": 15333
    },
    {
      "epoch": 1.626776999787821,
      "grad_norm": 0.3869214174895366,
      "learning_rate": 4.7791832079205664e-05,
      "loss": 1.7446,
      "num_input_tokens_seen": 12064270960,
      "step": 15334
    },
    {
      "epoch": 1.6268830893273925,
      "grad_norm": 0.4075926300820155,
      "learning_rate": 4.7791546496705e-05,
      "loss": 1.6465,
      "num_input_tokens_seen": 12065057680,
      "step": 15335
    },
    {
      "epoch": 1.6269891788669637,
      "grad_norm": 0.440015608010052,
      "learning_rate": 4.779126089659171e-05,
      "loss": 1.7149,
      "num_input_tokens_seen": 12065844384,
      "step": 15336
    },
    {
      "epoch": 1.627095268406535,
      "grad_norm": 0.36785518088781116,
      "learning_rate": 4.779097527886599e-05,
      "loss": 1.6813,
      "num_input_tokens_seen": 12066631168,
      "step": 15337
    },
    {
      "epoch": 1.6272013579461064,
      "grad_norm": 0.42535904183531165,
      "learning_rate": 4.779068964352808e-05,
      "loss": 1.7331,
      "num_input_tokens_seen": 12067417936,
      "step": 15338
    },
    {
      "epoch": 1.627307447485678,
      "grad_norm": 0.34275785877678483,
      "learning_rate": 4.779040399057818e-05,
      "loss": 1.7489,
      "num_input_tokens_seen": 12068204704,
      "step": 15339
    },
    {
      "epoch": 1.6274135370252494,
      "grad_norm": 0.36267250558980724,
      "learning_rate": 4.779011832001654e-05,
      "loss": 1.7568,
      "num_input_tokens_seen": 12068991440,
      "step": 15340
    },
    {
      "epoch": 1.6275196265648209,
      "grad_norm": 0.46137412169398634,
      "learning_rate": 4.7789832631843355e-05,
      "loss": 1.7173,
      "num_input_tokens_seen": 12069778240,
      "step": 15341
    },
    {
      "epoch": 1.627625716104392,
      "grad_norm": 0.45399511639022777,
      "learning_rate": 4.7789546926058864e-05,
      "loss": 1.7192,
      "num_input_tokens_seen": 12070565056,
      "step": 15342
    },
    {
      "epoch": 1.6277318056439634,
      "grad_norm": 0.3904223481966375,
      "learning_rate": 4.7789261202663285e-05,
      "loss": 1.7487,
      "num_input_tokens_seen": 12071351840,
      "step": 15343
    },
    {
      "epoch": 1.6278378951835348,
      "grad_norm": 0.4380066828269148,
      "learning_rate": 4.778897546165682e-05,
      "loss": 1.8705,
      "num_input_tokens_seen": 12072138608,
      "step": 15344
    },
    {
      "epoch": 1.6279439847231063,
      "grad_norm": 0.41858033057585314,
      "learning_rate": 4.7788689703039706e-05,
      "loss": 1.6438,
      "num_input_tokens_seen": 12072925424,
      "step": 15345
    },
    {
      "epoch": 1.6280500742626778,
      "grad_norm": 0.3954264371921253,
      "learning_rate": 4.778840392681216e-05,
      "loss": 1.773,
      "num_input_tokens_seen": 12073712208,
      "step": 15346
    },
    {
      "epoch": 1.6281561638022493,
      "grad_norm": 0.4285559361082669,
      "learning_rate": 4.7788118132974415e-05,
      "loss": 1.8078,
      "num_input_tokens_seen": 12074499120,
      "step": 15347
    },
    {
      "epoch": 1.6282622533418205,
      "grad_norm": 0.42510646661781787,
      "learning_rate": 4.778783232152667e-05,
      "loss": 1.695,
      "num_input_tokens_seen": 12075285856,
      "step": 15348
    },
    {
      "epoch": 1.6283683428813918,
      "grad_norm": 0.49603924543288086,
      "learning_rate": 4.7787546492469166e-05,
      "loss": 1.7168,
      "num_input_tokens_seen": 12076072544,
      "step": 15349
    },
    {
      "epoch": 1.6284744324209632,
      "grad_norm": 0.4685577924378699,
      "learning_rate": 4.778726064580211e-05,
      "loss": 1.7256,
      "num_input_tokens_seen": 12076859232,
      "step": 15350
    },
    {
      "epoch": 1.6285805219605347,
      "grad_norm": 0.42036149640631487,
      "learning_rate": 4.778697478152573e-05,
      "loss": 1.6606,
      "num_input_tokens_seen": 12077646016,
      "step": 15351
    },
    {
      "epoch": 1.6286866115001062,
      "grad_norm": 0.4579120095458014,
      "learning_rate": 4.778668889964024e-05,
      "loss": 1.6968,
      "num_input_tokens_seen": 12078432848,
      "step": 15352
    },
    {
      "epoch": 1.6287927010396774,
      "grad_norm": 0.369424939905269,
      "learning_rate": 4.778640300014587e-05,
      "loss": 1.7183,
      "num_input_tokens_seen": 12079219600,
      "step": 15353
    },
    {
      "epoch": 1.628898790579249,
      "grad_norm": 0.3678388782087657,
      "learning_rate": 4.778611708304283e-05,
      "loss": 1.7012,
      "num_input_tokens_seen": 12080006400,
      "step": 15354
    },
    {
      "epoch": 1.6290048801188202,
      "grad_norm": 0.705314790884465,
      "learning_rate": 4.778583114833135e-05,
      "loss": 1.8764,
      "num_input_tokens_seen": 12080793120,
      "step": 15355
    },
    {
      "epoch": 1.6291109696583916,
      "grad_norm": 0.5157365305120375,
      "learning_rate": 4.778554519601165e-05,
      "loss": 1.7989,
      "num_input_tokens_seen": 12081579856,
      "step": 15356
    },
    {
      "epoch": 1.6292170591979631,
      "grad_norm": 0.5875919535970656,
      "learning_rate": 4.778525922608395e-05,
      "loss": 1.7413,
      "num_input_tokens_seen": 12082366608,
      "step": 15357
    },
    {
      "epoch": 1.6293231487375346,
      "grad_norm": 0.409208619726195,
      "learning_rate": 4.778497323854847e-05,
      "loss": 1.7182,
      "num_input_tokens_seen": 12083153472,
      "step": 15358
    },
    {
      "epoch": 1.6294292382771058,
      "grad_norm": 0.44043175326879874,
      "learning_rate": 4.7784687233405425e-05,
      "loss": 1.7682,
      "num_input_tokens_seen": 12083940240,
      "step": 15359
    },
    {
      "epoch": 1.6295353278166773,
      "grad_norm": 0.4244533632823572,
      "learning_rate": 4.778440121065505e-05,
      "loss": 1.6816,
      "num_input_tokens_seen": 12084726944,
      "step": 15360
    },
    {
      "epoch": 1.6296414173562486,
      "grad_norm": 0.42765414355169756,
      "learning_rate": 4.7784115170297556e-05,
      "loss": 1.7757,
      "num_input_tokens_seen": 12085513776,
      "step": 15361
    },
    {
      "epoch": 1.62974750689582,
      "grad_norm": 0.3733598150803014,
      "learning_rate": 4.7783829112333165e-05,
      "loss": 1.7441,
      "num_input_tokens_seen": 12086300480,
      "step": 15362
    },
    {
      "epoch": 1.6298535964353915,
      "grad_norm": 0.43804293784330023,
      "learning_rate": 4.77835430367621e-05,
      "loss": 1.6989,
      "num_input_tokens_seen": 12087087200,
      "step": 15363
    },
    {
      "epoch": 1.629959685974963,
      "grad_norm": 0.3596487008101858,
      "learning_rate": 4.7783256943584586e-05,
      "loss": 1.6244,
      "num_input_tokens_seen": 12087874096,
      "step": 15364
    },
    {
      "epoch": 1.6300657755145342,
      "grad_norm": 0.41096749684121175,
      "learning_rate": 4.778297083280083e-05,
      "loss": 1.7602,
      "num_input_tokens_seen": 12088660944,
      "step": 15365
    },
    {
      "epoch": 1.6301718650541057,
      "grad_norm": 0.4204393615069945,
      "learning_rate": 4.778268470441107e-05,
      "loss": 1.731,
      "num_input_tokens_seen": 12089447712,
      "step": 15366
    },
    {
      "epoch": 1.630277954593677,
      "grad_norm": 0.41185505365923375,
      "learning_rate": 4.778239855841552e-05,
      "loss": 1.7289,
      "num_input_tokens_seen": 12090234544,
      "step": 15367
    },
    {
      "epoch": 1.6303840441332484,
      "grad_norm": 0.40906902539227885,
      "learning_rate": 4.7782112394814394e-05,
      "loss": 1.7416,
      "num_input_tokens_seen": 12091021296,
      "step": 15368
    },
    {
      "epoch": 1.63049013367282,
      "grad_norm": 0.405522837875394,
      "learning_rate": 4.778182621360793e-05,
      "loss": 1.8963,
      "num_input_tokens_seen": 12091808048,
      "step": 15369
    },
    {
      "epoch": 1.6305962232123914,
      "grad_norm": 0.36511469607097846,
      "learning_rate": 4.778154001479633e-05,
      "loss": 1.814,
      "num_input_tokens_seen": 12092594752,
      "step": 15370
    },
    {
      "epoch": 1.6307023127519626,
      "grad_norm": 0.37519893917211367,
      "learning_rate": 4.778125379837983e-05,
      "loss": 1.73,
      "num_input_tokens_seen": 12093381584,
      "step": 15371
    },
    {
      "epoch": 1.630808402291534,
      "grad_norm": 0.383195222894598,
      "learning_rate": 4.7780967564358644e-05,
      "loss": 1.7998,
      "num_input_tokens_seen": 12094168288,
      "step": 15372
    },
    {
      "epoch": 1.6309144918311054,
      "grad_norm": 0.3881949398166304,
      "learning_rate": 4.778068131273299e-05,
      "loss": 1.7588,
      "num_input_tokens_seen": 12094955072,
      "step": 15373
    },
    {
      "epoch": 1.6310205813706768,
      "grad_norm": 0.3793317279231998,
      "learning_rate": 4.7780395043503104e-05,
      "loss": 1.7235,
      "num_input_tokens_seen": 12095741936,
      "step": 15374
    },
    {
      "epoch": 1.6311266709102483,
      "grad_norm": 0.36518031247420213,
      "learning_rate": 4.7780108756669184e-05,
      "loss": 1.7037,
      "num_input_tokens_seen": 12096528640,
      "step": 15375
    },
    {
      "epoch": 1.6312327604498198,
      "grad_norm": 0.4048725439113292,
      "learning_rate": 4.777982245223147e-05,
      "loss": 1.6517,
      "num_input_tokens_seen": 12097315472,
      "step": 15376
    },
    {
      "epoch": 1.631338849989391,
      "grad_norm": 0.4156289864945011,
      "learning_rate": 4.777953613019018e-05,
      "loss": 1.7528,
      "num_input_tokens_seen": 12098102288,
      "step": 15377
    },
    {
      "epoch": 1.6314449395289623,
      "grad_norm": 0.3909223052971231,
      "learning_rate": 4.777924979054553e-05,
      "loss": 1.8619,
      "num_input_tokens_seen": 12098888976,
      "step": 15378
    },
    {
      "epoch": 1.6315510290685338,
      "grad_norm": 0.42222639294722697,
      "learning_rate": 4.777896343329775e-05,
      "loss": 1.8218,
      "num_input_tokens_seen": 12099675648,
      "step": 15379
    },
    {
      "epoch": 1.6316571186081053,
      "grad_norm": 0.5012025597719105,
      "learning_rate": 4.777867705844705e-05,
      "loss": 1.8372,
      "num_input_tokens_seen": 12100462448,
      "step": 15380
    },
    {
      "epoch": 1.6317632081476767,
      "grad_norm": 0.3766433118274586,
      "learning_rate": 4.7778390665993664e-05,
      "loss": 1.8419,
      "num_input_tokens_seen": 12101249152,
      "step": 15381
    },
    {
      "epoch": 1.6318692976872482,
      "grad_norm": 0.4149727789098177,
      "learning_rate": 4.77781042559378e-05,
      "loss": 1.7645,
      "num_input_tokens_seen": 12102035968,
      "step": 15382
    },
    {
      "epoch": 1.6319753872268195,
      "grad_norm": 0.3904735783188439,
      "learning_rate": 4.777781782827968e-05,
      "loss": 1.7693,
      "num_input_tokens_seen": 12102822720,
      "step": 15383
    },
    {
      "epoch": 1.6320814767663907,
      "grad_norm": 0.43073373833173384,
      "learning_rate": 4.777753138301954e-05,
      "loss": 1.7409,
      "num_input_tokens_seen": 12103609552,
      "step": 15384
    },
    {
      "epoch": 1.6321875663059622,
      "grad_norm": 0.3745350897003675,
      "learning_rate": 4.7777244920157594e-05,
      "loss": 1.7233,
      "num_input_tokens_seen": 12104396336,
      "step": 15385
    },
    {
      "epoch": 1.6322936558455337,
      "grad_norm": 0.3911146994474559,
      "learning_rate": 4.7776958439694056e-05,
      "loss": 1.7017,
      "num_input_tokens_seen": 12105183120,
      "step": 15386
    },
    {
      "epoch": 1.6323997453851051,
      "grad_norm": 0.4207721298010618,
      "learning_rate": 4.7776671941629147e-05,
      "loss": 1.7905,
      "num_input_tokens_seen": 12105969792,
      "step": 15387
    },
    {
      "epoch": 1.6325058349246764,
      "grad_norm": 0.33454118269595584,
      "learning_rate": 4.77763854259631e-05,
      "loss": 1.7117,
      "num_input_tokens_seen": 12106756480,
      "step": 15388
    },
    {
      "epoch": 1.6326119244642479,
      "grad_norm": 0.41913243074344775,
      "learning_rate": 4.7776098892696134e-05,
      "loss": 1.8093,
      "num_input_tokens_seen": 12107543152,
      "step": 15389
    },
    {
      "epoch": 1.632718014003819,
      "grad_norm": 0.3735401680279237,
      "learning_rate": 4.7775812341828464e-05,
      "loss": 1.8838,
      "num_input_tokens_seen": 12108329856,
      "step": 15390
    },
    {
      "epoch": 1.6328241035433906,
      "grad_norm": 0.35468543024186977,
      "learning_rate": 4.777552577336031e-05,
      "loss": 1.6756,
      "num_input_tokens_seen": 12109116624,
      "step": 15391
    },
    {
      "epoch": 1.632930193082962,
      "grad_norm": 0.35497639788502067,
      "learning_rate": 4.777523918729191e-05,
      "loss": 1.7576,
      "num_input_tokens_seen": 12109903472,
      "step": 15392
    },
    {
      "epoch": 1.6330362826225335,
      "grad_norm": 0.3597804254874582,
      "learning_rate": 4.777495258362346e-05,
      "loss": 1.6807,
      "num_input_tokens_seen": 12110690256,
      "step": 15393
    },
    {
      "epoch": 1.6331423721621048,
      "grad_norm": 0.37098332487807584,
      "learning_rate": 4.77746659623552e-05,
      "loss": 1.6969,
      "num_input_tokens_seen": 12111477008,
      "step": 15394
    },
    {
      "epoch": 1.6332484617016763,
      "grad_norm": 0.3404210860960827,
      "learning_rate": 4.777437932348735e-05,
      "loss": 1.7797,
      "num_input_tokens_seen": 12112263744,
      "step": 15395
    },
    {
      "epoch": 1.6333545512412475,
      "grad_norm": 0.4060843695221112,
      "learning_rate": 4.777409266702012e-05,
      "loss": 1.903,
      "num_input_tokens_seen": 12113050576,
      "step": 15396
    },
    {
      "epoch": 1.633460640780819,
      "grad_norm": 0.3792169247814501,
      "learning_rate": 4.7773805992953746e-05,
      "loss": 1.7127,
      "num_input_tokens_seen": 12113837344,
      "step": 15397
    },
    {
      "epoch": 1.6335667303203905,
      "grad_norm": 0.36198023439394356,
      "learning_rate": 4.7773519301288445e-05,
      "loss": 1.6579,
      "num_input_tokens_seen": 12114624176,
      "step": 15398
    },
    {
      "epoch": 1.633672819859962,
      "grad_norm": 0.37024775955015693,
      "learning_rate": 4.777323259202443e-05,
      "loss": 1.8096,
      "num_input_tokens_seen": 12115410960,
      "step": 15399
    },
    {
      "epoch": 1.6337789093995332,
      "grad_norm": 0.4393897726758213,
      "learning_rate": 4.7772945865161934e-05,
      "loss": 1.7846,
      "num_input_tokens_seen": 12116197744,
      "step": 15400
    },
    {
      "epoch": 1.6338849989391044,
      "grad_norm": 0.32193496806076827,
      "learning_rate": 4.777265912070117e-05,
      "loss": 1.7666,
      "num_input_tokens_seen": 12116984560,
      "step": 15401
    },
    {
      "epoch": 1.633991088478676,
      "grad_norm": 0.6887783082777205,
      "learning_rate": 4.777237235864236e-05,
      "loss": 1.5979,
      "num_input_tokens_seen": 12117771264,
      "step": 15402
    },
    {
      "epoch": 1.6340971780182474,
      "grad_norm": 0.320911417657878,
      "learning_rate": 4.7772085578985734e-05,
      "loss": 1.731,
      "num_input_tokens_seen": 12118558000,
      "step": 15403
    },
    {
      "epoch": 1.6342032675578189,
      "grad_norm": 0.7959051563383085,
      "learning_rate": 4.7771798781731515e-05,
      "loss": 1.7458,
      "num_input_tokens_seen": 12119344784,
      "step": 15404
    },
    {
      "epoch": 1.6343093570973903,
      "grad_norm": 0.42276172836199427,
      "learning_rate": 4.777151196687991e-05,
      "loss": 1.8662,
      "num_input_tokens_seen": 12120131456,
      "step": 15405
    },
    {
      "epoch": 1.6344154466369616,
      "grad_norm": 0.6274539499947969,
      "learning_rate": 4.7771225134431145e-05,
      "loss": 1.7555,
      "num_input_tokens_seen": 12120918272,
      "step": 15406
    },
    {
      "epoch": 1.6345215361765328,
      "grad_norm": 0.5041912689827553,
      "learning_rate": 4.7770938284385455e-05,
      "loss": 1.8489,
      "num_input_tokens_seen": 12121705088,
      "step": 15407
    },
    {
      "epoch": 1.6346276257161043,
      "grad_norm": 0.7553654863886312,
      "learning_rate": 4.777065141674305e-05,
      "loss": 1.7737,
      "num_input_tokens_seen": 12122491824,
      "step": 15408
    },
    {
      "epoch": 1.6347337152556758,
      "grad_norm": 0.5473347034697152,
      "learning_rate": 4.777036453150415e-05,
      "loss": 1.734,
      "num_input_tokens_seen": 12123278624,
      "step": 15409
    },
    {
      "epoch": 1.6348398047952473,
      "grad_norm": 0.6157957733609142,
      "learning_rate": 4.7770077628668974e-05,
      "loss": 1.7495,
      "num_input_tokens_seen": 12124065424,
      "step": 15410
    },
    {
      "epoch": 1.6349458943348187,
      "grad_norm": 0.5283283605401606,
      "learning_rate": 4.776979070823776e-05,
      "loss": 1.7401,
      "num_input_tokens_seen": 12124852256,
      "step": 15411
    },
    {
      "epoch": 1.63505198387439,
      "grad_norm": 0.3808904743286608,
      "learning_rate": 4.7769503770210724e-05,
      "loss": 1.7143,
      "num_input_tokens_seen": 12125639136,
      "step": 15412
    },
    {
      "epoch": 1.6351580734139612,
      "grad_norm": 0.524278094421099,
      "learning_rate": 4.776921681458807e-05,
      "loss": 1.7645,
      "num_input_tokens_seen": 12126425808,
      "step": 15413
    },
    {
      "epoch": 1.6352641629535327,
      "grad_norm": 0.3849348572323393,
      "learning_rate": 4.776892984137004e-05,
      "loss": 1.8217,
      "num_input_tokens_seen": 12127212512,
      "step": 15414
    },
    {
      "epoch": 1.6353702524931042,
      "grad_norm": 0.35051322704159155,
      "learning_rate": 4.776864285055685e-05,
      "loss": 1.768,
      "num_input_tokens_seen": 12127999232,
      "step": 15415
    },
    {
      "epoch": 1.6354763420326757,
      "grad_norm": 0.6484147404368574,
      "learning_rate": 4.776835584214872e-05,
      "loss": 1.7143,
      "num_input_tokens_seen": 12128786000,
      "step": 15416
    },
    {
      "epoch": 1.6355824315722471,
      "grad_norm": 0.6299899536011575,
      "learning_rate": 4.776806881614587e-05,
      "loss": 1.6879,
      "num_input_tokens_seen": 12129572784,
      "step": 15417
    },
    {
      "epoch": 1.6356885211118184,
      "grad_norm": 0.6852921054432105,
      "learning_rate": 4.776778177254853e-05,
      "loss": 1.5622,
      "num_input_tokens_seen": 12130359504,
      "step": 15418
    },
    {
      "epoch": 1.6357946106513896,
      "grad_norm": 0.5109778356535093,
      "learning_rate": 4.7767494711356914e-05,
      "loss": 1.7466,
      "num_input_tokens_seen": 12131146192,
      "step": 15419
    },
    {
      "epoch": 1.6359007001909611,
      "grad_norm": 0.5526621467734739,
      "learning_rate": 4.7767207632571244e-05,
      "loss": 1.8162,
      "num_input_tokens_seen": 12131932960,
      "step": 15420
    },
    {
      "epoch": 1.6360067897305326,
      "grad_norm": 0.41458279455442026,
      "learning_rate": 4.776692053619175e-05,
      "loss": 1.729,
      "num_input_tokens_seen": 12132719664,
      "step": 15421
    },
    {
      "epoch": 1.636112879270104,
      "grad_norm": 0.4039852475221012,
      "learning_rate": 4.7766633422218644e-05,
      "loss": 1.6439,
      "num_input_tokens_seen": 12133506496,
      "step": 15422
    },
    {
      "epoch": 1.6362189688096753,
      "grad_norm": 0.5703003665664385,
      "learning_rate": 4.776634629065215e-05,
      "loss": 1.7395,
      "num_input_tokens_seen": 12134293232,
      "step": 15423
    },
    {
      "epoch": 1.6363250583492468,
      "grad_norm": 0.38814172179426804,
      "learning_rate": 4.7766059141492494e-05,
      "loss": 1.6418,
      "num_input_tokens_seen": 12135080016,
      "step": 15424
    },
    {
      "epoch": 1.636431147888818,
      "grad_norm": 0.6238427632513598,
      "learning_rate": 4.776577197473989e-05,
      "loss": 1.7647,
      "num_input_tokens_seen": 12135866720,
      "step": 15425
    },
    {
      "epoch": 1.6365372374283895,
      "grad_norm": 0.4747700814811103,
      "learning_rate": 4.776548479039457e-05,
      "loss": 1.7354,
      "num_input_tokens_seen": 12136653392,
      "step": 15426
    },
    {
      "epoch": 1.636643326967961,
      "grad_norm": 0.5045045143780095,
      "learning_rate": 4.776519758845675e-05,
      "loss": 1.869,
      "num_input_tokens_seen": 12137440176,
      "step": 15427
    },
    {
      "epoch": 1.6367494165075325,
      "grad_norm": 0.415411733471651,
      "learning_rate": 4.776491036892666e-05,
      "loss": 1.728,
      "num_input_tokens_seen": 12138227040,
      "step": 15428
    },
    {
      "epoch": 1.6368555060471037,
      "grad_norm": 0.44425527983400404,
      "learning_rate": 4.776462313180451e-05,
      "loss": 1.6297,
      "num_input_tokens_seen": 12139013792,
      "step": 15429
    },
    {
      "epoch": 1.6369615955866752,
      "grad_norm": 0.4942951060175374,
      "learning_rate": 4.776433587709052e-05,
      "loss": 1.6289,
      "num_input_tokens_seen": 12139800544,
      "step": 15430
    },
    {
      "epoch": 1.6370676851262465,
      "grad_norm": 0.39513624240785433,
      "learning_rate": 4.776404860478493e-05,
      "loss": 1.7001,
      "num_input_tokens_seen": 12140587312,
      "step": 15431
    },
    {
      "epoch": 1.637173774665818,
      "grad_norm": 0.4718767417089783,
      "learning_rate": 4.7763761314887946e-05,
      "loss": 1.69,
      "num_input_tokens_seen": 12141374016,
      "step": 15432
    },
    {
      "epoch": 1.6372798642053894,
      "grad_norm": 0.484545007873926,
      "learning_rate": 4.7763474007399795e-05,
      "loss": 1.919,
      "num_input_tokens_seen": 12142160752,
      "step": 15433
    },
    {
      "epoch": 1.6373859537449609,
      "grad_norm": 0.3891088001539982,
      "learning_rate": 4.77631866823207e-05,
      "loss": 1.7608,
      "num_input_tokens_seen": 12142947584,
      "step": 15434
    },
    {
      "epoch": 1.6374920432845321,
      "grad_norm": 0.4396402876765644,
      "learning_rate": 4.776289933965088e-05,
      "loss": 1.7084,
      "num_input_tokens_seen": 12143734320,
      "step": 15435
    },
    {
      "epoch": 1.6375981328241034,
      "grad_norm": 0.48565423825932835,
      "learning_rate": 4.7762611979390565e-05,
      "loss": 1.9636,
      "num_input_tokens_seen": 12144521040,
      "step": 15436
    },
    {
      "epoch": 1.6377042223636749,
      "grad_norm": 0.4002991557373143,
      "learning_rate": 4.7762324601539964e-05,
      "loss": 1.7712,
      "num_input_tokens_seen": 12145307808,
      "step": 15437
    },
    {
      "epoch": 1.6378103119032463,
      "grad_norm": 0.8041354642155514,
      "learning_rate": 4.776203720609932e-05,
      "loss": 1.806,
      "num_input_tokens_seen": 12146094640,
      "step": 15438
    },
    {
      "epoch": 1.6379164014428178,
      "grad_norm": 0.4631467678953555,
      "learning_rate": 4.7761749793068825e-05,
      "loss": 1.8209,
      "num_input_tokens_seen": 12146881376,
      "step": 15439
    },
    {
      "epoch": 1.6380224909823893,
      "grad_norm": 0.44577228498779486,
      "learning_rate": 4.776146236244873e-05,
      "loss": 1.6111,
      "num_input_tokens_seen": 12147668208,
      "step": 15440
    },
    {
      "epoch": 1.6381285805219605,
      "grad_norm": 0.4191414285538536,
      "learning_rate": 4.776117491423924e-05,
      "loss": 1.6847,
      "num_input_tokens_seen": 12148454976,
      "step": 15441
    },
    {
      "epoch": 1.6382346700615318,
      "grad_norm": 0.4294104982659772,
      "learning_rate": 4.7760887448440584e-05,
      "loss": 1.8322,
      "num_input_tokens_seen": 12149241808,
      "step": 15442
    },
    {
      "epoch": 1.6383407596011033,
      "grad_norm": 0.43679240798044044,
      "learning_rate": 4.776059996505298e-05,
      "loss": 1.8321,
      "num_input_tokens_seen": 12150028560,
      "step": 15443
    },
    {
      "epoch": 1.6384468491406747,
      "grad_norm": 0.39855850192366266,
      "learning_rate": 4.776031246407665e-05,
      "loss": 1.7678,
      "num_input_tokens_seen": 12150815312,
      "step": 15444
    },
    {
      "epoch": 1.6385529386802462,
      "grad_norm": 0.5140237727018574,
      "learning_rate": 4.776002494551182e-05,
      "loss": 1.7819,
      "num_input_tokens_seen": 12151602032,
      "step": 15445
    },
    {
      "epoch": 1.6386590282198177,
      "grad_norm": 0.4580507697448046,
      "learning_rate": 4.775973740935871e-05,
      "loss": 1.7769,
      "num_input_tokens_seen": 12152388896,
      "step": 15446
    },
    {
      "epoch": 1.638765117759389,
      "grad_norm": 0.49147953821659235,
      "learning_rate": 4.775944985561754e-05,
      "loss": 1.6732,
      "num_input_tokens_seen": 12153175680,
      "step": 15447
    },
    {
      "epoch": 1.6388712072989602,
      "grad_norm": 0.37361584071022164,
      "learning_rate": 4.775916228428854e-05,
      "loss": 1.51,
      "num_input_tokens_seen": 12153962400,
      "step": 15448
    },
    {
      "epoch": 1.6389772968385317,
      "grad_norm": 0.5142826692803338,
      "learning_rate": 4.7758874695371925e-05,
      "loss": 1.6993,
      "num_input_tokens_seen": 12154749120,
      "step": 15449
    },
    {
      "epoch": 1.6390833863781031,
      "grad_norm": 0.4388178121879597,
      "learning_rate": 4.7758587088867924e-05,
      "loss": 1.7157,
      "num_input_tokens_seen": 12155535968,
      "step": 15450
    },
    {
      "epoch": 1.6391894759176746,
      "grad_norm": 0.48692981898857035,
      "learning_rate": 4.7758299464776747e-05,
      "loss": 1.8277,
      "num_input_tokens_seen": 12156322736,
      "step": 15451
    },
    {
      "epoch": 1.6392955654572459,
      "grad_norm": 0.48714236149801804,
      "learning_rate": 4.7758011823098624e-05,
      "loss": 1.7466,
      "num_input_tokens_seen": 12157109552,
      "step": 15452
    },
    {
      "epoch": 1.6394016549968173,
      "grad_norm": 0.5177100692171971,
      "learning_rate": 4.775772416383378e-05,
      "loss": 1.7651,
      "num_input_tokens_seen": 12157896224,
      "step": 15453
    },
    {
      "epoch": 1.6395077445363886,
      "grad_norm": 0.4968666602492461,
      "learning_rate": 4.775743648698244e-05,
      "loss": 1.8649,
      "num_input_tokens_seen": 12158682880,
      "step": 15454
    },
    {
      "epoch": 1.63961383407596,
      "grad_norm": 0.3970379272265685,
      "learning_rate": 4.775714879254482e-05,
      "loss": 1.7964,
      "num_input_tokens_seen": 12159469648,
      "step": 15455
    },
    {
      "epoch": 1.6397199236155315,
      "grad_norm": 0.4441404570152636,
      "learning_rate": 4.775686108052113e-05,
      "loss": 1.7115,
      "num_input_tokens_seen": 12160256304,
      "step": 15456
    },
    {
      "epoch": 1.639826013155103,
      "grad_norm": 0.41403038216855875,
      "learning_rate": 4.775657335091162e-05,
      "loss": 1.7787,
      "num_input_tokens_seen": 12161043056,
      "step": 15457
    },
    {
      "epoch": 1.6399321026946743,
      "grad_norm": 0.4317411590346385,
      "learning_rate": 4.7756285603716487e-05,
      "loss": 1.7202,
      "num_input_tokens_seen": 12161829856,
      "step": 15458
    },
    {
      "epoch": 1.6400381922342457,
      "grad_norm": 0.4182246952593078,
      "learning_rate": 4.7755997838935976e-05,
      "loss": 1.7378,
      "num_input_tokens_seen": 12162616768,
      "step": 15459
    },
    {
      "epoch": 1.640144281773817,
      "grad_norm": 0.4341113807380577,
      "learning_rate": 4.775571005657029e-05,
      "loss": 1.7548,
      "num_input_tokens_seen": 12163403568,
      "step": 15460
    },
    {
      "epoch": 1.6402503713133885,
      "grad_norm": 0.39046821536046483,
      "learning_rate": 4.7755422256619664e-05,
      "loss": 1.6011,
      "num_input_tokens_seen": 12164190336,
      "step": 15461
    },
    {
      "epoch": 1.64035646085296,
      "grad_norm": 0.42698450725502995,
      "learning_rate": 4.775513443908431e-05,
      "loss": 1.7014,
      "num_input_tokens_seen": 12164977216,
      "step": 15462
    },
    {
      "epoch": 1.6404625503925314,
      "grad_norm": 0.3816336251555061,
      "learning_rate": 4.7754846603964454e-05,
      "loss": 1.6341,
      "num_input_tokens_seen": 12165763984,
      "step": 15463
    },
    {
      "epoch": 1.6405686399321027,
      "grad_norm": 0.38167133207929543,
      "learning_rate": 4.7754558751260325e-05,
      "loss": 1.833,
      "num_input_tokens_seen": 12166550704,
      "step": 15464
    },
    {
      "epoch": 1.6406747294716741,
      "grad_norm": 0.3767094486540094,
      "learning_rate": 4.7754270880972144e-05,
      "loss": 1.7763,
      "num_input_tokens_seen": 12167337424,
      "step": 15465
    },
    {
      "epoch": 1.6407808190112454,
      "grad_norm": 0.43316990896521,
      "learning_rate": 4.775398299310012e-05,
      "loss": 1.757,
      "num_input_tokens_seen": 12168124176,
      "step": 15466
    },
    {
      "epoch": 1.6408869085508169,
      "grad_norm": 0.35563557254565076,
      "learning_rate": 4.775369508764449e-05,
      "loss": 1.6527,
      "num_input_tokens_seen": 12168911040,
      "step": 15467
    },
    {
      "epoch": 1.6409929980903883,
      "grad_norm": 0.35620641753211824,
      "learning_rate": 4.775340716460548e-05,
      "loss": 1.528,
      "num_input_tokens_seen": 12169697776,
      "step": 15468
    },
    {
      "epoch": 1.6410990876299598,
      "grad_norm": 0.5234294043516476,
      "learning_rate": 4.775311922398329e-05,
      "loss": 1.7074,
      "num_input_tokens_seen": 12170484528,
      "step": 15469
    },
    {
      "epoch": 1.641205177169531,
      "grad_norm": 0.46963646644758394,
      "learning_rate": 4.775283126577816e-05,
      "loss": 1.763,
      "num_input_tokens_seen": 12171271344,
      "step": 15470
    },
    {
      "epoch": 1.6413112667091023,
      "grad_norm": 0.3575588429891667,
      "learning_rate": 4.775254328999033e-05,
      "loss": 1.7337,
      "num_input_tokens_seen": 12172058176,
      "step": 15471
    },
    {
      "epoch": 1.6414173562486738,
      "grad_norm": 0.5140019365023605,
      "learning_rate": 4.775225529661998e-05,
      "loss": 1.7365,
      "num_input_tokens_seen": 12172844896,
      "step": 15472
    },
    {
      "epoch": 1.6415234457882453,
      "grad_norm": 0.39319270694529623,
      "learning_rate": 4.775196728566736e-05,
      "loss": 1.7881,
      "num_input_tokens_seen": 12173631696,
      "step": 15473
    },
    {
      "epoch": 1.6416295353278167,
      "grad_norm": 0.4248693799732891,
      "learning_rate": 4.775167925713269e-05,
      "loss": 1.7886,
      "num_input_tokens_seen": 12174418496,
      "step": 15474
    },
    {
      "epoch": 1.6417356248673882,
      "grad_norm": 0.35880388976193855,
      "learning_rate": 4.775139121101618e-05,
      "loss": 1.6967,
      "num_input_tokens_seen": 12175205312,
      "step": 15475
    },
    {
      "epoch": 1.6418417144069595,
      "grad_norm": 0.3848152037261834,
      "learning_rate": 4.775110314731808e-05,
      "loss": 1.669,
      "num_input_tokens_seen": 12175992064,
      "step": 15476
    },
    {
      "epoch": 1.6419478039465307,
      "grad_norm": 0.5146585238884912,
      "learning_rate": 4.7750815066038576e-05,
      "loss": 1.8011,
      "num_input_tokens_seen": 12176778912,
      "step": 15477
    },
    {
      "epoch": 1.6420538934861022,
      "grad_norm": 0.5274842583542413,
      "learning_rate": 4.775052696717793e-05,
      "loss": 1.8296,
      "num_input_tokens_seen": 12177565696,
      "step": 15478
    },
    {
      "epoch": 1.6421599830256737,
      "grad_norm": 0.3851279531974808,
      "learning_rate": 4.775023885073633e-05,
      "loss": 1.7153,
      "num_input_tokens_seen": 12178352496,
      "step": 15479
    },
    {
      "epoch": 1.6422660725652451,
      "grad_norm": 0.3847812900306035,
      "learning_rate": 4.774995071671402e-05,
      "loss": 1.7502,
      "num_input_tokens_seen": 12179139232,
      "step": 15480
    },
    {
      "epoch": 1.6423721621048166,
      "grad_norm": 0.380981960000861,
      "learning_rate": 4.774966256511121e-05,
      "loss": 1.8132,
      "num_input_tokens_seen": 12179925920,
      "step": 15481
    },
    {
      "epoch": 1.6424782516443879,
      "grad_norm": 0.38340190743275887,
      "learning_rate": 4.7749374395928125e-05,
      "loss": 1.638,
      "num_input_tokens_seen": 12180712816,
      "step": 15482
    },
    {
      "epoch": 1.6425843411839591,
      "grad_norm": 0.505319882643549,
      "learning_rate": 4.7749086209165e-05,
      "loss": 1.6089,
      "num_input_tokens_seen": 12181499552,
      "step": 15483
    },
    {
      "epoch": 1.6426904307235306,
      "grad_norm": 0.49455483825854574,
      "learning_rate": 4.774879800482205e-05,
      "loss": 1.7739,
      "num_input_tokens_seen": 12182286256,
      "step": 15484
    },
    {
      "epoch": 1.642796520263102,
      "grad_norm": 0.681353412609356,
      "learning_rate": 4.7748509782899485e-05,
      "loss": 1.7446,
      "num_input_tokens_seen": 12183073088,
      "step": 15485
    },
    {
      "epoch": 1.6429026098026736,
      "grad_norm": 0.6197249476859096,
      "learning_rate": 4.774822154339755e-05,
      "loss": 1.7517,
      "num_input_tokens_seen": 12183859808,
      "step": 15486
    },
    {
      "epoch": 1.6430086993422448,
      "grad_norm": 0.4499156583637014,
      "learning_rate": 4.774793328631645e-05,
      "loss": 1.6212,
      "num_input_tokens_seen": 12184646672,
      "step": 15487
    },
    {
      "epoch": 1.6431147888818163,
      "grad_norm": 0.5982176001727285,
      "learning_rate": 4.774764501165642e-05,
      "loss": 1.8451,
      "num_input_tokens_seen": 12185433328,
      "step": 15488
    },
    {
      "epoch": 1.6432208784213875,
      "grad_norm": 0.363602728307448,
      "learning_rate": 4.774735671941767e-05,
      "loss": 1.7158,
      "num_input_tokens_seen": 12186220112,
      "step": 15489
    },
    {
      "epoch": 1.643326967960959,
      "grad_norm": 0.560392342094995,
      "learning_rate": 4.7747068409600435e-05,
      "loss": 1.7668,
      "num_input_tokens_seen": 12187006848,
      "step": 15490
    },
    {
      "epoch": 1.6434330575005305,
      "grad_norm": 0.3488901837289645,
      "learning_rate": 4.7746780082204934e-05,
      "loss": 1.6639,
      "num_input_tokens_seen": 12187793616,
      "step": 15491
    },
    {
      "epoch": 1.643539147040102,
      "grad_norm": 0.4542201680025607,
      "learning_rate": 4.774649173723139e-05,
      "loss": 1.7905,
      "num_input_tokens_seen": 12188580320,
      "step": 15492
    },
    {
      "epoch": 1.6436452365796732,
      "grad_norm": 0.4694740944614828,
      "learning_rate": 4.774620337468002e-05,
      "loss": 1.8652,
      "num_input_tokens_seen": 12189366992,
      "step": 15493
    },
    {
      "epoch": 1.6437513261192447,
      "grad_norm": 0.6072956922794458,
      "learning_rate": 4.774591499455106e-05,
      "loss": 1.8155,
      "num_input_tokens_seen": 12190153744,
      "step": 15494
    },
    {
      "epoch": 1.643857415658816,
      "grad_norm": 0.3578817694059772,
      "learning_rate": 4.7745626596844714e-05,
      "loss": 1.7579,
      "num_input_tokens_seen": 12190940432,
      "step": 15495
    },
    {
      "epoch": 1.6439635051983874,
      "grad_norm": 0.4959442212964923,
      "learning_rate": 4.7745338181561216e-05,
      "loss": 1.7298,
      "num_input_tokens_seen": 12191727280,
      "step": 15496
    },
    {
      "epoch": 1.6440695947379589,
      "grad_norm": 0.4200568627276861,
      "learning_rate": 4.7745049748700796e-05,
      "loss": 1.6885,
      "num_input_tokens_seen": 12192514112,
      "step": 15497
    },
    {
      "epoch": 1.6441756842775304,
      "grad_norm": 0.3749196735866181,
      "learning_rate": 4.774476129826366e-05,
      "loss": 1.6909,
      "num_input_tokens_seen": 12193300816,
      "step": 15498
    },
    {
      "epoch": 1.6442817738171016,
      "grad_norm": 0.42841618367118606,
      "learning_rate": 4.7744472830250047e-05,
      "loss": 1.7491,
      "num_input_tokens_seen": 12194087568,
      "step": 15499
    },
    {
      "epoch": 1.644387863356673,
      "grad_norm": 0.4092984358263334,
      "learning_rate": 4.774418434466017e-05,
      "loss": 1.6698,
      "num_input_tokens_seen": 12194874320,
      "step": 15500
    },
    {
      "epoch": 1.6444939528962443,
      "grad_norm": 0.541738457927112,
      "learning_rate": 4.7743895841494255e-05,
      "loss": 1.9224,
      "num_input_tokens_seen": 12195661040,
      "step": 15501
    },
    {
      "epoch": 1.6446000424358158,
      "grad_norm": 0.5574921569503061,
      "learning_rate": 4.774360732075252e-05,
      "loss": 1.8492,
      "num_input_tokens_seen": 12196447808,
      "step": 15502
    },
    {
      "epoch": 1.6447061319753873,
      "grad_norm": 0.6735291058255433,
      "learning_rate": 4.7743318782435196e-05,
      "loss": 1.7933,
      "num_input_tokens_seen": 12197234480,
      "step": 15503
    },
    {
      "epoch": 1.6448122215149588,
      "grad_norm": 0.47522392258827056,
      "learning_rate": 4.774303022654251e-05,
      "loss": 1.7238,
      "num_input_tokens_seen": 12198021280,
      "step": 15504
    },
    {
      "epoch": 1.64491831105453,
      "grad_norm": 0.36976292242930436,
      "learning_rate": 4.7742741653074666e-05,
      "loss": 1.6782,
      "num_input_tokens_seen": 12198807984,
      "step": 15505
    },
    {
      "epoch": 1.6450244005941013,
      "grad_norm": 0.6469685034660443,
      "learning_rate": 4.77424530620319e-05,
      "loss": 1.7908,
      "num_input_tokens_seen": 12199594704,
      "step": 15506
    },
    {
      "epoch": 1.6451304901336727,
      "grad_norm": 0.42625744016587697,
      "learning_rate": 4.774216445341444e-05,
      "loss": 1.6879,
      "num_input_tokens_seen": 12200381456,
      "step": 15507
    },
    {
      "epoch": 1.6452365796732442,
      "grad_norm": 0.6146419211078582,
      "learning_rate": 4.77418758272225e-05,
      "loss": 1.8136,
      "num_input_tokens_seen": 12201168256,
      "step": 15508
    },
    {
      "epoch": 1.6453426692128157,
      "grad_norm": 0.43531333476408973,
      "learning_rate": 4.7741587183456306e-05,
      "loss": 1.6909,
      "num_input_tokens_seen": 12201955072,
      "step": 15509
    },
    {
      "epoch": 1.6454487587523872,
      "grad_norm": 0.49203915065503173,
      "learning_rate": 4.774129852211608e-05,
      "loss": 1.69,
      "num_input_tokens_seen": 12202741840,
      "step": 15510
    },
    {
      "epoch": 1.6455548482919584,
      "grad_norm": 0.3686316010540556,
      "learning_rate": 4.774100984320205e-05,
      "loss": 1.6607,
      "num_input_tokens_seen": 12203528544,
      "step": 15511
    },
    {
      "epoch": 1.6456609378315297,
      "grad_norm": 0.45462448681415923,
      "learning_rate": 4.774072114671443e-05,
      "loss": 1.7421,
      "num_input_tokens_seen": 12204315376,
      "step": 15512
    },
    {
      "epoch": 1.6457670273711011,
      "grad_norm": 0.3606810453389938,
      "learning_rate": 4.774043243265345e-05,
      "loss": 1.7502,
      "num_input_tokens_seen": 12205102160,
      "step": 15513
    },
    {
      "epoch": 1.6458731169106726,
      "grad_norm": 0.40889677237745936,
      "learning_rate": 4.7740143701019326e-05,
      "loss": 1.7097,
      "num_input_tokens_seen": 12205888960,
      "step": 15514
    },
    {
      "epoch": 1.645979206450244,
      "grad_norm": 0.38487549138145244,
      "learning_rate": 4.773985495181229e-05,
      "loss": 1.6972,
      "num_input_tokens_seen": 12206675680,
      "step": 15515
    },
    {
      "epoch": 1.6460852959898156,
      "grad_norm": 0.40194696827645937,
      "learning_rate": 4.773956618503256e-05,
      "loss": 1.7936,
      "num_input_tokens_seen": 12207462384,
      "step": 15516
    },
    {
      "epoch": 1.6461913855293868,
      "grad_norm": 0.4258800117033649,
      "learning_rate": 4.773927740068036e-05,
      "loss": 1.8423,
      "num_input_tokens_seen": 12208249168,
      "step": 15517
    },
    {
      "epoch": 1.646297475068958,
      "grad_norm": 0.45799698178665327,
      "learning_rate": 4.773898859875592e-05,
      "loss": 1.6738,
      "num_input_tokens_seen": 12209035840,
      "step": 15518
    },
    {
      "epoch": 1.6464035646085295,
      "grad_norm": 0.36167071212575935,
      "learning_rate": 4.7738699779259444e-05,
      "loss": 1.8158,
      "num_input_tokens_seen": 12209822576,
      "step": 15519
    },
    {
      "epoch": 1.646509654148101,
      "grad_norm": 0.3955612575178146,
      "learning_rate": 4.773841094219118e-05,
      "loss": 1.6916,
      "num_input_tokens_seen": 12210609360,
      "step": 15520
    },
    {
      "epoch": 1.6466157436876725,
      "grad_norm": 0.49330046118976595,
      "learning_rate": 4.7738122087551334e-05,
      "loss": 1.6248,
      "num_input_tokens_seen": 12211396048,
      "step": 15521
    },
    {
      "epoch": 1.6467218332272437,
      "grad_norm": 0.4165673048560224,
      "learning_rate": 4.7737833215340135e-05,
      "loss": 1.6883,
      "num_input_tokens_seen": 12212182800,
      "step": 15522
    },
    {
      "epoch": 1.6468279227668152,
      "grad_norm": 0.4401443086129998,
      "learning_rate": 4.7737544325557806e-05,
      "loss": 1.7883,
      "num_input_tokens_seen": 12212969552,
      "step": 15523
    },
    {
      "epoch": 1.6469340123063865,
      "grad_norm": 0.4735914268109081,
      "learning_rate": 4.7737255418204565e-05,
      "loss": 1.7475,
      "num_input_tokens_seen": 12213756320,
      "step": 15524
    },
    {
      "epoch": 1.647040101845958,
      "grad_norm": 0.3899535387697074,
      "learning_rate": 4.773696649328065e-05,
      "loss": 1.9496,
      "num_input_tokens_seen": 12214543024,
      "step": 15525
    },
    {
      "epoch": 1.6471461913855294,
      "grad_norm": 0.39076508139411814,
      "learning_rate": 4.773667755078627e-05,
      "loss": 1.6991,
      "num_input_tokens_seen": 12215329872,
      "step": 15526
    },
    {
      "epoch": 1.647252280925101,
      "grad_norm": 0.39590034065659696,
      "learning_rate": 4.773638859072165e-05,
      "loss": 1.8426,
      "num_input_tokens_seen": 12216116624,
      "step": 15527
    },
    {
      "epoch": 1.6473583704646722,
      "grad_norm": 0.3589898365548116,
      "learning_rate": 4.7736099613087024e-05,
      "loss": 1.6683,
      "num_input_tokens_seen": 12216903456,
      "step": 15528
    },
    {
      "epoch": 1.6474644600042436,
      "grad_norm": 0.36780420638932754,
      "learning_rate": 4.7735810617882595e-05,
      "loss": 1.6725,
      "num_input_tokens_seen": 12217690240,
      "step": 15529
    },
    {
      "epoch": 1.6475705495438149,
      "grad_norm": 0.36406492523184414,
      "learning_rate": 4.773552160510861e-05,
      "loss": 1.6681,
      "num_input_tokens_seen": 12218477008,
      "step": 15530
    },
    {
      "epoch": 1.6476766390833864,
      "grad_norm": 0.37056155399776974,
      "learning_rate": 4.7735232574765276e-05,
      "loss": 1.5518,
      "num_input_tokens_seen": 12219263888,
      "step": 15531
    },
    {
      "epoch": 1.6477827286229578,
      "grad_norm": 0.3602445234233102,
      "learning_rate": 4.773494352685282e-05,
      "loss": 1.728,
      "num_input_tokens_seen": 12220050656,
      "step": 15532
    },
    {
      "epoch": 1.6478888181625293,
      "grad_norm": 0.3436929806730319,
      "learning_rate": 4.773465446137147e-05,
      "loss": 1.861,
      "num_input_tokens_seen": 12220837376,
      "step": 15533
    },
    {
      "epoch": 1.6479949077021006,
      "grad_norm": 0.3295256343457248,
      "learning_rate": 4.7734365378321444e-05,
      "loss": 1.5988,
      "num_input_tokens_seen": 12221624208,
      "step": 15534
    },
    {
      "epoch": 1.6481009972416718,
      "grad_norm": 0.39914085879107575,
      "learning_rate": 4.7734076277702966e-05,
      "loss": 1.8516,
      "num_input_tokens_seen": 12222410960,
      "step": 15535
    },
    {
      "epoch": 1.6482070867812433,
      "grad_norm": 0.3871002371574481,
      "learning_rate": 4.7733787159516265e-05,
      "loss": 1.8993,
      "num_input_tokens_seen": 12223197680,
      "step": 15536
    },
    {
      "epoch": 1.6483131763208148,
      "grad_norm": 0.41936231062725077,
      "learning_rate": 4.773349802376156e-05,
      "loss": 1.8321,
      "num_input_tokens_seen": 12223984352,
      "step": 15537
    },
    {
      "epoch": 1.6484192658603862,
      "grad_norm": 0.47762498266761144,
      "learning_rate": 4.773320887043907e-05,
      "loss": 1.8164,
      "num_input_tokens_seen": 12224771168,
      "step": 15538
    },
    {
      "epoch": 1.6485253553999577,
      "grad_norm": 0.3549039069982221,
      "learning_rate": 4.773291969954903e-05,
      "loss": 1.6386,
      "num_input_tokens_seen": 12225558048,
      "step": 15539
    },
    {
      "epoch": 1.648631444939529,
      "grad_norm": 0.42781921747033624,
      "learning_rate": 4.773263051109165e-05,
      "loss": 1.7942,
      "num_input_tokens_seen": 12226344816,
      "step": 15540
    },
    {
      "epoch": 1.6487375344791002,
      "grad_norm": 0.37014396227140745,
      "learning_rate": 4.7732341305067165e-05,
      "loss": 1.7864,
      "num_input_tokens_seen": 12227131584,
      "step": 15541
    },
    {
      "epoch": 1.6488436240186717,
      "grad_norm": 0.5395547595941816,
      "learning_rate": 4.773205208147579e-05,
      "loss": 1.6132,
      "num_input_tokens_seen": 12227918320,
      "step": 15542
    },
    {
      "epoch": 1.6489497135582432,
      "grad_norm": 0.4202337333389626,
      "learning_rate": 4.773176284031776e-05,
      "loss": 1.701,
      "num_input_tokens_seen": 12228705104,
      "step": 15543
    },
    {
      "epoch": 1.6490558030978146,
      "grad_norm": 0.4484732623072311,
      "learning_rate": 4.773147358159328e-05,
      "loss": 1.7469,
      "num_input_tokens_seen": 12229491840,
      "step": 15544
    },
    {
      "epoch": 1.649161892637386,
      "grad_norm": 0.5601542966783338,
      "learning_rate": 4.773118430530259e-05,
      "loss": 1.8218,
      "num_input_tokens_seen": 12230278544,
      "step": 15545
    },
    {
      "epoch": 1.6492679821769574,
      "grad_norm": 0.4049757501271303,
      "learning_rate": 4.773089501144591e-05,
      "loss": 1.7852,
      "num_input_tokens_seen": 12231065376,
      "step": 15546
    },
    {
      "epoch": 1.6493740717165286,
      "grad_norm": 0.46491328141326865,
      "learning_rate": 4.7730605700023454e-05,
      "loss": 1.8051,
      "num_input_tokens_seen": 12231852144,
      "step": 15547
    },
    {
      "epoch": 1.6494801612561,
      "grad_norm": 0.4164773001979789,
      "learning_rate": 4.7730316371035454e-05,
      "loss": 1.7001,
      "num_input_tokens_seen": 12232638944,
      "step": 15548
    },
    {
      "epoch": 1.6495862507956716,
      "grad_norm": 0.3863574799495854,
      "learning_rate": 4.773002702448214e-05,
      "loss": 1.6121,
      "num_input_tokens_seen": 12233425648,
      "step": 15549
    },
    {
      "epoch": 1.649692340335243,
      "grad_norm": 0.3525871055011677,
      "learning_rate": 4.7729737660363724e-05,
      "loss": 1.6969,
      "num_input_tokens_seen": 12234212480,
      "step": 15550
    },
    {
      "epoch": 1.6497984298748145,
      "grad_norm": 0.40302233277128463,
      "learning_rate": 4.7729448278680435e-05,
      "loss": 1.697,
      "num_input_tokens_seen": 12234999232,
      "step": 15551
    },
    {
      "epoch": 1.6499045194143858,
      "grad_norm": 0.4009434926977737,
      "learning_rate": 4.772915887943249e-05,
      "loss": 1.7981,
      "num_input_tokens_seen": 12235785984,
      "step": 15552
    },
    {
      "epoch": 1.650010608953957,
      "grad_norm": 0.3722551838255626,
      "learning_rate": 4.772886946262012e-05,
      "loss": 1.6734,
      "num_input_tokens_seen": 12236572704,
      "step": 15553
    },
    {
      "epoch": 1.6501166984935285,
      "grad_norm": 0.523200880143099,
      "learning_rate": 4.772858002824355e-05,
      "loss": 1.9081,
      "num_input_tokens_seen": 12237359488,
      "step": 15554
    },
    {
      "epoch": 1.6502227880331,
      "grad_norm": 0.39859047884145016,
      "learning_rate": 4.772829057630299e-05,
      "loss": 1.8848,
      "num_input_tokens_seen": 12238146208,
      "step": 15555
    },
    {
      "epoch": 1.6503288775726714,
      "grad_norm": 0.49012938082509244,
      "learning_rate": 4.772800110679869e-05,
      "loss": 1.7916,
      "num_input_tokens_seen": 12238932976,
      "step": 15556
    },
    {
      "epoch": 1.6504349671122427,
      "grad_norm": 0.3677822562478747,
      "learning_rate": 4.772771161973085e-05,
      "loss": 1.8593,
      "num_input_tokens_seen": 12239719728,
      "step": 15557
    },
    {
      "epoch": 1.6505410566518142,
      "grad_norm": 0.36651050510645805,
      "learning_rate": 4.7727422115099695e-05,
      "loss": 1.6005,
      "num_input_tokens_seen": 12240506480,
      "step": 15558
    },
    {
      "epoch": 1.6506471461913854,
      "grad_norm": 0.4400633345787591,
      "learning_rate": 4.7727132592905465e-05,
      "loss": 1.7529,
      "num_input_tokens_seen": 12241293264,
      "step": 15559
    },
    {
      "epoch": 1.650753235730957,
      "grad_norm": 0.44931208936964867,
      "learning_rate": 4.7726843053148366e-05,
      "loss": 1.9387,
      "num_input_tokens_seen": 12242079968,
      "step": 15560
    },
    {
      "epoch": 1.6508593252705284,
      "grad_norm": 0.428618098033675,
      "learning_rate": 4.7726553495828635e-05,
      "loss": 1.8329,
      "num_input_tokens_seen": 12242866704,
      "step": 15561
    },
    {
      "epoch": 1.6509654148100998,
      "grad_norm": 0.38558775118644634,
      "learning_rate": 4.772626392094649e-05,
      "loss": 1.7477,
      "num_input_tokens_seen": 12243653552,
      "step": 15562
    },
    {
      "epoch": 1.651071504349671,
      "grad_norm": 0.3742558797654168,
      "learning_rate": 4.772597432850216e-05,
      "loss": 1.6866,
      "num_input_tokens_seen": 12244440368,
      "step": 15563
    },
    {
      "epoch": 1.6511775938892426,
      "grad_norm": 0.3570464086427763,
      "learning_rate": 4.772568471849585e-05,
      "loss": 1.6473,
      "num_input_tokens_seen": 12245227152,
      "step": 15564
    },
    {
      "epoch": 1.6512836834288138,
      "grad_norm": 0.40795328452381185,
      "learning_rate": 4.77253950909278e-05,
      "loss": 1.8017,
      "num_input_tokens_seen": 12246013888,
      "step": 15565
    },
    {
      "epoch": 1.6513897729683853,
      "grad_norm": 0.3502962001629078,
      "learning_rate": 4.772510544579824e-05,
      "loss": 1.7407,
      "num_input_tokens_seen": 12246800688,
      "step": 15566
    },
    {
      "epoch": 1.6514958625079568,
      "grad_norm": 0.38759154453311156,
      "learning_rate": 4.7724815783107386e-05,
      "loss": 1.8617,
      "num_input_tokens_seen": 12247587376,
      "step": 15567
    },
    {
      "epoch": 1.6516019520475282,
      "grad_norm": 0.37887868964164156,
      "learning_rate": 4.772452610285545e-05,
      "loss": 1.7575,
      "num_input_tokens_seen": 12248374048,
      "step": 15568
    },
    {
      "epoch": 1.6517080415870995,
      "grad_norm": 0.42239715193054794,
      "learning_rate": 4.7724236405042676e-05,
      "loss": 1.7626,
      "num_input_tokens_seen": 12249160656,
      "step": 15569
    },
    {
      "epoch": 1.6518141311266707,
      "grad_norm": 0.33057215475915097,
      "learning_rate": 4.772394668966928e-05,
      "loss": 1.6657,
      "num_input_tokens_seen": 12249947536,
      "step": 15570
    },
    {
      "epoch": 1.6519202206662422,
      "grad_norm": 0.418179000269528,
      "learning_rate": 4.772365695673548e-05,
      "loss": 1.6867,
      "num_input_tokens_seen": 12250734336,
      "step": 15571
    },
    {
      "epoch": 1.6520263102058137,
      "grad_norm": 0.3891141992877348,
      "learning_rate": 4.772336720624151e-05,
      "loss": 1.6906,
      "num_input_tokens_seen": 12251521072,
      "step": 15572
    },
    {
      "epoch": 1.6521323997453852,
      "grad_norm": 0.38866417425436084,
      "learning_rate": 4.772307743818758e-05,
      "loss": 1.7304,
      "num_input_tokens_seen": 12252307888,
      "step": 15573
    },
    {
      "epoch": 1.6522384892849566,
      "grad_norm": 0.42321959182003394,
      "learning_rate": 4.772278765257393e-05,
      "loss": 1.7672,
      "num_input_tokens_seen": 12253094672,
      "step": 15574
    },
    {
      "epoch": 1.652344578824528,
      "grad_norm": 0.3552787896574855,
      "learning_rate": 4.772249784940077e-05,
      "loss": 1.8693,
      "num_input_tokens_seen": 12253881552,
      "step": 15575
    },
    {
      "epoch": 1.6524506683640992,
      "grad_norm": 0.4298171750194011,
      "learning_rate": 4.7722208028668335e-05,
      "loss": 1.8365,
      "num_input_tokens_seen": 12254668320,
      "step": 15576
    },
    {
      "epoch": 1.6525567579036706,
      "grad_norm": 0.36901960501176045,
      "learning_rate": 4.7721918190376846e-05,
      "loss": 1.698,
      "num_input_tokens_seen": 12255455072,
      "step": 15577
    },
    {
      "epoch": 1.652662847443242,
      "grad_norm": 0.3592573418658918,
      "learning_rate": 4.7721628334526525e-05,
      "loss": 1.5125,
      "num_input_tokens_seen": 12256241920,
      "step": 15578
    },
    {
      "epoch": 1.6527689369828136,
      "grad_norm": 0.42942973234157733,
      "learning_rate": 4.772133846111759e-05,
      "loss": 1.7344,
      "num_input_tokens_seen": 12257028704,
      "step": 15579
    },
    {
      "epoch": 1.652875026522385,
      "grad_norm": 0.46712934403173084,
      "learning_rate": 4.772104857015028e-05,
      "loss": 1.8186,
      "num_input_tokens_seen": 12257815536,
      "step": 15580
    },
    {
      "epoch": 1.6529811160619563,
      "grad_norm": 0.482655671325042,
      "learning_rate": 4.7720758661624805e-05,
      "loss": 1.6687,
      "num_input_tokens_seen": 12258602256,
      "step": 15581
    },
    {
      "epoch": 1.6530872056015276,
      "grad_norm": 0.34741254832368773,
      "learning_rate": 4.772046873554139e-05,
      "loss": 1.6193,
      "num_input_tokens_seen": 12259389056,
      "step": 15582
    },
    {
      "epoch": 1.653193295141099,
      "grad_norm": 0.3528088989070486,
      "learning_rate": 4.7720178791900275e-05,
      "loss": 1.833,
      "num_input_tokens_seen": 12260175792,
      "step": 15583
    },
    {
      "epoch": 1.6532993846806705,
      "grad_norm": 0.3706360486488827,
      "learning_rate": 4.771988883070166e-05,
      "loss": 1.7742,
      "num_input_tokens_seen": 12260962592,
      "step": 15584
    },
    {
      "epoch": 1.653405474220242,
      "grad_norm": 0.4964793605091939,
      "learning_rate": 4.771959885194579e-05,
      "loss": 1.6275,
      "num_input_tokens_seen": 12261749408,
      "step": 15585
    },
    {
      "epoch": 1.6535115637598132,
      "grad_norm": 0.3422972892996323,
      "learning_rate": 4.7719308855632884e-05,
      "loss": 1.6438,
      "num_input_tokens_seen": 12262536224,
      "step": 15586
    },
    {
      "epoch": 1.6536176532993847,
      "grad_norm": 0.6545046548143005,
      "learning_rate": 4.771901884176315e-05,
      "loss": 1.8025,
      "num_input_tokens_seen": 12263322992,
      "step": 15587
    },
    {
      "epoch": 1.653723742838956,
      "grad_norm": 0.3631990668414817,
      "learning_rate": 4.7718728810336835e-05,
      "loss": 1.8106,
      "num_input_tokens_seen": 12264109728,
      "step": 15588
    },
    {
      "epoch": 1.6538298323785274,
      "grad_norm": 0.48396932918914054,
      "learning_rate": 4.771843876135415e-05,
      "loss": 1.7266,
      "num_input_tokens_seen": 12264896432,
      "step": 15589
    },
    {
      "epoch": 1.653935921918099,
      "grad_norm": 0.3959242380816226,
      "learning_rate": 4.7718148694815324e-05,
      "loss": 1.6865,
      "num_input_tokens_seen": 12265683088,
      "step": 15590
    },
    {
      "epoch": 1.6540420114576704,
      "grad_norm": 0.3940874892282104,
      "learning_rate": 4.771785861072058e-05,
      "loss": 1.8156,
      "num_input_tokens_seen": 12266469824,
      "step": 15591
    },
    {
      "epoch": 1.6541481009972416,
      "grad_norm": 0.3942392481268558,
      "learning_rate": 4.771756850907013e-05,
      "loss": 1.6505,
      "num_input_tokens_seen": 12267256608,
      "step": 15592
    },
    {
      "epoch": 1.654254190536813,
      "grad_norm": 0.3927268616752891,
      "learning_rate": 4.7717278389864225e-05,
      "loss": 1.6742,
      "num_input_tokens_seen": 12268043344,
      "step": 15593
    },
    {
      "epoch": 1.6543602800763844,
      "grad_norm": 0.4407241907484941,
      "learning_rate": 4.7716988253103065e-05,
      "loss": 1.6356,
      "num_input_tokens_seen": 12268830064,
      "step": 15594
    },
    {
      "epoch": 1.6544663696159558,
      "grad_norm": 0.41962715610649415,
      "learning_rate": 4.771669809878688e-05,
      "loss": 1.6929,
      "num_input_tokens_seen": 12269616816,
      "step": 15595
    },
    {
      "epoch": 1.6545724591555273,
      "grad_norm": 0.4237728731948676,
      "learning_rate": 4.771640792691591e-05,
      "loss": 1.7775,
      "num_input_tokens_seen": 12270403616,
      "step": 15596
    },
    {
      "epoch": 1.6546785486950988,
      "grad_norm": 0.38862487610836294,
      "learning_rate": 4.771611773749036e-05,
      "loss": 1.6403,
      "num_input_tokens_seen": 12271190352,
      "step": 15597
    },
    {
      "epoch": 1.65478463823467,
      "grad_norm": 0.5478434689139363,
      "learning_rate": 4.771582753051046e-05,
      "loss": 1.8414,
      "num_input_tokens_seen": 12271977088,
      "step": 15598
    },
    {
      "epoch": 1.6548907277742415,
      "grad_norm": 0.3901413488156905,
      "learning_rate": 4.771553730597643e-05,
      "loss": 1.6478,
      "num_input_tokens_seen": 12272763888,
      "step": 15599
    },
    {
      "epoch": 1.6549968173138128,
      "grad_norm": 0.46536358705250197,
      "learning_rate": 4.77152470638885e-05,
      "loss": 1.6966,
      "num_input_tokens_seen": 12273550608,
      "step": 15600
    },
    {
      "epoch": 1.6551029068533842,
      "grad_norm": 0.3643649452705214,
      "learning_rate": 4.77149568042469e-05,
      "loss": 1.607,
      "num_input_tokens_seen": 12274337408,
      "step": 15601
    },
    {
      "epoch": 1.6552089963929557,
      "grad_norm": 0.40656754490883523,
      "learning_rate": 4.771466652705185e-05,
      "loss": 1.7117,
      "num_input_tokens_seen": 12275124208,
      "step": 15602
    },
    {
      "epoch": 1.6553150859325272,
      "grad_norm": 0.4429454640054787,
      "learning_rate": 4.771437623230357e-05,
      "loss": 1.8256,
      "num_input_tokens_seen": 12275911024,
      "step": 15603
    },
    {
      "epoch": 1.6554211754720984,
      "grad_norm": 0.42782800565693957,
      "learning_rate": 4.7714085920002284e-05,
      "loss": 1.5446,
      "num_input_tokens_seen": 12276697792,
      "step": 15604
    },
    {
      "epoch": 1.6555272650116697,
      "grad_norm": 0.38005972095608864,
      "learning_rate": 4.7713795590148214e-05,
      "loss": 1.6678,
      "num_input_tokens_seen": 12277484576,
      "step": 15605
    },
    {
      "epoch": 1.6556333545512412,
      "grad_norm": 0.37903924384268656,
      "learning_rate": 4.7713505242741594e-05,
      "loss": 1.6437,
      "num_input_tokens_seen": 12278271440,
      "step": 15606
    },
    {
      "epoch": 1.6557394440908126,
      "grad_norm": 0.35389468229132093,
      "learning_rate": 4.771321487778265e-05,
      "loss": 1.7711,
      "num_input_tokens_seen": 12279058224,
      "step": 15607
    },
    {
      "epoch": 1.6558455336303841,
      "grad_norm": 0.4654876038381788,
      "learning_rate": 4.77129244952716e-05,
      "loss": 1.7896,
      "num_input_tokens_seen": 12279844928,
      "step": 15608
    },
    {
      "epoch": 1.6559516231699556,
      "grad_norm": 0.36170069654165976,
      "learning_rate": 4.771263409520865e-05,
      "loss": 1.7165,
      "num_input_tokens_seen": 12280631744,
      "step": 15609
    },
    {
      "epoch": 1.6560577127095268,
      "grad_norm": 0.37016637697381755,
      "learning_rate": 4.7712343677594054e-05,
      "loss": 1.7221,
      "num_input_tokens_seen": 12281418448,
      "step": 15610
    },
    {
      "epoch": 1.656163802249098,
      "grad_norm": 0.4331446671867407,
      "learning_rate": 4.771205324242803e-05,
      "loss": 1.7201,
      "num_input_tokens_seen": 12282205136,
      "step": 15611
    },
    {
      "epoch": 1.6562698917886696,
      "grad_norm": 0.38932863863615824,
      "learning_rate": 4.771176278971079e-05,
      "loss": 1.8416,
      "num_input_tokens_seen": 12282991968,
      "step": 15612
    },
    {
      "epoch": 1.656375981328241,
      "grad_norm": 0.46481570578370457,
      "learning_rate": 4.7711472319442574e-05,
      "loss": 1.7481,
      "num_input_tokens_seen": 12283778672,
      "step": 15613
    },
    {
      "epoch": 1.6564820708678125,
      "grad_norm": 0.46965001353723596,
      "learning_rate": 4.7711181831623595e-05,
      "loss": 1.6091,
      "num_input_tokens_seen": 12284565504,
      "step": 15614
    },
    {
      "epoch": 1.656588160407384,
      "grad_norm": 0.3965851604416992,
      "learning_rate": 4.771089132625408e-05,
      "loss": 1.8425,
      "num_input_tokens_seen": 12285352240,
      "step": 15615
    },
    {
      "epoch": 1.6566942499469552,
      "grad_norm": 0.44800817300707413,
      "learning_rate": 4.771060080333426e-05,
      "loss": 1.8367,
      "num_input_tokens_seen": 12286139008,
      "step": 15616
    },
    {
      "epoch": 1.6568003394865265,
      "grad_norm": 0.450031815499966,
      "learning_rate": 4.7710310262864346e-05,
      "loss": 1.8345,
      "num_input_tokens_seen": 12286925712,
      "step": 15617
    },
    {
      "epoch": 1.656906429026098,
      "grad_norm": 0.4010728807915034,
      "learning_rate": 4.771001970484458e-05,
      "loss": 1.7862,
      "num_input_tokens_seen": 12287712544,
      "step": 15618
    },
    {
      "epoch": 1.6570125185656694,
      "grad_norm": 0.45805082235506484,
      "learning_rate": 4.770972912927516e-05,
      "loss": 1.7418,
      "num_input_tokens_seen": 12288499360,
      "step": 15619
    },
    {
      "epoch": 1.657118608105241,
      "grad_norm": 0.44623026535712784,
      "learning_rate": 4.770943853615634e-05,
      "loss": 1.8087,
      "num_input_tokens_seen": 12289286144,
      "step": 15620
    },
    {
      "epoch": 1.6572246976448122,
      "grad_norm": 0.541542078673205,
      "learning_rate": 4.770914792548833e-05,
      "loss": 1.9048,
      "num_input_tokens_seen": 12290072944,
      "step": 15621
    },
    {
      "epoch": 1.6573307871843836,
      "grad_norm": 0.3702076643305409,
      "learning_rate": 4.770885729727136e-05,
      "loss": 1.5641,
      "num_input_tokens_seen": 12290859696,
      "step": 15622
    },
    {
      "epoch": 1.657436876723955,
      "grad_norm": 0.4105379013526473,
      "learning_rate": 4.770856665150565e-05,
      "loss": 1.6387,
      "num_input_tokens_seen": 12291646512,
      "step": 15623
    },
    {
      "epoch": 1.6575429662635264,
      "grad_norm": 0.4689580383410596,
      "learning_rate": 4.7708275988191425e-05,
      "loss": 1.8171,
      "num_input_tokens_seen": 12292433216,
      "step": 15624
    },
    {
      "epoch": 1.6576490558030978,
      "grad_norm": 0.44981856013299704,
      "learning_rate": 4.7707985307328914e-05,
      "loss": 1.7924,
      "num_input_tokens_seen": 12293219936,
      "step": 15625
    },
    {
      "epoch": 1.6577551453426693,
      "grad_norm": 0.3749229858051321,
      "learning_rate": 4.770769460891833e-05,
      "loss": 1.7912,
      "num_input_tokens_seen": 12294006704,
      "step": 15626
    },
    {
      "epoch": 1.6578612348822406,
      "grad_norm": 0.4117081738651951,
      "learning_rate": 4.770740389295991e-05,
      "loss": 1.6921,
      "num_input_tokens_seen": 12294793568,
      "step": 15627
    },
    {
      "epoch": 1.657967324421812,
      "grad_norm": 0.35119251187957085,
      "learning_rate": 4.7707113159453876e-05,
      "loss": 1.6291,
      "num_input_tokens_seen": 12295580400,
      "step": 15628
    },
    {
      "epoch": 1.6580734139613833,
      "grad_norm": 0.44251481554080313,
      "learning_rate": 4.7706822408400455e-05,
      "loss": 1.7861,
      "num_input_tokens_seen": 12296367184,
      "step": 15629
    },
    {
      "epoch": 1.6581795035009548,
      "grad_norm": 0.4268423976248302,
      "learning_rate": 4.7706531639799865e-05,
      "loss": 1.6759,
      "num_input_tokens_seen": 12297153952,
      "step": 15630
    },
    {
      "epoch": 1.6582855930405263,
      "grad_norm": 0.6123451693644981,
      "learning_rate": 4.770624085365233e-05,
      "loss": 1.7232,
      "num_input_tokens_seen": 12297940704,
      "step": 15631
    },
    {
      "epoch": 1.6583916825800977,
      "grad_norm": 0.4222087924748064,
      "learning_rate": 4.770595004995808e-05,
      "loss": 1.7908,
      "num_input_tokens_seen": 12298727456,
      "step": 15632
    },
    {
      "epoch": 1.658497772119669,
      "grad_norm": 0.51913442207219,
      "learning_rate": 4.7705659228717335e-05,
      "loss": 1.7254,
      "num_input_tokens_seen": 12299514256,
      "step": 15633
    },
    {
      "epoch": 1.6586038616592405,
      "grad_norm": 0.4657653742865118,
      "learning_rate": 4.770536838993033e-05,
      "loss": 1.8303,
      "num_input_tokens_seen": 12300301040,
      "step": 15634
    },
    {
      "epoch": 1.6587099511988117,
      "grad_norm": 0.5593745481304901,
      "learning_rate": 4.770507753359728e-05,
      "loss": 1.7799,
      "num_input_tokens_seen": 12301087792,
      "step": 15635
    },
    {
      "epoch": 1.6588160407383832,
      "grad_norm": 0.5332737564406183,
      "learning_rate": 4.7704786659718414e-05,
      "loss": 1.849,
      "num_input_tokens_seen": 12301874544,
      "step": 15636
    },
    {
      "epoch": 1.6589221302779547,
      "grad_norm": 0.5662631080600201,
      "learning_rate": 4.770449576829395e-05,
      "loss": 1.7851,
      "num_input_tokens_seen": 12302661344,
      "step": 15637
    },
    {
      "epoch": 1.6590282198175261,
      "grad_norm": 0.43868488061725425,
      "learning_rate": 4.770420485932412e-05,
      "loss": 1.754,
      "num_input_tokens_seen": 12303448080,
      "step": 15638
    },
    {
      "epoch": 1.6591343093570974,
      "grad_norm": 0.5949940847267884,
      "learning_rate": 4.7703913932809146e-05,
      "loss": 1.845,
      "num_input_tokens_seen": 12304234912,
      "step": 15639
    },
    {
      "epoch": 1.6592403988966686,
      "grad_norm": 0.3972563819003349,
      "learning_rate": 4.770362298874925e-05,
      "loss": 1.8322,
      "num_input_tokens_seen": 12305021632,
      "step": 15640
    },
    {
      "epoch": 1.65934648843624,
      "grad_norm": 0.37007651335782393,
      "learning_rate": 4.770333202714467e-05,
      "loss": 1.6905,
      "num_input_tokens_seen": 12305808352,
      "step": 15641
    },
    {
      "epoch": 1.6594525779758116,
      "grad_norm": 0.5021530476300902,
      "learning_rate": 4.770304104799561e-05,
      "loss": 1.7769,
      "num_input_tokens_seen": 12306595088,
      "step": 15642
    },
    {
      "epoch": 1.659558667515383,
      "grad_norm": 0.3525331248039474,
      "learning_rate": 4.7702750051302316e-05,
      "loss": 1.8525,
      "num_input_tokens_seen": 12307381888,
      "step": 15643
    },
    {
      "epoch": 1.6596647570549545,
      "grad_norm": 0.44451778694861643,
      "learning_rate": 4.7702459037065e-05,
      "loss": 1.7339,
      "num_input_tokens_seen": 12308168592,
      "step": 15644
    },
    {
      "epoch": 1.6597708465945258,
      "grad_norm": 0.33263614770351724,
      "learning_rate": 4.7702168005283884e-05,
      "loss": 1.7165,
      "num_input_tokens_seen": 12308955328,
      "step": 15645
    },
    {
      "epoch": 1.659876936134097,
      "grad_norm": 0.3872491669861237,
      "learning_rate": 4.770187695595921e-05,
      "loss": 1.7624,
      "num_input_tokens_seen": 12309742144,
      "step": 15646
    },
    {
      "epoch": 1.6599830256736685,
      "grad_norm": 0.5093340272666047,
      "learning_rate": 4.7701585889091186e-05,
      "loss": 1.7255,
      "num_input_tokens_seen": 12310528848,
      "step": 15647
    },
    {
      "epoch": 1.66008911521324,
      "grad_norm": 0.3643526495199485,
      "learning_rate": 4.770129480468003e-05,
      "loss": 1.8438,
      "num_input_tokens_seen": 12311315600,
      "step": 15648
    },
    {
      "epoch": 1.6601952047528115,
      "grad_norm": 0.44751066009294505,
      "learning_rate": 4.7701003702726e-05,
      "loss": 1.7551,
      "num_input_tokens_seen": 12312102432,
      "step": 15649
    },
    {
      "epoch": 1.660301294292383,
      "grad_norm": 0.3522016174797833,
      "learning_rate": 4.770071258322929e-05,
      "loss": 1.5565,
      "num_input_tokens_seen": 12312889200,
      "step": 15650
    },
    {
      "epoch": 1.6604073838319542,
      "grad_norm": 0.4280184918968158,
      "learning_rate": 4.7700421446190135e-05,
      "loss": 1.77,
      "num_input_tokens_seen": 12313675952,
      "step": 15651
    },
    {
      "epoch": 1.6605134733715254,
      "grad_norm": 0.34178821155335265,
      "learning_rate": 4.770013029160876e-05,
      "loss": 1.6129,
      "num_input_tokens_seen": 12314462784,
      "step": 15652
    },
    {
      "epoch": 1.660619562911097,
      "grad_norm": 0.38328167222764775,
      "learning_rate": 4.769983911948539e-05,
      "loss": 1.7402,
      "num_input_tokens_seen": 12315249472,
      "step": 15653
    },
    {
      "epoch": 1.6607256524506684,
      "grad_norm": 0.32715162870415754,
      "learning_rate": 4.7699547929820255e-05,
      "loss": 1.6976,
      "num_input_tokens_seen": 12316036304,
      "step": 15654
    },
    {
      "epoch": 1.6608317419902399,
      "grad_norm": 0.3518021543909461,
      "learning_rate": 4.769925672261357e-05,
      "loss": 1.6117,
      "num_input_tokens_seen": 12316823104,
      "step": 15655
    },
    {
      "epoch": 1.6609378315298111,
      "grad_norm": 0.3604852293231258,
      "learning_rate": 4.769896549786558e-05,
      "loss": 1.6672,
      "num_input_tokens_seen": 12317609952,
      "step": 15656
    },
    {
      "epoch": 1.6610439210693826,
      "grad_norm": 0.36651901945621274,
      "learning_rate": 4.769867425557648e-05,
      "loss": 1.714,
      "num_input_tokens_seen": 12318396704,
      "step": 15657
    },
    {
      "epoch": 1.6611500106089538,
      "grad_norm": 0.37276049120857474,
      "learning_rate": 4.7698382995746516e-05,
      "loss": 1.8429,
      "num_input_tokens_seen": 12319183392,
      "step": 15658
    },
    {
      "epoch": 1.6612561001485253,
      "grad_norm": 0.33508079797773654,
      "learning_rate": 4.7698091718375905e-05,
      "loss": 1.7182,
      "num_input_tokens_seen": 12319970144,
      "step": 15659
    },
    {
      "epoch": 1.6613621896880968,
      "grad_norm": 0.31491087644271853,
      "learning_rate": 4.7697800423464875e-05,
      "loss": 1.6021,
      "num_input_tokens_seen": 12320756912,
      "step": 15660
    },
    {
      "epoch": 1.6614682792276683,
      "grad_norm": 0.33418205264691264,
      "learning_rate": 4.769750911101365e-05,
      "loss": 1.6628,
      "num_input_tokens_seen": 12321543600,
      "step": 15661
    },
    {
      "epoch": 1.6615743687672395,
      "grad_norm": 0.33126963395608255,
      "learning_rate": 4.769721778102246e-05,
      "loss": 1.6965,
      "num_input_tokens_seen": 12322330448,
      "step": 15662
    },
    {
      "epoch": 1.661680458306811,
      "grad_norm": 0.3515932190106347,
      "learning_rate": 4.769692643349152e-05,
      "loss": 1.7649,
      "num_input_tokens_seen": 12323117168,
      "step": 15663
    },
    {
      "epoch": 1.6617865478463822,
      "grad_norm": 0.3982229087106426,
      "learning_rate": 4.769663506842107e-05,
      "loss": 1.7657,
      "num_input_tokens_seen": 12323903968,
      "step": 15664
    },
    {
      "epoch": 1.6618926373859537,
      "grad_norm": 0.30876008609710676,
      "learning_rate": 4.7696343685811315e-05,
      "loss": 1.5705,
      "num_input_tokens_seen": 12324690800,
      "step": 15665
    },
    {
      "epoch": 1.6619987269255252,
      "grad_norm": 0.4380033248606558,
      "learning_rate": 4.76960522856625e-05,
      "loss": 1.7773,
      "num_input_tokens_seen": 12325477504,
      "step": 15666
    },
    {
      "epoch": 1.6621048164650967,
      "grad_norm": 0.40415188494621906,
      "learning_rate": 4.7695760867974836e-05,
      "loss": 1.792,
      "num_input_tokens_seen": 12326264240,
      "step": 15667
    },
    {
      "epoch": 1.662210906004668,
      "grad_norm": 0.4165764998841994,
      "learning_rate": 4.769546943274856e-05,
      "loss": 1.8122,
      "num_input_tokens_seen": 12327050960,
      "step": 15668
    },
    {
      "epoch": 1.6623169955442392,
      "grad_norm": 0.4414453660122267,
      "learning_rate": 4.769517797998389e-05,
      "loss": 1.8201,
      "num_input_tokens_seen": 12327837792,
      "step": 15669
    },
    {
      "epoch": 1.6624230850838106,
      "grad_norm": 0.5246808807056768,
      "learning_rate": 4.769488650968105e-05,
      "loss": 1.6899,
      "num_input_tokens_seen": 12328624608,
      "step": 15670
    },
    {
      "epoch": 1.6625291746233821,
      "grad_norm": 0.35673928812270883,
      "learning_rate": 4.769459502184027e-05,
      "loss": 1.7141,
      "num_input_tokens_seen": 12329411408,
      "step": 15671
    },
    {
      "epoch": 1.6626352641629536,
      "grad_norm": 0.4462837090263518,
      "learning_rate": 4.769430351646177e-05,
      "loss": 1.7835,
      "num_input_tokens_seen": 12330198048,
      "step": 15672
    },
    {
      "epoch": 1.662741353702525,
      "grad_norm": 0.359697410098971,
      "learning_rate": 4.7694011993545786e-05,
      "loss": 1.7934,
      "num_input_tokens_seen": 12330984816,
      "step": 15673
    },
    {
      "epoch": 1.6628474432420963,
      "grad_norm": 0.3931486828839908,
      "learning_rate": 4.769372045309253e-05,
      "loss": 1.7277,
      "num_input_tokens_seen": 12331771568,
      "step": 15674
    },
    {
      "epoch": 1.6629535327816676,
      "grad_norm": 0.37782269298323345,
      "learning_rate": 4.7693428895102226e-05,
      "loss": 1.805,
      "num_input_tokens_seen": 12332558368,
      "step": 15675
    },
    {
      "epoch": 1.663059622321239,
      "grad_norm": 0.3750115595504265,
      "learning_rate": 4.769313731957511e-05,
      "loss": 1.7517,
      "num_input_tokens_seen": 12333345104,
      "step": 15676
    },
    {
      "epoch": 1.6631657118608105,
      "grad_norm": 0.45407911163668746,
      "learning_rate": 4.76928457265114e-05,
      "loss": 1.5877,
      "num_input_tokens_seen": 12334131856,
      "step": 15677
    },
    {
      "epoch": 1.663271801400382,
      "grad_norm": 0.3717636905190891,
      "learning_rate": 4.7692554115911335e-05,
      "loss": 1.733,
      "num_input_tokens_seen": 12334918720,
      "step": 15678
    },
    {
      "epoch": 1.6633778909399535,
      "grad_norm": 0.36152000132041345,
      "learning_rate": 4.769226248777513e-05,
      "loss": 1.6236,
      "num_input_tokens_seen": 12335705632,
      "step": 15679
    },
    {
      "epoch": 1.6634839804795247,
      "grad_norm": 0.4250638233760851,
      "learning_rate": 4.769197084210301e-05,
      "loss": 1.7908,
      "num_input_tokens_seen": 12336492368,
      "step": 15680
    },
    {
      "epoch": 1.663590070019096,
      "grad_norm": 0.3686907082301431,
      "learning_rate": 4.769167917889519e-05,
      "loss": 1.7175,
      "num_input_tokens_seen": 12337279184,
      "step": 15681
    },
    {
      "epoch": 1.6636961595586675,
      "grad_norm": 0.36598452077635457,
      "learning_rate": 4.769138749815191e-05,
      "loss": 1.7366,
      "num_input_tokens_seen": 12338065904,
      "step": 15682
    },
    {
      "epoch": 1.663802249098239,
      "grad_norm": 0.4126323072605341,
      "learning_rate": 4.76910957998734e-05,
      "loss": 1.7692,
      "num_input_tokens_seen": 12338852720,
      "step": 15683
    },
    {
      "epoch": 1.6639083386378104,
      "grad_norm": 0.34145114306401586,
      "learning_rate": 4.7690804084059867e-05,
      "loss": 1.6385,
      "num_input_tokens_seen": 12339639472,
      "step": 15684
    },
    {
      "epoch": 1.6640144281773817,
      "grad_norm": 0.355528613418958,
      "learning_rate": 4.7690512350711545e-05,
      "loss": 1.8623,
      "num_input_tokens_seen": 12340426240,
      "step": 15685
    },
    {
      "epoch": 1.6641205177169531,
      "grad_norm": 0.44517163412703914,
      "learning_rate": 4.769022059982867e-05,
      "loss": 1.8281,
      "num_input_tokens_seen": 12341213008,
      "step": 15686
    },
    {
      "epoch": 1.6642266072565244,
      "grad_norm": 0.39968668411008945,
      "learning_rate": 4.768992883141146e-05,
      "loss": 1.8598,
      "num_input_tokens_seen": 12341999760,
      "step": 15687
    },
    {
      "epoch": 1.6643326967960959,
      "grad_norm": 0.3308531283007013,
      "learning_rate": 4.768963704546012e-05,
      "loss": 1.6776,
      "num_input_tokens_seen": 12342786560,
      "step": 15688
    },
    {
      "epoch": 1.6644387863356673,
      "grad_norm": 0.3649261146384042,
      "learning_rate": 4.768934524197491e-05,
      "loss": 1.8111,
      "num_input_tokens_seen": 12343573344,
      "step": 15689
    },
    {
      "epoch": 1.6645448758752388,
      "grad_norm": 0.36029268621097743,
      "learning_rate": 4.7689053420956044e-05,
      "loss": 1.7394,
      "num_input_tokens_seen": 12344360240,
      "step": 15690
    },
    {
      "epoch": 1.66465096541481,
      "grad_norm": 0.46649762842994874,
      "learning_rate": 4.768876158240373e-05,
      "loss": 1.7992,
      "num_input_tokens_seen": 12345146976,
      "step": 15691
    },
    {
      "epoch": 1.6647570549543815,
      "grad_norm": 0.3540047253698622,
      "learning_rate": 4.768846972631822e-05,
      "loss": 1.6176,
      "num_input_tokens_seen": 12345933808,
      "step": 15692
    },
    {
      "epoch": 1.6648631444939528,
      "grad_norm": 0.5360226238164334,
      "learning_rate": 4.768817785269971e-05,
      "loss": 1.6691,
      "num_input_tokens_seen": 12346720624,
      "step": 15693
    },
    {
      "epoch": 1.6649692340335243,
      "grad_norm": 0.5833068505946294,
      "learning_rate": 4.7687885961548454e-05,
      "loss": 1.9136,
      "num_input_tokens_seen": 12347507360,
      "step": 15694
    },
    {
      "epoch": 1.6650753235730957,
      "grad_norm": 0.3721081796000446,
      "learning_rate": 4.7687594052864665e-05,
      "loss": 1.8152,
      "num_input_tokens_seen": 12348294048,
      "step": 15695
    },
    {
      "epoch": 1.6651814131126672,
      "grad_norm": 0.49620270198877897,
      "learning_rate": 4.768730212664857e-05,
      "loss": 1.7764,
      "num_input_tokens_seen": 12349080832,
      "step": 15696
    },
    {
      "epoch": 1.6652875026522385,
      "grad_norm": 0.40945508323188046,
      "learning_rate": 4.768701018290038e-05,
      "loss": 1.7785,
      "num_input_tokens_seen": 12349867696,
      "step": 15697
    },
    {
      "epoch": 1.66539359219181,
      "grad_norm": 0.3719248298262534,
      "learning_rate": 4.768671822162035e-05,
      "loss": 1.8324,
      "num_input_tokens_seen": 12350654448,
      "step": 15698
    },
    {
      "epoch": 1.6654996817313812,
      "grad_norm": 0.5378781492122455,
      "learning_rate": 4.7686426242808685e-05,
      "loss": 1.7947,
      "num_input_tokens_seen": 12351441232,
      "step": 15699
    },
    {
      "epoch": 1.6656057712709527,
      "grad_norm": 0.42748888435155996,
      "learning_rate": 4.768613424646561e-05,
      "loss": 1.774,
      "num_input_tokens_seen": 12352228064,
      "step": 15700
    },
    {
      "epoch": 1.6657118608105241,
      "grad_norm": 0.44378324917006823,
      "learning_rate": 4.768584223259136e-05,
      "loss": 1.6009,
      "num_input_tokens_seen": 12353014768,
      "step": 15701
    },
    {
      "epoch": 1.6658179503500956,
      "grad_norm": 0.39112971865090057,
      "learning_rate": 4.768555020118616e-05,
      "loss": 1.5741,
      "num_input_tokens_seen": 12353801616,
      "step": 15702
    },
    {
      "epoch": 1.6659240398896669,
      "grad_norm": 0.5740424183860052,
      "learning_rate": 4.7685258152250236e-05,
      "loss": 1.8248,
      "num_input_tokens_seen": 12354588336,
      "step": 15703
    },
    {
      "epoch": 1.6660301294292381,
      "grad_norm": 0.659144226057728,
      "learning_rate": 4.76849660857838e-05,
      "loss": 1.6671,
      "num_input_tokens_seen": 12355375088,
      "step": 15704
    },
    {
      "epoch": 1.6661362189688096,
      "grad_norm": 0.527023779608009,
      "learning_rate": 4.7684674001787094e-05,
      "loss": 1.6771,
      "num_input_tokens_seen": 12356161984,
      "step": 15705
    },
    {
      "epoch": 1.666242308508381,
      "grad_norm": 0.4100498678988057,
      "learning_rate": 4.768438190026033e-05,
      "loss": 1.8452,
      "num_input_tokens_seen": 12356948624,
      "step": 15706
    },
    {
      "epoch": 1.6663483980479525,
      "grad_norm": 0.6160407727386933,
      "learning_rate": 4.768408978120376e-05,
      "loss": 1.6361,
      "num_input_tokens_seen": 12357735488,
      "step": 15707
    },
    {
      "epoch": 1.666454487587524,
      "grad_norm": 0.4526620108330455,
      "learning_rate": 4.768379764461757e-05,
      "loss": 1.7335,
      "num_input_tokens_seen": 12358522288,
      "step": 15708
    },
    {
      "epoch": 1.6665605771270953,
      "grad_norm": 0.8846065911235799,
      "learning_rate": 4.768350549050201e-05,
      "loss": 1.7933,
      "num_input_tokens_seen": 12359309104,
      "step": 15709
    },
    {
      "epoch": 1.6666666666666665,
      "grad_norm": 0.6629568443057908,
      "learning_rate": 4.768321331885731e-05,
      "loss": 1.7972,
      "num_input_tokens_seen": 12360095792,
      "step": 15710
    },
    {
      "epoch": 1.666772756206238,
      "grad_norm": 0.9457454674114957,
      "learning_rate": 4.7682921129683686e-05,
      "loss": 1.8141,
      "num_input_tokens_seen": 12360882576,
      "step": 15711
    },
    {
      "epoch": 1.6668788457458095,
      "grad_norm": 0.6713621738157618,
      "learning_rate": 4.7682628922981363e-05,
      "loss": 1.7665,
      "num_input_tokens_seen": 12361669344,
      "step": 15712
    },
    {
      "epoch": 1.666984935285381,
      "grad_norm": 0.5253788951370333,
      "learning_rate": 4.7682336698750574e-05,
      "loss": 1.7337,
      "num_input_tokens_seen": 12362456128,
      "step": 15713
    },
    {
      "epoch": 1.6670910248249524,
      "grad_norm": 0.7549345765340816,
      "learning_rate": 4.7682044456991536e-05,
      "loss": 1.6676,
      "num_input_tokens_seen": 12363242944,
      "step": 15714
    },
    {
      "epoch": 1.6671971143645237,
      "grad_norm": 0.5153744266200819,
      "learning_rate": 4.7681752197704487e-05,
      "loss": 1.6254,
      "num_input_tokens_seen": 12364029792,
      "step": 15715
    },
    {
      "epoch": 1.667303203904095,
      "grad_norm": 0.542738674389199,
      "learning_rate": 4.7681459920889635e-05,
      "loss": 1.6375,
      "num_input_tokens_seen": 12364816592,
      "step": 15716
    },
    {
      "epoch": 1.6674092934436664,
      "grad_norm": 0.7744494067819957,
      "learning_rate": 4.768116762654723e-05,
      "loss": 1.7288,
      "num_input_tokens_seen": 12365603392,
      "step": 15717
    },
    {
      "epoch": 1.6675153829832379,
      "grad_norm": 0.6318106628245955,
      "learning_rate": 4.7680875314677474e-05,
      "loss": 1.7785,
      "num_input_tokens_seen": 12366390224,
      "step": 15718
    },
    {
      "epoch": 1.6676214725228093,
      "grad_norm": 0.8330671005138034,
      "learning_rate": 4.7680582985280606e-05,
      "loss": 1.7028,
      "num_input_tokens_seen": 12367176992,
      "step": 15719
    },
    {
      "epoch": 1.6677275620623806,
      "grad_norm": 0.5151232591156603,
      "learning_rate": 4.768029063835685e-05,
      "loss": 1.6452,
      "num_input_tokens_seen": 12367963840,
      "step": 15720
    },
    {
      "epoch": 1.667833651601952,
      "grad_norm": 0.9954240434767995,
      "learning_rate": 4.767999827390643e-05,
      "loss": 1.7885,
      "num_input_tokens_seen": 12368750544,
      "step": 15721
    },
    {
      "epoch": 1.6679397411415233,
      "grad_norm": 0.651600446918272,
      "learning_rate": 4.7679705891929573e-05,
      "loss": 1.7907,
      "num_input_tokens_seen": 12369537408,
      "step": 15722
    },
    {
      "epoch": 1.6680458306810948,
      "grad_norm": 0.4482590373216317,
      "learning_rate": 4.76794134924265e-05,
      "loss": 1.8417,
      "num_input_tokens_seen": 12370324080,
      "step": 15723
    },
    {
      "epoch": 1.6681519202206663,
      "grad_norm": 0.6194785860600575,
      "learning_rate": 4.7679121075397445e-05,
      "loss": 1.7682,
      "num_input_tokens_seen": 12371110928,
      "step": 15724
    },
    {
      "epoch": 1.6682580097602377,
      "grad_norm": 0.548157304598294,
      "learning_rate": 4.767882864084263e-05,
      "loss": 1.8536,
      "num_input_tokens_seen": 12371897680,
      "step": 15725
    },
    {
      "epoch": 1.668364099299809,
      "grad_norm": 0.5540643359365591,
      "learning_rate": 4.767853618876229e-05,
      "loss": 1.6971,
      "num_input_tokens_seen": 12372684432,
      "step": 15726
    },
    {
      "epoch": 1.6684701888393805,
      "grad_norm": 0.6428809090789356,
      "learning_rate": 4.767824371915663e-05,
      "loss": 1.7123,
      "num_input_tokens_seen": 12373471232,
      "step": 15727
    },
    {
      "epoch": 1.6685762783789517,
      "grad_norm": 0.7035642090844642,
      "learning_rate": 4.76779512320259e-05,
      "loss": 1.7614,
      "num_input_tokens_seen": 12374257984,
      "step": 15728
    },
    {
      "epoch": 1.6686823679185232,
      "grad_norm": 0.5742987464800088,
      "learning_rate": 4.76776587273703e-05,
      "loss": 1.6828,
      "num_input_tokens_seen": 12375044784,
      "step": 15729
    },
    {
      "epoch": 1.6687884574580947,
      "grad_norm": 0.5009921969145783,
      "learning_rate": 4.767736620519009e-05,
      "loss": 1.7515,
      "num_input_tokens_seen": 12375831488,
      "step": 15730
    },
    {
      "epoch": 1.6688945469976662,
      "grad_norm": 0.6461101561132827,
      "learning_rate": 4.767707366548546e-05,
      "loss": 1.69,
      "num_input_tokens_seen": 12376618336,
      "step": 15731
    },
    {
      "epoch": 1.6690006365372374,
      "grad_norm": 0.3836753934231638,
      "learning_rate": 4.7676781108256664e-05,
      "loss": 1.5905,
      "num_input_tokens_seen": 12377405136,
      "step": 15732
    },
    {
      "epoch": 1.6691067260768089,
      "grad_norm": 0.4713266754370879,
      "learning_rate": 4.767648853350391e-05,
      "loss": 1.7382,
      "num_input_tokens_seen": 12378191840,
      "step": 15733
    },
    {
      "epoch": 1.6692128156163801,
      "grad_norm": 0.7092597499245186,
      "learning_rate": 4.767619594122743e-05,
      "loss": 1.8344,
      "num_input_tokens_seen": 12378978544,
      "step": 15734
    },
    {
      "epoch": 1.6693189051559516,
      "grad_norm": 0.4802328571233475,
      "learning_rate": 4.7675903331427455e-05,
      "loss": 1.8354,
      "num_input_tokens_seen": 12379765328,
      "step": 15735
    },
    {
      "epoch": 1.669424994695523,
      "grad_norm": 0.9124663635381064,
      "learning_rate": 4.767561070410421e-05,
      "loss": 1.8356,
      "num_input_tokens_seen": 12380552064,
      "step": 15736
    },
    {
      "epoch": 1.6695310842350946,
      "grad_norm": 0.46991200563926744,
      "learning_rate": 4.767531805925792e-05,
      "loss": 1.7262,
      "num_input_tokens_seen": 12381338848,
      "step": 15737
    },
    {
      "epoch": 1.6696371737746658,
      "grad_norm": 0.717051928668452,
      "learning_rate": 4.76750253968888e-05,
      "loss": 1.8081,
      "num_input_tokens_seen": 12382125504,
      "step": 15738
    },
    {
      "epoch": 1.669743263314237,
      "grad_norm": 0.5277523009947436,
      "learning_rate": 4.7674732716997086e-05,
      "loss": 1.8981,
      "num_input_tokens_seen": 12382912192,
      "step": 15739
    },
    {
      "epoch": 1.6698493528538085,
      "grad_norm": 0.5283519754691179,
      "learning_rate": 4.767444001958301e-05,
      "loss": 1.7238,
      "num_input_tokens_seen": 12383698896,
      "step": 15740
    },
    {
      "epoch": 1.66995544239338,
      "grad_norm": 0.6016883018159292,
      "learning_rate": 4.767414730464679e-05,
      "loss": 1.7233,
      "num_input_tokens_seen": 12384485664,
      "step": 15741
    },
    {
      "epoch": 1.6700615319329515,
      "grad_norm": 0.7381055809282261,
      "learning_rate": 4.767385457218866e-05,
      "loss": 1.7577,
      "num_input_tokens_seen": 12385272448,
      "step": 15742
    },
    {
      "epoch": 1.670167621472523,
      "grad_norm": 0.6082051528827186,
      "learning_rate": 4.7673561822208834e-05,
      "loss": 1.814,
      "num_input_tokens_seen": 12386059184,
      "step": 15743
    },
    {
      "epoch": 1.6702737110120942,
      "grad_norm": 0.6365952590680082,
      "learning_rate": 4.7673269054707546e-05,
      "loss": 1.7263,
      "num_input_tokens_seen": 12386845904,
      "step": 15744
    },
    {
      "epoch": 1.6703798005516655,
      "grad_norm": 0.5185224501811512,
      "learning_rate": 4.767297626968502e-05,
      "loss": 1.6664,
      "num_input_tokens_seen": 12387632720,
      "step": 15745
    },
    {
      "epoch": 1.670485890091237,
      "grad_norm": 0.5844185656813219,
      "learning_rate": 4.7672683467141485e-05,
      "loss": 1.6456,
      "num_input_tokens_seen": 12388419520,
      "step": 15746
    },
    {
      "epoch": 1.6705919796308084,
      "grad_norm": 0.5691308344651705,
      "learning_rate": 4.7672390647077166e-05,
      "loss": 1.6609,
      "num_input_tokens_seen": 12389206272,
      "step": 15747
    },
    {
      "epoch": 1.6706980691703799,
      "grad_norm": 0.5798689199689645,
      "learning_rate": 4.767209780949228e-05,
      "loss": 1.6631,
      "num_input_tokens_seen": 12389993040,
      "step": 15748
    },
    {
      "epoch": 1.6708041587099514,
      "grad_norm": 0.7644369654731633,
      "learning_rate": 4.767180495438707e-05,
      "loss": 1.7119,
      "num_input_tokens_seen": 12390779792,
      "step": 15749
    },
    {
      "epoch": 1.6709102482495226,
      "grad_norm": 0.43553176986055164,
      "learning_rate": 4.767151208176176e-05,
      "loss": 1.6803,
      "num_input_tokens_seen": 12391566496,
      "step": 15750
    },
    {
      "epoch": 1.6710163377890939,
      "grad_norm": 1.0837003813688484,
      "learning_rate": 4.767121919161656e-05,
      "loss": 1.7282,
      "num_input_tokens_seen": 12392353328,
      "step": 15751
    },
    {
      "epoch": 1.6711224273286653,
      "grad_norm": 0.8369100889813347,
      "learning_rate": 4.767092628395171e-05,
      "loss": 1.899,
      "num_input_tokens_seen": 12393140048,
      "step": 15752
    },
    {
      "epoch": 1.6712285168682368,
      "grad_norm": 0.8429572786167131,
      "learning_rate": 4.767063335876743e-05,
      "loss": 1.7601,
      "num_input_tokens_seen": 12393926848,
      "step": 15753
    },
    {
      "epoch": 1.6713346064078083,
      "grad_norm": 0.48893435404965957,
      "learning_rate": 4.7670340416063965e-05,
      "loss": 1.7213,
      "num_input_tokens_seen": 12394713632,
      "step": 15754
    },
    {
      "epoch": 1.6714406959473795,
      "grad_norm": 0.6440855999049776,
      "learning_rate": 4.767004745584152e-05,
      "loss": 1.8011,
      "num_input_tokens_seen": 12395500400,
      "step": 15755
    },
    {
      "epoch": 1.671546785486951,
      "grad_norm": 0.5587214794464914,
      "learning_rate": 4.7669754478100317e-05,
      "loss": 1.7098,
      "num_input_tokens_seen": 12396287216,
      "step": 15756
    },
    {
      "epoch": 1.6716528750265223,
      "grad_norm": 0.5286188851093401,
      "learning_rate": 4.7669461482840596e-05,
      "loss": 1.6283,
      "num_input_tokens_seen": 12397074032,
      "step": 15757
    },
    {
      "epoch": 1.6717589645660937,
      "grad_norm": 0.5239916612246204,
      "learning_rate": 4.766916847006259e-05,
      "loss": 1.7695,
      "num_input_tokens_seen": 12397860800,
      "step": 15758
    },
    {
      "epoch": 1.6718650541056652,
      "grad_norm": 0.641067949261041,
      "learning_rate": 4.76688754397665e-05,
      "loss": 1.8453,
      "num_input_tokens_seen": 12398647600,
      "step": 15759
    },
    {
      "epoch": 1.6719711436452367,
      "grad_norm": 0.4175706173216914,
      "learning_rate": 4.766858239195258e-05,
      "loss": 1.8414,
      "num_input_tokens_seen": 12399434320,
      "step": 15760
    },
    {
      "epoch": 1.672077233184808,
      "grad_norm": 0.4317810304455531,
      "learning_rate": 4.766828932662104e-05,
      "loss": 1.7235,
      "num_input_tokens_seen": 12400221104,
      "step": 15761
    },
    {
      "epoch": 1.6721833227243794,
      "grad_norm": 0.5095201736429475,
      "learning_rate": 4.766799624377212e-05,
      "loss": 1.7386,
      "num_input_tokens_seen": 12401007936,
      "step": 15762
    },
    {
      "epoch": 1.6722894122639507,
      "grad_norm": 0.42879780795016825,
      "learning_rate": 4.766770314340603e-05,
      "loss": 1.7565,
      "num_input_tokens_seen": 12401794640,
      "step": 15763
    },
    {
      "epoch": 1.6723955018035221,
      "grad_norm": 0.48084415445133255,
      "learning_rate": 4.7667410025523005e-05,
      "loss": 1.8903,
      "num_input_tokens_seen": 12402581440,
      "step": 15764
    },
    {
      "epoch": 1.6725015913430936,
      "grad_norm": 0.5430006297543379,
      "learning_rate": 4.766711689012326e-05,
      "loss": 1.7705,
      "num_input_tokens_seen": 12403368272,
      "step": 15765
    },
    {
      "epoch": 1.672607680882665,
      "grad_norm": 0.45721411633891634,
      "learning_rate": 4.766682373720705e-05,
      "loss": 1.7506,
      "num_input_tokens_seen": 12404155088,
      "step": 15766
    },
    {
      "epoch": 1.6727137704222363,
      "grad_norm": 0.42708735303796996,
      "learning_rate": 4.766653056677458e-05,
      "loss": 1.8234,
      "num_input_tokens_seen": 12404941872,
      "step": 15767
    },
    {
      "epoch": 1.6728198599618078,
      "grad_norm": 0.5362603215166097,
      "learning_rate": 4.7666237378826076e-05,
      "loss": 1.7997,
      "num_input_tokens_seen": 12405728560,
      "step": 15768
    },
    {
      "epoch": 1.672925949501379,
      "grad_norm": 0.5612250013093001,
      "learning_rate": 4.7665944173361767e-05,
      "loss": 1.7678,
      "num_input_tokens_seen": 12406515296,
      "step": 15769
    },
    {
      "epoch": 1.6730320390409505,
      "grad_norm": 0.4781530731221218,
      "learning_rate": 4.766565095038188e-05,
      "loss": 1.9146,
      "num_input_tokens_seen": 12407302064,
      "step": 15770
    },
    {
      "epoch": 1.673138128580522,
      "grad_norm": 0.48743640937874627,
      "learning_rate": 4.7665357709886646e-05,
      "loss": 1.8016,
      "num_input_tokens_seen": 12408088784,
      "step": 15771
    },
    {
      "epoch": 1.6732442181200935,
      "grad_norm": 0.40775467343107796,
      "learning_rate": 4.7665064451876296e-05,
      "loss": 1.8246,
      "num_input_tokens_seen": 12408875520,
      "step": 15772
    },
    {
      "epoch": 1.6733503076596647,
      "grad_norm": 0.49511178129463024,
      "learning_rate": 4.766477117635104e-05,
      "loss": 1.7462,
      "num_input_tokens_seen": 12409662320,
      "step": 15773
    },
    {
      "epoch": 1.673456397199236,
      "grad_norm": 0.4463929931076009,
      "learning_rate": 4.766447788331111e-05,
      "loss": 1.8208,
      "num_input_tokens_seen": 12410449104,
      "step": 15774
    },
    {
      "epoch": 1.6735624867388075,
      "grad_norm": 0.4613454149240098,
      "learning_rate": 4.7664184572756747e-05,
      "loss": 1.9181,
      "num_input_tokens_seen": 12411235872,
      "step": 15775
    },
    {
      "epoch": 1.673668576278379,
      "grad_norm": 0.4416205317447396,
      "learning_rate": 4.7663891244688165e-05,
      "loss": 1.7177,
      "num_input_tokens_seen": 12412022528,
      "step": 15776
    },
    {
      "epoch": 1.6737746658179504,
      "grad_norm": 0.417666312509128,
      "learning_rate": 4.766359789910559e-05,
      "loss": 1.6822,
      "num_input_tokens_seen": 12412809184,
      "step": 15777
    },
    {
      "epoch": 1.673880755357522,
      "grad_norm": 0.4286802588945269,
      "learning_rate": 4.766330453600926e-05,
      "loss": 1.8073,
      "num_input_tokens_seen": 12413596000,
      "step": 15778
    },
    {
      "epoch": 1.6739868448970932,
      "grad_norm": 0.4592556813486171,
      "learning_rate": 4.766301115539938e-05,
      "loss": 1.7354,
      "num_input_tokens_seen": 12414382752,
      "step": 15779
    },
    {
      "epoch": 1.6740929344366644,
      "grad_norm": 0.5491644717356488,
      "learning_rate": 4.76627177572762e-05,
      "loss": 1.7486,
      "num_input_tokens_seen": 12415169600,
      "step": 15780
    },
    {
      "epoch": 1.6741990239762359,
      "grad_norm": 0.37487746283301276,
      "learning_rate": 4.766242434163993e-05,
      "loss": 1.7437,
      "num_input_tokens_seen": 12415956336,
      "step": 15781
    },
    {
      "epoch": 1.6743051135158074,
      "grad_norm": 0.4124356955077268,
      "learning_rate": 4.7662130908490806e-05,
      "loss": 1.8068,
      "num_input_tokens_seen": 12416743120,
      "step": 15782
    },
    {
      "epoch": 1.6744112030553788,
      "grad_norm": 0.4009560076540509,
      "learning_rate": 4.766183745782905e-05,
      "loss": 1.7697,
      "num_input_tokens_seen": 12417529952,
      "step": 15783
    },
    {
      "epoch": 1.6745172925949503,
      "grad_norm": 0.5397413898758167,
      "learning_rate": 4.766154398965489e-05,
      "loss": 1.8096,
      "num_input_tokens_seen": 12418316688,
      "step": 15784
    },
    {
      "epoch": 1.6746233821345216,
      "grad_norm": 0.3881242131538353,
      "learning_rate": 4.766125050396856e-05,
      "loss": 1.6973,
      "num_input_tokens_seen": 12419103424,
      "step": 15785
    },
    {
      "epoch": 1.6747294716740928,
      "grad_norm": 0.47670770690139275,
      "learning_rate": 4.766095700077028e-05,
      "loss": 1.6706,
      "num_input_tokens_seen": 12419890176,
      "step": 15786
    },
    {
      "epoch": 1.6748355612136643,
      "grad_norm": 0.41383606463289613,
      "learning_rate": 4.766066348006027e-05,
      "loss": 1.6328,
      "num_input_tokens_seen": 12420677008,
      "step": 15787
    },
    {
      "epoch": 1.6749416507532358,
      "grad_norm": 0.49084964910784323,
      "learning_rate": 4.766036994183877e-05,
      "loss": 1.7976,
      "num_input_tokens_seen": 12421463680,
      "step": 15788
    },
    {
      "epoch": 1.6750477402928072,
      "grad_norm": 0.39876990353263564,
      "learning_rate": 4.7660076386106e-05,
      "loss": 1.7111,
      "num_input_tokens_seen": 12422250432,
      "step": 15789
    },
    {
      "epoch": 1.6751538298323785,
      "grad_norm": 0.49715658150123154,
      "learning_rate": 4.7659782812862186e-05,
      "loss": 1.6411,
      "num_input_tokens_seen": 12423037248,
      "step": 15790
    },
    {
      "epoch": 1.67525991937195,
      "grad_norm": 0.4455775989410266,
      "learning_rate": 4.765948922210755e-05,
      "loss": 1.7548,
      "num_input_tokens_seen": 12423823984,
      "step": 15791
    },
    {
      "epoch": 1.6753660089115212,
      "grad_norm": 0.45471654022035773,
      "learning_rate": 4.765919561384234e-05,
      "loss": 1.6518,
      "num_input_tokens_seen": 12424610752,
      "step": 15792
    },
    {
      "epoch": 1.6754720984510927,
      "grad_norm": 0.39444881192092074,
      "learning_rate": 4.765890198806676e-05,
      "loss": 1.7176,
      "num_input_tokens_seen": 12425397552,
      "step": 15793
    },
    {
      "epoch": 1.6755781879906642,
      "grad_norm": 0.639447476870626,
      "learning_rate": 4.7658608344781054e-05,
      "loss": 1.691,
      "num_input_tokens_seen": 12426184320,
      "step": 15794
    },
    {
      "epoch": 1.6756842775302356,
      "grad_norm": 0.6413840243659256,
      "learning_rate": 4.7658314683985436e-05,
      "loss": 1.7819,
      "num_input_tokens_seen": 12426971152,
      "step": 15795
    },
    {
      "epoch": 1.6757903670698069,
      "grad_norm": 0.4797190064246441,
      "learning_rate": 4.765802100568013e-05,
      "loss": 1.6342,
      "num_input_tokens_seen": 12427757936,
      "step": 15796
    },
    {
      "epoch": 1.6758964566093784,
      "grad_norm": 0.5745789904356583,
      "learning_rate": 4.765772730986538e-05,
      "loss": 1.6149,
      "num_input_tokens_seen": 12428544608,
      "step": 15797
    },
    {
      "epoch": 1.6760025461489496,
      "grad_norm": 0.4576969923221648,
      "learning_rate": 4.7657433596541404e-05,
      "loss": 1.6904,
      "num_input_tokens_seen": 12429331328,
      "step": 15798
    },
    {
      "epoch": 1.676108635688521,
      "grad_norm": 0.5656323961310049,
      "learning_rate": 4.765713986570842e-05,
      "loss": 1.7387,
      "num_input_tokens_seen": 12430118048,
      "step": 15799
    },
    {
      "epoch": 1.6762147252280926,
      "grad_norm": 0.47917906272808664,
      "learning_rate": 4.765684611736666e-05,
      "loss": 1.8551,
      "num_input_tokens_seen": 12430904736,
      "step": 15800
    },
    {
      "epoch": 1.676320814767664,
      "grad_norm": 0.7168708397671076,
      "learning_rate": 4.765655235151636e-05,
      "loss": 1.8016,
      "num_input_tokens_seen": 12431691504,
      "step": 15801
    },
    {
      "epoch": 1.6764269043072353,
      "grad_norm": 0.6539107132084762,
      "learning_rate": 4.765625856815774e-05,
      "loss": 1.7647,
      "num_input_tokens_seen": 12432478272,
      "step": 15802
    },
    {
      "epoch": 1.6765329938468065,
      "grad_norm": 0.5747061174223336,
      "learning_rate": 4.765596476729103e-05,
      "loss": 1.7818,
      "num_input_tokens_seen": 12433265056,
      "step": 15803
    },
    {
      "epoch": 1.676639083386378,
      "grad_norm": 0.40833022149503106,
      "learning_rate": 4.765567094891645e-05,
      "loss": 1.6148,
      "num_input_tokens_seen": 12434051840,
      "step": 15804
    },
    {
      "epoch": 1.6767451729259495,
      "grad_norm": 0.49738629756419683,
      "learning_rate": 4.7655377113034244e-05,
      "loss": 1.6767,
      "num_input_tokens_seen": 12434838672,
      "step": 15805
    },
    {
      "epoch": 1.676851262465521,
      "grad_norm": 0.4795278254056059,
      "learning_rate": 4.765508325964462e-05,
      "loss": 1.7147,
      "num_input_tokens_seen": 12435625488,
      "step": 15806
    },
    {
      "epoch": 1.6769573520050924,
      "grad_norm": 0.4566915724551819,
      "learning_rate": 4.765478938874781e-05,
      "loss": 1.7501,
      "num_input_tokens_seen": 12436412240,
      "step": 15807
    },
    {
      "epoch": 1.6770634415446637,
      "grad_norm": 0.450912907011821,
      "learning_rate": 4.765449550034405e-05,
      "loss": 1.7624,
      "num_input_tokens_seen": 12437198992,
      "step": 15808
    },
    {
      "epoch": 1.677169531084235,
      "grad_norm": 0.4252733720894757,
      "learning_rate": 4.765420159443356e-05,
      "loss": 1.7429,
      "num_input_tokens_seen": 12437985760,
      "step": 15809
    },
    {
      "epoch": 1.6772756206238064,
      "grad_norm": 0.46829927300332747,
      "learning_rate": 4.765390767101656e-05,
      "loss": 1.7917,
      "num_input_tokens_seen": 12438772560,
      "step": 15810
    },
    {
      "epoch": 1.677381710163378,
      "grad_norm": 0.38284199434714594,
      "learning_rate": 4.765361373009329e-05,
      "loss": 1.6865,
      "num_input_tokens_seen": 12439559296,
      "step": 15811
    },
    {
      "epoch": 1.6774877997029494,
      "grad_norm": 0.49933528542710826,
      "learning_rate": 4.765331977166397e-05,
      "loss": 1.7858,
      "num_input_tokens_seen": 12440345984,
      "step": 15812
    },
    {
      "epoch": 1.6775938892425208,
      "grad_norm": 0.3928925149787254,
      "learning_rate": 4.765302579572883e-05,
      "loss": 1.6423,
      "num_input_tokens_seen": 12441132784,
      "step": 15813
    },
    {
      "epoch": 1.677699978782092,
      "grad_norm": 0.3626768956018808,
      "learning_rate": 4.7652731802288097e-05,
      "loss": 1.6401,
      "num_input_tokens_seen": 12441919536,
      "step": 15814
    },
    {
      "epoch": 1.6778060683216633,
      "grad_norm": 0.4222111790530195,
      "learning_rate": 4.7652437791342e-05,
      "loss": 1.8236,
      "num_input_tokens_seen": 12442706224,
      "step": 15815
    },
    {
      "epoch": 1.6779121578612348,
      "grad_norm": 0.41972222549587795,
      "learning_rate": 4.7652143762890756e-05,
      "loss": 1.761,
      "num_input_tokens_seen": 12443492880,
      "step": 15816
    },
    {
      "epoch": 1.6780182474008063,
      "grad_norm": 0.4414521125985053,
      "learning_rate": 4.7651849716934606e-05,
      "loss": 1.5618,
      "num_input_tokens_seen": 12444279840,
      "step": 15817
    },
    {
      "epoch": 1.6781243369403778,
      "grad_norm": 0.3945224580339018,
      "learning_rate": 4.765155565347377e-05,
      "loss": 1.754,
      "num_input_tokens_seen": 12445066608,
      "step": 15818
    },
    {
      "epoch": 1.678230426479949,
      "grad_norm": 0.4180638261673762,
      "learning_rate": 4.7651261572508474e-05,
      "loss": 1.8206,
      "num_input_tokens_seen": 12445853248,
      "step": 15819
    },
    {
      "epoch": 1.6783365160195205,
      "grad_norm": 0.40926580059999895,
      "learning_rate": 4.765096747403895e-05,
      "loss": 1.7599,
      "num_input_tokens_seen": 12446640064,
      "step": 15820
    },
    {
      "epoch": 1.6784426055590917,
      "grad_norm": 0.5365093705339556,
      "learning_rate": 4.7650673358065425e-05,
      "loss": 1.8331,
      "num_input_tokens_seen": 12447426752,
      "step": 15821
    },
    {
      "epoch": 1.6785486950986632,
      "grad_norm": 0.3777683695373482,
      "learning_rate": 4.7650379224588126e-05,
      "loss": 1.7427,
      "num_input_tokens_seen": 12448213552,
      "step": 15822
    },
    {
      "epoch": 1.6786547846382347,
      "grad_norm": 0.47814279568969864,
      "learning_rate": 4.765008507360728e-05,
      "loss": 1.7213,
      "num_input_tokens_seen": 12449000304,
      "step": 15823
    },
    {
      "epoch": 1.6787608741778062,
      "grad_norm": 0.4013509539934241,
      "learning_rate": 4.76497909051231e-05,
      "loss": 1.8105,
      "num_input_tokens_seen": 12449787056,
      "step": 15824
    },
    {
      "epoch": 1.6788669637173774,
      "grad_norm": 0.4136522906446728,
      "learning_rate": 4.764949671913583e-05,
      "loss": 1.8556,
      "num_input_tokens_seen": 12450573776,
      "step": 15825
    },
    {
      "epoch": 1.678973053256949,
      "grad_norm": 0.4451914733458534,
      "learning_rate": 4.76492025156457e-05,
      "loss": 1.8281,
      "num_input_tokens_seen": 12451360576,
      "step": 15826
    },
    {
      "epoch": 1.6790791427965202,
      "grad_norm": 0.541180116718247,
      "learning_rate": 4.7648908294652925e-05,
      "loss": 1.764,
      "num_input_tokens_seen": 12452147280,
      "step": 15827
    },
    {
      "epoch": 1.6791852323360916,
      "grad_norm": 0.3792888271840975,
      "learning_rate": 4.764861405615775e-05,
      "loss": 1.7021,
      "num_input_tokens_seen": 12452933936,
      "step": 15828
    },
    {
      "epoch": 1.679291321875663,
      "grad_norm": 0.48974902747351284,
      "learning_rate": 4.764831980016038e-05,
      "loss": 1.807,
      "num_input_tokens_seen": 12453720720,
      "step": 15829
    },
    {
      "epoch": 1.6793974114152346,
      "grad_norm": 0.4242251127013911,
      "learning_rate": 4.7648025526661055e-05,
      "loss": 1.7729,
      "num_input_tokens_seen": 12454507472,
      "step": 15830
    },
    {
      "epoch": 1.6795035009548058,
      "grad_norm": 0.4979718419204957,
      "learning_rate": 4.7647731235659995e-05,
      "loss": 1.7955,
      "num_input_tokens_seen": 12455294240,
      "step": 15831
    },
    {
      "epoch": 1.6796095904943773,
      "grad_norm": 0.427225526921049,
      "learning_rate": 4.764743692715744e-05,
      "loss": 1.5921,
      "num_input_tokens_seen": 12456080992,
      "step": 15832
    },
    {
      "epoch": 1.6797156800339486,
      "grad_norm": 0.6615058482198455,
      "learning_rate": 4.764714260115361e-05,
      "loss": 1.6858,
      "num_input_tokens_seen": 12456867856,
      "step": 15833
    },
    {
      "epoch": 1.67982176957352,
      "grad_norm": 0.3797204117209874,
      "learning_rate": 4.764684825764874e-05,
      "loss": 1.8043,
      "num_input_tokens_seen": 12457654576,
      "step": 15834
    },
    {
      "epoch": 1.6799278591130915,
      "grad_norm": 0.46791349310522606,
      "learning_rate": 4.7646553896643034e-05,
      "loss": 1.6413,
      "num_input_tokens_seen": 12458441344,
      "step": 15835
    },
    {
      "epoch": 1.680033948652663,
      "grad_norm": 0.47439200560315337,
      "learning_rate": 4.764625951813674e-05,
      "loss": 1.8704,
      "num_input_tokens_seen": 12459228080,
      "step": 15836
    },
    {
      "epoch": 1.6801400381922342,
      "grad_norm": 0.3884229053762576,
      "learning_rate": 4.7645965122130084e-05,
      "loss": 1.9075,
      "num_input_tokens_seen": 12460014736,
      "step": 15837
    },
    {
      "epoch": 1.6802461277318055,
      "grad_norm": 0.5487184052905903,
      "learning_rate": 4.764567070862329e-05,
      "loss": 1.8764,
      "num_input_tokens_seen": 12460801520,
      "step": 15838
    },
    {
      "epoch": 1.680352217271377,
      "grad_norm": 0.4293018145862926,
      "learning_rate": 4.764537627761659e-05,
      "loss": 1.708,
      "num_input_tokens_seen": 12461588352,
      "step": 15839
    },
    {
      "epoch": 1.6804583068109484,
      "grad_norm": 0.4694694142213638,
      "learning_rate": 4.764508182911021e-05,
      "loss": 1.815,
      "num_input_tokens_seen": 12462375056,
      "step": 15840
    },
    {
      "epoch": 1.68056439635052,
      "grad_norm": 0.40603039845284156,
      "learning_rate": 4.764478736310436e-05,
      "loss": 1.6485,
      "num_input_tokens_seen": 12463161792,
      "step": 15841
    },
    {
      "epoch": 1.6806704858900914,
      "grad_norm": 0.4982601225316394,
      "learning_rate": 4.76444928795993e-05,
      "loss": 1.868,
      "num_input_tokens_seen": 12463948592,
      "step": 15842
    },
    {
      "epoch": 1.6807765754296626,
      "grad_norm": 0.4279673531711181,
      "learning_rate": 4.764419837859523e-05,
      "loss": 1.8176,
      "num_input_tokens_seen": 12464735328,
      "step": 15843
    },
    {
      "epoch": 1.6808826649692339,
      "grad_norm": 0.48987536762234285,
      "learning_rate": 4.7643903860092394e-05,
      "loss": 1.754,
      "num_input_tokens_seen": 12465522160,
      "step": 15844
    },
    {
      "epoch": 1.6809887545088054,
      "grad_norm": 0.37627660528558554,
      "learning_rate": 4.764360932409101e-05,
      "loss": 1.8133,
      "num_input_tokens_seen": 12466308912,
      "step": 15845
    },
    {
      "epoch": 1.6810948440483768,
      "grad_norm": 0.3621471289069238,
      "learning_rate": 4.764331477059131e-05,
      "loss": 1.5828,
      "num_input_tokens_seen": 12467095728,
      "step": 15846
    },
    {
      "epoch": 1.6812009335879483,
      "grad_norm": 0.3727841198136962,
      "learning_rate": 4.764302019959352e-05,
      "loss": 1.6702,
      "num_input_tokens_seen": 12467882480,
      "step": 15847
    },
    {
      "epoch": 1.6813070231275198,
      "grad_norm": 0.42097359823634495,
      "learning_rate": 4.764272561109787e-05,
      "loss": 1.8847,
      "num_input_tokens_seen": 12468669168,
      "step": 15848
    },
    {
      "epoch": 1.681413112667091,
      "grad_norm": 0.4285397192107768,
      "learning_rate": 4.764243100510458e-05,
      "loss": 1.7504,
      "num_input_tokens_seen": 12469455936,
      "step": 15849
    },
    {
      "epoch": 1.6815192022066623,
      "grad_norm": 0.36474921586184983,
      "learning_rate": 4.764213638161389e-05,
      "loss": 1.7492,
      "num_input_tokens_seen": 12470242736,
      "step": 15850
    },
    {
      "epoch": 1.6816252917462338,
      "grad_norm": 0.33364100687169074,
      "learning_rate": 4.764184174062602e-05,
      "loss": 1.7119,
      "num_input_tokens_seen": 12471029584,
      "step": 15851
    },
    {
      "epoch": 1.6817313812858052,
      "grad_norm": 0.4877750126348068,
      "learning_rate": 4.76415470821412e-05,
      "loss": 1.7267,
      "num_input_tokens_seen": 12471816256,
      "step": 15852
    },
    {
      "epoch": 1.6818374708253767,
      "grad_norm": 0.42939164586378775,
      "learning_rate": 4.764125240615965e-05,
      "loss": 1.781,
      "num_input_tokens_seen": 12472602976,
      "step": 15853
    },
    {
      "epoch": 1.681943560364948,
      "grad_norm": 0.3827148260218484,
      "learning_rate": 4.764095771268161e-05,
      "loss": 1.6841,
      "num_input_tokens_seen": 12473389680,
      "step": 15854
    },
    {
      "epoch": 1.6820496499045194,
      "grad_norm": 0.39035332279148166,
      "learning_rate": 4.764066300170731e-05,
      "loss": 1.7426,
      "num_input_tokens_seen": 12474176352,
      "step": 15855
    },
    {
      "epoch": 1.6821557394440907,
      "grad_norm": 0.34666880142564255,
      "learning_rate": 4.764036827323696e-05,
      "loss": 1.7696,
      "num_input_tokens_seen": 12474963056,
      "step": 15856
    },
    {
      "epoch": 1.6822618289836622,
      "grad_norm": 0.4447642922146628,
      "learning_rate": 4.7640073527270804e-05,
      "loss": 1.8216,
      "num_input_tokens_seen": 12475749888,
      "step": 15857
    },
    {
      "epoch": 1.6823679185232336,
      "grad_norm": 0.34203918251480536,
      "learning_rate": 4.763977876380905e-05,
      "loss": 1.6701,
      "num_input_tokens_seen": 12476536704,
      "step": 15858
    },
    {
      "epoch": 1.6824740080628051,
      "grad_norm": 0.3606082118420314,
      "learning_rate": 4.763948398285195e-05,
      "loss": 1.7685,
      "num_input_tokens_seen": 12477323488,
      "step": 15859
    },
    {
      "epoch": 1.6825800976023764,
      "grad_norm": 0.3569699709759862,
      "learning_rate": 4.763918918439972e-05,
      "loss": 1.6649,
      "num_input_tokens_seen": 12478110352,
      "step": 15860
    },
    {
      "epoch": 1.6826861871419478,
      "grad_norm": 0.34426760734616213,
      "learning_rate": 4.763889436845259e-05,
      "loss": 1.6872,
      "num_input_tokens_seen": 12478897056,
      "step": 15861
    },
    {
      "epoch": 1.682792276681519,
      "grad_norm": 0.425155581519979,
      "learning_rate": 4.763859953501079e-05,
      "loss": 1.6675,
      "num_input_tokens_seen": 12479683840,
      "step": 15862
    },
    {
      "epoch": 1.6828983662210906,
      "grad_norm": 0.3863966220468226,
      "learning_rate": 4.7638304684074534e-05,
      "loss": 1.7499,
      "num_input_tokens_seen": 12480470656,
      "step": 15863
    },
    {
      "epoch": 1.683004455760662,
      "grad_norm": 0.37488072525025784,
      "learning_rate": 4.7638009815644066e-05,
      "loss": 1.8584,
      "num_input_tokens_seen": 12481257392,
      "step": 15864
    },
    {
      "epoch": 1.6831105453002335,
      "grad_norm": 0.3134336034544075,
      "learning_rate": 4.763771492971961e-05,
      "loss": 1.7297,
      "num_input_tokens_seen": 12482044112,
      "step": 15865
    },
    {
      "epoch": 1.6832166348398048,
      "grad_norm": 0.4025439586362928,
      "learning_rate": 4.7637420026301397e-05,
      "loss": 1.6921,
      "num_input_tokens_seen": 12482830912,
      "step": 15866
    },
    {
      "epoch": 1.6833227243793762,
      "grad_norm": 0.32798246344263915,
      "learning_rate": 4.7637125105389635e-05,
      "loss": 1.7494,
      "num_input_tokens_seen": 12483617680,
      "step": 15867
    },
    {
      "epoch": 1.6834288139189475,
      "grad_norm": 0.32448285402479765,
      "learning_rate": 4.763683016698458e-05,
      "loss": 1.7453,
      "num_input_tokens_seen": 12484404480,
      "step": 15868
    },
    {
      "epoch": 1.683534903458519,
      "grad_norm": 0.36978060937966806,
      "learning_rate": 4.7636535211086444e-05,
      "loss": 1.7854,
      "num_input_tokens_seen": 12485191232,
      "step": 15869
    },
    {
      "epoch": 1.6836409929980904,
      "grad_norm": 0.352559540104137,
      "learning_rate": 4.763624023769545e-05,
      "loss": 1.7166,
      "num_input_tokens_seen": 12485978016,
      "step": 15870
    },
    {
      "epoch": 1.683747082537662,
      "grad_norm": 0.43854716627137863,
      "learning_rate": 4.763594524681184e-05,
      "loss": 1.7564,
      "num_input_tokens_seen": 12486764864,
      "step": 15871
    },
    {
      "epoch": 1.6838531720772332,
      "grad_norm": 0.4804785281904984,
      "learning_rate": 4.7635650238435836e-05,
      "loss": 1.6854,
      "num_input_tokens_seen": 12487551568,
      "step": 15872
    },
    {
      "epoch": 1.6839592616168044,
      "grad_norm": 2.464087679549834,
      "learning_rate": 4.7635355212567666e-05,
      "loss": 1.8382,
      "num_input_tokens_seen": 12488338320,
      "step": 15873
    },
    {
      "epoch": 1.684065351156376,
      "grad_norm": 0.519196983251635,
      "learning_rate": 4.7635060169207555e-05,
      "loss": 1.7122,
      "num_input_tokens_seen": 12489125120,
      "step": 15874
    },
    {
      "epoch": 1.6841714406959474,
      "grad_norm": 2.832945449594599,
      "learning_rate": 4.763476510835574e-05,
      "loss": 1.865,
      "num_input_tokens_seen": 12489911888,
      "step": 15875
    },
    {
      "epoch": 1.6842775302355188,
      "grad_norm": 0.4189608357005091,
      "learning_rate": 4.7634470030012435e-05,
      "loss": 1.6814,
      "num_input_tokens_seen": 12490698672,
      "step": 15876
    },
    {
      "epoch": 1.6843836197750903,
      "grad_norm": 2.0076834510841133,
      "learning_rate": 4.763417493417788e-05,
      "loss": 1.9023,
      "num_input_tokens_seen": 12491485376,
      "step": 15877
    },
    {
      "epoch": 1.6844897093146616,
      "grad_norm": 0.4619176040964881,
      "learning_rate": 4.76338798208523e-05,
      "loss": 1.7607,
      "num_input_tokens_seen": 12492272144,
      "step": 15878
    },
    {
      "epoch": 1.6845957988542328,
      "grad_norm": 0.9889175619206491,
      "learning_rate": 4.763358469003591e-05,
      "loss": 1.8211,
      "num_input_tokens_seen": 12493058832,
      "step": 15879
    },
    {
      "epoch": 1.6847018883938043,
      "grad_norm": 0.3744375472509571,
      "learning_rate": 4.763328954172897e-05,
      "loss": 1.6713,
      "num_input_tokens_seen": 12493845616,
      "step": 15880
    },
    {
      "epoch": 1.6848079779333758,
      "grad_norm": 0.6847628193758502,
      "learning_rate": 4.7632994375931673e-05,
      "loss": 1.5872,
      "num_input_tokens_seen": 12494632368,
      "step": 15881
    },
    {
      "epoch": 1.6849140674729473,
      "grad_norm": 0.43999322576264577,
      "learning_rate": 4.763269919264427e-05,
      "loss": 1.6882,
      "num_input_tokens_seen": 12495419104,
      "step": 15882
    },
    {
      "epoch": 1.6850201570125187,
      "grad_norm": 0.6542919528940252,
      "learning_rate": 4.763240399186698e-05,
      "loss": 1.7224,
      "num_input_tokens_seen": 12496205856,
      "step": 15883
    },
    {
      "epoch": 1.68512624655209,
      "grad_norm": 0.4751082585726587,
      "learning_rate": 4.7632108773600025e-05,
      "loss": 1.6672,
      "num_input_tokens_seen": 12496992576,
      "step": 15884
    },
    {
      "epoch": 1.6852323360916612,
      "grad_norm": 0.42756693292566444,
      "learning_rate": 4.7631813537843644e-05,
      "loss": 1.6975,
      "num_input_tokens_seen": 12497779392,
      "step": 15885
    },
    {
      "epoch": 1.6853384256312327,
      "grad_norm": 0.46850978663630305,
      "learning_rate": 4.7631518284598065e-05,
      "loss": 1.7175,
      "num_input_tokens_seen": 12498566128,
      "step": 15886
    },
    {
      "epoch": 1.6854445151708042,
      "grad_norm": 0.488683125833154,
      "learning_rate": 4.7631223013863505e-05,
      "loss": 1.7815,
      "num_input_tokens_seen": 12499352816,
      "step": 15887
    },
    {
      "epoch": 1.6855506047103757,
      "grad_norm": 0.32997527754015676,
      "learning_rate": 4.763092772564021e-05,
      "loss": 1.578,
      "num_input_tokens_seen": 12500139616,
      "step": 15888
    },
    {
      "epoch": 1.685656694249947,
      "grad_norm": 0.44689022825836966,
      "learning_rate": 4.7630632419928386e-05,
      "loss": 1.585,
      "num_input_tokens_seen": 12500926480,
      "step": 15889
    },
    {
      "epoch": 1.6857627837895184,
      "grad_norm": 0.5062701334684317,
      "learning_rate": 4.763033709672828e-05,
      "loss": 1.7297,
      "num_input_tokens_seen": 12501713264,
      "step": 15890
    },
    {
      "epoch": 1.6858688733290896,
      "grad_norm": 0.4451526955001302,
      "learning_rate": 4.763004175604012e-05,
      "loss": 1.7298,
      "num_input_tokens_seen": 12502499968,
      "step": 15891
    },
    {
      "epoch": 1.685974962868661,
      "grad_norm": 0.44706407573289925,
      "learning_rate": 4.762974639786412e-05,
      "loss": 1.6031,
      "num_input_tokens_seen": 12503286768,
      "step": 15892
    },
    {
      "epoch": 1.6860810524082326,
      "grad_norm": 0.5533498056409153,
      "learning_rate": 4.7629451022200525e-05,
      "loss": 1.9501,
      "num_input_tokens_seen": 12504073552,
      "step": 15893
    },
    {
      "epoch": 1.686187141947804,
      "grad_norm": 0.5994071288761981,
      "learning_rate": 4.7629155629049545e-05,
      "loss": 1.889,
      "num_input_tokens_seen": 12504860352,
      "step": 15894
    },
    {
      "epoch": 1.6862932314873753,
      "grad_norm": 0.4104414180712834,
      "learning_rate": 4.762886021841142e-05,
      "loss": 1.7069,
      "num_input_tokens_seen": 12505647120,
      "step": 15895
    },
    {
      "epoch": 1.6863993210269468,
      "grad_norm": 0.6326818213822855,
      "learning_rate": 4.7628564790286376e-05,
      "loss": 1.6952,
      "num_input_tokens_seen": 12506433888,
      "step": 15896
    },
    {
      "epoch": 1.686505410566518,
      "grad_norm": 0.35637446313492,
      "learning_rate": 4.7628269344674635e-05,
      "loss": 1.7025,
      "num_input_tokens_seen": 12507220656,
      "step": 15897
    },
    {
      "epoch": 1.6866115001060895,
      "grad_norm": 0.6656308914896294,
      "learning_rate": 4.762797388157644e-05,
      "loss": 1.7341,
      "num_input_tokens_seen": 12508007376,
      "step": 15898
    },
    {
      "epoch": 1.686717589645661,
      "grad_norm": 0.5098760666286454,
      "learning_rate": 4.7627678400992e-05,
      "loss": 1.7591,
      "num_input_tokens_seen": 12508794096,
      "step": 15899
    },
    {
      "epoch": 1.6868236791852325,
      "grad_norm": 0.4768479551998991,
      "learning_rate": 4.762738290292157e-05,
      "loss": 1.648,
      "num_input_tokens_seen": 12509580912,
      "step": 15900
    },
    {
      "epoch": 1.6869297687248037,
      "grad_norm": 0.6164741810941986,
      "learning_rate": 4.762708738736535e-05,
      "loss": 1.7761,
      "num_input_tokens_seen": 12510367744,
      "step": 15901
    },
    {
      "epoch": 1.6870358582643752,
      "grad_norm": 0.42632717037947104,
      "learning_rate": 4.762679185432359e-05,
      "loss": 1.7744,
      "num_input_tokens_seen": 12511154576,
      "step": 15902
    },
    {
      "epoch": 1.6871419478039464,
      "grad_norm": 0.5823954007798997,
      "learning_rate": 4.76264963037965e-05,
      "loss": 1.7358,
      "num_input_tokens_seen": 12511941344,
      "step": 15903
    },
    {
      "epoch": 1.687248037343518,
      "grad_norm": 0.38544845132664596,
      "learning_rate": 4.762620073578432e-05,
      "loss": 1.6891,
      "num_input_tokens_seen": 12512728096,
      "step": 15904
    },
    {
      "epoch": 1.6873541268830894,
      "grad_norm": 0.7206710273729683,
      "learning_rate": 4.762590515028728e-05,
      "loss": 1.9318,
      "num_input_tokens_seen": 12513514736,
      "step": 15905
    },
    {
      "epoch": 1.6874602164226609,
      "grad_norm": 0.43533730352608085,
      "learning_rate": 4.762560954730561e-05,
      "loss": 1.859,
      "num_input_tokens_seen": 12514301520,
      "step": 15906
    },
    {
      "epoch": 1.6875663059622321,
      "grad_norm": 0.7536679422171472,
      "learning_rate": 4.762531392683952e-05,
      "loss": 1.7168,
      "num_input_tokens_seen": 12515088272,
      "step": 15907
    },
    {
      "epoch": 1.6876723955018034,
      "grad_norm": 0.3837393092402138,
      "learning_rate": 4.7625018288889255e-05,
      "loss": 1.767,
      "num_input_tokens_seen": 12515875072,
      "step": 15908
    },
    {
      "epoch": 1.6877784850413748,
      "grad_norm": 0.919036385153113,
      "learning_rate": 4.7624722633455045e-05,
      "loss": 1.859,
      "num_input_tokens_seen": 12516661856,
      "step": 15909
    },
    {
      "epoch": 1.6878845745809463,
      "grad_norm": 0.3996866007820605,
      "learning_rate": 4.7624426960537106e-05,
      "loss": 1.8573,
      "num_input_tokens_seen": 12517448560,
      "step": 15910
    },
    {
      "epoch": 1.6879906641205178,
      "grad_norm": 0.7591042557827962,
      "learning_rate": 4.7624131270135675e-05,
      "loss": 1.6962,
      "num_input_tokens_seen": 12518235296,
      "step": 15911
    },
    {
      "epoch": 1.6880967536600893,
      "grad_norm": 0.42553216560141216,
      "learning_rate": 4.762383556225098e-05,
      "loss": 1.7381,
      "num_input_tokens_seen": 12519022080,
      "step": 15912
    },
    {
      "epoch": 1.6882028431996605,
      "grad_norm": 0.4659937301255737,
      "learning_rate": 4.7623539836883245e-05,
      "loss": 1.7455,
      "num_input_tokens_seen": 12519808912,
      "step": 15913
    },
    {
      "epoch": 1.6883089327392318,
      "grad_norm": 0.49763413079254204,
      "learning_rate": 4.7623244094032714e-05,
      "loss": 1.6664,
      "num_input_tokens_seen": 12520595664,
      "step": 15914
    },
    {
      "epoch": 1.6884150222788032,
      "grad_norm": 0.4528807606189211,
      "learning_rate": 4.762294833369959e-05,
      "loss": 1.8696,
      "num_input_tokens_seen": 12521382464,
      "step": 15915
    },
    {
      "epoch": 1.6885211118183747,
      "grad_norm": 0.5121625126554809,
      "learning_rate": 4.762265255588413e-05,
      "loss": 1.8274,
      "num_input_tokens_seen": 12522169312,
      "step": 15916
    },
    {
      "epoch": 1.6886272013579462,
      "grad_norm": 0.3658030939656665,
      "learning_rate": 4.762235676058654e-05,
      "loss": 1.6416,
      "num_input_tokens_seen": 12522956112,
      "step": 15917
    },
    {
      "epoch": 1.6887332908975177,
      "grad_norm": 0.43151759129601425,
      "learning_rate": 4.762206094780705e-05,
      "loss": 1.6748,
      "num_input_tokens_seen": 12523742864,
      "step": 15918
    },
    {
      "epoch": 1.688839380437089,
      "grad_norm": 0.3782726299275766,
      "learning_rate": 4.76217651175459e-05,
      "loss": 1.6241,
      "num_input_tokens_seen": 12524529648,
      "step": 15919
    },
    {
      "epoch": 1.6889454699766602,
      "grad_norm": 0.39148212416239475,
      "learning_rate": 4.762146926980332e-05,
      "loss": 1.7261,
      "num_input_tokens_seen": 12525316416,
      "step": 15920
    },
    {
      "epoch": 1.6890515595162316,
      "grad_norm": 0.4310166636027367,
      "learning_rate": 4.7621173404579524e-05,
      "loss": 1.7556,
      "num_input_tokens_seen": 12526103120,
      "step": 15921
    },
    {
      "epoch": 1.6891576490558031,
      "grad_norm": 0.43762973462488663,
      "learning_rate": 4.762087752187475e-05,
      "loss": 1.8075,
      "num_input_tokens_seen": 12526889888,
      "step": 15922
    },
    {
      "epoch": 1.6892637385953746,
      "grad_norm": 0.3612961809448345,
      "learning_rate": 4.762058162168923e-05,
      "loss": 1.6888,
      "num_input_tokens_seen": 12527676688,
      "step": 15923
    },
    {
      "epoch": 1.6893698281349459,
      "grad_norm": 0.3860940990950306,
      "learning_rate": 4.7620285704023185e-05,
      "loss": 1.7402,
      "num_input_tokens_seen": 12528463472,
      "step": 15924
    },
    {
      "epoch": 1.6894759176745173,
      "grad_norm": 0.457657576596522,
      "learning_rate": 4.761998976887685e-05,
      "loss": 1.8331,
      "num_input_tokens_seen": 12529250304,
      "step": 15925
    },
    {
      "epoch": 1.6895820072140886,
      "grad_norm": 0.3882748532559716,
      "learning_rate": 4.761969381625045e-05,
      "loss": 1.6091,
      "num_input_tokens_seen": 12530037056,
      "step": 15926
    },
    {
      "epoch": 1.68968809675366,
      "grad_norm": 0.4959007822301514,
      "learning_rate": 4.761939784614421e-05,
      "loss": 1.7289,
      "num_input_tokens_seen": 12530823792,
      "step": 15927
    },
    {
      "epoch": 1.6897941862932315,
      "grad_norm": 0.3801390650163947,
      "learning_rate": 4.761910185855837e-05,
      "loss": 1.8244,
      "num_input_tokens_seen": 12531610640,
      "step": 15928
    },
    {
      "epoch": 1.689900275832803,
      "grad_norm": 0.432193636350223,
      "learning_rate": 4.7618805853493145e-05,
      "loss": 1.8706,
      "num_input_tokens_seen": 12532397456,
      "step": 15929
    },
    {
      "epoch": 1.6900063653723743,
      "grad_norm": 0.42453523354470923,
      "learning_rate": 4.761850983094878e-05,
      "loss": 1.9564,
      "num_input_tokens_seen": 12533184192,
      "step": 15930
    },
    {
      "epoch": 1.6901124549119457,
      "grad_norm": 0.49999228450254185,
      "learning_rate": 4.761821379092548e-05,
      "loss": 1.7685,
      "num_input_tokens_seen": 12533970912,
      "step": 15931
    },
    {
      "epoch": 1.690218544451517,
      "grad_norm": 0.4647024300750899,
      "learning_rate": 4.76179177334235e-05,
      "loss": 1.7126,
      "num_input_tokens_seen": 12534757632,
      "step": 15932
    },
    {
      "epoch": 1.6903246339910885,
      "grad_norm": 0.36066876362978306,
      "learning_rate": 4.761762165844305e-05,
      "loss": 1.6384,
      "num_input_tokens_seen": 12535544480,
      "step": 15933
    },
    {
      "epoch": 1.69043072353066,
      "grad_norm": 0.3750015883946256,
      "learning_rate": 4.761732556598436e-05,
      "loss": 1.8533,
      "num_input_tokens_seen": 12536331200,
      "step": 15934
    },
    {
      "epoch": 1.6905368130702314,
      "grad_norm": 0.4354686872242244,
      "learning_rate": 4.7617029456047676e-05,
      "loss": 1.7023,
      "num_input_tokens_seen": 12537118016,
      "step": 15935
    },
    {
      "epoch": 1.6906429026098027,
      "grad_norm": 0.384520132081919,
      "learning_rate": 4.761673332863321e-05,
      "loss": 1.8591,
      "num_input_tokens_seen": 12537904768,
      "step": 15936
    },
    {
      "epoch": 1.690748992149374,
      "grad_norm": 0.42816490470409885,
      "learning_rate": 4.76164371837412e-05,
      "loss": 1.6038,
      "num_input_tokens_seen": 12538691488,
      "step": 15937
    },
    {
      "epoch": 1.6908550816889454,
      "grad_norm": 0.33668244407957565,
      "learning_rate": 4.761614102137187e-05,
      "loss": 1.6356,
      "num_input_tokens_seen": 12539478240,
      "step": 15938
    },
    {
      "epoch": 1.6909611712285169,
      "grad_norm": 0.384505215119948,
      "learning_rate": 4.761584484152545e-05,
      "loss": 1.7017,
      "num_input_tokens_seen": 12540264992,
      "step": 15939
    },
    {
      "epoch": 1.6910672607680883,
      "grad_norm": 0.37441762573683274,
      "learning_rate": 4.761554864420217e-05,
      "loss": 1.6507,
      "num_input_tokens_seen": 12541051760,
      "step": 15940
    },
    {
      "epoch": 1.6911733503076598,
      "grad_norm": 0.33250780666196444,
      "learning_rate": 4.7615252429402255e-05,
      "loss": 1.7563,
      "num_input_tokens_seen": 12541838496,
      "step": 15941
    },
    {
      "epoch": 1.691279439847231,
      "grad_norm": 0.36820272274938587,
      "learning_rate": 4.7614956197125936e-05,
      "loss": 1.8342,
      "num_input_tokens_seen": 12542625280,
      "step": 15942
    },
    {
      "epoch": 1.6913855293868023,
      "grad_norm": 0.41253688138754624,
      "learning_rate": 4.7614659947373444e-05,
      "loss": 1.6162,
      "num_input_tokens_seen": 12543412016,
      "step": 15943
    },
    {
      "epoch": 1.6914916189263738,
      "grad_norm": 0.3630668277394406,
      "learning_rate": 4.7614363680145e-05,
      "loss": 1.7218,
      "num_input_tokens_seen": 12544198832,
      "step": 15944
    },
    {
      "epoch": 1.6915977084659453,
      "grad_norm": 0.4174542738075395,
      "learning_rate": 4.761406739544085e-05,
      "loss": 1.7386,
      "num_input_tokens_seen": 12544985536,
      "step": 15945
    },
    {
      "epoch": 1.6917037980055167,
      "grad_norm": 0.4160619688661646,
      "learning_rate": 4.76137710932612e-05,
      "loss": 1.6428,
      "num_input_tokens_seen": 12545772288,
      "step": 15946
    },
    {
      "epoch": 1.6918098875450882,
      "grad_norm": 0.4075895954098852,
      "learning_rate": 4.761347477360631e-05,
      "loss": 1.7214,
      "num_input_tokens_seen": 12546559120,
      "step": 15947
    },
    {
      "epoch": 1.6919159770846595,
      "grad_norm": 0.4503642505672482,
      "learning_rate": 4.761317843647637e-05,
      "loss": 1.7651,
      "num_input_tokens_seen": 12547345936,
      "step": 15948
    },
    {
      "epoch": 1.6920220666242307,
      "grad_norm": 0.3739840874897121,
      "learning_rate": 4.761288208187163e-05,
      "loss": 1.735,
      "num_input_tokens_seen": 12548132672,
      "step": 15949
    },
    {
      "epoch": 1.6921281561638022,
      "grad_norm": 0.4359327905474014,
      "learning_rate": 4.761258570979234e-05,
      "loss": 1.7282,
      "num_input_tokens_seen": 12548919472,
      "step": 15950
    },
    {
      "epoch": 1.6922342457033737,
      "grad_norm": 0.34685517485427614,
      "learning_rate": 4.761228932023868e-05,
      "loss": 1.7596,
      "num_input_tokens_seen": 12549706256,
      "step": 15951
    },
    {
      "epoch": 1.6923403352429451,
      "grad_norm": 0.4307683828912998,
      "learning_rate": 4.761199291321092e-05,
      "loss": 1.9754,
      "num_input_tokens_seen": 12550492976,
      "step": 15952
    },
    {
      "epoch": 1.6924464247825164,
      "grad_norm": 0.34396468909943073,
      "learning_rate": 4.761169648870928e-05,
      "loss": 1.7409,
      "num_input_tokens_seen": 12551279664,
      "step": 15953
    },
    {
      "epoch": 1.6925525143220879,
      "grad_norm": 0.337771030607564,
      "learning_rate": 4.7611400046733975e-05,
      "loss": 1.7024,
      "num_input_tokens_seen": 12552066480,
      "step": 15954
    },
    {
      "epoch": 1.6926586038616591,
      "grad_norm": 0.3933929797470656,
      "learning_rate": 4.761110358728525e-05,
      "loss": 1.7442,
      "num_input_tokens_seen": 12552853152,
      "step": 15955
    },
    {
      "epoch": 1.6927646934012306,
      "grad_norm": 0.3573636735444065,
      "learning_rate": 4.761080711036332e-05,
      "loss": 1.7012,
      "num_input_tokens_seen": 12553639984,
      "step": 15956
    },
    {
      "epoch": 1.692870782940802,
      "grad_norm": 0.3711467090054908,
      "learning_rate": 4.7610510615968426e-05,
      "loss": 1.8407,
      "num_input_tokens_seen": 12554426816,
      "step": 15957
    },
    {
      "epoch": 1.6929768724803735,
      "grad_norm": 0.36431166423079087,
      "learning_rate": 4.7610214104100795e-05,
      "loss": 1.7409,
      "num_input_tokens_seen": 12555213728,
      "step": 15958
    },
    {
      "epoch": 1.6930829620199448,
      "grad_norm": 0.35978279827688986,
      "learning_rate": 4.760991757476066e-05,
      "loss": 1.6796,
      "num_input_tokens_seen": 12556000352,
      "step": 15959
    },
    {
      "epoch": 1.6931890515595163,
      "grad_norm": 0.44728877059444877,
      "learning_rate": 4.760962102794823e-05,
      "loss": 1.8365,
      "num_input_tokens_seen": 12556787088,
      "step": 15960
    },
    {
      "epoch": 1.6932951410990875,
      "grad_norm": 0.3744390981569698,
      "learning_rate": 4.760932446366376e-05,
      "loss": 1.7366,
      "num_input_tokens_seen": 12557573904,
      "step": 15961
    },
    {
      "epoch": 1.693401230638659,
      "grad_norm": 0.40016560591599953,
      "learning_rate": 4.760902788190747e-05,
      "loss": 1.6866,
      "num_input_tokens_seen": 12558360688,
      "step": 15962
    },
    {
      "epoch": 1.6935073201782305,
      "grad_norm": 0.42988941850634216,
      "learning_rate": 4.760873128267957e-05,
      "loss": 1.7264,
      "num_input_tokens_seen": 12559147392,
      "step": 15963
    },
    {
      "epoch": 1.693613409717802,
      "grad_norm": 0.3541296460582148,
      "learning_rate": 4.7608434665980315e-05,
      "loss": 1.7292,
      "num_input_tokens_seen": 12559934144,
      "step": 15964
    },
    {
      "epoch": 1.6937194992573732,
      "grad_norm": 0.4241800705988281,
      "learning_rate": 4.760813803180992e-05,
      "loss": 1.7366,
      "num_input_tokens_seen": 12560720816,
      "step": 15965
    },
    {
      "epoch": 1.6938255887969447,
      "grad_norm": 0.4705714318759098,
      "learning_rate": 4.760784138016863e-05,
      "loss": 1.7356,
      "num_input_tokens_seen": 12561507568,
      "step": 15966
    },
    {
      "epoch": 1.693931678336516,
      "grad_norm": 0.37662566679670134,
      "learning_rate": 4.7607544711056656e-05,
      "loss": 1.6192,
      "num_input_tokens_seen": 12562294336,
      "step": 15967
    },
    {
      "epoch": 1.6940377678760874,
      "grad_norm": 0.40754171566432357,
      "learning_rate": 4.7607248024474236e-05,
      "loss": 1.7176,
      "num_input_tokens_seen": 12563081024,
      "step": 15968
    },
    {
      "epoch": 1.6941438574156589,
      "grad_norm": 0.3401799131035186,
      "learning_rate": 4.76069513204216e-05,
      "loss": 1.6099,
      "num_input_tokens_seen": 12563867808,
      "step": 15969
    },
    {
      "epoch": 1.6942499469552303,
      "grad_norm": 0.37164369914164413,
      "learning_rate": 4.760665459889897e-05,
      "loss": 1.6208,
      "num_input_tokens_seen": 12564654576,
      "step": 15970
    },
    {
      "epoch": 1.6943560364948016,
      "grad_norm": 0.35963912778296836,
      "learning_rate": 4.760635785990659e-05,
      "loss": 1.6712,
      "num_input_tokens_seen": 12565441376,
      "step": 15971
    },
    {
      "epoch": 1.6944621260343729,
      "grad_norm": 0.38369391052384144,
      "learning_rate": 4.760606110344467e-05,
      "loss": 1.791,
      "num_input_tokens_seen": 12566228112,
      "step": 15972
    },
    {
      "epoch": 1.6945682155739443,
      "grad_norm": 0.40090484084736566,
      "learning_rate": 4.760576432951346e-05,
      "loss": 1.7128,
      "num_input_tokens_seen": 12567014864,
      "step": 15973
    },
    {
      "epoch": 1.6946743051135158,
      "grad_norm": 0.3778656295535036,
      "learning_rate": 4.760546753811317e-05,
      "loss": 1.719,
      "num_input_tokens_seen": 12567801696,
      "step": 15974
    },
    {
      "epoch": 1.6947803946530873,
      "grad_norm": 0.5314728589987273,
      "learning_rate": 4.7605170729244045e-05,
      "loss": 1.7964,
      "num_input_tokens_seen": 12568588352,
      "step": 15975
    },
    {
      "epoch": 1.6948864841926587,
      "grad_norm": 0.35891816596346776,
      "learning_rate": 4.760487390290629e-05,
      "loss": 1.6545,
      "num_input_tokens_seen": 12569375136,
      "step": 15976
    },
    {
      "epoch": 1.69499257373223,
      "grad_norm": 0.34920006603149284,
      "learning_rate": 4.760457705910017e-05,
      "loss": 1.8147,
      "num_input_tokens_seen": 12570161920,
      "step": 15977
    },
    {
      "epoch": 1.6950986632718013,
      "grad_norm": 0.4206195337473344,
      "learning_rate": 4.760428019782589e-05,
      "loss": 1.8525,
      "num_input_tokens_seen": 12570948608,
      "step": 15978
    },
    {
      "epoch": 1.6952047528113727,
      "grad_norm": 0.399586918584438,
      "learning_rate": 4.760398331908369e-05,
      "loss": 1.6384,
      "num_input_tokens_seen": 12571735440,
      "step": 15979
    },
    {
      "epoch": 1.6953108423509442,
      "grad_norm": 0.4267523921464354,
      "learning_rate": 4.760368642287378e-05,
      "loss": 1.7583,
      "num_input_tokens_seen": 12572522224,
      "step": 15980
    },
    {
      "epoch": 1.6954169318905157,
      "grad_norm": 0.3771728732720141,
      "learning_rate": 4.760338950919642e-05,
      "loss": 1.6046,
      "num_input_tokens_seen": 12573309008,
      "step": 15981
    },
    {
      "epoch": 1.6955230214300872,
      "grad_norm": 0.5001578838931253,
      "learning_rate": 4.7603092578051824e-05,
      "loss": 1.8665,
      "num_input_tokens_seen": 12574095696,
      "step": 15982
    },
    {
      "epoch": 1.6956291109696584,
      "grad_norm": 0.6378903418142354,
      "learning_rate": 4.760279562944021e-05,
      "loss": 1.7642,
      "num_input_tokens_seen": 12574882432,
      "step": 15983
    },
    {
      "epoch": 1.6957352005092297,
      "grad_norm": 0.43875054192120544,
      "learning_rate": 4.7602498663361826e-05,
      "loss": 1.7698,
      "num_input_tokens_seen": 12575669120,
      "step": 15984
    },
    {
      "epoch": 1.6958412900488011,
      "grad_norm": 1.0167221926675778,
      "learning_rate": 4.760220167981689e-05,
      "loss": 1.7587,
      "num_input_tokens_seen": 12576455808,
      "step": 15985
    },
    {
      "epoch": 1.6959473795883726,
      "grad_norm": 1.3149323543920517,
      "learning_rate": 4.7601904678805645e-05,
      "loss": 1.8135,
      "num_input_tokens_seen": 12577242592,
      "step": 15986
    },
    {
      "epoch": 1.696053469127944,
      "grad_norm": 0.5256585216125197,
      "learning_rate": 4.7601607660328306e-05,
      "loss": 1.8906,
      "num_input_tokens_seen": 12578029312,
      "step": 15987
    },
    {
      "epoch": 1.6961595586675153,
      "grad_norm": 1.059975934960491,
      "learning_rate": 4.760131062438511e-05,
      "loss": 1.7636,
      "num_input_tokens_seen": 12578815904,
      "step": 15988
    },
    {
      "epoch": 1.6962656482070868,
      "grad_norm": 1.216543755582695,
      "learning_rate": 4.760101357097628e-05,
      "loss": 1.7995,
      "num_input_tokens_seen": 12579602624,
      "step": 15989
    },
    {
      "epoch": 1.696371737746658,
      "grad_norm": 1.15875462542428,
      "learning_rate": 4.760071650010205e-05,
      "loss": 1.7034,
      "num_input_tokens_seen": 12580389360,
      "step": 15990
    },
    {
      "epoch": 1.6964778272862295,
      "grad_norm": 1.1984629396034587,
      "learning_rate": 4.7600419411762656e-05,
      "loss": 1.7693,
      "num_input_tokens_seen": 12581176064,
      "step": 15991
    },
    {
      "epoch": 1.696583916825801,
      "grad_norm": 0.904026560005248,
      "learning_rate": 4.7600122305958315e-05,
      "loss": 1.7448,
      "num_input_tokens_seen": 12581962784,
      "step": 15992
    },
    {
      "epoch": 1.6966900063653725,
      "grad_norm": 0.9991841870465646,
      "learning_rate": 4.759982518268926e-05,
      "loss": 1.6625,
      "num_input_tokens_seen": 12582749536,
      "step": 15993
    },
    {
      "epoch": 1.6967960959049437,
      "grad_norm": 0.6599069501301837,
      "learning_rate": 4.7599528041955724e-05,
      "loss": 1.6821,
      "num_input_tokens_seen": 12583536384,
      "step": 15994
    },
    {
      "epoch": 1.6969021854445152,
      "grad_norm": 2.0812465715064272,
      "learning_rate": 4.7599230883757936e-05,
      "loss": 1.8859,
      "num_input_tokens_seen": 12584323056,
      "step": 15995
    },
    {
      "epoch": 1.6970082749840865,
      "grad_norm": 0.6350685203728746,
      "learning_rate": 4.759893370809613e-05,
      "loss": 1.7946,
      "num_input_tokens_seen": 12585109792,
      "step": 15996
    },
    {
      "epoch": 1.697114364523658,
      "grad_norm": 1.2824040188824082,
      "learning_rate": 4.7598636514970527e-05,
      "loss": 1.7592,
      "num_input_tokens_seen": 12585896544,
      "step": 15997
    },
    {
      "epoch": 1.6972204540632294,
      "grad_norm": 1.003078729623354,
      "learning_rate": 4.7598339304381365e-05,
      "loss": 1.8297,
      "num_input_tokens_seen": 12586683344,
      "step": 15998
    },
    {
      "epoch": 1.6973265436028009,
      "grad_norm": 1.2998097336111583,
      "learning_rate": 4.759804207632887e-05,
      "loss": 1.8351,
      "num_input_tokens_seen": 12587470096,
      "step": 15999
    },
    {
      "epoch": 1.6974326331423721,
      "grad_norm": 0.8473159310674779,
      "learning_rate": 4.759774483081326e-05,
      "loss": 1.8176,
      "num_input_tokens_seen": 12588256912,
      "step": 16000
    },
    {
      "epoch": 1.6974326331423721,
      "eval_loss": 1.7521542310714722,
      "eval_runtime": 65.848,
      "eval_samples_per_second": 45.559,
      "eval_steps_per_second": 0.486,
      "num_input_tokens_seen": 12588256912,
      "step": 16000
    },
    {
      "epoch": 1.6975387226819436,
      "grad_norm": 0.5728047583160865,
      "learning_rate": 4.759744756783479e-05,
      "loss": 1.6472,
      "num_input_tokens_seen": 12589043648,
      "step": 16001
    },
    {
      "epoch": 1.6976448122215149,
      "grad_norm": 0.8700634199002039,
      "learning_rate": 4.759715028739367e-05,
      "loss": 1.8247,
      "num_input_tokens_seen": 12589830384,
      "step": 16002
    },
    {
      "epoch": 1.6977509017610863,
      "grad_norm": 0.6397590589462218,
      "learning_rate": 4.759685298949014e-05,
      "loss": 1.6996,
      "num_input_tokens_seen": 12590617232,
      "step": 16003
    },
    {
      "epoch": 1.6978569913006578,
      "grad_norm": 1.0007643087695888,
      "learning_rate": 4.759655567412441e-05,
      "loss": 1.6688,
      "num_input_tokens_seen": 12591404080,
      "step": 16004
    },
    {
      "epoch": 1.6979630808402293,
      "grad_norm": 1.0792359169413508,
      "learning_rate": 4.759625834129674e-05,
      "loss": 1.7779,
      "num_input_tokens_seen": 12592190832,
      "step": 16005
    },
    {
      "epoch": 1.6980691703798005,
      "grad_norm": 0.6185840273651381,
      "learning_rate": 4.759596099100734e-05,
      "loss": 1.7041,
      "num_input_tokens_seen": 12592977712,
      "step": 16006
    },
    {
      "epoch": 1.6981752599193718,
      "grad_norm": 0.6358049239207625,
      "learning_rate": 4.7595663623256446e-05,
      "loss": 1.8124,
      "num_input_tokens_seen": 12593764544,
      "step": 16007
    },
    {
      "epoch": 1.6982813494589433,
      "grad_norm": 1.0973449914594755,
      "learning_rate": 4.759536623804428e-05,
      "loss": 1.6927,
      "num_input_tokens_seen": 12594551296,
      "step": 16008
    },
    {
      "epoch": 1.6983874389985147,
      "grad_norm": 0.7519202016818227,
      "learning_rate": 4.759506883537108e-05,
      "loss": 1.891,
      "num_input_tokens_seen": 12595337952,
      "step": 16009
    },
    {
      "epoch": 1.6984935285380862,
      "grad_norm": 0.8303762664916459,
      "learning_rate": 4.759477141523708e-05,
      "loss": 1.7746,
      "num_input_tokens_seen": 12596124640,
      "step": 16010
    },
    {
      "epoch": 1.6985996180776577,
      "grad_norm": 0.8400426353675232,
      "learning_rate": 4.759447397764249e-05,
      "loss": 1.6896,
      "num_input_tokens_seen": 12596911536,
      "step": 16011
    },
    {
      "epoch": 1.698705707617229,
      "grad_norm": 0.6271916235463689,
      "learning_rate": 4.7594176522587575e-05,
      "loss": 1.7753,
      "num_input_tokens_seen": 12597698272,
      "step": 16012
    },
    {
      "epoch": 1.6988117971568002,
      "grad_norm": 0.5120066716446218,
      "learning_rate": 4.759387905007253e-05,
      "loss": 1.8296,
      "num_input_tokens_seen": 12598485104,
      "step": 16013
    },
    {
      "epoch": 1.6989178866963717,
      "grad_norm": 0.4450316445046958,
      "learning_rate": 4.75935815600976e-05,
      "loss": 1.6604,
      "num_input_tokens_seen": 12599271888,
      "step": 16014
    },
    {
      "epoch": 1.6990239762359431,
      "grad_norm": 0.4251153247240839,
      "learning_rate": 4.759328405266301e-05,
      "loss": 1.6829,
      "num_input_tokens_seen": 12600058672,
      "step": 16015
    },
    {
      "epoch": 1.6991300657755146,
      "grad_norm": 0.4845442813832971,
      "learning_rate": 4.7592986527768996e-05,
      "loss": 1.7726,
      "num_input_tokens_seen": 12600845344,
      "step": 16016
    },
    {
      "epoch": 1.699236155315086,
      "grad_norm": 0.5111311427819758,
      "learning_rate": 4.7592688985415786e-05,
      "loss": 1.8603,
      "num_input_tokens_seen": 12601632128,
      "step": 16017
    },
    {
      "epoch": 1.6993422448546573,
      "grad_norm": 0.5293541725913109,
      "learning_rate": 4.759239142560361e-05,
      "loss": 1.8167,
      "num_input_tokens_seen": 12602418848,
      "step": 16018
    },
    {
      "epoch": 1.6994483343942286,
      "grad_norm": 0.48714358999204954,
      "learning_rate": 4.7592093848332684e-05,
      "loss": 1.8846,
      "num_input_tokens_seen": 12603205568,
      "step": 16019
    },
    {
      "epoch": 1.6995544239338,
      "grad_norm": 0.404007086349497,
      "learning_rate": 4.759179625360327e-05,
      "loss": 1.6902,
      "num_input_tokens_seen": 12603992288,
      "step": 16020
    },
    {
      "epoch": 1.6996605134733715,
      "grad_norm": 0.4647617685220166,
      "learning_rate": 4.7591498641415565e-05,
      "loss": 1.7981,
      "num_input_tokens_seen": 12604779008,
      "step": 16021
    },
    {
      "epoch": 1.699766603012943,
      "grad_norm": 0.46617536862379616,
      "learning_rate": 4.7591201011769816e-05,
      "loss": 1.5642,
      "num_input_tokens_seen": 12605565760,
      "step": 16022
    },
    {
      "epoch": 1.6998726925525143,
      "grad_norm": 0.7263819412516536,
      "learning_rate": 4.759090336466625e-05,
      "loss": 1.6227,
      "num_input_tokens_seen": 12606352496,
      "step": 16023
    },
    {
      "epoch": 1.6999787820920857,
      "grad_norm": 0.8283999520197112,
      "learning_rate": 4.75906057001051e-05,
      "loss": 1.7756,
      "num_input_tokens_seen": 12607139248,
      "step": 16024
    },
    {
      "epoch": 1.700084871631657,
      "grad_norm": 0.47595779992386006,
      "learning_rate": 4.759030801808659e-05,
      "loss": 1.6842,
      "num_input_tokens_seen": 12607926096,
      "step": 16025
    },
    {
      "epoch": 1.7001909611712285,
      "grad_norm": 0.4806170615471992,
      "learning_rate": 4.759001031861095e-05,
      "loss": 1.6465,
      "num_input_tokens_seen": 12608712880,
      "step": 16026
    },
    {
      "epoch": 1.7002970507108,
      "grad_norm": 0.6574961980666595,
      "learning_rate": 4.758971260167842e-05,
      "loss": 1.6882,
      "num_input_tokens_seen": 12609499664,
      "step": 16027
    },
    {
      "epoch": 1.7004031402503714,
      "grad_norm": 0.6601935604225618,
      "learning_rate": 4.758941486728922e-05,
      "loss": 1.8076,
      "num_input_tokens_seen": 12610286448,
      "step": 16028
    },
    {
      "epoch": 1.7005092297899427,
      "grad_norm": 0.46631373956833355,
      "learning_rate": 4.7589117115443585e-05,
      "loss": 1.6915,
      "num_input_tokens_seen": 12611073232,
      "step": 16029
    },
    {
      "epoch": 1.7006153193295142,
      "grad_norm": 0.6805282661643901,
      "learning_rate": 4.758881934614174e-05,
      "loss": 1.7784,
      "num_input_tokens_seen": 12611859968,
      "step": 16030
    },
    {
      "epoch": 1.7007214088690854,
      "grad_norm": 0.8641593091291832,
      "learning_rate": 4.758852155938392e-05,
      "loss": 1.7545,
      "num_input_tokens_seen": 12612646720,
      "step": 16031
    },
    {
      "epoch": 1.7008274984086569,
      "grad_norm": 0.5379516828742138,
      "learning_rate": 4.758822375517035e-05,
      "loss": 1.6788,
      "num_input_tokens_seen": 12613433536,
      "step": 16032
    },
    {
      "epoch": 1.7009335879482284,
      "grad_norm": 0.9065142122132882,
      "learning_rate": 4.758792593350126e-05,
      "loss": 1.5971,
      "num_input_tokens_seen": 12614220272,
      "step": 16033
    },
    {
      "epoch": 1.7010396774877998,
      "grad_norm": 0.49638756398756634,
      "learning_rate": 4.7587628094376894e-05,
      "loss": 1.6984,
      "num_input_tokens_seen": 12615007136,
      "step": 16034
    },
    {
      "epoch": 1.701145767027371,
      "grad_norm": 0.8092937521883239,
      "learning_rate": 4.7587330237797466e-05,
      "loss": 1.7068,
      "num_input_tokens_seen": 12615793792,
      "step": 16035
    },
    {
      "epoch": 1.7012518565669423,
      "grad_norm": 0.8087976182262895,
      "learning_rate": 4.758703236376321e-05,
      "loss": 1.8514,
      "num_input_tokens_seen": 12616580560,
      "step": 16036
    },
    {
      "epoch": 1.7013579461065138,
      "grad_norm": 0.6270896055759864,
      "learning_rate": 4.758673447227436e-05,
      "loss": 1.6237,
      "num_input_tokens_seen": 12617367328,
      "step": 16037
    },
    {
      "epoch": 1.7014640356460853,
      "grad_norm": 0.8754553029749411,
      "learning_rate": 4.758643656333115e-05,
      "loss": 1.9622,
      "num_input_tokens_seen": 12618154032,
      "step": 16038
    },
    {
      "epoch": 1.7015701251856568,
      "grad_norm": 0.6167728852479959,
      "learning_rate": 4.7586138636933796e-05,
      "loss": 1.6693,
      "num_input_tokens_seen": 12618940800,
      "step": 16039
    },
    {
      "epoch": 1.7016762147252282,
      "grad_norm": 0.9068691836213024,
      "learning_rate": 4.758584069308254e-05,
      "loss": 1.5957,
      "num_input_tokens_seen": 12619727552,
      "step": 16040
    },
    {
      "epoch": 1.7017823042647995,
      "grad_norm": 0.5227482302135072,
      "learning_rate": 4.758554273177761e-05,
      "loss": 1.7099,
      "num_input_tokens_seen": 12620514320,
      "step": 16041
    },
    {
      "epoch": 1.7018883938043707,
      "grad_norm": 1.9082112119863877,
      "learning_rate": 4.758524475301923e-05,
      "loss": 1.6951,
      "num_input_tokens_seen": 12621301184,
      "step": 16042
    },
    {
      "epoch": 1.7019944833439422,
      "grad_norm": 0.7231429799950573,
      "learning_rate": 4.7584946756807646e-05,
      "loss": 1.7163,
      "num_input_tokens_seen": 12622088032,
      "step": 16043
    },
    {
      "epoch": 1.7021005728835137,
      "grad_norm": 0.5130495471791383,
      "learning_rate": 4.7584648743143065e-05,
      "loss": 1.7107,
      "num_input_tokens_seen": 12622874768,
      "step": 16044
    },
    {
      "epoch": 1.7022066624230852,
      "grad_norm": 1.5491331415600387,
      "learning_rate": 4.758435071202574e-05,
      "loss": 1.6156,
      "num_input_tokens_seen": 12623661584,
      "step": 16045
    },
    {
      "epoch": 1.7023127519626566,
      "grad_norm": 0.5054380697592449,
      "learning_rate": 4.758405266345589e-05,
      "loss": 1.6156,
      "num_input_tokens_seen": 12624448352,
      "step": 16046
    },
    {
      "epoch": 1.7024188415022279,
      "grad_norm": 0.640376661995123,
      "learning_rate": 4.758375459743375e-05,
      "loss": 1.6873,
      "num_input_tokens_seen": 12625235088,
      "step": 16047
    },
    {
      "epoch": 1.7025249310417991,
      "grad_norm": 0.6230429043203408,
      "learning_rate": 4.758345651395954e-05,
      "loss": 1.7642,
      "num_input_tokens_seen": 12626021808,
      "step": 16048
    },
    {
      "epoch": 1.7026310205813706,
      "grad_norm": 0.6950535905841413,
      "learning_rate": 4.75831584130335e-05,
      "loss": 1.7548,
      "num_input_tokens_seen": 12626808544,
      "step": 16049
    },
    {
      "epoch": 1.702737110120942,
      "grad_norm": 0.7240411627963135,
      "learning_rate": 4.758286029465586e-05,
      "loss": 1.863,
      "num_input_tokens_seen": 12627595216,
      "step": 16050
    },
    {
      "epoch": 1.7028431996605136,
      "grad_norm": 0.48146666141281125,
      "learning_rate": 4.7582562158826847e-05,
      "loss": 1.8041,
      "num_input_tokens_seen": 12628381968,
      "step": 16051
    },
    {
      "epoch": 1.702949289200085,
      "grad_norm": 0.4221589812877916,
      "learning_rate": 4.7582264005546685e-05,
      "loss": 1.7791,
      "num_input_tokens_seen": 12629168736,
      "step": 16052
    },
    {
      "epoch": 1.7030553787396563,
      "grad_norm": 0.655202988304057,
      "learning_rate": 4.7581965834815626e-05,
      "loss": 1.6113,
      "num_input_tokens_seen": 12629955552,
      "step": 16053
    },
    {
      "epoch": 1.7031614682792275,
      "grad_norm": 0.46261449278096956,
      "learning_rate": 4.758166764663388e-05,
      "loss": 1.7929,
      "num_input_tokens_seen": 12630742384,
      "step": 16054
    },
    {
      "epoch": 1.703267557818799,
      "grad_norm": 0.5442852104497016,
      "learning_rate": 4.758136944100168e-05,
      "loss": 1.7108,
      "num_input_tokens_seen": 12631529120,
      "step": 16055
    },
    {
      "epoch": 1.7033736473583705,
      "grad_norm": 0.5229249963186757,
      "learning_rate": 4.758107121791926e-05,
      "loss": 1.7643,
      "num_input_tokens_seen": 12632315840,
      "step": 16056
    },
    {
      "epoch": 1.703479736897942,
      "grad_norm": 0.5173023888757599,
      "learning_rate": 4.758077297738686e-05,
      "loss": 1.6467,
      "num_input_tokens_seen": 12633102688,
      "step": 16057
    },
    {
      "epoch": 1.7035858264375132,
      "grad_norm": 0.40610306132284874,
      "learning_rate": 4.758047471940469e-05,
      "loss": 1.7122,
      "num_input_tokens_seen": 12633889376,
      "step": 16058
    },
    {
      "epoch": 1.7036919159770847,
      "grad_norm": 0.6128665533456458,
      "learning_rate": 4.7580176443972993e-05,
      "loss": 1.8254,
      "num_input_tokens_seen": 12634676112,
      "step": 16059
    },
    {
      "epoch": 1.703798005516656,
      "grad_norm": 0.37145294870249956,
      "learning_rate": 4.7579878151092004e-05,
      "loss": 1.6553,
      "num_input_tokens_seen": 12635463056,
      "step": 16060
    },
    {
      "epoch": 1.7039040950562274,
      "grad_norm": 0.6212062645585436,
      "learning_rate": 4.7579579840761946e-05,
      "loss": 1.6121,
      "num_input_tokens_seen": 12636249808,
      "step": 16061
    },
    {
      "epoch": 1.704010184595799,
      "grad_norm": 0.49195252869784,
      "learning_rate": 4.757928151298305e-05,
      "loss": 1.6652,
      "num_input_tokens_seen": 12637036688,
      "step": 16062
    },
    {
      "epoch": 1.7041162741353704,
      "grad_norm": 0.9791030831726057,
      "learning_rate": 4.7578983167755546e-05,
      "loss": 1.8389,
      "num_input_tokens_seen": 12637823408,
      "step": 16063
    },
    {
      "epoch": 1.7042223636749416,
      "grad_norm": 0.7547458356550452,
      "learning_rate": 4.757868480507967e-05,
      "loss": 1.7641,
      "num_input_tokens_seen": 12638610144,
      "step": 16064
    },
    {
      "epoch": 1.704328453214513,
      "grad_norm": 0.7293931798528897,
      "learning_rate": 4.7578386424955644e-05,
      "loss": 1.7921,
      "num_input_tokens_seen": 12639396784,
      "step": 16065
    },
    {
      "epoch": 1.7044345427540843,
      "grad_norm": 0.48753655616928104,
      "learning_rate": 4.757808802738371e-05,
      "loss": 1.6742,
      "num_input_tokens_seen": 12640183616,
      "step": 16066
    },
    {
      "epoch": 1.7045406322936558,
      "grad_norm": 0.760544481413572,
      "learning_rate": 4.757778961236409e-05,
      "loss": 1.6267,
      "num_input_tokens_seen": 12640970400,
      "step": 16067
    },
    {
      "epoch": 1.7046467218332273,
      "grad_norm": 0.5813984050983372,
      "learning_rate": 4.7577491179897016e-05,
      "loss": 1.7652,
      "num_input_tokens_seen": 12641757120,
      "step": 16068
    },
    {
      "epoch": 1.7047528113727988,
      "grad_norm": 0.46123506006877096,
      "learning_rate": 4.7577192729982725e-05,
      "loss": 1.8353,
      "num_input_tokens_seen": 12642543888,
      "step": 16069
    },
    {
      "epoch": 1.70485890091237,
      "grad_norm": 0.5070969873746621,
      "learning_rate": 4.757689426262143e-05,
      "loss": 1.8062,
      "num_input_tokens_seen": 12643330624,
      "step": 16070
    },
    {
      "epoch": 1.7049649904519413,
      "grad_norm": 0.47717584048968986,
      "learning_rate": 4.757659577781338e-05,
      "loss": 1.7131,
      "num_input_tokens_seen": 12644117376,
      "step": 16071
    },
    {
      "epoch": 1.7050710799915128,
      "grad_norm": 1.014406974817929,
      "learning_rate": 4.7576297275558804e-05,
      "loss": 1.8605,
      "num_input_tokens_seen": 12644904048,
      "step": 16072
    },
    {
      "epoch": 1.7051771695310842,
      "grad_norm": 2.353536878475365,
      "learning_rate": 4.757599875585792e-05,
      "loss": 1.7706,
      "num_input_tokens_seen": 12645690800,
      "step": 16073
    },
    {
      "epoch": 1.7052832590706557,
      "grad_norm": 1.123931025782213,
      "learning_rate": 4.757570021871097e-05,
      "loss": 1.6985,
      "num_input_tokens_seen": 12646477536,
      "step": 16074
    },
    {
      "epoch": 1.7053893486102272,
      "grad_norm": 1.0515450499928367,
      "learning_rate": 4.757540166411818e-05,
      "loss": 1.7242,
      "num_input_tokens_seen": 12647264288,
      "step": 16075
    },
    {
      "epoch": 1.7054954381497984,
      "grad_norm": 0.8759535944456815,
      "learning_rate": 4.757510309207978e-05,
      "loss": 1.7212,
      "num_input_tokens_seen": 12648051088,
      "step": 16076
    },
    {
      "epoch": 1.7056015276893697,
      "grad_norm": 0.8571834255814639,
      "learning_rate": 4.7574804502596006e-05,
      "loss": 1.6371,
      "num_input_tokens_seen": 12648837920,
      "step": 16077
    },
    {
      "epoch": 1.7057076172289412,
      "grad_norm": 0.8565777196800919,
      "learning_rate": 4.757450589566708e-05,
      "loss": 1.7368,
      "num_input_tokens_seen": 12649624688,
      "step": 16078
    },
    {
      "epoch": 1.7058137067685126,
      "grad_norm": 1.3248890472032584,
      "learning_rate": 4.757420727129325e-05,
      "loss": 1.7361,
      "num_input_tokens_seen": 12650411440,
      "step": 16079
    },
    {
      "epoch": 1.705919796308084,
      "grad_norm": 1.0568629731359005,
      "learning_rate": 4.757390862947472e-05,
      "loss": 1.7641,
      "num_input_tokens_seen": 12651198112,
      "step": 16080
    },
    {
      "epoch": 1.7060258858476556,
      "grad_norm": 0.5166989257057915,
      "learning_rate": 4.7573609970211744e-05,
      "loss": 1.7844,
      "num_input_tokens_seen": 12651984992,
      "step": 16081
    },
    {
      "epoch": 1.7061319753872268,
      "grad_norm": 1.0315044814631673,
      "learning_rate": 4.7573311293504544e-05,
      "loss": 1.7177,
      "num_input_tokens_seen": 12652771808,
      "step": 16082
    },
    {
      "epoch": 1.706238064926798,
      "grad_norm": 0.6620537661141058,
      "learning_rate": 4.757301259935336e-05,
      "loss": 1.8734,
      "num_input_tokens_seen": 12653558576,
      "step": 16083
    },
    {
      "epoch": 1.7063441544663696,
      "grad_norm": 0.650878155347125,
      "learning_rate": 4.75727138877584e-05,
      "loss": 1.7517,
      "num_input_tokens_seen": 12654345376,
      "step": 16084
    },
    {
      "epoch": 1.706450244005941,
      "grad_norm": 0.7347516720112383,
      "learning_rate": 4.757241515871992e-05,
      "loss": 1.7916,
      "num_input_tokens_seen": 12655132128,
      "step": 16085
    },
    {
      "epoch": 1.7065563335455125,
      "grad_norm": 1.1423285286998919,
      "learning_rate": 4.757211641223813e-05,
      "loss": 1.5666,
      "num_input_tokens_seen": 12655918944,
      "step": 16086
    },
    {
      "epoch": 1.7066624230850838,
      "grad_norm": 0.6320560579005786,
      "learning_rate": 4.7571817648313276e-05,
      "loss": 1.7675,
      "num_input_tokens_seen": 12656705680,
      "step": 16087
    },
    {
      "epoch": 1.7067685126246552,
      "grad_norm": 1.1968325790111103,
      "learning_rate": 4.757151886694559e-05,
      "loss": 1.7336,
      "num_input_tokens_seen": 12657492464,
      "step": 16088
    },
    {
      "epoch": 1.7068746021642265,
      "grad_norm": 1.0418796911862884,
      "learning_rate": 4.757122006813528e-05,
      "loss": 1.8117,
      "num_input_tokens_seen": 12658279200,
      "step": 16089
    },
    {
      "epoch": 1.706980691703798,
      "grad_norm": 0.6266233769488285,
      "learning_rate": 4.757092125188261e-05,
      "loss": 1.7017,
      "num_input_tokens_seen": 12659066000,
      "step": 16090
    },
    {
      "epoch": 1.7070867812433694,
      "grad_norm": 0.9200439886434844,
      "learning_rate": 4.7570622418187784e-05,
      "loss": 1.6384,
      "num_input_tokens_seen": 12659852848,
      "step": 16091
    },
    {
      "epoch": 1.707192870782941,
      "grad_norm": 0.7006008586869852,
      "learning_rate": 4.757032356705104e-05,
      "loss": 1.7371,
      "num_input_tokens_seen": 12660639728,
      "step": 16092
    },
    {
      "epoch": 1.7072989603225122,
      "grad_norm": 1.2039072004531157,
      "learning_rate": 4.7570024698472624e-05,
      "loss": 1.8637,
      "num_input_tokens_seen": 12661426496,
      "step": 16093
    },
    {
      "epoch": 1.7074050498620836,
      "grad_norm": 0.8918218949432999,
      "learning_rate": 4.756972581245275e-05,
      "loss": 1.6886,
      "num_input_tokens_seen": 12662213312,
      "step": 16094
    },
    {
      "epoch": 1.7075111394016549,
      "grad_norm": 0.7465684651608518,
      "learning_rate": 4.7569426908991656e-05,
      "loss": 1.7868,
      "num_input_tokens_seen": 12663000048,
      "step": 16095
    },
    {
      "epoch": 1.7076172289412264,
      "grad_norm": 0.6971474738606143,
      "learning_rate": 4.7569127988089566e-05,
      "loss": 1.7138,
      "num_input_tokens_seen": 12663786752,
      "step": 16096
    },
    {
      "epoch": 1.7077233184807978,
      "grad_norm": 0.5999355195793963,
      "learning_rate": 4.756882904974672e-05,
      "loss": 1.6537,
      "num_input_tokens_seen": 12664573456,
      "step": 16097
    },
    {
      "epoch": 1.7078294080203693,
      "grad_norm": 0.9810122677110878,
      "learning_rate": 4.756853009396335e-05,
      "loss": 1.7563,
      "num_input_tokens_seen": 12665360240,
      "step": 16098
    },
    {
      "epoch": 1.7079354975599406,
      "grad_norm": 0.6292715548241659,
      "learning_rate": 4.756823112073967e-05,
      "loss": 1.8128,
      "num_input_tokens_seen": 12666147056,
      "step": 16099
    },
    {
      "epoch": 1.708041587099512,
      "grad_norm": 1.4468736701348657,
      "learning_rate": 4.756793213007593e-05,
      "loss": 1.7921,
      "num_input_tokens_seen": 12666933744,
      "step": 16100
    },
    {
      "epoch": 1.7081476766390833,
      "grad_norm": 0.45156737749599796,
      "learning_rate": 4.756763312197236e-05,
      "loss": 1.8153,
      "num_input_tokens_seen": 12667720496,
      "step": 16101
    },
    {
      "epoch": 1.7082537661786548,
      "grad_norm": 0.9312592657138637,
      "learning_rate": 4.756733409642917e-05,
      "loss": 1.747,
      "num_input_tokens_seen": 12668507200,
      "step": 16102
    },
    {
      "epoch": 1.7083598557182262,
      "grad_norm": 0.7512659360798605,
      "learning_rate": 4.7567035053446616e-05,
      "loss": 1.7053,
      "num_input_tokens_seen": 12669294032,
      "step": 16103
    },
    {
      "epoch": 1.7084659452577977,
      "grad_norm": 0.8616689543364034,
      "learning_rate": 4.7566735993024926e-05,
      "loss": 1.7881,
      "num_input_tokens_seen": 12670080800,
      "step": 16104
    },
    {
      "epoch": 1.708572034797369,
      "grad_norm": 0.6674039473269294,
      "learning_rate": 4.756643691516431e-05,
      "loss": 1.7693,
      "num_input_tokens_seen": 12670867520,
      "step": 16105
    },
    {
      "epoch": 1.7086781243369402,
      "grad_norm": 0.4182520750041742,
      "learning_rate": 4.756613781986502e-05,
      "loss": 1.7235,
      "num_input_tokens_seen": 12671654272,
      "step": 16106
    },
    {
      "epoch": 1.7087842138765117,
      "grad_norm": 0.6387086245973012,
      "learning_rate": 4.7565838707127284e-05,
      "loss": 1.8089,
      "num_input_tokens_seen": 12672441024,
      "step": 16107
    },
    {
      "epoch": 1.7088903034160832,
      "grad_norm": 0.44451466974430737,
      "learning_rate": 4.756553957695133e-05,
      "loss": 1.8302,
      "num_input_tokens_seen": 12673227872,
      "step": 16108
    },
    {
      "epoch": 1.7089963929556546,
      "grad_norm": 0.445064774387149,
      "learning_rate": 4.7565240429337385e-05,
      "loss": 1.812,
      "num_input_tokens_seen": 12674014624,
      "step": 16109
    },
    {
      "epoch": 1.7091024824952261,
      "grad_norm": 0.6430221390360235,
      "learning_rate": 4.756494126428569e-05,
      "loss": 1.743,
      "num_input_tokens_seen": 12674801456,
      "step": 16110
    },
    {
      "epoch": 1.7092085720347974,
      "grad_norm": 0.47681826483383943,
      "learning_rate": 4.756464208179647e-05,
      "loss": 1.7394,
      "num_input_tokens_seen": 12675588176,
      "step": 16111
    },
    {
      "epoch": 1.7093146615743686,
      "grad_norm": 0.7986601853697671,
      "learning_rate": 4.756434288186995e-05,
      "loss": 1.6139,
      "num_input_tokens_seen": 12676375008,
      "step": 16112
    },
    {
      "epoch": 1.70942075111394,
      "grad_norm": 0.8942335998376474,
      "learning_rate": 4.756404366450637e-05,
      "loss": 1.8242,
      "num_input_tokens_seen": 12677161792,
      "step": 16113
    },
    {
      "epoch": 1.7095268406535116,
      "grad_norm": 0.6353989331356691,
      "learning_rate": 4.756374442970597e-05,
      "loss": 1.8262,
      "num_input_tokens_seen": 12677948544,
      "step": 16114
    },
    {
      "epoch": 1.709632930193083,
      "grad_norm": 1.261167465510216,
      "learning_rate": 4.7563445177468956e-05,
      "loss": 1.8434,
      "num_input_tokens_seen": 12678735248,
      "step": 16115
    },
    {
      "epoch": 1.7097390197326545,
      "grad_norm": 0.4937838304515674,
      "learning_rate": 4.756314590779558e-05,
      "loss": 1.8192,
      "num_input_tokens_seen": 12679522000,
      "step": 16116
    },
    {
      "epoch": 1.7098451092722258,
      "grad_norm": 2.1585999283769395,
      "learning_rate": 4.756284662068606e-05,
      "loss": 1.7734,
      "num_input_tokens_seen": 12680308720,
      "step": 16117
    },
    {
      "epoch": 1.709951198811797,
      "grad_norm": 0.38820363754019266,
      "learning_rate": 4.756254731614064e-05,
      "loss": 1.7416,
      "num_input_tokens_seen": 12681095424,
      "step": 16118
    },
    {
      "epoch": 1.7100572883513685,
      "grad_norm": 0.6958696228760901,
      "learning_rate": 4.7562247994159547e-05,
      "loss": 1.782,
      "num_input_tokens_seen": 12681882176,
      "step": 16119
    },
    {
      "epoch": 1.71016337789094,
      "grad_norm": 0.46590993280567333,
      "learning_rate": 4.756194865474301e-05,
      "loss": 1.8485,
      "num_input_tokens_seen": 12682668864,
      "step": 16120
    },
    {
      "epoch": 1.7102694674305114,
      "grad_norm": 0.7399695524686946,
      "learning_rate": 4.7561649297891265e-05,
      "loss": 1.8064,
      "num_input_tokens_seen": 12683455616,
      "step": 16121
    },
    {
      "epoch": 1.7103755569700827,
      "grad_norm": 0.5702297338906871,
      "learning_rate": 4.756134992360453e-05,
      "loss": 1.7955,
      "num_input_tokens_seen": 12684242352,
      "step": 16122
    },
    {
      "epoch": 1.7104816465096542,
      "grad_norm": 0.628635860924108,
      "learning_rate": 4.756105053188305e-05,
      "loss": 1.903,
      "num_input_tokens_seen": 12685029136,
      "step": 16123
    },
    {
      "epoch": 1.7105877360492254,
      "grad_norm": 0.5607830434526827,
      "learning_rate": 4.756075112272706e-05,
      "loss": 1.6662,
      "num_input_tokens_seen": 12685815872,
      "step": 16124
    },
    {
      "epoch": 1.710693825588797,
      "grad_norm": 0.6830204993649327,
      "learning_rate": 4.756045169613677e-05,
      "loss": 1.7109,
      "num_input_tokens_seen": 12686602656,
      "step": 16125
    },
    {
      "epoch": 1.7107999151283684,
      "grad_norm": 0.41478247723432965,
      "learning_rate": 4.756015225211243e-05,
      "loss": 1.7733,
      "num_input_tokens_seen": 12687389408,
      "step": 16126
    },
    {
      "epoch": 1.7109060046679399,
      "grad_norm": 0.7357150274430833,
      "learning_rate": 4.755985279065427e-05,
      "loss": 1.7242,
      "num_input_tokens_seen": 12688176176,
      "step": 16127
    },
    {
      "epoch": 1.711012094207511,
      "grad_norm": 0.46224352457072476,
      "learning_rate": 4.7559553311762514e-05,
      "loss": 1.7114,
      "num_input_tokens_seen": 12688962928,
      "step": 16128
    },
    {
      "epoch": 1.7111181837470826,
      "grad_norm": 0.6584162331794495,
      "learning_rate": 4.75592538154374e-05,
      "loss": 1.6774,
      "num_input_tokens_seen": 12689749776,
      "step": 16129
    },
    {
      "epoch": 1.7112242732866538,
      "grad_norm": 0.3841411231537781,
      "learning_rate": 4.755895430167915e-05,
      "loss": 1.5583,
      "num_input_tokens_seen": 12690536592,
      "step": 16130
    },
    {
      "epoch": 1.7113303628262253,
      "grad_norm": 0.5004433529957196,
      "learning_rate": 4.7558654770488006e-05,
      "loss": 1.6323,
      "num_input_tokens_seen": 12691323408,
      "step": 16131
    },
    {
      "epoch": 1.7114364523657968,
      "grad_norm": 0.5592110614131067,
      "learning_rate": 4.75583552218642e-05,
      "loss": 1.7678,
      "num_input_tokens_seen": 12692110032,
      "step": 16132
    },
    {
      "epoch": 1.7115425419053683,
      "grad_norm": 0.3788782835318799,
      "learning_rate": 4.755805565580795e-05,
      "loss": 1.6169,
      "num_input_tokens_seen": 12692896928,
      "step": 16133
    },
    {
      "epoch": 1.7116486314449395,
      "grad_norm": 0.6590222521819747,
      "learning_rate": 4.7557756072319504e-05,
      "loss": 1.9485,
      "num_input_tokens_seen": 12693683664,
      "step": 16134
    },
    {
      "epoch": 1.711754720984511,
      "grad_norm": 0.4121419696827968,
      "learning_rate": 4.755745647139909e-05,
      "loss": 1.5996,
      "num_input_tokens_seen": 12694470528,
      "step": 16135
    },
    {
      "epoch": 1.7118608105240822,
      "grad_norm": 0.5585277874143079,
      "learning_rate": 4.755715685304693e-05,
      "loss": 1.7511,
      "num_input_tokens_seen": 12695257376,
      "step": 16136
    },
    {
      "epoch": 1.7119669000636537,
      "grad_norm": 0.4528379004713434,
      "learning_rate": 4.7556857217263254e-05,
      "loss": 1.7175,
      "num_input_tokens_seen": 12696044160,
      "step": 16137
    },
    {
      "epoch": 1.7120729896032252,
      "grad_norm": 0.4848612594852229,
      "learning_rate": 4.7556557564048307e-05,
      "loss": 1.7047,
      "num_input_tokens_seen": 12696830992,
      "step": 16138
    },
    {
      "epoch": 1.7121790791427967,
      "grad_norm": 0.35573429318291105,
      "learning_rate": 4.755625789340231e-05,
      "loss": 1.6991,
      "num_input_tokens_seen": 12697617776,
      "step": 16139
    },
    {
      "epoch": 1.712285168682368,
      "grad_norm": 0.4690008096239245,
      "learning_rate": 4.7555958205325505e-05,
      "loss": 1.8549,
      "num_input_tokens_seen": 12698404480,
      "step": 16140
    },
    {
      "epoch": 1.7123912582219392,
      "grad_norm": 0.43603448475164613,
      "learning_rate": 4.755565849981811e-05,
      "loss": 1.8095,
      "num_input_tokens_seen": 12699191232,
      "step": 16141
    },
    {
      "epoch": 1.7124973477615106,
      "grad_norm": 0.37480608947808014,
      "learning_rate": 4.755535877688038e-05,
      "loss": 1.6006,
      "num_input_tokens_seen": 12699978080,
      "step": 16142
    },
    {
      "epoch": 1.712603437301082,
      "grad_norm": 0.5614011192709017,
      "learning_rate": 4.7555059036512517e-05,
      "loss": 1.6243,
      "num_input_tokens_seen": 12700764816,
      "step": 16143
    },
    {
      "epoch": 1.7127095268406536,
      "grad_norm": 0.39902132512002497,
      "learning_rate": 4.7554759278714764e-05,
      "loss": 1.6689,
      "num_input_tokens_seen": 12701551584,
      "step": 16144
    },
    {
      "epoch": 1.712815616380225,
      "grad_norm": 0.40958991942208234,
      "learning_rate": 4.7554459503487356e-05,
      "loss": 1.8257,
      "num_input_tokens_seen": 12702338336,
      "step": 16145
    },
    {
      "epoch": 1.7129217059197963,
      "grad_norm": 0.45714567123012695,
      "learning_rate": 4.755415971083053e-05,
      "loss": 1.6973,
      "num_input_tokens_seen": 12703125152,
      "step": 16146
    },
    {
      "epoch": 1.7130277954593676,
      "grad_norm": 0.38593086386252384,
      "learning_rate": 4.755385990074451e-05,
      "loss": 1.603,
      "num_input_tokens_seen": 12703911984,
      "step": 16147
    },
    {
      "epoch": 1.713133884998939,
      "grad_norm": 0.462097401459563,
      "learning_rate": 4.7553560073229524e-05,
      "loss": 1.7111,
      "num_input_tokens_seen": 12704698736,
      "step": 16148
    },
    {
      "epoch": 1.7132399745385105,
      "grad_norm": 0.41836495766347925,
      "learning_rate": 4.755326022828581e-05,
      "loss": 1.6534,
      "num_input_tokens_seen": 12705485472,
      "step": 16149
    },
    {
      "epoch": 1.713346064078082,
      "grad_norm": 0.4779581126379384,
      "learning_rate": 4.75529603659136e-05,
      "loss": 1.7961,
      "num_input_tokens_seen": 12706272304,
      "step": 16150
    },
    {
      "epoch": 1.7134521536176535,
      "grad_norm": 0.45707780678626314,
      "learning_rate": 4.7552660486113123e-05,
      "loss": 1.7635,
      "num_input_tokens_seen": 12707059120,
      "step": 16151
    },
    {
      "epoch": 1.7135582431572247,
      "grad_norm": 0.36964412478030306,
      "learning_rate": 4.755236058888461e-05,
      "loss": 1.7248,
      "num_input_tokens_seen": 12707845840,
      "step": 16152
    },
    {
      "epoch": 1.713664332696796,
      "grad_norm": 0.49663290249216613,
      "learning_rate": 4.7552060674228304e-05,
      "loss": 1.6729,
      "num_input_tokens_seen": 12708632528,
      "step": 16153
    },
    {
      "epoch": 1.7137704222363674,
      "grad_norm": 0.8877781469107078,
      "learning_rate": 4.755176074214442e-05,
      "loss": 1.8516,
      "num_input_tokens_seen": 12709419280,
      "step": 16154
    },
    {
      "epoch": 1.713876511775939,
      "grad_norm": 0.6133264622133814,
      "learning_rate": 4.7551460792633196e-05,
      "loss": 1.702,
      "num_input_tokens_seen": 12710206000,
      "step": 16155
    },
    {
      "epoch": 1.7139826013155104,
      "grad_norm": 0.987211626004063,
      "learning_rate": 4.755116082569486e-05,
      "loss": 1.6412,
      "num_input_tokens_seen": 12710992768,
      "step": 16156
    },
    {
      "epoch": 1.7140886908550816,
      "grad_norm": 0.4187371514677342,
      "learning_rate": 4.755086084132966e-05,
      "loss": 1.7412,
      "num_input_tokens_seen": 12711779472,
      "step": 16157
    },
    {
      "epoch": 1.7141947803946531,
      "grad_norm": 0.7616411951359752,
      "learning_rate": 4.755056083953781e-05,
      "loss": 1.6235,
      "num_input_tokens_seen": 12712566176,
      "step": 16158
    },
    {
      "epoch": 1.7143008699342244,
      "grad_norm": 0.503981978681334,
      "learning_rate": 4.755026082031955e-05,
      "loss": 1.841,
      "num_input_tokens_seen": 12713352960,
      "step": 16159
    },
    {
      "epoch": 1.7144069594737958,
      "grad_norm": 0.37941707208042463,
      "learning_rate": 4.754996078367511e-05,
      "loss": 1.8452,
      "num_input_tokens_seen": 12714139680,
      "step": 16160
    },
    {
      "epoch": 1.7145130490133673,
      "grad_norm": 0.49660983766231326,
      "learning_rate": 4.7549660729604725e-05,
      "loss": 1.8534,
      "num_input_tokens_seen": 12714926416,
      "step": 16161
    },
    {
      "epoch": 1.7146191385529388,
      "grad_norm": 0.8732617123691575,
      "learning_rate": 4.754936065810862e-05,
      "loss": 1.7938,
      "num_input_tokens_seen": 12715713168,
      "step": 16162
    },
    {
      "epoch": 1.71472522809251,
      "grad_norm": 0.5211296931157002,
      "learning_rate": 4.754906056918703e-05,
      "loss": 1.7195,
      "num_input_tokens_seen": 12716499904,
      "step": 16163
    },
    {
      "epoch": 1.7148313176320815,
      "grad_norm": 2.275639519751478,
      "learning_rate": 4.754876046284019e-05,
      "loss": 1.7918,
      "num_input_tokens_seen": 12717286656,
      "step": 16164
    },
    {
      "epoch": 1.7149374071716528,
      "grad_norm": 0.4400701457351556,
      "learning_rate": 4.754846033906832e-05,
      "loss": 1.5891,
      "num_input_tokens_seen": 12718073392,
      "step": 16165
    },
    {
      "epoch": 1.7150434967112242,
      "grad_norm": 0.7256916045261,
      "learning_rate": 4.754816019787167e-05,
      "loss": 1.8357,
      "num_input_tokens_seen": 12718860080,
      "step": 16166
    },
    {
      "epoch": 1.7151495862507957,
      "grad_norm": 0.974491885660357,
      "learning_rate": 4.7547860039250466e-05,
      "loss": 1.8715,
      "num_input_tokens_seen": 12719646832,
      "step": 16167
    },
    {
      "epoch": 1.7152556757903672,
      "grad_norm": 0.6284547658485092,
      "learning_rate": 4.7547559863204934e-05,
      "loss": 1.8893,
      "num_input_tokens_seen": 12720433584,
      "step": 16168
    },
    {
      "epoch": 1.7153617653299384,
      "grad_norm": 0.5541349472376779,
      "learning_rate": 4.754725966973531e-05,
      "loss": 1.7131,
      "num_input_tokens_seen": 12721220384,
      "step": 16169
    },
    {
      "epoch": 1.7154678548695097,
      "grad_norm": 0.4848359826302642,
      "learning_rate": 4.7546959458841825e-05,
      "loss": 1.6431,
      "num_input_tokens_seen": 12722007056,
      "step": 16170
    },
    {
      "epoch": 1.7155739444090812,
      "grad_norm": 0.5468312027799966,
      "learning_rate": 4.754665923052471e-05,
      "loss": 1.6787,
      "num_input_tokens_seen": 12722793808,
      "step": 16171
    },
    {
      "epoch": 1.7156800339486526,
      "grad_norm": 0.5153105672592608,
      "learning_rate": 4.75463589847842e-05,
      "loss": 1.7787,
      "num_input_tokens_seen": 12723580544,
      "step": 16172
    },
    {
      "epoch": 1.7157861234882241,
      "grad_norm": 0.4581961052527945,
      "learning_rate": 4.7546058721620524e-05,
      "loss": 1.752,
      "num_input_tokens_seen": 12724367280,
      "step": 16173
    },
    {
      "epoch": 1.7158922130277956,
      "grad_norm": 0.5302907106970655,
      "learning_rate": 4.7545758441033914e-05,
      "loss": 1.7396,
      "num_input_tokens_seen": 12725153968,
      "step": 16174
    },
    {
      "epoch": 1.7159983025673669,
      "grad_norm": 0.42247343289694717,
      "learning_rate": 4.754545814302461e-05,
      "loss": 1.6887,
      "num_input_tokens_seen": 12725940768,
      "step": 16175
    },
    {
      "epoch": 1.716104392106938,
      "grad_norm": 0.44909147752611445,
      "learning_rate": 4.754515782759283e-05,
      "loss": 1.7546,
      "num_input_tokens_seen": 12726727600,
      "step": 16176
    },
    {
      "epoch": 1.7162104816465096,
      "grad_norm": 0.3953250258852094,
      "learning_rate": 4.7544857494738814e-05,
      "loss": 1.5638,
      "num_input_tokens_seen": 12727514448,
      "step": 16177
    },
    {
      "epoch": 1.716316571186081,
      "grad_norm": 0.4318837894368166,
      "learning_rate": 4.75445571444628e-05,
      "loss": 1.7797,
      "num_input_tokens_seen": 12728301280,
      "step": 16178
    },
    {
      "epoch": 1.7164226607256525,
      "grad_norm": 0.4305146405328571,
      "learning_rate": 4.754425677676501e-05,
      "loss": 1.7777,
      "num_input_tokens_seen": 12729088000,
      "step": 16179
    },
    {
      "epoch": 1.716528750265224,
      "grad_norm": 0.5752658448779555,
      "learning_rate": 4.7543956391645684e-05,
      "loss": 1.7616,
      "num_input_tokens_seen": 12729874752,
      "step": 16180
    },
    {
      "epoch": 1.7166348398047953,
      "grad_norm": 0.39270969674270306,
      "learning_rate": 4.754365598910504e-05,
      "loss": 1.7284,
      "num_input_tokens_seen": 12730661456,
      "step": 16181
    },
    {
      "epoch": 1.7167409293443665,
      "grad_norm": 0.4661647874817449,
      "learning_rate": 4.7543355569143324e-05,
      "loss": 1.6462,
      "num_input_tokens_seen": 12731448240,
      "step": 16182
    },
    {
      "epoch": 1.716847018883938,
      "grad_norm": 0.3965471341500577,
      "learning_rate": 4.754305513176077e-05,
      "loss": 1.788,
      "num_input_tokens_seen": 12732235024,
      "step": 16183
    },
    {
      "epoch": 1.7169531084235095,
      "grad_norm": 0.47691317323979804,
      "learning_rate": 4.7542754676957604e-05,
      "loss": 1.7435,
      "num_input_tokens_seen": 12733021840,
      "step": 16184
    },
    {
      "epoch": 1.717059197963081,
      "grad_norm": 0.40459205647369545,
      "learning_rate": 4.754245420473405e-05,
      "loss": 1.7046,
      "num_input_tokens_seen": 12733808688,
      "step": 16185
    },
    {
      "epoch": 1.7171652875026524,
      "grad_norm": 0.5802355929482456,
      "learning_rate": 4.754215371509035e-05,
      "loss": 1.8356,
      "num_input_tokens_seen": 12734595568,
      "step": 16186
    },
    {
      "epoch": 1.7172713770422237,
      "grad_norm": 0.49058408816710336,
      "learning_rate": 4.754185320802674e-05,
      "loss": 1.7212,
      "num_input_tokens_seen": 12735382304,
      "step": 16187
    },
    {
      "epoch": 1.717377466581795,
      "grad_norm": 0.8885852556623692,
      "learning_rate": 4.754155268354345e-05,
      "loss": 1.6672,
      "num_input_tokens_seen": 12736169040,
      "step": 16188
    },
    {
      "epoch": 1.7174835561213664,
      "grad_norm": 0.5181048280819484,
      "learning_rate": 4.75412521416407e-05,
      "loss": 1.7237,
      "num_input_tokens_seen": 12736955792,
      "step": 16189
    },
    {
      "epoch": 1.7175896456609379,
      "grad_norm": 1.071006879912792,
      "learning_rate": 4.754095158231874e-05,
      "loss": 1.773,
      "num_input_tokens_seen": 12737742576,
      "step": 16190
    },
    {
      "epoch": 1.7176957352005093,
      "grad_norm": 0.401266939931455,
      "learning_rate": 4.7540651005577796e-05,
      "loss": 1.5877,
      "num_input_tokens_seen": 12738529360,
      "step": 16191
    },
    {
      "epoch": 1.7178018247400806,
      "grad_norm": 0.902505132192855,
      "learning_rate": 4.754035041141809e-05,
      "loss": 1.7652,
      "num_input_tokens_seen": 12739316016,
      "step": 16192
    },
    {
      "epoch": 1.717907914279652,
      "grad_norm": 0.43281661156052453,
      "learning_rate": 4.754004979983987e-05,
      "loss": 1.585,
      "num_input_tokens_seen": 12740102864,
      "step": 16193
    },
    {
      "epoch": 1.7180140038192233,
      "grad_norm": 0.6315992695880193,
      "learning_rate": 4.7539749170843356e-05,
      "loss": 1.8625,
      "num_input_tokens_seen": 12740889664,
      "step": 16194
    },
    {
      "epoch": 1.7181200933587948,
      "grad_norm": 0.44095057251462727,
      "learning_rate": 4.7539448524428786e-05,
      "loss": 1.7795,
      "num_input_tokens_seen": 12741676464,
      "step": 16195
    },
    {
      "epoch": 1.7182261828983663,
      "grad_norm": 0.4463251126760372,
      "learning_rate": 4.7539147860596386e-05,
      "loss": 1.7387,
      "num_input_tokens_seen": 12742463184,
      "step": 16196
    },
    {
      "epoch": 1.7183322724379377,
      "grad_norm": 0.48284778944424606,
      "learning_rate": 4.753884717934641e-05,
      "loss": 1.7594,
      "num_input_tokens_seen": 12743249984,
      "step": 16197
    },
    {
      "epoch": 1.718438361977509,
      "grad_norm": 0.4360823079883113,
      "learning_rate": 4.753854648067906e-05,
      "loss": 1.7574,
      "num_input_tokens_seen": 12744036880,
      "step": 16198
    },
    {
      "epoch": 1.7185444515170805,
      "grad_norm": 0.39937682814316816,
      "learning_rate": 4.753824576459459e-05,
      "loss": 1.6479,
      "num_input_tokens_seen": 12744823696,
      "step": 16199
    },
    {
      "epoch": 1.7186505410566517,
      "grad_norm": 0.38664745922684857,
      "learning_rate": 4.7537945031093225e-05,
      "loss": 1.6855,
      "num_input_tokens_seen": 12745610432,
      "step": 16200
    },
    {
      "epoch": 1.7187566305962232,
      "grad_norm": 0.46190730211081593,
      "learning_rate": 4.7537644280175186e-05,
      "loss": 1.7425,
      "num_input_tokens_seen": 12746397168,
      "step": 16201
    },
    {
      "epoch": 1.7188627201357947,
      "grad_norm": 0.4085142027503647,
      "learning_rate": 4.7537343511840726e-05,
      "loss": 1.8058,
      "num_input_tokens_seen": 12747183888,
      "step": 16202
    },
    {
      "epoch": 1.7189688096753661,
      "grad_norm": 0.3558938984541436,
      "learning_rate": 4.7537042726090063e-05,
      "loss": 1.7492,
      "num_input_tokens_seen": 12747970672,
      "step": 16203
    },
    {
      "epoch": 1.7190748992149374,
      "grad_norm": 0.4194159172502406,
      "learning_rate": 4.753674192292345e-05,
      "loss": 1.698,
      "num_input_tokens_seen": 12748757360,
      "step": 16204
    },
    {
      "epoch": 1.7191809887545086,
      "grad_norm": 0.4550807043363284,
      "learning_rate": 4.753644110234109e-05,
      "loss": 1.6403,
      "num_input_tokens_seen": 12749544176,
      "step": 16205
    },
    {
      "epoch": 1.7192870782940801,
      "grad_norm": 0.3895574137937059,
      "learning_rate": 4.753614026434323e-05,
      "loss": 1.7937,
      "num_input_tokens_seen": 12750331040,
      "step": 16206
    },
    {
      "epoch": 1.7193931678336516,
      "grad_norm": 0.4117712534867105,
      "learning_rate": 4.7535839408930105e-05,
      "loss": 1.6367,
      "num_input_tokens_seen": 12751117776,
      "step": 16207
    },
    {
      "epoch": 1.719499257373223,
      "grad_norm": 0.5120542568308587,
      "learning_rate": 4.753553853610194e-05,
      "loss": 1.655,
      "num_input_tokens_seen": 12751904512,
      "step": 16208
    },
    {
      "epoch": 1.7196053469127945,
      "grad_norm": 0.5191963577687326,
      "learning_rate": 4.7535237645858976e-05,
      "loss": 1.8496,
      "num_input_tokens_seen": 12752691216,
      "step": 16209
    },
    {
      "epoch": 1.7197114364523658,
      "grad_norm": 0.3941936840238234,
      "learning_rate": 4.753493673820144e-05,
      "loss": 1.6925,
      "num_input_tokens_seen": 12753477968,
      "step": 16210
    },
    {
      "epoch": 1.719817525991937,
      "grad_norm": 0.710684642416325,
      "learning_rate": 4.7534635813129565e-05,
      "loss": 1.7494,
      "num_input_tokens_seen": 12754264704,
      "step": 16211
    },
    {
      "epoch": 1.7199236155315085,
      "grad_norm": 0.5665757206973653,
      "learning_rate": 4.7534334870643594e-05,
      "loss": 1.7189,
      "num_input_tokens_seen": 12755051472,
      "step": 16212
    },
    {
      "epoch": 1.72002970507108,
      "grad_norm": 1.013083634133172,
      "learning_rate": 4.753403391074375e-05,
      "loss": 1.8145,
      "num_input_tokens_seen": 12755838304,
      "step": 16213
    },
    {
      "epoch": 1.7201357946106515,
      "grad_norm": 0.49089326836691627,
      "learning_rate": 4.753373293343025e-05,
      "loss": 1.694,
      "num_input_tokens_seen": 12756625088,
      "step": 16214
    },
    {
      "epoch": 1.720241884150223,
      "grad_norm": 0.634744793142165,
      "learning_rate": 4.753343193870335e-05,
      "loss": 1.8267,
      "num_input_tokens_seen": 12757411904,
      "step": 16215
    },
    {
      "epoch": 1.7203479736897942,
      "grad_norm": 0.9753913833533999,
      "learning_rate": 4.7533130926563286e-05,
      "loss": 1.8089,
      "num_input_tokens_seen": 12758198624,
      "step": 16216
    },
    {
      "epoch": 1.7204540632293654,
      "grad_norm": 0.4940095059699531,
      "learning_rate": 4.753282989701027e-05,
      "loss": 1.6808,
      "num_input_tokens_seen": 12758985344,
      "step": 16217
    },
    {
      "epoch": 1.720560152768937,
      "grad_norm": 0.7876713187748603,
      "learning_rate": 4.7532528850044545e-05,
      "loss": 1.6584,
      "num_input_tokens_seen": 12759772064,
      "step": 16218
    },
    {
      "epoch": 1.7206662423085084,
      "grad_norm": 0.5405418105561518,
      "learning_rate": 4.753222778566634e-05,
      "loss": 1.6987,
      "num_input_tokens_seen": 12760558864,
      "step": 16219
    },
    {
      "epoch": 1.7207723318480799,
      "grad_norm": 0.46289507466506186,
      "learning_rate": 4.753192670387589e-05,
      "loss": 1.9032,
      "num_input_tokens_seen": 12761345616,
      "step": 16220
    },
    {
      "epoch": 1.7208784213876511,
      "grad_norm": 0.5840305982197465,
      "learning_rate": 4.7531625604673435e-05,
      "loss": 1.6759,
      "num_input_tokens_seen": 12762132352,
      "step": 16221
    },
    {
      "epoch": 1.7209845109272226,
      "grad_norm": 0.48231873836534234,
      "learning_rate": 4.7531324488059194e-05,
      "loss": 1.6453,
      "num_input_tokens_seen": 12762919168,
      "step": 16222
    },
    {
      "epoch": 1.7210906004667939,
      "grad_norm": 0.5448674594039677,
      "learning_rate": 4.753102335403341e-05,
      "loss": 1.6405,
      "num_input_tokens_seen": 12763705936,
      "step": 16223
    },
    {
      "epoch": 1.7211966900063653,
      "grad_norm": 0.4472687346138122,
      "learning_rate": 4.753072220259631e-05,
      "loss": 1.7513,
      "num_input_tokens_seen": 12764492704,
      "step": 16224
    },
    {
      "epoch": 1.7213027795459368,
      "grad_norm": 0.56315013416968,
      "learning_rate": 4.753042103374813e-05,
      "loss": 1.7205,
      "num_input_tokens_seen": 12765279488,
      "step": 16225
    },
    {
      "epoch": 1.7214088690855083,
      "grad_norm": 0.582029964033168,
      "learning_rate": 4.7530119847489104e-05,
      "loss": 1.7738,
      "num_input_tokens_seen": 12766066240,
      "step": 16226
    },
    {
      "epoch": 1.7215149586250795,
      "grad_norm": 0.42930768945989384,
      "learning_rate": 4.752981864381946e-05,
      "loss": 1.7786,
      "num_input_tokens_seen": 12766852928,
      "step": 16227
    },
    {
      "epoch": 1.721621048164651,
      "grad_norm": 0.4686641039270156,
      "learning_rate": 4.752951742273943e-05,
      "loss": 1.7098,
      "num_input_tokens_seen": 12767639664,
      "step": 16228
    },
    {
      "epoch": 1.7217271377042223,
      "grad_norm": 0.5384824368370954,
      "learning_rate": 4.752921618424926e-05,
      "loss": 1.623,
      "num_input_tokens_seen": 12768426464,
      "step": 16229
    },
    {
      "epoch": 1.7218332272437937,
      "grad_norm": 0.43393756978530884,
      "learning_rate": 4.7528914928349164e-05,
      "loss": 1.7851,
      "num_input_tokens_seen": 12769213264,
      "step": 16230
    },
    {
      "epoch": 1.7219393167833652,
      "grad_norm": 0.6029975825156996,
      "learning_rate": 4.752861365503939e-05,
      "loss": 1.7827,
      "num_input_tokens_seen": 12770000032,
      "step": 16231
    },
    {
      "epoch": 1.7220454063229367,
      "grad_norm": 0.4388158520132079,
      "learning_rate": 4.752831236432016e-05,
      "loss": 1.7128,
      "num_input_tokens_seen": 12770786848,
      "step": 16232
    },
    {
      "epoch": 1.722151495862508,
      "grad_norm": 0.6206692195270263,
      "learning_rate": 4.752801105619171e-05,
      "loss": 1.6959,
      "num_input_tokens_seen": 12771573488,
      "step": 16233
    },
    {
      "epoch": 1.7222575854020794,
      "grad_norm": 0.4414876768413266,
      "learning_rate": 4.752770973065428e-05,
      "loss": 1.8522,
      "num_input_tokens_seen": 12772360208,
      "step": 16234
    },
    {
      "epoch": 1.7223636749416507,
      "grad_norm": 0.4992317735348116,
      "learning_rate": 4.752740838770809e-05,
      "loss": 1.6333,
      "num_input_tokens_seen": 12773147040,
      "step": 16235
    },
    {
      "epoch": 1.7224697644812221,
      "grad_norm": 0.39966908540149615,
      "learning_rate": 4.7527107027353384e-05,
      "loss": 1.6799,
      "num_input_tokens_seen": 12773933776,
      "step": 16236
    },
    {
      "epoch": 1.7225758540207936,
      "grad_norm": 0.594464687082811,
      "learning_rate": 4.752680564959039e-05,
      "loss": 1.7882,
      "num_input_tokens_seen": 12774720448,
      "step": 16237
    },
    {
      "epoch": 1.722681943560365,
      "grad_norm": 0.4072999182674764,
      "learning_rate": 4.752650425441933e-05,
      "loss": 1.7345,
      "num_input_tokens_seen": 12775507232,
      "step": 16238
    },
    {
      "epoch": 1.7227880330999363,
      "grad_norm": 0.6275194885303175,
      "learning_rate": 4.752620284184047e-05,
      "loss": 1.7516,
      "num_input_tokens_seen": 12776293920,
      "step": 16239
    },
    {
      "epoch": 1.7228941226395076,
      "grad_norm": 0.43254376874180744,
      "learning_rate": 4.752590141185401e-05,
      "loss": 1.7551,
      "num_input_tokens_seen": 12777080688,
      "step": 16240
    },
    {
      "epoch": 1.723000212179079,
      "grad_norm": 0.657019453271904,
      "learning_rate": 4.7525599964460196e-05,
      "loss": 1.7799,
      "num_input_tokens_seen": 12777867568,
      "step": 16241
    },
    {
      "epoch": 1.7231063017186505,
      "grad_norm": 0.4386989988313298,
      "learning_rate": 4.752529849965925e-05,
      "loss": 1.7548,
      "num_input_tokens_seen": 12778654384,
      "step": 16242
    },
    {
      "epoch": 1.723212391258222,
      "grad_norm": 0.8248442621999074,
      "learning_rate": 4.7524997017451435e-05,
      "loss": 1.9237,
      "num_input_tokens_seen": 12779441072,
      "step": 16243
    },
    {
      "epoch": 1.7233184807977935,
      "grad_norm": 0.4182068757598702,
      "learning_rate": 4.752469551783695e-05,
      "loss": 1.7492,
      "num_input_tokens_seen": 12780227824,
      "step": 16244
    },
    {
      "epoch": 1.7234245703373647,
      "grad_norm": 0.6000665875604354,
      "learning_rate": 4.7524394000816044e-05,
      "loss": 1.7181,
      "num_input_tokens_seen": 12781014656,
      "step": 16245
    },
    {
      "epoch": 1.723530659876936,
      "grad_norm": 0.3941215960472452,
      "learning_rate": 4.752409246638894e-05,
      "loss": 1.6729,
      "num_input_tokens_seen": 12781801472,
      "step": 16246
    },
    {
      "epoch": 1.7236367494165075,
      "grad_norm": 0.41140854066052207,
      "learning_rate": 4.752379091455588e-05,
      "loss": 1.743,
      "num_input_tokens_seen": 12782588128,
      "step": 16247
    },
    {
      "epoch": 1.723742838956079,
      "grad_norm": 0.4886811018532159,
      "learning_rate": 4.75234893453171e-05,
      "loss": 1.7211,
      "num_input_tokens_seen": 12783374864,
      "step": 16248
    },
    {
      "epoch": 1.7238489284956504,
      "grad_norm": 0.4381775213498189,
      "learning_rate": 4.7523187758672825e-05,
      "loss": 1.796,
      "num_input_tokens_seen": 12784161600,
      "step": 16249
    },
    {
      "epoch": 1.7239550180352219,
      "grad_norm": 0.3728479194984999,
      "learning_rate": 4.7522886154623303e-05,
      "loss": 1.6789,
      "num_input_tokens_seen": 12784948352,
      "step": 16250
    },
    {
      "epoch": 1.7240611075747931,
      "grad_norm": 0.5289858975753247,
      "learning_rate": 4.7522584533168745e-05,
      "loss": 1.7518,
      "num_input_tokens_seen": 12785735056,
      "step": 16251
    },
    {
      "epoch": 1.7241671971143644,
      "grad_norm": 0.425061247343059,
      "learning_rate": 4.752228289430939e-05,
      "loss": 1.8091,
      "num_input_tokens_seen": 12786521840,
      "step": 16252
    },
    {
      "epoch": 1.7242732866539359,
      "grad_norm": 0.4340313034031963,
      "learning_rate": 4.752198123804549e-05,
      "loss": 1.6656,
      "num_input_tokens_seen": 12787308608,
      "step": 16253
    },
    {
      "epoch": 1.7243793761935073,
      "grad_norm": 0.43309493333476123,
      "learning_rate": 4.752167956437725e-05,
      "loss": 1.6956,
      "num_input_tokens_seen": 12788095424,
      "step": 16254
    },
    {
      "epoch": 1.7244854657330788,
      "grad_norm": 0.3827668747476489,
      "learning_rate": 4.752137787330492e-05,
      "loss": 1.8072,
      "num_input_tokens_seen": 12788882176,
      "step": 16255
    },
    {
      "epoch": 1.72459155527265,
      "grad_norm": 0.3660838549931446,
      "learning_rate": 4.752107616482873e-05,
      "loss": 1.7411,
      "num_input_tokens_seen": 12789668992,
      "step": 16256
    },
    {
      "epoch": 1.7246976448122215,
      "grad_norm": 0.4040558765993459,
      "learning_rate": 4.7520774438948916e-05,
      "loss": 1.7059,
      "num_input_tokens_seen": 12790455840,
      "step": 16257
    },
    {
      "epoch": 1.7248037343517928,
      "grad_norm": 0.4247745101192658,
      "learning_rate": 4.752047269566571e-05,
      "loss": 1.8406,
      "num_input_tokens_seen": 12791242592,
      "step": 16258
    },
    {
      "epoch": 1.7249098238913643,
      "grad_norm": 0.3786585955265814,
      "learning_rate": 4.752017093497934e-05,
      "loss": 1.7619,
      "num_input_tokens_seen": 12792029344,
      "step": 16259
    },
    {
      "epoch": 1.7250159134309357,
      "grad_norm": 0.4357025276902182,
      "learning_rate": 4.751986915689004e-05,
      "loss": 1.7428,
      "num_input_tokens_seen": 12792816096,
      "step": 16260
    },
    {
      "epoch": 1.7251220029705072,
      "grad_norm": 0.5155997290492278,
      "learning_rate": 4.751956736139805e-05,
      "loss": 1.7059,
      "num_input_tokens_seen": 12793602912,
      "step": 16261
    },
    {
      "epoch": 1.7252280925100785,
      "grad_norm": 0.325739558199622,
      "learning_rate": 4.75192655485036e-05,
      "loss": 1.6997,
      "num_input_tokens_seen": 12794389712,
      "step": 16262
    },
    {
      "epoch": 1.72533418204965,
      "grad_norm": 0.5734421765327173,
      "learning_rate": 4.751896371820692e-05,
      "loss": 1.8819,
      "num_input_tokens_seen": 12795176432,
      "step": 16263
    },
    {
      "epoch": 1.7254402715892212,
      "grad_norm": 0.4103965014406285,
      "learning_rate": 4.7518661870508245e-05,
      "loss": 1.7697,
      "num_input_tokens_seen": 12795963264,
      "step": 16264
    },
    {
      "epoch": 1.7255463611287927,
      "grad_norm": 0.5152051656622665,
      "learning_rate": 4.751836000540782e-05,
      "loss": 1.6393,
      "num_input_tokens_seen": 12796750032,
      "step": 16265
    },
    {
      "epoch": 1.7256524506683641,
      "grad_norm": 0.38779548309433587,
      "learning_rate": 4.751805812290585e-05,
      "loss": 1.7954,
      "num_input_tokens_seen": 12797536720,
      "step": 16266
    },
    {
      "epoch": 1.7257585402079356,
      "grad_norm": 0.5956361623947232,
      "learning_rate": 4.751775622300259e-05,
      "loss": 1.625,
      "num_input_tokens_seen": 12798323600,
      "step": 16267
    },
    {
      "epoch": 1.7258646297475069,
      "grad_norm": 0.532457475740663,
      "learning_rate": 4.751745430569827e-05,
      "loss": 1.8449,
      "num_input_tokens_seen": 12799110368,
      "step": 16268
    },
    {
      "epoch": 1.7259707192870783,
      "grad_norm": 0.4732964433893148,
      "learning_rate": 4.751715237099313e-05,
      "loss": 1.7781,
      "num_input_tokens_seen": 12799897184,
      "step": 16269
    },
    {
      "epoch": 1.7260768088266496,
      "grad_norm": 0.4530755506948718,
      "learning_rate": 4.751685041888739e-05,
      "loss": 1.6372,
      "num_input_tokens_seen": 12800684048,
      "step": 16270
    },
    {
      "epoch": 1.726182898366221,
      "grad_norm": 0.38421654447670045,
      "learning_rate": 4.7516548449381285e-05,
      "loss": 1.7395,
      "num_input_tokens_seen": 12801470816,
      "step": 16271
    },
    {
      "epoch": 1.7262889879057925,
      "grad_norm": 0.4849864009401601,
      "learning_rate": 4.751624646247505e-05,
      "loss": 1.7882,
      "num_input_tokens_seen": 12802257568,
      "step": 16272
    },
    {
      "epoch": 1.726395077445364,
      "grad_norm": 0.3453727316211812,
      "learning_rate": 4.751594445816893e-05,
      "loss": 1.5736,
      "num_input_tokens_seen": 12803044352,
      "step": 16273
    },
    {
      "epoch": 1.7265011669849353,
      "grad_norm": 0.4170494790345616,
      "learning_rate": 4.751564243646314e-05,
      "loss": 1.773,
      "num_input_tokens_seen": 12803831136,
      "step": 16274
    },
    {
      "epoch": 1.7266072565245065,
      "grad_norm": 0.40258532788397067,
      "learning_rate": 4.7515340397357926e-05,
      "loss": 1.8756,
      "num_input_tokens_seen": 12804617904,
      "step": 16275
    },
    {
      "epoch": 1.726713346064078,
      "grad_norm": 0.37407656039630166,
      "learning_rate": 4.7515038340853524e-05,
      "loss": 1.6296,
      "num_input_tokens_seen": 12805404672,
      "step": 16276
    },
    {
      "epoch": 1.7268194356036495,
      "grad_norm": 0.3823241023425222,
      "learning_rate": 4.751473626695015e-05,
      "loss": 1.762,
      "num_input_tokens_seen": 12806191408,
      "step": 16277
    },
    {
      "epoch": 1.726925525143221,
      "grad_norm": 0.3724474505054989,
      "learning_rate": 4.751443417564806e-05,
      "loss": 1.6799,
      "num_input_tokens_seen": 12806978224,
      "step": 16278
    },
    {
      "epoch": 1.7270316146827924,
      "grad_norm": 0.3866255187705314,
      "learning_rate": 4.751413206694746e-05,
      "loss": 1.5998,
      "num_input_tokens_seen": 12807765024,
      "step": 16279
    },
    {
      "epoch": 1.7271377042223637,
      "grad_norm": 0.5589361222807808,
      "learning_rate": 4.751382994084861e-05,
      "loss": 1.598,
      "num_input_tokens_seen": 12808551840,
      "step": 16280
    },
    {
      "epoch": 1.727243793761935,
      "grad_norm": 0.3716853209524487,
      "learning_rate": 4.751352779735173e-05,
      "loss": 1.6938,
      "num_input_tokens_seen": 12809338576,
      "step": 16281
    },
    {
      "epoch": 1.7273498833015064,
      "grad_norm": 0.5046765302323448,
      "learning_rate": 4.751322563645706e-05,
      "loss": 1.7586,
      "num_input_tokens_seen": 12810125360,
      "step": 16282
    },
    {
      "epoch": 1.7274559728410779,
      "grad_norm": 0.41684580607666427,
      "learning_rate": 4.7512923458164824e-05,
      "loss": 1.8296,
      "num_input_tokens_seen": 12810912128,
      "step": 16283
    },
    {
      "epoch": 1.7275620623806494,
      "grad_norm": 0.4417059915919822,
      "learning_rate": 4.7512621262475263e-05,
      "loss": 1.8435,
      "num_input_tokens_seen": 12811698960,
      "step": 16284
    },
    {
      "epoch": 1.7276681519202208,
      "grad_norm": 0.4374458226031945,
      "learning_rate": 4.751231904938861e-05,
      "loss": 1.8616,
      "num_input_tokens_seen": 12812485792,
      "step": 16285
    },
    {
      "epoch": 1.727774241459792,
      "grad_norm": 0.36070451197809034,
      "learning_rate": 4.75120168189051e-05,
      "loss": 1.8277,
      "num_input_tokens_seen": 12813272656,
      "step": 16286
    },
    {
      "epoch": 1.7278803309993633,
      "grad_norm": 0.3408759772467564,
      "learning_rate": 4.7511714571024964e-05,
      "loss": 1.6724,
      "num_input_tokens_seen": 12814059408,
      "step": 16287
    },
    {
      "epoch": 1.7279864205389348,
      "grad_norm": 0.4783111966954583,
      "learning_rate": 4.751141230574843e-05,
      "loss": 1.7273,
      "num_input_tokens_seen": 12814846176,
      "step": 16288
    },
    {
      "epoch": 1.7280925100785063,
      "grad_norm": 0.4315488412198423,
      "learning_rate": 4.7511110023075746e-05,
      "loss": 1.7063,
      "num_input_tokens_seen": 12815632912,
      "step": 16289
    },
    {
      "epoch": 1.7281985996180778,
      "grad_norm": 0.34549839645350944,
      "learning_rate": 4.751080772300712e-05,
      "loss": 1.7452,
      "num_input_tokens_seen": 12816419648,
      "step": 16290
    },
    {
      "epoch": 1.728304689157649,
      "grad_norm": 0.464818459418161,
      "learning_rate": 4.751050540554281e-05,
      "loss": 1.7573,
      "num_input_tokens_seen": 12817206480,
      "step": 16291
    },
    {
      "epoch": 1.7284107786972205,
      "grad_norm": 0.48165721903046455,
      "learning_rate": 4.7510203070683056e-05,
      "loss": 1.7613,
      "num_input_tokens_seen": 12817993312,
      "step": 16292
    },
    {
      "epoch": 1.7285168682367917,
      "grad_norm": 0.3291710645342232,
      "learning_rate": 4.750990071842806e-05,
      "loss": 1.7885,
      "num_input_tokens_seen": 12818780016,
      "step": 16293
    },
    {
      "epoch": 1.7286229577763632,
      "grad_norm": 0.5216408600904759,
      "learning_rate": 4.7509598348778086e-05,
      "loss": 1.7291,
      "num_input_tokens_seen": 12819566784,
      "step": 16294
    },
    {
      "epoch": 1.7287290473159347,
      "grad_norm": 0.4096706968737954,
      "learning_rate": 4.750929596173335e-05,
      "loss": 1.7335,
      "num_input_tokens_seen": 12820353568,
      "step": 16295
    },
    {
      "epoch": 1.7288351368555062,
      "grad_norm": 0.3706524649447588,
      "learning_rate": 4.750899355729409e-05,
      "loss": 1.7427,
      "num_input_tokens_seen": 12821140352,
      "step": 16296
    },
    {
      "epoch": 1.7289412263950774,
      "grad_norm": 0.32459368853024667,
      "learning_rate": 4.7508691135460535e-05,
      "loss": 1.681,
      "num_input_tokens_seen": 12821927136,
      "step": 16297
    },
    {
      "epoch": 1.7290473159346489,
      "grad_norm": 0.40121155712424006,
      "learning_rate": 4.750838869623293e-05,
      "loss": 1.6624,
      "num_input_tokens_seen": 12822713984,
      "step": 16298
    },
    {
      "epoch": 1.7291534054742201,
      "grad_norm": 0.381745509464346,
      "learning_rate": 4.750808623961151e-05,
      "loss": 1.6295,
      "num_input_tokens_seen": 12823500832,
      "step": 16299
    },
    {
      "epoch": 1.7292594950137916,
      "grad_norm": 0.3852873011222508,
      "learning_rate": 4.750778376559648e-05,
      "loss": 1.7805,
      "num_input_tokens_seen": 12824287568,
      "step": 16300
    },
    {
      "epoch": 1.729365584553363,
      "grad_norm": 0.4083737255097219,
      "learning_rate": 4.750748127418811e-05,
      "loss": 1.5595,
      "num_input_tokens_seen": 12825074464,
      "step": 16301
    },
    {
      "epoch": 1.7294716740929346,
      "grad_norm": 0.43815520433101296,
      "learning_rate": 4.750717876538662e-05,
      "loss": 1.7079,
      "num_input_tokens_seen": 12825861232,
      "step": 16302
    },
    {
      "epoch": 1.7295777636325058,
      "grad_norm": 0.3929025652865879,
      "learning_rate": 4.750687623919223e-05,
      "loss": 1.6734,
      "num_input_tokens_seen": 12826648000,
      "step": 16303
    },
    {
      "epoch": 1.729683853172077,
      "grad_norm": 0.4827109128318549,
      "learning_rate": 4.7506573695605204e-05,
      "loss": 1.7402,
      "num_input_tokens_seen": 12827434752,
      "step": 16304
    },
    {
      "epoch": 1.7297899427116485,
      "grad_norm": 0.37816075195326476,
      "learning_rate": 4.7506271134625746e-05,
      "loss": 1.751,
      "num_input_tokens_seen": 12828221504,
      "step": 16305
    },
    {
      "epoch": 1.72989603225122,
      "grad_norm": 0.40522325266142084,
      "learning_rate": 4.750596855625411e-05,
      "loss": 1.7891,
      "num_input_tokens_seen": 12829008208,
      "step": 16306
    },
    {
      "epoch": 1.7300021217907915,
      "grad_norm": 0.47417983571706374,
      "learning_rate": 4.7505665960490516e-05,
      "loss": 1.8212,
      "num_input_tokens_seen": 12829794960,
      "step": 16307
    },
    {
      "epoch": 1.730108211330363,
      "grad_norm": 0.5923433897117805,
      "learning_rate": 4.750536334733521e-05,
      "loss": 1.7911,
      "num_input_tokens_seen": 12830581616,
      "step": 16308
    },
    {
      "epoch": 1.7302143008699342,
      "grad_norm": 0.44533481679081,
      "learning_rate": 4.750506071678841e-05,
      "loss": 1.8168,
      "num_input_tokens_seen": 12831368288,
      "step": 16309
    },
    {
      "epoch": 1.7303203904095055,
      "grad_norm": 0.3581863261670227,
      "learning_rate": 4.7504758068850366e-05,
      "loss": 1.6482,
      "num_input_tokens_seen": 12832155072,
      "step": 16310
    },
    {
      "epoch": 1.730426479949077,
      "grad_norm": 0.38877744803185305,
      "learning_rate": 4.7504455403521294e-05,
      "loss": 1.7679,
      "num_input_tokens_seen": 12832941776,
      "step": 16311
    },
    {
      "epoch": 1.7305325694886484,
      "grad_norm": 0.44354934695844794,
      "learning_rate": 4.750415272080145e-05,
      "loss": 1.6349,
      "num_input_tokens_seen": 12833728544,
      "step": 16312
    },
    {
      "epoch": 1.73063865902822,
      "grad_norm": 0.3862844753395644,
      "learning_rate": 4.750385002069106e-05,
      "loss": 1.7313,
      "num_input_tokens_seen": 12834515312,
      "step": 16313
    },
    {
      "epoch": 1.7307447485677914,
      "grad_norm": 0.49710124040314013,
      "learning_rate": 4.750354730319035e-05,
      "loss": 1.7478,
      "num_input_tokens_seen": 12835302144,
      "step": 16314
    },
    {
      "epoch": 1.7308508381073626,
      "grad_norm": 0.40033367258536434,
      "learning_rate": 4.750324456829957e-05,
      "loss": 1.7866,
      "num_input_tokens_seen": 12836088896,
      "step": 16315
    },
    {
      "epoch": 1.7309569276469339,
      "grad_norm": 0.4480261618134878,
      "learning_rate": 4.7502941816018925e-05,
      "loss": 1.7786,
      "num_input_tokens_seen": 12836875680,
      "step": 16316
    },
    {
      "epoch": 1.7310630171865053,
      "grad_norm": 0.4399158039950484,
      "learning_rate": 4.7502639046348675e-05,
      "loss": 1.8218,
      "num_input_tokens_seen": 12837662400,
      "step": 16317
    },
    {
      "epoch": 1.7311691067260768,
      "grad_norm": 0.6117117604024201,
      "learning_rate": 4.750233625928904e-05,
      "loss": 1.794,
      "num_input_tokens_seen": 12838449120,
      "step": 16318
    },
    {
      "epoch": 1.7312751962656483,
      "grad_norm": 0.3751902663999092,
      "learning_rate": 4.7502033454840264e-05,
      "loss": 1.7282,
      "num_input_tokens_seen": 12839235920,
      "step": 16319
    },
    {
      "epoch": 1.7313812858052198,
      "grad_norm": 0.5274747389500059,
      "learning_rate": 4.7501730633002583e-05,
      "loss": 1.8451,
      "num_input_tokens_seen": 12840022592,
      "step": 16320
    },
    {
      "epoch": 1.731487375344791,
      "grad_norm": 0.38692854603816246,
      "learning_rate": 4.750142779377622e-05,
      "loss": 1.6748,
      "num_input_tokens_seen": 12840809376,
      "step": 16321
    },
    {
      "epoch": 1.7315934648843623,
      "grad_norm": 0.6134801650046928,
      "learning_rate": 4.750112493716141e-05,
      "loss": 1.8534,
      "num_input_tokens_seen": 12841596176,
      "step": 16322
    },
    {
      "epoch": 1.7316995544239338,
      "grad_norm": 0.38681158328167914,
      "learning_rate": 4.75008220631584e-05,
      "loss": 1.9738,
      "num_input_tokens_seen": 12842382976,
      "step": 16323
    },
    {
      "epoch": 1.7318056439635052,
      "grad_norm": 0.4691252457272991,
      "learning_rate": 4.750051917176741e-05,
      "loss": 1.7762,
      "num_input_tokens_seen": 12843169744,
      "step": 16324
    },
    {
      "epoch": 1.7319117335030767,
      "grad_norm": 0.4124616786647907,
      "learning_rate": 4.750021626298867e-05,
      "loss": 1.6981,
      "num_input_tokens_seen": 12843956544,
      "step": 16325
    },
    {
      "epoch": 1.732017823042648,
      "grad_norm": 0.4195300138581305,
      "learning_rate": 4.749991333682244e-05,
      "loss": 1.7241,
      "num_input_tokens_seen": 12844743424,
      "step": 16326
    },
    {
      "epoch": 1.7321239125822194,
      "grad_norm": 0.5455081413023547,
      "learning_rate": 4.749961039326892e-05,
      "loss": 1.8148,
      "num_input_tokens_seen": 12845530144,
      "step": 16327
    },
    {
      "epoch": 1.7322300021217907,
      "grad_norm": 0.38603933174252486,
      "learning_rate": 4.7499307432328374e-05,
      "loss": 1.6903,
      "num_input_tokens_seen": 12846316960,
      "step": 16328
    },
    {
      "epoch": 1.7323360916613622,
      "grad_norm": 0.4653478614193092,
      "learning_rate": 4.7499004454001025e-05,
      "loss": 1.8263,
      "num_input_tokens_seen": 12847103664,
      "step": 16329
    },
    {
      "epoch": 1.7324421812009336,
      "grad_norm": 0.37274032848098737,
      "learning_rate": 4.74987014582871e-05,
      "loss": 1.6541,
      "num_input_tokens_seen": 12847890480,
      "step": 16330
    },
    {
      "epoch": 1.732548270740505,
      "grad_norm": 0.5519895602331677,
      "learning_rate": 4.749839844518683e-05,
      "loss": 1.7453,
      "num_input_tokens_seen": 12848677328,
      "step": 16331
    },
    {
      "epoch": 1.7326543602800764,
      "grad_norm": 0.37121025180804373,
      "learning_rate": 4.749809541470047e-05,
      "loss": 1.8193,
      "num_input_tokens_seen": 12849464016,
      "step": 16332
    },
    {
      "epoch": 1.7327604498196478,
      "grad_norm": 0.5103902351600328,
      "learning_rate": 4.749779236682824e-05,
      "loss": 1.674,
      "num_input_tokens_seen": 12850250784,
      "step": 16333
    },
    {
      "epoch": 1.732866539359219,
      "grad_norm": 0.35931693601133546,
      "learning_rate": 4.7497489301570374e-05,
      "loss": 1.7189,
      "num_input_tokens_seen": 12851037584,
      "step": 16334
    },
    {
      "epoch": 1.7329726288987906,
      "grad_norm": 0.37940150501335573,
      "learning_rate": 4.749718621892711e-05,
      "loss": 1.748,
      "num_input_tokens_seen": 12851824400,
      "step": 16335
    },
    {
      "epoch": 1.733078718438362,
      "grad_norm": 0.48495911611284037,
      "learning_rate": 4.7496883118898675e-05,
      "loss": 1.7617,
      "num_input_tokens_seen": 12852611120,
      "step": 16336
    },
    {
      "epoch": 1.7331848079779335,
      "grad_norm": 0.3503719641104139,
      "learning_rate": 4.749658000148532e-05,
      "loss": 1.7851,
      "num_input_tokens_seen": 12853397936,
      "step": 16337
    },
    {
      "epoch": 1.7332908975175048,
      "grad_norm": 0.402147385337037,
      "learning_rate": 4.749627686668726e-05,
      "loss": 1.6993,
      "num_input_tokens_seen": 12854184784,
      "step": 16338
    },
    {
      "epoch": 1.733396987057076,
      "grad_norm": 0.46003656067449694,
      "learning_rate": 4.7495973714504736e-05,
      "loss": 1.8217,
      "num_input_tokens_seen": 12854971632,
      "step": 16339
    },
    {
      "epoch": 1.7335030765966475,
      "grad_norm": 0.40722267285456715,
      "learning_rate": 4.749567054493799e-05,
      "loss": 1.7485,
      "num_input_tokens_seen": 12855758368,
      "step": 16340
    },
    {
      "epoch": 1.733609166136219,
      "grad_norm": 0.36683120851913026,
      "learning_rate": 4.749536735798724e-05,
      "loss": 1.6217,
      "num_input_tokens_seen": 12856545136,
      "step": 16341
    },
    {
      "epoch": 1.7337152556757904,
      "grad_norm": 0.44192441904376023,
      "learning_rate": 4.749506415365273e-05,
      "loss": 1.7595,
      "num_input_tokens_seen": 12857331872,
      "step": 16342
    },
    {
      "epoch": 1.733821345215362,
      "grad_norm": 0.42468795924948155,
      "learning_rate": 4.7494760931934714e-05,
      "loss": 1.6918,
      "num_input_tokens_seen": 12858118592,
      "step": 16343
    },
    {
      "epoch": 1.7339274347549332,
      "grad_norm": 0.3929034082270306,
      "learning_rate": 4.749445769283339e-05,
      "loss": 1.835,
      "num_input_tokens_seen": 12858905344,
      "step": 16344
    },
    {
      "epoch": 1.7340335242945044,
      "grad_norm": 0.39985415476757596,
      "learning_rate": 4.7494154436349014e-05,
      "loss": 1.7455,
      "num_input_tokens_seen": 12859692048,
      "step": 16345
    },
    {
      "epoch": 1.7341396138340759,
      "grad_norm": 0.3781517051473748,
      "learning_rate": 4.749385116248181e-05,
      "loss": 1.7023,
      "num_input_tokens_seen": 12860478704,
      "step": 16346
    },
    {
      "epoch": 1.7342457033736474,
      "grad_norm": 0.31744913625829185,
      "learning_rate": 4.7493547871232025e-05,
      "loss": 1.6237,
      "num_input_tokens_seen": 12861265568,
      "step": 16347
    },
    {
      "epoch": 1.7343517929132188,
      "grad_norm": 0.3847512596529535,
      "learning_rate": 4.749324456259988e-05,
      "loss": 1.5981,
      "num_input_tokens_seen": 12862052304,
      "step": 16348
    },
    {
      "epoch": 1.7344578824527903,
      "grad_norm": 0.3446072234100219,
      "learning_rate": 4.749294123658562e-05,
      "loss": 1.6188,
      "num_input_tokens_seen": 12862839072,
      "step": 16349
    },
    {
      "epoch": 1.7345639719923616,
      "grad_norm": 0.4100550312184399,
      "learning_rate": 4.7492637893189475e-05,
      "loss": 1.7916,
      "num_input_tokens_seen": 12863625824,
      "step": 16350
    },
    {
      "epoch": 1.7346700615319328,
      "grad_norm": 0.3591873425913924,
      "learning_rate": 4.749233453241167e-05,
      "loss": 1.7888,
      "num_input_tokens_seen": 12864412624,
      "step": 16351
    },
    {
      "epoch": 1.7347761510715043,
      "grad_norm": 0.40033381174986854,
      "learning_rate": 4.749203115425246e-05,
      "loss": 1.7077,
      "num_input_tokens_seen": 12865199360,
      "step": 16352
    },
    {
      "epoch": 1.7348822406110758,
      "grad_norm": 0.4386957789578881,
      "learning_rate": 4.749172775871207e-05,
      "loss": 1.8062,
      "num_input_tokens_seen": 12865986096,
      "step": 16353
    },
    {
      "epoch": 1.7349883301506472,
      "grad_norm": 0.38825594702728233,
      "learning_rate": 4.749142434579073e-05,
      "loss": 1.6557,
      "num_input_tokens_seen": 12866773104,
      "step": 16354
    },
    {
      "epoch": 1.7350944196902185,
      "grad_norm": 0.6034041936606188,
      "learning_rate": 4.749112091548867e-05,
      "loss": 1.7014,
      "num_input_tokens_seen": 12867559856,
      "step": 16355
    },
    {
      "epoch": 1.73520050922979,
      "grad_norm": 0.38114012757797716,
      "learning_rate": 4.7490817467806135e-05,
      "loss": 1.7505,
      "num_input_tokens_seen": 12868346624,
      "step": 16356
    },
    {
      "epoch": 1.7353065987693612,
      "grad_norm": 0.574552929984711,
      "learning_rate": 4.749051400274336e-05,
      "loss": 1.7061,
      "num_input_tokens_seen": 12869133392,
      "step": 16357
    },
    {
      "epoch": 1.7354126883089327,
      "grad_norm": 0.4379066515189638,
      "learning_rate": 4.7490210520300575e-05,
      "loss": 1.8336,
      "num_input_tokens_seen": 12869920080,
      "step": 16358
    },
    {
      "epoch": 1.7355187778485042,
      "grad_norm": 0.4536717036762309,
      "learning_rate": 4.748990702047801e-05,
      "loss": 1.8134,
      "num_input_tokens_seen": 12870706880,
      "step": 16359
    },
    {
      "epoch": 1.7356248673880756,
      "grad_norm": 0.45054869672076114,
      "learning_rate": 4.7489603503275917e-05,
      "loss": 1.5589,
      "num_input_tokens_seen": 12871493696,
      "step": 16360
    },
    {
      "epoch": 1.735730956927647,
      "grad_norm": 0.3953122281545024,
      "learning_rate": 4.748929996869451e-05,
      "loss": 1.7236,
      "num_input_tokens_seen": 12872280416,
      "step": 16361
    },
    {
      "epoch": 1.7358370464672184,
      "grad_norm": 0.4814416870658773,
      "learning_rate": 4.7488996416734025e-05,
      "loss": 1.7048,
      "num_input_tokens_seen": 12873067216,
      "step": 16362
    },
    {
      "epoch": 1.7359431360067896,
      "grad_norm": 0.3697825031088388,
      "learning_rate": 4.748869284739471e-05,
      "loss": 1.7769,
      "num_input_tokens_seen": 12873854032,
      "step": 16363
    },
    {
      "epoch": 1.736049225546361,
      "grad_norm": 0.4411358861531973,
      "learning_rate": 4.7488389260676796e-05,
      "loss": 1.6594,
      "num_input_tokens_seen": 12874640784,
      "step": 16364
    },
    {
      "epoch": 1.7361553150859326,
      "grad_norm": 0.47698748019062914,
      "learning_rate": 4.748808565658052e-05,
      "loss": 1.7388,
      "num_input_tokens_seen": 12875427504,
      "step": 16365
    },
    {
      "epoch": 1.736261404625504,
      "grad_norm": 0.3938893856817086,
      "learning_rate": 4.74877820351061e-05,
      "loss": 1.7479,
      "num_input_tokens_seen": 12876214304,
      "step": 16366
    },
    {
      "epoch": 1.7363674941650753,
      "grad_norm": 0.6301517435499365,
      "learning_rate": 4.748747839625378e-05,
      "loss": 1.8048,
      "num_input_tokens_seen": 12877000992,
      "step": 16367
    },
    {
      "epoch": 1.7364735837046468,
      "grad_norm": 0.39507376704425806,
      "learning_rate": 4.7487174740023796e-05,
      "loss": 1.6318,
      "num_input_tokens_seen": 12877787712,
      "step": 16368
    },
    {
      "epoch": 1.736579673244218,
      "grad_norm": 0.5134738519545822,
      "learning_rate": 4.74868710664164e-05,
      "loss": 1.8644,
      "num_input_tokens_seen": 12878574480,
      "step": 16369
    },
    {
      "epoch": 1.7366857627837895,
      "grad_norm": 0.41590679138190645,
      "learning_rate": 4.748656737543179e-05,
      "loss": 1.9818,
      "num_input_tokens_seen": 12879361168,
      "step": 16370
    },
    {
      "epoch": 1.736791852323361,
      "grad_norm": 0.5524618986160392,
      "learning_rate": 4.748626366707023e-05,
      "loss": 1.7347,
      "num_input_tokens_seen": 12880147952,
      "step": 16371
    },
    {
      "epoch": 1.7368979418629324,
      "grad_norm": 0.4423143555565949,
      "learning_rate": 4.7485959941331946e-05,
      "loss": 1.6795,
      "num_input_tokens_seen": 12880934656,
      "step": 16372
    },
    {
      "epoch": 1.7370040314025037,
      "grad_norm": 0.3218219125315273,
      "learning_rate": 4.748565619821717e-05,
      "loss": 1.6422,
      "num_input_tokens_seen": 12881721376,
      "step": 16373
    },
    {
      "epoch": 1.737110120942075,
      "grad_norm": 0.5296714884349273,
      "learning_rate": 4.7485352437726135e-05,
      "loss": 1.7513,
      "num_input_tokens_seen": 12882508112,
      "step": 16374
    },
    {
      "epoch": 1.7372162104816464,
      "grad_norm": 0.36892916245337776,
      "learning_rate": 4.748504865985909e-05,
      "loss": 1.7412,
      "num_input_tokens_seen": 12883294864,
      "step": 16375
    },
    {
      "epoch": 1.737322300021218,
      "grad_norm": 0.4286858744751596,
      "learning_rate": 4.748474486461625e-05,
      "loss": 1.7861,
      "num_input_tokens_seen": 12884081680,
      "step": 16376
    },
    {
      "epoch": 1.7374283895607894,
      "grad_norm": 0.46938161607200996,
      "learning_rate": 4.748444105199786e-05,
      "loss": 1.7598,
      "num_input_tokens_seen": 12884868416,
      "step": 16377
    },
    {
      "epoch": 1.7375344791003609,
      "grad_norm": 0.3304254385717895,
      "learning_rate": 4.7484137222004153e-05,
      "loss": 1.7234,
      "num_input_tokens_seen": 12885655168,
      "step": 16378
    },
    {
      "epoch": 1.737640568639932,
      "grad_norm": 0.5577118377278473,
      "learning_rate": 4.748383337463537e-05,
      "loss": 1.834,
      "num_input_tokens_seen": 12886441920,
      "step": 16379
    },
    {
      "epoch": 1.7377466581795034,
      "grad_norm": 0.3698557965825709,
      "learning_rate": 4.7483529509891736e-05,
      "loss": 1.7427,
      "num_input_tokens_seen": 12887228720,
      "step": 16380
    },
    {
      "epoch": 1.7378527477190748,
      "grad_norm": 0.5538580939347512,
      "learning_rate": 4.748322562777349e-05,
      "loss": 1.7789,
      "num_input_tokens_seen": 12888015392,
      "step": 16381
    },
    {
      "epoch": 1.7379588372586463,
      "grad_norm": 0.3919333747103211,
      "learning_rate": 4.748292172828087e-05,
      "loss": 1.6805,
      "num_input_tokens_seen": 12888802064,
      "step": 16382
    },
    {
      "epoch": 1.7380649267982178,
      "grad_norm": 0.45486838791399414,
      "learning_rate": 4.748261781141411e-05,
      "loss": 1.8652,
      "num_input_tokens_seen": 12889588816,
      "step": 16383
    },
    {
      "epoch": 1.7381710163377893,
      "grad_norm": 0.42801510197182185,
      "learning_rate": 4.7482313877173436e-05,
      "loss": 1.6741,
      "num_input_tokens_seen": 12890375536,
      "step": 16384
    },
    {
      "epoch": 1.7382771058773605,
      "grad_norm": 0.39936788597712775,
      "learning_rate": 4.748200992555909e-05,
      "loss": 1.7414,
      "num_input_tokens_seen": 12891162272,
      "step": 16385
    },
    {
      "epoch": 1.7383831954169318,
      "grad_norm": 0.37695886853593075,
      "learning_rate": 4.748170595657131e-05,
      "loss": 1.6672,
      "num_input_tokens_seen": 12891949088,
      "step": 16386
    },
    {
      "epoch": 1.7384892849565032,
      "grad_norm": 0.37056700923634955,
      "learning_rate": 4.748140197021033e-05,
      "loss": 1.8038,
      "num_input_tokens_seen": 12892735856,
      "step": 16387
    },
    {
      "epoch": 1.7385953744960747,
      "grad_norm": 0.32911358339110636,
      "learning_rate": 4.748109796647637e-05,
      "loss": 1.7357,
      "num_input_tokens_seen": 12893522656,
      "step": 16388
    },
    {
      "epoch": 1.7387014640356462,
      "grad_norm": 0.3864101346429952,
      "learning_rate": 4.7480793945369687e-05,
      "loss": 1.6471,
      "num_input_tokens_seen": 12894309376,
      "step": 16389
    },
    {
      "epoch": 1.7388075535752174,
      "grad_norm": 0.38397929710109485,
      "learning_rate": 4.74804899068905e-05,
      "loss": 1.7921,
      "num_input_tokens_seen": 12895096112,
      "step": 16390
    },
    {
      "epoch": 1.738913643114789,
      "grad_norm": 0.5032687471800517,
      "learning_rate": 4.748018585103906e-05,
      "loss": 1.7599,
      "num_input_tokens_seen": 12895882880,
      "step": 16391
    },
    {
      "epoch": 1.7390197326543602,
      "grad_norm": 0.3990583781152208,
      "learning_rate": 4.7479881777815584e-05,
      "loss": 1.6231,
      "num_input_tokens_seen": 12896669648,
      "step": 16392
    },
    {
      "epoch": 1.7391258221939316,
      "grad_norm": 0.45312967310687363,
      "learning_rate": 4.7479577687220316e-05,
      "loss": 1.7528,
      "num_input_tokens_seen": 12897456448,
      "step": 16393
    },
    {
      "epoch": 1.739231911733503,
      "grad_norm": 0.3921820633318934,
      "learning_rate": 4.7479273579253494e-05,
      "loss": 1.7313,
      "num_input_tokens_seen": 12898243232,
      "step": 16394
    },
    {
      "epoch": 1.7393380012730746,
      "grad_norm": 0.5154687522171456,
      "learning_rate": 4.747896945391535e-05,
      "loss": 1.764,
      "num_input_tokens_seen": 12899029968,
      "step": 16395
    },
    {
      "epoch": 1.7394440908126458,
      "grad_norm": 0.40283194736670813,
      "learning_rate": 4.7478665311206106e-05,
      "loss": 1.6733,
      "num_input_tokens_seen": 12899816736,
      "step": 16396
    },
    {
      "epoch": 1.7395501803522173,
      "grad_norm": 0.389067805116468,
      "learning_rate": 4.7478361151126015e-05,
      "loss": 1.8341,
      "num_input_tokens_seen": 12900603424,
      "step": 16397
    },
    {
      "epoch": 1.7396562698917886,
      "grad_norm": 0.3953449579087362,
      "learning_rate": 4.747805697367531e-05,
      "loss": 1.7708,
      "num_input_tokens_seen": 12901390224,
      "step": 16398
    },
    {
      "epoch": 1.73976235943136,
      "grad_norm": 0.3635849881148725,
      "learning_rate": 4.7477752778854225e-05,
      "loss": 1.672,
      "num_input_tokens_seen": 12902176976,
      "step": 16399
    },
    {
      "epoch": 1.7398684489709315,
      "grad_norm": 0.4490977239096949,
      "learning_rate": 4.747744856666299e-05,
      "loss": 1.6197,
      "num_input_tokens_seen": 12902963696,
      "step": 16400
    },
    {
      "epoch": 1.739974538510503,
      "grad_norm": 0.4633416515796508,
      "learning_rate": 4.7477144337101834e-05,
      "loss": 1.7349,
      "num_input_tokens_seen": 12903750464,
      "step": 16401
    },
    {
      "epoch": 1.7400806280500742,
      "grad_norm": 0.38212147988185,
      "learning_rate": 4.7476840090171e-05,
      "loss": 1.7374,
      "num_input_tokens_seen": 12904537312,
      "step": 16402
    },
    {
      "epoch": 1.7401867175896457,
      "grad_norm": 0.39996639194639383,
      "learning_rate": 4.747653582587073e-05,
      "loss": 1.6884,
      "num_input_tokens_seen": 12905324000,
      "step": 16403
    },
    {
      "epoch": 1.740292807129217,
      "grad_norm": 0.509595919790718,
      "learning_rate": 4.7476231544201256e-05,
      "loss": 1.7615,
      "num_input_tokens_seen": 12906110736,
      "step": 16404
    },
    {
      "epoch": 1.7403988966687884,
      "grad_norm": 0.39984199655282937,
      "learning_rate": 4.74759272451628e-05,
      "loss": 1.7628,
      "num_input_tokens_seen": 12906897520,
      "step": 16405
    },
    {
      "epoch": 1.74050498620836,
      "grad_norm": 0.41276864842965444,
      "learning_rate": 4.747562292875561e-05,
      "loss": 1.8065,
      "num_input_tokens_seen": 12907684224,
      "step": 16406
    },
    {
      "epoch": 1.7406110757479314,
      "grad_norm": 0.538680791001774,
      "learning_rate": 4.747531859497992e-05,
      "loss": 1.8304,
      "num_input_tokens_seen": 12908470944,
      "step": 16407
    },
    {
      "epoch": 1.7407171652875026,
      "grad_norm": 0.34779627833127974,
      "learning_rate": 4.747501424383597e-05,
      "loss": 1.6643,
      "num_input_tokens_seen": 12909257760,
      "step": 16408
    },
    {
      "epoch": 1.740823254827074,
      "grad_norm": 0.38953320819926057,
      "learning_rate": 4.747470987532399e-05,
      "loss": 1.6902,
      "num_input_tokens_seen": 12910044576,
      "step": 16409
    },
    {
      "epoch": 1.7409293443666454,
      "grad_norm": 0.48225919444411586,
      "learning_rate": 4.747440548944419e-05,
      "loss": 1.8665,
      "num_input_tokens_seen": 12910831312,
      "step": 16410
    },
    {
      "epoch": 1.7410354339062168,
      "grad_norm": 0.4670488857556186,
      "learning_rate": 4.7474101086196854e-05,
      "loss": 1.7559,
      "num_input_tokens_seen": 12911618080,
      "step": 16411
    },
    {
      "epoch": 1.7411415234457883,
      "grad_norm": 0.4042813641379155,
      "learning_rate": 4.747379666558218e-05,
      "loss": 1.7018,
      "num_input_tokens_seen": 12912404896,
      "step": 16412
    },
    {
      "epoch": 1.7412476129853598,
      "grad_norm": 0.4737155472566546,
      "learning_rate": 4.7473492227600426e-05,
      "loss": 1.7701,
      "num_input_tokens_seen": 12913191680,
      "step": 16413
    },
    {
      "epoch": 1.741353702524931,
      "grad_norm": 0.7371000511405689,
      "learning_rate": 4.7473187772251806e-05,
      "loss": 1.5965,
      "num_input_tokens_seen": 12913978384,
      "step": 16414
    },
    {
      "epoch": 1.7414597920645023,
      "grad_norm": 0.4497908553917934,
      "learning_rate": 4.7472883299536564e-05,
      "loss": 1.8733,
      "num_input_tokens_seen": 12914765120,
      "step": 16415
    },
    {
      "epoch": 1.7415658816040738,
      "grad_norm": 2.3326959035628803,
      "learning_rate": 4.7472578809454944e-05,
      "loss": 1.8685,
      "num_input_tokens_seen": 12915551904,
      "step": 16416
    },
    {
      "epoch": 1.7416719711436452,
      "grad_norm": 0.4577508938496384,
      "learning_rate": 4.747227430200717e-05,
      "loss": 1.6681,
      "num_input_tokens_seen": 12916338704,
      "step": 16417
    },
    {
      "epoch": 1.7417780606832167,
      "grad_norm": 1.1935775249230984,
      "learning_rate": 4.7471969777193486e-05,
      "loss": 1.616,
      "num_input_tokens_seen": 12917125440,
      "step": 16418
    },
    {
      "epoch": 1.7418841502227882,
      "grad_norm": 0.6036595150832412,
      "learning_rate": 4.747166523501412e-05,
      "loss": 1.8366,
      "num_input_tokens_seen": 12917912208,
      "step": 16419
    },
    {
      "epoch": 1.7419902397623594,
      "grad_norm": 0.6272030126184007,
      "learning_rate": 4.747136067546931e-05,
      "loss": 1.7928,
      "num_input_tokens_seen": 12918698896,
      "step": 16420
    },
    {
      "epoch": 1.7420963293019307,
      "grad_norm": 0.5076420616243043,
      "learning_rate": 4.74710560985593e-05,
      "loss": 1.6602,
      "num_input_tokens_seen": 12919485616,
      "step": 16421
    },
    {
      "epoch": 1.7422024188415022,
      "grad_norm": 0.5139908597541616,
      "learning_rate": 4.74707515042843e-05,
      "loss": 1.6905,
      "num_input_tokens_seen": 12920272384,
      "step": 16422
    },
    {
      "epoch": 1.7423085083810737,
      "grad_norm": 0.5132910088543681,
      "learning_rate": 4.7470446892644585e-05,
      "loss": 1.8771,
      "num_input_tokens_seen": 12921059216,
      "step": 16423
    },
    {
      "epoch": 1.7424145979206451,
      "grad_norm": 0.6201571389622041,
      "learning_rate": 4.747014226364035e-05,
      "loss": 1.8443,
      "num_input_tokens_seen": 12921845904,
      "step": 16424
    },
    {
      "epoch": 1.7425206874602164,
      "grad_norm": 0.5327581700822803,
      "learning_rate": 4.7469837617271864e-05,
      "loss": 1.7559,
      "num_input_tokens_seen": 12922632560,
      "step": 16425
    },
    {
      "epoch": 1.7426267769997879,
      "grad_norm": 0.451728546005265,
      "learning_rate": 4.746953295353933e-05,
      "loss": 1.7268,
      "num_input_tokens_seen": 12923419264,
      "step": 16426
    },
    {
      "epoch": 1.742732866539359,
      "grad_norm": 0.8716616710809434,
      "learning_rate": 4.746922827244301e-05,
      "loss": 1.7807,
      "num_input_tokens_seen": 12924206080,
      "step": 16427
    },
    {
      "epoch": 1.7428389560789306,
      "grad_norm": 0.9261412114161867,
      "learning_rate": 4.746892357398313e-05,
      "loss": 1.6886,
      "num_input_tokens_seen": 12924992816,
      "step": 16428
    },
    {
      "epoch": 1.742945045618502,
      "grad_norm": 0.6478201213403058,
      "learning_rate": 4.746861885815992e-05,
      "loss": 1.8228,
      "num_input_tokens_seen": 12925779488,
      "step": 16429
    },
    {
      "epoch": 1.7430511351580735,
      "grad_norm": 0.5050354404563172,
      "learning_rate": 4.7468314124973625e-05,
      "loss": 1.7695,
      "num_input_tokens_seen": 12926566288,
      "step": 16430
    },
    {
      "epoch": 1.7431572246976448,
      "grad_norm": 0.6299594072551312,
      "learning_rate": 4.746800937442447e-05,
      "loss": 1.817,
      "num_input_tokens_seen": 12927353024,
      "step": 16431
    },
    {
      "epoch": 1.7432633142372163,
      "grad_norm": 0.45716197739665615,
      "learning_rate": 4.74677046065127e-05,
      "loss": 1.7295,
      "num_input_tokens_seen": 12928139728,
      "step": 16432
    },
    {
      "epoch": 1.7433694037767875,
      "grad_norm": 0.47056995721977196,
      "learning_rate": 4.7467399821238554e-05,
      "loss": 1.7956,
      "num_input_tokens_seen": 12928926512,
      "step": 16433
    },
    {
      "epoch": 1.743475493316359,
      "grad_norm": 0.6427324822309111,
      "learning_rate": 4.746709501860225e-05,
      "loss": 1.7585,
      "num_input_tokens_seen": 12929713312,
      "step": 16434
    },
    {
      "epoch": 1.7435815828559305,
      "grad_norm": 0.4686020423527286,
      "learning_rate": 4.7466790198604036e-05,
      "loss": 1.7443,
      "num_input_tokens_seen": 12930500000,
      "step": 16435
    },
    {
      "epoch": 1.743687672395502,
      "grad_norm": 0.49767960214258417,
      "learning_rate": 4.746648536124415e-05,
      "loss": 1.7659,
      "num_input_tokens_seen": 12931286832,
      "step": 16436
    },
    {
      "epoch": 1.7437937619350732,
      "grad_norm": 0.6923142356169465,
      "learning_rate": 4.746618050652283e-05,
      "loss": 1.7685,
      "num_input_tokens_seen": 12932073664,
      "step": 16437
    },
    {
      "epoch": 1.7438998514746444,
      "grad_norm": 0.563410789788481,
      "learning_rate": 4.7465875634440296e-05,
      "loss": 1.7774,
      "num_input_tokens_seen": 12932860480,
      "step": 16438
    },
    {
      "epoch": 1.744005941014216,
      "grad_norm": 0.46063092591309857,
      "learning_rate": 4.746557074499679e-05,
      "loss": 1.7476,
      "num_input_tokens_seen": 12933647200,
      "step": 16439
    },
    {
      "epoch": 1.7441120305537874,
      "grad_norm": 0.46460931780927756,
      "learning_rate": 4.746526583819255e-05,
      "loss": 1.7963,
      "num_input_tokens_seen": 12934433936,
      "step": 16440
    },
    {
      "epoch": 1.7442181200933589,
      "grad_norm": 0.4804537072429912,
      "learning_rate": 4.7464960914027816e-05,
      "loss": 1.7277,
      "num_input_tokens_seen": 12935220688,
      "step": 16441
    },
    {
      "epoch": 1.7443242096329303,
      "grad_norm": 0.3962149890566814,
      "learning_rate": 4.7464655972502816e-05,
      "loss": 1.6509,
      "num_input_tokens_seen": 12936007408,
      "step": 16442
    },
    {
      "epoch": 1.7444302991725016,
      "grad_norm": 0.40997793894143003,
      "learning_rate": 4.7464351013617795e-05,
      "loss": 1.7834,
      "num_input_tokens_seen": 12936794144,
      "step": 16443
    },
    {
      "epoch": 1.7445363887120728,
      "grad_norm": 0.5495423930201128,
      "learning_rate": 4.7464046037372975e-05,
      "loss": 1.7699,
      "num_input_tokens_seen": 12937580864,
      "step": 16444
    },
    {
      "epoch": 1.7446424782516443,
      "grad_norm": 0.4132903516494531,
      "learning_rate": 4.746374104376861e-05,
      "loss": 1.9608,
      "num_input_tokens_seen": 12938367680,
      "step": 16445
    },
    {
      "epoch": 1.7447485677912158,
      "grad_norm": 0.48181603842923465,
      "learning_rate": 4.746343603280492e-05,
      "loss": 1.853,
      "num_input_tokens_seen": 12939154416,
      "step": 16446
    },
    {
      "epoch": 1.7448546573307873,
      "grad_norm": 0.48685361279173206,
      "learning_rate": 4.746313100448214e-05,
      "loss": 1.8073,
      "num_input_tokens_seen": 12939941168,
      "step": 16447
    },
    {
      "epoch": 1.7449607468703587,
      "grad_norm": 0.44928677437761383,
      "learning_rate": 4.7462825958800514e-05,
      "loss": 1.8096,
      "num_input_tokens_seen": 12940727968,
      "step": 16448
    },
    {
      "epoch": 1.74506683640993,
      "grad_norm": 0.4303093755471915,
      "learning_rate": 4.746252089576028e-05,
      "loss": 1.8663,
      "num_input_tokens_seen": 12941514608,
      "step": 16449
    },
    {
      "epoch": 1.7451729259495012,
      "grad_norm": 0.5051901871775729,
      "learning_rate": 4.746221581536167e-05,
      "loss": 1.8742,
      "num_input_tokens_seen": 12942301376,
      "step": 16450
    },
    {
      "epoch": 1.7452790154890727,
      "grad_norm": 0.4863733301117712,
      "learning_rate": 4.746191071760491e-05,
      "loss": 1.7425,
      "num_input_tokens_seen": 12943088128,
      "step": 16451
    },
    {
      "epoch": 1.7453851050286442,
      "grad_norm": 0.43243207665550043,
      "learning_rate": 4.746160560249025e-05,
      "loss": 1.8088,
      "num_input_tokens_seen": 12943874832,
      "step": 16452
    },
    {
      "epoch": 1.7454911945682157,
      "grad_norm": 0.47730152625162275,
      "learning_rate": 4.7461300470017924e-05,
      "loss": 1.7294,
      "num_input_tokens_seen": 12944661616,
      "step": 16453
    },
    {
      "epoch": 1.745597284107787,
      "grad_norm": 0.4541063399423077,
      "learning_rate": 4.746099532018815e-05,
      "loss": 1.8025,
      "num_input_tokens_seen": 12945448384,
      "step": 16454
    },
    {
      "epoch": 1.7457033736473584,
      "grad_norm": 0.4524637203958344,
      "learning_rate": 4.746069015300119e-05,
      "loss": 1.7041,
      "num_input_tokens_seen": 12946235088,
      "step": 16455
    },
    {
      "epoch": 1.7458094631869296,
      "grad_norm": 0.3770416016736722,
      "learning_rate": 4.746038496845727e-05,
      "loss": 1.586,
      "num_input_tokens_seen": 12947021968,
      "step": 16456
    },
    {
      "epoch": 1.7459155527265011,
      "grad_norm": 0.45552209086265394,
      "learning_rate": 4.746007976655662e-05,
      "loss": 1.7636,
      "num_input_tokens_seen": 12947808672,
      "step": 16457
    },
    {
      "epoch": 1.7460216422660726,
      "grad_norm": 0.398378264610299,
      "learning_rate": 4.7459774547299475e-05,
      "loss": 1.6852,
      "num_input_tokens_seen": 12948595472,
      "step": 16458
    },
    {
      "epoch": 1.746127731805644,
      "grad_norm": 0.38055758418559704,
      "learning_rate": 4.745946931068608e-05,
      "loss": 1.7914,
      "num_input_tokens_seen": 12949382256,
      "step": 16459
    },
    {
      "epoch": 1.7462338213452153,
      "grad_norm": 0.40550704669869786,
      "learning_rate": 4.7459164056716665e-05,
      "loss": 1.7366,
      "num_input_tokens_seen": 12950169024,
      "step": 16460
    },
    {
      "epoch": 1.7463399108847868,
      "grad_norm": 0.34584856685092125,
      "learning_rate": 4.7458858785391465e-05,
      "loss": 1.613,
      "num_input_tokens_seen": 12950955760,
      "step": 16461
    },
    {
      "epoch": 1.746446000424358,
      "grad_norm": 0.37643995267286773,
      "learning_rate": 4.7458553496710716e-05,
      "loss": 1.7121,
      "num_input_tokens_seen": 12951742560,
      "step": 16462
    },
    {
      "epoch": 1.7465520899639295,
      "grad_norm": 0.3509690323084048,
      "learning_rate": 4.745824819067466e-05,
      "loss": 1.8127,
      "num_input_tokens_seen": 12952529264,
      "step": 16463
    },
    {
      "epoch": 1.746658179503501,
      "grad_norm": 0.3795806698834726,
      "learning_rate": 4.7457942867283526e-05,
      "loss": 1.7397,
      "num_input_tokens_seen": 12953316016,
      "step": 16464
    },
    {
      "epoch": 1.7467642690430725,
      "grad_norm": 0.38856555808250565,
      "learning_rate": 4.745763752653756e-05,
      "loss": 1.8194,
      "num_input_tokens_seen": 12954102656,
      "step": 16465
    },
    {
      "epoch": 1.7468703585826437,
      "grad_norm": 0.37330300649880055,
      "learning_rate": 4.7457332168436985e-05,
      "loss": 1.7556,
      "num_input_tokens_seen": 12954889376,
      "step": 16466
    },
    {
      "epoch": 1.7469764481222152,
      "grad_norm": 0.4497124414495472,
      "learning_rate": 4.745702679298204e-05,
      "loss": 1.8051,
      "num_input_tokens_seen": 12955676176,
      "step": 16467
    },
    {
      "epoch": 1.7470825376617864,
      "grad_norm": 0.41829271775146304,
      "learning_rate": 4.7456721400172964e-05,
      "loss": 1.8057,
      "num_input_tokens_seen": 12956463024,
      "step": 16468
    },
    {
      "epoch": 1.747188627201358,
      "grad_norm": 0.35950559399044946,
      "learning_rate": 4.745641599001e-05,
      "loss": 1.6132,
      "num_input_tokens_seen": 12957249808,
      "step": 16469
    },
    {
      "epoch": 1.7472947167409294,
      "grad_norm": 0.4178777958349561,
      "learning_rate": 4.745611056249337e-05,
      "loss": 1.7219,
      "num_input_tokens_seen": 12958036672,
      "step": 16470
    },
    {
      "epoch": 1.7474008062805009,
      "grad_norm": 0.4315506411640592,
      "learning_rate": 4.745580511762332e-05,
      "loss": 1.7539,
      "num_input_tokens_seen": 12958823360,
      "step": 16471
    },
    {
      "epoch": 1.7475068958200721,
      "grad_norm": 0.46977124317290786,
      "learning_rate": 4.745549965540008e-05,
      "loss": 1.7395,
      "num_input_tokens_seen": 12959610096,
      "step": 16472
    },
    {
      "epoch": 1.7476129853596434,
      "grad_norm": 0.4036110259967023,
      "learning_rate": 4.745519417582389e-05,
      "loss": 1.7233,
      "num_input_tokens_seen": 12960396832,
      "step": 16473
    },
    {
      "epoch": 1.7477190748992149,
      "grad_norm": 0.3860700040758582,
      "learning_rate": 4.745488867889498e-05,
      "loss": 1.7977,
      "num_input_tokens_seen": 12961183632,
      "step": 16474
    },
    {
      "epoch": 1.7478251644387863,
      "grad_norm": 0.4098980345164074,
      "learning_rate": 4.74545831646136e-05,
      "loss": 1.7091,
      "num_input_tokens_seen": 12961970416,
      "step": 16475
    },
    {
      "epoch": 1.7479312539783578,
      "grad_norm": 0.37059200755774074,
      "learning_rate": 4.745427763297997e-05,
      "loss": 1.6751,
      "num_input_tokens_seen": 12962757168,
      "step": 16476
    },
    {
      "epoch": 1.7480373435179293,
      "grad_norm": 0.3555337210342056,
      "learning_rate": 4.7453972083994335e-05,
      "loss": 1.6132,
      "num_input_tokens_seen": 12963543920,
      "step": 16477
    },
    {
      "epoch": 1.7481434330575005,
      "grad_norm": 0.4467956872170082,
      "learning_rate": 4.745366651765693e-05,
      "loss": 1.8241,
      "num_input_tokens_seen": 12964330656,
      "step": 16478
    },
    {
      "epoch": 1.7482495225970718,
      "grad_norm": 0.41272727686627964,
      "learning_rate": 4.7453360933968e-05,
      "loss": 1.7471,
      "num_input_tokens_seen": 12965117472,
      "step": 16479
    },
    {
      "epoch": 1.7483556121366433,
      "grad_norm": 0.5198540963608811,
      "learning_rate": 4.7453055332927755e-05,
      "loss": 1.6957,
      "num_input_tokens_seen": 12965904208,
      "step": 16480
    },
    {
      "epoch": 1.7484617016762147,
      "grad_norm": 0.535662298413769,
      "learning_rate": 4.745274971453645e-05,
      "loss": 1.7253,
      "num_input_tokens_seen": 12966690928,
      "step": 16481
    },
    {
      "epoch": 1.7485677912157862,
      "grad_norm": 0.7502216240144823,
      "learning_rate": 4.7452444078794325e-05,
      "loss": 1.8708,
      "num_input_tokens_seen": 12967477664,
      "step": 16482
    },
    {
      "epoch": 1.7486738807553577,
      "grad_norm": 0.6402137037789787,
      "learning_rate": 4.745213842570161e-05,
      "loss": 1.7757,
      "num_input_tokens_seen": 12968264448,
      "step": 16483
    },
    {
      "epoch": 1.748779970294929,
      "grad_norm": 0.9614604824888804,
      "learning_rate": 4.745183275525854e-05,
      "loss": 1.8324,
      "num_input_tokens_seen": 12969051200,
      "step": 16484
    },
    {
      "epoch": 1.7488860598345002,
      "grad_norm": 0.6262978129407857,
      "learning_rate": 4.745152706746535e-05,
      "loss": 1.8829,
      "num_input_tokens_seen": 12969837920,
      "step": 16485
    },
    {
      "epoch": 1.7489921493740717,
      "grad_norm": 0.6814202393148738,
      "learning_rate": 4.745122136232228e-05,
      "loss": 1.7455,
      "num_input_tokens_seen": 12970624720,
      "step": 16486
    },
    {
      "epoch": 1.7490982389136431,
      "grad_norm": 0.6643927422001724,
      "learning_rate": 4.745091563982956e-05,
      "loss": 1.7081,
      "num_input_tokens_seen": 12971411488,
      "step": 16487
    },
    {
      "epoch": 1.7492043284532146,
      "grad_norm": 0.7208302770742234,
      "learning_rate": 4.745060989998744e-05,
      "loss": 1.9017,
      "num_input_tokens_seen": 12972198176,
      "step": 16488
    },
    {
      "epoch": 1.7493104179927859,
      "grad_norm": 0.4793986734654812,
      "learning_rate": 4.745030414279614e-05,
      "loss": 1.8208,
      "num_input_tokens_seen": 12972984864,
      "step": 16489
    },
    {
      "epoch": 1.7494165075323573,
      "grad_norm": 0.5087360563587132,
      "learning_rate": 4.744999836825591e-05,
      "loss": 1.7634,
      "num_input_tokens_seen": 12973771616,
      "step": 16490
    },
    {
      "epoch": 1.7495225970719286,
      "grad_norm": 0.6935866332443154,
      "learning_rate": 4.7449692576366976e-05,
      "loss": 1.7369,
      "num_input_tokens_seen": 12974558320,
      "step": 16491
    },
    {
      "epoch": 1.7496286866115,
      "grad_norm": 0.4919398882145304,
      "learning_rate": 4.744938676712958e-05,
      "loss": 1.7415,
      "num_input_tokens_seen": 12975345136,
      "step": 16492
    },
    {
      "epoch": 1.7497347761510715,
      "grad_norm": 0.4203503337505899,
      "learning_rate": 4.744908094054396e-05,
      "loss": 1.6911,
      "num_input_tokens_seen": 12976132064,
      "step": 16493
    },
    {
      "epoch": 1.749840865690643,
      "grad_norm": 0.590067162057846,
      "learning_rate": 4.7448775096610346e-05,
      "loss": 1.7583,
      "num_input_tokens_seen": 12976918736,
      "step": 16494
    },
    {
      "epoch": 1.7499469552302143,
      "grad_norm": 0.538355596841091,
      "learning_rate": 4.7448469235328975e-05,
      "loss": 1.8748,
      "num_input_tokens_seen": 12977705504,
      "step": 16495
    },
    {
      "epoch": 1.7500530447697857,
      "grad_norm": 0.42578211652013903,
      "learning_rate": 4.744816335670009e-05,
      "loss": 1.6897,
      "num_input_tokens_seen": 12978492368,
      "step": 16496
    },
    {
      "epoch": 1.750159134309357,
      "grad_norm": 0.4356665381503686,
      "learning_rate": 4.744785746072392e-05,
      "loss": 1.7457,
      "num_input_tokens_seen": 12979279120,
      "step": 16497
    },
    {
      "epoch": 1.7502652238489285,
      "grad_norm": 0.4626357476171314,
      "learning_rate": 4.74475515474007e-05,
      "loss": 1.7696,
      "num_input_tokens_seen": 12980065904,
      "step": 16498
    },
    {
      "epoch": 1.7503713133885,
      "grad_norm": 0.3809964048078522,
      "learning_rate": 4.744724561673068e-05,
      "loss": 1.5771,
      "num_input_tokens_seen": 12980852736,
      "step": 16499
    },
    {
      "epoch": 1.7504774029280714,
      "grad_norm": 0.43869069385201215,
      "learning_rate": 4.744693966871409e-05,
      "loss": 1.7638,
      "num_input_tokens_seen": 12981639536,
      "step": 16500
    },
    {
      "epoch": 1.7505834924676427,
      "grad_norm": 0.35354018462872977,
      "learning_rate": 4.744663370335115e-05,
      "loss": 1.7497,
      "num_input_tokens_seen": 12982426240,
      "step": 16501
    },
    {
      "epoch": 1.7506895820072141,
      "grad_norm": 0.5039967681341593,
      "learning_rate": 4.7446327720642113e-05,
      "loss": 1.6737,
      "num_input_tokens_seen": 12983213040,
      "step": 16502
    },
    {
      "epoch": 1.7507956715467854,
      "grad_norm": 0.4647624309267259,
      "learning_rate": 4.744602172058722e-05,
      "loss": 1.7506,
      "num_input_tokens_seen": 12983999840,
      "step": 16503
    },
    {
      "epoch": 1.7509017610863569,
      "grad_norm": 0.39768852227299334,
      "learning_rate": 4.7445715703186695e-05,
      "loss": 1.7131,
      "num_input_tokens_seen": 12984786608,
      "step": 16504
    },
    {
      "epoch": 1.7510078506259283,
      "grad_norm": 0.7732672223289816,
      "learning_rate": 4.7445409668440776e-05,
      "loss": 1.8322,
      "num_input_tokens_seen": 12985573296,
      "step": 16505
    },
    {
      "epoch": 1.7511139401654998,
      "grad_norm": 0.5423545232596285,
      "learning_rate": 4.744510361634971e-05,
      "loss": 1.9231,
      "num_input_tokens_seen": 12986359936,
      "step": 16506
    },
    {
      "epoch": 1.751220029705071,
      "grad_norm": 0.6183689736081117,
      "learning_rate": 4.744479754691372e-05,
      "loss": 1.663,
      "num_input_tokens_seen": 12987146640,
      "step": 16507
    },
    {
      "epoch": 1.7513261192446423,
      "grad_norm": 0.3943669439939609,
      "learning_rate": 4.7444491460133056e-05,
      "loss": 1.7729,
      "num_input_tokens_seen": 12987933408,
      "step": 16508
    },
    {
      "epoch": 1.7514322087842138,
      "grad_norm": 0.6120779817771254,
      "learning_rate": 4.744418535600795e-05,
      "loss": 1.6959,
      "num_input_tokens_seen": 12988720192,
      "step": 16509
    },
    {
      "epoch": 1.7515382983237853,
      "grad_norm": 0.4017412275079854,
      "learning_rate": 4.744387923453862e-05,
      "loss": 1.6539,
      "num_input_tokens_seen": 12989506976,
      "step": 16510
    },
    {
      "epoch": 1.7516443878633567,
      "grad_norm": 0.5343964570861256,
      "learning_rate": 4.7443573095725335e-05,
      "loss": 1.6929,
      "num_input_tokens_seen": 12990293824,
      "step": 16511
    },
    {
      "epoch": 1.7517504774029282,
      "grad_norm": 0.42211439474510065,
      "learning_rate": 4.744326693956831e-05,
      "loss": 1.7436,
      "num_input_tokens_seen": 12991080608,
      "step": 16512
    },
    {
      "epoch": 1.7518565669424995,
      "grad_norm": 0.44887937128396427,
      "learning_rate": 4.744296076606779e-05,
      "loss": 1.6677,
      "num_input_tokens_seen": 12991867360,
      "step": 16513
    },
    {
      "epoch": 1.7519626564820707,
      "grad_norm": 0.3454360466181903,
      "learning_rate": 4.7442654575224005e-05,
      "loss": 1.7026,
      "num_input_tokens_seen": 12992654160,
      "step": 16514
    },
    {
      "epoch": 1.7520687460216422,
      "grad_norm": 0.44301127940307433,
      "learning_rate": 4.7442348367037194e-05,
      "loss": 1.7225,
      "num_input_tokens_seen": 12993440864,
      "step": 16515
    },
    {
      "epoch": 1.7521748355612137,
      "grad_norm": 0.46050897186125683,
      "learning_rate": 4.744204214150759e-05,
      "loss": 1.7753,
      "num_input_tokens_seen": 12994227680,
      "step": 16516
    },
    {
      "epoch": 1.7522809251007851,
      "grad_norm": 0.4575716652677777,
      "learning_rate": 4.744173589863544e-05,
      "loss": 1.8201,
      "num_input_tokens_seen": 12995014352,
      "step": 16517
    },
    {
      "epoch": 1.7523870146403566,
      "grad_norm": 0.41608451231995774,
      "learning_rate": 4.744142963842098e-05,
      "loss": 1.7505,
      "num_input_tokens_seen": 12995801104,
      "step": 16518
    },
    {
      "epoch": 1.7524931041799279,
      "grad_norm": 0.36256796024419113,
      "learning_rate": 4.744112336086444e-05,
      "loss": 1.6848,
      "num_input_tokens_seen": 12996587872,
      "step": 16519
    },
    {
      "epoch": 1.7525991937194991,
      "grad_norm": 0.46053435302578727,
      "learning_rate": 4.744081706596605e-05,
      "loss": 1.7839,
      "num_input_tokens_seen": 12997374640,
      "step": 16520
    },
    {
      "epoch": 1.7527052832590706,
      "grad_norm": 0.5485403762059439,
      "learning_rate": 4.744051075372606e-05,
      "loss": 1.6532,
      "num_input_tokens_seen": 12998161376,
      "step": 16521
    },
    {
      "epoch": 1.752811372798642,
      "grad_norm": 0.3948050453933863,
      "learning_rate": 4.7440204424144706e-05,
      "loss": 1.7495,
      "num_input_tokens_seen": 12998948112,
      "step": 16522
    },
    {
      "epoch": 1.7529174623382136,
      "grad_norm": 0.4422887809502352,
      "learning_rate": 4.743989807722221e-05,
      "loss": 1.789,
      "num_input_tokens_seen": 12999734896,
      "step": 16523
    },
    {
      "epoch": 1.7530235518777848,
      "grad_norm": 0.3640509409864922,
      "learning_rate": 4.7439591712958834e-05,
      "loss": 1.7204,
      "num_input_tokens_seen": 13000521648,
      "step": 16524
    },
    {
      "epoch": 1.7531296414173563,
      "grad_norm": 0.4542589221646658,
      "learning_rate": 4.743928533135479e-05,
      "loss": 1.8351,
      "num_input_tokens_seen": 13001308480,
      "step": 16525
    },
    {
      "epoch": 1.7532357309569275,
      "grad_norm": 0.3636767111816266,
      "learning_rate": 4.743897893241032e-05,
      "loss": 1.7626,
      "num_input_tokens_seen": 13002095264,
      "step": 16526
    },
    {
      "epoch": 1.753341820496499,
      "grad_norm": 0.39942968226510067,
      "learning_rate": 4.743867251612567e-05,
      "loss": 1.7894,
      "num_input_tokens_seen": 13002882016,
      "step": 16527
    },
    {
      "epoch": 1.7534479100360705,
      "grad_norm": 0.34335448399511626,
      "learning_rate": 4.743836608250108e-05,
      "loss": 1.6412,
      "num_input_tokens_seen": 13003668864,
      "step": 16528
    },
    {
      "epoch": 1.753553999575642,
      "grad_norm": 0.3882585539999666,
      "learning_rate": 4.743805963153677e-05,
      "loss": 1.7053,
      "num_input_tokens_seen": 13004455600,
      "step": 16529
    },
    {
      "epoch": 1.7536600891152132,
      "grad_norm": 0.3656269215446201,
      "learning_rate": 4.743775316323299e-05,
      "loss": 1.7611,
      "num_input_tokens_seen": 13005242256,
      "step": 16530
    },
    {
      "epoch": 1.7537661786547847,
      "grad_norm": 0.37408173896711855,
      "learning_rate": 4.743744667758997e-05,
      "loss": 1.7754,
      "num_input_tokens_seen": 13006029120,
      "step": 16531
    },
    {
      "epoch": 1.753872268194356,
      "grad_norm": 0.34752980339555595,
      "learning_rate": 4.743714017460795e-05,
      "loss": 1.5392,
      "num_input_tokens_seen": 13006815920,
      "step": 16532
    },
    {
      "epoch": 1.7539783577339274,
      "grad_norm": 0.36900570163077456,
      "learning_rate": 4.7436833654287175e-05,
      "loss": 1.7117,
      "num_input_tokens_seen": 13007602688,
      "step": 16533
    },
    {
      "epoch": 1.7540844472734989,
      "grad_norm": 0.3515684547653877,
      "learning_rate": 4.743652711662786e-05,
      "loss": 1.899,
      "num_input_tokens_seen": 13008389392,
      "step": 16534
    },
    {
      "epoch": 1.7541905368130704,
      "grad_norm": 0.4190370569013446,
      "learning_rate": 4.7436220561630264e-05,
      "loss": 1.7732,
      "num_input_tokens_seen": 13009176176,
      "step": 16535
    },
    {
      "epoch": 1.7542966263526416,
      "grad_norm": 0.38061313629626253,
      "learning_rate": 4.743591398929461e-05,
      "loss": 1.71,
      "num_input_tokens_seen": 13009962928,
      "step": 16536
    },
    {
      "epoch": 1.754402715892213,
      "grad_norm": 0.41137721732841664,
      "learning_rate": 4.743560739962114e-05,
      "loss": 1.6699,
      "num_input_tokens_seen": 13010749712,
      "step": 16537
    },
    {
      "epoch": 1.7545088054317843,
      "grad_norm": 0.4079612394894738,
      "learning_rate": 4.7435300792610094e-05,
      "loss": 1.6659,
      "num_input_tokens_seen": 13011536560,
      "step": 16538
    },
    {
      "epoch": 1.7546148949713558,
      "grad_norm": 0.3797481191833921,
      "learning_rate": 4.7434994168261705e-05,
      "loss": 1.7796,
      "num_input_tokens_seen": 13012323424,
      "step": 16539
    },
    {
      "epoch": 1.7547209845109273,
      "grad_norm": 0.4530496819094333,
      "learning_rate": 4.743468752657621e-05,
      "loss": 1.8425,
      "num_input_tokens_seen": 13013110224,
      "step": 16540
    },
    {
      "epoch": 1.7548270740504988,
      "grad_norm": 0.4272068127463478,
      "learning_rate": 4.743438086755385e-05,
      "loss": 1.7069,
      "num_input_tokens_seen": 13013897072,
      "step": 16541
    },
    {
      "epoch": 1.75493316359007,
      "grad_norm": 0.40243298244322345,
      "learning_rate": 4.7434074191194854e-05,
      "loss": 1.6229,
      "num_input_tokens_seen": 13014683888,
      "step": 16542
    },
    {
      "epoch": 1.7550392531296413,
      "grad_norm": 0.38890439692584955,
      "learning_rate": 4.7433767497499465e-05,
      "loss": 1.6694,
      "num_input_tokens_seen": 13015470720,
      "step": 16543
    },
    {
      "epoch": 1.7551453426692127,
      "grad_norm": 0.41991934497524447,
      "learning_rate": 4.743346078646792e-05,
      "loss": 1.863,
      "num_input_tokens_seen": 13016257472,
      "step": 16544
    },
    {
      "epoch": 1.7552514322087842,
      "grad_norm": 0.37728874358704356,
      "learning_rate": 4.7433154058100456e-05,
      "loss": 1.7256,
      "num_input_tokens_seen": 13017044224,
      "step": 16545
    },
    {
      "epoch": 1.7553575217483557,
      "grad_norm": 0.39558009988906234,
      "learning_rate": 4.7432847312397304e-05,
      "loss": 1.77,
      "num_input_tokens_seen": 13017830928,
      "step": 16546
    },
    {
      "epoch": 1.7554636112879272,
      "grad_norm": 0.3909214336831544,
      "learning_rate": 4.743254054935871e-05,
      "loss": 1.8409,
      "num_input_tokens_seen": 13018617664,
      "step": 16547
    },
    {
      "epoch": 1.7555697008274984,
      "grad_norm": 0.38935958478853766,
      "learning_rate": 4.74322337689849e-05,
      "loss": 1.6703,
      "num_input_tokens_seen": 13019404512,
      "step": 16548
    },
    {
      "epoch": 1.7556757903670697,
      "grad_norm": 0.3882870726018572,
      "learning_rate": 4.743192697127613e-05,
      "loss": 1.696,
      "num_input_tokens_seen": 13020191264,
      "step": 16549
    },
    {
      "epoch": 1.7557818799066411,
      "grad_norm": 0.40033264216235637,
      "learning_rate": 4.7431620156232615e-05,
      "loss": 1.7659,
      "num_input_tokens_seen": 13020978000,
      "step": 16550
    },
    {
      "epoch": 1.7558879694462126,
      "grad_norm": 0.3830499326904472,
      "learning_rate": 4.743131332385461e-05,
      "loss": 1.7714,
      "num_input_tokens_seen": 13021764752,
      "step": 16551
    },
    {
      "epoch": 1.755994058985784,
      "grad_norm": 0.3550342370473576,
      "learning_rate": 4.7431006474142335e-05,
      "loss": 1.8157,
      "num_input_tokens_seen": 13022551456,
      "step": 16552
    },
    {
      "epoch": 1.7561001485253556,
      "grad_norm": 0.36390595034154455,
      "learning_rate": 4.743069960709604e-05,
      "loss": 1.6606,
      "num_input_tokens_seen": 13023338192,
      "step": 16553
    },
    {
      "epoch": 1.7562062380649268,
      "grad_norm": 0.33148822396231675,
      "learning_rate": 4.7430392722715965e-05,
      "loss": 1.7329,
      "num_input_tokens_seen": 13024124928,
      "step": 16554
    },
    {
      "epoch": 1.756312327604498,
      "grad_norm": 0.3426120940393528,
      "learning_rate": 4.7430085821002335e-05,
      "loss": 1.6763,
      "num_input_tokens_seen": 13024911712,
      "step": 16555
    },
    {
      "epoch": 1.7564184171440695,
      "grad_norm": 0.34943311870712734,
      "learning_rate": 4.742977890195539e-05,
      "loss": 1.6984,
      "num_input_tokens_seen": 13025698528,
      "step": 16556
    },
    {
      "epoch": 1.756524506683641,
      "grad_norm": 0.3922443333941911,
      "learning_rate": 4.7429471965575375e-05,
      "loss": 1.761,
      "num_input_tokens_seen": 13026485328,
      "step": 16557
    },
    {
      "epoch": 1.7566305962232125,
      "grad_norm": 0.31316739335643334,
      "learning_rate": 4.742916501186252e-05,
      "loss": 1.6872,
      "num_input_tokens_seen": 13027272112,
      "step": 16558
    },
    {
      "epoch": 1.7567366857627837,
      "grad_norm": 0.3196743760120187,
      "learning_rate": 4.742885804081707e-05,
      "loss": 1.6926,
      "num_input_tokens_seen": 13028058896,
      "step": 16559
    },
    {
      "epoch": 1.7568427753023552,
      "grad_norm": 0.36306687826991646,
      "learning_rate": 4.742855105243925e-05,
      "loss": 1.6761,
      "num_input_tokens_seen": 13028845728,
      "step": 16560
    },
    {
      "epoch": 1.7569488648419265,
      "grad_norm": 0.4411639533634255,
      "learning_rate": 4.7428244046729305e-05,
      "loss": 1.7022,
      "num_input_tokens_seen": 13029632512,
      "step": 16561
    },
    {
      "epoch": 1.757054954381498,
      "grad_norm": 0.3704071225371979,
      "learning_rate": 4.742793702368747e-05,
      "loss": 1.7323,
      "num_input_tokens_seen": 13030419328,
      "step": 16562
    },
    {
      "epoch": 1.7571610439210694,
      "grad_norm": 0.368551565634222,
      "learning_rate": 4.742762998331398e-05,
      "loss": 1.8432,
      "num_input_tokens_seen": 13031206000,
      "step": 16563
    },
    {
      "epoch": 1.757267133460641,
      "grad_norm": 0.3660202480191796,
      "learning_rate": 4.742732292560908e-05,
      "loss": 1.7177,
      "num_input_tokens_seen": 13031992768,
      "step": 16564
    },
    {
      "epoch": 1.7573732230002121,
      "grad_norm": 0.3905860698664722,
      "learning_rate": 4.742701585057301e-05,
      "loss": 1.7901,
      "num_input_tokens_seen": 13032779584,
      "step": 16565
    },
    {
      "epoch": 1.7574793125397836,
      "grad_norm": 0.37499286034044366,
      "learning_rate": 4.7426708758206e-05,
      "loss": 1.9447,
      "num_input_tokens_seen": 13033566336,
      "step": 16566
    },
    {
      "epoch": 1.7575854020793549,
      "grad_norm": 0.41458215082207595,
      "learning_rate": 4.742640164850827e-05,
      "loss": 1.8316,
      "num_input_tokens_seen": 13034353136,
      "step": 16567
    },
    {
      "epoch": 1.7576914916189263,
      "grad_norm": 0.3259466830643359,
      "learning_rate": 4.742609452148009e-05,
      "loss": 1.7528,
      "num_input_tokens_seen": 13035139920,
      "step": 16568
    },
    {
      "epoch": 1.7577975811584978,
      "grad_norm": 0.4405060173506176,
      "learning_rate": 4.742578737712168e-05,
      "loss": 1.7815,
      "num_input_tokens_seen": 13035926672,
      "step": 16569
    },
    {
      "epoch": 1.7579036706980693,
      "grad_norm": 0.39837110580332286,
      "learning_rate": 4.742548021543327e-05,
      "loss": 1.806,
      "num_input_tokens_seen": 13036713344,
      "step": 16570
    },
    {
      "epoch": 1.7580097602376406,
      "grad_norm": 0.4785103725474422,
      "learning_rate": 4.742517303641511e-05,
      "loss": 1.6403,
      "num_input_tokens_seen": 13037500176,
      "step": 16571
    },
    {
      "epoch": 1.7581158497772118,
      "grad_norm": 0.5359545902938814,
      "learning_rate": 4.742486584006745e-05,
      "loss": 1.721,
      "num_input_tokens_seen": 13038286896,
      "step": 16572
    },
    {
      "epoch": 1.7582219393167833,
      "grad_norm": 0.4595744234344142,
      "learning_rate": 4.74245586263905e-05,
      "loss": 1.6161,
      "num_input_tokens_seen": 13039073760,
      "step": 16573
    },
    {
      "epoch": 1.7583280288563548,
      "grad_norm": 0.578846549142026,
      "learning_rate": 4.742425139538451e-05,
      "loss": 1.7628,
      "num_input_tokens_seen": 13039860560,
      "step": 16574
    },
    {
      "epoch": 1.7584341183959262,
      "grad_norm": 0.3853025380777022,
      "learning_rate": 4.7423944147049716e-05,
      "loss": 1.6755,
      "num_input_tokens_seen": 13040647280,
      "step": 16575
    },
    {
      "epoch": 1.7585402079354977,
      "grad_norm": 0.5332756718054571,
      "learning_rate": 4.742363688138635e-05,
      "loss": 1.7821,
      "num_input_tokens_seen": 13041434048,
      "step": 16576
    },
    {
      "epoch": 1.758646297475069,
      "grad_norm": 0.4187940814214541,
      "learning_rate": 4.742332959839466e-05,
      "loss": 1.7645,
      "num_input_tokens_seen": 13042220896,
      "step": 16577
    },
    {
      "epoch": 1.7587523870146402,
      "grad_norm": 0.42765805873486495,
      "learning_rate": 4.742302229807488e-05,
      "loss": 1.6474,
      "num_input_tokens_seen": 13043007712,
      "step": 16578
    },
    {
      "epoch": 1.7588584765542117,
      "grad_norm": 0.42455296795828995,
      "learning_rate": 4.7422714980427254e-05,
      "loss": 1.803,
      "num_input_tokens_seen": 13043794528,
      "step": 16579
    },
    {
      "epoch": 1.7589645660937832,
      "grad_norm": 0.38902275075932286,
      "learning_rate": 4.7422407645452e-05,
      "loss": 1.671,
      "num_input_tokens_seen": 13044581312,
      "step": 16580
    },
    {
      "epoch": 1.7590706556333546,
      "grad_norm": 0.4367692996060746,
      "learning_rate": 4.7422100293149376e-05,
      "loss": 1.6941,
      "num_input_tokens_seen": 13045368000,
      "step": 16581
    },
    {
      "epoch": 1.759176745172926,
      "grad_norm": 0.35032390305428446,
      "learning_rate": 4.74217929235196e-05,
      "loss": 1.722,
      "num_input_tokens_seen": 13046154720,
      "step": 16582
    },
    {
      "epoch": 1.7592828347124974,
      "grad_norm": 0.46299750318029825,
      "learning_rate": 4.7421485536562926e-05,
      "loss": 1.748,
      "num_input_tokens_seen": 13046941488,
      "step": 16583
    },
    {
      "epoch": 1.7593889242520686,
      "grad_norm": 0.37837752933399427,
      "learning_rate": 4.742117813227959e-05,
      "loss": 1.7693,
      "num_input_tokens_seen": 13047728320,
      "step": 16584
    },
    {
      "epoch": 1.75949501379164,
      "grad_norm": 0.3404512867120254,
      "learning_rate": 4.742087071066982e-05,
      "loss": 1.6572,
      "num_input_tokens_seen": 13048515120,
      "step": 16585
    },
    {
      "epoch": 1.7596011033312116,
      "grad_norm": 0.44768963965493425,
      "learning_rate": 4.7420563271733865e-05,
      "loss": 1.7969,
      "num_input_tokens_seen": 13049301904,
      "step": 16586
    },
    {
      "epoch": 1.759707192870783,
      "grad_norm": 0.3277981011920852,
      "learning_rate": 4.7420255815471945e-05,
      "loss": 1.7669,
      "num_input_tokens_seen": 13050088672,
      "step": 16587
    },
    {
      "epoch": 1.7598132824103543,
      "grad_norm": 0.4334000702627574,
      "learning_rate": 4.741994834188432e-05,
      "loss": 1.8597,
      "num_input_tokens_seen": 13050875456,
      "step": 16588
    },
    {
      "epoch": 1.7599193719499258,
      "grad_norm": 0.44956207504491674,
      "learning_rate": 4.7419640850971215e-05,
      "loss": 1.6176,
      "num_input_tokens_seen": 13051662208,
      "step": 16589
    },
    {
      "epoch": 1.760025461489497,
      "grad_norm": 0.37743079834304627,
      "learning_rate": 4.741933334273287e-05,
      "loss": 1.6089,
      "num_input_tokens_seen": 13052448992,
      "step": 16590
    },
    {
      "epoch": 1.7601315510290685,
      "grad_norm": 0.4453896152968903,
      "learning_rate": 4.7419025817169516e-05,
      "loss": 1.7033,
      "num_input_tokens_seen": 13053235744,
      "step": 16591
    },
    {
      "epoch": 1.76023764056864,
      "grad_norm": 0.33670959411079726,
      "learning_rate": 4.74187182742814e-05,
      "loss": 1.6191,
      "num_input_tokens_seen": 13054022576,
      "step": 16592
    },
    {
      "epoch": 1.7603437301082114,
      "grad_norm": 0.5024301318733806,
      "learning_rate": 4.741841071406876e-05,
      "loss": 1.7355,
      "num_input_tokens_seen": 13054809344,
      "step": 16593
    },
    {
      "epoch": 1.7604498196477827,
      "grad_norm": 0.36777494535432315,
      "learning_rate": 4.741810313653182e-05,
      "loss": 1.7716,
      "num_input_tokens_seen": 13055596192,
      "step": 16594
    },
    {
      "epoch": 1.7605559091873542,
      "grad_norm": 0.361343237516789,
      "learning_rate": 4.741779554167084e-05,
      "loss": 1.856,
      "num_input_tokens_seen": 13056382928,
      "step": 16595
    },
    {
      "epoch": 1.7606619987269254,
      "grad_norm": 0.38571316729904503,
      "learning_rate": 4.741748792948604e-05,
      "loss": 1.603,
      "num_input_tokens_seen": 13057169824,
      "step": 16596
    },
    {
      "epoch": 1.760768088266497,
      "grad_norm": 0.40258381010738464,
      "learning_rate": 4.7417180299977656e-05,
      "loss": 1.717,
      "num_input_tokens_seen": 13057956528,
      "step": 16597
    },
    {
      "epoch": 1.7608741778060684,
      "grad_norm": 0.495024824363642,
      "learning_rate": 4.741687265314594e-05,
      "loss": 1.8486,
      "num_input_tokens_seen": 13058743264,
      "step": 16598
    },
    {
      "epoch": 1.7609802673456398,
      "grad_norm": 0.37479179031067,
      "learning_rate": 4.7416564988991127e-05,
      "loss": 1.6568,
      "num_input_tokens_seen": 13059530048,
      "step": 16599
    },
    {
      "epoch": 1.761086356885211,
      "grad_norm": 0.36569046449722353,
      "learning_rate": 4.7416257307513446e-05,
      "loss": 1.7038,
      "num_input_tokens_seen": 13060316864,
      "step": 16600
    },
    {
      "epoch": 1.7611924464247826,
      "grad_norm": 0.41406881757352043,
      "learning_rate": 4.741594960871314e-05,
      "loss": 1.6522,
      "num_input_tokens_seen": 13061103696,
      "step": 16601
    },
    {
      "epoch": 1.7612985359643538,
      "grad_norm": 0.41134215730044593,
      "learning_rate": 4.741564189259044e-05,
      "loss": 1.6904,
      "num_input_tokens_seen": 13061890432,
      "step": 16602
    },
    {
      "epoch": 1.7614046255039253,
      "grad_norm": 0.3863808514334222,
      "learning_rate": 4.74153341591456e-05,
      "loss": 1.7066,
      "num_input_tokens_seen": 13062677184,
      "step": 16603
    },
    {
      "epoch": 1.7615107150434968,
      "grad_norm": 0.4411486330064083,
      "learning_rate": 4.741502640837884e-05,
      "loss": 1.8229,
      "num_input_tokens_seen": 13063463952,
      "step": 16604
    },
    {
      "epoch": 1.7616168045830682,
      "grad_norm": 0.5218765134331119,
      "learning_rate": 4.74147186402904e-05,
      "loss": 1.8369,
      "num_input_tokens_seen": 13064250672,
      "step": 16605
    },
    {
      "epoch": 1.7617228941226395,
      "grad_norm": 0.3790418317437182,
      "learning_rate": 4.741441085488053e-05,
      "loss": 1.81,
      "num_input_tokens_seen": 13065037376,
      "step": 16606
    },
    {
      "epoch": 1.7618289836622107,
      "grad_norm": 0.3789984565641115,
      "learning_rate": 4.741410305214946e-05,
      "loss": 1.6201,
      "num_input_tokens_seen": 13065824112,
      "step": 16607
    },
    {
      "epoch": 1.7619350732017822,
      "grad_norm": 0.4222705694003133,
      "learning_rate": 4.741379523209743e-05,
      "loss": 1.6191,
      "num_input_tokens_seen": 13066610848,
      "step": 16608
    },
    {
      "epoch": 1.7620411627413537,
      "grad_norm": 0.3446823782617373,
      "learning_rate": 4.741348739472468e-05,
      "loss": 1.6586,
      "num_input_tokens_seen": 13067397696,
      "step": 16609
    },
    {
      "epoch": 1.7621472522809252,
      "grad_norm": 0.4069959694275588,
      "learning_rate": 4.741317954003144e-05,
      "loss": 1.7098,
      "num_input_tokens_seen": 13068184432,
      "step": 16610
    },
    {
      "epoch": 1.7622533418204966,
      "grad_norm": 0.35270535611396203,
      "learning_rate": 4.741287166801796e-05,
      "loss": 1.7659,
      "num_input_tokens_seen": 13068971184,
      "step": 16611
    },
    {
      "epoch": 1.762359431360068,
      "grad_norm": 0.38657925998920306,
      "learning_rate": 4.741256377868446e-05,
      "loss": 1.5967,
      "num_input_tokens_seen": 13069757920,
      "step": 16612
    },
    {
      "epoch": 1.7624655208996391,
      "grad_norm": 0.34503697840189296,
      "learning_rate": 4.741225587203119e-05,
      "loss": 1.7184,
      "num_input_tokens_seen": 13070544656,
      "step": 16613
    },
    {
      "epoch": 1.7625716104392106,
      "grad_norm": 0.5036433533718121,
      "learning_rate": 4.7411947948058385e-05,
      "loss": 1.7354,
      "num_input_tokens_seen": 13071331408,
      "step": 16614
    },
    {
      "epoch": 1.762677699978782,
      "grad_norm": 0.4035258503460715,
      "learning_rate": 4.741164000676629e-05,
      "loss": 1.723,
      "num_input_tokens_seen": 13072118208,
      "step": 16615
    },
    {
      "epoch": 1.7627837895183536,
      "grad_norm": 0.6276081251320246,
      "learning_rate": 4.7411332048155136e-05,
      "loss": 1.8725,
      "num_input_tokens_seen": 13072904992,
      "step": 16616
    },
    {
      "epoch": 1.762889879057925,
      "grad_norm": 0.432680852106676,
      "learning_rate": 4.741102407222516e-05,
      "loss": 1.6961,
      "num_input_tokens_seen": 13073691696,
      "step": 16617
    },
    {
      "epoch": 1.7629959685974963,
      "grad_norm": 0.3677451489547384,
      "learning_rate": 4.74107160789766e-05,
      "loss": 1.6552,
      "num_input_tokens_seen": 13074478560,
      "step": 16618
    },
    {
      "epoch": 1.7631020581370676,
      "grad_norm": 0.41766633979094286,
      "learning_rate": 4.7410408068409706e-05,
      "loss": 1.67,
      "num_input_tokens_seen": 13075265360,
      "step": 16619
    },
    {
      "epoch": 1.763208147676639,
      "grad_norm": 0.3549150726002443,
      "learning_rate": 4.7410100040524694e-05,
      "loss": 1.7654,
      "num_input_tokens_seen": 13076052128,
      "step": 16620
    },
    {
      "epoch": 1.7633142372162105,
      "grad_norm": 0.4154874702539763,
      "learning_rate": 4.740979199532182e-05,
      "loss": 1.7735,
      "num_input_tokens_seen": 13076838960,
      "step": 16621
    },
    {
      "epoch": 1.763420326755782,
      "grad_norm": 0.3615292152571641,
      "learning_rate": 4.740948393280132e-05,
      "loss": 1.5913,
      "num_input_tokens_seen": 13077625776,
      "step": 16622
    },
    {
      "epoch": 1.7635264162953532,
      "grad_norm": 0.4001530462698366,
      "learning_rate": 4.740917585296343e-05,
      "loss": 1.597,
      "num_input_tokens_seen": 13078412560,
      "step": 16623
    },
    {
      "epoch": 1.7636325058349247,
      "grad_norm": 0.4427925567149315,
      "learning_rate": 4.7408867755808375e-05,
      "loss": 1.7144,
      "num_input_tokens_seen": 13079199392,
      "step": 16624
    },
    {
      "epoch": 1.763738595374496,
      "grad_norm": 0.3505119577591552,
      "learning_rate": 4.740855964133642e-05,
      "loss": 1.5803,
      "num_input_tokens_seen": 13079986160,
      "step": 16625
    },
    {
      "epoch": 1.7638446849140674,
      "grad_norm": 0.4365088668094614,
      "learning_rate": 4.740825150954777e-05,
      "loss": 1.6489,
      "num_input_tokens_seen": 13080772976,
      "step": 16626
    },
    {
      "epoch": 1.763950774453639,
      "grad_norm": 0.36887895947929344,
      "learning_rate": 4.740794336044269e-05,
      "loss": 1.7186,
      "num_input_tokens_seen": 13081559648,
      "step": 16627
    },
    {
      "epoch": 1.7640568639932104,
      "grad_norm": 0.5000227414563321,
      "learning_rate": 4.7407635194021407e-05,
      "loss": 1.6662,
      "num_input_tokens_seen": 13082346432,
      "step": 16628
    },
    {
      "epoch": 1.7641629535327816,
      "grad_norm": 0.42647388766368133,
      "learning_rate": 4.740732701028416e-05,
      "loss": 1.8192,
      "num_input_tokens_seen": 13083133168,
      "step": 16629
    },
    {
      "epoch": 1.764269043072353,
      "grad_norm": 0.38035550178056854,
      "learning_rate": 4.740701880923119e-05,
      "loss": 1.8675,
      "num_input_tokens_seen": 13083919904,
      "step": 16630
    },
    {
      "epoch": 1.7643751326119244,
      "grad_norm": 0.35891718685308166,
      "learning_rate": 4.7406710590862735e-05,
      "loss": 1.7069,
      "num_input_tokens_seen": 13084706672,
      "step": 16631
    },
    {
      "epoch": 1.7644812221514958,
      "grad_norm": 0.3566526760927715,
      "learning_rate": 4.740640235517903e-05,
      "loss": 1.8016,
      "num_input_tokens_seen": 13085493440,
      "step": 16632
    },
    {
      "epoch": 1.7645873116910673,
      "grad_norm": 0.3517818187491782,
      "learning_rate": 4.740609410218031e-05,
      "loss": 1.8002,
      "num_input_tokens_seen": 13086280176,
      "step": 16633
    },
    {
      "epoch": 1.7646934012306388,
      "grad_norm": 0.39505182954071216,
      "learning_rate": 4.740578583186682e-05,
      "loss": 1.7436,
      "num_input_tokens_seen": 13087066912,
      "step": 16634
    },
    {
      "epoch": 1.76479949077021,
      "grad_norm": 0.3485207202279571,
      "learning_rate": 4.740547754423881e-05,
      "loss": 1.6702,
      "num_input_tokens_seen": 13087853664,
      "step": 16635
    },
    {
      "epoch": 1.7649055803097815,
      "grad_norm": 0.40034070294830093,
      "learning_rate": 4.740516923929649e-05,
      "loss": 1.7556,
      "num_input_tokens_seen": 13088640368,
      "step": 16636
    },
    {
      "epoch": 1.7650116698493528,
      "grad_norm": 0.37449144006371027,
      "learning_rate": 4.740486091704012e-05,
      "loss": 1.7028,
      "num_input_tokens_seen": 13089427104,
      "step": 16637
    },
    {
      "epoch": 1.7651177593889242,
      "grad_norm": 0.32747608229208985,
      "learning_rate": 4.740455257746992e-05,
      "loss": 1.6911,
      "num_input_tokens_seen": 13090213904,
      "step": 16638
    },
    {
      "epoch": 1.7652238489284957,
      "grad_norm": 0.3336106494905461,
      "learning_rate": 4.7404244220586146e-05,
      "loss": 1.7356,
      "num_input_tokens_seen": 13091000720,
      "step": 16639
    },
    {
      "epoch": 1.7653299384680672,
      "grad_norm": 0.36062576904997495,
      "learning_rate": 4.7403935846389024e-05,
      "loss": 1.8098,
      "num_input_tokens_seen": 13091787440,
      "step": 16640
    },
    {
      "epoch": 1.7654360280076384,
      "grad_norm": 0.3630524230607612,
      "learning_rate": 4.7403627454878805e-05,
      "loss": 1.7063,
      "num_input_tokens_seen": 13092574176,
      "step": 16641
    },
    {
      "epoch": 1.7655421175472097,
      "grad_norm": 0.32657061355614503,
      "learning_rate": 4.7403319046055715e-05,
      "loss": 1.7297,
      "num_input_tokens_seen": 13093360944,
      "step": 16642
    },
    {
      "epoch": 1.7656482070867812,
      "grad_norm": 0.43578855564419133,
      "learning_rate": 4.740301061992001e-05,
      "loss": 1.7257,
      "num_input_tokens_seen": 13094147760,
      "step": 16643
    },
    {
      "epoch": 1.7657542966263526,
      "grad_norm": 0.3145087262464254,
      "learning_rate": 4.74027021764719e-05,
      "loss": 1.7054,
      "num_input_tokens_seen": 13094934496,
      "step": 16644
    },
    {
      "epoch": 1.7658603861659241,
      "grad_norm": 0.40372415193904126,
      "learning_rate": 4.740239371571165e-05,
      "loss": 1.6774,
      "num_input_tokens_seen": 13095721232,
      "step": 16645
    },
    {
      "epoch": 1.7659664757054956,
      "grad_norm": 0.3738055518109594,
      "learning_rate": 4.7402085237639475e-05,
      "loss": 1.7217,
      "num_input_tokens_seen": 13096508016,
      "step": 16646
    },
    {
      "epoch": 1.7660725652450668,
      "grad_norm": 0.3573994710756684,
      "learning_rate": 4.7401776742255634e-05,
      "loss": 1.8302,
      "num_input_tokens_seen": 13097294816,
      "step": 16647
    },
    {
      "epoch": 1.766178654784638,
      "grad_norm": 0.3337877094047332,
      "learning_rate": 4.740146822956036e-05,
      "loss": 1.5926,
      "num_input_tokens_seen": 13098081648,
      "step": 16648
    },
    {
      "epoch": 1.7662847443242096,
      "grad_norm": 0.35101821436486574,
      "learning_rate": 4.740115969955389e-05,
      "loss": 1.6682,
      "num_input_tokens_seen": 13098868368,
      "step": 16649
    },
    {
      "epoch": 1.766390833863781,
      "grad_norm": 0.31772016704264855,
      "learning_rate": 4.740085115223645e-05,
      "loss": 1.6139,
      "num_input_tokens_seen": 13099655072,
      "step": 16650
    },
    {
      "epoch": 1.7664969234033525,
      "grad_norm": 0.3157578413551325,
      "learning_rate": 4.74005425876083e-05,
      "loss": 1.6479,
      "num_input_tokens_seen": 13100441824,
      "step": 16651
    },
    {
      "epoch": 1.766603012942924,
      "grad_norm": 0.3933648996901322,
      "learning_rate": 4.7400234005669666e-05,
      "loss": 1.9162,
      "num_input_tokens_seen": 13101228592,
      "step": 16652
    },
    {
      "epoch": 1.7667091024824952,
      "grad_norm": 0.3836402340399708,
      "learning_rate": 4.739992540642078e-05,
      "loss": 1.8481,
      "num_input_tokens_seen": 13102015376,
      "step": 16653
    },
    {
      "epoch": 1.7668151920220665,
      "grad_norm": 0.3682383794912,
      "learning_rate": 4.739961678986189e-05,
      "loss": 1.6297,
      "num_input_tokens_seen": 13102802160,
      "step": 16654
    },
    {
      "epoch": 1.766921281561638,
      "grad_norm": 0.44299305581282866,
      "learning_rate": 4.739930815599325e-05,
      "loss": 1.6361,
      "num_input_tokens_seen": 13103588960,
      "step": 16655
    },
    {
      "epoch": 1.7670273711012094,
      "grad_norm": 0.32526772580919916,
      "learning_rate": 4.7398999504815064e-05,
      "loss": 1.732,
      "num_input_tokens_seen": 13104375664,
      "step": 16656
    },
    {
      "epoch": 1.767133460640781,
      "grad_norm": 0.4025540459715218,
      "learning_rate": 4.73986908363276e-05,
      "loss": 1.7904,
      "num_input_tokens_seen": 13105162464,
      "step": 16657
    },
    {
      "epoch": 1.7672395501803522,
      "grad_norm": 0.39490814429500953,
      "learning_rate": 4.739838215053107e-05,
      "loss": 1.6675,
      "num_input_tokens_seen": 13105949200,
      "step": 16658
    },
    {
      "epoch": 1.7673456397199236,
      "grad_norm": 0.3924690694015192,
      "learning_rate": 4.739807344742574e-05,
      "loss": 1.7456,
      "num_input_tokens_seen": 13106735968,
      "step": 16659
    },
    {
      "epoch": 1.767451729259495,
      "grad_norm": 0.47156930169921574,
      "learning_rate": 4.739776472701183e-05,
      "loss": 1.6839,
      "num_input_tokens_seen": 13107522752,
      "step": 16660
    },
    {
      "epoch": 1.7675578187990664,
      "grad_norm": 0.3665441000516719,
      "learning_rate": 4.7397455989289595e-05,
      "loss": 1.7929,
      "num_input_tokens_seen": 13108309536,
      "step": 16661
    },
    {
      "epoch": 1.7676639083386378,
      "grad_norm": 0.4229142265467139,
      "learning_rate": 4.7397147234259256e-05,
      "loss": 1.7252,
      "num_input_tokens_seen": 13109096208,
      "step": 16662
    },
    {
      "epoch": 1.7677699978782093,
      "grad_norm": 0.5413220190557744,
      "learning_rate": 4.739683846192105e-05,
      "loss": 1.7633,
      "num_input_tokens_seen": 13109882992,
      "step": 16663
    },
    {
      "epoch": 1.7678760874177806,
      "grad_norm": 0.3962081681008961,
      "learning_rate": 4.739652967227524e-05,
      "loss": 1.6492,
      "num_input_tokens_seen": 13110669664,
      "step": 16664
    },
    {
      "epoch": 1.767982176957352,
      "grad_norm": 0.6014105056505682,
      "learning_rate": 4.7396220865322035e-05,
      "loss": 1.8011,
      "num_input_tokens_seen": 13111456432,
      "step": 16665
    },
    {
      "epoch": 1.7680882664969233,
      "grad_norm": 0.4134336850225219,
      "learning_rate": 4.73959120410617e-05,
      "loss": 1.5501,
      "num_input_tokens_seen": 13112243168,
      "step": 16666
    },
    {
      "epoch": 1.7681943560364948,
      "grad_norm": 0.5793603199759508,
      "learning_rate": 4.739560319949445e-05,
      "loss": 1.6938,
      "num_input_tokens_seen": 13113029968,
      "step": 16667
    },
    {
      "epoch": 1.7683004455760662,
      "grad_norm": 0.4424794455231912,
      "learning_rate": 4.739529434062055e-05,
      "loss": 1.7391,
      "num_input_tokens_seen": 13113816720,
      "step": 16668
    },
    {
      "epoch": 1.7684065351156377,
      "grad_norm": 0.7776131346711553,
      "learning_rate": 4.739498546444021e-05,
      "loss": 1.7604,
      "num_input_tokens_seen": 13114603376,
      "step": 16669
    },
    {
      "epoch": 1.768512624655209,
      "grad_norm": 0.387110348620015,
      "learning_rate": 4.739467657095369e-05,
      "loss": 1.7084,
      "num_input_tokens_seen": 13115390144,
      "step": 16670
    },
    {
      "epoch": 1.7686187141947802,
      "grad_norm": 0.4102561623853728,
      "learning_rate": 4.739436766016122e-05,
      "loss": 1.7009,
      "num_input_tokens_seen": 13116176928,
      "step": 16671
    },
    {
      "epoch": 1.7687248037343517,
      "grad_norm": 0.5793998192290595,
      "learning_rate": 4.7394058732063044e-05,
      "loss": 1.7766,
      "num_input_tokens_seen": 13116963728,
      "step": 16672
    },
    {
      "epoch": 1.7688308932739232,
      "grad_norm": 0.40437379054217704,
      "learning_rate": 4.739374978665938e-05,
      "loss": 1.7779,
      "num_input_tokens_seen": 13117750480,
      "step": 16673
    },
    {
      "epoch": 1.7689369828134947,
      "grad_norm": 0.6109573243128124,
      "learning_rate": 4.7393440823950495e-05,
      "loss": 1.7474,
      "num_input_tokens_seen": 13118537264,
      "step": 16674
    },
    {
      "epoch": 1.7690430723530661,
      "grad_norm": 0.3529439895399149,
      "learning_rate": 4.739313184393662e-05,
      "loss": 1.7884,
      "num_input_tokens_seen": 13119324080,
      "step": 16675
    },
    {
      "epoch": 1.7691491618926374,
      "grad_norm": 0.5829948579470775,
      "learning_rate": 4.739282284661798e-05,
      "loss": 1.7143,
      "num_input_tokens_seen": 13120110784,
      "step": 16676
    },
    {
      "epoch": 1.7692552514322086,
      "grad_norm": 0.34760352474336154,
      "learning_rate": 4.739251383199483e-05,
      "loss": 1.5507,
      "num_input_tokens_seen": 13120897568,
      "step": 16677
    },
    {
      "epoch": 1.76936134097178,
      "grad_norm": 0.40943187672955234,
      "learning_rate": 4.73922048000674e-05,
      "loss": 1.683,
      "num_input_tokens_seen": 13121684464,
      "step": 16678
    },
    {
      "epoch": 1.7694674305113516,
      "grad_norm": 0.4289685581856466,
      "learning_rate": 4.739189575083593e-05,
      "loss": 1.7211,
      "num_input_tokens_seen": 13122471184,
      "step": 16679
    },
    {
      "epoch": 1.769573520050923,
      "grad_norm": 0.39246170182411017,
      "learning_rate": 4.739158668430066e-05,
      "loss": 1.638,
      "num_input_tokens_seen": 13123258064,
      "step": 16680
    },
    {
      "epoch": 1.7696796095904945,
      "grad_norm": 0.4134494488254538,
      "learning_rate": 4.739127760046184e-05,
      "loss": 1.6547,
      "num_input_tokens_seen": 13124044832,
      "step": 16681
    },
    {
      "epoch": 1.7697856991300658,
      "grad_norm": 0.4079058052935597,
      "learning_rate": 4.739096849931968e-05,
      "loss": 1.6543,
      "num_input_tokens_seen": 13124831632,
      "step": 16682
    },
    {
      "epoch": 1.769891788669637,
      "grad_norm": 0.4002822561785609,
      "learning_rate": 4.7390659380874444e-05,
      "loss": 1.723,
      "num_input_tokens_seen": 13125618384,
      "step": 16683
    },
    {
      "epoch": 1.7699978782092085,
      "grad_norm": 0.36968699117590675,
      "learning_rate": 4.739035024512637e-05,
      "loss": 1.7022,
      "num_input_tokens_seen": 13126405200,
      "step": 16684
    },
    {
      "epoch": 1.77010396774878,
      "grad_norm": 0.41285191102938606,
      "learning_rate": 4.7390041092075684e-05,
      "loss": 1.67,
      "num_input_tokens_seen": 13127191952,
      "step": 16685
    },
    {
      "epoch": 1.7702100572883515,
      "grad_norm": 0.3677834188424014,
      "learning_rate": 4.738973192172262e-05,
      "loss": 1.7743,
      "num_input_tokens_seen": 13127978624,
      "step": 16686
    },
    {
      "epoch": 1.770316146827923,
      "grad_norm": 0.3348270339929904,
      "learning_rate": 4.738942273406745e-05,
      "loss": 1.5269,
      "num_input_tokens_seen": 13128765504,
      "step": 16687
    },
    {
      "epoch": 1.7704222363674942,
      "grad_norm": 0.381509606552836,
      "learning_rate": 4.738911352911038e-05,
      "loss": 1.8374,
      "num_input_tokens_seen": 13129552208,
      "step": 16688
    },
    {
      "epoch": 1.7705283259070654,
      "grad_norm": 0.41027550194960827,
      "learning_rate": 4.738880430685166e-05,
      "loss": 1.7459,
      "num_input_tokens_seen": 13130338976,
      "step": 16689
    },
    {
      "epoch": 1.770634415446637,
      "grad_norm": 0.4657077303329658,
      "learning_rate": 4.7388495067291525e-05,
      "loss": 1.808,
      "num_input_tokens_seen": 13131125728,
      "step": 16690
    },
    {
      "epoch": 1.7707405049862084,
      "grad_norm": 0.4623947384420042,
      "learning_rate": 4.738818581043022e-05,
      "loss": 1.6404,
      "num_input_tokens_seen": 13131912576,
      "step": 16691
    },
    {
      "epoch": 1.7708465945257799,
      "grad_norm": 0.38012983136700257,
      "learning_rate": 4.7387876536267985e-05,
      "loss": 1.7944,
      "num_input_tokens_seen": 13132699328,
      "step": 16692
    },
    {
      "epoch": 1.7709526840653511,
      "grad_norm": 0.4051953667612374,
      "learning_rate": 4.738756724480506e-05,
      "loss": 1.7191,
      "num_input_tokens_seen": 13133486128,
      "step": 16693
    },
    {
      "epoch": 1.7710587736049226,
      "grad_norm": 0.38404230338090706,
      "learning_rate": 4.738725793604167e-05,
      "loss": 1.7139,
      "num_input_tokens_seen": 13134272832,
      "step": 16694
    },
    {
      "epoch": 1.7711648631444938,
      "grad_norm": 0.37575690648222027,
      "learning_rate": 4.7386948609978075e-05,
      "loss": 1.9295,
      "num_input_tokens_seen": 13135059648,
      "step": 16695
    },
    {
      "epoch": 1.7712709526840653,
      "grad_norm": 0.34127447201106786,
      "learning_rate": 4.7386639266614494e-05,
      "loss": 1.6518,
      "num_input_tokens_seen": 13135846432,
      "step": 16696
    },
    {
      "epoch": 1.7713770422236368,
      "grad_norm": 0.3571947097764051,
      "learning_rate": 4.738632990595118e-05,
      "loss": 1.7329,
      "num_input_tokens_seen": 13136633280,
      "step": 16697
    },
    {
      "epoch": 1.7714831317632083,
      "grad_norm": 0.4214141790006618,
      "learning_rate": 4.738602052798837e-05,
      "loss": 1.6968,
      "num_input_tokens_seen": 13137420032,
      "step": 16698
    },
    {
      "epoch": 1.7715892213027795,
      "grad_norm": 0.4723167487986527,
      "learning_rate": 4.7385711132726295e-05,
      "loss": 1.8298,
      "num_input_tokens_seen": 13138206752,
      "step": 16699
    },
    {
      "epoch": 1.771695310842351,
      "grad_norm": 0.34297210881255846,
      "learning_rate": 4.7385401720165204e-05,
      "loss": 1.7007,
      "num_input_tokens_seen": 13138993552,
      "step": 16700
    },
    {
      "epoch": 1.7718014003819222,
      "grad_norm": 0.606006744266522,
      "learning_rate": 4.738509229030532e-05,
      "loss": 1.6045,
      "num_input_tokens_seen": 13139780384,
      "step": 16701
    },
    {
      "epoch": 1.7719074899214937,
      "grad_norm": 0.4103722852742396,
      "learning_rate": 4.73847828431469e-05,
      "loss": 1.7657,
      "num_input_tokens_seen": 13140567072,
      "step": 16702
    },
    {
      "epoch": 1.7720135794610652,
      "grad_norm": 0.7300985368224088,
      "learning_rate": 4.7384473378690175e-05,
      "loss": 1.7548,
      "num_input_tokens_seen": 13141353872,
      "step": 16703
    },
    {
      "epoch": 1.7721196690006367,
      "grad_norm": 0.40792919959690666,
      "learning_rate": 4.738416389693539e-05,
      "loss": 1.6227,
      "num_input_tokens_seen": 13142140672,
      "step": 16704
    },
    {
      "epoch": 1.772225758540208,
      "grad_norm": 0.6265103473955389,
      "learning_rate": 4.7383854397882776e-05,
      "loss": 1.6619,
      "num_input_tokens_seen": 13142927456,
      "step": 16705
    },
    {
      "epoch": 1.7723318480797792,
      "grad_norm": 0.40937598802596525,
      "learning_rate": 4.7383544881532584e-05,
      "loss": 1.6216,
      "num_input_tokens_seen": 13143714272,
      "step": 16706
    },
    {
      "epoch": 1.7724379376193506,
      "grad_norm": 0.4367775474271343,
      "learning_rate": 4.738323534788504e-05,
      "loss": 1.7438,
      "num_input_tokens_seen": 13144500976,
      "step": 16707
    },
    {
      "epoch": 1.7725440271589221,
      "grad_norm": 0.412375475588206,
      "learning_rate": 4.738292579694038e-05,
      "loss": 1.6909,
      "num_input_tokens_seen": 13145287792,
      "step": 16708
    },
    {
      "epoch": 1.7726501166984936,
      "grad_norm": 0.42392726809756365,
      "learning_rate": 4.738261622869886e-05,
      "loss": 1.6995,
      "num_input_tokens_seen": 13146074608,
      "step": 16709
    },
    {
      "epoch": 1.772756206238065,
      "grad_norm": 0.6041513463352223,
      "learning_rate": 4.7382306643160714e-05,
      "loss": 1.6247,
      "num_input_tokens_seen": 13146861472,
      "step": 16710
    },
    {
      "epoch": 1.7728622957776363,
      "grad_norm": 0.37543928893711526,
      "learning_rate": 4.7381997040326175e-05,
      "loss": 1.7007,
      "num_input_tokens_seen": 13147648320,
      "step": 16711
    },
    {
      "epoch": 1.7729683853172076,
      "grad_norm": 0.47829117175307023,
      "learning_rate": 4.7381687420195486e-05,
      "loss": 1.7406,
      "num_input_tokens_seen": 13148435088,
      "step": 16712
    },
    {
      "epoch": 1.773074474856779,
      "grad_norm": 0.47737038017499683,
      "learning_rate": 4.738137778276889e-05,
      "loss": 1.7036,
      "num_input_tokens_seen": 13149221936,
      "step": 16713
    },
    {
      "epoch": 1.7731805643963505,
      "grad_norm": 0.5664671613558186,
      "learning_rate": 4.738106812804661e-05,
      "loss": 1.8148,
      "num_input_tokens_seen": 13150008720,
      "step": 16714
    },
    {
      "epoch": 1.773286653935922,
      "grad_norm": 0.36817668819715543,
      "learning_rate": 4.738075845602891e-05,
      "loss": 1.6159,
      "num_input_tokens_seen": 13150795488,
      "step": 16715
    },
    {
      "epoch": 1.7733927434754935,
      "grad_norm": 0.3920111851820916,
      "learning_rate": 4.7380448766716e-05,
      "loss": 1.7624,
      "num_input_tokens_seen": 13151582256,
      "step": 16716
    },
    {
      "epoch": 1.7734988330150647,
      "grad_norm": 0.3642232837609315,
      "learning_rate": 4.738013906010815e-05,
      "loss": 1.828,
      "num_input_tokens_seen": 13152369040,
      "step": 16717
    },
    {
      "epoch": 1.773604922554636,
      "grad_norm": 0.4119066206015421,
      "learning_rate": 4.737982933620558e-05,
      "loss": 1.8249,
      "num_input_tokens_seen": 13153155840,
      "step": 16718
    },
    {
      "epoch": 1.7737110120942075,
      "grad_norm": 0.3501322740152459,
      "learning_rate": 4.7379519595008534e-05,
      "loss": 1.6056,
      "num_input_tokens_seen": 13153942640,
      "step": 16719
    },
    {
      "epoch": 1.773817101633779,
      "grad_norm": 0.4169831061465263,
      "learning_rate": 4.737920983651726e-05,
      "loss": 1.859,
      "num_input_tokens_seen": 13154729344,
      "step": 16720
    },
    {
      "epoch": 1.7739231911733504,
      "grad_norm": 0.3303591841614711,
      "learning_rate": 4.737890006073198e-05,
      "loss": 1.7095,
      "num_input_tokens_seen": 13155516160,
      "step": 16721
    },
    {
      "epoch": 1.7740292807129217,
      "grad_norm": 0.4755399366813111,
      "learning_rate": 4.7378590267652945e-05,
      "loss": 1.7191,
      "num_input_tokens_seen": 13156302832,
      "step": 16722
    },
    {
      "epoch": 1.7741353702524931,
      "grad_norm": 0.4326309770551466,
      "learning_rate": 4.73782804572804e-05,
      "loss": 1.7854,
      "num_input_tokens_seen": 13157089728,
      "step": 16723
    },
    {
      "epoch": 1.7742414597920644,
      "grad_norm": 0.4401883047059728,
      "learning_rate": 4.737797062961456e-05,
      "loss": 1.7651,
      "num_input_tokens_seen": 13157876496,
      "step": 16724
    },
    {
      "epoch": 1.7743475493316359,
      "grad_norm": 0.362409648272039,
      "learning_rate": 4.7377660784655695e-05,
      "loss": 1.6611,
      "num_input_tokens_seen": 13158663184,
      "step": 16725
    },
    {
      "epoch": 1.7744536388712073,
      "grad_norm": 0.47446384654905377,
      "learning_rate": 4.737735092240403e-05,
      "loss": 1.8038,
      "num_input_tokens_seen": 13159449952,
      "step": 16726
    },
    {
      "epoch": 1.7745597284107788,
      "grad_norm": 0.418909430091472,
      "learning_rate": 4.73770410428598e-05,
      "loss": 1.7992,
      "num_input_tokens_seen": 13160236688,
      "step": 16727
    },
    {
      "epoch": 1.77466581795035,
      "grad_norm": 0.35372669331564793,
      "learning_rate": 4.7376731146023243e-05,
      "loss": 1.7487,
      "num_input_tokens_seen": 13161023488,
      "step": 16728
    },
    {
      "epoch": 1.7747719074899215,
      "grad_norm": 0.553556385749386,
      "learning_rate": 4.7376421231894616e-05,
      "loss": 1.6504,
      "num_input_tokens_seen": 13161810336,
      "step": 16729
    },
    {
      "epoch": 1.7748779970294928,
      "grad_norm": 0.39090903280058187,
      "learning_rate": 4.737611130047415e-05,
      "loss": 1.6732,
      "num_input_tokens_seen": 13162597088,
      "step": 16730
    },
    {
      "epoch": 1.7749840865690643,
      "grad_norm": 0.358516471904745,
      "learning_rate": 4.7375801351762074e-05,
      "loss": 1.738,
      "num_input_tokens_seen": 13163383872,
      "step": 16731
    },
    {
      "epoch": 1.7750901761086357,
      "grad_norm": 0.402766522078995,
      "learning_rate": 4.737549138575863e-05,
      "loss": 1.7023,
      "num_input_tokens_seen": 13164170688,
      "step": 16732
    },
    {
      "epoch": 1.7751962656482072,
      "grad_norm": 0.3926906779653032,
      "learning_rate": 4.737518140246407e-05,
      "loss": 1.703,
      "num_input_tokens_seen": 13164957440,
      "step": 16733
    },
    {
      "epoch": 1.7753023551877785,
      "grad_norm": 0.344221284491728,
      "learning_rate": 4.7374871401878624e-05,
      "loss": 1.8114,
      "num_input_tokens_seen": 13165744240,
      "step": 16734
    },
    {
      "epoch": 1.77540844472735,
      "grad_norm": 0.4064855431247463,
      "learning_rate": 4.7374561384002534e-05,
      "loss": 1.8365,
      "num_input_tokens_seen": 13166530928,
      "step": 16735
    },
    {
      "epoch": 1.7755145342669212,
      "grad_norm": 0.5243085447621455,
      "learning_rate": 4.737425134883604e-05,
      "loss": 1.9959,
      "num_input_tokens_seen": 13167317680,
      "step": 16736
    },
    {
      "epoch": 1.7756206238064927,
      "grad_norm": 0.4321040889309393,
      "learning_rate": 4.737394129637938e-05,
      "loss": 1.7969,
      "num_input_tokens_seen": 13168104432,
      "step": 16737
    },
    {
      "epoch": 1.7757267133460641,
      "grad_norm": 0.43003431084870586,
      "learning_rate": 4.73736312266328e-05,
      "loss": 1.7877,
      "num_input_tokens_seen": 13168891232,
      "step": 16738
    },
    {
      "epoch": 1.7758328028856356,
      "grad_norm": 0.37918126833776933,
      "learning_rate": 4.7373321139596525e-05,
      "loss": 1.7399,
      "num_input_tokens_seen": 13169677984,
      "step": 16739
    },
    {
      "epoch": 1.7759388924252069,
      "grad_norm": 0.36131658104138076,
      "learning_rate": 4.737301103527081e-05,
      "loss": 1.7106,
      "num_input_tokens_seen": 13170464784,
      "step": 16740
    },
    {
      "epoch": 1.7760449819647781,
      "grad_norm": 0.3982786926478069,
      "learning_rate": 4.7372700913655885e-05,
      "loss": 1.691,
      "num_input_tokens_seen": 13171251680,
      "step": 16741
    },
    {
      "epoch": 1.7761510715043496,
      "grad_norm": 0.34520829698006633,
      "learning_rate": 4.7372390774752e-05,
      "loss": 1.7014,
      "num_input_tokens_seen": 13172038544,
      "step": 16742
    },
    {
      "epoch": 1.776257161043921,
      "grad_norm": 0.35899068651671256,
      "learning_rate": 4.737208061855939e-05,
      "loss": 1.6874,
      "num_input_tokens_seen": 13172825328,
      "step": 16743
    },
    {
      "epoch": 1.7763632505834925,
      "grad_norm": 0.4232676624578132,
      "learning_rate": 4.737177044507828e-05,
      "loss": 1.8137,
      "num_input_tokens_seen": 13173611920,
      "step": 16744
    },
    {
      "epoch": 1.776469340123064,
      "grad_norm": 0.32395872426771194,
      "learning_rate": 4.737146025430893e-05,
      "loss": 1.701,
      "num_input_tokens_seen": 13174398672,
      "step": 16745
    },
    {
      "epoch": 1.7765754296626353,
      "grad_norm": 0.4727073819541803,
      "learning_rate": 4.737115004625157e-05,
      "loss": 1.8145,
      "num_input_tokens_seen": 13175185456,
      "step": 16746
    },
    {
      "epoch": 1.7766815192022065,
      "grad_norm": 0.4529700311032024,
      "learning_rate": 4.7370839820906444e-05,
      "loss": 1.8645,
      "num_input_tokens_seen": 13175972160,
      "step": 16747
    },
    {
      "epoch": 1.776787608741778,
      "grad_norm": 0.44453203762852755,
      "learning_rate": 4.737052957827379e-05,
      "loss": 1.6368,
      "num_input_tokens_seen": 13176759008,
      "step": 16748
    },
    {
      "epoch": 1.7768936982813495,
      "grad_norm": 0.45910350775510655,
      "learning_rate": 4.7370219318353845e-05,
      "loss": 1.8796,
      "num_input_tokens_seen": 13177545744,
      "step": 16749
    },
    {
      "epoch": 1.776999787820921,
      "grad_norm": 0.4463657388201886,
      "learning_rate": 4.736990904114685e-05,
      "loss": 1.6783,
      "num_input_tokens_seen": 13178332464,
      "step": 16750
    },
    {
      "epoch": 1.7771058773604924,
      "grad_norm": 0.38437778781511833,
      "learning_rate": 4.736959874665304e-05,
      "loss": 1.7646,
      "num_input_tokens_seen": 13179119200,
      "step": 16751
    },
    {
      "epoch": 1.7772119669000637,
      "grad_norm": 0.3741616808503515,
      "learning_rate": 4.736928843487267e-05,
      "loss": 1.8245,
      "num_input_tokens_seen": 13179905888,
      "step": 16752
    },
    {
      "epoch": 1.777318056439635,
      "grad_norm": 0.3286402851759997,
      "learning_rate": 4.736897810580597e-05,
      "loss": 1.6934,
      "num_input_tokens_seen": 13180692688,
      "step": 16753
    },
    {
      "epoch": 1.7774241459792064,
      "grad_norm": 0.4334633051640036,
      "learning_rate": 4.736866775945318e-05,
      "loss": 1.7511,
      "num_input_tokens_seen": 13181479376,
      "step": 16754
    },
    {
      "epoch": 1.7775302355187779,
      "grad_norm": 0.44047414145264674,
      "learning_rate": 4.736835739581453e-05,
      "loss": 1.7556,
      "num_input_tokens_seen": 13182266096,
      "step": 16755
    },
    {
      "epoch": 1.7776363250583493,
      "grad_norm": 0.36527999626653657,
      "learning_rate": 4.7368047014890276e-05,
      "loss": 1.78,
      "num_input_tokens_seen": 13183052864,
      "step": 16756
    },
    {
      "epoch": 1.7777424145979206,
      "grad_norm": 0.4768015190031861,
      "learning_rate": 4.736773661668066e-05,
      "loss": 1.7691,
      "num_input_tokens_seen": 13183839552,
      "step": 16757
    },
    {
      "epoch": 1.777848504137492,
      "grad_norm": 0.3994856989800412,
      "learning_rate": 4.73674262011859e-05,
      "loss": 1.7524,
      "num_input_tokens_seen": 13184626288,
      "step": 16758
    },
    {
      "epoch": 1.7779545936770633,
      "grad_norm": 0.5745140251164229,
      "learning_rate": 4.736711576840626e-05,
      "loss": 1.7028,
      "num_input_tokens_seen": 13185413104,
      "step": 16759
    },
    {
      "epoch": 1.7780606832166348,
      "grad_norm": 0.37649797179465705,
      "learning_rate": 4.736680531834195e-05,
      "loss": 1.7157,
      "num_input_tokens_seen": 13186199856,
      "step": 16760
    },
    {
      "epoch": 1.7781667727562063,
      "grad_norm": 0.5086765832906182,
      "learning_rate": 4.736649485099325e-05,
      "loss": 1.779,
      "num_input_tokens_seen": 13186986576,
      "step": 16761
    },
    {
      "epoch": 1.7782728622957777,
      "grad_norm": 0.43187652002074267,
      "learning_rate": 4.7366184366360374e-05,
      "loss": 1.7973,
      "num_input_tokens_seen": 13187773296,
      "step": 16762
    },
    {
      "epoch": 1.778378951835349,
      "grad_norm": 0.4225339200640562,
      "learning_rate": 4.7365873864443567e-05,
      "loss": 1.7775,
      "num_input_tokens_seen": 13188560048,
      "step": 16763
    },
    {
      "epoch": 1.7784850413749205,
      "grad_norm": 0.4030097855380224,
      "learning_rate": 4.736556334524307e-05,
      "loss": 1.6373,
      "num_input_tokens_seen": 13189346832,
      "step": 16764
    },
    {
      "epoch": 1.7785911309144917,
      "grad_norm": 0.35398314442507156,
      "learning_rate": 4.7365252808759114e-05,
      "loss": 1.62,
      "num_input_tokens_seen": 13190133744,
      "step": 16765
    },
    {
      "epoch": 1.7786972204540632,
      "grad_norm": 0.36621115115008984,
      "learning_rate": 4.736494225499195e-05,
      "loss": 1.7269,
      "num_input_tokens_seen": 13190920528,
      "step": 16766
    },
    {
      "epoch": 1.7788033099936347,
      "grad_norm": 0.36682095616985627,
      "learning_rate": 4.736463168394182e-05,
      "loss": 1.7709,
      "num_input_tokens_seen": 13191707264,
      "step": 16767
    },
    {
      "epoch": 1.7789093995332061,
      "grad_norm": 0.3516467971030968,
      "learning_rate": 4.736432109560895e-05,
      "loss": 1.8167,
      "num_input_tokens_seen": 13192494000,
      "step": 16768
    },
    {
      "epoch": 1.7790154890727774,
      "grad_norm": 0.32124419251933395,
      "learning_rate": 4.73640104899936e-05,
      "loss": 1.6399,
      "num_input_tokens_seen": 13193280800,
      "step": 16769
    },
    {
      "epoch": 1.7791215786123489,
      "grad_norm": 0.3772487323201415,
      "learning_rate": 4.736369986709599e-05,
      "loss": 1.7471,
      "num_input_tokens_seen": 13194067472,
      "step": 16770
    },
    {
      "epoch": 1.7792276681519201,
      "grad_norm": 0.35215061029690936,
      "learning_rate": 4.736338922691638e-05,
      "loss": 1.5913,
      "num_input_tokens_seen": 13194854304,
      "step": 16771
    },
    {
      "epoch": 1.7793337576914916,
      "grad_norm": 0.3549236727487913,
      "learning_rate": 4.7363078569454986e-05,
      "loss": 1.7866,
      "num_input_tokens_seen": 13195641008,
      "step": 16772
    },
    {
      "epoch": 1.779439847231063,
      "grad_norm": 0.37872892511758244,
      "learning_rate": 4.736276789471207e-05,
      "loss": 1.8111,
      "num_input_tokens_seen": 13196427776,
      "step": 16773
    },
    {
      "epoch": 1.7795459367706346,
      "grad_norm": 0.32655390171606996,
      "learning_rate": 4.736245720268786e-05,
      "loss": 1.6019,
      "num_input_tokens_seen": 13197214544,
      "step": 16774
    },
    {
      "epoch": 1.7796520263102058,
      "grad_norm": 0.35381977404056236,
      "learning_rate": 4.7362146493382595e-05,
      "loss": 1.6463,
      "num_input_tokens_seen": 13198001344,
      "step": 16775
    },
    {
      "epoch": 1.779758115849777,
      "grad_norm": 0.402034189519664,
      "learning_rate": 4.7361835766796525e-05,
      "loss": 1.7821,
      "num_input_tokens_seen": 13198788080,
      "step": 16776
    },
    {
      "epoch": 1.7798642053893485,
      "grad_norm": 0.4083097222094487,
      "learning_rate": 4.7361525022929885e-05,
      "loss": 1.8102,
      "num_input_tokens_seen": 13199574880,
      "step": 16777
    },
    {
      "epoch": 1.77997029492892,
      "grad_norm": 0.3684030030550188,
      "learning_rate": 4.736121426178291e-05,
      "loss": 1.7653,
      "num_input_tokens_seen": 13200361600,
      "step": 16778
    },
    {
      "epoch": 1.7800763844684915,
      "grad_norm": 0.45868894224453904,
      "learning_rate": 4.7360903483355845e-05,
      "loss": 1.7627,
      "num_input_tokens_seen": 13201148304,
      "step": 16779
    },
    {
      "epoch": 1.780182474008063,
      "grad_norm": 0.34869766685984044,
      "learning_rate": 4.736059268764893e-05,
      "loss": 1.8174,
      "num_input_tokens_seen": 13201935056,
      "step": 16780
    },
    {
      "epoch": 1.7802885635476342,
      "grad_norm": 0.3929842161879368,
      "learning_rate": 4.736028187466241e-05,
      "loss": 1.8305,
      "num_input_tokens_seen": 13202721808,
      "step": 16781
    },
    {
      "epoch": 1.7803946530872055,
      "grad_norm": 0.3728734732967127,
      "learning_rate": 4.735997104439652e-05,
      "loss": 1.5734,
      "num_input_tokens_seen": 13203508544,
      "step": 16782
    },
    {
      "epoch": 1.780500742626777,
      "grad_norm": 0.4149996283434092,
      "learning_rate": 4.73596601968515e-05,
      "loss": 1.7379,
      "num_input_tokens_seen": 13204295264,
      "step": 16783
    },
    {
      "epoch": 1.7806068321663484,
      "grad_norm": 0.38285017670792504,
      "learning_rate": 4.7359349332027584e-05,
      "loss": 1.726,
      "num_input_tokens_seen": 13205082080,
      "step": 16784
    },
    {
      "epoch": 1.7807129217059199,
      "grad_norm": 0.37516623560063916,
      "learning_rate": 4.735903844992502e-05,
      "loss": 1.7023,
      "num_input_tokens_seen": 13205868800,
      "step": 16785
    },
    {
      "epoch": 1.7808190112454914,
      "grad_norm": 0.40477962537680867,
      "learning_rate": 4.735872755054406e-05,
      "loss": 1.7832,
      "num_input_tokens_seen": 13206655568,
      "step": 16786
    },
    {
      "epoch": 1.7809251007850626,
      "grad_norm": 0.3870324821796563,
      "learning_rate": 4.735841663388492e-05,
      "loss": 1.8434,
      "num_input_tokens_seen": 13207442240,
      "step": 16787
    },
    {
      "epoch": 1.7810311903246339,
      "grad_norm": 0.4033761221119911,
      "learning_rate": 4.7358105699947855e-05,
      "loss": 1.6848,
      "num_input_tokens_seen": 13208229072,
      "step": 16788
    },
    {
      "epoch": 1.7811372798642053,
      "grad_norm": 0.3822026907830328,
      "learning_rate": 4.73577947487331e-05,
      "loss": 1.6768,
      "num_input_tokens_seen": 13209015808,
      "step": 16789
    },
    {
      "epoch": 1.7812433694037768,
      "grad_norm": 0.37700072077175323,
      "learning_rate": 4.735748378024089e-05,
      "loss": 1.7717,
      "num_input_tokens_seen": 13209802544,
      "step": 16790
    },
    {
      "epoch": 1.7813494589433483,
      "grad_norm": 0.346823521321846,
      "learning_rate": 4.735717279447148e-05,
      "loss": 1.5949,
      "num_input_tokens_seen": 13210589376,
      "step": 16791
    },
    {
      "epoch": 1.7814555484829195,
      "grad_norm": 0.36816389096369534,
      "learning_rate": 4.7356861791425106e-05,
      "loss": 1.6535,
      "num_input_tokens_seen": 13211376112,
      "step": 16792
    },
    {
      "epoch": 1.781561638022491,
      "grad_norm": 0.39832699637730506,
      "learning_rate": 4.7356550771102e-05,
      "loss": 1.7799,
      "num_input_tokens_seen": 13212162896,
      "step": 16793
    },
    {
      "epoch": 1.7816677275620623,
      "grad_norm": 0.32684322179304337,
      "learning_rate": 4.735623973350241e-05,
      "loss": 1.6575,
      "num_input_tokens_seen": 13212949632,
      "step": 16794
    },
    {
      "epoch": 1.7817738171016337,
      "grad_norm": 0.36431954015017276,
      "learning_rate": 4.735592867862657e-05,
      "loss": 1.6915,
      "num_input_tokens_seen": 13213736272,
      "step": 16795
    },
    {
      "epoch": 1.7818799066412052,
      "grad_norm": 0.41406728912591223,
      "learning_rate": 4.7355617606474734e-05,
      "loss": 1.7239,
      "num_input_tokens_seen": 13214523120,
      "step": 16796
    },
    {
      "epoch": 1.7819859961807767,
      "grad_norm": 0.41373561235294093,
      "learning_rate": 4.7355306517047126e-05,
      "loss": 1.725,
      "num_input_tokens_seen": 13215309920,
      "step": 16797
    },
    {
      "epoch": 1.782092085720348,
      "grad_norm": 0.3930250303180976,
      "learning_rate": 4.7354995410343996e-05,
      "loss": 1.6831,
      "num_input_tokens_seen": 13216096784,
      "step": 16798
    },
    {
      "epoch": 1.7821981752599194,
      "grad_norm": 0.4107362324173687,
      "learning_rate": 4.735468428636558e-05,
      "loss": 1.7796,
      "num_input_tokens_seen": 13216883536,
      "step": 16799
    },
    {
      "epoch": 1.7823042647994907,
      "grad_norm": 0.4231947969994412,
      "learning_rate": 4.735437314511212e-05,
      "loss": 1.9015,
      "num_input_tokens_seen": 13217670240,
      "step": 16800
    },
    {
      "epoch": 1.7824103543390621,
      "grad_norm": 0.41676337966825916,
      "learning_rate": 4.7354061986583856e-05,
      "loss": 1.6543,
      "num_input_tokens_seen": 13218456992,
      "step": 16801
    },
    {
      "epoch": 1.7825164438786336,
      "grad_norm": 0.4113180342877931,
      "learning_rate": 4.7353750810781025e-05,
      "loss": 1.7645,
      "num_input_tokens_seen": 13219243840,
      "step": 16802
    },
    {
      "epoch": 1.782622533418205,
      "grad_norm": 0.368137328380771,
      "learning_rate": 4.735343961770388e-05,
      "loss": 1.7839,
      "num_input_tokens_seen": 13220030560,
      "step": 16803
    },
    {
      "epoch": 1.7827286229577763,
      "grad_norm": 0.4018598131688435,
      "learning_rate": 4.735312840735264e-05,
      "loss": 1.7693,
      "num_input_tokens_seen": 13220817248,
      "step": 16804
    },
    {
      "epoch": 1.7828347124973476,
      "grad_norm": 0.37173691547526383,
      "learning_rate": 4.735281717972756e-05,
      "loss": 1.7748,
      "num_input_tokens_seen": 13221603984,
      "step": 16805
    },
    {
      "epoch": 1.782940802036919,
      "grad_norm": 0.37965022519085595,
      "learning_rate": 4.7352505934828886e-05,
      "loss": 1.6698,
      "num_input_tokens_seen": 13222390928,
      "step": 16806
    },
    {
      "epoch": 1.7830468915764905,
      "grad_norm": 0.37345966302129935,
      "learning_rate": 4.735219467265685e-05,
      "loss": 1.7191,
      "num_input_tokens_seen": 13223177712,
      "step": 16807
    },
    {
      "epoch": 1.783152981116062,
      "grad_norm": 0.4374605794759687,
      "learning_rate": 4.735188339321169e-05,
      "loss": 1.8353,
      "num_input_tokens_seen": 13223964432,
      "step": 16808
    },
    {
      "epoch": 1.7832590706556335,
      "grad_norm": 0.4353729033835509,
      "learning_rate": 4.735157209649366e-05,
      "loss": 1.7357,
      "num_input_tokens_seen": 13224751136,
      "step": 16809
    },
    {
      "epoch": 1.7833651601952047,
      "grad_norm": 0.4752226040293986,
      "learning_rate": 4.735126078250298e-05,
      "loss": 1.75,
      "num_input_tokens_seen": 13225537856,
      "step": 16810
    },
    {
      "epoch": 1.783471249734776,
      "grad_norm": 0.44853082129920957,
      "learning_rate": 4.735094945123991e-05,
      "loss": 1.7163,
      "num_input_tokens_seen": 13226324560,
      "step": 16811
    },
    {
      "epoch": 1.7835773392743475,
      "grad_norm": 0.4531236313772983,
      "learning_rate": 4.735063810270468e-05,
      "loss": 1.6879,
      "num_input_tokens_seen": 13227111376,
      "step": 16812
    },
    {
      "epoch": 1.783683428813919,
      "grad_norm": 0.3902798306466231,
      "learning_rate": 4.735032673689753e-05,
      "loss": 1.8375,
      "num_input_tokens_seen": 13227898192,
      "step": 16813
    },
    {
      "epoch": 1.7837895183534904,
      "grad_norm": 0.502794917598072,
      "learning_rate": 4.7350015353818706e-05,
      "loss": 1.6922,
      "num_input_tokens_seen": 13228684928,
      "step": 16814
    },
    {
      "epoch": 1.783895607893062,
      "grad_norm": 0.36497487286614033,
      "learning_rate": 4.734970395346844e-05,
      "loss": 1.7358,
      "num_input_tokens_seen": 13229471648,
      "step": 16815
    },
    {
      "epoch": 1.7840016974326331,
      "grad_norm": 0.4519190111628189,
      "learning_rate": 4.7349392535846984e-05,
      "loss": 1.7499,
      "num_input_tokens_seen": 13230258336,
      "step": 16816
    },
    {
      "epoch": 1.7841077869722044,
      "grad_norm": 0.37662412502088527,
      "learning_rate": 4.7349081100954576e-05,
      "loss": 1.7383,
      "num_input_tokens_seen": 13231045072,
      "step": 16817
    },
    {
      "epoch": 1.7842138765117759,
      "grad_norm": 0.4333537987596274,
      "learning_rate": 4.7348769648791444e-05,
      "loss": 1.6551,
      "num_input_tokens_seen": 13231831872,
      "step": 16818
    },
    {
      "epoch": 1.7843199660513474,
      "grad_norm": 0.43679207225554917,
      "learning_rate": 4.7348458179357845e-05,
      "loss": 1.6932,
      "num_input_tokens_seen": 13232618688,
      "step": 16819
    },
    {
      "epoch": 1.7844260555909188,
      "grad_norm": 0.3886574253154065,
      "learning_rate": 4.734814669265402e-05,
      "loss": 1.6532,
      "num_input_tokens_seen": 13233405408,
      "step": 16820
    },
    {
      "epoch": 1.7845321451304903,
      "grad_norm": 0.38389246558944795,
      "learning_rate": 4.734783518868019e-05,
      "loss": 1.7276,
      "num_input_tokens_seen": 13234192160,
      "step": 16821
    },
    {
      "epoch": 1.7846382346700616,
      "grad_norm": 0.39811780884127085,
      "learning_rate": 4.734752366743661e-05,
      "loss": 1.7428,
      "num_input_tokens_seen": 13234978912,
      "step": 16822
    },
    {
      "epoch": 1.7847443242096328,
      "grad_norm": 0.3777665399722649,
      "learning_rate": 4.734721212892353e-05,
      "loss": 1.7556,
      "num_input_tokens_seen": 13235765696,
      "step": 16823
    },
    {
      "epoch": 1.7848504137492043,
      "grad_norm": 0.4061822887803472,
      "learning_rate": 4.734690057314117e-05,
      "loss": 1.753,
      "num_input_tokens_seen": 13236552576,
      "step": 16824
    },
    {
      "epoch": 1.7849565032887758,
      "grad_norm": 0.3804182620777323,
      "learning_rate": 4.734658900008979e-05,
      "loss": 1.9353,
      "num_input_tokens_seen": 13237339280,
      "step": 16825
    },
    {
      "epoch": 1.7850625928283472,
      "grad_norm": 0.4350519174626666,
      "learning_rate": 4.734627740976961e-05,
      "loss": 1.6268,
      "num_input_tokens_seen": 13238126096,
      "step": 16826
    },
    {
      "epoch": 1.7851686823679185,
      "grad_norm": 0.4817649803328936,
      "learning_rate": 4.7345965802180894e-05,
      "loss": 1.6973,
      "num_input_tokens_seen": 13238912848,
      "step": 16827
    },
    {
      "epoch": 1.78527477190749,
      "grad_norm": 0.49017673013448615,
      "learning_rate": 4.7345654177323865e-05,
      "loss": 1.7201,
      "num_input_tokens_seen": 13239699664,
      "step": 16828
    },
    {
      "epoch": 1.7853808614470612,
      "grad_norm": 0.4213791232781458,
      "learning_rate": 4.734534253519877e-05,
      "loss": 1.7542,
      "num_input_tokens_seen": 13240486304,
      "step": 16829
    },
    {
      "epoch": 1.7854869509866327,
      "grad_norm": 0.5489613469676295,
      "learning_rate": 4.7345030875805854e-05,
      "loss": 1.7693,
      "num_input_tokens_seen": 13241273088,
      "step": 16830
    },
    {
      "epoch": 1.7855930405262042,
      "grad_norm": 0.4244063709613101,
      "learning_rate": 4.7344719199145347e-05,
      "loss": 1.6618,
      "num_input_tokens_seen": 13242059936,
      "step": 16831
    },
    {
      "epoch": 1.7856991300657756,
      "grad_norm": 0.6063465396727262,
      "learning_rate": 4.7344407505217503e-05,
      "loss": 1.7953,
      "num_input_tokens_seen": 13242846624,
      "step": 16832
    },
    {
      "epoch": 1.7858052196053469,
      "grad_norm": 0.380552158160502,
      "learning_rate": 4.7344095794022555e-05,
      "loss": 1.6779,
      "num_input_tokens_seen": 13243633360,
      "step": 16833
    },
    {
      "epoch": 1.7859113091449184,
      "grad_norm": 0.5989516893992732,
      "learning_rate": 4.7343784065560745e-05,
      "loss": 1.7988,
      "num_input_tokens_seen": 13244420240,
      "step": 16834
    },
    {
      "epoch": 1.7860173986844896,
      "grad_norm": 0.3930573741896723,
      "learning_rate": 4.734347231983232e-05,
      "loss": 1.7419,
      "num_input_tokens_seen": 13245206976,
      "step": 16835
    },
    {
      "epoch": 1.786123488224061,
      "grad_norm": 0.7443761395692385,
      "learning_rate": 4.73431605568375e-05,
      "loss": 1.7198,
      "num_input_tokens_seen": 13245993728,
      "step": 16836
    },
    {
      "epoch": 1.7862295777636326,
      "grad_norm": 0.3928110798508825,
      "learning_rate": 4.734284877657655e-05,
      "loss": 1.6992,
      "num_input_tokens_seen": 13246780544,
      "step": 16837
    },
    {
      "epoch": 1.786335667303204,
      "grad_norm": 0.5391429053152226,
      "learning_rate": 4.73425369790497e-05,
      "loss": 1.8399,
      "num_input_tokens_seen": 13247567200,
      "step": 16838
    },
    {
      "epoch": 1.7864417568427753,
      "grad_norm": 0.5933213704696984,
      "learning_rate": 4.7342225164257196e-05,
      "loss": 1.6259,
      "num_input_tokens_seen": 13248354032,
      "step": 16839
    },
    {
      "epoch": 1.7865478463823465,
      "grad_norm": 0.48696813964729085,
      "learning_rate": 4.734191333219928e-05,
      "loss": 1.7872,
      "num_input_tokens_seen": 13249140720,
      "step": 16840
    },
    {
      "epoch": 1.786653935921918,
      "grad_norm": 0.7373634928536064,
      "learning_rate": 4.734160148287619e-05,
      "loss": 1.8427,
      "num_input_tokens_seen": 13249927536,
      "step": 16841
    },
    {
      "epoch": 1.7867600254614895,
      "grad_norm": 0.6295822234269679,
      "learning_rate": 4.734128961628815e-05,
      "loss": 1.791,
      "num_input_tokens_seen": 13250714272,
      "step": 16842
    },
    {
      "epoch": 1.786866115001061,
      "grad_norm": 0.38182625452126173,
      "learning_rate": 4.734097773243543e-05,
      "loss": 1.6217,
      "num_input_tokens_seen": 13251501168,
      "step": 16843
    },
    {
      "epoch": 1.7869722045406324,
      "grad_norm": 0.381066101375968,
      "learning_rate": 4.734066583131825e-05,
      "loss": 1.6623,
      "num_input_tokens_seen": 13252287856,
      "step": 16844
    },
    {
      "epoch": 1.7870782940802037,
      "grad_norm": 0.40645872067872146,
      "learning_rate": 4.734035391293687e-05,
      "loss": 1.698,
      "num_input_tokens_seen": 13253074656,
      "step": 16845
    },
    {
      "epoch": 1.787184383619775,
      "grad_norm": 0.38611911975125585,
      "learning_rate": 4.734004197729151e-05,
      "loss": 1.8119,
      "num_input_tokens_seen": 13253861392,
      "step": 16846
    },
    {
      "epoch": 1.7872904731593464,
      "grad_norm": 0.36516846004525483,
      "learning_rate": 4.7339730024382425e-05,
      "loss": 1.6317,
      "num_input_tokens_seen": 13254648192,
      "step": 16847
    },
    {
      "epoch": 1.787396562698918,
      "grad_norm": 0.4151000321534909,
      "learning_rate": 4.7339418054209857e-05,
      "loss": 1.7749,
      "num_input_tokens_seen": 13255434976,
      "step": 16848
    },
    {
      "epoch": 1.7875026522384894,
      "grad_norm": 0.3911776878511047,
      "learning_rate": 4.733910606677404e-05,
      "loss": 1.8258,
      "num_input_tokens_seen": 13256221808,
      "step": 16849
    },
    {
      "epoch": 1.7876087417780608,
      "grad_norm": 0.44711301312153057,
      "learning_rate": 4.733879406207521e-05,
      "loss": 1.7737,
      "num_input_tokens_seen": 13257008656,
      "step": 16850
    },
    {
      "epoch": 1.787714831317632,
      "grad_norm": 0.483074840659291,
      "learning_rate": 4.733848204011362e-05,
      "loss": 1.8757,
      "num_input_tokens_seen": 13257795344,
      "step": 16851
    },
    {
      "epoch": 1.7878209208572033,
      "grad_norm": 0.44860398197401086,
      "learning_rate": 4.7338170000889505e-05,
      "loss": 1.6942,
      "num_input_tokens_seen": 13258582096,
      "step": 16852
    },
    {
      "epoch": 1.7879270103967748,
      "grad_norm": 0.4367307437627933,
      "learning_rate": 4.733785794440311e-05,
      "loss": 1.6832,
      "num_input_tokens_seen": 13259368816,
      "step": 16853
    },
    {
      "epoch": 1.7880330999363463,
      "grad_norm": 0.4598222178115447,
      "learning_rate": 4.733754587065468e-05,
      "loss": 1.7397,
      "num_input_tokens_seen": 13260155568,
      "step": 16854
    },
    {
      "epoch": 1.7881391894759178,
      "grad_norm": 0.40848835468430444,
      "learning_rate": 4.733723377964444e-05,
      "loss": 1.7963,
      "num_input_tokens_seen": 13260942368,
      "step": 16855
    },
    {
      "epoch": 1.788245279015489,
      "grad_norm": 0.44640698529409717,
      "learning_rate": 4.7336921671372634e-05,
      "loss": 1.7567,
      "num_input_tokens_seen": 13261729280,
      "step": 16856
    },
    {
      "epoch": 1.7883513685550605,
      "grad_norm": 0.5310607488531828,
      "learning_rate": 4.7336609545839525e-05,
      "loss": 1.8226,
      "num_input_tokens_seen": 13262516000,
      "step": 16857
    },
    {
      "epoch": 1.7884574580946317,
      "grad_norm": 0.4035928894197984,
      "learning_rate": 4.7336297403045335e-05,
      "loss": 1.7459,
      "num_input_tokens_seen": 13263302768,
      "step": 16858
    },
    {
      "epoch": 1.7885635476342032,
      "grad_norm": 0.36968841818383247,
      "learning_rate": 4.733598524299031e-05,
      "loss": 1.692,
      "num_input_tokens_seen": 13264089552,
      "step": 16859
    },
    {
      "epoch": 1.7886696371737747,
      "grad_norm": 0.4018595218232362,
      "learning_rate": 4.7335673065674694e-05,
      "loss": 1.8516,
      "num_input_tokens_seen": 13264876368,
      "step": 16860
    },
    {
      "epoch": 1.7887757267133462,
      "grad_norm": 0.40248118832972096,
      "learning_rate": 4.7335360871098723e-05,
      "loss": 1.7544,
      "num_input_tokens_seen": 13265663152,
      "step": 16861
    },
    {
      "epoch": 1.7888818162529174,
      "grad_norm": 0.34377810901213895,
      "learning_rate": 4.733504865926264e-05,
      "loss": 1.7572,
      "num_input_tokens_seen": 13266449872,
      "step": 16862
    },
    {
      "epoch": 1.788987905792489,
      "grad_norm": 0.44758125494651757,
      "learning_rate": 4.733473643016668e-05,
      "loss": 1.8445,
      "num_input_tokens_seen": 13267236608,
      "step": 16863
    },
    {
      "epoch": 1.7890939953320601,
      "grad_norm": 0.37026449707300185,
      "learning_rate": 4.73344241838111e-05,
      "loss": 1.6138,
      "num_input_tokens_seen": 13268023344,
      "step": 16864
    },
    {
      "epoch": 1.7892000848716316,
      "grad_norm": 0.4375468662647191,
      "learning_rate": 4.733411192019613e-05,
      "loss": 1.6554,
      "num_input_tokens_seen": 13268810128,
      "step": 16865
    },
    {
      "epoch": 1.789306174411203,
      "grad_norm": 0.41974016999035246,
      "learning_rate": 4.7333799639322005e-05,
      "loss": 1.7424,
      "num_input_tokens_seen": 13269596944,
      "step": 16866
    },
    {
      "epoch": 1.7894122639507746,
      "grad_norm": 0.5403345339018307,
      "learning_rate": 4.7333487341188986e-05,
      "loss": 1.8939,
      "num_input_tokens_seen": 13270383856,
      "step": 16867
    },
    {
      "epoch": 1.7895183534903458,
      "grad_norm": 0.395435860479698,
      "learning_rate": 4.7333175025797304e-05,
      "loss": 1.7617,
      "num_input_tokens_seen": 13271170672,
      "step": 16868
    },
    {
      "epoch": 1.7896244430299173,
      "grad_norm": 0.39377598282793563,
      "learning_rate": 4.73328626931472e-05,
      "loss": 1.6375,
      "num_input_tokens_seen": 13271957472,
      "step": 16869
    },
    {
      "epoch": 1.7897305325694886,
      "grad_norm": 0.41159823952324115,
      "learning_rate": 4.733255034323891e-05,
      "loss": 1.7415,
      "num_input_tokens_seen": 13272744256,
      "step": 16870
    },
    {
      "epoch": 1.78983662210906,
      "grad_norm": 0.38965824917811415,
      "learning_rate": 4.733223797607268e-05,
      "loss": 1.711,
      "num_input_tokens_seen": 13273531024,
      "step": 16871
    },
    {
      "epoch": 1.7899427116486315,
      "grad_norm": 0.4108593375279101,
      "learning_rate": 4.7331925591648755e-05,
      "loss": 1.8584,
      "num_input_tokens_seen": 13274317728,
      "step": 16872
    },
    {
      "epoch": 1.790048801188203,
      "grad_norm": 0.4181004901073103,
      "learning_rate": 4.733161318996737e-05,
      "loss": 1.7253,
      "num_input_tokens_seen": 13275104464,
      "step": 16873
    },
    {
      "epoch": 1.7901548907277742,
      "grad_norm": 0.36255867531046193,
      "learning_rate": 4.733130077102877e-05,
      "loss": 1.7004,
      "num_input_tokens_seen": 13275891280,
      "step": 16874
    },
    {
      "epoch": 1.7902609802673455,
      "grad_norm": 0.3830362412990167,
      "learning_rate": 4.733098833483319e-05,
      "loss": 1.7821,
      "num_input_tokens_seen": 13276677968,
      "step": 16875
    },
    {
      "epoch": 1.790367069806917,
      "grad_norm": 0.4318267226772813,
      "learning_rate": 4.7330675881380895e-05,
      "loss": 1.8026,
      "num_input_tokens_seen": 13277464752,
      "step": 16876
    },
    {
      "epoch": 1.7904731593464884,
      "grad_norm": 0.4103382563494458,
      "learning_rate": 4.7330363410672095e-05,
      "loss": 1.7471,
      "num_input_tokens_seen": 13278251616,
      "step": 16877
    },
    {
      "epoch": 1.79057924888606,
      "grad_norm": 0.39961306304645977,
      "learning_rate": 4.7330050922707046e-05,
      "loss": 1.707,
      "num_input_tokens_seen": 13279038416,
      "step": 16878
    },
    {
      "epoch": 1.7906853384256314,
      "grad_norm": 0.457965272516929,
      "learning_rate": 4.732973841748599e-05,
      "loss": 1.6936,
      "num_input_tokens_seen": 13279825184,
      "step": 16879
    },
    {
      "epoch": 1.7907914279652026,
      "grad_norm": 0.41791457086643163,
      "learning_rate": 4.7329425895009174e-05,
      "loss": 1.7602,
      "num_input_tokens_seen": 13280611952,
      "step": 16880
    },
    {
      "epoch": 1.7908975175047739,
      "grad_norm": 0.37486072490684924,
      "learning_rate": 4.732911335527682e-05,
      "loss": 1.4776,
      "num_input_tokens_seen": 13281398800,
      "step": 16881
    },
    {
      "epoch": 1.7910036070443454,
      "grad_norm": 0.3606376563090037,
      "learning_rate": 4.7328800798289196e-05,
      "loss": 1.679,
      "num_input_tokens_seen": 13282185568,
      "step": 16882
    },
    {
      "epoch": 1.7911096965839168,
      "grad_norm": 0.4341977512025473,
      "learning_rate": 4.7328488224046516e-05,
      "loss": 1.8471,
      "num_input_tokens_seen": 13282972320,
      "step": 16883
    },
    {
      "epoch": 1.7912157861234883,
      "grad_norm": 0.3486301924597745,
      "learning_rate": 4.732817563254905e-05,
      "loss": 1.7467,
      "num_input_tokens_seen": 13283759104,
      "step": 16884
    },
    {
      "epoch": 1.7913218756630598,
      "grad_norm": 0.3924410361540253,
      "learning_rate": 4.7327863023797015e-05,
      "loss": 1.8169,
      "num_input_tokens_seen": 13284545872,
      "step": 16885
    },
    {
      "epoch": 1.791427965202631,
      "grad_norm": 0.3708166333062195,
      "learning_rate": 4.732755039779067e-05,
      "loss": 1.7484,
      "num_input_tokens_seen": 13285332624,
      "step": 16886
    },
    {
      "epoch": 1.7915340547422023,
      "grad_norm": 0.38589902482517374,
      "learning_rate": 4.732723775453024e-05,
      "loss": 1.8188,
      "num_input_tokens_seen": 13286119296,
      "step": 16887
    },
    {
      "epoch": 1.7916401442817738,
      "grad_norm": 0.3423515852410308,
      "learning_rate": 4.7326925094015986e-05,
      "loss": 1.7556,
      "num_input_tokens_seen": 13286906048,
      "step": 16888
    },
    {
      "epoch": 1.7917462338213452,
      "grad_norm": 0.3754443728246138,
      "learning_rate": 4.732661241624813e-05,
      "loss": 1.7011,
      "num_input_tokens_seen": 13287692912,
      "step": 16889
    },
    {
      "epoch": 1.7918523233609167,
      "grad_norm": 0.4291906183856139,
      "learning_rate": 4.732629972122693e-05,
      "loss": 1.8059,
      "num_input_tokens_seen": 13288479712,
      "step": 16890
    },
    {
      "epoch": 1.791958412900488,
      "grad_norm": 0.37198777348337636,
      "learning_rate": 4.732598700895262e-05,
      "loss": 1.7317,
      "num_input_tokens_seen": 13289266432,
      "step": 16891
    },
    {
      "epoch": 1.7920645024400594,
      "grad_norm": 0.5218975964488388,
      "learning_rate": 4.732567427942544e-05,
      "loss": 1.7495,
      "num_input_tokens_seen": 13290053120,
      "step": 16892
    },
    {
      "epoch": 1.7921705919796307,
      "grad_norm": 0.42327311969224835,
      "learning_rate": 4.732536153264563e-05,
      "loss": 1.7213,
      "num_input_tokens_seen": 13290839872,
      "step": 16893
    },
    {
      "epoch": 1.7922766815192022,
      "grad_norm": 0.5773934411290534,
      "learning_rate": 4.732504876861345e-05,
      "loss": 1.6726,
      "num_input_tokens_seen": 13291626752,
      "step": 16894
    },
    {
      "epoch": 1.7923827710587736,
      "grad_norm": 0.3860853045299303,
      "learning_rate": 4.732473598732911e-05,
      "loss": 1.8324,
      "num_input_tokens_seen": 13292413488,
      "step": 16895
    },
    {
      "epoch": 1.7924888605983451,
      "grad_norm": 0.5296308135787166,
      "learning_rate": 4.7324423188792876e-05,
      "loss": 1.6867,
      "num_input_tokens_seen": 13293200288,
      "step": 16896
    },
    {
      "epoch": 1.7925949501379164,
      "grad_norm": 0.4332809409223241,
      "learning_rate": 4.732411037300498e-05,
      "loss": 1.6968,
      "num_input_tokens_seen": 13293987040,
      "step": 16897
    },
    {
      "epoch": 1.7927010396774878,
      "grad_norm": 0.4284498638267377,
      "learning_rate": 4.7323797539965676e-05,
      "loss": 1.6967,
      "num_input_tokens_seen": 13294773872,
      "step": 16898
    },
    {
      "epoch": 1.792807129217059,
      "grad_norm": 0.4281172466831629,
      "learning_rate": 4.732348468967519e-05,
      "loss": 1.8596,
      "num_input_tokens_seen": 13295560512,
      "step": 16899
    },
    {
      "epoch": 1.7929132187566306,
      "grad_norm": 0.3627585204303111,
      "learning_rate": 4.732317182213377e-05,
      "loss": 1.7825,
      "num_input_tokens_seen": 13296347280,
      "step": 16900
    },
    {
      "epoch": 1.793019308296202,
      "grad_norm": 0.43548413735147823,
      "learning_rate": 4.7322858937341654e-05,
      "loss": 1.6611,
      "num_input_tokens_seen": 13297134144,
      "step": 16901
    },
    {
      "epoch": 1.7931253978357735,
      "grad_norm": 0.6152352001982464,
      "learning_rate": 4.7322546035299094e-05,
      "loss": 1.7221,
      "num_input_tokens_seen": 13297920960,
      "step": 16902
    },
    {
      "epoch": 1.7932314873753448,
      "grad_norm": 0.39194437084486367,
      "learning_rate": 4.732223311600632e-05,
      "loss": 1.6634,
      "num_input_tokens_seen": 13298707760,
      "step": 16903
    },
    {
      "epoch": 1.7933375769149162,
      "grad_norm": 0.3443748399438858,
      "learning_rate": 4.732192017946359e-05,
      "loss": 1.7443,
      "num_input_tokens_seen": 13299494496,
      "step": 16904
    },
    {
      "epoch": 1.7934436664544875,
      "grad_norm": 0.45575599776161624,
      "learning_rate": 4.732160722567112e-05,
      "loss": 1.8666,
      "num_input_tokens_seen": 13300281184,
      "step": 16905
    },
    {
      "epoch": 1.793549755994059,
      "grad_norm": 0.35304808626079764,
      "learning_rate": 4.732129425462918e-05,
      "loss": 1.6272,
      "num_input_tokens_seen": 13301067888,
      "step": 16906
    },
    {
      "epoch": 1.7936558455336304,
      "grad_norm": 0.39389439099150075,
      "learning_rate": 4.732098126633799e-05,
      "loss": 1.6868,
      "num_input_tokens_seen": 13301854672,
      "step": 16907
    },
    {
      "epoch": 1.793761935073202,
      "grad_norm": 0.40788919459166234,
      "learning_rate": 4.73206682607978e-05,
      "loss": 1.6574,
      "num_input_tokens_seen": 13302641472,
      "step": 16908
    },
    {
      "epoch": 1.7938680246127732,
      "grad_norm": 0.5060681351075249,
      "learning_rate": 4.732035523800886e-05,
      "loss": 1.7792,
      "num_input_tokens_seen": 13303428256,
      "step": 16909
    },
    {
      "epoch": 1.7939741141523444,
      "grad_norm": 0.41076108551913226,
      "learning_rate": 4.7320042197971396e-05,
      "loss": 1.6941,
      "num_input_tokens_seen": 13304215008,
      "step": 16910
    },
    {
      "epoch": 1.794080203691916,
      "grad_norm": 0.5033501272783403,
      "learning_rate": 4.731972914068567e-05,
      "loss": 1.7501,
      "num_input_tokens_seen": 13305001856,
      "step": 16911
    },
    {
      "epoch": 1.7941862932314874,
      "grad_norm": 0.45452418201027867,
      "learning_rate": 4.73194160661519e-05,
      "loss": 1.7029,
      "num_input_tokens_seen": 13305788576,
      "step": 16912
    },
    {
      "epoch": 1.7942923827710588,
      "grad_norm": 0.3352598881696555,
      "learning_rate": 4.731910297437034e-05,
      "loss": 1.6943,
      "num_input_tokens_seen": 13306575328,
      "step": 16913
    },
    {
      "epoch": 1.7943984723106303,
      "grad_norm": 0.4420707203251295,
      "learning_rate": 4.731878986534124e-05,
      "loss": 1.7057,
      "num_input_tokens_seen": 13307362144,
      "step": 16914
    },
    {
      "epoch": 1.7945045618502016,
      "grad_norm": 0.3484114806501052,
      "learning_rate": 4.7318476739064834e-05,
      "loss": 1.6742,
      "num_input_tokens_seen": 13308148880,
      "step": 16915
    },
    {
      "epoch": 1.7946106513897728,
      "grad_norm": 0.37747215101866743,
      "learning_rate": 4.731816359554136e-05,
      "loss": 1.9109,
      "num_input_tokens_seen": 13308935648,
      "step": 16916
    },
    {
      "epoch": 1.7947167409293443,
      "grad_norm": 0.5169907228011932,
      "learning_rate": 4.731785043477107e-05,
      "loss": 1.6867,
      "num_input_tokens_seen": 13309722400,
      "step": 16917
    },
    {
      "epoch": 1.7948228304689158,
      "grad_norm": 0.36778782785607395,
      "learning_rate": 4.731753725675419e-05,
      "loss": 1.7303,
      "num_input_tokens_seen": 13310509152,
      "step": 16918
    },
    {
      "epoch": 1.7949289200084872,
      "grad_norm": 0.3359608312495934,
      "learning_rate": 4.731722406149098e-05,
      "loss": 1.7408,
      "num_input_tokens_seen": 13311295936,
      "step": 16919
    },
    {
      "epoch": 1.7950350095480587,
      "grad_norm": 0.3446723870918665,
      "learning_rate": 4.731691084898167e-05,
      "loss": 1.7068,
      "num_input_tokens_seen": 13312082752,
      "step": 16920
    },
    {
      "epoch": 1.79514109908763,
      "grad_norm": 0.4129237861353496,
      "learning_rate": 4.731659761922651e-05,
      "loss": 1.7339,
      "num_input_tokens_seen": 13312869488,
      "step": 16921
    },
    {
      "epoch": 1.7952471886272012,
      "grad_norm": 0.3424272415146359,
      "learning_rate": 4.731628437222573e-05,
      "loss": 1.6171,
      "num_input_tokens_seen": 13313656304,
      "step": 16922
    },
    {
      "epoch": 1.7953532781667727,
      "grad_norm": 0.3513299788097502,
      "learning_rate": 4.731597110797959e-05,
      "loss": 1.6286,
      "num_input_tokens_seen": 13314443088,
      "step": 16923
    },
    {
      "epoch": 1.7954593677063442,
      "grad_norm": 0.47629957305203185,
      "learning_rate": 4.731565782648832e-05,
      "loss": 1.6746,
      "num_input_tokens_seen": 13315229776,
      "step": 16924
    },
    {
      "epoch": 1.7955654572459157,
      "grad_norm": 0.384828663557848,
      "learning_rate": 4.7315344527752156e-05,
      "loss": 1.6209,
      "num_input_tokens_seen": 13316016576,
      "step": 16925
    },
    {
      "epoch": 1.795671546785487,
      "grad_norm": 0.6697679182869135,
      "learning_rate": 4.731503121177136e-05,
      "loss": 1.8466,
      "num_input_tokens_seen": 13316803264,
      "step": 16926
    },
    {
      "epoch": 1.7957776363250584,
      "grad_norm": 0.39498688324864495,
      "learning_rate": 4.7314717878546153e-05,
      "loss": 1.6289,
      "num_input_tokens_seen": 13317590048,
      "step": 16927
    },
    {
      "epoch": 1.7958837258646296,
      "grad_norm": 0.4399022587024325,
      "learning_rate": 4.7314404528076795e-05,
      "loss": 1.7124,
      "num_input_tokens_seen": 13318376848,
      "step": 16928
    },
    {
      "epoch": 1.795989815404201,
      "grad_norm": 0.523668483479574,
      "learning_rate": 4.7314091160363513e-05,
      "loss": 1.7321,
      "num_input_tokens_seen": 13319163552,
      "step": 16929
    },
    {
      "epoch": 1.7960959049437726,
      "grad_norm": 0.34539077692065956,
      "learning_rate": 4.7313777775406565e-05,
      "loss": 1.738,
      "num_input_tokens_seen": 13319950400,
      "step": 16930
    },
    {
      "epoch": 1.796201994483344,
      "grad_norm": 0.41320438059767534,
      "learning_rate": 4.7313464373206174e-05,
      "loss": 1.7033,
      "num_input_tokens_seen": 13320737168,
      "step": 16931
    },
    {
      "epoch": 1.7963080840229153,
      "grad_norm": 0.4706370540177914,
      "learning_rate": 4.73131509537626e-05,
      "loss": 1.6841,
      "num_input_tokens_seen": 13321523888,
      "step": 16932
    },
    {
      "epoch": 1.7964141735624868,
      "grad_norm": 0.45405379596299267,
      "learning_rate": 4.7312837517076074e-05,
      "loss": 1.7587,
      "num_input_tokens_seen": 13322310608,
      "step": 16933
    },
    {
      "epoch": 1.796520263102058,
      "grad_norm": 0.470205078170271,
      "learning_rate": 4.7312524063146845e-05,
      "loss": 1.7369,
      "num_input_tokens_seen": 13323097456,
      "step": 16934
    },
    {
      "epoch": 1.7966263526416295,
      "grad_norm": 0.393662617218239,
      "learning_rate": 4.731221059197515e-05,
      "loss": 1.7621,
      "num_input_tokens_seen": 13323884240,
      "step": 16935
    },
    {
      "epoch": 1.796732442181201,
      "grad_norm": 0.5269858115245475,
      "learning_rate": 4.731189710356123e-05,
      "loss": 1.8085,
      "num_input_tokens_seen": 13324670992,
      "step": 16936
    },
    {
      "epoch": 1.7968385317207725,
      "grad_norm": 0.3615825125049846,
      "learning_rate": 4.731158359790534e-05,
      "loss": 1.7171,
      "num_input_tokens_seen": 13325457776,
      "step": 16937
    },
    {
      "epoch": 1.7969446212603437,
      "grad_norm": 0.5041352402819935,
      "learning_rate": 4.73112700750077e-05,
      "loss": 1.712,
      "num_input_tokens_seen": 13326244496,
      "step": 16938
    },
    {
      "epoch": 1.797050710799915,
      "grad_norm": 0.42369175113339747,
      "learning_rate": 4.731095653486858e-05,
      "loss": 1.6395,
      "num_input_tokens_seen": 13327031296,
      "step": 16939
    },
    {
      "epoch": 1.7971568003394864,
      "grad_norm": 0.4545100673463399,
      "learning_rate": 4.7310642977488194e-05,
      "loss": 1.716,
      "num_input_tokens_seen": 13327818080,
      "step": 16940
    },
    {
      "epoch": 1.797262889879058,
      "grad_norm": 0.3551070362702475,
      "learning_rate": 4.7310329402866806e-05,
      "loss": 1.7081,
      "num_input_tokens_seen": 13328604816,
      "step": 16941
    },
    {
      "epoch": 1.7973689794186294,
      "grad_norm": 0.3902144915182538,
      "learning_rate": 4.7310015811004645e-05,
      "loss": 1.7034,
      "num_input_tokens_seen": 13329391552,
      "step": 16942
    },
    {
      "epoch": 1.7974750689582009,
      "grad_norm": 0.4427334176618321,
      "learning_rate": 4.730970220190196e-05,
      "loss": 1.8372,
      "num_input_tokens_seen": 13330178288,
      "step": 16943
    },
    {
      "epoch": 1.7975811584977721,
      "grad_norm": 0.3487128088769001,
      "learning_rate": 4.730938857555899e-05,
      "loss": 1.6634,
      "num_input_tokens_seen": 13330965056,
      "step": 16944
    },
    {
      "epoch": 1.7976872480373434,
      "grad_norm": 0.4498609649136507,
      "learning_rate": 4.7309074931975986e-05,
      "loss": 1.7144,
      "num_input_tokens_seen": 13331751840,
      "step": 16945
    },
    {
      "epoch": 1.7977933375769148,
      "grad_norm": 0.3777954818687292,
      "learning_rate": 4.730876127115318e-05,
      "loss": 1.7674,
      "num_input_tokens_seen": 13332538592,
      "step": 16946
    },
    {
      "epoch": 1.7978994271164863,
      "grad_norm": 0.3969780409237063,
      "learning_rate": 4.730844759309081e-05,
      "loss": 1.6324,
      "num_input_tokens_seen": 13333325248,
      "step": 16947
    },
    {
      "epoch": 1.7980055166560578,
      "grad_norm": 0.4193627722809291,
      "learning_rate": 4.730813389778914e-05,
      "loss": 1.8312,
      "num_input_tokens_seen": 13334112064,
      "step": 16948
    },
    {
      "epoch": 1.7981116061956293,
      "grad_norm": 0.36941499416701185,
      "learning_rate": 4.7307820185248385e-05,
      "loss": 1.6676,
      "num_input_tokens_seen": 13334898880,
      "step": 16949
    },
    {
      "epoch": 1.7982176957352005,
      "grad_norm": 0.4874722600360801,
      "learning_rate": 4.730750645546881e-05,
      "loss": 1.7054,
      "num_input_tokens_seen": 13335685600,
      "step": 16950
    },
    {
      "epoch": 1.7983237852747718,
      "grad_norm": 0.35411029166286306,
      "learning_rate": 4.7307192708450644e-05,
      "loss": 1.6502,
      "num_input_tokens_seen": 13336472368,
      "step": 16951
    },
    {
      "epoch": 1.7984298748143432,
      "grad_norm": 0.3611584908520657,
      "learning_rate": 4.730687894419414e-05,
      "loss": 1.7465,
      "num_input_tokens_seen": 13337259152,
      "step": 16952
    },
    {
      "epoch": 1.7985359643539147,
      "grad_norm": 0.5341120710535786,
      "learning_rate": 4.730656516269953e-05,
      "loss": 1.7292,
      "num_input_tokens_seen": 13338045904,
      "step": 16953
    },
    {
      "epoch": 1.7986420538934862,
      "grad_norm": 0.3916926943839061,
      "learning_rate": 4.730625136396706e-05,
      "loss": 1.6845,
      "num_input_tokens_seen": 13338832624,
      "step": 16954
    },
    {
      "epoch": 1.7987481434330577,
      "grad_norm": 0.48316505056817455,
      "learning_rate": 4.7305937547996976e-05,
      "loss": 1.6829,
      "num_input_tokens_seen": 13339619440,
      "step": 16955
    },
    {
      "epoch": 1.798854232972629,
      "grad_norm": 0.5929365175312629,
      "learning_rate": 4.7305623714789514e-05,
      "loss": 1.6651,
      "num_input_tokens_seen": 13340406240,
      "step": 16956
    },
    {
      "epoch": 1.7989603225122002,
      "grad_norm": 0.5737105970834256,
      "learning_rate": 4.7305309864344926e-05,
      "loss": 1.6617,
      "num_input_tokens_seen": 13341193056,
      "step": 16957
    },
    {
      "epoch": 1.7990664120517716,
      "grad_norm": 0.5288466884537785,
      "learning_rate": 4.730499599666345e-05,
      "loss": 1.6523,
      "num_input_tokens_seen": 13341979808,
      "step": 16958
    },
    {
      "epoch": 1.7991725015913431,
      "grad_norm": 0.4936542937479752,
      "learning_rate": 4.730468211174532e-05,
      "loss": 1.7255,
      "num_input_tokens_seen": 13342766544,
      "step": 16959
    },
    {
      "epoch": 1.7992785911309146,
      "grad_norm": 0.3749556730815055,
      "learning_rate": 4.730436820959079e-05,
      "loss": 1.7088,
      "num_input_tokens_seen": 13343553200,
      "step": 16960
    },
    {
      "epoch": 1.7993846806704858,
      "grad_norm": 0.5468252303235168,
      "learning_rate": 4.73040542902001e-05,
      "loss": 1.8062,
      "num_input_tokens_seen": 13344340080,
      "step": 16961
    },
    {
      "epoch": 1.7994907702100573,
      "grad_norm": 0.365641574570093,
      "learning_rate": 4.730374035357349e-05,
      "loss": 1.7776,
      "num_input_tokens_seen": 13345126864,
      "step": 16962
    },
    {
      "epoch": 1.7995968597496286,
      "grad_norm": 0.4603472107034862,
      "learning_rate": 4.7303426399711205e-05,
      "loss": 1.7427,
      "num_input_tokens_seen": 13345913648,
      "step": 16963
    },
    {
      "epoch": 1.7997029492892,
      "grad_norm": 0.39914819047857575,
      "learning_rate": 4.730311242861348e-05,
      "loss": 1.7122,
      "num_input_tokens_seen": 13346700416,
      "step": 16964
    },
    {
      "epoch": 1.7998090388287715,
      "grad_norm": 0.33776256091514345,
      "learning_rate": 4.7302798440280575e-05,
      "loss": 1.6616,
      "num_input_tokens_seen": 13347487168,
      "step": 16965
    },
    {
      "epoch": 1.799915128368343,
      "grad_norm": 0.5331735048272418,
      "learning_rate": 4.730248443471272e-05,
      "loss": 1.7491,
      "num_input_tokens_seen": 13348273952,
      "step": 16966
    },
    {
      "epoch": 1.8000212179079143,
      "grad_norm": 0.3675000004830113,
      "learning_rate": 4.730217041191015e-05,
      "loss": 1.7401,
      "num_input_tokens_seen": 13349060752,
      "step": 16967
    },
    {
      "epoch": 1.8001273074474857,
      "grad_norm": 0.3519505523419965,
      "learning_rate": 4.730185637187313e-05,
      "loss": 1.7256,
      "num_input_tokens_seen": 13349847520,
      "step": 16968
    },
    {
      "epoch": 1.800233396987057,
      "grad_norm": 0.37934791863106043,
      "learning_rate": 4.7301542314601876e-05,
      "loss": 1.7219,
      "num_input_tokens_seen": 13350634224,
      "step": 16969
    },
    {
      "epoch": 1.8003394865266285,
      "grad_norm": 0.45405717589159966,
      "learning_rate": 4.730122824009665e-05,
      "loss": 1.6115,
      "num_input_tokens_seen": 13351421040,
      "step": 16970
    },
    {
      "epoch": 1.8004455760662,
      "grad_norm": 0.3558886307026009,
      "learning_rate": 4.73009141483577e-05,
      "loss": 1.6711,
      "num_input_tokens_seen": 13352207760,
      "step": 16971
    },
    {
      "epoch": 1.8005516656057714,
      "grad_norm": 0.35798933539277505,
      "learning_rate": 4.730060003938524e-05,
      "loss": 1.7353,
      "num_input_tokens_seen": 13352994512,
      "step": 16972
    },
    {
      "epoch": 1.8006577551453427,
      "grad_norm": 0.5287649905269208,
      "learning_rate": 4.730028591317954e-05,
      "loss": 1.8583,
      "num_input_tokens_seen": 13353781168,
      "step": 16973
    },
    {
      "epoch": 1.800763844684914,
      "grad_norm": 0.3343429862981484,
      "learning_rate": 4.729997176974084e-05,
      "loss": 1.768,
      "num_input_tokens_seen": 13354567840,
      "step": 16974
    },
    {
      "epoch": 1.8008699342244854,
      "grad_norm": 0.41922728730676656,
      "learning_rate": 4.729965760906936e-05,
      "loss": 1.7542,
      "num_input_tokens_seen": 13355354544,
      "step": 16975
    },
    {
      "epoch": 1.8009760237640569,
      "grad_norm": 0.3747643003012791,
      "learning_rate": 4.7299343431165365e-05,
      "loss": 1.7304,
      "num_input_tokens_seen": 13356141392,
      "step": 16976
    },
    {
      "epoch": 1.8010821133036283,
      "grad_norm": 0.38877248863266267,
      "learning_rate": 4.72990292360291e-05,
      "loss": 1.7093,
      "num_input_tokens_seen": 13356928240,
      "step": 16977
    },
    {
      "epoch": 1.8011882028431998,
      "grad_norm": 0.5417863297712843,
      "learning_rate": 4.729871502366079e-05,
      "loss": 1.7988,
      "num_input_tokens_seen": 13357714992,
      "step": 16978
    },
    {
      "epoch": 1.801294292382771,
      "grad_norm": 0.3837840271961912,
      "learning_rate": 4.7298400794060694e-05,
      "loss": 1.842,
      "num_input_tokens_seen": 13358501712,
      "step": 16979
    },
    {
      "epoch": 1.8014003819223423,
      "grad_norm": 0.40527200938528257,
      "learning_rate": 4.7298086547229046e-05,
      "loss": 1.7261,
      "num_input_tokens_seen": 13359288384,
      "step": 16980
    },
    {
      "epoch": 1.8015064714619138,
      "grad_norm": 0.364054445693116,
      "learning_rate": 4.7297772283166085e-05,
      "loss": 1.8268,
      "num_input_tokens_seen": 13360075056,
      "step": 16981
    },
    {
      "epoch": 1.8016125610014853,
      "grad_norm": 0.3911241121758334,
      "learning_rate": 4.729745800187207e-05,
      "loss": 1.8439,
      "num_input_tokens_seen": 13360861760,
      "step": 16982
    },
    {
      "epoch": 1.8017186505410567,
      "grad_norm": 0.35813809208314124,
      "learning_rate": 4.729714370334723e-05,
      "loss": 1.6977,
      "num_input_tokens_seen": 13361648528,
      "step": 16983
    },
    {
      "epoch": 1.8018247400806282,
      "grad_norm": 0.38124989535641757,
      "learning_rate": 4.7296829387591804e-05,
      "loss": 1.591,
      "num_input_tokens_seen": 13362435344,
      "step": 16984
    },
    {
      "epoch": 1.8019308296201995,
      "grad_norm": 0.3945862876156493,
      "learning_rate": 4.729651505460605e-05,
      "loss": 1.7299,
      "num_input_tokens_seen": 13363222080,
      "step": 16985
    },
    {
      "epoch": 1.8020369191597707,
      "grad_norm": 0.3793160910585379,
      "learning_rate": 4.72962007043902e-05,
      "loss": 1.7913,
      "num_input_tokens_seen": 13364008752,
      "step": 16986
    },
    {
      "epoch": 1.8021430086993422,
      "grad_norm": 0.39397187592247446,
      "learning_rate": 4.7295886336944506e-05,
      "loss": 1.574,
      "num_input_tokens_seen": 13364795568,
      "step": 16987
    },
    {
      "epoch": 1.8022490982389137,
      "grad_norm": 0.38663034221793535,
      "learning_rate": 4.7295571952269204e-05,
      "loss": 1.7021,
      "num_input_tokens_seen": 13365582304,
      "step": 16988
    },
    {
      "epoch": 1.8023551877784851,
      "grad_norm": 0.3596755952778528,
      "learning_rate": 4.729525755036453e-05,
      "loss": 1.7406,
      "num_input_tokens_seen": 13366369072,
      "step": 16989
    },
    {
      "epoch": 1.8024612773180564,
      "grad_norm": 0.375424581371323,
      "learning_rate": 4.7294943131230744e-05,
      "loss": 1.6209,
      "num_input_tokens_seen": 13367155904,
      "step": 16990
    },
    {
      "epoch": 1.8025673668576279,
      "grad_norm": 0.5176333497630901,
      "learning_rate": 4.729462869486808e-05,
      "loss": 1.7312,
      "num_input_tokens_seen": 13367942624,
      "step": 16991
    },
    {
      "epoch": 1.8026734563971991,
      "grad_norm": 0.5328975534366442,
      "learning_rate": 4.7294314241276776e-05,
      "loss": 1.8536,
      "num_input_tokens_seen": 13368729312,
      "step": 16992
    },
    {
      "epoch": 1.8027795459367706,
      "grad_norm": 0.3724046621335422,
      "learning_rate": 4.729399977045708e-05,
      "loss": 1.6767,
      "num_input_tokens_seen": 13369516112,
      "step": 16993
    },
    {
      "epoch": 1.802885635476342,
      "grad_norm": 0.46864187632901144,
      "learning_rate": 4.729368528240924e-05,
      "loss": 1.7809,
      "num_input_tokens_seen": 13370302864,
      "step": 16994
    },
    {
      "epoch": 1.8029917250159135,
      "grad_norm": 0.4271966944527428,
      "learning_rate": 4.729337077713349e-05,
      "loss": 1.6952,
      "num_input_tokens_seen": 13371089712,
      "step": 16995
    },
    {
      "epoch": 1.8030978145554848,
      "grad_norm": 0.3838381426226345,
      "learning_rate": 4.729305625463008e-05,
      "loss": 1.6831,
      "num_input_tokens_seen": 13371876368,
      "step": 16996
    },
    {
      "epoch": 1.8032039040950563,
      "grad_norm": 0.43250339552739403,
      "learning_rate": 4.7292741714899244e-05,
      "loss": 1.7376,
      "num_input_tokens_seen": 13372663120,
      "step": 16997
    },
    {
      "epoch": 1.8033099936346275,
      "grad_norm": 0.3658924445519784,
      "learning_rate": 4.729242715794124e-05,
      "loss": 1.5917,
      "num_input_tokens_seen": 13373449888,
      "step": 16998
    },
    {
      "epoch": 1.803416083174199,
      "grad_norm": 0.3120231057885995,
      "learning_rate": 4.7292112583756297e-05,
      "loss": 1.6999,
      "num_input_tokens_seen": 13374236560,
      "step": 16999
    },
    {
      "epoch": 1.8035221727137705,
      "grad_norm": 0.40638917551954695,
      "learning_rate": 4.729179799234467e-05,
      "loss": 1.6958,
      "num_input_tokens_seen": 13375023328,
      "step": 17000
    },
    {
      "epoch": 1.8035221727137705,
      "eval_loss": 1.7306379079818726,
      "eval_runtime": 64.8405,
      "eval_samples_per_second": 46.267,
      "eval_steps_per_second": 0.494,
      "num_input_tokens_seen": 13375023328,
      "step": 17000
    },
    {
      "epoch": 1.803628262253342,
      "grad_norm": 0.3629360065060901,
      "learning_rate": 4.729148338370659e-05,
      "loss": 1.7038,
      "num_input_tokens_seen": 13375810080,
      "step": 17001
    },
    {
      "epoch": 1.8037343517929132,
      "grad_norm": 0.5046382131053284,
      "learning_rate": 4.729116875784231e-05,
      "loss": 1.6876,
      "num_input_tokens_seen": 13376596848,
      "step": 17002
    },
    {
      "epoch": 1.8038404413324847,
      "grad_norm": 0.3430922310823386,
      "learning_rate": 4.729085411475206e-05,
      "loss": 1.8466,
      "num_input_tokens_seen": 13377383632,
      "step": 17003
    },
    {
      "epoch": 1.803946530872056,
      "grad_norm": 0.488604939753322,
      "learning_rate": 4.72905394544361e-05,
      "loss": 1.656,
      "num_input_tokens_seen": 13378170320,
      "step": 17004
    },
    {
      "epoch": 1.8040526204116274,
      "grad_norm": 0.3933086901611219,
      "learning_rate": 4.729022477689466e-05,
      "loss": 1.687,
      "num_input_tokens_seen": 13378957168,
      "step": 17005
    },
    {
      "epoch": 1.8041587099511989,
      "grad_norm": 0.6217837307251542,
      "learning_rate": 4.728991008212799e-05,
      "loss": 1.7676,
      "num_input_tokens_seen": 13379743872,
      "step": 17006
    },
    {
      "epoch": 1.8042647994907703,
      "grad_norm": 0.34906141446144223,
      "learning_rate": 4.728959537013633e-05,
      "loss": 1.6821,
      "num_input_tokens_seen": 13380530672,
      "step": 17007
    },
    {
      "epoch": 1.8043708890303416,
      "grad_norm": 0.47835540909510577,
      "learning_rate": 4.728928064091993e-05,
      "loss": 1.7302,
      "num_input_tokens_seen": 13381317392,
      "step": 17008
    },
    {
      "epoch": 1.8044769785699128,
      "grad_norm": 0.3805981211628623,
      "learning_rate": 4.728896589447903e-05,
      "loss": 1.637,
      "num_input_tokens_seen": 13382104208,
      "step": 17009
    },
    {
      "epoch": 1.8045830681094843,
      "grad_norm": 0.5477806101302317,
      "learning_rate": 4.7288651130813864e-05,
      "loss": 1.7052,
      "num_input_tokens_seen": 13382891040,
      "step": 17010
    },
    {
      "epoch": 1.8046891576490558,
      "grad_norm": 0.3414064158018728,
      "learning_rate": 4.728833634992468e-05,
      "loss": 1.6489,
      "num_input_tokens_seen": 13383677872,
      "step": 17011
    },
    {
      "epoch": 1.8047952471886273,
      "grad_norm": 0.42108915508850614,
      "learning_rate": 4.728802155181173e-05,
      "loss": 1.7295,
      "num_input_tokens_seen": 13384464592,
      "step": 17012
    },
    {
      "epoch": 1.8049013367281987,
      "grad_norm": 0.37645489484603284,
      "learning_rate": 4.728770673647525e-05,
      "loss": 1.646,
      "num_input_tokens_seen": 13385251344,
      "step": 17013
    },
    {
      "epoch": 1.80500742626777,
      "grad_norm": 0.31259174672814266,
      "learning_rate": 4.728739190391548e-05,
      "loss": 1.6884,
      "num_input_tokens_seen": 13386038144,
      "step": 17014
    },
    {
      "epoch": 1.8051135158073413,
      "grad_norm": 0.40866937612990856,
      "learning_rate": 4.728707705413267e-05,
      "loss": 1.6983,
      "num_input_tokens_seen": 13386824912,
      "step": 17015
    },
    {
      "epoch": 1.8052196053469127,
      "grad_norm": 0.4264152056806497,
      "learning_rate": 4.7286762187127066e-05,
      "loss": 1.8165,
      "num_input_tokens_seen": 13387611616,
      "step": 17016
    },
    {
      "epoch": 1.8053256948864842,
      "grad_norm": 0.3255747515474351,
      "learning_rate": 4.72864473028989e-05,
      "loss": 1.7275,
      "num_input_tokens_seen": 13388398384,
      "step": 17017
    },
    {
      "epoch": 1.8054317844260557,
      "grad_norm": 0.34929587007767005,
      "learning_rate": 4.728613240144842e-05,
      "loss": 1.7054,
      "num_input_tokens_seen": 13389185184,
      "step": 17018
    },
    {
      "epoch": 1.8055378739656271,
      "grad_norm": 0.39881909739886967,
      "learning_rate": 4.7285817482775875e-05,
      "loss": 1.7403,
      "num_input_tokens_seen": 13389971984,
      "step": 17019
    },
    {
      "epoch": 1.8056439635051984,
      "grad_norm": 0.40261287140892094,
      "learning_rate": 4.72855025468815e-05,
      "loss": 1.6662,
      "num_input_tokens_seen": 13390758816,
      "step": 17020
    },
    {
      "epoch": 1.8057500530447697,
      "grad_norm": 0.33545101183117493,
      "learning_rate": 4.728518759376555e-05,
      "loss": 1.7376,
      "num_input_tokens_seen": 13391545504,
      "step": 17021
    },
    {
      "epoch": 1.8058561425843411,
      "grad_norm": 0.3781889454301055,
      "learning_rate": 4.728487262342826e-05,
      "loss": 1.61,
      "num_input_tokens_seen": 13392332304,
      "step": 17022
    },
    {
      "epoch": 1.8059622321239126,
      "grad_norm": 0.3067018520900193,
      "learning_rate": 4.728455763586986e-05,
      "loss": 1.588,
      "num_input_tokens_seen": 13393119056,
      "step": 17023
    },
    {
      "epoch": 1.806068321663484,
      "grad_norm": 0.38397669201905993,
      "learning_rate": 4.7284242631090624e-05,
      "loss": 1.906,
      "num_input_tokens_seen": 13393905840,
      "step": 17024
    },
    {
      "epoch": 1.8061744112030553,
      "grad_norm": 0.35557441588244415,
      "learning_rate": 4.728392760909077e-05,
      "loss": 1.7269,
      "num_input_tokens_seen": 13394692624,
      "step": 17025
    },
    {
      "epoch": 1.8062805007426268,
      "grad_norm": 0.37325800750141275,
      "learning_rate": 4.728361256987056e-05,
      "loss": 1.6928,
      "num_input_tokens_seen": 13395479392,
      "step": 17026
    },
    {
      "epoch": 1.806386590282198,
      "grad_norm": 0.3740361939774707,
      "learning_rate": 4.728329751343023e-05,
      "loss": 1.5337,
      "num_input_tokens_seen": 13396266096,
      "step": 17027
    },
    {
      "epoch": 1.8064926798217695,
      "grad_norm": 0.38434010148032455,
      "learning_rate": 4.7282982439770004e-05,
      "loss": 1.843,
      "num_input_tokens_seen": 13397052864,
      "step": 17028
    },
    {
      "epoch": 1.806598769361341,
      "grad_norm": 0.35471361155721126,
      "learning_rate": 4.728266734889015e-05,
      "loss": 1.6549,
      "num_input_tokens_seen": 13397839632,
      "step": 17029
    },
    {
      "epoch": 1.8067048589009125,
      "grad_norm": 0.3869612614284439,
      "learning_rate": 4.728235224079091e-05,
      "loss": 1.6383,
      "num_input_tokens_seen": 13398626464,
      "step": 17030
    },
    {
      "epoch": 1.8068109484404837,
      "grad_norm": 0.3568736605519991,
      "learning_rate": 4.728203711547252e-05,
      "loss": 1.6879,
      "num_input_tokens_seen": 13399413248,
      "step": 17031
    },
    {
      "epoch": 1.8069170379800552,
      "grad_norm": 0.3479403306741384,
      "learning_rate": 4.728172197293523e-05,
      "loss": 1.745,
      "num_input_tokens_seen": 13400200000,
      "step": 17032
    },
    {
      "epoch": 1.8070231275196265,
      "grad_norm": 0.41914076911156634,
      "learning_rate": 4.728140681317928e-05,
      "loss": 1.8246,
      "num_input_tokens_seen": 13400986768,
      "step": 17033
    },
    {
      "epoch": 1.807129217059198,
      "grad_norm": 0.4734477910225101,
      "learning_rate": 4.72810916362049e-05,
      "loss": 1.8728,
      "num_input_tokens_seen": 13401773520,
      "step": 17034
    },
    {
      "epoch": 1.8072353065987694,
      "grad_norm": 0.3312791130610689,
      "learning_rate": 4.728077644201235e-05,
      "loss": 1.5341,
      "num_input_tokens_seen": 13402560320,
      "step": 17035
    },
    {
      "epoch": 1.8073413961383409,
      "grad_norm": 0.4847691869102723,
      "learning_rate": 4.728046123060187e-05,
      "loss": 1.8203,
      "num_input_tokens_seen": 13403347056,
      "step": 17036
    },
    {
      "epoch": 1.8074474856779121,
      "grad_norm": 0.3892166572138638,
      "learning_rate": 4.728014600197371e-05,
      "loss": 1.7021,
      "num_input_tokens_seen": 13404133856,
      "step": 17037
    },
    {
      "epoch": 1.8075535752174836,
      "grad_norm": 0.44470156437402325,
      "learning_rate": 4.72798307561281e-05,
      "loss": 1.721,
      "num_input_tokens_seen": 13404920528,
      "step": 17038
    },
    {
      "epoch": 1.8076596647570549,
      "grad_norm": 0.3465993570107585,
      "learning_rate": 4.727951549306529e-05,
      "loss": 1.675,
      "num_input_tokens_seen": 13405707328,
      "step": 17039
    },
    {
      "epoch": 1.8077657542966263,
      "grad_norm": 0.42149319268916774,
      "learning_rate": 4.727920021278553e-05,
      "loss": 1.7396,
      "num_input_tokens_seen": 13406494048,
      "step": 17040
    },
    {
      "epoch": 1.8078718438361978,
      "grad_norm": 0.32059840933986955,
      "learning_rate": 4.727888491528906e-05,
      "loss": 1.597,
      "num_input_tokens_seen": 13407280912,
      "step": 17041
    },
    {
      "epoch": 1.8079779333757693,
      "grad_norm": 0.38271794713411417,
      "learning_rate": 4.7278569600576114e-05,
      "loss": 1.8726,
      "num_input_tokens_seen": 13408067632,
      "step": 17042
    },
    {
      "epoch": 1.8080840229153405,
      "grad_norm": 0.4215263912952004,
      "learning_rate": 4.727825426864694e-05,
      "loss": 1.6697,
      "num_input_tokens_seen": 13408854432,
      "step": 17043
    },
    {
      "epoch": 1.8081901124549118,
      "grad_norm": 0.3529903918847758,
      "learning_rate": 4.7277938919501794e-05,
      "loss": 1.7903,
      "num_input_tokens_seen": 13409641152,
      "step": 17044
    },
    {
      "epoch": 1.8082962019944833,
      "grad_norm": 0.37401367917071277,
      "learning_rate": 4.7277623553140906e-05,
      "loss": 1.6213,
      "num_input_tokens_seen": 13410427888,
      "step": 17045
    },
    {
      "epoch": 1.8084022915340547,
      "grad_norm": 0.3606991249186043,
      "learning_rate": 4.727730816956453e-05,
      "loss": 1.7933,
      "num_input_tokens_seen": 13411214576,
      "step": 17046
    },
    {
      "epoch": 1.8085083810736262,
      "grad_norm": 0.39001349940813107,
      "learning_rate": 4.7276992768772896e-05,
      "loss": 1.6428,
      "num_input_tokens_seen": 13412001408,
      "step": 17047
    },
    {
      "epoch": 1.8086144706131977,
      "grad_norm": 0.3820793067600973,
      "learning_rate": 4.7276677350766255e-05,
      "loss": 1.6243,
      "num_input_tokens_seen": 13412788256,
      "step": 17048
    },
    {
      "epoch": 1.808720560152769,
      "grad_norm": 0.3857394623160744,
      "learning_rate": 4.7276361915544855e-05,
      "loss": 1.7443,
      "num_input_tokens_seen": 13413574992,
      "step": 17049
    },
    {
      "epoch": 1.8088266496923402,
      "grad_norm": 0.3524926850798219,
      "learning_rate": 4.727604646310893e-05,
      "loss": 1.7685,
      "num_input_tokens_seen": 13414361760,
      "step": 17050
    },
    {
      "epoch": 1.8089327392319117,
      "grad_norm": 0.39609090861714724,
      "learning_rate": 4.727573099345875e-05,
      "loss": 1.6755,
      "num_input_tokens_seen": 13415148624,
      "step": 17051
    },
    {
      "epoch": 1.8090388287714831,
      "grad_norm": 0.426364104748787,
      "learning_rate": 4.7275415506594514e-05,
      "loss": 1.7559,
      "num_input_tokens_seen": 13415935344,
      "step": 17052
    },
    {
      "epoch": 1.8091449183110546,
      "grad_norm": 0.3798151086292848,
      "learning_rate": 4.7275100002516505e-05,
      "loss": 1.7501,
      "num_input_tokens_seen": 13416722048,
      "step": 17053
    },
    {
      "epoch": 1.809251007850626,
      "grad_norm": 0.3738322551377536,
      "learning_rate": 4.727478448122495e-05,
      "loss": 1.6692,
      "num_input_tokens_seen": 13417508784,
      "step": 17054
    },
    {
      "epoch": 1.8093570973901973,
      "grad_norm": 0.3935918788371402,
      "learning_rate": 4.727446894272009e-05,
      "loss": 1.7565,
      "num_input_tokens_seen": 13418295472,
      "step": 17055
    },
    {
      "epoch": 1.8094631869297686,
      "grad_norm": 0.3884023297763211,
      "learning_rate": 4.727415338700218e-05,
      "loss": 1.806,
      "num_input_tokens_seen": 13419082272,
      "step": 17056
    },
    {
      "epoch": 1.80956927646934,
      "grad_norm": 0.4091336296663163,
      "learning_rate": 4.7273837814071455e-05,
      "loss": 1.7029,
      "num_input_tokens_seen": 13419868960,
      "step": 17057
    },
    {
      "epoch": 1.8096753660089115,
      "grad_norm": 0.3831406313749126,
      "learning_rate": 4.727352222392816e-05,
      "loss": 1.8429,
      "num_input_tokens_seen": 13420655712,
      "step": 17058
    },
    {
      "epoch": 1.809781455548483,
      "grad_norm": 0.4150863927283818,
      "learning_rate": 4.727320661657254e-05,
      "loss": 1.7433,
      "num_input_tokens_seen": 13421442560,
      "step": 17059
    },
    {
      "epoch": 1.8098875450880543,
      "grad_norm": 0.5584315074942384,
      "learning_rate": 4.727289099200485e-05,
      "loss": 1.7488,
      "num_input_tokens_seen": 13422229408,
      "step": 17060
    },
    {
      "epoch": 1.8099936346276257,
      "grad_norm": 0.888095572690794,
      "learning_rate": 4.727257535022531e-05,
      "loss": 1.7776,
      "num_input_tokens_seen": 13423016144,
      "step": 17061
    },
    {
      "epoch": 1.810099724167197,
      "grad_norm": 0.4149852250171308,
      "learning_rate": 4.7272259691234185e-05,
      "loss": 1.6386,
      "num_input_tokens_seen": 13423802864,
      "step": 17062
    },
    {
      "epoch": 1.8102058137067685,
      "grad_norm": 0.7569224240800668,
      "learning_rate": 4.727194401503171e-05,
      "loss": 1.7126,
      "num_input_tokens_seen": 13424589520,
      "step": 17063
    },
    {
      "epoch": 1.81031190324634,
      "grad_norm": 0.37482826425543075,
      "learning_rate": 4.7271628321618125e-05,
      "loss": 1.7086,
      "num_input_tokens_seen": 13425376320,
      "step": 17064
    },
    {
      "epoch": 1.8104179927859114,
      "grad_norm": 0.8130700389752933,
      "learning_rate": 4.727131261099369e-05,
      "loss": 1.8373,
      "num_input_tokens_seen": 13426163120,
      "step": 17065
    },
    {
      "epoch": 1.8105240823254827,
      "grad_norm": 0.4722818287265696,
      "learning_rate": 4.727099688315862e-05,
      "loss": 1.7492,
      "num_input_tokens_seen": 13426949856,
      "step": 17066
    },
    {
      "epoch": 1.8106301718650541,
      "grad_norm": 0.8327655838310377,
      "learning_rate": 4.727068113811319e-05,
      "loss": 1.8272,
      "num_input_tokens_seen": 13427736688,
      "step": 17067
    },
    {
      "epoch": 1.8107362614046254,
      "grad_norm": 0.4674889393045185,
      "learning_rate": 4.727036537585764e-05,
      "loss": 1.6794,
      "num_input_tokens_seen": 13428523504,
      "step": 17068
    },
    {
      "epoch": 1.8108423509441969,
      "grad_norm": 3.0865160880155154,
      "learning_rate": 4.727004959639219e-05,
      "loss": 1.7891,
      "num_input_tokens_seen": 13429310256,
      "step": 17069
    },
    {
      "epoch": 1.8109484404837684,
      "grad_norm": 0.5299285824426639,
      "learning_rate": 4.72697337997171e-05,
      "loss": 1.7128,
      "num_input_tokens_seen": 13430096976,
      "step": 17070
    },
    {
      "epoch": 1.8110545300233398,
      "grad_norm": 1.292445047779081,
      "learning_rate": 4.726941798583262e-05,
      "loss": 1.6873,
      "num_input_tokens_seen": 13430883712,
      "step": 17071
    },
    {
      "epoch": 1.811160619562911,
      "grad_norm": 0.47372386877640005,
      "learning_rate": 4.7269102154738984e-05,
      "loss": 1.753,
      "num_input_tokens_seen": 13431670576,
      "step": 17072
    },
    {
      "epoch": 1.8112667091024823,
      "grad_norm": 0.6159008879953175,
      "learning_rate": 4.726878630643644e-05,
      "loss": 1.5976,
      "num_input_tokens_seen": 13432457328,
      "step": 17073
    },
    {
      "epoch": 1.8113727986420538,
      "grad_norm": 0.7341552403598292,
      "learning_rate": 4.7268470440925224e-05,
      "loss": 1.8839,
      "num_input_tokens_seen": 13433244096,
      "step": 17074
    },
    {
      "epoch": 1.8114788881816253,
      "grad_norm": 0.3816885305543219,
      "learning_rate": 4.7268154558205605e-05,
      "loss": 1.6582,
      "num_input_tokens_seen": 13434030816,
      "step": 17075
    },
    {
      "epoch": 1.8115849777211968,
      "grad_norm": 0.7615318085059468,
      "learning_rate": 4.726783865827779e-05,
      "loss": 1.7732,
      "num_input_tokens_seen": 13434817488,
      "step": 17076
    },
    {
      "epoch": 1.8116910672607682,
      "grad_norm": 0.5430675000352349,
      "learning_rate": 4.726752274114205e-05,
      "loss": 1.7624,
      "num_input_tokens_seen": 13435604208,
      "step": 17077
    },
    {
      "epoch": 1.8117971568003395,
      "grad_norm": 0.37208995932739175,
      "learning_rate": 4.726720680679863e-05,
      "loss": 1.6529,
      "num_input_tokens_seen": 13436390992,
      "step": 17078
    },
    {
      "epoch": 1.8119032463399107,
      "grad_norm": 0.5165324957699844,
      "learning_rate": 4.7266890855247756e-05,
      "loss": 1.8015,
      "num_input_tokens_seen": 13437177664,
      "step": 17079
    },
    {
      "epoch": 1.8120093358794822,
      "grad_norm": 0.6606654918163708,
      "learning_rate": 4.726657488648969e-05,
      "loss": 1.7846,
      "num_input_tokens_seen": 13437964432,
      "step": 17080
    },
    {
      "epoch": 1.8121154254190537,
      "grad_norm": 0.4266674900294339,
      "learning_rate": 4.726625890052466e-05,
      "loss": 1.7246,
      "num_input_tokens_seen": 13438751184,
      "step": 17081
    },
    {
      "epoch": 1.8122215149586252,
      "grad_norm": 0.5166756277996878,
      "learning_rate": 4.7265942897352924e-05,
      "loss": 1.8364,
      "num_input_tokens_seen": 13439538016,
      "step": 17082
    },
    {
      "epoch": 1.8123276044981966,
      "grad_norm": 0.40428672459513304,
      "learning_rate": 4.7265626876974716e-05,
      "loss": 1.7507,
      "num_input_tokens_seen": 13440324816,
      "step": 17083
    },
    {
      "epoch": 1.8124336940377679,
      "grad_norm": 0.45157060476360283,
      "learning_rate": 4.726531083939029e-05,
      "loss": 1.6985,
      "num_input_tokens_seen": 13441111648,
      "step": 17084
    },
    {
      "epoch": 1.8125397835773391,
      "grad_norm": 0.35244636022124937,
      "learning_rate": 4.726499478459988e-05,
      "loss": 1.841,
      "num_input_tokens_seen": 13441898400,
      "step": 17085
    },
    {
      "epoch": 1.8126458731169106,
      "grad_norm": 0.44533587952034864,
      "learning_rate": 4.726467871260374e-05,
      "loss": 1.8055,
      "num_input_tokens_seen": 13442685168,
      "step": 17086
    },
    {
      "epoch": 1.812751962656482,
      "grad_norm": 0.4572641058172056,
      "learning_rate": 4.7264362623402104e-05,
      "loss": 1.8837,
      "num_input_tokens_seen": 13443471968,
      "step": 17087
    },
    {
      "epoch": 1.8128580521960536,
      "grad_norm": 0.3605869269080244,
      "learning_rate": 4.726404651699523e-05,
      "loss": 1.7966,
      "num_input_tokens_seen": 13444258752,
      "step": 17088
    },
    {
      "epoch": 1.8129641417356248,
      "grad_norm": 0.39295641182502994,
      "learning_rate": 4.7263730393383346e-05,
      "loss": 1.5971,
      "num_input_tokens_seen": 13445045520,
      "step": 17089
    },
    {
      "epoch": 1.8130702312751963,
      "grad_norm": 0.4646800752121921,
      "learning_rate": 4.726341425256671e-05,
      "loss": 1.8748,
      "num_input_tokens_seen": 13445832320,
      "step": 17090
    },
    {
      "epoch": 1.8131763208147675,
      "grad_norm": 0.442578688185102,
      "learning_rate": 4.726309809454555e-05,
      "loss": 1.8672,
      "num_input_tokens_seen": 13446619008,
      "step": 17091
    },
    {
      "epoch": 1.813282410354339,
      "grad_norm": 0.35596372842953306,
      "learning_rate": 4.7262781919320134e-05,
      "loss": 1.7509,
      "num_input_tokens_seen": 13447405760,
      "step": 17092
    },
    {
      "epoch": 1.8133884998939105,
      "grad_norm": 0.42850486165629614,
      "learning_rate": 4.726246572689069e-05,
      "loss": 1.7685,
      "num_input_tokens_seen": 13448192528,
      "step": 17093
    },
    {
      "epoch": 1.813494589433482,
      "grad_norm": 0.5396674492632874,
      "learning_rate": 4.7262149517257464e-05,
      "loss": 1.7844,
      "num_input_tokens_seen": 13448979312,
      "step": 17094
    },
    {
      "epoch": 1.8136006789730532,
      "grad_norm": 0.5708523333786718,
      "learning_rate": 4.72618332904207e-05,
      "loss": 1.7967,
      "num_input_tokens_seen": 13449766064,
      "step": 17095
    },
    {
      "epoch": 1.8137067685126247,
      "grad_norm": 0.37824582586134237,
      "learning_rate": 4.726151704638065e-05,
      "loss": 1.8467,
      "num_input_tokens_seen": 13450552864,
      "step": 17096
    },
    {
      "epoch": 1.813812858052196,
      "grad_norm": 0.3833365201449232,
      "learning_rate": 4.726120078513755e-05,
      "loss": 1.6823,
      "num_input_tokens_seen": 13451339696,
      "step": 17097
    },
    {
      "epoch": 1.8139189475917674,
      "grad_norm": 0.5393823845459343,
      "learning_rate": 4.726088450669165e-05,
      "loss": 1.882,
      "num_input_tokens_seen": 13452126400,
      "step": 17098
    },
    {
      "epoch": 1.814025037131339,
      "grad_norm": 0.43394841400874357,
      "learning_rate": 4.726056821104319e-05,
      "loss": 1.7787,
      "num_input_tokens_seen": 13452913152,
      "step": 17099
    },
    {
      "epoch": 1.8141311266709104,
      "grad_norm": 0.4648758308270985,
      "learning_rate": 4.726025189819241e-05,
      "loss": 1.768,
      "num_input_tokens_seen": 13453699808,
      "step": 17100
    },
    {
      "epoch": 1.8142372162104816,
      "grad_norm": 0.4464896834518134,
      "learning_rate": 4.725993556813957e-05,
      "loss": 1.7031,
      "num_input_tokens_seen": 13454486464,
      "step": 17101
    },
    {
      "epoch": 1.814343305750053,
      "grad_norm": 0.3613428046596456,
      "learning_rate": 4.72596192208849e-05,
      "loss": 1.6607,
      "num_input_tokens_seen": 13455273120,
      "step": 17102
    },
    {
      "epoch": 1.8144493952896243,
      "grad_norm": 0.33278558609632936,
      "learning_rate": 4.7259302856428645e-05,
      "loss": 1.8131,
      "num_input_tokens_seen": 13456059888,
      "step": 17103
    },
    {
      "epoch": 1.8145554848291958,
      "grad_norm": 0.4254671003520253,
      "learning_rate": 4.725898647477106e-05,
      "loss": 1.6412,
      "num_input_tokens_seen": 13456846704,
      "step": 17104
    },
    {
      "epoch": 1.8146615743687673,
      "grad_norm": 0.40506907174218026,
      "learning_rate": 4.725867007591238e-05,
      "loss": 1.8849,
      "num_input_tokens_seen": 13457633536,
      "step": 17105
    },
    {
      "epoch": 1.8147676639083388,
      "grad_norm": 0.4273992994943635,
      "learning_rate": 4.7258353659852855e-05,
      "loss": 1.7293,
      "num_input_tokens_seen": 13458420336,
      "step": 17106
    },
    {
      "epoch": 1.81487375344791,
      "grad_norm": 0.5322877422301927,
      "learning_rate": 4.7258037226592726e-05,
      "loss": 1.5989,
      "num_input_tokens_seen": 13459207072,
      "step": 17107
    },
    {
      "epoch": 1.8149798429874813,
      "grad_norm": 0.4070009006095455,
      "learning_rate": 4.725772077613224e-05,
      "loss": 1.7265,
      "num_input_tokens_seen": 13459993728,
      "step": 17108
    },
    {
      "epoch": 1.8150859325270527,
      "grad_norm": 0.4974670056164747,
      "learning_rate": 4.725740430847164e-05,
      "loss": 1.8689,
      "num_input_tokens_seen": 13460780496,
      "step": 17109
    },
    {
      "epoch": 1.8151920220666242,
      "grad_norm": 0.3262994006118862,
      "learning_rate": 4.7257087823611175e-05,
      "loss": 1.8665,
      "num_input_tokens_seen": 13461567296,
      "step": 17110
    },
    {
      "epoch": 1.8152981116061957,
      "grad_norm": 0.4176874506459108,
      "learning_rate": 4.7256771321551086e-05,
      "loss": 1.8467,
      "num_input_tokens_seen": 13462354064,
      "step": 17111
    },
    {
      "epoch": 1.8154042011457672,
      "grad_norm": 0.46937945930942554,
      "learning_rate": 4.725645480229161e-05,
      "loss": 1.7391,
      "num_input_tokens_seen": 13463140880,
      "step": 17112
    },
    {
      "epoch": 1.8155102906853384,
      "grad_norm": 0.38396718773363875,
      "learning_rate": 4.7256138265833e-05,
      "loss": 1.6939,
      "num_input_tokens_seen": 13463927680,
      "step": 17113
    },
    {
      "epoch": 1.8156163802249097,
      "grad_norm": 0.4670536396440513,
      "learning_rate": 4.7255821712175503e-05,
      "loss": 1.7539,
      "num_input_tokens_seen": 13464714416,
      "step": 17114
    },
    {
      "epoch": 1.8157224697644812,
      "grad_norm": 0.48249662647645847,
      "learning_rate": 4.725550514131936e-05,
      "loss": 1.7349,
      "num_input_tokens_seen": 13465501168,
      "step": 17115
    },
    {
      "epoch": 1.8158285593040526,
      "grad_norm": 0.37167260563328386,
      "learning_rate": 4.725518855326481e-05,
      "loss": 1.5494,
      "num_input_tokens_seen": 13466288016,
      "step": 17116
    },
    {
      "epoch": 1.815934648843624,
      "grad_norm": 0.6465119461811674,
      "learning_rate": 4.725487194801211e-05,
      "loss": 1.725,
      "num_input_tokens_seen": 13467074768,
      "step": 17117
    },
    {
      "epoch": 1.8160407383831956,
      "grad_norm": 0.3517420110446415,
      "learning_rate": 4.7254555325561494e-05,
      "loss": 1.6973,
      "num_input_tokens_seen": 13467861552,
      "step": 17118
    },
    {
      "epoch": 1.8161468279227668,
      "grad_norm": 0.45716233629735925,
      "learning_rate": 4.725423868591321e-05,
      "loss": 1.7887,
      "num_input_tokens_seen": 13468648224,
      "step": 17119
    },
    {
      "epoch": 1.816252917462338,
      "grad_norm": 0.39768723956874913,
      "learning_rate": 4.725392202906751e-05,
      "loss": 1.7782,
      "num_input_tokens_seen": 13469435008,
      "step": 17120
    },
    {
      "epoch": 1.8163590070019096,
      "grad_norm": 0.443572989641431,
      "learning_rate": 4.725360535502462e-05,
      "loss": 1.8479,
      "num_input_tokens_seen": 13470221776,
      "step": 17121
    },
    {
      "epoch": 1.816465096541481,
      "grad_norm": 0.4151642720422368,
      "learning_rate": 4.7253288663784814e-05,
      "loss": 1.7027,
      "num_input_tokens_seen": 13471008560,
      "step": 17122
    },
    {
      "epoch": 1.8165711860810525,
      "grad_norm": 0.45493648720719615,
      "learning_rate": 4.72529719553483e-05,
      "loss": 1.8667,
      "num_input_tokens_seen": 13471795328,
      "step": 17123
    },
    {
      "epoch": 1.8166772756206238,
      "grad_norm": 0.333356621267127,
      "learning_rate": 4.725265522971536e-05,
      "loss": 1.6323,
      "num_input_tokens_seen": 13472582096,
      "step": 17124
    },
    {
      "epoch": 1.8167833651601952,
      "grad_norm": 0.3483078195811544,
      "learning_rate": 4.7252338486886206e-05,
      "loss": 1.7699,
      "num_input_tokens_seen": 13473368704,
      "step": 17125
    },
    {
      "epoch": 1.8168894546997665,
      "grad_norm": 0.46378584831481734,
      "learning_rate": 4.725202172686111e-05,
      "loss": 1.8131,
      "num_input_tokens_seen": 13474155520,
      "step": 17126
    },
    {
      "epoch": 1.816995544239338,
      "grad_norm": 0.379187567794566,
      "learning_rate": 4.7251704949640294e-05,
      "loss": 1.8073,
      "num_input_tokens_seen": 13474942224,
      "step": 17127
    },
    {
      "epoch": 1.8171016337789094,
      "grad_norm": 0.3547781517638358,
      "learning_rate": 4.725138815522402e-05,
      "loss": 1.7155,
      "num_input_tokens_seen": 13475728864,
      "step": 17128
    },
    {
      "epoch": 1.817207723318481,
      "grad_norm": 0.3458308801967081,
      "learning_rate": 4.725107134361252e-05,
      "loss": 1.7258,
      "num_input_tokens_seen": 13476515664,
      "step": 17129
    },
    {
      "epoch": 1.8173138128580522,
      "grad_norm": 0.36686173592252536,
      "learning_rate": 4.725075451480605e-05,
      "loss": 1.7182,
      "num_input_tokens_seen": 13477302464,
      "step": 17130
    },
    {
      "epoch": 1.8174199023976236,
      "grad_norm": 0.3079170249357822,
      "learning_rate": 4.7250437668804854e-05,
      "loss": 1.6046,
      "num_input_tokens_seen": 13478089168,
      "step": 17131
    },
    {
      "epoch": 1.8175259919371949,
      "grad_norm": 0.34698710349941997,
      "learning_rate": 4.7250120805609165e-05,
      "loss": 1.729,
      "num_input_tokens_seen": 13478875920,
      "step": 17132
    },
    {
      "epoch": 1.8176320814767664,
      "grad_norm": 0.40775263750307705,
      "learning_rate": 4.7249803925219236e-05,
      "loss": 1.7329,
      "num_input_tokens_seen": 13479662672,
      "step": 17133
    },
    {
      "epoch": 1.8177381710163378,
      "grad_norm": 0.380482555960907,
      "learning_rate": 4.724948702763532e-05,
      "loss": 1.7182,
      "num_input_tokens_seen": 13480449472,
      "step": 17134
    },
    {
      "epoch": 1.8178442605559093,
      "grad_norm": 0.37211776822566633,
      "learning_rate": 4.7249170112857646e-05,
      "loss": 1.7926,
      "num_input_tokens_seen": 13481236208,
      "step": 17135
    },
    {
      "epoch": 1.8179503500954806,
      "grad_norm": 0.3485086767326705,
      "learning_rate": 4.724885318088647e-05,
      "loss": 1.8302,
      "num_input_tokens_seen": 13482022928,
      "step": 17136
    },
    {
      "epoch": 1.818056439635052,
      "grad_norm": 0.3527342570739672,
      "learning_rate": 4.724853623172203e-05,
      "loss": 1.7,
      "num_input_tokens_seen": 13482809744,
      "step": 17137
    },
    {
      "epoch": 1.8181625291746233,
      "grad_norm": 0.3077215124855209,
      "learning_rate": 4.724821926536457e-05,
      "loss": 1.6626,
      "num_input_tokens_seen": 13483596528,
      "step": 17138
    },
    {
      "epoch": 1.8182686187141948,
      "grad_norm": 0.3463694681442908,
      "learning_rate": 4.7247902281814344e-05,
      "loss": 1.7959,
      "num_input_tokens_seen": 13484383216,
      "step": 17139
    },
    {
      "epoch": 1.8183747082537662,
      "grad_norm": 0.34680610794982186,
      "learning_rate": 4.724758528107159e-05,
      "loss": 1.6903,
      "num_input_tokens_seen": 13485169968,
      "step": 17140
    },
    {
      "epoch": 1.8184807977933377,
      "grad_norm": 0.34404471426132033,
      "learning_rate": 4.7247268263136555e-05,
      "loss": 1.7047,
      "num_input_tokens_seen": 13485956800,
      "step": 17141
    },
    {
      "epoch": 1.818586887332909,
      "grad_norm": 0.3594871858848829,
      "learning_rate": 4.724695122800948e-05,
      "loss": 1.7318,
      "num_input_tokens_seen": 13486743616,
      "step": 17142
    },
    {
      "epoch": 1.8186929768724802,
      "grad_norm": 0.3257919383661623,
      "learning_rate": 4.724663417569062e-05,
      "loss": 1.8396,
      "num_input_tokens_seen": 13487530384,
      "step": 17143
    },
    {
      "epoch": 1.8187990664120517,
      "grad_norm": 0.3136316924800191,
      "learning_rate": 4.724631710618022e-05,
      "loss": 1.691,
      "num_input_tokens_seen": 13488317152,
      "step": 17144
    },
    {
      "epoch": 1.8189051559516232,
      "grad_norm": 0.36315618149455886,
      "learning_rate": 4.7246000019478507e-05,
      "loss": 1.7969,
      "num_input_tokens_seen": 13489103952,
      "step": 17145
    },
    {
      "epoch": 1.8190112454911946,
      "grad_norm": 0.3589077081319123,
      "learning_rate": 4.724568291558574e-05,
      "loss": 1.8688,
      "num_input_tokens_seen": 13489890704,
      "step": 17146
    },
    {
      "epoch": 1.8191173350307661,
      "grad_norm": 0.34076532560611345,
      "learning_rate": 4.724536579450217e-05,
      "loss": 1.6653,
      "num_input_tokens_seen": 13490677440,
      "step": 17147
    },
    {
      "epoch": 1.8192234245703374,
      "grad_norm": 0.39340248039060527,
      "learning_rate": 4.724504865622803e-05,
      "loss": 1.6935,
      "num_input_tokens_seen": 13491464192,
      "step": 17148
    },
    {
      "epoch": 1.8193295141099086,
      "grad_norm": 0.3756561777373656,
      "learning_rate": 4.7244731500763564e-05,
      "loss": 1.7225,
      "num_input_tokens_seen": 13492250960,
      "step": 17149
    },
    {
      "epoch": 1.81943560364948,
      "grad_norm": 0.43249465213460264,
      "learning_rate": 4.724441432810902e-05,
      "loss": 1.9424,
      "num_input_tokens_seen": 13493037744,
      "step": 17150
    },
    {
      "epoch": 1.8195416931890516,
      "grad_norm": 0.3791512721565128,
      "learning_rate": 4.724409713826465e-05,
      "loss": 1.6552,
      "num_input_tokens_seen": 13493824528,
      "step": 17151
    },
    {
      "epoch": 1.819647782728623,
      "grad_norm": 0.3648265151941418,
      "learning_rate": 4.7243779931230705e-05,
      "loss": 1.7481,
      "num_input_tokens_seen": 13494611248,
      "step": 17152
    },
    {
      "epoch": 1.8197538722681945,
      "grad_norm": 0.3467658201030164,
      "learning_rate": 4.724346270700741e-05,
      "loss": 1.6058,
      "num_input_tokens_seen": 13495398064,
      "step": 17153
    },
    {
      "epoch": 1.8198599618077658,
      "grad_norm": 0.6007689682844711,
      "learning_rate": 4.7243145465595015e-05,
      "loss": 1.823,
      "num_input_tokens_seen": 13496184752,
      "step": 17154
    },
    {
      "epoch": 1.819966051347337,
      "grad_norm": 0.3613807069484844,
      "learning_rate": 4.724282820699377e-05,
      "loss": 1.8149,
      "num_input_tokens_seen": 13496971440,
      "step": 17155
    },
    {
      "epoch": 1.8200721408869085,
      "grad_norm": 0.45303589214173373,
      "learning_rate": 4.7242510931203934e-05,
      "loss": 1.6883,
      "num_input_tokens_seen": 13497758256,
      "step": 17156
    },
    {
      "epoch": 1.82017823042648,
      "grad_norm": 0.424568947138859,
      "learning_rate": 4.7242193638225726e-05,
      "loss": 1.7911,
      "num_input_tokens_seen": 13498544928,
      "step": 17157
    },
    {
      "epoch": 1.8202843199660514,
      "grad_norm": 0.4396503039798265,
      "learning_rate": 4.7241876328059405e-05,
      "loss": 1.746,
      "num_input_tokens_seen": 13499331728,
      "step": 17158
    },
    {
      "epoch": 1.8203904095056227,
      "grad_norm": 0.4042647247624729,
      "learning_rate": 4.724155900070522e-05,
      "loss": 1.9771,
      "num_input_tokens_seen": 13500118416,
      "step": 17159
    },
    {
      "epoch": 1.8204964990451942,
      "grad_norm": 0.38161816388443126,
      "learning_rate": 4.724124165616341e-05,
      "loss": 1.7884,
      "num_input_tokens_seen": 13500905152,
      "step": 17160
    },
    {
      "epoch": 1.8206025885847654,
      "grad_norm": 0.3920893876820044,
      "learning_rate": 4.7240924294434205e-05,
      "loss": 1.7372,
      "num_input_tokens_seen": 13501691936,
      "step": 17161
    },
    {
      "epoch": 1.820708678124337,
      "grad_norm": 0.34375144169636834,
      "learning_rate": 4.7240606915517885e-05,
      "loss": 1.6958,
      "num_input_tokens_seen": 13502478672,
      "step": 17162
    },
    {
      "epoch": 1.8208147676639084,
      "grad_norm": 0.4249271068994831,
      "learning_rate": 4.724028951941467e-05,
      "loss": 1.7099,
      "num_input_tokens_seen": 13503265392,
      "step": 17163
    },
    {
      "epoch": 1.8209208572034798,
      "grad_norm": 0.36052640859165047,
      "learning_rate": 4.723997210612481e-05,
      "loss": 1.687,
      "num_input_tokens_seen": 13504052192,
      "step": 17164
    },
    {
      "epoch": 1.821026946743051,
      "grad_norm": 0.4366737978963479,
      "learning_rate": 4.723965467564855e-05,
      "loss": 1.8111,
      "num_input_tokens_seen": 13504838912,
      "step": 17165
    },
    {
      "epoch": 1.8211330362826226,
      "grad_norm": 0.3836750326907394,
      "learning_rate": 4.723933722798615e-05,
      "loss": 1.6165,
      "num_input_tokens_seen": 13505625632,
      "step": 17166
    },
    {
      "epoch": 1.8212391258221938,
      "grad_norm": 0.40186079476836034,
      "learning_rate": 4.723901976313783e-05,
      "loss": 1.7201,
      "num_input_tokens_seen": 13506412432,
      "step": 17167
    },
    {
      "epoch": 1.8213452153617653,
      "grad_norm": 0.342709499096582,
      "learning_rate": 4.723870228110385e-05,
      "loss": 1.517,
      "num_input_tokens_seen": 13507199312,
      "step": 17168
    },
    {
      "epoch": 1.8214513049013368,
      "grad_norm": 0.4539008379899689,
      "learning_rate": 4.723838478188446e-05,
      "loss": 1.8353,
      "num_input_tokens_seen": 13507986032,
      "step": 17169
    },
    {
      "epoch": 1.8215573944409083,
      "grad_norm": 0.4806349698942421,
      "learning_rate": 4.723806726547989e-05,
      "loss": 1.7329,
      "num_input_tokens_seen": 13508772832,
      "step": 17170
    },
    {
      "epoch": 1.8216634839804795,
      "grad_norm": 0.3992651113316338,
      "learning_rate": 4.72377497318904e-05,
      "loss": 1.7117,
      "num_input_tokens_seen": 13509559680,
      "step": 17171
    },
    {
      "epoch": 1.821769573520051,
      "grad_norm": 0.37698419247610676,
      "learning_rate": 4.723743218111623e-05,
      "loss": 1.671,
      "num_input_tokens_seen": 13510346480,
      "step": 17172
    },
    {
      "epoch": 1.8218756630596222,
      "grad_norm": 0.36693284610900034,
      "learning_rate": 4.723711461315762e-05,
      "loss": 1.646,
      "num_input_tokens_seen": 13511133280,
      "step": 17173
    },
    {
      "epoch": 1.8219817525991937,
      "grad_norm": 0.4183130278512098,
      "learning_rate": 4.723679702801482e-05,
      "loss": 1.7732,
      "num_input_tokens_seen": 13511920048,
      "step": 17174
    },
    {
      "epoch": 1.8220878421387652,
      "grad_norm": 0.37894039458265705,
      "learning_rate": 4.7236479425688087e-05,
      "loss": 1.7485,
      "num_input_tokens_seen": 13512706768,
      "step": 17175
    },
    {
      "epoch": 1.8221939316783367,
      "grad_norm": 0.43591691114517267,
      "learning_rate": 4.723616180617765e-05,
      "loss": 1.6278,
      "num_input_tokens_seen": 13513493520,
      "step": 17176
    },
    {
      "epoch": 1.822300021217908,
      "grad_norm": 0.41355372064836493,
      "learning_rate": 4.723584416948376e-05,
      "loss": 1.7382,
      "num_input_tokens_seen": 13514280432,
      "step": 17177
    },
    {
      "epoch": 1.8224061107574792,
      "grad_norm": 0.516853429148776,
      "learning_rate": 4.723552651560665e-05,
      "loss": 1.8369,
      "num_input_tokens_seen": 13515067200,
      "step": 17178
    },
    {
      "epoch": 1.8225122002970506,
      "grad_norm": 0.4234805793625054,
      "learning_rate": 4.723520884454659e-05,
      "loss": 1.6316,
      "num_input_tokens_seen": 13515853952,
      "step": 17179
    },
    {
      "epoch": 1.822618289836622,
      "grad_norm": 0.4837204046587066,
      "learning_rate": 4.723489115630381e-05,
      "loss": 1.7393,
      "num_input_tokens_seen": 13516640656,
      "step": 17180
    },
    {
      "epoch": 1.8227243793761936,
      "grad_norm": 0.3713848706251466,
      "learning_rate": 4.7234573450878555e-05,
      "loss": 1.687,
      "num_input_tokens_seen": 13517427456,
      "step": 17181
    },
    {
      "epoch": 1.822830468915765,
      "grad_norm": 0.41606777417289303,
      "learning_rate": 4.7234255728271074e-05,
      "loss": 1.6641,
      "num_input_tokens_seen": 13518214304,
      "step": 17182
    },
    {
      "epoch": 1.8229365584553363,
      "grad_norm": 0.48027369207809617,
      "learning_rate": 4.723393798848162e-05,
      "loss": 1.7123,
      "num_input_tokens_seen": 13519001056,
      "step": 17183
    },
    {
      "epoch": 1.8230426479949076,
      "grad_norm": 0.4359123244573075,
      "learning_rate": 4.7233620231510424e-05,
      "loss": 1.7346,
      "num_input_tokens_seen": 13519787760,
      "step": 17184
    },
    {
      "epoch": 1.823148737534479,
      "grad_norm": 0.5119722044774648,
      "learning_rate": 4.723330245735774e-05,
      "loss": 1.7923,
      "num_input_tokens_seen": 13520574544,
      "step": 17185
    },
    {
      "epoch": 1.8232548270740505,
      "grad_norm": 0.4488114887319731,
      "learning_rate": 4.723298466602382e-05,
      "loss": 1.8534,
      "num_input_tokens_seen": 13521361264,
      "step": 17186
    },
    {
      "epoch": 1.823360916613622,
      "grad_norm": 0.5992532110017863,
      "learning_rate": 4.723266685750889e-05,
      "loss": 1.7466,
      "num_input_tokens_seen": 13522148016,
      "step": 17187
    },
    {
      "epoch": 1.8234670061531935,
      "grad_norm": 0.4897469433408046,
      "learning_rate": 4.7232349031813215e-05,
      "loss": 1.7228,
      "num_input_tokens_seen": 13522934784,
      "step": 17188
    },
    {
      "epoch": 1.8235730956927647,
      "grad_norm": 0.4531357680133779,
      "learning_rate": 4.723203118893703e-05,
      "loss": 1.6377,
      "num_input_tokens_seen": 13523721520,
      "step": 17189
    },
    {
      "epoch": 1.823679185232336,
      "grad_norm": 0.42253008837355627,
      "learning_rate": 4.7231713328880585e-05,
      "loss": 1.6609,
      "num_input_tokens_seen": 13524508256,
      "step": 17190
    },
    {
      "epoch": 1.8237852747719074,
      "grad_norm": 0.32967064103423904,
      "learning_rate": 4.723139545164412e-05,
      "loss": 1.6239,
      "num_input_tokens_seen": 13525295136,
      "step": 17191
    },
    {
      "epoch": 1.823891364311479,
      "grad_norm": 0.3717110476119364,
      "learning_rate": 4.7231077557227895e-05,
      "loss": 1.714,
      "num_input_tokens_seen": 13526081856,
      "step": 17192
    },
    {
      "epoch": 1.8239974538510504,
      "grad_norm": 0.508000937054621,
      "learning_rate": 4.723075964563214e-05,
      "loss": 1.8129,
      "num_input_tokens_seen": 13526868560,
      "step": 17193
    },
    {
      "epoch": 1.8241035433906216,
      "grad_norm": 0.35862246739498405,
      "learning_rate": 4.72304417168571e-05,
      "loss": 1.6327,
      "num_input_tokens_seen": 13527655296,
      "step": 17194
    },
    {
      "epoch": 1.8242096329301931,
      "grad_norm": 0.4207430916976784,
      "learning_rate": 4.723012377090303e-05,
      "loss": 1.617,
      "num_input_tokens_seen": 13528442080,
      "step": 17195
    },
    {
      "epoch": 1.8243157224697644,
      "grad_norm": 0.3970229998696066,
      "learning_rate": 4.722980580777018e-05,
      "loss": 1.6918,
      "num_input_tokens_seen": 13529228976,
      "step": 17196
    },
    {
      "epoch": 1.8244218120093358,
      "grad_norm": 0.3776752719907354,
      "learning_rate": 4.7229487827458785e-05,
      "loss": 1.7297,
      "num_input_tokens_seen": 13530015824,
      "step": 17197
    },
    {
      "epoch": 1.8245279015489073,
      "grad_norm": 0.37743574983537753,
      "learning_rate": 4.722916982996909e-05,
      "loss": 1.8224,
      "num_input_tokens_seen": 13530802656,
      "step": 17198
    },
    {
      "epoch": 1.8246339910884788,
      "grad_norm": 0.37374561933810624,
      "learning_rate": 4.722885181530134e-05,
      "loss": 1.6319,
      "num_input_tokens_seen": 13531589392,
      "step": 17199
    },
    {
      "epoch": 1.82474008062805,
      "grad_norm": 0.3392075322283466,
      "learning_rate": 4.72285337834558e-05,
      "loss": 1.6171,
      "num_input_tokens_seen": 13532376256,
      "step": 17200
    },
    {
      "epoch": 1.8248461701676215,
      "grad_norm": 0.3331313867073477,
      "learning_rate": 4.722821573443269e-05,
      "loss": 1.6467,
      "num_input_tokens_seen": 13533163072,
      "step": 17201
    },
    {
      "epoch": 1.8249522597071928,
      "grad_norm": 0.35214209790191786,
      "learning_rate": 4.7227897668232275e-05,
      "loss": 1.7369,
      "num_input_tokens_seen": 13533949824,
      "step": 17202
    },
    {
      "epoch": 1.8250583492467642,
      "grad_norm": 0.4145490172909084,
      "learning_rate": 4.722757958485479e-05,
      "loss": 1.6692,
      "num_input_tokens_seen": 13534736640,
      "step": 17203
    },
    {
      "epoch": 1.8251644387863357,
      "grad_norm": 0.35976122253063403,
      "learning_rate": 4.722726148430048e-05,
      "loss": 1.7925,
      "num_input_tokens_seen": 13535523408,
      "step": 17204
    },
    {
      "epoch": 1.8252705283259072,
      "grad_norm": 0.3442754999533875,
      "learning_rate": 4.72269433665696e-05,
      "loss": 1.6874,
      "num_input_tokens_seen": 13536310304,
      "step": 17205
    },
    {
      "epoch": 1.8253766178654784,
      "grad_norm": 0.3379075028087498,
      "learning_rate": 4.722662523166239e-05,
      "loss": 1.6433,
      "num_input_tokens_seen": 13537097072,
      "step": 17206
    },
    {
      "epoch": 1.8254827074050497,
      "grad_norm": 0.3840955151536148,
      "learning_rate": 4.722630707957909e-05,
      "loss": 1.7214,
      "num_input_tokens_seen": 13537883808,
      "step": 17207
    },
    {
      "epoch": 1.8255887969446212,
      "grad_norm": 0.41341458201702386,
      "learning_rate": 4.7225988910319954e-05,
      "loss": 1.7372,
      "num_input_tokens_seen": 13538670528,
      "step": 17208
    },
    {
      "epoch": 1.8256948864841926,
      "grad_norm": 0.41956769500079616,
      "learning_rate": 4.722567072388523e-05,
      "loss": 1.6547,
      "num_input_tokens_seen": 13539457328,
      "step": 17209
    },
    {
      "epoch": 1.8258009760237641,
      "grad_norm": 0.4859612630296598,
      "learning_rate": 4.7225352520275153e-05,
      "loss": 1.8019,
      "num_input_tokens_seen": 13540243984,
      "step": 17210
    },
    {
      "epoch": 1.8259070655633356,
      "grad_norm": 0.3980277220987516,
      "learning_rate": 4.722503429948998e-05,
      "loss": 1.6527,
      "num_input_tokens_seen": 13541030768,
      "step": 17211
    },
    {
      "epoch": 1.8260131551029068,
      "grad_norm": 0.41927378277359506,
      "learning_rate": 4.7224716061529956e-05,
      "loss": 1.8002,
      "num_input_tokens_seen": 13541817616,
      "step": 17212
    },
    {
      "epoch": 1.826119244642478,
      "grad_norm": 0.5315982853048252,
      "learning_rate": 4.722439780639532e-05,
      "loss": 1.7598,
      "num_input_tokens_seen": 13542604384,
      "step": 17213
    },
    {
      "epoch": 1.8262253341820496,
      "grad_norm": 0.3426904547122024,
      "learning_rate": 4.722407953408632e-05,
      "loss": 1.6608,
      "num_input_tokens_seen": 13543391200,
      "step": 17214
    },
    {
      "epoch": 1.826331423721621,
      "grad_norm": 0.7171522634684925,
      "learning_rate": 4.7223761244603207e-05,
      "loss": 1.6544,
      "num_input_tokens_seen": 13544177936,
      "step": 17215
    },
    {
      "epoch": 1.8264375132611925,
      "grad_norm": 0.377309518439331,
      "learning_rate": 4.722344293794622e-05,
      "loss": 1.7213,
      "num_input_tokens_seen": 13544964768,
      "step": 17216
    },
    {
      "epoch": 1.826543602800764,
      "grad_norm": 0.6714171986136547,
      "learning_rate": 4.722312461411561e-05,
      "loss": 1.7098,
      "num_input_tokens_seen": 13545751616,
      "step": 17217
    },
    {
      "epoch": 1.8266496923403353,
      "grad_norm": 0.39856838707085807,
      "learning_rate": 4.722280627311162e-05,
      "loss": 1.5936,
      "num_input_tokens_seen": 13546538400,
      "step": 17218
    },
    {
      "epoch": 1.8267557818799065,
      "grad_norm": 0.44169980802630965,
      "learning_rate": 4.72224879149345e-05,
      "loss": 1.5651,
      "num_input_tokens_seen": 13547325152,
      "step": 17219
    },
    {
      "epoch": 1.826861871419478,
      "grad_norm": 0.6226639222506055,
      "learning_rate": 4.7222169539584496e-05,
      "loss": 1.7677,
      "num_input_tokens_seen": 13548111920,
      "step": 17220
    },
    {
      "epoch": 1.8269679609590495,
      "grad_norm": 0.3517118270475795,
      "learning_rate": 4.722185114706185e-05,
      "loss": 1.6074,
      "num_input_tokens_seen": 13548898720,
      "step": 17221
    },
    {
      "epoch": 1.827074050498621,
      "grad_norm": 0.5798031909872774,
      "learning_rate": 4.72215327373668e-05,
      "loss": 1.6465,
      "num_input_tokens_seen": 13549685440,
      "step": 17222
    },
    {
      "epoch": 1.8271801400381922,
      "grad_norm": 0.40807058018928916,
      "learning_rate": 4.722121431049961e-05,
      "loss": 1.7291,
      "num_input_tokens_seen": 13550472160,
      "step": 17223
    },
    {
      "epoch": 1.8272862295777637,
      "grad_norm": 0.34733909753032477,
      "learning_rate": 4.7220895866460515e-05,
      "loss": 1.5479,
      "num_input_tokens_seen": 13551258960,
      "step": 17224
    },
    {
      "epoch": 1.827392319117335,
      "grad_norm": 0.5024685909416995,
      "learning_rate": 4.7220577405249765e-05,
      "loss": 1.7507,
      "num_input_tokens_seen": 13552045744,
      "step": 17225
    },
    {
      "epoch": 1.8274984086569064,
      "grad_norm": 0.4060076278198318,
      "learning_rate": 4.722025892686761e-05,
      "loss": 1.7126,
      "num_input_tokens_seen": 13552832512,
      "step": 17226
    },
    {
      "epoch": 1.8276044981964779,
      "grad_norm": 0.38425445255070834,
      "learning_rate": 4.721994043131428e-05,
      "loss": 1.7879,
      "num_input_tokens_seen": 13553619264,
      "step": 17227
    },
    {
      "epoch": 1.8277105877360493,
      "grad_norm": 0.4459225097538843,
      "learning_rate": 4.721962191859004e-05,
      "loss": 1.6204,
      "num_input_tokens_seen": 13554406032,
      "step": 17228
    },
    {
      "epoch": 1.8278166772756206,
      "grad_norm": 0.34699857222063624,
      "learning_rate": 4.7219303388695124e-05,
      "loss": 1.7916,
      "num_input_tokens_seen": 13555192816,
      "step": 17229
    },
    {
      "epoch": 1.827922766815192,
      "grad_norm": 0.3913965014222197,
      "learning_rate": 4.7218984841629784e-05,
      "loss": 1.6349,
      "num_input_tokens_seen": 13555979488,
      "step": 17230
    },
    {
      "epoch": 1.8280288563547633,
      "grad_norm": 0.35269019821433367,
      "learning_rate": 4.721866627739426e-05,
      "loss": 1.8245,
      "num_input_tokens_seen": 13556766224,
      "step": 17231
    },
    {
      "epoch": 1.8281349458943348,
      "grad_norm": 0.33829931836229404,
      "learning_rate": 4.7218347695988816e-05,
      "loss": 1.6612,
      "num_input_tokens_seen": 13557552992,
      "step": 17232
    },
    {
      "epoch": 1.8282410354339063,
      "grad_norm": 0.3627582993156046,
      "learning_rate": 4.7218029097413675e-05,
      "loss": 1.7891,
      "num_input_tokens_seen": 13558339776,
      "step": 17233
    },
    {
      "epoch": 1.8283471249734777,
      "grad_norm": 0.3715344024079339,
      "learning_rate": 4.7217710481669095e-05,
      "loss": 1.8628,
      "num_input_tokens_seen": 13559126528,
      "step": 17234
    },
    {
      "epoch": 1.828453214513049,
      "grad_norm": 0.3843109675760924,
      "learning_rate": 4.721739184875531e-05,
      "loss": 1.6934,
      "num_input_tokens_seen": 13559913360,
      "step": 17235
    },
    {
      "epoch": 1.8285593040526205,
      "grad_norm": 0.37129842213010983,
      "learning_rate": 4.721707319867259e-05,
      "loss": 1.7723,
      "num_input_tokens_seen": 13560700144,
      "step": 17236
    },
    {
      "epoch": 1.8286653935921917,
      "grad_norm": 0.43153599405035875,
      "learning_rate": 4.7216754531421165e-05,
      "loss": 1.8299,
      "num_input_tokens_seen": 13561486928,
      "step": 17237
    },
    {
      "epoch": 1.8287714831317632,
      "grad_norm": 0.3814007475130022,
      "learning_rate": 4.721643584700128e-05,
      "loss": 1.7309,
      "num_input_tokens_seen": 13562273696,
      "step": 17238
    },
    {
      "epoch": 1.8288775726713347,
      "grad_norm": 0.31960581428684975,
      "learning_rate": 4.7216117145413185e-05,
      "loss": 1.6266,
      "num_input_tokens_seen": 13563060528,
      "step": 17239
    },
    {
      "epoch": 1.8289836622109061,
      "grad_norm": 0.3946754795592076,
      "learning_rate": 4.7215798426657134e-05,
      "loss": 1.6947,
      "num_input_tokens_seen": 13563847280,
      "step": 17240
    },
    {
      "epoch": 1.8290897517504774,
      "grad_norm": 0.40281504557303976,
      "learning_rate": 4.7215479690733364e-05,
      "loss": 1.6899,
      "num_input_tokens_seen": 13564634064,
      "step": 17241
    },
    {
      "epoch": 1.8291958412900486,
      "grad_norm": 0.37931986395206346,
      "learning_rate": 4.7215160937642114e-05,
      "loss": 1.6674,
      "num_input_tokens_seen": 13565420864,
      "step": 17242
    },
    {
      "epoch": 1.8293019308296201,
      "grad_norm": 0.37733761931967236,
      "learning_rate": 4.721484216738365e-05,
      "loss": 1.6096,
      "num_input_tokens_seen": 13566207760,
      "step": 17243
    },
    {
      "epoch": 1.8294080203691916,
      "grad_norm": 0.39362450795059084,
      "learning_rate": 4.72145233799582e-05,
      "loss": 1.7709,
      "num_input_tokens_seen": 13566994448,
      "step": 17244
    },
    {
      "epoch": 1.829514109908763,
      "grad_norm": 0.3579887089499775,
      "learning_rate": 4.7214204575366025e-05,
      "loss": 1.617,
      "num_input_tokens_seen": 13567781232,
      "step": 17245
    },
    {
      "epoch": 1.8296201994483345,
      "grad_norm": 0.36149482271464856,
      "learning_rate": 4.721388575360736e-05,
      "loss": 1.7387,
      "num_input_tokens_seen": 13568568000,
      "step": 17246
    },
    {
      "epoch": 1.8297262889879058,
      "grad_norm": 0.3718973301299135,
      "learning_rate": 4.721356691468246e-05,
      "loss": 1.7449,
      "num_input_tokens_seen": 13569354736,
      "step": 17247
    },
    {
      "epoch": 1.829832378527477,
      "grad_norm": 0.4061269445728985,
      "learning_rate": 4.721324805859156e-05,
      "loss": 1.9399,
      "num_input_tokens_seen": 13570141440,
      "step": 17248
    },
    {
      "epoch": 1.8299384680670485,
      "grad_norm": 0.34662656643700324,
      "learning_rate": 4.721292918533492e-05,
      "loss": 1.6419,
      "num_input_tokens_seen": 13570928288,
      "step": 17249
    },
    {
      "epoch": 1.83004455760662,
      "grad_norm": 0.38830065662790963,
      "learning_rate": 4.721261029491277e-05,
      "loss": 1.6451,
      "num_input_tokens_seen": 13571715088,
      "step": 17250
    },
    {
      "epoch": 1.8301506471461915,
      "grad_norm": 0.37908588065101806,
      "learning_rate": 4.721229138732538e-05,
      "loss": 1.6418,
      "num_input_tokens_seen": 13572501808,
      "step": 17251
    },
    {
      "epoch": 1.830256736685763,
      "grad_norm": 0.5117618735748465,
      "learning_rate": 4.721197246257297e-05,
      "loss": 1.7808,
      "num_input_tokens_seen": 13573288560,
      "step": 17252
    },
    {
      "epoch": 1.8303628262253342,
      "grad_norm": 0.3433205730475003,
      "learning_rate": 4.721165352065581e-05,
      "loss": 1.811,
      "num_input_tokens_seen": 13574075344,
      "step": 17253
    },
    {
      "epoch": 1.8304689157649054,
      "grad_norm": 0.4339571046364811,
      "learning_rate": 4.7211334561574136e-05,
      "loss": 1.7797,
      "num_input_tokens_seen": 13574862048,
      "step": 17254
    },
    {
      "epoch": 1.830575005304477,
      "grad_norm": 0.4241805631190215,
      "learning_rate": 4.7211015585328186e-05,
      "loss": 1.7424,
      "num_input_tokens_seen": 13575648864,
      "step": 17255
    },
    {
      "epoch": 1.8306810948440484,
      "grad_norm": 0.5193088648389126,
      "learning_rate": 4.7210696591918225e-05,
      "loss": 1.6757,
      "num_input_tokens_seen": 13576435696,
      "step": 17256
    },
    {
      "epoch": 1.8307871843836199,
      "grad_norm": 0.4461457777584073,
      "learning_rate": 4.7210377581344483e-05,
      "loss": 1.7436,
      "num_input_tokens_seen": 13577222432,
      "step": 17257
    },
    {
      "epoch": 1.8308932739231911,
      "grad_norm": 0.48564884106688017,
      "learning_rate": 4.721005855360722e-05,
      "loss": 1.8745,
      "num_input_tokens_seen": 13578009136,
      "step": 17258
    },
    {
      "epoch": 1.8309993634627626,
      "grad_norm": 0.41527761697927634,
      "learning_rate": 4.7209739508706666e-05,
      "loss": 1.8175,
      "num_input_tokens_seen": 13578795984,
      "step": 17259
    },
    {
      "epoch": 1.8311054530023338,
      "grad_norm": 0.3458114183206897,
      "learning_rate": 4.720942044664308e-05,
      "loss": 1.7788,
      "num_input_tokens_seen": 13579582784,
      "step": 17260
    },
    {
      "epoch": 1.8312115425419053,
      "grad_norm": 0.498405813485079,
      "learning_rate": 4.720910136741671e-05,
      "loss": 1.9308,
      "num_input_tokens_seen": 13580369536,
      "step": 17261
    },
    {
      "epoch": 1.8313176320814768,
      "grad_norm": 0.334648288862962,
      "learning_rate": 4.720878227102779e-05,
      "loss": 1.7424,
      "num_input_tokens_seen": 13581156272,
      "step": 17262
    },
    {
      "epoch": 1.8314237216210483,
      "grad_norm": 0.38703999583721815,
      "learning_rate": 4.720846315747658e-05,
      "loss": 1.6949,
      "num_input_tokens_seen": 13581943024,
      "step": 17263
    },
    {
      "epoch": 1.8315298111606195,
      "grad_norm": 0.39234050138257726,
      "learning_rate": 4.720814402676332e-05,
      "loss": 1.785,
      "num_input_tokens_seen": 13582729760,
      "step": 17264
    },
    {
      "epoch": 1.831635900700191,
      "grad_norm": 0.35577184104371457,
      "learning_rate": 4.7207824878888255e-05,
      "loss": 1.7089,
      "num_input_tokens_seen": 13583516464,
      "step": 17265
    },
    {
      "epoch": 1.8317419902397623,
      "grad_norm": 0.403485881802569,
      "learning_rate": 4.720750571385164e-05,
      "loss": 1.5635,
      "num_input_tokens_seen": 13584303312,
      "step": 17266
    },
    {
      "epoch": 1.8318480797793337,
      "grad_norm": 0.34649696980276384,
      "learning_rate": 4.7207186531653713e-05,
      "loss": 1.683,
      "num_input_tokens_seen": 13585090032,
      "step": 17267
    },
    {
      "epoch": 1.8319541693189052,
      "grad_norm": 0.4232676375710701,
      "learning_rate": 4.7206867332294725e-05,
      "loss": 1.7147,
      "num_input_tokens_seen": 13585876752,
      "step": 17268
    },
    {
      "epoch": 1.8320602588584767,
      "grad_norm": 0.3491373706640205,
      "learning_rate": 4.720654811577492e-05,
      "loss": 1.6738,
      "num_input_tokens_seen": 13586663488,
      "step": 17269
    },
    {
      "epoch": 1.832166348398048,
      "grad_norm": 0.3922045623216453,
      "learning_rate": 4.720622888209455e-05,
      "loss": 1.7573,
      "num_input_tokens_seen": 13587450272,
      "step": 17270
    },
    {
      "epoch": 1.8322724379376194,
      "grad_norm": 0.3973116252123066,
      "learning_rate": 4.720590963125385e-05,
      "loss": 1.8358,
      "num_input_tokens_seen": 13588236960,
      "step": 17271
    },
    {
      "epoch": 1.8323785274771907,
      "grad_norm": 0.4518377250578161,
      "learning_rate": 4.720559036325308e-05,
      "loss": 1.7192,
      "num_input_tokens_seen": 13589023792,
      "step": 17272
    },
    {
      "epoch": 1.8324846170167621,
      "grad_norm": 0.44983740422934304,
      "learning_rate": 4.720527107809248e-05,
      "loss": 1.7326,
      "num_input_tokens_seen": 13589810592,
      "step": 17273
    },
    {
      "epoch": 1.8325907065563336,
      "grad_norm": 0.40245240405293453,
      "learning_rate": 4.720495177577231e-05,
      "loss": 1.8746,
      "num_input_tokens_seen": 13590597392,
      "step": 17274
    },
    {
      "epoch": 1.832696796095905,
      "grad_norm": 0.6574438812155511,
      "learning_rate": 4.7204632456292786e-05,
      "loss": 1.6346,
      "num_input_tokens_seen": 13591384272,
      "step": 17275
    },
    {
      "epoch": 1.8328028856354763,
      "grad_norm": 1.0463145934356068,
      "learning_rate": 4.7204313119654185e-05,
      "loss": 1.8114,
      "num_input_tokens_seen": 13592171024,
      "step": 17276
    },
    {
      "epoch": 1.8329089751750476,
      "grad_norm": 0.5498789250171707,
      "learning_rate": 4.7203993765856737e-05,
      "loss": 1.6598,
      "num_input_tokens_seen": 13592957856,
      "step": 17277
    },
    {
      "epoch": 1.833015064714619,
      "grad_norm": 0.8833122200432406,
      "learning_rate": 4.72036743949007e-05,
      "loss": 1.7036,
      "num_input_tokens_seen": 13593744640,
      "step": 17278
    },
    {
      "epoch": 1.8331211542541905,
      "grad_norm": 0.62849987258367,
      "learning_rate": 4.720335500678631e-05,
      "loss": 1.7764,
      "num_input_tokens_seen": 13594531408,
      "step": 17279
    },
    {
      "epoch": 1.833227243793762,
      "grad_norm": 0.5942547012201242,
      "learning_rate": 4.720303560151382e-05,
      "loss": 1.5628,
      "num_input_tokens_seen": 13595318272,
      "step": 17280
    },
    {
      "epoch": 1.8333333333333335,
      "grad_norm": 0.39252718526233316,
      "learning_rate": 4.720271617908347e-05,
      "loss": 1.6906,
      "num_input_tokens_seen": 13596105040,
      "step": 17281
    },
    {
      "epoch": 1.8334394228729047,
      "grad_norm": 0.47606615489039644,
      "learning_rate": 4.7202396739495524e-05,
      "loss": 1.7233,
      "num_input_tokens_seen": 13596891760,
      "step": 17282
    },
    {
      "epoch": 1.833545512412476,
      "grad_norm": 0.5528332305857961,
      "learning_rate": 4.7202077282750206e-05,
      "loss": 1.8124,
      "num_input_tokens_seen": 13597678592,
      "step": 17283
    },
    {
      "epoch": 1.8336516019520475,
      "grad_norm": 0.37983049242326744,
      "learning_rate": 4.720175780884778e-05,
      "loss": 1.7389,
      "num_input_tokens_seen": 13598465376,
      "step": 17284
    },
    {
      "epoch": 1.833757691491619,
      "grad_norm": 0.5748098831308629,
      "learning_rate": 4.720143831778849e-05,
      "loss": 1.7344,
      "num_input_tokens_seen": 13599252096,
      "step": 17285
    },
    {
      "epoch": 1.8338637810311904,
      "grad_norm": 0.4383976963106772,
      "learning_rate": 4.720111880957258e-05,
      "loss": 1.719,
      "num_input_tokens_seen": 13600038864,
      "step": 17286
    },
    {
      "epoch": 1.8339698705707619,
      "grad_norm": 0.37021287190914953,
      "learning_rate": 4.7200799284200283e-05,
      "loss": 1.7264,
      "num_input_tokens_seen": 13600825568,
      "step": 17287
    },
    {
      "epoch": 1.8340759601103331,
      "grad_norm": 0.38782050074010394,
      "learning_rate": 4.720047974167187e-05,
      "loss": 1.666,
      "num_input_tokens_seen": 13601612336,
      "step": 17288
    },
    {
      "epoch": 1.8341820496499044,
      "grad_norm": 0.41947814711835685,
      "learning_rate": 4.7200160181987576e-05,
      "loss": 1.8215,
      "num_input_tokens_seen": 13602399024,
      "step": 17289
    },
    {
      "epoch": 1.8342881391894759,
      "grad_norm": 0.3131919368015254,
      "learning_rate": 4.719984060514766e-05,
      "loss": 1.7337,
      "num_input_tokens_seen": 13603185760,
      "step": 17290
    },
    {
      "epoch": 1.8343942287290473,
      "grad_norm": 0.3694840482200978,
      "learning_rate": 4.719952101115234e-05,
      "loss": 1.7692,
      "num_input_tokens_seen": 13603972544,
      "step": 17291
    },
    {
      "epoch": 1.8345003182686188,
      "grad_norm": 0.4187110370840731,
      "learning_rate": 4.7199201400001893e-05,
      "loss": 1.6973,
      "num_input_tokens_seen": 13604759360,
      "step": 17292
    },
    {
      "epoch": 1.83460640780819,
      "grad_norm": 0.42042954137743843,
      "learning_rate": 4.719888177169656e-05,
      "loss": 1.6115,
      "num_input_tokens_seen": 13605546064,
      "step": 17293
    },
    {
      "epoch": 1.8347124973477615,
      "grad_norm": 0.34456568909672086,
      "learning_rate": 4.719856212623657e-05,
      "loss": 1.7473,
      "num_input_tokens_seen": 13606332832,
      "step": 17294
    },
    {
      "epoch": 1.8348185868873328,
      "grad_norm": 0.42760973630790544,
      "learning_rate": 4.719824246362219e-05,
      "loss": 1.6523,
      "num_input_tokens_seen": 13607119584,
      "step": 17295
    },
    {
      "epoch": 1.8349246764269043,
      "grad_norm": 0.4177541238532349,
      "learning_rate": 4.719792278385365e-05,
      "loss": 1.7087,
      "num_input_tokens_seen": 13607906368,
      "step": 17296
    },
    {
      "epoch": 1.8350307659664757,
      "grad_norm": 0.4259961392160715,
      "learning_rate": 4.719760308693122e-05,
      "loss": 1.729,
      "num_input_tokens_seen": 13608693232,
      "step": 17297
    },
    {
      "epoch": 1.8351368555060472,
      "grad_norm": 0.4327190801712932,
      "learning_rate": 4.7197283372855124e-05,
      "loss": 1.5859,
      "num_input_tokens_seen": 13609479984,
      "step": 17298
    },
    {
      "epoch": 1.8352429450456185,
      "grad_norm": 0.5767854881487409,
      "learning_rate": 4.719696364162562e-05,
      "loss": 1.7283,
      "num_input_tokens_seen": 13610266720,
      "step": 17299
    },
    {
      "epoch": 1.83534903458519,
      "grad_norm": 0.5269636846090152,
      "learning_rate": 4.719664389324296e-05,
      "loss": 1.9303,
      "num_input_tokens_seen": 13611053472,
      "step": 17300
    },
    {
      "epoch": 1.8354551241247612,
      "grad_norm": 0.4729889683433832,
      "learning_rate": 4.719632412770738e-05,
      "loss": 1.8286,
      "num_input_tokens_seen": 13611840272,
      "step": 17301
    },
    {
      "epoch": 1.8355612136643327,
      "grad_norm": 0.3935375304950499,
      "learning_rate": 4.719600434501913e-05,
      "loss": 1.6815,
      "num_input_tokens_seen": 13612627168,
      "step": 17302
    },
    {
      "epoch": 1.8356673032039041,
      "grad_norm": 0.36922677808180226,
      "learning_rate": 4.719568454517847e-05,
      "loss": 1.6756,
      "num_input_tokens_seen": 13613413920,
      "step": 17303
    },
    {
      "epoch": 1.8357733927434756,
      "grad_norm": 0.42288711285388336,
      "learning_rate": 4.719536472818562e-05,
      "loss": 1.7839,
      "num_input_tokens_seen": 13614200704,
      "step": 17304
    },
    {
      "epoch": 1.8358794822830469,
      "grad_norm": 0.35238511546091433,
      "learning_rate": 4.7195044894040855e-05,
      "loss": 1.7063,
      "num_input_tokens_seen": 13614987488,
      "step": 17305
    },
    {
      "epoch": 1.8359855718226183,
      "grad_norm": 0.4301727106507961,
      "learning_rate": 4.7194725042744405e-05,
      "loss": 1.7506,
      "num_input_tokens_seen": 13615774256,
      "step": 17306
    },
    {
      "epoch": 1.8360916613621896,
      "grad_norm": 0.3482770308127855,
      "learning_rate": 4.719440517429652e-05,
      "loss": 1.7108,
      "num_input_tokens_seen": 13616561024,
      "step": 17307
    },
    {
      "epoch": 1.836197750901761,
      "grad_norm": 0.41471754801440575,
      "learning_rate": 4.719408528869746e-05,
      "loss": 1.7558,
      "num_input_tokens_seen": 13617347744,
      "step": 17308
    },
    {
      "epoch": 1.8363038404413325,
      "grad_norm": 0.41422594406609836,
      "learning_rate": 4.719376538594745e-05,
      "loss": 1.614,
      "num_input_tokens_seen": 13618134480,
      "step": 17309
    },
    {
      "epoch": 1.836409929980904,
      "grad_norm": 0.43455785045049883,
      "learning_rate": 4.719344546604676e-05,
      "loss": 1.7005,
      "num_input_tokens_seen": 13618921248,
      "step": 17310
    },
    {
      "epoch": 1.8365160195204753,
      "grad_norm": 0.3967055503713919,
      "learning_rate": 4.7193125528995625e-05,
      "loss": 1.7304,
      "num_input_tokens_seen": 13619708032,
      "step": 17311
    },
    {
      "epoch": 1.8366221090600465,
      "grad_norm": 0.5058362866362932,
      "learning_rate": 4.719280557479429e-05,
      "loss": 1.5852,
      "num_input_tokens_seen": 13620494800,
      "step": 17312
    },
    {
      "epoch": 1.836728198599618,
      "grad_norm": 0.4187269450346132,
      "learning_rate": 4.719248560344301e-05,
      "loss": 1.8832,
      "num_input_tokens_seen": 13621281520,
      "step": 17313
    },
    {
      "epoch": 1.8368342881391895,
      "grad_norm": 0.32471355988725487,
      "learning_rate": 4.7192165614942026e-05,
      "loss": 1.5282,
      "num_input_tokens_seen": 13622068368,
      "step": 17314
    },
    {
      "epoch": 1.836940377678761,
      "grad_norm": 0.6941451919635613,
      "learning_rate": 4.719184560929158e-05,
      "loss": 1.6996,
      "num_input_tokens_seen": 13622855152,
      "step": 17315
    },
    {
      "epoch": 1.8370464672183324,
      "grad_norm": 0.41631610990297924,
      "learning_rate": 4.7191525586491934e-05,
      "loss": 1.748,
      "num_input_tokens_seen": 13623641888,
      "step": 17316
    },
    {
      "epoch": 1.8371525567579037,
      "grad_norm": 0.6631587627746298,
      "learning_rate": 4.719120554654333e-05,
      "loss": 1.8317,
      "num_input_tokens_seen": 13624428656,
      "step": 17317
    },
    {
      "epoch": 1.837258646297475,
      "grad_norm": 0.43435664772026206,
      "learning_rate": 4.719088548944601e-05,
      "loss": 1.6297,
      "num_input_tokens_seen": 13625215344,
      "step": 17318
    },
    {
      "epoch": 1.8373647358370464,
      "grad_norm": 0.7533844280318699,
      "learning_rate": 4.719056541520023e-05,
      "loss": 1.8401,
      "num_input_tokens_seen": 13626002208,
      "step": 17319
    },
    {
      "epoch": 1.8374708253766179,
      "grad_norm": 0.4890364961585746,
      "learning_rate": 4.719024532380623e-05,
      "loss": 1.712,
      "num_input_tokens_seen": 13626789088,
      "step": 17320
    },
    {
      "epoch": 1.8375769149161894,
      "grad_norm": 0.627405205359398,
      "learning_rate": 4.718992521526426e-05,
      "loss": 1.8098,
      "num_input_tokens_seen": 13627575856,
      "step": 17321
    },
    {
      "epoch": 1.8376830044557608,
      "grad_norm": 0.3861336788768177,
      "learning_rate": 4.718960508957456e-05,
      "loss": 1.7604,
      "num_input_tokens_seen": 13628362640,
      "step": 17322
    },
    {
      "epoch": 1.837789093995332,
      "grad_norm": 0.4834199940010527,
      "learning_rate": 4.7189284946737394e-05,
      "loss": 1.7856,
      "num_input_tokens_seen": 13629149424,
      "step": 17323
    },
    {
      "epoch": 1.8378951835349033,
      "grad_norm": 0.4008983029250492,
      "learning_rate": 4.7188964786752994e-05,
      "loss": 1.7098,
      "num_input_tokens_seen": 13629936144,
      "step": 17324
    },
    {
      "epoch": 1.8380012730744748,
      "grad_norm": 0.4924877557650998,
      "learning_rate": 4.718864460962161e-05,
      "loss": 1.8279,
      "num_input_tokens_seen": 13630722848,
      "step": 17325
    },
    {
      "epoch": 1.8381073626140463,
      "grad_norm": 0.3949416167193192,
      "learning_rate": 4.7188324415343496e-05,
      "loss": 1.764,
      "num_input_tokens_seen": 13631509680,
      "step": 17326
    },
    {
      "epoch": 1.8382134521536178,
      "grad_norm": 0.35662026575215094,
      "learning_rate": 4.71880042039189e-05,
      "loss": 1.7779,
      "num_input_tokens_seen": 13632296432,
      "step": 17327
    },
    {
      "epoch": 1.838319541693189,
      "grad_norm": 0.34947312152992277,
      "learning_rate": 4.718768397534806e-05,
      "loss": 1.5267,
      "num_input_tokens_seen": 13633083152,
      "step": 17328
    },
    {
      "epoch": 1.8384256312327605,
      "grad_norm": 0.4174018445913978,
      "learning_rate": 4.7187363729631233e-05,
      "loss": 1.6975,
      "num_input_tokens_seen": 13633870016,
      "step": 17329
    },
    {
      "epoch": 1.8385317207723317,
      "grad_norm": 0.3725383272780388,
      "learning_rate": 4.7187043466768664e-05,
      "loss": 1.7109,
      "num_input_tokens_seen": 13634656864,
      "step": 17330
    },
    {
      "epoch": 1.8386378103119032,
      "grad_norm": 0.42553722327375676,
      "learning_rate": 4.71867231867606e-05,
      "loss": 1.6279,
      "num_input_tokens_seen": 13635443664,
      "step": 17331
    },
    {
      "epoch": 1.8387438998514747,
      "grad_norm": 0.3316029364096694,
      "learning_rate": 4.7186402889607274e-05,
      "loss": 1.6754,
      "num_input_tokens_seen": 13636230560,
      "step": 17332
    },
    {
      "epoch": 1.8388499893910462,
      "grad_norm": 0.3603619903054172,
      "learning_rate": 4.7186082575308955e-05,
      "loss": 1.8074,
      "num_input_tokens_seen": 13637017344,
      "step": 17333
    },
    {
      "epoch": 1.8389560789306174,
      "grad_norm": 0.348626741854351,
      "learning_rate": 4.718576224386588e-05,
      "loss": 1.6404,
      "num_input_tokens_seen": 13637804080,
      "step": 17334
    },
    {
      "epoch": 1.8390621684701889,
      "grad_norm": 0.39349292508109307,
      "learning_rate": 4.718544189527831e-05,
      "loss": 1.6501,
      "num_input_tokens_seen": 13638590912,
      "step": 17335
    },
    {
      "epoch": 1.8391682580097601,
      "grad_norm": 0.3472482273389269,
      "learning_rate": 4.7185121529546466e-05,
      "loss": 1.5765,
      "num_input_tokens_seen": 13639377600,
      "step": 17336
    },
    {
      "epoch": 1.8392743475493316,
      "grad_norm": 0.40570243460067446,
      "learning_rate": 4.718480114667062e-05,
      "loss": 1.7031,
      "num_input_tokens_seen": 13640164304,
      "step": 17337
    },
    {
      "epoch": 1.839380437088903,
      "grad_norm": 0.3273562714398755,
      "learning_rate": 4.7184480746651006e-05,
      "loss": 1.6965,
      "num_input_tokens_seen": 13640951008,
      "step": 17338
    },
    {
      "epoch": 1.8394865266284746,
      "grad_norm": 0.4044587991974773,
      "learning_rate": 4.718416032948788e-05,
      "loss": 1.7851,
      "num_input_tokens_seen": 13641737840,
      "step": 17339
    },
    {
      "epoch": 1.8395926161680458,
      "grad_norm": 0.34474574587480517,
      "learning_rate": 4.718383989518148e-05,
      "loss": 1.7445,
      "num_input_tokens_seen": 13642524480,
      "step": 17340
    },
    {
      "epoch": 1.839698705707617,
      "grad_norm": 0.36464627341834627,
      "learning_rate": 4.718351944373207e-05,
      "loss": 1.7405,
      "num_input_tokens_seen": 13643311248,
      "step": 17341
    },
    {
      "epoch": 1.8398047952471885,
      "grad_norm": 0.3287960430520748,
      "learning_rate": 4.718319897513988e-05,
      "loss": 1.7067,
      "num_input_tokens_seen": 13644097984,
      "step": 17342
    },
    {
      "epoch": 1.83991088478676,
      "grad_norm": 0.5009133337027236,
      "learning_rate": 4.7182878489405166e-05,
      "loss": 1.7233,
      "num_input_tokens_seen": 13644884816,
      "step": 17343
    },
    {
      "epoch": 1.8400169743263315,
      "grad_norm": 0.42399552959574527,
      "learning_rate": 4.7182557986528174e-05,
      "loss": 1.7409,
      "num_input_tokens_seen": 13645671568,
      "step": 17344
    },
    {
      "epoch": 1.840123063865903,
      "grad_norm": 0.5423858873149249,
      "learning_rate": 4.718223746650915e-05,
      "loss": 1.7138,
      "num_input_tokens_seen": 13646458256,
      "step": 17345
    },
    {
      "epoch": 1.8402291534054742,
      "grad_norm": 0.44305919218347223,
      "learning_rate": 4.718191692934835e-05,
      "loss": 1.7861,
      "num_input_tokens_seen": 13647245008,
      "step": 17346
    },
    {
      "epoch": 1.8403352429450455,
      "grad_norm": 0.48713947545891884,
      "learning_rate": 4.7181596375046014e-05,
      "loss": 1.706,
      "num_input_tokens_seen": 13648031824,
      "step": 17347
    },
    {
      "epoch": 1.840441332484617,
      "grad_norm": 0.44630565143765577,
      "learning_rate": 4.718127580360239e-05,
      "loss": 1.6511,
      "num_input_tokens_seen": 13648818624,
      "step": 17348
    },
    {
      "epoch": 1.8405474220241884,
      "grad_norm": 0.3261101537753863,
      "learning_rate": 4.718095521501772e-05,
      "loss": 1.6714,
      "num_input_tokens_seen": 13649605472,
      "step": 17349
    },
    {
      "epoch": 1.84065351156376,
      "grad_norm": 0.3919148953604753,
      "learning_rate": 4.718063460929226e-05,
      "loss": 1.6812,
      "num_input_tokens_seen": 13650392304,
      "step": 17350
    },
    {
      "epoch": 1.8407596011033314,
      "grad_norm": 0.4117653772385621,
      "learning_rate": 4.718031398642626e-05,
      "loss": 1.8088,
      "num_input_tokens_seen": 13651179104,
      "step": 17351
    },
    {
      "epoch": 1.8408656906429026,
      "grad_norm": 0.38539908094074343,
      "learning_rate": 4.717999334641997e-05,
      "loss": 1.6706,
      "num_input_tokens_seen": 13651965856,
      "step": 17352
    },
    {
      "epoch": 1.8409717801824739,
      "grad_norm": 0.4559254050172383,
      "learning_rate": 4.7179672689273625e-05,
      "loss": 1.5963,
      "num_input_tokens_seen": 13652752656,
      "step": 17353
    },
    {
      "epoch": 1.8410778697220453,
      "grad_norm": 0.42265748769532774,
      "learning_rate": 4.7179352014987475e-05,
      "loss": 1.6286,
      "num_input_tokens_seen": 13653539344,
      "step": 17354
    },
    {
      "epoch": 1.8411839592616168,
      "grad_norm": 0.4251312606704738,
      "learning_rate": 4.717903132356178e-05,
      "loss": 1.6042,
      "num_input_tokens_seen": 13654326096,
      "step": 17355
    },
    {
      "epoch": 1.8412900488011883,
      "grad_norm": 0.4296137342220186,
      "learning_rate": 4.717871061499678e-05,
      "loss": 1.7925,
      "num_input_tokens_seen": 13655112768,
      "step": 17356
    },
    {
      "epoch": 1.8413961383407595,
      "grad_norm": 0.4686611549139297,
      "learning_rate": 4.717838988929273e-05,
      "loss": 1.6005,
      "num_input_tokens_seen": 13655899568,
      "step": 17357
    },
    {
      "epoch": 1.841502227880331,
      "grad_norm": 0.40967310270269863,
      "learning_rate": 4.717806914644986e-05,
      "loss": 1.6403,
      "num_input_tokens_seen": 13656686368,
      "step": 17358
    },
    {
      "epoch": 1.8416083174199023,
      "grad_norm": 0.37895521385784364,
      "learning_rate": 4.717774838646844e-05,
      "loss": 1.6755,
      "num_input_tokens_seen": 13657473216,
      "step": 17359
    },
    {
      "epoch": 1.8417144069594737,
      "grad_norm": 0.34353238610703773,
      "learning_rate": 4.717742760934869e-05,
      "loss": 1.6788,
      "num_input_tokens_seen": 13658260000,
      "step": 17360
    },
    {
      "epoch": 1.8418204964990452,
      "grad_norm": 0.4245092681269432,
      "learning_rate": 4.717710681509089e-05,
      "loss": 1.7277,
      "num_input_tokens_seen": 13659046752,
      "step": 17361
    },
    {
      "epoch": 1.8419265860386167,
      "grad_norm": 0.3656369257450484,
      "learning_rate": 4.717678600369526e-05,
      "loss": 1.7314,
      "num_input_tokens_seen": 13659833504,
      "step": 17362
    },
    {
      "epoch": 1.842032675578188,
      "grad_norm": 0.38966873072318836,
      "learning_rate": 4.7176465175162065e-05,
      "loss": 1.6955,
      "num_input_tokens_seen": 13660620208,
      "step": 17363
    },
    {
      "epoch": 1.8421387651177594,
      "grad_norm": 0.3819301859158101,
      "learning_rate": 4.717614432949156e-05,
      "loss": 1.7419,
      "num_input_tokens_seen": 13661406944,
      "step": 17364
    },
    {
      "epoch": 1.8422448546573307,
      "grad_norm": 0.4303854836922219,
      "learning_rate": 4.717582346668397e-05,
      "loss": 1.7319,
      "num_input_tokens_seen": 13662193648,
      "step": 17365
    },
    {
      "epoch": 1.8423509441969022,
      "grad_norm": 0.4442801502283938,
      "learning_rate": 4.717550258673955e-05,
      "loss": 1.7158,
      "num_input_tokens_seen": 13662980512,
      "step": 17366
    },
    {
      "epoch": 1.8424570337364736,
      "grad_norm": 0.3901939466653862,
      "learning_rate": 4.717518168965856e-05,
      "loss": 1.7378,
      "num_input_tokens_seen": 13663767408,
      "step": 17367
    },
    {
      "epoch": 1.842563123276045,
      "grad_norm": 0.46780860723309614,
      "learning_rate": 4.717486077544124e-05,
      "loss": 1.6487,
      "num_input_tokens_seen": 13664554272,
      "step": 17368
    },
    {
      "epoch": 1.8426692128156164,
      "grad_norm": 0.3527662820605219,
      "learning_rate": 4.7174539844087834e-05,
      "loss": 1.5318,
      "num_input_tokens_seen": 13665341040,
      "step": 17369
    },
    {
      "epoch": 1.8427753023551878,
      "grad_norm": 0.5456478561116643,
      "learning_rate": 4.71742188955986e-05,
      "loss": 1.6799,
      "num_input_tokens_seen": 13666127888,
      "step": 17370
    },
    {
      "epoch": 1.842881391894759,
      "grad_norm": 0.41070508341922507,
      "learning_rate": 4.7173897929973774e-05,
      "loss": 1.7926,
      "num_input_tokens_seen": 13666914576,
      "step": 17371
    },
    {
      "epoch": 1.8429874814343306,
      "grad_norm": 0.427810233173038,
      "learning_rate": 4.7173576947213614e-05,
      "loss": 1.873,
      "num_input_tokens_seen": 13667701216,
      "step": 17372
    },
    {
      "epoch": 1.843093570973902,
      "grad_norm": 0.35894568630090495,
      "learning_rate": 4.717325594731836e-05,
      "loss": 1.6225,
      "num_input_tokens_seen": 13668487920,
      "step": 17373
    },
    {
      "epoch": 1.8431996605134735,
      "grad_norm": 0.49700780578936066,
      "learning_rate": 4.717293493028827e-05,
      "loss": 1.836,
      "num_input_tokens_seen": 13669274720,
      "step": 17374
    },
    {
      "epoch": 1.8433057500530448,
      "grad_norm": 0.42290440950379166,
      "learning_rate": 4.717261389612359e-05,
      "loss": 1.7725,
      "num_input_tokens_seen": 13670061536,
      "step": 17375
    },
    {
      "epoch": 1.843411839592616,
      "grad_norm": 0.3931818083920136,
      "learning_rate": 4.7172292844824557e-05,
      "loss": 1.659,
      "num_input_tokens_seen": 13670848320,
      "step": 17376
    },
    {
      "epoch": 1.8435179291321875,
      "grad_norm": 0.35987054500990445,
      "learning_rate": 4.717197177639143e-05,
      "loss": 1.8798,
      "num_input_tokens_seen": 13671635008,
      "step": 17377
    },
    {
      "epoch": 1.843624018671759,
      "grad_norm": 0.32733662030213095,
      "learning_rate": 4.717165069082446e-05,
      "loss": 1.5086,
      "num_input_tokens_seen": 13672421840,
      "step": 17378
    },
    {
      "epoch": 1.8437301082113304,
      "grad_norm": 0.4969575402645176,
      "learning_rate": 4.717132958812387e-05,
      "loss": 1.8159,
      "num_input_tokens_seen": 13673208608,
      "step": 17379
    },
    {
      "epoch": 1.843836197750902,
      "grad_norm": 0.39928163613200734,
      "learning_rate": 4.717100846828994e-05,
      "loss": 1.6978,
      "num_input_tokens_seen": 13673995376,
      "step": 17380
    },
    {
      "epoch": 1.8439422872904732,
      "grad_norm": 0.4587884593251619,
      "learning_rate": 4.7170687331322904e-05,
      "loss": 1.774,
      "num_input_tokens_seen": 13674782176,
      "step": 17381
    },
    {
      "epoch": 1.8440483768300444,
      "grad_norm": 0.3994271857079584,
      "learning_rate": 4.7170366177223015e-05,
      "loss": 1.683,
      "num_input_tokens_seen": 13675569072,
      "step": 17382
    },
    {
      "epoch": 1.8441544663696159,
      "grad_norm": 0.5479918622278017,
      "learning_rate": 4.717004500599051e-05,
      "loss": 1.77,
      "num_input_tokens_seen": 13676355808,
      "step": 17383
    },
    {
      "epoch": 1.8442605559091874,
      "grad_norm": 0.4799241725249936,
      "learning_rate": 4.716972381762565e-05,
      "loss": 1.8024,
      "num_input_tokens_seen": 13677142544,
      "step": 17384
    },
    {
      "epoch": 1.8443666454487588,
      "grad_norm": 0.552363021777409,
      "learning_rate": 4.7169402612128676e-05,
      "loss": 1.7835,
      "num_input_tokens_seen": 13677929280,
      "step": 17385
    },
    {
      "epoch": 1.8444727349883303,
      "grad_norm": 0.4550893648711563,
      "learning_rate": 4.716908138949984e-05,
      "loss": 1.8265,
      "num_input_tokens_seen": 13678716032,
      "step": 17386
    },
    {
      "epoch": 1.8445788245279016,
      "grad_norm": 0.5599084618018315,
      "learning_rate": 4.716876014973939e-05,
      "loss": 1.6657,
      "num_input_tokens_seen": 13679502816,
      "step": 17387
    },
    {
      "epoch": 1.8446849140674728,
      "grad_norm": 0.5552459294085543,
      "learning_rate": 4.716843889284757e-05,
      "loss": 1.7802,
      "num_input_tokens_seen": 13680289568,
      "step": 17388
    },
    {
      "epoch": 1.8447910036070443,
      "grad_norm": 0.4347019245821952,
      "learning_rate": 4.7168117618824626e-05,
      "loss": 1.8437,
      "num_input_tokens_seen": 13681076208,
      "step": 17389
    },
    {
      "epoch": 1.8448970931466158,
      "grad_norm": 0.39613324766207597,
      "learning_rate": 4.7167796327670815e-05,
      "loss": 1.8334,
      "num_input_tokens_seen": 13681862976,
      "step": 17390
    },
    {
      "epoch": 1.8450031826861872,
      "grad_norm": 0.41035288636815787,
      "learning_rate": 4.7167475019386386e-05,
      "loss": 1.7804,
      "num_input_tokens_seen": 13682649728,
      "step": 17391
    },
    {
      "epoch": 1.8451092722257585,
      "grad_norm": 0.34746651099374726,
      "learning_rate": 4.7167153693971576e-05,
      "loss": 1.5726,
      "num_input_tokens_seen": 13683436560,
      "step": 17392
    },
    {
      "epoch": 1.84521536176533,
      "grad_norm": 0.3974466453274148,
      "learning_rate": 4.716683235142664e-05,
      "loss": 1.7074,
      "num_input_tokens_seen": 13684223360,
      "step": 17393
    },
    {
      "epoch": 1.8453214513049012,
      "grad_norm": 0.4040005863186687,
      "learning_rate": 4.716651099175183e-05,
      "loss": 1.6885,
      "num_input_tokens_seen": 13685010032,
      "step": 17394
    },
    {
      "epoch": 1.8454275408444727,
      "grad_norm": 0.5624426843249848,
      "learning_rate": 4.716618961494739e-05,
      "loss": 1.783,
      "num_input_tokens_seen": 13685796768,
      "step": 17395
    },
    {
      "epoch": 1.8455336303840442,
      "grad_norm": 0.4686947852427775,
      "learning_rate": 4.716586822101357e-05,
      "loss": 1.6891,
      "num_input_tokens_seen": 13686583568,
      "step": 17396
    },
    {
      "epoch": 1.8456397199236156,
      "grad_norm": 0.6066289446020373,
      "learning_rate": 4.716554680995062e-05,
      "loss": 1.7233,
      "num_input_tokens_seen": 13687370272,
      "step": 17397
    },
    {
      "epoch": 1.845745809463187,
      "grad_norm": 0.4053522494458371,
      "learning_rate": 4.716522538175878e-05,
      "loss": 1.6076,
      "num_input_tokens_seen": 13688157104,
      "step": 17398
    },
    {
      "epoch": 1.8458518990027584,
      "grad_norm": 0.6388181639095475,
      "learning_rate": 4.7164903936438306e-05,
      "loss": 1.7657,
      "num_input_tokens_seen": 13688943904,
      "step": 17399
    },
    {
      "epoch": 1.8459579885423296,
      "grad_norm": 0.37706197975942474,
      "learning_rate": 4.716458247398944e-05,
      "loss": 1.727,
      "num_input_tokens_seen": 13689730576,
      "step": 17400
    },
    {
      "epoch": 1.846064078081901,
      "grad_norm": 0.630037681361897,
      "learning_rate": 4.716426099441245e-05,
      "loss": 1.6922,
      "num_input_tokens_seen": 13690517376,
      "step": 17401
    },
    {
      "epoch": 1.8461701676214726,
      "grad_norm": 0.4180028985558135,
      "learning_rate": 4.716393949770755e-05,
      "loss": 1.859,
      "num_input_tokens_seen": 13691304144,
      "step": 17402
    },
    {
      "epoch": 1.846276257161044,
      "grad_norm": 0.4612579095518753,
      "learning_rate": 4.716361798387502e-05,
      "loss": 1.699,
      "num_input_tokens_seen": 13692090944,
      "step": 17403
    },
    {
      "epoch": 1.8463823467006153,
      "grad_norm": 0.464183056063481,
      "learning_rate": 4.7163296452915095e-05,
      "loss": 1.7281,
      "num_input_tokens_seen": 13692877664,
      "step": 17404
    },
    {
      "epoch": 1.8464884362401868,
      "grad_norm": 0.4351068739008349,
      "learning_rate": 4.716297490482802e-05,
      "loss": 1.7659,
      "num_input_tokens_seen": 13693664448,
      "step": 17405
    },
    {
      "epoch": 1.846594525779758,
      "grad_norm": 0.4455946833280634,
      "learning_rate": 4.716265333961405e-05,
      "loss": 1.6244,
      "num_input_tokens_seen": 13694451232,
      "step": 17406
    },
    {
      "epoch": 1.8467006153193295,
      "grad_norm": 0.393401137998516,
      "learning_rate": 4.7162331757273434e-05,
      "loss": 1.6082,
      "num_input_tokens_seen": 13695238000,
      "step": 17407
    },
    {
      "epoch": 1.846806704858901,
      "grad_norm": 0.36360371574852157,
      "learning_rate": 4.7162010157806427e-05,
      "loss": 1.6743,
      "num_input_tokens_seen": 13696024832,
      "step": 17408
    },
    {
      "epoch": 1.8469127943984724,
      "grad_norm": 0.5528429542954642,
      "learning_rate": 4.716168854121325e-05,
      "loss": 1.7233,
      "num_input_tokens_seen": 13696811680,
      "step": 17409
    },
    {
      "epoch": 1.8470188839380437,
      "grad_norm": 0.34884722838090015,
      "learning_rate": 4.7161366907494185e-05,
      "loss": 1.598,
      "num_input_tokens_seen": 13697598496,
      "step": 17410
    },
    {
      "epoch": 1.847124973477615,
      "grad_norm": 0.4259650367058765,
      "learning_rate": 4.716104525664946e-05,
      "loss": 1.7593,
      "num_input_tokens_seen": 13698385232,
      "step": 17411
    },
    {
      "epoch": 1.8472310630171864,
      "grad_norm": 0.4606599214536638,
      "learning_rate": 4.716072358867933e-05,
      "loss": 1.7273,
      "num_input_tokens_seen": 13699171936,
      "step": 17412
    },
    {
      "epoch": 1.847337152556758,
      "grad_norm": 0.34830740470912147,
      "learning_rate": 4.7160401903584044e-05,
      "loss": 1.9029,
      "num_input_tokens_seen": 13699958640,
      "step": 17413
    },
    {
      "epoch": 1.8474432420963294,
      "grad_norm": 0.5449355677451165,
      "learning_rate": 4.7160080201363856e-05,
      "loss": 1.5926,
      "num_input_tokens_seen": 13700745456,
      "step": 17414
    },
    {
      "epoch": 1.8475493316359008,
      "grad_norm": 0.4811450502169364,
      "learning_rate": 4.715975848201899e-05,
      "loss": 1.7667,
      "num_input_tokens_seen": 13701532208,
      "step": 17415
    },
    {
      "epoch": 1.847655421175472,
      "grad_norm": 0.5248572380383031,
      "learning_rate": 4.715943674554973e-05,
      "loss": 1.6162,
      "num_input_tokens_seen": 13702319008,
      "step": 17416
    },
    {
      "epoch": 1.8477615107150434,
      "grad_norm": 0.42652029181508866,
      "learning_rate": 4.71591149919563e-05,
      "loss": 1.6145,
      "num_input_tokens_seen": 13703105744,
      "step": 17417
    },
    {
      "epoch": 1.8478676002546148,
      "grad_norm": 0.3534561625866818,
      "learning_rate": 4.715879322123896e-05,
      "loss": 1.6161,
      "num_input_tokens_seen": 13703892640,
      "step": 17418
    },
    {
      "epoch": 1.8479736897941863,
      "grad_norm": 0.4437240986100957,
      "learning_rate": 4.715847143339795e-05,
      "loss": 1.7928,
      "num_input_tokens_seen": 13704679424,
      "step": 17419
    },
    {
      "epoch": 1.8480797793337578,
      "grad_norm": 0.4117269939195713,
      "learning_rate": 4.715814962843353e-05,
      "loss": 1.838,
      "num_input_tokens_seen": 13705466096,
      "step": 17420
    },
    {
      "epoch": 1.8481858688733293,
      "grad_norm": 0.3782422748338072,
      "learning_rate": 4.7157827806345935e-05,
      "loss": 1.7623,
      "num_input_tokens_seen": 13706252880,
      "step": 17421
    },
    {
      "epoch": 1.8482919584129005,
      "grad_norm": 0.4345136947792834,
      "learning_rate": 4.715750596713543e-05,
      "loss": 1.7507,
      "num_input_tokens_seen": 13707039616,
      "step": 17422
    },
    {
      "epoch": 1.8483980479524718,
      "grad_norm": 0.45272058108784813,
      "learning_rate": 4.715718411080224e-05,
      "loss": 1.786,
      "num_input_tokens_seen": 13707826416,
      "step": 17423
    },
    {
      "epoch": 1.8485041374920432,
      "grad_norm": 0.42533270032916976,
      "learning_rate": 4.7156862237346647e-05,
      "loss": 1.7177,
      "num_input_tokens_seen": 13708613200,
      "step": 17424
    },
    {
      "epoch": 1.8486102270316147,
      "grad_norm": 0.49053168589192103,
      "learning_rate": 4.715654034676886e-05,
      "loss": 1.8828,
      "num_input_tokens_seen": 13709399904,
      "step": 17425
    },
    {
      "epoch": 1.8487163165711862,
      "grad_norm": 0.37270959388680497,
      "learning_rate": 4.715621843906917e-05,
      "loss": 1.6705,
      "num_input_tokens_seen": 13710186816,
      "step": 17426
    },
    {
      "epoch": 1.8488224061107574,
      "grad_norm": 0.36780058349094064,
      "learning_rate": 4.7155896514247786e-05,
      "loss": 1.7158,
      "num_input_tokens_seen": 13710973536,
      "step": 17427
    },
    {
      "epoch": 1.848928495650329,
      "grad_norm": 0.3228084535408784,
      "learning_rate": 4.715557457230498e-05,
      "loss": 1.5994,
      "num_input_tokens_seen": 13711760304,
      "step": 17428
    },
    {
      "epoch": 1.8490345851899002,
      "grad_norm": 0.36510885426131595,
      "learning_rate": 4.7155252613241006e-05,
      "loss": 1.6123,
      "num_input_tokens_seen": 13712547136,
      "step": 17429
    },
    {
      "epoch": 1.8491406747294716,
      "grad_norm": 0.3624065635901658,
      "learning_rate": 4.7154930637056095e-05,
      "loss": 1.7466,
      "num_input_tokens_seen": 13713333952,
      "step": 17430
    },
    {
      "epoch": 1.849246764269043,
      "grad_norm": 0.33960655955617075,
      "learning_rate": 4.71546086437505e-05,
      "loss": 1.7515,
      "num_input_tokens_seen": 13714120736,
      "step": 17431
    },
    {
      "epoch": 1.8493528538086146,
      "grad_norm": 0.4446579099144684,
      "learning_rate": 4.715428663332449e-05,
      "loss": 1.7654,
      "num_input_tokens_seen": 13714907392,
      "step": 17432
    },
    {
      "epoch": 1.8494589433481858,
      "grad_norm": 0.34492830273058633,
      "learning_rate": 4.7153964605778276e-05,
      "loss": 1.8726,
      "num_input_tokens_seen": 13715694192,
      "step": 17433
    },
    {
      "epoch": 1.8495650328877573,
      "grad_norm": 0.5048129847025028,
      "learning_rate": 4.715364256111214e-05,
      "loss": 1.7246,
      "num_input_tokens_seen": 13716480928,
      "step": 17434
    },
    {
      "epoch": 1.8496711224273286,
      "grad_norm": 0.4779564698652598,
      "learning_rate": 4.715332049932631e-05,
      "loss": 1.8291,
      "num_input_tokens_seen": 13717267632,
      "step": 17435
    },
    {
      "epoch": 1.8497772119669,
      "grad_norm": 0.3767918365381214,
      "learning_rate": 4.715299842042106e-05,
      "loss": 1.5533,
      "num_input_tokens_seen": 13718054432,
      "step": 17436
    },
    {
      "epoch": 1.8498833015064715,
      "grad_norm": 0.5165020535904955,
      "learning_rate": 4.715267632439661e-05,
      "loss": 1.6955,
      "num_input_tokens_seen": 13718841216,
      "step": 17437
    },
    {
      "epoch": 1.849989391046043,
      "grad_norm": 0.37896691084872897,
      "learning_rate": 4.715235421125322e-05,
      "loss": 1.642,
      "num_input_tokens_seen": 13719628096,
      "step": 17438
    },
    {
      "epoch": 1.8500954805856142,
      "grad_norm": 0.3981660899900386,
      "learning_rate": 4.7152032080991155e-05,
      "loss": 1.7216,
      "num_input_tokens_seen": 13720414960,
      "step": 17439
    },
    {
      "epoch": 1.8502015701251855,
      "grad_norm": 0.4915107919937932,
      "learning_rate": 4.715170993361064e-05,
      "loss": 1.7475,
      "num_input_tokens_seen": 13721201792,
      "step": 17440
    },
    {
      "epoch": 1.850307659664757,
      "grad_norm": 0.4268438261768382,
      "learning_rate": 4.7151387769111935e-05,
      "loss": 1.6446,
      "num_input_tokens_seen": 13721988624,
      "step": 17441
    },
    {
      "epoch": 1.8504137492043284,
      "grad_norm": 0.483688025308079,
      "learning_rate": 4.7151065587495284e-05,
      "loss": 1.914,
      "num_input_tokens_seen": 13722775552,
      "step": 17442
    },
    {
      "epoch": 1.8505198387439,
      "grad_norm": 0.36002007685709003,
      "learning_rate": 4.715074338876094e-05,
      "loss": 1.7214,
      "num_input_tokens_seen": 13723562304,
      "step": 17443
    },
    {
      "epoch": 1.8506259282834714,
      "grad_norm": 0.41338869130911154,
      "learning_rate": 4.715042117290915e-05,
      "loss": 1.9091,
      "num_input_tokens_seen": 13724349056,
      "step": 17444
    },
    {
      "epoch": 1.8507320178230426,
      "grad_norm": 0.4208104879750709,
      "learning_rate": 4.715009893994017e-05,
      "loss": 1.8217,
      "num_input_tokens_seen": 13725135808,
      "step": 17445
    },
    {
      "epoch": 1.850838107362614,
      "grad_norm": 0.37400235980771174,
      "learning_rate": 4.714977668985425e-05,
      "loss": 1.6714,
      "num_input_tokens_seen": 13725922448,
      "step": 17446
    },
    {
      "epoch": 1.8509441969021854,
      "grad_norm": 0.3692985639662578,
      "learning_rate": 4.714945442265162e-05,
      "loss": 1.634,
      "num_input_tokens_seen": 13726709200,
      "step": 17447
    },
    {
      "epoch": 1.8510502864417568,
      "grad_norm": 0.3268795859146476,
      "learning_rate": 4.714913213833255e-05,
      "loss": 1.7367,
      "num_input_tokens_seen": 13727495968,
      "step": 17448
    },
    {
      "epoch": 1.8511563759813283,
      "grad_norm": 0.39254841466813817,
      "learning_rate": 4.7148809836897266e-05,
      "loss": 1.7023,
      "num_input_tokens_seen": 13728282816,
      "step": 17449
    },
    {
      "epoch": 1.8512624655208998,
      "grad_norm": 0.3748605243391952,
      "learning_rate": 4.714848751834605e-05,
      "loss": 1.6926,
      "num_input_tokens_seen": 13729069648,
      "step": 17450
    },
    {
      "epoch": 1.851368555060471,
      "grad_norm": 0.3661875581463359,
      "learning_rate": 4.714816518267912e-05,
      "loss": 1.8114,
      "num_input_tokens_seen": 13729856336,
      "step": 17451
    },
    {
      "epoch": 1.8514746446000423,
      "grad_norm": 0.44674677299929344,
      "learning_rate": 4.714784282989674e-05,
      "loss": 1.6914,
      "num_input_tokens_seen": 13730643184,
      "step": 17452
    },
    {
      "epoch": 1.8515807341396138,
      "grad_norm": 0.31991945513702374,
      "learning_rate": 4.714752045999916e-05,
      "loss": 1.5966,
      "num_input_tokens_seen": 13731430080,
      "step": 17453
    },
    {
      "epoch": 1.8516868236791852,
      "grad_norm": 0.38928023200434975,
      "learning_rate": 4.714719807298663e-05,
      "loss": 1.5781,
      "num_input_tokens_seen": 13732216880,
      "step": 17454
    },
    {
      "epoch": 1.8517929132187567,
      "grad_norm": 0.36929217200696607,
      "learning_rate": 4.714687566885939e-05,
      "loss": 1.5266,
      "num_input_tokens_seen": 13733003744,
      "step": 17455
    },
    {
      "epoch": 1.8518990027583282,
      "grad_norm": 0.3384269111814197,
      "learning_rate": 4.7146553247617693e-05,
      "loss": 1.6437,
      "num_input_tokens_seen": 13733790544,
      "step": 17456
    },
    {
      "epoch": 1.8520050922978994,
      "grad_norm": 0.4725041661684847,
      "learning_rate": 4.714623080926179e-05,
      "loss": 1.9122,
      "num_input_tokens_seen": 13734577216,
      "step": 17457
    },
    {
      "epoch": 1.8521111818374707,
      "grad_norm": 0.35696836062910514,
      "learning_rate": 4.7145908353791934e-05,
      "loss": 1.7303,
      "num_input_tokens_seen": 13735363920,
      "step": 17458
    },
    {
      "epoch": 1.8522172713770422,
      "grad_norm": 0.46663730192093705,
      "learning_rate": 4.7145585881208365e-05,
      "loss": 1.7054,
      "num_input_tokens_seen": 13736150720,
      "step": 17459
    },
    {
      "epoch": 1.8523233609166136,
      "grad_norm": 0.38395695777295025,
      "learning_rate": 4.7145263391511343e-05,
      "loss": 1.8268,
      "num_input_tokens_seen": 13736937552,
      "step": 17460
    },
    {
      "epoch": 1.8524294504561851,
      "grad_norm": 0.3682029440995322,
      "learning_rate": 4.7144940884701105e-05,
      "loss": 1.7115,
      "num_input_tokens_seen": 13737724432,
      "step": 17461
    },
    {
      "epoch": 1.8525355399957564,
      "grad_norm": 0.38521317869638333,
      "learning_rate": 4.71446183607779e-05,
      "loss": 1.6611,
      "num_input_tokens_seen": 13738511232,
      "step": 17462
    },
    {
      "epoch": 1.8526416295353278,
      "grad_norm": 0.4413984390462966,
      "learning_rate": 4.7144295819742e-05,
      "loss": 1.857,
      "num_input_tokens_seen": 13739298016,
      "step": 17463
    },
    {
      "epoch": 1.852747719074899,
      "grad_norm": 0.36001887554161355,
      "learning_rate": 4.7143973261593624e-05,
      "loss": 1.6441,
      "num_input_tokens_seen": 13740084816,
      "step": 17464
    },
    {
      "epoch": 1.8528538086144706,
      "grad_norm": 0.3581063107809489,
      "learning_rate": 4.714365068633304e-05,
      "loss": 1.6481,
      "num_input_tokens_seen": 13740871600,
      "step": 17465
    },
    {
      "epoch": 1.852959898154042,
      "grad_norm": 0.3884055383056487,
      "learning_rate": 4.71433280939605e-05,
      "loss": 1.7521,
      "num_input_tokens_seen": 13741658352,
      "step": 17466
    },
    {
      "epoch": 1.8530659876936135,
      "grad_norm": 0.43207712121049585,
      "learning_rate": 4.7143005484476235e-05,
      "loss": 1.8858,
      "num_input_tokens_seen": 13742445088,
      "step": 17467
    },
    {
      "epoch": 1.8531720772331848,
      "grad_norm": 0.34985868262230074,
      "learning_rate": 4.7142682857880515e-05,
      "loss": 1.6632,
      "num_input_tokens_seen": 13743231856,
      "step": 17468
    },
    {
      "epoch": 1.8532781667727563,
      "grad_norm": 0.4557012696437801,
      "learning_rate": 4.714236021417358e-05,
      "loss": 1.7323,
      "num_input_tokens_seen": 13744018592,
      "step": 17469
    },
    {
      "epoch": 1.8533842563123275,
      "grad_norm": 0.41807837969168954,
      "learning_rate": 4.7142037553355665e-05,
      "loss": 1.8062,
      "num_input_tokens_seen": 13744805296,
      "step": 17470
    },
    {
      "epoch": 1.853490345851899,
      "grad_norm": 0.4117358939077631,
      "learning_rate": 4.714171487542704e-05,
      "loss": 1.766,
      "num_input_tokens_seen": 13745592032,
      "step": 17471
    },
    {
      "epoch": 1.8535964353914705,
      "grad_norm": 0.35226530019967034,
      "learning_rate": 4.7141392180387945e-05,
      "loss": 1.689,
      "num_input_tokens_seen": 13746378768,
      "step": 17472
    },
    {
      "epoch": 1.853702524931042,
      "grad_norm": 0.5217605345251994,
      "learning_rate": 4.714106946823864e-05,
      "loss": 1.8492,
      "num_input_tokens_seen": 13747165456,
      "step": 17473
    },
    {
      "epoch": 1.8538086144706132,
      "grad_norm": 0.35375232228922926,
      "learning_rate": 4.714074673897936e-05,
      "loss": 1.675,
      "num_input_tokens_seen": 13747952224,
      "step": 17474
    },
    {
      "epoch": 1.8539147040101844,
      "grad_norm": 0.38750655240851056,
      "learning_rate": 4.714042399261036e-05,
      "loss": 1.7355,
      "num_input_tokens_seen": 13748739008,
      "step": 17475
    },
    {
      "epoch": 1.854020793549756,
      "grad_norm": 0.4243723032858568,
      "learning_rate": 4.7140101229131895e-05,
      "loss": 1.7696,
      "num_input_tokens_seen": 13749525792,
      "step": 17476
    },
    {
      "epoch": 1.8541268830893274,
      "grad_norm": 0.32643136158815017,
      "learning_rate": 4.71397784485442e-05,
      "loss": 1.6502,
      "num_input_tokens_seen": 13750312512,
      "step": 17477
    },
    {
      "epoch": 1.8542329726288989,
      "grad_norm": 0.3843822382134956,
      "learning_rate": 4.713945565084754e-05,
      "loss": 1.6147,
      "num_input_tokens_seen": 13751099360,
      "step": 17478
    },
    {
      "epoch": 1.8543390621684703,
      "grad_norm": 0.4417526935489634,
      "learning_rate": 4.713913283604216e-05,
      "loss": 1.7477,
      "num_input_tokens_seen": 13751886128,
      "step": 17479
    },
    {
      "epoch": 1.8544451517080416,
      "grad_norm": 0.38919974783898803,
      "learning_rate": 4.713881000412831e-05,
      "loss": 1.8025,
      "num_input_tokens_seen": 13752672784,
      "step": 17480
    },
    {
      "epoch": 1.8545512412476128,
      "grad_norm": 0.35409282500000727,
      "learning_rate": 4.713848715510623e-05,
      "loss": 1.8032,
      "num_input_tokens_seen": 13753459424,
      "step": 17481
    },
    {
      "epoch": 1.8546573307871843,
      "grad_norm": 0.3397312312438732,
      "learning_rate": 4.713816428897618e-05,
      "loss": 1.7925,
      "num_input_tokens_seen": 13754246144,
      "step": 17482
    },
    {
      "epoch": 1.8547634203267558,
      "grad_norm": 0.41922942791726,
      "learning_rate": 4.7137841405738404e-05,
      "loss": 1.8326,
      "num_input_tokens_seen": 13755032976,
      "step": 17483
    },
    {
      "epoch": 1.8548695098663273,
      "grad_norm": 0.30857239249124924,
      "learning_rate": 4.7137518505393155e-05,
      "loss": 1.6404,
      "num_input_tokens_seen": 13755819744,
      "step": 17484
    },
    {
      "epoch": 1.8549755994058987,
      "grad_norm": 0.405049435600751,
      "learning_rate": 4.7137195587940686e-05,
      "loss": 1.821,
      "num_input_tokens_seen": 13756606480,
      "step": 17485
    },
    {
      "epoch": 1.85508168894547,
      "grad_norm": 0.3989230156750879,
      "learning_rate": 4.7136872653381235e-05,
      "loss": 1.796,
      "num_input_tokens_seen": 13757393168,
      "step": 17486
    },
    {
      "epoch": 1.8551877784850412,
      "grad_norm": 0.37420524564210356,
      "learning_rate": 4.713654970171506e-05,
      "loss": 1.796,
      "num_input_tokens_seen": 13758179888,
      "step": 17487
    },
    {
      "epoch": 1.8552938680246127,
      "grad_norm": 0.34272550260279533,
      "learning_rate": 4.713622673294241e-05,
      "loss": 1.7628,
      "num_input_tokens_seen": 13758966576,
      "step": 17488
    },
    {
      "epoch": 1.8553999575641842,
      "grad_norm": 0.3824312732441155,
      "learning_rate": 4.7135903747063536e-05,
      "loss": 1.6864,
      "num_input_tokens_seen": 13759753392,
      "step": 17489
    },
    {
      "epoch": 1.8555060471037557,
      "grad_norm": 0.3560508128978143,
      "learning_rate": 4.713558074407868e-05,
      "loss": 1.4975,
      "num_input_tokens_seen": 13760540144,
      "step": 17490
    },
    {
      "epoch": 1.855612136643327,
      "grad_norm": 0.35451856464234777,
      "learning_rate": 4.71352577239881e-05,
      "loss": 1.7005,
      "num_input_tokens_seen": 13761326960,
      "step": 17491
    },
    {
      "epoch": 1.8557182261828984,
      "grad_norm": 0.34803915882264275,
      "learning_rate": 4.713493468679204e-05,
      "loss": 1.796,
      "num_input_tokens_seen": 13762113680,
      "step": 17492
    },
    {
      "epoch": 1.8558243157224696,
      "grad_norm": 0.3508538107397667,
      "learning_rate": 4.7134611632490755e-05,
      "loss": 1.7116,
      "num_input_tokens_seen": 13762900416,
      "step": 17493
    },
    {
      "epoch": 1.8559304052620411,
      "grad_norm": 0.3539349525687942,
      "learning_rate": 4.713428856108449e-05,
      "loss": 1.7538,
      "num_input_tokens_seen": 13763687120,
      "step": 17494
    },
    {
      "epoch": 1.8560364948016126,
      "grad_norm": 0.3585126967432439,
      "learning_rate": 4.71339654725735e-05,
      "loss": 1.7612,
      "num_input_tokens_seen": 13764473888,
      "step": 17495
    },
    {
      "epoch": 1.856142584341184,
      "grad_norm": 0.3812394085597778,
      "learning_rate": 4.7133642366958024e-05,
      "loss": 1.6146,
      "num_input_tokens_seen": 13765260784,
      "step": 17496
    },
    {
      "epoch": 1.8562486738807553,
      "grad_norm": 0.4176352142438381,
      "learning_rate": 4.713331924423833e-05,
      "loss": 1.6306,
      "num_input_tokens_seen": 13766047536,
      "step": 17497
    },
    {
      "epoch": 1.8563547634203268,
      "grad_norm": 0.3735846683956585,
      "learning_rate": 4.713299610441464e-05,
      "loss": 1.7231,
      "num_input_tokens_seen": 13766834368,
      "step": 17498
    },
    {
      "epoch": 1.856460852959898,
      "grad_norm": 0.5350412864243137,
      "learning_rate": 4.713267294748723e-05,
      "loss": 1.782,
      "num_input_tokens_seen": 13767621168,
      "step": 17499
    },
    {
      "epoch": 1.8565669424994695,
      "grad_norm": 0.4361414142299863,
      "learning_rate": 4.713234977345634e-05,
      "loss": 1.7769,
      "num_input_tokens_seen": 13768407904,
      "step": 17500
    },
    {
      "epoch": 1.856673032039041,
      "grad_norm": 0.3772146577440621,
      "learning_rate": 4.713202658232222e-05,
      "loss": 1.6571,
      "num_input_tokens_seen": 13769194720,
      "step": 17501
    },
    {
      "epoch": 1.8567791215786125,
      "grad_norm": 0.5299377090759346,
      "learning_rate": 4.713170337408511e-05,
      "loss": 1.6562,
      "num_input_tokens_seen": 13769981504,
      "step": 17502
    },
    {
      "epoch": 1.8568852111181837,
      "grad_norm": 0.4311298066551522,
      "learning_rate": 4.713138014874527e-05,
      "loss": 1.7596,
      "num_input_tokens_seen": 13770768272,
      "step": 17503
    },
    {
      "epoch": 1.8569913006577552,
      "grad_norm": 0.4047895812370616,
      "learning_rate": 4.713105690630296e-05,
      "loss": 1.843,
      "num_input_tokens_seen": 13771555056,
      "step": 17504
    },
    {
      "epoch": 1.8570973901973264,
      "grad_norm": 0.5904421350957382,
      "learning_rate": 4.713073364675842e-05,
      "loss": 1.7154,
      "num_input_tokens_seen": 13772341840,
      "step": 17505
    },
    {
      "epoch": 1.857203479736898,
      "grad_norm": 0.4202468088318849,
      "learning_rate": 4.7130410370111886e-05,
      "loss": 1.7236,
      "num_input_tokens_seen": 13773128640,
      "step": 17506
    },
    {
      "epoch": 1.8573095692764694,
      "grad_norm": 0.49141457212131984,
      "learning_rate": 4.713008707636363e-05,
      "loss": 1.6889,
      "num_input_tokens_seen": 13773915392,
      "step": 17507
    },
    {
      "epoch": 1.8574156588160409,
      "grad_norm": 0.41567198952624956,
      "learning_rate": 4.712976376551389e-05,
      "loss": 1.8301,
      "num_input_tokens_seen": 13774702128,
      "step": 17508
    },
    {
      "epoch": 1.8575217483556121,
      "grad_norm": 0.4848696623806124,
      "learning_rate": 4.712944043756291e-05,
      "loss": 1.81,
      "num_input_tokens_seen": 13775488896,
      "step": 17509
    },
    {
      "epoch": 1.8576278378951834,
      "grad_norm": 0.3978862489380846,
      "learning_rate": 4.7129117092510955e-05,
      "loss": 1.6876,
      "num_input_tokens_seen": 13776275632,
      "step": 17510
    },
    {
      "epoch": 1.8577339274347549,
      "grad_norm": 0.4392609382130894,
      "learning_rate": 4.712879373035827e-05,
      "loss": 1.6883,
      "num_input_tokens_seen": 13777062352,
      "step": 17511
    },
    {
      "epoch": 1.8578400169743263,
      "grad_norm": 0.48527918375575424,
      "learning_rate": 4.712847035110509e-05,
      "loss": 1.6729,
      "num_input_tokens_seen": 13777849088,
      "step": 17512
    },
    {
      "epoch": 1.8579461065138978,
      "grad_norm": 0.37667659421992594,
      "learning_rate": 4.712814695475169e-05,
      "loss": 1.7339,
      "num_input_tokens_seen": 13778635872,
      "step": 17513
    },
    {
      "epoch": 1.8580521960534693,
      "grad_norm": 0.42423109979229134,
      "learning_rate": 4.7127823541298305e-05,
      "loss": 1.7145,
      "num_input_tokens_seen": 13779422624,
      "step": 17514
    },
    {
      "epoch": 1.8581582855930405,
      "grad_norm": 0.39208192881834597,
      "learning_rate": 4.712750011074518e-05,
      "loss": 1.7629,
      "num_input_tokens_seen": 13780209280,
      "step": 17515
    },
    {
      "epoch": 1.8582643751326118,
      "grad_norm": 0.36312839898932847,
      "learning_rate": 4.7127176663092586e-05,
      "loss": 1.7531,
      "num_input_tokens_seen": 13780995952,
      "step": 17516
    },
    {
      "epoch": 1.8583704646721833,
      "grad_norm": 0.3741787338879833,
      "learning_rate": 4.712685319834075e-05,
      "loss": 1.7843,
      "num_input_tokens_seen": 13781782624,
      "step": 17517
    },
    {
      "epoch": 1.8584765542117547,
      "grad_norm": 0.35597610244308314,
      "learning_rate": 4.712652971648993e-05,
      "loss": 1.6519,
      "num_input_tokens_seen": 13782569360,
      "step": 17518
    },
    {
      "epoch": 1.8585826437513262,
      "grad_norm": 0.3974704399929636,
      "learning_rate": 4.712620621754038e-05,
      "loss": 1.7933,
      "num_input_tokens_seen": 13783356112,
      "step": 17519
    },
    {
      "epoch": 1.8586887332908977,
      "grad_norm": 0.3691045539297205,
      "learning_rate": 4.7125882701492344e-05,
      "loss": 1.7599,
      "num_input_tokens_seen": 13784142832,
      "step": 17520
    },
    {
      "epoch": 1.858794822830469,
      "grad_norm": 0.37331707177111756,
      "learning_rate": 4.712555916834608e-05,
      "loss": 1.7093,
      "num_input_tokens_seen": 13784929616,
      "step": 17521
    },
    {
      "epoch": 1.8589009123700402,
      "grad_norm": 0.45154251717065635,
      "learning_rate": 4.7125235618101825e-05,
      "loss": 1.842,
      "num_input_tokens_seen": 13785716368,
      "step": 17522
    },
    {
      "epoch": 1.8590070019096117,
      "grad_norm": 0.3848234710666738,
      "learning_rate": 4.7124912050759845e-05,
      "loss": 1.6295,
      "num_input_tokens_seen": 13786503248,
      "step": 17523
    },
    {
      "epoch": 1.8591130914491831,
      "grad_norm": 0.4923266819880464,
      "learning_rate": 4.712458846632038e-05,
      "loss": 1.6693,
      "num_input_tokens_seen": 13787289952,
      "step": 17524
    },
    {
      "epoch": 1.8592191809887546,
      "grad_norm": 0.3668039344519567,
      "learning_rate": 4.712426486478368e-05,
      "loss": 1.8309,
      "num_input_tokens_seen": 13788076672,
      "step": 17525
    },
    {
      "epoch": 1.8593252705283259,
      "grad_norm": 0.4391891101879618,
      "learning_rate": 4.712394124615001e-05,
      "loss": 1.7224,
      "num_input_tokens_seen": 13788863520,
      "step": 17526
    },
    {
      "epoch": 1.8594313600678973,
      "grad_norm": 0.48389153631581894,
      "learning_rate": 4.712361761041959e-05,
      "loss": 1.6841,
      "num_input_tokens_seen": 13789650224,
      "step": 17527
    },
    {
      "epoch": 1.8595374496074686,
      "grad_norm": 0.35426925533430276,
      "learning_rate": 4.712329395759269e-05,
      "loss": 1.6294,
      "num_input_tokens_seen": 13790437008,
      "step": 17528
    },
    {
      "epoch": 1.85964353914704,
      "grad_norm": 0.4719568868746284,
      "learning_rate": 4.712297028766957e-05,
      "loss": 1.8608,
      "num_input_tokens_seen": 13791223760,
      "step": 17529
    },
    {
      "epoch": 1.8597496286866115,
      "grad_norm": 0.3579212902357229,
      "learning_rate": 4.712264660065046e-05,
      "loss": 1.6822,
      "num_input_tokens_seen": 13792010480,
      "step": 17530
    },
    {
      "epoch": 1.859855718226183,
      "grad_norm": 0.37893810105006487,
      "learning_rate": 4.712232289653561e-05,
      "loss": 1.6264,
      "num_input_tokens_seen": 13792797264,
      "step": 17531
    },
    {
      "epoch": 1.8599618077657543,
      "grad_norm": 0.3728240005899622,
      "learning_rate": 4.712199917532528e-05,
      "loss": 1.6612,
      "num_input_tokens_seen": 13793584048,
      "step": 17532
    },
    {
      "epoch": 1.8600678973053257,
      "grad_norm": 0.5587999692650556,
      "learning_rate": 4.712167543701973e-05,
      "loss": 1.7583,
      "num_input_tokens_seen": 13794370704,
      "step": 17533
    },
    {
      "epoch": 1.860173986844897,
      "grad_norm": 0.5405758097889102,
      "learning_rate": 4.712135168161919e-05,
      "loss": 1.6551,
      "num_input_tokens_seen": 13795157392,
      "step": 17534
    },
    {
      "epoch": 1.8602800763844685,
      "grad_norm": 0.4425389684211172,
      "learning_rate": 4.712102790912392e-05,
      "loss": 1.6655,
      "num_input_tokens_seen": 13795944128,
      "step": 17535
    },
    {
      "epoch": 1.86038616592404,
      "grad_norm": 0.3714202290525648,
      "learning_rate": 4.7120704119534166e-05,
      "loss": 1.5613,
      "num_input_tokens_seen": 13796730816,
      "step": 17536
    },
    {
      "epoch": 1.8604922554636114,
      "grad_norm": 0.5872529714310272,
      "learning_rate": 4.7120380312850185e-05,
      "loss": 1.7191,
      "num_input_tokens_seen": 13797517616,
      "step": 17537
    },
    {
      "epoch": 1.8605983450031827,
      "grad_norm": 0.41655305095576156,
      "learning_rate": 4.712005648907222e-05,
      "loss": 1.6419,
      "num_input_tokens_seen": 13798304432,
      "step": 17538
    },
    {
      "epoch": 1.8607044345427541,
      "grad_norm": 0.4820278281028123,
      "learning_rate": 4.7119732648200524e-05,
      "loss": 1.6438,
      "num_input_tokens_seen": 13799091232,
      "step": 17539
    },
    {
      "epoch": 1.8608105240823254,
      "grad_norm": 0.4457747859284963,
      "learning_rate": 4.711940879023535e-05,
      "loss": 1.647,
      "num_input_tokens_seen": 13799878032,
      "step": 17540
    },
    {
      "epoch": 1.8609166136218969,
      "grad_norm": 0.45153277329635627,
      "learning_rate": 4.711908491517695e-05,
      "loss": 1.6933,
      "num_input_tokens_seen": 13800664816,
      "step": 17541
    },
    {
      "epoch": 1.8610227031614683,
      "grad_norm": 0.44383593232664914,
      "learning_rate": 4.711876102302557e-05,
      "loss": 1.8774,
      "num_input_tokens_seen": 13801451568,
      "step": 17542
    },
    {
      "epoch": 1.8611287927010398,
      "grad_norm": 0.41030310444279994,
      "learning_rate": 4.711843711378145e-05,
      "loss": 1.7026,
      "num_input_tokens_seen": 13802238288,
      "step": 17543
    },
    {
      "epoch": 1.861234882240611,
      "grad_norm": 0.4208604460535125,
      "learning_rate": 4.7118113187444855e-05,
      "loss": 1.8422,
      "num_input_tokens_seen": 13803025040,
      "step": 17544
    },
    {
      "epoch": 1.8613409717801823,
      "grad_norm": 0.34908063322632304,
      "learning_rate": 4.711778924401604e-05,
      "loss": 1.6615,
      "num_input_tokens_seen": 13803811712,
      "step": 17545
    },
    {
      "epoch": 1.8614470613197538,
      "grad_norm": 0.3816916261382019,
      "learning_rate": 4.7117465283495234e-05,
      "loss": 1.6015,
      "num_input_tokens_seen": 13804598512,
      "step": 17546
    },
    {
      "epoch": 1.8615531508593253,
      "grad_norm": 0.42426751726181244,
      "learning_rate": 4.711714130588271e-05,
      "loss": 1.7428,
      "num_input_tokens_seen": 13805385216,
      "step": 17547
    },
    {
      "epoch": 1.8616592403988967,
      "grad_norm": 0.37104770927261793,
      "learning_rate": 4.71168173111787e-05,
      "loss": 1.8887,
      "num_input_tokens_seen": 13806172048,
      "step": 17548
    },
    {
      "epoch": 1.8617653299384682,
      "grad_norm": 0.39914444146805855,
      "learning_rate": 4.7116493299383466e-05,
      "loss": 1.7665,
      "num_input_tokens_seen": 13806958848,
      "step": 17549
    },
    {
      "epoch": 1.8618714194780395,
      "grad_norm": 0.4033957438324509,
      "learning_rate": 4.711616927049726e-05,
      "loss": 1.7266,
      "num_input_tokens_seen": 13807745600,
      "step": 17550
    },
    {
      "epoch": 1.8619775090176107,
      "grad_norm": 0.4119583066153793,
      "learning_rate": 4.7115845224520316e-05,
      "loss": 1.7159,
      "num_input_tokens_seen": 13808532352,
      "step": 17551
    },
    {
      "epoch": 1.8620835985571822,
      "grad_norm": 0.4840369964126737,
      "learning_rate": 4.71155211614529e-05,
      "loss": 1.7909,
      "num_input_tokens_seen": 13809319072,
      "step": 17552
    },
    {
      "epoch": 1.8621896880967537,
      "grad_norm": 0.6551886994101377,
      "learning_rate": 4.711519708129526e-05,
      "loss": 1.7283,
      "num_input_tokens_seen": 13810105840,
      "step": 17553
    },
    {
      "epoch": 1.8622957776363251,
      "grad_norm": 0.37030743849707665,
      "learning_rate": 4.711487298404765e-05,
      "loss": 1.717,
      "num_input_tokens_seen": 13810892688,
      "step": 17554
    },
    {
      "epoch": 1.8624018671758966,
      "grad_norm": 0.566939122041835,
      "learning_rate": 4.7114548869710305e-05,
      "loss": 1.8251,
      "num_input_tokens_seen": 13811679376,
      "step": 17555
    },
    {
      "epoch": 1.8625079567154679,
      "grad_norm": 0.4202262377851098,
      "learning_rate": 4.7114224738283494e-05,
      "loss": 1.657,
      "num_input_tokens_seen": 13812466016,
      "step": 17556
    },
    {
      "epoch": 1.8626140462550391,
      "grad_norm": 0.5854976953107185,
      "learning_rate": 4.7113900589767455e-05,
      "loss": 1.7731,
      "num_input_tokens_seen": 13813252768,
      "step": 17557
    },
    {
      "epoch": 1.8627201357946106,
      "grad_norm": 0.32661934494662326,
      "learning_rate": 4.7113576424162445e-05,
      "loss": 1.6657,
      "num_input_tokens_seen": 13814039536,
      "step": 17558
    },
    {
      "epoch": 1.862826225334182,
      "grad_norm": 0.43177436731277824,
      "learning_rate": 4.711325224146871e-05,
      "loss": 1.8483,
      "num_input_tokens_seen": 13814826240,
      "step": 17559
    },
    {
      "epoch": 1.8629323148737535,
      "grad_norm": 0.5170577572604302,
      "learning_rate": 4.71129280416865e-05,
      "loss": 1.7652,
      "num_input_tokens_seen": 13815613008,
      "step": 17560
    },
    {
      "epoch": 1.8630384044133248,
      "grad_norm": 0.3447597970130166,
      "learning_rate": 4.711260382481607e-05,
      "loss": 1.6171,
      "num_input_tokens_seen": 13816399760,
      "step": 17561
    },
    {
      "epoch": 1.8631444939528963,
      "grad_norm": 0.39563348451244085,
      "learning_rate": 4.711227959085767e-05,
      "loss": 1.6572,
      "num_input_tokens_seen": 13817186464,
      "step": 17562
    },
    {
      "epoch": 1.8632505834924675,
      "grad_norm": 0.4025676776714232,
      "learning_rate": 4.711195533981154e-05,
      "loss": 1.7495,
      "num_input_tokens_seen": 13817973216,
      "step": 17563
    },
    {
      "epoch": 1.863356673032039,
      "grad_norm": 0.3361968795256864,
      "learning_rate": 4.711163107167795e-05,
      "loss": 1.676,
      "num_input_tokens_seen": 13818760048,
      "step": 17564
    },
    {
      "epoch": 1.8634627625716105,
      "grad_norm": 0.4282585629392749,
      "learning_rate": 4.711130678645714e-05,
      "loss": 1.7328,
      "num_input_tokens_seen": 13819546784,
      "step": 17565
    },
    {
      "epoch": 1.863568852111182,
      "grad_norm": 0.6049075666803879,
      "learning_rate": 4.7110982484149356e-05,
      "loss": 1.8214,
      "num_input_tokens_seen": 13820333520,
      "step": 17566
    },
    {
      "epoch": 1.8636749416507532,
      "grad_norm": 0.3943392676340677,
      "learning_rate": 4.711065816475486e-05,
      "loss": 1.7599,
      "num_input_tokens_seen": 13821120272,
      "step": 17567
    },
    {
      "epoch": 1.8637810311903247,
      "grad_norm": 0.4277810423646992,
      "learning_rate": 4.71103338282739e-05,
      "loss": 1.6401,
      "num_input_tokens_seen": 13821907168,
      "step": 17568
    },
    {
      "epoch": 1.863887120729896,
      "grad_norm": 0.5424536660628682,
      "learning_rate": 4.7110009474706706e-05,
      "loss": 1.7085,
      "num_input_tokens_seen": 13822693936,
      "step": 17569
    },
    {
      "epoch": 1.8639932102694674,
      "grad_norm": 0.3683003495997014,
      "learning_rate": 4.710968510405356e-05,
      "loss": 1.6611,
      "num_input_tokens_seen": 13823480720,
      "step": 17570
    },
    {
      "epoch": 1.8640992998090389,
      "grad_norm": 0.4504256235062489,
      "learning_rate": 4.7109360716314686e-05,
      "loss": 1.841,
      "num_input_tokens_seen": 13824267488,
      "step": 17571
    },
    {
      "epoch": 1.8642053893486104,
      "grad_norm": 0.463999090157947,
      "learning_rate": 4.710903631149035e-05,
      "loss": 1.648,
      "num_input_tokens_seen": 13825054256,
      "step": 17572
    },
    {
      "epoch": 1.8643114788881816,
      "grad_norm": 0.3516224264485923,
      "learning_rate": 4.710871188958082e-05,
      "loss": 1.675,
      "num_input_tokens_seen": 13825840960,
      "step": 17573
    },
    {
      "epoch": 1.8644175684277529,
      "grad_norm": 0.39572192715201254,
      "learning_rate": 4.71083874505863e-05,
      "loss": 1.7008,
      "num_input_tokens_seen": 13826627680,
      "step": 17574
    },
    {
      "epoch": 1.8645236579673243,
      "grad_norm": 0.5383021528281323,
      "learning_rate": 4.7108062994507075e-05,
      "loss": 1.7479,
      "num_input_tokens_seen": 13827414448,
      "step": 17575
    },
    {
      "epoch": 1.8646297475068958,
      "grad_norm": 0.3825733107317796,
      "learning_rate": 4.710773852134339e-05,
      "loss": 1.6045,
      "num_input_tokens_seen": 13828201280,
      "step": 17576
    },
    {
      "epoch": 1.8647358370464673,
      "grad_norm": 0.5033835616283078,
      "learning_rate": 4.7107414031095495e-05,
      "loss": 1.7851,
      "num_input_tokens_seen": 13828987952,
      "step": 17577
    },
    {
      "epoch": 1.8648419265860388,
      "grad_norm": 0.37863135748729937,
      "learning_rate": 4.7107089523763634e-05,
      "loss": 1.6684,
      "num_input_tokens_seen": 13829774736,
      "step": 17578
    },
    {
      "epoch": 1.86494801612561,
      "grad_norm": 0.4346613717546342,
      "learning_rate": 4.710676499934806e-05,
      "loss": 1.716,
      "num_input_tokens_seen": 13830561616,
      "step": 17579
    },
    {
      "epoch": 1.8650541056651813,
      "grad_norm": 0.3811722116474019,
      "learning_rate": 4.710644045784903e-05,
      "loss": 1.749,
      "num_input_tokens_seen": 13831348304,
      "step": 17580
    },
    {
      "epoch": 1.8651601952047527,
      "grad_norm": 0.5620750231712864,
      "learning_rate": 4.71061158992668e-05,
      "loss": 1.7009,
      "num_input_tokens_seen": 13832135120,
      "step": 17581
    },
    {
      "epoch": 1.8652662847443242,
      "grad_norm": 0.32306438936322646,
      "learning_rate": 4.7105791323601606e-05,
      "loss": 1.704,
      "num_input_tokens_seen": 13832921904,
      "step": 17582
    },
    {
      "epoch": 1.8653723742838957,
      "grad_norm": 0.4682246466193795,
      "learning_rate": 4.7105466730853703e-05,
      "loss": 1.7454,
      "num_input_tokens_seen": 13833708576,
      "step": 17583
    },
    {
      "epoch": 1.8654784638234672,
      "grad_norm": 0.33771090951102145,
      "learning_rate": 4.710514212102335e-05,
      "loss": 1.7553,
      "num_input_tokens_seen": 13834495200,
      "step": 17584
    },
    {
      "epoch": 1.8655845533630384,
      "grad_norm": 0.3708874985992872,
      "learning_rate": 4.7104817494110784e-05,
      "loss": 1.7769,
      "num_input_tokens_seen": 13835282016,
      "step": 17585
    },
    {
      "epoch": 1.8656906429026097,
      "grad_norm": 0.41677907560887034,
      "learning_rate": 4.710449285011626e-05,
      "loss": 1.7654,
      "num_input_tokens_seen": 13836068816,
      "step": 17586
    },
    {
      "epoch": 1.8657967324421811,
      "grad_norm": 0.4943410781048178,
      "learning_rate": 4.710416818904004e-05,
      "loss": 1.7412,
      "num_input_tokens_seen": 13836855664,
      "step": 17587
    },
    {
      "epoch": 1.8659028219817526,
      "grad_norm": 0.4204458245967062,
      "learning_rate": 4.710384351088237e-05,
      "loss": 1.7693,
      "num_input_tokens_seen": 13837642320,
      "step": 17588
    },
    {
      "epoch": 1.866008911521324,
      "grad_norm": 0.4072751705239158,
      "learning_rate": 4.71035188156435e-05,
      "loss": 1.7162,
      "num_input_tokens_seen": 13838429040,
      "step": 17589
    },
    {
      "epoch": 1.8661150010608956,
      "grad_norm": 0.4118034822458867,
      "learning_rate": 4.710319410332367e-05,
      "loss": 1.7038,
      "num_input_tokens_seen": 13839215760,
      "step": 17590
    },
    {
      "epoch": 1.8662210906004668,
      "grad_norm": 0.3772295594185999,
      "learning_rate": 4.710286937392315e-05,
      "loss": 1.6756,
      "num_input_tokens_seen": 13840002496,
      "step": 17591
    },
    {
      "epoch": 1.866327180140038,
      "grad_norm": 0.4330634300497306,
      "learning_rate": 4.710254462744217e-05,
      "loss": 1.5302,
      "num_input_tokens_seen": 13840789280,
      "step": 17592
    },
    {
      "epoch": 1.8664332696796095,
      "grad_norm": 0.4058001522855439,
      "learning_rate": 4.7102219863881005e-05,
      "loss": 1.8357,
      "num_input_tokens_seen": 13841575920,
      "step": 17593
    },
    {
      "epoch": 1.866539359219181,
      "grad_norm": 0.4084498913854532,
      "learning_rate": 4.7101895083239876e-05,
      "loss": 1.7562,
      "num_input_tokens_seen": 13842362688,
      "step": 17594
    },
    {
      "epoch": 1.8666454487587525,
      "grad_norm": 0.5916214125381303,
      "learning_rate": 4.7101570285519066e-05,
      "loss": 1.6772,
      "num_input_tokens_seen": 13843149488,
      "step": 17595
    },
    {
      "epoch": 1.8667515382983237,
      "grad_norm": 0.3782960686657356,
      "learning_rate": 4.71012454707188e-05,
      "loss": 1.678,
      "num_input_tokens_seen": 13843936272,
      "step": 17596
    },
    {
      "epoch": 1.8668576278378952,
      "grad_norm": 0.39618368193104797,
      "learning_rate": 4.710092063883935e-05,
      "loss": 1.7839,
      "num_input_tokens_seen": 13844723024,
      "step": 17597
    },
    {
      "epoch": 1.8669637173774665,
      "grad_norm": 0.44427911347221266,
      "learning_rate": 4.710059578988095e-05,
      "loss": 1.7126,
      "num_input_tokens_seen": 13845509712,
      "step": 17598
    },
    {
      "epoch": 1.867069806917038,
      "grad_norm": 0.5568087229900525,
      "learning_rate": 4.710027092384386e-05,
      "loss": 1.6923,
      "num_input_tokens_seen": 13846296448,
      "step": 17599
    },
    {
      "epoch": 1.8671758964566094,
      "grad_norm": 0.3770612298766528,
      "learning_rate": 4.709994604072833e-05,
      "loss": 1.7557,
      "num_input_tokens_seen": 13847083232,
      "step": 17600
    },
    {
      "epoch": 1.867281985996181,
      "grad_norm": 0.3958991442305208,
      "learning_rate": 4.7099621140534614e-05,
      "loss": 1.746,
      "num_input_tokens_seen": 13847870000,
      "step": 17601
    },
    {
      "epoch": 1.8673880755357521,
      "grad_norm": 0.37026178695746015,
      "learning_rate": 4.709929622326296e-05,
      "loss": 1.7318,
      "num_input_tokens_seen": 13848656736,
      "step": 17602
    },
    {
      "epoch": 1.8674941650753236,
      "grad_norm": 0.35619040172484134,
      "learning_rate": 4.7098971288913606e-05,
      "loss": 1.6001,
      "num_input_tokens_seen": 13849443472,
      "step": 17603
    },
    {
      "epoch": 1.8676002546148949,
      "grad_norm": 0.4841708977632823,
      "learning_rate": 4.709864633748682e-05,
      "loss": 1.6986,
      "num_input_tokens_seen": 13850230224,
      "step": 17604
    },
    {
      "epoch": 1.8677063441544663,
      "grad_norm": 0.35094263784066254,
      "learning_rate": 4.709832136898286e-05,
      "loss": 1.7892,
      "num_input_tokens_seen": 13851017008,
      "step": 17605
    },
    {
      "epoch": 1.8678124336940378,
      "grad_norm": 0.35873212136604377,
      "learning_rate": 4.709799638340195e-05,
      "loss": 1.8237,
      "num_input_tokens_seen": 13851803696,
      "step": 17606
    },
    {
      "epoch": 1.8679185232336093,
      "grad_norm": 0.4649968518246495,
      "learning_rate": 4.709767138074437e-05,
      "loss": 1.8037,
      "num_input_tokens_seen": 13852590496,
      "step": 17607
    },
    {
      "epoch": 1.8680246127731805,
      "grad_norm": 0.34384137897073186,
      "learning_rate": 4.709734636101035e-05,
      "loss": 1.6393,
      "num_input_tokens_seen": 13853377248,
      "step": 17608
    },
    {
      "epoch": 1.8681307023127518,
      "grad_norm": 0.4384082773908706,
      "learning_rate": 4.709702132420015e-05,
      "loss": 1.7515,
      "num_input_tokens_seen": 13854164048,
      "step": 17609
    },
    {
      "epoch": 1.8682367918523233,
      "grad_norm": 0.362998014387851,
      "learning_rate": 4.709669627031402e-05,
      "loss": 1.757,
      "num_input_tokens_seen": 13854950752,
      "step": 17610
    },
    {
      "epoch": 1.8683428813918947,
      "grad_norm": 0.3586960421266825,
      "learning_rate": 4.709637119935221e-05,
      "loss": 1.7498,
      "num_input_tokens_seen": 13855737488,
      "step": 17611
    },
    {
      "epoch": 1.8684489709314662,
      "grad_norm": 0.4403410997050952,
      "learning_rate": 4.709604611131498e-05,
      "loss": 1.7988,
      "num_input_tokens_seen": 13856524192,
      "step": 17612
    },
    {
      "epoch": 1.8685550604710377,
      "grad_norm": 0.4288420729200875,
      "learning_rate": 4.7095721006202566e-05,
      "loss": 1.7674,
      "num_input_tokens_seen": 13857310976,
      "step": 17613
    },
    {
      "epoch": 1.868661150010609,
      "grad_norm": 0.38559053085134365,
      "learning_rate": 4.709539588401523e-05,
      "loss": 1.6619,
      "num_input_tokens_seen": 13858097744,
      "step": 17614
    },
    {
      "epoch": 1.8687672395501802,
      "grad_norm": 0.4438298034534682,
      "learning_rate": 4.7095070744753225e-05,
      "loss": 1.6932,
      "num_input_tokens_seen": 13858884464,
      "step": 17615
    },
    {
      "epoch": 1.8688733290897517,
      "grad_norm": 0.3907463015000359,
      "learning_rate": 4.709474558841679e-05,
      "loss": 1.8761,
      "num_input_tokens_seen": 13859671136,
      "step": 17616
    },
    {
      "epoch": 1.8689794186293232,
      "grad_norm": 0.4100665657309351,
      "learning_rate": 4.709442041500619e-05,
      "loss": 1.669,
      "num_input_tokens_seen": 13860457840,
      "step": 17617
    },
    {
      "epoch": 1.8690855081688946,
      "grad_norm": 0.3614104819636349,
      "learning_rate": 4.709409522452166e-05,
      "loss": 1.613,
      "num_input_tokens_seen": 13861244592,
      "step": 17618
    },
    {
      "epoch": 1.869191597708466,
      "grad_norm": 0.3457407692727885,
      "learning_rate": 4.709377001696347e-05,
      "loss": 1.7248,
      "num_input_tokens_seen": 13862031344,
      "step": 17619
    },
    {
      "epoch": 1.8692976872480374,
      "grad_norm": 0.4814486517918324,
      "learning_rate": 4.7093444792331864e-05,
      "loss": 1.7167,
      "num_input_tokens_seen": 13862818096,
      "step": 17620
    },
    {
      "epoch": 1.8694037767876086,
      "grad_norm": 0.3374420637505736,
      "learning_rate": 4.709311955062709e-05,
      "loss": 1.7768,
      "num_input_tokens_seen": 13863604944,
      "step": 17621
    },
    {
      "epoch": 1.86950986632718,
      "grad_norm": 0.581019968610695,
      "learning_rate": 4.7092794291849404e-05,
      "loss": 1.8975,
      "num_input_tokens_seen": 13864391600,
      "step": 17622
    },
    {
      "epoch": 1.8696159558667516,
      "grad_norm": 0.3451071751734597,
      "learning_rate": 4.7092469015999055e-05,
      "loss": 1.7809,
      "num_input_tokens_seen": 13865178320,
      "step": 17623
    },
    {
      "epoch": 1.869722045406323,
      "grad_norm": 0.4403832330174166,
      "learning_rate": 4.709214372307629e-05,
      "loss": 1.675,
      "num_input_tokens_seen": 13865965104,
      "step": 17624
    },
    {
      "epoch": 1.8698281349458943,
      "grad_norm": 0.39436595484519593,
      "learning_rate": 4.7091818413081364e-05,
      "loss": 1.7727,
      "num_input_tokens_seen": 13866751920,
      "step": 17625
    },
    {
      "epoch": 1.8699342244854658,
      "grad_norm": 0.38245092733472646,
      "learning_rate": 4.7091493086014524e-05,
      "loss": 1.7824,
      "num_input_tokens_seen": 13867538720,
      "step": 17626
    },
    {
      "epoch": 1.870040314025037,
      "grad_norm": 0.41654701314364057,
      "learning_rate": 4.709116774187604e-05,
      "loss": 1.7661,
      "num_input_tokens_seen": 13868325504,
      "step": 17627
    },
    {
      "epoch": 1.8701464035646085,
      "grad_norm": 0.41473808153811326,
      "learning_rate": 4.709084238066614e-05,
      "loss": 1.6387,
      "num_input_tokens_seen": 13869112272,
      "step": 17628
    },
    {
      "epoch": 1.87025249310418,
      "grad_norm": 0.40969131530892927,
      "learning_rate": 4.7090517002385095e-05,
      "loss": 1.7984,
      "num_input_tokens_seen": 13869898992,
      "step": 17629
    },
    {
      "epoch": 1.8703585826437514,
      "grad_norm": 0.3517984614131074,
      "learning_rate": 4.7090191607033135e-05,
      "loss": 1.7301,
      "num_input_tokens_seen": 13870685776,
      "step": 17630
    },
    {
      "epoch": 1.8704646721833227,
      "grad_norm": 0.4002031932061706,
      "learning_rate": 4.708986619461053e-05,
      "loss": 1.8204,
      "num_input_tokens_seen": 13871472560,
      "step": 17631
    },
    {
      "epoch": 1.8705707617228942,
      "grad_norm": 0.3661128569596897,
      "learning_rate": 4.7089540765117516e-05,
      "loss": 1.6571,
      "num_input_tokens_seen": 13872259328,
      "step": 17632
    },
    {
      "epoch": 1.8706768512624654,
      "grad_norm": 0.43944812787416904,
      "learning_rate": 4.7089215318554364e-05,
      "loss": 1.7882,
      "num_input_tokens_seen": 13873046096,
      "step": 17633
    },
    {
      "epoch": 1.8707829408020369,
      "grad_norm": 0.3898056774387378,
      "learning_rate": 4.708888985492131e-05,
      "loss": 1.5861,
      "num_input_tokens_seen": 13873832896,
      "step": 17634
    },
    {
      "epoch": 1.8708890303416084,
      "grad_norm": 0.4272536676061204,
      "learning_rate": 4.708856437421861e-05,
      "loss": 1.7248,
      "num_input_tokens_seen": 13874619696,
      "step": 17635
    },
    {
      "epoch": 1.8709951198811798,
      "grad_norm": 0.36692699908512866,
      "learning_rate": 4.708823887644651e-05,
      "loss": 1.7034,
      "num_input_tokens_seen": 13875406400,
      "step": 17636
    },
    {
      "epoch": 1.871101209420751,
      "grad_norm": 0.4495379087192782,
      "learning_rate": 4.708791336160527e-05,
      "loss": 1.6883,
      "num_input_tokens_seen": 13876193136,
      "step": 17637
    },
    {
      "epoch": 1.8712072989603226,
      "grad_norm": 0.3841220887205258,
      "learning_rate": 4.708758782969514e-05,
      "loss": 1.7289,
      "num_input_tokens_seen": 13876979872,
      "step": 17638
    },
    {
      "epoch": 1.8713133884998938,
      "grad_norm": 0.3638569658610444,
      "learning_rate": 4.708726228071638e-05,
      "loss": 1.81,
      "num_input_tokens_seen": 13877766704,
      "step": 17639
    },
    {
      "epoch": 1.8714194780394653,
      "grad_norm": 0.5974897468811088,
      "learning_rate": 4.708693671466922e-05,
      "loss": 1.6988,
      "num_input_tokens_seen": 13878553472,
      "step": 17640
    },
    {
      "epoch": 1.8715255675790368,
      "grad_norm": 0.35997608999710806,
      "learning_rate": 4.708661113155393e-05,
      "loss": 1.7154,
      "num_input_tokens_seen": 13879340272,
      "step": 17641
    },
    {
      "epoch": 1.8716316571186082,
      "grad_norm": 0.5361334299254126,
      "learning_rate": 4.7086285531370747e-05,
      "loss": 1.6264,
      "num_input_tokens_seen": 13880127120,
      "step": 17642
    },
    {
      "epoch": 1.8717377466581795,
      "grad_norm": 0.38099299623191113,
      "learning_rate": 4.708595991411994e-05,
      "loss": 1.5816,
      "num_input_tokens_seen": 13880913936,
      "step": 17643
    },
    {
      "epoch": 1.8718438361977507,
      "grad_norm": 0.47596491065122776,
      "learning_rate": 4.7085634279801744e-05,
      "loss": 1.7592,
      "num_input_tokens_seen": 13881700704,
      "step": 17644
    },
    {
      "epoch": 1.8719499257373222,
      "grad_norm": 0.38190975331212657,
      "learning_rate": 4.7085308628416423e-05,
      "loss": 1.7673,
      "num_input_tokens_seen": 13882487488,
      "step": 17645
    },
    {
      "epoch": 1.8720560152768937,
      "grad_norm": 0.35515557341689824,
      "learning_rate": 4.7084982959964216e-05,
      "loss": 1.7375,
      "num_input_tokens_seen": 13883274240,
      "step": 17646
    },
    {
      "epoch": 1.8721621048164652,
      "grad_norm": 0.5925907753660006,
      "learning_rate": 4.7084657274445386e-05,
      "loss": 1.9208,
      "num_input_tokens_seen": 13884061072,
      "step": 17647
    },
    {
      "epoch": 1.8722681943560366,
      "grad_norm": 0.3377097123123512,
      "learning_rate": 4.708433157186018e-05,
      "loss": 1.8933,
      "num_input_tokens_seen": 13884847792,
      "step": 17648
    },
    {
      "epoch": 1.872374283895608,
      "grad_norm": 0.420843417224926,
      "learning_rate": 4.708400585220886e-05,
      "loss": 1.7263,
      "num_input_tokens_seen": 13885634672,
      "step": 17649
    },
    {
      "epoch": 1.8724803734351791,
      "grad_norm": 0.35976791938219277,
      "learning_rate": 4.708368011549166e-05,
      "loss": 1.7216,
      "num_input_tokens_seen": 13886421408,
      "step": 17650
    },
    {
      "epoch": 1.8725864629747506,
      "grad_norm": 0.3676290847757068,
      "learning_rate": 4.708335436170884e-05,
      "loss": 1.7234,
      "num_input_tokens_seen": 13887208160,
      "step": 17651
    },
    {
      "epoch": 1.872692552514322,
      "grad_norm": 0.40627757293484446,
      "learning_rate": 4.708302859086066e-05,
      "loss": 1.7835,
      "num_input_tokens_seen": 13887994944,
      "step": 17652
    },
    {
      "epoch": 1.8727986420538936,
      "grad_norm": 0.42508832371995114,
      "learning_rate": 4.708270280294735e-05,
      "loss": 1.6593,
      "num_input_tokens_seen": 13888781776,
      "step": 17653
    },
    {
      "epoch": 1.872904731593465,
      "grad_norm": 0.36761521582082374,
      "learning_rate": 4.708237699796918e-05,
      "loss": 1.6924,
      "num_input_tokens_seen": 13889568624,
      "step": 17654
    },
    {
      "epoch": 1.8730108211330363,
      "grad_norm": 0.4085915587705732,
      "learning_rate": 4.70820511759264e-05,
      "loss": 1.7642,
      "num_input_tokens_seen": 13890355392,
      "step": 17655
    },
    {
      "epoch": 1.8731169106726075,
      "grad_norm": 0.447905173346426,
      "learning_rate": 4.708172533681925e-05,
      "loss": 1.7488,
      "num_input_tokens_seen": 13891142144,
      "step": 17656
    },
    {
      "epoch": 1.873223000212179,
      "grad_norm": 0.39076132368302174,
      "learning_rate": 4.7081399480648e-05,
      "loss": 1.6672,
      "num_input_tokens_seen": 13891928944,
      "step": 17657
    },
    {
      "epoch": 1.8733290897517505,
      "grad_norm": 0.3746511692602231,
      "learning_rate": 4.7081073607412895e-05,
      "loss": 1.604,
      "num_input_tokens_seen": 13892715728,
      "step": 17658
    },
    {
      "epoch": 1.873435179291322,
      "grad_norm": 0.3930999516536514,
      "learning_rate": 4.708074771711417e-05,
      "loss": 1.6142,
      "num_input_tokens_seen": 13893502608,
      "step": 17659
    },
    {
      "epoch": 1.8735412688308932,
      "grad_norm": 0.39695809601134974,
      "learning_rate": 4.708042180975211e-05,
      "loss": 1.8253,
      "num_input_tokens_seen": 13894289376,
      "step": 17660
    },
    {
      "epoch": 1.8736473583704647,
      "grad_norm": 0.38518180497065596,
      "learning_rate": 4.708009588532694e-05,
      "loss": 1.6715,
      "num_input_tokens_seen": 13895076192,
      "step": 17661
    },
    {
      "epoch": 1.873753447910036,
      "grad_norm": 0.34796475655291037,
      "learning_rate": 4.707976994383891e-05,
      "loss": 1.6659,
      "num_input_tokens_seen": 13895862976,
      "step": 17662
    },
    {
      "epoch": 1.8738595374496074,
      "grad_norm": 0.4020094804619208,
      "learning_rate": 4.7079443985288294e-05,
      "loss": 1.6886,
      "num_input_tokens_seen": 13896649792,
      "step": 17663
    },
    {
      "epoch": 1.873965626989179,
      "grad_norm": 0.3949236351774786,
      "learning_rate": 4.707911800967533e-05,
      "loss": 1.6881,
      "num_input_tokens_seen": 13897436576,
      "step": 17664
    },
    {
      "epoch": 1.8740717165287504,
      "grad_norm": 0.4331592966059731,
      "learning_rate": 4.707879201700026e-05,
      "loss": 1.7406,
      "num_input_tokens_seen": 13898223264,
      "step": 17665
    },
    {
      "epoch": 1.8741778060683216,
      "grad_norm": 0.39527170735418443,
      "learning_rate": 4.7078466007263355e-05,
      "loss": 1.807,
      "num_input_tokens_seen": 13899010000,
      "step": 17666
    },
    {
      "epoch": 1.874283895607893,
      "grad_norm": 0.40367421539697573,
      "learning_rate": 4.707813998046486e-05,
      "loss": 1.8977,
      "num_input_tokens_seen": 13899796848,
      "step": 17667
    },
    {
      "epoch": 1.8743899851474644,
      "grad_norm": 0.4521719613252322,
      "learning_rate": 4.707781393660503e-05,
      "loss": 1.8576,
      "num_input_tokens_seen": 13900583568,
      "step": 17668
    },
    {
      "epoch": 1.8744960746870358,
      "grad_norm": 0.44388992778239617,
      "learning_rate": 4.707748787568411e-05,
      "loss": 1.7013,
      "num_input_tokens_seen": 13901370320,
      "step": 17669
    },
    {
      "epoch": 1.8746021642266073,
      "grad_norm": 0.4215531738188368,
      "learning_rate": 4.707716179770235e-05,
      "loss": 1.7574,
      "num_input_tokens_seen": 13902157168,
      "step": 17670
    },
    {
      "epoch": 1.8747082537661788,
      "grad_norm": 0.42087994197673656,
      "learning_rate": 4.7076835702660015e-05,
      "loss": 1.7159,
      "num_input_tokens_seen": 13902943968,
      "step": 17671
    },
    {
      "epoch": 1.87481434330575,
      "grad_norm": 0.538155188303341,
      "learning_rate": 4.707650959055735e-05,
      "loss": 1.6898,
      "num_input_tokens_seen": 13903730784,
      "step": 17672
    },
    {
      "epoch": 1.8749204328453215,
      "grad_norm": 0.3624973303281498,
      "learning_rate": 4.7076183461394596e-05,
      "loss": 1.7315,
      "num_input_tokens_seen": 13904517520,
      "step": 17673
    },
    {
      "epoch": 1.8750265223848928,
      "grad_norm": 0.6031790865879082,
      "learning_rate": 4.7075857315172025e-05,
      "loss": 1.7065,
      "num_input_tokens_seen": 13905304288,
      "step": 17674
    },
    {
      "epoch": 1.8751326119244642,
      "grad_norm": 0.34718432747434447,
      "learning_rate": 4.707553115188987e-05,
      "loss": 1.6857,
      "num_input_tokens_seen": 13906091120,
      "step": 17675
    },
    {
      "epoch": 1.8752387014640357,
      "grad_norm": 0.5913939609581398,
      "learning_rate": 4.70752049715484e-05,
      "loss": 1.6394,
      "num_input_tokens_seen": 13906877840,
      "step": 17676
    },
    {
      "epoch": 1.8753447910036072,
      "grad_norm": 0.40657422001789567,
      "learning_rate": 4.7074878774147855e-05,
      "loss": 1.7467,
      "num_input_tokens_seen": 13907664624,
      "step": 17677
    },
    {
      "epoch": 1.8754508805431784,
      "grad_norm": 0.5011251936007031,
      "learning_rate": 4.70745525596885e-05,
      "loss": 1.6994,
      "num_input_tokens_seen": 13908451440,
      "step": 17678
    },
    {
      "epoch": 1.8755569700827497,
      "grad_norm": 0.5954187241759484,
      "learning_rate": 4.707422632817057e-05,
      "loss": 1.9068,
      "num_input_tokens_seen": 13909238176,
      "step": 17679
    },
    {
      "epoch": 1.8756630596223212,
      "grad_norm": 0.4418448133210214,
      "learning_rate": 4.707390007959433e-05,
      "loss": 1.6827,
      "num_input_tokens_seen": 13910024928,
      "step": 17680
    },
    {
      "epoch": 1.8757691491618926,
      "grad_norm": 0.6544976744477509,
      "learning_rate": 4.7073573813960026e-05,
      "loss": 1.585,
      "num_input_tokens_seen": 13910811696,
      "step": 17681
    },
    {
      "epoch": 1.875875238701464,
      "grad_norm": 0.3941575140916041,
      "learning_rate": 4.7073247531267905e-05,
      "loss": 1.784,
      "num_input_tokens_seen": 13911598416,
      "step": 17682
    },
    {
      "epoch": 1.8759813282410356,
      "grad_norm": 0.4963265521466188,
      "learning_rate": 4.707292123151823e-05,
      "loss": 1.7998,
      "num_input_tokens_seen": 13912385152,
      "step": 17683
    },
    {
      "epoch": 1.8760874177806068,
      "grad_norm": 0.4018396319130076,
      "learning_rate": 4.707259491471126e-05,
      "loss": 1.712,
      "num_input_tokens_seen": 13913171872,
      "step": 17684
    },
    {
      "epoch": 1.876193507320178,
      "grad_norm": 0.41612492650664884,
      "learning_rate": 4.7072268580847225e-05,
      "loss": 1.7322,
      "num_input_tokens_seen": 13913958688,
      "step": 17685
    },
    {
      "epoch": 1.8762995968597496,
      "grad_norm": 0.3633907889027663,
      "learning_rate": 4.707194222992639e-05,
      "loss": 1.7506,
      "num_input_tokens_seen": 13914745504,
      "step": 17686
    },
    {
      "epoch": 1.876405686399321,
      "grad_norm": 0.39531981740375466,
      "learning_rate": 4.7071615861949e-05,
      "loss": 1.643,
      "num_input_tokens_seen": 13915532416,
      "step": 17687
    },
    {
      "epoch": 1.8765117759388925,
      "grad_norm": 0.39158582046922963,
      "learning_rate": 4.707128947691533e-05,
      "loss": 1.7497,
      "num_input_tokens_seen": 13916319232,
      "step": 17688
    },
    {
      "epoch": 1.876617865478464,
      "grad_norm": 0.3821305858660945,
      "learning_rate": 4.7070963074825606e-05,
      "loss": 1.8087,
      "num_input_tokens_seen": 13917105920,
      "step": 17689
    },
    {
      "epoch": 1.8767239550180352,
      "grad_norm": 0.4496368576706226,
      "learning_rate": 4.707063665568008e-05,
      "loss": 1.8113,
      "num_input_tokens_seen": 13917892672,
      "step": 17690
    },
    {
      "epoch": 1.8768300445576065,
      "grad_norm": 0.4342042988575341,
      "learning_rate": 4.707031021947902e-05,
      "loss": 1.7633,
      "num_input_tokens_seen": 13918679488,
      "step": 17691
    },
    {
      "epoch": 1.876936134097178,
      "grad_norm": 0.3414934259304239,
      "learning_rate": 4.706998376622267e-05,
      "loss": 1.6367,
      "num_input_tokens_seen": 13919466352,
      "step": 17692
    },
    {
      "epoch": 1.8770422236367494,
      "grad_norm": 0.41169826993954695,
      "learning_rate": 4.7069657295911296e-05,
      "loss": 1.7949,
      "num_input_tokens_seen": 13920253104,
      "step": 17693
    },
    {
      "epoch": 1.877148313176321,
      "grad_norm": 0.3726128128917295,
      "learning_rate": 4.706933080854513e-05,
      "loss": 1.7957,
      "num_input_tokens_seen": 13921039856,
      "step": 17694
    },
    {
      "epoch": 1.8772544027158922,
      "grad_norm": 0.3746675366547232,
      "learning_rate": 4.706900430412443e-05,
      "loss": 1.8122,
      "num_input_tokens_seen": 13921826672,
      "step": 17695
    },
    {
      "epoch": 1.8773604922554636,
      "grad_norm": 0.43216985226505894,
      "learning_rate": 4.7068677782649454e-05,
      "loss": 1.7354,
      "num_input_tokens_seen": 13922613440,
      "step": 17696
    },
    {
      "epoch": 1.877466581795035,
      "grad_norm": 0.3638005186334218,
      "learning_rate": 4.706835124412044e-05,
      "loss": 1.819,
      "num_input_tokens_seen": 13923400112,
      "step": 17697
    },
    {
      "epoch": 1.8775726713346064,
      "grad_norm": 0.40900332106523274,
      "learning_rate": 4.706802468853767e-05,
      "loss": 1.786,
      "num_input_tokens_seen": 13924186768,
      "step": 17698
    },
    {
      "epoch": 1.8776787608741778,
      "grad_norm": 0.40769483920109484,
      "learning_rate": 4.706769811590137e-05,
      "loss": 1.5369,
      "num_input_tokens_seen": 13924973632,
      "step": 17699
    },
    {
      "epoch": 1.8777848504137493,
      "grad_norm": 0.5131079266238169,
      "learning_rate": 4.70673715262118e-05,
      "loss": 1.8711,
      "num_input_tokens_seen": 13925760352,
      "step": 17700
    },
    {
      "epoch": 1.8778909399533206,
      "grad_norm": 0.3414153985113421,
      "learning_rate": 4.7067044919469215e-05,
      "loss": 1.7154,
      "num_input_tokens_seen": 13926547056,
      "step": 17701
    },
    {
      "epoch": 1.877997029492892,
      "grad_norm": 0.3842083281618113,
      "learning_rate": 4.706671829567387e-05,
      "loss": 1.6104,
      "num_input_tokens_seen": 13927333872,
      "step": 17702
    },
    {
      "epoch": 1.8781031190324633,
      "grad_norm": 0.4686207619305453,
      "learning_rate": 4.7066391654826e-05,
      "loss": 1.7157,
      "num_input_tokens_seen": 13928120608,
      "step": 17703
    },
    {
      "epoch": 1.8782092085720348,
      "grad_norm": 0.37648903985812077,
      "learning_rate": 4.706606499692588e-05,
      "loss": 1.6415,
      "num_input_tokens_seen": 13928907328,
      "step": 17704
    },
    {
      "epoch": 1.8783152981116062,
      "grad_norm": 0.4505231880222895,
      "learning_rate": 4.7065738321973754e-05,
      "loss": 1.7986,
      "num_input_tokens_seen": 13929694208,
      "step": 17705
    },
    {
      "epoch": 1.8784213876511777,
      "grad_norm": 0.4667623916670827,
      "learning_rate": 4.706541162996986e-05,
      "loss": 1.6883,
      "num_input_tokens_seen": 13930481008,
      "step": 17706
    },
    {
      "epoch": 1.878527477190749,
      "grad_norm": 0.36654735623738494,
      "learning_rate": 4.706508492091447e-05,
      "loss": 1.6807,
      "num_input_tokens_seen": 13931267728,
      "step": 17707
    },
    {
      "epoch": 1.8786335667303202,
      "grad_norm": 0.4973057902351807,
      "learning_rate": 4.7064758194807836e-05,
      "loss": 1.7355,
      "num_input_tokens_seen": 13932054432,
      "step": 17708
    },
    {
      "epoch": 1.8787396562698917,
      "grad_norm": 0.3699398384915974,
      "learning_rate": 4.70644314516502e-05,
      "loss": 1.7115,
      "num_input_tokens_seen": 13932841248,
      "step": 17709
    },
    {
      "epoch": 1.8788457458094632,
      "grad_norm": 0.5478465647372419,
      "learning_rate": 4.706410469144182e-05,
      "loss": 1.7694,
      "num_input_tokens_seen": 13933628032,
      "step": 17710
    },
    {
      "epoch": 1.8789518353490346,
      "grad_norm": 0.44156112366384564,
      "learning_rate": 4.7063777914182946e-05,
      "loss": 1.8585,
      "num_input_tokens_seen": 13934414784,
      "step": 17711
    },
    {
      "epoch": 1.8790579248886061,
      "grad_norm": 0.3344371535378734,
      "learning_rate": 4.7063451119873824e-05,
      "loss": 1.5668,
      "num_input_tokens_seen": 13935201648,
      "step": 17712
    },
    {
      "epoch": 1.8791640144281774,
      "grad_norm": 0.5198077564960348,
      "learning_rate": 4.706312430851473e-05,
      "loss": 1.7375,
      "num_input_tokens_seen": 13935988384,
      "step": 17713
    },
    {
      "epoch": 1.8792701039677486,
      "grad_norm": 0.4369913202782242,
      "learning_rate": 4.706279748010589e-05,
      "loss": 1.8001,
      "num_input_tokens_seen": 13936775184,
      "step": 17714
    },
    {
      "epoch": 1.87937619350732,
      "grad_norm": 0.3688877055912661,
      "learning_rate": 4.7062470634647564e-05,
      "loss": 1.769,
      "num_input_tokens_seen": 13937561872,
      "step": 17715
    },
    {
      "epoch": 1.8794822830468916,
      "grad_norm": 0.4931952227445717,
      "learning_rate": 4.706214377214002e-05,
      "loss": 1.8113,
      "num_input_tokens_seen": 13938348608,
      "step": 17716
    },
    {
      "epoch": 1.879588372586463,
      "grad_norm": 0.45928468474070594,
      "learning_rate": 4.706181689258349e-05,
      "loss": 1.6844,
      "num_input_tokens_seen": 13939135408,
      "step": 17717
    },
    {
      "epoch": 1.8796944621260345,
      "grad_norm": 0.368085460120428,
      "learning_rate": 4.7061489995978236e-05,
      "loss": 1.6769,
      "num_input_tokens_seen": 13939922160,
      "step": 17718
    },
    {
      "epoch": 1.8798005516656058,
      "grad_norm": 0.606091508617298,
      "learning_rate": 4.706116308232451e-05,
      "loss": 1.7702,
      "num_input_tokens_seen": 13940708816,
      "step": 17719
    },
    {
      "epoch": 1.879906641205177,
      "grad_norm": 0.4070638195333197,
      "learning_rate": 4.7060836151622564e-05,
      "loss": 1.71,
      "num_input_tokens_seen": 13941495600,
      "step": 17720
    },
    {
      "epoch": 1.8800127307447485,
      "grad_norm": 0.5646979823916843,
      "learning_rate": 4.706050920387266e-05,
      "loss": 1.7368,
      "num_input_tokens_seen": 13942282368,
      "step": 17721
    },
    {
      "epoch": 1.88011882028432,
      "grad_norm": 0.4617036974396886,
      "learning_rate": 4.7060182239075034e-05,
      "loss": 1.8363,
      "num_input_tokens_seen": 13943069104,
      "step": 17722
    },
    {
      "epoch": 1.8802249098238915,
      "grad_norm": 0.4181278139343377,
      "learning_rate": 4.7059855257229944e-05,
      "loss": 1.6681,
      "num_input_tokens_seen": 13943855808,
      "step": 17723
    },
    {
      "epoch": 1.8803309993634627,
      "grad_norm": 0.5300296858414612,
      "learning_rate": 4.705952825833765e-05,
      "loss": 1.7184,
      "num_input_tokens_seen": 13944642576,
      "step": 17724
    },
    {
      "epoch": 1.8804370889030342,
      "grad_norm": 0.42838625424379306,
      "learning_rate": 4.70592012423984e-05,
      "loss": 1.74,
      "num_input_tokens_seen": 13945429440,
      "step": 17725
    },
    {
      "epoch": 1.8805431784426054,
      "grad_norm": 0.36445621169510845,
      "learning_rate": 4.705887420941244e-05,
      "loss": 1.6585,
      "num_input_tokens_seen": 13946216128,
      "step": 17726
    },
    {
      "epoch": 1.880649267982177,
      "grad_norm": 0.4802721700129817,
      "learning_rate": 4.705854715938004e-05,
      "loss": 1.8078,
      "num_input_tokens_seen": 13947002864,
      "step": 17727
    },
    {
      "epoch": 1.8807553575217484,
      "grad_norm": 0.3717495608802583,
      "learning_rate": 4.7058220092301435e-05,
      "loss": 1.7608,
      "num_input_tokens_seen": 13947789664,
      "step": 17728
    },
    {
      "epoch": 1.8808614470613199,
      "grad_norm": 0.4194049977060142,
      "learning_rate": 4.7057893008176886e-05,
      "loss": 1.6963,
      "num_input_tokens_seen": 13948576400,
      "step": 17729
    },
    {
      "epoch": 1.880967536600891,
      "grad_norm": 0.3797265775030778,
      "learning_rate": 4.705756590700665e-05,
      "loss": 1.7251,
      "num_input_tokens_seen": 13949363216,
      "step": 17730
    },
    {
      "epoch": 1.8810736261404626,
      "grad_norm": 0.35754004626924935,
      "learning_rate": 4.7057238788790967e-05,
      "loss": 1.6894,
      "num_input_tokens_seen": 13950149984,
      "step": 17731
    },
    {
      "epoch": 1.8811797156800338,
      "grad_norm": 0.39933864664685764,
      "learning_rate": 4.7056911653530104e-05,
      "loss": 1.6767,
      "num_input_tokens_seen": 13950936672,
      "step": 17732
    },
    {
      "epoch": 1.8812858052196053,
      "grad_norm": 0.444790851113523,
      "learning_rate": 4.7056584501224295e-05,
      "loss": 1.7622,
      "num_input_tokens_seen": 13951723440,
      "step": 17733
    },
    {
      "epoch": 1.8813918947591768,
      "grad_norm": 0.34874073540598177,
      "learning_rate": 4.705625733187381e-05,
      "loss": 1.7329,
      "num_input_tokens_seen": 13952510240,
      "step": 17734
    },
    {
      "epoch": 1.8814979842987483,
      "grad_norm": 0.4398498611632616,
      "learning_rate": 4.70559301454789e-05,
      "loss": 1.6894,
      "num_input_tokens_seen": 13953297040,
      "step": 17735
    },
    {
      "epoch": 1.8816040738383195,
      "grad_norm": 0.3644537874466476,
      "learning_rate": 4.705560294203981e-05,
      "loss": 1.6907,
      "num_input_tokens_seen": 13954083712,
      "step": 17736
    },
    {
      "epoch": 1.881710163377891,
      "grad_norm": 0.4269363717223667,
      "learning_rate": 4.70552757215568e-05,
      "loss": 1.7328,
      "num_input_tokens_seen": 13954870544,
      "step": 17737
    },
    {
      "epoch": 1.8818162529174622,
      "grad_norm": 0.3331987444785746,
      "learning_rate": 4.7054948484030114e-05,
      "loss": 1.739,
      "num_input_tokens_seen": 13955657296,
      "step": 17738
    },
    {
      "epoch": 1.8819223424570337,
      "grad_norm": 0.47895388407267075,
      "learning_rate": 4.7054621229460025e-05,
      "loss": 1.7551,
      "num_input_tokens_seen": 13956444112,
      "step": 17739
    },
    {
      "epoch": 1.8820284319966052,
      "grad_norm": 0.4191305231678314,
      "learning_rate": 4.705429395784676e-05,
      "loss": 1.6579,
      "num_input_tokens_seen": 13957230848,
      "step": 17740
    },
    {
      "epoch": 1.8821345215361767,
      "grad_norm": 0.7069780928097121,
      "learning_rate": 4.705396666919059e-05,
      "loss": 1.8257,
      "num_input_tokens_seen": 13958017712,
      "step": 17741
    },
    {
      "epoch": 1.882240611075748,
      "grad_norm": 0.40985216343317427,
      "learning_rate": 4.7053639363491754e-05,
      "loss": 1.7641,
      "num_input_tokens_seen": 13958804496,
      "step": 17742
    },
    {
      "epoch": 1.8823467006153192,
      "grad_norm": 0.9236081474425271,
      "learning_rate": 4.7053312040750516e-05,
      "loss": 1.8202,
      "num_input_tokens_seen": 13959591248,
      "step": 17743
    },
    {
      "epoch": 1.8824527901548906,
      "grad_norm": 0.42131177683229654,
      "learning_rate": 4.705298470096713e-05,
      "loss": 1.6766,
      "num_input_tokens_seen": 13960378032,
      "step": 17744
    },
    {
      "epoch": 1.8825588796944621,
      "grad_norm": 0.669403141524317,
      "learning_rate": 4.7052657344141836e-05,
      "loss": 1.6109,
      "num_input_tokens_seen": 13961164784,
      "step": 17745
    },
    {
      "epoch": 1.8826649692340336,
      "grad_norm": 0.48921337549870625,
      "learning_rate": 4.70523299702749e-05,
      "loss": 1.8577,
      "num_input_tokens_seen": 13961951568,
      "step": 17746
    },
    {
      "epoch": 1.882771058773605,
      "grad_norm": 0.5612825963763806,
      "learning_rate": 4.705200257936658e-05,
      "loss": 1.7523,
      "num_input_tokens_seen": 13962738288,
      "step": 17747
    },
    {
      "epoch": 1.8828771483131763,
      "grad_norm": 0.700748663170014,
      "learning_rate": 4.705167517141711e-05,
      "loss": 1.7279,
      "num_input_tokens_seen": 13963525040,
      "step": 17748
    },
    {
      "epoch": 1.8829832378527476,
      "grad_norm": 0.37050249520051404,
      "learning_rate": 4.7051347746426754e-05,
      "loss": 1.8141,
      "num_input_tokens_seen": 13964311888,
      "step": 17749
    },
    {
      "epoch": 1.883089327392319,
      "grad_norm": 0.6459035443005433,
      "learning_rate": 4.705102030439576e-05,
      "loss": 1.7829,
      "num_input_tokens_seen": 13965098624,
      "step": 17750
    },
    {
      "epoch": 1.8831954169318905,
      "grad_norm": 0.481180689720728,
      "learning_rate": 4.7050692845324385e-05,
      "loss": 1.7962,
      "num_input_tokens_seen": 13965885328,
      "step": 17751
    },
    {
      "epoch": 1.883301506471462,
      "grad_norm": 0.4188856214712476,
      "learning_rate": 4.705036536921288e-05,
      "loss": 1.7214,
      "num_input_tokens_seen": 13966672128,
      "step": 17752
    },
    {
      "epoch": 1.8834075960110335,
      "grad_norm": 0.5743922424509494,
      "learning_rate": 4.705003787606151e-05,
      "loss": 1.7629,
      "num_input_tokens_seen": 13967458832,
      "step": 17753
    },
    {
      "epoch": 1.8835136855506047,
      "grad_norm": 0.5061493313103494,
      "learning_rate": 4.704971036587051e-05,
      "loss": 1.7103,
      "num_input_tokens_seen": 13968245552,
      "step": 17754
    },
    {
      "epoch": 1.883619775090176,
      "grad_norm": 0.685966546724355,
      "learning_rate": 4.7049382838640146e-05,
      "loss": 1.8177,
      "num_input_tokens_seen": 13969032272,
      "step": 17755
    },
    {
      "epoch": 1.8837258646297474,
      "grad_norm": 0.42128288550641685,
      "learning_rate": 4.704905529437066e-05,
      "loss": 1.7183,
      "num_input_tokens_seen": 13969819056,
      "step": 17756
    },
    {
      "epoch": 1.883831954169319,
      "grad_norm": 0.4497756226863891,
      "learning_rate": 4.7048727733062316e-05,
      "loss": 1.6129,
      "num_input_tokens_seen": 13970605872,
      "step": 17757
    },
    {
      "epoch": 1.8839380437088904,
      "grad_norm": 0.5042279374204661,
      "learning_rate": 4.7048400154715354e-05,
      "loss": 1.7477,
      "num_input_tokens_seen": 13971392592,
      "step": 17758
    },
    {
      "epoch": 1.8840441332484616,
      "grad_norm": 0.4559011977408135,
      "learning_rate": 4.704807255933004e-05,
      "loss": 1.7902,
      "num_input_tokens_seen": 13972179472,
      "step": 17759
    },
    {
      "epoch": 1.8841502227880331,
      "grad_norm": 0.44771513366768123,
      "learning_rate": 4.704774494690662e-05,
      "loss": 1.6173,
      "num_input_tokens_seen": 13972966256,
      "step": 17760
    },
    {
      "epoch": 1.8842563123276044,
      "grad_norm": 0.3829950676906078,
      "learning_rate": 4.704741731744535e-05,
      "loss": 1.7538,
      "num_input_tokens_seen": 13973753040,
      "step": 17761
    },
    {
      "epoch": 1.8843624018671759,
      "grad_norm": 0.5069091568025492,
      "learning_rate": 4.704708967094649e-05,
      "loss": 1.798,
      "num_input_tokens_seen": 13974539744,
      "step": 17762
    },
    {
      "epoch": 1.8844684914067473,
      "grad_norm": 0.38265339789385916,
      "learning_rate": 4.7046762007410286e-05,
      "loss": 1.779,
      "num_input_tokens_seen": 13975326512,
      "step": 17763
    },
    {
      "epoch": 1.8845745809463188,
      "grad_norm": 0.4175177839415055,
      "learning_rate": 4.704643432683698e-05,
      "loss": 1.7321,
      "num_input_tokens_seen": 13976113360,
      "step": 17764
    },
    {
      "epoch": 1.88468067048589,
      "grad_norm": 0.3833743467276417,
      "learning_rate": 4.704610662922684e-05,
      "loss": 1.651,
      "num_input_tokens_seen": 13976900208,
      "step": 17765
    },
    {
      "epoch": 1.8847867600254615,
      "grad_norm": 0.45013945677621237,
      "learning_rate": 4.704577891458012e-05,
      "loss": 1.6646,
      "num_input_tokens_seen": 13977686976,
      "step": 17766
    },
    {
      "epoch": 1.8848928495650328,
      "grad_norm": 0.38570345194312355,
      "learning_rate": 4.7045451182897075e-05,
      "loss": 1.7431,
      "num_input_tokens_seen": 13978473680,
      "step": 17767
    },
    {
      "epoch": 1.8849989391046043,
      "grad_norm": 0.36481825975513216,
      "learning_rate": 4.704512343417794e-05,
      "loss": 1.6223,
      "num_input_tokens_seen": 13979260528,
      "step": 17768
    },
    {
      "epoch": 1.8851050286441757,
      "grad_norm": 0.365207702405742,
      "learning_rate": 4.704479566842298e-05,
      "loss": 1.5271,
      "num_input_tokens_seen": 13980047312,
      "step": 17769
    },
    {
      "epoch": 1.8852111181837472,
      "grad_norm": 0.3767410900102507,
      "learning_rate": 4.704446788563246e-05,
      "loss": 1.7395,
      "num_input_tokens_seen": 13980834048,
      "step": 17770
    },
    {
      "epoch": 1.8853172077233185,
      "grad_norm": 0.35826364731900473,
      "learning_rate": 4.7044140085806615e-05,
      "loss": 1.6902,
      "num_input_tokens_seen": 13981620864,
      "step": 17771
    },
    {
      "epoch": 1.88542329726289,
      "grad_norm": 0.481190395672381,
      "learning_rate": 4.704381226894571e-05,
      "loss": 1.7338,
      "num_input_tokens_seen": 13982407648,
      "step": 17772
    },
    {
      "epoch": 1.8855293868024612,
      "grad_norm": 0.4210067923593773,
      "learning_rate": 4.704348443504999e-05,
      "loss": 1.6114,
      "num_input_tokens_seen": 13983194400,
      "step": 17773
    },
    {
      "epoch": 1.8856354763420327,
      "grad_norm": 0.3473907182444185,
      "learning_rate": 4.704315658411971e-05,
      "loss": 1.6778,
      "num_input_tokens_seen": 13983981200,
      "step": 17774
    },
    {
      "epoch": 1.8857415658816041,
      "grad_norm": 0.41348840545800564,
      "learning_rate": 4.704282871615512e-05,
      "loss": 1.8085,
      "num_input_tokens_seen": 13984767856,
      "step": 17775
    },
    {
      "epoch": 1.8858476554211756,
      "grad_norm": 0.4693516818262702,
      "learning_rate": 4.704250083115649e-05,
      "loss": 1.6829,
      "num_input_tokens_seen": 13985554672,
      "step": 17776
    },
    {
      "epoch": 1.8859537449607469,
      "grad_norm": 0.32651402020095444,
      "learning_rate": 4.7042172929124065e-05,
      "loss": 1.7627,
      "num_input_tokens_seen": 13986341456,
      "step": 17777
    },
    {
      "epoch": 1.886059834500318,
      "grad_norm": 0.42134772963238404,
      "learning_rate": 4.7041845010058087e-05,
      "loss": 1.7629,
      "num_input_tokens_seen": 13987128048,
      "step": 17778
    },
    {
      "epoch": 1.8861659240398896,
      "grad_norm": 0.3766234394778826,
      "learning_rate": 4.704151707395882e-05,
      "loss": 1.6942,
      "num_input_tokens_seen": 13987914800,
      "step": 17779
    },
    {
      "epoch": 1.886272013579461,
      "grad_norm": 0.33753352429946903,
      "learning_rate": 4.7041189120826515e-05,
      "loss": 1.6544,
      "num_input_tokens_seen": 13988701552,
      "step": 17780
    },
    {
      "epoch": 1.8863781031190325,
      "grad_norm": 0.43262393988312026,
      "learning_rate": 4.704086115066142e-05,
      "loss": 1.7729,
      "num_input_tokens_seen": 13989488336,
      "step": 17781
    },
    {
      "epoch": 1.886484192658604,
      "grad_norm": 0.32899416080477734,
      "learning_rate": 4.7040533163463794e-05,
      "loss": 1.5756,
      "num_input_tokens_seen": 13990275168,
      "step": 17782
    },
    {
      "epoch": 1.8865902821981753,
      "grad_norm": 0.4327059827262954,
      "learning_rate": 4.7040205159233904e-05,
      "loss": 1.781,
      "num_input_tokens_seen": 13991061952,
      "step": 17783
    },
    {
      "epoch": 1.8866963717377465,
      "grad_norm": 0.4101652118852254,
      "learning_rate": 4.703987713797198e-05,
      "loss": 1.7555,
      "num_input_tokens_seen": 13991848608,
      "step": 17784
    },
    {
      "epoch": 1.886802461277318,
      "grad_norm": 0.5105439211377731,
      "learning_rate": 4.703954909967829e-05,
      "loss": 1.7484,
      "num_input_tokens_seen": 13992635312,
      "step": 17785
    },
    {
      "epoch": 1.8869085508168895,
      "grad_norm": 0.35586116082774116,
      "learning_rate": 4.703922104435308e-05,
      "loss": 1.7887,
      "num_input_tokens_seen": 13993422016,
      "step": 17786
    },
    {
      "epoch": 1.887014640356461,
      "grad_norm": 0.3937228218836506,
      "learning_rate": 4.7038892971996605e-05,
      "loss": 1.6067,
      "num_input_tokens_seen": 13994208816,
      "step": 17787
    },
    {
      "epoch": 1.8871207298960324,
      "grad_norm": 0.36861222511568864,
      "learning_rate": 4.7038564882609126e-05,
      "loss": 1.6853,
      "num_input_tokens_seen": 13994995552,
      "step": 17788
    },
    {
      "epoch": 1.8872268194356037,
      "grad_norm": 0.4165944244864647,
      "learning_rate": 4.703823677619089e-05,
      "loss": 1.7192,
      "num_input_tokens_seen": 13995782336,
      "step": 17789
    },
    {
      "epoch": 1.887332908975175,
      "grad_norm": 0.39484792625754694,
      "learning_rate": 4.7037908652742144e-05,
      "loss": 1.7219,
      "num_input_tokens_seen": 13996569072,
      "step": 17790
    },
    {
      "epoch": 1.8874389985147464,
      "grad_norm": 0.3963782576314245,
      "learning_rate": 4.7037580512263155e-05,
      "loss": 1.6697,
      "num_input_tokens_seen": 13997355872,
      "step": 17791
    },
    {
      "epoch": 1.8875450880543179,
      "grad_norm": 0.4214944120151207,
      "learning_rate": 4.7037252354754176e-05,
      "loss": 1.7167,
      "num_input_tokens_seen": 13998142576,
      "step": 17792
    },
    {
      "epoch": 1.8876511775938893,
      "grad_norm": 0.5211082465112074,
      "learning_rate": 4.7036924180215444e-05,
      "loss": 1.7169,
      "num_input_tokens_seen": 13998929376,
      "step": 17793
    },
    {
      "epoch": 1.8877572671334606,
      "grad_norm": 0.42967225846241075,
      "learning_rate": 4.703659598864723e-05,
      "loss": 1.7851,
      "num_input_tokens_seen": 13999716208,
      "step": 17794
    },
    {
      "epoch": 1.887863356673032,
      "grad_norm": 0.40927439544511934,
      "learning_rate": 4.7036267780049784e-05,
      "loss": 1.8407,
      "num_input_tokens_seen": 14000502992,
      "step": 17795
    },
    {
      "epoch": 1.8879694462126033,
      "grad_norm": 0.3460849105931122,
      "learning_rate": 4.703593955442335e-05,
      "loss": 1.6207,
      "num_input_tokens_seen": 14001289664,
      "step": 17796
    },
    {
      "epoch": 1.8880755357521748,
      "grad_norm": 0.3676874306723661,
      "learning_rate": 4.7035611311768194e-05,
      "loss": 1.6651,
      "num_input_tokens_seen": 14002076368,
      "step": 17797
    },
    {
      "epoch": 1.8881816252917463,
      "grad_norm": 0.3839721152162487,
      "learning_rate": 4.703528305208456e-05,
      "loss": 1.7117,
      "num_input_tokens_seen": 14002863040,
      "step": 17798
    },
    {
      "epoch": 1.8882877148313177,
      "grad_norm": 0.3840866147382929,
      "learning_rate": 4.70349547753727e-05,
      "loss": 1.7706,
      "num_input_tokens_seen": 14003649776,
      "step": 17799
    },
    {
      "epoch": 1.888393804370889,
      "grad_norm": 0.336879857386273,
      "learning_rate": 4.7034626481632884e-05,
      "loss": 1.6243,
      "num_input_tokens_seen": 14004436528,
      "step": 17800
    },
    {
      "epoch": 1.8884998939104605,
      "grad_norm": 0.3670179076066431,
      "learning_rate": 4.703429817086535e-05,
      "loss": 1.7381,
      "num_input_tokens_seen": 14005223280,
      "step": 17801
    },
    {
      "epoch": 1.8886059834500317,
      "grad_norm": 0.3661745273477491,
      "learning_rate": 4.703396984307036e-05,
      "loss": 1.7329,
      "num_input_tokens_seen": 14006010032,
      "step": 17802
    },
    {
      "epoch": 1.8887120729896032,
      "grad_norm": 0.35566844060399705,
      "learning_rate": 4.703364149824816e-05,
      "loss": 1.7127,
      "num_input_tokens_seen": 14006796832,
      "step": 17803
    },
    {
      "epoch": 1.8888181625291747,
      "grad_norm": 0.4283322287699239,
      "learning_rate": 4.703331313639901e-05,
      "loss": 1.727,
      "num_input_tokens_seen": 14007583552,
      "step": 17804
    },
    {
      "epoch": 1.8889242520687461,
      "grad_norm": 0.4281275202877063,
      "learning_rate": 4.7032984757523165e-05,
      "loss": 1.7336,
      "num_input_tokens_seen": 14008370288,
      "step": 17805
    },
    {
      "epoch": 1.8890303416083174,
      "grad_norm": 0.36476902846448195,
      "learning_rate": 4.703265636162088e-05,
      "loss": 1.7262,
      "num_input_tokens_seen": 14009157072,
      "step": 17806
    },
    {
      "epoch": 1.8891364311478889,
      "grad_norm": 1.4540650665577162,
      "learning_rate": 4.703232794869239e-05,
      "loss": 1.7823,
      "num_input_tokens_seen": 14009943840,
      "step": 17807
    },
    {
      "epoch": 1.8892425206874601,
      "grad_norm": 1.4500297157887765,
      "learning_rate": 4.7031999518737976e-05,
      "loss": 1.7139,
      "num_input_tokens_seen": 14010730592,
      "step": 17808
    },
    {
      "epoch": 1.8893486102270316,
      "grad_norm": 0.9610783486716888,
      "learning_rate": 4.703167107175787e-05,
      "loss": 1.6242,
      "num_input_tokens_seen": 14011517376,
      "step": 17809
    },
    {
      "epoch": 1.889454699766603,
      "grad_norm": 2.9393734006826238,
      "learning_rate": 4.7031342607752346e-05,
      "loss": 1.7019,
      "num_input_tokens_seen": 14012304112,
      "step": 17810
    },
    {
      "epoch": 1.8895607893061745,
      "grad_norm": 1.048721727522958,
      "learning_rate": 4.703101412672164e-05,
      "loss": 1.5804,
      "num_input_tokens_seen": 14013090992,
      "step": 17811
    },
    {
      "epoch": 1.8896668788457458,
      "grad_norm": 0.8966213191289121,
      "learning_rate": 4.703068562866601e-05,
      "loss": 1.6804,
      "num_input_tokens_seen": 14013877760,
      "step": 17812
    },
    {
      "epoch": 1.889772968385317,
      "grad_norm": 0.5709869779335209,
      "learning_rate": 4.703035711358572e-05,
      "loss": 1.7454,
      "num_input_tokens_seen": 14014664608,
      "step": 17813
    },
    {
      "epoch": 1.8898790579248885,
      "grad_norm": 0.47810270830037316,
      "learning_rate": 4.703002858148101e-05,
      "loss": 1.673,
      "num_input_tokens_seen": 14015451296,
      "step": 17814
    },
    {
      "epoch": 1.88998514746446,
      "grad_norm": 0.5019606983570739,
      "learning_rate": 4.702970003235214e-05,
      "loss": 1.7283,
      "num_input_tokens_seen": 14016238112,
      "step": 17815
    },
    {
      "epoch": 1.8900912370040315,
      "grad_norm": 0.507825578146065,
      "learning_rate": 4.702937146619937e-05,
      "loss": 1.7496,
      "num_input_tokens_seen": 14017024816,
      "step": 17816
    },
    {
      "epoch": 1.890197326543603,
      "grad_norm": 0.4477941203925868,
      "learning_rate": 4.702904288302295e-05,
      "loss": 1.7711,
      "num_input_tokens_seen": 14017811632,
      "step": 17817
    },
    {
      "epoch": 1.8903034160831742,
      "grad_norm": 0.4758162633982633,
      "learning_rate": 4.7028714282823126e-05,
      "loss": 1.7318,
      "num_input_tokens_seen": 14018598336,
      "step": 17818
    },
    {
      "epoch": 1.8904095056227455,
      "grad_norm": 0.4295741562484475,
      "learning_rate": 4.702838566560016e-05,
      "loss": 1.7498,
      "num_input_tokens_seen": 14019385024,
      "step": 17819
    },
    {
      "epoch": 1.890515595162317,
      "grad_norm": 0.461160623362985,
      "learning_rate": 4.70280570313543e-05,
      "loss": 1.7726,
      "num_input_tokens_seen": 14020171760,
      "step": 17820
    },
    {
      "epoch": 1.8906216847018884,
      "grad_norm": 0.43153293316659463,
      "learning_rate": 4.702772838008581e-05,
      "loss": 1.6615,
      "num_input_tokens_seen": 14020958512,
      "step": 17821
    },
    {
      "epoch": 1.8907277742414599,
      "grad_norm": 0.4025257727473806,
      "learning_rate": 4.702739971179494e-05,
      "loss": 1.606,
      "num_input_tokens_seen": 14021745344,
      "step": 17822
    },
    {
      "epoch": 1.8908338637810314,
      "grad_norm": 0.41942621774333994,
      "learning_rate": 4.702707102648193e-05,
      "loss": 1.746,
      "num_input_tokens_seen": 14022532128,
      "step": 17823
    },
    {
      "epoch": 1.8909399533206026,
      "grad_norm": 0.37756416416230404,
      "learning_rate": 4.702674232414706e-05,
      "loss": 1.6966,
      "num_input_tokens_seen": 14023318976,
      "step": 17824
    },
    {
      "epoch": 1.8910460428601739,
      "grad_norm": 0.4070411233261757,
      "learning_rate": 4.702641360479056e-05,
      "loss": 1.6372,
      "num_input_tokens_seen": 14024105680,
      "step": 17825
    },
    {
      "epoch": 1.8911521323997453,
      "grad_norm": 0.4327134395478807,
      "learning_rate": 4.702608486841269e-05,
      "loss": 1.6475,
      "num_input_tokens_seen": 14024892528,
      "step": 17826
    },
    {
      "epoch": 1.8912582219393168,
      "grad_norm": 0.4539473239474356,
      "learning_rate": 4.702575611501372e-05,
      "loss": 1.6419,
      "num_input_tokens_seen": 14025679344,
      "step": 17827
    },
    {
      "epoch": 1.8913643114788883,
      "grad_norm": 0.3774684918730223,
      "learning_rate": 4.702542734459389e-05,
      "loss": 1.8183,
      "num_input_tokens_seen": 14026466176,
      "step": 17828
    },
    {
      "epoch": 1.8914704010184595,
      "grad_norm": 0.560654997371392,
      "learning_rate": 4.7025098557153444e-05,
      "loss": 1.8081,
      "num_input_tokens_seen": 14027252928,
      "step": 17829
    },
    {
      "epoch": 1.891576490558031,
      "grad_norm": 0.4541376895391822,
      "learning_rate": 4.702476975269267e-05,
      "loss": 1.7397,
      "num_input_tokens_seen": 14028039616,
      "step": 17830
    },
    {
      "epoch": 1.8916825800976023,
      "grad_norm": 0.4370840494192146,
      "learning_rate": 4.702444093121178e-05,
      "loss": 1.6582,
      "num_input_tokens_seen": 14028826432,
      "step": 17831
    },
    {
      "epoch": 1.8917886696371737,
      "grad_norm": 0.41471908768870297,
      "learning_rate": 4.702411209271105e-05,
      "loss": 1.7564,
      "num_input_tokens_seen": 14029613280,
      "step": 17832
    },
    {
      "epoch": 1.8918947591767452,
      "grad_norm": 0.49922716719219457,
      "learning_rate": 4.702378323719074e-05,
      "loss": 1.8045,
      "num_input_tokens_seen": 14030399952,
      "step": 17833
    },
    {
      "epoch": 1.8920008487163167,
      "grad_norm": 0.44971263267978207,
      "learning_rate": 4.70234543646511e-05,
      "loss": 1.6825,
      "num_input_tokens_seen": 14031186688,
      "step": 17834
    },
    {
      "epoch": 1.892106938255888,
      "grad_norm": 0.5274377734898502,
      "learning_rate": 4.7023125475092366e-05,
      "loss": 1.7918,
      "num_input_tokens_seen": 14031973424,
      "step": 17835
    },
    {
      "epoch": 1.8922130277954594,
      "grad_norm": 0.39528124158710964,
      "learning_rate": 4.7022796568514815e-05,
      "loss": 1.8116,
      "num_input_tokens_seen": 14032760192,
      "step": 17836
    },
    {
      "epoch": 1.8923191173350307,
      "grad_norm": 0.9236280950250001,
      "learning_rate": 4.70224676449187e-05,
      "loss": 1.7539,
      "num_input_tokens_seen": 14033546992,
      "step": 17837
    },
    {
      "epoch": 1.8924252068746021,
      "grad_norm": 0.5276007611804175,
      "learning_rate": 4.702213870430426e-05,
      "loss": 1.806,
      "num_input_tokens_seen": 14034333840,
      "step": 17838
    },
    {
      "epoch": 1.8925312964141736,
      "grad_norm": 0.9774357276177299,
      "learning_rate": 4.7021809746671756e-05,
      "loss": 1.8236,
      "num_input_tokens_seen": 14035120512,
      "step": 17839
    },
    {
      "epoch": 1.892637385953745,
      "grad_norm": 0.5121630284019816,
      "learning_rate": 4.7021480772021446e-05,
      "loss": 1.7428,
      "num_input_tokens_seen": 14035907264,
      "step": 17840
    },
    {
      "epoch": 1.8927434754933163,
      "grad_norm": 0.592625298302376,
      "learning_rate": 4.702115178035358e-05,
      "loss": 1.6741,
      "num_input_tokens_seen": 14036693984,
      "step": 17841
    },
    {
      "epoch": 1.8928495650328876,
      "grad_norm": 0.8760180364899322,
      "learning_rate": 4.7020822771668424e-05,
      "loss": 1.6638,
      "num_input_tokens_seen": 14037480736,
      "step": 17842
    },
    {
      "epoch": 1.892955654572459,
      "grad_norm": 0.568806898200618,
      "learning_rate": 4.702049374596621e-05,
      "loss": 1.799,
      "num_input_tokens_seen": 14038267504,
      "step": 17843
    },
    {
      "epoch": 1.8930617441120305,
      "grad_norm": 0.9417454615291486,
      "learning_rate": 4.7020164703247216e-05,
      "loss": 1.7165,
      "num_input_tokens_seen": 14039054240,
      "step": 17844
    },
    {
      "epoch": 1.893167833651602,
      "grad_norm": 0.4099145340303266,
      "learning_rate": 4.701983564351168e-05,
      "loss": 1.6306,
      "num_input_tokens_seen": 14039841024,
      "step": 17845
    },
    {
      "epoch": 1.8932739231911735,
      "grad_norm": 0.628980174621372,
      "learning_rate": 4.701950656675985e-05,
      "loss": 1.7514,
      "num_input_tokens_seen": 14040627840,
      "step": 17846
    },
    {
      "epoch": 1.8933800127307447,
      "grad_norm": 0.6076702817915176,
      "learning_rate": 4.7019177472992e-05,
      "loss": 1.7352,
      "num_input_tokens_seen": 14041414704,
      "step": 17847
    },
    {
      "epoch": 1.893486102270316,
      "grad_norm": 0.6034872767778132,
      "learning_rate": 4.701884836220838e-05,
      "loss": 1.5759,
      "num_input_tokens_seen": 14042201408,
      "step": 17848
    },
    {
      "epoch": 1.8935921918098875,
      "grad_norm": 0.45669437061485696,
      "learning_rate": 4.7018519234409235e-05,
      "loss": 1.633,
      "num_input_tokens_seen": 14042988176,
      "step": 17849
    },
    {
      "epoch": 1.893698281349459,
      "grad_norm": 0.5349303150851973,
      "learning_rate": 4.7018190089594824e-05,
      "loss": 1.6945,
      "num_input_tokens_seen": 14043774960,
      "step": 17850
    },
    {
      "epoch": 1.8938043708890304,
      "grad_norm": 0.41650358866805387,
      "learning_rate": 4.701786092776541e-05,
      "loss": 1.5711,
      "num_input_tokens_seen": 14044561776,
      "step": 17851
    },
    {
      "epoch": 1.893910460428602,
      "grad_norm": 0.36390495236324455,
      "learning_rate": 4.701753174892123e-05,
      "loss": 1.7412,
      "num_input_tokens_seen": 14045348544,
      "step": 17852
    },
    {
      "epoch": 1.8940165499681731,
      "grad_norm": 0.40642535520082984,
      "learning_rate": 4.701720255306255e-05,
      "loss": 1.6492,
      "num_input_tokens_seen": 14046135296,
      "step": 17853
    },
    {
      "epoch": 1.8941226395077444,
      "grad_norm": 0.489704493212566,
      "learning_rate": 4.701687334018963e-05,
      "loss": 1.8009,
      "num_input_tokens_seen": 14046921984,
      "step": 17854
    },
    {
      "epoch": 1.8942287290473159,
      "grad_norm": 0.4013219315564915,
      "learning_rate": 4.70165441103027e-05,
      "loss": 1.758,
      "num_input_tokens_seen": 14047708704,
      "step": 17855
    },
    {
      "epoch": 1.8943348185868873,
      "grad_norm": 0.5146495408537621,
      "learning_rate": 4.701621486340204e-05,
      "loss": 1.839,
      "num_input_tokens_seen": 14048495504,
      "step": 17856
    },
    {
      "epoch": 1.8944409081264588,
      "grad_norm": 0.4881648352323384,
      "learning_rate": 4.70158855994879e-05,
      "loss": 1.78,
      "num_input_tokens_seen": 14049282224,
      "step": 17857
    },
    {
      "epoch": 1.89454699766603,
      "grad_norm": 0.4151657931412141,
      "learning_rate": 4.701555631856052e-05,
      "loss": 1.6923,
      "num_input_tokens_seen": 14050069024,
      "step": 17858
    },
    {
      "epoch": 1.8946530872056015,
      "grad_norm": 0.38757586447464226,
      "learning_rate": 4.701522702062017e-05,
      "loss": 1.7594,
      "num_input_tokens_seen": 14050855776,
      "step": 17859
    },
    {
      "epoch": 1.8947591767451728,
      "grad_norm": 0.5370447466147955,
      "learning_rate": 4.701489770566709e-05,
      "loss": 1.8315,
      "num_input_tokens_seen": 14051642480,
      "step": 17860
    },
    {
      "epoch": 1.8948652662847443,
      "grad_norm": 0.45129230002004894,
      "learning_rate": 4.701456837370155e-05,
      "loss": 1.7707,
      "num_input_tokens_seen": 14052429248,
      "step": 17861
    },
    {
      "epoch": 1.8949713558243158,
      "grad_norm": 0.4170663459803678,
      "learning_rate": 4.7014239024723795e-05,
      "loss": 1.6462,
      "num_input_tokens_seen": 14053216000,
      "step": 17862
    },
    {
      "epoch": 1.8950774453638872,
      "grad_norm": 0.5506764781277254,
      "learning_rate": 4.701390965873409e-05,
      "loss": 1.919,
      "num_input_tokens_seen": 14054002832,
      "step": 17863
    },
    {
      "epoch": 1.8951835349034585,
      "grad_norm": 0.41651926402447803,
      "learning_rate": 4.701358027573267e-05,
      "loss": 1.6643,
      "num_input_tokens_seen": 14054789552,
      "step": 17864
    },
    {
      "epoch": 1.89528962444303,
      "grad_norm": 0.640809722744714,
      "learning_rate": 4.701325087571981e-05,
      "loss": 1.8309,
      "num_input_tokens_seen": 14055576304,
      "step": 17865
    },
    {
      "epoch": 1.8953957139826012,
      "grad_norm": 0.4053517943062551,
      "learning_rate": 4.7012921458695754e-05,
      "loss": 1.7256,
      "num_input_tokens_seen": 14056363024,
      "step": 17866
    },
    {
      "epoch": 1.8955018035221727,
      "grad_norm": 0.54805642131668,
      "learning_rate": 4.701259202466075e-05,
      "loss": 1.6699,
      "num_input_tokens_seen": 14057149840,
      "step": 17867
    },
    {
      "epoch": 1.8956078930617442,
      "grad_norm": 0.46514180741623,
      "learning_rate": 4.7012262573615076e-05,
      "loss": 1.6478,
      "num_input_tokens_seen": 14057936768,
      "step": 17868
    },
    {
      "epoch": 1.8957139826013156,
      "grad_norm": 0.5209390903074281,
      "learning_rate": 4.701193310555896e-05,
      "loss": 1.8325,
      "num_input_tokens_seen": 14058723536,
      "step": 17869
    },
    {
      "epoch": 1.8958200721408869,
      "grad_norm": 0.5818377886527347,
      "learning_rate": 4.7011603620492675e-05,
      "loss": 1.9077,
      "num_input_tokens_seen": 14059510288,
      "step": 17870
    },
    {
      "epoch": 1.8959261616804584,
      "grad_norm": 0.42413804467131416,
      "learning_rate": 4.701127411841646e-05,
      "loss": 1.6115,
      "num_input_tokens_seen": 14060297120,
      "step": 17871
    },
    {
      "epoch": 1.8960322512200296,
      "grad_norm": 0.7147027645645913,
      "learning_rate": 4.7010944599330584e-05,
      "loss": 1.9123,
      "num_input_tokens_seen": 14061083888,
      "step": 17872
    },
    {
      "epoch": 1.896138340759601,
      "grad_norm": 0.5654806283619749,
      "learning_rate": 4.7010615063235287e-05,
      "loss": 1.8467,
      "num_input_tokens_seen": 14061870592,
      "step": 17873
    },
    {
      "epoch": 1.8962444302991726,
      "grad_norm": 0.4629986784421299,
      "learning_rate": 4.701028551013084e-05,
      "loss": 1.6755,
      "num_input_tokens_seen": 14062657312,
      "step": 17874
    },
    {
      "epoch": 1.896350519838744,
      "grad_norm": 0.8422195551716996,
      "learning_rate": 4.700995594001749e-05,
      "loss": 1.7858,
      "num_input_tokens_seen": 14063444016,
      "step": 17875
    },
    {
      "epoch": 1.8964566093783153,
      "grad_norm": 0.6485737236401927,
      "learning_rate": 4.70096263528955e-05,
      "loss": 1.6774,
      "num_input_tokens_seen": 14064230736,
      "step": 17876
    },
    {
      "epoch": 1.8965626989178865,
      "grad_norm": 0.7997387743486886,
      "learning_rate": 4.7009296748765104e-05,
      "loss": 1.6657,
      "num_input_tokens_seen": 14065017488,
      "step": 17877
    },
    {
      "epoch": 1.896668788457458,
      "grad_norm": 0.7717476221457091,
      "learning_rate": 4.700896712762657e-05,
      "loss": 1.692,
      "num_input_tokens_seen": 14065804192,
      "step": 17878
    },
    {
      "epoch": 1.8967748779970295,
      "grad_norm": 0.7525278908353387,
      "learning_rate": 4.700863748948016e-05,
      "loss": 1.6814,
      "num_input_tokens_seen": 14066590896,
      "step": 17879
    },
    {
      "epoch": 1.896880967536601,
      "grad_norm": 0.5928266280336236,
      "learning_rate": 4.700830783432611e-05,
      "loss": 1.6625,
      "num_input_tokens_seen": 14067377744,
      "step": 17880
    },
    {
      "epoch": 1.8969870570761724,
      "grad_norm": 0.9984388607869791,
      "learning_rate": 4.7007978162164696e-05,
      "loss": 1.6546,
      "num_input_tokens_seen": 14068164608,
      "step": 17881
    },
    {
      "epoch": 1.8970931466157437,
      "grad_norm": 0.5540124073945504,
      "learning_rate": 4.700764847299616e-05,
      "loss": 1.7393,
      "num_input_tokens_seen": 14068951440,
      "step": 17882
    },
    {
      "epoch": 1.897199236155315,
      "grad_norm": 0.8812677541429985,
      "learning_rate": 4.700731876682075e-05,
      "loss": 1.8087,
      "num_input_tokens_seen": 14069738256,
      "step": 17883
    },
    {
      "epoch": 1.8973053256948864,
      "grad_norm": 0.5029933842648947,
      "learning_rate": 4.700698904363874e-05,
      "loss": 1.7926,
      "num_input_tokens_seen": 14070524976,
      "step": 17884
    },
    {
      "epoch": 1.8974114152344579,
      "grad_norm": 0.6434392221856003,
      "learning_rate": 4.700665930345037e-05,
      "loss": 1.8222,
      "num_input_tokens_seen": 14071311728,
      "step": 17885
    },
    {
      "epoch": 1.8975175047740294,
      "grad_norm": 0.7812576222417092,
      "learning_rate": 4.70063295462559e-05,
      "loss": 1.6939,
      "num_input_tokens_seen": 14072098416,
      "step": 17886
    },
    {
      "epoch": 1.8976235943136008,
      "grad_norm": 0.6261054696882921,
      "learning_rate": 4.7005999772055584e-05,
      "loss": 1.7145,
      "num_input_tokens_seen": 14072885184,
      "step": 17887
    },
    {
      "epoch": 1.897729683853172,
      "grad_norm": 0.545067168736495,
      "learning_rate": 4.7005669980849684e-05,
      "loss": 1.6726,
      "num_input_tokens_seen": 14073672016,
      "step": 17888
    },
    {
      "epoch": 1.8978357733927433,
      "grad_norm": 0.8604944711764673,
      "learning_rate": 4.700534017263844e-05,
      "loss": 1.799,
      "num_input_tokens_seen": 14074458816,
      "step": 17889
    },
    {
      "epoch": 1.8979418629323148,
      "grad_norm": 0.47351774870733443,
      "learning_rate": 4.700501034742212e-05,
      "loss": 1.7381,
      "num_input_tokens_seen": 14075245568,
      "step": 17890
    },
    {
      "epoch": 1.8980479524718863,
      "grad_norm": 0.6675327860040602,
      "learning_rate": 4.700468050520096e-05,
      "loss": 1.732,
      "num_input_tokens_seen": 14076032336,
      "step": 17891
    },
    {
      "epoch": 1.8981540420114578,
      "grad_norm": 0.40088593138075007,
      "learning_rate": 4.700435064597525e-05,
      "loss": 1.6605,
      "num_input_tokens_seen": 14076819152,
      "step": 17892
    },
    {
      "epoch": 1.898260131551029,
      "grad_norm": 0.7291765304534683,
      "learning_rate": 4.70040207697452e-05,
      "loss": 1.6612,
      "num_input_tokens_seen": 14077605984,
      "step": 17893
    },
    {
      "epoch": 1.8983662210906005,
      "grad_norm": 0.3895246279871454,
      "learning_rate": 4.700369087651111e-05,
      "loss": 1.6323,
      "num_input_tokens_seen": 14078392752,
      "step": 17894
    },
    {
      "epoch": 1.8984723106301717,
      "grad_norm": 0.7608759312940288,
      "learning_rate": 4.70033609662732e-05,
      "loss": 1.7389,
      "num_input_tokens_seen": 14079179424,
      "step": 17895
    },
    {
      "epoch": 1.8985784001697432,
      "grad_norm": 0.48600622431903595,
      "learning_rate": 4.700303103903174e-05,
      "loss": 1.7982,
      "num_input_tokens_seen": 14079966256,
      "step": 17896
    },
    {
      "epoch": 1.8986844897093147,
      "grad_norm": 0.4537146076449813,
      "learning_rate": 4.700270109478699e-05,
      "loss": 1.6598,
      "num_input_tokens_seen": 14080753024,
      "step": 17897
    },
    {
      "epoch": 1.8987905792488862,
      "grad_norm": 0.5071709354541931,
      "learning_rate": 4.700237113353919e-05,
      "loss": 1.6401,
      "num_input_tokens_seen": 14081539808,
      "step": 17898
    },
    {
      "epoch": 1.8988966687884574,
      "grad_norm": 1.1858269978008114,
      "learning_rate": 4.700204115528861e-05,
      "loss": 1.7999,
      "num_input_tokens_seen": 14082326496,
      "step": 17899
    },
    {
      "epoch": 1.899002758328029,
      "grad_norm": 0.6180556161846638,
      "learning_rate": 4.70017111600355e-05,
      "loss": 1.6676,
      "num_input_tokens_seen": 14083113248,
      "step": 17900
    },
    {
      "epoch": 1.8991088478676001,
      "grad_norm": 0.8639010591871967,
      "learning_rate": 4.7001381147780105e-05,
      "loss": 1.7364,
      "num_input_tokens_seen": 14083900000,
      "step": 17901
    },
    {
      "epoch": 1.8992149374071716,
      "grad_norm": 0.6022951315787779,
      "learning_rate": 4.700105111852269e-05,
      "loss": 1.7121,
      "num_input_tokens_seen": 14084686736,
      "step": 17902
    },
    {
      "epoch": 1.899321026946743,
      "grad_norm": 1.2941756806950906,
      "learning_rate": 4.700072107226351e-05,
      "loss": 1.7063,
      "num_input_tokens_seen": 14085473504,
      "step": 17903
    },
    {
      "epoch": 1.8994271164863146,
      "grad_norm": 0.6083081504954403,
      "learning_rate": 4.700039100900282e-05,
      "loss": 1.7302,
      "num_input_tokens_seen": 14086260224,
      "step": 17904
    },
    {
      "epoch": 1.8995332060258858,
      "grad_norm": 0.8944997301358297,
      "learning_rate": 4.700006092874088e-05,
      "loss": 1.7251,
      "num_input_tokens_seen": 14087046960,
      "step": 17905
    },
    {
      "epoch": 1.8996392955654573,
      "grad_norm": 0.563181214794956,
      "learning_rate": 4.699973083147792e-05,
      "loss": 1.6991,
      "num_input_tokens_seen": 14087833808,
      "step": 17906
    },
    {
      "epoch": 1.8997453851050286,
      "grad_norm": 0.8792075002211492,
      "learning_rate": 4.699940071721423e-05,
      "loss": 1.7268,
      "num_input_tokens_seen": 14088620576,
      "step": 17907
    },
    {
      "epoch": 1.8998514746446,
      "grad_norm": 0.6105626136612325,
      "learning_rate": 4.699907058595003e-05,
      "loss": 1.7071,
      "num_input_tokens_seen": 14089407392,
      "step": 17908
    },
    {
      "epoch": 1.8999575641841715,
      "grad_norm": 0.9018268491928159,
      "learning_rate": 4.699874043768561e-05,
      "loss": 1.706,
      "num_input_tokens_seen": 14090194144,
      "step": 17909
    },
    {
      "epoch": 1.900063653723743,
      "grad_norm": 0.6839298760294742,
      "learning_rate": 4.6998410272421206e-05,
      "loss": 1.7137,
      "num_input_tokens_seen": 14090980944,
      "step": 17910
    },
    {
      "epoch": 1.9001697432633142,
      "grad_norm": 0.8066997144345727,
      "learning_rate": 4.6998080090157074e-05,
      "loss": 1.7291,
      "num_input_tokens_seen": 14091767680,
      "step": 17911
    },
    {
      "epoch": 1.9002758328028855,
      "grad_norm": 0.5863459538210661,
      "learning_rate": 4.699774989089347e-05,
      "loss": 1.7638,
      "num_input_tokens_seen": 14092554352,
      "step": 17912
    },
    {
      "epoch": 1.900381922342457,
      "grad_norm": 0.4213607806583214,
      "learning_rate": 4.699741967463066e-05,
      "loss": 1.5536,
      "num_input_tokens_seen": 14093341136,
      "step": 17913
    },
    {
      "epoch": 1.9004880118820284,
      "grad_norm": 0.7935377904257036,
      "learning_rate": 4.699708944136888e-05,
      "loss": 1.7799,
      "num_input_tokens_seen": 14094127904,
      "step": 17914
    },
    {
      "epoch": 1.9005941014216,
      "grad_norm": 0.5250117652674424,
      "learning_rate": 4.69967591911084e-05,
      "loss": 1.7203,
      "num_input_tokens_seen": 14094914656,
      "step": 17915
    },
    {
      "epoch": 1.9007001909611714,
      "grad_norm": 0.5899291736334138,
      "learning_rate": 4.699642892384946e-05,
      "loss": 1.6953,
      "num_input_tokens_seen": 14095701392,
      "step": 17916
    },
    {
      "epoch": 1.9008062805007426,
      "grad_norm": 0.690673119028174,
      "learning_rate": 4.699609863959233e-05,
      "loss": 1.9226,
      "num_input_tokens_seen": 14096488048,
      "step": 17917
    },
    {
      "epoch": 1.9009123700403139,
      "grad_norm": 0.486585142574855,
      "learning_rate": 4.699576833833726e-05,
      "loss": 1.6573,
      "num_input_tokens_seen": 14097274800,
      "step": 17918
    },
    {
      "epoch": 1.9010184595798854,
      "grad_norm": 0.49853149718737166,
      "learning_rate": 4.699543802008452e-05,
      "loss": 1.7589,
      "num_input_tokens_seen": 14098061440,
      "step": 17919
    },
    {
      "epoch": 1.9011245491194568,
      "grad_norm": 0.7100406187070033,
      "learning_rate": 4.699510768483433e-05,
      "loss": 1.8124,
      "num_input_tokens_seen": 14098848240,
      "step": 17920
    },
    {
      "epoch": 1.9012306386590283,
      "grad_norm": 0.6499195894028151,
      "learning_rate": 4.699477733258697e-05,
      "loss": 1.6842,
      "num_input_tokens_seen": 14099635024,
      "step": 17921
    },
    {
      "epoch": 1.9013367281985998,
      "grad_norm": 0.861318966813054,
      "learning_rate": 4.69944469633427e-05,
      "loss": 1.7569,
      "num_input_tokens_seen": 14100421808,
      "step": 17922
    },
    {
      "epoch": 1.901442817738171,
      "grad_norm": 1.009780196607606,
      "learning_rate": 4.699411657710176e-05,
      "loss": 1.7242,
      "num_input_tokens_seen": 14101208624,
      "step": 17923
    },
    {
      "epoch": 1.9015489072777423,
      "grad_norm": 0.6098785390752588,
      "learning_rate": 4.699378617386442e-05,
      "loss": 1.709,
      "num_input_tokens_seen": 14101995360,
      "step": 17924
    },
    {
      "epoch": 1.9016549968173138,
      "grad_norm": 0.7354718955755378,
      "learning_rate": 4.699345575363092e-05,
      "loss": 1.6839,
      "num_input_tokens_seen": 14102782080,
      "step": 17925
    },
    {
      "epoch": 1.9017610863568852,
      "grad_norm": 0.4838906620218869,
      "learning_rate": 4.699312531640152e-05,
      "loss": 1.7062,
      "num_input_tokens_seen": 14103568784,
      "step": 17926
    },
    {
      "epoch": 1.9018671758964567,
      "grad_norm": 0.550607332100669,
      "learning_rate": 4.6992794862176486e-05,
      "loss": 1.6861,
      "num_input_tokens_seen": 14104355568,
      "step": 17927
    },
    {
      "epoch": 1.901973265436028,
      "grad_norm": 0.475225366296412,
      "learning_rate": 4.699246439095606e-05,
      "loss": 1.7798,
      "num_input_tokens_seen": 14105142320,
      "step": 17928
    },
    {
      "epoch": 1.9020793549755994,
      "grad_norm": 0.5861071294654099,
      "learning_rate": 4.699213390274051e-05,
      "loss": 1.8721,
      "num_input_tokens_seen": 14105929056,
      "step": 17929
    },
    {
      "epoch": 1.9021854445151707,
      "grad_norm": 0.41858395517762453,
      "learning_rate": 4.699180339753007e-05,
      "loss": 1.7187,
      "num_input_tokens_seen": 14106715808,
      "step": 17930
    },
    {
      "epoch": 1.9022915340547422,
      "grad_norm": 0.4801570787792718,
      "learning_rate": 4.699147287532503e-05,
      "loss": 1.8863,
      "num_input_tokens_seen": 14107502768,
      "step": 17931
    },
    {
      "epoch": 1.9023976235943136,
      "grad_norm": 0.45669809207279644,
      "learning_rate": 4.699114233612561e-05,
      "loss": 1.8258,
      "num_input_tokens_seen": 14108289472,
      "step": 17932
    },
    {
      "epoch": 1.902503713133885,
      "grad_norm": 0.47969856893445634,
      "learning_rate": 4.699081177993209e-05,
      "loss": 1.8187,
      "num_input_tokens_seen": 14109076272,
      "step": 17933
    },
    {
      "epoch": 1.9026098026734564,
      "grad_norm": 0.4068237296633434,
      "learning_rate": 4.699048120674471e-05,
      "loss": 1.769,
      "num_input_tokens_seen": 14109862992,
      "step": 17934
    },
    {
      "epoch": 1.9027158922130278,
      "grad_norm": 0.3975882140938421,
      "learning_rate": 4.6990150616563725e-05,
      "loss": 1.6606,
      "num_input_tokens_seen": 14110649776,
      "step": 17935
    },
    {
      "epoch": 1.902821981752599,
      "grad_norm": 0.38817891065618276,
      "learning_rate": 4.6989820009389404e-05,
      "loss": 1.6498,
      "num_input_tokens_seen": 14111436432,
      "step": 17936
    },
    {
      "epoch": 1.9029280712921706,
      "grad_norm": 0.3818682305486856,
      "learning_rate": 4.6989489385222e-05,
      "loss": 1.7075,
      "num_input_tokens_seen": 14112223200,
      "step": 17937
    },
    {
      "epoch": 1.903034160831742,
      "grad_norm": 0.3707831694714676,
      "learning_rate": 4.698915874406176e-05,
      "loss": 1.6524,
      "num_input_tokens_seen": 14113009984,
      "step": 17938
    },
    {
      "epoch": 1.9031402503713135,
      "grad_norm": 0.45770207088168396,
      "learning_rate": 4.698882808590894e-05,
      "loss": 1.875,
      "num_input_tokens_seen": 14113796704,
      "step": 17939
    },
    {
      "epoch": 1.9032463399108848,
      "grad_norm": 0.4061837147844545,
      "learning_rate": 4.69884974107638e-05,
      "loss": 1.6554,
      "num_input_tokens_seen": 14114583440,
      "step": 17940
    },
    {
      "epoch": 1.9033524294504562,
      "grad_norm": 0.4502009897524678,
      "learning_rate": 4.6988166718626593e-05,
      "loss": 1.6648,
      "num_input_tokens_seen": 14115370144,
      "step": 17941
    },
    {
      "epoch": 1.9034585189900275,
      "grad_norm": 0.37209392931512564,
      "learning_rate": 4.698783600949758e-05,
      "loss": 1.6475,
      "num_input_tokens_seen": 14116156896,
      "step": 17942
    },
    {
      "epoch": 1.903564608529599,
      "grad_norm": 0.4607204392654509,
      "learning_rate": 4.698750528337701e-05,
      "loss": 1.8019,
      "num_input_tokens_seen": 14116943600,
      "step": 17943
    },
    {
      "epoch": 1.9036706980691704,
      "grad_norm": 0.4279715694318482,
      "learning_rate": 4.6987174540265144e-05,
      "loss": 1.7391,
      "num_input_tokens_seen": 14117730352,
      "step": 17944
    },
    {
      "epoch": 1.903776787608742,
      "grad_norm": 0.3930625550101957,
      "learning_rate": 4.698684378016222e-05,
      "loss": 1.7595,
      "num_input_tokens_seen": 14118517088,
      "step": 17945
    },
    {
      "epoch": 1.9038828771483132,
      "grad_norm": 0.4212704439078111,
      "learning_rate": 4.698651300306853e-05,
      "loss": 1.7926,
      "num_input_tokens_seen": 14119303744,
      "step": 17946
    },
    {
      "epoch": 1.9039889666878844,
      "grad_norm": 0.3932411537159545,
      "learning_rate": 4.69861822089843e-05,
      "loss": 1.9595,
      "num_input_tokens_seen": 14120090560,
      "step": 17947
    },
    {
      "epoch": 1.904095056227456,
      "grad_norm": 0.3793070016987523,
      "learning_rate": 4.698585139790979e-05,
      "loss": 1.7847,
      "num_input_tokens_seen": 14120877264,
      "step": 17948
    },
    {
      "epoch": 1.9042011457670274,
      "grad_norm": 0.36578154342623265,
      "learning_rate": 4.6985520569845265e-05,
      "loss": 1.6908,
      "num_input_tokens_seen": 14121664096,
      "step": 17949
    },
    {
      "epoch": 1.9043072353065988,
      "grad_norm": 0.3990461931884752,
      "learning_rate": 4.698518972479097e-05,
      "loss": 1.7095,
      "num_input_tokens_seen": 14122450896,
      "step": 17950
    },
    {
      "epoch": 1.9044133248461703,
      "grad_norm": 0.39505929207016965,
      "learning_rate": 4.698485886274716e-05,
      "loss": 1.7836,
      "num_input_tokens_seen": 14123237600,
      "step": 17951
    },
    {
      "epoch": 1.9045194143857416,
      "grad_norm": 0.4615467944529728,
      "learning_rate": 4.6984527983714105e-05,
      "loss": 1.8305,
      "num_input_tokens_seen": 14124024336,
      "step": 17952
    },
    {
      "epoch": 1.9046255039253128,
      "grad_norm": 0.4588789379942709,
      "learning_rate": 4.698419708769205e-05,
      "loss": 1.6074,
      "num_input_tokens_seen": 14124811248,
      "step": 17953
    },
    {
      "epoch": 1.9047315934648843,
      "grad_norm": 0.3741116868828589,
      "learning_rate": 4.698386617468125e-05,
      "loss": 1.6178,
      "num_input_tokens_seen": 14125598112,
      "step": 17954
    },
    {
      "epoch": 1.9048376830044558,
      "grad_norm": 0.3840491873714347,
      "learning_rate": 4.6983535244681964e-05,
      "loss": 1.6875,
      "num_input_tokens_seen": 14126384784,
      "step": 17955
    },
    {
      "epoch": 1.9049437725440272,
      "grad_norm": 0.4032439164107293,
      "learning_rate": 4.698320429769445e-05,
      "loss": 1.718,
      "num_input_tokens_seen": 14127171568,
      "step": 17956
    },
    {
      "epoch": 1.9050498620835987,
      "grad_norm": 0.310999422479002,
      "learning_rate": 4.698287333371896e-05,
      "loss": 1.598,
      "num_input_tokens_seen": 14127958320,
      "step": 17957
    },
    {
      "epoch": 1.90515595162317,
      "grad_norm": 0.37291597047357067,
      "learning_rate": 4.6982542352755756e-05,
      "loss": 1.6442,
      "num_input_tokens_seen": 14128745072,
      "step": 17958
    },
    {
      "epoch": 1.9052620411627412,
      "grad_norm": 0.3760000487669847,
      "learning_rate": 4.6982211354805075e-05,
      "loss": 1.7083,
      "num_input_tokens_seen": 14129531808,
      "step": 17959
    },
    {
      "epoch": 1.9053681307023127,
      "grad_norm": 0.38972639909203083,
      "learning_rate": 4.6981880339867196e-05,
      "loss": 1.7868,
      "num_input_tokens_seen": 14130318624,
      "step": 17960
    },
    {
      "epoch": 1.9054742202418842,
      "grad_norm": 0.35250164643245896,
      "learning_rate": 4.698154930794236e-05,
      "loss": 1.6393,
      "num_input_tokens_seen": 14131105392,
      "step": 17961
    },
    {
      "epoch": 1.9055803097814557,
      "grad_norm": 0.4749343263058439,
      "learning_rate": 4.6981218259030826e-05,
      "loss": 1.7683,
      "num_input_tokens_seen": 14131892096,
      "step": 17962
    },
    {
      "epoch": 1.905686399321027,
      "grad_norm": 0.38312571122690875,
      "learning_rate": 4.6980887193132864e-05,
      "loss": 1.8341,
      "num_input_tokens_seen": 14132678848,
      "step": 17963
    },
    {
      "epoch": 1.9057924888605984,
      "grad_norm": 0.40435699154450244,
      "learning_rate": 4.6980556110248706e-05,
      "loss": 1.7462,
      "num_input_tokens_seen": 14133465696,
      "step": 17964
    },
    {
      "epoch": 1.9058985784001696,
      "grad_norm": 0.3923965022132116,
      "learning_rate": 4.698022501037862e-05,
      "loss": 1.7398,
      "num_input_tokens_seen": 14134252432,
      "step": 17965
    },
    {
      "epoch": 1.906004667939741,
      "grad_norm": 0.49506891669970327,
      "learning_rate": 4.697989389352287e-05,
      "loss": 1.8629,
      "num_input_tokens_seen": 14135039152,
      "step": 17966
    },
    {
      "epoch": 1.9061107574793126,
      "grad_norm": 0.4267361309634514,
      "learning_rate": 4.697956275968168e-05,
      "loss": 1.6908,
      "num_input_tokens_seen": 14135825952,
      "step": 17967
    },
    {
      "epoch": 1.906216847018884,
      "grad_norm": 0.4039737743624307,
      "learning_rate": 4.697923160885535e-05,
      "loss": 1.696,
      "num_input_tokens_seen": 14136612736,
      "step": 17968
    },
    {
      "epoch": 1.9063229365584553,
      "grad_norm": 0.4903841696339173,
      "learning_rate": 4.697890044104411e-05,
      "loss": 1.7638,
      "num_input_tokens_seen": 14137399440,
      "step": 17969
    },
    {
      "epoch": 1.9064290260980268,
      "grad_norm": 0.4327066660003496,
      "learning_rate": 4.6978569256248215e-05,
      "loss": 1.6277,
      "num_input_tokens_seen": 14138186224,
      "step": 17970
    },
    {
      "epoch": 1.906535115637598,
      "grad_norm": 0.3876963263786738,
      "learning_rate": 4.697823805446794e-05,
      "loss": 1.6974,
      "num_input_tokens_seen": 14138973024,
      "step": 17971
    },
    {
      "epoch": 1.9066412051771695,
      "grad_norm": 0.46424405505965305,
      "learning_rate": 4.697790683570351e-05,
      "loss": 1.7083,
      "num_input_tokens_seen": 14139759728,
      "step": 17972
    },
    {
      "epoch": 1.906747294716741,
      "grad_norm": 0.3805129602526601,
      "learning_rate": 4.697757559995521e-05,
      "loss": 1.7274,
      "num_input_tokens_seen": 14140546384,
      "step": 17973
    },
    {
      "epoch": 1.9068533842563125,
      "grad_norm": 0.43953050693159873,
      "learning_rate": 4.697724434722328e-05,
      "loss": 1.753,
      "num_input_tokens_seen": 14141333232,
      "step": 17974
    },
    {
      "epoch": 1.9069594737958837,
      "grad_norm": 0.3821421022130515,
      "learning_rate": 4.697691307750798e-05,
      "loss": 1.8211,
      "num_input_tokens_seen": 14142119952,
      "step": 17975
    },
    {
      "epoch": 1.907065563335455,
      "grad_norm": 0.4084865716440626,
      "learning_rate": 4.697658179080957e-05,
      "loss": 1.9462,
      "num_input_tokens_seen": 14142906672,
      "step": 17976
    },
    {
      "epoch": 1.9071716528750264,
      "grad_norm": 0.503071568094126,
      "learning_rate": 4.6976250487128305e-05,
      "loss": 1.7719,
      "num_input_tokens_seen": 14143693456,
      "step": 17977
    },
    {
      "epoch": 1.907277742414598,
      "grad_norm": 0.368105333566021,
      "learning_rate": 4.6975919166464435e-05,
      "loss": 1.7407,
      "num_input_tokens_seen": 14144480192,
      "step": 17978
    },
    {
      "epoch": 1.9073838319541694,
      "grad_norm": 0.4507662247670249,
      "learning_rate": 4.697558782881821e-05,
      "loss": 1.7174,
      "num_input_tokens_seen": 14145266992,
      "step": 17979
    },
    {
      "epoch": 1.9074899214937409,
      "grad_norm": 0.4820511829637218,
      "learning_rate": 4.697525647418991e-05,
      "loss": 1.7399,
      "num_input_tokens_seen": 14146053776,
      "step": 17980
    },
    {
      "epoch": 1.9075960110333121,
      "grad_norm": 0.5231186985699209,
      "learning_rate": 4.697492510257977e-05,
      "loss": 1.7375,
      "num_input_tokens_seen": 14146840576,
      "step": 17981
    },
    {
      "epoch": 1.9077021005728834,
      "grad_norm": 0.4934563823050698,
      "learning_rate": 4.6974593713988056e-05,
      "loss": 1.8212,
      "num_input_tokens_seen": 14147627376,
      "step": 17982
    },
    {
      "epoch": 1.9078081901124548,
      "grad_norm": 0.4180371122716196,
      "learning_rate": 4.697426230841502e-05,
      "loss": 1.623,
      "num_input_tokens_seen": 14148414144,
      "step": 17983
    },
    {
      "epoch": 1.9079142796520263,
      "grad_norm": 0.5339032030007252,
      "learning_rate": 4.697393088586092e-05,
      "loss": 1.7476,
      "num_input_tokens_seen": 14149200816,
      "step": 17984
    },
    {
      "epoch": 1.9080203691915978,
      "grad_norm": 0.4454546686308573,
      "learning_rate": 4.6973599446326e-05,
      "loss": 1.8163,
      "num_input_tokens_seen": 14149987632,
      "step": 17985
    },
    {
      "epoch": 1.9081264587311693,
      "grad_norm": 0.6083446102675041,
      "learning_rate": 4.697326798981054e-05,
      "loss": 1.7017,
      "num_input_tokens_seen": 14150774416,
      "step": 17986
    },
    {
      "epoch": 1.9082325482707405,
      "grad_norm": 0.4138095877003641,
      "learning_rate": 4.697293651631478e-05,
      "loss": 1.7066,
      "num_input_tokens_seen": 14151561168,
      "step": 17987
    },
    {
      "epoch": 1.9083386378103118,
      "grad_norm": 0.4216725811209921,
      "learning_rate": 4.6972605025838976e-05,
      "loss": 1.5959,
      "num_input_tokens_seen": 14152347968,
      "step": 17988
    },
    {
      "epoch": 1.9084447273498832,
      "grad_norm": 0.5490262931292784,
      "learning_rate": 4.697227351838339e-05,
      "loss": 1.7095,
      "num_input_tokens_seen": 14153134768,
      "step": 17989
    },
    {
      "epoch": 1.9085508168894547,
      "grad_norm": 0.3482062811571071,
      "learning_rate": 4.697194199394827e-05,
      "loss": 1.6375,
      "num_input_tokens_seen": 14153921632,
      "step": 17990
    },
    {
      "epoch": 1.9086569064290262,
      "grad_norm": 0.7664896340008599,
      "learning_rate": 4.697161045253389e-05,
      "loss": 1.7241,
      "num_input_tokens_seen": 14154708496,
      "step": 17991
    },
    {
      "epoch": 1.9087629959685974,
      "grad_norm": 0.42298052599333,
      "learning_rate": 4.697127889414048e-05,
      "loss": 1.7001,
      "num_input_tokens_seen": 14155495328,
      "step": 17992
    },
    {
      "epoch": 1.908869085508169,
      "grad_norm": 0.5621067170694453,
      "learning_rate": 4.6970947318768324e-05,
      "loss": 1.665,
      "num_input_tokens_seen": 14156282096,
      "step": 17993
    },
    {
      "epoch": 1.9089751750477402,
      "grad_norm": 0.6256967959375489,
      "learning_rate": 4.697061572641765e-05,
      "loss": 1.8093,
      "num_input_tokens_seen": 14157068928,
      "step": 17994
    },
    {
      "epoch": 1.9090812645873116,
      "grad_norm": 0.46329837441148053,
      "learning_rate": 4.6970284117088735e-05,
      "loss": 1.5846,
      "num_input_tokens_seen": 14157855632,
      "step": 17995
    },
    {
      "epoch": 1.9091873541268831,
      "grad_norm": 0.756352337952979,
      "learning_rate": 4.6969952490781835e-05,
      "loss": 1.7089,
      "num_input_tokens_seen": 14158642320,
      "step": 17996
    },
    {
      "epoch": 1.9092934436664546,
      "grad_norm": 0.4952467771692885,
      "learning_rate": 4.6969620847497196e-05,
      "loss": 1.7479,
      "num_input_tokens_seen": 14159429104,
      "step": 17997
    },
    {
      "epoch": 1.9093995332060258,
      "grad_norm": 0.5274033483430004,
      "learning_rate": 4.6969289187235075e-05,
      "loss": 1.7314,
      "num_input_tokens_seen": 14160215872,
      "step": 17998
    },
    {
      "epoch": 1.9095056227455973,
      "grad_norm": 0.7552461889626393,
      "learning_rate": 4.696895750999574e-05,
      "loss": 1.6646,
      "num_input_tokens_seen": 14161002624,
      "step": 17999
    },
    {
      "epoch": 1.9096117122851686,
      "grad_norm": 0.5642923071768705,
      "learning_rate": 4.6968625815779435e-05,
      "loss": 1.6954,
      "num_input_tokens_seen": 14161789344,
      "step": 18000
    },
    {
      "epoch": 1.9096117122851686,
      "eval_loss": 1.7224416732788086,
      "eval_runtime": 65.8794,
      "eval_samples_per_second": 45.538,
      "eval_steps_per_second": 0.486,
      "num_input_tokens_seen": 14161789344,
      "step": 18000
    },
    {
      "epoch": 1.90971780182474,
      "grad_norm": 0.6681701528183285,
      "learning_rate": 4.6968294104586417e-05,
      "loss": 1.7455,
      "num_input_tokens_seen": 14162576176,
      "step": 18001
    },
    {
      "epoch": 1.9098238913643115,
      "grad_norm": 0.4856817040168819,
      "learning_rate": 4.6967962376416953e-05,
      "loss": 1.7244,
      "num_input_tokens_seen": 14163362912,
      "step": 18002
    },
    {
      "epoch": 1.909929980903883,
      "grad_norm": 0.41295828888717767,
      "learning_rate": 4.696763063127129e-05,
      "loss": 1.6177,
      "num_input_tokens_seen": 14164149712,
      "step": 18003
    },
    {
      "epoch": 1.9100360704434542,
      "grad_norm": 0.5869502568360986,
      "learning_rate": 4.6967298869149684e-05,
      "loss": 1.7506,
      "num_input_tokens_seen": 14164936432,
      "step": 18004
    },
    {
      "epoch": 1.9101421599830257,
      "grad_norm": 0.3553122475195729,
      "learning_rate": 4.696696709005239e-05,
      "loss": 1.597,
      "num_input_tokens_seen": 14165723200,
      "step": 18005
    },
    {
      "epoch": 1.910248249522597,
      "grad_norm": 0.4610918447386016,
      "learning_rate": 4.696663529397968e-05,
      "loss": 1.6188,
      "num_input_tokens_seen": 14166509968,
      "step": 18006
    },
    {
      "epoch": 1.9103543390621684,
      "grad_norm": 0.4356744510296568,
      "learning_rate": 4.6966303480931795e-05,
      "loss": 1.7776,
      "num_input_tokens_seen": 14167296720,
      "step": 18007
    },
    {
      "epoch": 1.91046042860174,
      "grad_norm": 0.41892024983954446,
      "learning_rate": 4.696597165090899e-05,
      "loss": 1.68,
      "num_input_tokens_seen": 14168083536,
      "step": 18008
    },
    {
      "epoch": 1.9105665181413114,
      "grad_norm": 0.42985937391591317,
      "learning_rate": 4.696563980391153e-05,
      "loss": 1.6904,
      "num_input_tokens_seen": 14168870304,
      "step": 18009
    },
    {
      "epoch": 1.9106726076808827,
      "grad_norm": 0.6643462569583098,
      "learning_rate": 4.696530793993967e-05,
      "loss": 1.753,
      "num_input_tokens_seen": 14169657136,
      "step": 18010
    },
    {
      "epoch": 1.910778697220454,
      "grad_norm": 0.4612603046362449,
      "learning_rate": 4.696497605899366e-05,
      "loss": 1.811,
      "num_input_tokens_seen": 14170443968,
      "step": 18011
    },
    {
      "epoch": 1.9108847867600254,
      "grad_norm": 0.3671088261572765,
      "learning_rate": 4.6964644161073765e-05,
      "loss": 1.7183,
      "num_input_tokens_seen": 14171230704,
      "step": 18012
    },
    {
      "epoch": 1.9109908762995969,
      "grad_norm": 0.49527461722363736,
      "learning_rate": 4.696431224618023e-05,
      "loss": 1.7429,
      "num_input_tokens_seen": 14172017472,
      "step": 18013
    },
    {
      "epoch": 1.9110969658391683,
      "grad_norm": 0.43145822943128204,
      "learning_rate": 4.6963980314313325e-05,
      "loss": 1.7263,
      "num_input_tokens_seen": 14172804128,
      "step": 18014
    },
    {
      "epoch": 1.9112030553787398,
      "grad_norm": 0.40714459005563625,
      "learning_rate": 4.69636483654733e-05,
      "loss": 1.6592,
      "num_input_tokens_seen": 14173590912,
      "step": 18015
    },
    {
      "epoch": 1.911309144918311,
      "grad_norm": 0.5164566484962383,
      "learning_rate": 4.6963316399660416e-05,
      "loss": 1.8418,
      "num_input_tokens_seen": 14174377696,
      "step": 18016
    },
    {
      "epoch": 1.9114152344578823,
      "grad_norm": 0.37316538583641234,
      "learning_rate": 4.696298441687492e-05,
      "loss": 1.7215,
      "num_input_tokens_seen": 14175164432,
      "step": 18017
    },
    {
      "epoch": 1.9115213239974538,
      "grad_norm": 0.5625020841752377,
      "learning_rate": 4.696265241711708e-05,
      "loss": 1.7472,
      "num_input_tokens_seen": 14175951184,
      "step": 18018
    },
    {
      "epoch": 1.9116274135370253,
      "grad_norm": 0.3975314276317141,
      "learning_rate": 4.696232040038714e-05,
      "loss": 1.7983,
      "num_input_tokens_seen": 14176738080,
      "step": 18019
    },
    {
      "epoch": 1.9117335030765967,
      "grad_norm": 0.46330048952103037,
      "learning_rate": 4.696198836668536e-05,
      "loss": 1.7316,
      "num_input_tokens_seen": 14177524848,
      "step": 18020
    },
    {
      "epoch": 1.9118395926161682,
      "grad_norm": 0.4092950716823811,
      "learning_rate": 4.6961656316012e-05,
      "loss": 1.7267,
      "num_input_tokens_seen": 14178311648,
      "step": 18021
    },
    {
      "epoch": 1.9119456821557395,
      "grad_norm": 0.36878125775259585,
      "learning_rate": 4.6961324248367325e-05,
      "loss": 1.5864,
      "num_input_tokens_seen": 14179098464,
      "step": 18022
    },
    {
      "epoch": 1.9120517716953107,
      "grad_norm": 0.4561340732981403,
      "learning_rate": 4.6960992163751585e-05,
      "loss": 1.7803,
      "num_input_tokens_seen": 14179885232,
      "step": 18023
    },
    {
      "epoch": 1.9121578612348822,
      "grad_norm": 0.3789532531485555,
      "learning_rate": 4.696066006216503e-05,
      "loss": 1.7005,
      "num_input_tokens_seen": 14180672000,
      "step": 18024
    },
    {
      "epoch": 1.9122639507744537,
      "grad_norm": 0.3596003767264714,
      "learning_rate": 4.6960327943607916e-05,
      "loss": 1.6723,
      "num_input_tokens_seen": 14181458720,
      "step": 18025
    },
    {
      "epoch": 1.9123700403140251,
      "grad_norm": 0.3736495943388197,
      "learning_rate": 4.6959995808080515e-05,
      "loss": 1.7514,
      "num_input_tokens_seen": 14182245424,
      "step": 18026
    },
    {
      "epoch": 1.9124761298535964,
      "grad_norm": 0.34750700673060064,
      "learning_rate": 4.6959663655583066e-05,
      "loss": 1.6598,
      "num_input_tokens_seen": 14183032176,
      "step": 18027
    },
    {
      "epoch": 1.9125822193931679,
      "grad_norm": 0.4549095350992509,
      "learning_rate": 4.6959331486115835e-05,
      "loss": 1.8843,
      "num_input_tokens_seen": 14183818864,
      "step": 18028
    },
    {
      "epoch": 1.9126883089327391,
      "grad_norm": 0.32410157394294536,
      "learning_rate": 4.695899929967908e-05,
      "loss": 1.7015,
      "num_input_tokens_seen": 14184605664,
      "step": 18029
    },
    {
      "epoch": 1.9127943984723106,
      "grad_norm": 0.32248157394281546,
      "learning_rate": 4.6958667096273044e-05,
      "loss": 1.5792,
      "num_input_tokens_seen": 14185392448,
      "step": 18030
    },
    {
      "epoch": 1.912900488011882,
      "grad_norm": 0.4097075626430734,
      "learning_rate": 4.6958334875898e-05,
      "loss": 1.7666,
      "num_input_tokens_seen": 14186179232,
      "step": 18031
    },
    {
      "epoch": 1.9130065775514535,
      "grad_norm": 0.3478781796536663,
      "learning_rate": 4.695800263855421e-05,
      "loss": 1.7087,
      "num_input_tokens_seen": 14186965936,
      "step": 18032
    },
    {
      "epoch": 1.9131126670910248,
      "grad_norm": 0.35660745921011167,
      "learning_rate": 4.695767038424191e-05,
      "loss": 1.6818,
      "num_input_tokens_seen": 14187752672,
      "step": 18033
    },
    {
      "epoch": 1.9132187566305963,
      "grad_norm": 0.39117751150456914,
      "learning_rate": 4.695733811296137e-05,
      "loss": 1.692,
      "num_input_tokens_seen": 14188539456,
      "step": 18034
    },
    {
      "epoch": 1.9133248461701675,
      "grad_norm": 0.43927629268914853,
      "learning_rate": 4.695700582471284e-05,
      "loss": 1.7379,
      "num_input_tokens_seen": 14189326288,
      "step": 18035
    },
    {
      "epoch": 1.913430935709739,
      "grad_norm": 0.4115740339302802,
      "learning_rate": 4.695667351949658e-05,
      "loss": 1.6149,
      "num_input_tokens_seen": 14190113040,
      "step": 18036
    },
    {
      "epoch": 1.9135370252493105,
      "grad_norm": 0.35678729093092604,
      "learning_rate": 4.695634119731285e-05,
      "loss": 1.7131,
      "num_input_tokens_seen": 14190899792,
      "step": 18037
    },
    {
      "epoch": 1.913643114788882,
      "grad_norm": 0.4045013804109936,
      "learning_rate": 4.69560088581619e-05,
      "loss": 1.594,
      "num_input_tokens_seen": 14191686560,
      "step": 18038
    },
    {
      "epoch": 1.9137492043284532,
      "grad_norm": 0.3285775030864847,
      "learning_rate": 4.6955676502043986e-05,
      "loss": 1.6233,
      "num_input_tokens_seen": 14192473376,
      "step": 18039
    },
    {
      "epoch": 1.9138552938680247,
      "grad_norm": 0.31237001142068616,
      "learning_rate": 4.695534412895938e-05,
      "loss": 1.6187,
      "num_input_tokens_seen": 14193260304,
      "step": 18040
    },
    {
      "epoch": 1.913961383407596,
      "grad_norm": 0.3764436140724782,
      "learning_rate": 4.695501173890833e-05,
      "loss": 1.7204,
      "num_input_tokens_seen": 14194047104,
      "step": 18041
    },
    {
      "epoch": 1.9140674729471674,
      "grad_norm": 0.3446808519306494,
      "learning_rate": 4.6954679331891086e-05,
      "loss": 1.5955,
      "num_input_tokens_seen": 14194833968,
      "step": 18042
    },
    {
      "epoch": 1.9141735624867389,
      "grad_norm": 0.399465045365481,
      "learning_rate": 4.695434690790791e-05,
      "loss": 1.7,
      "num_input_tokens_seen": 14195620768,
      "step": 18043
    },
    {
      "epoch": 1.9142796520263103,
      "grad_norm": 0.34669322273879993,
      "learning_rate": 4.695401446695905e-05,
      "loss": 1.6462,
      "num_input_tokens_seen": 14196407472,
      "step": 18044
    },
    {
      "epoch": 1.9143857415658816,
      "grad_norm": 0.3580323782649322,
      "learning_rate": 4.695368200904479e-05,
      "loss": 1.793,
      "num_input_tokens_seen": 14197194240,
      "step": 18045
    },
    {
      "epoch": 1.9144918311054528,
      "grad_norm": 0.4040829244234741,
      "learning_rate": 4.695334953416535e-05,
      "loss": 1.7353,
      "num_input_tokens_seen": 14197980944,
      "step": 18046
    },
    {
      "epoch": 1.9145979206450243,
      "grad_norm": 0.3526843077108129,
      "learning_rate": 4.6953017042321014e-05,
      "loss": 1.7158,
      "num_input_tokens_seen": 14198767712,
      "step": 18047
    },
    {
      "epoch": 1.9147040101845958,
      "grad_norm": 0.42138845576429984,
      "learning_rate": 4.695268453351203e-05,
      "loss": 1.735,
      "num_input_tokens_seen": 14199554448,
      "step": 18048
    },
    {
      "epoch": 1.9148100997241673,
      "grad_norm": 0.3990415998464212,
      "learning_rate": 4.695235200773866e-05,
      "loss": 1.6969,
      "num_input_tokens_seen": 14200341248,
      "step": 18049
    },
    {
      "epoch": 1.9149161892637387,
      "grad_norm": 0.38820163540811903,
      "learning_rate": 4.695201946500115e-05,
      "loss": 1.7031,
      "num_input_tokens_seen": 14201127968,
      "step": 18050
    },
    {
      "epoch": 1.91502227880331,
      "grad_norm": 0.3339303388804388,
      "learning_rate": 4.695168690529977e-05,
      "loss": 1.6792,
      "num_input_tokens_seen": 14201914720,
      "step": 18051
    },
    {
      "epoch": 1.9151283683428812,
      "grad_norm": 0.3664802769361239,
      "learning_rate": 4.695135432863477e-05,
      "loss": 1.8016,
      "num_input_tokens_seen": 14202701472,
      "step": 18052
    },
    {
      "epoch": 1.9152344578824527,
      "grad_norm": 0.4379995242397887,
      "learning_rate": 4.69510217350064e-05,
      "loss": 1.6837,
      "num_input_tokens_seen": 14203488256,
      "step": 18053
    },
    {
      "epoch": 1.9153405474220242,
      "grad_norm": 0.33924338082798006,
      "learning_rate": 4.6950689124414924e-05,
      "loss": 1.6298,
      "num_input_tokens_seen": 14204275104,
      "step": 18054
    },
    {
      "epoch": 1.9154466369615957,
      "grad_norm": 0.49128720682036797,
      "learning_rate": 4.6950356496860606e-05,
      "loss": 1.626,
      "num_input_tokens_seen": 14205061824,
      "step": 18055
    },
    {
      "epoch": 1.9155527265011671,
      "grad_norm": 0.4084009808077181,
      "learning_rate": 4.6950023852343694e-05,
      "loss": 1.73,
      "num_input_tokens_seen": 14205848608,
      "step": 18056
    },
    {
      "epoch": 1.9156588160407384,
      "grad_norm": 0.36989057886976023,
      "learning_rate": 4.694969119086445e-05,
      "loss": 1.6379,
      "num_input_tokens_seen": 14206635392,
      "step": 18057
    },
    {
      "epoch": 1.9157649055803097,
      "grad_norm": 0.5377453149543402,
      "learning_rate": 4.694935851242313e-05,
      "loss": 1.6589,
      "num_input_tokens_seen": 14207422112,
      "step": 18058
    },
    {
      "epoch": 1.9158709951198811,
      "grad_norm": 0.46660422108537375,
      "learning_rate": 4.6949025817019984e-05,
      "loss": 1.6116,
      "num_input_tokens_seen": 14208208912,
      "step": 18059
    },
    {
      "epoch": 1.9159770846594526,
      "grad_norm": 0.5519995266911103,
      "learning_rate": 4.6948693104655285e-05,
      "loss": 1.6417,
      "num_input_tokens_seen": 14208995728,
      "step": 18060
    },
    {
      "epoch": 1.916083174199024,
      "grad_norm": 0.3670605614975721,
      "learning_rate": 4.694836037532927e-05,
      "loss": 1.6789,
      "num_input_tokens_seen": 14209782448,
      "step": 18061
    },
    {
      "epoch": 1.9161892637385953,
      "grad_norm": 0.4423819759848873,
      "learning_rate": 4.694802762904221e-05,
      "loss": 1.7666,
      "num_input_tokens_seen": 14210569200,
      "step": 18062
    },
    {
      "epoch": 1.9162953532781668,
      "grad_norm": 0.48346421023037883,
      "learning_rate": 4.6947694865794356e-05,
      "loss": 1.6574,
      "num_input_tokens_seen": 14211355920,
      "step": 18063
    },
    {
      "epoch": 1.916401442817738,
      "grad_norm": 0.5360574960052366,
      "learning_rate": 4.6947362085585964e-05,
      "loss": 1.7035,
      "num_input_tokens_seen": 14212142576,
      "step": 18064
    },
    {
      "epoch": 1.9165075323573095,
      "grad_norm": 0.33193189586321203,
      "learning_rate": 4.6947029288417296e-05,
      "loss": 1.6367,
      "num_input_tokens_seen": 14212929376,
      "step": 18065
    },
    {
      "epoch": 1.916613621896881,
      "grad_norm": 0.3936280912017851,
      "learning_rate": 4.694669647428862e-05,
      "loss": 1.5756,
      "num_input_tokens_seen": 14213716144,
      "step": 18066
    },
    {
      "epoch": 1.9167197114364525,
      "grad_norm": 0.40638846127021894,
      "learning_rate": 4.694636364320017e-05,
      "loss": 1.6582,
      "num_input_tokens_seen": 14214502896,
      "step": 18067
    },
    {
      "epoch": 1.9168258009760237,
      "grad_norm": 0.37440264133606405,
      "learning_rate": 4.6946030795152216e-05,
      "loss": 1.5973,
      "num_input_tokens_seen": 14215289680,
      "step": 18068
    },
    {
      "epoch": 1.9169318905155952,
      "grad_norm": 0.4306893993867891,
      "learning_rate": 4.694569793014502e-05,
      "loss": 1.8803,
      "num_input_tokens_seen": 14216076480,
      "step": 18069
    },
    {
      "epoch": 1.9170379800551665,
      "grad_norm": 0.34693028696116723,
      "learning_rate": 4.694536504817882e-05,
      "loss": 1.796,
      "num_input_tokens_seen": 14216863200,
      "step": 18070
    },
    {
      "epoch": 1.917144069594738,
      "grad_norm": 0.5622430145466745,
      "learning_rate": 4.6945032149253886e-05,
      "loss": 1.709,
      "num_input_tokens_seen": 14217649952,
      "step": 18071
    },
    {
      "epoch": 1.9172501591343094,
      "grad_norm": 0.39395605749946216,
      "learning_rate": 4.694469923337048e-05,
      "loss": 1.7291,
      "num_input_tokens_seen": 14218436656,
      "step": 18072
    },
    {
      "epoch": 1.9173562486738809,
      "grad_norm": 0.4714863554665459,
      "learning_rate": 4.694436630052886e-05,
      "loss": 1.7077,
      "num_input_tokens_seen": 14219223424,
      "step": 18073
    },
    {
      "epoch": 1.9174623382134521,
      "grad_norm": 0.38809094467680183,
      "learning_rate": 4.694403335072927e-05,
      "loss": 1.6888,
      "num_input_tokens_seen": 14220010176,
      "step": 18074
    },
    {
      "epoch": 1.9175684277530234,
      "grad_norm": 0.31809754472397134,
      "learning_rate": 4.694370038397198e-05,
      "loss": 1.5673,
      "num_input_tokens_seen": 14220796992,
      "step": 18075
    },
    {
      "epoch": 1.9176745172925949,
      "grad_norm": 0.36027533336878287,
      "learning_rate": 4.6943367400257245e-05,
      "loss": 1.7088,
      "num_input_tokens_seen": 14221583728,
      "step": 18076
    },
    {
      "epoch": 1.9177806068321663,
      "grad_norm": 0.6866048227708033,
      "learning_rate": 4.694303439958531e-05,
      "loss": 1.6713,
      "num_input_tokens_seen": 14222370592,
      "step": 18077
    },
    {
      "epoch": 1.9178866963717378,
      "grad_norm": 0.6622807456073306,
      "learning_rate": 4.6942701381956446e-05,
      "loss": 1.618,
      "num_input_tokens_seen": 14223157408,
      "step": 18078
    },
    {
      "epoch": 1.9179927859113093,
      "grad_norm": 0.4979070129962296,
      "learning_rate": 4.69423683473709e-05,
      "loss": 1.5487,
      "num_input_tokens_seen": 14223944224,
      "step": 18079
    },
    {
      "epoch": 1.9180988754508805,
      "grad_norm": 0.4381558981784535,
      "learning_rate": 4.694203529582895e-05,
      "loss": 1.6902,
      "num_input_tokens_seen": 14224730896,
      "step": 18080
    },
    {
      "epoch": 1.9182049649904518,
      "grad_norm": 0.5115446923399989,
      "learning_rate": 4.694170222733083e-05,
      "loss": 1.6376,
      "num_input_tokens_seen": 14225517776,
      "step": 18081
    },
    {
      "epoch": 1.9183110545300233,
      "grad_norm": 0.3863587535159321,
      "learning_rate": 4.6941369141876805e-05,
      "loss": 1.789,
      "num_input_tokens_seen": 14226304496,
      "step": 18082
    },
    {
      "epoch": 1.9184171440695947,
      "grad_norm": 0.47457472943828194,
      "learning_rate": 4.6941036039467136e-05,
      "loss": 1.8529,
      "num_input_tokens_seen": 14227091200,
      "step": 18083
    },
    {
      "epoch": 1.9185232336091662,
      "grad_norm": 0.3455930707476553,
      "learning_rate": 4.6940702920102077e-05,
      "loss": 1.6809,
      "num_input_tokens_seen": 14227878032,
      "step": 18084
    },
    {
      "epoch": 1.9186293231487377,
      "grad_norm": 0.5942568373190612,
      "learning_rate": 4.694036978378189e-05,
      "loss": 1.7123,
      "num_input_tokens_seen": 14228664672,
      "step": 18085
    },
    {
      "epoch": 1.918735412688309,
      "grad_norm": 0.3566591919446352,
      "learning_rate": 4.694003663050682e-05,
      "loss": 1.6755,
      "num_input_tokens_seen": 14229451520,
      "step": 18086
    },
    {
      "epoch": 1.9188415022278802,
      "grad_norm": 0.42786532631589824,
      "learning_rate": 4.693970346027714e-05,
      "loss": 1.5699,
      "num_input_tokens_seen": 14230238336,
      "step": 18087
    },
    {
      "epoch": 1.9189475917674517,
      "grad_norm": 0.3551135197128474,
      "learning_rate": 4.693937027309311e-05,
      "loss": 1.8108,
      "num_input_tokens_seen": 14231025104,
      "step": 18088
    },
    {
      "epoch": 1.9190536813070231,
      "grad_norm": 0.3888439402821298,
      "learning_rate": 4.693903706895497e-05,
      "loss": 1.7307,
      "num_input_tokens_seen": 14231811872,
      "step": 18089
    },
    {
      "epoch": 1.9191597708465946,
      "grad_norm": 0.41300652659136217,
      "learning_rate": 4.6938703847862985e-05,
      "loss": 1.6539,
      "num_input_tokens_seen": 14232598736,
      "step": 18090
    },
    {
      "epoch": 1.919265860386166,
      "grad_norm": 0.32180513715237374,
      "learning_rate": 4.693837060981741e-05,
      "loss": 1.5611,
      "num_input_tokens_seen": 14233385616,
      "step": 18091
    },
    {
      "epoch": 1.9193719499257373,
      "grad_norm": 0.4942446662243922,
      "learning_rate": 4.693803735481851e-05,
      "loss": 1.7213,
      "num_input_tokens_seen": 14234172384,
      "step": 18092
    },
    {
      "epoch": 1.9194780394653086,
      "grad_norm": 0.41585185031649274,
      "learning_rate": 4.693770408286654e-05,
      "loss": 1.8548,
      "num_input_tokens_seen": 14234959168,
      "step": 18093
    },
    {
      "epoch": 1.91958412900488,
      "grad_norm": 0.35807237140956827,
      "learning_rate": 4.693737079396175e-05,
      "loss": 1.6305,
      "num_input_tokens_seen": 14235745936,
      "step": 18094
    },
    {
      "epoch": 1.9196902185444515,
      "grad_norm": 0.4293112827512397,
      "learning_rate": 4.6937037488104405e-05,
      "loss": 1.6244,
      "num_input_tokens_seen": 14236532768,
      "step": 18095
    },
    {
      "epoch": 1.919796308084023,
      "grad_norm": 0.40052288519969276,
      "learning_rate": 4.6936704165294765e-05,
      "loss": 1.7155,
      "num_input_tokens_seen": 14237319456,
      "step": 18096
    },
    {
      "epoch": 1.9199023976235943,
      "grad_norm": 0.4255164680088235,
      "learning_rate": 4.693637082553308e-05,
      "loss": 1.7075,
      "num_input_tokens_seen": 14238106272,
      "step": 18097
    },
    {
      "epoch": 1.9200084871631657,
      "grad_norm": 0.4638151798397941,
      "learning_rate": 4.693603746881962e-05,
      "loss": 1.6255,
      "num_input_tokens_seen": 14238893008,
      "step": 18098
    },
    {
      "epoch": 1.920114576702737,
      "grad_norm": 0.373617509999409,
      "learning_rate": 4.693570409515463e-05,
      "loss": 1.7918,
      "num_input_tokens_seen": 14239679840,
      "step": 18099
    },
    {
      "epoch": 1.9202206662423085,
      "grad_norm": 0.43907992662861445,
      "learning_rate": 4.693537070453836e-05,
      "loss": 1.6616,
      "num_input_tokens_seen": 14240466544,
      "step": 18100
    },
    {
      "epoch": 1.92032675578188,
      "grad_norm": 0.36284535488144914,
      "learning_rate": 4.69350372969711e-05,
      "loss": 1.6272,
      "num_input_tokens_seen": 14241253408,
      "step": 18101
    },
    {
      "epoch": 1.9204328453214514,
      "grad_norm": 0.35704939666158786,
      "learning_rate": 4.693470387245307e-05,
      "loss": 1.6039,
      "num_input_tokens_seen": 14242040208,
      "step": 18102
    },
    {
      "epoch": 1.9205389348610227,
      "grad_norm": 0.39878439609712846,
      "learning_rate": 4.693437043098455e-05,
      "loss": 1.7478,
      "num_input_tokens_seen": 14242827072,
      "step": 18103
    },
    {
      "epoch": 1.9206450244005941,
      "grad_norm": 0.35402472742855223,
      "learning_rate": 4.6934036972565785e-05,
      "loss": 1.6314,
      "num_input_tokens_seen": 14243613840,
      "step": 18104
    },
    {
      "epoch": 1.9207511139401654,
      "grad_norm": 0.34448596776895335,
      "learning_rate": 4.6933703497197047e-05,
      "loss": 1.6056,
      "num_input_tokens_seen": 14244400592,
      "step": 18105
    },
    {
      "epoch": 1.9208572034797369,
      "grad_norm": 0.39841574770143384,
      "learning_rate": 4.693337000487858e-05,
      "loss": 1.6732,
      "num_input_tokens_seen": 14245187360,
      "step": 18106
    },
    {
      "epoch": 1.9209632930193083,
      "grad_norm": 0.41248087457258376,
      "learning_rate": 4.693303649561066e-05,
      "loss": 1.8064,
      "num_input_tokens_seen": 14245974080,
      "step": 18107
    },
    {
      "epoch": 1.9210693825588798,
      "grad_norm": 0.3182839428378106,
      "learning_rate": 4.693270296939353e-05,
      "loss": 1.6742,
      "num_input_tokens_seen": 14246760896,
      "step": 18108
    },
    {
      "epoch": 1.921175472098451,
      "grad_norm": 0.4616962793454453,
      "learning_rate": 4.6932369426227447e-05,
      "loss": 1.7335,
      "num_input_tokens_seen": 14247547680,
      "step": 18109
    },
    {
      "epoch": 1.9212815616380223,
      "grad_norm": 0.44066965888880455,
      "learning_rate": 4.6932035866112676e-05,
      "loss": 1.6193,
      "num_input_tokens_seen": 14248334416,
      "step": 18110
    },
    {
      "epoch": 1.9213876511775938,
      "grad_norm": 0.3620619611835687,
      "learning_rate": 4.693170228904946e-05,
      "loss": 1.7168,
      "num_input_tokens_seen": 14249121216,
      "step": 18111
    },
    {
      "epoch": 1.9214937407171653,
      "grad_norm": 0.48526789064356823,
      "learning_rate": 4.693136869503808e-05,
      "loss": 1.7811,
      "num_input_tokens_seen": 14249907984,
      "step": 18112
    },
    {
      "epoch": 1.9215998302567368,
      "grad_norm": 0.4414053089965481,
      "learning_rate": 4.693103508407878e-05,
      "loss": 1.6664,
      "num_input_tokens_seen": 14250694736,
      "step": 18113
    },
    {
      "epoch": 1.9217059197963082,
      "grad_norm": 0.44777677763883844,
      "learning_rate": 4.693070145617182e-05,
      "loss": 1.8789,
      "num_input_tokens_seen": 14251481520,
      "step": 18114
    },
    {
      "epoch": 1.9218120093358795,
      "grad_norm": 0.46807421179914943,
      "learning_rate": 4.6930367811317454e-05,
      "loss": 1.6586,
      "num_input_tokens_seen": 14252268336,
      "step": 18115
    },
    {
      "epoch": 1.9219180988754507,
      "grad_norm": 0.3320367809161918,
      "learning_rate": 4.6930034149515944e-05,
      "loss": 1.6875,
      "num_input_tokens_seen": 14253055168,
      "step": 18116
    },
    {
      "epoch": 1.9220241884150222,
      "grad_norm": 0.37308172713037907,
      "learning_rate": 4.692970047076755e-05,
      "loss": 1.7137,
      "num_input_tokens_seen": 14253841856,
      "step": 18117
    },
    {
      "epoch": 1.9221302779545937,
      "grad_norm": 0.41511924212984647,
      "learning_rate": 4.6929366775072516e-05,
      "loss": 1.8809,
      "num_input_tokens_seen": 14254628544,
      "step": 18118
    },
    {
      "epoch": 1.9222363674941652,
      "grad_norm": 0.3925688159402574,
      "learning_rate": 4.692903306243113e-05,
      "loss": 1.6676,
      "num_input_tokens_seen": 14255415344,
      "step": 18119
    },
    {
      "epoch": 1.9223424570337366,
      "grad_norm": 0.35537372965401104,
      "learning_rate": 4.692869933284361e-05,
      "loss": 1.6188,
      "num_input_tokens_seen": 14256202176,
      "step": 18120
    },
    {
      "epoch": 1.9224485465733079,
      "grad_norm": 0.3769097491798749,
      "learning_rate": 4.6928365586310243e-05,
      "loss": 1.7233,
      "num_input_tokens_seen": 14256988944,
      "step": 18121
    },
    {
      "epoch": 1.9225546361128791,
      "grad_norm": 0.37279766620083554,
      "learning_rate": 4.6928031822831285e-05,
      "loss": 1.6114,
      "num_input_tokens_seen": 14257775744,
      "step": 18122
    },
    {
      "epoch": 1.9226607256524506,
      "grad_norm": 0.3455394677346511,
      "learning_rate": 4.692769804240698e-05,
      "loss": 1.7793,
      "num_input_tokens_seen": 14258562544,
      "step": 18123
    },
    {
      "epoch": 1.922766815192022,
      "grad_norm": 0.3635572471826935,
      "learning_rate": 4.6927364245037594e-05,
      "loss": 1.7681,
      "num_input_tokens_seen": 14259349360,
      "step": 18124
    },
    {
      "epoch": 1.9228729047315936,
      "grad_norm": 0.37944658620449606,
      "learning_rate": 4.6927030430723384e-05,
      "loss": 1.8762,
      "num_input_tokens_seen": 14260136080,
      "step": 18125
    },
    {
      "epoch": 1.9229789942711648,
      "grad_norm": 0.3342809273004781,
      "learning_rate": 4.692669659946461e-05,
      "loss": 1.5879,
      "num_input_tokens_seen": 14260922832,
      "step": 18126
    },
    {
      "epoch": 1.9230850838107363,
      "grad_norm": 0.33003877337170706,
      "learning_rate": 4.6926362751261535e-05,
      "loss": 1.57,
      "num_input_tokens_seen": 14261709584,
      "step": 18127
    },
    {
      "epoch": 1.9231911733503075,
      "grad_norm": 0.3267770291065746,
      "learning_rate": 4.6926028886114405e-05,
      "loss": 1.7681,
      "num_input_tokens_seen": 14262496400,
      "step": 18128
    },
    {
      "epoch": 1.923297262889879,
      "grad_norm": 0.35900372371663863,
      "learning_rate": 4.692569500402348e-05,
      "loss": 1.7606,
      "num_input_tokens_seen": 14263283120,
      "step": 18129
    },
    {
      "epoch": 1.9234033524294505,
      "grad_norm": 0.4156760219046666,
      "learning_rate": 4.692536110498902e-05,
      "loss": 1.9024,
      "num_input_tokens_seen": 14264069824,
      "step": 18130
    },
    {
      "epoch": 1.923509441969022,
      "grad_norm": 0.37088675091219514,
      "learning_rate": 4.692502718901129e-05,
      "loss": 1.7277,
      "num_input_tokens_seen": 14264856624,
      "step": 18131
    },
    {
      "epoch": 1.9236155315085932,
      "grad_norm": 0.32215081196683104,
      "learning_rate": 4.6924693256090534e-05,
      "loss": 1.7573,
      "num_input_tokens_seen": 14265643424,
      "step": 18132
    },
    {
      "epoch": 1.9237216210481647,
      "grad_norm": 0.4121929311268872,
      "learning_rate": 4.692435930622703e-05,
      "loss": 1.7997,
      "num_input_tokens_seen": 14266430128,
      "step": 18133
    },
    {
      "epoch": 1.923827710587736,
      "grad_norm": 0.374204530531244,
      "learning_rate": 4.692402533942102e-05,
      "loss": 1.5704,
      "num_input_tokens_seen": 14267216864,
      "step": 18134
    },
    {
      "epoch": 1.9239338001273074,
      "grad_norm": 0.3509333409087936,
      "learning_rate": 4.692369135567276e-05,
      "loss": 1.8032,
      "num_input_tokens_seen": 14268003664,
      "step": 18135
    },
    {
      "epoch": 1.9240398896668789,
      "grad_norm": 0.4537753465367143,
      "learning_rate": 4.6923357354982524e-05,
      "loss": 1.6639,
      "num_input_tokens_seen": 14268790496,
      "step": 18136
    },
    {
      "epoch": 1.9241459792064504,
      "grad_norm": 0.40072074261011514,
      "learning_rate": 4.692302333735056e-05,
      "loss": 1.7457,
      "num_input_tokens_seen": 14269577264,
      "step": 18137
    },
    {
      "epoch": 1.9242520687460216,
      "grad_norm": 0.41958201188019056,
      "learning_rate": 4.692268930277712e-05,
      "loss": 1.6743,
      "num_input_tokens_seen": 14270364032,
      "step": 18138
    },
    {
      "epoch": 1.924358158285593,
      "grad_norm": 0.371265100454442,
      "learning_rate": 4.6922355251262464e-05,
      "loss": 1.7213,
      "num_input_tokens_seen": 14271150752,
      "step": 18139
    },
    {
      "epoch": 1.9244642478251643,
      "grad_norm": 0.3727241887192856,
      "learning_rate": 4.692202118280686e-05,
      "loss": 1.8201,
      "num_input_tokens_seen": 14271937520,
      "step": 18140
    },
    {
      "epoch": 1.9245703373647358,
      "grad_norm": 0.4689167262876977,
      "learning_rate": 4.692168709741057e-05,
      "loss": 1.6646,
      "num_input_tokens_seen": 14272724272,
      "step": 18141
    },
    {
      "epoch": 1.9246764269043073,
      "grad_norm": 0.3760973399049528,
      "learning_rate": 4.692135299507384e-05,
      "loss": 1.6586,
      "num_input_tokens_seen": 14273511120,
      "step": 18142
    },
    {
      "epoch": 1.9247825164438788,
      "grad_norm": 0.5383203400438811,
      "learning_rate": 4.692101887579693e-05,
      "loss": 1.6028,
      "num_input_tokens_seen": 14274297872,
      "step": 18143
    },
    {
      "epoch": 1.92488860598345,
      "grad_norm": 0.411842504324169,
      "learning_rate": 4.69206847395801e-05,
      "loss": 1.7888,
      "num_input_tokens_seen": 14275084624,
      "step": 18144
    },
    {
      "epoch": 1.9249946955230213,
      "grad_norm": 0.5296007561269072,
      "learning_rate": 4.6920350586423605e-05,
      "loss": 1.6864,
      "num_input_tokens_seen": 14275871328,
      "step": 18145
    },
    {
      "epoch": 1.9251007850625927,
      "grad_norm": 0.3907097658697513,
      "learning_rate": 4.692001641632771e-05,
      "loss": 1.7438,
      "num_input_tokens_seen": 14276658048,
      "step": 18146
    },
    {
      "epoch": 1.9252068746021642,
      "grad_norm": 0.4859511545414539,
      "learning_rate": 4.691968222929267e-05,
      "loss": 1.7713,
      "num_input_tokens_seen": 14277444736,
      "step": 18147
    },
    {
      "epoch": 1.9253129641417357,
      "grad_norm": 0.6366457126935583,
      "learning_rate": 4.691934802531874e-05,
      "loss": 1.792,
      "num_input_tokens_seen": 14278231440,
      "step": 18148
    },
    {
      "epoch": 1.9254190536813072,
      "grad_norm": 0.7126261183402838,
      "learning_rate": 4.691901380440618e-05,
      "loss": 1.6777,
      "num_input_tokens_seen": 14279018112,
      "step": 18149
    },
    {
      "epoch": 1.9255251432208784,
      "grad_norm": 0.5291516033772545,
      "learning_rate": 4.691867956655525e-05,
      "loss": 1.6983,
      "num_input_tokens_seen": 14279804896,
      "step": 18150
    },
    {
      "epoch": 1.9256312327604497,
      "grad_norm": 0.5222749708801977,
      "learning_rate": 4.691834531176621e-05,
      "loss": 1.7673,
      "num_input_tokens_seen": 14280591616,
      "step": 18151
    },
    {
      "epoch": 1.9257373223000211,
      "grad_norm": 0.41372487697958643,
      "learning_rate": 4.691801104003931e-05,
      "loss": 1.7594,
      "num_input_tokens_seen": 14281378384,
      "step": 18152
    },
    {
      "epoch": 1.9258434118395926,
      "grad_norm": 0.3611124913990926,
      "learning_rate": 4.691767675137482e-05,
      "loss": 1.6553,
      "num_input_tokens_seen": 14282165104,
      "step": 18153
    },
    {
      "epoch": 1.925949501379164,
      "grad_norm": 0.4505953504963629,
      "learning_rate": 4.6917342445772997e-05,
      "loss": 1.7451,
      "num_input_tokens_seen": 14282951872,
      "step": 18154
    },
    {
      "epoch": 1.9260555909187356,
      "grad_norm": 0.3962939773239846,
      "learning_rate": 4.6917008123234085e-05,
      "loss": 1.7546,
      "num_input_tokens_seen": 14283738544,
      "step": 18155
    },
    {
      "epoch": 1.9261616804583068,
      "grad_norm": 0.4014915020252264,
      "learning_rate": 4.6916673783758357e-05,
      "loss": 1.6356,
      "num_input_tokens_seen": 14284525248,
      "step": 18156
    },
    {
      "epoch": 1.926267769997878,
      "grad_norm": 0.5538570852320012,
      "learning_rate": 4.691633942734607e-05,
      "loss": 1.7612,
      "num_input_tokens_seen": 14285311968,
      "step": 18157
    },
    {
      "epoch": 1.9263738595374496,
      "grad_norm": 0.42344326869928717,
      "learning_rate": 4.691600505399747e-05,
      "loss": 1.6646,
      "num_input_tokens_seen": 14286098800,
      "step": 18158
    },
    {
      "epoch": 1.926479949077021,
      "grad_norm": 0.6019709120023333,
      "learning_rate": 4.691567066371283e-05,
      "loss": 1.8335,
      "num_input_tokens_seen": 14286885600,
      "step": 18159
    },
    {
      "epoch": 1.9265860386165925,
      "grad_norm": 0.40945562124812884,
      "learning_rate": 4.6915336256492405e-05,
      "loss": 1.8393,
      "num_input_tokens_seen": 14287672384,
      "step": 18160
    },
    {
      "epoch": 1.9266921281561638,
      "grad_norm": 0.47365497969627807,
      "learning_rate": 4.691500183233645e-05,
      "loss": 1.6168,
      "num_input_tokens_seen": 14288459264,
      "step": 18161
    },
    {
      "epoch": 1.9267982176957352,
      "grad_norm": 0.36433675162364487,
      "learning_rate": 4.691466739124521e-05,
      "loss": 1.7967,
      "num_input_tokens_seen": 14289245936,
      "step": 18162
    },
    {
      "epoch": 1.9269043072353065,
      "grad_norm": 0.4287174474957914,
      "learning_rate": 4.6914332933218976e-05,
      "loss": 1.728,
      "num_input_tokens_seen": 14290032704,
      "step": 18163
    },
    {
      "epoch": 1.927010396774878,
      "grad_norm": 0.3824250012196558,
      "learning_rate": 4.6913998458257984e-05,
      "loss": 1.7388,
      "num_input_tokens_seen": 14290819488,
      "step": 18164
    },
    {
      "epoch": 1.9271164863144494,
      "grad_norm": 0.3453255319244338,
      "learning_rate": 4.69136639663625e-05,
      "loss": 1.6956,
      "num_input_tokens_seen": 14291606240,
      "step": 18165
    },
    {
      "epoch": 1.927222575854021,
      "grad_norm": 0.34396176768351494,
      "learning_rate": 4.691332945753277e-05,
      "loss": 1.7627,
      "num_input_tokens_seen": 14292393024,
      "step": 18166
    },
    {
      "epoch": 1.9273286653935922,
      "grad_norm": 0.4211161478936856,
      "learning_rate": 4.691299493176907e-05,
      "loss": 1.7869,
      "num_input_tokens_seen": 14293179856,
      "step": 18167
    },
    {
      "epoch": 1.9274347549331636,
      "grad_norm": 0.5034665114390927,
      "learning_rate": 4.691266038907165e-05,
      "loss": 1.8528,
      "num_input_tokens_seen": 14293966480,
      "step": 18168
    },
    {
      "epoch": 1.9275408444727349,
      "grad_norm": 0.3623690767012999,
      "learning_rate": 4.691232582944076e-05,
      "loss": 1.727,
      "num_input_tokens_seen": 14294753312,
      "step": 18169
    },
    {
      "epoch": 1.9276469340123064,
      "grad_norm": 0.38691008948457356,
      "learning_rate": 4.691199125287668e-05,
      "loss": 1.673,
      "num_input_tokens_seen": 14295540080,
      "step": 18170
    },
    {
      "epoch": 1.9277530235518778,
      "grad_norm": 0.44750932660100545,
      "learning_rate": 4.691165665937965e-05,
      "loss": 1.728,
      "num_input_tokens_seen": 14296326768,
      "step": 18171
    },
    {
      "epoch": 1.9278591130914493,
      "grad_norm": 0.44543762276044746,
      "learning_rate": 4.691132204894993e-05,
      "loss": 1.7057,
      "num_input_tokens_seen": 14297113488,
      "step": 18172
    },
    {
      "epoch": 1.9279652026310206,
      "grad_norm": 0.498653235924282,
      "learning_rate": 4.6910987421587796e-05,
      "loss": 1.775,
      "num_input_tokens_seen": 14297900224,
      "step": 18173
    },
    {
      "epoch": 1.928071292170592,
      "grad_norm": 0.46074500765467075,
      "learning_rate": 4.6910652777293486e-05,
      "loss": 1.8553,
      "num_input_tokens_seen": 14298686896,
      "step": 18174
    },
    {
      "epoch": 1.9281773817101633,
      "grad_norm": 0.38570160251948576,
      "learning_rate": 4.6910318116067264e-05,
      "loss": 1.6944,
      "num_input_tokens_seen": 14299473680,
      "step": 18175
    },
    {
      "epoch": 1.9282834712497348,
      "grad_norm": 0.48947138658549416,
      "learning_rate": 4.6909983437909396e-05,
      "loss": 1.8468,
      "num_input_tokens_seen": 14300260416,
      "step": 18176
    },
    {
      "epoch": 1.9283895607893062,
      "grad_norm": 0.42959605939810774,
      "learning_rate": 4.690964874282013e-05,
      "loss": 1.7001,
      "num_input_tokens_seen": 14301047136,
      "step": 18177
    },
    {
      "epoch": 1.9284956503288777,
      "grad_norm": 0.45726031064639144,
      "learning_rate": 4.690931403079973e-05,
      "loss": 1.8735,
      "num_input_tokens_seen": 14301833840,
      "step": 18178
    },
    {
      "epoch": 1.928601739868449,
      "grad_norm": 0.4016816849210978,
      "learning_rate": 4.690897930184847e-05,
      "loss": 1.7048,
      "num_input_tokens_seen": 14302620656,
      "step": 18179
    },
    {
      "epoch": 1.9287078294080202,
      "grad_norm": 0.3999266723988253,
      "learning_rate": 4.690864455596658e-05,
      "loss": 1.686,
      "num_input_tokens_seen": 14303407440,
      "step": 18180
    },
    {
      "epoch": 1.9288139189475917,
      "grad_norm": 0.5018306264098799,
      "learning_rate": 4.690830979315434e-05,
      "loss": 1.7017,
      "num_input_tokens_seen": 14304194240,
      "step": 18181
    },
    {
      "epoch": 1.9289200084871632,
      "grad_norm": 0.3990620524501758,
      "learning_rate": 4.6907975013411984e-05,
      "loss": 1.7478,
      "num_input_tokens_seen": 14304980992,
      "step": 18182
    },
    {
      "epoch": 1.9290260980267346,
      "grad_norm": 0.41708826756156475,
      "learning_rate": 4.690764021673981e-05,
      "loss": 1.6377,
      "num_input_tokens_seen": 14305767824,
      "step": 18183
    },
    {
      "epoch": 1.9291321875663061,
      "grad_norm": 0.405424000255404,
      "learning_rate": 4.6907305403138044e-05,
      "loss": 1.7174,
      "num_input_tokens_seen": 14306554544,
      "step": 18184
    },
    {
      "epoch": 1.9292382771058774,
      "grad_norm": 0.42464249231333817,
      "learning_rate": 4.690697057260695e-05,
      "loss": 1.6022,
      "num_input_tokens_seen": 14307341264,
      "step": 18185
    },
    {
      "epoch": 1.9293443666454486,
      "grad_norm": 0.5172799069353046,
      "learning_rate": 4.6906635725146795e-05,
      "loss": 1.7198,
      "num_input_tokens_seen": 14308128016,
      "step": 18186
    },
    {
      "epoch": 1.92945045618502,
      "grad_norm": 0.4043629786799235,
      "learning_rate": 4.690630086075784e-05,
      "loss": 1.7736,
      "num_input_tokens_seen": 14308914736,
      "step": 18187
    },
    {
      "epoch": 1.9295565457245916,
      "grad_norm": 0.48008851737212027,
      "learning_rate": 4.690596597944034e-05,
      "loss": 1.6638,
      "num_input_tokens_seen": 14309701488,
      "step": 18188
    },
    {
      "epoch": 1.929662635264163,
      "grad_norm": 0.39661469192225307,
      "learning_rate": 4.6905631081194544e-05,
      "loss": 1.5485,
      "num_input_tokens_seen": 14310488240,
      "step": 18189
    },
    {
      "epoch": 1.9297687248037345,
      "grad_norm": 0.42683111904796467,
      "learning_rate": 4.6905296166020716e-05,
      "loss": 1.6306,
      "num_input_tokens_seen": 14311275024,
      "step": 18190
    },
    {
      "epoch": 1.9298748143433058,
      "grad_norm": 0.3774815410245018,
      "learning_rate": 4.690496123391913e-05,
      "loss": 1.5967,
      "num_input_tokens_seen": 14312061792,
      "step": 18191
    },
    {
      "epoch": 1.929980903882877,
      "grad_norm": 0.4053448038073209,
      "learning_rate": 4.690462628489003e-05,
      "loss": 1.8196,
      "num_input_tokens_seen": 14312848512,
      "step": 18192
    },
    {
      "epoch": 1.9300869934224485,
      "grad_norm": 0.41181522650555435,
      "learning_rate": 4.690429131893367e-05,
      "loss": 1.5803,
      "num_input_tokens_seen": 14313635232,
      "step": 18193
    },
    {
      "epoch": 1.93019308296202,
      "grad_norm": 0.3602305962932129,
      "learning_rate": 4.690395633605032e-05,
      "loss": 1.62,
      "num_input_tokens_seen": 14314421968,
      "step": 18194
    },
    {
      "epoch": 1.9302991725015914,
      "grad_norm": 0.47159701283407907,
      "learning_rate": 4.690362133624024e-05,
      "loss": 1.7992,
      "num_input_tokens_seen": 14315208624,
      "step": 18195
    },
    {
      "epoch": 1.9304052620411627,
      "grad_norm": 0.3390203350949826,
      "learning_rate": 4.6903286319503684e-05,
      "loss": 1.6884,
      "num_input_tokens_seen": 14315995392,
      "step": 18196
    },
    {
      "epoch": 1.9305113515807342,
      "grad_norm": 0.4636575952640505,
      "learning_rate": 4.6902951285840905e-05,
      "loss": 1.6895,
      "num_input_tokens_seen": 14316782016,
      "step": 18197
    },
    {
      "epoch": 1.9306174411203054,
      "grad_norm": 0.37309917440864104,
      "learning_rate": 4.6902616235252164e-05,
      "loss": 1.6757,
      "num_input_tokens_seen": 14317568784,
      "step": 18198
    },
    {
      "epoch": 1.930723530659877,
      "grad_norm": 0.36774676354367775,
      "learning_rate": 4.690228116773774e-05,
      "loss": 1.6447,
      "num_input_tokens_seen": 14318355648,
      "step": 18199
    },
    {
      "epoch": 1.9308296201994484,
      "grad_norm": 0.38697680679707464,
      "learning_rate": 4.690194608329786e-05,
      "loss": 1.8423,
      "num_input_tokens_seen": 14319142496,
      "step": 18200
    },
    {
      "epoch": 1.9309357097390198,
      "grad_norm": 0.3568239373161821,
      "learning_rate": 4.690161098193281e-05,
      "loss": 1.7067,
      "num_input_tokens_seen": 14319929312,
      "step": 18201
    },
    {
      "epoch": 1.931041799278591,
      "grad_norm": 0.45044809285538157,
      "learning_rate": 4.6901275863642826e-05,
      "loss": 1.7053,
      "num_input_tokens_seen": 14320716016,
      "step": 18202
    },
    {
      "epoch": 1.9311478888181626,
      "grad_norm": 0.37637106396336073,
      "learning_rate": 4.690094072842819e-05,
      "loss": 1.6051,
      "num_input_tokens_seen": 14321502720,
      "step": 18203
    },
    {
      "epoch": 1.9312539783577338,
      "grad_norm": 0.9761022260138413,
      "learning_rate": 4.690060557628914e-05,
      "loss": 1.8087,
      "num_input_tokens_seen": 14322289504,
      "step": 18204
    },
    {
      "epoch": 1.9313600678973053,
      "grad_norm": 2.3512720954323902,
      "learning_rate": 4.690027040722595e-05,
      "loss": 1.6615,
      "num_input_tokens_seen": 14323076304,
      "step": 18205
    },
    {
      "epoch": 1.9314661574368768,
      "grad_norm": 0.7785555126187336,
      "learning_rate": 4.689993522123888e-05,
      "loss": 1.753,
      "num_input_tokens_seen": 14323863104,
      "step": 18206
    },
    {
      "epoch": 1.9315722469764482,
      "grad_norm": 1.3177292450186702,
      "learning_rate": 4.6899600018328174e-05,
      "loss": 1.7655,
      "num_input_tokens_seen": 14324649888,
      "step": 18207
    },
    {
      "epoch": 1.9316783365160195,
      "grad_norm": 0.8572532554446551,
      "learning_rate": 4.68992647984941e-05,
      "loss": 1.696,
      "num_input_tokens_seen": 14325436592,
      "step": 18208
    },
    {
      "epoch": 1.9317844260555908,
      "grad_norm": 0.5029077716395605,
      "learning_rate": 4.6898929561736914e-05,
      "loss": 1.7544,
      "num_input_tokens_seen": 14326223360,
      "step": 18209
    },
    {
      "epoch": 1.9318905155951622,
      "grad_norm": 1.0743845197993216,
      "learning_rate": 4.689859430805688e-05,
      "loss": 1.7662,
      "num_input_tokens_seen": 14327010080,
      "step": 18210
    },
    {
      "epoch": 1.9319966051347337,
      "grad_norm": 0.5728706494188586,
      "learning_rate": 4.689825903745426e-05,
      "loss": 1.8213,
      "num_input_tokens_seen": 14327796768,
      "step": 18211
    },
    {
      "epoch": 1.9321026946743052,
      "grad_norm": 0.44770464702301827,
      "learning_rate": 4.689792374992931e-05,
      "loss": 1.5038,
      "num_input_tokens_seen": 14328583632,
      "step": 18212
    },
    {
      "epoch": 1.9322087842138767,
      "grad_norm": 0.8526271694411941,
      "learning_rate": 4.689758844548228e-05,
      "loss": 1.6964,
      "num_input_tokens_seen": 14329370400,
      "step": 18213
    },
    {
      "epoch": 1.932314873753448,
      "grad_norm": 0.5187884439807988,
      "learning_rate": 4.6897253124113434e-05,
      "loss": 1.564,
      "num_input_tokens_seen": 14330157168,
      "step": 18214
    },
    {
      "epoch": 1.9324209632930192,
      "grad_norm": 0.3790837408936814,
      "learning_rate": 4.6896917785823034e-05,
      "loss": 1.5972,
      "num_input_tokens_seen": 14330944000,
      "step": 18215
    },
    {
      "epoch": 1.9325270528325906,
      "grad_norm": 0.6693344837211354,
      "learning_rate": 4.689658243061135e-05,
      "loss": 1.7822,
      "num_input_tokens_seen": 14331730720,
      "step": 18216
    },
    {
      "epoch": 1.932633142372162,
      "grad_norm": 0.5232066605505126,
      "learning_rate": 4.6896247058478615e-05,
      "loss": 1.7899,
      "num_input_tokens_seen": 14332517472,
      "step": 18217
    },
    {
      "epoch": 1.9327392319117336,
      "grad_norm": 0.5612305265073393,
      "learning_rate": 4.689591166942511e-05,
      "loss": 1.7913,
      "num_input_tokens_seen": 14333304208,
      "step": 18218
    },
    {
      "epoch": 1.932845321451305,
      "grad_norm": 0.6255564648617197,
      "learning_rate": 4.689557626345108e-05,
      "loss": 1.6536,
      "num_input_tokens_seen": 14334091008,
      "step": 18219
    },
    {
      "epoch": 1.9329514109908763,
      "grad_norm": 0.6141110224261354,
      "learning_rate": 4.68952408405568e-05,
      "loss": 1.8449,
      "num_input_tokens_seen": 14334877712,
      "step": 18220
    },
    {
      "epoch": 1.9330575005304476,
      "grad_norm": 1.0553509157150767,
      "learning_rate": 4.689490540074252e-05,
      "loss": 1.7574,
      "num_input_tokens_seen": 14335664432,
      "step": 18221
    },
    {
      "epoch": 1.933163590070019,
      "grad_norm": 0.4141491435441971,
      "learning_rate": 4.6894569944008494e-05,
      "loss": 1.6656,
      "num_input_tokens_seen": 14336451200,
      "step": 18222
    },
    {
      "epoch": 1.9332696796095905,
      "grad_norm": 0.5985310230207866,
      "learning_rate": 4.689423447035499e-05,
      "loss": 1.665,
      "num_input_tokens_seen": 14337238032,
      "step": 18223
    },
    {
      "epoch": 1.933375769149162,
      "grad_norm": 0.65605105105045,
      "learning_rate": 4.6893898979782264e-05,
      "loss": 1.9652,
      "num_input_tokens_seen": 14338024704,
      "step": 18224
    },
    {
      "epoch": 1.9334818586887335,
      "grad_norm": 0.4126898283282278,
      "learning_rate": 4.689356347229057e-05,
      "loss": 1.6965,
      "num_input_tokens_seen": 14338811536,
      "step": 18225
    },
    {
      "epoch": 1.9335879482283047,
      "grad_norm": 0.5003474085270083,
      "learning_rate": 4.689322794788018e-05,
      "loss": 1.6691,
      "num_input_tokens_seen": 14339598352,
      "step": 18226
    },
    {
      "epoch": 1.933694037767876,
      "grad_norm": 0.6130758470709556,
      "learning_rate": 4.689289240655135e-05,
      "loss": 1.7865,
      "num_input_tokens_seen": 14340385136,
      "step": 18227
    },
    {
      "epoch": 1.9338001273074474,
      "grad_norm": 0.451812712466608,
      "learning_rate": 4.689255684830433e-05,
      "loss": 1.7227,
      "num_input_tokens_seen": 14341171856,
      "step": 18228
    },
    {
      "epoch": 1.933906216847019,
      "grad_norm": 0.6793580299007195,
      "learning_rate": 4.6892221273139376e-05,
      "loss": 1.7825,
      "num_input_tokens_seen": 14341958624,
      "step": 18229
    },
    {
      "epoch": 1.9340123063865904,
      "grad_norm": 0.48228852050836496,
      "learning_rate": 4.6891885681056756e-05,
      "loss": 1.72,
      "num_input_tokens_seen": 14342745360,
      "step": 18230
    },
    {
      "epoch": 1.9341183959261616,
      "grad_norm": 0.4902768480086617,
      "learning_rate": 4.689155007205675e-05,
      "loss": 1.6374,
      "num_input_tokens_seen": 14343532032,
      "step": 18231
    },
    {
      "epoch": 1.9342244854657331,
      "grad_norm": 0.5929817674166282,
      "learning_rate": 4.689121444613957e-05,
      "loss": 1.585,
      "num_input_tokens_seen": 14344318800,
      "step": 18232
    },
    {
      "epoch": 1.9343305750053044,
      "grad_norm": 0.959580869766071,
      "learning_rate": 4.689087880330552e-05,
      "loss": 1.7461,
      "num_input_tokens_seen": 14345105568,
      "step": 18233
    },
    {
      "epoch": 1.9344366645448758,
      "grad_norm": 0.47732344138208305,
      "learning_rate": 4.689054314355483e-05,
      "loss": 1.695,
      "num_input_tokens_seen": 14345892288,
      "step": 18234
    },
    {
      "epoch": 1.9345427540844473,
      "grad_norm": 0.7344265716083449,
      "learning_rate": 4.689020746688778e-05,
      "loss": 1.7399,
      "num_input_tokens_seen": 14346679024,
      "step": 18235
    },
    {
      "epoch": 1.9346488436240188,
      "grad_norm": 0.5762260244031269,
      "learning_rate": 4.688987177330461e-05,
      "loss": 1.6466,
      "num_input_tokens_seen": 14347465728,
      "step": 18236
    },
    {
      "epoch": 1.93475493316359,
      "grad_norm": 0.6325969527838233,
      "learning_rate": 4.688953606280559e-05,
      "loss": 1.6904,
      "num_input_tokens_seen": 14348252480,
      "step": 18237
    },
    {
      "epoch": 1.9348610227031615,
      "grad_norm": 0.422184751690447,
      "learning_rate": 4.6889200335390995e-05,
      "loss": 1.6855,
      "num_input_tokens_seen": 14349039360,
      "step": 18238
    },
    {
      "epoch": 1.9349671122427328,
      "grad_norm": 0.6748732707404528,
      "learning_rate": 4.688886459106105e-05,
      "loss": 1.6878,
      "num_input_tokens_seen": 14349826112,
      "step": 18239
    },
    {
      "epoch": 1.9350732017823042,
      "grad_norm": 0.4045952301043613,
      "learning_rate": 4.688852882981604e-05,
      "loss": 1.712,
      "num_input_tokens_seen": 14350612864,
      "step": 18240
    },
    {
      "epoch": 1.9351792913218757,
      "grad_norm": 0.6413309734562443,
      "learning_rate": 4.688819305165621e-05,
      "loss": 1.7713,
      "num_input_tokens_seen": 14351399728,
      "step": 18241
    },
    {
      "epoch": 1.9352853808614472,
      "grad_norm": 0.4729033337940189,
      "learning_rate": 4.688785725658185e-05,
      "loss": 1.7351,
      "num_input_tokens_seen": 14352186432,
      "step": 18242
    },
    {
      "epoch": 1.9353914704010184,
      "grad_norm": 0.4287766352078634,
      "learning_rate": 4.688752144459317e-05,
      "loss": 1.7046,
      "num_input_tokens_seen": 14352973232,
      "step": 18243
    },
    {
      "epoch": 1.9354975599405897,
      "grad_norm": 0.45860891685863675,
      "learning_rate": 4.688718561569047e-05,
      "loss": 1.7348,
      "num_input_tokens_seen": 14353760048,
      "step": 18244
    },
    {
      "epoch": 1.9356036494801612,
      "grad_norm": 0.5128541647364057,
      "learning_rate": 4.6886849769873986e-05,
      "loss": 1.7106,
      "num_input_tokens_seen": 14354546800,
      "step": 18245
    },
    {
      "epoch": 1.9357097390197326,
      "grad_norm": 0.5148441234682455,
      "learning_rate": 4.688651390714399e-05,
      "loss": 1.7248,
      "num_input_tokens_seen": 14355333552,
      "step": 18246
    },
    {
      "epoch": 1.9358158285593041,
      "grad_norm": 0.4173259425171727,
      "learning_rate": 4.688617802750074e-05,
      "loss": 1.6177,
      "num_input_tokens_seen": 14356120256,
      "step": 18247
    },
    {
      "epoch": 1.9359219180988756,
      "grad_norm": 0.6415389138770262,
      "learning_rate": 4.688584213094449e-05,
      "loss": 1.737,
      "num_input_tokens_seen": 14356907008,
      "step": 18248
    },
    {
      "epoch": 1.9360280076384468,
      "grad_norm": 0.41561088388475165,
      "learning_rate": 4.688550621747551e-05,
      "loss": 1.955,
      "num_input_tokens_seen": 14357693792,
      "step": 18249
    },
    {
      "epoch": 1.936134097178018,
      "grad_norm": 0.44391996384094484,
      "learning_rate": 4.6885170287094046e-05,
      "loss": 1.7753,
      "num_input_tokens_seen": 14358480608,
      "step": 18250
    },
    {
      "epoch": 1.9362401867175896,
      "grad_norm": 0.4331015434998863,
      "learning_rate": 4.6884834339800374e-05,
      "loss": 1.8034,
      "num_input_tokens_seen": 14359267360,
      "step": 18251
    },
    {
      "epoch": 1.936346276257161,
      "grad_norm": 0.3488300394314658,
      "learning_rate": 4.688449837559474e-05,
      "loss": 1.7076,
      "num_input_tokens_seen": 14360054112,
      "step": 18252
    },
    {
      "epoch": 1.9364523657967325,
      "grad_norm": 0.38489712488424155,
      "learning_rate": 4.68841623944774e-05,
      "loss": 1.7304,
      "num_input_tokens_seen": 14360840896,
      "step": 18253
    },
    {
      "epoch": 1.936558455336304,
      "grad_norm": 0.39544371292741015,
      "learning_rate": 4.6883826396448625e-05,
      "loss": 1.7278,
      "num_input_tokens_seen": 14361627600,
      "step": 18254
    },
    {
      "epoch": 1.9366645448758752,
      "grad_norm": 0.40473758435937146,
      "learning_rate": 4.688349038150868e-05,
      "loss": 1.7302,
      "num_input_tokens_seen": 14362414384,
      "step": 18255
    },
    {
      "epoch": 1.9367706344154465,
      "grad_norm": 0.34949262275286785,
      "learning_rate": 4.688315434965781e-05,
      "loss": 1.6669,
      "num_input_tokens_seen": 14363201136,
      "step": 18256
    },
    {
      "epoch": 1.936876723955018,
      "grad_norm": 0.43943867234067846,
      "learning_rate": 4.688281830089628e-05,
      "loss": 1.8309,
      "num_input_tokens_seen": 14363987840,
      "step": 18257
    },
    {
      "epoch": 1.9369828134945895,
      "grad_norm": 0.36888525448148196,
      "learning_rate": 4.6882482235224344e-05,
      "loss": 1.6494,
      "num_input_tokens_seen": 14364774624,
      "step": 18258
    },
    {
      "epoch": 1.937088903034161,
      "grad_norm": 0.32898069205747854,
      "learning_rate": 4.688214615264228e-05,
      "loss": 1.5693,
      "num_input_tokens_seen": 14365561488,
      "step": 18259
    },
    {
      "epoch": 1.9371949925737322,
      "grad_norm": 0.43201027325534086,
      "learning_rate": 4.6881810053150324e-05,
      "loss": 1.6986,
      "num_input_tokens_seen": 14366348208,
      "step": 18260
    },
    {
      "epoch": 1.9373010821133037,
      "grad_norm": 0.3689475501309714,
      "learning_rate": 4.6881473936748754e-05,
      "loss": 1.6267,
      "num_input_tokens_seen": 14367134992,
      "step": 18261
    },
    {
      "epoch": 1.937407171652875,
      "grad_norm": 0.4591325112196278,
      "learning_rate": 4.6881137803437824e-05,
      "loss": 1.6432,
      "num_input_tokens_seen": 14367921776,
      "step": 18262
    },
    {
      "epoch": 1.9375132611924464,
      "grad_norm": 0.4159131516712831,
      "learning_rate": 4.6880801653217785e-05,
      "loss": 1.7173,
      "num_input_tokens_seen": 14368708576,
      "step": 18263
    },
    {
      "epoch": 1.9376193507320179,
      "grad_norm": 0.4817709283664441,
      "learning_rate": 4.688046548608891e-05,
      "loss": 1.7537,
      "num_input_tokens_seen": 14369495312,
      "step": 18264
    },
    {
      "epoch": 1.9377254402715893,
      "grad_norm": 0.3551856283591515,
      "learning_rate": 4.688012930205146e-05,
      "loss": 1.7105,
      "num_input_tokens_seen": 14370282048,
      "step": 18265
    },
    {
      "epoch": 1.9378315298111606,
      "grad_norm": 0.4588964657443057,
      "learning_rate": 4.687979310110567e-05,
      "loss": 1.6629,
      "num_input_tokens_seen": 14371068704,
      "step": 18266
    },
    {
      "epoch": 1.937937619350732,
      "grad_norm": 0.4290090981602331,
      "learning_rate": 4.687945688325183e-05,
      "loss": 1.7372,
      "num_input_tokens_seen": 14371855408,
      "step": 18267
    },
    {
      "epoch": 1.9380437088903033,
      "grad_norm": 0.4220014186757612,
      "learning_rate": 4.687912064849019e-05,
      "loss": 1.7253,
      "num_input_tokens_seen": 14372642096,
      "step": 18268
    },
    {
      "epoch": 1.9381497984298748,
      "grad_norm": 0.4546190099810588,
      "learning_rate": 4.687878439682101e-05,
      "loss": 1.7893,
      "num_input_tokens_seen": 14373428816,
      "step": 18269
    },
    {
      "epoch": 1.9382558879694463,
      "grad_norm": 0.365950522404109,
      "learning_rate": 4.6878448128244535e-05,
      "loss": 1.6132,
      "num_input_tokens_seen": 14374215648,
      "step": 18270
    },
    {
      "epoch": 1.9383619775090177,
      "grad_norm": 0.33501282083449496,
      "learning_rate": 4.687811184276104e-05,
      "loss": 1.6248,
      "num_input_tokens_seen": 14375002448,
      "step": 18271
    },
    {
      "epoch": 1.938468067048589,
      "grad_norm": 0.406794573777322,
      "learning_rate": 4.6877775540370786e-05,
      "loss": 1.7002,
      "num_input_tokens_seen": 14375789280,
      "step": 18272
    },
    {
      "epoch": 1.9385741565881605,
      "grad_norm": 0.3330966990350261,
      "learning_rate": 4.6877439221074033e-05,
      "loss": 1.6743,
      "num_input_tokens_seen": 14376576080,
      "step": 18273
    },
    {
      "epoch": 1.9386802461277317,
      "grad_norm": 0.400537947894793,
      "learning_rate": 4.687710288487103e-05,
      "loss": 1.7331,
      "num_input_tokens_seen": 14377362816,
      "step": 18274
    },
    {
      "epoch": 1.9387863356673032,
      "grad_norm": 0.37928196200665026,
      "learning_rate": 4.687676653176205e-05,
      "loss": 1.6791,
      "num_input_tokens_seen": 14378149648,
      "step": 18275
    },
    {
      "epoch": 1.9388924252068747,
      "grad_norm": 0.3566591880444523,
      "learning_rate": 4.6876430161747344e-05,
      "loss": 1.6593,
      "num_input_tokens_seen": 14378936416,
      "step": 18276
    },
    {
      "epoch": 1.9389985147464461,
      "grad_norm": 0.4184914301137818,
      "learning_rate": 4.687609377482717e-05,
      "loss": 1.5956,
      "num_input_tokens_seen": 14379723168,
      "step": 18277
    },
    {
      "epoch": 1.9391046042860174,
      "grad_norm": 0.4040977170279027,
      "learning_rate": 4.687575737100179e-05,
      "loss": 1.6413,
      "num_input_tokens_seen": 14380510000,
      "step": 18278
    },
    {
      "epoch": 1.9392106938255886,
      "grad_norm": 0.38317441500624677,
      "learning_rate": 4.687542095027148e-05,
      "loss": 1.885,
      "num_input_tokens_seen": 14381296704,
      "step": 18279
    },
    {
      "epoch": 1.9393167833651601,
      "grad_norm": 0.373022072319168,
      "learning_rate": 4.687508451263648e-05,
      "loss": 1.7364,
      "num_input_tokens_seen": 14382083392,
      "step": 18280
    },
    {
      "epoch": 1.9394228729047316,
      "grad_norm": 0.3644300426251787,
      "learning_rate": 4.687474805809706e-05,
      "loss": 1.8102,
      "num_input_tokens_seen": 14382870080,
      "step": 18281
    },
    {
      "epoch": 1.939528962444303,
      "grad_norm": 0.34268503225804675,
      "learning_rate": 4.6874411586653464e-05,
      "loss": 1.6933,
      "num_input_tokens_seen": 14383656720,
      "step": 18282
    },
    {
      "epoch": 1.9396350519838745,
      "grad_norm": 0.3777041212663884,
      "learning_rate": 4.687407509830598e-05,
      "loss": 1.7135,
      "num_input_tokens_seen": 14384443584,
      "step": 18283
    },
    {
      "epoch": 1.9397411415234458,
      "grad_norm": 0.42185404238542046,
      "learning_rate": 4.6873738593054836e-05,
      "loss": 1.7126,
      "num_input_tokens_seen": 14385230368,
      "step": 18284
    },
    {
      "epoch": 1.939847231063017,
      "grad_norm": 0.3851240243404798,
      "learning_rate": 4.687340207090033e-05,
      "loss": 1.7069,
      "num_input_tokens_seen": 14386017104,
      "step": 18285
    },
    {
      "epoch": 1.9399533206025885,
      "grad_norm": 0.5392255879796256,
      "learning_rate": 4.6873065531842685e-05,
      "loss": 1.789,
      "num_input_tokens_seen": 14386803776,
      "step": 18286
    },
    {
      "epoch": 1.94005941014216,
      "grad_norm": 0.3840425172214153,
      "learning_rate": 4.687272897588218e-05,
      "loss": 1.718,
      "num_input_tokens_seen": 14387590496,
      "step": 18287
    },
    {
      "epoch": 1.9401654996817315,
      "grad_norm": 0.4402574712898082,
      "learning_rate": 4.687239240301907e-05,
      "loss": 1.5887,
      "num_input_tokens_seen": 14388377216,
      "step": 18288
    },
    {
      "epoch": 1.940271589221303,
      "grad_norm": 0.35381471605176706,
      "learning_rate": 4.6872055813253624e-05,
      "loss": 1.6323,
      "num_input_tokens_seen": 14389164016,
      "step": 18289
    },
    {
      "epoch": 1.9403776787608742,
      "grad_norm": 0.33570287647621766,
      "learning_rate": 4.687171920658608e-05,
      "loss": 1.514,
      "num_input_tokens_seen": 14389950992,
      "step": 18290
    },
    {
      "epoch": 1.9404837683004454,
      "grad_norm": 0.34850443808690146,
      "learning_rate": 4.687138258301673e-05,
      "loss": 1.7616,
      "num_input_tokens_seen": 14390737776,
      "step": 18291
    },
    {
      "epoch": 1.940589857840017,
      "grad_norm": 0.37984038822036703,
      "learning_rate": 4.687104594254581e-05,
      "loss": 1.7503,
      "num_input_tokens_seen": 14391524544,
      "step": 18292
    },
    {
      "epoch": 1.9406959473795884,
      "grad_norm": 0.4228405668055226,
      "learning_rate": 4.6870709285173594e-05,
      "loss": 1.7052,
      "num_input_tokens_seen": 14392311280,
      "step": 18293
    },
    {
      "epoch": 1.9408020369191599,
      "grad_norm": 0.38850824779966836,
      "learning_rate": 4.687037261090033e-05,
      "loss": 1.765,
      "num_input_tokens_seen": 14393098032,
      "step": 18294
    },
    {
      "epoch": 1.9409081264587311,
      "grad_norm": 0.4240090792739776,
      "learning_rate": 4.687003591972628e-05,
      "loss": 1.8407,
      "num_input_tokens_seen": 14393884800,
      "step": 18295
    },
    {
      "epoch": 1.9410142159983026,
      "grad_norm": 0.4889560400803926,
      "learning_rate": 4.6869699211651714e-05,
      "loss": 1.5528,
      "num_input_tokens_seen": 14394671680,
      "step": 18296
    },
    {
      "epoch": 1.9411203055378738,
      "grad_norm": 0.7427301328394985,
      "learning_rate": 4.686936248667688e-05,
      "loss": 1.7289,
      "num_input_tokens_seen": 14395458528,
      "step": 18297
    },
    {
      "epoch": 1.9412263950774453,
      "grad_norm": 0.48104083588615243,
      "learning_rate": 4.686902574480205e-05,
      "loss": 1.7428,
      "num_input_tokens_seen": 14396245232,
      "step": 18298
    },
    {
      "epoch": 1.9413324846170168,
      "grad_norm": 0.6020358706601185,
      "learning_rate": 4.686868898602748e-05,
      "loss": 1.6827,
      "num_input_tokens_seen": 14397032080,
      "step": 18299
    },
    {
      "epoch": 1.9414385741565883,
      "grad_norm": 0.3640892241594361,
      "learning_rate": 4.6868352210353425e-05,
      "loss": 1.5049,
      "num_input_tokens_seen": 14397818832,
      "step": 18300
    },
    {
      "epoch": 1.9415446636961595,
      "grad_norm": 0.5879181955775015,
      "learning_rate": 4.686801541778015e-05,
      "loss": 1.674,
      "num_input_tokens_seen": 14398605552,
      "step": 18301
    },
    {
      "epoch": 1.941650753235731,
      "grad_norm": 0.5678011016129747,
      "learning_rate": 4.686767860830791e-05,
      "loss": 1.6674,
      "num_input_tokens_seen": 14399392272,
      "step": 18302
    },
    {
      "epoch": 1.9417568427753022,
      "grad_norm": 0.9437630847418084,
      "learning_rate": 4.686734178193698e-05,
      "loss": 1.721,
      "num_input_tokens_seen": 14400179008,
      "step": 18303
    },
    {
      "epoch": 1.9418629323148737,
      "grad_norm": 0.6607238632073621,
      "learning_rate": 4.68670049386676e-05,
      "loss": 1.7953,
      "num_input_tokens_seen": 14400965776,
      "step": 18304
    },
    {
      "epoch": 1.9419690218544452,
      "grad_norm": 0.6472223811704962,
      "learning_rate": 4.686666807850004e-05,
      "loss": 1.5109,
      "num_input_tokens_seen": 14401752544,
      "step": 18305
    },
    {
      "epoch": 1.9420751113940167,
      "grad_norm": 0.6271686934299985,
      "learning_rate": 4.6866331201434566e-05,
      "loss": 1.7884,
      "num_input_tokens_seen": 14402539216,
      "step": 18306
    },
    {
      "epoch": 1.942181200933588,
      "grad_norm": 0.5774645048843902,
      "learning_rate": 4.686599430747143e-05,
      "loss": 1.652,
      "num_input_tokens_seen": 14403325968,
      "step": 18307
    },
    {
      "epoch": 1.9422872904731594,
      "grad_norm": 0.5819667728688472,
      "learning_rate": 4.6865657396610896e-05,
      "loss": 1.6854,
      "num_input_tokens_seen": 14404112656,
      "step": 18308
    },
    {
      "epoch": 1.9423933800127307,
      "grad_norm": 0.5457683815745799,
      "learning_rate": 4.686532046885322e-05,
      "loss": 1.8402,
      "num_input_tokens_seen": 14404899376,
      "step": 18309
    },
    {
      "epoch": 1.9424994695523021,
      "grad_norm": 0.5529203080012087,
      "learning_rate": 4.686498352419867e-05,
      "loss": 1.8115,
      "num_input_tokens_seen": 14405686016,
      "step": 18310
    },
    {
      "epoch": 1.9426055590918736,
      "grad_norm": 0.3819484391407539,
      "learning_rate": 4.686464656264751e-05,
      "loss": 1.6536,
      "num_input_tokens_seen": 14406472800,
      "step": 18311
    },
    {
      "epoch": 1.942711648631445,
      "grad_norm": 0.43384144314264295,
      "learning_rate": 4.686430958419998e-05,
      "loss": 1.6119,
      "num_input_tokens_seen": 14407259648,
      "step": 18312
    },
    {
      "epoch": 1.9428177381710163,
      "grad_norm": 0.37853005959359726,
      "learning_rate": 4.6863972588856364e-05,
      "loss": 1.6538,
      "num_input_tokens_seen": 14408046432,
      "step": 18313
    },
    {
      "epoch": 1.9429238277105876,
      "grad_norm": 0.38017066200957045,
      "learning_rate": 4.6863635576616905e-05,
      "loss": 1.7652,
      "num_input_tokens_seen": 14408833248,
      "step": 18314
    },
    {
      "epoch": 1.943029917250159,
      "grad_norm": 0.4031136602378247,
      "learning_rate": 4.686329854748187e-05,
      "loss": 1.7655,
      "num_input_tokens_seen": 14409620128,
      "step": 18315
    },
    {
      "epoch": 1.9431360067897305,
      "grad_norm": 0.5386479300887351,
      "learning_rate": 4.6862961501451516e-05,
      "loss": 1.6934,
      "num_input_tokens_seen": 14410406864,
      "step": 18316
    },
    {
      "epoch": 1.943242096329302,
      "grad_norm": 0.36652093028224947,
      "learning_rate": 4.6862624438526114e-05,
      "loss": 1.6696,
      "num_input_tokens_seen": 14411193616,
      "step": 18317
    },
    {
      "epoch": 1.9433481858688735,
      "grad_norm": 0.3764493722236773,
      "learning_rate": 4.6862287358705915e-05,
      "loss": 1.7351,
      "num_input_tokens_seen": 14411980240,
      "step": 18318
    },
    {
      "epoch": 1.9434542754084447,
      "grad_norm": 0.5142238925774774,
      "learning_rate": 4.6861950261991176e-05,
      "loss": 1.8291,
      "num_input_tokens_seen": 14412766992,
      "step": 18319
    },
    {
      "epoch": 1.943560364948016,
      "grad_norm": 0.35026881381545927,
      "learning_rate": 4.686161314838217e-05,
      "loss": 1.6865,
      "num_input_tokens_seen": 14413553728,
      "step": 18320
    },
    {
      "epoch": 1.9436664544875875,
      "grad_norm": 0.4375068086119132,
      "learning_rate": 4.6861276017879143e-05,
      "loss": 1.686,
      "num_input_tokens_seen": 14414340480,
      "step": 18321
    },
    {
      "epoch": 1.943772544027159,
      "grad_norm": 0.4405393969020337,
      "learning_rate": 4.686093887048237e-05,
      "loss": 1.6791,
      "num_input_tokens_seen": 14415127248,
      "step": 18322
    },
    {
      "epoch": 1.9438786335667304,
      "grad_norm": 0.4195973554795217,
      "learning_rate": 4.686060170619211e-05,
      "loss": 1.6951,
      "num_input_tokens_seen": 14415914000,
      "step": 18323
    },
    {
      "epoch": 1.9439847231063019,
      "grad_norm": 0.4172133243433442,
      "learning_rate": 4.686026452500861e-05,
      "loss": 1.6467,
      "num_input_tokens_seen": 14416700784,
      "step": 18324
    },
    {
      "epoch": 1.9440908126458731,
      "grad_norm": 0.42530849298330325,
      "learning_rate": 4.685992732693214e-05,
      "loss": 1.6898,
      "num_input_tokens_seen": 14417487584,
      "step": 18325
    },
    {
      "epoch": 1.9441969021854444,
      "grad_norm": 0.412377185760703,
      "learning_rate": 4.685959011196296e-05,
      "loss": 1.6983,
      "num_input_tokens_seen": 14418274368,
      "step": 18326
    },
    {
      "epoch": 1.9443029917250159,
      "grad_norm": 0.6647811797134101,
      "learning_rate": 4.685925288010133e-05,
      "loss": 1.7447,
      "num_input_tokens_seen": 14419061136,
      "step": 18327
    },
    {
      "epoch": 1.9444090812645873,
      "grad_norm": 0.4769165957092655,
      "learning_rate": 4.6858915631347514e-05,
      "loss": 1.9284,
      "num_input_tokens_seen": 14419847936,
      "step": 18328
    },
    {
      "epoch": 1.9445151708041588,
      "grad_norm": 0.4339516086758092,
      "learning_rate": 4.6858578365701764e-05,
      "loss": 1.744,
      "num_input_tokens_seen": 14420634720,
      "step": 18329
    },
    {
      "epoch": 1.94462126034373,
      "grad_norm": 0.4962449469648541,
      "learning_rate": 4.6858241083164355e-05,
      "loss": 1.6938,
      "num_input_tokens_seen": 14421421440,
      "step": 18330
    },
    {
      "epoch": 1.9447273498833015,
      "grad_norm": 0.3832807476814746,
      "learning_rate": 4.685790378373553e-05,
      "loss": 1.697,
      "num_input_tokens_seen": 14422208192,
      "step": 18331
    },
    {
      "epoch": 1.9448334394228728,
      "grad_norm": 0.40045130452490973,
      "learning_rate": 4.685756646741556e-05,
      "loss": 1.7317,
      "num_input_tokens_seen": 14422994928,
      "step": 18332
    },
    {
      "epoch": 1.9449395289624443,
      "grad_norm": 0.39148446617517363,
      "learning_rate": 4.685722913420471e-05,
      "loss": 1.5566,
      "num_input_tokens_seen": 14423781760,
      "step": 18333
    },
    {
      "epoch": 1.9450456185020157,
      "grad_norm": 0.4491289671119363,
      "learning_rate": 4.685689178410323e-05,
      "loss": 1.7069,
      "num_input_tokens_seen": 14424568464,
      "step": 18334
    },
    {
      "epoch": 1.9451517080415872,
      "grad_norm": 0.43500153621433535,
      "learning_rate": 4.685655441711139e-05,
      "loss": 1.6556,
      "num_input_tokens_seen": 14425355248,
      "step": 18335
    },
    {
      "epoch": 1.9452577975811585,
      "grad_norm": 0.35573433688256134,
      "learning_rate": 4.6856217033229435e-05,
      "loss": 1.7259,
      "num_input_tokens_seen": 14426141936,
      "step": 18336
    },
    {
      "epoch": 1.94536388712073,
      "grad_norm": 0.3170411277546038,
      "learning_rate": 4.6855879632457644e-05,
      "loss": 1.6906,
      "num_input_tokens_seen": 14426928656,
      "step": 18337
    },
    {
      "epoch": 1.9454699766603012,
      "grad_norm": 0.3717430221122923,
      "learning_rate": 4.685554221479627e-05,
      "loss": 1.6855,
      "num_input_tokens_seen": 14427715376,
      "step": 18338
    },
    {
      "epoch": 1.9455760661998727,
      "grad_norm": 0.3453329558580897,
      "learning_rate": 4.685520478024557e-05,
      "loss": 1.6245,
      "num_input_tokens_seen": 14428502192,
      "step": 18339
    },
    {
      "epoch": 1.9456821557394441,
      "grad_norm": 0.33568127995812647,
      "learning_rate": 4.685486732880581e-05,
      "loss": 1.638,
      "num_input_tokens_seen": 14429288976,
      "step": 18340
    },
    {
      "epoch": 1.9457882452790156,
      "grad_norm": 0.5453330898705622,
      "learning_rate": 4.685452986047726e-05,
      "loss": 1.72,
      "num_input_tokens_seen": 14430075712,
      "step": 18341
    },
    {
      "epoch": 1.9458943348185869,
      "grad_norm": 0.3982720339185819,
      "learning_rate": 4.685419237526017e-05,
      "loss": 1.6271,
      "num_input_tokens_seen": 14430862416,
      "step": 18342
    },
    {
      "epoch": 1.9460004243581581,
      "grad_norm": 0.47468553749586223,
      "learning_rate": 4.685385487315478e-05,
      "loss": 1.7409,
      "num_input_tokens_seen": 14431649184,
      "step": 18343
    },
    {
      "epoch": 1.9461065138977296,
      "grad_norm": 0.42714773271887335,
      "learning_rate": 4.685351735416139e-05,
      "loss": 1.7805,
      "num_input_tokens_seen": 14432436032,
      "step": 18344
    },
    {
      "epoch": 1.946212603437301,
      "grad_norm": 0.33669105910785163,
      "learning_rate": 4.685317981828024e-05,
      "loss": 1.5743,
      "num_input_tokens_seen": 14433222864,
      "step": 18345
    },
    {
      "epoch": 1.9463186929768725,
      "grad_norm": 0.430213205997875,
      "learning_rate": 4.68528422655116e-05,
      "loss": 1.7661,
      "num_input_tokens_seen": 14434009712,
      "step": 18346
    },
    {
      "epoch": 1.946424782516444,
      "grad_norm": 0.4143013341694586,
      "learning_rate": 4.6852504695855716e-05,
      "loss": 1.7326,
      "num_input_tokens_seen": 14434796528,
      "step": 18347
    },
    {
      "epoch": 1.9465308720560153,
      "grad_norm": 0.3534984857760218,
      "learning_rate": 4.6852167109312856e-05,
      "loss": 1.5797,
      "num_input_tokens_seen": 14435583216,
      "step": 18348
    },
    {
      "epoch": 1.9466369615955865,
      "grad_norm": 0.4000841970335597,
      "learning_rate": 4.685182950588329e-05,
      "loss": 1.6146,
      "num_input_tokens_seen": 14436370032,
      "step": 18349
    },
    {
      "epoch": 1.946743051135158,
      "grad_norm": 0.47709199993885937,
      "learning_rate": 4.685149188556727e-05,
      "loss": 1.9061,
      "num_input_tokens_seen": 14437156816,
      "step": 18350
    },
    {
      "epoch": 1.9468491406747295,
      "grad_norm": 0.5937782652421472,
      "learning_rate": 4.6851154248365046e-05,
      "loss": 1.7619,
      "num_input_tokens_seen": 14437943616,
      "step": 18351
    },
    {
      "epoch": 1.946955230214301,
      "grad_norm": 0.41399956911637165,
      "learning_rate": 4.6850816594276906e-05,
      "loss": 1.6357,
      "num_input_tokens_seen": 14438730416,
      "step": 18352
    },
    {
      "epoch": 1.9470613197538724,
      "grad_norm": 0.6852787565360854,
      "learning_rate": 4.685047892330309e-05,
      "loss": 1.9299,
      "num_input_tokens_seen": 14439517088,
      "step": 18353
    },
    {
      "epoch": 1.9471674092934437,
      "grad_norm": 0.5226901308592252,
      "learning_rate": 4.6850141235443866e-05,
      "loss": 1.5922,
      "num_input_tokens_seen": 14440303904,
      "step": 18354
    },
    {
      "epoch": 1.947273498833015,
      "grad_norm": 0.4723509662683637,
      "learning_rate": 4.6849803530699496e-05,
      "loss": 1.727,
      "num_input_tokens_seen": 14441090576,
      "step": 18355
    },
    {
      "epoch": 1.9473795883725864,
      "grad_norm": 0.620356295631374,
      "learning_rate": 4.6849465809070235e-05,
      "loss": 1.6944,
      "num_input_tokens_seen": 14441877248,
      "step": 18356
    },
    {
      "epoch": 1.9474856779121579,
      "grad_norm": 0.4498933716579209,
      "learning_rate": 4.684912807055635e-05,
      "loss": 1.6881,
      "num_input_tokens_seen": 14442663984,
      "step": 18357
    },
    {
      "epoch": 1.9475917674517293,
      "grad_norm": 0.5180815849323569,
      "learning_rate": 4.68487903151581e-05,
      "loss": 1.692,
      "num_input_tokens_seen": 14443450752,
      "step": 18358
    },
    {
      "epoch": 1.9476978569913006,
      "grad_norm": 0.3814182948441463,
      "learning_rate": 4.684845254287574e-05,
      "loss": 1.6746,
      "num_input_tokens_seen": 14444237472,
      "step": 18359
    },
    {
      "epoch": 1.947803946530872,
      "grad_norm": 0.42387088723919397,
      "learning_rate": 4.684811475370955e-05,
      "loss": 1.7128,
      "num_input_tokens_seen": 14445024144,
      "step": 18360
    },
    {
      "epoch": 1.9479100360704433,
      "grad_norm": 0.5355430641866209,
      "learning_rate": 4.6847776947659774e-05,
      "loss": 1.7525,
      "num_input_tokens_seen": 14445810976,
      "step": 18361
    },
    {
      "epoch": 1.9480161256100148,
      "grad_norm": 0.4419943857085365,
      "learning_rate": 4.684743912472667e-05,
      "loss": 1.7394,
      "num_input_tokens_seen": 14446597664,
      "step": 18362
    },
    {
      "epoch": 1.9481222151495863,
      "grad_norm": 0.4234096851159589,
      "learning_rate": 4.684710128491051e-05,
      "loss": 1.7757,
      "num_input_tokens_seen": 14447384416,
      "step": 18363
    },
    {
      "epoch": 1.9482283046891578,
      "grad_norm": 0.4975195671857278,
      "learning_rate": 4.684676342821155e-05,
      "loss": 1.6048,
      "num_input_tokens_seen": 14448171296,
      "step": 18364
    },
    {
      "epoch": 1.948334394228729,
      "grad_norm": 0.4463504188689312,
      "learning_rate": 4.684642555463005e-05,
      "loss": 1.6844,
      "num_input_tokens_seen": 14448958032,
      "step": 18365
    },
    {
      "epoch": 1.9484404837683005,
      "grad_norm": 0.5063933883469782,
      "learning_rate": 4.684608766416628e-05,
      "loss": 1.69,
      "num_input_tokens_seen": 14449744784,
      "step": 18366
    },
    {
      "epoch": 1.9485465733078717,
      "grad_norm": 0.43777558283212165,
      "learning_rate": 4.684574975682049e-05,
      "loss": 1.7086,
      "num_input_tokens_seen": 14450531552,
      "step": 18367
    },
    {
      "epoch": 1.9486526628474432,
      "grad_norm": 0.3949465431863423,
      "learning_rate": 4.684541183259295e-05,
      "loss": 1.808,
      "num_input_tokens_seen": 14451318352,
      "step": 18368
    },
    {
      "epoch": 1.9487587523870147,
      "grad_norm": 0.431537834590664,
      "learning_rate": 4.684507389148391e-05,
      "loss": 1.8079,
      "num_input_tokens_seen": 14452105088,
      "step": 18369
    },
    {
      "epoch": 1.9488648419265862,
      "grad_norm": 0.40572540491950704,
      "learning_rate": 4.6844735933493644e-05,
      "loss": 1.7629,
      "num_input_tokens_seen": 14452891760,
      "step": 18370
    },
    {
      "epoch": 1.9489709314661574,
      "grad_norm": 0.38278846166122427,
      "learning_rate": 4.6844397958622396e-05,
      "loss": 1.7122,
      "num_input_tokens_seen": 14453678512,
      "step": 18371
    },
    {
      "epoch": 1.9490770210057289,
      "grad_norm": 0.41326183711010106,
      "learning_rate": 4.684405996687045e-05,
      "loss": 1.7572,
      "num_input_tokens_seen": 14454465280,
      "step": 18372
    },
    {
      "epoch": 1.9491831105453001,
      "grad_norm": 0.3515667243995172,
      "learning_rate": 4.684372195823805e-05,
      "loss": 1.7056,
      "num_input_tokens_seen": 14455252080,
      "step": 18373
    },
    {
      "epoch": 1.9492892000848716,
      "grad_norm": 0.35536741474619243,
      "learning_rate": 4.684338393272547e-05,
      "loss": 1.7144,
      "num_input_tokens_seen": 14456038880,
      "step": 18374
    },
    {
      "epoch": 1.949395289624443,
      "grad_norm": 0.3913601850099105,
      "learning_rate": 4.684304589033296e-05,
      "loss": 1.5668,
      "num_input_tokens_seen": 14456825616,
      "step": 18375
    },
    {
      "epoch": 1.9495013791640146,
      "grad_norm": 0.3853923517697766,
      "learning_rate": 4.684270783106078e-05,
      "loss": 1.8028,
      "num_input_tokens_seen": 14457612352,
      "step": 18376
    },
    {
      "epoch": 1.9496074687035858,
      "grad_norm": 0.4021116110584115,
      "learning_rate": 4.6842369754909196e-05,
      "loss": 1.774,
      "num_input_tokens_seen": 14458399024,
      "step": 18377
    },
    {
      "epoch": 1.949713558243157,
      "grad_norm": 0.39872484147880216,
      "learning_rate": 4.684203166187848e-05,
      "loss": 1.7861,
      "num_input_tokens_seen": 14459185808,
      "step": 18378
    },
    {
      "epoch": 1.9498196477827285,
      "grad_norm": 0.35892117003269575,
      "learning_rate": 4.684169355196887e-05,
      "loss": 1.6617,
      "num_input_tokens_seen": 14459972576,
      "step": 18379
    },
    {
      "epoch": 1.9499257373223,
      "grad_norm": 0.3694551323665086,
      "learning_rate": 4.684135542518064e-05,
      "loss": 1.8242,
      "num_input_tokens_seen": 14460759360,
      "step": 18380
    },
    {
      "epoch": 1.9500318268618715,
      "grad_norm": 0.4581497788429998,
      "learning_rate": 4.6841017281514064e-05,
      "loss": 1.7179,
      "num_input_tokens_seen": 14461546080,
      "step": 18381
    },
    {
      "epoch": 1.950137916401443,
      "grad_norm": 0.4035806578821169,
      "learning_rate": 4.6840679120969386e-05,
      "loss": 1.6564,
      "num_input_tokens_seen": 14462332944,
      "step": 18382
    },
    {
      "epoch": 1.9502440059410142,
      "grad_norm": 0.37013303835201955,
      "learning_rate": 4.6840340943546865e-05,
      "loss": 1.6614,
      "num_input_tokens_seen": 14463119776,
      "step": 18383
    },
    {
      "epoch": 1.9503500954805855,
      "grad_norm": 0.408642099297302,
      "learning_rate": 4.684000274924678e-05,
      "loss": 1.6721,
      "num_input_tokens_seen": 14463906528,
      "step": 18384
    },
    {
      "epoch": 1.950456185020157,
      "grad_norm": 0.3751191003820233,
      "learning_rate": 4.683966453806937e-05,
      "loss": 1.5594,
      "num_input_tokens_seen": 14464693312,
      "step": 18385
    },
    {
      "epoch": 1.9505622745597284,
      "grad_norm": 0.407758954108613,
      "learning_rate": 4.683932631001492e-05,
      "loss": 1.6591,
      "num_input_tokens_seen": 14465480160,
      "step": 18386
    },
    {
      "epoch": 1.9506683640993,
      "grad_norm": 0.3798682125945111,
      "learning_rate": 4.683898806508367e-05,
      "loss": 1.5784,
      "num_input_tokens_seen": 14466266944,
      "step": 18387
    },
    {
      "epoch": 1.9507744536388714,
      "grad_norm": 0.4018132644338695,
      "learning_rate": 4.68386498032759e-05,
      "loss": 1.7472,
      "num_input_tokens_seen": 14467053680,
      "step": 18388
    },
    {
      "epoch": 1.9508805431784426,
      "grad_norm": 0.3992666057793027,
      "learning_rate": 4.683831152459186e-05,
      "loss": 1.8575,
      "num_input_tokens_seen": 14467840432,
      "step": 18389
    },
    {
      "epoch": 1.9509866327180139,
      "grad_norm": 0.4236241065581225,
      "learning_rate": 4.683797322903181e-05,
      "loss": 1.7649,
      "num_input_tokens_seen": 14468627136,
      "step": 18390
    },
    {
      "epoch": 1.9510927222575853,
      "grad_norm": 0.39985950041215457,
      "learning_rate": 4.683763491659601e-05,
      "loss": 1.7471,
      "num_input_tokens_seen": 14469413904,
      "step": 18391
    },
    {
      "epoch": 1.9511988117971568,
      "grad_norm": 0.5532480468503217,
      "learning_rate": 4.6837296587284726e-05,
      "loss": 1.6424,
      "num_input_tokens_seen": 14470200608,
      "step": 18392
    },
    {
      "epoch": 1.9513049013367283,
      "grad_norm": 0.331128573181024,
      "learning_rate": 4.6836958241098236e-05,
      "loss": 1.7304,
      "num_input_tokens_seen": 14470987376,
      "step": 18393
    },
    {
      "epoch": 1.9514109908762995,
      "grad_norm": 0.9023784554663559,
      "learning_rate": 4.683661987803677e-05,
      "loss": 1.8037,
      "num_input_tokens_seen": 14471774192,
      "step": 18394
    },
    {
      "epoch": 1.951517080415871,
      "grad_norm": 0.41034120381696926,
      "learning_rate": 4.683628149810061e-05,
      "loss": 1.7709,
      "num_input_tokens_seen": 14472560944,
      "step": 18395
    },
    {
      "epoch": 1.9516231699554423,
      "grad_norm": 0.6710018437892383,
      "learning_rate": 4.683594310129002e-05,
      "loss": 1.8133,
      "num_input_tokens_seen": 14473347632,
      "step": 18396
    },
    {
      "epoch": 1.9517292594950137,
      "grad_norm": 0.5813491723239665,
      "learning_rate": 4.683560468760524e-05,
      "loss": 1.6908,
      "num_input_tokens_seen": 14474134464,
      "step": 18397
    },
    {
      "epoch": 1.9518353490345852,
      "grad_norm": 0.5257698950895913,
      "learning_rate": 4.683526625704655e-05,
      "loss": 1.6015,
      "num_input_tokens_seen": 14474921296,
      "step": 18398
    },
    {
      "epoch": 1.9519414385741567,
      "grad_norm": 0.7809424448440719,
      "learning_rate": 4.683492780961422e-05,
      "loss": 1.5875,
      "num_input_tokens_seen": 14475708144,
      "step": 18399
    },
    {
      "epoch": 1.952047528113728,
      "grad_norm": 0.4453527892743449,
      "learning_rate": 4.6834589345308475e-05,
      "loss": 1.7243,
      "num_input_tokens_seen": 14476495008,
      "step": 18400
    },
    {
      "epoch": 1.9521536176532994,
      "grad_norm": 0.5260988174708616,
      "learning_rate": 4.683425086412961e-05,
      "loss": 1.705,
      "num_input_tokens_seen": 14477281824,
      "step": 18401
    },
    {
      "epoch": 1.9522597071928707,
      "grad_norm": 0.7331766596567552,
      "learning_rate": 4.683391236607788e-05,
      "loss": 1.7884,
      "num_input_tokens_seen": 14478068560,
      "step": 18402
    },
    {
      "epoch": 1.9523657967324421,
      "grad_norm": 0.47020931841672625,
      "learning_rate": 4.6833573851153543e-05,
      "loss": 1.715,
      "num_input_tokens_seen": 14478855328,
      "step": 18403
    },
    {
      "epoch": 1.9524718862720136,
      "grad_norm": 0.4977505583443745,
      "learning_rate": 4.683323531935686e-05,
      "loss": 1.7172,
      "num_input_tokens_seen": 14479642144,
      "step": 18404
    },
    {
      "epoch": 1.952577975811585,
      "grad_norm": 0.5888560212080513,
      "learning_rate": 4.68328967706881e-05,
      "loss": 1.7633,
      "num_input_tokens_seen": 14480428864,
      "step": 18405
    },
    {
      "epoch": 1.9526840653511564,
      "grad_norm": 0.33217999837400985,
      "learning_rate": 4.6832558205147505e-05,
      "loss": 1.6272,
      "num_input_tokens_seen": 14481215536,
      "step": 18406
    },
    {
      "epoch": 1.9527901548907278,
      "grad_norm": 0.5625958413003477,
      "learning_rate": 4.683221962273536e-05,
      "loss": 1.743,
      "num_input_tokens_seen": 14482002288,
      "step": 18407
    },
    {
      "epoch": 1.952896244430299,
      "grad_norm": 0.4439364168520964,
      "learning_rate": 4.6831881023451906e-05,
      "loss": 1.6698,
      "num_input_tokens_seen": 14482789008,
      "step": 18408
    },
    {
      "epoch": 1.9530023339698706,
      "grad_norm": 0.42954346966161355,
      "learning_rate": 4.683154240729742e-05,
      "loss": 1.6328,
      "num_input_tokens_seen": 14483575744,
      "step": 18409
    },
    {
      "epoch": 1.953108423509442,
      "grad_norm": 0.42406087426487743,
      "learning_rate": 4.683120377427216e-05,
      "loss": 1.7709,
      "num_input_tokens_seen": 14484362400,
      "step": 18410
    },
    {
      "epoch": 1.9532145130490135,
      "grad_norm": 0.4292306370170413,
      "learning_rate": 4.683086512437639e-05,
      "loss": 1.6797,
      "num_input_tokens_seen": 14485149120,
      "step": 18411
    },
    {
      "epoch": 1.9533206025885848,
      "grad_norm": 0.4520217498060777,
      "learning_rate": 4.6830526457610366e-05,
      "loss": 1.6855,
      "num_input_tokens_seen": 14485935920,
      "step": 18412
    },
    {
      "epoch": 1.953426692128156,
      "grad_norm": 0.645001470288145,
      "learning_rate": 4.6830187773974345e-05,
      "loss": 1.8319,
      "num_input_tokens_seen": 14486722752,
      "step": 18413
    },
    {
      "epoch": 1.9535327816677275,
      "grad_norm": 0.49875512670114835,
      "learning_rate": 4.68298490734686e-05,
      "loss": 1.7289,
      "num_input_tokens_seen": 14487509520,
      "step": 18414
    },
    {
      "epoch": 1.953638871207299,
      "grad_norm": 0.42805224985901336,
      "learning_rate": 4.6829510356093386e-05,
      "loss": 1.7516,
      "num_input_tokens_seen": 14488296192,
      "step": 18415
    },
    {
      "epoch": 1.9537449607468704,
      "grad_norm": 0.42439261605179124,
      "learning_rate": 4.682917162184897e-05,
      "loss": 1.6487,
      "num_input_tokens_seen": 14489083056,
      "step": 18416
    },
    {
      "epoch": 1.953851050286442,
      "grad_norm": 0.4069825129064432,
      "learning_rate": 4.6828832870735615e-05,
      "loss": 1.7622,
      "num_input_tokens_seen": 14489869760,
      "step": 18417
    },
    {
      "epoch": 1.9539571398260132,
      "grad_norm": 0.48449759275995036,
      "learning_rate": 4.682849410275357e-05,
      "loss": 1.7544,
      "num_input_tokens_seen": 14490656496,
      "step": 18418
    },
    {
      "epoch": 1.9540632293655844,
      "grad_norm": 0.3650561366565345,
      "learning_rate": 4.682815531790311e-05,
      "loss": 1.8534,
      "num_input_tokens_seen": 14491443312,
      "step": 18419
    },
    {
      "epoch": 1.9541693189051559,
      "grad_norm": 0.38915812074951595,
      "learning_rate": 4.682781651618448e-05,
      "loss": 1.6279,
      "num_input_tokens_seen": 14492230064,
      "step": 18420
    },
    {
      "epoch": 1.9542754084447274,
      "grad_norm": 0.7268909704500767,
      "learning_rate": 4.6827477697597974e-05,
      "loss": 1.7243,
      "num_input_tokens_seen": 14493016832,
      "step": 18421
    },
    {
      "epoch": 1.9543814979842988,
      "grad_norm": 0.7765944316297095,
      "learning_rate": 4.682713886214383e-05,
      "loss": 1.6608,
      "num_input_tokens_seen": 14493803568,
      "step": 18422
    },
    {
      "epoch": 1.9544875875238703,
      "grad_norm": 0.4054789569570739,
      "learning_rate": 4.68268000098223e-05,
      "loss": 1.7069,
      "num_input_tokens_seen": 14494590192,
      "step": 18423
    },
    {
      "epoch": 1.9545936770634416,
      "grad_norm": 0.4462672193299872,
      "learning_rate": 4.682646114063367e-05,
      "loss": 1.6114,
      "num_input_tokens_seen": 14495376992,
      "step": 18424
    },
    {
      "epoch": 1.9546997666030128,
      "grad_norm": 0.6246639838097412,
      "learning_rate": 4.682612225457819e-05,
      "loss": 1.8049,
      "num_input_tokens_seen": 14496163760,
      "step": 18425
    },
    {
      "epoch": 1.9548058561425843,
      "grad_norm": 0.4079636804608828,
      "learning_rate": 4.682578335165612e-05,
      "loss": 1.8055,
      "num_input_tokens_seen": 14496950496,
      "step": 18426
    },
    {
      "epoch": 1.9549119456821558,
      "grad_norm": 0.5324125230218217,
      "learning_rate": 4.6825444431867725e-05,
      "loss": 1.684,
      "num_input_tokens_seen": 14497737232,
      "step": 18427
    },
    {
      "epoch": 1.9550180352217272,
      "grad_norm": 0.3806353840096361,
      "learning_rate": 4.6825105495213266e-05,
      "loss": 1.622,
      "num_input_tokens_seen": 14498524016,
      "step": 18428
    },
    {
      "epoch": 1.9551241247612985,
      "grad_norm": 0.4521853837011064,
      "learning_rate": 4.682476654169301e-05,
      "loss": 1.5724,
      "num_input_tokens_seen": 14499310864,
      "step": 18429
    },
    {
      "epoch": 1.95523021430087,
      "grad_norm": 0.43973433507664117,
      "learning_rate": 4.682442757130721e-05,
      "loss": 1.6534,
      "num_input_tokens_seen": 14500097744,
      "step": 18430
    },
    {
      "epoch": 1.9553363038404412,
      "grad_norm": 0.432249453324297,
      "learning_rate": 4.682408858405614e-05,
      "loss": 1.5903,
      "num_input_tokens_seen": 14500884496,
      "step": 18431
    },
    {
      "epoch": 1.9554423933800127,
      "grad_norm": 0.528877213868481,
      "learning_rate": 4.6823749579940045e-05,
      "loss": 1.6257,
      "num_input_tokens_seen": 14501671264,
      "step": 18432
    },
    {
      "epoch": 1.9555484829195842,
      "grad_norm": 0.43991857123210126,
      "learning_rate": 4.68234105589592e-05,
      "loss": 1.8033,
      "num_input_tokens_seen": 14502458032,
      "step": 18433
    },
    {
      "epoch": 1.9556545724591556,
      "grad_norm": 0.45362305816387666,
      "learning_rate": 4.682307152111387e-05,
      "loss": 1.6224,
      "num_input_tokens_seen": 14503244800,
      "step": 18434
    },
    {
      "epoch": 1.955760661998727,
      "grad_norm": 0.3700432740167474,
      "learning_rate": 4.682273246640431e-05,
      "loss": 1.6245,
      "num_input_tokens_seen": 14504031552,
      "step": 18435
    },
    {
      "epoch": 1.9558667515382984,
      "grad_norm": 0.41798571799266093,
      "learning_rate": 4.6822393394830776e-05,
      "loss": 1.7416,
      "num_input_tokens_seen": 14504818336,
      "step": 18436
    },
    {
      "epoch": 1.9559728410778696,
      "grad_norm": 0.40383999789296926,
      "learning_rate": 4.6822054306393536e-05,
      "loss": 1.8299,
      "num_input_tokens_seen": 14505605168,
      "step": 18437
    },
    {
      "epoch": 1.956078930617441,
      "grad_norm": 0.3851072896363243,
      "learning_rate": 4.6821715201092866e-05,
      "loss": 1.7269,
      "num_input_tokens_seen": 14506391936,
      "step": 18438
    },
    {
      "epoch": 1.9561850201570126,
      "grad_norm": 0.3355414165594857,
      "learning_rate": 4.6821376078929e-05,
      "loss": 1.6597,
      "num_input_tokens_seen": 14507178656,
      "step": 18439
    },
    {
      "epoch": 1.956291109696584,
      "grad_norm": 0.46859534921420415,
      "learning_rate": 4.682103693990222e-05,
      "loss": 1.8194,
      "num_input_tokens_seen": 14507965280,
      "step": 18440
    },
    {
      "epoch": 1.9563971992361553,
      "grad_norm": 0.35096804525162545,
      "learning_rate": 4.682069778401278e-05,
      "loss": 1.7537,
      "num_input_tokens_seen": 14508752096,
      "step": 18441
    },
    {
      "epoch": 1.9565032887757268,
      "grad_norm": 0.3852952299851064,
      "learning_rate": 4.682035861126095e-05,
      "loss": 1.7484,
      "num_input_tokens_seen": 14509538864,
      "step": 18442
    },
    {
      "epoch": 1.956609378315298,
      "grad_norm": 0.37000164484215675,
      "learning_rate": 4.6820019421646985e-05,
      "loss": 1.5261,
      "num_input_tokens_seen": 14510325648,
      "step": 18443
    },
    {
      "epoch": 1.9567154678548695,
      "grad_norm": 0.4233450631384616,
      "learning_rate": 4.681968021517115e-05,
      "loss": 1.808,
      "num_input_tokens_seen": 14511112448,
      "step": 18444
    },
    {
      "epoch": 1.956821557394441,
      "grad_norm": 0.37141340681477597,
      "learning_rate": 4.681934099183371e-05,
      "loss": 1.6164,
      "num_input_tokens_seen": 14511899168,
      "step": 18445
    },
    {
      "epoch": 1.9569276469340124,
      "grad_norm": 0.40838506527304785,
      "learning_rate": 4.6819001751634916e-05,
      "loss": 1.6695,
      "num_input_tokens_seen": 14512685920,
      "step": 18446
    },
    {
      "epoch": 1.9570337364735837,
      "grad_norm": 0.4152074438002502,
      "learning_rate": 4.681866249457504e-05,
      "loss": 1.6058,
      "num_input_tokens_seen": 14513472752,
      "step": 18447
    },
    {
      "epoch": 1.957139826013155,
      "grad_norm": 0.40622696802019576,
      "learning_rate": 4.681832322065434e-05,
      "loss": 1.7924,
      "num_input_tokens_seen": 14514259488,
      "step": 18448
    },
    {
      "epoch": 1.9572459155527264,
      "grad_norm": 0.3978580699505678,
      "learning_rate": 4.681798392987308e-05,
      "loss": 1.8684,
      "num_input_tokens_seen": 14515046304,
      "step": 18449
    },
    {
      "epoch": 1.957352005092298,
      "grad_norm": 0.6387867401419521,
      "learning_rate": 4.6817644622231525e-05,
      "loss": 1.7901,
      "num_input_tokens_seen": 14515833040,
      "step": 18450
    },
    {
      "epoch": 1.9574580946318694,
      "grad_norm": 0.41064932686572325,
      "learning_rate": 4.681730529772994e-05,
      "loss": 1.8281,
      "num_input_tokens_seen": 14516619712,
      "step": 18451
    },
    {
      "epoch": 1.9575641841714408,
      "grad_norm": 0.3966931980104312,
      "learning_rate": 4.681696595636858e-05,
      "loss": 1.7129,
      "num_input_tokens_seen": 14517406448,
      "step": 18452
    },
    {
      "epoch": 1.957670273711012,
      "grad_norm": 0.5392664537790074,
      "learning_rate": 4.68166265981477e-05,
      "loss": 1.7013,
      "num_input_tokens_seen": 14518193216,
      "step": 18453
    },
    {
      "epoch": 1.9577763632505834,
      "grad_norm": 0.3772104816861459,
      "learning_rate": 4.6816287223067576e-05,
      "loss": 1.7085,
      "num_input_tokens_seen": 14518980000,
      "step": 18454
    },
    {
      "epoch": 1.9578824527901548,
      "grad_norm": 0.800094850736471,
      "learning_rate": 4.681594783112846e-05,
      "loss": 1.7414,
      "num_input_tokens_seen": 14519766784,
      "step": 18455
    },
    {
      "epoch": 1.9579885423297263,
      "grad_norm": 0.4633492930643112,
      "learning_rate": 4.681560842233063e-05,
      "loss": 1.7597,
      "num_input_tokens_seen": 14520553616,
      "step": 18456
    },
    {
      "epoch": 1.9580946318692978,
      "grad_norm": 0.8605108764800614,
      "learning_rate": 4.681526899667433e-05,
      "loss": 1.7366,
      "num_input_tokens_seen": 14521340336,
      "step": 18457
    },
    {
      "epoch": 1.9582007214088692,
      "grad_norm": 0.5073570510447414,
      "learning_rate": 4.681492955415984e-05,
      "loss": 1.7456,
      "num_input_tokens_seen": 14522127168,
      "step": 18458
    },
    {
      "epoch": 1.9583068109484405,
      "grad_norm": 0.820632677431825,
      "learning_rate": 4.68145900947874e-05,
      "loss": 1.8515,
      "num_input_tokens_seen": 14522913888,
      "step": 18459
    },
    {
      "epoch": 1.9584129004880118,
      "grad_norm": 0.5920692518048075,
      "learning_rate": 4.681425061855729e-05,
      "loss": 1.7905,
      "num_input_tokens_seen": 14523700688,
      "step": 18460
    },
    {
      "epoch": 1.9585189900275832,
      "grad_norm": 0.48871269906597237,
      "learning_rate": 4.681391112546977e-05,
      "loss": 1.7432,
      "num_input_tokens_seen": 14524487408,
      "step": 18461
    },
    {
      "epoch": 1.9586250795671547,
      "grad_norm": 0.45531224736495524,
      "learning_rate": 4.6813571615525096e-05,
      "loss": 1.6637,
      "num_input_tokens_seen": 14525274256,
      "step": 18462
    },
    {
      "epoch": 1.9587311691067262,
      "grad_norm": 0.5266150538444931,
      "learning_rate": 4.681323208872354e-05,
      "loss": 1.8651,
      "num_input_tokens_seen": 14526060944,
      "step": 18463
    },
    {
      "epoch": 1.9588372586462974,
      "grad_norm": 0.36599395338123303,
      "learning_rate": 4.681289254506535e-05,
      "loss": 1.6327,
      "num_input_tokens_seen": 14526847744,
      "step": 18464
    },
    {
      "epoch": 1.958943348185869,
      "grad_norm": 0.4964188406003946,
      "learning_rate": 4.6812552984550794e-05,
      "loss": 1.7648,
      "num_input_tokens_seen": 14527634448,
      "step": 18465
    },
    {
      "epoch": 1.9590494377254402,
      "grad_norm": 0.6213880702399163,
      "learning_rate": 4.681221340718014e-05,
      "loss": 1.8068,
      "num_input_tokens_seen": 14528421152,
      "step": 18466
    },
    {
      "epoch": 1.9591555272650116,
      "grad_norm": 0.40353668404503035,
      "learning_rate": 4.681187381295365e-05,
      "loss": 1.8639,
      "num_input_tokens_seen": 14529207856,
      "step": 18467
    },
    {
      "epoch": 1.959261616804583,
      "grad_norm": 0.530956921697106,
      "learning_rate": 4.681153420187159e-05,
      "loss": 1.6986,
      "num_input_tokens_seen": 14529994528,
      "step": 18468
    },
    {
      "epoch": 1.9593677063441546,
      "grad_norm": 0.5643398235398093,
      "learning_rate": 4.681119457393421e-05,
      "loss": 1.8137,
      "num_input_tokens_seen": 14530781184,
      "step": 18469
    },
    {
      "epoch": 1.9594737958837258,
      "grad_norm": 0.5191439236603067,
      "learning_rate": 4.681085492914178e-05,
      "loss": 1.7348,
      "num_input_tokens_seen": 14531568032,
      "step": 18470
    },
    {
      "epoch": 1.9595798854232973,
      "grad_norm": 0.5582297017218252,
      "learning_rate": 4.681051526749456e-05,
      "loss": 1.7154,
      "num_input_tokens_seen": 14532354784,
      "step": 18471
    },
    {
      "epoch": 1.9596859749628686,
      "grad_norm": 0.3593036785220708,
      "learning_rate": 4.6810175588992816e-05,
      "loss": 1.7425,
      "num_input_tokens_seen": 14533141536,
      "step": 18472
    },
    {
      "epoch": 1.95979206450244,
      "grad_norm": 0.4696284224113682,
      "learning_rate": 4.6809835893636804e-05,
      "loss": 1.7809,
      "num_input_tokens_seen": 14533928368,
      "step": 18473
    },
    {
      "epoch": 1.9598981540420115,
      "grad_norm": 0.567098880186097,
      "learning_rate": 4.6809496181426795e-05,
      "loss": 1.552,
      "num_input_tokens_seen": 14534715232,
      "step": 18474
    },
    {
      "epoch": 1.960004243581583,
      "grad_norm": 0.4954948201321809,
      "learning_rate": 4.680915645236305e-05,
      "loss": 1.6948,
      "num_input_tokens_seen": 14535502000,
      "step": 18475
    },
    {
      "epoch": 1.9601103331211542,
      "grad_norm": 0.4132144418425689,
      "learning_rate": 4.680881670644582e-05,
      "loss": 1.6681,
      "num_input_tokens_seen": 14536288784,
      "step": 18476
    },
    {
      "epoch": 1.9602164226607255,
      "grad_norm": 0.4255201081044906,
      "learning_rate": 4.680847694367539e-05,
      "loss": 1.7169,
      "num_input_tokens_seen": 14537075584,
      "step": 18477
    },
    {
      "epoch": 1.960322512200297,
      "grad_norm": 0.3877489921119171,
      "learning_rate": 4.680813716405199e-05,
      "loss": 1.8436,
      "num_input_tokens_seen": 14537862384,
      "step": 18478
    },
    {
      "epoch": 1.9604286017398684,
      "grad_norm": 0.5235721911632711,
      "learning_rate": 4.680779736757591e-05,
      "loss": 1.8851,
      "num_input_tokens_seen": 14538649056,
      "step": 18479
    },
    {
      "epoch": 1.96053469127944,
      "grad_norm": 0.39856835704939714,
      "learning_rate": 4.680745755424741e-05,
      "loss": 1.7584,
      "num_input_tokens_seen": 14539435808,
      "step": 18480
    },
    {
      "epoch": 1.9606407808190114,
      "grad_norm": 0.4159343021169933,
      "learning_rate": 4.680711772406674e-05,
      "loss": 1.7044,
      "num_input_tokens_seen": 14540222624,
      "step": 18481
    },
    {
      "epoch": 1.9607468703585826,
      "grad_norm": 0.3363683067457112,
      "learning_rate": 4.6806777877034174e-05,
      "loss": 1.7196,
      "num_input_tokens_seen": 14541009376,
      "step": 18482
    },
    {
      "epoch": 1.960852959898154,
      "grad_norm": 0.427887860054223,
      "learning_rate": 4.6806438013149967e-05,
      "loss": 1.7024,
      "num_input_tokens_seen": 14541796064,
      "step": 18483
    },
    {
      "epoch": 1.9609590494377254,
      "grad_norm": 0.36560140390556617,
      "learning_rate": 4.680609813241439e-05,
      "loss": 1.7081,
      "num_input_tokens_seen": 14542582688,
      "step": 18484
    },
    {
      "epoch": 1.9610651389772968,
      "grad_norm": 0.3821337958661443,
      "learning_rate": 4.680575823482769e-05,
      "loss": 1.6963,
      "num_input_tokens_seen": 14543369520,
      "step": 18485
    },
    {
      "epoch": 1.9611712285168683,
      "grad_norm": 0.4454940722759532,
      "learning_rate": 4.680541832039015e-05,
      "loss": 1.8532,
      "num_input_tokens_seen": 14544156304,
      "step": 18486
    },
    {
      "epoch": 1.9612773180564398,
      "grad_norm": 0.3665849499926774,
      "learning_rate": 4.680507838910201e-05,
      "loss": 1.6943,
      "num_input_tokens_seen": 14544943088,
      "step": 18487
    },
    {
      "epoch": 1.961383407596011,
      "grad_norm": 0.396303824247034,
      "learning_rate": 4.6804738440963557e-05,
      "loss": 1.7892,
      "num_input_tokens_seen": 14545729808,
      "step": 18488
    },
    {
      "epoch": 1.9614894971355823,
      "grad_norm": 0.32636279259408546,
      "learning_rate": 4.6804398475975037e-05,
      "loss": 1.7585,
      "num_input_tokens_seen": 14546516608,
      "step": 18489
    },
    {
      "epoch": 1.9615955866751538,
      "grad_norm": 0.3631598277183114,
      "learning_rate": 4.6804058494136714e-05,
      "loss": 1.8049,
      "num_input_tokens_seen": 14547303344,
      "step": 18490
    },
    {
      "epoch": 1.9617016762147252,
      "grad_norm": 0.3432480365518005,
      "learning_rate": 4.680371849544886e-05,
      "loss": 1.6805,
      "num_input_tokens_seen": 14548090112,
      "step": 18491
    },
    {
      "epoch": 1.9618077657542967,
      "grad_norm": 0.389460436258788,
      "learning_rate": 4.680337847991173e-05,
      "loss": 1.8222,
      "num_input_tokens_seen": 14548876864,
      "step": 18492
    },
    {
      "epoch": 1.961913855293868,
      "grad_norm": 0.33739577324738895,
      "learning_rate": 4.680303844752559e-05,
      "loss": 1.6265,
      "num_input_tokens_seen": 14549663680,
      "step": 18493
    },
    {
      "epoch": 1.9620199448334394,
      "grad_norm": 0.3986787203093151,
      "learning_rate": 4.68026983982907e-05,
      "loss": 1.6297,
      "num_input_tokens_seen": 14550450448,
      "step": 18494
    },
    {
      "epoch": 1.9621260343730107,
      "grad_norm": 0.3527855511466112,
      "learning_rate": 4.680235833220733e-05,
      "loss": 1.6055,
      "num_input_tokens_seen": 14551237120,
      "step": 18495
    },
    {
      "epoch": 1.9622321239125822,
      "grad_norm": 0.41796662732843604,
      "learning_rate": 4.680201824927574e-05,
      "loss": 1.7696,
      "num_input_tokens_seen": 14552023904,
      "step": 18496
    },
    {
      "epoch": 1.9623382134521536,
      "grad_norm": 0.4836536087717602,
      "learning_rate": 4.6801678149496175e-05,
      "loss": 1.7862,
      "num_input_tokens_seen": 14552810576,
      "step": 18497
    },
    {
      "epoch": 1.9624443029917251,
      "grad_norm": 0.43907389375126454,
      "learning_rate": 4.680133803286892e-05,
      "loss": 1.718,
      "num_input_tokens_seen": 14553597392,
      "step": 18498
    },
    {
      "epoch": 1.9625503925312964,
      "grad_norm": 0.5579880655921451,
      "learning_rate": 4.680099789939423e-05,
      "loss": 1.7648,
      "num_input_tokens_seen": 14554384160,
      "step": 18499
    },
    {
      "epoch": 1.9626564820708678,
      "grad_norm": 0.48772504588341015,
      "learning_rate": 4.680065774907238e-05,
      "loss": 1.7393,
      "num_input_tokens_seen": 14555170928,
      "step": 18500
    },
    {
      "epoch": 1.962762571610439,
      "grad_norm": 0.37054906838505036,
      "learning_rate": 4.6800317581903605e-05,
      "loss": 1.6359,
      "num_input_tokens_seen": 14555957760,
      "step": 18501
    },
    {
      "epoch": 1.9628686611500106,
      "grad_norm": 0.4002617313254038,
      "learning_rate": 4.679997739788819e-05,
      "loss": 1.7388,
      "num_input_tokens_seen": 14556744512,
      "step": 18502
    },
    {
      "epoch": 1.962974750689582,
      "grad_norm": 0.3608138546150817,
      "learning_rate": 4.679963719702639e-05,
      "loss": 1.7899,
      "num_input_tokens_seen": 14557531200,
      "step": 18503
    },
    {
      "epoch": 1.9630808402291535,
      "grad_norm": 0.38013646651088157,
      "learning_rate": 4.6799296979318474e-05,
      "loss": 1.7073,
      "num_input_tokens_seen": 14558317968,
      "step": 18504
    },
    {
      "epoch": 1.9631869297687248,
      "grad_norm": 0.34173069524508703,
      "learning_rate": 4.67989567447647e-05,
      "loss": 1.5769,
      "num_input_tokens_seen": 14559104752,
      "step": 18505
    },
    {
      "epoch": 1.9632930193082963,
      "grad_norm": 0.3710281647336047,
      "learning_rate": 4.679861649336533e-05,
      "loss": 1.6893,
      "num_input_tokens_seen": 14559891568,
      "step": 18506
    },
    {
      "epoch": 1.9633991088478675,
      "grad_norm": 0.353279427375676,
      "learning_rate": 4.679827622512063e-05,
      "loss": 1.7538,
      "num_input_tokens_seen": 14560678208,
      "step": 18507
    },
    {
      "epoch": 1.963505198387439,
      "grad_norm": 0.3779330312635068,
      "learning_rate": 4.679793594003086e-05,
      "loss": 1.7102,
      "num_input_tokens_seen": 14561464992,
      "step": 18508
    },
    {
      "epoch": 1.9636112879270105,
      "grad_norm": 0.47102778584413335,
      "learning_rate": 4.679759563809629e-05,
      "loss": 1.8449,
      "num_input_tokens_seen": 14562251728,
      "step": 18509
    },
    {
      "epoch": 1.963717377466582,
      "grad_norm": 0.37199051422004126,
      "learning_rate": 4.6797255319317174e-05,
      "loss": 1.7855,
      "num_input_tokens_seen": 14563038560,
      "step": 18510
    },
    {
      "epoch": 1.9638234670061532,
      "grad_norm": 0.4646055619212354,
      "learning_rate": 4.679691498369378e-05,
      "loss": 1.7144,
      "num_input_tokens_seen": 14563825280,
      "step": 18511
    },
    {
      "epoch": 1.9639295565457244,
      "grad_norm": 0.36052723871329984,
      "learning_rate": 4.679657463122636e-05,
      "loss": 1.7545,
      "num_input_tokens_seen": 14564612048,
      "step": 18512
    },
    {
      "epoch": 1.964035646085296,
      "grad_norm": 0.3650999048623507,
      "learning_rate": 4.679623426191521e-05,
      "loss": 1.7476,
      "num_input_tokens_seen": 14565398752,
      "step": 18513
    },
    {
      "epoch": 1.9641417356248674,
      "grad_norm": 0.3859794925802224,
      "learning_rate": 4.679589387576055e-05,
      "loss": 1.7418,
      "num_input_tokens_seen": 14566185424,
      "step": 18514
    },
    {
      "epoch": 1.9642478251644389,
      "grad_norm": 0.41260858337792716,
      "learning_rate": 4.6795553472762665e-05,
      "loss": 1.6836,
      "num_input_tokens_seen": 14566972160,
      "step": 18515
    },
    {
      "epoch": 1.9643539147040103,
      "grad_norm": 0.4009827991036459,
      "learning_rate": 4.679521305292182e-05,
      "loss": 1.7597,
      "num_input_tokens_seen": 14567758944,
      "step": 18516
    },
    {
      "epoch": 1.9644600042435816,
      "grad_norm": 0.37017131919527074,
      "learning_rate": 4.679487261623827e-05,
      "loss": 1.7091,
      "num_input_tokens_seen": 14568545680,
      "step": 18517
    },
    {
      "epoch": 1.9645660937831528,
      "grad_norm": 0.35957658407468085,
      "learning_rate": 4.6794532162712286e-05,
      "loss": 1.6764,
      "num_input_tokens_seen": 14569332384,
      "step": 18518
    },
    {
      "epoch": 1.9646721833227243,
      "grad_norm": 0.37481433998964553,
      "learning_rate": 4.6794191692344127e-05,
      "loss": 1.5743,
      "num_input_tokens_seen": 14570119152,
      "step": 18519
    },
    {
      "epoch": 1.9647782728622958,
      "grad_norm": 0.6591543680317853,
      "learning_rate": 4.679385120513405e-05,
      "loss": 1.626,
      "num_input_tokens_seen": 14570905936,
      "step": 18520
    },
    {
      "epoch": 1.9648843624018673,
      "grad_norm": 0.5672233409748413,
      "learning_rate": 4.679351070108233e-05,
      "loss": 1.7743,
      "num_input_tokens_seen": 14571692752,
      "step": 18521
    },
    {
      "epoch": 1.9649904519414387,
      "grad_norm": 0.7218203706976396,
      "learning_rate": 4.679317018018922e-05,
      "loss": 1.7427,
      "num_input_tokens_seen": 14572479568,
      "step": 18522
    },
    {
      "epoch": 1.96509654148101,
      "grad_norm": 0.35828691005945473,
      "learning_rate": 4.679282964245499e-05,
      "loss": 1.6675,
      "num_input_tokens_seen": 14573266288,
      "step": 18523
    },
    {
      "epoch": 1.9652026310205812,
      "grad_norm": 0.5751290956024795,
      "learning_rate": 4.679248908787991e-05,
      "loss": 1.6882,
      "num_input_tokens_seen": 14574053088,
      "step": 18524
    },
    {
      "epoch": 1.9653087205601527,
      "grad_norm": 0.3897438666387248,
      "learning_rate": 4.679214851646422e-05,
      "loss": 1.6809,
      "num_input_tokens_seen": 14574839808,
      "step": 18525
    },
    {
      "epoch": 1.9654148100997242,
      "grad_norm": 0.3647227410230753,
      "learning_rate": 4.67918079282082e-05,
      "loss": 1.649,
      "num_input_tokens_seen": 14575626592,
      "step": 18526
    },
    {
      "epoch": 1.9655208996392957,
      "grad_norm": 0.40130587625469427,
      "learning_rate": 4.679146732311211e-05,
      "loss": 1.8037,
      "num_input_tokens_seen": 14576413360,
      "step": 18527
    },
    {
      "epoch": 1.965626989178867,
      "grad_norm": 0.433278456144165,
      "learning_rate": 4.679112670117622e-05,
      "loss": 1.6748,
      "num_input_tokens_seen": 14577200144,
      "step": 18528
    },
    {
      "epoch": 1.9657330787184384,
      "grad_norm": 0.4046335402103304,
      "learning_rate": 4.679078606240078e-05,
      "loss": 1.7173,
      "num_input_tokens_seen": 14577986848,
      "step": 18529
    },
    {
      "epoch": 1.9658391682580096,
      "grad_norm": 0.36837294031642415,
      "learning_rate": 4.6790445406786063e-05,
      "loss": 1.6315,
      "num_input_tokens_seen": 14578773696,
      "step": 18530
    },
    {
      "epoch": 1.9659452577975811,
      "grad_norm": 0.34952706463302546,
      "learning_rate": 4.679010473433233e-05,
      "loss": 1.5679,
      "num_input_tokens_seen": 14579560416,
      "step": 18531
    },
    {
      "epoch": 1.9660513473371526,
      "grad_norm": 0.4778244816978759,
      "learning_rate": 4.6789764045039844e-05,
      "loss": 1.8232,
      "num_input_tokens_seen": 14580347184,
      "step": 18532
    },
    {
      "epoch": 1.966157436876724,
      "grad_norm": 0.3446275880121124,
      "learning_rate": 4.6789423338908866e-05,
      "loss": 1.7217,
      "num_input_tokens_seen": 14581133984,
      "step": 18533
    },
    {
      "epoch": 1.9662635264162953,
      "grad_norm": 0.3961154028474343,
      "learning_rate": 4.678908261593966e-05,
      "loss": 1.7028,
      "num_input_tokens_seen": 14581920848,
      "step": 18534
    },
    {
      "epoch": 1.9663696159558668,
      "grad_norm": 0.5405247252316144,
      "learning_rate": 4.6788741876132493e-05,
      "loss": 1.8961,
      "num_input_tokens_seen": 14582707504,
      "step": 18535
    },
    {
      "epoch": 1.966475705495438,
      "grad_norm": 0.3414537771561107,
      "learning_rate": 4.678840111948762e-05,
      "loss": 1.6118,
      "num_input_tokens_seen": 14583494272,
      "step": 18536
    },
    {
      "epoch": 1.9665817950350095,
      "grad_norm": 0.4691703454360868,
      "learning_rate": 4.678806034600531e-05,
      "loss": 1.6572,
      "num_input_tokens_seen": 14584281024,
      "step": 18537
    },
    {
      "epoch": 1.966687884574581,
      "grad_norm": 0.39559222024329904,
      "learning_rate": 4.678771955568584e-05,
      "loss": 1.7486,
      "num_input_tokens_seen": 14585067696,
      "step": 18538
    },
    {
      "epoch": 1.9667939741141525,
      "grad_norm": 0.4337037245226431,
      "learning_rate": 4.6787378748529445e-05,
      "loss": 1.6517,
      "num_input_tokens_seen": 14585854400,
      "step": 18539
    },
    {
      "epoch": 1.9669000636537237,
      "grad_norm": 0.40593331165667496,
      "learning_rate": 4.678703792453641e-05,
      "loss": 1.6951,
      "num_input_tokens_seen": 14586641120,
      "step": 18540
    },
    {
      "epoch": 1.9670061531932952,
      "grad_norm": 0.36106071648346827,
      "learning_rate": 4.678669708370699e-05,
      "loss": 1.6632,
      "num_input_tokens_seen": 14587427968,
      "step": 18541
    },
    {
      "epoch": 1.9671122427328664,
      "grad_norm": 0.4383533383944555,
      "learning_rate": 4.6786356226041445e-05,
      "loss": 1.7187,
      "num_input_tokens_seen": 14588214800,
      "step": 18542
    },
    {
      "epoch": 1.967218332272438,
      "grad_norm": 0.3764537770534544,
      "learning_rate": 4.678601535154005e-05,
      "loss": 1.7354,
      "num_input_tokens_seen": 14589001552,
      "step": 18543
    },
    {
      "epoch": 1.9673244218120094,
      "grad_norm": 0.3494173625564146,
      "learning_rate": 4.678567446020305e-05,
      "loss": 1.6169,
      "num_input_tokens_seen": 14589788464,
      "step": 18544
    },
    {
      "epoch": 1.9674305113515809,
      "grad_norm": 0.43461904880129565,
      "learning_rate": 4.678533355203073e-05,
      "loss": 1.8332,
      "num_input_tokens_seen": 14590575104,
      "step": 18545
    },
    {
      "epoch": 1.9675366008911521,
      "grad_norm": 0.46697119990925073,
      "learning_rate": 4.678499262702335e-05,
      "loss": 1.77,
      "num_input_tokens_seen": 14591361904,
      "step": 18546
    },
    {
      "epoch": 1.9676426904307234,
      "grad_norm": 0.39318911889000996,
      "learning_rate": 4.678465168518116e-05,
      "loss": 1.6613,
      "num_input_tokens_seen": 14592148736,
      "step": 18547
    },
    {
      "epoch": 1.9677487799702948,
      "grad_norm": 0.4798084315215559,
      "learning_rate": 4.678431072650442e-05,
      "loss": 1.6634,
      "num_input_tokens_seen": 14592935520,
      "step": 18548
    },
    {
      "epoch": 1.9678548695098663,
      "grad_norm": 0.40445460137297023,
      "learning_rate": 4.678396975099342e-05,
      "loss": 1.8292,
      "num_input_tokens_seen": 14593722288,
      "step": 18549
    },
    {
      "epoch": 1.9679609590494378,
      "grad_norm": 0.45259268391443697,
      "learning_rate": 4.6783628758648394e-05,
      "loss": 1.8714,
      "num_input_tokens_seen": 14594509008,
      "step": 18550
    },
    {
      "epoch": 1.9680670485890093,
      "grad_norm": 0.38142174110338284,
      "learning_rate": 4.6783287749469627e-05,
      "loss": 1.6304,
      "num_input_tokens_seen": 14595295760,
      "step": 18551
    },
    {
      "epoch": 1.9681731381285805,
      "grad_norm": 0.4359329480876505,
      "learning_rate": 4.6782946723457374e-05,
      "loss": 1.9496,
      "num_input_tokens_seen": 14596082560,
      "step": 18552
    },
    {
      "epoch": 1.9682792276681518,
      "grad_norm": 0.5154261523339617,
      "learning_rate": 4.6782605680611893e-05,
      "loss": 1.767,
      "num_input_tokens_seen": 14596869408,
      "step": 18553
    },
    {
      "epoch": 1.9683853172077233,
      "grad_norm": 0.39668715824901873,
      "learning_rate": 4.6782264620933456e-05,
      "loss": 1.6721,
      "num_input_tokens_seen": 14597656208,
      "step": 18554
    },
    {
      "epoch": 1.9684914067472947,
      "grad_norm": 0.3746399965328449,
      "learning_rate": 4.678192354442233e-05,
      "loss": 1.7313,
      "num_input_tokens_seen": 14598442960,
      "step": 18555
    },
    {
      "epoch": 1.9685974962868662,
      "grad_norm": 0.5222776397361161,
      "learning_rate": 4.6781582451078774e-05,
      "loss": 1.7349,
      "num_input_tokens_seen": 14599229680,
      "step": 18556
    },
    {
      "epoch": 1.9687035858264377,
      "grad_norm": 0.3511424304853267,
      "learning_rate": 4.678124134090304e-05,
      "loss": 1.6355,
      "num_input_tokens_seen": 14600016464,
      "step": 18557
    },
    {
      "epoch": 1.968809675366009,
      "grad_norm": 0.40696149139878596,
      "learning_rate": 4.678090021389541e-05,
      "loss": 1.6861,
      "num_input_tokens_seen": 14600803328,
      "step": 18558
    },
    {
      "epoch": 1.9689157649055802,
      "grad_norm": 0.473904743162727,
      "learning_rate": 4.678055907005613e-05,
      "loss": 1.7831,
      "num_input_tokens_seen": 14601590064,
      "step": 18559
    },
    {
      "epoch": 1.9690218544451517,
      "grad_norm": 0.3779250140807502,
      "learning_rate": 4.6780217909385485e-05,
      "loss": 1.7117,
      "num_input_tokens_seen": 14602376912,
      "step": 18560
    },
    {
      "epoch": 1.9691279439847231,
      "grad_norm": 0.37987211760409706,
      "learning_rate": 4.677987673188372e-05,
      "loss": 1.7083,
      "num_input_tokens_seen": 14603163712,
      "step": 18561
    },
    {
      "epoch": 1.9692340335242946,
      "grad_norm": 0.43887024282352055,
      "learning_rate": 4.67795355375511e-05,
      "loss": 1.7205,
      "num_input_tokens_seen": 14603950464,
      "step": 18562
    },
    {
      "epoch": 1.9693401230638659,
      "grad_norm": 0.445849894015749,
      "learning_rate": 4.67791943263879e-05,
      "loss": 1.8521,
      "num_input_tokens_seen": 14604737200,
      "step": 18563
    },
    {
      "epoch": 1.9694462126034373,
      "grad_norm": 0.42075884563654137,
      "learning_rate": 4.677885309839438e-05,
      "loss": 1.7473,
      "num_input_tokens_seen": 14605524000,
      "step": 18564
    },
    {
      "epoch": 1.9695523021430086,
      "grad_norm": 0.9260969812706668,
      "learning_rate": 4.67785118535708e-05,
      "loss": 1.8259,
      "num_input_tokens_seen": 14606310880,
      "step": 18565
    },
    {
      "epoch": 1.96965839168258,
      "grad_norm": 0.447723001331317,
      "learning_rate": 4.677817059191743e-05,
      "loss": 1.659,
      "num_input_tokens_seen": 14607097744,
      "step": 18566
    },
    {
      "epoch": 1.9697644812221515,
      "grad_norm": 0.9544716173751826,
      "learning_rate": 4.677782931343452e-05,
      "loss": 1.6128,
      "num_input_tokens_seen": 14607884464,
      "step": 18567
    },
    {
      "epoch": 1.969870570761723,
      "grad_norm": 0.4877027557994622,
      "learning_rate": 4.677748801812234e-05,
      "loss": 1.7574,
      "num_input_tokens_seen": 14608671168,
      "step": 18568
    },
    {
      "epoch": 1.9699766603012943,
      "grad_norm": 0.8352415375437419,
      "learning_rate": 4.677714670598116e-05,
      "loss": 1.7691,
      "num_input_tokens_seen": 14609457904,
      "step": 18569
    },
    {
      "epoch": 1.9700827498408657,
      "grad_norm": 0.42851990041095117,
      "learning_rate": 4.6776805377011244e-05,
      "loss": 1.6122,
      "num_input_tokens_seen": 14610244704,
      "step": 18570
    },
    {
      "epoch": 1.970188839380437,
      "grad_norm": 0.44863101345398304,
      "learning_rate": 4.677646403121285e-05,
      "loss": 1.7794,
      "num_input_tokens_seen": 14611031440,
      "step": 18571
    },
    {
      "epoch": 1.9702949289200085,
      "grad_norm": 0.5020263710020427,
      "learning_rate": 4.677612266858624e-05,
      "loss": 1.758,
      "num_input_tokens_seen": 14611818256,
      "step": 18572
    },
    {
      "epoch": 1.97040101845958,
      "grad_norm": 0.35787513484011246,
      "learning_rate": 4.677578128913169e-05,
      "loss": 1.6115,
      "num_input_tokens_seen": 14612605072,
      "step": 18573
    },
    {
      "epoch": 1.9705071079991514,
      "grad_norm": 0.5133689093965349,
      "learning_rate": 4.677543989284945e-05,
      "loss": 1.7277,
      "num_input_tokens_seen": 14613391856,
      "step": 18574
    },
    {
      "epoch": 1.9706131975387227,
      "grad_norm": 0.39445833744484987,
      "learning_rate": 4.677509847973979e-05,
      "loss": 1.7293,
      "num_input_tokens_seen": 14614178624,
      "step": 18575
    },
    {
      "epoch": 1.9707192870782941,
      "grad_norm": 0.4752669076002563,
      "learning_rate": 4.677475704980296e-05,
      "loss": 1.7791,
      "num_input_tokens_seen": 14614965424,
      "step": 18576
    },
    {
      "epoch": 1.9708253766178654,
      "grad_norm": 0.4467453428929315,
      "learning_rate": 4.677441560303926e-05,
      "loss": 1.7352,
      "num_input_tokens_seen": 14615752256,
      "step": 18577
    },
    {
      "epoch": 1.9709314661574369,
      "grad_norm": 0.41077590390876184,
      "learning_rate": 4.677407413944891e-05,
      "loss": 1.793,
      "num_input_tokens_seen": 14616539040,
      "step": 18578
    },
    {
      "epoch": 1.9710375556970083,
      "grad_norm": 0.3371247613251425,
      "learning_rate": 4.6773732659032206e-05,
      "loss": 1.6343,
      "num_input_tokens_seen": 14617325792,
      "step": 18579
    },
    {
      "epoch": 1.9711436452365798,
      "grad_norm": 0.5150770228821699,
      "learning_rate": 4.6773391161789395e-05,
      "loss": 1.7376,
      "num_input_tokens_seen": 14618112480,
      "step": 18580
    },
    {
      "epoch": 1.971249734776151,
      "grad_norm": 0.37027751805402764,
      "learning_rate": 4.677304964772074e-05,
      "loss": 1.758,
      "num_input_tokens_seen": 14618899264,
      "step": 18581
    },
    {
      "epoch": 1.9713558243157223,
      "grad_norm": 0.3682337480077658,
      "learning_rate": 4.677270811682653e-05,
      "loss": 1.637,
      "num_input_tokens_seen": 14619686160,
      "step": 18582
    },
    {
      "epoch": 1.9714619138552938,
      "grad_norm": 0.4796675825650293,
      "learning_rate": 4.6772366569107e-05,
      "loss": 1.7953,
      "num_input_tokens_seen": 14620472864,
      "step": 18583
    },
    {
      "epoch": 1.9715680033948653,
      "grad_norm": 0.39489713469005344,
      "learning_rate": 4.6772025004562425e-05,
      "loss": 1.7058,
      "num_input_tokens_seen": 14621259664,
      "step": 18584
    },
    {
      "epoch": 1.9716740929344367,
      "grad_norm": 0.42897118276100715,
      "learning_rate": 4.677168342319306e-05,
      "loss": 1.7321,
      "num_input_tokens_seen": 14622046496,
      "step": 18585
    },
    {
      "epoch": 1.9717801824740082,
      "grad_norm": 0.3706778982208665,
      "learning_rate": 4.6771341824999184e-05,
      "loss": 1.7136,
      "num_input_tokens_seen": 14622833184,
      "step": 18586
    },
    {
      "epoch": 1.9718862720135795,
      "grad_norm": 0.3846231253554813,
      "learning_rate": 4.677100020998105e-05,
      "loss": 1.6236,
      "num_input_tokens_seen": 14623620000,
      "step": 18587
    },
    {
      "epoch": 1.9719923615531507,
      "grad_norm": 0.6158711460566404,
      "learning_rate": 4.677065857813894e-05,
      "loss": 1.7664,
      "num_input_tokens_seen": 14624406720,
      "step": 18588
    },
    {
      "epoch": 1.9720984510927222,
      "grad_norm": 0.42917612018295953,
      "learning_rate": 4.6770316929473084e-05,
      "loss": 1.6745,
      "num_input_tokens_seen": 14625193488,
      "step": 18589
    },
    {
      "epoch": 1.9722045406322937,
      "grad_norm": 0.5733219010373566,
      "learning_rate": 4.676997526398378e-05,
      "loss": 1.795,
      "num_input_tokens_seen": 14625980304,
      "step": 18590
    },
    {
      "epoch": 1.9723106301718651,
      "grad_norm": 0.4373792331603934,
      "learning_rate": 4.676963358167127e-05,
      "loss": 1.784,
      "num_input_tokens_seen": 14626767104,
      "step": 18591
    },
    {
      "epoch": 1.9724167197114366,
      "grad_norm": 0.519684308284187,
      "learning_rate": 4.676929188253583e-05,
      "loss": 1.8445,
      "num_input_tokens_seen": 14627553936,
      "step": 18592
    },
    {
      "epoch": 1.9725228092510079,
      "grad_norm": 0.35617605878564473,
      "learning_rate": 4.676895016657772e-05,
      "loss": 1.7006,
      "num_input_tokens_seen": 14628340704,
      "step": 18593
    },
    {
      "epoch": 1.9726288987905791,
      "grad_norm": 0.49600069232837035,
      "learning_rate": 4.6768608433797204e-05,
      "loss": 1.759,
      "num_input_tokens_seen": 14629127472,
      "step": 18594
    },
    {
      "epoch": 1.9727349883301506,
      "grad_norm": 0.36318259998972696,
      "learning_rate": 4.676826668419454e-05,
      "loss": 1.6372,
      "num_input_tokens_seen": 14629914256,
      "step": 18595
    },
    {
      "epoch": 1.972841077869722,
      "grad_norm": 0.5473065911398569,
      "learning_rate": 4.676792491777e-05,
      "loss": 1.6807,
      "num_input_tokens_seen": 14630700976,
      "step": 18596
    },
    {
      "epoch": 1.9729471674092935,
      "grad_norm": 0.3877489649282887,
      "learning_rate": 4.676758313452385e-05,
      "loss": 1.7243,
      "num_input_tokens_seen": 14631487744,
      "step": 18597
    },
    {
      "epoch": 1.9730532569488648,
      "grad_norm": 0.5759443910112503,
      "learning_rate": 4.676724133445635e-05,
      "loss": 1.682,
      "num_input_tokens_seen": 14632274496,
      "step": 18598
    },
    {
      "epoch": 1.9731593464884363,
      "grad_norm": 0.4403078703070375,
      "learning_rate": 4.6766899517567765e-05,
      "loss": 1.6624,
      "num_input_tokens_seen": 14633061312,
      "step": 18599
    },
    {
      "epoch": 1.9732654360280075,
      "grad_norm": 0.4374756834450056,
      "learning_rate": 4.676655768385836e-05,
      "loss": 1.7077,
      "num_input_tokens_seen": 14633848096,
      "step": 18600
    },
    {
      "epoch": 1.973371525567579,
      "grad_norm": 0.39624634474152276,
      "learning_rate": 4.676621583332839e-05,
      "loss": 1.8529,
      "num_input_tokens_seen": 14634634832,
      "step": 18601
    },
    {
      "epoch": 1.9734776151071505,
      "grad_norm": 0.35056414951272297,
      "learning_rate": 4.676587396597814e-05,
      "loss": 1.6775,
      "num_input_tokens_seen": 14635421632,
      "step": 18602
    },
    {
      "epoch": 1.973583704646722,
      "grad_norm": 0.3592294845536236,
      "learning_rate": 4.676553208180785e-05,
      "loss": 1.6878,
      "num_input_tokens_seen": 14636208304,
      "step": 18603
    },
    {
      "epoch": 1.9736897941862932,
      "grad_norm": 0.3584451556936786,
      "learning_rate": 4.67651901808178e-05,
      "loss": 1.6798,
      "num_input_tokens_seen": 14636995200,
      "step": 18604
    },
    {
      "epoch": 1.9737958837258647,
      "grad_norm": 0.33870014830071166,
      "learning_rate": 4.6764848263008244e-05,
      "loss": 1.6014,
      "num_input_tokens_seen": 14637781968,
      "step": 18605
    },
    {
      "epoch": 1.973901973265436,
      "grad_norm": 0.3724618793843799,
      "learning_rate": 4.676450632837946e-05,
      "loss": 1.6946,
      "num_input_tokens_seen": 14638568800,
      "step": 18606
    },
    {
      "epoch": 1.9740080628050074,
      "grad_norm": 0.4377268212263788,
      "learning_rate": 4.6764164376931705e-05,
      "loss": 1.7631,
      "num_input_tokens_seen": 14639355568,
      "step": 18607
    },
    {
      "epoch": 1.9741141523445789,
      "grad_norm": 0.4554089748651158,
      "learning_rate": 4.6763822408665236e-05,
      "loss": 1.8115,
      "num_input_tokens_seen": 14640142240,
      "step": 18608
    },
    {
      "epoch": 1.9742202418841504,
      "grad_norm": 0.35991769937338064,
      "learning_rate": 4.6763480423580325e-05,
      "loss": 1.6754,
      "num_input_tokens_seen": 14640929056,
      "step": 18609
    },
    {
      "epoch": 1.9743263314237216,
      "grad_norm": 0.37925019600360865,
      "learning_rate": 4.676313842167723e-05,
      "loss": 1.8238,
      "num_input_tokens_seen": 14641715776,
      "step": 18610
    },
    {
      "epoch": 1.9744324209632929,
      "grad_norm": 0.3648766011732126,
      "learning_rate": 4.6762796402956234e-05,
      "loss": 1.837,
      "num_input_tokens_seen": 14642502592,
      "step": 18611
    },
    {
      "epoch": 1.9745385105028643,
      "grad_norm": 0.3348144198810859,
      "learning_rate": 4.6762454367417575e-05,
      "loss": 1.7205,
      "num_input_tokens_seen": 14643289280,
      "step": 18612
    },
    {
      "epoch": 1.9746446000424358,
      "grad_norm": 0.35816542880076535,
      "learning_rate": 4.676211231506153e-05,
      "loss": 1.6764,
      "num_input_tokens_seen": 14644076080,
      "step": 18613
    },
    {
      "epoch": 1.9747506895820073,
      "grad_norm": 0.4071278254868477,
      "learning_rate": 4.6761770245888374e-05,
      "loss": 1.7686,
      "num_input_tokens_seen": 14644862848,
      "step": 18614
    },
    {
      "epoch": 1.9748567791215788,
      "grad_norm": 0.3589733849485565,
      "learning_rate": 4.676142815989836e-05,
      "loss": 1.6431,
      "num_input_tokens_seen": 14645649664,
      "step": 18615
    },
    {
      "epoch": 1.97496286866115,
      "grad_norm": 0.4428054361980339,
      "learning_rate": 4.676108605709174e-05,
      "loss": 1.6488,
      "num_input_tokens_seen": 14646436432,
      "step": 18616
    },
    {
      "epoch": 1.9750689582007213,
      "grad_norm": 0.37168168412816266,
      "learning_rate": 4.67607439374688e-05,
      "loss": 1.7578,
      "num_input_tokens_seen": 14647223152,
      "step": 18617
    },
    {
      "epoch": 1.9751750477402927,
      "grad_norm": 0.45856160461304873,
      "learning_rate": 4.676040180102979e-05,
      "loss": 1.7718,
      "num_input_tokens_seen": 14648009920,
      "step": 18618
    },
    {
      "epoch": 1.9752811372798642,
      "grad_norm": 0.3980228533710793,
      "learning_rate": 4.6760059647774986e-05,
      "loss": 1.7298,
      "num_input_tokens_seen": 14648796672,
      "step": 18619
    },
    {
      "epoch": 1.9753872268194357,
      "grad_norm": 0.45012959376946515,
      "learning_rate": 4.6759717477704646e-05,
      "loss": 1.8144,
      "num_input_tokens_seen": 14649583472,
      "step": 18620
    },
    {
      "epoch": 1.9754933163590072,
      "grad_norm": 0.44349441467333467,
      "learning_rate": 4.675937529081903e-05,
      "loss": 1.8492,
      "num_input_tokens_seen": 14650370288,
      "step": 18621
    },
    {
      "epoch": 1.9755994058985784,
      "grad_norm": 0.4255404234935087,
      "learning_rate": 4.675903308711841e-05,
      "loss": 1.655,
      "num_input_tokens_seen": 14651157136,
      "step": 18622
    },
    {
      "epoch": 1.9757054954381497,
      "grad_norm": 0.38403344886971963,
      "learning_rate": 4.675869086660305e-05,
      "loss": 1.7985,
      "num_input_tokens_seen": 14651943936,
      "step": 18623
    },
    {
      "epoch": 1.9758115849777211,
      "grad_norm": 0.5369672115332771,
      "learning_rate": 4.6758348629273205e-05,
      "loss": 1.7275,
      "num_input_tokens_seen": 14652730704,
      "step": 18624
    },
    {
      "epoch": 1.9759176745172926,
      "grad_norm": 0.5881478163393745,
      "learning_rate": 4.675800637512915e-05,
      "loss": 1.8005,
      "num_input_tokens_seen": 14653517488,
      "step": 18625
    },
    {
      "epoch": 1.976023764056864,
      "grad_norm": 0.42059962369568565,
      "learning_rate": 4.675766410417115e-05,
      "loss": 1.6088,
      "num_input_tokens_seen": 14654304288,
      "step": 18626
    },
    {
      "epoch": 1.9761298535964353,
      "grad_norm": 0.4098364357534772,
      "learning_rate": 4.675732181639947e-05,
      "loss": 1.7318,
      "num_input_tokens_seen": 14655091008,
      "step": 18627
    },
    {
      "epoch": 1.9762359431360068,
      "grad_norm": 0.4496143838456385,
      "learning_rate": 4.675697951181436e-05,
      "loss": 1.7768,
      "num_input_tokens_seen": 14655877744,
      "step": 18628
    },
    {
      "epoch": 1.976342032675578,
      "grad_norm": 0.3628850243696686,
      "learning_rate": 4.6756637190416097e-05,
      "loss": 1.7593,
      "num_input_tokens_seen": 14656664512,
      "step": 18629
    },
    {
      "epoch": 1.9764481222151495,
      "grad_norm": 0.3678795300785196,
      "learning_rate": 4.6756294852204946e-05,
      "loss": 1.854,
      "num_input_tokens_seen": 14657451312,
      "step": 18630
    },
    {
      "epoch": 1.976554211754721,
      "grad_norm": 0.3740189967794994,
      "learning_rate": 4.675595249718117e-05,
      "loss": 1.6299,
      "num_input_tokens_seen": 14658238112,
      "step": 18631
    },
    {
      "epoch": 1.9766603012942925,
      "grad_norm": 0.3894531041047886,
      "learning_rate": 4.6755610125345024e-05,
      "loss": 1.6644,
      "num_input_tokens_seen": 14659024816,
      "step": 18632
    },
    {
      "epoch": 1.9767663908338637,
      "grad_norm": 0.38534868045162807,
      "learning_rate": 4.675526773669678e-05,
      "loss": 1.8368,
      "num_input_tokens_seen": 14659811584,
      "step": 18633
    },
    {
      "epoch": 1.9768724803734352,
      "grad_norm": 0.40118441015523304,
      "learning_rate": 4.675492533123672e-05,
      "loss": 1.7899,
      "num_input_tokens_seen": 14660598288,
      "step": 18634
    },
    {
      "epoch": 1.9769785699130065,
      "grad_norm": 0.38766021147665514,
      "learning_rate": 4.6754582908965074e-05,
      "loss": 1.8422,
      "num_input_tokens_seen": 14661385088,
      "step": 18635
    },
    {
      "epoch": 1.977084659452578,
      "grad_norm": 0.40576207390013924,
      "learning_rate": 4.675424046988214e-05,
      "loss": 1.7041,
      "num_input_tokens_seen": 14662171952,
      "step": 18636
    },
    {
      "epoch": 1.9771907489921494,
      "grad_norm": 0.36711158377313974,
      "learning_rate": 4.6753898013988154e-05,
      "loss": 1.6849,
      "num_input_tokens_seen": 14662958752,
      "step": 18637
    },
    {
      "epoch": 1.977296838531721,
      "grad_norm": 0.3993191776538966,
      "learning_rate": 4.67535555412834e-05,
      "loss": 1.5975,
      "num_input_tokens_seen": 14663745536,
      "step": 18638
    },
    {
      "epoch": 1.9774029280712921,
      "grad_norm": 0.3805316467346562,
      "learning_rate": 4.6753213051768133e-05,
      "loss": 1.7479,
      "num_input_tokens_seen": 14664532288,
      "step": 18639
    },
    {
      "epoch": 1.9775090176108636,
      "grad_norm": 0.41159299820156303,
      "learning_rate": 4.675287054544263e-05,
      "loss": 1.6595,
      "num_input_tokens_seen": 14665319056,
      "step": 18640
    },
    {
      "epoch": 1.9776151071504349,
      "grad_norm": 0.3412266699149281,
      "learning_rate": 4.675252802230714e-05,
      "loss": 1.6511,
      "num_input_tokens_seen": 14666105824,
      "step": 18641
    },
    {
      "epoch": 1.9777211966900063,
      "grad_norm": 0.37047859641335734,
      "learning_rate": 4.6752185482361934e-05,
      "loss": 1.5144,
      "num_input_tokens_seen": 14666892592,
      "step": 18642
    },
    {
      "epoch": 1.9778272862295778,
      "grad_norm": 0.3772129414642794,
      "learning_rate": 4.675184292560728e-05,
      "loss": 1.7783,
      "num_input_tokens_seen": 14667679376,
      "step": 18643
    },
    {
      "epoch": 1.9779333757691493,
      "grad_norm": 0.4577471772486158,
      "learning_rate": 4.6751500352043435e-05,
      "loss": 1.7305,
      "num_input_tokens_seen": 14668466080,
      "step": 18644
    },
    {
      "epoch": 1.9780394653087205,
      "grad_norm": 0.3623555033617105,
      "learning_rate": 4.675115776167067e-05,
      "loss": 1.7252,
      "num_input_tokens_seen": 14669252800,
      "step": 18645
    },
    {
      "epoch": 1.9781455548482918,
      "grad_norm": 0.38132632736494476,
      "learning_rate": 4.6750815154489256e-05,
      "loss": 1.8543,
      "num_input_tokens_seen": 14670039520,
      "step": 18646
    },
    {
      "epoch": 1.9782516443878633,
      "grad_norm": 0.33905765314264036,
      "learning_rate": 4.675047253049945e-05,
      "loss": 1.6958,
      "num_input_tokens_seen": 14670826224,
      "step": 18647
    },
    {
      "epoch": 1.9783577339274347,
      "grad_norm": 0.34237395407721016,
      "learning_rate": 4.6750129889701504e-05,
      "loss": 1.6848,
      "num_input_tokens_seen": 14671612880,
      "step": 18648
    },
    {
      "epoch": 1.9784638234670062,
      "grad_norm": 0.3360737113937649,
      "learning_rate": 4.674978723209571e-05,
      "loss": 1.5981,
      "num_input_tokens_seen": 14672399712,
      "step": 18649
    },
    {
      "epoch": 1.9785699130065777,
      "grad_norm": 0.37622413916655073,
      "learning_rate": 4.674944455768231e-05,
      "loss": 1.7132,
      "num_input_tokens_seen": 14673186560,
      "step": 18650
    },
    {
      "epoch": 1.978676002546149,
      "grad_norm": 0.3470839622139426,
      "learning_rate": 4.674910186646158e-05,
      "loss": 1.578,
      "num_input_tokens_seen": 14673973328,
      "step": 18651
    },
    {
      "epoch": 1.9787820920857202,
      "grad_norm": 0.3227928699389383,
      "learning_rate": 4.674875915843379e-05,
      "loss": 1.6574,
      "num_input_tokens_seen": 14674760096,
      "step": 18652
    },
    {
      "epoch": 1.9788881816252917,
      "grad_norm": 0.38458032682363025,
      "learning_rate": 4.6748416433599186e-05,
      "loss": 1.8212,
      "num_input_tokens_seen": 14675546880,
      "step": 18653
    },
    {
      "epoch": 1.9789942711648632,
      "grad_norm": 0.31515638528693196,
      "learning_rate": 4.674807369195805e-05,
      "loss": 1.7262,
      "num_input_tokens_seen": 14676333568,
      "step": 18654
    },
    {
      "epoch": 1.9791003607044346,
      "grad_norm": 0.3383349644651457,
      "learning_rate": 4.674773093351063e-05,
      "loss": 1.7499,
      "num_input_tokens_seen": 14677120320,
      "step": 18655
    },
    {
      "epoch": 1.979206450244006,
      "grad_norm": 0.3140176493512027,
      "learning_rate": 4.674738815825721e-05,
      "loss": 1.6451,
      "num_input_tokens_seen": 14677907072,
      "step": 18656
    },
    {
      "epoch": 1.9793125397835774,
      "grad_norm": 0.3444415970160691,
      "learning_rate": 4.674704536619805e-05,
      "loss": 1.5621,
      "num_input_tokens_seen": 14678693904,
      "step": 18657
    },
    {
      "epoch": 1.9794186293231486,
      "grad_norm": 0.41493811050988694,
      "learning_rate": 4.6746702557333405e-05,
      "loss": 1.8703,
      "num_input_tokens_seen": 14679480624,
      "step": 18658
    },
    {
      "epoch": 1.97952471886272,
      "grad_norm": 0.39208887286593985,
      "learning_rate": 4.674635973166355e-05,
      "loss": 1.702,
      "num_input_tokens_seen": 14680267408,
      "step": 18659
    },
    {
      "epoch": 1.9796308084022916,
      "grad_norm": 0.359592525009214,
      "learning_rate": 4.674601688918875e-05,
      "loss": 1.8088,
      "num_input_tokens_seen": 14681054144,
      "step": 18660
    },
    {
      "epoch": 1.979736897941863,
      "grad_norm": 0.31613941132292506,
      "learning_rate": 4.674567402990926e-05,
      "loss": 1.5705,
      "num_input_tokens_seen": 14681840944,
      "step": 18661
    },
    {
      "epoch": 1.9798429874814343,
      "grad_norm": 0.5174517827614583,
      "learning_rate": 4.674533115382535e-05,
      "loss": 1.8082,
      "num_input_tokens_seen": 14682627632,
      "step": 18662
    },
    {
      "epoch": 1.9799490770210058,
      "grad_norm": 0.3697852774263635,
      "learning_rate": 4.674498826093729e-05,
      "loss": 1.7359,
      "num_input_tokens_seen": 14683414336,
      "step": 18663
    },
    {
      "epoch": 1.980055166560577,
      "grad_norm": 0.5804207540158773,
      "learning_rate": 4.6744645351245335e-05,
      "loss": 1.63,
      "num_input_tokens_seen": 14684201152,
      "step": 18664
    },
    {
      "epoch": 1.9801612561001485,
      "grad_norm": 0.4111054909554261,
      "learning_rate": 4.6744302424749765e-05,
      "loss": 1.7457,
      "num_input_tokens_seen": 14684987936,
      "step": 18665
    },
    {
      "epoch": 1.98026734563972,
      "grad_norm": 0.5355720575371805,
      "learning_rate": 4.674395948145083e-05,
      "loss": 1.7841,
      "num_input_tokens_seen": 14685774688,
      "step": 18666
    },
    {
      "epoch": 1.9803734351792914,
      "grad_norm": 0.47810760503991,
      "learning_rate": 4.674361652134881e-05,
      "loss": 1.6572,
      "num_input_tokens_seen": 14686561456,
      "step": 18667
    },
    {
      "epoch": 1.9804795247188627,
      "grad_norm": 0.4023537906488585,
      "learning_rate": 4.674327354444395e-05,
      "loss": 1.589,
      "num_input_tokens_seen": 14687348288,
      "step": 18668
    },
    {
      "epoch": 1.9805856142584342,
      "grad_norm": 0.6658445207546854,
      "learning_rate": 4.674293055073653e-05,
      "loss": 1.7755,
      "num_input_tokens_seen": 14688134992,
      "step": 18669
    },
    {
      "epoch": 1.9806917037980054,
      "grad_norm": 0.37116954055236184,
      "learning_rate": 4.674258754022681e-05,
      "loss": 1.7549,
      "num_input_tokens_seen": 14688921648,
      "step": 18670
    },
    {
      "epoch": 1.9807977933375769,
      "grad_norm": 0.820136555262286,
      "learning_rate": 4.6742244512915056e-05,
      "loss": 1.7514,
      "num_input_tokens_seen": 14689708448,
      "step": 18671
    },
    {
      "epoch": 1.9809038828771484,
      "grad_norm": 0.4317403332381647,
      "learning_rate": 4.674190146880154e-05,
      "loss": 1.7743,
      "num_input_tokens_seen": 14690495104,
      "step": 18672
    },
    {
      "epoch": 1.9810099724167198,
      "grad_norm": 0.4602382630229879,
      "learning_rate": 4.674155840788652e-05,
      "loss": 1.6131,
      "num_input_tokens_seen": 14691281856,
      "step": 18673
    },
    {
      "epoch": 1.981116061956291,
      "grad_norm": 0.7245283960451471,
      "learning_rate": 4.674121533017025e-05,
      "loss": 1.6713,
      "num_input_tokens_seen": 14692068544,
      "step": 18674
    },
    {
      "epoch": 1.9812221514958626,
      "grad_norm": 0.42255745571033576,
      "learning_rate": 4.6740872235653024e-05,
      "loss": 1.665,
      "num_input_tokens_seen": 14692855408,
      "step": 18675
    },
    {
      "epoch": 1.9813282410354338,
      "grad_norm": 0.5827612050443168,
      "learning_rate": 4.6740529124335075e-05,
      "loss": 1.645,
      "num_input_tokens_seen": 14693642128,
      "step": 18676
    },
    {
      "epoch": 1.9814343305750053,
      "grad_norm": 0.5597128086077294,
      "learning_rate": 4.674018599621669e-05,
      "loss": 1.6,
      "num_input_tokens_seen": 14694429008,
      "step": 18677
    },
    {
      "epoch": 1.9815404201145768,
      "grad_norm": 0.47555798942715216,
      "learning_rate": 4.673984285129812e-05,
      "loss": 1.6945,
      "num_input_tokens_seen": 14695215824,
      "step": 18678
    },
    {
      "epoch": 1.9816465096541482,
      "grad_norm": 0.5012439016029521,
      "learning_rate": 4.6739499689579645e-05,
      "loss": 1.614,
      "num_input_tokens_seen": 14696002624,
      "step": 18679
    },
    {
      "epoch": 1.9817525991937195,
      "grad_norm": 0.4391514572239059,
      "learning_rate": 4.6739156511061524e-05,
      "loss": 1.6497,
      "num_input_tokens_seen": 14696789488,
      "step": 18680
    },
    {
      "epoch": 1.9818586887332907,
      "grad_norm": 0.41571392816195674,
      "learning_rate": 4.673881331574401e-05,
      "loss": 1.7302,
      "num_input_tokens_seen": 14697576272,
      "step": 18681
    },
    {
      "epoch": 1.9819647782728622,
      "grad_norm": 0.42449933537003076,
      "learning_rate": 4.673847010362739e-05,
      "loss": 1.7709,
      "num_input_tokens_seen": 14698363040,
      "step": 18682
    },
    {
      "epoch": 1.9820708678124337,
      "grad_norm": 0.4284704118479894,
      "learning_rate": 4.673812687471192e-05,
      "loss": 1.6457,
      "num_input_tokens_seen": 14699149808,
      "step": 18683
    },
    {
      "epoch": 1.9821769573520052,
      "grad_norm": 0.3890951414445364,
      "learning_rate": 4.6737783628997856e-05,
      "loss": 1.6672,
      "num_input_tokens_seen": 14699936592,
      "step": 18684
    },
    {
      "epoch": 1.9822830468915766,
      "grad_norm": 0.4585363913016186,
      "learning_rate": 4.673744036648547e-05,
      "loss": 1.683,
      "num_input_tokens_seen": 14700723344,
      "step": 18685
    },
    {
      "epoch": 1.982389136431148,
      "grad_norm": 0.3246050809706725,
      "learning_rate": 4.673709708717503e-05,
      "loss": 1.54,
      "num_input_tokens_seen": 14701510064,
      "step": 18686
    },
    {
      "epoch": 1.9824952259707191,
      "grad_norm": 0.3595592190399154,
      "learning_rate": 4.67367537910668e-05,
      "loss": 1.7726,
      "num_input_tokens_seen": 14702296848,
      "step": 18687
    },
    {
      "epoch": 1.9826013155102906,
      "grad_norm": 0.3976228057038975,
      "learning_rate": 4.673641047816104e-05,
      "loss": 1.7311,
      "num_input_tokens_seen": 14703083568,
      "step": 18688
    },
    {
      "epoch": 1.982707405049862,
      "grad_norm": 0.37096952805587474,
      "learning_rate": 4.6736067148458026e-05,
      "loss": 1.606,
      "num_input_tokens_seen": 14703870352,
      "step": 18689
    },
    {
      "epoch": 1.9828134945894336,
      "grad_norm": 0.32933892422827016,
      "learning_rate": 4.673572380195802e-05,
      "loss": 1.7106,
      "num_input_tokens_seen": 14704657056,
      "step": 18690
    },
    {
      "epoch": 1.982919584129005,
      "grad_norm": 0.3622621152692089,
      "learning_rate": 4.673538043866127e-05,
      "loss": 1.6924,
      "num_input_tokens_seen": 14705443808,
      "step": 18691
    },
    {
      "epoch": 1.9830256736685763,
      "grad_norm": 0.4362715217458846,
      "learning_rate": 4.6735037058568066e-05,
      "loss": 1.6979,
      "num_input_tokens_seen": 14706230656,
      "step": 18692
    },
    {
      "epoch": 1.9831317632081475,
      "grad_norm": 0.3348144697882092,
      "learning_rate": 4.6734693661678665e-05,
      "loss": 1.5946,
      "num_input_tokens_seen": 14707017392,
      "step": 18693
    },
    {
      "epoch": 1.983237852747719,
      "grad_norm": 0.3620141454708815,
      "learning_rate": 4.6734350247993325e-05,
      "loss": 1.7127,
      "num_input_tokens_seen": 14707804096,
      "step": 18694
    },
    {
      "epoch": 1.9833439422872905,
      "grad_norm": 0.42342037870773586,
      "learning_rate": 4.6734006817512324e-05,
      "loss": 1.8267,
      "num_input_tokens_seen": 14708590832,
      "step": 18695
    },
    {
      "epoch": 1.983450031826862,
      "grad_norm": 0.4250520252928079,
      "learning_rate": 4.6733663370235914e-05,
      "loss": 1.724,
      "num_input_tokens_seen": 14709377616,
      "step": 18696
    },
    {
      "epoch": 1.9835561213664332,
      "grad_norm": 0.4082812593865966,
      "learning_rate": 4.6733319906164365e-05,
      "loss": 1.5981,
      "num_input_tokens_seen": 14710164320,
      "step": 18697
    },
    {
      "epoch": 1.9836622109060047,
      "grad_norm": 0.44914755704500453,
      "learning_rate": 4.673297642529795e-05,
      "loss": 1.7374,
      "num_input_tokens_seen": 14710951040,
      "step": 18698
    },
    {
      "epoch": 1.983768300445576,
      "grad_norm": 0.3595264688369681,
      "learning_rate": 4.673263292763692e-05,
      "loss": 1.7883,
      "num_input_tokens_seen": 14711737872,
      "step": 18699
    },
    {
      "epoch": 1.9838743899851474,
      "grad_norm": 0.362085824623361,
      "learning_rate": 4.673228941318156e-05,
      "loss": 1.682,
      "num_input_tokens_seen": 14712524592,
      "step": 18700
    },
    {
      "epoch": 1.983980479524719,
      "grad_norm": 0.34947446261327086,
      "learning_rate": 4.6731945881932116e-05,
      "loss": 1.5933,
      "num_input_tokens_seen": 14713311456,
      "step": 18701
    },
    {
      "epoch": 1.9840865690642904,
      "grad_norm": 0.3635996084392059,
      "learning_rate": 4.6731602333888865e-05,
      "loss": 1.6981,
      "num_input_tokens_seen": 14714098240,
      "step": 18702
    },
    {
      "epoch": 1.9841926586038616,
      "grad_norm": 0.3155347715046556,
      "learning_rate": 4.673125876905207e-05,
      "loss": 1.6166,
      "num_input_tokens_seen": 14714885040,
      "step": 18703
    },
    {
      "epoch": 1.984298748143433,
      "grad_norm": 0.340235270451342,
      "learning_rate": 4.6730915187421995e-05,
      "loss": 1.6341,
      "num_input_tokens_seen": 14715671808,
      "step": 18704
    },
    {
      "epoch": 1.9844048376830044,
      "grad_norm": 0.34733960025650634,
      "learning_rate": 4.6730571588998905e-05,
      "loss": 1.6811,
      "num_input_tokens_seen": 14716458528,
      "step": 18705
    },
    {
      "epoch": 1.9845109272225758,
      "grad_norm": 0.3323158247522956,
      "learning_rate": 4.673022797378307e-05,
      "loss": 1.716,
      "num_input_tokens_seen": 14717245280,
      "step": 18706
    },
    {
      "epoch": 1.9846170167621473,
      "grad_norm": 0.3645174670134151,
      "learning_rate": 4.672988434177475e-05,
      "loss": 1.708,
      "num_input_tokens_seen": 14718032064,
      "step": 18707
    },
    {
      "epoch": 1.9847231063017188,
      "grad_norm": 0.35203887932518474,
      "learning_rate": 4.672954069297422e-05,
      "loss": 1.8327,
      "num_input_tokens_seen": 14718818720,
      "step": 18708
    },
    {
      "epoch": 1.98482919584129,
      "grad_norm": 0.3343997268917074,
      "learning_rate": 4.672919702738172e-05,
      "loss": 1.7613,
      "num_input_tokens_seen": 14719605536,
      "step": 18709
    },
    {
      "epoch": 1.9849352853808613,
      "grad_norm": 0.3442544793167146,
      "learning_rate": 4.672885334499755e-05,
      "loss": 1.7157,
      "num_input_tokens_seen": 14720392224,
      "step": 18710
    },
    {
      "epoch": 1.9850413749204328,
      "grad_norm": 0.34905519847482425,
      "learning_rate": 4.672850964582196e-05,
      "loss": 1.702,
      "num_input_tokens_seen": 14721178992,
      "step": 18711
    },
    {
      "epoch": 1.9851474644600042,
      "grad_norm": 0.3568822513843922,
      "learning_rate": 4.672816592985521e-05,
      "loss": 1.6255,
      "num_input_tokens_seen": 14721965712,
      "step": 18712
    },
    {
      "epoch": 1.9852535539995757,
      "grad_norm": 0.3315907329610661,
      "learning_rate": 4.672782219709757e-05,
      "loss": 1.7738,
      "num_input_tokens_seen": 14722752480,
      "step": 18713
    },
    {
      "epoch": 1.9853596435391472,
      "grad_norm": 0.34736076124332554,
      "learning_rate": 4.672747844754931e-05,
      "loss": 1.6258,
      "num_input_tokens_seen": 14723539280,
      "step": 18714
    },
    {
      "epoch": 1.9854657330787184,
      "grad_norm": 0.31731977195232247,
      "learning_rate": 4.672713468121069e-05,
      "loss": 1.7186,
      "num_input_tokens_seen": 14724325968,
      "step": 18715
    },
    {
      "epoch": 1.9855718226182897,
      "grad_norm": 0.3448354174451482,
      "learning_rate": 4.672679089808198e-05,
      "loss": 1.6975,
      "num_input_tokens_seen": 14725112736,
      "step": 18716
    },
    {
      "epoch": 1.9856779121578612,
      "grad_norm": 0.3340215445910052,
      "learning_rate": 4.672644709816344e-05,
      "loss": 1.7449,
      "num_input_tokens_seen": 14725899536,
      "step": 18717
    },
    {
      "epoch": 1.9857840016974326,
      "grad_norm": 0.3463296574176143,
      "learning_rate": 4.672610328145535e-05,
      "loss": 1.7986,
      "num_input_tokens_seen": 14726686272,
      "step": 18718
    },
    {
      "epoch": 1.985890091237004,
      "grad_norm": 0.31062380463187994,
      "learning_rate": 4.672575944795795e-05,
      "loss": 1.7821,
      "num_input_tokens_seen": 14727473024,
      "step": 18719
    },
    {
      "epoch": 1.9859961807765756,
      "grad_norm": 0.33831998098282823,
      "learning_rate": 4.672541559767153e-05,
      "loss": 1.688,
      "num_input_tokens_seen": 14728259760,
      "step": 18720
    },
    {
      "epoch": 1.9861022703161468,
      "grad_norm": 0.36952978453235846,
      "learning_rate": 4.6725071730596334e-05,
      "loss": 1.6866,
      "num_input_tokens_seen": 14729046624,
      "step": 18721
    },
    {
      "epoch": 1.986208359855718,
      "grad_norm": 0.3134079897583461,
      "learning_rate": 4.6724727846732654e-05,
      "loss": 1.6489,
      "num_input_tokens_seen": 14729833392,
      "step": 18722
    },
    {
      "epoch": 1.9863144493952896,
      "grad_norm": 0.3634645901934026,
      "learning_rate": 4.672438394608074e-05,
      "loss": 1.7769,
      "num_input_tokens_seen": 14730620160,
      "step": 18723
    },
    {
      "epoch": 1.986420538934861,
      "grad_norm": 0.320152417304529,
      "learning_rate": 4.672404002864086e-05,
      "loss": 1.7058,
      "num_input_tokens_seen": 14731406896,
      "step": 18724
    },
    {
      "epoch": 1.9865266284744325,
      "grad_norm": 0.3398221074888648,
      "learning_rate": 4.672369609441327e-05,
      "loss": 1.7263,
      "num_input_tokens_seen": 14732193584,
      "step": 18725
    },
    {
      "epoch": 1.986632718014004,
      "grad_norm": 0.34449104941719344,
      "learning_rate": 4.6723352143398256e-05,
      "loss": 1.6434,
      "num_input_tokens_seen": 14732980304,
      "step": 18726
    },
    {
      "epoch": 1.9867388075535752,
      "grad_norm": 0.3921054124723741,
      "learning_rate": 4.6723008175596064e-05,
      "loss": 1.7383,
      "num_input_tokens_seen": 14733766960,
      "step": 18727
    },
    {
      "epoch": 1.9868448970931465,
      "grad_norm": 0.33718337791024294,
      "learning_rate": 4.6722664191006974e-05,
      "loss": 1.7724,
      "num_input_tokens_seen": 14734553760,
      "step": 18728
    },
    {
      "epoch": 1.986950986632718,
      "grad_norm": 0.343554260483652,
      "learning_rate": 4.672232018963124e-05,
      "loss": 1.6231,
      "num_input_tokens_seen": 14735340592,
      "step": 18729
    },
    {
      "epoch": 1.9870570761722894,
      "grad_norm": 0.3754335790404448,
      "learning_rate": 4.672197617146914e-05,
      "loss": 1.8068,
      "num_input_tokens_seen": 14736127328,
      "step": 18730
    },
    {
      "epoch": 1.987163165711861,
      "grad_norm": 0.3590779600548197,
      "learning_rate": 4.672163213652093e-05,
      "loss": 1.6277,
      "num_input_tokens_seen": 14736914112,
      "step": 18731
    },
    {
      "epoch": 1.9872692552514322,
      "grad_norm": 0.38981373622035265,
      "learning_rate": 4.672128808478688e-05,
      "loss": 1.7917,
      "num_input_tokens_seen": 14737700912,
      "step": 18732
    },
    {
      "epoch": 1.9873753447910036,
      "grad_norm": 0.3725736949289621,
      "learning_rate": 4.672094401626726e-05,
      "loss": 1.705,
      "num_input_tokens_seen": 14738487632,
      "step": 18733
    },
    {
      "epoch": 1.987481434330575,
      "grad_norm": 0.34507351289547766,
      "learning_rate": 4.672059993096234e-05,
      "loss": 1.7491,
      "num_input_tokens_seen": 14739274432,
      "step": 18734
    },
    {
      "epoch": 1.9875875238701464,
      "grad_norm": 0.38291885210696547,
      "learning_rate": 4.672025582887237e-05,
      "loss": 1.6596,
      "num_input_tokens_seen": 14740061232,
      "step": 18735
    },
    {
      "epoch": 1.9876936134097178,
      "grad_norm": 0.3204252241425281,
      "learning_rate": 4.671991170999762e-05,
      "loss": 1.6785,
      "num_input_tokens_seen": 14740847968,
      "step": 18736
    },
    {
      "epoch": 1.9877997029492893,
      "grad_norm": 0.4094014921939632,
      "learning_rate": 4.671956757433836e-05,
      "loss": 1.6851,
      "num_input_tokens_seen": 14741634768,
      "step": 18737
    },
    {
      "epoch": 1.9879057924888606,
      "grad_norm": 0.3599271583023027,
      "learning_rate": 4.671922342189486e-05,
      "loss": 1.7593,
      "num_input_tokens_seen": 14742421424,
      "step": 18738
    },
    {
      "epoch": 1.988011882028432,
      "grad_norm": 0.3350116719562551,
      "learning_rate": 4.671887925266738e-05,
      "loss": 1.5935,
      "num_input_tokens_seen": 14743208256,
      "step": 18739
    },
    {
      "epoch": 1.9881179715680033,
      "grad_norm": 0.35735482292670934,
      "learning_rate": 4.671853506665618e-05,
      "loss": 1.7388,
      "num_input_tokens_seen": 14743995024,
      "step": 18740
    },
    {
      "epoch": 1.9882240611075748,
      "grad_norm": 0.36866062120052934,
      "learning_rate": 4.671819086386154e-05,
      "loss": 1.734,
      "num_input_tokens_seen": 14744781776,
      "step": 18741
    },
    {
      "epoch": 1.9883301506471462,
      "grad_norm": 0.3335047245381678,
      "learning_rate": 4.671784664428373e-05,
      "loss": 1.6464,
      "num_input_tokens_seen": 14745568544,
      "step": 18742
    },
    {
      "epoch": 1.9884362401867177,
      "grad_norm": 0.45034204917878284,
      "learning_rate": 4.671750240792298e-05,
      "loss": 1.8932,
      "num_input_tokens_seen": 14746355264,
      "step": 18743
    },
    {
      "epoch": 1.988542329726289,
      "grad_norm": 0.31949448127354557,
      "learning_rate": 4.67171581547796e-05,
      "loss": 1.7354,
      "num_input_tokens_seen": 14747142032,
      "step": 18744
    },
    {
      "epoch": 1.9886484192658602,
      "grad_norm": 0.3469315082438724,
      "learning_rate": 4.671681388485384e-05,
      "loss": 1.7072,
      "num_input_tokens_seen": 14747928800,
      "step": 18745
    },
    {
      "epoch": 1.9887545088054317,
      "grad_norm": 0.3548513842663384,
      "learning_rate": 4.671646959814595e-05,
      "loss": 1.6068,
      "num_input_tokens_seen": 14748715648,
      "step": 18746
    },
    {
      "epoch": 1.9888605983450032,
      "grad_norm": 0.3464405020052295,
      "learning_rate": 4.671612529465622e-05,
      "loss": 1.7707,
      "num_input_tokens_seen": 14749502432,
      "step": 18747
    },
    {
      "epoch": 1.9889666878845746,
      "grad_norm": 0.35633797704855213,
      "learning_rate": 4.6715780974384896e-05,
      "loss": 1.8336,
      "num_input_tokens_seen": 14750289168,
      "step": 18748
    },
    {
      "epoch": 1.9890727774241461,
      "grad_norm": 0.3550624032342092,
      "learning_rate": 4.6715436637332264e-05,
      "loss": 1.5748,
      "num_input_tokens_seen": 14751075984,
      "step": 18749
    },
    {
      "epoch": 1.9891788669637174,
      "grad_norm": 0.32994312156238154,
      "learning_rate": 4.6715092283498574e-05,
      "loss": 1.7077,
      "num_input_tokens_seen": 14751862736,
      "step": 18750
    },
    {
      "epoch": 1.9892849565032886,
      "grad_norm": 0.35982840617545947,
      "learning_rate": 4.67147479128841e-05,
      "loss": 1.6784,
      "num_input_tokens_seen": 14752649504,
      "step": 18751
    },
    {
      "epoch": 1.98939104604286,
      "grad_norm": 0.38165213765102673,
      "learning_rate": 4.6714403525489106e-05,
      "loss": 1.6148,
      "num_input_tokens_seen": 14753436304,
      "step": 18752
    },
    {
      "epoch": 1.9894971355824316,
      "grad_norm": 0.35386242484654207,
      "learning_rate": 4.6714059121313856e-05,
      "loss": 1.6292,
      "num_input_tokens_seen": 14754223088,
      "step": 18753
    },
    {
      "epoch": 1.989603225122003,
      "grad_norm": 0.37341255034852716,
      "learning_rate": 4.671371470035862e-05,
      "loss": 1.9388,
      "num_input_tokens_seen": 14755009840,
      "step": 18754
    },
    {
      "epoch": 1.9897093146615745,
      "grad_norm": 0.34470450397902724,
      "learning_rate": 4.671337026262366e-05,
      "loss": 1.7094,
      "num_input_tokens_seen": 14755796480,
      "step": 18755
    },
    {
      "epoch": 1.9898154042011458,
      "grad_norm": 0.40181788542636604,
      "learning_rate": 4.671302580810924e-05,
      "loss": 1.8793,
      "num_input_tokens_seen": 14756583184,
      "step": 18756
    },
    {
      "epoch": 1.989921493740717,
      "grad_norm": 0.3690412409850901,
      "learning_rate": 4.6712681336815644e-05,
      "loss": 1.7516,
      "num_input_tokens_seen": 14757369888,
      "step": 18757
    },
    {
      "epoch": 1.9900275832802885,
      "grad_norm": 0.3540304255240379,
      "learning_rate": 4.671233684874311e-05,
      "loss": 1.8014,
      "num_input_tokens_seen": 14758156688,
      "step": 18758
    },
    {
      "epoch": 1.99013367281986,
      "grad_norm": 0.38355383478547284,
      "learning_rate": 4.671199234389193e-05,
      "loss": 1.75,
      "num_input_tokens_seen": 14758943504,
      "step": 18759
    },
    {
      "epoch": 1.9902397623594315,
      "grad_norm": 0.3470881414583553,
      "learning_rate": 4.671164782226236e-05,
      "loss": 1.7577,
      "num_input_tokens_seen": 14759730288,
      "step": 18760
    },
    {
      "epoch": 1.9903458518990027,
      "grad_norm": 0.33830016710538724,
      "learning_rate": 4.6711303283854655e-05,
      "loss": 1.6015,
      "num_input_tokens_seen": 14760517104,
      "step": 18761
    },
    {
      "epoch": 1.9904519414385742,
      "grad_norm": 0.3625424025655969,
      "learning_rate": 4.6710958728669104e-05,
      "loss": 1.6812,
      "num_input_tokens_seen": 14761303824,
      "step": 18762
    },
    {
      "epoch": 1.9905580309781454,
      "grad_norm": 0.30949869376011496,
      "learning_rate": 4.671061415670596e-05,
      "loss": 1.635,
      "num_input_tokens_seen": 14762090608,
      "step": 18763
    },
    {
      "epoch": 1.990664120517717,
      "grad_norm": 0.3624432746494202,
      "learning_rate": 4.671026956796548e-05,
      "loss": 1.6639,
      "num_input_tokens_seen": 14762877392,
      "step": 18764
    },
    {
      "epoch": 1.9907702100572884,
      "grad_norm": 0.4012863485096656,
      "learning_rate": 4.6709924962447946e-05,
      "loss": 1.7198,
      "num_input_tokens_seen": 14763664192,
      "step": 18765
    },
    {
      "epoch": 1.9908762995968599,
      "grad_norm": 0.3671788311774549,
      "learning_rate": 4.670958034015362e-05,
      "loss": 1.8087,
      "num_input_tokens_seen": 14764451024,
      "step": 18766
    },
    {
      "epoch": 1.990982389136431,
      "grad_norm": 0.37979562589402444,
      "learning_rate": 4.670923570108277e-05,
      "loss": 1.7302,
      "num_input_tokens_seen": 14765237776,
      "step": 18767
    },
    {
      "epoch": 1.9910884786760026,
      "grad_norm": 0.37047020323369273,
      "learning_rate": 4.670889104523566e-05,
      "loss": 1.7014,
      "num_input_tokens_seen": 14766024496,
      "step": 18768
    },
    {
      "epoch": 1.9911945682155738,
      "grad_norm": 0.34887514891316856,
      "learning_rate": 4.670854637261255e-05,
      "loss": 1.6288,
      "num_input_tokens_seen": 14766811344,
      "step": 18769
    },
    {
      "epoch": 1.9913006577551453,
      "grad_norm": 0.3881622559008,
      "learning_rate": 4.6708201683213716e-05,
      "loss": 1.7491,
      "num_input_tokens_seen": 14767598096,
      "step": 18770
    },
    {
      "epoch": 1.9914067472947168,
      "grad_norm": 0.3947240639758663,
      "learning_rate": 4.670785697703942e-05,
      "loss": 1.8083,
      "num_input_tokens_seen": 14768384880,
      "step": 18771
    },
    {
      "epoch": 1.9915128368342883,
      "grad_norm": 0.4195055934668886,
      "learning_rate": 4.670751225408993e-05,
      "loss": 1.7296,
      "num_input_tokens_seen": 14769171536,
      "step": 18772
    },
    {
      "epoch": 1.9916189263738595,
      "grad_norm": 0.30463554146248617,
      "learning_rate": 4.6707167514365516e-05,
      "loss": 1.5115,
      "num_input_tokens_seen": 14769958352,
      "step": 18773
    },
    {
      "epoch": 1.991725015913431,
      "grad_norm": 0.3886623825733918,
      "learning_rate": 4.670682275786643e-05,
      "loss": 1.7969,
      "num_input_tokens_seen": 14770745024,
      "step": 18774
    },
    {
      "epoch": 1.9918311054530022,
      "grad_norm": 0.374529286608464,
      "learning_rate": 4.670647798459295e-05,
      "loss": 1.7576,
      "num_input_tokens_seen": 14771531808,
      "step": 18775
    },
    {
      "epoch": 1.9919371949925737,
      "grad_norm": 0.389031085875627,
      "learning_rate": 4.670613319454534e-05,
      "loss": 1.718,
      "num_input_tokens_seen": 14772318592,
      "step": 18776
    },
    {
      "epoch": 1.9920432845321452,
      "grad_norm": 0.3261119391173429,
      "learning_rate": 4.670578838772387e-05,
      "loss": 1.6189,
      "num_input_tokens_seen": 14773105424,
      "step": 18777
    },
    {
      "epoch": 1.9921493740717167,
      "grad_norm": 0.4396336704266564,
      "learning_rate": 4.670544356412881e-05,
      "loss": 1.7566,
      "num_input_tokens_seen": 14773892128,
      "step": 18778
    },
    {
      "epoch": 1.992255463611288,
      "grad_norm": 0.3234324593365301,
      "learning_rate": 4.670509872376041e-05,
      "loss": 1.5699,
      "num_input_tokens_seen": 14774678960,
      "step": 18779
    },
    {
      "epoch": 1.9923615531508592,
      "grad_norm": 0.4275477454190133,
      "learning_rate": 4.6704753866618956e-05,
      "loss": 1.7508,
      "num_input_tokens_seen": 14775465776,
      "step": 18780
    },
    {
      "epoch": 1.9924676426904306,
      "grad_norm": 0.34787777603940595,
      "learning_rate": 4.670440899270469e-05,
      "loss": 1.6907,
      "num_input_tokens_seen": 14776252496,
      "step": 18781
    },
    {
      "epoch": 1.9925737322300021,
      "grad_norm": 0.4053050434143543,
      "learning_rate": 4.670406410201791e-05,
      "loss": 1.7984,
      "num_input_tokens_seen": 14777039264,
      "step": 18782
    },
    {
      "epoch": 1.9926798217695736,
      "grad_norm": 0.37050374424939025,
      "learning_rate": 4.670371919455886e-05,
      "loss": 1.7866,
      "num_input_tokens_seen": 14777826016,
      "step": 18783
    },
    {
      "epoch": 1.992785911309145,
      "grad_norm": 0.33030133453792754,
      "learning_rate": 4.6703374270327814e-05,
      "loss": 1.6918,
      "num_input_tokens_seen": 14778612768,
      "step": 18784
    },
    {
      "epoch": 1.9928920008487163,
      "grad_norm": 0.45951679140678015,
      "learning_rate": 4.670302932932503e-05,
      "loss": 1.5913,
      "num_input_tokens_seen": 14779399520,
      "step": 18785
    },
    {
      "epoch": 1.9929980903882876,
      "grad_norm": 0.40957242046220016,
      "learning_rate": 4.6702684371550784e-05,
      "loss": 1.7976,
      "num_input_tokens_seen": 14780186224,
      "step": 18786
    },
    {
      "epoch": 1.993104179927859,
      "grad_norm": 0.39872179540731506,
      "learning_rate": 4.670233939700535e-05,
      "loss": 1.7661,
      "num_input_tokens_seen": 14780972992,
      "step": 18787
    },
    {
      "epoch": 1.9932102694674305,
      "grad_norm": 0.3505386638532105,
      "learning_rate": 4.6701994405688976e-05,
      "loss": 1.8381,
      "num_input_tokens_seen": 14781759744,
      "step": 18788
    },
    {
      "epoch": 1.993316359007002,
      "grad_norm": 0.34814744079595167,
      "learning_rate": 4.670164939760194e-05,
      "loss": 1.6427,
      "num_input_tokens_seen": 14782546416,
      "step": 18789
    },
    {
      "epoch": 1.9934224485465735,
      "grad_norm": 0.5779572501172321,
      "learning_rate": 4.670130437274451e-05,
      "loss": 1.6738,
      "num_input_tokens_seen": 14783333152,
      "step": 18790
    },
    {
      "epoch": 1.9935285380861447,
      "grad_norm": 0.44259249969729614,
      "learning_rate": 4.670095933111694e-05,
      "loss": 1.688,
      "num_input_tokens_seen": 14784119856,
      "step": 18791
    },
    {
      "epoch": 1.993634627625716,
      "grad_norm": 0.6625402775488881,
      "learning_rate": 4.670061427271951e-05,
      "loss": 1.7425,
      "num_input_tokens_seen": 14784906656,
      "step": 18792
    },
    {
      "epoch": 1.9937407171652874,
      "grad_norm": 0.5188415475874715,
      "learning_rate": 4.6700269197552484e-05,
      "loss": 1.705,
      "num_input_tokens_seen": 14785693424,
      "step": 18793
    },
    {
      "epoch": 1.993846806704859,
      "grad_norm": 0.6136615562635349,
      "learning_rate": 4.669992410561612e-05,
      "loss": 1.806,
      "num_input_tokens_seen": 14786480064,
      "step": 18794
    },
    {
      "epoch": 1.9939528962444304,
      "grad_norm": 0.45807831341961835,
      "learning_rate": 4.66995789969107e-05,
      "loss": 1.7251,
      "num_input_tokens_seen": 14787266784,
      "step": 18795
    },
    {
      "epoch": 1.9940589857840016,
      "grad_norm": 0.5275348094675635,
      "learning_rate": 4.669923387143647e-05,
      "loss": 1.7941,
      "num_input_tokens_seen": 14788053472,
      "step": 18796
    },
    {
      "epoch": 1.9941650753235731,
      "grad_norm": 0.39058964644808725,
      "learning_rate": 4.6698888729193725e-05,
      "loss": 1.7121,
      "num_input_tokens_seen": 14788840144,
      "step": 18797
    },
    {
      "epoch": 1.9942711648631444,
      "grad_norm": 0.3881938155531179,
      "learning_rate": 4.6698543570182706e-05,
      "loss": 1.6208,
      "num_input_tokens_seen": 14789626912,
      "step": 18798
    },
    {
      "epoch": 1.9943772544027158,
      "grad_norm": 0.36499074488315925,
      "learning_rate": 4.6698198394403694e-05,
      "loss": 1.7722,
      "num_input_tokens_seen": 14790413744,
      "step": 18799
    },
    {
      "epoch": 1.9944833439422873,
      "grad_norm": 0.4140695710117423,
      "learning_rate": 4.669785320185695e-05,
      "loss": 1.8328,
      "num_input_tokens_seen": 14791200512,
      "step": 18800
    },
    {
      "epoch": 1.9945894334818588,
      "grad_norm": 0.380101440638852,
      "learning_rate": 4.6697507992542735e-05,
      "loss": 1.7514,
      "num_input_tokens_seen": 14791987360,
      "step": 18801
    },
    {
      "epoch": 1.99469552302143,
      "grad_norm": 0.37684364603569814,
      "learning_rate": 4.669716276646133e-05,
      "loss": 1.8629,
      "num_input_tokens_seen": 14792774112,
      "step": 18802
    },
    {
      "epoch": 1.9948016125610015,
      "grad_norm": 0.4090569765850366,
      "learning_rate": 4.669681752361299e-05,
      "loss": 1.6741,
      "num_input_tokens_seen": 14793560864,
      "step": 18803
    },
    {
      "epoch": 1.9949077021005728,
      "grad_norm": 0.37659117690995075,
      "learning_rate": 4.6696472263997983e-05,
      "loss": 1.773,
      "num_input_tokens_seen": 14794347616,
      "step": 18804
    },
    {
      "epoch": 1.9950137916401443,
      "grad_norm": 0.3641893974020269,
      "learning_rate": 4.6696126987616584e-05,
      "loss": 1.7602,
      "num_input_tokens_seen": 14795134368,
      "step": 18805
    },
    {
      "epoch": 1.9951198811797157,
      "grad_norm": 0.35402274261182426,
      "learning_rate": 4.6695781694469055e-05,
      "loss": 1.7535,
      "num_input_tokens_seen": 14795921120,
      "step": 18806
    },
    {
      "epoch": 1.9952259707192872,
      "grad_norm": 0.3786277021606689,
      "learning_rate": 4.669543638455566e-05,
      "loss": 1.6803,
      "num_input_tokens_seen": 14796707792,
      "step": 18807
    },
    {
      "epoch": 1.9953320602588585,
      "grad_norm": 0.39164353544381847,
      "learning_rate": 4.669509105787667e-05,
      "loss": 1.7088,
      "num_input_tokens_seen": 14797494640,
      "step": 18808
    },
    {
      "epoch": 1.99543814979843,
      "grad_norm": 0.3391000488914256,
      "learning_rate": 4.6694745714432354e-05,
      "loss": 1.7528,
      "num_input_tokens_seen": 14798281328,
      "step": 18809
    },
    {
      "epoch": 1.9955442393380012,
      "grad_norm": 0.33527705131485513,
      "learning_rate": 4.669440035422297e-05,
      "loss": 1.6663,
      "num_input_tokens_seen": 14799068064,
      "step": 18810
    },
    {
      "epoch": 1.9956503288775727,
      "grad_norm": 0.3986819402753438,
      "learning_rate": 4.6694054977248784e-05,
      "loss": 1.7451,
      "num_input_tokens_seen": 14799854720,
      "step": 18811
    },
    {
      "epoch": 1.9957564184171441,
      "grad_norm": 0.3370293239173385,
      "learning_rate": 4.669370958351008e-05,
      "loss": 1.6055,
      "num_input_tokens_seen": 14800641552,
      "step": 18812
    },
    {
      "epoch": 1.9958625079567156,
      "grad_norm": 0.36707922065914605,
      "learning_rate": 4.669336417300711e-05,
      "loss": 1.7947,
      "num_input_tokens_seen": 14801428320,
      "step": 18813
    },
    {
      "epoch": 1.9959685974962869,
      "grad_norm": 0.3729204242505418,
      "learning_rate": 4.6693018745740144e-05,
      "loss": 1.7911,
      "num_input_tokens_seen": 14802215168,
      "step": 18814
    },
    {
      "epoch": 1.996074687035858,
      "grad_norm": 0.4663980780740452,
      "learning_rate": 4.669267330170944e-05,
      "loss": 1.6835,
      "num_input_tokens_seen": 14803002064,
      "step": 18815
    },
    {
      "epoch": 1.9961807765754296,
      "grad_norm": 0.3712938564417775,
      "learning_rate": 4.6692327840915297e-05,
      "loss": 1.7377,
      "num_input_tokens_seen": 14803788832,
      "step": 18816
    },
    {
      "epoch": 1.996286866115001,
      "grad_norm": 0.38453311183223365,
      "learning_rate": 4.669198236335795e-05,
      "loss": 1.5787,
      "num_input_tokens_seen": 14804575616,
      "step": 18817
    },
    {
      "epoch": 1.9963929556545725,
      "grad_norm": 0.3735584482838595,
      "learning_rate": 4.669163686903766e-05,
      "loss": 1.79,
      "num_input_tokens_seen": 14805362368,
      "step": 18818
    },
    {
      "epoch": 1.996499045194144,
      "grad_norm": 0.4242535981057989,
      "learning_rate": 4.669129135795473e-05,
      "loss": 1.7398,
      "num_input_tokens_seen": 14806149088,
      "step": 18819
    },
    {
      "epoch": 1.9966051347337153,
      "grad_norm": 0.4114438029569791,
      "learning_rate": 4.669094583010939e-05,
      "loss": 1.841,
      "num_input_tokens_seen": 14806935904,
      "step": 18820
    },
    {
      "epoch": 1.9967112242732865,
      "grad_norm": 0.35850752904838157,
      "learning_rate": 4.669060028550193e-05,
      "loss": 1.794,
      "num_input_tokens_seen": 14807722608,
      "step": 18821
    },
    {
      "epoch": 1.996817313812858,
      "grad_norm": 0.3944431773774927,
      "learning_rate": 4.669025472413262e-05,
      "loss": 1.624,
      "num_input_tokens_seen": 14808509392,
      "step": 18822
    },
    {
      "epoch": 1.9969234033524295,
      "grad_norm": 0.3866520581813101,
      "learning_rate": 4.668990914600171e-05,
      "loss": 1.7818,
      "num_input_tokens_seen": 14809296176,
      "step": 18823
    },
    {
      "epoch": 1.997029492892001,
      "grad_norm": 0.41911722548075286,
      "learning_rate": 4.668956355110947e-05,
      "loss": 1.7811,
      "num_input_tokens_seen": 14810082944,
      "step": 18824
    },
    {
      "epoch": 1.9971355824315724,
      "grad_norm": 0.3450432871511683,
      "learning_rate": 4.6689217939456175e-05,
      "loss": 1.6666,
      "num_input_tokens_seen": 14810869696,
      "step": 18825
    },
    {
      "epoch": 1.9972416719711437,
      "grad_norm": 0.3604800935658434,
      "learning_rate": 4.6688872311042095e-05,
      "loss": 1.6623,
      "num_input_tokens_seen": 14811656512,
      "step": 18826
    },
    {
      "epoch": 1.997347761510715,
      "grad_norm": 0.33469695828696483,
      "learning_rate": 4.6688526665867484e-05,
      "loss": 1.6433,
      "num_input_tokens_seen": 14812443216,
      "step": 18827
    },
    {
      "epoch": 1.9974538510502864,
      "grad_norm": 0.42046836388034164,
      "learning_rate": 4.668818100393262e-05,
      "loss": 1.7365,
      "num_input_tokens_seen": 14813230016,
      "step": 18828
    },
    {
      "epoch": 1.9975599405898579,
      "grad_norm": 0.3906052773164711,
      "learning_rate": 4.668783532523776e-05,
      "loss": 1.7595,
      "num_input_tokens_seen": 14814016768,
      "step": 18829
    },
    {
      "epoch": 1.9976660301294293,
      "grad_norm": 0.3791930532391442,
      "learning_rate": 4.668748962978318e-05,
      "loss": 1.8117,
      "num_input_tokens_seen": 14814803552,
      "step": 18830
    },
    {
      "epoch": 1.9977721196690006,
      "grad_norm": 0.5507121565059063,
      "learning_rate": 4.668714391756914e-05,
      "loss": 1.8186,
      "num_input_tokens_seen": 14815590240,
      "step": 18831
    },
    {
      "epoch": 1.997878209208572,
      "grad_norm": 0.5414467849410491,
      "learning_rate": 4.668679818859593e-05,
      "loss": 1.8414,
      "num_input_tokens_seen": 14816377120,
      "step": 18832
    },
    {
      "epoch": 1.9979842987481433,
      "grad_norm": 0.42856245482433936,
      "learning_rate": 4.668645244286378e-05,
      "loss": 1.7106,
      "num_input_tokens_seen": 14817163904,
      "step": 18833
    },
    {
      "epoch": 1.9980903882877148,
      "grad_norm": 0.42194363723501177,
      "learning_rate": 4.668610668037298e-05,
      "loss": 1.751,
      "num_input_tokens_seen": 14817950752,
      "step": 18834
    },
    {
      "epoch": 1.9981964778272863,
      "grad_norm": 0.48740071413266833,
      "learning_rate": 4.668576090112379e-05,
      "loss": 1.7369,
      "num_input_tokens_seen": 14818737360,
      "step": 18835
    },
    {
      "epoch": 1.9983025673668577,
      "grad_norm": 0.3227703559813822,
      "learning_rate": 4.668541510511649e-05,
      "loss": 1.6797,
      "num_input_tokens_seen": 14819524096,
      "step": 18836
    },
    {
      "epoch": 1.998408656906429,
      "grad_norm": 0.47218518181654445,
      "learning_rate": 4.6685069292351334e-05,
      "loss": 1.6657,
      "num_input_tokens_seen": 14820310832,
      "step": 18837
    },
    {
      "epoch": 1.9985147464460005,
      "grad_norm": 0.47777897432451977,
      "learning_rate": 4.668472346282859e-05,
      "loss": 1.6773,
      "num_input_tokens_seen": 14821097632,
      "step": 18838
    },
    {
      "epoch": 1.9986208359855717,
      "grad_norm": 0.440907365886656,
      "learning_rate": 4.6684377616548527e-05,
      "loss": 1.7493,
      "num_input_tokens_seen": 14821884416,
      "step": 18839
    },
    {
      "epoch": 1.9987269255251432,
      "grad_norm": 0.43452199815526654,
      "learning_rate": 4.6684031753511417e-05,
      "loss": 1.5728,
      "num_input_tokens_seen": 14822671184,
      "step": 18840
    },
    {
      "epoch": 1.9988330150647147,
      "grad_norm": 0.38818060053316505,
      "learning_rate": 4.668368587371752e-05,
      "loss": 1.6544,
      "num_input_tokens_seen": 14823457952,
      "step": 18841
    },
    {
      "epoch": 1.9989391046042861,
      "grad_norm": 0.38527068628903977,
      "learning_rate": 4.6683339977167106e-05,
      "loss": 1.5398,
      "num_input_tokens_seen": 14824244752,
      "step": 18842
    },
    {
      "epoch": 1.9990451941438574,
      "grad_norm": 0.38981195162282517,
      "learning_rate": 4.6682994063860454e-05,
      "loss": 1.7622,
      "num_input_tokens_seen": 14825031472,
      "step": 18843
    },
    {
      "epoch": 1.9991512836834286,
      "grad_norm": 0.35345178169840535,
      "learning_rate": 4.668264813379781e-05,
      "loss": 1.6386,
      "num_input_tokens_seen": 14825818336,
      "step": 18844
    },
    {
      "epoch": 1.9992573732230001,
      "grad_norm": 0.378651903256195,
      "learning_rate": 4.668230218697945e-05,
      "loss": 1.5672,
      "num_input_tokens_seen": 14826605104,
      "step": 18845
    },
    {
      "epoch": 1.9993634627625716,
      "grad_norm": 0.42764958424457766,
      "learning_rate": 4.668195622340565e-05,
      "loss": 1.8098,
      "num_input_tokens_seen": 14827391824,
      "step": 18846
    },
    {
      "epoch": 1.999469552302143,
      "grad_norm": 0.40977600626081867,
      "learning_rate": 4.668161024307667e-05,
      "loss": 1.8524,
      "num_input_tokens_seen": 14828178624,
      "step": 18847
    },
    {
      "epoch": 1.9995756418417145,
      "grad_norm": 0.39105675476319646,
      "learning_rate": 4.668126424599277e-05,
      "loss": 1.7706,
      "num_input_tokens_seen": 14828965312,
      "step": 18848
    },
    {
      "epoch": 1.9996817313812858,
      "grad_norm": 0.37961645260623644,
      "learning_rate": 4.668091823215423e-05,
      "loss": 1.6925,
      "num_input_tokens_seen": 14829752048,
      "step": 18849
    },
    {
      "epoch": 1.999787820920857,
      "grad_norm": 0.3774973629580333,
      "learning_rate": 4.6680572201561314e-05,
      "loss": 1.7365,
      "num_input_tokens_seen": 14830538768,
      "step": 18850
    },
    {
      "epoch": 1.9998939104604285,
      "grad_norm": 0.4209797581292686,
      "learning_rate": 4.6680226154214286e-05,
      "loss": 1.7797,
      "num_input_tokens_seen": 14831325584,
      "step": 18851
    },
    {
      "epoch": 2.0,
      "grad_norm": 0.348834636570659,
      "learning_rate": 4.6679880090113415e-05,
      "loss": 1.8102,
      "num_input_tokens_seen": 14832112368,
      "step": 18852
    },
    {
      "epoch": 2.0001060895395715,
      "grad_norm": 0.4085169108266362,
      "learning_rate": 4.667953400925898e-05,
      "loss": 1.5731,
      "num_input_tokens_seen": 14832899120,
      "step": 18853
    },
    {
      "epoch": 2.000212179079143,
      "grad_norm": 0.3518114168289832,
      "learning_rate": 4.667918791165122e-05,
      "loss": 1.5662,
      "num_input_tokens_seen": 14833685936,
      "step": 18854
    },
    {
      "epoch": 2.000318268618714,
      "grad_norm": 0.4076749384618656,
      "learning_rate": 4.6678841797290426e-05,
      "loss": 1.5448,
      "num_input_tokens_seen": 14834472688,
      "step": 18855
    },
    {
      "epoch": 2.0004243581582855,
      "grad_norm": 0.35421752621324304,
      "learning_rate": 4.667849566617686e-05,
      "loss": 1.4397,
      "num_input_tokens_seen": 14835259488,
      "step": 18856
    },
    {
      "epoch": 2.000530447697857,
      "grad_norm": 0.4448331531298874,
      "learning_rate": 4.667814951831079e-05,
      "loss": 1.5226,
      "num_input_tokens_seen": 14836046240,
      "step": 18857
    },
    {
      "epoch": 2.0006365372374284,
      "grad_norm": 0.4156969785849662,
      "learning_rate": 4.6677803353692475e-05,
      "loss": 1.6201,
      "num_input_tokens_seen": 14836833136,
      "step": 18858
    },
    {
      "epoch": 2.000742626777,
      "grad_norm": 0.5006631405161289,
      "learning_rate": 4.6677457172322196e-05,
      "loss": 1.5415,
      "num_input_tokens_seen": 14837619904,
      "step": 18859
    },
    {
      "epoch": 2.0008487163165714,
      "grad_norm": 0.49825869449307386,
      "learning_rate": 4.6677110974200214e-05,
      "loss": 1.5766,
      "num_input_tokens_seen": 14838406640,
      "step": 18860
    },
    {
      "epoch": 2.0009548058561424,
      "grad_norm": 0.524226679059069,
      "learning_rate": 4.6676764759326794e-05,
      "loss": 1.5089,
      "num_input_tokens_seen": 14839193408,
      "step": 18861
    },
    {
      "epoch": 2.001060895395714,
      "grad_norm": 0.5421108283916254,
      "learning_rate": 4.667641852770221e-05,
      "loss": 1.4421,
      "num_input_tokens_seen": 14839980160,
      "step": 18862
    },
    {
      "epoch": 2.0011669849352853,
      "grad_norm": 0.47507622265585464,
      "learning_rate": 4.667607227932673e-05,
      "loss": 1.534,
      "num_input_tokens_seen": 14840766976,
      "step": 18863
    },
    {
      "epoch": 2.001273074474857,
      "grad_norm": 0.4718871019529142,
      "learning_rate": 4.6675726014200604e-05,
      "loss": 1.5871,
      "num_input_tokens_seen": 14841553776,
      "step": 18864
    },
    {
      "epoch": 2.0013791640144283,
      "grad_norm": 0.3756607227375317,
      "learning_rate": 4.667537973232412e-05,
      "loss": 1.6177,
      "num_input_tokens_seen": 14842340496,
      "step": 18865
    },
    {
      "epoch": 2.0014852535539998,
      "grad_norm": 0.38244484932165285,
      "learning_rate": 4.6675033433697545e-05,
      "loss": 1.6165,
      "num_input_tokens_seen": 14843127296,
      "step": 18866
    },
    {
      "epoch": 2.001591343093571,
      "grad_norm": 0.47846190455633536,
      "learning_rate": 4.667468711832113e-05,
      "loss": 1.6213,
      "num_input_tokens_seen": 14843914016,
      "step": 18867
    },
    {
      "epoch": 2.0016974326331423,
      "grad_norm": 0.39100839957796135,
      "learning_rate": 4.6674340786195156e-05,
      "loss": 1.5894,
      "num_input_tokens_seen": 14844700768,
      "step": 18868
    },
    {
      "epoch": 2.0018035221727137,
      "grad_norm": 0.39832372715445047,
      "learning_rate": 4.667399443731989e-05,
      "loss": 1.6982,
      "num_input_tokens_seen": 14845487472,
      "step": 18869
    },
    {
      "epoch": 2.001909611712285,
      "grad_norm": 0.49225312464524273,
      "learning_rate": 4.66736480716956e-05,
      "loss": 1.6921,
      "num_input_tokens_seen": 14846274128,
      "step": 18870
    },
    {
      "epoch": 2.0020157012518567,
      "grad_norm": 0.368168455932179,
      "learning_rate": 4.667330168932254e-05,
      "loss": 1.5592,
      "num_input_tokens_seen": 14847060912,
      "step": 18871
    },
    {
      "epoch": 2.002121790791428,
      "grad_norm": 0.4699438527059238,
      "learning_rate": 4.6672955290201e-05,
      "loss": 1.6465,
      "num_input_tokens_seen": 14847847712,
      "step": 18872
    },
    {
      "epoch": 2.002227880330999,
      "grad_norm": 0.3810726490084556,
      "learning_rate": 4.6672608874331226e-05,
      "loss": 1.6576,
      "num_input_tokens_seen": 14848634528,
      "step": 18873
    },
    {
      "epoch": 2.0023339698705707,
      "grad_norm": 0.4092657136694052,
      "learning_rate": 4.66722624417135e-05,
      "loss": 1.6272,
      "num_input_tokens_seen": 14849421344,
      "step": 18874
    },
    {
      "epoch": 2.002440059410142,
      "grad_norm": 0.37396413496953607,
      "learning_rate": 4.667191599234809e-05,
      "loss": 1.6203,
      "num_input_tokens_seen": 14850208128,
      "step": 18875
    },
    {
      "epoch": 2.0025461489497136,
      "grad_norm": 0.44159746922254706,
      "learning_rate": 4.6671569526235255e-05,
      "loss": 1.693,
      "num_input_tokens_seen": 14850994880,
      "step": 18876
    },
    {
      "epoch": 2.002652238489285,
      "grad_norm": 0.37263929171058746,
      "learning_rate": 4.667122304337527e-05,
      "loss": 1.7147,
      "num_input_tokens_seen": 14851781664,
      "step": 18877
    },
    {
      "epoch": 2.0027583280288566,
      "grad_norm": 0.31454545708707976,
      "learning_rate": 4.6670876543768394e-05,
      "loss": 1.5981,
      "num_input_tokens_seen": 14852568480,
      "step": 18878
    },
    {
      "epoch": 2.0028644175684276,
      "grad_norm": 0.37646372055300936,
      "learning_rate": 4.66705300274149e-05,
      "loss": 1.7491,
      "num_input_tokens_seen": 14853355296,
      "step": 18879
    },
    {
      "epoch": 2.002970507107999,
      "grad_norm": 0.37500117078543793,
      "learning_rate": 4.667018349431506e-05,
      "loss": 1.5605,
      "num_input_tokens_seen": 14854142176,
      "step": 18880
    },
    {
      "epoch": 2.0030765966475705,
      "grad_norm": 0.3788643848033808,
      "learning_rate": 4.6669836944469136e-05,
      "loss": 1.574,
      "num_input_tokens_seen": 14854928976,
      "step": 18881
    },
    {
      "epoch": 2.003182686187142,
      "grad_norm": 0.4347224884337708,
      "learning_rate": 4.66694903778774e-05,
      "loss": 1.4983,
      "num_input_tokens_seen": 14855715760,
      "step": 18882
    },
    {
      "epoch": 2.0032887757267135,
      "grad_norm": 0.5202938878972294,
      "learning_rate": 4.6669143794540114e-05,
      "loss": 1.4834,
      "num_input_tokens_seen": 14856502576,
      "step": 18883
    },
    {
      "epoch": 2.003394865266285,
      "grad_norm": 0.3480274674181924,
      "learning_rate": 4.6668797194457556e-05,
      "loss": 1.5516,
      "num_input_tokens_seen": 14857289344,
      "step": 18884
    },
    {
      "epoch": 2.003500954805856,
      "grad_norm": 0.3928124177403844,
      "learning_rate": 4.6668450577629984e-05,
      "loss": 1.5857,
      "num_input_tokens_seen": 14858076112,
      "step": 18885
    },
    {
      "epoch": 2.0036070443454275,
      "grad_norm": 0.4201572949994365,
      "learning_rate": 4.6668103944057674e-05,
      "loss": 1.5681,
      "num_input_tokens_seen": 14858862896,
      "step": 18886
    },
    {
      "epoch": 2.003713133884999,
      "grad_norm": 0.3620942564832567,
      "learning_rate": 4.666775729374088e-05,
      "loss": 1.5845,
      "num_input_tokens_seen": 14859649664,
      "step": 18887
    },
    {
      "epoch": 2.0038192234245704,
      "grad_norm": 0.5484651813162111,
      "learning_rate": 4.666741062667988e-05,
      "loss": 1.7153,
      "num_input_tokens_seen": 14860436432,
      "step": 18888
    },
    {
      "epoch": 2.003925312964142,
      "grad_norm": 0.3944749186308392,
      "learning_rate": 4.666706394287495e-05,
      "loss": 1.635,
      "num_input_tokens_seen": 14861223264,
      "step": 18889
    },
    {
      "epoch": 2.004031402503713,
      "grad_norm": 0.36023679741526843,
      "learning_rate": 4.666671724232634e-05,
      "loss": 1.5555,
      "num_input_tokens_seen": 14862009984,
      "step": 18890
    },
    {
      "epoch": 2.0041374920432844,
      "grad_norm": 0.3537911709482236,
      "learning_rate": 4.666637052503432e-05,
      "loss": 1.5284,
      "num_input_tokens_seen": 14862796800,
      "step": 18891
    },
    {
      "epoch": 2.004243581582856,
      "grad_norm": 0.4435983678233172,
      "learning_rate": 4.666602379099918e-05,
      "loss": 1.6022,
      "num_input_tokens_seen": 14863583696,
      "step": 18892
    },
    {
      "epoch": 2.0043496711224273,
      "grad_norm": 0.41298041749815106,
      "learning_rate": 4.666567704022117e-05,
      "loss": 1.6399,
      "num_input_tokens_seen": 14864370448,
      "step": 18893
    },
    {
      "epoch": 2.004455760661999,
      "grad_norm": 0.3770742353047089,
      "learning_rate": 4.6665330272700554e-05,
      "loss": 1.5143,
      "num_input_tokens_seen": 14865157248,
      "step": 18894
    },
    {
      "epoch": 2.0045618502015703,
      "grad_norm": 0.39130939204394205,
      "learning_rate": 4.666498348843761e-05,
      "loss": 1.6157,
      "num_input_tokens_seen": 14865944032,
      "step": 18895
    },
    {
      "epoch": 2.0046679397411413,
      "grad_norm": 0.4183946796497505,
      "learning_rate": 4.66646366874326e-05,
      "loss": 1.7523,
      "num_input_tokens_seen": 14866730800,
      "step": 18896
    },
    {
      "epoch": 2.004774029280713,
      "grad_norm": 0.42235736008207386,
      "learning_rate": 4.6664289869685796e-05,
      "loss": 1.7206,
      "num_input_tokens_seen": 14867517520,
      "step": 18897
    },
    {
      "epoch": 2.0048801188202843,
      "grad_norm": 0.49388545242715265,
      "learning_rate": 4.666394303519747e-05,
      "loss": 1.6036,
      "num_input_tokens_seen": 14868304416,
      "step": 18898
    },
    {
      "epoch": 2.0049862083598557,
      "grad_norm": 0.35948767039739543,
      "learning_rate": 4.666359618396787e-05,
      "loss": 1.5095,
      "num_input_tokens_seen": 14869091328,
      "step": 18899
    },
    {
      "epoch": 2.0050922978994272,
      "grad_norm": 0.45779921610089935,
      "learning_rate": 4.6663249315997294e-05,
      "loss": 1.5692,
      "num_input_tokens_seen": 14869878096,
      "step": 18900
    },
    {
      "epoch": 2.0051983874389987,
      "grad_norm": 0.5396697537834966,
      "learning_rate": 4.6662902431285984e-05,
      "loss": 1.76,
      "num_input_tokens_seen": 14870664736,
      "step": 18901
    },
    {
      "epoch": 2.0053044769785697,
      "grad_norm": 0.43769222354826554,
      "learning_rate": 4.6662555529834226e-05,
      "loss": 1.6115,
      "num_input_tokens_seen": 14871451472,
      "step": 18902
    },
    {
      "epoch": 2.005410566518141,
      "grad_norm": 0.591823167820343,
      "learning_rate": 4.666220861164228e-05,
      "loss": 1.6632,
      "num_input_tokens_seen": 14872238256,
      "step": 18903
    },
    {
      "epoch": 2.0055166560577127,
      "grad_norm": 0.4134763691687864,
      "learning_rate": 4.6661861676710405e-05,
      "loss": 1.6986,
      "num_input_tokens_seen": 14873024960,
      "step": 18904
    },
    {
      "epoch": 2.005622745597284,
      "grad_norm": 0.6885273017158672,
      "learning_rate": 4.666151472503889e-05,
      "loss": 1.6023,
      "num_input_tokens_seen": 14873811744,
      "step": 18905
    },
    {
      "epoch": 2.0057288351368556,
      "grad_norm": 0.4470984604280168,
      "learning_rate": 4.6661167756627985e-05,
      "loss": 1.5881,
      "num_input_tokens_seen": 14874598560,
      "step": 18906
    },
    {
      "epoch": 2.005834924676427,
      "grad_norm": 0.4392505837404822,
      "learning_rate": 4.666082077147797e-05,
      "loss": 1.5449,
      "num_input_tokens_seen": 14875385296,
      "step": 18907
    },
    {
      "epoch": 2.005941014215998,
      "grad_norm": 0.3509950939859483,
      "learning_rate": 4.666047376958911e-05,
      "loss": 1.4959,
      "num_input_tokens_seen": 14876172096,
      "step": 18908
    },
    {
      "epoch": 2.0060471037555696,
      "grad_norm": 0.49104142962026326,
      "learning_rate": 4.6660126750961666e-05,
      "loss": 1.7045,
      "num_input_tokens_seen": 14876958832,
      "step": 18909
    },
    {
      "epoch": 2.006153193295141,
      "grad_norm": 0.3559899535421823,
      "learning_rate": 4.665977971559591e-05,
      "loss": 1.5527,
      "num_input_tokens_seen": 14877745616,
      "step": 18910
    },
    {
      "epoch": 2.0062592828347126,
      "grad_norm": 0.37460191295830286,
      "learning_rate": 4.665943266349212e-05,
      "loss": 1.5608,
      "num_input_tokens_seen": 14878532480,
      "step": 18911
    },
    {
      "epoch": 2.006365372374284,
      "grad_norm": 0.3816500797327205,
      "learning_rate": 4.665908559465055e-05,
      "loss": 1.6971,
      "num_input_tokens_seen": 14879319232,
      "step": 18912
    },
    {
      "epoch": 2.0064714619138555,
      "grad_norm": 0.3622228640904597,
      "learning_rate": 4.6658738509071475e-05,
      "loss": 1.539,
      "num_input_tokens_seen": 14880106000,
      "step": 18913
    },
    {
      "epoch": 2.0065775514534265,
      "grad_norm": 0.40514774192567055,
      "learning_rate": 4.6658391406755165e-05,
      "loss": 1.7096,
      "num_input_tokens_seen": 14880892752,
      "step": 18914
    },
    {
      "epoch": 2.006683640992998,
      "grad_norm": 0.40321583998683713,
      "learning_rate": 4.665804428770188e-05,
      "loss": 1.6877,
      "num_input_tokens_seen": 14881679424,
      "step": 18915
    },
    {
      "epoch": 2.0067897305325695,
      "grad_norm": 0.4231227530920107,
      "learning_rate": 4.66576971519119e-05,
      "loss": 1.6099,
      "num_input_tokens_seen": 14882466128,
      "step": 18916
    },
    {
      "epoch": 2.006895820072141,
      "grad_norm": 0.3817161272723532,
      "learning_rate": 4.665734999938548e-05,
      "loss": 1.6891,
      "num_input_tokens_seen": 14883252976,
      "step": 18917
    },
    {
      "epoch": 2.0070019096117124,
      "grad_norm": 0.32668702348625334,
      "learning_rate": 4.6657002830122906e-05,
      "loss": 1.5786,
      "num_input_tokens_seen": 14884039808,
      "step": 18918
    },
    {
      "epoch": 2.007107999151284,
      "grad_norm": 0.3572959970116119,
      "learning_rate": 4.665665564412442e-05,
      "loss": 1.618,
      "num_input_tokens_seen": 14884826496,
      "step": 18919
    },
    {
      "epoch": 2.007214088690855,
      "grad_norm": 0.36073563540086384,
      "learning_rate": 4.6656308441390323e-05,
      "loss": 1.7231,
      "num_input_tokens_seen": 14885613328,
      "step": 18920
    },
    {
      "epoch": 2.0073201782304264,
      "grad_norm": 0.34806977830787195,
      "learning_rate": 4.665596122192086e-05,
      "loss": 1.5449,
      "num_input_tokens_seen": 14886400112,
      "step": 18921
    },
    {
      "epoch": 2.007426267769998,
      "grad_norm": 0.36901585037857465,
      "learning_rate": 4.6655613985716307e-05,
      "loss": 1.6365,
      "num_input_tokens_seen": 14887186896,
      "step": 18922
    },
    {
      "epoch": 2.0075323573095694,
      "grad_norm": 0.5293023216625955,
      "learning_rate": 4.6655266732776924e-05,
      "loss": 1.7116,
      "num_input_tokens_seen": 14887973632,
      "step": 18923
    },
    {
      "epoch": 2.007638446849141,
      "grad_norm": 0.3772014990690287,
      "learning_rate": 4.6654919463102983e-05,
      "loss": 1.7405,
      "num_input_tokens_seen": 14888760288,
      "step": 18924
    },
    {
      "epoch": 2.007744536388712,
      "grad_norm": 0.45776456404199817,
      "learning_rate": 4.665457217669477e-05,
      "loss": 1.5299,
      "num_input_tokens_seen": 14889547104,
      "step": 18925
    },
    {
      "epoch": 2.0078506259282833,
      "grad_norm": 0.41438235503094967,
      "learning_rate": 4.665422487355253e-05,
      "loss": 1.5471,
      "num_input_tokens_seen": 14890333824,
      "step": 18926
    },
    {
      "epoch": 2.007956715467855,
      "grad_norm": 0.4172462812439122,
      "learning_rate": 4.665387755367654e-05,
      "loss": 1.6921,
      "num_input_tokens_seen": 14891120592,
      "step": 18927
    },
    {
      "epoch": 2.0080628050074263,
      "grad_norm": 0.6173316714065475,
      "learning_rate": 4.665353021706708e-05,
      "loss": 1.7176,
      "num_input_tokens_seen": 14891907312,
      "step": 18928
    },
    {
      "epoch": 2.0081688945469978,
      "grad_norm": 0.3849376761089667,
      "learning_rate": 4.6653182863724395e-05,
      "loss": 1.5094,
      "num_input_tokens_seen": 14892694080,
      "step": 18929
    },
    {
      "epoch": 2.0082749840865692,
      "grad_norm": 0.5769841179536493,
      "learning_rate": 4.6652835493648766e-05,
      "loss": 1.6411,
      "num_input_tokens_seen": 14893480832,
      "step": 18930
    },
    {
      "epoch": 2.0083810736261403,
      "grad_norm": 0.4231299419257972,
      "learning_rate": 4.665248810684046e-05,
      "loss": 1.6002,
      "num_input_tokens_seen": 14894267648,
      "step": 18931
    },
    {
      "epoch": 2.0084871631657117,
      "grad_norm": 0.4665720549000703,
      "learning_rate": 4.665214070329976e-05,
      "loss": 1.6261,
      "num_input_tokens_seen": 14895054384,
      "step": 18932
    },
    {
      "epoch": 2.008593252705283,
      "grad_norm": 0.45436482915642273,
      "learning_rate": 4.665179328302691e-05,
      "loss": 1.6603,
      "num_input_tokens_seen": 14895841152,
      "step": 18933
    },
    {
      "epoch": 2.0086993422448547,
      "grad_norm": 0.439877205583363,
      "learning_rate": 4.665144584602219e-05,
      "loss": 1.6785,
      "num_input_tokens_seen": 14896627792,
      "step": 18934
    },
    {
      "epoch": 2.008805431784426,
      "grad_norm": 0.40978881297102077,
      "learning_rate": 4.6651098392285867e-05,
      "loss": 1.5633,
      "num_input_tokens_seen": 14897414544,
      "step": 18935
    },
    {
      "epoch": 2.0089115213239976,
      "grad_norm": 0.4086570801304362,
      "learning_rate": 4.665075092181821e-05,
      "loss": 1.531,
      "num_input_tokens_seen": 14898201312,
      "step": 18936
    },
    {
      "epoch": 2.0090176108635687,
      "grad_norm": 0.3293378959278738,
      "learning_rate": 4.6650403434619495e-05,
      "loss": 1.5513,
      "num_input_tokens_seen": 14898988128,
      "step": 18937
    },
    {
      "epoch": 2.00912370040314,
      "grad_norm": 0.4435112411910489,
      "learning_rate": 4.665005593068998e-05,
      "loss": 1.5791,
      "num_input_tokens_seen": 14899774944,
      "step": 18938
    },
    {
      "epoch": 2.0092297899427116,
      "grad_norm": 0.36121838983682725,
      "learning_rate": 4.664970841002994e-05,
      "loss": 1.6058,
      "num_input_tokens_seen": 14900561760,
      "step": 18939
    },
    {
      "epoch": 2.009335879482283,
      "grad_norm": 0.4094078684981497,
      "learning_rate": 4.664936087263964e-05,
      "loss": 1.5626,
      "num_input_tokens_seen": 14901348448,
      "step": 18940
    },
    {
      "epoch": 2.0094419690218546,
      "grad_norm": 0.3793966934667924,
      "learning_rate": 4.664901331851934e-05,
      "loss": 1.4429,
      "num_input_tokens_seen": 14902135136,
      "step": 18941
    },
    {
      "epoch": 2.009548058561426,
      "grad_norm": 0.4074751254620091,
      "learning_rate": 4.664866574766932e-05,
      "loss": 1.6203,
      "num_input_tokens_seen": 14902921904,
      "step": 18942
    },
    {
      "epoch": 2.009654148100997,
      "grad_norm": 0.4480320705395737,
      "learning_rate": 4.664831816008985e-05,
      "loss": 1.6251,
      "num_input_tokens_seen": 14903708688,
      "step": 18943
    },
    {
      "epoch": 2.0097602376405685,
      "grad_norm": 0.445919444641964,
      "learning_rate": 4.664797055578119e-05,
      "loss": 1.7393,
      "num_input_tokens_seen": 14904495440,
      "step": 18944
    },
    {
      "epoch": 2.00986632718014,
      "grad_norm": 0.3565220399248073,
      "learning_rate": 4.6647622934743626e-05,
      "loss": 1.5691,
      "num_input_tokens_seen": 14905282208,
      "step": 18945
    },
    {
      "epoch": 2.0099724167197115,
      "grad_norm": 0.36276284645664086,
      "learning_rate": 4.66472752969774e-05,
      "loss": 1.5332,
      "num_input_tokens_seen": 14906068960,
      "step": 18946
    },
    {
      "epoch": 2.010078506259283,
      "grad_norm": 0.3778860397518381,
      "learning_rate": 4.664692764248281e-05,
      "loss": 1.6351,
      "num_input_tokens_seen": 14906855760,
      "step": 18947
    },
    {
      "epoch": 2.0101845957988544,
      "grad_norm": 0.4568869167625919,
      "learning_rate": 4.66465799712601e-05,
      "loss": 1.6836,
      "num_input_tokens_seen": 14907642528,
      "step": 18948
    },
    {
      "epoch": 2.0102906853384255,
      "grad_norm": 0.390201374636488,
      "learning_rate": 4.6646232283309544e-05,
      "loss": 1.5358,
      "num_input_tokens_seen": 14908429328,
      "step": 18949
    },
    {
      "epoch": 2.010396774877997,
      "grad_norm": 0.380851460932229,
      "learning_rate": 4.664588457863142e-05,
      "loss": 1.624,
      "num_input_tokens_seen": 14909216032,
      "step": 18950
    },
    {
      "epoch": 2.0105028644175684,
      "grad_norm": 0.37762660001317877,
      "learning_rate": 4.664553685722599e-05,
      "loss": 1.5466,
      "num_input_tokens_seen": 14910002784,
      "step": 18951
    },
    {
      "epoch": 2.01060895395714,
      "grad_norm": 0.3498672444778178,
      "learning_rate": 4.6645189119093525e-05,
      "loss": 1.5873,
      "num_input_tokens_seen": 14910789568,
      "step": 18952
    },
    {
      "epoch": 2.0107150434967114,
      "grad_norm": 0.423107397179539,
      "learning_rate": 4.6644841364234294e-05,
      "loss": 1.5412,
      "num_input_tokens_seen": 14911576336,
      "step": 18953
    },
    {
      "epoch": 2.0108211330362824,
      "grad_norm": 0.45609626233662376,
      "learning_rate": 4.664449359264856e-05,
      "loss": 1.5541,
      "num_input_tokens_seen": 14912363104,
      "step": 18954
    },
    {
      "epoch": 2.010927222575854,
      "grad_norm": 0.4075341503740879,
      "learning_rate": 4.6644145804336604e-05,
      "loss": 1.6041,
      "num_input_tokens_seen": 14913149872,
      "step": 18955
    },
    {
      "epoch": 2.0110333121154254,
      "grad_norm": 0.3828771998030428,
      "learning_rate": 4.664379799929869e-05,
      "loss": 1.5376,
      "num_input_tokens_seen": 14913936672,
      "step": 18956
    },
    {
      "epoch": 2.011139401654997,
      "grad_norm": 0.4327832236539789,
      "learning_rate": 4.6643450177535075e-05,
      "loss": 1.5925,
      "num_input_tokens_seen": 14914723408,
      "step": 18957
    },
    {
      "epoch": 2.0112454911945683,
      "grad_norm": 0.4335817944745099,
      "learning_rate": 4.664310233904604e-05,
      "loss": 1.6071,
      "num_input_tokens_seen": 14915510144,
      "step": 18958
    },
    {
      "epoch": 2.0113515807341398,
      "grad_norm": 0.6024981130271948,
      "learning_rate": 4.6642754483831854e-05,
      "loss": 1.6094,
      "num_input_tokens_seen": 14916296928,
      "step": 18959
    },
    {
      "epoch": 2.011457670273711,
      "grad_norm": 0.3838807574354749,
      "learning_rate": 4.6642406611892775e-05,
      "loss": 1.6512,
      "num_input_tokens_seen": 14917083728,
      "step": 18960
    },
    {
      "epoch": 2.0115637598132823,
      "grad_norm": 0.6269926113226224,
      "learning_rate": 4.664205872322908e-05,
      "loss": 1.5497,
      "num_input_tokens_seen": 14917870464,
      "step": 18961
    },
    {
      "epoch": 2.0116698493528538,
      "grad_norm": 0.4898436974400093,
      "learning_rate": 4.6641710817841046e-05,
      "loss": 1.6599,
      "num_input_tokens_seen": 14918657232,
      "step": 18962
    },
    {
      "epoch": 2.0117759388924252,
      "grad_norm": 0.46807429978287857,
      "learning_rate": 4.6641362895728925e-05,
      "loss": 1.6453,
      "num_input_tokens_seen": 14919444016,
      "step": 18963
    },
    {
      "epoch": 2.0118820284319967,
      "grad_norm": 0.4655568766565482,
      "learning_rate": 4.664101495689299e-05,
      "loss": 1.5734,
      "num_input_tokens_seen": 14920230912,
      "step": 18964
    },
    {
      "epoch": 2.011988117971568,
      "grad_norm": 0.3928554995100548,
      "learning_rate": 4.664066700133352e-05,
      "loss": 1.681,
      "num_input_tokens_seen": 14921017664,
      "step": 18965
    },
    {
      "epoch": 2.012094207511139,
      "grad_norm": 0.397956668698577,
      "learning_rate": 4.664031902905078e-05,
      "loss": 1.5313,
      "num_input_tokens_seen": 14921804528,
      "step": 18966
    },
    {
      "epoch": 2.0122002970507107,
      "grad_norm": 0.41121968783801766,
      "learning_rate": 4.663997104004503e-05,
      "loss": 1.6243,
      "num_input_tokens_seen": 14922591328,
      "step": 18967
    },
    {
      "epoch": 2.012306386590282,
      "grad_norm": 0.478060470792629,
      "learning_rate": 4.6639623034316547e-05,
      "loss": 1.6391,
      "num_input_tokens_seen": 14923378112,
      "step": 18968
    },
    {
      "epoch": 2.0124124761298536,
      "grad_norm": 0.4543750121261553,
      "learning_rate": 4.66392750118656e-05,
      "loss": 1.5803,
      "num_input_tokens_seen": 14924164912,
      "step": 18969
    },
    {
      "epoch": 2.012518565669425,
      "grad_norm": 0.414004942066398,
      "learning_rate": 4.6638926972692456e-05,
      "loss": 1.7836,
      "num_input_tokens_seen": 14924951664,
      "step": 18970
    },
    {
      "epoch": 2.0126246552089966,
      "grad_norm": 0.3658667139335555,
      "learning_rate": 4.6638578916797384e-05,
      "loss": 1.6443,
      "num_input_tokens_seen": 14925738368,
      "step": 18971
    },
    {
      "epoch": 2.0127307447485676,
      "grad_norm": 0.3706429765718392,
      "learning_rate": 4.6638230844180654e-05,
      "loss": 1.5369,
      "num_input_tokens_seen": 14926525040,
      "step": 18972
    },
    {
      "epoch": 2.012836834288139,
      "grad_norm": 0.4658898108002274,
      "learning_rate": 4.663788275484253e-05,
      "loss": 1.7567,
      "num_input_tokens_seen": 14927311808,
      "step": 18973
    },
    {
      "epoch": 2.0129429238277106,
      "grad_norm": 0.48657861924989765,
      "learning_rate": 4.663753464878329e-05,
      "loss": 1.636,
      "num_input_tokens_seen": 14928098496,
      "step": 18974
    },
    {
      "epoch": 2.013049013367282,
      "grad_norm": 0.3741331366462892,
      "learning_rate": 4.6637186526003194e-05,
      "loss": 1.4768,
      "num_input_tokens_seen": 14928885312,
      "step": 18975
    },
    {
      "epoch": 2.0131551029068535,
      "grad_norm": 0.40330934878442154,
      "learning_rate": 4.663683838650252e-05,
      "loss": 1.7374,
      "num_input_tokens_seen": 14929672048,
      "step": 18976
    },
    {
      "epoch": 2.013261192446425,
      "grad_norm": 0.36802757138982706,
      "learning_rate": 4.6636490230281525e-05,
      "loss": 1.576,
      "num_input_tokens_seen": 14930458784,
      "step": 18977
    },
    {
      "epoch": 2.013367281985996,
      "grad_norm": 0.5319798330559079,
      "learning_rate": 4.663614205734049e-05,
      "loss": 1.6036,
      "num_input_tokens_seen": 14931245552,
      "step": 18978
    },
    {
      "epoch": 2.0134733715255675,
      "grad_norm": 0.45156374553219947,
      "learning_rate": 4.6635793867679686e-05,
      "loss": 1.6954,
      "num_input_tokens_seen": 14932032272,
      "step": 18979
    },
    {
      "epoch": 2.013579461065139,
      "grad_norm": 0.5836242929723152,
      "learning_rate": 4.6635445661299365e-05,
      "loss": 1.6548,
      "num_input_tokens_seen": 14932819008,
      "step": 18980
    },
    {
      "epoch": 2.0136855506047104,
      "grad_norm": 0.4272427047486918,
      "learning_rate": 4.663509743819981e-05,
      "loss": 1.7162,
      "num_input_tokens_seen": 14933605728,
      "step": 18981
    },
    {
      "epoch": 2.013791640144282,
      "grad_norm": 0.6014309780063647,
      "learning_rate": 4.6634749198381286e-05,
      "loss": 1.6242,
      "num_input_tokens_seen": 14934392528,
      "step": 18982
    },
    {
      "epoch": 2.0138977296838534,
      "grad_norm": 0.36966115046140213,
      "learning_rate": 4.663440094184406e-05,
      "loss": 1.5848,
      "num_input_tokens_seen": 14935179280,
      "step": 18983
    },
    {
      "epoch": 2.0140038192234244,
      "grad_norm": 0.5825010407636533,
      "learning_rate": 4.663405266858841e-05,
      "loss": 1.6527,
      "num_input_tokens_seen": 14935965968,
      "step": 18984
    },
    {
      "epoch": 2.014109908762996,
      "grad_norm": 0.39078316641963684,
      "learning_rate": 4.66337043786146e-05,
      "loss": 1.5426,
      "num_input_tokens_seen": 14936752800,
      "step": 18985
    },
    {
      "epoch": 2.0142159983025674,
      "grad_norm": 0.7670252051272737,
      "learning_rate": 4.663335607192288e-05,
      "loss": 1.7337,
      "num_input_tokens_seen": 14937539536,
      "step": 18986
    },
    {
      "epoch": 2.014322087842139,
      "grad_norm": 0.421606114607879,
      "learning_rate": 4.663300774851356e-05,
      "loss": 1.5064,
      "num_input_tokens_seen": 14938326272,
      "step": 18987
    },
    {
      "epoch": 2.0144281773817103,
      "grad_norm": 0.5817602080447033,
      "learning_rate": 4.663265940838688e-05,
      "loss": 1.534,
      "num_input_tokens_seen": 14939112976,
      "step": 18988
    },
    {
      "epoch": 2.0145342669212813,
      "grad_norm": 0.4551205368136898,
      "learning_rate": 4.663231105154311e-05,
      "loss": 1.5841,
      "num_input_tokens_seen": 14939899776,
      "step": 18989
    },
    {
      "epoch": 2.014640356460853,
      "grad_norm": 0.46536767744146396,
      "learning_rate": 4.6631962677982524e-05,
      "loss": 1.6549,
      "num_input_tokens_seen": 14940686496,
      "step": 18990
    },
    {
      "epoch": 2.0147464460004243,
      "grad_norm": 0.4600847098215196,
      "learning_rate": 4.6631614287705394e-05,
      "loss": 1.6517,
      "num_input_tokens_seen": 14941473232,
      "step": 18991
    },
    {
      "epoch": 2.0148525355399958,
      "grad_norm": 0.5231489660099222,
      "learning_rate": 4.663126588071199e-05,
      "loss": 1.7967,
      "num_input_tokens_seen": 14942259952,
      "step": 18992
    },
    {
      "epoch": 2.0149586250795672,
      "grad_norm": 0.39010846296309065,
      "learning_rate": 4.6630917457002574e-05,
      "loss": 1.5362,
      "num_input_tokens_seen": 14943046768,
      "step": 18993
    },
    {
      "epoch": 2.0150647146191387,
      "grad_norm": 0.39954100871606196,
      "learning_rate": 4.663056901657743e-05,
      "loss": 1.5714,
      "num_input_tokens_seen": 14943833632,
      "step": 18994
    },
    {
      "epoch": 2.0151708041587097,
      "grad_norm": 0.4158586603370648,
      "learning_rate": 4.663022055943681e-05,
      "loss": 1.5463,
      "num_input_tokens_seen": 14944620544,
      "step": 18995
    },
    {
      "epoch": 2.0152768936982812,
      "grad_norm": 0.38657270981581016,
      "learning_rate": 4.6629872085580986e-05,
      "loss": 1.5658,
      "num_input_tokens_seen": 14945407376,
      "step": 18996
    },
    {
      "epoch": 2.0153829832378527,
      "grad_norm": 0.44006414208679223,
      "learning_rate": 4.662952359501024e-05,
      "loss": 1.7682,
      "num_input_tokens_seen": 14946194048,
      "step": 18997
    },
    {
      "epoch": 2.015489072777424,
      "grad_norm": 0.509847084637255,
      "learning_rate": 4.6629175087724826e-05,
      "loss": 1.6346,
      "num_input_tokens_seen": 14946980816,
      "step": 18998
    },
    {
      "epoch": 2.0155951623169956,
      "grad_norm": 0.4016120000406646,
      "learning_rate": 4.662882656372502e-05,
      "loss": 1.7342,
      "num_input_tokens_seen": 14947767536,
      "step": 18999
    },
    {
      "epoch": 2.015701251856567,
      "grad_norm": 0.4322077455426169,
      "learning_rate": 4.662847802301109e-05,
      "loss": 1.6383,
      "num_input_tokens_seen": 14948554320,
      "step": 19000
    },
    {
      "epoch": 2.015701251856567,
      "eval_loss": 1.7159647941589355,
      "eval_runtime": 65.0857,
      "eval_samples_per_second": 46.093,
      "eval_steps_per_second": 0.492,
      "num_input_tokens_seen": 14948554320,
      "step": 19000
    },
    {
      "epoch": 2.015807341396138,
      "grad_norm": 0.44252347694960653,
      "learning_rate": 4.6628129465583316e-05,
      "loss": 1.7733,
      "num_input_tokens_seen": 14949341088,
      "step": 19001
    },
    {
      "epoch": 2.0159134309357096,
      "grad_norm": 0.35045429627730995,
      "learning_rate": 4.662778089144195e-05,
      "loss": 1.6407,
      "num_input_tokens_seen": 14950127808,
      "step": 19002
    },
    {
      "epoch": 2.016019520475281,
      "grad_norm": 0.4497920470537145,
      "learning_rate": 4.662743230058727e-05,
      "loss": 1.669,
      "num_input_tokens_seen": 14950914560,
      "step": 19003
    },
    {
      "epoch": 2.0161256100148526,
      "grad_norm": 0.42904590322364533,
      "learning_rate": 4.662708369301955e-05,
      "loss": 1.7121,
      "num_input_tokens_seen": 14951701296,
      "step": 19004
    },
    {
      "epoch": 2.016231699554424,
      "grad_norm": 0.3894925487165889,
      "learning_rate": 4.6626735068739056e-05,
      "loss": 1.7187,
      "num_input_tokens_seen": 14952488016,
      "step": 19005
    },
    {
      "epoch": 2.0163377890939955,
      "grad_norm": 0.5060855506920687,
      "learning_rate": 4.662638642774605e-05,
      "loss": 1.6111,
      "num_input_tokens_seen": 14953274880,
      "step": 19006
    },
    {
      "epoch": 2.0164438786335666,
      "grad_norm": 0.36590945796862023,
      "learning_rate": 4.662603777004081e-05,
      "loss": 1.6618,
      "num_input_tokens_seen": 14954061712,
      "step": 19007
    },
    {
      "epoch": 2.016549968173138,
      "grad_norm": 0.4134844411228673,
      "learning_rate": 4.6625689095623596e-05,
      "loss": 1.6065,
      "num_input_tokens_seen": 14954848464,
      "step": 19008
    },
    {
      "epoch": 2.0166560577127095,
      "grad_norm": 0.34721724817649346,
      "learning_rate": 4.662534040449469e-05,
      "loss": 1.6036,
      "num_input_tokens_seen": 14955635232,
      "step": 19009
    },
    {
      "epoch": 2.016762147252281,
      "grad_norm": 0.5034775903109772,
      "learning_rate": 4.6624991696654354e-05,
      "loss": 1.76,
      "num_input_tokens_seen": 14956421920,
      "step": 19010
    },
    {
      "epoch": 2.0168682367918525,
      "grad_norm": 0.41107310538449204,
      "learning_rate": 4.662464297210286e-05,
      "loss": 1.6309,
      "num_input_tokens_seen": 14957208672,
      "step": 19011
    },
    {
      "epoch": 2.016974326331424,
      "grad_norm": 0.4956454250804346,
      "learning_rate": 4.662429423084047e-05,
      "loss": 1.5749,
      "num_input_tokens_seen": 14957995392,
      "step": 19012
    },
    {
      "epoch": 2.017080415870995,
      "grad_norm": 0.4167756052832576,
      "learning_rate": 4.662394547286747e-05,
      "loss": 1.571,
      "num_input_tokens_seen": 14958782176,
      "step": 19013
    },
    {
      "epoch": 2.0171865054105664,
      "grad_norm": 0.5740982477484795,
      "learning_rate": 4.662359669818411e-05,
      "loss": 1.5264,
      "num_input_tokens_seen": 14959568992,
      "step": 19014
    },
    {
      "epoch": 2.017292594950138,
      "grad_norm": 0.3950531615842454,
      "learning_rate": 4.662324790679068e-05,
      "loss": 1.5941,
      "num_input_tokens_seen": 14960355824,
      "step": 19015
    },
    {
      "epoch": 2.0173986844897094,
      "grad_norm": 0.44450882313204065,
      "learning_rate": 4.662289909868743e-05,
      "loss": 1.5868,
      "num_input_tokens_seen": 14961142608,
      "step": 19016
    },
    {
      "epoch": 2.017504774029281,
      "grad_norm": 0.37947645401386804,
      "learning_rate": 4.6622550273874646e-05,
      "loss": 1.5018,
      "num_input_tokens_seen": 14961929488,
      "step": 19017
    },
    {
      "epoch": 2.0176108635688523,
      "grad_norm": 0.42827522611521723,
      "learning_rate": 4.662220143235258e-05,
      "loss": 1.6618,
      "num_input_tokens_seen": 14962716256,
      "step": 19018
    },
    {
      "epoch": 2.0177169531084234,
      "grad_norm": 0.47215020431237603,
      "learning_rate": 4.662185257412152e-05,
      "loss": 1.6135,
      "num_input_tokens_seen": 14963502944,
      "step": 19019
    },
    {
      "epoch": 2.017823042647995,
      "grad_norm": 0.4337631719677593,
      "learning_rate": 4.6621503699181716e-05,
      "loss": 1.7023,
      "num_input_tokens_seen": 14964289744,
      "step": 19020
    },
    {
      "epoch": 2.0179291321875663,
      "grad_norm": 0.48441842783427674,
      "learning_rate": 4.662115480753345e-05,
      "loss": 1.7853,
      "num_input_tokens_seen": 14965076496,
      "step": 19021
    },
    {
      "epoch": 2.018035221727138,
      "grad_norm": 0.5241280714780561,
      "learning_rate": 4.6620805899177e-05,
      "loss": 1.6322,
      "num_input_tokens_seen": 14965863136,
      "step": 19022
    },
    {
      "epoch": 2.0181413112667093,
      "grad_norm": 0.4313629676092009,
      "learning_rate": 4.6620456974112614e-05,
      "loss": 1.5353,
      "num_input_tokens_seen": 14966649920,
      "step": 19023
    },
    {
      "epoch": 2.0182474008062803,
      "grad_norm": 0.46417908096855076,
      "learning_rate": 4.662010803234058e-05,
      "loss": 1.5038,
      "num_input_tokens_seen": 14967436720,
      "step": 19024
    },
    {
      "epoch": 2.0183534903458518,
      "grad_norm": 0.3824983443429341,
      "learning_rate": 4.661975907386116e-05,
      "loss": 1.6206,
      "num_input_tokens_seen": 14968223456,
      "step": 19025
    },
    {
      "epoch": 2.0184595798854232,
      "grad_norm": 0.4160659964379831,
      "learning_rate": 4.6619410098674626e-05,
      "loss": 1.7485,
      "num_input_tokens_seen": 14969010160,
      "step": 19026
    },
    {
      "epoch": 2.0185656694249947,
      "grad_norm": 0.4930830729172442,
      "learning_rate": 4.6619061106781245e-05,
      "loss": 1.6152,
      "num_input_tokens_seen": 14969796960,
      "step": 19027
    },
    {
      "epoch": 2.018671758964566,
      "grad_norm": 0.49867911175882135,
      "learning_rate": 4.661871209818129e-05,
      "loss": 1.6421,
      "num_input_tokens_seen": 14970583712,
      "step": 19028
    },
    {
      "epoch": 2.0187778485041377,
      "grad_norm": 0.493568462065124,
      "learning_rate": 4.661836307287503e-05,
      "loss": 1.7046,
      "num_input_tokens_seen": 14971370480,
      "step": 19029
    },
    {
      "epoch": 2.0188839380437087,
      "grad_norm": 0.4812575191224348,
      "learning_rate": 4.661801403086272e-05,
      "loss": 1.6734,
      "num_input_tokens_seen": 14972157184,
      "step": 19030
    },
    {
      "epoch": 2.01899002758328,
      "grad_norm": 0.476074906158843,
      "learning_rate": 4.661766497214466e-05,
      "loss": 1.5013,
      "num_input_tokens_seen": 14972943952,
      "step": 19031
    },
    {
      "epoch": 2.0190961171228516,
      "grad_norm": 0.41708392012041645,
      "learning_rate": 4.661731589672109e-05,
      "loss": 1.6333,
      "num_input_tokens_seen": 14973730704,
      "step": 19032
    },
    {
      "epoch": 2.019202206662423,
      "grad_norm": 0.4954027522657024,
      "learning_rate": 4.66169668045923e-05,
      "loss": 1.6244,
      "num_input_tokens_seen": 14974517408,
      "step": 19033
    },
    {
      "epoch": 2.0193082962019946,
      "grad_norm": 0.3937260761423841,
      "learning_rate": 4.661661769575855e-05,
      "loss": 1.6205,
      "num_input_tokens_seen": 14975304192,
      "step": 19034
    },
    {
      "epoch": 2.019414385741566,
      "grad_norm": 0.7403652801622727,
      "learning_rate": 4.661626857022011e-05,
      "loss": 1.6701,
      "num_input_tokens_seen": 14976090960,
      "step": 19035
    },
    {
      "epoch": 2.019520475281137,
      "grad_norm": 0.43585060397837533,
      "learning_rate": 4.661591942797726e-05,
      "loss": 1.548,
      "num_input_tokens_seen": 14976877728,
      "step": 19036
    },
    {
      "epoch": 2.0196265648207086,
      "grad_norm": 0.9225565460405598,
      "learning_rate": 4.6615570269030254e-05,
      "loss": 1.718,
      "num_input_tokens_seen": 14977664448,
      "step": 19037
    },
    {
      "epoch": 2.01973265436028,
      "grad_norm": 0.5855910413949442,
      "learning_rate": 4.6615221093379377e-05,
      "loss": 1.6647,
      "num_input_tokens_seen": 14978451088,
      "step": 19038
    },
    {
      "epoch": 2.0198387438998515,
      "grad_norm": 0.6321994753818067,
      "learning_rate": 4.661487190102488e-05,
      "loss": 1.419,
      "num_input_tokens_seen": 14979237952,
      "step": 19039
    },
    {
      "epoch": 2.019944833439423,
      "grad_norm": 0.436095199210079,
      "learning_rate": 4.661452269196706e-05,
      "loss": 1.6888,
      "num_input_tokens_seen": 14980024672,
      "step": 19040
    },
    {
      "epoch": 2.0200509229789945,
      "grad_norm": 0.5808102510207838,
      "learning_rate": 4.661417346620615e-05,
      "loss": 1.7157,
      "num_input_tokens_seen": 14980811456,
      "step": 19041
    },
    {
      "epoch": 2.0201570125185655,
      "grad_norm": 0.39376780717355875,
      "learning_rate": 4.6613824223742455e-05,
      "loss": 1.5022,
      "num_input_tokens_seen": 14981598288,
      "step": 19042
    },
    {
      "epoch": 2.020263102058137,
      "grad_norm": 0.4981192431319703,
      "learning_rate": 4.661347496457623e-05,
      "loss": 1.5967,
      "num_input_tokens_seen": 14982385072,
      "step": 19043
    },
    {
      "epoch": 2.0203691915977084,
      "grad_norm": 0.4282682363110845,
      "learning_rate": 4.661312568870774e-05,
      "loss": 1.6457,
      "num_input_tokens_seen": 14983171808,
      "step": 19044
    },
    {
      "epoch": 2.02047528113728,
      "grad_norm": 0.4467342347583625,
      "learning_rate": 4.661277639613727e-05,
      "loss": 1.5132,
      "num_input_tokens_seen": 14983958608,
      "step": 19045
    },
    {
      "epoch": 2.0205813706768514,
      "grad_norm": 0.7063039681431509,
      "learning_rate": 4.6612427086865074e-05,
      "loss": 1.6422,
      "num_input_tokens_seen": 14984745360,
      "step": 19046
    },
    {
      "epoch": 2.020687460216423,
      "grad_norm": 0.3863837199944189,
      "learning_rate": 4.661207776089143e-05,
      "loss": 1.4976,
      "num_input_tokens_seen": 14985532096,
      "step": 19047
    },
    {
      "epoch": 2.020793549755994,
      "grad_norm": 0.6419329579010102,
      "learning_rate": 4.6611728418216605e-05,
      "loss": 1.5994,
      "num_input_tokens_seen": 14986318928,
      "step": 19048
    },
    {
      "epoch": 2.0208996392955654,
      "grad_norm": 0.43766911489740357,
      "learning_rate": 4.6611379058840866e-05,
      "loss": 1.5401,
      "num_input_tokens_seen": 14987105824,
      "step": 19049
    },
    {
      "epoch": 2.021005728835137,
      "grad_norm": 0.4950846222187428,
      "learning_rate": 4.66110296827645e-05,
      "loss": 1.5431,
      "num_input_tokens_seen": 14987892528,
      "step": 19050
    },
    {
      "epoch": 2.0211118183747083,
      "grad_norm": 0.5460661789496363,
      "learning_rate": 4.661068028998775e-05,
      "loss": 1.583,
      "num_input_tokens_seen": 14988679296,
      "step": 19051
    },
    {
      "epoch": 2.02121790791428,
      "grad_norm": 0.6990579063510889,
      "learning_rate": 4.6610330880510913e-05,
      "loss": 1.7131,
      "num_input_tokens_seen": 14989466112,
      "step": 19052
    },
    {
      "epoch": 2.021323997453851,
      "grad_norm": 0.4884820709880433,
      "learning_rate": 4.660998145433424e-05,
      "loss": 1.6389,
      "num_input_tokens_seen": 14990252848,
      "step": 19053
    },
    {
      "epoch": 2.0214300869934223,
      "grad_norm": 0.6382723406457423,
      "learning_rate": 4.660963201145801e-05,
      "loss": 1.6775,
      "num_input_tokens_seen": 14991039600,
      "step": 19054
    },
    {
      "epoch": 2.021536176532994,
      "grad_norm": 0.495635819350115,
      "learning_rate": 4.6609282551882486e-05,
      "loss": 1.665,
      "num_input_tokens_seen": 14991826384,
      "step": 19055
    },
    {
      "epoch": 2.0216422660725653,
      "grad_norm": 0.6741466455835935,
      "learning_rate": 4.660893307560794e-05,
      "loss": 1.7145,
      "num_input_tokens_seen": 14992613152,
      "step": 19056
    },
    {
      "epoch": 2.0217483556121367,
      "grad_norm": 0.4453766991029955,
      "learning_rate": 4.6608583582634655e-05,
      "loss": 1.6202,
      "num_input_tokens_seen": 14993399840,
      "step": 19057
    },
    {
      "epoch": 2.021854445151708,
      "grad_norm": 0.45057704424328193,
      "learning_rate": 4.660823407296289e-05,
      "loss": 1.4666,
      "num_input_tokens_seen": 14994186704,
      "step": 19058
    },
    {
      "epoch": 2.0219605346912792,
      "grad_norm": 0.8023948033252581,
      "learning_rate": 4.66078845465929e-05,
      "loss": 1.6926,
      "num_input_tokens_seen": 14994973376,
      "step": 19059
    },
    {
      "epoch": 2.0220666242308507,
      "grad_norm": 0.5074019295307923,
      "learning_rate": 4.6607535003524985e-05,
      "loss": 1.5684,
      "num_input_tokens_seen": 14995760080,
      "step": 19060
    },
    {
      "epoch": 2.022172713770422,
      "grad_norm": 0.877951535790197,
      "learning_rate": 4.6607185443759405e-05,
      "loss": 1.7071,
      "num_input_tokens_seen": 14996546832,
      "step": 19061
    },
    {
      "epoch": 2.0222788033099937,
      "grad_norm": 0.5680427600627712,
      "learning_rate": 4.660683586729642e-05,
      "loss": 1.7215,
      "num_input_tokens_seen": 14997333616,
      "step": 19062
    },
    {
      "epoch": 2.022384892849565,
      "grad_norm": 0.489186677496225,
      "learning_rate": 4.6606486274136294e-05,
      "loss": 1.5791,
      "num_input_tokens_seen": 14998120400,
      "step": 19063
    },
    {
      "epoch": 2.0224909823891366,
      "grad_norm": 0.7061320329149956,
      "learning_rate": 4.660613666427933e-05,
      "loss": 1.6876,
      "num_input_tokens_seen": 14998907104,
      "step": 19064
    },
    {
      "epoch": 2.0225970719287076,
      "grad_norm": 0.4786764682359619,
      "learning_rate": 4.660578703772577e-05,
      "loss": 1.6368,
      "num_input_tokens_seen": 14999693840,
      "step": 19065
    },
    {
      "epoch": 2.022703161468279,
      "grad_norm": 0.5454175090889382,
      "learning_rate": 4.660543739447588e-05,
      "loss": 1.4852,
      "num_input_tokens_seen": 15000480608,
      "step": 19066
    },
    {
      "epoch": 2.0228092510078506,
      "grad_norm": 0.5277362995721449,
      "learning_rate": 4.660508773452995e-05,
      "loss": 1.7201,
      "num_input_tokens_seen": 15001267280,
      "step": 19067
    },
    {
      "epoch": 2.022915340547422,
      "grad_norm": 0.5343126454977193,
      "learning_rate": 4.660473805788825e-05,
      "loss": 1.7667,
      "num_input_tokens_seen": 15002054080,
      "step": 19068
    },
    {
      "epoch": 2.0230214300869935,
      "grad_norm": 0.45749756945796427,
      "learning_rate": 4.660438836455103e-05,
      "loss": 1.6515,
      "num_input_tokens_seen": 15002840816,
      "step": 19069
    },
    {
      "epoch": 2.023127519626565,
      "grad_norm": 0.5230476711757016,
      "learning_rate": 4.660403865451858e-05,
      "loss": 1.5875,
      "num_input_tokens_seen": 15003627600,
      "step": 19070
    },
    {
      "epoch": 2.023233609166136,
      "grad_norm": 0.9500057003880495,
      "learning_rate": 4.6603688927791165e-05,
      "loss": 1.6137,
      "num_input_tokens_seen": 15004414320,
      "step": 19071
    },
    {
      "epoch": 2.0233396987057075,
      "grad_norm": 0.5299310210858476,
      "learning_rate": 4.660333918436905e-05,
      "loss": 1.5526,
      "num_input_tokens_seen": 15005201072,
      "step": 19072
    },
    {
      "epoch": 2.023445788245279,
      "grad_norm": 0.7771959480152496,
      "learning_rate": 4.660298942425251e-05,
      "loss": 1.694,
      "num_input_tokens_seen": 15005987856,
      "step": 19073
    },
    {
      "epoch": 2.0235518777848505,
      "grad_norm": 0.47812205269557195,
      "learning_rate": 4.660263964744182e-05,
      "loss": 1.5951,
      "num_input_tokens_seen": 15006774592,
      "step": 19074
    },
    {
      "epoch": 2.023657967324422,
      "grad_norm": 0.5637763760341191,
      "learning_rate": 4.6602289853937224e-05,
      "loss": 1.6464,
      "num_input_tokens_seen": 15007561360,
      "step": 19075
    },
    {
      "epoch": 2.0237640568639934,
      "grad_norm": 0.5321456653412587,
      "learning_rate": 4.660194004373902e-05,
      "loss": 1.5859,
      "num_input_tokens_seen": 15008348208,
      "step": 19076
    },
    {
      "epoch": 2.0238701464035644,
      "grad_norm": 0.41073322640379706,
      "learning_rate": 4.660159021684748e-05,
      "loss": 1.6566,
      "num_input_tokens_seen": 15009135024,
      "step": 19077
    },
    {
      "epoch": 2.023976235943136,
      "grad_norm": 0.4416232203925865,
      "learning_rate": 4.660124037326286e-05,
      "loss": 1.3771,
      "num_input_tokens_seen": 15009921856,
      "step": 19078
    },
    {
      "epoch": 2.0240823254827074,
      "grad_norm": 0.44551685643845873,
      "learning_rate": 4.6600890512985436e-05,
      "loss": 1.67,
      "num_input_tokens_seen": 15010708608,
      "step": 19079
    },
    {
      "epoch": 2.024188415022279,
      "grad_norm": 0.44188062259218325,
      "learning_rate": 4.6600540636015476e-05,
      "loss": 1.6396,
      "num_input_tokens_seen": 15011495408,
      "step": 19080
    },
    {
      "epoch": 2.0242945045618503,
      "grad_norm": 0.5724407703164465,
      "learning_rate": 4.6600190742353255e-05,
      "loss": 1.6158,
      "num_input_tokens_seen": 15012282208,
      "step": 19081
    },
    {
      "epoch": 2.024400594101422,
      "grad_norm": 0.5221227226454339,
      "learning_rate": 4.659984083199903e-05,
      "loss": 1.6688,
      "num_input_tokens_seen": 15013068944,
      "step": 19082
    },
    {
      "epoch": 2.024506683640993,
      "grad_norm": 0.682984299576065,
      "learning_rate": 4.659949090495309e-05,
      "loss": 1.7287,
      "num_input_tokens_seen": 15013855696,
      "step": 19083
    },
    {
      "epoch": 2.0246127731805643,
      "grad_norm": 0.4142369910964438,
      "learning_rate": 4.65991409612157e-05,
      "loss": 1.5235,
      "num_input_tokens_seen": 15014642448,
      "step": 19084
    },
    {
      "epoch": 2.024718862720136,
      "grad_norm": 0.37276257516187306,
      "learning_rate": 4.6598791000787125e-05,
      "loss": 1.4864,
      "num_input_tokens_seen": 15015429296,
      "step": 19085
    },
    {
      "epoch": 2.0248249522597073,
      "grad_norm": 0.4168891386834406,
      "learning_rate": 4.6598441023667635e-05,
      "loss": 1.6026,
      "num_input_tokens_seen": 15016216128,
      "step": 19086
    },
    {
      "epoch": 2.0249310417992787,
      "grad_norm": 0.3996263172836347,
      "learning_rate": 4.6598091029857504e-05,
      "loss": 1.6095,
      "num_input_tokens_seen": 15017002944,
      "step": 19087
    },
    {
      "epoch": 2.0250371313388498,
      "grad_norm": 0.43283334511059696,
      "learning_rate": 4.659774101935701e-05,
      "loss": 1.6282,
      "num_input_tokens_seen": 15017789664,
      "step": 19088
    },
    {
      "epoch": 2.0251432208784212,
      "grad_norm": 0.3950049935360206,
      "learning_rate": 4.6597390992166406e-05,
      "loss": 1.5729,
      "num_input_tokens_seen": 15018576464,
      "step": 19089
    },
    {
      "epoch": 2.0252493104179927,
      "grad_norm": 0.45944050540686665,
      "learning_rate": 4.6597040948285976e-05,
      "loss": 1.6709,
      "num_input_tokens_seen": 15019363136,
      "step": 19090
    },
    {
      "epoch": 2.025355399957564,
      "grad_norm": 0.36523844072218753,
      "learning_rate": 4.659669088771599e-05,
      "loss": 1.7263,
      "num_input_tokens_seen": 15020149888,
      "step": 19091
    },
    {
      "epoch": 2.0254614894971357,
      "grad_norm": 0.5312624398443131,
      "learning_rate": 4.6596340810456705e-05,
      "loss": 1.636,
      "num_input_tokens_seen": 15020936656,
      "step": 19092
    },
    {
      "epoch": 2.025567579036707,
      "grad_norm": 0.494094338212048,
      "learning_rate": 4.659599071650841e-05,
      "loss": 1.6896,
      "num_input_tokens_seen": 15021723344,
      "step": 19093
    },
    {
      "epoch": 2.025673668576278,
      "grad_norm": 0.38950754665772713,
      "learning_rate": 4.659564060587136e-05,
      "loss": 1.6201,
      "num_input_tokens_seen": 15022510176,
      "step": 19094
    },
    {
      "epoch": 2.0257797581158496,
      "grad_norm": 0.3832745516573276,
      "learning_rate": 4.6595290478545836e-05,
      "loss": 1.5691,
      "num_input_tokens_seen": 15023296944,
      "step": 19095
    },
    {
      "epoch": 2.025885847655421,
      "grad_norm": 0.43867604651679065,
      "learning_rate": 4.659494033453211e-05,
      "loss": 1.6216,
      "num_input_tokens_seen": 15024083680,
      "step": 19096
    },
    {
      "epoch": 2.0259919371949926,
      "grad_norm": 0.4548120001551298,
      "learning_rate": 4.659459017383044e-05,
      "loss": 1.7258,
      "num_input_tokens_seen": 15024870496,
      "step": 19097
    },
    {
      "epoch": 2.026098026734564,
      "grad_norm": 0.4385170666659195,
      "learning_rate": 4.659423999644111e-05,
      "loss": 1.6305,
      "num_input_tokens_seen": 15025657232,
      "step": 19098
    },
    {
      "epoch": 2.0262041162741355,
      "grad_norm": 0.47786084501660514,
      "learning_rate": 4.6593889802364385e-05,
      "loss": 1.7764,
      "num_input_tokens_seen": 15026444032,
      "step": 19099
    },
    {
      "epoch": 2.0263102058137066,
      "grad_norm": 0.4222478193074065,
      "learning_rate": 4.659353959160053e-05,
      "loss": 1.592,
      "num_input_tokens_seen": 15027230864,
      "step": 19100
    },
    {
      "epoch": 2.026416295353278,
      "grad_norm": 0.4422536997021176,
      "learning_rate": 4.659318936414983e-05,
      "loss": 1.583,
      "num_input_tokens_seen": 15028017680,
      "step": 19101
    },
    {
      "epoch": 2.0265223848928495,
      "grad_norm": 0.42802088320090337,
      "learning_rate": 4.659283912001254e-05,
      "loss": 1.6434,
      "num_input_tokens_seen": 15028804512,
      "step": 19102
    },
    {
      "epoch": 2.026628474432421,
      "grad_norm": 0.4369457530200504,
      "learning_rate": 4.659248885918894e-05,
      "loss": 1.5128,
      "num_input_tokens_seen": 15029591248,
      "step": 19103
    },
    {
      "epoch": 2.0267345639719925,
      "grad_norm": 0.3999709092076033,
      "learning_rate": 4.65921385816793e-05,
      "loss": 1.5197,
      "num_input_tokens_seen": 15030378080,
      "step": 19104
    },
    {
      "epoch": 2.026840653511564,
      "grad_norm": 0.38045032705265613,
      "learning_rate": 4.659178828748388e-05,
      "loss": 1.7048,
      "num_input_tokens_seen": 15031164720,
      "step": 19105
    },
    {
      "epoch": 2.026946743051135,
      "grad_norm": 0.4421225812657024,
      "learning_rate": 4.659143797660297e-05,
      "loss": 1.6967,
      "num_input_tokens_seen": 15031951552,
      "step": 19106
    },
    {
      "epoch": 2.0270528325907065,
      "grad_norm": 0.3630123742910986,
      "learning_rate": 4.659108764903683e-05,
      "loss": 1.3958,
      "num_input_tokens_seen": 15032738400,
      "step": 19107
    },
    {
      "epoch": 2.027158922130278,
      "grad_norm": 0.4773686703444594,
      "learning_rate": 4.659073730478572e-05,
      "loss": 1.7568,
      "num_input_tokens_seen": 15033525168,
      "step": 19108
    },
    {
      "epoch": 2.0272650116698494,
      "grad_norm": 0.39896362219307346,
      "learning_rate": 4.6590386943849927e-05,
      "loss": 1.7779,
      "num_input_tokens_seen": 15034311936,
      "step": 19109
    },
    {
      "epoch": 2.027371101209421,
      "grad_norm": 0.4201482038580626,
      "learning_rate": 4.659003656622972e-05,
      "loss": 1.6026,
      "num_input_tokens_seen": 15035098656,
      "step": 19110
    },
    {
      "epoch": 2.0274771907489924,
      "grad_norm": 0.4007815449860253,
      "learning_rate": 4.658968617192536e-05,
      "loss": 1.5385,
      "num_input_tokens_seen": 15035885472,
      "step": 19111
    },
    {
      "epoch": 2.0275832802885634,
      "grad_norm": 0.3747576578018428,
      "learning_rate": 4.658933576093714e-05,
      "loss": 1.5741,
      "num_input_tokens_seen": 15036672192,
      "step": 19112
    },
    {
      "epoch": 2.027689369828135,
      "grad_norm": 0.3509299164289253,
      "learning_rate": 4.658898533326529e-05,
      "loss": 1.5515,
      "num_input_tokens_seen": 15037459024,
      "step": 19113
    },
    {
      "epoch": 2.0277954593677063,
      "grad_norm": 0.6900506768295869,
      "learning_rate": 4.6588634888910123e-05,
      "loss": 1.6194,
      "num_input_tokens_seen": 15038245760,
      "step": 19114
    },
    {
      "epoch": 2.027901548907278,
      "grad_norm": 0.6210499852433562,
      "learning_rate": 4.658828442787189e-05,
      "loss": 1.6562,
      "num_input_tokens_seen": 15039032544,
      "step": 19115
    },
    {
      "epoch": 2.0280076384468493,
      "grad_norm": 0.5551641917477138,
      "learning_rate": 4.6587933950150866e-05,
      "loss": 1.6804,
      "num_input_tokens_seen": 15039819232,
      "step": 19116
    },
    {
      "epoch": 2.0281137279864208,
      "grad_norm": 0.4771137913305529,
      "learning_rate": 4.6587583455747305e-05,
      "loss": 1.5796,
      "num_input_tokens_seen": 15040605984,
      "step": 19117
    },
    {
      "epoch": 2.028219817525992,
      "grad_norm": 0.48117363307931305,
      "learning_rate": 4.6587232944661505e-05,
      "loss": 1.5497,
      "num_input_tokens_seen": 15041392752,
      "step": 19118
    },
    {
      "epoch": 2.0283259070655633,
      "grad_norm": 0.36079666901186697,
      "learning_rate": 4.658688241689373e-05,
      "loss": 1.5386,
      "num_input_tokens_seen": 15042179504,
      "step": 19119
    },
    {
      "epoch": 2.0284319966051347,
      "grad_norm": 0.4615809465911484,
      "learning_rate": 4.658653187244424e-05,
      "loss": 1.514,
      "num_input_tokens_seen": 15042966336,
      "step": 19120
    },
    {
      "epoch": 2.028538086144706,
      "grad_norm": 0.5355153626653741,
      "learning_rate": 4.658618131131331e-05,
      "loss": 1.6815,
      "num_input_tokens_seen": 15043753104,
      "step": 19121
    },
    {
      "epoch": 2.0286441756842777,
      "grad_norm": 0.6787909566059122,
      "learning_rate": 4.658583073350121e-05,
      "loss": 1.6783,
      "num_input_tokens_seen": 15044539808,
      "step": 19122
    },
    {
      "epoch": 2.0287502652238487,
      "grad_norm": 0.37769384179806004,
      "learning_rate": 4.658548013900822e-05,
      "loss": 1.4665,
      "num_input_tokens_seen": 15045326688,
      "step": 19123
    },
    {
      "epoch": 2.02885635476342,
      "grad_norm": 0.5850977849413701,
      "learning_rate": 4.65851295278346e-05,
      "loss": 1.6604,
      "num_input_tokens_seen": 15046113600,
      "step": 19124
    },
    {
      "epoch": 2.0289624443029917,
      "grad_norm": 0.613385506728902,
      "learning_rate": 4.658477889998063e-05,
      "loss": 1.7162,
      "num_input_tokens_seen": 15046900368,
      "step": 19125
    },
    {
      "epoch": 2.029068533842563,
      "grad_norm": 0.48150033172858847,
      "learning_rate": 4.6584428255446574e-05,
      "loss": 1.6886,
      "num_input_tokens_seen": 15047687152,
      "step": 19126
    },
    {
      "epoch": 2.0291746233821346,
      "grad_norm": 0.6551341630525425,
      "learning_rate": 4.65840775942327e-05,
      "loss": 1.6583,
      "num_input_tokens_seen": 15048473968,
      "step": 19127
    },
    {
      "epoch": 2.029280712921706,
      "grad_norm": 0.40057089040170374,
      "learning_rate": 4.6583726916339294e-05,
      "loss": 1.7221,
      "num_input_tokens_seen": 15049260656,
      "step": 19128
    },
    {
      "epoch": 2.029386802461277,
      "grad_norm": 0.6124849548868363,
      "learning_rate": 4.658337622176661e-05,
      "loss": 1.654,
      "num_input_tokens_seen": 15050047376,
      "step": 19129
    },
    {
      "epoch": 2.0294928920008486,
      "grad_norm": 0.44067656882862327,
      "learning_rate": 4.658302551051493e-05,
      "loss": 1.5996,
      "num_input_tokens_seen": 15050834240,
      "step": 19130
    },
    {
      "epoch": 2.02959898154042,
      "grad_norm": 0.5006446979559916,
      "learning_rate": 4.6582674782584513e-05,
      "loss": 1.6675,
      "num_input_tokens_seen": 15051620912,
      "step": 19131
    },
    {
      "epoch": 2.0297050710799915,
      "grad_norm": 0.46058323484364,
      "learning_rate": 4.658232403797565e-05,
      "loss": 1.6718,
      "num_input_tokens_seen": 15052407632,
      "step": 19132
    },
    {
      "epoch": 2.029811160619563,
      "grad_norm": 0.4359147841224344,
      "learning_rate": 4.658197327668859e-05,
      "loss": 1.6211,
      "num_input_tokens_seen": 15053194384,
      "step": 19133
    },
    {
      "epoch": 2.0299172501591345,
      "grad_norm": 0.5020693006968812,
      "learning_rate": 4.658162249872362e-05,
      "loss": 1.7392,
      "num_input_tokens_seen": 15053981088,
      "step": 19134
    },
    {
      "epoch": 2.0300233396987055,
      "grad_norm": 0.43419532677292677,
      "learning_rate": 4.6581271704081e-05,
      "loss": 1.6134,
      "num_input_tokens_seen": 15054767728,
      "step": 19135
    },
    {
      "epoch": 2.030129429238277,
      "grad_norm": 0.47362846150370624,
      "learning_rate": 4.658092089276102e-05,
      "loss": 1.7261,
      "num_input_tokens_seen": 15055554480,
      "step": 19136
    },
    {
      "epoch": 2.0302355187778485,
      "grad_norm": 0.3639609052917257,
      "learning_rate": 4.658057006476392e-05,
      "loss": 1.6538,
      "num_input_tokens_seen": 15056341296,
      "step": 19137
    },
    {
      "epoch": 2.03034160831742,
      "grad_norm": 0.5053604564219152,
      "learning_rate": 4.658021922009e-05,
      "loss": 1.5197,
      "num_input_tokens_seen": 15057128176,
      "step": 19138
    },
    {
      "epoch": 2.0304476978569914,
      "grad_norm": 0.4261350839072176,
      "learning_rate": 4.657986835873951e-05,
      "loss": 1.6461,
      "num_input_tokens_seen": 15057914976,
      "step": 19139
    },
    {
      "epoch": 2.030553787396563,
      "grad_norm": 0.4650785292170302,
      "learning_rate": 4.657951748071274e-05,
      "loss": 1.5779,
      "num_input_tokens_seen": 15058701728,
      "step": 19140
    },
    {
      "epoch": 2.030659876936134,
      "grad_norm": 0.39839285950935427,
      "learning_rate": 4.657916658600995e-05,
      "loss": 1.6145,
      "num_input_tokens_seen": 15059488512,
      "step": 19141
    },
    {
      "epoch": 2.0307659664757054,
      "grad_norm": 0.39061190494124526,
      "learning_rate": 4.6578815674631415e-05,
      "loss": 1.6419,
      "num_input_tokens_seen": 15060275296,
      "step": 19142
    },
    {
      "epoch": 2.030872056015277,
      "grad_norm": 0.4073535598217496,
      "learning_rate": 4.65784647465774e-05,
      "loss": 1.4769,
      "num_input_tokens_seen": 15061062112,
      "step": 19143
    },
    {
      "epoch": 2.0309781455548483,
      "grad_norm": 0.42417647668169034,
      "learning_rate": 4.657811380184818e-05,
      "loss": 1.7406,
      "num_input_tokens_seen": 15061848784,
      "step": 19144
    },
    {
      "epoch": 2.03108423509442,
      "grad_norm": 0.43291928075105435,
      "learning_rate": 4.657776284044403e-05,
      "loss": 1.7134,
      "num_input_tokens_seen": 15062635568,
      "step": 19145
    },
    {
      "epoch": 2.0311903246339913,
      "grad_norm": 0.4290008171950217,
      "learning_rate": 4.6577411862365215e-05,
      "loss": 1.5664,
      "num_input_tokens_seen": 15063422288,
      "step": 19146
    },
    {
      "epoch": 2.0312964141735623,
      "grad_norm": 0.4016858744306032,
      "learning_rate": 4.6577060867612015e-05,
      "loss": 1.5949,
      "num_input_tokens_seen": 15064209072,
      "step": 19147
    },
    {
      "epoch": 2.031402503713134,
      "grad_norm": 0.47952108476565153,
      "learning_rate": 4.657670985618469e-05,
      "loss": 1.6913,
      "num_input_tokens_seen": 15064995904,
      "step": 19148
    },
    {
      "epoch": 2.0315085932527053,
      "grad_norm": 0.52875031066848,
      "learning_rate": 4.657635882808352e-05,
      "loss": 1.509,
      "num_input_tokens_seen": 15065782560,
      "step": 19149
    },
    {
      "epoch": 2.0316146827922767,
      "grad_norm": 0.5016103765247195,
      "learning_rate": 4.657600778330877e-05,
      "loss": 1.6388,
      "num_input_tokens_seen": 15066569392,
      "step": 19150
    },
    {
      "epoch": 2.0317207723318482,
      "grad_norm": 0.4787498605101359,
      "learning_rate": 4.657565672186072e-05,
      "loss": 1.5383,
      "num_input_tokens_seen": 15067356176,
      "step": 19151
    },
    {
      "epoch": 2.0318268618714193,
      "grad_norm": 0.4932233622751192,
      "learning_rate": 4.6575305643739634e-05,
      "loss": 1.6272,
      "num_input_tokens_seen": 15068142992,
      "step": 19152
    },
    {
      "epoch": 2.0319329514109907,
      "grad_norm": 0.3906437952978801,
      "learning_rate": 4.6574954548945785e-05,
      "loss": 1.6779,
      "num_input_tokens_seen": 15068929664,
      "step": 19153
    },
    {
      "epoch": 2.032039040950562,
      "grad_norm": 0.525897197875247,
      "learning_rate": 4.6574603437479433e-05,
      "loss": 1.6457,
      "num_input_tokens_seen": 15069716368,
      "step": 19154
    },
    {
      "epoch": 2.0321451304901337,
      "grad_norm": 0.4090024442890208,
      "learning_rate": 4.657425230934087e-05,
      "loss": 1.7532,
      "num_input_tokens_seen": 15070503104,
      "step": 19155
    },
    {
      "epoch": 2.032251220029705,
      "grad_norm": 0.4380789685560018,
      "learning_rate": 4.657390116453036e-05,
      "loss": 1.696,
      "num_input_tokens_seen": 15071289824,
      "step": 19156
    },
    {
      "epoch": 2.0323573095692766,
      "grad_norm": 0.45091328485591975,
      "learning_rate": 4.6573550003048174e-05,
      "loss": 1.5921,
      "num_input_tokens_seen": 15072076560,
      "step": 19157
    },
    {
      "epoch": 2.0324633991088477,
      "grad_norm": 0.5266830620971485,
      "learning_rate": 4.6573198824894573e-05,
      "loss": 1.6938,
      "num_input_tokens_seen": 15072863520,
      "step": 19158
    },
    {
      "epoch": 2.032569488648419,
      "grad_norm": 0.39455361183804155,
      "learning_rate": 4.657284763006984e-05,
      "loss": 1.6117,
      "num_input_tokens_seen": 15073650208,
      "step": 19159
    },
    {
      "epoch": 2.0326755781879906,
      "grad_norm": 0.4184717631357317,
      "learning_rate": 4.6572496418574244e-05,
      "loss": 1.5844,
      "num_input_tokens_seen": 15074436960,
      "step": 19160
    },
    {
      "epoch": 2.032781667727562,
      "grad_norm": 0.42202955241511825,
      "learning_rate": 4.657214519040806e-05,
      "loss": 1.6831,
      "num_input_tokens_seen": 15075223680,
      "step": 19161
    },
    {
      "epoch": 2.0328877572671336,
      "grad_norm": 0.4075580578834036,
      "learning_rate": 4.6571793945571544e-05,
      "loss": 1.6483,
      "num_input_tokens_seen": 15076010480,
      "step": 19162
    },
    {
      "epoch": 2.032993846806705,
      "grad_norm": 0.3783304882045173,
      "learning_rate": 4.657144268406498e-05,
      "loss": 1.474,
      "num_input_tokens_seen": 15076797232,
      "step": 19163
    },
    {
      "epoch": 2.033099936346276,
      "grad_norm": 0.3686990003045342,
      "learning_rate": 4.657109140588865e-05,
      "loss": 1.5212,
      "num_input_tokens_seen": 15077584048,
      "step": 19164
    },
    {
      "epoch": 2.0332060258858475,
      "grad_norm": 0.38302703699920626,
      "learning_rate": 4.65707401110428e-05,
      "loss": 1.6221,
      "num_input_tokens_seen": 15078370752,
      "step": 19165
    },
    {
      "epoch": 2.033312115425419,
      "grad_norm": 0.3816887120308365,
      "learning_rate": 4.657038879952773e-05,
      "loss": 1.6034,
      "num_input_tokens_seen": 15079157616,
      "step": 19166
    },
    {
      "epoch": 2.0334182049649905,
      "grad_norm": 0.40472914952901584,
      "learning_rate": 4.6570037471343685e-05,
      "loss": 1.6065,
      "num_input_tokens_seen": 15079944320,
      "step": 19167
    },
    {
      "epoch": 2.033524294504562,
      "grad_norm": 0.4123766669488451,
      "learning_rate": 4.656968612649095e-05,
      "loss": 1.6634,
      "num_input_tokens_seen": 15080731152,
      "step": 19168
    },
    {
      "epoch": 2.0336303840441334,
      "grad_norm": 0.354821359161361,
      "learning_rate": 4.6569334764969794e-05,
      "loss": 1.5938,
      "num_input_tokens_seen": 15081517984,
      "step": 19169
    },
    {
      "epoch": 2.0337364735837045,
      "grad_norm": 0.35709140507736126,
      "learning_rate": 4.656898338678049e-05,
      "loss": 1.5342,
      "num_input_tokens_seen": 15082304832,
      "step": 19170
    },
    {
      "epoch": 2.033842563123276,
      "grad_norm": 0.39981073850344595,
      "learning_rate": 4.656863199192332e-05,
      "loss": 1.7369,
      "num_input_tokens_seen": 15083091600,
      "step": 19171
    },
    {
      "epoch": 2.0339486526628474,
      "grad_norm": 0.4337160319449534,
      "learning_rate": 4.656828058039853e-05,
      "loss": 1.6154,
      "num_input_tokens_seen": 15083878416,
      "step": 19172
    },
    {
      "epoch": 2.034054742202419,
      "grad_norm": 0.38366363527237024,
      "learning_rate": 4.656792915220641e-05,
      "loss": 1.6203,
      "num_input_tokens_seen": 15084665152,
      "step": 19173
    },
    {
      "epoch": 2.0341608317419904,
      "grad_norm": 0.36798671823230705,
      "learning_rate": 4.656757770734722e-05,
      "loss": 1.6814,
      "num_input_tokens_seen": 15085451936,
      "step": 19174
    },
    {
      "epoch": 2.034266921281562,
      "grad_norm": 0.3295835129357886,
      "learning_rate": 4.656722624582125e-05,
      "loss": 1.5369,
      "num_input_tokens_seen": 15086238688,
      "step": 19175
    },
    {
      "epoch": 2.034373010821133,
      "grad_norm": 0.3574217954073636,
      "learning_rate": 4.656687476762876e-05,
      "loss": 1.5493,
      "num_input_tokens_seen": 15087025456,
      "step": 19176
    },
    {
      "epoch": 2.0344791003607043,
      "grad_norm": 0.357206848851076,
      "learning_rate": 4.656652327277001e-05,
      "loss": 1.7336,
      "num_input_tokens_seen": 15087812128,
      "step": 19177
    },
    {
      "epoch": 2.034585189900276,
      "grad_norm": 0.3705164776445659,
      "learning_rate": 4.656617176124529e-05,
      "loss": 1.5397,
      "num_input_tokens_seen": 15088598928,
      "step": 19178
    },
    {
      "epoch": 2.0346912794398473,
      "grad_norm": 0.3886943673192948,
      "learning_rate": 4.656582023305487e-05,
      "loss": 1.7174,
      "num_input_tokens_seen": 15089385728,
      "step": 19179
    },
    {
      "epoch": 2.0347973689794188,
      "grad_norm": 0.4449560405780761,
      "learning_rate": 4.656546868819901e-05,
      "loss": 1.604,
      "num_input_tokens_seen": 15090172432,
      "step": 19180
    },
    {
      "epoch": 2.0349034585189902,
      "grad_norm": 0.3946631149134207,
      "learning_rate": 4.656511712667799e-05,
      "loss": 1.5869,
      "num_input_tokens_seen": 15090959216,
      "step": 19181
    },
    {
      "epoch": 2.0350095480585613,
      "grad_norm": 0.3903263001261158,
      "learning_rate": 4.656476554849208e-05,
      "loss": 1.6341,
      "num_input_tokens_seen": 15091746016,
      "step": 19182
    },
    {
      "epoch": 2.0351156375981327,
      "grad_norm": 0.38382556763918196,
      "learning_rate": 4.6564413953641564e-05,
      "loss": 1.5764,
      "num_input_tokens_seen": 15092532848,
      "step": 19183
    },
    {
      "epoch": 2.035221727137704,
      "grad_norm": 0.44385141432707836,
      "learning_rate": 4.656406234212669e-05,
      "loss": 1.6691,
      "num_input_tokens_seen": 15093319680,
      "step": 19184
    },
    {
      "epoch": 2.0353278166772757,
      "grad_norm": 0.39057913086197465,
      "learning_rate": 4.656371071394774e-05,
      "loss": 1.614,
      "num_input_tokens_seen": 15094106512,
      "step": 19185
    },
    {
      "epoch": 2.035433906216847,
      "grad_norm": 0.4866400216256032,
      "learning_rate": 4.656335906910499e-05,
      "loss": 1.6155,
      "num_input_tokens_seen": 15094893216,
      "step": 19186
    },
    {
      "epoch": 2.0355399957564186,
      "grad_norm": 0.38583369588920297,
      "learning_rate": 4.6563007407598706e-05,
      "loss": 1.5049,
      "num_input_tokens_seen": 15095680048,
      "step": 19187
    },
    {
      "epoch": 2.0356460852959897,
      "grad_norm": 0.616662234373036,
      "learning_rate": 4.656265572942917e-05,
      "loss": 1.5782,
      "num_input_tokens_seen": 15096466800,
      "step": 19188
    },
    {
      "epoch": 2.035752174835561,
      "grad_norm": 0.36987396645604914,
      "learning_rate": 4.656230403459664e-05,
      "loss": 1.6838,
      "num_input_tokens_seen": 15097253520,
      "step": 19189
    },
    {
      "epoch": 2.0358582643751326,
      "grad_norm": 0.5617199039151779,
      "learning_rate": 4.6561952323101396e-05,
      "loss": 1.5434,
      "num_input_tokens_seen": 15098040336,
      "step": 19190
    },
    {
      "epoch": 2.035964353914704,
      "grad_norm": 0.3737774090007862,
      "learning_rate": 4.65616005949437e-05,
      "loss": 1.5422,
      "num_input_tokens_seen": 15098827104,
      "step": 19191
    },
    {
      "epoch": 2.0360704434542756,
      "grad_norm": 0.5227221821103833,
      "learning_rate": 4.656124885012385e-05,
      "loss": 1.7047,
      "num_input_tokens_seen": 15099613856,
      "step": 19192
    },
    {
      "epoch": 2.0361765329938466,
      "grad_norm": 0.396468043329425,
      "learning_rate": 4.656089708864209e-05,
      "loss": 1.4905,
      "num_input_tokens_seen": 15100400624,
      "step": 19193
    },
    {
      "epoch": 2.036282622533418,
      "grad_norm": 0.43379758787512773,
      "learning_rate": 4.6560545310498696e-05,
      "loss": 1.5637,
      "num_input_tokens_seen": 15101187456,
      "step": 19194
    },
    {
      "epoch": 2.0363887120729895,
      "grad_norm": 0.4663637188440972,
      "learning_rate": 4.656019351569395e-05,
      "loss": 1.5221,
      "num_input_tokens_seen": 15101974288,
      "step": 19195
    },
    {
      "epoch": 2.036494801612561,
      "grad_norm": 0.3941921300796757,
      "learning_rate": 4.655984170422811e-05,
      "loss": 1.7122,
      "num_input_tokens_seen": 15102761056,
      "step": 19196
    },
    {
      "epoch": 2.0366008911521325,
      "grad_norm": 0.6205040102194082,
      "learning_rate": 4.655948987610147e-05,
      "loss": 1.7127,
      "num_input_tokens_seen": 15103547904,
      "step": 19197
    },
    {
      "epoch": 2.036706980691704,
      "grad_norm": 0.3913077830337822,
      "learning_rate": 4.655913803131429e-05,
      "loss": 1.6026,
      "num_input_tokens_seen": 15104334688,
      "step": 19198
    },
    {
      "epoch": 2.036813070231275,
      "grad_norm": 0.4964533118746366,
      "learning_rate": 4.655878616986683e-05,
      "loss": 1.5656,
      "num_input_tokens_seen": 15105121520,
      "step": 19199
    },
    {
      "epoch": 2.0369191597708465,
      "grad_norm": 0.4470419188636098,
      "learning_rate": 4.655843429175938e-05,
      "loss": 1.4847,
      "num_input_tokens_seen": 15105908336,
      "step": 19200
    },
    {
      "epoch": 2.037025249310418,
      "grad_norm": 0.5000748159298888,
      "learning_rate": 4.65580823969922e-05,
      "loss": 1.5956,
      "num_input_tokens_seen": 15106695168,
      "step": 19201
    },
    {
      "epoch": 2.0371313388499894,
      "grad_norm": 0.4825115391692476,
      "learning_rate": 4.6557730485565566e-05,
      "loss": 1.7242,
      "num_input_tokens_seen": 15107481856,
      "step": 19202
    },
    {
      "epoch": 2.037237428389561,
      "grad_norm": 0.4519391950692747,
      "learning_rate": 4.655737855747976e-05,
      "loss": 1.6644,
      "num_input_tokens_seen": 15108268624,
      "step": 19203
    },
    {
      "epoch": 2.0373435179291324,
      "grad_norm": 0.4970395896530681,
      "learning_rate": 4.6557026612735034e-05,
      "loss": 1.7251,
      "num_input_tokens_seen": 15109055280,
      "step": 19204
    },
    {
      "epoch": 2.0374496074687034,
      "grad_norm": 0.3768446476391665,
      "learning_rate": 4.655667465133168e-05,
      "loss": 1.5281,
      "num_input_tokens_seen": 15109842048,
      "step": 19205
    },
    {
      "epoch": 2.037555697008275,
      "grad_norm": 0.5115030115064629,
      "learning_rate": 4.6556322673269946e-05,
      "loss": 1.5942,
      "num_input_tokens_seen": 15110628784,
      "step": 19206
    },
    {
      "epoch": 2.0376617865478464,
      "grad_norm": 0.3697872851146245,
      "learning_rate": 4.655597067855013e-05,
      "loss": 1.5421,
      "num_input_tokens_seen": 15111415552,
      "step": 19207
    },
    {
      "epoch": 2.037767876087418,
      "grad_norm": 0.41362052912831615,
      "learning_rate": 4.655561866717248e-05,
      "loss": 1.6327,
      "num_input_tokens_seen": 15112202336,
      "step": 19208
    },
    {
      "epoch": 2.0378739656269893,
      "grad_norm": 0.5596550298162852,
      "learning_rate": 4.6555266639137294e-05,
      "loss": 1.6706,
      "num_input_tokens_seen": 15112989072,
      "step": 19209
    },
    {
      "epoch": 2.0379800551665608,
      "grad_norm": 0.3540993270020605,
      "learning_rate": 4.6554914594444824e-05,
      "loss": 1.4991,
      "num_input_tokens_seen": 15113775952,
      "step": 19210
    },
    {
      "epoch": 2.038086144706132,
      "grad_norm": 0.4515224732694649,
      "learning_rate": 4.655456253309535e-05,
      "loss": 1.607,
      "num_input_tokens_seen": 15114562800,
      "step": 19211
    },
    {
      "epoch": 2.0381922342457033,
      "grad_norm": 0.5180855913748302,
      "learning_rate": 4.655421045508914e-05,
      "loss": 1.6733,
      "num_input_tokens_seen": 15115349504,
      "step": 19212
    },
    {
      "epoch": 2.0382983237852748,
      "grad_norm": 0.36396581520300697,
      "learning_rate": 4.655385836042648e-05,
      "loss": 1.6252,
      "num_input_tokens_seen": 15116136224,
      "step": 19213
    },
    {
      "epoch": 2.0384044133248462,
      "grad_norm": 0.604878992890442,
      "learning_rate": 4.655350624910762e-05,
      "loss": 1.6015,
      "num_input_tokens_seen": 15116923024,
      "step": 19214
    },
    {
      "epoch": 2.0385105028644177,
      "grad_norm": 0.3873124989171202,
      "learning_rate": 4.655315412113285e-05,
      "loss": 1.7403,
      "num_input_tokens_seen": 15117709744,
      "step": 19215
    },
    {
      "epoch": 2.038616592403989,
      "grad_norm": 0.3989255913787949,
      "learning_rate": 4.655280197650242e-05,
      "loss": 1.5724,
      "num_input_tokens_seen": 15118496496,
      "step": 19216
    },
    {
      "epoch": 2.03872268194356,
      "grad_norm": 0.47591435283894584,
      "learning_rate": 4.6552449815216634e-05,
      "loss": 1.5141,
      "num_input_tokens_seen": 15119283280,
      "step": 19217
    },
    {
      "epoch": 2.0388287714831317,
      "grad_norm": 0.3538939599559482,
      "learning_rate": 4.655209763727574e-05,
      "loss": 1.6199,
      "num_input_tokens_seen": 15120070096,
      "step": 19218
    },
    {
      "epoch": 2.038934861022703,
      "grad_norm": 0.4613184081464656,
      "learning_rate": 4.655174544268001e-05,
      "loss": 1.6037,
      "num_input_tokens_seen": 15120856816,
      "step": 19219
    },
    {
      "epoch": 2.0390409505622746,
      "grad_norm": 0.45935107633504235,
      "learning_rate": 4.6551393231429734e-05,
      "loss": 1.6708,
      "num_input_tokens_seen": 15121643616,
      "step": 19220
    },
    {
      "epoch": 2.039147040101846,
      "grad_norm": 0.46014826406648107,
      "learning_rate": 4.655104100352517e-05,
      "loss": 1.8461,
      "num_input_tokens_seen": 15122430288,
      "step": 19221
    },
    {
      "epoch": 2.039253129641417,
      "grad_norm": 0.4172108474955625,
      "learning_rate": 4.6550688758966595e-05,
      "loss": 1.6499,
      "num_input_tokens_seen": 15123217056,
      "step": 19222
    },
    {
      "epoch": 2.0393592191809886,
      "grad_norm": 0.3926785360294066,
      "learning_rate": 4.6550336497754275e-05,
      "loss": 1.7038,
      "num_input_tokens_seen": 15124003792,
      "step": 19223
    },
    {
      "epoch": 2.03946530872056,
      "grad_norm": 0.36062164983360595,
      "learning_rate": 4.6549984219888496e-05,
      "loss": 1.5082,
      "num_input_tokens_seen": 15124790560,
      "step": 19224
    },
    {
      "epoch": 2.0395713982601316,
      "grad_norm": 0.3918454892215017,
      "learning_rate": 4.654963192536952e-05,
      "loss": 1.7409,
      "num_input_tokens_seen": 15125577328,
      "step": 19225
    },
    {
      "epoch": 2.039677487799703,
      "grad_norm": 0.4069243437981088,
      "learning_rate": 4.654927961419762e-05,
      "loss": 1.517,
      "num_input_tokens_seen": 15126364096,
      "step": 19226
    },
    {
      "epoch": 2.0397835773392745,
      "grad_norm": 0.3729079116004182,
      "learning_rate": 4.6548927286373055e-05,
      "loss": 1.4245,
      "num_input_tokens_seen": 15127150864,
      "step": 19227
    },
    {
      "epoch": 2.0398896668788455,
      "grad_norm": 0.40310181221662017,
      "learning_rate": 4.654857494189613e-05,
      "loss": 1.5358,
      "num_input_tokens_seen": 15127937632,
      "step": 19228
    },
    {
      "epoch": 2.039995756418417,
      "grad_norm": 0.41428782683153886,
      "learning_rate": 4.6548222580767086e-05,
      "loss": 1.6639,
      "num_input_tokens_seen": 15128724320,
      "step": 19229
    },
    {
      "epoch": 2.0401018459579885,
      "grad_norm": 0.4552556304225109,
      "learning_rate": 4.654787020298622e-05,
      "loss": 1.7255,
      "num_input_tokens_seen": 15129511104,
      "step": 19230
    },
    {
      "epoch": 2.04020793549756,
      "grad_norm": 0.41724273107275744,
      "learning_rate": 4.6547517808553786e-05,
      "loss": 1.5011,
      "num_input_tokens_seen": 15130297968,
      "step": 19231
    },
    {
      "epoch": 2.0403140250371314,
      "grad_norm": 0.42557636357219686,
      "learning_rate": 4.654716539747006e-05,
      "loss": 1.742,
      "num_input_tokens_seen": 15131084720,
      "step": 19232
    },
    {
      "epoch": 2.040420114576703,
      "grad_norm": 0.44367129343541506,
      "learning_rate": 4.654681296973532e-05,
      "loss": 1.6898,
      "num_input_tokens_seen": 15131871456,
      "step": 19233
    },
    {
      "epoch": 2.040526204116274,
      "grad_norm": 0.4478715737478099,
      "learning_rate": 4.6546460525349834e-05,
      "loss": 1.6958,
      "num_input_tokens_seen": 15132658256,
      "step": 19234
    },
    {
      "epoch": 2.0406322936558454,
      "grad_norm": 0.37365055859711954,
      "learning_rate": 4.654610806431388e-05,
      "loss": 1.5331,
      "num_input_tokens_seen": 15133445024,
      "step": 19235
    },
    {
      "epoch": 2.040738383195417,
      "grad_norm": 0.4266974546008347,
      "learning_rate": 4.654575558662771e-05,
      "loss": 1.5781,
      "num_input_tokens_seen": 15134231776,
      "step": 19236
    },
    {
      "epoch": 2.0408444727349884,
      "grad_norm": 0.40586627447893464,
      "learning_rate": 4.654540309229163e-05,
      "loss": 1.6951,
      "num_input_tokens_seen": 15135018480,
      "step": 19237
    },
    {
      "epoch": 2.04095056227456,
      "grad_norm": 0.3450514328309253,
      "learning_rate": 4.6545050581305883e-05,
      "loss": 1.6721,
      "num_input_tokens_seen": 15135805248,
      "step": 19238
    },
    {
      "epoch": 2.0410566518141313,
      "grad_norm": 0.40564473206897766,
      "learning_rate": 4.654469805367076e-05,
      "loss": 1.5307,
      "num_input_tokens_seen": 15136592016,
      "step": 19239
    },
    {
      "epoch": 2.0411627413537023,
      "grad_norm": 0.3915810471245173,
      "learning_rate": 4.654434550938653e-05,
      "loss": 1.6569,
      "num_input_tokens_seen": 15137378864,
      "step": 19240
    },
    {
      "epoch": 2.041268830893274,
      "grad_norm": 0.40911248870073524,
      "learning_rate": 4.654399294845345e-05,
      "loss": 1.6331,
      "num_input_tokens_seen": 15138165568,
      "step": 19241
    },
    {
      "epoch": 2.0413749204328453,
      "grad_norm": 0.40087253583146343,
      "learning_rate": 4.654364037087181e-05,
      "loss": 1.7529,
      "num_input_tokens_seen": 15138952192,
      "step": 19242
    },
    {
      "epoch": 2.0414810099724168,
      "grad_norm": 0.39345219190620223,
      "learning_rate": 4.654328777664188e-05,
      "loss": 1.7192,
      "num_input_tokens_seen": 15139738880,
      "step": 19243
    },
    {
      "epoch": 2.0415870995119882,
      "grad_norm": 0.4188795813159294,
      "learning_rate": 4.654293516576393e-05,
      "loss": 1.7042,
      "num_input_tokens_seen": 15140525600,
      "step": 19244
    },
    {
      "epoch": 2.0416931890515597,
      "grad_norm": 0.4035413273460121,
      "learning_rate": 4.654258253823823e-05,
      "loss": 1.697,
      "num_input_tokens_seen": 15141312304,
      "step": 19245
    },
    {
      "epoch": 2.0417992785911308,
      "grad_norm": 0.4258965406131173,
      "learning_rate": 4.654222989406505e-05,
      "loss": 1.5771,
      "num_input_tokens_seen": 15142099088,
      "step": 19246
    },
    {
      "epoch": 2.0419053681307022,
      "grad_norm": 0.41037664916140937,
      "learning_rate": 4.654187723324468e-05,
      "loss": 1.6775,
      "num_input_tokens_seen": 15142885744,
      "step": 19247
    },
    {
      "epoch": 2.0420114576702737,
      "grad_norm": 0.39321332728401687,
      "learning_rate": 4.654152455577736e-05,
      "loss": 1.475,
      "num_input_tokens_seen": 15143672512,
      "step": 19248
    },
    {
      "epoch": 2.042117547209845,
      "grad_norm": 0.3627668994778051,
      "learning_rate": 4.654117186166339e-05,
      "loss": 1.5869,
      "num_input_tokens_seen": 15144459248,
      "step": 19249
    },
    {
      "epoch": 2.0422236367494166,
      "grad_norm": 0.43374949867138773,
      "learning_rate": 4.6540819150903045e-05,
      "loss": 1.6068,
      "num_input_tokens_seen": 15145246048,
      "step": 19250
    },
    {
      "epoch": 2.042329726288988,
      "grad_norm": 0.37680292019644296,
      "learning_rate": 4.654046642349658e-05,
      "loss": 1.8002,
      "num_input_tokens_seen": 15146032720,
      "step": 19251
    },
    {
      "epoch": 2.042435815828559,
      "grad_norm": 0.5182851428383338,
      "learning_rate": 4.654011367944426e-05,
      "loss": 1.6651,
      "num_input_tokens_seen": 15146819424,
      "step": 19252
    },
    {
      "epoch": 2.0425419053681306,
      "grad_norm": 0.4003555083912439,
      "learning_rate": 4.653976091874639e-05,
      "loss": 1.6165,
      "num_input_tokens_seen": 15147606144,
      "step": 19253
    },
    {
      "epoch": 2.042647994907702,
      "grad_norm": 0.4776892102425203,
      "learning_rate": 4.653940814140322e-05,
      "loss": 1.4848,
      "num_input_tokens_seen": 15148392944,
      "step": 19254
    },
    {
      "epoch": 2.0427540844472736,
      "grad_norm": 0.3794186855163683,
      "learning_rate": 4.653905534741503e-05,
      "loss": 1.6577,
      "num_input_tokens_seen": 15149179728,
      "step": 19255
    },
    {
      "epoch": 2.042860173986845,
      "grad_norm": 0.4158720576780576,
      "learning_rate": 4.6538702536782086e-05,
      "loss": 1.6993,
      "num_input_tokens_seen": 15149966464,
      "step": 19256
    },
    {
      "epoch": 2.042966263526416,
      "grad_norm": 0.36650616826782817,
      "learning_rate": 4.653834970950467e-05,
      "loss": 1.6531,
      "num_input_tokens_seen": 15150753168,
      "step": 19257
    },
    {
      "epoch": 2.0430723530659876,
      "grad_norm": 0.4255269741901779,
      "learning_rate": 4.653799686558304e-05,
      "loss": 1.5439,
      "num_input_tokens_seen": 15151539984,
      "step": 19258
    },
    {
      "epoch": 2.043178442605559,
      "grad_norm": 0.40498386857185,
      "learning_rate": 4.653764400501748e-05,
      "loss": 1.5596,
      "num_input_tokens_seen": 15152326800,
      "step": 19259
    },
    {
      "epoch": 2.0432845321451305,
      "grad_norm": 0.3656394721568097,
      "learning_rate": 4.653729112780827e-05,
      "loss": 1.5435,
      "num_input_tokens_seen": 15153113520,
      "step": 19260
    },
    {
      "epoch": 2.043390621684702,
      "grad_norm": 0.393991735596571,
      "learning_rate": 4.6536938233955666e-05,
      "loss": 1.5925,
      "num_input_tokens_seen": 15153900304,
      "step": 19261
    },
    {
      "epoch": 2.0434967112242735,
      "grad_norm": 0.35526569109601847,
      "learning_rate": 4.6536585323459944e-05,
      "loss": 1.554,
      "num_input_tokens_seen": 15154687120,
      "step": 19262
    },
    {
      "epoch": 2.0436028007638445,
      "grad_norm": 0.40342505868940276,
      "learning_rate": 4.653623239632139e-05,
      "loss": 1.6649,
      "num_input_tokens_seen": 15155473824,
      "step": 19263
    },
    {
      "epoch": 2.043708890303416,
      "grad_norm": 0.3913233809103671,
      "learning_rate": 4.653587945254026e-05,
      "loss": 1.5881,
      "num_input_tokens_seen": 15156260688,
      "step": 19264
    },
    {
      "epoch": 2.0438149798429874,
      "grad_norm": 0.4284600121487767,
      "learning_rate": 4.653552649211684e-05,
      "loss": 1.5919,
      "num_input_tokens_seen": 15157047392,
      "step": 19265
    },
    {
      "epoch": 2.043921069382559,
      "grad_norm": 0.3573913170549986,
      "learning_rate": 4.653517351505139e-05,
      "loss": 1.6904,
      "num_input_tokens_seen": 15157834112,
      "step": 19266
    },
    {
      "epoch": 2.0440271589221304,
      "grad_norm": 0.378414013869025,
      "learning_rate": 4.65348205213442e-05,
      "loss": 1.5519,
      "num_input_tokens_seen": 15158620976,
      "step": 19267
    },
    {
      "epoch": 2.044133248461702,
      "grad_norm": 0.3674120261509219,
      "learning_rate": 4.6534467510995525e-05,
      "loss": 1.7764,
      "num_input_tokens_seen": 15159407744,
      "step": 19268
    },
    {
      "epoch": 2.044239338001273,
      "grad_norm": 0.3546523264916742,
      "learning_rate": 4.653411448400565e-05,
      "loss": 1.6676,
      "num_input_tokens_seen": 15160194464,
      "step": 19269
    },
    {
      "epoch": 2.0443454275408444,
      "grad_norm": 0.3687674523394864,
      "learning_rate": 4.653376144037483e-05,
      "loss": 1.689,
      "num_input_tokens_seen": 15160981200,
      "step": 19270
    },
    {
      "epoch": 2.044451517080416,
      "grad_norm": 0.38859493229758957,
      "learning_rate": 4.653340838010337e-05,
      "loss": 1.5611,
      "num_input_tokens_seen": 15161767904,
      "step": 19271
    },
    {
      "epoch": 2.0445576066199873,
      "grad_norm": 0.42526715629409895,
      "learning_rate": 4.6533055303191514e-05,
      "loss": 1.5841,
      "num_input_tokens_seen": 15162554688,
      "step": 19272
    },
    {
      "epoch": 2.044663696159559,
      "grad_norm": 0.46595536852340824,
      "learning_rate": 4.6532702209639544e-05,
      "loss": 1.6292,
      "num_input_tokens_seen": 15163341408,
      "step": 19273
    },
    {
      "epoch": 2.0447697856991303,
      "grad_norm": 0.4198242117690767,
      "learning_rate": 4.6532349099447735e-05,
      "loss": 1.692,
      "num_input_tokens_seen": 15164128096,
      "step": 19274
    },
    {
      "epoch": 2.0448758752387013,
      "grad_norm": 0.4722434596538462,
      "learning_rate": 4.6531995972616363e-05,
      "loss": 1.7163,
      "num_input_tokens_seen": 15164914848,
      "step": 19275
    },
    {
      "epoch": 2.0449819647782728,
      "grad_norm": 0.4370879898495369,
      "learning_rate": 4.6531642829145693e-05,
      "loss": 1.5438,
      "num_input_tokens_seen": 15165701568,
      "step": 19276
    },
    {
      "epoch": 2.0450880543178442,
      "grad_norm": 0.4322234228587223,
      "learning_rate": 4.6531289669035996e-05,
      "loss": 1.6169,
      "num_input_tokens_seen": 15166488288,
      "step": 19277
    },
    {
      "epoch": 2.0451941438574157,
      "grad_norm": 0.43970578648110975,
      "learning_rate": 4.653093649228756e-05,
      "loss": 1.6079,
      "num_input_tokens_seen": 15167275056,
      "step": 19278
    },
    {
      "epoch": 2.045300233396987,
      "grad_norm": 0.402232707309987,
      "learning_rate": 4.6530583298900646e-05,
      "loss": 1.4646,
      "num_input_tokens_seen": 15168061808,
      "step": 19279
    },
    {
      "epoch": 2.0454063229365587,
      "grad_norm": 0.41589773126372154,
      "learning_rate": 4.653023008887552e-05,
      "loss": 1.5921,
      "num_input_tokens_seen": 15168848656,
      "step": 19280
    },
    {
      "epoch": 2.0455124124761297,
      "grad_norm": 0.3679515171629363,
      "learning_rate": 4.652987686221247e-05,
      "loss": 1.6243,
      "num_input_tokens_seen": 15169635408,
      "step": 19281
    },
    {
      "epoch": 2.045618502015701,
      "grad_norm": 0.3794960607366127,
      "learning_rate": 4.652952361891176e-05,
      "loss": 1.5727,
      "num_input_tokens_seen": 15170422304,
      "step": 19282
    },
    {
      "epoch": 2.0457245915552726,
      "grad_norm": 0.3708296741635047,
      "learning_rate": 4.6529170358973674e-05,
      "loss": 1.5608,
      "num_input_tokens_seen": 15171209088,
      "step": 19283
    },
    {
      "epoch": 2.045830681094844,
      "grad_norm": 0.36247425138504186,
      "learning_rate": 4.652881708239847e-05,
      "loss": 1.628,
      "num_input_tokens_seen": 15171995824,
      "step": 19284
    },
    {
      "epoch": 2.0459367706344156,
      "grad_norm": 0.4220066209862043,
      "learning_rate": 4.652846378918643e-05,
      "loss": 1.7231,
      "num_input_tokens_seen": 15172782576,
      "step": 19285
    },
    {
      "epoch": 2.046042860173987,
      "grad_norm": 0.4682226138373718,
      "learning_rate": 4.6528110479337815e-05,
      "loss": 1.6767,
      "num_input_tokens_seen": 15173569280,
      "step": 19286
    },
    {
      "epoch": 2.046148949713558,
      "grad_norm": 0.390521633178056,
      "learning_rate": 4.6527757152852924e-05,
      "loss": 1.6475,
      "num_input_tokens_seen": 15174356032,
      "step": 19287
    },
    {
      "epoch": 2.0462550392531296,
      "grad_norm": 0.4719364958598533,
      "learning_rate": 4.652740380973201e-05,
      "loss": 1.6693,
      "num_input_tokens_seen": 15175142672,
      "step": 19288
    },
    {
      "epoch": 2.046361128792701,
      "grad_norm": 0.472579524428068,
      "learning_rate": 4.652705044997534e-05,
      "loss": 1.8067,
      "num_input_tokens_seen": 15175929344,
      "step": 19289
    },
    {
      "epoch": 2.0464672183322725,
      "grad_norm": 0.4397480448890877,
      "learning_rate": 4.6526697073583204e-05,
      "loss": 1.7148,
      "num_input_tokens_seen": 15176716096,
      "step": 19290
    },
    {
      "epoch": 2.046573307871844,
      "grad_norm": 0.4187413645098872,
      "learning_rate": 4.652634368055587e-05,
      "loss": 1.6796,
      "num_input_tokens_seen": 15177502896,
      "step": 19291
    },
    {
      "epoch": 2.046679397411415,
      "grad_norm": 0.44515599719811716,
      "learning_rate": 4.6525990270893606e-05,
      "loss": 1.6612,
      "num_input_tokens_seen": 15178289584,
      "step": 19292
    },
    {
      "epoch": 2.0467854869509865,
      "grad_norm": 0.47015260630518585,
      "learning_rate": 4.652563684459669e-05,
      "loss": 1.6326,
      "num_input_tokens_seen": 15179076400,
      "step": 19293
    },
    {
      "epoch": 2.046891576490558,
      "grad_norm": 0.3783957542363798,
      "learning_rate": 4.6525283401665395e-05,
      "loss": 1.4573,
      "num_input_tokens_seen": 15179863152,
      "step": 19294
    },
    {
      "epoch": 2.0469976660301294,
      "grad_norm": 0.41769359168288495,
      "learning_rate": 4.6524929942099987e-05,
      "loss": 1.6516,
      "num_input_tokens_seen": 15180649904,
      "step": 19295
    },
    {
      "epoch": 2.047103755569701,
      "grad_norm": 0.38943916495354003,
      "learning_rate": 4.652457646590075e-05,
      "loss": 1.5746,
      "num_input_tokens_seen": 15181436672,
      "step": 19296
    },
    {
      "epoch": 2.0472098451092724,
      "grad_norm": 0.37958257723457106,
      "learning_rate": 4.652422297306795e-05,
      "loss": 1.4672,
      "num_input_tokens_seen": 15182223440,
      "step": 19297
    },
    {
      "epoch": 2.0473159346488434,
      "grad_norm": 0.39285052466531345,
      "learning_rate": 4.652386946360186e-05,
      "loss": 1.558,
      "num_input_tokens_seen": 15183010208,
      "step": 19298
    },
    {
      "epoch": 2.047422024188415,
      "grad_norm": 0.4017213288972373,
      "learning_rate": 4.652351593750276e-05,
      "loss": 1.7079,
      "num_input_tokens_seen": 15183796912,
      "step": 19299
    },
    {
      "epoch": 2.0475281137279864,
      "grad_norm": 0.3970417210490865,
      "learning_rate": 4.652316239477091e-05,
      "loss": 1.5498,
      "num_input_tokens_seen": 15184583680,
      "step": 19300
    },
    {
      "epoch": 2.047634203267558,
      "grad_norm": 0.4345321135965298,
      "learning_rate": 4.65228088354066e-05,
      "loss": 1.7249,
      "num_input_tokens_seen": 15185370464,
      "step": 19301
    },
    {
      "epoch": 2.0477402928071293,
      "grad_norm": 0.34336752030944695,
      "learning_rate": 4.652245525941009e-05,
      "loss": 1.5722,
      "num_input_tokens_seen": 15186157216,
      "step": 19302
    },
    {
      "epoch": 2.047846382346701,
      "grad_norm": 0.37178620928353345,
      "learning_rate": 4.652210166678166e-05,
      "loss": 1.7755,
      "num_input_tokens_seen": 15186943920,
      "step": 19303
    },
    {
      "epoch": 2.047952471886272,
      "grad_norm": 0.38605462949961294,
      "learning_rate": 4.6521748057521584e-05,
      "loss": 1.6201,
      "num_input_tokens_seen": 15187730688,
      "step": 19304
    },
    {
      "epoch": 2.0480585614258433,
      "grad_norm": 0.35358928780713605,
      "learning_rate": 4.652139443163013e-05,
      "loss": 1.5814,
      "num_input_tokens_seen": 15188517472,
      "step": 19305
    },
    {
      "epoch": 2.048164650965415,
      "grad_norm": 0.4260433184762554,
      "learning_rate": 4.6521040789107576e-05,
      "loss": 1.8405,
      "num_input_tokens_seen": 15189304256,
      "step": 19306
    },
    {
      "epoch": 2.0482707405049863,
      "grad_norm": 0.35320657256941124,
      "learning_rate": 4.652068712995419e-05,
      "loss": 1.5666,
      "num_input_tokens_seen": 15190091056,
      "step": 19307
    },
    {
      "epoch": 2.0483768300445577,
      "grad_norm": 0.37958355646772207,
      "learning_rate": 4.652033345417025e-05,
      "loss": 1.524,
      "num_input_tokens_seen": 15190877824,
      "step": 19308
    },
    {
      "epoch": 2.048482919584129,
      "grad_norm": 0.3849578946531253,
      "learning_rate": 4.6519979761756026e-05,
      "loss": 1.4718,
      "num_input_tokens_seen": 15191664592,
      "step": 19309
    },
    {
      "epoch": 2.0485890091237002,
      "grad_norm": 0.41378667972956595,
      "learning_rate": 4.6519626052711794e-05,
      "loss": 1.615,
      "num_input_tokens_seen": 15192451344,
      "step": 19310
    },
    {
      "epoch": 2.0486950986632717,
      "grad_norm": 0.5827653294896712,
      "learning_rate": 4.651927232703783e-05,
      "loss": 1.8168,
      "num_input_tokens_seen": 15193238016,
      "step": 19311
    },
    {
      "epoch": 2.048801188202843,
      "grad_norm": 0.5658600884392129,
      "learning_rate": 4.65189185847344e-05,
      "loss": 1.661,
      "num_input_tokens_seen": 15194024800,
      "step": 19312
    },
    {
      "epoch": 2.0489072777424147,
      "grad_norm": 0.46856880795430456,
      "learning_rate": 4.651856482580178e-05,
      "loss": 1.5879,
      "num_input_tokens_seen": 15194811600,
      "step": 19313
    },
    {
      "epoch": 2.049013367281986,
      "grad_norm": 0.42642221551734383,
      "learning_rate": 4.651821105024024e-05,
      "loss": 1.4869,
      "num_input_tokens_seen": 15195598320,
      "step": 19314
    },
    {
      "epoch": 2.0491194568215576,
      "grad_norm": 0.4027096783433462,
      "learning_rate": 4.651785725805007e-05,
      "loss": 1.6469,
      "num_input_tokens_seen": 15196385152,
      "step": 19315
    },
    {
      "epoch": 2.0492255463611286,
      "grad_norm": 0.39938162829772256,
      "learning_rate": 4.6517503449231524e-05,
      "loss": 1.5638,
      "num_input_tokens_seen": 15197172000,
      "step": 19316
    },
    {
      "epoch": 2.0493316359007,
      "grad_norm": 0.4539786656419275,
      "learning_rate": 4.651714962378488e-05,
      "loss": 1.7216,
      "num_input_tokens_seen": 15197958704,
      "step": 19317
    },
    {
      "epoch": 2.0494377254402716,
      "grad_norm": 0.41658661099425554,
      "learning_rate": 4.6516795781710425e-05,
      "loss": 1.526,
      "num_input_tokens_seen": 15198745456,
      "step": 19318
    },
    {
      "epoch": 2.049543814979843,
      "grad_norm": 0.4267254711830691,
      "learning_rate": 4.6516441923008414e-05,
      "loss": 1.6099,
      "num_input_tokens_seen": 15199532240,
      "step": 19319
    },
    {
      "epoch": 2.0496499045194145,
      "grad_norm": 0.481284160753019,
      "learning_rate": 4.651608804767913e-05,
      "loss": 1.6157,
      "num_input_tokens_seen": 15200318944,
      "step": 19320
    },
    {
      "epoch": 2.0497559940589856,
      "grad_norm": 0.43734953039205654,
      "learning_rate": 4.6515734155722846e-05,
      "loss": 1.583,
      "num_input_tokens_seen": 15201105728,
      "step": 19321
    },
    {
      "epoch": 2.049862083598557,
      "grad_norm": 0.47450370916016105,
      "learning_rate": 4.651538024713983e-05,
      "loss": 1.6539,
      "num_input_tokens_seen": 15201892464,
      "step": 19322
    },
    {
      "epoch": 2.0499681731381285,
      "grad_norm": 0.6503781253624548,
      "learning_rate": 4.651502632193036e-05,
      "loss": 1.6051,
      "num_input_tokens_seen": 15202679264,
      "step": 19323
    },
    {
      "epoch": 2.0500742626777,
      "grad_norm": 0.37140835653989696,
      "learning_rate": 4.651467238009471e-05,
      "loss": 1.6039,
      "num_input_tokens_seen": 15203465952,
      "step": 19324
    },
    {
      "epoch": 2.0501803522172715,
      "grad_norm": 0.5108204338070338,
      "learning_rate": 4.651431842163315e-05,
      "loss": 1.5525,
      "num_input_tokens_seen": 15204252704,
      "step": 19325
    },
    {
      "epoch": 2.050286441756843,
      "grad_norm": 0.5222631233289393,
      "learning_rate": 4.651396444654596e-05,
      "loss": 1.6457,
      "num_input_tokens_seen": 15205039472,
      "step": 19326
    },
    {
      "epoch": 2.050392531296414,
      "grad_norm": 0.4413273253736269,
      "learning_rate": 4.6513610454833405e-05,
      "loss": 1.6513,
      "num_input_tokens_seen": 15205826336,
      "step": 19327
    },
    {
      "epoch": 2.0504986208359854,
      "grad_norm": 0.6339963629006623,
      "learning_rate": 4.6513256446495766e-05,
      "loss": 1.5771,
      "num_input_tokens_seen": 15206613088,
      "step": 19328
    },
    {
      "epoch": 2.050604710375557,
      "grad_norm": 0.3888352804881939,
      "learning_rate": 4.651290242153331e-05,
      "loss": 1.4876,
      "num_input_tokens_seen": 15207399856,
      "step": 19329
    },
    {
      "epoch": 2.0507107999151284,
      "grad_norm": 0.42752203491337104,
      "learning_rate": 4.651254837994632e-05,
      "loss": 1.5684,
      "num_input_tokens_seen": 15208186656,
      "step": 19330
    },
    {
      "epoch": 2.0508168894547,
      "grad_norm": 0.41054597239735297,
      "learning_rate": 4.6512194321735065e-05,
      "loss": 1.5151,
      "num_input_tokens_seen": 15208973424,
      "step": 19331
    },
    {
      "epoch": 2.0509229789942713,
      "grad_norm": 0.4949561787126483,
      "learning_rate": 4.651184024689981e-05,
      "loss": 1.6939,
      "num_input_tokens_seen": 15209760176,
      "step": 19332
    },
    {
      "epoch": 2.0510290685338424,
      "grad_norm": 0.4014344671462526,
      "learning_rate": 4.6511486155440844e-05,
      "loss": 1.6788,
      "num_input_tokens_seen": 15210547024,
      "step": 19333
    },
    {
      "epoch": 2.051135158073414,
      "grad_norm": 0.3582874396180646,
      "learning_rate": 4.651113204735843e-05,
      "loss": 1.4735,
      "num_input_tokens_seen": 15211333920,
      "step": 19334
    },
    {
      "epoch": 2.0512412476129853,
      "grad_norm": 0.4269651103712061,
      "learning_rate": 4.6510777922652836e-05,
      "loss": 1.6707,
      "num_input_tokens_seen": 15212120608,
      "step": 19335
    },
    {
      "epoch": 2.051347337152557,
      "grad_norm": 0.3852927799215761,
      "learning_rate": 4.651042378132435e-05,
      "loss": 1.5936,
      "num_input_tokens_seen": 15212907456,
      "step": 19336
    },
    {
      "epoch": 2.0514534266921283,
      "grad_norm": 0.4061544342341048,
      "learning_rate": 4.651006962337324e-05,
      "loss": 1.4958,
      "num_input_tokens_seen": 15213694256,
      "step": 19337
    },
    {
      "epoch": 2.0515595162316997,
      "grad_norm": 0.38622479595673337,
      "learning_rate": 4.6509715448799784e-05,
      "loss": 1.5853,
      "num_input_tokens_seen": 15214480976,
      "step": 19338
    },
    {
      "epoch": 2.0516656057712708,
      "grad_norm": 0.511162312999062,
      "learning_rate": 4.6509361257604246e-05,
      "loss": 1.7669,
      "num_input_tokens_seen": 15215267696,
      "step": 19339
    },
    {
      "epoch": 2.0517716953108422,
      "grad_norm": 0.44248735883252244,
      "learning_rate": 4.6509007049786907e-05,
      "loss": 1.7107,
      "num_input_tokens_seen": 15216054464,
      "step": 19340
    },
    {
      "epoch": 2.0518777848504137,
      "grad_norm": 0.4701884869320055,
      "learning_rate": 4.6508652825348036e-05,
      "loss": 1.6644,
      "num_input_tokens_seen": 15216841264,
      "step": 19341
    },
    {
      "epoch": 2.051983874389985,
      "grad_norm": 0.4711549618143051,
      "learning_rate": 4.650829858428791e-05,
      "loss": 1.6491,
      "num_input_tokens_seen": 15217627968,
      "step": 19342
    },
    {
      "epoch": 2.0520899639295567,
      "grad_norm": 0.4237854362213436,
      "learning_rate": 4.650794432660681e-05,
      "loss": 1.636,
      "num_input_tokens_seen": 15218414656,
      "step": 19343
    },
    {
      "epoch": 2.052196053469128,
      "grad_norm": 0.44763408652839526,
      "learning_rate": 4.650759005230499e-05,
      "loss": 1.6984,
      "num_input_tokens_seen": 15219201408,
      "step": 19344
    },
    {
      "epoch": 2.052302143008699,
      "grad_norm": 0.43798080529736705,
      "learning_rate": 4.650723576138274e-05,
      "loss": 1.6782,
      "num_input_tokens_seen": 15219988064,
      "step": 19345
    },
    {
      "epoch": 2.0524082325482707,
      "grad_norm": 0.5026045010023971,
      "learning_rate": 4.650688145384033e-05,
      "loss": 1.5829,
      "num_input_tokens_seen": 15220774816,
      "step": 19346
    },
    {
      "epoch": 2.052514322087842,
      "grad_norm": 0.48637956816733086,
      "learning_rate": 4.650652712967803e-05,
      "loss": 1.5044,
      "num_input_tokens_seen": 15221561648,
      "step": 19347
    },
    {
      "epoch": 2.0526204116274136,
      "grad_norm": 0.44615648201368374,
      "learning_rate": 4.650617278889612e-05,
      "loss": 1.5931,
      "num_input_tokens_seen": 15222348336,
      "step": 19348
    },
    {
      "epoch": 2.052726501166985,
      "grad_norm": 0.4647596042519331,
      "learning_rate": 4.650581843149486e-05,
      "loss": 1.7059,
      "num_input_tokens_seen": 15223135040,
      "step": 19349
    },
    {
      "epoch": 2.0528325907065565,
      "grad_norm": 0.39246242913986157,
      "learning_rate": 4.650546405747455e-05,
      "loss": 1.6195,
      "num_input_tokens_seen": 15223921856,
      "step": 19350
    },
    {
      "epoch": 2.0529386802461276,
      "grad_norm": 0.38615807515955924,
      "learning_rate": 4.6505109666835444e-05,
      "loss": 1.6704,
      "num_input_tokens_seen": 15224708608,
      "step": 19351
    },
    {
      "epoch": 2.053044769785699,
      "grad_norm": 0.3818424545842281,
      "learning_rate": 4.650475525957781e-05,
      "loss": 1.5749,
      "num_input_tokens_seen": 15225495392,
      "step": 19352
    },
    {
      "epoch": 2.0531508593252705,
      "grad_norm": 0.4005293218837081,
      "learning_rate": 4.6504400835701945e-05,
      "loss": 1.6685,
      "num_input_tokens_seen": 15226282144,
      "step": 19353
    },
    {
      "epoch": 2.053256948864842,
      "grad_norm": 0.4041799966534279,
      "learning_rate": 4.650404639520811e-05,
      "loss": 1.5835,
      "num_input_tokens_seen": 15227068944,
      "step": 19354
    },
    {
      "epoch": 2.0533630384044135,
      "grad_norm": 0.4603241500119426,
      "learning_rate": 4.6503691938096574e-05,
      "loss": 1.6057,
      "num_input_tokens_seen": 15227855632,
      "step": 19355
    },
    {
      "epoch": 2.0534691279439845,
      "grad_norm": 0.37393610186622883,
      "learning_rate": 4.650333746436761e-05,
      "loss": 1.6497,
      "num_input_tokens_seen": 15228642416,
      "step": 19356
    },
    {
      "epoch": 2.053575217483556,
      "grad_norm": 0.437801476331841,
      "learning_rate": 4.650298297402151e-05,
      "loss": 1.635,
      "num_input_tokens_seen": 15229429216,
      "step": 19357
    },
    {
      "epoch": 2.0536813070231275,
      "grad_norm": 0.3725356271404788,
      "learning_rate": 4.650262846705853e-05,
      "loss": 1.6317,
      "num_input_tokens_seen": 15230215984,
      "step": 19358
    },
    {
      "epoch": 2.053787396562699,
      "grad_norm": 0.3990463914532181,
      "learning_rate": 4.650227394347895e-05,
      "loss": 1.6963,
      "num_input_tokens_seen": 15231002704,
      "step": 19359
    },
    {
      "epoch": 2.0538934861022704,
      "grad_norm": 0.42356370523383613,
      "learning_rate": 4.650191940328305e-05,
      "loss": 1.6816,
      "num_input_tokens_seen": 15231789488,
      "step": 19360
    },
    {
      "epoch": 2.053999575641842,
      "grad_norm": 0.4319772088472527,
      "learning_rate": 4.650156484647108e-05,
      "loss": 1.6529,
      "num_input_tokens_seen": 15232576224,
      "step": 19361
    },
    {
      "epoch": 2.054105665181413,
      "grad_norm": 0.509607145214927,
      "learning_rate": 4.650121027304334e-05,
      "loss": 1.6811,
      "num_input_tokens_seen": 15233362960,
      "step": 19362
    },
    {
      "epoch": 2.0542117547209844,
      "grad_norm": 0.38675814441575057,
      "learning_rate": 4.65008556830001e-05,
      "loss": 1.6214,
      "num_input_tokens_seen": 15234149744,
      "step": 19363
    },
    {
      "epoch": 2.054317844260556,
      "grad_norm": 0.552873671272073,
      "learning_rate": 4.650050107634163e-05,
      "loss": 1.5239,
      "num_input_tokens_seen": 15234936480,
      "step": 19364
    },
    {
      "epoch": 2.0544239338001273,
      "grad_norm": 0.3731028482329964,
      "learning_rate": 4.65001464530682e-05,
      "loss": 1.6893,
      "num_input_tokens_seen": 15235723216,
      "step": 19365
    },
    {
      "epoch": 2.054530023339699,
      "grad_norm": 0.4551931538889184,
      "learning_rate": 4.64997918131801e-05,
      "loss": 1.7111,
      "num_input_tokens_seen": 15236509920,
      "step": 19366
    },
    {
      "epoch": 2.0546361128792703,
      "grad_norm": 0.3594829885390862,
      "learning_rate": 4.649943715667757e-05,
      "loss": 1.6177,
      "num_input_tokens_seen": 15237296656,
      "step": 19367
    },
    {
      "epoch": 2.0547422024188413,
      "grad_norm": 0.3685124712410608,
      "learning_rate": 4.649908248356092e-05,
      "loss": 1.7487,
      "num_input_tokens_seen": 15238083408,
      "step": 19368
    },
    {
      "epoch": 2.054848291958413,
      "grad_norm": 0.3898352753304544,
      "learning_rate": 4.64987277938304e-05,
      "loss": 1.5881,
      "num_input_tokens_seen": 15238870208,
      "step": 19369
    },
    {
      "epoch": 2.0549543814979843,
      "grad_norm": 0.3787302940988147,
      "learning_rate": 4.64983730874863e-05,
      "loss": 1.6679,
      "num_input_tokens_seen": 15239656976,
      "step": 19370
    },
    {
      "epoch": 2.0550604710375557,
      "grad_norm": 0.4481058675682706,
      "learning_rate": 4.649801836452889e-05,
      "loss": 1.7598,
      "num_input_tokens_seen": 15240443632,
      "step": 19371
    },
    {
      "epoch": 2.055166560577127,
      "grad_norm": 0.37923249813157495,
      "learning_rate": 4.6497663624958445e-05,
      "loss": 1.7452,
      "num_input_tokens_seen": 15241230400,
      "step": 19372
    },
    {
      "epoch": 2.0552726501166987,
      "grad_norm": 0.4120517831830691,
      "learning_rate": 4.649730886877523e-05,
      "loss": 1.5694,
      "num_input_tokens_seen": 15242017168,
      "step": 19373
    },
    {
      "epoch": 2.0553787396562697,
      "grad_norm": 0.3951428444742478,
      "learning_rate": 4.6496954095979526e-05,
      "loss": 1.5869,
      "num_input_tokens_seen": 15242803920,
      "step": 19374
    },
    {
      "epoch": 2.055484829195841,
      "grad_norm": 0.3910627459260229,
      "learning_rate": 4.649659930657161e-05,
      "loss": 1.6275,
      "num_input_tokens_seen": 15243590608,
      "step": 19375
    },
    {
      "epoch": 2.0555909187354127,
      "grad_norm": 0.4100020754168302,
      "learning_rate": 4.649624450055175e-05,
      "loss": 1.63,
      "num_input_tokens_seen": 15244377328,
      "step": 19376
    },
    {
      "epoch": 2.055697008274984,
      "grad_norm": 0.40995152139491003,
      "learning_rate": 4.6495889677920224e-05,
      "loss": 1.8148,
      "num_input_tokens_seen": 15245164112,
      "step": 19377
    },
    {
      "epoch": 2.0558030978145556,
      "grad_norm": 0.37859105948240473,
      "learning_rate": 4.64955348386773e-05,
      "loss": 1.5665,
      "num_input_tokens_seen": 15245950864,
      "step": 19378
    },
    {
      "epoch": 2.055909187354127,
      "grad_norm": 0.4016734863424843,
      "learning_rate": 4.649517998282327e-05,
      "loss": 1.7279,
      "num_input_tokens_seen": 15246737680,
      "step": 19379
    },
    {
      "epoch": 2.056015276893698,
      "grad_norm": 0.3747381280422787,
      "learning_rate": 4.649482511035839e-05,
      "loss": 1.6144,
      "num_input_tokens_seen": 15247524368,
      "step": 19380
    },
    {
      "epoch": 2.0561213664332696,
      "grad_norm": 0.43207005575187823,
      "learning_rate": 4.6494470221282924e-05,
      "loss": 1.5833,
      "num_input_tokens_seen": 15248311136,
      "step": 19381
    },
    {
      "epoch": 2.056227455972841,
      "grad_norm": 0.40558295341047973,
      "learning_rate": 4.649411531559718e-05,
      "loss": 1.5705,
      "num_input_tokens_seen": 15249097920,
      "step": 19382
    },
    {
      "epoch": 2.0563335455124125,
      "grad_norm": 0.34402636794365965,
      "learning_rate": 4.649376039330141e-05,
      "loss": 1.5694,
      "num_input_tokens_seen": 15249884720,
      "step": 19383
    },
    {
      "epoch": 2.056439635051984,
      "grad_norm": 0.5602926892068628,
      "learning_rate": 4.649340545439589e-05,
      "loss": 1.7036,
      "num_input_tokens_seen": 15250671456,
      "step": 19384
    },
    {
      "epoch": 2.0565457245915555,
      "grad_norm": 0.31703132101887566,
      "learning_rate": 4.6493050498880905e-05,
      "loss": 1.505,
      "num_input_tokens_seen": 15251458224,
      "step": 19385
    },
    {
      "epoch": 2.0566518141311265,
      "grad_norm": 0.5268450072636691,
      "learning_rate": 4.6492695526756714e-05,
      "loss": 1.7157,
      "num_input_tokens_seen": 15252244944,
      "step": 19386
    },
    {
      "epoch": 2.056757903670698,
      "grad_norm": 0.39730650607387286,
      "learning_rate": 4.64923405380236e-05,
      "loss": 1.6776,
      "num_input_tokens_seen": 15253031712,
      "step": 19387
    },
    {
      "epoch": 2.0568639932102695,
      "grad_norm": 0.489349273117024,
      "learning_rate": 4.6491985532681836e-05,
      "loss": 1.7337,
      "num_input_tokens_seen": 15253818512,
      "step": 19388
    },
    {
      "epoch": 2.056970082749841,
      "grad_norm": 0.3860787152095969,
      "learning_rate": 4.64916305107317e-05,
      "loss": 1.5737,
      "num_input_tokens_seen": 15254605296,
      "step": 19389
    },
    {
      "epoch": 2.0570761722894124,
      "grad_norm": 0.38047956506404346,
      "learning_rate": 4.649127547217346e-05,
      "loss": 1.8109,
      "num_input_tokens_seen": 15255392064,
      "step": 19390
    },
    {
      "epoch": 2.0571822618289834,
      "grad_norm": 0.38214792697034694,
      "learning_rate": 4.649092041700739e-05,
      "loss": 1.5869,
      "num_input_tokens_seen": 15256178720,
      "step": 19391
    },
    {
      "epoch": 2.057288351368555,
      "grad_norm": 0.40158926429918157,
      "learning_rate": 4.649056534523377e-05,
      "loss": 1.5943,
      "num_input_tokens_seen": 15256965472,
      "step": 19392
    },
    {
      "epoch": 2.0573944409081264,
      "grad_norm": 0.37191715459020863,
      "learning_rate": 4.649021025685287e-05,
      "loss": 1.6525,
      "num_input_tokens_seen": 15257752224,
      "step": 19393
    },
    {
      "epoch": 2.057500530447698,
      "grad_norm": 0.39362402517805134,
      "learning_rate": 4.648985515186497e-05,
      "loss": 1.5576,
      "num_input_tokens_seen": 15258539056,
      "step": 19394
    },
    {
      "epoch": 2.0576066199872693,
      "grad_norm": 0.4084248381600718,
      "learning_rate": 4.648950003027033e-05,
      "loss": 1.7618,
      "num_input_tokens_seen": 15259325856,
      "step": 19395
    },
    {
      "epoch": 2.057712709526841,
      "grad_norm": 0.38410150690647743,
      "learning_rate": 4.6489144892069244e-05,
      "loss": 1.6822,
      "num_input_tokens_seen": 15260112640,
      "step": 19396
    },
    {
      "epoch": 2.057818799066412,
      "grad_norm": 0.3854531522137832,
      "learning_rate": 4.648878973726198e-05,
      "loss": 1.5194,
      "num_input_tokens_seen": 15260899488,
      "step": 19397
    },
    {
      "epoch": 2.0579248886059833,
      "grad_norm": 0.41319101760328214,
      "learning_rate": 4.648843456584881e-05,
      "loss": 1.6152,
      "num_input_tokens_seen": 15261686256,
      "step": 19398
    },
    {
      "epoch": 2.058030978145555,
      "grad_norm": 0.3402134052439835,
      "learning_rate": 4.648807937783e-05,
      "loss": 1.5625,
      "num_input_tokens_seen": 15262473152,
      "step": 19399
    },
    {
      "epoch": 2.0581370676851263,
      "grad_norm": 0.3706543078486795,
      "learning_rate": 4.6487724173205835e-05,
      "loss": 1.5381,
      "num_input_tokens_seen": 15263259984,
      "step": 19400
    },
    {
      "epoch": 2.0582431572246978,
      "grad_norm": 0.3963506075935487,
      "learning_rate": 4.6487368951976586e-05,
      "loss": 1.6355,
      "num_input_tokens_seen": 15264046720,
      "step": 19401
    },
    {
      "epoch": 2.0583492467642692,
      "grad_norm": 0.3693661646390718,
      "learning_rate": 4.648701371414254e-05,
      "loss": 1.6162,
      "num_input_tokens_seen": 15264833504,
      "step": 19402
    },
    {
      "epoch": 2.0584553363038403,
      "grad_norm": 0.40891696787972653,
      "learning_rate": 4.6486658459703946e-05,
      "loss": 1.6881,
      "num_input_tokens_seen": 15265620224,
      "step": 19403
    },
    {
      "epoch": 2.0585614258434117,
      "grad_norm": 0.3607580154739751,
      "learning_rate": 4.6486303188661096e-05,
      "loss": 1.654,
      "num_input_tokens_seen": 15266406928,
      "step": 19404
    },
    {
      "epoch": 2.058667515382983,
      "grad_norm": 0.373026706440227,
      "learning_rate": 4.6485947901014266e-05,
      "loss": 1.5083,
      "num_input_tokens_seen": 15267193696,
      "step": 19405
    },
    {
      "epoch": 2.0587736049225547,
      "grad_norm": 0.44200280820287036,
      "learning_rate": 4.6485592596763726e-05,
      "loss": 1.7314,
      "num_input_tokens_seen": 15267980400,
      "step": 19406
    },
    {
      "epoch": 2.058879694462126,
      "grad_norm": 0.3859616170722639,
      "learning_rate": 4.648523727590974e-05,
      "loss": 1.6584,
      "num_input_tokens_seen": 15268767120,
      "step": 19407
    },
    {
      "epoch": 2.0589857840016976,
      "grad_norm": 0.4263421896212155,
      "learning_rate": 4.6484881938452604e-05,
      "loss": 1.6834,
      "num_input_tokens_seen": 15269553824,
      "step": 19408
    },
    {
      "epoch": 2.0590918735412687,
      "grad_norm": 0.40028884578973506,
      "learning_rate": 4.6484526584392584e-05,
      "loss": 1.8341,
      "num_input_tokens_seen": 15270340544,
      "step": 19409
    },
    {
      "epoch": 2.05919796308084,
      "grad_norm": 0.37274023471146,
      "learning_rate": 4.6484171213729945e-05,
      "loss": 1.52,
      "num_input_tokens_seen": 15271127248,
      "step": 19410
    },
    {
      "epoch": 2.0593040526204116,
      "grad_norm": 0.4788851774973714,
      "learning_rate": 4.648381582646497e-05,
      "loss": 1.6641,
      "num_input_tokens_seen": 15271914064,
      "step": 19411
    },
    {
      "epoch": 2.059410142159983,
      "grad_norm": 0.3783540777132166,
      "learning_rate": 4.648346042259794e-05,
      "loss": 1.6702,
      "num_input_tokens_seen": 15272700848,
      "step": 19412
    },
    {
      "epoch": 2.0595162316995546,
      "grad_norm": 0.5174581202137434,
      "learning_rate": 4.648310500212911e-05,
      "loss": 1.6973,
      "num_input_tokens_seen": 15273487600,
      "step": 19413
    },
    {
      "epoch": 2.059622321239126,
      "grad_norm": 0.389402716412608,
      "learning_rate": 4.648274956505878e-05,
      "loss": 1.6126,
      "num_input_tokens_seen": 15274274272,
      "step": 19414
    },
    {
      "epoch": 2.059728410778697,
      "grad_norm": 0.5490931519900031,
      "learning_rate": 4.6482394111387195e-05,
      "loss": 1.6664,
      "num_input_tokens_seen": 15275060976,
      "step": 19415
    },
    {
      "epoch": 2.0598345003182685,
      "grad_norm": 0.4224432529768946,
      "learning_rate": 4.6482038641114654e-05,
      "loss": 1.6345,
      "num_input_tokens_seen": 15275847808,
      "step": 19416
    },
    {
      "epoch": 2.05994058985784,
      "grad_norm": 0.4638604465884919,
      "learning_rate": 4.6481683154241426e-05,
      "loss": 1.6667,
      "num_input_tokens_seen": 15276634528,
      "step": 19417
    },
    {
      "epoch": 2.0600466793974115,
      "grad_norm": 0.37942447190617096,
      "learning_rate": 4.648132765076779e-05,
      "loss": 1.5923,
      "num_input_tokens_seen": 15277421312,
      "step": 19418
    },
    {
      "epoch": 2.060152768936983,
      "grad_norm": 0.5079294352847405,
      "learning_rate": 4.6480972130694e-05,
      "loss": 1.6476,
      "num_input_tokens_seen": 15278208096,
      "step": 19419
    },
    {
      "epoch": 2.060258858476554,
      "grad_norm": 0.36226668778362026,
      "learning_rate": 4.648061659402035e-05,
      "loss": 1.6744,
      "num_input_tokens_seen": 15278994832,
      "step": 19420
    },
    {
      "epoch": 2.0603649480161255,
      "grad_norm": 0.4927685071301629,
      "learning_rate": 4.648026104074712e-05,
      "loss": 1.4801,
      "num_input_tokens_seen": 15279781632,
      "step": 19421
    },
    {
      "epoch": 2.060471037555697,
      "grad_norm": 0.43701395225367984,
      "learning_rate": 4.647990547087456e-05,
      "loss": 1.5073,
      "num_input_tokens_seen": 15280568384,
      "step": 19422
    },
    {
      "epoch": 2.0605771270952684,
      "grad_norm": 0.6800890881453427,
      "learning_rate": 4.647954988440297e-05,
      "loss": 1.6765,
      "num_input_tokens_seen": 15281355024,
      "step": 19423
    },
    {
      "epoch": 2.06068321663484,
      "grad_norm": 0.3713006095911339,
      "learning_rate": 4.6479194281332606e-05,
      "loss": 1.4844,
      "num_input_tokens_seen": 15282141856,
      "step": 19424
    },
    {
      "epoch": 2.0607893061744114,
      "grad_norm": 0.43940175689767436,
      "learning_rate": 4.647883866166376e-05,
      "loss": 1.5449,
      "num_input_tokens_seen": 15282928576,
      "step": 19425
    },
    {
      "epoch": 2.0608953957139824,
      "grad_norm": 0.4856621212966686,
      "learning_rate": 4.647848302539669e-05,
      "loss": 1.6501,
      "num_input_tokens_seen": 15283715296,
      "step": 19426
    },
    {
      "epoch": 2.061001485253554,
      "grad_norm": 0.40593291409029497,
      "learning_rate": 4.6478127372531675e-05,
      "loss": 1.6756,
      "num_input_tokens_seen": 15284502048,
      "step": 19427
    },
    {
      "epoch": 2.0611075747931253,
      "grad_norm": 0.523593301767382,
      "learning_rate": 4.6477771703069e-05,
      "loss": 1.598,
      "num_input_tokens_seen": 15285288832,
      "step": 19428
    },
    {
      "epoch": 2.061213664332697,
      "grad_norm": 0.3701890509901812,
      "learning_rate": 4.647741601700894e-05,
      "loss": 1.6048,
      "num_input_tokens_seen": 15286075536,
      "step": 19429
    },
    {
      "epoch": 2.0613197538722683,
      "grad_norm": 0.40950946385070763,
      "learning_rate": 4.647706031435175e-05,
      "loss": 1.7804,
      "num_input_tokens_seen": 15286862272,
      "step": 19430
    },
    {
      "epoch": 2.0614258434118398,
      "grad_norm": 0.37296607283283056,
      "learning_rate": 4.647670459509773e-05,
      "loss": 1.6961,
      "num_input_tokens_seen": 15287649024,
      "step": 19431
    },
    {
      "epoch": 2.061531932951411,
      "grad_norm": 0.39159023865686166,
      "learning_rate": 4.6476348859247134e-05,
      "loss": 1.5371,
      "num_input_tokens_seen": 15288435696,
      "step": 19432
    },
    {
      "epoch": 2.0616380224909823,
      "grad_norm": 0.3783366590703724,
      "learning_rate": 4.6475993106800244e-05,
      "loss": 1.6656,
      "num_input_tokens_seen": 15289222560,
      "step": 19433
    },
    {
      "epoch": 2.0617441120305537,
      "grad_norm": 0.3523216755104005,
      "learning_rate": 4.647563733775734e-05,
      "loss": 1.6101,
      "num_input_tokens_seen": 15290009328,
      "step": 19434
    },
    {
      "epoch": 2.061850201570125,
      "grad_norm": 0.4087351051652872,
      "learning_rate": 4.64752815521187e-05,
      "loss": 1.5916,
      "num_input_tokens_seen": 15290796128,
      "step": 19435
    },
    {
      "epoch": 2.0619562911096967,
      "grad_norm": 0.38287056004007397,
      "learning_rate": 4.647492574988458e-05,
      "loss": 1.4939,
      "num_input_tokens_seen": 15291582848,
      "step": 19436
    },
    {
      "epoch": 2.062062380649268,
      "grad_norm": 0.4796024455408201,
      "learning_rate": 4.647456993105528e-05,
      "loss": 1.5267,
      "num_input_tokens_seen": 15292369760,
      "step": 19437
    },
    {
      "epoch": 2.062168470188839,
      "grad_norm": 0.41077218289787437,
      "learning_rate": 4.647421409563105e-05,
      "loss": 1.6879,
      "num_input_tokens_seen": 15293156592,
      "step": 19438
    },
    {
      "epoch": 2.0622745597284107,
      "grad_norm": 0.38296409555398564,
      "learning_rate": 4.647385824361219e-05,
      "loss": 1.4323,
      "num_input_tokens_seen": 15293943440,
      "step": 19439
    },
    {
      "epoch": 2.062380649267982,
      "grad_norm": 0.3790879146764252,
      "learning_rate": 4.6473502374998955e-05,
      "loss": 1.6182,
      "num_input_tokens_seen": 15294730176,
      "step": 19440
    },
    {
      "epoch": 2.0624867388075536,
      "grad_norm": 0.5023364770455484,
      "learning_rate": 4.647314648979163e-05,
      "loss": 1.6848,
      "num_input_tokens_seen": 15295516960,
      "step": 19441
    },
    {
      "epoch": 2.062592828347125,
      "grad_norm": 0.4314537628654891,
      "learning_rate": 4.647279058799049e-05,
      "loss": 1.4514,
      "num_input_tokens_seen": 15296303680,
      "step": 19442
    },
    {
      "epoch": 2.0626989178866966,
      "grad_norm": 0.40629187402962674,
      "learning_rate": 4.64724346695958e-05,
      "loss": 1.5527,
      "num_input_tokens_seen": 15297090432,
      "step": 19443
    },
    {
      "epoch": 2.0628050074262676,
      "grad_norm": 0.43537490249800015,
      "learning_rate": 4.647207873460785e-05,
      "loss": 1.626,
      "num_input_tokens_seen": 15297877184,
      "step": 19444
    },
    {
      "epoch": 2.062911096965839,
      "grad_norm": 0.4263552732567256,
      "learning_rate": 4.647172278302691e-05,
      "loss": 1.5854,
      "num_input_tokens_seen": 15298663984,
      "step": 19445
    },
    {
      "epoch": 2.0630171865054105,
      "grad_norm": 0.4250855640303458,
      "learning_rate": 4.647136681485324e-05,
      "loss": 1.6737,
      "num_input_tokens_seen": 15299450704,
      "step": 19446
    },
    {
      "epoch": 2.063123276044982,
      "grad_norm": 0.44798342538174324,
      "learning_rate": 4.6471010830087135e-05,
      "loss": 1.7034,
      "num_input_tokens_seen": 15300237440,
      "step": 19447
    },
    {
      "epoch": 2.0632293655845535,
      "grad_norm": 0.47559266284310037,
      "learning_rate": 4.647065482872886e-05,
      "loss": 1.699,
      "num_input_tokens_seen": 15301024176,
      "step": 19448
    },
    {
      "epoch": 2.063335455124125,
      "grad_norm": 0.3721667763668083,
      "learning_rate": 4.647029881077869e-05,
      "loss": 1.54,
      "num_input_tokens_seen": 15301811024,
      "step": 19449
    },
    {
      "epoch": 2.063441544663696,
      "grad_norm": 0.38544155018575166,
      "learning_rate": 4.646994277623691e-05,
      "loss": 1.7168,
      "num_input_tokens_seen": 15302597712,
      "step": 19450
    },
    {
      "epoch": 2.0635476342032675,
      "grad_norm": 0.40552377784035964,
      "learning_rate": 4.646958672510379e-05,
      "loss": 1.6209,
      "num_input_tokens_seen": 15303384352,
      "step": 19451
    },
    {
      "epoch": 2.063653723742839,
      "grad_norm": 0.3985972136647783,
      "learning_rate": 4.64692306573796e-05,
      "loss": 1.6549,
      "num_input_tokens_seen": 15304171072,
      "step": 19452
    },
    {
      "epoch": 2.0637598132824104,
      "grad_norm": 0.4543884055859146,
      "learning_rate": 4.646887457306462e-05,
      "loss": 1.6829,
      "num_input_tokens_seen": 15304957840,
      "step": 19453
    },
    {
      "epoch": 2.063865902821982,
      "grad_norm": 0.46469756730119655,
      "learning_rate": 4.6468518472159116e-05,
      "loss": 1.6121,
      "num_input_tokens_seen": 15305744592,
      "step": 19454
    },
    {
      "epoch": 2.0639719923615534,
      "grad_norm": 0.40513863281445245,
      "learning_rate": 4.646816235466338e-05,
      "loss": 1.6254,
      "num_input_tokens_seen": 15306531376,
      "step": 19455
    },
    {
      "epoch": 2.0640780819011244,
      "grad_norm": 0.5194626008164958,
      "learning_rate": 4.646780622057768e-05,
      "loss": 1.6738,
      "num_input_tokens_seen": 15307318112,
      "step": 19456
    },
    {
      "epoch": 2.064184171440696,
      "grad_norm": 0.3934837647825767,
      "learning_rate": 4.646745006990229e-05,
      "loss": 1.5484,
      "num_input_tokens_seen": 15308104912,
      "step": 19457
    },
    {
      "epoch": 2.0642902609802674,
      "grad_norm": 0.634640211826987,
      "learning_rate": 4.646709390263747e-05,
      "loss": 1.4932,
      "num_input_tokens_seen": 15308891664,
      "step": 19458
    },
    {
      "epoch": 2.064396350519839,
      "grad_norm": 0.40046316091646367,
      "learning_rate": 4.646673771878352e-05,
      "loss": 1.6124,
      "num_input_tokens_seen": 15309678464,
      "step": 19459
    },
    {
      "epoch": 2.0645024400594103,
      "grad_norm": 0.5261545276348641,
      "learning_rate": 4.64663815183407e-05,
      "loss": 1.7482,
      "num_input_tokens_seen": 15310465200,
      "step": 19460
    },
    {
      "epoch": 2.0646085295989813,
      "grad_norm": 0.3552511209804041,
      "learning_rate": 4.64660253013093e-05,
      "loss": 1.5659,
      "num_input_tokens_seen": 15311252000,
      "step": 19461
    },
    {
      "epoch": 2.064714619138553,
      "grad_norm": 0.3736411434546507,
      "learning_rate": 4.6465669067689574e-05,
      "loss": 1.6902,
      "num_input_tokens_seen": 15312038768,
      "step": 19462
    },
    {
      "epoch": 2.0648207086781243,
      "grad_norm": 0.381145541204773,
      "learning_rate": 4.6465312817481814e-05,
      "loss": 1.677,
      "num_input_tokens_seen": 15312825440,
      "step": 19463
    },
    {
      "epoch": 2.0649267982176958,
      "grad_norm": 0.3582830103014904,
      "learning_rate": 4.646495655068629e-05,
      "loss": 1.6342,
      "num_input_tokens_seen": 15313612176,
      "step": 19464
    },
    {
      "epoch": 2.0650328877572672,
      "grad_norm": 0.37966487238921026,
      "learning_rate": 4.6464600267303285e-05,
      "loss": 1.4516,
      "num_input_tokens_seen": 15314398944,
      "step": 19465
    },
    {
      "epoch": 2.0651389772968387,
      "grad_norm": 0.40979526376822717,
      "learning_rate": 4.646424396733305e-05,
      "loss": 1.6513,
      "num_input_tokens_seen": 15315185648,
      "step": 19466
    },
    {
      "epoch": 2.0652450668364097,
      "grad_norm": 0.3805215682960131,
      "learning_rate": 4.6463887650775886e-05,
      "loss": 1.4923,
      "num_input_tokens_seen": 15315972416,
      "step": 19467
    },
    {
      "epoch": 2.065351156375981,
      "grad_norm": 0.39663952969254374,
      "learning_rate": 4.646353131763206e-05,
      "loss": 1.5904,
      "num_input_tokens_seen": 15316759216,
      "step": 19468
    },
    {
      "epoch": 2.0654572459155527,
      "grad_norm": 0.40776407419093336,
      "learning_rate": 4.6463174967901847e-05,
      "loss": 1.6783,
      "num_input_tokens_seen": 15317545936,
      "step": 19469
    },
    {
      "epoch": 2.065563335455124,
      "grad_norm": 0.4047218139720548,
      "learning_rate": 4.646281860158552e-05,
      "loss": 1.723,
      "num_input_tokens_seen": 15318332624,
      "step": 19470
    },
    {
      "epoch": 2.0656694249946956,
      "grad_norm": 0.5044805130230491,
      "learning_rate": 4.646246221868336e-05,
      "loss": 1.6632,
      "num_input_tokens_seen": 15319119440,
      "step": 19471
    },
    {
      "epoch": 2.065775514534267,
      "grad_norm": 0.4814409294915515,
      "learning_rate": 4.6462105819195634e-05,
      "loss": 1.613,
      "num_input_tokens_seen": 15319906192,
      "step": 19472
    },
    {
      "epoch": 2.065881604073838,
      "grad_norm": 0.3992165294391844,
      "learning_rate": 4.646174940312263e-05,
      "loss": 1.5851,
      "num_input_tokens_seen": 15320693008,
      "step": 19473
    },
    {
      "epoch": 2.0659876936134096,
      "grad_norm": 0.42865481457909904,
      "learning_rate": 4.6461392970464615e-05,
      "loss": 1.5507,
      "num_input_tokens_seen": 15321479760,
      "step": 19474
    },
    {
      "epoch": 2.066093783152981,
      "grad_norm": 0.42752717489964304,
      "learning_rate": 4.646103652122186e-05,
      "loss": 1.634,
      "num_input_tokens_seen": 15322266512,
      "step": 19475
    },
    {
      "epoch": 2.0661998726925526,
      "grad_norm": 0.4049122461575489,
      "learning_rate": 4.6460680055394646e-05,
      "loss": 1.6155,
      "num_input_tokens_seen": 15323053280,
      "step": 19476
    },
    {
      "epoch": 2.066305962232124,
      "grad_norm": 0.4399773429501849,
      "learning_rate": 4.6460323572983246e-05,
      "loss": 1.7037,
      "num_input_tokens_seen": 15323840112,
      "step": 19477
    },
    {
      "epoch": 2.0664120517716955,
      "grad_norm": 0.516186802642864,
      "learning_rate": 4.6459967073987944e-05,
      "loss": 1.5262,
      "num_input_tokens_seen": 15324626912,
      "step": 19478
    },
    {
      "epoch": 2.0665181413112665,
      "grad_norm": 0.5014203536762991,
      "learning_rate": 4.6459610558409004e-05,
      "loss": 1.6076,
      "num_input_tokens_seen": 15325413632,
      "step": 19479
    },
    {
      "epoch": 2.066624230850838,
      "grad_norm": 0.4110286641128971,
      "learning_rate": 4.645925402624671e-05,
      "loss": 1.6104,
      "num_input_tokens_seen": 15326200304,
      "step": 19480
    },
    {
      "epoch": 2.0667303203904095,
      "grad_norm": 0.42464026622013157,
      "learning_rate": 4.645889747750133e-05,
      "loss": 1.7017,
      "num_input_tokens_seen": 15326987024,
      "step": 19481
    },
    {
      "epoch": 2.066836409929981,
      "grad_norm": 0.3676681674203346,
      "learning_rate": 4.645854091217315e-05,
      "loss": 1.6214,
      "num_input_tokens_seen": 15327773712,
      "step": 19482
    },
    {
      "epoch": 2.0669424994695524,
      "grad_norm": 0.44029815417318957,
      "learning_rate": 4.6458184330262434e-05,
      "loss": 1.5696,
      "num_input_tokens_seen": 15328560448,
      "step": 19483
    },
    {
      "epoch": 2.067048589009124,
      "grad_norm": 0.3920158025529797,
      "learning_rate": 4.6457827731769464e-05,
      "loss": 1.5085,
      "num_input_tokens_seen": 15329347184,
      "step": 19484
    },
    {
      "epoch": 2.067154678548695,
      "grad_norm": 0.4286965299489726,
      "learning_rate": 4.645747111669451e-05,
      "loss": 1.7143,
      "num_input_tokens_seen": 15330133936,
      "step": 19485
    },
    {
      "epoch": 2.0672607680882664,
      "grad_norm": 0.38137715621227947,
      "learning_rate": 4.6457114485037863e-05,
      "loss": 1.5025,
      "num_input_tokens_seen": 15330920672,
      "step": 19486
    },
    {
      "epoch": 2.067366857627838,
      "grad_norm": 0.3496134036933433,
      "learning_rate": 4.645675783679978e-05,
      "loss": 1.6552,
      "num_input_tokens_seen": 15331707440,
      "step": 19487
    },
    {
      "epoch": 2.0674729471674094,
      "grad_norm": 0.34748410974496374,
      "learning_rate": 4.645640117198055e-05,
      "loss": 1.554,
      "num_input_tokens_seen": 15332494272,
      "step": 19488
    },
    {
      "epoch": 2.067579036706981,
      "grad_norm": 0.36914516465981134,
      "learning_rate": 4.645604449058043e-05,
      "loss": 1.5842,
      "num_input_tokens_seen": 15333281024,
      "step": 19489
    },
    {
      "epoch": 2.067685126246552,
      "grad_norm": 0.37214225550065977,
      "learning_rate": 4.6455687792599724e-05,
      "loss": 1.6938,
      "num_input_tokens_seen": 15334067808,
      "step": 19490
    },
    {
      "epoch": 2.0677912157861233,
      "grad_norm": 0.35335485290076546,
      "learning_rate": 4.645533107803868e-05,
      "loss": 1.5876,
      "num_input_tokens_seen": 15334854544,
      "step": 19491
    },
    {
      "epoch": 2.067897305325695,
      "grad_norm": 0.3556601744489149,
      "learning_rate": 4.645497434689759e-05,
      "loss": 1.605,
      "num_input_tokens_seen": 15335641328,
      "step": 19492
    },
    {
      "epoch": 2.0680033948652663,
      "grad_norm": 0.3706319525402899,
      "learning_rate": 4.645461759917673e-05,
      "loss": 1.5166,
      "num_input_tokens_seen": 15336428176,
      "step": 19493
    },
    {
      "epoch": 2.0681094844048378,
      "grad_norm": 0.3699224611539262,
      "learning_rate": 4.645426083487636e-05,
      "loss": 1.6511,
      "num_input_tokens_seen": 15337214880,
      "step": 19494
    },
    {
      "epoch": 2.0682155739444092,
      "grad_norm": 0.33745527488534094,
      "learning_rate": 4.6453904053996775e-05,
      "loss": 1.6726,
      "num_input_tokens_seen": 15338001584,
      "step": 19495
    },
    {
      "epoch": 2.0683216634839803,
      "grad_norm": 0.34547756063789675,
      "learning_rate": 4.645354725653824e-05,
      "loss": 1.342,
      "num_input_tokens_seen": 15338788432,
      "step": 19496
    },
    {
      "epoch": 2.0684277530235518,
      "grad_norm": 0.39062357684380966,
      "learning_rate": 4.6453190442501034e-05,
      "loss": 1.7207,
      "num_input_tokens_seen": 15339575184,
      "step": 19497
    },
    {
      "epoch": 2.0685338425631232,
      "grad_norm": 0.3737037880859583,
      "learning_rate": 4.6452833611885434e-05,
      "loss": 1.6094,
      "num_input_tokens_seen": 15340361888,
      "step": 19498
    },
    {
      "epoch": 2.0686399321026947,
      "grad_norm": 0.4086023139726246,
      "learning_rate": 4.645247676469171e-05,
      "loss": 1.7465,
      "num_input_tokens_seen": 15341148592,
      "step": 19499
    },
    {
      "epoch": 2.068746021642266,
      "grad_norm": 0.39737553722188007,
      "learning_rate": 4.645211990092014e-05,
      "loss": 1.6544,
      "num_input_tokens_seen": 15341935312,
      "step": 19500
    },
    {
      "epoch": 2.0688521111818376,
      "grad_norm": 0.4370958062942696,
      "learning_rate": 4.6451763020571e-05,
      "loss": 1.62,
      "num_input_tokens_seen": 15342722112,
      "step": 19501
    },
    {
      "epoch": 2.0689582007214087,
      "grad_norm": 0.4332659176904846,
      "learning_rate": 4.6451406123644574e-05,
      "loss": 1.5757,
      "num_input_tokens_seen": 15343508768,
      "step": 19502
    },
    {
      "epoch": 2.06906429026098,
      "grad_norm": 0.3502976448171421,
      "learning_rate": 4.645104921014113e-05,
      "loss": 1.5442,
      "num_input_tokens_seen": 15344295584,
      "step": 19503
    },
    {
      "epoch": 2.0691703798005516,
      "grad_norm": 0.4266117991460201,
      "learning_rate": 4.6450692280060945e-05,
      "loss": 1.6454,
      "num_input_tokens_seen": 15345082400,
      "step": 19504
    },
    {
      "epoch": 2.069276469340123,
      "grad_norm": 0.4234216179187823,
      "learning_rate": 4.6450335333404285e-05,
      "loss": 1.4475,
      "num_input_tokens_seen": 15345869152,
      "step": 19505
    },
    {
      "epoch": 2.0693825588796946,
      "grad_norm": 0.3909097624200611,
      "learning_rate": 4.644997837017144e-05,
      "loss": 1.597,
      "num_input_tokens_seen": 15346655952,
      "step": 19506
    },
    {
      "epoch": 2.069488648419266,
      "grad_norm": 0.36264953852900966,
      "learning_rate": 4.644962139036268e-05,
      "loss": 1.5373,
      "num_input_tokens_seen": 15347442752,
      "step": 19507
    },
    {
      "epoch": 2.069594737958837,
      "grad_norm": 0.3941261775512787,
      "learning_rate": 4.644926439397829e-05,
      "loss": 1.5855,
      "num_input_tokens_seen": 15348229536,
      "step": 19508
    },
    {
      "epoch": 2.0697008274984086,
      "grad_norm": 0.3889446741166749,
      "learning_rate": 4.6448907381018534e-05,
      "loss": 1.5685,
      "num_input_tokens_seen": 15349016288,
      "step": 19509
    },
    {
      "epoch": 2.06980691703798,
      "grad_norm": 0.43704130900740945,
      "learning_rate": 4.644855035148369e-05,
      "loss": 1.7038,
      "num_input_tokens_seen": 15349802976,
      "step": 19510
    },
    {
      "epoch": 2.0699130065775515,
      "grad_norm": 0.5175096651639037,
      "learning_rate": 4.644819330537404e-05,
      "loss": 1.6265,
      "num_input_tokens_seen": 15350589680,
      "step": 19511
    },
    {
      "epoch": 2.070019096117123,
      "grad_norm": 0.4371294712544946,
      "learning_rate": 4.644783624268985e-05,
      "loss": 1.6469,
      "num_input_tokens_seen": 15351376416,
      "step": 19512
    },
    {
      "epoch": 2.0701251856566945,
      "grad_norm": 0.38985022889549376,
      "learning_rate": 4.6447479163431404e-05,
      "loss": 1.5224,
      "num_input_tokens_seen": 15352163168,
      "step": 19513
    },
    {
      "epoch": 2.0702312751962655,
      "grad_norm": 0.3637856943604445,
      "learning_rate": 4.6447122067598973e-05,
      "loss": 1.5368,
      "num_input_tokens_seen": 15352949984,
      "step": 19514
    },
    {
      "epoch": 2.070337364735837,
      "grad_norm": 0.37472503268027607,
      "learning_rate": 4.644676495519283e-05,
      "loss": 1.645,
      "num_input_tokens_seen": 15353736672,
      "step": 19515
    },
    {
      "epoch": 2.0704434542754084,
      "grad_norm": 0.36333837710549194,
      "learning_rate": 4.644640782621327e-05,
      "loss": 1.5195,
      "num_input_tokens_seen": 15354523472,
      "step": 19516
    },
    {
      "epoch": 2.07054954381498,
      "grad_norm": 0.480019600148059,
      "learning_rate": 4.6446050680660544e-05,
      "loss": 1.7639,
      "num_input_tokens_seen": 15355310288,
      "step": 19517
    },
    {
      "epoch": 2.0706556333545514,
      "grad_norm": 0.478231825138369,
      "learning_rate": 4.644569351853495e-05,
      "loss": 1.6896,
      "num_input_tokens_seen": 15356096928,
      "step": 19518
    },
    {
      "epoch": 2.0707617228941224,
      "grad_norm": 0.3848228559117559,
      "learning_rate": 4.644533633983674e-05,
      "loss": 1.4846,
      "num_input_tokens_seen": 15356883632,
      "step": 19519
    },
    {
      "epoch": 2.070867812433694,
      "grad_norm": 0.5324163649455914,
      "learning_rate": 4.644497914456621e-05,
      "loss": 1.7163,
      "num_input_tokens_seen": 15357670352,
      "step": 19520
    },
    {
      "epoch": 2.0709739019732654,
      "grad_norm": 0.4463941318798053,
      "learning_rate": 4.6444621932723635e-05,
      "loss": 1.6798,
      "num_input_tokens_seen": 15358457120,
      "step": 19521
    },
    {
      "epoch": 2.071079991512837,
      "grad_norm": 0.6351605775555439,
      "learning_rate": 4.6444264704309285e-05,
      "loss": 1.6461,
      "num_input_tokens_seen": 15359243952,
      "step": 19522
    },
    {
      "epoch": 2.0711860810524083,
      "grad_norm": 0.4512514633400568,
      "learning_rate": 4.644390745932343e-05,
      "loss": 1.5899,
      "num_input_tokens_seen": 15360030768,
      "step": 19523
    },
    {
      "epoch": 2.07129217059198,
      "grad_norm": 0.5595785034044437,
      "learning_rate": 4.644355019776635e-05,
      "loss": 1.4649,
      "num_input_tokens_seen": 15360817536,
      "step": 19524
    },
    {
      "epoch": 2.071398260131551,
      "grad_norm": 0.41874334024016574,
      "learning_rate": 4.6443192919638336e-05,
      "loss": 1.5811,
      "num_input_tokens_seen": 15361604336,
      "step": 19525
    },
    {
      "epoch": 2.0715043496711223,
      "grad_norm": 0.3959527887195138,
      "learning_rate": 4.644283562493964e-05,
      "loss": 1.7576,
      "num_input_tokens_seen": 15362391072,
      "step": 19526
    },
    {
      "epoch": 2.0716104392106938,
      "grad_norm": 0.46492094702238457,
      "learning_rate": 4.644247831367055e-05,
      "loss": 1.5849,
      "num_input_tokens_seen": 15363177840,
      "step": 19527
    },
    {
      "epoch": 2.0717165287502652,
      "grad_norm": 0.4542958757967946,
      "learning_rate": 4.644212098583135e-05,
      "loss": 1.5789,
      "num_input_tokens_seen": 15363964608,
      "step": 19528
    },
    {
      "epoch": 2.0718226182898367,
      "grad_norm": 0.4077577928874283,
      "learning_rate": 4.64417636414223e-05,
      "loss": 1.5188,
      "num_input_tokens_seen": 15364751328,
      "step": 19529
    },
    {
      "epoch": 2.071928707829408,
      "grad_norm": 0.3807083764912294,
      "learning_rate": 4.6441406280443687e-05,
      "loss": 1.595,
      "num_input_tokens_seen": 15365538112,
      "step": 19530
    },
    {
      "epoch": 2.072034797368979,
      "grad_norm": 0.3844718118138785,
      "learning_rate": 4.644104890289578e-05,
      "loss": 1.6287,
      "num_input_tokens_seen": 15366324912,
      "step": 19531
    },
    {
      "epoch": 2.0721408869085507,
      "grad_norm": 0.4416144426307023,
      "learning_rate": 4.6440691508778864e-05,
      "loss": 1.5704,
      "num_input_tokens_seen": 15367111744,
      "step": 19532
    },
    {
      "epoch": 2.072246976448122,
      "grad_norm": 0.35006799698634966,
      "learning_rate": 4.644033409809322e-05,
      "loss": 1.5488,
      "num_input_tokens_seen": 15367898640,
      "step": 19533
    },
    {
      "epoch": 2.0723530659876936,
      "grad_norm": 0.39663351526292373,
      "learning_rate": 4.64399766708391e-05,
      "loss": 1.6846,
      "num_input_tokens_seen": 15368685264,
      "step": 19534
    },
    {
      "epoch": 2.072459155527265,
      "grad_norm": 0.4372755614444892,
      "learning_rate": 4.6439619227016804e-05,
      "loss": 1.539,
      "num_input_tokens_seen": 15369472048,
      "step": 19535
    },
    {
      "epoch": 2.0725652450668366,
      "grad_norm": 0.38576460031198717,
      "learning_rate": 4.64392617666266e-05,
      "loss": 1.695,
      "num_input_tokens_seen": 15370258832,
      "step": 19536
    },
    {
      "epoch": 2.0726713346064076,
      "grad_norm": 0.39590220547034505,
      "learning_rate": 4.643890428966876e-05,
      "loss": 1.574,
      "num_input_tokens_seen": 15371045712,
      "step": 19537
    },
    {
      "epoch": 2.072777424145979,
      "grad_norm": 0.35812756238746396,
      "learning_rate": 4.643854679614356e-05,
      "loss": 1.5599,
      "num_input_tokens_seen": 15371832528,
      "step": 19538
    },
    {
      "epoch": 2.0728835136855506,
      "grad_norm": 0.3661792616039618,
      "learning_rate": 4.643818928605128e-05,
      "loss": 1.618,
      "num_input_tokens_seen": 15372619280,
      "step": 19539
    },
    {
      "epoch": 2.072989603225122,
      "grad_norm": 0.3611446195217351,
      "learning_rate": 4.6437831759392206e-05,
      "loss": 1.6348,
      "num_input_tokens_seen": 15373406080,
      "step": 19540
    },
    {
      "epoch": 2.0730956927646935,
      "grad_norm": 0.43773744146340465,
      "learning_rate": 4.6437474216166595e-05,
      "loss": 1.6204,
      "num_input_tokens_seen": 15374192880,
      "step": 19541
    },
    {
      "epoch": 2.073201782304265,
      "grad_norm": 0.45492979589564386,
      "learning_rate": 4.643711665637474e-05,
      "loss": 1.4541,
      "num_input_tokens_seen": 15374979632,
      "step": 19542
    },
    {
      "epoch": 2.073307871843836,
      "grad_norm": 0.3932011974842056,
      "learning_rate": 4.643675908001691e-05,
      "loss": 1.6485,
      "num_input_tokens_seen": 15375766448,
      "step": 19543
    },
    {
      "epoch": 2.0734139613834075,
      "grad_norm": 0.371564819670101,
      "learning_rate": 4.6436401487093375e-05,
      "loss": 1.5647,
      "num_input_tokens_seen": 15376553200,
      "step": 19544
    },
    {
      "epoch": 2.073520050922979,
      "grad_norm": 0.4246905156101978,
      "learning_rate": 4.643604387760442e-05,
      "loss": 1.6925,
      "num_input_tokens_seen": 15377339920,
      "step": 19545
    },
    {
      "epoch": 2.0736261404625504,
      "grad_norm": 0.4424177210374875,
      "learning_rate": 4.643568625155033e-05,
      "loss": 1.6813,
      "num_input_tokens_seen": 15378126672,
      "step": 19546
    },
    {
      "epoch": 2.073732230002122,
      "grad_norm": 0.42613993957627844,
      "learning_rate": 4.643532860893135e-05,
      "loss": 1.7379,
      "num_input_tokens_seen": 15378913408,
      "step": 19547
    },
    {
      "epoch": 2.0738383195416934,
      "grad_norm": 0.39966702016453004,
      "learning_rate": 4.643497094974779e-05,
      "loss": 1.6739,
      "num_input_tokens_seen": 15379700176,
      "step": 19548
    },
    {
      "epoch": 2.0739444090812644,
      "grad_norm": 0.408237503077933,
      "learning_rate": 4.643461327399992e-05,
      "loss": 1.6329,
      "num_input_tokens_seen": 15380486880,
      "step": 19549
    },
    {
      "epoch": 2.074050498620836,
      "grad_norm": 0.6589189648330496,
      "learning_rate": 4.643425558168799e-05,
      "loss": 1.5402,
      "num_input_tokens_seen": 15381273648,
      "step": 19550
    },
    {
      "epoch": 2.0741565881604074,
      "grad_norm": 0.45038018382409545,
      "learning_rate": 4.6433897872812315e-05,
      "loss": 1.7584,
      "num_input_tokens_seen": 15382060352,
      "step": 19551
    },
    {
      "epoch": 2.074262677699979,
      "grad_norm": 0.3821683294376593,
      "learning_rate": 4.6433540147373146e-05,
      "loss": 1.582,
      "num_input_tokens_seen": 15382847136,
      "step": 19552
    },
    {
      "epoch": 2.0743687672395503,
      "grad_norm": 0.3993532487785312,
      "learning_rate": 4.643318240537076e-05,
      "loss": 1.5439,
      "num_input_tokens_seen": 15383633920,
      "step": 19553
    },
    {
      "epoch": 2.074474856779122,
      "grad_norm": 0.5849052783521932,
      "learning_rate": 4.643282464680545e-05,
      "loss": 1.7435,
      "num_input_tokens_seen": 15384420544,
      "step": 19554
    },
    {
      "epoch": 2.074580946318693,
      "grad_norm": 0.4507419895111892,
      "learning_rate": 4.643246687167748e-05,
      "loss": 1.6055,
      "num_input_tokens_seen": 15385207280,
      "step": 19555
    },
    {
      "epoch": 2.0746870358582643,
      "grad_norm": 0.509291785960822,
      "learning_rate": 4.643210907998712e-05,
      "loss": 1.5593,
      "num_input_tokens_seen": 15385994160,
      "step": 19556
    },
    {
      "epoch": 2.074793125397836,
      "grad_norm": 0.33752492005941315,
      "learning_rate": 4.643175127173466e-05,
      "loss": 1.5314,
      "num_input_tokens_seen": 15386781040,
      "step": 19557
    },
    {
      "epoch": 2.0748992149374073,
      "grad_norm": 0.6243851771015152,
      "learning_rate": 4.643139344692037e-05,
      "loss": 1.6079,
      "num_input_tokens_seen": 15387567792,
      "step": 19558
    },
    {
      "epoch": 2.0750053044769787,
      "grad_norm": 0.3629556250469601,
      "learning_rate": 4.643103560554454e-05,
      "loss": 1.4443,
      "num_input_tokens_seen": 15388354624,
      "step": 19559
    },
    {
      "epoch": 2.0751113940165498,
      "grad_norm": 0.44680561108767036,
      "learning_rate": 4.643067774760742e-05,
      "loss": 1.5493,
      "num_input_tokens_seen": 15389141408,
      "step": 19560
    },
    {
      "epoch": 2.0752174835561212,
      "grad_norm": 0.4584140084055716,
      "learning_rate": 4.6430319873109304e-05,
      "loss": 1.7048,
      "num_input_tokens_seen": 15389928176,
      "step": 19561
    },
    {
      "epoch": 2.0753235730956927,
      "grad_norm": 0.3505642764157179,
      "learning_rate": 4.642996198205046e-05,
      "loss": 1.5752,
      "num_input_tokens_seen": 15390714928,
      "step": 19562
    },
    {
      "epoch": 2.075429662635264,
      "grad_norm": 0.4466920241293053,
      "learning_rate": 4.642960407443119e-05,
      "loss": 1.5042,
      "num_input_tokens_seen": 15391501680,
      "step": 19563
    },
    {
      "epoch": 2.0755357521748357,
      "grad_norm": 0.35777353671859125,
      "learning_rate": 4.642924615025173e-05,
      "loss": 1.562,
      "num_input_tokens_seen": 15392288432,
      "step": 19564
    },
    {
      "epoch": 2.075641841714407,
      "grad_norm": 0.3970092218360892,
      "learning_rate": 4.6428888209512386e-05,
      "loss": 1.5949,
      "num_input_tokens_seen": 15393075200,
      "step": 19565
    },
    {
      "epoch": 2.075747931253978,
      "grad_norm": 0.36802877076290624,
      "learning_rate": 4.6428530252213425e-05,
      "loss": 1.6223,
      "num_input_tokens_seen": 15393862048,
      "step": 19566
    },
    {
      "epoch": 2.0758540207935496,
      "grad_norm": 0.3965188452579033,
      "learning_rate": 4.6428172278355125e-05,
      "loss": 1.641,
      "num_input_tokens_seen": 15394648816,
      "step": 19567
    },
    {
      "epoch": 2.075960110333121,
      "grad_norm": 0.3866480694236712,
      "learning_rate": 4.6427814287937766e-05,
      "loss": 1.5974,
      "num_input_tokens_seen": 15395435520,
      "step": 19568
    },
    {
      "epoch": 2.0760661998726926,
      "grad_norm": 0.42609058488552115,
      "learning_rate": 4.642745628096161e-05,
      "loss": 1.6732,
      "num_input_tokens_seen": 15396222272,
      "step": 19569
    },
    {
      "epoch": 2.076172289412264,
      "grad_norm": 0.39561255290220565,
      "learning_rate": 4.6427098257426956e-05,
      "loss": 1.6258,
      "num_input_tokens_seen": 15397009088,
      "step": 19570
    },
    {
      "epoch": 2.0762783789518355,
      "grad_norm": 0.4472687585920114,
      "learning_rate": 4.642674021733406e-05,
      "loss": 1.6707,
      "num_input_tokens_seen": 15397795840,
      "step": 19571
    },
    {
      "epoch": 2.0763844684914066,
      "grad_norm": 0.36710075190855534,
      "learning_rate": 4.642638216068321e-05,
      "loss": 1.4969,
      "num_input_tokens_seen": 15398582576,
      "step": 19572
    },
    {
      "epoch": 2.076490558030978,
      "grad_norm": 0.43479494998681684,
      "learning_rate": 4.642602408747469e-05,
      "loss": 1.6889,
      "num_input_tokens_seen": 15399369424,
      "step": 19573
    },
    {
      "epoch": 2.0765966475705495,
      "grad_norm": 0.3955111982788214,
      "learning_rate": 4.6425665997708754e-05,
      "loss": 1.5982,
      "num_input_tokens_seen": 15400156256,
      "step": 19574
    },
    {
      "epoch": 2.076702737110121,
      "grad_norm": 0.4164387449955044,
      "learning_rate": 4.64253078913857e-05,
      "loss": 1.5821,
      "num_input_tokens_seen": 15400943056,
      "step": 19575
    },
    {
      "epoch": 2.0768088266496925,
      "grad_norm": 0.3781474306506175,
      "learning_rate": 4.64249497685058e-05,
      "loss": 1.5418,
      "num_input_tokens_seen": 15401729824,
      "step": 19576
    },
    {
      "epoch": 2.076914916189264,
      "grad_norm": 0.4073901576154693,
      "learning_rate": 4.642459162906932e-05,
      "loss": 1.6031,
      "num_input_tokens_seen": 15402516528,
      "step": 19577
    },
    {
      "epoch": 2.077021005728835,
      "grad_norm": 0.37441911622758706,
      "learning_rate": 4.642423347307655e-05,
      "loss": 1.4609,
      "num_input_tokens_seen": 15403303376,
      "step": 19578
    },
    {
      "epoch": 2.0771270952684064,
      "grad_norm": 0.3618910780802519,
      "learning_rate": 4.642387530052775e-05,
      "loss": 1.7513,
      "num_input_tokens_seen": 15404090064,
      "step": 19579
    },
    {
      "epoch": 2.077233184807978,
      "grad_norm": 0.3508184042834522,
      "learning_rate": 4.642351711142322e-05,
      "loss": 1.6048,
      "num_input_tokens_seen": 15404876816,
      "step": 19580
    },
    {
      "epoch": 2.0773392743475494,
      "grad_norm": 0.413708765612168,
      "learning_rate": 4.642315890576322e-05,
      "loss": 1.7408,
      "num_input_tokens_seen": 15405663552,
      "step": 19581
    },
    {
      "epoch": 2.077445363887121,
      "grad_norm": 0.3872246508393984,
      "learning_rate": 4.642280068354803e-05,
      "loss": 1.6273,
      "num_input_tokens_seen": 15406450256,
      "step": 19582
    },
    {
      "epoch": 2.0775514534266923,
      "grad_norm": 0.38485008081131117,
      "learning_rate": 4.6422442444777935e-05,
      "loss": 1.5969,
      "num_input_tokens_seen": 15407237088,
      "step": 19583
    },
    {
      "epoch": 2.0776575429662634,
      "grad_norm": 0.3471984128760806,
      "learning_rate": 4.6422084189453196e-05,
      "loss": 1.6386,
      "num_input_tokens_seen": 15408023872,
      "step": 19584
    },
    {
      "epoch": 2.077763632505835,
      "grad_norm": 0.42469046521488146,
      "learning_rate": 4.642172591757411e-05,
      "loss": 1.5734,
      "num_input_tokens_seen": 15408810544,
      "step": 19585
    },
    {
      "epoch": 2.0778697220454063,
      "grad_norm": 0.39988671379128826,
      "learning_rate": 4.642136762914093e-05,
      "loss": 1.6745,
      "num_input_tokens_seen": 15409597328,
      "step": 19586
    },
    {
      "epoch": 2.077975811584978,
      "grad_norm": 0.4169343056938373,
      "learning_rate": 4.642100932415395e-05,
      "loss": 1.6446,
      "num_input_tokens_seen": 15410384048,
      "step": 19587
    },
    {
      "epoch": 2.0780819011245493,
      "grad_norm": 0.3543280513179077,
      "learning_rate": 4.642065100261345e-05,
      "loss": 1.6304,
      "num_input_tokens_seen": 15411170768,
      "step": 19588
    },
    {
      "epoch": 2.0781879906641203,
      "grad_norm": 0.37417991128316047,
      "learning_rate": 4.6420292664519687e-05,
      "loss": 1.6185,
      "num_input_tokens_seen": 15411957552,
      "step": 19589
    },
    {
      "epoch": 2.0782940802036918,
      "grad_norm": 0.36991708342127727,
      "learning_rate": 4.641993430987296e-05,
      "loss": 1.534,
      "num_input_tokens_seen": 15412744384,
      "step": 19590
    },
    {
      "epoch": 2.0784001697432632,
      "grad_norm": 0.4345046039148668,
      "learning_rate": 4.6419575938673533e-05,
      "loss": 1.631,
      "num_input_tokens_seen": 15413531168,
      "step": 19591
    },
    {
      "epoch": 2.0785062592828347,
      "grad_norm": 0.38742161466156816,
      "learning_rate": 4.641921755092168e-05,
      "loss": 1.7698,
      "num_input_tokens_seen": 15414317920,
      "step": 19592
    },
    {
      "epoch": 2.078612348822406,
      "grad_norm": 0.3979352503053612,
      "learning_rate": 4.641885914661769e-05,
      "loss": 1.7229,
      "num_input_tokens_seen": 15415104704,
      "step": 19593
    },
    {
      "epoch": 2.0787184383619777,
      "grad_norm": 0.42042277097547087,
      "learning_rate": 4.6418500725761834e-05,
      "loss": 1.727,
      "num_input_tokens_seen": 15415891504,
      "step": 19594
    },
    {
      "epoch": 2.0788245279015487,
      "grad_norm": 0.37763563961087915,
      "learning_rate": 4.6418142288354386e-05,
      "loss": 1.565,
      "num_input_tokens_seen": 15416678352,
      "step": 19595
    },
    {
      "epoch": 2.07893061744112,
      "grad_norm": 0.43363356645900597,
      "learning_rate": 4.641778383439563e-05,
      "loss": 1.728,
      "num_input_tokens_seen": 15417465040,
      "step": 19596
    },
    {
      "epoch": 2.0790367069806917,
      "grad_norm": 0.3118165216263441,
      "learning_rate": 4.6417425363885844e-05,
      "loss": 1.4383,
      "num_input_tokens_seen": 15418251808,
      "step": 19597
    },
    {
      "epoch": 2.079142796520263,
      "grad_norm": 0.4150482886364134,
      "learning_rate": 4.6417066876825285e-05,
      "loss": 1.7692,
      "num_input_tokens_seen": 15419038464,
      "step": 19598
    },
    {
      "epoch": 2.0792488860598346,
      "grad_norm": 0.39787525838348453,
      "learning_rate": 4.641670837321426e-05,
      "loss": 1.796,
      "num_input_tokens_seen": 15419825280,
      "step": 19599
    },
    {
      "epoch": 2.079354975599406,
      "grad_norm": 0.4716037810407825,
      "learning_rate": 4.6416349853053026e-05,
      "loss": 1.6506,
      "num_input_tokens_seen": 15420612000,
      "step": 19600
    },
    {
      "epoch": 2.079461065138977,
      "grad_norm": 0.43508373252473254,
      "learning_rate": 4.641599131634187e-05,
      "loss": 1.6165,
      "num_input_tokens_seen": 15421398800,
      "step": 19601
    },
    {
      "epoch": 2.0795671546785486,
      "grad_norm": 0.39267411337964875,
      "learning_rate": 4.641563276308105e-05,
      "loss": 1.5805,
      "num_input_tokens_seen": 15422185600,
      "step": 19602
    },
    {
      "epoch": 2.07967324421812,
      "grad_norm": 0.36469518680903956,
      "learning_rate": 4.6415274193270873e-05,
      "loss": 1.6096,
      "num_input_tokens_seen": 15422972352,
      "step": 19603
    },
    {
      "epoch": 2.0797793337576915,
      "grad_norm": 0.37866519670093884,
      "learning_rate": 4.641491560691159e-05,
      "loss": 1.5818,
      "num_input_tokens_seen": 15423759136,
      "step": 19604
    },
    {
      "epoch": 2.079885423297263,
      "grad_norm": 0.48043634737170576,
      "learning_rate": 4.6414557004003495e-05,
      "loss": 1.6548,
      "num_input_tokens_seen": 15424545744,
      "step": 19605
    },
    {
      "epoch": 2.0799915128368345,
      "grad_norm": 0.36017083247280884,
      "learning_rate": 4.641419838454686e-05,
      "loss": 1.4929,
      "num_input_tokens_seen": 15425332528,
      "step": 19606
    },
    {
      "epoch": 2.0800976023764055,
      "grad_norm": 0.41690067588834917,
      "learning_rate": 4.6413839748541955e-05,
      "loss": 1.7211,
      "num_input_tokens_seen": 15426119280,
      "step": 19607
    },
    {
      "epoch": 2.080203691915977,
      "grad_norm": 0.38437677359266215,
      "learning_rate": 4.641348109598907e-05,
      "loss": 1.5622,
      "num_input_tokens_seen": 15426906144,
      "step": 19608
    },
    {
      "epoch": 2.0803097814555485,
      "grad_norm": 0.4234271953548525,
      "learning_rate": 4.641312242688847e-05,
      "loss": 1.7096,
      "num_input_tokens_seen": 15427692896,
      "step": 19609
    },
    {
      "epoch": 2.08041587099512,
      "grad_norm": 0.49067466627453354,
      "learning_rate": 4.6412763741240425e-05,
      "loss": 1.5932,
      "num_input_tokens_seen": 15428479680,
      "step": 19610
    },
    {
      "epoch": 2.0805219605346914,
      "grad_norm": 0.46432941920874105,
      "learning_rate": 4.641240503904524e-05,
      "loss": 1.6096,
      "num_input_tokens_seen": 15429266496,
      "step": 19611
    },
    {
      "epoch": 2.080628050074263,
      "grad_norm": 0.4842771548808593,
      "learning_rate": 4.641204632030318e-05,
      "loss": 1.6961,
      "num_input_tokens_seen": 15430053136,
      "step": 19612
    },
    {
      "epoch": 2.080734139613834,
      "grad_norm": 0.48596353166339756,
      "learning_rate": 4.6411687585014505e-05,
      "loss": 1.7191,
      "num_input_tokens_seen": 15430839840,
      "step": 19613
    },
    {
      "epoch": 2.0808402291534054,
      "grad_norm": 0.4408283793907154,
      "learning_rate": 4.641132883317952e-05,
      "loss": 1.5422,
      "num_input_tokens_seen": 15431626624,
      "step": 19614
    },
    {
      "epoch": 2.080946318692977,
      "grad_norm": 0.4158406049286014,
      "learning_rate": 4.641097006479847e-05,
      "loss": 1.6121,
      "num_input_tokens_seen": 15432413376,
      "step": 19615
    },
    {
      "epoch": 2.0810524082325483,
      "grad_norm": 0.5071283450755893,
      "learning_rate": 4.6410611279871676e-05,
      "loss": 1.7242,
      "num_input_tokens_seen": 15433200112,
      "step": 19616
    },
    {
      "epoch": 2.08115849777212,
      "grad_norm": 0.40252148156494694,
      "learning_rate": 4.641025247839937e-05,
      "loss": 1.5806,
      "num_input_tokens_seen": 15433986848,
      "step": 19617
    },
    {
      "epoch": 2.081264587311691,
      "grad_norm": 0.43019740513536503,
      "learning_rate": 4.6409893660381856e-05,
      "loss": 1.5478,
      "num_input_tokens_seen": 15434773712,
      "step": 19618
    },
    {
      "epoch": 2.0813706768512623,
      "grad_norm": 0.5435558250208435,
      "learning_rate": 4.64095348258194e-05,
      "loss": 1.5986,
      "num_input_tokens_seen": 15435560544,
      "step": 19619
    },
    {
      "epoch": 2.081476766390834,
      "grad_norm": 0.4298540750642672,
      "learning_rate": 4.6409175974712296e-05,
      "loss": 1.5481,
      "num_input_tokens_seen": 15436347296,
      "step": 19620
    },
    {
      "epoch": 2.0815828559304053,
      "grad_norm": 0.46799663705281747,
      "learning_rate": 4.64088171070608e-05,
      "loss": 1.5901,
      "num_input_tokens_seen": 15437134160,
      "step": 19621
    },
    {
      "epoch": 2.0816889454699767,
      "grad_norm": 0.3844542468657707,
      "learning_rate": 4.640845822286519e-05,
      "loss": 1.5514,
      "num_input_tokens_seen": 15437921040,
      "step": 19622
    },
    {
      "epoch": 2.081795035009548,
      "grad_norm": 0.36334470587546835,
      "learning_rate": 4.640809932212577e-05,
      "loss": 1.6096,
      "num_input_tokens_seen": 15438707712,
      "step": 19623
    },
    {
      "epoch": 2.0819011245491192,
      "grad_norm": 0.4804049730103065,
      "learning_rate": 4.640774040484278e-05,
      "loss": 1.6472,
      "num_input_tokens_seen": 15439494320,
      "step": 19624
    },
    {
      "epoch": 2.0820072140886907,
      "grad_norm": 0.3794072461848345,
      "learning_rate": 4.640738147101653e-05,
      "loss": 1.6573,
      "num_input_tokens_seen": 15440281088,
      "step": 19625
    },
    {
      "epoch": 2.082113303628262,
      "grad_norm": 0.35596799203038615,
      "learning_rate": 4.640702252064728e-05,
      "loss": 1.4768,
      "num_input_tokens_seen": 15441067888,
      "step": 19626
    },
    {
      "epoch": 2.0822193931678337,
      "grad_norm": 0.4116905797821236,
      "learning_rate": 4.640666355373531e-05,
      "loss": 1.6898,
      "num_input_tokens_seen": 15441854608,
      "step": 19627
    },
    {
      "epoch": 2.082325482707405,
      "grad_norm": 0.3655908355753078,
      "learning_rate": 4.64063045702809e-05,
      "loss": 1.6952,
      "num_input_tokens_seen": 15442641376,
      "step": 19628
    },
    {
      "epoch": 2.0824315722469766,
      "grad_norm": 0.39699670330646153,
      "learning_rate": 4.6405945570284324e-05,
      "loss": 1.5641,
      "num_input_tokens_seen": 15443428272,
      "step": 19629
    },
    {
      "epoch": 2.0825376617865476,
      "grad_norm": 0.3880026448463025,
      "learning_rate": 4.640558655374586e-05,
      "loss": 1.6046,
      "num_input_tokens_seen": 15444214976,
      "step": 19630
    },
    {
      "epoch": 2.082643751326119,
      "grad_norm": 0.38429256420697333,
      "learning_rate": 4.6405227520665794e-05,
      "loss": 1.5895,
      "num_input_tokens_seen": 15445001776,
      "step": 19631
    },
    {
      "epoch": 2.0827498408656906,
      "grad_norm": 0.3988233601021939,
      "learning_rate": 4.640486847104439e-05,
      "loss": 1.642,
      "num_input_tokens_seen": 15445788576,
      "step": 19632
    },
    {
      "epoch": 2.082855930405262,
      "grad_norm": 0.5202384125781835,
      "learning_rate": 4.6404509404881936e-05,
      "loss": 1.55,
      "num_input_tokens_seen": 15446575440,
      "step": 19633
    },
    {
      "epoch": 2.0829620199448335,
      "grad_norm": 0.376731413015932,
      "learning_rate": 4.6404150322178694e-05,
      "loss": 1.5507,
      "num_input_tokens_seen": 15447362144,
      "step": 19634
    },
    {
      "epoch": 2.083068109484405,
      "grad_norm": 0.6806243919868614,
      "learning_rate": 4.6403791222934965e-05,
      "loss": 1.679,
      "num_input_tokens_seen": 15448148864,
      "step": 19635
    },
    {
      "epoch": 2.083174199023976,
      "grad_norm": 0.4849428170067325,
      "learning_rate": 4.6403432107151014e-05,
      "loss": 1.6326,
      "num_input_tokens_seen": 15448935632,
      "step": 19636
    },
    {
      "epoch": 2.0832802885635475,
      "grad_norm": 0.5927723186100029,
      "learning_rate": 4.640307297482711e-05,
      "loss": 1.6042,
      "num_input_tokens_seen": 15449722368,
      "step": 19637
    },
    {
      "epoch": 2.083386378103119,
      "grad_norm": 0.46545640242066916,
      "learning_rate": 4.640271382596355e-05,
      "loss": 1.6886,
      "num_input_tokens_seen": 15450509184,
      "step": 19638
    },
    {
      "epoch": 2.0834924676426905,
      "grad_norm": 0.46310189857480055,
      "learning_rate": 4.6402354660560584e-05,
      "loss": 1.5996,
      "num_input_tokens_seen": 15451295920,
      "step": 19639
    },
    {
      "epoch": 2.083598557182262,
      "grad_norm": 0.36966972179719376,
      "learning_rate": 4.640199547861852e-05,
      "loss": 1.6003,
      "num_input_tokens_seen": 15452082656,
      "step": 19640
    },
    {
      "epoch": 2.0837046467218334,
      "grad_norm": 0.43175367382604146,
      "learning_rate": 4.6401636280137626e-05,
      "loss": 1.5699,
      "num_input_tokens_seen": 15452869440,
      "step": 19641
    },
    {
      "epoch": 2.0838107362614045,
      "grad_norm": 0.4587465194806714,
      "learning_rate": 4.640127706511817e-05,
      "loss": 1.6848,
      "num_input_tokens_seen": 15453656192,
      "step": 19642
    },
    {
      "epoch": 2.083916825800976,
      "grad_norm": 0.44660128741532507,
      "learning_rate": 4.640091783356043e-05,
      "loss": 1.5977,
      "num_input_tokens_seen": 15454442928,
      "step": 19643
    },
    {
      "epoch": 2.0840229153405474,
      "grad_norm": 0.35354934602461197,
      "learning_rate": 4.640055858546469e-05,
      "loss": 1.4775,
      "num_input_tokens_seen": 15455229808,
      "step": 19644
    },
    {
      "epoch": 2.084129004880119,
      "grad_norm": 0.431492180016932,
      "learning_rate": 4.6400199320831226e-05,
      "loss": 1.5964,
      "num_input_tokens_seen": 15456016512,
      "step": 19645
    },
    {
      "epoch": 2.0842350944196903,
      "grad_norm": 0.39758450165838133,
      "learning_rate": 4.6399840039660324e-05,
      "loss": 1.6013,
      "num_input_tokens_seen": 15456803232,
      "step": 19646
    },
    {
      "epoch": 2.084341183959262,
      "grad_norm": 0.34381111658261687,
      "learning_rate": 4.639948074195224e-05,
      "loss": 1.5358,
      "num_input_tokens_seen": 15457589968,
      "step": 19647
    },
    {
      "epoch": 2.084447273498833,
      "grad_norm": 0.37646275870873025,
      "learning_rate": 4.639912142770728e-05,
      "loss": 1.6609,
      "num_input_tokens_seen": 15458376784,
      "step": 19648
    },
    {
      "epoch": 2.0845533630384043,
      "grad_norm": 0.38267759727847583,
      "learning_rate": 4.63987620969257e-05,
      "loss": 1.5546,
      "num_input_tokens_seen": 15459163472,
      "step": 19649
    },
    {
      "epoch": 2.084659452577976,
      "grad_norm": 0.4040388144963712,
      "learning_rate": 4.6398402749607785e-05,
      "loss": 1.5497,
      "num_input_tokens_seen": 15459950272,
      "step": 19650
    },
    {
      "epoch": 2.0847655421175473,
      "grad_norm": 0.4007449804055048,
      "learning_rate": 4.639804338575381e-05,
      "loss": 1.6695,
      "num_input_tokens_seen": 15460737040,
      "step": 19651
    },
    {
      "epoch": 2.0848716316571188,
      "grad_norm": 0.4007301305830083,
      "learning_rate": 4.639768400536406e-05,
      "loss": 1.6744,
      "num_input_tokens_seen": 15461523824,
      "step": 19652
    },
    {
      "epoch": 2.0849777211966902,
      "grad_norm": 0.4226214695202336,
      "learning_rate": 4.63973246084388e-05,
      "loss": 1.5308,
      "num_input_tokens_seen": 15462310528,
      "step": 19653
    },
    {
      "epoch": 2.0850838107362613,
      "grad_norm": 0.3888745670634358,
      "learning_rate": 4.639696519497832e-05,
      "loss": 1.7109,
      "num_input_tokens_seen": 15463097248,
      "step": 19654
    },
    {
      "epoch": 2.0851899002758327,
      "grad_norm": 0.4163970113348506,
      "learning_rate": 4.6396605764982894e-05,
      "loss": 1.6202,
      "num_input_tokens_seen": 15463884032,
      "step": 19655
    },
    {
      "epoch": 2.085295989815404,
      "grad_norm": 0.410012055029942,
      "learning_rate": 4.63962463184528e-05,
      "loss": 1.5968,
      "num_input_tokens_seen": 15464670720,
      "step": 19656
    },
    {
      "epoch": 2.0854020793549757,
      "grad_norm": 0.4518416382027507,
      "learning_rate": 4.6395886855388306e-05,
      "loss": 1.4913,
      "num_input_tokens_seen": 15465457584,
      "step": 19657
    },
    {
      "epoch": 2.085508168894547,
      "grad_norm": 0.39865539825041785,
      "learning_rate": 4.6395527375789705e-05,
      "loss": 1.5271,
      "num_input_tokens_seen": 15466244384,
      "step": 19658
    },
    {
      "epoch": 2.085614258434118,
      "grad_norm": 0.46711468437491344,
      "learning_rate": 4.639516787965727e-05,
      "loss": 1.6178,
      "num_input_tokens_seen": 15467031152,
      "step": 19659
    },
    {
      "epoch": 2.0857203479736897,
      "grad_norm": 0.3949331747343632,
      "learning_rate": 4.639480836699127e-05,
      "loss": 1.6298,
      "num_input_tokens_seen": 15467817840,
      "step": 19660
    },
    {
      "epoch": 2.085826437513261,
      "grad_norm": 0.40346976863485073,
      "learning_rate": 4.6394448837791996e-05,
      "loss": 1.5933,
      "num_input_tokens_seen": 15468604656,
      "step": 19661
    },
    {
      "epoch": 2.0859325270528326,
      "grad_norm": 0.37613640548870786,
      "learning_rate": 4.639408929205972e-05,
      "loss": 1.6121,
      "num_input_tokens_seen": 15469391392,
      "step": 19662
    },
    {
      "epoch": 2.086038616592404,
      "grad_norm": 0.4543080619599442,
      "learning_rate": 4.639372972979472e-05,
      "loss": 1.7713,
      "num_input_tokens_seen": 15470178112,
      "step": 19663
    },
    {
      "epoch": 2.0861447061319756,
      "grad_norm": 0.3623526794674998,
      "learning_rate": 4.639337015099727e-05,
      "loss": 1.6642,
      "num_input_tokens_seen": 15470964880,
      "step": 19664
    },
    {
      "epoch": 2.0862507956715466,
      "grad_norm": 0.42480210737416974,
      "learning_rate": 4.639301055566765e-05,
      "loss": 1.5759,
      "num_input_tokens_seen": 15471751632,
      "step": 19665
    },
    {
      "epoch": 2.086356885211118,
      "grad_norm": 0.43093754071216334,
      "learning_rate": 4.639265094380614e-05,
      "loss": 1.745,
      "num_input_tokens_seen": 15472538288,
      "step": 19666
    },
    {
      "epoch": 2.0864629747506895,
      "grad_norm": 0.4820451400611543,
      "learning_rate": 4.639229131541302e-05,
      "loss": 1.6104,
      "num_input_tokens_seen": 15473325008,
      "step": 19667
    },
    {
      "epoch": 2.086569064290261,
      "grad_norm": 0.3749115206938331,
      "learning_rate": 4.6391931670488564e-05,
      "loss": 1.6668,
      "num_input_tokens_seen": 15474111728,
      "step": 19668
    },
    {
      "epoch": 2.0866751538298325,
      "grad_norm": 0.6786109321383198,
      "learning_rate": 4.639157200903305e-05,
      "loss": 1.7049,
      "num_input_tokens_seen": 15474898480,
      "step": 19669
    },
    {
      "epoch": 2.086781243369404,
      "grad_norm": 0.35969341164837565,
      "learning_rate": 4.6391212331046764e-05,
      "loss": 1.4855,
      "num_input_tokens_seen": 15475685264,
      "step": 19670
    },
    {
      "epoch": 2.086887332908975,
      "grad_norm": 0.45195954554605716,
      "learning_rate": 4.639085263652997e-05,
      "loss": 1.5403,
      "num_input_tokens_seen": 15476472112,
      "step": 19671
    },
    {
      "epoch": 2.0869934224485465,
      "grad_norm": 0.4911333311496201,
      "learning_rate": 4.639049292548295e-05,
      "loss": 1.6882,
      "num_input_tokens_seen": 15477258832,
      "step": 19672
    },
    {
      "epoch": 2.087099511988118,
      "grad_norm": 0.470002830995029,
      "learning_rate": 4.639013319790598e-05,
      "loss": 1.7136,
      "num_input_tokens_seen": 15478045456,
      "step": 19673
    },
    {
      "epoch": 2.0872056015276894,
      "grad_norm": 0.3879482528207057,
      "learning_rate": 4.638977345379936e-05,
      "loss": 1.6502,
      "num_input_tokens_seen": 15478832176,
      "step": 19674
    },
    {
      "epoch": 2.087311691067261,
      "grad_norm": 0.361804523984701,
      "learning_rate": 4.638941369316334e-05,
      "loss": 1.6531,
      "num_input_tokens_seen": 15479618992,
      "step": 19675
    },
    {
      "epoch": 2.0874177806068324,
      "grad_norm": 0.3681125462835098,
      "learning_rate": 4.6389053915998205e-05,
      "loss": 1.6257,
      "num_input_tokens_seen": 15480405696,
      "step": 19676
    },
    {
      "epoch": 2.0875238701464034,
      "grad_norm": 0.33654486461064,
      "learning_rate": 4.638869412230424e-05,
      "loss": 1.6263,
      "num_input_tokens_seen": 15481192448,
      "step": 19677
    },
    {
      "epoch": 2.087629959685975,
      "grad_norm": 0.3758935888016131,
      "learning_rate": 4.6388334312081724e-05,
      "loss": 1.5688,
      "num_input_tokens_seen": 15481979200,
      "step": 19678
    },
    {
      "epoch": 2.0877360492255463,
      "grad_norm": 0.39070693772444043,
      "learning_rate": 4.638797448533093e-05,
      "loss": 1.643,
      "num_input_tokens_seen": 15482765952,
      "step": 19679
    },
    {
      "epoch": 2.087842138765118,
      "grad_norm": 0.3288137296983889,
      "learning_rate": 4.6387614642052134e-05,
      "loss": 1.5865,
      "num_input_tokens_seen": 15483552736,
      "step": 19680
    },
    {
      "epoch": 2.0879482283046893,
      "grad_norm": 0.39032444446061487,
      "learning_rate": 4.638725478224562e-05,
      "loss": 1.6145,
      "num_input_tokens_seen": 15484339472,
      "step": 19681
    },
    {
      "epoch": 2.0880543178442608,
      "grad_norm": 0.39042901795472457,
      "learning_rate": 4.638689490591166e-05,
      "loss": 1.6179,
      "num_input_tokens_seen": 15485126304,
      "step": 19682
    },
    {
      "epoch": 2.088160407383832,
      "grad_norm": 0.42459505729141467,
      "learning_rate": 4.638653501305054e-05,
      "loss": 1.6092,
      "num_input_tokens_seen": 15485913184,
      "step": 19683
    },
    {
      "epoch": 2.0882664969234033,
      "grad_norm": 0.38103219405058764,
      "learning_rate": 4.638617510366252e-05,
      "loss": 1.6778,
      "num_input_tokens_seen": 15486699936,
      "step": 19684
    },
    {
      "epoch": 2.0883725864629747,
      "grad_norm": 0.42634072853796534,
      "learning_rate": 4.6385815177747906e-05,
      "loss": 1.6365,
      "num_input_tokens_seen": 15487486736,
      "step": 19685
    },
    {
      "epoch": 2.088478676002546,
      "grad_norm": 0.3823450610224533,
      "learning_rate": 4.6385455235306954e-05,
      "loss": 1.5304,
      "num_input_tokens_seen": 15488273440,
      "step": 19686
    },
    {
      "epoch": 2.0885847655421177,
      "grad_norm": 0.3763025328917722,
      "learning_rate": 4.638509527633995e-05,
      "loss": 1.5883,
      "num_input_tokens_seen": 15489060272,
      "step": 19687
    },
    {
      "epoch": 2.0886908550816887,
      "grad_norm": 0.4141351920601592,
      "learning_rate": 4.6384735300847176e-05,
      "loss": 1.6363,
      "num_input_tokens_seen": 15489846992,
      "step": 19688
    },
    {
      "epoch": 2.08879694462126,
      "grad_norm": 0.3739417988150792,
      "learning_rate": 4.6384375308828905e-05,
      "loss": 1.6621,
      "num_input_tokens_seen": 15490633808,
      "step": 19689
    },
    {
      "epoch": 2.0889030341608317,
      "grad_norm": 0.47166215526395006,
      "learning_rate": 4.6384015300285414e-05,
      "loss": 1.7349,
      "num_input_tokens_seen": 15491420576,
      "step": 19690
    },
    {
      "epoch": 2.089009123700403,
      "grad_norm": 0.4020507846900323,
      "learning_rate": 4.638365527521699e-05,
      "loss": 1.5962,
      "num_input_tokens_seen": 15492207280,
      "step": 19691
    },
    {
      "epoch": 2.0891152132399746,
      "grad_norm": 0.37136696504214106,
      "learning_rate": 4.638329523362389e-05,
      "loss": 1.5345,
      "num_input_tokens_seen": 15492994016,
      "step": 19692
    },
    {
      "epoch": 2.089221302779546,
      "grad_norm": 0.40530840079682656,
      "learning_rate": 4.638293517550642e-05,
      "loss": 1.585,
      "num_input_tokens_seen": 15493780672,
      "step": 19693
    },
    {
      "epoch": 2.089327392319117,
      "grad_norm": 0.38687588642580173,
      "learning_rate": 4.638257510086484e-05,
      "loss": 1.6098,
      "num_input_tokens_seen": 15494567392,
      "step": 19694
    },
    {
      "epoch": 2.0894334818586886,
      "grad_norm": 0.4841802224602911,
      "learning_rate": 4.6382215009699434e-05,
      "loss": 1.5956,
      "num_input_tokens_seen": 15495354224,
      "step": 19695
    },
    {
      "epoch": 2.08953957139826,
      "grad_norm": 0.3788036809681875,
      "learning_rate": 4.638185490201048e-05,
      "loss": 1.6189,
      "num_input_tokens_seen": 15496140992,
      "step": 19696
    },
    {
      "epoch": 2.0896456609378316,
      "grad_norm": 0.5682133583294949,
      "learning_rate": 4.6381494777798256e-05,
      "loss": 1.5967,
      "num_input_tokens_seen": 15496927712,
      "step": 19697
    },
    {
      "epoch": 2.089751750477403,
      "grad_norm": 0.3971062115850985,
      "learning_rate": 4.638113463706304e-05,
      "loss": 1.6797,
      "num_input_tokens_seen": 15497714480,
      "step": 19698
    },
    {
      "epoch": 2.0898578400169745,
      "grad_norm": 0.4394094236962304,
      "learning_rate": 4.638077447980511e-05,
      "loss": 1.6022,
      "num_input_tokens_seen": 15498501200,
      "step": 19699
    },
    {
      "epoch": 2.0899639295565455,
      "grad_norm": 0.3939563178820572,
      "learning_rate": 4.638041430602474e-05,
      "loss": 1.5709,
      "num_input_tokens_seen": 15499287920,
      "step": 19700
    },
    {
      "epoch": 2.090070019096117,
      "grad_norm": 0.472454235392414,
      "learning_rate": 4.6380054115722225e-05,
      "loss": 1.5891,
      "num_input_tokens_seen": 15500074592,
      "step": 19701
    },
    {
      "epoch": 2.0901761086356885,
      "grad_norm": 0.4401006305336517,
      "learning_rate": 4.637969390889783e-05,
      "loss": 1.6192,
      "num_input_tokens_seen": 15500861280,
      "step": 19702
    },
    {
      "epoch": 2.09028219817526,
      "grad_norm": 0.49895372722403347,
      "learning_rate": 4.637933368555183e-05,
      "loss": 1.7154,
      "num_input_tokens_seen": 15501647984,
      "step": 19703
    },
    {
      "epoch": 2.0903882877148314,
      "grad_norm": 0.4058177224522675,
      "learning_rate": 4.63789734456845e-05,
      "loss": 1.5234,
      "num_input_tokens_seen": 15502434768,
      "step": 19704
    },
    {
      "epoch": 2.090494377254403,
      "grad_norm": 0.397325584825861,
      "learning_rate": 4.637861318929614e-05,
      "loss": 1.5922,
      "num_input_tokens_seen": 15503221536,
      "step": 19705
    },
    {
      "epoch": 2.090600466793974,
      "grad_norm": 0.4139927789615582,
      "learning_rate": 4.6378252916387014e-05,
      "loss": 1.6313,
      "num_input_tokens_seen": 15504008272,
      "step": 19706
    },
    {
      "epoch": 2.0907065563335454,
      "grad_norm": 0.3804548275957751,
      "learning_rate": 4.637789262695739e-05,
      "loss": 1.6509,
      "num_input_tokens_seen": 15504794944,
      "step": 19707
    },
    {
      "epoch": 2.090812645873117,
      "grad_norm": 0.43090082423558745,
      "learning_rate": 4.6377532321007566e-05,
      "loss": 1.6647,
      "num_input_tokens_seen": 15505581696,
      "step": 19708
    },
    {
      "epoch": 2.0909187354126884,
      "grad_norm": 0.3912830156615754,
      "learning_rate": 4.6377171998537815e-05,
      "loss": 1.661,
      "num_input_tokens_seen": 15506368528,
      "step": 19709
    },
    {
      "epoch": 2.09102482495226,
      "grad_norm": 0.31085759063707474,
      "learning_rate": 4.63768116595484e-05,
      "loss": 1.3491,
      "num_input_tokens_seen": 15507155392,
      "step": 19710
    },
    {
      "epoch": 2.0911309144918313,
      "grad_norm": 0.44739093250947143,
      "learning_rate": 4.637645130403963e-05,
      "loss": 1.6382,
      "num_input_tokens_seen": 15507942144,
      "step": 19711
    },
    {
      "epoch": 2.0912370040314023,
      "grad_norm": 0.431828175590004,
      "learning_rate": 4.637609093201175e-05,
      "loss": 1.6242,
      "num_input_tokens_seen": 15508728960,
      "step": 19712
    },
    {
      "epoch": 2.091343093570974,
      "grad_norm": 0.38912745638740037,
      "learning_rate": 4.6375730543465066e-05,
      "loss": 1.7544,
      "num_input_tokens_seen": 15509515696,
      "step": 19713
    },
    {
      "epoch": 2.0914491831105453,
      "grad_norm": 0.4829546169376013,
      "learning_rate": 4.6375370138399845e-05,
      "loss": 1.6315,
      "num_input_tokens_seen": 15510302496,
      "step": 19714
    },
    {
      "epoch": 2.0915552726501168,
      "grad_norm": 0.42465977428201895,
      "learning_rate": 4.637500971681635e-05,
      "loss": 1.6852,
      "num_input_tokens_seen": 15511089232,
      "step": 19715
    },
    {
      "epoch": 2.0916613621896882,
      "grad_norm": 0.4893861675435717,
      "learning_rate": 4.6374649278714886e-05,
      "loss": 1.6487,
      "num_input_tokens_seen": 15511875952,
      "step": 19716
    },
    {
      "epoch": 2.0917674517292597,
      "grad_norm": 0.4316700558189561,
      "learning_rate": 4.637428882409572e-05,
      "loss": 1.6914,
      "num_input_tokens_seen": 15512662640,
      "step": 19717
    },
    {
      "epoch": 2.0918735412688307,
      "grad_norm": 0.3736196708926701,
      "learning_rate": 4.637392835295913e-05,
      "loss": 1.658,
      "num_input_tokens_seen": 15513449456,
      "step": 19718
    },
    {
      "epoch": 2.091979630808402,
      "grad_norm": 0.4959022753760217,
      "learning_rate": 4.6373567865305395e-05,
      "loss": 1.6225,
      "num_input_tokens_seen": 15514236176,
      "step": 19719
    },
    {
      "epoch": 2.0920857203479737,
      "grad_norm": 0.4429913565333978,
      "learning_rate": 4.63732073611348e-05,
      "loss": 1.5998,
      "num_input_tokens_seen": 15515022960,
      "step": 19720
    },
    {
      "epoch": 2.092191809887545,
      "grad_norm": 0.432884736288517,
      "learning_rate": 4.63728468404476e-05,
      "loss": 1.5244,
      "num_input_tokens_seen": 15515809632,
      "step": 19721
    },
    {
      "epoch": 2.0922978994271166,
      "grad_norm": 0.37040017618448634,
      "learning_rate": 4.637248630324411e-05,
      "loss": 1.5411,
      "num_input_tokens_seen": 15516596368,
      "step": 19722
    },
    {
      "epoch": 2.092403988966688,
      "grad_norm": 0.3831552849725446,
      "learning_rate": 4.637212574952457e-05,
      "loss": 1.5115,
      "num_input_tokens_seen": 15517383232,
      "step": 19723
    },
    {
      "epoch": 2.092510078506259,
      "grad_norm": 0.4175637721738363,
      "learning_rate": 4.63717651792893e-05,
      "loss": 1.6584,
      "num_input_tokens_seen": 15518170032,
      "step": 19724
    },
    {
      "epoch": 2.0926161680458306,
      "grad_norm": 0.4414790939745779,
      "learning_rate": 4.637140459253855e-05,
      "loss": 1.7063,
      "num_input_tokens_seen": 15518956816,
      "step": 19725
    },
    {
      "epoch": 2.092722257585402,
      "grad_norm": 0.3635246463926996,
      "learning_rate": 4.63710439892726e-05,
      "loss": 1.6553,
      "num_input_tokens_seen": 15519743568,
      "step": 19726
    },
    {
      "epoch": 2.0928283471249736,
      "grad_norm": 0.39189419621678084,
      "learning_rate": 4.637068336949174e-05,
      "loss": 1.4774,
      "num_input_tokens_seen": 15520530352,
      "step": 19727
    },
    {
      "epoch": 2.092934436664545,
      "grad_norm": 0.3711049966285665,
      "learning_rate": 4.637032273319624e-05,
      "loss": 1.6756,
      "num_input_tokens_seen": 15521317120,
      "step": 19728
    },
    {
      "epoch": 2.093040526204116,
      "grad_norm": 0.4302432986432378,
      "learning_rate": 4.6369962080386375e-05,
      "loss": 1.6069,
      "num_input_tokens_seen": 15522103920,
      "step": 19729
    },
    {
      "epoch": 2.0931466157436875,
      "grad_norm": 0.37164578175722046,
      "learning_rate": 4.636960141106244e-05,
      "loss": 1.5341,
      "num_input_tokens_seen": 15522890816,
      "step": 19730
    },
    {
      "epoch": 2.093252705283259,
      "grad_norm": 0.3815966978457093,
      "learning_rate": 4.63692407252247e-05,
      "loss": 1.5858,
      "num_input_tokens_seen": 15523677616,
      "step": 19731
    },
    {
      "epoch": 2.0933587948228305,
      "grad_norm": 0.3497565535220995,
      "learning_rate": 4.636888002287344e-05,
      "loss": 1.5827,
      "num_input_tokens_seen": 15524464416,
      "step": 19732
    },
    {
      "epoch": 2.093464884362402,
      "grad_norm": 0.3625887964573412,
      "learning_rate": 4.636851930400894e-05,
      "loss": 1.648,
      "num_input_tokens_seen": 15525251120,
      "step": 19733
    },
    {
      "epoch": 2.0935709739019734,
      "grad_norm": 0.38942526681073747,
      "learning_rate": 4.636815856863147e-05,
      "loss": 1.5861,
      "num_input_tokens_seen": 15526037952,
      "step": 19734
    },
    {
      "epoch": 2.0936770634415445,
      "grad_norm": 0.35987727564054317,
      "learning_rate": 4.636779781674131e-05,
      "loss": 1.6086,
      "num_input_tokens_seen": 15526824768,
      "step": 19735
    },
    {
      "epoch": 2.093783152981116,
      "grad_norm": 0.3340735403111606,
      "learning_rate": 4.636743704833875e-05,
      "loss": 1.5104,
      "num_input_tokens_seen": 15527611504,
      "step": 19736
    },
    {
      "epoch": 2.0938892425206874,
      "grad_norm": 0.37071570321512837,
      "learning_rate": 4.636707626342406e-05,
      "loss": 1.623,
      "num_input_tokens_seen": 15528398256,
      "step": 19737
    },
    {
      "epoch": 2.093995332060259,
      "grad_norm": 0.3440286218294065,
      "learning_rate": 4.636671546199752e-05,
      "loss": 1.5711,
      "num_input_tokens_seen": 15529185072,
      "step": 19738
    },
    {
      "epoch": 2.0941014215998304,
      "grad_norm": 0.34392985737227905,
      "learning_rate": 4.636635464405941e-05,
      "loss": 1.5501,
      "num_input_tokens_seen": 15529971888,
      "step": 19739
    },
    {
      "epoch": 2.094207511139402,
      "grad_norm": 0.37867322682679216,
      "learning_rate": 4.6365993809610005e-05,
      "loss": 1.5925,
      "num_input_tokens_seen": 15530758592,
      "step": 19740
    },
    {
      "epoch": 2.094313600678973,
      "grad_norm": 0.43829766947947774,
      "learning_rate": 4.6365632958649585e-05,
      "loss": 1.5796,
      "num_input_tokens_seen": 15531545440,
      "step": 19741
    },
    {
      "epoch": 2.0944196902185443,
      "grad_norm": 0.3967447106224283,
      "learning_rate": 4.636527209117843e-05,
      "loss": 1.5964,
      "num_input_tokens_seen": 15532332320,
      "step": 19742
    },
    {
      "epoch": 2.094525779758116,
      "grad_norm": 0.4201298925082701,
      "learning_rate": 4.6364911207196826e-05,
      "loss": 1.5756,
      "num_input_tokens_seen": 15533119072,
      "step": 19743
    },
    {
      "epoch": 2.0946318692976873,
      "grad_norm": 0.45851881731217076,
      "learning_rate": 4.636455030670504e-05,
      "loss": 1.5598,
      "num_input_tokens_seen": 15533905936,
      "step": 19744
    },
    {
      "epoch": 2.0947379588372588,
      "grad_norm": 0.3456311421569894,
      "learning_rate": 4.6364189389703375e-05,
      "loss": 1.5747,
      "num_input_tokens_seen": 15534692720,
      "step": 19745
    },
    {
      "epoch": 2.0948440483768302,
      "grad_norm": 0.45925402291912226,
      "learning_rate": 4.636382845619207e-05,
      "loss": 1.5886,
      "num_input_tokens_seen": 15535479568,
      "step": 19746
    },
    {
      "epoch": 2.0949501379164013,
      "grad_norm": 0.3285632274135919,
      "learning_rate": 4.636346750617143e-05,
      "loss": 1.6086,
      "num_input_tokens_seen": 15536266320,
      "step": 19747
    },
    {
      "epoch": 2.0950562274559728,
      "grad_norm": 0.38358710980970057,
      "learning_rate": 4.636310653964173e-05,
      "loss": 1.5832,
      "num_input_tokens_seen": 15537053136,
      "step": 19748
    },
    {
      "epoch": 2.0951623169955442,
      "grad_norm": 0.3601620607500626,
      "learning_rate": 4.636274555660325e-05,
      "loss": 1.6652,
      "num_input_tokens_seen": 15537839936,
      "step": 19749
    },
    {
      "epoch": 2.0952684065351157,
      "grad_norm": 0.3932487188540416,
      "learning_rate": 4.6362384557056264e-05,
      "loss": 1.7316,
      "num_input_tokens_seen": 15538626656,
      "step": 19750
    },
    {
      "epoch": 2.095374496074687,
      "grad_norm": 0.40017043074158204,
      "learning_rate": 4.636202354100106e-05,
      "loss": 1.5457,
      "num_input_tokens_seen": 15539413456,
      "step": 19751
    },
    {
      "epoch": 2.0954805856142587,
      "grad_norm": 0.3987167826839101,
      "learning_rate": 4.6361662508437906e-05,
      "loss": 1.5908,
      "num_input_tokens_seen": 15540200176,
      "step": 19752
    },
    {
      "epoch": 2.0955866751538297,
      "grad_norm": 0.42547108466982764,
      "learning_rate": 4.6361301459367084e-05,
      "loss": 1.4924,
      "num_input_tokens_seen": 15540987056,
      "step": 19753
    },
    {
      "epoch": 2.095692764693401,
      "grad_norm": 0.3549532752822387,
      "learning_rate": 4.636094039378888e-05,
      "loss": 1.6319,
      "num_input_tokens_seen": 15541773776,
      "step": 19754
    },
    {
      "epoch": 2.0957988542329726,
      "grad_norm": 0.4436137291772978,
      "learning_rate": 4.6360579311703565e-05,
      "loss": 1.5816,
      "num_input_tokens_seen": 15542560592,
      "step": 19755
    },
    {
      "epoch": 2.095904943772544,
      "grad_norm": 0.35892765033570123,
      "learning_rate": 4.636021821311142e-05,
      "loss": 1.6099,
      "num_input_tokens_seen": 15543347424,
      "step": 19756
    },
    {
      "epoch": 2.0960110333121156,
      "grad_norm": 0.39617847845720666,
      "learning_rate": 4.635985709801273e-05,
      "loss": 1.4971,
      "num_input_tokens_seen": 15544134128,
      "step": 19757
    },
    {
      "epoch": 2.0961171228516866,
      "grad_norm": 0.39220808080152353,
      "learning_rate": 4.635949596640776e-05,
      "loss": 1.6398,
      "num_input_tokens_seen": 15544920816,
      "step": 19758
    },
    {
      "epoch": 2.096223212391258,
      "grad_norm": 0.4496674675040761,
      "learning_rate": 4.6359134818296813e-05,
      "loss": 1.6432,
      "num_input_tokens_seen": 15545707616,
      "step": 19759
    },
    {
      "epoch": 2.0963293019308296,
      "grad_norm": 0.417990566946576,
      "learning_rate": 4.635877365368014e-05,
      "loss": 1.6471,
      "num_input_tokens_seen": 15546494384,
      "step": 19760
    },
    {
      "epoch": 2.096435391470401,
      "grad_norm": 0.420522106295053,
      "learning_rate": 4.635841247255804e-05,
      "loss": 1.6164,
      "num_input_tokens_seen": 15547281136,
      "step": 19761
    },
    {
      "epoch": 2.0965414810099725,
      "grad_norm": 0.4380159243777034,
      "learning_rate": 4.635805127493078e-05,
      "loss": 1.5778,
      "num_input_tokens_seen": 15548067872,
      "step": 19762
    },
    {
      "epoch": 2.096647570549544,
      "grad_norm": 0.3879833249232965,
      "learning_rate": 4.6357690060798654e-05,
      "loss": 1.6671,
      "num_input_tokens_seen": 15548854672,
      "step": 19763
    },
    {
      "epoch": 2.096753660089115,
      "grad_norm": 0.46320850099605454,
      "learning_rate": 4.635732883016193e-05,
      "loss": 1.5936,
      "num_input_tokens_seen": 15549641392,
      "step": 19764
    },
    {
      "epoch": 2.0968597496286865,
      "grad_norm": 0.39890824136779046,
      "learning_rate": 4.635696758302088e-05,
      "loss": 1.7319,
      "num_input_tokens_seen": 15550428016,
      "step": 19765
    },
    {
      "epoch": 2.096965839168258,
      "grad_norm": 0.45351568795403,
      "learning_rate": 4.63566063193758e-05,
      "loss": 1.6767,
      "num_input_tokens_seen": 15551214784,
      "step": 19766
    },
    {
      "epoch": 2.0970719287078294,
      "grad_norm": 0.38380527811086596,
      "learning_rate": 4.6356245039226955e-05,
      "loss": 1.6797,
      "num_input_tokens_seen": 15552001568,
      "step": 19767
    },
    {
      "epoch": 2.097178018247401,
      "grad_norm": 0.42153971215829594,
      "learning_rate": 4.6355883742574636e-05,
      "loss": 1.6327,
      "num_input_tokens_seen": 15552788176,
      "step": 19768
    },
    {
      "epoch": 2.0972841077869724,
      "grad_norm": 0.39505377029531924,
      "learning_rate": 4.6355522429419115e-05,
      "loss": 1.5984,
      "num_input_tokens_seen": 15553574944,
      "step": 19769
    },
    {
      "epoch": 2.0973901973265434,
      "grad_norm": 0.36650736367508574,
      "learning_rate": 4.635516109976067e-05,
      "loss": 1.5587,
      "num_input_tokens_seen": 15554361648,
      "step": 19770
    },
    {
      "epoch": 2.097496286866115,
      "grad_norm": 0.5396207063621744,
      "learning_rate": 4.6354799753599585e-05,
      "loss": 1.5481,
      "num_input_tokens_seen": 15555148512,
      "step": 19771
    },
    {
      "epoch": 2.0976023764056864,
      "grad_norm": 0.362728873122752,
      "learning_rate": 4.635443839093614e-05,
      "loss": 1.615,
      "num_input_tokens_seen": 15555935296,
      "step": 19772
    },
    {
      "epoch": 2.097708465945258,
      "grad_norm": 0.5167743260914786,
      "learning_rate": 4.635407701177061e-05,
      "loss": 1.5342,
      "num_input_tokens_seen": 15556722000,
      "step": 19773
    },
    {
      "epoch": 2.0978145554848293,
      "grad_norm": 0.38745849029568596,
      "learning_rate": 4.6353715616103276e-05,
      "loss": 1.5857,
      "num_input_tokens_seen": 15557508816,
      "step": 19774
    },
    {
      "epoch": 2.097920645024401,
      "grad_norm": 0.5088379635517314,
      "learning_rate": 4.635335420393442e-05,
      "loss": 1.7649,
      "num_input_tokens_seen": 15558295456,
      "step": 19775
    },
    {
      "epoch": 2.098026734563972,
      "grad_norm": 0.386021166897518,
      "learning_rate": 4.6352992775264306e-05,
      "loss": 1.6871,
      "num_input_tokens_seen": 15559082128,
      "step": 19776
    },
    {
      "epoch": 2.0981328241035433,
      "grad_norm": 0.6353681506854676,
      "learning_rate": 4.635263133009324e-05,
      "loss": 1.6199,
      "num_input_tokens_seen": 15559868880,
      "step": 19777
    },
    {
      "epoch": 2.0982389136431148,
      "grad_norm": 0.49182721724994993,
      "learning_rate": 4.635226986842148e-05,
      "loss": 1.5398,
      "num_input_tokens_seen": 15560655632,
      "step": 19778
    },
    {
      "epoch": 2.0983450031826862,
      "grad_norm": 0.4114725903002762,
      "learning_rate": 4.635190839024931e-05,
      "loss": 1.5065,
      "num_input_tokens_seen": 15561442416,
      "step": 19779
    },
    {
      "epoch": 2.0984510927222577,
      "grad_norm": 0.3824454473925261,
      "learning_rate": 4.635154689557702e-05,
      "loss": 1.562,
      "num_input_tokens_seen": 15562229088,
      "step": 19780
    },
    {
      "epoch": 2.098557182261829,
      "grad_norm": 0.464515165981556,
      "learning_rate": 4.635118538440487e-05,
      "loss": 1.6174,
      "num_input_tokens_seen": 15563015840,
      "step": 19781
    },
    {
      "epoch": 2.0986632718014,
      "grad_norm": 0.463769096003698,
      "learning_rate": 4.635082385673316e-05,
      "loss": 1.5431,
      "num_input_tokens_seen": 15563802672,
      "step": 19782
    },
    {
      "epoch": 2.0987693613409717,
      "grad_norm": 0.37070287764177506,
      "learning_rate": 4.6350462312562156e-05,
      "loss": 1.5773,
      "num_input_tokens_seen": 15564589312,
      "step": 19783
    },
    {
      "epoch": 2.098875450880543,
      "grad_norm": 0.6514100854170798,
      "learning_rate": 4.635010075189214e-05,
      "loss": 1.6283,
      "num_input_tokens_seen": 15565376048,
      "step": 19784
    },
    {
      "epoch": 2.0989815404201146,
      "grad_norm": 0.4420628339901099,
      "learning_rate": 4.63497391747234e-05,
      "loss": 1.6687,
      "num_input_tokens_seen": 15566162832,
      "step": 19785
    },
    {
      "epoch": 2.099087629959686,
      "grad_norm": 0.5417626193129105,
      "learning_rate": 4.6349377581056204e-05,
      "loss": 1.5944,
      "num_input_tokens_seen": 15566949552,
      "step": 19786
    },
    {
      "epoch": 2.099193719499257,
      "grad_norm": 0.45385235584766304,
      "learning_rate": 4.6349015970890835e-05,
      "loss": 1.6411,
      "num_input_tokens_seen": 15567736256,
      "step": 19787
    },
    {
      "epoch": 2.0992998090388286,
      "grad_norm": 0.619834335522694,
      "learning_rate": 4.634865434422757e-05,
      "loss": 1.4993,
      "num_input_tokens_seen": 15568523008,
      "step": 19788
    },
    {
      "epoch": 2.0994058985784,
      "grad_norm": 0.5187293448933089,
      "learning_rate": 4.6348292701066696e-05,
      "loss": 1.7318,
      "num_input_tokens_seen": 15569309664,
      "step": 19789
    },
    {
      "epoch": 2.0995119881179716,
      "grad_norm": 0.5048281136599884,
      "learning_rate": 4.634793104140849e-05,
      "loss": 1.6547,
      "num_input_tokens_seen": 15570096448,
      "step": 19790
    },
    {
      "epoch": 2.099618077657543,
      "grad_norm": 0.4722993694298482,
      "learning_rate": 4.6347569365253216e-05,
      "loss": 1.7377,
      "num_input_tokens_seen": 15570883136,
      "step": 19791
    },
    {
      "epoch": 2.0997241671971145,
      "grad_norm": 0.5116538966865245,
      "learning_rate": 4.634720767260118e-05,
      "loss": 1.6623,
      "num_input_tokens_seen": 15571669952,
      "step": 19792
    },
    {
      "epoch": 2.0998302567366856,
      "grad_norm": 0.3776607098662515,
      "learning_rate": 4.6346845963452636e-05,
      "loss": 1.6751,
      "num_input_tokens_seen": 15572456672,
      "step": 19793
    },
    {
      "epoch": 2.099936346276257,
      "grad_norm": 0.44161290390783847,
      "learning_rate": 4.6346484237807885e-05,
      "loss": 1.6003,
      "num_input_tokens_seen": 15573243440,
      "step": 19794
    },
    {
      "epoch": 2.1000424358158285,
      "grad_norm": 0.4007014801771664,
      "learning_rate": 4.63461224956672e-05,
      "loss": 1.5705,
      "num_input_tokens_seen": 15574030192,
      "step": 19795
    },
    {
      "epoch": 2.1001485253554,
      "grad_norm": 0.44965902648959927,
      "learning_rate": 4.6345760737030855e-05,
      "loss": 1.5691,
      "num_input_tokens_seen": 15574817008,
      "step": 19796
    },
    {
      "epoch": 2.1002546148949714,
      "grad_norm": 0.40557254898054024,
      "learning_rate": 4.6345398961899126e-05,
      "loss": 1.4859,
      "num_input_tokens_seen": 15575603776,
      "step": 19797
    },
    {
      "epoch": 2.100360704434543,
      "grad_norm": 0.38449737191202943,
      "learning_rate": 4.634503717027231e-05,
      "loss": 1.5855,
      "num_input_tokens_seen": 15576390544,
      "step": 19798
    },
    {
      "epoch": 2.100466793974114,
      "grad_norm": 0.49727875348307726,
      "learning_rate": 4.6344675362150666e-05,
      "loss": 1.5506,
      "num_input_tokens_seen": 15577177328,
      "step": 19799
    },
    {
      "epoch": 2.1005728835136854,
      "grad_norm": 0.34001632346852956,
      "learning_rate": 4.634431353753449e-05,
      "loss": 1.4927,
      "num_input_tokens_seen": 15577964112,
      "step": 19800
    },
    {
      "epoch": 2.100678973053257,
      "grad_norm": 0.38616335002068236,
      "learning_rate": 4.6343951696424046e-05,
      "loss": 1.5903,
      "num_input_tokens_seen": 15578750896,
      "step": 19801
    },
    {
      "epoch": 2.1007850625928284,
      "grad_norm": 0.45161282636020716,
      "learning_rate": 4.634358983881963e-05,
      "loss": 1.7137,
      "num_input_tokens_seen": 15579537552,
      "step": 19802
    },
    {
      "epoch": 2.1008911521324,
      "grad_norm": 0.44594822251994576,
      "learning_rate": 4.6343227964721515e-05,
      "loss": 1.5376,
      "num_input_tokens_seen": 15580324352,
      "step": 19803
    },
    {
      "epoch": 2.1009972416719713,
      "grad_norm": 0.3677547712763793,
      "learning_rate": 4.634286607412998e-05,
      "loss": 1.5185,
      "num_input_tokens_seen": 15581111152,
      "step": 19804
    },
    {
      "epoch": 2.1011033312115424,
      "grad_norm": 0.45046925679615246,
      "learning_rate": 4.6342504167045295e-05,
      "loss": 1.4706,
      "num_input_tokens_seen": 15581897936,
      "step": 19805
    },
    {
      "epoch": 2.101209420751114,
      "grad_norm": 0.4759677660070373,
      "learning_rate": 4.6342142243467755e-05,
      "loss": 1.6536,
      "num_input_tokens_seen": 15582684752,
      "step": 19806
    },
    {
      "epoch": 2.1013155102906853,
      "grad_norm": 0.43204559872519843,
      "learning_rate": 4.634178030339763e-05,
      "loss": 1.7111,
      "num_input_tokens_seen": 15583471456,
      "step": 19807
    },
    {
      "epoch": 2.101421599830257,
      "grad_norm": 0.4222288254948575,
      "learning_rate": 4.634141834683521e-05,
      "loss": 1.5675,
      "num_input_tokens_seen": 15584258272,
      "step": 19808
    },
    {
      "epoch": 2.1015276893698283,
      "grad_norm": 0.44920775307374855,
      "learning_rate": 4.634105637378077e-05,
      "loss": 1.5614,
      "num_input_tokens_seen": 15585045040,
      "step": 19809
    },
    {
      "epoch": 2.1016337789093997,
      "grad_norm": 0.3336011310766948,
      "learning_rate": 4.634069438423458e-05,
      "loss": 1.6395,
      "num_input_tokens_seen": 15585831824,
      "step": 19810
    },
    {
      "epoch": 2.1017398684489708,
      "grad_norm": 0.5449800937775,
      "learning_rate": 4.6340332378196926e-05,
      "loss": 1.6505,
      "num_input_tokens_seen": 15586618608,
      "step": 19811
    },
    {
      "epoch": 2.1018459579885422,
      "grad_norm": 0.36197891253580866,
      "learning_rate": 4.6339970355668096e-05,
      "loss": 1.5496,
      "num_input_tokens_seen": 15587405504,
      "step": 19812
    },
    {
      "epoch": 2.1019520475281137,
      "grad_norm": 0.5727007884997622,
      "learning_rate": 4.633960831664836e-05,
      "loss": 1.5925,
      "num_input_tokens_seen": 15588192256,
      "step": 19813
    },
    {
      "epoch": 2.102058137067685,
      "grad_norm": 0.4027853568196222,
      "learning_rate": 4.6339246261138005e-05,
      "loss": 1.6864,
      "num_input_tokens_seen": 15588978960,
      "step": 19814
    },
    {
      "epoch": 2.1021642266072567,
      "grad_norm": 0.40151676759268745,
      "learning_rate": 4.63388841891373e-05,
      "loss": 1.6695,
      "num_input_tokens_seen": 15589765728,
      "step": 19815
    },
    {
      "epoch": 2.102270316146828,
      "grad_norm": 0.3322916279169891,
      "learning_rate": 4.633852210064654e-05,
      "loss": 1.4954,
      "num_input_tokens_seen": 15590552512,
      "step": 19816
    },
    {
      "epoch": 2.102376405686399,
      "grad_norm": 0.4068492742984818,
      "learning_rate": 4.633815999566598e-05,
      "loss": 1.566,
      "num_input_tokens_seen": 15591339248,
      "step": 19817
    },
    {
      "epoch": 2.1024824952259706,
      "grad_norm": 0.35957723772693034,
      "learning_rate": 4.633779787419593e-05,
      "loss": 1.4613,
      "num_input_tokens_seen": 15592125968,
      "step": 19818
    },
    {
      "epoch": 2.102588584765542,
      "grad_norm": 0.39370676164586116,
      "learning_rate": 4.633743573623666e-05,
      "loss": 1.6632,
      "num_input_tokens_seen": 15592912752,
      "step": 19819
    },
    {
      "epoch": 2.1026946743051136,
      "grad_norm": 0.6680013415224532,
      "learning_rate": 4.6337073581788436e-05,
      "loss": 1.6987,
      "num_input_tokens_seen": 15593699520,
      "step": 19820
    },
    {
      "epoch": 2.102800763844685,
      "grad_norm": 0.5020835312496017,
      "learning_rate": 4.633671141085155e-05,
      "loss": 1.4657,
      "num_input_tokens_seen": 15594486352,
      "step": 19821
    },
    {
      "epoch": 2.1029068533842565,
      "grad_norm": 0.4964095021049824,
      "learning_rate": 4.633634922342628e-05,
      "loss": 1.6466,
      "num_input_tokens_seen": 15595273088,
      "step": 19822
    },
    {
      "epoch": 2.1030129429238276,
      "grad_norm": 0.5663056681661242,
      "learning_rate": 4.6335987019512904e-05,
      "loss": 1.6822,
      "num_input_tokens_seen": 15596059920,
      "step": 19823
    },
    {
      "epoch": 2.103119032463399,
      "grad_norm": 0.4511397244437283,
      "learning_rate": 4.63356247991117e-05,
      "loss": 1.6929,
      "num_input_tokens_seen": 15596846704,
      "step": 19824
    },
    {
      "epoch": 2.1032251220029705,
      "grad_norm": 0.4190808100577292,
      "learning_rate": 4.6335262562222956e-05,
      "loss": 1.5798,
      "num_input_tokens_seen": 15597633424,
      "step": 19825
    },
    {
      "epoch": 2.103331211542542,
      "grad_norm": 0.4319117995712659,
      "learning_rate": 4.633490030884695e-05,
      "loss": 1.572,
      "num_input_tokens_seen": 15598420256,
      "step": 19826
    },
    {
      "epoch": 2.1034373010821135,
      "grad_norm": 0.502806769365964,
      "learning_rate": 4.633453803898395e-05,
      "loss": 1.6225,
      "num_input_tokens_seen": 15599207024,
      "step": 19827
    },
    {
      "epoch": 2.1035433906216845,
      "grad_norm": 0.38263757651588726,
      "learning_rate": 4.6334175752634255e-05,
      "loss": 1.604,
      "num_input_tokens_seen": 15599993792,
      "step": 19828
    },
    {
      "epoch": 2.103649480161256,
      "grad_norm": 0.47321065602842455,
      "learning_rate": 4.633381344979813e-05,
      "loss": 1.6233,
      "num_input_tokens_seen": 15600780512,
      "step": 19829
    },
    {
      "epoch": 2.1037555697008274,
      "grad_norm": 0.3608717719164369,
      "learning_rate": 4.633345113047586e-05,
      "loss": 1.6517,
      "num_input_tokens_seen": 15601567328,
      "step": 19830
    },
    {
      "epoch": 2.103861659240399,
      "grad_norm": 0.5377156490696848,
      "learning_rate": 4.633308879466773e-05,
      "loss": 1.5465,
      "num_input_tokens_seen": 15602354160,
      "step": 19831
    },
    {
      "epoch": 2.1039677487799704,
      "grad_norm": 0.3761690213149366,
      "learning_rate": 4.633272644237401e-05,
      "loss": 1.6998,
      "num_input_tokens_seen": 15603140896,
      "step": 19832
    },
    {
      "epoch": 2.104073838319542,
      "grad_norm": 0.4513770549635197,
      "learning_rate": 4.633236407359498e-05,
      "loss": 1.7181,
      "num_input_tokens_seen": 15603927600,
      "step": 19833
    },
    {
      "epoch": 2.104179927859113,
      "grad_norm": 0.4460951348821317,
      "learning_rate": 4.6332001688330936e-05,
      "loss": 1.6393,
      "num_input_tokens_seen": 15604714416,
      "step": 19834
    },
    {
      "epoch": 2.1042860173986844,
      "grad_norm": 0.40650885225052313,
      "learning_rate": 4.633163928658214e-05,
      "loss": 1.7027,
      "num_input_tokens_seen": 15605501168,
      "step": 19835
    },
    {
      "epoch": 2.104392106938256,
      "grad_norm": 0.38087554677968083,
      "learning_rate": 4.6331276868348886e-05,
      "loss": 1.5097,
      "num_input_tokens_seen": 15606288016,
      "step": 19836
    },
    {
      "epoch": 2.1044981964778273,
      "grad_norm": 0.38329190352838705,
      "learning_rate": 4.6330914433631435e-05,
      "loss": 1.8114,
      "num_input_tokens_seen": 15607074736,
      "step": 19837
    },
    {
      "epoch": 2.104604286017399,
      "grad_norm": 0.43800924594509066,
      "learning_rate": 4.6330551982430086e-05,
      "loss": 1.5643,
      "num_input_tokens_seen": 15607861488,
      "step": 19838
    },
    {
      "epoch": 2.1047103755569703,
      "grad_norm": 0.483797896098874,
      "learning_rate": 4.6330189514745116e-05,
      "loss": 1.5829,
      "num_input_tokens_seen": 15608648304,
      "step": 19839
    },
    {
      "epoch": 2.1048164650965413,
      "grad_norm": 0.4118869190249156,
      "learning_rate": 4.63298270305768e-05,
      "loss": 1.6,
      "num_input_tokens_seen": 15609435072,
      "step": 19840
    },
    {
      "epoch": 2.1049225546361128,
      "grad_norm": 0.4289068405362925,
      "learning_rate": 4.6329464529925414e-05,
      "loss": 1.626,
      "num_input_tokens_seen": 15610221824,
      "step": 19841
    },
    {
      "epoch": 2.1050286441756842,
      "grad_norm": 0.38892480473823965,
      "learning_rate": 4.632910201279124e-05,
      "loss": 1.5816,
      "num_input_tokens_seen": 15611008528,
      "step": 19842
    },
    {
      "epoch": 2.1051347337152557,
      "grad_norm": 0.4681508786961326,
      "learning_rate": 4.632873947917457e-05,
      "loss": 1.6345,
      "num_input_tokens_seen": 15611795264,
      "step": 19843
    },
    {
      "epoch": 2.105240823254827,
      "grad_norm": 0.3915341539095316,
      "learning_rate": 4.632837692907568e-05,
      "loss": 1.6244,
      "num_input_tokens_seen": 15612582032,
      "step": 19844
    },
    {
      "epoch": 2.1053469127943987,
      "grad_norm": 0.37457736847914275,
      "learning_rate": 4.632801436249484e-05,
      "loss": 1.6152,
      "num_input_tokens_seen": 15613368768,
      "step": 19845
    },
    {
      "epoch": 2.1054530023339697,
      "grad_norm": 0.5123182591186882,
      "learning_rate": 4.632765177943234e-05,
      "loss": 1.6136,
      "num_input_tokens_seen": 15614155600,
      "step": 19846
    },
    {
      "epoch": 2.105559091873541,
      "grad_norm": 0.45200521193149745,
      "learning_rate": 4.632728917988844e-05,
      "loss": 1.6817,
      "num_input_tokens_seen": 15614942368,
      "step": 19847
    },
    {
      "epoch": 2.1056651814131127,
      "grad_norm": 0.3923563838684892,
      "learning_rate": 4.632692656386346e-05,
      "loss": 1.5793,
      "num_input_tokens_seen": 15615729184,
      "step": 19848
    },
    {
      "epoch": 2.105771270952684,
      "grad_norm": 0.38540568229784855,
      "learning_rate": 4.632656393135765e-05,
      "loss": 1.6153,
      "num_input_tokens_seen": 15616515968,
      "step": 19849
    },
    {
      "epoch": 2.1058773604922556,
      "grad_norm": 0.4359041325491514,
      "learning_rate": 4.632620128237129e-05,
      "loss": 1.7065,
      "num_input_tokens_seen": 15617302688,
      "step": 19850
    },
    {
      "epoch": 2.105983450031827,
      "grad_norm": 0.37273548402228845,
      "learning_rate": 4.632583861690467e-05,
      "loss": 1.6674,
      "num_input_tokens_seen": 15618089376,
      "step": 19851
    },
    {
      "epoch": 2.106089539571398,
      "grad_norm": 0.3418224060664085,
      "learning_rate": 4.632547593495807e-05,
      "loss": 1.6776,
      "num_input_tokens_seen": 15618876176,
      "step": 19852
    },
    {
      "epoch": 2.1061956291109696,
      "grad_norm": 0.4033213758013509,
      "learning_rate": 4.632511323653177e-05,
      "loss": 1.4613,
      "num_input_tokens_seen": 15619663056,
      "step": 19853
    },
    {
      "epoch": 2.106301718650541,
      "grad_norm": 0.37150873782916344,
      "learning_rate": 4.6324750521626034e-05,
      "loss": 1.5784,
      "num_input_tokens_seen": 15620449760,
      "step": 19854
    },
    {
      "epoch": 2.1064078081901125,
      "grad_norm": 0.42683324242225945,
      "learning_rate": 4.6324387790241175e-05,
      "loss": 1.6257,
      "num_input_tokens_seen": 15621236512,
      "step": 19855
    },
    {
      "epoch": 2.106513897729684,
      "grad_norm": 0.42103738827168635,
      "learning_rate": 4.632402504237745e-05,
      "loss": 1.6551,
      "num_input_tokens_seen": 15622023248,
      "step": 19856
    },
    {
      "epoch": 2.106619987269255,
      "grad_norm": 0.42615661709873753,
      "learning_rate": 4.632366227803514e-05,
      "loss": 1.605,
      "num_input_tokens_seen": 15622810000,
      "step": 19857
    },
    {
      "epoch": 2.1067260768088265,
      "grad_norm": 0.3750385262410512,
      "learning_rate": 4.6323299497214535e-05,
      "loss": 1.5937,
      "num_input_tokens_seen": 15623596832,
      "step": 19858
    },
    {
      "epoch": 2.106832166348398,
      "grad_norm": 0.3711768495156904,
      "learning_rate": 4.6322936699915896e-05,
      "loss": 1.4218,
      "num_input_tokens_seen": 15624383616,
      "step": 19859
    },
    {
      "epoch": 2.1069382558879695,
      "grad_norm": 0.39718616953334956,
      "learning_rate": 4.632257388613953e-05,
      "loss": 1.6455,
      "num_input_tokens_seen": 15625170320,
      "step": 19860
    },
    {
      "epoch": 2.107044345427541,
      "grad_norm": 0.43253590345402937,
      "learning_rate": 4.63222110558857e-05,
      "loss": 1.6117,
      "num_input_tokens_seen": 15625957072,
      "step": 19861
    },
    {
      "epoch": 2.1071504349671124,
      "grad_norm": 0.5368400436746269,
      "learning_rate": 4.6321848209154694e-05,
      "loss": 1.6619,
      "num_input_tokens_seen": 15626743776,
      "step": 19862
    },
    {
      "epoch": 2.1072565245066834,
      "grad_norm": 0.635876279722078,
      "learning_rate": 4.632148534594679e-05,
      "loss": 1.6263,
      "num_input_tokens_seen": 15627530672,
      "step": 19863
    },
    {
      "epoch": 2.107362614046255,
      "grad_norm": 0.41140743365635724,
      "learning_rate": 4.632112246626227e-05,
      "loss": 1.574,
      "num_input_tokens_seen": 15628317408,
      "step": 19864
    },
    {
      "epoch": 2.1074687035858264,
      "grad_norm": 0.5351660314235525,
      "learning_rate": 4.63207595701014e-05,
      "loss": 1.6419,
      "num_input_tokens_seen": 15629104160,
      "step": 19865
    },
    {
      "epoch": 2.107574793125398,
      "grad_norm": 0.4619422620430063,
      "learning_rate": 4.632039665746448e-05,
      "loss": 1.7095,
      "num_input_tokens_seen": 15629890944,
      "step": 19866
    },
    {
      "epoch": 2.1076808826649693,
      "grad_norm": 0.47935761818249806,
      "learning_rate": 4.632003372835179e-05,
      "loss": 1.6715,
      "num_input_tokens_seen": 15630677712,
      "step": 19867
    },
    {
      "epoch": 2.107786972204541,
      "grad_norm": 0.4079591594496227,
      "learning_rate": 4.63196707827636e-05,
      "loss": 1.621,
      "num_input_tokens_seen": 15631464448,
      "step": 19868
    },
    {
      "epoch": 2.107893061744112,
      "grad_norm": 0.5038279503867235,
      "learning_rate": 4.6319307820700185e-05,
      "loss": 1.6548,
      "num_input_tokens_seen": 15632251248,
      "step": 19869
    },
    {
      "epoch": 2.1079991512836833,
      "grad_norm": 0.49348087476517444,
      "learning_rate": 4.6318944842161845e-05,
      "loss": 1.5884,
      "num_input_tokens_seen": 15633037936,
      "step": 19870
    },
    {
      "epoch": 2.108105240823255,
      "grad_norm": 0.5711161351295484,
      "learning_rate": 4.6318581847148844e-05,
      "loss": 1.715,
      "num_input_tokens_seen": 15633824752,
      "step": 19871
    },
    {
      "epoch": 2.1082113303628263,
      "grad_norm": 0.4036402838041994,
      "learning_rate": 4.6318218835661465e-05,
      "loss": 1.6826,
      "num_input_tokens_seen": 15634611472,
      "step": 19872
    },
    {
      "epoch": 2.1083174199023977,
      "grad_norm": 0.5318123959346753,
      "learning_rate": 4.63178558077e-05,
      "loss": 1.7448,
      "num_input_tokens_seen": 15635398160,
      "step": 19873
    },
    {
      "epoch": 2.108423509441969,
      "grad_norm": 0.4168409976618742,
      "learning_rate": 4.631749276326472e-05,
      "loss": 1.6041,
      "num_input_tokens_seen": 15636184944,
      "step": 19874
    },
    {
      "epoch": 2.1085295989815402,
      "grad_norm": 0.5228449856842511,
      "learning_rate": 4.63171297023559e-05,
      "loss": 1.6629,
      "num_input_tokens_seen": 15636971680,
      "step": 19875
    },
    {
      "epoch": 2.1086356885211117,
      "grad_norm": 0.4679269121293392,
      "learning_rate": 4.631676662497384e-05,
      "loss": 1.6226,
      "num_input_tokens_seen": 15637758400,
      "step": 19876
    },
    {
      "epoch": 2.108741778060683,
      "grad_norm": 0.46324364242527394,
      "learning_rate": 4.63164035311188e-05,
      "loss": 1.6757,
      "num_input_tokens_seen": 15638545152,
      "step": 19877
    },
    {
      "epoch": 2.1088478676002547,
      "grad_norm": 0.4831038840309745,
      "learning_rate": 4.6316040420791065e-05,
      "loss": 1.6266,
      "num_input_tokens_seen": 15639331968,
      "step": 19878
    },
    {
      "epoch": 2.108953957139826,
      "grad_norm": 0.4324673959677754,
      "learning_rate": 4.631567729399093e-05,
      "loss": 1.7193,
      "num_input_tokens_seen": 15640118608,
      "step": 19879
    },
    {
      "epoch": 2.1090600466793976,
      "grad_norm": 0.41492069923396563,
      "learning_rate": 4.6315314150718656e-05,
      "loss": 1.7011,
      "num_input_tokens_seen": 15640905328,
      "step": 19880
    },
    {
      "epoch": 2.1091661362189686,
      "grad_norm": 0.45949441973998684,
      "learning_rate": 4.631495099097454e-05,
      "loss": 1.6557,
      "num_input_tokens_seen": 15641692112,
      "step": 19881
    },
    {
      "epoch": 2.10927222575854,
      "grad_norm": 0.45377302754539117,
      "learning_rate": 4.631458781475885e-05,
      "loss": 1.6982,
      "num_input_tokens_seen": 15642478960,
      "step": 19882
    },
    {
      "epoch": 2.1093783152981116,
      "grad_norm": 0.3643986956388272,
      "learning_rate": 4.631422462207187e-05,
      "loss": 1.542,
      "num_input_tokens_seen": 15643265824,
      "step": 19883
    },
    {
      "epoch": 2.109484404837683,
      "grad_norm": 0.4585380111875985,
      "learning_rate": 4.631386141291389e-05,
      "loss": 1.6834,
      "num_input_tokens_seen": 15644052560,
      "step": 19884
    },
    {
      "epoch": 2.1095904943772545,
      "grad_norm": 0.44528008411115116,
      "learning_rate": 4.6313498187285176e-05,
      "loss": 1.6539,
      "num_input_tokens_seen": 15644839312,
      "step": 19885
    },
    {
      "epoch": 2.1096965839168256,
      "grad_norm": 0.4387096461803724,
      "learning_rate": 4.631313494518602e-05,
      "loss": 1.6657,
      "num_input_tokens_seen": 15645626160,
      "step": 19886
    },
    {
      "epoch": 2.109802673456397,
      "grad_norm": 0.36019523875878545,
      "learning_rate": 4.631277168661669e-05,
      "loss": 1.6264,
      "num_input_tokens_seen": 15646412896,
      "step": 19887
    },
    {
      "epoch": 2.1099087629959685,
      "grad_norm": 0.36342722654298876,
      "learning_rate": 4.631240841157749e-05,
      "loss": 1.5878,
      "num_input_tokens_seen": 15647199744,
      "step": 19888
    },
    {
      "epoch": 2.11001485253554,
      "grad_norm": 0.5164714521721738,
      "learning_rate": 4.631204512006868e-05,
      "loss": 1.7132,
      "num_input_tokens_seen": 15647986496,
      "step": 19889
    },
    {
      "epoch": 2.1101209420751115,
      "grad_norm": 0.31509066395985397,
      "learning_rate": 4.631168181209055e-05,
      "loss": 1.5183,
      "num_input_tokens_seen": 15648773312,
      "step": 19890
    },
    {
      "epoch": 2.110227031614683,
      "grad_norm": 0.4365481931492201,
      "learning_rate": 4.6311318487643374e-05,
      "loss": 1.6607,
      "num_input_tokens_seen": 15649560128,
      "step": 19891
    },
    {
      "epoch": 2.110333121154254,
      "grad_norm": 0.401560159031857,
      "learning_rate": 4.631095514672744e-05,
      "loss": 1.5938,
      "num_input_tokens_seen": 15650346848,
      "step": 19892
    },
    {
      "epoch": 2.1104392106938255,
      "grad_norm": 0.4011569077714348,
      "learning_rate": 4.6310591789343016e-05,
      "loss": 1.5234,
      "num_input_tokens_seen": 15651133616,
      "step": 19893
    },
    {
      "epoch": 2.110545300233397,
      "grad_norm": 0.3924447631392996,
      "learning_rate": 4.6310228415490395e-05,
      "loss": 1.614,
      "num_input_tokens_seen": 15651920368,
      "step": 19894
    },
    {
      "epoch": 2.1106513897729684,
      "grad_norm": 0.37875585296896663,
      "learning_rate": 4.630986502516986e-05,
      "loss": 1.5957,
      "num_input_tokens_seen": 15652707040,
      "step": 19895
    },
    {
      "epoch": 2.11075747931254,
      "grad_norm": 0.3650752052883477,
      "learning_rate": 4.6309501618381686e-05,
      "loss": 1.5312,
      "num_input_tokens_seen": 15653493824,
      "step": 19896
    },
    {
      "epoch": 2.1108635688521113,
      "grad_norm": 0.3508013101337239,
      "learning_rate": 4.630913819512615e-05,
      "loss": 1.6603,
      "num_input_tokens_seen": 15654280592,
      "step": 19897
    },
    {
      "epoch": 2.1109696583916824,
      "grad_norm": 0.39526630835577414,
      "learning_rate": 4.630877475540354e-05,
      "loss": 1.6818,
      "num_input_tokens_seen": 15655067296,
      "step": 19898
    },
    {
      "epoch": 2.111075747931254,
      "grad_norm": 0.3876886743953045,
      "learning_rate": 4.630841129921414e-05,
      "loss": 1.4765,
      "num_input_tokens_seen": 15655854064,
      "step": 19899
    },
    {
      "epoch": 2.1111818374708253,
      "grad_norm": 0.33946909533900244,
      "learning_rate": 4.630804782655821e-05,
      "loss": 1.575,
      "num_input_tokens_seen": 15656640752,
      "step": 19900
    },
    {
      "epoch": 2.111287927010397,
      "grad_norm": 0.4523845727231748,
      "learning_rate": 4.630768433743605e-05,
      "loss": 1.5632,
      "num_input_tokens_seen": 15657427536,
      "step": 19901
    },
    {
      "epoch": 2.1113940165499683,
      "grad_norm": 0.3790240847200819,
      "learning_rate": 4.630732083184794e-05,
      "loss": 1.6742,
      "num_input_tokens_seen": 15658214320,
      "step": 19902
    },
    {
      "epoch": 2.1115001060895398,
      "grad_norm": 0.5852405975892074,
      "learning_rate": 4.630695730979416e-05,
      "loss": 1.5565,
      "num_input_tokens_seen": 15659001088,
      "step": 19903
    },
    {
      "epoch": 2.111606195629111,
      "grad_norm": 0.35871901054044775,
      "learning_rate": 4.6306593771275e-05,
      "loss": 1.586,
      "num_input_tokens_seen": 15659787840,
      "step": 19904
    },
    {
      "epoch": 2.1117122851686823,
      "grad_norm": 0.7188156785552086,
      "learning_rate": 4.630623021629071e-05,
      "loss": 1.6025,
      "num_input_tokens_seen": 15660574608,
      "step": 19905
    },
    {
      "epoch": 2.1118183747082537,
      "grad_norm": 0.5279389466932507,
      "learning_rate": 4.63058666448416e-05,
      "loss": 1.6121,
      "num_input_tokens_seen": 15661361376,
      "step": 19906
    },
    {
      "epoch": 2.111924464247825,
      "grad_norm": 0.4731650071147937,
      "learning_rate": 4.630550305692793e-05,
      "loss": 1.4749,
      "num_input_tokens_seen": 15662148096,
      "step": 19907
    },
    {
      "epoch": 2.1120305537873967,
      "grad_norm": 0.45565144738937874,
      "learning_rate": 4.630513945255e-05,
      "loss": 1.4858,
      "num_input_tokens_seen": 15662934800,
      "step": 19908
    },
    {
      "epoch": 2.112136643326968,
      "grad_norm": 0.5358053932195089,
      "learning_rate": 4.630477583170809e-05,
      "loss": 1.6899,
      "num_input_tokens_seen": 15663721568,
      "step": 19909
    },
    {
      "epoch": 2.112242732866539,
      "grad_norm": 0.4412901845712024,
      "learning_rate": 4.630441219440247e-05,
      "loss": 1.5168,
      "num_input_tokens_seen": 15664508400,
      "step": 19910
    },
    {
      "epoch": 2.1123488224061107,
      "grad_norm": 0.43482254427232,
      "learning_rate": 4.630404854063343e-05,
      "loss": 1.5155,
      "num_input_tokens_seen": 15665295264,
      "step": 19911
    },
    {
      "epoch": 2.112454911945682,
      "grad_norm": 0.39219262777647246,
      "learning_rate": 4.6303684870401236e-05,
      "loss": 1.6011,
      "num_input_tokens_seen": 15666082016,
      "step": 19912
    },
    {
      "epoch": 2.1125610014852536,
      "grad_norm": 0.43484833922617655,
      "learning_rate": 4.6303321183706185e-05,
      "loss": 1.5679,
      "num_input_tokens_seen": 15666868864,
      "step": 19913
    },
    {
      "epoch": 2.112667091024825,
      "grad_norm": 0.4580252068121606,
      "learning_rate": 4.630295748054855e-05,
      "loss": 1.6893,
      "num_input_tokens_seen": 15667655648,
      "step": 19914
    },
    {
      "epoch": 2.1127731805643966,
      "grad_norm": 0.3940497932919602,
      "learning_rate": 4.630259376092861e-05,
      "loss": 1.6682,
      "num_input_tokens_seen": 15668442400,
      "step": 19915
    },
    {
      "epoch": 2.1128792701039676,
      "grad_norm": 0.47584188616943096,
      "learning_rate": 4.630223002484667e-05,
      "loss": 1.5293,
      "num_input_tokens_seen": 15669229152,
      "step": 19916
    },
    {
      "epoch": 2.112985359643539,
      "grad_norm": 0.4041745636788282,
      "learning_rate": 4.630186627230297e-05,
      "loss": 1.6799,
      "num_input_tokens_seen": 15670015936,
      "step": 19917
    },
    {
      "epoch": 2.1130914491831105,
      "grad_norm": 0.5501167902825477,
      "learning_rate": 4.6301502503297825e-05,
      "loss": 1.6052,
      "num_input_tokens_seen": 15670802752,
      "step": 19918
    },
    {
      "epoch": 2.113197538722682,
      "grad_norm": 0.3876488073948819,
      "learning_rate": 4.63011387178315e-05,
      "loss": 1.6496,
      "num_input_tokens_seen": 15671589408,
      "step": 19919
    },
    {
      "epoch": 2.1133036282622535,
      "grad_norm": 0.7428994196225766,
      "learning_rate": 4.630077491590428e-05,
      "loss": 1.7582,
      "num_input_tokens_seen": 15672376080,
      "step": 19920
    },
    {
      "epoch": 2.113409717801825,
      "grad_norm": 0.4132933808839022,
      "learning_rate": 4.630041109751645e-05,
      "loss": 1.4868,
      "num_input_tokens_seen": 15673162832,
      "step": 19921
    },
    {
      "epoch": 2.113515807341396,
      "grad_norm": 0.5418830883122893,
      "learning_rate": 4.630004726266828e-05,
      "loss": 1.6134,
      "num_input_tokens_seen": 15673949552,
      "step": 19922
    },
    {
      "epoch": 2.1136218968809675,
      "grad_norm": 0.42470862049377467,
      "learning_rate": 4.629968341136006e-05,
      "loss": 1.5413,
      "num_input_tokens_seen": 15674736368,
      "step": 19923
    },
    {
      "epoch": 2.113727986420539,
      "grad_norm": 0.45150038858630653,
      "learning_rate": 4.6299319543592065e-05,
      "loss": 1.7633,
      "num_input_tokens_seen": 15675523152,
      "step": 19924
    },
    {
      "epoch": 2.1138340759601104,
      "grad_norm": 0.42744861944809004,
      "learning_rate": 4.6298955659364594e-05,
      "loss": 1.5961,
      "num_input_tokens_seen": 15676309840,
      "step": 19925
    },
    {
      "epoch": 2.113940165499682,
      "grad_norm": 0.4491197971891874,
      "learning_rate": 4.629859175867791e-05,
      "loss": 1.4971,
      "num_input_tokens_seen": 15677096608,
      "step": 19926
    },
    {
      "epoch": 2.114046255039253,
      "grad_norm": 0.46096326635907,
      "learning_rate": 4.629822784153229e-05,
      "loss": 1.5183,
      "num_input_tokens_seen": 15677883360,
      "step": 19927
    },
    {
      "epoch": 2.1141523445788244,
      "grad_norm": 0.46208766335477874,
      "learning_rate": 4.629786390792804e-05,
      "loss": 1.7804,
      "num_input_tokens_seen": 15678670112,
      "step": 19928
    },
    {
      "epoch": 2.114258434118396,
      "grad_norm": 0.4486383699850716,
      "learning_rate": 4.629749995786542e-05,
      "loss": 1.6557,
      "num_input_tokens_seen": 15679456832,
      "step": 19929
    },
    {
      "epoch": 2.1143645236579673,
      "grad_norm": 0.4108323299835692,
      "learning_rate": 4.629713599134471e-05,
      "loss": 1.6506,
      "num_input_tokens_seen": 15680243568,
      "step": 19930
    },
    {
      "epoch": 2.114470613197539,
      "grad_norm": 0.40882573551231544,
      "learning_rate": 4.629677200836621e-05,
      "loss": 1.5334,
      "num_input_tokens_seen": 15681030400,
      "step": 19931
    },
    {
      "epoch": 2.1145767027371103,
      "grad_norm": 0.4274729194234311,
      "learning_rate": 4.6296408008930175e-05,
      "loss": 1.6998,
      "num_input_tokens_seen": 15681817152,
      "step": 19932
    },
    {
      "epoch": 2.1146827922766813,
      "grad_norm": 0.3908589914391035,
      "learning_rate": 4.629604399303691e-05,
      "loss": 1.5716,
      "num_input_tokens_seen": 15682603904,
      "step": 19933
    },
    {
      "epoch": 2.114788881816253,
      "grad_norm": 0.37544406560847376,
      "learning_rate": 4.629567996068669e-05,
      "loss": 1.4451,
      "num_input_tokens_seen": 15683390672,
      "step": 19934
    },
    {
      "epoch": 2.1148949713558243,
      "grad_norm": 0.3809279451649921,
      "learning_rate": 4.629531591187978e-05,
      "loss": 1.5244,
      "num_input_tokens_seen": 15684177536,
      "step": 19935
    },
    {
      "epoch": 2.1150010608953957,
      "grad_norm": 0.36870658141025253,
      "learning_rate": 4.629495184661649e-05,
      "loss": 1.5705,
      "num_input_tokens_seen": 15684964320,
      "step": 19936
    },
    {
      "epoch": 2.115107150434967,
      "grad_norm": 0.4043041915230542,
      "learning_rate": 4.629458776489708e-05,
      "loss": 1.523,
      "num_input_tokens_seen": 15685751072,
      "step": 19937
    },
    {
      "epoch": 2.1152132399745387,
      "grad_norm": 0.4031495469404565,
      "learning_rate": 4.6294223666721836e-05,
      "loss": 1.7156,
      "num_input_tokens_seen": 15686537728,
      "step": 19938
    },
    {
      "epoch": 2.1153193295141097,
      "grad_norm": 0.33685708219920957,
      "learning_rate": 4.6293859552091035e-05,
      "loss": 1.4725,
      "num_input_tokens_seen": 15687324560,
      "step": 19939
    },
    {
      "epoch": 2.115425419053681,
      "grad_norm": 0.3808773168318405,
      "learning_rate": 4.629349542100497e-05,
      "loss": 1.6118,
      "num_input_tokens_seen": 15688111344,
      "step": 19940
    },
    {
      "epoch": 2.1155315085932527,
      "grad_norm": 0.4061489101271733,
      "learning_rate": 4.629313127346392e-05,
      "loss": 1.6103,
      "num_input_tokens_seen": 15688898144,
      "step": 19941
    },
    {
      "epoch": 2.115637598132824,
      "grad_norm": 0.3873642477805795,
      "learning_rate": 4.629276710946816e-05,
      "loss": 1.5164,
      "num_input_tokens_seen": 15689684832,
      "step": 19942
    },
    {
      "epoch": 2.1157436876723956,
      "grad_norm": 0.4085782221293796,
      "learning_rate": 4.6292402929017974e-05,
      "loss": 1.7174,
      "num_input_tokens_seen": 15690471536,
      "step": 19943
    },
    {
      "epoch": 2.115849777211967,
      "grad_norm": 0.3638337219012578,
      "learning_rate": 4.629203873211364e-05,
      "loss": 1.5366,
      "num_input_tokens_seen": 15691258336,
      "step": 19944
    },
    {
      "epoch": 2.115955866751538,
      "grad_norm": 0.3988908519878053,
      "learning_rate": 4.6291674518755454e-05,
      "loss": 1.6119,
      "num_input_tokens_seen": 15692045040,
      "step": 19945
    },
    {
      "epoch": 2.1160619562911096,
      "grad_norm": 0.3987029254913335,
      "learning_rate": 4.6291310288943676e-05,
      "loss": 1.5908,
      "num_input_tokens_seen": 15692831776,
      "step": 19946
    },
    {
      "epoch": 2.116168045830681,
      "grad_norm": 0.36467189560393487,
      "learning_rate": 4.629094604267861e-05,
      "loss": 1.4827,
      "num_input_tokens_seen": 15693618576,
      "step": 19947
    },
    {
      "epoch": 2.1162741353702526,
      "grad_norm": 0.38258096741347564,
      "learning_rate": 4.629058177996051e-05,
      "loss": 1.7043,
      "num_input_tokens_seen": 15694405312,
      "step": 19948
    },
    {
      "epoch": 2.116380224909824,
      "grad_norm": 0.3887825460881885,
      "learning_rate": 4.629021750078968e-05,
      "loss": 1.4724,
      "num_input_tokens_seen": 15695192016,
      "step": 19949
    },
    {
      "epoch": 2.1164863144493955,
      "grad_norm": 0.4103195770003954,
      "learning_rate": 4.62898532051664e-05,
      "loss": 1.5796,
      "num_input_tokens_seen": 15695978848,
      "step": 19950
    },
    {
      "epoch": 2.1165924039889665,
      "grad_norm": 0.40618594599695856,
      "learning_rate": 4.628948889309094e-05,
      "loss": 1.5247,
      "num_input_tokens_seen": 15696765664,
      "step": 19951
    },
    {
      "epoch": 2.116698493528538,
      "grad_norm": 0.3895985283164394,
      "learning_rate": 4.628912456456359e-05,
      "loss": 1.603,
      "num_input_tokens_seen": 15697552448,
      "step": 19952
    },
    {
      "epoch": 2.1168045830681095,
      "grad_norm": 0.37997525374958235,
      "learning_rate": 4.6288760219584625e-05,
      "loss": 1.6618,
      "num_input_tokens_seen": 15698339200,
      "step": 19953
    },
    {
      "epoch": 2.116910672607681,
      "grad_norm": 0.3686281335036565,
      "learning_rate": 4.6288395858154336e-05,
      "loss": 1.598,
      "num_input_tokens_seen": 15699126000,
      "step": 19954
    },
    {
      "epoch": 2.1170167621472524,
      "grad_norm": 0.3857226336916192,
      "learning_rate": 4.6288031480273e-05,
      "loss": 1.5387,
      "num_input_tokens_seen": 15699912832,
      "step": 19955
    },
    {
      "epoch": 2.1171228516868235,
      "grad_norm": 0.36003415112543125,
      "learning_rate": 4.62876670859409e-05,
      "loss": 1.6173,
      "num_input_tokens_seen": 15700699728,
      "step": 19956
    },
    {
      "epoch": 2.117228941226395,
      "grad_norm": 0.4334740383972643,
      "learning_rate": 4.6287302675158306e-05,
      "loss": 1.6843,
      "num_input_tokens_seen": 15701486432,
      "step": 19957
    },
    {
      "epoch": 2.1173350307659664,
      "grad_norm": 0.42189971377987157,
      "learning_rate": 4.628693824792552e-05,
      "loss": 1.7573,
      "num_input_tokens_seen": 15702273152,
      "step": 19958
    },
    {
      "epoch": 2.117441120305538,
      "grad_norm": 0.43432708861800734,
      "learning_rate": 4.6286573804242806e-05,
      "loss": 1.5535,
      "num_input_tokens_seen": 15703059936,
      "step": 19959
    },
    {
      "epoch": 2.1175472098451094,
      "grad_norm": 0.3807090044607958,
      "learning_rate": 4.628620934411045e-05,
      "loss": 1.5786,
      "num_input_tokens_seen": 15703846704,
      "step": 19960
    },
    {
      "epoch": 2.117653299384681,
      "grad_norm": 0.43366260881223806,
      "learning_rate": 4.6285844867528736e-05,
      "loss": 1.6447,
      "num_input_tokens_seen": 15704633392,
      "step": 19961
    },
    {
      "epoch": 2.117759388924252,
      "grad_norm": 0.38514167762268914,
      "learning_rate": 4.6285480374497946e-05,
      "loss": 1.4381,
      "num_input_tokens_seen": 15705420208,
      "step": 19962
    },
    {
      "epoch": 2.1178654784638233,
      "grad_norm": 0.46867210199656,
      "learning_rate": 4.6285115865018367e-05,
      "loss": 1.6397,
      "num_input_tokens_seen": 15706206976,
      "step": 19963
    },
    {
      "epoch": 2.117971568003395,
      "grad_norm": 0.5794898641838092,
      "learning_rate": 4.6284751339090274e-05,
      "loss": 1.7626,
      "num_input_tokens_seen": 15706993696,
      "step": 19964
    },
    {
      "epoch": 2.1180776575429663,
      "grad_norm": 0.5347262543390562,
      "learning_rate": 4.628438679671395e-05,
      "loss": 1.6782,
      "num_input_tokens_seen": 15707780544,
      "step": 19965
    },
    {
      "epoch": 2.1181837470825378,
      "grad_norm": 0.49694953904122396,
      "learning_rate": 4.628402223788968e-05,
      "loss": 1.6465,
      "num_input_tokens_seen": 15708567296,
      "step": 19966
    },
    {
      "epoch": 2.1182898366221092,
      "grad_norm": 0.4022487688240987,
      "learning_rate": 4.628365766261773e-05,
      "loss": 1.5245,
      "num_input_tokens_seen": 15709354032,
      "step": 19967
    },
    {
      "epoch": 2.1183959261616803,
      "grad_norm": 0.579400617358715,
      "learning_rate": 4.62832930708984e-05,
      "loss": 1.5694,
      "num_input_tokens_seen": 15710140912,
      "step": 19968
    },
    {
      "epoch": 2.1185020157012517,
      "grad_norm": 0.43627739113308356,
      "learning_rate": 4.6282928462731965e-05,
      "loss": 1.6436,
      "num_input_tokens_seen": 15710927600,
      "step": 19969
    },
    {
      "epoch": 2.118608105240823,
      "grad_norm": 0.36896330317908804,
      "learning_rate": 4.6282563838118707e-05,
      "loss": 1.4871,
      "num_input_tokens_seen": 15711714400,
      "step": 19970
    },
    {
      "epoch": 2.1187141947803947,
      "grad_norm": 0.43324832640166183,
      "learning_rate": 4.628219919705891e-05,
      "loss": 1.6187,
      "num_input_tokens_seen": 15712501184,
      "step": 19971
    },
    {
      "epoch": 2.118820284319966,
      "grad_norm": 0.412280855249801,
      "learning_rate": 4.628183453955285e-05,
      "loss": 1.552,
      "num_input_tokens_seen": 15713288016,
      "step": 19972
    },
    {
      "epoch": 2.1189263738595376,
      "grad_norm": 0.36762764147154253,
      "learning_rate": 4.628146986560082e-05,
      "loss": 1.5473,
      "num_input_tokens_seen": 15714074896,
      "step": 19973
    },
    {
      "epoch": 2.1190324633991087,
      "grad_norm": 0.4378078128302839,
      "learning_rate": 4.628110517520309e-05,
      "loss": 1.6359,
      "num_input_tokens_seen": 15714861616,
      "step": 19974
    },
    {
      "epoch": 2.11913855293868,
      "grad_norm": 0.38153234755259957,
      "learning_rate": 4.6280740468359945e-05,
      "loss": 1.6458,
      "num_input_tokens_seen": 15715648256,
      "step": 19975
    },
    {
      "epoch": 2.1192446424782516,
      "grad_norm": 0.3793975142836794,
      "learning_rate": 4.628037574507167e-05,
      "loss": 1.6247,
      "num_input_tokens_seen": 15716435024,
      "step": 19976
    },
    {
      "epoch": 2.119350732017823,
      "grad_norm": 0.48189846402106934,
      "learning_rate": 4.6280011005338545e-05,
      "loss": 1.5669,
      "num_input_tokens_seen": 15717221776,
      "step": 19977
    },
    {
      "epoch": 2.1194568215573946,
      "grad_norm": 0.6336553701716076,
      "learning_rate": 4.627964624916085e-05,
      "loss": 1.5379,
      "num_input_tokens_seen": 15718008560,
      "step": 19978
    },
    {
      "epoch": 2.119562911096966,
      "grad_norm": 0.428350404755412,
      "learning_rate": 4.627928147653887e-05,
      "loss": 1.5192,
      "num_input_tokens_seen": 15718795280,
      "step": 19979
    },
    {
      "epoch": 2.119669000636537,
      "grad_norm": 0.5889234229793403,
      "learning_rate": 4.627891668747289e-05,
      "loss": 1.4684,
      "num_input_tokens_seen": 15719582112,
      "step": 19980
    },
    {
      "epoch": 2.1197750901761085,
      "grad_norm": 0.3898485145247043,
      "learning_rate": 4.6278551881963184e-05,
      "loss": 1.6242,
      "num_input_tokens_seen": 15720368848,
      "step": 19981
    },
    {
      "epoch": 2.11988117971568,
      "grad_norm": 0.4328406965944016,
      "learning_rate": 4.627818706001004e-05,
      "loss": 1.5547,
      "num_input_tokens_seen": 15721155696,
      "step": 19982
    },
    {
      "epoch": 2.1199872692552515,
      "grad_norm": 0.6036865657445388,
      "learning_rate": 4.627782222161373e-05,
      "loss": 1.7195,
      "num_input_tokens_seen": 15721942432,
      "step": 19983
    },
    {
      "epoch": 2.120093358794823,
      "grad_norm": 0.46428708387335066,
      "learning_rate": 4.6277457366774544e-05,
      "loss": 1.5707,
      "num_input_tokens_seen": 15722729168,
      "step": 19984
    },
    {
      "epoch": 2.1201994483343944,
      "grad_norm": 0.42668985588312724,
      "learning_rate": 4.627709249549277e-05,
      "loss": 1.6846,
      "num_input_tokens_seen": 15723515904,
      "step": 19985
    },
    {
      "epoch": 2.1203055378739655,
      "grad_norm": 0.48112743425388793,
      "learning_rate": 4.627672760776868e-05,
      "loss": 1.5593,
      "num_input_tokens_seen": 15724302688,
      "step": 19986
    },
    {
      "epoch": 2.120411627413537,
      "grad_norm": 0.5186983029414938,
      "learning_rate": 4.627636270360256e-05,
      "loss": 1.5983,
      "num_input_tokens_seen": 15725089440,
      "step": 19987
    },
    {
      "epoch": 2.1205177169531084,
      "grad_norm": 0.3677832352525636,
      "learning_rate": 4.6275997782994696e-05,
      "loss": 1.5797,
      "num_input_tokens_seen": 15725876288,
      "step": 19988
    },
    {
      "epoch": 2.12062380649268,
      "grad_norm": 0.516116290781001,
      "learning_rate": 4.627563284594536e-05,
      "loss": 1.687,
      "num_input_tokens_seen": 15726663056,
      "step": 19989
    },
    {
      "epoch": 2.1207298960322514,
      "grad_norm": 0.5483878032760651,
      "learning_rate": 4.6275267892454835e-05,
      "loss": 1.6385,
      "num_input_tokens_seen": 15727449776,
      "step": 19990
    },
    {
      "epoch": 2.120835985571823,
      "grad_norm": 0.6545244494407353,
      "learning_rate": 4.627490292252341e-05,
      "loss": 1.4922,
      "num_input_tokens_seen": 15728236624,
      "step": 19991
    },
    {
      "epoch": 2.120942075111394,
      "grad_norm": 0.44672262659451617,
      "learning_rate": 4.627453793615137e-05,
      "loss": 1.6873,
      "num_input_tokens_seen": 15729023440,
      "step": 19992
    },
    {
      "epoch": 2.1210481646509654,
      "grad_norm": 0.5143543511874629,
      "learning_rate": 4.6274172933338986e-05,
      "loss": 1.625,
      "num_input_tokens_seen": 15729810224,
      "step": 19993
    },
    {
      "epoch": 2.121154254190537,
      "grad_norm": 0.43656911752872773,
      "learning_rate": 4.6273807914086545e-05,
      "loss": 1.6702,
      "num_input_tokens_seen": 15730596992,
      "step": 19994
    },
    {
      "epoch": 2.1212603437301083,
      "grad_norm": 0.45788840675900766,
      "learning_rate": 4.627344287839433e-05,
      "loss": 1.6418,
      "num_input_tokens_seen": 15731383712,
      "step": 19995
    },
    {
      "epoch": 2.1213664332696798,
      "grad_norm": 0.47824758555964264,
      "learning_rate": 4.627307782626262e-05,
      "loss": 1.703,
      "num_input_tokens_seen": 15732170496,
      "step": 19996
    },
    {
      "epoch": 2.121472522809251,
      "grad_norm": 0.3891351413990434,
      "learning_rate": 4.627271275769171e-05,
      "loss": 1.5991,
      "num_input_tokens_seen": 15732957200,
      "step": 19997
    },
    {
      "epoch": 2.1215786123488223,
      "grad_norm": 0.457008261758511,
      "learning_rate": 4.6272347672681857e-05,
      "loss": 1.5654,
      "num_input_tokens_seen": 15733743920,
      "step": 19998
    },
    {
      "epoch": 2.1216847018883938,
      "grad_norm": 0.4032317635992764,
      "learning_rate": 4.627198257123337e-05,
      "loss": 1.4836,
      "num_input_tokens_seen": 15734530768,
      "step": 19999
    },
    {
      "epoch": 2.1217907914279652,
      "grad_norm": 0.48792572928731454,
      "learning_rate": 4.627161745334651e-05,
      "loss": 1.7965,
      "num_input_tokens_seen": 15735317424,
      "step": 20000
    },
    {
      "epoch": 2.1217907914279652,
      "eval_loss": 1.7063239812850952,
      "eval_runtime": 65.3826,
      "eval_samples_per_second": 45.884,
      "eval_steps_per_second": 0.489,
      "num_input_tokens_seen": 15735317424,
      "step": 20000
    },
    {
      "epoch": 2.1218968809675367,
      "grad_norm": 0.4491237938815379,
      "learning_rate": 4.627125231902158e-05,
      "loss": 1.6412,
      "num_input_tokens_seen": 15736104160,
      "step": 20001
    },
    {
      "epoch": 2.122002970507108,
      "grad_norm": 0.4837955431713177,
      "learning_rate": 4.627088716825885e-05,
      "loss": 1.6129,
      "num_input_tokens_seen": 15736890912,
      "step": 20002
    },
    {
      "epoch": 2.122109060046679,
      "grad_norm": 0.37058955019060585,
      "learning_rate": 4.627052200105859e-05,
      "loss": 1.5939,
      "num_input_tokens_seen": 15737677712,
      "step": 20003
    },
    {
      "epoch": 2.1222151495862507,
      "grad_norm": 0.4772935480575149,
      "learning_rate": 4.62701568174211e-05,
      "loss": 1.5897,
      "num_input_tokens_seen": 15738464512,
      "step": 20004
    },
    {
      "epoch": 2.122321239125822,
      "grad_norm": 0.36915595937382695,
      "learning_rate": 4.626979161734666e-05,
      "loss": 1.5925,
      "num_input_tokens_seen": 15739251376,
      "step": 20005
    },
    {
      "epoch": 2.1224273286653936,
      "grad_norm": 0.45022097231491787,
      "learning_rate": 4.6269426400835546e-05,
      "loss": 1.5835,
      "num_input_tokens_seen": 15740038192,
      "step": 20006
    },
    {
      "epoch": 2.122533418204965,
      "grad_norm": 0.423252763655306,
      "learning_rate": 4.6269061167888036e-05,
      "loss": 1.6693,
      "num_input_tokens_seen": 15740824944,
      "step": 20007
    },
    {
      "epoch": 2.1226395077445366,
      "grad_norm": 0.41651376167213483,
      "learning_rate": 4.6268695918504435e-05,
      "loss": 1.6105,
      "num_input_tokens_seen": 15741611680,
      "step": 20008
    },
    {
      "epoch": 2.1227455972841076,
      "grad_norm": 0.44669742840112353,
      "learning_rate": 4.6268330652685e-05,
      "loss": 1.5311,
      "num_input_tokens_seen": 15742398528,
      "step": 20009
    },
    {
      "epoch": 2.122851686823679,
      "grad_norm": 0.4616490353115626,
      "learning_rate": 4.626796537043003e-05,
      "loss": 1.6802,
      "num_input_tokens_seen": 15743185392,
      "step": 20010
    },
    {
      "epoch": 2.1229577763632506,
      "grad_norm": 0.42388278253687206,
      "learning_rate": 4.626760007173979e-05,
      "loss": 1.729,
      "num_input_tokens_seen": 15743972080,
      "step": 20011
    },
    {
      "epoch": 2.123063865902822,
      "grad_norm": 0.38479880370176617,
      "learning_rate": 4.626723475661458e-05,
      "loss": 1.6514,
      "num_input_tokens_seen": 15744758768,
      "step": 20012
    },
    {
      "epoch": 2.1231699554423935,
      "grad_norm": 0.45261178309259076,
      "learning_rate": 4.6266869425054676e-05,
      "loss": 1.5627,
      "num_input_tokens_seen": 15745545616,
      "step": 20013
    },
    {
      "epoch": 2.123276044981965,
      "grad_norm": 0.3708637688126986,
      "learning_rate": 4.626650407706036e-05,
      "loss": 1.579,
      "num_input_tokens_seen": 15746332368,
      "step": 20014
    },
    {
      "epoch": 2.123382134521536,
      "grad_norm": 0.4260655241285449,
      "learning_rate": 4.626613871263191e-05,
      "loss": 1.5981,
      "num_input_tokens_seen": 15747119072,
      "step": 20015
    },
    {
      "epoch": 2.1234882240611075,
      "grad_norm": 0.4138914359660501,
      "learning_rate": 4.626577333176961e-05,
      "loss": 1.6492,
      "num_input_tokens_seen": 15747905712,
      "step": 20016
    },
    {
      "epoch": 2.123594313600679,
      "grad_norm": 0.3808102855263759,
      "learning_rate": 4.626540793447375e-05,
      "loss": 1.6421,
      "num_input_tokens_seen": 15748692544,
      "step": 20017
    },
    {
      "epoch": 2.1237004031402504,
      "grad_norm": 0.3711059165988248,
      "learning_rate": 4.62650425207446e-05,
      "loss": 1.5907,
      "num_input_tokens_seen": 15749479376,
      "step": 20018
    },
    {
      "epoch": 2.123806492679822,
      "grad_norm": 0.4365417359566802,
      "learning_rate": 4.626467709058245e-05,
      "loss": 1.4675,
      "num_input_tokens_seen": 15750266256,
      "step": 20019
    },
    {
      "epoch": 2.1239125822193934,
      "grad_norm": 0.3532113809391357,
      "learning_rate": 4.626431164398758e-05,
      "loss": 1.5338,
      "num_input_tokens_seen": 15751053088,
      "step": 20020
    },
    {
      "epoch": 2.1240186717589644,
      "grad_norm": 0.45821832922552735,
      "learning_rate": 4.626394618096028e-05,
      "loss": 1.6875,
      "num_input_tokens_seen": 15751839840,
      "step": 20021
    },
    {
      "epoch": 2.124124761298536,
      "grad_norm": 0.43041277962151425,
      "learning_rate": 4.626358070150083e-05,
      "loss": 1.4957,
      "num_input_tokens_seen": 15752626688,
      "step": 20022
    },
    {
      "epoch": 2.1242308508381074,
      "grad_norm": 0.3616274923423535,
      "learning_rate": 4.62632152056095e-05,
      "loss": 1.543,
      "num_input_tokens_seen": 15753413520,
      "step": 20023
    },
    {
      "epoch": 2.124336940377679,
      "grad_norm": 0.45014848022447385,
      "learning_rate": 4.626284969328659e-05,
      "loss": 1.6164,
      "num_input_tokens_seen": 15754200176,
      "step": 20024
    },
    {
      "epoch": 2.1244430299172503,
      "grad_norm": 0.3667179174741241,
      "learning_rate": 4.626248416453236e-05,
      "loss": 1.5682,
      "num_input_tokens_seen": 15754986912,
      "step": 20025
    },
    {
      "epoch": 2.1245491194568213,
      "grad_norm": 0.37698105609359167,
      "learning_rate": 4.626211861934712e-05,
      "loss": 1.5556,
      "num_input_tokens_seen": 15755773680,
      "step": 20026
    },
    {
      "epoch": 2.124655208996393,
      "grad_norm": 0.38661131350955785,
      "learning_rate": 4.6261753057731126e-05,
      "loss": 1.6397,
      "num_input_tokens_seen": 15756560544,
      "step": 20027
    },
    {
      "epoch": 2.1247612985359643,
      "grad_norm": 0.3689240226311168,
      "learning_rate": 4.626138747968468e-05,
      "loss": 1.5944,
      "num_input_tokens_seen": 15757347248,
      "step": 20028
    },
    {
      "epoch": 2.1248673880755358,
      "grad_norm": 0.4477893963139612,
      "learning_rate": 4.6261021885208065e-05,
      "loss": 1.6049,
      "num_input_tokens_seen": 15758134016,
      "step": 20029
    },
    {
      "epoch": 2.1249734776151072,
      "grad_norm": 0.3562019525550435,
      "learning_rate": 4.6260656274301546e-05,
      "loss": 1.6059,
      "num_input_tokens_seen": 15758920832,
      "step": 20030
    },
    {
      "epoch": 2.1250795671546787,
      "grad_norm": 0.40635476286231764,
      "learning_rate": 4.626029064696542e-05,
      "loss": 1.7346,
      "num_input_tokens_seen": 15759707616,
      "step": 20031
    },
    {
      "epoch": 2.1251856566942497,
      "grad_norm": 0.35402243208515893,
      "learning_rate": 4.6259925003199964e-05,
      "loss": 1.5088,
      "num_input_tokens_seen": 15760494272,
      "step": 20032
    },
    {
      "epoch": 2.125291746233821,
      "grad_norm": 0.3768593754149243,
      "learning_rate": 4.625955934300546e-05,
      "loss": 1.5741,
      "num_input_tokens_seen": 15761281008,
      "step": 20033
    },
    {
      "epoch": 2.1253978357733927,
      "grad_norm": 0.34060155375292006,
      "learning_rate": 4.625919366638219e-05,
      "loss": 1.4973,
      "num_input_tokens_seen": 15762067872,
      "step": 20034
    },
    {
      "epoch": 2.125503925312964,
      "grad_norm": 0.46928588198543125,
      "learning_rate": 4.6258827973330444e-05,
      "loss": 1.7598,
      "num_input_tokens_seen": 15762854608,
      "step": 20035
    },
    {
      "epoch": 2.1256100148525356,
      "grad_norm": 0.4205548672189129,
      "learning_rate": 4.62584622638505e-05,
      "loss": 1.4649,
      "num_input_tokens_seen": 15763641376,
      "step": 20036
    },
    {
      "epoch": 2.125716104392107,
      "grad_norm": 0.38304306974412505,
      "learning_rate": 4.6258096537942635e-05,
      "loss": 1.6705,
      "num_input_tokens_seen": 15764428144,
      "step": 20037
    },
    {
      "epoch": 2.125822193931678,
      "grad_norm": 0.42609489250305566,
      "learning_rate": 4.625773079560714e-05,
      "loss": 1.4777,
      "num_input_tokens_seen": 15765214784,
      "step": 20038
    },
    {
      "epoch": 2.1259282834712496,
      "grad_norm": 0.42753744362924545,
      "learning_rate": 4.62573650368443e-05,
      "loss": 1.571,
      "num_input_tokens_seen": 15766001568,
      "step": 20039
    },
    {
      "epoch": 2.126034373010821,
      "grad_norm": 0.5229900329747186,
      "learning_rate": 4.6256999261654385e-05,
      "loss": 1.7472,
      "num_input_tokens_seen": 15766788272,
      "step": 20040
    },
    {
      "epoch": 2.1261404625503926,
      "grad_norm": 0.55985310367848,
      "learning_rate": 4.625663347003768e-05,
      "loss": 1.7022,
      "num_input_tokens_seen": 15767575024,
      "step": 20041
    },
    {
      "epoch": 2.126246552089964,
      "grad_norm": 0.3829990611428413,
      "learning_rate": 4.6256267661994476e-05,
      "loss": 1.6125,
      "num_input_tokens_seen": 15768361792,
      "step": 20042
    },
    {
      "epoch": 2.1263526416295355,
      "grad_norm": 0.5236969546294765,
      "learning_rate": 4.6255901837525065e-05,
      "loss": 1.542,
      "num_input_tokens_seen": 15769148528,
      "step": 20043
    },
    {
      "epoch": 2.1264587311691066,
      "grad_norm": 0.3819838864416666,
      "learning_rate": 4.625553599662969e-05,
      "loss": 1.7648,
      "num_input_tokens_seen": 15769935312,
      "step": 20044
    },
    {
      "epoch": 2.126564820708678,
      "grad_norm": 0.5483475378187381,
      "learning_rate": 4.625517013930869e-05,
      "loss": 1.6662,
      "num_input_tokens_seen": 15770722208,
      "step": 20045
    },
    {
      "epoch": 2.1266709102482495,
      "grad_norm": 0.5340113767624504,
      "learning_rate": 4.62548042655623e-05,
      "loss": 1.6052,
      "num_input_tokens_seen": 15771508928,
      "step": 20046
    },
    {
      "epoch": 2.126776999787821,
      "grad_norm": 0.5007713587554506,
      "learning_rate": 4.625443837539083e-05,
      "loss": 1.7245,
      "num_input_tokens_seen": 15772295696,
      "step": 20047
    },
    {
      "epoch": 2.1268830893273925,
      "grad_norm": 0.5462322823329177,
      "learning_rate": 4.6254072468794544e-05,
      "loss": 1.4911,
      "num_input_tokens_seen": 15773082512,
      "step": 20048
    },
    {
      "epoch": 2.126989178866964,
      "grad_norm": 0.44063419080720434,
      "learning_rate": 4.6253706545773744e-05,
      "loss": 1.627,
      "num_input_tokens_seen": 15773869248,
      "step": 20049
    },
    {
      "epoch": 2.127095268406535,
      "grad_norm": 0.5789483015824682,
      "learning_rate": 4.62533406063287e-05,
      "loss": 1.7249,
      "num_input_tokens_seen": 15774656032,
      "step": 20050
    },
    {
      "epoch": 2.1272013579461064,
      "grad_norm": 0.4118426135272876,
      "learning_rate": 4.625297465045969e-05,
      "loss": 1.5877,
      "num_input_tokens_seen": 15775442768,
      "step": 20051
    },
    {
      "epoch": 2.127307447485678,
      "grad_norm": 0.5405348020176112,
      "learning_rate": 4.6252608678167016e-05,
      "loss": 1.6991,
      "num_input_tokens_seen": 15776229552,
      "step": 20052
    },
    {
      "epoch": 2.1274135370252494,
      "grad_norm": 0.4301159211489539,
      "learning_rate": 4.6252242689450943e-05,
      "loss": 1.8007,
      "num_input_tokens_seen": 15777016208,
      "step": 20053
    },
    {
      "epoch": 2.127519626564821,
      "grad_norm": 0.47103028762182264,
      "learning_rate": 4.625187668431176e-05,
      "loss": 1.5223,
      "num_input_tokens_seen": 15777802960,
      "step": 20054
    },
    {
      "epoch": 2.127625716104392,
      "grad_norm": 0.37743795646715766,
      "learning_rate": 4.625151066274975e-05,
      "loss": 1.5167,
      "num_input_tokens_seen": 15778589760,
      "step": 20055
    },
    {
      "epoch": 2.1277318056439634,
      "grad_norm": 0.4739650680103237,
      "learning_rate": 4.625114462476521e-05,
      "loss": 1.7389,
      "num_input_tokens_seen": 15779376464,
      "step": 20056
    },
    {
      "epoch": 2.127837895183535,
      "grad_norm": 0.4753711717289427,
      "learning_rate": 4.625077857035839e-05,
      "loss": 1.6387,
      "num_input_tokens_seen": 15780163264,
      "step": 20057
    },
    {
      "epoch": 2.1279439847231063,
      "grad_norm": 0.6414211328083931,
      "learning_rate": 4.62504124995296e-05,
      "loss": 1.6635,
      "num_input_tokens_seen": 15780950000,
      "step": 20058
    },
    {
      "epoch": 2.128050074262678,
      "grad_norm": 0.4975506302463406,
      "learning_rate": 4.6250046412279116e-05,
      "loss": 1.5555,
      "num_input_tokens_seen": 15781736800,
      "step": 20059
    },
    {
      "epoch": 2.1281561638022493,
      "grad_norm": 0.3819549584203863,
      "learning_rate": 4.624968030860722e-05,
      "loss": 1.4919,
      "num_input_tokens_seen": 15782523632,
      "step": 20060
    },
    {
      "epoch": 2.1282622533418207,
      "grad_norm": 0.3535633120848434,
      "learning_rate": 4.624931418851419e-05,
      "loss": 1.5693,
      "num_input_tokens_seen": 15783310400,
      "step": 20061
    },
    {
      "epoch": 2.1283683428813918,
      "grad_norm": 0.4170159654631599,
      "learning_rate": 4.6248948052000316e-05,
      "loss": 1.6094,
      "num_input_tokens_seen": 15784097072,
      "step": 20062
    },
    {
      "epoch": 2.1284744324209632,
      "grad_norm": 0.4904071983004551,
      "learning_rate": 4.624858189906588e-05,
      "loss": 1.7041,
      "num_input_tokens_seen": 15784883936,
      "step": 20063
    },
    {
      "epoch": 2.1285805219605347,
      "grad_norm": 0.4005773416803673,
      "learning_rate": 4.624821572971116e-05,
      "loss": 1.58,
      "num_input_tokens_seen": 15785670736,
      "step": 20064
    },
    {
      "epoch": 2.128686611500106,
      "grad_norm": 0.4596335269017538,
      "learning_rate": 4.624784954393645e-05,
      "loss": 1.5669,
      "num_input_tokens_seen": 15786457536,
      "step": 20065
    },
    {
      "epoch": 2.1287927010396777,
      "grad_norm": 0.4226461993826383,
      "learning_rate": 4.6247483341742016e-05,
      "loss": 1.6927,
      "num_input_tokens_seen": 15787244416,
      "step": 20066
    },
    {
      "epoch": 2.1288987905792487,
      "grad_norm": 0.4943471279212518,
      "learning_rate": 4.624711712312816e-05,
      "loss": 1.6472,
      "num_input_tokens_seen": 15788031184,
      "step": 20067
    },
    {
      "epoch": 2.12900488011882,
      "grad_norm": 0.4019664356836479,
      "learning_rate": 4.624675088809515e-05,
      "loss": 1.6931,
      "num_input_tokens_seen": 15788817856,
      "step": 20068
    },
    {
      "epoch": 2.1291109696583916,
      "grad_norm": 0.5506044378144597,
      "learning_rate": 4.624638463664327e-05,
      "loss": 1.6116,
      "num_input_tokens_seen": 15789604592,
      "step": 20069
    },
    {
      "epoch": 2.129217059197963,
      "grad_norm": 0.39424967760032475,
      "learning_rate": 4.6246018368772816e-05,
      "loss": 1.5275,
      "num_input_tokens_seen": 15790391424,
      "step": 20070
    },
    {
      "epoch": 2.1293231487375346,
      "grad_norm": 0.42313905618317593,
      "learning_rate": 4.624565208448405e-05,
      "loss": 1.7129,
      "num_input_tokens_seen": 15791178208,
      "step": 20071
    },
    {
      "epoch": 2.129429238277106,
      "grad_norm": 0.41500822148725264,
      "learning_rate": 4.624528578377728e-05,
      "loss": 1.781,
      "num_input_tokens_seen": 15791964960,
      "step": 20072
    },
    {
      "epoch": 2.129535327816677,
      "grad_norm": 0.4330513657029623,
      "learning_rate": 4.624491946665277e-05,
      "loss": 1.6762,
      "num_input_tokens_seen": 15792751664,
      "step": 20073
    },
    {
      "epoch": 2.1296414173562486,
      "grad_norm": 0.4119310451408195,
      "learning_rate": 4.6244553133110813e-05,
      "loss": 1.512,
      "num_input_tokens_seen": 15793538496,
      "step": 20074
    },
    {
      "epoch": 2.12974750689582,
      "grad_norm": 0.46559794532736404,
      "learning_rate": 4.624418678315168e-05,
      "loss": 1.7834,
      "num_input_tokens_seen": 15794325216,
      "step": 20075
    },
    {
      "epoch": 2.1298535964353915,
      "grad_norm": 0.3856446356409186,
      "learning_rate": 4.624382041677567e-05,
      "loss": 1.6483,
      "num_input_tokens_seen": 15795111984,
      "step": 20076
    },
    {
      "epoch": 2.129959685974963,
      "grad_norm": 0.4587777270034209,
      "learning_rate": 4.6243454033983056e-05,
      "loss": 1.6476,
      "num_input_tokens_seen": 15795898752,
      "step": 20077
    },
    {
      "epoch": 2.1300657755145345,
      "grad_norm": 0.4083760671166479,
      "learning_rate": 4.624308763477413e-05,
      "loss": 1.7076,
      "num_input_tokens_seen": 15796685488,
      "step": 20078
    },
    {
      "epoch": 2.1301718650541055,
      "grad_norm": 0.3918891849637297,
      "learning_rate": 4.624272121914916e-05,
      "loss": 1.5886,
      "num_input_tokens_seen": 15797472272,
      "step": 20079
    },
    {
      "epoch": 2.130277954593677,
      "grad_norm": 0.38830084715356633,
      "learning_rate": 4.624235478710845e-05,
      "loss": 1.736,
      "num_input_tokens_seen": 15798259008,
      "step": 20080
    },
    {
      "epoch": 2.1303840441332484,
      "grad_norm": 0.5615495639305516,
      "learning_rate": 4.6241988338652266e-05,
      "loss": 1.5614,
      "num_input_tokens_seen": 15799045728,
      "step": 20081
    },
    {
      "epoch": 2.13049013367282,
      "grad_norm": 0.36509547998337083,
      "learning_rate": 4.62416218737809e-05,
      "loss": 1.6498,
      "num_input_tokens_seen": 15799832496,
      "step": 20082
    },
    {
      "epoch": 2.1305962232123914,
      "grad_norm": 0.49451262643976057,
      "learning_rate": 4.624125539249463e-05,
      "loss": 1.52,
      "num_input_tokens_seen": 15800619264,
      "step": 20083
    },
    {
      "epoch": 2.1307023127519624,
      "grad_norm": 0.45364486399114007,
      "learning_rate": 4.6240888894793734e-05,
      "loss": 1.5759,
      "num_input_tokens_seen": 15801406144,
      "step": 20084
    },
    {
      "epoch": 2.130808402291534,
      "grad_norm": 0.6942382642234732,
      "learning_rate": 4.6240522380678506e-05,
      "loss": 1.5385,
      "num_input_tokens_seen": 15802192912,
      "step": 20085
    },
    {
      "epoch": 2.1309144918311054,
      "grad_norm": 0.46023965478686507,
      "learning_rate": 4.624015585014923e-05,
      "loss": 1.6533,
      "num_input_tokens_seen": 15802979584,
      "step": 20086
    },
    {
      "epoch": 2.131020581370677,
      "grad_norm": 0.48851030431635484,
      "learning_rate": 4.6239789303206184e-05,
      "loss": 1.536,
      "num_input_tokens_seen": 15803766464,
      "step": 20087
    },
    {
      "epoch": 2.1311266709102483,
      "grad_norm": 0.5716513993981912,
      "learning_rate": 4.6239422739849645e-05,
      "loss": 1.7021,
      "num_input_tokens_seen": 15804553152,
      "step": 20088
    },
    {
      "epoch": 2.13123276044982,
      "grad_norm": 0.3708053503334365,
      "learning_rate": 4.6239056160079905e-05,
      "loss": 1.6677,
      "num_input_tokens_seen": 15805339872,
      "step": 20089
    },
    {
      "epoch": 2.1313388499893913,
      "grad_norm": 0.6728086700891606,
      "learning_rate": 4.6238689563897255e-05,
      "loss": 1.6748,
      "num_input_tokens_seen": 15806126544,
      "step": 20090
    },
    {
      "epoch": 2.1314449395289623,
      "grad_norm": 0.4229859785426323,
      "learning_rate": 4.623832295130196e-05,
      "loss": 1.6405,
      "num_input_tokens_seen": 15806913392,
      "step": 20091
    },
    {
      "epoch": 2.1315510290685338,
      "grad_norm": 0.5126090137369718,
      "learning_rate": 4.6237956322294315e-05,
      "loss": 1.5474,
      "num_input_tokens_seen": 15807700176,
      "step": 20092
    },
    {
      "epoch": 2.1316571186081053,
      "grad_norm": 0.5733331357603052,
      "learning_rate": 4.62375896768746e-05,
      "loss": 1.6823,
      "num_input_tokens_seen": 15808486976,
      "step": 20093
    },
    {
      "epoch": 2.1317632081476767,
      "grad_norm": 0.4540463357634402,
      "learning_rate": 4.62372230150431e-05,
      "loss": 1.5437,
      "num_input_tokens_seen": 15809273712,
      "step": 20094
    },
    {
      "epoch": 2.131869297687248,
      "grad_norm": 0.5764236490039925,
      "learning_rate": 4.62368563368001e-05,
      "loss": 1.5647,
      "num_input_tokens_seen": 15810060528,
      "step": 20095
    },
    {
      "epoch": 2.1319753872268192,
      "grad_norm": 0.5031472019271248,
      "learning_rate": 4.6236489642145876e-05,
      "loss": 1.6462,
      "num_input_tokens_seen": 15810847264,
      "step": 20096
    },
    {
      "epoch": 2.1320814767663907,
      "grad_norm": 0.49510333919159294,
      "learning_rate": 4.6236122931080716e-05,
      "loss": 1.6057,
      "num_input_tokens_seen": 15811634112,
      "step": 20097
    },
    {
      "epoch": 2.132187566305962,
      "grad_norm": 0.4251165376862979,
      "learning_rate": 4.62357562036049e-05,
      "loss": 1.6522,
      "num_input_tokens_seen": 15812420816,
      "step": 20098
    },
    {
      "epoch": 2.1322936558455337,
      "grad_norm": 0.5028726657137679,
      "learning_rate": 4.623538945971873e-05,
      "loss": 1.7836,
      "num_input_tokens_seen": 15813207520,
      "step": 20099
    },
    {
      "epoch": 2.132399745385105,
      "grad_norm": 0.44906052089943693,
      "learning_rate": 4.623502269942246e-05,
      "loss": 1.7566,
      "num_input_tokens_seen": 15813994224,
      "step": 20100
    },
    {
      "epoch": 2.1325058349246766,
      "grad_norm": 0.38022411634054853,
      "learning_rate": 4.623465592271639e-05,
      "loss": 1.564,
      "num_input_tokens_seen": 15814781008,
      "step": 20101
    },
    {
      "epoch": 2.1326119244642476,
      "grad_norm": 0.3746312998415795,
      "learning_rate": 4.62342891296008e-05,
      "loss": 1.3683,
      "num_input_tokens_seen": 15815567824,
      "step": 20102
    },
    {
      "epoch": 2.132718014003819,
      "grad_norm": 0.3993133174589964,
      "learning_rate": 4.6233922320075975e-05,
      "loss": 1.6452,
      "num_input_tokens_seen": 15816354640,
      "step": 20103
    },
    {
      "epoch": 2.1328241035433906,
      "grad_norm": 0.3919764214208939,
      "learning_rate": 4.62335554941422e-05,
      "loss": 1.5782,
      "num_input_tokens_seen": 15817141488,
      "step": 20104
    },
    {
      "epoch": 2.132930193082962,
      "grad_norm": 0.4431370029620396,
      "learning_rate": 4.623318865179975e-05,
      "loss": 1.5894,
      "num_input_tokens_seen": 15817928352,
      "step": 20105
    },
    {
      "epoch": 2.1330362826225335,
      "grad_norm": 0.37820558039928637,
      "learning_rate": 4.623282179304892e-05,
      "loss": 1.5215,
      "num_input_tokens_seen": 15818715184,
      "step": 20106
    },
    {
      "epoch": 2.133142372162105,
      "grad_norm": 0.38479958342832815,
      "learning_rate": 4.6232454917889987e-05,
      "loss": 1.6398,
      "num_input_tokens_seen": 15819501984,
      "step": 20107
    },
    {
      "epoch": 2.133248461701676,
      "grad_norm": 0.44642530804858027,
      "learning_rate": 4.623208802632324e-05,
      "loss": 1.5811,
      "num_input_tokens_seen": 15820288816,
      "step": 20108
    },
    {
      "epoch": 2.1333545512412475,
      "grad_norm": 0.37529114107392997,
      "learning_rate": 4.623172111834896e-05,
      "loss": 1.5874,
      "num_input_tokens_seen": 15821075600,
      "step": 20109
    },
    {
      "epoch": 2.133460640780819,
      "grad_norm": 0.39186145879048173,
      "learning_rate": 4.623135419396742e-05,
      "loss": 1.648,
      "num_input_tokens_seen": 15821862384,
      "step": 20110
    },
    {
      "epoch": 2.1335667303203905,
      "grad_norm": 0.3567587100358949,
      "learning_rate": 4.6230987253178916e-05,
      "loss": 1.7192,
      "num_input_tokens_seen": 15822649040,
      "step": 20111
    },
    {
      "epoch": 2.133672819859962,
      "grad_norm": 0.3931549159805823,
      "learning_rate": 4.623062029598373e-05,
      "loss": 1.5472,
      "num_input_tokens_seen": 15823435728,
      "step": 20112
    },
    {
      "epoch": 2.1337789093995334,
      "grad_norm": 0.4103765922098457,
      "learning_rate": 4.6230253322382144e-05,
      "loss": 1.5993,
      "num_input_tokens_seen": 15824222464,
      "step": 20113
    },
    {
      "epoch": 2.1338849989391044,
      "grad_norm": 0.3890114891468812,
      "learning_rate": 4.622988633237444e-05,
      "loss": 1.6241,
      "num_input_tokens_seen": 15825009216,
      "step": 20114
    },
    {
      "epoch": 2.133991088478676,
      "grad_norm": 0.36263599083566966,
      "learning_rate": 4.6229519325960904e-05,
      "loss": 1.6106,
      "num_input_tokens_seen": 15825796048,
      "step": 20115
    },
    {
      "epoch": 2.1340971780182474,
      "grad_norm": 0.4105860867056514,
      "learning_rate": 4.622915230314181e-05,
      "loss": 1.7829,
      "num_input_tokens_seen": 15826582736,
      "step": 20116
    },
    {
      "epoch": 2.134203267557819,
      "grad_norm": 0.37716301834936783,
      "learning_rate": 4.622878526391746e-05,
      "loss": 1.673,
      "num_input_tokens_seen": 15827369456,
      "step": 20117
    },
    {
      "epoch": 2.1343093570973903,
      "grad_norm": 0.3154276370087539,
      "learning_rate": 4.622841820828813e-05,
      "loss": 1.5862,
      "num_input_tokens_seen": 15828156320,
      "step": 20118
    },
    {
      "epoch": 2.134415446636962,
      "grad_norm": 0.6515744017615708,
      "learning_rate": 4.622805113625409e-05,
      "loss": 1.6425,
      "num_input_tokens_seen": 15828942928,
      "step": 20119
    },
    {
      "epoch": 2.134521536176533,
      "grad_norm": 0.5945508021039259,
      "learning_rate": 4.622768404781564e-05,
      "loss": 1.7331,
      "num_input_tokens_seen": 15829729680,
      "step": 20120
    },
    {
      "epoch": 2.1346276257161043,
      "grad_norm": 0.6186308796900172,
      "learning_rate": 4.6227316942973056e-05,
      "loss": 1.6316,
      "num_input_tokens_seen": 15830516368,
      "step": 20121
    },
    {
      "epoch": 2.134733715255676,
      "grad_norm": 0.5001936462271409,
      "learning_rate": 4.622694982172663e-05,
      "loss": 1.671,
      "num_input_tokens_seen": 15831303024,
      "step": 20122
    },
    {
      "epoch": 2.1348398047952473,
      "grad_norm": 0.7558860174656595,
      "learning_rate": 4.6226582684076635e-05,
      "loss": 1.6126,
      "num_input_tokens_seen": 15832089856,
      "step": 20123
    },
    {
      "epoch": 2.1349458943348187,
      "grad_norm": 0.5331373765926394,
      "learning_rate": 4.622621553002337e-05,
      "loss": 1.5865,
      "num_input_tokens_seen": 15832876624,
      "step": 20124
    },
    {
      "epoch": 2.1350519838743898,
      "grad_norm": 0.6757664467279051,
      "learning_rate": 4.62258483595671e-05,
      "loss": 1.7037,
      "num_input_tokens_seen": 15833663376,
      "step": 20125
    },
    {
      "epoch": 2.1351580734139612,
      "grad_norm": 0.6200212858827571,
      "learning_rate": 4.6225481172708115e-05,
      "loss": 1.6684,
      "num_input_tokens_seen": 15834450240,
      "step": 20126
    },
    {
      "epoch": 2.1352641629535327,
      "grad_norm": 0.48078662361159596,
      "learning_rate": 4.6225113969446706e-05,
      "loss": 1.6537,
      "num_input_tokens_seen": 15835236992,
      "step": 20127
    },
    {
      "epoch": 2.135370252493104,
      "grad_norm": 0.5271351443413276,
      "learning_rate": 4.622474674978314e-05,
      "loss": 1.6282,
      "num_input_tokens_seen": 15836023728,
      "step": 20128
    },
    {
      "epoch": 2.1354763420326757,
      "grad_norm": 0.41853827508155006,
      "learning_rate": 4.622437951371773e-05,
      "loss": 1.6716,
      "num_input_tokens_seen": 15836810560,
      "step": 20129
    },
    {
      "epoch": 2.135582431572247,
      "grad_norm": 0.37630074821874593,
      "learning_rate": 4.622401226125074e-05,
      "loss": 1.5793,
      "num_input_tokens_seen": 15837597328,
      "step": 20130
    },
    {
      "epoch": 2.135688521111818,
      "grad_norm": 0.4004420088472969,
      "learning_rate": 4.622364499238244e-05,
      "loss": 1.5553,
      "num_input_tokens_seen": 15838384128,
      "step": 20131
    },
    {
      "epoch": 2.1357946106513896,
      "grad_norm": 0.4565177429453647,
      "learning_rate": 4.6223277707113146e-05,
      "loss": 1.6753,
      "num_input_tokens_seen": 15839170832,
      "step": 20132
    },
    {
      "epoch": 2.135900700190961,
      "grad_norm": 0.4360691988066781,
      "learning_rate": 4.622291040544312e-05,
      "loss": 1.6038,
      "num_input_tokens_seen": 15839957616,
      "step": 20133
    },
    {
      "epoch": 2.1360067897305326,
      "grad_norm": 0.4562230650897987,
      "learning_rate": 4.622254308737265e-05,
      "loss": 1.6127,
      "num_input_tokens_seen": 15840744304,
      "step": 20134
    },
    {
      "epoch": 2.136112879270104,
      "grad_norm": 0.45633517370775256,
      "learning_rate": 4.6222175752902024e-05,
      "loss": 1.6538,
      "num_input_tokens_seen": 15841530992,
      "step": 20135
    },
    {
      "epoch": 2.1362189688096755,
      "grad_norm": 0.39361128351884217,
      "learning_rate": 4.622180840203152e-05,
      "loss": 1.6705,
      "num_input_tokens_seen": 15842317728,
      "step": 20136
    },
    {
      "epoch": 2.1363250583492466,
      "grad_norm": 0.3737103481413151,
      "learning_rate": 4.622144103476143e-05,
      "loss": 1.5707,
      "num_input_tokens_seen": 15843104576,
      "step": 20137
    },
    {
      "epoch": 2.136431147888818,
      "grad_norm": 0.41539664529284304,
      "learning_rate": 4.622107365109203e-05,
      "loss": 1.628,
      "num_input_tokens_seen": 15843891392,
      "step": 20138
    },
    {
      "epoch": 2.1365372374283895,
      "grad_norm": 0.3397296172532956,
      "learning_rate": 4.622070625102361e-05,
      "loss": 1.5413,
      "num_input_tokens_seen": 15844678176,
      "step": 20139
    },
    {
      "epoch": 2.136643326967961,
      "grad_norm": 0.3702510407241392,
      "learning_rate": 4.622033883455644e-05,
      "loss": 1.6542,
      "num_input_tokens_seen": 15845464912,
      "step": 20140
    },
    {
      "epoch": 2.1367494165075325,
      "grad_norm": 0.35830339568872244,
      "learning_rate": 4.621997140169083e-05,
      "loss": 1.5671,
      "num_input_tokens_seen": 15846251600,
      "step": 20141
    },
    {
      "epoch": 2.136855506047104,
      "grad_norm": 0.31397786089040725,
      "learning_rate": 4.6219603952427036e-05,
      "loss": 1.5629,
      "num_input_tokens_seen": 15847038288,
      "step": 20142
    },
    {
      "epoch": 2.136961595586675,
      "grad_norm": 0.34993575738839,
      "learning_rate": 4.6219236486765364e-05,
      "loss": 1.4985,
      "num_input_tokens_seen": 15847825056,
      "step": 20143
    },
    {
      "epoch": 2.1370676851262465,
      "grad_norm": 0.34795630096975655,
      "learning_rate": 4.621886900470608e-05,
      "loss": 1.5046,
      "num_input_tokens_seen": 15848611824,
      "step": 20144
    },
    {
      "epoch": 2.137173774665818,
      "grad_norm": 0.35511253739276,
      "learning_rate": 4.621850150624949e-05,
      "loss": 1.5688,
      "num_input_tokens_seen": 15849398560,
      "step": 20145
    },
    {
      "epoch": 2.1372798642053894,
      "grad_norm": 0.3347996041312497,
      "learning_rate": 4.621813399139585e-05,
      "loss": 1.5596,
      "num_input_tokens_seen": 15850185392,
      "step": 20146
    },
    {
      "epoch": 2.137385953744961,
      "grad_norm": 0.38611819323955443,
      "learning_rate": 4.621776646014547e-05,
      "loss": 1.6339,
      "num_input_tokens_seen": 15850972112,
      "step": 20147
    },
    {
      "epoch": 2.1374920432845324,
      "grad_norm": 0.34739375609617595,
      "learning_rate": 4.6217398912498616e-05,
      "loss": 1.5485,
      "num_input_tokens_seen": 15851758848,
      "step": 20148
    },
    {
      "epoch": 2.1375981328241034,
      "grad_norm": 0.3971064809927518,
      "learning_rate": 4.621703134845558e-05,
      "loss": 1.5999,
      "num_input_tokens_seen": 15852545632,
      "step": 20149
    },
    {
      "epoch": 2.137704222363675,
      "grad_norm": 0.40100645451984335,
      "learning_rate": 4.6216663768016645e-05,
      "loss": 1.5673,
      "num_input_tokens_seen": 15853332416,
      "step": 20150
    },
    {
      "epoch": 2.1378103119032463,
      "grad_norm": 0.38784928054191753,
      "learning_rate": 4.6216296171182095e-05,
      "loss": 1.5879,
      "num_input_tokens_seen": 15854119248,
      "step": 20151
    },
    {
      "epoch": 2.137916401442818,
      "grad_norm": 0.4043132359039396,
      "learning_rate": 4.621592855795221e-05,
      "loss": 1.5141,
      "num_input_tokens_seen": 15854905952,
      "step": 20152
    },
    {
      "epoch": 2.1380224909823893,
      "grad_norm": 0.38304801301319585,
      "learning_rate": 4.621556092832728e-05,
      "loss": 1.538,
      "num_input_tokens_seen": 15855692720,
      "step": 20153
    },
    {
      "epoch": 2.1381285805219603,
      "grad_norm": 0.6866320126679794,
      "learning_rate": 4.621519328230759e-05,
      "loss": 1.6558,
      "num_input_tokens_seen": 15856479472,
      "step": 20154
    },
    {
      "epoch": 2.138234670061532,
      "grad_norm": 0.7364517080953453,
      "learning_rate": 4.621482561989342e-05,
      "loss": 1.5614,
      "num_input_tokens_seen": 15857266240,
      "step": 20155
    },
    {
      "epoch": 2.1383407596011033,
      "grad_norm": 0.4425587107351731,
      "learning_rate": 4.621445794108505e-05,
      "loss": 1.5832,
      "num_input_tokens_seen": 15858052976,
      "step": 20156
    },
    {
      "epoch": 2.1384468491406747,
      "grad_norm": 0.41850137478433364,
      "learning_rate": 4.6214090245882776e-05,
      "loss": 1.6091,
      "num_input_tokens_seen": 15858839680,
      "step": 20157
    },
    {
      "epoch": 2.138552938680246,
      "grad_norm": 0.7125543328910857,
      "learning_rate": 4.6213722534286877e-05,
      "loss": 1.6615,
      "num_input_tokens_seen": 15859626400,
      "step": 20158
    },
    {
      "epoch": 2.1386590282198177,
      "grad_norm": 0.5007477030849157,
      "learning_rate": 4.6213354806297637e-05,
      "loss": 1.592,
      "num_input_tokens_seen": 15860413120,
      "step": 20159
    },
    {
      "epoch": 2.138765117759389,
      "grad_norm": 0.43704409691157725,
      "learning_rate": 4.6212987061915334e-05,
      "loss": 1.5222,
      "num_input_tokens_seen": 15861199904,
      "step": 20160
    },
    {
      "epoch": 2.13887120729896,
      "grad_norm": 0.47686149950201695,
      "learning_rate": 4.621261930114026e-05,
      "loss": 1.5561,
      "num_input_tokens_seen": 15861986688,
      "step": 20161
    },
    {
      "epoch": 2.1389772968385317,
      "grad_norm": 0.41266813226817795,
      "learning_rate": 4.621225152397269e-05,
      "loss": 1.6529,
      "num_input_tokens_seen": 15862773472,
      "step": 20162
    },
    {
      "epoch": 2.139083386378103,
      "grad_norm": 0.4069185263211897,
      "learning_rate": 4.621188373041292e-05,
      "loss": 1.5747,
      "num_input_tokens_seen": 15863560240,
      "step": 20163
    },
    {
      "epoch": 2.1391894759176746,
      "grad_norm": 0.42908554219822886,
      "learning_rate": 4.621151592046122e-05,
      "loss": 1.6568,
      "num_input_tokens_seen": 15864347056,
      "step": 20164
    },
    {
      "epoch": 2.139295565457246,
      "grad_norm": 0.3625580383060628,
      "learning_rate": 4.6211148094117897e-05,
      "loss": 1.5111,
      "num_input_tokens_seen": 15865133792,
      "step": 20165
    },
    {
      "epoch": 2.139401654996817,
      "grad_norm": 0.36366404146665476,
      "learning_rate": 4.621078025138321e-05,
      "loss": 1.5858,
      "num_input_tokens_seen": 15865920560,
      "step": 20166
    },
    {
      "epoch": 2.1395077445363886,
      "grad_norm": 0.37070251992165537,
      "learning_rate": 4.6210412392257455e-05,
      "loss": 1.676,
      "num_input_tokens_seen": 15866707296,
      "step": 20167
    },
    {
      "epoch": 2.13961383407596,
      "grad_norm": 0.3605437575114111,
      "learning_rate": 4.621004451674093e-05,
      "loss": 1.5802,
      "num_input_tokens_seen": 15867494032,
      "step": 20168
    },
    {
      "epoch": 2.1397199236155315,
      "grad_norm": 0.3415183203390277,
      "learning_rate": 4.6209676624833884e-05,
      "loss": 1.5834,
      "num_input_tokens_seen": 15868280896,
      "step": 20169
    },
    {
      "epoch": 2.139826013155103,
      "grad_norm": 0.3434242447761227,
      "learning_rate": 4.620930871653664e-05,
      "loss": 1.6075,
      "num_input_tokens_seen": 15869067584,
      "step": 20170
    },
    {
      "epoch": 2.1399321026946745,
      "grad_norm": 0.33739747721261626,
      "learning_rate": 4.6208940791849456e-05,
      "loss": 1.571,
      "num_input_tokens_seen": 15869854304,
      "step": 20171
    },
    {
      "epoch": 2.1400381922342455,
      "grad_norm": 0.3552436505172069,
      "learning_rate": 4.620857285077262e-05,
      "loss": 1.6067,
      "num_input_tokens_seen": 15870641072,
      "step": 20172
    },
    {
      "epoch": 2.140144281773817,
      "grad_norm": 0.4282805630246644,
      "learning_rate": 4.6208204893306425e-05,
      "loss": 1.6395,
      "num_input_tokens_seen": 15871427856,
      "step": 20173
    },
    {
      "epoch": 2.1402503713133885,
      "grad_norm": 0.3736913784561744,
      "learning_rate": 4.6207836919451154e-05,
      "loss": 1.5136,
      "num_input_tokens_seen": 15872214624,
      "step": 20174
    },
    {
      "epoch": 2.14035646085296,
      "grad_norm": 0.38803582459291197,
      "learning_rate": 4.620746892920709e-05,
      "loss": 1.8016,
      "num_input_tokens_seen": 15873001376,
      "step": 20175
    },
    {
      "epoch": 2.1404625503925314,
      "grad_norm": 0.3569307407169177,
      "learning_rate": 4.620710092257451e-05,
      "loss": 1.6721,
      "num_input_tokens_seen": 15873788128,
      "step": 20176
    },
    {
      "epoch": 2.140568639932103,
      "grad_norm": 0.3336404301336184,
      "learning_rate": 4.620673289955371e-05,
      "loss": 1.6532,
      "num_input_tokens_seen": 15874574960,
      "step": 20177
    },
    {
      "epoch": 2.140674729471674,
      "grad_norm": 0.38493330956674515,
      "learning_rate": 4.620636486014497e-05,
      "loss": 1.4407,
      "num_input_tokens_seen": 15875361792,
      "step": 20178
    },
    {
      "epoch": 2.1407808190112454,
      "grad_norm": 0.4046898427934564,
      "learning_rate": 4.620599680434857e-05,
      "loss": 1.6229,
      "num_input_tokens_seen": 15876148528,
      "step": 20179
    },
    {
      "epoch": 2.140886908550817,
      "grad_norm": 0.34057852518375303,
      "learning_rate": 4.62056287321648e-05,
      "loss": 1.4951,
      "num_input_tokens_seen": 15876935216,
      "step": 20180
    },
    {
      "epoch": 2.1409929980903883,
      "grad_norm": 0.37998442473174193,
      "learning_rate": 4.6205260643593936e-05,
      "loss": 1.513,
      "num_input_tokens_seen": 15877721920,
      "step": 20181
    },
    {
      "epoch": 2.14109908762996,
      "grad_norm": 0.3859699075949142,
      "learning_rate": 4.620489253863628e-05,
      "loss": 1.4389,
      "num_input_tokens_seen": 15878508768,
      "step": 20182
    },
    {
      "epoch": 2.141205177169531,
      "grad_norm": 0.5878453205763697,
      "learning_rate": 4.62045244172921e-05,
      "loss": 1.5167,
      "num_input_tokens_seen": 15879295488,
      "step": 20183
    },
    {
      "epoch": 2.1413112667091023,
      "grad_norm": 0.3859704619874292,
      "learning_rate": 4.6204156279561686e-05,
      "loss": 1.6662,
      "num_input_tokens_seen": 15880082240,
      "step": 20184
    },
    {
      "epoch": 2.141417356248674,
      "grad_norm": 0.4059507089274069,
      "learning_rate": 4.6203788125445315e-05,
      "loss": 1.6122,
      "num_input_tokens_seen": 15880869040,
      "step": 20185
    },
    {
      "epoch": 2.1415234457882453,
      "grad_norm": 0.46445220154058087,
      "learning_rate": 4.620341995494329e-05,
      "loss": 1.6345,
      "num_input_tokens_seen": 15881655808,
      "step": 20186
    },
    {
      "epoch": 2.1416295353278167,
      "grad_norm": 0.3894192718411072,
      "learning_rate": 4.620305176805588e-05,
      "loss": 1.7571,
      "num_input_tokens_seen": 15882442576,
      "step": 20187
    },
    {
      "epoch": 2.141735624867388,
      "grad_norm": 0.5373233359523896,
      "learning_rate": 4.620268356478337e-05,
      "loss": 1.7361,
      "num_input_tokens_seen": 15883229248,
      "step": 20188
    },
    {
      "epoch": 2.1418417144069597,
      "grad_norm": 0.42351666163225493,
      "learning_rate": 4.620231534512606e-05,
      "loss": 1.6219,
      "num_input_tokens_seen": 15884015968,
      "step": 20189
    },
    {
      "epoch": 2.1419478039465307,
      "grad_norm": 0.4087375752081357,
      "learning_rate": 4.620194710908421e-05,
      "loss": 1.5986,
      "num_input_tokens_seen": 15884802704,
      "step": 20190
    },
    {
      "epoch": 2.142053893486102,
      "grad_norm": 0.37548619855197274,
      "learning_rate": 4.620157885665812e-05,
      "loss": 1.657,
      "num_input_tokens_seen": 15885589360,
      "step": 20191
    },
    {
      "epoch": 2.1421599830256737,
      "grad_norm": 0.4207581853876732,
      "learning_rate": 4.620121058784808e-05,
      "loss": 1.6548,
      "num_input_tokens_seen": 15886376176,
      "step": 20192
    },
    {
      "epoch": 2.142266072565245,
      "grad_norm": 0.37703771320145757,
      "learning_rate": 4.6200842302654354e-05,
      "loss": 1.603,
      "num_input_tokens_seen": 15887162880,
      "step": 20193
    },
    {
      "epoch": 2.1423721621048166,
      "grad_norm": 0.45980055060199265,
      "learning_rate": 4.6200474001077244e-05,
      "loss": 1.51,
      "num_input_tokens_seen": 15887949600,
      "step": 20194
    },
    {
      "epoch": 2.1424782516443877,
      "grad_norm": 0.35482503083932193,
      "learning_rate": 4.6200105683117034e-05,
      "loss": 1.6937,
      "num_input_tokens_seen": 15888736352,
      "step": 20195
    },
    {
      "epoch": 2.142584341183959,
      "grad_norm": 0.46057416362651105,
      "learning_rate": 4.6199737348773994e-05,
      "loss": 1.8173,
      "num_input_tokens_seen": 15889523168,
      "step": 20196
    },
    {
      "epoch": 2.1426904307235306,
      "grad_norm": 0.4102022710629162,
      "learning_rate": 4.619936899804843e-05,
      "loss": 1.6953,
      "num_input_tokens_seen": 15890309856,
      "step": 20197
    },
    {
      "epoch": 2.142796520263102,
      "grad_norm": 0.515065637658694,
      "learning_rate": 4.6199000630940615e-05,
      "loss": 1.5411,
      "num_input_tokens_seen": 15891096608,
      "step": 20198
    },
    {
      "epoch": 2.1429026098026736,
      "grad_norm": 0.3968887277714994,
      "learning_rate": 4.619863224745083e-05,
      "loss": 1.4904,
      "num_input_tokens_seen": 15891883408,
      "step": 20199
    },
    {
      "epoch": 2.143008699342245,
      "grad_norm": 0.48699645176463313,
      "learning_rate": 4.6198263847579365e-05,
      "loss": 1.4991,
      "num_input_tokens_seen": 15892670256,
      "step": 20200
    },
    {
      "epoch": 2.143114788881816,
      "grad_norm": 0.4261719333882216,
      "learning_rate": 4.6197895431326504e-05,
      "loss": 1.7284,
      "num_input_tokens_seen": 15893456992,
      "step": 20201
    },
    {
      "epoch": 2.1432208784213875,
      "grad_norm": 0.4155199382133139,
      "learning_rate": 4.6197526998692533e-05,
      "loss": 1.5788,
      "num_input_tokens_seen": 15894243728,
      "step": 20202
    },
    {
      "epoch": 2.143326967960959,
      "grad_norm": 0.47510451400442943,
      "learning_rate": 4.619715854967773e-05,
      "loss": 1.5089,
      "num_input_tokens_seen": 15895030512,
      "step": 20203
    },
    {
      "epoch": 2.1434330575005305,
      "grad_norm": 0.47118543341923586,
      "learning_rate": 4.619679008428239e-05,
      "loss": 1.778,
      "num_input_tokens_seen": 15895817248,
      "step": 20204
    },
    {
      "epoch": 2.143539147040102,
      "grad_norm": 0.4005138835235418,
      "learning_rate": 4.619642160250679e-05,
      "loss": 1.5693,
      "num_input_tokens_seen": 15896604048,
      "step": 20205
    },
    {
      "epoch": 2.1436452365796734,
      "grad_norm": 0.4312695147813082,
      "learning_rate": 4.619605310435122e-05,
      "loss": 1.5771,
      "num_input_tokens_seen": 15897390816,
      "step": 20206
    },
    {
      "epoch": 2.1437513261192445,
      "grad_norm": 0.4328036571977942,
      "learning_rate": 4.6195684589815955e-05,
      "loss": 1.6899,
      "num_input_tokens_seen": 15898177472,
      "step": 20207
    },
    {
      "epoch": 2.143857415658816,
      "grad_norm": 0.4447793815099321,
      "learning_rate": 4.6195316058901294e-05,
      "loss": 1.5728,
      "num_input_tokens_seen": 15898964320,
      "step": 20208
    },
    {
      "epoch": 2.1439635051983874,
      "grad_norm": 0.416003233286135,
      "learning_rate": 4.6194947511607516e-05,
      "loss": 1.5553,
      "num_input_tokens_seen": 15899751136,
      "step": 20209
    },
    {
      "epoch": 2.144069594737959,
      "grad_norm": 0.47510543542171096,
      "learning_rate": 4.61945789479349e-05,
      "loss": 1.5817,
      "num_input_tokens_seen": 15900537856,
      "step": 20210
    },
    {
      "epoch": 2.1441756842775304,
      "grad_norm": 0.4409365231007337,
      "learning_rate": 4.619421036788374e-05,
      "loss": 1.686,
      "num_input_tokens_seen": 15901324624,
      "step": 20211
    },
    {
      "epoch": 2.144281773817102,
      "grad_norm": 0.4007090990101321,
      "learning_rate": 4.619384177145431e-05,
      "loss": 1.5852,
      "num_input_tokens_seen": 15902111440,
      "step": 20212
    },
    {
      "epoch": 2.144387863356673,
      "grad_norm": 0.44983335012100717,
      "learning_rate": 4.61934731586469e-05,
      "loss": 1.6715,
      "num_input_tokens_seen": 15902898208,
      "step": 20213
    },
    {
      "epoch": 2.1444939528962443,
      "grad_norm": 0.3753985472005816,
      "learning_rate": 4.6193104529461804e-05,
      "loss": 1.6417,
      "num_input_tokens_seen": 15903684976,
      "step": 20214
    },
    {
      "epoch": 2.144600042435816,
      "grad_norm": 0.43170790630631,
      "learning_rate": 4.6192735883899295e-05,
      "loss": 1.5604,
      "num_input_tokens_seen": 15904471792,
      "step": 20215
    },
    {
      "epoch": 2.1447061319753873,
      "grad_norm": 0.40097093073707785,
      "learning_rate": 4.619236722195966e-05,
      "loss": 1.693,
      "num_input_tokens_seen": 15905258608,
      "step": 20216
    },
    {
      "epoch": 2.1448122215149588,
      "grad_norm": 0.444722525065066,
      "learning_rate": 4.619199854364319e-05,
      "loss": 1.6133,
      "num_input_tokens_seen": 15906045360,
      "step": 20217
    },
    {
      "epoch": 2.1449183110545302,
      "grad_norm": 0.35986645588733973,
      "learning_rate": 4.6191629848950155e-05,
      "loss": 1.5962,
      "num_input_tokens_seen": 15906832128,
      "step": 20218
    },
    {
      "epoch": 2.1450244005941013,
      "grad_norm": 0.4114145367914365,
      "learning_rate": 4.6191261137880856e-05,
      "loss": 1.6416,
      "num_input_tokens_seen": 15907618912,
      "step": 20219
    },
    {
      "epoch": 2.1451304901336727,
      "grad_norm": 0.5288310130965471,
      "learning_rate": 4.619089241043558e-05,
      "loss": 1.6892,
      "num_input_tokens_seen": 15908405664,
      "step": 20220
    },
    {
      "epoch": 2.145236579673244,
      "grad_norm": 0.5412269859384412,
      "learning_rate": 4.619052366661459e-05,
      "loss": 1.567,
      "num_input_tokens_seen": 15909192480,
      "step": 20221
    },
    {
      "epoch": 2.1453426692128157,
      "grad_norm": 0.5822736986435714,
      "learning_rate": 4.6190154906418195e-05,
      "loss": 1.6197,
      "num_input_tokens_seen": 15909979296,
      "step": 20222
    },
    {
      "epoch": 2.145448758752387,
      "grad_norm": 0.4403798794816779,
      "learning_rate": 4.6189786129846666e-05,
      "loss": 1.5874,
      "num_input_tokens_seen": 15910766144,
      "step": 20223
    },
    {
      "epoch": 2.145554848291958,
      "grad_norm": 0.5337128197671281,
      "learning_rate": 4.6189417336900296e-05,
      "loss": 1.4681,
      "num_input_tokens_seen": 15911553024,
      "step": 20224
    },
    {
      "epoch": 2.1456609378315297,
      "grad_norm": 0.4728007117968935,
      "learning_rate": 4.618904852757936e-05,
      "loss": 1.6407,
      "num_input_tokens_seen": 15912339808,
      "step": 20225
    },
    {
      "epoch": 2.145767027371101,
      "grad_norm": 0.4979477927702237,
      "learning_rate": 4.618867970188415e-05,
      "loss": 1.5879,
      "num_input_tokens_seen": 15913126512,
      "step": 20226
    },
    {
      "epoch": 2.1458731169106726,
      "grad_norm": 0.4157994403092615,
      "learning_rate": 4.618831085981495e-05,
      "loss": 1.5966,
      "num_input_tokens_seen": 15913913248,
      "step": 20227
    },
    {
      "epoch": 2.145979206450244,
      "grad_norm": 0.47146105665613885,
      "learning_rate": 4.618794200137205e-05,
      "loss": 1.5306,
      "num_input_tokens_seen": 15914700032,
      "step": 20228
    },
    {
      "epoch": 2.1460852959898156,
      "grad_norm": 0.42426807809238626,
      "learning_rate": 4.6187573126555725e-05,
      "loss": 1.5281,
      "num_input_tokens_seen": 15915486800,
      "step": 20229
    },
    {
      "epoch": 2.1461913855293866,
      "grad_norm": 0.40256636664421497,
      "learning_rate": 4.618720423536628e-05,
      "loss": 1.6294,
      "num_input_tokens_seen": 15916273584,
      "step": 20230
    },
    {
      "epoch": 2.146297475068958,
      "grad_norm": 0.4808043036010875,
      "learning_rate": 4.6186835327803965e-05,
      "loss": 1.5378,
      "num_input_tokens_seen": 15917060384,
      "step": 20231
    },
    {
      "epoch": 2.1464035646085295,
      "grad_norm": 0.4019318288009054,
      "learning_rate": 4.618646640386909e-05,
      "loss": 1.553,
      "num_input_tokens_seen": 15917847120,
      "step": 20232
    },
    {
      "epoch": 2.146509654148101,
      "grad_norm": 0.4221577601885114,
      "learning_rate": 4.618609746356194e-05,
      "loss": 1.637,
      "num_input_tokens_seen": 15918633936,
      "step": 20233
    },
    {
      "epoch": 2.1466157436876725,
      "grad_norm": 0.5046645470498862,
      "learning_rate": 4.6185728506882795e-05,
      "loss": 1.6439,
      "num_input_tokens_seen": 15919420656,
      "step": 20234
    },
    {
      "epoch": 2.146721833227244,
      "grad_norm": 0.41594863888909805,
      "learning_rate": 4.618535953383194e-05,
      "loss": 1.576,
      "num_input_tokens_seen": 15920207456,
      "step": 20235
    },
    {
      "epoch": 2.146827922766815,
      "grad_norm": 0.47225456653099146,
      "learning_rate": 4.618499054440966e-05,
      "loss": 1.6552,
      "num_input_tokens_seen": 15920994160,
      "step": 20236
    },
    {
      "epoch": 2.1469340123063865,
      "grad_norm": 0.42911120672179087,
      "learning_rate": 4.6184621538616246e-05,
      "loss": 1.6278,
      "num_input_tokens_seen": 15921780944,
      "step": 20237
    },
    {
      "epoch": 2.147040101845958,
      "grad_norm": 0.47209606608542126,
      "learning_rate": 4.618425251645197e-05,
      "loss": 1.5843,
      "num_input_tokens_seen": 15922567664,
      "step": 20238
    },
    {
      "epoch": 2.1471461913855294,
      "grad_norm": 0.379910120928357,
      "learning_rate": 4.6183883477917134e-05,
      "loss": 1.5514,
      "num_input_tokens_seen": 15923354400,
      "step": 20239
    },
    {
      "epoch": 2.147252280925101,
      "grad_norm": 0.36165816010786644,
      "learning_rate": 4.6183514423012e-05,
      "loss": 1.5757,
      "num_input_tokens_seen": 15924141184,
      "step": 20240
    },
    {
      "epoch": 2.1473583704646724,
      "grad_norm": 0.36806516218122165,
      "learning_rate": 4.618314535173688e-05,
      "loss": 1.5689,
      "num_input_tokens_seen": 15924927808,
      "step": 20241
    },
    {
      "epoch": 2.1474644600042434,
      "grad_norm": 0.40252242926975784,
      "learning_rate": 4.618277626409204e-05,
      "loss": 1.7335,
      "num_input_tokens_seen": 15925714528,
      "step": 20242
    },
    {
      "epoch": 2.147570549543815,
      "grad_norm": 0.48814693116648533,
      "learning_rate": 4.618240716007778e-05,
      "loss": 1.6612,
      "num_input_tokens_seen": 15926501344,
      "step": 20243
    },
    {
      "epoch": 2.1476766390833864,
      "grad_norm": 0.3903354348978124,
      "learning_rate": 4.618203803969437e-05,
      "loss": 1.6917,
      "num_input_tokens_seen": 15927288192,
      "step": 20244
    },
    {
      "epoch": 2.147782728622958,
      "grad_norm": 0.4726076844495758,
      "learning_rate": 4.618166890294211e-05,
      "loss": 1.5702,
      "num_input_tokens_seen": 15928074960,
      "step": 20245
    },
    {
      "epoch": 2.1478888181625293,
      "grad_norm": 0.42803362693513736,
      "learning_rate": 4.6181299749821275e-05,
      "loss": 1.7577,
      "num_input_tokens_seen": 15928861712,
      "step": 20246
    },
    {
      "epoch": 2.1479949077021008,
      "grad_norm": 0.389945575864249,
      "learning_rate": 4.618093058033215e-05,
      "loss": 1.5379,
      "num_input_tokens_seen": 15929648464,
      "step": 20247
    },
    {
      "epoch": 2.148100997241672,
      "grad_norm": 0.49578886175116477,
      "learning_rate": 4.6180561394475024e-05,
      "loss": 1.5288,
      "num_input_tokens_seen": 15930435248,
      "step": 20248
    },
    {
      "epoch": 2.1482070867812433,
      "grad_norm": 0.44337567423394725,
      "learning_rate": 4.618019219225018e-05,
      "loss": 1.6818,
      "num_input_tokens_seen": 15931222064,
      "step": 20249
    },
    {
      "epoch": 2.1483131763208148,
      "grad_norm": 0.5875162250739432,
      "learning_rate": 4.61798229736579e-05,
      "loss": 1.5607,
      "num_input_tokens_seen": 15932008864,
      "step": 20250
    },
    {
      "epoch": 2.1484192658603862,
      "grad_norm": 0.46180900799785374,
      "learning_rate": 4.617945373869849e-05,
      "loss": 1.6655,
      "num_input_tokens_seen": 15932795600,
      "step": 20251
    },
    {
      "epoch": 2.1485253553999577,
      "grad_norm": 0.5268741679357801,
      "learning_rate": 4.617908448737222e-05,
      "loss": 1.5594,
      "num_input_tokens_seen": 15933582448,
      "step": 20252
    },
    {
      "epoch": 2.1486314449395287,
      "grad_norm": 0.5112807876862426,
      "learning_rate": 4.617871521967936e-05,
      "loss": 1.7593,
      "num_input_tokens_seen": 15934369168,
      "step": 20253
    },
    {
      "epoch": 2.1487375344791,
      "grad_norm": 0.504155916447811,
      "learning_rate": 4.6178345935620214e-05,
      "loss": 1.6655,
      "num_input_tokens_seen": 15935155920,
      "step": 20254
    },
    {
      "epoch": 2.1488436240186717,
      "grad_norm": 0.47271321276874373,
      "learning_rate": 4.617797663519506e-05,
      "loss": 1.6066,
      "num_input_tokens_seen": 15935942672,
      "step": 20255
    },
    {
      "epoch": 2.148949713558243,
      "grad_norm": 0.3684308735440556,
      "learning_rate": 4.61776073184042e-05,
      "loss": 1.4834,
      "num_input_tokens_seen": 15936729520,
      "step": 20256
    },
    {
      "epoch": 2.1490558030978146,
      "grad_norm": 0.37487532309667865,
      "learning_rate": 4.61772379852479e-05,
      "loss": 1.6059,
      "num_input_tokens_seen": 15937516336,
      "step": 20257
    },
    {
      "epoch": 2.149161892637386,
      "grad_norm": 0.35883020310890185,
      "learning_rate": 4.6176868635726444e-05,
      "loss": 1.4542,
      "num_input_tokens_seen": 15938303152,
      "step": 20258
    },
    {
      "epoch": 2.1492679821769576,
      "grad_norm": 0.41741395198462156,
      "learning_rate": 4.617649926984013e-05,
      "loss": 1.6817,
      "num_input_tokens_seen": 15939089904,
      "step": 20259
    },
    {
      "epoch": 2.1493740717165286,
      "grad_norm": 0.46969478438732726,
      "learning_rate": 4.617612988758925e-05,
      "loss": 1.6107,
      "num_input_tokens_seen": 15939876768,
      "step": 20260
    },
    {
      "epoch": 2.1494801612561,
      "grad_norm": 0.4162985219998576,
      "learning_rate": 4.6175760488974065e-05,
      "loss": 1.6712,
      "num_input_tokens_seen": 15940663456,
      "step": 20261
    },
    {
      "epoch": 2.1495862507956716,
      "grad_norm": 0.45806494255171415,
      "learning_rate": 4.617539107399488e-05,
      "loss": 1.5321,
      "num_input_tokens_seen": 15941450224,
      "step": 20262
    },
    {
      "epoch": 2.149692340335243,
      "grad_norm": 0.38455889591538445,
      "learning_rate": 4.617502164265197e-05,
      "loss": 1.4567,
      "num_input_tokens_seen": 15942237056,
      "step": 20263
    },
    {
      "epoch": 2.1497984298748145,
      "grad_norm": 0.44264316001896237,
      "learning_rate": 4.6174652194945635e-05,
      "loss": 1.6938,
      "num_input_tokens_seen": 15943023776,
      "step": 20264
    },
    {
      "epoch": 2.1499045194143855,
      "grad_norm": 0.40566911600647926,
      "learning_rate": 4.617428273087614e-05,
      "loss": 1.5965,
      "num_input_tokens_seen": 15943810560,
      "step": 20265
    },
    {
      "epoch": 2.150010608953957,
      "grad_norm": 0.45360954941369513,
      "learning_rate": 4.617391325044378e-05,
      "loss": 1.5253,
      "num_input_tokens_seen": 15944597312,
      "step": 20266
    },
    {
      "epoch": 2.1501166984935285,
      "grad_norm": 0.3690724892059821,
      "learning_rate": 4.617354375364884e-05,
      "loss": 1.6324,
      "num_input_tokens_seen": 15945384192,
      "step": 20267
    },
    {
      "epoch": 2.1502227880331,
      "grad_norm": 0.4203764230469126,
      "learning_rate": 4.617317424049161e-05,
      "loss": 1.6777,
      "num_input_tokens_seen": 15946170896,
      "step": 20268
    },
    {
      "epoch": 2.1503288775726714,
      "grad_norm": 0.3543988106001769,
      "learning_rate": 4.6172804710972375e-05,
      "loss": 1.6258,
      "num_input_tokens_seen": 15946957632,
      "step": 20269
    },
    {
      "epoch": 2.150434967112243,
      "grad_norm": 0.3949096421702666,
      "learning_rate": 4.617243516509142e-05,
      "loss": 1.583,
      "num_input_tokens_seen": 15947744432,
      "step": 20270
    },
    {
      "epoch": 2.150541056651814,
      "grad_norm": 0.3676761302978395,
      "learning_rate": 4.617206560284902e-05,
      "loss": 1.5041,
      "num_input_tokens_seen": 15948531232,
      "step": 20271
    },
    {
      "epoch": 2.1506471461913854,
      "grad_norm": 0.3783453587424905,
      "learning_rate": 4.617169602424547e-05,
      "loss": 1.5269,
      "num_input_tokens_seen": 15949318144,
      "step": 20272
    },
    {
      "epoch": 2.150753235730957,
      "grad_norm": 0.43135641397913094,
      "learning_rate": 4.617132642928106e-05,
      "loss": 1.6482,
      "num_input_tokens_seen": 15950104864,
      "step": 20273
    },
    {
      "epoch": 2.1508593252705284,
      "grad_norm": 0.39614438364365673,
      "learning_rate": 4.617095681795607e-05,
      "loss": 1.6695,
      "num_input_tokens_seen": 15950891680,
      "step": 20274
    },
    {
      "epoch": 2.1509654148101,
      "grad_norm": 0.38996431544071,
      "learning_rate": 4.617058719027078e-05,
      "loss": 1.5954,
      "num_input_tokens_seen": 15951678432,
      "step": 20275
    },
    {
      "epoch": 2.1510715043496713,
      "grad_norm": 0.4039064936817146,
      "learning_rate": 4.617021754622548e-05,
      "loss": 1.555,
      "num_input_tokens_seen": 15952465200,
      "step": 20276
    },
    {
      "epoch": 2.1511775938892423,
      "grad_norm": 0.428844702394174,
      "learning_rate": 4.616984788582046e-05,
      "loss": 1.6658,
      "num_input_tokens_seen": 15953251904,
      "step": 20277
    },
    {
      "epoch": 2.151283683428814,
      "grad_norm": 0.3598594129986318,
      "learning_rate": 4.6169478209056004e-05,
      "loss": 1.5112,
      "num_input_tokens_seen": 15954038640,
      "step": 20278
    },
    {
      "epoch": 2.1513897729683853,
      "grad_norm": 0.37031111741301787,
      "learning_rate": 4.61691085159324e-05,
      "loss": 1.6516,
      "num_input_tokens_seen": 15954825360,
      "step": 20279
    },
    {
      "epoch": 2.1514958625079568,
      "grad_norm": 0.4326081447924642,
      "learning_rate": 4.6168738806449926e-05,
      "loss": 1.6586,
      "num_input_tokens_seen": 15955612128,
      "step": 20280
    },
    {
      "epoch": 2.1516019520475282,
      "grad_norm": 0.3772330241303764,
      "learning_rate": 4.616836908060888e-05,
      "loss": 1.6485,
      "num_input_tokens_seen": 15956398864,
      "step": 20281
    },
    {
      "epoch": 2.1517080415870997,
      "grad_norm": 0.3863670044765691,
      "learning_rate": 4.616799933840952e-05,
      "loss": 1.5649,
      "num_input_tokens_seen": 15957185584,
      "step": 20282
    },
    {
      "epoch": 2.1518141311266707,
      "grad_norm": 0.4123305382209605,
      "learning_rate": 4.6167629579852167e-05,
      "loss": 1.5782,
      "num_input_tokens_seen": 15957972368,
      "step": 20283
    },
    {
      "epoch": 2.1519202206662422,
      "grad_norm": 0.39539703109770924,
      "learning_rate": 4.616725980493709e-05,
      "loss": 1.6611,
      "num_input_tokens_seen": 15958759168,
      "step": 20284
    },
    {
      "epoch": 2.1520263102058137,
      "grad_norm": 0.35321133343687827,
      "learning_rate": 4.616689001366457e-05,
      "loss": 1.5928,
      "num_input_tokens_seen": 15959545872,
      "step": 20285
    },
    {
      "epoch": 2.152132399745385,
      "grad_norm": 0.4378880401842338,
      "learning_rate": 4.6166520206034904e-05,
      "loss": 1.7383,
      "num_input_tokens_seen": 15960332576,
      "step": 20286
    },
    {
      "epoch": 2.1522384892849566,
      "grad_norm": 0.35438323446385417,
      "learning_rate": 4.6166150382048365e-05,
      "loss": 1.5223,
      "num_input_tokens_seen": 15961119360,
      "step": 20287
    },
    {
      "epoch": 2.152344578824528,
      "grad_norm": 0.4124093126824072,
      "learning_rate": 4.616578054170525e-05,
      "loss": 1.7562,
      "num_input_tokens_seen": 15961906128,
      "step": 20288
    },
    {
      "epoch": 2.152450668364099,
      "grad_norm": 0.37114220387152846,
      "learning_rate": 4.616541068500584e-05,
      "loss": 1.6945,
      "num_input_tokens_seen": 15962692848,
      "step": 20289
    },
    {
      "epoch": 2.1525567579036706,
      "grad_norm": 0.4273131091383051,
      "learning_rate": 4.616504081195042e-05,
      "loss": 1.6937,
      "num_input_tokens_seen": 15963479568,
      "step": 20290
    },
    {
      "epoch": 2.152662847443242,
      "grad_norm": 0.370161766935603,
      "learning_rate": 4.616467092253929e-05,
      "loss": 1.5705,
      "num_input_tokens_seen": 15964266304,
      "step": 20291
    },
    {
      "epoch": 2.1527689369828136,
      "grad_norm": 0.5224856875710481,
      "learning_rate": 4.6164301016772706e-05,
      "loss": 1.6937,
      "num_input_tokens_seen": 15965052960,
      "step": 20292
    },
    {
      "epoch": 2.152875026522385,
      "grad_norm": 0.44316802112260234,
      "learning_rate": 4.6163931094650984e-05,
      "loss": 1.6749,
      "num_input_tokens_seen": 15965839664,
      "step": 20293
    },
    {
      "epoch": 2.152981116061956,
      "grad_norm": 0.40406410072003146,
      "learning_rate": 4.6163561156174396e-05,
      "loss": 1.4955,
      "num_input_tokens_seen": 15966626384,
      "step": 20294
    },
    {
      "epoch": 2.1530872056015276,
      "grad_norm": 0.41564540752650647,
      "learning_rate": 4.616319120134322e-05,
      "loss": 1.5783,
      "num_input_tokens_seen": 15967413120,
      "step": 20295
    },
    {
      "epoch": 2.153193295141099,
      "grad_norm": 0.3505724101367192,
      "learning_rate": 4.616282123015775e-05,
      "loss": 1.5454,
      "num_input_tokens_seen": 15968199824,
      "step": 20296
    },
    {
      "epoch": 2.1532993846806705,
      "grad_norm": 0.3844756582460799,
      "learning_rate": 4.616245124261828e-05,
      "loss": 1.5592,
      "num_input_tokens_seen": 15968986528,
      "step": 20297
    },
    {
      "epoch": 2.153405474220242,
      "grad_norm": 0.4442296915189086,
      "learning_rate": 4.6162081238725094e-05,
      "loss": 1.7295,
      "num_input_tokens_seen": 15969773248,
      "step": 20298
    },
    {
      "epoch": 2.1535115637598135,
      "grad_norm": 0.5337237696379896,
      "learning_rate": 4.6161711218478466e-05,
      "loss": 1.5326,
      "num_input_tokens_seen": 15970560016,
      "step": 20299
    },
    {
      "epoch": 2.1536176532993845,
      "grad_norm": 0.4356723213679736,
      "learning_rate": 4.616134118187868e-05,
      "loss": 1.6316,
      "num_input_tokens_seen": 15971346800,
      "step": 20300
    },
    {
      "epoch": 2.153723742838956,
      "grad_norm": 0.4890201687675137,
      "learning_rate": 4.6160971128926046e-05,
      "loss": 1.5763,
      "num_input_tokens_seen": 15972133664,
      "step": 20301
    },
    {
      "epoch": 2.1538298323785274,
      "grad_norm": 0.43780242918484996,
      "learning_rate": 4.616060105962082e-05,
      "loss": 1.5743,
      "num_input_tokens_seen": 15972920432,
      "step": 20302
    },
    {
      "epoch": 2.153935921918099,
      "grad_norm": 0.37899646247766894,
      "learning_rate": 4.6160230973963316e-05,
      "loss": 1.588,
      "num_input_tokens_seen": 15973707232,
      "step": 20303
    },
    {
      "epoch": 2.1540420114576704,
      "grad_norm": 0.6151360631428678,
      "learning_rate": 4.61598608719538e-05,
      "loss": 1.5406,
      "num_input_tokens_seen": 15974494000,
      "step": 20304
    },
    {
      "epoch": 2.154148100997242,
      "grad_norm": 0.41639508554479465,
      "learning_rate": 4.615949075359256e-05,
      "loss": 1.8122,
      "num_input_tokens_seen": 15975280656,
      "step": 20305
    },
    {
      "epoch": 2.154254190536813,
      "grad_norm": 0.4455321987756757,
      "learning_rate": 4.615912061887989e-05,
      "loss": 1.4956,
      "num_input_tokens_seen": 15976067408,
      "step": 20306
    },
    {
      "epoch": 2.1543602800763844,
      "grad_norm": 0.3982683013058433,
      "learning_rate": 4.615875046781607e-05,
      "loss": 1.6854,
      "num_input_tokens_seen": 15976854112,
      "step": 20307
    },
    {
      "epoch": 2.154466369615956,
      "grad_norm": 0.40951424905387224,
      "learning_rate": 4.6158380300401394e-05,
      "loss": 1.6267,
      "num_input_tokens_seen": 15977640864,
      "step": 20308
    },
    {
      "epoch": 2.1545724591555273,
      "grad_norm": 0.4593049956441294,
      "learning_rate": 4.615801011663614e-05,
      "loss": 1.62,
      "num_input_tokens_seen": 15978427680,
      "step": 20309
    },
    {
      "epoch": 2.154678548695099,
      "grad_norm": 0.4123117459926315,
      "learning_rate": 4.6157639916520596e-05,
      "loss": 1.5801,
      "num_input_tokens_seen": 15979214416,
      "step": 20310
    },
    {
      "epoch": 2.1547846382346703,
      "grad_norm": 0.4331985772390521,
      "learning_rate": 4.615726970005505e-05,
      "loss": 1.5329,
      "num_input_tokens_seen": 15980001168,
      "step": 20311
    },
    {
      "epoch": 2.1548907277742413,
      "grad_norm": 0.38242584418693537,
      "learning_rate": 4.615689946723979e-05,
      "loss": 1.6107,
      "num_input_tokens_seen": 15980787952,
      "step": 20312
    },
    {
      "epoch": 2.1549968173138128,
      "grad_norm": 0.44102584203399464,
      "learning_rate": 4.615652921807509e-05,
      "loss": 1.6585,
      "num_input_tokens_seen": 15981574688,
      "step": 20313
    },
    {
      "epoch": 2.1551029068533842,
      "grad_norm": 0.3802563640761456,
      "learning_rate": 4.6156158952561254e-05,
      "loss": 1.5655,
      "num_input_tokens_seen": 15982361408,
      "step": 20314
    },
    {
      "epoch": 2.1552089963929557,
      "grad_norm": 0.43228905647346433,
      "learning_rate": 4.615578867069855e-05,
      "loss": 1.644,
      "num_input_tokens_seen": 15983148176,
      "step": 20315
    },
    {
      "epoch": 2.155315085932527,
      "grad_norm": 0.3925826273777517,
      "learning_rate": 4.615541837248728e-05,
      "loss": 1.5191,
      "num_input_tokens_seen": 15983934864,
      "step": 20316
    },
    {
      "epoch": 2.1554211754720987,
      "grad_norm": 0.4468876955993481,
      "learning_rate": 4.615504805792772e-05,
      "loss": 1.6746,
      "num_input_tokens_seen": 15984721760,
      "step": 20317
    },
    {
      "epoch": 2.1555272650116697,
      "grad_norm": 0.36841187228199107,
      "learning_rate": 4.615467772702016e-05,
      "loss": 1.7003,
      "num_input_tokens_seen": 15985508576,
      "step": 20318
    },
    {
      "epoch": 2.155633354551241,
      "grad_norm": 0.4028422797062317,
      "learning_rate": 4.615430737976489e-05,
      "loss": 1.5802,
      "num_input_tokens_seen": 15986295296,
      "step": 20319
    },
    {
      "epoch": 2.1557394440908126,
      "grad_norm": 0.3486594604211936,
      "learning_rate": 4.615393701616219e-05,
      "loss": 1.5837,
      "num_input_tokens_seen": 15987082112,
      "step": 20320
    },
    {
      "epoch": 2.155845533630384,
      "grad_norm": 0.40792655398017025,
      "learning_rate": 4.615356663621234e-05,
      "loss": 1.5866,
      "num_input_tokens_seen": 15987868848,
      "step": 20321
    },
    {
      "epoch": 2.1559516231699556,
      "grad_norm": 0.382428709421532,
      "learning_rate": 4.6153196239915644e-05,
      "loss": 1.6176,
      "num_input_tokens_seen": 15988655568,
      "step": 20322
    },
    {
      "epoch": 2.1560577127095266,
      "grad_norm": 0.4077305522435537,
      "learning_rate": 4.615282582727238e-05,
      "loss": 1.6069,
      "num_input_tokens_seen": 15989442320,
      "step": 20323
    },
    {
      "epoch": 2.156163802249098,
      "grad_norm": 0.3624782703846201,
      "learning_rate": 4.6152455398282826e-05,
      "loss": 1.6763,
      "num_input_tokens_seen": 15990229088,
      "step": 20324
    },
    {
      "epoch": 2.1562698917886696,
      "grad_norm": 0.3754864339702629,
      "learning_rate": 4.6152084952947286e-05,
      "loss": 1.5821,
      "num_input_tokens_seen": 15991015920,
      "step": 20325
    },
    {
      "epoch": 2.156375981328241,
      "grad_norm": 0.44333859544814974,
      "learning_rate": 4.6151714491266017e-05,
      "loss": 1.5061,
      "num_input_tokens_seen": 15991802704,
      "step": 20326
    },
    {
      "epoch": 2.1564820708678125,
      "grad_norm": 0.38817244447152593,
      "learning_rate": 4.615134401323934e-05,
      "loss": 1.7067,
      "num_input_tokens_seen": 15992589408,
      "step": 20327
    },
    {
      "epoch": 2.156588160407384,
      "grad_norm": 0.4213798224435533,
      "learning_rate": 4.615097351886751e-05,
      "loss": 1.5228,
      "num_input_tokens_seen": 15993376224,
      "step": 20328
    },
    {
      "epoch": 2.156694249946955,
      "grad_norm": 0.4334539577329526,
      "learning_rate": 4.615060300815084e-05,
      "loss": 1.6138,
      "num_input_tokens_seen": 15994163024,
      "step": 20329
    },
    {
      "epoch": 2.1568003394865265,
      "grad_norm": 0.4319400817201671,
      "learning_rate": 4.6150232481089606e-05,
      "loss": 1.7338,
      "num_input_tokens_seen": 15994949760,
      "step": 20330
    },
    {
      "epoch": 2.156906429026098,
      "grad_norm": 0.455059331343394,
      "learning_rate": 4.614986193768409e-05,
      "loss": 1.6564,
      "num_input_tokens_seen": 15995736512,
      "step": 20331
    },
    {
      "epoch": 2.1570125185656694,
      "grad_norm": 0.4588436590867816,
      "learning_rate": 4.614949137793458e-05,
      "loss": 1.5366,
      "num_input_tokens_seen": 15996523232,
      "step": 20332
    },
    {
      "epoch": 2.157118608105241,
      "grad_norm": 0.43047481805215687,
      "learning_rate": 4.6149120801841364e-05,
      "loss": 1.5807,
      "num_input_tokens_seen": 15997309952,
      "step": 20333
    },
    {
      "epoch": 2.1572246976448124,
      "grad_norm": 0.40000882384671477,
      "learning_rate": 4.614875020940472e-05,
      "loss": 1.6213,
      "num_input_tokens_seen": 15998096640,
      "step": 20334
    },
    {
      "epoch": 2.1573307871843834,
      "grad_norm": 0.45393779049671473,
      "learning_rate": 4.614837960062496e-05,
      "loss": 1.6499,
      "num_input_tokens_seen": 15998883456,
      "step": 20335
    },
    {
      "epoch": 2.157436876723955,
      "grad_norm": 0.42392733909949865,
      "learning_rate": 4.614800897550234e-05,
      "loss": 1.5836,
      "num_input_tokens_seen": 15999670304,
      "step": 20336
    },
    {
      "epoch": 2.1575429662635264,
      "grad_norm": 0.45104493351227914,
      "learning_rate": 4.614763833403716e-05,
      "loss": 1.6153,
      "num_input_tokens_seen": 16000456992,
      "step": 20337
    },
    {
      "epoch": 2.157649055803098,
      "grad_norm": 0.4218225993656053,
      "learning_rate": 4.614726767622971e-05,
      "loss": 1.617,
      "num_input_tokens_seen": 16001243600,
      "step": 20338
    },
    {
      "epoch": 2.1577551453426693,
      "grad_norm": 0.45322476686827295,
      "learning_rate": 4.614689700208027e-05,
      "loss": 1.7057,
      "num_input_tokens_seen": 16002030336,
      "step": 20339
    },
    {
      "epoch": 2.157861234882241,
      "grad_norm": 0.4413883894190213,
      "learning_rate": 4.614652631158913e-05,
      "loss": 1.5718,
      "num_input_tokens_seen": 16002817088,
      "step": 20340
    },
    {
      "epoch": 2.157967324421812,
      "grad_norm": 0.39570141372515466,
      "learning_rate": 4.6146155604756566e-05,
      "loss": 1.5713,
      "num_input_tokens_seen": 16003603776,
      "step": 20341
    },
    {
      "epoch": 2.1580734139613833,
      "grad_norm": 0.42322650790968913,
      "learning_rate": 4.614578488158289e-05,
      "loss": 1.5693,
      "num_input_tokens_seen": 16004390544,
      "step": 20342
    },
    {
      "epoch": 2.1581795035009548,
      "grad_norm": 0.4510294900967172,
      "learning_rate": 4.6145414142068356e-05,
      "loss": 1.7379,
      "num_input_tokens_seen": 16005177344,
      "step": 20343
    },
    {
      "epoch": 2.1582855930405263,
      "grad_norm": 0.40875454322830757,
      "learning_rate": 4.614504338621327e-05,
      "loss": 1.5806,
      "num_input_tokens_seen": 16005964096,
      "step": 20344
    },
    {
      "epoch": 2.1583916825800977,
      "grad_norm": 0.44959188973589365,
      "learning_rate": 4.6144672614017926e-05,
      "loss": 1.6418,
      "num_input_tokens_seen": 16006750864,
      "step": 20345
    },
    {
      "epoch": 2.158497772119669,
      "grad_norm": 0.4342137134889907,
      "learning_rate": 4.614430182548258e-05,
      "loss": 1.5381,
      "num_input_tokens_seen": 16007537648,
      "step": 20346
    },
    {
      "epoch": 2.1586038616592402,
      "grad_norm": 0.5126045804358078,
      "learning_rate": 4.6143931020607555e-05,
      "loss": 1.5577,
      "num_input_tokens_seen": 16008324400,
      "step": 20347
    },
    {
      "epoch": 2.1587099511988117,
      "grad_norm": 0.39341261358774576,
      "learning_rate": 4.6143560199393115e-05,
      "loss": 1.6365,
      "num_input_tokens_seen": 16009111008,
      "step": 20348
    },
    {
      "epoch": 2.158816040738383,
      "grad_norm": 0.4333027769807575,
      "learning_rate": 4.614318936183956e-05,
      "loss": 1.4847,
      "num_input_tokens_seen": 16009897872,
      "step": 20349
    },
    {
      "epoch": 2.1589221302779547,
      "grad_norm": 0.41545755804572543,
      "learning_rate": 4.614281850794715e-05,
      "loss": 1.6613,
      "num_input_tokens_seen": 16010684592,
      "step": 20350
    },
    {
      "epoch": 2.159028219817526,
      "grad_norm": 0.4631718525362286,
      "learning_rate": 4.61424476377162e-05,
      "loss": 1.648,
      "num_input_tokens_seen": 16011471328,
      "step": 20351
    },
    {
      "epoch": 2.159134309357097,
      "grad_norm": 0.39032008149073166,
      "learning_rate": 4.614207675114699e-05,
      "loss": 1.588,
      "num_input_tokens_seen": 16012258080,
      "step": 20352
    },
    {
      "epoch": 2.1592403988966686,
      "grad_norm": 0.3976799362416202,
      "learning_rate": 4.61417058482398e-05,
      "loss": 1.5889,
      "num_input_tokens_seen": 16013044816,
      "step": 20353
    },
    {
      "epoch": 2.15934648843624,
      "grad_norm": 0.4597782665608427,
      "learning_rate": 4.614133492899492e-05,
      "loss": 1.6645,
      "num_input_tokens_seen": 16013831488,
      "step": 20354
    },
    {
      "epoch": 2.1594525779758116,
      "grad_norm": 0.3747011244388565,
      "learning_rate": 4.614096399341264e-05,
      "loss": 1.6453,
      "num_input_tokens_seen": 16014618304,
      "step": 20355
    },
    {
      "epoch": 2.159558667515383,
      "grad_norm": 0.3472324562382254,
      "learning_rate": 4.614059304149324e-05,
      "loss": 1.5782,
      "num_input_tokens_seen": 16015405040,
      "step": 20356
    },
    {
      "epoch": 2.1596647570549545,
      "grad_norm": 0.3766771741396366,
      "learning_rate": 4.614022207323702e-05,
      "loss": 1.5468,
      "num_input_tokens_seen": 16016191824,
      "step": 20357
    },
    {
      "epoch": 2.159770846594526,
      "grad_norm": 0.3612330084019479,
      "learning_rate": 4.6139851088644235e-05,
      "loss": 1.5248,
      "num_input_tokens_seen": 16016978640,
      "step": 20358
    },
    {
      "epoch": 2.159876936134097,
      "grad_norm": 0.5675226756976672,
      "learning_rate": 4.613948008771521e-05,
      "loss": 1.8012,
      "num_input_tokens_seen": 16017765360,
      "step": 20359
    },
    {
      "epoch": 2.1599830256736685,
      "grad_norm": 0.370941919091711,
      "learning_rate": 4.6139109070450215e-05,
      "loss": 1.5003,
      "num_input_tokens_seen": 16018552128,
      "step": 20360
    },
    {
      "epoch": 2.16008911521324,
      "grad_norm": 0.5179540003990394,
      "learning_rate": 4.613873803684953e-05,
      "loss": 1.6392,
      "num_input_tokens_seen": 16019338816,
      "step": 20361
    },
    {
      "epoch": 2.1601952047528115,
      "grad_norm": 0.31422469272900116,
      "learning_rate": 4.613836698691345e-05,
      "loss": 1.5376,
      "num_input_tokens_seen": 16020125696,
      "step": 20362
    },
    {
      "epoch": 2.160301294292383,
      "grad_norm": 0.5357842903277726,
      "learning_rate": 4.613799592064226e-05,
      "loss": 1.6915,
      "num_input_tokens_seen": 16020912464,
      "step": 20363
    },
    {
      "epoch": 2.160407383831954,
      "grad_norm": 0.38368845481343555,
      "learning_rate": 4.6137624838036254e-05,
      "loss": 1.5956,
      "num_input_tokens_seen": 16021699264,
      "step": 20364
    },
    {
      "epoch": 2.1605134733715254,
      "grad_norm": 0.3988566655232845,
      "learning_rate": 4.61372537390957e-05,
      "loss": 1.6641,
      "num_input_tokens_seen": 16022486032,
      "step": 20365
    },
    {
      "epoch": 2.160619562911097,
      "grad_norm": 0.4278842578413272,
      "learning_rate": 4.613688262382091e-05,
      "loss": 1.6189,
      "num_input_tokens_seen": 16023272768,
      "step": 20366
    },
    {
      "epoch": 2.1607256524506684,
      "grad_norm": 0.38319480206157497,
      "learning_rate": 4.6136511492212145e-05,
      "loss": 1.6056,
      "num_input_tokens_seen": 16024059600,
      "step": 20367
    },
    {
      "epoch": 2.16083174199024,
      "grad_norm": 0.5321023182364993,
      "learning_rate": 4.613614034426971e-05,
      "loss": 1.6763,
      "num_input_tokens_seen": 16024846288,
      "step": 20368
    },
    {
      "epoch": 2.1609378315298113,
      "grad_norm": 0.4244259869631448,
      "learning_rate": 4.613576917999388e-05,
      "loss": 1.6621,
      "num_input_tokens_seen": 16025633184,
      "step": 20369
    },
    {
      "epoch": 2.1610439210693824,
      "grad_norm": 0.49400561772017,
      "learning_rate": 4.613539799938495e-05,
      "loss": 1.5408,
      "num_input_tokens_seen": 16026419888,
      "step": 20370
    },
    {
      "epoch": 2.161150010608954,
      "grad_norm": 0.40580349820531975,
      "learning_rate": 4.613502680244322e-05,
      "loss": 1.7181,
      "num_input_tokens_seen": 16027206560,
      "step": 20371
    },
    {
      "epoch": 2.1612561001485253,
      "grad_norm": 0.40562721828027193,
      "learning_rate": 4.613465558916894e-05,
      "loss": 1.4711,
      "num_input_tokens_seen": 16027993328,
      "step": 20372
    },
    {
      "epoch": 2.161362189688097,
      "grad_norm": 0.447674805825139,
      "learning_rate": 4.613428435956243e-05,
      "loss": 1.7209,
      "num_input_tokens_seen": 16028780080,
      "step": 20373
    },
    {
      "epoch": 2.1614682792276683,
      "grad_norm": 0.385971181929693,
      "learning_rate": 4.613391311362396e-05,
      "loss": 1.6877,
      "num_input_tokens_seen": 16029566816,
      "step": 20374
    },
    {
      "epoch": 2.1615743687672397,
      "grad_norm": 0.4553058631436174,
      "learning_rate": 4.613354185135383e-05,
      "loss": 1.6251,
      "num_input_tokens_seen": 16030353584,
      "step": 20375
    },
    {
      "epoch": 2.1616804583068108,
      "grad_norm": 0.40180994023884553,
      "learning_rate": 4.613317057275231e-05,
      "loss": 1.7233,
      "num_input_tokens_seen": 16031140368,
      "step": 20376
    },
    {
      "epoch": 2.1617865478463822,
      "grad_norm": 0.4043448285845087,
      "learning_rate": 4.61327992778197e-05,
      "loss": 1.6866,
      "num_input_tokens_seen": 16031927136,
      "step": 20377
    },
    {
      "epoch": 2.1618926373859537,
      "grad_norm": 0.37825289856243033,
      "learning_rate": 4.613242796655628e-05,
      "loss": 1.6511,
      "num_input_tokens_seen": 16032713872,
      "step": 20378
    },
    {
      "epoch": 2.161998726925525,
      "grad_norm": 0.3604781167031959,
      "learning_rate": 4.613205663896234e-05,
      "loss": 1.6447,
      "num_input_tokens_seen": 16033500608,
      "step": 20379
    },
    {
      "epoch": 2.1621048164650967,
      "grad_norm": 0.4227393864597633,
      "learning_rate": 4.6131685295038174e-05,
      "loss": 1.5594,
      "num_input_tokens_seen": 16034287312,
      "step": 20380
    },
    {
      "epoch": 2.162210906004668,
      "grad_norm": 0.3543961810949527,
      "learning_rate": 4.6131313934784055e-05,
      "loss": 1.5064,
      "num_input_tokens_seen": 16035074192,
      "step": 20381
    },
    {
      "epoch": 2.162316995544239,
      "grad_norm": 0.3262437950269188,
      "learning_rate": 4.613094255820027e-05,
      "loss": 1.5688,
      "num_input_tokens_seen": 16035860992,
      "step": 20382
    },
    {
      "epoch": 2.1624230850838106,
      "grad_norm": 0.38210696194115074,
      "learning_rate": 4.613057116528713e-05,
      "loss": 1.6211,
      "num_input_tokens_seen": 16036647792,
      "step": 20383
    },
    {
      "epoch": 2.162529174623382,
      "grad_norm": 0.38909641361596814,
      "learning_rate": 4.613019975604489e-05,
      "loss": 1.5522,
      "num_input_tokens_seen": 16037434640,
      "step": 20384
    },
    {
      "epoch": 2.1626352641629536,
      "grad_norm": 0.3505432937145965,
      "learning_rate": 4.612982833047386e-05,
      "loss": 1.5654,
      "num_input_tokens_seen": 16038221392,
      "step": 20385
    },
    {
      "epoch": 2.162741353702525,
      "grad_norm": 0.4143615895175389,
      "learning_rate": 4.612945688857431e-05,
      "loss": 1.6707,
      "num_input_tokens_seen": 16039008176,
      "step": 20386
    },
    {
      "epoch": 2.1628474432420965,
      "grad_norm": 0.36932252812109584,
      "learning_rate": 4.612908543034654e-05,
      "loss": 1.5704,
      "num_input_tokens_seen": 16039794928,
      "step": 20387
    },
    {
      "epoch": 2.1629535327816676,
      "grad_norm": 0.3756925270460261,
      "learning_rate": 4.612871395579084e-05,
      "loss": 1.5863,
      "num_input_tokens_seen": 16040581712,
      "step": 20388
    },
    {
      "epoch": 2.163059622321239,
      "grad_norm": 0.3954922174084972,
      "learning_rate": 4.612834246490748e-05,
      "loss": 1.6232,
      "num_input_tokens_seen": 16041368464,
      "step": 20389
    },
    {
      "epoch": 2.1631657118608105,
      "grad_norm": 0.37396747332994,
      "learning_rate": 4.612797095769676e-05,
      "loss": 1.6282,
      "num_input_tokens_seen": 16042155232,
      "step": 20390
    },
    {
      "epoch": 2.163271801400382,
      "grad_norm": 0.3793389894695336,
      "learning_rate": 4.612759943415896e-05,
      "loss": 1.5581,
      "num_input_tokens_seen": 16042942096,
      "step": 20391
    },
    {
      "epoch": 2.1633778909399535,
      "grad_norm": 0.42715747128151504,
      "learning_rate": 4.612722789429438e-05,
      "loss": 1.6555,
      "num_input_tokens_seen": 16043728944,
      "step": 20392
    },
    {
      "epoch": 2.1634839804795245,
      "grad_norm": 0.4463804514235516,
      "learning_rate": 4.612685633810329e-05,
      "loss": 1.5769,
      "num_input_tokens_seen": 16044515792,
      "step": 20393
    },
    {
      "epoch": 2.163590070019096,
      "grad_norm": 0.368940897884017,
      "learning_rate": 4.6126484765585995e-05,
      "loss": 1.5289,
      "num_input_tokens_seen": 16045302560,
      "step": 20394
    },
    {
      "epoch": 2.1636961595586675,
      "grad_norm": 0.3627919247319108,
      "learning_rate": 4.612611317674276e-05,
      "loss": 1.6629,
      "num_input_tokens_seen": 16046089360,
      "step": 20395
    },
    {
      "epoch": 2.163802249098239,
      "grad_norm": 0.4556731201240606,
      "learning_rate": 4.612574157157389e-05,
      "loss": 1.69,
      "num_input_tokens_seen": 16046876112,
      "step": 20396
    },
    {
      "epoch": 2.1639083386378104,
      "grad_norm": 0.33006058805261174,
      "learning_rate": 4.6125369950079675e-05,
      "loss": 1.5477,
      "num_input_tokens_seen": 16047662896,
      "step": 20397
    },
    {
      "epoch": 2.164014428177382,
      "grad_norm": 0.3948053495244497,
      "learning_rate": 4.612499831226038e-05,
      "loss": 1.5197,
      "num_input_tokens_seen": 16048449664,
      "step": 20398
    },
    {
      "epoch": 2.164120517716953,
      "grad_norm": 0.32458756978954345,
      "learning_rate": 4.612462665811631e-05,
      "loss": 1.4724,
      "num_input_tokens_seen": 16049236416,
      "step": 20399
    },
    {
      "epoch": 2.1642266072565244,
      "grad_norm": 0.3422846774168127,
      "learning_rate": 4.612425498764775e-05,
      "loss": 1.5553,
      "num_input_tokens_seen": 16050023184,
      "step": 20400
    },
    {
      "epoch": 2.164332696796096,
      "grad_norm": 0.3459549896995491,
      "learning_rate": 4.612388330085499e-05,
      "loss": 1.5402,
      "num_input_tokens_seen": 16050809936,
      "step": 20401
    },
    {
      "epoch": 2.1644387863356673,
      "grad_norm": 0.3581495756940116,
      "learning_rate": 4.612351159773831e-05,
      "loss": 1.5298,
      "num_input_tokens_seen": 16051596672,
      "step": 20402
    },
    {
      "epoch": 2.164544875875239,
      "grad_norm": 0.37582173664761864,
      "learning_rate": 4.6123139878298e-05,
      "loss": 1.6418,
      "num_input_tokens_seen": 16052383408,
      "step": 20403
    },
    {
      "epoch": 2.1646509654148103,
      "grad_norm": 0.4437480715900181,
      "learning_rate": 4.6122768142534345e-05,
      "loss": 1.625,
      "num_input_tokens_seen": 16053170224,
      "step": 20404
    },
    {
      "epoch": 2.1647570549543813,
      "grad_norm": 0.43394046402120523,
      "learning_rate": 4.612239639044764e-05,
      "loss": 1.6181,
      "num_input_tokens_seen": 16053956960,
      "step": 20405
    },
    {
      "epoch": 2.164863144493953,
      "grad_norm": 0.37483168638453496,
      "learning_rate": 4.612202462203816e-05,
      "loss": 1.5191,
      "num_input_tokens_seen": 16054743760,
      "step": 20406
    },
    {
      "epoch": 2.1649692340335243,
      "grad_norm": 0.33243961130964994,
      "learning_rate": 4.612165283730621e-05,
      "loss": 1.6668,
      "num_input_tokens_seen": 16055530560,
      "step": 20407
    },
    {
      "epoch": 2.1650753235730957,
      "grad_norm": 0.3504088109931985,
      "learning_rate": 4.612128103625205e-05,
      "loss": 1.5618,
      "num_input_tokens_seen": 16056317376,
      "step": 20408
    },
    {
      "epoch": 2.165181413112667,
      "grad_norm": 0.4296476036716403,
      "learning_rate": 4.6120909218875996e-05,
      "loss": 1.6595,
      "num_input_tokens_seen": 16057104176,
      "step": 20409
    },
    {
      "epoch": 2.1652875026522387,
      "grad_norm": 0.37165011661420677,
      "learning_rate": 4.612053738517832e-05,
      "loss": 1.674,
      "num_input_tokens_seen": 16057890928,
      "step": 20410
    },
    {
      "epoch": 2.1653935921918097,
      "grad_norm": 0.5035092963946396,
      "learning_rate": 4.612016553515931e-05,
      "loss": 1.6626,
      "num_input_tokens_seen": 16058677632,
      "step": 20411
    },
    {
      "epoch": 2.165499681731381,
      "grad_norm": 0.3762395188583641,
      "learning_rate": 4.6119793668819254e-05,
      "loss": 1.4682,
      "num_input_tokens_seen": 16059464480,
      "step": 20412
    },
    {
      "epoch": 2.1656057712709527,
      "grad_norm": 0.428265901641032,
      "learning_rate": 4.611942178615845e-05,
      "loss": 1.6057,
      "num_input_tokens_seen": 16060251248,
      "step": 20413
    },
    {
      "epoch": 2.165711860810524,
      "grad_norm": 0.39154928491355484,
      "learning_rate": 4.611904988717718e-05,
      "loss": 1.6522,
      "num_input_tokens_seen": 16061037952,
      "step": 20414
    },
    {
      "epoch": 2.1658179503500956,
      "grad_norm": 0.4529222047199541,
      "learning_rate": 4.611867797187571e-05,
      "loss": 1.7054,
      "num_input_tokens_seen": 16061824592,
      "step": 20415
    },
    {
      "epoch": 2.165924039889667,
      "grad_norm": 0.34756999438358993,
      "learning_rate": 4.611830604025436e-05,
      "loss": 1.7378,
      "num_input_tokens_seen": 16062611328,
      "step": 20416
    },
    {
      "epoch": 2.166030129429238,
      "grad_norm": 0.38164935445232706,
      "learning_rate": 4.61179340923134e-05,
      "loss": 1.5939,
      "num_input_tokens_seen": 16063398016,
      "step": 20417
    },
    {
      "epoch": 2.1661362189688096,
      "grad_norm": 0.3949857182972899,
      "learning_rate": 4.6117562128053116e-05,
      "loss": 1.6196,
      "num_input_tokens_seen": 16064184848,
      "step": 20418
    },
    {
      "epoch": 2.166242308508381,
      "grad_norm": 0.34887638151763095,
      "learning_rate": 4.61171901474738e-05,
      "loss": 1.542,
      "num_input_tokens_seen": 16064971680,
      "step": 20419
    },
    {
      "epoch": 2.1663483980479525,
      "grad_norm": 0.3924372016658872,
      "learning_rate": 4.6116818150575734e-05,
      "loss": 1.6639,
      "num_input_tokens_seen": 16065758480,
      "step": 20420
    },
    {
      "epoch": 2.166454487587524,
      "grad_norm": 0.40752241841246034,
      "learning_rate": 4.6116446137359224e-05,
      "loss": 1.7217,
      "num_input_tokens_seen": 16066545264,
      "step": 20421
    },
    {
      "epoch": 2.166560577127095,
      "grad_norm": 0.46459683794387235,
      "learning_rate": 4.6116074107824536e-05,
      "loss": 1.5873,
      "num_input_tokens_seen": 16067332048,
      "step": 20422
    },
    {
      "epoch": 2.1666666666666665,
      "grad_norm": 0.4122384321212642,
      "learning_rate": 4.611570206197197e-05,
      "loss": 1.6079,
      "num_input_tokens_seen": 16068118752,
      "step": 20423
    },
    {
      "epoch": 2.166772756206238,
      "grad_norm": 0.40663591867098287,
      "learning_rate": 4.61153299998018e-05,
      "loss": 1.5886,
      "num_input_tokens_seen": 16068905520,
      "step": 20424
    },
    {
      "epoch": 2.1668788457458095,
      "grad_norm": 0.41374443216287055,
      "learning_rate": 4.6114957921314325e-05,
      "loss": 1.6065,
      "num_input_tokens_seen": 16069692240,
      "step": 20425
    },
    {
      "epoch": 2.166984935285381,
      "grad_norm": 0.3954767466463311,
      "learning_rate": 4.611458582650983e-05,
      "loss": 1.6614,
      "num_input_tokens_seen": 16070478992,
      "step": 20426
    },
    {
      "epoch": 2.1670910248249524,
      "grad_norm": 0.4966807620510065,
      "learning_rate": 4.611421371538861e-05,
      "loss": 1.5724,
      "num_input_tokens_seen": 16071265744,
      "step": 20427
    },
    {
      "epoch": 2.167197114364524,
      "grad_norm": 0.3917204829786157,
      "learning_rate": 4.611384158795094e-05,
      "loss": 1.5752,
      "num_input_tokens_seen": 16072052464,
      "step": 20428
    },
    {
      "epoch": 2.167303203904095,
      "grad_norm": 0.49854425995321566,
      "learning_rate": 4.611346944419711e-05,
      "loss": 1.5965,
      "num_input_tokens_seen": 16072839168,
      "step": 20429
    },
    {
      "epoch": 2.1674092934436664,
      "grad_norm": 0.4610265118965486,
      "learning_rate": 4.611309728412741e-05,
      "loss": 1.5618,
      "num_input_tokens_seen": 16073625936,
      "step": 20430
    },
    {
      "epoch": 2.167515382983238,
      "grad_norm": 0.5388894420188874,
      "learning_rate": 4.611272510774214e-05,
      "loss": 1.6162,
      "num_input_tokens_seen": 16074412688,
      "step": 20431
    },
    {
      "epoch": 2.1676214725228093,
      "grad_norm": 0.43655956632072873,
      "learning_rate": 4.6112352915041566e-05,
      "loss": 1.7605,
      "num_input_tokens_seen": 16075199536,
      "step": 20432
    },
    {
      "epoch": 2.167727562062381,
      "grad_norm": 0.3619708285025614,
      "learning_rate": 4.6111980706025984e-05,
      "loss": 1.7153,
      "num_input_tokens_seen": 16075986352,
      "step": 20433
    },
    {
      "epoch": 2.167833651601952,
      "grad_norm": 0.5198345230866348,
      "learning_rate": 4.6111608480695686e-05,
      "loss": 1.6579,
      "num_input_tokens_seen": 16076773104,
      "step": 20434
    },
    {
      "epoch": 2.1679397411415233,
      "grad_norm": 0.36779704011085007,
      "learning_rate": 4.611123623905096e-05,
      "loss": 1.4708,
      "num_input_tokens_seen": 16077559872,
      "step": 20435
    },
    {
      "epoch": 2.168045830681095,
      "grad_norm": 0.4845728010248824,
      "learning_rate": 4.611086398109208e-05,
      "loss": 1.5601,
      "num_input_tokens_seen": 16078346608,
      "step": 20436
    },
    {
      "epoch": 2.1681519202206663,
      "grad_norm": 0.41308542011745764,
      "learning_rate": 4.6110491706819356e-05,
      "loss": 1.5858,
      "num_input_tokens_seen": 16079133440,
      "step": 20437
    },
    {
      "epoch": 2.1682580097602377,
      "grad_norm": 0.45444988696616595,
      "learning_rate": 4.611011941623306e-05,
      "loss": 1.6558,
      "num_input_tokens_seen": 16079920192,
      "step": 20438
    },
    {
      "epoch": 2.1683640992998092,
      "grad_norm": 0.5543638940203639,
      "learning_rate": 4.610974710933347e-05,
      "loss": 1.511,
      "num_input_tokens_seen": 16080706912,
      "step": 20439
    },
    {
      "epoch": 2.1684701888393803,
      "grad_norm": 0.49484826387769487,
      "learning_rate": 4.61093747861209e-05,
      "loss": 1.6162,
      "num_input_tokens_seen": 16081493760,
      "step": 20440
    },
    {
      "epoch": 2.1685762783789517,
      "grad_norm": 0.5196984923808606,
      "learning_rate": 4.610900244659562e-05,
      "loss": 1.6087,
      "num_input_tokens_seen": 16082280480,
      "step": 20441
    },
    {
      "epoch": 2.168682367918523,
      "grad_norm": 0.4170142687912666,
      "learning_rate": 4.610863009075792e-05,
      "loss": 1.5642,
      "num_input_tokens_seen": 16083067264,
      "step": 20442
    },
    {
      "epoch": 2.1687884574580947,
      "grad_norm": 0.4139127596325286,
      "learning_rate": 4.610825771860809e-05,
      "loss": 1.4707,
      "num_input_tokens_seen": 16083854064,
      "step": 20443
    },
    {
      "epoch": 2.168894546997666,
      "grad_norm": 0.39844342248304193,
      "learning_rate": 4.6107885330146424e-05,
      "loss": 1.6078,
      "num_input_tokens_seen": 16084640768,
      "step": 20444
    },
    {
      "epoch": 2.1690006365372376,
      "grad_norm": 0.4443906789913423,
      "learning_rate": 4.6107512925373207e-05,
      "loss": 1.5521,
      "num_input_tokens_seen": 16085427552,
      "step": 20445
    },
    {
      "epoch": 2.1691067260768087,
      "grad_norm": 0.5522745256575942,
      "learning_rate": 4.6107140504288716e-05,
      "loss": 1.6362,
      "num_input_tokens_seen": 16086214320,
      "step": 20446
    },
    {
      "epoch": 2.16921281561638,
      "grad_norm": 0.4407267082739466,
      "learning_rate": 4.6106768066893244e-05,
      "loss": 1.6149,
      "num_input_tokens_seen": 16087001024,
      "step": 20447
    },
    {
      "epoch": 2.1693189051559516,
      "grad_norm": 0.4818938560479513,
      "learning_rate": 4.610639561318709e-05,
      "loss": 1.6003,
      "num_input_tokens_seen": 16087787840,
      "step": 20448
    },
    {
      "epoch": 2.169424994695523,
      "grad_norm": 0.37374203103290043,
      "learning_rate": 4.610602314317052e-05,
      "loss": 1.5421,
      "num_input_tokens_seen": 16088574672,
      "step": 20449
    },
    {
      "epoch": 2.1695310842350946,
      "grad_norm": 0.3939494803775425,
      "learning_rate": 4.610565065684385e-05,
      "loss": 1.5511,
      "num_input_tokens_seen": 16089361456,
      "step": 20450
    },
    {
      "epoch": 2.1696371737746656,
      "grad_norm": 0.4791000772565785,
      "learning_rate": 4.610527815420734e-05,
      "loss": 1.6674,
      "num_input_tokens_seen": 16090148208,
      "step": 20451
    },
    {
      "epoch": 2.169743263314237,
      "grad_norm": 0.4013044498600165,
      "learning_rate": 4.61049056352613e-05,
      "loss": 1.758,
      "num_input_tokens_seen": 16090934928,
      "step": 20452
    },
    {
      "epoch": 2.1698493528538085,
      "grad_norm": 0.3703749239723258,
      "learning_rate": 4.6104533100006e-05,
      "loss": 1.699,
      "num_input_tokens_seen": 16091721744,
      "step": 20453
    },
    {
      "epoch": 2.16995544239338,
      "grad_norm": 0.4372174937462137,
      "learning_rate": 4.610416054844174e-05,
      "loss": 1.6544,
      "num_input_tokens_seen": 16092508416,
      "step": 20454
    },
    {
      "epoch": 2.1700615319329515,
      "grad_norm": 0.3434139370287089,
      "learning_rate": 4.6103787980568804e-05,
      "loss": 1.5409,
      "num_input_tokens_seen": 16093295200,
      "step": 20455
    },
    {
      "epoch": 2.170167621472523,
      "grad_norm": 0.3627492461161834,
      "learning_rate": 4.610341539638747e-05,
      "loss": 1.6883,
      "num_input_tokens_seen": 16094081856,
      "step": 20456
    },
    {
      "epoch": 2.1702737110120944,
      "grad_norm": 0.48105213221349313,
      "learning_rate": 4.6103042795898046e-05,
      "loss": 1.5771,
      "num_input_tokens_seen": 16094868624,
      "step": 20457
    },
    {
      "epoch": 2.1703798005516655,
      "grad_norm": 0.4090792486328217,
      "learning_rate": 4.610267017910081e-05,
      "loss": 1.6098,
      "num_input_tokens_seen": 16095655392,
      "step": 20458
    },
    {
      "epoch": 2.170485890091237,
      "grad_norm": 0.5149923269277856,
      "learning_rate": 4.610229754599605e-05,
      "loss": 1.638,
      "num_input_tokens_seen": 16096442160,
      "step": 20459
    },
    {
      "epoch": 2.1705919796308084,
      "grad_norm": 0.3958382566971814,
      "learning_rate": 4.610192489658405e-05,
      "loss": 1.5772,
      "num_input_tokens_seen": 16097228960,
      "step": 20460
    },
    {
      "epoch": 2.17069806917038,
      "grad_norm": 0.5477739965900947,
      "learning_rate": 4.6101552230865106e-05,
      "loss": 1.5518,
      "num_input_tokens_seen": 16098015840,
      "step": 20461
    },
    {
      "epoch": 2.1708041587099514,
      "grad_norm": 0.39477706051558104,
      "learning_rate": 4.61011795488395e-05,
      "loss": 1.5754,
      "num_input_tokens_seen": 16098802592,
      "step": 20462
    },
    {
      "epoch": 2.1709102482495224,
      "grad_norm": 0.5605720211386571,
      "learning_rate": 4.610080685050752e-05,
      "loss": 1.569,
      "num_input_tokens_seen": 16099589488,
      "step": 20463
    },
    {
      "epoch": 2.171016337789094,
      "grad_norm": 0.4197873432720299,
      "learning_rate": 4.6100434135869455e-05,
      "loss": 1.6661,
      "num_input_tokens_seen": 16100376304,
      "step": 20464
    },
    {
      "epoch": 2.1711224273286653,
      "grad_norm": 0.33379813668843006,
      "learning_rate": 4.6100061404925594e-05,
      "loss": 1.5769,
      "num_input_tokens_seen": 16101163136,
      "step": 20465
    },
    {
      "epoch": 2.171228516868237,
      "grad_norm": 0.4481678679246378,
      "learning_rate": 4.609968865767622e-05,
      "loss": 1.5644,
      "num_input_tokens_seen": 16101949904,
      "step": 20466
    },
    {
      "epoch": 2.1713346064078083,
      "grad_norm": 0.4112607748994585,
      "learning_rate": 4.609931589412163e-05,
      "loss": 1.5757,
      "num_input_tokens_seen": 16102736672,
      "step": 20467
    },
    {
      "epoch": 2.1714406959473798,
      "grad_norm": 0.42421991072902726,
      "learning_rate": 4.609894311426212e-05,
      "loss": 1.6694,
      "num_input_tokens_seen": 16103523408,
      "step": 20468
    },
    {
      "epoch": 2.171546785486951,
      "grad_norm": 0.43948911187696654,
      "learning_rate": 4.609857031809794e-05,
      "loss": 1.6386,
      "num_input_tokens_seen": 16104310208,
      "step": 20469
    },
    {
      "epoch": 2.1716528750265223,
      "grad_norm": 0.3776422866373405,
      "learning_rate": 4.609819750562942e-05,
      "loss": 1.6255,
      "num_input_tokens_seen": 16105097008,
      "step": 20470
    },
    {
      "epoch": 2.1717589645660937,
      "grad_norm": 0.3785517934142348,
      "learning_rate": 4.6097824676856835e-05,
      "loss": 1.586,
      "num_input_tokens_seen": 16105883824,
      "step": 20471
    },
    {
      "epoch": 2.171865054105665,
      "grad_norm": 0.3964190060780187,
      "learning_rate": 4.609745183178047e-05,
      "loss": 1.6061,
      "num_input_tokens_seen": 16106670576,
      "step": 20472
    },
    {
      "epoch": 2.1719711436452367,
      "grad_norm": 0.3664588118108991,
      "learning_rate": 4.609707897040061e-05,
      "loss": 1.5018,
      "num_input_tokens_seen": 16107457392,
      "step": 20473
    },
    {
      "epoch": 2.172077233184808,
      "grad_norm": 0.4427821218223575,
      "learning_rate": 4.609670609271754e-05,
      "loss": 1.5991,
      "num_input_tokens_seen": 16108244096,
      "step": 20474
    },
    {
      "epoch": 2.172183322724379,
      "grad_norm": 0.35791736127342144,
      "learning_rate": 4.609633319873156e-05,
      "loss": 1.4629,
      "num_input_tokens_seen": 16109030848,
      "step": 20475
    },
    {
      "epoch": 2.1722894122639507,
      "grad_norm": 0.5769516316158595,
      "learning_rate": 4.609596028844295e-05,
      "loss": 1.6979,
      "num_input_tokens_seen": 16109817696,
      "step": 20476
    },
    {
      "epoch": 2.172395501803522,
      "grad_norm": 0.39612785963878194,
      "learning_rate": 4.6095587361852005e-05,
      "loss": 1.6751,
      "num_input_tokens_seen": 16110604464,
      "step": 20477
    },
    {
      "epoch": 2.1725015913430936,
      "grad_norm": 0.5096549319853444,
      "learning_rate": 4.6095214418959006e-05,
      "loss": 1.6506,
      "num_input_tokens_seen": 16111391120,
      "step": 20478
    },
    {
      "epoch": 2.172607680882665,
      "grad_norm": 0.3398364587981443,
      "learning_rate": 4.609484145976425e-05,
      "loss": 1.653,
      "num_input_tokens_seen": 16112177840,
      "step": 20479
    },
    {
      "epoch": 2.1727137704222366,
      "grad_norm": 0.417303103013537,
      "learning_rate": 4.609446848426802e-05,
      "loss": 1.8288,
      "num_input_tokens_seen": 16112964592,
      "step": 20480
    },
    {
      "epoch": 2.1728198599618076,
      "grad_norm": 0.403594653486033,
      "learning_rate": 4.609409549247059e-05,
      "loss": 1.7457,
      "num_input_tokens_seen": 16113751280,
      "step": 20481
    },
    {
      "epoch": 2.172925949501379,
      "grad_norm": 0.34529470468181456,
      "learning_rate": 4.609372248437227e-05,
      "loss": 1.5489,
      "num_input_tokens_seen": 16114537952,
      "step": 20482
    },
    {
      "epoch": 2.1730320390409505,
      "grad_norm": 0.43881565321505467,
      "learning_rate": 4.609334945997334e-05,
      "loss": 1.5919,
      "num_input_tokens_seen": 16115324672,
      "step": 20483
    },
    {
      "epoch": 2.173138128580522,
      "grad_norm": 0.44015161323561136,
      "learning_rate": 4.6092976419274094e-05,
      "loss": 1.6621,
      "num_input_tokens_seen": 16116111424,
      "step": 20484
    },
    {
      "epoch": 2.1732442181200935,
      "grad_norm": 0.3789963555422051,
      "learning_rate": 4.6092603362274814e-05,
      "loss": 1.5576,
      "num_input_tokens_seen": 16116898288,
      "step": 20485
    },
    {
      "epoch": 2.173350307659665,
      "grad_norm": 0.49107082768567506,
      "learning_rate": 4.609223028897578e-05,
      "loss": 1.6764,
      "num_input_tokens_seen": 16117685056,
      "step": 20486
    },
    {
      "epoch": 2.173456397199236,
      "grad_norm": 0.34891104437295073,
      "learning_rate": 4.60918571993773e-05,
      "loss": 1.7178,
      "num_input_tokens_seen": 16118471728,
      "step": 20487
    },
    {
      "epoch": 2.1735624867388075,
      "grad_norm": 0.4284670057111342,
      "learning_rate": 4.609148409347964e-05,
      "loss": 1.6438,
      "num_input_tokens_seen": 16119258528,
      "step": 20488
    },
    {
      "epoch": 2.173668576278379,
      "grad_norm": 0.368651103099214,
      "learning_rate": 4.60911109712831e-05,
      "loss": 1.6153,
      "num_input_tokens_seen": 16120045312,
      "step": 20489
    },
    {
      "epoch": 2.1737746658179504,
      "grad_norm": 0.36767352386303676,
      "learning_rate": 4.609073783278798e-05,
      "loss": 1.5829,
      "num_input_tokens_seen": 16120832080,
      "step": 20490
    },
    {
      "epoch": 2.173880755357522,
      "grad_norm": 0.32846788004875294,
      "learning_rate": 4.609036467799455e-05,
      "loss": 1.4462,
      "num_input_tokens_seen": 16121618896,
      "step": 20491
    },
    {
      "epoch": 2.173986844897093,
      "grad_norm": 0.4589965881962218,
      "learning_rate": 4.608999150690311e-05,
      "loss": 1.6757,
      "num_input_tokens_seen": 16122405712,
      "step": 20492
    },
    {
      "epoch": 2.1740929344366644,
      "grad_norm": 0.39368695876010285,
      "learning_rate": 4.6089618319513936e-05,
      "loss": 1.6507,
      "num_input_tokens_seen": 16123192416,
      "step": 20493
    },
    {
      "epoch": 2.174199023976236,
      "grad_norm": 0.40521158272039753,
      "learning_rate": 4.6089245115827326e-05,
      "loss": 1.5704,
      "num_input_tokens_seen": 16123979152,
      "step": 20494
    },
    {
      "epoch": 2.1743051135158074,
      "grad_norm": 0.3886160066322247,
      "learning_rate": 4.6088871895843566e-05,
      "loss": 1.6083,
      "num_input_tokens_seen": 16124765984,
      "step": 20495
    },
    {
      "epoch": 2.174411203055379,
      "grad_norm": 0.39729709043930717,
      "learning_rate": 4.608849865956295e-05,
      "loss": 1.6244,
      "num_input_tokens_seen": 16125552768,
      "step": 20496
    },
    {
      "epoch": 2.1745172925949503,
      "grad_norm": 0.43572471087408776,
      "learning_rate": 4.6088125406985764e-05,
      "loss": 1.5702,
      "num_input_tokens_seen": 16126339584,
      "step": 20497
    },
    {
      "epoch": 2.1746233821345213,
      "grad_norm": 0.3736684018581935,
      "learning_rate": 4.608775213811228e-05,
      "loss": 1.6449,
      "num_input_tokens_seen": 16127126256,
      "step": 20498
    },
    {
      "epoch": 2.174729471674093,
      "grad_norm": 0.3720872366362312,
      "learning_rate": 4.6087378852942806e-05,
      "loss": 1.6485,
      "num_input_tokens_seen": 16127912976,
      "step": 20499
    },
    {
      "epoch": 2.1748355612136643,
      "grad_norm": 0.43259218113809417,
      "learning_rate": 4.608700555147763e-05,
      "loss": 1.6054,
      "num_input_tokens_seen": 16128699760,
      "step": 20500
    },
    {
      "epoch": 2.1749416507532358,
      "grad_norm": 0.4280410514055376,
      "learning_rate": 4.608663223371702e-05,
      "loss": 1.7839,
      "num_input_tokens_seen": 16129486464,
      "step": 20501
    },
    {
      "epoch": 2.1750477402928072,
      "grad_norm": 0.4391997966203836,
      "learning_rate": 4.608625889966129e-05,
      "loss": 1.6099,
      "num_input_tokens_seen": 16130273264,
      "step": 20502
    },
    {
      "epoch": 2.1751538298323787,
      "grad_norm": 0.3586256348244497,
      "learning_rate": 4.608588554931072e-05,
      "loss": 1.6569,
      "num_input_tokens_seen": 16131060096,
      "step": 20503
    },
    {
      "epoch": 2.1752599193719497,
      "grad_norm": 0.46143925324171464,
      "learning_rate": 4.608551218266559e-05,
      "loss": 1.6849,
      "num_input_tokens_seen": 16131846848,
      "step": 20504
    },
    {
      "epoch": 2.175366008911521,
      "grad_norm": 0.42834368594452377,
      "learning_rate": 4.60851387997262e-05,
      "loss": 1.6217,
      "num_input_tokens_seen": 16132633584,
      "step": 20505
    },
    {
      "epoch": 2.1754720984510927,
      "grad_norm": 0.41023897886146293,
      "learning_rate": 4.608476540049284e-05,
      "loss": 1.6028,
      "num_input_tokens_seen": 16133420256,
      "step": 20506
    },
    {
      "epoch": 2.175578187990664,
      "grad_norm": 0.3433790775370837,
      "learning_rate": 4.6084391984965775e-05,
      "loss": 1.5674,
      "num_input_tokens_seen": 16134206976,
      "step": 20507
    },
    {
      "epoch": 2.1756842775302356,
      "grad_norm": 0.3921841870354056,
      "learning_rate": 4.6084018553145316e-05,
      "loss": 1.5753,
      "num_input_tokens_seen": 16134993728,
      "step": 20508
    },
    {
      "epoch": 2.175790367069807,
      "grad_norm": 0.42044159558036664,
      "learning_rate": 4.608364510503175e-05,
      "loss": 1.5755,
      "num_input_tokens_seen": 16135780400,
      "step": 20509
    },
    {
      "epoch": 2.175896456609378,
      "grad_norm": 0.38147403748539893,
      "learning_rate": 4.608327164062536e-05,
      "loss": 1.6314,
      "num_input_tokens_seen": 16136567120,
      "step": 20510
    },
    {
      "epoch": 2.1760025461489496,
      "grad_norm": 0.35639895525680304,
      "learning_rate": 4.6082898159926434e-05,
      "loss": 1.4932,
      "num_input_tokens_seen": 16137353952,
      "step": 20511
    },
    {
      "epoch": 2.176108635688521,
      "grad_norm": 0.3788029118473984,
      "learning_rate": 4.6082524662935266e-05,
      "loss": 1.6069,
      "num_input_tokens_seen": 16138140752,
      "step": 20512
    },
    {
      "epoch": 2.1762147252280926,
      "grad_norm": 0.38056096642396287,
      "learning_rate": 4.6082151149652145e-05,
      "loss": 1.6599,
      "num_input_tokens_seen": 16138927440,
      "step": 20513
    },
    {
      "epoch": 2.176320814767664,
      "grad_norm": 0.3540720009434906,
      "learning_rate": 4.608177762007735e-05,
      "loss": 1.6167,
      "num_input_tokens_seen": 16139714240,
      "step": 20514
    },
    {
      "epoch": 2.1764269043072355,
      "grad_norm": 0.3654482545342208,
      "learning_rate": 4.608140407421118e-05,
      "loss": 1.5014,
      "num_input_tokens_seen": 16140501008,
      "step": 20515
    },
    {
      "epoch": 2.1765329938468065,
      "grad_norm": 0.36850422008422523,
      "learning_rate": 4.608103051205392e-05,
      "loss": 1.6175,
      "num_input_tokens_seen": 16141287680,
      "step": 20516
    },
    {
      "epoch": 2.176639083386378,
      "grad_norm": 0.41491750329858107,
      "learning_rate": 4.608065693360586e-05,
      "loss": 1.5556,
      "num_input_tokens_seen": 16142074544,
      "step": 20517
    },
    {
      "epoch": 2.1767451729259495,
      "grad_norm": 0.33352094903273255,
      "learning_rate": 4.6080283338867274e-05,
      "loss": 1.4537,
      "num_input_tokens_seen": 16142861296,
      "step": 20518
    },
    {
      "epoch": 2.176851262465521,
      "grad_norm": 0.3957583912055295,
      "learning_rate": 4.6079909727838475e-05,
      "loss": 1.5785,
      "num_input_tokens_seen": 16143648080,
      "step": 20519
    },
    {
      "epoch": 2.1769573520050924,
      "grad_norm": 0.3812746799897157,
      "learning_rate": 4.607953610051974e-05,
      "loss": 1.765,
      "num_input_tokens_seen": 16144434832,
      "step": 20520
    },
    {
      "epoch": 2.1770634415446635,
      "grad_norm": 0.36035190121355665,
      "learning_rate": 4.607916245691135e-05,
      "loss": 1.5595,
      "num_input_tokens_seen": 16145221568,
      "step": 20521
    },
    {
      "epoch": 2.177169531084235,
      "grad_norm": 0.3204539515957895,
      "learning_rate": 4.607878879701361e-05,
      "loss": 1.4945,
      "num_input_tokens_seen": 16146008320,
      "step": 20522
    },
    {
      "epoch": 2.1772756206238064,
      "grad_norm": 0.35431922463429993,
      "learning_rate": 4.60784151208268e-05,
      "loss": 1.5268,
      "num_input_tokens_seen": 16146795152,
      "step": 20523
    },
    {
      "epoch": 2.177381710163378,
      "grad_norm": 0.4112329162450089,
      "learning_rate": 4.60780414283512e-05,
      "loss": 1.6208,
      "num_input_tokens_seen": 16147581872,
      "step": 20524
    },
    {
      "epoch": 2.1774877997029494,
      "grad_norm": 0.42165174862743177,
      "learning_rate": 4.607766771958712e-05,
      "loss": 1.6046,
      "num_input_tokens_seen": 16148368656,
      "step": 20525
    },
    {
      "epoch": 2.177593889242521,
      "grad_norm": 0.3720746873703661,
      "learning_rate": 4.607729399453483e-05,
      "loss": 1.5526,
      "num_input_tokens_seen": 16149155424,
      "step": 20526
    },
    {
      "epoch": 2.1776999787820923,
      "grad_norm": 0.42386214017892065,
      "learning_rate": 4.6076920253194635e-05,
      "loss": 1.6001,
      "num_input_tokens_seen": 16149942192,
      "step": 20527
    },
    {
      "epoch": 2.1778060683216633,
      "grad_norm": 0.3402907485285083,
      "learning_rate": 4.60765464955668e-05,
      "loss": 1.5074,
      "num_input_tokens_seen": 16150729072,
      "step": 20528
    },
    {
      "epoch": 2.177912157861235,
      "grad_norm": 0.41445113476258555,
      "learning_rate": 4.607617272165164e-05,
      "loss": 1.7243,
      "num_input_tokens_seen": 16151515888,
      "step": 20529
    },
    {
      "epoch": 2.1780182474008063,
      "grad_norm": 0.35176470497100126,
      "learning_rate": 4.607579893144943e-05,
      "loss": 1.6045,
      "num_input_tokens_seen": 16152302672,
      "step": 20530
    },
    {
      "epoch": 2.1781243369403778,
      "grad_norm": 0.39721567378175593,
      "learning_rate": 4.607542512496046e-05,
      "loss": 1.8134,
      "num_input_tokens_seen": 16153089440,
      "step": 20531
    },
    {
      "epoch": 2.1782304264799492,
      "grad_norm": 0.3744904327867653,
      "learning_rate": 4.6075051302185016e-05,
      "loss": 1.6812,
      "num_input_tokens_seen": 16153876160,
      "step": 20532
    },
    {
      "epoch": 2.1783365160195203,
      "grad_norm": 0.33109378658796773,
      "learning_rate": 4.6074677463123394e-05,
      "loss": 1.4644,
      "num_input_tokens_seen": 16154662928,
      "step": 20533
    },
    {
      "epoch": 2.1784426055590917,
      "grad_norm": 0.3537785536619329,
      "learning_rate": 4.6074303607775876e-05,
      "loss": 1.6478,
      "num_input_tokens_seen": 16155449760,
      "step": 20534
    },
    {
      "epoch": 2.1785486950986632,
      "grad_norm": 0.3234954952462035,
      "learning_rate": 4.6073929736142754e-05,
      "loss": 1.5095,
      "num_input_tokens_seen": 16156236608,
      "step": 20535
    },
    {
      "epoch": 2.1786547846382347,
      "grad_norm": 0.34543742296818575,
      "learning_rate": 4.6073555848224325e-05,
      "loss": 1.4986,
      "num_input_tokens_seen": 16157023440,
      "step": 20536
    },
    {
      "epoch": 2.178760874177806,
      "grad_norm": 0.35610782596430435,
      "learning_rate": 4.607318194402087e-05,
      "loss": 1.5812,
      "num_input_tokens_seen": 16157810176,
      "step": 20537
    },
    {
      "epoch": 2.1788669637173776,
      "grad_norm": 0.3758136210287025,
      "learning_rate": 4.607280802353267e-05,
      "loss": 1.7709,
      "num_input_tokens_seen": 16158596896,
      "step": 20538
    },
    {
      "epoch": 2.1789730532569487,
      "grad_norm": 0.4385627688091069,
      "learning_rate": 4.607243408676003e-05,
      "loss": 1.6221,
      "num_input_tokens_seen": 16159383632,
      "step": 20539
    },
    {
      "epoch": 2.17907914279652,
      "grad_norm": 0.39635018947067996,
      "learning_rate": 4.607206013370323e-05,
      "loss": 1.4819,
      "num_input_tokens_seen": 16160170480,
      "step": 20540
    },
    {
      "epoch": 2.1791852323360916,
      "grad_norm": 0.4085683201809536,
      "learning_rate": 4.607168616436255e-05,
      "loss": 1.6122,
      "num_input_tokens_seen": 16160957248,
      "step": 20541
    },
    {
      "epoch": 2.179291321875663,
      "grad_norm": 0.49840111474488646,
      "learning_rate": 4.6071312178738304e-05,
      "loss": 1.7733,
      "num_input_tokens_seen": 16161744032,
      "step": 20542
    },
    {
      "epoch": 2.1793974114152346,
      "grad_norm": 0.44158031858101837,
      "learning_rate": 4.6070938176830756e-05,
      "loss": 1.6308,
      "num_input_tokens_seen": 16162530816,
      "step": 20543
    },
    {
      "epoch": 2.179503500954806,
      "grad_norm": 0.7023851539294701,
      "learning_rate": 4.6070564158640205e-05,
      "loss": 1.639,
      "num_input_tokens_seen": 16163317696,
      "step": 20544
    },
    {
      "epoch": 2.179609590494377,
      "grad_norm": 0.3703002160244905,
      "learning_rate": 4.6070190124166943e-05,
      "loss": 1.5874,
      "num_input_tokens_seen": 16164104496,
      "step": 20545
    },
    {
      "epoch": 2.1797156800339486,
      "grad_norm": 0.6001312492367343,
      "learning_rate": 4.606981607341126e-05,
      "loss": 1.691,
      "num_input_tokens_seen": 16164891200,
      "step": 20546
    },
    {
      "epoch": 2.17982176957352,
      "grad_norm": 0.3753291579912656,
      "learning_rate": 4.606944200637344e-05,
      "loss": 1.5266,
      "num_input_tokens_seen": 16165677872,
      "step": 20547
    },
    {
      "epoch": 2.1799278591130915,
      "grad_norm": 0.5892932226676977,
      "learning_rate": 4.6069067923053774e-05,
      "loss": 1.6665,
      "num_input_tokens_seen": 16166464608,
      "step": 20548
    },
    {
      "epoch": 2.180033948652663,
      "grad_norm": 0.4834165900347388,
      "learning_rate": 4.606869382345255e-05,
      "loss": 1.6625,
      "num_input_tokens_seen": 16167251328,
      "step": 20549
    },
    {
      "epoch": 2.1801400381922345,
      "grad_norm": 0.5455510266880658,
      "learning_rate": 4.606831970757005e-05,
      "loss": 1.6872,
      "num_input_tokens_seen": 16168038080,
      "step": 20550
    },
    {
      "epoch": 2.1802461277318055,
      "grad_norm": 0.4806395230703507,
      "learning_rate": 4.606794557540658e-05,
      "loss": 1.6283,
      "num_input_tokens_seen": 16168824832,
      "step": 20551
    },
    {
      "epoch": 2.180352217271377,
      "grad_norm": 0.524557150798194,
      "learning_rate": 4.606757142696242e-05,
      "loss": 1.7454,
      "num_input_tokens_seen": 16169611680,
      "step": 20552
    },
    {
      "epoch": 2.1804583068109484,
      "grad_norm": 0.40064589583042615,
      "learning_rate": 4.606719726223785e-05,
      "loss": 1.6159,
      "num_input_tokens_seen": 16170398368,
      "step": 20553
    },
    {
      "epoch": 2.18056439635052,
      "grad_norm": 0.48769553312374514,
      "learning_rate": 4.606682308123318e-05,
      "loss": 1.6293,
      "num_input_tokens_seen": 16171185088,
      "step": 20554
    },
    {
      "epoch": 2.1806704858900914,
      "grad_norm": 0.3939554096862864,
      "learning_rate": 4.606644888394868e-05,
      "loss": 1.6363,
      "num_input_tokens_seen": 16171971808,
      "step": 20555
    },
    {
      "epoch": 2.180776575429663,
      "grad_norm": 0.432899883713003,
      "learning_rate": 4.606607467038465e-05,
      "loss": 1.6385,
      "num_input_tokens_seen": 16172758560,
      "step": 20556
    },
    {
      "epoch": 2.180882664969234,
      "grad_norm": 0.4916298576907678,
      "learning_rate": 4.606570044054137e-05,
      "loss": 1.6678,
      "num_input_tokens_seen": 16173545216,
      "step": 20557
    },
    {
      "epoch": 2.1809887545088054,
      "grad_norm": 0.4570259452999594,
      "learning_rate": 4.606532619441914e-05,
      "loss": 1.624,
      "num_input_tokens_seen": 16174331904,
      "step": 20558
    },
    {
      "epoch": 2.181094844048377,
      "grad_norm": 0.5985087028921471,
      "learning_rate": 4.606495193201824e-05,
      "loss": 1.644,
      "num_input_tokens_seen": 16175118688,
      "step": 20559
    },
    {
      "epoch": 2.1812009335879483,
      "grad_norm": 0.44469697733791536,
      "learning_rate": 4.606457765333897e-05,
      "loss": 1.7234,
      "num_input_tokens_seen": 16175905392,
      "step": 20560
    },
    {
      "epoch": 2.18130702312752,
      "grad_norm": 0.5683383305602783,
      "learning_rate": 4.6064203358381605e-05,
      "loss": 1.7176,
      "num_input_tokens_seen": 16176692128,
      "step": 20561
    },
    {
      "epoch": 2.181413112667091,
      "grad_norm": 0.34964257579287805,
      "learning_rate": 4.606382904714645e-05,
      "loss": 1.586,
      "num_input_tokens_seen": 16177478928,
      "step": 20562
    },
    {
      "epoch": 2.1815192022066623,
      "grad_norm": 0.54604025854751,
      "learning_rate": 4.6063454719633776e-05,
      "loss": 1.4803,
      "num_input_tokens_seen": 16178265680,
      "step": 20563
    },
    {
      "epoch": 2.1816252917462338,
      "grad_norm": 0.47038716376503287,
      "learning_rate": 4.606308037584389e-05,
      "loss": 1.7092,
      "num_input_tokens_seen": 16179052416,
      "step": 20564
    },
    {
      "epoch": 2.1817313812858052,
      "grad_norm": 0.38024973709119086,
      "learning_rate": 4.606270601577707e-05,
      "loss": 1.516,
      "num_input_tokens_seen": 16179839248,
      "step": 20565
    },
    {
      "epoch": 2.1818374708253767,
      "grad_norm": 0.558952059898152,
      "learning_rate": 4.60623316394336e-05,
      "loss": 1.5678,
      "num_input_tokens_seen": 16180626016,
      "step": 20566
    },
    {
      "epoch": 2.181943560364948,
      "grad_norm": 0.481171614887281,
      "learning_rate": 4.606195724681379e-05,
      "loss": 1.5695,
      "num_input_tokens_seen": 16181412768,
      "step": 20567
    },
    {
      "epoch": 2.182049649904519,
      "grad_norm": 0.5134665712759515,
      "learning_rate": 4.6061582837917914e-05,
      "loss": 1.672,
      "num_input_tokens_seen": 16182199552,
      "step": 20568
    },
    {
      "epoch": 2.1821557394440907,
      "grad_norm": 0.49238297417163546,
      "learning_rate": 4.606120841274627e-05,
      "loss": 1.6259,
      "num_input_tokens_seen": 16182986336,
      "step": 20569
    },
    {
      "epoch": 2.182261828983662,
      "grad_norm": 0.45479717770582373,
      "learning_rate": 4.606083397129913e-05,
      "loss": 1.677,
      "num_input_tokens_seen": 16183773120,
      "step": 20570
    },
    {
      "epoch": 2.1823679185232336,
      "grad_norm": 0.3745883048925415,
      "learning_rate": 4.60604595135768e-05,
      "loss": 1.4741,
      "num_input_tokens_seen": 16184559888,
      "step": 20571
    },
    {
      "epoch": 2.182474008062805,
      "grad_norm": 0.5578185105183017,
      "learning_rate": 4.6060085039579575e-05,
      "loss": 1.5551,
      "num_input_tokens_seen": 16185346768,
      "step": 20572
    },
    {
      "epoch": 2.1825800976023766,
      "grad_norm": 0.4347403062599569,
      "learning_rate": 4.605971054930773e-05,
      "loss": 1.7349,
      "num_input_tokens_seen": 16186133456,
      "step": 20573
    },
    {
      "epoch": 2.1826861871419476,
      "grad_norm": 0.44733507657310534,
      "learning_rate": 4.605933604276155e-05,
      "loss": 1.531,
      "num_input_tokens_seen": 16186920288,
      "step": 20574
    },
    {
      "epoch": 2.182792276681519,
      "grad_norm": 0.45198856150965216,
      "learning_rate": 4.605896151994134e-05,
      "loss": 1.5845,
      "num_input_tokens_seen": 16187707104,
      "step": 20575
    },
    {
      "epoch": 2.1828983662210906,
      "grad_norm": 0.5502296480870182,
      "learning_rate": 4.605858698084738e-05,
      "loss": 1.569,
      "num_input_tokens_seen": 16188493872,
      "step": 20576
    },
    {
      "epoch": 2.183004455760662,
      "grad_norm": 0.8198485941497623,
      "learning_rate": 4.605821242547996e-05,
      "loss": 1.6463,
      "num_input_tokens_seen": 16189280672,
      "step": 20577
    },
    {
      "epoch": 2.1831105453002335,
      "grad_norm": 0.486272212589764,
      "learning_rate": 4.605783785383938e-05,
      "loss": 1.6359,
      "num_input_tokens_seen": 16190067504,
      "step": 20578
    },
    {
      "epoch": 2.183216634839805,
      "grad_norm": 0.5641233542363535,
      "learning_rate": 4.6057463265925915e-05,
      "loss": 1.6204,
      "num_input_tokens_seen": 16190854272,
      "step": 20579
    },
    {
      "epoch": 2.183322724379376,
      "grad_norm": 0.5248467057622039,
      "learning_rate": 4.605708866173986e-05,
      "loss": 1.6232,
      "num_input_tokens_seen": 16191640976,
      "step": 20580
    },
    {
      "epoch": 2.1834288139189475,
      "grad_norm": 1.0067849490627034,
      "learning_rate": 4.60567140412815e-05,
      "loss": 1.5006,
      "num_input_tokens_seen": 16192427792,
      "step": 20581
    },
    {
      "epoch": 2.183534903458519,
      "grad_norm": 0.7905286743429323,
      "learning_rate": 4.605633940455114e-05,
      "loss": 1.7143,
      "num_input_tokens_seen": 16193214560,
      "step": 20582
    },
    {
      "epoch": 2.1836409929980904,
      "grad_norm": 0.8473958099403311,
      "learning_rate": 4.605596475154905e-05,
      "loss": 1.554,
      "num_input_tokens_seen": 16194001360,
      "step": 20583
    },
    {
      "epoch": 2.183747082537662,
      "grad_norm": 1.5788762322521686,
      "learning_rate": 4.6055590082275535e-05,
      "loss": 1.7794,
      "num_input_tokens_seen": 16194788112,
      "step": 20584
    },
    {
      "epoch": 2.1838531720772334,
      "grad_norm": 0.7467044905817197,
      "learning_rate": 4.605521539673087e-05,
      "loss": 1.5824,
      "num_input_tokens_seen": 16195574944,
      "step": 20585
    },
    {
      "epoch": 2.1839592616168044,
      "grad_norm": 0.7384900655693515,
      "learning_rate": 4.605484069491536e-05,
      "loss": 1.6368,
      "num_input_tokens_seen": 16196361728,
      "step": 20586
    },
    {
      "epoch": 2.184065351156376,
      "grad_norm": 1.2185026563548211,
      "learning_rate": 4.605446597682929e-05,
      "loss": 1.6974,
      "num_input_tokens_seen": 16197148480,
      "step": 20587
    },
    {
      "epoch": 2.1841714406959474,
      "grad_norm": 0.5769445293911653,
      "learning_rate": 4.605409124247293e-05,
      "loss": 1.7361,
      "num_input_tokens_seen": 16197935296,
      "step": 20588
    },
    {
      "epoch": 2.184277530235519,
      "grad_norm": 0.6365477269620328,
      "learning_rate": 4.60537164918466e-05,
      "loss": 1.5614,
      "num_input_tokens_seen": 16198722208,
      "step": 20589
    },
    {
      "epoch": 2.1843836197750903,
      "grad_norm": 0.5040496185415969,
      "learning_rate": 4.605334172495057e-05,
      "loss": 1.6142,
      "num_input_tokens_seen": 16199509008,
      "step": 20590
    },
    {
      "epoch": 2.1844897093146614,
      "grad_norm": 0.40276914016904525,
      "learning_rate": 4.605296694178514e-05,
      "loss": 1.5477,
      "num_input_tokens_seen": 16200295824,
      "step": 20591
    },
    {
      "epoch": 2.184595798854233,
      "grad_norm": 0.5388033601571145,
      "learning_rate": 4.605259214235059e-05,
      "loss": 1.4884,
      "num_input_tokens_seen": 16201082608,
      "step": 20592
    },
    {
      "epoch": 2.1847018883938043,
      "grad_norm": 0.5234825680064521,
      "learning_rate": 4.605221732664722e-05,
      "loss": 1.684,
      "num_input_tokens_seen": 16201869376,
      "step": 20593
    },
    {
      "epoch": 2.1848079779333758,
      "grad_norm": 0.5658010327397309,
      "learning_rate": 4.60518424946753e-05,
      "loss": 1.6388,
      "num_input_tokens_seen": 16202656064,
      "step": 20594
    },
    {
      "epoch": 2.1849140674729473,
      "grad_norm": 0.6100253001894023,
      "learning_rate": 4.605146764643515e-05,
      "loss": 1.6566,
      "num_input_tokens_seen": 16203442768,
      "step": 20595
    },
    {
      "epoch": 2.1850201570125187,
      "grad_norm": 0.44737551579053714,
      "learning_rate": 4.6051092781927035e-05,
      "loss": 1.675,
      "num_input_tokens_seen": 16204229552,
      "step": 20596
    },
    {
      "epoch": 2.1851262465520898,
      "grad_norm": 0.6563980603834723,
      "learning_rate": 4.6050717901151254e-05,
      "loss": 1.6524,
      "num_input_tokens_seen": 16205016320,
      "step": 20597
    },
    {
      "epoch": 2.1852323360916612,
      "grad_norm": 0.4802391865064597,
      "learning_rate": 4.6050343004108096e-05,
      "loss": 1.6505,
      "num_input_tokens_seen": 16205803120,
      "step": 20598
    },
    {
      "epoch": 2.1853384256312327,
      "grad_norm": 0.80933276037541,
      "learning_rate": 4.604996809079786e-05,
      "loss": 1.6659,
      "num_input_tokens_seen": 16206589840,
      "step": 20599
    },
    {
      "epoch": 2.185444515170804,
      "grad_norm": 0.646986712920143,
      "learning_rate": 4.604959316122082e-05,
      "loss": 1.5942,
      "num_input_tokens_seen": 16207376656,
      "step": 20600
    },
    {
      "epoch": 2.1855506047103757,
      "grad_norm": 0.8088815278971155,
      "learning_rate": 4.6049218215377265e-05,
      "loss": 1.6377,
      "num_input_tokens_seen": 16208163520,
      "step": 20601
    },
    {
      "epoch": 2.185656694249947,
      "grad_norm": 0.7082854069339676,
      "learning_rate": 4.6048843253267496e-05,
      "loss": 1.5781,
      "num_input_tokens_seen": 16208950224,
      "step": 20602
    },
    {
      "epoch": 2.185762783789518,
      "grad_norm": 0.774097768483329,
      "learning_rate": 4.60484682748918e-05,
      "loss": 1.7741,
      "num_input_tokens_seen": 16209737008,
      "step": 20603
    },
    {
      "epoch": 2.1858688733290896,
      "grad_norm": 0.5623027733764137,
      "learning_rate": 4.604809328025047e-05,
      "loss": 1.5478,
      "num_input_tokens_seen": 16210523776,
      "step": 20604
    },
    {
      "epoch": 2.185974962868661,
      "grad_norm": 0.9057399335619883,
      "learning_rate": 4.6047718269343784e-05,
      "loss": 1.5609,
      "num_input_tokens_seen": 16211310640,
      "step": 20605
    },
    {
      "epoch": 2.1860810524082326,
      "grad_norm": 1.0441556632624118,
      "learning_rate": 4.604734324217204e-05,
      "loss": 1.6502,
      "num_input_tokens_seen": 16212097376,
      "step": 20606
    },
    {
      "epoch": 2.186187141947804,
      "grad_norm": 0.5063123354908016,
      "learning_rate": 4.604696819873553e-05,
      "loss": 1.7685,
      "num_input_tokens_seen": 16212884096,
      "step": 20607
    },
    {
      "epoch": 2.1862932314873755,
      "grad_norm": 0.8263657250420966,
      "learning_rate": 4.604659313903453e-05,
      "loss": 1.581,
      "num_input_tokens_seen": 16213670880,
      "step": 20608
    },
    {
      "epoch": 2.1863993210269466,
      "grad_norm": 0.6722852108816171,
      "learning_rate": 4.604621806306936e-05,
      "loss": 1.5919,
      "num_input_tokens_seen": 16214457744,
      "step": 20609
    },
    {
      "epoch": 2.186505410566518,
      "grad_norm": 0.7063524916422252,
      "learning_rate": 4.604584297084028e-05,
      "loss": 1.6134,
      "num_input_tokens_seen": 16215244480,
      "step": 20610
    },
    {
      "epoch": 2.1866115001060895,
      "grad_norm": 0.46383592737815,
      "learning_rate": 4.604546786234758e-05,
      "loss": 1.5603,
      "num_input_tokens_seen": 16216031232,
      "step": 20611
    },
    {
      "epoch": 2.186717589645661,
      "grad_norm": 0.7265127776832795,
      "learning_rate": 4.604509273759157e-05,
      "loss": 1.7751,
      "num_input_tokens_seen": 16216818000,
      "step": 20612
    },
    {
      "epoch": 2.1868236791852325,
      "grad_norm": 0.5901092911858548,
      "learning_rate": 4.604471759657253e-05,
      "loss": 1.6792,
      "num_input_tokens_seen": 16217604704,
      "step": 20613
    },
    {
      "epoch": 2.186929768724804,
      "grad_norm": 0.4622799238023723,
      "learning_rate": 4.604434243929075e-05,
      "loss": 1.5309,
      "num_input_tokens_seen": 16218391568,
      "step": 20614
    },
    {
      "epoch": 2.187035858264375,
      "grad_norm": 0.5163796588453587,
      "learning_rate": 4.6043967265746516e-05,
      "loss": 1.6689,
      "num_input_tokens_seen": 16219178256,
      "step": 20615
    },
    {
      "epoch": 2.1871419478039464,
      "grad_norm": 0.45962831340036686,
      "learning_rate": 4.604359207594012e-05,
      "loss": 1.6256,
      "num_input_tokens_seen": 16219965008,
      "step": 20616
    },
    {
      "epoch": 2.187248037343518,
      "grad_norm": 0.4725033494343833,
      "learning_rate": 4.6043216869871866e-05,
      "loss": 1.7512,
      "num_input_tokens_seen": 16220751776,
      "step": 20617
    },
    {
      "epoch": 2.1873541268830894,
      "grad_norm": 0.4996064791950129,
      "learning_rate": 4.6042841647542015e-05,
      "loss": 1.6154,
      "num_input_tokens_seen": 16221538528,
      "step": 20618
    },
    {
      "epoch": 2.187460216422661,
      "grad_norm": 0.4808089952611635,
      "learning_rate": 4.604246640895089e-05,
      "loss": 1.5092,
      "num_input_tokens_seen": 16222325328,
      "step": 20619
    },
    {
      "epoch": 2.187566305962232,
      "grad_norm": 0.39321380951766044,
      "learning_rate": 4.604209115409875e-05,
      "loss": 1.5445,
      "num_input_tokens_seen": 16223112096,
      "step": 20620
    },
    {
      "epoch": 2.1876723955018034,
      "grad_norm": 0.4635111344529959,
      "learning_rate": 4.60417158829859e-05,
      "loss": 1.6627,
      "num_input_tokens_seen": 16223898736,
      "step": 20621
    },
    {
      "epoch": 2.187778485041375,
      "grad_norm": 0.4513700964118094,
      "learning_rate": 4.604134059561264e-05,
      "loss": 1.5451,
      "num_input_tokens_seen": 16224685504,
      "step": 20622
    },
    {
      "epoch": 2.1878845745809463,
      "grad_norm": 0.38203817631111175,
      "learning_rate": 4.604096529197924e-05,
      "loss": 1.5924,
      "num_input_tokens_seen": 16225472256,
      "step": 20623
    },
    {
      "epoch": 2.187990664120518,
      "grad_norm": 0.3889817372900607,
      "learning_rate": 4.604058997208601e-05,
      "loss": 1.4315,
      "num_input_tokens_seen": 16226259072,
      "step": 20624
    },
    {
      "epoch": 2.1880967536600893,
      "grad_norm": 0.5191750477460112,
      "learning_rate": 4.604021463593322e-05,
      "loss": 1.6123,
      "num_input_tokens_seen": 16227045824,
      "step": 20625
    },
    {
      "epoch": 2.1882028431996607,
      "grad_norm": 0.4252351292113284,
      "learning_rate": 4.603983928352117e-05,
      "loss": 1.7597,
      "num_input_tokens_seen": 16227832592,
      "step": 20626
    },
    {
      "epoch": 2.1883089327392318,
      "grad_norm": 0.6135092372320314,
      "learning_rate": 4.6039463914850156e-05,
      "loss": 1.6458,
      "num_input_tokens_seen": 16228619312,
      "step": 20627
    },
    {
      "epoch": 2.1884150222788032,
      "grad_norm": 0.508805166981603,
      "learning_rate": 4.603908852992045e-05,
      "loss": 1.6327,
      "num_input_tokens_seen": 16229406032,
      "step": 20628
    },
    {
      "epoch": 2.1885211118183747,
      "grad_norm": 0.4956904707764008,
      "learning_rate": 4.603871312873237e-05,
      "loss": 1.4703,
      "num_input_tokens_seen": 16230192864,
      "step": 20629
    },
    {
      "epoch": 2.188627201357946,
      "grad_norm": 0.374909322791257,
      "learning_rate": 4.603833771128617e-05,
      "loss": 1.5092,
      "num_input_tokens_seen": 16230979632,
      "step": 20630
    },
    {
      "epoch": 2.1887332908975177,
      "grad_norm": 0.5044349640386463,
      "learning_rate": 4.6037962277582175e-05,
      "loss": 1.5967,
      "num_input_tokens_seen": 16231766384,
      "step": 20631
    },
    {
      "epoch": 2.1888393804370887,
      "grad_norm": 0.5340133219878102,
      "learning_rate": 4.603758682762066e-05,
      "loss": 1.7407,
      "num_input_tokens_seen": 16232553136,
      "step": 20632
    },
    {
      "epoch": 2.18894546997666,
      "grad_norm": 0.5192468665262053,
      "learning_rate": 4.603721136140191e-05,
      "loss": 1.6422,
      "num_input_tokens_seen": 16233339904,
      "step": 20633
    },
    {
      "epoch": 2.1890515595162316,
      "grad_norm": 0.6644772206437409,
      "learning_rate": 4.603683587892622e-05,
      "loss": 1.7196,
      "num_input_tokens_seen": 16234126640,
      "step": 20634
    },
    {
      "epoch": 2.189157649055803,
      "grad_norm": 0.6542224180331113,
      "learning_rate": 4.603646038019388e-05,
      "loss": 1.5668,
      "num_input_tokens_seen": 16234913408,
      "step": 20635
    },
    {
      "epoch": 2.1892637385953746,
      "grad_norm": 0.8828482674317607,
      "learning_rate": 4.6036084865205186e-05,
      "loss": 1.553,
      "num_input_tokens_seen": 16235700272,
      "step": 20636
    },
    {
      "epoch": 2.189369828134946,
      "grad_norm": 0.6167435270098773,
      "learning_rate": 4.6035709333960414e-05,
      "loss": 1.5257,
      "num_input_tokens_seen": 16236487088,
      "step": 20637
    },
    {
      "epoch": 2.189475917674517,
      "grad_norm": 1.6781286319705062,
      "learning_rate": 4.6035333786459866e-05,
      "loss": 1.5197,
      "num_input_tokens_seen": 16237273904,
      "step": 20638
    },
    {
      "epoch": 2.1895820072140886,
      "grad_norm": 0.5448802628775458,
      "learning_rate": 4.603495822270384e-05,
      "loss": 1.6946,
      "num_input_tokens_seen": 16238060720,
      "step": 20639
    },
    {
      "epoch": 2.18968809675366,
      "grad_norm": 1.3976867365444579,
      "learning_rate": 4.6034582642692604e-05,
      "loss": 1.6788,
      "num_input_tokens_seen": 16238847504,
      "step": 20640
    },
    {
      "epoch": 2.1897941862932315,
      "grad_norm": 0.8807152869102125,
      "learning_rate": 4.603420704642646e-05,
      "loss": 1.685,
      "num_input_tokens_seen": 16239634304,
      "step": 20641
    },
    {
      "epoch": 2.189900275832803,
      "grad_norm": 0.49500872135032814,
      "learning_rate": 4.60338314339057e-05,
      "loss": 1.6962,
      "num_input_tokens_seen": 16240420944,
      "step": 20642
    },
    {
      "epoch": 2.1900063653723745,
      "grad_norm": 0.5959557763490692,
      "learning_rate": 4.6033455805130616e-05,
      "loss": 1.6014,
      "num_input_tokens_seen": 16241207760,
      "step": 20643
    },
    {
      "epoch": 2.1901124549119455,
      "grad_norm": 0.7091054435564685,
      "learning_rate": 4.603308016010149e-05,
      "loss": 1.5912,
      "num_input_tokens_seen": 16241994512,
      "step": 20644
    },
    {
      "epoch": 2.190218544451517,
      "grad_norm": 0.5244883853968851,
      "learning_rate": 4.603270449881861e-05,
      "loss": 1.627,
      "num_input_tokens_seen": 16242781296,
      "step": 20645
    },
    {
      "epoch": 2.1903246339910885,
      "grad_norm": 0.5484506690913123,
      "learning_rate": 4.603232882128229e-05,
      "loss": 1.4796,
      "num_input_tokens_seen": 16243568096,
      "step": 20646
    },
    {
      "epoch": 2.19043072353066,
      "grad_norm": 0.5759390978031429,
      "learning_rate": 4.603195312749279e-05,
      "loss": 1.7036,
      "num_input_tokens_seen": 16244354848,
      "step": 20647
    },
    {
      "epoch": 2.1905368130702314,
      "grad_norm": 0.9133933970253633,
      "learning_rate": 4.603157741745042e-05,
      "loss": 1.8171,
      "num_input_tokens_seen": 16245141600,
      "step": 20648
    },
    {
      "epoch": 2.190642902609803,
      "grad_norm": 1.4221923912448444,
      "learning_rate": 4.603120169115547e-05,
      "loss": 1.4532,
      "num_input_tokens_seen": 16245928368,
      "step": 20649
    },
    {
      "epoch": 2.190748992149374,
      "grad_norm": 0.6716908564725508,
      "learning_rate": 4.603082594860821e-05,
      "loss": 1.6948,
      "num_input_tokens_seen": 16246715168,
      "step": 20650
    },
    {
      "epoch": 2.1908550816889454,
      "grad_norm": 0.7126182711742823,
      "learning_rate": 4.6030450189808946e-05,
      "loss": 1.5107,
      "num_input_tokens_seen": 16247501968,
      "step": 20651
    },
    {
      "epoch": 2.190961171228517,
      "grad_norm": 0.7346556335556765,
      "learning_rate": 4.6030074414757984e-05,
      "loss": 1.6399,
      "num_input_tokens_seen": 16248288832,
      "step": 20652
    },
    {
      "epoch": 2.1910672607680883,
      "grad_norm": 0.971498274135282,
      "learning_rate": 4.6029698623455584e-05,
      "loss": 1.5505,
      "num_input_tokens_seen": 16249075632,
      "step": 20653
    },
    {
      "epoch": 2.19117335030766,
      "grad_norm": 0.9240467602076756,
      "learning_rate": 4.602932281590206e-05,
      "loss": 1.4645,
      "num_input_tokens_seen": 16249862464,
      "step": 20654
    },
    {
      "epoch": 2.1912794398472313,
      "grad_norm": 0.6476735187842487,
      "learning_rate": 4.6028946992097675e-05,
      "loss": 1.637,
      "num_input_tokens_seen": 16250649136,
      "step": 20655
    },
    {
      "epoch": 2.1913855293868023,
      "grad_norm": 0.823908381334145,
      "learning_rate": 4.602857115204275e-05,
      "loss": 1.6388,
      "num_input_tokens_seen": 16251435872,
      "step": 20656
    },
    {
      "epoch": 2.191491618926374,
      "grad_norm": 0.6056337778671191,
      "learning_rate": 4.6028195295737556e-05,
      "loss": 1.5338,
      "num_input_tokens_seen": 16252222688,
      "step": 20657
    },
    {
      "epoch": 2.1915977084659453,
      "grad_norm": 0.7861494406685156,
      "learning_rate": 4.6027819423182396e-05,
      "loss": 1.6298,
      "num_input_tokens_seen": 16253009408,
      "step": 20658
    },
    {
      "epoch": 2.1917037980055167,
      "grad_norm": 0.5938328810059497,
      "learning_rate": 4.6027443534377545e-05,
      "loss": 1.5742,
      "num_input_tokens_seen": 16253796160,
      "step": 20659
    },
    {
      "epoch": 2.191809887545088,
      "grad_norm": 0.4311908427777125,
      "learning_rate": 4.602706762932331e-05,
      "loss": 1.5221,
      "num_input_tokens_seen": 16254582992,
      "step": 20660
    },
    {
      "epoch": 2.1919159770846592,
      "grad_norm": 0.7081535018264019,
      "learning_rate": 4.602669170801997e-05,
      "loss": 1.6715,
      "num_input_tokens_seen": 16255369712,
      "step": 20661
    },
    {
      "epoch": 2.1920220666242307,
      "grad_norm": 0.5681547038586086,
      "learning_rate": 4.602631577046782e-05,
      "loss": 1.7036,
      "num_input_tokens_seen": 16256156512,
      "step": 20662
    },
    {
      "epoch": 2.192128156163802,
      "grad_norm": 0.4298002337506476,
      "learning_rate": 4.602593981666716e-05,
      "loss": 1.5993,
      "num_input_tokens_seen": 16256943344,
      "step": 20663
    },
    {
      "epoch": 2.1922342457033737,
      "grad_norm": 0.6876015373804584,
      "learning_rate": 4.602556384661826e-05,
      "loss": 1.536,
      "num_input_tokens_seen": 16257730096,
      "step": 20664
    },
    {
      "epoch": 2.192340335242945,
      "grad_norm": 0.40423361200991365,
      "learning_rate": 4.602518786032142e-05,
      "loss": 1.6876,
      "num_input_tokens_seen": 16258516896,
      "step": 20665
    },
    {
      "epoch": 2.1924464247825166,
      "grad_norm": 0.7706025290219187,
      "learning_rate": 4.602481185777694e-05,
      "loss": 1.6249,
      "num_input_tokens_seen": 16259303664,
      "step": 20666
    },
    {
      "epoch": 2.1925525143220876,
      "grad_norm": 0.5442144696392278,
      "learning_rate": 4.60244358389851e-05,
      "loss": 1.6686,
      "num_input_tokens_seen": 16260090400,
      "step": 20667
    },
    {
      "epoch": 2.192658603861659,
      "grad_norm": 0.6470645137124963,
      "learning_rate": 4.6024059803946184e-05,
      "loss": 1.6264,
      "num_input_tokens_seen": 16260877168,
      "step": 20668
    },
    {
      "epoch": 2.1927646934012306,
      "grad_norm": 0.3951573858237073,
      "learning_rate": 4.60236837526605e-05,
      "loss": 1.7318,
      "num_input_tokens_seen": 16261664048,
      "step": 20669
    },
    {
      "epoch": 2.192870782940802,
      "grad_norm": 0.6830940401811383,
      "learning_rate": 4.602330768512833e-05,
      "loss": 1.7428,
      "num_input_tokens_seen": 16262450752,
      "step": 20670
    },
    {
      "epoch": 2.1929768724803735,
      "grad_norm": 0.3743708087413165,
      "learning_rate": 4.6022931601349964e-05,
      "loss": 1.5943,
      "num_input_tokens_seen": 16263237552,
      "step": 20671
    },
    {
      "epoch": 2.193082962019945,
      "grad_norm": 0.48963356331796853,
      "learning_rate": 4.602255550132569e-05,
      "loss": 1.6993,
      "num_input_tokens_seen": 16264024304,
      "step": 20672
    },
    {
      "epoch": 2.193189051559516,
      "grad_norm": 0.4885692103387784,
      "learning_rate": 4.602217938505581e-05,
      "loss": 1.5615,
      "num_input_tokens_seen": 16264811200,
      "step": 20673
    },
    {
      "epoch": 2.1932951410990875,
      "grad_norm": 0.39342209037138554,
      "learning_rate": 4.60218032525406e-05,
      "loss": 1.6537,
      "num_input_tokens_seen": 16265598000,
      "step": 20674
    },
    {
      "epoch": 2.193401230638659,
      "grad_norm": 0.5362369983393154,
      "learning_rate": 4.6021427103780354e-05,
      "loss": 1.5341,
      "num_input_tokens_seen": 16266384720,
      "step": 20675
    },
    {
      "epoch": 2.1935073201782305,
      "grad_norm": 0.5958869288453389,
      "learning_rate": 4.6021050938775366e-05,
      "loss": 1.6972,
      "num_input_tokens_seen": 16267171488,
      "step": 20676
    },
    {
      "epoch": 2.193613409717802,
      "grad_norm": 0.44415230905693115,
      "learning_rate": 4.602067475752594e-05,
      "loss": 1.5309,
      "num_input_tokens_seen": 16267958240,
      "step": 20677
    },
    {
      "epoch": 2.1937194992573734,
      "grad_norm": 0.9390671425770348,
      "learning_rate": 4.602029856003234e-05,
      "loss": 1.6045,
      "num_input_tokens_seen": 16268745056,
      "step": 20678
    },
    {
      "epoch": 2.1938255887969444,
      "grad_norm": 0.42772119552863513,
      "learning_rate": 4.6019922346294875e-05,
      "loss": 1.6535,
      "num_input_tokens_seen": 16269531760,
      "step": 20679
    },
    {
      "epoch": 2.193931678336516,
      "grad_norm": 1.3459378369711017,
      "learning_rate": 4.601954611631383e-05,
      "loss": 1.6602,
      "num_input_tokens_seen": 16270318496,
      "step": 20680
    },
    {
      "epoch": 2.1940377678760874,
      "grad_norm": 0.4177118107334137,
      "learning_rate": 4.601916987008949e-05,
      "loss": 1.5382,
      "num_input_tokens_seen": 16271105296,
      "step": 20681
    },
    {
      "epoch": 2.194143857415659,
      "grad_norm": 0.9975859240389091,
      "learning_rate": 4.601879360762217e-05,
      "loss": 1.6219,
      "num_input_tokens_seen": 16271892112,
      "step": 20682
    },
    {
      "epoch": 2.1942499469552303,
      "grad_norm": 0.4081236932832426,
      "learning_rate": 4.601841732891212e-05,
      "loss": 1.6389,
      "num_input_tokens_seen": 16272678800,
      "step": 20683
    },
    {
      "epoch": 2.194356036494802,
      "grad_norm": 0.8132061459800627,
      "learning_rate": 4.601804103395967e-05,
      "loss": 1.6556,
      "num_input_tokens_seen": 16273465520,
      "step": 20684
    },
    {
      "epoch": 2.194462126034373,
      "grad_norm": 0.48215724154872036,
      "learning_rate": 4.601766472276509e-05,
      "loss": 1.6108,
      "num_input_tokens_seen": 16274252224,
      "step": 20685
    },
    {
      "epoch": 2.1945682155739443,
      "grad_norm": 0.8431807900621655,
      "learning_rate": 4.601728839532867e-05,
      "loss": 1.6448,
      "num_input_tokens_seen": 16275038960,
      "step": 20686
    },
    {
      "epoch": 2.194674305113516,
      "grad_norm": 0.4429055953748796,
      "learning_rate": 4.6016912051650717e-05,
      "loss": 1.5346,
      "num_input_tokens_seen": 16275825760,
      "step": 20687
    },
    {
      "epoch": 2.1947803946530873,
      "grad_norm": 0.5599693374122581,
      "learning_rate": 4.601653569173151e-05,
      "loss": 1.5818,
      "num_input_tokens_seen": 16276612528,
      "step": 20688
    },
    {
      "epoch": 2.1948864841926587,
      "grad_norm": 0.529895642292941,
      "learning_rate": 4.6016159315571336e-05,
      "loss": 1.7039,
      "num_input_tokens_seen": 16277399280,
      "step": 20689
    },
    {
      "epoch": 2.19499257373223,
      "grad_norm": 0.42864365864116105,
      "learning_rate": 4.601578292317049e-05,
      "loss": 1.6052,
      "num_input_tokens_seen": 16278186032,
      "step": 20690
    },
    {
      "epoch": 2.1950986632718013,
      "grad_norm": 0.4970057069719345,
      "learning_rate": 4.601540651452926e-05,
      "loss": 1.6161,
      "num_input_tokens_seen": 16278972752,
      "step": 20691
    },
    {
      "epoch": 2.1952047528113727,
      "grad_norm": 0.36184621140264106,
      "learning_rate": 4.601503008964795e-05,
      "loss": 1.5936,
      "num_input_tokens_seen": 16279759520,
      "step": 20692
    },
    {
      "epoch": 2.195310842350944,
      "grad_norm": 0.42442332595769205,
      "learning_rate": 4.6014653648526836e-05,
      "loss": 1.4758,
      "num_input_tokens_seen": 16280546272,
      "step": 20693
    },
    {
      "epoch": 2.1954169318905157,
      "grad_norm": 0.4649324308409242,
      "learning_rate": 4.601427719116621e-05,
      "loss": 1.7992,
      "num_input_tokens_seen": 16281332944,
      "step": 20694
    },
    {
      "epoch": 2.195523021430087,
      "grad_norm": 0.35791140928359444,
      "learning_rate": 4.601390071756638e-05,
      "loss": 1.4228,
      "num_input_tokens_seen": 16282119728,
      "step": 20695
    },
    {
      "epoch": 2.1956291109696586,
      "grad_norm": 0.45626936754572417,
      "learning_rate": 4.601352422772761e-05,
      "loss": 1.6604,
      "num_input_tokens_seen": 16282906560,
      "step": 20696
    },
    {
      "epoch": 2.1957352005092297,
      "grad_norm": 0.36782695766075246,
      "learning_rate": 4.6013147721650214e-05,
      "loss": 1.6333,
      "num_input_tokens_seen": 16283693296,
      "step": 20697
    },
    {
      "epoch": 2.195841290048801,
      "grad_norm": 0.4026137126515918,
      "learning_rate": 4.601277119933447e-05,
      "loss": 1.5659,
      "num_input_tokens_seen": 16284480112,
      "step": 20698
    },
    {
      "epoch": 2.1959473795883726,
      "grad_norm": 0.42628905684022744,
      "learning_rate": 4.601239466078068e-05,
      "loss": 1.7275,
      "num_input_tokens_seen": 16285266784,
      "step": 20699
    },
    {
      "epoch": 2.196053469127944,
      "grad_norm": 0.4316087958655688,
      "learning_rate": 4.601201810598912e-05,
      "loss": 1.5385,
      "num_input_tokens_seen": 16286053616,
      "step": 20700
    },
    {
      "epoch": 2.1961595586675156,
      "grad_norm": 0.5161638738089508,
      "learning_rate": 4.601164153496009e-05,
      "loss": 1.7078,
      "num_input_tokens_seen": 16286840368,
      "step": 20701
    },
    {
      "epoch": 2.1962656482070866,
      "grad_norm": 0.4431133684183294,
      "learning_rate": 4.6011264947693874e-05,
      "loss": 1.7012,
      "num_input_tokens_seen": 16287627104,
      "step": 20702
    },
    {
      "epoch": 2.196371737746658,
      "grad_norm": 0.511452524078686,
      "learning_rate": 4.6010888344190785e-05,
      "loss": 1.6839,
      "num_input_tokens_seen": 16288413904,
      "step": 20703
    },
    {
      "epoch": 2.1964778272862295,
      "grad_norm": 0.3939143676013595,
      "learning_rate": 4.601051172445109e-05,
      "loss": 1.6199,
      "num_input_tokens_seen": 16289200720,
      "step": 20704
    },
    {
      "epoch": 2.196583916825801,
      "grad_norm": 0.4894331214567024,
      "learning_rate": 4.601013508847508e-05,
      "loss": 1.6324,
      "num_input_tokens_seen": 16289987440,
      "step": 20705
    },
    {
      "epoch": 2.1966900063653725,
      "grad_norm": 0.4558967512154744,
      "learning_rate": 4.600975843626306e-05,
      "loss": 1.7048,
      "num_input_tokens_seen": 16290774208,
      "step": 20706
    },
    {
      "epoch": 2.196796095904944,
      "grad_norm": 0.5296211491615821,
      "learning_rate": 4.600938176781532e-05,
      "loss": 1.6805,
      "num_input_tokens_seen": 16291560864,
      "step": 20707
    },
    {
      "epoch": 2.196902185444515,
      "grad_norm": 0.4179844555998951,
      "learning_rate": 4.6009005083132136e-05,
      "loss": 1.5942,
      "num_input_tokens_seen": 16292347600,
      "step": 20708
    },
    {
      "epoch": 2.1970082749840865,
      "grad_norm": 0.5851234640065321,
      "learning_rate": 4.600862838221383e-05,
      "loss": 1.6015,
      "num_input_tokens_seen": 16293134368,
      "step": 20709
    },
    {
      "epoch": 2.197114364523658,
      "grad_norm": 0.39198120444169643,
      "learning_rate": 4.6008251665060655e-05,
      "loss": 1.6716,
      "num_input_tokens_seen": 16293921136,
      "step": 20710
    },
    {
      "epoch": 2.1972204540632294,
      "grad_norm": 0.3991828515614129,
      "learning_rate": 4.600787493167292e-05,
      "loss": 1.5514,
      "num_input_tokens_seen": 16294707936,
      "step": 20711
    },
    {
      "epoch": 2.197326543602801,
      "grad_norm": 0.4203708843606711,
      "learning_rate": 4.600749818205092e-05,
      "loss": 1.6887,
      "num_input_tokens_seen": 16295494688,
      "step": 20712
    },
    {
      "epoch": 2.1974326331423724,
      "grad_norm": 0.5199743941413425,
      "learning_rate": 4.600712141619494e-05,
      "loss": 1.6142,
      "num_input_tokens_seen": 16296281472,
      "step": 20713
    },
    {
      "epoch": 2.1975387226819434,
      "grad_norm": 0.41979997419900456,
      "learning_rate": 4.600674463410527e-05,
      "loss": 1.7493,
      "num_input_tokens_seen": 16297068144,
      "step": 20714
    },
    {
      "epoch": 2.197644812221515,
      "grad_norm": 0.6145959555385176,
      "learning_rate": 4.6006367835782205e-05,
      "loss": 1.6619,
      "num_input_tokens_seen": 16297854880,
      "step": 20715
    },
    {
      "epoch": 2.1977509017610863,
      "grad_norm": 0.4481656986268206,
      "learning_rate": 4.6005991021226044e-05,
      "loss": 1.6544,
      "num_input_tokens_seen": 16298641680,
      "step": 20716
    },
    {
      "epoch": 2.197856991300658,
      "grad_norm": 0.48965909478342334,
      "learning_rate": 4.6005614190437066e-05,
      "loss": 1.6687,
      "num_input_tokens_seen": 16299428480,
      "step": 20717
    },
    {
      "epoch": 2.1979630808402293,
      "grad_norm": 0.3954341741550554,
      "learning_rate": 4.6005237343415555e-05,
      "loss": 1.5499,
      "num_input_tokens_seen": 16300215408,
      "step": 20718
    },
    {
      "epoch": 2.1980691703798003,
      "grad_norm": 0.6032421883945362,
      "learning_rate": 4.6004860480161824e-05,
      "loss": 1.7647,
      "num_input_tokens_seen": 16301002112,
      "step": 20719
    },
    {
      "epoch": 2.198175259919372,
      "grad_norm": 0.35284701432154736,
      "learning_rate": 4.600448360067615e-05,
      "loss": 1.4702,
      "num_input_tokens_seen": 16301788976,
      "step": 20720
    },
    {
      "epoch": 2.1982813494589433,
      "grad_norm": 0.506077033520256,
      "learning_rate": 4.600410670495883e-05,
      "loss": 1.5704,
      "num_input_tokens_seen": 16302575808,
      "step": 20721
    },
    {
      "epoch": 2.1983874389985147,
      "grad_norm": 0.4131941552484242,
      "learning_rate": 4.600372979301015e-05,
      "loss": 1.6802,
      "num_input_tokens_seen": 16303362608,
      "step": 20722
    },
    {
      "epoch": 2.198493528538086,
      "grad_norm": 0.44704859083388326,
      "learning_rate": 4.600335286483039e-05,
      "loss": 1.6064,
      "num_input_tokens_seen": 16304149488,
      "step": 20723
    },
    {
      "epoch": 2.1985996180776577,
      "grad_norm": 0.4691417878858736,
      "learning_rate": 4.600297592041988e-05,
      "loss": 1.6457,
      "num_input_tokens_seen": 16304936240,
      "step": 20724
    },
    {
      "epoch": 2.198705707617229,
      "grad_norm": 0.40473148758799016,
      "learning_rate": 4.6002598959778874e-05,
      "loss": 1.5846,
      "num_input_tokens_seen": 16305723024,
      "step": 20725
    },
    {
      "epoch": 2.1988117971568,
      "grad_norm": 0.403239234362615,
      "learning_rate": 4.600222198290768e-05,
      "loss": 1.6766,
      "num_input_tokens_seen": 16306509792,
      "step": 20726
    },
    {
      "epoch": 2.1989178866963717,
      "grad_norm": 0.4048468883627264,
      "learning_rate": 4.600184498980658e-05,
      "loss": 1.6059,
      "num_input_tokens_seen": 16307296608,
      "step": 20727
    },
    {
      "epoch": 2.199023976235943,
      "grad_norm": 0.42249756784909065,
      "learning_rate": 4.600146798047587e-05,
      "loss": 1.6779,
      "num_input_tokens_seen": 16308083456,
      "step": 20728
    },
    {
      "epoch": 2.1991300657755146,
      "grad_norm": 0.3304687030355479,
      "learning_rate": 4.600109095491585e-05,
      "loss": 1.5235,
      "num_input_tokens_seen": 16308870224,
      "step": 20729
    },
    {
      "epoch": 2.199236155315086,
      "grad_norm": 0.3962895499512773,
      "learning_rate": 4.600071391312679e-05,
      "loss": 1.6073,
      "num_input_tokens_seen": 16309656960,
      "step": 20730
    },
    {
      "epoch": 2.199342244854657,
      "grad_norm": 0.32210263519082577,
      "learning_rate": 4.6000336855109006e-05,
      "loss": 1.4425,
      "num_input_tokens_seen": 16310443744,
      "step": 20731
    },
    {
      "epoch": 2.1994483343942286,
      "grad_norm": 0.4522582920424238,
      "learning_rate": 4.5999959780862775e-05,
      "loss": 1.6202,
      "num_input_tokens_seen": 16311230480,
      "step": 20732
    },
    {
      "epoch": 2.1995544239338,
      "grad_norm": 0.3544169766089043,
      "learning_rate": 4.599958269038839e-05,
      "loss": 1.7843,
      "num_input_tokens_seen": 16312017200,
      "step": 20733
    },
    {
      "epoch": 2.1996605134733715,
      "grad_norm": 0.475614579621982,
      "learning_rate": 4.599920558368615e-05,
      "loss": 1.5985,
      "num_input_tokens_seen": 16312804000,
      "step": 20734
    },
    {
      "epoch": 2.199766603012943,
      "grad_norm": 0.41823493895371333,
      "learning_rate": 4.5998828460756325e-05,
      "loss": 1.6306,
      "num_input_tokens_seen": 16313590880,
      "step": 20735
    },
    {
      "epoch": 2.1998726925525145,
      "grad_norm": 0.5260729962317764,
      "learning_rate": 4.5998451321599236e-05,
      "loss": 1.6275,
      "num_input_tokens_seen": 16314377648,
      "step": 20736
    },
    {
      "epoch": 2.1999787820920855,
      "grad_norm": 0.47569586089961774,
      "learning_rate": 4.599807416621516e-05,
      "loss": 1.7479,
      "num_input_tokens_seen": 16315164384,
      "step": 20737
    },
    {
      "epoch": 2.200084871631657,
      "grad_norm": 0.42447859993583564,
      "learning_rate": 4.599769699460438e-05,
      "loss": 1.5369,
      "num_input_tokens_seen": 16315951248,
      "step": 20738
    },
    {
      "epoch": 2.2001909611712285,
      "grad_norm": 0.548597248979358,
      "learning_rate": 4.599731980676719e-05,
      "loss": 1.5888,
      "num_input_tokens_seen": 16316738016,
      "step": 20739
    },
    {
      "epoch": 2.2002970507108,
      "grad_norm": 0.38290334081789273,
      "learning_rate": 4.5996942602703896e-05,
      "loss": 1.6271,
      "num_input_tokens_seen": 16317524864,
      "step": 20740
    },
    {
      "epoch": 2.2004031402503714,
      "grad_norm": 0.574555863129851,
      "learning_rate": 4.599656538241478e-05,
      "loss": 1.7745,
      "num_input_tokens_seen": 16318311728,
      "step": 20741
    },
    {
      "epoch": 2.200509229789943,
      "grad_norm": 0.3585448140898121,
      "learning_rate": 4.5996188145900143e-05,
      "loss": 1.6536,
      "num_input_tokens_seen": 16319098416,
      "step": 20742
    },
    {
      "epoch": 2.200615319329514,
      "grad_norm": 0.5875408924448431,
      "learning_rate": 4.599581089316026e-05,
      "loss": 1.6533,
      "num_input_tokens_seen": 16319885104,
      "step": 20743
    },
    {
      "epoch": 2.2007214088690854,
      "grad_norm": 0.3923695130222016,
      "learning_rate": 4.5995433624195425e-05,
      "loss": 1.5422,
      "num_input_tokens_seen": 16320671888,
      "step": 20744
    },
    {
      "epoch": 2.200827498408657,
      "grad_norm": 0.43173038866886415,
      "learning_rate": 4.5995056339005946e-05,
      "loss": 1.4743,
      "num_input_tokens_seen": 16321458688,
      "step": 20745
    },
    {
      "epoch": 2.2009335879482284,
      "grad_norm": 0.5182403901259761,
      "learning_rate": 4.599467903759209e-05,
      "loss": 1.5725,
      "num_input_tokens_seen": 16322245408,
      "step": 20746
    },
    {
      "epoch": 2.2010396774878,
      "grad_norm": 0.3745559768480332,
      "learning_rate": 4.599430171995418e-05,
      "loss": 1.6084,
      "num_input_tokens_seen": 16323032176,
      "step": 20747
    },
    {
      "epoch": 2.2011457670273713,
      "grad_norm": 0.38573711357797935,
      "learning_rate": 4.599392438609248e-05,
      "loss": 1.5493,
      "num_input_tokens_seen": 16323818944,
      "step": 20748
    },
    {
      "epoch": 2.2012518565669423,
      "grad_norm": 0.5575831074933059,
      "learning_rate": 4.599354703600729e-05,
      "loss": 1.6096,
      "num_input_tokens_seen": 16324605744,
      "step": 20749
    },
    {
      "epoch": 2.201357946106514,
      "grad_norm": 0.5956406051448263,
      "learning_rate": 4.5993169669698896e-05,
      "loss": 1.5944,
      "num_input_tokens_seen": 16325392640,
      "step": 20750
    },
    {
      "epoch": 2.2014640356460853,
      "grad_norm": 0.4736451639633474,
      "learning_rate": 4.599279228716761e-05,
      "loss": 1.7119,
      "num_input_tokens_seen": 16326179408,
      "step": 20751
    },
    {
      "epoch": 2.2015701251856568,
      "grad_norm": 0.3660542099403083,
      "learning_rate": 4.599241488841371e-05,
      "loss": 1.5183,
      "num_input_tokens_seen": 16326966240,
      "step": 20752
    },
    {
      "epoch": 2.2016762147252282,
      "grad_norm": 0.5148398387186206,
      "learning_rate": 4.5992037473437476e-05,
      "loss": 1.6381,
      "num_input_tokens_seen": 16327753040,
      "step": 20753
    },
    {
      "epoch": 2.2017823042647997,
      "grad_norm": 0.39096084021785016,
      "learning_rate": 4.5991660042239215e-05,
      "loss": 1.5931,
      "num_input_tokens_seen": 16328539904,
      "step": 20754
    },
    {
      "epoch": 2.2018883938043707,
      "grad_norm": 0.44479208789946556,
      "learning_rate": 4.5991282594819216e-05,
      "loss": 1.6152,
      "num_input_tokens_seen": 16329326784,
      "step": 20755
    },
    {
      "epoch": 2.201994483343942,
      "grad_norm": 0.4686667810097646,
      "learning_rate": 4.599090513117778e-05,
      "loss": 1.5351,
      "num_input_tokens_seen": 16330113568,
      "step": 20756
    },
    {
      "epoch": 2.2021005728835137,
      "grad_norm": 0.5601326426759061,
      "learning_rate": 4.599052765131518e-05,
      "loss": 1.6034,
      "num_input_tokens_seen": 16330900224,
      "step": 20757
    },
    {
      "epoch": 2.202206662423085,
      "grad_norm": 0.4584216326438069,
      "learning_rate": 4.5990150155231705e-05,
      "loss": 1.6658,
      "num_input_tokens_seen": 16331687008,
      "step": 20758
    },
    {
      "epoch": 2.2023127519626566,
      "grad_norm": 0.37250279493564825,
      "learning_rate": 4.598977264292767e-05,
      "loss": 1.5203,
      "num_input_tokens_seen": 16332473776,
      "step": 20759
    },
    {
      "epoch": 2.2024188415022277,
      "grad_norm": 0.4700275407623016,
      "learning_rate": 4.5989395114403357e-05,
      "loss": 1.7067,
      "num_input_tokens_seen": 16333260448,
      "step": 20760
    },
    {
      "epoch": 2.202524931041799,
      "grad_norm": 0.39137707399404514,
      "learning_rate": 4.598901756965905e-05,
      "loss": 1.7371,
      "num_input_tokens_seen": 16334047152,
      "step": 20761
    },
    {
      "epoch": 2.2026310205813706,
      "grad_norm": 0.3732804154151708,
      "learning_rate": 4.598864000869505e-05,
      "loss": 1.5858,
      "num_input_tokens_seen": 16334834000,
      "step": 20762
    },
    {
      "epoch": 2.202737110120942,
      "grad_norm": 0.4399851404368207,
      "learning_rate": 4.598826243151164e-05,
      "loss": 1.6839,
      "num_input_tokens_seen": 16335620768,
      "step": 20763
    },
    {
      "epoch": 2.2028431996605136,
      "grad_norm": 0.4006156068656257,
      "learning_rate": 4.598788483810912e-05,
      "loss": 1.6081,
      "num_input_tokens_seen": 16336407376,
      "step": 20764
    },
    {
      "epoch": 2.202949289200085,
      "grad_norm": 0.43650443602044475,
      "learning_rate": 4.598750722848777e-05,
      "loss": 1.6677,
      "num_input_tokens_seen": 16337194096,
      "step": 20765
    },
    {
      "epoch": 2.203055378739656,
      "grad_norm": 0.4556264543337336,
      "learning_rate": 4.598712960264791e-05,
      "loss": 1.6989,
      "num_input_tokens_seen": 16337980800,
      "step": 20766
    },
    {
      "epoch": 2.2031614682792275,
      "grad_norm": 0.46613767487552615,
      "learning_rate": 4.5986751960589793e-05,
      "loss": 1.6064,
      "num_input_tokens_seen": 16338767552,
      "step": 20767
    },
    {
      "epoch": 2.203267557818799,
      "grad_norm": 0.4395791984575523,
      "learning_rate": 4.598637430231374e-05,
      "loss": 1.6302,
      "num_input_tokens_seen": 16339554288,
      "step": 20768
    },
    {
      "epoch": 2.2033736473583705,
      "grad_norm": 0.3878367199920192,
      "learning_rate": 4.5985996627820027e-05,
      "loss": 1.5908,
      "num_input_tokens_seen": 16340340992,
      "step": 20769
    },
    {
      "epoch": 2.203479736897942,
      "grad_norm": 0.44380580792268043,
      "learning_rate": 4.5985618937108957e-05,
      "loss": 1.6061,
      "num_input_tokens_seen": 16341127776,
      "step": 20770
    },
    {
      "epoch": 2.2035858264375134,
      "grad_norm": 0.4023900478240257,
      "learning_rate": 4.598524123018081e-05,
      "loss": 1.5975,
      "num_input_tokens_seen": 16341914576,
      "step": 20771
    },
    {
      "epoch": 2.2036919159770845,
      "grad_norm": 0.38835204356848185,
      "learning_rate": 4.598486350703589e-05,
      "loss": 1.579,
      "num_input_tokens_seen": 16342701376,
      "step": 20772
    },
    {
      "epoch": 2.203798005516656,
      "grad_norm": 0.4401550672969803,
      "learning_rate": 4.598448576767448e-05,
      "loss": 1.8017,
      "num_input_tokens_seen": 16343488144,
      "step": 20773
    },
    {
      "epoch": 2.2039040950562274,
      "grad_norm": 0.3588667541357968,
      "learning_rate": 4.598410801209687e-05,
      "loss": 1.5854,
      "num_input_tokens_seen": 16344274880,
      "step": 20774
    },
    {
      "epoch": 2.204010184595799,
      "grad_norm": 0.43552426482895296,
      "learning_rate": 4.598373024030337e-05,
      "loss": 1.6263,
      "num_input_tokens_seen": 16345061616,
      "step": 20775
    },
    {
      "epoch": 2.2041162741353704,
      "grad_norm": 0.4130748903223698,
      "learning_rate": 4.598335245229425e-05,
      "loss": 1.6893,
      "num_input_tokens_seen": 16345848416,
      "step": 20776
    },
    {
      "epoch": 2.204222363674942,
      "grad_norm": 0.5271056598160917,
      "learning_rate": 4.598297464806981e-05,
      "loss": 1.6352,
      "num_input_tokens_seen": 16346635264,
      "step": 20777
    },
    {
      "epoch": 2.204328453214513,
      "grad_norm": 0.5470704767131609,
      "learning_rate": 4.598259682763035e-05,
      "loss": 1.5015,
      "num_input_tokens_seen": 16347422080,
      "step": 20778
    },
    {
      "epoch": 2.2044345427540843,
      "grad_norm": 0.5653884423763478,
      "learning_rate": 4.5982218990976145e-05,
      "loss": 1.5601,
      "num_input_tokens_seen": 16348208816,
      "step": 20779
    },
    {
      "epoch": 2.204540632293656,
      "grad_norm": 0.4042320795980339,
      "learning_rate": 4.598184113810751e-05,
      "loss": 1.6802,
      "num_input_tokens_seen": 16348995568,
      "step": 20780
    },
    {
      "epoch": 2.2046467218332273,
      "grad_norm": 0.45255141213512534,
      "learning_rate": 4.598146326902471e-05,
      "loss": 1.4845,
      "num_input_tokens_seen": 16349782416,
      "step": 20781
    },
    {
      "epoch": 2.2047528113727988,
      "grad_norm": 0.4000604460173884,
      "learning_rate": 4.5981085383728055e-05,
      "loss": 1.6527,
      "num_input_tokens_seen": 16350569136,
      "step": 20782
    },
    {
      "epoch": 2.2048589009123702,
      "grad_norm": 0.4070036114292658,
      "learning_rate": 4.598070748221783e-05,
      "loss": 1.5551,
      "num_input_tokens_seen": 16351355856,
      "step": 20783
    },
    {
      "epoch": 2.2049649904519413,
      "grad_norm": 0.40614502411332937,
      "learning_rate": 4.598032956449434e-05,
      "loss": 1.6354,
      "num_input_tokens_seen": 16352142624,
      "step": 20784
    },
    {
      "epoch": 2.2050710799915128,
      "grad_norm": 0.4417025125550833,
      "learning_rate": 4.597995163055786e-05,
      "loss": 1.5991,
      "num_input_tokens_seen": 16352929376,
      "step": 20785
    },
    {
      "epoch": 2.2051771695310842,
      "grad_norm": 0.5016783258807517,
      "learning_rate": 4.5979573680408694e-05,
      "loss": 1.6461,
      "num_input_tokens_seen": 16353716192,
      "step": 20786
    },
    {
      "epoch": 2.2052832590706557,
      "grad_norm": 0.6136592839614702,
      "learning_rate": 4.597919571404713e-05,
      "loss": 1.6593,
      "num_input_tokens_seen": 16354502896,
      "step": 20787
    },
    {
      "epoch": 2.205389348610227,
      "grad_norm": 0.4253404151752041,
      "learning_rate": 4.597881773147345e-05,
      "loss": 1.6037,
      "num_input_tokens_seen": 16355289648,
      "step": 20788
    },
    {
      "epoch": 2.205495438149798,
      "grad_norm": 0.6281341415218442,
      "learning_rate": 4.597843973268796e-05,
      "loss": 1.6945,
      "num_input_tokens_seen": 16356076288,
      "step": 20789
    },
    {
      "epoch": 2.2056015276893697,
      "grad_norm": 0.3939035878968875,
      "learning_rate": 4.597806171769095e-05,
      "loss": 1.5638,
      "num_input_tokens_seen": 16356863072,
      "step": 20790
    },
    {
      "epoch": 2.205707617228941,
      "grad_norm": 0.5617556695841767,
      "learning_rate": 4.59776836864827e-05,
      "loss": 1.466,
      "num_input_tokens_seen": 16357649872,
      "step": 20791
    },
    {
      "epoch": 2.2058137067685126,
      "grad_norm": 0.4775813969627734,
      "learning_rate": 4.597730563906352e-05,
      "loss": 1.6012,
      "num_input_tokens_seen": 16358436672,
      "step": 20792
    },
    {
      "epoch": 2.205919796308084,
      "grad_norm": 0.4743716378850669,
      "learning_rate": 4.5976927575433694e-05,
      "loss": 1.4997,
      "num_input_tokens_seen": 16359223456,
      "step": 20793
    },
    {
      "epoch": 2.2060258858476556,
      "grad_norm": 0.40156299781910626,
      "learning_rate": 4.597654949559351e-05,
      "loss": 1.7255,
      "num_input_tokens_seen": 16360010304,
      "step": 20794
    },
    {
      "epoch": 2.206131975387227,
      "grad_norm": 0.4214403883359137,
      "learning_rate": 4.597617139954327e-05,
      "loss": 1.5786,
      "num_input_tokens_seen": 16360797200,
      "step": 20795
    },
    {
      "epoch": 2.206238064926798,
      "grad_norm": 0.522484677242511,
      "learning_rate": 4.5975793287283254e-05,
      "loss": 1.6283,
      "num_input_tokens_seen": 16361583968,
      "step": 20796
    },
    {
      "epoch": 2.2063441544663696,
      "grad_norm": 0.4208207718859445,
      "learning_rate": 4.597541515881376e-05,
      "loss": 1.5925,
      "num_input_tokens_seen": 16362370784,
      "step": 20797
    },
    {
      "epoch": 2.206450244005941,
      "grad_norm": 0.5160499541670229,
      "learning_rate": 4.597503701413509e-05,
      "loss": 1.6996,
      "num_input_tokens_seen": 16363157488,
      "step": 20798
    },
    {
      "epoch": 2.2065563335455125,
      "grad_norm": 0.4135376023083298,
      "learning_rate": 4.5974658853247524e-05,
      "loss": 1.6016,
      "num_input_tokens_seen": 16363944208,
      "step": 20799
    },
    {
      "epoch": 2.206662423085084,
      "grad_norm": 0.37857267591399285,
      "learning_rate": 4.597428067615135e-05,
      "loss": 1.7056,
      "num_input_tokens_seen": 16364731024,
      "step": 20800
    },
    {
      "epoch": 2.206768512624655,
      "grad_norm": 0.5139332049188532,
      "learning_rate": 4.5973902482846865e-05,
      "loss": 1.7049,
      "num_input_tokens_seen": 16365517696,
      "step": 20801
    },
    {
      "epoch": 2.2068746021642265,
      "grad_norm": 0.376551705078109,
      "learning_rate": 4.5973524273334376e-05,
      "loss": 1.624,
      "num_input_tokens_seen": 16366304480,
      "step": 20802
    },
    {
      "epoch": 2.206980691703798,
      "grad_norm": 0.45028103688542676,
      "learning_rate": 4.597314604761415e-05,
      "loss": 1.6225,
      "num_input_tokens_seen": 16367091280,
      "step": 20803
    },
    {
      "epoch": 2.2070867812433694,
      "grad_norm": 0.36507997502321077,
      "learning_rate": 4.59727678056865e-05,
      "loss": 1.5664,
      "num_input_tokens_seen": 16367878128,
      "step": 20804
    },
    {
      "epoch": 2.207192870782941,
      "grad_norm": 0.40689069865808136,
      "learning_rate": 4.5972389547551706e-05,
      "loss": 1.6819,
      "num_input_tokens_seen": 16368664816,
      "step": 20805
    },
    {
      "epoch": 2.2072989603225124,
      "grad_norm": 0.4896330482186925,
      "learning_rate": 4.597201127321007e-05,
      "loss": 1.6394,
      "num_input_tokens_seen": 16369451584,
      "step": 20806
    },
    {
      "epoch": 2.2074050498620834,
      "grad_norm": 0.35822403628907823,
      "learning_rate": 4.5971632982661875e-05,
      "loss": 1.5708,
      "num_input_tokens_seen": 16370238416,
      "step": 20807
    },
    {
      "epoch": 2.207511139401655,
      "grad_norm": 0.6391975646997642,
      "learning_rate": 4.5971254675907415e-05,
      "loss": 1.5742,
      "num_input_tokens_seen": 16371025152,
      "step": 20808
    },
    {
      "epoch": 2.2076172289412264,
      "grad_norm": 0.4022331402309908,
      "learning_rate": 4.597087635294699e-05,
      "loss": 1.5687,
      "num_input_tokens_seen": 16371811888,
      "step": 20809
    },
    {
      "epoch": 2.207723318480798,
      "grad_norm": 0.7251993164640009,
      "learning_rate": 4.5970498013780885e-05,
      "loss": 1.7725,
      "num_input_tokens_seen": 16372598688,
      "step": 20810
    },
    {
      "epoch": 2.2078294080203693,
      "grad_norm": 0.4280766743821037,
      "learning_rate": 4.59701196584094e-05,
      "loss": 1.5866,
      "num_input_tokens_seen": 16373385376,
      "step": 20811
    },
    {
      "epoch": 2.207935497559941,
      "grad_norm": 0.557172489212465,
      "learning_rate": 4.5969741286832814e-05,
      "loss": 1.6597,
      "num_input_tokens_seen": 16374172160,
      "step": 20812
    },
    {
      "epoch": 2.208041587099512,
      "grad_norm": 0.40363548414582073,
      "learning_rate": 4.5969362899051426e-05,
      "loss": 1.626,
      "num_input_tokens_seen": 16374959008,
      "step": 20813
    },
    {
      "epoch": 2.2081476766390833,
      "grad_norm": 0.44858740999066804,
      "learning_rate": 4.596898449506554e-05,
      "loss": 1.5471,
      "num_input_tokens_seen": 16375745776,
      "step": 20814
    },
    {
      "epoch": 2.2082537661786548,
      "grad_norm": 0.36068729007183453,
      "learning_rate": 4.596860607487543e-05,
      "loss": 1.6359,
      "num_input_tokens_seen": 16376532624,
      "step": 20815
    },
    {
      "epoch": 2.2083598557182262,
      "grad_norm": 0.4392799450439546,
      "learning_rate": 4.59682276384814e-05,
      "loss": 1.5948,
      "num_input_tokens_seen": 16377319456,
      "step": 20816
    },
    {
      "epoch": 2.2084659452577977,
      "grad_norm": 0.6028945290903666,
      "learning_rate": 4.596784918588373e-05,
      "loss": 1.5756,
      "num_input_tokens_seen": 16378106224,
      "step": 20817
    },
    {
      "epoch": 2.2085720347973687,
      "grad_norm": 0.44514106063942405,
      "learning_rate": 4.5967470717082726e-05,
      "loss": 1.6552,
      "num_input_tokens_seen": 16378893040,
      "step": 20818
    },
    {
      "epoch": 2.20867812433694,
      "grad_norm": 1.004901880972402,
      "learning_rate": 4.596709223207868e-05,
      "loss": 1.5991,
      "num_input_tokens_seen": 16379679776,
      "step": 20819
    },
    {
      "epoch": 2.2087842138765117,
      "grad_norm": 0.6381272318002549,
      "learning_rate": 4.596671373087188e-05,
      "loss": 1.5245,
      "num_input_tokens_seen": 16380466512,
      "step": 20820
    },
    {
      "epoch": 2.208890303416083,
      "grad_norm": 0.5849853084988379,
      "learning_rate": 4.596633521346262e-05,
      "loss": 1.5809,
      "num_input_tokens_seen": 16381253312,
      "step": 20821
    },
    {
      "epoch": 2.2089963929556546,
      "grad_norm": 0.4533769239627479,
      "learning_rate": 4.596595667985119e-05,
      "loss": 1.6357,
      "num_input_tokens_seen": 16382040032,
      "step": 20822
    },
    {
      "epoch": 2.209102482495226,
      "grad_norm": 0.5434367880725061,
      "learning_rate": 4.596557813003788e-05,
      "loss": 1.7181,
      "num_input_tokens_seen": 16382826752,
      "step": 20823
    },
    {
      "epoch": 2.2092085720347976,
      "grad_norm": 0.583802062579188,
      "learning_rate": 4.5965199564022986e-05,
      "loss": 1.6344,
      "num_input_tokens_seen": 16383613472,
      "step": 20824
    },
    {
      "epoch": 2.2093146615743686,
      "grad_norm": 0.47207800512193465,
      "learning_rate": 4.596482098180681e-05,
      "loss": 1.5585,
      "num_input_tokens_seen": 16384400240,
      "step": 20825
    },
    {
      "epoch": 2.20942075111394,
      "grad_norm": 0.6087384787720923,
      "learning_rate": 4.596444238338963e-05,
      "loss": 1.6005,
      "num_input_tokens_seen": 16385187056,
      "step": 20826
    },
    {
      "epoch": 2.2095268406535116,
      "grad_norm": 0.35186503217466547,
      "learning_rate": 4.596406376877174e-05,
      "loss": 1.5504,
      "num_input_tokens_seen": 16385973840,
      "step": 20827
    },
    {
      "epoch": 2.209632930193083,
      "grad_norm": 0.6602683451827276,
      "learning_rate": 4.596368513795344e-05,
      "loss": 1.6242,
      "num_input_tokens_seen": 16386760592,
      "step": 20828
    },
    {
      "epoch": 2.2097390197326545,
      "grad_norm": 0.3743474418342238,
      "learning_rate": 4.596330649093502e-05,
      "loss": 1.6707,
      "num_input_tokens_seen": 16387547344,
      "step": 20829
    },
    {
      "epoch": 2.2098451092722255,
      "grad_norm": 0.45668194230791825,
      "learning_rate": 4.596292782771677e-05,
      "loss": 1.6961,
      "num_input_tokens_seen": 16388334064,
      "step": 20830
    },
    {
      "epoch": 2.209951198811797,
      "grad_norm": 0.38815679975739364,
      "learning_rate": 4.596254914829898e-05,
      "loss": 1.4829,
      "num_input_tokens_seen": 16389120864,
      "step": 20831
    },
    {
      "epoch": 2.2100572883513685,
      "grad_norm": 0.4677893075362267,
      "learning_rate": 4.5962170452681956e-05,
      "loss": 1.729,
      "num_input_tokens_seen": 16389907600,
      "step": 20832
    },
    {
      "epoch": 2.21016337789094,
      "grad_norm": 0.41339135607109695,
      "learning_rate": 4.596179174086598e-05,
      "loss": 1.6442,
      "num_input_tokens_seen": 16390694336,
      "step": 20833
    },
    {
      "epoch": 2.2102694674305114,
      "grad_norm": 0.8409386927224223,
      "learning_rate": 4.5961413012851345e-05,
      "loss": 1.6385,
      "num_input_tokens_seen": 16391481088,
      "step": 20834
    },
    {
      "epoch": 2.210375556970083,
      "grad_norm": 0.4653495039809821,
      "learning_rate": 4.5961034268638345e-05,
      "loss": 1.5419,
      "num_input_tokens_seen": 16392267888,
      "step": 20835
    },
    {
      "epoch": 2.210481646509654,
      "grad_norm": 0.9973598854983172,
      "learning_rate": 4.596065550822727e-05,
      "loss": 1.5164,
      "num_input_tokens_seen": 16393054656,
      "step": 20836
    },
    {
      "epoch": 2.2105877360492254,
      "grad_norm": 0.4753961633487531,
      "learning_rate": 4.5960276731618415e-05,
      "loss": 1.5759,
      "num_input_tokens_seen": 16393841376,
      "step": 20837
    },
    {
      "epoch": 2.210693825588797,
      "grad_norm": 1.0435372750782432,
      "learning_rate": 4.595989793881208e-05,
      "loss": 1.656,
      "num_input_tokens_seen": 16394628080,
      "step": 20838
    },
    {
      "epoch": 2.2107999151283684,
      "grad_norm": 0.6858220944365625,
      "learning_rate": 4.595951912980855e-05,
      "loss": 1.545,
      "num_input_tokens_seen": 16395414864,
      "step": 20839
    },
    {
      "epoch": 2.21090600466794,
      "grad_norm": 0.696602263642239,
      "learning_rate": 4.595914030460812e-05,
      "loss": 1.7825,
      "num_input_tokens_seen": 16396201536,
      "step": 20840
    },
    {
      "epoch": 2.2110120942075113,
      "grad_norm": 0.5330260032134172,
      "learning_rate": 4.595876146321108e-05,
      "loss": 1.7015,
      "num_input_tokens_seen": 16396988304,
      "step": 20841
    },
    {
      "epoch": 2.2111181837470824,
      "grad_norm": 0.7294055865507756,
      "learning_rate": 4.595838260561771e-05,
      "loss": 1.4954,
      "num_input_tokens_seen": 16397775072,
      "step": 20842
    },
    {
      "epoch": 2.211224273286654,
      "grad_norm": 0.44638944903246813,
      "learning_rate": 4.595800373182833e-05,
      "loss": 1.6202,
      "num_input_tokens_seen": 16398561792,
      "step": 20843
    },
    {
      "epoch": 2.2113303628262253,
      "grad_norm": 0.8161440863192375,
      "learning_rate": 4.595762484184322e-05,
      "loss": 1.5953,
      "num_input_tokens_seen": 16399348544,
      "step": 20844
    },
    {
      "epoch": 2.211436452365797,
      "grad_norm": 0.48475876490921604,
      "learning_rate": 4.595724593566267e-05,
      "loss": 1.611,
      "num_input_tokens_seen": 16400135344,
      "step": 20845
    },
    {
      "epoch": 2.2115425419053683,
      "grad_norm": 0.6249862439815795,
      "learning_rate": 4.5956867013286976e-05,
      "loss": 1.7369,
      "num_input_tokens_seen": 16400922080,
      "step": 20846
    },
    {
      "epoch": 2.2116486314449397,
      "grad_norm": 0.5197290294717133,
      "learning_rate": 4.595648807471643e-05,
      "loss": 1.6636,
      "num_input_tokens_seen": 16401708832,
      "step": 20847
    },
    {
      "epoch": 2.2117547209845108,
      "grad_norm": 0.6171334371357037,
      "learning_rate": 4.595610911995132e-05,
      "loss": 1.597,
      "num_input_tokens_seen": 16402495680,
      "step": 20848
    },
    {
      "epoch": 2.2118608105240822,
      "grad_norm": 0.4739735947198551,
      "learning_rate": 4.595573014899195e-05,
      "loss": 1.612,
      "num_input_tokens_seen": 16403282512,
      "step": 20849
    },
    {
      "epoch": 2.2119669000636537,
      "grad_norm": 0.548262039570242,
      "learning_rate": 4.5955351161838604e-05,
      "loss": 1.5084,
      "num_input_tokens_seen": 16404069200,
      "step": 20850
    },
    {
      "epoch": 2.212072989603225,
      "grad_norm": 0.4336509423564076,
      "learning_rate": 4.595497215849158e-05,
      "loss": 1.5351,
      "num_input_tokens_seen": 16404855936,
      "step": 20851
    },
    {
      "epoch": 2.2121790791427967,
      "grad_norm": 0.4843219716104533,
      "learning_rate": 4.5954593138951164e-05,
      "loss": 1.6421,
      "num_input_tokens_seen": 16405642624,
      "step": 20852
    },
    {
      "epoch": 2.212285168682368,
      "grad_norm": 0.45527704916958855,
      "learning_rate": 4.595421410321765e-05,
      "loss": 1.6573,
      "num_input_tokens_seen": 16406429456,
      "step": 20853
    },
    {
      "epoch": 2.212391258221939,
      "grad_norm": 0.5381909020498205,
      "learning_rate": 4.595383505129135e-05,
      "loss": 1.6141,
      "num_input_tokens_seen": 16407216240,
      "step": 20854
    },
    {
      "epoch": 2.2124973477615106,
      "grad_norm": 0.4477380215273796,
      "learning_rate": 4.5953455983172524e-05,
      "loss": 1.6548,
      "num_input_tokens_seen": 16408002992,
      "step": 20855
    },
    {
      "epoch": 2.212603437301082,
      "grad_norm": 0.5830096763683114,
      "learning_rate": 4.595307689886149e-05,
      "loss": 1.5763,
      "num_input_tokens_seen": 16408789760,
      "step": 20856
    },
    {
      "epoch": 2.2127095268406536,
      "grad_norm": 0.4023660346971385,
      "learning_rate": 4.5952697798358534e-05,
      "loss": 1.6016,
      "num_input_tokens_seen": 16409576544,
      "step": 20857
    },
    {
      "epoch": 2.212815616380225,
      "grad_norm": 0.5665105362771236,
      "learning_rate": 4.595231868166395e-05,
      "loss": 1.5898,
      "num_input_tokens_seen": 16410363344,
      "step": 20858
    },
    {
      "epoch": 2.212921705919796,
      "grad_norm": 0.42409234904549903,
      "learning_rate": 4.595193954877802e-05,
      "loss": 1.7478,
      "num_input_tokens_seen": 16411150032,
      "step": 20859
    },
    {
      "epoch": 2.2130277954593676,
      "grad_norm": 0.40266089838914393,
      "learning_rate": 4.595156039970106e-05,
      "loss": 1.5418,
      "num_input_tokens_seen": 16411936816,
      "step": 20860
    },
    {
      "epoch": 2.213133884998939,
      "grad_norm": 0.5830794573835055,
      "learning_rate": 4.595118123443333e-05,
      "loss": 1.6112,
      "num_input_tokens_seen": 16412723520,
      "step": 20861
    },
    {
      "epoch": 2.2132399745385105,
      "grad_norm": 0.4266087915355207,
      "learning_rate": 4.5950802052975154e-05,
      "loss": 1.6923,
      "num_input_tokens_seen": 16413510288,
      "step": 20862
    },
    {
      "epoch": 2.213346064078082,
      "grad_norm": 0.5343435671755126,
      "learning_rate": 4.5950422855326816e-05,
      "loss": 1.6357,
      "num_input_tokens_seen": 16414296960,
      "step": 20863
    },
    {
      "epoch": 2.2134521536176535,
      "grad_norm": 0.46919809301335297,
      "learning_rate": 4.5950043641488595e-05,
      "loss": 1.7457,
      "num_input_tokens_seen": 16415083680,
      "step": 20864
    },
    {
      "epoch": 2.2135582431572245,
      "grad_norm": 0.47502731315100843,
      "learning_rate": 4.59496644114608e-05,
      "loss": 1.6893,
      "num_input_tokens_seen": 16415870512,
      "step": 20865
    },
    {
      "epoch": 2.213664332696796,
      "grad_norm": 0.46435588696836483,
      "learning_rate": 4.5949285165243724e-05,
      "loss": 1.7245,
      "num_input_tokens_seen": 16416657296,
      "step": 20866
    },
    {
      "epoch": 2.2137704222363674,
      "grad_norm": 0.5448449292501204,
      "learning_rate": 4.594890590283765e-05,
      "loss": 1.6709,
      "num_input_tokens_seen": 16417443952,
      "step": 20867
    },
    {
      "epoch": 2.213876511775939,
      "grad_norm": 0.4263862866090504,
      "learning_rate": 4.594852662424287e-05,
      "loss": 1.6181,
      "num_input_tokens_seen": 16418230608,
      "step": 20868
    },
    {
      "epoch": 2.2139826013155104,
      "grad_norm": 0.6497378057412844,
      "learning_rate": 4.5948147329459696e-05,
      "loss": 1.6707,
      "num_input_tokens_seen": 16419017376,
      "step": 20869
    },
    {
      "epoch": 2.214088690855082,
      "grad_norm": 0.38451038776544605,
      "learning_rate": 4.5947768018488405e-05,
      "loss": 1.5104,
      "num_input_tokens_seen": 16419804080,
      "step": 20870
    },
    {
      "epoch": 2.214194780394653,
      "grad_norm": 0.5346817555359475,
      "learning_rate": 4.5947388691329285e-05,
      "loss": 1.498,
      "num_input_tokens_seen": 16420590848,
      "step": 20871
    },
    {
      "epoch": 2.2143008699342244,
      "grad_norm": 0.4595602711524574,
      "learning_rate": 4.594700934798265e-05,
      "loss": 1.7339,
      "num_input_tokens_seen": 16421377664,
      "step": 20872
    },
    {
      "epoch": 2.214406959473796,
      "grad_norm": 0.6189556589566316,
      "learning_rate": 4.594662998844877e-05,
      "loss": 1.6048,
      "num_input_tokens_seen": 16422164416,
      "step": 20873
    },
    {
      "epoch": 2.2145130490133673,
      "grad_norm": 0.5250339517025568,
      "learning_rate": 4.5946250612727955e-05,
      "loss": 1.6024,
      "num_input_tokens_seen": 16422951200,
      "step": 20874
    },
    {
      "epoch": 2.214619138552939,
      "grad_norm": 0.4684794382033691,
      "learning_rate": 4.594587122082049e-05,
      "loss": 1.6283,
      "num_input_tokens_seen": 16423738032,
      "step": 20875
    },
    {
      "epoch": 2.2147252280925103,
      "grad_norm": 0.5260775512437283,
      "learning_rate": 4.5945491812726674e-05,
      "loss": 1.5519,
      "num_input_tokens_seen": 16424524784,
      "step": 20876
    },
    {
      "epoch": 2.2148313176320813,
      "grad_norm": 0.5227060946430417,
      "learning_rate": 4.594511238844679e-05,
      "loss": 1.6121,
      "num_input_tokens_seen": 16425311584,
      "step": 20877
    },
    {
      "epoch": 2.2149374071716528,
      "grad_norm": 0.41755998143481393,
      "learning_rate": 4.5944732947981136e-05,
      "loss": 1.5436,
      "num_input_tokens_seen": 16426098336,
      "step": 20878
    },
    {
      "epoch": 2.2150434967112242,
      "grad_norm": 0.6932108661397085,
      "learning_rate": 4.594435349133002e-05,
      "loss": 1.6484,
      "num_input_tokens_seen": 16426885040,
      "step": 20879
    },
    {
      "epoch": 2.2151495862507957,
      "grad_norm": 0.3511079778054463,
      "learning_rate": 4.5943974018493705e-05,
      "loss": 1.5742,
      "num_input_tokens_seen": 16427671696,
      "step": 20880
    },
    {
      "epoch": 2.215255675790367,
      "grad_norm": 0.840725158623732,
      "learning_rate": 4.594359452947252e-05,
      "loss": 1.7039,
      "num_input_tokens_seen": 16428458400,
      "step": 20881
    },
    {
      "epoch": 2.2153617653299387,
      "grad_norm": 0.36546416667428844,
      "learning_rate": 4.594321502426673e-05,
      "loss": 1.5719,
      "num_input_tokens_seen": 16429245152,
      "step": 20882
    },
    {
      "epoch": 2.2154678548695097,
      "grad_norm": 0.5451415408441972,
      "learning_rate": 4.5942835502876636e-05,
      "loss": 1.5751,
      "num_input_tokens_seen": 16430031936,
      "step": 20883
    },
    {
      "epoch": 2.215573944409081,
      "grad_norm": 0.41282265892358067,
      "learning_rate": 4.594245596530253e-05,
      "loss": 1.5526,
      "num_input_tokens_seen": 16430818800,
      "step": 20884
    },
    {
      "epoch": 2.2156800339486526,
      "grad_norm": 0.46984560710341566,
      "learning_rate": 4.594207641154472e-05,
      "loss": 1.6217,
      "num_input_tokens_seen": 16431605536,
      "step": 20885
    },
    {
      "epoch": 2.215786123488224,
      "grad_norm": 0.52123205503567,
      "learning_rate": 4.5941696841603476e-05,
      "loss": 1.6212,
      "num_input_tokens_seen": 16432392240,
      "step": 20886
    },
    {
      "epoch": 2.2158922130277956,
      "grad_norm": 0.3549584718753115,
      "learning_rate": 4.594131725547911e-05,
      "loss": 1.6526,
      "num_input_tokens_seen": 16433179056,
      "step": 20887
    },
    {
      "epoch": 2.2159983025673666,
      "grad_norm": 0.56561830575693,
      "learning_rate": 4.5940937653171914e-05,
      "loss": 1.6587,
      "num_input_tokens_seen": 16433965744,
      "step": 20888
    },
    {
      "epoch": 2.216104392106938,
      "grad_norm": 0.4569468085673925,
      "learning_rate": 4.594055803468217e-05,
      "loss": 1.524,
      "num_input_tokens_seen": 16434752560,
      "step": 20889
    },
    {
      "epoch": 2.2162104816465096,
      "grad_norm": 0.5164245055021731,
      "learning_rate": 4.594017840001017e-05,
      "loss": 1.5101,
      "num_input_tokens_seen": 16435539360,
      "step": 20890
    },
    {
      "epoch": 2.216316571186081,
      "grad_norm": 0.4433537999203232,
      "learning_rate": 4.593979874915623e-05,
      "loss": 1.5705,
      "num_input_tokens_seen": 16436326128,
      "step": 20891
    },
    {
      "epoch": 2.2164226607256525,
      "grad_norm": 0.4649088457880096,
      "learning_rate": 4.593941908212062e-05,
      "loss": 1.5516,
      "num_input_tokens_seen": 16437112896,
      "step": 20892
    },
    {
      "epoch": 2.216528750265224,
      "grad_norm": 0.5089932954333013,
      "learning_rate": 4.5939039398903636e-05,
      "loss": 1.6369,
      "num_input_tokens_seen": 16437899648,
      "step": 20893
    },
    {
      "epoch": 2.2166348398047955,
      "grad_norm": 0.3668182415475287,
      "learning_rate": 4.5938659699505574e-05,
      "loss": 1.5539,
      "num_input_tokens_seen": 16438686368,
      "step": 20894
    },
    {
      "epoch": 2.2167409293443665,
      "grad_norm": 0.41933852430629537,
      "learning_rate": 4.593827998392674e-05,
      "loss": 1.5555,
      "num_input_tokens_seen": 16439473168,
      "step": 20895
    },
    {
      "epoch": 2.216847018883938,
      "grad_norm": 0.4451357576882521,
      "learning_rate": 4.5937900252167413e-05,
      "loss": 1.5759,
      "num_input_tokens_seen": 16440260016,
      "step": 20896
    },
    {
      "epoch": 2.2169531084235095,
      "grad_norm": 0.3678650582702184,
      "learning_rate": 4.593752050422789e-05,
      "loss": 1.4895,
      "num_input_tokens_seen": 16441046784,
      "step": 20897
    },
    {
      "epoch": 2.217059197963081,
      "grad_norm": 0.376176082020516,
      "learning_rate": 4.5937140740108475e-05,
      "loss": 1.589,
      "num_input_tokens_seen": 16441833472,
      "step": 20898
    },
    {
      "epoch": 2.2171652875026524,
      "grad_norm": 0.4538001238498184,
      "learning_rate": 4.593676095980944e-05,
      "loss": 1.6821,
      "num_input_tokens_seen": 16442620176,
      "step": 20899
    },
    {
      "epoch": 2.2172713770422234,
      "grad_norm": 0.40248018549974035,
      "learning_rate": 4.59363811633311e-05,
      "loss": 1.6349,
      "num_input_tokens_seen": 16443406976,
      "step": 20900
    },
    {
      "epoch": 2.217377466581795,
      "grad_norm": 0.41763182738375176,
      "learning_rate": 4.593600135067373e-05,
      "loss": 1.5949,
      "num_input_tokens_seen": 16444193792,
      "step": 20901
    },
    {
      "epoch": 2.2174835561213664,
      "grad_norm": 0.3783660162091622,
      "learning_rate": 4.593562152183764e-05,
      "loss": 1.5732,
      "num_input_tokens_seen": 16444980624,
      "step": 20902
    },
    {
      "epoch": 2.217589645660938,
      "grad_norm": 0.4317091487362444,
      "learning_rate": 4.593524167682311e-05,
      "loss": 1.5897,
      "num_input_tokens_seen": 16445767456,
      "step": 20903
    },
    {
      "epoch": 2.2176957352005093,
      "grad_norm": 0.4208144348677465,
      "learning_rate": 4.593486181563045e-05,
      "loss": 1.7186,
      "num_input_tokens_seen": 16446554208,
      "step": 20904
    },
    {
      "epoch": 2.217801824740081,
      "grad_norm": 0.38595285249127215,
      "learning_rate": 4.5934481938259934e-05,
      "loss": 1.5885,
      "num_input_tokens_seen": 16447340912,
      "step": 20905
    },
    {
      "epoch": 2.217907914279652,
      "grad_norm": 0.5142598586543551,
      "learning_rate": 4.5934102044711864e-05,
      "loss": 1.7546,
      "num_input_tokens_seen": 16448127568,
      "step": 20906
    },
    {
      "epoch": 2.2180140038192233,
      "grad_norm": 0.4176318677489021,
      "learning_rate": 4.5933722134986535e-05,
      "loss": 1.6561,
      "num_input_tokens_seen": 16448914336,
      "step": 20907
    },
    {
      "epoch": 2.218120093358795,
      "grad_norm": 0.3810676234663491,
      "learning_rate": 4.593334220908424e-05,
      "loss": 1.5416,
      "num_input_tokens_seen": 16449701024,
      "step": 20908
    },
    {
      "epoch": 2.2182261828983663,
      "grad_norm": 0.44575265041375906,
      "learning_rate": 4.5932962267005275e-05,
      "loss": 1.7015,
      "num_input_tokens_seen": 16450487792,
      "step": 20909
    },
    {
      "epoch": 2.2183322724379377,
      "grad_norm": 0.3718470939025375,
      "learning_rate": 4.5932582308749925e-05,
      "loss": 1.5319,
      "num_input_tokens_seen": 16451274512,
      "step": 20910
    },
    {
      "epoch": 2.218438361977509,
      "grad_norm": 0.42416719733319574,
      "learning_rate": 4.5932202334318496e-05,
      "loss": 1.6205,
      "num_input_tokens_seen": 16452061328,
      "step": 20911
    },
    {
      "epoch": 2.2185444515170802,
      "grad_norm": 0.46543247185886516,
      "learning_rate": 4.593182234371128e-05,
      "loss": 1.5821,
      "num_input_tokens_seen": 16452848064,
      "step": 20912
    },
    {
      "epoch": 2.2186505410566517,
      "grad_norm": 0.5845993098098077,
      "learning_rate": 4.593144233692855e-05,
      "loss": 1.6443,
      "num_input_tokens_seen": 16453634848,
      "step": 20913
    },
    {
      "epoch": 2.218756630596223,
      "grad_norm": 0.4992269847128023,
      "learning_rate": 4.593106231397063e-05,
      "loss": 1.774,
      "num_input_tokens_seen": 16454421568,
      "step": 20914
    },
    {
      "epoch": 2.2188627201357947,
      "grad_norm": 0.7224516570802794,
      "learning_rate": 4.59306822748378e-05,
      "loss": 1.6358,
      "num_input_tokens_seen": 16455208320,
      "step": 20915
    },
    {
      "epoch": 2.218968809675366,
      "grad_norm": 0.3598211437448816,
      "learning_rate": 4.593030221953034e-05,
      "loss": 1.5351,
      "num_input_tokens_seen": 16455994992,
      "step": 20916
    },
    {
      "epoch": 2.2190748992149376,
      "grad_norm": 0.48514057257360393,
      "learning_rate": 4.592992214804857e-05,
      "loss": 1.6658,
      "num_input_tokens_seen": 16456781760,
      "step": 20917
    },
    {
      "epoch": 2.2191809887545086,
      "grad_norm": 0.4213919825966283,
      "learning_rate": 4.592954206039276e-05,
      "loss": 1.6064,
      "num_input_tokens_seen": 16457568512,
      "step": 20918
    },
    {
      "epoch": 2.21928707829408,
      "grad_norm": 0.42340516071895795,
      "learning_rate": 4.592916195656322e-05,
      "loss": 1.4872,
      "num_input_tokens_seen": 16458355360,
      "step": 20919
    },
    {
      "epoch": 2.2193931678336516,
      "grad_norm": 0.42121728909605344,
      "learning_rate": 4.592878183656023e-05,
      "loss": 1.6092,
      "num_input_tokens_seen": 16459142096,
      "step": 20920
    },
    {
      "epoch": 2.219499257373223,
      "grad_norm": 0.41479098029468686,
      "learning_rate": 4.59284017003841e-05,
      "loss": 1.6389,
      "num_input_tokens_seen": 16459928864,
      "step": 20921
    },
    {
      "epoch": 2.2196053469127945,
      "grad_norm": 0.4310790281575794,
      "learning_rate": 4.592802154803512e-05,
      "loss": 1.611,
      "num_input_tokens_seen": 16460715664,
      "step": 20922
    },
    {
      "epoch": 2.219711436452366,
      "grad_norm": 0.4752507008918911,
      "learning_rate": 4.592764137951356e-05,
      "loss": 1.5744,
      "num_input_tokens_seen": 16461502448,
      "step": 20923
    },
    {
      "epoch": 2.219817525991937,
      "grad_norm": 0.42602443756276964,
      "learning_rate": 4.592726119481975e-05,
      "loss": 1.699,
      "num_input_tokens_seen": 16462289280,
      "step": 20924
    },
    {
      "epoch": 2.2199236155315085,
      "grad_norm": 0.4679871696501689,
      "learning_rate": 4.592688099395396e-05,
      "loss": 1.6583,
      "num_input_tokens_seen": 16463076064,
      "step": 20925
    },
    {
      "epoch": 2.22002970507108,
      "grad_norm": 0.3926427035791193,
      "learning_rate": 4.592650077691649e-05,
      "loss": 1.6803,
      "num_input_tokens_seen": 16463862832,
      "step": 20926
    },
    {
      "epoch": 2.2201357946106515,
      "grad_norm": 0.4295284325770229,
      "learning_rate": 4.592612054370763e-05,
      "loss": 1.638,
      "num_input_tokens_seen": 16464649616,
      "step": 20927
    },
    {
      "epoch": 2.220241884150223,
      "grad_norm": 0.38431970028298706,
      "learning_rate": 4.592574029432768e-05,
      "loss": 1.5126,
      "num_input_tokens_seen": 16465436416,
      "step": 20928
    },
    {
      "epoch": 2.220347973689794,
      "grad_norm": 0.40912765321200467,
      "learning_rate": 4.5925360028776945e-05,
      "loss": 1.6397,
      "num_input_tokens_seen": 16466223216,
      "step": 20929
    },
    {
      "epoch": 2.2204540632293654,
      "grad_norm": 0.38099718699363283,
      "learning_rate": 4.592497974705569e-05,
      "loss": 1.4935,
      "num_input_tokens_seen": 16467010032,
      "step": 20930
    },
    {
      "epoch": 2.220560152768937,
      "grad_norm": 0.40822141826448627,
      "learning_rate": 4.592459944916423e-05,
      "loss": 1.5396,
      "num_input_tokens_seen": 16467796736,
      "step": 20931
    },
    {
      "epoch": 2.2206662423085084,
      "grad_norm": 0.40716075978245003,
      "learning_rate": 4.5924219135102855e-05,
      "loss": 1.677,
      "num_input_tokens_seen": 16468583584,
      "step": 20932
    },
    {
      "epoch": 2.22077233184808,
      "grad_norm": 0.4004554681061361,
      "learning_rate": 4.5923838804871855e-05,
      "loss": 1.6971,
      "num_input_tokens_seen": 16469370320,
      "step": 20933
    },
    {
      "epoch": 2.2208784213876513,
      "grad_norm": 0.3994370009443831,
      "learning_rate": 4.592345845847154e-05,
      "loss": 1.6766,
      "num_input_tokens_seen": 16470157024,
      "step": 20934
    },
    {
      "epoch": 2.2209845109272224,
      "grad_norm": 0.3856075457888689,
      "learning_rate": 4.5923078095902175e-05,
      "loss": 1.5722,
      "num_input_tokens_seen": 16470943856,
      "step": 20935
    },
    {
      "epoch": 2.221090600466794,
      "grad_norm": 0.40118573025865767,
      "learning_rate": 4.5922697717164065e-05,
      "loss": 1.5998,
      "num_input_tokens_seen": 16471730576,
      "step": 20936
    },
    {
      "epoch": 2.2211966900063653,
      "grad_norm": 0.3711918414615975,
      "learning_rate": 4.592231732225751e-05,
      "loss": 1.6062,
      "num_input_tokens_seen": 16472517328,
      "step": 20937
    },
    {
      "epoch": 2.221302779545937,
      "grad_norm": 0.38605622222566127,
      "learning_rate": 4.5921936911182815e-05,
      "loss": 1.6066,
      "num_input_tokens_seen": 16473304144,
      "step": 20938
    },
    {
      "epoch": 2.2214088690855083,
      "grad_norm": 0.32869384789990697,
      "learning_rate": 4.592155648394025e-05,
      "loss": 1.4504,
      "num_input_tokens_seen": 16474090992,
      "step": 20939
    },
    {
      "epoch": 2.2215149586250797,
      "grad_norm": 0.4206987135226947,
      "learning_rate": 4.5921176040530124e-05,
      "loss": 1.6211,
      "num_input_tokens_seen": 16474877696,
      "step": 20940
    },
    {
      "epoch": 2.221621048164651,
      "grad_norm": 0.4023922351864797,
      "learning_rate": 4.592079558095273e-05,
      "loss": 1.6341,
      "num_input_tokens_seen": 16475664416,
      "step": 20941
    },
    {
      "epoch": 2.2217271377042223,
      "grad_norm": 0.36518094022195063,
      "learning_rate": 4.592041510520835e-05,
      "loss": 1.5892,
      "num_input_tokens_seen": 16476451232,
      "step": 20942
    },
    {
      "epoch": 2.2218332272437937,
      "grad_norm": 0.43961439736174135,
      "learning_rate": 4.5920034613297296e-05,
      "loss": 1.6924,
      "num_input_tokens_seen": 16477237968,
      "step": 20943
    },
    {
      "epoch": 2.221939316783365,
      "grad_norm": 0.3480234192253944,
      "learning_rate": 4.591965410521985e-05,
      "loss": 1.6227,
      "num_input_tokens_seen": 16478024688,
      "step": 20944
    },
    {
      "epoch": 2.2220454063229367,
      "grad_norm": 0.39895476777395844,
      "learning_rate": 4.5919273580976306e-05,
      "loss": 1.574,
      "num_input_tokens_seen": 16478811568,
      "step": 20945
    },
    {
      "epoch": 2.222151495862508,
      "grad_norm": 0.41937546290433986,
      "learning_rate": 4.591889304056697e-05,
      "loss": 1.5586,
      "num_input_tokens_seen": 16479598448,
      "step": 20946
    },
    {
      "epoch": 2.222257585402079,
      "grad_norm": 0.4537198179389301,
      "learning_rate": 4.5918512483992116e-05,
      "loss": 1.7183,
      "num_input_tokens_seen": 16480385232,
      "step": 20947
    },
    {
      "epoch": 2.2223636749416507,
      "grad_norm": 0.4953615354985112,
      "learning_rate": 4.591813191125205e-05,
      "loss": 1.5417,
      "num_input_tokens_seen": 16481172048,
      "step": 20948
    },
    {
      "epoch": 2.222469764481222,
      "grad_norm": 0.42405877681594273,
      "learning_rate": 4.591775132234708e-05,
      "loss": 1.6865,
      "num_input_tokens_seen": 16481958832,
      "step": 20949
    },
    {
      "epoch": 2.2225758540207936,
      "grad_norm": 0.3780537890688761,
      "learning_rate": 4.5917370717277474e-05,
      "loss": 1.6057,
      "num_input_tokens_seen": 16482745616,
      "step": 20950
    },
    {
      "epoch": 2.222681943560365,
      "grad_norm": 0.34557678247364887,
      "learning_rate": 4.5916990096043535e-05,
      "loss": 1.551,
      "num_input_tokens_seen": 16483532368,
      "step": 20951
    },
    {
      "epoch": 2.2227880330999366,
      "grad_norm": 0.39068802539535774,
      "learning_rate": 4.5916609458645564e-05,
      "loss": 1.5708,
      "num_input_tokens_seen": 16484319136,
      "step": 20952
    },
    {
      "epoch": 2.2228941226395076,
      "grad_norm": 0.3675726834491255,
      "learning_rate": 4.5916228805083846e-05,
      "loss": 1.655,
      "num_input_tokens_seen": 16485105952,
      "step": 20953
    },
    {
      "epoch": 2.223000212179079,
      "grad_norm": 0.39540967743589533,
      "learning_rate": 4.5915848135358694e-05,
      "loss": 1.574,
      "num_input_tokens_seen": 16485892832,
      "step": 20954
    },
    {
      "epoch": 2.2231063017186505,
      "grad_norm": 0.39027826374082913,
      "learning_rate": 4.591546744947037e-05,
      "loss": 1.7037,
      "num_input_tokens_seen": 16486679600,
      "step": 20955
    },
    {
      "epoch": 2.223212391258222,
      "grad_norm": 0.35808010677574736,
      "learning_rate": 4.59150867474192e-05,
      "loss": 1.5902,
      "num_input_tokens_seen": 16487466400,
      "step": 20956
    },
    {
      "epoch": 2.2233184807977935,
      "grad_norm": 0.47391945764100935,
      "learning_rate": 4.5914706029205465e-05,
      "loss": 1.6518,
      "num_input_tokens_seen": 16488253200,
      "step": 20957
    },
    {
      "epoch": 2.2234245703373645,
      "grad_norm": 0.35631181314938093,
      "learning_rate": 4.591432529482945e-05,
      "loss": 1.6176,
      "num_input_tokens_seen": 16489039936,
      "step": 20958
    },
    {
      "epoch": 2.223530659876936,
      "grad_norm": 0.3665761822743894,
      "learning_rate": 4.591394454429147e-05,
      "loss": 1.622,
      "num_input_tokens_seen": 16489826752,
      "step": 20959
    },
    {
      "epoch": 2.2236367494165075,
      "grad_norm": 0.3769402967026214,
      "learning_rate": 4.5913563777591796e-05,
      "loss": 1.6248,
      "num_input_tokens_seen": 16490613552,
      "step": 20960
    },
    {
      "epoch": 2.223742838956079,
      "grad_norm": 0.3521550642622393,
      "learning_rate": 4.5913182994730736e-05,
      "loss": 1.6802,
      "num_input_tokens_seen": 16491400288,
      "step": 20961
    },
    {
      "epoch": 2.2238489284956504,
      "grad_norm": 0.42242492103925605,
      "learning_rate": 4.591280219570858e-05,
      "loss": 1.448,
      "num_input_tokens_seen": 16492187072,
      "step": 20962
    },
    {
      "epoch": 2.223955018035222,
      "grad_norm": 0.33334027130855315,
      "learning_rate": 4.591242138052563e-05,
      "loss": 1.6154,
      "num_input_tokens_seen": 16492973824,
      "step": 20963
    },
    {
      "epoch": 2.2240611075747934,
      "grad_norm": 0.3961721479873191,
      "learning_rate": 4.5912040549182166e-05,
      "loss": 1.6515,
      "num_input_tokens_seen": 16493760560,
      "step": 20964
    },
    {
      "epoch": 2.2241671971143644,
      "grad_norm": 0.4174784215636645,
      "learning_rate": 4.59116597016785e-05,
      "loss": 1.5103,
      "num_input_tokens_seen": 16494547360,
      "step": 20965
    },
    {
      "epoch": 2.224273286653936,
      "grad_norm": 0.3947211020894859,
      "learning_rate": 4.5911278838014915e-05,
      "loss": 1.6015,
      "num_input_tokens_seen": 16495334112,
      "step": 20966
    },
    {
      "epoch": 2.2243793761935073,
      "grad_norm": 0.4398889685066576,
      "learning_rate": 4.59108979581917e-05,
      "loss": 1.789,
      "num_input_tokens_seen": 16496120912,
      "step": 20967
    },
    {
      "epoch": 2.224485465733079,
      "grad_norm": 0.40677719867904355,
      "learning_rate": 4.591051706220917e-05,
      "loss": 1.724,
      "num_input_tokens_seen": 16496907696,
      "step": 20968
    },
    {
      "epoch": 2.2245915552726503,
      "grad_norm": 0.37550658790687247,
      "learning_rate": 4.59101361500676e-05,
      "loss": 1.6389,
      "num_input_tokens_seen": 16497694480,
      "step": 20969
    },
    {
      "epoch": 2.2246976448122213,
      "grad_norm": 0.3851838847119383,
      "learning_rate": 4.590975522176728e-05,
      "loss": 1.6484,
      "num_input_tokens_seen": 16498481184,
      "step": 20970
    },
    {
      "epoch": 2.224803734351793,
      "grad_norm": 0.4285200431235944,
      "learning_rate": 4.5909374277308524e-05,
      "loss": 1.6796,
      "num_input_tokens_seen": 16499267888,
      "step": 20971
    },
    {
      "epoch": 2.2249098238913643,
      "grad_norm": 0.36995616038625034,
      "learning_rate": 4.590899331669162e-05,
      "loss": 1.6163,
      "num_input_tokens_seen": 16500054656,
      "step": 20972
    },
    {
      "epoch": 2.2250159134309357,
      "grad_norm": 0.42370973912990206,
      "learning_rate": 4.5908612339916845e-05,
      "loss": 1.6275,
      "num_input_tokens_seen": 16500841472,
      "step": 20973
    },
    {
      "epoch": 2.225122002970507,
      "grad_norm": 0.4137241834205495,
      "learning_rate": 4.590823134698452e-05,
      "loss": 1.717,
      "num_input_tokens_seen": 16501628240,
      "step": 20974
    },
    {
      "epoch": 2.2252280925100787,
      "grad_norm": 0.37626406529063855,
      "learning_rate": 4.590785033789493e-05,
      "loss": 1.6246,
      "num_input_tokens_seen": 16502414992,
      "step": 20975
    },
    {
      "epoch": 2.2253341820496497,
      "grad_norm": 0.3655070625134495,
      "learning_rate": 4.590746931264836e-05,
      "loss": 1.6343,
      "num_input_tokens_seen": 16503201632,
      "step": 20976
    },
    {
      "epoch": 2.225440271589221,
      "grad_norm": 0.3666190720191474,
      "learning_rate": 4.590708827124511e-05,
      "loss": 1.5297,
      "num_input_tokens_seen": 16503988400,
      "step": 20977
    },
    {
      "epoch": 2.2255463611287927,
      "grad_norm": 0.5680176818951699,
      "learning_rate": 4.5906707213685485e-05,
      "loss": 1.6969,
      "num_input_tokens_seen": 16504775216,
      "step": 20978
    },
    {
      "epoch": 2.225652450668364,
      "grad_norm": 0.6293854563761975,
      "learning_rate": 4.5906326139969764e-05,
      "loss": 1.5205,
      "num_input_tokens_seen": 16505561984,
      "step": 20979
    },
    {
      "epoch": 2.2257585402079356,
      "grad_norm": 0.4008296390391556,
      "learning_rate": 4.5905945050098245e-05,
      "loss": 1.6251,
      "num_input_tokens_seen": 16506348800,
      "step": 20980
    },
    {
      "epoch": 2.225864629747507,
      "grad_norm": 0.3880371532648015,
      "learning_rate": 4.5905563944071226e-05,
      "loss": 1.5781,
      "num_input_tokens_seen": 16507135584,
      "step": 20981
    },
    {
      "epoch": 2.225970719287078,
      "grad_norm": 0.4807834252390644,
      "learning_rate": 4.5905182821889004e-05,
      "loss": 1.6562,
      "num_input_tokens_seen": 16507922272,
      "step": 20982
    },
    {
      "epoch": 2.2260768088266496,
      "grad_norm": 0.4094842548874826,
      "learning_rate": 4.5904801683551866e-05,
      "loss": 1.6824,
      "num_input_tokens_seen": 16508709008,
      "step": 20983
    },
    {
      "epoch": 2.226182898366221,
      "grad_norm": 0.400714762743451,
      "learning_rate": 4.590442052906012e-05,
      "loss": 1.6724,
      "num_input_tokens_seen": 16509495856,
      "step": 20984
    },
    {
      "epoch": 2.2262889879057925,
      "grad_norm": 0.4194633840993898,
      "learning_rate": 4.590403935841404e-05,
      "loss": 1.5269,
      "num_input_tokens_seen": 16510282640,
      "step": 20985
    },
    {
      "epoch": 2.226395077445364,
      "grad_norm": 0.43528045804169957,
      "learning_rate": 4.590365817161394e-05,
      "loss": 1.6313,
      "num_input_tokens_seen": 16511069440,
      "step": 20986
    },
    {
      "epoch": 2.226501166984935,
      "grad_norm": 0.388808574825352,
      "learning_rate": 4.59032769686601e-05,
      "loss": 1.6527,
      "num_input_tokens_seen": 16511856192,
      "step": 20987
    },
    {
      "epoch": 2.2266072565245065,
      "grad_norm": 0.48960300541911916,
      "learning_rate": 4.590289574955283e-05,
      "loss": 1.637,
      "num_input_tokens_seen": 16512642928,
      "step": 20988
    },
    {
      "epoch": 2.226713346064078,
      "grad_norm": 0.4425822974820159,
      "learning_rate": 4.5902514514292406e-05,
      "loss": 1.5705,
      "num_input_tokens_seen": 16513429600,
      "step": 20989
    },
    {
      "epoch": 2.2268194356036495,
      "grad_norm": 0.48531352025850616,
      "learning_rate": 4.5902133262879134e-05,
      "loss": 1.6987,
      "num_input_tokens_seen": 16514216368,
      "step": 20990
    },
    {
      "epoch": 2.226925525143221,
      "grad_norm": 0.4070457909143783,
      "learning_rate": 4.590175199531331e-05,
      "loss": 1.5542,
      "num_input_tokens_seen": 16515003104,
      "step": 20991
    },
    {
      "epoch": 2.2270316146827924,
      "grad_norm": 0.581015253801688,
      "learning_rate": 4.5901370711595224e-05,
      "loss": 1.4332,
      "num_input_tokens_seen": 16515789920,
      "step": 20992
    },
    {
      "epoch": 2.227137704222364,
      "grad_norm": 0.4464760938723649,
      "learning_rate": 4.590098941172517e-05,
      "loss": 1.5337,
      "num_input_tokens_seen": 16516576720,
      "step": 20993
    },
    {
      "epoch": 2.227243793761935,
      "grad_norm": 0.39805940360930325,
      "learning_rate": 4.590060809570345e-05,
      "loss": 1.6212,
      "num_input_tokens_seen": 16517363440,
      "step": 20994
    },
    {
      "epoch": 2.2273498833015064,
      "grad_norm": 0.7159341948187169,
      "learning_rate": 4.590022676353034e-05,
      "loss": 1.738,
      "num_input_tokens_seen": 16518150160,
      "step": 20995
    },
    {
      "epoch": 2.227455972841078,
      "grad_norm": 0.41403093191756674,
      "learning_rate": 4.589984541520615e-05,
      "loss": 1.6404,
      "num_input_tokens_seen": 16518937008,
      "step": 20996
    },
    {
      "epoch": 2.2275620623806494,
      "grad_norm": 0.5126565552975819,
      "learning_rate": 4.5899464050731187e-05,
      "loss": 1.5249,
      "num_input_tokens_seen": 16519723840,
      "step": 20997
    },
    {
      "epoch": 2.227668151920221,
      "grad_norm": 0.5888301897455455,
      "learning_rate": 4.589908267010573e-05,
      "loss": 1.7473,
      "num_input_tokens_seen": 16520510560,
      "step": 20998
    },
    {
      "epoch": 2.227774241459792,
      "grad_norm": 0.6307150739717806,
      "learning_rate": 4.589870127333006e-05,
      "loss": 1.6342,
      "num_input_tokens_seen": 16521297344,
      "step": 20999
    },
    {
      "epoch": 2.2278803309993633,
      "grad_norm": 0.49892205319502336,
      "learning_rate": 4.589831986040451e-05,
      "loss": 1.6666,
      "num_input_tokens_seen": 16522084096,
      "step": 21000
    },
    {
      "epoch": 2.2278803309993633,
      "eval_loss": 1.6974067687988281,
      "eval_runtime": 66.3047,
      "eval_samples_per_second": 45.246,
      "eval_steps_per_second": 0.483,
      "num_input_tokens_seen": 16522084096,
      "step": 21000
    },
    {
      "epoch": 2.227986420538935,
      "grad_norm": 0.43658098305123044,
      "learning_rate": 4.5897938431329326e-05,
      "loss": 1.6533,
      "num_input_tokens_seen": 16522870848,
      "step": 21001
    },
    {
      "epoch": 2.2280925100785063,
      "grad_norm": 0.6173762527961102,
      "learning_rate": 4.589755698610484e-05,
      "loss": 1.5836,
      "num_input_tokens_seen": 16523657600,
      "step": 21002
    },
    {
      "epoch": 2.2281985996180778,
      "grad_norm": 0.5376451645239156,
      "learning_rate": 4.589717552473134e-05,
      "loss": 1.6468,
      "num_input_tokens_seen": 16524444368,
      "step": 21003
    },
    {
      "epoch": 2.2283046891576492,
      "grad_norm": 0.7891982247866872,
      "learning_rate": 4.589679404720911e-05,
      "loss": 1.5841,
      "num_input_tokens_seen": 16525231104,
      "step": 21004
    },
    {
      "epoch": 2.2284107786972203,
      "grad_norm": 0.3920459792594954,
      "learning_rate": 4.5896412553538446e-05,
      "loss": 1.6057,
      "num_input_tokens_seen": 16526017872,
      "step": 21005
    },
    {
      "epoch": 2.2285168682367917,
      "grad_norm": 0.5066420778034832,
      "learning_rate": 4.5896031043719653e-05,
      "loss": 1.6561,
      "num_input_tokens_seen": 16526804688,
      "step": 21006
    },
    {
      "epoch": 2.228622957776363,
      "grad_norm": 0.5234196436110121,
      "learning_rate": 4.5895649517753025e-05,
      "loss": 1.4844,
      "num_input_tokens_seen": 16527591456,
      "step": 21007
    },
    {
      "epoch": 2.2287290473159347,
      "grad_norm": 0.5808958574347606,
      "learning_rate": 4.589526797563885e-05,
      "loss": 1.558,
      "num_input_tokens_seen": 16528378176,
      "step": 21008
    },
    {
      "epoch": 2.228835136855506,
      "grad_norm": 0.4407233073162976,
      "learning_rate": 4.5894886417377424e-05,
      "loss": 1.5608,
      "num_input_tokens_seen": 16529164960,
      "step": 21009
    },
    {
      "epoch": 2.2289412263950776,
      "grad_norm": 0.500268666512478,
      "learning_rate": 4.589450484296904e-05,
      "loss": 1.6378,
      "num_input_tokens_seen": 16529951776,
      "step": 21010
    },
    {
      "epoch": 2.2290473159346487,
      "grad_norm": 0.5045659590613161,
      "learning_rate": 4.5894123252414003e-05,
      "loss": 1.738,
      "num_input_tokens_seen": 16530738480,
      "step": 21011
    },
    {
      "epoch": 2.22915340547422,
      "grad_norm": 0.3494680350302335,
      "learning_rate": 4.589374164571259e-05,
      "loss": 1.4655,
      "num_input_tokens_seen": 16531525184,
      "step": 21012
    },
    {
      "epoch": 2.2292594950137916,
      "grad_norm": 0.550639800580505,
      "learning_rate": 4.589336002286511e-05,
      "loss": 1.5201,
      "num_input_tokens_seen": 16532311856,
      "step": 21013
    },
    {
      "epoch": 2.229365584553363,
      "grad_norm": 0.41248929263962314,
      "learning_rate": 4.589297838387185e-05,
      "loss": 1.6321,
      "num_input_tokens_seen": 16533098544,
      "step": 21014
    },
    {
      "epoch": 2.2294716740929346,
      "grad_norm": 0.4084635133014987,
      "learning_rate": 4.5892596728733125e-05,
      "loss": 1.5975,
      "num_input_tokens_seen": 16533885328,
      "step": 21015
    },
    {
      "epoch": 2.229577763632506,
      "grad_norm": 0.46976232171481597,
      "learning_rate": 4.5892215057449205e-05,
      "loss": 1.6156,
      "num_input_tokens_seen": 16534672144,
      "step": 21016
    },
    {
      "epoch": 2.229683853172077,
      "grad_norm": 0.40725667154491596,
      "learning_rate": 4.589183337002039e-05,
      "loss": 1.7274,
      "num_input_tokens_seen": 16535458928,
      "step": 21017
    },
    {
      "epoch": 2.2297899427116485,
      "grad_norm": 0.414260634585457,
      "learning_rate": 4.5891451666446985e-05,
      "loss": 1.6404,
      "num_input_tokens_seen": 16536245792,
      "step": 21018
    },
    {
      "epoch": 2.22989603225122,
      "grad_norm": 0.4640669283179489,
      "learning_rate": 4.5891069946729274e-05,
      "loss": 1.7833,
      "num_input_tokens_seen": 16537032480,
      "step": 21019
    },
    {
      "epoch": 2.2300021217907915,
      "grad_norm": 0.35474257019173805,
      "learning_rate": 4.589068821086756e-05,
      "loss": 1.6613,
      "num_input_tokens_seen": 16537819184,
      "step": 21020
    },
    {
      "epoch": 2.230108211330363,
      "grad_norm": 0.4494461695720948,
      "learning_rate": 4.5890306458862135e-05,
      "loss": 1.5812,
      "num_input_tokens_seen": 16538606016,
      "step": 21021
    },
    {
      "epoch": 2.2302143008699344,
      "grad_norm": 0.4163939342070209,
      "learning_rate": 4.5889924690713296e-05,
      "loss": 1.6163,
      "num_input_tokens_seen": 16539392752,
      "step": 21022
    },
    {
      "epoch": 2.2303203904095055,
      "grad_norm": 0.4182812158873158,
      "learning_rate": 4.588954290642134e-05,
      "loss": 1.5345,
      "num_input_tokens_seen": 16540179440,
      "step": 21023
    },
    {
      "epoch": 2.230426479949077,
      "grad_norm": 0.3927770411640926,
      "learning_rate": 4.588916110598655e-05,
      "loss": 1.6579,
      "num_input_tokens_seen": 16540966240,
      "step": 21024
    },
    {
      "epoch": 2.2305325694886484,
      "grad_norm": 0.46694903618455025,
      "learning_rate": 4.588877928940923e-05,
      "loss": 1.6309,
      "num_input_tokens_seen": 16541753104,
      "step": 21025
    },
    {
      "epoch": 2.23063865902822,
      "grad_norm": 0.41042646935686694,
      "learning_rate": 4.588839745668968e-05,
      "loss": 1.6165,
      "num_input_tokens_seen": 16542539856,
      "step": 21026
    },
    {
      "epoch": 2.2307447485677914,
      "grad_norm": 0.4396632294946189,
      "learning_rate": 4.5888015607828186e-05,
      "loss": 1.6736,
      "num_input_tokens_seen": 16543326592,
      "step": 21027
    },
    {
      "epoch": 2.2308508381073624,
      "grad_norm": 0.3732028522815195,
      "learning_rate": 4.588763374282504e-05,
      "loss": 1.4832,
      "num_input_tokens_seen": 16544113312,
      "step": 21028
    },
    {
      "epoch": 2.230956927646934,
      "grad_norm": 0.37551132083021793,
      "learning_rate": 4.5887251861680555e-05,
      "loss": 1.4682,
      "num_input_tokens_seen": 16544900112,
      "step": 21029
    },
    {
      "epoch": 2.2310630171865053,
      "grad_norm": 0.3251648676564789,
      "learning_rate": 4.5886869964395005e-05,
      "loss": 1.4417,
      "num_input_tokens_seen": 16545686864,
      "step": 21030
    },
    {
      "epoch": 2.231169106726077,
      "grad_norm": 0.36995263490553676,
      "learning_rate": 4.58864880509687e-05,
      "loss": 1.536,
      "num_input_tokens_seen": 16546473728,
      "step": 21031
    },
    {
      "epoch": 2.2312751962656483,
      "grad_norm": 0.538117558899168,
      "learning_rate": 4.588610612140193e-05,
      "loss": 1.6183,
      "num_input_tokens_seen": 16547260496,
      "step": 21032
    },
    {
      "epoch": 2.2313812858052198,
      "grad_norm": 0.4989245543760931,
      "learning_rate": 4.588572417569499e-05,
      "loss": 1.5548,
      "num_input_tokens_seen": 16548047232,
      "step": 21033
    },
    {
      "epoch": 2.231487375344791,
      "grad_norm": 0.47538865436819217,
      "learning_rate": 4.588534221384817e-05,
      "loss": 1.5604,
      "num_input_tokens_seen": 16548834064,
      "step": 21034
    },
    {
      "epoch": 2.2315934648843623,
      "grad_norm": 0.4095575848528417,
      "learning_rate": 4.588496023586178e-05,
      "loss": 1.5926,
      "num_input_tokens_seen": 16549620848,
      "step": 21035
    },
    {
      "epoch": 2.2316995544239338,
      "grad_norm": 0.5304362042151932,
      "learning_rate": 4.58845782417361e-05,
      "loss": 1.495,
      "num_input_tokens_seen": 16550407648,
      "step": 21036
    },
    {
      "epoch": 2.2318056439635052,
      "grad_norm": 0.6168502748352835,
      "learning_rate": 4.588419623147143e-05,
      "loss": 1.5562,
      "num_input_tokens_seen": 16551194416,
      "step": 21037
    },
    {
      "epoch": 2.2319117335030767,
      "grad_norm": 0.6149428234331488,
      "learning_rate": 4.588381420506807e-05,
      "loss": 1.6172,
      "num_input_tokens_seen": 16551981216,
      "step": 21038
    },
    {
      "epoch": 2.232017823042648,
      "grad_norm": 1.293393155141371,
      "learning_rate": 4.5883432162526306e-05,
      "loss": 1.6964,
      "num_input_tokens_seen": 16552767920,
      "step": 21039
    },
    {
      "epoch": 2.232123912582219,
      "grad_norm": 0.48399887973970707,
      "learning_rate": 4.5883050103846434e-05,
      "loss": 1.6312,
      "num_input_tokens_seen": 16553554656,
      "step": 21040
    },
    {
      "epoch": 2.2322300021217907,
      "grad_norm": 3.293199289457009,
      "learning_rate": 4.588266802902876e-05,
      "loss": 1.4478,
      "num_input_tokens_seen": 16554341424,
      "step": 21041
    },
    {
      "epoch": 2.232336091661362,
      "grad_norm": 1.2333474059881224,
      "learning_rate": 4.588228593807358e-05,
      "loss": 1.7172,
      "num_input_tokens_seen": 16555128144,
      "step": 21042
    },
    {
      "epoch": 2.2324421812009336,
      "grad_norm": 3.05011884173626,
      "learning_rate": 4.588190383098117e-05,
      "loss": 1.7282,
      "num_input_tokens_seen": 16555914928,
      "step": 21043
    },
    {
      "epoch": 2.232548270740505,
      "grad_norm": 0.7622150672364058,
      "learning_rate": 4.588152170775184e-05,
      "loss": 1.8022,
      "num_input_tokens_seen": 16556701536,
      "step": 21044
    },
    {
      "epoch": 2.2326543602800766,
      "grad_norm": 0.8315544035424199,
      "learning_rate": 4.588113956838589e-05,
      "loss": 1.6691,
      "num_input_tokens_seen": 16557488256,
      "step": 21045
    },
    {
      "epoch": 2.2327604498196476,
      "grad_norm": 0.5777455204901667,
      "learning_rate": 4.58807574128836e-05,
      "loss": 1.4988,
      "num_input_tokens_seen": 16558275104,
      "step": 21046
    },
    {
      "epoch": 2.232866539359219,
      "grad_norm": 0.5873639696982357,
      "learning_rate": 4.588037524124528e-05,
      "loss": 1.5714,
      "num_input_tokens_seen": 16559061968,
      "step": 21047
    },
    {
      "epoch": 2.2329726288987906,
      "grad_norm": 0.6412538874066757,
      "learning_rate": 4.587999305347121e-05,
      "loss": 1.6855,
      "num_input_tokens_seen": 16559848784,
      "step": 21048
    },
    {
      "epoch": 2.233078718438362,
      "grad_norm": 0.6369512752398321,
      "learning_rate": 4.587961084956171e-05,
      "loss": 1.6302,
      "num_input_tokens_seen": 16560635568,
      "step": 21049
    },
    {
      "epoch": 2.2331848079779335,
      "grad_norm": 0.44532944728232354,
      "learning_rate": 4.5879228629517044e-05,
      "loss": 1.6535,
      "num_input_tokens_seen": 16561422288,
      "step": 21050
    },
    {
      "epoch": 2.233290897517505,
      "grad_norm": 0.5851541489421022,
      "learning_rate": 4.587884639333753e-05,
      "loss": 1.4912,
      "num_input_tokens_seen": 16562209072,
      "step": 21051
    },
    {
      "epoch": 2.233396987057076,
      "grad_norm": 0.52095253747996,
      "learning_rate": 4.587846414102345e-05,
      "loss": 1.5641,
      "num_input_tokens_seen": 16562995744,
      "step": 21052
    },
    {
      "epoch": 2.2335030765966475,
      "grad_norm": 0.36533574013339093,
      "learning_rate": 4.587808187257511e-05,
      "loss": 1.4898,
      "num_input_tokens_seen": 16563782576,
      "step": 21053
    },
    {
      "epoch": 2.233609166136219,
      "grad_norm": 0.5069236939733506,
      "learning_rate": 4.5877699587992796e-05,
      "loss": 1.5912,
      "num_input_tokens_seen": 16564569344,
      "step": 21054
    },
    {
      "epoch": 2.2337152556757904,
      "grad_norm": 0.48758854627880044,
      "learning_rate": 4.587731728727681e-05,
      "loss": 1.5605,
      "num_input_tokens_seen": 16565356160,
      "step": 21055
    },
    {
      "epoch": 2.233821345215362,
      "grad_norm": 0.44883945168084277,
      "learning_rate": 4.5876934970427454e-05,
      "loss": 1.6531,
      "num_input_tokens_seen": 16566142928,
      "step": 21056
    },
    {
      "epoch": 2.233927434754933,
      "grad_norm": 0.42235776271135106,
      "learning_rate": 4.587655263744501e-05,
      "loss": 1.749,
      "num_input_tokens_seen": 16566929664,
      "step": 21057
    },
    {
      "epoch": 2.2340335242945044,
      "grad_norm": 0.5160172272993722,
      "learning_rate": 4.5876170288329776e-05,
      "loss": 1.6215,
      "num_input_tokens_seen": 16567716368,
      "step": 21058
    },
    {
      "epoch": 2.234139613834076,
      "grad_norm": 0.43436698213924413,
      "learning_rate": 4.587578792308205e-05,
      "loss": 1.6199,
      "num_input_tokens_seen": 16568503216,
      "step": 21059
    },
    {
      "epoch": 2.2342457033736474,
      "grad_norm": 0.4511201349521528,
      "learning_rate": 4.587540554170213e-05,
      "loss": 1.7006,
      "num_input_tokens_seen": 16569289952,
      "step": 21060
    },
    {
      "epoch": 2.234351792913219,
      "grad_norm": 0.46554149871281386,
      "learning_rate": 4.587502314419031e-05,
      "loss": 1.6561,
      "num_input_tokens_seen": 16570076624,
      "step": 21061
    },
    {
      "epoch": 2.2344578824527903,
      "grad_norm": 0.4319448093858398,
      "learning_rate": 4.587464073054688e-05,
      "loss": 1.5796,
      "num_input_tokens_seen": 16570863488,
      "step": 21062
    },
    {
      "epoch": 2.234563971992362,
      "grad_norm": 0.40132593660513616,
      "learning_rate": 4.5874258300772144e-05,
      "loss": 1.5778,
      "num_input_tokens_seen": 16571650320,
      "step": 21063
    },
    {
      "epoch": 2.234670061531933,
      "grad_norm": 0.4561998302803318,
      "learning_rate": 4.58738758548664e-05,
      "loss": 1.7134,
      "num_input_tokens_seen": 16572437088,
      "step": 21064
    },
    {
      "epoch": 2.2347761510715043,
      "grad_norm": 0.4621110306616201,
      "learning_rate": 4.587349339282993e-05,
      "loss": 1.6341,
      "num_input_tokens_seen": 16573223888,
      "step": 21065
    },
    {
      "epoch": 2.2348822406110758,
      "grad_norm": 0.4016480846178735,
      "learning_rate": 4.587311091466303e-05,
      "loss": 1.6502,
      "num_input_tokens_seen": 16574010720,
      "step": 21066
    },
    {
      "epoch": 2.2349883301506472,
      "grad_norm": 0.38941637476417446,
      "learning_rate": 4.5872728420366015e-05,
      "loss": 1.6538,
      "num_input_tokens_seen": 16574797536,
      "step": 21067
    },
    {
      "epoch": 2.2350944196902187,
      "grad_norm": 0.41229904303526715,
      "learning_rate": 4.5872345909939165e-05,
      "loss": 1.6101,
      "num_input_tokens_seen": 16575584352,
      "step": 21068
    },
    {
      "epoch": 2.2352005092297897,
      "grad_norm": 0.3814414955883757,
      "learning_rate": 4.587196338338277e-05,
      "loss": 1.5469,
      "num_input_tokens_seen": 16576371088,
      "step": 21069
    },
    {
      "epoch": 2.235306598769361,
      "grad_norm": 0.35300606539403695,
      "learning_rate": 4.5871580840697136e-05,
      "loss": 1.6319,
      "num_input_tokens_seen": 16577157808,
      "step": 21070
    },
    {
      "epoch": 2.2354126883089327,
      "grad_norm": 0.5526686088692385,
      "learning_rate": 4.5871198281882567e-05,
      "loss": 1.7441,
      "num_input_tokens_seen": 16577944544,
      "step": 21071
    },
    {
      "epoch": 2.235518777848504,
      "grad_norm": 0.43039285647625586,
      "learning_rate": 4.587081570693934e-05,
      "loss": 1.7987,
      "num_input_tokens_seen": 16578731296,
      "step": 21072
    },
    {
      "epoch": 2.2356248673880756,
      "grad_norm": 0.5662055104272292,
      "learning_rate": 4.587043311586776e-05,
      "loss": 1.5393,
      "num_input_tokens_seen": 16579518032,
      "step": 21073
    },
    {
      "epoch": 2.235730956927647,
      "grad_norm": 0.47078381382987833,
      "learning_rate": 4.587005050866813e-05,
      "loss": 1.6812,
      "num_input_tokens_seen": 16580304656,
      "step": 21074
    },
    {
      "epoch": 2.235837046467218,
      "grad_norm": 0.3964094257923892,
      "learning_rate": 4.5869667885340726e-05,
      "loss": 1.6128,
      "num_input_tokens_seen": 16581091424,
      "step": 21075
    },
    {
      "epoch": 2.2359431360067896,
      "grad_norm": 0.5805303843007777,
      "learning_rate": 4.5869285245885855e-05,
      "loss": 1.6726,
      "num_input_tokens_seen": 16581878224,
      "step": 21076
    },
    {
      "epoch": 2.236049225546361,
      "grad_norm": 0.346121981801711,
      "learning_rate": 4.5868902590303816e-05,
      "loss": 1.6671,
      "num_input_tokens_seen": 16582664912,
      "step": 21077
    },
    {
      "epoch": 2.2361553150859326,
      "grad_norm": 0.46981304915632144,
      "learning_rate": 4.586851991859491e-05,
      "loss": 1.6661,
      "num_input_tokens_seen": 16583451696,
      "step": 21078
    },
    {
      "epoch": 2.236261404625504,
      "grad_norm": 0.547478838213909,
      "learning_rate": 4.586813723075941e-05,
      "loss": 1.7457,
      "num_input_tokens_seen": 16584238384,
      "step": 21079
    },
    {
      "epoch": 2.2363674941650755,
      "grad_norm": 0.37081490414216056,
      "learning_rate": 4.5867754526797636e-05,
      "loss": 1.6293,
      "num_input_tokens_seen": 16585025248,
      "step": 21080
    },
    {
      "epoch": 2.2364735837046466,
      "grad_norm": 0.6614495149680495,
      "learning_rate": 4.586737180670987e-05,
      "loss": 1.6944,
      "num_input_tokens_seen": 16585811984,
      "step": 21081
    },
    {
      "epoch": 2.236579673244218,
      "grad_norm": 0.46243622015586955,
      "learning_rate": 4.5866989070496414e-05,
      "loss": 1.7105,
      "num_input_tokens_seen": 16586598752,
      "step": 21082
    },
    {
      "epoch": 2.2366857627837895,
      "grad_norm": 0.5708785861885379,
      "learning_rate": 4.586660631815756e-05,
      "loss": 1.6372,
      "num_input_tokens_seen": 16587385472,
      "step": 21083
    },
    {
      "epoch": 2.236791852323361,
      "grad_norm": 0.7823575046018744,
      "learning_rate": 4.58662235496936e-05,
      "loss": 1.6593,
      "num_input_tokens_seen": 16588172144,
      "step": 21084
    },
    {
      "epoch": 2.2368979418629324,
      "grad_norm": 0.3878678013751602,
      "learning_rate": 4.586584076510484e-05,
      "loss": 1.6318,
      "num_input_tokens_seen": 16588958976,
      "step": 21085
    },
    {
      "epoch": 2.2370040314025035,
      "grad_norm": 0.6641387626247612,
      "learning_rate": 4.586545796439157e-05,
      "loss": 1.6622,
      "num_input_tokens_seen": 16589745840,
      "step": 21086
    },
    {
      "epoch": 2.237110120942075,
      "grad_norm": 0.5893819920672042,
      "learning_rate": 4.586507514755408e-05,
      "loss": 1.5695,
      "num_input_tokens_seen": 16590532624,
      "step": 21087
    },
    {
      "epoch": 2.2372162104816464,
      "grad_norm": 0.39738170381463056,
      "learning_rate": 4.586469231459267e-05,
      "loss": 1.4917,
      "num_input_tokens_seen": 16591319328,
      "step": 21088
    },
    {
      "epoch": 2.237322300021218,
      "grad_norm": 0.8807560534344404,
      "learning_rate": 4.586430946550765e-05,
      "loss": 1.71,
      "num_input_tokens_seen": 16592106080,
      "step": 21089
    },
    {
      "epoch": 2.2374283895607894,
      "grad_norm": 0.40242975125928565,
      "learning_rate": 4.58639266002993e-05,
      "loss": 1.6473,
      "num_input_tokens_seen": 16592892736,
      "step": 21090
    },
    {
      "epoch": 2.237534479100361,
      "grad_norm": 0.575750276984934,
      "learning_rate": 4.586354371896792e-05,
      "loss": 1.6094,
      "num_input_tokens_seen": 16593679488,
      "step": 21091
    },
    {
      "epoch": 2.2376405686399323,
      "grad_norm": 0.6457120860025756,
      "learning_rate": 4.58631608215138e-05,
      "loss": 1.6513,
      "num_input_tokens_seen": 16594466272,
      "step": 21092
    },
    {
      "epoch": 2.2377466581795034,
      "grad_norm": 0.3805721347526215,
      "learning_rate": 4.5862777907937247e-05,
      "loss": 1.5449,
      "num_input_tokens_seen": 16595253088,
      "step": 21093
    },
    {
      "epoch": 2.237852747719075,
      "grad_norm": 0.45857040253085457,
      "learning_rate": 4.586239497823855e-05,
      "loss": 1.5899,
      "num_input_tokens_seen": 16596039856,
      "step": 21094
    },
    {
      "epoch": 2.2379588372586463,
      "grad_norm": 0.50873282555159,
      "learning_rate": 4.5862012032418006e-05,
      "loss": 1.5186,
      "num_input_tokens_seen": 16596826672,
      "step": 21095
    },
    {
      "epoch": 2.238064926798218,
      "grad_norm": 0.3492540165018127,
      "learning_rate": 4.586162907047591e-05,
      "loss": 1.556,
      "num_input_tokens_seen": 16597613440,
      "step": 21096
    },
    {
      "epoch": 2.2381710163377893,
      "grad_norm": 0.452667164506059,
      "learning_rate": 4.586124609241256e-05,
      "loss": 1.6471,
      "num_input_tokens_seen": 16598400240,
      "step": 21097
    },
    {
      "epoch": 2.2382771058773603,
      "grad_norm": 0.5007059210662809,
      "learning_rate": 4.5860863098228255e-05,
      "loss": 1.6268,
      "num_input_tokens_seen": 16599187008,
      "step": 21098
    },
    {
      "epoch": 2.2383831954169318,
      "grad_norm": 0.4833802210460188,
      "learning_rate": 4.5860480087923285e-05,
      "loss": 1.7022,
      "num_input_tokens_seen": 16599973776,
      "step": 21099
    },
    {
      "epoch": 2.2384892849565032,
      "grad_norm": 0.4543269657591581,
      "learning_rate": 4.586009706149794e-05,
      "loss": 1.5899,
      "num_input_tokens_seen": 16600760480,
      "step": 21100
    },
    {
      "epoch": 2.2385953744960747,
      "grad_norm": 0.6603285909102807,
      "learning_rate": 4.585971401895254e-05,
      "loss": 1.6516,
      "num_input_tokens_seen": 16601547184,
      "step": 21101
    },
    {
      "epoch": 2.238701464035646,
      "grad_norm": 0.3747998039781533,
      "learning_rate": 4.585933096028735e-05,
      "loss": 1.5259,
      "num_input_tokens_seen": 16602333936,
      "step": 21102
    },
    {
      "epoch": 2.2388075535752177,
      "grad_norm": 0.5082654396422267,
      "learning_rate": 4.585894788550269e-05,
      "loss": 1.7182,
      "num_input_tokens_seen": 16603120720,
      "step": 21103
    },
    {
      "epoch": 2.2389136431147887,
      "grad_norm": 0.44247892874110817,
      "learning_rate": 4.5858564794598846e-05,
      "loss": 1.6553,
      "num_input_tokens_seen": 16603907456,
      "step": 21104
    },
    {
      "epoch": 2.23901973265436,
      "grad_norm": 0.38724956087089685,
      "learning_rate": 4.585818168757611e-05,
      "loss": 1.5813,
      "num_input_tokens_seen": 16604694096,
      "step": 21105
    },
    {
      "epoch": 2.2391258221939316,
      "grad_norm": 0.4254619491962887,
      "learning_rate": 4.5857798564434785e-05,
      "loss": 1.5557,
      "num_input_tokens_seen": 16605480944,
      "step": 21106
    },
    {
      "epoch": 2.239231911733503,
      "grad_norm": 0.4543218805513294,
      "learning_rate": 4.585741542517517e-05,
      "loss": 1.7426,
      "num_input_tokens_seen": 16606267696,
      "step": 21107
    },
    {
      "epoch": 2.2393380012730746,
      "grad_norm": 0.431857384744866,
      "learning_rate": 4.585703226979755e-05,
      "loss": 1.8113,
      "num_input_tokens_seen": 16607054368,
      "step": 21108
    },
    {
      "epoch": 2.239444090812646,
      "grad_norm": 0.5201383468134958,
      "learning_rate": 4.585664909830223e-05,
      "loss": 1.712,
      "num_input_tokens_seen": 16607841168,
      "step": 21109
    },
    {
      "epoch": 2.239550180352217,
      "grad_norm": 0.4033454599131164,
      "learning_rate": 4.5856265910689514e-05,
      "loss": 1.7238,
      "num_input_tokens_seen": 16608627936,
      "step": 21110
    },
    {
      "epoch": 2.2396562698917886,
      "grad_norm": 0.3729101175425252,
      "learning_rate": 4.585588270695967e-05,
      "loss": 1.6659,
      "num_input_tokens_seen": 16609414592,
      "step": 21111
    },
    {
      "epoch": 2.23976235943136,
      "grad_norm": 0.36393799420325,
      "learning_rate": 4.585549948711302e-05,
      "loss": 1.5324,
      "num_input_tokens_seen": 16610201344,
      "step": 21112
    },
    {
      "epoch": 2.2398684489709315,
      "grad_norm": 0.4096456937912271,
      "learning_rate": 4.5855116251149854e-05,
      "loss": 1.7807,
      "num_input_tokens_seen": 16610987984,
      "step": 21113
    },
    {
      "epoch": 2.239974538510503,
      "grad_norm": 0.3611650113669743,
      "learning_rate": 4.585473299907046e-05,
      "loss": 1.5784,
      "num_input_tokens_seen": 16611774800,
      "step": 21114
    },
    {
      "epoch": 2.2400806280500745,
      "grad_norm": 0.408500145325123,
      "learning_rate": 4.5854349730875145e-05,
      "loss": 1.6064,
      "num_input_tokens_seen": 16612561520,
      "step": 21115
    },
    {
      "epoch": 2.2401867175896455,
      "grad_norm": 0.3980255557480897,
      "learning_rate": 4.58539664465642e-05,
      "loss": 1.5689,
      "num_input_tokens_seen": 16613348304,
      "step": 21116
    },
    {
      "epoch": 2.240292807129217,
      "grad_norm": 0.44109518150818405,
      "learning_rate": 4.585358314613792e-05,
      "loss": 1.7157,
      "num_input_tokens_seen": 16614135104,
      "step": 21117
    },
    {
      "epoch": 2.2403988966687884,
      "grad_norm": 0.39284609321471076,
      "learning_rate": 4.5853199829596605e-05,
      "loss": 1.7149,
      "num_input_tokens_seen": 16614921872,
      "step": 21118
    },
    {
      "epoch": 2.24050498620836,
      "grad_norm": 0.3366239359869635,
      "learning_rate": 4.585281649694054e-05,
      "loss": 1.6399,
      "num_input_tokens_seen": 16615708624,
      "step": 21119
    },
    {
      "epoch": 2.2406110757479314,
      "grad_norm": 0.38125350730461816,
      "learning_rate": 4.585243314817005e-05,
      "loss": 1.677,
      "num_input_tokens_seen": 16616495488,
      "step": 21120
    },
    {
      "epoch": 2.240717165287503,
      "grad_norm": 0.3983198949466036,
      "learning_rate": 4.585204978328539e-05,
      "loss": 1.7959,
      "num_input_tokens_seen": 16617282256,
      "step": 21121
    },
    {
      "epoch": 2.240823254827074,
      "grad_norm": 0.3650934404852417,
      "learning_rate": 4.5851666402286894e-05,
      "loss": 1.5891,
      "num_input_tokens_seen": 16618069024,
      "step": 21122
    },
    {
      "epoch": 2.2409293443666454,
      "grad_norm": 0.37549565139291047,
      "learning_rate": 4.5851283005174835e-05,
      "loss": 1.6207,
      "num_input_tokens_seen": 16618855664,
      "step": 21123
    },
    {
      "epoch": 2.241035433906217,
      "grad_norm": 0.39158535752462004,
      "learning_rate": 4.585089959194951e-05,
      "loss": 1.5686,
      "num_input_tokens_seen": 16619642432,
      "step": 21124
    },
    {
      "epoch": 2.2411415234457883,
      "grad_norm": 0.3929486573798128,
      "learning_rate": 4.585051616261123e-05,
      "loss": 1.6545,
      "num_input_tokens_seen": 16620429168,
      "step": 21125
    },
    {
      "epoch": 2.24124761298536,
      "grad_norm": 0.3896055436469921,
      "learning_rate": 4.585013271716029e-05,
      "loss": 1.7678,
      "num_input_tokens_seen": 16621215888,
      "step": 21126
    },
    {
      "epoch": 2.241353702524931,
      "grad_norm": 0.4173163016841465,
      "learning_rate": 4.5849749255596966e-05,
      "loss": 1.6667,
      "num_input_tokens_seen": 16622002560,
      "step": 21127
    },
    {
      "epoch": 2.2414597920645023,
      "grad_norm": 0.38861557448871603,
      "learning_rate": 4.584936577792157e-05,
      "loss": 1.7399,
      "num_input_tokens_seen": 16622789296,
      "step": 21128
    },
    {
      "epoch": 2.2415658816040738,
      "grad_norm": 0.42545864716428433,
      "learning_rate": 4.58489822841344e-05,
      "loss": 1.6959,
      "num_input_tokens_seen": 16623576112,
      "step": 21129
    },
    {
      "epoch": 2.2416719711436452,
      "grad_norm": 0.4501889797390313,
      "learning_rate": 4.5848598774235745e-05,
      "loss": 1.7745,
      "num_input_tokens_seen": 16624362848,
      "step": 21130
    },
    {
      "epoch": 2.2417780606832167,
      "grad_norm": 0.4336491499459773,
      "learning_rate": 4.5848215248225906e-05,
      "loss": 1.5606,
      "num_input_tokens_seen": 16625149552,
      "step": 21131
    },
    {
      "epoch": 2.241884150222788,
      "grad_norm": 0.4374102006310567,
      "learning_rate": 4.5847831706105174e-05,
      "loss": 1.5281,
      "num_input_tokens_seen": 16625936336,
      "step": 21132
    },
    {
      "epoch": 2.2419902397623592,
      "grad_norm": 0.3765083608681158,
      "learning_rate": 4.5847448147873855e-05,
      "loss": 1.6176,
      "num_input_tokens_seen": 16626723056,
      "step": 21133
    },
    {
      "epoch": 2.2420963293019307,
      "grad_norm": 0.38787008846867943,
      "learning_rate": 4.584706457353224e-05,
      "loss": 1.6563,
      "num_input_tokens_seen": 16627509872,
      "step": 21134
    },
    {
      "epoch": 2.242202418841502,
      "grad_norm": 0.45152857444703487,
      "learning_rate": 4.584668098308062e-05,
      "loss": 1.6528,
      "num_input_tokens_seen": 16628296576,
      "step": 21135
    },
    {
      "epoch": 2.2423085083810737,
      "grad_norm": 0.3537858558632455,
      "learning_rate": 4.58462973765193e-05,
      "loss": 1.5888,
      "num_input_tokens_seen": 16629083280,
      "step": 21136
    },
    {
      "epoch": 2.242414597920645,
      "grad_norm": 0.38925736866363525,
      "learning_rate": 4.584591375384857e-05,
      "loss": 1.6444,
      "num_input_tokens_seen": 16629870096,
      "step": 21137
    },
    {
      "epoch": 2.2425206874602166,
      "grad_norm": 0.40694446073360685,
      "learning_rate": 4.584553011506874e-05,
      "loss": 1.5477,
      "num_input_tokens_seen": 16630656848,
      "step": 21138
    },
    {
      "epoch": 2.2426267769997876,
      "grad_norm": 0.36015463401452397,
      "learning_rate": 4.584514646018009e-05,
      "loss": 1.6035,
      "num_input_tokens_seen": 16631443616,
      "step": 21139
    },
    {
      "epoch": 2.242732866539359,
      "grad_norm": 0.3697329599450986,
      "learning_rate": 4.5844762789182916e-05,
      "loss": 1.5261,
      "num_input_tokens_seen": 16632230368,
      "step": 21140
    },
    {
      "epoch": 2.2428389560789306,
      "grad_norm": 0.5734271252143847,
      "learning_rate": 4.5844379102077526e-05,
      "loss": 1.5181,
      "num_input_tokens_seen": 16633017184,
      "step": 21141
    },
    {
      "epoch": 2.242945045618502,
      "grad_norm": 0.3866291658812501,
      "learning_rate": 4.5843995398864206e-05,
      "loss": 1.6138,
      "num_input_tokens_seen": 16633803936,
      "step": 21142
    },
    {
      "epoch": 2.2430511351580735,
      "grad_norm": 0.4585168343010432,
      "learning_rate": 4.584361167954326e-05,
      "loss": 1.5512,
      "num_input_tokens_seen": 16634590656,
      "step": 21143
    },
    {
      "epoch": 2.243157224697645,
      "grad_norm": 0.3977731426979946,
      "learning_rate": 4.5843227944114994e-05,
      "loss": 1.5337,
      "num_input_tokens_seen": 16635377376,
      "step": 21144
    },
    {
      "epoch": 2.243263314237216,
      "grad_norm": 0.42646423998428895,
      "learning_rate": 4.5842844192579684e-05,
      "loss": 1.6508,
      "num_input_tokens_seen": 16636164208,
      "step": 21145
    },
    {
      "epoch": 2.2433694037767875,
      "grad_norm": 0.46641093305249837,
      "learning_rate": 4.5842460424937637e-05,
      "loss": 1.6869,
      "num_input_tokens_seen": 16636950960,
      "step": 21146
    },
    {
      "epoch": 2.243475493316359,
      "grad_norm": 0.4273354850442258,
      "learning_rate": 4.584207664118915e-05,
      "loss": 1.7145,
      "num_input_tokens_seen": 16637737776,
      "step": 21147
    },
    {
      "epoch": 2.2435815828559305,
      "grad_norm": 0.46632325553020704,
      "learning_rate": 4.584169284133451e-05,
      "loss": 1.4929,
      "num_input_tokens_seen": 16638524592,
      "step": 21148
    },
    {
      "epoch": 2.243687672395502,
      "grad_norm": 0.3895777778420522,
      "learning_rate": 4.5841309025374026e-05,
      "loss": 1.5089,
      "num_input_tokens_seen": 16639311440,
      "step": 21149
    },
    {
      "epoch": 2.2437937619350734,
      "grad_norm": 0.3642792813965822,
      "learning_rate": 4.5840925193307994e-05,
      "loss": 1.5813,
      "num_input_tokens_seen": 16640098224,
      "step": 21150
    },
    {
      "epoch": 2.2438998514746444,
      "grad_norm": 0.42504997226602675,
      "learning_rate": 4.58405413451367e-05,
      "loss": 1.5853,
      "num_input_tokens_seen": 16640884928,
      "step": 21151
    },
    {
      "epoch": 2.244005941014216,
      "grad_norm": 0.40548541338897953,
      "learning_rate": 4.5840157480860446e-05,
      "loss": 1.6751,
      "num_input_tokens_seen": 16641671600,
      "step": 21152
    },
    {
      "epoch": 2.2441120305537874,
      "grad_norm": 0.35610365454953247,
      "learning_rate": 4.583977360047953e-05,
      "loss": 1.6623,
      "num_input_tokens_seen": 16642458368,
      "step": 21153
    },
    {
      "epoch": 2.244218120093359,
      "grad_norm": 0.4167068920385968,
      "learning_rate": 4.583938970399426e-05,
      "loss": 1.5915,
      "num_input_tokens_seen": 16643245056,
      "step": 21154
    },
    {
      "epoch": 2.2443242096329303,
      "grad_norm": 0.39104331944200527,
      "learning_rate": 4.583900579140491e-05,
      "loss": 1.5814,
      "num_input_tokens_seen": 16644031808,
      "step": 21155
    },
    {
      "epoch": 2.2444302991725014,
      "grad_norm": 0.3467919953890522,
      "learning_rate": 4.5838621862711794e-05,
      "loss": 1.6422,
      "num_input_tokens_seen": 16644818656,
      "step": 21156
    },
    {
      "epoch": 2.244536388712073,
      "grad_norm": 0.38758812920228736,
      "learning_rate": 4.58382379179152e-05,
      "loss": 1.6377,
      "num_input_tokens_seen": 16645605392,
      "step": 21157
    },
    {
      "epoch": 2.2446424782516443,
      "grad_norm": 0.3643876800617238,
      "learning_rate": 4.583785395701542e-05,
      "loss": 1.6154,
      "num_input_tokens_seen": 16646392192,
      "step": 21158
    },
    {
      "epoch": 2.244748567791216,
      "grad_norm": 0.36562626557116357,
      "learning_rate": 4.583746998001277e-05,
      "loss": 1.5651,
      "num_input_tokens_seen": 16647178992,
      "step": 21159
    },
    {
      "epoch": 2.2448546573307873,
      "grad_norm": 0.3541442186240115,
      "learning_rate": 4.5837085986907524e-05,
      "loss": 1.5953,
      "num_input_tokens_seen": 16647965808,
      "step": 21160
    },
    {
      "epoch": 2.2449607468703587,
      "grad_norm": 0.39277961512682275,
      "learning_rate": 4.5836701977699994e-05,
      "loss": 1.5416,
      "num_input_tokens_seen": 16648752544,
      "step": 21161
    },
    {
      "epoch": 2.24506683640993,
      "grad_norm": 0.3849965499442904,
      "learning_rate": 4.583631795239047e-05,
      "loss": 1.5674,
      "num_input_tokens_seen": 16649539312,
      "step": 21162
    },
    {
      "epoch": 2.2451729259495012,
      "grad_norm": 0.39116683812951886,
      "learning_rate": 4.5835933910979255e-05,
      "loss": 1.5997,
      "num_input_tokens_seen": 16650326080,
      "step": 21163
    },
    {
      "epoch": 2.2452790154890727,
      "grad_norm": 0.4197592622666663,
      "learning_rate": 4.583554985346664e-05,
      "loss": 1.5876,
      "num_input_tokens_seen": 16651112880,
      "step": 21164
    },
    {
      "epoch": 2.245385105028644,
      "grad_norm": 0.39915190264971523,
      "learning_rate": 4.583516577985293e-05,
      "loss": 1.6154,
      "num_input_tokens_seen": 16651899600,
      "step": 21165
    },
    {
      "epoch": 2.2454911945682157,
      "grad_norm": 0.423449118873106,
      "learning_rate": 4.583478169013841e-05,
      "loss": 1.636,
      "num_input_tokens_seen": 16652686352,
      "step": 21166
    },
    {
      "epoch": 2.245597284107787,
      "grad_norm": 0.3747290446104027,
      "learning_rate": 4.5834397584323376e-05,
      "loss": 1.6837,
      "num_input_tokens_seen": 16653473056,
      "step": 21167
    },
    {
      "epoch": 2.245703373647358,
      "grad_norm": 0.4124344280016595,
      "learning_rate": 4.583401346240813e-05,
      "loss": 1.6378,
      "num_input_tokens_seen": 16654259792,
      "step": 21168
    },
    {
      "epoch": 2.2458094631869296,
      "grad_norm": 0.37144734807422586,
      "learning_rate": 4.583362932439298e-05,
      "loss": 1.6308,
      "num_input_tokens_seen": 16655046576,
      "step": 21169
    },
    {
      "epoch": 2.245915552726501,
      "grad_norm": 0.43216547584366966,
      "learning_rate": 4.58332451702782e-05,
      "loss": 1.6263,
      "num_input_tokens_seen": 16655833232,
      "step": 21170
    },
    {
      "epoch": 2.2460216422660726,
      "grad_norm": 0.32676086633175677,
      "learning_rate": 4.5832861000064117e-05,
      "loss": 1.6495,
      "num_input_tokens_seen": 16656619952,
      "step": 21171
    },
    {
      "epoch": 2.246127731805644,
      "grad_norm": 0.36569993757173724,
      "learning_rate": 4.5832476813750996e-05,
      "loss": 1.5755,
      "num_input_tokens_seen": 16657406752,
      "step": 21172
    },
    {
      "epoch": 2.2462338213452155,
      "grad_norm": 0.3450615100682995,
      "learning_rate": 4.5832092611339154e-05,
      "loss": 1.6331,
      "num_input_tokens_seen": 16658193440,
      "step": 21173
    },
    {
      "epoch": 2.2463399108847866,
      "grad_norm": 0.36713782771383163,
      "learning_rate": 4.583170839282888e-05,
      "loss": 1.6411,
      "num_input_tokens_seen": 16658980224,
      "step": 21174
    },
    {
      "epoch": 2.246446000424358,
      "grad_norm": 0.37742728217241245,
      "learning_rate": 4.583132415822048e-05,
      "loss": 1.564,
      "num_input_tokens_seen": 16659766880,
      "step": 21175
    },
    {
      "epoch": 2.2465520899639295,
      "grad_norm": 0.3502200409812097,
      "learning_rate": 4.583093990751424e-05,
      "loss": 1.5629,
      "num_input_tokens_seen": 16660553696,
      "step": 21176
    },
    {
      "epoch": 2.246658179503501,
      "grad_norm": 0.4247450277486081,
      "learning_rate": 4.583055564071045e-05,
      "loss": 1.6264,
      "num_input_tokens_seen": 16661340384,
      "step": 21177
    },
    {
      "epoch": 2.2467642690430725,
      "grad_norm": 0.37002035967392605,
      "learning_rate": 4.5830171357809425e-05,
      "loss": 1.6143,
      "num_input_tokens_seen": 16662127104,
      "step": 21178
    },
    {
      "epoch": 2.246870358582644,
      "grad_norm": 0.3478638489293977,
      "learning_rate": 4.582978705881146e-05,
      "loss": 1.5601,
      "num_input_tokens_seen": 16662913936,
      "step": 21179
    },
    {
      "epoch": 2.246976448122215,
      "grad_norm": 0.35094786011162415,
      "learning_rate": 4.582940274371684e-05,
      "loss": 1.6549,
      "num_input_tokens_seen": 16663700720,
      "step": 21180
    },
    {
      "epoch": 2.2470825376617864,
      "grad_norm": 0.35920437952319817,
      "learning_rate": 4.582901841252587e-05,
      "loss": 1.5774,
      "num_input_tokens_seen": 16664487440,
      "step": 21181
    },
    {
      "epoch": 2.247188627201358,
      "grad_norm": 0.3204812727915782,
      "learning_rate": 4.5828634065238854e-05,
      "loss": 1.5407,
      "num_input_tokens_seen": 16665274208,
      "step": 21182
    },
    {
      "epoch": 2.2472947167409294,
      "grad_norm": 0.4340582738511751,
      "learning_rate": 4.582824970185607e-05,
      "loss": 1.7416,
      "num_input_tokens_seen": 16666060976,
      "step": 21183
    },
    {
      "epoch": 2.247400806280501,
      "grad_norm": 0.3701574942303796,
      "learning_rate": 4.5827865322377826e-05,
      "loss": 1.551,
      "num_input_tokens_seen": 16666847712,
      "step": 21184
    },
    {
      "epoch": 2.2475068958200723,
      "grad_norm": 0.4055901768812356,
      "learning_rate": 4.582748092680442e-05,
      "loss": 1.6049,
      "num_input_tokens_seen": 16667634448,
      "step": 21185
    },
    {
      "epoch": 2.2476129853596434,
      "grad_norm": 0.3881732286501472,
      "learning_rate": 4.582709651513616e-05,
      "loss": 1.5741,
      "num_input_tokens_seen": 16668421264,
      "step": 21186
    },
    {
      "epoch": 2.247719074899215,
      "grad_norm": 0.36440380173484965,
      "learning_rate": 4.582671208737331e-05,
      "loss": 1.7045,
      "num_input_tokens_seen": 16669207968,
      "step": 21187
    },
    {
      "epoch": 2.2478251644387863,
      "grad_norm": 0.5269338414709763,
      "learning_rate": 4.582632764351621e-05,
      "loss": 1.6842,
      "num_input_tokens_seen": 16669994704,
      "step": 21188
    },
    {
      "epoch": 2.247931253978358,
      "grad_norm": 0.45375796661638695,
      "learning_rate": 4.582594318356512e-05,
      "loss": 1.5446,
      "num_input_tokens_seen": 16670781552,
      "step": 21189
    },
    {
      "epoch": 2.2480373435179293,
      "grad_norm": 0.3507086121820023,
      "learning_rate": 4.5825558707520355e-05,
      "loss": 1.5848,
      "num_input_tokens_seen": 16671568416,
      "step": 21190
    },
    {
      "epoch": 2.2481434330575008,
      "grad_norm": 0.3732700276134255,
      "learning_rate": 4.5825174215382215e-05,
      "loss": 1.5775,
      "num_input_tokens_seen": 16672355200,
      "step": 21191
    },
    {
      "epoch": 2.248249522597072,
      "grad_norm": 0.45509481774385346,
      "learning_rate": 4.5824789707150984e-05,
      "loss": 1.6571,
      "num_input_tokens_seen": 16673141872,
      "step": 21192
    },
    {
      "epoch": 2.2483556121366433,
      "grad_norm": 0.2950239557350642,
      "learning_rate": 4.582440518282697e-05,
      "loss": 1.3899,
      "num_input_tokens_seen": 16673928736,
      "step": 21193
    },
    {
      "epoch": 2.2484617016762147,
      "grad_norm": 0.4041385851139391,
      "learning_rate": 4.582402064241047e-05,
      "loss": 1.7717,
      "num_input_tokens_seen": 16674715488,
      "step": 21194
    },
    {
      "epoch": 2.248567791215786,
      "grad_norm": 0.3843161052804324,
      "learning_rate": 4.582363608590177e-05,
      "loss": 1.6505,
      "num_input_tokens_seen": 16675502176,
      "step": 21195
    },
    {
      "epoch": 2.2486738807553577,
      "grad_norm": 0.3890583805920416,
      "learning_rate": 4.582325151330118e-05,
      "loss": 1.5436,
      "num_input_tokens_seen": 16676288848,
      "step": 21196
    },
    {
      "epoch": 2.2487799702949287,
      "grad_norm": 0.427250738811548,
      "learning_rate": 4.582286692460899e-05,
      "loss": 1.5152,
      "num_input_tokens_seen": 16677075664,
      "step": 21197
    },
    {
      "epoch": 2.2488860598345,
      "grad_norm": 0.35626397517875796,
      "learning_rate": 4.582248231982551e-05,
      "loss": 1.6031,
      "num_input_tokens_seen": 16677862432,
      "step": 21198
    },
    {
      "epoch": 2.2489921493740717,
      "grad_norm": 0.4062604332068727,
      "learning_rate": 4.582209769895102e-05,
      "loss": 1.5756,
      "num_input_tokens_seen": 16678649152,
      "step": 21199
    },
    {
      "epoch": 2.249098238913643,
      "grad_norm": 0.5664834175827732,
      "learning_rate": 4.5821713061985814e-05,
      "loss": 1.6325,
      "num_input_tokens_seen": 16679435856,
      "step": 21200
    },
    {
      "epoch": 2.2492043284532146,
      "grad_norm": 0.38882473828565617,
      "learning_rate": 4.582132840893021e-05,
      "loss": 1.5139,
      "num_input_tokens_seen": 16680222640,
      "step": 21201
    },
    {
      "epoch": 2.249310417992786,
      "grad_norm": 0.3664654106857523,
      "learning_rate": 4.5820943739784486e-05,
      "loss": 1.5491,
      "num_input_tokens_seen": 16681009472,
      "step": 21202
    },
    {
      "epoch": 2.249416507532357,
      "grad_norm": 0.3574817769361431,
      "learning_rate": 4.5820559054548957e-05,
      "loss": 1.5659,
      "num_input_tokens_seen": 16681796304,
      "step": 21203
    },
    {
      "epoch": 2.2495225970719286,
      "grad_norm": 0.49200119223728456,
      "learning_rate": 4.582017435322391e-05,
      "loss": 1.6977,
      "num_input_tokens_seen": 16682583152,
      "step": 21204
    },
    {
      "epoch": 2.2496286866115,
      "grad_norm": 0.49453963326174,
      "learning_rate": 4.581978963580963e-05,
      "loss": 1.4982,
      "num_input_tokens_seen": 16683369920,
      "step": 21205
    },
    {
      "epoch": 2.2497347761510715,
      "grad_norm": 0.47658403391167753,
      "learning_rate": 4.581940490230644e-05,
      "loss": 1.7145,
      "num_input_tokens_seen": 16684156608,
      "step": 21206
    },
    {
      "epoch": 2.249840865690643,
      "grad_norm": 0.35105116019128635,
      "learning_rate": 4.581902015271462e-05,
      "loss": 1.5858,
      "num_input_tokens_seen": 16684943504,
      "step": 21207
    },
    {
      "epoch": 2.2499469552302145,
      "grad_norm": 0.5158963190467762,
      "learning_rate": 4.581863538703448e-05,
      "loss": 1.6924,
      "num_input_tokens_seen": 16685730192,
      "step": 21208
    },
    {
      "epoch": 2.2500530447697855,
      "grad_norm": 0.5637152290453116,
      "learning_rate": 4.58182506052663e-05,
      "loss": 1.6142,
      "num_input_tokens_seen": 16686516896,
      "step": 21209
    },
    {
      "epoch": 2.250159134309357,
      "grad_norm": 0.5926463094410171,
      "learning_rate": 4.5817865807410384e-05,
      "loss": 1.7961,
      "num_input_tokens_seen": 16687303616,
      "step": 21210
    },
    {
      "epoch": 2.2502652238489285,
      "grad_norm": 0.5176382440675668,
      "learning_rate": 4.5817480993467046e-05,
      "loss": 1.6308,
      "num_input_tokens_seen": 16688090320,
      "step": 21211
    },
    {
      "epoch": 2.2503713133885,
      "grad_norm": 0.41511015472432716,
      "learning_rate": 4.581709616343656e-05,
      "loss": 1.6185,
      "num_input_tokens_seen": 16688876960,
      "step": 21212
    },
    {
      "epoch": 2.2504774029280714,
      "grad_norm": 0.7910769356547509,
      "learning_rate": 4.581671131731923e-05,
      "loss": 1.6113,
      "num_input_tokens_seen": 16689663712,
      "step": 21213
    },
    {
      "epoch": 2.2505834924676424,
      "grad_norm": 0.42286989204967385,
      "learning_rate": 4.5816326455115365e-05,
      "loss": 1.6495,
      "num_input_tokens_seen": 16690450416,
      "step": 21214
    },
    {
      "epoch": 2.250689582007214,
      "grad_norm": 0.6707451549711134,
      "learning_rate": 4.581594157682525e-05,
      "loss": 1.6519,
      "num_input_tokens_seen": 16691237152,
      "step": 21215
    },
    {
      "epoch": 2.2507956715467854,
      "grad_norm": 0.48617531744182374,
      "learning_rate": 4.581555668244918e-05,
      "loss": 1.6799,
      "num_input_tokens_seen": 16692023904,
      "step": 21216
    },
    {
      "epoch": 2.250901761086357,
      "grad_norm": 0.4217456903512829,
      "learning_rate": 4.581517177198747e-05,
      "loss": 1.7567,
      "num_input_tokens_seen": 16692810656,
      "step": 21217
    },
    {
      "epoch": 2.2510078506259283,
      "grad_norm": 0.5427072882135318,
      "learning_rate": 4.58147868454404e-05,
      "loss": 1.6748,
      "num_input_tokens_seen": 16693597504,
      "step": 21218
    },
    {
      "epoch": 2.2511139401655,
      "grad_norm": 0.536095007383988,
      "learning_rate": 4.5814401902808274e-05,
      "loss": 1.7689,
      "num_input_tokens_seen": 16694384240,
      "step": 21219
    },
    {
      "epoch": 2.2512200297050713,
      "grad_norm": 0.5122805670704064,
      "learning_rate": 4.5814016944091386e-05,
      "loss": 1.6967,
      "num_input_tokens_seen": 16695171008,
      "step": 21220
    },
    {
      "epoch": 2.2513261192446423,
      "grad_norm": 0.7016305141207532,
      "learning_rate": 4.581363196929004e-05,
      "loss": 1.6642,
      "num_input_tokens_seen": 16695957744,
      "step": 21221
    },
    {
      "epoch": 2.251432208784214,
      "grad_norm": 0.4647370200186246,
      "learning_rate": 4.5813246978404535e-05,
      "loss": 1.6176,
      "num_input_tokens_seen": 16696744480,
      "step": 21222
    },
    {
      "epoch": 2.2515382983237853,
      "grad_norm": 0.5930145038985968,
      "learning_rate": 4.581286197143515e-05,
      "loss": 1.5668,
      "num_input_tokens_seen": 16697531216,
      "step": 21223
    },
    {
      "epoch": 2.2516443878633567,
      "grad_norm": 0.5654722081025972,
      "learning_rate": 4.581247694838221e-05,
      "loss": 1.5971,
      "num_input_tokens_seen": 16698317968,
      "step": 21224
    },
    {
      "epoch": 2.251750477402928,
      "grad_norm": 0.48149178071214566,
      "learning_rate": 4.581209190924599e-05,
      "loss": 1.6216,
      "num_input_tokens_seen": 16699104800,
      "step": 21225
    },
    {
      "epoch": 2.2518565669424992,
      "grad_norm": 0.5860847906970086,
      "learning_rate": 4.58117068540268e-05,
      "loss": 1.5621,
      "num_input_tokens_seen": 16699891504,
      "step": 21226
    },
    {
      "epoch": 2.2519626564820707,
      "grad_norm": 0.3376265572802,
      "learning_rate": 4.581132178272492e-05,
      "loss": 1.5133,
      "num_input_tokens_seen": 16700678240,
      "step": 21227
    },
    {
      "epoch": 2.252068746021642,
      "grad_norm": 0.44749197356065595,
      "learning_rate": 4.581093669534068e-05,
      "loss": 1.5753,
      "num_input_tokens_seen": 16701465024,
      "step": 21228
    },
    {
      "epoch": 2.2521748355612137,
      "grad_norm": 0.5219546408271208,
      "learning_rate": 4.581055159187435e-05,
      "loss": 1.6217,
      "num_input_tokens_seen": 16702251744,
      "step": 21229
    },
    {
      "epoch": 2.252280925100785,
      "grad_norm": 0.3658201618221507,
      "learning_rate": 4.581016647232624e-05,
      "loss": 1.5531,
      "num_input_tokens_seen": 16703038512,
      "step": 21230
    },
    {
      "epoch": 2.2523870146403566,
      "grad_norm": 1.2990823472544546,
      "learning_rate": 4.5809781336696645e-05,
      "loss": 1.7438,
      "num_input_tokens_seen": 16703825232,
      "step": 21231
    },
    {
      "epoch": 2.252493104179928,
      "grad_norm": 0.5456488463548969,
      "learning_rate": 4.5809396184985854e-05,
      "loss": 1.5072,
      "num_input_tokens_seen": 16704612096,
      "step": 21232
    },
    {
      "epoch": 2.252599193719499,
      "grad_norm": 1.0117949447389505,
      "learning_rate": 4.5809011017194184e-05,
      "loss": 1.6163,
      "num_input_tokens_seen": 16705398912,
      "step": 21233
    },
    {
      "epoch": 2.2527052832590706,
      "grad_norm": 0.49118616608765536,
      "learning_rate": 4.5808625833321905e-05,
      "loss": 1.5472,
      "num_input_tokens_seen": 16706185696,
      "step": 21234
    },
    {
      "epoch": 2.252811372798642,
      "grad_norm": 1.2936435013390246,
      "learning_rate": 4.580824063336934e-05,
      "loss": 1.5085,
      "num_input_tokens_seen": 16706972464,
      "step": 21235
    },
    {
      "epoch": 2.2529174623382136,
      "grad_norm": 0.41400977600818084,
      "learning_rate": 4.5807855417336775e-05,
      "loss": 1.4681,
      "num_input_tokens_seen": 16707759264,
      "step": 21236
    },
    {
      "epoch": 2.253023551877785,
      "grad_norm": 0.7643647010859895,
      "learning_rate": 4.580747018522451e-05,
      "loss": 1.608,
      "num_input_tokens_seen": 16708546000,
      "step": 21237
    },
    {
      "epoch": 2.253129641417356,
      "grad_norm": 0.5847957131513063,
      "learning_rate": 4.580708493703285e-05,
      "loss": 1.546,
      "num_input_tokens_seen": 16709332768,
      "step": 21238
    },
    {
      "epoch": 2.2532357309569275,
      "grad_norm": 0.4654983407454858,
      "learning_rate": 4.580669967276208e-05,
      "loss": 1.5937,
      "num_input_tokens_seen": 16710119584,
      "step": 21239
    },
    {
      "epoch": 2.253341820496499,
      "grad_norm": 0.760339578210414,
      "learning_rate": 4.5806314392412496e-05,
      "loss": 1.5608,
      "num_input_tokens_seen": 16710906368,
      "step": 21240
    },
    {
      "epoch": 2.2534479100360705,
      "grad_norm": 0.4154577336398117,
      "learning_rate": 4.580592909598441e-05,
      "loss": 1.5619,
      "num_input_tokens_seen": 16711693056,
      "step": 21241
    },
    {
      "epoch": 2.253553999575642,
      "grad_norm": 0.478704786011328,
      "learning_rate": 4.580554378347811e-05,
      "loss": 1.698,
      "num_input_tokens_seen": 16712479856,
      "step": 21242
    },
    {
      "epoch": 2.2536600891152134,
      "grad_norm": 0.477945269819683,
      "learning_rate": 4.5805158454893906e-05,
      "loss": 1.6468,
      "num_input_tokens_seen": 16713266624,
      "step": 21243
    },
    {
      "epoch": 2.2537661786547845,
      "grad_norm": 0.4056726495613863,
      "learning_rate": 4.5804773110232067e-05,
      "loss": 1.6038,
      "num_input_tokens_seen": 16714053344,
      "step": 21244
    },
    {
      "epoch": 2.253872268194356,
      "grad_norm": 0.4663168937061118,
      "learning_rate": 4.5804387749492925e-05,
      "loss": 1.7503,
      "num_input_tokens_seen": 16714840064,
      "step": 21245
    },
    {
      "epoch": 2.2539783577339274,
      "grad_norm": 0.41780964039143753,
      "learning_rate": 4.580400237267676e-05,
      "loss": 1.5198,
      "num_input_tokens_seen": 16715626896,
      "step": 21246
    },
    {
      "epoch": 2.254084447273499,
      "grad_norm": 0.4480264974231511,
      "learning_rate": 4.580361697978387e-05,
      "loss": 1.6485,
      "num_input_tokens_seen": 16716413712,
      "step": 21247
    },
    {
      "epoch": 2.2541905368130704,
      "grad_norm": 0.3859010270489684,
      "learning_rate": 4.5803231570814555e-05,
      "loss": 1.6066,
      "num_input_tokens_seen": 16717200512,
      "step": 21248
    },
    {
      "epoch": 2.254296626352642,
      "grad_norm": 0.43755957681924634,
      "learning_rate": 4.580284614576911e-05,
      "loss": 1.5776,
      "num_input_tokens_seen": 16717987168,
      "step": 21249
    },
    {
      "epoch": 2.254402715892213,
      "grad_norm": 0.4930859166588959,
      "learning_rate": 4.5802460704647845e-05,
      "loss": 1.7241,
      "num_input_tokens_seen": 16718773952,
      "step": 21250
    },
    {
      "epoch": 2.2545088054317843,
      "grad_norm": 0.5182159302263567,
      "learning_rate": 4.580207524745104e-05,
      "loss": 1.633,
      "num_input_tokens_seen": 16719560768,
      "step": 21251
    },
    {
      "epoch": 2.254614894971356,
      "grad_norm": 0.43054922401432183,
      "learning_rate": 4.5801689774179e-05,
      "loss": 1.5351,
      "num_input_tokens_seen": 16720347472,
      "step": 21252
    },
    {
      "epoch": 2.2547209845109273,
      "grad_norm": 0.44737698937068565,
      "learning_rate": 4.5801304284832036e-05,
      "loss": 1.5395,
      "num_input_tokens_seen": 16721134240,
      "step": 21253
    },
    {
      "epoch": 2.2548270740504988,
      "grad_norm": 0.37924166063159487,
      "learning_rate": 4.5800918779410424e-05,
      "loss": 1.4923,
      "num_input_tokens_seen": 16721921088,
      "step": 21254
    },
    {
      "epoch": 2.25493316359007,
      "grad_norm": 0.4652645446223525,
      "learning_rate": 4.580053325791447e-05,
      "loss": 1.6844,
      "num_input_tokens_seen": 16722707824,
      "step": 21255
    },
    {
      "epoch": 2.2550392531296413,
      "grad_norm": 0.4029360266951124,
      "learning_rate": 4.580014772034449e-05,
      "loss": 1.5831,
      "num_input_tokens_seen": 16723494608,
      "step": 21256
    },
    {
      "epoch": 2.2551453426692127,
      "grad_norm": 0.5064641513710452,
      "learning_rate": 4.579976216670076e-05,
      "loss": 1.6541,
      "num_input_tokens_seen": 16724281344,
      "step": 21257
    },
    {
      "epoch": 2.255251432208784,
      "grad_norm": 0.36396558306087695,
      "learning_rate": 4.5799376596983565e-05,
      "loss": 1.5647,
      "num_input_tokens_seen": 16725068144,
      "step": 21258
    },
    {
      "epoch": 2.2553575217483557,
      "grad_norm": 0.4425245805963091,
      "learning_rate": 4.5798991011193244e-05,
      "loss": 1.5341,
      "num_input_tokens_seen": 16725854896,
      "step": 21259
    },
    {
      "epoch": 2.255463611287927,
      "grad_norm": 0.5230190708423951,
      "learning_rate": 4.579860540933007e-05,
      "loss": 1.5847,
      "num_input_tokens_seen": 16726641616,
      "step": 21260
    },
    {
      "epoch": 2.2555697008274986,
      "grad_norm": 0.4189376461734378,
      "learning_rate": 4.579821979139434e-05,
      "loss": 1.6949,
      "num_input_tokens_seen": 16727428480,
      "step": 21261
    },
    {
      "epoch": 2.2556757903670697,
      "grad_norm": 0.5308752145818555,
      "learning_rate": 4.5797834157386355e-05,
      "loss": 1.6349,
      "num_input_tokens_seen": 16728215264,
      "step": 21262
    },
    {
      "epoch": 2.255781879906641,
      "grad_norm": 0.45128010204495206,
      "learning_rate": 4.579744850730642e-05,
      "loss": 1.6311,
      "num_input_tokens_seen": 16729002048,
      "step": 21263
    },
    {
      "epoch": 2.2558879694462126,
      "grad_norm": 0.3608116137672374,
      "learning_rate": 4.5797062841154815e-05,
      "loss": 1.6478,
      "num_input_tokens_seen": 16729788800,
      "step": 21264
    },
    {
      "epoch": 2.255994058985784,
      "grad_norm": 0.6227905069683892,
      "learning_rate": 4.579667715893185e-05,
      "loss": 1.6329,
      "num_input_tokens_seen": 16730575536,
      "step": 21265
    },
    {
      "epoch": 2.2561001485253556,
      "grad_norm": 0.3574939481149907,
      "learning_rate": 4.5796291460637844e-05,
      "loss": 1.4598,
      "num_input_tokens_seen": 16731362320,
      "step": 21266
    },
    {
      "epoch": 2.2562062380649266,
      "grad_norm": 0.5678363154689712,
      "learning_rate": 4.579590574627305e-05,
      "loss": 1.5885,
      "num_input_tokens_seen": 16732149072,
      "step": 21267
    },
    {
      "epoch": 2.256312327604498,
      "grad_norm": 0.4434380339963985,
      "learning_rate": 4.579552001583781e-05,
      "loss": 1.5873,
      "num_input_tokens_seen": 16732935792,
      "step": 21268
    },
    {
      "epoch": 2.2564184171440695,
      "grad_norm": 0.3936390846457786,
      "learning_rate": 4.579513426933239e-05,
      "loss": 1.6494,
      "num_input_tokens_seen": 16733722576,
      "step": 21269
    },
    {
      "epoch": 2.256524506683641,
      "grad_norm": 0.41730643211029234,
      "learning_rate": 4.57947485067571e-05,
      "loss": 1.4946,
      "num_input_tokens_seen": 16734509312,
      "step": 21270
    },
    {
      "epoch": 2.2566305962232125,
      "grad_norm": 0.3939201184501998,
      "learning_rate": 4.579436272811225e-05,
      "loss": 1.6083,
      "num_input_tokens_seen": 16735296048,
      "step": 21271
    },
    {
      "epoch": 2.256736685762784,
      "grad_norm": 0.4367641751679195,
      "learning_rate": 4.579397693339812e-05,
      "loss": 1.6068,
      "num_input_tokens_seen": 16736082816,
      "step": 21272
    },
    {
      "epoch": 2.256842775302355,
      "grad_norm": 0.34607686650420627,
      "learning_rate": 4.579359112261501e-05,
      "loss": 1.6414,
      "num_input_tokens_seen": 16736869600,
      "step": 21273
    },
    {
      "epoch": 2.2569488648419265,
      "grad_norm": 0.5037975814555969,
      "learning_rate": 4.5793205295763225e-05,
      "loss": 1.5966,
      "num_input_tokens_seen": 16737656336,
      "step": 21274
    },
    {
      "epoch": 2.257054954381498,
      "grad_norm": 0.4008825043963137,
      "learning_rate": 4.579281945284306e-05,
      "loss": 1.6825,
      "num_input_tokens_seen": 16738443136,
      "step": 21275
    },
    {
      "epoch": 2.2571610439210694,
      "grad_norm": 0.3702185183573641,
      "learning_rate": 4.579243359385482e-05,
      "loss": 1.6375,
      "num_input_tokens_seen": 16739229904,
      "step": 21276
    },
    {
      "epoch": 2.257267133460641,
      "grad_norm": 0.4323666752016591,
      "learning_rate": 4.579204771879879e-05,
      "loss": 1.8282,
      "num_input_tokens_seen": 16740016672,
      "step": 21277
    },
    {
      "epoch": 2.2573732230002124,
      "grad_norm": 0.40023549927989743,
      "learning_rate": 4.579166182767528e-05,
      "loss": 1.4858,
      "num_input_tokens_seen": 16740803360,
      "step": 21278
    },
    {
      "epoch": 2.2574793125397834,
      "grad_norm": 0.3732458694026384,
      "learning_rate": 4.579127592048459e-05,
      "loss": 1.6535,
      "num_input_tokens_seen": 16741590112,
      "step": 21279
    },
    {
      "epoch": 2.257585402079355,
      "grad_norm": 0.39422040203090786,
      "learning_rate": 4.5790889997227005e-05,
      "loss": 1.667,
      "num_input_tokens_seen": 16742376912,
      "step": 21280
    },
    {
      "epoch": 2.2576914916189263,
      "grad_norm": 0.37565891387344214,
      "learning_rate": 4.5790504057902826e-05,
      "loss": 1.6153,
      "num_input_tokens_seen": 16743163712,
      "step": 21281
    },
    {
      "epoch": 2.257797581158498,
      "grad_norm": 0.3970729640174164,
      "learning_rate": 4.579011810251236e-05,
      "loss": 1.4877,
      "num_input_tokens_seen": 16743950480,
      "step": 21282
    },
    {
      "epoch": 2.2579036706980693,
      "grad_norm": 0.3576495092458704,
      "learning_rate": 4.5789732131055906e-05,
      "loss": 1.6345,
      "num_input_tokens_seen": 16744737216,
      "step": 21283
    },
    {
      "epoch": 2.2580097602376403,
      "grad_norm": 0.4360573008873469,
      "learning_rate": 4.578934614353375e-05,
      "loss": 1.6293,
      "num_input_tokens_seen": 16745523984,
      "step": 21284
    },
    {
      "epoch": 2.258115849777212,
      "grad_norm": 0.34210295423878956,
      "learning_rate": 4.57889601399462e-05,
      "loss": 1.6549,
      "num_input_tokens_seen": 16746310736,
      "step": 21285
    },
    {
      "epoch": 2.2582219393167833,
      "grad_norm": 0.381794102783809,
      "learning_rate": 4.5788574120293545e-05,
      "loss": 1.5164,
      "num_input_tokens_seen": 16747097520,
      "step": 21286
    },
    {
      "epoch": 2.2583280288563548,
      "grad_norm": 0.3879989590516015,
      "learning_rate": 4.57881880845761e-05,
      "loss": 1.5349,
      "num_input_tokens_seen": 16747884208,
      "step": 21287
    },
    {
      "epoch": 2.2584341183959262,
      "grad_norm": 0.41114121408436416,
      "learning_rate": 4.578780203279415e-05,
      "loss": 1.5954,
      "num_input_tokens_seen": 16748670928,
      "step": 21288
    },
    {
      "epoch": 2.2585402079354977,
      "grad_norm": 0.42386900712643566,
      "learning_rate": 4.5787415964948e-05,
      "loss": 1.8706,
      "num_input_tokens_seen": 16749457600,
      "step": 21289
    },
    {
      "epoch": 2.258646297475069,
      "grad_norm": 0.4281564799105625,
      "learning_rate": 4.578702988103793e-05,
      "loss": 1.6234,
      "num_input_tokens_seen": 16750244336,
      "step": 21290
    },
    {
      "epoch": 2.25875238701464,
      "grad_norm": 0.3866613051589274,
      "learning_rate": 4.578664378106427e-05,
      "loss": 1.5,
      "num_input_tokens_seen": 16751031088,
      "step": 21291
    },
    {
      "epoch": 2.2588584765542117,
      "grad_norm": 0.36833511340825253,
      "learning_rate": 4.57862576650273e-05,
      "loss": 1.5435,
      "num_input_tokens_seen": 16751817840,
      "step": 21292
    },
    {
      "epoch": 2.258964566093783,
      "grad_norm": 0.3889014848828896,
      "learning_rate": 4.578587153292731e-05,
      "loss": 1.6417,
      "num_input_tokens_seen": 16752604592,
      "step": 21293
    },
    {
      "epoch": 2.2590706556333546,
      "grad_norm": 0.43214503738528265,
      "learning_rate": 4.578548538476462e-05,
      "loss": 1.6084,
      "num_input_tokens_seen": 16753391392,
      "step": 21294
    },
    {
      "epoch": 2.259176745172926,
      "grad_norm": 0.4402082030357559,
      "learning_rate": 4.578509922053951e-05,
      "loss": 1.4832,
      "num_input_tokens_seen": 16754178256,
      "step": 21295
    },
    {
      "epoch": 2.259282834712497,
      "grad_norm": 0.35975718717485716,
      "learning_rate": 4.578471304025228e-05,
      "loss": 1.5257,
      "num_input_tokens_seen": 16754964992,
      "step": 21296
    },
    {
      "epoch": 2.2593889242520686,
      "grad_norm": 0.34702362100606193,
      "learning_rate": 4.578432684390324e-05,
      "loss": 1.473,
      "num_input_tokens_seen": 16755751776,
      "step": 21297
    },
    {
      "epoch": 2.25949501379164,
      "grad_norm": 0.4646544661653159,
      "learning_rate": 4.5783940631492685e-05,
      "loss": 1.647,
      "num_input_tokens_seen": 16756538544,
      "step": 21298
    },
    {
      "epoch": 2.2596011033312116,
      "grad_norm": 0.3807031725076491,
      "learning_rate": 4.57835544030209e-05,
      "loss": 1.6336,
      "num_input_tokens_seen": 16757325296,
      "step": 21299
    },
    {
      "epoch": 2.259707192870783,
      "grad_norm": 0.4691031959884957,
      "learning_rate": 4.5783168158488204e-05,
      "loss": 1.6174,
      "num_input_tokens_seen": 16758112128,
      "step": 21300
    },
    {
      "epoch": 2.2598132824103545,
      "grad_norm": 0.3586756923658166,
      "learning_rate": 4.578278189789488e-05,
      "loss": 1.6016,
      "num_input_tokens_seen": 16758898960,
      "step": 21301
    },
    {
      "epoch": 2.259919371949926,
      "grad_norm": 0.42278368276935435,
      "learning_rate": 4.5782395621241235e-05,
      "loss": 1.6051,
      "num_input_tokens_seen": 16759685664,
      "step": 21302
    },
    {
      "epoch": 2.260025461489497,
      "grad_norm": 0.39468266439381844,
      "learning_rate": 4.5782009328527564e-05,
      "loss": 1.6289,
      "num_input_tokens_seen": 16760472464,
      "step": 21303
    },
    {
      "epoch": 2.2601315510290685,
      "grad_norm": 0.3741210474545573,
      "learning_rate": 4.578162301975417e-05,
      "loss": 1.6618,
      "num_input_tokens_seen": 16761259312,
      "step": 21304
    },
    {
      "epoch": 2.26023764056864,
      "grad_norm": 0.4220434756608453,
      "learning_rate": 4.5781236694921334e-05,
      "loss": 1.6516,
      "num_input_tokens_seen": 16762046064,
      "step": 21305
    },
    {
      "epoch": 2.2603437301082114,
      "grad_norm": 0.4282719987954138,
      "learning_rate": 4.578085035402938e-05,
      "loss": 1.7179,
      "num_input_tokens_seen": 16762832880,
      "step": 21306
    },
    {
      "epoch": 2.260449819647783,
      "grad_norm": 0.3837925920138357,
      "learning_rate": 4.578046399707859e-05,
      "loss": 1.6637,
      "num_input_tokens_seen": 16763619648,
      "step": 21307
    },
    {
      "epoch": 2.260555909187354,
      "grad_norm": 0.44361952941114713,
      "learning_rate": 4.5780077624069274e-05,
      "loss": 1.7707,
      "num_input_tokens_seen": 16764406384,
      "step": 21308
    },
    {
      "epoch": 2.2606619987269254,
      "grad_norm": 0.41144059807476047,
      "learning_rate": 4.577969123500172e-05,
      "loss": 1.6058,
      "num_input_tokens_seen": 16765193200,
      "step": 21309
    },
    {
      "epoch": 2.260768088266497,
      "grad_norm": 0.41221855163662774,
      "learning_rate": 4.577930482987622e-05,
      "loss": 1.6386,
      "num_input_tokens_seen": 16765979952,
      "step": 21310
    },
    {
      "epoch": 2.2608741778060684,
      "grad_norm": 0.39402225891640924,
      "learning_rate": 4.57789184086931e-05,
      "loss": 1.6058,
      "num_input_tokens_seen": 16766766736,
      "step": 21311
    },
    {
      "epoch": 2.26098026734564,
      "grad_norm": 0.36760618805222983,
      "learning_rate": 4.5778531971452635e-05,
      "loss": 1.6239,
      "num_input_tokens_seen": 16767553472,
      "step": 21312
    },
    {
      "epoch": 2.261086356885211,
      "grad_norm": 0.385530043525621,
      "learning_rate": 4.5778145518155124e-05,
      "loss": 1.4664,
      "num_input_tokens_seen": 16768340336,
      "step": 21313
    },
    {
      "epoch": 2.2611924464247823,
      "grad_norm": 0.450364402004751,
      "learning_rate": 4.5777759048800884e-05,
      "loss": 1.645,
      "num_input_tokens_seen": 16769127056,
      "step": 21314
    },
    {
      "epoch": 2.261298535964354,
      "grad_norm": 0.41352630763227094,
      "learning_rate": 4.577737256339019e-05,
      "loss": 1.51,
      "num_input_tokens_seen": 16769913824,
      "step": 21315
    },
    {
      "epoch": 2.2614046255039253,
      "grad_norm": 0.3942586905260194,
      "learning_rate": 4.5776986061923354e-05,
      "loss": 1.5548,
      "num_input_tokens_seen": 16770700624,
      "step": 21316
    },
    {
      "epoch": 2.2615107150434968,
      "grad_norm": 0.6820107546776687,
      "learning_rate": 4.577659954440068e-05,
      "loss": 1.7035,
      "num_input_tokens_seen": 16771487424,
      "step": 21317
    },
    {
      "epoch": 2.2616168045830682,
      "grad_norm": 0.38659539526288544,
      "learning_rate": 4.577621301082245e-05,
      "loss": 1.6754,
      "num_input_tokens_seen": 16772274160,
      "step": 21318
    },
    {
      "epoch": 2.2617228941226397,
      "grad_norm": 0.7561367774211889,
      "learning_rate": 4.5775826461188976e-05,
      "loss": 1.6207,
      "num_input_tokens_seen": 16773060896,
      "step": 21319
    },
    {
      "epoch": 2.2618289836622107,
      "grad_norm": 0.40536689984725677,
      "learning_rate": 4.5775439895500554e-05,
      "loss": 1.5814,
      "num_input_tokens_seen": 16773847600,
      "step": 21320
    },
    {
      "epoch": 2.261935073201782,
      "grad_norm": 0.5140462590865825,
      "learning_rate": 4.577505331375748e-05,
      "loss": 1.6678,
      "num_input_tokens_seen": 16774634384,
      "step": 21321
    },
    {
      "epoch": 2.2620411627413537,
      "grad_norm": 0.6179312905399356,
      "learning_rate": 4.5774666715960055e-05,
      "loss": 1.6861,
      "num_input_tokens_seen": 16775421168,
      "step": 21322
    },
    {
      "epoch": 2.262147252280925,
      "grad_norm": 0.4175029281332017,
      "learning_rate": 4.577428010210858e-05,
      "loss": 1.564,
      "num_input_tokens_seen": 16776208000,
      "step": 21323
    },
    {
      "epoch": 2.2622533418204966,
      "grad_norm": 0.42701855643920905,
      "learning_rate": 4.577389347220335e-05,
      "loss": 1.5175,
      "num_input_tokens_seen": 16776994832,
      "step": 21324
    },
    {
      "epoch": 2.2623594313600677,
      "grad_norm": 0.5633867219133539,
      "learning_rate": 4.577350682624466e-05,
      "loss": 1.5888,
      "num_input_tokens_seen": 16777781568,
      "step": 21325
    },
    {
      "epoch": 2.262465520899639,
      "grad_norm": 0.3873483372740868,
      "learning_rate": 4.5773120164232816e-05,
      "loss": 1.5361,
      "num_input_tokens_seen": 16778568352,
      "step": 21326
    },
    {
      "epoch": 2.2625716104392106,
      "grad_norm": 0.49123952680531935,
      "learning_rate": 4.577273348616812e-05,
      "loss": 1.6413,
      "num_input_tokens_seen": 16779355088,
      "step": 21327
    },
    {
      "epoch": 2.262677699978782,
      "grad_norm": 0.5035225232471148,
      "learning_rate": 4.5772346792050854e-05,
      "loss": 1.6458,
      "num_input_tokens_seen": 16780141840,
      "step": 21328
    },
    {
      "epoch": 2.2627837895183536,
      "grad_norm": 0.43473020262545536,
      "learning_rate": 4.577196008188134e-05,
      "loss": 1.679,
      "num_input_tokens_seen": 16780928576,
      "step": 21329
    },
    {
      "epoch": 2.262889879057925,
      "grad_norm": 0.5281041941603817,
      "learning_rate": 4.577157335565986e-05,
      "loss": 1.7009,
      "num_input_tokens_seen": 16781715312,
      "step": 21330
    },
    {
      "epoch": 2.2629959685974965,
      "grad_norm": 0.4550966226578894,
      "learning_rate": 4.577118661338671e-05,
      "loss": 1.6328,
      "num_input_tokens_seen": 16782502048,
      "step": 21331
    },
    {
      "epoch": 2.2631020581370676,
      "grad_norm": 0.39491044878276066,
      "learning_rate": 4.5770799855062206e-05,
      "loss": 1.5938,
      "num_input_tokens_seen": 16783288688,
      "step": 21332
    },
    {
      "epoch": 2.263208147676639,
      "grad_norm": 0.5261634892389428,
      "learning_rate": 4.577041308068664e-05,
      "loss": 1.6656,
      "num_input_tokens_seen": 16784075488,
      "step": 21333
    },
    {
      "epoch": 2.2633142372162105,
      "grad_norm": 0.41419405931613446,
      "learning_rate": 4.577002629026029e-05,
      "loss": 1.6308,
      "num_input_tokens_seen": 16784862144,
      "step": 21334
    },
    {
      "epoch": 2.263420326755782,
      "grad_norm": 0.443826026364278,
      "learning_rate": 4.576963948378349e-05,
      "loss": 1.634,
      "num_input_tokens_seen": 16785648816,
      "step": 21335
    },
    {
      "epoch": 2.2635264162953534,
      "grad_norm": 0.5244611326168442,
      "learning_rate": 4.5769252661256515e-05,
      "loss": 1.5934,
      "num_input_tokens_seen": 16786435616,
      "step": 21336
    },
    {
      "epoch": 2.2636325058349245,
      "grad_norm": 0.3824983053037946,
      "learning_rate": 4.576886582267967e-05,
      "loss": 1.5275,
      "num_input_tokens_seen": 16787222496,
      "step": 21337
    },
    {
      "epoch": 2.263738595374496,
      "grad_norm": 0.4113264114927293,
      "learning_rate": 4.576847896805326e-05,
      "loss": 1.5644,
      "num_input_tokens_seen": 16788009296,
      "step": 21338
    },
    {
      "epoch": 2.2638446849140674,
      "grad_norm": 0.629548498191729,
      "learning_rate": 4.576809209737758e-05,
      "loss": 1.5879,
      "num_input_tokens_seen": 16788796032,
      "step": 21339
    },
    {
      "epoch": 2.263950774453639,
      "grad_norm": 0.4006849902089851,
      "learning_rate": 4.5767705210652926e-05,
      "loss": 1.5777,
      "num_input_tokens_seen": 16789582768,
      "step": 21340
    },
    {
      "epoch": 2.2640568639932104,
      "grad_norm": 0.4543732119234526,
      "learning_rate": 4.57673183078796e-05,
      "loss": 1.5218,
      "num_input_tokens_seen": 16790369472,
      "step": 21341
    },
    {
      "epoch": 2.264162953532782,
      "grad_norm": 0.6385320117600998,
      "learning_rate": 4.57669313890579e-05,
      "loss": 1.5947,
      "num_input_tokens_seen": 16791156304,
      "step": 21342
    },
    {
      "epoch": 2.264269043072353,
      "grad_norm": 0.5154035508289191,
      "learning_rate": 4.576654445418812e-05,
      "loss": 1.7361,
      "num_input_tokens_seen": 16791943104,
      "step": 21343
    },
    {
      "epoch": 2.2643751326119244,
      "grad_norm": 0.5228978986035857,
      "learning_rate": 4.576615750327056e-05,
      "loss": 1.5812,
      "num_input_tokens_seen": 16792729920,
      "step": 21344
    },
    {
      "epoch": 2.264481222151496,
      "grad_norm": 0.4878155266235032,
      "learning_rate": 4.576577053630553e-05,
      "loss": 1.8328,
      "num_input_tokens_seen": 16793516640,
      "step": 21345
    },
    {
      "epoch": 2.2645873116910673,
      "grad_norm": 0.45382397128772933,
      "learning_rate": 4.576538355329332e-05,
      "loss": 1.5226,
      "num_input_tokens_seen": 16794303408,
      "step": 21346
    },
    {
      "epoch": 2.264693401230639,
      "grad_norm": 0.5164663874751053,
      "learning_rate": 4.576499655423423e-05,
      "loss": 1.7266,
      "num_input_tokens_seen": 16795090112,
      "step": 21347
    },
    {
      "epoch": 2.2647994907702103,
      "grad_norm": 0.39587790603594675,
      "learning_rate": 4.5764609539128567e-05,
      "loss": 1.5912,
      "num_input_tokens_seen": 16795876912,
      "step": 21348
    },
    {
      "epoch": 2.2649055803097813,
      "grad_norm": 0.42677242677333793,
      "learning_rate": 4.576422250797662e-05,
      "loss": 1.5254,
      "num_input_tokens_seen": 16796663680,
      "step": 21349
    },
    {
      "epoch": 2.2650116698493528,
      "grad_norm": 0.509189470033096,
      "learning_rate": 4.576383546077868e-05,
      "loss": 1.7384,
      "num_input_tokens_seen": 16797450480,
      "step": 21350
    },
    {
      "epoch": 2.2651177593889242,
      "grad_norm": 0.4147739675477914,
      "learning_rate": 4.576344839753507e-05,
      "loss": 1.5156,
      "num_input_tokens_seen": 16798237264,
      "step": 21351
    },
    {
      "epoch": 2.2652238489284957,
      "grad_norm": 0.3674407108736299,
      "learning_rate": 4.576306131824607e-05,
      "loss": 1.5026,
      "num_input_tokens_seen": 16799024032,
      "step": 21352
    },
    {
      "epoch": 2.265329938468067,
      "grad_norm": 0.36434488437222134,
      "learning_rate": 4.576267422291199e-05,
      "loss": 1.5584,
      "num_input_tokens_seen": 16799810784,
      "step": 21353
    },
    {
      "epoch": 2.265436028007638,
      "grad_norm": 0.37891433318553014,
      "learning_rate": 4.576228711153312e-05,
      "loss": 1.7025,
      "num_input_tokens_seen": 16800597520,
      "step": 21354
    },
    {
      "epoch": 2.2655421175472097,
      "grad_norm": 0.42915569117653846,
      "learning_rate": 4.576189998410977e-05,
      "loss": 1.597,
      "num_input_tokens_seen": 16801384240,
      "step": 21355
    },
    {
      "epoch": 2.265648207086781,
      "grad_norm": 0.41241062882572993,
      "learning_rate": 4.576151284064223e-05,
      "loss": 1.5895,
      "num_input_tokens_seen": 16802170992,
      "step": 21356
    },
    {
      "epoch": 2.2657542966263526,
      "grad_norm": 0.48084840619125746,
      "learning_rate": 4.57611256811308e-05,
      "loss": 1.7425,
      "num_input_tokens_seen": 16802957760,
      "step": 21357
    },
    {
      "epoch": 2.265860386165924,
      "grad_norm": 0.46541963854326085,
      "learning_rate": 4.576073850557578e-05,
      "loss": 1.5473,
      "num_input_tokens_seen": 16803744544,
      "step": 21358
    },
    {
      "epoch": 2.2659664757054956,
      "grad_norm": 0.42508949407552155,
      "learning_rate": 4.576035131397747e-05,
      "loss": 1.6341,
      "num_input_tokens_seen": 16804531360,
      "step": 21359
    },
    {
      "epoch": 2.266072565245067,
      "grad_norm": 0.41727843672471215,
      "learning_rate": 4.5759964106336174e-05,
      "loss": 1.6957,
      "num_input_tokens_seen": 16805318176,
      "step": 21360
    },
    {
      "epoch": 2.266178654784638,
      "grad_norm": 0.36939318797315834,
      "learning_rate": 4.575957688265218e-05,
      "loss": 1.7229,
      "num_input_tokens_seen": 16806104848,
      "step": 21361
    },
    {
      "epoch": 2.2662847443242096,
      "grad_norm": 0.3458254253353938,
      "learning_rate": 4.575918964292581e-05,
      "loss": 1.5587,
      "num_input_tokens_seen": 16806891600,
      "step": 21362
    },
    {
      "epoch": 2.266390833863781,
      "grad_norm": 0.3786897218217351,
      "learning_rate": 4.575880238715733e-05,
      "loss": 1.6109,
      "num_input_tokens_seen": 16807678432,
      "step": 21363
    },
    {
      "epoch": 2.2664969234033525,
      "grad_norm": 0.46651267879326214,
      "learning_rate": 4.575841511534706e-05,
      "loss": 1.7339,
      "num_input_tokens_seen": 16808465152,
      "step": 21364
    },
    {
      "epoch": 2.266603012942924,
      "grad_norm": 0.390428494777032,
      "learning_rate": 4.57580278274953e-05,
      "loss": 1.6189,
      "num_input_tokens_seen": 16809252048,
      "step": 21365
    },
    {
      "epoch": 2.266709102482495,
      "grad_norm": 0.4070456735060546,
      "learning_rate": 4.575764052360234e-05,
      "loss": 1.6683,
      "num_input_tokens_seen": 16810038800,
      "step": 21366
    },
    {
      "epoch": 2.2668151920220665,
      "grad_norm": 0.4576215385933167,
      "learning_rate": 4.575725320366849e-05,
      "loss": 1.7034,
      "num_input_tokens_seen": 16810825584,
      "step": 21367
    },
    {
      "epoch": 2.266921281561638,
      "grad_norm": 0.3939513607896709,
      "learning_rate": 4.5756865867694046e-05,
      "loss": 1.6706,
      "num_input_tokens_seen": 16811612352,
      "step": 21368
    },
    {
      "epoch": 2.2670273711012094,
      "grad_norm": 0.40193233452014265,
      "learning_rate": 4.5756478515679304e-05,
      "loss": 1.6644,
      "num_input_tokens_seen": 16812399152,
      "step": 21369
    },
    {
      "epoch": 2.267133460640781,
      "grad_norm": 0.39560998131714986,
      "learning_rate": 4.575609114762456e-05,
      "loss": 1.5684,
      "num_input_tokens_seen": 16813185920,
      "step": 21370
    },
    {
      "epoch": 2.2672395501803524,
      "grad_norm": 0.3640306423885445,
      "learning_rate": 4.5755703763530116e-05,
      "loss": 1.625,
      "num_input_tokens_seen": 16813972736,
      "step": 21371
    },
    {
      "epoch": 2.2673456397199234,
      "grad_norm": 0.3751353667884205,
      "learning_rate": 4.575531636339628e-05,
      "loss": 1.585,
      "num_input_tokens_seen": 16814759488,
      "step": 21372
    },
    {
      "epoch": 2.267451729259495,
      "grad_norm": 0.3822146295387077,
      "learning_rate": 4.575492894722334e-05,
      "loss": 1.4867,
      "num_input_tokens_seen": 16815546208,
      "step": 21373
    },
    {
      "epoch": 2.2675578187990664,
      "grad_norm": 0.39172417592316267,
      "learning_rate": 4.575454151501159e-05,
      "loss": 1.673,
      "num_input_tokens_seen": 16816333024,
      "step": 21374
    },
    {
      "epoch": 2.267663908338638,
      "grad_norm": 0.4101297770352963,
      "learning_rate": 4.575415406676136e-05,
      "loss": 1.6116,
      "num_input_tokens_seen": 16817119760,
      "step": 21375
    },
    {
      "epoch": 2.2677699978782093,
      "grad_norm": 0.39168246693511005,
      "learning_rate": 4.575376660247292e-05,
      "loss": 1.5011,
      "num_input_tokens_seen": 16817906560,
      "step": 21376
    },
    {
      "epoch": 2.267876087417781,
      "grad_norm": 0.36471878977286926,
      "learning_rate": 4.575337912214658e-05,
      "loss": 1.5479,
      "num_input_tokens_seen": 16818693392,
      "step": 21377
    },
    {
      "epoch": 2.267982176957352,
      "grad_norm": 0.40896764886271314,
      "learning_rate": 4.575299162578263e-05,
      "loss": 1.5098,
      "num_input_tokens_seen": 16819480176,
      "step": 21378
    },
    {
      "epoch": 2.2680882664969233,
      "grad_norm": 0.44367935455351765,
      "learning_rate": 4.575260411338138e-05,
      "loss": 1.5348,
      "num_input_tokens_seen": 16820267136,
      "step": 21379
    },
    {
      "epoch": 2.2681943560364948,
      "grad_norm": 0.3928266181422487,
      "learning_rate": 4.575221658494313e-05,
      "loss": 1.6502,
      "num_input_tokens_seen": 16821053872,
      "step": 21380
    },
    {
      "epoch": 2.2683004455760662,
      "grad_norm": 0.38127312419922216,
      "learning_rate": 4.5751829040468175e-05,
      "loss": 1.593,
      "num_input_tokens_seen": 16821840608,
      "step": 21381
    },
    {
      "epoch": 2.2684065351156377,
      "grad_norm": 0.3903775336549384,
      "learning_rate": 4.5751441479956816e-05,
      "loss": 1.6728,
      "num_input_tokens_seen": 16822627552,
      "step": 21382
    },
    {
      "epoch": 2.2685126246552088,
      "grad_norm": 0.36625436485027896,
      "learning_rate": 4.575105390340935e-05,
      "loss": 1.5203,
      "num_input_tokens_seen": 16823414320,
      "step": 21383
    },
    {
      "epoch": 2.2686187141947802,
      "grad_norm": 0.35983369507098306,
      "learning_rate": 4.5750666310826075e-05,
      "loss": 1.4386,
      "num_input_tokens_seen": 16824201120,
      "step": 21384
    },
    {
      "epoch": 2.2687248037343517,
      "grad_norm": 0.3658041362270507,
      "learning_rate": 4.57502787022073e-05,
      "loss": 1.6157,
      "num_input_tokens_seen": 16824987920,
      "step": 21385
    },
    {
      "epoch": 2.268830893273923,
      "grad_norm": 0.3607811095327241,
      "learning_rate": 4.574989107755332e-05,
      "loss": 1.6858,
      "num_input_tokens_seen": 16825774688,
      "step": 21386
    },
    {
      "epoch": 2.2689369828134947,
      "grad_norm": 0.38328379631615067,
      "learning_rate": 4.5749503436864427e-05,
      "loss": 1.58,
      "num_input_tokens_seen": 16826561472,
      "step": 21387
    },
    {
      "epoch": 2.269043072353066,
      "grad_norm": 0.37971905960096164,
      "learning_rate": 4.5749115780140926e-05,
      "loss": 1.6432,
      "num_input_tokens_seen": 16827348208,
      "step": 21388
    },
    {
      "epoch": 2.2691491618926376,
      "grad_norm": 0.3276406215745408,
      "learning_rate": 4.574872810738312e-05,
      "loss": 1.5397,
      "num_input_tokens_seen": 16828134976,
      "step": 21389
    },
    {
      "epoch": 2.2692552514322086,
      "grad_norm": 0.3726113976066917,
      "learning_rate": 4.574834041859131e-05,
      "loss": 1.4623,
      "num_input_tokens_seen": 16828921776,
      "step": 21390
    },
    {
      "epoch": 2.26936134097178,
      "grad_norm": 0.3436052551973092,
      "learning_rate": 4.574795271376578e-05,
      "loss": 1.5228,
      "num_input_tokens_seen": 16829708544,
      "step": 21391
    },
    {
      "epoch": 2.2694674305113516,
      "grad_norm": 0.440167893775871,
      "learning_rate": 4.574756499290686e-05,
      "loss": 1.62,
      "num_input_tokens_seen": 16830495344,
      "step": 21392
    },
    {
      "epoch": 2.269573520050923,
      "grad_norm": 0.4225295950745047,
      "learning_rate": 4.574717725601481e-05,
      "loss": 1.6225,
      "num_input_tokens_seen": 16831282224,
      "step": 21393
    },
    {
      "epoch": 2.2696796095904945,
      "grad_norm": 0.540445861874412,
      "learning_rate": 4.574678950308996e-05,
      "loss": 1.6977,
      "num_input_tokens_seen": 16832068944,
      "step": 21394
    },
    {
      "epoch": 2.2697856991300656,
      "grad_norm": 0.4180976714989511,
      "learning_rate": 4.57464017341326e-05,
      "loss": 1.5893,
      "num_input_tokens_seen": 16832855744,
      "step": 21395
    },
    {
      "epoch": 2.269891788669637,
      "grad_norm": 0.5154952743670643,
      "learning_rate": 4.574601394914303e-05,
      "loss": 1.7076,
      "num_input_tokens_seen": 16833642448,
      "step": 21396
    },
    {
      "epoch": 2.2699978782092085,
      "grad_norm": 0.347931298787823,
      "learning_rate": 4.574562614812155e-05,
      "loss": 1.5416,
      "num_input_tokens_seen": 16834429280,
      "step": 21397
    },
    {
      "epoch": 2.27010396774878,
      "grad_norm": 0.42529705370089343,
      "learning_rate": 4.574523833106845e-05,
      "loss": 1.6851,
      "num_input_tokens_seen": 16835216096,
      "step": 21398
    },
    {
      "epoch": 2.2702100572883515,
      "grad_norm": 0.4620691256368157,
      "learning_rate": 4.5744850497984046e-05,
      "loss": 1.7864,
      "num_input_tokens_seen": 16836002768,
      "step": 21399
    },
    {
      "epoch": 2.270316146827923,
      "grad_norm": 0.4093035854763423,
      "learning_rate": 4.5744462648868625e-05,
      "loss": 1.601,
      "num_input_tokens_seen": 16836789520,
      "step": 21400
    },
    {
      "epoch": 2.2704222363674944,
      "grad_norm": 0.4335830143932302,
      "learning_rate": 4.57440747837225e-05,
      "loss": 1.6433,
      "num_input_tokens_seen": 16837576288,
      "step": 21401
    },
    {
      "epoch": 2.2705283259070654,
      "grad_norm": 0.4223844267282724,
      "learning_rate": 4.574368690254596e-05,
      "loss": 1.4752,
      "num_input_tokens_seen": 16838363072,
      "step": 21402
    },
    {
      "epoch": 2.270634415446637,
      "grad_norm": 0.38481095871389853,
      "learning_rate": 4.57432990053393e-05,
      "loss": 1.6375,
      "num_input_tokens_seen": 16839149888,
      "step": 21403
    },
    {
      "epoch": 2.2707405049862084,
      "grad_norm": 0.49013969674173247,
      "learning_rate": 4.5742911092102834e-05,
      "loss": 1.6784,
      "num_input_tokens_seen": 16839936640,
      "step": 21404
    },
    {
      "epoch": 2.27084659452578,
      "grad_norm": 0.3541854246107583,
      "learning_rate": 4.574252316283686e-05,
      "loss": 1.7121,
      "num_input_tokens_seen": 16840723424,
      "step": 21405
    },
    {
      "epoch": 2.2709526840653513,
      "grad_norm": 0.41124347707547343,
      "learning_rate": 4.574213521754166e-05,
      "loss": 1.6261,
      "num_input_tokens_seen": 16841510176,
      "step": 21406
    },
    {
      "epoch": 2.2710587736049224,
      "grad_norm": 0.40058148064576804,
      "learning_rate": 4.574174725621755e-05,
      "loss": 1.5653,
      "num_input_tokens_seen": 16842296976,
      "step": 21407
    },
    {
      "epoch": 2.271164863144494,
      "grad_norm": 0.4236730692733056,
      "learning_rate": 4.574135927886484e-05,
      "loss": 1.7285,
      "num_input_tokens_seen": 16843083712,
      "step": 21408
    },
    {
      "epoch": 2.2712709526840653,
      "grad_norm": 0.3707068870198479,
      "learning_rate": 4.5740971285483804e-05,
      "loss": 1.5658,
      "num_input_tokens_seen": 16843870480,
      "step": 21409
    },
    {
      "epoch": 2.271377042223637,
      "grad_norm": 0.48229453713203824,
      "learning_rate": 4.574058327607475e-05,
      "loss": 1.7253,
      "num_input_tokens_seen": 16844657200,
      "step": 21410
    },
    {
      "epoch": 2.2714831317632083,
      "grad_norm": 0.38969830610491685,
      "learning_rate": 4.5740195250637983e-05,
      "loss": 1.6519,
      "num_input_tokens_seen": 16845443840,
      "step": 21411
    },
    {
      "epoch": 2.2715892213027797,
      "grad_norm": 0.47945508868610853,
      "learning_rate": 4.5739807209173815e-05,
      "loss": 1.5201,
      "num_input_tokens_seen": 16846230656,
      "step": 21412
    },
    {
      "epoch": 2.2716953108423508,
      "grad_norm": 0.37815914880602525,
      "learning_rate": 4.5739419151682516e-05,
      "loss": 1.5892,
      "num_input_tokens_seen": 16847017408,
      "step": 21413
    },
    {
      "epoch": 2.2718014003819222,
      "grad_norm": 0.5047954516287353,
      "learning_rate": 4.573903107816441e-05,
      "loss": 1.5579,
      "num_input_tokens_seen": 16847804128,
      "step": 21414
    },
    {
      "epoch": 2.2719074899214937,
      "grad_norm": 0.41510933259666244,
      "learning_rate": 4.5738642988619794e-05,
      "loss": 1.6267,
      "num_input_tokens_seen": 16848590848,
      "step": 21415
    },
    {
      "epoch": 2.272013579461065,
      "grad_norm": 0.6461010686851865,
      "learning_rate": 4.573825488304896e-05,
      "loss": 1.7362,
      "num_input_tokens_seen": 16849377600,
      "step": 21416
    },
    {
      "epoch": 2.2721196690006367,
      "grad_norm": 0.38572524901958166,
      "learning_rate": 4.573786676145221e-05,
      "loss": 1.5547,
      "num_input_tokens_seen": 16850164336,
      "step": 21417
    },
    {
      "epoch": 2.272225758540208,
      "grad_norm": 0.5026219605926011,
      "learning_rate": 4.5737478623829845e-05,
      "loss": 1.617,
      "num_input_tokens_seen": 16850951184,
      "step": 21418
    },
    {
      "epoch": 2.272331848079779,
      "grad_norm": 0.4166337059876351,
      "learning_rate": 4.573709047018217e-05,
      "loss": 1.6553,
      "num_input_tokens_seen": 16851737952,
      "step": 21419
    },
    {
      "epoch": 2.2724379376193506,
      "grad_norm": 0.42528495597933924,
      "learning_rate": 4.5736702300509466e-05,
      "loss": 1.4883,
      "num_input_tokens_seen": 16852524816,
      "step": 21420
    },
    {
      "epoch": 2.272544027158922,
      "grad_norm": 0.4295878172994913,
      "learning_rate": 4.573631411481205e-05,
      "loss": 1.6401,
      "num_input_tokens_seen": 16853311488,
      "step": 21421
    },
    {
      "epoch": 2.2726501166984936,
      "grad_norm": 0.4813081234398587,
      "learning_rate": 4.5735925913090227e-05,
      "loss": 1.546,
      "num_input_tokens_seen": 16854098192,
      "step": 21422
    },
    {
      "epoch": 2.272756206238065,
      "grad_norm": 0.4745540055684058,
      "learning_rate": 4.5735537695344285e-05,
      "loss": 1.6372,
      "num_input_tokens_seen": 16854884928,
      "step": 21423
    },
    {
      "epoch": 2.272862295777636,
      "grad_norm": 0.5171379628154174,
      "learning_rate": 4.5735149461574534e-05,
      "loss": 1.7749,
      "num_input_tokens_seen": 16855671616,
      "step": 21424
    },
    {
      "epoch": 2.2729683853172076,
      "grad_norm": 0.45222040886246273,
      "learning_rate": 4.5734761211781264e-05,
      "loss": 1.6485,
      "num_input_tokens_seen": 16856458400,
      "step": 21425
    },
    {
      "epoch": 2.273074474856779,
      "grad_norm": 0.5027238939254146,
      "learning_rate": 4.573437294596477e-05,
      "loss": 1.6893,
      "num_input_tokens_seen": 16857245200,
      "step": 21426
    },
    {
      "epoch": 2.2731805643963505,
      "grad_norm": 0.4040339816182239,
      "learning_rate": 4.573398466412537e-05,
      "loss": 1.5474,
      "num_input_tokens_seen": 16858032016,
      "step": 21427
    },
    {
      "epoch": 2.273286653935922,
      "grad_norm": 0.38287492699882053,
      "learning_rate": 4.5733596366263356e-05,
      "loss": 1.5239,
      "num_input_tokens_seen": 16858818816,
      "step": 21428
    },
    {
      "epoch": 2.2733927434754935,
      "grad_norm": 0.4385682244564555,
      "learning_rate": 4.5733208052379026e-05,
      "loss": 1.5882,
      "num_input_tokens_seen": 16859605584,
      "step": 21429
    },
    {
      "epoch": 2.273498833015065,
      "grad_norm": 0.4305894342125397,
      "learning_rate": 4.573281972247268e-05,
      "loss": 1.5794,
      "num_input_tokens_seen": 16860392352,
      "step": 21430
    },
    {
      "epoch": 2.273604922554636,
      "grad_norm": 0.4596054005340634,
      "learning_rate": 4.573243137654462e-05,
      "loss": 1.7092,
      "num_input_tokens_seen": 16861179104,
      "step": 21431
    },
    {
      "epoch": 2.2737110120942075,
      "grad_norm": 0.4222067243713598,
      "learning_rate": 4.573204301459515e-05,
      "loss": 1.6792,
      "num_input_tokens_seen": 16861965936,
      "step": 21432
    },
    {
      "epoch": 2.273817101633779,
      "grad_norm": 0.4312098298617108,
      "learning_rate": 4.573165463662456e-05,
      "loss": 1.6201,
      "num_input_tokens_seen": 16862752592,
      "step": 21433
    },
    {
      "epoch": 2.2739231911733504,
      "grad_norm": 0.3723561150330238,
      "learning_rate": 4.573126624263315e-05,
      "loss": 1.7141,
      "num_input_tokens_seen": 16863539408,
      "step": 21434
    },
    {
      "epoch": 2.274029280712922,
      "grad_norm": 0.40246493095322533,
      "learning_rate": 4.5730877832621234e-05,
      "loss": 1.546,
      "num_input_tokens_seen": 16864326176,
      "step": 21435
    },
    {
      "epoch": 2.274135370252493,
      "grad_norm": 0.3937416570729358,
      "learning_rate": 4.5730489406589105e-05,
      "loss": 1.5811,
      "num_input_tokens_seen": 16865112944,
      "step": 21436
    },
    {
      "epoch": 2.2742414597920644,
      "grad_norm": 0.4026191619483896,
      "learning_rate": 4.5730100964537055e-05,
      "loss": 1.6436,
      "num_input_tokens_seen": 16865899680,
      "step": 21437
    },
    {
      "epoch": 2.274347549331636,
      "grad_norm": 0.44454859729726204,
      "learning_rate": 4.57297125064654e-05,
      "loss": 1.7315,
      "num_input_tokens_seen": 16866686432,
      "step": 21438
    },
    {
      "epoch": 2.2744536388712073,
      "grad_norm": 0.36386048415801375,
      "learning_rate": 4.572932403237442e-05,
      "loss": 1.6859,
      "num_input_tokens_seen": 16867473248,
      "step": 21439
    },
    {
      "epoch": 2.274559728410779,
      "grad_norm": 0.36114037905266244,
      "learning_rate": 4.572893554226443e-05,
      "loss": 1.5611,
      "num_input_tokens_seen": 16868260016,
      "step": 21440
    },
    {
      "epoch": 2.2746658179503503,
      "grad_norm": 0.40804830948052173,
      "learning_rate": 4.5728547036135736e-05,
      "loss": 1.4911,
      "num_input_tokens_seen": 16869046784,
      "step": 21441
    },
    {
      "epoch": 2.2747719074899213,
      "grad_norm": 0.38139399345521025,
      "learning_rate": 4.5728158513988624e-05,
      "loss": 1.546,
      "num_input_tokens_seen": 16869833520,
      "step": 21442
    },
    {
      "epoch": 2.274877997029493,
      "grad_norm": 0.4245143031298192,
      "learning_rate": 4.57277699758234e-05,
      "loss": 1.6549,
      "num_input_tokens_seen": 16870620352,
      "step": 21443
    },
    {
      "epoch": 2.2749840865690643,
      "grad_norm": 0.3908487245301312,
      "learning_rate": 4.572738142164036e-05,
      "loss": 1.654,
      "num_input_tokens_seen": 16871407120,
      "step": 21444
    },
    {
      "epoch": 2.2750901761086357,
      "grad_norm": 0.3344255989492689,
      "learning_rate": 4.572699285143981e-05,
      "loss": 1.4014,
      "num_input_tokens_seen": 16872193808,
      "step": 21445
    },
    {
      "epoch": 2.275196265648207,
      "grad_norm": 0.41978333459929096,
      "learning_rate": 4.5726604265222036e-05,
      "loss": 1.6732,
      "num_input_tokens_seen": 16872980592,
      "step": 21446
    },
    {
      "epoch": 2.2753023551877787,
      "grad_norm": 0.3473204302867966,
      "learning_rate": 4.572621566298737e-05,
      "loss": 1.4738,
      "num_input_tokens_seen": 16873767392,
      "step": 21447
    },
    {
      "epoch": 2.2754084447273497,
      "grad_norm": 0.4386857091141394,
      "learning_rate": 4.572582704473608e-05,
      "loss": 1.6375,
      "num_input_tokens_seen": 16874554192,
      "step": 21448
    },
    {
      "epoch": 2.275514534266921,
      "grad_norm": 0.3627750062102588,
      "learning_rate": 4.572543841046849e-05,
      "loss": 1.562,
      "num_input_tokens_seen": 16875340928,
      "step": 21449
    },
    {
      "epoch": 2.2756206238064927,
      "grad_norm": 0.4973259207965108,
      "learning_rate": 4.572504976018488e-05,
      "loss": 1.6754,
      "num_input_tokens_seen": 16876127712,
      "step": 21450
    },
    {
      "epoch": 2.275726713346064,
      "grad_norm": 0.3979451095102295,
      "learning_rate": 4.5724661093885565e-05,
      "loss": 1.5776,
      "num_input_tokens_seen": 16876914384,
      "step": 21451
    },
    {
      "epoch": 2.2758328028856356,
      "grad_norm": 0.4364396237354831,
      "learning_rate": 4.572427241157083e-05,
      "loss": 1.5501,
      "num_input_tokens_seen": 16877701152,
      "step": 21452
    },
    {
      "epoch": 2.2759388924252066,
      "grad_norm": 0.47493410763730926,
      "learning_rate": 4.5723883713241e-05,
      "loss": 1.5781,
      "num_input_tokens_seen": 16878487984,
      "step": 21453
    },
    {
      "epoch": 2.276044981964778,
      "grad_norm": 0.34977362818292396,
      "learning_rate": 4.572349499889635e-05,
      "loss": 1.4827,
      "num_input_tokens_seen": 16879274800,
      "step": 21454
    },
    {
      "epoch": 2.2761510715043496,
      "grad_norm": 0.7457123223548222,
      "learning_rate": 4.57231062685372e-05,
      "loss": 1.6914,
      "num_input_tokens_seen": 16880061472,
      "step": 21455
    },
    {
      "epoch": 2.276257161043921,
      "grad_norm": 0.40399907037026667,
      "learning_rate": 4.572271752216383e-05,
      "loss": 1.6622,
      "num_input_tokens_seen": 16880848192,
      "step": 21456
    },
    {
      "epoch": 2.2763632505834925,
      "grad_norm": 0.5953027823922602,
      "learning_rate": 4.5722328759776564e-05,
      "loss": 1.5515,
      "num_input_tokens_seen": 16881634896,
      "step": 21457
    },
    {
      "epoch": 2.276469340123064,
      "grad_norm": 0.3774239119725064,
      "learning_rate": 4.5721939981375686e-05,
      "loss": 1.569,
      "num_input_tokens_seen": 16882421696,
      "step": 21458
    },
    {
      "epoch": 2.2765754296626355,
      "grad_norm": 0.4282736054711982,
      "learning_rate": 4.5721551186961495e-05,
      "loss": 1.5831,
      "num_input_tokens_seen": 16883208480,
      "step": 21459
    },
    {
      "epoch": 2.2766815192022065,
      "grad_norm": 0.4220064954658616,
      "learning_rate": 4.57211623765343e-05,
      "loss": 1.5696,
      "num_input_tokens_seen": 16883995360,
      "step": 21460
    },
    {
      "epoch": 2.276787608741778,
      "grad_norm": 0.5184588532400022,
      "learning_rate": 4.5720773550094405e-05,
      "loss": 1.661,
      "num_input_tokens_seen": 16884782080,
      "step": 21461
    },
    {
      "epoch": 2.2768936982813495,
      "grad_norm": 0.3680171697566891,
      "learning_rate": 4.5720384707642095e-05,
      "loss": 1.6547,
      "num_input_tokens_seen": 16885568896,
      "step": 21462
    },
    {
      "epoch": 2.276999787820921,
      "grad_norm": 0.3606133525675094,
      "learning_rate": 4.571999584917769e-05,
      "loss": 1.433,
      "num_input_tokens_seen": 16886355648,
      "step": 21463
    },
    {
      "epoch": 2.2771058773604924,
      "grad_norm": 0.4248622618074034,
      "learning_rate": 4.5719606974701465e-05,
      "loss": 1.6306,
      "num_input_tokens_seen": 16887142432,
      "step": 21464
    },
    {
      "epoch": 2.2772119669000634,
      "grad_norm": 0.36683396424058046,
      "learning_rate": 4.571921808421375e-05,
      "loss": 1.6022,
      "num_input_tokens_seen": 16887929152,
      "step": 21465
    },
    {
      "epoch": 2.277318056439635,
      "grad_norm": 0.3591528186767415,
      "learning_rate": 4.571882917771483e-05,
      "loss": 1.5545,
      "num_input_tokens_seen": 16888716048,
      "step": 21466
    },
    {
      "epoch": 2.2774241459792064,
      "grad_norm": 0.3753644653335294,
      "learning_rate": 4.5718440255205e-05,
      "loss": 1.6362,
      "num_input_tokens_seen": 16889502912,
      "step": 21467
    },
    {
      "epoch": 2.277530235518778,
      "grad_norm": 0.3699485545181484,
      "learning_rate": 4.5718051316684577e-05,
      "loss": 1.6362,
      "num_input_tokens_seen": 16890289712,
      "step": 21468
    },
    {
      "epoch": 2.2776363250583493,
      "grad_norm": 0.4684317446575622,
      "learning_rate": 4.5717662362153836e-05,
      "loss": 1.7495,
      "num_input_tokens_seen": 16891076528,
      "step": 21469
    },
    {
      "epoch": 2.277742414597921,
      "grad_norm": 0.39121858889306993,
      "learning_rate": 4.57172733916131e-05,
      "loss": 1.7445,
      "num_input_tokens_seen": 16891863312,
      "step": 21470
    },
    {
      "epoch": 2.2778485041374923,
      "grad_norm": 0.38376733408950414,
      "learning_rate": 4.5716884405062674e-05,
      "loss": 1.4965,
      "num_input_tokens_seen": 16892649984,
      "step": 21471
    },
    {
      "epoch": 2.2779545936770633,
      "grad_norm": 0.3972133799336455,
      "learning_rate": 4.5716495402502835e-05,
      "loss": 1.5386,
      "num_input_tokens_seen": 16893436624,
      "step": 21472
    },
    {
      "epoch": 2.278060683216635,
      "grad_norm": 0.3600375197056026,
      "learning_rate": 4.5716106383933896e-05,
      "loss": 1.735,
      "num_input_tokens_seen": 16894223392,
      "step": 21473
    },
    {
      "epoch": 2.2781667727562063,
      "grad_norm": 0.3906775166270172,
      "learning_rate": 4.571571734935617e-05,
      "loss": 1.58,
      "num_input_tokens_seen": 16895010080,
      "step": 21474
    },
    {
      "epoch": 2.2782728622957777,
      "grad_norm": 0.405676423188635,
      "learning_rate": 4.5715328298769936e-05,
      "loss": 1.6644,
      "num_input_tokens_seen": 16895796800,
      "step": 21475
    },
    {
      "epoch": 2.278378951835349,
      "grad_norm": 0.3665891522733731,
      "learning_rate": 4.5714939232175504e-05,
      "loss": 1.6169,
      "num_input_tokens_seen": 16896583536,
      "step": 21476
    },
    {
      "epoch": 2.2784850413749203,
      "grad_norm": 0.4240152025002171,
      "learning_rate": 4.571455014957318e-05,
      "loss": 1.5966,
      "num_input_tokens_seen": 16897370400,
      "step": 21477
    },
    {
      "epoch": 2.2785911309144917,
      "grad_norm": 0.42821374021551956,
      "learning_rate": 4.571416105096326e-05,
      "loss": 1.5472,
      "num_input_tokens_seen": 16898157184,
      "step": 21478
    },
    {
      "epoch": 2.278697220454063,
      "grad_norm": 0.34710171201056134,
      "learning_rate": 4.5713771936346036e-05,
      "loss": 1.4871,
      "num_input_tokens_seen": 16898943936,
      "step": 21479
    },
    {
      "epoch": 2.2788033099936347,
      "grad_norm": 0.4049449285580127,
      "learning_rate": 4.5713382805721815e-05,
      "loss": 1.6202,
      "num_input_tokens_seen": 16899730656,
      "step": 21480
    },
    {
      "epoch": 2.278909399533206,
      "grad_norm": 0.4346540401206828,
      "learning_rate": 4.571299365909091e-05,
      "loss": 1.6492,
      "num_input_tokens_seen": 16900517312,
      "step": 21481
    },
    {
      "epoch": 2.279015489072777,
      "grad_norm": 0.41636713527256275,
      "learning_rate": 4.5712604496453604e-05,
      "loss": 1.6888,
      "num_input_tokens_seen": 16901304080,
      "step": 21482
    },
    {
      "epoch": 2.2791215786123487,
      "grad_norm": 0.3640989429896086,
      "learning_rate": 4.571221531781021e-05,
      "loss": 1.5522,
      "num_input_tokens_seen": 16902090800,
      "step": 21483
    },
    {
      "epoch": 2.27922766815192,
      "grad_norm": 0.3865903066241718,
      "learning_rate": 4.571182612316102e-05,
      "loss": 1.6004,
      "num_input_tokens_seen": 16902877616,
      "step": 21484
    },
    {
      "epoch": 2.2793337576914916,
      "grad_norm": 0.34682075551840297,
      "learning_rate": 4.571143691250635e-05,
      "loss": 1.5127,
      "num_input_tokens_seen": 16903664352,
      "step": 21485
    },
    {
      "epoch": 2.279439847231063,
      "grad_norm": 0.4053005454316211,
      "learning_rate": 4.571104768584647e-05,
      "loss": 1.787,
      "num_input_tokens_seen": 16904451088,
      "step": 21486
    },
    {
      "epoch": 2.2795459367706346,
      "grad_norm": 0.3726671011441951,
      "learning_rate": 4.5710658443181707e-05,
      "loss": 1.7081,
      "num_input_tokens_seen": 16905237808,
      "step": 21487
    },
    {
      "epoch": 2.279652026310206,
      "grad_norm": 0.36183923851007144,
      "learning_rate": 4.571026918451236e-05,
      "loss": 1.6949,
      "num_input_tokens_seen": 16906024528,
      "step": 21488
    },
    {
      "epoch": 2.279758115849777,
      "grad_norm": 0.40264999543258695,
      "learning_rate": 4.570987990983872e-05,
      "loss": 1.7541,
      "num_input_tokens_seen": 16906811152,
      "step": 21489
    },
    {
      "epoch": 2.2798642053893485,
      "grad_norm": 0.40604263628957177,
      "learning_rate": 4.5709490619161094e-05,
      "loss": 1.5656,
      "num_input_tokens_seen": 16907597792,
      "step": 21490
    },
    {
      "epoch": 2.27997029492892,
      "grad_norm": 0.41427165155385953,
      "learning_rate": 4.570910131247979e-05,
      "loss": 1.7485,
      "num_input_tokens_seen": 16908384448,
      "step": 21491
    },
    {
      "epoch": 2.2800763844684915,
      "grad_norm": 0.44360743522604473,
      "learning_rate": 4.570871198979508e-05,
      "loss": 1.6318,
      "num_input_tokens_seen": 16909171200,
      "step": 21492
    },
    {
      "epoch": 2.280182474008063,
      "grad_norm": 0.3939760989949734,
      "learning_rate": 4.57083226511073e-05,
      "loss": 1.6142,
      "num_input_tokens_seen": 16909958048,
      "step": 21493
    },
    {
      "epoch": 2.280288563547634,
      "grad_norm": 0.353395300216926,
      "learning_rate": 4.5707933296416734e-05,
      "loss": 1.5437,
      "num_input_tokens_seen": 16910744832,
      "step": 21494
    },
    {
      "epoch": 2.2803946530872055,
      "grad_norm": 0.5293395341663001,
      "learning_rate": 4.5707543925723684e-05,
      "loss": 1.5793,
      "num_input_tokens_seen": 16911531584,
      "step": 21495
    },
    {
      "epoch": 2.280500742626777,
      "grad_norm": 0.401285985052086,
      "learning_rate": 4.570715453902845e-05,
      "loss": 1.6314,
      "num_input_tokens_seen": 16912318352,
      "step": 21496
    },
    {
      "epoch": 2.2806068321663484,
      "grad_norm": 0.4215870189401689,
      "learning_rate": 4.5706765136331334e-05,
      "loss": 1.6519,
      "num_input_tokens_seen": 16913105088,
      "step": 21497
    },
    {
      "epoch": 2.28071292170592,
      "grad_norm": 0.48220628220079276,
      "learning_rate": 4.5706375717632644e-05,
      "loss": 1.6699,
      "num_input_tokens_seen": 16913891840,
      "step": 21498
    },
    {
      "epoch": 2.2808190112454914,
      "grad_norm": 0.4828277321627105,
      "learning_rate": 4.570598628293267e-05,
      "loss": 1.7709,
      "num_input_tokens_seen": 16914678448,
      "step": 21499
    },
    {
      "epoch": 2.280925100785063,
      "grad_norm": 0.4838211712649172,
      "learning_rate": 4.570559683223171e-05,
      "loss": 1.6451,
      "num_input_tokens_seen": 16915465104,
      "step": 21500
    },
    {
      "epoch": 2.281031190324634,
      "grad_norm": 0.49562234390541965,
      "learning_rate": 4.570520736553008e-05,
      "loss": 1.7442,
      "num_input_tokens_seen": 16916251824,
      "step": 21501
    },
    {
      "epoch": 2.2811372798642053,
      "grad_norm": 0.3842554063065586,
      "learning_rate": 4.5704817882828075e-05,
      "loss": 1.6535,
      "num_input_tokens_seen": 16917038576,
      "step": 21502
    },
    {
      "epoch": 2.281243369403777,
      "grad_norm": 0.3913182424038039,
      "learning_rate": 4.570442838412599e-05,
      "loss": 1.566,
      "num_input_tokens_seen": 16917825456,
      "step": 21503
    },
    {
      "epoch": 2.2813494589433483,
      "grad_norm": 0.3855680385260376,
      "learning_rate": 4.570403886942414e-05,
      "loss": 1.646,
      "num_input_tokens_seen": 16918612320,
      "step": 21504
    },
    {
      "epoch": 2.2814555484829198,
      "grad_norm": 0.37880301562710766,
      "learning_rate": 4.57036493387228e-05,
      "loss": 1.6206,
      "num_input_tokens_seen": 16919399120,
      "step": 21505
    },
    {
      "epoch": 2.281561638022491,
      "grad_norm": 0.42045432789034215,
      "learning_rate": 4.57032597920223e-05,
      "loss": 1.6252,
      "num_input_tokens_seen": 16920185920,
      "step": 21506
    },
    {
      "epoch": 2.2816677275620623,
      "grad_norm": 0.41470680264808607,
      "learning_rate": 4.570287022932292e-05,
      "loss": 1.5821,
      "num_input_tokens_seen": 16920972592,
      "step": 21507
    },
    {
      "epoch": 2.2817738171016337,
      "grad_norm": 0.43406818659673524,
      "learning_rate": 4.570248065062497e-05,
      "loss": 1.5846,
      "num_input_tokens_seen": 16921759408,
      "step": 21508
    },
    {
      "epoch": 2.281879906641205,
      "grad_norm": 0.36615305540904036,
      "learning_rate": 4.570209105592875e-05,
      "loss": 1.611,
      "num_input_tokens_seen": 16922546288,
      "step": 21509
    },
    {
      "epoch": 2.2819859961807767,
      "grad_norm": 0.5056576460738852,
      "learning_rate": 4.570170144523457e-05,
      "loss": 1.7261,
      "num_input_tokens_seen": 16923332976,
      "step": 21510
    },
    {
      "epoch": 2.282092085720348,
      "grad_norm": 0.3717664932259372,
      "learning_rate": 4.570131181854272e-05,
      "loss": 1.5951,
      "num_input_tokens_seen": 16924119680,
      "step": 21511
    },
    {
      "epoch": 2.282198175259919,
      "grad_norm": 0.4384291899395995,
      "learning_rate": 4.57009221758535e-05,
      "loss": 1.6276,
      "num_input_tokens_seen": 16924906416,
      "step": 21512
    },
    {
      "epoch": 2.2823042647994907,
      "grad_norm": 0.35090181684062755,
      "learning_rate": 4.5700532517167216e-05,
      "loss": 1.4134,
      "num_input_tokens_seen": 16925693216,
      "step": 21513
    },
    {
      "epoch": 2.282410354339062,
      "grad_norm": 0.404102617837611,
      "learning_rate": 4.570014284248417e-05,
      "loss": 1.5045,
      "num_input_tokens_seen": 16926480032,
      "step": 21514
    },
    {
      "epoch": 2.2825164438786336,
      "grad_norm": 0.4068191960241775,
      "learning_rate": 4.569975315180466e-05,
      "loss": 1.6405,
      "num_input_tokens_seen": 16927266704,
      "step": 21515
    },
    {
      "epoch": 2.282622533418205,
      "grad_norm": 0.39843839147339866,
      "learning_rate": 4.5699363445128984e-05,
      "loss": 1.4946,
      "num_input_tokens_seen": 16928053536,
      "step": 21516
    },
    {
      "epoch": 2.2827286229577766,
      "grad_norm": 0.34731945418767135,
      "learning_rate": 4.569897372245745e-05,
      "loss": 1.5931,
      "num_input_tokens_seen": 16928840352,
      "step": 21517
    },
    {
      "epoch": 2.2828347124973476,
      "grad_norm": 0.42075462788279727,
      "learning_rate": 4.569858398379036e-05,
      "loss": 1.8438,
      "num_input_tokens_seen": 16929627072,
      "step": 21518
    },
    {
      "epoch": 2.282940802036919,
      "grad_norm": 0.3399184630371985,
      "learning_rate": 4.5698194229128e-05,
      "loss": 1.5777,
      "num_input_tokens_seen": 16930413936,
      "step": 21519
    },
    {
      "epoch": 2.2830468915764905,
      "grad_norm": 0.3693528672467672,
      "learning_rate": 4.56978044584707e-05,
      "loss": 1.5469,
      "num_input_tokens_seen": 16931200640,
      "step": 21520
    },
    {
      "epoch": 2.283152981116062,
      "grad_norm": 0.35622376429532737,
      "learning_rate": 4.5697414671818726e-05,
      "loss": 1.4902,
      "num_input_tokens_seen": 16931987504,
      "step": 21521
    },
    {
      "epoch": 2.2832590706556335,
      "grad_norm": 0.38385928965349486,
      "learning_rate": 4.569702486917241e-05,
      "loss": 1.5566,
      "num_input_tokens_seen": 16932774288,
      "step": 21522
    },
    {
      "epoch": 2.2833651601952045,
      "grad_norm": 0.33202195326938644,
      "learning_rate": 4.5696635050532035e-05,
      "loss": 1.5227,
      "num_input_tokens_seen": 16933561008,
      "step": 21523
    },
    {
      "epoch": 2.283471249734776,
      "grad_norm": 0.3451626908802837,
      "learning_rate": 4.569624521589791e-05,
      "loss": 1.5428,
      "num_input_tokens_seen": 16934347824,
      "step": 21524
    },
    {
      "epoch": 2.2835773392743475,
      "grad_norm": 0.33551919209251574,
      "learning_rate": 4.5695855365270335e-05,
      "loss": 1.5746,
      "num_input_tokens_seen": 16935134624,
      "step": 21525
    },
    {
      "epoch": 2.283683428813919,
      "grad_norm": 0.3979210178116528,
      "learning_rate": 4.569546549864961e-05,
      "loss": 1.7429,
      "num_input_tokens_seen": 16935921472,
      "step": 21526
    },
    {
      "epoch": 2.2837895183534904,
      "grad_norm": 0.3659103515377347,
      "learning_rate": 4.569507561603603e-05,
      "loss": 1.5599,
      "num_input_tokens_seen": 16936708240,
      "step": 21527
    },
    {
      "epoch": 2.283895607893062,
      "grad_norm": 0.35778577023504793,
      "learning_rate": 4.569468571742991e-05,
      "loss": 1.5738,
      "num_input_tokens_seen": 16937495024,
      "step": 21528
    },
    {
      "epoch": 2.2840016974326334,
      "grad_norm": 0.32810188888249914,
      "learning_rate": 4.569429580283154e-05,
      "loss": 1.5385,
      "num_input_tokens_seen": 16938281744,
      "step": 21529
    },
    {
      "epoch": 2.2841077869722044,
      "grad_norm": 0.42979884663819573,
      "learning_rate": 4.569390587224123e-05,
      "loss": 1.7014,
      "num_input_tokens_seen": 16939068384,
      "step": 21530
    },
    {
      "epoch": 2.284213876511776,
      "grad_norm": 0.3858827745131614,
      "learning_rate": 4.5693515925659275e-05,
      "loss": 1.5775,
      "num_input_tokens_seen": 16939855184,
      "step": 21531
    },
    {
      "epoch": 2.2843199660513474,
      "grad_norm": 0.38727443863546357,
      "learning_rate": 4.569312596308598e-05,
      "loss": 1.6379,
      "num_input_tokens_seen": 16940642064,
      "step": 21532
    },
    {
      "epoch": 2.284426055590919,
      "grad_norm": 0.371595001604115,
      "learning_rate": 4.569273598452164e-05,
      "loss": 1.6408,
      "num_input_tokens_seen": 16941428848,
      "step": 21533
    },
    {
      "epoch": 2.2845321451304903,
      "grad_norm": 0.41829996604866315,
      "learning_rate": 4.5692345989966565e-05,
      "loss": 1.4978,
      "num_input_tokens_seen": 16942215712,
      "step": 21534
    },
    {
      "epoch": 2.2846382346700613,
      "grad_norm": 0.40734171216965553,
      "learning_rate": 4.5691955979421045e-05,
      "loss": 1.6994,
      "num_input_tokens_seen": 16943002512,
      "step": 21535
    },
    {
      "epoch": 2.284744324209633,
      "grad_norm": 0.37209083944303617,
      "learning_rate": 4.569156595288539e-05,
      "loss": 1.5979,
      "num_input_tokens_seen": 16943789216,
      "step": 21536
    },
    {
      "epoch": 2.2848504137492043,
      "grad_norm": 0.35562025370299194,
      "learning_rate": 4.569117591035991e-05,
      "loss": 1.5835,
      "num_input_tokens_seen": 16944576048,
      "step": 21537
    },
    {
      "epoch": 2.2849565032887758,
      "grad_norm": 0.42776408963469686,
      "learning_rate": 4.5690785851844886e-05,
      "loss": 1.6471,
      "num_input_tokens_seen": 16945362800,
      "step": 21538
    },
    {
      "epoch": 2.2850625928283472,
      "grad_norm": 0.35966789441402647,
      "learning_rate": 4.569039577734063e-05,
      "loss": 1.658,
      "num_input_tokens_seen": 16946149568,
      "step": 21539
    },
    {
      "epoch": 2.2851686823679187,
      "grad_norm": 0.36164317750889835,
      "learning_rate": 4.569000568684745e-05,
      "loss": 1.603,
      "num_input_tokens_seen": 16946936304,
      "step": 21540
    },
    {
      "epoch": 2.2852747719074897,
      "grad_norm": 0.3769411672455427,
      "learning_rate": 4.568961558036564e-05,
      "loss": 1.6279,
      "num_input_tokens_seen": 16947723120,
      "step": 21541
    },
    {
      "epoch": 2.285380861447061,
      "grad_norm": 0.40875730682301675,
      "learning_rate": 4.56892254578955e-05,
      "loss": 1.673,
      "num_input_tokens_seen": 16948509872,
      "step": 21542
    },
    {
      "epoch": 2.2854869509866327,
      "grad_norm": 0.3729464524339757,
      "learning_rate": 4.568883531943733e-05,
      "loss": 1.6482,
      "num_input_tokens_seen": 16949296624,
      "step": 21543
    },
    {
      "epoch": 2.285593040526204,
      "grad_norm": 0.35729805847746576,
      "learning_rate": 4.568844516499144e-05,
      "loss": 1.5709,
      "num_input_tokens_seen": 16950083440,
      "step": 21544
    },
    {
      "epoch": 2.2856991300657756,
      "grad_norm": 0.3912161334203388,
      "learning_rate": 4.568805499455812e-05,
      "loss": 1.5914,
      "num_input_tokens_seen": 16950870176,
      "step": 21545
    },
    {
      "epoch": 2.285805219605347,
      "grad_norm": 0.37177828893764153,
      "learning_rate": 4.5687664808137683e-05,
      "loss": 1.6612,
      "num_input_tokens_seen": 16951656960,
      "step": 21546
    },
    {
      "epoch": 2.285911309144918,
      "grad_norm": 0.3986123455445734,
      "learning_rate": 4.5687274605730426e-05,
      "loss": 1.5668,
      "num_input_tokens_seen": 16952443712,
      "step": 21547
    },
    {
      "epoch": 2.2860173986844896,
      "grad_norm": 0.3654036475049337,
      "learning_rate": 4.568688438733665e-05,
      "loss": 1.5355,
      "num_input_tokens_seen": 16953230512,
      "step": 21548
    },
    {
      "epoch": 2.286123488224061,
      "grad_norm": 0.4508540127991423,
      "learning_rate": 4.568649415295666e-05,
      "loss": 1.7382,
      "num_input_tokens_seen": 16954017200,
      "step": 21549
    },
    {
      "epoch": 2.2862295777636326,
      "grad_norm": 0.47593406029100516,
      "learning_rate": 4.568610390259075e-05,
      "loss": 1.7101,
      "num_input_tokens_seen": 16954803824,
      "step": 21550
    },
    {
      "epoch": 2.286335667303204,
      "grad_norm": 0.40739711535107,
      "learning_rate": 4.568571363623923e-05,
      "loss": 1.7274,
      "num_input_tokens_seen": 16955590480,
      "step": 21551
    },
    {
      "epoch": 2.286441756842775,
      "grad_norm": 0.3940907129570653,
      "learning_rate": 4.568532335390239e-05,
      "loss": 1.6801,
      "num_input_tokens_seen": 16956377232,
      "step": 21552
    },
    {
      "epoch": 2.2865478463823465,
      "grad_norm": 0.37723684106420263,
      "learning_rate": 4.5684933055580544e-05,
      "loss": 1.7361,
      "num_input_tokens_seen": 16957163952,
      "step": 21553
    },
    {
      "epoch": 2.286653935921918,
      "grad_norm": 0.3896307572322849,
      "learning_rate": 4.5684542741273987e-05,
      "loss": 1.614,
      "num_input_tokens_seen": 16957950752,
      "step": 21554
    },
    {
      "epoch": 2.2867600254614895,
      "grad_norm": 0.37439054046520465,
      "learning_rate": 4.568415241098302e-05,
      "loss": 1.5868,
      "num_input_tokens_seen": 16958737440,
      "step": 21555
    },
    {
      "epoch": 2.286866115001061,
      "grad_norm": 0.39295051647996665,
      "learning_rate": 4.568376206470795e-05,
      "loss": 1.6205,
      "num_input_tokens_seen": 16959524160,
      "step": 21556
    },
    {
      "epoch": 2.2869722045406324,
      "grad_norm": 0.3937005183373638,
      "learning_rate": 4.5683371702449076e-05,
      "loss": 1.6965,
      "num_input_tokens_seen": 16960311008,
      "step": 21557
    },
    {
      "epoch": 2.287078294080204,
      "grad_norm": 0.4044838498670892,
      "learning_rate": 4.56829813242067e-05,
      "loss": 1.7367,
      "num_input_tokens_seen": 16961097856,
      "step": 21558
    },
    {
      "epoch": 2.287184383619775,
      "grad_norm": 0.37887467996151847,
      "learning_rate": 4.568259092998112e-05,
      "loss": 1.568,
      "num_input_tokens_seen": 16961884640,
      "step": 21559
    },
    {
      "epoch": 2.2872904731593464,
      "grad_norm": 0.3756290972719586,
      "learning_rate": 4.568220051977264e-05,
      "loss": 1.5611,
      "num_input_tokens_seen": 16962671312,
      "step": 21560
    },
    {
      "epoch": 2.287396562698918,
      "grad_norm": 0.35139171216540754,
      "learning_rate": 4.568181009358157e-05,
      "loss": 1.5321,
      "num_input_tokens_seen": 16963458144,
      "step": 21561
    },
    {
      "epoch": 2.2875026522384894,
      "grad_norm": 0.3447580500945893,
      "learning_rate": 4.56814196514082e-05,
      "loss": 1.5861,
      "num_input_tokens_seen": 16964244944,
      "step": 21562
    },
    {
      "epoch": 2.287608741778061,
      "grad_norm": 0.457243627103689,
      "learning_rate": 4.5681029193252835e-05,
      "loss": 1.6471,
      "num_input_tokens_seen": 16965031696,
      "step": 21563
    },
    {
      "epoch": 2.287714831317632,
      "grad_norm": 0.3878185271475139,
      "learning_rate": 4.5680638719115775e-05,
      "loss": 1.5478,
      "num_input_tokens_seen": 16965818496,
      "step": 21564
    },
    {
      "epoch": 2.2878209208572033,
      "grad_norm": 0.3588667343422838,
      "learning_rate": 4.5680248228997324e-05,
      "loss": 1.6319,
      "num_input_tokens_seen": 16966605296,
      "step": 21565
    },
    {
      "epoch": 2.287927010396775,
      "grad_norm": 0.37185741159090496,
      "learning_rate": 4.567985772289779e-05,
      "loss": 1.6465,
      "num_input_tokens_seen": 16967392064,
      "step": 21566
    },
    {
      "epoch": 2.2880330999363463,
      "grad_norm": 0.41758883395388835,
      "learning_rate": 4.567946720081746e-05,
      "loss": 1.626,
      "num_input_tokens_seen": 16968178832,
      "step": 21567
    },
    {
      "epoch": 2.2881391894759178,
      "grad_norm": 0.3416458363070482,
      "learning_rate": 4.567907666275665e-05,
      "loss": 1.501,
      "num_input_tokens_seen": 16968965584,
      "step": 21568
    },
    {
      "epoch": 2.2882452790154892,
      "grad_norm": 0.4275548263686284,
      "learning_rate": 4.567868610871566e-05,
      "loss": 1.574,
      "num_input_tokens_seen": 16969752384,
      "step": 21569
    },
    {
      "epoch": 2.2883513685550607,
      "grad_norm": 0.38132706810551864,
      "learning_rate": 4.567829553869478e-05,
      "loss": 1.6479,
      "num_input_tokens_seen": 16970539184,
      "step": 21570
    },
    {
      "epoch": 2.2884574580946317,
      "grad_norm": 0.379009008297797,
      "learning_rate": 4.567790495269433e-05,
      "loss": 1.6688,
      "num_input_tokens_seen": 16971325888,
      "step": 21571
    },
    {
      "epoch": 2.288563547634203,
      "grad_norm": 0.4041364400012602,
      "learning_rate": 4.567751435071459e-05,
      "loss": 1.6274,
      "num_input_tokens_seen": 16972112592,
      "step": 21572
    },
    {
      "epoch": 2.2886696371737747,
      "grad_norm": 0.4495164629467651,
      "learning_rate": 4.5677123732755876e-05,
      "loss": 1.6555,
      "num_input_tokens_seen": 16972899392,
      "step": 21573
    },
    {
      "epoch": 2.288775726713346,
      "grad_norm": 0.4885609039798806,
      "learning_rate": 4.567673309881849e-05,
      "loss": 1.526,
      "num_input_tokens_seen": 16973686208,
      "step": 21574
    },
    {
      "epoch": 2.2888818162529176,
      "grad_norm": 0.3796787447936109,
      "learning_rate": 4.567634244890273e-05,
      "loss": 1.5617,
      "num_input_tokens_seen": 16974472928,
      "step": 21575
    },
    {
      "epoch": 2.2889879057924887,
      "grad_norm": 0.37814185232204417,
      "learning_rate": 4.5675951783008905e-05,
      "loss": 1.6976,
      "num_input_tokens_seen": 16975259776,
      "step": 21576
    },
    {
      "epoch": 2.28909399533206,
      "grad_norm": 0.3689433259929602,
      "learning_rate": 4.567556110113731e-05,
      "loss": 1.596,
      "num_input_tokens_seen": 16976046512,
      "step": 21577
    },
    {
      "epoch": 2.2892000848716316,
      "grad_norm": 0.4141772154808101,
      "learning_rate": 4.567517040328825e-05,
      "loss": 1.7155,
      "num_input_tokens_seen": 16976833312,
      "step": 21578
    },
    {
      "epoch": 2.289306174411203,
      "grad_norm": 0.36057604962687195,
      "learning_rate": 4.567477968946201e-05,
      "loss": 1.5477,
      "num_input_tokens_seen": 16977620080,
      "step": 21579
    },
    {
      "epoch": 2.2894122639507746,
      "grad_norm": 0.48821676811841563,
      "learning_rate": 4.567438895965892e-05,
      "loss": 1.6451,
      "num_input_tokens_seen": 16978406832,
      "step": 21580
    },
    {
      "epoch": 2.2895183534903456,
      "grad_norm": 0.4007980225844915,
      "learning_rate": 4.5673998213879266e-05,
      "loss": 1.6615,
      "num_input_tokens_seen": 16979193552,
      "step": 21581
    },
    {
      "epoch": 2.289624443029917,
      "grad_norm": 0.5358468067411625,
      "learning_rate": 4.567360745212336e-05,
      "loss": 1.7202,
      "num_input_tokens_seen": 16979980384,
      "step": 21582
    },
    {
      "epoch": 2.2897305325694886,
      "grad_norm": 0.3649935459541043,
      "learning_rate": 4.5673216674391484e-05,
      "loss": 1.6555,
      "num_input_tokens_seen": 16980767072,
      "step": 21583
    },
    {
      "epoch": 2.28983662210906,
      "grad_norm": 0.4285704318633894,
      "learning_rate": 4.5672825880683956e-05,
      "loss": 1.6136,
      "num_input_tokens_seen": 16981553888,
      "step": 21584
    },
    {
      "epoch": 2.2899427116486315,
      "grad_norm": 0.4207975802723192,
      "learning_rate": 4.567243507100108e-05,
      "loss": 1.6739,
      "num_input_tokens_seen": 16982340624,
      "step": 21585
    },
    {
      "epoch": 2.290048801188203,
      "grad_norm": 0.40262799570741753,
      "learning_rate": 4.567204424534315e-05,
      "loss": 1.6478,
      "num_input_tokens_seen": 16983127328,
      "step": 21586
    },
    {
      "epoch": 2.2901548907277745,
      "grad_norm": 0.4878968700800559,
      "learning_rate": 4.567165340371047e-05,
      "loss": 1.6159,
      "num_input_tokens_seen": 16983914032,
      "step": 21587
    },
    {
      "epoch": 2.2902609802673455,
      "grad_norm": 0.49296040244774564,
      "learning_rate": 4.5671262546103344e-05,
      "loss": 1.5587,
      "num_input_tokens_seen": 16984700720,
      "step": 21588
    },
    {
      "epoch": 2.290367069806917,
      "grad_norm": 0.41847514452862705,
      "learning_rate": 4.567087167252207e-05,
      "loss": 1.7113,
      "num_input_tokens_seen": 16985487488,
      "step": 21589
    },
    {
      "epoch": 2.2904731593464884,
      "grad_norm": 0.3524487199441088,
      "learning_rate": 4.5670480782966954e-05,
      "loss": 1.5417,
      "num_input_tokens_seen": 16986274336,
      "step": 21590
    },
    {
      "epoch": 2.29057924888606,
      "grad_norm": 0.35666623200519654,
      "learning_rate": 4.56700898774383e-05,
      "loss": 1.5662,
      "num_input_tokens_seen": 16987061136,
      "step": 21591
    },
    {
      "epoch": 2.2906853384256314,
      "grad_norm": 0.37112292420509296,
      "learning_rate": 4.56696989559364e-05,
      "loss": 1.5292,
      "num_input_tokens_seen": 16987847872,
      "step": 21592
    },
    {
      "epoch": 2.2907914279652024,
      "grad_norm": 0.4907941700915644,
      "learning_rate": 4.566930801846157e-05,
      "loss": 1.6796,
      "num_input_tokens_seen": 16988634656,
      "step": 21593
    },
    {
      "epoch": 2.290897517504774,
      "grad_norm": 0.35930563356167133,
      "learning_rate": 4.566891706501411e-05,
      "loss": 1.5057,
      "num_input_tokens_seen": 16989421376,
      "step": 21594
    },
    {
      "epoch": 2.2910036070443454,
      "grad_norm": 0.40284318105782563,
      "learning_rate": 4.5668526095594305e-05,
      "loss": 1.6729,
      "num_input_tokens_seen": 16990208128,
      "step": 21595
    },
    {
      "epoch": 2.291109696583917,
      "grad_norm": 0.40643583682705536,
      "learning_rate": 4.5668135110202476e-05,
      "loss": 1.6952,
      "num_input_tokens_seen": 16990994864,
      "step": 21596
    },
    {
      "epoch": 2.2912157861234883,
      "grad_norm": 0.3703433627494523,
      "learning_rate": 4.566774410883892e-05,
      "loss": 1.7383,
      "num_input_tokens_seen": 16991781616,
      "step": 21597
    },
    {
      "epoch": 2.29132187566306,
      "grad_norm": 0.4125963518660418,
      "learning_rate": 4.566735309150393e-05,
      "loss": 1.6312,
      "num_input_tokens_seen": 16992568352,
      "step": 21598
    },
    {
      "epoch": 2.2914279652026313,
      "grad_norm": 0.40119227643112115,
      "learning_rate": 4.566696205819783e-05,
      "loss": 1.5724,
      "num_input_tokens_seen": 16993355120,
      "step": 21599
    },
    {
      "epoch": 2.2915340547422023,
      "grad_norm": 0.4443667143942789,
      "learning_rate": 4.566657100892089e-05,
      "loss": 1.6539,
      "num_input_tokens_seen": 16994141904,
      "step": 21600
    },
    {
      "epoch": 2.2916401442817738,
      "grad_norm": 0.5449670348153027,
      "learning_rate": 4.5666179943673446e-05,
      "loss": 1.6793,
      "num_input_tokens_seen": 16994928688,
      "step": 21601
    },
    {
      "epoch": 2.2917462338213452,
      "grad_norm": 0.3929397931208437,
      "learning_rate": 4.566578886245578e-05,
      "loss": 1.5199,
      "num_input_tokens_seen": 16995715440,
      "step": 21602
    },
    {
      "epoch": 2.2918523233609167,
      "grad_norm": 0.47511572510243294,
      "learning_rate": 4.566539776526819e-05,
      "loss": 1.7093,
      "num_input_tokens_seen": 16996502160,
      "step": 21603
    },
    {
      "epoch": 2.291958412900488,
      "grad_norm": 0.3603420718126503,
      "learning_rate": 4.5665006652110995e-05,
      "loss": 1.597,
      "num_input_tokens_seen": 16997288976,
      "step": 21604
    },
    {
      "epoch": 2.292064502440059,
      "grad_norm": 0.39124801003694,
      "learning_rate": 4.5664615522984485e-05,
      "loss": 1.6528,
      "num_input_tokens_seen": 16998075792,
      "step": 21605
    },
    {
      "epoch": 2.2921705919796307,
      "grad_norm": 0.41225617141330984,
      "learning_rate": 4.566422437788898e-05,
      "loss": 1.5813,
      "num_input_tokens_seen": 16998862656,
      "step": 21606
    },
    {
      "epoch": 2.292276681519202,
      "grad_norm": 0.41605502499281305,
      "learning_rate": 4.566383321682476e-05,
      "loss": 1.5807,
      "num_input_tokens_seen": 16999649424,
      "step": 21607
    },
    {
      "epoch": 2.2923827710587736,
      "grad_norm": 0.35881325537929093,
      "learning_rate": 4.5663442039792126e-05,
      "loss": 1.6049,
      "num_input_tokens_seen": 17000436208,
      "step": 21608
    },
    {
      "epoch": 2.292488860598345,
      "grad_norm": 0.36142254393874124,
      "learning_rate": 4.56630508467914e-05,
      "loss": 1.6018,
      "num_input_tokens_seen": 17001222992,
      "step": 21609
    },
    {
      "epoch": 2.2925949501379166,
      "grad_norm": 0.43723495877259677,
      "learning_rate": 4.566265963782288e-05,
      "loss": 1.6199,
      "num_input_tokens_seen": 17002009712,
      "step": 21610
    },
    {
      "epoch": 2.2927010396774876,
      "grad_norm": 0.516870905691668,
      "learning_rate": 4.566226841288686e-05,
      "loss": 1.5753,
      "num_input_tokens_seen": 17002796528,
      "step": 21611
    },
    {
      "epoch": 2.292807129217059,
      "grad_norm": 0.3852575892250234,
      "learning_rate": 4.566187717198364e-05,
      "loss": 1.6341,
      "num_input_tokens_seen": 17003583360,
      "step": 21612
    },
    {
      "epoch": 2.2929132187566306,
      "grad_norm": 0.4161862000284491,
      "learning_rate": 4.566148591511352e-05,
      "loss": 1.6781,
      "num_input_tokens_seen": 17004370080,
      "step": 21613
    },
    {
      "epoch": 2.293019308296202,
      "grad_norm": 0.41416856928286555,
      "learning_rate": 4.5661094642276826e-05,
      "loss": 1.5207,
      "num_input_tokens_seen": 17005156896,
      "step": 21614
    },
    {
      "epoch": 2.2931253978357735,
      "grad_norm": 0.41677751722490636,
      "learning_rate": 4.566070335347383e-05,
      "loss": 1.6209,
      "num_input_tokens_seen": 17005943696,
      "step": 21615
    },
    {
      "epoch": 2.293231487375345,
      "grad_norm": 0.3698106154879122,
      "learning_rate": 4.5660312048704855e-05,
      "loss": 1.5947,
      "num_input_tokens_seen": 17006730496,
      "step": 21616
    },
    {
      "epoch": 2.293337576914916,
      "grad_norm": 0.5444201227948897,
      "learning_rate": 4.565992072797021e-05,
      "loss": 1.4987,
      "num_input_tokens_seen": 17007517248,
      "step": 21617
    },
    {
      "epoch": 2.2934436664544875,
      "grad_norm": 0.3735324425452749,
      "learning_rate": 4.5659529391270165e-05,
      "loss": 1.6031,
      "num_input_tokens_seen": 17008303984,
      "step": 21618
    },
    {
      "epoch": 2.293549755994059,
      "grad_norm": 0.4886399693546949,
      "learning_rate": 4.5659138038605046e-05,
      "loss": 1.4817,
      "num_input_tokens_seen": 17009090832,
      "step": 21619
    },
    {
      "epoch": 2.2936558455336304,
      "grad_norm": 0.4104076358977962,
      "learning_rate": 4.565874666997516e-05,
      "loss": 1.5996,
      "num_input_tokens_seen": 17009877648,
      "step": 21620
    },
    {
      "epoch": 2.293761935073202,
      "grad_norm": 0.4031836418084109,
      "learning_rate": 4.5658355285380796e-05,
      "loss": 1.5662,
      "num_input_tokens_seen": 17010664464,
      "step": 21621
    },
    {
      "epoch": 2.293868024612773,
      "grad_norm": 0.45375020687795764,
      "learning_rate": 4.565796388482226e-05,
      "loss": 1.6445,
      "num_input_tokens_seen": 17011451360,
      "step": 21622
    },
    {
      "epoch": 2.2939741141523444,
      "grad_norm": 0.3840469199243867,
      "learning_rate": 4.5657572468299856e-05,
      "loss": 1.4641,
      "num_input_tokens_seen": 17012238144,
      "step": 21623
    },
    {
      "epoch": 2.294080203691916,
      "grad_norm": 0.44100711312427265,
      "learning_rate": 4.565718103581389e-05,
      "loss": 1.6625,
      "num_input_tokens_seen": 17013024944,
      "step": 21624
    },
    {
      "epoch": 2.2941862932314874,
      "grad_norm": 0.3822995990279328,
      "learning_rate": 4.565678958736466e-05,
      "loss": 1.4776,
      "num_input_tokens_seen": 17013811664,
      "step": 21625
    },
    {
      "epoch": 2.294292382771059,
      "grad_norm": 0.3428798883009144,
      "learning_rate": 4.5656398122952457e-05,
      "loss": 1.544,
      "num_input_tokens_seen": 17014598528,
      "step": 21626
    },
    {
      "epoch": 2.2943984723106303,
      "grad_norm": 0.3921498367322375,
      "learning_rate": 4.5656006642577606e-05,
      "loss": 1.5405,
      "num_input_tokens_seen": 17015385328,
      "step": 21627
    },
    {
      "epoch": 2.294504561850202,
      "grad_norm": 0.36484429073300356,
      "learning_rate": 4.56556151462404e-05,
      "loss": 1.6158,
      "num_input_tokens_seen": 17016172160,
      "step": 21628
    },
    {
      "epoch": 2.294610651389773,
      "grad_norm": 0.3664854213247801,
      "learning_rate": 4.5655223633941134e-05,
      "loss": 1.6128,
      "num_input_tokens_seen": 17016958976,
      "step": 21629
    },
    {
      "epoch": 2.2947167409293443,
      "grad_norm": 0.3388798487920417,
      "learning_rate": 4.565483210568012e-05,
      "loss": 1.6347,
      "num_input_tokens_seen": 17017745712,
      "step": 21630
    },
    {
      "epoch": 2.2948228304689158,
      "grad_norm": 0.3951368417129452,
      "learning_rate": 4.565444056145767e-05,
      "loss": 1.5874,
      "num_input_tokens_seen": 17018532576,
      "step": 21631
    },
    {
      "epoch": 2.2949289200084872,
      "grad_norm": 0.41399103187044806,
      "learning_rate": 4.565404900127406e-05,
      "loss": 1.6751,
      "num_input_tokens_seen": 17019319312,
      "step": 21632
    },
    {
      "epoch": 2.2950350095480587,
      "grad_norm": 0.38080174884741813,
      "learning_rate": 4.5653657425129606e-05,
      "loss": 1.7019,
      "num_input_tokens_seen": 17020106080,
      "step": 21633
    },
    {
      "epoch": 2.2951410990876298,
      "grad_norm": 0.4451574948242774,
      "learning_rate": 4.5653265833024625e-05,
      "loss": 1.6933,
      "num_input_tokens_seen": 17020892944,
      "step": 21634
    },
    {
      "epoch": 2.2952471886272012,
      "grad_norm": 0.34316486444248345,
      "learning_rate": 4.5652874224959395e-05,
      "loss": 1.6058,
      "num_input_tokens_seen": 17021679744,
      "step": 21635
    },
    {
      "epoch": 2.2953532781667727,
      "grad_norm": 0.44361826225011997,
      "learning_rate": 4.5652482600934234e-05,
      "loss": 1.5072,
      "num_input_tokens_seen": 17022466528,
      "step": 21636
    },
    {
      "epoch": 2.295459367706344,
      "grad_norm": 0.4310330518408631,
      "learning_rate": 4.5652090960949435e-05,
      "loss": 1.5749,
      "num_input_tokens_seen": 17023253296,
      "step": 21637
    },
    {
      "epoch": 2.2955654572459157,
      "grad_norm": 0.36209518503910426,
      "learning_rate": 4.5651699305005315e-05,
      "loss": 1.5954,
      "num_input_tokens_seen": 17024040048,
      "step": 21638
    },
    {
      "epoch": 2.295671546785487,
      "grad_norm": 0.5108520642862427,
      "learning_rate": 4.565130763310216e-05,
      "loss": 1.6533,
      "num_input_tokens_seen": 17024826800,
      "step": 21639
    },
    {
      "epoch": 2.295777636325058,
      "grad_norm": 0.36438891856146144,
      "learning_rate": 4.565091594524028e-05,
      "loss": 1.6225,
      "num_input_tokens_seen": 17025613520,
      "step": 21640
    },
    {
      "epoch": 2.2958837258646296,
      "grad_norm": 0.37700449792535656,
      "learning_rate": 4.565052424141999e-05,
      "loss": 1.6058,
      "num_input_tokens_seen": 17026400288,
      "step": 21641
    },
    {
      "epoch": 2.295989815404201,
      "grad_norm": 0.39229026006600337,
      "learning_rate": 4.565013252164157e-05,
      "loss": 1.676,
      "num_input_tokens_seen": 17027186992,
      "step": 21642
    },
    {
      "epoch": 2.2960959049437726,
      "grad_norm": 0.40913269291928667,
      "learning_rate": 4.564974078590533e-05,
      "loss": 1.6234,
      "num_input_tokens_seen": 17027973728,
      "step": 21643
    },
    {
      "epoch": 2.296201994483344,
      "grad_norm": 0.3666093603813854,
      "learning_rate": 4.5649349034211584e-05,
      "loss": 1.6395,
      "num_input_tokens_seen": 17028760496,
      "step": 21644
    },
    {
      "epoch": 2.2963080840229155,
      "grad_norm": 0.4372160982259043,
      "learning_rate": 4.564895726656062e-05,
      "loss": 1.6442,
      "num_input_tokens_seen": 17029547312,
      "step": 21645
    },
    {
      "epoch": 2.2964141735624866,
      "grad_norm": 0.37858902666076244,
      "learning_rate": 4.5648565482952755e-05,
      "loss": 1.649,
      "num_input_tokens_seen": 17030334016,
      "step": 21646
    },
    {
      "epoch": 2.296520263102058,
      "grad_norm": 0.5704917993561599,
      "learning_rate": 4.564817368338828e-05,
      "loss": 1.6151,
      "num_input_tokens_seen": 17031120768,
      "step": 21647
    },
    {
      "epoch": 2.2966263526416295,
      "grad_norm": 0.35444845784382295,
      "learning_rate": 4.5647781867867506e-05,
      "loss": 1.4471,
      "num_input_tokens_seen": 17031907632,
      "step": 21648
    },
    {
      "epoch": 2.296732442181201,
      "grad_norm": 0.3917164219454429,
      "learning_rate": 4.564739003639073e-05,
      "loss": 1.7129,
      "num_input_tokens_seen": 17032694352,
      "step": 21649
    },
    {
      "epoch": 2.2968385317207725,
      "grad_norm": 0.4514081283095673,
      "learning_rate": 4.564699818895826e-05,
      "loss": 1.6685,
      "num_input_tokens_seen": 17033481104,
      "step": 21650
    },
    {
      "epoch": 2.2969446212603435,
      "grad_norm": 0.3768609963453716,
      "learning_rate": 4.564660632557039e-05,
      "loss": 1.6373,
      "num_input_tokens_seen": 17034267824,
      "step": 21651
    },
    {
      "epoch": 2.297050710799915,
      "grad_norm": 0.4171266020656491,
      "learning_rate": 4.564621444622743e-05,
      "loss": 1.6214,
      "num_input_tokens_seen": 17035054672,
      "step": 21652
    },
    {
      "epoch": 2.2971568003394864,
      "grad_norm": 0.37845116722177097,
      "learning_rate": 4.5645822550929686e-05,
      "loss": 1.4968,
      "num_input_tokens_seen": 17035841472,
      "step": 21653
    },
    {
      "epoch": 2.297262889879058,
      "grad_norm": 0.47411926610998517,
      "learning_rate": 4.564543063967745e-05,
      "loss": 1.5903,
      "num_input_tokens_seen": 17036628256,
      "step": 21654
    },
    {
      "epoch": 2.2973689794186294,
      "grad_norm": 0.3681673499711011,
      "learning_rate": 4.5645038712471035e-05,
      "loss": 1.6086,
      "num_input_tokens_seen": 17037415136,
      "step": 21655
    },
    {
      "epoch": 2.297475068958201,
      "grad_norm": 0.4141017239960676,
      "learning_rate": 4.564464676931074e-05,
      "loss": 1.6143,
      "num_input_tokens_seen": 17038201920,
      "step": 21656
    },
    {
      "epoch": 2.2975811584977723,
      "grad_norm": 0.43788336454381105,
      "learning_rate": 4.564425481019686e-05,
      "loss": 1.5952,
      "num_input_tokens_seen": 17038988704,
      "step": 21657
    },
    {
      "epoch": 2.2976872480373434,
      "grad_norm": 0.3443676822148887,
      "learning_rate": 4.5643862835129716e-05,
      "loss": 1.5707,
      "num_input_tokens_seen": 17039775472,
      "step": 21658
    },
    {
      "epoch": 2.297793337576915,
      "grad_norm": 0.5122469127432995,
      "learning_rate": 4.5643470844109595e-05,
      "loss": 1.6333,
      "num_input_tokens_seen": 17040562160,
      "step": 21659
    },
    {
      "epoch": 2.2978994271164863,
      "grad_norm": 0.36082028043660264,
      "learning_rate": 4.564307883713681e-05,
      "loss": 1.504,
      "num_input_tokens_seen": 17041348944,
      "step": 21660
    },
    {
      "epoch": 2.298005516656058,
      "grad_norm": 0.42720291044193504,
      "learning_rate": 4.564268681421166e-05,
      "loss": 1.5821,
      "num_input_tokens_seen": 17042135728,
      "step": 21661
    },
    {
      "epoch": 2.2981116061956293,
      "grad_norm": 0.5110179889323659,
      "learning_rate": 4.564229477533444e-05,
      "loss": 1.4943,
      "num_input_tokens_seen": 17042922576,
      "step": 21662
    },
    {
      "epoch": 2.2982176957352003,
      "grad_norm": 0.4753587578309999,
      "learning_rate": 4.5641902720505456e-05,
      "loss": 1.7378,
      "num_input_tokens_seen": 17043709392,
      "step": 21663
    },
    {
      "epoch": 2.2983237852747718,
      "grad_norm": 0.5560025678011968,
      "learning_rate": 4.5641510649725025e-05,
      "loss": 1.6116,
      "num_input_tokens_seen": 17044496192,
      "step": 21664
    },
    {
      "epoch": 2.2984298748143432,
      "grad_norm": 0.44954122564913496,
      "learning_rate": 4.5641118562993433e-05,
      "loss": 1.5294,
      "num_input_tokens_seen": 17045282992,
      "step": 21665
    },
    {
      "epoch": 2.2985359643539147,
      "grad_norm": 0.43492837420814306,
      "learning_rate": 4.5640726460311e-05,
      "loss": 1.5803,
      "num_input_tokens_seen": 17046069760,
      "step": 21666
    },
    {
      "epoch": 2.298642053893486,
      "grad_norm": 0.46016577427522576,
      "learning_rate": 4.564033434167802e-05,
      "loss": 1.7064,
      "num_input_tokens_seen": 17046856592,
      "step": 21667
    },
    {
      "epoch": 2.2987481434330577,
      "grad_norm": 0.4406184248189628,
      "learning_rate": 4.563994220709479e-05,
      "loss": 1.6307,
      "num_input_tokens_seen": 17047643312,
      "step": 21668
    },
    {
      "epoch": 2.298854232972629,
      "grad_norm": 0.3773424058762843,
      "learning_rate": 4.5639550056561613e-05,
      "loss": 1.5655,
      "num_input_tokens_seen": 17048430080,
      "step": 21669
    },
    {
      "epoch": 2.2989603225122,
      "grad_norm": 0.4328007410957043,
      "learning_rate": 4.563915789007881e-05,
      "loss": 1.6376,
      "num_input_tokens_seen": 17049216880,
      "step": 21670
    },
    {
      "epoch": 2.2990664120517716,
      "grad_norm": 0.35930886150436425,
      "learning_rate": 4.563876570764666e-05,
      "loss": 1.7593,
      "num_input_tokens_seen": 17050003632,
      "step": 21671
    },
    {
      "epoch": 2.299172501591343,
      "grad_norm": 0.38335607301441743,
      "learning_rate": 4.5638373509265474e-05,
      "loss": 1.48,
      "num_input_tokens_seen": 17050790448,
      "step": 21672
    },
    {
      "epoch": 2.2992785911309146,
      "grad_norm": 0.4500525110588,
      "learning_rate": 4.563798129493557e-05,
      "loss": 1.7438,
      "num_input_tokens_seen": 17051577120,
      "step": 21673
    },
    {
      "epoch": 2.299384680670486,
      "grad_norm": 0.5406747786953423,
      "learning_rate": 4.563758906465724e-05,
      "loss": 1.5643,
      "num_input_tokens_seen": 17052363904,
      "step": 21674
    },
    {
      "epoch": 2.299490770210057,
      "grad_norm": 0.35531035351313833,
      "learning_rate": 4.563719681843078e-05,
      "loss": 1.4868,
      "num_input_tokens_seen": 17053150640,
      "step": 21675
    },
    {
      "epoch": 2.2995968597496286,
      "grad_norm": 0.6567192515503137,
      "learning_rate": 4.56368045562565e-05,
      "loss": 1.7042,
      "num_input_tokens_seen": 17053937376,
      "step": 21676
    },
    {
      "epoch": 2.2997029492892,
      "grad_norm": 0.49544593643281815,
      "learning_rate": 4.56364122781347e-05,
      "loss": 1.6573,
      "num_input_tokens_seen": 17054724080,
      "step": 21677
    },
    {
      "epoch": 2.2998090388287715,
      "grad_norm": 0.4110887512154442,
      "learning_rate": 4.5636019984065694e-05,
      "loss": 1.7356,
      "num_input_tokens_seen": 17055510832,
      "step": 21678
    },
    {
      "epoch": 2.299915128368343,
      "grad_norm": 0.5162348852251805,
      "learning_rate": 4.563562767404977e-05,
      "loss": 1.6493,
      "num_input_tokens_seen": 17056297584,
      "step": 21679
    },
    {
      "epoch": 2.3000212179079145,
      "grad_norm": 0.3829565486958158,
      "learning_rate": 4.563523534808724e-05,
      "loss": 1.6166,
      "num_input_tokens_seen": 17057084368,
      "step": 21680
    },
    {
      "epoch": 2.3001273074474855,
      "grad_norm": 0.4685670751557712,
      "learning_rate": 4.563484300617842e-05,
      "loss": 1.5313,
      "num_input_tokens_seen": 17057871088,
      "step": 21681
    },
    {
      "epoch": 2.300233396987057,
      "grad_norm": 0.39615867627315693,
      "learning_rate": 4.563445064832358e-05,
      "loss": 1.574,
      "num_input_tokens_seen": 17058657792,
      "step": 21682
    },
    {
      "epoch": 2.3003394865266285,
      "grad_norm": 0.4838020020208414,
      "learning_rate": 4.563405827452305e-05,
      "loss": 1.705,
      "num_input_tokens_seen": 17059444512,
      "step": 21683
    },
    {
      "epoch": 2.3004455760662,
      "grad_norm": 0.5853760015358133,
      "learning_rate": 4.563366588477712e-05,
      "loss": 1.6855,
      "num_input_tokens_seen": 17060231312,
      "step": 21684
    },
    {
      "epoch": 2.3005516656057714,
      "grad_norm": 0.45860414461507887,
      "learning_rate": 4.5633273479086106e-05,
      "loss": 1.5667,
      "num_input_tokens_seen": 17061018112,
      "step": 21685
    },
    {
      "epoch": 2.300657755145343,
      "grad_norm": 0.5782021134372556,
      "learning_rate": 4.5632881057450304e-05,
      "loss": 1.7552,
      "num_input_tokens_seen": 17061804800,
      "step": 21686
    },
    {
      "epoch": 2.300763844684914,
      "grad_norm": 0.4028433024723324,
      "learning_rate": 4.563248861987001e-05,
      "loss": 1.7591,
      "num_input_tokens_seen": 17062591536,
      "step": 21687
    },
    {
      "epoch": 2.3008699342244854,
      "grad_norm": 0.5636709185017302,
      "learning_rate": 4.5632096166345536e-05,
      "loss": 1.6407,
      "num_input_tokens_seen": 17063378304,
      "step": 21688
    },
    {
      "epoch": 2.300976023764057,
      "grad_norm": 0.38367598266389324,
      "learning_rate": 4.563170369687718e-05,
      "loss": 1.5658,
      "num_input_tokens_seen": 17064165072,
      "step": 21689
    },
    {
      "epoch": 2.3010821133036283,
      "grad_norm": 0.49780824924451367,
      "learning_rate": 4.563131121146526e-05,
      "loss": 1.7488,
      "num_input_tokens_seen": 17064951840,
      "step": 21690
    },
    {
      "epoch": 2.3011882028432,
      "grad_norm": 0.4142749093344582,
      "learning_rate": 4.563091871011006e-05,
      "loss": 1.5296,
      "num_input_tokens_seen": 17065738624,
      "step": 21691
    },
    {
      "epoch": 2.301294292382771,
      "grad_norm": 0.3740872064345815,
      "learning_rate": 4.563052619281189e-05,
      "loss": 1.4729,
      "num_input_tokens_seen": 17066525328,
      "step": 21692
    },
    {
      "epoch": 2.3014003819223423,
      "grad_norm": 0.4454466139674192,
      "learning_rate": 4.5630133659571063e-05,
      "loss": 1.6105,
      "num_input_tokens_seen": 17067312048,
      "step": 21693
    },
    {
      "epoch": 2.301506471461914,
      "grad_norm": 0.368809841829712,
      "learning_rate": 4.562974111038787e-05,
      "loss": 1.461,
      "num_input_tokens_seen": 17068098816,
      "step": 21694
    },
    {
      "epoch": 2.3016125610014853,
      "grad_norm": 0.41228943876922075,
      "learning_rate": 4.562934854526262e-05,
      "loss": 1.5938,
      "num_input_tokens_seen": 17068885600,
      "step": 21695
    },
    {
      "epoch": 2.3017186505410567,
      "grad_norm": 0.3967439514392679,
      "learning_rate": 4.5628955964195605e-05,
      "loss": 1.6932,
      "num_input_tokens_seen": 17069672320,
      "step": 21696
    },
    {
      "epoch": 2.301824740080628,
      "grad_norm": 0.41525843033356863,
      "learning_rate": 4.562856336718715e-05,
      "loss": 1.5904,
      "num_input_tokens_seen": 17070459120,
      "step": 21697
    },
    {
      "epoch": 2.3019308296201997,
      "grad_norm": 0.3731310052782255,
      "learning_rate": 4.5628170754237536e-05,
      "loss": 1.6286,
      "num_input_tokens_seen": 17071245776,
      "step": 21698
    },
    {
      "epoch": 2.3020369191597707,
      "grad_norm": 0.3849021059539911,
      "learning_rate": 4.562777812534709e-05,
      "loss": 1.6914,
      "num_input_tokens_seen": 17072032480,
      "step": 21699
    },
    {
      "epoch": 2.302143008699342,
      "grad_norm": 0.3814538690610178,
      "learning_rate": 4.562738548051609e-05,
      "loss": 1.5271,
      "num_input_tokens_seen": 17072819264,
      "step": 21700
    },
    {
      "epoch": 2.3022490982389137,
      "grad_norm": 0.39195010801080676,
      "learning_rate": 4.562699281974485e-05,
      "loss": 1.5158,
      "num_input_tokens_seen": 17073605968,
      "step": 21701
    },
    {
      "epoch": 2.302355187778485,
      "grad_norm": 0.4181865428625621,
      "learning_rate": 4.5626600143033685e-05,
      "loss": 1.6629,
      "num_input_tokens_seen": 17074392784,
      "step": 21702
    },
    {
      "epoch": 2.3024612773180566,
      "grad_norm": 0.4071973095612688,
      "learning_rate": 4.562620745038289e-05,
      "loss": 1.6845,
      "num_input_tokens_seen": 17075179552,
      "step": 21703
    },
    {
      "epoch": 2.3025673668576276,
      "grad_norm": 0.4293969110940582,
      "learning_rate": 4.562581474179276e-05,
      "loss": 1.6777,
      "num_input_tokens_seen": 17075966272,
      "step": 21704
    },
    {
      "epoch": 2.302673456397199,
      "grad_norm": 0.37550901761448396,
      "learning_rate": 4.562542201726361e-05,
      "loss": 1.5021,
      "num_input_tokens_seen": 17076753056,
      "step": 21705
    },
    {
      "epoch": 2.3027795459367706,
      "grad_norm": 0.41165764808968297,
      "learning_rate": 4.5625029276795734e-05,
      "loss": 1.548,
      "num_input_tokens_seen": 17077539840,
      "step": 21706
    },
    {
      "epoch": 2.302885635476342,
      "grad_norm": 0.4067069285443333,
      "learning_rate": 4.562463652038944e-05,
      "loss": 1.6596,
      "num_input_tokens_seen": 17078326512,
      "step": 21707
    },
    {
      "epoch": 2.3029917250159135,
      "grad_norm": 0.38671383171501666,
      "learning_rate": 4.562424374804504e-05,
      "loss": 1.523,
      "num_input_tokens_seen": 17079113296,
      "step": 21708
    },
    {
      "epoch": 2.303097814555485,
      "grad_norm": 0.3810494312013696,
      "learning_rate": 4.5623850959762826e-05,
      "loss": 1.5412,
      "num_input_tokens_seen": 17079900048,
      "step": 21709
    },
    {
      "epoch": 2.303203904095056,
      "grad_norm": 0.39845253538633646,
      "learning_rate": 4.5623458155543106e-05,
      "loss": 1.6074,
      "num_input_tokens_seen": 17080686800,
      "step": 21710
    },
    {
      "epoch": 2.3033099936346275,
      "grad_norm": 0.42938880489529446,
      "learning_rate": 4.562306533538617e-05,
      "loss": 1.5823,
      "num_input_tokens_seen": 17081473600,
      "step": 21711
    },
    {
      "epoch": 2.303416083174199,
      "grad_norm": 0.35628182483006576,
      "learning_rate": 4.562267249929235e-05,
      "loss": 1.5004,
      "num_input_tokens_seen": 17082260400,
      "step": 21712
    },
    {
      "epoch": 2.3035221727137705,
      "grad_norm": 0.33893229834191513,
      "learning_rate": 4.5622279647261935e-05,
      "loss": 1.6481,
      "num_input_tokens_seen": 17083047136,
      "step": 21713
    },
    {
      "epoch": 2.303628262253342,
      "grad_norm": 0.43665227322255795,
      "learning_rate": 4.562188677929522e-05,
      "loss": 1.502,
      "num_input_tokens_seen": 17083833904,
      "step": 21714
    },
    {
      "epoch": 2.3037343517929134,
      "grad_norm": 0.4641504358046524,
      "learning_rate": 4.5621493895392516e-05,
      "loss": 1.6479,
      "num_input_tokens_seen": 17084620704,
      "step": 21715
    },
    {
      "epoch": 2.3038404413324844,
      "grad_norm": 0.34491259128429447,
      "learning_rate": 4.5621100995554126e-05,
      "loss": 1.6524,
      "num_input_tokens_seen": 17085407376,
      "step": 21716
    },
    {
      "epoch": 2.303946530872056,
      "grad_norm": 0.34730799132262846,
      "learning_rate": 4.562070807978036e-05,
      "loss": 1.4848,
      "num_input_tokens_seen": 17086194240,
      "step": 21717
    },
    {
      "epoch": 2.3040526204116274,
      "grad_norm": 0.45643080595778684,
      "learning_rate": 4.5620315148071505e-05,
      "loss": 1.4415,
      "num_input_tokens_seen": 17086980992,
      "step": 21718
    },
    {
      "epoch": 2.304158709951199,
      "grad_norm": 0.367326212183333,
      "learning_rate": 4.561992220042789e-05,
      "loss": 1.6114,
      "num_input_tokens_seen": 17087767776,
      "step": 21719
    },
    {
      "epoch": 2.3042647994907703,
      "grad_norm": 0.4769935193806237,
      "learning_rate": 4.561952923684979e-05,
      "loss": 1.6201,
      "num_input_tokens_seen": 17088554544,
      "step": 21720
    },
    {
      "epoch": 2.3043708890303414,
      "grad_norm": 0.49719877661581047,
      "learning_rate": 4.561913625733754e-05,
      "loss": 1.5657,
      "num_input_tokens_seen": 17089341376,
      "step": 21721
    },
    {
      "epoch": 2.304476978569913,
      "grad_norm": 0.4757324873283174,
      "learning_rate": 4.561874326189141e-05,
      "loss": 1.6939,
      "num_input_tokens_seen": 17090128176,
      "step": 21722
    },
    {
      "epoch": 2.3045830681094843,
      "grad_norm": 0.33634842611349874,
      "learning_rate": 4.561835025051172e-05,
      "loss": 1.5411,
      "num_input_tokens_seen": 17090914944,
      "step": 21723
    },
    {
      "epoch": 2.304689157649056,
      "grad_norm": 0.5938962104992342,
      "learning_rate": 4.5617957223198784e-05,
      "loss": 1.6303,
      "num_input_tokens_seen": 17091701760,
      "step": 21724
    },
    {
      "epoch": 2.3047952471886273,
      "grad_norm": 0.48860979694938333,
      "learning_rate": 4.5617564179952885e-05,
      "loss": 1.5216,
      "num_input_tokens_seen": 17092488608,
      "step": 21725
    },
    {
      "epoch": 2.3049013367281987,
      "grad_norm": 0.48175629949200954,
      "learning_rate": 4.561717112077435e-05,
      "loss": 1.5834,
      "num_input_tokens_seen": 17093275424,
      "step": 21726
    },
    {
      "epoch": 2.30500742626777,
      "grad_norm": 0.35886619891051097,
      "learning_rate": 4.5616778045663465e-05,
      "loss": 1.4185,
      "num_input_tokens_seen": 17094062224,
      "step": 21727
    },
    {
      "epoch": 2.3051135158073413,
      "grad_norm": 0.7678511805458511,
      "learning_rate": 4.561638495462054e-05,
      "loss": 1.6484,
      "num_input_tokens_seen": 17094848960,
      "step": 21728
    },
    {
      "epoch": 2.3052196053469127,
      "grad_norm": 0.3885170631530984,
      "learning_rate": 4.5615991847645874e-05,
      "loss": 1.5917,
      "num_input_tokens_seen": 17095635808,
      "step": 21729
    },
    {
      "epoch": 2.305325694886484,
      "grad_norm": 0.585410158484914,
      "learning_rate": 4.561559872473977e-05,
      "loss": 1.6428,
      "num_input_tokens_seen": 17096422608,
      "step": 21730
    },
    {
      "epoch": 2.3054317844260557,
      "grad_norm": 0.5109271663374252,
      "learning_rate": 4.5615205585902546e-05,
      "loss": 1.7255,
      "num_input_tokens_seen": 17097209280,
      "step": 21731
    },
    {
      "epoch": 2.305537873965627,
      "grad_norm": 0.5653238495532195,
      "learning_rate": 4.561481243113449e-05,
      "loss": 1.6732,
      "num_input_tokens_seen": 17097996032,
      "step": 21732
    },
    {
      "epoch": 2.305643963505198,
      "grad_norm": 0.6490095974403972,
      "learning_rate": 4.561441926043591e-05,
      "loss": 1.5935,
      "num_input_tokens_seen": 17098782768,
      "step": 21733
    },
    {
      "epoch": 2.3057500530447697,
      "grad_norm": 0.40698584326415516,
      "learning_rate": 4.561402607380712e-05,
      "loss": 1.6555,
      "num_input_tokens_seen": 17099569520,
      "step": 21734
    },
    {
      "epoch": 2.305856142584341,
      "grad_norm": 0.71318432941998,
      "learning_rate": 4.5613632871248414e-05,
      "loss": 1.5315,
      "num_input_tokens_seen": 17100356352,
      "step": 21735
    },
    {
      "epoch": 2.3059622321239126,
      "grad_norm": 0.5492177040388694,
      "learning_rate": 4.56132396527601e-05,
      "loss": 1.7329,
      "num_input_tokens_seen": 17101143104,
      "step": 21736
    },
    {
      "epoch": 2.306068321663484,
      "grad_norm": 0.6121513256586367,
      "learning_rate": 4.561284641834247e-05,
      "loss": 1.6364,
      "num_input_tokens_seen": 17101929968,
      "step": 21737
    },
    {
      "epoch": 2.3061744112030556,
      "grad_norm": 0.43490698923260035,
      "learning_rate": 4.561245316799584e-05,
      "loss": 1.5544,
      "num_input_tokens_seen": 17102716784,
      "step": 21738
    },
    {
      "epoch": 2.306280500742627,
      "grad_norm": 0.4542711355480262,
      "learning_rate": 4.561205990172051e-05,
      "loss": 1.6436,
      "num_input_tokens_seen": 17103503520,
      "step": 21739
    },
    {
      "epoch": 2.306386590282198,
      "grad_norm": 0.42496810550501235,
      "learning_rate": 4.561166661951679e-05,
      "loss": 1.5978,
      "num_input_tokens_seen": 17104290256,
      "step": 21740
    },
    {
      "epoch": 2.3064926798217695,
      "grad_norm": 0.4951703018118129,
      "learning_rate": 4.5611273321384976e-05,
      "loss": 1.6851,
      "num_input_tokens_seen": 17105077072,
      "step": 21741
    },
    {
      "epoch": 2.306598769361341,
      "grad_norm": 0.36370636375823945,
      "learning_rate": 4.561088000732537e-05,
      "loss": 1.5527,
      "num_input_tokens_seen": 17105863920,
      "step": 21742
    },
    {
      "epoch": 2.3067048589009125,
      "grad_norm": 0.46628841055912695,
      "learning_rate": 4.561048667733829e-05,
      "loss": 1.6269,
      "num_input_tokens_seen": 17106650608,
      "step": 21743
    },
    {
      "epoch": 2.306810948440484,
      "grad_norm": 0.4056104317761768,
      "learning_rate": 4.561009333142402e-05,
      "loss": 1.6426,
      "num_input_tokens_seen": 17107437264,
      "step": 21744
    },
    {
      "epoch": 2.306917037980055,
      "grad_norm": 0.4956870404380907,
      "learning_rate": 4.560969996958289e-05,
      "loss": 1.4792,
      "num_input_tokens_seen": 17108224016,
      "step": 21745
    },
    {
      "epoch": 2.3070231275196265,
      "grad_norm": 0.403953761188721,
      "learning_rate": 4.560930659181517e-05,
      "loss": 1.5966,
      "num_input_tokens_seen": 17109010816,
      "step": 21746
    },
    {
      "epoch": 2.307129217059198,
      "grad_norm": 0.40337682238373407,
      "learning_rate": 4.5608913198121195e-05,
      "loss": 1.668,
      "num_input_tokens_seen": 17109797568,
      "step": 21747
    },
    {
      "epoch": 2.3072353065987694,
      "grad_norm": 0.39534891398151506,
      "learning_rate": 4.560851978850125e-05,
      "loss": 1.4883,
      "num_input_tokens_seen": 17110584336,
      "step": 21748
    },
    {
      "epoch": 2.307341396138341,
      "grad_norm": 0.3265955252112184,
      "learning_rate": 4.560812636295565e-05,
      "loss": 1.499,
      "num_input_tokens_seen": 17111371072,
      "step": 21749
    },
    {
      "epoch": 2.307447485677912,
      "grad_norm": 0.4359938330569125,
      "learning_rate": 4.560773292148469e-05,
      "loss": 1.6724,
      "num_input_tokens_seen": 17112157872,
      "step": 21750
    },
    {
      "epoch": 2.3075535752174834,
      "grad_norm": 0.410593512832589,
      "learning_rate": 4.560733946408868e-05,
      "loss": 1.7178,
      "num_input_tokens_seen": 17112944560,
      "step": 21751
    },
    {
      "epoch": 2.307659664757055,
      "grad_norm": 0.420572406790463,
      "learning_rate": 4.560694599076793e-05,
      "loss": 1.6439,
      "num_input_tokens_seen": 17113731232,
      "step": 21752
    },
    {
      "epoch": 2.3077657542966263,
      "grad_norm": 0.3343132057142839,
      "learning_rate": 4.560655250152273e-05,
      "loss": 1.6289,
      "num_input_tokens_seen": 17114518064,
      "step": 21753
    },
    {
      "epoch": 2.307871843836198,
      "grad_norm": 0.4448357674116497,
      "learning_rate": 4.560615899635339e-05,
      "loss": 1.6249,
      "num_input_tokens_seen": 17115304768,
      "step": 21754
    },
    {
      "epoch": 2.3079779333757693,
      "grad_norm": 0.3990576508113464,
      "learning_rate": 4.560576547526022e-05,
      "loss": 1.6869,
      "num_input_tokens_seen": 17116091504,
      "step": 21755
    },
    {
      "epoch": 2.3080840229153408,
      "grad_norm": 0.3916026055713567,
      "learning_rate": 4.560537193824351e-05,
      "loss": 1.6257,
      "num_input_tokens_seen": 17116878224,
      "step": 21756
    },
    {
      "epoch": 2.308190112454912,
      "grad_norm": 0.4880453271371435,
      "learning_rate": 4.5604978385303586e-05,
      "loss": 1.5423,
      "num_input_tokens_seen": 17117664976,
      "step": 21757
    },
    {
      "epoch": 2.3082962019944833,
      "grad_norm": 0.3817872174291339,
      "learning_rate": 4.560458481644073e-05,
      "loss": 1.6964,
      "num_input_tokens_seen": 17118451632,
      "step": 21758
    },
    {
      "epoch": 2.3084022915340547,
      "grad_norm": 0.44735979721664204,
      "learning_rate": 4.560419123165526e-05,
      "loss": 1.6203,
      "num_input_tokens_seen": 17119238432,
      "step": 21759
    },
    {
      "epoch": 2.308508381073626,
      "grad_norm": 0.4064415994491584,
      "learning_rate": 4.5603797630947474e-05,
      "loss": 1.6277,
      "num_input_tokens_seen": 17120025168,
      "step": 21760
    },
    {
      "epoch": 2.3086144706131977,
      "grad_norm": 0.38820663129879884,
      "learning_rate": 4.560340401431767e-05,
      "loss": 1.6496,
      "num_input_tokens_seen": 17120811856,
      "step": 21761
    },
    {
      "epoch": 2.3087205601527687,
      "grad_norm": 0.40671941907150394,
      "learning_rate": 4.5603010381766177e-05,
      "loss": 1.5593,
      "num_input_tokens_seen": 17121598688,
      "step": 21762
    },
    {
      "epoch": 2.30882664969234,
      "grad_norm": 0.3657473090392774,
      "learning_rate": 4.560261673329327e-05,
      "loss": 1.6807,
      "num_input_tokens_seen": 17122385552,
      "step": 21763
    },
    {
      "epoch": 2.3089327392319117,
      "grad_norm": 0.45707137175692697,
      "learning_rate": 4.560222306889927e-05,
      "loss": 1.5916,
      "num_input_tokens_seen": 17123172288,
      "step": 21764
    },
    {
      "epoch": 2.309038828771483,
      "grad_norm": 0.3566293275168138,
      "learning_rate": 4.560182938858447e-05,
      "loss": 1.486,
      "num_input_tokens_seen": 17123959168,
      "step": 21765
    },
    {
      "epoch": 2.3091449183110546,
      "grad_norm": 0.38185739604271557,
      "learning_rate": 4.5601435692349196e-05,
      "loss": 1.5485,
      "num_input_tokens_seen": 17124745984,
      "step": 21766
    },
    {
      "epoch": 2.309251007850626,
      "grad_norm": 0.3537104804404371,
      "learning_rate": 4.5601041980193714e-05,
      "loss": 1.4629,
      "num_input_tokens_seen": 17125532784,
      "step": 21767
    },
    {
      "epoch": 2.3093570973901976,
      "grad_norm": 0.3553371515356172,
      "learning_rate": 4.5600648252118364e-05,
      "loss": 1.5654,
      "num_input_tokens_seen": 17126319616,
      "step": 21768
    },
    {
      "epoch": 2.3094631869297686,
      "grad_norm": 0.3342545921788157,
      "learning_rate": 4.560025450812344e-05,
      "loss": 1.4083,
      "num_input_tokens_seen": 17127106384,
      "step": 21769
    },
    {
      "epoch": 2.30956927646934,
      "grad_norm": 0.37057300515284286,
      "learning_rate": 4.559986074820924e-05,
      "loss": 1.5286,
      "num_input_tokens_seen": 17127893232,
      "step": 21770
    },
    {
      "epoch": 2.3096753660089115,
      "grad_norm": 0.42192197712739743,
      "learning_rate": 4.559946697237607e-05,
      "loss": 1.6423,
      "num_input_tokens_seen": 17128679968,
      "step": 21771
    },
    {
      "epoch": 2.309781455548483,
      "grad_norm": 0.4140427446905809,
      "learning_rate": 4.559907318062424e-05,
      "loss": 1.6503,
      "num_input_tokens_seen": 17129466656,
      "step": 21772
    },
    {
      "epoch": 2.3098875450880545,
      "grad_norm": 0.4059523673805921,
      "learning_rate": 4.559867937295406e-05,
      "loss": 1.6128,
      "num_input_tokens_seen": 17130253408,
      "step": 21773
    },
    {
      "epoch": 2.3099936346276255,
      "grad_norm": 0.36576498045643907,
      "learning_rate": 4.55982855493658e-05,
      "loss": 1.6601,
      "num_input_tokens_seen": 17131040096,
      "step": 21774
    },
    {
      "epoch": 2.310099724167197,
      "grad_norm": 0.44138071667876616,
      "learning_rate": 4.5597891709859805e-05,
      "loss": 1.7617,
      "num_input_tokens_seen": 17131826736,
      "step": 21775
    },
    {
      "epoch": 2.3102058137067685,
      "grad_norm": 0.33543464891934066,
      "learning_rate": 4.5597497854436364e-05,
      "loss": 1.4536,
      "num_input_tokens_seen": 17132613584,
      "step": 21776
    },
    {
      "epoch": 2.31031190324634,
      "grad_norm": 0.3972179682608179,
      "learning_rate": 4.5597103983095786e-05,
      "loss": 1.6398,
      "num_input_tokens_seen": 17133400272,
      "step": 21777
    },
    {
      "epoch": 2.3104179927859114,
      "grad_norm": 0.4091202468977925,
      "learning_rate": 4.559671009583836e-05,
      "loss": 1.551,
      "num_input_tokens_seen": 17134187040,
      "step": 21778
    },
    {
      "epoch": 2.310524082325483,
      "grad_norm": 0.42906602014478945,
      "learning_rate": 4.5596316192664406e-05,
      "loss": 1.5602,
      "num_input_tokens_seen": 17134973840,
      "step": 21779
    },
    {
      "epoch": 2.310630171865054,
      "grad_norm": 0.4119210469619904,
      "learning_rate": 4.559592227357422e-05,
      "loss": 1.7373,
      "num_input_tokens_seen": 17135760576,
      "step": 21780
    },
    {
      "epoch": 2.3107362614046254,
      "grad_norm": 0.4859032240666886,
      "learning_rate": 4.559552833856812e-05,
      "loss": 1.6854,
      "num_input_tokens_seen": 17136547392,
      "step": 21781
    },
    {
      "epoch": 2.310842350944197,
      "grad_norm": 0.5252075975818704,
      "learning_rate": 4.559513438764639e-05,
      "loss": 1.6502,
      "num_input_tokens_seen": 17137334080,
      "step": 21782
    },
    {
      "epoch": 2.3109484404837684,
      "grad_norm": 0.41643378315969987,
      "learning_rate": 4.559474042080934e-05,
      "loss": 1.6666,
      "num_input_tokens_seen": 17138120896,
      "step": 21783
    },
    {
      "epoch": 2.31105453002334,
      "grad_norm": 0.47413890304931744,
      "learning_rate": 4.559434643805728e-05,
      "loss": 1.5517,
      "num_input_tokens_seen": 17138907584,
      "step": 21784
    },
    {
      "epoch": 2.3111606195629113,
      "grad_norm": 0.371704485950006,
      "learning_rate": 4.559395243939052e-05,
      "loss": 1.627,
      "num_input_tokens_seen": 17139694320,
      "step": 21785
    },
    {
      "epoch": 2.3112667091024823,
      "grad_norm": 0.49959622386359337,
      "learning_rate": 4.559355842480936e-05,
      "loss": 1.6705,
      "num_input_tokens_seen": 17140481168,
      "step": 21786
    },
    {
      "epoch": 2.311372798642054,
      "grad_norm": 0.3673665788582212,
      "learning_rate": 4.5593164394314095e-05,
      "loss": 1.678,
      "num_input_tokens_seen": 17141267920,
      "step": 21787
    },
    {
      "epoch": 2.3114788881816253,
      "grad_norm": 0.39964325975511683,
      "learning_rate": 4.559277034790505e-05,
      "loss": 1.5901,
      "num_input_tokens_seen": 17142054624,
      "step": 21788
    },
    {
      "epoch": 2.3115849777211968,
      "grad_norm": 0.49403165493268625,
      "learning_rate": 4.55923762855825e-05,
      "loss": 1.7106,
      "num_input_tokens_seen": 17142841392,
      "step": 21789
    },
    {
      "epoch": 2.3116910672607682,
      "grad_norm": 0.45042521211665826,
      "learning_rate": 4.559198220734677e-05,
      "loss": 1.7484,
      "num_input_tokens_seen": 17143628064,
      "step": 21790
    },
    {
      "epoch": 2.3117971568003393,
      "grad_norm": 0.4007731653466183,
      "learning_rate": 4.559158811319817e-05,
      "loss": 1.648,
      "num_input_tokens_seen": 17144414880,
      "step": 21791
    },
    {
      "epoch": 2.3119032463399107,
      "grad_norm": 0.38131212664109027,
      "learning_rate": 4.5591194003136985e-05,
      "loss": 1.6292,
      "num_input_tokens_seen": 17145201600,
      "step": 21792
    },
    {
      "epoch": 2.312009335879482,
      "grad_norm": 0.42369180660782635,
      "learning_rate": 4.559079987716352e-05,
      "loss": 1.8451,
      "num_input_tokens_seen": 17145988464,
      "step": 21793
    },
    {
      "epoch": 2.3121154254190537,
      "grad_norm": 0.35159838568332574,
      "learning_rate": 4.559040573527811e-05,
      "loss": 1.5703,
      "num_input_tokens_seen": 17146775328,
      "step": 21794
    },
    {
      "epoch": 2.312221514958625,
      "grad_norm": 0.3577476690916659,
      "learning_rate": 4.559001157748103e-05,
      "loss": 1.5683,
      "num_input_tokens_seen": 17147562160,
      "step": 21795
    },
    {
      "epoch": 2.3123276044981966,
      "grad_norm": 0.33880000659298665,
      "learning_rate": 4.55896174037726e-05,
      "loss": 1.5351,
      "num_input_tokens_seen": 17148349008,
      "step": 21796
    },
    {
      "epoch": 2.312433694037768,
      "grad_norm": 0.39382372886849665,
      "learning_rate": 4.55892232141531e-05,
      "loss": 1.6587,
      "num_input_tokens_seen": 17149135904,
      "step": 21797
    },
    {
      "epoch": 2.312539783577339,
      "grad_norm": 0.3870491449249587,
      "learning_rate": 4.558882900862287e-05,
      "loss": 1.6767,
      "num_input_tokens_seen": 17149922720,
      "step": 21798
    },
    {
      "epoch": 2.3126458731169106,
      "grad_norm": 0.3698231739132853,
      "learning_rate": 4.558843478718219e-05,
      "loss": 1.5748,
      "num_input_tokens_seen": 17150709552,
      "step": 21799
    },
    {
      "epoch": 2.312751962656482,
      "grad_norm": 0.41081835348487555,
      "learning_rate": 4.558804054983137e-05,
      "loss": 1.5448,
      "num_input_tokens_seen": 17151496288,
      "step": 21800
    },
    {
      "epoch": 2.3128580521960536,
      "grad_norm": 0.33876240994266227,
      "learning_rate": 4.558764629657072e-05,
      "loss": 1.5643,
      "num_input_tokens_seen": 17152283120,
      "step": 21801
    },
    {
      "epoch": 2.312964141735625,
      "grad_norm": 0.7167587458825828,
      "learning_rate": 4.558725202740053e-05,
      "loss": 1.6125,
      "num_input_tokens_seen": 17153069872,
      "step": 21802
    },
    {
      "epoch": 2.313070231275196,
      "grad_norm": 0.4409823521648582,
      "learning_rate": 4.558685774232113e-05,
      "loss": 1.5602,
      "num_input_tokens_seen": 17153856560,
      "step": 21803
    },
    {
      "epoch": 2.3131763208147675,
      "grad_norm": 0.6783274054244474,
      "learning_rate": 4.55864634413328e-05,
      "loss": 1.7615,
      "num_input_tokens_seen": 17154643376,
      "step": 21804
    },
    {
      "epoch": 2.313282410354339,
      "grad_norm": 0.44537688562481714,
      "learning_rate": 4.5586069124435864e-05,
      "loss": 1.6859,
      "num_input_tokens_seen": 17155430064,
      "step": 21805
    },
    {
      "epoch": 2.3133884998939105,
      "grad_norm": 0.5545700348736191,
      "learning_rate": 4.558567479163062e-05,
      "loss": 1.5588,
      "num_input_tokens_seen": 17156216880,
      "step": 21806
    },
    {
      "epoch": 2.313494589433482,
      "grad_norm": 0.39149960206593404,
      "learning_rate": 4.5585280442917354e-05,
      "loss": 1.6812,
      "num_input_tokens_seen": 17157003552,
      "step": 21807
    },
    {
      "epoch": 2.3136006789730534,
      "grad_norm": 0.4523645835062734,
      "learning_rate": 4.5584886078296405e-05,
      "loss": 1.5637,
      "num_input_tokens_seen": 17157790288,
      "step": 21808
    },
    {
      "epoch": 2.3137067685126245,
      "grad_norm": 0.5151080251306859,
      "learning_rate": 4.558449169776805e-05,
      "loss": 1.7321,
      "num_input_tokens_seen": 17158576992,
      "step": 21809
    },
    {
      "epoch": 2.313812858052196,
      "grad_norm": 0.3508973922780869,
      "learning_rate": 4.558409730133261e-05,
      "loss": 1.5366,
      "num_input_tokens_seen": 17159363824,
      "step": 21810
    },
    {
      "epoch": 2.3139189475917674,
      "grad_norm": 0.5817299169250055,
      "learning_rate": 4.558370288899037e-05,
      "loss": 1.6701,
      "num_input_tokens_seen": 17160150592,
      "step": 21811
    },
    {
      "epoch": 2.314025037131339,
      "grad_norm": 0.39636981469154486,
      "learning_rate": 4.558330846074167e-05,
      "loss": 1.6281,
      "num_input_tokens_seen": 17160937376,
      "step": 21812
    },
    {
      "epoch": 2.3141311266709104,
      "grad_norm": 0.4116919415075403,
      "learning_rate": 4.558291401658678e-05,
      "loss": 1.5265,
      "num_input_tokens_seen": 17161724224,
      "step": 21813
    },
    {
      "epoch": 2.314237216210482,
      "grad_norm": 0.4867006784596967,
      "learning_rate": 4.5582519556526015e-05,
      "loss": 1.675,
      "num_input_tokens_seen": 17162510960,
      "step": 21814
    },
    {
      "epoch": 2.314343305750053,
      "grad_norm": 0.5864775569587761,
      "learning_rate": 4.558212508055969e-05,
      "loss": 1.6127,
      "num_input_tokens_seen": 17163297744,
      "step": 21815
    },
    {
      "epoch": 2.3144493952896243,
      "grad_norm": 0.3143470825201845,
      "learning_rate": 4.55817305886881e-05,
      "loss": 1.5131,
      "num_input_tokens_seen": 17164084496,
      "step": 21816
    },
    {
      "epoch": 2.314555484829196,
      "grad_norm": 0.38723302475272625,
      "learning_rate": 4.558133608091155e-05,
      "loss": 1.6573,
      "num_input_tokens_seen": 17164871168,
      "step": 21817
    },
    {
      "epoch": 2.3146615743687673,
      "grad_norm": 0.4639726113741947,
      "learning_rate": 4.5580941557230357e-05,
      "loss": 1.7062,
      "num_input_tokens_seen": 17165657888,
      "step": 21818
    },
    {
      "epoch": 2.3147676639083388,
      "grad_norm": 0.38472761376774534,
      "learning_rate": 4.558054701764481e-05,
      "loss": 1.7686,
      "num_input_tokens_seen": 17166444688,
      "step": 21819
    },
    {
      "epoch": 2.31487375344791,
      "grad_norm": 0.46878095101796474,
      "learning_rate": 4.558015246215522e-05,
      "loss": 1.6004,
      "num_input_tokens_seen": 17167231504,
      "step": 21820
    },
    {
      "epoch": 2.3149798429874813,
      "grad_norm": 0.4972172570753909,
      "learning_rate": 4.5579757890761886e-05,
      "loss": 1.6296,
      "num_input_tokens_seen": 17168018304,
      "step": 21821
    },
    {
      "epoch": 2.3150859325270527,
      "grad_norm": 0.37485201307268967,
      "learning_rate": 4.557936330346513e-05,
      "loss": 1.6614,
      "num_input_tokens_seen": 17168805088,
      "step": 21822
    },
    {
      "epoch": 2.3151920220666242,
      "grad_norm": 0.5066656743577335,
      "learning_rate": 4.557896870026524e-05,
      "loss": 1.5835,
      "num_input_tokens_seen": 17169591824,
      "step": 21823
    },
    {
      "epoch": 2.3152981116061957,
      "grad_norm": 0.3759205780646341,
      "learning_rate": 4.557857408116253e-05,
      "loss": 1.6538,
      "num_input_tokens_seen": 17170378592,
      "step": 21824
    },
    {
      "epoch": 2.315404201145767,
      "grad_norm": 0.40950766920034115,
      "learning_rate": 4.55781794461573e-05,
      "loss": 1.4653,
      "num_input_tokens_seen": 17171165424,
      "step": 21825
    },
    {
      "epoch": 2.3155102906853386,
      "grad_norm": 0.5701076987361661,
      "learning_rate": 4.557778479524985e-05,
      "loss": 1.6628,
      "num_input_tokens_seen": 17171952096,
      "step": 21826
    },
    {
      "epoch": 2.3156163802249097,
      "grad_norm": 0.3532592108770776,
      "learning_rate": 4.55773901284405e-05,
      "loss": 1.5976,
      "num_input_tokens_seen": 17172738848,
      "step": 21827
    },
    {
      "epoch": 2.315722469764481,
      "grad_norm": 0.5304560196679369,
      "learning_rate": 4.557699544572954e-05,
      "loss": 1.5467,
      "num_input_tokens_seen": 17173525632,
      "step": 21828
    },
    {
      "epoch": 2.3158285593040526,
      "grad_norm": 0.4922740272953614,
      "learning_rate": 4.5576600747117286e-05,
      "loss": 1.6539,
      "num_input_tokens_seen": 17174312432,
      "step": 21829
    },
    {
      "epoch": 2.315934648843624,
      "grad_norm": 0.42103580782626415,
      "learning_rate": 4.557620603260404e-05,
      "loss": 1.603,
      "num_input_tokens_seen": 17175099216,
      "step": 21830
    },
    {
      "epoch": 2.3160407383831956,
      "grad_norm": 0.48580853658885226,
      "learning_rate": 4.5575811302190105e-05,
      "loss": 1.5725,
      "num_input_tokens_seen": 17175886064,
      "step": 21831
    },
    {
      "epoch": 2.3161468279227666,
      "grad_norm": 0.4717485411445948,
      "learning_rate": 4.557541655587578e-05,
      "loss": 1.63,
      "num_input_tokens_seen": 17176672768,
      "step": 21832
    },
    {
      "epoch": 2.316252917462338,
      "grad_norm": 0.5946745874578012,
      "learning_rate": 4.557502179366139e-05,
      "loss": 1.5341,
      "num_input_tokens_seen": 17177459584,
      "step": 21833
    },
    {
      "epoch": 2.3163590070019096,
      "grad_norm": 0.4907019789808365,
      "learning_rate": 4.557462701554722e-05,
      "loss": 1.5539,
      "num_input_tokens_seen": 17178246464,
      "step": 21834
    },
    {
      "epoch": 2.316465096541481,
      "grad_norm": 0.37891863243233426,
      "learning_rate": 4.5574232221533575e-05,
      "loss": 1.568,
      "num_input_tokens_seen": 17179033312,
      "step": 21835
    },
    {
      "epoch": 2.3165711860810525,
      "grad_norm": 0.5411631315803039,
      "learning_rate": 4.557383741162078e-05,
      "loss": 1.6409,
      "num_input_tokens_seen": 17179820064,
      "step": 21836
    },
    {
      "epoch": 2.316677275620624,
      "grad_norm": 0.40903224864023524,
      "learning_rate": 4.5573442585809126e-05,
      "loss": 1.7593,
      "num_input_tokens_seen": 17180606784,
      "step": 21837
    },
    {
      "epoch": 2.3167833651601955,
      "grad_norm": 0.3993001062449032,
      "learning_rate": 4.557304774409891e-05,
      "loss": 1.6234,
      "num_input_tokens_seen": 17181393552,
      "step": 21838
    },
    {
      "epoch": 2.3168894546997665,
      "grad_norm": 0.5712528915926985,
      "learning_rate": 4.5572652886490446e-05,
      "loss": 1.5555,
      "num_input_tokens_seen": 17182180288,
      "step": 21839
    },
    {
      "epoch": 2.316995544239338,
      "grad_norm": 0.3679225441162764,
      "learning_rate": 4.557225801298405e-05,
      "loss": 1.6137,
      "num_input_tokens_seen": 17182967040,
      "step": 21840
    },
    {
      "epoch": 2.3171016337789094,
      "grad_norm": 0.5958655669838134,
      "learning_rate": 4.557186312358001e-05,
      "loss": 1.6622,
      "num_input_tokens_seen": 17183753776,
      "step": 21841
    },
    {
      "epoch": 2.317207723318481,
      "grad_norm": 0.38912972591658407,
      "learning_rate": 4.557146821827864e-05,
      "loss": 1.4497,
      "num_input_tokens_seen": 17184540560,
      "step": 21842
    },
    {
      "epoch": 2.3173138128580524,
      "grad_norm": 0.6112893470247354,
      "learning_rate": 4.557107329708023e-05,
      "loss": 1.6239,
      "num_input_tokens_seen": 17185327296,
      "step": 21843
    },
    {
      "epoch": 2.3174199023976234,
      "grad_norm": 0.3776626563713916,
      "learning_rate": 4.5570678359985113e-05,
      "loss": 1.5842,
      "num_input_tokens_seen": 17186114096,
      "step": 21844
    },
    {
      "epoch": 2.317525991937195,
      "grad_norm": 0.4332145300130113,
      "learning_rate": 4.557028340699358e-05,
      "loss": 1.5362,
      "num_input_tokens_seen": 17186900896,
      "step": 21845
    },
    {
      "epoch": 2.3176320814767664,
      "grad_norm": 0.3580794873062973,
      "learning_rate": 4.556988843810593e-05,
      "loss": 1.5436,
      "num_input_tokens_seen": 17187687632,
      "step": 21846
    },
    {
      "epoch": 2.317738171016338,
      "grad_norm": 0.4049203508811103,
      "learning_rate": 4.556949345332248e-05,
      "loss": 1.5008,
      "num_input_tokens_seen": 17188474448,
      "step": 21847
    },
    {
      "epoch": 2.3178442605559093,
      "grad_norm": 0.3535679401699034,
      "learning_rate": 4.556909845264352e-05,
      "loss": 1.4763,
      "num_input_tokens_seen": 17189261232,
      "step": 21848
    },
    {
      "epoch": 2.3179503500954803,
      "grad_norm": 0.3634833582452049,
      "learning_rate": 4.556870343606937e-05,
      "loss": 1.5007,
      "num_input_tokens_seen": 17190047920,
      "step": 21849
    },
    {
      "epoch": 2.318056439635052,
      "grad_norm": 0.46090489768129317,
      "learning_rate": 4.556830840360032e-05,
      "loss": 1.5114,
      "num_input_tokens_seen": 17190834672,
      "step": 21850
    },
    {
      "epoch": 2.3181625291746233,
      "grad_norm": 0.3888482905608788,
      "learning_rate": 4.556791335523669e-05,
      "loss": 1.5603,
      "num_input_tokens_seen": 17191621440,
      "step": 21851
    },
    {
      "epoch": 2.3182686187141948,
      "grad_norm": 0.560416589426091,
      "learning_rate": 4.556751829097879e-05,
      "loss": 1.7205,
      "num_input_tokens_seen": 17192408192,
      "step": 21852
    },
    {
      "epoch": 2.3183747082537662,
      "grad_norm": 0.45752343605991164,
      "learning_rate": 4.556712321082691e-05,
      "loss": 1.5746,
      "num_input_tokens_seen": 17193194960,
      "step": 21853
    },
    {
      "epoch": 2.3184807977933377,
      "grad_norm": 0.42274926960957243,
      "learning_rate": 4.5566728114781355e-05,
      "loss": 1.7021,
      "num_input_tokens_seen": 17193981680,
      "step": 21854
    },
    {
      "epoch": 2.318586887332909,
      "grad_norm": 0.38027706482589424,
      "learning_rate": 4.556633300284244e-05,
      "loss": 1.5959,
      "num_input_tokens_seen": 17194768464,
      "step": 21855
    },
    {
      "epoch": 2.31869297687248,
      "grad_norm": 0.37319508772499044,
      "learning_rate": 4.5565937875010464e-05,
      "loss": 1.5935,
      "num_input_tokens_seen": 17195555232,
      "step": 21856
    },
    {
      "epoch": 2.3187990664120517,
      "grad_norm": 0.3649472457210217,
      "learning_rate": 4.556554273128574e-05,
      "loss": 1.6507,
      "num_input_tokens_seen": 17196341968,
      "step": 21857
    },
    {
      "epoch": 2.318905155951623,
      "grad_norm": 0.42193125808515536,
      "learning_rate": 4.5565147571668564e-05,
      "loss": 1.7512,
      "num_input_tokens_seen": 17197128720,
      "step": 21858
    },
    {
      "epoch": 2.3190112454911946,
      "grad_norm": 0.37358565116934095,
      "learning_rate": 4.556475239615925e-05,
      "loss": 1.6362,
      "num_input_tokens_seen": 17197915424,
      "step": 21859
    },
    {
      "epoch": 2.319117335030766,
      "grad_norm": 0.419299718155731,
      "learning_rate": 4.556435720475809e-05,
      "loss": 1.5894,
      "num_input_tokens_seen": 17198702256,
      "step": 21860
    },
    {
      "epoch": 2.319223424570337,
      "grad_norm": 0.3866700574503643,
      "learning_rate": 4.55639619974654e-05,
      "loss": 1.5887,
      "num_input_tokens_seen": 17199488976,
      "step": 21861
    },
    {
      "epoch": 2.3193295141099086,
      "grad_norm": 0.39124130086433945,
      "learning_rate": 4.556356677428149e-05,
      "loss": 1.7213,
      "num_input_tokens_seen": 17200275824,
      "step": 21862
    },
    {
      "epoch": 2.31943560364948,
      "grad_norm": 0.3984001219671268,
      "learning_rate": 4.5563171535206657e-05,
      "loss": 1.6495,
      "num_input_tokens_seen": 17201062528,
      "step": 21863
    },
    {
      "epoch": 2.3195416931890516,
      "grad_norm": 0.3579559372384879,
      "learning_rate": 4.55627762802412e-05,
      "loss": 1.569,
      "num_input_tokens_seen": 17201849296,
      "step": 21864
    },
    {
      "epoch": 2.319647782728623,
      "grad_norm": 0.3586962644592327,
      "learning_rate": 4.556238100938545e-05,
      "loss": 1.5654,
      "num_input_tokens_seen": 17202636080,
      "step": 21865
    },
    {
      "epoch": 2.3197538722681945,
      "grad_norm": 0.3417595324294316,
      "learning_rate": 4.5561985722639675e-05,
      "loss": 1.5812,
      "num_input_tokens_seen": 17203422784,
      "step": 21866
    },
    {
      "epoch": 2.319859961807766,
      "grad_norm": 0.417033452641226,
      "learning_rate": 4.5561590420004215e-05,
      "loss": 1.5389,
      "num_input_tokens_seen": 17204209552,
      "step": 21867
    },
    {
      "epoch": 2.319966051347337,
      "grad_norm": 0.3592461158970517,
      "learning_rate": 4.556119510147936e-05,
      "loss": 1.4795,
      "num_input_tokens_seen": 17204996384,
      "step": 21868
    },
    {
      "epoch": 2.3200721408869085,
      "grad_norm": 0.4115615465897459,
      "learning_rate": 4.556079976706541e-05,
      "loss": 1.861,
      "num_input_tokens_seen": 17205783216,
      "step": 21869
    },
    {
      "epoch": 2.32017823042648,
      "grad_norm": 0.43316961357817724,
      "learning_rate": 4.556040441676268e-05,
      "loss": 1.7346,
      "num_input_tokens_seen": 17206569936,
      "step": 21870
    },
    {
      "epoch": 2.3202843199660514,
      "grad_norm": 0.3560584764369317,
      "learning_rate": 4.5560009050571474e-05,
      "loss": 1.5894,
      "num_input_tokens_seen": 17207356672,
      "step": 21871
    },
    {
      "epoch": 2.320390409505623,
      "grad_norm": 0.3966403301094906,
      "learning_rate": 4.5559613668492096e-05,
      "loss": 1.4808,
      "num_input_tokens_seen": 17208143392,
      "step": 21872
    },
    {
      "epoch": 2.320496499045194,
      "grad_norm": 0.4069745052381643,
      "learning_rate": 4.555921827052485e-05,
      "loss": 1.6427,
      "num_input_tokens_seen": 17208930064,
      "step": 21873
    },
    {
      "epoch": 2.3206025885847654,
      "grad_norm": 0.44019370614717285,
      "learning_rate": 4.555882285667005e-05,
      "loss": 1.6701,
      "num_input_tokens_seen": 17209716800,
      "step": 21874
    },
    {
      "epoch": 2.320708678124337,
      "grad_norm": 0.4271457036459997,
      "learning_rate": 4.5558427426927985e-05,
      "loss": 1.7361,
      "num_input_tokens_seen": 17210503568,
      "step": 21875
    },
    {
      "epoch": 2.3208147676639084,
      "grad_norm": 0.48705618082711416,
      "learning_rate": 4.555803198129898e-05,
      "loss": 1.6005,
      "num_input_tokens_seen": 17211290240,
      "step": 21876
    },
    {
      "epoch": 2.32092085720348,
      "grad_norm": 0.386355603151901,
      "learning_rate": 4.555763651978332e-05,
      "loss": 1.5964,
      "num_input_tokens_seen": 17212077024,
      "step": 21877
    },
    {
      "epoch": 2.3210269467430513,
      "grad_norm": 0.39768372814994557,
      "learning_rate": 4.5557241042381324e-05,
      "loss": 1.7215,
      "num_input_tokens_seen": 17212863808,
      "step": 21878
    },
    {
      "epoch": 2.3211330362826224,
      "grad_norm": 0.3897936219112539,
      "learning_rate": 4.555684554909331e-05,
      "loss": 1.5699,
      "num_input_tokens_seen": 17213650608,
      "step": 21879
    },
    {
      "epoch": 2.321239125822194,
      "grad_norm": 0.41116207128598475,
      "learning_rate": 4.555645003991955e-05,
      "loss": 1.6539,
      "num_input_tokens_seen": 17214437296,
      "step": 21880
    },
    {
      "epoch": 2.3213452153617653,
      "grad_norm": 0.4138955436037085,
      "learning_rate": 4.555605451486038e-05,
      "loss": 1.8651,
      "num_input_tokens_seen": 17215223984,
      "step": 21881
    },
    {
      "epoch": 2.3214513049013368,
      "grad_norm": 0.35579576242672534,
      "learning_rate": 4.555565897391609e-05,
      "loss": 1.5406,
      "num_input_tokens_seen": 17216010800,
      "step": 21882
    },
    {
      "epoch": 2.3215573944409083,
      "grad_norm": 0.3304575988556123,
      "learning_rate": 4.5555263417087e-05,
      "loss": 1.5212,
      "num_input_tokens_seen": 17216797696,
      "step": 21883
    },
    {
      "epoch": 2.3216634839804797,
      "grad_norm": 0.3809049695880286,
      "learning_rate": 4.5554867844373396e-05,
      "loss": 1.5226,
      "num_input_tokens_seen": 17217584496,
      "step": 21884
    },
    {
      "epoch": 2.3217695735200508,
      "grad_norm": 0.37704789951355827,
      "learning_rate": 4.5554472255775594e-05,
      "loss": 1.5376,
      "num_input_tokens_seen": 17218371248,
      "step": 21885
    },
    {
      "epoch": 2.3218756630596222,
      "grad_norm": 0.3350627123790674,
      "learning_rate": 4.55540766512939e-05,
      "loss": 1.5045,
      "num_input_tokens_seen": 17219158032,
      "step": 21886
    },
    {
      "epoch": 2.3219817525991937,
      "grad_norm": 0.5195427972176603,
      "learning_rate": 4.5553681030928614e-05,
      "loss": 1.6915,
      "num_input_tokens_seen": 17219944736,
      "step": 21887
    },
    {
      "epoch": 2.322087842138765,
      "grad_norm": 0.371826420780582,
      "learning_rate": 4.5553285394680045e-05,
      "loss": 1.5419,
      "num_input_tokens_seen": 17220731440,
      "step": 21888
    },
    {
      "epoch": 2.3221939316783367,
      "grad_norm": 0.5667462439960996,
      "learning_rate": 4.555288974254851e-05,
      "loss": 1.6411,
      "num_input_tokens_seen": 17221518096,
      "step": 21889
    },
    {
      "epoch": 2.3223000212179077,
      "grad_norm": 0.44563308637277715,
      "learning_rate": 4.55524940745343e-05,
      "loss": 1.601,
      "num_input_tokens_seen": 17222304864,
      "step": 21890
    },
    {
      "epoch": 2.322406110757479,
      "grad_norm": 0.4868695168490839,
      "learning_rate": 4.555209839063772e-05,
      "loss": 1.5957,
      "num_input_tokens_seen": 17223091648,
      "step": 21891
    },
    {
      "epoch": 2.3225122002970506,
      "grad_norm": 0.3976575579773917,
      "learning_rate": 4.555170269085909e-05,
      "loss": 1.5967,
      "num_input_tokens_seen": 17223878352,
      "step": 21892
    },
    {
      "epoch": 2.322618289836622,
      "grad_norm": 0.3712500554887672,
      "learning_rate": 4.5551306975198704e-05,
      "loss": 1.4277,
      "num_input_tokens_seen": 17224665136,
      "step": 21893
    },
    {
      "epoch": 2.3227243793761936,
      "grad_norm": 0.38872331333983046,
      "learning_rate": 4.5550911243656876e-05,
      "loss": 1.637,
      "num_input_tokens_seen": 17225451856,
      "step": 21894
    },
    {
      "epoch": 2.322830468915765,
      "grad_norm": 0.3620999261255058,
      "learning_rate": 4.55505154962339e-05,
      "loss": 1.5758,
      "num_input_tokens_seen": 17226238560,
      "step": 21895
    },
    {
      "epoch": 2.3229365584553365,
      "grad_norm": 0.34536501666408337,
      "learning_rate": 4.555011973293009e-05,
      "loss": 1.5531,
      "num_input_tokens_seen": 17227025360,
      "step": 21896
    },
    {
      "epoch": 2.3230426479949076,
      "grad_norm": 0.3402031782163417,
      "learning_rate": 4.554972395374575e-05,
      "loss": 1.6619,
      "num_input_tokens_seen": 17227812144,
      "step": 21897
    },
    {
      "epoch": 2.323148737534479,
      "grad_norm": 0.3397088496639114,
      "learning_rate": 4.5549328158681185e-05,
      "loss": 1.6324,
      "num_input_tokens_seen": 17228598864,
      "step": 21898
    },
    {
      "epoch": 2.3232548270740505,
      "grad_norm": 0.3909001627632185,
      "learning_rate": 4.5548932347736706e-05,
      "loss": 1.7286,
      "num_input_tokens_seen": 17229385616,
      "step": 21899
    },
    {
      "epoch": 2.323360916613622,
      "grad_norm": 0.35700928491376327,
      "learning_rate": 4.554853652091261e-05,
      "loss": 1.7182,
      "num_input_tokens_seen": 17230172352,
      "step": 21900
    },
    {
      "epoch": 2.3234670061531935,
      "grad_norm": 0.4706164935158606,
      "learning_rate": 4.554814067820922e-05,
      "loss": 1.5691,
      "num_input_tokens_seen": 17230959104,
      "step": 21901
    },
    {
      "epoch": 2.3235730956927645,
      "grad_norm": 0.3729330762886616,
      "learning_rate": 4.5547744819626815e-05,
      "loss": 1.6663,
      "num_input_tokens_seen": 17231745792,
      "step": 21902
    },
    {
      "epoch": 2.323679185232336,
      "grad_norm": 0.37280685908189864,
      "learning_rate": 4.554734894516573e-05,
      "loss": 1.6315,
      "num_input_tokens_seen": 17232532528,
      "step": 21903
    },
    {
      "epoch": 2.3237852747719074,
      "grad_norm": 0.4464220037905834,
      "learning_rate": 4.554695305482624e-05,
      "loss": 1.7185,
      "num_input_tokens_seen": 17233319328,
      "step": 21904
    },
    {
      "epoch": 2.323891364311479,
      "grad_norm": 0.38016595140045994,
      "learning_rate": 4.554655714860868e-05,
      "loss": 1.6405,
      "num_input_tokens_seen": 17234106112,
      "step": 21905
    },
    {
      "epoch": 2.3239974538510504,
      "grad_norm": 0.5758786043939128,
      "learning_rate": 4.554616122651334e-05,
      "loss": 1.6669,
      "num_input_tokens_seen": 17234892864,
      "step": 21906
    },
    {
      "epoch": 2.324103543390622,
      "grad_norm": 0.40684236709007404,
      "learning_rate": 4.5545765288540524e-05,
      "loss": 1.555,
      "num_input_tokens_seen": 17235679664,
      "step": 21907
    },
    {
      "epoch": 2.324209632930193,
      "grad_norm": 0.5194374907110612,
      "learning_rate": 4.554536933469055e-05,
      "loss": 1.5333,
      "num_input_tokens_seen": 17236466336,
      "step": 21908
    },
    {
      "epoch": 2.3243157224697644,
      "grad_norm": 0.4798817629233788,
      "learning_rate": 4.554497336496372e-05,
      "loss": 1.7277,
      "num_input_tokens_seen": 17237253040,
      "step": 21909
    },
    {
      "epoch": 2.324421812009336,
      "grad_norm": 0.4562697391772539,
      "learning_rate": 4.554457737936033e-05,
      "loss": 1.6033,
      "num_input_tokens_seen": 17238039824,
      "step": 21910
    },
    {
      "epoch": 2.3245279015489073,
      "grad_norm": 0.4982951224402582,
      "learning_rate": 4.5544181377880695e-05,
      "loss": 1.6404,
      "num_input_tokens_seen": 17238826576,
      "step": 21911
    },
    {
      "epoch": 2.324633991088479,
      "grad_norm": 0.4286488739129505,
      "learning_rate": 4.554378536052513e-05,
      "loss": 1.5837,
      "num_input_tokens_seen": 17239613296,
      "step": 21912
    },
    {
      "epoch": 2.3247400806280503,
      "grad_norm": 0.4370371416654076,
      "learning_rate": 4.5543389327293915e-05,
      "loss": 1.5627,
      "num_input_tokens_seen": 17240400176,
      "step": 21913
    },
    {
      "epoch": 2.3248461701676213,
      "grad_norm": 0.5805478461356682,
      "learning_rate": 4.554299327818738e-05,
      "loss": 1.7241,
      "num_input_tokens_seen": 17241186960,
      "step": 21914
    },
    {
      "epoch": 2.3249522597071928,
      "grad_norm": 0.46889426315326543,
      "learning_rate": 4.5542597213205815e-05,
      "loss": 1.5574,
      "num_input_tokens_seen": 17241973648,
      "step": 21915
    },
    {
      "epoch": 2.3250583492467642,
      "grad_norm": 0.5041373058060101,
      "learning_rate": 4.5542201132349544e-05,
      "loss": 1.6951,
      "num_input_tokens_seen": 17242760368,
      "step": 21916
    },
    {
      "epoch": 2.3251644387863357,
      "grad_norm": 0.4129091112809188,
      "learning_rate": 4.554180503561886e-05,
      "loss": 1.5979,
      "num_input_tokens_seen": 17243547104,
      "step": 21917
    },
    {
      "epoch": 2.325270528325907,
      "grad_norm": 0.4494174503013834,
      "learning_rate": 4.5541408923014065e-05,
      "loss": 1.6107,
      "num_input_tokens_seen": 17244333904,
      "step": 21918
    },
    {
      "epoch": 2.3253766178654782,
      "grad_norm": 0.40351778610468303,
      "learning_rate": 4.5541012794535474e-05,
      "loss": 1.5599,
      "num_input_tokens_seen": 17245120688,
      "step": 21919
    },
    {
      "epoch": 2.3254827074050497,
      "grad_norm": 0.47539022195626485,
      "learning_rate": 4.55406166501834e-05,
      "loss": 1.6305,
      "num_input_tokens_seen": 17245907488,
      "step": 21920
    },
    {
      "epoch": 2.325588796944621,
      "grad_norm": 0.4025346346964275,
      "learning_rate": 4.554022048995813e-05,
      "loss": 1.6474,
      "num_input_tokens_seen": 17246694288,
      "step": 21921
    },
    {
      "epoch": 2.3256948864841926,
      "grad_norm": 0.4665238703845958,
      "learning_rate": 4.553982431385999e-05,
      "loss": 1.7461,
      "num_input_tokens_seen": 17247480976,
      "step": 21922
    },
    {
      "epoch": 2.325800976023764,
      "grad_norm": 0.37078662245213057,
      "learning_rate": 4.5539428121889264e-05,
      "loss": 1.5496,
      "num_input_tokens_seen": 17248267744,
      "step": 21923
    },
    {
      "epoch": 2.3259070655633356,
      "grad_norm": 0.38982749575587883,
      "learning_rate": 4.553903191404628e-05,
      "loss": 1.6348,
      "num_input_tokens_seen": 17249054464,
      "step": 21924
    },
    {
      "epoch": 2.326013155102907,
      "grad_norm": 0.42461506382644626,
      "learning_rate": 4.553863569033133e-05,
      "loss": 1.6578,
      "num_input_tokens_seen": 17249841168,
      "step": 21925
    },
    {
      "epoch": 2.326119244642478,
      "grad_norm": 0.4875350414137839,
      "learning_rate": 4.553823945074473e-05,
      "loss": 1.592,
      "num_input_tokens_seen": 17250627968,
      "step": 21926
    },
    {
      "epoch": 2.3262253341820496,
      "grad_norm": 0.3697977070208335,
      "learning_rate": 4.553784319528678e-05,
      "loss": 1.4792,
      "num_input_tokens_seen": 17251414784,
      "step": 21927
    },
    {
      "epoch": 2.326331423721621,
      "grad_norm": 0.4125481821059361,
      "learning_rate": 4.5537446923957784e-05,
      "loss": 1.5643,
      "num_input_tokens_seen": 17252201648,
      "step": 21928
    },
    {
      "epoch": 2.3264375132611925,
      "grad_norm": 0.39979131463202455,
      "learning_rate": 4.553705063675805e-05,
      "loss": 1.6477,
      "num_input_tokens_seen": 17252988448,
      "step": 21929
    },
    {
      "epoch": 2.326543602800764,
      "grad_norm": 0.3736636534314891,
      "learning_rate": 4.553665433368789e-05,
      "loss": 1.5549,
      "num_input_tokens_seen": 17253775248,
      "step": 21930
    },
    {
      "epoch": 2.326649692340335,
      "grad_norm": 0.43075829200142574,
      "learning_rate": 4.553625801474761e-05,
      "loss": 1.5608,
      "num_input_tokens_seen": 17254561904,
      "step": 21931
    },
    {
      "epoch": 2.3267557818799065,
      "grad_norm": 0.4270597206520982,
      "learning_rate": 4.553586167993751e-05,
      "loss": 1.6706,
      "num_input_tokens_seen": 17255348752,
      "step": 21932
    },
    {
      "epoch": 2.326861871419478,
      "grad_norm": 0.3608309014147287,
      "learning_rate": 4.5535465329257884e-05,
      "loss": 1.6049,
      "num_input_tokens_seen": 17256135520,
      "step": 21933
    },
    {
      "epoch": 2.3269679609590495,
      "grad_norm": 0.39296962639046185,
      "learning_rate": 4.553506896270907e-05,
      "loss": 1.5527,
      "num_input_tokens_seen": 17256922272,
      "step": 21934
    },
    {
      "epoch": 2.327074050498621,
      "grad_norm": 0.39100537068225716,
      "learning_rate": 4.5534672580291355e-05,
      "loss": 1.6774,
      "num_input_tokens_seen": 17257709056,
      "step": 21935
    },
    {
      "epoch": 2.3271801400381924,
      "grad_norm": 0.332444225611932,
      "learning_rate": 4.553427618200504e-05,
      "loss": 1.508,
      "num_input_tokens_seen": 17258495808,
      "step": 21936
    },
    {
      "epoch": 2.327286229577764,
      "grad_norm": 0.3395561992363737,
      "learning_rate": 4.5533879767850454e-05,
      "loss": 1.5791,
      "num_input_tokens_seen": 17259282640,
      "step": 21937
    },
    {
      "epoch": 2.327392319117335,
      "grad_norm": 0.40126290323552816,
      "learning_rate": 4.553348333782787e-05,
      "loss": 1.6474,
      "num_input_tokens_seen": 17260069344,
      "step": 21938
    },
    {
      "epoch": 2.3274984086569064,
      "grad_norm": 0.39173353485351453,
      "learning_rate": 4.553308689193763e-05,
      "loss": 1.6098,
      "num_input_tokens_seen": 17260856112,
      "step": 21939
    },
    {
      "epoch": 2.327604498196478,
      "grad_norm": 0.48598344408007604,
      "learning_rate": 4.5532690430180005e-05,
      "loss": 1.6647,
      "num_input_tokens_seen": 17261642864,
      "step": 21940
    },
    {
      "epoch": 2.3277105877360493,
      "grad_norm": 0.4054889654716872,
      "learning_rate": 4.553229395255533e-05,
      "loss": 1.5917,
      "num_input_tokens_seen": 17262429760,
      "step": 21941
    },
    {
      "epoch": 2.327816677275621,
      "grad_norm": 0.5245235917854666,
      "learning_rate": 4.55318974590639e-05,
      "loss": 1.7509,
      "num_input_tokens_seen": 17263216512,
      "step": 21942
    },
    {
      "epoch": 2.327922766815192,
      "grad_norm": 0.4008074823003954,
      "learning_rate": 4.553150094970602e-05,
      "loss": 1.6959,
      "num_input_tokens_seen": 17264003328,
      "step": 21943
    },
    {
      "epoch": 2.3280288563547633,
      "grad_norm": 0.5825651284161533,
      "learning_rate": 4.5531104424481996e-05,
      "loss": 1.4768,
      "num_input_tokens_seen": 17264790160,
      "step": 21944
    },
    {
      "epoch": 2.328134945894335,
      "grad_norm": 0.46226192727018006,
      "learning_rate": 4.553070788339214e-05,
      "loss": 1.5492,
      "num_input_tokens_seen": 17265576976,
      "step": 21945
    },
    {
      "epoch": 2.3282410354339063,
      "grad_norm": 0.4838271218901521,
      "learning_rate": 4.553031132643676e-05,
      "loss": 1.6105,
      "num_input_tokens_seen": 17266363712,
      "step": 21946
    },
    {
      "epoch": 2.3283471249734777,
      "grad_norm": 0.5056452834457799,
      "learning_rate": 4.552991475361615e-05,
      "loss": 1.6375,
      "num_input_tokens_seen": 17267150464,
      "step": 21947
    },
    {
      "epoch": 2.328453214513049,
      "grad_norm": 0.42970706870941566,
      "learning_rate": 4.552951816493063e-05,
      "loss": 1.6921,
      "num_input_tokens_seen": 17267937232,
      "step": 21948
    },
    {
      "epoch": 2.3285593040526202,
      "grad_norm": 0.5423183810017087,
      "learning_rate": 4.552912156038049e-05,
      "loss": 1.5894,
      "num_input_tokens_seen": 17268724016,
      "step": 21949
    },
    {
      "epoch": 2.3286653935921917,
      "grad_norm": 0.4031949175786489,
      "learning_rate": 4.5528724939966064e-05,
      "loss": 1.6351,
      "num_input_tokens_seen": 17269510832,
      "step": 21950
    },
    {
      "epoch": 2.328771483131763,
      "grad_norm": 0.4514777477519936,
      "learning_rate": 4.552832830368763e-05,
      "loss": 1.585,
      "num_input_tokens_seen": 17270297568,
      "step": 21951
    },
    {
      "epoch": 2.3288775726713347,
      "grad_norm": 0.37056976427931326,
      "learning_rate": 4.552793165154551e-05,
      "loss": 1.5528,
      "num_input_tokens_seen": 17271084432,
      "step": 21952
    },
    {
      "epoch": 2.328983662210906,
      "grad_norm": 0.44690516555025134,
      "learning_rate": 4.5527534983540005e-05,
      "loss": 1.6583,
      "num_input_tokens_seen": 17271871216,
      "step": 21953
    },
    {
      "epoch": 2.3290897517504776,
      "grad_norm": 0.42932567471404404,
      "learning_rate": 4.5527138299671424e-05,
      "loss": 1.5806,
      "num_input_tokens_seen": 17272657984,
      "step": 21954
    },
    {
      "epoch": 2.3291958412900486,
      "grad_norm": 0.5057295411232826,
      "learning_rate": 4.552674159994007e-05,
      "loss": 1.7101,
      "num_input_tokens_seen": 17273444816,
      "step": 21955
    },
    {
      "epoch": 2.32930193082962,
      "grad_norm": 0.37297246903777537,
      "learning_rate": 4.552634488434626e-05,
      "loss": 1.6375,
      "num_input_tokens_seen": 17274231568,
      "step": 21956
    },
    {
      "epoch": 2.3294080203691916,
      "grad_norm": 0.42092454073457475,
      "learning_rate": 4.552594815289028e-05,
      "loss": 1.5166,
      "num_input_tokens_seen": 17275018336,
      "step": 21957
    },
    {
      "epoch": 2.329514109908763,
      "grad_norm": 0.4276173077955757,
      "learning_rate": 4.552555140557246e-05,
      "loss": 1.6676,
      "num_input_tokens_seen": 17275805184,
      "step": 21958
    },
    {
      "epoch": 2.3296201994483345,
      "grad_norm": 0.34572910361276815,
      "learning_rate": 4.55251546423931e-05,
      "loss": 1.4955,
      "num_input_tokens_seen": 17276591984,
      "step": 21959
    },
    {
      "epoch": 2.3297262889879056,
      "grad_norm": 0.4184774414339233,
      "learning_rate": 4.55247578633525e-05,
      "loss": 1.6341,
      "num_input_tokens_seen": 17277378688,
      "step": 21960
    },
    {
      "epoch": 2.329832378527477,
      "grad_norm": 0.41787008711707535,
      "learning_rate": 4.552436106845096e-05,
      "loss": 1.6089,
      "num_input_tokens_seen": 17278165504,
      "step": 21961
    },
    {
      "epoch": 2.3299384680670485,
      "grad_norm": 0.41653834922131094,
      "learning_rate": 4.55239642576888e-05,
      "loss": 1.6198,
      "num_input_tokens_seen": 17278952320,
      "step": 21962
    },
    {
      "epoch": 2.33004455760662,
      "grad_norm": 0.41394159280953075,
      "learning_rate": 4.5523567431066324e-05,
      "loss": 1.5839,
      "num_input_tokens_seen": 17279739136,
      "step": 21963
    },
    {
      "epoch": 2.3301506471461915,
      "grad_norm": 0.3757902047270854,
      "learning_rate": 4.552317058858384e-05,
      "loss": 1.498,
      "num_input_tokens_seen": 17280525936,
      "step": 21964
    },
    {
      "epoch": 2.330256736685763,
      "grad_norm": 0.3664582048449711,
      "learning_rate": 4.552277373024165e-05,
      "loss": 1.5588,
      "num_input_tokens_seen": 17281312656,
      "step": 21965
    },
    {
      "epoch": 2.3303628262253344,
      "grad_norm": 0.3901605840670408,
      "learning_rate": 4.552237685604007e-05,
      "loss": 1.6112,
      "num_input_tokens_seen": 17282099424,
      "step": 21966
    },
    {
      "epoch": 2.3304689157649054,
      "grad_norm": 0.34983362847088756,
      "learning_rate": 4.552197996597939e-05,
      "loss": 1.5033,
      "num_input_tokens_seen": 17282886240,
      "step": 21967
    },
    {
      "epoch": 2.330575005304477,
      "grad_norm": 0.41526989408914694,
      "learning_rate": 4.552158306005992e-05,
      "loss": 1.6346,
      "num_input_tokens_seen": 17283672992,
      "step": 21968
    },
    {
      "epoch": 2.3306810948440484,
      "grad_norm": 0.3706622390665225,
      "learning_rate": 4.552118613828199e-05,
      "loss": 1.6715,
      "num_input_tokens_seen": 17284459776,
      "step": 21969
    },
    {
      "epoch": 2.33078718438362,
      "grad_norm": 0.36781241260308306,
      "learning_rate": 4.552078920064587e-05,
      "loss": 1.5884,
      "num_input_tokens_seen": 17285246592,
      "step": 21970
    },
    {
      "epoch": 2.3308932739231913,
      "grad_norm": 0.3751635612771665,
      "learning_rate": 4.5520392247151905e-05,
      "loss": 1.6812,
      "num_input_tokens_seen": 17286033312,
      "step": 21971
    },
    {
      "epoch": 2.3309993634627624,
      "grad_norm": 0.4036198868173837,
      "learning_rate": 4.551999527780038e-05,
      "loss": 1.7048,
      "num_input_tokens_seen": 17286820096,
      "step": 21972
    },
    {
      "epoch": 2.331105453002334,
      "grad_norm": 0.36837726410564914,
      "learning_rate": 4.551959829259159e-05,
      "loss": 1.5129,
      "num_input_tokens_seen": 17287606896,
      "step": 21973
    },
    {
      "epoch": 2.3312115425419053,
      "grad_norm": 0.36779557834239057,
      "learning_rate": 4.551920129152587e-05,
      "loss": 1.4623,
      "num_input_tokens_seen": 17288393696,
      "step": 21974
    },
    {
      "epoch": 2.331317632081477,
      "grad_norm": 0.40135103553768026,
      "learning_rate": 4.551880427460351e-05,
      "loss": 1.6463,
      "num_input_tokens_seen": 17289180432,
      "step": 21975
    },
    {
      "epoch": 2.3314237216210483,
      "grad_norm": 0.3589055365523176,
      "learning_rate": 4.551840724182482e-05,
      "loss": 1.5914,
      "num_input_tokens_seen": 17289967184,
      "step": 21976
    },
    {
      "epoch": 2.3315298111606197,
      "grad_norm": 0.35934535082514074,
      "learning_rate": 4.55180101931901e-05,
      "loss": 1.5445,
      "num_input_tokens_seen": 17290754000,
      "step": 21977
    },
    {
      "epoch": 2.3316359007001908,
      "grad_norm": 0.40799206835505236,
      "learning_rate": 4.551761312869968e-05,
      "loss": 1.7081,
      "num_input_tokens_seen": 17291540672,
      "step": 21978
    },
    {
      "epoch": 2.3317419902397623,
      "grad_norm": 0.37397720486550434,
      "learning_rate": 4.551721604835384e-05,
      "loss": 1.7794,
      "num_input_tokens_seen": 17292327296,
      "step": 21979
    },
    {
      "epoch": 2.3318480797793337,
      "grad_norm": 0.3923006975143398,
      "learning_rate": 4.5516818952152894e-05,
      "loss": 1.7311,
      "num_input_tokens_seen": 17293113936,
      "step": 21980
    },
    {
      "epoch": 2.331954169318905,
      "grad_norm": 0.39761006320716663,
      "learning_rate": 4.551642184009716e-05,
      "loss": 1.6374,
      "num_input_tokens_seen": 17293900688,
      "step": 21981
    },
    {
      "epoch": 2.3320602588584767,
      "grad_norm": 0.34717629766630775,
      "learning_rate": 4.551602471218693e-05,
      "loss": 1.5945,
      "num_input_tokens_seen": 17294687440,
      "step": 21982
    },
    {
      "epoch": 2.332166348398048,
      "grad_norm": 0.37658935551144734,
      "learning_rate": 4.551562756842252e-05,
      "loss": 1.643,
      "num_input_tokens_seen": 17295474192,
      "step": 21983
    },
    {
      "epoch": 2.332272437937619,
      "grad_norm": 0.34750972948285413,
      "learning_rate": 4.551523040880423e-05,
      "loss": 1.5617,
      "num_input_tokens_seen": 17296261024,
      "step": 21984
    },
    {
      "epoch": 2.3323785274771907,
      "grad_norm": 0.3794966604683024,
      "learning_rate": 4.5514833233332386e-05,
      "loss": 1.6382,
      "num_input_tokens_seen": 17297047744,
      "step": 21985
    },
    {
      "epoch": 2.332484617016762,
      "grad_norm": 0.3613184225373739,
      "learning_rate": 4.551443604200727e-05,
      "loss": 1.5247,
      "num_input_tokens_seen": 17297834464,
      "step": 21986
    },
    {
      "epoch": 2.3325907065563336,
      "grad_norm": 0.3656972894388643,
      "learning_rate": 4.551403883482921e-05,
      "loss": 1.5937,
      "num_input_tokens_seen": 17298621200,
      "step": 21987
    },
    {
      "epoch": 2.332696796095905,
      "grad_norm": 0.39159163893707677,
      "learning_rate": 4.551364161179849e-05,
      "loss": 1.6282,
      "num_input_tokens_seen": 17299408000,
      "step": 21988
    },
    {
      "epoch": 2.332802885635476,
      "grad_norm": 0.3700720654848804,
      "learning_rate": 4.5513244372915434e-05,
      "loss": 1.6465,
      "num_input_tokens_seen": 17300194688,
      "step": 21989
    },
    {
      "epoch": 2.3329089751750476,
      "grad_norm": 0.3797274689260871,
      "learning_rate": 4.5512847118180345e-05,
      "loss": 1.5806,
      "num_input_tokens_seen": 17300981424,
      "step": 21990
    },
    {
      "epoch": 2.333015064714619,
      "grad_norm": 0.40829541564295935,
      "learning_rate": 4.551244984759353e-05,
      "loss": 1.5835,
      "num_input_tokens_seen": 17301768192,
      "step": 21991
    },
    {
      "epoch": 2.3331211542541905,
      "grad_norm": 0.38563083333312576,
      "learning_rate": 4.5512052561155305e-05,
      "loss": 1.6497,
      "num_input_tokens_seen": 17302555008,
      "step": 21992
    },
    {
      "epoch": 2.333227243793762,
      "grad_norm": 0.38783433901303777,
      "learning_rate": 4.551165525886595e-05,
      "loss": 1.5008,
      "num_input_tokens_seen": 17303341712,
      "step": 21993
    },
    {
      "epoch": 2.3333333333333335,
      "grad_norm": 0.34499652606805803,
      "learning_rate": 4.5511257940725804e-05,
      "loss": 1.4113,
      "num_input_tokens_seen": 17304128496,
      "step": 21994
    },
    {
      "epoch": 2.333439422872905,
      "grad_norm": 0.4030286009229002,
      "learning_rate": 4.551086060673515e-05,
      "loss": 1.7618,
      "num_input_tokens_seen": 17304915216,
      "step": 21995
    },
    {
      "epoch": 2.333545512412476,
      "grad_norm": 0.3868168358474434,
      "learning_rate": 4.551046325689431e-05,
      "loss": 1.5389,
      "num_input_tokens_seen": 17305701888,
      "step": 21996
    },
    {
      "epoch": 2.3336516019520475,
      "grad_norm": 0.4003052902513133,
      "learning_rate": 4.551006589120358e-05,
      "loss": 1.5414,
      "num_input_tokens_seen": 17306488768,
      "step": 21997
    },
    {
      "epoch": 2.333757691491619,
      "grad_norm": 0.593098200368116,
      "learning_rate": 4.5509668509663283e-05,
      "loss": 1.6724,
      "num_input_tokens_seen": 17307275472,
      "step": 21998
    },
    {
      "epoch": 2.3338637810311904,
      "grad_norm": 0.5610844924463327,
      "learning_rate": 4.550927111227371e-05,
      "loss": 1.6402,
      "num_input_tokens_seen": 17308062128,
      "step": 21999
    },
    {
      "epoch": 2.333969870570762,
      "grad_norm": 0.44556584681250067,
      "learning_rate": 4.550887369903518e-05,
      "loss": 1.5678,
      "num_input_tokens_seen": 17308848896,
      "step": 22000
    },
    {
      "epoch": 2.333969870570762,
      "eval_loss": 1.6876192092895508,
      "eval_runtime": 65.3041,
      "eval_samples_per_second": 45.939,
      "eval_steps_per_second": 0.49,
      "num_input_tokens_seen": 17308848896,
      "step": 22000
    },
    {
      "epoch": 2.334075960110333,
      "grad_norm": 0.3726500934669926,
      "learning_rate": 4.5508476269947985e-05,
      "loss": 1.6029,
      "num_input_tokens_seen": 17309635696,
      "step": 22001
    },
    {
      "epoch": 2.3341820496499044,
      "grad_norm": 0.44728138885468716,
      "learning_rate": 4.550807882501245e-05,
      "loss": 1.6397,
      "num_input_tokens_seen": 17310422416,
      "step": 22002
    },
    {
      "epoch": 2.334288139189476,
      "grad_norm": 0.373731624243259,
      "learning_rate": 4.550768136422886e-05,
      "loss": 1.5188,
      "num_input_tokens_seen": 17311209232,
      "step": 22003
    },
    {
      "epoch": 2.3343942287290473,
      "grad_norm": 0.41957850869958846,
      "learning_rate": 4.550728388759755e-05,
      "loss": 1.6518,
      "num_input_tokens_seen": 17311995936,
      "step": 22004
    },
    {
      "epoch": 2.334500318268619,
      "grad_norm": 0.38857674550180576,
      "learning_rate": 4.550688639511881e-05,
      "loss": 1.5081,
      "num_input_tokens_seen": 17312782768,
      "step": 22005
    },
    {
      "epoch": 2.3346064078081903,
      "grad_norm": 0.3776980374108215,
      "learning_rate": 4.550648888679294e-05,
      "loss": 1.5921,
      "num_input_tokens_seen": 17313569440,
      "step": 22006
    },
    {
      "epoch": 2.3347124973477613,
      "grad_norm": 0.39737504504414356,
      "learning_rate": 4.550609136262026e-05,
      "loss": 1.6205,
      "num_input_tokens_seen": 17314356176,
      "step": 22007
    },
    {
      "epoch": 2.334818586887333,
      "grad_norm": 0.4146363234308493,
      "learning_rate": 4.550569382260109e-05,
      "loss": 1.798,
      "num_input_tokens_seen": 17315143040,
      "step": 22008
    },
    {
      "epoch": 2.3349246764269043,
      "grad_norm": 0.3583309892136708,
      "learning_rate": 4.550529626673571e-05,
      "loss": 1.5944,
      "num_input_tokens_seen": 17315929680,
      "step": 22009
    },
    {
      "epoch": 2.3350307659664757,
      "grad_norm": 0.40301350188109963,
      "learning_rate": 4.5504898695024435e-05,
      "loss": 1.6778,
      "num_input_tokens_seen": 17316716464,
      "step": 22010
    },
    {
      "epoch": 2.335136855506047,
      "grad_norm": 0.3984355525148097,
      "learning_rate": 4.550450110746758e-05,
      "loss": 1.6336,
      "num_input_tokens_seen": 17317503120,
      "step": 22011
    },
    {
      "epoch": 2.3352429450456187,
      "grad_norm": 0.37190599158417664,
      "learning_rate": 4.550410350406544e-05,
      "loss": 1.68,
      "num_input_tokens_seen": 17318289968,
      "step": 22012
    },
    {
      "epoch": 2.3353490345851897,
      "grad_norm": 0.41253664153461667,
      "learning_rate": 4.5503705884818345e-05,
      "loss": 1.6023,
      "num_input_tokens_seen": 17319076704,
      "step": 22013
    },
    {
      "epoch": 2.335455124124761,
      "grad_norm": 0.35171959969690175,
      "learning_rate": 4.550330824972658e-05,
      "loss": 1.558,
      "num_input_tokens_seen": 17319863472,
      "step": 22014
    },
    {
      "epoch": 2.3355612136643327,
      "grad_norm": 0.35188073828863553,
      "learning_rate": 4.550291059879046e-05,
      "loss": 1.6368,
      "num_input_tokens_seen": 17320650192,
      "step": 22015
    },
    {
      "epoch": 2.335667303203904,
      "grad_norm": 0.4179059252174466,
      "learning_rate": 4.5502512932010294e-05,
      "loss": 1.6278,
      "num_input_tokens_seen": 17321436928,
      "step": 22016
    },
    {
      "epoch": 2.3357733927434756,
      "grad_norm": 0.3571922690607086,
      "learning_rate": 4.550211524938638e-05,
      "loss": 1.7182,
      "num_input_tokens_seen": 17322223664,
      "step": 22017
    },
    {
      "epoch": 2.3358794822830466,
      "grad_norm": 0.4301229010885614,
      "learning_rate": 4.550171755091904e-05,
      "loss": 1.5846,
      "num_input_tokens_seen": 17323010400,
      "step": 22018
    },
    {
      "epoch": 2.335985571822618,
      "grad_norm": 0.38187291885785624,
      "learning_rate": 4.5501319836608583e-05,
      "loss": 1.6666,
      "num_input_tokens_seen": 17323797120,
      "step": 22019
    },
    {
      "epoch": 2.3360916613621896,
      "grad_norm": 0.4272793174476238,
      "learning_rate": 4.550092210645529e-05,
      "loss": 1.4256,
      "num_input_tokens_seen": 17324583904,
      "step": 22020
    },
    {
      "epoch": 2.336197750901761,
      "grad_norm": 0.41018190730401205,
      "learning_rate": 4.5500524360459494e-05,
      "loss": 1.7342,
      "num_input_tokens_seen": 17325370672,
      "step": 22021
    },
    {
      "epoch": 2.3363038404413325,
      "grad_norm": 0.34875093085060527,
      "learning_rate": 4.5500126598621494e-05,
      "loss": 1.5442,
      "num_input_tokens_seen": 17326157408,
      "step": 22022
    },
    {
      "epoch": 2.336409929980904,
      "grad_norm": 0.4893843254120756,
      "learning_rate": 4.54997288209416e-05,
      "loss": 1.5687,
      "num_input_tokens_seen": 17326944224,
      "step": 22023
    },
    {
      "epoch": 2.3365160195204755,
      "grad_norm": 0.4029626207868241,
      "learning_rate": 4.5499331027420115e-05,
      "loss": 1.6482,
      "num_input_tokens_seen": 17327731040,
      "step": 22024
    },
    {
      "epoch": 2.3366221090600465,
      "grad_norm": 0.40239986622617596,
      "learning_rate": 4.549893321805735e-05,
      "loss": 1.6068,
      "num_input_tokens_seen": 17328517840,
      "step": 22025
    },
    {
      "epoch": 2.336728198599618,
      "grad_norm": 0.4600543249094805,
      "learning_rate": 4.549853539285362e-05,
      "loss": 1.7234,
      "num_input_tokens_seen": 17329304560,
      "step": 22026
    },
    {
      "epoch": 2.3368342881391895,
      "grad_norm": 0.38216221298593406,
      "learning_rate": 4.549813755180921e-05,
      "loss": 1.5708,
      "num_input_tokens_seen": 17330091376,
      "step": 22027
    },
    {
      "epoch": 2.336940377678761,
      "grad_norm": 0.44806298978289116,
      "learning_rate": 4.5497739694924434e-05,
      "loss": 1.7253,
      "num_input_tokens_seen": 17330878128,
      "step": 22028
    },
    {
      "epoch": 2.3370464672183324,
      "grad_norm": 0.4248405536405366,
      "learning_rate": 4.5497341822199616e-05,
      "loss": 1.5848,
      "num_input_tokens_seen": 17331664960,
      "step": 22029
    },
    {
      "epoch": 2.3371525567579035,
      "grad_norm": 0.3314044640111682,
      "learning_rate": 4.549694393363506e-05,
      "loss": 1.4153,
      "num_input_tokens_seen": 17332451808,
      "step": 22030
    },
    {
      "epoch": 2.337258646297475,
      "grad_norm": 0.3951196147152458,
      "learning_rate": 4.549654602923106e-05,
      "loss": 1.6123,
      "num_input_tokens_seen": 17333238496,
      "step": 22031
    },
    {
      "epoch": 2.3373647358370464,
      "grad_norm": 0.37115378823778905,
      "learning_rate": 4.549614810898793e-05,
      "loss": 1.615,
      "num_input_tokens_seen": 17334025248,
      "step": 22032
    },
    {
      "epoch": 2.337470825376618,
      "grad_norm": 0.39571632539591056,
      "learning_rate": 4.5495750172905976e-05,
      "loss": 1.6343,
      "num_input_tokens_seen": 17334811968,
      "step": 22033
    },
    {
      "epoch": 2.3375769149161894,
      "grad_norm": 0.3416276130277148,
      "learning_rate": 4.549535222098551e-05,
      "loss": 1.4663,
      "num_input_tokens_seen": 17335598720,
      "step": 22034
    },
    {
      "epoch": 2.337683004455761,
      "grad_norm": 0.3790200424993146,
      "learning_rate": 4.549495425322684e-05,
      "loss": 1.5991,
      "num_input_tokens_seen": 17336385456,
      "step": 22035
    },
    {
      "epoch": 2.3377890939953323,
      "grad_norm": 0.3673869435279151,
      "learning_rate": 4.5494556269630275e-05,
      "loss": 1.5742,
      "num_input_tokens_seen": 17337172272,
      "step": 22036
    },
    {
      "epoch": 2.3378951835349033,
      "grad_norm": 0.3664054477458044,
      "learning_rate": 4.5494158270196104e-05,
      "loss": 1.5878,
      "num_input_tokens_seen": 17337958992,
      "step": 22037
    },
    {
      "epoch": 2.338001273074475,
      "grad_norm": 0.3524690434132436,
      "learning_rate": 4.549376025492466e-05,
      "loss": 1.6027,
      "num_input_tokens_seen": 17338745840,
      "step": 22038
    },
    {
      "epoch": 2.3381073626140463,
      "grad_norm": 0.38270003285748877,
      "learning_rate": 4.5493362223816235e-05,
      "loss": 1.7396,
      "num_input_tokens_seen": 17339532544,
      "step": 22039
    },
    {
      "epoch": 2.3382134521536178,
      "grad_norm": 0.3503192937929676,
      "learning_rate": 4.5492964176871146e-05,
      "loss": 1.5598,
      "num_input_tokens_seen": 17340319264,
      "step": 22040
    },
    {
      "epoch": 2.3383195416931892,
      "grad_norm": 0.41911766222047736,
      "learning_rate": 4.5492566114089686e-05,
      "loss": 1.7562,
      "num_input_tokens_seen": 17341106000,
      "step": 22041
    },
    {
      "epoch": 2.3384256312327603,
      "grad_norm": 0.3289812675318606,
      "learning_rate": 4.5492168035472185e-05,
      "loss": 1.5855,
      "num_input_tokens_seen": 17341892784,
      "step": 22042
    },
    {
      "epoch": 2.3385317207723317,
      "grad_norm": 0.45212463094937344,
      "learning_rate": 4.549176994101892e-05,
      "loss": 1.5554,
      "num_input_tokens_seen": 17342679568,
      "step": 22043
    },
    {
      "epoch": 2.338637810311903,
      "grad_norm": 0.39113776783510995,
      "learning_rate": 4.5491371830730236e-05,
      "loss": 1.832,
      "num_input_tokens_seen": 17343466256,
      "step": 22044
    },
    {
      "epoch": 2.3387438998514747,
      "grad_norm": 0.42743469656247834,
      "learning_rate": 4.549097370460641e-05,
      "loss": 1.6872,
      "num_input_tokens_seen": 17344253008,
      "step": 22045
    },
    {
      "epoch": 2.338849989391046,
      "grad_norm": 0.48552287219758367,
      "learning_rate": 4.549057556264776e-05,
      "loss": 1.6972,
      "num_input_tokens_seen": 17345039760,
      "step": 22046
    },
    {
      "epoch": 2.3389560789306176,
      "grad_norm": 0.3704614694888703,
      "learning_rate": 4.54901774048546e-05,
      "loss": 1.6351,
      "num_input_tokens_seen": 17345826464,
      "step": 22047
    },
    {
      "epoch": 2.3390621684701887,
      "grad_norm": 0.38519447271572355,
      "learning_rate": 4.548977923122724e-05,
      "loss": 1.5965,
      "num_input_tokens_seen": 17346613120,
      "step": 22048
    },
    {
      "epoch": 2.33916825800976,
      "grad_norm": 0.3739906464588593,
      "learning_rate": 4.548938104176596e-05,
      "loss": 1.5506,
      "num_input_tokens_seen": 17347399824,
      "step": 22049
    },
    {
      "epoch": 2.3392743475493316,
      "grad_norm": 0.35600102397688116,
      "learning_rate": 4.548898283647109e-05,
      "loss": 1.6147,
      "num_input_tokens_seen": 17348186528,
      "step": 22050
    },
    {
      "epoch": 2.339380437088903,
      "grad_norm": 0.49452632806391666,
      "learning_rate": 4.5488584615342954e-05,
      "loss": 1.6761,
      "num_input_tokens_seen": 17348973360,
      "step": 22051
    },
    {
      "epoch": 2.3394865266284746,
      "grad_norm": 0.3725473626226797,
      "learning_rate": 4.5488186378381826e-05,
      "loss": 1.6033,
      "num_input_tokens_seen": 17349760160,
      "step": 22052
    },
    {
      "epoch": 2.339592616168046,
      "grad_norm": 0.4574299410223745,
      "learning_rate": 4.548778812558803e-05,
      "loss": 1.4824,
      "num_input_tokens_seen": 17350547008,
      "step": 22053
    },
    {
      "epoch": 2.339698705707617,
      "grad_norm": 0.4415022853815329,
      "learning_rate": 4.548738985696188e-05,
      "loss": 1.6351,
      "num_input_tokens_seen": 17351333776,
      "step": 22054
    },
    {
      "epoch": 2.3398047952471885,
      "grad_norm": 0.435505833996368,
      "learning_rate": 4.548699157250367e-05,
      "loss": 1.7589,
      "num_input_tokens_seen": 17352120560,
      "step": 22055
    },
    {
      "epoch": 2.33991088478676,
      "grad_norm": 0.5429327411568037,
      "learning_rate": 4.5486593272213716e-05,
      "loss": 1.5212,
      "num_input_tokens_seen": 17352907344,
      "step": 22056
    },
    {
      "epoch": 2.3400169743263315,
      "grad_norm": 0.4748966109631516,
      "learning_rate": 4.5486194956092324e-05,
      "loss": 1.7016,
      "num_input_tokens_seen": 17353694064,
      "step": 22057
    },
    {
      "epoch": 2.340123063865903,
      "grad_norm": 0.5565120021093201,
      "learning_rate": 4.54857966241398e-05,
      "loss": 1.5192,
      "num_input_tokens_seen": 17354480880,
      "step": 22058
    },
    {
      "epoch": 2.340229153405474,
      "grad_norm": 0.3940703888022847,
      "learning_rate": 4.548539827635645e-05,
      "loss": 1.3486,
      "num_input_tokens_seen": 17355267696,
      "step": 22059
    },
    {
      "epoch": 2.3403352429450455,
      "grad_norm": 0.4935686634333459,
      "learning_rate": 4.5484999912742585e-05,
      "loss": 1.6251,
      "num_input_tokens_seen": 17356054432,
      "step": 22060
    },
    {
      "epoch": 2.340441332484617,
      "grad_norm": 0.5519939777717363,
      "learning_rate": 4.548460153329852e-05,
      "loss": 1.649,
      "num_input_tokens_seen": 17356841232,
      "step": 22061
    },
    {
      "epoch": 2.3405474220241884,
      "grad_norm": 0.40681842536985124,
      "learning_rate": 4.5484203138024556e-05,
      "loss": 1.6765,
      "num_input_tokens_seen": 17357627984,
      "step": 22062
    },
    {
      "epoch": 2.34065351156376,
      "grad_norm": 0.6224022125300248,
      "learning_rate": 4.5483804726920996e-05,
      "loss": 1.6311,
      "num_input_tokens_seen": 17358414784,
      "step": 22063
    },
    {
      "epoch": 2.3407596011033314,
      "grad_norm": 0.44282412699203977,
      "learning_rate": 4.548340629998816e-05,
      "loss": 1.5964,
      "num_input_tokens_seen": 17359201504,
      "step": 22064
    },
    {
      "epoch": 2.340865690642903,
      "grad_norm": 0.6266423747537307,
      "learning_rate": 4.548300785722634e-05,
      "loss": 1.6,
      "num_input_tokens_seen": 17359988224,
      "step": 22065
    },
    {
      "epoch": 2.340971780182474,
      "grad_norm": 0.4057156770813411,
      "learning_rate": 4.548260939863586e-05,
      "loss": 1.5574,
      "num_input_tokens_seen": 17360775040,
      "step": 22066
    },
    {
      "epoch": 2.3410778697220453,
      "grad_norm": 0.38304420629821867,
      "learning_rate": 4.548221092421701e-05,
      "loss": 1.5608,
      "num_input_tokens_seen": 17361561856,
      "step": 22067
    },
    {
      "epoch": 2.341183959261617,
      "grad_norm": 0.47295316985891506,
      "learning_rate": 4.5481812433970115e-05,
      "loss": 1.6353,
      "num_input_tokens_seen": 17362348624,
      "step": 22068
    },
    {
      "epoch": 2.3412900488011883,
      "grad_norm": 0.4159623794426632,
      "learning_rate": 4.548141392789548e-05,
      "loss": 1.6061,
      "num_input_tokens_seen": 17363135440,
      "step": 22069
    },
    {
      "epoch": 2.3413961383407598,
      "grad_norm": 0.3898955364318569,
      "learning_rate": 4.5481015405993396e-05,
      "loss": 1.6465,
      "num_input_tokens_seen": 17363922128,
      "step": 22070
    },
    {
      "epoch": 2.341502227880331,
      "grad_norm": 0.38144849687297966,
      "learning_rate": 4.5480616868264204e-05,
      "loss": 1.5689,
      "num_input_tokens_seen": 17364708976,
      "step": 22071
    },
    {
      "epoch": 2.3416083174199023,
      "grad_norm": 0.37381935923470144,
      "learning_rate": 4.548021831470818e-05,
      "loss": 1.688,
      "num_input_tokens_seen": 17365495776,
      "step": 22072
    },
    {
      "epoch": 2.3417144069594737,
      "grad_norm": 0.37717874837823473,
      "learning_rate": 4.5479819745325645e-05,
      "loss": 1.6001,
      "num_input_tokens_seen": 17366282544,
      "step": 22073
    },
    {
      "epoch": 2.3418204964990452,
      "grad_norm": 0.382850636994588,
      "learning_rate": 4.547942116011691e-05,
      "loss": 1.6479,
      "num_input_tokens_seen": 17367069360,
      "step": 22074
    },
    {
      "epoch": 2.3419265860386167,
      "grad_norm": 0.37917110300212975,
      "learning_rate": 4.547902255908228e-05,
      "loss": 1.5959,
      "num_input_tokens_seen": 17367856112,
      "step": 22075
    },
    {
      "epoch": 2.342032675578188,
      "grad_norm": 0.3418646308079106,
      "learning_rate": 4.5478623942222054e-05,
      "loss": 1.575,
      "num_input_tokens_seen": 17368642816,
      "step": 22076
    },
    {
      "epoch": 2.342138765117759,
      "grad_norm": 0.3880097011610187,
      "learning_rate": 4.547822530953655e-05,
      "loss": 1.5951,
      "num_input_tokens_seen": 17369429600,
      "step": 22077
    },
    {
      "epoch": 2.3422448546573307,
      "grad_norm": 0.4523253574149829,
      "learning_rate": 4.547782666102608e-05,
      "loss": 1.6077,
      "num_input_tokens_seen": 17370216384,
      "step": 22078
    },
    {
      "epoch": 2.342350944196902,
      "grad_norm": 0.4089600722732852,
      "learning_rate": 4.547742799669095e-05,
      "loss": 1.6184,
      "num_input_tokens_seen": 17371003104,
      "step": 22079
    },
    {
      "epoch": 2.3424570337364736,
      "grad_norm": 0.34348525503748223,
      "learning_rate": 4.547702931653145e-05,
      "loss": 1.5779,
      "num_input_tokens_seen": 17371789888,
      "step": 22080
    },
    {
      "epoch": 2.342563123276045,
      "grad_norm": 0.3954348115910446,
      "learning_rate": 4.547663062054791e-05,
      "loss": 1.5411,
      "num_input_tokens_seen": 17372576688,
      "step": 22081
    },
    {
      "epoch": 2.3426692128156166,
      "grad_norm": 0.43505973383485746,
      "learning_rate": 4.5476231908740634e-05,
      "loss": 1.6905,
      "num_input_tokens_seen": 17373363472,
      "step": 22082
    },
    {
      "epoch": 2.3427753023551876,
      "grad_norm": 0.403964147130835,
      "learning_rate": 4.547583318110993e-05,
      "loss": 1.6636,
      "num_input_tokens_seen": 17374150288,
      "step": 22083
    },
    {
      "epoch": 2.342881391894759,
      "grad_norm": 0.38515958712908044,
      "learning_rate": 4.54754344376561e-05,
      "loss": 1.6387,
      "num_input_tokens_seen": 17374937040,
      "step": 22084
    },
    {
      "epoch": 2.3429874814343306,
      "grad_norm": 0.32250614280048073,
      "learning_rate": 4.547503567837945e-05,
      "loss": 1.4554,
      "num_input_tokens_seen": 17375723840,
      "step": 22085
    },
    {
      "epoch": 2.343093570973902,
      "grad_norm": 0.4283827228904034,
      "learning_rate": 4.547463690328029e-05,
      "loss": 1.5684,
      "num_input_tokens_seen": 17376510688,
      "step": 22086
    },
    {
      "epoch": 2.3431996605134735,
      "grad_norm": 0.3696741723097552,
      "learning_rate": 4.547423811235894e-05,
      "loss": 1.5409,
      "num_input_tokens_seen": 17377297472,
      "step": 22087
    },
    {
      "epoch": 2.3433057500530445,
      "grad_norm": 0.4498249806070908,
      "learning_rate": 4.547383930561569e-05,
      "loss": 1.5694,
      "num_input_tokens_seen": 17378084272,
      "step": 22088
    },
    {
      "epoch": 2.343411839592616,
      "grad_norm": 0.4163064373526975,
      "learning_rate": 4.547344048305087e-05,
      "loss": 1.6023,
      "num_input_tokens_seen": 17378871024,
      "step": 22089
    },
    {
      "epoch": 2.3435179291321875,
      "grad_norm": 0.34241245951184757,
      "learning_rate": 4.547304164466477e-05,
      "loss": 1.5729,
      "num_input_tokens_seen": 17379657824,
      "step": 22090
    },
    {
      "epoch": 2.343624018671759,
      "grad_norm": 0.3849081148861209,
      "learning_rate": 4.54726427904577e-05,
      "loss": 1.709,
      "num_input_tokens_seen": 17380444496,
      "step": 22091
    },
    {
      "epoch": 2.3437301082113304,
      "grad_norm": 0.41053564799085174,
      "learning_rate": 4.547224392042998e-05,
      "loss": 1.6103,
      "num_input_tokens_seen": 17381231344,
      "step": 22092
    },
    {
      "epoch": 2.343836197750902,
      "grad_norm": 0.3586295081850293,
      "learning_rate": 4.5471845034581906e-05,
      "loss": 1.611,
      "num_input_tokens_seen": 17382018208,
      "step": 22093
    },
    {
      "epoch": 2.3439422872904734,
      "grad_norm": 0.42724428258432584,
      "learning_rate": 4.547144613291379e-05,
      "loss": 1.7432,
      "num_input_tokens_seen": 17382805088,
      "step": 22094
    },
    {
      "epoch": 2.3440483768300444,
      "grad_norm": 0.41307465393597115,
      "learning_rate": 4.5471047215425944e-05,
      "loss": 1.6719,
      "num_input_tokens_seen": 17383591744,
      "step": 22095
    },
    {
      "epoch": 2.344154466369616,
      "grad_norm": 0.35677853810043453,
      "learning_rate": 4.547064828211868e-05,
      "loss": 1.6419,
      "num_input_tokens_seen": 17384378480,
      "step": 22096
    },
    {
      "epoch": 2.3442605559091874,
      "grad_norm": 0.40681995705188817,
      "learning_rate": 4.5470249332992285e-05,
      "loss": 1.5822,
      "num_input_tokens_seen": 17385165232,
      "step": 22097
    },
    {
      "epoch": 2.344366645448759,
      "grad_norm": 0.4462659132989882,
      "learning_rate": 4.546985036804709e-05,
      "loss": 1.5714,
      "num_input_tokens_seen": 17385951984,
      "step": 22098
    },
    {
      "epoch": 2.3444727349883303,
      "grad_norm": 0.395536087341874,
      "learning_rate": 4.5469451387283394e-05,
      "loss": 1.6318,
      "num_input_tokens_seen": 17386738768,
      "step": 22099
    },
    {
      "epoch": 2.3445788245279013,
      "grad_norm": 0.4224861426403601,
      "learning_rate": 4.5469052390701506e-05,
      "loss": 1.5053,
      "num_input_tokens_seen": 17387525552,
      "step": 22100
    },
    {
      "epoch": 2.344684914067473,
      "grad_norm": 0.42110432266012954,
      "learning_rate": 4.546865337830174e-05,
      "loss": 1.7122,
      "num_input_tokens_seen": 17388312400,
      "step": 22101
    },
    {
      "epoch": 2.3447910036070443,
      "grad_norm": 0.44535384161073416,
      "learning_rate": 4.5468254350084396e-05,
      "loss": 1.681,
      "num_input_tokens_seen": 17389099056,
      "step": 22102
    },
    {
      "epoch": 2.3448970931466158,
      "grad_norm": 0.37306928635711667,
      "learning_rate": 4.546785530604978e-05,
      "loss": 1.6586,
      "num_input_tokens_seen": 17389885856,
      "step": 22103
    },
    {
      "epoch": 2.3450031826861872,
      "grad_norm": 0.376090575036011,
      "learning_rate": 4.5467456246198215e-05,
      "loss": 1.4881,
      "num_input_tokens_seen": 17390672624,
      "step": 22104
    },
    {
      "epoch": 2.3451092722257587,
      "grad_norm": 0.36216566070602213,
      "learning_rate": 4.546705717052999e-05,
      "loss": 1.5412,
      "num_input_tokens_seen": 17391459552,
      "step": 22105
    },
    {
      "epoch": 2.34521536176533,
      "grad_norm": 0.37616410849741727,
      "learning_rate": 4.5466658079045434e-05,
      "loss": 1.5508,
      "num_input_tokens_seen": 17392246240,
      "step": 22106
    },
    {
      "epoch": 2.345321451304901,
      "grad_norm": 0.4568007220538842,
      "learning_rate": 4.546625897174484e-05,
      "loss": 1.7335,
      "num_input_tokens_seen": 17393033008,
      "step": 22107
    },
    {
      "epoch": 2.3454275408444727,
      "grad_norm": 0.3434621479664819,
      "learning_rate": 4.546585984862852e-05,
      "loss": 1.5722,
      "num_input_tokens_seen": 17393819744,
      "step": 22108
    },
    {
      "epoch": 2.345533630384044,
      "grad_norm": 0.3731229706178534,
      "learning_rate": 4.546546070969679e-05,
      "loss": 1.6249,
      "num_input_tokens_seen": 17394606416,
      "step": 22109
    },
    {
      "epoch": 2.3456397199236156,
      "grad_norm": 0.37395343146873483,
      "learning_rate": 4.546506155494995e-05,
      "loss": 1.5902,
      "num_input_tokens_seen": 17395393168,
      "step": 22110
    },
    {
      "epoch": 2.345745809463187,
      "grad_norm": 0.37862484978199257,
      "learning_rate": 4.546466238438831e-05,
      "loss": 1.6248,
      "num_input_tokens_seen": 17396179968,
      "step": 22111
    },
    {
      "epoch": 2.345851899002758,
      "grad_norm": 0.3605400599231712,
      "learning_rate": 4.546426319801218e-05,
      "loss": 1.5255,
      "num_input_tokens_seen": 17396966704,
      "step": 22112
    },
    {
      "epoch": 2.3459579885423296,
      "grad_norm": 0.3625998022902111,
      "learning_rate": 4.546386399582186e-05,
      "loss": 1.4788,
      "num_input_tokens_seen": 17397753472,
      "step": 22113
    },
    {
      "epoch": 2.346064078081901,
      "grad_norm": 0.38012013951852586,
      "learning_rate": 4.5463464777817675e-05,
      "loss": 1.5429,
      "num_input_tokens_seen": 17398540240,
      "step": 22114
    },
    {
      "epoch": 2.3461701676214726,
      "grad_norm": 0.40595363752117475,
      "learning_rate": 4.546306554399993e-05,
      "loss": 1.5627,
      "num_input_tokens_seen": 17399327008,
      "step": 22115
    },
    {
      "epoch": 2.346276257161044,
      "grad_norm": 0.41121474510903583,
      "learning_rate": 4.5462666294368914e-05,
      "loss": 1.6068,
      "num_input_tokens_seen": 17400113728,
      "step": 22116
    },
    {
      "epoch": 2.346382346700615,
      "grad_norm": 0.3327417411116106,
      "learning_rate": 4.5462267028924965e-05,
      "loss": 1.4514,
      "num_input_tokens_seen": 17400900512,
      "step": 22117
    },
    {
      "epoch": 2.3464884362401865,
      "grad_norm": 0.35532229814694544,
      "learning_rate": 4.546186774766836e-05,
      "loss": 1.6313,
      "num_input_tokens_seen": 17401687232,
      "step": 22118
    },
    {
      "epoch": 2.346594525779758,
      "grad_norm": 0.38516577370144384,
      "learning_rate": 4.546146845059944e-05,
      "loss": 1.6818,
      "num_input_tokens_seen": 17402474064,
      "step": 22119
    },
    {
      "epoch": 2.3467006153193295,
      "grad_norm": 0.30757945998499325,
      "learning_rate": 4.546106913771849e-05,
      "loss": 1.4925,
      "num_input_tokens_seen": 17403260752,
      "step": 22120
    },
    {
      "epoch": 2.346806704858901,
      "grad_norm": 0.42737068787813537,
      "learning_rate": 4.5460669809025825e-05,
      "loss": 1.5539,
      "num_input_tokens_seen": 17404047568,
      "step": 22121
    },
    {
      "epoch": 2.3469127943984724,
      "grad_norm": 0.46257135753343875,
      "learning_rate": 4.546027046452176e-05,
      "loss": 1.627,
      "num_input_tokens_seen": 17404834304,
      "step": 22122
    },
    {
      "epoch": 2.347018883938044,
      "grad_norm": 0.398269178091821,
      "learning_rate": 4.5459871104206597e-05,
      "loss": 1.5852,
      "num_input_tokens_seen": 17405621072,
      "step": 22123
    },
    {
      "epoch": 2.347124973477615,
      "grad_norm": 0.5185828701835885,
      "learning_rate": 4.5459471728080636e-05,
      "loss": 1.6482,
      "num_input_tokens_seen": 17406407904,
      "step": 22124
    },
    {
      "epoch": 2.3472310630171864,
      "grad_norm": 0.45216899941297045,
      "learning_rate": 4.54590723361442e-05,
      "loss": 1.6788,
      "num_input_tokens_seen": 17407194640,
      "step": 22125
    },
    {
      "epoch": 2.347337152556758,
      "grad_norm": 0.3575314903330805,
      "learning_rate": 4.5458672928397606e-05,
      "loss": 1.6177,
      "num_input_tokens_seen": 17407981408,
      "step": 22126
    },
    {
      "epoch": 2.3474432420963294,
      "grad_norm": 0.4105698713029901,
      "learning_rate": 4.5458273504841134e-05,
      "loss": 1.6343,
      "num_input_tokens_seen": 17408768128,
      "step": 22127
    },
    {
      "epoch": 2.347549331635901,
      "grad_norm": 0.35425799284175946,
      "learning_rate": 4.545787406547512e-05,
      "loss": 1.5412,
      "num_input_tokens_seen": 17409554896,
      "step": 22128
    },
    {
      "epoch": 2.347655421175472,
      "grad_norm": 0.4340998501377249,
      "learning_rate": 4.5457474610299854e-05,
      "loss": 1.7497,
      "num_input_tokens_seen": 17410341584,
      "step": 22129
    },
    {
      "epoch": 2.3477615107150434,
      "grad_norm": 0.34794633209000947,
      "learning_rate": 4.545707513931565e-05,
      "loss": 1.5858,
      "num_input_tokens_seen": 17411128320,
      "step": 22130
    },
    {
      "epoch": 2.347867600254615,
      "grad_norm": 0.3530056269319506,
      "learning_rate": 4.545667565252283e-05,
      "loss": 1.5158,
      "num_input_tokens_seen": 17411915056,
      "step": 22131
    },
    {
      "epoch": 2.3479736897941863,
      "grad_norm": 0.41254785131232663,
      "learning_rate": 4.545627614992168e-05,
      "loss": 1.5778,
      "num_input_tokens_seen": 17412701808,
      "step": 22132
    },
    {
      "epoch": 2.3480797793337578,
      "grad_norm": 0.3667972888409449,
      "learning_rate": 4.545587663151253e-05,
      "loss": 1.5753,
      "num_input_tokens_seen": 17413488576,
      "step": 22133
    },
    {
      "epoch": 2.3481858688733293,
      "grad_norm": 0.5403701635170203,
      "learning_rate": 4.5455477097295675e-05,
      "loss": 1.6083,
      "num_input_tokens_seen": 17414275456,
      "step": 22134
    },
    {
      "epoch": 2.3482919584129007,
      "grad_norm": 0.37886557219405104,
      "learning_rate": 4.545507754727142e-05,
      "loss": 1.5043,
      "num_input_tokens_seen": 17415062160,
      "step": 22135
    },
    {
      "epoch": 2.3483980479524718,
      "grad_norm": 0.4108426290663413,
      "learning_rate": 4.545467798144009e-05,
      "loss": 1.456,
      "num_input_tokens_seen": 17415848912,
      "step": 22136
    },
    {
      "epoch": 2.3485041374920432,
      "grad_norm": 0.4308981280359089,
      "learning_rate": 4.545427839980197e-05,
      "loss": 1.6353,
      "num_input_tokens_seen": 17416635744,
      "step": 22137
    },
    {
      "epoch": 2.3486102270316147,
      "grad_norm": 0.5761176229782031,
      "learning_rate": 4.54538788023574e-05,
      "loss": 1.7372,
      "num_input_tokens_seen": 17417422416,
      "step": 22138
    },
    {
      "epoch": 2.348716316571186,
      "grad_norm": 0.6663588423226661,
      "learning_rate": 4.545347918910667e-05,
      "loss": 1.6146,
      "num_input_tokens_seen": 17418209200,
      "step": 22139
    },
    {
      "epoch": 2.3488224061107577,
      "grad_norm": 0.4310790263631252,
      "learning_rate": 4.545307956005009e-05,
      "loss": 1.6956,
      "num_input_tokens_seen": 17418995920,
      "step": 22140
    },
    {
      "epoch": 2.3489284956503287,
      "grad_norm": 0.4041260118424692,
      "learning_rate": 4.5452679915187965e-05,
      "loss": 1.5602,
      "num_input_tokens_seen": 17419782576,
      "step": 22141
    },
    {
      "epoch": 2.3490345851899,
      "grad_norm": 0.3915364508213891,
      "learning_rate": 4.545228025452062e-05,
      "loss": 1.6554,
      "num_input_tokens_seen": 17420569440,
      "step": 22142
    },
    {
      "epoch": 2.3491406747294716,
      "grad_norm": 0.38601933373872793,
      "learning_rate": 4.545188057804835e-05,
      "loss": 1.5158,
      "num_input_tokens_seen": 17421356144,
      "step": 22143
    },
    {
      "epoch": 2.349246764269043,
      "grad_norm": 0.406807042986339,
      "learning_rate": 4.545148088577146e-05,
      "loss": 1.6404,
      "num_input_tokens_seen": 17422142944,
      "step": 22144
    },
    {
      "epoch": 2.3493528538086146,
      "grad_norm": 0.4169562010198972,
      "learning_rate": 4.545108117769027e-05,
      "loss": 1.5603,
      "num_input_tokens_seen": 17422929632,
      "step": 22145
    },
    {
      "epoch": 2.349458943348186,
      "grad_norm": 0.419851770437117,
      "learning_rate": 4.545068145380508e-05,
      "loss": 1.6912,
      "num_input_tokens_seen": 17423716272,
      "step": 22146
    },
    {
      "epoch": 2.349565032887757,
      "grad_norm": 0.37628734687199794,
      "learning_rate": 4.545028171411621e-05,
      "loss": 1.5979,
      "num_input_tokens_seen": 17424503056,
      "step": 22147
    },
    {
      "epoch": 2.3496711224273286,
      "grad_norm": 0.42404558409637927,
      "learning_rate": 4.544988195862395e-05,
      "loss": 1.7599,
      "num_input_tokens_seen": 17425289824,
      "step": 22148
    },
    {
      "epoch": 2.3497772119669,
      "grad_norm": 0.4439893967850814,
      "learning_rate": 4.544948218732864e-05,
      "loss": 1.6976,
      "num_input_tokens_seen": 17426076576,
      "step": 22149
    },
    {
      "epoch": 2.3498833015064715,
      "grad_norm": 0.5186852317039522,
      "learning_rate": 4.544908240023056e-05,
      "loss": 1.6918,
      "num_input_tokens_seen": 17426863280,
      "step": 22150
    },
    {
      "epoch": 2.349989391046043,
      "grad_norm": 0.40955928253180734,
      "learning_rate": 4.544868259733003e-05,
      "loss": 1.6506,
      "num_input_tokens_seen": 17427650032,
      "step": 22151
    },
    {
      "epoch": 2.3500954805856145,
      "grad_norm": 0.40814407746063003,
      "learning_rate": 4.544828277862735e-05,
      "loss": 1.5542,
      "num_input_tokens_seen": 17428436784,
      "step": 22152
    },
    {
      "epoch": 2.3502015701251855,
      "grad_norm": 0.5042218614830176,
      "learning_rate": 4.544788294412285e-05,
      "loss": 1.6254,
      "num_input_tokens_seen": 17429223584,
      "step": 22153
    },
    {
      "epoch": 2.350307659664757,
      "grad_norm": 0.3469848908890504,
      "learning_rate": 4.544748309381682e-05,
      "loss": 1.6244,
      "num_input_tokens_seen": 17430010352,
      "step": 22154
    },
    {
      "epoch": 2.3504137492043284,
      "grad_norm": 0.44743188722200383,
      "learning_rate": 4.5447083227709576e-05,
      "loss": 1.6931,
      "num_input_tokens_seen": 17430797040,
      "step": 22155
    },
    {
      "epoch": 2.3505198387439,
      "grad_norm": 0.4406725958793708,
      "learning_rate": 4.5446683345801424e-05,
      "loss": 1.6073,
      "num_input_tokens_seen": 17431583792,
      "step": 22156
    },
    {
      "epoch": 2.3506259282834714,
      "grad_norm": 0.4935942402698379,
      "learning_rate": 4.544628344809268e-05,
      "loss": 1.6846,
      "num_input_tokens_seen": 17432370720,
      "step": 22157
    },
    {
      "epoch": 2.3507320178230424,
      "grad_norm": 0.5780994251533151,
      "learning_rate": 4.544588353458365e-05,
      "loss": 1.6575,
      "num_input_tokens_seen": 17433157552,
      "step": 22158
    },
    {
      "epoch": 2.350838107362614,
      "grad_norm": 0.38466430352954023,
      "learning_rate": 4.544548360527463e-05,
      "loss": 1.5708,
      "num_input_tokens_seen": 17433944320,
      "step": 22159
    },
    {
      "epoch": 2.3509441969021854,
      "grad_norm": 0.45368359035535005,
      "learning_rate": 4.544508366016595e-05,
      "loss": 1.618,
      "num_input_tokens_seen": 17434731104,
      "step": 22160
    },
    {
      "epoch": 2.351050286441757,
      "grad_norm": 0.3546709883354725,
      "learning_rate": 4.544468369925791e-05,
      "loss": 1.5948,
      "num_input_tokens_seen": 17435517888,
      "step": 22161
    },
    {
      "epoch": 2.3511563759813283,
      "grad_norm": 0.4118364681580686,
      "learning_rate": 4.5444283722550805e-05,
      "loss": 1.4503,
      "num_input_tokens_seen": 17436304624,
      "step": 22162
    },
    {
      "epoch": 2.3512624655209,
      "grad_norm": 0.453990564133386,
      "learning_rate": 4.5443883730044965e-05,
      "loss": 1.6011,
      "num_input_tokens_seen": 17437091456,
      "step": 22163
    },
    {
      "epoch": 2.3513685550604713,
      "grad_norm": 0.42825432287714676,
      "learning_rate": 4.54434837217407e-05,
      "loss": 1.6285,
      "num_input_tokens_seen": 17437878240,
      "step": 22164
    },
    {
      "epoch": 2.3514746446000423,
      "grad_norm": 0.44412423401379564,
      "learning_rate": 4.54430836976383e-05,
      "loss": 1.627,
      "num_input_tokens_seen": 17438664992,
      "step": 22165
    },
    {
      "epoch": 2.3515807341396138,
      "grad_norm": 0.5490000084890048,
      "learning_rate": 4.544268365773809e-05,
      "loss": 1.4374,
      "num_input_tokens_seen": 17439451792,
      "step": 22166
    },
    {
      "epoch": 2.3516868236791852,
      "grad_norm": 0.39648711482401416,
      "learning_rate": 4.544228360204037e-05,
      "loss": 1.6495,
      "num_input_tokens_seen": 17440238560,
      "step": 22167
    },
    {
      "epoch": 2.3517929132187567,
      "grad_norm": 0.46666447298392827,
      "learning_rate": 4.544188353054546e-05,
      "loss": 1.5549,
      "num_input_tokens_seen": 17441025328,
      "step": 22168
    },
    {
      "epoch": 2.351899002758328,
      "grad_norm": 0.45179931835115644,
      "learning_rate": 4.544148344325365e-05,
      "loss": 1.644,
      "num_input_tokens_seen": 17441812160,
      "step": 22169
    },
    {
      "epoch": 2.3520050922978992,
      "grad_norm": 0.5360764704714429,
      "learning_rate": 4.544108334016527e-05,
      "loss": 1.6207,
      "num_input_tokens_seen": 17442598912,
      "step": 22170
    },
    {
      "epoch": 2.3521111818374707,
      "grad_norm": 0.5301582147352588,
      "learning_rate": 4.544068322128062e-05,
      "loss": 1.4663,
      "num_input_tokens_seen": 17443385760,
      "step": 22171
    },
    {
      "epoch": 2.352217271377042,
      "grad_norm": 0.429475206083853,
      "learning_rate": 4.544028308660001e-05,
      "loss": 1.6389,
      "num_input_tokens_seen": 17444172592,
      "step": 22172
    },
    {
      "epoch": 2.3523233609166136,
      "grad_norm": 0.6351924138103504,
      "learning_rate": 4.543988293612375e-05,
      "loss": 1.6044,
      "num_input_tokens_seen": 17444959376,
      "step": 22173
    },
    {
      "epoch": 2.352429450456185,
      "grad_norm": 0.41686543305946755,
      "learning_rate": 4.543948276985215e-05,
      "loss": 1.6829,
      "num_input_tokens_seen": 17445746080,
      "step": 22174
    },
    {
      "epoch": 2.3525355399957566,
      "grad_norm": 0.5128651829636772,
      "learning_rate": 4.543908258778551e-05,
      "loss": 1.6205,
      "num_input_tokens_seen": 17446532880,
      "step": 22175
    },
    {
      "epoch": 2.3526416295353276,
      "grad_norm": 0.4280501355803239,
      "learning_rate": 4.543868238992415e-05,
      "loss": 1.7091,
      "num_input_tokens_seen": 17447319616,
      "step": 22176
    },
    {
      "epoch": 2.352747719074899,
      "grad_norm": 0.5063259273956746,
      "learning_rate": 4.5438282176268375e-05,
      "loss": 1.7519,
      "num_input_tokens_seen": 17448106368,
      "step": 22177
    },
    {
      "epoch": 2.3528538086144706,
      "grad_norm": 0.45896851242984493,
      "learning_rate": 4.54378819468185e-05,
      "loss": 1.751,
      "num_input_tokens_seen": 17448893120,
      "step": 22178
    },
    {
      "epoch": 2.352959898154042,
      "grad_norm": 0.3932078222854639,
      "learning_rate": 4.5437481701574827e-05,
      "loss": 1.6457,
      "num_input_tokens_seen": 17449679872,
      "step": 22179
    },
    {
      "epoch": 2.3530659876936135,
      "grad_norm": 0.5000617195950764,
      "learning_rate": 4.543708144053766e-05,
      "loss": 1.6508,
      "num_input_tokens_seen": 17450466640,
      "step": 22180
    },
    {
      "epoch": 2.353172077233185,
      "grad_norm": 0.38177269567454203,
      "learning_rate": 4.543668116370733e-05,
      "loss": 1.5842,
      "num_input_tokens_seen": 17451253376,
      "step": 22181
    },
    {
      "epoch": 2.353278166772756,
      "grad_norm": 0.4410313704028735,
      "learning_rate": 4.5436280871084125e-05,
      "loss": 1.5809,
      "num_input_tokens_seen": 17452040160,
      "step": 22182
    },
    {
      "epoch": 2.3533842563123275,
      "grad_norm": 0.42059133175482716,
      "learning_rate": 4.543588056266836e-05,
      "loss": 1.6448,
      "num_input_tokens_seen": 17452826912,
      "step": 22183
    },
    {
      "epoch": 2.353490345851899,
      "grad_norm": 0.3743281429274839,
      "learning_rate": 4.543548023846035e-05,
      "loss": 1.6096,
      "num_input_tokens_seen": 17453613728,
      "step": 22184
    },
    {
      "epoch": 2.3535964353914705,
      "grad_norm": 0.4149689072295768,
      "learning_rate": 4.54350798984604e-05,
      "loss": 1.5841,
      "num_input_tokens_seen": 17454400464,
      "step": 22185
    },
    {
      "epoch": 2.353702524931042,
      "grad_norm": 0.41862656609206794,
      "learning_rate": 4.543467954266882e-05,
      "loss": 1.5303,
      "num_input_tokens_seen": 17455187280,
      "step": 22186
    },
    {
      "epoch": 2.353808614470613,
      "grad_norm": 0.3875585014440555,
      "learning_rate": 4.543427917108591e-05,
      "loss": 1.4289,
      "num_input_tokens_seen": 17455974208,
      "step": 22187
    },
    {
      "epoch": 2.3539147040101844,
      "grad_norm": 0.44575859893953934,
      "learning_rate": 4.5433878783712e-05,
      "loss": 1.6657,
      "num_input_tokens_seen": 17456760928,
      "step": 22188
    },
    {
      "epoch": 2.354020793549756,
      "grad_norm": 0.38160931442605556,
      "learning_rate": 4.543347838054739e-05,
      "loss": 1.5623,
      "num_input_tokens_seen": 17457547696,
      "step": 22189
    },
    {
      "epoch": 2.3541268830893274,
      "grad_norm": 0.4610790820003913,
      "learning_rate": 4.5433077961592386e-05,
      "loss": 1.5795,
      "num_input_tokens_seen": 17458334512,
      "step": 22190
    },
    {
      "epoch": 2.354232972628899,
      "grad_norm": 0.41364269297640394,
      "learning_rate": 4.543267752684729e-05,
      "loss": 1.4523,
      "num_input_tokens_seen": 17459121392,
      "step": 22191
    },
    {
      "epoch": 2.3543390621684703,
      "grad_norm": 0.4906267457012785,
      "learning_rate": 4.543227707631242e-05,
      "loss": 1.6704,
      "num_input_tokens_seen": 17459908160,
      "step": 22192
    },
    {
      "epoch": 2.354445151708042,
      "grad_norm": 0.512006991947481,
      "learning_rate": 4.54318766099881e-05,
      "loss": 1.5968,
      "num_input_tokens_seen": 17460694976,
      "step": 22193
    },
    {
      "epoch": 2.354551241247613,
      "grad_norm": 0.3804859782110298,
      "learning_rate": 4.5431476127874614e-05,
      "loss": 1.5632,
      "num_input_tokens_seen": 17461481728,
      "step": 22194
    },
    {
      "epoch": 2.3546573307871843,
      "grad_norm": 0.45807455816307613,
      "learning_rate": 4.543107562997229e-05,
      "loss": 1.5183,
      "num_input_tokens_seen": 17462268544,
      "step": 22195
    },
    {
      "epoch": 2.354763420326756,
      "grad_norm": 0.439023583804222,
      "learning_rate": 4.543067511628142e-05,
      "loss": 1.5313,
      "num_input_tokens_seen": 17463055360,
      "step": 22196
    },
    {
      "epoch": 2.3548695098663273,
      "grad_norm": 0.4180712335700132,
      "learning_rate": 4.5430274586802335e-05,
      "loss": 1.5539,
      "num_input_tokens_seen": 17463842112,
      "step": 22197
    },
    {
      "epoch": 2.3549755994058987,
      "grad_norm": 0.4281009383213856,
      "learning_rate": 4.5429874041535323e-05,
      "loss": 1.59,
      "num_input_tokens_seen": 17464628912,
      "step": 22198
    },
    {
      "epoch": 2.3550816889454698,
      "grad_norm": 0.3941663508014798,
      "learning_rate": 4.542947348048071e-05,
      "loss": 1.6108,
      "num_input_tokens_seen": 17465415664,
      "step": 22199
    },
    {
      "epoch": 2.3551877784850412,
      "grad_norm": 0.4430381517341856,
      "learning_rate": 4.542907290363879e-05,
      "loss": 1.6993,
      "num_input_tokens_seen": 17466202384,
      "step": 22200
    },
    {
      "epoch": 2.3552938680246127,
      "grad_norm": 0.37391531749826545,
      "learning_rate": 4.5428672311009896e-05,
      "loss": 1.5495,
      "num_input_tokens_seen": 17466989152,
      "step": 22201
    },
    {
      "epoch": 2.355399957564184,
      "grad_norm": 0.387843120644855,
      "learning_rate": 4.5428271702594315e-05,
      "loss": 1.4464,
      "num_input_tokens_seen": 17467775936,
      "step": 22202
    },
    {
      "epoch": 2.3555060471037557,
      "grad_norm": 0.36476477628660353,
      "learning_rate": 4.542787107839237e-05,
      "loss": 1.5311,
      "num_input_tokens_seen": 17468562832,
      "step": 22203
    },
    {
      "epoch": 2.355612136643327,
      "grad_norm": 0.4513444984117022,
      "learning_rate": 4.542747043840436e-05,
      "loss": 1.6731,
      "num_input_tokens_seen": 17469349600,
      "step": 22204
    },
    {
      "epoch": 2.3557182261828986,
      "grad_norm": 0.3666059404169419,
      "learning_rate": 4.5427069782630606e-05,
      "loss": 1.5177,
      "num_input_tokens_seen": 17470136320,
      "step": 22205
    },
    {
      "epoch": 2.3558243157224696,
      "grad_norm": 0.4252276701020926,
      "learning_rate": 4.542666911107141e-05,
      "loss": 1.6167,
      "num_input_tokens_seen": 17470923088,
      "step": 22206
    },
    {
      "epoch": 2.355930405262041,
      "grad_norm": 0.39334933438669256,
      "learning_rate": 4.542626842372708e-05,
      "loss": 1.7986,
      "num_input_tokens_seen": 17471709840,
      "step": 22207
    },
    {
      "epoch": 2.3560364948016126,
      "grad_norm": 0.44926299828496213,
      "learning_rate": 4.542586772059793e-05,
      "loss": 1.5591,
      "num_input_tokens_seen": 17472496544,
      "step": 22208
    },
    {
      "epoch": 2.356142584341184,
      "grad_norm": 0.4588470327010693,
      "learning_rate": 4.542546700168427e-05,
      "loss": 1.6542,
      "num_input_tokens_seen": 17473283344,
      "step": 22209
    },
    {
      "epoch": 2.3562486738807555,
      "grad_norm": 0.36643908135551656,
      "learning_rate": 4.542506626698641e-05,
      "loss": 1.5249,
      "num_input_tokens_seen": 17474070256,
      "step": 22210
    },
    {
      "epoch": 2.3563547634203266,
      "grad_norm": 0.5984493238119197,
      "learning_rate": 4.5424665516504655e-05,
      "loss": 1.7198,
      "num_input_tokens_seen": 17474857008,
      "step": 22211
    },
    {
      "epoch": 2.356460852959898,
      "grad_norm": 0.3927717373580056,
      "learning_rate": 4.542426475023932e-05,
      "loss": 1.6184,
      "num_input_tokens_seen": 17475643712,
      "step": 22212
    },
    {
      "epoch": 2.3565669424994695,
      "grad_norm": 0.5274915058093683,
      "learning_rate": 4.542386396819071e-05,
      "loss": 1.5685,
      "num_input_tokens_seen": 17476430512,
      "step": 22213
    },
    {
      "epoch": 2.356673032039041,
      "grad_norm": 0.3978157055945939,
      "learning_rate": 4.542346317035914e-05,
      "loss": 1.7129,
      "num_input_tokens_seen": 17477217296,
      "step": 22214
    },
    {
      "epoch": 2.3567791215786125,
      "grad_norm": 0.42846609433973676,
      "learning_rate": 4.542306235674492e-05,
      "loss": 1.4843,
      "num_input_tokens_seen": 17478004096,
      "step": 22215
    },
    {
      "epoch": 2.3568852111181835,
      "grad_norm": 0.4175495529463759,
      "learning_rate": 4.542266152734835e-05,
      "loss": 1.5905,
      "num_input_tokens_seen": 17478790864,
      "step": 22216
    },
    {
      "epoch": 2.356991300657755,
      "grad_norm": 0.3997171603966971,
      "learning_rate": 4.5422260682169745e-05,
      "loss": 1.6123,
      "num_input_tokens_seen": 17479577616,
      "step": 22217
    },
    {
      "epoch": 2.3570973901973264,
      "grad_norm": 0.3954981693049323,
      "learning_rate": 4.542185982120942e-05,
      "loss": 1.4742,
      "num_input_tokens_seen": 17480364384,
      "step": 22218
    },
    {
      "epoch": 2.357203479736898,
      "grad_norm": 0.37893191731042847,
      "learning_rate": 4.5421458944467686e-05,
      "loss": 1.6662,
      "num_input_tokens_seen": 17481151104,
      "step": 22219
    },
    {
      "epoch": 2.3573095692764694,
      "grad_norm": 0.38140811367485056,
      "learning_rate": 4.542105805194484e-05,
      "loss": 1.6508,
      "num_input_tokens_seen": 17481937840,
      "step": 22220
    },
    {
      "epoch": 2.357415658816041,
      "grad_norm": 0.3546839241118727,
      "learning_rate": 4.54206571436412e-05,
      "loss": 1.5232,
      "num_input_tokens_seen": 17482724576,
      "step": 22221
    },
    {
      "epoch": 2.3575217483556123,
      "grad_norm": 0.42828905111110616,
      "learning_rate": 4.5420256219557075e-05,
      "loss": 1.6904,
      "num_input_tokens_seen": 17483511328,
      "step": 22222
    },
    {
      "epoch": 2.3576278378951834,
      "grad_norm": 0.4316797806609306,
      "learning_rate": 4.541985527969278e-05,
      "loss": 1.6431,
      "num_input_tokens_seen": 17484298000,
      "step": 22223
    },
    {
      "epoch": 2.357733927434755,
      "grad_norm": 0.3287122989163565,
      "learning_rate": 4.5419454324048624e-05,
      "loss": 1.4757,
      "num_input_tokens_seen": 17485084720,
      "step": 22224
    },
    {
      "epoch": 2.3578400169743263,
      "grad_norm": 0.37443294977412717,
      "learning_rate": 4.541905335262491e-05,
      "loss": 1.5585,
      "num_input_tokens_seen": 17485871488,
      "step": 22225
    },
    {
      "epoch": 2.357946106513898,
      "grad_norm": 0.4162371398004282,
      "learning_rate": 4.541865236542194e-05,
      "loss": 1.6074,
      "num_input_tokens_seen": 17486658288,
      "step": 22226
    },
    {
      "epoch": 2.3580521960534693,
      "grad_norm": 0.34829993617216115,
      "learning_rate": 4.541825136244004e-05,
      "loss": 1.5757,
      "num_input_tokens_seen": 17487445040,
      "step": 22227
    },
    {
      "epoch": 2.3581582855930403,
      "grad_norm": 0.4742795654038427,
      "learning_rate": 4.5417850343679526e-05,
      "loss": 1.5904,
      "num_input_tokens_seen": 17488231856,
      "step": 22228
    },
    {
      "epoch": 2.358264375132612,
      "grad_norm": 0.4252435567984309,
      "learning_rate": 4.5417449309140684e-05,
      "loss": 1.5385,
      "num_input_tokens_seen": 17489018736,
      "step": 22229
    },
    {
      "epoch": 2.3583704646721833,
      "grad_norm": 0.4429959207329026,
      "learning_rate": 4.541704825882383e-05,
      "loss": 1.7119,
      "num_input_tokens_seen": 17489805440,
      "step": 22230
    },
    {
      "epoch": 2.3584765542117547,
      "grad_norm": 0.4525019743919108,
      "learning_rate": 4.541664719272929e-05,
      "loss": 1.6016,
      "num_input_tokens_seen": 17490592224,
      "step": 22231
    },
    {
      "epoch": 2.358582643751326,
      "grad_norm": 0.38345035455794013,
      "learning_rate": 4.541624611085737e-05,
      "loss": 1.5252,
      "num_input_tokens_seen": 17491379040,
      "step": 22232
    },
    {
      "epoch": 2.3586887332908977,
      "grad_norm": 0.4274160808040205,
      "learning_rate": 4.541584501320837e-05,
      "loss": 1.7408,
      "num_input_tokens_seen": 17492165856,
      "step": 22233
    },
    {
      "epoch": 2.358794822830469,
      "grad_norm": 0.6545214655897228,
      "learning_rate": 4.54154438997826e-05,
      "loss": 1.6336,
      "num_input_tokens_seen": 17492952592,
      "step": 22234
    },
    {
      "epoch": 2.35890091237004,
      "grad_norm": 0.4103944104261718,
      "learning_rate": 4.5415042770580376e-05,
      "loss": 1.4557,
      "num_input_tokens_seen": 17493739408,
      "step": 22235
    },
    {
      "epoch": 2.3590070019096117,
      "grad_norm": 0.5245452820976116,
      "learning_rate": 4.5414641625602003e-05,
      "loss": 1.6809,
      "num_input_tokens_seen": 17494526112,
      "step": 22236
    },
    {
      "epoch": 2.359113091449183,
      "grad_norm": 0.36057267272816945,
      "learning_rate": 4.54142404648478e-05,
      "loss": 1.5897,
      "num_input_tokens_seen": 17495312912,
      "step": 22237
    },
    {
      "epoch": 2.3592191809887546,
      "grad_norm": 0.4895430147762239,
      "learning_rate": 4.5413839288318064e-05,
      "loss": 1.6725,
      "num_input_tokens_seen": 17496099664,
      "step": 22238
    },
    {
      "epoch": 2.359325270528326,
      "grad_norm": 0.39225372237497996,
      "learning_rate": 4.5413438096013114e-05,
      "loss": 1.6664,
      "num_input_tokens_seen": 17496886368,
      "step": 22239
    },
    {
      "epoch": 2.359431360067897,
      "grad_norm": 0.4298956058214878,
      "learning_rate": 4.541303688793326e-05,
      "loss": 1.5442,
      "num_input_tokens_seen": 17497673200,
      "step": 22240
    },
    {
      "epoch": 2.3595374496074686,
      "grad_norm": 0.43552775843682684,
      "learning_rate": 4.5412635664078806e-05,
      "loss": 1.4774,
      "num_input_tokens_seen": 17498459952,
      "step": 22241
    },
    {
      "epoch": 2.35964353914704,
      "grad_norm": 0.4713437328946238,
      "learning_rate": 4.541223442445007e-05,
      "loss": 1.5965,
      "num_input_tokens_seen": 17499246784,
      "step": 22242
    },
    {
      "epoch": 2.3597496286866115,
      "grad_norm": 0.5912290383840278,
      "learning_rate": 4.541183316904736e-05,
      "loss": 1.5773,
      "num_input_tokens_seen": 17500033552,
      "step": 22243
    },
    {
      "epoch": 2.359855718226183,
      "grad_norm": 0.4978959547870894,
      "learning_rate": 4.541143189787098e-05,
      "loss": 1.6202,
      "num_input_tokens_seen": 17500820320,
      "step": 22244
    },
    {
      "epoch": 2.3599618077657545,
      "grad_norm": 0.5236019668264578,
      "learning_rate": 4.5411030610921244e-05,
      "loss": 1.5347,
      "num_input_tokens_seen": 17501607024,
      "step": 22245
    },
    {
      "epoch": 2.3600678973053255,
      "grad_norm": 0.47574974561383065,
      "learning_rate": 4.541062930819847e-05,
      "loss": 1.5961,
      "num_input_tokens_seen": 17502393760,
      "step": 22246
    },
    {
      "epoch": 2.360173986844897,
      "grad_norm": 0.48165313524826203,
      "learning_rate": 4.541022798970296e-05,
      "loss": 1.5452,
      "num_input_tokens_seen": 17503180608,
      "step": 22247
    },
    {
      "epoch": 2.3602800763844685,
      "grad_norm": 0.46590491289416314,
      "learning_rate": 4.5409826655435014e-05,
      "loss": 1.5861,
      "num_input_tokens_seen": 17503967312,
      "step": 22248
    },
    {
      "epoch": 2.36038616592404,
      "grad_norm": 0.47752322767145217,
      "learning_rate": 4.540942530539496e-05,
      "loss": 1.5557,
      "num_input_tokens_seen": 17504754112,
      "step": 22249
    },
    {
      "epoch": 2.3604922554636114,
      "grad_norm": 0.4540182690374869,
      "learning_rate": 4.54090239395831e-05,
      "loss": 1.6129,
      "num_input_tokens_seen": 17505540864,
      "step": 22250
    },
    {
      "epoch": 2.360598345003183,
      "grad_norm": 0.4264668820898426,
      "learning_rate": 4.540862255799975e-05,
      "loss": 1.596,
      "num_input_tokens_seen": 17506327568,
      "step": 22251
    },
    {
      "epoch": 2.360704434542754,
      "grad_norm": 0.3890452638374508,
      "learning_rate": 4.540822116064521e-05,
      "loss": 1.3572,
      "num_input_tokens_seen": 17507114384,
      "step": 22252
    },
    {
      "epoch": 2.3608105240823254,
      "grad_norm": 0.431222774949659,
      "learning_rate": 4.5407819747519784e-05,
      "loss": 1.5768,
      "num_input_tokens_seen": 17507901200,
      "step": 22253
    },
    {
      "epoch": 2.360916613621897,
      "grad_norm": 0.36809131303399056,
      "learning_rate": 4.540741831862381e-05,
      "loss": 1.5178,
      "num_input_tokens_seen": 17508688048,
      "step": 22254
    },
    {
      "epoch": 2.3610227031614683,
      "grad_norm": 0.36227442305790736,
      "learning_rate": 4.5407016873957575e-05,
      "loss": 1.543,
      "num_input_tokens_seen": 17509474896,
      "step": 22255
    },
    {
      "epoch": 2.36112879270104,
      "grad_norm": 0.37498843565185697,
      "learning_rate": 4.5406615413521405e-05,
      "loss": 1.6127,
      "num_input_tokens_seen": 17510261728,
      "step": 22256
    },
    {
      "epoch": 2.361234882240611,
      "grad_norm": 0.40036249879874264,
      "learning_rate": 4.540621393731559e-05,
      "loss": 1.7264,
      "num_input_tokens_seen": 17511048496,
      "step": 22257
    },
    {
      "epoch": 2.3613409717801823,
      "grad_norm": 0.3610923793410427,
      "learning_rate": 4.540581244534046e-05,
      "loss": 1.5555,
      "num_input_tokens_seen": 17511835376,
      "step": 22258
    },
    {
      "epoch": 2.361447061319754,
      "grad_norm": 0.42454545316696135,
      "learning_rate": 4.540541093759631e-05,
      "loss": 1.6233,
      "num_input_tokens_seen": 17512622080,
      "step": 22259
    },
    {
      "epoch": 2.3615531508593253,
      "grad_norm": 0.42424212384868676,
      "learning_rate": 4.540500941408346e-05,
      "loss": 1.4922,
      "num_input_tokens_seen": 17513408880,
      "step": 22260
    },
    {
      "epoch": 2.3616592403988967,
      "grad_norm": 0.4132888249268725,
      "learning_rate": 4.540460787480222e-05,
      "loss": 1.6718,
      "num_input_tokens_seen": 17514195616,
      "step": 22261
    },
    {
      "epoch": 2.361765329938468,
      "grad_norm": 0.44331675397279685,
      "learning_rate": 4.5404206319752896e-05,
      "loss": 1.7367,
      "num_input_tokens_seen": 17514982304,
      "step": 22262
    },
    {
      "epoch": 2.3618714194780397,
      "grad_norm": 0.3829101483939575,
      "learning_rate": 4.5403804748935796e-05,
      "loss": 1.6569,
      "num_input_tokens_seen": 17515769024,
      "step": 22263
    },
    {
      "epoch": 2.3619775090176107,
      "grad_norm": 0.3902462779636885,
      "learning_rate": 4.540340316235125e-05,
      "loss": 1.6875,
      "num_input_tokens_seen": 17516555824,
      "step": 22264
    },
    {
      "epoch": 2.362083598557182,
      "grad_norm": 0.4118828558628098,
      "learning_rate": 4.540300155999953e-05,
      "loss": 1.533,
      "num_input_tokens_seen": 17517342576,
      "step": 22265
    },
    {
      "epoch": 2.3621896880967537,
      "grad_norm": 0.37033596249517103,
      "learning_rate": 4.540259994188098e-05,
      "loss": 1.6953,
      "num_input_tokens_seen": 17518129280,
      "step": 22266
    },
    {
      "epoch": 2.362295777636325,
      "grad_norm": 0.4056085426442965,
      "learning_rate": 4.54021983079959e-05,
      "loss": 1.5999,
      "num_input_tokens_seen": 17518916112,
      "step": 22267
    },
    {
      "epoch": 2.3624018671758966,
      "grad_norm": 0.39841490678067837,
      "learning_rate": 4.54017966583446e-05,
      "loss": 1.593,
      "num_input_tokens_seen": 17519702832,
      "step": 22268
    },
    {
      "epoch": 2.3625079567154676,
      "grad_norm": 0.38764667451144613,
      "learning_rate": 4.5401394992927385e-05,
      "loss": 1.6081,
      "num_input_tokens_seen": 17520489616,
      "step": 22269
    },
    {
      "epoch": 2.362614046255039,
      "grad_norm": 0.37195406371686957,
      "learning_rate": 4.5400993311744576e-05,
      "loss": 1.5956,
      "num_input_tokens_seen": 17521276400,
      "step": 22270
    },
    {
      "epoch": 2.3627201357946106,
      "grad_norm": 0.4800233328070359,
      "learning_rate": 4.540059161479648e-05,
      "loss": 1.6375,
      "num_input_tokens_seen": 17522063072,
      "step": 22271
    },
    {
      "epoch": 2.362826225334182,
      "grad_norm": 0.3872036183965543,
      "learning_rate": 4.5400189902083403e-05,
      "loss": 1.584,
      "num_input_tokens_seen": 17522849872,
      "step": 22272
    },
    {
      "epoch": 2.3629323148737535,
      "grad_norm": 0.4786193418871147,
      "learning_rate": 4.539978817360565e-05,
      "loss": 1.486,
      "num_input_tokens_seen": 17523636592,
      "step": 22273
    },
    {
      "epoch": 2.363038404413325,
      "grad_norm": 0.5002365524985202,
      "learning_rate": 4.539938642936355e-05,
      "loss": 1.4597,
      "num_input_tokens_seen": 17524423456,
      "step": 22274
    },
    {
      "epoch": 2.363144493952896,
      "grad_norm": 0.4955708995429672,
      "learning_rate": 4.53989846693574e-05,
      "loss": 1.7848,
      "num_input_tokens_seen": 17525210272,
      "step": 22275
    },
    {
      "epoch": 2.3632505834924675,
      "grad_norm": 0.48779471992332774,
      "learning_rate": 4.539858289358751e-05,
      "loss": 1.5568,
      "num_input_tokens_seen": 17525997056,
      "step": 22276
    },
    {
      "epoch": 2.363356673032039,
      "grad_norm": 0.3738617233411578,
      "learning_rate": 4.539818110205419e-05,
      "loss": 1.5699,
      "num_input_tokens_seen": 17526783888,
      "step": 22277
    },
    {
      "epoch": 2.3634627625716105,
      "grad_norm": 0.45120027934426266,
      "learning_rate": 4.5397779294757766e-05,
      "loss": 1.5644,
      "num_input_tokens_seen": 17527570704,
      "step": 22278
    },
    {
      "epoch": 2.363568852111182,
      "grad_norm": 0.41434447205048336,
      "learning_rate": 4.539737747169853e-05,
      "loss": 1.6861,
      "num_input_tokens_seen": 17528357376,
      "step": 22279
    },
    {
      "epoch": 2.3636749416507534,
      "grad_norm": 0.3713459301705685,
      "learning_rate": 4.5396975632876805e-05,
      "loss": 1.5507,
      "num_input_tokens_seen": 17529144128,
      "step": 22280
    },
    {
      "epoch": 2.3637810311903245,
      "grad_norm": 0.3817706796927573,
      "learning_rate": 4.539657377829288e-05,
      "loss": 1.6503,
      "num_input_tokens_seen": 17529930896,
      "step": 22281
    },
    {
      "epoch": 2.363887120729896,
      "grad_norm": 0.3689548081527053,
      "learning_rate": 4.5396171907947096e-05,
      "loss": 1.5526,
      "num_input_tokens_seen": 17530717664,
      "step": 22282
    },
    {
      "epoch": 2.3639932102694674,
      "grad_norm": 0.43692302419103063,
      "learning_rate": 4.539577002183974e-05,
      "loss": 1.5752,
      "num_input_tokens_seen": 17531504400,
      "step": 22283
    },
    {
      "epoch": 2.364099299809039,
      "grad_norm": 0.36859976071538225,
      "learning_rate": 4.539536811997114e-05,
      "loss": 1.4814,
      "num_input_tokens_seen": 17532291248,
      "step": 22284
    },
    {
      "epoch": 2.3642053893486104,
      "grad_norm": 0.3648317322761658,
      "learning_rate": 4.539496620234159e-05,
      "loss": 1.5349,
      "num_input_tokens_seen": 17533078096,
      "step": 22285
    },
    {
      "epoch": 2.3643114788881814,
      "grad_norm": 0.42582370538632697,
      "learning_rate": 4.5394564268951415e-05,
      "loss": 1.6022,
      "num_input_tokens_seen": 17533864928,
      "step": 22286
    },
    {
      "epoch": 2.364417568427753,
      "grad_norm": 0.35525502255748614,
      "learning_rate": 4.539416231980092e-05,
      "loss": 1.5861,
      "num_input_tokens_seen": 17534651760,
      "step": 22287
    },
    {
      "epoch": 2.3645236579673243,
      "grad_norm": 0.42415462489273764,
      "learning_rate": 4.5393760354890416e-05,
      "loss": 1.5979,
      "num_input_tokens_seen": 17535438576,
      "step": 22288
    },
    {
      "epoch": 2.364629747506896,
      "grad_norm": 0.3655382055915154,
      "learning_rate": 4.53933583742202e-05,
      "loss": 1.6221,
      "num_input_tokens_seen": 17536225264,
      "step": 22289
    },
    {
      "epoch": 2.3647358370464673,
      "grad_norm": 0.382890377935251,
      "learning_rate": 4.539295637779061e-05,
      "loss": 1.5883,
      "num_input_tokens_seen": 17537012096,
      "step": 22290
    },
    {
      "epoch": 2.3648419265860388,
      "grad_norm": 0.3880797045234961,
      "learning_rate": 4.539255436560193e-05,
      "loss": 1.6117,
      "num_input_tokens_seen": 17537798848,
      "step": 22291
    },
    {
      "epoch": 2.3649480161256102,
      "grad_norm": 0.42550117591875025,
      "learning_rate": 4.539215233765448e-05,
      "loss": 1.6077,
      "num_input_tokens_seen": 17538585584,
      "step": 22292
    },
    {
      "epoch": 2.3650541056651813,
      "grad_norm": 0.4151404150035421,
      "learning_rate": 4.5391750293948586e-05,
      "loss": 1.5426,
      "num_input_tokens_seen": 17539372368,
      "step": 22293
    },
    {
      "epoch": 2.3651601952047527,
      "grad_norm": 0.39379564689474933,
      "learning_rate": 4.5391348234484536e-05,
      "loss": 1.6205,
      "num_input_tokens_seen": 17540159104,
      "step": 22294
    },
    {
      "epoch": 2.365266284744324,
      "grad_norm": 0.3500226428610047,
      "learning_rate": 4.539094615926266e-05,
      "loss": 1.5962,
      "num_input_tokens_seen": 17540945824,
      "step": 22295
    },
    {
      "epoch": 2.3653723742838957,
      "grad_norm": 0.45697036604683516,
      "learning_rate": 4.539054406828325e-05,
      "loss": 1.7376,
      "num_input_tokens_seen": 17541732464,
      "step": 22296
    },
    {
      "epoch": 2.365478463823467,
      "grad_norm": 0.3597701060735645,
      "learning_rate": 4.539014196154663e-05,
      "loss": 1.6362,
      "num_input_tokens_seen": 17542519264,
      "step": 22297
    },
    {
      "epoch": 2.365584553363038,
      "grad_norm": 0.47617322369652737,
      "learning_rate": 4.53897398390531e-05,
      "loss": 1.7036,
      "num_input_tokens_seen": 17543306048,
      "step": 22298
    },
    {
      "epoch": 2.3656906429026097,
      "grad_norm": 0.35464292815115805,
      "learning_rate": 4.5389337700802986e-05,
      "loss": 1.5826,
      "num_input_tokens_seen": 17544092720,
      "step": 22299
    },
    {
      "epoch": 2.365796732442181,
      "grad_norm": 0.35969695370991595,
      "learning_rate": 4.538893554679659e-05,
      "loss": 1.742,
      "num_input_tokens_seen": 17544879408,
      "step": 22300
    },
    {
      "epoch": 2.3659028219817526,
      "grad_norm": 0.5990479641732694,
      "learning_rate": 4.538853337703422e-05,
      "loss": 1.4824,
      "num_input_tokens_seen": 17545666128,
      "step": 22301
    },
    {
      "epoch": 2.366008911521324,
      "grad_norm": 0.4097706110433756,
      "learning_rate": 4.538813119151618e-05,
      "loss": 1.7363,
      "num_input_tokens_seen": 17546452928,
      "step": 22302
    },
    {
      "epoch": 2.3661150010608956,
      "grad_norm": 0.5369852717655913,
      "learning_rate": 4.538772899024281e-05,
      "loss": 1.6105,
      "num_input_tokens_seen": 17547239648,
      "step": 22303
    },
    {
      "epoch": 2.366221090600467,
      "grad_norm": 0.3637151540591626,
      "learning_rate": 4.538732677321439e-05,
      "loss": 1.4701,
      "num_input_tokens_seen": 17548026368,
      "step": 22304
    },
    {
      "epoch": 2.366327180140038,
      "grad_norm": 0.5165884275539554,
      "learning_rate": 4.538692454043124e-05,
      "loss": 1.7115,
      "num_input_tokens_seen": 17548813104,
      "step": 22305
    },
    {
      "epoch": 2.3664332696796095,
      "grad_norm": 0.36419766841634527,
      "learning_rate": 4.5386522291893676e-05,
      "loss": 1.4745,
      "num_input_tokens_seen": 17549599936,
      "step": 22306
    },
    {
      "epoch": 2.366539359219181,
      "grad_norm": 0.37089386522146023,
      "learning_rate": 4.538612002760201e-05,
      "loss": 1.4971,
      "num_input_tokens_seen": 17550386784,
      "step": 22307
    },
    {
      "epoch": 2.3666454487587525,
      "grad_norm": 0.44523937213360265,
      "learning_rate": 4.538571774755654e-05,
      "loss": 1.5504,
      "num_input_tokens_seen": 17551173600,
      "step": 22308
    },
    {
      "epoch": 2.366751538298324,
      "grad_norm": 0.40681370664710204,
      "learning_rate": 4.538531545175759e-05,
      "loss": 1.6294,
      "num_input_tokens_seen": 17551960272,
      "step": 22309
    },
    {
      "epoch": 2.366857627837895,
      "grad_norm": 0.40849755031728524,
      "learning_rate": 4.538491314020546e-05,
      "loss": 1.7199,
      "num_input_tokens_seen": 17552746976,
      "step": 22310
    },
    {
      "epoch": 2.3669637173774665,
      "grad_norm": 0.4114717602503218,
      "learning_rate": 4.538451081290048e-05,
      "loss": 1.5103,
      "num_input_tokens_seen": 17553533728,
      "step": 22311
    },
    {
      "epoch": 2.367069806917038,
      "grad_norm": 0.37934830019427734,
      "learning_rate": 4.538410846984294e-05,
      "loss": 1.6087,
      "num_input_tokens_seen": 17554320496,
      "step": 22312
    },
    {
      "epoch": 2.3671758964566094,
      "grad_norm": 0.40540324124253335,
      "learning_rate": 4.5383706111033165e-05,
      "loss": 1.6093,
      "num_input_tokens_seen": 17555107296,
      "step": 22313
    },
    {
      "epoch": 2.367281985996181,
      "grad_norm": 0.39923346128020426,
      "learning_rate": 4.538330373647145e-05,
      "loss": 1.54,
      "num_input_tokens_seen": 17555894112,
      "step": 22314
    },
    {
      "epoch": 2.3673880755357524,
      "grad_norm": 0.3551582353058503,
      "learning_rate": 4.5382901346158125e-05,
      "loss": 1.5577,
      "num_input_tokens_seen": 17556680880,
      "step": 22315
    },
    {
      "epoch": 2.3674941650753234,
      "grad_norm": 0.5205844841917341,
      "learning_rate": 4.5382498940093485e-05,
      "loss": 1.601,
      "num_input_tokens_seen": 17557467616,
      "step": 22316
    },
    {
      "epoch": 2.367600254614895,
      "grad_norm": 0.3370076109457072,
      "learning_rate": 4.538209651827785e-05,
      "loss": 1.5827,
      "num_input_tokens_seen": 17558254368,
      "step": 22317
    },
    {
      "epoch": 2.3677063441544663,
      "grad_norm": 0.4446946074749461,
      "learning_rate": 4.5381694080711537e-05,
      "loss": 1.5082,
      "num_input_tokens_seen": 17559041152,
      "step": 22318
    },
    {
      "epoch": 2.367812433694038,
      "grad_norm": 0.3862428501132132,
      "learning_rate": 4.538129162739484e-05,
      "loss": 1.6035,
      "num_input_tokens_seen": 17559827936,
      "step": 22319
    },
    {
      "epoch": 2.3679185232336093,
      "grad_norm": 0.32890304235072404,
      "learning_rate": 4.538088915832808e-05,
      "loss": 1.6132,
      "num_input_tokens_seen": 17560614688,
      "step": 22320
    },
    {
      "epoch": 2.3680246127731808,
      "grad_norm": 0.5072435343025988,
      "learning_rate": 4.5380486673511565e-05,
      "loss": 1.6434,
      "num_input_tokens_seen": 17561401392,
      "step": 22321
    },
    {
      "epoch": 2.368130702312752,
      "grad_norm": 0.38875561686640486,
      "learning_rate": 4.5380084172945614e-05,
      "loss": 1.5864,
      "num_input_tokens_seen": 17562188128,
      "step": 22322
    },
    {
      "epoch": 2.3682367918523233,
      "grad_norm": 0.41492434763077984,
      "learning_rate": 4.537968165663052e-05,
      "loss": 1.5545,
      "num_input_tokens_seen": 17562974896,
      "step": 22323
    },
    {
      "epoch": 2.3683428813918947,
      "grad_norm": 0.33829824622590365,
      "learning_rate": 4.537927912456662e-05,
      "loss": 1.5865,
      "num_input_tokens_seen": 17563761568,
      "step": 22324
    },
    {
      "epoch": 2.3684489709314662,
      "grad_norm": 0.3633807576446733,
      "learning_rate": 4.53788765767542e-05,
      "loss": 1.5038,
      "num_input_tokens_seen": 17564548320,
      "step": 22325
    },
    {
      "epoch": 2.3685550604710377,
      "grad_norm": 0.3750331890699191,
      "learning_rate": 4.53784740131936e-05,
      "loss": 1.6976,
      "num_input_tokens_seen": 17565335088,
      "step": 22326
    },
    {
      "epoch": 2.3686611500106087,
      "grad_norm": 0.5204718118123892,
      "learning_rate": 4.537807143388509e-05,
      "loss": 1.6768,
      "num_input_tokens_seen": 17566121856,
      "step": 22327
    },
    {
      "epoch": 2.36876723955018,
      "grad_norm": 0.3763158061688843,
      "learning_rate": 4.5377668838829016e-05,
      "loss": 1.5705,
      "num_input_tokens_seen": 17566908608,
      "step": 22328
    },
    {
      "epoch": 2.3688733290897517,
      "grad_norm": 0.4352512252393634,
      "learning_rate": 4.5377266228025685e-05,
      "loss": 1.5877,
      "num_input_tokens_seen": 17567695408,
      "step": 22329
    },
    {
      "epoch": 2.368979418629323,
      "grad_norm": 0.38553050793977167,
      "learning_rate": 4.537686360147539e-05,
      "loss": 1.6595,
      "num_input_tokens_seen": 17568482208,
      "step": 22330
    },
    {
      "epoch": 2.3690855081688946,
      "grad_norm": 0.4316775128911603,
      "learning_rate": 4.5376460959178455e-05,
      "loss": 1.6219,
      "num_input_tokens_seen": 17569268992,
      "step": 22331
    },
    {
      "epoch": 2.369191597708466,
      "grad_norm": 0.4085209246009862,
      "learning_rate": 4.537605830113518e-05,
      "loss": 1.5583,
      "num_input_tokens_seen": 17570055760,
      "step": 22332
    },
    {
      "epoch": 2.3692976872480376,
      "grad_norm": 0.35749564587944715,
      "learning_rate": 4.53756556273459e-05,
      "loss": 1.6068,
      "num_input_tokens_seen": 17570842608,
      "step": 22333
    },
    {
      "epoch": 2.3694037767876086,
      "grad_norm": 0.44015905561384605,
      "learning_rate": 4.5375252937810906e-05,
      "loss": 1.6659,
      "num_input_tokens_seen": 17571629328,
      "step": 22334
    },
    {
      "epoch": 2.36950986632718,
      "grad_norm": 0.37363275970709087,
      "learning_rate": 4.5374850232530515e-05,
      "loss": 1.7967,
      "num_input_tokens_seen": 17572416064,
      "step": 22335
    },
    {
      "epoch": 2.3696159558667516,
      "grad_norm": 0.38183478435912926,
      "learning_rate": 4.5374447511505035e-05,
      "loss": 1.6582,
      "num_input_tokens_seen": 17573202848,
      "step": 22336
    },
    {
      "epoch": 2.369722045406323,
      "grad_norm": 0.4488295633678331,
      "learning_rate": 4.537404477473478e-05,
      "loss": 1.7664,
      "num_input_tokens_seen": 17573989584,
      "step": 22337
    },
    {
      "epoch": 2.3698281349458945,
      "grad_norm": 0.4077963500209294,
      "learning_rate": 4.537364202222006e-05,
      "loss": 1.6917,
      "num_input_tokens_seen": 17574776288,
      "step": 22338
    },
    {
      "epoch": 2.3699342244854655,
      "grad_norm": 0.431285219786541,
      "learning_rate": 4.5373239253961194e-05,
      "loss": 1.6702,
      "num_input_tokens_seen": 17575563056,
      "step": 22339
    },
    {
      "epoch": 2.370040314025037,
      "grad_norm": 0.3524860208975122,
      "learning_rate": 4.537283646995848e-05,
      "loss": 1.5934,
      "num_input_tokens_seen": 17576349776,
      "step": 22340
    },
    {
      "epoch": 2.3701464035646085,
      "grad_norm": 0.36885007621118987,
      "learning_rate": 4.5372433670212234e-05,
      "loss": 1.635,
      "num_input_tokens_seen": 17577136576,
      "step": 22341
    },
    {
      "epoch": 2.37025249310418,
      "grad_norm": 0.41847323203998266,
      "learning_rate": 4.5372030854722774e-05,
      "loss": 1.6503,
      "num_input_tokens_seen": 17577923328,
      "step": 22342
    },
    {
      "epoch": 2.3703585826437514,
      "grad_norm": 0.4160818857753019,
      "learning_rate": 4.537162802349041e-05,
      "loss": 1.6559,
      "num_input_tokens_seen": 17578710080,
      "step": 22343
    },
    {
      "epoch": 2.370464672183323,
      "grad_norm": 0.4111928739257542,
      "learning_rate": 4.5371225176515444e-05,
      "loss": 1.44,
      "num_input_tokens_seen": 17579496896,
      "step": 22344
    },
    {
      "epoch": 2.370570761722894,
      "grad_norm": 0.4211802454153775,
      "learning_rate": 4.537082231379819e-05,
      "loss": 1.5787,
      "num_input_tokens_seen": 17580283680,
      "step": 22345
    },
    {
      "epoch": 2.3706768512624654,
      "grad_norm": 0.39490969734077613,
      "learning_rate": 4.537041943533896e-05,
      "loss": 1.522,
      "num_input_tokens_seen": 17581070400,
      "step": 22346
    },
    {
      "epoch": 2.370782940802037,
      "grad_norm": 0.4087903868381019,
      "learning_rate": 4.5370016541138076e-05,
      "loss": 1.7229,
      "num_input_tokens_seen": 17581857136,
      "step": 22347
    },
    {
      "epoch": 2.3708890303416084,
      "grad_norm": 0.41338834446071165,
      "learning_rate": 4.536961363119584e-05,
      "loss": 1.5498,
      "num_input_tokens_seen": 17582643968,
      "step": 22348
    },
    {
      "epoch": 2.37099511988118,
      "grad_norm": 0.47156580066417464,
      "learning_rate": 4.536921070551256e-05,
      "loss": 1.5108,
      "num_input_tokens_seen": 17583430768,
      "step": 22349
    },
    {
      "epoch": 2.3711012094207513,
      "grad_norm": 0.43672758742539114,
      "learning_rate": 4.536880776408856e-05,
      "loss": 1.6538,
      "num_input_tokens_seen": 17584217504,
      "step": 22350
    },
    {
      "epoch": 2.3712072989603223,
      "grad_norm": 0.41635017817274667,
      "learning_rate": 4.536840480692413e-05,
      "loss": 1.5535,
      "num_input_tokens_seen": 17585004224,
      "step": 22351
    },
    {
      "epoch": 2.371313388499894,
      "grad_norm": 0.4183494231138364,
      "learning_rate": 4.53680018340196e-05,
      "loss": 1.7714,
      "num_input_tokens_seen": 17585790912,
      "step": 22352
    },
    {
      "epoch": 2.3714194780394653,
      "grad_norm": 0.3777586796771508,
      "learning_rate": 4.536759884537528e-05,
      "loss": 1.6464,
      "num_input_tokens_seen": 17586577648,
      "step": 22353
    },
    {
      "epoch": 2.3715255675790368,
      "grad_norm": 0.371291981524072,
      "learning_rate": 4.536719584099147e-05,
      "loss": 1.543,
      "num_input_tokens_seen": 17587364368,
      "step": 22354
    },
    {
      "epoch": 2.3716316571186082,
      "grad_norm": 0.4317362605371451,
      "learning_rate": 4.53667928208685e-05,
      "loss": 1.6818,
      "num_input_tokens_seen": 17588151072,
      "step": 22355
    },
    {
      "epoch": 2.3717377466581793,
      "grad_norm": 0.3982537571324023,
      "learning_rate": 4.536638978500666e-05,
      "loss": 1.6163,
      "num_input_tokens_seen": 17588937840,
      "step": 22356
    },
    {
      "epoch": 2.3718438361977507,
      "grad_norm": 0.5565962764617655,
      "learning_rate": 4.536598673340628e-05,
      "loss": 1.5741,
      "num_input_tokens_seen": 17589724640,
      "step": 22357
    },
    {
      "epoch": 2.371949925737322,
      "grad_norm": 0.5144480703504608,
      "learning_rate": 4.536558366606765e-05,
      "loss": 1.5498,
      "num_input_tokens_seen": 17590511376,
      "step": 22358
    },
    {
      "epoch": 2.3720560152768937,
      "grad_norm": 0.5306530525321332,
      "learning_rate": 4.536518058299111e-05,
      "loss": 1.4268,
      "num_input_tokens_seen": 17591298256,
      "step": 22359
    },
    {
      "epoch": 2.372162104816465,
      "grad_norm": 0.4064454725973103,
      "learning_rate": 4.536477748417695e-05,
      "loss": 1.6136,
      "num_input_tokens_seen": 17592085056,
      "step": 22360
    },
    {
      "epoch": 2.3722681943560366,
      "grad_norm": 0.4750694962902122,
      "learning_rate": 4.536437436962548e-05,
      "loss": 1.5869,
      "num_input_tokens_seen": 17592871760,
      "step": 22361
    },
    {
      "epoch": 2.372374283895608,
      "grad_norm": 0.4642801182074415,
      "learning_rate": 4.536397123933702e-05,
      "loss": 1.6054,
      "num_input_tokens_seen": 17593658592,
      "step": 22362
    },
    {
      "epoch": 2.372480373435179,
      "grad_norm": 0.6006499312430826,
      "learning_rate": 4.5363568093311893e-05,
      "loss": 1.6235,
      "num_input_tokens_seen": 17594445264,
      "step": 22363
    },
    {
      "epoch": 2.3725864629747506,
      "grad_norm": 0.41080312630265453,
      "learning_rate": 4.5363164931550384e-05,
      "loss": 1.7278,
      "num_input_tokens_seen": 17595231968,
      "step": 22364
    },
    {
      "epoch": 2.372692552514322,
      "grad_norm": 0.4345803343514673,
      "learning_rate": 4.536276175405283e-05,
      "loss": 1.5279,
      "num_input_tokens_seen": 17596018720,
      "step": 22365
    },
    {
      "epoch": 2.3727986420538936,
      "grad_norm": 0.5200971787140386,
      "learning_rate": 4.536235856081952e-05,
      "loss": 1.5637,
      "num_input_tokens_seen": 17596805536,
      "step": 22366
    },
    {
      "epoch": 2.372904731593465,
      "grad_norm": 0.4191063455314424,
      "learning_rate": 4.5361955351850785e-05,
      "loss": 1.584,
      "num_input_tokens_seen": 17597592240,
      "step": 22367
    },
    {
      "epoch": 2.373010821133036,
      "grad_norm": 0.469750691231255,
      "learning_rate": 4.536155212714692e-05,
      "loss": 1.6016,
      "num_input_tokens_seen": 17598379008,
      "step": 22368
    },
    {
      "epoch": 2.3731169106726075,
      "grad_norm": 0.39530411170639124,
      "learning_rate": 4.536114888670826e-05,
      "loss": 1.5101,
      "num_input_tokens_seen": 17599165808,
      "step": 22369
    },
    {
      "epoch": 2.373223000212179,
      "grad_norm": 0.475221832561121,
      "learning_rate": 4.536074563053509e-05,
      "loss": 1.5001,
      "num_input_tokens_seen": 17599952560,
      "step": 22370
    },
    {
      "epoch": 2.3733290897517505,
      "grad_norm": 0.5421040443660777,
      "learning_rate": 4.536034235862774e-05,
      "loss": 1.6796,
      "num_input_tokens_seen": 17600739312,
      "step": 22371
    },
    {
      "epoch": 2.373435179291322,
      "grad_norm": 0.4223344009337856,
      "learning_rate": 4.535993907098651e-05,
      "loss": 1.5612,
      "num_input_tokens_seen": 17601526096,
      "step": 22372
    },
    {
      "epoch": 2.3735412688308934,
      "grad_norm": 0.4972516107922948,
      "learning_rate": 4.535953576761172e-05,
      "loss": 1.7024,
      "num_input_tokens_seen": 17602312784,
      "step": 22373
    },
    {
      "epoch": 2.373647358370465,
      "grad_norm": 0.38950537169879146,
      "learning_rate": 4.535913244850367e-05,
      "loss": 1.5004,
      "num_input_tokens_seen": 17603099616,
      "step": 22374
    },
    {
      "epoch": 2.373753447910036,
      "grad_norm": 0.4312934398217751,
      "learning_rate": 4.5358729113662676e-05,
      "loss": 1.5955,
      "num_input_tokens_seen": 17603886368,
      "step": 22375
    },
    {
      "epoch": 2.3738595374496074,
      "grad_norm": 0.39347646023764815,
      "learning_rate": 4.535832576308907e-05,
      "loss": 1.6257,
      "num_input_tokens_seen": 17604673056,
      "step": 22376
    },
    {
      "epoch": 2.373965626989179,
      "grad_norm": 0.37889971472164413,
      "learning_rate": 4.535792239678314e-05,
      "loss": 1.7253,
      "num_input_tokens_seen": 17605459744,
      "step": 22377
    },
    {
      "epoch": 2.3740717165287504,
      "grad_norm": 0.5390008234022188,
      "learning_rate": 4.535751901474521e-05,
      "loss": 1.5921,
      "num_input_tokens_seen": 17606246464,
      "step": 22378
    },
    {
      "epoch": 2.374177806068322,
      "grad_norm": 0.37992475323467895,
      "learning_rate": 4.5357115616975574e-05,
      "loss": 1.6056,
      "num_input_tokens_seen": 17607033408,
      "step": 22379
    },
    {
      "epoch": 2.374283895607893,
      "grad_norm": 0.3609691130155164,
      "learning_rate": 4.5356712203474565e-05,
      "loss": 1.6164,
      "num_input_tokens_seen": 17607820224,
      "step": 22380
    },
    {
      "epoch": 2.3743899851474644,
      "grad_norm": 0.4816112058841821,
      "learning_rate": 4.5356308774242486e-05,
      "loss": 1.5366,
      "num_input_tokens_seen": 17608606992,
      "step": 22381
    },
    {
      "epoch": 2.374496074687036,
      "grad_norm": 0.36770329728590007,
      "learning_rate": 4.5355905329279644e-05,
      "loss": 1.7064,
      "num_input_tokens_seen": 17609393680,
      "step": 22382
    },
    {
      "epoch": 2.3746021642266073,
      "grad_norm": 0.6369457800504952,
      "learning_rate": 4.5355501868586364e-05,
      "loss": 1.5143,
      "num_input_tokens_seen": 17610180416,
      "step": 22383
    },
    {
      "epoch": 2.374708253766179,
      "grad_norm": 0.40544722795114874,
      "learning_rate": 4.535509839216294e-05,
      "loss": 1.6462,
      "num_input_tokens_seen": 17610967104,
      "step": 22384
    },
    {
      "epoch": 2.37481434330575,
      "grad_norm": 0.5425219447424058,
      "learning_rate": 4.5354694900009706e-05,
      "loss": 1.5476,
      "num_input_tokens_seen": 17611753872,
      "step": 22385
    },
    {
      "epoch": 2.3749204328453213,
      "grad_norm": 0.48726327707820727,
      "learning_rate": 4.535429139212695e-05,
      "loss": 1.6468,
      "num_input_tokens_seen": 17612540624,
      "step": 22386
    },
    {
      "epoch": 2.3750265223848928,
      "grad_norm": 0.38802890012539365,
      "learning_rate": 4.5353887868515e-05,
      "loss": 1.545,
      "num_input_tokens_seen": 17613327504,
      "step": 22387
    },
    {
      "epoch": 2.3751326119244642,
      "grad_norm": 0.6802616658406803,
      "learning_rate": 4.5353484329174156e-05,
      "loss": 1.6366,
      "num_input_tokens_seen": 17614114288,
      "step": 22388
    },
    {
      "epoch": 2.3752387014640357,
      "grad_norm": 0.4339943560460943,
      "learning_rate": 4.535308077410474e-05,
      "loss": 1.6561,
      "num_input_tokens_seen": 17614901072,
      "step": 22389
    },
    {
      "epoch": 2.375344791003607,
      "grad_norm": 0.593742580221148,
      "learning_rate": 4.5352677203307065e-05,
      "loss": 1.4671,
      "num_input_tokens_seen": 17615687872,
      "step": 22390
    },
    {
      "epoch": 2.3754508805431787,
      "grad_norm": 0.7875289443762581,
      "learning_rate": 4.5352273616781436e-05,
      "loss": 1.556,
      "num_input_tokens_seen": 17616474640,
      "step": 22391
    },
    {
      "epoch": 2.3755569700827497,
      "grad_norm": 0.6071720463735654,
      "learning_rate": 4.535187001452817e-05,
      "loss": 1.5237,
      "num_input_tokens_seen": 17617261424,
      "step": 22392
    },
    {
      "epoch": 2.375663059622321,
      "grad_norm": 1.3081813116643461,
      "learning_rate": 4.535146639654757e-05,
      "loss": 1.7135,
      "num_input_tokens_seen": 17618048160,
      "step": 22393
    },
    {
      "epoch": 2.3757691491618926,
      "grad_norm": 0.38132019431592157,
      "learning_rate": 4.535106276283995e-05,
      "loss": 1.495,
      "num_input_tokens_seen": 17618834976,
      "step": 22394
    },
    {
      "epoch": 2.375875238701464,
      "grad_norm": 0.976819466875306,
      "learning_rate": 4.535065911340564e-05,
      "loss": 1.6547,
      "num_input_tokens_seen": 17619621760,
      "step": 22395
    },
    {
      "epoch": 2.3759813282410356,
      "grad_norm": 0.6219446787273942,
      "learning_rate": 4.5350255448244925e-05,
      "loss": 1.6298,
      "num_input_tokens_seen": 17620408512,
      "step": 22396
    },
    {
      "epoch": 2.3760874177806066,
      "grad_norm": 0.7152617467832452,
      "learning_rate": 4.534985176735813e-05,
      "loss": 1.5996,
      "num_input_tokens_seen": 17621195264,
      "step": 22397
    },
    {
      "epoch": 2.376193507320178,
      "grad_norm": 0.6693298205235201,
      "learning_rate": 4.534944807074557e-05,
      "loss": 1.5719,
      "num_input_tokens_seen": 17621981984,
      "step": 22398
    },
    {
      "epoch": 2.3762995968597496,
      "grad_norm": 0.4360959843315854,
      "learning_rate": 4.5349044358407554e-05,
      "loss": 1.6925,
      "num_input_tokens_seen": 17622768768,
      "step": 22399
    },
    {
      "epoch": 2.376405686399321,
      "grad_norm": 0.5874659106980167,
      "learning_rate": 4.5348640630344393e-05,
      "loss": 1.679,
      "num_input_tokens_seen": 17623555488,
      "step": 22400
    },
    {
      "epoch": 2.3765117759388925,
      "grad_norm": 0.6396644388967304,
      "learning_rate": 4.5348236886556405e-05,
      "loss": 1.5903,
      "num_input_tokens_seen": 17624342224,
      "step": 22401
    },
    {
      "epoch": 2.376617865478464,
      "grad_norm": 0.4209147297600514,
      "learning_rate": 4.5347833127043893e-05,
      "loss": 1.6137,
      "num_input_tokens_seen": 17625128912,
      "step": 22402
    },
    {
      "epoch": 2.3767239550180355,
      "grad_norm": 0.4559464478798444,
      "learning_rate": 4.534742935180717e-05,
      "loss": 1.5883,
      "num_input_tokens_seen": 17625915632,
      "step": 22403
    },
    {
      "epoch": 2.3768300445576065,
      "grad_norm": 0.6245777352002683,
      "learning_rate": 4.5347025560846555e-05,
      "loss": 1.6937,
      "num_input_tokens_seen": 17626702368,
      "step": 22404
    },
    {
      "epoch": 2.376936134097178,
      "grad_norm": 0.3563039406600515,
      "learning_rate": 4.534662175416235e-05,
      "loss": 1.5197,
      "num_input_tokens_seen": 17627489104,
      "step": 22405
    },
    {
      "epoch": 2.3770422236367494,
      "grad_norm": 0.4954392150415598,
      "learning_rate": 4.534621793175487e-05,
      "loss": 1.6945,
      "num_input_tokens_seen": 17628275824,
      "step": 22406
    },
    {
      "epoch": 2.377148313176321,
      "grad_norm": 0.5828018500771255,
      "learning_rate": 4.5345814093624436e-05,
      "loss": 1.6471,
      "num_input_tokens_seen": 17629062560,
      "step": 22407
    },
    {
      "epoch": 2.3772544027158924,
      "grad_norm": 0.39835768010454353,
      "learning_rate": 4.534541023977136e-05,
      "loss": 1.5984,
      "num_input_tokens_seen": 17629849232,
      "step": 22408
    },
    {
      "epoch": 2.3773604922554634,
      "grad_norm": 0.5324703418584524,
      "learning_rate": 4.534500637019594e-05,
      "loss": 1.6101,
      "num_input_tokens_seen": 17630635968,
      "step": 22409
    },
    {
      "epoch": 2.377466581795035,
      "grad_norm": 0.5013358205440528,
      "learning_rate": 4.53446024848985e-05,
      "loss": 1.6252,
      "num_input_tokens_seen": 17631422720,
      "step": 22410
    },
    {
      "epoch": 2.3775726713346064,
      "grad_norm": 0.5088411964071012,
      "learning_rate": 4.5344198583879346e-05,
      "loss": 1.6615,
      "num_input_tokens_seen": 17632209488,
      "step": 22411
    },
    {
      "epoch": 2.377678760874178,
      "grad_norm": 0.6301886133338027,
      "learning_rate": 4.534379466713879e-05,
      "loss": 1.5624,
      "num_input_tokens_seen": 17632996256,
      "step": 22412
    },
    {
      "epoch": 2.3777848504137493,
      "grad_norm": 0.49001165928550616,
      "learning_rate": 4.534339073467715e-05,
      "loss": 1.6099,
      "num_input_tokens_seen": 17633782976,
      "step": 22413
    },
    {
      "epoch": 2.377890939953321,
      "grad_norm": 0.393866072711888,
      "learning_rate": 4.5342986786494735e-05,
      "loss": 1.5564,
      "num_input_tokens_seen": 17634569712,
      "step": 22414
    },
    {
      "epoch": 2.377997029492892,
      "grad_norm": 0.5700231311896449,
      "learning_rate": 4.534258282259185e-05,
      "loss": 1.6725,
      "num_input_tokens_seen": 17635356432,
      "step": 22415
    },
    {
      "epoch": 2.3781031190324633,
      "grad_norm": 0.48879262328540596,
      "learning_rate": 4.5342178842968816e-05,
      "loss": 1.4657,
      "num_input_tokens_seen": 17636143152,
      "step": 22416
    },
    {
      "epoch": 2.3782092085720348,
      "grad_norm": 0.4794127416012935,
      "learning_rate": 4.5341774847625954e-05,
      "loss": 1.6683,
      "num_input_tokens_seen": 17636929872,
      "step": 22417
    },
    {
      "epoch": 2.3783152981116062,
      "grad_norm": 0.42461443888697914,
      "learning_rate": 4.534137083656354e-05,
      "loss": 1.5491,
      "num_input_tokens_seen": 17637716608,
      "step": 22418
    },
    {
      "epoch": 2.3784213876511777,
      "grad_norm": 0.43732871792218647,
      "learning_rate": 4.5340966809781935e-05,
      "loss": 1.5633,
      "num_input_tokens_seen": 17638503376,
      "step": 22419
    },
    {
      "epoch": 2.378527477190749,
      "grad_norm": 0.4662620808758232,
      "learning_rate": 4.534056276728143e-05,
      "loss": 1.6725,
      "num_input_tokens_seen": 17639290096,
      "step": 22420
    },
    {
      "epoch": 2.3786335667303202,
      "grad_norm": 0.3899110843645546,
      "learning_rate": 4.534015870906232e-05,
      "loss": 1.464,
      "num_input_tokens_seen": 17640076928,
      "step": 22421
    },
    {
      "epoch": 2.3787396562698917,
      "grad_norm": 0.4216188276193443,
      "learning_rate": 4.533975463512494e-05,
      "loss": 1.6184,
      "num_input_tokens_seen": 17640863712,
      "step": 22422
    },
    {
      "epoch": 2.378845745809463,
      "grad_norm": 0.4225599817374309,
      "learning_rate": 4.533935054546959e-05,
      "loss": 1.6605,
      "num_input_tokens_seen": 17641650464,
      "step": 22423
    },
    {
      "epoch": 2.3789518353490346,
      "grad_norm": 0.3764412444498445,
      "learning_rate": 4.533894644009659e-05,
      "loss": 1.7037,
      "num_input_tokens_seen": 17642437152,
      "step": 22424
    },
    {
      "epoch": 2.379057924888606,
      "grad_norm": 0.37431582420174747,
      "learning_rate": 4.533854231900624e-05,
      "loss": 1.5598,
      "num_input_tokens_seen": 17643223856,
      "step": 22425
    },
    {
      "epoch": 2.379164014428177,
      "grad_norm": 0.43357917087889786,
      "learning_rate": 4.533813818219888e-05,
      "loss": 1.6098,
      "num_input_tokens_seen": 17644010608,
      "step": 22426
    },
    {
      "epoch": 2.3792701039677486,
      "grad_norm": 0.3730813840484552,
      "learning_rate": 4.533773402967479e-05,
      "loss": 1.5177,
      "num_input_tokens_seen": 17644797376,
      "step": 22427
    },
    {
      "epoch": 2.37937619350732,
      "grad_norm": 0.499859622028726,
      "learning_rate": 4.53373298614343e-05,
      "loss": 1.6452,
      "num_input_tokens_seen": 17645584080,
      "step": 22428
    },
    {
      "epoch": 2.3794822830468916,
      "grad_norm": 0.42810637627947856,
      "learning_rate": 4.533692567747772e-05,
      "loss": 1.637,
      "num_input_tokens_seen": 17646370816,
      "step": 22429
    },
    {
      "epoch": 2.379588372586463,
      "grad_norm": 0.371820577283989,
      "learning_rate": 4.533652147780535e-05,
      "loss": 1.6005,
      "num_input_tokens_seen": 17647157536,
      "step": 22430
    },
    {
      "epoch": 2.3796944621260345,
      "grad_norm": 0.4936446655776948,
      "learning_rate": 4.533611726241752e-05,
      "loss": 1.6919,
      "num_input_tokens_seen": 17647944224,
      "step": 22431
    },
    {
      "epoch": 2.379800551665606,
      "grad_norm": 0.4385059088308562,
      "learning_rate": 4.533571303131454e-05,
      "loss": 1.6435,
      "num_input_tokens_seen": 17648730960,
      "step": 22432
    },
    {
      "epoch": 2.379906641205177,
      "grad_norm": 0.4352106184978497,
      "learning_rate": 4.533530878449671e-05,
      "loss": 1.6478,
      "num_input_tokens_seen": 17649517696,
      "step": 22433
    },
    {
      "epoch": 2.3800127307447485,
      "grad_norm": 0.38591638032160214,
      "learning_rate": 4.533490452196435e-05,
      "loss": 1.4393,
      "num_input_tokens_seen": 17650304544,
      "step": 22434
    },
    {
      "epoch": 2.38011882028432,
      "grad_norm": 0.3893834208030203,
      "learning_rate": 4.5334500243717784e-05,
      "loss": 1.6133,
      "num_input_tokens_seen": 17651091280,
      "step": 22435
    },
    {
      "epoch": 2.3802249098238915,
      "grad_norm": 0.47037251365360405,
      "learning_rate": 4.5334095949757305e-05,
      "loss": 1.5461,
      "num_input_tokens_seen": 17651878080,
      "step": 22436
    },
    {
      "epoch": 2.380330999363463,
      "grad_norm": 0.3993187205974426,
      "learning_rate": 4.533369164008323e-05,
      "loss": 1.5884,
      "num_input_tokens_seen": 17652664848,
      "step": 22437
    },
    {
      "epoch": 2.380437088903034,
      "grad_norm": 0.49231358380058904,
      "learning_rate": 4.5333287314695874e-05,
      "loss": 1.7174,
      "num_input_tokens_seen": 17653451680,
      "step": 22438
    },
    {
      "epoch": 2.3805431784426054,
      "grad_norm": 0.419945426879871,
      "learning_rate": 4.533288297359556e-05,
      "loss": 1.6742,
      "num_input_tokens_seen": 17654238352,
      "step": 22439
    },
    {
      "epoch": 2.380649267982177,
      "grad_norm": 0.4375502793956539,
      "learning_rate": 4.533247861678258e-05,
      "loss": 1.6774,
      "num_input_tokens_seen": 17655024976,
      "step": 22440
    },
    {
      "epoch": 2.3807553575217484,
      "grad_norm": 0.3893011472736647,
      "learning_rate": 4.533207424425726e-05,
      "loss": 1.5573,
      "num_input_tokens_seen": 17655811808,
      "step": 22441
    },
    {
      "epoch": 2.38086144706132,
      "grad_norm": 0.38013666017271786,
      "learning_rate": 4.5331669856019906e-05,
      "loss": 1.6599,
      "num_input_tokens_seen": 17656598544,
      "step": 22442
    },
    {
      "epoch": 2.3809675366008913,
      "grad_norm": 0.3831256352581804,
      "learning_rate": 4.533126545207085e-05,
      "loss": 1.6231,
      "num_input_tokens_seen": 17657385376,
      "step": 22443
    },
    {
      "epoch": 2.3810736261404624,
      "grad_norm": 0.3909047763192306,
      "learning_rate": 4.533086103241038e-05,
      "loss": 1.5852,
      "num_input_tokens_seen": 17658172128,
      "step": 22444
    },
    {
      "epoch": 2.381179715680034,
      "grad_norm": 0.4234427277743265,
      "learning_rate": 4.5330456597038805e-05,
      "loss": 1.5886,
      "num_input_tokens_seen": 17658958880,
      "step": 22445
    },
    {
      "epoch": 2.3812858052196053,
      "grad_norm": 0.3766752357085081,
      "learning_rate": 4.5330052145956466e-05,
      "loss": 1.5904,
      "num_input_tokens_seen": 17659745600,
      "step": 22446
    },
    {
      "epoch": 2.381391894759177,
      "grad_norm": 0.4190019934602423,
      "learning_rate": 4.532964767916365e-05,
      "loss": 1.7264,
      "num_input_tokens_seen": 17660532400,
      "step": 22447
    },
    {
      "epoch": 2.3814979842987483,
      "grad_norm": 0.41297878936139004,
      "learning_rate": 4.532924319666068e-05,
      "loss": 1.7986,
      "num_input_tokens_seen": 17661319104,
      "step": 22448
    },
    {
      "epoch": 2.3816040738383197,
      "grad_norm": 0.3613181212637836,
      "learning_rate": 4.5328838698447874e-05,
      "loss": 1.5091,
      "num_input_tokens_seen": 17662105872,
      "step": 22449
    },
    {
      "epoch": 2.3817101633778908,
      "grad_norm": 0.36659838510780374,
      "learning_rate": 4.532843418452553e-05,
      "loss": 1.6709,
      "num_input_tokens_seen": 17662892640,
      "step": 22450
    },
    {
      "epoch": 2.3818162529174622,
      "grad_norm": 0.3644878798370256,
      "learning_rate": 4.5328029654893975e-05,
      "loss": 1.5805,
      "num_input_tokens_seen": 17663679408,
      "step": 22451
    },
    {
      "epoch": 2.3819223424570337,
      "grad_norm": 0.4241453284969937,
      "learning_rate": 4.5327625109553505e-05,
      "loss": 1.7106,
      "num_input_tokens_seen": 17664466128,
      "step": 22452
    },
    {
      "epoch": 2.382028431996605,
      "grad_norm": 0.3443793378520609,
      "learning_rate": 4.5327220548504455e-05,
      "loss": 1.4872,
      "num_input_tokens_seen": 17665252880,
      "step": 22453
    },
    {
      "epoch": 2.3821345215361767,
      "grad_norm": 0.42289216109987887,
      "learning_rate": 4.532681597174712e-05,
      "loss": 1.6908,
      "num_input_tokens_seen": 17666039600,
      "step": 22454
    },
    {
      "epoch": 2.3822406110757477,
      "grad_norm": 0.37217386705022226,
      "learning_rate": 4.5326411379281815e-05,
      "loss": 1.6246,
      "num_input_tokens_seen": 17666826320,
      "step": 22455
    },
    {
      "epoch": 2.382346700615319,
      "grad_norm": 0.3614598226319179,
      "learning_rate": 4.532600677110886e-05,
      "loss": 1.6363,
      "num_input_tokens_seen": 17667613104,
      "step": 22456
    },
    {
      "epoch": 2.3824527901548906,
      "grad_norm": 0.37178837851795166,
      "learning_rate": 4.532560214722856e-05,
      "loss": 1.7031,
      "num_input_tokens_seen": 17668399888,
      "step": 22457
    },
    {
      "epoch": 2.382558879694462,
      "grad_norm": 0.3914019100705885,
      "learning_rate": 4.5325197507641234e-05,
      "loss": 1.5775,
      "num_input_tokens_seen": 17669186640,
      "step": 22458
    },
    {
      "epoch": 2.3826649692340336,
      "grad_norm": 0.37441507282494924,
      "learning_rate": 4.532479285234719e-05,
      "loss": 1.6268,
      "num_input_tokens_seen": 17669973440,
      "step": 22459
    },
    {
      "epoch": 2.382771058773605,
      "grad_norm": 0.38599976372231404,
      "learning_rate": 4.532438818134674e-05,
      "loss": 1.6144,
      "num_input_tokens_seen": 17670760096,
      "step": 22460
    },
    {
      "epoch": 2.3828771483131765,
      "grad_norm": 0.3385952008622436,
      "learning_rate": 4.532398349464021e-05,
      "loss": 1.5999,
      "num_input_tokens_seen": 17671546880,
      "step": 22461
    },
    {
      "epoch": 2.3829832378527476,
      "grad_norm": 0.36187069292693025,
      "learning_rate": 4.53235787922279e-05,
      "loss": 1.5744,
      "num_input_tokens_seen": 17672333632,
      "step": 22462
    },
    {
      "epoch": 2.383089327392319,
      "grad_norm": 0.3530950152981262,
      "learning_rate": 4.5323174074110106e-05,
      "loss": 1.5482,
      "num_input_tokens_seen": 17673120368,
      "step": 22463
    },
    {
      "epoch": 2.3831954169318905,
      "grad_norm": 0.3843414231562291,
      "learning_rate": 4.532276934028717e-05,
      "loss": 1.5753,
      "num_input_tokens_seen": 17673907056,
      "step": 22464
    },
    {
      "epoch": 2.383301506471462,
      "grad_norm": 0.3745981411668429,
      "learning_rate": 4.53223645907594e-05,
      "loss": 1.6709,
      "num_input_tokens_seen": 17674693888,
      "step": 22465
    },
    {
      "epoch": 2.3834075960110335,
      "grad_norm": 0.41115823068593893,
      "learning_rate": 4.5321959825527105e-05,
      "loss": 1.578,
      "num_input_tokens_seen": 17675480576,
      "step": 22466
    },
    {
      "epoch": 2.3835136855506045,
      "grad_norm": 0.38280300004266193,
      "learning_rate": 4.532155504459059e-05,
      "loss": 1.618,
      "num_input_tokens_seen": 17676267344,
      "step": 22467
    },
    {
      "epoch": 2.383619775090176,
      "grad_norm": 0.3686655698565703,
      "learning_rate": 4.532115024795017e-05,
      "loss": 1.6445,
      "num_input_tokens_seen": 17677054144,
      "step": 22468
    },
    {
      "epoch": 2.3837258646297474,
      "grad_norm": 0.3476343575146415,
      "learning_rate": 4.5320745435606166e-05,
      "loss": 1.5787,
      "num_input_tokens_seen": 17677840848,
      "step": 22469
    },
    {
      "epoch": 2.383831954169319,
      "grad_norm": 0.45623620550978056,
      "learning_rate": 4.532034060755889e-05,
      "loss": 1.5426,
      "num_input_tokens_seen": 17678627536,
      "step": 22470
    },
    {
      "epoch": 2.3839380437088904,
      "grad_norm": 0.3746287185221417,
      "learning_rate": 4.531993576380864e-05,
      "loss": 1.6021,
      "num_input_tokens_seen": 17679414256,
      "step": 22471
    },
    {
      "epoch": 2.384044133248462,
      "grad_norm": 0.42076892427291673,
      "learning_rate": 4.531953090435575e-05,
      "loss": 1.5533,
      "num_input_tokens_seen": 17680201056,
      "step": 22472
    },
    {
      "epoch": 2.3841502227880333,
      "grad_norm": 0.41737185264448595,
      "learning_rate": 4.5319126029200515e-05,
      "loss": 1.6112,
      "num_input_tokens_seen": 17680987888,
      "step": 22473
    },
    {
      "epoch": 2.3842563123276044,
      "grad_norm": 0.3920133389680593,
      "learning_rate": 4.5318721138343256e-05,
      "loss": 1.5918,
      "num_input_tokens_seen": 17681774720,
      "step": 22474
    },
    {
      "epoch": 2.384362401867176,
      "grad_norm": 0.42079379079701024,
      "learning_rate": 4.53183162317843e-05,
      "loss": 1.7643,
      "num_input_tokens_seen": 17682561440,
      "step": 22475
    },
    {
      "epoch": 2.3844684914067473,
      "grad_norm": 0.3579553779913157,
      "learning_rate": 4.531791130952393e-05,
      "loss": 1.64,
      "num_input_tokens_seen": 17683348176,
      "step": 22476
    },
    {
      "epoch": 2.384574580946319,
      "grad_norm": 0.3896995534857625,
      "learning_rate": 4.531750637156247e-05,
      "loss": 1.5408,
      "num_input_tokens_seen": 17684134928,
      "step": 22477
    },
    {
      "epoch": 2.3846806704858903,
      "grad_norm": 0.35288210884292226,
      "learning_rate": 4.5317101417900255e-05,
      "loss": 1.4944,
      "num_input_tokens_seen": 17684921648,
      "step": 22478
    },
    {
      "epoch": 2.3847867600254613,
      "grad_norm": 0.4418803727042746,
      "learning_rate": 4.5316696448537564e-05,
      "loss": 1.6602,
      "num_input_tokens_seen": 17685708400,
      "step": 22479
    },
    {
      "epoch": 2.384892849565033,
      "grad_norm": 0.48968748885427016,
      "learning_rate": 4.531629146347474e-05,
      "loss": 1.9059,
      "num_input_tokens_seen": 17686495072,
      "step": 22480
    },
    {
      "epoch": 2.3849989391046043,
      "grad_norm": 0.3641789891380408,
      "learning_rate": 4.531588646271207e-05,
      "loss": 1.5897,
      "num_input_tokens_seen": 17687281824,
      "step": 22481
    },
    {
      "epoch": 2.3851050286441757,
      "grad_norm": 0.4966216137526129,
      "learning_rate": 4.531548144624989e-05,
      "loss": 1.6375,
      "num_input_tokens_seen": 17688068608,
      "step": 22482
    },
    {
      "epoch": 2.385211118183747,
      "grad_norm": 0.3723165322856622,
      "learning_rate": 4.531507641408849e-05,
      "loss": 1.6117,
      "num_input_tokens_seen": 17688855360,
      "step": 22483
    },
    {
      "epoch": 2.3853172077233182,
      "grad_norm": 0.46367743124914873,
      "learning_rate": 4.53146713662282e-05,
      "loss": 1.6046,
      "num_input_tokens_seen": 17689642128,
      "step": 22484
    },
    {
      "epoch": 2.3854232972628897,
      "grad_norm": 0.40985028014517694,
      "learning_rate": 4.531426630266933e-05,
      "loss": 1.5971,
      "num_input_tokens_seen": 17690428944,
      "step": 22485
    },
    {
      "epoch": 2.385529386802461,
      "grad_norm": 0.420318583990745,
      "learning_rate": 4.531386122341219e-05,
      "loss": 1.6877,
      "num_input_tokens_seen": 17691215664,
      "step": 22486
    },
    {
      "epoch": 2.3856354763420327,
      "grad_norm": 0.3860725687667269,
      "learning_rate": 4.53134561284571e-05,
      "loss": 1.5606,
      "num_input_tokens_seen": 17692002480,
      "step": 22487
    },
    {
      "epoch": 2.385741565881604,
      "grad_norm": 0.40500893934515086,
      "learning_rate": 4.531305101780436e-05,
      "loss": 1.6456,
      "num_input_tokens_seen": 17692789280,
      "step": 22488
    },
    {
      "epoch": 2.3858476554211756,
      "grad_norm": 0.3778020903998514,
      "learning_rate": 4.531264589145429e-05,
      "loss": 1.609,
      "num_input_tokens_seen": 17693576064,
      "step": 22489
    },
    {
      "epoch": 2.385953744960747,
      "grad_norm": 0.4164241445399468,
      "learning_rate": 4.531224074940721e-05,
      "loss": 1.7119,
      "num_input_tokens_seen": 17694362752,
      "step": 22490
    },
    {
      "epoch": 2.386059834500318,
      "grad_norm": 0.3944982399050449,
      "learning_rate": 4.531183559166342e-05,
      "loss": 1.6349,
      "num_input_tokens_seen": 17695149536,
      "step": 22491
    },
    {
      "epoch": 2.3861659240398896,
      "grad_norm": 0.42633720695504435,
      "learning_rate": 4.531143041822323e-05,
      "loss": 1.5335,
      "num_input_tokens_seen": 17695936304,
      "step": 22492
    },
    {
      "epoch": 2.386272013579461,
      "grad_norm": 0.42616458189169837,
      "learning_rate": 4.531102522908698e-05,
      "loss": 1.8347,
      "num_input_tokens_seen": 17696723008,
      "step": 22493
    },
    {
      "epoch": 2.3863781031190325,
      "grad_norm": 0.4438664776462946,
      "learning_rate": 4.531062002425496e-05,
      "loss": 1.4511,
      "num_input_tokens_seen": 17697509696,
      "step": 22494
    },
    {
      "epoch": 2.386484192658604,
      "grad_norm": 0.42509298234497267,
      "learning_rate": 4.531021480372749e-05,
      "loss": 1.6212,
      "num_input_tokens_seen": 17698296576,
      "step": 22495
    },
    {
      "epoch": 2.386590282198175,
      "grad_norm": 0.4008084561878029,
      "learning_rate": 4.530980956750488e-05,
      "loss": 1.5462,
      "num_input_tokens_seen": 17699083360,
      "step": 22496
    },
    {
      "epoch": 2.3866963717377465,
      "grad_norm": 0.82164834744005,
      "learning_rate": 4.530940431558744e-05,
      "loss": 1.6318,
      "num_input_tokens_seen": 17699870112,
      "step": 22497
    },
    {
      "epoch": 2.386802461277318,
      "grad_norm": 0.873760896422501,
      "learning_rate": 4.53089990479755e-05,
      "loss": 1.5491,
      "num_input_tokens_seen": 17700656912,
      "step": 22498
    },
    {
      "epoch": 2.3869085508168895,
      "grad_norm": 0.618648417535442,
      "learning_rate": 4.530859376466935e-05,
      "loss": 1.5646,
      "num_input_tokens_seen": 17701443728,
      "step": 22499
    },
    {
      "epoch": 2.387014640356461,
      "grad_norm": 0.8396275903110192,
      "learning_rate": 4.530818846566932e-05,
      "loss": 1.6125,
      "num_input_tokens_seen": 17702230512,
      "step": 22500
    },
    {
      "epoch": 2.3871207298960324,
      "grad_norm": 0.6043418661043071,
      "learning_rate": 4.5307783150975715e-05,
      "loss": 1.5039,
      "num_input_tokens_seen": 17703017152,
      "step": 22501
    },
    {
      "epoch": 2.387226819435604,
      "grad_norm": 0.6264108075183371,
      "learning_rate": 4.530737782058885e-05,
      "loss": 1.6367,
      "num_input_tokens_seen": 17703803824,
      "step": 22502
    },
    {
      "epoch": 2.387332908975175,
      "grad_norm": 0.5917983153219446,
      "learning_rate": 4.5306972474509045e-05,
      "loss": 1.5265,
      "num_input_tokens_seen": 17704590688,
      "step": 22503
    },
    {
      "epoch": 2.3874389985147464,
      "grad_norm": 0.5600424923834776,
      "learning_rate": 4.530656711273661e-05,
      "loss": 1.6994,
      "num_input_tokens_seen": 17705377456,
      "step": 22504
    },
    {
      "epoch": 2.387545088054318,
      "grad_norm": 0.4946128878377837,
      "learning_rate": 4.5306161735271846e-05,
      "loss": 1.6691,
      "num_input_tokens_seen": 17706164304,
      "step": 22505
    },
    {
      "epoch": 2.3876511775938893,
      "grad_norm": 0.4132820637058054,
      "learning_rate": 4.530575634211508e-05,
      "loss": 1.52,
      "num_input_tokens_seen": 17706951104,
      "step": 22506
    },
    {
      "epoch": 2.387757267133461,
      "grad_norm": 0.50561251761917,
      "learning_rate": 4.530535093326662e-05,
      "loss": 1.6938,
      "num_input_tokens_seen": 17707737952,
      "step": 22507
    },
    {
      "epoch": 2.387863356673032,
      "grad_norm": 0.4542693528794504,
      "learning_rate": 4.530494550872678e-05,
      "loss": 1.5349,
      "num_input_tokens_seen": 17708524720,
      "step": 22508
    },
    {
      "epoch": 2.3879694462126033,
      "grad_norm": 0.43126872729982896,
      "learning_rate": 4.5304540068495884e-05,
      "loss": 1.5684,
      "num_input_tokens_seen": 17709311440,
      "step": 22509
    },
    {
      "epoch": 2.388075535752175,
      "grad_norm": 0.5761142460883856,
      "learning_rate": 4.5304134612574226e-05,
      "loss": 1.7626,
      "num_input_tokens_seen": 17710098112,
      "step": 22510
    },
    {
      "epoch": 2.3881816252917463,
      "grad_norm": 0.4678753490077116,
      "learning_rate": 4.530372914096212e-05,
      "loss": 1.5471,
      "num_input_tokens_seen": 17710884848,
      "step": 22511
    },
    {
      "epoch": 2.3882877148313177,
      "grad_norm": 0.5371661632761674,
      "learning_rate": 4.530332365365991e-05,
      "loss": 1.6486,
      "num_input_tokens_seen": 17711671664,
      "step": 22512
    },
    {
      "epoch": 2.388393804370889,
      "grad_norm": 0.4956528127225334,
      "learning_rate": 4.5302918150667875e-05,
      "loss": 1.5804,
      "num_input_tokens_seen": 17712458384,
      "step": 22513
    },
    {
      "epoch": 2.3884998939104602,
      "grad_norm": 0.5030948364668768,
      "learning_rate": 4.530251263198634e-05,
      "loss": 1.5885,
      "num_input_tokens_seen": 17713245024,
      "step": 22514
    },
    {
      "epoch": 2.3886059834500317,
      "grad_norm": 0.4193689028872024,
      "learning_rate": 4.530210709761562e-05,
      "loss": 1.5692,
      "num_input_tokens_seen": 17714031872,
      "step": 22515
    },
    {
      "epoch": 2.388712072989603,
      "grad_norm": 0.4714285133006924,
      "learning_rate": 4.530170154755602e-05,
      "loss": 1.5316,
      "num_input_tokens_seen": 17714818608,
      "step": 22516
    },
    {
      "epoch": 2.3888181625291747,
      "grad_norm": 0.503098125200785,
      "learning_rate": 4.5301295981807875e-05,
      "loss": 1.6208,
      "num_input_tokens_seen": 17715605296,
      "step": 22517
    },
    {
      "epoch": 2.388924252068746,
      "grad_norm": 0.3668632129150675,
      "learning_rate": 4.530089040037148e-05,
      "loss": 1.63,
      "num_input_tokens_seen": 17716392032,
      "step": 22518
    },
    {
      "epoch": 2.3890303416083176,
      "grad_norm": 0.5054740287991543,
      "learning_rate": 4.5300484803247145e-05,
      "loss": 1.6627,
      "num_input_tokens_seen": 17717178800,
      "step": 22519
    },
    {
      "epoch": 2.3891364311478887,
      "grad_norm": 0.47348070947758636,
      "learning_rate": 4.53000791904352e-05,
      "loss": 1.7321,
      "num_input_tokens_seen": 17717965600,
      "step": 22520
    },
    {
      "epoch": 2.38924252068746,
      "grad_norm": 0.422914149901808,
      "learning_rate": 4.529967356193594e-05,
      "loss": 1.6259,
      "num_input_tokens_seen": 17718752288,
      "step": 22521
    },
    {
      "epoch": 2.3893486102270316,
      "grad_norm": 0.44898284663119026,
      "learning_rate": 4.529926791774969e-05,
      "loss": 1.4433,
      "num_input_tokens_seen": 17719539088,
      "step": 22522
    },
    {
      "epoch": 2.389454699766603,
      "grad_norm": 0.45666002478067347,
      "learning_rate": 4.5298862257876765e-05,
      "loss": 1.6783,
      "num_input_tokens_seen": 17720325904,
      "step": 22523
    },
    {
      "epoch": 2.3895607893061745,
      "grad_norm": 0.5130017659306135,
      "learning_rate": 4.529845658231747e-05,
      "loss": 1.5784,
      "num_input_tokens_seen": 17721112688,
      "step": 22524
    },
    {
      "epoch": 2.3896668788457456,
      "grad_norm": 0.390909951615081,
      "learning_rate": 4.529805089107213e-05,
      "loss": 1.5968,
      "num_input_tokens_seen": 17721899456,
      "step": 22525
    },
    {
      "epoch": 2.389772968385317,
      "grad_norm": 0.5768352257976475,
      "learning_rate": 4.5297645184141054e-05,
      "loss": 1.7365,
      "num_input_tokens_seen": 17722686112,
      "step": 22526
    },
    {
      "epoch": 2.3898790579248885,
      "grad_norm": 0.4064422165846064,
      "learning_rate": 4.529723946152454e-05,
      "loss": 1.6451,
      "num_input_tokens_seen": 17723472768,
      "step": 22527
    },
    {
      "epoch": 2.38998514746446,
      "grad_norm": 0.4837836157699978,
      "learning_rate": 4.5296833723222934e-05,
      "loss": 1.5958,
      "num_input_tokens_seen": 17724259520,
      "step": 22528
    },
    {
      "epoch": 2.3900912370040315,
      "grad_norm": 0.4378627294977826,
      "learning_rate": 4.529642796923652e-05,
      "loss": 1.6757,
      "num_input_tokens_seen": 17725046256,
      "step": 22529
    },
    {
      "epoch": 2.390197326543603,
      "grad_norm": 0.4067349457057777,
      "learning_rate": 4.529602219956562e-05,
      "loss": 1.5746,
      "num_input_tokens_seen": 17725832976,
      "step": 22530
    },
    {
      "epoch": 2.3903034160831744,
      "grad_norm": 0.39344516903798304,
      "learning_rate": 4.5295616414210554e-05,
      "loss": 1.4356,
      "num_input_tokens_seen": 17726619744,
      "step": 22531
    },
    {
      "epoch": 2.3904095056227455,
      "grad_norm": 0.5183550831985185,
      "learning_rate": 4.529521061317162e-05,
      "loss": 1.5748,
      "num_input_tokens_seen": 17727406544,
      "step": 22532
    },
    {
      "epoch": 2.390515595162317,
      "grad_norm": 0.3736211755679721,
      "learning_rate": 4.529480479644916e-05,
      "loss": 1.6289,
      "num_input_tokens_seen": 17728193312,
      "step": 22533
    },
    {
      "epoch": 2.3906216847018884,
      "grad_norm": 0.4560538950565277,
      "learning_rate": 4.529439896404346e-05,
      "loss": 1.6532,
      "num_input_tokens_seen": 17728980064,
      "step": 22534
    },
    {
      "epoch": 2.39072777424146,
      "grad_norm": 0.40186348330256233,
      "learning_rate": 4.5293993115954844e-05,
      "loss": 1.5716,
      "num_input_tokens_seen": 17729766832,
      "step": 22535
    },
    {
      "epoch": 2.3908338637810314,
      "grad_norm": 0.42558714762160704,
      "learning_rate": 4.529358725218363e-05,
      "loss": 1.5617,
      "num_input_tokens_seen": 17730553584,
      "step": 22536
    },
    {
      "epoch": 2.3909399533206024,
      "grad_norm": 0.4496943371406867,
      "learning_rate": 4.529318137273012e-05,
      "loss": 1.5341,
      "num_input_tokens_seen": 17731340336,
      "step": 22537
    },
    {
      "epoch": 2.391046042860174,
      "grad_norm": 0.3528892669370863,
      "learning_rate": 4.529277547759464e-05,
      "loss": 1.4775,
      "num_input_tokens_seen": 17732127216,
      "step": 22538
    },
    {
      "epoch": 2.3911521323997453,
      "grad_norm": 0.412844777756659,
      "learning_rate": 4.52923695667775e-05,
      "loss": 1.6367,
      "num_input_tokens_seen": 17732914032,
      "step": 22539
    },
    {
      "epoch": 2.391258221939317,
      "grad_norm": 0.3935515929777941,
      "learning_rate": 4.529196364027901e-05,
      "loss": 1.5807,
      "num_input_tokens_seen": 17733700752,
      "step": 22540
    },
    {
      "epoch": 2.3913643114788883,
      "grad_norm": 0.40495320913710486,
      "learning_rate": 4.5291557698099484e-05,
      "loss": 1.5305,
      "num_input_tokens_seen": 17734487520,
      "step": 22541
    },
    {
      "epoch": 2.3914704010184598,
      "grad_norm": 0.3971201360320915,
      "learning_rate": 4.529115174023924e-05,
      "loss": 1.5334,
      "num_input_tokens_seen": 17735274288,
      "step": 22542
    },
    {
      "epoch": 2.391576490558031,
      "grad_norm": 0.38783949501016324,
      "learning_rate": 4.529074576669859e-05,
      "loss": 1.6128,
      "num_input_tokens_seen": 17736061024,
      "step": 22543
    },
    {
      "epoch": 2.3916825800976023,
      "grad_norm": 0.3830022261295977,
      "learning_rate": 4.529033977747784e-05,
      "loss": 1.6857,
      "num_input_tokens_seen": 17736847824,
      "step": 22544
    },
    {
      "epoch": 2.3917886696371737,
      "grad_norm": 0.3623849560831496,
      "learning_rate": 4.528993377257732e-05,
      "loss": 1.7361,
      "num_input_tokens_seen": 17737634560,
      "step": 22545
    },
    {
      "epoch": 2.391894759176745,
      "grad_norm": 0.4262302394951226,
      "learning_rate": 4.5289527751997336e-05,
      "loss": 1.6839,
      "num_input_tokens_seen": 17738421312,
      "step": 22546
    },
    {
      "epoch": 2.3920008487163167,
      "grad_norm": 0.3632738047026578,
      "learning_rate": 4.528912171573819e-05,
      "loss": 1.6127,
      "num_input_tokens_seen": 17739208096,
      "step": 22547
    },
    {
      "epoch": 2.392106938255888,
      "grad_norm": 0.3705368059133403,
      "learning_rate": 4.528871566380022e-05,
      "loss": 1.6467,
      "num_input_tokens_seen": 17739994848,
      "step": 22548
    },
    {
      "epoch": 2.392213027795459,
      "grad_norm": 0.4101376365749959,
      "learning_rate": 4.528830959618371e-05,
      "loss": 1.5468,
      "num_input_tokens_seen": 17740781632,
      "step": 22549
    },
    {
      "epoch": 2.3923191173350307,
      "grad_norm": 0.4209727667697874,
      "learning_rate": 4.5287903512889e-05,
      "loss": 1.6126,
      "num_input_tokens_seen": 17741568336,
      "step": 22550
    },
    {
      "epoch": 2.392425206874602,
      "grad_norm": 0.34658709024868006,
      "learning_rate": 4.5287497413916393e-05,
      "loss": 1.563,
      "num_input_tokens_seen": 17742355152,
      "step": 22551
    },
    {
      "epoch": 2.3925312964141736,
      "grad_norm": 0.43983033162107427,
      "learning_rate": 4.52870912992662e-05,
      "loss": 1.721,
      "num_input_tokens_seen": 17743141984,
      "step": 22552
    },
    {
      "epoch": 2.392637385953745,
      "grad_norm": 0.3535882510220305,
      "learning_rate": 4.5286685168938736e-05,
      "loss": 1.5502,
      "num_input_tokens_seen": 17743928720,
      "step": 22553
    },
    {
      "epoch": 2.392743475493316,
      "grad_norm": 0.37919152500787073,
      "learning_rate": 4.528627902293432e-05,
      "loss": 1.6007,
      "num_input_tokens_seen": 17744715504,
      "step": 22554
    },
    {
      "epoch": 2.3928495650328876,
      "grad_norm": 0.414691981868269,
      "learning_rate": 4.5285872861253265e-05,
      "loss": 1.6788,
      "num_input_tokens_seen": 17745502288,
      "step": 22555
    },
    {
      "epoch": 2.392955654572459,
      "grad_norm": 0.4362779106346436,
      "learning_rate": 4.5285466683895885e-05,
      "loss": 1.6024,
      "num_input_tokens_seen": 17746289040,
      "step": 22556
    },
    {
      "epoch": 2.3930617441120305,
      "grad_norm": 0.3267163338584327,
      "learning_rate": 4.528506049086248e-05,
      "loss": 1.5308,
      "num_input_tokens_seen": 17747075856,
      "step": 22557
    },
    {
      "epoch": 2.393167833651602,
      "grad_norm": 0.42576733760487256,
      "learning_rate": 4.528465428215338e-05,
      "loss": 1.6551,
      "num_input_tokens_seen": 17747862640,
      "step": 22558
    },
    {
      "epoch": 2.3932739231911735,
      "grad_norm": 0.45304978236273324,
      "learning_rate": 4.52842480577689e-05,
      "loss": 1.5513,
      "num_input_tokens_seen": 17748649360,
      "step": 22559
    },
    {
      "epoch": 2.393380012730745,
      "grad_norm": 0.3915232140770093,
      "learning_rate": 4.528384181770935e-05,
      "loss": 1.4925,
      "num_input_tokens_seen": 17749436192,
      "step": 22560
    },
    {
      "epoch": 2.393486102270316,
      "grad_norm": 0.5033076849812331,
      "learning_rate": 4.528343556197503e-05,
      "loss": 1.61,
      "num_input_tokens_seen": 17750223024,
      "step": 22561
    },
    {
      "epoch": 2.3935921918098875,
      "grad_norm": 0.46373450748824735,
      "learning_rate": 4.5283029290566276e-05,
      "loss": 1.5466,
      "num_input_tokens_seen": 17751009824,
      "step": 22562
    },
    {
      "epoch": 2.393698281349459,
      "grad_norm": 0.47616469712044446,
      "learning_rate": 4.5282623003483395e-05,
      "loss": 1.7703,
      "num_input_tokens_seen": 17751796672,
      "step": 22563
    },
    {
      "epoch": 2.3938043708890304,
      "grad_norm": 0.38374653937306413,
      "learning_rate": 4.528221670072669e-05,
      "loss": 1.5587,
      "num_input_tokens_seen": 17752583504,
      "step": 22564
    },
    {
      "epoch": 2.393910460428602,
      "grad_norm": 0.3616691569805307,
      "learning_rate": 4.528181038229649e-05,
      "loss": 1.6218,
      "num_input_tokens_seen": 17753370272,
      "step": 22565
    },
    {
      "epoch": 2.394016549968173,
      "grad_norm": 0.3789766926985414,
      "learning_rate": 4.5281404048193086e-05,
      "loss": 1.5065,
      "num_input_tokens_seen": 17754157120,
      "step": 22566
    },
    {
      "epoch": 2.3941226395077444,
      "grad_norm": 0.40201601584855146,
      "learning_rate": 4.528099769841682e-05,
      "loss": 1.5045,
      "num_input_tokens_seen": 17754943904,
      "step": 22567
    },
    {
      "epoch": 2.394228729047316,
      "grad_norm": 0.3595444520847516,
      "learning_rate": 4.5280591332968e-05,
      "loss": 1.7025,
      "num_input_tokens_seen": 17755730720,
      "step": 22568
    },
    {
      "epoch": 2.3943348185868873,
      "grad_norm": 0.4208310780061057,
      "learning_rate": 4.528018495184693e-05,
      "loss": 1.7397,
      "num_input_tokens_seen": 17756517488,
      "step": 22569
    },
    {
      "epoch": 2.394440908126459,
      "grad_norm": 0.381192127833973,
      "learning_rate": 4.527977855505392e-05,
      "loss": 1.5739,
      "num_input_tokens_seen": 17757304256,
      "step": 22570
    },
    {
      "epoch": 2.3945469976660303,
      "grad_norm": 0.3707308325847023,
      "learning_rate": 4.52793721425893e-05,
      "loss": 1.5916,
      "num_input_tokens_seen": 17758091008,
      "step": 22571
    },
    {
      "epoch": 2.3946530872056018,
      "grad_norm": 0.36465739639757155,
      "learning_rate": 4.527896571445337e-05,
      "loss": 1.5921,
      "num_input_tokens_seen": 17758877792,
      "step": 22572
    },
    {
      "epoch": 2.394759176745173,
      "grad_norm": 0.41978366167689835,
      "learning_rate": 4.527855927064646e-05,
      "loss": 1.5813,
      "num_input_tokens_seen": 17759664592,
      "step": 22573
    },
    {
      "epoch": 2.3948652662847443,
      "grad_norm": 0.36150929557668626,
      "learning_rate": 4.5278152811168866e-05,
      "loss": 1.6267,
      "num_input_tokens_seen": 17760451360,
      "step": 22574
    },
    {
      "epoch": 2.3949713558243158,
      "grad_norm": 0.3384586736693588,
      "learning_rate": 4.527774633602091e-05,
      "loss": 1.6614,
      "num_input_tokens_seen": 17761238128,
      "step": 22575
    },
    {
      "epoch": 2.3950774453638872,
      "grad_norm": 0.3387613191859136,
      "learning_rate": 4.527733984520292e-05,
      "loss": 1.59,
      "num_input_tokens_seen": 17762024880,
      "step": 22576
    },
    {
      "epoch": 2.3951835349034587,
      "grad_norm": 0.3915782436782634,
      "learning_rate": 4.5276933338715184e-05,
      "loss": 1.58,
      "num_input_tokens_seen": 17762811648,
      "step": 22577
    },
    {
      "epoch": 2.3952896244430297,
      "grad_norm": 0.34524225770549016,
      "learning_rate": 4.527652681655803e-05,
      "loss": 1.5608,
      "num_input_tokens_seen": 17763598448,
      "step": 22578
    },
    {
      "epoch": 2.395395713982601,
      "grad_norm": 0.3697231958932859,
      "learning_rate": 4.527612027873177e-05,
      "loss": 1.6868,
      "num_input_tokens_seen": 17764385136,
      "step": 22579
    },
    {
      "epoch": 2.3955018035221727,
      "grad_norm": 0.48055096610479187,
      "learning_rate": 4.5275713725236724e-05,
      "loss": 1.8178,
      "num_input_tokens_seen": 17765171824,
      "step": 22580
    },
    {
      "epoch": 2.395607893061744,
      "grad_norm": 0.3823211206672709,
      "learning_rate": 4.5275307156073196e-05,
      "loss": 1.5713,
      "num_input_tokens_seen": 17765958640,
      "step": 22581
    },
    {
      "epoch": 2.3957139826013156,
      "grad_norm": 0.44813729612525804,
      "learning_rate": 4.5274900571241516e-05,
      "loss": 1.7382,
      "num_input_tokens_seen": 17766745376,
      "step": 22582
    },
    {
      "epoch": 2.395820072140887,
      "grad_norm": 0.4107714374519538,
      "learning_rate": 4.5274493970741976e-05,
      "loss": 1.534,
      "num_input_tokens_seen": 17767532096,
      "step": 22583
    },
    {
      "epoch": 2.395926161680458,
      "grad_norm": 0.3465533133813956,
      "learning_rate": 4.5274087354574916e-05,
      "loss": 1.6351,
      "num_input_tokens_seen": 17768318896,
      "step": 22584
    },
    {
      "epoch": 2.3960322512200296,
      "grad_norm": 0.35615785895179497,
      "learning_rate": 4.527368072274062e-05,
      "loss": 1.5148,
      "num_input_tokens_seen": 17769105632,
      "step": 22585
    },
    {
      "epoch": 2.396138340759601,
      "grad_norm": 0.3453783105900452,
      "learning_rate": 4.5273274075239424e-05,
      "loss": 1.5574,
      "num_input_tokens_seen": 17769892448,
      "step": 22586
    },
    {
      "epoch": 2.3962444302991726,
      "grad_norm": 0.462350065263813,
      "learning_rate": 4.527286741207164e-05,
      "loss": 1.6081,
      "num_input_tokens_seen": 17770679152,
      "step": 22587
    },
    {
      "epoch": 2.396350519838744,
      "grad_norm": 0.39367753462251875,
      "learning_rate": 4.5272460733237575e-05,
      "loss": 1.5129,
      "num_input_tokens_seen": 17771465808,
      "step": 22588
    },
    {
      "epoch": 2.3964566093783155,
      "grad_norm": 0.4205865549330378,
      "learning_rate": 4.527205403873755e-05,
      "loss": 1.5642,
      "num_input_tokens_seen": 17772252624,
      "step": 22589
    },
    {
      "epoch": 2.3965626989178865,
      "grad_norm": 0.3882713606900465,
      "learning_rate": 4.527164732857188e-05,
      "loss": 1.7348,
      "num_input_tokens_seen": 17773039440,
      "step": 22590
    },
    {
      "epoch": 2.396668788457458,
      "grad_norm": 0.44564609144643397,
      "learning_rate": 4.527124060274086e-05,
      "loss": 1.5331,
      "num_input_tokens_seen": 17773826240,
      "step": 22591
    },
    {
      "epoch": 2.3967748779970295,
      "grad_norm": 0.39348368486025115,
      "learning_rate": 4.527083386124483e-05,
      "loss": 1.6926,
      "num_input_tokens_seen": 17774613008,
      "step": 22592
    },
    {
      "epoch": 2.396880967536601,
      "grad_norm": 0.3894819909884718,
      "learning_rate": 4.52704271040841e-05,
      "loss": 1.6432,
      "num_input_tokens_seen": 17775399760,
      "step": 22593
    },
    {
      "epoch": 2.3969870570761724,
      "grad_norm": 0.36918321916239233,
      "learning_rate": 4.527002033125898e-05,
      "loss": 1.634,
      "num_input_tokens_seen": 17776186512,
      "step": 22594
    },
    {
      "epoch": 2.3970931466157435,
      "grad_norm": 0.4047455968595708,
      "learning_rate": 4.5269613542769775e-05,
      "loss": 1.6538,
      "num_input_tokens_seen": 17776973232,
      "step": 22595
    },
    {
      "epoch": 2.397199236155315,
      "grad_norm": 0.3839231008638711,
      "learning_rate": 4.526920673861681e-05,
      "loss": 1.5962,
      "num_input_tokens_seen": 17777760048,
      "step": 22596
    },
    {
      "epoch": 2.3973053256948864,
      "grad_norm": 0.40657035114203555,
      "learning_rate": 4.5268799918800395e-05,
      "loss": 1.6748,
      "num_input_tokens_seen": 17778546752,
      "step": 22597
    },
    {
      "epoch": 2.397411415234458,
      "grad_norm": 0.38555496501155495,
      "learning_rate": 4.5268393083320845e-05,
      "loss": 1.6386,
      "num_input_tokens_seen": 17779333520,
      "step": 22598
    },
    {
      "epoch": 2.3975175047740294,
      "grad_norm": 0.5119329241902721,
      "learning_rate": 4.526798623217848e-05,
      "loss": 1.7129,
      "num_input_tokens_seen": 17780120320,
      "step": 22599
    },
    {
      "epoch": 2.397623594313601,
      "grad_norm": 0.43203223271920754,
      "learning_rate": 4.526757936537361e-05,
      "loss": 1.5679,
      "num_input_tokens_seen": 17780907104,
      "step": 22600
    },
    {
      "epoch": 2.3977296838531723,
      "grad_norm": 0.3423374697833939,
      "learning_rate": 4.5267172482906544e-05,
      "loss": 1.5454,
      "num_input_tokens_seen": 17781693888,
      "step": 22601
    },
    {
      "epoch": 2.3978357733927433,
      "grad_norm": 0.41182617906731483,
      "learning_rate": 4.5266765584777604e-05,
      "loss": 1.4808,
      "num_input_tokens_seen": 17782480752,
      "step": 22602
    },
    {
      "epoch": 2.397941862932315,
      "grad_norm": 0.42116087810757463,
      "learning_rate": 4.5266358670987106e-05,
      "loss": 1.7233,
      "num_input_tokens_seen": 17783267520,
      "step": 22603
    },
    {
      "epoch": 2.3980479524718863,
      "grad_norm": 0.34160834140090207,
      "learning_rate": 4.526595174153536e-05,
      "loss": 1.6116,
      "num_input_tokens_seen": 17784054256,
      "step": 22604
    },
    {
      "epoch": 2.3981540420114578,
      "grad_norm": 0.3852678402349686,
      "learning_rate": 4.526554479642268e-05,
      "loss": 1.4191,
      "num_input_tokens_seen": 17784841024,
      "step": 22605
    },
    {
      "epoch": 2.3982601315510292,
      "grad_norm": 0.42049142277334917,
      "learning_rate": 4.526513783564938e-05,
      "loss": 1.5586,
      "num_input_tokens_seen": 17785627856,
      "step": 22606
    },
    {
      "epoch": 2.3983662210906003,
      "grad_norm": 0.48279862927735073,
      "learning_rate": 4.526473085921578e-05,
      "loss": 1.7703,
      "num_input_tokens_seen": 17786414576,
      "step": 22607
    },
    {
      "epoch": 2.3984723106301717,
      "grad_norm": 0.41633800810734856,
      "learning_rate": 4.526432386712218e-05,
      "loss": 1.6546,
      "num_input_tokens_seen": 17787201392,
      "step": 22608
    },
    {
      "epoch": 2.398578400169743,
      "grad_norm": 0.3728303056899269,
      "learning_rate": 4.5263916859368914e-05,
      "loss": 1.5346,
      "num_input_tokens_seen": 17787988208,
      "step": 22609
    },
    {
      "epoch": 2.3986844897093147,
      "grad_norm": 0.5372455733548311,
      "learning_rate": 4.5263509835956286e-05,
      "loss": 1.6807,
      "num_input_tokens_seen": 17788774928,
      "step": 22610
    },
    {
      "epoch": 2.398790579248886,
      "grad_norm": 0.4116719705009411,
      "learning_rate": 4.5263102796884615e-05,
      "loss": 1.5888,
      "num_input_tokens_seen": 17789561744,
      "step": 22611
    },
    {
      "epoch": 2.3988966687884576,
      "grad_norm": 0.4301271206356768,
      "learning_rate": 4.526269574215421e-05,
      "loss": 1.5233,
      "num_input_tokens_seen": 17790348512,
      "step": 22612
    },
    {
      "epoch": 2.3990027583280287,
      "grad_norm": 0.4293059565799113,
      "learning_rate": 4.526228867176539e-05,
      "loss": 1.5455,
      "num_input_tokens_seen": 17791135312,
      "step": 22613
    },
    {
      "epoch": 2.3991088478676,
      "grad_norm": 0.4509774547532964,
      "learning_rate": 4.526188158571847e-05,
      "loss": 1.6524,
      "num_input_tokens_seen": 17791922048,
      "step": 22614
    },
    {
      "epoch": 2.3992149374071716,
      "grad_norm": 0.4427684950452807,
      "learning_rate": 4.526147448401376e-05,
      "loss": 1.5642,
      "num_input_tokens_seen": 17792708912,
      "step": 22615
    },
    {
      "epoch": 2.399321026946743,
      "grad_norm": 0.40606341167841375,
      "learning_rate": 4.526106736665156e-05,
      "loss": 1.662,
      "num_input_tokens_seen": 17793495760,
      "step": 22616
    },
    {
      "epoch": 2.3994271164863146,
      "grad_norm": 0.5849720129191862,
      "learning_rate": 4.526066023363222e-05,
      "loss": 1.5572,
      "num_input_tokens_seen": 17794282544,
      "step": 22617
    },
    {
      "epoch": 2.399533206025886,
      "grad_norm": 0.4410115176075066,
      "learning_rate": 4.526025308495604e-05,
      "loss": 1.5854,
      "num_input_tokens_seen": 17795069296,
      "step": 22618
    },
    {
      "epoch": 2.399639295565457,
      "grad_norm": 0.47782358052985774,
      "learning_rate": 4.5259845920623325e-05,
      "loss": 1.5387,
      "num_input_tokens_seen": 17795856000,
      "step": 22619
    },
    {
      "epoch": 2.3997453851050286,
      "grad_norm": 0.3869433345044336,
      "learning_rate": 4.5259438740634394e-05,
      "loss": 1.5417,
      "num_input_tokens_seen": 17796642816,
      "step": 22620
    },
    {
      "epoch": 2.3998514746446,
      "grad_norm": 0.4299898876228174,
      "learning_rate": 4.525903154498956e-05,
      "loss": 1.5954,
      "num_input_tokens_seen": 17797429696,
      "step": 22621
    },
    {
      "epoch": 2.3999575641841715,
      "grad_norm": 0.36389700025197874,
      "learning_rate": 4.525862433368915e-05,
      "loss": 1.4393,
      "num_input_tokens_seen": 17798216480,
      "step": 22622
    },
    {
      "epoch": 2.400063653723743,
      "grad_norm": 0.36058629511773205,
      "learning_rate": 4.525821710673346e-05,
      "loss": 1.5583,
      "num_input_tokens_seen": 17799003280,
      "step": 22623
    },
    {
      "epoch": 2.400169743263314,
      "grad_norm": 0.3568003659530527,
      "learning_rate": 4.525780986412282e-05,
      "loss": 1.5491,
      "num_input_tokens_seen": 17799790112,
      "step": 22624
    },
    {
      "epoch": 2.4002758328028855,
      "grad_norm": 0.41597285440214515,
      "learning_rate": 4.525740260585754e-05,
      "loss": 1.6034,
      "num_input_tokens_seen": 17800576912,
      "step": 22625
    },
    {
      "epoch": 2.400381922342457,
      "grad_norm": 0.35195841837173897,
      "learning_rate": 4.525699533193794e-05,
      "loss": 1.5865,
      "num_input_tokens_seen": 17801363776,
      "step": 22626
    },
    {
      "epoch": 2.4004880118820284,
      "grad_norm": 0.39386543663272927,
      "learning_rate": 4.525658804236431e-05,
      "loss": 1.6525,
      "num_input_tokens_seen": 17802150592,
      "step": 22627
    },
    {
      "epoch": 2.4005941014216,
      "grad_norm": 0.3514855200955825,
      "learning_rate": 4.5256180737136996e-05,
      "loss": 1.4525,
      "num_input_tokens_seen": 17802937504,
      "step": 22628
    },
    {
      "epoch": 2.4007001909611714,
      "grad_norm": 0.39253462976379455,
      "learning_rate": 4.52557734162563e-05,
      "loss": 1.6408,
      "num_input_tokens_seen": 17803724288,
      "step": 22629
    },
    {
      "epoch": 2.400806280500743,
      "grad_norm": 0.3308005197127666,
      "learning_rate": 4.5255366079722525e-05,
      "loss": 1.6357,
      "num_input_tokens_seen": 17804511088,
      "step": 22630
    },
    {
      "epoch": 2.400912370040314,
      "grad_norm": 0.42234420033094333,
      "learning_rate": 4.525495872753601e-05,
      "loss": 1.5845,
      "num_input_tokens_seen": 17805297920,
      "step": 22631
    },
    {
      "epoch": 2.4010184595798854,
      "grad_norm": 0.46686517418897144,
      "learning_rate": 4.525455135969705e-05,
      "loss": 1.7835,
      "num_input_tokens_seen": 17806084624,
      "step": 22632
    },
    {
      "epoch": 2.401124549119457,
      "grad_norm": 0.3293421724683584,
      "learning_rate": 4.5254143976205975e-05,
      "loss": 1.5352,
      "num_input_tokens_seen": 17806871472,
      "step": 22633
    },
    {
      "epoch": 2.4012306386590283,
      "grad_norm": 0.42082765264213373,
      "learning_rate": 4.525373657706309e-05,
      "loss": 1.5816,
      "num_input_tokens_seen": 17807658224,
      "step": 22634
    },
    {
      "epoch": 2.4013367281986,
      "grad_norm": 0.3860168374278606,
      "learning_rate": 4.5253329162268706e-05,
      "loss": 1.6223,
      "num_input_tokens_seen": 17808445056,
      "step": 22635
    },
    {
      "epoch": 2.401442817738171,
      "grad_norm": 0.36229254894043106,
      "learning_rate": 4.5252921731823143e-05,
      "loss": 1.5238,
      "num_input_tokens_seen": 17809231856,
      "step": 22636
    },
    {
      "epoch": 2.4015489072777423,
      "grad_norm": 0.393850535931925,
      "learning_rate": 4.525251428572672e-05,
      "loss": 1.5267,
      "num_input_tokens_seen": 17810018608,
      "step": 22637
    },
    {
      "epoch": 2.4016549968173138,
      "grad_norm": 0.3660130288701701,
      "learning_rate": 4.525210682397974e-05,
      "loss": 1.6004,
      "num_input_tokens_seen": 17810805360,
      "step": 22638
    },
    {
      "epoch": 2.4017610863568852,
      "grad_norm": 0.3862605558808887,
      "learning_rate": 4.525169934658254e-05,
      "loss": 1.5931,
      "num_input_tokens_seen": 17811592144,
      "step": 22639
    },
    {
      "epoch": 2.4018671758964567,
      "grad_norm": 0.4379028303623331,
      "learning_rate": 4.5251291853535416e-05,
      "loss": 1.7183,
      "num_input_tokens_seen": 17812378928,
      "step": 22640
    },
    {
      "epoch": 2.401973265436028,
      "grad_norm": 0.3493225157360562,
      "learning_rate": 4.525088434483869e-05,
      "loss": 1.5878,
      "num_input_tokens_seen": 17813165632,
      "step": 22641
    },
    {
      "epoch": 2.402079354975599,
      "grad_norm": 0.38206014898947915,
      "learning_rate": 4.525047682049267e-05,
      "loss": 1.5574,
      "num_input_tokens_seen": 17813952448,
      "step": 22642
    },
    {
      "epoch": 2.4021854445151707,
      "grad_norm": 0.41536093889161363,
      "learning_rate": 4.5250069280497675e-05,
      "loss": 1.6447,
      "num_input_tokens_seen": 17814739328,
      "step": 22643
    },
    {
      "epoch": 2.402291534054742,
      "grad_norm": 0.35354326677542325,
      "learning_rate": 4.524966172485402e-05,
      "loss": 1.4454,
      "num_input_tokens_seen": 17815526144,
      "step": 22644
    },
    {
      "epoch": 2.4023976235943136,
      "grad_norm": 0.4259565245929924,
      "learning_rate": 4.5249254153562026e-05,
      "loss": 1.5612,
      "num_input_tokens_seen": 17816312864,
      "step": 22645
    },
    {
      "epoch": 2.402503713133885,
      "grad_norm": 0.4444442958296511,
      "learning_rate": 4.5248846566622e-05,
      "loss": 1.663,
      "num_input_tokens_seen": 17817099600,
      "step": 22646
    },
    {
      "epoch": 2.4026098026734566,
      "grad_norm": 0.3455316786009953,
      "learning_rate": 4.5248438964034255e-05,
      "loss": 1.6598,
      "num_input_tokens_seen": 17817886432,
      "step": 22647
    },
    {
      "epoch": 2.4027158922130276,
      "grad_norm": 0.3846082903030398,
      "learning_rate": 4.5248031345799116e-05,
      "loss": 1.6405,
      "num_input_tokens_seen": 17818673280,
      "step": 22648
    },
    {
      "epoch": 2.402821981752599,
      "grad_norm": 0.41562136262917887,
      "learning_rate": 4.52476237119169e-05,
      "loss": 1.7027,
      "num_input_tokens_seen": 17819459952,
      "step": 22649
    },
    {
      "epoch": 2.4029280712921706,
      "grad_norm": 0.3624132235078976,
      "learning_rate": 4.52472160623879e-05,
      "loss": 1.5915,
      "num_input_tokens_seen": 17820246688,
      "step": 22650
    },
    {
      "epoch": 2.403034160831742,
      "grad_norm": 0.39783024260358446,
      "learning_rate": 4.524680839721245e-05,
      "loss": 1.5601,
      "num_input_tokens_seen": 17821033392,
      "step": 22651
    },
    {
      "epoch": 2.4031402503713135,
      "grad_norm": 0.36250546685825275,
      "learning_rate": 4.524640071639086e-05,
      "loss": 1.5721,
      "num_input_tokens_seen": 17821820160,
      "step": 22652
    },
    {
      "epoch": 2.4032463399108845,
      "grad_norm": 0.5275023224849225,
      "learning_rate": 4.524599301992345e-05,
      "loss": 1.6688,
      "num_input_tokens_seen": 17822606864,
      "step": 22653
    },
    {
      "epoch": 2.403352429450456,
      "grad_norm": 0.4084519190409631,
      "learning_rate": 4.524558530781053e-05,
      "loss": 1.5469,
      "num_input_tokens_seen": 17823393600,
      "step": 22654
    },
    {
      "epoch": 2.4034585189900275,
      "grad_norm": 0.45180523739826134,
      "learning_rate": 4.524517758005241e-05,
      "loss": 1.5777,
      "num_input_tokens_seen": 17824180352,
      "step": 22655
    },
    {
      "epoch": 2.403564608529599,
      "grad_norm": 0.409113951389903,
      "learning_rate": 4.5244769836649414e-05,
      "loss": 1.6655,
      "num_input_tokens_seen": 17824967056,
      "step": 22656
    },
    {
      "epoch": 2.4036706980691704,
      "grad_norm": 0.3874189787575785,
      "learning_rate": 4.524436207760185e-05,
      "loss": 1.6037,
      "num_input_tokens_seen": 17825753776,
      "step": 22657
    },
    {
      "epoch": 2.403776787608742,
      "grad_norm": 0.47169991095495545,
      "learning_rate": 4.524395430291005e-05,
      "loss": 1.5236,
      "num_input_tokens_seen": 17826540528,
      "step": 22658
    },
    {
      "epoch": 2.4038828771483134,
      "grad_norm": 0.41198667498919733,
      "learning_rate": 4.524354651257431e-05,
      "loss": 1.5446,
      "num_input_tokens_seen": 17827327280,
      "step": 22659
    },
    {
      "epoch": 2.4039889666878844,
      "grad_norm": 0.39256280411896877,
      "learning_rate": 4.524313870659494e-05,
      "loss": 1.6898,
      "num_input_tokens_seen": 17828114064,
      "step": 22660
    },
    {
      "epoch": 2.404095056227456,
      "grad_norm": 0.38952886696497074,
      "learning_rate": 4.5242730884972287e-05,
      "loss": 1.4956,
      "num_input_tokens_seen": 17828900880,
      "step": 22661
    },
    {
      "epoch": 2.4042011457670274,
      "grad_norm": 0.3760805789808806,
      "learning_rate": 4.5242323047706625e-05,
      "loss": 1.5149,
      "num_input_tokens_seen": 17829687616,
      "step": 22662
    },
    {
      "epoch": 2.404307235306599,
      "grad_norm": 0.40972696597581537,
      "learning_rate": 4.52419151947983e-05,
      "loss": 1.7373,
      "num_input_tokens_seen": 17830474336,
      "step": 22663
    },
    {
      "epoch": 2.4044133248461703,
      "grad_norm": 0.4109488819236969,
      "learning_rate": 4.524150732624762e-05,
      "loss": 1.6064,
      "num_input_tokens_seen": 17831261184,
      "step": 22664
    },
    {
      "epoch": 2.4045194143857413,
      "grad_norm": 0.3555742129582936,
      "learning_rate": 4.524109944205489e-05,
      "loss": 1.5644,
      "num_input_tokens_seen": 17832048016,
      "step": 22665
    },
    {
      "epoch": 2.404625503925313,
      "grad_norm": 0.3718051738485768,
      "learning_rate": 4.5240691542220434e-05,
      "loss": 1.7118,
      "num_input_tokens_seen": 17832834768,
      "step": 22666
    },
    {
      "epoch": 2.4047315934648843,
      "grad_norm": 0.4080144819804268,
      "learning_rate": 4.524028362674456e-05,
      "loss": 1.5159,
      "num_input_tokens_seen": 17833621664,
      "step": 22667
    },
    {
      "epoch": 2.4048376830044558,
      "grad_norm": 0.3761361138366609,
      "learning_rate": 4.5239875695627595e-05,
      "loss": 1.6485,
      "num_input_tokens_seen": 17834408400,
      "step": 22668
    },
    {
      "epoch": 2.4049437725440272,
      "grad_norm": 0.3622897713158057,
      "learning_rate": 4.5239467748869854e-05,
      "loss": 1.6467,
      "num_input_tokens_seen": 17835195184,
      "step": 22669
    },
    {
      "epoch": 2.4050498620835987,
      "grad_norm": 0.4379369184910982,
      "learning_rate": 4.5239059786471636e-05,
      "loss": 1.4998,
      "num_input_tokens_seen": 17835981984,
      "step": 22670
    },
    {
      "epoch": 2.40515595162317,
      "grad_norm": 0.39258292464458594,
      "learning_rate": 4.523865180843327e-05,
      "loss": 1.6405,
      "num_input_tokens_seen": 17836768704,
      "step": 22671
    },
    {
      "epoch": 2.4052620411627412,
      "grad_norm": 0.4120029752398121,
      "learning_rate": 4.523824381475507e-05,
      "loss": 1.6114,
      "num_input_tokens_seen": 17837555424,
      "step": 22672
    },
    {
      "epoch": 2.4053681307023127,
      "grad_norm": 0.41851404883053156,
      "learning_rate": 4.5237835805437346e-05,
      "loss": 1.5923,
      "num_input_tokens_seen": 17838342192,
      "step": 22673
    },
    {
      "epoch": 2.405474220241884,
      "grad_norm": 0.4001151177503026,
      "learning_rate": 4.523742778048042e-05,
      "loss": 1.6807,
      "num_input_tokens_seen": 17839128832,
      "step": 22674
    },
    {
      "epoch": 2.4055803097814557,
      "grad_norm": 0.40166843797608726,
      "learning_rate": 4.52370197398846e-05,
      "loss": 1.6767,
      "num_input_tokens_seen": 17839915504,
      "step": 22675
    },
    {
      "epoch": 2.405686399321027,
      "grad_norm": 0.3598477688112339,
      "learning_rate": 4.523661168365021e-05,
      "loss": 1.6738,
      "num_input_tokens_seen": 17840702240,
      "step": 22676
    },
    {
      "epoch": 2.405792488860598,
      "grad_norm": 0.35862977496286974,
      "learning_rate": 4.523620361177755e-05,
      "loss": 1.4955,
      "num_input_tokens_seen": 17841488992,
      "step": 22677
    },
    {
      "epoch": 2.4058985784001696,
      "grad_norm": 0.33753297891708606,
      "learning_rate": 4.5235795524266954e-05,
      "loss": 1.4992,
      "num_input_tokens_seen": 17842275744,
      "step": 22678
    },
    {
      "epoch": 2.406004667939741,
      "grad_norm": 0.39061214399178695,
      "learning_rate": 4.523538742111872e-05,
      "loss": 1.5577,
      "num_input_tokens_seen": 17843062480,
      "step": 22679
    },
    {
      "epoch": 2.4061107574793126,
      "grad_norm": 0.3932715416836151,
      "learning_rate": 4.523497930233318e-05,
      "loss": 1.6147,
      "num_input_tokens_seen": 17843849264,
      "step": 22680
    },
    {
      "epoch": 2.406216847018884,
      "grad_norm": 0.3726111461629055,
      "learning_rate": 4.5234571167910644e-05,
      "loss": 1.4513,
      "num_input_tokens_seen": 17844636000,
      "step": 22681
    },
    {
      "epoch": 2.4063229365584555,
      "grad_norm": 0.4462912756042833,
      "learning_rate": 4.523416301785143e-05,
      "loss": 1.5207,
      "num_input_tokens_seen": 17845422912,
      "step": 22682
    },
    {
      "epoch": 2.4064290260980266,
      "grad_norm": 0.3956872698145237,
      "learning_rate": 4.523375485215583e-05,
      "loss": 1.5291,
      "num_input_tokens_seen": 17846209680,
      "step": 22683
    },
    {
      "epoch": 2.406535115637598,
      "grad_norm": 0.43357381848269877,
      "learning_rate": 4.5233346670824194e-05,
      "loss": 1.6313,
      "num_input_tokens_seen": 17846996448,
      "step": 22684
    },
    {
      "epoch": 2.4066412051771695,
      "grad_norm": 0.4261256096229492,
      "learning_rate": 4.523293847385681e-05,
      "loss": 1.5814,
      "num_input_tokens_seen": 17847783216,
      "step": 22685
    },
    {
      "epoch": 2.406747294716741,
      "grad_norm": 0.38322791433168735,
      "learning_rate": 4.523253026125401e-05,
      "loss": 1.5572,
      "num_input_tokens_seen": 17848570064,
      "step": 22686
    },
    {
      "epoch": 2.4068533842563125,
      "grad_norm": 0.44903325813386785,
      "learning_rate": 4.523212203301611e-05,
      "loss": 1.6795,
      "num_input_tokens_seen": 17849356864,
      "step": 22687
    },
    {
      "epoch": 2.406959473795884,
      "grad_norm": 0.39821802669590567,
      "learning_rate": 4.5231713789143414e-05,
      "loss": 1.6392,
      "num_input_tokens_seen": 17850143600,
      "step": 22688
    },
    {
      "epoch": 2.407065563335455,
      "grad_norm": 0.5516327889208603,
      "learning_rate": 4.5231305529636246e-05,
      "loss": 1.8268,
      "num_input_tokens_seen": 17850930304,
      "step": 22689
    },
    {
      "epoch": 2.4071716528750264,
      "grad_norm": 0.443013870493918,
      "learning_rate": 4.523089725449491e-05,
      "loss": 1.6329,
      "num_input_tokens_seen": 17851717120,
      "step": 22690
    },
    {
      "epoch": 2.407277742414598,
      "grad_norm": 0.5925772480324114,
      "learning_rate": 4.523048896371974e-05,
      "loss": 1.6216,
      "num_input_tokens_seen": 17852503840,
      "step": 22691
    },
    {
      "epoch": 2.4073838319541694,
      "grad_norm": 0.5619554322795767,
      "learning_rate": 4.523008065731104e-05,
      "loss": 1.6265,
      "num_input_tokens_seen": 17853290656,
      "step": 22692
    },
    {
      "epoch": 2.407489921493741,
      "grad_norm": 0.4721805229418954,
      "learning_rate": 4.522967233526913e-05,
      "loss": 1.5396,
      "num_input_tokens_seen": 17854077552,
      "step": 22693
    },
    {
      "epoch": 2.407596011033312,
      "grad_norm": 0.6075196142910493,
      "learning_rate": 4.522926399759432e-05,
      "loss": 1.6633,
      "num_input_tokens_seen": 17854864240,
      "step": 22694
    },
    {
      "epoch": 2.4077021005728834,
      "grad_norm": 0.406505754204958,
      "learning_rate": 4.5228855644286924e-05,
      "loss": 1.626,
      "num_input_tokens_seen": 17855651056,
      "step": 22695
    },
    {
      "epoch": 2.407808190112455,
      "grad_norm": 0.6009137040918582,
      "learning_rate": 4.522844727534726e-05,
      "loss": 1.7092,
      "num_input_tokens_seen": 17856437760,
      "step": 22696
    },
    {
      "epoch": 2.4079142796520263,
      "grad_norm": 0.3923242580114038,
      "learning_rate": 4.522803889077565e-05,
      "loss": 1.7551,
      "num_input_tokens_seen": 17857224416,
      "step": 22697
    },
    {
      "epoch": 2.408020369191598,
      "grad_norm": 0.5375359864908291,
      "learning_rate": 4.522763049057241e-05,
      "loss": 1.6999,
      "num_input_tokens_seen": 17858011136,
      "step": 22698
    },
    {
      "epoch": 2.4081264587311693,
      "grad_norm": 0.3957910589430035,
      "learning_rate": 4.5227222074737843e-05,
      "loss": 1.712,
      "num_input_tokens_seen": 17858797856,
      "step": 22699
    },
    {
      "epoch": 2.4082325482707407,
      "grad_norm": 0.41037277260622584,
      "learning_rate": 4.5226813643272275e-05,
      "loss": 1.5837,
      "num_input_tokens_seen": 17859584608,
      "step": 22700
    },
    {
      "epoch": 2.4083386378103118,
      "grad_norm": 0.40133749570749855,
      "learning_rate": 4.522640519617603e-05,
      "loss": 1.6267,
      "num_input_tokens_seen": 17860371456,
      "step": 22701
    },
    {
      "epoch": 2.4084447273498832,
      "grad_norm": 0.42740869427780576,
      "learning_rate": 4.522599673344939e-05,
      "loss": 1.6296,
      "num_input_tokens_seen": 17861158224,
      "step": 22702
    },
    {
      "epoch": 2.4085508168894547,
      "grad_norm": 0.43137097197361585,
      "learning_rate": 4.522558825509271e-05,
      "loss": 1.665,
      "num_input_tokens_seen": 17861944960,
      "step": 22703
    },
    {
      "epoch": 2.408656906429026,
      "grad_norm": 0.42446268906410844,
      "learning_rate": 4.5225179761106284e-05,
      "loss": 1.6383,
      "num_input_tokens_seen": 17862731712,
      "step": 22704
    },
    {
      "epoch": 2.4087629959685977,
      "grad_norm": 0.46636040050225175,
      "learning_rate": 4.5224771251490426e-05,
      "loss": 1.6292,
      "num_input_tokens_seen": 17863518464,
      "step": 22705
    },
    {
      "epoch": 2.4088690855081687,
      "grad_norm": 0.43620875084204114,
      "learning_rate": 4.522436272624547e-05,
      "loss": 1.6595,
      "num_input_tokens_seen": 17864305184,
      "step": 22706
    },
    {
      "epoch": 2.40897517504774,
      "grad_norm": 0.3790641638054531,
      "learning_rate": 4.522395418537171e-05,
      "loss": 1.5792,
      "num_input_tokens_seen": 17865091968,
      "step": 22707
    },
    {
      "epoch": 2.4090812645873116,
      "grad_norm": 0.5002057695222591,
      "learning_rate": 4.522354562886948e-05,
      "loss": 1.7219,
      "num_input_tokens_seen": 17865878720,
      "step": 22708
    },
    {
      "epoch": 2.409187354126883,
      "grad_norm": 0.4397317271283082,
      "learning_rate": 4.522313705673908e-05,
      "loss": 1.6172,
      "num_input_tokens_seen": 17866665456,
      "step": 22709
    },
    {
      "epoch": 2.4092934436664546,
      "grad_norm": 0.4296036643106117,
      "learning_rate": 4.522272846898084e-05,
      "loss": 1.5676,
      "num_input_tokens_seen": 17867452160,
      "step": 22710
    },
    {
      "epoch": 2.409399533206026,
      "grad_norm": 0.42029133837740795,
      "learning_rate": 4.5222319865595065e-05,
      "loss": 1.5103,
      "num_input_tokens_seen": 17868238928,
      "step": 22711
    },
    {
      "epoch": 2.409505622745597,
      "grad_norm": 0.36763935926197594,
      "learning_rate": 4.522191124658207e-05,
      "loss": 1.5657,
      "num_input_tokens_seen": 17869025744,
      "step": 22712
    },
    {
      "epoch": 2.4096117122851686,
      "grad_norm": 0.4615265842976194,
      "learning_rate": 4.522150261194218e-05,
      "loss": 1.6205,
      "num_input_tokens_seen": 17869812480,
      "step": 22713
    },
    {
      "epoch": 2.40971780182474,
      "grad_norm": 0.5151602935924726,
      "learning_rate": 4.5221093961675706e-05,
      "loss": 1.6795,
      "num_input_tokens_seen": 17870599232,
      "step": 22714
    },
    {
      "epoch": 2.4098238913643115,
      "grad_norm": 0.3509790313613404,
      "learning_rate": 4.522068529578297e-05,
      "loss": 1.512,
      "num_input_tokens_seen": 17871385968,
      "step": 22715
    },
    {
      "epoch": 2.409929980903883,
      "grad_norm": 0.6618023500918612,
      "learning_rate": 4.5220276614264274e-05,
      "loss": 1.6039,
      "num_input_tokens_seen": 17872172688,
      "step": 22716
    },
    {
      "epoch": 2.4100360704434545,
      "grad_norm": 0.3464757128190877,
      "learning_rate": 4.521986791711994e-05,
      "loss": 1.5936,
      "num_input_tokens_seen": 17872959472,
      "step": 22717
    },
    {
      "epoch": 2.4101421599830255,
      "grad_norm": 0.6605715268060521,
      "learning_rate": 4.521945920435029e-05,
      "loss": 1.6222,
      "num_input_tokens_seen": 17873746256,
      "step": 22718
    },
    {
      "epoch": 2.410248249522597,
      "grad_norm": 0.43225438686928225,
      "learning_rate": 4.521905047595564e-05,
      "loss": 1.7866,
      "num_input_tokens_seen": 17874533008,
      "step": 22719
    },
    {
      "epoch": 2.4103543390621684,
      "grad_norm": 0.4627145385921839,
      "learning_rate": 4.521864173193629e-05,
      "loss": 1.6296,
      "num_input_tokens_seen": 17875319824,
      "step": 22720
    },
    {
      "epoch": 2.41046042860174,
      "grad_norm": 0.4481100341005615,
      "learning_rate": 4.5218232972292574e-05,
      "loss": 1.5643,
      "num_input_tokens_seen": 17876106656,
      "step": 22721
    },
    {
      "epoch": 2.4105665181413114,
      "grad_norm": 0.38528604473024414,
      "learning_rate": 4.5217824197024795e-05,
      "loss": 1.5675,
      "num_input_tokens_seen": 17876893408,
      "step": 22722
    },
    {
      "epoch": 2.4106726076808824,
      "grad_norm": 0.5904628894290298,
      "learning_rate": 4.521741540613328e-05,
      "loss": 1.6215,
      "num_input_tokens_seen": 17877680128,
      "step": 22723
    },
    {
      "epoch": 2.410778697220454,
      "grad_norm": 0.41090850271886253,
      "learning_rate": 4.521700659961834e-05,
      "loss": 1.7229,
      "num_input_tokens_seen": 17878466832,
      "step": 22724
    },
    {
      "epoch": 2.4108847867600254,
      "grad_norm": 0.41057847859146324,
      "learning_rate": 4.521659777748028e-05,
      "loss": 1.5815,
      "num_input_tokens_seen": 17879253584,
      "step": 22725
    },
    {
      "epoch": 2.410990876299597,
      "grad_norm": 0.4461693066802841,
      "learning_rate": 4.521618893971944e-05,
      "loss": 1.5087,
      "num_input_tokens_seen": 17880040336,
      "step": 22726
    },
    {
      "epoch": 2.4110969658391683,
      "grad_norm": 0.39137723620093273,
      "learning_rate": 4.521578008633612e-05,
      "loss": 1.5606,
      "num_input_tokens_seen": 17880827184,
      "step": 22727
    },
    {
      "epoch": 2.41120305537874,
      "grad_norm": 0.4409237346938224,
      "learning_rate": 4.521537121733064e-05,
      "loss": 1.6207,
      "num_input_tokens_seen": 17881613920,
      "step": 22728
    },
    {
      "epoch": 2.4113091449183113,
      "grad_norm": 0.36671673254378717,
      "learning_rate": 4.52149623327033e-05,
      "loss": 1.5273,
      "num_input_tokens_seen": 17882400752,
      "step": 22729
    },
    {
      "epoch": 2.4114152344578823,
      "grad_norm": 0.41187921660388643,
      "learning_rate": 4.5214553432454444e-05,
      "loss": 1.6354,
      "num_input_tokens_seen": 17883187520,
      "step": 22730
    },
    {
      "epoch": 2.411521323997454,
      "grad_norm": 0.47495827194653756,
      "learning_rate": 4.521414451658437e-05,
      "loss": 1.6549,
      "num_input_tokens_seen": 17883974336,
      "step": 22731
    },
    {
      "epoch": 2.4116274135370253,
      "grad_norm": 0.37606039751589954,
      "learning_rate": 4.5213735585093395e-05,
      "loss": 1.6687,
      "num_input_tokens_seen": 17884761136,
      "step": 22732
    },
    {
      "epoch": 2.4117335030765967,
      "grad_norm": 0.6329976496005609,
      "learning_rate": 4.521332663798185e-05,
      "loss": 1.6752,
      "num_input_tokens_seen": 17885547872,
      "step": 22733
    },
    {
      "epoch": 2.411839592616168,
      "grad_norm": 0.46286077835202416,
      "learning_rate": 4.5212917675250026e-05,
      "loss": 1.5489,
      "num_input_tokens_seen": 17886334704,
      "step": 22734
    },
    {
      "epoch": 2.4119456821557392,
      "grad_norm": 0.36510248018497876,
      "learning_rate": 4.521250869689826e-05,
      "loss": 1.4946,
      "num_input_tokens_seen": 17887121440,
      "step": 22735
    },
    {
      "epoch": 2.4120517716953107,
      "grad_norm": 0.4477817923491221,
      "learning_rate": 4.521209970292686e-05,
      "loss": 1.66,
      "num_input_tokens_seen": 17887908032,
      "step": 22736
    },
    {
      "epoch": 2.412157861234882,
      "grad_norm": 0.5048606811687681,
      "learning_rate": 4.521169069333614e-05,
      "loss": 1.6226,
      "num_input_tokens_seen": 17888694768,
      "step": 22737
    },
    {
      "epoch": 2.4122639507744537,
      "grad_norm": 0.40462629020371926,
      "learning_rate": 4.5211281668126416e-05,
      "loss": 1.6137,
      "num_input_tokens_seen": 17889481488,
      "step": 22738
    },
    {
      "epoch": 2.412370040314025,
      "grad_norm": 0.45483248695069795,
      "learning_rate": 4.5210872627298006e-05,
      "loss": 1.6193,
      "num_input_tokens_seen": 17890268320,
      "step": 22739
    },
    {
      "epoch": 2.4124761298535966,
      "grad_norm": 0.36928763112098295,
      "learning_rate": 4.521046357085124e-05,
      "loss": 1.5438,
      "num_input_tokens_seen": 17891055088,
      "step": 22740
    },
    {
      "epoch": 2.412582219393168,
      "grad_norm": 0.41544244342385894,
      "learning_rate": 4.52100544987864e-05,
      "loss": 1.6613,
      "num_input_tokens_seen": 17891841888,
      "step": 22741
    },
    {
      "epoch": 2.412688308932739,
      "grad_norm": 0.448803082368865,
      "learning_rate": 4.520964541110384e-05,
      "loss": 1.6938,
      "num_input_tokens_seen": 17892628624,
      "step": 22742
    },
    {
      "epoch": 2.4127943984723106,
      "grad_norm": 0.3480912920464761,
      "learning_rate": 4.520923630780385e-05,
      "loss": 1.5118,
      "num_input_tokens_seen": 17893415424,
      "step": 22743
    },
    {
      "epoch": 2.412900488011882,
      "grad_norm": 0.44124942644234166,
      "learning_rate": 4.520882718888676e-05,
      "loss": 1.6008,
      "num_input_tokens_seen": 17894202192,
      "step": 22744
    },
    {
      "epoch": 2.4130065775514535,
      "grad_norm": 0.3931349929683202,
      "learning_rate": 4.520841805435287e-05,
      "loss": 1.6727,
      "num_input_tokens_seen": 17894988944,
      "step": 22745
    },
    {
      "epoch": 2.413112667091025,
      "grad_norm": 0.4510098988501916,
      "learning_rate": 4.520800890420253e-05,
      "loss": 1.6546,
      "num_input_tokens_seen": 17895775744,
      "step": 22746
    },
    {
      "epoch": 2.413218756630596,
      "grad_norm": 0.46154015654785924,
      "learning_rate": 4.520759973843601e-05,
      "loss": 1.6838,
      "num_input_tokens_seen": 17896562432,
      "step": 22747
    },
    {
      "epoch": 2.4133248461701675,
      "grad_norm": 0.5601118872186751,
      "learning_rate": 4.5207190557053666e-05,
      "loss": 1.7015,
      "num_input_tokens_seen": 17897349136,
      "step": 22748
    },
    {
      "epoch": 2.413430935709739,
      "grad_norm": 0.37117461976612126,
      "learning_rate": 4.5206781360055786e-05,
      "loss": 1.5947,
      "num_input_tokens_seen": 17898135936,
      "step": 22749
    },
    {
      "epoch": 2.4135370252493105,
      "grad_norm": 0.561460013572265,
      "learning_rate": 4.520637214744271e-05,
      "loss": 1.5127,
      "num_input_tokens_seen": 17898922576,
      "step": 22750
    },
    {
      "epoch": 2.413643114788882,
      "grad_norm": 0.35167480807195245,
      "learning_rate": 4.520596291921474e-05,
      "loss": 1.5187,
      "num_input_tokens_seen": 17899709344,
      "step": 22751
    },
    {
      "epoch": 2.413749204328453,
      "grad_norm": 0.5133658186970245,
      "learning_rate": 4.5205553675372184e-05,
      "loss": 1.5888,
      "num_input_tokens_seen": 17900496064,
      "step": 22752
    },
    {
      "epoch": 2.4138552938680244,
      "grad_norm": 0.4874021206434421,
      "learning_rate": 4.520514441591538e-05,
      "loss": 1.7015,
      "num_input_tokens_seen": 17901282768,
      "step": 22753
    },
    {
      "epoch": 2.413961383407596,
      "grad_norm": 0.8277958903870828,
      "learning_rate": 4.520473514084463e-05,
      "loss": 1.6474,
      "num_input_tokens_seen": 17902069664,
      "step": 22754
    },
    {
      "epoch": 2.4140674729471674,
      "grad_norm": 0.3857023140140511,
      "learning_rate": 4.520432585016025e-05,
      "loss": 1.6522,
      "num_input_tokens_seen": 17902856528,
      "step": 22755
    },
    {
      "epoch": 2.414173562486739,
      "grad_norm": 0.80680542544963,
      "learning_rate": 4.520391654386257e-05,
      "loss": 1.6418,
      "num_input_tokens_seen": 17903643472,
      "step": 22756
    },
    {
      "epoch": 2.4142796520263103,
      "grad_norm": 0.5245320017046107,
      "learning_rate": 4.5203507221951886e-05,
      "loss": 1.5775,
      "num_input_tokens_seen": 17904430176,
      "step": 22757
    },
    {
      "epoch": 2.414385741565882,
      "grad_norm": 0.6916812579331618,
      "learning_rate": 4.520309788442852e-05,
      "loss": 1.509,
      "num_input_tokens_seen": 17905216976,
      "step": 22758
    },
    {
      "epoch": 2.414491831105453,
      "grad_norm": 0.6695197124040649,
      "learning_rate": 4.5202688531292804e-05,
      "loss": 1.6035,
      "num_input_tokens_seen": 17906003776,
      "step": 22759
    },
    {
      "epoch": 2.4145979206450243,
      "grad_norm": 0.4779630110208995,
      "learning_rate": 4.520227916254504e-05,
      "loss": 1.5275,
      "num_input_tokens_seen": 17906790592,
      "step": 22760
    },
    {
      "epoch": 2.414704010184596,
      "grad_norm": 0.6372755286592647,
      "learning_rate": 4.520186977818555e-05,
      "loss": 1.6202,
      "num_input_tokens_seen": 17907577408,
      "step": 22761
    },
    {
      "epoch": 2.4148100997241673,
      "grad_norm": 0.4235948815588947,
      "learning_rate": 4.5201460378214646e-05,
      "loss": 1.6703,
      "num_input_tokens_seen": 17908364208,
      "step": 22762
    },
    {
      "epoch": 2.4149161892637387,
      "grad_norm": 0.39352055934595265,
      "learning_rate": 4.520105096263264e-05,
      "loss": 1.5623,
      "num_input_tokens_seen": 17909150960,
      "step": 22763
    },
    {
      "epoch": 2.4150222788033098,
      "grad_norm": 0.5814192265743602,
      "learning_rate": 4.520064153143986e-05,
      "loss": 1.7447,
      "num_input_tokens_seen": 17909937744,
      "step": 22764
    },
    {
      "epoch": 2.4151283683428812,
      "grad_norm": 0.3721272234788949,
      "learning_rate": 4.520023208463662e-05,
      "loss": 1.5731,
      "num_input_tokens_seen": 17910724480,
      "step": 22765
    },
    {
      "epoch": 2.4152344578824527,
      "grad_norm": 0.5071225275787984,
      "learning_rate": 4.5199822622223234e-05,
      "loss": 1.6025,
      "num_input_tokens_seen": 17911511216,
      "step": 22766
    },
    {
      "epoch": 2.415340547422024,
      "grad_norm": 0.4307222032576018,
      "learning_rate": 4.519941314420001e-05,
      "loss": 1.576,
      "num_input_tokens_seen": 17912298080,
      "step": 22767
    },
    {
      "epoch": 2.4154466369615957,
      "grad_norm": 0.43238292299593034,
      "learning_rate": 4.5199003650567274e-05,
      "loss": 1.7303,
      "num_input_tokens_seen": 17913084784,
      "step": 22768
    },
    {
      "epoch": 2.415552726501167,
      "grad_norm": 0.4940820909298767,
      "learning_rate": 4.519859414132535e-05,
      "loss": 1.7342,
      "num_input_tokens_seen": 17913871504,
      "step": 22769
    },
    {
      "epoch": 2.4156588160407386,
      "grad_norm": 0.37369502662471543,
      "learning_rate": 4.519818461647452e-05,
      "loss": 1.5645,
      "num_input_tokens_seen": 17914658320,
      "step": 22770
    },
    {
      "epoch": 2.4157649055803097,
      "grad_norm": 0.36007732660054975,
      "learning_rate": 4.519777507601515e-05,
      "loss": 1.5037,
      "num_input_tokens_seen": 17915445056,
      "step": 22771
    },
    {
      "epoch": 2.415870995119881,
      "grad_norm": 0.4218631568960598,
      "learning_rate": 4.519736551994753e-05,
      "loss": 1.6807,
      "num_input_tokens_seen": 17916231872,
      "step": 22772
    },
    {
      "epoch": 2.4159770846594526,
      "grad_norm": 0.399943233764716,
      "learning_rate": 4.519695594827197e-05,
      "loss": 1.5921,
      "num_input_tokens_seen": 17917018720,
      "step": 22773
    },
    {
      "epoch": 2.416083174199024,
      "grad_norm": 0.3583424421050116,
      "learning_rate": 4.51965463609888e-05,
      "loss": 1.6619,
      "num_input_tokens_seen": 17917805472,
      "step": 22774
    },
    {
      "epoch": 2.4161892637385955,
      "grad_norm": 0.616670179136637,
      "learning_rate": 4.519613675809833e-05,
      "loss": 1.6224,
      "num_input_tokens_seen": 17918592208,
      "step": 22775
    },
    {
      "epoch": 2.4162953532781666,
      "grad_norm": 0.3601783591138162,
      "learning_rate": 4.519572713960088e-05,
      "loss": 1.595,
      "num_input_tokens_seen": 17919379056,
      "step": 22776
    },
    {
      "epoch": 2.416401442817738,
      "grad_norm": 0.5633771447381088,
      "learning_rate": 4.519531750549676e-05,
      "loss": 1.6282,
      "num_input_tokens_seen": 17920165792,
      "step": 22777
    },
    {
      "epoch": 2.4165075323573095,
      "grad_norm": 0.3970195423172376,
      "learning_rate": 4.5194907855786297e-05,
      "loss": 1.6987,
      "num_input_tokens_seen": 17920952528,
      "step": 22778
    },
    {
      "epoch": 2.416613621896881,
      "grad_norm": 0.49579054662996175,
      "learning_rate": 4.5194498190469795e-05,
      "loss": 1.6642,
      "num_input_tokens_seen": 17921739296,
      "step": 22779
    },
    {
      "epoch": 2.4167197114364525,
      "grad_norm": 0.4350052353282464,
      "learning_rate": 4.5194088509547586e-05,
      "loss": 1.6135,
      "num_input_tokens_seen": 17922526000,
      "step": 22780
    },
    {
      "epoch": 2.416825800976024,
      "grad_norm": 0.42077663078038674,
      "learning_rate": 4.519367881301997e-05,
      "loss": 1.5557,
      "num_input_tokens_seen": 17923312768,
      "step": 22781
    },
    {
      "epoch": 2.416931890515595,
      "grad_norm": 0.5265905773459626,
      "learning_rate": 4.519326910088728e-05,
      "loss": 1.548,
      "num_input_tokens_seen": 17924099536,
      "step": 22782
    },
    {
      "epoch": 2.4170379800551665,
      "grad_norm": 0.3825456110500639,
      "learning_rate": 4.5192859373149814e-05,
      "loss": 1.6606,
      "num_input_tokens_seen": 17924886208,
      "step": 22783
    },
    {
      "epoch": 2.417144069594738,
      "grad_norm": 0.4258655042653814,
      "learning_rate": 4.519244962980791e-05,
      "loss": 1.6337,
      "num_input_tokens_seen": 17925672992,
      "step": 22784
    },
    {
      "epoch": 2.4172501591343094,
      "grad_norm": 0.4589787641597365,
      "learning_rate": 4.5192039870861865e-05,
      "loss": 1.6834,
      "num_input_tokens_seen": 17926459744,
      "step": 22785
    },
    {
      "epoch": 2.417356248673881,
      "grad_norm": 0.43799517838145346,
      "learning_rate": 4.5191630096312e-05,
      "loss": 1.6331,
      "num_input_tokens_seen": 17927246592,
      "step": 22786
    },
    {
      "epoch": 2.4174623382134524,
      "grad_norm": 0.3963721871093234,
      "learning_rate": 4.5191220306158646e-05,
      "loss": 1.5527,
      "num_input_tokens_seen": 17928033392,
      "step": 22787
    },
    {
      "epoch": 2.4175684277530234,
      "grad_norm": 0.39523853599811526,
      "learning_rate": 4.51908105004021e-05,
      "loss": 1.5021,
      "num_input_tokens_seen": 17928820208,
      "step": 22788
    },
    {
      "epoch": 2.417674517292595,
      "grad_norm": 0.39858465138402366,
      "learning_rate": 4.51904006790427e-05,
      "loss": 1.4978,
      "num_input_tokens_seen": 17929606944,
      "step": 22789
    },
    {
      "epoch": 2.4177806068321663,
      "grad_norm": 0.43451015055816067,
      "learning_rate": 4.5189990842080744e-05,
      "loss": 1.633,
      "num_input_tokens_seen": 17930393648,
      "step": 22790
    },
    {
      "epoch": 2.417886696371738,
      "grad_norm": 0.3336392490816864,
      "learning_rate": 4.518958098951656e-05,
      "loss": 1.5819,
      "num_input_tokens_seen": 17931180464,
      "step": 22791
    },
    {
      "epoch": 2.4179927859113093,
      "grad_norm": 0.4194986979688931,
      "learning_rate": 4.518917112135045e-05,
      "loss": 1.6166,
      "num_input_tokens_seen": 17931967232,
      "step": 22792
    },
    {
      "epoch": 2.4180988754508803,
      "grad_norm": 0.39530814905060063,
      "learning_rate": 4.518876123758274e-05,
      "loss": 1.7033,
      "num_input_tokens_seen": 17932754016,
      "step": 22793
    },
    {
      "epoch": 2.418204964990452,
      "grad_norm": 0.3886643504203671,
      "learning_rate": 4.5188351338213766e-05,
      "loss": 1.5879,
      "num_input_tokens_seen": 17933540800,
      "step": 22794
    },
    {
      "epoch": 2.4183110545300233,
      "grad_norm": 0.3847229443635496,
      "learning_rate": 4.5187941423243804e-05,
      "loss": 1.5603,
      "num_input_tokens_seen": 17934327568,
      "step": 22795
    },
    {
      "epoch": 2.4184171440695947,
      "grad_norm": 0.3634063897913633,
      "learning_rate": 4.518753149267321e-05,
      "loss": 1.5041,
      "num_input_tokens_seen": 17935114368,
      "step": 22796
    },
    {
      "epoch": 2.418523233609166,
      "grad_norm": 0.3987828281919612,
      "learning_rate": 4.518712154650227e-05,
      "loss": 1.5219,
      "num_input_tokens_seen": 17935901104,
      "step": 22797
    },
    {
      "epoch": 2.4186293231487377,
      "grad_norm": 0.3580907758674273,
      "learning_rate": 4.5186711584731335e-05,
      "loss": 1.5925,
      "num_input_tokens_seen": 17936687792,
      "step": 22798
    },
    {
      "epoch": 2.418735412688309,
      "grad_norm": 0.40358712619857695,
      "learning_rate": 4.5186301607360686e-05,
      "loss": 1.6627,
      "num_input_tokens_seen": 17937474480,
      "step": 22799
    },
    {
      "epoch": 2.41884150222788,
      "grad_norm": 0.41037963705436337,
      "learning_rate": 4.518589161439066e-05,
      "loss": 1.5581,
      "num_input_tokens_seen": 17938261216,
      "step": 22800
    },
    {
      "epoch": 2.4189475917674517,
      "grad_norm": 0.3611680524022164,
      "learning_rate": 4.518548160582157e-05,
      "loss": 1.5064,
      "num_input_tokens_seen": 17939048016,
      "step": 22801
    },
    {
      "epoch": 2.419053681307023,
      "grad_norm": 0.39768773924394896,
      "learning_rate": 4.5185071581653726e-05,
      "loss": 1.6113,
      "num_input_tokens_seen": 17939834704,
      "step": 22802
    },
    {
      "epoch": 2.4191597708465946,
      "grad_norm": 0.44312133715957297,
      "learning_rate": 4.518466154188746e-05,
      "loss": 1.7393,
      "num_input_tokens_seen": 17940621440,
      "step": 22803
    },
    {
      "epoch": 2.419265860386166,
      "grad_norm": 0.4069530007755506,
      "learning_rate": 4.518425148652307e-05,
      "loss": 1.7605,
      "num_input_tokens_seen": 17941408160,
      "step": 22804
    },
    {
      "epoch": 2.419371949925737,
      "grad_norm": 0.46880439997303314,
      "learning_rate": 4.518384141556089e-05,
      "loss": 1.6174,
      "num_input_tokens_seen": 17942194912,
      "step": 22805
    },
    {
      "epoch": 2.4194780394653086,
      "grad_norm": 0.36768109335830934,
      "learning_rate": 4.518343132900123e-05,
      "loss": 1.569,
      "num_input_tokens_seen": 17942981696,
      "step": 22806
    },
    {
      "epoch": 2.41958412900488,
      "grad_norm": 0.43242566216892436,
      "learning_rate": 4.5183021226844404e-05,
      "loss": 1.6014,
      "num_input_tokens_seen": 17943768368,
      "step": 22807
    },
    {
      "epoch": 2.4196902185444515,
      "grad_norm": 0.32339265535797224,
      "learning_rate": 4.518261110909073e-05,
      "loss": 1.4854,
      "num_input_tokens_seen": 17944555168,
      "step": 22808
    },
    {
      "epoch": 2.419796308084023,
      "grad_norm": 0.40916619524456993,
      "learning_rate": 4.518220097574052e-05,
      "loss": 1.6029,
      "num_input_tokens_seen": 17945341856,
      "step": 22809
    },
    {
      "epoch": 2.4199023976235945,
      "grad_norm": 0.39113177941172145,
      "learning_rate": 4.518179082679411e-05,
      "loss": 1.4629,
      "num_input_tokens_seen": 17946128608,
      "step": 22810
    },
    {
      "epoch": 2.4200084871631655,
      "grad_norm": 0.3477712948300458,
      "learning_rate": 4.51813806622518e-05,
      "loss": 1.4442,
      "num_input_tokens_seen": 17946915344,
      "step": 22811
    },
    {
      "epoch": 2.420114576702737,
      "grad_norm": 0.39396308826139154,
      "learning_rate": 4.518097048211391e-05,
      "loss": 1.6819,
      "num_input_tokens_seen": 17947702144,
      "step": 22812
    },
    {
      "epoch": 2.4202206662423085,
      "grad_norm": 0.37920354070766304,
      "learning_rate": 4.518056028638076e-05,
      "loss": 1.6142,
      "num_input_tokens_seen": 17948488832,
      "step": 22813
    },
    {
      "epoch": 2.42032675578188,
      "grad_norm": 0.4138174022667622,
      "learning_rate": 4.5180150075052664e-05,
      "loss": 1.5999,
      "num_input_tokens_seen": 17949275616,
      "step": 22814
    },
    {
      "epoch": 2.4204328453214514,
      "grad_norm": 0.4352386290319281,
      "learning_rate": 4.517973984812994e-05,
      "loss": 1.6294,
      "num_input_tokens_seen": 17950062400,
      "step": 22815
    },
    {
      "epoch": 2.420538934861023,
      "grad_norm": 0.3705612597316016,
      "learning_rate": 4.51793296056129e-05,
      "loss": 1.5326,
      "num_input_tokens_seen": 17950849168,
      "step": 22816
    },
    {
      "epoch": 2.420645024400594,
      "grad_norm": 0.4373518679680413,
      "learning_rate": 4.5178919347501874e-05,
      "loss": 1.5631,
      "num_input_tokens_seen": 17951635968,
      "step": 22817
    },
    {
      "epoch": 2.4207511139401654,
      "grad_norm": 0.4848701711175002,
      "learning_rate": 4.517850907379717e-05,
      "loss": 1.5644,
      "num_input_tokens_seen": 17952422784,
      "step": 22818
    },
    {
      "epoch": 2.420857203479737,
      "grad_norm": 0.4266501513377539,
      "learning_rate": 4.51780987844991e-05,
      "loss": 1.6372,
      "num_input_tokens_seen": 17953209568,
      "step": 22819
    },
    {
      "epoch": 2.4209632930193083,
      "grad_norm": 0.412421675646791,
      "learning_rate": 4.517768847960799e-05,
      "loss": 1.5938,
      "num_input_tokens_seen": 17953996288,
      "step": 22820
    },
    {
      "epoch": 2.42106938255888,
      "grad_norm": 0.48268969826822167,
      "learning_rate": 4.517727815912416e-05,
      "loss": 1.591,
      "num_input_tokens_seen": 17954782976,
      "step": 22821
    },
    {
      "epoch": 2.421175472098451,
      "grad_norm": 0.5983978818151349,
      "learning_rate": 4.5176867823047916e-05,
      "loss": 1.7458,
      "num_input_tokens_seen": 17955569728,
      "step": 22822
    },
    {
      "epoch": 2.4212815616380223,
      "grad_norm": 0.5172540530391639,
      "learning_rate": 4.517645747137959e-05,
      "loss": 1.6006,
      "num_input_tokens_seen": 17956356480,
      "step": 22823
    },
    {
      "epoch": 2.421387651177594,
      "grad_norm": 0.8193035088648337,
      "learning_rate": 4.5176047104119476e-05,
      "loss": 1.6109,
      "num_input_tokens_seen": 17957143264,
      "step": 22824
    },
    {
      "epoch": 2.4214937407171653,
      "grad_norm": 0.3824811976435619,
      "learning_rate": 4.517563672126791e-05,
      "loss": 1.5024,
      "num_input_tokens_seen": 17957930080,
      "step": 22825
    },
    {
      "epoch": 2.4215998302567368,
      "grad_norm": 0.437602684731675,
      "learning_rate": 4.517522632282521e-05,
      "loss": 1.7134,
      "num_input_tokens_seen": 17958716800,
      "step": 22826
    },
    {
      "epoch": 2.4217059197963082,
      "grad_norm": 0.6732968125520484,
      "learning_rate": 4.517481590879168e-05,
      "loss": 1.6381,
      "num_input_tokens_seen": 17959503520,
      "step": 22827
    },
    {
      "epoch": 2.4218120093358797,
      "grad_norm": 0.3788228140946571,
      "learning_rate": 4.517440547916764e-05,
      "loss": 1.5675,
      "num_input_tokens_seen": 17960290400,
      "step": 22828
    },
    {
      "epoch": 2.4219180988754507,
      "grad_norm": 0.5984761542530593,
      "learning_rate": 4.517399503395342e-05,
      "loss": 1.5742,
      "num_input_tokens_seen": 17961077184,
      "step": 22829
    },
    {
      "epoch": 2.422024188415022,
      "grad_norm": 0.6412681367787421,
      "learning_rate": 4.517358457314933e-05,
      "loss": 1.4912,
      "num_input_tokens_seen": 17961863920,
      "step": 22830
    },
    {
      "epoch": 2.4221302779545937,
      "grad_norm": 0.579745330544136,
      "learning_rate": 4.517317409675568e-05,
      "loss": 1.612,
      "num_input_tokens_seen": 17962650768,
      "step": 22831
    },
    {
      "epoch": 2.422236367494165,
      "grad_norm": 0.5158248722676302,
      "learning_rate": 4.51727636047728e-05,
      "loss": 1.5795,
      "num_input_tokens_seen": 17963437552,
      "step": 22832
    },
    {
      "epoch": 2.4223424570337366,
      "grad_norm": 0.46291490274308045,
      "learning_rate": 4.517235309720099e-05,
      "loss": 1.6157,
      "num_input_tokens_seen": 17964224384,
      "step": 22833
    },
    {
      "epoch": 2.4224485465733077,
      "grad_norm": 0.8194873449622985,
      "learning_rate": 4.517194257404058e-05,
      "loss": 1.5784,
      "num_input_tokens_seen": 17965011200,
      "step": 22834
    },
    {
      "epoch": 2.422554636112879,
      "grad_norm": 0.6856834922791295,
      "learning_rate": 4.5171532035291886e-05,
      "loss": 1.7197,
      "num_input_tokens_seen": 17965797952,
      "step": 22835
    },
    {
      "epoch": 2.4226607256524506,
      "grad_norm": 0.6062252601604871,
      "learning_rate": 4.5171121480955224e-05,
      "loss": 1.5536,
      "num_input_tokens_seen": 17966584720,
      "step": 22836
    },
    {
      "epoch": 2.422766815192022,
      "grad_norm": 0.6087117660648302,
      "learning_rate": 4.517071091103091e-05,
      "loss": 1.4809,
      "num_input_tokens_seen": 17967371472,
      "step": 22837
    },
    {
      "epoch": 2.4228729047315936,
      "grad_norm": 0.6222434823147145,
      "learning_rate": 4.5170300325519265e-05,
      "loss": 1.6001,
      "num_input_tokens_seen": 17968158240,
      "step": 22838
    },
    {
      "epoch": 2.422978994271165,
      "grad_norm": 0.7653261954830588,
      "learning_rate": 4.5169889724420604e-05,
      "loss": 1.7147,
      "num_input_tokens_seen": 17968944960,
      "step": 22839
    },
    {
      "epoch": 2.4230850838107365,
      "grad_norm": 0.7477427155828803,
      "learning_rate": 4.516947910773524e-05,
      "loss": 1.6919,
      "num_input_tokens_seen": 17969731680,
      "step": 22840
    },
    {
      "epoch": 2.4231911733503075,
      "grad_norm": 0.7837377045252596,
      "learning_rate": 4.516906847546351e-05,
      "loss": 1.7487,
      "num_input_tokens_seen": 17970518480,
      "step": 22841
    },
    {
      "epoch": 2.423297262889879,
      "grad_norm": 0.856948923796709,
      "learning_rate": 4.51686578276057e-05,
      "loss": 1.7024,
      "num_input_tokens_seen": 17971305216,
      "step": 22842
    },
    {
      "epoch": 2.4234033524294505,
      "grad_norm": 0.8325253359504835,
      "learning_rate": 4.516824716416214e-05,
      "loss": 1.5883,
      "num_input_tokens_seen": 17972092000,
      "step": 22843
    },
    {
      "epoch": 2.423509441969022,
      "grad_norm": 0.6650739199545441,
      "learning_rate": 4.5167836485133164e-05,
      "loss": 1.6326,
      "num_input_tokens_seen": 17972878816,
      "step": 22844
    },
    {
      "epoch": 2.4236155315085934,
      "grad_norm": 1.053960051851216,
      "learning_rate": 4.5167425790519064e-05,
      "loss": 1.6534,
      "num_input_tokens_seen": 17973665536,
      "step": 22845
    },
    {
      "epoch": 2.4237216210481645,
      "grad_norm": 0.5143076239007183,
      "learning_rate": 4.5167015080320174e-05,
      "loss": 1.5853,
      "num_input_tokens_seen": 17974452320,
      "step": 22846
    },
    {
      "epoch": 2.423827710587736,
      "grad_norm": 0.7542352123054005,
      "learning_rate": 4.516660435453681e-05,
      "loss": 1.7091,
      "num_input_tokens_seen": 17975239120,
      "step": 22847
    },
    {
      "epoch": 2.4239338001273074,
      "grad_norm": 0.511569601264813,
      "learning_rate": 4.516619361316928e-05,
      "loss": 1.5915,
      "num_input_tokens_seen": 17976025824,
      "step": 22848
    },
    {
      "epoch": 2.424039889666879,
      "grad_norm": 1.2997629578995487,
      "learning_rate": 4.5165782856217906e-05,
      "loss": 1.6507,
      "num_input_tokens_seen": 17976812512,
      "step": 22849
    },
    {
      "epoch": 2.4241459792064504,
      "grad_norm": 0.4548517280686296,
      "learning_rate": 4.516537208368301e-05,
      "loss": 1.6012,
      "num_input_tokens_seen": 17977599296,
      "step": 22850
    },
    {
      "epoch": 2.4242520687460214,
      "grad_norm": 1.4308238519681011,
      "learning_rate": 4.516496129556491e-05,
      "loss": 1.5667,
      "num_input_tokens_seen": 17978386032,
      "step": 22851
    },
    {
      "epoch": 2.424358158285593,
      "grad_norm": 0.5124864462235622,
      "learning_rate": 4.516455049186391e-05,
      "loss": 1.5424,
      "num_input_tokens_seen": 17979172800,
      "step": 22852
    },
    {
      "epoch": 2.4244642478251643,
      "grad_norm": 0.6995719861505283,
      "learning_rate": 4.516413967258034e-05,
      "loss": 1.6005,
      "num_input_tokens_seen": 17979959536,
      "step": 22853
    },
    {
      "epoch": 2.424570337364736,
      "grad_norm": 0.5180221891801835,
      "learning_rate": 4.516372883771453e-05,
      "loss": 1.61,
      "num_input_tokens_seen": 17980746336,
      "step": 22854
    },
    {
      "epoch": 2.4246764269043073,
      "grad_norm": 0.5691087270167434,
      "learning_rate": 4.516331798726676e-05,
      "loss": 1.7097,
      "num_input_tokens_seen": 17981533040,
      "step": 22855
    },
    {
      "epoch": 2.4247825164438788,
      "grad_norm": 0.5265438124430354,
      "learning_rate": 4.516290712123738e-05,
      "loss": 1.5431,
      "num_input_tokens_seen": 17982319856,
      "step": 22856
    },
    {
      "epoch": 2.4248886059834502,
      "grad_norm": 0.4397062482836036,
      "learning_rate": 4.5162496239626694e-05,
      "loss": 1.6126,
      "num_input_tokens_seen": 17983106656,
      "step": 22857
    },
    {
      "epoch": 2.4249946955230213,
      "grad_norm": 0.7825940136728304,
      "learning_rate": 4.516208534243502e-05,
      "loss": 1.5324,
      "num_input_tokens_seen": 17983893408,
      "step": 22858
    },
    {
      "epoch": 2.4251007850625927,
      "grad_norm": 0.43663865271191465,
      "learning_rate": 4.516167442966269e-05,
      "loss": 1.5569,
      "num_input_tokens_seen": 17984680128,
      "step": 22859
    },
    {
      "epoch": 2.425206874602164,
      "grad_norm": 0.5892575852830545,
      "learning_rate": 4.516126350131e-05,
      "loss": 1.6317,
      "num_input_tokens_seen": 17985466832,
      "step": 22860
    },
    {
      "epoch": 2.4253129641417357,
      "grad_norm": 0.7268651349611098,
      "learning_rate": 4.5160852557377277e-05,
      "loss": 1.7592,
      "num_input_tokens_seen": 17986253648,
      "step": 22861
    },
    {
      "epoch": 2.425419053681307,
      "grad_norm": 0.46681816692701794,
      "learning_rate": 4.5160441597864844e-05,
      "loss": 1.6592,
      "num_input_tokens_seen": 17987040416,
      "step": 22862
    },
    {
      "epoch": 2.425525143220878,
      "grad_norm": 0.6035930405337415,
      "learning_rate": 4.516003062277301e-05,
      "loss": 1.7423,
      "num_input_tokens_seen": 17987827120,
      "step": 22863
    },
    {
      "epoch": 2.4256312327604497,
      "grad_norm": 0.4861716426240072,
      "learning_rate": 4.515961963210209e-05,
      "loss": 1.6213,
      "num_input_tokens_seen": 17988613888,
      "step": 22864
    },
    {
      "epoch": 2.425737322300021,
      "grad_norm": 0.5073707426794141,
      "learning_rate": 4.515920862585242e-05,
      "loss": 1.6981,
      "num_input_tokens_seen": 17989400624,
      "step": 22865
    },
    {
      "epoch": 2.4258434118395926,
      "grad_norm": 0.3979194819972871,
      "learning_rate": 4.5158797604024294e-05,
      "loss": 1.5692,
      "num_input_tokens_seen": 17990187472,
      "step": 22866
    },
    {
      "epoch": 2.425949501379164,
      "grad_norm": 0.5438374026010235,
      "learning_rate": 4.515838656661805e-05,
      "loss": 1.617,
      "num_input_tokens_seen": 17990974256,
      "step": 22867
    },
    {
      "epoch": 2.4260555909187356,
      "grad_norm": 0.4522150977092651,
      "learning_rate": 4.5157975513633985e-05,
      "loss": 1.624,
      "num_input_tokens_seen": 17991761024,
      "step": 22868
    },
    {
      "epoch": 2.426161680458307,
      "grad_norm": 0.5437037690352343,
      "learning_rate": 4.5157564445072437e-05,
      "loss": 1.5151,
      "num_input_tokens_seen": 17992547808,
      "step": 22869
    },
    {
      "epoch": 2.426267769997878,
      "grad_norm": 0.4720501219360114,
      "learning_rate": 4.5157153360933715e-05,
      "loss": 1.5921,
      "num_input_tokens_seen": 17993334512,
      "step": 22870
    },
    {
      "epoch": 2.4263738595374496,
      "grad_norm": 0.5403765990302886,
      "learning_rate": 4.515674226121813e-05,
      "loss": 1.7224,
      "num_input_tokens_seen": 17994121264,
      "step": 22871
    },
    {
      "epoch": 2.426479949077021,
      "grad_norm": 0.6260166950316279,
      "learning_rate": 4.5156331145926014e-05,
      "loss": 1.5722,
      "num_input_tokens_seen": 17994908160,
      "step": 22872
    },
    {
      "epoch": 2.4265860386165925,
      "grad_norm": 0.43560348438390983,
      "learning_rate": 4.5155920015057665e-05,
      "loss": 1.6241,
      "num_input_tokens_seen": 17995695024,
      "step": 22873
    },
    {
      "epoch": 2.426692128156164,
      "grad_norm": 0.602204790920348,
      "learning_rate": 4.5155508868613416e-05,
      "loss": 1.5741,
      "num_input_tokens_seen": 17996481760,
      "step": 22874
    },
    {
      "epoch": 2.426798217695735,
      "grad_norm": 0.47224360008518396,
      "learning_rate": 4.5155097706593586e-05,
      "loss": 1.535,
      "num_input_tokens_seen": 17997268560,
      "step": 22875
    },
    {
      "epoch": 2.4269043072353065,
      "grad_norm": 0.440637888026174,
      "learning_rate": 4.5154686528998494e-05,
      "loss": 1.7035,
      "num_input_tokens_seen": 17998055312,
      "step": 22876
    },
    {
      "epoch": 2.427010396774878,
      "grad_norm": 0.6075718471876926,
      "learning_rate": 4.515427533582844e-05,
      "loss": 1.4861,
      "num_input_tokens_seen": 17998842144,
      "step": 22877
    },
    {
      "epoch": 2.4271164863144494,
      "grad_norm": 0.544045011332846,
      "learning_rate": 4.515386412708376e-05,
      "loss": 1.6112,
      "num_input_tokens_seen": 17999628928,
      "step": 22878
    },
    {
      "epoch": 2.427222575854021,
      "grad_norm": 0.4089441874628816,
      "learning_rate": 4.515345290276476e-05,
      "loss": 1.6111,
      "num_input_tokens_seen": 18000415696,
      "step": 22879
    },
    {
      "epoch": 2.4273286653935924,
      "grad_norm": 0.4051075407556413,
      "learning_rate": 4.515304166287177e-05,
      "loss": 1.5682,
      "num_input_tokens_seen": 18001202560,
      "step": 22880
    },
    {
      "epoch": 2.4274347549331634,
      "grad_norm": 0.366414693731017,
      "learning_rate": 4.5152630407405095e-05,
      "loss": 1.4795,
      "num_input_tokens_seen": 18001989360,
      "step": 22881
    },
    {
      "epoch": 2.427540844472735,
      "grad_norm": 0.5002298980204984,
      "learning_rate": 4.515221913636506e-05,
      "loss": 1.6662,
      "num_input_tokens_seen": 18002776048,
      "step": 22882
    },
    {
      "epoch": 2.4276469340123064,
      "grad_norm": 0.4517218796890724,
      "learning_rate": 4.515180784975198e-05,
      "loss": 1.614,
      "num_input_tokens_seen": 18003562736,
      "step": 22883
    },
    {
      "epoch": 2.427753023551878,
      "grad_norm": 0.5358394270576365,
      "learning_rate": 4.515139654756617e-05,
      "loss": 1.7226,
      "num_input_tokens_seen": 18004349552,
      "step": 22884
    },
    {
      "epoch": 2.4278591130914493,
      "grad_norm": 0.6208874113947069,
      "learning_rate": 4.515098522980796e-05,
      "loss": 1.6956,
      "num_input_tokens_seen": 18005136400,
      "step": 22885
    },
    {
      "epoch": 2.427965202631021,
      "grad_norm": 0.4228314110559945,
      "learning_rate": 4.5150573896477656e-05,
      "loss": 1.4708,
      "num_input_tokens_seen": 18005923152,
      "step": 22886
    },
    {
      "epoch": 2.428071292170592,
      "grad_norm": 0.45277000059026634,
      "learning_rate": 4.515016254757558e-05,
      "loss": 1.5997,
      "num_input_tokens_seen": 18006709936,
      "step": 22887
    },
    {
      "epoch": 2.4281773817101633,
      "grad_norm": 0.4218651466195303,
      "learning_rate": 4.5149751183102054e-05,
      "loss": 1.63,
      "num_input_tokens_seen": 18007496624,
      "step": 22888
    },
    {
      "epoch": 2.4282834712497348,
      "grad_norm": 0.42219055948763873,
      "learning_rate": 4.514933980305739e-05,
      "loss": 1.5599,
      "num_input_tokens_seen": 18008283296,
      "step": 22889
    },
    {
      "epoch": 2.4283895607893062,
      "grad_norm": 0.39970434321927595,
      "learning_rate": 4.51489284074419e-05,
      "loss": 1.557,
      "num_input_tokens_seen": 18009069936,
      "step": 22890
    },
    {
      "epoch": 2.4284956503288777,
      "grad_norm": 0.47253034142849976,
      "learning_rate": 4.514851699625592e-05,
      "loss": 1.5752,
      "num_input_tokens_seen": 18009856672,
      "step": 22891
    },
    {
      "epoch": 2.4286017398684487,
      "grad_norm": 0.5180275288851769,
      "learning_rate": 4.514810556949975e-05,
      "loss": 1.6659,
      "num_input_tokens_seen": 18010643424,
      "step": 22892
    },
    {
      "epoch": 2.42870782940802,
      "grad_norm": 0.5522953386434434,
      "learning_rate": 4.5147694127173715e-05,
      "loss": 1.6059,
      "num_input_tokens_seen": 18011430176,
      "step": 22893
    },
    {
      "epoch": 2.4288139189475917,
      "grad_norm": 0.4305116243888133,
      "learning_rate": 4.5147282669278135e-05,
      "loss": 1.6626,
      "num_input_tokens_seen": 18012216976,
      "step": 22894
    },
    {
      "epoch": 2.428920008487163,
      "grad_norm": 0.39202578233823815,
      "learning_rate": 4.514687119581334e-05,
      "loss": 1.6123,
      "num_input_tokens_seen": 18013003712,
      "step": 22895
    },
    {
      "epoch": 2.4290260980267346,
      "grad_norm": 0.36799302415079294,
      "learning_rate": 4.514645970677961e-05,
      "loss": 1.6706,
      "num_input_tokens_seen": 18013790432,
      "step": 22896
    },
    {
      "epoch": 2.429132187566306,
      "grad_norm": 0.41213358513359977,
      "learning_rate": 4.5146048202177294e-05,
      "loss": 1.4831,
      "num_input_tokens_seen": 18014577120,
      "step": 22897
    },
    {
      "epoch": 2.4292382771058776,
      "grad_norm": 0.3646631553748938,
      "learning_rate": 4.5145636682006706e-05,
      "loss": 1.6448,
      "num_input_tokens_seen": 18015363952,
      "step": 22898
    },
    {
      "epoch": 2.4293443666454486,
      "grad_norm": 0.4025539741696061,
      "learning_rate": 4.514522514626817e-05,
      "loss": 1.5576,
      "num_input_tokens_seen": 18016150656,
      "step": 22899
    },
    {
      "epoch": 2.42945045618502,
      "grad_norm": 0.40860917541927017,
      "learning_rate": 4.514481359496199e-05,
      "loss": 1.5442,
      "num_input_tokens_seen": 18016937392,
      "step": 22900
    },
    {
      "epoch": 2.4295565457245916,
      "grad_norm": 0.36609894641992424,
      "learning_rate": 4.514440202808848e-05,
      "loss": 1.6483,
      "num_input_tokens_seen": 18017724128,
      "step": 22901
    },
    {
      "epoch": 2.429662635264163,
      "grad_norm": 0.351585302991383,
      "learning_rate": 4.5143990445647973e-05,
      "loss": 1.4828,
      "num_input_tokens_seen": 18018510992,
      "step": 22902
    },
    {
      "epoch": 2.4297687248037345,
      "grad_norm": 0.40318228975148573,
      "learning_rate": 4.5143578847640784e-05,
      "loss": 1.6032,
      "num_input_tokens_seen": 18019297712,
      "step": 22903
    },
    {
      "epoch": 2.4298748143433055,
      "grad_norm": 0.36264408369079043,
      "learning_rate": 4.514316723406722e-05,
      "loss": 1.5323,
      "num_input_tokens_seen": 18020084464,
      "step": 22904
    },
    {
      "epoch": 2.429980903882877,
      "grad_norm": 0.3525213532515715,
      "learning_rate": 4.5142755604927615e-05,
      "loss": 1.531,
      "num_input_tokens_seen": 18020871264,
      "step": 22905
    },
    {
      "epoch": 2.4300869934224485,
      "grad_norm": 0.41332707529929413,
      "learning_rate": 4.514234396022228e-05,
      "loss": 1.4892,
      "num_input_tokens_seen": 18021658096,
      "step": 22906
    },
    {
      "epoch": 2.43019308296202,
      "grad_norm": 0.38198636510149897,
      "learning_rate": 4.514193229995153e-05,
      "loss": 1.6652,
      "num_input_tokens_seen": 18022444816,
      "step": 22907
    },
    {
      "epoch": 2.4302991725015914,
      "grad_norm": 0.4219880605232573,
      "learning_rate": 4.5141520624115684e-05,
      "loss": 1.6454,
      "num_input_tokens_seen": 18023231568,
      "step": 22908
    },
    {
      "epoch": 2.430405262041163,
      "grad_norm": 0.4024809280559158,
      "learning_rate": 4.514110893271506e-05,
      "loss": 1.6455,
      "num_input_tokens_seen": 18024018320,
      "step": 22909
    },
    {
      "epoch": 2.430511351580734,
      "grad_norm": 0.36303819284554995,
      "learning_rate": 4.514069722574999e-05,
      "loss": 1.5578,
      "num_input_tokens_seen": 18024805072,
      "step": 22910
    },
    {
      "epoch": 2.4306174411203054,
      "grad_norm": 0.37823421221570447,
      "learning_rate": 4.514028550322077e-05,
      "loss": 1.5147,
      "num_input_tokens_seen": 18025591904,
      "step": 22911
    },
    {
      "epoch": 2.430723530659877,
      "grad_norm": 0.37782371943778825,
      "learning_rate": 4.5139873765127725e-05,
      "loss": 1.6905,
      "num_input_tokens_seen": 18026378640,
      "step": 22912
    },
    {
      "epoch": 2.4308296201994484,
      "grad_norm": 0.38547243683443083,
      "learning_rate": 4.513946201147119e-05,
      "loss": 1.6759,
      "num_input_tokens_seen": 18027165456,
      "step": 22913
    },
    {
      "epoch": 2.43093570973902,
      "grad_norm": 0.4415868331233054,
      "learning_rate": 4.5139050242251456e-05,
      "loss": 1.5231,
      "num_input_tokens_seen": 18027952192,
      "step": 22914
    },
    {
      "epoch": 2.4310417992785913,
      "grad_norm": 0.5953747246712477,
      "learning_rate": 4.513863845746886e-05,
      "loss": 1.501,
      "num_input_tokens_seen": 18028738944,
      "step": 22915
    },
    {
      "epoch": 2.4311478888181624,
      "grad_norm": 0.39776733741646,
      "learning_rate": 4.5138226657123714e-05,
      "loss": 1.6038,
      "num_input_tokens_seen": 18029525728,
      "step": 22916
    },
    {
      "epoch": 2.431253978357734,
      "grad_norm": 0.5224576612610772,
      "learning_rate": 4.513781484121634e-05,
      "loss": 1.7847,
      "num_input_tokens_seen": 18030312432,
      "step": 22917
    },
    {
      "epoch": 2.4313600678973053,
      "grad_norm": 0.4467102122549648,
      "learning_rate": 4.513740300974706e-05,
      "loss": 1.6351,
      "num_input_tokens_seen": 18031099216,
      "step": 22918
    },
    {
      "epoch": 2.4314661574368768,
      "grad_norm": 0.4901573974913858,
      "learning_rate": 4.5136991162716175e-05,
      "loss": 1.4654,
      "num_input_tokens_seen": 18031886080,
      "step": 22919
    },
    {
      "epoch": 2.4315722469764482,
      "grad_norm": 0.6133885868732972,
      "learning_rate": 4.5136579300124014e-05,
      "loss": 1.6679,
      "num_input_tokens_seen": 18032672816,
      "step": 22920
    },
    {
      "epoch": 2.4316783365160193,
      "grad_norm": 0.5022758079373253,
      "learning_rate": 4.5136167421970896e-05,
      "loss": 1.6114,
      "num_input_tokens_seen": 18033459584,
      "step": 22921
    },
    {
      "epoch": 2.4317844260555908,
      "grad_norm": 0.48671000217713445,
      "learning_rate": 4.5135755528257145e-05,
      "loss": 1.5442,
      "num_input_tokens_seen": 18034246432,
      "step": 22922
    },
    {
      "epoch": 2.4318905155951622,
      "grad_norm": 0.38855863959255293,
      "learning_rate": 4.5135343618983074e-05,
      "loss": 1.6363,
      "num_input_tokens_seen": 18035033184,
      "step": 22923
    },
    {
      "epoch": 2.4319966051347337,
      "grad_norm": 0.376549160320004,
      "learning_rate": 4.5134931694148994e-05,
      "loss": 1.505,
      "num_input_tokens_seen": 18035820032,
      "step": 22924
    },
    {
      "epoch": 2.432102694674305,
      "grad_norm": 0.5081287613504393,
      "learning_rate": 4.513451975375523e-05,
      "loss": 1.669,
      "num_input_tokens_seen": 18036606848,
      "step": 22925
    },
    {
      "epoch": 2.4322087842138767,
      "grad_norm": 0.40218664138772364,
      "learning_rate": 4.51341077978021e-05,
      "loss": 1.4751,
      "num_input_tokens_seen": 18037393632,
      "step": 22926
    },
    {
      "epoch": 2.432314873753448,
      "grad_norm": 0.5321789438190085,
      "learning_rate": 4.513369582628992e-05,
      "loss": 1.6604,
      "num_input_tokens_seen": 18038180464,
      "step": 22927
    },
    {
      "epoch": 2.432420963293019,
      "grad_norm": 0.8983751247498794,
      "learning_rate": 4.513328383921902e-05,
      "loss": 1.6452,
      "num_input_tokens_seen": 18038967136,
      "step": 22928
    },
    {
      "epoch": 2.4325270528325906,
      "grad_norm": 0.38698289180050904,
      "learning_rate": 4.51328718365897e-05,
      "loss": 1.6393,
      "num_input_tokens_seen": 18039753952,
      "step": 22929
    },
    {
      "epoch": 2.432633142372162,
      "grad_norm": 0.4235644495801996,
      "learning_rate": 4.5132459818402295e-05,
      "loss": 1.5188,
      "num_input_tokens_seen": 18040540752,
      "step": 22930
    },
    {
      "epoch": 2.4327392319117336,
      "grad_norm": 0.566628446642153,
      "learning_rate": 4.5132047784657105e-05,
      "loss": 1.6224,
      "num_input_tokens_seen": 18041327504,
      "step": 22931
    },
    {
      "epoch": 2.432845321451305,
      "grad_norm": 0.5568195512792353,
      "learning_rate": 4.5131635735354475e-05,
      "loss": 1.666,
      "num_input_tokens_seen": 18042114224,
      "step": 22932
    },
    {
      "epoch": 2.432951410990876,
      "grad_norm": 0.38695421307397493,
      "learning_rate": 4.5131223670494695e-05,
      "loss": 1.5691,
      "num_input_tokens_seen": 18042901088,
      "step": 22933
    },
    {
      "epoch": 2.4330575005304476,
      "grad_norm": 0.7201037779341771,
      "learning_rate": 4.513081159007809e-05,
      "loss": 1.6186,
      "num_input_tokens_seen": 18043687808,
      "step": 22934
    },
    {
      "epoch": 2.433163590070019,
      "grad_norm": 0.4712135981661204,
      "learning_rate": 4.5130399494105e-05,
      "loss": 1.6572,
      "num_input_tokens_seen": 18044474464,
      "step": 22935
    },
    {
      "epoch": 2.4332696796095905,
      "grad_norm": 0.44389181987981474,
      "learning_rate": 4.512998738257572e-05,
      "loss": 1.7053,
      "num_input_tokens_seen": 18045261296,
      "step": 22936
    },
    {
      "epoch": 2.433375769149162,
      "grad_norm": 0.47485072650344695,
      "learning_rate": 4.5129575255490576e-05,
      "loss": 1.629,
      "num_input_tokens_seen": 18046048032,
      "step": 22937
    },
    {
      "epoch": 2.4334818586887335,
      "grad_norm": 0.43140769731390977,
      "learning_rate": 4.5129163112849895e-05,
      "loss": 1.5991,
      "num_input_tokens_seen": 18046834704,
      "step": 22938
    },
    {
      "epoch": 2.433587948228305,
      "grad_norm": 0.3798415225045877,
      "learning_rate": 4.5128750954653976e-05,
      "loss": 1.5672,
      "num_input_tokens_seen": 18047621520,
      "step": 22939
    },
    {
      "epoch": 2.433694037767876,
      "grad_norm": 0.4161623067978667,
      "learning_rate": 4.512833878090316e-05,
      "loss": 1.5906,
      "num_input_tokens_seen": 18048408384,
      "step": 22940
    },
    {
      "epoch": 2.4338001273074474,
      "grad_norm": 0.4215338460113,
      "learning_rate": 4.5127926591597744e-05,
      "loss": 1.5244,
      "num_input_tokens_seen": 18049195168,
      "step": 22941
    },
    {
      "epoch": 2.433906216847019,
      "grad_norm": 0.4210348004385118,
      "learning_rate": 4.5127514386738055e-05,
      "loss": 1.6224,
      "num_input_tokens_seen": 18049981904,
      "step": 22942
    },
    {
      "epoch": 2.4340123063865904,
      "grad_norm": 0.33069400054589715,
      "learning_rate": 4.512710216632442e-05,
      "loss": 1.5003,
      "num_input_tokens_seen": 18050768720,
      "step": 22943
    },
    {
      "epoch": 2.434118395926162,
      "grad_norm": 0.356766861335554,
      "learning_rate": 4.5126689930357156e-05,
      "loss": 1.5724,
      "num_input_tokens_seen": 18051555440,
      "step": 22944
    },
    {
      "epoch": 2.434224485465733,
      "grad_norm": 0.383424649957662,
      "learning_rate": 4.512627767883657e-05,
      "loss": 1.6676,
      "num_input_tokens_seen": 18052342256,
      "step": 22945
    },
    {
      "epoch": 2.4343305750053044,
      "grad_norm": 0.34027396280208627,
      "learning_rate": 4.512586541176299e-05,
      "loss": 1.5761,
      "num_input_tokens_seen": 18053129104,
      "step": 22946
    },
    {
      "epoch": 2.434436664544876,
      "grad_norm": 0.4164373457012283,
      "learning_rate": 4.512545312913673e-05,
      "loss": 1.4456,
      "num_input_tokens_seen": 18053915936,
      "step": 22947
    },
    {
      "epoch": 2.4345427540844473,
      "grad_norm": 0.40839655235270134,
      "learning_rate": 4.512504083095811e-05,
      "loss": 1.6156,
      "num_input_tokens_seen": 18054702688,
      "step": 22948
    },
    {
      "epoch": 2.434648843624019,
      "grad_norm": 0.39114016348640174,
      "learning_rate": 4.512462851722745e-05,
      "loss": 1.6596,
      "num_input_tokens_seen": 18055489424,
      "step": 22949
    },
    {
      "epoch": 2.4347549331635903,
      "grad_norm": 0.3860200245463859,
      "learning_rate": 4.5124216187945065e-05,
      "loss": 1.7439,
      "num_input_tokens_seen": 18056276176,
      "step": 22950
    },
    {
      "epoch": 2.4348610227031613,
      "grad_norm": 0.40131206708540507,
      "learning_rate": 4.512380384311128e-05,
      "loss": 1.4693,
      "num_input_tokens_seen": 18057062912,
      "step": 22951
    },
    {
      "epoch": 2.4349671122427328,
      "grad_norm": 0.41623738964602885,
      "learning_rate": 4.5123391482726405e-05,
      "loss": 1.5581,
      "num_input_tokens_seen": 18057849696,
      "step": 22952
    },
    {
      "epoch": 2.4350732017823042,
      "grad_norm": 0.42641189037353916,
      "learning_rate": 4.512297910679077e-05,
      "loss": 1.517,
      "num_input_tokens_seen": 18058636480,
      "step": 22953
    },
    {
      "epoch": 2.4351792913218757,
      "grad_norm": 0.4743679907811603,
      "learning_rate": 4.512256671530468e-05,
      "loss": 1.6446,
      "num_input_tokens_seen": 18059423184,
      "step": 22954
    },
    {
      "epoch": 2.435285380861447,
      "grad_norm": 0.4416547636457756,
      "learning_rate": 4.512215430826847e-05,
      "loss": 1.5898,
      "num_input_tokens_seen": 18060210016,
      "step": 22955
    },
    {
      "epoch": 2.4353914704010187,
      "grad_norm": 0.38243560799996307,
      "learning_rate": 4.512174188568244e-05,
      "loss": 1.6891,
      "num_input_tokens_seen": 18060996800,
      "step": 22956
    },
    {
      "epoch": 2.4354975599405897,
      "grad_norm": 0.383860562142953,
      "learning_rate": 4.5121329447546924e-05,
      "loss": 1.6452,
      "num_input_tokens_seen": 18061783472,
      "step": 22957
    },
    {
      "epoch": 2.435603649480161,
      "grad_norm": 0.38005037264127933,
      "learning_rate": 4.512091699386223e-05,
      "loss": 1.5126,
      "num_input_tokens_seen": 18062570304,
      "step": 22958
    },
    {
      "epoch": 2.4357097390197326,
      "grad_norm": 0.37416593596263203,
      "learning_rate": 4.512050452462869e-05,
      "loss": 1.5797,
      "num_input_tokens_seen": 18063357088,
      "step": 22959
    },
    {
      "epoch": 2.435815828559304,
      "grad_norm": 0.39435871987415616,
      "learning_rate": 4.5120092039846605e-05,
      "loss": 1.66,
      "num_input_tokens_seen": 18064143904,
      "step": 22960
    },
    {
      "epoch": 2.4359219180988756,
      "grad_norm": 0.38893404131257053,
      "learning_rate": 4.511967953951631e-05,
      "loss": 1.6264,
      "num_input_tokens_seen": 18064930688,
      "step": 22961
    },
    {
      "epoch": 2.4360280076384466,
      "grad_norm": 0.36331805246982996,
      "learning_rate": 4.511926702363811e-05,
      "loss": 1.493,
      "num_input_tokens_seen": 18065717408,
      "step": 22962
    },
    {
      "epoch": 2.436134097178018,
      "grad_norm": 0.4096024991332535,
      "learning_rate": 4.511885449221234e-05,
      "loss": 1.7212,
      "num_input_tokens_seen": 18066504192,
      "step": 22963
    },
    {
      "epoch": 2.4362401867175896,
      "grad_norm": 0.3426214446625709,
      "learning_rate": 4.5118441945239306e-05,
      "loss": 1.5526,
      "num_input_tokens_seen": 18067290960,
      "step": 22964
    },
    {
      "epoch": 2.436346276257161,
      "grad_norm": 0.38166205595611447,
      "learning_rate": 4.511802938271933e-05,
      "loss": 1.627,
      "num_input_tokens_seen": 18068077648,
      "step": 22965
    },
    {
      "epoch": 2.4364523657967325,
      "grad_norm": 0.37551065407305856,
      "learning_rate": 4.511761680465273e-05,
      "loss": 1.6789,
      "num_input_tokens_seen": 18068864400,
      "step": 22966
    },
    {
      "epoch": 2.436558455336304,
      "grad_norm": 0.3716418637178015,
      "learning_rate": 4.511720421103983e-05,
      "loss": 1.5763,
      "num_input_tokens_seen": 18069651136,
      "step": 22967
    },
    {
      "epoch": 2.4366645448758755,
      "grad_norm": 0.3398373048914045,
      "learning_rate": 4.5116791601880935e-05,
      "loss": 1.5315,
      "num_input_tokens_seen": 18070437984,
      "step": 22968
    },
    {
      "epoch": 2.4367706344154465,
      "grad_norm": 0.3737699916118788,
      "learning_rate": 4.511637897717639e-05,
      "loss": 1.5399,
      "num_input_tokens_seen": 18071224928,
      "step": 22969
    },
    {
      "epoch": 2.436876723955018,
      "grad_norm": 0.346035474148737,
      "learning_rate": 4.5115966336926484e-05,
      "loss": 1.6272,
      "num_input_tokens_seen": 18072011680,
      "step": 22970
    },
    {
      "epoch": 2.4369828134945895,
      "grad_norm": 0.40370554239600975,
      "learning_rate": 4.511555368113155e-05,
      "loss": 1.6141,
      "num_input_tokens_seen": 18072798448,
      "step": 22971
    },
    {
      "epoch": 2.437088903034161,
      "grad_norm": 0.3711352903334253,
      "learning_rate": 4.5115141009791914e-05,
      "loss": 1.6007,
      "num_input_tokens_seen": 18073585200,
      "step": 22972
    },
    {
      "epoch": 2.4371949925737324,
      "grad_norm": 0.4296821265699971,
      "learning_rate": 4.5114728322907886e-05,
      "loss": 1.6222,
      "num_input_tokens_seen": 18074372000,
      "step": 22973
    },
    {
      "epoch": 2.4373010821133034,
      "grad_norm": 0.3752743414051251,
      "learning_rate": 4.511431562047977e-05,
      "loss": 1.5477,
      "num_input_tokens_seen": 18075158768,
      "step": 22974
    },
    {
      "epoch": 2.437407171652875,
      "grad_norm": 0.37930530791995287,
      "learning_rate": 4.511390290250792e-05,
      "loss": 1.6176,
      "num_input_tokens_seen": 18075945568,
      "step": 22975
    },
    {
      "epoch": 2.4375132611924464,
      "grad_norm": 0.4044608911931574,
      "learning_rate": 4.5113490168992635e-05,
      "loss": 1.6935,
      "num_input_tokens_seen": 18076732336,
      "step": 22976
    },
    {
      "epoch": 2.437619350732018,
      "grad_norm": 0.4357910439440705,
      "learning_rate": 4.5113077419934226e-05,
      "loss": 1.6853,
      "num_input_tokens_seen": 18077519088,
      "step": 22977
    },
    {
      "epoch": 2.4377254402715893,
      "grad_norm": 0.4241812388790001,
      "learning_rate": 4.511266465533303e-05,
      "loss": 1.5481,
      "num_input_tokens_seen": 18078305840,
      "step": 22978
    },
    {
      "epoch": 2.437831529811161,
      "grad_norm": 0.34540815066381814,
      "learning_rate": 4.511225187518935e-05,
      "loss": 1.5331,
      "num_input_tokens_seen": 18079092592,
      "step": 22979
    },
    {
      "epoch": 2.437937619350732,
      "grad_norm": 0.3743852431673096,
      "learning_rate": 4.511183907950351e-05,
      "loss": 1.6314,
      "num_input_tokens_seen": 18079879312,
      "step": 22980
    },
    {
      "epoch": 2.4380437088903033,
      "grad_norm": 0.4219176280935292,
      "learning_rate": 4.5111426268275834e-05,
      "loss": 1.6665,
      "num_input_tokens_seen": 18080666096,
      "step": 22981
    },
    {
      "epoch": 2.438149798429875,
      "grad_norm": 0.372395553919466,
      "learning_rate": 4.5111013441506645e-05,
      "loss": 1.5517,
      "num_input_tokens_seen": 18081452816,
      "step": 22982
    },
    {
      "epoch": 2.4382558879694463,
      "grad_norm": 0.4161909454954196,
      "learning_rate": 4.5110600599196245e-05,
      "loss": 1.6695,
      "num_input_tokens_seen": 18082239552,
      "step": 22983
    },
    {
      "epoch": 2.4383619775090177,
      "grad_norm": 0.415530820397536,
      "learning_rate": 4.5110187741344965e-05,
      "loss": 1.728,
      "num_input_tokens_seen": 18083026352,
      "step": 22984
    },
    {
      "epoch": 2.438468067048589,
      "grad_norm": 0.37345136809760904,
      "learning_rate": 4.5109774867953125e-05,
      "loss": 1.6642,
      "num_input_tokens_seen": 18083813088,
      "step": 22985
    },
    {
      "epoch": 2.4385741565881602,
      "grad_norm": 0.41578102333350997,
      "learning_rate": 4.510936197902104e-05,
      "loss": 1.6551,
      "num_input_tokens_seen": 18084599776,
      "step": 22986
    },
    {
      "epoch": 2.4386802461277317,
      "grad_norm": 0.41449542448392046,
      "learning_rate": 4.5108949074549035e-05,
      "loss": 1.417,
      "num_input_tokens_seen": 18085386512,
      "step": 22987
    },
    {
      "epoch": 2.438786335667303,
      "grad_norm": 0.4449001695314187,
      "learning_rate": 4.5108536154537416e-05,
      "loss": 1.5978,
      "num_input_tokens_seen": 18086173296,
      "step": 22988
    },
    {
      "epoch": 2.4388924252068747,
      "grad_norm": 0.49380238664075443,
      "learning_rate": 4.510812321898651e-05,
      "loss": 1.5807,
      "num_input_tokens_seen": 18086960080,
      "step": 22989
    },
    {
      "epoch": 2.438998514746446,
      "grad_norm": 0.43993088732403485,
      "learning_rate": 4.510771026789664e-05,
      "loss": 1.743,
      "num_input_tokens_seen": 18087746864,
      "step": 22990
    },
    {
      "epoch": 2.439104604286017,
      "grad_norm": 0.4371534187836455,
      "learning_rate": 4.5107297301268124e-05,
      "loss": 1.58,
      "num_input_tokens_seen": 18088533664,
      "step": 22991
    },
    {
      "epoch": 2.4392106938255886,
      "grad_norm": 0.46688433560553966,
      "learning_rate": 4.5106884319101275e-05,
      "loss": 1.6961,
      "num_input_tokens_seen": 18089320528,
      "step": 22992
    },
    {
      "epoch": 2.43931678336516,
      "grad_norm": 0.36620128038478583,
      "learning_rate": 4.510647132139641e-05,
      "loss": 1.5365,
      "num_input_tokens_seen": 18090107328,
      "step": 22993
    },
    {
      "epoch": 2.4394228729047316,
      "grad_norm": 0.4296338639517767,
      "learning_rate": 4.510605830815386e-05,
      "loss": 1.6386,
      "num_input_tokens_seen": 18090894080,
      "step": 22994
    },
    {
      "epoch": 2.439528962444303,
      "grad_norm": 0.3684525437290455,
      "learning_rate": 4.510564527937394e-05,
      "loss": 1.6127,
      "num_input_tokens_seen": 18091680880,
      "step": 22995
    },
    {
      "epoch": 2.4396350519838745,
      "grad_norm": 0.39875278383094465,
      "learning_rate": 4.510523223505697e-05,
      "loss": 1.6508,
      "num_input_tokens_seen": 18092467696,
      "step": 22996
    },
    {
      "epoch": 2.439741141523446,
      "grad_norm": 0.4160624618750858,
      "learning_rate": 4.5104819175203264e-05,
      "loss": 1.5991,
      "num_input_tokens_seen": 18093254464,
      "step": 22997
    },
    {
      "epoch": 2.439847231063017,
      "grad_norm": 0.38479516051395163,
      "learning_rate": 4.5104406099813134e-05,
      "loss": 1.6033,
      "num_input_tokens_seen": 18094041232,
      "step": 22998
    },
    {
      "epoch": 2.4399533206025885,
      "grad_norm": 0.37600412518917475,
      "learning_rate": 4.510399300888692e-05,
      "loss": 1.4631,
      "num_input_tokens_seen": 18094828032,
      "step": 22999
    },
    {
      "epoch": 2.44005941014216,
      "grad_norm": 0.6949489924809317,
      "learning_rate": 4.510357990242493e-05,
      "loss": 1.6075,
      "num_input_tokens_seen": 18095614784,
      "step": 23000
    },
    {
      "epoch": 2.44005941014216,
      "eval_loss": 1.6774816513061523,
      "eval_runtime": 64.7342,
      "eval_samples_per_second": 46.343,
      "eval_steps_per_second": 0.494,
      "num_input_tokens_seen": 18095614784,
      "step": 23000
    },
    {
      "epoch": 2.4401654996817315,
      "grad_norm": 0.48123606791187096,
      "learning_rate": 4.510316678042747e-05,
      "loss": 1.5911,
      "num_input_tokens_seen": 18096401456,
      "step": 23001
    },
    {
      "epoch": 2.440271589221303,
      "grad_norm": 0.7208257857380811,
      "learning_rate": 4.510275364289489e-05,
      "loss": 1.5409,
      "num_input_tokens_seen": 18097188192,
      "step": 23002
    },
    {
      "epoch": 2.440377678760874,
      "grad_norm": 0.5480604739787652,
      "learning_rate": 4.510234048982749e-05,
      "loss": 1.5046,
      "num_input_tokens_seen": 18097974928,
      "step": 23003
    },
    {
      "epoch": 2.4404837683004454,
      "grad_norm": 0.48154176608313315,
      "learning_rate": 4.510192732122558e-05,
      "loss": 1.484,
      "num_input_tokens_seen": 18098761824,
      "step": 23004
    },
    {
      "epoch": 2.440589857840017,
      "grad_norm": 0.8589436404833755,
      "learning_rate": 4.51015141370895e-05,
      "loss": 1.573,
      "num_input_tokens_seen": 18099548640,
      "step": 23005
    },
    {
      "epoch": 2.4406959473795884,
      "grad_norm": 0.44900597904175904,
      "learning_rate": 4.510110093741955e-05,
      "loss": 1.5482,
      "num_input_tokens_seen": 18100335344,
      "step": 23006
    },
    {
      "epoch": 2.44080203691916,
      "grad_norm": 0.6521165153688117,
      "learning_rate": 4.510068772221607e-05,
      "loss": 1.5888,
      "num_input_tokens_seen": 18101122112,
      "step": 23007
    },
    {
      "epoch": 2.4409081264587313,
      "grad_norm": 0.5707762743795233,
      "learning_rate": 4.510027449147936e-05,
      "loss": 1.5487,
      "num_input_tokens_seen": 18101908912,
      "step": 23008
    },
    {
      "epoch": 2.441014215998303,
      "grad_norm": 0.7443704083651109,
      "learning_rate": 4.509986124520975e-05,
      "loss": 1.6668,
      "num_input_tokens_seen": 18102695648,
      "step": 23009
    },
    {
      "epoch": 2.441120305537874,
      "grad_norm": 0.4186914652829457,
      "learning_rate": 4.509944798340756e-05,
      "loss": 1.6866,
      "num_input_tokens_seen": 18103482432,
      "step": 23010
    },
    {
      "epoch": 2.4412263950774453,
      "grad_norm": 0.44224811661681235,
      "learning_rate": 4.50990347060731e-05,
      "loss": 1.5175,
      "num_input_tokens_seen": 18104269328,
      "step": 23011
    },
    {
      "epoch": 2.441332484617017,
      "grad_norm": 0.4815073413176309,
      "learning_rate": 4.50986214132067e-05,
      "loss": 1.6284,
      "num_input_tokens_seen": 18105056096,
      "step": 23012
    },
    {
      "epoch": 2.4414385741565883,
      "grad_norm": 0.40815407456702674,
      "learning_rate": 4.509820810480868e-05,
      "loss": 1.6298,
      "num_input_tokens_seen": 18105842800,
      "step": 23013
    },
    {
      "epoch": 2.4415446636961597,
      "grad_norm": 0.4819094702162887,
      "learning_rate": 4.5097794780879346e-05,
      "loss": 1.5755,
      "num_input_tokens_seen": 18106629584,
      "step": 23014
    },
    {
      "epoch": 2.4416507532357308,
      "grad_norm": 0.3928638543354111,
      "learning_rate": 4.509738144141903e-05,
      "loss": 1.5708,
      "num_input_tokens_seen": 18107416448,
      "step": 23015
    },
    {
      "epoch": 2.4417568427753022,
      "grad_norm": 0.5635620887351364,
      "learning_rate": 4.509696808642805e-05,
      "loss": 1.5624,
      "num_input_tokens_seen": 18108203232,
      "step": 23016
    },
    {
      "epoch": 2.4418629323148737,
      "grad_norm": 0.36721838810469926,
      "learning_rate": 4.5096554715906716e-05,
      "loss": 1.513,
      "num_input_tokens_seen": 18108990016,
      "step": 23017
    },
    {
      "epoch": 2.441969021854445,
      "grad_norm": 0.4974667464548301,
      "learning_rate": 4.5096141329855354e-05,
      "loss": 1.6771,
      "num_input_tokens_seen": 18109776768,
      "step": 23018
    },
    {
      "epoch": 2.4420751113940167,
      "grad_norm": 0.4040911179678707,
      "learning_rate": 4.509572792827429e-05,
      "loss": 1.5186,
      "num_input_tokens_seen": 18110563520,
      "step": 23019
    },
    {
      "epoch": 2.4421812009335877,
      "grad_norm": 0.5654929413332204,
      "learning_rate": 4.509531451116383e-05,
      "loss": 1.6957,
      "num_input_tokens_seen": 18111350208,
      "step": 23020
    },
    {
      "epoch": 2.442287290473159,
      "grad_norm": 0.41033402709866074,
      "learning_rate": 4.509490107852431e-05,
      "loss": 1.6253,
      "num_input_tokens_seen": 18112136976,
      "step": 23021
    },
    {
      "epoch": 2.4423933800127307,
      "grad_norm": 0.3552661888940143,
      "learning_rate": 4.509448763035603e-05,
      "loss": 1.5124,
      "num_input_tokens_seen": 18112923760,
      "step": 23022
    },
    {
      "epoch": 2.442499469552302,
      "grad_norm": 0.49422722224221044,
      "learning_rate": 4.509407416665933e-05,
      "loss": 1.5669,
      "num_input_tokens_seen": 18113710576,
      "step": 23023
    },
    {
      "epoch": 2.4426055590918736,
      "grad_norm": 0.4507332526248197,
      "learning_rate": 4.5093660687434514e-05,
      "loss": 1.7022,
      "num_input_tokens_seen": 18114497264,
      "step": 23024
    },
    {
      "epoch": 2.442711648631445,
      "grad_norm": 0.40270574104201395,
      "learning_rate": 4.50932471926819e-05,
      "loss": 1.6702,
      "num_input_tokens_seen": 18115284000,
      "step": 23025
    },
    {
      "epoch": 2.4428177381710166,
      "grad_norm": 0.4167697854602913,
      "learning_rate": 4.509283368240183e-05,
      "loss": 1.6111,
      "num_input_tokens_seen": 18116070816,
      "step": 23026
    },
    {
      "epoch": 2.4429238277105876,
      "grad_norm": 0.3601259413921459,
      "learning_rate": 4.5092420156594596e-05,
      "loss": 1.5191,
      "num_input_tokens_seen": 18116857664,
      "step": 23027
    },
    {
      "epoch": 2.443029917250159,
      "grad_norm": 0.38101884313222306,
      "learning_rate": 4.509200661526053e-05,
      "loss": 1.5613,
      "num_input_tokens_seen": 18117644480,
      "step": 23028
    },
    {
      "epoch": 2.4431360067897305,
      "grad_norm": 0.33525940558562334,
      "learning_rate": 4.509159305839995e-05,
      "loss": 1.5882,
      "num_input_tokens_seen": 18118431184,
      "step": 23029
    },
    {
      "epoch": 2.443242096329302,
      "grad_norm": 0.35382737534104625,
      "learning_rate": 4.509117948601318e-05,
      "loss": 1.6451,
      "num_input_tokens_seen": 18119217872,
      "step": 23030
    },
    {
      "epoch": 2.4433481858688735,
      "grad_norm": 0.36640239738710323,
      "learning_rate": 4.5090765898100526e-05,
      "loss": 1.6172,
      "num_input_tokens_seen": 18120004672,
      "step": 23031
    },
    {
      "epoch": 2.4434542754084445,
      "grad_norm": 0.398907348992474,
      "learning_rate": 4.509035229466233e-05,
      "loss": 1.5933,
      "num_input_tokens_seen": 18120791440,
      "step": 23032
    },
    {
      "epoch": 2.443560364948016,
      "grad_norm": 0.3482567162505941,
      "learning_rate": 4.50899386756989e-05,
      "loss": 1.564,
      "num_input_tokens_seen": 18121578256,
      "step": 23033
    },
    {
      "epoch": 2.4436664544875875,
      "grad_norm": 0.436486166535445,
      "learning_rate": 4.508952504121054e-05,
      "loss": 1.5502,
      "num_input_tokens_seen": 18122365008,
      "step": 23034
    },
    {
      "epoch": 2.443772544027159,
      "grad_norm": 0.3522473317094721,
      "learning_rate": 4.5089111391197605e-05,
      "loss": 1.6044,
      "num_input_tokens_seen": 18123151760,
      "step": 23035
    },
    {
      "epoch": 2.4438786335667304,
      "grad_norm": 0.46446827554754366,
      "learning_rate": 4.5088697725660376e-05,
      "loss": 1.6307,
      "num_input_tokens_seen": 18123938448,
      "step": 23036
    },
    {
      "epoch": 2.443984723106302,
      "grad_norm": 0.3925702328674255,
      "learning_rate": 4.508828404459921e-05,
      "loss": 1.5884,
      "num_input_tokens_seen": 18124725264,
      "step": 23037
    },
    {
      "epoch": 2.4440908126458734,
      "grad_norm": 0.4287973932908205,
      "learning_rate": 4.5087870348014386e-05,
      "loss": 1.5688,
      "num_input_tokens_seen": 18125512032,
      "step": 23038
    },
    {
      "epoch": 2.4441969021854444,
      "grad_norm": 0.3654643528561922,
      "learning_rate": 4.5087456635906256e-05,
      "loss": 1.5889,
      "num_input_tokens_seen": 18126298784,
      "step": 23039
    },
    {
      "epoch": 2.444302991725016,
      "grad_norm": 0.43433649791189727,
      "learning_rate": 4.508704290827513e-05,
      "loss": 1.6054,
      "num_input_tokens_seen": 18127085536,
      "step": 23040
    },
    {
      "epoch": 2.4444090812645873,
      "grad_norm": 0.37162355749950565,
      "learning_rate": 4.5086629165121317e-05,
      "loss": 1.5571,
      "num_input_tokens_seen": 18127872272,
      "step": 23041
    },
    {
      "epoch": 2.444515170804159,
      "grad_norm": 0.39832653298132487,
      "learning_rate": 4.5086215406445165e-05,
      "loss": 1.6887,
      "num_input_tokens_seen": 18128659056,
      "step": 23042
    },
    {
      "epoch": 2.4446212603437303,
      "grad_norm": 0.39321720301114266,
      "learning_rate": 4.508580163224696e-05,
      "loss": 1.6159,
      "num_input_tokens_seen": 18129445760,
      "step": 23043
    },
    {
      "epoch": 2.4447273498833013,
      "grad_norm": 0.39502873443214187,
      "learning_rate": 4.5085387842527035e-05,
      "loss": 1.646,
      "num_input_tokens_seen": 18130232480,
      "step": 23044
    },
    {
      "epoch": 2.444833439422873,
      "grad_norm": 0.3607053024305562,
      "learning_rate": 4.508497403728572e-05,
      "loss": 1.5005,
      "num_input_tokens_seen": 18131019328,
      "step": 23045
    },
    {
      "epoch": 2.4449395289624443,
      "grad_norm": 0.40390415641311866,
      "learning_rate": 4.508456021652333e-05,
      "loss": 1.7005,
      "num_input_tokens_seen": 18131806000,
      "step": 23046
    },
    {
      "epoch": 2.4450456185020157,
      "grad_norm": 0.34272205661794614,
      "learning_rate": 4.5084146380240175e-05,
      "loss": 1.7316,
      "num_input_tokens_seen": 18132592784,
      "step": 23047
    },
    {
      "epoch": 2.445151708041587,
      "grad_norm": 0.39949485926545686,
      "learning_rate": 4.508373252843658e-05,
      "loss": 1.7004,
      "num_input_tokens_seen": 18133379520,
      "step": 23048
    },
    {
      "epoch": 2.4452577975811587,
      "grad_norm": 0.37036986509573255,
      "learning_rate": 4.508331866111287e-05,
      "loss": 1.559,
      "num_input_tokens_seen": 18134166368,
      "step": 23049
    },
    {
      "epoch": 2.4453638871207297,
      "grad_norm": 0.5229755102187112,
      "learning_rate": 4.5082904778269355e-05,
      "loss": 1.6704,
      "num_input_tokens_seen": 18134953120,
      "step": 23050
    },
    {
      "epoch": 2.445469976660301,
      "grad_norm": 0.39207500391114297,
      "learning_rate": 4.5082490879906364e-05,
      "loss": 1.6513,
      "num_input_tokens_seen": 18135739936,
      "step": 23051
    },
    {
      "epoch": 2.4455760661998727,
      "grad_norm": 0.3905434975586817,
      "learning_rate": 4.508207696602421e-05,
      "loss": 1.5547,
      "num_input_tokens_seen": 18136526704,
      "step": 23052
    },
    {
      "epoch": 2.445682155739444,
      "grad_norm": 0.42527448454219274,
      "learning_rate": 4.508166303662322e-05,
      "loss": 1.6694,
      "num_input_tokens_seen": 18137313456,
      "step": 23053
    },
    {
      "epoch": 2.4457882452790156,
      "grad_norm": 0.4788280844368374,
      "learning_rate": 4.508124909170371e-05,
      "loss": 1.6489,
      "num_input_tokens_seen": 18138100208,
      "step": 23054
    },
    {
      "epoch": 2.445894334818587,
      "grad_norm": 0.3749955629494848,
      "learning_rate": 4.5080835131265996e-05,
      "loss": 1.6292,
      "num_input_tokens_seen": 18138886992,
      "step": 23055
    },
    {
      "epoch": 2.446000424358158,
      "grad_norm": 0.38022191125772853,
      "learning_rate": 4.50804211553104e-05,
      "loss": 1.6595,
      "num_input_tokens_seen": 18139673760,
      "step": 23056
    },
    {
      "epoch": 2.4461065138977296,
      "grad_norm": 0.3707648567980073,
      "learning_rate": 4.5080007163837254e-05,
      "loss": 1.6242,
      "num_input_tokens_seen": 18140460432,
      "step": 23057
    },
    {
      "epoch": 2.446212603437301,
      "grad_norm": 0.4487119554409898,
      "learning_rate": 4.507959315684686e-05,
      "loss": 1.6827,
      "num_input_tokens_seen": 18141247072,
      "step": 23058
    },
    {
      "epoch": 2.4463186929768725,
      "grad_norm": 0.3741669851167884,
      "learning_rate": 4.507917913433955e-05,
      "loss": 1.4424,
      "num_input_tokens_seen": 18142033888,
      "step": 23059
    },
    {
      "epoch": 2.446424782516444,
      "grad_norm": 0.49175059443227154,
      "learning_rate": 4.507876509631563e-05,
      "loss": 1.6434,
      "num_input_tokens_seen": 18142820608,
      "step": 23060
    },
    {
      "epoch": 2.446530872056015,
      "grad_norm": 0.36994123381321115,
      "learning_rate": 4.5078351042775446e-05,
      "loss": 1.5026,
      "num_input_tokens_seen": 18143607472,
      "step": 23061
    },
    {
      "epoch": 2.4466369615955865,
      "grad_norm": 0.39625559951510153,
      "learning_rate": 4.507793697371929e-05,
      "loss": 1.4896,
      "num_input_tokens_seen": 18144394128,
      "step": 23062
    },
    {
      "epoch": 2.446743051135158,
      "grad_norm": 0.39963059789491057,
      "learning_rate": 4.50775228891475e-05,
      "loss": 1.5515,
      "num_input_tokens_seen": 18145180976,
      "step": 23063
    },
    {
      "epoch": 2.4468491406747295,
      "grad_norm": 0.447088305479455,
      "learning_rate": 4.507710878906038e-05,
      "loss": 1.547,
      "num_input_tokens_seen": 18145967792,
      "step": 23064
    },
    {
      "epoch": 2.446955230214301,
      "grad_norm": 0.39795987203836053,
      "learning_rate": 4.507669467345826e-05,
      "loss": 1.6302,
      "num_input_tokens_seen": 18146754576,
      "step": 23065
    },
    {
      "epoch": 2.4470613197538724,
      "grad_norm": 0.3801788276117605,
      "learning_rate": 4.507628054234147e-05,
      "loss": 1.6127,
      "num_input_tokens_seen": 18147541360,
      "step": 23066
    },
    {
      "epoch": 2.447167409293444,
      "grad_norm": 0.39822417486401046,
      "learning_rate": 4.507586639571031e-05,
      "loss": 1.6997,
      "num_input_tokens_seen": 18148328192,
      "step": 23067
    },
    {
      "epoch": 2.447273498833015,
      "grad_norm": 0.44350193346161165,
      "learning_rate": 4.507545223356511e-05,
      "loss": 1.6544,
      "num_input_tokens_seen": 18149114896,
      "step": 23068
    },
    {
      "epoch": 2.4473795883725864,
      "grad_norm": 0.4556791417951049,
      "learning_rate": 4.5075038055906196e-05,
      "loss": 1.6422,
      "num_input_tokens_seen": 18149901616,
      "step": 23069
    },
    {
      "epoch": 2.447485677912158,
      "grad_norm": 0.4835326795408864,
      "learning_rate": 4.5074623862733875e-05,
      "loss": 1.6061,
      "num_input_tokens_seen": 18150688352,
      "step": 23070
    },
    {
      "epoch": 2.4475917674517293,
      "grad_norm": 0.4135080626735319,
      "learning_rate": 4.507420965404848e-05,
      "loss": 1.5741,
      "num_input_tokens_seen": 18151475088,
      "step": 23071
    },
    {
      "epoch": 2.447697856991301,
      "grad_norm": 0.44941535804906924,
      "learning_rate": 4.507379542985032e-05,
      "loss": 1.644,
      "num_input_tokens_seen": 18152261936,
      "step": 23072
    },
    {
      "epoch": 2.447803946530872,
      "grad_norm": 0.36015339978481814,
      "learning_rate": 4.5073381190139716e-05,
      "loss": 1.6545,
      "num_input_tokens_seen": 18153048688,
      "step": 23073
    },
    {
      "epoch": 2.4479100360704433,
      "grad_norm": 0.36523561288936657,
      "learning_rate": 4.5072966934917e-05,
      "loss": 1.6883,
      "num_input_tokens_seen": 18153835472,
      "step": 23074
    },
    {
      "epoch": 2.448016125610015,
      "grad_norm": 0.3879477485300224,
      "learning_rate": 4.507255266418248e-05,
      "loss": 1.5702,
      "num_input_tokens_seen": 18154622144,
      "step": 23075
    },
    {
      "epoch": 2.4481222151495863,
      "grad_norm": 0.3648655697470649,
      "learning_rate": 4.507213837793649e-05,
      "loss": 1.5266,
      "num_input_tokens_seen": 18155408960,
      "step": 23076
    },
    {
      "epoch": 2.4482283046891578,
      "grad_norm": 0.3938058530002024,
      "learning_rate": 4.507172407617932e-05,
      "loss": 1.5676,
      "num_input_tokens_seen": 18156195792,
      "step": 23077
    },
    {
      "epoch": 2.4483343942287292,
      "grad_norm": 0.4554722853596267,
      "learning_rate": 4.507130975891133e-05,
      "loss": 1.7105,
      "num_input_tokens_seen": 18156982544,
      "step": 23078
    },
    {
      "epoch": 2.4484404837683003,
      "grad_norm": 0.3549765304140234,
      "learning_rate": 4.507089542613281e-05,
      "loss": 1.5723,
      "num_input_tokens_seen": 18157769344,
      "step": 23079
    },
    {
      "epoch": 2.4485465733078717,
      "grad_norm": 0.4705567869759776,
      "learning_rate": 4.507048107784409e-05,
      "loss": 1.5862,
      "num_input_tokens_seen": 18158556032,
      "step": 23080
    },
    {
      "epoch": 2.448652662847443,
      "grad_norm": 0.4150364352188112,
      "learning_rate": 4.50700667140455e-05,
      "loss": 1.742,
      "num_input_tokens_seen": 18159342768,
      "step": 23081
    },
    {
      "epoch": 2.4487587523870147,
      "grad_norm": 0.4126190153627275,
      "learning_rate": 4.5069652334737346e-05,
      "loss": 1.5484,
      "num_input_tokens_seen": 18160129584,
      "step": 23082
    },
    {
      "epoch": 2.448864841926586,
      "grad_norm": 0.5252907632695517,
      "learning_rate": 4.5069237939919956e-05,
      "loss": 1.6278,
      "num_input_tokens_seen": 18160916384,
      "step": 23083
    },
    {
      "epoch": 2.4489709314661576,
      "grad_norm": 0.4771340841817924,
      "learning_rate": 4.506882352959364e-05,
      "loss": 1.602,
      "num_input_tokens_seen": 18161703136,
      "step": 23084
    },
    {
      "epoch": 2.4490770210057287,
      "grad_norm": 0.40631166790973083,
      "learning_rate": 4.506840910375873e-05,
      "loss": 1.5676,
      "num_input_tokens_seen": 18162489936,
      "step": 23085
    },
    {
      "epoch": 2.4491831105453,
      "grad_norm": 0.4663683010093429,
      "learning_rate": 4.506799466241555e-05,
      "loss": 1.5797,
      "num_input_tokens_seen": 18163276640,
      "step": 23086
    },
    {
      "epoch": 2.4492892000848716,
      "grad_norm": 0.4055795603929882,
      "learning_rate": 4.506758020556441e-05,
      "loss": 1.6515,
      "num_input_tokens_seen": 18164063408,
      "step": 23087
    },
    {
      "epoch": 2.449395289624443,
      "grad_norm": 0.4031321234131449,
      "learning_rate": 4.506716573320563e-05,
      "loss": 1.6099,
      "num_input_tokens_seen": 18164850160,
      "step": 23088
    },
    {
      "epoch": 2.4495013791640146,
      "grad_norm": 0.35628842020575324,
      "learning_rate": 4.5066751245339535e-05,
      "loss": 1.4799,
      "num_input_tokens_seen": 18165636944,
      "step": 23089
    },
    {
      "epoch": 2.4496074687035856,
      "grad_norm": 0.3874995066085752,
      "learning_rate": 4.5066336741966436e-05,
      "loss": 1.681,
      "num_input_tokens_seen": 18166423840,
      "step": 23090
    },
    {
      "epoch": 2.449713558243157,
      "grad_norm": 0.4602769829135167,
      "learning_rate": 4.5065922223086664e-05,
      "loss": 1.7925,
      "num_input_tokens_seen": 18167210592,
      "step": 23091
    },
    {
      "epoch": 2.4498196477827285,
      "grad_norm": 0.46568664507755725,
      "learning_rate": 4.5065507688700544e-05,
      "loss": 1.588,
      "num_input_tokens_seen": 18167997328,
      "step": 23092
    },
    {
      "epoch": 2.4499257373223,
      "grad_norm": 0.5389913747507592,
      "learning_rate": 4.5065093138808375e-05,
      "loss": 1.5915,
      "num_input_tokens_seen": 18168784064,
      "step": 23093
    },
    {
      "epoch": 2.4500318268618715,
      "grad_norm": 0.4278986197755285,
      "learning_rate": 4.50646785734105e-05,
      "loss": 1.616,
      "num_input_tokens_seen": 18169570832,
      "step": 23094
    },
    {
      "epoch": 2.450137916401443,
      "grad_norm": 0.48989218786275446,
      "learning_rate": 4.506426399250723e-05,
      "loss": 1.6345,
      "num_input_tokens_seen": 18170357584,
      "step": 23095
    },
    {
      "epoch": 2.4502440059410144,
      "grad_norm": 0.38292021714153873,
      "learning_rate": 4.506384939609889e-05,
      "loss": 1.613,
      "num_input_tokens_seen": 18171144336,
      "step": 23096
    },
    {
      "epoch": 2.4503500954805855,
      "grad_norm": 0.47627610294683914,
      "learning_rate": 4.5063434784185785e-05,
      "loss": 1.6546,
      "num_input_tokens_seen": 18171931040,
      "step": 23097
    },
    {
      "epoch": 2.450456185020157,
      "grad_norm": 0.45703598976086945,
      "learning_rate": 4.5063020156768255e-05,
      "loss": 1.5714,
      "num_input_tokens_seen": 18172717680,
      "step": 23098
    },
    {
      "epoch": 2.4505622745597284,
      "grad_norm": 0.4328021159230061,
      "learning_rate": 4.50626055138466e-05,
      "loss": 1.5177,
      "num_input_tokens_seen": 18173504384,
      "step": 23099
    },
    {
      "epoch": 2.4506683640993,
      "grad_norm": 0.46117724254019254,
      "learning_rate": 4.506219085542116e-05,
      "loss": 1.5248,
      "num_input_tokens_seen": 18174291136,
      "step": 23100
    },
    {
      "epoch": 2.4507744536388714,
      "grad_norm": 0.3780858027560958,
      "learning_rate": 4.5061776181492256e-05,
      "loss": 1.6319,
      "num_input_tokens_seen": 18175077920,
      "step": 23101
    },
    {
      "epoch": 2.4508805431784424,
      "grad_norm": 0.4966326429958352,
      "learning_rate": 4.506136149206019e-05,
      "loss": 1.5581,
      "num_input_tokens_seen": 18175864672,
      "step": 23102
    },
    {
      "epoch": 2.450986632718014,
      "grad_norm": 0.36843256582527467,
      "learning_rate": 4.506094678712529e-05,
      "loss": 1.6384,
      "num_input_tokens_seen": 18176651408,
      "step": 23103
    },
    {
      "epoch": 2.4510927222575853,
      "grad_norm": 0.3888345463321523,
      "learning_rate": 4.506053206668788e-05,
      "loss": 1.5796,
      "num_input_tokens_seen": 18177438176,
      "step": 23104
    },
    {
      "epoch": 2.451198811797157,
      "grad_norm": 0.40126112939422887,
      "learning_rate": 4.5060117330748286e-05,
      "loss": 1.6054,
      "num_input_tokens_seen": 18178224944,
      "step": 23105
    },
    {
      "epoch": 2.4513049013367283,
      "grad_norm": 0.33691208850697635,
      "learning_rate": 4.5059702579306816e-05,
      "loss": 1.4975,
      "num_input_tokens_seen": 18179011696,
      "step": 23106
    },
    {
      "epoch": 2.4514109908762998,
      "grad_norm": 0.38498424230335,
      "learning_rate": 4.50592878123638e-05,
      "loss": 1.5716,
      "num_input_tokens_seen": 18179798352,
      "step": 23107
    },
    {
      "epoch": 2.4515170804158712,
      "grad_norm": 0.40196975095701326,
      "learning_rate": 4.505887302991956e-05,
      "loss": 1.6642,
      "num_input_tokens_seen": 18180585056,
      "step": 23108
    },
    {
      "epoch": 2.4516231699554423,
      "grad_norm": 0.340126026572612,
      "learning_rate": 4.50584582319744e-05,
      "loss": 1.5085,
      "num_input_tokens_seen": 18181371792,
      "step": 23109
    },
    {
      "epoch": 2.4517292594950137,
      "grad_norm": 0.4907930196669639,
      "learning_rate": 4.505804341852866e-05,
      "loss": 1.6535,
      "num_input_tokens_seen": 18182158608,
      "step": 23110
    },
    {
      "epoch": 2.451835349034585,
      "grad_norm": 0.39745422692832516,
      "learning_rate": 4.505762858958265e-05,
      "loss": 1.6636,
      "num_input_tokens_seen": 18182945280,
      "step": 23111
    },
    {
      "epoch": 2.4519414385741567,
      "grad_norm": 0.41607344498973226,
      "learning_rate": 4.505721374513669e-05,
      "loss": 1.6863,
      "num_input_tokens_seen": 18183732080,
      "step": 23112
    },
    {
      "epoch": 2.452047528113728,
      "grad_norm": 0.4820901527476731,
      "learning_rate": 4.505679888519111e-05,
      "loss": 1.6831,
      "num_input_tokens_seen": 18184518880,
      "step": 23113
    },
    {
      "epoch": 2.452153617653299,
      "grad_norm": 0.3863444804612247,
      "learning_rate": 4.505638400974622e-05,
      "loss": 1.5778,
      "num_input_tokens_seen": 18185305632,
      "step": 23114
    },
    {
      "epoch": 2.4522597071928707,
      "grad_norm": 0.40258344491648673,
      "learning_rate": 4.5055969118802346e-05,
      "loss": 1.6244,
      "num_input_tokens_seen": 18186092304,
      "step": 23115
    },
    {
      "epoch": 2.452365796732442,
      "grad_norm": 0.39256570924965684,
      "learning_rate": 4.505555421235981e-05,
      "loss": 1.695,
      "num_input_tokens_seen": 18186879088,
      "step": 23116
    },
    {
      "epoch": 2.4524718862720136,
      "grad_norm": 0.45753625472496035,
      "learning_rate": 4.505513929041892e-05,
      "loss": 1.5601,
      "num_input_tokens_seen": 18187665856,
      "step": 23117
    },
    {
      "epoch": 2.452577975811585,
      "grad_norm": 0.41156710560057014,
      "learning_rate": 4.5054724352980015e-05,
      "loss": 1.5767,
      "num_input_tokens_seen": 18188452656,
      "step": 23118
    },
    {
      "epoch": 2.452684065351156,
      "grad_norm": 0.41237782989115557,
      "learning_rate": 4.5054309400043406e-05,
      "loss": 1.5026,
      "num_input_tokens_seen": 18189239376,
      "step": 23119
    },
    {
      "epoch": 2.4527901548907276,
      "grad_norm": 0.43993151150960913,
      "learning_rate": 4.5053894431609415e-05,
      "loss": 1.667,
      "num_input_tokens_seen": 18190026064,
      "step": 23120
    },
    {
      "epoch": 2.452896244430299,
      "grad_norm": 0.3846406559319033,
      "learning_rate": 4.5053479447678374e-05,
      "loss": 1.5958,
      "num_input_tokens_seen": 18190812800,
      "step": 23121
    },
    {
      "epoch": 2.4530023339698706,
      "grad_norm": 0.4997794799133005,
      "learning_rate": 4.505306444825057e-05,
      "loss": 1.5774,
      "num_input_tokens_seen": 18191599584,
      "step": 23122
    },
    {
      "epoch": 2.453108423509442,
      "grad_norm": 0.44275516060521214,
      "learning_rate": 4.5052649433326366e-05,
      "loss": 1.5438,
      "num_input_tokens_seen": 18192386448,
      "step": 23123
    },
    {
      "epoch": 2.4532145130490135,
      "grad_norm": 0.38581117871979387,
      "learning_rate": 4.505223440290605e-05,
      "loss": 1.6044,
      "num_input_tokens_seen": 18193173152,
      "step": 23124
    },
    {
      "epoch": 2.453320602588585,
      "grad_norm": 0.4293876113133544,
      "learning_rate": 4.5051819356989964e-05,
      "loss": 1.6197,
      "num_input_tokens_seen": 18193959920,
      "step": 23125
    },
    {
      "epoch": 2.453426692128156,
      "grad_norm": 0.521299364000946,
      "learning_rate": 4.505140429557841e-05,
      "loss": 1.606,
      "num_input_tokens_seen": 18194746768,
      "step": 23126
    },
    {
      "epoch": 2.4535327816677275,
      "grad_norm": 0.3720629569948113,
      "learning_rate": 4.5050989218671736e-05,
      "loss": 1.5598,
      "num_input_tokens_seen": 18195533600,
      "step": 23127
    },
    {
      "epoch": 2.453638871207299,
      "grad_norm": 0.43093211170496226,
      "learning_rate": 4.505057412627023e-05,
      "loss": 1.4431,
      "num_input_tokens_seen": 18196320400,
      "step": 23128
    },
    {
      "epoch": 2.4537449607468704,
      "grad_norm": 0.4835096951403781,
      "learning_rate": 4.505015901837424e-05,
      "loss": 1.5416,
      "num_input_tokens_seen": 18197107168,
      "step": 23129
    },
    {
      "epoch": 2.453851050286442,
      "grad_norm": 0.4392331118760534,
      "learning_rate": 4.504974389498407e-05,
      "loss": 1.6159,
      "num_input_tokens_seen": 18197893872,
      "step": 23130
    },
    {
      "epoch": 2.453957139826013,
      "grad_norm": 0.48398925368459916,
      "learning_rate": 4.504932875610004e-05,
      "loss": 1.7314,
      "num_input_tokens_seen": 18198680672,
      "step": 23131
    },
    {
      "epoch": 2.4540632293655844,
      "grad_norm": 0.3689987246933027,
      "learning_rate": 4.504891360172249e-05,
      "loss": 1.6234,
      "num_input_tokens_seen": 18199467456,
      "step": 23132
    },
    {
      "epoch": 2.454169318905156,
      "grad_norm": 0.40454152156742695,
      "learning_rate": 4.504849843185172e-05,
      "loss": 1.4898,
      "num_input_tokens_seen": 18200254208,
      "step": 23133
    },
    {
      "epoch": 2.4542754084447274,
      "grad_norm": 0.423157302215117,
      "learning_rate": 4.504808324648806e-05,
      "loss": 1.5655,
      "num_input_tokens_seen": 18201040944,
      "step": 23134
    },
    {
      "epoch": 2.454381497984299,
      "grad_norm": 0.38610699107210694,
      "learning_rate": 4.504766804563183e-05,
      "loss": 1.6279,
      "num_input_tokens_seen": 18201827648,
      "step": 23135
    },
    {
      "epoch": 2.4544875875238703,
      "grad_norm": 0.40857122815594554,
      "learning_rate": 4.504725282928335e-05,
      "loss": 1.6592,
      "num_input_tokens_seen": 18202614336,
      "step": 23136
    },
    {
      "epoch": 2.454593677063442,
      "grad_norm": 0.48224907860956656,
      "learning_rate": 4.5046837597442944e-05,
      "loss": 1.6088,
      "num_input_tokens_seen": 18203401072,
      "step": 23137
    },
    {
      "epoch": 2.454699766603013,
      "grad_norm": 0.3962876509691038,
      "learning_rate": 4.504642235011093e-05,
      "loss": 1.6482,
      "num_input_tokens_seen": 18204187840,
      "step": 23138
    },
    {
      "epoch": 2.4548058561425843,
      "grad_norm": 0.5014839866194554,
      "learning_rate": 4.504600708728762e-05,
      "loss": 1.5706,
      "num_input_tokens_seen": 18204974688,
      "step": 23139
    },
    {
      "epoch": 2.4549119456821558,
      "grad_norm": 0.6233451807147844,
      "learning_rate": 4.5045591808973355e-05,
      "loss": 1.5613,
      "num_input_tokens_seen": 18205761488,
      "step": 23140
    },
    {
      "epoch": 2.4550180352217272,
      "grad_norm": 0.4993554080619493,
      "learning_rate": 4.5045176515168435e-05,
      "loss": 1.5422,
      "num_input_tokens_seen": 18206548208,
      "step": 23141
    },
    {
      "epoch": 2.4551241247612987,
      "grad_norm": 0.5635197152004463,
      "learning_rate": 4.50447612058732e-05,
      "loss": 1.5656,
      "num_input_tokens_seen": 18207334960,
      "step": 23142
    },
    {
      "epoch": 2.4552302143008697,
      "grad_norm": 0.4186155527186864,
      "learning_rate": 4.5044345881087956e-05,
      "loss": 1.6069,
      "num_input_tokens_seen": 18208121744,
      "step": 23143
    },
    {
      "epoch": 2.455336303840441,
      "grad_norm": 0.524207042659058,
      "learning_rate": 4.5043930540813027e-05,
      "loss": 1.5945,
      "num_input_tokens_seen": 18208908528,
      "step": 23144
    },
    {
      "epoch": 2.4554423933800127,
      "grad_norm": 0.4910046326556349,
      "learning_rate": 4.5043515185048745e-05,
      "loss": 1.6127,
      "num_input_tokens_seen": 18209695248,
      "step": 23145
    },
    {
      "epoch": 2.455548482919584,
      "grad_norm": 0.4643103151573177,
      "learning_rate": 4.504309981379542e-05,
      "loss": 1.7206,
      "num_input_tokens_seen": 18210482032,
      "step": 23146
    },
    {
      "epoch": 2.4556545724591556,
      "grad_norm": 0.41703506616584834,
      "learning_rate": 4.504268442705337e-05,
      "loss": 1.6707,
      "num_input_tokens_seen": 18211268704,
      "step": 23147
    },
    {
      "epoch": 2.455760661998727,
      "grad_norm": 0.47112944331324547,
      "learning_rate": 4.5042269024822927e-05,
      "loss": 1.6296,
      "num_input_tokens_seen": 18212055488,
      "step": 23148
    },
    {
      "epoch": 2.455866751538298,
      "grad_norm": 0.4459785036757221,
      "learning_rate": 4.5041853607104405e-05,
      "loss": 1.4957,
      "num_input_tokens_seen": 18212842288,
      "step": 23149
    },
    {
      "epoch": 2.4559728410778696,
      "grad_norm": 0.391047797123932,
      "learning_rate": 4.504143817389812e-05,
      "loss": 1.5466,
      "num_input_tokens_seen": 18213628944,
      "step": 23150
    },
    {
      "epoch": 2.456078930617441,
      "grad_norm": 0.4876079437135407,
      "learning_rate": 4.504102272520441e-05,
      "loss": 1.5831,
      "num_input_tokens_seen": 18214415712,
      "step": 23151
    },
    {
      "epoch": 2.4561850201570126,
      "grad_norm": 0.3627283512553594,
      "learning_rate": 4.504060726102358e-05,
      "loss": 1.6001,
      "num_input_tokens_seen": 18215202512,
      "step": 23152
    },
    {
      "epoch": 2.456291109696584,
      "grad_norm": 0.3978579939864983,
      "learning_rate": 4.504019178135597e-05,
      "loss": 1.5925,
      "num_input_tokens_seen": 18215989296,
      "step": 23153
    },
    {
      "epoch": 2.4563971992361555,
      "grad_norm": 0.443270649083588,
      "learning_rate": 4.503977628620187e-05,
      "loss": 1.6637,
      "num_input_tokens_seen": 18216776016,
      "step": 23154
    },
    {
      "epoch": 2.4565032887757265,
      "grad_norm": 0.3877524449495651,
      "learning_rate": 4.503936077556162e-05,
      "loss": 1.4493,
      "num_input_tokens_seen": 18217562864,
      "step": 23155
    },
    {
      "epoch": 2.456609378315298,
      "grad_norm": 0.4286676410414008,
      "learning_rate": 4.5038945249435546e-05,
      "loss": 1.5966,
      "num_input_tokens_seen": 18218349664,
      "step": 23156
    },
    {
      "epoch": 2.4567154678548695,
      "grad_norm": 0.439315250493926,
      "learning_rate": 4.503852970782397e-05,
      "loss": 1.6225,
      "num_input_tokens_seen": 18219136432,
      "step": 23157
    },
    {
      "epoch": 2.456821557394441,
      "grad_norm": 0.3697022482209184,
      "learning_rate": 4.503811415072719e-05,
      "loss": 1.5113,
      "num_input_tokens_seen": 18219923248,
      "step": 23158
    },
    {
      "epoch": 2.4569276469340124,
      "grad_norm": 0.41207913278973646,
      "learning_rate": 4.503769857814556e-05,
      "loss": 1.5943,
      "num_input_tokens_seen": 18220709968,
      "step": 23159
    },
    {
      "epoch": 2.4570337364735835,
      "grad_norm": 0.440529069998835,
      "learning_rate": 4.503728299007938e-05,
      "loss": 1.5452,
      "num_input_tokens_seen": 18221496704,
      "step": 23160
    },
    {
      "epoch": 2.457139826013155,
      "grad_norm": 0.38344132981103585,
      "learning_rate": 4.503686738652897e-05,
      "loss": 1.647,
      "num_input_tokens_seen": 18222283424,
      "step": 23161
    },
    {
      "epoch": 2.4572459155527264,
      "grad_norm": 0.45145256945448453,
      "learning_rate": 4.503645176749466e-05,
      "loss": 1.6542,
      "num_input_tokens_seen": 18223070176,
      "step": 23162
    },
    {
      "epoch": 2.457352005092298,
      "grad_norm": 0.3861364990638257,
      "learning_rate": 4.503603613297676e-05,
      "loss": 1.6522,
      "num_input_tokens_seen": 18223856912,
      "step": 23163
    },
    {
      "epoch": 2.4574580946318694,
      "grad_norm": 0.391496717424838,
      "learning_rate": 4.5035620482975606e-05,
      "loss": 1.6766,
      "num_input_tokens_seen": 18224643616,
      "step": 23164
    },
    {
      "epoch": 2.457564184171441,
      "grad_norm": 0.45398444218635986,
      "learning_rate": 4.503520481749152e-05,
      "loss": 1.7424,
      "num_input_tokens_seen": 18225430304,
      "step": 23165
    },
    {
      "epoch": 2.4576702737110123,
      "grad_norm": 0.4197602112795853,
      "learning_rate": 4.50347891365248e-05,
      "loss": 1.4537,
      "num_input_tokens_seen": 18226217136,
      "step": 23166
    },
    {
      "epoch": 2.4577763632505834,
      "grad_norm": 0.3676055630432639,
      "learning_rate": 4.5034373440075795e-05,
      "loss": 1.5088,
      "num_input_tokens_seen": 18227003936,
      "step": 23167
    },
    {
      "epoch": 2.457882452790155,
      "grad_norm": 0.6170290673347446,
      "learning_rate": 4.503395772814481e-05,
      "loss": 1.5359,
      "num_input_tokens_seen": 18227790640,
      "step": 23168
    },
    {
      "epoch": 2.4579885423297263,
      "grad_norm": 0.4040125321625079,
      "learning_rate": 4.5033542000732165e-05,
      "loss": 1.4645,
      "num_input_tokens_seen": 18228577472,
      "step": 23169
    },
    {
      "epoch": 2.4580946318692978,
      "grad_norm": 0.519409225631701,
      "learning_rate": 4.5033126257838197e-05,
      "loss": 1.6815,
      "num_input_tokens_seen": 18229364208,
      "step": 23170
    },
    {
      "epoch": 2.4582007214088692,
      "grad_norm": 0.4521364148614836,
      "learning_rate": 4.503271049946321e-05,
      "loss": 1.5823,
      "num_input_tokens_seen": 18230150928,
      "step": 23171
    },
    {
      "epoch": 2.4583068109484403,
      "grad_norm": 0.46017404023880065,
      "learning_rate": 4.503229472560754e-05,
      "loss": 1.6449,
      "num_input_tokens_seen": 18230937600,
      "step": 23172
    },
    {
      "epoch": 2.4584129004880118,
      "grad_norm": 0.4054304762968131,
      "learning_rate": 4.5031878936271485e-05,
      "loss": 1.6411,
      "num_input_tokens_seen": 18231724368,
      "step": 23173
    },
    {
      "epoch": 2.4585189900275832,
      "grad_norm": 0.4813638514171874,
      "learning_rate": 4.503146313145539e-05,
      "loss": 1.6803,
      "num_input_tokens_seen": 18232511088,
      "step": 23174
    },
    {
      "epoch": 2.4586250795671547,
      "grad_norm": 0.5411287666129078,
      "learning_rate": 4.503104731115958e-05,
      "loss": 1.5289,
      "num_input_tokens_seen": 18233297840,
      "step": 23175
    },
    {
      "epoch": 2.458731169106726,
      "grad_norm": 0.42220981773516086,
      "learning_rate": 4.503063147538435e-05,
      "loss": 1.6299,
      "num_input_tokens_seen": 18234084576,
      "step": 23176
    },
    {
      "epoch": 2.4588372586462977,
      "grad_norm": 0.41702622817294915,
      "learning_rate": 4.5030215624130036e-05,
      "loss": 1.5556,
      "num_input_tokens_seen": 18234871312,
      "step": 23177
    },
    {
      "epoch": 2.4589433481858687,
      "grad_norm": 0.42467098546850635,
      "learning_rate": 4.5029799757396964e-05,
      "loss": 1.7006,
      "num_input_tokens_seen": 18235658112,
      "step": 23178
    },
    {
      "epoch": 2.45904943772544,
      "grad_norm": 0.4423845143272021,
      "learning_rate": 4.502938387518545e-05,
      "loss": 1.5817,
      "num_input_tokens_seen": 18236444800,
      "step": 23179
    },
    {
      "epoch": 2.4591555272650116,
      "grad_norm": 0.41198273808377506,
      "learning_rate": 4.50289679774958e-05,
      "loss": 1.7081,
      "num_input_tokens_seen": 18237231648,
      "step": 23180
    },
    {
      "epoch": 2.459261616804583,
      "grad_norm": 0.44155118186568404,
      "learning_rate": 4.502855206432838e-05,
      "loss": 1.5718,
      "num_input_tokens_seen": 18238018368,
      "step": 23181
    },
    {
      "epoch": 2.4593677063441546,
      "grad_norm": 0.5633960187785623,
      "learning_rate": 4.5028136135683465e-05,
      "loss": 1.6501,
      "num_input_tokens_seen": 18238805184,
      "step": 23182
    },
    {
      "epoch": 2.459473795883726,
      "grad_norm": 0.38475520629735427,
      "learning_rate": 4.50277201915614e-05,
      "loss": 1.5928,
      "num_input_tokens_seen": 18239591936,
      "step": 23183
    },
    {
      "epoch": 2.459579885423297,
      "grad_norm": 0.6470797143931968,
      "learning_rate": 4.502730423196249e-05,
      "loss": 1.538,
      "num_input_tokens_seen": 18240378736,
      "step": 23184
    },
    {
      "epoch": 2.4596859749628686,
      "grad_norm": 0.3907299192736427,
      "learning_rate": 4.5026888256887076e-05,
      "loss": 1.5757,
      "num_input_tokens_seen": 18241165408,
      "step": 23185
    },
    {
      "epoch": 2.45979206450244,
      "grad_norm": 0.4337294510532963,
      "learning_rate": 4.502647226633547e-05,
      "loss": 1.5943,
      "num_input_tokens_seen": 18241952176,
      "step": 23186
    },
    {
      "epoch": 2.4598981540420115,
      "grad_norm": 0.39574082706375946,
      "learning_rate": 4.502605626030799e-05,
      "loss": 1.5562,
      "num_input_tokens_seen": 18242738944,
      "step": 23187
    },
    {
      "epoch": 2.460004243581583,
      "grad_norm": 0.3943708197128265,
      "learning_rate": 4.502564023880497e-05,
      "loss": 1.7348,
      "num_input_tokens_seen": 18243525616,
      "step": 23188
    },
    {
      "epoch": 2.460110333121154,
      "grad_norm": 0.47206934566447145,
      "learning_rate": 4.502522420182672e-05,
      "loss": 1.5986,
      "num_input_tokens_seen": 18244312368,
      "step": 23189
    },
    {
      "epoch": 2.4602164226607255,
      "grad_norm": 0.4392172602157456,
      "learning_rate": 4.5024808149373554e-05,
      "loss": 1.7104,
      "num_input_tokens_seen": 18245099152,
      "step": 23190
    },
    {
      "epoch": 2.460322512200297,
      "grad_norm": 0.38509373439417705,
      "learning_rate": 4.5024392081445816e-05,
      "loss": 1.5422,
      "num_input_tokens_seen": 18245885920,
      "step": 23191
    },
    {
      "epoch": 2.4604286017398684,
      "grad_norm": 0.45675141973879924,
      "learning_rate": 4.502397599804381e-05,
      "loss": 1.6602,
      "num_input_tokens_seen": 18246672736,
      "step": 23192
    },
    {
      "epoch": 2.46053469127944,
      "grad_norm": 0.4289021634924685,
      "learning_rate": 4.502355989916786e-05,
      "loss": 1.5647,
      "num_input_tokens_seen": 18247459520,
      "step": 23193
    },
    {
      "epoch": 2.4606407808190114,
      "grad_norm": 0.3962643828277177,
      "learning_rate": 4.502314378481829e-05,
      "loss": 1.741,
      "num_input_tokens_seen": 18248246288,
      "step": 23194
    },
    {
      "epoch": 2.460746870358583,
      "grad_norm": 0.48902846641196956,
      "learning_rate": 4.502272765499543e-05,
      "loss": 1.5544,
      "num_input_tokens_seen": 18249033152,
      "step": 23195
    },
    {
      "epoch": 2.460852959898154,
      "grad_norm": 0.3806683520422797,
      "learning_rate": 4.502231150969959e-05,
      "loss": 1.6006,
      "num_input_tokens_seen": 18249819888,
      "step": 23196
    },
    {
      "epoch": 2.4609590494377254,
      "grad_norm": 0.38439107277598,
      "learning_rate": 4.50218953489311e-05,
      "loss": 1.5475,
      "num_input_tokens_seen": 18250606672,
      "step": 23197
    },
    {
      "epoch": 2.461065138977297,
      "grad_norm": 0.44066572446331875,
      "learning_rate": 4.502147917269027e-05,
      "loss": 1.6125,
      "num_input_tokens_seen": 18251393392,
      "step": 23198
    },
    {
      "epoch": 2.4611712285168683,
      "grad_norm": 0.3874913187170635,
      "learning_rate": 4.502106298097742e-05,
      "loss": 1.6188,
      "num_input_tokens_seen": 18252180176,
      "step": 23199
    },
    {
      "epoch": 2.46127731805644,
      "grad_norm": 0.4070614059840872,
      "learning_rate": 4.5020646773792895e-05,
      "loss": 1.6233,
      "num_input_tokens_seen": 18252967008,
      "step": 23200
    },
    {
      "epoch": 2.461383407596011,
      "grad_norm": 0.5304296606551859,
      "learning_rate": 4.5020230551137e-05,
      "loss": 1.6246,
      "num_input_tokens_seen": 18253753808,
      "step": 23201
    },
    {
      "epoch": 2.4614894971355823,
      "grad_norm": 0.4239641932791883,
      "learning_rate": 4.501981431301006e-05,
      "loss": 1.5652,
      "num_input_tokens_seen": 18254540528,
      "step": 23202
    },
    {
      "epoch": 2.4615955866751538,
      "grad_norm": 0.5647168323366003,
      "learning_rate": 4.501939805941238e-05,
      "loss": 1.6245,
      "num_input_tokens_seen": 18255327248,
      "step": 23203
    },
    {
      "epoch": 2.4617016762147252,
      "grad_norm": 0.7327703116061213,
      "learning_rate": 4.5018981790344303e-05,
      "loss": 1.7283,
      "num_input_tokens_seen": 18256114048,
      "step": 23204
    },
    {
      "epoch": 2.4618077657542967,
      "grad_norm": 0.5167771410057197,
      "learning_rate": 4.501856550580615e-05,
      "loss": 1.7063,
      "num_input_tokens_seen": 18256900768,
      "step": 23205
    },
    {
      "epoch": 2.461913855293868,
      "grad_norm": 0.7137762857597205,
      "learning_rate": 4.501814920579823e-05,
      "loss": 1.6547,
      "num_input_tokens_seen": 18257687600,
      "step": 23206
    },
    {
      "epoch": 2.4620199448334397,
      "grad_norm": 0.5787583868891035,
      "learning_rate": 4.501773289032088e-05,
      "loss": 1.5925,
      "num_input_tokens_seen": 18258474400,
      "step": 23207
    },
    {
      "epoch": 2.4621260343730107,
      "grad_norm": 0.44930660390605004,
      "learning_rate": 4.501731655937441e-05,
      "loss": 1.5477,
      "num_input_tokens_seen": 18259261152,
      "step": 23208
    },
    {
      "epoch": 2.462232123912582,
      "grad_norm": 0.6561036887761018,
      "learning_rate": 4.5016900212959146e-05,
      "loss": 1.5004,
      "num_input_tokens_seen": 18260048016,
      "step": 23209
    },
    {
      "epoch": 2.4623382134521536,
      "grad_norm": 0.41034049490718705,
      "learning_rate": 4.501648385107541e-05,
      "loss": 1.5722,
      "num_input_tokens_seen": 18260834704,
      "step": 23210
    },
    {
      "epoch": 2.462444302991725,
      "grad_norm": 0.5251649509252154,
      "learning_rate": 4.501606747372352e-05,
      "loss": 1.5683,
      "num_input_tokens_seen": 18261621456,
      "step": 23211
    },
    {
      "epoch": 2.4625503925312966,
      "grad_norm": 0.458153956489295,
      "learning_rate": 4.50156510809038e-05,
      "loss": 1.7288,
      "num_input_tokens_seen": 18262408240,
      "step": 23212
    },
    {
      "epoch": 2.4626564820708676,
      "grad_norm": 0.4165206461441609,
      "learning_rate": 4.5015234672616566e-05,
      "loss": 1.6173,
      "num_input_tokens_seen": 18263195056,
      "step": 23213
    },
    {
      "epoch": 2.462762571610439,
      "grad_norm": 0.4150118217252852,
      "learning_rate": 4.501481824886215e-05,
      "loss": 1.5301,
      "num_input_tokens_seen": 18263981920,
      "step": 23214
    },
    {
      "epoch": 2.4628686611500106,
      "grad_norm": 0.41213363034433675,
      "learning_rate": 4.501440180964088e-05,
      "loss": 1.5521,
      "num_input_tokens_seen": 18264768672,
      "step": 23215
    },
    {
      "epoch": 2.462974750689582,
      "grad_norm": 0.37454243394054315,
      "learning_rate": 4.501398535495306e-05,
      "loss": 1.6325,
      "num_input_tokens_seen": 18265555424,
      "step": 23216
    },
    {
      "epoch": 2.4630808402291535,
      "grad_norm": 0.4754458927574568,
      "learning_rate": 4.501356888479902e-05,
      "loss": 1.6528,
      "num_input_tokens_seen": 18266342144,
      "step": 23217
    },
    {
      "epoch": 2.463186929768725,
      "grad_norm": 0.39537608224584114,
      "learning_rate": 4.5013152399179076e-05,
      "loss": 1.6513,
      "num_input_tokens_seen": 18267128912,
      "step": 23218
    },
    {
      "epoch": 2.463293019308296,
      "grad_norm": 0.42870024545167873,
      "learning_rate": 4.501273589809356e-05,
      "loss": 1.6532,
      "num_input_tokens_seen": 18267915696,
      "step": 23219
    },
    {
      "epoch": 2.4633991088478675,
      "grad_norm": 0.6044559794971589,
      "learning_rate": 4.501231938154279e-05,
      "loss": 1.6702,
      "num_input_tokens_seen": 18268702384,
      "step": 23220
    },
    {
      "epoch": 2.463505198387439,
      "grad_norm": 0.4347308501275337,
      "learning_rate": 4.501190284952708e-05,
      "loss": 1.7634,
      "num_input_tokens_seen": 18269489168,
      "step": 23221
    },
    {
      "epoch": 2.4636112879270105,
      "grad_norm": 0.4620588549190028,
      "learning_rate": 4.501148630204677e-05,
      "loss": 1.609,
      "num_input_tokens_seen": 18270275936,
      "step": 23222
    },
    {
      "epoch": 2.463717377466582,
      "grad_norm": 0.4060034818028448,
      "learning_rate": 4.501106973910216e-05,
      "loss": 1.5675,
      "num_input_tokens_seen": 18271062656,
      "step": 23223
    },
    {
      "epoch": 2.4638234670061534,
      "grad_norm": 0.4533412287561942,
      "learning_rate": 4.5010653160693586e-05,
      "loss": 1.6251,
      "num_input_tokens_seen": 18271849344,
      "step": 23224
    },
    {
      "epoch": 2.4639295565457244,
      "grad_norm": 0.444603199298394,
      "learning_rate": 4.501023656682137e-05,
      "loss": 1.6504,
      "num_input_tokens_seen": 18272636208,
      "step": 23225
    },
    {
      "epoch": 2.464035646085296,
      "grad_norm": 0.4592067323699074,
      "learning_rate": 4.500981995748582e-05,
      "loss": 1.5371,
      "num_input_tokens_seen": 18273422944,
      "step": 23226
    },
    {
      "epoch": 2.4641417356248674,
      "grad_norm": 0.49428541232339723,
      "learning_rate": 4.5009403332687285e-05,
      "loss": 1.5591,
      "num_input_tokens_seen": 18274209696,
      "step": 23227
    },
    {
      "epoch": 2.464247825164439,
      "grad_norm": 0.34637725780293327,
      "learning_rate": 4.500898669242606e-05,
      "loss": 1.5341,
      "num_input_tokens_seen": 18274996576,
      "step": 23228
    },
    {
      "epoch": 2.4643539147040103,
      "grad_norm": 0.3758903275684703,
      "learning_rate": 4.500857003670247e-05,
      "loss": 1.4141,
      "num_input_tokens_seen": 18275783440,
      "step": 23229
    },
    {
      "epoch": 2.4644600042435814,
      "grad_norm": 0.4497791937498109,
      "learning_rate": 4.500815336551686e-05,
      "loss": 1.6357,
      "num_input_tokens_seen": 18276570192,
      "step": 23230
    },
    {
      "epoch": 2.464566093783153,
      "grad_norm": 0.36697602250449146,
      "learning_rate": 4.500773667886953e-05,
      "loss": 1.529,
      "num_input_tokens_seen": 18277357024,
      "step": 23231
    },
    {
      "epoch": 2.4646721833227243,
      "grad_norm": 0.5776242297771024,
      "learning_rate": 4.50073199767608e-05,
      "loss": 1.6818,
      "num_input_tokens_seen": 18278143840,
      "step": 23232
    },
    {
      "epoch": 2.464778272862296,
      "grad_norm": 0.4400326727867228,
      "learning_rate": 4.5006903259191004e-05,
      "loss": 1.5404,
      "num_input_tokens_seen": 18278930640,
      "step": 23233
    },
    {
      "epoch": 2.4648843624018673,
      "grad_norm": 0.43782449267747936,
      "learning_rate": 4.500648652616046e-05,
      "loss": 1.6438,
      "num_input_tokens_seen": 18279717424,
      "step": 23234
    },
    {
      "epoch": 2.4649904519414387,
      "grad_norm": 0.32912302580478126,
      "learning_rate": 4.5006069777669505e-05,
      "loss": 1.3473,
      "num_input_tokens_seen": 18280504256,
      "step": 23235
    },
    {
      "epoch": 2.46509654148101,
      "grad_norm": 0.42069729500057595,
      "learning_rate": 4.500565301371843e-05,
      "loss": 1.5954,
      "num_input_tokens_seen": 18281291008,
      "step": 23236
    },
    {
      "epoch": 2.4652026310205812,
      "grad_norm": 0.3814257051439625,
      "learning_rate": 4.5005236234307574e-05,
      "loss": 1.5876,
      "num_input_tokens_seen": 18282077904,
      "step": 23237
    },
    {
      "epoch": 2.4653087205601527,
      "grad_norm": 0.5155773462300811,
      "learning_rate": 4.500481943943726e-05,
      "loss": 1.7598,
      "num_input_tokens_seen": 18282864640,
      "step": 23238
    },
    {
      "epoch": 2.465414810099724,
      "grad_norm": 0.34798489491819784,
      "learning_rate": 4.5004402629107814e-05,
      "loss": 1.5013,
      "num_input_tokens_seen": 18283651456,
      "step": 23239
    },
    {
      "epoch": 2.4655208996392957,
      "grad_norm": 0.4463996496443821,
      "learning_rate": 4.5003985803319546e-05,
      "loss": 1.5132,
      "num_input_tokens_seen": 18284438208,
      "step": 23240
    },
    {
      "epoch": 2.465626989178867,
      "grad_norm": 0.4019139820953044,
      "learning_rate": 4.50035689620728e-05,
      "loss": 1.6629,
      "num_input_tokens_seen": 18285225040,
      "step": 23241
    },
    {
      "epoch": 2.465733078718438,
      "grad_norm": 0.4293287116318294,
      "learning_rate": 4.500315210536786e-05,
      "loss": 1.592,
      "num_input_tokens_seen": 18286011776,
      "step": 23242
    },
    {
      "epoch": 2.4658391682580096,
      "grad_norm": 0.5127553012096753,
      "learning_rate": 4.500273523320508e-05,
      "loss": 1.6575,
      "num_input_tokens_seen": 18286798480,
      "step": 23243
    },
    {
      "epoch": 2.465945257797581,
      "grad_norm": 0.3635946929067461,
      "learning_rate": 4.5002318345584784e-05,
      "loss": 1.4265,
      "num_input_tokens_seen": 18287585312,
      "step": 23244
    },
    {
      "epoch": 2.4660513473371526,
      "grad_norm": 0.42554439808359357,
      "learning_rate": 4.500190144250727e-05,
      "loss": 1.7802,
      "num_input_tokens_seen": 18288372128,
      "step": 23245
    },
    {
      "epoch": 2.466157436876724,
      "grad_norm": 0.3803416763696373,
      "learning_rate": 4.5001484523972876e-05,
      "loss": 1.465,
      "num_input_tokens_seen": 18289158960,
      "step": 23246
    },
    {
      "epoch": 2.4662635264162955,
      "grad_norm": 0.42495273426319874,
      "learning_rate": 4.500106758998193e-05,
      "loss": 1.6638,
      "num_input_tokens_seen": 18289945744,
      "step": 23247
    },
    {
      "epoch": 2.4663696159558666,
      "grad_norm": 0.3778183367997247,
      "learning_rate": 4.500065064053474e-05,
      "loss": 1.4353,
      "num_input_tokens_seen": 18290732688,
      "step": 23248
    },
    {
      "epoch": 2.466475705495438,
      "grad_norm": 0.4344883488781638,
      "learning_rate": 4.500023367563162e-05,
      "loss": 1.6291,
      "num_input_tokens_seen": 18291519440,
      "step": 23249
    },
    {
      "epoch": 2.4665817950350095,
      "grad_norm": 0.37200921896170425,
      "learning_rate": 4.499981669527292e-05,
      "loss": 1.5739,
      "num_input_tokens_seen": 18292306176,
      "step": 23250
    },
    {
      "epoch": 2.466687884574581,
      "grad_norm": 0.3829266118994741,
      "learning_rate": 4.4999399699458956e-05,
      "loss": 1.6303,
      "num_input_tokens_seen": 18293092848,
      "step": 23251
    },
    {
      "epoch": 2.4667939741141525,
      "grad_norm": 0.40779487454988816,
      "learning_rate": 4.4998982688190036e-05,
      "loss": 1.6145,
      "num_input_tokens_seen": 18293879648,
      "step": 23252
    },
    {
      "epoch": 2.466900063653724,
      "grad_norm": 0.3283438614981395,
      "learning_rate": 4.4998565661466484e-05,
      "loss": 1.4884,
      "num_input_tokens_seen": 18294666368,
      "step": 23253
    },
    {
      "epoch": 2.467006153193295,
      "grad_norm": 0.3529408004949832,
      "learning_rate": 4.499814861928863e-05,
      "loss": 1.5939,
      "num_input_tokens_seen": 18295453104,
      "step": 23254
    },
    {
      "epoch": 2.4671122427328664,
      "grad_norm": 0.4758406843724185,
      "learning_rate": 4.4997731561656796e-05,
      "loss": 1.6114,
      "num_input_tokens_seen": 18296239808,
      "step": 23255
    },
    {
      "epoch": 2.467218332272438,
      "grad_norm": 0.3825367460236596,
      "learning_rate": 4.4997314488571296e-05,
      "loss": 1.5864,
      "num_input_tokens_seen": 18297026560,
      "step": 23256
    },
    {
      "epoch": 2.4673244218120094,
      "grad_norm": 0.4245510666789241,
      "learning_rate": 4.4996897400032466e-05,
      "loss": 1.5969,
      "num_input_tokens_seen": 18297813264,
      "step": 23257
    },
    {
      "epoch": 2.467430511351581,
      "grad_norm": 0.506424962007657,
      "learning_rate": 4.499648029604062e-05,
      "loss": 1.6988,
      "num_input_tokens_seen": 18298600064,
      "step": 23258
    },
    {
      "epoch": 2.467536600891152,
      "grad_norm": 0.3822578930909382,
      "learning_rate": 4.499606317659607e-05,
      "loss": 1.6465,
      "num_input_tokens_seen": 18299386960,
      "step": 23259
    },
    {
      "epoch": 2.4676426904307234,
      "grad_norm": 0.38154726621056145,
      "learning_rate": 4.499564604169916e-05,
      "loss": 1.5964,
      "num_input_tokens_seen": 18300173696,
      "step": 23260
    },
    {
      "epoch": 2.467748779970295,
      "grad_norm": 0.35957847662000847,
      "learning_rate": 4.4995228891350195e-05,
      "loss": 1.5898,
      "num_input_tokens_seen": 18300960448,
      "step": 23261
    },
    {
      "epoch": 2.4678548695098663,
      "grad_norm": 0.3560724141074735,
      "learning_rate": 4.499481172554951e-05,
      "loss": 1.6,
      "num_input_tokens_seen": 18301747232,
      "step": 23262
    },
    {
      "epoch": 2.467960959049438,
      "grad_norm": 0.3363208208623831,
      "learning_rate": 4.4994394544297417e-05,
      "loss": 1.4905,
      "num_input_tokens_seen": 18302534064,
      "step": 23263
    },
    {
      "epoch": 2.4680670485890093,
      "grad_norm": 0.3985523363266771,
      "learning_rate": 4.499397734759424e-05,
      "loss": 1.5555,
      "num_input_tokens_seen": 18303320912,
      "step": 23264
    },
    {
      "epoch": 2.4681731381285807,
      "grad_norm": 0.37600870463804775,
      "learning_rate": 4.499356013544031e-05,
      "loss": 1.6502,
      "num_input_tokens_seen": 18304107664,
      "step": 23265
    },
    {
      "epoch": 2.4682792276681518,
      "grad_norm": 0.32800270914471263,
      "learning_rate": 4.4993142907835936e-05,
      "loss": 1.5343,
      "num_input_tokens_seen": 18304894512,
      "step": 23266
    },
    {
      "epoch": 2.4683853172077233,
      "grad_norm": 0.39427759265030354,
      "learning_rate": 4.499272566478146e-05,
      "loss": 1.6431,
      "num_input_tokens_seen": 18305681328,
      "step": 23267
    },
    {
      "epoch": 2.4684914067472947,
      "grad_norm": 0.32397350116831974,
      "learning_rate": 4.4992308406277186e-05,
      "loss": 1.6002,
      "num_input_tokens_seen": 18306468080,
      "step": 23268
    },
    {
      "epoch": 2.468597496286866,
      "grad_norm": 0.4353894816649288,
      "learning_rate": 4.499189113232344e-05,
      "loss": 1.8096,
      "num_input_tokens_seen": 18307254848,
      "step": 23269
    },
    {
      "epoch": 2.4687035858264377,
      "grad_norm": 0.41224214867058195,
      "learning_rate": 4.499147384292055e-05,
      "loss": 1.5934,
      "num_input_tokens_seen": 18308041536,
      "step": 23270
    },
    {
      "epoch": 2.4688096753660087,
      "grad_norm": 0.35593174300892927,
      "learning_rate": 4.499105653806883e-05,
      "loss": 1.492,
      "num_input_tokens_seen": 18308828368,
      "step": 23271
    },
    {
      "epoch": 2.46891576490558,
      "grad_norm": 0.3702261225573791,
      "learning_rate": 4.4990639217768616e-05,
      "loss": 1.6809,
      "num_input_tokens_seen": 18309615136,
      "step": 23272
    },
    {
      "epoch": 2.4690218544451517,
      "grad_norm": 0.378254381691546,
      "learning_rate": 4.499022188202022e-05,
      "loss": 1.6243,
      "num_input_tokens_seen": 18310401936,
      "step": 23273
    },
    {
      "epoch": 2.469127943984723,
      "grad_norm": 0.4039782419867685,
      "learning_rate": 4.4989804530823966e-05,
      "loss": 1.674,
      "num_input_tokens_seen": 18311188672,
      "step": 23274
    },
    {
      "epoch": 2.4692340335242946,
      "grad_norm": 0.396832137578918,
      "learning_rate": 4.498938716418018e-05,
      "loss": 1.58,
      "num_input_tokens_seen": 18311975392,
      "step": 23275
    },
    {
      "epoch": 2.469340123063866,
      "grad_norm": 0.3547998749344965,
      "learning_rate": 4.498896978208918e-05,
      "loss": 1.5471,
      "num_input_tokens_seen": 18312762048,
      "step": 23276
    },
    {
      "epoch": 2.469446212603437,
      "grad_norm": 0.3959053222505541,
      "learning_rate": 4.4988552384551285e-05,
      "loss": 1.7174,
      "num_input_tokens_seen": 18313548864,
      "step": 23277
    },
    {
      "epoch": 2.4695523021430086,
      "grad_norm": 0.359648817810353,
      "learning_rate": 4.498813497156683e-05,
      "loss": 1.5422,
      "num_input_tokens_seen": 18314335648,
      "step": 23278
    },
    {
      "epoch": 2.46965839168258,
      "grad_norm": 0.3539176377559294,
      "learning_rate": 4.498771754313613e-05,
      "loss": 1.5558,
      "num_input_tokens_seen": 18315122416,
      "step": 23279
    },
    {
      "epoch": 2.4697644812221515,
      "grad_norm": 0.4327036188047606,
      "learning_rate": 4.4987300099259504e-05,
      "loss": 1.6003,
      "num_input_tokens_seen": 18315909232,
      "step": 23280
    },
    {
      "epoch": 2.469870570761723,
      "grad_norm": 0.390466949144999,
      "learning_rate": 4.4986882639937287e-05,
      "loss": 1.6658,
      "num_input_tokens_seen": 18316695968,
      "step": 23281
    },
    {
      "epoch": 2.4699766603012945,
      "grad_norm": 0.4284176458945741,
      "learning_rate": 4.498646516516979e-05,
      "loss": 1.5708,
      "num_input_tokens_seen": 18317482720,
      "step": 23282
    },
    {
      "epoch": 2.4700827498408655,
      "grad_norm": 0.4295688999640758,
      "learning_rate": 4.498604767495733e-05,
      "loss": 1.7149,
      "num_input_tokens_seen": 18318269536,
      "step": 23283
    },
    {
      "epoch": 2.470188839380437,
      "grad_norm": 0.4516802272572802,
      "learning_rate": 4.498563016930025e-05,
      "loss": 1.6653,
      "num_input_tokens_seen": 18319056240,
      "step": 23284
    },
    {
      "epoch": 2.4702949289200085,
      "grad_norm": 0.36171876965875877,
      "learning_rate": 4.498521264819886e-05,
      "loss": 1.4821,
      "num_input_tokens_seen": 18319843040,
      "step": 23285
    },
    {
      "epoch": 2.47040101845958,
      "grad_norm": 0.4087570657158442,
      "learning_rate": 4.498479511165349e-05,
      "loss": 1.5452,
      "num_input_tokens_seen": 18320629856,
      "step": 23286
    },
    {
      "epoch": 2.4705071079991514,
      "grad_norm": 0.3819670369091364,
      "learning_rate": 4.498437755966444e-05,
      "loss": 1.6439,
      "num_input_tokens_seen": 18321416688,
      "step": 23287
    },
    {
      "epoch": 2.4706131975387224,
      "grad_norm": 0.4143731522372974,
      "learning_rate": 4.498395999223206e-05,
      "loss": 1.6263,
      "num_input_tokens_seen": 18322203376,
      "step": 23288
    },
    {
      "epoch": 2.470719287078294,
      "grad_norm": 0.38454149474704596,
      "learning_rate": 4.498354240935666e-05,
      "loss": 1.4472,
      "num_input_tokens_seen": 18322990288,
      "step": 23289
    },
    {
      "epoch": 2.4708253766178654,
      "grad_norm": 0.3612464645897809,
      "learning_rate": 4.4983124811038565e-05,
      "loss": 1.5484,
      "num_input_tokens_seen": 18323777104,
      "step": 23290
    },
    {
      "epoch": 2.470931466157437,
      "grad_norm": 0.3995900827476232,
      "learning_rate": 4.4982707197278105e-05,
      "loss": 1.6746,
      "num_input_tokens_seen": 18324563744,
      "step": 23291
    },
    {
      "epoch": 2.4710375556970083,
      "grad_norm": 0.3518054874084033,
      "learning_rate": 4.498228956807558e-05,
      "loss": 1.6415,
      "num_input_tokens_seen": 18325350448,
      "step": 23292
    },
    {
      "epoch": 2.47114364523658,
      "grad_norm": 0.37304246387796375,
      "learning_rate": 4.498187192343134e-05,
      "loss": 1.5956,
      "num_input_tokens_seen": 18326137200,
      "step": 23293
    },
    {
      "epoch": 2.4712497347761513,
      "grad_norm": 0.3594109258327315,
      "learning_rate": 4.49814542633457e-05,
      "loss": 1.733,
      "num_input_tokens_seen": 18326923984,
      "step": 23294
    },
    {
      "epoch": 2.4713558243157223,
      "grad_norm": 0.4165919238824196,
      "learning_rate": 4.4981036587818965e-05,
      "loss": 1.4718,
      "num_input_tokens_seen": 18327710768,
      "step": 23295
    },
    {
      "epoch": 2.471461913855294,
      "grad_norm": 0.39982794077153,
      "learning_rate": 4.498061889685148e-05,
      "loss": 1.7497,
      "num_input_tokens_seen": 18328497552,
      "step": 23296
    },
    {
      "epoch": 2.4715680033948653,
      "grad_norm": 0.4067180585349148,
      "learning_rate": 4.498020119044355e-05,
      "loss": 1.5266,
      "num_input_tokens_seen": 18329284288,
      "step": 23297
    },
    {
      "epoch": 2.4716740929344367,
      "grad_norm": 0.39591725114734216,
      "learning_rate": 4.497978346859551e-05,
      "loss": 1.5517,
      "num_input_tokens_seen": 18330071008,
      "step": 23298
    },
    {
      "epoch": 2.471780182474008,
      "grad_norm": 0.4090758919777719,
      "learning_rate": 4.497936573130769e-05,
      "loss": 1.575,
      "num_input_tokens_seen": 18330857808,
      "step": 23299
    },
    {
      "epoch": 2.4718862720135792,
      "grad_norm": 0.3955553923932533,
      "learning_rate": 4.497894797858039e-05,
      "loss": 1.528,
      "num_input_tokens_seen": 18331644560,
      "step": 23300
    },
    {
      "epoch": 2.4719923615531507,
      "grad_norm": 0.4829767583723285,
      "learning_rate": 4.4978530210413947e-05,
      "loss": 1.5847,
      "num_input_tokens_seen": 18332431296,
      "step": 23301
    },
    {
      "epoch": 2.472098451092722,
      "grad_norm": 0.4006928662895776,
      "learning_rate": 4.497811242680869e-05,
      "loss": 1.6341,
      "num_input_tokens_seen": 18333218032,
      "step": 23302
    },
    {
      "epoch": 2.4722045406322937,
      "grad_norm": 0.42677452205813504,
      "learning_rate": 4.497769462776493e-05,
      "loss": 1.6396,
      "num_input_tokens_seen": 18334004768,
      "step": 23303
    },
    {
      "epoch": 2.472310630171865,
      "grad_norm": 0.42063969585510846,
      "learning_rate": 4.497727681328299e-05,
      "loss": 1.619,
      "num_input_tokens_seen": 18334791552,
      "step": 23304
    },
    {
      "epoch": 2.4724167197114366,
      "grad_norm": 0.3927590136637504,
      "learning_rate": 4.49768589833632e-05,
      "loss": 1.6693,
      "num_input_tokens_seen": 18335578208,
      "step": 23305
    },
    {
      "epoch": 2.472522809251008,
      "grad_norm": 0.4178615028035079,
      "learning_rate": 4.4976441138005876e-05,
      "loss": 1.5742,
      "num_input_tokens_seen": 18336364880,
      "step": 23306
    },
    {
      "epoch": 2.472628898790579,
      "grad_norm": 0.39244851033957484,
      "learning_rate": 4.4976023277211346e-05,
      "loss": 1.5701,
      "num_input_tokens_seen": 18337151760,
      "step": 23307
    },
    {
      "epoch": 2.4727349883301506,
      "grad_norm": 0.42074387386132406,
      "learning_rate": 4.497560540097994e-05,
      "loss": 1.4735,
      "num_input_tokens_seen": 18337938560,
      "step": 23308
    },
    {
      "epoch": 2.472841077869722,
      "grad_norm": 0.4321541775132425,
      "learning_rate": 4.497518750931195e-05,
      "loss": 1.6368,
      "num_input_tokens_seen": 18338725344,
      "step": 23309
    },
    {
      "epoch": 2.4729471674092935,
      "grad_norm": 0.519016255705367,
      "learning_rate": 4.497476960220775e-05,
      "loss": 1.6493,
      "num_input_tokens_seen": 18339512064,
      "step": 23310
    },
    {
      "epoch": 2.473053256948865,
      "grad_norm": 0.36361497660708575,
      "learning_rate": 4.497435167966761e-05,
      "loss": 1.5834,
      "num_input_tokens_seen": 18340298832,
      "step": 23311
    },
    {
      "epoch": 2.473159346488436,
      "grad_norm": 0.3518209461124084,
      "learning_rate": 4.497393374169189e-05,
      "loss": 1.6055,
      "num_input_tokens_seen": 18341085616,
      "step": 23312
    },
    {
      "epoch": 2.4732654360280075,
      "grad_norm": 0.398487966021649,
      "learning_rate": 4.49735157882809e-05,
      "loss": 1.6797,
      "num_input_tokens_seen": 18341872416,
      "step": 23313
    },
    {
      "epoch": 2.473371525567579,
      "grad_norm": 0.32673331322757465,
      "learning_rate": 4.4973097819434964e-05,
      "loss": 1.5558,
      "num_input_tokens_seen": 18342659184,
      "step": 23314
    },
    {
      "epoch": 2.4734776151071505,
      "grad_norm": 0.34556161502863086,
      "learning_rate": 4.4972679835154394e-05,
      "loss": 1.4657,
      "num_input_tokens_seen": 18343445920,
      "step": 23315
    },
    {
      "epoch": 2.473583704646722,
      "grad_norm": 0.41178920538621594,
      "learning_rate": 4.4972261835439536e-05,
      "loss": 1.6722,
      "num_input_tokens_seen": 18344232704,
      "step": 23316
    },
    {
      "epoch": 2.4736897941862934,
      "grad_norm": 0.36440805941644544,
      "learning_rate": 4.497184382029069e-05,
      "loss": 1.6451,
      "num_input_tokens_seen": 18345019376,
      "step": 23317
    },
    {
      "epoch": 2.4737958837258645,
      "grad_norm": 0.42267349986841174,
      "learning_rate": 4.4971425789708186e-05,
      "loss": 1.6778,
      "num_input_tokens_seen": 18345806176,
      "step": 23318
    },
    {
      "epoch": 2.473901973265436,
      "grad_norm": 0.37430211427255305,
      "learning_rate": 4.497100774369236e-05,
      "loss": 1.531,
      "num_input_tokens_seen": 18346592912,
      "step": 23319
    },
    {
      "epoch": 2.4740080628050074,
      "grad_norm": 0.41637145798628783,
      "learning_rate": 4.4970589682243523e-05,
      "loss": 1.526,
      "num_input_tokens_seen": 18347379712,
      "step": 23320
    },
    {
      "epoch": 2.474114152344579,
      "grad_norm": 0.3836891538456667,
      "learning_rate": 4.4970171605362e-05,
      "loss": 1.6001,
      "num_input_tokens_seen": 18348166560,
      "step": 23321
    },
    {
      "epoch": 2.4742202418841504,
      "grad_norm": 0.3840777931640039,
      "learning_rate": 4.4969753513048116e-05,
      "loss": 1.5191,
      "num_input_tokens_seen": 18348953344,
      "step": 23322
    },
    {
      "epoch": 2.474326331423722,
      "grad_norm": 0.4037484445109069,
      "learning_rate": 4.496933540530218e-05,
      "loss": 1.6295,
      "num_input_tokens_seen": 18349740144,
      "step": 23323
    },
    {
      "epoch": 2.474432420963293,
      "grad_norm": 0.3628514644064055,
      "learning_rate": 4.4968917282124546e-05,
      "loss": 1.5722,
      "num_input_tokens_seen": 18350527008,
      "step": 23324
    },
    {
      "epoch": 2.4745385105028643,
      "grad_norm": 0.3911111417188548,
      "learning_rate": 4.496849914351551e-05,
      "loss": 1.6372,
      "num_input_tokens_seen": 18351313776,
      "step": 23325
    },
    {
      "epoch": 2.474644600042436,
      "grad_norm": 0.39052077039807065,
      "learning_rate": 4.49680809894754e-05,
      "loss": 1.5056,
      "num_input_tokens_seen": 18352100608,
      "step": 23326
    },
    {
      "epoch": 2.4747506895820073,
      "grad_norm": 0.36149731091487297,
      "learning_rate": 4.496766282000455e-05,
      "loss": 1.5953,
      "num_input_tokens_seen": 18352887312,
      "step": 23327
    },
    {
      "epoch": 2.4748567791215788,
      "grad_norm": 0.4015906395508826,
      "learning_rate": 4.496724463510327e-05,
      "loss": 1.5964,
      "num_input_tokens_seen": 18353674064,
      "step": 23328
    },
    {
      "epoch": 2.47496286866115,
      "grad_norm": 0.3464702271563553,
      "learning_rate": 4.496682643477189e-05,
      "loss": 1.4837,
      "num_input_tokens_seen": 18354460768,
      "step": 23329
    },
    {
      "epoch": 2.4750689582007213,
      "grad_norm": 0.424409800706473,
      "learning_rate": 4.4966408219010735e-05,
      "loss": 1.5598,
      "num_input_tokens_seen": 18355247584,
      "step": 23330
    },
    {
      "epoch": 2.4751750477402927,
      "grad_norm": 0.4096639820293123,
      "learning_rate": 4.496598998782012e-05,
      "loss": 1.6048,
      "num_input_tokens_seen": 18356034384,
      "step": 23331
    },
    {
      "epoch": 2.475281137279864,
      "grad_norm": 0.3494899185893046,
      "learning_rate": 4.4965571741200384e-05,
      "loss": 1.6085,
      "num_input_tokens_seen": 18356821248,
      "step": 23332
    },
    {
      "epoch": 2.4753872268194357,
      "grad_norm": 0.40934772421328836,
      "learning_rate": 4.496515347915183e-05,
      "loss": 1.5669,
      "num_input_tokens_seen": 18357608064,
      "step": 23333
    },
    {
      "epoch": 2.475493316359007,
      "grad_norm": 0.41151152492640486,
      "learning_rate": 4.49647352016748e-05,
      "loss": 1.5526,
      "num_input_tokens_seen": 18358394784,
      "step": 23334
    },
    {
      "epoch": 2.4755994058985786,
      "grad_norm": 0.35024256804337217,
      "learning_rate": 4.4964316908769604e-05,
      "loss": 1.5989,
      "num_input_tokens_seen": 18359181616,
      "step": 23335
    },
    {
      "epoch": 2.4757054954381497,
      "grad_norm": 0.4236331645322584,
      "learning_rate": 4.496389860043657e-05,
      "loss": 1.6602,
      "num_input_tokens_seen": 18359968272,
      "step": 23336
    },
    {
      "epoch": 2.475811584977721,
      "grad_norm": 0.4200534319843873,
      "learning_rate": 4.4963480276676024e-05,
      "loss": 1.5697,
      "num_input_tokens_seen": 18360755104,
      "step": 23337
    },
    {
      "epoch": 2.4759176745172926,
      "grad_norm": 0.3742517747364787,
      "learning_rate": 4.496306193748828e-05,
      "loss": 1.5118,
      "num_input_tokens_seen": 18361541872,
      "step": 23338
    },
    {
      "epoch": 2.476023764056864,
      "grad_norm": 0.3890717918757075,
      "learning_rate": 4.4962643582873674e-05,
      "loss": 1.5637,
      "num_input_tokens_seen": 18362328544,
      "step": 23339
    },
    {
      "epoch": 2.4761298535964356,
      "grad_norm": 0.45208225830392124,
      "learning_rate": 4.496222521283252e-05,
      "loss": 1.5367,
      "num_input_tokens_seen": 18363115296,
      "step": 23340
    },
    {
      "epoch": 2.4762359431360066,
      "grad_norm": 0.5438832955678693,
      "learning_rate": 4.496180682736514e-05,
      "loss": 1.5722,
      "num_input_tokens_seen": 18363902096,
      "step": 23341
    },
    {
      "epoch": 2.476342032675578,
      "grad_norm": 0.5941683564158298,
      "learning_rate": 4.4961388426471866e-05,
      "loss": 1.6103,
      "num_input_tokens_seen": 18364688848,
      "step": 23342
    },
    {
      "epoch": 2.4764481222151495,
      "grad_norm": 0.4587984278418622,
      "learning_rate": 4.4960970010153015e-05,
      "loss": 1.6174,
      "num_input_tokens_seen": 18365475616,
      "step": 23343
    },
    {
      "epoch": 2.476554211754721,
      "grad_norm": 0.5656107998569738,
      "learning_rate": 4.4960551578408913e-05,
      "loss": 1.6608,
      "num_input_tokens_seen": 18366262336,
      "step": 23344
    },
    {
      "epoch": 2.4766603012942925,
      "grad_norm": 0.3754025916039202,
      "learning_rate": 4.496013313123988e-05,
      "loss": 1.5822,
      "num_input_tokens_seen": 18367049104,
      "step": 23345
    },
    {
      "epoch": 2.476766390833864,
      "grad_norm": 0.4650271414565831,
      "learning_rate": 4.4959714668646244e-05,
      "loss": 1.6549,
      "num_input_tokens_seen": 18367835760,
      "step": 23346
    },
    {
      "epoch": 2.476872480373435,
      "grad_norm": 0.3731493009547918,
      "learning_rate": 4.495929619062833e-05,
      "loss": 1.5354,
      "num_input_tokens_seen": 18368622512,
      "step": 23347
    },
    {
      "epoch": 2.4769785699130065,
      "grad_norm": 0.4185018795360175,
      "learning_rate": 4.4958877697186454e-05,
      "loss": 1.7082,
      "num_input_tokens_seen": 18369409232,
      "step": 23348
    },
    {
      "epoch": 2.477084659452578,
      "grad_norm": 0.3501151662363149,
      "learning_rate": 4.495845918832094e-05,
      "loss": 1.5756,
      "num_input_tokens_seen": 18370196032,
      "step": 23349
    },
    {
      "epoch": 2.4771907489921494,
      "grad_norm": 0.4687195195185027,
      "learning_rate": 4.495804066403212e-05,
      "loss": 1.6692,
      "num_input_tokens_seen": 18370982752,
      "step": 23350
    },
    {
      "epoch": 2.477296838531721,
      "grad_norm": 0.3623679323006844,
      "learning_rate": 4.495762212432031e-05,
      "loss": 1.5027,
      "num_input_tokens_seen": 18371769568,
      "step": 23351
    },
    {
      "epoch": 2.4774029280712924,
      "grad_norm": 0.3873057970343561,
      "learning_rate": 4.495720356918583e-05,
      "loss": 1.6598,
      "num_input_tokens_seen": 18372556320,
      "step": 23352
    },
    {
      "epoch": 2.4775090176108634,
      "grad_norm": 0.4092268147224485,
      "learning_rate": 4.495678499862901e-05,
      "loss": 1.6394,
      "num_input_tokens_seen": 18373343024,
      "step": 23353
    },
    {
      "epoch": 2.477615107150435,
      "grad_norm": 0.4115899292492654,
      "learning_rate": 4.4956366412650175e-05,
      "loss": 1.5373,
      "num_input_tokens_seen": 18374129856,
      "step": 23354
    },
    {
      "epoch": 2.4777211966900063,
      "grad_norm": 0.4756398319504606,
      "learning_rate": 4.4955947811249644e-05,
      "loss": 1.6826,
      "num_input_tokens_seen": 18374916688,
      "step": 23355
    },
    {
      "epoch": 2.477827286229578,
      "grad_norm": 0.4409147636121827,
      "learning_rate": 4.4955529194427746e-05,
      "loss": 1.7377,
      "num_input_tokens_seen": 18375703408,
      "step": 23356
    },
    {
      "epoch": 2.4779333757691493,
      "grad_norm": 0.3816149877122444,
      "learning_rate": 4.49551105621848e-05,
      "loss": 1.5283,
      "num_input_tokens_seen": 18376490208,
      "step": 23357
    },
    {
      "epoch": 2.4780394653087203,
      "grad_norm": 0.39774415354627035,
      "learning_rate": 4.495469191452113e-05,
      "loss": 1.5737,
      "num_input_tokens_seen": 18377277008,
      "step": 23358
    },
    {
      "epoch": 2.478145554848292,
      "grad_norm": 0.5170057942012057,
      "learning_rate": 4.495427325143705e-05,
      "loss": 1.674,
      "num_input_tokens_seen": 18378063776,
      "step": 23359
    },
    {
      "epoch": 2.4782516443878633,
      "grad_norm": 0.3923063184494825,
      "learning_rate": 4.495385457293291e-05,
      "loss": 1.6243,
      "num_input_tokens_seen": 18378850544,
      "step": 23360
    },
    {
      "epoch": 2.4783577339274347,
      "grad_norm": 0.3867019979027155,
      "learning_rate": 4.4953435879009e-05,
      "loss": 1.6959,
      "num_input_tokens_seen": 18379637312,
      "step": 23361
    },
    {
      "epoch": 2.478463823467006,
      "grad_norm": 0.40703850321890267,
      "learning_rate": 4.495301716966567e-05,
      "loss": 1.6337,
      "num_input_tokens_seen": 18380423984,
      "step": 23362
    },
    {
      "epoch": 2.4785699130065777,
      "grad_norm": 0.37810898149673156,
      "learning_rate": 4.4952598444903224e-05,
      "loss": 1.613,
      "num_input_tokens_seen": 18381210720,
      "step": 23363
    },
    {
      "epoch": 2.478676002546149,
      "grad_norm": 0.3627900974691902,
      "learning_rate": 4.495217970472201e-05,
      "loss": 1.5543,
      "num_input_tokens_seen": 18381997536,
      "step": 23364
    },
    {
      "epoch": 2.47878209208572,
      "grad_norm": 0.4025617072881941,
      "learning_rate": 4.495176094912233e-05,
      "loss": 1.7192,
      "num_input_tokens_seen": 18382784224,
      "step": 23365
    },
    {
      "epoch": 2.4788881816252917,
      "grad_norm": 0.4004153130562803,
      "learning_rate": 4.495134217810452e-05,
      "loss": 1.5352,
      "num_input_tokens_seen": 18383570992,
      "step": 23366
    },
    {
      "epoch": 2.478994271164863,
      "grad_norm": 0.3636066027228395,
      "learning_rate": 4.495092339166889e-05,
      "loss": 1.5496,
      "num_input_tokens_seen": 18384357744,
      "step": 23367
    },
    {
      "epoch": 2.4791003607044346,
      "grad_norm": 0.4378201024289,
      "learning_rate": 4.495050458981577e-05,
      "loss": 1.6829,
      "num_input_tokens_seen": 18385144544,
      "step": 23368
    },
    {
      "epoch": 2.479206450244006,
      "grad_norm": 0.3710553486486257,
      "learning_rate": 4.4950085772545494e-05,
      "loss": 1.638,
      "num_input_tokens_seen": 18385931312,
      "step": 23369
    },
    {
      "epoch": 2.479312539783577,
      "grad_norm": 0.3761112769217948,
      "learning_rate": 4.494966693985837e-05,
      "loss": 1.6803,
      "num_input_tokens_seen": 18386718112,
      "step": 23370
    },
    {
      "epoch": 2.4794186293231486,
      "grad_norm": 0.38302311087098373,
      "learning_rate": 4.4949248091754733e-05,
      "loss": 1.5729,
      "num_input_tokens_seen": 18387504896,
      "step": 23371
    },
    {
      "epoch": 2.47952471886272,
      "grad_norm": 0.43942981292118694,
      "learning_rate": 4.49488292282349e-05,
      "loss": 1.6746,
      "num_input_tokens_seen": 18388291712,
      "step": 23372
    },
    {
      "epoch": 2.4796308084022916,
      "grad_norm": 0.33326122118115314,
      "learning_rate": 4.4948410349299195e-05,
      "loss": 1.5489,
      "num_input_tokens_seen": 18389078592,
      "step": 23373
    },
    {
      "epoch": 2.479736897941863,
      "grad_norm": 0.4034805956100842,
      "learning_rate": 4.494799145494795e-05,
      "loss": 1.5876,
      "num_input_tokens_seen": 18389865360,
      "step": 23374
    },
    {
      "epoch": 2.4798429874814345,
      "grad_norm": 0.4658489259663375,
      "learning_rate": 4.4947572545181474e-05,
      "loss": 1.6486,
      "num_input_tokens_seen": 18390652080,
      "step": 23375
    },
    {
      "epoch": 2.479949077021006,
      "grad_norm": 0.41257924964152376,
      "learning_rate": 4.4947153620000105e-05,
      "loss": 1.5748,
      "num_input_tokens_seen": 18391438848,
      "step": 23376
    },
    {
      "epoch": 2.480055166560577,
      "grad_norm": 0.4211425868773418,
      "learning_rate": 4.4946734679404166e-05,
      "loss": 1.4265,
      "num_input_tokens_seen": 18392225728,
      "step": 23377
    },
    {
      "epoch": 2.4801612561001485,
      "grad_norm": 0.4308998256419537,
      "learning_rate": 4.494631572339397e-05,
      "loss": 1.6464,
      "num_input_tokens_seen": 18393012384,
      "step": 23378
    },
    {
      "epoch": 2.48026734563972,
      "grad_norm": 0.4438265554028472,
      "learning_rate": 4.494589675196984e-05,
      "loss": 1.6128,
      "num_input_tokens_seen": 18393799184,
      "step": 23379
    },
    {
      "epoch": 2.4803734351792914,
      "grad_norm": 0.41892093242898526,
      "learning_rate": 4.4945477765132114e-05,
      "loss": 1.5264,
      "num_input_tokens_seen": 18394585936,
      "step": 23380
    },
    {
      "epoch": 2.480479524718863,
      "grad_norm": 0.4695430339991515,
      "learning_rate": 4.494505876288111e-05,
      "loss": 1.723,
      "num_input_tokens_seen": 18395372672,
      "step": 23381
    },
    {
      "epoch": 2.480585614258434,
      "grad_norm": 0.47069394750731725,
      "learning_rate": 4.4944639745217144e-05,
      "loss": 1.5572,
      "num_input_tokens_seen": 18396159456,
      "step": 23382
    },
    {
      "epoch": 2.4806917037980054,
      "grad_norm": 0.4401839142384719,
      "learning_rate": 4.494422071214055e-05,
      "loss": 1.5148,
      "num_input_tokens_seen": 18396946208,
      "step": 23383
    },
    {
      "epoch": 2.480797793337577,
      "grad_norm": 0.4201815374188028,
      "learning_rate": 4.494380166365165e-05,
      "loss": 1.5549,
      "num_input_tokens_seen": 18397732992,
      "step": 23384
    },
    {
      "epoch": 2.4809038828771484,
      "grad_norm": 0.46552015189506407,
      "learning_rate": 4.494338259975076e-05,
      "loss": 1.7083,
      "num_input_tokens_seen": 18398519792,
      "step": 23385
    },
    {
      "epoch": 2.48100997241672,
      "grad_norm": 0.4918341541468425,
      "learning_rate": 4.494296352043821e-05,
      "loss": 1.6036,
      "num_input_tokens_seen": 18399306496,
      "step": 23386
    },
    {
      "epoch": 2.481116061956291,
      "grad_norm": 0.42423109800041814,
      "learning_rate": 4.494254442571432e-05,
      "loss": 1.5352,
      "num_input_tokens_seen": 18400093328,
      "step": 23387
    },
    {
      "epoch": 2.4812221514958623,
      "grad_norm": 0.43774824768124454,
      "learning_rate": 4.494212531557942e-05,
      "loss": 1.5061,
      "num_input_tokens_seen": 18400880096,
      "step": 23388
    },
    {
      "epoch": 2.481328241035434,
      "grad_norm": 0.3980950518903241,
      "learning_rate": 4.4941706190033834e-05,
      "loss": 1.796,
      "num_input_tokens_seen": 18401666864,
      "step": 23389
    },
    {
      "epoch": 2.4814343305750053,
      "grad_norm": 0.4866136605075935,
      "learning_rate": 4.4941287049077876e-05,
      "loss": 1.5361,
      "num_input_tokens_seen": 18402453728,
      "step": 23390
    },
    {
      "epoch": 2.4815404201145768,
      "grad_norm": 0.3481108933136648,
      "learning_rate": 4.494086789271188e-05,
      "loss": 1.4642,
      "num_input_tokens_seen": 18403240512,
      "step": 23391
    },
    {
      "epoch": 2.4816465096541482,
      "grad_norm": 0.4365375273994567,
      "learning_rate": 4.494044872093617e-05,
      "loss": 1.5462,
      "num_input_tokens_seen": 18404027264,
      "step": 23392
    },
    {
      "epoch": 2.4817525991937197,
      "grad_norm": 0.3811843314676853,
      "learning_rate": 4.494002953375106e-05,
      "loss": 1.5915,
      "num_input_tokens_seen": 18404813968,
      "step": 23393
    },
    {
      "epoch": 2.4818586887332907,
      "grad_norm": 0.4953053976096493,
      "learning_rate": 4.493961033115688e-05,
      "loss": 1.5643,
      "num_input_tokens_seen": 18405600768,
      "step": 23394
    },
    {
      "epoch": 2.481964778272862,
      "grad_norm": 0.3783681757170975,
      "learning_rate": 4.493919111315396e-05,
      "loss": 1.5311,
      "num_input_tokens_seen": 18406387568,
      "step": 23395
    },
    {
      "epoch": 2.4820708678124337,
      "grad_norm": 0.39747448292566784,
      "learning_rate": 4.493877187974261e-05,
      "loss": 1.4138,
      "num_input_tokens_seen": 18407174416,
      "step": 23396
    },
    {
      "epoch": 2.482176957352005,
      "grad_norm": 0.43270027820639917,
      "learning_rate": 4.4938352630923176e-05,
      "loss": 1.6165,
      "num_input_tokens_seen": 18407961216,
      "step": 23397
    },
    {
      "epoch": 2.4822830468915766,
      "grad_norm": 0.35485984853481944,
      "learning_rate": 4.493793336669595e-05,
      "loss": 1.621,
      "num_input_tokens_seen": 18408747920,
      "step": 23398
    },
    {
      "epoch": 2.4823891364311477,
      "grad_norm": 0.4637322206168083,
      "learning_rate": 4.4937514087061285e-05,
      "loss": 1.7332,
      "num_input_tokens_seen": 18409534640,
      "step": 23399
    },
    {
      "epoch": 2.482495225970719,
      "grad_norm": 0.3622668588873435,
      "learning_rate": 4.4937094792019496e-05,
      "loss": 1.4562,
      "num_input_tokens_seen": 18410321504,
      "step": 23400
    },
    {
      "epoch": 2.4826013155102906,
      "grad_norm": 0.5609516964360354,
      "learning_rate": 4.4936675481570903e-05,
      "loss": 1.7137,
      "num_input_tokens_seen": 18411108240,
      "step": 23401
    },
    {
      "epoch": 2.482707405049862,
      "grad_norm": 0.4243060532799365,
      "learning_rate": 4.4936256155715825e-05,
      "loss": 1.7103,
      "num_input_tokens_seen": 18411894912,
      "step": 23402
    },
    {
      "epoch": 2.4828134945894336,
      "grad_norm": 0.5292481526751367,
      "learning_rate": 4.49358368144546e-05,
      "loss": 1.5977,
      "num_input_tokens_seen": 18412681616,
      "step": 23403
    },
    {
      "epoch": 2.482919584129005,
      "grad_norm": 0.3831593863135972,
      "learning_rate": 4.493541745778755e-05,
      "loss": 1.5156,
      "num_input_tokens_seen": 18413468544,
      "step": 23404
    },
    {
      "epoch": 2.4830256736685765,
      "grad_norm": 0.4692966391804299,
      "learning_rate": 4.493499808571499e-05,
      "loss": 1.5233,
      "num_input_tokens_seen": 18414255392,
      "step": 23405
    },
    {
      "epoch": 2.4831317632081475,
      "grad_norm": 0.4483104721686633,
      "learning_rate": 4.493457869823724e-05,
      "loss": 1.5279,
      "num_input_tokens_seen": 18415042240,
      "step": 23406
    },
    {
      "epoch": 2.483237852747719,
      "grad_norm": 0.6278208631399435,
      "learning_rate": 4.4934159295354644e-05,
      "loss": 1.5723,
      "num_input_tokens_seen": 18415829120,
      "step": 23407
    },
    {
      "epoch": 2.4833439422872905,
      "grad_norm": 0.4503175645591199,
      "learning_rate": 4.49337398770675e-05,
      "loss": 1.6325,
      "num_input_tokens_seen": 18416615904,
      "step": 23408
    },
    {
      "epoch": 2.483450031826862,
      "grad_norm": 0.5583438717536425,
      "learning_rate": 4.4933320443376164e-05,
      "loss": 1.7212,
      "num_input_tokens_seen": 18417402624,
      "step": 23409
    },
    {
      "epoch": 2.4835561213664334,
      "grad_norm": 0.525798069358018,
      "learning_rate": 4.4932900994280936e-05,
      "loss": 1.5656,
      "num_input_tokens_seen": 18418189344,
      "step": 23410
    },
    {
      "epoch": 2.4836622109060045,
      "grad_norm": 0.40797819615534936,
      "learning_rate": 4.493248152978214e-05,
      "loss": 1.5646,
      "num_input_tokens_seen": 18418976032,
      "step": 23411
    },
    {
      "epoch": 2.483768300445576,
      "grad_norm": 0.37369927688321497,
      "learning_rate": 4.4932062049880116e-05,
      "loss": 1.4167,
      "num_input_tokens_seen": 18419762848,
      "step": 23412
    },
    {
      "epoch": 2.4838743899851474,
      "grad_norm": 0.38616075250025683,
      "learning_rate": 4.493164255457518e-05,
      "loss": 1.5663,
      "num_input_tokens_seen": 18420549632,
      "step": 23413
    },
    {
      "epoch": 2.483980479524719,
      "grad_norm": 0.35642883902155253,
      "learning_rate": 4.493122304386766e-05,
      "loss": 1.5674,
      "num_input_tokens_seen": 18421336432,
      "step": 23414
    },
    {
      "epoch": 2.4840865690642904,
      "grad_norm": 0.40609700022823025,
      "learning_rate": 4.493080351775786e-05,
      "loss": 1.6489,
      "num_input_tokens_seen": 18422123184,
      "step": 23415
    },
    {
      "epoch": 2.484192658603862,
      "grad_norm": 0.4141876595226782,
      "learning_rate": 4.493038397624613e-05,
      "loss": 1.562,
      "num_input_tokens_seen": 18422909984,
      "step": 23416
    },
    {
      "epoch": 2.484298748143433,
      "grad_norm": 0.4450603578681151,
      "learning_rate": 4.492996441933278e-05,
      "loss": 1.6368,
      "num_input_tokens_seen": 18423696672,
      "step": 23417
    },
    {
      "epoch": 2.4844048376830044,
      "grad_norm": 0.3815410321102881,
      "learning_rate": 4.4929544847018146e-05,
      "loss": 1.5621,
      "num_input_tokens_seen": 18424483360,
      "step": 23418
    },
    {
      "epoch": 2.484510927222576,
      "grad_norm": 0.40144917594498464,
      "learning_rate": 4.492912525930254e-05,
      "loss": 1.5878,
      "num_input_tokens_seen": 18425270064,
      "step": 23419
    },
    {
      "epoch": 2.4846170167621473,
      "grad_norm": 0.38304042664083177,
      "learning_rate": 4.492870565618629e-05,
      "loss": 1.5133,
      "num_input_tokens_seen": 18426056816,
      "step": 23420
    },
    {
      "epoch": 2.4847231063017188,
      "grad_norm": 0.5566819925987511,
      "learning_rate": 4.492828603766972e-05,
      "loss": 1.5614,
      "num_input_tokens_seen": 18426843696,
      "step": 23421
    },
    {
      "epoch": 2.4848291958412903,
      "grad_norm": 0.38447496977804735,
      "learning_rate": 4.492786640375315e-05,
      "loss": 1.6062,
      "num_input_tokens_seen": 18427630448,
      "step": 23422
    },
    {
      "epoch": 2.4849352853808613,
      "grad_norm": 0.8471883651948161,
      "learning_rate": 4.492744675443692e-05,
      "loss": 1.7661,
      "num_input_tokens_seen": 18428417152,
      "step": 23423
    },
    {
      "epoch": 2.4850413749204328,
      "grad_norm": 0.5122696578179323,
      "learning_rate": 4.492702708972134e-05,
      "loss": 1.6234,
      "num_input_tokens_seen": 18429203872,
      "step": 23424
    },
    {
      "epoch": 2.4851474644600042,
      "grad_norm": 0.5449548415522573,
      "learning_rate": 4.492660740960673e-05,
      "loss": 1.6452,
      "num_input_tokens_seen": 18429990640,
      "step": 23425
    },
    {
      "epoch": 2.4852535539995757,
      "grad_norm": 0.4011863200045426,
      "learning_rate": 4.492618771409344e-05,
      "loss": 1.6482,
      "num_input_tokens_seen": 18430777440,
      "step": 23426
    },
    {
      "epoch": 2.485359643539147,
      "grad_norm": 0.5304134396476181,
      "learning_rate": 4.492576800318176e-05,
      "loss": 1.4287,
      "num_input_tokens_seen": 18431564272,
      "step": 23427
    },
    {
      "epoch": 2.485465733078718,
      "grad_norm": 0.6736734498713673,
      "learning_rate": 4.492534827687204e-05,
      "loss": 1.5157,
      "num_input_tokens_seen": 18432351072,
      "step": 23428
    },
    {
      "epoch": 2.4855718226182897,
      "grad_norm": 0.6075901982858734,
      "learning_rate": 4.492492853516459e-05,
      "loss": 1.5516,
      "num_input_tokens_seen": 18433137760,
      "step": 23429
    },
    {
      "epoch": 2.485677912157861,
      "grad_norm": 0.716567372367126,
      "learning_rate": 4.492450877805975e-05,
      "loss": 1.5239,
      "num_input_tokens_seen": 18433924480,
      "step": 23430
    },
    {
      "epoch": 2.4857840016974326,
      "grad_norm": 0.4952632688845578,
      "learning_rate": 4.4924089005557826e-05,
      "loss": 1.7698,
      "num_input_tokens_seen": 18434711216,
      "step": 23431
    },
    {
      "epoch": 2.485890091237004,
      "grad_norm": 0.5707803705657877,
      "learning_rate": 4.492366921765915e-05,
      "loss": 1.6075,
      "num_input_tokens_seen": 18435497904,
      "step": 23432
    },
    {
      "epoch": 2.4859961807765756,
      "grad_norm": 0.5684523793502025,
      "learning_rate": 4.492324941436405e-05,
      "loss": 1.6266,
      "num_input_tokens_seen": 18436284640,
      "step": 23433
    },
    {
      "epoch": 2.486102270316147,
      "grad_norm": 0.5906301797949189,
      "learning_rate": 4.4922829595672846e-05,
      "loss": 1.6597,
      "num_input_tokens_seen": 18437071392,
      "step": 23434
    },
    {
      "epoch": 2.486208359855718,
      "grad_norm": 0.693115717868958,
      "learning_rate": 4.492240976158586e-05,
      "loss": 1.674,
      "num_input_tokens_seen": 18437858176,
      "step": 23435
    },
    {
      "epoch": 2.4863144493952896,
      "grad_norm": 0.40657917687599243,
      "learning_rate": 4.4921989912103425e-05,
      "loss": 1.6422,
      "num_input_tokens_seen": 18438644912,
      "step": 23436
    },
    {
      "epoch": 2.486420538934861,
      "grad_norm": 0.6444121345895626,
      "learning_rate": 4.4921570047225866e-05,
      "loss": 1.7189,
      "num_input_tokens_seen": 18439431616,
      "step": 23437
    },
    {
      "epoch": 2.4865266284744325,
      "grad_norm": 0.5239568645901213,
      "learning_rate": 4.49211501669535e-05,
      "loss": 1.6162,
      "num_input_tokens_seen": 18440218400,
      "step": 23438
    },
    {
      "epoch": 2.486632718014004,
      "grad_norm": 0.6927895664994029,
      "learning_rate": 4.492073027128665e-05,
      "loss": 1.6809,
      "num_input_tokens_seen": 18441005152,
      "step": 23439
    },
    {
      "epoch": 2.486738807553575,
      "grad_norm": 0.4356132872260881,
      "learning_rate": 4.4920310360225635e-05,
      "loss": 1.5607,
      "num_input_tokens_seen": 18441791824,
      "step": 23440
    },
    {
      "epoch": 2.4868448970931465,
      "grad_norm": 0.5234801372725695,
      "learning_rate": 4.4919890433770806e-05,
      "loss": 1.4854,
      "num_input_tokens_seen": 18442578592,
      "step": 23441
    },
    {
      "epoch": 2.486950986632718,
      "grad_norm": 0.45776578344985086,
      "learning_rate": 4.4919470491922455e-05,
      "loss": 1.6586,
      "num_input_tokens_seen": 18443365344,
      "step": 23442
    },
    {
      "epoch": 2.4870570761722894,
      "grad_norm": 0.4919130039320975,
      "learning_rate": 4.491905053468093e-05,
      "loss": 1.6727,
      "num_input_tokens_seen": 18444152096,
      "step": 23443
    },
    {
      "epoch": 2.487163165711861,
      "grad_norm": 0.39857613004119685,
      "learning_rate": 4.4918630562046546e-05,
      "loss": 1.5715,
      "num_input_tokens_seen": 18444938864,
      "step": 23444
    },
    {
      "epoch": 2.4872692552514324,
      "grad_norm": 0.4080822077617342,
      "learning_rate": 4.491821057401963e-05,
      "loss": 1.5651,
      "num_input_tokens_seen": 18445725664,
      "step": 23445
    },
    {
      "epoch": 2.4873753447910034,
      "grad_norm": 0.4461364036529684,
      "learning_rate": 4.4917790570600504e-05,
      "loss": 1.7587,
      "num_input_tokens_seen": 18446512368,
      "step": 23446
    },
    {
      "epoch": 2.487481434330575,
      "grad_norm": 0.4866097319079861,
      "learning_rate": 4.491737055178949e-05,
      "loss": 1.6013,
      "num_input_tokens_seen": 18447299168,
      "step": 23447
    },
    {
      "epoch": 2.4875875238701464,
      "grad_norm": 0.4319944453543592,
      "learning_rate": 4.491695051758692e-05,
      "loss": 1.6627,
      "num_input_tokens_seen": 18448085952,
      "step": 23448
    },
    {
      "epoch": 2.487693613409718,
      "grad_norm": 0.35190707634375945,
      "learning_rate": 4.491653046799312e-05,
      "loss": 1.5849,
      "num_input_tokens_seen": 18448872640,
      "step": 23449
    },
    {
      "epoch": 2.4877997029492893,
      "grad_norm": 0.4327118614604747,
      "learning_rate": 4.4916110403008406e-05,
      "loss": 1.6553,
      "num_input_tokens_seen": 18449659456,
      "step": 23450
    },
    {
      "epoch": 2.487905792488861,
      "grad_norm": 0.37378081017821424,
      "learning_rate": 4.491569032263311e-05,
      "loss": 1.5253,
      "num_input_tokens_seen": 18450446176,
      "step": 23451
    },
    {
      "epoch": 2.488011882028432,
      "grad_norm": 0.3923597202704943,
      "learning_rate": 4.491527022686755e-05,
      "loss": 1.5725,
      "num_input_tokens_seen": 18451232880,
      "step": 23452
    },
    {
      "epoch": 2.4881179715680033,
      "grad_norm": 0.42281984535781514,
      "learning_rate": 4.491485011571205e-05,
      "loss": 1.5382,
      "num_input_tokens_seen": 18452019664,
      "step": 23453
    },
    {
      "epoch": 2.4882240611075748,
      "grad_norm": 0.4096169410995524,
      "learning_rate": 4.491442998916694e-05,
      "loss": 1.6138,
      "num_input_tokens_seen": 18452806592,
      "step": 23454
    },
    {
      "epoch": 2.4883301506471462,
      "grad_norm": 0.41659761014917696,
      "learning_rate": 4.4914009847232544e-05,
      "loss": 1.5625,
      "num_input_tokens_seen": 18453593424,
      "step": 23455
    },
    {
      "epoch": 2.4884362401867177,
      "grad_norm": 0.38268349700307275,
      "learning_rate": 4.491358968990918e-05,
      "loss": 1.5964,
      "num_input_tokens_seen": 18454380224,
      "step": 23456
    },
    {
      "epoch": 2.4885423297262887,
      "grad_norm": 0.4376952918732932,
      "learning_rate": 4.491316951719718e-05,
      "loss": 1.6126,
      "num_input_tokens_seen": 18455167040,
      "step": 23457
    },
    {
      "epoch": 2.4886484192658602,
      "grad_norm": 0.3848520636431883,
      "learning_rate": 4.491274932909687e-05,
      "loss": 1.5745,
      "num_input_tokens_seen": 18455953808,
      "step": 23458
    },
    {
      "epoch": 2.4887545088054317,
      "grad_norm": 0.4146512530519474,
      "learning_rate": 4.4912329125608575e-05,
      "loss": 1.5754,
      "num_input_tokens_seen": 18456740528,
      "step": 23459
    },
    {
      "epoch": 2.488860598345003,
      "grad_norm": 0.4790351413144643,
      "learning_rate": 4.491190890673262e-05,
      "loss": 1.5885,
      "num_input_tokens_seen": 18457527264,
      "step": 23460
    },
    {
      "epoch": 2.4889666878845746,
      "grad_norm": 0.43351503227715804,
      "learning_rate": 4.491148867246931e-05,
      "loss": 1.6652,
      "num_input_tokens_seen": 18458313968,
      "step": 23461
    },
    {
      "epoch": 2.489072777424146,
      "grad_norm": 0.5459624294109537,
      "learning_rate": 4.491106842281899e-05,
      "loss": 1.5705,
      "num_input_tokens_seen": 18459100768,
      "step": 23462
    },
    {
      "epoch": 2.4891788669637176,
      "grad_norm": 0.3933121606001333,
      "learning_rate": 4.4910648157781985e-05,
      "loss": 1.5218,
      "num_input_tokens_seen": 18459887504,
      "step": 23463
    },
    {
      "epoch": 2.4892849565032886,
      "grad_norm": 0.5738935341313728,
      "learning_rate": 4.491022787735862e-05,
      "loss": 1.5406,
      "num_input_tokens_seen": 18460674240,
      "step": 23464
    },
    {
      "epoch": 2.48939104604286,
      "grad_norm": 0.3910830323788414,
      "learning_rate": 4.4909807581549214e-05,
      "loss": 1.5819,
      "num_input_tokens_seen": 18461460976,
      "step": 23465
    },
    {
      "epoch": 2.4894971355824316,
      "grad_norm": 0.4430011945819714,
      "learning_rate": 4.4909387270354084e-05,
      "loss": 1.656,
      "num_input_tokens_seen": 18462247728,
      "step": 23466
    },
    {
      "epoch": 2.489603225122003,
      "grad_norm": 0.46143188244731964,
      "learning_rate": 4.490896694377357e-05,
      "loss": 1.6689,
      "num_input_tokens_seen": 18463034512,
      "step": 23467
    },
    {
      "epoch": 2.4897093146615745,
      "grad_norm": 0.5118060412238832,
      "learning_rate": 4.490854660180799e-05,
      "loss": 1.6812,
      "num_input_tokens_seen": 18463821216,
      "step": 23468
    },
    {
      "epoch": 2.4898154042011456,
      "grad_norm": 0.40075533071316305,
      "learning_rate": 4.490812624445767e-05,
      "loss": 1.5645,
      "num_input_tokens_seen": 18464607968,
      "step": 23469
    },
    {
      "epoch": 2.489921493740717,
      "grad_norm": 0.43864493191450565,
      "learning_rate": 4.4907705871722925e-05,
      "loss": 1.6076,
      "num_input_tokens_seen": 18465394640,
      "step": 23470
    },
    {
      "epoch": 2.4900275832802885,
      "grad_norm": 0.43424199020704585,
      "learning_rate": 4.49072854836041e-05,
      "loss": 1.6652,
      "num_input_tokens_seen": 18466181440,
      "step": 23471
    },
    {
      "epoch": 2.49013367281986,
      "grad_norm": 0.3516680464040864,
      "learning_rate": 4.4906865080101507e-05,
      "loss": 1.6162,
      "num_input_tokens_seen": 18466968080,
      "step": 23472
    },
    {
      "epoch": 2.4902397623594315,
      "grad_norm": 0.5140366380970616,
      "learning_rate": 4.4906444661215475e-05,
      "loss": 1.6361,
      "num_input_tokens_seen": 18467754896,
      "step": 23473
    },
    {
      "epoch": 2.490345851899003,
      "grad_norm": 0.3999719543673554,
      "learning_rate": 4.490602422694632e-05,
      "loss": 1.5313,
      "num_input_tokens_seen": 18468541648,
      "step": 23474
    },
    {
      "epoch": 2.4904519414385744,
      "grad_norm": 0.43906390624643743,
      "learning_rate": 4.4905603777294374e-05,
      "loss": 1.5393,
      "num_input_tokens_seen": 18469328464,
      "step": 23475
    },
    {
      "epoch": 2.4905580309781454,
      "grad_norm": 0.3584435321574282,
      "learning_rate": 4.490518331225997e-05,
      "loss": 1.6349,
      "num_input_tokens_seen": 18470115168,
      "step": 23476
    },
    {
      "epoch": 2.490664120517717,
      "grad_norm": 0.38236211553592436,
      "learning_rate": 4.490476283184342e-05,
      "loss": 1.6176,
      "num_input_tokens_seen": 18470901920,
      "step": 23477
    },
    {
      "epoch": 2.4907702100572884,
      "grad_norm": 0.3946572611699111,
      "learning_rate": 4.4904342336045046e-05,
      "loss": 1.6011,
      "num_input_tokens_seen": 18471688672,
      "step": 23478
    },
    {
      "epoch": 2.49087629959686,
      "grad_norm": 0.37152519046404114,
      "learning_rate": 4.4903921824865187e-05,
      "loss": 1.6637,
      "num_input_tokens_seen": 18472475440,
      "step": 23479
    },
    {
      "epoch": 2.4909823891364313,
      "grad_norm": 0.3728232168211079,
      "learning_rate": 4.4903501298304164e-05,
      "loss": 1.6095,
      "num_input_tokens_seen": 18473262176,
      "step": 23480
    },
    {
      "epoch": 2.4910884786760024,
      "grad_norm": 0.38651158697945465,
      "learning_rate": 4.490308075636229e-05,
      "loss": 1.6833,
      "num_input_tokens_seen": 18474048992,
      "step": 23481
    },
    {
      "epoch": 2.491194568215574,
      "grad_norm": 0.4086198298646818,
      "learning_rate": 4.4902660199039905e-05,
      "loss": 1.8317,
      "num_input_tokens_seen": 18474835808,
      "step": 23482
    },
    {
      "epoch": 2.4913006577551453,
      "grad_norm": 0.34645344802805594,
      "learning_rate": 4.4902239626337325e-05,
      "loss": 1.5858,
      "num_input_tokens_seen": 18475622576,
      "step": 23483
    },
    {
      "epoch": 2.491406747294717,
      "grad_norm": 0.3617265042909596,
      "learning_rate": 4.490181903825489e-05,
      "loss": 1.574,
      "num_input_tokens_seen": 18476409408,
      "step": 23484
    },
    {
      "epoch": 2.4915128368342883,
      "grad_norm": 0.4778330500863586,
      "learning_rate": 4.49013984347929e-05,
      "loss": 1.7154,
      "num_input_tokens_seen": 18477196192,
      "step": 23485
    },
    {
      "epoch": 2.4916189263738593,
      "grad_norm": 0.3745502912944595,
      "learning_rate": 4.4900977815951696e-05,
      "loss": 1.6486,
      "num_input_tokens_seen": 18477982896,
      "step": 23486
    },
    {
      "epoch": 2.4917250159134308,
      "grad_norm": 0.42667883133564827,
      "learning_rate": 4.490055718173161e-05,
      "loss": 1.5834,
      "num_input_tokens_seen": 18478769696,
      "step": 23487
    },
    {
      "epoch": 2.4918311054530022,
      "grad_norm": 0.3564368308268006,
      "learning_rate": 4.4900136532132944e-05,
      "loss": 1.6877,
      "num_input_tokens_seen": 18479556528,
      "step": 23488
    },
    {
      "epoch": 2.4919371949925737,
      "grad_norm": 0.3658434333869246,
      "learning_rate": 4.489971586715604e-05,
      "loss": 1.4321,
      "num_input_tokens_seen": 18480343264,
      "step": 23489
    },
    {
      "epoch": 2.492043284532145,
      "grad_norm": 0.35123891708921934,
      "learning_rate": 4.489929518680122e-05,
      "loss": 1.5607,
      "num_input_tokens_seen": 18481130160,
      "step": 23490
    },
    {
      "epoch": 2.4921493740717167,
      "grad_norm": 0.3346075349803394,
      "learning_rate": 4.489887449106881e-05,
      "loss": 1.5735,
      "num_input_tokens_seen": 18481916992,
      "step": 23491
    },
    {
      "epoch": 2.492255463611288,
      "grad_norm": 0.38731659568060306,
      "learning_rate": 4.4898453779959134e-05,
      "loss": 1.6669,
      "num_input_tokens_seen": 18482703792,
      "step": 23492
    },
    {
      "epoch": 2.492361553150859,
      "grad_norm": 0.368037243682514,
      "learning_rate": 4.489803305347252e-05,
      "loss": 1.6177,
      "num_input_tokens_seen": 18483490544,
      "step": 23493
    },
    {
      "epoch": 2.4924676426904306,
      "grad_norm": 0.3193622585255421,
      "learning_rate": 4.489761231160928e-05,
      "loss": 1.6271,
      "num_input_tokens_seen": 18484277248,
      "step": 23494
    },
    {
      "epoch": 2.492573732230002,
      "grad_norm": 0.61051907671464,
      "learning_rate": 4.489719155436976e-05,
      "loss": 1.6098,
      "num_input_tokens_seen": 18485064048,
      "step": 23495
    },
    {
      "epoch": 2.4926798217695736,
      "grad_norm": 0.43474954133783733,
      "learning_rate": 4.4896770781754264e-05,
      "loss": 1.6602,
      "num_input_tokens_seen": 18485850768,
      "step": 23496
    },
    {
      "epoch": 2.492785911309145,
      "grad_norm": 0.596886441120934,
      "learning_rate": 4.489634999376313e-05,
      "loss": 1.5738,
      "num_input_tokens_seen": 18486637552,
      "step": 23497
    },
    {
      "epoch": 2.492892000848716,
      "grad_norm": 0.42944439032901455,
      "learning_rate": 4.489592919039669e-05,
      "loss": 1.5655,
      "num_input_tokens_seen": 18487424304,
      "step": 23498
    },
    {
      "epoch": 2.4929980903882876,
      "grad_norm": 0.6305435862756855,
      "learning_rate": 4.489550837165525e-05,
      "loss": 1.7004,
      "num_input_tokens_seen": 18488211088,
      "step": 23499
    },
    {
      "epoch": 2.493104179927859,
      "grad_norm": 0.37414866705532845,
      "learning_rate": 4.489508753753915e-05,
      "loss": 1.5399,
      "num_input_tokens_seen": 18488997872,
      "step": 23500
    },
    {
      "epoch": 2.4932102694674305,
      "grad_norm": 0.4288986252385439,
      "learning_rate": 4.48946666880487e-05,
      "loss": 1.5523,
      "num_input_tokens_seen": 18489784592,
      "step": 23501
    },
    {
      "epoch": 2.493316359007002,
      "grad_norm": 0.4937377265361078,
      "learning_rate": 4.4894245823184244e-05,
      "loss": 1.6816,
      "num_input_tokens_seen": 18490571184,
      "step": 23502
    },
    {
      "epoch": 2.4934224485465735,
      "grad_norm": 0.4138241856040832,
      "learning_rate": 4.4893824942946106e-05,
      "loss": 1.7496,
      "num_input_tokens_seen": 18491357904,
      "step": 23503
    },
    {
      "epoch": 2.493528538086145,
      "grad_norm": 0.5308770667991555,
      "learning_rate": 4.489340404733459e-05,
      "loss": 1.5309,
      "num_input_tokens_seen": 18492144592,
      "step": 23504
    },
    {
      "epoch": 2.493634627625716,
      "grad_norm": 0.5733689299097074,
      "learning_rate": 4.489298313635004e-05,
      "loss": 1.5689,
      "num_input_tokens_seen": 18492931312,
      "step": 23505
    },
    {
      "epoch": 2.4937407171652874,
      "grad_norm": 0.6145768319986834,
      "learning_rate": 4.489256220999278e-05,
      "loss": 1.5872,
      "num_input_tokens_seen": 18493718080,
      "step": 23506
    },
    {
      "epoch": 2.493846806704859,
      "grad_norm": 0.48640774511923407,
      "learning_rate": 4.489214126826313e-05,
      "loss": 1.5491,
      "num_input_tokens_seen": 18494504832,
      "step": 23507
    },
    {
      "epoch": 2.4939528962444304,
      "grad_norm": 0.4292359441540476,
      "learning_rate": 4.489172031116141e-05,
      "loss": 1.6778,
      "num_input_tokens_seen": 18495291616,
      "step": 23508
    },
    {
      "epoch": 2.494058985784002,
      "grad_norm": 0.40234709080677294,
      "learning_rate": 4.489129933868796e-05,
      "loss": 1.5516,
      "num_input_tokens_seen": 18496078400,
      "step": 23509
    },
    {
      "epoch": 2.494165075323573,
      "grad_norm": 0.4766506452925329,
      "learning_rate": 4.4890878350843094e-05,
      "loss": 1.6832,
      "num_input_tokens_seen": 18496865136,
      "step": 23510
    },
    {
      "epoch": 2.4942711648631444,
      "grad_norm": 0.39487617977011474,
      "learning_rate": 4.489045734762715e-05,
      "loss": 1.4821,
      "num_input_tokens_seen": 18497651904,
      "step": 23511
    },
    {
      "epoch": 2.494377254402716,
      "grad_norm": 0.49293781267744546,
      "learning_rate": 4.489003632904043e-05,
      "loss": 1.6337,
      "num_input_tokens_seen": 18498438704,
      "step": 23512
    },
    {
      "epoch": 2.4944833439422873,
      "grad_norm": 0.3498794269348065,
      "learning_rate": 4.488961529508328e-05,
      "loss": 1.5986,
      "num_input_tokens_seen": 18499225488,
      "step": 23513
    },
    {
      "epoch": 2.494589433481859,
      "grad_norm": 0.4358486457170408,
      "learning_rate": 4.488919424575602e-05,
      "loss": 1.5533,
      "num_input_tokens_seen": 18500012336,
      "step": 23514
    },
    {
      "epoch": 2.4946955230214303,
      "grad_norm": 0.4761822573909964,
      "learning_rate": 4.488877318105896e-05,
      "loss": 1.7467,
      "num_input_tokens_seen": 18500798960,
      "step": 23515
    },
    {
      "epoch": 2.4948016125610013,
      "grad_norm": 0.37353820220388007,
      "learning_rate": 4.488835210099246e-05,
      "loss": 1.7025,
      "num_input_tokens_seen": 18501585840,
      "step": 23516
    },
    {
      "epoch": 2.4949077021005728,
      "grad_norm": 0.4149145138372581,
      "learning_rate": 4.488793100555681e-05,
      "loss": 1.6459,
      "num_input_tokens_seen": 18502372576,
      "step": 23517
    },
    {
      "epoch": 2.4950137916401443,
      "grad_norm": 0.3873265918855817,
      "learning_rate": 4.488750989475237e-05,
      "loss": 1.52,
      "num_input_tokens_seen": 18503159376,
      "step": 23518
    },
    {
      "epoch": 2.4951198811797157,
      "grad_norm": 0.37220107883994114,
      "learning_rate": 4.4887088768579434e-05,
      "loss": 1.6104,
      "num_input_tokens_seen": 18503946192,
      "step": 23519
    },
    {
      "epoch": 2.495225970719287,
      "grad_norm": 0.32819341025866045,
      "learning_rate": 4.488666762703834e-05,
      "loss": 1.5011,
      "num_input_tokens_seen": 18504733072,
      "step": 23520
    },
    {
      "epoch": 2.4953320602588587,
      "grad_norm": 0.44712861442987717,
      "learning_rate": 4.4886246470129405e-05,
      "loss": 1.7049,
      "num_input_tokens_seen": 18505519792,
      "step": 23521
    },
    {
      "epoch": 2.4954381497984297,
      "grad_norm": 0.43814590412262683,
      "learning_rate": 4.488582529785297e-05,
      "loss": 1.6424,
      "num_input_tokens_seen": 18506306512,
      "step": 23522
    },
    {
      "epoch": 2.495544239338001,
      "grad_norm": 0.4240960312514231,
      "learning_rate": 4.488540411020935e-05,
      "loss": 1.7171,
      "num_input_tokens_seen": 18507093216,
      "step": 23523
    },
    {
      "epoch": 2.4956503288775727,
      "grad_norm": 0.3790432932436928,
      "learning_rate": 4.488498290719888e-05,
      "loss": 1.6338,
      "num_input_tokens_seen": 18507879920,
      "step": 23524
    },
    {
      "epoch": 2.495756418417144,
      "grad_norm": 0.3470845085376928,
      "learning_rate": 4.488456168882187e-05,
      "loss": 1.5896,
      "num_input_tokens_seen": 18508666672,
      "step": 23525
    },
    {
      "epoch": 2.4958625079567156,
      "grad_norm": 0.4153140977329074,
      "learning_rate": 4.488414045507866e-05,
      "loss": 1.6394,
      "num_input_tokens_seen": 18509453392,
      "step": 23526
    },
    {
      "epoch": 2.4959685974962866,
      "grad_norm": 0.40822238349980017,
      "learning_rate": 4.488371920596956e-05,
      "loss": 1.5954,
      "num_input_tokens_seen": 18510240112,
      "step": 23527
    },
    {
      "epoch": 2.496074687035858,
      "grad_norm": 0.45415720844649243,
      "learning_rate": 4.488329794149492e-05,
      "loss": 1.6867,
      "num_input_tokens_seen": 18511026848,
      "step": 23528
    },
    {
      "epoch": 2.4961807765754296,
      "grad_norm": 0.4657597774906717,
      "learning_rate": 4.488287666165504e-05,
      "loss": 1.6246,
      "num_input_tokens_seen": 18511813600,
      "step": 23529
    },
    {
      "epoch": 2.496286866115001,
      "grad_norm": 0.3795656582347155,
      "learning_rate": 4.488245536645026e-05,
      "loss": 1.4995,
      "num_input_tokens_seen": 18512600320,
      "step": 23530
    },
    {
      "epoch": 2.4963929556545725,
      "grad_norm": 0.3766199645747846,
      "learning_rate": 4.4882034055880906e-05,
      "loss": 1.6917,
      "num_input_tokens_seen": 18513387072,
      "step": 23531
    },
    {
      "epoch": 2.496499045194144,
      "grad_norm": 0.4179725127322084,
      "learning_rate": 4.488161272994729e-05,
      "loss": 1.6885,
      "num_input_tokens_seen": 18514173856,
      "step": 23532
    },
    {
      "epoch": 2.4966051347337155,
      "grad_norm": 0.4094645471928526,
      "learning_rate": 4.488119138864976e-05,
      "loss": 1.7456,
      "num_input_tokens_seen": 18514960608,
      "step": 23533
    },
    {
      "epoch": 2.4967112242732865,
      "grad_norm": 0.36478770431798296,
      "learning_rate": 4.4880770031988616e-05,
      "loss": 1.5736,
      "num_input_tokens_seen": 18515747328,
      "step": 23534
    },
    {
      "epoch": 2.496817313812858,
      "grad_norm": 0.5454610701718762,
      "learning_rate": 4.48803486599642e-05,
      "loss": 1.6654,
      "num_input_tokens_seen": 18516534048,
      "step": 23535
    },
    {
      "epoch": 2.4969234033524295,
      "grad_norm": 0.444392645781452,
      "learning_rate": 4.487992727257684e-05,
      "loss": 1.745,
      "num_input_tokens_seen": 18517320816,
      "step": 23536
    },
    {
      "epoch": 2.497029492892001,
      "grad_norm": 0.40622594255153016,
      "learning_rate": 4.487950586982685e-05,
      "loss": 1.6161,
      "num_input_tokens_seen": 18518107632,
      "step": 23537
    },
    {
      "epoch": 2.4971355824315724,
      "grad_norm": 0.38371487808534543,
      "learning_rate": 4.487908445171456e-05,
      "loss": 1.5758,
      "num_input_tokens_seen": 18518894384,
      "step": 23538
    },
    {
      "epoch": 2.4972416719711434,
      "grad_norm": 0.37752129230333853,
      "learning_rate": 4.48786630182403e-05,
      "loss": 1.4915,
      "num_input_tokens_seen": 18519681136,
      "step": 23539
    },
    {
      "epoch": 2.497347761510715,
      "grad_norm": 0.5327638538317186,
      "learning_rate": 4.4878241569404386e-05,
      "loss": 1.6946,
      "num_input_tokens_seen": 18520467808,
      "step": 23540
    },
    {
      "epoch": 2.4974538510502864,
      "grad_norm": 0.3848639612432902,
      "learning_rate": 4.487782010520716e-05,
      "loss": 1.4932,
      "num_input_tokens_seen": 18521254544,
      "step": 23541
    },
    {
      "epoch": 2.497559940589858,
      "grad_norm": 0.4463352277408513,
      "learning_rate": 4.4877398625648926e-05,
      "loss": 1.6718,
      "num_input_tokens_seen": 18522041296,
      "step": 23542
    },
    {
      "epoch": 2.4976660301294293,
      "grad_norm": 0.39308068763161125,
      "learning_rate": 4.4876977130730036e-05,
      "loss": 1.5749,
      "num_input_tokens_seen": 18522828112,
      "step": 23543
    },
    {
      "epoch": 2.497772119669001,
      "grad_norm": 0.43539734250364553,
      "learning_rate": 4.487655562045079e-05,
      "loss": 1.6071,
      "num_input_tokens_seen": 18523614912,
      "step": 23544
    },
    {
      "epoch": 2.497878209208572,
      "grad_norm": 0.4728718464320622,
      "learning_rate": 4.487613409481153e-05,
      "loss": 1.7438,
      "num_input_tokens_seen": 18524401632,
      "step": 23545
    },
    {
      "epoch": 2.4979842987481433,
      "grad_norm": 0.4222893663156617,
      "learning_rate": 4.487571255381258e-05,
      "loss": 1.6174,
      "num_input_tokens_seen": 18525188400,
      "step": 23546
    },
    {
      "epoch": 2.498090388287715,
      "grad_norm": 0.4597000415416284,
      "learning_rate": 4.4875290997454255e-05,
      "loss": 1.6545,
      "num_input_tokens_seen": 18525975248,
      "step": 23547
    },
    {
      "epoch": 2.4981964778272863,
      "grad_norm": 0.526631865249483,
      "learning_rate": 4.487486942573689e-05,
      "loss": 1.5686,
      "num_input_tokens_seen": 18526761952,
      "step": 23548
    },
    {
      "epoch": 2.4983025673668577,
      "grad_norm": 0.43147491371160746,
      "learning_rate": 4.487444783866081e-05,
      "loss": 1.5525,
      "num_input_tokens_seen": 18527548736,
      "step": 23549
    },
    {
      "epoch": 2.498408656906429,
      "grad_norm": 0.43036686532810436,
      "learning_rate": 4.4874026236226344e-05,
      "loss": 1.5678,
      "num_input_tokens_seen": 18528335584,
      "step": 23550
    },
    {
      "epoch": 2.4985147464460002,
      "grad_norm": 0.33312821982234275,
      "learning_rate": 4.4873604618433806e-05,
      "loss": 1.5471,
      "num_input_tokens_seen": 18529122432,
      "step": 23551
    },
    {
      "epoch": 2.4986208359855717,
      "grad_norm": 0.426758871578058,
      "learning_rate": 4.487318298528354e-05,
      "loss": 1.6747,
      "num_input_tokens_seen": 18529909264,
      "step": 23552
    },
    {
      "epoch": 2.498726925525143,
      "grad_norm": 0.3643111253702319,
      "learning_rate": 4.487276133677585e-05,
      "loss": 1.524,
      "num_input_tokens_seen": 18530695968,
      "step": 23553
    },
    {
      "epoch": 2.4988330150647147,
      "grad_norm": 0.3758434986518611,
      "learning_rate": 4.487233967291108e-05,
      "loss": 1.5623,
      "num_input_tokens_seen": 18531482784,
      "step": 23554
    },
    {
      "epoch": 2.498939104604286,
      "grad_norm": 0.38747962031642497,
      "learning_rate": 4.4871917993689546e-05,
      "loss": 1.6855,
      "num_input_tokens_seen": 18532269520,
      "step": 23555
    },
    {
      "epoch": 2.499045194143857,
      "grad_norm": 0.41360656759488695,
      "learning_rate": 4.4871496299111574e-05,
      "loss": 1.5769,
      "num_input_tokens_seen": 18533056304,
      "step": 23556
    },
    {
      "epoch": 2.4991512836834286,
      "grad_norm": 0.45143925307210714,
      "learning_rate": 4.48710745891775e-05,
      "loss": 1.4188,
      "num_input_tokens_seen": 18533843072,
      "step": 23557
    },
    {
      "epoch": 2.499257373223,
      "grad_norm": 0.4129565493929616,
      "learning_rate": 4.487065286388764e-05,
      "loss": 1.7424,
      "num_input_tokens_seen": 18534629856,
      "step": 23558
    },
    {
      "epoch": 2.4993634627625716,
      "grad_norm": 0.47770181504790293,
      "learning_rate": 4.4870231123242326e-05,
      "loss": 1.5497,
      "num_input_tokens_seen": 18535416608,
      "step": 23559
    },
    {
      "epoch": 2.499469552302143,
      "grad_norm": 0.4818858524583804,
      "learning_rate": 4.4869809367241875e-05,
      "loss": 1.5622,
      "num_input_tokens_seen": 18536203312,
      "step": 23560
    },
    {
      "epoch": 2.4995756418417145,
      "grad_norm": 0.4558702819516367,
      "learning_rate": 4.486938759588661e-05,
      "loss": 1.6011,
      "num_input_tokens_seen": 18536990080,
      "step": 23561
    },
    {
      "epoch": 2.499681731381286,
      "grad_norm": 0.490786809360852,
      "learning_rate": 4.4868965809176874e-05,
      "loss": 1.6374,
      "num_input_tokens_seen": 18537776832,
      "step": 23562
    },
    {
      "epoch": 2.499787820920857,
      "grad_norm": 0.4038052866220798,
      "learning_rate": 4.486854400711299e-05,
      "loss": 1.5594,
      "num_input_tokens_seen": 18538563632,
      "step": 23563
    },
    {
      "epoch": 2.4998939104604285,
      "grad_norm": 0.3724167962075626,
      "learning_rate": 4.486812218969527e-05,
      "loss": 1.6542,
      "num_input_tokens_seen": 18539350368,
      "step": 23564
    },
    {
      "epoch": 2.5,
      "grad_norm": 0.42571686395537695,
      "learning_rate": 4.4867700356924055e-05,
      "loss": 1.633,
      "num_input_tokens_seen": 18540137072,
      "step": 23565
    },
    {
      "epoch": 2.5001060895395715,
      "grad_norm": 0.426418593500476,
      "learning_rate": 4.486727850879966e-05,
      "loss": 1.6297,
      "num_input_tokens_seen": 18540923840,
      "step": 23566
    },
    {
      "epoch": 2.500212179079143,
      "grad_norm": 0.41486174369570006,
      "learning_rate": 4.4866856645322414e-05,
      "loss": 1.595,
      "num_input_tokens_seen": 18541710704,
      "step": 23567
    },
    {
      "epoch": 2.500318268618714,
      "grad_norm": 0.40644128716286676,
      "learning_rate": 4.486643476649265e-05,
      "loss": 1.5521,
      "num_input_tokens_seen": 18542497504,
      "step": 23568
    },
    {
      "epoch": 2.5004243581582855,
      "grad_norm": 0.3554715654217139,
      "learning_rate": 4.486601287231068e-05,
      "loss": 1.5108,
      "num_input_tokens_seen": 18543284304,
      "step": 23569
    },
    {
      "epoch": 2.500530447697857,
      "grad_norm": 0.3846298420698584,
      "learning_rate": 4.486559096277684e-05,
      "loss": 1.5932,
      "num_input_tokens_seen": 18544071104,
      "step": 23570
    },
    {
      "epoch": 2.5006365372374284,
      "grad_norm": 0.39130568333496657,
      "learning_rate": 4.486516903789146e-05,
      "loss": 1.5219,
      "num_input_tokens_seen": 18544857840,
      "step": 23571
    },
    {
      "epoch": 2.500742626777,
      "grad_norm": 0.3780434661958198,
      "learning_rate": 4.4864747097654855e-05,
      "loss": 1.4374,
      "num_input_tokens_seen": 18545644592,
      "step": 23572
    },
    {
      "epoch": 2.5008487163165714,
      "grad_norm": 0.4243699651165241,
      "learning_rate": 4.486432514206735e-05,
      "loss": 1.5748,
      "num_input_tokens_seen": 18546431392,
      "step": 23573
    },
    {
      "epoch": 2.500954805856143,
      "grad_norm": 0.3835699524957932,
      "learning_rate": 4.4863903171129296e-05,
      "loss": 1.5899,
      "num_input_tokens_seen": 18547218096,
      "step": 23574
    },
    {
      "epoch": 2.501060895395714,
      "grad_norm": 0.3961367649698566,
      "learning_rate": 4.486348118484098e-05,
      "loss": 1.6182,
      "num_input_tokens_seen": 18548004848,
      "step": 23575
    },
    {
      "epoch": 2.5011669849352853,
      "grad_norm": 0.3893041167526451,
      "learning_rate": 4.4863059183202766e-05,
      "loss": 1.5951,
      "num_input_tokens_seen": 18548791584,
      "step": 23576
    },
    {
      "epoch": 2.501273074474857,
      "grad_norm": 0.36134586921102657,
      "learning_rate": 4.486263716621495e-05,
      "loss": 1.5422,
      "num_input_tokens_seen": 18549578432,
      "step": 23577
    },
    {
      "epoch": 2.5013791640144283,
      "grad_norm": 0.3933357284260801,
      "learning_rate": 4.486221513387788e-05,
      "loss": 1.5695,
      "num_input_tokens_seen": 18550365232,
      "step": 23578
    },
    {
      "epoch": 2.5014852535539998,
      "grad_norm": 0.35036003747663896,
      "learning_rate": 4.486179308619187e-05,
      "loss": 1.5663,
      "num_input_tokens_seen": 18551151952,
      "step": 23579
    },
    {
      "epoch": 2.501591343093571,
      "grad_norm": 0.36030335648491085,
      "learning_rate": 4.486137102315724e-05,
      "loss": 1.5023,
      "num_input_tokens_seen": 18551938736,
      "step": 23580
    },
    {
      "epoch": 2.5016974326331423,
      "grad_norm": 0.41841530485208506,
      "learning_rate": 4.4860948944774336e-05,
      "loss": 1.525,
      "num_input_tokens_seen": 18552725504,
      "step": 23581
    },
    {
      "epoch": 2.5018035221727137,
      "grad_norm": 0.37414094170055184,
      "learning_rate": 4.486052685104347e-05,
      "loss": 1.6487,
      "num_input_tokens_seen": 18553512208,
      "step": 23582
    },
    {
      "epoch": 2.501909611712285,
      "grad_norm": 0.3799299050677387,
      "learning_rate": 4.486010474196497e-05,
      "loss": 1.6545,
      "num_input_tokens_seen": 18554298960,
      "step": 23583
    },
    {
      "epoch": 2.5020157012518567,
      "grad_norm": 0.4175758641584359,
      "learning_rate": 4.4859682617539166e-05,
      "loss": 1.6419,
      "num_input_tokens_seen": 18555085712,
      "step": 23584
    },
    {
      "epoch": 2.5021217907914277,
      "grad_norm": 0.4178025255022588,
      "learning_rate": 4.485926047776638e-05,
      "loss": 1.7165,
      "num_input_tokens_seen": 18555872496,
      "step": 23585
    },
    {
      "epoch": 2.5022278803309996,
      "grad_norm": 0.42969218728311787,
      "learning_rate": 4.485883832264695e-05,
      "loss": 1.5544,
      "num_input_tokens_seen": 18556659248,
      "step": 23586
    },
    {
      "epoch": 2.5023339698705707,
      "grad_norm": 0.409639854459698,
      "learning_rate": 4.485841615218118e-05,
      "loss": 1.7056,
      "num_input_tokens_seen": 18557446048,
      "step": 23587
    },
    {
      "epoch": 2.502440059410142,
      "grad_norm": 0.41256541113667516,
      "learning_rate": 4.485799396636941e-05,
      "loss": 1.563,
      "num_input_tokens_seen": 18558232720,
      "step": 23588
    },
    {
      "epoch": 2.5025461489497136,
      "grad_norm": 0.4970174227306449,
      "learning_rate": 4.485757176521197e-05,
      "loss": 1.6234,
      "num_input_tokens_seen": 18559019520,
      "step": 23589
    },
    {
      "epoch": 2.502652238489285,
      "grad_norm": 0.4732268014631346,
      "learning_rate": 4.485714954870918e-05,
      "loss": 1.6355,
      "num_input_tokens_seen": 18559806224,
      "step": 23590
    },
    {
      "epoch": 2.5027583280288566,
      "grad_norm": 0.39110455953540596,
      "learning_rate": 4.4856727316861365e-05,
      "loss": 1.5941,
      "num_input_tokens_seen": 18560593104,
      "step": 23591
    },
    {
      "epoch": 2.5028644175684276,
      "grad_norm": 0.40912518653781027,
      "learning_rate": 4.485630506966886e-05,
      "loss": 1.6515,
      "num_input_tokens_seen": 18561379824,
      "step": 23592
    },
    {
      "epoch": 2.502970507107999,
      "grad_norm": 0.3586765128877118,
      "learning_rate": 4.485588280713198e-05,
      "loss": 1.3917,
      "num_input_tokens_seen": 18562166688,
      "step": 23593
    },
    {
      "epoch": 2.5030765966475705,
      "grad_norm": 0.518751247177538,
      "learning_rate": 4.4855460529251056e-05,
      "loss": 1.619,
      "num_input_tokens_seen": 18562953392,
      "step": 23594
    },
    {
      "epoch": 2.503182686187142,
      "grad_norm": 0.4162153446330588,
      "learning_rate": 4.4855038236026416e-05,
      "loss": 1.7081,
      "num_input_tokens_seen": 18563740016,
      "step": 23595
    },
    {
      "epoch": 2.5032887757267135,
      "grad_norm": 0.5101050064539163,
      "learning_rate": 4.4854615927458384e-05,
      "loss": 1.5423,
      "num_input_tokens_seen": 18564526928,
      "step": 23596
    },
    {
      "epoch": 2.5033948652662845,
      "grad_norm": 0.3989685379017665,
      "learning_rate": 4.4854193603547285e-05,
      "loss": 1.616,
      "num_input_tokens_seen": 18565313712,
      "step": 23597
    },
    {
      "epoch": 2.503500954805856,
      "grad_norm": 0.5908983255373788,
      "learning_rate": 4.485377126429345e-05,
      "loss": 1.6832,
      "num_input_tokens_seen": 18566100496,
      "step": 23598
    },
    {
      "epoch": 2.5036070443454275,
      "grad_norm": 0.37440504712449374,
      "learning_rate": 4.48533489096972e-05,
      "loss": 1.6296,
      "num_input_tokens_seen": 18566887200,
      "step": 23599
    },
    {
      "epoch": 2.503713133884999,
      "grad_norm": 0.5477660031467697,
      "learning_rate": 4.4852926539758874e-05,
      "loss": 1.641,
      "num_input_tokens_seen": 18567673904,
      "step": 23600
    },
    {
      "epoch": 2.5038192234245704,
      "grad_norm": 0.45831513402145924,
      "learning_rate": 4.485250415447878e-05,
      "loss": 1.6752,
      "num_input_tokens_seen": 18568460688,
      "step": 23601
    },
    {
      "epoch": 2.503925312964142,
      "grad_norm": 0.3753014954964991,
      "learning_rate": 4.4852081753857255e-05,
      "loss": 1.5655,
      "num_input_tokens_seen": 18569247408,
      "step": 23602
    },
    {
      "epoch": 2.5040314025037134,
      "grad_norm": 0.42440968878096325,
      "learning_rate": 4.4851659337894627e-05,
      "loss": 1.458,
      "num_input_tokens_seen": 18570034208,
      "step": 23603
    },
    {
      "epoch": 2.5041374920432844,
      "grad_norm": 0.3824249254225552,
      "learning_rate": 4.485123690659122e-05,
      "loss": 1.6537,
      "num_input_tokens_seen": 18570821008,
      "step": 23604
    },
    {
      "epoch": 2.504243581582856,
      "grad_norm": 0.4028583830917311,
      "learning_rate": 4.485081445994735e-05,
      "loss": 1.6277,
      "num_input_tokens_seen": 18571607808,
      "step": 23605
    },
    {
      "epoch": 2.5043496711224273,
      "grad_norm": 0.4694949102845676,
      "learning_rate": 4.4850391997963365e-05,
      "loss": 1.5847,
      "num_input_tokens_seen": 18572394544,
      "step": 23606
    },
    {
      "epoch": 2.504455760661999,
      "grad_norm": 0.39524927541278093,
      "learning_rate": 4.4849969520639576e-05,
      "loss": 1.6633,
      "num_input_tokens_seen": 18573181280,
      "step": 23607
    },
    {
      "epoch": 2.5045618502015703,
      "grad_norm": 0.46952722974882083,
      "learning_rate": 4.484954702797631e-05,
      "loss": 1.6414,
      "num_input_tokens_seen": 18573968016,
      "step": 23608
    },
    {
      "epoch": 2.5046679397411413,
      "grad_norm": 0.3740889114288889,
      "learning_rate": 4.48491245199739e-05,
      "loss": 1.5697,
      "num_input_tokens_seen": 18574754752,
      "step": 23609
    },
    {
      "epoch": 2.504774029280713,
      "grad_norm": 0.5530605766299247,
      "learning_rate": 4.4848701996632666e-05,
      "loss": 1.6061,
      "num_input_tokens_seen": 18575541424,
      "step": 23610
    },
    {
      "epoch": 2.5048801188202843,
      "grad_norm": 0.34189650799120735,
      "learning_rate": 4.4848279457952935e-05,
      "loss": 1.5774,
      "num_input_tokens_seen": 18576328240,
      "step": 23611
    },
    {
      "epoch": 2.5049862083598557,
      "grad_norm": 0.6502108971787675,
      "learning_rate": 4.4847856903935036e-05,
      "loss": 1.7124,
      "num_input_tokens_seen": 18577115072,
      "step": 23612
    },
    {
      "epoch": 2.5050922978994272,
      "grad_norm": 0.37784529062945954,
      "learning_rate": 4.48474343345793e-05,
      "loss": 1.5341,
      "num_input_tokens_seen": 18577901856,
      "step": 23613
    },
    {
      "epoch": 2.5051983874389983,
      "grad_norm": 0.5625092325616002,
      "learning_rate": 4.484701174988605e-05,
      "loss": 1.6795,
      "num_input_tokens_seen": 18578688592,
      "step": 23614
    },
    {
      "epoch": 2.50530447697857,
      "grad_norm": 0.44432892049544437,
      "learning_rate": 4.4846589149855614e-05,
      "loss": 1.6279,
      "num_input_tokens_seen": 18579475392,
      "step": 23615
    },
    {
      "epoch": 2.505410566518141,
      "grad_norm": 0.5341988905018785,
      "learning_rate": 4.484616653448831e-05,
      "loss": 1.6539,
      "num_input_tokens_seen": 18580262128,
      "step": 23616
    },
    {
      "epoch": 2.5055166560577127,
      "grad_norm": 0.43928756685117815,
      "learning_rate": 4.484574390378447e-05,
      "loss": 1.5765,
      "num_input_tokens_seen": 18581048800,
      "step": 23617
    },
    {
      "epoch": 2.505622745597284,
      "grad_norm": 0.4242059884635137,
      "learning_rate": 4.484532125774442e-05,
      "loss": 1.5412,
      "num_input_tokens_seen": 18581835584,
      "step": 23618
    },
    {
      "epoch": 2.5057288351368556,
      "grad_norm": 0.4136840861493529,
      "learning_rate": 4.48448985963685e-05,
      "loss": 1.5354,
      "num_input_tokens_seen": 18582622384,
      "step": 23619
    },
    {
      "epoch": 2.505834924676427,
      "grad_norm": 0.4092248255389459,
      "learning_rate": 4.4844475919657016e-05,
      "loss": 1.5543,
      "num_input_tokens_seen": 18583409168,
      "step": 23620
    },
    {
      "epoch": 2.505941014215998,
      "grad_norm": 0.4737248089544927,
      "learning_rate": 4.484405322761031e-05,
      "loss": 1.5977,
      "num_input_tokens_seen": 18584195904,
      "step": 23621
    },
    {
      "epoch": 2.5060471037555696,
      "grad_norm": 0.3777433022310288,
      "learning_rate": 4.4843630520228684e-05,
      "loss": 1.5181,
      "num_input_tokens_seen": 18584982736,
      "step": 23622
    },
    {
      "epoch": 2.506153193295141,
      "grad_norm": 0.480526487183458,
      "learning_rate": 4.48432077975125e-05,
      "loss": 1.6097,
      "num_input_tokens_seen": 18585769520,
      "step": 23623
    },
    {
      "epoch": 2.5062592828347126,
      "grad_norm": 0.4947062552787704,
      "learning_rate": 4.484278505946206e-05,
      "loss": 1.5614,
      "num_input_tokens_seen": 18586556240,
      "step": 23624
    },
    {
      "epoch": 2.506365372374284,
      "grad_norm": 0.5365445262733154,
      "learning_rate": 4.48423623060777e-05,
      "loss": 1.5958,
      "num_input_tokens_seen": 18587343040,
      "step": 23625
    },
    {
      "epoch": 2.506471461913855,
      "grad_norm": 0.41610870752264606,
      "learning_rate": 4.484193953735974e-05,
      "loss": 1.6685,
      "num_input_tokens_seen": 18588129760,
      "step": 23626
    },
    {
      "epoch": 2.5065775514534265,
      "grad_norm": 0.5453282486397695,
      "learning_rate": 4.484151675330852e-05,
      "loss": 1.556,
      "num_input_tokens_seen": 18588916560,
      "step": 23627
    },
    {
      "epoch": 2.506683640992998,
      "grad_norm": 0.4133550086771764,
      "learning_rate": 4.484109395392435e-05,
      "loss": 1.5053,
      "num_input_tokens_seen": 18589703232,
      "step": 23628
    },
    {
      "epoch": 2.5067897305325695,
      "grad_norm": 0.6910406751985174,
      "learning_rate": 4.4840671139207574e-05,
      "loss": 1.4963,
      "num_input_tokens_seen": 18590490016,
      "step": 23629
    },
    {
      "epoch": 2.506895820072141,
      "grad_norm": 0.40584959228051215,
      "learning_rate": 4.4840248309158504e-05,
      "loss": 1.5834,
      "num_input_tokens_seen": 18591276848,
      "step": 23630
    },
    {
      "epoch": 2.5070019096117124,
      "grad_norm": 0.4524549791006539,
      "learning_rate": 4.483982546377747e-05,
      "loss": 1.5573,
      "num_input_tokens_seen": 18592063584,
      "step": 23631
    },
    {
      "epoch": 2.507107999151284,
      "grad_norm": 0.37953927152965916,
      "learning_rate": 4.483940260306481e-05,
      "loss": 1.5206,
      "num_input_tokens_seen": 18592850368,
      "step": 23632
    },
    {
      "epoch": 2.507214088690855,
      "grad_norm": 0.41919585648616575,
      "learning_rate": 4.483897972702083e-05,
      "loss": 1.6478,
      "num_input_tokens_seen": 18593637184,
      "step": 23633
    },
    {
      "epoch": 2.5073201782304264,
      "grad_norm": 0.4520716155224711,
      "learning_rate": 4.483855683564587e-05,
      "loss": 1.6203,
      "num_input_tokens_seen": 18594423920,
      "step": 23634
    },
    {
      "epoch": 2.507426267769998,
      "grad_norm": 0.3638423761746491,
      "learning_rate": 4.4838133928940265e-05,
      "loss": 1.4782,
      "num_input_tokens_seen": 18595210720,
      "step": 23635
    },
    {
      "epoch": 2.5075323573095694,
      "grad_norm": 0.359015343556703,
      "learning_rate": 4.4837711006904324e-05,
      "loss": 1.556,
      "num_input_tokens_seen": 18595997472,
      "step": 23636
    },
    {
      "epoch": 2.507638446849141,
      "grad_norm": 0.5078575267841781,
      "learning_rate": 4.483728806953839e-05,
      "loss": 1.5397,
      "num_input_tokens_seen": 18596784272,
      "step": 23637
    },
    {
      "epoch": 2.507744536388712,
      "grad_norm": 0.37841885177997525,
      "learning_rate": 4.483686511684277e-05,
      "loss": 1.6144,
      "num_input_tokens_seen": 18597571072,
      "step": 23638
    },
    {
      "epoch": 2.5078506259282833,
      "grad_norm": 0.5559720212968345,
      "learning_rate": 4.483644214881781e-05,
      "loss": 1.4883,
      "num_input_tokens_seen": 18598357888,
      "step": 23639
    },
    {
      "epoch": 2.507956715467855,
      "grad_norm": 0.47254674088176024,
      "learning_rate": 4.483601916546383e-05,
      "loss": 1.5446,
      "num_input_tokens_seen": 18599144688,
      "step": 23640
    },
    {
      "epoch": 2.5080628050074263,
      "grad_norm": 0.400055444372564,
      "learning_rate": 4.4835596166781144e-05,
      "loss": 1.699,
      "num_input_tokens_seen": 18599931392,
      "step": 23641
    },
    {
      "epoch": 2.5081688945469978,
      "grad_norm": 0.526929888081773,
      "learning_rate": 4.483517315277011e-05,
      "loss": 1.6049,
      "num_input_tokens_seen": 18600718128,
      "step": 23642
    },
    {
      "epoch": 2.508274984086569,
      "grad_norm": 0.37833219367820337,
      "learning_rate": 4.4834750123431026e-05,
      "loss": 1.5743,
      "num_input_tokens_seen": 18601504896,
      "step": 23643
    },
    {
      "epoch": 2.5083810736261407,
      "grad_norm": 0.5450521337528071,
      "learning_rate": 4.483432707876423e-05,
      "loss": 1.5271,
      "num_input_tokens_seen": 18602291536,
      "step": 23644
    },
    {
      "epoch": 2.5084871631657117,
      "grad_norm": 0.4061613595984972,
      "learning_rate": 4.483390401877005e-05,
      "loss": 1.6744,
      "num_input_tokens_seen": 18603078288,
      "step": 23645
    },
    {
      "epoch": 2.508593252705283,
      "grad_norm": 0.4526027457788724,
      "learning_rate": 4.483348094344881e-05,
      "loss": 1.6803,
      "num_input_tokens_seen": 18603865008,
      "step": 23646
    },
    {
      "epoch": 2.5086993422448547,
      "grad_norm": 0.49984636321335335,
      "learning_rate": 4.483305785280084e-05,
      "loss": 1.5632,
      "num_input_tokens_seen": 18604651792,
      "step": 23647
    },
    {
      "epoch": 2.508805431784426,
      "grad_norm": 0.4437179965256085,
      "learning_rate": 4.4832634746826464e-05,
      "loss": 1.6479,
      "num_input_tokens_seen": 18605438464,
      "step": 23648
    },
    {
      "epoch": 2.5089115213239976,
      "grad_norm": 0.45152590660084124,
      "learning_rate": 4.483221162552601e-05,
      "loss": 1.538,
      "num_input_tokens_seen": 18606225136,
      "step": 23649
    },
    {
      "epoch": 2.5090176108635687,
      "grad_norm": 0.37545661598054875,
      "learning_rate": 4.48317884888998e-05,
      "loss": 1.7021,
      "num_input_tokens_seen": 18607011840,
      "step": 23650
    },
    {
      "epoch": 2.50912370040314,
      "grad_norm": 0.48654969356244054,
      "learning_rate": 4.483136533694817e-05,
      "loss": 1.6081,
      "num_input_tokens_seen": 18607798624,
      "step": 23651
    },
    {
      "epoch": 2.5092297899427116,
      "grad_norm": 0.38103031784820135,
      "learning_rate": 4.483094216967144e-05,
      "loss": 1.4348,
      "num_input_tokens_seen": 18608585520,
      "step": 23652
    },
    {
      "epoch": 2.509335879482283,
      "grad_norm": 0.47279614565461514,
      "learning_rate": 4.483051898706995e-05,
      "loss": 1.7623,
      "num_input_tokens_seen": 18609372208,
      "step": 23653
    },
    {
      "epoch": 2.5094419690218546,
      "grad_norm": 0.40295567663326126,
      "learning_rate": 4.4830095789144e-05,
      "loss": 1.6317,
      "num_input_tokens_seen": 18610159024,
      "step": 23654
    },
    {
      "epoch": 2.5095480585614256,
      "grad_norm": 0.5348285648488388,
      "learning_rate": 4.4829672575893946e-05,
      "loss": 1.663,
      "num_input_tokens_seen": 18610945808,
      "step": 23655
    },
    {
      "epoch": 2.5096541481009975,
      "grad_norm": 0.36197886516594757,
      "learning_rate": 4.48292493473201e-05,
      "loss": 1.4713,
      "num_input_tokens_seen": 18611732512,
      "step": 23656
    },
    {
      "epoch": 2.5097602376405685,
      "grad_norm": 0.43107872757590193,
      "learning_rate": 4.482882610342279e-05,
      "loss": 1.5764,
      "num_input_tokens_seen": 18612519280,
      "step": 23657
    },
    {
      "epoch": 2.50986632718014,
      "grad_norm": 0.48847502184055946,
      "learning_rate": 4.4828402844202344e-05,
      "loss": 1.5866,
      "num_input_tokens_seen": 18613305984,
      "step": 23658
    },
    {
      "epoch": 2.5099724167197115,
      "grad_norm": 0.5700694495922768,
      "learning_rate": 4.4827979569659094e-05,
      "loss": 1.6779,
      "num_input_tokens_seen": 18614092720,
      "step": 23659
    },
    {
      "epoch": 2.510078506259283,
      "grad_norm": 0.528119520944773,
      "learning_rate": 4.482755627979336e-05,
      "loss": 1.654,
      "num_input_tokens_seen": 18614879408,
      "step": 23660
    },
    {
      "epoch": 2.5101845957988544,
      "grad_norm": 0.4904459114345943,
      "learning_rate": 4.482713297460547e-05,
      "loss": 1.5488,
      "num_input_tokens_seen": 18615666128,
      "step": 23661
    },
    {
      "epoch": 2.5102906853384255,
      "grad_norm": 0.40748141923920306,
      "learning_rate": 4.482670965409576e-05,
      "loss": 1.5889,
      "num_input_tokens_seen": 18616452864,
      "step": 23662
    },
    {
      "epoch": 2.510396774877997,
      "grad_norm": 0.5629315614440922,
      "learning_rate": 4.482628631826455e-05,
      "loss": 1.6359,
      "num_input_tokens_seen": 18617239632,
      "step": 23663
    },
    {
      "epoch": 2.5105028644175684,
      "grad_norm": 0.4285067083121918,
      "learning_rate": 4.482586296711216e-05,
      "loss": 1.6064,
      "num_input_tokens_seen": 18618026400,
      "step": 23664
    },
    {
      "epoch": 2.51060895395714,
      "grad_norm": 0.4991788580088563,
      "learning_rate": 4.4825439600638936e-05,
      "loss": 1.5237,
      "num_input_tokens_seen": 18618813280,
      "step": 23665
    },
    {
      "epoch": 2.5107150434967114,
      "grad_norm": 0.38865614925878467,
      "learning_rate": 4.482501621884518e-05,
      "loss": 1.4946,
      "num_input_tokens_seen": 18619599984,
      "step": 23666
    },
    {
      "epoch": 2.5108211330362824,
      "grad_norm": 0.553937876411586,
      "learning_rate": 4.482459282173125e-05,
      "loss": 1.6582,
      "num_input_tokens_seen": 18620386624,
      "step": 23667
    },
    {
      "epoch": 2.510927222575854,
      "grad_norm": 0.4129601446051775,
      "learning_rate": 4.4824169409297445e-05,
      "loss": 1.6261,
      "num_input_tokens_seen": 18621173472,
      "step": 23668
    },
    {
      "epoch": 2.5110333121154254,
      "grad_norm": 0.49767588552880115,
      "learning_rate": 4.482374598154411e-05,
      "loss": 1.7496,
      "num_input_tokens_seen": 18621960224,
      "step": 23669
    },
    {
      "epoch": 2.511139401654997,
      "grad_norm": 0.3722750146405884,
      "learning_rate": 4.482332253847156e-05,
      "loss": 1.5923,
      "num_input_tokens_seen": 18622747008,
      "step": 23670
    },
    {
      "epoch": 2.5112454911945683,
      "grad_norm": 0.4120699155745901,
      "learning_rate": 4.4822899080080126e-05,
      "loss": 1.5823,
      "num_input_tokens_seen": 18623533760,
      "step": 23671
    },
    {
      "epoch": 2.5113515807341398,
      "grad_norm": 0.375175505378427,
      "learning_rate": 4.482247560637014e-05,
      "loss": 1.6029,
      "num_input_tokens_seen": 18624320608,
      "step": 23672
    },
    {
      "epoch": 2.5114576702737113,
      "grad_norm": 0.39996724197156963,
      "learning_rate": 4.482205211734193e-05,
      "loss": 1.5255,
      "num_input_tokens_seen": 18625107376,
      "step": 23673
    },
    {
      "epoch": 2.5115637598132823,
      "grad_norm": 0.3704640927278675,
      "learning_rate": 4.482162861299582e-05,
      "loss": 1.5126,
      "num_input_tokens_seen": 18625894160,
      "step": 23674
    },
    {
      "epoch": 2.5116698493528538,
      "grad_norm": 0.3941803300977189,
      "learning_rate": 4.482120509333213e-05,
      "loss": 1.6822,
      "num_input_tokens_seen": 18626680960,
      "step": 23675
    },
    {
      "epoch": 2.5117759388924252,
      "grad_norm": 0.38768067475354756,
      "learning_rate": 4.48207815583512e-05,
      "loss": 1.6859,
      "num_input_tokens_seen": 18627467808,
      "step": 23676
    },
    {
      "epoch": 2.5118820284319967,
      "grad_norm": 0.3733508370762701,
      "learning_rate": 4.482035800805335e-05,
      "loss": 1.6022,
      "num_input_tokens_seen": 18628254496,
      "step": 23677
    },
    {
      "epoch": 2.511988117971568,
      "grad_norm": 0.3442048024288208,
      "learning_rate": 4.481993444243891e-05,
      "loss": 1.568,
      "num_input_tokens_seen": 18629041264,
      "step": 23678
    },
    {
      "epoch": 2.512094207511139,
      "grad_norm": 0.37897214046038175,
      "learning_rate": 4.4819510861508206e-05,
      "loss": 1.5909,
      "num_input_tokens_seen": 18629828144,
      "step": 23679
    },
    {
      "epoch": 2.5122002970507107,
      "grad_norm": 0.4257062711392876,
      "learning_rate": 4.4819087265261565e-05,
      "loss": 1.7342,
      "num_input_tokens_seen": 18630614928,
      "step": 23680
    },
    {
      "epoch": 2.512306386590282,
      "grad_norm": 0.3961447904121906,
      "learning_rate": 4.4818663653699314e-05,
      "loss": 1.6016,
      "num_input_tokens_seen": 18631401744,
      "step": 23681
    },
    {
      "epoch": 2.5124124761298536,
      "grad_norm": 0.3900383020313184,
      "learning_rate": 4.4818240026821786e-05,
      "loss": 1.5362,
      "num_input_tokens_seen": 18632188576,
      "step": 23682
    },
    {
      "epoch": 2.512518565669425,
      "grad_norm": 0.35412690508056033,
      "learning_rate": 4.48178163846293e-05,
      "loss": 1.6177,
      "num_input_tokens_seen": 18632975392,
      "step": 23683
    },
    {
      "epoch": 2.512624655208996,
      "grad_norm": 0.48486653465859114,
      "learning_rate": 4.481739272712218e-05,
      "loss": 1.4356,
      "num_input_tokens_seen": 18633762080,
      "step": 23684
    },
    {
      "epoch": 2.512730744748568,
      "grad_norm": 0.3719878021501315,
      "learning_rate": 4.481696905430077e-05,
      "loss": 1.6532,
      "num_input_tokens_seen": 18634548864,
      "step": 23685
    },
    {
      "epoch": 2.512836834288139,
      "grad_norm": 0.5109070147606594,
      "learning_rate": 4.481654536616539e-05,
      "loss": 1.6546,
      "num_input_tokens_seen": 18635335632,
      "step": 23686
    },
    {
      "epoch": 2.5129429238277106,
      "grad_norm": 0.4084653329661425,
      "learning_rate": 4.481612166271635e-05,
      "loss": 1.5868,
      "num_input_tokens_seen": 18636122368,
      "step": 23687
    },
    {
      "epoch": 2.513049013367282,
      "grad_norm": 0.4249348932507297,
      "learning_rate": 4.4815697943954005e-05,
      "loss": 1.635,
      "num_input_tokens_seen": 18636909040,
      "step": 23688
    },
    {
      "epoch": 2.5131551029068535,
      "grad_norm": 0.45369792479380144,
      "learning_rate": 4.481527420987867e-05,
      "loss": 1.5321,
      "num_input_tokens_seen": 18637695856,
      "step": 23689
    },
    {
      "epoch": 2.513261192446425,
      "grad_norm": 0.3936300386887194,
      "learning_rate": 4.481485046049067e-05,
      "loss": 1.5872,
      "num_input_tokens_seen": 18638482624,
      "step": 23690
    },
    {
      "epoch": 2.513367281985996,
      "grad_norm": 0.36837139798951146,
      "learning_rate": 4.4814426695790336e-05,
      "loss": 1.5699,
      "num_input_tokens_seen": 18639269376,
      "step": 23691
    },
    {
      "epoch": 2.5134733715255675,
      "grad_norm": 0.3652944729039328,
      "learning_rate": 4.4814002915778e-05,
      "loss": 1.5826,
      "num_input_tokens_seen": 18640056192,
      "step": 23692
    },
    {
      "epoch": 2.513579461065139,
      "grad_norm": 0.4191343934904445,
      "learning_rate": 4.481357912045398e-05,
      "loss": 1.6106,
      "num_input_tokens_seen": 18640842896,
      "step": 23693
    },
    {
      "epoch": 2.5136855506047104,
      "grad_norm": 0.3531025700654903,
      "learning_rate": 4.48131553098186e-05,
      "loss": 1.5764,
      "num_input_tokens_seen": 18641629696,
      "step": 23694
    },
    {
      "epoch": 2.513791640144282,
      "grad_norm": 0.41532160622607905,
      "learning_rate": 4.4812731483872196e-05,
      "loss": 1.5122,
      "num_input_tokens_seen": 18642416432,
      "step": 23695
    },
    {
      "epoch": 2.513897729683853,
      "grad_norm": 0.44293106636762,
      "learning_rate": 4.4812307642615095e-05,
      "loss": 1.7954,
      "num_input_tokens_seen": 18643203136,
      "step": 23696
    },
    {
      "epoch": 2.5140038192234244,
      "grad_norm": 0.4643332022111696,
      "learning_rate": 4.481188378604763e-05,
      "loss": 1.5723,
      "num_input_tokens_seen": 18643989776,
      "step": 23697
    },
    {
      "epoch": 2.514109908762996,
      "grad_norm": 0.4576734341320308,
      "learning_rate": 4.481145991417012e-05,
      "loss": 1.5995,
      "num_input_tokens_seen": 18644776464,
      "step": 23698
    },
    {
      "epoch": 2.5142159983025674,
      "grad_norm": 0.3749111977461665,
      "learning_rate": 4.48110360269829e-05,
      "loss": 1.5657,
      "num_input_tokens_seen": 18645563248,
      "step": 23699
    },
    {
      "epoch": 2.514322087842139,
      "grad_norm": 0.4454153484930828,
      "learning_rate": 4.4810612124486285e-05,
      "loss": 1.5332,
      "num_input_tokens_seen": 18646350096,
      "step": 23700
    },
    {
      "epoch": 2.5144281773817103,
      "grad_norm": 0.43942854175613005,
      "learning_rate": 4.4810188206680614e-05,
      "loss": 1.7914,
      "num_input_tokens_seen": 18647136880,
      "step": 23701
    },
    {
      "epoch": 2.514534266921282,
      "grad_norm": 0.543763702502169,
      "learning_rate": 4.4809764273566205e-05,
      "loss": 1.6094,
      "num_input_tokens_seen": 18647923584,
      "step": 23702
    },
    {
      "epoch": 2.514640356460853,
      "grad_norm": 0.4116655734295129,
      "learning_rate": 4.48093403251434e-05,
      "loss": 1.6517,
      "num_input_tokens_seen": 18648710416,
      "step": 23703
    },
    {
      "epoch": 2.5147464460004243,
      "grad_norm": 0.4016540922358368,
      "learning_rate": 4.4808916361412514e-05,
      "loss": 1.6184,
      "num_input_tokens_seen": 18649497184,
      "step": 23704
    },
    {
      "epoch": 2.5148525355399958,
      "grad_norm": 0.3820070476890924,
      "learning_rate": 4.480849238237388e-05,
      "loss": 1.6046,
      "num_input_tokens_seen": 18650283952,
      "step": 23705
    },
    {
      "epoch": 2.5149586250795672,
      "grad_norm": 0.41487644736266593,
      "learning_rate": 4.480806838802782e-05,
      "loss": 1.5287,
      "num_input_tokens_seen": 18651070800,
      "step": 23706
    },
    {
      "epoch": 2.5150647146191387,
      "grad_norm": 0.3666301707421397,
      "learning_rate": 4.480764437837467e-05,
      "loss": 1.576,
      "num_input_tokens_seen": 18651857568,
      "step": 23707
    },
    {
      "epoch": 2.5151708041587097,
      "grad_norm": 0.481899168571857,
      "learning_rate": 4.480722035341475e-05,
      "loss": 1.5819,
      "num_input_tokens_seen": 18652644272,
      "step": 23708
    },
    {
      "epoch": 2.5152768936982812,
      "grad_norm": 0.40162037233901043,
      "learning_rate": 4.4806796313148394e-05,
      "loss": 1.5686,
      "num_input_tokens_seen": 18653430992,
      "step": 23709
    },
    {
      "epoch": 2.5153829832378527,
      "grad_norm": 0.5018686016054157,
      "learning_rate": 4.4806372257575925e-05,
      "loss": 1.7052,
      "num_input_tokens_seen": 18654217744,
      "step": 23710
    },
    {
      "epoch": 2.515489072777424,
      "grad_norm": 0.4663125770727463,
      "learning_rate": 4.480594818669768e-05,
      "loss": 1.7156,
      "num_input_tokens_seen": 18655004576,
      "step": 23711
    },
    {
      "epoch": 2.5155951623169956,
      "grad_norm": 0.4036663607482167,
      "learning_rate": 4.480552410051397e-05,
      "loss": 1.6209,
      "num_input_tokens_seen": 18655791360,
      "step": 23712
    },
    {
      "epoch": 2.5157012518565667,
      "grad_norm": 0.4490656192238969,
      "learning_rate": 4.4805099999025135e-05,
      "loss": 1.7458,
      "num_input_tokens_seen": 18656578096,
      "step": 23713
    },
    {
      "epoch": 2.5158073413961386,
      "grad_norm": 0.4126524292215874,
      "learning_rate": 4.48046758822315e-05,
      "loss": 1.5372,
      "num_input_tokens_seen": 18657364800,
      "step": 23714
    },
    {
      "epoch": 2.5159134309357096,
      "grad_norm": 0.49393372902533506,
      "learning_rate": 4.4804251750133394e-05,
      "loss": 1.651,
      "num_input_tokens_seen": 18658151632,
      "step": 23715
    },
    {
      "epoch": 2.516019520475281,
      "grad_norm": 0.3684961295957214,
      "learning_rate": 4.480382760273114e-05,
      "loss": 1.5698,
      "num_input_tokens_seen": 18658938400,
      "step": 23716
    },
    {
      "epoch": 2.5161256100148526,
      "grad_norm": 0.3940281987068386,
      "learning_rate": 4.480340344002508e-05,
      "loss": 1.5357,
      "num_input_tokens_seen": 18659725184,
      "step": 23717
    },
    {
      "epoch": 2.516231699554424,
      "grad_norm": 0.37891592721350303,
      "learning_rate": 4.480297926201552e-05,
      "loss": 1.5048,
      "num_input_tokens_seen": 18660512032,
      "step": 23718
    },
    {
      "epoch": 2.5163377890939955,
      "grad_norm": 0.47800717303406304,
      "learning_rate": 4.48025550687028e-05,
      "loss": 1.5659,
      "num_input_tokens_seen": 18661298768,
      "step": 23719
    },
    {
      "epoch": 2.5164438786335666,
      "grad_norm": 0.40466341757232,
      "learning_rate": 4.480213086008725e-05,
      "loss": 1.5768,
      "num_input_tokens_seen": 18662085488,
      "step": 23720
    },
    {
      "epoch": 2.516549968173138,
      "grad_norm": 0.4041547851911012,
      "learning_rate": 4.4801706636169196e-05,
      "loss": 1.5785,
      "num_input_tokens_seen": 18662872224,
      "step": 23721
    },
    {
      "epoch": 2.5166560577127095,
      "grad_norm": 0.37757382603025963,
      "learning_rate": 4.480128239694896e-05,
      "loss": 1.4203,
      "num_input_tokens_seen": 18663659104,
      "step": 23722
    },
    {
      "epoch": 2.516762147252281,
      "grad_norm": 0.36071711652364363,
      "learning_rate": 4.4800858142426874e-05,
      "loss": 1.5855,
      "num_input_tokens_seen": 18664445856,
      "step": 23723
    },
    {
      "epoch": 2.5168682367918525,
      "grad_norm": 0.4602259725248909,
      "learning_rate": 4.480043387260326e-05,
      "loss": 1.5284,
      "num_input_tokens_seen": 18665232656,
      "step": 23724
    },
    {
      "epoch": 2.5169743263314235,
      "grad_norm": 0.37891278742327683,
      "learning_rate": 4.480000958747847e-05,
      "loss": 1.6787,
      "num_input_tokens_seen": 18666019488,
      "step": 23725
    },
    {
      "epoch": 2.517080415870995,
      "grad_norm": 0.44289045463471266,
      "learning_rate": 4.4799585287052794e-05,
      "loss": 1.673,
      "num_input_tokens_seen": 18666806192,
      "step": 23726
    },
    {
      "epoch": 2.5171865054105664,
      "grad_norm": 0.42478318487103933,
      "learning_rate": 4.479916097132658e-05,
      "loss": 1.6497,
      "num_input_tokens_seen": 18667593008,
      "step": 23727
    },
    {
      "epoch": 2.517292594950138,
      "grad_norm": 0.37485014031643826,
      "learning_rate": 4.4798736640300164e-05,
      "loss": 1.6908,
      "num_input_tokens_seen": 18668379824,
      "step": 23728
    },
    {
      "epoch": 2.5173986844897094,
      "grad_norm": 0.3699876627343032,
      "learning_rate": 4.4798312293973864e-05,
      "loss": 1.6296,
      "num_input_tokens_seen": 18669166624,
      "step": 23729
    },
    {
      "epoch": 2.517504774029281,
      "grad_norm": 0.4017299372221229,
      "learning_rate": 4.479788793234801e-05,
      "loss": 1.6715,
      "num_input_tokens_seen": 18669953312,
      "step": 23730
    },
    {
      "epoch": 2.5176108635688523,
      "grad_norm": 0.3919059485901989,
      "learning_rate": 4.479746355542293e-05,
      "loss": 1.6216,
      "num_input_tokens_seen": 18670740160,
      "step": 23731
    },
    {
      "epoch": 2.5177169531084234,
      "grad_norm": 0.40381391317031334,
      "learning_rate": 4.479703916319895e-05,
      "loss": 1.6177,
      "num_input_tokens_seen": 18671526976,
      "step": 23732
    },
    {
      "epoch": 2.517823042647995,
      "grad_norm": 0.36720693545726185,
      "learning_rate": 4.4796614755676394e-05,
      "loss": 1.6451,
      "num_input_tokens_seen": 18672313744,
      "step": 23733
    },
    {
      "epoch": 2.5179291321875663,
      "grad_norm": 0.3753160905918895,
      "learning_rate": 4.47961903328556e-05,
      "loss": 1.6036,
      "num_input_tokens_seen": 18673100512,
      "step": 23734
    },
    {
      "epoch": 2.518035221727138,
      "grad_norm": 0.35785618544576087,
      "learning_rate": 4.4795765894736894e-05,
      "loss": 1.5454,
      "num_input_tokens_seen": 18673887360,
      "step": 23735
    },
    {
      "epoch": 2.5181413112667093,
      "grad_norm": 0.44397005409016055,
      "learning_rate": 4.479534144132059e-05,
      "loss": 1.7153,
      "num_input_tokens_seen": 18674674112,
      "step": 23736
    },
    {
      "epoch": 2.5182474008062803,
      "grad_norm": 0.5368297842793283,
      "learning_rate": 4.4794916972607036e-05,
      "loss": 1.5664,
      "num_input_tokens_seen": 18675460928,
      "step": 23737
    },
    {
      "epoch": 2.5183534903458518,
      "grad_norm": 0.3595807757128632,
      "learning_rate": 4.4794492488596554e-05,
      "loss": 1.6374,
      "num_input_tokens_seen": 18676247680,
      "step": 23738
    },
    {
      "epoch": 2.5184595798854232,
      "grad_norm": 0.4026046660351888,
      "learning_rate": 4.4794067989289456e-05,
      "loss": 1.5784,
      "num_input_tokens_seen": 18677034528,
      "step": 23739
    },
    {
      "epoch": 2.5185656694249947,
      "grad_norm": 0.36148683007743143,
      "learning_rate": 4.4793643474686095e-05,
      "loss": 1.5272,
      "num_input_tokens_seen": 18677821312,
      "step": 23740
    },
    {
      "epoch": 2.518671758964566,
      "grad_norm": 0.4098685880687193,
      "learning_rate": 4.479321894478678e-05,
      "loss": 1.5293,
      "num_input_tokens_seen": 18678608000,
      "step": 23741
    },
    {
      "epoch": 2.518777848504137,
      "grad_norm": 0.4158150334513268,
      "learning_rate": 4.479279439959185e-05,
      "loss": 1.5518,
      "num_input_tokens_seen": 18679394832,
      "step": 23742
    },
    {
      "epoch": 2.518883938043709,
      "grad_norm": 0.3949173223001303,
      "learning_rate": 4.4792369839101626e-05,
      "loss": 1.5541,
      "num_input_tokens_seen": 18680181488,
      "step": 23743
    },
    {
      "epoch": 2.51899002758328,
      "grad_norm": 0.4432648231799365,
      "learning_rate": 4.4791945263316445e-05,
      "loss": 1.5229,
      "num_input_tokens_seen": 18680968336,
      "step": 23744
    },
    {
      "epoch": 2.5190961171228516,
      "grad_norm": 0.3640042687877864,
      "learning_rate": 4.479152067223663e-05,
      "loss": 1.6718,
      "num_input_tokens_seen": 18681755120,
      "step": 23745
    },
    {
      "epoch": 2.519202206662423,
      "grad_norm": 0.5445892364635031,
      "learning_rate": 4.47910960658625e-05,
      "loss": 1.6668,
      "num_input_tokens_seen": 18682541888,
      "step": 23746
    },
    {
      "epoch": 2.5193082962019946,
      "grad_norm": 0.35189140745803676,
      "learning_rate": 4.4790671444194396e-05,
      "loss": 1.638,
      "num_input_tokens_seen": 18683328672,
      "step": 23747
    },
    {
      "epoch": 2.519414385741566,
      "grad_norm": 0.4155782092764376,
      "learning_rate": 4.479024680723264e-05,
      "loss": 1.4919,
      "num_input_tokens_seen": 18684115488,
      "step": 23748
    },
    {
      "epoch": 2.519520475281137,
      "grad_norm": 0.3807954928998327,
      "learning_rate": 4.478982215497757e-05,
      "loss": 1.5314,
      "num_input_tokens_seen": 18684902192,
      "step": 23749
    },
    {
      "epoch": 2.5196265648207086,
      "grad_norm": 0.41592539115143623,
      "learning_rate": 4.4789397487429494e-05,
      "loss": 1.6858,
      "num_input_tokens_seen": 18685689024,
      "step": 23750
    },
    {
      "epoch": 2.51973265436028,
      "grad_norm": 0.35996330009639615,
      "learning_rate": 4.478897280458876e-05,
      "loss": 1.5377,
      "num_input_tokens_seen": 18686475808,
      "step": 23751
    },
    {
      "epoch": 2.5198387438998515,
      "grad_norm": 0.38352751848294525,
      "learning_rate": 4.478854810645569e-05,
      "loss": 1.6221,
      "num_input_tokens_seen": 18687262608,
      "step": 23752
    },
    {
      "epoch": 2.519944833439423,
      "grad_norm": 0.33921445797015864,
      "learning_rate": 4.47881233930306e-05,
      "loss": 1.5909,
      "num_input_tokens_seen": 18688049456,
      "step": 23753
    },
    {
      "epoch": 2.520050922978994,
      "grad_norm": 0.44648662771753095,
      "learning_rate": 4.478769866431384e-05,
      "loss": 1.7297,
      "num_input_tokens_seen": 18688836128,
      "step": 23754
    },
    {
      "epoch": 2.520157012518566,
      "grad_norm": 0.45373466889698044,
      "learning_rate": 4.4787273920305726e-05,
      "loss": 1.7161,
      "num_input_tokens_seen": 18689622928,
      "step": 23755
    },
    {
      "epoch": 2.520263102058137,
      "grad_norm": 0.36769386615537697,
      "learning_rate": 4.478684916100658e-05,
      "loss": 1.6032,
      "num_input_tokens_seen": 18690409632,
      "step": 23756
    },
    {
      "epoch": 2.5203691915977084,
      "grad_norm": 0.4095251651517606,
      "learning_rate": 4.478642438641674e-05,
      "loss": 1.6502,
      "num_input_tokens_seen": 18691196320,
      "step": 23757
    },
    {
      "epoch": 2.52047528113728,
      "grad_norm": 0.38847616375153576,
      "learning_rate": 4.478599959653654e-05,
      "loss": 1.5663,
      "num_input_tokens_seen": 18691983120,
      "step": 23758
    },
    {
      "epoch": 2.5205813706768514,
      "grad_norm": 0.3865761690911362,
      "learning_rate": 4.478557479136629e-05,
      "loss": 1.7355,
      "num_input_tokens_seen": 18692769856,
      "step": 23759
    },
    {
      "epoch": 2.520687460216423,
      "grad_norm": 0.41262912684422504,
      "learning_rate": 4.478514997090634e-05,
      "loss": 1.5817,
      "num_input_tokens_seen": 18693556640,
      "step": 23760
    },
    {
      "epoch": 2.520793549755994,
      "grad_norm": 0.5182976244114398,
      "learning_rate": 4.478472513515699e-05,
      "loss": 1.5095,
      "num_input_tokens_seen": 18694343408,
      "step": 23761
    },
    {
      "epoch": 2.5208996392955654,
      "grad_norm": 0.4289554649079489,
      "learning_rate": 4.47843002841186e-05,
      "loss": 1.6615,
      "num_input_tokens_seen": 18695130192,
      "step": 23762
    },
    {
      "epoch": 2.521005728835137,
      "grad_norm": 0.47158486025354707,
      "learning_rate": 4.4783875417791474e-05,
      "loss": 1.4987,
      "num_input_tokens_seen": 18695916960,
      "step": 23763
    },
    {
      "epoch": 2.5211118183747083,
      "grad_norm": 0.34923230982086856,
      "learning_rate": 4.4783450536175954e-05,
      "loss": 1.6632,
      "num_input_tokens_seen": 18696703664,
      "step": 23764
    },
    {
      "epoch": 2.52121790791428,
      "grad_norm": 0.5239818133663352,
      "learning_rate": 4.4783025639272363e-05,
      "loss": 1.8096,
      "num_input_tokens_seen": 18697490384,
      "step": 23765
    },
    {
      "epoch": 2.521323997453851,
      "grad_norm": 0.4367791741914197,
      "learning_rate": 4.4782600727081034e-05,
      "loss": 1.6485,
      "num_input_tokens_seen": 18698277088,
      "step": 23766
    },
    {
      "epoch": 2.5214300869934223,
      "grad_norm": 0.38220226104322524,
      "learning_rate": 4.4782175799602285e-05,
      "loss": 1.6287,
      "num_input_tokens_seen": 18699063888,
      "step": 23767
    },
    {
      "epoch": 2.521536176532994,
      "grad_norm": 0.4709653931444193,
      "learning_rate": 4.4781750856836454e-05,
      "loss": 1.74,
      "num_input_tokens_seen": 18699850592,
      "step": 23768
    },
    {
      "epoch": 2.5216422660725653,
      "grad_norm": 0.35573863171233105,
      "learning_rate": 4.478132589878387e-05,
      "loss": 1.7109,
      "num_input_tokens_seen": 18700637280,
      "step": 23769
    },
    {
      "epoch": 2.5217483556121367,
      "grad_norm": 0.4410229636658351,
      "learning_rate": 4.4780900925444844e-05,
      "loss": 1.5428,
      "num_input_tokens_seen": 18701423952,
      "step": 23770
    },
    {
      "epoch": 2.521854445151708,
      "grad_norm": 0.38765956410634483,
      "learning_rate": 4.4780475936819735e-05,
      "loss": 1.6628,
      "num_input_tokens_seen": 18702210688,
      "step": 23771
    },
    {
      "epoch": 2.5219605346912797,
      "grad_norm": 0.3644217381458048,
      "learning_rate": 4.4780050932908846e-05,
      "loss": 1.5985,
      "num_input_tokens_seen": 18702997488,
      "step": 23772
    },
    {
      "epoch": 2.5220666242308507,
      "grad_norm": 0.35551095718385944,
      "learning_rate": 4.4779625913712515e-05,
      "loss": 1.5106,
      "num_input_tokens_seen": 18703784208,
      "step": 23773
    },
    {
      "epoch": 2.522172713770422,
      "grad_norm": 0.39937533491716687,
      "learning_rate": 4.477920087923106e-05,
      "loss": 1.6017,
      "num_input_tokens_seen": 18704570928,
      "step": 23774
    },
    {
      "epoch": 2.5222788033099937,
      "grad_norm": 0.36710581835395856,
      "learning_rate": 4.477877582946484e-05,
      "loss": 1.596,
      "num_input_tokens_seen": 18705357664,
      "step": 23775
    },
    {
      "epoch": 2.522384892849565,
      "grad_norm": 0.37422267514343865,
      "learning_rate": 4.477835076441415e-05,
      "loss": 1.5934,
      "num_input_tokens_seen": 18706144384,
      "step": 23776
    },
    {
      "epoch": 2.5224909823891366,
      "grad_norm": 0.3996675680744652,
      "learning_rate": 4.477792568407933e-05,
      "loss": 1.7057,
      "num_input_tokens_seen": 18706931104,
      "step": 23777
    },
    {
      "epoch": 2.5225970719287076,
      "grad_norm": 0.3805191914232618,
      "learning_rate": 4.4777500588460713e-05,
      "loss": 1.6333,
      "num_input_tokens_seen": 18707717888,
      "step": 23778
    },
    {
      "epoch": 2.522703161468279,
      "grad_norm": 0.387321789773988,
      "learning_rate": 4.477707547755862e-05,
      "loss": 1.685,
      "num_input_tokens_seen": 18708504640,
      "step": 23779
    },
    {
      "epoch": 2.5228092510078506,
      "grad_norm": 0.368299034522937,
      "learning_rate": 4.477665035137338e-05,
      "loss": 1.6348,
      "num_input_tokens_seen": 18709291440,
      "step": 23780
    },
    {
      "epoch": 2.522915340547422,
      "grad_norm": 0.4212226627724351,
      "learning_rate": 4.477622520990534e-05,
      "loss": 1.6815,
      "num_input_tokens_seen": 18710078208,
      "step": 23781
    },
    {
      "epoch": 2.5230214300869935,
      "grad_norm": 0.43195185897460225,
      "learning_rate": 4.4775800053154806e-05,
      "loss": 1.5661,
      "num_input_tokens_seen": 18710865024,
      "step": 23782
    },
    {
      "epoch": 2.5231275196265646,
      "grad_norm": 0.48727343963653524,
      "learning_rate": 4.477537488112211e-05,
      "loss": 1.6352,
      "num_input_tokens_seen": 18711651760,
      "step": 23783
    },
    {
      "epoch": 2.5232336091661365,
      "grad_norm": 0.41062088624901166,
      "learning_rate": 4.4774949693807585e-05,
      "loss": 1.5176,
      "num_input_tokens_seen": 18712438496,
      "step": 23784
    },
    {
      "epoch": 2.5233396987057075,
      "grad_norm": 0.4145468578909369,
      "learning_rate": 4.477452449121156e-05,
      "loss": 1.5434,
      "num_input_tokens_seen": 18713225328,
      "step": 23785
    },
    {
      "epoch": 2.523445788245279,
      "grad_norm": 0.4684680083293187,
      "learning_rate": 4.477409927333436e-05,
      "loss": 1.6004,
      "num_input_tokens_seen": 18714012032,
      "step": 23786
    },
    {
      "epoch": 2.5235518777848505,
      "grad_norm": 0.5440109471140951,
      "learning_rate": 4.477367404017632e-05,
      "loss": 1.659,
      "num_input_tokens_seen": 18714798752,
      "step": 23787
    },
    {
      "epoch": 2.523657967324422,
      "grad_norm": 0.36835321675107224,
      "learning_rate": 4.477324879173777e-05,
      "loss": 1.6077,
      "num_input_tokens_seen": 18715585536,
      "step": 23788
    },
    {
      "epoch": 2.5237640568639934,
      "grad_norm": 0.37323577197054825,
      "learning_rate": 4.4772823528019023e-05,
      "loss": 1.6034,
      "num_input_tokens_seen": 18716372304,
      "step": 23789
    },
    {
      "epoch": 2.5238701464035644,
      "grad_norm": 0.48256433875178895,
      "learning_rate": 4.477239824902042e-05,
      "loss": 1.6126,
      "num_input_tokens_seen": 18717159040,
      "step": 23790
    },
    {
      "epoch": 2.523976235943136,
      "grad_norm": 0.3793130043615086,
      "learning_rate": 4.4771972954742295e-05,
      "loss": 1.6269,
      "num_input_tokens_seen": 18717945744,
      "step": 23791
    },
    {
      "epoch": 2.5240823254827074,
      "grad_norm": 0.43060993360486155,
      "learning_rate": 4.477154764518496e-05,
      "loss": 1.7917,
      "num_input_tokens_seen": 18718732480,
      "step": 23792
    },
    {
      "epoch": 2.524188415022279,
      "grad_norm": 0.38702383341051194,
      "learning_rate": 4.477112232034877e-05,
      "loss": 1.4841,
      "num_input_tokens_seen": 18719519232,
      "step": 23793
    },
    {
      "epoch": 2.5242945045618503,
      "grad_norm": 0.4612855182948536,
      "learning_rate": 4.477069698023402e-05,
      "loss": 1.5369,
      "num_input_tokens_seen": 18720306032,
      "step": 23794
    },
    {
      "epoch": 2.5244005941014214,
      "grad_norm": 0.4282123368261693,
      "learning_rate": 4.477027162484106e-05,
      "loss": 1.6869,
      "num_input_tokens_seen": 18721092752,
      "step": 23795
    },
    {
      "epoch": 2.524506683640993,
      "grad_norm": 0.4490030480022722,
      "learning_rate": 4.476984625417022e-05,
      "loss": 1.608,
      "num_input_tokens_seen": 18721879568,
      "step": 23796
    },
    {
      "epoch": 2.5246127731805643,
      "grad_norm": 0.3522278939356516,
      "learning_rate": 4.4769420868221815e-05,
      "loss": 1.5354,
      "num_input_tokens_seen": 18722666464,
      "step": 23797
    },
    {
      "epoch": 2.524718862720136,
      "grad_norm": 0.5341797311248925,
      "learning_rate": 4.476899546699619e-05,
      "loss": 1.7055,
      "num_input_tokens_seen": 18723453216,
      "step": 23798
    },
    {
      "epoch": 2.5248249522597073,
      "grad_norm": 0.4501562826575553,
      "learning_rate": 4.4768570050493655e-05,
      "loss": 1.6197,
      "num_input_tokens_seen": 18724240000,
      "step": 23799
    },
    {
      "epoch": 2.5249310417992787,
      "grad_norm": 0.4624662136477363,
      "learning_rate": 4.4768144618714555e-05,
      "loss": 1.6254,
      "num_input_tokens_seen": 18725026752,
      "step": 23800
    },
    {
      "epoch": 2.52503713133885,
      "grad_norm": 0.47523854723670406,
      "learning_rate": 4.47677191716592e-05,
      "loss": 1.5295,
      "num_input_tokens_seen": 18725813488,
      "step": 23801
    },
    {
      "epoch": 2.5251432208784212,
      "grad_norm": 0.43854655236941403,
      "learning_rate": 4.476729370932795e-05,
      "loss": 1.595,
      "num_input_tokens_seen": 18726600224,
      "step": 23802
    },
    {
      "epoch": 2.5252493104179927,
      "grad_norm": 0.4936561165237777,
      "learning_rate": 4.4766868231721115e-05,
      "loss": 1.62,
      "num_input_tokens_seen": 18727386976,
      "step": 23803
    },
    {
      "epoch": 2.525355399957564,
      "grad_norm": 0.42036366081236387,
      "learning_rate": 4.476644273883902e-05,
      "loss": 1.6047,
      "num_input_tokens_seen": 18728173776,
      "step": 23804
    },
    {
      "epoch": 2.5254614894971357,
      "grad_norm": 0.40095400786081975,
      "learning_rate": 4.476601723068199e-05,
      "loss": 1.6089,
      "num_input_tokens_seen": 18728960496,
      "step": 23805
    },
    {
      "epoch": 2.525567579036707,
      "grad_norm": 0.37595731152118494,
      "learning_rate": 4.4765591707250365e-05,
      "loss": 1.5114,
      "num_input_tokens_seen": 18729747232,
      "step": 23806
    },
    {
      "epoch": 2.525673668576278,
      "grad_norm": 0.43393117066286235,
      "learning_rate": 4.476516616854448e-05,
      "loss": 1.7261,
      "num_input_tokens_seen": 18730534032,
      "step": 23807
    },
    {
      "epoch": 2.5257797581158496,
      "grad_norm": 0.426435703076565,
      "learning_rate": 4.476474061456465e-05,
      "loss": 1.5972,
      "num_input_tokens_seen": 18731320816,
      "step": 23808
    },
    {
      "epoch": 2.525885847655421,
      "grad_norm": 0.40035904574234416,
      "learning_rate": 4.47643150453112e-05,
      "loss": 1.7187,
      "num_input_tokens_seen": 18732107584,
      "step": 23809
    },
    {
      "epoch": 2.5259919371949926,
      "grad_norm": 0.514631288768518,
      "learning_rate": 4.476388946078448e-05,
      "loss": 1.804,
      "num_input_tokens_seen": 18732894336,
      "step": 23810
    },
    {
      "epoch": 2.526098026734564,
      "grad_norm": 0.37153898165645516,
      "learning_rate": 4.47634638609848e-05,
      "loss": 1.576,
      "num_input_tokens_seen": 18733681136,
      "step": 23811
    },
    {
      "epoch": 2.526204116274135,
      "grad_norm": 0.5341370406861868,
      "learning_rate": 4.476303824591249e-05,
      "loss": 1.7486,
      "num_input_tokens_seen": 18734467952,
      "step": 23812
    },
    {
      "epoch": 2.526310205813707,
      "grad_norm": 0.4371545926334116,
      "learning_rate": 4.476261261556789e-05,
      "loss": 1.682,
      "num_input_tokens_seen": 18735254624,
      "step": 23813
    },
    {
      "epoch": 2.526416295353278,
      "grad_norm": 0.4911140916154533,
      "learning_rate": 4.4762186969951324e-05,
      "loss": 1.6507,
      "num_input_tokens_seen": 18736041328,
      "step": 23814
    },
    {
      "epoch": 2.5265223848928495,
      "grad_norm": 0.4139536519202081,
      "learning_rate": 4.4761761309063114e-05,
      "loss": 1.5714,
      "num_input_tokens_seen": 18736828096,
      "step": 23815
    },
    {
      "epoch": 2.526628474432421,
      "grad_norm": 0.40986732663076714,
      "learning_rate": 4.47613356329036e-05,
      "loss": 1.4891,
      "num_input_tokens_seen": 18737614848,
      "step": 23816
    },
    {
      "epoch": 2.5267345639719925,
      "grad_norm": 0.3721411741269055,
      "learning_rate": 4.476090994147311e-05,
      "loss": 1.5694,
      "num_input_tokens_seen": 18738401600,
      "step": 23817
    },
    {
      "epoch": 2.526840653511564,
      "grad_norm": 0.36741882589787744,
      "learning_rate": 4.476048423477196e-05,
      "loss": 1.4542,
      "num_input_tokens_seen": 18739188384,
      "step": 23818
    },
    {
      "epoch": 2.526946743051135,
      "grad_norm": 0.39557615334830876,
      "learning_rate": 4.4760058512800486e-05,
      "loss": 1.6454,
      "num_input_tokens_seen": 18739975248,
      "step": 23819
    },
    {
      "epoch": 2.5270528325907065,
      "grad_norm": 0.4764561494956227,
      "learning_rate": 4.4759632775559025e-05,
      "loss": 1.642,
      "num_input_tokens_seen": 18740761920,
      "step": 23820
    },
    {
      "epoch": 2.527158922130278,
      "grad_norm": 0.33220164334583774,
      "learning_rate": 4.47592070230479e-05,
      "loss": 1.5208,
      "num_input_tokens_seen": 18741548720,
      "step": 23821
    },
    {
      "epoch": 2.5272650116698494,
      "grad_norm": 0.44469339051590967,
      "learning_rate": 4.4758781255267437e-05,
      "loss": 1.6582,
      "num_input_tokens_seen": 18742335440,
      "step": 23822
    },
    {
      "epoch": 2.527371101209421,
      "grad_norm": 0.4188021456562805,
      "learning_rate": 4.475835547221796e-05,
      "loss": 1.6962,
      "num_input_tokens_seen": 18743122144,
      "step": 23823
    },
    {
      "epoch": 2.527477190748992,
      "grad_norm": 0.40027964962874935,
      "learning_rate": 4.475792967389982e-05,
      "loss": 1.648,
      "num_input_tokens_seen": 18743908896,
      "step": 23824
    },
    {
      "epoch": 2.5275832802885634,
      "grad_norm": 0.38143287866309455,
      "learning_rate": 4.475750386031332e-05,
      "loss": 1.5917,
      "num_input_tokens_seen": 18744695536,
      "step": 23825
    },
    {
      "epoch": 2.527689369828135,
      "grad_norm": 0.3890609295283164,
      "learning_rate": 4.475707803145881e-05,
      "loss": 1.6461,
      "num_input_tokens_seen": 18745482400,
      "step": 23826
    },
    {
      "epoch": 2.5277954593677063,
      "grad_norm": 0.3947111013453794,
      "learning_rate": 4.47566521873366e-05,
      "loss": 1.5931,
      "num_input_tokens_seen": 18746269200,
      "step": 23827
    },
    {
      "epoch": 2.527901548907278,
      "grad_norm": 0.3635106021348958,
      "learning_rate": 4.4756226327947035e-05,
      "loss": 1.4677,
      "num_input_tokens_seen": 18747055936,
      "step": 23828
    },
    {
      "epoch": 2.5280076384468493,
      "grad_norm": 0.43762152515889713,
      "learning_rate": 4.475580045329044e-05,
      "loss": 1.5063,
      "num_input_tokens_seen": 18747842672,
      "step": 23829
    },
    {
      "epoch": 2.5281137279864208,
      "grad_norm": 0.37188167038201264,
      "learning_rate": 4.475537456336713e-05,
      "loss": 1.5095,
      "num_input_tokens_seen": 18748629584,
      "step": 23830
    },
    {
      "epoch": 2.528219817525992,
      "grad_norm": 0.3843439516661965,
      "learning_rate": 4.4754948658177464e-05,
      "loss": 1.608,
      "num_input_tokens_seen": 18749416304,
      "step": 23831
    },
    {
      "epoch": 2.5283259070655633,
      "grad_norm": 0.4181896645995085,
      "learning_rate": 4.4754522737721746e-05,
      "loss": 1.6798,
      "num_input_tokens_seen": 18750203120,
      "step": 23832
    },
    {
      "epoch": 2.5284319966051347,
      "grad_norm": 0.38751750955717074,
      "learning_rate": 4.475409680200031e-05,
      "loss": 1.5781,
      "num_input_tokens_seen": 18750989904,
      "step": 23833
    },
    {
      "epoch": 2.528538086144706,
      "grad_norm": 0.39381011007438144,
      "learning_rate": 4.475367085101348e-05,
      "loss": 1.505,
      "num_input_tokens_seen": 18751776656,
      "step": 23834
    },
    {
      "epoch": 2.5286441756842777,
      "grad_norm": 0.38176855655877523,
      "learning_rate": 4.4753244884761615e-05,
      "loss": 1.6536,
      "num_input_tokens_seen": 18752563424,
      "step": 23835
    },
    {
      "epoch": 2.5287502652238487,
      "grad_norm": 0.42153754225436973,
      "learning_rate": 4.4752818903245e-05,
      "loss": 1.6431,
      "num_input_tokens_seen": 18753350160,
      "step": 23836
    },
    {
      "epoch": 2.52885635476342,
      "grad_norm": 0.37653306985355656,
      "learning_rate": 4.4752392906464e-05,
      "loss": 1.5219,
      "num_input_tokens_seen": 18754136928,
      "step": 23837
    },
    {
      "epoch": 2.5289624443029917,
      "grad_norm": 0.37911637245792806,
      "learning_rate": 4.4751966894418926e-05,
      "loss": 1.6791,
      "num_input_tokens_seen": 18754923648,
      "step": 23838
    },
    {
      "epoch": 2.529068533842563,
      "grad_norm": 0.46961448533797445,
      "learning_rate": 4.475154086711011e-05,
      "loss": 1.6762,
      "num_input_tokens_seen": 18755710352,
      "step": 23839
    },
    {
      "epoch": 2.5291746233821346,
      "grad_norm": 0.3904920257816963,
      "learning_rate": 4.4751114824537884e-05,
      "loss": 1.5938,
      "num_input_tokens_seen": 18756497152,
      "step": 23840
    },
    {
      "epoch": 2.5292807129217056,
      "grad_norm": 0.4789211496067543,
      "learning_rate": 4.475068876670258e-05,
      "loss": 1.6812,
      "num_input_tokens_seen": 18757283840,
      "step": 23841
    },
    {
      "epoch": 2.5293868024612776,
      "grad_norm": 0.3839622065273268,
      "learning_rate": 4.475026269360451e-05,
      "loss": 1.5833,
      "num_input_tokens_seen": 18758070608,
      "step": 23842
    },
    {
      "epoch": 2.5294928920008486,
      "grad_norm": 0.3615110777573299,
      "learning_rate": 4.474983660524402e-05,
      "loss": 1.5342,
      "num_input_tokens_seen": 18758857392,
      "step": 23843
    },
    {
      "epoch": 2.52959898154042,
      "grad_norm": 0.43644372636593753,
      "learning_rate": 4.4749410501621446e-05,
      "loss": 1.6367,
      "num_input_tokens_seen": 18759644144,
      "step": 23844
    },
    {
      "epoch": 2.5297050710799915,
      "grad_norm": 0.3920392892783124,
      "learning_rate": 4.47489843827371e-05,
      "loss": 1.6016,
      "num_input_tokens_seen": 18760430912,
      "step": 23845
    },
    {
      "epoch": 2.529811160619563,
      "grad_norm": 0.3792357367354352,
      "learning_rate": 4.474855824859132e-05,
      "loss": 1.5205,
      "num_input_tokens_seen": 18761217648,
      "step": 23846
    },
    {
      "epoch": 2.5299172501591345,
      "grad_norm": 0.3604699245616718,
      "learning_rate": 4.4748132099184435e-05,
      "loss": 1.5754,
      "num_input_tokens_seen": 18762004384,
      "step": 23847
    },
    {
      "epoch": 2.5300233396987055,
      "grad_norm": 0.3856832564235364,
      "learning_rate": 4.474770593451677e-05,
      "loss": 1.5629,
      "num_input_tokens_seen": 18762791168,
      "step": 23848
    },
    {
      "epoch": 2.530129429238277,
      "grad_norm": 0.3774592133002262,
      "learning_rate": 4.474727975458866e-05,
      "loss": 1.6512,
      "num_input_tokens_seen": 18763577936,
      "step": 23849
    },
    {
      "epoch": 2.5302355187778485,
      "grad_norm": 0.3578114099057391,
      "learning_rate": 4.474685355940043e-05,
      "loss": 1.5293,
      "num_input_tokens_seen": 18764364720,
      "step": 23850
    },
    {
      "epoch": 2.53034160831742,
      "grad_norm": 0.35197780336648726,
      "learning_rate": 4.474642734895241e-05,
      "loss": 1.7432,
      "num_input_tokens_seen": 18765151392,
      "step": 23851
    },
    {
      "epoch": 2.5304476978569914,
      "grad_norm": 0.37851597419180366,
      "learning_rate": 4.474600112324494e-05,
      "loss": 1.566,
      "num_input_tokens_seen": 18765938192,
      "step": 23852
    },
    {
      "epoch": 2.5305537873965624,
      "grad_norm": 0.35449258865256766,
      "learning_rate": 4.474557488227833e-05,
      "loss": 1.6239,
      "num_input_tokens_seen": 18766724944,
      "step": 23853
    },
    {
      "epoch": 2.5306598769361344,
      "grad_norm": 0.34434358051601816,
      "learning_rate": 4.4745148626052925e-05,
      "loss": 1.5536,
      "num_input_tokens_seen": 18767511664,
      "step": 23854
    },
    {
      "epoch": 2.5307659664757054,
      "grad_norm": 0.49194789330264327,
      "learning_rate": 4.4744722354569034e-05,
      "loss": 1.6779,
      "num_input_tokens_seen": 18768298480,
      "step": 23855
    },
    {
      "epoch": 2.530872056015277,
      "grad_norm": 0.44818245696548953,
      "learning_rate": 4.474429606782702e-05,
      "loss": 1.6319,
      "num_input_tokens_seen": 18769085248,
      "step": 23856
    },
    {
      "epoch": 2.5309781455548483,
      "grad_norm": 0.48809881212473943,
      "learning_rate": 4.4743869765827186e-05,
      "loss": 1.5635,
      "num_input_tokens_seen": 18769872048,
      "step": 23857
    },
    {
      "epoch": 2.53108423509442,
      "grad_norm": 0.41298158607112234,
      "learning_rate": 4.4743443448569865e-05,
      "loss": 1.6367,
      "num_input_tokens_seen": 18770658832,
      "step": 23858
    },
    {
      "epoch": 2.5311903246339913,
      "grad_norm": 0.4258950787547064,
      "learning_rate": 4.4743017116055394e-05,
      "loss": 1.6024,
      "num_input_tokens_seen": 18771445536,
      "step": 23859
    },
    {
      "epoch": 2.5312964141735623,
      "grad_norm": 0.3576383108871129,
      "learning_rate": 4.474259076828409e-05,
      "loss": 1.5018,
      "num_input_tokens_seen": 18772232272,
      "step": 23860
    },
    {
      "epoch": 2.531402503713134,
      "grad_norm": 0.5011994594690571,
      "learning_rate": 4.47421644052563e-05,
      "loss": 1.6794,
      "num_input_tokens_seen": 18773019008,
      "step": 23861
    },
    {
      "epoch": 2.5315085932527053,
      "grad_norm": 0.38084324820401133,
      "learning_rate": 4.4741738026972344e-05,
      "loss": 1.59,
      "num_input_tokens_seen": 18773805760,
      "step": 23862
    },
    {
      "epoch": 2.5316146827922767,
      "grad_norm": 0.3821219665908733,
      "learning_rate": 4.474131163343255e-05,
      "loss": 1.6575,
      "num_input_tokens_seen": 18774592560,
      "step": 23863
    },
    {
      "epoch": 2.5317207723318482,
      "grad_norm": 0.38726817405399105,
      "learning_rate": 4.4740885224637254e-05,
      "loss": 1.6545,
      "num_input_tokens_seen": 18775379328,
      "step": 23864
    },
    {
      "epoch": 2.5318268618714193,
      "grad_norm": 0.3298637577942356,
      "learning_rate": 4.474045880058678e-05,
      "loss": 1.5558,
      "num_input_tokens_seen": 18776166048,
      "step": 23865
    },
    {
      "epoch": 2.5319329514109907,
      "grad_norm": 0.3677360890382365,
      "learning_rate": 4.4740032361281456e-05,
      "loss": 1.5914,
      "num_input_tokens_seen": 18776952752,
      "step": 23866
    },
    {
      "epoch": 2.532039040950562,
      "grad_norm": 0.3918810853887865,
      "learning_rate": 4.473960590672161e-05,
      "loss": 1.4755,
      "num_input_tokens_seen": 18777739568,
      "step": 23867
    },
    {
      "epoch": 2.5321451304901337,
      "grad_norm": 0.3393523973060321,
      "learning_rate": 4.4739179436907586e-05,
      "loss": 1.5544,
      "num_input_tokens_seen": 18778526432,
      "step": 23868
    },
    {
      "epoch": 2.532251220029705,
      "grad_norm": 0.38520638386500733,
      "learning_rate": 4.473875295183969e-05,
      "loss": 1.5585,
      "num_input_tokens_seen": 18779313216,
      "step": 23869
    },
    {
      "epoch": 2.5323573095692766,
      "grad_norm": 0.3789478281805409,
      "learning_rate": 4.4738326451518274e-05,
      "loss": 1.6376,
      "num_input_tokens_seen": 18780099968,
      "step": 23870
    },
    {
      "epoch": 2.532463399108848,
      "grad_norm": 0.3769528601126669,
      "learning_rate": 4.473789993594366e-05,
      "loss": 1.5489,
      "num_input_tokens_seen": 18780886768,
      "step": 23871
    },
    {
      "epoch": 2.532569488648419,
      "grad_norm": 0.4349250889764852,
      "learning_rate": 4.473747340511617e-05,
      "loss": 1.4084,
      "num_input_tokens_seen": 18781673520,
      "step": 23872
    },
    {
      "epoch": 2.5326755781879906,
      "grad_norm": 0.41098008291345955,
      "learning_rate": 4.4737046859036144e-05,
      "loss": 1.6487,
      "num_input_tokens_seen": 18782460240,
      "step": 23873
    },
    {
      "epoch": 2.532781667727562,
      "grad_norm": 0.5106596965326352,
      "learning_rate": 4.473662029770391e-05,
      "loss": 1.5996,
      "num_input_tokens_seen": 18783246928,
      "step": 23874
    },
    {
      "epoch": 2.5328877572671336,
      "grad_norm": 0.4125970899368015,
      "learning_rate": 4.473619372111979e-05,
      "loss": 1.6514,
      "num_input_tokens_seen": 18784033776,
      "step": 23875
    },
    {
      "epoch": 2.532993846806705,
      "grad_norm": 0.586444623091092,
      "learning_rate": 4.473576712928412e-05,
      "loss": 1.5376,
      "num_input_tokens_seen": 18784820496,
      "step": 23876
    },
    {
      "epoch": 2.533099936346276,
      "grad_norm": 0.35929509703427587,
      "learning_rate": 4.473534052219722e-05,
      "loss": 1.6903,
      "num_input_tokens_seen": 18785607328,
      "step": 23877
    },
    {
      "epoch": 2.5332060258858475,
      "grad_norm": 0.5190763722306994,
      "learning_rate": 4.4734913899859444e-05,
      "loss": 1.6052,
      "num_input_tokens_seen": 18786394160,
      "step": 23878
    },
    {
      "epoch": 2.533312115425419,
      "grad_norm": 0.39401780414635484,
      "learning_rate": 4.4734487262271095e-05,
      "loss": 1.6898,
      "num_input_tokens_seen": 18787180944,
      "step": 23879
    },
    {
      "epoch": 2.5334182049649905,
      "grad_norm": 0.45340093483057037,
      "learning_rate": 4.4734060609432514e-05,
      "loss": 1.6385,
      "num_input_tokens_seen": 18787967648,
      "step": 23880
    },
    {
      "epoch": 2.533524294504562,
      "grad_norm": 0.4309367249408504,
      "learning_rate": 4.4733633941344033e-05,
      "loss": 1.5224,
      "num_input_tokens_seen": 18788754400,
      "step": 23881
    },
    {
      "epoch": 2.533630384044133,
      "grad_norm": 0.3784813152199583,
      "learning_rate": 4.4733207258005985e-05,
      "loss": 1.5804,
      "num_input_tokens_seen": 18789541072,
      "step": 23882
    },
    {
      "epoch": 2.533736473583705,
      "grad_norm": 0.36787829334857286,
      "learning_rate": 4.473278055941868e-05,
      "loss": 1.7079,
      "num_input_tokens_seen": 18790327840,
      "step": 23883
    },
    {
      "epoch": 2.533842563123276,
      "grad_norm": 0.4305814949655643,
      "learning_rate": 4.473235384558247e-05,
      "loss": 1.5196,
      "num_input_tokens_seen": 18791114576,
      "step": 23884
    },
    {
      "epoch": 2.5339486526628474,
      "grad_norm": 0.40319737334171746,
      "learning_rate": 4.473192711649767e-05,
      "loss": 1.6686,
      "num_input_tokens_seen": 18791901328,
      "step": 23885
    },
    {
      "epoch": 2.534054742202419,
      "grad_norm": 0.4487322188246299,
      "learning_rate": 4.473150037216462e-05,
      "loss": 1.5543,
      "num_input_tokens_seen": 18792688160,
      "step": 23886
    },
    {
      "epoch": 2.5341608317419904,
      "grad_norm": 0.3871741110151866,
      "learning_rate": 4.473107361258364e-05,
      "loss": 1.6888,
      "num_input_tokens_seen": 18793474960,
      "step": 23887
    },
    {
      "epoch": 2.534266921281562,
      "grad_norm": 0.40732312105528123,
      "learning_rate": 4.473064683775508e-05,
      "loss": 1.6328,
      "num_input_tokens_seen": 18794261680,
      "step": 23888
    },
    {
      "epoch": 2.534373010821133,
      "grad_norm": 0.3970630388598723,
      "learning_rate": 4.4730220047679236e-05,
      "loss": 1.5004,
      "num_input_tokens_seen": 18795048464,
      "step": 23889
    },
    {
      "epoch": 2.5344791003607043,
      "grad_norm": 0.38585304627975003,
      "learning_rate": 4.472979324235646e-05,
      "loss": 1.4612,
      "num_input_tokens_seen": 18795835264,
      "step": 23890
    },
    {
      "epoch": 2.534585189900276,
      "grad_norm": 0.4055455953799929,
      "learning_rate": 4.472936642178709e-05,
      "loss": 1.5896,
      "num_input_tokens_seen": 18796621920,
      "step": 23891
    },
    {
      "epoch": 2.5346912794398473,
      "grad_norm": 0.37790124738427144,
      "learning_rate": 4.472893958597144e-05,
      "loss": 1.5662,
      "num_input_tokens_seen": 18797408688,
      "step": 23892
    },
    {
      "epoch": 2.5347973689794188,
      "grad_norm": 0.48227020610450194,
      "learning_rate": 4.4728512734909844e-05,
      "loss": 1.6716,
      "num_input_tokens_seen": 18798195440,
      "step": 23893
    },
    {
      "epoch": 2.53490345851899,
      "grad_norm": 0.3626934082163856,
      "learning_rate": 4.472808586860263e-05,
      "loss": 1.5907,
      "num_input_tokens_seen": 18798982192,
      "step": 23894
    },
    {
      "epoch": 2.5350095480585613,
      "grad_norm": 0.4351422928323114,
      "learning_rate": 4.472765898705013e-05,
      "loss": 1.6041,
      "num_input_tokens_seen": 18799768992,
      "step": 23895
    },
    {
      "epoch": 2.5351156375981327,
      "grad_norm": 0.39222714086238375,
      "learning_rate": 4.472723209025268e-05,
      "loss": 1.645,
      "num_input_tokens_seen": 18800555696,
      "step": 23896
    },
    {
      "epoch": 2.535221727137704,
      "grad_norm": 0.35933016891606073,
      "learning_rate": 4.4726805178210596e-05,
      "loss": 1.5879,
      "num_input_tokens_seen": 18801342432,
      "step": 23897
    },
    {
      "epoch": 2.5353278166772757,
      "grad_norm": 0.4490432647683852,
      "learning_rate": 4.472637825092422e-05,
      "loss": 1.5392,
      "num_input_tokens_seen": 18802129168,
      "step": 23898
    },
    {
      "epoch": 2.535433906216847,
      "grad_norm": 0.4084734819960869,
      "learning_rate": 4.472595130839388e-05,
      "loss": 1.5641,
      "num_input_tokens_seen": 18802915936,
      "step": 23899
    },
    {
      "epoch": 2.5355399957564186,
      "grad_norm": 0.3659850682000759,
      "learning_rate": 4.472552435061989e-05,
      "loss": 1.5604,
      "num_input_tokens_seen": 18803702848,
      "step": 23900
    },
    {
      "epoch": 2.5356460852959897,
      "grad_norm": 0.4220837345789541,
      "learning_rate": 4.472509737760261e-05,
      "loss": 1.5162,
      "num_input_tokens_seen": 18804489600,
      "step": 23901
    },
    {
      "epoch": 2.535752174835561,
      "grad_norm": 0.40880587807008684,
      "learning_rate": 4.472467038934235e-05,
      "loss": 1.6792,
      "num_input_tokens_seen": 18805276384,
      "step": 23902
    },
    {
      "epoch": 2.5358582643751326,
      "grad_norm": 0.43439056111859015,
      "learning_rate": 4.472424338583944e-05,
      "loss": 1.4763,
      "num_input_tokens_seen": 18806063168,
      "step": 23903
    },
    {
      "epoch": 2.535964353914704,
      "grad_norm": 0.5555623619023659,
      "learning_rate": 4.472381636709421e-05,
      "loss": 1.6254,
      "num_input_tokens_seen": 18806849984,
      "step": 23904
    },
    {
      "epoch": 2.5360704434542756,
      "grad_norm": 0.4145663378738578,
      "learning_rate": 4.4723389333107005e-05,
      "loss": 1.7591,
      "num_input_tokens_seen": 18807636720,
      "step": 23905
    },
    {
      "epoch": 2.5361765329938466,
      "grad_norm": 0.41512077416672416,
      "learning_rate": 4.472296228387813e-05,
      "loss": 1.5124,
      "num_input_tokens_seen": 18808423488,
      "step": 23906
    },
    {
      "epoch": 2.536282622533418,
      "grad_norm": 0.4790531075535969,
      "learning_rate": 4.4722535219407934e-05,
      "loss": 1.6562,
      "num_input_tokens_seen": 18809210272,
      "step": 23907
    },
    {
      "epoch": 2.5363887120729895,
      "grad_norm": 0.40271124621142196,
      "learning_rate": 4.4722108139696745e-05,
      "loss": 1.5873,
      "num_input_tokens_seen": 18809996992,
      "step": 23908
    },
    {
      "epoch": 2.536494801612561,
      "grad_norm": 0.570639397364209,
      "learning_rate": 4.4721681044744885e-05,
      "loss": 1.648,
      "num_input_tokens_seen": 18810783728,
      "step": 23909
    },
    {
      "epoch": 2.5366008911521325,
      "grad_norm": 0.40560402428676845,
      "learning_rate": 4.472125393455269e-05,
      "loss": 1.6312,
      "num_input_tokens_seen": 18811570512,
      "step": 23910
    },
    {
      "epoch": 2.5367069806917035,
      "grad_norm": 0.5356491516018752,
      "learning_rate": 4.472082680912049e-05,
      "loss": 1.618,
      "num_input_tokens_seen": 18812357264,
      "step": 23911
    },
    {
      "epoch": 2.5368130702312754,
      "grad_norm": 0.3582485357115287,
      "learning_rate": 4.472039966844861e-05,
      "loss": 1.541,
      "num_input_tokens_seen": 18813144000,
      "step": 23912
    },
    {
      "epoch": 2.5369191597708465,
      "grad_norm": 0.423667395250568,
      "learning_rate": 4.471997251253739e-05,
      "loss": 1.5668,
      "num_input_tokens_seen": 18813930704,
      "step": 23913
    },
    {
      "epoch": 2.537025249310418,
      "grad_norm": 0.39931055610002425,
      "learning_rate": 4.471954534138715e-05,
      "loss": 1.5104,
      "num_input_tokens_seen": 18814717408,
      "step": 23914
    },
    {
      "epoch": 2.5371313388499894,
      "grad_norm": 0.4189678014426076,
      "learning_rate": 4.471911815499822e-05,
      "loss": 1.7411,
      "num_input_tokens_seen": 18815504240,
      "step": 23915
    },
    {
      "epoch": 2.537237428389561,
      "grad_norm": 0.5135628101166159,
      "learning_rate": 4.471869095337094e-05,
      "loss": 1.7246,
      "num_input_tokens_seen": 18816291072,
      "step": 23916
    },
    {
      "epoch": 2.5373435179291324,
      "grad_norm": 0.4272588243836749,
      "learning_rate": 4.471826373650563e-05,
      "loss": 1.5524,
      "num_input_tokens_seen": 18817077808,
      "step": 23917
    },
    {
      "epoch": 2.5374496074687034,
      "grad_norm": 0.4075034846677545,
      "learning_rate": 4.471783650440263e-05,
      "loss": 1.6266,
      "num_input_tokens_seen": 18817864672,
      "step": 23918
    },
    {
      "epoch": 2.537555697008275,
      "grad_norm": 0.45054507217585893,
      "learning_rate": 4.471740925706226e-05,
      "loss": 1.7317,
      "num_input_tokens_seen": 18818651360,
      "step": 23919
    },
    {
      "epoch": 2.5376617865478464,
      "grad_norm": 0.36347603232574854,
      "learning_rate": 4.471698199448485e-05,
      "loss": 1.5358,
      "num_input_tokens_seen": 18819438048,
      "step": 23920
    },
    {
      "epoch": 2.537767876087418,
      "grad_norm": 0.48265063366721783,
      "learning_rate": 4.471655471667075e-05,
      "loss": 1.558,
      "num_input_tokens_seen": 18820224912,
      "step": 23921
    },
    {
      "epoch": 2.5378739656269893,
      "grad_norm": 0.43318884583705575,
      "learning_rate": 4.4716127423620256e-05,
      "loss": 1.6176,
      "num_input_tokens_seen": 18821011616,
      "step": 23922
    },
    {
      "epoch": 2.5379800551665603,
      "grad_norm": 0.4131999150105618,
      "learning_rate": 4.471570011533373e-05,
      "loss": 1.6431,
      "num_input_tokens_seen": 18821798480,
      "step": 23923
    },
    {
      "epoch": 2.5380861447061323,
      "grad_norm": 0.43134791329173644,
      "learning_rate": 4.4715272791811494e-05,
      "loss": 1.6536,
      "num_input_tokens_seen": 18822585152,
      "step": 23924
    },
    {
      "epoch": 2.5381922342457033,
      "grad_norm": 0.3859502927806963,
      "learning_rate": 4.471484545305386e-05,
      "loss": 1.5335,
      "num_input_tokens_seen": 18823371952,
      "step": 23925
    },
    {
      "epoch": 2.5382983237852748,
      "grad_norm": 0.39752386661214223,
      "learning_rate": 4.471441809906118e-05,
      "loss": 1.7946,
      "num_input_tokens_seen": 18824158688,
      "step": 23926
    },
    {
      "epoch": 2.5384044133248462,
      "grad_norm": 0.3971804448489553,
      "learning_rate": 4.4713990729833774e-05,
      "loss": 1.5347,
      "num_input_tokens_seen": 18824945456,
      "step": 23927
    },
    {
      "epoch": 2.5385105028644177,
      "grad_norm": 0.44331774852611877,
      "learning_rate": 4.4713563345371976e-05,
      "loss": 1.6483,
      "num_input_tokens_seen": 18825732208,
      "step": 23928
    },
    {
      "epoch": 2.538616592403989,
      "grad_norm": 0.38503460772244985,
      "learning_rate": 4.471313594567611e-05,
      "loss": 1.6073,
      "num_input_tokens_seen": 18826518912,
      "step": 23929
    },
    {
      "epoch": 2.53872268194356,
      "grad_norm": 0.3816642827591348,
      "learning_rate": 4.471270853074652e-05,
      "loss": 1.6449,
      "num_input_tokens_seen": 18827305584,
      "step": 23930
    },
    {
      "epoch": 2.5388287714831317,
      "grad_norm": 0.3756539533520193,
      "learning_rate": 4.471228110058352e-05,
      "loss": 1.5745,
      "num_input_tokens_seen": 18828092384,
      "step": 23931
    },
    {
      "epoch": 2.538934861022703,
      "grad_norm": 0.4054040936023602,
      "learning_rate": 4.471185365518744e-05,
      "loss": 1.6623,
      "num_input_tokens_seen": 18828879120,
      "step": 23932
    },
    {
      "epoch": 2.5390409505622746,
      "grad_norm": 0.39991272574176534,
      "learning_rate": 4.471142619455863e-05,
      "loss": 1.5834,
      "num_input_tokens_seen": 18829665936,
      "step": 23933
    },
    {
      "epoch": 2.539147040101846,
      "grad_norm": 0.3850849011931467,
      "learning_rate": 4.471099871869741e-05,
      "loss": 1.564,
      "num_input_tokens_seen": 18830452752,
      "step": 23934
    },
    {
      "epoch": 2.539253129641417,
      "grad_norm": 0.47402897462471555,
      "learning_rate": 4.47105712276041e-05,
      "loss": 1.5598,
      "num_input_tokens_seen": 18831239472,
      "step": 23935
    },
    {
      "epoch": 2.5393592191809886,
      "grad_norm": 0.330102133220994,
      "learning_rate": 4.471014372127904e-05,
      "loss": 1.4102,
      "num_input_tokens_seen": 18832026336,
      "step": 23936
    },
    {
      "epoch": 2.53946530872056,
      "grad_norm": 0.4957645895083859,
      "learning_rate": 4.470971619972256e-05,
      "loss": 1.6514,
      "num_input_tokens_seen": 18832813104,
      "step": 23937
    },
    {
      "epoch": 2.5395713982601316,
      "grad_norm": 0.445680127732673,
      "learning_rate": 4.4709288662935e-05,
      "loss": 1.5026,
      "num_input_tokens_seen": 18833599920,
      "step": 23938
    },
    {
      "epoch": 2.539677487799703,
      "grad_norm": 0.3957564625133451,
      "learning_rate": 4.470886111091667e-05,
      "loss": 1.5205,
      "num_input_tokens_seen": 18834386688,
      "step": 23939
    },
    {
      "epoch": 2.5397835773392745,
      "grad_norm": 0.5609587485403931,
      "learning_rate": 4.470843354366791e-05,
      "loss": 1.5751,
      "num_input_tokens_seen": 18835173488,
      "step": 23940
    },
    {
      "epoch": 2.539889666878846,
      "grad_norm": 0.4250025617510645,
      "learning_rate": 4.4708005961189055e-05,
      "loss": 1.6493,
      "num_input_tokens_seen": 18835960224,
      "step": 23941
    },
    {
      "epoch": 2.539995756418417,
      "grad_norm": 0.600531079287177,
      "learning_rate": 4.470757836348043e-05,
      "loss": 1.6456,
      "num_input_tokens_seen": 18836746848,
      "step": 23942
    },
    {
      "epoch": 2.5401018459579885,
      "grad_norm": 0.41432398209850746,
      "learning_rate": 4.470715075054236e-05,
      "loss": 1.4836,
      "num_input_tokens_seen": 18837533568,
      "step": 23943
    },
    {
      "epoch": 2.54020793549756,
      "grad_norm": 0.5127002035188709,
      "learning_rate": 4.4706723122375186e-05,
      "loss": 1.519,
      "num_input_tokens_seen": 18838320368,
      "step": 23944
    },
    {
      "epoch": 2.5403140250371314,
      "grad_norm": 0.45425797054127687,
      "learning_rate": 4.4706295478979245e-05,
      "loss": 1.6286,
      "num_input_tokens_seen": 18839107072,
      "step": 23945
    },
    {
      "epoch": 2.540420114576703,
      "grad_norm": 0.5558008122148699,
      "learning_rate": 4.470586782035484e-05,
      "loss": 1.5698,
      "num_input_tokens_seen": 18839893840,
      "step": 23946
    },
    {
      "epoch": 2.540526204116274,
      "grad_norm": 0.4759108794931878,
      "learning_rate": 4.4705440146502334e-05,
      "loss": 1.6696,
      "num_input_tokens_seen": 18840680576,
      "step": 23947
    },
    {
      "epoch": 2.5406322936558454,
      "grad_norm": 0.5573584442944262,
      "learning_rate": 4.4705012457422036e-05,
      "loss": 1.627,
      "num_input_tokens_seen": 18841467328,
      "step": 23948
    },
    {
      "epoch": 2.540738383195417,
      "grad_norm": 0.41347791862754724,
      "learning_rate": 4.4704584753114275e-05,
      "loss": 1.5469,
      "num_input_tokens_seen": 18842254096,
      "step": 23949
    },
    {
      "epoch": 2.5408444727349884,
      "grad_norm": 0.3791617620493189,
      "learning_rate": 4.4704157033579395e-05,
      "loss": 1.381,
      "num_input_tokens_seen": 18843040960,
      "step": 23950
    },
    {
      "epoch": 2.54095056227456,
      "grad_norm": 0.5426466830622071,
      "learning_rate": 4.470372929881772e-05,
      "loss": 1.6361,
      "num_input_tokens_seen": 18843827648,
      "step": 23951
    },
    {
      "epoch": 2.541056651814131,
      "grad_norm": 0.4118962884224216,
      "learning_rate": 4.470330154882959e-05,
      "loss": 1.6316,
      "num_input_tokens_seen": 18844614352,
      "step": 23952
    },
    {
      "epoch": 2.541162741353703,
      "grad_norm": 0.4989998651795162,
      "learning_rate": 4.470287378361532e-05,
      "loss": 1.6067,
      "num_input_tokens_seen": 18845401152,
      "step": 23953
    },
    {
      "epoch": 2.541268830893274,
      "grad_norm": 0.39056492992762465,
      "learning_rate": 4.470244600317524e-05,
      "loss": 1.495,
      "num_input_tokens_seen": 18846188032,
      "step": 23954
    },
    {
      "epoch": 2.5413749204328453,
      "grad_norm": 0.46670562655910297,
      "learning_rate": 4.47020182075097e-05,
      "loss": 1.5796,
      "num_input_tokens_seen": 18846974688,
      "step": 23955
    },
    {
      "epoch": 2.5414810099724168,
      "grad_norm": 0.37022369877696526,
      "learning_rate": 4.470159039661901e-05,
      "loss": 1.5969,
      "num_input_tokens_seen": 18847761408,
      "step": 23956
    },
    {
      "epoch": 2.5415870995119882,
      "grad_norm": 0.38660937716417754,
      "learning_rate": 4.4701162570503505e-05,
      "loss": 1.5152,
      "num_input_tokens_seen": 18848548144,
      "step": 23957
    },
    {
      "epoch": 2.5416931890515597,
      "grad_norm": 0.4176910068312608,
      "learning_rate": 4.470073472916353e-05,
      "loss": 1.609,
      "num_input_tokens_seen": 18849334928,
      "step": 23958
    },
    {
      "epoch": 2.5417992785911308,
      "grad_norm": 0.38475488024848686,
      "learning_rate": 4.470030687259941e-05,
      "loss": 1.5584,
      "num_input_tokens_seen": 18850121744,
      "step": 23959
    },
    {
      "epoch": 2.5419053681307022,
      "grad_norm": 0.4286513700351077,
      "learning_rate": 4.4699879000811455e-05,
      "loss": 1.5269,
      "num_input_tokens_seen": 18850908608,
      "step": 23960
    },
    {
      "epoch": 2.5420114576702737,
      "grad_norm": 0.43834876196625,
      "learning_rate": 4.4699451113800015e-05,
      "loss": 1.6028,
      "num_input_tokens_seen": 18851695232,
      "step": 23961
    },
    {
      "epoch": 2.542117547209845,
      "grad_norm": 0.3537632342678659,
      "learning_rate": 4.469902321156543e-05,
      "loss": 1.5674,
      "num_input_tokens_seen": 18852482064,
      "step": 23962
    },
    {
      "epoch": 2.5422236367494166,
      "grad_norm": 0.43718942568581615,
      "learning_rate": 4.4698595294108005e-05,
      "loss": 1.6567,
      "num_input_tokens_seen": 18853268848,
      "step": 23963
    },
    {
      "epoch": 2.5423297262889877,
      "grad_norm": 0.5375184398471162,
      "learning_rate": 4.469816736142809e-05,
      "loss": 1.5064,
      "num_input_tokens_seen": 18854055600,
      "step": 23964
    },
    {
      "epoch": 2.542435815828559,
      "grad_norm": 0.5070490291922919,
      "learning_rate": 4.469773941352601e-05,
      "loss": 1.6585,
      "num_input_tokens_seen": 18854842272,
      "step": 23965
    },
    {
      "epoch": 2.5425419053681306,
      "grad_norm": 0.4074548428586129,
      "learning_rate": 4.4697311450402085e-05,
      "loss": 1.536,
      "num_input_tokens_seen": 18855629024,
      "step": 23966
    },
    {
      "epoch": 2.542647994907702,
      "grad_norm": 0.40898332453849495,
      "learning_rate": 4.469688347205666e-05,
      "loss": 1.4803,
      "num_input_tokens_seen": 18856415808,
      "step": 23967
    },
    {
      "epoch": 2.5427540844472736,
      "grad_norm": 0.3430772890867402,
      "learning_rate": 4.469645547849006e-05,
      "loss": 1.5474,
      "num_input_tokens_seen": 18857202656,
      "step": 23968
    },
    {
      "epoch": 2.542860173986845,
      "grad_norm": 0.4019649852673794,
      "learning_rate": 4.4696027469702626e-05,
      "loss": 1.6575,
      "num_input_tokens_seen": 18857989408,
      "step": 23969
    },
    {
      "epoch": 2.5429662635264165,
      "grad_norm": 0.38947252933954635,
      "learning_rate": 4.469559944569468e-05,
      "loss": 1.4784,
      "num_input_tokens_seen": 18858776224,
      "step": 23970
    },
    {
      "epoch": 2.5430723530659876,
      "grad_norm": 0.42155207114537285,
      "learning_rate": 4.469517140646654e-05,
      "loss": 1.5969,
      "num_input_tokens_seen": 18859563024,
      "step": 23971
    },
    {
      "epoch": 2.543178442605559,
      "grad_norm": 0.3626597945860199,
      "learning_rate": 4.469474335201857e-05,
      "loss": 1.5869,
      "num_input_tokens_seen": 18860349856,
      "step": 23972
    },
    {
      "epoch": 2.5432845321451305,
      "grad_norm": 0.5572228802330034,
      "learning_rate": 4.469431528235106e-05,
      "loss": 1.5761,
      "num_input_tokens_seen": 18861136640,
      "step": 23973
    },
    {
      "epoch": 2.543390621684702,
      "grad_norm": 0.47979204065763875,
      "learning_rate": 4.4693887197464366e-05,
      "loss": 1.6341,
      "num_input_tokens_seen": 18861923328,
      "step": 23974
    },
    {
      "epoch": 2.5434967112242735,
      "grad_norm": 0.7282073190267336,
      "learning_rate": 4.469345909735882e-05,
      "loss": 1.6486,
      "num_input_tokens_seen": 18862710064,
      "step": 23975
    },
    {
      "epoch": 2.5436028007638445,
      "grad_norm": 0.5157469086939712,
      "learning_rate": 4.469303098203474e-05,
      "loss": 1.6934,
      "num_input_tokens_seen": 18863496800,
      "step": 23976
    },
    {
      "epoch": 2.543708890303416,
      "grad_norm": 0.5409819172749751,
      "learning_rate": 4.4692602851492466e-05,
      "loss": 1.646,
      "num_input_tokens_seen": 18864283584,
      "step": 23977
    },
    {
      "epoch": 2.5438149798429874,
      "grad_norm": 0.6604585621636974,
      "learning_rate": 4.469217470573233e-05,
      "loss": 1.5699,
      "num_input_tokens_seen": 18865070352,
      "step": 23978
    },
    {
      "epoch": 2.543921069382559,
      "grad_norm": 0.36485153077267923,
      "learning_rate": 4.4691746544754654e-05,
      "loss": 1.6274,
      "num_input_tokens_seen": 18865857120,
      "step": 23979
    },
    {
      "epoch": 2.5440271589221304,
      "grad_norm": 0.5519602782013778,
      "learning_rate": 4.4691318368559776e-05,
      "loss": 1.6455,
      "num_input_tokens_seen": 18866643856,
      "step": 23980
    },
    {
      "epoch": 2.5441332484617014,
      "grad_norm": 0.5644339725440825,
      "learning_rate": 4.4690890177148025e-05,
      "loss": 1.5949,
      "num_input_tokens_seen": 18867430592,
      "step": 23981
    },
    {
      "epoch": 2.5442393380012733,
      "grad_norm": 0.47489023787851514,
      "learning_rate": 4.469046197051973e-05,
      "loss": 1.6573,
      "num_input_tokens_seen": 18868217392,
      "step": 23982
    },
    {
      "epoch": 2.5443454275408444,
      "grad_norm": 0.5685156644252111,
      "learning_rate": 4.469003374867522e-05,
      "loss": 1.6399,
      "num_input_tokens_seen": 18869004208,
      "step": 23983
    },
    {
      "epoch": 2.544451517080416,
      "grad_norm": 0.4032205158461096,
      "learning_rate": 4.468960551161484e-05,
      "loss": 1.6461,
      "num_input_tokens_seen": 18869790976,
      "step": 23984
    },
    {
      "epoch": 2.5445576066199873,
      "grad_norm": 0.5649949872283271,
      "learning_rate": 4.4689177259338906e-05,
      "loss": 1.7109,
      "num_input_tokens_seen": 18870577744,
      "step": 23985
    },
    {
      "epoch": 2.544663696159559,
      "grad_norm": 0.42130106703671877,
      "learning_rate": 4.4688748991847754e-05,
      "loss": 1.5473,
      "num_input_tokens_seen": 18871364544,
      "step": 23986
    },
    {
      "epoch": 2.5447697856991303,
      "grad_norm": 0.42143369176448914,
      "learning_rate": 4.4688320709141715e-05,
      "loss": 1.4578,
      "num_input_tokens_seen": 18872151360,
      "step": 23987
    },
    {
      "epoch": 2.5448758752387013,
      "grad_norm": 0.4472457457403615,
      "learning_rate": 4.4687892411221114e-05,
      "loss": 1.5075,
      "num_input_tokens_seen": 18872938224,
      "step": 23988
    },
    {
      "epoch": 2.5449819647782728,
      "grad_norm": 0.38783771153053415,
      "learning_rate": 4.468746409808629e-05,
      "loss": 1.594,
      "num_input_tokens_seen": 18873725024,
      "step": 23989
    },
    {
      "epoch": 2.5450880543178442,
      "grad_norm": 0.4333348306671297,
      "learning_rate": 4.4687035769737576e-05,
      "loss": 1.5379,
      "num_input_tokens_seen": 18874511856,
      "step": 23990
    },
    {
      "epoch": 2.5451941438574157,
      "grad_norm": 0.4261386836892781,
      "learning_rate": 4.468660742617529e-05,
      "loss": 1.5498,
      "num_input_tokens_seen": 18875298512,
      "step": 23991
    },
    {
      "epoch": 2.545300233396987,
      "grad_norm": 0.3708924816125931,
      "learning_rate": 4.468617906739978e-05,
      "loss": 1.5922,
      "num_input_tokens_seen": 18876085200,
      "step": 23992
    },
    {
      "epoch": 2.545406322936558,
      "grad_norm": 0.42664432533451335,
      "learning_rate": 4.468575069341137e-05,
      "loss": 1.5945,
      "num_input_tokens_seen": 18876871984,
      "step": 23993
    },
    {
      "epoch": 2.5455124124761297,
      "grad_norm": 0.4120463985015374,
      "learning_rate": 4.4685322304210376e-05,
      "loss": 1.5924,
      "num_input_tokens_seen": 18877658800,
      "step": 23994
    },
    {
      "epoch": 2.545618502015701,
      "grad_norm": 0.3418613380662897,
      "learning_rate": 4.4684893899797154e-05,
      "loss": 1.5808,
      "num_input_tokens_seen": 18878445632,
      "step": 23995
    },
    {
      "epoch": 2.5457245915552726,
      "grad_norm": 0.37471014505997025,
      "learning_rate": 4.468446548017202e-05,
      "loss": 1.5142,
      "num_input_tokens_seen": 18879232512,
      "step": 23996
    },
    {
      "epoch": 2.545830681094844,
      "grad_norm": 0.4624496927557649,
      "learning_rate": 4.4684037045335306e-05,
      "loss": 1.7051,
      "num_input_tokens_seen": 18880019216,
      "step": 23997
    },
    {
      "epoch": 2.5459367706344156,
      "grad_norm": 0.3391653168259623,
      "learning_rate": 4.468360859528735e-05,
      "loss": 1.547,
      "num_input_tokens_seen": 18880806000,
      "step": 23998
    },
    {
      "epoch": 2.546042860173987,
      "grad_norm": 0.475291988858559,
      "learning_rate": 4.468318013002848e-05,
      "loss": 1.5145,
      "num_input_tokens_seen": 18881592752,
      "step": 23999
    },
    {
      "epoch": 2.546148949713558,
      "grad_norm": 0.41246101041952127,
      "learning_rate": 4.4682751649559024e-05,
      "loss": 1.6178,
      "num_input_tokens_seen": 18882379552,
      "step": 24000
    },
    {
      "epoch": 2.546148949713558,
      "eval_loss": 1.6652144193649292,
      "eval_runtime": 64.2423,
      "eval_samples_per_second": 46.698,
      "eval_steps_per_second": 0.498,
      "num_input_tokens_seen": 18882379552,
      "step": 24000
    },
    {
      "epoch": 2.5462550392531296,
      "grad_norm": 0.4093507607265836,
      "learning_rate": 4.468232315387931e-05,
      "loss": 1.5346,
      "num_input_tokens_seen": 18883166384,
      "step": 24001
    },
    {
      "epoch": 2.546361128792701,
      "grad_norm": 0.49802074499577415,
      "learning_rate": 4.468189464298968e-05,
      "loss": 1.5399,
      "num_input_tokens_seen": 18883953264,
      "step": 24002
    },
    {
      "epoch": 2.5464672183322725,
      "grad_norm": 0.35962313250456657,
      "learning_rate": 4.468146611689046e-05,
      "loss": 1.6988,
      "num_input_tokens_seen": 18884740080,
      "step": 24003
    },
    {
      "epoch": 2.546573307871844,
      "grad_norm": 0.4079235936894052,
      "learning_rate": 4.4681037575581984e-05,
      "loss": 1.5221,
      "num_input_tokens_seen": 18885526848,
      "step": 24004
    },
    {
      "epoch": 2.546679397411415,
      "grad_norm": 0.4515134153808947,
      "learning_rate": 4.468060901906457e-05,
      "loss": 1.6545,
      "num_input_tokens_seen": 18886313632,
      "step": 24005
    },
    {
      "epoch": 2.5467854869509865,
      "grad_norm": 0.3773648673432608,
      "learning_rate": 4.468018044733857e-05,
      "loss": 1.5612,
      "num_input_tokens_seen": 18887100528,
      "step": 24006
    },
    {
      "epoch": 2.546891576490558,
      "grad_norm": 0.43928824597660976,
      "learning_rate": 4.4679751860404295e-05,
      "loss": 1.5559,
      "num_input_tokens_seen": 18887887328,
      "step": 24007
    },
    {
      "epoch": 2.5469976660301294,
      "grad_norm": 0.3844645105260464,
      "learning_rate": 4.467932325826209e-05,
      "loss": 1.5564,
      "num_input_tokens_seen": 18888674016,
      "step": 24008
    },
    {
      "epoch": 2.547103755569701,
      "grad_norm": 0.3688585775775854,
      "learning_rate": 4.467889464091227e-05,
      "loss": 1.7302,
      "num_input_tokens_seen": 18889460704,
      "step": 24009
    },
    {
      "epoch": 2.547209845109272,
      "grad_norm": 0.3971942981088911,
      "learning_rate": 4.467846600835519e-05,
      "loss": 1.561,
      "num_input_tokens_seen": 18890247408,
      "step": 24010
    },
    {
      "epoch": 2.547315934648844,
      "grad_norm": 0.441010048837563,
      "learning_rate": 4.4678037360591164e-05,
      "loss": 1.6525,
      "num_input_tokens_seen": 18891034192,
      "step": 24011
    },
    {
      "epoch": 2.547422024188415,
      "grad_norm": 0.3691350637555885,
      "learning_rate": 4.467760869762053e-05,
      "loss": 1.4355,
      "num_input_tokens_seen": 18891821024,
      "step": 24012
    },
    {
      "epoch": 2.5475281137279864,
      "grad_norm": 0.5062368885644132,
      "learning_rate": 4.467718001944362e-05,
      "loss": 1.6675,
      "num_input_tokens_seen": 18892607872,
      "step": 24013
    },
    {
      "epoch": 2.547634203267558,
      "grad_norm": 0.45047024066190106,
      "learning_rate": 4.467675132606076e-05,
      "loss": 1.5689,
      "num_input_tokens_seen": 18893394592,
      "step": 24014
    },
    {
      "epoch": 2.5477402928071293,
      "grad_norm": 0.4429167925734331,
      "learning_rate": 4.467632261747228e-05,
      "loss": 1.6583,
      "num_input_tokens_seen": 18894181312,
      "step": 24015
    },
    {
      "epoch": 2.547846382346701,
      "grad_norm": 0.42171238887077533,
      "learning_rate": 4.4675893893678514e-05,
      "loss": 1.7687,
      "num_input_tokens_seen": 18894968064,
      "step": 24016
    },
    {
      "epoch": 2.547952471886272,
      "grad_norm": 0.349527742112386,
      "learning_rate": 4.467546515467981e-05,
      "loss": 1.6388,
      "num_input_tokens_seen": 18895754944,
      "step": 24017
    },
    {
      "epoch": 2.5480585614258433,
      "grad_norm": 0.3801324765377015,
      "learning_rate": 4.4675036400476466e-05,
      "loss": 1.7026,
      "num_input_tokens_seen": 18896541648,
      "step": 24018
    },
    {
      "epoch": 2.548164650965415,
      "grad_norm": 0.3776455080887764,
      "learning_rate": 4.467460763106884e-05,
      "loss": 1.5618,
      "num_input_tokens_seen": 18897328464,
      "step": 24019
    },
    {
      "epoch": 2.5482707405049863,
      "grad_norm": 0.39574964822912356,
      "learning_rate": 4.467417884645725e-05,
      "loss": 1.6239,
      "num_input_tokens_seen": 18898115216,
      "step": 24020
    },
    {
      "epoch": 2.5483768300445577,
      "grad_norm": 0.36403898113967426,
      "learning_rate": 4.467375004664204e-05,
      "loss": 1.638,
      "num_input_tokens_seen": 18898901952,
      "step": 24021
    },
    {
      "epoch": 2.5484829195841288,
      "grad_norm": 0.3710399956164034,
      "learning_rate": 4.467332123162352e-05,
      "loss": 1.5664,
      "num_input_tokens_seen": 18899688624,
      "step": 24022
    },
    {
      "epoch": 2.5485890091237007,
      "grad_norm": 0.40389475157171445,
      "learning_rate": 4.4672892401402045e-05,
      "loss": 1.5767,
      "num_input_tokens_seen": 18900475504,
      "step": 24023
    },
    {
      "epoch": 2.5486950986632717,
      "grad_norm": 0.5631554047842812,
      "learning_rate": 4.467246355597794e-05,
      "loss": 1.6753,
      "num_input_tokens_seen": 18901262224,
      "step": 24024
    },
    {
      "epoch": 2.548801188202843,
      "grad_norm": 0.4533352366157397,
      "learning_rate": 4.467203469535152e-05,
      "loss": 1.5486,
      "num_input_tokens_seen": 18902048960,
      "step": 24025
    },
    {
      "epoch": 2.5489072777424147,
      "grad_norm": 1.2012812859103903,
      "learning_rate": 4.4671605819523135e-05,
      "loss": 1.5766,
      "num_input_tokens_seen": 18902835760,
      "step": 24026
    },
    {
      "epoch": 2.549013367281986,
      "grad_norm": 0.4897646081857231,
      "learning_rate": 4.467117692849311e-05,
      "loss": 1.6587,
      "num_input_tokens_seen": 18903622528,
      "step": 24027
    },
    {
      "epoch": 2.5491194568215576,
      "grad_norm": 1.2596277656149508,
      "learning_rate": 4.467074802226178e-05,
      "loss": 1.5994,
      "num_input_tokens_seen": 18904409232,
      "step": 24028
    },
    {
      "epoch": 2.5492255463611286,
      "grad_norm": 0.42616481077829427,
      "learning_rate": 4.4670319100829464e-05,
      "loss": 1.5446,
      "num_input_tokens_seen": 18905195968,
      "step": 24029
    },
    {
      "epoch": 2.5493316359007,
      "grad_norm": 0.7079336177841338,
      "learning_rate": 4.4669890164196514e-05,
      "loss": 1.6158,
      "num_input_tokens_seen": 18905982736,
      "step": 24030
    },
    {
      "epoch": 2.5494377254402716,
      "grad_norm": 0.5518628097357919,
      "learning_rate": 4.466946121236324e-05,
      "loss": 1.6334,
      "num_input_tokens_seen": 18906769472,
      "step": 24031
    },
    {
      "epoch": 2.549543814979843,
      "grad_norm": 0.45530653103823693,
      "learning_rate": 4.466903224532999e-05,
      "loss": 1.6155,
      "num_input_tokens_seen": 18907556224,
      "step": 24032
    },
    {
      "epoch": 2.5496499045194145,
      "grad_norm": 0.4349809233830983,
      "learning_rate": 4.466860326309709e-05,
      "loss": 1.5572,
      "num_input_tokens_seen": 18908342976,
      "step": 24033
    },
    {
      "epoch": 2.5497559940589856,
      "grad_norm": 0.542382409446257,
      "learning_rate": 4.4668174265664866e-05,
      "loss": 1.5259,
      "num_input_tokens_seen": 18909129824,
      "step": 24034
    },
    {
      "epoch": 2.549862083598557,
      "grad_norm": 0.8543175353133876,
      "learning_rate": 4.466774525303365e-05,
      "loss": 1.7756,
      "num_input_tokens_seen": 18909916656,
      "step": 24035
    },
    {
      "epoch": 2.5499681731381285,
      "grad_norm": 0.8844666621726534,
      "learning_rate": 4.466731622520378e-05,
      "loss": 1.645,
      "num_input_tokens_seen": 18910703456,
      "step": 24036
    },
    {
      "epoch": 2.5500742626777,
      "grad_norm": 0.8022789505176758,
      "learning_rate": 4.466688718217559e-05,
      "loss": 1.6757,
      "num_input_tokens_seen": 18911490128,
      "step": 24037
    },
    {
      "epoch": 2.5501803522172715,
      "grad_norm": 0.5590522986320644,
      "learning_rate": 4.466645812394941e-05,
      "loss": 1.6751,
      "num_input_tokens_seen": 18912276912,
      "step": 24038
    },
    {
      "epoch": 2.550286441756843,
      "grad_norm": 0.633845237499671,
      "learning_rate": 4.466602905052556e-05,
      "loss": 1.4908,
      "num_input_tokens_seen": 18913063664,
      "step": 24039
    },
    {
      "epoch": 2.5503925312964144,
      "grad_norm": 0.506827345592699,
      "learning_rate": 4.466559996190438e-05,
      "loss": 1.6156,
      "num_input_tokens_seen": 18913850384,
      "step": 24040
    },
    {
      "epoch": 2.5504986208359854,
      "grad_norm": 0.5179752045572131,
      "learning_rate": 4.4665170858086204e-05,
      "loss": 1.5952,
      "num_input_tokens_seen": 18914637168,
      "step": 24041
    },
    {
      "epoch": 2.550604710375557,
      "grad_norm": 0.5246584383461528,
      "learning_rate": 4.466474173907136e-05,
      "loss": 1.5953,
      "num_input_tokens_seen": 18915423920,
      "step": 24042
    },
    {
      "epoch": 2.5507107999151284,
      "grad_norm": 0.44390935524573166,
      "learning_rate": 4.466431260486018e-05,
      "loss": 1.671,
      "num_input_tokens_seen": 18916210704,
      "step": 24043
    },
    {
      "epoch": 2.5508168894547,
      "grad_norm": 0.5745163250143468,
      "learning_rate": 4.4663883455453e-05,
      "loss": 1.6109,
      "num_input_tokens_seen": 18916997536,
      "step": 24044
    },
    {
      "epoch": 2.5509229789942713,
      "grad_norm": 0.5124549391497971,
      "learning_rate": 4.4663454290850146e-05,
      "loss": 1.6617,
      "num_input_tokens_seen": 18917784272,
      "step": 24045
    },
    {
      "epoch": 2.5510290685338424,
      "grad_norm": 0.42992489873159967,
      "learning_rate": 4.4663025111051946e-05,
      "loss": 1.6749,
      "num_input_tokens_seen": 18918570928,
      "step": 24046
    },
    {
      "epoch": 2.551135158073414,
      "grad_norm": 0.42294477014573933,
      "learning_rate": 4.466259591605875e-05,
      "loss": 1.6153,
      "num_input_tokens_seen": 18919357696,
      "step": 24047
    },
    {
      "epoch": 2.5512412476129853,
      "grad_norm": 0.47357566408146407,
      "learning_rate": 4.466216670587087e-05,
      "loss": 1.5526,
      "num_input_tokens_seen": 18920144464,
      "step": 24048
    },
    {
      "epoch": 2.551347337152557,
      "grad_norm": 0.4753982746130194,
      "learning_rate": 4.466173748048864e-05,
      "loss": 1.5073,
      "num_input_tokens_seen": 18920931296,
      "step": 24049
    },
    {
      "epoch": 2.5514534266921283,
      "grad_norm": 0.4552519425271765,
      "learning_rate": 4.46613082399124e-05,
      "loss": 1.4727,
      "num_input_tokens_seen": 18921718128,
      "step": 24050
    },
    {
      "epoch": 2.5515595162316993,
      "grad_norm": 0.5724909215318468,
      "learning_rate": 4.466087898414247e-05,
      "loss": 1.7915,
      "num_input_tokens_seen": 18922504912,
      "step": 24051
    },
    {
      "epoch": 2.551665605771271,
      "grad_norm": 0.4054963391334507,
      "learning_rate": 4.46604497131792e-05,
      "loss": 1.6492,
      "num_input_tokens_seen": 18923291632,
      "step": 24052
    },
    {
      "epoch": 2.5517716953108422,
      "grad_norm": 0.5780708810682071,
      "learning_rate": 4.466002042702291e-05,
      "loss": 1.7066,
      "num_input_tokens_seen": 18924078400,
      "step": 24053
    },
    {
      "epoch": 2.5518777848504137,
      "grad_norm": 0.3868922966184787,
      "learning_rate": 4.465959112567393e-05,
      "loss": 1.5394,
      "num_input_tokens_seen": 18924865200,
      "step": 24054
    },
    {
      "epoch": 2.551983874389985,
      "grad_norm": 0.46545651111716574,
      "learning_rate": 4.46591618091326e-05,
      "loss": 1.6434,
      "num_input_tokens_seen": 18925651904,
      "step": 24055
    },
    {
      "epoch": 2.5520899639295567,
      "grad_norm": 0.438982487413306,
      "learning_rate": 4.465873247739925e-05,
      "loss": 1.648,
      "num_input_tokens_seen": 18926438784,
      "step": 24056
    },
    {
      "epoch": 2.552196053469128,
      "grad_norm": 0.4234771701153847,
      "learning_rate": 4.465830313047419e-05,
      "loss": 1.68,
      "num_input_tokens_seen": 18927225536,
      "step": 24057
    },
    {
      "epoch": 2.552302143008699,
      "grad_norm": 0.43154165381798704,
      "learning_rate": 4.465787376835778e-05,
      "loss": 1.6338,
      "num_input_tokens_seen": 18928012288,
      "step": 24058
    },
    {
      "epoch": 2.5524082325482707,
      "grad_norm": 0.4305050781198404,
      "learning_rate": 4.465744439105035e-05,
      "loss": 1.596,
      "num_input_tokens_seen": 18928799008,
      "step": 24059
    },
    {
      "epoch": 2.552514322087842,
      "grad_norm": 0.35770824752790326,
      "learning_rate": 4.4657014998552215e-05,
      "loss": 1.4888,
      "num_input_tokens_seen": 18929585808,
      "step": 24060
    },
    {
      "epoch": 2.5526204116274136,
      "grad_norm": 0.39246053635413153,
      "learning_rate": 4.465658559086372e-05,
      "loss": 1.6859,
      "num_input_tokens_seen": 18930372576,
      "step": 24061
    },
    {
      "epoch": 2.552726501166985,
      "grad_norm": 0.366377009942286,
      "learning_rate": 4.465615616798519e-05,
      "loss": 1.5616,
      "num_input_tokens_seen": 18931159264,
      "step": 24062
    },
    {
      "epoch": 2.552832590706556,
      "grad_norm": 0.5547886035732296,
      "learning_rate": 4.465572672991696e-05,
      "loss": 1.6687,
      "num_input_tokens_seen": 18931946064,
      "step": 24063
    },
    {
      "epoch": 2.5529386802461276,
      "grad_norm": 0.3731761141029071,
      "learning_rate": 4.4655297276659356e-05,
      "loss": 1.4224,
      "num_input_tokens_seen": 18932732912,
      "step": 24064
    },
    {
      "epoch": 2.553044769785699,
      "grad_norm": 0.5412875913155534,
      "learning_rate": 4.465486780821272e-05,
      "loss": 1.6208,
      "num_input_tokens_seen": 18933519728,
      "step": 24065
    },
    {
      "epoch": 2.5531508593252705,
      "grad_norm": 0.4205875046777442,
      "learning_rate": 4.465443832457738e-05,
      "loss": 1.5703,
      "num_input_tokens_seen": 18934306464,
      "step": 24066
    },
    {
      "epoch": 2.553256948864842,
      "grad_norm": 0.5933258399396125,
      "learning_rate": 4.465400882575367e-05,
      "loss": 1.5601,
      "num_input_tokens_seen": 18935093184,
      "step": 24067
    },
    {
      "epoch": 2.5533630384044135,
      "grad_norm": 0.4817997806047136,
      "learning_rate": 4.465357931174191e-05,
      "loss": 1.6249,
      "num_input_tokens_seen": 18935879920,
      "step": 24068
    },
    {
      "epoch": 2.553469127943985,
      "grad_norm": 0.4477751477867668,
      "learning_rate": 4.465314978254244e-05,
      "loss": 1.6008,
      "num_input_tokens_seen": 18936666672,
      "step": 24069
    },
    {
      "epoch": 2.553575217483556,
      "grad_norm": 0.6054386800387328,
      "learning_rate": 4.46527202381556e-05,
      "loss": 1.6294,
      "num_input_tokens_seen": 18937453504,
      "step": 24070
    },
    {
      "epoch": 2.5536813070231275,
      "grad_norm": 0.4544809268941393,
      "learning_rate": 4.465229067858171e-05,
      "loss": 1.5505,
      "num_input_tokens_seen": 18938240256,
      "step": 24071
    },
    {
      "epoch": 2.553787396562699,
      "grad_norm": 0.5860288127366521,
      "learning_rate": 4.4651861103821105e-05,
      "loss": 1.6564,
      "num_input_tokens_seen": 18939027152,
      "step": 24072
    },
    {
      "epoch": 2.5538934861022704,
      "grad_norm": 0.4526240799936695,
      "learning_rate": 4.465143151387413e-05,
      "loss": 1.5148,
      "num_input_tokens_seen": 18939813968,
      "step": 24073
    },
    {
      "epoch": 2.553999575641842,
      "grad_norm": 0.4812549985656144,
      "learning_rate": 4.465100190874109e-05,
      "loss": 1.611,
      "num_input_tokens_seen": 18940600752,
      "step": 24074
    },
    {
      "epoch": 2.554105665181413,
      "grad_norm": 0.4485846255731085,
      "learning_rate": 4.465057228842234e-05,
      "loss": 1.4942,
      "num_input_tokens_seen": 18941387488,
      "step": 24075
    },
    {
      "epoch": 2.5542117547209844,
      "grad_norm": 0.48198754176665315,
      "learning_rate": 4.4650142652918206e-05,
      "loss": 1.6128,
      "num_input_tokens_seen": 18942174304,
      "step": 24076
    },
    {
      "epoch": 2.554317844260556,
      "grad_norm": 0.4984790539425003,
      "learning_rate": 4.464971300222901e-05,
      "loss": 1.4916,
      "num_input_tokens_seen": 18942961056,
      "step": 24077
    },
    {
      "epoch": 2.5544239338001273,
      "grad_norm": 0.43034195372932843,
      "learning_rate": 4.4649283336355096e-05,
      "loss": 1.6871,
      "num_input_tokens_seen": 18943747712,
      "step": 24078
    },
    {
      "epoch": 2.554530023339699,
      "grad_norm": 0.4277823694394237,
      "learning_rate": 4.46488536552968e-05,
      "loss": 1.6789,
      "num_input_tokens_seen": 18944534496,
      "step": 24079
    },
    {
      "epoch": 2.55463611287927,
      "grad_norm": 0.4981407597076641,
      "learning_rate": 4.4648423959054444e-05,
      "loss": 1.6075,
      "num_input_tokens_seen": 18945321264,
      "step": 24080
    },
    {
      "epoch": 2.5547422024188418,
      "grad_norm": 0.38365818424902964,
      "learning_rate": 4.4647994247628355e-05,
      "loss": 1.514,
      "num_input_tokens_seen": 18946108064,
      "step": 24081
    },
    {
      "epoch": 2.554848291958413,
      "grad_norm": 0.5050191953953619,
      "learning_rate": 4.4647564521018874e-05,
      "loss": 1.6238,
      "num_input_tokens_seen": 18946894896,
      "step": 24082
    },
    {
      "epoch": 2.5549543814979843,
      "grad_norm": 0.3691167981976872,
      "learning_rate": 4.4647134779226335e-05,
      "loss": 1.5,
      "num_input_tokens_seen": 18947681664,
      "step": 24083
    },
    {
      "epoch": 2.5550604710375557,
      "grad_norm": 0.434303812461103,
      "learning_rate": 4.464670502225107e-05,
      "loss": 1.493,
      "num_input_tokens_seen": 18948468448,
      "step": 24084
    },
    {
      "epoch": 2.555166560577127,
      "grad_norm": 0.4312167293193168,
      "learning_rate": 4.46462752500934e-05,
      "loss": 1.511,
      "num_input_tokens_seen": 18949255280,
      "step": 24085
    },
    {
      "epoch": 2.5552726501166987,
      "grad_norm": 0.4369942594442657,
      "learning_rate": 4.4645845462753664e-05,
      "loss": 1.4779,
      "num_input_tokens_seen": 18950042032,
      "step": 24086
    },
    {
      "epoch": 2.5553787396562697,
      "grad_norm": 0.5028954801066609,
      "learning_rate": 4.46454156602322e-05,
      "loss": 1.7642,
      "num_input_tokens_seen": 18950828752,
      "step": 24087
    },
    {
      "epoch": 2.555484829195841,
      "grad_norm": 0.38120614655982366,
      "learning_rate": 4.4644985842529343e-05,
      "loss": 1.6919,
      "num_input_tokens_seen": 18951615552,
      "step": 24088
    },
    {
      "epoch": 2.5555909187354127,
      "grad_norm": 0.5450123976250802,
      "learning_rate": 4.46445560096454e-05,
      "loss": 1.5338,
      "num_input_tokens_seen": 18952402352,
      "step": 24089
    },
    {
      "epoch": 2.555697008274984,
      "grad_norm": 0.33533149573217297,
      "learning_rate": 4.4644126161580736e-05,
      "loss": 1.5485,
      "num_input_tokens_seen": 18953189104,
      "step": 24090
    },
    {
      "epoch": 2.5558030978145556,
      "grad_norm": 0.43393899882046716,
      "learning_rate": 4.464369629833566e-05,
      "loss": 1.6723,
      "num_input_tokens_seen": 18953975792,
      "step": 24091
    },
    {
      "epoch": 2.5559091873541266,
      "grad_norm": 0.4100219370448012,
      "learning_rate": 4.464326641991051e-05,
      "loss": 1.5508,
      "num_input_tokens_seen": 18954762576,
      "step": 24092
    },
    {
      "epoch": 2.556015276893698,
      "grad_norm": 0.41217324709623443,
      "learning_rate": 4.464283652630563e-05,
      "loss": 1.6871,
      "num_input_tokens_seen": 18955549216,
      "step": 24093
    },
    {
      "epoch": 2.5561213664332696,
      "grad_norm": 0.37293113286105195,
      "learning_rate": 4.4642406617521335e-05,
      "loss": 1.5197,
      "num_input_tokens_seen": 18956336000,
      "step": 24094
    },
    {
      "epoch": 2.556227455972841,
      "grad_norm": 0.41724167184658073,
      "learning_rate": 4.464197669355796e-05,
      "loss": 1.5611,
      "num_input_tokens_seen": 18957122704,
      "step": 24095
    },
    {
      "epoch": 2.5563335455124125,
      "grad_norm": 0.39813253781595437,
      "learning_rate": 4.464154675441585e-05,
      "loss": 1.5905,
      "num_input_tokens_seen": 18957909488,
      "step": 24096
    },
    {
      "epoch": 2.556439635051984,
      "grad_norm": 0.4036340977493145,
      "learning_rate": 4.464111680009533e-05,
      "loss": 1.6072,
      "num_input_tokens_seen": 18958696272,
      "step": 24097
    },
    {
      "epoch": 2.5565457245915555,
      "grad_norm": 0.4024995812341868,
      "learning_rate": 4.464068683059672e-05,
      "loss": 1.5583,
      "num_input_tokens_seen": 18959483040,
      "step": 24098
    },
    {
      "epoch": 2.5566518141311265,
      "grad_norm": 0.37356997856932417,
      "learning_rate": 4.464025684592037e-05,
      "loss": 1.5319,
      "num_input_tokens_seen": 18960269888,
      "step": 24099
    },
    {
      "epoch": 2.556757903670698,
      "grad_norm": 0.389893097583116,
      "learning_rate": 4.4639826846066615e-05,
      "loss": 1.5726,
      "num_input_tokens_seen": 18961056752,
      "step": 24100
    },
    {
      "epoch": 2.5568639932102695,
      "grad_norm": 0.5392519369100661,
      "learning_rate": 4.463939683103576e-05,
      "loss": 1.5212,
      "num_input_tokens_seen": 18961843472,
      "step": 24101
    },
    {
      "epoch": 2.556970082749841,
      "grad_norm": 0.39884226776999304,
      "learning_rate": 4.463896680082817e-05,
      "loss": 1.5926,
      "num_input_tokens_seen": 18962630256,
      "step": 24102
    },
    {
      "epoch": 2.5570761722894124,
      "grad_norm": 0.5541975226019403,
      "learning_rate": 4.463853675544416e-05,
      "loss": 1.5985,
      "num_input_tokens_seen": 18963417024,
      "step": 24103
    },
    {
      "epoch": 2.5571822618289834,
      "grad_norm": 0.3773281569894996,
      "learning_rate": 4.463810669488406e-05,
      "loss": 1.7204,
      "num_input_tokens_seen": 18964203824,
      "step": 24104
    },
    {
      "epoch": 2.557288351368555,
      "grad_norm": 0.5002678315696479,
      "learning_rate": 4.463767661914821e-05,
      "loss": 1.6666,
      "num_input_tokens_seen": 18964990576,
      "step": 24105
    },
    {
      "epoch": 2.5573944409081264,
      "grad_norm": 0.5011557975166293,
      "learning_rate": 4.4637246528236945e-05,
      "loss": 1.7262,
      "num_input_tokens_seen": 18965777344,
      "step": 24106
    },
    {
      "epoch": 2.557500530447698,
      "grad_norm": 0.45079305154819177,
      "learning_rate": 4.4636816422150585e-05,
      "loss": 1.4731,
      "num_input_tokens_seen": 18966564096,
      "step": 24107
    },
    {
      "epoch": 2.5576066199872693,
      "grad_norm": 0.5149795582251853,
      "learning_rate": 4.463638630088947e-05,
      "loss": 1.523,
      "num_input_tokens_seen": 18967350928,
      "step": 24108
    },
    {
      "epoch": 2.5577127095268404,
      "grad_norm": 0.3535974633481628,
      "learning_rate": 4.463595616445393e-05,
      "loss": 1.6272,
      "num_input_tokens_seen": 18968137616,
      "step": 24109
    },
    {
      "epoch": 2.5578187990664123,
      "grad_norm": 0.4630373120865893,
      "learning_rate": 4.46355260128443e-05,
      "loss": 1.6962,
      "num_input_tokens_seen": 18968924304,
      "step": 24110
    },
    {
      "epoch": 2.5579248886059833,
      "grad_norm": 0.4540470478060281,
      "learning_rate": 4.4635095846060915e-05,
      "loss": 1.599,
      "num_input_tokens_seen": 18969710992,
      "step": 24111
    },
    {
      "epoch": 2.558030978145555,
      "grad_norm": 0.38799010485779345,
      "learning_rate": 4.4634665664104106e-05,
      "loss": 1.6517,
      "num_input_tokens_seen": 18970497696,
      "step": 24112
    },
    {
      "epoch": 2.5581370676851263,
      "grad_norm": 0.4110371288136971,
      "learning_rate": 4.46342354669742e-05,
      "loss": 1.7275,
      "num_input_tokens_seen": 18971284432,
      "step": 24113
    },
    {
      "epoch": 2.5582431572246978,
      "grad_norm": 0.5099749645412174,
      "learning_rate": 4.4633805254671535e-05,
      "loss": 1.6258,
      "num_input_tokens_seen": 18972071264,
      "step": 24114
    },
    {
      "epoch": 2.5583492467642692,
      "grad_norm": 0.443760025600912,
      "learning_rate": 4.4633375027196436e-05,
      "loss": 1.6819,
      "num_input_tokens_seen": 18972858016,
      "step": 24115
    },
    {
      "epoch": 2.5584553363038403,
      "grad_norm": 0.4849434033463796,
      "learning_rate": 4.463294478454925e-05,
      "loss": 1.5917,
      "num_input_tokens_seen": 18973644752,
      "step": 24116
    },
    {
      "epoch": 2.5585614258434117,
      "grad_norm": 0.4445265337534721,
      "learning_rate": 4.463251452673029e-05,
      "loss": 1.6517,
      "num_input_tokens_seen": 18974431408,
      "step": 24117
    },
    {
      "epoch": 2.558667515382983,
      "grad_norm": 0.4213467047077219,
      "learning_rate": 4.4632084253739906e-05,
      "loss": 1.6954,
      "num_input_tokens_seen": 18975218144,
      "step": 24118
    },
    {
      "epoch": 2.5587736049225547,
      "grad_norm": 0.3934001853165221,
      "learning_rate": 4.463165396557843e-05,
      "loss": 1.5551,
      "num_input_tokens_seen": 18976004928,
      "step": 24119
    },
    {
      "epoch": 2.558879694462126,
      "grad_norm": 0.48562872470756296,
      "learning_rate": 4.463122366224617e-05,
      "loss": 1.5113,
      "num_input_tokens_seen": 18976791760,
      "step": 24120
    },
    {
      "epoch": 2.558985784001697,
      "grad_norm": 0.359440674243515,
      "learning_rate": 4.463079334374348e-05,
      "loss": 1.558,
      "num_input_tokens_seen": 18977578544,
      "step": 24121
    },
    {
      "epoch": 2.559091873541269,
      "grad_norm": 0.37610926359451935,
      "learning_rate": 4.46303630100707e-05,
      "loss": 1.5691,
      "num_input_tokens_seen": 18978365328,
      "step": 24122
    },
    {
      "epoch": 2.55919796308084,
      "grad_norm": 0.46413830624653574,
      "learning_rate": 4.4629932661228144e-05,
      "loss": 1.6073,
      "num_input_tokens_seen": 18979152096,
      "step": 24123
    },
    {
      "epoch": 2.5593040526204116,
      "grad_norm": 0.39658728632102574,
      "learning_rate": 4.462950229721615e-05,
      "loss": 1.5717,
      "num_input_tokens_seen": 18979938864,
      "step": 24124
    },
    {
      "epoch": 2.559410142159983,
      "grad_norm": 0.34383913196738947,
      "learning_rate": 4.462907191803506e-05,
      "loss": 1.4993,
      "num_input_tokens_seen": 18980725760,
      "step": 24125
    },
    {
      "epoch": 2.5595162316995546,
      "grad_norm": 0.41216927787917995,
      "learning_rate": 4.46286415236852e-05,
      "loss": 1.5576,
      "num_input_tokens_seen": 18981512512,
      "step": 24126
    },
    {
      "epoch": 2.559622321239126,
      "grad_norm": 0.354617121627055,
      "learning_rate": 4.462821111416689e-05,
      "loss": 1.5355,
      "num_input_tokens_seen": 18982299296,
      "step": 24127
    },
    {
      "epoch": 2.559728410778697,
      "grad_norm": 0.3679371460120264,
      "learning_rate": 4.462778068948049e-05,
      "loss": 1.5245,
      "num_input_tokens_seen": 18983086128,
      "step": 24128
    },
    {
      "epoch": 2.5598345003182685,
      "grad_norm": 0.410028911100147,
      "learning_rate": 4.4627350249626304e-05,
      "loss": 1.6871,
      "num_input_tokens_seen": 18983872832,
      "step": 24129
    },
    {
      "epoch": 2.55994058985784,
      "grad_norm": 0.37063737751320647,
      "learning_rate": 4.462691979460468e-05,
      "loss": 1.604,
      "num_input_tokens_seen": 18984659584,
      "step": 24130
    },
    {
      "epoch": 2.5600466793974115,
      "grad_norm": 0.44774732133586675,
      "learning_rate": 4.462648932441596e-05,
      "loss": 1.5743,
      "num_input_tokens_seen": 18985446336,
      "step": 24131
    },
    {
      "epoch": 2.560152768936983,
      "grad_norm": 0.3651519478154585,
      "learning_rate": 4.4626058839060444e-05,
      "loss": 1.6112,
      "num_input_tokens_seen": 18986233120,
      "step": 24132
    },
    {
      "epoch": 2.560258858476554,
      "grad_norm": 0.4460259087749006,
      "learning_rate": 4.462562833853851e-05,
      "loss": 1.5693,
      "num_input_tokens_seen": 18987019968,
      "step": 24133
    },
    {
      "epoch": 2.5603649480161255,
      "grad_norm": 0.4225073167219111,
      "learning_rate": 4.462519782285045e-05,
      "loss": 1.6807,
      "num_input_tokens_seen": 18987806672,
      "step": 24134
    },
    {
      "epoch": 2.560471037555697,
      "grad_norm": 0.4156522616989533,
      "learning_rate": 4.4624767291996614e-05,
      "loss": 1.5114,
      "num_input_tokens_seen": 18988593424,
      "step": 24135
    },
    {
      "epoch": 2.5605771270952684,
      "grad_norm": 0.4419843805141773,
      "learning_rate": 4.462433674597733e-05,
      "loss": 1.6752,
      "num_input_tokens_seen": 18989380208,
      "step": 24136
    },
    {
      "epoch": 2.56068321663484,
      "grad_norm": 0.4992206685342612,
      "learning_rate": 4.462390618479294e-05,
      "loss": 1.6415,
      "num_input_tokens_seen": 18990166992,
      "step": 24137
    },
    {
      "epoch": 2.5607893061744114,
      "grad_norm": 0.4167227677790253,
      "learning_rate": 4.462347560844378e-05,
      "loss": 1.5991,
      "num_input_tokens_seen": 18990953872,
      "step": 24138
    },
    {
      "epoch": 2.560895395713983,
      "grad_norm": 0.5445757578467688,
      "learning_rate": 4.462304501693016e-05,
      "loss": 1.6303,
      "num_input_tokens_seen": 18991740624,
      "step": 24139
    },
    {
      "epoch": 2.561001485253554,
      "grad_norm": 0.4226330174435572,
      "learning_rate": 4.462261441025243e-05,
      "loss": 1.694,
      "num_input_tokens_seen": 18992527312,
      "step": 24140
    },
    {
      "epoch": 2.5611075747931253,
      "grad_norm": 0.3975994424975425,
      "learning_rate": 4.462218378841092e-05,
      "loss": 1.5612,
      "num_input_tokens_seen": 18993314112,
      "step": 24141
    },
    {
      "epoch": 2.561213664332697,
      "grad_norm": 0.4345990998547865,
      "learning_rate": 4.4621753151405965e-05,
      "loss": 1.6115,
      "num_input_tokens_seen": 18994100896,
      "step": 24142
    },
    {
      "epoch": 2.5613197538722683,
      "grad_norm": 0.5009876899191864,
      "learning_rate": 4.462132249923789e-05,
      "loss": 1.6166,
      "num_input_tokens_seen": 18994887600,
      "step": 24143
    },
    {
      "epoch": 2.5614258434118398,
      "grad_norm": 0.4139283934319723,
      "learning_rate": 4.462089183190704e-05,
      "loss": 1.6526,
      "num_input_tokens_seen": 18995674336,
      "step": 24144
    },
    {
      "epoch": 2.561531932951411,
      "grad_norm": 0.49517113255660283,
      "learning_rate": 4.4620461149413736e-05,
      "loss": 1.5997,
      "num_input_tokens_seen": 18996461008,
      "step": 24145
    },
    {
      "epoch": 2.5616380224909823,
      "grad_norm": 0.47109429632705124,
      "learning_rate": 4.462003045175832e-05,
      "loss": 1.7533,
      "num_input_tokens_seen": 18997247776,
      "step": 24146
    },
    {
      "epoch": 2.5617441120305537,
      "grad_norm": 0.4421791444580982,
      "learning_rate": 4.4619599738941114e-05,
      "loss": 1.616,
      "num_input_tokens_seen": 18998034592,
      "step": 24147
    },
    {
      "epoch": 2.561850201570125,
      "grad_norm": 0.4043039639406501,
      "learning_rate": 4.461916901096246e-05,
      "loss": 1.5723,
      "num_input_tokens_seen": 18998821344,
      "step": 24148
    },
    {
      "epoch": 2.5619562911096967,
      "grad_norm": 0.4847336305514194,
      "learning_rate": 4.461873826782269e-05,
      "loss": 1.6746,
      "num_input_tokens_seen": 18999608064,
      "step": 24149
    },
    {
      "epoch": 2.5620623806492677,
      "grad_norm": 0.4340155831563543,
      "learning_rate": 4.461830750952213e-05,
      "loss": 1.4942,
      "num_input_tokens_seen": 19000394848,
      "step": 24150
    },
    {
      "epoch": 2.5621684701888396,
      "grad_norm": 0.46424172669594305,
      "learning_rate": 4.4617876736061114e-05,
      "loss": 1.7067,
      "num_input_tokens_seen": 19001181664,
      "step": 24151
    },
    {
      "epoch": 2.5622745597284107,
      "grad_norm": 0.3991591511255749,
      "learning_rate": 4.461744594743998e-05,
      "loss": 1.5249,
      "num_input_tokens_seen": 19001968448,
      "step": 24152
    },
    {
      "epoch": 2.562380649267982,
      "grad_norm": 0.38418044054513184,
      "learning_rate": 4.461701514365907e-05,
      "loss": 1.5818,
      "num_input_tokens_seen": 19002755200,
      "step": 24153
    },
    {
      "epoch": 2.5624867388075536,
      "grad_norm": 0.4342425395019615,
      "learning_rate": 4.4616584324718705e-05,
      "loss": 1.6187,
      "num_input_tokens_seen": 19003541904,
      "step": 24154
    },
    {
      "epoch": 2.562592828347125,
      "grad_norm": 0.4717649239953097,
      "learning_rate": 4.46161534906192e-05,
      "loss": 1.6116,
      "num_input_tokens_seen": 19004328656,
      "step": 24155
    },
    {
      "epoch": 2.5626989178866966,
      "grad_norm": 0.4150907588091684,
      "learning_rate": 4.461572264136093e-05,
      "loss": 1.5531,
      "num_input_tokens_seen": 19005115408,
      "step": 24156
    },
    {
      "epoch": 2.5628050074262676,
      "grad_norm": 0.5290133576001439,
      "learning_rate": 4.461529177694419e-05,
      "loss": 1.7048,
      "num_input_tokens_seen": 19005902192,
      "step": 24157
    },
    {
      "epoch": 2.562911096965839,
      "grad_norm": 0.34460052309713496,
      "learning_rate": 4.461486089736934e-05,
      "loss": 1.5195,
      "num_input_tokens_seen": 19006688928,
      "step": 24158
    },
    {
      "epoch": 2.5630171865054105,
      "grad_norm": 0.48219740889575224,
      "learning_rate": 4.461443000263669e-05,
      "loss": 1.5707,
      "num_input_tokens_seen": 19007475728,
      "step": 24159
    },
    {
      "epoch": 2.563123276044982,
      "grad_norm": 0.4601729651462412,
      "learning_rate": 4.461399909274659e-05,
      "loss": 1.6109,
      "num_input_tokens_seen": 19008262464,
      "step": 24160
    },
    {
      "epoch": 2.5632293655845535,
      "grad_norm": 0.4215860041692294,
      "learning_rate": 4.4613568167699366e-05,
      "loss": 1.7439,
      "num_input_tokens_seen": 19009049136,
      "step": 24161
    },
    {
      "epoch": 2.5633354551241245,
      "grad_norm": 0.5354865893078301,
      "learning_rate": 4.461313722749535e-05,
      "loss": 1.5852,
      "num_input_tokens_seen": 19009836064,
      "step": 24162
    },
    {
      "epoch": 2.563441544663696,
      "grad_norm": 0.3351747347140817,
      "learning_rate": 4.4612706272134885e-05,
      "loss": 1.4957,
      "num_input_tokens_seen": 19010622832,
      "step": 24163
    },
    {
      "epoch": 2.5635476342032675,
      "grad_norm": 0.5572640359312465,
      "learning_rate": 4.4612275301618286e-05,
      "loss": 1.6206,
      "num_input_tokens_seen": 19011409568,
      "step": 24164
    },
    {
      "epoch": 2.563653723742839,
      "grad_norm": 0.41652046458082215,
      "learning_rate": 4.46118443159459e-05,
      "loss": 1.711,
      "num_input_tokens_seen": 19012196368,
      "step": 24165
    },
    {
      "epoch": 2.5637598132824104,
      "grad_norm": 0.4899225254412885,
      "learning_rate": 4.4611413315118056e-05,
      "loss": 1.5795,
      "num_input_tokens_seen": 19012983136,
      "step": 24166
    },
    {
      "epoch": 2.563865902821982,
      "grad_norm": 0.6294947578093248,
      "learning_rate": 4.461098229913509e-05,
      "loss": 1.5302,
      "num_input_tokens_seen": 19013769872,
      "step": 24167
    },
    {
      "epoch": 2.5639719923615534,
      "grad_norm": 0.611659018399555,
      "learning_rate": 4.4610551267997323e-05,
      "loss": 1.6264,
      "num_input_tokens_seen": 19014556656,
      "step": 24168
    },
    {
      "epoch": 2.5640780819011244,
      "grad_norm": 0.5893778662137363,
      "learning_rate": 4.461012022170511e-05,
      "loss": 1.5487,
      "num_input_tokens_seen": 19015343328,
      "step": 24169
    },
    {
      "epoch": 2.564184171440696,
      "grad_norm": 0.5696001676822672,
      "learning_rate": 4.4609689160258766e-05,
      "loss": 1.486,
      "num_input_tokens_seen": 19016130144,
      "step": 24170
    },
    {
      "epoch": 2.5642902609802674,
      "grad_norm": 0.47374543000102237,
      "learning_rate": 4.460925808365863e-05,
      "loss": 1.4948,
      "num_input_tokens_seen": 19016916864,
      "step": 24171
    },
    {
      "epoch": 2.564396350519839,
      "grad_norm": 0.4010028508693077,
      "learning_rate": 4.460882699190503e-05,
      "loss": 1.6587,
      "num_input_tokens_seen": 19017703648,
      "step": 24172
    },
    {
      "epoch": 2.5645024400594103,
      "grad_norm": 0.5206952855641407,
      "learning_rate": 4.460839588499831e-05,
      "loss": 1.691,
      "num_input_tokens_seen": 19018490512,
      "step": 24173
    },
    {
      "epoch": 2.5646085295989813,
      "grad_norm": 0.5717904191621144,
      "learning_rate": 4.460796476293879e-05,
      "loss": 1.7161,
      "num_input_tokens_seen": 19019277168,
      "step": 24174
    },
    {
      "epoch": 2.564714619138553,
      "grad_norm": 0.4081945080858508,
      "learning_rate": 4.460753362572682e-05,
      "loss": 1.6303,
      "num_input_tokens_seen": 19020063936,
      "step": 24175
    },
    {
      "epoch": 2.5648207086781243,
      "grad_norm": 0.5037627990931445,
      "learning_rate": 4.460710247336272e-05,
      "loss": 1.5792,
      "num_input_tokens_seen": 19020850720,
      "step": 24176
    },
    {
      "epoch": 2.5649267982176958,
      "grad_norm": 0.40451936343071865,
      "learning_rate": 4.460667130584683e-05,
      "loss": 1.5716,
      "num_input_tokens_seen": 19021637600,
      "step": 24177
    },
    {
      "epoch": 2.5650328877572672,
      "grad_norm": 0.5257669657518954,
      "learning_rate": 4.4606240123179464e-05,
      "loss": 1.5458,
      "num_input_tokens_seen": 19022424352,
      "step": 24178
    },
    {
      "epoch": 2.5651389772968383,
      "grad_norm": 0.4146441117604557,
      "learning_rate": 4.460580892536098e-05,
      "loss": 1.6571,
      "num_input_tokens_seen": 19023211104,
      "step": 24179
    },
    {
      "epoch": 2.56524506683641,
      "grad_norm": 0.40563080547167757,
      "learning_rate": 4.460537771239171e-05,
      "loss": 1.5567,
      "num_input_tokens_seen": 19023997792,
      "step": 24180
    },
    {
      "epoch": 2.565351156375981,
      "grad_norm": 0.43463154162695156,
      "learning_rate": 4.460494648427197e-05,
      "loss": 1.4445,
      "num_input_tokens_seen": 19024784592,
      "step": 24181
    },
    {
      "epoch": 2.5654572459155527,
      "grad_norm": 0.38283463253586125,
      "learning_rate": 4.460451524100211e-05,
      "loss": 1.6057,
      "num_input_tokens_seen": 19025571328,
      "step": 24182
    },
    {
      "epoch": 2.565563335455124,
      "grad_norm": 0.5089627394591542,
      "learning_rate": 4.4604083982582446e-05,
      "loss": 1.5007,
      "num_input_tokens_seen": 19026358096,
      "step": 24183
    },
    {
      "epoch": 2.5656694249946956,
      "grad_norm": 0.4002944146364209,
      "learning_rate": 4.460365270901333e-05,
      "loss": 1.5146,
      "num_input_tokens_seen": 19027144880,
      "step": 24184
    },
    {
      "epoch": 2.565775514534267,
      "grad_norm": 0.35156064825243755,
      "learning_rate": 4.460322142029508e-05,
      "loss": 1.4657,
      "num_input_tokens_seen": 19027931664,
      "step": 24185
    },
    {
      "epoch": 2.565881604073838,
      "grad_norm": 0.4402496688498935,
      "learning_rate": 4.460279011642804e-05,
      "loss": 1.5354,
      "num_input_tokens_seen": 19028718496,
      "step": 24186
    },
    {
      "epoch": 2.5659876936134096,
      "grad_norm": 0.4034145752565019,
      "learning_rate": 4.4602358797412534e-05,
      "loss": 1.5246,
      "num_input_tokens_seen": 19029505280,
      "step": 24187
    },
    {
      "epoch": 2.566093783152981,
      "grad_norm": 0.39555749124328654,
      "learning_rate": 4.46019274632489e-05,
      "loss": 1.6579,
      "num_input_tokens_seen": 19030292080,
      "step": 24188
    },
    {
      "epoch": 2.5661998726925526,
      "grad_norm": 0.4285684842985193,
      "learning_rate": 4.460149611393748e-05,
      "loss": 1.6038,
      "num_input_tokens_seen": 19031078784,
      "step": 24189
    },
    {
      "epoch": 2.566305962232124,
      "grad_norm": 0.5381163073524798,
      "learning_rate": 4.4601064749478594e-05,
      "loss": 1.5776,
      "num_input_tokens_seen": 19031865536,
      "step": 24190
    },
    {
      "epoch": 2.566412051771695,
      "grad_norm": 0.4270641309870983,
      "learning_rate": 4.460063336987259e-05,
      "loss": 1.5882,
      "num_input_tokens_seen": 19032652320,
      "step": 24191
    },
    {
      "epoch": 2.5665181413112665,
      "grad_norm": 0.5015182581783091,
      "learning_rate": 4.4600201975119775e-05,
      "loss": 1.6435,
      "num_input_tokens_seen": 19033439120,
      "step": 24192
    },
    {
      "epoch": 2.566624230850838,
      "grad_norm": 0.380203039596314,
      "learning_rate": 4.459977056522051e-05,
      "loss": 1.6064,
      "num_input_tokens_seen": 19034225920,
      "step": 24193
    },
    {
      "epoch": 2.5667303203904095,
      "grad_norm": 0.3899493751409748,
      "learning_rate": 4.459933914017511e-05,
      "loss": 1.5621,
      "num_input_tokens_seen": 19035012688,
      "step": 24194
    },
    {
      "epoch": 2.566836409929981,
      "grad_norm": 0.5250918487234963,
      "learning_rate": 4.4598907699983925e-05,
      "loss": 1.7387,
      "num_input_tokens_seen": 19035799424,
      "step": 24195
    },
    {
      "epoch": 2.5669424994695524,
      "grad_norm": 0.375334609920374,
      "learning_rate": 4.459847624464727e-05,
      "loss": 1.4452,
      "num_input_tokens_seen": 19036586192,
      "step": 24196
    },
    {
      "epoch": 2.567048589009124,
      "grad_norm": 0.4842196061492054,
      "learning_rate": 4.459804477416549e-05,
      "loss": 1.7139,
      "num_input_tokens_seen": 19037373088,
      "step": 24197
    },
    {
      "epoch": 2.567154678548695,
      "grad_norm": 0.40851601712297514,
      "learning_rate": 4.459761328853892e-05,
      "loss": 1.5617,
      "num_input_tokens_seen": 19038159920,
      "step": 24198
    },
    {
      "epoch": 2.5672607680882664,
      "grad_norm": 0.43882857191589314,
      "learning_rate": 4.4597181787767883e-05,
      "loss": 1.5607,
      "num_input_tokens_seen": 19038946720,
      "step": 24199
    },
    {
      "epoch": 2.567366857627838,
      "grad_norm": 0.409177965211122,
      "learning_rate": 4.459675027185273e-05,
      "loss": 1.6144,
      "num_input_tokens_seen": 19039733440,
      "step": 24200
    },
    {
      "epoch": 2.5674729471674094,
      "grad_norm": 0.4504893328844304,
      "learning_rate": 4.459631874079377e-05,
      "loss": 1.6378,
      "num_input_tokens_seen": 19040520112,
      "step": 24201
    },
    {
      "epoch": 2.567579036706981,
      "grad_norm": 0.5721351335624032,
      "learning_rate": 4.4595887194591354e-05,
      "loss": 1.6386,
      "num_input_tokens_seen": 19041306864,
      "step": 24202
    },
    {
      "epoch": 2.567685126246552,
      "grad_norm": 0.5719707532172713,
      "learning_rate": 4.4595455633245816e-05,
      "loss": 1.5041,
      "num_input_tokens_seen": 19042093568,
      "step": 24203
    },
    {
      "epoch": 2.5677912157861233,
      "grad_norm": 0.4389349103955147,
      "learning_rate": 4.4595024056757484e-05,
      "loss": 1.6459,
      "num_input_tokens_seen": 19042880288,
      "step": 24204
    },
    {
      "epoch": 2.567897305325695,
      "grad_norm": 0.364092214823633,
      "learning_rate": 4.459459246512669e-05,
      "loss": 1.5734,
      "num_input_tokens_seen": 19043667072,
      "step": 24205
    },
    {
      "epoch": 2.5680033948652663,
      "grad_norm": 0.47901885007937905,
      "learning_rate": 4.459416085835377e-05,
      "loss": 1.5601,
      "num_input_tokens_seen": 19044453840,
      "step": 24206
    },
    {
      "epoch": 2.5681094844048378,
      "grad_norm": 0.38076112186385247,
      "learning_rate": 4.4593729236439055e-05,
      "loss": 1.6202,
      "num_input_tokens_seen": 19045240560,
      "step": 24207
    },
    {
      "epoch": 2.5682155739444092,
      "grad_norm": 0.4706515339043646,
      "learning_rate": 4.4593297599382886e-05,
      "loss": 1.4621,
      "num_input_tokens_seen": 19046027376,
      "step": 24208
    },
    {
      "epoch": 2.5683216634839807,
      "grad_norm": 0.3592394708616586,
      "learning_rate": 4.459286594718559e-05,
      "loss": 1.5344,
      "num_input_tokens_seen": 19046814144,
      "step": 24209
    },
    {
      "epoch": 2.5684277530235518,
      "grad_norm": 0.49081411965677846,
      "learning_rate": 4.4592434279847505e-05,
      "loss": 1.7928,
      "num_input_tokens_seen": 19047600864,
      "step": 24210
    },
    {
      "epoch": 2.5685338425631232,
      "grad_norm": 0.4026939865215168,
      "learning_rate": 4.459200259736895e-05,
      "loss": 1.6297,
      "num_input_tokens_seen": 19048387696,
      "step": 24211
    },
    {
      "epoch": 2.5686399321026947,
      "grad_norm": 0.3591473386351425,
      "learning_rate": 4.4591570899750285e-05,
      "loss": 1.5524,
      "num_input_tokens_seen": 19049174528,
      "step": 24212
    },
    {
      "epoch": 2.568746021642266,
      "grad_norm": 0.40906618612631723,
      "learning_rate": 4.459113918699182e-05,
      "loss": 1.6193,
      "num_input_tokens_seen": 19049961328,
      "step": 24213
    },
    {
      "epoch": 2.5688521111818376,
      "grad_norm": 0.4250597827745879,
      "learning_rate": 4.45907074590939e-05,
      "loss": 1.7216,
      "num_input_tokens_seen": 19050748112,
      "step": 24214
    },
    {
      "epoch": 2.5689582007214087,
      "grad_norm": 0.38254863398683864,
      "learning_rate": 4.4590275716056856e-05,
      "loss": 1.5609,
      "num_input_tokens_seen": 19051534912,
      "step": 24215
    },
    {
      "epoch": 2.56906429026098,
      "grad_norm": 0.47573568564314234,
      "learning_rate": 4.458984395788102e-05,
      "loss": 1.646,
      "num_input_tokens_seen": 19052321696,
      "step": 24216
    },
    {
      "epoch": 2.5691703798005516,
      "grad_norm": 0.36153254724663514,
      "learning_rate": 4.4589412184566734e-05,
      "loss": 1.6669,
      "num_input_tokens_seen": 19053108448,
      "step": 24217
    },
    {
      "epoch": 2.569276469340123,
      "grad_norm": 0.4268279778562355,
      "learning_rate": 4.458898039611432e-05,
      "loss": 1.5228,
      "num_input_tokens_seen": 19053895248,
      "step": 24218
    },
    {
      "epoch": 2.5693825588796946,
      "grad_norm": 0.41195772749520077,
      "learning_rate": 4.458854859252412e-05,
      "loss": 1.575,
      "num_input_tokens_seen": 19054681920,
      "step": 24219
    },
    {
      "epoch": 2.5694886484192656,
      "grad_norm": 0.3884607492715444,
      "learning_rate": 4.458811677379646e-05,
      "loss": 1.613,
      "num_input_tokens_seen": 19055468720,
      "step": 24220
    },
    {
      "epoch": 2.5695947379588375,
      "grad_norm": 0.4400897437875478,
      "learning_rate": 4.4587684939931675e-05,
      "loss": 1.6641,
      "num_input_tokens_seen": 19056255456,
      "step": 24221
    },
    {
      "epoch": 2.5697008274984086,
      "grad_norm": 0.4150429010422367,
      "learning_rate": 4.45872530909301e-05,
      "loss": 1.5588,
      "num_input_tokens_seen": 19057042288,
      "step": 24222
    },
    {
      "epoch": 2.56980691703798,
      "grad_norm": 0.395256147176472,
      "learning_rate": 4.4586821226792085e-05,
      "loss": 1.5603,
      "num_input_tokens_seen": 19057829168,
      "step": 24223
    },
    {
      "epoch": 2.5699130065775515,
      "grad_norm": 0.3648617957973741,
      "learning_rate": 4.458638934751794e-05,
      "loss": 1.6067,
      "num_input_tokens_seen": 19058615856,
      "step": 24224
    },
    {
      "epoch": 2.570019096117123,
      "grad_norm": 0.3533311746688198,
      "learning_rate": 4.458595745310801e-05,
      "loss": 1.6532,
      "num_input_tokens_seen": 19059402608,
      "step": 24225
    },
    {
      "epoch": 2.5701251856566945,
      "grad_norm": 0.39126350876847155,
      "learning_rate": 4.458552554356262e-05,
      "loss": 1.6031,
      "num_input_tokens_seen": 19060189376,
      "step": 24226
    },
    {
      "epoch": 2.5702312751962655,
      "grad_norm": 0.3863465525410329,
      "learning_rate": 4.4585093618882124e-05,
      "loss": 1.6036,
      "num_input_tokens_seen": 19060976112,
      "step": 24227
    },
    {
      "epoch": 2.570337364735837,
      "grad_norm": 0.38067188968797394,
      "learning_rate": 4.458466167906683e-05,
      "loss": 1.553,
      "num_input_tokens_seen": 19061762992,
      "step": 24228
    },
    {
      "epoch": 2.5704434542754084,
      "grad_norm": 0.3823506182167295,
      "learning_rate": 4.458422972411709e-05,
      "loss": 1.502,
      "num_input_tokens_seen": 19062549712,
      "step": 24229
    },
    {
      "epoch": 2.57054954381498,
      "grad_norm": 0.38417962587293075,
      "learning_rate": 4.458379775403323e-05,
      "loss": 1.5874,
      "num_input_tokens_seen": 19063336496,
      "step": 24230
    },
    {
      "epoch": 2.5706556333545514,
      "grad_norm": 0.3490090043457718,
      "learning_rate": 4.458336576881559e-05,
      "loss": 1.6115,
      "num_input_tokens_seen": 19064123232,
      "step": 24231
    },
    {
      "epoch": 2.5707617228941224,
      "grad_norm": 0.4294423483242887,
      "learning_rate": 4.458293376846449e-05,
      "loss": 1.6945,
      "num_input_tokens_seen": 19064910048,
      "step": 24232
    },
    {
      "epoch": 2.570867812433694,
      "grad_norm": 0.393336559375665,
      "learning_rate": 4.458250175298028e-05,
      "loss": 1.6836,
      "num_input_tokens_seen": 19065696800,
      "step": 24233
    },
    {
      "epoch": 2.5709739019732654,
      "grad_norm": 0.3643959267209826,
      "learning_rate": 4.458206972236329e-05,
      "loss": 1.6032,
      "num_input_tokens_seen": 19066483680,
      "step": 24234
    },
    {
      "epoch": 2.571079991512837,
      "grad_norm": 0.3816231092351713,
      "learning_rate": 4.458163767661384e-05,
      "loss": 1.6796,
      "num_input_tokens_seen": 19067270432,
      "step": 24235
    },
    {
      "epoch": 2.5711860810524083,
      "grad_norm": 0.3967029970614106,
      "learning_rate": 4.458120561573229e-05,
      "loss": 1.6229,
      "num_input_tokens_seen": 19068057136,
      "step": 24236
    },
    {
      "epoch": 2.57129217059198,
      "grad_norm": 0.3882476253841998,
      "learning_rate": 4.458077353971894e-05,
      "loss": 1.6796,
      "num_input_tokens_seen": 19068843904,
      "step": 24237
    },
    {
      "epoch": 2.5713982601315513,
      "grad_norm": 0.4222407867726698,
      "learning_rate": 4.458034144857416e-05,
      "loss": 1.5031,
      "num_input_tokens_seen": 19069630768,
      "step": 24238
    },
    {
      "epoch": 2.5715043496711223,
      "grad_norm": 0.3992297314282464,
      "learning_rate": 4.457990934229827e-05,
      "loss": 1.5799,
      "num_input_tokens_seen": 19070417600,
      "step": 24239
    },
    {
      "epoch": 2.5716104392106938,
      "grad_norm": 0.5368875217016363,
      "learning_rate": 4.457947722089158e-05,
      "loss": 1.677,
      "num_input_tokens_seen": 19071204304,
      "step": 24240
    },
    {
      "epoch": 2.5717165287502652,
      "grad_norm": 0.3882568816358864,
      "learning_rate": 4.457904508435446e-05,
      "loss": 1.6141,
      "num_input_tokens_seen": 19071991056,
      "step": 24241
    },
    {
      "epoch": 2.5718226182898367,
      "grad_norm": 0.3728437267603168,
      "learning_rate": 4.457861293268722e-05,
      "loss": 1.6434,
      "num_input_tokens_seen": 19072777760,
      "step": 24242
    },
    {
      "epoch": 2.571928707829408,
      "grad_norm": 0.4373501824349971,
      "learning_rate": 4.457818076589021e-05,
      "loss": 1.6523,
      "num_input_tokens_seen": 19073564384,
      "step": 24243
    },
    {
      "epoch": 2.572034797368979,
      "grad_norm": 0.35219735367685534,
      "learning_rate": 4.4577748583963755e-05,
      "loss": 1.5395,
      "num_input_tokens_seen": 19074351152,
      "step": 24244
    },
    {
      "epoch": 2.5721408869085507,
      "grad_norm": 0.3852077136152303,
      "learning_rate": 4.4577316386908185e-05,
      "loss": 1.6493,
      "num_input_tokens_seen": 19075137888,
      "step": 24245
    },
    {
      "epoch": 2.572246976448122,
      "grad_norm": 0.4124005766668441,
      "learning_rate": 4.457688417472384e-05,
      "loss": 1.6594,
      "num_input_tokens_seen": 19075924640,
      "step": 24246
    },
    {
      "epoch": 2.5723530659876936,
      "grad_norm": 0.42410580676847426,
      "learning_rate": 4.4576451947411056e-05,
      "loss": 1.6454,
      "num_input_tokens_seen": 19076711376,
      "step": 24247
    },
    {
      "epoch": 2.572459155527265,
      "grad_norm": 0.408157828915753,
      "learning_rate": 4.457601970497017e-05,
      "loss": 1.641,
      "num_input_tokens_seen": 19077498096,
      "step": 24248
    },
    {
      "epoch": 2.572565245066836,
      "grad_norm": 0.43914783716778294,
      "learning_rate": 4.45755874474015e-05,
      "loss": 1.7048,
      "num_input_tokens_seen": 19078284896,
      "step": 24249
    },
    {
      "epoch": 2.572671334606408,
      "grad_norm": 0.36114709775380427,
      "learning_rate": 4.4575155174705394e-05,
      "loss": 1.4913,
      "num_input_tokens_seen": 19079071632,
      "step": 24250
    },
    {
      "epoch": 2.572777424145979,
      "grad_norm": 0.49104237737445977,
      "learning_rate": 4.4574722886882194e-05,
      "loss": 1.6745,
      "num_input_tokens_seen": 19079858288,
      "step": 24251
    },
    {
      "epoch": 2.5728835136855506,
      "grad_norm": 0.37220493945750294,
      "learning_rate": 4.457429058393221e-05,
      "loss": 1.7262,
      "num_input_tokens_seen": 19080645152,
      "step": 24252
    },
    {
      "epoch": 2.572989603225122,
      "grad_norm": 0.5030726843300675,
      "learning_rate": 4.457385826585578e-05,
      "loss": 1.6181,
      "num_input_tokens_seen": 19081431888,
      "step": 24253
    },
    {
      "epoch": 2.5730956927646935,
      "grad_norm": 0.4439327041356207,
      "learning_rate": 4.4573425932653264e-05,
      "loss": 1.583,
      "num_input_tokens_seen": 19082218608,
      "step": 24254
    },
    {
      "epoch": 2.573201782304265,
      "grad_norm": 0.4609003840921567,
      "learning_rate": 4.4572993584324976e-05,
      "loss": 1.5761,
      "num_input_tokens_seen": 19083005440,
      "step": 24255
    },
    {
      "epoch": 2.573307871843836,
      "grad_norm": 0.42026566949408484,
      "learning_rate": 4.457256122087125e-05,
      "loss": 1.5834,
      "num_input_tokens_seen": 19083792224,
      "step": 24256
    },
    {
      "epoch": 2.5734139613834075,
      "grad_norm": 0.39306368025727056,
      "learning_rate": 4.457212884229242e-05,
      "loss": 1.6739,
      "num_input_tokens_seen": 19084578976,
      "step": 24257
    },
    {
      "epoch": 2.573520050922979,
      "grad_norm": 0.4436997454783838,
      "learning_rate": 4.457169644858882e-05,
      "loss": 1.5874,
      "num_input_tokens_seen": 19085365744,
      "step": 24258
    },
    {
      "epoch": 2.5736261404625504,
      "grad_norm": 0.6062239486745036,
      "learning_rate": 4.45712640397608e-05,
      "loss": 1.6056,
      "num_input_tokens_seen": 19086152544,
      "step": 24259
    },
    {
      "epoch": 2.573732230002122,
      "grad_norm": 0.46488812549186226,
      "learning_rate": 4.457083161580867e-05,
      "loss": 1.5134,
      "num_input_tokens_seen": 19086939424,
      "step": 24260
    },
    {
      "epoch": 2.573838319541693,
      "grad_norm": 0.7344490476849624,
      "learning_rate": 4.457039917673278e-05,
      "loss": 1.7138,
      "num_input_tokens_seen": 19087726160,
      "step": 24261
    },
    {
      "epoch": 2.5739444090812644,
      "grad_norm": 0.4358032303641291,
      "learning_rate": 4.456996672253346e-05,
      "loss": 1.5835,
      "num_input_tokens_seen": 19088512864,
      "step": 24262
    },
    {
      "epoch": 2.574050498620836,
      "grad_norm": 0.5290476302961744,
      "learning_rate": 4.456953425321104e-05,
      "loss": 1.7037,
      "num_input_tokens_seen": 19089299568,
      "step": 24263
    },
    {
      "epoch": 2.5741565881604074,
      "grad_norm": 0.3848055497855985,
      "learning_rate": 4.4569101768765866e-05,
      "loss": 1.5834,
      "num_input_tokens_seen": 19090086448,
      "step": 24264
    },
    {
      "epoch": 2.574262677699979,
      "grad_norm": 0.4637780683540988,
      "learning_rate": 4.4568669269198246e-05,
      "loss": 1.5653,
      "num_input_tokens_seen": 19090873328,
      "step": 24265
    },
    {
      "epoch": 2.5743687672395503,
      "grad_norm": 0.4696329465810427,
      "learning_rate": 4.456823675450855e-05,
      "loss": 1.6835,
      "num_input_tokens_seen": 19091660128,
      "step": 24266
    },
    {
      "epoch": 2.574474856779122,
      "grad_norm": 0.4576858630102511,
      "learning_rate": 4.456780422469709e-05,
      "loss": 1.5775,
      "num_input_tokens_seen": 19092446976,
      "step": 24267
    },
    {
      "epoch": 2.574580946318693,
      "grad_norm": 0.4607065274991362,
      "learning_rate": 4.456737167976421e-05,
      "loss": 1.6533,
      "num_input_tokens_seen": 19093233680,
      "step": 24268
    },
    {
      "epoch": 2.5746870358582643,
      "grad_norm": 0.40977639442021685,
      "learning_rate": 4.456693911971024e-05,
      "loss": 1.5131,
      "num_input_tokens_seen": 19094020528,
      "step": 24269
    },
    {
      "epoch": 2.574793125397836,
      "grad_norm": 0.53914091142121,
      "learning_rate": 4.4566506544535504e-05,
      "loss": 1.6925,
      "num_input_tokens_seen": 19094807248,
      "step": 24270
    },
    {
      "epoch": 2.5748992149374073,
      "grad_norm": 0.43160182500359273,
      "learning_rate": 4.456607395424035e-05,
      "loss": 1.6761,
      "num_input_tokens_seen": 19095594032,
      "step": 24271
    },
    {
      "epoch": 2.5750053044769787,
      "grad_norm": 0.530998594406182,
      "learning_rate": 4.456564134882511e-05,
      "loss": 1.5234,
      "num_input_tokens_seen": 19096380768,
      "step": 24272
    },
    {
      "epoch": 2.5751113940165498,
      "grad_norm": 0.4419283600828698,
      "learning_rate": 4.4565208728290116e-05,
      "loss": 1.519,
      "num_input_tokens_seen": 19097167536,
      "step": 24273
    },
    {
      "epoch": 2.5752174835561212,
      "grad_norm": 0.5017588453749842,
      "learning_rate": 4.45647760926357e-05,
      "loss": 1.4866,
      "num_input_tokens_seen": 19097954240,
      "step": 24274
    },
    {
      "epoch": 2.5753235730956927,
      "grad_norm": 0.3751703852762805,
      "learning_rate": 4.45643434418622e-05,
      "loss": 1.6136,
      "num_input_tokens_seen": 19098741040,
      "step": 24275
    },
    {
      "epoch": 2.575429662635264,
      "grad_norm": 0.4614179689691036,
      "learning_rate": 4.4563910775969955e-05,
      "loss": 1.5467,
      "num_input_tokens_seen": 19099527824,
      "step": 24276
    },
    {
      "epoch": 2.5755357521748357,
      "grad_norm": 0.4432421194823487,
      "learning_rate": 4.4563478094959286e-05,
      "loss": 1.6807,
      "num_input_tokens_seen": 19100314656,
      "step": 24277
    },
    {
      "epoch": 2.5756418417144067,
      "grad_norm": 0.41561029574848446,
      "learning_rate": 4.456304539883054e-05,
      "loss": 1.638,
      "num_input_tokens_seen": 19101101392,
      "step": 24278
    },
    {
      "epoch": 2.5757479312539786,
      "grad_norm": 0.3841659665456109,
      "learning_rate": 4.456261268758404e-05,
      "loss": 1.4854,
      "num_input_tokens_seen": 19101888208,
      "step": 24279
    },
    {
      "epoch": 2.5758540207935496,
      "grad_norm": 0.41484681851880795,
      "learning_rate": 4.456217996122014e-05,
      "loss": 1.6095,
      "num_input_tokens_seen": 19102675008,
      "step": 24280
    },
    {
      "epoch": 2.575960110333121,
      "grad_norm": 0.37417599823292536,
      "learning_rate": 4.456174721973915e-05,
      "loss": 1.5948,
      "num_input_tokens_seen": 19103461696,
      "step": 24281
    },
    {
      "epoch": 2.5760661998726926,
      "grad_norm": 0.41747872863994356,
      "learning_rate": 4.4561314463141415e-05,
      "loss": 1.5896,
      "num_input_tokens_seen": 19104248496,
      "step": 24282
    },
    {
      "epoch": 2.576172289412264,
      "grad_norm": 0.3809631715954531,
      "learning_rate": 4.456088169142727e-05,
      "loss": 1.6684,
      "num_input_tokens_seen": 19105035264,
      "step": 24283
    },
    {
      "epoch": 2.5762783789518355,
      "grad_norm": 0.3464846333341255,
      "learning_rate": 4.456044890459706e-05,
      "loss": 1.4278,
      "num_input_tokens_seen": 19105821984,
      "step": 24284
    },
    {
      "epoch": 2.5763844684914066,
      "grad_norm": 0.4461205089586414,
      "learning_rate": 4.45600161026511e-05,
      "loss": 1.767,
      "num_input_tokens_seen": 19106608752,
      "step": 24285
    },
    {
      "epoch": 2.576490558030978,
      "grad_norm": 0.491122048558773,
      "learning_rate": 4.455958328558974e-05,
      "loss": 1.6252,
      "num_input_tokens_seen": 19107395488,
      "step": 24286
    },
    {
      "epoch": 2.5765966475705495,
      "grad_norm": 0.3924412390025042,
      "learning_rate": 4.45591504534133e-05,
      "loss": 1.5383,
      "num_input_tokens_seen": 19108182416,
      "step": 24287
    },
    {
      "epoch": 2.576702737110121,
      "grad_norm": 0.5196855478446604,
      "learning_rate": 4.455871760612213e-05,
      "loss": 1.6822,
      "num_input_tokens_seen": 19108969168,
      "step": 24288
    },
    {
      "epoch": 2.5768088266496925,
      "grad_norm": 0.40931040006852615,
      "learning_rate": 4.455828474371655e-05,
      "loss": 1.5543,
      "num_input_tokens_seen": 19109755936,
      "step": 24289
    },
    {
      "epoch": 2.5769149161892635,
      "grad_norm": 0.5093676835330867,
      "learning_rate": 4.455785186619691e-05,
      "loss": 1.5941,
      "num_input_tokens_seen": 19110542624,
      "step": 24290
    },
    {
      "epoch": 2.5770210057288354,
      "grad_norm": 0.5371184621026306,
      "learning_rate": 4.4557418973563526e-05,
      "loss": 1.6183,
      "num_input_tokens_seen": 19111329376,
      "step": 24291
    },
    {
      "epoch": 2.5771270952684064,
      "grad_norm": 0.415587843067838,
      "learning_rate": 4.455698606581675e-05,
      "loss": 1.4513,
      "num_input_tokens_seen": 19112116160,
      "step": 24292
    },
    {
      "epoch": 2.577233184807978,
      "grad_norm": 0.4355337607213461,
      "learning_rate": 4.4556553142956906e-05,
      "loss": 1.7121,
      "num_input_tokens_seen": 19112902928,
      "step": 24293
    },
    {
      "epoch": 2.5773392743475494,
      "grad_norm": 0.38924037158995844,
      "learning_rate": 4.455612020498433e-05,
      "loss": 1.4437,
      "num_input_tokens_seen": 19113689664,
      "step": 24294
    },
    {
      "epoch": 2.577445363887121,
      "grad_norm": 0.45103086583435525,
      "learning_rate": 4.455568725189936e-05,
      "loss": 1.6392,
      "num_input_tokens_seen": 19114476400,
      "step": 24295
    },
    {
      "epoch": 2.5775514534266923,
      "grad_norm": 0.5242263546548191,
      "learning_rate": 4.455525428370233e-05,
      "loss": 1.6668,
      "num_input_tokens_seen": 19115263152,
      "step": 24296
    },
    {
      "epoch": 2.5776575429662634,
      "grad_norm": 0.42717792668980514,
      "learning_rate": 4.4554821300393574e-05,
      "loss": 1.548,
      "num_input_tokens_seen": 19116049968,
      "step": 24297
    },
    {
      "epoch": 2.577763632505835,
      "grad_norm": 0.6933204648182885,
      "learning_rate": 4.455438830197342e-05,
      "loss": 1.5917,
      "num_input_tokens_seen": 19116836752,
      "step": 24298
    },
    {
      "epoch": 2.5778697220454063,
      "grad_norm": 0.6761506378915418,
      "learning_rate": 4.4553955288442214e-05,
      "loss": 1.5649,
      "num_input_tokens_seen": 19117623520,
      "step": 24299
    },
    {
      "epoch": 2.577975811584978,
      "grad_norm": 0.5060597496385065,
      "learning_rate": 4.4553522259800285e-05,
      "loss": 1.6168,
      "num_input_tokens_seen": 19118410256,
      "step": 24300
    },
    {
      "epoch": 2.5780819011245493,
      "grad_norm": 0.5217393175142037,
      "learning_rate": 4.455308921604796e-05,
      "loss": 1.578,
      "num_input_tokens_seen": 19119196992,
      "step": 24301
    },
    {
      "epoch": 2.5781879906641203,
      "grad_norm": 0.45685312535311984,
      "learning_rate": 4.455265615718559e-05,
      "loss": 1.7007,
      "num_input_tokens_seen": 19119983824,
      "step": 24302
    },
    {
      "epoch": 2.5782940802036918,
      "grad_norm": 0.7759493123867526,
      "learning_rate": 4.45522230832135e-05,
      "loss": 1.7763,
      "num_input_tokens_seen": 19120770528,
      "step": 24303
    },
    {
      "epoch": 2.5784001697432632,
      "grad_norm": 0.4141644476571986,
      "learning_rate": 4.455178999413202e-05,
      "loss": 1.6641,
      "num_input_tokens_seen": 19121557312,
      "step": 24304
    },
    {
      "epoch": 2.5785062592828347,
      "grad_norm": 0.7502441489065617,
      "learning_rate": 4.4551356889941496e-05,
      "loss": 1.6121,
      "num_input_tokens_seen": 19122344064,
      "step": 24305
    },
    {
      "epoch": 2.578612348822406,
      "grad_norm": 0.47918008244685706,
      "learning_rate": 4.455092377064226e-05,
      "loss": 1.6189,
      "num_input_tokens_seen": 19123130880,
      "step": 24306
    },
    {
      "epoch": 2.5787184383619777,
      "grad_norm": 0.5117849692287038,
      "learning_rate": 4.4550490636234635e-05,
      "loss": 1.5934,
      "num_input_tokens_seen": 19123917616,
      "step": 24307
    },
    {
      "epoch": 2.578824527901549,
      "grad_norm": 0.4077962112248133,
      "learning_rate": 4.455005748671897e-05,
      "loss": 1.6428,
      "num_input_tokens_seen": 19124704432,
      "step": 24308
    },
    {
      "epoch": 2.57893061744112,
      "grad_norm": 0.38493412319203785,
      "learning_rate": 4.45496243220956e-05,
      "loss": 1.4627,
      "num_input_tokens_seen": 19125491216,
      "step": 24309
    },
    {
      "epoch": 2.5790367069806917,
      "grad_norm": 0.47234710834386623,
      "learning_rate": 4.4549191142364845e-05,
      "loss": 1.5519,
      "num_input_tokens_seen": 19126278000,
      "step": 24310
    },
    {
      "epoch": 2.579142796520263,
      "grad_norm": 0.5023864411693375,
      "learning_rate": 4.454875794752705e-05,
      "loss": 1.6098,
      "num_input_tokens_seen": 19127064848,
      "step": 24311
    },
    {
      "epoch": 2.5792488860598346,
      "grad_norm": 0.4036543514944246,
      "learning_rate": 4.454832473758255e-05,
      "loss": 1.6662,
      "num_input_tokens_seen": 19127851648,
      "step": 24312
    },
    {
      "epoch": 2.579354975599406,
      "grad_norm": 0.47705310527050837,
      "learning_rate": 4.454789151253168e-05,
      "loss": 1.6929,
      "num_input_tokens_seen": 19128638384,
      "step": 24313
    },
    {
      "epoch": 2.579461065138977,
      "grad_norm": 0.45479589176465435,
      "learning_rate": 4.4547458272374766e-05,
      "loss": 1.6065,
      "num_input_tokens_seen": 19129425232,
      "step": 24314
    },
    {
      "epoch": 2.5795671546785486,
      "grad_norm": 0.39181233647163755,
      "learning_rate": 4.454702501711215e-05,
      "loss": 1.4833,
      "num_input_tokens_seen": 19130211968,
      "step": 24315
    },
    {
      "epoch": 2.57967324421812,
      "grad_norm": 0.4703280920032061,
      "learning_rate": 4.454659174674418e-05,
      "loss": 1.5087,
      "num_input_tokens_seen": 19130998752,
      "step": 24316
    },
    {
      "epoch": 2.5797793337576915,
      "grad_norm": 0.4583010509999682,
      "learning_rate": 4.454615846127116e-05,
      "loss": 1.7182,
      "num_input_tokens_seen": 19131785632,
      "step": 24317
    },
    {
      "epoch": 2.579885423297263,
      "grad_norm": 0.40949328164931126,
      "learning_rate": 4.454572516069345e-05,
      "loss": 1.5988,
      "num_input_tokens_seen": 19132572416,
      "step": 24318
    },
    {
      "epoch": 2.579991512836834,
      "grad_norm": 0.6098456101518411,
      "learning_rate": 4.454529184501138e-05,
      "loss": 1.7813,
      "num_input_tokens_seen": 19133359104,
      "step": 24319
    },
    {
      "epoch": 2.580097602376406,
      "grad_norm": 0.37376507201000947,
      "learning_rate": 4.454485851422528e-05,
      "loss": 1.6014,
      "num_input_tokens_seen": 19134145888,
      "step": 24320
    },
    {
      "epoch": 2.580203691915977,
      "grad_norm": 0.41639628533163864,
      "learning_rate": 4.454442516833549e-05,
      "loss": 1.4556,
      "num_input_tokens_seen": 19134932704,
      "step": 24321
    },
    {
      "epoch": 2.5803097814555485,
      "grad_norm": 0.4959699063122619,
      "learning_rate": 4.454399180734233e-05,
      "loss": 1.7215,
      "num_input_tokens_seen": 19135719472,
      "step": 24322
    },
    {
      "epoch": 2.58041587099512,
      "grad_norm": 0.3856393383098021,
      "learning_rate": 4.4543558431246154e-05,
      "loss": 1.6373,
      "num_input_tokens_seen": 19136506288,
      "step": 24323
    },
    {
      "epoch": 2.5805219605346914,
      "grad_norm": 0.495975703938654,
      "learning_rate": 4.4543125040047296e-05,
      "loss": 1.7458,
      "num_input_tokens_seen": 19137293136,
      "step": 24324
    },
    {
      "epoch": 2.580628050074263,
      "grad_norm": 0.408252488620113,
      "learning_rate": 4.454269163374608e-05,
      "loss": 1.5572,
      "num_input_tokens_seen": 19138079968,
      "step": 24325
    },
    {
      "epoch": 2.580734139613834,
      "grad_norm": 0.3949558626329759,
      "learning_rate": 4.454225821234284e-05,
      "loss": 1.6184,
      "num_input_tokens_seen": 19138866704,
      "step": 24326
    },
    {
      "epoch": 2.5808402291534054,
      "grad_norm": 0.4417533336953508,
      "learning_rate": 4.454182477583792e-05,
      "loss": 1.6256,
      "num_input_tokens_seen": 19139653584,
      "step": 24327
    },
    {
      "epoch": 2.580946318692977,
      "grad_norm": 0.4601014992416555,
      "learning_rate": 4.454139132423165e-05,
      "loss": 1.6021,
      "num_input_tokens_seen": 19140440384,
      "step": 24328
    },
    {
      "epoch": 2.5810524082325483,
      "grad_norm": 0.41734997375503124,
      "learning_rate": 4.454095785752437e-05,
      "loss": 1.6853,
      "num_input_tokens_seen": 19141227264,
      "step": 24329
    },
    {
      "epoch": 2.58115849777212,
      "grad_norm": 0.509379947190591,
      "learning_rate": 4.454052437571641e-05,
      "loss": 1.5889,
      "num_input_tokens_seen": 19142014096,
      "step": 24330
    },
    {
      "epoch": 2.581264587311691,
      "grad_norm": 0.37946831574242734,
      "learning_rate": 4.4540090878808104e-05,
      "loss": 1.5824,
      "num_input_tokens_seen": 19142800896,
      "step": 24331
    },
    {
      "epoch": 2.5813706768512623,
      "grad_norm": 0.43671207121875033,
      "learning_rate": 4.453965736679979e-05,
      "loss": 1.6636,
      "num_input_tokens_seen": 19143587664,
      "step": 24332
    },
    {
      "epoch": 2.581476766390834,
      "grad_norm": 0.390018794349397,
      "learning_rate": 4.45392238396918e-05,
      "loss": 1.5819,
      "num_input_tokens_seen": 19144374400,
      "step": 24333
    },
    {
      "epoch": 2.5815828559304053,
      "grad_norm": 0.36606319707476165,
      "learning_rate": 4.453879029748448e-05,
      "loss": 1.4939,
      "num_input_tokens_seen": 19145161136,
      "step": 24334
    },
    {
      "epoch": 2.5816889454699767,
      "grad_norm": 0.4192602021673437,
      "learning_rate": 4.453835674017814e-05,
      "loss": 1.5535,
      "num_input_tokens_seen": 19145947904,
      "step": 24335
    },
    {
      "epoch": 2.581795035009548,
      "grad_norm": 0.4021291449505304,
      "learning_rate": 4.4537923167773146e-05,
      "loss": 1.4465,
      "num_input_tokens_seen": 19146734720,
      "step": 24336
    },
    {
      "epoch": 2.5819011245491197,
      "grad_norm": 0.36001466733211995,
      "learning_rate": 4.453748958026981e-05,
      "loss": 1.5007,
      "num_input_tokens_seen": 19147521552,
      "step": 24337
    },
    {
      "epoch": 2.5820072140886907,
      "grad_norm": 0.4355321728050736,
      "learning_rate": 4.453705597766848e-05,
      "loss": 1.5534,
      "num_input_tokens_seen": 19148308320,
      "step": 24338
    },
    {
      "epoch": 2.582113303628262,
      "grad_norm": 0.3610161974851618,
      "learning_rate": 4.4536622359969484e-05,
      "loss": 1.6061,
      "num_input_tokens_seen": 19149095040,
      "step": 24339
    },
    {
      "epoch": 2.5822193931678337,
      "grad_norm": 0.37752168765089084,
      "learning_rate": 4.453618872717316e-05,
      "loss": 1.4542,
      "num_input_tokens_seen": 19149881856,
      "step": 24340
    },
    {
      "epoch": 2.582325482707405,
      "grad_norm": 0.4035130973983477,
      "learning_rate": 4.453575507927984e-05,
      "loss": 1.5825,
      "num_input_tokens_seen": 19150668624,
      "step": 24341
    },
    {
      "epoch": 2.5824315722469766,
      "grad_norm": 0.39727771356754604,
      "learning_rate": 4.4535321416289864e-05,
      "loss": 1.5831,
      "num_input_tokens_seen": 19151455488,
      "step": 24342
    },
    {
      "epoch": 2.5825376617865476,
      "grad_norm": 0.3726298515536231,
      "learning_rate": 4.453488773820357e-05,
      "loss": 1.554,
      "num_input_tokens_seen": 19152242256,
      "step": 24343
    },
    {
      "epoch": 2.582643751326119,
      "grad_norm": 0.37777685855437365,
      "learning_rate": 4.453445404502128e-05,
      "loss": 1.5814,
      "num_input_tokens_seen": 19153029072,
      "step": 24344
    },
    {
      "epoch": 2.5827498408656906,
      "grad_norm": 0.42051546390988276,
      "learning_rate": 4.453402033674334e-05,
      "loss": 1.5979,
      "num_input_tokens_seen": 19153815856,
      "step": 24345
    },
    {
      "epoch": 2.582855930405262,
      "grad_norm": 0.4187558907924004,
      "learning_rate": 4.4533586613370084e-05,
      "loss": 1.6242,
      "num_input_tokens_seen": 19154602496,
      "step": 24346
    },
    {
      "epoch": 2.5829620199448335,
      "grad_norm": 0.41311868590331297,
      "learning_rate": 4.453315287490184e-05,
      "loss": 1.4381,
      "num_input_tokens_seen": 19155389248,
      "step": 24347
    },
    {
      "epoch": 2.5830681094844046,
      "grad_norm": 0.37150190012524,
      "learning_rate": 4.4532719121338954e-05,
      "loss": 1.5571,
      "num_input_tokens_seen": 19156175984,
      "step": 24348
    },
    {
      "epoch": 2.5831741990239765,
      "grad_norm": 0.44756734365302747,
      "learning_rate": 4.453228535268176e-05,
      "loss": 1.5335,
      "num_input_tokens_seen": 19156962752,
      "step": 24349
    },
    {
      "epoch": 2.5832802885635475,
      "grad_norm": 0.37833315375854387,
      "learning_rate": 4.4531851568930576e-05,
      "loss": 1.5613,
      "num_input_tokens_seen": 19157749440,
      "step": 24350
    },
    {
      "epoch": 2.583386378103119,
      "grad_norm": 0.4526364695359306,
      "learning_rate": 4.453141777008576e-05,
      "loss": 1.6787,
      "num_input_tokens_seen": 19158536272,
      "step": 24351
    },
    {
      "epoch": 2.5834924676426905,
      "grad_norm": 0.37344590525381394,
      "learning_rate": 4.4530983956147634e-05,
      "loss": 1.6671,
      "num_input_tokens_seen": 19159323008,
      "step": 24352
    },
    {
      "epoch": 2.583598557182262,
      "grad_norm": 0.3913075979864046,
      "learning_rate": 4.453055012711654e-05,
      "loss": 1.6439,
      "num_input_tokens_seen": 19160109808,
      "step": 24353
    },
    {
      "epoch": 2.5837046467218334,
      "grad_norm": 0.3883857333987598,
      "learning_rate": 4.4530116282992806e-05,
      "loss": 1.6313,
      "num_input_tokens_seen": 19160896592,
      "step": 24354
    },
    {
      "epoch": 2.5838107362614045,
      "grad_norm": 0.40925840154582405,
      "learning_rate": 4.4529682423776776e-05,
      "loss": 1.6205,
      "num_input_tokens_seen": 19161683328,
      "step": 24355
    },
    {
      "epoch": 2.583916825800976,
      "grad_norm": 0.35902634044133924,
      "learning_rate": 4.4529248549468774e-05,
      "loss": 1.6232,
      "num_input_tokens_seen": 19162470080,
      "step": 24356
    },
    {
      "epoch": 2.5840229153405474,
      "grad_norm": 0.3118985373412045,
      "learning_rate": 4.452881466006914e-05,
      "loss": 1.5013,
      "num_input_tokens_seen": 19163256848,
      "step": 24357
    },
    {
      "epoch": 2.584129004880119,
      "grad_norm": 0.35627797489119795,
      "learning_rate": 4.452838075557822e-05,
      "loss": 1.6613,
      "num_input_tokens_seen": 19164043552,
      "step": 24358
    },
    {
      "epoch": 2.5842350944196903,
      "grad_norm": 0.36991412756184905,
      "learning_rate": 4.4527946835996335e-05,
      "loss": 1.6838,
      "num_input_tokens_seen": 19164830256,
      "step": 24359
    },
    {
      "epoch": 2.5843411839592614,
      "grad_norm": 0.3764324099947275,
      "learning_rate": 4.4527512901323825e-05,
      "loss": 1.4969,
      "num_input_tokens_seen": 19165617008,
      "step": 24360
    },
    {
      "epoch": 2.584447273498833,
      "grad_norm": 0.3952681274498893,
      "learning_rate": 4.452707895156103e-05,
      "loss": 1.6171,
      "num_input_tokens_seen": 19166403824,
      "step": 24361
    },
    {
      "epoch": 2.5845533630384043,
      "grad_norm": 0.34427435090730857,
      "learning_rate": 4.4526644986708276e-05,
      "loss": 1.5778,
      "num_input_tokens_seen": 19167190608,
      "step": 24362
    },
    {
      "epoch": 2.584659452577976,
      "grad_norm": 0.3297421659723127,
      "learning_rate": 4.452621100676591e-05,
      "loss": 1.5821,
      "num_input_tokens_seen": 19167977296,
      "step": 24363
    },
    {
      "epoch": 2.5847655421175473,
      "grad_norm": 0.4157733913598072,
      "learning_rate": 4.452577701173426e-05,
      "loss": 1.6533,
      "num_input_tokens_seen": 19168764096,
      "step": 24364
    },
    {
      "epoch": 2.5848716316571188,
      "grad_norm": 0.3526125006176455,
      "learning_rate": 4.452534300161366e-05,
      "loss": 1.622,
      "num_input_tokens_seen": 19169550848,
      "step": 24365
    },
    {
      "epoch": 2.5849777211966902,
      "grad_norm": 0.4166762776411678,
      "learning_rate": 4.452490897640444e-05,
      "loss": 1.5788,
      "num_input_tokens_seen": 19170337680,
      "step": 24366
    },
    {
      "epoch": 2.5850838107362613,
      "grad_norm": 0.3572258471586363,
      "learning_rate": 4.452447493610696e-05,
      "loss": 1.617,
      "num_input_tokens_seen": 19171124384,
      "step": 24367
    },
    {
      "epoch": 2.5851899002758327,
      "grad_norm": 0.33801928629425804,
      "learning_rate": 4.4524040880721527e-05,
      "loss": 1.5076,
      "num_input_tokens_seen": 19171911168,
      "step": 24368
    },
    {
      "epoch": 2.585295989815404,
      "grad_norm": 0.36242988890764116,
      "learning_rate": 4.452360681024849e-05,
      "loss": 1.5768,
      "num_input_tokens_seen": 19172697904,
      "step": 24369
    },
    {
      "epoch": 2.5854020793549757,
      "grad_norm": 0.40222423481236624,
      "learning_rate": 4.452317272468819e-05,
      "loss": 1.5226,
      "num_input_tokens_seen": 19173484720,
      "step": 24370
    },
    {
      "epoch": 2.585508168894547,
      "grad_norm": 0.3886895850921413,
      "learning_rate": 4.452273862404094e-05,
      "loss": 1.6508,
      "num_input_tokens_seen": 19174271488,
      "step": 24371
    },
    {
      "epoch": 2.585614258434118,
      "grad_norm": 0.33725886598392923,
      "learning_rate": 4.45223045083071e-05,
      "loss": 1.5556,
      "num_input_tokens_seen": 19175058320,
      "step": 24372
    },
    {
      "epoch": 2.5857203479736897,
      "grad_norm": 0.4064186583593236,
      "learning_rate": 4.4521870377487e-05,
      "loss": 1.6788,
      "num_input_tokens_seen": 19175845184,
      "step": 24373
    },
    {
      "epoch": 2.585826437513261,
      "grad_norm": 0.35803844863963336,
      "learning_rate": 4.452143623158096e-05,
      "loss": 1.623,
      "num_input_tokens_seen": 19176631904,
      "step": 24374
    },
    {
      "epoch": 2.5859325270528326,
      "grad_norm": 0.5232488220389047,
      "learning_rate": 4.4521002070589335e-05,
      "loss": 1.5771,
      "num_input_tokens_seen": 19177418640,
      "step": 24375
    },
    {
      "epoch": 2.586038616592404,
      "grad_norm": 0.43677436853518686,
      "learning_rate": 4.4520567894512456e-05,
      "loss": 1.8058,
      "num_input_tokens_seen": 19178205488,
      "step": 24376
    },
    {
      "epoch": 2.586144706131975,
      "grad_norm": 0.4965206955599299,
      "learning_rate": 4.4520133703350645e-05,
      "loss": 1.5462,
      "num_input_tokens_seen": 19178992208,
      "step": 24377
    },
    {
      "epoch": 2.586250795671547,
      "grad_norm": 0.5826545311824928,
      "learning_rate": 4.451969949710425e-05,
      "loss": 1.6654,
      "num_input_tokens_seen": 19179778928,
      "step": 24378
    },
    {
      "epoch": 2.586356885211118,
      "grad_norm": 0.4938274449042087,
      "learning_rate": 4.451926527577361e-05,
      "loss": 1.6402,
      "num_input_tokens_seen": 19180565728,
      "step": 24379
    },
    {
      "epoch": 2.5864629747506895,
      "grad_norm": 0.4913462217043217,
      "learning_rate": 4.451883103935905e-05,
      "loss": 1.6046,
      "num_input_tokens_seen": 19181352512,
      "step": 24380
    },
    {
      "epoch": 2.586569064290261,
      "grad_norm": 0.3642080372519899,
      "learning_rate": 4.4518396787860906e-05,
      "loss": 1.4478,
      "num_input_tokens_seen": 19182139248,
      "step": 24381
    },
    {
      "epoch": 2.5866751538298325,
      "grad_norm": 0.46448845877794054,
      "learning_rate": 4.4517962521279525e-05,
      "loss": 1.5835,
      "num_input_tokens_seen": 19182926000,
      "step": 24382
    },
    {
      "epoch": 2.586781243369404,
      "grad_norm": 0.4437894935212099,
      "learning_rate": 4.451752823961524e-05,
      "loss": 1.6267,
      "num_input_tokens_seen": 19183712752,
      "step": 24383
    },
    {
      "epoch": 2.586887332908975,
      "grad_norm": 0.3753703634017427,
      "learning_rate": 4.4517093942868364e-05,
      "loss": 1.6218,
      "num_input_tokens_seen": 19184499552,
      "step": 24384
    },
    {
      "epoch": 2.5869934224485465,
      "grad_norm": 0.5101403335127915,
      "learning_rate": 4.451665963103926e-05,
      "loss": 1.6223,
      "num_input_tokens_seen": 19185286368,
      "step": 24385
    },
    {
      "epoch": 2.587099511988118,
      "grad_norm": 0.3684407096445207,
      "learning_rate": 4.451622530412826e-05,
      "loss": 1.5836,
      "num_input_tokens_seen": 19186073040,
      "step": 24386
    },
    {
      "epoch": 2.5872056015276894,
      "grad_norm": 0.38550406505093554,
      "learning_rate": 4.451579096213568e-05,
      "loss": 1.49,
      "num_input_tokens_seen": 19186859904,
      "step": 24387
    },
    {
      "epoch": 2.587311691067261,
      "grad_norm": 0.5181920881335828,
      "learning_rate": 4.451535660506189e-05,
      "loss": 1.7092,
      "num_input_tokens_seen": 19187646688,
      "step": 24388
    },
    {
      "epoch": 2.587417780606832,
      "grad_norm": 0.3802061713582182,
      "learning_rate": 4.451492223290719e-05,
      "loss": 1.7609,
      "num_input_tokens_seen": 19188433392,
      "step": 24389
    },
    {
      "epoch": 2.587523870146404,
      "grad_norm": 0.5649993429137893,
      "learning_rate": 4.4514487845671935e-05,
      "loss": 1.6237,
      "num_input_tokens_seen": 19189220160,
      "step": 24390
    },
    {
      "epoch": 2.587629959685975,
      "grad_norm": 0.3645686379023054,
      "learning_rate": 4.451405344335645e-05,
      "loss": 1.5073,
      "num_input_tokens_seen": 19190006880,
      "step": 24391
    },
    {
      "epoch": 2.5877360492255463,
      "grad_norm": 0.5660338267231195,
      "learning_rate": 4.4513619025961084e-05,
      "loss": 1.6193,
      "num_input_tokens_seen": 19190793648,
      "step": 24392
    },
    {
      "epoch": 2.587842138765118,
      "grad_norm": 0.38867110951607564,
      "learning_rate": 4.451318459348616e-05,
      "loss": 1.6315,
      "num_input_tokens_seen": 19191580480,
      "step": 24393
    },
    {
      "epoch": 2.5879482283046893,
      "grad_norm": 0.5060260042108917,
      "learning_rate": 4.451275014593203e-05,
      "loss": 1.659,
      "num_input_tokens_seen": 19192367264,
      "step": 24394
    },
    {
      "epoch": 2.5880543178442608,
      "grad_norm": 0.3802414481761752,
      "learning_rate": 4.451231568329901e-05,
      "loss": 1.6658,
      "num_input_tokens_seen": 19193154032,
      "step": 24395
    },
    {
      "epoch": 2.588160407383832,
      "grad_norm": 0.3720498461793144,
      "learning_rate": 4.4511881205587444e-05,
      "loss": 1.5749,
      "num_input_tokens_seen": 19193940800,
      "step": 24396
    },
    {
      "epoch": 2.5882664969234033,
      "grad_norm": 0.3885720782437,
      "learning_rate": 4.4511446712797674e-05,
      "loss": 1.664,
      "num_input_tokens_seen": 19194727584,
      "step": 24397
    },
    {
      "epoch": 2.5883725864629747,
      "grad_norm": 0.34821871484233896,
      "learning_rate": 4.451101220493003e-05,
      "loss": 1.4668,
      "num_input_tokens_seen": 19195514480,
      "step": 24398
    },
    {
      "epoch": 2.588478676002546,
      "grad_norm": 0.371473982067953,
      "learning_rate": 4.451057768198484e-05,
      "loss": 1.4756,
      "num_input_tokens_seen": 19196301360,
      "step": 24399
    },
    {
      "epoch": 2.5885847655421177,
      "grad_norm": 0.4449397165820568,
      "learning_rate": 4.4510143143962455e-05,
      "loss": 1.5875,
      "num_input_tokens_seen": 19197088096,
      "step": 24400
    },
    {
      "epoch": 2.5886908550816887,
      "grad_norm": 0.38293440218613106,
      "learning_rate": 4.450970859086321e-05,
      "loss": 1.5889,
      "num_input_tokens_seen": 19197874736,
      "step": 24401
    },
    {
      "epoch": 2.58879694462126,
      "grad_norm": 0.41604970465737684,
      "learning_rate": 4.450927402268743e-05,
      "loss": 1.6499,
      "num_input_tokens_seen": 19198661408,
      "step": 24402
    },
    {
      "epoch": 2.5889030341608317,
      "grad_norm": 0.43630133309144864,
      "learning_rate": 4.450883943943545e-05,
      "loss": 1.8152,
      "num_input_tokens_seen": 19199448224,
      "step": 24403
    },
    {
      "epoch": 2.589009123700403,
      "grad_norm": 0.36027797252249055,
      "learning_rate": 4.450840484110762e-05,
      "loss": 1.5912,
      "num_input_tokens_seen": 19200234976,
      "step": 24404
    },
    {
      "epoch": 2.5891152132399746,
      "grad_norm": 0.39430952038024064,
      "learning_rate": 4.450797022770426e-05,
      "loss": 1.6589,
      "num_input_tokens_seen": 19201021680,
      "step": 24405
    },
    {
      "epoch": 2.589221302779546,
      "grad_norm": 0.3899424568279498,
      "learning_rate": 4.4507535599225716e-05,
      "loss": 1.739,
      "num_input_tokens_seen": 19201808400,
      "step": 24406
    },
    {
      "epoch": 2.5893273923191176,
      "grad_norm": 0.36095615448900464,
      "learning_rate": 4.450710095567232e-05,
      "loss": 1.6076,
      "num_input_tokens_seen": 19202595168,
      "step": 24407
    },
    {
      "epoch": 2.5894334818586886,
      "grad_norm": 0.4078947261635616,
      "learning_rate": 4.450666629704441e-05,
      "loss": 1.6759,
      "num_input_tokens_seen": 19203381904,
      "step": 24408
    },
    {
      "epoch": 2.58953957139826,
      "grad_norm": 0.35473669015955933,
      "learning_rate": 4.450623162334232e-05,
      "loss": 1.4832,
      "num_input_tokens_seen": 19204168592,
      "step": 24409
    },
    {
      "epoch": 2.5896456609378316,
      "grad_norm": 0.4050292326276627,
      "learning_rate": 4.450579693456639e-05,
      "loss": 1.6509,
      "num_input_tokens_seen": 19204955312,
      "step": 24410
    },
    {
      "epoch": 2.589751750477403,
      "grad_norm": 0.39798539981526865,
      "learning_rate": 4.450536223071694e-05,
      "loss": 1.5913,
      "num_input_tokens_seen": 19205742112,
      "step": 24411
    },
    {
      "epoch": 2.5898578400169745,
      "grad_norm": 0.3343608619417698,
      "learning_rate": 4.450492751179433e-05,
      "loss": 1.5129,
      "num_input_tokens_seen": 19206528928,
      "step": 24412
    },
    {
      "epoch": 2.5899639295565455,
      "grad_norm": 0.4021938766197905,
      "learning_rate": 4.4504492777798885e-05,
      "loss": 1.624,
      "num_input_tokens_seen": 19207315648,
      "step": 24413
    },
    {
      "epoch": 2.590070019096117,
      "grad_norm": 0.3877482602597485,
      "learning_rate": 4.4504058028730936e-05,
      "loss": 1.629,
      "num_input_tokens_seen": 19208102448,
      "step": 24414
    },
    {
      "epoch": 2.5901761086356885,
      "grad_norm": 0.3452370286860672,
      "learning_rate": 4.450362326459082e-05,
      "loss": 1.5248,
      "num_input_tokens_seen": 19208889280,
      "step": 24415
    },
    {
      "epoch": 2.59028219817526,
      "grad_norm": 0.4284832219514465,
      "learning_rate": 4.450318848537888e-05,
      "loss": 1.5467,
      "num_input_tokens_seen": 19209676096,
      "step": 24416
    },
    {
      "epoch": 2.5903882877148314,
      "grad_norm": 0.40219744740554103,
      "learning_rate": 4.450275369109545e-05,
      "loss": 1.5201,
      "num_input_tokens_seen": 19210462928,
      "step": 24417
    },
    {
      "epoch": 2.5904943772544025,
      "grad_norm": 0.4262953122243208,
      "learning_rate": 4.4502318881740866e-05,
      "loss": 1.7303,
      "num_input_tokens_seen": 19211249616,
      "step": 24418
    },
    {
      "epoch": 2.5906004667939744,
      "grad_norm": 0.40378468251096716,
      "learning_rate": 4.450188405731546e-05,
      "loss": 1.7841,
      "num_input_tokens_seen": 19212036352,
      "step": 24419
    },
    {
      "epoch": 2.5907065563335454,
      "grad_norm": 0.3777244462143777,
      "learning_rate": 4.4501449217819565e-05,
      "loss": 1.5963,
      "num_input_tokens_seen": 19212823072,
      "step": 24420
    },
    {
      "epoch": 2.590812645873117,
      "grad_norm": 0.39778333534258986,
      "learning_rate": 4.4501014363253526e-05,
      "loss": 1.6748,
      "num_input_tokens_seen": 19213609824,
      "step": 24421
    },
    {
      "epoch": 2.5909187354126884,
      "grad_norm": 0.3110172905379834,
      "learning_rate": 4.450057949361768e-05,
      "loss": 1.5126,
      "num_input_tokens_seen": 19214396592,
      "step": 24422
    },
    {
      "epoch": 2.59102482495226,
      "grad_norm": 0.39180801528654446,
      "learning_rate": 4.450014460891235e-05,
      "loss": 1.6119,
      "num_input_tokens_seen": 19215183408,
      "step": 24423
    },
    {
      "epoch": 2.5911309144918313,
      "grad_norm": 0.38396142033492936,
      "learning_rate": 4.449970970913788e-05,
      "loss": 1.6017,
      "num_input_tokens_seen": 19215970256,
      "step": 24424
    },
    {
      "epoch": 2.5912370040314023,
      "grad_norm": 0.37641863132242054,
      "learning_rate": 4.4499274794294614e-05,
      "loss": 1.7221,
      "num_input_tokens_seen": 19216757008,
      "step": 24425
    },
    {
      "epoch": 2.591343093570974,
      "grad_norm": 0.37678175257446006,
      "learning_rate": 4.449883986438288e-05,
      "loss": 1.6106,
      "num_input_tokens_seen": 19217543760,
      "step": 24426
    },
    {
      "epoch": 2.5914491831105453,
      "grad_norm": 0.39494210059959095,
      "learning_rate": 4.449840491940301e-05,
      "loss": 1.6816,
      "num_input_tokens_seen": 19218330560,
      "step": 24427
    },
    {
      "epoch": 2.5915552726501168,
      "grad_norm": 0.4450564799685833,
      "learning_rate": 4.4497969959355345e-05,
      "loss": 1.64,
      "num_input_tokens_seen": 19219117424,
      "step": 24428
    },
    {
      "epoch": 2.5916613621896882,
      "grad_norm": 0.4015946329004124,
      "learning_rate": 4.449753498424022e-05,
      "loss": 1.6907,
      "num_input_tokens_seen": 19219904256,
      "step": 24429
    },
    {
      "epoch": 2.5917674517292593,
      "grad_norm": 0.39504770404181905,
      "learning_rate": 4.449709999405798e-05,
      "loss": 1.6955,
      "num_input_tokens_seen": 19220691024,
      "step": 24430
    },
    {
      "epoch": 2.5918735412688307,
      "grad_norm": 0.3823048881768832,
      "learning_rate": 4.449666498880895e-05,
      "loss": 1.6092,
      "num_input_tokens_seen": 19221477776,
      "step": 24431
    },
    {
      "epoch": 2.591979630808402,
      "grad_norm": 0.3625938717915448,
      "learning_rate": 4.449622996849346e-05,
      "loss": 1.5044,
      "num_input_tokens_seen": 19222264544,
      "step": 24432
    },
    {
      "epoch": 2.5920857203479737,
      "grad_norm": 0.4129537414852477,
      "learning_rate": 4.449579493311187e-05,
      "loss": 1.7123,
      "num_input_tokens_seen": 19223051216,
      "step": 24433
    },
    {
      "epoch": 2.592191809887545,
      "grad_norm": 0.3885944093435256,
      "learning_rate": 4.449535988266449e-05,
      "loss": 1.6374,
      "num_input_tokens_seen": 19223838000,
      "step": 24434
    },
    {
      "epoch": 2.5922978994271166,
      "grad_norm": 0.41290294356780705,
      "learning_rate": 4.449492481715167e-05,
      "loss": 1.5445,
      "num_input_tokens_seen": 19224624752,
      "step": 24435
    },
    {
      "epoch": 2.592403988966688,
      "grad_norm": 0.3827972583579466,
      "learning_rate": 4.4494489736573755e-05,
      "loss": 1.5613,
      "num_input_tokens_seen": 19225411552,
      "step": 24436
    },
    {
      "epoch": 2.592510078506259,
      "grad_norm": 0.3922652049657585,
      "learning_rate": 4.449405464093106e-05,
      "loss": 1.6166,
      "num_input_tokens_seen": 19226198352,
      "step": 24437
    },
    {
      "epoch": 2.5926161680458306,
      "grad_norm": 0.3866283881607346,
      "learning_rate": 4.449361953022393e-05,
      "loss": 1.5297,
      "num_input_tokens_seen": 19226985136,
      "step": 24438
    },
    {
      "epoch": 2.592722257585402,
      "grad_norm": 0.40657918721821423,
      "learning_rate": 4.449318440445271e-05,
      "loss": 1.6219,
      "num_input_tokens_seen": 19227771856,
      "step": 24439
    },
    {
      "epoch": 2.5928283471249736,
      "grad_norm": 0.4112518044039953,
      "learning_rate": 4.449274926361773e-05,
      "loss": 1.54,
      "num_input_tokens_seen": 19228558640,
      "step": 24440
    },
    {
      "epoch": 2.592934436664545,
      "grad_norm": 0.3355752510651117,
      "learning_rate": 4.4492314107719314e-05,
      "loss": 1.5175,
      "num_input_tokens_seen": 19229345456,
      "step": 24441
    },
    {
      "epoch": 2.593040526204116,
      "grad_norm": 0.35243457699870273,
      "learning_rate": 4.449187893675781e-05,
      "loss": 1.6151,
      "num_input_tokens_seen": 19230132224,
      "step": 24442
    },
    {
      "epoch": 2.5931466157436875,
      "grad_norm": 0.3485813025121066,
      "learning_rate": 4.4491443750733565e-05,
      "loss": 1.5748,
      "num_input_tokens_seen": 19230919008,
      "step": 24443
    },
    {
      "epoch": 2.593252705283259,
      "grad_norm": 0.37310130736781477,
      "learning_rate": 4.449100854964691e-05,
      "loss": 1.5374,
      "num_input_tokens_seen": 19231705840,
      "step": 24444
    },
    {
      "epoch": 2.5933587948228305,
      "grad_norm": 0.40740902139834184,
      "learning_rate": 4.449057333349815e-05,
      "loss": 1.601,
      "num_input_tokens_seen": 19232492656,
      "step": 24445
    },
    {
      "epoch": 2.593464884362402,
      "grad_norm": 0.37389495581756194,
      "learning_rate": 4.449013810228767e-05,
      "loss": 1.5971,
      "num_input_tokens_seen": 19233279440,
      "step": 24446
    },
    {
      "epoch": 2.593570973901973,
      "grad_norm": 0.43573025004956717,
      "learning_rate": 4.4489702856015766e-05,
      "loss": 1.7522,
      "num_input_tokens_seen": 19234066272,
      "step": 24447
    },
    {
      "epoch": 2.593677063441545,
      "grad_norm": 0.3815302677223965,
      "learning_rate": 4.44892675946828e-05,
      "loss": 1.5398,
      "num_input_tokens_seen": 19234852992,
      "step": 24448
    },
    {
      "epoch": 2.593783152981116,
      "grad_norm": 0.4351813335065052,
      "learning_rate": 4.448883231828911e-05,
      "loss": 1.5231,
      "num_input_tokens_seen": 19235639792,
      "step": 24449
    },
    {
      "epoch": 2.5938892425206874,
      "grad_norm": 0.3248949405483757,
      "learning_rate": 4.448839702683501e-05,
      "loss": 1.4794,
      "num_input_tokens_seen": 19236426560,
      "step": 24450
    },
    {
      "epoch": 2.593995332060259,
      "grad_norm": 0.34898411550670333,
      "learning_rate": 4.4487961720320855e-05,
      "loss": 1.5832,
      "num_input_tokens_seen": 19237213376,
      "step": 24451
    },
    {
      "epoch": 2.5941014215998304,
      "grad_norm": 0.36837790064198095,
      "learning_rate": 4.448752639874697e-05,
      "loss": 1.6746,
      "num_input_tokens_seen": 19238000240,
      "step": 24452
    },
    {
      "epoch": 2.594207511139402,
      "grad_norm": 0.3622390410706256,
      "learning_rate": 4.44870910621137e-05,
      "loss": 1.6847,
      "num_input_tokens_seen": 19238787056,
      "step": 24453
    },
    {
      "epoch": 2.594313600678973,
      "grad_norm": 0.42590776345839965,
      "learning_rate": 4.448665571042137e-05,
      "loss": 1.5657,
      "num_input_tokens_seen": 19239573872,
      "step": 24454
    },
    {
      "epoch": 2.5944196902185443,
      "grad_norm": 0.3666714663795607,
      "learning_rate": 4.448622034367033e-05,
      "loss": 1.6475,
      "num_input_tokens_seen": 19240360656,
      "step": 24455
    },
    {
      "epoch": 2.594525779758116,
      "grad_norm": 0.4790178256514593,
      "learning_rate": 4.448578496186091e-05,
      "loss": 1.6557,
      "num_input_tokens_seen": 19241147360,
      "step": 24456
    },
    {
      "epoch": 2.5946318692976873,
      "grad_norm": 0.36455887763256445,
      "learning_rate": 4.448534956499345e-05,
      "loss": 1.5656,
      "num_input_tokens_seen": 19241934160,
      "step": 24457
    },
    {
      "epoch": 2.5947379588372588,
      "grad_norm": 0.4333153950112073,
      "learning_rate": 4.448491415306828e-05,
      "loss": 1.5847,
      "num_input_tokens_seen": 19242720816,
      "step": 24458
    },
    {
      "epoch": 2.59484404837683,
      "grad_norm": 0.3899060177100462,
      "learning_rate": 4.448447872608574e-05,
      "loss": 1.6175,
      "num_input_tokens_seen": 19243507568,
      "step": 24459
    },
    {
      "epoch": 2.5949501379164013,
      "grad_norm": 0.4040222945621511,
      "learning_rate": 4.448404328404617e-05,
      "loss": 1.5985,
      "num_input_tokens_seen": 19244294368,
      "step": 24460
    },
    {
      "epoch": 2.5950562274559728,
      "grad_norm": 0.5172736117901163,
      "learning_rate": 4.44836078269499e-05,
      "loss": 1.6825,
      "num_input_tokens_seen": 19245081232,
      "step": 24461
    },
    {
      "epoch": 2.5951623169955442,
      "grad_norm": 0.3669629255785166,
      "learning_rate": 4.4483172354797265e-05,
      "loss": 1.5206,
      "num_input_tokens_seen": 19245867984,
      "step": 24462
    },
    {
      "epoch": 2.5952684065351157,
      "grad_norm": 0.5340422197958429,
      "learning_rate": 4.448273686758861e-05,
      "loss": 1.4512,
      "num_input_tokens_seen": 19246654832,
      "step": 24463
    },
    {
      "epoch": 2.595374496074687,
      "grad_norm": 0.39457129122334345,
      "learning_rate": 4.4482301365324275e-05,
      "loss": 1.5776,
      "num_input_tokens_seen": 19247441584,
      "step": 24464
    },
    {
      "epoch": 2.5954805856142587,
      "grad_norm": 0.5181999537805282,
      "learning_rate": 4.448186584800458e-05,
      "loss": 1.631,
      "num_input_tokens_seen": 19248228256,
      "step": 24465
    },
    {
      "epoch": 2.5955866751538297,
      "grad_norm": 0.3657230069960083,
      "learning_rate": 4.448143031562987e-05,
      "loss": 1.5986,
      "num_input_tokens_seen": 19249014992,
      "step": 24466
    },
    {
      "epoch": 2.595692764693401,
      "grad_norm": 0.37631217242367726,
      "learning_rate": 4.448099476820049e-05,
      "loss": 1.5938,
      "num_input_tokens_seen": 19249801728,
      "step": 24467
    },
    {
      "epoch": 2.5957988542329726,
      "grad_norm": 0.37087091583842685,
      "learning_rate": 4.448055920571677e-05,
      "loss": 1.4901,
      "num_input_tokens_seen": 19250588512,
      "step": 24468
    },
    {
      "epoch": 2.595904943772544,
      "grad_norm": 0.41103042392299094,
      "learning_rate": 4.448012362817904e-05,
      "loss": 1.6097,
      "num_input_tokens_seen": 19251375264,
      "step": 24469
    },
    {
      "epoch": 2.5960110333121156,
      "grad_norm": 0.37932777790390715,
      "learning_rate": 4.4479688035587636e-05,
      "loss": 1.4627,
      "num_input_tokens_seen": 19252162096,
      "step": 24470
    },
    {
      "epoch": 2.5961171228516866,
      "grad_norm": 0.3600390894163433,
      "learning_rate": 4.447925242794291e-05,
      "loss": 1.6476,
      "num_input_tokens_seen": 19252948896,
      "step": 24471
    },
    {
      "epoch": 2.596223212391258,
      "grad_norm": 0.39359240858704186,
      "learning_rate": 4.447881680524518e-05,
      "loss": 1.6089,
      "num_input_tokens_seen": 19253735664,
      "step": 24472
    },
    {
      "epoch": 2.5963293019308296,
      "grad_norm": 0.4046312785721658,
      "learning_rate": 4.44783811674948e-05,
      "loss": 1.6071,
      "num_input_tokens_seen": 19254522352,
      "step": 24473
    },
    {
      "epoch": 2.596435391470401,
      "grad_norm": 0.41319968733947243,
      "learning_rate": 4.4477945514692096e-05,
      "loss": 1.6538,
      "num_input_tokens_seen": 19255309184,
      "step": 24474
    },
    {
      "epoch": 2.5965414810099725,
      "grad_norm": 0.3957049683602674,
      "learning_rate": 4.447750984683741e-05,
      "loss": 1.6217,
      "num_input_tokens_seen": 19256095936,
      "step": 24475
    },
    {
      "epoch": 2.5966475705495435,
      "grad_norm": 0.4726587901383911,
      "learning_rate": 4.4477074163931074e-05,
      "loss": 1.5436,
      "num_input_tokens_seen": 19256882608,
      "step": 24476
    },
    {
      "epoch": 2.5967536600891155,
      "grad_norm": 0.365220238015774,
      "learning_rate": 4.447663846597342e-05,
      "loss": 1.5752,
      "num_input_tokens_seen": 19257669248,
      "step": 24477
    },
    {
      "epoch": 2.5968597496286865,
      "grad_norm": 0.5019444772608758,
      "learning_rate": 4.44762027529648e-05,
      "loss": 1.5104,
      "num_input_tokens_seen": 19258456064,
      "step": 24478
    },
    {
      "epoch": 2.596965839168258,
      "grad_norm": 0.43649631527507593,
      "learning_rate": 4.447576702490555e-05,
      "loss": 1.4915,
      "num_input_tokens_seen": 19259242816,
      "step": 24479
    },
    {
      "epoch": 2.5970719287078294,
      "grad_norm": 0.4007174719720986,
      "learning_rate": 4.4475331281795985e-05,
      "loss": 1.7019,
      "num_input_tokens_seen": 19260029536,
      "step": 24480
    },
    {
      "epoch": 2.597178018247401,
      "grad_norm": 0.45549646426461654,
      "learning_rate": 4.4474895523636455e-05,
      "loss": 1.589,
      "num_input_tokens_seen": 19260816320,
      "step": 24481
    },
    {
      "epoch": 2.5972841077869724,
      "grad_norm": 0.3685681097825538,
      "learning_rate": 4.44744597504273e-05,
      "loss": 1.6332,
      "num_input_tokens_seen": 19261603056,
      "step": 24482
    },
    {
      "epoch": 2.5973901973265434,
      "grad_norm": 0.33320272176812177,
      "learning_rate": 4.447402396216885e-05,
      "loss": 1.4311,
      "num_input_tokens_seen": 19262389920,
      "step": 24483
    },
    {
      "epoch": 2.597496286866115,
      "grad_norm": 0.4446491667481116,
      "learning_rate": 4.447358815886146e-05,
      "loss": 1.6161,
      "num_input_tokens_seen": 19263176752,
      "step": 24484
    },
    {
      "epoch": 2.5976023764056864,
      "grad_norm": 0.3871240924455353,
      "learning_rate": 4.4473152340505444e-05,
      "loss": 1.5438,
      "num_input_tokens_seen": 19263963520,
      "step": 24485
    },
    {
      "epoch": 2.597708465945258,
      "grad_norm": 0.39089955860275394,
      "learning_rate": 4.4472716507101145e-05,
      "loss": 1.4536,
      "num_input_tokens_seen": 19264750352,
      "step": 24486
    },
    {
      "epoch": 2.5978145554848293,
      "grad_norm": 0.4559347792507175,
      "learning_rate": 4.44722806586489e-05,
      "loss": 1.6898,
      "num_input_tokens_seen": 19265537072,
      "step": 24487
    },
    {
      "epoch": 2.5979206450244003,
      "grad_norm": 0.3997522501380622,
      "learning_rate": 4.447184479514905e-05,
      "loss": 1.6887,
      "num_input_tokens_seen": 19266323872,
      "step": 24488
    },
    {
      "epoch": 2.5980267345639723,
      "grad_norm": 0.4828231062362246,
      "learning_rate": 4.447140891660193e-05,
      "loss": 1.7622,
      "num_input_tokens_seen": 19267110624,
      "step": 24489
    },
    {
      "epoch": 2.5981328241035433,
      "grad_norm": 0.3741632859590324,
      "learning_rate": 4.4470973023007876e-05,
      "loss": 1.5984,
      "num_input_tokens_seen": 19267897392,
      "step": 24490
    },
    {
      "epoch": 2.5982389136431148,
      "grad_norm": 0.3832620497988168,
      "learning_rate": 4.447053711436723e-05,
      "loss": 1.6134,
      "num_input_tokens_seen": 19268684176,
      "step": 24491
    },
    {
      "epoch": 2.5983450031826862,
      "grad_norm": 0.5077621947595831,
      "learning_rate": 4.4470101190680326e-05,
      "loss": 1.7461,
      "num_input_tokens_seen": 19269470848,
      "step": 24492
    },
    {
      "epoch": 2.5984510927222577,
      "grad_norm": 0.4092477116588451,
      "learning_rate": 4.446966525194749e-05,
      "loss": 1.6102,
      "num_input_tokens_seen": 19270257616,
      "step": 24493
    },
    {
      "epoch": 2.598557182261829,
      "grad_norm": 0.49242874543239595,
      "learning_rate": 4.4469229298169066e-05,
      "loss": 1.4397,
      "num_input_tokens_seen": 19271044416,
      "step": 24494
    },
    {
      "epoch": 2.5986632718014,
      "grad_norm": 0.36860075167271655,
      "learning_rate": 4.44687933293454e-05,
      "loss": 1.5165,
      "num_input_tokens_seen": 19271831232,
      "step": 24495
    },
    {
      "epoch": 2.5987693613409717,
      "grad_norm": 0.4963798199224803,
      "learning_rate": 4.4468357345476826e-05,
      "loss": 1.4934,
      "num_input_tokens_seen": 19272617888,
      "step": 24496
    },
    {
      "epoch": 2.598875450880543,
      "grad_norm": 0.4510210717404479,
      "learning_rate": 4.4467921346563665e-05,
      "loss": 1.6763,
      "num_input_tokens_seen": 19273404640,
      "step": 24497
    },
    {
      "epoch": 2.5989815404201146,
      "grad_norm": 0.41414890120053915,
      "learning_rate": 4.446748533260627e-05,
      "loss": 1.695,
      "num_input_tokens_seen": 19274191456,
      "step": 24498
    },
    {
      "epoch": 2.599087629959686,
      "grad_norm": 0.45220950336209276,
      "learning_rate": 4.446704930360498e-05,
      "loss": 1.5711,
      "num_input_tokens_seen": 19274978224,
      "step": 24499
    },
    {
      "epoch": 2.599193719499257,
      "grad_norm": 0.35344131497574965,
      "learning_rate": 4.446661325956012e-05,
      "loss": 1.6486,
      "num_input_tokens_seen": 19275764992,
      "step": 24500
    },
    {
      "epoch": 2.5992998090388286,
      "grad_norm": 0.40391547796339783,
      "learning_rate": 4.446617720047204e-05,
      "loss": 1.5264,
      "num_input_tokens_seen": 19276551808,
      "step": 24501
    },
    {
      "epoch": 2.5994058985784,
      "grad_norm": 0.36746197675391123,
      "learning_rate": 4.446574112634106e-05,
      "loss": 1.5428,
      "num_input_tokens_seen": 19277338576,
      "step": 24502
    },
    {
      "epoch": 2.5995119881179716,
      "grad_norm": 0.35820198288447336,
      "learning_rate": 4.4465305037167524e-05,
      "loss": 1.6161,
      "num_input_tokens_seen": 19278125408,
      "step": 24503
    },
    {
      "epoch": 2.599618077657543,
      "grad_norm": 0.4902398434042433,
      "learning_rate": 4.446486893295178e-05,
      "loss": 1.5151,
      "num_input_tokens_seen": 19278912112,
      "step": 24504
    },
    {
      "epoch": 2.5997241671971145,
      "grad_norm": 0.3644890652378185,
      "learning_rate": 4.446443281369416e-05,
      "loss": 1.5157,
      "num_input_tokens_seen": 19279698928,
      "step": 24505
    },
    {
      "epoch": 2.599830256736686,
      "grad_norm": 0.6882640508116532,
      "learning_rate": 4.446399667939498e-05,
      "loss": 1.595,
      "num_input_tokens_seen": 19280485632,
      "step": 24506
    },
    {
      "epoch": 2.599936346276257,
      "grad_norm": 0.44126913336311063,
      "learning_rate": 4.446356053005461e-05,
      "loss": 1.4885,
      "num_input_tokens_seen": 19281272432,
      "step": 24507
    },
    {
      "epoch": 2.6000424358158285,
      "grad_norm": 0.9616185744866027,
      "learning_rate": 4.446312436567337e-05,
      "loss": 1.7369,
      "num_input_tokens_seen": 19282059168,
      "step": 24508
    },
    {
      "epoch": 2.6001485253554,
      "grad_norm": 0.5743373804609156,
      "learning_rate": 4.4462688186251585e-05,
      "loss": 1.6917,
      "num_input_tokens_seen": 19282845872,
      "step": 24509
    },
    {
      "epoch": 2.6002546148949714,
      "grad_norm": 1.309827818335588,
      "learning_rate": 4.446225199178962e-05,
      "loss": 1.6647,
      "num_input_tokens_seen": 19283632560,
      "step": 24510
    },
    {
      "epoch": 2.600360704434543,
      "grad_norm": 0.5434515107390366,
      "learning_rate": 4.44618157822878e-05,
      "loss": 1.5137,
      "num_input_tokens_seen": 19284419296,
      "step": 24511
    },
    {
      "epoch": 2.600466793974114,
      "grad_norm": 2.369726258163825,
      "learning_rate": 4.446137955774645e-05,
      "loss": 1.6764,
      "num_input_tokens_seen": 19285206144,
      "step": 24512
    },
    {
      "epoch": 2.6005728835136854,
      "grad_norm": 0.5361725296624579,
      "learning_rate": 4.4460943318165915e-05,
      "loss": 1.601,
      "num_input_tokens_seen": 19285992928,
      "step": 24513
    },
    {
      "epoch": 2.600678973053257,
      "grad_norm": 1.2085600661687361,
      "learning_rate": 4.4460507063546544e-05,
      "loss": 1.6062,
      "num_input_tokens_seen": 19286779568,
      "step": 24514
    },
    {
      "epoch": 2.6007850625928284,
      "grad_norm": 0.4293469795680605,
      "learning_rate": 4.446007079388865e-05,
      "loss": 1.5834,
      "num_input_tokens_seen": 19287566320,
      "step": 24515
    },
    {
      "epoch": 2.6008911521324,
      "grad_norm": 0.8778354054740984,
      "learning_rate": 4.44596345091926e-05,
      "loss": 1.7111,
      "num_input_tokens_seen": 19288353120,
      "step": 24516
    },
    {
      "epoch": 2.600997241671971,
      "grad_norm": 0.38920879280281234,
      "learning_rate": 4.445919820945871e-05,
      "loss": 1.5114,
      "num_input_tokens_seen": 19289139872,
      "step": 24517
    },
    {
      "epoch": 2.601103331211543,
      "grad_norm": 0.5835527836959499,
      "learning_rate": 4.4458761894687314e-05,
      "loss": 1.6101,
      "num_input_tokens_seen": 19289926688,
      "step": 24518
    },
    {
      "epoch": 2.601209420751114,
      "grad_norm": 0.6575428750821878,
      "learning_rate": 4.4458325564878774e-05,
      "loss": 1.589,
      "num_input_tokens_seen": 19290713456,
      "step": 24519
    },
    {
      "epoch": 2.6013155102906853,
      "grad_norm": 0.4799800783871921,
      "learning_rate": 4.44578892200334e-05,
      "loss": 1.5525,
      "num_input_tokens_seen": 19291500224,
      "step": 24520
    },
    {
      "epoch": 2.601421599830257,
      "grad_norm": 0.607592617137157,
      "learning_rate": 4.4457452860151544e-05,
      "loss": 1.5499,
      "num_input_tokens_seen": 19292287136,
      "step": 24521
    },
    {
      "epoch": 2.6015276893698283,
      "grad_norm": 0.5867254673755278,
      "learning_rate": 4.445701648523354e-05,
      "loss": 1.5435,
      "num_input_tokens_seen": 19293073872,
      "step": 24522
    },
    {
      "epoch": 2.6016337789093997,
      "grad_norm": 0.43600486318878046,
      "learning_rate": 4.445658009527972e-05,
      "loss": 1.6436,
      "num_input_tokens_seen": 19293860640,
      "step": 24523
    },
    {
      "epoch": 2.6017398684489708,
      "grad_norm": 0.5209578501697134,
      "learning_rate": 4.445614369029043e-05,
      "loss": 1.5961,
      "num_input_tokens_seen": 19294647376,
      "step": 24524
    },
    {
      "epoch": 2.6018459579885422,
      "grad_norm": 0.5612451790114709,
      "learning_rate": 4.4455707270266e-05,
      "loss": 1.62,
      "num_input_tokens_seen": 19295434112,
      "step": 24525
    },
    {
      "epoch": 2.6019520475281137,
      "grad_norm": 0.36756657261863573,
      "learning_rate": 4.445527083520677e-05,
      "loss": 1.5761,
      "num_input_tokens_seen": 19296220912,
      "step": 24526
    },
    {
      "epoch": 2.602058137067685,
      "grad_norm": 0.6202413796378843,
      "learning_rate": 4.4454834385113084e-05,
      "loss": 1.6332,
      "num_input_tokens_seen": 19297007632,
      "step": 24527
    },
    {
      "epoch": 2.6021642266072567,
      "grad_norm": 0.5599269601830401,
      "learning_rate": 4.445439791998526e-05,
      "loss": 1.7594,
      "num_input_tokens_seen": 19297794496,
      "step": 24528
    },
    {
      "epoch": 2.6022703161468277,
      "grad_norm": 0.4530455208398302,
      "learning_rate": 4.445396143982365e-05,
      "loss": 1.4354,
      "num_input_tokens_seen": 19298581264,
      "step": 24529
    },
    {
      "epoch": 2.602376405686399,
      "grad_norm": 0.6784513048698685,
      "learning_rate": 4.44535249446286e-05,
      "loss": 1.5842,
      "num_input_tokens_seen": 19299368048,
      "step": 24530
    },
    {
      "epoch": 2.6024824952259706,
      "grad_norm": 0.44705036675416576,
      "learning_rate": 4.445308843440044e-05,
      "loss": 1.5823,
      "num_input_tokens_seen": 19300154704,
      "step": 24531
    },
    {
      "epoch": 2.602588584765542,
      "grad_norm": 0.6213658049549066,
      "learning_rate": 4.445265190913949e-05,
      "loss": 1.4615,
      "num_input_tokens_seen": 19300941504,
      "step": 24532
    },
    {
      "epoch": 2.6026946743051136,
      "grad_norm": 0.4408187021346489,
      "learning_rate": 4.44522153688461e-05,
      "loss": 1.6345,
      "num_input_tokens_seen": 19301728304,
      "step": 24533
    },
    {
      "epoch": 2.602800763844685,
      "grad_norm": 0.4404082685640686,
      "learning_rate": 4.445177881352063e-05,
      "loss": 1.5339,
      "num_input_tokens_seen": 19302515008,
      "step": 24534
    },
    {
      "epoch": 2.6029068533842565,
      "grad_norm": 0.4189847042253243,
      "learning_rate": 4.445134224316338e-05,
      "loss": 1.5237,
      "num_input_tokens_seen": 19303301840,
      "step": 24535
    },
    {
      "epoch": 2.6030129429238276,
      "grad_norm": 0.46613306345402583,
      "learning_rate": 4.44509056577747e-05,
      "loss": 1.7596,
      "num_input_tokens_seen": 19304088608,
      "step": 24536
    },
    {
      "epoch": 2.603119032463399,
      "grad_norm": 0.3653687068266461,
      "learning_rate": 4.445046905735494e-05,
      "loss": 1.5881,
      "num_input_tokens_seen": 19304875328,
      "step": 24537
    },
    {
      "epoch": 2.6032251220029705,
      "grad_norm": 0.4380933985516835,
      "learning_rate": 4.4450032441904424e-05,
      "loss": 1.5072,
      "num_input_tokens_seen": 19305662080,
      "step": 24538
    },
    {
      "epoch": 2.603331211542542,
      "grad_norm": 0.42340002908374014,
      "learning_rate": 4.4449595811423494e-05,
      "loss": 1.6521,
      "num_input_tokens_seen": 19306448800,
      "step": 24539
    },
    {
      "epoch": 2.6034373010821135,
      "grad_norm": 0.37477651428021636,
      "learning_rate": 4.444915916591249e-05,
      "loss": 1.5358,
      "num_input_tokens_seen": 19307235616,
      "step": 24540
    },
    {
      "epoch": 2.6035433906216845,
      "grad_norm": 0.4188476842637656,
      "learning_rate": 4.4448722505371746e-05,
      "loss": 1.6337,
      "num_input_tokens_seen": 19308022416,
      "step": 24541
    },
    {
      "epoch": 2.603649480161256,
      "grad_norm": 0.37708607718960147,
      "learning_rate": 4.444828582980159e-05,
      "loss": 1.487,
      "num_input_tokens_seen": 19308809152,
      "step": 24542
    },
    {
      "epoch": 2.6037555697008274,
      "grad_norm": 0.40995717599700104,
      "learning_rate": 4.444784913920238e-05,
      "loss": 1.4583,
      "num_input_tokens_seen": 19309595968,
      "step": 24543
    },
    {
      "epoch": 2.603861659240399,
      "grad_norm": 0.3946387293498421,
      "learning_rate": 4.4447412433574445e-05,
      "loss": 1.6566,
      "num_input_tokens_seen": 19310382720,
      "step": 24544
    },
    {
      "epoch": 2.6039677487799704,
      "grad_norm": 0.3804624277534101,
      "learning_rate": 4.4446975712918116e-05,
      "loss": 1.7003,
      "num_input_tokens_seen": 19311169440,
      "step": 24545
    },
    {
      "epoch": 2.6040738383195414,
      "grad_norm": 0.38441827957200353,
      "learning_rate": 4.444653897723373e-05,
      "loss": 1.6101,
      "num_input_tokens_seen": 19311956176,
      "step": 24546
    },
    {
      "epoch": 2.6041799278591133,
      "grad_norm": 0.37950860426080973,
      "learning_rate": 4.4446102226521635e-05,
      "loss": 1.5825,
      "num_input_tokens_seen": 19312742976,
      "step": 24547
    },
    {
      "epoch": 2.6042860173986844,
      "grad_norm": 0.4909115748870757,
      "learning_rate": 4.444566546078216e-05,
      "loss": 1.7609,
      "num_input_tokens_seen": 19313529808,
      "step": 24548
    },
    {
      "epoch": 2.604392106938256,
      "grad_norm": 0.4336901784952025,
      "learning_rate": 4.444522868001565e-05,
      "loss": 1.6632,
      "num_input_tokens_seen": 19314316576,
      "step": 24549
    },
    {
      "epoch": 2.6044981964778273,
      "grad_norm": 0.5731262923502257,
      "learning_rate": 4.444479188422243e-05,
      "loss": 1.6613,
      "num_input_tokens_seen": 19315103472,
      "step": 24550
    },
    {
      "epoch": 2.604604286017399,
      "grad_norm": 0.4921913316615865,
      "learning_rate": 4.444435507340285e-05,
      "loss": 1.6189,
      "num_input_tokens_seen": 19315890192,
      "step": 24551
    },
    {
      "epoch": 2.6047103755569703,
      "grad_norm": 0.4390075488448644,
      "learning_rate": 4.444391824755724e-05,
      "loss": 1.6866,
      "num_input_tokens_seen": 19316676992,
      "step": 24552
    },
    {
      "epoch": 2.6048164650965413,
      "grad_norm": 0.40446747395249005,
      "learning_rate": 4.4443481406685946e-05,
      "loss": 1.5329,
      "num_input_tokens_seen": 19317463728,
      "step": 24553
    },
    {
      "epoch": 2.6049225546361128,
      "grad_norm": 0.4814503294569763,
      "learning_rate": 4.4443044550789295e-05,
      "loss": 1.6204,
      "num_input_tokens_seen": 19318250496,
      "step": 24554
    },
    {
      "epoch": 2.6050286441756842,
      "grad_norm": 0.4125069762536616,
      "learning_rate": 4.4442607679867634e-05,
      "loss": 1.676,
      "num_input_tokens_seen": 19319037232,
      "step": 24555
    },
    {
      "epoch": 2.6051347337152557,
      "grad_norm": 0.322902162401191,
      "learning_rate": 4.4442170793921295e-05,
      "loss": 1.4414,
      "num_input_tokens_seen": 19319824032,
      "step": 24556
    },
    {
      "epoch": 2.605240823254827,
      "grad_norm": 0.5606804529633804,
      "learning_rate": 4.444173389295061e-05,
      "loss": 1.5137,
      "num_input_tokens_seen": 19320610752,
      "step": 24557
    },
    {
      "epoch": 2.6053469127943982,
      "grad_norm": 0.4429432891702515,
      "learning_rate": 4.4441296976955936e-05,
      "loss": 1.5148,
      "num_input_tokens_seen": 19321397536,
      "step": 24558
    },
    {
      "epoch": 2.60545300233397,
      "grad_norm": 0.5054935846752829,
      "learning_rate": 4.444086004593759e-05,
      "loss": 1.6149,
      "num_input_tokens_seen": 19322184208,
      "step": 24559
    },
    {
      "epoch": 2.605559091873541,
      "grad_norm": 0.48724131337330195,
      "learning_rate": 4.444042309989592e-05,
      "loss": 1.6126,
      "num_input_tokens_seen": 19322970912,
      "step": 24560
    },
    {
      "epoch": 2.6056651814131127,
      "grad_norm": 0.4182718742021258,
      "learning_rate": 4.443998613883126e-05,
      "loss": 1.5861,
      "num_input_tokens_seen": 19323757664,
      "step": 24561
    },
    {
      "epoch": 2.605771270952684,
      "grad_norm": 0.43917565467905373,
      "learning_rate": 4.443954916274395e-05,
      "loss": 1.5718,
      "num_input_tokens_seen": 19324544480,
      "step": 24562
    },
    {
      "epoch": 2.6058773604922556,
      "grad_norm": 0.42744094917503656,
      "learning_rate": 4.4439112171634326e-05,
      "loss": 1.6979,
      "num_input_tokens_seen": 19325331184,
      "step": 24563
    },
    {
      "epoch": 2.605983450031827,
      "grad_norm": 0.49950411683218776,
      "learning_rate": 4.4438675165502733e-05,
      "loss": 1.7295,
      "num_input_tokens_seen": 19326117968,
      "step": 24564
    },
    {
      "epoch": 2.606089539571398,
      "grad_norm": 0.42283358881849853,
      "learning_rate": 4.443823814434949e-05,
      "loss": 1.6437,
      "num_input_tokens_seen": 19326904736,
      "step": 24565
    },
    {
      "epoch": 2.6061956291109696,
      "grad_norm": 0.4518895988959584,
      "learning_rate": 4.4437801108174957e-05,
      "loss": 1.5892,
      "num_input_tokens_seen": 19327691440,
      "step": 24566
    },
    {
      "epoch": 2.606301718650541,
      "grad_norm": 0.3942510824898221,
      "learning_rate": 4.4437364056979456e-05,
      "loss": 1.5858,
      "num_input_tokens_seen": 19328478224,
      "step": 24567
    },
    {
      "epoch": 2.6064078081901125,
      "grad_norm": 0.3643234570583779,
      "learning_rate": 4.443692699076333e-05,
      "loss": 1.6738,
      "num_input_tokens_seen": 19329264992,
      "step": 24568
    },
    {
      "epoch": 2.606513897729684,
      "grad_norm": 0.38772320519047015,
      "learning_rate": 4.443648990952693e-05,
      "loss": 1.6337,
      "num_input_tokens_seen": 19330051728,
      "step": 24569
    },
    {
      "epoch": 2.606619987269255,
      "grad_norm": 0.3857409064098276,
      "learning_rate": 4.443605281327056e-05,
      "loss": 1.7555,
      "num_input_tokens_seen": 19330838448,
      "step": 24570
    },
    {
      "epoch": 2.6067260768088265,
      "grad_norm": 0.37146085188379685,
      "learning_rate": 4.4435615701994594e-05,
      "loss": 1.5329,
      "num_input_tokens_seen": 19331625248,
      "step": 24571
    },
    {
      "epoch": 2.606832166348398,
      "grad_norm": 0.4044207464816104,
      "learning_rate": 4.4435178575699344e-05,
      "loss": 1.6434,
      "num_input_tokens_seen": 19332411968,
      "step": 24572
    },
    {
      "epoch": 2.6069382558879695,
      "grad_norm": 0.35491849224002214,
      "learning_rate": 4.443474143438516e-05,
      "loss": 1.5204,
      "num_input_tokens_seen": 19333198768,
      "step": 24573
    },
    {
      "epoch": 2.607044345427541,
      "grad_norm": 0.40962372327971674,
      "learning_rate": 4.443430427805239e-05,
      "loss": 1.6634,
      "num_input_tokens_seen": 19333985520,
      "step": 24574
    },
    {
      "epoch": 2.6071504349671124,
      "grad_norm": 0.40848012948274764,
      "learning_rate": 4.443386710670135e-05,
      "loss": 1.5912,
      "num_input_tokens_seen": 19334772192,
      "step": 24575
    },
    {
      "epoch": 2.607256524506684,
      "grad_norm": 0.41703043261095624,
      "learning_rate": 4.443342992033239e-05,
      "loss": 1.5573,
      "num_input_tokens_seen": 19335558928,
      "step": 24576
    },
    {
      "epoch": 2.607362614046255,
      "grad_norm": 0.4062500493283075,
      "learning_rate": 4.443299271894584e-05,
      "loss": 1.604,
      "num_input_tokens_seen": 19336345664,
      "step": 24577
    },
    {
      "epoch": 2.6074687035858264,
      "grad_norm": 0.4510242575667296,
      "learning_rate": 4.443255550254205e-05,
      "loss": 1.5116,
      "num_input_tokens_seen": 19337132464,
      "step": 24578
    },
    {
      "epoch": 2.607574793125398,
      "grad_norm": 0.42874980216699743,
      "learning_rate": 4.4432118271121355e-05,
      "loss": 1.524,
      "num_input_tokens_seen": 19337919312,
      "step": 24579
    },
    {
      "epoch": 2.6076808826649693,
      "grad_norm": 0.3839830335346119,
      "learning_rate": 4.4431681024684076e-05,
      "loss": 1.5436,
      "num_input_tokens_seen": 19338706176,
      "step": 24580
    },
    {
      "epoch": 2.607786972204541,
      "grad_norm": 0.4691149273901424,
      "learning_rate": 4.443124376323058e-05,
      "loss": 1.5475,
      "num_input_tokens_seen": 19339492928,
      "step": 24581
    },
    {
      "epoch": 2.607893061744112,
      "grad_norm": 0.45762768924071334,
      "learning_rate": 4.4430806486761176e-05,
      "loss": 1.7101,
      "num_input_tokens_seen": 19340279552,
      "step": 24582
    },
    {
      "epoch": 2.6079991512836833,
      "grad_norm": 0.396028961608941,
      "learning_rate": 4.4430369195276225e-05,
      "loss": 1.6469,
      "num_input_tokens_seen": 19341066352,
      "step": 24583
    },
    {
      "epoch": 2.608105240823255,
      "grad_norm": 0.38661929940564405,
      "learning_rate": 4.442993188877605e-05,
      "loss": 1.5225,
      "num_input_tokens_seen": 19341853136,
      "step": 24584
    },
    {
      "epoch": 2.6082113303628263,
      "grad_norm": 0.46139103159441736,
      "learning_rate": 4.442949456726099e-05,
      "loss": 1.5303,
      "num_input_tokens_seen": 19342639968,
      "step": 24585
    },
    {
      "epoch": 2.6083174199023977,
      "grad_norm": 0.4044701681806822,
      "learning_rate": 4.442905723073139e-05,
      "loss": 1.5757,
      "num_input_tokens_seen": 19343426640,
      "step": 24586
    },
    {
      "epoch": 2.6084235094419688,
      "grad_norm": 0.37522112729765983,
      "learning_rate": 4.442861987918758e-05,
      "loss": 1.4569,
      "num_input_tokens_seen": 19344213472,
      "step": 24587
    },
    {
      "epoch": 2.6085295989815407,
      "grad_norm": 0.3670524654980553,
      "learning_rate": 4.442818251262991e-05,
      "loss": 1.5711,
      "num_input_tokens_seen": 19345000224,
      "step": 24588
    },
    {
      "epoch": 2.6086356885211117,
      "grad_norm": 0.4000343464076315,
      "learning_rate": 4.442774513105871e-05,
      "loss": 1.5463,
      "num_input_tokens_seen": 19345787088,
      "step": 24589
    },
    {
      "epoch": 2.608741778060683,
      "grad_norm": 0.3469653213661721,
      "learning_rate": 4.442730773447432e-05,
      "loss": 1.5524,
      "num_input_tokens_seen": 19346573888,
      "step": 24590
    },
    {
      "epoch": 2.6088478676002547,
      "grad_norm": 0.39070125308557785,
      "learning_rate": 4.4426870322877065e-05,
      "loss": 1.71,
      "num_input_tokens_seen": 19347360624,
      "step": 24591
    },
    {
      "epoch": 2.608953957139826,
      "grad_norm": 0.39302646749505504,
      "learning_rate": 4.442643289626731e-05,
      "loss": 1.5323,
      "num_input_tokens_seen": 19348147440,
      "step": 24592
    },
    {
      "epoch": 2.6090600466793976,
      "grad_norm": 0.46898873119117773,
      "learning_rate": 4.442599545464537e-05,
      "loss": 1.5409,
      "num_input_tokens_seen": 19348934224,
      "step": 24593
    },
    {
      "epoch": 2.6091661362189686,
      "grad_norm": 0.3690638827312324,
      "learning_rate": 4.442555799801159e-05,
      "loss": 1.648,
      "num_input_tokens_seen": 19349720976,
      "step": 24594
    },
    {
      "epoch": 2.60927222575854,
      "grad_norm": 0.3662611124010249,
      "learning_rate": 4.442512052636631e-05,
      "loss": 1.621,
      "num_input_tokens_seen": 19350507824,
      "step": 24595
    },
    {
      "epoch": 2.6093783152981116,
      "grad_norm": 0.3856455734458701,
      "learning_rate": 4.442468303970987e-05,
      "loss": 1.691,
      "num_input_tokens_seen": 19351294544,
      "step": 24596
    },
    {
      "epoch": 2.609484404837683,
      "grad_norm": 0.3975914773901997,
      "learning_rate": 4.4424245538042596e-05,
      "loss": 1.5768,
      "num_input_tokens_seen": 19352081296,
      "step": 24597
    },
    {
      "epoch": 2.6095904943772545,
      "grad_norm": 0.3728299752484813,
      "learning_rate": 4.442380802136484e-05,
      "loss": 1.5561,
      "num_input_tokens_seen": 19352868080,
      "step": 24598
    },
    {
      "epoch": 2.6096965839168256,
      "grad_norm": 0.33938146761928417,
      "learning_rate": 4.442337048967694e-05,
      "loss": 1.5632,
      "num_input_tokens_seen": 19353654848,
      "step": 24599
    },
    {
      "epoch": 2.609802673456397,
      "grad_norm": 0.4615342692643608,
      "learning_rate": 4.442293294297922e-05,
      "loss": 1.5204,
      "num_input_tokens_seen": 19354441664,
      "step": 24600
    },
    {
      "epoch": 2.6099087629959685,
      "grad_norm": 0.3774445527939199,
      "learning_rate": 4.442249538127203e-05,
      "loss": 1.5424,
      "num_input_tokens_seen": 19355228464,
      "step": 24601
    },
    {
      "epoch": 2.61001485253554,
      "grad_norm": 0.3457739287566155,
      "learning_rate": 4.4422057804555714e-05,
      "loss": 1.6373,
      "num_input_tokens_seen": 19356015216,
      "step": 24602
    },
    {
      "epoch": 2.6101209420751115,
      "grad_norm": 0.4004846308992988,
      "learning_rate": 4.44216202128306e-05,
      "loss": 1.5635,
      "num_input_tokens_seen": 19356801968,
      "step": 24603
    },
    {
      "epoch": 2.610227031614683,
      "grad_norm": 0.3526627078966973,
      "learning_rate": 4.4421182606097026e-05,
      "loss": 1.5556,
      "num_input_tokens_seen": 19357588736,
      "step": 24604
    },
    {
      "epoch": 2.6103331211542544,
      "grad_norm": 0.46963545906858883,
      "learning_rate": 4.4420744984355325e-05,
      "loss": 1.6322,
      "num_input_tokens_seen": 19358375456,
      "step": 24605
    },
    {
      "epoch": 2.6104392106938255,
      "grad_norm": 0.41074152693922844,
      "learning_rate": 4.4420307347605846e-05,
      "loss": 1.7488,
      "num_input_tokens_seen": 19359162144,
      "step": 24606
    },
    {
      "epoch": 2.610545300233397,
      "grad_norm": 0.3855924482242243,
      "learning_rate": 4.441986969584892e-05,
      "loss": 1.4985,
      "num_input_tokens_seen": 19359948944,
      "step": 24607
    },
    {
      "epoch": 2.6106513897729684,
      "grad_norm": 0.5581485401785796,
      "learning_rate": 4.441943202908489e-05,
      "loss": 1.6993,
      "num_input_tokens_seen": 19360735696,
      "step": 24608
    },
    {
      "epoch": 2.61075747931254,
      "grad_norm": 0.34082915188381263,
      "learning_rate": 4.4418994347314096e-05,
      "loss": 1.6245,
      "num_input_tokens_seen": 19361522464,
      "step": 24609
    },
    {
      "epoch": 2.6108635688521113,
      "grad_norm": 0.5240647887536188,
      "learning_rate": 4.441855665053688e-05,
      "loss": 1.6403,
      "num_input_tokens_seen": 19362309200,
      "step": 24610
    },
    {
      "epoch": 2.6109696583916824,
      "grad_norm": 0.3944716415541623,
      "learning_rate": 4.441811893875356e-05,
      "loss": 1.5607,
      "num_input_tokens_seen": 19363096016,
      "step": 24611
    },
    {
      "epoch": 2.611075747931254,
      "grad_norm": 0.3703555936007924,
      "learning_rate": 4.441768121196449e-05,
      "loss": 1.5811,
      "num_input_tokens_seen": 19363882832,
      "step": 24612
    },
    {
      "epoch": 2.6111818374708253,
      "grad_norm": 0.4458937725554409,
      "learning_rate": 4.441724347017001e-05,
      "loss": 1.5718,
      "num_input_tokens_seen": 19364669728,
      "step": 24613
    },
    {
      "epoch": 2.611287927010397,
      "grad_norm": 0.4143505734553695,
      "learning_rate": 4.441680571337045e-05,
      "loss": 1.6871,
      "num_input_tokens_seen": 19365456416,
      "step": 24614
    },
    {
      "epoch": 2.6113940165499683,
      "grad_norm": 0.3674309091310761,
      "learning_rate": 4.441636794156615e-05,
      "loss": 1.5501,
      "num_input_tokens_seen": 19366243216,
      "step": 24615
    },
    {
      "epoch": 2.6115001060895393,
      "grad_norm": 0.4045953398737486,
      "learning_rate": 4.441593015475746e-05,
      "loss": 1.6978,
      "num_input_tokens_seen": 19367029952,
      "step": 24616
    },
    {
      "epoch": 2.6116061956291112,
      "grad_norm": 0.35571868630360215,
      "learning_rate": 4.4415492352944704e-05,
      "loss": 1.509,
      "num_input_tokens_seen": 19367816784,
      "step": 24617
    },
    {
      "epoch": 2.6117122851686823,
      "grad_norm": 0.45082736311435434,
      "learning_rate": 4.441505453612822e-05,
      "loss": 1.7109,
      "num_input_tokens_seen": 19368603584,
      "step": 24618
    },
    {
      "epoch": 2.6118183747082537,
      "grad_norm": 0.4032566486226987,
      "learning_rate": 4.441461670430836e-05,
      "loss": 1.555,
      "num_input_tokens_seen": 19369390384,
      "step": 24619
    },
    {
      "epoch": 2.611924464247825,
      "grad_norm": 0.4120491123702091,
      "learning_rate": 4.4414178857485455e-05,
      "loss": 1.5893,
      "num_input_tokens_seen": 19370177184,
      "step": 24620
    },
    {
      "epoch": 2.6120305537873967,
      "grad_norm": 0.4326772735971877,
      "learning_rate": 4.4413740995659834e-05,
      "loss": 1.6336,
      "num_input_tokens_seen": 19370963888,
      "step": 24621
    },
    {
      "epoch": 2.612136643326968,
      "grad_norm": 0.3500881801621249,
      "learning_rate": 4.441330311883185e-05,
      "loss": 1.6035,
      "num_input_tokens_seen": 19371750624,
      "step": 24622
    },
    {
      "epoch": 2.612242732866539,
      "grad_norm": 0.43221497539796955,
      "learning_rate": 4.4412865227001835e-05,
      "loss": 1.6621,
      "num_input_tokens_seen": 19372537440,
      "step": 24623
    },
    {
      "epoch": 2.6123488224061107,
      "grad_norm": 0.3560059045826185,
      "learning_rate": 4.441242732017012e-05,
      "loss": 1.5824,
      "num_input_tokens_seen": 19373324192,
      "step": 24624
    },
    {
      "epoch": 2.612454911945682,
      "grad_norm": 0.3722888546329411,
      "learning_rate": 4.441198939833705e-05,
      "loss": 1.6155,
      "num_input_tokens_seen": 19374110928,
      "step": 24625
    },
    {
      "epoch": 2.6125610014852536,
      "grad_norm": 0.3799012617584881,
      "learning_rate": 4.441155146150297e-05,
      "loss": 1.6065,
      "num_input_tokens_seen": 19374897664,
      "step": 24626
    },
    {
      "epoch": 2.612667091024825,
      "grad_norm": 0.40624810680397183,
      "learning_rate": 4.441111350966821e-05,
      "loss": 1.5973,
      "num_input_tokens_seen": 19375684480,
      "step": 24627
    },
    {
      "epoch": 2.612773180564396,
      "grad_norm": 0.3795001724934514,
      "learning_rate": 4.4410675542833116e-05,
      "loss": 1.5361,
      "num_input_tokens_seen": 19376471296,
      "step": 24628
    },
    {
      "epoch": 2.6128792701039676,
      "grad_norm": 0.35374382295124646,
      "learning_rate": 4.441023756099802e-05,
      "loss": 1.5737,
      "num_input_tokens_seen": 19377258016,
      "step": 24629
    },
    {
      "epoch": 2.612985359643539,
      "grad_norm": 0.43769948085993604,
      "learning_rate": 4.4409799564163266e-05,
      "loss": 1.6431,
      "num_input_tokens_seen": 19378044672,
      "step": 24630
    },
    {
      "epoch": 2.6130914491831105,
      "grad_norm": 0.3777112565989826,
      "learning_rate": 4.4409361552329174e-05,
      "loss": 1.5609,
      "num_input_tokens_seen": 19378831392,
      "step": 24631
    },
    {
      "epoch": 2.613197538722682,
      "grad_norm": 0.3718164958830352,
      "learning_rate": 4.440892352549611e-05,
      "loss": 1.587,
      "num_input_tokens_seen": 19379618192,
      "step": 24632
    },
    {
      "epoch": 2.6133036282622535,
      "grad_norm": 0.3875863977242517,
      "learning_rate": 4.44084854836644e-05,
      "loss": 1.5249,
      "num_input_tokens_seen": 19380404960,
      "step": 24633
    },
    {
      "epoch": 2.613409717801825,
      "grad_norm": 0.3778409953618738,
      "learning_rate": 4.440804742683437e-05,
      "loss": 1.5131,
      "num_input_tokens_seen": 19381191792,
      "step": 24634
    },
    {
      "epoch": 2.613515807341396,
      "grad_norm": 0.36888375305669424,
      "learning_rate": 4.440760935500637e-05,
      "loss": 1.5796,
      "num_input_tokens_seen": 19381978624,
      "step": 24635
    },
    {
      "epoch": 2.6136218968809675,
      "grad_norm": 0.37460585656094614,
      "learning_rate": 4.440717126818076e-05,
      "loss": 1.5381,
      "num_input_tokens_seen": 19382765504,
      "step": 24636
    },
    {
      "epoch": 2.613727986420539,
      "grad_norm": 0.3494808419674694,
      "learning_rate": 4.440673316635784e-05,
      "loss": 1.594,
      "num_input_tokens_seen": 19383552400,
      "step": 24637
    },
    {
      "epoch": 2.6138340759601104,
      "grad_norm": 0.38798872502407544,
      "learning_rate": 4.440629504953797e-05,
      "loss": 1.6004,
      "num_input_tokens_seen": 19384339216,
      "step": 24638
    },
    {
      "epoch": 2.613940165499682,
      "grad_norm": 0.40318882594337524,
      "learning_rate": 4.4405856917721486e-05,
      "loss": 1.5628,
      "num_input_tokens_seen": 19385126000,
      "step": 24639
    },
    {
      "epoch": 2.614046255039253,
      "grad_norm": 0.4590742241006751,
      "learning_rate": 4.4405418770908723e-05,
      "loss": 1.5404,
      "num_input_tokens_seen": 19385912656,
      "step": 24640
    },
    {
      "epoch": 2.6141523445788244,
      "grad_norm": 0.44929731794042593,
      "learning_rate": 4.440498060910002e-05,
      "loss": 1.605,
      "num_input_tokens_seen": 19386699504,
      "step": 24641
    },
    {
      "epoch": 2.614258434118396,
      "grad_norm": 0.537841178150056,
      "learning_rate": 4.440454243229572e-05,
      "loss": 1.6636,
      "num_input_tokens_seen": 19387486352,
      "step": 24642
    },
    {
      "epoch": 2.6143645236579673,
      "grad_norm": 0.38636671941894324,
      "learning_rate": 4.4404104240496155e-05,
      "loss": 1.7021,
      "num_input_tokens_seen": 19388273120,
      "step": 24643
    },
    {
      "epoch": 2.614470613197539,
      "grad_norm": 0.4448566517843737,
      "learning_rate": 4.4403666033701676e-05,
      "loss": 1.5368,
      "num_input_tokens_seen": 19389059936,
      "step": 24644
    },
    {
      "epoch": 2.61457670273711,
      "grad_norm": 0.35605987487964097,
      "learning_rate": 4.4403227811912606e-05,
      "loss": 1.598,
      "num_input_tokens_seen": 19389846688,
      "step": 24645
    },
    {
      "epoch": 2.6146827922766818,
      "grad_norm": 0.37515104975012675,
      "learning_rate": 4.44027895751293e-05,
      "loss": 1.5615,
      "num_input_tokens_seen": 19390633472,
      "step": 24646
    },
    {
      "epoch": 2.614788881816253,
      "grad_norm": 0.45307670854626814,
      "learning_rate": 4.4402351323352076e-05,
      "loss": 1.7455,
      "num_input_tokens_seen": 19391420192,
      "step": 24647
    },
    {
      "epoch": 2.6148949713558243,
      "grad_norm": 0.3962716239101435,
      "learning_rate": 4.440191305658129e-05,
      "loss": 1.6269,
      "num_input_tokens_seen": 19392207056,
      "step": 24648
    },
    {
      "epoch": 2.6150010608953957,
      "grad_norm": 0.43693883190296295,
      "learning_rate": 4.440147477481728e-05,
      "loss": 1.6556,
      "num_input_tokens_seen": 19392993824,
      "step": 24649
    },
    {
      "epoch": 2.615107150434967,
      "grad_norm": 0.3920009197498215,
      "learning_rate": 4.440103647806037e-05,
      "loss": 1.6289,
      "num_input_tokens_seen": 19393780560,
      "step": 24650
    },
    {
      "epoch": 2.6152132399745387,
      "grad_norm": 0.43816889988087115,
      "learning_rate": 4.440059816631091e-05,
      "loss": 1.6968,
      "num_input_tokens_seen": 19394567248,
      "step": 24651
    },
    {
      "epoch": 2.6153193295141097,
      "grad_norm": 0.3707780756315664,
      "learning_rate": 4.440015983956924e-05,
      "loss": 1.6512,
      "num_input_tokens_seen": 19395353888,
      "step": 24652
    },
    {
      "epoch": 2.615425419053681,
      "grad_norm": 0.3964160456892265,
      "learning_rate": 4.439972149783569e-05,
      "loss": 1.702,
      "num_input_tokens_seen": 19396140688,
      "step": 24653
    },
    {
      "epoch": 2.6155315085932527,
      "grad_norm": 0.4260775325451044,
      "learning_rate": 4.4399283141110614e-05,
      "loss": 1.714,
      "num_input_tokens_seen": 19396927360,
      "step": 24654
    },
    {
      "epoch": 2.615637598132824,
      "grad_norm": 0.3254060773740149,
      "learning_rate": 4.4398844769394334e-05,
      "loss": 1.5601,
      "num_input_tokens_seen": 19397714128,
      "step": 24655
    },
    {
      "epoch": 2.6157436876723956,
      "grad_norm": 0.4835092481807869,
      "learning_rate": 4.43984063826872e-05,
      "loss": 1.6588,
      "num_input_tokens_seen": 19398500848,
      "step": 24656
    },
    {
      "epoch": 2.6158497772119667,
      "grad_norm": 0.35379457636962175,
      "learning_rate": 4.439796798098954e-05,
      "loss": 1.5526,
      "num_input_tokens_seen": 19399287568,
      "step": 24657
    },
    {
      "epoch": 2.6159558667515386,
      "grad_norm": 0.38817745007291465,
      "learning_rate": 4.439752956430171e-05,
      "loss": 1.4558,
      "num_input_tokens_seen": 19400074400,
      "step": 24658
    },
    {
      "epoch": 2.6160619562911096,
      "grad_norm": 0.35838509133943025,
      "learning_rate": 4.439709113262403e-05,
      "loss": 1.4719,
      "num_input_tokens_seen": 19400861248,
      "step": 24659
    },
    {
      "epoch": 2.616168045830681,
      "grad_norm": 0.3450037558615045,
      "learning_rate": 4.439665268595685e-05,
      "loss": 1.5951,
      "num_input_tokens_seen": 19401647968,
      "step": 24660
    },
    {
      "epoch": 2.6162741353702526,
      "grad_norm": 0.300853133381056,
      "learning_rate": 4.43962142243005e-05,
      "loss": 1.4896,
      "num_input_tokens_seen": 19402434736,
      "step": 24661
    },
    {
      "epoch": 2.616380224909824,
      "grad_norm": 0.3530756460117551,
      "learning_rate": 4.439577574765534e-05,
      "loss": 1.6119,
      "num_input_tokens_seen": 19403221504,
      "step": 24662
    },
    {
      "epoch": 2.6164863144493955,
      "grad_norm": 0.31954208725391114,
      "learning_rate": 4.4395337256021684e-05,
      "loss": 1.505,
      "num_input_tokens_seen": 19404008256,
      "step": 24663
    },
    {
      "epoch": 2.6165924039889665,
      "grad_norm": 0.33753337035999353,
      "learning_rate": 4.439489874939988e-05,
      "loss": 1.3807,
      "num_input_tokens_seen": 19404795024,
      "step": 24664
    },
    {
      "epoch": 2.616698493528538,
      "grad_norm": 0.34042757594807543,
      "learning_rate": 4.439446022779027e-05,
      "loss": 1.5433,
      "num_input_tokens_seen": 19405581744,
      "step": 24665
    },
    {
      "epoch": 2.6168045830681095,
      "grad_norm": 0.4243962659829507,
      "learning_rate": 4.439402169119319e-05,
      "loss": 1.64,
      "num_input_tokens_seen": 19406368528,
      "step": 24666
    },
    {
      "epoch": 2.616910672607681,
      "grad_norm": 0.3938779104406064,
      "learning_rate": 4.4393583139608975e-05,
      "loss": 1.5322,
      "num_input_tokens_seen": 19407155328,
      "step": 24667
    },
    {
      "epoch": 2.6170167621472524,
      "grad_norm": 0.4217486761240154,
      "learning_rate": 4.439314457303797e-05,
      "loss": 1.7393,
      "num_input_tokens_seen": 19407942032,
      "step": 24668
    },
    {
      "epoch": 2.6171228516868235,
      "grad_norm": 0.3994902736222056,
      "learning_rate": 4.439270599148051e-05,
      "loss": 1.6692,
      "num_input_tokens_seen": 19408728736,
      "step": 24669
    },
    {
      "epoch": 2.617228941226395,
      "grad_norm": 0.4252566104102795,
      "learning_rate": 4.439226739493694e-05,
      "loss": 1.6365,
      "num_input_tokens_seen": 19409515504,
      "step": 24670
    },
    {
      "epoch": 2.6173350307659664,
      "grad_norm": 0.494324364365058,
      "learning_rate": 4.4391828783407594e-05,
      "loss": 1.5876,
      "num_input_tokens_seen": 19410302256,
      "step": 24671
    },
    {
      "epoch": 2.617441120305538,
      "grad_norm": 0.3790968006597712,
      "learning_rate": 4.439139015689281e-05,
      "loss": 1.5603,
      "num_input_tokens_seen": 19411088912,
      "step": 24672
    },
    {
      "epoch": 2.6175472098451094,
      "grad_norm": 0.40284808794032606,
      "learning_rate": 4.439095151539293e-05,
      "loss": 1.5438,
      "num_input_tokens_seen": 19411875616,
      "step": 24673
    },
    {
      "epoch": 2.617653299384681,
      "grad_norm": 0.36717136125024397,
      "learning_rate": 4.439051285890828e-05,
      "loss": 1.5733,
      "num_input_tokens_seen": 19412662464,
      "step": 24674
    },
    {
      "epoch": 2.6177593889242523,
      "grad_norm": 0.46779104386862136,
      "learning_rate": 4.4390074187439226e-05,
      "loss": 1.5713,
      "num_input_tokens_seen": 19413449280,
      "step": 24675
    },
    {
      "epoch": 2.6178654784638233,
      "grad_norm": 0.35723130574682294,
      "learning_rate": 4.4389635500986095e-05,
      "loss": 1.5584,
      "num_input_tokens_seen": 19414236032,
      "step": 24676
    },
    {
      "epoch": 2.617971568003395,
      "grad_norm": 0.4419089095923165,
      "learning_rate": 4.438919679954921e-05,
      "loss": 1.62,
      "num_input_tokens_seen": 19415022736,
      "step": 24677
    },
    {
      "epoch": 2.6180776575429663,
      "grad_norm": 0.5114689275470903,
      "learning_rate": 4.438875808312893e-05,
      "loss": 1.5892,
      "num_input_tokens_seen": 19415809488,
      "step": 24678
    },
    {
      "epoch": 2.6181837470825378,
      "grad_norm": 0.45184816069111666,
      "learning_rate": 4.438831935172558e-05,
      "loss": 1.6545,
      "num_input_tokens_seen": 19416596208,
      "step": 24679
    },
    {
      "epoch": 2.6182898366221092,
      "grad_norm": 0.655973248101283,
      "learning_rate": 4.438788060533951e-05,
      "loss": 1.5708,
      "num_input_tokens_seen": 19417382928,
      "step": 24680
    },
    {
      "epoch": 2.6183959261616803,
      "grad_norm": 0.4167143572135512,
      "learning_rate": 4.438744184397106e-05,
      "loss": 1.5696,
      "num_input_tokens_seen": 19418169728,
      "step": 24681
    },
    {
      "epoch": 2.6185020157012517,
      "grad_norm": 0.8278461230748468,
      "learning_rate": 4.4387003067620546e-05,
      "loss": 1.5834,
      "num_input_tokens_seen": 19418956544,
      "step": 24682
    },
    {
      "epoch": 2.618608105240823,
      "grad_norm": 0.3948618633285003,
      "learning_rate": 4.4386564276288345e-05,
      "loss": 1.6188,
      "num_input_tokens_seen": 19419743264,
      "step": 24683
    },
    {
      "epoch": 2.6187141947803947,
      "grad_norm": 0.88961825812146,
      "learning_rate": 4.438612546997477e-05,
      "loss": 1.6507,
      "num_input_tokens_seen": 19420530160,
      "step": 24684
    },
    {
      "epoch": 2.618820284319966,
      "grad_norm": 0.35070740313995025,
      "learning_rate": 4.438568664868016e-05,
      "loss": 1.4875,
      "num_input_tokens_seen": 19421316976,
      "step": 24685
    },
    {
      "epoch": 2.618926373859537,
      "grad_norm": 1.336101926238124,
      "learning_rate": 4.438524781240486e-05,
      "loss": 1.7416,
      "num_input_tokens_seen": 19422103792,
      "step": 24686
    },
    {
      "epoch": 2.619032463399109,
      "grad_norm": 0.41747132891828137,
      "learning_rate": 4.4384808961149215e-05,
      "loss": 1.5325,
      "num_input_tokens_seen": 19422890592,
      "step": 24687
    },
    {
      "epoch": 2.61913855293868,
      "grad_norm": 0.7024113631188924,
      "learning_rate": 4.4384370094913565e-05,
      "loss": 1.4848,
      "num_input_tokens_seen": 19423677344,
      "step": 24688
    },
    {
      "epoch": 2.6192446424782516,
      "grad_norm": 0.7497039853380775,
      "learning_rate": 4.4383931213698225e-05,
      "loss": 1.5884,
      "num_input_tokens_seen": 19424464096,
      "step": 24689
    },
    {
      "epoch": 2.619350732017823,
      "grad_norm": 0.549143415347599,
      "learning_rate": 4.438349231750357e-05,
      "loss": 1.6233,
      "num_input_tokens_seen": 19425250848,
      "step": 24690
    },
    {
      "epoch": 2.6194568215573946,
      "grad_norm": 1.114981182768056,
      "learning_rate": 4.438305340632991e-05,
      "loss": 1.621,
      "num_input_tokens_seen": 19426037680,
      "step": 24691
    },
    {
      "epoch": 2.619562911096966,
      "grad_norm": 0.36325604227161173,
      "learning_rate": 4.43826144801776e-05,
      "loss": 1.5163,
      "num_input_tokens_seen": 19426824480,
      "step": 24692
    },
    {
      "epoch": 2.619669000636537,
      "grad_norm": 0.9216572044406518,
      "learning_rate": 4.4382175539046965e-05,
      "loss": 1.6791,
      "num_input_tokens_seen": 19427611152,
      "step": 24693
    },
    {
      "epoch": 2.6197750901761085,
      "grad_norm": 0.4391209952538158,
      "learning_rate": 4.438173658293836e-05,
      "loss": 1.5387,
      "num_input_tokens_seen": 19428397968,
      "step": 24694
    },
    {
      "epoch": 2.61988117971568,
      "grad_norm": 0.5475311701827652,
      "learning_rate": 4.438129761185212e-05,
      "loss": 1.6307,
      "num_input_tokens_seen": 19429184736,
      "step": 24695
    },
    {
      "epoch": 2.6199872692552515,
      "grad_norm": 0.5663109073199818,
      "learning_rate": 4.438085862578858e-05,
      "loss": 1.6462,
      "num_input_tokens_seen": 19429971568,
      "step": 24696
    },
    {
      "epoch": 2.620093358794823,
      "grad_norm": 0.37235727203418983,
      "learning_rate": 4.438041962474808e-05,
      "loss": 1.4892,
      "num_input_tokens_seen": 19430758464,
      "step": 24697
    },
    {
      "epoch": 2.620199448334394,
      "grad_norm": 0.4015402683582794,
      "learning_rate": 4.437998060873096e-05,
      "loss": 1.4883,
      "num_input_tokens_seen": 19431545232,
      "step": 24698
    },
    {
      "epoch": 2.6203055378739655,
      "grad_norm": 0.4485657787785909,
      "learning_rate": 4.437954157773756e-05,
      "loss": 1.5301,
      "num_input_tokens_seen": 19432332016,
      "step": 24699
    },
    {
      "epoch": 2.620411627413537,
      "grad_norm": 0.3869140349975023,
      "learning_rate": 4.437910253176822e-05,
      "loss": 1.6484,
      "num_input_tokens_seen": 19433118704,
      "step": 24700
    },
    {
      "epoch": 2.6205177169531084,
      "grad_norm": 0.3769334457271558,
      "learning_rate": 4.437866347082328e-05,
      "loss": 1.6223,
      "num_input_tokens_seen": 19433905392,
      "step": 24701
    },
    {
      "epoch": 2.62062380649268,
      "grad_norm": 0.39258322396069356,
      "learning_rate": 4.437822439490307e-05,
      "loss": 1.5579,
      "num_input_tokens_seen": 19434692208,
      "step": 24702
    },
    {
      "epoch": 2.6207298960322514,
      "grad_norm": 0.6372489392573827,
      "learning_rate": 4.4377785304007944e-05,
      "loss": 1.6501,
      "num_input_tokens_seen": 19435479024,
      "step": 24703
    },
    {
      "epoch": 2.620835985571823,
      "grad_norm": 0.37588768741616313,
      "learning_rate": 4.437734619813823e-05,
      "loss": 1.612,
      "num_input_tokens_seen": 19436265712,
      "step": 24704
    },
    {
      "epoch": 2.620942075111394,
      "grad_norm": 0.5496048718398042,
      "learning_rate": 4.4376907077294275e-05,
      "loss": 1.7072,
      "num_input_tokens_seen": 19437052528,
      "step": 24705
    },
    {
      "epoch": 2.6210481646509654,
      "grad_norm": 0.41300803613006143,
      "learning_rate": 4.437646794147641e-05,
      "loss": 1.4929,
      "num_input_tokens_seen": 19437839280,
      "step": 24706
    },
    {
      "epoch": 2.621154254190537,
      "grad_norm": 0.48828980464425875,
      "learning_rate": 4.437602879068499e-05,
      "loss": 1.6064,
      "num_input_tokens_seen": 19438626080,
      "step": 24707
    },
    {
      "epoch": 2.6212603437301083,
      "grad_norm": 0.6146211564805378,
      "learning_rate": 4.4375589624920335e-05,
      "loss": 1.5487,
      "num_input_tokens_seen": 19439412912,
      "step": 24708
    },
    {
      "epoch": 2.6213664332696798,
      "grad_norm": 0.4300850016308741,
      "learning_rate": 4.437515044418279e-05,
      "loss": 1.553,
      "num_input_tokens_seen": 19440199696,
      "step": 24709
    },
    {
      "epoch": 2.621472522809251,
      "grad_norm": 0.5466459230665378,
      "learning_rate": 4.43747112484727e-05,
      "loss": 1.5927,
      "num_input_tokens_seen": 19440986464,
      "step": 24710
    },
    {
      "epoch": 2.6215786123488223,
      "grad_norm": 0.374598780794482,
      "learning_rate": 4.4374272037790405e-05,
      "loss": 1.4782,
      "num_input_tokens_seen": 19441773248,
      "step": 24711
    },
    {
      "epoch": 2.6216847018883938,
      "grad_norm": 0.46342751017864214,
      "learning_rate": 4.437383281213623e-05,
      "loss": 1.5909,
      "num_input_tokens_seen": 19442560016,
      "step": 24712
    },
    {
      "epoch": 2.6217907914279652,
      "grad_norm": 0.5654848927062346,
      "learning_rate": 4.437339357151054e-05,
      "loss": 1.5423,
      "num_input_tokens_seen": 19443346784,
      "step": 24713
    },
    {
      "epoch": 2.6218968809675367,
      "grad_norm": 0.3628822435215426,
      "learning_rate": 4.437295431591365e-05,
      "loss": 1.59,
      "num_input_tokens_seen": 19444133568,
      "step": 24714
    },
    {
      "epoch": 2.6220029705071077,
      "grad_norm": 0.4551475481075822,
      "learning_rate": 4.437251504534592e-05,
      "loss": 1.6225,
      "num_input_tokens_seen": 19444920288,
      "step": 24715
    },
    {
      "epoch": 2.6221090600466797,
      "grad_norm": 0.389429780559434,
      "learning_rate": 4.4372075759807676e-05,
      "loss": 1.4724,
      "num_input_tokens_seen": 19445707040,
      "step": 24716
    },
    {
      "epoch": 2.6222151495862507,
      "grad_norm": 0.3873644212547097,
      "learning_rate": 4.437163645929925e-05,
      "loss": 1.5762,
      "num_input_tokens_seen": 19446493696,
      "step": 24717
    },
    {
      "epoch": 2.622321239125822,
      "grad_norm": 0.33815667217528644,
      "learning_rate": 4.4371197143820995e-05,
      "loss": 1.6121,
      "num_input_tokens_seen": 19447280416,
      "step": 24718
    },
    {
      "epoch": 2.6224273286653936,
      "grad_norm": 0.3786905077395179,
      "learning_rate": 4.4370757813373255e-05,
      "loss": 1.564,
      "num_input_tokens_seen": 19448067264,
      "step": 24719
    },
    {
      "epoch": 2.622533418204965,
      "grad_norm": 0.38752689528482553,
      "learning_rate": 4.4370318467956356e-05,
      "loss": 1.4565,
      "num_input_tokens_seen": 19448854128,
      "step": 24720
    },
    {
      "epoch": 2.6226395077445366,
      "grad_norm": 0.37595775054875796,
      "learning_rate": 4.436987910757064e-05,
      "loss": 1.5637,
      "num_input_tokens_seen": 19449640864,
      "step": 24721
    },
    {
      "epoch": 2.6227455972841076,
      "grad_norm": 0.44159511010905284,
      "learning_rate": 4.4369439732216455e-05,
      "loss": 1.601,
      "num_input_tokens_seen": 19450427600,
      "step": 24722
    },
    {
      "epoch": 2.622851686823679,
      "grad_norm": 0.385966332827601,
      "learning_rate": 4.436900034189414e-05,
      "loss": 1.5925,
      "num_input_tokens_seen": 19451214416,
      "step": 24723
    },
    {
      "epoch": 2.6229577763632506,
      "grad_norm": 0.40813643608887173,
      "learning_rate": 4.436856093660402e-05,
      "loss": 1.5657,
      "num_input_tokens_seen": 19452001072,
      "step": 24724
    },
    {
      "epoch": 2.623063865902822,
      "grad_norm": 0.40619542583537815,
      "learning_rate": 4.436812151634645e-05,
      "loss": 1.5116,
      "num_input_tokens_seen": 19452787824,
      "step": 24725
    },
    {
      "epoch": 2.6231699554423935,
      "grad_norm": 0.5186180967786574,
      "learning_rate": 4.4367682081121764e-05,
      "loss": 1.4881,
      "num_input_tokens_seen": 19453574640,
      "step": 24726
    },
    {
      "epoch": 2.6232760449819645,
      "grad_norm": 0.49845482733751384,
      "learning_rate": 4.43672426309303e-05,
      "loss": 1.6078,
      "num_input_tokens_seen": 19454361424,
      "step": 24727
    },
    {
      "epoch": 2.623382134521536,
      "grad_norm": 0.45469394371386274,
      "learning_rate": 4.4366803165772396e-05,
      "loss": 1.645,
      "num_input_tokens_seen": 19455148160,
      "step": 24728
    },
    {
      "epoch": 2.6234882240611075,
      "grad_norm": 0.6974906848461483,
      "learning_rate": 4.43663636856484e-05,
      "loss": 1.6445,
      "num_input_tokens_seen": 19455934896,
      "step": 24729
    },
    {
      "epoch": 2.623594313600679,
      "grad_norm": 0.3709067582886159,
      "learning_rate": 4.436592419055864e-05,
      "loss": 1.5261,
      "num_input_tokens_seen": 19456721696,
      "step": 24730
    },
    {
      "epoch": 2.6237004031402504,
      "grad_norm": 0.9008090061906974,
      "learning_rate": 4.436548468050347e-05,
      "loss": 1.6351,
      "num_input_tokens_seen": 19457508496,
      "step": 24731
    },
    {
      "epoch": 2.623806492679822,
      "grad_norm": 0.3700254925142755,
      "learning_rate": 4.436504515548322e-05,
      "loss": 1.5421,
      "num_input_tokens_seen": 19458295280,
      "step": 24732
    },
    {
      "epoch": 2.6239125822193934,
      "grad_norm": 0.9893685295935938,
      "learning_rate": 4.4364605615498225e-05,
      "loss": 1.6464,
      "num_input_tokens_seen": 19459082032,
      "step": 24733
    },
    {
      "epoch": 2.6240186717589644,
      "grad_norm": 0.5186952219233496,
      "learning_rate": 4.436416606054884e-05,
      "loss": 1.5733,
      "num_input_tokens_seen": 19459868784,
      "step": 24734
    },
    {
      "epoch": 2.624124761298536,
      "grad_norm": 1.9120592445832834,
      "learning_rate": 4.4363726490635386e-05,
      "loss": 1.5693,
      "num_input_tokens_seen": 19460655520,
      "step": 24735
    },
    {
      "epoch": 2.6242308508381074,
      "grad_norm": 0.506052245830724,
      "learning_rate": 4.436328690575822e-05,
      "loss": 1.6805,
      "num_input_tokens_seen": 19461442384,
      "step": 24736
    },
    {
      "epoch": 2.624336940377679,
      "grad_norm": 6.85694217882997,
      "learning_rate": 4.436284730591767e-05,
      "loss": 1.6172,
      "num_input_tokens_seen": 19462229120,
      "step": 24737
    },
    {
      "epoch": 2.6244430299172503,
      "grad_norm": 0.6174205712413132,
      "learning_rate": 4.436240769111408e-05,
      "loss": 1.6386,
      "num_input_tokens_seen": 19463015936,
      "step": 24738
    },
    {
      "epoch": 2.6245491194568213,
      "grad_norm": 3.228737408821432,
      "learning_rate": 4.436196806134779e-05,
      "loss": 1.5003,
      "num_input_tokens_seen": 19463802656,
      "step": 24739
    },
    {
      "epoch": 2.624655208996393,
      "grad_norm": 0.9128164335181433,
      "learning_rate": 4.436152841661915e-05,
      "loss": 1.54,
      "num_input_tokens_seen": 19464589440,
      "step": 24740
    },
    {
      "epoch": 2.6247612985359643,
      "grad_norm": 1.1034328834469471,
      "learning_rate": 4.436108875692847e-05,
      "loss": 1.7226,
      "num_input_tokens_seen": 19465376272,
      "step": 24741
    },
    {
      "epoch": 2.6248673880755358,
      "grad_norm": 0.6720770643058259,
      "learning_rate": 4.4360649082276116e-05,
      "loss": 1.6838,
      "num_input_tokens_seen": 19466163120,
      "step": 24742
    },
    {
      "epoch": 2.6249734776151072,
      "grad_norm": 0.9009599819652061,
      "learning_rate": 4.4360209392662425e-05,
      "loss": 1.6177,
      "num_input_tokens_seen": 19466949888,
      "step": 24743
    },
    {
      "epoch": 2.6250795671546783,
      "grad_norm": 0.40862056122010937,
      "learning_rate": 4.4359769688087727e-05,
      "loss": 1.6844,
      "num_input_tokens_seen": 19467736624,
      "step": 24744
    },
    {
      "epoch": 2.62518565669425,
      "grad_norm": 1.1738664033897226,
      "learning_rate": 4.435932996855237e-05,
      "loss": 1.5327,
      "num_input_tokens_seen": 19468523296,
      "step": 24745
    },
    {
      "epoch": 2.625291746233821,
      "grad_norm": 1.5502063091637213,
      "learning_rate": 4.43588902340567e-05,
      "loss": 1.6436,
      "num_input_tokens_seen": 19469310064,
      "step": 24746
    },
    {
      "epoch": 2.6253978357733927,
      "grad_norm": 0.7954176327310577,
      "learning_rate": 4.4358450484601036e-05,
      "loss": 1.6685,
      "num_input_tokens_seen": 19470096848,
      "step": 24747
    },
    {
      "epoch": 2.625503925312964,
      "grad_norm": 0.5043161672544112,
      "learning_rate": 4.435801072018573e-05,
      "loss": 1.717,
      "num_input_tokens_seen": 19470883600,
      "step": 24748
    },
    {
      "epoch": 2.6256100148525356,
      "grad_norm": 0.7718603180393877,
      "learning_rate": 4.435757094081112e-05,
      "loss": 1.5758,
      "num_input_tokens_seen": 19471670352,
      "step": 24749
    },
    {
      "epoch": 2.625716104392107,
      "grad_norm": 0.6299596370391833,
      "learning_rate": 4.435713114647755e-05,
      "loss": 1.4979,
      "num_input_tokens_seen": 19472457088,
      "step": 24750
    },
    {
      "epoch": 2.625822193931678,
      "grad_norm": 1.7818092902003921,
      "learning_rate": 4.4356691337185355e-05,
      "loss": 1.5989,
      "num_input_tokens_seen": 19473243824,
      "step": 24751
    },
    {
      "epoch": 2.6259282834712496,
      "grad_norm": 0.44265152234326166,
      "learning_rate": 4.4356251512934876e-05,
      "loss": 1.5207,
      "num_input_tokens_seen": 19474030576,
      "step": 24752
    },
    {
      "epoch": 2.626034373010821,
      "grad_norm": 0.6296386033373437,
      "learning_rate": 4.435581167372645e-05,
      "loss": 1.5929,
      "num_input_tokens_seen": 19474817392,
      "step": 24753
    },
    {
      "epoch": 2.6261404625503926,
      "grad_norm": 0.44613787655937776,
      "learning_rate": 4.435537181956043e-05,
      "loss": 1.5,
      "num_input_tokens_seen": 19475604160,
      "step": 24754
    },
    {
      "epoch": 2.626246552089964,
      "grad_norm": 0.6070454462064399,
      "learning_rate": 4.4354931950437146e-05,
      "loss": 1.5802,
      "num_input_tokens_seen": 19476390976,
      "step": 24755
    },
    {
      "epoch": 2.626352641629535,
      "grad_norm": 0.39479871775949776,
      "learning_rate": 4.4354492066356936e-05,
      "loss": 1.6093,
      "num_input_tokens_seen": 19477177712,
      "step": 24756
    },
    {
      "epoch": 2.626458731169107,
      "grad_norm": 0.4419868072447635,
      "learning_rate": 4.435405216732014e-05,
      "loss": 1.487,
      "num_input_tokens_seen": 19477964528,
      "step": 24757
    },
    {
      "epoch": 2.626564820708678,
      "grad_norm": 0.4128216600483702,
      "learning_rate": 4.4353612253327105e-05,
      "loss": 1.6477,
      "num_input_tokens_seen": 19478751264,
      "step": 24758
    },
    {
      "epoch": 2.6266709102482495,
      "grad_norm": 0.40270140907858404,
      "learning_rate": 4.435317232437817e-05,
      "loss": 1.7149,
      "num_input_tokens_seen": 19479538000,
      "step": 24759
    },
    {
      "epoch": 2.626776999787821,
      "grad_norm": 0.4384435458599682,
      "learning_rate": 4.435273238047366e-05,
      "loss": 1.7519,
      "num_input_tokens_seen": 19480324768,
      "step": 24760
    },
    {
      "epoch": 2.6268830893273925,
      "grad_norm": 0.3665278217754405,
      "learning_rate": 4.435229242161393e-05,
      "loss": 1.6158,
      "num_input_tokens_seen": 19481111488,
      "step": 24761
    },
    {
      "epoch": 2.626989178866964,
      "grad_norm": 0.42764706551903564,
      "learning_rate": 4.435185244779932e-05,
      "loss": 1.611,
      "num_input_tokens_seen": 19481898224,
      "step": 24762
    },
    {
      "epoch": 2.627095268406535,
      "grad_norm": 0.5497645788327599,
      "learning_rate": 4.435141245903017e-05,
      "loss": 1.5275,
      "num_input_tokens_seen": 19482685008,
      "step": 24763
    },
    {
      "epoch": 2.6272013579461064,
      "grad_norm": 0.3903872030113191,
      "learning_rate": 4.4350972455306805e-05,
      "loss": 1.6316,
      "num_input_tokens_seen": 19483471712,
      "step": 24764
    },
    {
      "epoch": 2.627307447485678,
      "grad_norm": 0.5241020035883897,
      "learning_rate": 4.435053243662958e-05,
      "loss": 1.7065,
      "num_input_tokens_seen": 19484258464,
      "step": 24765
    },
    {
      "epoch": 2.6274135370252494,
      "grad_norm": 0.45056657441915815,
      "learning_rate": 4.4350092402998834e-05,
      "loss": 1.585,
      "num_input_tokens_seen": 19485045200,
      "step": 24766
    },
    {
      "epoch": 2.627519626564821,
      "grad_norm": 0.4035996915552999,
      "learning_rate": 4.4349652354414904e-05,
      "loss": 1.6263,
      "num_input_tokens_seen": 19485832000,
      "step": 24767
    },
    {
      "epoch": 2.627625716104392,
      "grad_norm": 1.0147097846112554,
      "learning_rate": 4.4349212290878126e-05,
      "loss": 1.623,
      "num_input_tokens_seen": 19486618768,
      "step": 24768
    },
    {
      "epoch": 2.6277318056439634,
      "grad_norm": 0.5211891209038613,
      "learning_rate": 4.434877221238886e-05,
      "loss": 1.6767,
      "num_input_tokens_seen": 19487405504,
      "step": 24769
    },
    {
      "epoch": 2.627837895183535,
      "grad_norm": 1.0956664609678406,
      "learning_rate": 4.434833211894741e-05,
      "loss": 1.5779,
      "num_input_tokens_seen": 19488192368,
      "step": 24770
    },
    {
      "epoch": 2.6279439847231063,
      "grad_norm": 0.4763797197207315,
      "learning_rate": 4.4347892010554147e-05,
      "loss": 1.7302,
      "num_input_tokens_seen": 19488979152,
      "step": 24771
    },
    {
      "epoch": 2.628050074262678,
      "grad_norm": 1.1360908033753976,
      "learning_rate": 4.43474518872094e-05,
      "loss": 1.5692,
      "num_input_tokens_seen": 19489765920,
      "step": 24772
    },
    {
      "epoch": 2.6281561638022493,
      "grad_norm": 0.45397199490418694,
      "learning_rate": 4.4347011748913515e-05,
      "loss": 1.6126,
      "num_input_tokens_seen": 19490552592,
      "step": 24773
    },
    {
      "epoch": 2.6282622533418207,
      "grad_norm": 0.6007283107232925,
      "learning_rate": 4.434657159566682e-05,
      "loss": 1.5892,
      "num_input_tokens_seen": 19491339408,
      "step": 24774
    },
    {
      "epoch": 2.6283683428813918,
      "grad_norm": 0.5979654536837482,
      "learning_rate": 4.4346131427469655e-05,
      "loss": 1.6215,
      "num_input_tokens_seen": 19492126112,
      "step": 24775
    },
    {
      "epoch": 2.6284744324209632,
      "grad_norm": 0.813671460557882,
      "learning_rate": 4.434569124432238e-05,
      "loss": 1.5864,
      "num_input_tokens_seen": 19492912816,
      "step": 24776
    },
    {
      "epoch": 2.6285805219605347,
      "grad_norm": 0.5066427302823132,
      "learning_rate": 4.4345251046225315e-05,
      "loss": 1.5779,
      "num_input_tokens_seen": 19493699552,
      "step": 24777
    },
    {
      "epoch": 2.628686611500106,
      "grad_norm": 0.6850057527628887,
      "learning_rate": 4.434481083317881e-05,
      "loss": 1.7717,
      "num_input_tokens_seen": 19494486336,
      "step": 24778
    },
    {
      "epoch": 2.6287927010396777,
      "grad_norm": 0.41920098509447645,
      "learning_rate": 4.434437060518321e-05,
      "loss": 1.6051,
      "num_input_tokens_seen": 19495273024,
      "step": 24779
    },
    {
      "epoch": 2.6288987905792487,
      "grad_norm": 0.5452926922991904,
      "learning_rate": 4.434393036223884e-05,
      "loss": 1.5525,
      "num_input_tokens_seen": 19496059824,
      "step": 24780
    },
    {
      "epoch": 2.62900488011882,
      "grad_norm": 0.4529372405723791,
      "learning_rate": 4.434349010434605e-05,
      "loss": 1.5445,
      "num_input_tokens_seen": 19496846592,
      "step": 24781
    },
    {
      "epoch": 2.6291109696583916,
      "grad_norm": 0.3959341770320769,
      "learning_rate": 4.434304983150517e-05,
      "loss": 1.6044,
      "num_input_tokens_seen": 19497633280,
      "step": 24782
    },
    {
      "epoch": 2.629217059197963,
      "grad_norm": 0.5449579021561709,
      "learning_rate": 4.4342609543716564e-05,
      "loss": 1.6358,
      "num_input_tokens_seen": 19498419968,
      "step": 24783
    },
    {
      "epoch": 2.6293231487375346,
      "grad_norm": 0.37786185389510574,
      "learning_rate": 4.434216924098055e-05,
      "loss": 1.6769,
      "num_input_tokens_seen": 19499206848,
      "step": 24784
    },
    {
      "epoch": 2.6294292382771056,
      "grad_norm": 0.4594873485190252,
      "learning_rate": 4.434172892329747e-05,
      "loss": 1.7068,
      "num_input_tokens_seen": 19499993712,
      "step": 24785
    },
    {
      "epoch": 2.6295353278166775,
      "grad_norm": 0.48944795556389636,
      "learning_rate": 4.4341288590667674e-05,
      "loss": 1.663,
      "num_input_tokens_seen": 19500780416,
      "step": 24786
    },
    {
      "epoch": 2.6296414173562486,
      "grad_norm": 0.382925832392872,
      "learning_rate": 4.43408482430915e-05,
      "loss": 1.7162,
      "num_input_tokens_seen": 19501567184,
      "step": 24787
    },
    {
      "epoch": 2.62974750689582,
      "grad_norm": 0.4621884829419472,
      "learning_rate": 4.4340407880569285e-05,
      "loss": 1.5077,
      "num_input_tokens_seen": 19502354000,
      "step": 24788
    },
    {
      "epoch": 2.6298535964353915,
      "grad_norm": 0.42374081520708545,
      "learning_rate": 4.433996750310137e-05,
      "loss": 1.5681,
      "num_input_tokens_seen": 19503140768,
      "step": 24789
    },
    {
      "epoch": 2.629959685974963,
      "grad_norm": 0.4830876182152754,
      "learning_rate": 4.4339527110688096e-05,
      "loss": 1.6236,
      "num_input_tokens_seen": 19503927536,
      "step": 24790
    },
    {
      "epoch": 2.6300657755145345,
      "grad_norm": 0.3872719605490644,
      "learning_rate": 4.43390867033298e-05,
      "loss": 1.5865,
      "num_input_tokens_seen": 19504714336,
      "step": 24791
    },
    {
      "epoch": 2.6301718650541055,
      "grad_norm": 0.34518215226355475,
      "learning_rate": 4.4338646281026824e-05,
      "loss": 1.4863,
      "num_input_tokens_seen": 19505501120,
      "step": 24792
    },
    {
      "epoch": 2.630277954593677,
      "grad_norm": 0.5259112913901091,
      "learning_rate": 4.433820584377951e-05,
      "loss": 1.6336,
      "num_input_tokens_seen": 19506287888,
      "step": 24793
    },
    {
      "epoch": 2.6303840441332484,
      "grad_norm": 0.3793691269551447,
      "learning_rate": 4.43377653915882e-05,
      "loss": 1.557,
      "num_input_tokens_seen": 19507074704,
      "step": 24794
    },
    {
      "epoch": 2.63049013367282,
      "grad_norm": 0.538481338238885,
      "learning_rate": 4.433732492445324e-05,
      "loss": 1.6531,
      "num_input_tokens_seen": 19507861536,
      "step": 24795
    },
    {
      "epoch": 2.6305962232123914,
      "grad_norm": 0.4099956869691228,
      "learning_rate": 4.4336884442374946e-05,
      "loss": 1.5281,
      "num_input_tokens_seen": 19508648288,
      "step": 24796
    },
    {
      "epoch": 2.6307023127519624,
      "grad_norm": 0.4640782146275381,
      "learning_rate": 4.433644394535369e-05,
      "loss": 1.6517,
      "num_input_tokens_seen": 19509435120,
      "step": 24797
    },
    {
      "epoch": 2.630808402291534,
      "grad_norm": 0.5011506280831152,
      "learning_rate": 4.433600343338979e-05,
      "loss": 1.5634,
      "num_input_tokens_seen": 19510221920,
      "step": 24798
    },
    {
      "epoch": 2.6309144918311054,
      "grad_norm": 0.38334904245675,
      "learning_rate": 4.4335562906483593e-05,
      "loss": 1.5297,
      "num_input_tokens_seen": 19511008624,
      "step": 24799
    },
    {
      "epoch": 2.631020581370677,
      "grad_norm": 0.5896026333727384,
      "learning_rate": 4.433512236463545e-05,
      "loss": 1.4674,
      "num_input_tokens_seen": 19511795344,
      "step": 24800
    },
    {
      "epoch": 2.6311266709102483,
      "grad_norm": 0.443300685735099,
      "learning_rate": 4.433468180784568e-05,
      "loss": 1.7213,
      "num_input_tokens_seen": 19512582080,
      "step": 24801
    },
    {
      "epoch": 2.63123276044982,
      "grad_norm": 0.40103282448257344,
      "learning_rate": 4.433424123611464e-05,
      "loss": 1.4941,
      "num_input_tokens_seen": 19513368864,
      "step": 24802
    },
    {
      "epoch": 2.6313388499893913,
      "grad_norm": 0.621107050237737,
      "learning_rate": 4.433380064944267e-05,
      "loss": 1.7262,
      "num_input_tokens_seen": 19514155584,
      "step": 24803
    },
    {
      "epoch": 2.6314449395289623,
      "grad_norm": 0.4069182903048694,
      "learning_rate": 4.4333360047830096e-05,
      "loss": 1.5836,
      "num_input_tokens_seen": 19514942448,
      "step": 24804
    },
    {
      "epoch": 2.6315510290685338,
      "grad_norm": 0.7301700971827623,
      "learning_rate": 4.4332919431277276e-05,
      "loss": 1.552,
      "num_input_tokens_seen": 19515729232,
      "step": 24805
    },
    {
      "epoch": 2.6316571186081053,
      "grad_norm": 0.5265071769040996,
      "learning_rate": 4.4332478799784544e-05,
      "loss": 1.7292,
      "num_input_tokens_seen": 19516515952,
      "step": 24806
    },
    {
      "epoch": 2.6317632081476767,
      "grad_norm": 0.417538112717075,
      "learning_rate": 4.433203815335224e-05,
      "loss": 1.5518,
      "num_input_tokens_seen": 19517302704,
      "step": 24807
    },
    {
      "epoch": 2.631869297687248,
      "grad_norm": 0.8953301432486193,
      "learning_rate": 4.4331597491980696e-05,
      "loss": 1.7341,
      "num_input_tokens_seen": 19518089536,
      "step": 24808
    },
    {
      "epoch": 2.6319753872268192,
      "grad_norm": 0.4479386670103166,
      "learning_rate": 4.433115681567027e-05,
      "loss": 1.6799,
      "num_input_tokens_seen": 19518876352,
      "step": 24809
    },
    {
      "epoch": 2.6320814767663907,
      "grad_norm": 0.8204284443565696,
      "learning_rate": 4.433071612442129e-05,
      "loss": 1.6938,
      "num_input_tokens_seen": 19519663152,
      "step": 24810
    },
    {
      "epoch": 2.632187566305962,
      "grad_norm": 0.5390691885382779,
      "learning_rate": 4.4330275418234095e-05,
      "loss": 1.562,
      "num_input_tokens_seen": 19520449952,
      "step": 24811
    },
    {
      "epoch": 2.6322936558455337,
      "grad_norm": 0.3938231752520407,
      "learning_rate": 4.4329834697109034e-05,
      "loss": 1.563,
      "num_input_tokens_seen": 19521236768,
      "step": 24812
    },
    {
      "epoch": 2.632399745385105,
      "grad_norm": 0.6190548812750416,
      "learning_rate": 4.432939396104645e-05,
      "loss": 1.7474,
      "num_input_tokens_seen": 19522023600,
      "step": 24813
    },
    {
      "epoch": 2.632505834924676,
      "grad_norm": 0.48997001387133204,
      "learning_rate": 4.432895321004667e-05,
      "loss": 1.6069,
      "num_input_tokens_seen": 19522810320,
      "step": 24814
    },
    {
      "epoch": 2.632611924464248,
      "grad_norm": 0.46373588760237355,
      "learning_rate": 4.432851244411004e-05,
      "loss": 1.6721,
      "num_input_tokens_seen": 19523597104,
      "step": 24815
    },
    {
      "epoch": 2.632718014003819,
      "grad_norm": 0.4624571069772323,
      "learning_rate": 4.4328071663236915e-05,
      "loss": 1.5282,
      "num_input_tokens_seen": 19524383872,
      "step": 24816
    },
    {
      "epoch": 2.6328241035433906,
      "grad_norm": 0.5435558492432278,
      "learning_rate": 4.432763086742761e-05,
      "loss": 1.6105,
      "num_input_tokens_seen": 19525170672,
      "step": 24817
    },
    {
      "epoch": 2.632930193082962,
      "grad_norm": 0.42084490847129236,
      "learning_rate": 4.432719005668248e-05,
      "loss": 1.4754,
      "num_input_tokens_seen": 19525957568,
      "step": 24818
    },
    {
      "epoch": 2.6330362826225335,
      "grad_norm": 0.623305565054176,
      "learning_rate": 4.4326749231001874e-05,
      "loss": 1.6182,
      "num_input_tokens_seen": 19526744336,
      "step": 24819
    },
    {
      "epoch": 2.633142372162105,
      "grad_norm": 0.37971413792011005,
      "learning_rate": 4.432630839038612e-05,
      "loss": 1.5538,
      "num_input_tokens_seen": 19527531104,
      "step": 24820
    },
    {
      "epoch": 2.633248461701676,
      "grad_norm": 0.47127803679589964,
      "learning_rate": 4.4325867534835554e-05,
      "loss": 1.6653,
      "num_input_tokens_seen": 19528317792,
      "step": 24821
    },
    {
      "epoch": 2.6333545512412475,
      "grad_norm": 0.4374743723223999,
      "learning_rate": 4.432542666435053e-05,
      "loss": 1.641,
      "num_input_tokens_seen": 19529104464,
      "step": 24822
    },
    {
      "epoch": 2.633460640780819,
      "grad_norm": 0.38565751901026346,
      "learning_rate": 4.432498577893138e-05,
      "loss": 1.5583,
      "num_input_tokens_seen": 19529891264,
      "step": 24823
    },
    {
      "epoch": 2.6335667303203905,
      "grad_norm": 0.37770199975378016,
      "learning_rate": 4.432454487857845e-05,
      "loss": 1.6289,
      "num_input_tokens_seen": 19530678096,
      "step": 24824
    },
    {
      "epoch": 2.633672819859962,
      "grad_norm": 0.42568409696241677,
      "learning_rate": 4.432410396329209e-05,
      "loss": 1.7628,
      "num_input_tokens_seen": 19531464816,
      "step": 24825
    },
    {
      "epoch": 2.633778909399533,
      "grad_norm": 0.4550272193372276,
      "learning_rate": 4.4323663033072614e-05,
      "loss": 1.617,
      "num_input_tokens_seen": 19532251632,
      "step": 24826
    },
    {
      "epoch": 2.6338849989391044,
      "grad_norm": 0.3725574855093633,
      "learning_rate": 4.432322208792039e-05,
      "loss": 1.6186,
      "num_input_tokens_seen": 19533038416,
      "step": 24827
    },
    {
      "epoch": 2.633991088478676,
      "grad_norm": 0.36841406650495917,
      "learning_rate": 4.432278112783574e-05,
      "loss": 1.5588,
      "num_input_tokens_seen": 19533825136,
      "step": 24828
    },
    {
      "epoch": 2.6340971780182474,
      "grad_norm": 0.48153271797461294,
      "learning_rate": 4.432234015281901e-05,
      "loss": 1.6844,
      "num_input_tokens_seen": 19534611936,
      "step": 24829
    },
    {
      "epoch": 2.634203267557819,
      "grad_norm": 0.39977318577062093,
      "learning_rate": 4.432189916287055e-05,
      "loss": 1.6847,
      "num_input_tokens_seen": 19535398576,
      "step": 24830
    },
    {
      "epoch": 2.6343093570973903,
      "grad_norm": 0.33146003616972036,
      "learning_rate": 4.4321458157990683e-05,
      "loss": 1.5422,
      "num_input_tokens_seen": 19536185232,
      "step": 24831
    },
    {
      "epoch": 2.634415446636962,
      "grad_norm": 0.4482428623202966,
      "learning_rate": 4.432101713817977e-05,
      "loss": 1.6926,
      "num_input_tokens_seen": 19536971920,
      "step": 24832
    },
    {
      "epoch": 2.634521536176533,
      "grad_norm": 0.42273192382639935,
      "learning_rate": 4.432057610343814e-05,
      "loss": 1.7718,
      "num_input_tokens_seen": 19537758640,
      "step": 24833
    },
    {
      "epoch": 2.6346276257161043,
      "grad_norm": 0.3668924700358129,
      "learning_rate": 4.432013505376613e-05,
      "loss": 1.5063,
      "num_input_tokens_seen": 19538545472,
      "step": 24834
    },
    {
      "epoch": 2.634733715255676,
      "grad_norm": 0.320188904406734,
      "learning_rate": 4.431969398916409e-05,
      "loss": 1.4345,
      "num_input_tokens_seen": 19539332224,
      "step": 24835
    },
    {
      "epoch": 2.6348398047952473,
      "grad_norm": 0.3546277668285159,
      "learning_rate": 4.431925290963236e-05,
      "loss": 1.6029,
      "num_input_tokens_seen": 19540118976,
      "step": 24836
    },
    {
      "epoch": 2.6349458943348187,
      "grad_norm": 0.376475389991709,
      "learning_rate": 4.431881181517127e-05,
      "loss": 1.5046,
      "num_input_tokens_seen": 19540905712,
      "step": 24837
    },
    {
      "epoch": 2.6350519838743898,
      "grad_norm": 0.34160252099650956,
      "learning_rate": 4.4318370705781174e-05,
      "loss": 1.4821,
      "num_input_tokens_seen": 19541692528,
      "step": 24838
    },
    {
      "epoch": 2.6351580734139612,
      "grad_norm": 0.4228290394010279,
      "learning_rate": 4.431792958146241e-05,
      "loss": 1.527,
      "num_input_tokens_seen": 19542479312,
      "step": 24839
    },
    {
      "epoch": 2.6352641629535327,
      "grad_norm": 0.42657324588705586,
      "learning_rate": 4.431748844221531e-05,
      "loss": 1.5265,
      "num_input_tokens_seen": 19543266192,
      "step": 24840
    },
    {
      "epoch": 2.635370252493104,
      "grad_norm": 0.4007207051885688,
      "learning_rate": 4.431704728804024e-05,
      "loss": 1.6291,
      "num_input_tokens_seen": 19544052928,
      "step": 24841
    },
    {
      "epoch": 2.6354763420326757,
      "grad_norm": 0.4439898080386454,
      "learning_rate": 4.43166061189375e-05,
      "loss": 1.5961,
      "num_input_tokens_seen": 19544839776,
      "step": 24842
    },
    {
      "epoch": 2.635582431572247,
      "grad_norm": 0.320402836167324,
      "learning_rate": 4.431616493490747e-05,
      "loss": 1.5394,
      "num_input_tokens_seen": 19545626528,
      "step": 24843
    },
    {
      "epoch": 2.6356885211118186,
      "grad_norm": 0.474231581483607,
      "learning_rate": 4.431572373595047e-05,
      "loss": 1.6233,
      "num_input_tokens_seen": 19546413328,
      "step": 24844
    },
    {
      "epoch": 2.6357946106513896,
      "grad_norm": 0.42399208157170554,
      "learning_rate": 4.4315282522066836e-05,
      "loss": 1.5659,
      "num_input_tokens_seen": 19547199968,
      "step": 24845
    },
    {
      "epoch": 2.635900700190961,
      "grad_norm": 0.3625106388129916,
      "learning_rate": 4.4314841293256925e-05,
      "loss": 1.6311,
      "num_input_tokens_seen": 19547986672,
      "step": 24846
    },
    {
      "epoch": 2.6360067897305326,
      "grad_norm": 0.562650640515977,
      "learning_rate": 4.4314400049521074e-05,
      "loss": 1.5345,
      "num_input_tokens_seen": 19548773392,
      "step": 24847
    },
    {
      "epoch": 2.636112879270104,
      "grad_norm": 0.4522425743119026,
      "learning_rate": 4.4313958790859614e-05,
      "loss": 1.7199,
      "num_input_tokens_seen": 19549560128,
      "step": 24848
    },
    {
      "epoch": 2.6362189688096755,
      "grad_norm": 0.4883274673222282,
      "learning_rate": 4.43135175172729e-05,
      "loss": 1.6332,
      "num_input_tokens_seen": 19550346880,
      "step": 24849
    },
    {
      "epoch": 2.6363250583492466,
      "grad_norm": 0.5519756917651837,
      "learning_rate": 4.4313076228761267e-05,
      "loss": 1.6494,
      "num_input_tokens_seen": 19551133712,
      "step": 24850
    },
    {
      "epoch": 2.636431147888818,
      "grad_norm": 0.46386204628829664,
      "learning_rate": 4.4312634925325056e-05,
      "loss": 1.5688,
      "num_input_tokens_seen": 19551920432,
      "step": 24851
    },
    {
      "epoch": 2.6365372374283895,
      "grad_norm": 0.48040537497258096,
      "learning_rate": 4.4312193606964606e-05,
      "loss": 1.4444,
      "num_input_tokens_seen": 19552707360,
      "step": 24852
    },
    {
      "epoch": 2.636643326967961,
      "grad_norm": 0.42756948172238707,
      "learning_rate": 4.431175227368025e-05,
      "loss": 1.5567,
      "num_input_tokens_seen": 19553494128,
      "step": 24853
    },
    {
      "epoch": 2.6367494165075325,
      "grad_norm": 0.41795530448237544,
      "learning_rate": 4.431131092547235e-05,
      "loss": 1.6325,
      "num_input_tokens_seen": 19554280928,
      "step": 24854
    },
    {
      "epoch": 2.6368555060471035,
      "grad_norm": 0.39969138058377723,
      "learning_rate": 4.431086956234123e-05,
      "loss": 1.5703,
      "num_input_tokens_seen": 19555067680,
      "step": 24855
    },
    {
      "epoch": 2.6369615955866754,
      "grad_norm": 0.4088279165690676,
      "learning_rate": 4.431042818428724e-05,
      "loss": 1.5928,
      "num_input_tokens_seen": 19555854480,
      "step": 24856
    },
    {
      "epoch": 2.6370676851262465,
      "grad_norm": 0.4011950784429096,
      "learning_rate": 4.430998679131072e-05,
      "loss": 1.6145,
      "num_input_tokens_seen": 19556641216,
      "step": 24857
    },
    {
      "epoch": 2.637173774665818,
      "grad_norm": 0.3634737752678411,
      "learning_rate": 4.4309545383412e-05,
      "loss": 1.6326,
      "num_input_tokens_seen": 19557427984,
      "step": 24858
    },
    {
      "epoch": 2.6372798642053894,
      "grad_norm": 0.3627057318557757,
      "learning_rate": 4.4309103960591436e-05,
      "loss": 1.579,
      "num_input_tokens_seen": 19558214784,
      "step": 24859
    },
    {
      "epoch": 2.637385953744961,
      "grad_norm": 0.41171256616234725,
      "learning_rate": 4.430866252284936e-05,
      "loss": 1.5033,
      "num_input_tokens_seen": 19559001616,
      "step": 24860
    },
    {
      "epoch": 2.6374920432845324,
      "grad_norm": 0.39028215589751,
      "learning_rate": 4.430822107018612e-05,
      "loss": 1.5564,
      "num_input_tokens_seen": 19559788304,
      "step": 24861
    },
    {
      "epoch": 2.6375981328241034,
      "grad_norm": 0.3805685084025088,
      "learning_rate": 4.430777960260205e-05,
      "loss": 1.5539,
      "num_input_tokens_seen": 19560575056,
      "step": 24862
    },
    {
      "epoch": 2.637704222363675,
      "grad_norm": 0.39185567118238307,
      "learning_rate": 4.43073381200975e-05,
      "loss": 1.6883,
      "num_input_tokens_seen": 19561361792,
      "step": 24863
    },
    {
      "epoch": 2.6378103119032463,
      "grad_norm": 0.40616072574919115,
      "learning_rate": 4.43068966226728e-05,
      "loss": 1.6335,
      "num_input_tokens_seen": 19562148576,
      "step": 24864
    },
    {
      "epoch": 2.637916401442818,
      "grad_norm": 0.3678440361882211,
      "learning_rate": 4.43064551103283e-05,
      "loss": 1.4974,
      "num_input_tokens_seen": 19562935296,
      "step": 24865
    },
    {
      "epoch": 2.6380224909823893,
      "grad_norm": 0.41487072451658935,
      "learning_rate": 4.430601358306434e-05,
      "loss": 1.7547,
      "num_input_tokens_seen": 19563721968,
      "step": 24866
    },
    {
      "epoch": 2.6381285805219603,
      "grad_norm": 0.4733913978303005,
      "learning_rate": 4.4305572040881254e-05,
      "loss": 1.6311,
      "num_input_tokens_seen": 19564508640,
      "step": 24867
    },
    {
      "epoch": 2.638234670061532,
      "grad_norm": 0.3453209752956884,
      "learning_rate": 4.430513048377939e-05,
      "loss": 1.5867,
      "num_input_tokens_seen": 19565295520,
      "step": 24868
    },
    {
      "epoch": 2.6383407596011033,
      "grad_norm": 0.5273309250836404,
      "learning_rate": 4.430468891175908e-05,
      "loss": 1.6608,
      "num_input_tokens_seen": 19566082272,
      "step": 24869
    },
    {
      "epoch": 2.6384468491406747,
      "grad_norm": 0.5375230171359292,
      "learning_rate": 4.4304247324820686e-05,
      "loss": 1.647,
      "num_input_tokens_seen": 19566868992,
      "step": 24870
    },
    {
      "epoch": 2.638552938680246,
      "grad_norm": 0.503255048124679,
      "learning_rate": 4.430380572296453e-05,
      "loss": 1.6149,
      "num_input_tokens_seen": 19567655760,
      "step": 24871
    },
    {
      "epoch": 2.6386590282198177,
      "grad_norm": 0.4355355607243252,
      "learning_rate": 4.430336410619096e-05,
      "loss": 1.5571,
      "num_input_tokens_seen": 19568442528,
      "step": 24872
    },
    {
      "epoch": 2.638765117759389,
      "grad_norm": 0.5237615818072394,
      "learning_rate": 4.430292247450032e-05,
      "loss": 1.5087,
      "num_input_tokens_seen": 19569229328,
      "step": 24873
    },
    {
      "epoch": 2.63887120729896,
      "grad_norm": 0.4030317646232599,
      "learning_rate": 4.430248082789295e-05,
      "loss": 1.6002,
      "num_input_tokens_seen": 19570016096,
      "step": 24874
    },
    {
      "epoch": 2.6389772968385317,
      "grad_norm": 0.43248581831587735,
      "learning_rate": 4.430203916636918e-05,
      "loss": 1.7498,
      "num_input_tokens_seen": 19570802848,
      "step": 24875
    },
    {
      "epoch": 2.639083386378103,
      "grad_norm": 0.38757536264430476,
      "learning_rate": 4.430159748992936e-05,
      "loss": 1.5474,
      "num_input_tokens_seen": 19571589616,
      "step": 24876
    },
    {
      "epoch": 2.6391894759176746,
      "grad_norm": 0.4861782162188552,
      "learning_rate": 4.430115579857383e-05,
      "loss": 1.563,
      "num_input_tokens_seen": 19572376336,
      "step": 24877
    },
    {
      "epoch": 2.639295565457246,
      "grad_norm": 0.4240324663074576,
      "learning_rate": 4.430071409230294e-05,
      "loss": 1.5324,
      "num_input_tokens_seen": 19573163104,
      "step": 24878
    },
    {
      "epoch": 2.639401654996817,
      "grad_norm": 0.4474186766486723,
      "learning_rate": 4.430027237111703e-05,
      "loss": 1.6627,
      "num_input_tokens_seen": 19573949808,
      "step": 24879
    },
    {
      "epoch": 2.6395077445363886,
      "grad_norm": 0.627150476037608,
      "learning_rate": 4.429983063501643e-05,
      "loss": 1.7055,
      "num_input_tokens_seen": 19574736464,
      "step": 24880
    },
    {
      "epoch": 2.63961383407596,
      "grad_norm": 0.40710677978364773,
      "learning_rate": 4.429938888400148e-05,
      "loss": 1.5522,
      "num_input_tokens_seen": 19575523248,
      "step": 24881
    },
    {
      "epoch": 2.6397199236155315,
      "grad_norm": 0.4534805585791106,
      "learning_rate": 4.429894711807254e-05,
      "loss": 1.5487,
      "num_input_tokens_seen": 19576310032,
      "step": 24882
    },
    {
      "epoch": 2.639826013155103,
      "grad_norm": 0.40325956114133876,
      "learning_rate": 4.4298505337229935e-05,
      "loss": 1.4551,
      "num_input_tokens_seen": 19577096752,
      "step": 24883
    },
    {
      "epoch": 2.639932102694674,
      "grad_norm": 0.43473251701982646,
      "learning_rate": 4.429806354147401e-05,
      "loss": 1.5807,
      "num_input_tokens_seen": 19577883536,
      "step": 24884
    },
    {
      "epoch": 2.640038192234246,
      "grad_norm": 0.3748331463367733,
      "learning_rate": 4.4297621730805104e-05,
      "loss": 1.5808,
      "num_input_tokens_seen": 19578670368,
      "step": 24885
    },
    {
      "epoch": 2.640144281773817,
      "grad_norm": 0.41405110450644844,
      "learning_rate": 4.429717990522357e-05,
      "loss": 1.5576,
      "num_input_tokens_seen": 19579457072,
      "step": 24886
    },
    {
      "epoch": 2.6402503713133885,
      "grad_norm": 0.3571894659129951,
      "learning_rate": 4.4296738064729746e-05,
      "loss": 1.5876,
      "num_input_tokens_seen": 19580243904,
      "step": 24887
    },
    {
      "epoch": 2.64035646085296,
      "grad_norm": 0.37927599510782495,
      "learning_rate": 4.429629620932396e-05,
      "loss": 1.5119,
      "num_input_tokens_seen": 19581030752,
      "step": 24888
    },
    {
      "epoch": 2.6404625503925314,
      "grad_norm": 0.38394128955886153,
      "learning_rate": 4.429585433900656e-05,
      "loss": 1.5874,
      "num_input_tokens_seen": 19581817456,
      "step": 24889
    },
    {
      "epoch": 2.640568639932103,
      "grad_norm": 0.38756800860800344,
      "learning_rate": 4.4295412453777894e-05,
      "loss": 1.6422,
      "num_input_tokens_seen": 19582604240,
      "step": 24890
    },
    {
      "epoch": 2.640674729471674,
      "grad_norm": 0.3473618352875149,
      "learning_rate": 4.4294970553638305e-05,
      "loss": 1.4728,
      "num_input_tokens_seen": 19583391024,
      "step": 24891
    },
    {
      "epoch": 2.6407808190112454,
      "grad_norm": 0.3352071989975976,
      "learning_rate": 4.4294528638588125e-05,
      "loss": 1.518,
      "num_input_tokens_seen": 19584177808,
      "step": 24892
    },
    {
      "epoch": 2.640886908550817,
      "grad_norm": 0.37407664830462345,
      "learning_rate": 4.429408670862769e-05,
      "loss": 1.505,
      "num_input_tokens_seen": 19584964656,
      "step": 24893
    },
    {
      "epoch": 2.6409929980903883,
      "grad_norm": 0.3599407816778696,
      "learning_rate": 4.4293644763757356e-05,
      "loss": 1.6699,
      "num_input_tokens_seen": 19585751440,
      "step": 24894
    },
    {
      "epoch": 2.64109908762996,
      "grad_norm": 0.3825246573300918,
      "learning_rate": 4.4293202803977467e-05,
      "loss": 1.5201,
      "num_input_tokens_seen": 19586538144,
      "step": 24895
    },
    {
      "epoch": 2.641205177169531,
      "grad_norm": 0.3523693585874529,
      "learning_rate": 4.4292760829288354e-05,
      "loss": 1.5756,
      "num_input_tokens_seen": 19587324912,
      "step": 24896
    },
    {
      "epoch": 2.6413112667091023,
      "grad_norm": 0.3535814250444984,
      "learning_rate": 4.429231883969036e-05,
      "loss": 1.5733,
      "num_input_tokens_seen": 19588111744,
      "step": 24897
    },
    {
      "epoch": 2.641417356248674,
      "grad_norm": 0.36071570048911933,
      "learning_rate": 4.4291876835183833e-05,
      "loss": 1.6494,
      "num_input_tokens_seen": 19588898496,
      "step": 24898
    },
    {
      "epoch": 2.6415234457882453,
      "grad_norm": 0.40854174907447777,
      "learning_rate": 4.42914348157691e-05,
      "loss": 1.7307,
      "num_input_tokens_seen": 19589685312,
      "step": 24899
    },
    {
      "epoch": 2.6416295353278167,
      "grad_norm": 0.32545669370555,
      "learning_rate": 4.429099278144651e-05,
      "loss": 1.5296,
      "num_input_tokens_seen": 19590472080,
      "step": 24900
    },
    {
      "epoch": 2.641735624867388,
      "grad_norm": 0.409339014213997,
      "learning_rate": 4.429055073221642e-05,
      "loss": 1.5936,
      "num_input_tokens_seen": 19591258848,
      "step": 24901
    },
    {
      "epoch": 2.6418417144069597,
      "grad_norm": 0.3728221125560331,
      "learning_rate": 4.429010866807916e-05,
      "loss": 1.6035,
      "num_input_tokens_seen": 19592045568,
      "step": 24902
    },
    {
      "epoch": 2.6419478039465307,
      "grad_norm": 0.4651830058476451,
      "learning_rate": 4.428966658903505e-05,
      "loss": 1.6412,
      "num_input_tokens_seen": 19592832288,
      "step": 24903
    },
    {
      "epoch": 2.642053893486102,
      "grad_norm": 0.3723832300808026,
      "learning_rate": 4.428922449508447e-05,
      "loss": 1.5462,
      "num_input_tokens_seen": 19593619152,
      "step": 24904
    },
    {
      "epoch": 2.6421599830256737,
      "grad_norm": 0.36076759093200506,
      "learning_rate": 4.428878238622773e-05,
      "loss": 1.4468,
      "num_input_tokens_seen": 19594405872,
      "step": 24905
    },
    {
      "epoch": 2.642266072565245,
      "grad_norm": 0.409159938678402,
      "learning_rate": 4.42883402624652e-05,
      "loss": 1.55,
      "num_input_tokens_seen": 19595192688,
      "step": 24906
    },
    {
      "epoch": 2.6423721621048166,
      "grad_norm": 0.36252280562586964,
      "learning_rate": 4.4287898123797194e-05,
      "loss": 1.601,
      "num_input_tokens_seen": 19595979440,
      "step": 24907
    },
    {
      "epoch": 2.6424782516443877,
      "grad_norm": 0.3795546732300934,
      "learning_rate": 4.4287455970224067e-05,
      "loss": 1.6494,
      "num_input_tokens_seen": 19596766192,
      "step": 24908
    },
    {
      "epoch": 2.642584341183959,
      "grad_norm": 0.38499177015310826,
      "learning_rate": 4.428701380174617e-05,
      "loss": 1.6645,
      "num_input_tokens_seen": 19597552864,
      "step": 24909
    },
    {
      "epoch": 2.6426904307235306,
      "grad_norm": 0.36655790351454975,
      "learning_rate": 4.4286571618363824e-05,
      "loss": 1.4489,
      "num_input_tokens_seen": 19598339680,
      "step": 24910
    },
    {
      "epoch": 2.642796520263102,
      "grad_norm": 0.4025430456267813,
      "learning_rate": 4.4286129420077386e-05,
      "loss": 1.5517,
      "num_input_tokens_seen": 19599126384,
      "step": 24911
    },
    {
      "epoch": 2.6429026098026736,
      "grad_norm": 0.4270102938151001,
      "learning_rate": 4.4285687206887194e-05,
      "loss": 1.6363,
      "num_input_tokens_seen": 19599913072,
      "step": 24912
    },
    {
      "epoch": 2.6430086993422446,
      "grad_norm": 0.3747918739796653,
      "learning_rate": 4.4285244978793585e-05,
      "loss": 1.5709,
      "num_input_tokens_seen": 19600699856,
      "step": 24913
    },
    {
      "epoch": 2.6431147888818165,
      "grad_norm": 0.47309325036906086,
      "learning_rate": 4.4284802735796907e-05,
      "loss": 1.6195,
      "num_input_tokens_seen": 19601486608,
      "step": 24914
    },
    {
      "epoch": 2.6432208784213875,
      "grad_norm": 0.4123996975220953,
      "learning_rate": 4.42843604778975e-05,
      "loss": 1.5575,
      "num_input_tokens_seen": 19602273376,
      "step": 24915
    },
    {
      "epoch": 2.643326967960959,
      "grad_norm": 0.4590680812173577,
      "learning_rate": 4.4283918205095707e-05,
      "loss": 1.7211,
      "num_input_tokens_seen": 19603060112,
      "step": 24916
    },
    {
      "epoch": 2.6434330575005305,
      "grad_norm": 0.4013352028134343,
      "learning_rate": 4.428347591739186e-05,
      "loss": 1.5771,
      "num_input_tokens_seen": 19603846800,
      "step": 24917
    },
    {
      "epoch": 2.643539147040102,
      "grad_norm": 0.5111009964433826,
      "learning_rate": 4.428303361478632e-05,
      "loss": 1.5943,
      "num_input_tokens_seen": 19604633552,
      "step": 24918
    },
    {
      "epoch": 2.6436452365796734,
      "grad_norm": 0.4170634532017715,
      "learning_rate": 4.428259129727941e-05,
      "loss": 1.5925,
      "num_input_tokens_seen": 19605420240,
      "step": 24919
    },
    {
      "epoch": 2.6437513261192445,
      "grad_norm": 0.4587233684721815,
      "learning_rate": 4.428214896487148e-05,
      "loss": 1.6954,
      "num_input_tokens_seen": 19606207024,
      "step": 24920
    },
    {
      "epoch": 2.643857415658816,
      "grad_norm": 0.4083593980584121,
      "learning_rate": 4.428170661756287e-05,
      "loss": 1.6186,
      "num_input_tokens_seen": 19606993888,
      "step": 24921
    },
    {
      "epoch": 2.6439635051983874,
      "grad_norm": 0.34583603274083535,
      "learning_rate": 4.4281264255353925e-05,
      "loss": 1.4732,
      "num_input_tokens_seen": 19607780720,
      "step": 24922
    },
    {
      "epoch": 2.644069594737959,
      "grad_norm": 0.40195793386953765,
      "learning_rate": 4.428082187824498e-05,
      "loss": 1.5929,
      "num_input_tokens_seen": 19608567376,
      "step": 24923
    },
    {
      "epoch": 2.6441756842775304,
      "grad_norm": 0.3419026759649331,
      "learning_rate": 4.428037948623639e-05,
      "loss": 1.4564,
      "num_input_tokens_seen": 19609354112,
      "step": 24924
    },
    {
      "epoch": 2.6442817738171014,
      "grad_norm": 0.39699415771834035,
      "learning_rate": 4.427993707932849e-05,
      "loss": 1.6602,
      "num_input_tokens_seen": 19610140896,
      "step": 24925
    },
    {
      "epoch": 2.6443878633566733,
      "grad_norm": 0.40617883767459906,
      "learning_rate": 4.4279494657521616e-05,
      "loss": 1.5252,
      "num_input_tokens_seen": 19610927600,
      "step": 24926
    },
    {
      "epoch": 2.6444939528962443,
      "grad_norm": 0.37819125999220954,
      "learning_rate": 4.4279052220816105e-05,
      "loss": 1.5448,
      "num_input_tokens_seen": 19611714288,
      "step": 24927
    },
    {
      "epoch": 2.644600042435816,
      "grad_norm": 0.3610223089536372,
      "learning_rate": 4.427860976921232e-05,
      "loss": 1.5578,
      "num_input_tokens_seen": 19612501072,
      "step": 24928
    },
    {
      "epoch": 2.6447061319753873,
      "grad_norm": 0.35598646270416856,
      "learning_rate": 4.4278167302710584e-05,
      "loss": 1.57,
      "num_input_tokens_seen": 19613287776,
      "step": 24929
    },
    {
      "epoch": 2.6448122215149588,
      "grad_norm": 0.40535616819121706,
      "learning_rate": 4.427772482131125e-05,
      "loss": 1.603,
      "num_input_tokens_seen": 19614074560,
      "step": 24930
    },
    {
      "epoch": 2.6449183110545302,
      "grad_norm": 0.4374055115922178,
      "learning_rate": 4.4277282325014654e-05,
      "loss": 1.548,
      "num_input_tokens_seen": 19614861264,
      "step": 24931
    },
    {
      "epoch": 2.6450244005941013,
      "grad_norm": 0.4240072135165758,
      "learning_rate": 4.427683981382114e-05,
      "loss": 1.5632,
      "num_input_tokens_seen": 19615648016,
      "step": 24932
    },
    {
      "epoch": 2.6451304901336727,
      "grad_norm": 0.4107125323340368,
      "learning_rate": 4.4276397287731055e-05,
      "loss": 1.5261,
      "num_input_tokens_seen": 19616434768,
      "step": 24933
    },
    {
      "epoch": 2.645236579673244,
      "grad_norm": 0.41143944149312794,
      "learning_rate": 4.427595474674473e-05,
      "loss": 1.5656,
      "num_input_tokens_seen": 19617221520,
      "step": 24934
    },
    {
      "epoch": 2.6453426692128157,
      "grad_norm": 0.49986095329144997,
      "learning_rate": 4.427551219086251e-05,
      "loss": 1.6401,
      "num_input_tokens_seen": 19618008368,
      "step": 24935
    },
    {
      "epoch": 2.645448758752387,
      "grad_norm": 0.3669593780906996,
      "learning_rate": 4.427506962008475e-05,
      "loss": 1.6579,
      "num_input_tokens_seen": 19618795168,
      "step": 24936
    },
    {
      "epoch": 2.645554848291958,
      "grad_norm": 0.4909048355954217,
      "learning_rate": 4.4274627034411776e-05,
      "loss": 1.6398,
      "num_input_tokens_seen": 19619581888,
      "step": 24937
    },
    {
      "epoch": 2.6456609378315297,
      "grad_norm": 0.5029567644474647,
      "learning_rate": 4.4274184433843926e-05,
      "loss": 1.5115,
      "num_input_tokens_seen": 19620368768,
      "step": 24938
    },
    {
      "epoch": 2.645767027371101,
      "grad_norm": 0.4218274488626114,
      "learning_rate": 4.4273741818381565e-05,
      "loss": 1.6983,
      "num_input_tokens_seen": 19621155440,
      "step": 24939
    },
    {
      "epoch": 2.6458731169106726,
      "grad_norm": 0.5939114308286206,
      "learning_rate": 4.4273299188025016e-05,
      "loss": 1.6417,
      "num_input_tokens_seen": 19621942224,
      "step": 24940
    },
    {
      "epoch": 2.645979206450244,
      "grad_norm": 0.4236096759407482,
      "learning_rate": 4.4272856542774634e-05,
      "loss": 1.6681,
      "num_input_tokens_seen": 19622729024,
      "step": 24941
    },
    {
      "epoch": 2.6460852959898156,
      "grad_norm": 0.4496438614079686,
      "learning_rate": 4.427241388263075e-05,
      "loss": 1.5801,
      "num_input_tokens_seen": 19623515808,
      "step": 24942
    },
    {
      "epoch": 2.646191385529387,
      "grad_norm": 0.7078540666593529,
      "learning_rate": 4.427197120759371e-05,
      "loss": 1.598,
      "num_input_tokens_seen": 19624302560,
      "step": 24943
    },
    {
      "epoch": 2.646297475068958,
      "grad_norm": 0.36540537874561524,
      "learning_rate": 4.4271528517663855e-05,
      "loss": 1.655,
      "num_input_tokens_seen": 19625089376,
      "step": 24944
    },
    {
      "epoch": 2.6464035646085295,
      "grad_norm": 0.6210668539606605,
      "learning_rate": 4.427108581284152e-05,
      "loss": 1.5373,
      "num_input_tokens_seen": 19625876096,
      "step": 24945
    },
    {
      "epoch": 2.646509654148101,
      "grad_norm": 0.6519654558066648,
      "learning_rate": 4.4270643093127065e-05,
      "loss": 1.6126,
      "num_input_tokens_seen": 19626662800,
      "step": 24946
    },
    {
      "epoch": 2.6466157436876725,
      "grad_norm": 0.40930416845098716,
      "learning_rate": 4.427020035852082e-05,
      "loss": 1.5665,
      "num_input_tokens_seen": 19627449520,
      "step": 24947
    },
    {
      "epoch": 2.646721833227244,
      "grad_norm": 0.6611200360662298,
      "learning_rate": 4.426975760902313e-05,
      "loss": 1.5186,
      "num_input_tokens_seen": 19628236352,
      "step": 24948
    },
    {
      "epoch": 2.646827922766815,
      "grad_norm": 0.5043869262110438,
      "learning_rate": 4.426931484463434e-05,
      "loss": 1.557,
      "num_input_tokens_seen": 19629023216,
      "step": 24949
    },
    {
      "epoch": 2.6469340123063865,
      "grad_norm": 0.42585566914924733,
      "learning_rate": 4.426887206535479e-05,
      "loss": 1.5347,
      "num_input_tokens_seen": 19629810000,
      "step": 24950
    },
    {
      "epoch": 2.647040101845958,
      "grad_norm": 0.5899172028022591,
      "learning_rate": 4.426842927118481e-05,
      "loss": 1.5457,
      "num_input_tokens_seen": 19630596752,
      "step": 24951
    },
    {
      "epoch": 2.6471461913855294,
      "grad_norm": 0.4016384811322698,
      "learning_rate": 4.426798646212477e-05,
      "loss": 1.5216,
      "num_input_tokens_seen": 19631383536,
      "step": 24952
    },
    {
      "epoch": 2.647252280925101,
      "grad_norm": 0.34982257502843384,
      "learning_rate": 4.426754363817498e-05,
      "loss": 1.5992,
      "num_input_tokens_seen": 19632170368,
      "step": 24953
    },
    {
      "epoch": 2.647358370464672,
      "grad_norm": 0.5128068783651941,
      "learning_rate": 4.4267100799335805e-05,
      "loss": 1.472,
      "num_input_tokens_seen": 19632957184,
      "step": 24954
    },
    {
      "epoch": 2.647464460004244,
      "grad_norm": 0.4419690343748304,
      "learning_rate": 4.426665794560758e-05,
      "loss": 1.611,
      "num_input_tokens_seen": 19633744000,
      "step": 24955
    },
    {
      "epoch": 2.647570549543815,
      "grad_norm": 0.33959919094121266,
      "learning_rate": 4.426621507699065e-05,
      "loss": 1.4344,
      "num_input_tokens_seen": 19634530800,
      "step": 24956
    },
    {
      "epoch": 2.6476766390833864,
      "grad_norm": 0.6629842395373096,
      "learning_rate": 4.4265772193485347e-05,
      "loss": 1.7365,
      "num_input_tokens_seen": 19635317552,
      "step": 24957
    },
    {
      "epoch": 2.647782728622958,
      "grad_norm": 0.3361841489229591,
      "learning_rate": 4.426532929509202e-05,
      "loss": 1.5121,
      "num_input_tokens_seen": 19636104416,
      "step": 24958
    },
    {
      "epoch": 2.6478888181625293,
      "grad_norm": 0.382686145620778,
      "learning_rate": 4.4264886381811016e-05,
      "loss": 1.5572,
      "num_input_tokens_seen": 19636891152,
      "step": 24959
    },
    {
      "epoch": 2.6479949077021008,
      "grad_norm": 0.4575563710450821,
      "learning_rate": 4.426444345364267e-05,
      "loss": 1.4906,
      "num_input_tokens_seen": 19637677872,
      "step": 24960
    },
    {
      "epoch": 2.648100997241672,
      "grad_norm": 0.38219943356950703,
      "learning_rate": 4.4264000510587336e-05,
      "loss": 1.5359,
      "num_input_tokens_seen": 19638464704,
      "step": 24961
    },
    {
      "epoch": 2.6482070867812433,
      "grad_norm": 0.4429547815644114,
      "learning_rate": 4.4263557552645335e-05,
      "loss": 1.7371,
      "num_input_tokens_seen": 19639251408,
      "step": 24962
    },
    {
      "epoch": 2.6483131763208148,
      "grad_norm": 0.3940905666985508,
      "learning_rate": 4.426311457981703e-05,
      "loss": 1.5597,
      "num_input_tokens_seen": 19640038128,
      "step": 24963
    },
    {
      "epoch": 2.6484192658603862,
      "grad_norm": 0.3991040134880284,
      "learning_rate": 4.4262671592102755e-05,
      "loss": 1.6159,
      "num_input_tokens_seen": 19640824928,
      "step": 24964
    },
    {
      "epoch": 2.6485253553999577,
      "grad_norm": 0.39648473323506844,
      "learning_rate": 4.4262228589502854e-05,
      "loss": 1.5553,
      "num_input_tokens_seen": 19641611744,
      "step": 24965
    },
    {
      "epoch": 2.6486314449395287,
      "grad_norm": 0.36493899353885545,
      "learning_rate": 4.4261785572017656e-05,
      "loss": 1.5013,
      "num_input_tokens_seen": 19642398576,
      "step": 24966
    },
    {
      "epoch": 2.6487375344791,
      "grad_norm": 0.34748840256037516,
      "learning_rate": 4.426134253964752e-05,
      "loss": 1.5312,
      "num_input_tokens_seen": 19643185248,
      "step": 24967
    },
    {
      "epoch": 2.6488436240186717,
      "grad_norm": 0.3523218485429229,
      "learning_rate": 4.4260899492392794e-05,
      "loss": 1.44,
      "num_input_tokens_seen": 19643972112,
      "step": 24968
    },
    {
      "epoch": 2.648949713558243,
      "grad_norm": 0.4787438359061835,
      "learning_rate": 4.426045643025381e-05,
      "loss": 1.5888,
      "num_input_tokens_seen": 19644758816,
      "step": 24969
    },
    {
      "epoch": 2.6490558030978146,
      "grad_norm": 0.42378493737698636,
      "learning_rate": 4.42600133532309e-05,
      "loss": 1.5828,
      "num_input_tokens_seen": 19645545568,
      "step": 24970
    },
    {
      "epoch": 2.649161892637386,
      "grad_norm": 0.5833420613738522,
      "learning_rate": 4.4259570261324426e-05,
      "loss": 1.4951,
      "num_input_tokens_seen": 19646332400,
      "step": 24971
    },
    {
      "epoch": 2.6492679821769576,
      "grad_norm": 0.48404474754346816,
      "learning_rate": 4.425912715453471e-05,
      "loss": 1.6338,
      "num_input_tokens_seen": 19647119232,
      "step": 24972
    },
    {
      "epoch": 2.6493740717165286,
      "grad_norm": 0.45263365211395284,
      "learning_rate": 4.425868403286211e-05,
      "loss": 1.5873,
      "num_input_tokens_seen": 19647905984,
      "step": 24973
    },
    {
      "epoch": 2.6494801612561,
      "grad_norm": 0.4168523426215741,
      "learning_rate": 4.4258240896306967e-05,
      "loss": 1.5772,
      "num_input_tokens_seen": 19648692720,
      "step": 24974
    },
    {
      "epoch": 2.6495862507956716,
      "grad_norm": 0.41464071997397417,
      "learning_rate": 4.425779774486962e-05,
      "loss": 1.5866,
      "num_input_tokens_seen": 19649479440,
      "step": 24975
    },
    {
      "epoch": 2.649692340335243,
      "grad_norm": 0.4294226558145657,
      "learning_rate": 4.425735457855041e-05,
      "loss": 1.5561,
      "num_input_tokens_seen": 19650266176,
      "step": 24976
    },
    {
      "epoch": 2.6497984298748145,
      "grad_norm": 0.4651901878586093,
      "learning_rate": 4.4256911397349684e-05,
      "loss": 1.6821,
      "num_input_tokens_seen": 19651052864,
      "step": 24977
    },
    {
      "epoch": 2.6499045194143855,
      "grad_norm": 0.46688454956483333,
      "learning_rate": 4.425646820126778e-05,
      "loss": 1.6693,
      "num_input_tokens_seen": 19651839632,
      "step": 24978
    },
    {
      "epoch": 2.650010608953957,
      "grad_norm": 0.4021803869492263,
      "learning_rate": 4.425602499030504e-05,
      "loss": 1.6743,
      "num_input_tokens_seen": 19652626464,
      "step": 24979
    },
    {
      "epoch": 2.6501166984935285,
      "grad_norm": 0.38959759187781384,
      "learning_rate": 4.4255581764461816e-05,
      "loss": 1.603,
      "num_input_tokens_seen": 19653413232,
      "step": 24980
    },
    {
      "epoch": 2.6502227880331,
      "grad_norm": 0.39416468975063856,
      "learning_rate": 4.4255138523738435e-05,
      "loss": 1.5653,
      "num_input_tokens_seen": 19654199984,
      "step": 24981
    },
    {
      "epoch": 2.6503288775726714,
      "grad_norm": 0.35483028548905454,
      "learning_rate": 4.425469526813526e-05,
      "loss": 1.5147,
      "num_input_tokens_seen": 19654986656,
      "step": 24982
    },
    {
      "epoch": 2.6504349671122425,
      "grad_norm": 0.4047483661680261,
      "learning_rate": 4.425425199765261e-05,
      "loss": 1.6245,
      "num_input_tokens_seen": 19655773296,
      "step": 24983
    },
    {
      "epoch": 2.6505410566518144,
      "grad_norm": 0.4097559867376101,
      "learning_rate": 4.4253808712290844e-05,
      "loss": 1.6833,
      "num_input_tokens_seen": 19656560128,
      "step": 24984
    },
    {
      "epoch": 2.6506471461913854,
      "grad_norm": 0.3985595205702142,
      "learning_rate": 4.4253365412050293e-05,
      "loss": 1.5728,
      "num_input_tokens_seen": 19657346880,
      "step": 24985
    },
    {
      "epoch": 2.650753235730957,
      "grad_norm": 0.4211890010785307,
      "learning_rate": 4.425292209693132e-05,
      "loss": 1.529,
      "num_input_tokens_seen": 19658133616,
      "step": 24986
    },
    {
      "epoch": 2.6508593252705284,
      "grad_norm": 0.36445559239871894,
      "learning_rate": 4.425247876693424e-05,
      "loss": 1.6036,
      "num_input_tokens_seen": 19658920400,
      "step": 24987
    },
    {
      "epoch": 2.6509654148101,
      "grad_norm": 0.349014901683368,
      "learning_rate": 4.425203542205941e-05,
      "loss": 1.5304,
      "num_input_tokens_seen": 19659707136,
      "step": 24988
    },
    {
      "epoch": 2.6510715043496713,
      "grad_norm": 0.4427860952939018,
      "learning_rate": 4.425159206230718e-05,
      "loss": 1.6745,
      "num_input_tokens_seen": 19660493936,
      "step": 24989
    },
    {
      "epoch": 2.6511775938892423,
      "grad_norm": 0.35226272875099657,
      "learning_rate": 4.425114868767788e-05,
      "loss": 1.5594,
      "num_input_tokens_seen": 19661280704,
      "step": 24990
    },
    {
      "epoch": 2.651283683428814,
      "grad_norm": 0.3174553538518608,
      "learning_rate": 4.425070529817186e-05,
      "loss": 1.4503,
      "num_input_tokens_seen": 19662067568,
      "step": 24991
    },
    {
      "epoch": 2.6513897729683853,
      "grad_norm": 0.38610767600910045,
      "learning_rate": 4.4250261893789456e-05,
      "loss": 1.5361,
      "num_input_tokens_seen": 19662854320,
      "step": 24992
    },
    {
      "epoch": 2.6514958625079568,
      "grad_norm": 0.42339287900633304,
      "learning_rate": 4.424981847453102e-05,
      "loss": 1.6726,
      "num_input_tokens_seen": 19663641120,
      "step": 24993
    },
    {
      "epoch": 2.6516019520475282,
      "grad_norm": 0.3637761035579404,
      "learning_rate": 4.424937504039689e-05,
      "loss": 1.6418,
      "num_input_tokens_seen": 19664427936,
      "step": 24994
    },
    {
      "epoch": 2.6517080415870993,
      "grad_norm": 0.4600394929834107,
      "learning_rate": 4.42489315913874e-05,
      "loss": 1.5536,
      "num_input_tokens_seen": 19665214672,
      "step": 24995
    },
    {
      "epoch": 2.6518141311266707,
      "grad_norm": 0.41580708627302854,
      "learning_rate": 4.42484881275029e-05,
      "loss": 1.5775,
      "num_input_tokens_seen": 19666001424,
      "step": 24996
    },
    {
      "epoch": 2.6519202206662422,
      "grad_norm": 0.4322388776683975,
      "learning_rate": 4.4248044648743735e-05,
      "loss": 1.5561,
      "num_input_tokens_seen": 19666788144,
      "step": 24997
    },
    {
      "epoch": 2.6520263102058137,
      "grad_norm": 0.4597240883823425,
      "learning_rate": 4.4247601155110255e-05,
      "loss": 1.6838,
      "num_input_tokens_seen": 19667574960,
      "step": 24998
    },
    {
      "epoch": 2.652132399745385,
      "grad_norm": 0.37105603744558113,
      "learning_rate": 4.424715764660278e-05,
      "loss": 1.7113,
      "num_input_tokens_seen": 19668361760,
      "step": 24999
    },
    {
      "epoch": 2.6522384892849566,
      "grad_norm": 0.3689825325734376,
      "learning_rate": 4.424671412322168e-05,
      "loss": 1.5166,
      "num_input_tokens_seen": 19669148464,
      "step": 25000
    },
    {
      "epoch": 2.6522384892849566,
      "eval_loss": 1.6574674844741821,
      "eval_runtime": 65.2394,
      "eval_samples_per_second": 45.984,
      "eval_steps_per_second": 0.491,
      "num_input_tokens_seen": 19669148464,
      "step": 25000
    },
    {
      "epoch": 2.652344578824528,
      "grad_norm": 0.4499260007202415,
      "learning_rate": 4.424627058496728e-05,
      "loss": 1.5873,
      "num_input_tokens_seen": 19669935248,
      "step": 25001
    },
    {
      "epoch": 2.652450668364099,
      "grad_norm": 0.3711543437694186,
      "learning_rate": 4.424582703183992e-05,
      "loss": 1.627,
      "num_input_tokens_seen": 19670722048,
      "step": 25002
    },
    {
      "epoch": 2.6525567579036706,
      "grad_norm": 0.3773035881205076,
      "learning_rate": 4.424538346383995e-05,
      "loss": 1.5475,
      "num_input_tokens_seen": 19671508896,
      "step": 25003
    },
    {
      "epoch": 2.652662847443242,
      "grad_norm": 0.4302663118379429,
      "learning_rate": 4.424493988096772e-05,
      "loss": 1.6041,
      "num_input_tokens_seen": 19672295648,
      "step": 25004
    },
    {
      "epoch": 2.6527689369828136,
      "grad_norm": 0.36837293691860634,
      "learning_rate": 4.424449628322356e-05,
      "loss": 1.5667,
      "num_input_tokens_seen": 19673082400,
      "step": 25005
    },
    {
      "epoch": 2.652875026522385,
      "grad_norm": 0.37642766049347176,
      "learning_rate": 4.4244052670607817e-05,
      "loss": 1.5739,
      "num_input_tokens_seen": 19673869232,
      "step": 25006
    },
    {
      "epoch": 2.652981116061956,
      "grad_norm": 0.4177410733077365,
      "learning_rate": 4.424360904312084e-05,
      "loss": 1.691,
      "num_input_tokens_seen": 19674655936,
      "step": 25007
    },
    {
      "epoch": 2.6530872056015276,
      "grad_norm": 0.32700102014210786,
      "learning_rate": 4.4243165400762954e-05,
      "loss": 1.5496,
      "num_input_tokens_seen": 19675442736,
      "step": 25008
    },
    {
      "epoch": 2.653193295141099,
      "grad_norm": 0.3982533021843541,
      "learning_rate": 4.424272174353453e-05,
      "loss": 1.5807,
      "num_input_tokens_seen": 19676229472,
      "step": 25009
    },
    {
      "epoch": 2.6532993846806705,
      "grad_norm": 0.35335890084147065,
      "learning_rate": 4.424227807143588e-05,
      "loss": 1.6078,
      "num_input_tokens_seen": 19677016160,
      "step": 25010
    },
    {
      "epoch": 2.653405474220242,
      "grad_norm": 0.35825978188038116,
      "learning_rate": 4.4241834384467374e-05,
      "loss": 1.522,
      "num_input_tokens_seen": 19677802864,
      "step": 25011
    },
    {
      "epoch": 2.653511563759813,
      "grad_norm": 0.36897175226177786,
      "learning_rate": 4.424139068262934e-05,
      "loss": 1.6553,
      "num_input_tokens_seen": 19678589600,
      "step": 25012
    },
    {
      "epoch": 2.653617653299385,
      "grad_norm": 0.42461902762468734,
      "learning_rate": 4.4240946965922123e-05,
      "loss": 1.6895,
      "num_input_tokens_seen": 19679376304,
      "step": 25013
    },
    {
      "epoch": 2.653723742838956,
      "grad_norm": 0.45082459295753424,
      "learning_rate": 4.4240503234346064e-05,
      "loss": 1.6931,
      "num_input_tokens_seen": 19680163056,
      "step": 25014
    },
    {
      "epoch": 2.6538298323785274,
      "grad_norm": 0.35759541969258996,
      "learning_rate": 4.424005948790152e-05,
      "loss": 1.4864,
      "num_input_tokens_seen": 19680949808,
      "step": 25015
    },
    {
      "epoch": 2.653935921918099,
      "grad_norm": 0.36013416682995336,
      "learning_rate": 4.423961572658881e-05,
      "loss": 1.5792,
      "num_input_tokens_seen": 19681736512,
      "step": 25016
    },
    {
      "epoch": 2.6540420114576704,
      "grad_norm": 0.35849317676413345,
      "learning_rate": 4.423917195040829e-05,
      "loss": 1.5767,
      "num_input_tokens_seen": 19682523264,
      "step": 25017
    },
    {
      "epoch": 2.654148100997242,
      "grad_norm": 0.48059698774644294,
      "learning_rate": 4.423872815936031e-05,
      "loss": 1.6171,
      "num_input_tokens_seen": 19683310064,
      "step": 25018
    },
    {
      "epoch": 2.654254190536813,
      "grad_norm": 0.3385681505345982,
      "learning_rate": 4.42382843534452e-05,
      "loss": 1.5953,
      "num_input_tokens_seen": 19684096768,
      "step": 25019
    },
    {
      "epoch": 2.6543602800763844,
      "grad_norm": 0.42124532633345785,
      "learning_rate": 4.423784053266331e-05,
      "loss": 1.3941,
      "num_input_tokens_seen": 19684883568,
      "step": 25020
    },
    {
      "epoch": 2.654466369615956,
      "grad_norm": 0.3876714003266756,
      "learning_rate": 4.423739669701499e-05,
      "loss": 1.7254,
      "num_input_tokens_seen": 19685670368,
      "step": 25021
    },
    {
      "epoch": 2.6545724591555273,
      "grad_norm": 0.44834340642921866,
      "learning_rate": 4.4236952846500555e-05,
      "loss": 1.5686,
      "num_input_tokens_seen": 19686457136,
      "step": 25022
    },
    {
      "epoch": 2.654678548695099,
      "grad_norm": 0.3940775759062662,
      "learning_rate": 4.423650898112038e-05,
      "loss": 1.5135,
      "num_input_tokens_seen": 19687243872,
      "step": 25023
    },
    {
      "epoch": 2.65478463823467,
      "grad_norm": 0.565283596048514,
      "learning_rate": 4.423606510087479e-05,
      "loss": 1.6536,
      "num_input_tokens_seen": 19688030656,
      "step": 25024
    },
    {
      "epoch": 2.6548907277742417,
      "grad_norm": 0.3808928411535626,
      "learning_rate": 4.423562120576414e-05,
      "loss": 1.5074,
      "num_input_tokens_seen": 19688817488,
      "step": 25025
    },
    {
      "epoch": 2.6549968173138128,
      "grad_norm": 0.5854396408651147,
      "learning_rate": 4.423517729578877e-05,
      "loss": 1.5893,
      "num_input_tokens_seen": 19689604240,
      "step": 25026
    },
    {
      "epoch": 2.6551029068533842,
      "grad_norm": 0.4057003916965137,
      "learning_rate": 4.423473337094901e-05,
      "loss": 1.5032,
      "num_input_tokens_seen": 19690390992,
      "step": 25027
    },
    {
      "epoch": 2.6552089963929557,
      "grad_norm": 0.42883633093794354,
      "learning_rate": 4.423428943124521e-05,
      "loss": 1.59,
      "num_input_tokens_seen": 19691177824,
      "step": 25028
    },
    {
      "epoch": 2.655315085932527,
      "grad_norm": 0.5193645761175291,
      "learning_rate": 4.423384547667772e-05,
      "loss": 1.6475,
      "num_input_tokens_seen": 19691964496,
      "step": 25029
    },
    {
      "epoch": 2.6554211754720987,
      "grad_norm": 0.4078274480673911,
      "learning_rate": 4.423340150724688e-05,
      "loss": 1.5806,
      "num_input_tokens_seen": 19692751280,
      "step": 25030
    },
    {
      "epoch": 2.6555272650116697,
      "grad_norm": 0.45123802042474687,
      "learning_rate": 4.4232957522953036e-05,
      "loss": 1.484,
      "num_input_tokens_seen": 19693538032,
      "step": 25031
    },
    {
      "epoch": 2.655633354551241,
      "grad_norm": 0.5572027046188974,
      "learning_rate": 4.423251352379652e-05,
      "loss": 1.6097,
      "num_input_tokens_seen": 19694324832,
      "step": 25032
    },
    {
      "epoch": 2.6557394440908126,
      "grad_norm": 0.4240226397568605,
      "learning_rate": 4.423206950977768e-05,
      "loss": 1.551,
      "num_input_tokens_seen": 19695111568,
      "step": 25033
    },
    {
      "epoch": 2.655845533630384,
      "grad_norm": 0.6060684917976402,
      "learning_rate": 4.4231625480896864e-05,
      "loss": 1.7507,
      "num_input_tokens_seen": 19695898304,
      "step": 25034
    },
    {
      "epoch": 2.6559516231699556,
      "grad_norm": 0.4354655938677293,
      "learning_rate": 4.4231181437154415e-05,
      "loss": 1.539,
      "num_input_tokens_seen": 19696685072,
      "step": 25035
    },
    {
      "epoch": 2.6560577127095266,
      "grad_norm": 0.431400719695879,
      "learning_rate": 4.423073737855067e-05,
      "loss": 1.7142,
      "num_input_tokens_seen": 19697471904,
      "step": 25036
    },
    {
      "epoch": 2.656163802249098,
      "grad_norm": 0.6041214384932748,
      "learning_rate": 4.423029330508597e-05,
      "loss": 1.6944,
      "num_input_tokens_seen": 19698258720,
      "step": 25037
    },
    {
      "epoch": 2.6562698917886696,
      "grad_norm": 0.48321998235642283,
      "learning_rate": 4.422984921676067e-05,
      "loss": 1.5507,
      "num_input_tokens_seen": 19699045472,
      "step": 25038
    },
    {
      "epoch": 2.656375981328241,
      "grad_norm": 0.5103371536869029,
      "learning_rate": 4.4229405113575105e-05,
      "loss": 1.5187,
      "num_input_tokens_seen": 19699832240,
      "step": 25039
    },
    {
      "epoch": 2.6564820708678125,
      "grad_norm": 0.5669629797804501,
      "learning_rate": 4.4228960995529624e-05,
      "loss": 1.5708,
      "num_input_tokens_seen": 19700619072,
      "step": 25040
    },
    {
      "epoch": 2.656588160407384,
      "grad_norm": 0.43931538475778614,
      "learning_rate": 4.422851686262456e-05,
      "loss": 1.4981,
      "num_input_tokens_seen": 19701405952,
      "step": 25041
    },
    {
      "epoch": 2.6566942499469555,
      "grad_norm": 0.46273498553899095,
      "learning_rate": 4.422807271486027e-05,
      "loss": 1.7223,
      "num_input_tokens_seen": 19702192608,
      "step": 25042
    },
    {
      "epoch": 2.6568003394865265,
      "grad_norm": 0.5627652562862254,
      "learning_rate": 4.422762855223708e-05,
      "loss": 1.5279,
      "num_input_tokens_seen": 19702979408,
      "step": 25043
    },
    {
      "epoch": 2.656906429026098,
      "grad_norm": 0.3690029076784246,
      "learning_rate": 4.4227184374755354e-05,
      "loss": 1.6059,
      "num_input_tokens_seen": 19703766256,
      "step": 25044
    },
    {
      "epoch": 2.6570125185656694,
      "grad_norm": 0.4007353936514033,
      "learning_rate": 4.4226740182415414e-05,
      "loss": 1.5241,
      "num_input_tokens_seen": 19704553040,
      "step": 25045
    },
    {
      "epoch": 2.657118608105241,
      "grad_norm": 0.46038162618424566,
      "learning_rate": 4.422629597521762e-05,
      "loss": 1.532,
      "num_input_tokens_seen": 19705339824,
      "step": 25046
    },
    {
      "epoch": 2.6572246976448124,
      "grad_norm": 0.37766215618183635,
      "learning_rate": 4.422585175316231e-05,
      "loss": 1.5605,
      "num_input_tokens_seen": 19706126592,
      "step": 25047
    },
    {
      "epoch": 2.6573307871843834,
      "grad_norm": 0.3811550146660712,
      "learning_rate": 4.4225407516249814e-05,
      "loss": 1.5799,
      "num_input_tokens_seen": 19706913392,
      "step": 25048
    },
    {
      "epoch": 2.657436876723955,
      "grad_norm": 0.46752967970659237,
      "learning_rate": 4.42249632644805e-05,
      "loss": 1.5588,
      "num_input_tokens_seen": 19707700208,
      "step": 25049
    },
    {
      "epoch": 2.6575429662635264,
      "grad_norm": 0.380681016529745,
      "learning_rate": 4.422451899785469e-05,
      "loss": 1.6267,
      "num_input_tokens_seen": 19708487024,
      "step": 25050
    },
    {
      "epoch": 2.657649055803098,
      "grad_norm": 0.3987994838638321,
      "learning_rate": 4.4224074716372746e-05,
      "loss": 1.6023,
      "num_input_tokens_seen": 19709273792,
      "step": 25051
    },
    {
      "epoch": 2.6577551453426693,
      "grad_norm": 0.5026669636102594,
      "learning_rate": 4.422363042003499e-05,
      "loss": 1.5744,
      "num_input_tokens_seen": 19710060528,
      "step": 25052
    },
    {
      "epoch": 2.6578612348822404,
      "grad_norm": 0.40249154418739896,
      "learning_rate": 4.4223186108841784e-05,
      "loss": 1.5387,
      "num_input_tokens_seen": 19710847376,
      "step": 25053
    },
    {
      "epoch": 2.6579673244218123,
      "grad_norm": 0.36509952145527436,
      "learning_rate": 4.422274178279346e-05,
      "loss": 1.6382,
      "num_input_tokens_seen": 19711634160,
      "step": 25054
    },
    {
      "epoch": 2.6580734139613833,
      "grad_norm": 0.4274887096393899,
      "learning_rate": 4.422229744189036e-05,
      "loss": 1.522,
      "num_input_tokens_seen": 19712420960,
      "step": 25055
    },
    {
      "epoch": 2.6581795035009548,
      "grad_norm": 0.46914452318095523,
      "learning_rate": 4.4221853086132845e-05,
      "loss": 1.5725,
      "num_input_tokens_seen": 19713207696,
      "step": 25056
    },
    {
      "epoch": 2.6582855930405263,
      "grad_norm": 0.35049872464914106,
      "learning_rate": 4.422140871552124e-05,
      "loss": 1.5386,
      "num_input_tokens_seen": 19713994448,
      "step": 25057
    },
    {
      "epoch": 2.6583916825800977,
      "grad_norm": 0.4703891756292134,
      "learning_rate": 4.422096433005589e-05,
      "loss": 1.6166,
      "num_input_tokens_seen": 19714781232,
      "step": 25058
    },
    {
      "epoch": 2.658497772119669,
      "grad_norm": 0.37863768137356485,
      "learning_rate": 4.422051992973715e-05,
      "loss": 1.6605,
      "num_input_tokens_seen": 19715567984,
      "step": 25059
    },
    {
      "epoch": 2.6586038616592402,
      "grad_norm": 0.4009905347333894,
      "learning_rate": 4.422007551456535e-05,
      "loss": 1.5913,
      "num_input_tokens_seen": 19716354768,
      "step": 25060
    },
    {
      "epoch": 2.6587099511988117,
      "grad_norm": 0.4973971863889517,
      "learning_rate": 4.4219631084540845e-05,
      "loss": 1.5366,
      "num_input_tokens_seen": 19717141472,
      "step": 25061
    },
    {
      "epoch": 2.658816040738383,
      "grad_norm": 0.3557688739637617,
      "learning_rate": 4.421918663966397e-05,
      "loss": 1.4912,
      "num_input_tokens_seen": 19717928288,
      "step": 25062
    },
    {
      "epoch": 2.6589221302779547,
      "grad_norm": 0.5641512426648483,
      "learning_rate": 4.4218742179935066e-05,
      "loss": 1.5607,
      "num_input_tokens_seen": 19718715056,
      "step": 25063
    },
    {
      "epoch": 2.659028219817526,
      "grad_norm": 0.4898698370227375,
      "learning_rate": 4.421829770535449e-05,
      "loss": 1.7262,
      "num_input_tokens_seen": 19719501856,
      "step": 25064
    },
    {
      "epoch": 2.659134309357097,
      "grad_norm": 0.4287624890933587,
      "learning_rate": 4.4217853215922576e-05,
      "loss": 1.7433,
      "num_input_tokens_seen": 19720288608,
      "step": 25065
    },
    {
      "epoch": 2.6592403988966686,
      "grad_norm": 0.6290378763252266,
      "learning_rate": 4.421740871163967e-05,
      "loss": 1.4022,
      "num_input_tokens_seen": 19721075376,
      "step": 25066
    },
    {
      "epoch": 2.65934648843624,
      "grad_norm": 0.4615602731445552,
      "learning_rate": 4.421696419250611e-05,
      "loss": 1.6696,
      "num_input_tokens_seen": 19721862112,
      "step": 25067
    },
    {
      "epoch": 2.6594525779758116,
      "grad_norm": 0.45088319457510423,
      "learning_rate": 4.4216519658522246e-05,
      "loss": 1.6899,
      "num_input_tokens_seen": 19722648928,
      "step": 25068
    },
    {
      "epoch": 2.659558667515383,
      "grad_norm": 0.5794826029685719,
      "learning_rate": 4.4216075109688425e-05,
      "loss": 1.556,
      "num_input_tokens_seen": 19723435728,
      "step": 25069
    },
    {
      "epoch": 2.6596647570549545,
      "grad_norm": 0.471592102414641,
      "learning_rate": 4.421563054600498e-05,
      "loss": 1.5715,
      "num_input_tokens_seen": 19724222432,
      "step": 25070
    },
    {
      "epoch": 2.659770846594526,
      "grad_norm": 0.4021400219598563,
      "learning_rate": 4.421518596747226e-05,
      "loss": 1.5461,
      "num_input_tokens_seen": 19725009232,
      "step": 25071
    },
    {
      "epoch": 2.659876936134097,
      "grad_norm": 0.6169810279907957,
      "learning_rate": 4.4214741374090604e-05,
      "loss": 1.6306,
      "num_input_tokens_seen": 19725795952,
      "step": 25072
    },
    {
      "epoch": 2.6599830256736685,
      "grad_norm": 0.39089139669855383,
      "learning_rate": 4.421429676586036e-05,
      "loss": 1.5765,
      "num_input_tokens_seen": 19726582720,
      "step": 25073
    },
    {
      "epoch": 2.66008911521324,
      "grad_norm": 0.42793202652470663,
      "learning_rate": 4.421385214278188e-05,
      "loss": 1.5841,
      "num_input_tokens_seen": 19727369408,
      "step": 25074
    },
    {
      "epoch": 2.6601952047528115,
      "grad_norm": 0.41559627420308615,
      "learning_rate": 4.4213407504855494e-05,
      "loss": 1.6528,
      "num_input_tokens_seen": 19728156096,
      "step": 25075
    },
    {
      "epoch": 2.660301294292383,
      "grad_norm": 0.4589793635099298,
      "learning_rate": 4.421296285208155e-05,
      "loss": 1.6659,
      "num_input_tokens_seen": 19728942880,
      "step": 25076
    },
    {
      "epoch": 2.660407383831954,
      "grad_norm": 0.3803204764784145,
      "learning_rate": 4.421251818446039e-05,
      "loss": 1.5774,
      "num_input_tokens_seen": 19729729728,
      "step": 25077
    },
    {
      "epoch": 2.6605134733715254,
      "grad_norm": 0.6118951235142097,
      "learning_rate": 4.4212073501992364e-05,
      "loss": 1.7478,
      "num_input_tokens_seen": 19730516464,
      "step": 25078
    },
    {
      "epoch": 2.660619562911097,
      "grad_norm": 0.3859002191988092,
      "learning_rate": 4.421162880467781e-05,
      "loss": 1.6239,
      "num_input_tokens_seen": 19731303232,
      "step": 25079
    },
    {
      "epoch": 2.6607256524506684,
      "grad_norm": 0.4801263043087272,
      "learning_rate": 4.421118409251707e-05,
      "loss": 1.604,
      "num_input_tokens_seen": 19732090000,
      "step": 25080
    },
    {
      "epoch": 2.66083174199024,
      "grad_norm": 0.5184080325912508,
      "learning_rate": 4.421073936551049e-05,
      "loss": 1.5489,
      "num_input_tokens_seen": 19732876704,
      "step": 25081
    },
    {
      "epoch": 2.660937831529811,
      "grad_norm": 0.4674232920460688,
      "learning_rate": 4.421029462365842e-05,
      "loss": 1.654,
      "num_input_tokens_seen": 19733663472,
      "step": 25082
    },
    {
      "epoch": 2.661043921069383,
      "grad_norm": 0.41308876753482926,
      "learning_rate": 4.420984986696119e-05,
      "loss": 1.4734,
      "num_input_tokens_seen": 19734450272,
      "step": 25083
    },
    {
      "epoch": 2.661150010608954,
      "grad_norm": 0.37314802663101126,
      "learning_rate": 4.4209405095419154e-05,
      "loss": 1.5556,
      "num_input_tokens_seen": 19735237072,
      "step": 25084
    },
    {
      "epoch": 2.6612561001485253,
      "grad_norm": 0.4176431845741219,
      "learning_rate": 4.420896030903266e-05,
      "loss": 1.6915,
      "num_input_tokens_seen": 19736023760,
      "step": 25085
    },
    {
      "epoch": 2.661362189688097,
      "grad_norm": 0.4114131845691267,
      "learning_rate": 4.420851550780204e-05,
      "loss": 1.6187,
      "num_input_tokens_seen": 19736810544,
      "step": 25086
    },
    {
      "epoch": 2.6614682792276683,
      "grad_norm": 0.4559844858661719,
      "learning_rate": 4.4208070691727646e-05,
      "loss": 1.6831,
      "num_input_tokens_seen": 19737597200,
      "step": 25087
    },
    {
      "epoch": 2.6615743687672397,
      "grad_norm": 0.3921112967039797,
      "learning_rate": 4.420762586080982e-05,
      "loss": 1.5526,
      "num_input_tokens_seen": 19738384000,
      "step": 25088
    },
    {
      "epoch": 2.6616804583068108,
      "grad_norm": 0.39279222249693935,
      "learning_rate": 4.4207181015048896e-05,
      "loss": 1.6061,
      "num_input_tokens_seen": 19739170720,
      "step": 25089
    },
    {
      "epoch": 2.6617865478463822,
      "grad_norm": 0.4441749116253072,
      "learning_rate": 4.4206736154445226e-05,
      "loss": 1.6066,
      "num_input_tokens_seen": 19739957504,
      "step": 25090
    },
    {
      "epoch": 2.6618926373859537,
      "grad_norm": 0.38671766770420973,
      "learning_rate": 4.420629127899916e-05,
      "loss": 1.5446,
      "num_input_tokens_seen": 19740744176,
      "step": 25091
    },
    {
      "epoch": 2.661998726925525,
      "grad_norm": 0.5733118397758274,
      "learning_rate": 4.420584638871104e-05,
      "loss": 1.6676,
      "num_input_tokens_seen": 19741530864,
      "step": 25092
    },
    {
      "epoch": 2.6621048164650967,
      "grad_norm": 0.39063422809614323,
      "learning_rate": 4.420540148358119e-05,
      "loss": 1.626,
      "num_input_tokens_seen": 19742317568,
      "step": 25093
    },
    {
      "epoch": 2.6622109060046677,
      "grad_norm": 0.41830226286450195,
      "learning_rate": 4.4204956563609984e-05,
      "loss": 1.5964,
      "num_input_tokens_seen": 19743104320,
      "step": 25094
    },
    {
      "epoch": 2.662316995544239,
      "grad_norm": 0.3765283000197382,
      "learning_rate": 4.4204511628797744e-05,
      "loss": 1.5927,
      "num_input_tokens_seen": 19743891168,
      "step": 25095
    },
    {
      "epoch": 2.6624230850838106,
      "grad_norm": 0.3800404394682953,
      "learning_rate": 4.420406667914482e-05,
      "loss": 1.6097,
      "num_input_tokens_seen": 19744677920,
      "step": 25096
    },
    {
      "epoch": 2.662529174623382,
      "grad_norm": 0.3668437867433838,
      "learning_rate": 4.4203621714651566e-05,
      "loss": 1.4452,
      "num_input_tokens_seen": 19745464720,
      "step": 25097
    },
    {
      "epoch": 2.6626352641629536,
      "grad_norm": 0.3988061996547055,
      "learning_rate": 4.4203176735318305e-05,
      "loss": 1.7319,
      "num_input_tokens_seen": 19746251440,
      "step": 25098
    },
    {
      "epoch": 2.662741353702525,
      "grad_norm": 0.3865714868553729,
      "learning_rate": 4.42027317411454e-05,
      "loss": 1.6423,
      "num_input_tokens_seen": 19747038192,
      "step": 25099
    },
    {
      "epoch": 2.6628474432420965,
      "grad_norm": 0.39009414804732023,
      "learning_rate": 4.420228673213318e-05,
      "loss": 1.6142,
      "num_input_tokens_seen": 19747824992,
      "step": 25100
    },
    {
      "epoch": 2.6629535327816676,
      "grad_norm": 0.40521645547626906,
      "learning_rate": 4.420184170828201e-05,
      "loss": 1.6324,
      "num_input_tokens_seen": 19748611728,
      "step": 25101
    },
    {
      "epoch": 2.663059622321239,
      "grad_norm": 0.45119005760146785,
      "learning_rate": 4.420139666959221e-05,
      "loss": 1.6015,
      "num_input_tokens_seen": 19749398576,
      "step": 25102
    },
    {
      "epoch": 2.6631657118608105,
      "grad_norm": 0.42397961314379934,
      "learning_rate": 4.420095161606414e-05,
      "loss": 1.6785,
      "num_input_tokens_seen": 19750185296,
      "step": 25103
    },
    {
      "epoch": 2.663271801400382,
      "grad_norm": 0.5277142785070589,
      "learning_rate": 4.4200506547698125e-05,
      "loss": 1.6766,
      "num_input_tokens_seen": 19750972032,
      "step": 25104
    },
    {
      "epoch": 2.6633778909399535,
      "grad_norm": 0.40174060506872084,
      "learning_rate": 4.4200061464494536e-05,
      "loss": 1.5991,
      "num_input_tokens_seen": 19751758720,
      "step": 25105
    },
    {
      "epoch": 2.6634839804795245,
      "grad_norm": 0.40824995574973094,
      "learning_rate": 4.4199616366453693e-05,
      "loss": 1.5918,
      "num_input_tokens_seen": 19752545504,
      "step": 25106
    },
    {
      "epoch": 2.663590070019096,
      "grad_norm": 0.5883876269523973,
      "learning_rate": 4.419917125357596e-05,
      "loss": 1.5294,
      "num_input_tokens_seen": 19753332304,
      "step": 25107
    },
    {
      "epoch": 2.6636961595586675,
      "grad_norm": 0.35591611152087077,
      "learning_rate": 4.4198726125861654e-05,
      "loss": 1.5211,
      "num_input_tokens_seen": 19754119136,
      "step": 25108
    },
    {
      "epoch": 2.663802249098239,
      "grad_norm": 0.4371641085525303,
      "learning_rate": 4.4198280983311155e-05,
      "loss": 1.6304,
      "num_input_tokens_seen": 19754905872,
      "step": 25109
    },
    {
      "epoch": 2.6639083386378104,
      "grad_norm": 0.3501705623971983,
      "learning_rate": 4.419783582592477e-05,
      "loss": 1.5069,
      "num_input_tokens_seen": 19755692736,
      "step": 25110
    },
    {
      "epoch": 2.6640144281773814,
      "grad_norm": 0.3626412279237723,
      "learning_rate": 4.419739065370287e-05,
      "loss": 1.5971,
      "num_input_tokens_seen": 19756479504,
      "step": 25111
    },
    {
      "epoch": 2.6641205177169534,
      "grad_norm": 0.42590281197887664,
      "learning_rate": 4.419694546664579e-05,
      "loss": 1.625,
      "num_input_tokens_seen": 19757266208,
      "step": 25112
    },
    {
      "epoch": 2.6642266072565244,
      "grad_norm": 0.37206564489835653,
      "learning_rate": 4.419650026475388e-05,
      "loss": 1.5814,
      "num_input_tokens_seen": 19758053072,
      "step": 25113
    },
    {
      "epoch": 2.664332696796096,
      "grad_norm": 0.34429116144965743,
      "learning_rate": 4.419605504802747e-05,
      "loss": 1.4973,
      "num_input_tokens_seen": 19758839808,
      "step": 25114
    },
    {
      "epoch": 2.6644387863356673,
      "grad_norm": 0.4032485036311522,
      "learning_rate": 4.4195609816466915e-05,
      "loss": 1.4965,
      "num_input_tokens_seen": 19759626624,
      "step": 25115
    },
    {
      "epoch": 2.664544875875239,
      "grad_norm": 0.35647752757066653,
      "learning_rate": 4.4195164570072555e-05,
      "loss": 1.5468,
      "num_input_tokens_seen": 19760413328,
      "step": 25116
    },
    {
      "epoch": 2.6646509654148103,
      "grad_norm": 0.3715116996545378,
      "learning_rate": 4.419471930884474e-05,
      "loss": 1.471,
      "num_input_tokens_seen": 19761200128,
      "step": 25117
    },
    {
      "epoch": 2.6647570549543813,
      "grad_norm": 0.37955554828874777,
      "learning_rate": 4.41942740327838e-05,
      "loss": 1.5932,
      "num_input_tokens_seen": 19761986880,
      "step": 25118
    },
    {
      "epoch": 2.664863144493953,
      "grad_norm": 0.36224437662366515,
      "learning_rate": 4.4193828741890084e-05,
      "loss": 1.4752,
      "num_input_tokens_seen": 19762773664,
      "step": 25119
    },
    {
      "epoch": 2.6649692340335243,
      "grad_norm": 0.34939541997854745,
      "learning_rate": 4.419338343616395e-05,
      "loss": 1.5959,
      "num_input_tokens_seen": 19763560384,
      "step": 25120
    },
    {
      "epoch": 2.6650753235730957,
      "grad_norm": 0.36607295497658565,
      "learning_rate": 4.419293811560573e-05,
      "loss": 1.5285,
      "num_input_tokens_seen": 19764347168,
      "step": 25121
    },
    {
      "epoch": 2.665181413112667,
      "grad_norm": 0.3916712987344205,
      "learning_rate": 4.4192492780215775e-05,
      "loss": 1.5054,
      "num_input_tokens_seen": 19765133920,
      "step": 25122
    },
    {
      "epoch": 2.6652875026522382,
      "grad_norm": 0.3572818910860932,
      "learning_rate": 4.419204742999442e-05,
      "loss": 1.5804,
      "num_input_tokens_seen": 19765920672,
      "step": 25123
    },
    {
      "epoch": 2.66539359219181,
      "grad_norm": 0.3524401476888238,
      "learning_rate": 4.4191602064942014e-05,
      "loss": 1.507,
      "num_input_tokens_seen": 19766707472,
      "step": 25124
    },
    {
      "epoch": 2.665499681731381,
      "grad_norm": 0.5089978582660417,
      "learning_rate": 4.419115668505891e-05,
      "loss": 1.6204,
      "num_input_tokens_seen": 19767494224,
      "step": 25125
    },
    {
      "epoch": 2.6656057712709527,
      "grad_norm": 0.35866200530197784,
      "learning_rate": 4.419071129034543e-05,
      "loss": 1.4964,
      "num_input_tokens_seen": 19768280976,
      "step": 25126
    },
    {
      "epoch": 2.665711860810524,
      "grad_norm": 0.37474858283716744,
      "learning_rate": 4.4190265880801935e-05,
      "loss": 1.7181,
      "num_input_tokens_seen": 19769067632,
      "step": 25127
    },
    {
      "epoch": 2.6658179503500956,
      "grad_norm": 0.4790146053827318,
      "learning_rate": 4.418982045642877e-05,
      "loss": 1.6285,
      "num_input_tokens_seen": 19769854416,
      "step": 25128
    },
    {
      "epoch": 2.665924039889667,
      "grad_norm": 0.36994538677658556,
      "learning_rate": 4.418937501722627e-05,
      "loss": 1.6046,
      "num_input_tokens_seen": 19770641184,
      "step": 25129
    },
    {
      "epoch": 2.666030129429238,
      "grad_norm": 0.44166844695886753,
      "learning_rate": 4.418892956319479e-05,
      "loss": 1.5848,
      "num_input_tokens_seen": 19771428000,
      "step": 25130
    },
    {
      "epoch": 2.6661362189688096,
      "grad_norm": 0.4247536443585058,
      "learning_rate": 4.418848409433466e-05,
      "loss": 1.6935,
      "num_input_tokens_seen": 19772214672,
      "step": 25131
    },
    {
      "epoch": 2.666242308508381,
      "grad_norm": 0.37612218790468743,
      "learning_rate": 4.418803861064623e-05,
      "loss": 1.5052,
      "num_input_tokens_seen": 19773001456,
      "step": 25132
    },
    {
      "epoch": 2.6663483980479525,
      "grad_norm": 0.38984900387516613,
      "learning_rate": 4.418759311212985e-05,
      "loss": 1.5706,
      "num_input_tokens_seen": 19773788240,
      "step": 25133
    },
    {
      "epoch": 2.666454487587524,
      "grad_norm": 0.4197948572490819,
      "learning_rate": 4.418714759878587e-05,
      "loss": 1.5501,
      "num_input_tokens_seen": 19774575008,
      "step": 25134
    },
    {
      "epoch": 2.666560577127095,
      "grad_norm": 0.3661349761894978,
      "learning_rate": 4.418670207061463e-05,
      "loss": 1.4769,
      "num_input_tokens_seen": 19775361856,
      "step": 25135
    },
    {
      "epoch": 2.6666666666666665,
      "grad_norm": 0.4443622402002049,
      "learning_rate": 4.418625652761646e-05,
      "loss": 1.7544,
      "num_input_tokens_seen": 19776148656,
      "step": 25136
    },
    {
      "epoch": 2.666772756206238,
      "grad_norm": 0.3889875130865059,
      "learning_rate": 4.4185810969791705e-05,
      "loss": 1.6158,
      "num_input_tokens_seen": 19776935504,
      "step": 25137
    },
    {
      "epoch": 2.6668788457458095,
      "grad_norm": 0.3513569895915145,
      "learning_rate": 4.4185365397140725e-05,
      "loss": 1.5532,
      "num_input_tokens_seen": 19777722256,
      "step": 25138
    },
    {
      "epoch": 2.666984935285381,
      "grad_norm": 0.43010081611901796,
      "learning_rate": 4.418491980966386e-05,
      "loss": 1.703,
      "num_input_tokens_seen": 19778508960,
      "step": 25139
    },
    {
      "epoch": 2.6670910248249524,
      "grad_norm": 0.38115306589644177,
      "learning_rate": 4.418447420736145e-05,
      "loss": 1.6464,
      "num_input_tokens_seen": 19779295744,
      "step": 25140
    },
    {
      "epoch": 2.667197114364524,
      "grad_norm": 0.3776430300950839,
      "learning_rate": 4.418402859023385e-05,
      "loss": 1.6531,
      "num_input_tokens_seen": 19780082464,
      "step": 25141
    },
    {
      "epoch": 2.667303203904095,
      "grad_norm": 0.4118104258118434,
      "learning_rate": 4.4183582958281386e-05,
      "loss": 1.7189,
      "num_input_tokens_seen": 19780869232,
      "step": 25142
    },
    {
      "epoch": 2.6674092934436664,
      "grad_norm": 0.3567749693955399,
      "learning_rate": 4.4183137311504405e-05,
      "loss": 1.5706,
      "num_input_tokens_seen": 19781656000,
      "step": 25143
    },
    {
      "epoch": 2.667515382983238,
      "grad_norm": 0.3558414860327547,
      "learning_rate": 4.4182691649903276e-05,
      "loss": 1.5278,
      "num_input_tokens_seen": 19782442688,
      "step": 25144
    },
    {
      "epoch": 2.6676214725228093,
      "grad_norm": 0.44106258242867036,
      "learning_rate": 4.418224597347831e-05,
      "loss": 1.6235,
      "num_input_tokens_seen": 19783229536,
      "step": 25145
    },
    {
      "epoch": 2.667727562062381,
      "grad_norm": 0.38316558833223474,
      "learning_rate": 4.418180028222988e-05,
      "loss": 1.5673,
      "num_input_tokens_seen": 19784016304,
      "step": 25146
    },
    {
      "epoch": 2.667833651601952,
      "grad_norm": 0.3889155791768015,
      "learning_rate": 4.418135457615831e-05,
      "loss": 1.5146,
      "num_input_tokens_seen": 19784803152,
      "step": 25147
    },
    {
      "epoch": 2.6679397411415233,
      "grad_norm": 0.4140813240287477,
      "learning_rate": 4.418090885526395e-05,
      "loss": 1.6491,
      "num_input_tokens_seen": 19785589808,
      "step": 25148
    },
    {
      "epoch": 2.668045830681095,
      "grad_norm": 0.346116605929737,
      "learning_rate": 4.4180463119547154e-05,
      "loss": 1.5088,
      "num_input_tokens_seen": 19786376576,
      "step": 25149
    },
    {
      "epoch": 2.6681519202206663,
      "grad_norm": 0.3840018988454699,
      "learning_rate": 4.418001736900825e-05,
      "loss": 1.6416,
      "num_input_tokens_seen": 19787163312,
      "step": 25150
    },
    {
      "epoch": 2.6682580097602377,
      "grad_norm": 0.38650628607650994,
      "learning_rate": 4.41795716036476e-05,
      "loss": 1.5651,
      "num_input_tokens_seen": 19787950048,
      "step": 25151
    },
    {
      "epoch": 2.668364099299809,
      "grad_norm": 0.38891323038617936,
      "learning_rate": 4.4179125823465537e-05,
      "loss": 1.5459,
      "num_input_tokens_seen": 19788736736,
      "step": 25152
    },
    {
      "epoch": 2.6684701888393807,
      "grad_norm": 0.3524685711301532,
      "learning_rate": 4.4178680028462404e-05,
      "loss": 1.5646,
      "num_input_tokens_seen": 19789523520,
      "step": 25153
    },
    {
      "epoch": 2.6685762783789517,
      "grad_norm": 0.39741409145616613,
      "learning_rate": 4.417823421863856e-05,
      "loss": 1.5725,
      "num_input_tokens_seen": 19790310288,
      "step": 25154
    },
    {
      "epoch": 2.668682367918523,
      "grad_norm": 0.4312157055296329,
      "learning_rate": 4.417778839399433e-05,
      "loss": 1.5702,
      "num_input_tokens_seen": 19791097040,
      "step": 25155
    },
    {
      "epoch": 2.6687884574580947,
      "grad_norm": 0.3815208424107732,
      "learning_rate": 4.4177342554530064e-05,
      "loss": 1.5112,
      "num_input_tokens_seen": 19791883888,
      "step": 25156
    },
    {
      "epoch": 2.668894546997666,
      "grad_norm": 0.43949793236974705,
      "learning_rate": 4.4176896700246125e-05,
      "loss": 1.5439,
      "num_input_tokens_seen": 19792670672,
      "step": 25157
    },
    {
      "epoch": 2.6690006365372376,
      "grad_norm": 0.46690412973275636,
      "learning_rate": 4.4176450831142836e-05,
      "loss": 1.6578,
      "num_input_tokens_seen": 19793457488,
      "step": 25158
    },
    {
      "epoch": 2.6691067260768087,
      "grad_norm": 0.3980027442327047,
      "learning_rate": 4.417600494722054e-05,
      "loss": 1.4797,
      "num_input_tokens_seen": 19794244224,
      "step": 25159
    },
    {
      "epoch": 2.66921281561638,
      "grad_norm": 0.39421210551190466,
      "learning_rate": 4.41755590484796e-05,
      "loss": 1.5611,
      "num_input_tokens_seen": 19795030992,
      "step": 25160
    },
    {
      "epoch": 2.6693189051559516,
      "grad_norm": 0.3843276990467348,
      "learning_rate": 4.4175113134920347e-05,
      "loss": 1.7332,
      "num_input_tokens_seen": 19795817696,
      "step": 25161
    },
    {
      "epoch": 2.669424994695523,
      "grad_norm": 0.3977970773155776,
      "learning_rate": 4.417466720654313e-05,
      "loss": 1.5872,
      "num_input_tokens_seen": 19796604480,
      "step": 25162
    },
    {
      "epoch": 2.6695310842350946,
      "grad_norm": 0.3879208904072635,
      "learning_rate": 4.4174221263348295e-05,
      "loss": 1.6533,
      "num_input_tokens_seen": 19797391184,
      "step": 25163
    },
    {
      "epoch": 2.6696371737746656,
      "grad_norm": 0.38412278287402085,
      "learning_rate": 4.4173775305336186e-05,
      "loss": 1.5716,
      "num_input_tokens_seen": 19798177952,
      "step": 25164
    },
    {
      "epoch": 2.669743263314237,
      "grad_norm": 0.4077904887595262,
      "learning_rate": 4.417332933250714e-05,
      "loss": 1.611,
      "num_input_tokens_seen": 19798964720,
      "step": 25165
    },
    {
      "epoch": 2.6698493528538085,
      "grad_norm": 0.5599843668009967,
      "learning_rate": 4.41728833448615e-05,
      "loss": 1.6438,
      "num_input_tokens_seen": 19799751488,
      "step": 25166
    },
    {
      "epoch": 2.66995544239338,
      "grad_norm": 0.5297621409867715,
      "learning_rate": 4.417243734239964e-05,
      "loss": 1.6179,
      "num_input_tokens_seen": 19800538128,
      "step": 25167
    },
    {
      "epoch": 2.6700615319329515,
      "grad_norm": 0.46916472458207875,
      "learning_rate": 4.4171991325121866e-05,
      "loss": 1.6716,
      "num_input_tokens_seen": 19801324848,
      "step": 25168
    },
    {
      "epoch": 2.670167621472523,
      "grad_norm": 0.4405281307446248,
      "learning_rate": 4.4171545293028546e-05,
      "loss": 1.4981,
      "num_input_tokens_seen": 19802111600,
      "step": 25169
    },
    {
      "epoch": 2.6702737110120944,
      "grad_norm": 0.5079714916051215,
      "learning_rate": 4.417109924612002e-05,
      "loss": 1.5982,
      "num_input_tokens_seen": 19802898272,
      "step": 25170
    },
    {
      "epoch": 2.6703798005516655,
      "grad_norm": 0.459940296209641,
      "learning_rate": 4.4170653184396625e-05,
      "loss": 1.6003,
      "num_input_tokens_seen": 19803685024,
      "step": 25171
    },
    {
      "epoch": 2.670485890091237,
      "grad_norm": 0.6003242426707571,
      "learning_rate": 4.417020710785872e-05,
      "loss": 1.5629,
      "num_input_tokens_seen": 19804471840,
      "step": 25172
    },
    {
      "epoch": 2.6705919796308084,
      "grad_norm": 0.34021375681833854,
      "learning_rate": 4.416976101650663e-05,
      "loss": 1.5201,
      "num_input_tokens_seen": 19805258512,
      "step": 25173
    },
    {
      "epoch": 2.67069806917038,
      "grad_norm": 0.6316395420609069,
      "learning_rate": 4.416931491034072e-05,
      "loss": 1.6714,
      "num_input_tokens_seen": 19806045248,
      "step": 25174
    },
    {
      "epoch": 2.6708041587099514,
      "grad_norm": 0.36706578426030906,
      "learning_rate": 4.416886878936132e-05,
      "loss": 1.5579,
      "num_input_tokens_seen": 19806832016,
      "step": 25175
    },
    {
      "epoch": 2.6709102482495224,
      "grad_norm": 0.4261119066693676,
      "learning_rate": 4.416842265356879e-05,
      "loss": 1.7343,
      "num_input_tokens_seen": 19807618784,
      "step": 25176
    },
    {
      "epoch": 2.671016337789094,
      "grad_norm": 0.4667944808501018,
      "learning_rate": 4.416797650296346e-05,
      "loss": 1.6972,
      "num_input_tokens_seen": 19808405520,
      "step": 25177
    },
    {
      "epoch": 2.6711224273286653,
      "grad_norm": 0.4415996778596993,
      "learning_rate": 4.4167530337545674e-05,
      "loss": 1.5025,
      "num_input_tokens_seen": 19809192304,
      "step": 25178
    },
    {
      "epoch": 2.671228516868237,
      "grad_norm": 0.4241225852830957,
      "learning_rate": 4.416708415731579e-05,
      "loss": 1.6697,
      "num_input_tokens_seen": 19809979040,
      "step": 25179
    },
    {
      "epoch": 2.6713346064078083,
      "grad_norm": 0.4185131459402781,
      "learning_rate": 4.416663796227415e-05,
      "loss": 1.7001,
      "num_input_tokens_seen": 19810765856,
      "step": 25180
    },
    {
      "epoch": 2.6714406959473793,
      "grad_norm": 0.308842254867319,
      "learning_rate": 4.416619175242108e-05,
      "loss": 1.4816,
      "num_input_tokens_seen": 19811552720,
      "step": 25181
    },
    {
      "epoch": 2.6715467854869512,
      "grad_norm": 0.3784079207355194,
      "learning_rate": 4.4165745527756955e-05,
      "loss": 1.5807,
      "num_input_tokens_seen": 19812339456,
      "step": 25182
    },
    {
      "epoch": 2.6716528750265223,
      "grad_norm": 0.4171819513748642,
      "learning_rate": 4.416529928828209e-05,
      "loss": 1.6521,
      "num_input_tokens_seen": 19813126304,
      "step": 25183
    },
    {
      "epoch": 2.6717589645660937,
      "grad_norm": 0.3807047124401283,
      "learning_rate": 4.416485303399685e-05,
      "loss": 1.6319,
      "num_input_tokens_seen": 19813913024,
      "step": 25184
    },
    {
      "epoch": 2.671865054105665,
      "grad_norm": 0.48142680587808384,
      "learning_rate": 4.416440676490158e-05,
      "loss": 1.658,
      "num_input_tokens_seen": 19814699744,
      "step": 25185
    },
    {
      "epoch": 2.6719711436452367,
      "grad_norm": 0.4621566396130137,
      "learning_rate": 4.4163960480996614e-05,
      "loss": 1.6318,
      "num_input_tokens_seen": 19815486480,
      "step": 25186
    },
    {
      "epoch": 2.672077233184808,
      "grad_norm": 0.47368730290755673,
      "learning_rate": 4.416351418228231e-05,
      "loss": 1.6631,
      "num_input_tokens_seen": 19816273296,
      "step": 25187
    },
    {
      "epoch": 2.672183322724379,
      "grad_norm": 0.4289432505713027,
      "learning_rate": 4.416306786875899e-05,
      "loss": 1.6928,
      "num_input_tokens_seen": 19817060080,
      "step": 25188
    },
    {
      "epoch": 2.6722894122639507,
      "grad_norm": 0.5015002664551981,
      "learning_rate": 4.416262154042702e-05,
      "loss": 1.659,
      "num_input_tokens_seen": 19817846784,
      "step": 25189
    },
    {
      "epoch": 2.672395501803522,
      "grad_norm": 0.35594727196733444,
      "learning_rate": 4.416217519728674e-05,
      "loss": 1.4975,
      "num_input_tokens_seen": 19818633616,
      "step": 25190
    },
    {
      "epoch": 2.6725015913430936,
      "grad_norm": 0.38782860159850846,
      "learning_rate": 4.416172883933849e-05,
      "loss": 1.5084,
      "num_input_tokens_seen": 19819420368,
      "step": 25191
    },
    {
      "epoch": 2.672607680882665,
      "grad_norm": 0.4376022385750468,
      "learning_rate": 4.416128246658262e-05,
      "loss": 1.6008,
      "num_input_tokens_seen": 19820207024,
      "step": 25192
    },
    {
      "epoch": 2.672713770422236,
      "grad_norm": 0.4479613850794904,
      "learning_rate": 4.416083607901947e-05,
      "loss": 1.6626,
      "num_input_tokens_seen": 19820993696,
      "step": 25193
    },
    {
      "epoch": 2.672819859961808,
      "grad_norm": 0.4833502440493114,
      "learning_rate": 4.416038967664939e-05,
      "loss": 1.5825,
      "num_input_tokens_seen": 19821780576,
      "step": 25194
    },
    {
      "epoch": 2.672925949501379,
      "grad_norm": 0.4231090517679715,
      "learning_rate": 4.415994325947272e-05,
      "loss": 1.5707,
      "num_input_tokens_seen": 19822567264,
      "step": 25195
    },
    {
      "epoch": 2.6730320390409505,
      "grad_norm": 0.4011565700620607,
      "learning_rate": 4.415949682748982e-05,
      "loss": 1.6159,
      "num_input_tokens_seen": 19823354048,
      "step": 25196
    },
    {
      "epoch": 2.673138128580522,
      "grad_norm": 0.3889082057565137,
      "learning_rate": 4.415905038070102e-05,
      "loss": 1.6547,
      "num_input_tokens_seen": 19824140832,
      "step": 25197
    },
    {
      "epoch": 2.6732442181200935,
      "grad_norm": 0.3739928120064797,
      "learning_rate": 4.415860391910666e-05,
      "loss": 1.5671,
      "num_input_tokens_seen": 19824927696,
      "step": 25198
    },
    {
      "epoch": 2.673350307659665,
      "grad_norm": 0.40093629120040286,
      "learning_rate": 4.415815744270709e-05,
      "loss": 1.7316,
      "num_input_tokens_seen": 19825714512,
      "step": 25199
    },
    {
      "epoch": 2.673456397199236,
      "grad_norm": 0.3615667000424207,
      "learning_rate": 4.415771095150267e-05,
      "loss": 1.5567,
      "num_input_tokens_seen": 19826501328,
      "step": 25200
    },
    {
      "epoch": 2.6735624867388075,
      "grad_norm": 0.41018410275727396,
      "learning_rate": 4.4157264445493726e-05,
      "loss": 1.6668,
      "num_input_tokens_seen": 19827288064,
      "step": 25201
    },
    {
      "epoch": 2.673668576278379,
      "grad_norm": 0.34000088954802204,
      "learning_rate": 4.415681792468061e-05,
      "loss": 1.5482,
      "num_input_tokens_seen": 19828074800,
      "step": 25202
    },
    {
      "epoch": 2.6737746658179504,
      "grad_norm": 0.42697799458014807,
      "learning_rate": 4.415637138906367e-05,
      "loss": 1.4852,
      "num_input_tokens_seen": 19828861632,
      "step": 25203
    },
    {
      "epoch": 2.673880755357522,
      "grad_norm": 0.3971059343103997,
      "learning_rate": 4.415592483864325e-05,
      "loss": 1.5941,
      "num_input_tokens_seen": 19829648352,
      "step": 25204
    },
    {
      "epoch": 2.673986844897093,
      "grad_norm": 0.507652848914025,
      "learning_rate": 4.415547827341968e-05,
      "loss": 1.5696,
      "num_input_tokens_seen": 19830435184,
      "step": 25205
    },
    {
      "epoch": 2.6740929344366644,
      "grad_norm": 0.372067740387924,
      "learning_rate": 4.415503169339333e-05,
      "loss": 1.6101,
      "num_input_tokens_seen": 19831221984,
      "step": 25206
    },
    {
      "epoch": 2.674199023976236,
      "grad_norm": 0.4908190148064652,
      "learning_rate": 4.415458509856454e-05,
      "loss": 1.5876,
      "num_input_tokens_seen": 19832008800,
      "step": 25207
    },
    {
      "epoch": 2.6743051135158074,
      "grad_norm": 0.35501748010471756,
      "learning_rate": 4.4154138488933636e-05,
      "loss": 1.6528,
      "num_input_tokens_seen": 19832795648,
      "step": 25208
    },
    {
      "epoch": 2.674411203055379,
      "grad_norm": 0.4053298345573435,
      "learning_rate": 4.415369186450098e-05,
      "loss": 1.5581,
      "num_input_tokens_seen": 19833582480,
      "step": 25209
    },
    {
      "epoch": 2.6745172925949503,
      "grad_norm": 0.47040999237897546,
      "learning_rate": 4.4153245225266914e-05,
      "loss": 1.6166,
      "num_input_tokens_seen": 19834369184,
      "step": 25210
    },
    {
      "epoch": 2.6746233821345218,
      "grad_norm": 0.36593381155345567,
      "learning_rate": 4.415279857123178e-05,
      "loss": 1.6889,
      "num_input_tokens_seen": 19835155936,
      "step": 25211
    },
    {
      "epoch": 2.674729471674093,
      "grad_norm": 0.4383003767538203,
      "learning_rate": 4.415235190239593e-05,
      "loss": 1.6757,
      "num_input_tokens_seen": 19835942752,
      "step": 25212
    },
    {
      "epoch": 2.6748355612136643,
      "grad_norm": 0.40089448356713697,
      "learning_rate": 4.41519052187597e-05,
      "loss": 1.6805,
      "num_input_tokens_seen": 19836729488,
      "step": 25213
    },
    {
      "epoch": 2.6749416507532358,
      "grad_norm": 0.34861720241509137,
      "learning_rate": 4.415145852032344e-05,
      "loss": 1.622,
      "num_input_tokens_seen": 19837516272,
      "step": 25214
    },
    {
      "epoch": 2.6750477402928072,
      "grad_norm": 0.38242764954896474,
      "learning_rate": 4.415101180708749e-05,
      "loss": 1.4444,
      "num_input_tokens_seen": 19838303104,
      "step": 25215
    },
    {
      "epoch": 2.6751538298323787,
      "grad_norm": 0.40934110478412705,
      "learning_rate": 4.415056507905221e-05,
      "loss": 1.6817,
      "num_input_tokens_seen": 19839089808,
      "step": 25216
    },
    {
      "epoch": 2.6752599193719497,
      "grad_norm": 0.33402473744903644,
      "learning_rate": 4.4150118336217936e-05,
      "loss": 1.5507,
      "num_input_tokens_seen": 19839876480,
      "step": 25217
    },
    {
      "epoch": 2.675366008911521,
      "grad_norm": 0.39421010332774536,
      "learning_rate": 4.414967157858501e-05,
      "loss": 1.6572,
      "num_input_tokens_seen": 19840663184,
      "step": 25218
    },
    {
      "epoch": 2.6754720984510927,
      "grad_norm": 0.3513196637376544,
      "learning_rate": 4.4149224806153775e-05,
      "loss": 1.6277,
      "num_input_tokens_seen": 19841449936,
      "step": 25219
    },
    {
      "epoch": 2.675578187990664,
      "grad_norm": 0.35171696131583413,
      "learning_rate": 4.4148778018924586e-05,
      "loss": 1.5107,
      "num_input_tokens_seen": 19842236672,
      "step": 25220
    },
    {
      "epoch": 2.6756842775302356,
      "grad_norm": 0.3689214917757902,
      "learning_rate": 4.414833121689778e-05,
      "loss": 1.5525,
      "num_input_tokens_seen": 19843023520,
      "step": 25221
    },
    {
      "epoch": 2.6757903670698067,
      "grad_norm": 0.4239164925928012,
      "learning_rate": 4.41478844000737e-05,
      "loss": 1.6173,
      "num_input_tokens_seen": 19843810272,
      "step": 25222
    },
    {
      "epoch": 2.6758964566093786,
      "grad_norm": 0.38590516827920185,
      "learning_rate": 4.4147437568452706e-05,
      "loss": 1.688,
      "num_input_tokens_seen": 19844596944,
      "step": 25223
    },
    {
      "epoch": 2.6760025461489496,
      "grad_norm": 0.3429924887033429,
      "learning_rate": 4.414699072203513e-05,
      "loss": 1.5459,
      "num_input_tokens_seen": 19845383744,
      "step": 25224
    },
    {
      "epoch": 2.676108635688521,
      "grad_norm": 0.3407161283417785,
      "learning_rate": 4.414654386082132e-05,
      "loss": 1.4801,
      "num_input_tokens_seen": 19846170656,
      "step": 25225
    },
    {
      "epoch": 2.6762147252280926,
      "grad_norm": 0.39629311221785946,
      "learning_rate": 4.414609698481163e-05,
      "loss": 1.6419,
      "num_input_tokens_seen": 19846957504,
      "step": 25226
    },
    {
      "epoch": 2.676320814767664,
      "grad_norm": 0.3794326923552522,
      "learning_rate": 4.414565009400638e-05,
      "loss": 1.6515,
      "num_input_tokens_seen": 19847744144,
      "step": 25227
    },
    {
      "epoch": 2.6764269043072355,
      "grad_norm": 0.3340590989937294,
      "learning_rate": 4.414520318840595e-05,
      "loss": 1.5988,
      "num_input_tokens_seen": 19848530848,
      "step": 25228
    },
    {
      "epoch": 2.6765329938468065,
      "grad_norm": 0.6748096864372379,
      "learning_rate": 4.414475626801067e-05,
      "loss": 1.5178,
      "num_input_tokens_seen": 19849317600,
      "step": 25229
    },
    {
      "epoch": 2.676639083386378,
      "grad_norm": 0.47828678624906124,
      "learning_rate": 4.4144309332820876e-05,
      "loss": 1.6512,
      "num_input_tokens_seen": 19850104352,
      "step": 25230
    },
    {
      "epoch": 2.6767451729259495,
      "grad_norm": 0.6439156976406717,
      "learning_rate": 4.414386238283693e-05,
      "loss": 1.5931,
      "num_input_tokens_seen": 19850891072,
      "step": 25231
    },
    {
      "epoch": 2.676851262465521,
      "grad_norm": 0.40109250534392255,
      "learning_rate": 4.414341541805916e-05,
      "loss": 1.6865,
      "num_input_tokens_seen": 19851677744,
      "step": 25232
    },
    {
      "epoch": 2.6769573520050924,
      "grad_norm": 0.39806244267666074,
      "learning_rate": 4.4142968438487916e-05,
      "loss": 1.6384,
      "num_input_tokens_seen": 19852464512,
      "step": 25233
    },
    {
      "epoch": 2.6770634415446635,
      "grad_norm": 0.3737988040885252,
      "learning_rate": 4.414252144412356e-05,
      "loss": 1.5671,
      "num_input_tokens_seen": 19853251312,
      "step": 25234
    },
    {
      "epoch": 2.677169531084235,
      "grad_norm": 0.40984253506602564,
      "learning_rate": 4.4142074434966415e-05,
      "loss": 1.6178,
      "num_input_tokens_seen": 19854038080,
      "step": 25235
    },
    {
      "epoch": 2.6772756206238064,
      "grad_norm": 0.3929086221625415,
      "learning_rate": 4.414162741101685e-05,
      "loss": 1.5021,
      "num_input_tokens_seen": 19854824848,
      "step": 25236
    },
    {
      "epoch": 2.677381710163378,
      "grad_norm": 0.4154948405326343,
      "learning_rate": 4.4141180372275184e-05,
      "loss": 1.6359,
      "num_input_tokens_seen": 19855611424,
      "step": 25237
    },
    {
      "epoch": 2.6774877997029494,
      "grad_norm": 0.4073218582986591,
      "learning_rate": 4.4140733318741784e-05,
      "loss": 1.777,
      "num_input_tokens_seen": 19856398176,
      "step": 25238
    },
    {
      "epoch": 2.677593889242521,
      "grad_norm": 0.3807686550037737,
      "learning_rate": 4.4140286250416986e-05,
      "loss": 1.5111,
      "num_input_tokens_seen": 19857184960,
      "step": 25239
    },
    {
      "epoch": 2.6776999787820923,
      "grad_norm": 0.33597902354546094,
      "learning_rate": 4.413983916730113e-05,
      "loss": 1.4903,
      "num_input_tokens_seen": 19857971808,
      "step": 25240
    },
    {
      "epoch": 2.6778060683216633,
      "grad_norm": 0.4359955868817652,
      "learning_rate": 4.413939206939457e-05,
      "loss": 1.6922,
      "num_input_tokens_seen": 19858758560,
      "step": 25241
    },
    {
      "epoch": 2.677912157861235,
      "grad_norm": 0.37373412058899486,
      "learning_rate": 4.413894495669765e-05,
      "loss": 1.5196,
      "num_input_tokens_seen": 19859545424,
      "step": 25242
    },
    {
      "epoch": 2.6780182474008063,
      "grad_norm": 0.37192917340676,
      "learning_rate": 4.413849782921072e-05,
      "loss": 1.5745,
      "num_input_tokens_seen": 19860332304,
      "step": 25243
    },
    {
      "epoch": 2.6781243369403778,
      "grad_norm": 0.429763606254412,
      "learning_rate": 4.413805068693412e-05,
      "loss": 1.6538,
      "num_input_tokens_seen": 19861119104,
      "step": 25244
    },
    {
      "epoch": 2.6782304264799492,
      "grad_norm": 0.37398859468166107,
      "learning_rate": 4.4137603529868186e-05,
      "loss": 1.5618,
      "num_input_tokens_seen": 19861905872,
      "step": 25245
    },
    {
      "epoch": 2.6783365160195203,
      "grad_norm": 0.4048709626325821,
      "learning_rate": 4.4137156358013276e-05,
      "loss": 1.6373,
      "num_input_tokens_seen": 19862692704,
      "step": 25246
    },
    {
      "epoch": 2.6784426055590917,
      "grad_norm": 0.34788226498793023,
      "learning_rate": 4.413670917136974e-05,
      "loss": 1.5681,
      "num_input_tokens_seen": 19863479552,
      "step": 25247
    },
    {
      "epoch": 2.6785486950986632,
      "grad_norm": 0.39964722472597447,
      "learning_rate": 4.4136261969937915e-05,
      "loss": 1.5032,
      "num_input_tokens_seen": 19864266400,
      "step": 25248
    },
    {
      "epoch": 2.6786547846382347,
      "grad_norm": 0.3685223594414801,
      "learning_rate": 4.413581475371815e-05,
      "loss": 1.6842,
      "num_input_tokens_seen": 19865053104,
      "step": 25249
    },
    {
      "epoch": 2.678760874177806,
      "grad_norm": 0.352375234436126,
      "learning_rate": 4.413536752271078e-05,
      "loss": 1.5564,
      "num_input_tokens_seen": 19865839856,
      "step": 25250
    },
    {
      "epoch": 2.678866963717377,
      "grad_norm": 0.37032992297542017,
      "learning_rate": 4.413492027691616e-05,
      "loss": 1.5981,
      "num_input_tokens_seen": 19866626640,
      "step": 25251
    },
    {
      "epoch": 2.678973053256949,
      "grad_norm": 0.4414636485904056,
      "learning_rate": 4.4134473016334646e-05,
      "loss": 1.571,
      "num_input_tokens_seen": 19867413456,
      "step": 25252
    },
    {
      "epoch": 2.67907914279652,
      "grad_norm": 0.41380459064686087,
      "learning_rate": 4.413402574096657e-05,
      "loss": 1.5645,
      "num_input_tokens_seen": 19868200208,
      "step": 25253
    },
    {
      "epoch": 2.6791852323360916,
      "grad_norm": 0.4146932402918891,
      "learning_rate": 4.413357845081227e-05,
      "loss": 1.5335,
      "num_input_tokens_seen": 19868986992,
      "step": 25254
    },
    {
      "epoch": 2.679291321875663,
      "grad_norm": 0.4135020107473283,
      "learning_rate": 4.413313114587211e-05,
      "loss": 1.5844,
      "num_input_tokens_seen": 19869773808,
      "step": 25255
    },
    {
      "epoch": 2.6793974114152346,
      "grad_norm": 0.47320744940994003,
      "learning_rate": 4.413268382614643e-05,
      "loss": 1.5627,
      "num_input_tokens_seen": 19870560480,
      "step": 25256
    },
    {
      "epoch": 2.679503500954806,
      "grad_norm": 0.4010380506458484,
      "learning_rate": 4.413223649163557e-05,
      "loss": 1.5034,
      "num_input_tokens_seen": 19871347232,
      "step": 25257
    },
    {
      "epoch": 2.679609590494377,
      "grad_norm": 0.6424229404718764,
      "learning_rate": 4.4131789142339875e-05,
      "loss": 1.6923,
      "num_input_tokens_seen": 19872133952,
      "step": 25258
    },
    {
      "epoch": 2.6797156800339486,
      "grad_norm": 0.344617020579314,
      "learning_rate": 4.41313417782597e-05,
      "loss": 1.4989,
      "num_input_tokens_seen": 19872920704,
      "step": 25259
    },
    {
      "epoch": 2.67982176957352,
      "grad_norm": 0.5678378890060256,
      "learning_rate": 4.4130894399395386e-05,
      "loss": 1.6538,
      "num_input_tokens_seen": 19873707520,
      "step": 25260
    },
    {
      "epoch": 2.6799278591130915,
      "grad_norm": 0.42553375282082023,
      "learning_rate": 4.4130447005747277e-05,
      "loss": 1.5387,
      "num_input_tokens_seen": 19874494352,
      "step": 25261
    },
    {
      "epoch": 2.680033948652663,
      "grad_norm": 0.4829572354373949,
      "learning_rate": 4.412999959731572e-05,
      "loss": 1.648,
      "num_input_tokens_seen": 19875281088,
      "step": 25262
    },
    {
      "epoch": 2.680140038192234,
      "grad_norm": 0.3784022625676876,
      "learning_rate": 4.4129552174101057e-05,
      "loss": 1.5291,
      "num_input_tokens_seen": 19876067840,
      "step": 25263
    },
    {
      "epoch": 2.6802461277318055,
      "grad_norm": 0.44894999209353487,
      "learning_rate": 4.4129104736103644e-05,
      "loss": 1.6004,
      "num_input_tokens_seen": 19876854672,
      "step": 25264
    },
    {
      "epoch": 2.680352217271377,
      "grad_norm": 0.4047542846714886,
      "learning_rate": 4.412865728332381e-05,
      "loss": 1.6353,
      "num_input_tokens_seen": 19877641376,
      "step": 25265
    },
    {
      "epoch": 2.6804583068109484,
      "grad_norm": 0.5321204953964663,
      "learning_rate": 4.412820981576192e-05,
      "loss": 1.5643,
      "num_input_tokens_seen": 19878428128,
      "step": 25266
    },
    {
      "epoch": 2.68056439635052,
      "grad_norm": 0.36994045877868326,
      "learning_rate": 4.412776233341831e-05,
      "loss": 1.4918,
      "num_input_tokens_seen": 19879214992,
      "step": 25267
    },
    {
      "epoch": 2.6806704858900914,
      "grad_norm": 0.39732069882790966,
      "learning_rate": 4.412731483629332e-05,
      "loss": 1.5663,
      "num_input_tokens_seen": 19880001776,
      "step": 25268
    },
    {
      "epoch": 2.680776575429663,
      "grad_norm": 0.4733798189443719,
      "learning_rate": 4.412686732438731e-05,
      "loss": 1.503,
      "num_input_tokens_seen": 19880788544,
      "step": 25269
    },
    {
      "epoch": 2.680882664969234,
      "grad_norm": 0.37281723869982775,
      "learning_rate": 4.4126419797700614e-05,
      "loss": 1.4942,
      "num_input_tokens_seen": 19881575296,
      "step": 25270
    },
    {
      "epoch": 2.6809887545088054,
      "grad_norm": 0.3699374981991307,
      "learning_rate": 4.4125972256233586e-05,
      "loss": 1.5798,
      "num_input_tokens_seen": 19882362176,
      "step": 25271
    },
    {
      "epoch": 2.681094844048377,
      "grad_norm": 0.3818074711943044,
      "learning_rate": 4.4125524699986566e-05,
      "loss": 1.5147,
      "num_input_tokens_seen": 19883149008,
      "step": 25272
    },
    {
      "epoch": 2.6812009335879483,
      "grad_norm": 0.38345347626690673,
      "learning_rate": 4.41250771289599e-05,
      "loss": 1.6754,
      "num_input_tokens_seen": 19883935808,
      "step": 25273
    },
    {
      "epoch": 2.68130702312752,
      "grad_norm": 0.4457159524318966,
      "learning_rate": 4.4124629543153935e-05,
      "loss": 1.536,
      "num_input_tokens_seen": 19884722576,
      "step": 25274
    },
    {
      "epoch": 2.681413112667091,
      "grad_norm": 0.366869359325605,
      "learning_rate": 4.412418194256901e-05,
      "loss": 1.593,
      "num_input_tokens_seen": 19885509504,
      "step": 25275
    },
    {
      "epoch": 2.6815192022066623,
      "grad_norm": 0.38830319775538497,
      "learning_rate": 4.412373432720549e-05,
      "loss": 1.5461,
      "num_input_tokens_seen": 19886296368,
      "step": 25276
    },
    {
      "epoch": 2.6816252917462338,
      "grad_norm": 0.41315667435621223,
      "learning_rate": 4.4123286697063704e-05,
      "loss": 1.6732,
      "num_input_tokens_seen": 19887083136,
      "step": 25277
    },
    {
      "epoch": 2.6817313812858052,
      "grad_norm": 0.4025090600835249,
      "learning_rate": 4.4122839052144e-05,
      "loss": 1.594,
      "num_input_tokens_seen": 19887869888,
      "step": 25278
    },
    {
      "epoch": 2.6818374708253767,
      "grad_norm": 0.36811949302787417,
      "learning_rate": 4.412239139244674e-05,
      "loss": 1.5002,
      "num_input_tokens_seen": 19888656640,
      "step": 25279
    },
    {
      "epoch": 2.6819435603649477,
      "grad_norm": 0.3878948003707297,
      "learning_rate": 4.4121943717972244e-05,
      "loss": 1.6261,
      "num_input_tokens_seen": 19889443424,
      "step": 25280
    },
    {
      "epoch": 2.6820496499045197,
      "grad_norm": 0.4032356325549417,
      "learning_rate": 4.4121496028720885e-05,
      "loss": 1.5857,
      "num_input_tokens_seen": 19890230240,
      "step": 25281
    },
    {
      "epoch": 2.6821557394440907,
      "grad_norm": 0.4264307431894684,
      "learning_rate": 4.412104832469298e-05,
      "loss": 1.5758,
      "num_input_tokens_seen": 19891016992,
      "step": 25282
    },
    {
      "epoch": 2.682261828983662,
      "grad_norm": 0.36141963832560287,
      "learning_rate": 4.4120600605888894e-05,
      "loss": 1.4003,
      "num_input_tokens_seen": 19891803792,
      "step": 25283
    },
    {
      "epoch": 2.6823679185232336,
      "grad_norm": 0.5178137635975767,
      "learning_rate": 4.412015287230897e-05,
      "loss": 1.6133,
      "num_input_tokens_seen": 19892590512,
      "step": 25284
    },
    {
      "epoch": 2.682474008062805,
      "grad_norm": 0.3914378919077637,
      "learning_rate": 4.411970512395356e-05,
      "loss": 1.5152,
      "num_input_tokens_seen": 19893377248,
      "step": 25285
    },
    {
      "epoch": 2.6825800976023766,
      "grad_norm": 0.4879584298675305,
      "learning_rate": 4.4119257360822997e-05,
      "loss": 1.554,
      "num_input_tokens_seen": 19894163936,
      "step": 25286
    },
    {
      "epoch": 2.6826861871419476,
      "grad_norm": 0.43251871953336724,
      "learning_rate": 4.411880958291763e-05,
      "loss": 1.431,
      "num_input_tokens_seen": 19894950752,
      "step": 25287
    },
    {
      "epoch": 2.682792276681519,
      "grad_norm": 0.4288608246609088,
      "learning_rate": 4.411836179023781e-05,
      "loss": 1.6588,
      "num_input_tokens_seen": 19895737536,
      "step": 25288
    },
    {
      "epoch": 2.6828983662210906,
      "grad_norm": 0.6847448145687076,
      "learning_rate": 4.4117913982783884e-05,
      "loss": 1.6207,
      "num_input_tokens_seen": 19896524240,
      "step": 25289
    },
    {
      "epoch": 2.683004455760662,
      "grad_norm": 0.38956152325111826,
      "learning_rate": 4.411746616055619e-05,
      "loss": 1.6252,
      "num_input_tokens_seen": 19897310992,
      "step": 25290
    },
    {
      "epoch": 2.6831105453002335,
      "grad_norm": 0.4882896794738839,
      "learning_rate": 4.411701832355508e-05,
      "loss": 1.7169,
      "num_input_tokens_seen": 19898097696,
      "step": 25291
    },
    {
      "epoch": 2.6832166348398045,
      "grad_norm": 0.45351127251417445,
      "learning_rate": 4.411657047178091e-05,
      "loss": 1.6442,
      "num_input_tokens_seen": 19898884336,
      "step": 25292
    },
    {
      "epoch": 2.6833227243793765,
      "grad_norm": 0.3931471031073289,
      "learning_rate": 4.4116122605234e-05,
      "loss": 1.5922,
      "num_input_tokens_seen": 19899671024,
      "step": 25293
    },
    {
      "epoch": 2.6834288139189475,
      "grad_norm": 0.4598141628251625,
      "learning_rate": 4.411567472391472e-05,
      "loss": 1.6853,
      "num_input_tokens_seen": 19900457760,
      "step": 25294
    },
    {
      "epoch": 2.683534903458519,
      "grad_norm": 0.3768478942219021,
      "learning_rate": 4.4115226827823404e-05,
      "loss": 1.46,
      "num_input_tokens_seen": 19901244608,
      "step": 25295
    },
    {
      "epoch": 2.6836409929980904,
      "grad_norm": 0.3857936851797395,
      "learning_rate": 4.4114778916960396e-05,
      "loss": 1.563,
      "num_input_tokens_seen": 19902031376,
      "step": 25296
    },
    {
      "epoch": 2.683747082537662,
      "grad_norm": 0.3626821452538048,
      "learning_rate": 4.411433099132606e-05,
      "loss": 1.5347,
      "num_input_tokens_seen": 19902818192,
      "step": 25297
    },
    {
      "epoch": 2.6838531720772334,
      "grad_norm": 0.38103299361034754,
      "learning_rate": 4.4113883050920725e-05,
      "loss": 1.617,
      "num_input_tokens_seen": 19903604960,
      "step": 25298
    },
    {
      "epoch": 2.6839592616168044,
      "grad_norm": 0.41259717325307976,
      "learning_rate": 4.4113435095744734e-05,
      "loss": 1.6674,
      "num_input_tokens_seen": 19904391760,
      "step": 25299
    },
    {
      "epoch": 2.684065351156376,
      "grad_norm": 0.4045042861260485,
      "learning_rate": 4.4112987125798454e-05,
      "loss": 1.5684,
      "num_input_tokens_seen": 19905178512,
      "step": 25300
    },
    {
      "epoch": 2.6841714406959474,
      "grad_norm": 0.44921727302845893,
      "learning_rate": 4.411253914108221e-05,
      "loss": 1.6656,
      "num_input_tokens_seen": 19905965248,
      "step": 25301
    },
    {
      "epoch": 2.684277530235519,
      "grad_norm": 0.3976192989154091,
      "learning_rate": 4.411209114159636e-05,
      "loss": 1.654,
      "num_input_tokens_seen": 19906752016,
      "step": 25302
    },
    {
      "epoch": 2.6843836197750903,
      "grad_norm": 0.44686194687520736,
      "learning_rate": 4.411164312734124e-05,
      "loss": 1.6152,
      "num_input_tokens_seen": 19907538768,
      "step": 25303
    },
    {
      "epoch": 2.6844897093146614,
      "grad_norm": 0.38607773649366706,
      "learning_rate": 4.411119509831721e-05,
      "loss": 1.6262,
      "num_input_tokens_seen": 19908325488,
      "step": 25304
    },
    {
      "epoch": 2.684595798854233,
      "grad_norm": 0.5300597817079585,
      "learning_rate": 4.4110747054524615e-05,
      "loss": 1.5501,
      "num_input_tokens_seen": 19909112208,
      "step": 25305
    },
    {
      "epoch": 2.6847018883938043,
      "grad_norm": 0.3721385501101282,
      "learning_rate": 4.411029899596378e-05,
      "loss": 1.7193,
      "num_input_tokens_seen": 19909898944,
      "step": 25306
    },
    {
      "epoch": 2.6848079779333758,
      "grad_norm": 0.45488159445252446,
      "learning_rate": 4.4109850922635075e-05,
      "loss": 1.6251,
      "num_input_tokens_seen": 19910685744,
      "step": 25307
    },
    {
      "epoch": 2.6849140674729473,
      "grad_norm": 0.3660594342714461,
      "learning_rate": 4.4109402834538846e-05,
      "loss": 1.5185,
      "num_input_tokens_seen": 19911472528,
      "step": 25308
    },
    {
      "epoch": 2.6850201570125187,
      "grad_norm": 0.35379935619204933,
      "learning_rate": 4.410895473167542e-05,
      "loss": 1.5473,
      "num_input_tokens_seen": 19912259248,
      "step": 25309
    },
    {
      "epoch": 2.68512624655209,
      "grad_norm": 0.43385869828144236,
      "learning_rate": 4.410850661404516e-05,
      "loss": 1.6909,
      "num_input_tokens_seen": 19913046080,
      "step": 25310
    },
    {
      "epoch": 2.6852323360916612,
      "grad_norm": 0.3551710967730347,
      "learning_rate": 4.41080584816484e-05,
      "loss": 1.4962,
      "num_input_tokens_seen": 19913832928,
      "step": 25311
    },
    {
      "epoch": 2.6853384256312327,
      "grad_norm": 0.3723974829518939,
      "learning_rate": 4.41076103344855e-05,
      "loss": 1.5948,
      "num_input_tokens_seen": 19914619632,
      "step": 25312
    },
    {
      "epoch": 2.685444515170804,
      "grad_norm": 0.3946193453645183,
      "learning_rate": 4.41071621725568e-05,
      "loss": 1.6441,
      "num_input_tokens_seen": 19915406416,
      "step": 25313
    },
    {
      "epoch": 2.6855506047103757,
      "grad_norm": 0.3514179533760041,
      "learning_rate": 4.410671399586264e-05,
      "loss": 1.4909,
      "num_input_tokens_seen": 19916193216,
      "step": 25314
    },
    {
      "epoch": 2.685656694249947,
      "grad_norm": 0.37694717143313083,
      "learning_rate": 4.410626580440337e-05,
      "loss": 1.687,
      "num_input_tokens_seen": 19916980016,
      "step": 25315
    },
    {
      "epoch": 2.685762783789518,
      "grad_norm": 0.3444495609600342,
      "learning_rate": 4.410581759817934e-05,
      "loss": 1.6297,
      "num_input_tokens_seen": 19917766720,
      "step": 25316
    },
    {
      "epoch": 2.6858688733290896,
      "grad_norm": 0.34718326569460894,
      "learning_rate": 4.410536937719091e-05,
      "loss": 1.4716,
      "num_input_tokens_seen": 19918553440,
      "step": 25317
    },
    {
      "epoch": 2.685974962868661,
      "grad_norm": 0.43234410340893575,
      "learning_rate": 4.410492114143839e-05,
      "loss": 1.5973,
      "num_input_tokens_seen": 19919340176,
      "step": 25318
    },
    {
      "epoch": 2.6860810524082326,
      "grad_norm": 0.38075497188593216,
      "learning_rate": 4.4104472890922164e-05,
      "loss": 1.5103,
      "num_input_tokens_seen": 19920127040,
      "step": 25319
    },
    {
      "epoch": 2.686187141947804,
      "grad_norm": 0.4763567487637212,
      "learning_rate": 4.4104024625642545e-05,
      "loss": 1.6293,
      "num_input_tokens_seen": 19920913760,
      "step": 25320
    },
    {
      "epoch": 2.686293231487375,
      "grad_norm": 0.5079393827477541,
      "learning_rate": 4.410357634559991e-05,
      "loss": 1.6756,
      "num_input_tokens_seen": 19921700464,
      "step": 25321
    },
    {
      "epoch": 2.686399321026947,
      "grad_norm": 0.5155216273073859,
      "learning_rate": 4.4103128050794585e-05,
      "loss": 1.6174,
      "num_input_tokens_seen": 19922487264,
      "step": 25322
    },
    {
      "epoch": 2.686505410566518,
      "grad_norm": 0.515881200473247,
      "learning_rate": 4.410267974122693e-05,
      "loss": 1.5594,
      "num_input_tokens_seen": 19923273984,
      "step": 25323
    },
    {
      "epoch": 2.6866115001060895,
      "grad_norm": 0.3790056902093035,
      "learning_rate": 4.4102231416897274e-05,
      "loss": 1.5332,
      "num_input_tokens_seen": 19924060720,
      "step": 25324
    },
    {
      "epoch": 2.686717589645661,
      "grad_norm": 0.4702194530599521,
      "learning_rate": 4.410178307780598e-05,
      "loss": 1.7534,
      "num_input_tokens_seen": 19924847520,
      "step": 25325
    },
    {
      "epoch": 2.6868236791852325,
      "grad_norm": 0.4719530302282636,
      "learning_rate": 4.410133472395339e-05,
      "loss": 1.532,
      "num_input_tokens_seen": 19925634304,
      "step": 25326
    },
    {
      "epoch": 2.686929768724804,
      "grad_norm": 0.3968755265597751,
      "learning_rate": 4.410088635533985e-05,
      "loss": 1.5866,
      "num_input_tokens_seen": 19926421008,
      "step": 25327
    },
    {
      "epoch": 2.687035858264375,
      "grad_norm": 0.5034761666704152,
      "learning_rate": 4.41004379719657e-05,
      "loss": 1.6599,
      "num_input_tokens_seen": 19927207744,
      "step": 25328
    },
    {
      "epoch": 2.6871419478039464,
      "grad_norm": 0.4505049069563557,
      "learning_rate": 4.40999895738313e-05,
      "loss": 1.4501,
      "num_input_tokens_seen": 19927994496,
      "step": 25329
    },
    {
      "epoch": 2.687248037343518,
      "grad_norm": 0.4833442237535266,
      "learning_rate": 4.4099541160936984e-05,
      "loss": 1.6526,
      "num_input_tokens_seen": 19928781296,
      "step": 25330
    },
    {
      "epoch": 2.6873541268830894,
      "grad_norm": 0.43125528435464044,
      "learning_rate": 4.40990927332831e-05,
      "loss": 1.6753,
      "num_input_tokens_seen": 19929568016,
      "step": 25331
    },
    {
      "epoch": 2.687460216422661,
      "grad_norm": 0.4660157996029978,
      "learning_rate": 4.409864429087e-05,
      "loss": 1.4915,
      "num_input_tokens_seen": 19930354800,
      "step": 25332
    },
    {
      "epoch": 2.687566305962232,
      "grad_norm": 0.47340709585847934,
      "learning_rate": 4.409819583369803e-05,
      "loss": 1.5985,
      "num_input_tokens_seen": 19931141568,
      "step": 25333
    },
    {
      "epoch": 2.6876723955018034,
      "grad_norm": 0.34377337774507183,
      "learning_rate": 4.409774736176753e-05,
      "loss": 1.4936,
      "num_input_tokens_seen": 19931928304,
      "step": 25334
    },
    {
      "epoch": 2.687778485041375,
      "grad_norm": 0.45511654224528936,
      "learning_rate": 4.409729887507885e-05,
      "loss": 1.6298,
      "num_input_tokens_seen": 19932715024,
      "step": 25335
    },
    {
      "epoch": 2.6878845745809463,
      "grad_norm": 0.4157706672661766,
      "learning_rate": 4.409685037363235e-05,
      "loss": 1.5972,
      "num_input_tokens_seen": 19933501776,
      "step": 25336
    },
    {
      "epoch": 2.687990664120518,
      "grad_norm": 0.4224148181173548,
      "learning_rate": 4.4096401857428355e-05,
      "loss": 1.5237,
      "num_input_tokens_seen": 19934288576,
      "step": 25337
    },
    {
      "epoch": 2.6880967536600893,
      "grad_norm": 0.39291468272146496,
      "learning_rate": 4.4095953326467224e-05,
      "loss": 1.5705,
      "num_input_tokens_seen": 19935075360,
      "step": 25338
    },
    {
      "epoch": 2.6882028431996607,
      "grad_norm": 0.42404779269790344,
      "learning_rate": 4.4095504780749295e-05,
      "loss": 1.5838,
      "num_input_tokens_seen": 19935862208,
      "step": 25339
    },
    {
      "epoch": 2.6883089327392318,
      "grad_norm": 0.43066838316490264,
      "learning_rate": 4.409505622027492e-05,
      "loss": 1.5991,
      "num_input_tokens_seen": 19936648944,
      "step": 25340
    },
    {
      "epoch": 2.6884150222788032,
      "grad_norm": 0.41070190414712515,
      "learning_rate": 4.409460764504446e-05,
      "loss": 1.7199,
      "num_input_tokens_seen": 19937435696,
      "step": 25341
    },
    {
      "epoch": 2.6885211118183747,
      "grad_norm": 0.45069625938383706,
      "learning_rate": 4.409415905505823e-05,
      "loss": 1.7702,
      "num_input_tokens_seen": 19938222496,
      "step": 25342
    },
    {
      "epoch": 2.688627201357946,
      "grad_norm": 0.4707031135806171,
      "learning_rate": 4.4093710450316605e-05,
      "loss": 1.5503,
      "num_input_tokens_seen": 19939009328,
      "step": 25343
    },
    {
      "epoch": 2.6887332908975177,
      "grad_norm": 0.39721121004975346,
      "learning_rate": 4.409326183081992e-05,
      "loss": 1.522,
      "num_input_tokens_seen": 19939796096,
      "step": 25344
    },
    {
      "epoch": 2.6888393804370887,
      "grad_norm": 0.48158236682720773,
      "learning_rate": 4.409281319656852e-05,
      "loss": 1.5788,
      "num_input_tokens_seen": 19940582848,
      "step": 25345
    },
    {
      "epoch": 2.68894546997666,
      "grad_norm": 0.38573057306452646,
      "learning_rate": 4.409236454756275e-05,
      "loss": 1.4728,
      "num_input_tokens_seen": 19941369600,
      "step": 25346
    },
    {
      "epoch": 2.6890515595162316,
      "grad_norm": 0.44680282769912305,
      "learning_rate": 4.409191588380296e-05,
      "loss": 1.6941,
      "num_input_tokens_seen": 19942156384,
      "step": 25347
    },
    {
      "epoch": 2.689157649055803,
      "grad_norm": 0.3477610939008091,
      "learning_rate": 4.4091467205289506e-05,
      "loss": 1.5901,
      "num_input_tokens_seen": 19942943168,
      "step": 25348
    },
    {
      "epoch": 2.6892637385953746,
      "grad_norm": 0.4357398157131492,
      "learning_rate": 4.409101851202272e-05,
      "loss": 1.5624,
      "num_input_tokens_seen": 19943730048,
      "step": 25349
    },
    {
      "epoch": 2.6893698281349456,
      "grad_norm": 0.4109214662064523,
      "learning_rate": 4.409056980400296e-05,
      "loss": 1.5954,
      "num_input_tokens_seen": 19944516688,
      "step": 25350
    },
    {
      "epoch": 2.6894759176745175,
      "grad_norm": 0.3713568526164025,
      "learning_rate": 4.4090121081230565e-05,
      "loss": 1.5525,
      "num_input_tokens_seen": 19945303376,
      "step": 25351
    },
    {
      "epoch": 2.6895820072140886,
      "grad_norm": 0.4199321358349864,
      "learning_rate": 4.408967234370589e-05,
      "loss": 1.635,
      "num_input_tokens_seen": 19946090032,
      "step": 25352
    },
    {
      "epoch": 2.68968809675366,
      "grad_norm": 0.36719358531321505,
      "learning_rate": 4.408922359142927e-05,
      "loss": 1.5109,
      "num_input_tokens_seen": 19946876816,
      "step": 25353
    },
    {
      "epoch": 2.6897941862932315,
      "grad_norm": 0.40074728987110875,
      "learning_rate": 4.408877482440106e-05,
      "loss": 1.6614,
      "num_input_tokens_seen": 19947663600,
      "step": 25354
    },
    {
      "epoch": 2.689900275832803,
      "grad_norm": 0.39716263965722015,
      "learning_rate": 4.4088326042621594e-05,
      "loss": 1.4626,
      "num_input_tokens_seen": 19948450336,
      "step": 25355
    },
    {
      "epoch": 2.6900063653723745,
      "grad_norm": 0.4191563110567415,
      "learning_rate": 4.4087877246091246e-05,
      "loss": 1.5935,
      "num_input_tokens_seen": 19949237008,
      "step": 25356
    },
    {
      "epoch": 2.6901124549119455,
      "grad_norm": 0.39524081210172624,
      "learning_rate": 4.408742843481034e-05,
      "loss": 1.5281,
      "num_input_tokens_seen": 19950023728,
      "step": 25357
    },
    {
      "epoch": 2.690218544451517,
      "grad_norm": 0.4225818888105507,
      "learning_rate": 4.408697960877923e-05,
      "loss": 1.49,
      "num_input_tokens_seen": 19950810544,
      "step": 25358
    },
    {
      "epoch": 2.6903246339910885,
      "grad_norm": 0.36218087379045977,
      "learning_rate": 4.408653076799826e-05,
      "loss": 1.4894,
      "num_input_tokens_seen": 19951597280,
      "step": 25359
    },
    {
      "epoch": 2.69043072353066,
      "grad_norm": 0.3464885086986514,
      "learning_rate": 4.408608191246779e-05,
      "loss": 1.4451,
      "num_input_tokens_seen": 19952384048,
      "step": 25360
    },
    {
      "epoch": 2.6905368130702314,
      "grad_norm": 0.38486106334156794,
      "learning_rate": 4.408563304218814e-05,
      "loss": 1.6288,
      "num_input_tokens_seen": 19953170848,
      "step": 25361
    },
    {
      "epoch": 2.6906429026098024,
      "grad_norm": 0.3918440666605353,
      "learning_rate": 4.4085184157159685e-05,
      "loss": 1.7893,
      "num_input_tokens_seen": 19953957536,
      "step": 25362
    },
    {
      "epoch": 2.690748992149374,
      "grad_norm": 0.35976284118217533,
      "learning_rate": 4.4084735257382756e-05,
      "loss": 1.5295,
      "num_input_tokens_seen": 19954744240,
      "step": 25363
    },
    {
      "epoch": 2.6908550816889454,
      "grad_norm": 0.37851727741260105,
      "learning_rate": 4.40842863428577e-05,
      "loss": 1.501,
      "num_input_tokens_seen": 19955531120,
      "step": 25364
    },
    {
      "epoch": 2.690961171228517,
      "grad_norm": 0.40176912244001695,
      "learning_rate": 4.408383741358487e-05,
      "loss": 1.6377,
      "num_input_tokens_seen": 19956317952,
      "step": 25365
    },
    {
      "epoch": 2.6910672607680883,
      "grad_norm": 0.38037378467195826,
      "learning_rate": 4.408338846956461e-05,
      "loss": 1.6461,
      "num_input_tokens_seen": 19957104624,
      "step": 25366
    },
    {
      "epoch": 2.69117335030766,
      "grad_norm": 0.4019026741349003,
      "learning_rate": 4.408293951079727e-05,
      "loss": 1.6037,
      "num_input_tokens_seen": 19957891424,
      "step": 25367
    },
    {
      "epoch": 2.6912794398472313,
      "grad_norm": 0.40778259347242773,
      "learning_rate": 4.4082490537283186e-05,
      "loss": 1.5861,
      "num_input_tokens_seen": 19958678176,
      "step": 25368
    },
    {
      "epoch": 2.6913855293868023,
      "grad_norm": 0.3708657480278573,
      "learning_rate": 4.408204154902272e-05,
      "loss": 1.615,
      "num_input_tokens_seen": 19959464880,
      "step": 25369
    },
    {
      "epoch": 2.691491618926374,
      "grad_norm": 0.3459978831178949,
      "learning_rate": 4.4081592546016215e-05,
      "loss": 1.5819,
      "num_input_tokens_seen": 19960251664,
      "step": 25370
    },
    {
      "epoch": 2.6915977084659453,
      "grad_norm": 0.4587363594532991,
      "learning_rate": 4.408114352826401e-05,
      "loss": 1.6272,
      "num_input_tokens_seen": 19961038464,
      "step": 25371
    },
    {
      "epoch": 2.6917037980055167,
      "grad_norm": 0.3891941594452299,
      "learning_rate": 4.408069449576646e-05,
      "loss": 1.5588,
      "num_input_tokens_seen": 19961825248,
      "step": 25372
    },
    {
      "epoch": 2.691809887545088,
      "grad_norm": 0.4418496822633991,
      "learning_rate": 4.40802454485239e-05,
      "loss": 1.5868,
      "num_input_tokens_seen": 19962611968,
      "step": 25373
    },
    {
      "epoch": 2.6919159770846592,
      "grad_norm": 0.3899193961246541,
      "learning_rate": 4.4079796386536696e-05,
      "loss": 1.5086,
      "num_input_tokens_seen": 19963398720,
      "step": 25374
    },
    {
      "epoch": 2.6920220666242307,
      "grad_norm": 0.3719637605785254,
      "learning_rate": 4.4079347309805186e-05,
      "loss": 1.5171,
      "num_input_tokens_seen": 19964185424,
      "step": 25375
    },
    {
      "epoch": 2.692128156163802,
      "grad_norm": 0.4214686552439273,
      "learning_rate": 4.407889821832971e-05,
      "loss": 1.6064,
      "num_input_tokens_seen": 19964972048,
      "step": 25376
    },
    {
      "epoch": 2.6922342457033737,
      "grad_norm": 0.45385831542008875,
      "learning_rate": 4.4078449112110633e-05,
      "loss": 1.5833,
      "num_input_tokens_seen": 19965758816,
      "step": 25377
    },
    {
      "epoch": 2.692340335242945,
      "grad_norm": 0.41008875432468,
      "learning_rate": 4.4077999991148276e-05,
      "loss": 1.6889,
      "num_input_tokens_seen": 19966545600,
      "step": 25378
    },
    {
      "epoch": 2.692446424782516,
      "grad_norm": 0.3704303247808797,
      "learning_rate": 4.4077550855443005e-05,
      "loss": 1.5589,
      "num_input_tokens_seen": 19967332336,
      "step": 25379
    },
    {
      "epoch": 2.692552514322088,
      "grad_norm": 0.3722441991440385,
      "learning_rate": 4.4077101704995166e-05,
      "loss": 1.5284,
      "num_input_tokens_seen": 19968119104,
      "step": 25380
    },
    {
      "epoch": 2.692658603861659,
      "grad_norm": 0.33557942778757405,
      "learning_rate": 4.40766525398051e-05,
      "loss": 1.4946,
      "num_input_tokens_seen": 19968905888,
      "step": 25381
    },
    {
      "epoch": 2.6927646934012306,
      "grad_norm": 0.3418521546623642,
      "learning_rate": 4.407620335987316e-05,
      "loss": 1.4182,
      "num_input_tokens_seen": 19969692720,
      "step": 25382
    },
    {
      "epoch": 2.692870782940802,
      "grad_norm": 0.40497518258616133,
      "learning_rate": 4.4075754165199685e-05,
      "loss": 1.4791,
      "num_input_tokens_seen": 19970479504,
      "step": 25383
    },
    {
      "epoch": 2.6929768724803735,
      "grad_norm": 0.4050075947243154,
      "learning_rate": 4.4075304955785024e-05,
      "loss": 1.7313,
      "num_input_tokens_seen": 19971266240,
      "step": 25384
    },
    {
      "epoch": 2.693082962019945,
      "grad_norm": 0.38528336834393967,
      "learning_rate": 4.407485573162953e-05,
      "loss": 1.421,
      "num_input_tokens_seen": 19972052992,
      "step": 25385
    },
    {
      "epoch": 2.693189051559516,
      "grad_norm": 0.4290374084190385,
      "learning_rate": 4.4074406492733556e-05,
      "loss": 1.6981,
      "num_input_tokens_seen": 19972839696,
      "step": 25386
    },
    {
      "epoch": 2.6932951410990875,
      "grad_norm": 0.3802115472923096,
      "learning_rate": 4.407395723909743e-05,
      "loss": 1.6068,
      "num_input_tokens_seen": 19973626448,
      "step": 25387
    },
    {
      "epoch": 2.693401230638659,
      "grad_norm": 0.4199547169157997,
      "learning_rate": 4.407350797072151e-05,
      "loss": 1.5452,
      "num_input_tokens_seen": 19974413200,
      "step": 25388
    },
    {
      "epoch": 2.6935073201782305,
      "grad_norm": 0.3767983567102577,
      "learning_rate": 4.407305868760615e-05,
      "loss": 1.5519,
      "num_input_tokens_seen": 19975199968,
      "step": 25389
    },
    {
      "epoch": 2.693613409717802,
      "grad_norm": 0.37735021586058937,
      "learning_rate": 4.407260938975169e-05,
      "loss": 1.5611,
      "num_input_tokens_seen": 19975986688,
      "step": 25390
    },
    {
      "epoch": 2.693719499257373,
      "grad_norm": 0.4255506754555411,
      "learning_rate": 4.4072160077158466e-05,
      "loss": 1.6992,
      "num_input_tokens_seen": 19976773424,
      "step": 25391
    },
    {
      "epoch": 2.693825588796945,
      "grad_norm": 0.3854505247000328,
      "learning_rate": 4.4071710749826844e-05,
      "loss": 1.6237,
      "num_input_tokens_seen": 19977560144,
      "step": 25392
    },
    {
      "epoch": 2.693931678336516,
      "grad_norm": 0.38005460217991227,
      "learning_rate": 4.407126140775716e-05,
      "loss": 1.748,
      "num_input_tokens_seen": 19978346944,
      "step": 25393
    },
    {
      "epoch": 2.6940377678760874,
      "grad_norm": 0.3922016994651621,
      "learning_rate": 4.407081205094977e-05,
      "loss": 1.659,
      "num_input_tokens_seen": 19979133776,
      "step": 25394
    },
    {
      "epoch": 2.694143857415659,
      "grad_norm": 0.3943704788075349,
      "learning_rate": 4.4070362679405005e-05,
      "loss": 1.7272,
      "num_input_tokens_seen": 19979920480,
      "step": 25395
    },
    {
      "epoch": 2.6942499469552303,
      "grad_norm": 0.4325470930228246,
      "learning_rate": 4.406991329312323e-05,
      "loss": 1.6271,
      "num_input_tokens_seen": 19980707328,
      "step": 25396
    },
    {
      "epoch": 2.694356036494802,
      "grad_norm": 0.36262125654898175,
      "learning_rate": 4.406946389210479e-05,
      "loss": 1.5244,
      "num_input_tokens_seen": 19981494096,
      "step": 25397
    },
    {
      "epoch": 2.694462126034373,
      "grad_norm": 0.42283920090942206,
      "learning_rate": 4.4069014476350024e-05,
      "loss": 1.5452,
      "num_input_tokens_seen": 19982280848,
      "step": 25398
    },
    {
      "epoch": 2.6945682155739443,
      "grad_norm": 0.37222795030642036,
      "learning_rate": 4.406856504585929e-05,
      "loss": 1.6204,
      "num_input_tokens_seen": 19983067536,
      "step": 25399
    },
    {
      "epoch": 2.694674305113516,
      "grad_norm": 0.37708788166982393,
      "learning_rate": 4.406811560063292e-05,
      "loss": 1.5981,
      "num_input_tokens_seen": 19983854320,
      "step": 25400
    },
    {
      "epoch": 2.6947803946530873,
      "grad_norm": 0.43627489235302763,
      "learning_rate": 4.406766614067127e-05,
      "loss": 1.621,
      "num_input_tokens_seen": 19984640992,
      "step": 25401
    },
    {
      "epoch": 2.6948864841926587,
      "grad_norm": 0.3962007976307431,
      "learning_rate": 4.406721666597469e-05,
      "loss": 1.6337,
      "num_input_tokens_seen": 19985427696,
      "step": 25402
    },
    {
      "epoch": 2.69499257373223,
      "grad_norm": 0.3881626375881792,
      "learning_rate": 4.406676717654352e-05,
      "loss": 1.5533,
      "num_input_tokens_seen": 19986214464,
      "step": 25403
    },
    {
      "epoch": 2.6950986632718013,
      "grad_norm": 0.47172473841329876,
      "learning_rate": 4.406631767237812e-05,
      "loss": 1.6332,
      "num_input_tokens_seen": 19987001152,
      "step": 25404
    },
    {
      "epoch": 2.6952047528113727,
      "grad_norm": 0.4502405859537782,
      "learning_rate": 4.4065868153478826e-05,
      "loss": 1.471,
      "num_input_tokens_seen": 19987787920,
      "step": 25405
    },
    {
      "epoch": 2.695310842350944,
      "grad_norm": 0.4324741313984146,
      "learning_rate": 4.406541861984599e-05,
      "loss": 1.6416,
      "num_input_tokens_seen": 19988574576,
      "step": 25406
    },
    {
      "epoch": 2.6954169318905157,
      "grad_norm": 0.4846909214751272,
      "learning_rate": 4.406496907147995e-05,
      "loss": 1.7049,
      "num_input_tokens_seen": 19989361280,
      "step": 25407
    },
    {
      "epoch": 2.695523021430087,
      "grad_norm": 0.4158551556282439,
      "learning_rate": 4.406451950838106e-05,
      "loss": 1.5439,
      "num_input_tokens_seen": 19990148048,
      "step": 25408
    },
    {
      "epoch": 2.6956291109696586,
      "grad_norm": 0.4044725650552871,
      "learning_rate": 4.4064069930549677e-05,
      "loss": 1.6565,
      "num_input_tokens_seen": 19990934816,
      "step": 25409
    },
    {
      "epoch": 2.6957352005092297,
      "grad_norm": 0.4172186468486497,
      "learning_rate": 4.406362033798615e-05,
      "loss": 1.5815,
      "num_input_tokens_seen": 19991721504,
      "step": 25410
    },
    {
      "epoch": 2.695841290048801,
      "grad_norm": 0.38795110556772455,
      "learning_rate": 4.4063170730690797e-05,
      "loss": 1.5471,
      "num_input_tokens_seen": 19992508192,
      "step": 25411
    },
    {
      "epoch": 2.6959473795883726,
      "grad_norm": 0.3905638286056658,
      "learning_rate": 4.406272110866399e-05,
      "loss": 1.6862,
      "num_input_tokens_seen": 19993294944,
      "step": 25412
    },
    {
      "epoch": 2.696053469127944,
      "grad_norm": 0.4458309775172427,
      "learning_rate": 4.406227147190608e-05,
      "loss": 1.6203,
      "num_input_tokens_seen": 19994081664,
      "step": 25413
    },
    {
      "epoch": 2.6961595586675156,
      "grad_norm": 0.37974107889379616,
      "learning_rate": 4.406182182041739e-05,
      "loss": 1.6039,
      "num_input_tokens_seen": 19994868480,
      "step": 25414
    },
    {
      "epoch": 2.6962656482070866,
      "grad_norm": 0.3986610557154588,
      "learning_rate": 4.40613721541983e-05,
      "loss": 1.6023,
      "num_input_tokens_seen": 19995655280,
      "step": 25415
    },
    {
      "epoch": 2.696371737746658,
      "grad_norm": 0.39328350288165953,
      "learning_rate": 4.4060922473249136e-05,
      "loss": 1.6279,
      "num_input_tokens_seen": 19996442048,
      "step": 25416
    },
    {
      "epoch": 2.6964778272862295,
      "grad_norm": 0.3417227362148327,
      "learning_rate": 4.406047277757024e-05,
      "loss": 1.5195,
      "num_input_tokens_seen": 19997228816,
      "step": 25417
    },
    {
      "epoch": 2.696583916825801,
      "grad_norm": 0.4244555547441377,
      "learning_rate": 4.406002306716198e-05,
      "loss": 1.5285,
      "num_input_tokens_seen": 19998015584,
      "step": 25418
    },
    {
      "epoch": 2.6966900063653725,
      "grad_norm": 0.36265117677498676,
      "learning_rate": 4.4059573342024694e-05,
      "loss": 1.5691,
      "num_input_tokens_seen": 19998802352,
      "step": 25419
    },
    {
      "epoch": 2.6967960959049435,
      "grad_norm": 0.38189943337128485,
      "learning_rate": 4.405912360215873e-05,
      "loss": 1.5794,
      "num_input_tokens_seen": 19999589168,
      "step": 25420
    },
    {
      "epoch": 2.6969021854445154,
      "grad_norm": 0.40299530841422027,
      "learning_rate": 4.405867384756442e-05,
      "loss": 1.5738,
      "num_input_tokens_seen": 20000375856,
      "step": 25421
    },
    {
      "epoch": 2.6970082749840865,
      "grad_norm": 0.4382656601566889,
      "learning_rate": 4.405822407824215e-05,
      "loss": 1.6992,
      "num_input_tokens_seen": 20001162624,
      "step": 25422
    },
    {
      "epoch": 2.697114364523658,
      "grad_norm": 0.39296544087819035,
      "learning_rate": 4.405777429419223e-05,
      "loss": 1.5899,
      "num_input_tokens_seen": 20001949376,
      "step": 25423
    },
    {
      "epoch": 2.6972204540632294,
      "grad_norm": 0.4233940700421722,
      "learning_rate": 4.405732449541502e-05,
      "loss": 1.5676,
      "num_input_tokens_seen": 20002736144,
      "step": 25424
    },
    {
      "epoch": 2.697326543602801,
      "grad_norm": 0.4948549147052327,
      "learning_rate": 4.405687468191087e-05,
      "loss": 1.642,
      "num_input_tokens_seen": 20003522976,
      "step": 25425
    },
    {
      "epoch": 2.6974326331423724,
      "grad_norm": 0.3917903253255955,
      "learning_rate": 4.405642485368013e-05,
      "loss": 1.5778,
      "num_input_tokens_seen": 20004309776,
      "step": 25426
    },
    {
      "epoch": 2.6975387226819434,
      "grad_norm": 0.456504074927574,
      "learning_rate": 4.405597501072314e-05,
      "loss": 1.5875,
      "num_input_tokens_seen": 20005096624,
      "step": 25427
    },
    {
      "epoch": 2.697644812221515,
      "grad_norm": 0.43490041306814603,
      "learning_rate": 4.405552515304025e-05,
      "loss": 1.582,
      "num_input_tokens_seen": 20005883408,
      "step": 25428
    },
    {
      "epoch": 2.6977509017610863,
      "grad_norm": 0.36023307696163864,
      "learning_rate": 4.405507528063182e-05,
      "loss": 1.5891,
      "num_input_tokens_seen": 20006670112,
      "step": 25429
    },
    {
      "epoch": 2.697856991300658,
      "grad_norm": 0.3683889936339658,
      "learning_rate": 4.405462539349817e-05,
      "loss": 1.7257,
      "num_input_tokens_seen": 20007456896,
      "step": 25430
    },
    {
      "epoch": 2.6979630808402293,
      "grad_norm": 0.3609695084887291,
      "learning_rate": 4.405417549163968e-05,
      "loss": 1.5246,
      "num_input_tokens_seen": 20008243712,
      "step": 25431
    },
    {
      "epoch": 2.6980691703798003,
      "grad_norm": 0.4471411957226288,
      "learning_rate": 4.4053725575056675e-05,
      "loss": 1.5671,
      "num_input_tokens_seen": 20009030496,
      "step": 25432
    },
    {
      "epoch": 2.698175259919372,
      "grad_norm": 0.32107129061390277,
      "learning_rate": 4.405327564374951e-05,
      "loss": 1.5047,
      "num_input_tokens_seen": 20009817408,
      "step": 25433
    },
    {
      "epoch": 2.6982813494589433,
      "grad_norm": 0.5735070009032294,
      "learning_rate": 4.4052825697718536e-05,
      "loss": 1.7378,
      "num_input_tokens_seen": 20010604064,
      "step": 25434
    },
    {
      "epoch": 2.6983874389985147,
      "grad_norm": 0.40126062772233595,
      "learning_rate": 4.405237573696409e-05,
      "loss": 1.533,
      "num_input_tokens_seen": 20011390928,
      "step": 25435
    },
    {
      "epoch": 2.698493528538086,
      "grad_norm": 0.5337266621008393,
      "learning_rate": 4.4051925761486535e-05,
      "loss": 1.5879,
      "num_input_tokens_seen": 20012177664,
      "step": 25436
    },
    {
      "epoch": 2.6985996180776577,
      "grad_norm": 0.4460717742719442,
      "learning_rate": 4.405147577128621e-05,
      "loss": 1.7297,
      "num_input_tokens_seen": 20012964416,
      "step": 25437
    },
    {
      "epoch": 2.698705707617229,
      "grad_norm": 0.49713972660722944,
      "learning_rate": 4.4051025766363465e-05,
      "loss": 1.5654,
      "num_input_tokens_seen": 20013751184,
      "step": 25438
    },
    {
      "epoch": 2.6988117971568,
      "grad_norm": 0.4599045162018634,
      "learning_rate": 4.405057574671864e-05,
      "loss": 1.4633,
      "num_input_tokens_seen": 20014537968,
      "step": 25439
    },
    {
      "epoch": 2.6989178866963717,
      "grad_norm": 0.4100724441001244,
      "learning_rate": 4.405012571235209e-05,
      "loss": 1.6391,
      "num_input_tokens_seen": 20015324768,
      "step": 25440
    },
    {
      "epoch": 2.699023976235943,
      "grad_norm": 0.5053616048160438,
      "learning_rate": 4.404967566326416e-05,
      "loss": 1.5804,
      "num_input_tokens_seen": 20016111584,
      "step": 25441
    },
    {
      "epoch": 2.6991300657755146,
      "grad_norm": 0.4195178699039185,
      "learning_rate": 4.4049225599455205e-05,
      "loss": 1.6402,
      "num_input_tokens_seen": 20016898368,
      "step": 25442
    },
    {
      "epoch": 2.699236155315086,
      "grad_norm": 0.3927949388239258,
      "learning_rate": 4.404877552092557e-05,
      "loss": 1.6347,
      "num_input_tokens_seen": 20017685152,
      "step": 25443
    },
    {
      "epoch": 2.699342244854657,
      "grad_norm": 0.4860902201022404,
      "learning_rate": 4.404832542767559e-05,
      "loss": 1.5883,
      "num_input_tokens_seen": 20018471920,
      "step": 25444
    },
    {
      "epoch": 2.6994483343942286,
      "grad_norm": 0.3715758296850744,
      "learning_rate": 4.4047875319705634e-05,
      "loss": 1.5487,
      "num_input_tokens_seen": 20019258640,
      "step": 25445
    },
    {
      "epoch": 2.6995544239338,
      "grad_norm": 0.4327629613029464,
      "learning_rate": 4.404742519701604e-05,
      "loss": 1.5852,
      "num_input_tokens_seen": 20020045456,
      "step": 25446
    },
    {
      "epoch": 2.6996605134733715,
      "grad_norm": 0.36471094423255385,
      "learning_rate": 4.4046975059607144e-05,
      "loss": 1.5269,
      "num_input_tokens_seen": 20020832192,
      "step": 25447
    },
    {
      "epoch": 2.699766603012943,
      "grad_norm": 0.3424711289505615,
      "learning_rate": 4.4046524907479304e-05,
      "loss": 1.5673,
      "num_input_tokens_seen": 20021618944,
      "step": 25448
    },
    {
      "epoch": 2.699872692552514,
      "grad_norm": 0.42919960388937534,
      "learning_rate": 4.404607474063288e-05,
      "loss": 1.5821,
      "num_input_tokens_seen": 20022405728,
      "step": 25449
    },
    {
      "epoch": 2.699978782092086,
      "grad_norm": 0.35053514730032914,
      "learning_rate": 4.40456245590682e-05,
      "loss": 1.5726,
      "num_input_tokens_seen": 20023192480,
      "step": 25450
    },
    {
      "epoch": 2.700084871631657,
      "grad_norm": 0.40125456340118504,
      "learning_rate": 4.404517436278562e-05,
      "loss": 1.6454,
      "num_input_tokens_seen": 20023979296,
      "step": 25451
    },
    {
      "epoch": 2.7001909611712285,
      "grad_norm": 0.5127044960637372,
      "learning_rate": 4.4044724151785486e-05,
      "loss": 1.6561,
      "num_input_tokens_seen": 20024766048,
      "step": 25452
    },
    {
      "epoch": 2.7002970507108,
      "grad_norm": 0.3483128852659303,
      "learning_rate": 4.4044273926068156e-05,
      "loss": 1.5647,
      "num_input_tokens_seen": 20025552752,
      "step": 25453
    },
    {
      "epoch": 2.7004031402503714,
      "grad_norm": 0.4140131731270573,
      "learning_rate": 4.4043823685633966e-05,
      "loss": 1.4991,
      "num_input_tokens_seen": 20026339472,
      "step": 25454
    },
    {
      "epoch": 2.700509229789943,
      "grad_norm": 0.43209493787064185,
      "learning_rate": 4.4043373430483264e-05,
      "loss": 1.6183,
      "num_input_tokens_seen": 20027126224,
      "step": 25455
    },
    {
      "epoch": 2.700615319329514,
      "grad_norm": 0.3487987466368588,
      "learning_rate": 4.404292316061641e-05,
      "loss": 1.5875,
      "num_input_tokens_seen": 20027912976,
      "step": 25456
    },
    {
      "epoch": 2.7007214088690854,
      "grad_norm": 0.4714881564556452,
      "learning_rate": 4.4042472876033736e-05,
      "loss": 1.7292,
      "num_input_tokens_seen": 20028699600,
      "step": 25457
    },
    {
      "epoch": 2.700827498408657,
      "grad_norm": 0.3768712501843625,
      "learning_rate": 4.4042022576735596e-05,
      "loss": 1.646,
      "num_input_tokens_seen": 20029486400,
      "step": 25458
    },
    {
      "epoch": 2.7009335879482284,
      "grad_norm": 0.3730373036109803,
      "learning_rate": 4.404157226272235e-05,
      "loss": 1.6355,
      "num_input_tokens_seen": 20030273120,
      "step": 25459
    },
    {
      "epoch": 2.7010396774878,
      "grad_norm": 0.39440123872731253,
      "learning_rate": 4.4041121933994335e-05,
      "loss": 1.5434,
      "num_input_tokens_seen": 20031059984,
      "step": 25460
    },
    {
      "epoch": 2.701145767027371,
      "grad_norm": 0.3531558961930044,
      "learning_rate": 4.4040671590551887e-05,
      "loss": 1.5481,
      "num_input_tokens_seen": 20031846704,
      "step": 25461
    },
    {
      "epoch": 2.7012518565669423,
      "grad_norm": 0.36833428507237664,
      "learning_rate": 4.404022123239537e-05,
      "loss": 1.6845,
      "num_input_tokens_seen": 20032633488,
      "step": 25462
    },
    {
      "epoch": 2.701357946106514,
      "grad_norm": 0.4128027175382024,
      "learning_rate": 4.403977085952514e-05,
      "loss": 1.7394,
      "num_input_tokens_seen": 20033420240,
      "step": 25463
    },
    {
      "epoch": 2.7014640356460853,
      "grad_norm": 0.3901212002428181,
      "learning_rate": 4.403932047194153e-05,
      "loss": 1.6486,
      "num_input_tokens_seen": 20034207056,
      "step": 25464
    },
    {
      "epoch": 2.7015701251856568,
      "grad_norm": 0.36990184898511486,
      "learning_rate": 4.4038870069644886e-05,
      "loss": 1.4904,
      "num_input_tokens_seen": 20034993744,
      "step": 25465
    },
    {
      "epoch": 2.7016762147252282,
      "grad_norm": 0.4232421498251875,
      "learning_rate": 4.4038419652635566e-05,
      "loss": 1.6338,
      "num_input_tokens_seen": 20035780512,
      "step": 25466
    },
    {
      "epoch": 2.7017823042647997,
      "grad_norm": 0.372268796077116,
      "learning_rate": 4.4037969220913914e-05,
      "loss": 1.6165,
      "num_input_tokens_seen": 20036567248,
      "step": 25467
    },
    {
      "epoch": 2.7018883938043707,
      "grad_norm": 0.41467812473387444,
      "learning_rate": 4.403751877448027e-05,
      "loss": 1.7999,
      "num_input_tokens_seen": 20037354000,
      "step": 25468
    },
    {
      "epoch": 2.701994483343942,
      "grad_norm": 0.38055428541738484,
      "learning_rate": 4.4037068313335e-05,
      "loss": 1.6433,
      "num_input_tokens_seen": 20038140736,
      "step": 25469
    },
    {
      "epoch": 2.7021005728835137,
      "grad_norm": 0.4089056162016353,
      "learning_rate": 4.403661783747844e-05,
      "loss": 1.4957,
      "num_input_tokens_seen": 20038927552,
      "step": 25470
    },
    {
      "epoch": 2.702206662423085,
      "grad_norm": 0.5254414466544766,
      "learning_rate": 4.4036167346910936e-05,
      "loss": 1.6934,
      "num_input_tokens_seen": 20039714320,
      "step": 25471
    },
    {
      "epoch": 2.7023127519626566,
      "grad_norm": 0.3961250697680275,
      "learning_rate": 4.403571684163285e-05,
      "loss": 1.5585,
      "num_input_tokens_seen": 20040501056,
      "step": 25472
    },
    {
      "epoch": 2.7024188415022277,
      "grad_norm": 0.4367466666425398,
      "learning_rate": 4.403526632164451e-05,
      "loss": 1.7708,
      "num_input_tokens_seen": 20041287792,
      "step": 25473
    },
    {
      "epoch": 2.702524931041799,
      "grad_norm": 0.4160778138355371,
      "learning_rate": 4.4034815786946275e-05,
      "loss": 1.4952,
      "num_input_tokens_seen": 20042074544,
      "step": 25474
    },
    {
      "epoch": 2.7026310205813706,
      "grad_norm": 0.42906240980761695,
      "learning_rate": 4.40343652375385e-05,
      "loss": 1.5753,
      "num_input_tokens_seen": 20042861360,
      "step": 25475
    },
    {
      "epoch": 2.702737110120942,
      "grad_norm": 0.3912944018881911,
      "learning_rate": 4.403391467342152e-05,
      "loss": 1.6158,
      "num_input_tokens_seen": 20043648144,
      "step": 25476
    },
    {
      "epoch": 2.7028431996605136,
      "grad_norm": 0.3581242501865565,
      "learning_rate": 4.40334640945957e-05,
      "loss": 1.5034,
      "num_input_tokens_seen": 20044434944,
      "step": 25477
    },
    {
      "epoch": 2.702949289200085,
      "grad_norm": 0.3756668267910639,
      "learning_rate": 4.403301350106136e-05,
      "loss": 1.6702,
      "num_input_tokens_seen": 20045221696,
      "step": 25478
    },
    {
      "epoch": 2.7030553787396565,
      "grad_norm": 0.4485473504774983,
      "learning_rate": 4.403256289281888e-05,
      "loss": 1.6596,
      "num_input_tokens_seen": 20046008400,
      "step": 25479
    },
    {
      "epoch": 2.7031614682792275,
      "grad_norm": 0.515993476434316,
      "learning_rate": 4.403211226986859e-05,
      "loss": 1.5658,
      "num_input_tokens_seen": 20046795104,
      "step": 25480
    },
    {
      "epoch": 2.703267557818799,
      "grad_norm": 0.3999974979925019,
      "learning_rate": 4.4031661632210844e-05,
      "loss": 1.6487,
      "num_input_tokens_seen": 20047581824,
      "step": 25481
    },
    {
      "epoch": 2.7033736473583705,
      "grad_norm": 0.4030553492436052,
      "learning_rate": 4.4031210979845986e-05,
      "loss": 1.7367,
      "num_input_tokens_seen": 20048368608,
      "step": 25482
    },
    {
      "epoch": 2.703479736897942,
      "grad_norm": 0.4616951166343535,
      "learning_rate": 4.403076031277436e-05,
      "loss": 1.5881,
      "num_input_tokens_seen": 20049155408,
      "step": 25483
    },
    {
      "epoch": 2.7035858264375134,
      "grad_norm": 0.36857547046740374,
      "learning_rate": 4.403030963099632e-05,
      "loss": 1.5324,
      "num_input_tokens_seen": 20049942208,
      "step": 25484
    },
    {
      "epoch": 2.7036919159770845,
      "grad_norm": 0.42144815961217325,
      "learning_rate": 4.402985893451222e-05,
      "loss": 1.5301,
      "num_input_tokens_seen": 20050729024,
      "step": 25485
    },
    {
      "epoch": 2.703798005516656,
      "grad_norm": 0.4227403474224526,
      "learning_rate": 4.402940822332241e-05,
      "loss": 1.589,
      "num_input_tokens_seen": 20051515840,
      "step": 25486
    },
    {
      "epoch": 2.7039040950562274,
      "grad_norm": 0.4228053683039566,
      "learning_rate": 4.402895749742723e-05,
      "loss": 1.7466,
      "num_input_tokens_seen": 20052302624,
      "step": 25487
    },
    {
      "epoch": 2.704010184595799,
      "grad_norm": 0.4896841336468569,
      "learning_rate": 4.4028506756827025e-05,
      "loss": 1.707,
      "num_input_tokens_seen": 20053089472,
      "step": 25488
    },
    {
      "epoch": 2.7041162741353704,
      "grad_norm": 0.36983717275506156,
      "learning_rate": 4.402805600152216e-05,
      "loss": 1.6316,
      "num_input_tokens_seen": 20053876224,
      "step": 25489
    },
    {
      "epoch": 2.7042223636749414,
      "grad_norm": 0.4517228762841985,
      "learning_rate": 4.4027605231512955e-05,
      "loss": 1.5816,
      "num_input_tokens_seen": 20054663008,
      "step": 25490
    },
    {
      "epoch": 2.7043284532145133,
      "grad_norm": 0.4343128491132731,
      "learning_rate": 4.402715444679978e-05,
      "loss": 1.7171,
      "num_input_tokens_seen": 20055449776,
      "step": 25491
    },
    {
      "epoch": 2.7044345427540843,
      "grad_norm": 0.44323931754235635,
      "learning_rate": 4.4026703647382983e-05,
      "loss": 1.4698,
      "num_input_tokens_seen": 20056236512,
      "step": 25492
    },
    {
      "epoch": 2.704540632293656,
      "grad_norm": 0.5330136189554586,
      "learning_rate": 4.4026252833262906e-05,
      "loss": 1.7239,
      "num_input_tokens_seen": 20057023280,
      "step": 25493
    },
    {
      "epoch": 2.7046467218332273,
      "grad_norm": 0.4210999322787873,
      "learning_rate": 4.402580200443989e-05,
      "loss": 1.6549,
      "num_input_tokens_seen": 20057810032,
      "step": 25494
    },
    {
      "epoch": 2.7047528113727988,
      "grad_norm": 0.6096024913417775,
      "learning_rate": 4.4025351160914305e-05,
      "loss": 1.6337,
      "num_input_tokens_seen": 20058596912,
      "step": 25495
    },
    {
      "epoch": 2.7048589009123702,
      "grad_norm": 0.37873206623741457,
      "learning_rate": 4.402490030268648e-05,
      "loss": 1.5782,
      "num_input_tokens_seen": 20059383712,
      "step": 25496
    },
    {
      "epoch": 2.7049649904519413,
      "grad_norm": 0.6346972256119827,
      "learning_rate": 4.4024449429756774e-05,
      "loss": 1.5585,
      "num_input_tokens_seen": 20060170528,
      "step": 25497
    },
    {
      "epoch": 2.7050710799915128,
      "grad_norm": 0.40576728018591574,
      "learning_rate": 4.402399854212553e-05,
      "loss": 1.7244,
      "num_input_tokens_seen": 20060957280,
      "step": 25498
    },
    {
      "epoch": 2.7051771695310842,
      "grad_norm": 0.4192619579621293,
      "learning_rate": 4.4023547639793094e-05,
      "loss": 1.5421,
      "num_input_tokens_seen": 20061743968,
      "step": 25499
    },
    {
      "epoch": 2.7052832590706557,
      "grad_norm": 0.45561018261327896,
      "learning_rate": 4.402309672275983e-05,
      "loss": 1.5562,
      "num_input_tokens_seen": 20062530640,
      "step": 25500
    },
    {
      "epoch": 2.705389348610227,
      "grad_norm": 0.4209848871860055,
      "learning_rate": 4.402264579102606e-05,
      "loss": 1.6057,
      "num_input_tokens_seen": 20063317376,
      "step": 25501
    },
    {
      "epoch": 2.705495438149798,
      "grad_norm": 0.48218302908536403,
      "learning_rate": 4.4022194844592154e-05,
      "loss": 1.6788,
      "num_input_tokens_seen": 20064104080,
      "step": 25502
    },
    {
      "epoch": 2.7056015276893697,
      "grad_norm": 0.36764352526656197,
      "learning_rate": 4.402174388345846e-05,
      "loss": 1.5335,
      "num_input_tokens_seen": 20064890864,
      "step": 25503
    },
    {
      "epoch": 2.705707617228941,
      "grad_norm": 0.38987405426212746,
      "learning_rate": 4.4021292907625317e-05,
      "loss": 1.5939,
      "num_input_tokens_seen": 20065677664,
      "step": 25504
    },
    {
      "epoch": 2.7058137067685126,
      "grad_norm": 0.4505023507701477,
      "learning_rate": 4.402084191709308e-05,
      "loss": 1.571,
      "num_input_tokens_seen": 20066464432,
      "step": 25505
    },
    {
      "epoch": 2.705919796308084,
      "grad_norm": 0.35981729546613983,
      "learning_rate": 4.4020390911862087e-05,
      "loss": 1.6058,
      "num_input_tokens_seen": 20067251168,
      "step": 25506
    },
    {
      "epoch": 2.7060258858476556,
      "grad_norm": 0.4861757995685326,
      "learning_rate": 4.4019939891932695e-05,
      "loss": 1.625,
      "num_input_tokens_seen": 20068037856,
      "step": 25507
    },
    {
      "epoch": 2.706131975387227,
      "grad_norm": 0.35073883366341424,
      "learning_rate": 4.4019488857305256e-05,
      "loss": 1.6349,
      "num_input_tokens_seen": 20068824720,
      "step": 25508
    },
    {
      "epoch": 2.706238064926798,
      "grad_norm": 0.428313815370965,
      "learning_rate": 4.4019037807980115e-05,
      "loss": 1.6689,
      "num_input_tokens_seen": 20069611472,
      "step": 25509
    },
    {
      "epoch": 2.7063441544663696,
      "grad_norm": 0.3704485650637052,
      "learning_rate": 4.401858674395761e-05,
      "loss": 1.5271,
      "num_input_tokens_seen": 20070398240,
      "step": 25510
    },
    {
      "epoch": 2.706450244005941,
      "grad_norm": 0.3993732047670567,
      "learning_rate": 4.401813566523811e-05,
      "loss": 1.628,
      "num_input_tokens_seen": 20071185056,
      "step": 25511
    },
    {
      "epoch": 2.7065563335455125,
      "grad_norm": 0.39558327669558435,
      "learning_rate": 4.401768457182195e-05,
      "loss": 1.532,
      "num_input_tokens_seen": 20071971840,
      "step": 25512
    },
    {
      "epoch": 2.706662423085084,
      "grad_norm": 0.3289398750684797,
      "learning_rate": 4.4017233463709474e-05,
      "loss": 1.4799,
      "num_input_tokens_seen": 20072758656,
      "step": 25513
    },
    {
      "epoch": 2.706768512624655,
      "grad_norm": 0.33023587497271956,
      "learning_rate": 4.401678234090104e-05,
      "loss": 1.465,
      "num_input_tokens_seen": 20073545424,
      "step": 25514
    },
    {
      "epoch": 2.7068746021642265,
      "grad_norm": 0.3512363247076787,
      "learning_rate": 4.4016331203397004e-05,
      "loss": 1.6277,
      "num_input_tokens_seen": 20074332176,
      "step": 25515
    },
    {
      "epoch": 2.706980691703798,
      "grad_norm": 0.42387158017949933,
      "learning_rate": 4.40158800511977e-05,
      "loss": 1.8236,
      "num_input_tokens_seen": 20075118928,
      "step": 25516
    },
    {
      "epoch": 2.7070867812433694,
      "grad_norm": 0.3800277149932189,
      "learning_rate": 4.4015428884303476e-05,
      "loss": 1.6036,
      "num_input_tokens_seen": 20075905600,
      "step": 25517
    },
    {
      "epoch": 2.707192870782941,
      "grad_norm": 0.397408078771664,
      "learning_rate": 4.4014977702714696e-05,
      "loss": 1.6261,
      "num_input_tokens_seen": 20076692304,
      "step": 25518
    },
    {
      "epoch": 2.707298960322512,
      "grad_norm": 0.33967159175869643,
      "learning_rate": 4.40145265064317e-05,
      "loss": 1.4299,
      "num_input_tokens_seen": 20077479152,
      "step": 25519
    },
    {
      "epoch": 2.707405049862084,
      "grad_norm": 0.40778888150409803,
      "learning_rate": 4.4014075295454824e-05,
      "loss": 1.8133,
      "num_input_tokens_seen": 20078265904,
      "step": 25520
    },
    {
      "epoch": 2.707511139401655,
      "grad_norm": 0.37379935739645703,
      "learning_rate": 4.4013624069784436e-05,
      "loss": 1.5929,
      "num_input_tokens_seen": 20079052608,
      "step": 25521
    },
    {
      "epoch": 2.7076172289412264,
      "grad_norm": 0.3997454479630735,
      "learning_rate": 4.401317282942088e-05,
      "loss": 1.535,
      "num_input_tokens_seen": 20079839424,
      "step": 25522
    },
    {
      "epoch": 2.707723318480798,
      "grad_norm": 0.3462166641983946,
      "learning_rate": 4.4012721574364494e-05,
      "loss": 1.4846,
      "num_input_tokens_seen": 20080626224,
      "step": 25523
    },
    {
      "epoch": 2.7078294080203693,
      "grad_norm": 0.3595113147663037,
      "learning_rate": 4.401227030461564e-05,
      "loss": 1.5623,
      "num_input_tokens_seen": 20081412928,
      "step": 25524
    },
    {
      "epoch": 2.707935497559941,
      "grad_norm": 0.4153004695709431,
      "learning_rate": 4.401181902017466e-05,
      "loss": 1.6998,
      "num_input_tokens_seen": 20082199776,
      "step": 25525
    },
    {
      "epoch": 2.708041587099512,
      "grad_norm": 0.36219546483329024,
      "learning_rate": 4.4011367721041906e-05,
      "loss": 1.5704,
      "num_input_tokens_seen": 20082986528,
      "step": 25526
    },
    {
      "epoch": 2.7081476766390833,
      "grad_norm": 0.4109534484312341,
      "learning_rate": 4.401091640721773e-05,
      "loss": 1.6534,
      "num_input_tokens_seen": 20083773296,
      "step": 25527
    },
    {
      "epoch": 2.7082537661786548,
      "grad_norm": 0.4972246069691571,
      "learning_rate": 4.4010465078702465e-05,
      "loss": 1.6212,
      "num_input_tokens_seen": 20084559984,
      "step": 25528
    },
    {
      "epoch": 2.7083598557182262,
      "grad_norm": 0.3737000356034151,
      "learning_rate": 4.401001373549647e-05,
      "loss": 1.5707,
      "num_input_tokens_seen": 20085346704,
      "step": 25529
    },
    {
      "epoch": 2.7084659452577977,
      "grad_norm": 0.45191909610172004,
      "learning_rate": 4.40095623776001e-05,
      "loss": 1.6499,
      "num_input_tokens_seen": 20086133520,
      "step": 25530
    },
    {
      "epoch": 2.7085720347973687,
      "grad_norm": 0.4120348356756692,
      "learning_rate": 4.40091110050137e-05,
      "loss": 1.5256,
      "num_input_tokens_seen": 20086920288,
      "step": 25531
    },
    {
      "epoch": 2.70867812433694,
      "grad_norm": 0.43844998724980644,
      "learning_rate": 4.400865961773761e-05,
      "loss": 1.5719,
      "num_input_tokens_seen": 20087707072,
      "step": 25532
    },
    {
      "epoch": 2.7087842138765117,
      "grad_norm": 0.49819104660269337,
      "learning_rate": 4.4008208215772196e-05,
      "loss": 1.6854,
      "num_input_tokens_seen": 20088493872,
      "step": 25533
    },
    {
      "epoch": 2.708890303416083,
      "grad_norm": 0.44588895828587677,
      "learning_rate": 4.4007756799117786e-05,
      "loss": 1.5345,
      "num_input_tokens_seen": 20089280544,
      "step": 25534
    },
    {
      "epoch": 2.7089963929556546,
      "grad_norm": 0.3634577107410669,
      "learning_rate": 4.400730536777474e-05,
      "loss": 1.5721,
      "num_input_tokens_seen": 20090067280,
      "step": 25535
    },
    {
      "epoch": 2.709102482495226,
      "grad_norm": 0.3825046716417851,
      "learning_rate": 4.4006853921743407e-05,
      "loss": 1.6233,
      "num_input_tokens_seen": 20090854048,
      "step": 25536
    },
    {
      "epoch": 2.7092085720347976,
      "grad_norm": 0.3750410330822017,
      "learning_rate": 4.400640246102414e-05,
      "loss": 1.6653,
      "num_input_tokens_seen": 20091640784,
      "step": 25537
    },
    {
      "epoch": 2.7093146615743686,
      "grad_norm": 0.46176737804606244,
      "learning_rate": 4.400595098561728e-05,
      "loss": 1.6124,
      "num_input_tokens_seen": 20092427584,
      "step": 25538
    },
    {
      "epoch": 2.70942075111394,
      "grad_norm": 0.4306852787109693,
      "learning_rate": 4.400549949552318e-05,
      "loss": 1.6087,
      "num_input_tokens_seen": 20093214304,
      "step": 25539
    },
    {
      "epoch": 2.7095268406535116,
      "grad_norm": 0.37526969369444124,
      "learning_rate": 4.400504799074218e-05,
      "loss": 1.5495,
      "num_input_tokens_seen": 20094001120,
      "step": 25540
    },
    {
      "epoch": 2.709632930193083,
      "grad_norm": 0.4266542181754246,
      "learning_rate": 4.400459647127464e-05,
      "loss": 1.6253,
      "num_input_tokens_seen": 20094787920,
      "step": 25541
    },
    {
      "epoch": 2.7097390197326545,
      "grad_norm": 0.3849539000000551,
      "learning_rate": 4.400414493712092e-05,
      "loss": 1.5441,
      "num_input_tokens_seen": 20095574672,
      "step": 25542
    },
    {
      "epoch": 2.7098451092722255,
      "grad_norm": 0.413328225089287,
      "learning_rate": 4.4003693388281334e-05,
      "loss": 1.6096,
      "num_input_tokens_seen": 20096361360,
      "step": 25543
    },
    {
      "epoch": 2.709951198811797,
      "grad_norm": 0.44096286813979874,
      "learning_rate": 4.4003241824756256e-05,
      "loss": 1.54,
      "num_input_tokens_seen": 20097148208,
      "step": 25544
    },
    {
      "epoch": 2.7100572883513685,
      "grad_norm": 0.4017361832821151,
      "learning_rate": 4.400279024654605e-05,
      "loss": 1.5955,
      "num_input_tokens_seen": 20097934928,
      "step": 25545
    },
    {
      "epoch": 2.71016337789094,
      "grad_norm": 0.40465402585373417,
      "learning_rate": 4.4002338653651024e-05,
      "loss": 1.5718,
      "num_input_tokens_seen": 20098721696,
      "step": 25546
    },
    {
      "epoch": 2.7102694674305114,
      "grad_norm": 0.34122209415526306,
      "learning_rate": 4.400188704607155e-05,
      "loss": 1.5107,
      "num_input_tokens_seen": 20099508544,
      "step": 25547
    },
    {
      "epoch": 2.7103755569700825,
      "grad_norm": 0.3899453970510248,
      "learning_rate": 4.400143542380798e-05,
      "loss": 1.6808,
      "num_input_tokens_seen": 20100295296,
      "step": 25548
    },
    {
      "epoch": 2.7104816465096544,
      "grad_norm": 0.42328478621232823,
      "learning_rate": 4.4000983786860656e-05,
      "loss": 1.7089,
      "num_input_tokens_seen": 20101081936,
      "step": 25549
    },
    {
      "epoch": 2.7105877360492254,
      "grad_norm": 0.3856314646481146,
      "learning_rate": 4.4000532135229936e-05,
      "loss": 1.5438,
      "num_input_tokens_seen": 20101868784,
      "step": 25550
    },
    {
      "epoch": 2.710693825588797,
      "grad_norm": 0.691727433111196,
      "learning_rate": 4.400008046891615e-05,
      "loss": 1.7309,
      "num_input_tokens_seen": 20102655552,
      "step": 25551
    },
    {
      "epoch": 2.7107999151283684,
      "grad_norm": 0.61891736605352,
      "learning_rate": 4.3999628787919664e-05,
      "loss": 1.5367,
      "num_input_tokens_seen": 20103442320,
      "step": 25552
    },
    {
      "epoch": 2.71090600466794,
      "grad_norm": 0.5764523337468155,
      "learning_rate": 4.399917709224083e-05,
      "loss": 1.6137,
      "num_input_tokens_seen": 20104229072,
      "step": 25553
    },
    {
      "epoch": 2.7110120942075113,
      "grad_norm": 0.4788801693299619,
      "learning_rate": 4.399872538187998e-05,
      "loss": 1.5964,
      "num_input_tokens_seen": 20105015792,
      "step": 25554
    },
    {
      "epoch": 2.7111181837470824,
      "grad_norm": 0.5031526232883311,
      "learning_rate": 4.399827365683748e-05,
      "loss": 1.6058,
      "num_input_tokens_seen": 20105802496,
      "step": 25555
    },
    {
      "epoch": 2.711224273286654,
      "grad_norm": 0.38022907489662744,
      "learning_rate": 4.3997821917113666e-05,
      "loss": 1.5544,
      "num_input_tokens_seen": 20106589184,
      "step": 25556
    },
    {
      "epoch": 2.7113303628262253,
      "grad_norm": 0.5237023942117631,
      "learning_rate": 4.3997370162708894e-05,
      "loss": 1.637,
      "num_input_tokens_seen": 20107375984,
      "step": 25557
    },
    {
      "epoch": 2.711436452365797,
      "grad_norm": 0.45618071797818255,
      "learning_rate": 4.399691839362351e-05,
      "loss": 1.6472,
      "num_input_tokens_seen": 20108162768,
      "step": 25558
    },
    {
      "epoch": 2.7115425419053683,
      "grad_norm": 0.40516814706819526,
      "learning_rate": 4.3996466609857866e-05,
      "loss": 1.606,
      "num_input_tokens_seen": 20108949472,
      "step": 25559
    },
    {
      "epoch": 2.7116486314449393,
      "grad_norm": 0.38318313502911905,
      "learning_rate": 4.3996014811412313e-05,
      "loss": 1.6116,
      "num_input_tokens_seen": 20109736240,
      "step": 25560
    },
    {
      "epoch": 2.711754720984511,
      "grad_norm": 0.38641323173646575,
      "learning_rate": 4.39955629982872e-05,
      "loss": 1.5116,
      "num_input_tokens_seen": 20110522992,
      "step": 25561
    },
    {
      "epoch": 2.7118608105240822,
      "grad_norm": 0.3098290152387091,
      "learning_rate": 4.399511117048286e-05,
      "loss": 1.4637,
      "num_input_tokens_seen": 20111309712,
      "step": 25562
    },
    {
      "epoch": 2.7119669000636537,
      "grad_norm": 0.44542833371174584,
      "learning_rate": 4.399465932799967e-05,
      "loss": 1.643,
      "num_input_tokens_seen": 20112096400,
      "step": 25563
    },
    {
      "epoch": 2.712072989603225,
      "grad_norm": 0.4252985791464959,
      "learning_rate": 4.3994207470837953e-05,
      "loss": 1.5914,
      "num_input_tokens_seen": 20112883232,
      "step": 25564
    },
    {
      "epoch": 2.7121790791427967,
      "grad_norm": 0.4223991055636295,
      "learning_rate": 4.3993755598998074e-05,
      "loss": 1.6156,
      "num_input_tokens_seen": 20113670032,
      "step": 25565
    },
    {
      "epoch": 2.712285168682368,
      "grad_norm": 0.4148282203364837,
      "learning_rate": 4.399330371248038e-05,
      "loss": 1.699,
      "num_input_tokens_seen": 20114456896,
      "step": 25566
    },
    {
      "epoch": 2.712391258221939,
      "grad_norm": 0.4111133088020902,
      "learning_rate": 4.399285181128522e-05,
      "loss": 1.4938,
      "num_input_tokens_seen": 20115243648,
      "step": 25567
    },
    {
      "epoch": 2.7124973477615106,
      "grad_norm": 0.3951184014397618,
      "learning_rate": 4.399239989541294e-05,
      "loss": 1.5793,
      "num_input_tokens_seen": 20116030480,
      "step": 25568
    },
    {
      "epoch": 2.712603437301082,
      "grad_norm": 0.5278466945647057,
      "learning_rate": 4.399194796486389e-05,
      "loss": 1.7172,
      "num_input_tokens_seen": 20116817280,
      "step": 25569
    },
    {
      "epoch": 2.7127095268406536,
      "grad_norm": 0.3864770659840847,
      "learning_rate": 4.399149601963842e-05,
      "loss": 1.5195,
      "num_input_tokens_seen": 20117604064,
      "step": 25570
    },
    {
      "epoch": 2.712815616380225,
      "grad_norm": 0.47906074277437277,
      "learning_rate": 4.3991044059736876e-05,
      "loss": 1.628,
      "num_input_tokens_seen": 20118390816,
      "step": 25571
    },
    {
      "epoch": 2.712921705919796,
      "grad_norm": 0.4810298185299266,
      "learning_rate": 4.399059208515962e-05,
      "loss": 1.6014,
      "num_input_tokens_seen": 20119177600,
      "step": 25572
    },
    {
      "epoch": 2.7130277954593676,
      "grad_norm": 0.40364886939142897,
      "learning_rate": 4.399014009590698e-05,
      "loss": 1.6091,
      "num_input_tokens_seen": 20119964288,
      "step": 25573
    },
    {
      "epoch": 2.713133884998939,
      "grad_norm": 0.5003578734234624,
      "learning_rate": 4.398968809197932e-05,
      "loss": 1.756,
      "num_input_tokens_seen": 20120751008,
      "step": 25574
    },
    {
      "epoch": 2.7132399745385105,
      "grad_norm": 0.5081357015393645,
      "learning_rate": 4.3989236073376995e-05,
      "loss": 1.6211,
      "num_input_tokens_seen": 20121537856,
      "step": 25575
    },
    {
      "epoch": 2.713346064078082,
      "grad_norm": 0.4028740589816236,
      "learning_rate": 4.398878404010033e-05,
      "loss": 1.5905,
      "num_input_tokens_seen": 20122324672,
      "step": 25576
    },
    {
      "epoch": 2.7134521536176535,
      "grad_norm": 0.45628906122977586,
      "learning_rate": 4.39883319921497e-05,
      "loss": 1.5391,
      "num_input_tokens_seen": 20123111424,
      "step": 25577
    },
    {
      "epoch": 2.713558243157225,
      "grad_norm": 0.5354610219980283,
      "learning_rate": 4.398787992952545e-05,
      "loss": 1.6621,
      "num_input_tokens_seen": 20123898208,
      "step": 25578
    },
    {
      "epoch": 2.713664332696796,
      "grad_norm": 0.41117674437213053,
      "learning_rate": 4.398742785222791e-05,
      "loss": 1.5089,
      "num_input_tokens_seen": 20124684992,
      "step": 25579
    },
    {
      "epoch": 2.7137704222363674,
      "grad_norm": 0.6043765154035889,
      "learning_rate": 4.3986975760257447e-05,
      "loss": 1.5891,
      "num_input_tokens_seen": 20125471744,
      "step": 25580
    },
    {
      "epoch": 2.713876511775939,
      "grad_norm": 0.4360423283511888,
      "learning_rate": 4.398652365361441e-05,
      "loss": 1.6316,
      "num_input_tokens_seen": 20126258560,
      "step": 25581
    },
    {
      "epoch": 2.7139826013155104,
      "grad_norm": 0.4725068236187782,
      "learning_rate": 4.398607153229914e-05,
      "loss": 1.5766,
      "num_input_tokens_seen": 20127045360,
      "step": 25582
    },
    {
      "epoch": 2.714088690855082,
      "grad_norm": 0.5041621312053236,
      "learning_rate": 4.3985619396312e-05,
      "loss": 1.615,
      "num_input_tokens_seen": 20127832032,
      "step": 25583
    },
    {
      "epoch": 2.714194780394653,
      "grad_norm": 0.47294055352293707,
      "learning_rate": 4.3985167245653314e-05,
      "loss": 1.6777,
      "num_input_tokens_seen": 20128618800,
      "step": 25584
    },
    {
      "epoch": 2.7143008699342244,
      "grad_norm": 0.5113555714118158,
      "learning_rate": 4.398471508032346e-05,
      "loss": 1.5505,
      "num_input_tokens_seen": 20129405552,
      "step": 25585
    },
    {
      "epoch": 2.714406959473796,
      "grad_norm": 0.46886649635869065,
      "learning_rate": 4.398426290032277e-05,
      "loss": 1.5562,
      "num_input_tokens_seen": 20130192432,
      "step": 25586
    },
    {
      "epoch": 2.7145130490133673,
      "grad_norm": 0.38048051597191307,
      "learning_rate": 4.3983810705651606e-05,
      "loss": 1.4696,
      "num_input_tokens_seen": 20130979232,
      "step": 25587
    },
    {
      "epoch": 2.714619138552939,
      "grad_norm": 0.4291504138323134,
      "learning_rate": 4.3983358496310304e-05,
      "loss": 1.5606,
      "num_input_tokens_seen": 20131765904,
      "step": 25588
    },
    {
      "epoch": 2.71472522809251,
      "grad_norm": 0.3910618936786799,
      "learning_rate": 4.3982906272299224e-05,
      "loss": 1.5616,
      "num_input_tokens_seen": 20132552704,
      "step": 25589
    },
    {
      "epoch": 2.7148313176320817,
      "grad_norm": 0.46571034080231,
      "learning_rate": 4.3982454033618706e-05,
      "loss": 1.5694,
      "num_input_tokens_seen": 20133339424,
      "step": 25590
    },
    {
      "epoch": 2.7149374071716528,
      "grad_norm": 0.40512735659489696,
      "learning_rate": 4.398200178026911e-05,
      "loss": 1.6578,
      "num_input_tokens_seen": 20134126128,
      "step": 25591
    },
    {
      "epoch": 2.7150434967112242,
      "grad_norm": 0.43186073579681866,
      "learning_rate": 4.398154951225078e-05,
      "loss": 1.5619,
      "num_input_tokens_seen": 20134912912,
      "step": 25592
    },
    {
      "epoch": 2.7151495862507957,
      "grad_norm": 0.40833641814928384,
      "learning_rate": 4.398109722956406e-05,
      "loss": 1.5729,
      "num_input_tokens_seen": 20135699728,
      "step": 25593
    },
    {
      "epoch": 2.715255675790367,
      "grad_norm": 0.3565550079544949,
      "learning_rate": 4.3980644932209304e-05,
      "loss": 1.5999,
      "num_input_tokens_seen": 20136486528,
      "step": 25594
    },
    {
      "epoch": 2.7153617653299387,
      "grad_norm": 0.4055459611674238,
      "learning_rate": 4.3980192620186866e-05,
      "loss": 1.7071,
      "num_input_tokens_seen": 20137273328,
      "step": 25595
    },
    {
      "epoch": 2.7154678548695097,
      "grad_norm": 0.3683457241418546,
      "learning_rate": 4.39797402934971e-05,
      "loss": 1.5581,
      "num_input_tokens_seen": 20138060112,
      "step": 25596
    },
    {
      "epoch": 2.715573944409081,
      "grad_norm": 0.46605708591225764,
      "learning_rate": 4.3979287952140336e-05,
      "loss": 1.6324,
      "num_input_tokens_seen": 20138846880,
      "step": 25597
    },
    {
      "epoch": 2.7156800339486526,
      "grad_norm": 0.35698218509649604,
      "learning_rate": 4.3978835596116935e-05,
      "loss": 1.6566,
      "num_input_tokens_seen": 20139633584,
      "step": 25598
    },
    {
      "epoch": 2.715786123488224,
      "grad_norm": 0.4496709054955884,
      "learning_rate": 4.397838322542725e-05,
      "loss": 1.5499,
      "num_input_tokens_seen": 20140420368,
      "step": 25599
    },
    {
      "epoch": 2.7158922130277956,
      "grad_norm": 0.36057244507516883,
      "learning_rate": 4.397793084007163e-05,
      "loss": 1.42,
      "num_input_tokens_seen": 20141207184,
      "step": 25600
    },
    {
      "epoch": 2.7159983025673666,
      "grad_norm": 0.3851082826498306,
      "learning_rate": 4.397747844005042e-05,
      "loss": 1.6494,
      "num_input_tokens_seen": 20141993920,
      "step": 25601
    },
    {
      "epoch": 2.716104392106938,
      "grad_norm": 0.37385858189252547,
      "learning_rate": 4.397702602536397e-05,
      "loss": 1.5751,
      "num_input_tokens_seen": 20142780672,
      "step": 25602
    },
    {
      "epoch": 2.7162104816465096,
      "grad_norm": 0.3729963648089367,
      "learning_rate": 4.3976573596012634e-05,
      "loss": 1.6387,
      "num_input_tokens_seen": 20143567504,
      "step": 25603
    },
    {
      "epoch": 2.716316571186081,
      "grad_norm": 0.3832389317416753,
      "learning_rate": 4.3976121151996754e-05,
      "loss": 1.4608,
      "num_input_tokens_seen": 20144354336,
      "step": 25604
    },
    {
      "epoch": 2.7164226607256525,
      "grad_norm": 0.3774697287210336,
      "learning_rate": 4.3975668693316687e-05,
      "loss": 1.5381,
      "num_input_tokens_seen": 20145141120,
      "step": 25605
    },
    {
      "epoch": 2.716528750265224,
      "grad_norm": 0.460742882120341,
      "learning_rate": 4.397521621997278e-05,
      "loss": 1.6742,
      "num_input_tokens_seen": 20145927872,
      "step": 25606
    },
    {
      "epoch": 2.7166348398047955,
      "grad_norm": 0.39259598858970135,
      "learning_rate": 4.397476373196539e-05,
      "loss": 1.4557,
      "num_input_tokens_seen": 20146714592,
      "step": 25607
    },
    {
      "epoch": 2.7167409293443665,
      "grad_norm": 0.45513597854788623,
      "learning_rate": 4.397431122929485e-05,
      "loss": 1.5088,
      "num_input_tokens_seen": 20147501424,
      "step": 25608
    },
    {
      "epoch": 2.716847018883938,
      "grad_norm": 0.3959315927279063,
      "learning_rate": 4.397385871196151e-05,
      "loss": 1.5034,
      "num_input_tokens_seen": 20148288128,
      "step": 25609
    },
    {
      "epoch": 2.7169531084235095,
      "grad_norm": 0.43279497303930264,
      "learning_rate": 4.397340617996575e-05,
      "loss": 1.6658,
      "num_input_tokens_seen": 20149074976,
      "step": 25610
    },
    {
      "epoch": 2.717059197963081,
      "grad_norm": 0.42200982370232726,
      "learning_rate": 4.397295363330789e-05,
      "loss": 1.7153,
      "num_input_tokens_seen": 20149861680,
      "step": 25611
    },
    {
      "epoch": 2.7171652875026524,
      "grad_norm": 0.39376510265159426,
      "learning_rate": 4.397250107198828e-05,
      "loss": 1.6329,
      "num_input_tokens_seen": 20150648512,
      "step": 25612
    },
    {
      "epoch": 2.7172713770422234,
      "grad_norm": 0.36565986840084813,
      "learning_rate": 4.397204849600729e-05,
      "loss": 1.4785,
      "num_input_tokens_seen": 20151435312,
      "step": 25613
    },
    {
      "epoch": 2.717377466581795,
      "grad_norm": 0.41369795566767575,
      "learning_rate": 4.397159590536525e-05,
      "loss": 1.5599,
      "num_input_tokens_seen": 20152222096,
      "step": 25614
    },
    {
      "epoch": 2.7174835561213664,
      "grad_norm": 0.34408605385248986,
      "learning_rate": 4.397114330006252e-05,
      "loss": 1.5495,
      "num_input_tokens_seen": 20153008928,
      "step": 25615
    },
    {
      "epoch": 2.717589645660938,
      "grad_norm": 0.437522033317464,
      "learning_rate": 4.3970690680099445e-05,
      "loss": 1.6842,
      "num_input_tokens_seen": 20153795568,
      "step": 25616
    },
    {
      "epoch": 2.7176957352005093,
      "grad_norm": 0.39040845265467855,
      "learning_rate": 4.397023804547638e-05,
      "loss": 1.6483,
      "num_input_tokens_seen": 20154582272,
      "step": 25617
    },
    {
      "epoch": 2.7178018247400804,
      "grad_norm": 0.39508731254597007,
      "learning_rate": 4.396978539619367e-05,
      "loss": 1.6983,
      "num_input_tokens_seen": 20155369040,
      "step": 25618
    },
    {
      "epoch": 2.7179079142796523,
      "grad_norm": 0.41054566905121403,
      "learning_rate": 4.396933273225167e-05,
      "loss": 1.6499,
      "num_input_tokens_seen": 20156155760,
      "step": 25619
    },
    {
      "epoch": 2.7180140038192233,
      "grad_norm": 0.46269861021994146,
      "learning_rate": 4.396888005365072e-05,
      "loss": 1.5524,
      "num_input_tokens_seen": 20156942528,
      "step": 25620
    },
    {
      "epoch": 2.718120093358795,
      "grad_norm": 0.466343938261674,
      "learning_rate": 4.396842736039117e-05,
      "loss": 1.6284,
      "num_input_tokens_seen": 20157729408,
      "step": 25621
    },
    {
      "epoch": 2.7182261828983663,
      "grad_norm": 0.607497400707268,
      "learning_rate": 4.3967974652473395e-05,
      "loss": 1.6716,
      "num_input_tokens_seen": 20158516128,
      "step": 25622
    },
    {
      "epoch": 2.7183322724379377,
      "grad_norm": 0.36499056065410235,
      "learning_rate": 4.396752192989771e-05,
      "loss": 1.4925,
      "num_input_tokens_seen": 20159302896,
      "step": 25623
    },
    {
      "epoch": 2.718438361977509,
      "grad_norm": 0.4381499235940622,
      "learning_rate": 4.396706919266449e-05,
      "loss": 1.5194,
      "num_input_tokens_seen": 20160089664,
      "step": 25624
    },
    {
      "epoch": 2.7185444515170802,
      "grad_norm": 0.35640386927566914,
      "learning_rate": 4.396661644077407e-05,
      "loss": 1.5075,
      "num_input_tokens_seen": 20160876464,
      "step": 25625
    },
    {
      "epoch": 2.7186505410566517,
      "grad_norm": 0.4571486481538754,
      "learning_rate": 4.3966163674226806e-05,
      "loss": 1.6689,
      "num_input_tokens_seen": 20161663104,
      "step": 25626
    },
    {
      "epoch": 2.718756630596223,
      "grad_norm": 0.4056953879958942,
      "learning_rate": 4.396571089302305e-05,
      "loss": 1.5571,
      "num_input_tokens_seen": 20162449920,
      "step": 25627
    },
    {
      "epoch": 2.7188627201357947,
      "grad_norm": 0.5047714141021167,
      "learning_rate": 4.3965258097163145e-05,
      "loss": 1.4903,
      "num_input_tokens_seen": 20163236704,
      "step": 25628
    },
    {
      "epoch": 2.718968809675366,
      "grad_norm": 0.3596591457370673,
      "learning_rate": 4.3964805286647445e-05,
      "loss": 1.5406,
      "num_input_tokens_seen": 20164023360,
      "step": 25629
    },
    {
      "epoch": 2.719074899214937,
      "grad_norm": 0.5156636910802315,
      "learning_rate": 4.396435246147631e-05,
      "loss": 1.705,
      "num_input_tokens_seen": 20164810032,
      "step": 25630
    },
    {
      "epoch": 2.7191809887545086,
      "grad_norm": 0.3814271074863099,
      "learning_rate": 4.396389962165007e-05,
      "loss": 1.6075,
      "num_input_tokens_seen": 20165596784,
      "step": 25631
    },
    {
      "epoch": 2.71928707829408,
      "grad_norm": 0.38304061934660927,
      "learning_rate": 4.396344676716908e-05,
      "loss": 1.4559,
      "num_input_tokens_seen": 20166383552,
      "step": 25632
    },
    {
      "epoch": 2.7193931678336516,
      "grad_norm": 0.3480615350743894,
      "learning_rate": 4.39629938980337e-05,
      "loss": 1.5331,
      "num_input_tokens_seen": 20167170288,
      "step": 25633
    },
    {
      "epoch": 2.719499257373223,
      "grad_norm": 0.3832039319901757,
      "learning_rate": 4.3962541014244286e-05,
      "loss": 1.5224,
      "num_input_tokens_seen": 20167956992,
      "step": 25634
    },
    {
      "epoch": 2.7196053469127945,
      "grad_norm": 0.3956969098626688,
      "learning_rate": 4.396208811580116e-05,
      "loss": 1.6319,
      "num_input_tokens_seen": 20168743696,
      "step": 25635
    },
    {
      "epoch": 2.719711436452366,
      "grad_norm": 0.39707727930795655,
      "learning_rate": 4.39616352027047e-05,
      "loss": 1.5433,
      "num_input_tokens_seen": 20169530416,
      "step": 25636
    },
    {
      "epoch": 2.719817525991937,
      "grad_norm": 0.4045678757289468,
      "learning_rate": 4.3961182274955236e-05,
      "loss": 1.5542,
      "num_input_tokens_seen": 20170317120,
      "step": 25637
    },
    {
      "epoch": 2.7199236155315085,
      "grad_norm": 0.3957363963486021,
      "learning_rate": 4.396072933255313e-05,
      "loss": 1.5627,
      "num_input_tokens_seen": 20171103952,
      "step": 25638
    },
    {
      "epoch": 2.72002970507108,
      "grad_norm": 0.3928103050498542,
      "learning_rate": 4.396027637549873e-05,
      "loss": 1.5799,
      "num_input_tokens_seen": 20171890688,
      "step": 25639
    },
    {
      "epoch": 2.7201357946106515,
      "grad_norm": 0.34385283880502804,
      "learning_rate": 4.395982340379239e-05,
      "loss": 1.5168,
      "num_input_tokens_seen": 20172677584,
      "step": 25640
    },
    {
      "epoch": 2.720241884150223,
      "grad_norm": 0.3721922899935057,
      "learning_rate": 4.395937041743445e-05,
      "loss": 1.6416,
      "num_input_tokens_seen": 20173464384,
      "step": 25641
    },
    {
      "epoch": 2.720347973689794,
      "grad_norm": 0.42012908222265716,
      "learning_rate": 4.395891741642526e-05,
      "loss": 1.6989,
      "num_input_tokens_seen": 20174251136,
      "step": 25642
    },
    {
      "epoch": 2.7204540632293654,
      "grad_norm": 0.3666320716119983,
      "learning_rate": 4.395846440076517e-05,
      "loss": 1.6986,
      "num_input_tokens_seen": 20175037808,
      "step": 25643
    },
    {
      "epoch": 2.720560152768937,
      "grad_norm": 0.32299869577290047,
      "learning_rate": 4.3958011370454554e-05,
      "loss": 1.4228,
      "num_input_tokens_seen": 20175824640,
      "step": 25644
    },
    {
      "epoch": 2.7206662423085084,
      "grad_norm": 0.39526376256995543,
      "learning_rate": 4.395755832549373e-05,
      "loss": 1.5807,
      "num_input_tokens_seen": 20176611456,
      "step": 25645
    },
    {
      "epoch": 2.72077233184808,
      "grad_norm": 0.41619693371219946,
      "learning_rate": 4.3957105265883066e-05,
      "loss": 1.525,
      "num_input_tokens_seen": 20177398304,
      "step": 25646
    },
    {
      "epoch": 2.720878421387651,
      "grad_norm": 0.3687685008752725,
      "learning_rate": 4.39566521916229e-05,
      "loss": 1.5444,
      "num_input_tokens_seen": 20178185168,
      "step": 25647
    },
    {
      "epoch": 2.720984510927223,
      "grad_norm": 0.3649532173286628,
      "learning_rate": 4.39561991027136e-05,
      "loss": 1.5746,
      "num_input_tokens_seen": 20178972000,
      "step": 25648
    },
    {
      "epoch": 2.721090600466794,
      "grad_norm": 0.3663198178958064,
      "learning_rate": 4.3955745999155504e-05,
      "loss": 1.5287,
      "num_input_tokens_seen": 20179758736,
      "step": 25649
    },
    {
      "epoch": 2.7211966900063653,
      "grad_norm": 0.4438261267670265,
      "learning_rate": 4.395529288094896e-05,
      "loss": 1.5959,
      "num_input_tokens_seen": 20180545504,
      "step": 25650
    },
    {
      "epoch": 2.721302779545937,
      "grad_norm": 0.3432429905606853,
      "learning_rate": 4.395483974809432e-05,
      "loss": 1.6057,
      "num_input_tokens_seen": 20181332272,
      "step": 25651
    },
    {
      "epoch": 2.7214088690855083,
      "grad_norm": 0.3977419985605331,
      "learning_rate": 4.395438660059194e-05,
      "loss": 1.608,
      "num_input_tokens_seen": 20182119136,
      "step": 25652
    },
    {
      "epoch": 2.7215149586250797,
      "grad_norm": 0.3745322664682437,
      "learning_rate": 4.3953933438442166e-05,
      "loss": 1.6267,
      "num_input_tokens_seen": 20182905872,
      "step": 25653
    },
    {
      "epoch": 2.721621048164651,
      "grad_norm": 0.4107395930189706,
      "learning_rate": 4.3953480261645344e-05,
      "loss": 1.6099,
      "num_input_tokens_seen": 20183692672,
      "step": 25654
    },
    {
      "epoch": 2.7217271377042223,
      "grad_norm": 0.37620382735410635,
      "learning_rate": 4.395302707020183e-05,
      "loss": 1.4613,
      "num_input_tokens_seen": 20184479488,
      "step": 25655
    },
    {
      "epoch": 2.7218332272437937,
      "grad_norm": 0.44700724559729293,
      "learning_rate": 4.3952573864111974e-05,
      "loss": 1.6002,
      "num_input_tokens_seen": 20185266224,
      "step": 25656
    },
    {
      "epoch": 2.721939316783365,
      "grad_norm": 0.4087998346647717,
      "learning_rate": 4.3952120643376123e-05,
      "loss": 1.6437,
      "num_input_tokens_seen": 20186053088,
      "step": 25657
    },
    {
      "epoch": 2.7220454063229367,
      "grad_norm": 0.4904900123103287,
      "learning_rate": 4.395166740799463e-05,
      "loss": 1.5432,
      "num_input_tokens_seen": 20186839840,
      "step": 25658
    },
    {
      "epoch": 2.7221514958625077,
      "grad_norm": 0.3861778990592807,
      "learning_rate": 4.395121415796785e-05,
      "loss": 1.5958,
      "num_input_tokens_seen": 20187626592,
      "step": 25659
    },
    {
      "epoch": 2.7222575854020796,
      "grad_norm": 0.33319289855252093,
      "learning_rate": 4.395076089329612e-05,
      "loss": 1.5367,
      "num_input_tokens_seen": 20188413424,
      "step": 25660
    },
    {
      "epoch": 2.7223636749416507,
      "grad_norm": 0.3891291513800491,
      "learning_rate": 4.3950307613979805e-05,
      "loss": 1.6214,
      "num_input_tokens_seen": 20189200128,
      "step": 25661
    },
    {
      "epoch": 2.722469764481222,
      "grad_norm": 0.35804917567693406,
      "learning_rate": 4.3949854320019244e-05,
      "loss": 1.6689,
      "num_input_tokens_seen": 20189986912,
      "step": 25662
    },
    {
      "epoch": 2.7225758540207936,
      "grad_norm": 0.386859654230302,
      "learning_rate": 4.394940101141479e-05,
      "loss": 1.4904,
      "num_input_tokens_seen": 20190773664,
      "step": 25663
    },
    {
      "epoch": 2.722681943560365,
      "grad_norm": 0.4204199103410315,
      "learning_rate": 4.39489476881668e-05,
      "loss": 1.4951,
      "num_input_tokens_seen": 20191560384,
      "step": 25664
    },
    {
      "epoch": 2.7227880330999366,
      "grad_norm": 0.41471514904574586,
      "learning_rate": 4.394849435027561e-05,
      "loss": 1.7486,
      "num_input_tokens_seen": 20192347136,
      "step": 25665
    },
    {
      "epoch": 2.7228941226395076,
      "grad_norm": 0.3855787657487328,
      "learning_rate": 4.394804099774159e-05,
      "loss": 1.4332,
      "num_input_tokens_seen": 20193134000,
      "step": 25666
    },
    {
      "epoch": 2.723000212179079,
      "grad_norm": 0.40761254595637586,
      "learning_rate": 4.394758763056508e-05,
      "loss": 1.5482,
      "num_input_tokens_seen": 20193920784,
      "step": 25667
    },
    {
      "epoch": 2.7231063017186505,
      "grad_norm": 0.3621703694990915,
      "learning_rate": 4.394713424874642e-05,
      "loss": 1.5144,
      "num_input_tokens_seen": 20194707584,
      "step": 25668
    },
    {
      "epoch": 2.723212391258222,
      "grad_norm": 0.471019892972953,
      "learning_rate": 4.3946680852285984e-05,
      "loss": 1.5944,
      "num_input_tokens_seen": 20195494336,
      "step": 25669
    },
    {
      "epoch": 2.7233184807977935,
      "grad_norm": 0.3576141585274237,
      "learning_rate": 4.3946227441184094e-05,
      "loss": 1.5837,
      "num_input_tokens_seen": 20196281072,
      "step": 25670
    },
    {
      "epoch": 2.7234245703373645,
      "grad_norm": 0.4297746361541343,
      "learning_rate": 4.394577401544113e-05,
      "loss": 1.6567,
      "num_input_tokens_seen": 20197067808,
      "step": 25671
    },
    {
      "epoch": 2.723530659876936,
      "grad_norm": 0.4137791860947812,
      "learning_rate": 4.394532057505742e-05,
      "loss": 1.6537,
      "num_input_tokens_seen": 20197854464,
      "step": 25672
    },
    {
      "epoch": 2.7236367494165075,
      "grad_norm": 0.41619436244195607,
      "learning_rate": 4.394486712003332e-05,
      "loss": 1.6588,
      "num_input_tokens_seen": 20198641248,
      "step": 25673
    },
    {
      "epoch": 2.723742838956079,
      "grad_norm": 0.46281402335938704,
      "learning_rate": 4.3944413650369184e-05,
      "loss": 1.6337,
      "num_input_tokens_seen": 20199428032,
      "step": 25674
    },
    {
      "epoch": 2.7238489284956504,
      "grad_norm": 0.41792244429327663,
      "learning_rate": 4.3943960166065365e-05,
      "loss": 1.708,
      "num_input_tokens_seen": 20200214784,
      "step": 25675
    },
    {
      "epoch": 2.723955018035222,
      "grad_norm": 0.3801649152779484,
      "learning_rate": 4.394350666712221e-05,
      "loss": 1.5966,
      "num_input_tokens_seen": 20201001552,
      "step": 25676
    },
    {
      "epoch": 2.7240611075747934,
      "grad_norm": 0.391664161537921,
      "learning_rate": 4.3943053153540064e-05,
      "loss": 1.6924,
      "num_input_tokens_seen": 20201788352,
      "step": 25677
    },
    {
      "epoch": 2.7241671971143644,
      "grad_norm": 0.3757069797235223,
      "learning_rate": 4.394259962531929e-05,
      "loss": 1.5522,
      "num_input_tokens_seen": 20202575104,
      "step": 25678
    },
    {
      "epoch": 2.724273286653936,
      "grad_norm": 0.49491378886085025,
      "learning_rate": 4.394214608246022e-05,
      "loss": 1.6922,
      "num_input_tokens_seen": 20203361936,
      "step": 25679
    },
    {
      "epoch": 2.7243793761935073,
      "grad_norm": 0.351030505295215,
      "learning_rate": 4.3941692524963216e-05,
      "loss": 1.6157,
      "num_input_tokens_seen": 20204148704,
      "step": 25680
    },
    {
      "epoch": 2.724485465733079,
      "grad_norm": 0.39058308028366046,
      "learning_rate": 4.394123895282863e-05,
      "loss": 1.6079,
      "num_input_tokens_seen": 20204935424,
      "step": 25681
    },
    {
      "epoch": 2.7245915552726503,
      "grad_norm": 0.4232795534147472,
      "learning_rate": 4.394078536605682e-05,
      "loss": 1.5736,
      "num_input_tokens_seen": 20205722240,
      "step": 25682
    },
    {
      "epoch": 2.7246976448122213,
      "grad_norm": 0.4200605562990859,
      "learning_rate": 4.394033176464812e-05,
      "loss": 1.7211,
      "num_input_tokens_seen": 20206509024,
      "step": 25683
    },
    {
      "epoch": 2.724803734351793,
      "grad_norm": 0.44845496104204274,
      "learning_rate": 4.393987814860289e-05,
      "loss": 1.714,
      "num_input_tokens_seen": 20207295712,
      "step": 25684
    },
    {
      "epoch": 2.7249098238913643,
      "grad_norm": 0.41518935880986985,
      "learning_rate": 4.393942451792147e-05,
      "loss": 1.5238,
      "num_input_tokens_seen": 20208082528,
      "step": 25685
    },
    {
      "epoch": 2.7250159134309357,
      "grad_norm": 0.43098494017210587,
      "learning_rate": 4.393897087260423e-05,
      "loss": 1.727,
      "num_input_tokens_seen": 20208869264,
      "step": 25686
    },
    {
      "epoch": 2.725122002970507,
      "grad_norm": 0.35488783418159897,
      "learning_rate": 4.39385172126515e-05,
      "loss": 1.5866,
      "num_input_tokens_seen": 20209656032,
      "step": 25687
    },
    {
      "epoch": 2.7252280925100782,
      "grad_norm": 0.41204255282146984,
      "learning_rate": 4.393806353806364e-05,
      "loss": 1.6595,
      "num_input_tokens_seen": 20210442752,
      "step": 25688
    },
    {
      "epoch": 2.72533418204965,
      "grad_norm": 0.4606209285348701,
      "learning_rate": 4.3937609848841e-05,
      "loss": 1.643,
      "num_input_tokens_seen": 20211229456,
      "step": 25689
    },
    {
      "epoch": 2.725440271589221,
      "grad_norm": 0.3908470220065619,
      "learning_rate": 4.393715614498393e-05,
      "loss": 1.5229,
      "num_input_tokens_seen": 20212016160,
      "step": 25690
    },
    {
      "epoch": 2.7255463611287927,
      "grad_norm": 0.6434744876699003,
      "learning_rate": 4.3936702426492786e-05,
      "loss": 1.6366,
      "num_input_tokens_seen": 20212802928,
      "step": 25691
    },
    {
      "epoch": 2.725652450668364,
      "grad_norm": 0.4089070135032338,
      "learning_rate": 4.393624869336791e-05,
      "loss": 1.5137,
      "num_input_tokens_seen": 20213589712,
      "step": 25692
    },
    {
      "epoch": 2.7257585402079356,
      "grad_norm": 0.48312070630158416,
      "learning_rate": 4.3935794945609656e-05,
      "loss": 1.4999,
      "num_input_tokens_seen": 20214376512,
      "step": 25693
    },
    {
      "epoch": 2.725864629747507,
      "grad_norm": 0.3661606770966265,
      "learning_rate": 4.393534118321838e-05,
      "loss": 1.5856,
      "num_input_tokens_seen": 20215163280,
      "step": 25694
    },
    {
      "epoch": 2.725970719287078,
      "grad_norm": 0.4715941793058757,
      "learning_rate": 4.393488740619442e-05,
      "loss": 1.6542,
      "num_input_tokens_seen": 20215950000,
      "step": 25695
    },
    {
      "epoch": 2.7260768088266496,
      "grad_norm": 0.3863788610848433,
      "learning_rate": 4.393443361453815e-05,
      "loss": 1.7008,
      "num_input_tokens_seen": 20216736816,
      "step": 25696
    },
    {
      "epoch": 2.726182898366221,
      "grad_norm": 0.3654459087502066,
      "learning_rate": 4.393397980824989e-05,
      "loss": 1.5936,
      "num_input_tokens_seen": 20217523584,
      "step": 25697
    },
    {
      "epoch": 2.7262889879057925,
      "grad_norm": 0.36464389015437365,
      "learning_rate": 4.393352598733001e-05,
      "loss": 1.5238,
      "num_input_tokens_seen": 20218310352,
      "step": 25698
    },
    {
      "epoch": 2.726395077445364,
      "grad_norm": 0.35955797431485054,
      "learning_rate": 4.393307215177886e-05,
      "loss": 1.4654,
      "num_input_tokens_seen": 20219097072,
      "step": 25699
    },
    {
      "epoch": 2.726501166984935,
      "grad_norm": 0.3562457112602071,
      "learning_rate": 4.393261830159679e-05,
      "loss": 1.5795,
      "num_input_tokens_seen": 20219883824,
      "step": 25700
    },
    {
      "epoch": 2.7266072565245065,
      "grad_norm": 0.38067316739878687,
      "learning_rate": 4.393216443678415e-05,
      "loss": 1.6238,
      "num_input_tokens_seen": 20220670656,
      "step": 25701
    },
    {
      "epoch": 2.726713346064078,
      "grad_norm": 0.42031578291884053,
      "learning_rate": 4.3931710557341275e-05,
      "loss": 1.5496,
      "num_input_tokens_seen": 20221457360,
      "step": 25702
    },
    {
      "epoch": 2.7268194356036495,
      "grad_norm": 0.3739547158375089,
      "learning_rate": 4.3931256663268536e-05,
      "loss": 1.6661,
      "num_input_tokens_seen": 20222244160,
      "step": 25703
    },
    {
      "epoch": 2.726925525143221,
      "grad_norm": 0.3727089494820199,
      "learning_rate": 4.393080275456628e-05,
      "loss": 1.4964,
      "num_input_tokens_seen": 20223030928,
      "step": 25704
    },
    {
      "epoch": 2.7270316146827924,
      "grad_norm": 0.41277248097179087,
      "learning_rate": 4.3930348831234854e-05,
      "loss": 1.668,
      "num_input_tokens_seen": 20223817584,
      "step": 25705
    },
    {
      "epoch": 2.727137704222364,
      "grad_norm": 0.3912132369365073,
      "learning_rate": 4.392989489327461e-05,
      "loss": 1.6262,
      "num_input_tokens_seen": 20224604432,
      "step": 25706
    },
    {
      "epoch": 2.727243793761935,
      "grad_norm": 0.46028343774649444,
      "learning_rate": 4.392944094068589e-05,
      "loss": 1.4796,
      "num_input_tokens_seen": 20225391136,
      "step": 25707
    },
    {
      "epoch": 2.7273498833015064,
      "grad_norm": 0.4320417914619632,
      "learning_rate": 4.392898697346907e-05,
      "loss": 1.7115,
      "num_input_tokens_seen": 20226177856,
      "step": 25708
    },
    {
      "epoch": 2.727455972841078,
      "grad_norm": 0.38631662352357043,
      "learning_rate": 4.392853299162447e-05,
      "loss": 1.6243,
      "num_input_tokens_seen": 20226964544,
      "step": 25709
    },
    {
      "epoch": 2.7275620623806494,
      "grad_norm": 0.41672746326755034,
      "learning_rate": 4.3928078995152464e-05,
      "loss": 1.5784,
      "num_input_tokens_seen": 20227751408,
      "step": 25710
    },
    {
      "epoch": 2.727668151920221,
      "grad_norm": 0.5020633734877943,
      "learning_rate": 4.3927624984053396e-05,
      "loss": 1.6247,
      "num_input_tokens_seen": 20228538176,
      "step": 25711
    },
    {
      "epoch": 2.727774241459792,
      "grad_norm": 0.397137838155192,
      "learning_rate": 4.392717095832761e-05,
      "loss": 1.6382,
      "num_input_tokens_seen": 20229324880,
      "step": 25712
    },
    {
      "epoch": 2.7278803309993633,
      "grad_norm": 0.5364926535781659,
      "learning_rate": 4.392671691797546e-05,
      "loss": 1.6356,
      "num_input_tokens_seen": 20230111696,
      "step": 25713
    },
    {
      "epoch": 2.727986420538935,
      "grad_norm": 0.3628524731485475,
      "learning_rate": 4.39262628629973e-05,
      "loss": 1.7004,
      "num_input_tokens_seen": 20230898464,
      "step": 25714
    },
    {
      "epoch": 2.7280925100785063,
      "grad_norm": 0.5258989414814831,
      "learning_rate": 4.3925808793393475e-05,
      "loss": 1.5334,
      "num_input_tokens_seen": 20231685280,
      "step": 25715
    },
    {
      "epoch": 2.7281985996180778,
      "grad_norm": 0.36850553017300125,
      "learning_rate": 4.392535470916435e-05,
      "loss": 1.6247,
      "num_input_tokens_seen": 20232472016,
      "step": 25716
    },
    {
      "epoch": 2.728304689157649,
      "grad_norm": 0.41828264969977563,
      "learning_rate": 4.392490061031026e-05,
      "loss": 1.5297,
      "num_input_tokens_seen": 20233258832,
      "step": 25717
    },
    {
      "epoch": 2.7284107786972207,
      "grad_norm": 0.42614173464700733,
      "learning_rate": 4.392444649683156e-05,
      "loss": 1.5973,
      "num_input_tokens_seen": 20234045632,
      "step": 25718
    },
    {
      "epoch": 2.7285168682367917,
      "grad_norm": 0.5274832950313143,
      "learning_rate": 4.392399236872861e-05,
      "loss": 1.4618,
      "num_input_tokens_seen": 20234832352,
      "step": 25719
    },
    {
      "epoch": 2.728622957776363,
      "grad_norm": 0.39304937425762676,
      "learning_rate": 4.392353822600175e-05,
      "loss": 1.6119,
      "num_input_tokens_seen": 20235619168,
      "step": 25720
    },
    {
      "epoch": 2.7287290473159347,
      "grad_norm": 0.46947352619211596,
      "learning_rate": 4.392308406865133e-05,
      "loss": 1.6096,
      "num_input_tokens_seen": 20236405984,
      "step": 25721
    },
    {
      "epoch": 2.728835136855506,
      "grad_norm": 0.3650014059731915,
      "learning_rate": 4.3922629896677716e-05,
      "loss": 1.6115,
      "num_input_tokens_seen": 20237192640,
      "step": 25722
    },
    {
      "epoch": 2.7289412263950776,
      "grad_norm": 0.37645926983493694,
      "learning_rate": 4.3922175710081234e-05,
      "loss": 1.6266,
      "num_input_tokens_seen": 20237979440,
      "step": 25723
    },
    {
      "epoch": 2.7290473159346487,
      "grad_norm": 0.4003388176842841,
      "learning_rate": 4.392172150886227e-05,
      "loss": 1.4596,
      "num_input_tokens_seen": 20238766224,
      "step": 25724
    },
    {
      "epoch": 2.72915340547422,
      "grad_norm": 0.3362374087805083,
      "learning_rate": 4.392126729302114e-05,
      "loss": 1.5206,
      "num_input_tokens_seen": 20239553056,
      "step": 25725
    },
    {
      "epoch": 2.7292594950137916,
      "grad_norm": 0.3944861980609198,
      "learning_rate": 4.392081306255821e-05,
      "loss": 1.6549,
      "num_input_tokens_seen": 20240339840,
      "step": 25726
    },
    {
      "epoch": 2.729365584553363,
      "grad_norm": 0.35559365996977244,
      "learning_rate": 4.392035881747384e-05,
      "loss": 1.5842,
      "num_input_tokens_seen": 20241126608,
      "step": 25727
    },
    {
      "epoch": 2.7294716740929346,
      "grad_norm": 0.4042877703705957,
      "learning_rate": 4.391990455776837e-05,
      "loss": 1.6709,
      "num_input_tokens_seen": 20241913360,
      "step": 25728
    },
    {
      "epoch": 2.7295777636325056,
      "grad_norm": 0.3745331018911585,
      "learning_rate": 4.391945028344214e-05,
      "loss": 1.6511,
      "num_input_tokens_seen": 20242700096,
      "step": 25729
    },
    {
      "epoch": 2.729683853172077,
      "grad_norm": 0.4105161773886933,
      "learning_rate": 4.3918995994495526e-05,
      "loss": 1.7102,
      "num_input_tokens_seen": 20243486848,
      "step": 25730
    },
    {
      "epoch": 2.7297899427116485,
      "grad_norm": 0.4154640154400947,
      "learning_rate": 4.391854169092886e-05,
      "loss": 1.5622,
      "num_input_tokens_seen": 20244273584,
      "step": 25731
    },
    {
      "epoch": 2.72989603225122,
      "grad_norm": 0.3514083964949752,
      "learning_rate": 4.3918087372742507e-05,
      "loss": 1.5201,
      "num_input_tokens_seen": 20245060320,
      "step": 25732
    },
    {
      "epoch": 2.7300021217907915,
      "grad_norm": 0.35755546819179707,
      "learning_rate": 4.391763303993681e-05,
      "loss": 1.5842,
      "num_input_tokens_seen": 20245847136,
      "step": 25733
    },
    {
      "epoch": 2.730108211330363,
      "grad_norm": 0.43794450538643753,
      "learning_rate": 4.3917178692512115e-05,
      "loss": 1.5363,
      "num_input_tokens_seen": 20246633840,
      "step": 25734
    },
    {
      "epoch": 2.7302143008699344,
      "grad_norm": 0.40317917404884185,
      "learning_rate": 4.391672433046879e-05,
      "loss": 1.6599,
      "num_input_tokens_seen": 20247420480,
      "step": 25735
    },
    {
      "epoch": 2.7303203904095055,
      "grad_norm": 0.5452543004061083,
      "learning_rate": 4.391626995380716e-05,
      "loss": 1.6796,
      "num_input_tokens_seen": 20248207200,
      "step": 25736
    },
    {
      "epoch": 2.730426479949077,
      "grad_norm": 0.3418546630045477,
      "learning_rate": 4.391581556252761e-05,
      "loss": 1.7016,
      "num_input_tokens_seen": 20248993936,
      "step": 25737
    },
    {
      "epoch": 2.7305325694886484,
      "grad_norm": 0.42624481490463684,
      "learning_rate": 4.391536115663046e-05,
      "loss": 1.6499,
      "num_input_tokens_seen": 20249780592,
      "step": 25738
    },
    {
      "epoch": 2.73063865902822,
      "grad_norm": 0.38678681910807905,
      "learning_rate": 4.391490673611608e-05,
      "loss": 1.5958,
      "num_input_tokens_seen": 20250567280,
      "step": 25739
    },
    {
      "epoch": 2.7307447485677914,
      "grad_norm": 0.3957736015329601,
      "learning_rate": 4.391445230098481e-05,
      "loss": 1.7385,
      "num_input_tokens_seen": 20251354000,
      "step": 25740
    },
    {
      "epoch": 2.7308508381073624,
      "grad_norm": 0.403627410057143,
      "learning_rate": 4.3913997851237014e-05,
      "loss": 1.5005,
      "num_input_tokens_seen": 20252140688,
      "step": 25741
    },
    {
      "epoch": 2.730956927646934,
      "grad_norm": 0.33848664433253295,
      "learning_rate": 4.391354338687303e-05,
      "loss": 1.4707,
      "num_input_tokens_seen": 20252927520,
      "step": 25742
    },
    {
      "epoch": 2.7310630171865053,
      "grad_norm": 0.5788371372535334,
      "learning_rate": 4.391308890789322e-05,
      "loss": 1.5832,
      "num_input_tokens_seen": 20253714240,
      "step": 25743
    },
    {
      "epoch": 2.731169106726077,
      "grad_norm": 0.3418714692925331,
      "learning_rate": 4.3912634414297926e-05,
      "loss": 1.5329,
      "num_input_tokens_seen": 20254500976,
      "step": 25744
    },
    {
      "epoch": 2.7312751962656483,
      "grad_norm": 0.3582356824828012,
      "learning_rate": 4.39121799060875e-05,
      "loss": 1.463,
      "num_input_tokens_seen": 20255287856,
      "step": 25745
    },
    {
      "epoch": 2.7313812858052198,
      "grad_norm": 0.37450473290799513,
      "learning_rate": 4.39117253832623e-05,
      "loss": 1.514,
      "num_input_tokens_seen": 20256074640,
      "step": 25746
    },
    {
      "epoch": 2.7314873753447912,
      "grad_norm": 0.4126898771109715,
      "learning_rate": 4.391127084582267e-05,
      "loss": 1.6748,
      "num_input_tokens_seen": 20256861376,
      "step": 25747
    },
    {
      "epoch": 2.7315934648843623,
      "grad_norm": 0.3950571990391646,
      "learning_rate": 4.3910816293768966e-05,
      "loss": 1.7644,
      "num_input_tokens_seen": 20257648128,
      "step": 25748
    },
    {
      "epoch": 2.7316995544239338,
      "grad_norm": 0.4211603266649005,
      "learning_rate": 4.391036172710154e-05,
      "loss": 1.6069,
      "num_input_tokens_seen": 20258434944,
      "step": 25749
    },
    {
      "epoch": 2.7318056439635052,
      "grad_norm": 0.3995099087923023,
      "learning_rate": 4.390990714582074e-05,
      "loss": 1.5548,
      "num_input_tokens_seen": 20259221712,
      "step": 25750
    },
    {
      "epoch": 2.7319117335030767,
      "grad_norm": 0.3700341759271164,
      "learning_rate": 4.390945254992692e-05,
      "loss": 1.6737,
      "num_input_tokens_seen": 20260008432,
      "step": 25751
    },
    {
      "epoch": 2.732017823042648,
      "grad_norm": 0.5299147393747441,
      "learning_rate": 4.3908997939420424e-05,
      "loss": 1.7437,
      "num_input_tokens_seen": 20260795056,
      "step": 25752
    },
    {
      "epoch": 2.732123912582219,
      "grad_norm": 0.37774869035899805,
      "learning_rate": 4.3908543314301617e-05,
      "loss": 1.549,
      "num_input_tokens_seen": 20261581744,
      "step": 25753
    },
    {
      "epoch": 2.7322300021217907,
      "grad_norm": 0.49618761449325094,
      "learning_rate": 4.390808867457083e-05,
      "loss": 1.6098,
      "num_input_tokens_seen": 20262368432,
      "step": 25754
    },
    {
      "epoch": 2.732336091661362,
      "grad_norm": 0.41259202616884416,
      "learning_rate": 4.390763402022845e-05,
      "loss": 1.4328,
      "num_input_tokens_seen": 20263155232,
      "step": 25755
    },
    {
      "epoch": 2.7324421812009336,
      "grad_norm": 0.38506538297855014,
      "learning_rate": 4.390717935127478e-05,
      "loss": 1.5303,
      "num_input_tokens_seen": 20263941984,
      "step": 25756
    },
    {
      "epoch": 2.732548270740505,
      "grad_norm": 0.48433182381918805,
      "learning_rate": 4.3906724667710214e-05,
      "loss": 1.7139,
      "num_input_tokens_seen": 20264728752,
      "step": 25757
    },
    {
      "epoch": 2.732654360280076,
      "grad_norm": 0.40710741070232764,
      "learning_rate": 4.390626996953508e-05,
      "loss": 1.6066,
      "num_input_tokens_seen": 20265515520,
      "step": 25758
    },
    {
      "epoch": 2.732760449819648,
      "grad_norm": 0.3775040572009415,
      "learning_rate": 4.390581525674974e-05,
      "loss": 1.559,
      "num_input_tokens_seen": 20266302256,
      "step": 25759
    },
    {
      "epoch": 2.732866539359219,
      "grad_norm": 0.3966598296103587,
      "learning_rate": 4.390536052935453e-05,
      "loss": 1.5189,
      "num_input_tokens_seen": 20267089008,
      "step": 25760
    },
    {
      "epoch": 2.7329726288987906,
      "grad_norm": 0.4350552938236864,
      "learning_rate": 4.390490578734982e-05,
      "loss": 1.6239,
      "num_input_tokens_seen": 20267875792,
      "step": 25761
    },
    {
      "epoch": 2.733078718438362,
      "grad_norm": 0.4086851487535053,
      "learning_rate": 4.390445103073595e-05,
      "loss": 1.5888,
      "num_input_tokens_seen": 20268662512,
      "step": 25762
    },
    {
      "epoch": 2.7331848079779335,
      "grad_norm": 0.518159261938247,
      "learning_rate": 4.390399625951328e-05,
      "loss": 1.626,
      "num_input_tokens_seen": 20269449296,
      "step": 25763
    },
    {
      "epoch": 2.733290897517505,
      "grad_norm": 0.37814971451128765,
      "learning_rate": 4.390354147368215e-05,
      "loss": 1.5605,
      "num_input_tokens_seen": 20270236096,
      "step": 25764
    },
    {
      "epoch": 2.733396987057076,
      "grad_norm": 0.48316681676079254,
      "learning_rate": 4.390308667324292e-05,
      "loss": 1.572,
      "num_input_tokens_seen": 20271022816,
      "step": 25765
    },
    {
      "epoch": 2.7335030765966475,
      "grad_norm": 0.4011906026688756,
      "learning_rate": 4.390263185819594e-05,
      "loss": 1.5935,
      "num_input_tokens_seen": 20271809600,
      "step": 25766
    },
    {
      "epoch": 2.733609166136219,
      "grad_norm": 0.3693849145387158,
      "learning_rate": 4.3902177028541566e-05,
      "loss": 1.5218,
      "num_input_tokens_seen": 20272596336,
      "step": 25767
    },
    {
      "epoch": 2.7337152556757904,
      "grad_norm": 0.4251409950217011,
      "learning_rate": 4.3901722184280136e-05,
      "loss": 1.6396,
      "num_input_tokens_seen": 20273383056,
      "step": 25768
    },
    {
      "epoch": 2.733821345215362,
      "grad_norm": 0.34570468027030277,
      "learning_rate": 4.390126732541201e-05,
      "loss": 1.5857,
      "num_input_tokens_seen": 20274169904,
      "step": 25769
    },
    {
      "epoch": 2.733927434754933,
      "grad_norm": 0.37406544249828355,
      "learning_rate": 4.3900812451937544e-05,
      "loss": 1.5551,
      "num_input_tokens_seen": 20274956640,
      "step": 25770
    },
    {
      "epoch": 2.7340335242945044,
      "grad_norm": 0.4135538684445815,
      "learning_rate": 4.3900357563857087e-05,
      "loss": 1.5519,
      "num_input_tokens_seen": 20275743376,
      "step": 25771
    },
    {
      "epoch": 2.734139613834076,
      "grad_norm": 0.3539507494797713,
      "learning_rate": 4.389990266117098e-05,
      "loss": 1.6072,
      "num_input_tokens_seen": 20276530224,
      "step": 25772
    },
    {
      "epoch": 2.7342457033736474,
      "grad_norm": 0.3728369539325672,
      "learning_rate": 4.3899447743879585e-05,
      "loss": 1.5901,
      "num_input_tokens_seen": 20277317008,
      "step": 25773
    },
    {
      "epoch": 2.734351792913219,
      "grad_norm": 0.46092491352380854,
      "learning_rate": 4.389899281198325e-05,
      "loss": 1.6227,
      "num_input_tokens_seen": 20278103792,
      "step": 25774
    },
    {
      "epoch": 2.7344578824527903,
      "grad_norm": 0.33935079422186365,
      "learning_rate": 4.3898537865482336e-05,
      "loss": 1.6026,
      "num_input_tokens_seen": 20278890560,
      "step": 25775
    },
    {
      "epoch": 2.734563971992362,
      "grad_norm": 0.512808343338889,
      "learning_rate": 4.389808290437718e-05,
      "loss": 1.5546,
      "num_input_tokens_seen": 20279677296,
      "step": 25776
    },
    {
      "epoch": 2.734670061531933,
      "grad_norm": 0.335274385746603,
      "learning_rate": 4.3897627928668145e-05,
      "loss": 1.5148,
      "num_input_tokens_seen": 20280464144,
      "step": 25777
    },
    {
      "epoch": 2.7347761510715043,
      "grad_norm": 0.4530309159799775,
      "learning_rate": 4.389717293835557e-05,
      "loss": 1.4772,
      "num_input_tokens_seen": 20281250880,
      "step": 25778
    },
    {
      "epoch": 2.7348822406110758,
      "grad_norm": 0.4226916302449752,
      "learning_rate": 4.3896717933439824e-05,
      "loss": 1.7017,
      "num_input_tokens_seen": 20282037616,
      "step": 25779
    },
    {
      "epoch": 2.7349883301506472,
      "grad_norm": 0.3305895602686888,
      "learning_rate": 4.389626291392124e-05,
      "loss": 1.5489,
      "num_input_tokens_seen": 20282824368,
      "step": 25780
    },
    {
      "epoch": 2.7350944196902187,
      "grad_norm": 0.3626924810697952,
      "learning_rate": 4.389580787980018e-05,
      "loss": 1.5828,
      "num_input_tokens_seen": 20283611104,
      "step": 25781
    },
    {
      "epoch": 2.7352005092297897,
      "grad_norm": 0.4248343872867759,
      "learning_rate": 4.3895352831076997e-05,
      "loss": 1.7517,
      "num_input_tokens_seen": 20284397856,
      "step": 25782
    },
    {
      "epoch": 2.735306598769361,
      "grad_norm": 0.43372532921995255,
      "learning_rate": 4.389489776775204e-05,
      "loss": 1.5934,
      "num_input_tokens_seen": 20285184544,
      "step": 25783
    },
    {
      "epoch": 2.7354126883089327,
      "grad_norm": 0.36663209976474864,
      "learning_rate": 4.389444268982566e-05,
      "loss": 1.6906,
      "num_input_tokens_seen": 20285971296,
      "step": 25784
    },
    {
      "epoch": 2.735518777848504,
      "grad_norm": 0.41443133038105734,
      "learning_rate": 4.38939875972982e-05,
      "loss": 1.6073,
      "num_input_tokens_seen": 20286758000,
      "step": 25785
    },
    {
      "epoch": 2.7356248673880756,
      "grad_norm": 0.3910807755563487,
      "learning_rate": 4.389353249017003e-05,
      "loss": 1.4857,
      "num_input_tokens_seen": 20287544816,
      "step": 25786
    },
    {
      "epoch": 2.7357309569276467,
      "grad_norm": 0.38338166450923566,
      "learning_rate": 4.3893077368441496e-05,
      "loss": 1.5841,
      "num_input_tokens_seen": 20288331600,
      "step": 25787
    },
    {
      "epoch": 2.7358370464672186,
      "grad_norm": 0.39765886541142914,
      "learning_rate": 4.389262223211294e-05,
      "loss": 1.5977,
      "num_input_tokens_seen": 20289118320,
      "step": 25788
    },
    {
      "epoch": 2.7359431360067896,
      "grad_norm": 0.3633208039116662,
      "learning_rate": 4.389216708118472e-05,
      "loss": 1.6616,
      "num_input_tokens_seen": 20289904912,
      "step": 25789
    },
    {
      "epoch": 2.736049225546361,
      "grad_norm": 0.384105231075374,
      "learning_rate": 4.3891711915657194e-05,
      "loss": 1.4962,
      "num_input_tokens_seen": 20290691616,
      "step": 25790
    },
    {
      "epoch": 2.7361553150859326,
      "grad_norm": 0.399222150096556,
      "learning_rate": 4.38912567355307e-05,
      "loss": 1.5782,
      "num_input_tokens_seen": 20291478352,
      "step": 25791
    },
    {
      "epoch": 2.736261404625504,
      "grad_norm": 0.32903383238313333,
      "learning_rate": 4.38908015408056e-05,
      "loss": 1.5369,
      "num_input_tokens_seen": 20292265168,
      "step": 25792
    },
    {
      "epoch": 2.7363674941650755,
      "grad_norm": 0.38648500531941327,
      "learning_rate": 4.389034633148224e-05,
      "loss": 1.501,
      "num_input_tokens_seen": 20293051840,
      "step": 25793
    },
    {
      "epoch": 2.7364735837046466,
      "grad_norm": 0.40587727339459273,
      "learning_rate": 4.388989110756098e-05,
      "loss": 1.5361,
      "num_input_tokens_seen": 20293838592,
      "step": 25794
    },
    {
      "epoch": 2.736579673244218,
      "grad_norm": 0.39491491011075125,
      "learning_rate": 4.388943586904216e-05,
      "loss": 1.6011,
      "num_input_tokens_seen": 20294625376,
      "step": 25795
    },
    {
      "epoch": 2.7366857627837895,
      "grad_norm": 0.4468319854532071,
      "learning_rate": 4.3888980615926145e-05,
      "loss": 1.4412,
      "num_input_tokens_seen": 20295412176,
      "step": 25796
    },
    {
      "epoch": 2.736791852323361,
      "grad_norm": 0.4230178297254534,
      "learning_rate": 4.388852534821327e-05,
      "loss": 1.5799,
      "num_input_tokens_seen": 20296198848,
      "step": 25797
    },
    {
      "epoch": 2.7368979418629324,
      "grad_norm": 0.38701876608345537,
      "learning_rate": 4.388807006590391e-05,
      "loss": 1.7046,
      "num_input_tokens_seen": 20296985552,
      "step": 25798
    },
    {
      "epoch": 2.7370040314025035,
      "grad_norm": 0.3864319638682132,
      "learning_rate": 4.388761476899839e-05,
      "loss": 1.6616,
      "num_input_tokens_seen": 20297772400,
      "step": 25799
    },
    {
      "epoch": 2.737110120942075,
      "grad_norm": 0.37504842702544794,
      "learning_rate": 4.388715945749709e-05,
      "loss": 1.521,
      "num_input_tokens_seen": 20298559152,
      "step": 25800
    },
    {
      "epoch": 2.7372162104816464,
      "grad_norm": 0.36005656185959806,
      "learning_rate": 4.3886704131400335e-05,
      "loss": 1.5312,
      "num_input_tokens_seen": 20299345952,
      "step": 25801
    },
    {
      "epoch": 2.737322300021218,
      "grad_norm": 0.38157498220155345,
      "learning_rate": 4.388624879070849e-05,
      "loss": 1.6801,
      "num_input_tokens_seen": 20300132720,
      "step": 25802
    },
    {
      "epoch": 2.7374283895607894,
      "grad_norm": 0.5323605149180554,
      "learning_rate": 4.3885793435421915e-05,
      "loss": 1.4887,
      "num_input_tokens_seen": 20300919440,
      "step": 25803
    },
    {
      "epoch": 2.737534479100361,
      "grad_norm": 0.39158164275709934,
      "learning_rate": 4.388533806554095e-05,
      "loss": 1.5487,
      "num_input_tokens_seen": 20301706288,
      "step": 25804
    },
    {
      "epoch": 2.7376405686399323,
      "grad_norm": 0.5173139395503187,
      "learning_rate": 4.388488268106594e-05,
      "loss": 1.7304,
      "num_input_tokens_seen": 20302492976,
      "step": 25805
    },
    {
      "epoch": 2.7377466581795034,
      "grad_norm": 0.55946911226983,
      "learning_rate": 4.388442728199726e-05,
      "loss": 1.6892,
      "num_input_tokens_seen": 20303279712,
      "step": 25806
    },
    {
      "epoch": 2.737852747719075,
      "grad_norm": 0.5797562513681336,
      "learning_rate": 4.3883971868335246e-05,
      "loss": 1.6475,
      "num_input_tokens_seen": 20304066480,
      "step": 25807
    },
    {
      "epoch": 2.7379588372586463,
      "grad_norm": 0.5279034739848794,
      "learning_rate": 4.388351644008025e-05,
      "loss": 1.5699,
      "num_input_tokens_seen": 20304853280,
      "step": 25808
    },
    {
      "epoch": 2.738064926798218,
      "grad_norm": 0.37016525375043,
      "learning_rate": 4.388306099723262e-05,
      "loss": 1.5137,
      "num_input_tokens_seen": 20305640112,
      "step": 25809
    },
    {
      "epoch": 2.7381710163377893,
      "grad_norm": 0.4645124041255384,
      "learning_rate": 4.3882605539792724e-05,
      "loss": 1.4973,
      "num_input_tokens_seen": 20306426976,
      "step": 25810
    },
    {
      "epoch": 2.7382771058773603,
      "grad_norm": 0.48726227444250947,
      "learning_rate": 4.38821500677609e-05,
      "loss": 1.7358,
      "num_input_tokens_seen": 20307213760,
      "step": 25811
    },
    {
      "epoch": 2.7383831954169318,
      "grad_norm": 0.3865093408319584,
      "learning_rate": 4.388169458113751e-05,
      "loss": 1.6558,
      "num_input_tokens_seen": 20308000496,
      "step": 25812
    },
    {
      "epoch": 2.7384892849565032,
      "grad_norm": 0.4553828879543546,
      "learning_rate": 4.38812390799229e-05,
      "loss": 1.5993,
      "num_input_tokens_seen": 20308787312,
      "step": 25813
    },
    {
      "epoch": 2.7385953744960747,
      "grad_norm": 0.3786831657677921,
      "learning_rate": 4.388078356411741e-05,
      "loss": 1.5716,
      "num_input_tokens_seen": 20309574128,
      "step": 25814
    },
    {
      "epoch": 2.738701464035646,
      "grad_norm": 0.41904778839326,
      "learning_rate": 4.3880328033721416e-05,
      "loss": 1.6282,
      "num_input_tokens_seen": 20310360944,
      "step": 25815
    },
    {
      "epoch": 2.738807553575217,
      "grad_norm": 0.38667777232363076,
      "learning_rate": 4.3879872488735256e-05,
      "loss": 1.4873,
      "num_input_tokens_seen": 20311147728,
      "step": 25816
    },
    {
      "epoch": 2.738913643114789,
      "grad_norm": 0.3961784933140966,
      "learning_rate": 4.387941692915929e-05,
      "loss": 1.5736,
      "num_input_tokens_seen": 20311934432,
      "step": 25817
    },
    {
      "epoch": 2.73901973265436,
      "grad_norm": 0.3865004416164916,
      "learning_rate": 4.387896135499385e-05,
      "loss": 1.5544,
      "num_input_tokens_seen": 20312721296,
      "step": 25818
    },
    {
      "epoch": 2.7391258221939316,
      "grad_norm": 0.39092133613844066,
      "learning_rate": 4.3878505766239317e-05,
      "loss": 1.6017,
      "num_input_tokens_seen": 20313508032,
      "step": 25819
    },
    {
      "epoch": 2.739231911733503,
      "grad_norm": 0.359493055967593,
      "learning_rate": 4.387805016289602e-05,
      "loss": 1.5268,
      "num_input_tokens_seen": 20314294720,
      "step": 25820
    },
    {
      "epoch": 2.7393380012730746,
      "grad_norm": 0.3706202339558668,
      "learning_rate": 4.387759454496433e-05,
      "loss": 1.5006,
      "num_input_tokens_seen": 20315081504,
      "step": 25821
    },
    {
      "epoch": 2.739444090812646,
      "grad_norm": 0.38158714248156345,
      "learning_rate": 4.3877138912444576e-05,
      "loss": 1.572,
      "num_input_tokens_seen": 20315868240,
      "step": 25822
    },
    {
      "epoch": 2.739550180352217,
      "grad_norm": 0.34869428390084206,
      "learning_rate": 4.387668326533713e-05,
      "loss": 1.6776,
      "num_input_tokens_seen": 20316655024,
      "step": 25823
    },
    {
      "epoch": 2.7396562698917886,
      "grad_norm": 0.4204739356949419,
      "learning_rate": 4.387622760364234e-05,
      "loss": 1.5823,
      "num_input_tokens_seen": 20317441728,
      "step": 25824
    },
    {
      "epoch": 2.73976235943136,
      "grad_norm": 0.41658603285079304,
      "learning_rate": 4.387577192736054e-05,
      "loss": 1.6729,
      "num_input_tokens_seen": 20318228448,
      "step": 25825
    },
    {
      "epoch": 2.7398684489709315,
      "grad_norm": 0.36836741279306606,
      "learning_rate": 4.3875316236492114e-05,
      "loss": 1.5135,
      "num_input_tokens_seen": 20319015216,
      "step": 25826
    },
    {
      "epoch": 2.739974538510503,
      "grad_norm": 0.3797209603414437,
      "learning_rate": 4.387486053103739e-05,
      "loss": 1.5019,
      "num_input_tokens_seen": 20319802112,
      "step": 25827
    },
    {
      "epoch": 2.740080628050074,
      "grad_norm": 0.3882203246756307,
      "learning_rate": 4.387440481099673e-05,
      "loss": 1.5842,
      "num_input_tokens_seen": 20320588832,
      "step": 25828
    },
    {
      "epoch": 2.740186717589646,
      "grad_norm": 0.42309239059947223,
      "learning_rate": 4.3873949076370484e-05,
      "loss": 1.5799,
      "num_input_tokens_seen": 20321375488,
      "step": 25829
    },
    {
      "epoch": 2.740292807129217,
      "grad_norm": 0.3932212603074016,
      "learning_rate": 4.3873493327159e-05,
      "loss": 1.6254,
      "num_input_tokens_seen": 20322162240,
      "step": 25830
    },
    {
      "epoch": 2.7403988966687884,
      "grad_norm": 0.38017395322198133,
      "learning_rate": 4.387303756336264e-05,
      "loss": 1.6062,
      "num_input_tokens_seen": 20322949040,
      "step": 25831
    },
    {
      "epoch": 2.74050498620836,
      "grad_norm": 0.3123240729785706,
      "learning_rate": 4.3872581784981745e-05,
      "loss": 1.4643,
      "num_input_tokens_seen": 20323735904,
      "step": 25832
    },
    {
      "epoch": 2.7406110757479314,
      "grad_norm": 0.4041126750327577,
      "learning_rate": 4.3872125992016675e-05,
      "loss": 1.6415,
      "num_input_tokens_seen": 20324522768,
      "step": 25833
    },
    {
      "epoch": 2.740717165287503,
      "grad_norm": 0.41591768298168796,
      "learning_rate": 4.3871670184467784e-05,
      "loss": 1.6651,
      "num_input_tokens_seen": 20325309456,
      "step": 25834
    },
    {
      "epoch": 2.740823254827074,
      "grad_norm": 0.4268339950776094,
      "learning_rate": 4.387121436233542e-05,
      "loss": 1.5936,
      "num_input_tokens_seen": 20326096240,
      "step": 25835
    },
    {
      "epoch": 2.7409293443666454,
      "grad_norm": 0.3648034504148221,
      "learning_rate": 4.3870758525619924e-05,
      "loss": 1.641,
      "num_input_tokens_seen": 20326883008,
      "step": 25836
    },
    {
      "epoch": 2.741035433906217,
      "grad_norm": 0.4230791143219885,
      "learning_rate": 4.3870302674321674e-05,
      "loss": 1.5523,
      "num_input_tokens_seen": 20327669728,
      "step": 25837
    },
    {
      "epoch": 2.7411415234457883,
      "grad_norm": 0.3621279591304922,
      "learning_rate": 4.3869846808441e-05,
      "loss": 1.6149,
      "num_input_tokens_seen": 20328456480,
      "step": 25838
    },
    {
      "epoch": 2.74124761298536,
      "grad_norm": 0.4024467457584571,
      "learning_rate": 4.386939092797826e-05,
      "loss": 1.5594,
      "num_input_tokens_seen": 20329243200,
      "step": 25839
    },
    {
      "epoch": 2.741353702524931,
      "grad_norm": 0.3973109815000241,
      "learning_rate": 4.386893503293381e-05,
      "loss": 1.6835,
      "num_input_tokens_seen": 20330030016,
      "step": 25840
    },
    {
      "epoch": 2.7414597920645023,
      "grad_norm": 0.350129630685186,
      "learning_rate": 4.3868479123308005e-05,
      "loss": 1.4517,
      "num_input_tokens_seen": 20330816832,
      "step": 25841
    },
    {
      "epoch": 2.7415658816040738,
      "grad_norm": 0.35329506263084615,
      "learning_rate": 4.386802319910118e-05,
      "loss": 1.5104,
      "num_input_tokens_seen": 20331603552,
      "step": 25842
    },
    {
      "epoch": 2.7416719711436452,
      "grad_norm": 0.37933556881985026,
      "learning_rate": 4.386756726031371e-05,
      "loss": 1.4718,
      "num_input_tokens_seen": 20332390384,
      "step": 25843
    },
    {
      "epoch": 2.7417780606832167,
      "grad_norm": 0.4450607759308791,
      "learning_rate": 4.386711130694594e-05,
      "loss": 1.7427,
      "num_input_tokens_seen": 20333177136,
      "step": 25844
    },
    {
      "epoch": 2.741884150222788,
      "grad_norm": 0.4273865673126604,
      "learning_rate": 4.386665533899822e-05,
      "loss": 1.5909,
      "num_input_tokens_seen": 20333963936,
      "step": 25845
    },
    {
      "epoch": 2.7419902397623597,
      "grad_norm": 0.40023142201296047,
      "learning_rate": 4.3866199356470896e-05,
      "loss": 1.5172,
      "num_input_tokens_seen": 20334750784,
      "step": 25846
    },
    {
      "epoch": 2.7420963293019307,
      "grad_norm": 0.37698939602463233,
      "learning_rate": 4.386574335936433e-05,
      "loss": 1.567,
      "num_input_tokens_seen": 20335537536,
      "step": 25847
    },
    {
      "epoch": 2.742202418841502,
      "grad_norm": 0.4116292835141769,
      "learning_rate": 4.3865287347678876e-05,
      "loss": 1.6331,
      "num_input_tokens_seen": 20336324288,
      "step": 25848
    },
    {
      "epoch": 2.7423085083810737,
      "grad_norm": 0.36703479714363796,
      "learning_rate": 4.386483132141488e-05,
      "loss": 1.5981,
      "num_input_tokens_seen": 20337111088,
      "step": 25849
    },
    {
      "epoch": 2.742414597920645,
      "grad_norm": 0.43922611435036285,
      "learning_rate": 4.386437528057269e-05,
      "loss": 1.6981,
      "num_input_tokens_seen": 20337897952,
      "step": 25850
    },
    {
      "epoch": 2.7425206874602166,
      "grad_norm": 0.4087580926753631,
      "learning_rate": 4.3863919225152664e-05,
      "loss": 1.5405,
      "num_input_tokens_seen": 20338684688,
      "step": 25851
    },
    {
      "epoch": 2.7426267769997876,
      "grad_norm": 0.3443699152026908,
      "learning_rate": 4.386346315515516e-05,
      "loss": 1.6546,
      "num_input_tokens_seen": 20339471520,
      "step": 25852
    },
    {
      "epoch": 2.742732866539359,
      "grad_norm": 0.4134972481590061,
      "learning_rate": 4.386300707058052e-05,
      "loss": 1.5053,
      "num_input_tokens_seen": 20340258304,
      "step": 25853
    },
    {
      "epoch": 2.7428389560789306,
      "grad_norm": 0.3409294305327201,
      "learning_rate": 4.3862550971429106e-05,
      "loss": 1.5805,
      "num_input_tokens_seen": 20341045008,
      "step": 25854
    },
    {
      "epoch": 2.742945045618502,
      "grad_norm": 0.38456085243267163,
      "learning_rate": 4.3862094857701265e-05,
      "loss": 1.4712,
      "num_input_tokens_seen": 20341831760,
      "step": 25855
    },
    {
      "epoch": 2.7430511351580735,
      "grad_norm": 0.49254128067761593,
      "learning_rate": 4.386163872939735e-05,
      "loss": 1.7172,
      "num_input_tokens_seen": 20342618512,
      "step": 25856
    },
    {
      "epoch": 2.7431572246976446,
      "grad_norm": 0.3976127972198651,
      "learning_rate": 4.3861182586517715e-05,
      "loss": 1.6114,
      "num_input_tokens_seen": 20343405264,
      "step": 25857
    },
    {
      "epoch": 2.7432633142372165,
      "grad_norm": 0.45889081350639266,
      "learning_rate": 4.386072642906271e-05,
      "loss": 1.6363,
      "num_input_tokens_seen": 20344192000,
      "step": 25858
    },
    {
      "epoch": 2.7433694037767875,
      "grad_norm": 0.3289272963436267,
      "learning_rate": 4.3860270257032685e-05,
      "loss": 1.6248,
      "num_input_tokens_seen": 20344978864,
      "step": 25859
    },
    {
      "epoch": 2.743475493316359,
      "grad_norm": 0.4304164539099651,
      "learning_rate": 4.3859814070428006e-05,
      "loss": 1.5798,
      "num_input_tokens_seen": 20345765648,
      "step": 25860
    },
    {
      "epoch": 2.7435815828559305,
      "grad_norm": 0.3928175657045171,
      "learning_rate": 4.3859357869249013e-05,
      "loss": 1.4213,
      "num_input_tokens_seen": 20346552480,
      "step": 25861
    },
    {
      "epoch": 2.743687672395502,
      "grad_norm": 0.38843510304622375,
      "learning_rate": 4.385890165349606e-05,
      "loss": 1.5846,
      "num_input_tokens_seen": 20347339312,
      "step": 25862
    },
    {
      "epoch": 2.7437937619350734,
      "grad_norm": 0.48654203915689864,
      "learning_rate": 4.3858445423169505e-05,
      "loss": 1.5891,
      "num_input_tokens_seen": 20348126032,
      "step": 25863
    },
    {
      "epoch": 2.7438998514746444,
      "grad_norm": 0.42913244289214725,
      "learning_rate": 4.385798917826969e-05,
      "loss": 1.5912,
      "num_input_tokens_seen": 20348912880,
      "step": 25864
    },
    {
      "epoch": 2.744005941014216,
      "grad_norm": 0.3962936444398246,
      "learning_rate": 4.385753291879697e-05,
      "loss": 1.5954,
      "num_input_tokens_seen": 20349699648,
      "step": 25865
    },
    {
      "epoch": 2.7441120305537874,
      "grad_norm": 0.40446237881623676,
      "learning_rate": 4.385707664475171e-05,
      "loss": 1.6549,
      "num_input_tokens_seen": 20350486336,
      "step": 25866
    },
    {
      "epoch": 2.744218120093359,
      "grad_norm": 0.4340697832194191,
      "learning_rate": 4.385662035613426e-05,
      "loss": 1.627,
      "num_input_tokens_seen": 20351273072,
      "step": 25867
    },
    {
      "epoch": 2.7443242096329303,
      "grad_norm": 0.34511509712253147,
      "learning_rate": 4.385616405294496e-05,
      "loss": 1.684,
      "num_input_tokens_seen": 20352059808,
      "step": 25868
    },
    {
      "epoch": 2.7444302991725014,
      "grad_norm": 0.4120301958644535,
      "learning_rate": 4.385570773518417e-05,
      "loss": 1.6123,
      "num_input_tokens_seen": 20352846496,
      "step": 25869
    },
    {
      "epoch": 2.744536388712073,
      "grad_norm": 0.4307469892508184,
      "learning_rate": 4.385525140285224e-05,
      "loss": 1.5659,
      "num_input_tokens_seen": 20353633216,
      "step": 25870
    },
    {
      "epoch": 2.7446424782516443,
      "grad_norm": 0.3629431790881921,
      "learning_rate": 4.385479505594953e-05,
      "loss": 1.4729,
      "num_input_tokens_seen": 20354420128,
      "step": 25871
    },
    {
      "epoch": 2.744748567791216,
      "grad_norm": 0.38293225071158604,
      "learning_rate": 4.385433869447638e-05,
      "loss": 1.57,
      "num_input_tokens_seen": 20355206896,
      "step": 25872
    },
    {
      "epoch": 2.7448546573307873,
      "grad_norm": 0.3853313402188286,
      "learning_rate": 4.385388231843316e-05,
      "loss": 1.5611,
      "num_input_tokens_seen": 20355993664,
      "step": 25873
    },
    {
      "epoch": 2.7449607468703587,
      "grad_norm": 0.3650259088661105,
      "learning_rate": 4.385342592782021e-05,
      "loss": 1.4846,
      "num_input_tokens_seen": 20356780432,
      "step": 25874
    },
    {
      "epoch": 2.74506683640993,
      "grad_norm": 0.39242800606175604,
      "learning_rate": 4.3852969522637886e-05,
      "loss": 1.4903,
      "num_input_tokens_seen": 20357567136,
      "step": 25875
    },
    {
      "epoch": 2.7451729259495012,
      "grad_norm": 0.411823865957052,
      "learning_rate": 4.385251310288654e-05,
      "loss": 1.619,
      "num_input_tokens_seen": 20358353920,
      "step": 25876
    },
    {
      "epoch": 2.7452790154890727,
      "grad_norm": 0.37339512042117223,
      "learning_rate": 4.385205666856652e-05,
      "loss": 1.5571,
      "num_input_tokens_seen": 20359140704,
      "step": 25877
    },
    {
      "epoch": 2.745385105028644,
      "grad_norm": 0.379796440864276,
      "learning_rate": 4.385160021967818e-05,
      "loss": 1.616,
      "num_input_tokens_seen": 20359927456,
      "step": 25878
    },
    {
      "epoch": 2.7454911945682157,
      "grad_norm": 0.35495864299135854,
      "learning_rate": 4.385114375622189e-05,
      "loss": 1.5634,
      "num_input_tokens_seen": 20360714128,
      "step": 25879
    },
    {
      "epoch": 2.745597284107787,
      "grad_norm": 0.3934058890674531,
      "learning_rate": 4.3850687278197985e-05,
      "loss": 1.5651,
      "num_input_tokens_seen": 20361500944,
      "step": 25880
    },
    {
      "epoch": 2.745703373647358,
      "grad_norm": 0.385511177273918,
      "learning_rate": 4.3850230785606814e-05,
      "loss": 1.5993,
      "num_input_tokens_seen": 20362287696,
      "step": 25881
    },
    {
      "epoch": 2.7458094631869296,
      "grad_norm": 0.40129561145365933,
      "learning_rate": 4.384977427844875e-05,
      "loss": 1.6289,
      "num_input_tokens_seen": 20363074512,
      "step": 25882
    },
    {
      "epoch": 2.745915552726501,
      "grad_norm": 0.39095627829716373,
      "learning_rate": 4.3849317756724124e-05,
      "loss": 1.5732,
      "num_input_tokens_seen": 20363861360,
      "step": 25883
    },
    {
      "epoch": 2.7460216422660726,
      "grad_norm": 0.4107599234366219,
      "learning_rate": 4.3848861220433304e-05,
      "loss": 1.6103,
      "num_input_tokens_seen": 20364648000,
      "step": 25884
    },
    {
      "epoch": 2.746127731805644,
      "grad_norm": 0.36029704534363066,
      "learning_rate": 4.3848404669576634e-05,
      "loss": 1.5127,
      "num_input_tokens_seen": 20365434752,
      "step": 25885
    },
    {
      "epoch": 2.746233821345215,
      "grad_norm": 0.3466634835281968,
      "learning_rate": 4.3847948104154467e-05,
      "loss": 1.4674,
      "num_input_tokens_seen": 20366221488,
      "step": 25886
    },
    {
      "epoch": 2.746339910884787,
      "grad_norm": 0.3751285986517896,
      "learning_rate": 4.384749152416716e-05,
      "loss": 1.5573,
      "num_input_tokens_seen": 20367008288,
      "step": 25887
    },
    {
      "epoch": 2.746446000424358,
      "grad_norm": 0.4458271062123923,
      "learning_rate": 4.384703492961507e-05,
      "loss": 1.6496,
      "num_input_tokens_seen": 20367795136,
      "step": 25888
    },
    {
      "epoch": 2.7465520899639295,
      "grad_norm": 0.3727761059349686,
      "learning_rate": 4.3846578320498546e-05,
      "loss": 1.6078,
      "num_input_tokens_seen": 20368581920,
      "step": 25889
    },
    {
      "epoch": 2.746658179503501,
      "grad_norm": 0.4546494568589994,
      "learning_rate": 4.384612169681793e-05,
      "loss": 1.5849,
      "num_input_tokens_seen": 20369368752,
      "step": 25890
    },
    {
      "epoch": 2.7467642690430725,
      "grad_norm": 0.384993657289815,
      "learning_rate": 4.384566505857359e-05,
      "loss": 1.6137,
      "num_input_tokens_seen": 20370155520,
      "step": 25891
    },
    {
      "epoch": 2.746870358582644,
      "grad_norm": 0.4647917698346455,
      "learning_rate": 4.384520840576587e-05,
      "loss": 1.5619,
      "num_input_tokens_seen": 20370942336,
      "step": 25892
    },
    {
      "epoch": 2.746976448122215,
      "grad_norm": 0.3614871873457404,
      "learning_rate": 4.384475173839513e-05,
      "loss": 1.6258,
      "num_input_tokens_seen": 20371728992,
      "step": 25893
    },
    {
      "epoch": 2.7470825376617864,
      "grad_norm": 0.3856541643082995,
      "learning_rate": 4.3844295056461715e-05,
      "loss": 1.591,
      "num_input_tokens_seen": 20372515808,
      "step": 25894
    },
    {
      "epoch": 2.747188627201358,
      "grad_norm": 0.39558689201363445,
      "learning_rate": 4.384383835996598e-05,
      "loss": 1.5542,
      "num_input_tokens_seen": 20373302640,
      "step": 25895
    },
    {
      "epoch": 2.7472947167409294,
      "grad_norm": 0.4210787398342566,
      "learning_rate": 4.384338164890829e-05,
      "loss": 1.549,
      "num_input_tokens_seen": 20374089296,
      "step": 25896
    },
    {
      "epoch": 2.747400806280501,
      "grad_norm": 0.42531574996366867,
      "learning_rate": 4.384292492328898e-05,
      "loss": 1.5587,
      "num_input_tokens_seen": 20374876016,
      "step": 25897
    },
    {
      "epoch": 2.747506895820072,
      "grad_norm": 0.6390061522258011,
      "learning_rate": 4.38424681831084e-05,
      "loss": 1.6521,
      "num_input_tokens_seen": 20375662672,
      "step": 25898
    },
    {
      "epoch": 2.7476129853596434,
      "grad_norm": 0.4471790753246206,
      "learning_rate": 4.3842011428366925e-05,
      "loss": 1.6039,
      "num_input_tokens_seen": 20376449424,
      "step": 25899
    },
    {
      "epoch": 2.747719074899215,
      "grad_norm": 0.5969720139886472,
      "learning_rate": 4.3841554659064896e-05,
      "loss": 1.5255,
      "num_input_tokens_seen": 20377236144,
      "step": 25900
    },
    {
      "epoch": 2.7478251644387863,
      "grad_norm": 0.365842637967852,
      "learning_rate": 4.384109787520267e-05,
      "loss": 1.6823,
      "num_input_tokens_seen": 20378022896,
      "step": 25901
    },
    {
      "epoch": 2.747931253978358,
      "grad_norm": 0.5218607445255051,
      "learning_rate": 4.384064107678059e-05,
      "loss": 1.6543,
      "num_input_tokens_seen": 20378809648,
      "step": 25902
    },
    {
      "epoch": 2.7480373435179293,
      "grad_norm": 0.3987653305379728,
      "learning_rate": 4.384018426379902e-05,
      "loss": 1.6755,
      "num_input_tokens_seen": 20379596288,
      "step": 25903
    },
    {
      "epoch": 2.7481434330575008,
      "grad_norm": 0.40936629053343665,
      "learning_rate": 4.38397274362583e-05,
      "loss": 1.6699,
      "num_input_tokens_seen": 20380383024,
      "step": 25904
    },
    {
      "epoch": 2.748249522597072,
      "grad_norm": 0.4684692849819557,
      "learning_rate": 4.38392705941588e-05,
      "loss": 1.5324,
      "num_input_tokens_seen": 20381169760,
      "step": 25905
    },
    {
      "epoch": 2.7483556121366433,
      "grad_norm": 0.4152474876764184,
      "learning_rate": 4.383881373750087e-05,
      "loss": 1.6613,
      "num_input_tokens_seen": 20381956544,
      "step": 25906
    },
    {
      "epoch": 2.7484617016762147,
      "grad_norm": 0.593874546987005,
      "learning_rate": 4.3838356866284844e-05,
      "loss": 1.681,
      "num_input_tokens_seen": 20382743312,
      "step": 25907
    },
    {
      "epoch": 2.748567791215786,
      "grad_norm": 0.40495727530514475,
      "learning_rate": 4.3837899980511096e-05,
      "loss": 1.6243,
      "num_input_tokens_seen": 20383530144,
      "step": 25908
    },
    {
      "epoch": 2.7486738807553577,
      "grad_norm": 0.4515396768742624,
      "learning_rate": 4.383744308017997e-05,
      "loss": 1.6027,
      "num_input_tokens_seen": 20384316848,
      "step": 25909
    },
    {
      "epoch": 2.7487799702949287,
      "grad_norm": 0.48391682651524004,
      "learning_rate": 4.383698616529182e-05,
      "loss": 1.643,
      "num_input_tokens_seen": 20385103600,
      "step": 25910
    },
    {
      "epoch": 2.7488860598345,
      "grad_norm": 0.39937834830558594,
      "learning_rate": 4.3836529235847e-05,
      "loss": 1.6437,
      "num_input_tokens_seen": 20385890288,
      "step": 25911
    },
    {
      "epoch": 2.7489921493740717,
      "grad_norm": 0.48281555783822033,
      "learning_rate": 4.383607229184586e-05,
      "loss": 1.6045,
      "num_input_tokens_seen": 20386677136,
      "step": 25912
    },
    {
      "epoch": 2.749098238913643,
      "grad_norm": 0.38797651106647807,
      "learning_rate": 4.383561533328876e-05,
      "loss": 1.6621,
      "num_input_tokens_seen": 20387463856,
      "step": 25913
    },
    {
      "epoch": 2.7492043284532146,
      "grad_norm": 0.3736084144187999,
      "learning_rate": 4.3835158360176056e-05,
      "loss": 1.5924,
      "num_input_tokens_seen": 20388250672,
      "step": 25914
    },
    {
      "epoch": 2.7493104179927856,
      "grad_norm": 0.3942664614057751,
      "learning_rate": 4.383470137250808e-05,
      "loss": 1.5383,
      "num_input_tokens_seen": 20389037424,
      "step": 25915
    },
    {
      "epoch": 2.7494165075323576,
      "grad_norm": 0.5108761075627049,
      "learning_rate": 4.3834244370285205e-05,
      "loss": 1.5635,
      "num_input_tokens_seen": 20389824288,
      "step": 25916
    },
    {
      "epoch": 2.7495225970719286,
      "grad_norm": 0.391281987501758,
      "learning_rate": 4.383378735350778e-05,
      "loss": 1.5411,
      "num_input_tokens_seen": 20390611072,
      "step": 25917
    },
    {
      "epoch": 2.7496286866115,
      "grad_norm": 0.5495651782869445,
      "learning_rate": 4.383333032217616e-05,
      "loss": 1.6721,
      "num_input_tokens_seen": 20391397856,
      "step": 25918
    },
    {
      "epoch": 2.7497347761510715,
      "grad_norm": 0.3498878471067989,
      "learning_rate": 4.3832873276290687e-05,
      "loss": 1.5617,
      "num_input_tokens_seen": 20392184640,
      "step": 25919
    },
    {
      "epoch": 2.749840865690643,
      "grad_norm": 0.39978327645633077,
      "learning_rate": 4.383241621585173e-05,
      "loss": 1.5959,
      "num_input_tokens_seen": 20392971488,
      "step": 25920
    },
    {
      "epoch": 2.7499469552302145,
      "grad_norm": 0.39993978157479393,
      "learning_rate": 4.383195914085963e-05,
      "loss": 1.6759,
      "num_input_tokens_seen": 20393758192,
      "step": 25921
    },
    {
      "epoch": 2.7500530447697855,
      "grad_norm": 0.36507502835727473,
      "learning_rate": 4.383150205131474e-05,
      "loss": 1.6134,
      "num_input_tokens_seen": 20394544960,
      "step": 25922
    },
    {
      "epoch": 2.750159134309357,
      "grad_norm": 0.4160139078461657,
      "learning_rate": 4.3831044947217424e-05,
      "loss": 1.5756,
      "num_input_tokens_seen": 20395331680,
      "step": 25923
    },
    {
      "epoch": 2.7502652238489285,
      "grad_norm": 0.331501890265471,
      "learning_rate": 4.3830587828568033e-05,
      "loss": 1.4807,
      "num_input_tokens_seen": 20396118512,
      "step": 25924
    },
    {
      "epoch": 2.7503713133885,
      "grad_norm": 0.3451851337483131,
      "learning_rate": 4.383013069536691e-05,
      "loss": 1.5713,
      "num_input_tokens_seen": 20396905376,
      "step": 25925
    },
    {
      "epoch": 2.7504774029280714,
      "grad_norm": 0.3976658625849705,
      "learning_rate": 4.3829673547614415e-05,
      "loss": 1.5582,
      "num_input_tokens_seen": 20397692144,
      "step": 25926
    },
    {
      "epoch": 2.7505834924676424,
      "grad_norm": 0.41038274005012726,
      "learning_rate": 4.38292163853109e-05,
      "loss": 1.6815,
      "num_input_tokens_seen": 20398478960,
      "step": 25927
    },
    {
      "epoch": 2.7506895820072144,
      "grad_norm": 0.3223584334414929,
      "learning_rate": 4.382875920845672e-05,
      "loss": 1.5971,
      "num_input_tokens_seen": 20399265760,
      "step": 25928
    },
    {
      "epoch": 2.7507956715467854,
      "grad_norm": 0.36177131456190187,
      "learning_rate": 4.382830201705223e-05,
      "loss": 1.5277,
      "num_input_tokens_seen": 20400052544,
      "step": 25929
    },
    {
      "epoch": 2.750901761086357,
      "grad_norm": 0.3709129849249861,
      "learning_rate": 4.382784481109778e-05,
      "loss": 1.5409,
      "num_input_tokens_seen": 20400839280,
      "step": 25930
    },
    {
      "epoch": 2.7510078506259283,
      "grad_norm": 0.42252188845759514,
      "learning_rate": 4.382738759059372e-05,
      "loss": 1.6512,
      "num_input_tokens_seen": 20401626048,
      "step": 25931
    },
    {
      "epoch": 2.7511139401655,
      "grad_norm": 0.36049353341574614,
      "learning_rate": 4.382693035554041e-05,
      "loss": 1.5782,
      "num_input_tokens_seen": 20402412800,
      "step": 25932
    },
    {
      "epoch": 2.7512200297050713,
      "grad_norm": 0.4785124994616911,
      "learning_rate": 4.3826473105938205e-05,
      "loss": 1.6395,
      "num_input_tokens_seen": 20403199568,
      "step": 25933
    },
    {
      "epoch": 2.7513261192446423,
      "grad_norm": 0.38414081698444463,
      "learning_rate": 4.3826015841787446e-05,
      "loss": 1.7055,
      "num_input_tokens_seen": 20403986384,
      "step": 25934
    },
    {
      "epoch": 2.751432208784214,
      "grad_norm": 0.40225652190568734,
      "learning_rate": 4.38255585630885e-05,
      "loss": 1.7125,
      "num_input_tokens_seen": 20404773136,
      "step": 25935
    },
    {
      "epoch": 2.7515382983237853,
      "grad_norm": 0.4442141886424171,
      "learning_rate": 4.382510126984171e-05,
      "loss": 1.6609,
      "num_input_tokens_seen": 20405559904,
      "step": 25936
    },
    {
      "epoch": 2.7516443878633567,
      "grad_norm": 0.3824149209919721,
      "learning_rate": 4.382464396204744e-05,
      "loss": 1.43,
      "num_input_tokens_seen": 20406346672,
      "step": 25937
    },
    {
      "epoch": 2.751750477402928,
      "grad_norm": 0.4712701639956714,
      "learning_rate": 4.3824186639706036e-05,
      "loss": 1.6266,
      "num_input_tokens_seen": 20407133456,
      "step": 25938
    },
    {
      "epoch": 2.7518565669424992,
      "grad_norm": 0.38176535821881546,
      "learning_rate": 4.382372930281785e-05,
      "loss": 1.4769,
      "num_input_tokens_seen": 20407920256,
      "step": 25939
    },
    {
      "epoch": 2.7519626564820707,
      "grad_norm": 0.3908232156543734,
      "learning_rate": 4.382327195138324e-05,
      "loss": 1.621,
      "num_input_tokens_seen": 20408707104,
      "step": 25940
    },
    {
      "epoch": 2.752068746021642,
      "grad_norm": 0.3991232617268374,
      "learning_rate": 4.382281458540255e-05,
      "loss": 1.6053,
      "num_input_tokens_seen": 20409493872,
      "step": 25941
    },
    {
      "epoch": 2.7521748355612137,
      "grad_norm": 0.3547613132494164,
      "learning_rate": 4.382235720487615e-05,
      "loss": 1.4938,
      "num_input_tokens_seen": 20410280672,
      "step": 25942
    },
    {
      "epoch": 2.752280925100785,
      "grad_norm": 0.37324345870600134,
      "learning_rate": 4.3821899809804384e-05,
      "loss": 1.5779,
      "num_input_tokens_seen": 20411067456,
      "step": 25943
    },
    {
      "epoch": 2.7523870146403566,
      "grad_norm": 0.3921894771811589,
      "learning_rate": 4.382144240018761e-05,
      "loss": 1.5336,
      "num_input_tokens_seen": 20411854240,
      "step": 25944
    },
    {
      "epoch": 2.752493104179928,
      "grad_norm": 0.36901410014841274,
      "learning_rate": 4.382098497602617e-05,
      "loss": 1.6913,
      "num_input_tokens_seen": 20412641024,
      "step": 25945
    },
    {
      "epoch": 2.752599193719499,
      "grad_norm": 0.3977777819869474,
      "learning_rate": 4.3820527537320424e-05,
      "loss": 1.6732,
      "num_input_tokens_seen": 20413427840,
      "step": 25946
    },
    {
      "epoch": 2.7527052832590706,
      "grad_norm": 0.35225455438916503,
      "learning_rate": 4.382007008407073e-05,
      "loss": 1.5479,
      "num_input_tokens_seen": 20414214688,
      "step": 25947
    },
    {
      "epoch": 2.752811372798642,
      "grad_norm": 0.4015420298915649,
      "learning_rate": 4.381961261627744e-05,
      "loss": 1.6467,
      "num_input_tokens_seen": 20415001456,
      "step": 25948
    },
    {
      "epoch": 2.7529174623382136,
      "grad_norm": 0.3568476796689336,
      "learning_rate": 4.3819155133940906e-05,
      "loss": 1.6255,
      "num_input_tokens_seen": 20415788176,
      "step": 25949
    },
    {
      "epoch": 2.753023551877785,
      "grad_norm": 0.4053462122984283,
      "learning_rate": 4.381869763706148e-05,
      "loss": 1.5666,
      "num_input_tokens_seen": 20416574912,
      "step": 25950
    },
    {
      "epoch": 2.753129641417356,
      "grad_norm": 0.42167735938190304,
      "learning_rate": 4.381824012563951e-05,
      "loss": 1.5813,
      "num_input_tokens_seen": 20417361616,
      "step": 25951
    },
    {
      "epoch": 2.7532357309569275,
      "grad_norm": 0.33767986189651206,
      "learning_rate": 4.381778259967536e-05,
      "loss": 1.5598,
      "num_input_tokens_seen": 20418148368,
      "step": 25952
    },
    {
      "epoch": 2.753341820496499,
      "grad_norm": 0.40414162852142776,
      "learning_rate": 4.381732505916939e-05,
      "loss": 1.5037,
      "num_input_tokens_seen": 20418935120,
      "step": 25953
    },
    {
      "epoch": 2.7534479100360705,
      "grad_norm": 0.41404478343337137,
      "learning_rate": 4.3816867504121925e-05,
      "loss": 1.4928,
      "num_input_tokens_seen": 20419721872,
      "step": 25954
    },
    {
      "epoch": 2.753553999575642,
      "grad_norm": 0.5264051495618705,
      "learning_rate": 4.3816409934533356e-05,
      "loss": 1.5618,
      "num_input_tokens_seen": 20420508656,
      "step": 25955
    },
    {
      "epoch": 2.753660089115213,
      "grad_norm": 0.33783803219335834,
      "learning_rate": 4.381595235040401e-05,
      "loss": 1.4718,
      "num_input_tokens_seen": 20421295520,
      "step": 25956
    },
    {
      "epoch": 2.753766178654785,
      "grad_norm": 0.39045627734432825,
      "learning_rate": 4.3815494751734244e-05,
      "loss": 1.5317,
      "num_input_tokens_seen": 20422082288,
      "step": 25957
    },
    {
      "epoch": 2.753872268194356,
      "grad_norm": 0.46366751198553835,
      "learning_rate": 4.381503713852442e-05,
      "loss": 1.6746,
      "num_input_tokens_seen": 20422868960,
      "step": 25958
    },
    {
      "epoch": 2.7539783577339274,
      "grad_norm": 0.37956043305067244,
      "learning_rate": 4.3814579510774875e-05,
      "loss": 1.6072,
      "num_input_tokens_seen": 20423655712,
      "step": 25959
    },
    {
      "epoch": 2.754084447273499,
      "grad_norm": 0.4288826116158309,
      "learning_rate": 4.381412186848599e-05,
      "loss": 1.5921,
      "num_input_tokens_seen": 20424442512,
      "step": 25960
    },
    {
      "epoch": 2.7541905368130704,
      "grad_norm": 0.40020497071468203,
      "learning_rate": 4.38136642116581e-05,
      "loss": 1.5606,
      "num_input_tokens_seen": 20425229264,
      "step": 25961
    },
    {
      "epoch": 2.754296626352642,
      "grad_norm": 0.4860573948374389,
      "learning_rate": 4.3813206540291565e-05,
      "loss": 1.6153,
      "num_input_tokens_seen": 20426016048,
      "step": 25962
    },
    {
      "epoch": 2.754402715892213,
      "grad_norm": 0.39930290009496827,
      "learning_rate": 4.381274885438673e-05,
      "loss": 1.5847,
      "num_input_tokens_seen": 20426802784,
      "step": 25963
    },
    {
      "epoch": 2.7545088054317843,
      "grad_norm": 0.42883099720119805,
      "learning_rate": 4.381229115394396e-05,
      "loss": 1.5267,
      "num_input_tokens_seen": 20427589616,
      "step": 25964
    },
    {
      "epoch": 2.754614894971356,
      "grad_norm": 0.3682064592323135,
      "learning_rate": 4.381183343896359e-05,
      "loss": 1.6138,
      "num_input_tokens_seen": 20428376384,
      "step": 25965
    },
    {
      "epoch": 2.7547209845109273,
      "grad_norm": 0.33201887454176565,
      "learning_rate": 4.381137570944601e-05,
      "loss": 1.4893,
      "num_input_tokens_seen": 20429163120,
      "step": 25966
    },
    {
      "epoch": 2.7548270740504988,
      "grad_norm": 0.3553287608984387,
      "learning_rate": 4.381091796539153e-05,
      "loss": 1.5677,
      "num_input_tokens_seen": 20429949808,
      "step": 25967
    },
    {
      "epoch": 2.75493316359007,
      "grad_norm": 0.36253091040059016,
      "learning_rate": 4.381046020680053e-05,
      "loss": 1.6123,
      "num_input_tokens_seen": 20430736528,
      "step": 25968
    },
    {
      "epoch": 2.7550392531296413,
      "grad_norm": 0.38902729873144076,
      "learning_rate": 4.381000243367337e-05,
      "loss": 1.6111,
      "num_input_tokens_seen": 20431523296,
      "step": 25969
    },
    {
      "epoch": 2.7551453426692127,
      "grad_norm": 0.36596518033042236,
      "learning_rate": 4.380954464601038e-05,
      "loss": 1.6561,
      "num_input_tokens_seen": 20432310032,
      "step": 25970
    },
    {
      "epoch": 2.755251432208784,
      "grad_norm": 0.3796753520849939,
      "learning_rate": 4.3809086843811934e-05,
      "loss": 1.5823,
      "num_input_tokens_seen": 20433096720,
      "step": 25971
    },
    {
      "epoch": 2.7553575217483557,
      "grad_norm": 0.38813043037713224,
      "learning_rate": 4.380862902707837e-05,
      "loss": 1.6096,
      "num_input_tokens_seen": 20433883408,
      "step": 25972
    },
    {
      "epoch": 2.755463611287927,
      "grad_norm": 0.41931099578307807,
      "learning_rate": 4.3808171195810056e-05,
      "loss": 1.5633,
      "num_input_tokens_seen": 20434670224,
      "step": 25973
    },
    {
      "epoch": 2.7555697008274986,
      "grad_norm": 0.3790744012942244,
      "learning_rate": 4.380771335000733e-05,
      "loss": 1.5982,
      "num_input_tokens_seen": 20435457024,
      "step": 25974
    },
    {
      "epoch": 2.7556757903670697,
      "grad_norm": 0.4494858213301775,
      "learning_rate": 4.380725548967056e-05,
      "loss": 1.5591,
      "num_input_tokens_seen": 20436243808,
      "step": 25975
    },
    {
      "epoch": 2.755781879906641,
      "grad_norm": 0.38327799945029223,
      "learning_rate": 4.38067976148001e-05,
      "loss": 1.6519,
      "num_input_tokens_seen": 20437030464,
      "step": 25976
    },
    {
      "epoch": 2.7558879694462126,
      "grad_norm": 0.3911146547268765,
      "learning_rate": 4.3806339725396286e-05,
      "loss": 1.6242,
      "num_input_tokens_seen": 20437817280,
      "step": 25977
    },
    {
      "epoch": 2.755994058985784,
      "grad_norm": 0.371199029099884,
      "learning_rate": 4.380588182145949e-05,
      "loss": 1.6787,
      "num_input_tokens_seen": 20438604048,
      "step": 25978
    },
    {
      "epoch": 2.7561001485253556,
      "grad_norm": 0.38065301093660275,
      "learning_rate": 4.3805423902990074e-05,
      "loss": 1.5458,
      "num_input_tokens_seen": 20439390832,
      "step": 25979
    },
    {
      "epoch": 2.7562062380649266,
      "grad_norm": 0.4120725310518411,
      "learning_rate": 4.380496596998836e-05,
      "loss": 1.5512,
      "num_input_tokens_seen": 20440177632,
      "step": 25980
    },
    {
      "epoch": 2.756312327604498,
      "grad_norm": 0.37208437507212444,
      "learning_rate": 4.380450802245473e-05,
      "loss": 1.5581,
      "num_input_tokens_seen": 20440964368,
      "step": 25981
    },
    {
      "epoch": 2.7564184171440695,
      "grad_norm": 0.34477668813460893,
      "learning_rate": 4.3804050060389525e-05,
      "loss": 1.5645,
      "num_input_tokens_seen": 20441751200,
      "step": 25982
    },
    {
      "epoch": 2.756524506683641,
      "grad_norm": 0.3697824062706854,
      "learning_rate": 4.38035920837931e-05,
      "loss": 1.6149,
      "num_input_tokens_seen": 20442537952,
      "step": 25983
    },
    {
      "epoch": 2.7566305962232125,
      "grad_norm": 0.43716494572441655,
      "learning_rate": 4.380313409266581e-05,
      "loss": 1.6747,
      "num_input_tokens_seen": 20443324736,
      "step": 25984
    },
    {
      "epoch": 2.7567366857627835,
      "grad_norm": 0.3714182222558441,
      "learning_rate": 4.380267608700801e-05,
      "loss": 1.5645,
      "num_input_tokens_seen": 20444111472,
      "step": 25985
    },
    {
      "epoch": 2.7568427753023554,
      "grad_norm": 0.34500288830701253,
      "learning_rate": 4.380221806682005e-05,
      "loss": 1.5313,
      "num_input_tokens_seen": 20444898240,
      "step": 25986
    },
    {
      "epoch": 2.7569488648419265,
      "grad_norm": 0.36888436964411814,
      "learning_rate": 4.38017600321023e-05,
      "loss": 1.5527,
      "num_input_tokens_seen": 20445685008,
      "step": 25987
    },
    {
      "epoch": 2.757054954381498,
      "grad_norm": 0.38319430179920805,
      "learning_rate": 4.380130198285509e-05,
      "loss": 1.5467,
      "num_input_tokens_seen": 20446471712,
      "step": 25988
    },
    {
      "epoch": 2.7571610439210694,
      "grad_norm": 0.40824359795076814,
      "learning_rate": 4.380084391907879e-05,
      "loss": 1.677,
      "num_input_tokens_seen": 20447258528,
      "step": 25989
    },
    {
      "epoch": 2.757267133460641,
      "grad_norm": 0.3457983946946103,
      "learning_rate": 4.3800385840773754e-05,
      "loss": 1.5971,
      "num_input_tokens_seen": 20448045248,
      "step": 25990
    },
    {
      "epoch": 2.7573732230002124,
      "grad_norm": 0.45718004846902016,
      "learning_rate": 4.3799927747940326e-05,
      "loss": 1.5331,
      "num_input_tokens_seen": 20448832080,
      "step": 25991
    },
    {
      "epoch": 2.7574793125397834,
      "grad_norm": 0.35179916048858234,
      "learning_rate": 4.379946964057887e-05,
      "loss": 1.5992,
      "num_input_tokens_seen": 20449618800,
      "step": 25992
    },
    {
      "epoch": 2.757585402079355,
      "grad_norm": 0.564994346376943,
      "learning_rate": 4.379901151868973e-05,
      "loss": 1.6088,
      "num_input_tokens_seen": 20450405648,
      "step": 25993
    },
    {
      "epoch": 2.7576914916189263,
      "grad_norm": 0.41191360034419994,
      "learning_rate": 4.379855338227327e-05,
      "loss": 1.6844,
      "num_input_tokens_seen": 20451192464,
      "step": 25994
    },
    {
      "epoch": 2.757797581158498,
      "grad_norm": 0.45001231841462164,
      "learning_rate": 4.379809523132983e-05,
      "loss": 1.5403,
      "num_input_tokens_seen": 20451979152,
      "step": 25995
    },
    {
      "epoch": 2.7579036706980693,
      "grad_norm": 0.3775074522827755,
      "learning_rate": 4.379763706585979e-05,
      "loss": 1.6226,
      "num_input_tokens_seen": 20452765952,
      "step": 25996
    },
    {
      "epoch": 2.7580097602376403,
      "grad_norm": 0.3792626493008296,
      "learning_rate": 4.379717888586348e-05,
      "loss": 1.5197,
      "num_input_tokens_seen": 20453552736,
      "step": 25997
    },
    {
      "epoch": 2.758115849777212,
      "grad_norm": 0.4292767302674219,
      "learning_rate": 4.379672069134125e-05,
      "loss": 1.6274,
      "num_input_tokens_seen": 20454339488,
      "step": 25998
    },
    {
      "epoch": 2.7582219393167833,
      "grad_norm": 0.4164099626279849,
      "learning_rate": 4.379626248229348e-05,
      "loss": 1.6533,
      "num_input_tokens_seen": 20455126224,
      "step": 25999
    },
    {
      "epoch": 2.7583280288563548,
      "grad_norm": 0.3876943420123393,
      "learning_rate": 4.379580425872051e-05,
      "loss": 1.4823,
      "num_input_tokens_seen": 20455912992,
      "step": 26000
    },
    {
      "epoch": 2.7583280288563548,
      "eval_loss": 1.6492315530776978,
      "eval_runtime": 64.7421,
      "eval_samples_per_second": 46.338,
      "eval_steps_per_second": 0.494,
      "num_input_tokens_seen": 20455912992,
      "step": 26000
    },
    {
      "epoch": 2.7584341183959262,
      "grad_norm": 0.4430637251850087,
      "learning_rate": 4.379534602062269e-05,
      "loss": 1.6163,
      "num_input_tokens_seen": 20456699712,
      "step": 26001
    },
    {
      "epoch": 2.7585402079354977,
      "grad_norm": 0.39430038433359194,
      "learning_rate": 4.379488776800037e-05,
      "loss": 1.5866,
      "num_input_tokens_seen": 20457486416,
      "step": 26002
    },
    {
      "epoch": 2.758646297475069,
      "grad_norm": 0.4905826336881499,
      "learning_rate": 4.3794429500853924e-05,
      "loss": 1.6024,
      "num_input_tokens_seen": 20458273248,
      "step": 26003
    },
    {
      "epoch": 2.75875238701464,
      "grad_norm": 0.3842556395594171,
      "learning_rate": 4.379397121918369e-05,
      "loss": 1.5895,
      "num_input_tokens_seen": 20459060000,
      "step": 26004
    },
    {
      "epoch": 2.7588584765542117,
      "grad_norm": 0.38746694566316153,
      "learning_rate": 4.379351292299002e-05,
      "loss": 1.6325,
      "num_input_tokens_seen": 20459846704,
      "step": 26005
    },
    {
      "epoch": 2.758964566093783,
      "grad_norm": 0.42200972315848034,
      "learning_rate": 4.379305461227329e-05,
      "loss": 1.6651,
      "num_input_tokens_seen": 20460633408,
      "step": 26006
    },
    {
      "epoch": 2.7590706556333546,
      "grad_norm": 0.3966940558782562,
      "learning_rate": 4.3792596287033825e-05,
      "loss": 1.5952,
      "num_input_tokens_seen": 20461420144,
      "step": 26007
    },
    {
      "epoch": 2.759176745172926,
      "grad_norm": 0.4810458421042352,
      "learning_rate": 4.3792137947272e-05,
      "loss": 1.6375,
      "num_input_tokens_seen": 20462206896,
      "step": 26008
    },
    {
      "epoch": 2.759282834712497,
      "grad_norm": 0.34828582236165256,
      "learning_rate": 4.379167959298816e-05,
      "loss": 1.6138,
      "num_input_tokens_seen": 20462993680,
      "step": 26009
    },
    {
      "epoch": 2.7593889242520686,
      "grad_norm": 0.34851067131443547,
      "learning_rate": 4.3791221224182664e-05,
      "loss": 1.591,
      "num_input_tokens_seen": 20463780448,
      "step": 26010
    },
    {
      "epoch": 2.75949501379164,
      "grad_norm": 0.5229648274517806,
      "learning_rate": 4.379076284085586e-05,
      "loss": 1.6055,
      "num_input_tokens_seen": 20464567296,
      "step": 26011
    },
    {
      "epoch": 2.7596011033312116,
      "grad_norm": 0.36399240146004386,
      "learning_rate": 4.379030444300811e-05,
      "loss": 1.5691,
      "num_input_tokens_seen": 20465354032,
      "step": 26012
    },
    {
      "epoch": 2.759707192870783,
      "grad_norm": 0.5086801037432949,
      "learning_rate": 4.378984603063976e-05,
      "loss": 1.7113,
      "num_input_tokens_seen": 20466140784,
      "step": 26013
    },
    {
      "epoch": 2.759813282410354,
      "grad_norm": 0.362528401178335,
      "learning_rate": 4.378938760375116e-05,
      "loss": 1.4981,
      "num_input_tokens_seen": 20466927648,
      "step": 26014
    },
    {
      "epoch": 2.759919371949926,
      "grad_norm": 0.37258839252056486,
      "learning_rate": 4.378892916234268e-05,
      "loss": 1.4772,
      "num_input_tokens_seen": 20467714400,
      "step": 26015
    },
    {
      "epoch": 2.760025461489497,
      "grad_norm": 0.4059969532362022,
      "learning_rate": 4.378847070641468e-05,
      "loss": 1.6053,
      "num_input_tokens_seen": 20468501232,
      "step": 26016
    },
    {
      "epoch": 2.7601315510290685,
      "grad_norm": 0.38130821034781126,
      "learning_rate": 4.378801223596749e-05,
      "loss": 1.603,
      "num_input_tokens_seen": 20469287984,
      "step": 26017
    },
    {
      "epoch": 2.76023764056864,
      "grad_norm": 0.42127502665789684,
      "learning_rate": 4.378755375100147e-05,
      "loss": 1.5818,
      "num_input_tokens_seen": 20470074704,
      "step": 26018
    },
    {
      "epoch": 2.7603437301082114,
      "grad_norm": 0.4805470142444811,
      "learning_rate": 4.3787095251516994e-05,
      "loss": 1.5814,
      "num_input_tokens_seen": 20470861456,
      "step": 26019
    },
    {
      "epoch": 2.760449819647783,
      "grad_norm": 0.4164741787407699,
      "learning_rate": 4.378663673751438e-05,
      "loss": 1.641,
      "num_input_tokens_seen": 20471648224,
      "step": 26020
    },
    {
      "epoch": 2.760555909187354,
      "grad_norm": 0.41782892799935256,
      "learning_rate": 4.378617820899402e-05,
      "loss": 1.6158,
      "num_input_tokens_seen": 20472434944,
      "step": 26021
    },
    {
      "epoch": 2.7606619987269254,
      "grad_norm": 0.3749702895134728,
      "learning_rate": 4.378571966595626e-05,
      "loss": 1.6556,
      "num_input_tokens_seen": 20473221680,
      "step": 26022
    },
    {
      "epoch": 2.760768088266497,
      "grad_norm": 0.36840956392228746,
      "learning_rate": 4.378526110840143e-05,
      "loss": 1.711,
      "num_input_tokens_seen": 20474008464,
      "step": 26023
    },
    {
      "epoch": 2.7608741778060684,
      "grad_norm": 0.5895569174803287,
      "learning_rate": 4.378480253632992e-05,
      "loss": 1.4979,
      "num_input_tokens_seen": 20474795280,
      "step": 26024
    },
    {
      "epoch": 2.76098026734564,
      "grad_norm": 0.3881906194854675,
      "learning_rate": 4.3784343949742046e-05,
      "loss": 1.6437,
      "num_input_tokens_seen": 20475582080,
      "step": 26025
    },
    {
      "epoch": 2.761086356885211,
      "grad_norm": 0.4543108553089706,
      "learning_rate": 4.378388534863819e-05,
      "loss": 1.6165,
      "num_input_tokens_seen": 20476368784,
      "step": 26026
    },
    {
      "epoch": 2.761192446424783,
      "grad_norm": 0.36592593597495665,
      "learning_rate": 4.3783426733018704e-05,
      "loss": 1.6575,
      "num_input_tokens_seen": 20477155520,
      "step": 26027
    },
    {
      "epoch": 2.761298535964354,
      "grad_norm": 0.3368885353007868,
      "learning_rate": 4.3782968102883925e-05,
      "loss": 1.4933,
      "num_input_tokens_seen": 20477942416,
      "step": 26028
    },
    {
      "epoch": 2.7614046255039253,
      "grad_norm": 0.38344111962791383,
      "learning_rate": 4.3782509458234234e-05,
      "loss": 1.6647,
      "num_input_tokens_seen": 20478729136,
      "step": 26029
    },
    {
      "epoch": 2.7615107150434968,
      "grad_norm": 0.38498273870744115,
      "learning_rate": 4.378205079906996e-05,
      "loss": 1.4967,
      "num_input_tokens_seen": 20479515872,
      "step": 26030
    },
    {
      "epoch": 2.7616168045830682,
      "grad_norm": 0.40097576495814996,
      "learning_rate": 4.378159212539147e-05,
      "loss": 1.7405,
      "num_input_tokens_seen": 20480302656,
      "step": 26031
    },
    {
      "epoch": 2.7617228941226397,
      "grad_norm": 0.38207991686489834,
      "learning_rate": 4.3781133437199115e-05,
      "loss": 1.5945,
      "num_input_tokens_seen": 20481089488,
      "step": 26032
    },
    {
      "epoch": 2.7618289836622107,
      "grad_norm": 0.41386773965551193,
      "learning_rate": 4.378067473449326e-05,
      "loss": 1.4148,
      "num_input_tokens_seen": 20481876304,
      "step": 26033
    },
    {
      "epoch": 2.761935073201782,
      "grad_norm": 0.3751243194117668,
      "learning_rate": 4.378021601727424e-05,
      "loss": 1.595,
      "num_input_tokens_seen": 20482663024,
      "step": 26034
    },
    {
      "epoch": 2.7620411627413537,
      "grad_norm": 0.3717234393658454,
      "learning_rate": 4.3779757285542436e-05,
      "loss": 1.6591,
      "num_input_tokens_seen": 20483449776,
      "step": 26035
    },
    {
      "epoch": 2.762147252280925,
      "grad_norm": 0.5026811960653074,
      "learning_rate": 4.377929853929817e-05,
      "loss": 1.5653,
      "num_input_tokens_seen": 20484236592,
      "step": 26036
    },
    {
      "epoch": 2.7622533418204966,
      "grad_norm": 0.3609400390312605,
      "learning_rate": 4.377883977854182e-05,
      "loss": 1.6436,
      "num_input_tokens_seen": 20485023440,
      "step": 26037
    },
    {
      "epoch": 2.7623594313600677,
      "grad_norm": 0.49441739383464306,
      "learning_rate": 4.377838100327373e-05,
      "loss": 1.5067,
      "num_input_tokens_seen": 20485810320,
      "step": 26038
    },
    {
      "epoch": 2.762465520899639,
      "grad_norm": 0.3985141497872158,
      "learning_rate": 4.377792221349426e-05,
      "loss": 1.6012,
      "num_input_tokens_seen": 20486597216,
      "step": 26039
    },
    {
      "epoch": 2.7625716104392106,
      "grad_norm": 0.5220046379679167,
      "learning_rate": 4.377746340920377e-05,
      "loss": 1.5987,
      "num_input_tokens_seen": 20487384000,
      "step": 26040
    },
    {
      "epoch": 2.762677699978782,
      "grad_norm": 0.49695146378266186,
      "learning_rate": 4.377700459040259e-05,
      "loss": 1.6153,
      "num_input_tokens_seen": 20488170800,
      "step": 26041
    },
    {
      "epoch": 2.7627837895183536,
      "grad_norm": 0.43232658209848734,
      "learning_rate": 4.3776545757091106e-05,
      "loss": 1.5523,
      "num_input_tokens_seen": 20488957568,
      "step": 26042
    },
    {
      "epoch": 2.762889879057925,
      "grad_norm": 0.44378531377276853,
      "learning_rate": 4.377608690926965e-05,
      "loss": 1.4635,
      "num_input_tokens_seen": 20489744416,
      "step": 26043
    },
    {
      "epoch": 2.7629959685974965,
      "grad_norm": 0.41273250485382923,
      "learning_rate": 4.37756280469386e-05,
      "loss": 1.5474,
      "num_input_tokens_seen": 20490531184,
      "step": 26044
    },
    {
      "epoch": 2.7631020581370676,
      "grad_norm": 0.3723251925389701,
      "learning_rate": 4.3775169170098286e-05,
      "loss": 1.4904,
      "num_input_tokens_seen": 20491318064,
      "step": 26045
    },
    {
      "epoch": 2.763208147676639,
      "grad_norm": 0.44451092044512214,
      "learning_rate": 4.377471027874906e-05,
      "loss": 1.6153,
      "num_input_tokens_seen": 20492104864,
      "step": 26046
    },
    {
      "epoch": 2.7633142372162105,
      "grad_norm": 0.41018417510603505,
      "learning_rate": 4.3774251372891305e-05,
      "loss": 1.6959,
      "num_input_tokens_seen": 20492891616,
      "step": 26047
    },
    {
      "epoch": 2.763420326755782,
      "grad_norm": 0.39586291432899084,
      "learning_rate": 4.3773792452525355e-05,
      "loss": 1.6413,
      "num_input_tokens_seen": 20493678480,
      "step": 26048
    },
    {
      "epoch": 2.7635264162953534,
      "grad_norm": 0.38417463686956477,
      "learning_rate": 4.377333351765157e-05,
      "loss": 1.5637,
      "num_input_tokens_seen": 20494465248,
      "step": 26049
    },
    {
      "epoch": 2.7636325058349245,
      "grad_norm": 0.4157527035903675,
      "learning_rate": 4.37728745682703e-05,
      "loss": 1.6447,
      "num_input_tokens_seen": 20495252016,
      "step": 26050
    },
    {
      "epoch": 2.763738595374496,
      "grad_norm": 0.40562765204528545,
      "learning_rate": 4.377241560438191e-05,
      "loss": 1.546,
      "num_input_tokens_seen": 20496038768,
      "step": 26051
    },
    {
      "epoch": 2.7638446849140674,
      "grad_norm": 0.39379395235014136,
      "learning_rate": 4.3771956625986743e-05,
      "loss": 1.5163,
      "num_input_tokens_seen": 20496825520,
      "step": 26052
    },
    {
      "epoch": 2.763950774453639,
      "grad_norm": 0.3505053195707194,
      "learning_rate": 4.377149763308516e-05,
      "loss": 1.4762,
      "num_input_tokens_seen": 20497612272,
      "step": 26053
    },
    {
      "epoch": 2.7640568639932104,
      "grad_norm": 0.40103186946315533,
      "learning_rate": 4.377103862567752e-05,
      "loss": 1.5718,
      "num_input_tokens_seen": 20498399056,
      "step": 26054
    },
    {
      "epoch": 2.7641629535327814,
      "grad_norm": 0.36888566102798703,
      "learning_rate": 4.377057960376416e-05,
      "loss": 1.5673,
      "num_input_tokens_seen": 20499185888,
      "step": 26055
    },
    {
      "epoch": 2.7642690430723533,
      "grad_norm": 0.3752257334813762,
      "learning_rate": 4.377012056734545e-05,
      "loss": 1.5606,
      "num_input_tokens_seen": 20499972656,
      "step": 26056
    },
    {
      "epoch": 2.7643751326119244,
      "grad_norm": 0.4385321231711416,
      "learning_rate": 4.3769661516421746e-05,
      "loss": 1.648,
      "num_input_tokens_seen": 20500759552,
      "step": 26057
    },
    {
      "epoch": 2.764481222151496,
      "grad_norm": 0.35226661066903037,
      "learning_rate": 4.3769202450993396e-05,
      "loss": 1.6619,
      "num_input_tokens_seen": 20501546320,
      "step": 26058
    },
    {
      "epoch": 2.7645873116910673,
      "grad_norm": 0.4951030903292314,
      "learning_rate": 4.376874337106076e-05,
      "loss": 1.6438,
      "num_input_tokens_seen": 20502333104,
      "step": 26059
    },
    {
      "epoch": 2.764693401230639,
      "grad_norm": 0.39842791207447975,
      "learning_rate": 4.376828427662419e-05,
      "loss": 1.6373,
      "num_input_tokens_seen": 20503119872,
      "step": 26060
    },
    {
      "epoch": 2.7647994907702103,
      "grad_norm": 0.37040330186605536,
      "learning_rate": 4.3767825167684036e-05,
      "loss": 1.5063,
      "num_input_tokens_seen": 20503906592,
      "step": 26061
    },
    {
      "epoch": 2.7649055803097813,
      "grad_norm": 0.4113086227452731,
      "learning_rate": 4.376736604424066e-05,
      "loss": 1.6222,
      "num_input_tokens_seen": 20504693328,
      "step": 26062
    },
    {
      "epoch": 2.7650116698493528,
      "grad_norm": 0.4551229146252365,
      "learning_rate": 4.3766906906294414e-05,
      "loss": 1.6158,
      "num_input_tokens_seen": 20505479984,
      "step": 26063
    },
    {
      "epoch": 2.7651177593889242,
      "grad_norm": 0.4192446203588262,
      "learning_rate": 4.376644775384565e-05,
      "loss": 1.6477,
      "num_input_tokens_seen": 20506266752,
      "step": 26064
    },
    {
      "epoch": 2.7652238489284957,
      "grad_norm": 0.5547049748992167,
      "learning_rate": 4.376598858689474e-05,
      "loss": 1.7575,
      "num_input_tokens_seen": 20507053472,
      "step": 26065
    },
    {
      "epoch": 2.765329938468067,
      "grad_norm": 0.3978325718294856,
      "learning_rate": 4.376552940544201e-05,
      "loss": 1.65,
      "num_input_tokens_seen": 20507840208,
      "step": 26066
    },
    {
      "epoch": 2.765436028007638,
      "grad_norm": 0.4431903630813846,
      "learning_rate": 4.3765070209487826e-05,
      "loss": 1.6454,
      "num_input_tokens_seen": 20508626992,
      "step": 26067
    },
    {
      "epoch": 2.7655421175472097,
      "grad_norm": 0.4095750591616907,
      "learning_rate": 4.3764610999032554e-05,
      "loss": 1.5667,
      "num_input_tokens_seen": 20509413840,
      "step": 26068
    },
    {
      "epoch": 2.765648207086781,
      "grad_norm": 0.40187871991138296,
      "learning_rate": 4.3764151774076545e-05,
      "loss": 1.6215,
      "num_input_tokens_seen": 20510200592,
      "step": 26069
    },
    {
      "epoch": 2.7657542966263526,
      "grad_norm": 0.3863614094298813,
      "learning_rate": 4.3763692534620146e-05,
      "loss": 1.626,
      "num_input_tokens_seen": 20510987344,
      "step": 26070
    },
    {
      "epoch": 2.765860386165924,
      "grad_norm": 0.4151520976514053,
      "learning_rate": 4.376323328066371e-05,
      "loss": 1.534,
      "num_input_tokens_seen": 20511774144,
      "step": 26071
    },
    {
      "epoch": 2.7659664757054956,
      "grad_norm": 0.3886456119440939,
      "learning_rate": 4.376277401220761e-05,
      "loss": 1.579,
      "num_input_tokens_seen": 20512560880,
      "step": 26072
    },
    {
      "epoch": 2.766072565245067,
      "grad_norm": 0.46267890716906435,
      "learning_rate": 4.376231472925217e-05,
      "loss": 1.5991,
      "num_input_tokens_seen": 20513347568,
      "step": 26073
    },
    {
      "epoch": 2.766178654784638,
      "grad_norm": 0.43293492107960596,
      "learning_rate": 4.376185543179778e-05,
      "loss": 1.6185,
      "num_input_tokens_seen": 20514134336,
      "step": 26074
    },
    {
      "epoch": 2.7662847443242096,
      "grad_norm": 0.42057227217949045,
      "learning_rate": 4.376139611984478e-05,
      "loss": 1.5547,
      "num_input_tokens_seen": 20514921056,
      "step": 26075
    },
    {
      "epoch": 2.766390833863781,
      "grad_norm": 0.40870080735994746,
      "learning_rate": 4.376093679339352e-05,
      "loss": 1.531,
      "num_input_tokens_seen": 20515707856,
      "step": 26076
    },
    {
      "epoch": 2.7664969234033525,
      "grad_norm": 0.46723472249104575,
      "learning_rate": 4.376047745244435e-05,
      "loss": 1.6359,
      "num_input_tokens_seen": 20516494608,
      "step": 26077
    },
    {
      "epoch": 2.766603012942924,
      "grad_norm": 0.379216819137408,
      "learning_rate": 4.376001809699764e-05,
      "loss": 1.5642,
      "num_input_tokens_seen": 20517281456,
      "step": 26078
    },
    {
      "epoch": 2.766709102482495,
      "grad_norm": 0.39892785030500516,
      "learning_rate": 4.375955872705374e-05,
      "loss": 1.4261,
      "num_input_tokens_seen": 20518068304,
      "step": 26079
    },
    {
      "epoch": 2.7668151920220665,
      "grad_norm": 0.4265994621611363,
      "learning_rate": 4.3759099342613006e-05,
      "loss": 1.5872,
      "num_input_tokens_seen": 20518855072,
      "step": 26080
    },
    {
      "epoch": 2.766921281561638,
      "grad_norm": 0.43728793953224687,
      "learning_rate": 4.3758639943675786e-05,
      "loss": 1.6626,
      "num_input_tokens_seen": 20519641840,
      "step": 26081
    },
    {
      "epoch": 2.7670273711012094,
      "grad_norm": 0.44871674831759345,
      "learning_rate": 4.375818053024244e-05,
      "loss": 1.5485,
      "num_input_tokens_seen": 20520428576,
      "step": 26082
    },
    {
      "epoch": 2.767133460640781,
      "grad_norm": 0.5017381877762294,
      "learning_rate": 4.375772110231332e-05,
      "loss": 1.5662,
      "num_input_tokens_seen": 20521215344,
      "step": 26083
    },
    {
      "epoch": 2.767239550180352,
      "grad_norm": 0.4687485507715824,
      "learning_rate": 4.3757261659888785e-05,
      "loss": 1.685,
      "num_input_tokens_seen": 20522002048,
      "step": 26084
    },
    {
      "epoch": 2.767345639719924,
      "grad_norm": 0.38855143818754917,
      "learning_rate": 4.3756802202969185e-05,
      "loss": 1.5138,
      "num_input_tokens_seen": 20522788736,
      "step": 26085
    },
    {
      "epoch": 2.767451729259495,
      "grad_norm": 0.33989976823659307,
      "learning_rate": 4.375634273155489e-05,
      "loss": 1.5415,
      "num_input_tokens_seen": 20523575536,
      "step": 26086
    },
    {
      "epoch": 2.7675578187990664,
      "grad_norm": 0.38360528720936227,
      "learning_rate": 4.3755883245646235e-05,
      "loss": 1.5273,
      "num_input_tokens_seen": 20524362448,
      "step": 26087
    },
    {
      "epoch": 2.767663908338638,
      "grad_norm": 0.42413815489063417,
      "learning_rate": 4.375542374524358e-05,
      "loss": 1.6822,
      "num_input_tokens_seen": 20525149104,
      "step": 26088
    },
    {
      "epoch": 2.7677699978782093,
      "grad_norm": 0.4307223885068259,
      "learning_rate": 4.3754964230347295e-05,
      "loss": 1.5762,
      "num_input_tokens_seen": 20525935888,
      "step": 26089
    },
    {
      "epoch": 2.767876087417781,
      "grad_norm": 0.4186383982155501,
      "learning_rate": 4.375450470095772e-05,
      "loss": 1.7287,
      "num_input_tokens_seen": 20526722672,
      "step": 26090
    },
    {
      "epoch": 2.767982176957352,
      "grad_norm": 0.37961958954903,
      "learning_rate": 4.375404515707521e-05,
      "loss": 1.5918,
      "num_input_tokens_seen": 20527509536,
      "step": 26091
    },
    {
      "epoch": 2.7680882664969233,
      "grad_norm": 0.46612970240273227,
      "learning_rate": 4.3753585598700126e-05,
      "loss": 1.5395,
      "num_input_tokens_seen": 20528296288,
      "step": 26092
    },
    {
      "epoch": 2.7681943560364948,
      "grad_norm": 0.36091707198694634,
      "learning_rate": 4.375312602583282e-05,
      "loss": 1.6414,
      "num_input_tokens_seen": 20529083136,
      "step": 26093
    },
    {
      "epoch": 2.7683004455760662,
      "grad_norm": 0.3462315586527064,
      "learning_rate": 4.375266643847365e-05,
      "loss": 1.506,
      "num_input_tokens_seen": 20529869840,
      "step": 26094
    },
    {
      "epoch": 2.7684065351156377,
      "grad_norm": 0.3909866894692175,
      "learning_rate": 4.3752206836622974e-05,
      "loss": 1.6725,
      "num_input_tokens_seen": 20530656624,
      "step": 26095
    },
    {
      "epoch": 2.7685126246552088,
      "grad_norm": 0.3741805249311941,
      "learning_rate": 4.3751747220281135e-05,
      "loss": 1.6401,
      "num_input_tokens_seen": 20531443344,
      "step": 26096
    },
    {
      "epoch": 2.7686187141947802,
      "grad_norm": 0.3260300407233478,
      "learning_rate": 4.37512875894485e-05,
      "loss": 1.5062,
      "num_input_tokens_seen": 20532230064,
      "step": 26097
    },
    {
      "epoch": 2.7687248037343517,
      "grad_norm": 0.38911890907398994,
      "learning_rate": 4.3750827944125415e-05,
      "loss": 1.5751,
      "num_input_tokens_seen": 20533016848,
      "step": 26098
    },
    {
      "epoch": 2.768830893273923,
      "grad_norm": 0.3431738828966556,
      "learning_rate": 4.3750368284312246e-05,
      "loss": 1.553,
      "num_input_tokens_seen": 20533803568,
      "step": 26099
    },
    {
      "epoch": 2.7689369828134947,
      "grad_norm": 0.36826323309537096,
      "learning_rate": 4.374990861000935e-05,
      "loss": 1.5931,
      "num_input_tokens_seen": 20534590368,
      "step": 26100
    },
    {
      "epoch": 2.769043072353066,
      "grad_norm": 0.3326508350877258,
      "learning_rate": 4.3749448921217065e-05,
      "loss": 1.5199,
      "num_input_tokens_seen": 20535377200,
      "step": 26101
    },
    {
      "epoch": 2.7691491618926376,
      "grad_norm": 0.3474168087791797,
      "learning_rate": 4.374898921793576e-05,
      "loss": 1.4938,
      "num_input_tokens_seen": 20536163984,
      "step": 26102
    },
    {
      "epoch": 2.7692552514322086,
      "grad_norm": 0.38846524711354186,
      "learning_rate": 4.374852950016578e-05,
      "loss": 1.6761,
      "num_input_tokens_seen": 20536950784,
      "step": 26103
    },
    {
      "epoch": 2.76936134097178,
      "grad_norm": 0.40169055392590275,
      "learning_rate": 4.374806976790749e-05,
      "loss": 1.6229,
      "num_input_tokens_seen": 20537737600,
      "step": 26104
    },
    {
      "epoch": 2.7694674305113516,
      "grad_norm": 0.3407534054073343,
      "learning_rate": 4.3747610021161236e-05,
      "loss": 1.6194,
      "num_input_tokens_seen": 20538524384,
      "step": 26105
    },
    {
      "epoch": 2.769573520050923,
      "grad_norm": 0.3646529899765136,
      "learning_rate": 4.374715025992739e-05,
      "loss": 1.5222,
      "num_input_tokens_seen": 20539311072,
      "step": 26106
    },
    {
      "epoch": 2.7696796095904945,
      "grad_norm": 0.46821706740011154,
      "learning_rate": 4.374669048420629e-05,
      "loss": 1.6306,
      "num_input_tokens_seen": 20540097888,
      "step": 26107
    },
    {
      "epoch": 2.7697856991300656,
      "grad_norm": 0.4076515582669398,
      "learning_rate": 4.3746230693998305e-05,
      "loss": 1.5543,
      "num_input_tokens_seen": 20540884768,
      "step": 26108
    },
    {
      "epoch": 2.769891788669637,
      "grad_norm": 0.45784826012609836,
      "learning_rate": 4.374577088930377e-05,
      "loss": 1.4863,
      "num_input_tokens_seen": 20541671552,
      "step": 26109
    },
    {
      "epoch": 2.7699978782092085,
      "grad_norm": 0.367805521330365,
      "learning_rate": 4.3745311070123065e-05,
      "loss": 1.5685,
      "num_input_tokens_seen": 20542458352,
      "step": 26110
    },
    {
      "epoch": 2.77010396774878,
      "grad_norm": 0.4403792295156727,
      "learning_rate": 4.3744851236456526e-05,
      "loss": 1.6356,
      "num_input_tokens_seen": 20543245056,
      "step": 26111
    },
    {
      "epoch": 2.7702100572883515,
      "grad_norm": 0.38920071427972314,
      "learning_rate": 4.374439138830452e-05,
      "loss": 1.7142,
      "num_input_tokens_seen": 20544031792,
      "step": 26112
    },
    {
      "epoch": 2.770316146827923,
      "grad_norm": 0.46864514373177607,
      "learning_rate": 4.37439315256674e-05,
      "loss": 1.4532,
      "num_input_tokens_seen": 20544818640,
      "step": 26113
    },
    {
      "epoch": 2.7704222363674944,
      "grad_norm": 0.4235294926504588,
      "learning_rate": 4.3743471648545514e-05,
      "loss": 1.542,
      "num_input_tokens_seen": 20545605536,
      "step": 26114
    },
    {
      "epoch": 2.7705283259070654,
      "grad_norm": 0.4720050732867132,
      "learning_rate": 4.3743011756939224e-05,
      "loss": 1.5248,
      "num_input_tokens_seen": 20546392272,
      "step": 26115
    },
    {
      "epoch": 2.770634415446637,
      "grad_norm": 0.4610391869829183,
      "learning_rate": 4.374255185084889e-05,
      "loss": 1.6307,
      "num_input_tokens_seen": 20547178912,
      "step": 26116
    },
    {
      "epoch": 2.7707405049862084,
      "grad_norm": 0.5207502580666257,
      "learning_rate": 4.374209193027485e-05,
      "loss": 1.5975,
      "num_input_tokens_seen": 20547965712,
      "step": 26117
    },
    {
      "epoch": 2.77084659452578,
      "grad_norm": 0.4470749378882362,
      "learning_rate": 4.3741631995217485e-05,
      "loss": 1.5389,
      "num_input_tokens_seen": 20548752512,
      "step": 26118
    },
    {
      "epoch": 2.7709526840653513,
      "grad_norm": 0.4074967488113659,
      "learning_rate": 4.374117204567714e-05,
      "loss": 1.6952,
      "num_input_tokens_seen": 20549539280,
      "step": 26119
    },
    {
      "epoch": 2.7710587736049224,
      "grad_norm": 0.5492767400775406,
      "learning_rate": 4.374071208165415e-05,
      "loss": 1.6583,
      "num_input_tokens_seen": 20550325968,
      "step": 26120
    },
    {
      "epoch": 2.771164863144494,
      "grad_norm": 0.36275181329658557,
      "learning_rate": 4.3740252103148895e-05,
      "loss": 1.5047,
      "num_input_tokens_seen": 20551112880,
      "step": 26121
    },
    {
      "epoch": 2.7712709526840653,
      "grad_norm": 0.5288649520292962,
      "learning_rate": 4.3739792110161726e-05,
      "loss": 1.504,
      "num_input_tokens_seen": 20551899664,
      "step": 26122
    },
    {
      "epoch": 2.771377042223637,
      "grad_norm": 0.3883403708171798,
      "learning_rate": 4.3739332102693e-05,
      "loss": 1.4652,
      "num_input_tokens_seen": 20552686432,
      "step": 26123
    },
    {
      "epoch": 2.7714831317632083,
      "grad_norm": 0.4096992846568948,
      "learning_rate": 4.3738872080743056e-05,
      "loss": 1.6669,
      "num_input_tokens_seen": 20553473168,
      "step": 26124
    },
    {
      "epoch": 2.7715892213027793,
      "grad_norm": 0.5915107646890438,
      "learning_rate": 4.373841204431227e-05,
      "loss": 1.6329,
      "num_input_tokens_seen": 20554259952,
      "step": 26125
    },
    {
      "epoch": 2.771695310842351,
      "grad_norm": 0.39591877066086845,
      "learning_rate": 4.3737951993400986e-05,
      "loss": 1.5256,
      "num_input_tokens_seen": 20555046816,
      "step": 26126
    },
    {
      "epoch": 2.7718014003819222,
      "grad_norm": 0.5582527988130458,
      "learning_rate": 4.373749192800956e-05,
      "loss": 1.618,
      "num_input_tokens_seen": 20555833520,
      "step": 26127
    },
    {
      "epoch": 2.7719074899214937,
      "grad_norm": 0.548362167210883,
      "learning_rate": 4.3737031848138355e-05,
      "loss": 1.5621,
      "num_input_tokens_seen": 20556620288,
      "step": 26128
    },
    {
      "epoch": 2.772013579461065,
      "grad_norm": 0.4136233278923509,
      "learning_rate": 4.3736571753787716e-05,
      "loss": 1.6565,
      "num_input_tokens_seen": 20557406976,
      "step": 26129
    },
    {
      "epoch": 2.7721196690006367,
      "grad_norm": 0.5931815600336616,
      "learning_rate": 4.373611164495801e-05,
      "loss": 1.5736,
      "num_input_tokens_seen": 20558193728,
      "step": 26130
    },
    {
      "epoch": 2.772225758540208,
      "grad_norm": 0.45522323596234954,
      "learning_rate": 4.373565152164958e-05,
      "loss": 1.6218,
      "num_input_tokens_seen": 20558980480,
      "step": 26131
    },
    {
      "epoch": 2.772331848079779,
      "grad_norm": 0.532479483563352,
      "learning_rate": 4.373519138386279e-05,
      "loss": 1.5332,
      "num_input_tokens_seen": 20559767328,
      "step": 26132
    },
    {
      "epoch": 2.7724379376193506,
      "grad_norm": 0.5559490701886474,
      "learning_rate": 4.3734731231598e-05,
      "loss": 1.7038,
      "num_input_tokens_seen": 20560554016,
      "step": 26133
    },
    {
      "epoch": 2.772544027158922,
      "grad_norm": 0.40364399362675424,
      "learning_rate": 4.373427106485556e-05,
      "loss": 1.6232,
      "num_input_tokens_seen": 20561340848,
      "step": 26134
    },
    {
      "epoch": 2.7726501166984936,
      "grad_norm": 0.5791213943241127,
      "learning_rate": 4.3733810883635814e-05,
      "loss": 1.6196,
      "num_input_tokens_seen": 20562127600,
      "step": 26135
    },
    {
      "epoch": 2.772756206238065,
      "grad_norm": 0.35999888344418246,
      "learning_rate": 4.373335068793913e-05,
      "loss": 1.6038,
      "num_input_tokens_seen": 20562914304,
      "step": 26136
    },
    {
      "epoch": 2.772862295777636,
      "grad_norm": 0.4279556204285353,
      "learning_rate": 4.373289047776587e-05,
      "loss": 1.6406,
      "num_input_tokens_seen": 20563700992,
      "step": 26137
    },
    {
      "epoch": 2.7729683853172076,
      "grad_norm": 0.4306469103358891,
      "learning_rate": 4.3732430253116386e-05,
      "loss": 1.5903,
      "num_input_tokens_seen": 20564487744,
      "step": 26138
    },
    {
      "epoch": 2.773074474856779,
      "grad_norm": 0.38945554110868297,
      "learning_rate": 4.373197001399102e-05,
      "loss": 1.5082,
      "num_input_tokens_seen": 20565274592,
      "step": 26139
    },
    {
      "epoch": 2.7731805643963505,
      "grad_norm": 0.43357539541215534,
      "learning_rate": 4.373150976039014e-05,
      "loss": 1.5872,
      "num_input_tokens_seen": 20566061312,
      "step": 26140
    },
    {
      "epoch": 2.773286653935922,
      "grad_norm": 0.3741483050830849,
      "learning_rate": 4.37310494923141e-05,
      "loss": 1.5486,
      "num_input_tokens_seen": 20566848048,
      "step": 26141
    },
    {
      "epoch": 2.7733927434754935,
      "grad_norm": 0.36994805370983025,
      "learning_rate": 4.373058920976325e-05,
      "loss": 1.4904,
      "num_input_tokens_seen": 20567634800,
      "step": 26142
    },
    {
      "epoch": 2.773498833015065,
      "grad_norm": 0.4022637536949321,
      "learning_rate": 4.373012891273796e-05,
      "loss": 1.5821,
      "num_input_tokens_seen": 20568421600,
      "step": 26143
    },
    {
      "epoch": 2.773604922554636,
      "grad_norm": 0.3335500214200828,
      "learning_rate": 4.372966860123856e-05,
      "loss": 1.4945,
      "num_input_tokens_seen": 20569208416,
      "step": 26144
    },
    {
      "epoch": 2.7737110120942075,
      "grad_norm": 0.40139951952693614,
      "learning_rate": 4.372920827526544e-05,
      "loss": 1.6407,
      "num_input_tokens_seen": 20569995200,
      "step": 26145
    },
    {
      "epoch": 2.773817101633779,
      "grad_norm": 0.481729087260284,
      "learning_rate": 4.372874793481892e-05,
      "loss": 1.6943,
      "num_input_tokens_seen": 20570782016,
      "step": 26146
    },
    {
      "epoch": 2.7739231911733504,
      "grad_norm": 0.36662640490981546,
      "learning_rate": 4.3728287579899387e-05,
      "loss": 1.5219,
      "num_input_tokens_seen": 20571568816,
      "step": 26147
    },
    {
      "epoch": 2.774029280712922,
      "grad_norm": 0.6103422727505786,
      "learning_rate": 4.3727827210507175e-05,
      "loss": 1.5455,
      "num_input_tokens_seen": 20572355632,
      "step": 26148
    },
    {
      "epoch": 2.774135370252493,
      "grad_norm": 0.4098181477370507,
      "learning_rate": 4.372736682664266e-05,
      "loss": 1.6448,
      "num_input_tokens_seen": 20573142528,
      "step": 26149
    },
    {
      "epoch": 2.7742414597920644,
      "grad_norm": 0.4681621151855056,
      "learning_rate": 4.3726906428306167e-05,
      "loss": 1.6813,
      "num_input_tokens_seen": 20573929216,
      "step": 26150
    },
    {
      "epoch": 2.774347549331636,
      "grad_norm": 0.37440694246241296,
      "learning_rate": 4.372644601549808e-05,
      "loss": 1.65,
      "num_input_tokens_seen": 20574715952,
      "step": 26151
    },
    {
      "epoch": 2.7744536388712073,
      "grad_norm": 0.3948833629590034,
      "learning_rate": 4.372598558821875e-05,
      "loss": 1.6029,
      "num_input_tokens_seen": 20575502752,
      "step": 26152
    },
    {
      "epoch": 2.774559728410779,
      "grad_norm": 0.40847524066501584,
      "learning_rate": 4.372552514646852e-05,
      "loss": 1.6468,
      "num_input_tokens_seen": 20576289632,
      "step": 26153
    },
    {
      "epoch": 2.77466581795035,
      "grad_norm": 0.38165787584363303,
      "learning_rate": 4.372506469024775e-05,
      "loss": 1.5266,
      "num_input_tokens_seen": 20577076448,
      "step": 26154
    },
    {
      "epoch": 2.7747719074899218,
      "grad_norm": 0.4535114731046356,
      "learning_rate": 4.372460421955681e-05,
      "loss": 1.5173,
      "num_input_tokens_seen": 20577863200,
      "step": 26155
    },
    {
      "epoch": 2.774877997029493,
      "grad_norm": 0.40780769969015845,
      "learning_rate": 4.372414373439604e-05,
      "loss": 1.6108,
      "num_input_tokens_seen": 20578649936,
      "step": 26156
    },
    {
      "epoch": 2.7749840865690643,
      "grad_norm": 0.3825828979317906,
      "learning_rate": 4.37236832347658e-05,
      "loss": 1.6124,
      "num_input_tokens_seen": 20579436640,
      "step": 26157
    },
    {
      "epoch": 2.7750901761086357,
      "grad_norm": 0.5268504920833907,
      "learning_rate": 4.372322272066645e-05,
      "loss": 1.5805,
      "num_input_tokens_seen": 20580223360,
      "step": 26158
    },
    {
      "epoch": 2.775196265648207,
      "grad_norm": 0.40875090128350955,
      "learning_rate": 4.3722762192098335e-05,
      "loss": 1.697,
      "num_input_tokens_seen": 20581010112,
      "step": 26159
    },
    {
      "epoch": 2.7753023551877787,
      "grad_norm": 0.4046488275033379,
      "learning_rate": 4.372230164906183e-05,
      "loss": 1.4808,
      "num_input_tokens_seen": 20581796912,
      "step": 26160
    },
    {
      "epoch": 2.7754084447273497,
      "grad_norm": 0.42689926753933294,
      "learning_rate": 4.372184109155727e-05,
      "loss": 1.5885,
      "num_input_tokens_seen": 20582583664,
      "step": 26161
    },
    {
      "epoch": 2.775514534266921,
      "grad_norm": 0.36033163025267284,
      "learning_rate": 4.372138051958503e-05,
      "loss": 1.5176,
      "num_input_tokens_seen": 20583370480,
      "step": 26162
    },
    {
      "epoch": 2.7756206238064927,
      "grad_norm": 0.3962249343314285,
      "learning_rate": 4.372091993314545e-05,
      "loss": 1.4878,
      "num_input_tokens_seen": 20584157344,
      "step": 26163
    },
    {
      "epoch": 2.775726713346064,
      "grad_norm": 0.42137348262819263,
      "learning_rate": 4.372045933223889e-05,
      "loss": 1.6583,
      "num_input_tokens_seen": 20584944016,
      "step": 26164
    },
    {
      "epoch": 2.7758328028856356,
      "grad_norm": 0.4291787451656257,
      "learning_rate": 4.371999871686572e-05,
      "loss": 1.6258,
      "num_input_tokens_seen": 20585730800,
      "step": 26165
    },
    {
      "epoch": 2.7759388924252066,
      "grad_norm": 0.4396778932490755,
      "learning_rate": 4.371953808702627e-05,
      "loss": 1.6727,
      "num_input_tokens_seen": 20586517472,
      "step": 26166
    },
    {
      "epoch": 2.776044981964778,
      "grad_norm": 0.3684280594138664,
      "learning_rate": 4.3719077442720916e-05,
      "loss": 1.5563,
      "num_input_tokens_seen": 20587304256,
      "step": 26167
    },
    {
      "epoch": 2.7761510715043496,
      "grad_norm": 0.4319761215146057,
      "learning_rate": 4.3718616783950015e-05,
      "loss": 1.5541,
      "num_input_tokens_seen": 20588091184,
      "step": 26168
    },
    {
      "epoch": 2.776257161043921,
      "grad_norm": 0.38932621669728035,
      "learning_rate": 4.3718156110713905e-05,
      "loss": 1.6582,
      "num_input_tokens_seen": 20588877904,
      "step": 26169
    },
    {
      "epoch": 2.7763632505834925,
      "grad_norm": 0.3912890828857641,
      "learning_rate": 4.371769542301296e-05,
      "loss": 1.4842,
      "num_input_tokens_seen": 20589664672,
      "step": 26170
    },
    {
      "epoch": 2.776469340123064,
      "grad_norm": 0.4818490760811859,
      "learning_rate": 4.3717234720847524e-05,
      "loss": 1.6767,
      "num_input_tokens_seen": 20590451344,
      "step": 26171
    },
    {
      "epoch": 2.7765754296626355,
      "grad_norm": 0.458162707041793,
      "learning_rate": 4.371677400421796e-05,
      "loss": 1.6749,
      "num_input_tokens_seen": 20591238080,
      "step": 26172
    },
    {
      "epoch": 2.7766815192022065,
      "grad_norm": 0.43492839536853134,
      "learning_rate": 4.371631327312463e-05,
      "loss": 1.6846,
      "num_input_tokens_seen": 20592024880,
      "step": 26173
    },
    {
      "epoch": 2.776787608741778,
      "grad_norm": 0.3993313278869608,
      "learning_rate": 4.371585252756787e-05,
      "loss": 1.5083,
      "num_input_tokens_seen": 20592811488,
      "step": 26174
    },
    {
      "epoch": 2.7768936982813495,
      "grad_norm": 0.3911053769127495,
      "learning_rate": 4.371539176754806e-05,
      "loss": 1.5834,
      "num_input_tokens_seen": 20593598272,
      "step": 26175
    },
    {
      "epoch": 2.776999787820921,
      "grad_norm": 0.40037730465454435,
      "learning_rate": 4.371493099306554e-05,
      "loss": 1.5302,
      "num_input_tokens_seen": 20594385072,
      "step": 26176
    },
    {
      "epoch": 2.7771058773604924,
      "grad_norm": 0.379403480817627,
      "learning_rate": 4.3714470204120664e-05,
      "loss": 1.6672,
      "num_input_tokens_seen": 20595171808,
      "step": 26177
    },
    {
      "epoch": 2.7772119669000634,
      "grad_norm": 0.4439871702626683,
      "learning_rate": 4.3714009400713804e-05,
      "loss": 1.605,
      "num_input_tokens_seen": 20595958624,
      "step": 26178
    },
    {
      "epoch": 2.777318056439635,
      "grad_norm": 0.4212380054191703,
      "learning_rate": 4.37135485828453e-05,
      "loss": 1.6315,
      "num_input_tokens_seen": 20596745376,
      "step": 26179
    },
    {
      "epoch": 2.7774241459792064,
      "grad_norm": 0.39511477341732293,
      "learning_rate": 4.371308775051551e-05,
      "loss": 1.6653,
      "num_input_tokens_seen": 20597532256,
      "step": 26180
    },
    {
      "epoch": 2.777530235518778,
      "grad_norm": 0.40985551478662596,
      "learning_rate": 4.3712626903724805e-05,
      "loss": 1.6682,
      "num_input_tokens_seen": 20598319056,
      "step": 26181
    },
    {
      "epoch": 2.7776363250583493,
      "grad_norm": 0.40221491364153666,
      "learning_rate": 4.371216604247354e-05,
      "loss": 1.5831,
      "num_input_tokens_seen": 20599105792,
      "step": 26182
    },
    {
      "epoch": 2.7777424145979204,
      "grad_norm": 0.4676006377869069,
      "learning_rate": 4.371170516676204e-05,
      "loss": 1.6046,
      "num_input_tokens_seen": 20599892480,
      "step": 26183
    },
    {
      "epoch": 2.7778485041374923,
      "grad_norm": 0.43825554240456976,
      "learning_rate": 4.371124427659069e-05,
      "loss": 1.4604,
      "num_input_tokens_seen": 20600679216,
      "step": 26184
    },
    {
      "epoch": 2.7779545936770633,
      "grad_norm": 0.4350771710827383,
      "learning_rate": 4.371078337195985e-05,
      "loss": 1.5644,
      "num_input_tokens_seen": 20601466000,
      "step": 26185
    },
    {
      "epoch": 2.778060683216635,
      "grad_norm": 0.42939635425042294,
      "learning_rate": 4.371032245286986e-05,
      "loss": 1.6188,
      "num_input_tokens_seen": 20602252768,
      "step": 26186
    },
    {
      "epoch": 2.7781667727562063,
      "grad_norm": 0.4145726167888766,
      "learning_rate": 4.370986151932108e-05,
      "loss": 1.6424,
      "num_input_tokens_seen": 20603039536,
      "step": 26187
    },
    {
      "epoch": 2.7782728622957777,
      "grad_norm": 0.43090626982319746,
      "learning_rate": 4.370940057131386e-05,
      "loss": 1.6436,
      "num_input_tokens_seen": 20603826320,
      "step": 26188
    },
    {
      "epoch": 2.778378951835349,
      "grad_norm": 0.4013212490333633,
      "learning_rate": 4.3708939608848574e-05,
      "loss": 1.5902,
      "num_input_tokens_seen": 20604613168,
      "step": 26189
    },
    {
      "epoch": 2.7784850413749203,
      "grad_norm": 0.44121651543803436,
      "learning_rate": 4.370847863192557e-05,
      "loss": 1.7156,
      "num_input_tokens_seen": 20605400000,
      "step": 26190
    },
    {
      "epoch": 2.7785911309144917,
      "grad_norm": 0.4810191903442694,
      "learning_rate": 4.3708017640545196e-05,
      "loss": 1.6063,
      "num_input_tokens_seen": 20606186752,
      "step": 26191
    },
    {
      "epoch": 2.778697220454063,
      "grad_norm": 0.49319746689744354,
      "learning_rate": 4.370755663470782e-05,
      "loss": 1.663,
      "num_input_tokens_seen": 20606973568,
      "step": 26192
    },
    {
      "epoch": 2.7788033099936347,
      "grad_norm": 0.3985356364788169,
      "learning_rate": 4.370709561441379e-05,
      "loss": 1.4417,
      "num_input_tokens_seen": 20607760272,
      "step": 26193
    },
    {
      "epoch": 2.778909399533206,
      "grad_norm": 0.45183920075192535,
      "learning_rate": 4.370663457966347e-05,
      "loss": 1.6151,
      "num_input_tokens_seen": 20608547040,
      "step": 26194
    },
    {
      "epoch": 2.779015489072777,
      "grad_norm": 0.4460641566328977,
      "learning_rate": 4.3706173530457214e-05,
      "loss": 1.4813,
      "num_input_tokens_seen": 20609333888,
      "step": 26195
    },
    {
      "epoch": 2.779121578612349,
      "grad_norm": 0.5215770327598106,
      "learning_rate": 4.370571246679537e-05,
      "loss": 1.5418,
      "num_input_tokens_seen": 20610120576,
      "step": 26196
    },
    {
      "epoch": 2.77922766815192,
      "grad_norm": 0.509698839177419,
      "learning_rate": 4.3705251388678296e-05,
      "loss": 1.538,
      "num_input_tokens_seen": 20610907312,
      "step": 26197
    },
    {
      "epoch": 2.7793337576914916,
      "grad_norm": 0.46704072469263636,
      "learning_rate": 4.3704790296106355e-05,
      "loss": 1.5041,
      "num_input_tokens_seen": 20611694160,
      "step": 26198
    },
    {
      "epoch": 2.779439847231063,
      "grad_norm": 0.44956760007770175,
      "learning_rate": 4.3704329189079906e-05,
      "loss": 1.536,
      "num_input_tokens_seen": 20612480976,
      "step": 26199
    },
    {
      "epoch": 2.7795459367706346,
      "grad_norm": 0.4363127202005616,
      "learning_rate": 4.370386806759929e-05,
      "loss": 1.5897,
      "num_input_tokens_seen": 20613267728,
      "step": 26200
    },
    {
      "epoch": 2.779652026310206,
      "grad_norm": 0.48795067182083884,
      "learning_rate": 4.370340693166489e-05,
      "loss": 1.5232,
      "num_input_tokens_seen": 20614054480,
      "step": 26201
    },
    {
      "epoch": 2.779758115849777,
      "grad_norm": 0.4358483393934466,
      "learning_rate": 4.3702945781277035e-05,
      "loss": 1.7245,
      "num_input_tokens_seen": 20614841152,
      "step": 26202
    },
    {
      "epoch": 2.7798642053893485,
      "grad_norm": 0.3775670798255622,
      "learning_rate": 4.3702484616436095e-05,
      "loss": 1.52,
      "num_input_tokens_seen": 20615627904,
      "step": 26203
    },
    {
      "epoch": 2.77997029492892,
      "grad_norm": 0.37908391359637605,
      "learning_rate": 4.370202343714243e-05,
      "loss": 1.4538,
      "num_input_tokens_seen": 20616414688,
      "step": 26204
    },
    {
      "epoch": 2.7800763844684915,
      "grad_norm": 0.44412268171441466,
      "learning_rate": 4.370156224339638e-05,
      "loss": 1.6195,
      "num_input_tokens_seen": 20617201424,
      "step": 26205
    },
    {
      "epoch": 2.780182474008063,
      "grad_norm": 0.4673383976557543,
      "learning_rate": 4.370110103519831e-05,
      "loss": 1.5743,
      "num_input_tokens_seen": 20617988128,
      "step": 26206
    },
    {
      "epoch": 2.780288563547634,
      "grad_norm": 0.39334866036616517,
      "learning_rate": 4.370063981254858e-05,
      "loss": 1.6418,
      "num_input_tokens_seen": 20618774864,
      "step": 26207
    },
    {
      "epoch": 2.7803946530872055,
      "grad_norm": 0.3506984532267383,
      "learning_rate": 4.3700178575447545e-05,
      "loss": 1.4849,
      "num_input_tokens_seen": 20619561616,
      "step": 26208
    },
    {
      "epoch": 2.780500742626777,
      "grad_norm": 0.41107705044387244,
      "learning_rate": 4.3699717323895564e-05,
      "loss": 1.5095,
      "num_input_tokens_seen": 20620348288,
      "step": 26209
    },
    {
      "epoch": 2.7806068321663484,
      "grad_norm": 0.3761979550937728,
      "learning_rate": 4.369925605789299e-05,
      "loss": 1.4871,
      "num_input_tokens_seen": 20621135072,
      "step": 26210
    },
    {
      "epoch": 2.78071292170592,
      "grad_norm": 0.39350903232384193,
      "learning_rate": 4.369879477744018e-05,
      "loss": 1.5262,
      "num_input_tokens_seen": 20621921824,
      "step": 26211
    },
    {
      "epoch": 2.7808190112454914,
      "grad_norm": 0.37377917616251116,
      "learning_rate": 4.369833348253749e-05,
      "loss": 1.6201,
      "num_input_tokens_seen": 20622708496,
      "step": 26212
    },
    {
      "epoch": 2.780925100785063,
      "grad_norm": 0.4343593937576458,
      "learning_rate": 4.3697872173185275e-05,
      "loss": 1.702,
      "num_input_tokens_seen": 20623495168,
      "step": 26213
    },
    {
      "epoch": 2.781031190324634,
      "grad_norm": 0.3533242206695463,
      "learning_rate": 4.369741084938389e-05,
      "loss": 1.6488,
      "num_input_tokens_seen": 20624281840,
      "step": 26214
    },
    {
      "epoch": 2.7811372798642053,
      "grad_norm": 0.4182824415745179,
      "learning_rate": 4.36969495111337e-05,
      "loss": 1.6938,
      "num_input_tokens_seen": 20625068560,
      "step": 26215
    },
    {
      "epoch": 2.781243369403777,
      "grad_norm": 0.37629699038958425,
      "learning_rate": 4.369648815843505e-05,
      "loss": 1.4985,
      "num_input_tokens_seen": 20625855280,
      "step": 26216
    },
    {
      "epoch": 2.7813494589433483,
      "grad_norm": 0.3509505891929237,
      "learning_rate": 4.36960267912883e-05,
      "loss": 1.613,
      "num_input_tokens_seen": 20626642000,
      "step": 26217
    },
    {
      "epoch": 2.7814555484829198,
      "grad_norm": 0.39599886927651773,
      "learning_rate": 4.3695565409693824e-05,
      "loss": 1.6026,
      "num_input_tokens_seen": 20627428768,
      "step": 26218
    },
    {
      "epoch": 2.781561638022491,
      "grad_norm": 0.3740122716758062,
      "learning_rate": 4.3695104013651954e-05,
      "loss": 1.5462,
      "num_input_tokens_seen": 20628215456,
      "step": 26219
    },
    {
      "epoch": 2.7816677275620623,
      "grad_norm": 0.38047894016358524,
      "learning_rate": 4.369464260316305e-05,
      "loss": 1.6255,
      "num_input_tokens_seen": 20629002256,
      "step": 26220
    },
    {
      "epoch": 2.7817738171016337,
      "grad_norm": 0.40768083063916044,
      "learning_rate": 4.369418117822748e-05,
      "loss": 1.6007,
      "num_input_tokens_seen": 20629788912,
      "step": 26221
    },
    {
      "epoch": 2.781879906641205,
      "grad_norm": 0.3898229828372702,
      "learning_rate": 4.36937197388456e-05,
      "loss": 1.555,
      "num_input_tokens_seen": 20630575728,
      "step": 26222
    },
    {
      "epoch": 2.7819859961807767,
      "grad_norm": 0.36972213693951667,
      "learning_rate": 4.369325828501776e-05,
      "loss": 1.5284,
      "num_input_tokens_seen": 20631362464,
      "step": 26223
    },
    {
      "epoch": 2.7820920857203477,
      "grad_norm": 0.3841507430727347,
      "learning_rate": 4.369279681674432e-05,
      "loss": 1.6927,
      "num_input_tokens_seen": 20632149216,
      "step": 26224
    },
    {
      "epoch": 2.7821981752599196,
      "grad_norm": 0.4508245369915538,
      "learning_rate": 4.369233533402563e-05,
      "loss": 1.638,
      "num_input_tokens_seen": 20632935952,
      "step": 26225
    },
    {
      "epoch": 2.7823042647994907,
      "grad_norm": 0.35571333287059087,
      "learning_rate": 4.3691873836862054e-05,
      "loss": 1.7005,
      "num_input_tokens_seen": 20633722640,
      "step": 26226
    },
    {
      "epoch": 2.782410354339062,
      "grad_norm": 0.4122312246937825,
      "learning_rate": 4.369141232525394e-05,
      "loss": 1.5894,
      "num_input_tokens_seen": 20634509456,
      "step": 26227
    },
    {
      "epoch": 2.7825164438786336,
      "grad_norm": 0.34427868995060845,
      "learning_rate": 4.3690950799201656e-05,
      "loss": 1.6283,
      "num_input_tokens_seen": 20635296096,
      "step": 26228
    },
    {
      "epoch": 2.782622533418205,
      "grad_norm": 0.3687287711425218,
      "learning_rate": 4.369048925870556e-05,
      "loss": 1.602,
      "num_input_tokens_seen": 20636082928,
      "step": 26229
    },
    {
      "epoch": 2.7827286229577766,
      "grad_norm": 0.43088907815812716,
      "learning_rate": 4.3690027703765995e-05,
      "loss": 1.7551,
      "num_input_tokens_seen": 20636869616,
      "step": 26230
    },
    {
      "epoch": 2.7828347124973476,
      "grad_norm": 0.3610277164884399,
      "learning_rate": 4.368956613438333e-05,
      "loss": 1.7098,
      "num_input_tokens_seen": 20637656256,
      "step": 26231
    },
    {
      "epoch": 2.782940802036919,
      "grad_norm": 0.4306746800807827,
      "learning_rate": 4.3689104550557917e-05,
      "loss": 1.6641,
      "num_input_tokens_seen": 20638443040,
      "step": 26232
    },
    {
      "epoch": 2.7830468915764905,
      "grad_norm": 0.3396690051664621,
      "learning_rate": 4.36886429522901e-05,
      "loss": 1.5963,
      "num_input_tokens_seen": 20639229744,
      "step": 26233
    },
    {
      "epoch": 2.783152981116062,
      "grad_norm": 0.4753464029508736,
      "learning_rate": 4.368818133958026e-05,
      "loss": 1.6608,
      "num_input_tokens_seen": 20640016576,
      "step": 26234
    },
    {
      "epoch": 2.7832590706556335,
      "grad_norm": 0.36246308804997407,
      "learning_rate": 4.368771971242874e-05,
      "loss": 1.4512,
      "num_input_tokens_seen": 20640803360,
      "step": 26235
    },
    {
      "epoch": 2.7833651601952045,
      "grad_norm": 0.4898589472550727,
      "learning_rate": 4.3687258070835904e-05,
      "loss": 1.6647,
      "num_input_tokens_seen": 20641590096,
      "step": 26236
    },
    {
      "epoch": 2.783471249734776,
      "grad_norm": 0.4130844916415503,
      "learning_rate": 4.368679641480209e-05,
      "loss": 1.654,
      "num_input_tokens_seen": 20642376848,
      "step": 26237
    },
    {
      "epoch": 2.7835773392743475,
      "grad_norm": 0.4260677461736671,
      "learning_rate": 4.368633474432767e-05,
      "loss": 1.6253,
      "num_input_tokens_seen": 20643163584,
      "step": 26238
    },
    {
      "epoch": 2.783683428813919,
      "grad_norm": 0.39491276715967627,
      "learning_rate": 4.3685873059413006e-05,
      "loss": 1.5456,
      "num_input_tokens_seen": 20643950448,
      "step": 26239
    },
    {
      "epoch": 2.7837895183534904,
      "grad_norm": 0.429526249174613,
      "learning_rate": 4.368541136005845e-05,
      "loss": 1.6402,
      "num_input_tokens_seen": 20644737264,
      "step": 26240
    },
    {
      "epoch": 2.783895607893062,
      "grad_norm": 0.40949117441541805,
      "learning_rate": 4.368494964626435e-05,
      "loss": 1.6656,
      "num_input_tokens_seen": 20645523968,
      "step": 26241
    },
    {
      "epoch": 2.7840016974326334,
      "grad_norm": 0.41395216657546685,
      "learning_rate": 4.368448791803107e-05,
      "loss": 1.712,
      "num_input_tokens_seen": 20646310736,
      "step": 26242
    },
    {
      "epoch": 2.7841077869722044,
      "grad_norm": 0.4337212773697636,
      "learning_rate": 4.368402617535897e-05,
      "loss": 1.7126,
      "num_input_tokens_seen": 20647097408,
      "step": 26243
    },
    {
      "epoch": 2.784213876511776,
      "grad_norm": 0.33660861216798854,
      "learning_rate": 4.3683564418248394e-05,
      "loss": 1.5088,
      "num_input_tokens_seen": 20647884160,
      "step": 26244
    },
    {
      "epoch": 2.7843199660513474,
      "grad_norm": 0.42276806441770665,
      "learning_rate": 4.3683102646699715e-05,
      "loss": 1.6458,
      "num_input_tokens_seen": 20648670880,
      "step": 26245
    },
    {
      "epoch": 2.784426055590919,
      "grad_norm": 0.36865438177694543,
      "learning_rate": 4.3682640860713285e-05,
      "loss": 1.6951,
      "num_input_tokens_seen": 20649457600,
      "step": 26246
    },
    {
      "epoch": 2.7845321451304903,
      "grad_norm": 0.37399852607049516,
      "learning_rate": 4.368217906028945e-05,
      "loss": 1.5713,
      "num_input_tokens_seen": 20650244368,
      "step": 26247
    },
    {
      "epoch": 2.7846382346700613,
      "grad_norm": 0.33690768871388826,
      "learning_rate": 4.3681717245428574e-05,
      "loss": 1.524,
      "num_input_tokens_seen": 20651031104,
      "step": 26248
    },
    {
      "epoch": 2.784744324209633,
      "grad_norm": 0.3480444929221301,
      "learning_rate": 4.3681255416131026e-05,
      "loss": 1.4729,
      "num_input_tokens_seen": 20651817936,
      "step": 26249
    },
    {
      "epoch": 2.7848504137492043,
      "grad_norm": 0.4252360605179985,
      "learning_rate": 4.368079357239714e-05,
      "loss": 1.6091,
      "num_input_tokens_seen": 20652604704,
      "step": 26250
    },
    {
      "epoch": 2.7849565032887758,
      "grad_norm": 0.3840456777557006,
      "learning_rate": 4.3680331714227296e-05,
      "loss": 1.5002,
      "num_input_tokens_seen": 20653391504,
      "step": 26251
    },
    {
      "epoch": 2.7850625928283472,
      "grad_norm": 0.3585921196473421,
      "learning_rate": 4.367986984162183e-05,
      "loss": 1.4713,
      "num_input_tokens_seen": 20654178352,
      "step": 26252
    },
    {
      "epoch": 2.7851686823679183,
      "grad_norm": 0.4320279879386476,
      "learning_rate": 4.367940795458112e-05,
      "loss": 1.6902,
      "num_input_tokens_seen": 20654965120,
      "step": 26253
    },
    {
      "epoch": 2.78527477190749,
      "grad_norm": 0.36421555350920665,
      "learning_rate": 4.367894605310551e-05,
      "loss": 1.7208,
      "num_input_tokens_seen": 20655751872,
      "step": 26254
    },
    {
      "epoch": 2.785380861447061,
      "grad_norm": 0.37530981034032934,
      "learning_rate": 4.3678484137195344e-05,
      "loss": 1.6543,
      "num_input_tokens_seen": 20656538560,
      "step": 26255
    },
    {
      "epoch": 2.7854869509866327,
      "grad_norm": 0.37213375981695357,
      "learning_rate": 4.3678022206851014e-05,
      "loss": 1.4463,
      "num_input_tokens_seen": 20657325264,
      "step": 26256
    },
    {
      "epoch": 2.785593040526204,
      "grad_norm": 0.338211035236274,
      "learning_rate": 4.3677560262072835e-05,
      "loss": 1.5902,
      "num_input_tokens_seen": 20658112016,
      "step": 26257
    },
    {
      "epoch": 2.7856991300657756,
      "grad_norm": 0.3946838767004774,
      "learning_rate": 4.3677098302861194e-05,
      "loss": 1.6637,
      "num_input_tokens_seen": 20658898864,
      "step": 26258
    },
    {
      "epoch": 2.785805219605347,
      "grad_norm": 0.40507927644287955,
      "learning_rate": 4.3676636329216444e-05,
      "loss": 1.5907,
      "num_input_tokens_seen": 20659685600,
      "step": 26259
    },
    {
      "epoch": 2.785911309144918,
      "grad_norm": 0.3666981926563251,
      "learning_rate": 4.367617434113894e-05,
      "loss": 1.6021,
      "num_input_tokens_seen": 20660472448,
      "step": 26260
    },
    {
      "epoch": 2.7860173986844896,
      "grad_norm": 0.40205472354639377,
      "learning_rate": 4.3675712338629026e-05,
      "loss": 1.5313,
      "num_input_tokens_seen": 20661259312,
      "step": 26261
    },
    {
      "epoch": 2.786123488224061,
      "grad_norm": 0.4116157592945112,
      "learning_rate": 4.3675250321687076e-05,
      "loss": 1.4895,
      "num_input_tokens_seen": 20662046016,
      "step": 26262
    },
    {
      "epoch": 2.7862295777636326,
      "grad_norm": 0.35478574295491483,
      "learning_rate": 4.367478829031344e-05,
      "loss": 1.5303,
      "num_input_tokens_seen": 20662832720,
      "step": 26263
    },
    {
      "epoch": 2.786335667303204,
      "grad_norm": 0.4281813436371295,
      "learning_rate": 4.367432624450848e-05,
      "loss": 1.6115,
      "num_input_tokens_seen": 20663619488,
      "step": 26264
    },
    {
      "epoch": 2.786441756842775,
      "grad_norm": 0.40695379884924465,
      "learning_rate": 4.3673864184272536e-05,
      "loss": 1.6705,
      "num_input_tokens_seen": 20664406192,
      "step": 26265
    },
    {
      "epoch": 2.7865478463823465,
      "grad_norm": 0.3667243312399344,
      "learning_rate": 4.367340210960599e-05,
      "loss": 1.5479,
      "num_input_tokens_seen": 20665192912,
      "step": 26266
    },
    {
      "epoch": 2.786653935921918,
      "grad_norm": 0.41408719262341265,
      "learning_rate": 4.367294002050918e-05,
      "loss": 1.469,
      "num_input_tokens_seen": 20665979680,
      "step": 26267
    },
    {
      "epoch": 2.7867600254614895,
      "grad_norm": 0.3570779296850778,
      "learning_rate": 4.3672477916982476e-05,
      "loss": 1.536,
      "num_input_tokens_seen": 20666766432,
      "step": 26268
    },
    {
      "epoch": 2.786866115001061,
      "grad_norm": 0.4144301971342174,
      "learning_rate": 4.367201579902622e-05,
      "loss": 1.6459,
      "num_input_tokens_seen": 20667553184,
      "step": 26269
    },
    {
      "epoch": 2.7869722045406324,
      "grad_norm": 0.37619533087365437,
      "learning_rate": 4.367155366664078e-05,
      "loss": 1.6826,
      "num_input_tokens_seen": 20668340016,
      "step": 26270
    },
    {
      "epoch": 2.787078294080204,
      "grad_norm": 0.4270882224790961,
      "learning_rate": 4.367109151982652e-05,
      "loss": 1.6857,
      "num_input_tokens_seen": 20669126832,
      "step": 26271
    },
    {
      "epoch": 2.787184383619775,
      "grad_norm": 0.34383627329787414,
      "learning_rate": 4.367062935858378e-05,
      "loss": 1.5694,
      "num_input_tokens_seen": 20669913632,
      "step": 26272
    },
    {
      "epoch": 2.7872904731593464,
      "grad_norm": 0.3627503781507388,
      "learning_rate": 4.367016718291293e-05,
      "loss": 1.5986,
      "num_input_tokens_seen": 20670700416,
      "step": 26273
    },
    {
      "epoch": 2.787396562698918,
      "grad_norm": 0.3681058437940927,
      "learning_rate": 4.366970499281432e-05,
      "loss": 1.7513,
      "num_input_tokens_seen": 20671487152,
      "step": 26274
    },
    {
      "epoch": 2.7875026522384894,
      "grad_norm": 0.3745337165796649,
      "learning_rate": 4.366924278828831e-05,
      "loss": 1.556,
      "num_input_tokens_seen": 20672273920,
      "step": 26275
    },
    {
      "epoch": 2.787608741778061,
      "grad_norm": 0.33501463451868735,
      "learning_rate": 4.366878056933525e-05,
      "loss": 1.5865,
      "num_input_tokens_seen": 20673060704,
      "step": 26276
    },
    {
      "epoch": 2.787714831317632,
      "grad_norm": 0.3798211758460013,
      "learning_rate": 4.366831833595551e-05,
      "loss": 1.5585,
      "num_input_tokens_seen": 20673847504,
      "step": 26277
    },
    {
      "epoch": 2.7878209208572033,
      "grad_norm": 0.45731267167066647,
      "learning_rate": 4.366785608814945e-05,
      "loss": 1.5824,
      "num_input_tokens_seen": 20674634224,
      "step": 26278
    },
    {
      "epoch": 2.787927010396775,
      "grad_norm": 0.4506275895459809,
      "learning_rate": 4.3667393825917414e-05,
      "loss": 1.5112,
      "num_input_tokens_seen": 20675420960,
      "step": 26279
    },
    {
      "epoch": 2.7880330999363463,
      "grad_norm": 0.3422933455162492,
      "learning_rate": 4.366693154925976e-05,
      "loss": 1.5111,
      "num_input_tokens_seen": 20676207808,
      "step": 26280
    },
    {
      "epoch": 2.7881391894759178,
      "grad_norm": 0.3875910743246325,
      "learning_rate": 4.366646925817685e-05,
      "loss": 1.6335,
      "num_input_tokens_seen": 20676994512,
      "step": 26281
    },
    {
      "epoch": 2.788245279015489,
      "grad_norm": 0.36271587691295715,
      "learning_rate": 4.3666006952669036e-05,
      "loss": 1.68,
      "num_input_tokens_seen": 20677781216,
      "step": 26282
    },
    {
      "epoch": 2.7883513685550607,
      "grad_norm": 0.374432668509601,
      "learning_rate": 4.3665544632736686e-05,
      "loss": 1.5342,
      "num_input_tokens_seen": 20678568032,
      "step": 26283
    },
    {
      "epoch": 2.7884574580946317,
      "grad_norm": 0.44997791060153297,
      "learning_rate": 4.3665082298380157e-05,
      "loss": 1.6081,
      "num_input_tokens_seen": 20679354896,
      "step": 26284
    },
    {
      "epoch": 2.788563547634203,
      "grad_norm": 0.3681595753484324,
      "learning_rate": 4.366461994959978e-05,
      "loss": 1.5841,
      "num_input_tokens_seen": 20680141632,
      "step": 26285
    },
    {
      "epoch": 2.7886696371737747,
      "grad_norm": 0.4021514917947575,
      "learning_rate": 4.3664157586395946e-05,
      "loss": 1.6345,
      "num_input_tokens_seen": 20680928416,
      "step": 26286
    },
    {
      "epoch": 2.788775726713346,
      "grad_norm": 0.43737484855295167,
      "learning_rate": 4.3663695208768996e-05,
      "loss": 1.6003,
      "num_input_tokens_seen": 20681715200,
      "step": 26287
    },
    {
      "epoch": 2.7888818162529176,
      "grad_norm": 0.35503635730092353,
      "learning_rate": 4.36632328167193e-05,
      "loss": 1.5116,
      "num_input_tokens_seen": 20682501872,
      "step": 26288
    },
    {
      "epoch": 2.7889879057924887,
      "grad_norm": 0.43513689451748216,
      "learning_rate": 4.366277041024719e-05,
      "loss": 1.5352,
      "num_input_tokens_seen": 20683288608,
      "step": 26289
    },
    {
      "epoch": 2.78909399533206,
      "grad_norm": 0.4002016896621933,
      "learning_rate": 4.3662307989353045e-05,
      "loss": 1.6345,
      "num_input_tokens_seen": 20684075360,
      "step": 26290
    },
    {
      "epoch": 2.7892000848716316,
      "grad_norm": 0.4311333126046246,
      "learning_rate": 4.3661845554037216e-05,
      "loss": 1.5528,
      "num_input_tokens_seen": 20684862160,
      "step": 26291
    },
    {
      "epoch": 2.789306174411203,
      "grad_norm": 0.44199564512028056,
      "learning_rate": 4.3661383104300054e-05,
      "loss": 1.6043,
      "num_input_tokens_seen": 20685648896,
      "step": 26292
    },
    {
      "epoch": 2.7894122639507746,
      "grad_norm": 0.379545620160027,
      "learning_rate": 4.366092064014193e-05,
      "loss": 1.5371,
      "num_input_tokens_seen": 20686435696,
      "step": 26293
    },
    {
      "epoch": 2.7895183534903456,
      "grad_norm": 0.5465415510064892,
      "learning_rate": 4.36604581615632e-05,
      "loss": 1.6968,
      "num_input_tokens_seen": 20687222368,
      "step": 26294
    },
    {
      "epoch": 2.7896244430299175,
      "grad_norm": 0.4077270634092796,
      "learning_rate": 4.365999566856421e-05,
      "loss": 1.3891,
      "num_input_tokens_seen": 20688009040,
      "step": 26295
    },
    {
      "epoch": 2.7897305325694886,
      "grad_norm": 0.5421017856568502,
      "learning_rate": 4.3659533161145316e-05,
      "loss": 1.577,
      "num_input_tokens_seen": 20688795824,
      "step": 26296
    },
    {
      "epoch": 2.78983662210906,
      "grad_norm": 0.4002112605090815,
      "learning_rate": 4.365907063930689e-05,
      "loss": 1.6553,
      "num_input_tokens_seen": 20689582624,
      "step": 26297
    },
    {
      "epoch": 2.7899427116486315,
      "grad_norm": 0.553263194642472,
      "learning_rate": 4.3658608103049274e-05,
      "loss": 1.4899,
      "num_input_tokens_seen": 20690369344,
      "step": 26298
    },
    {
      "epoch": 2.790048801188203,
      "grad_norm": 0.41195942144586956,
      "learning_rate": 4.365814555237284e-05,
      "loss": 1.5436,
      "num_input_tokens_seen": 20691156096,
      "step": 26299
    },
    {
      "epoch": 2.7901548907277745,
      "grad_norm": 0.35329693485071173,
      "learning_rate": 4.365768298727794e-05,
      "loss": 1.5097,
      "num_input_tokens_seen": 20691942912,
      "step": 26300
    },
    {
      "epoch": 2.7902609802673455,
      "grad_norm": 0.41306810056842197,
      "learning_rate": 4.365722040776492e-05,
      "loss": 1.5486,
      "num_input_tokens_seen": 20692729680,
      "step": 26301
    },
    {
      "epoch": 2.790367069806917,
      "grad_norm": 0.3654246768647943,
      "learning_rate": 4.365675781383416e-05,
      "loss": 1.5593,
      "num_input_tokens_seen": 20693516512,
      "step": 26302
    },
    {
      "epoch": 2.7904731593464884,
      "grad_norm": 0.49307775074857874,
      "learning_rate": 4.3656295205485996e-05,
      "loss": 1.5646,
      "num_input_tokens_seen": 20694303296,
      "step": 26303
    },
    {
      "epoch": 2.79057924888606,
      "grad_norm": 0.42511425735194003,
      "learning_rate": 4.36558325827208e-05,
      "loss": 1.5155,
      "num_input_tokens_seen": 20695090032,
      "step": 26304
    },
    {
      "epoch": 2.7906853384256314,
      "grad_norm": 0.3980577974926424,
      "learning_rate": 4.365536994553892e-05,
      "loss": 1.5832,
      "num_input_tokens_seen": 20695876768,
      "step": 26305
    },
    {
      "epoch": 2.7907914279652024,
      "grad_norm": 0.4320740389249327,
      "learning_rate": 4.3654907293940714e-05,
      "loss": 1.5669,
      "num_input_tokens_seen": 20696663584,
      "step": 26306
    },
    {
      "epoch": 2.790897517504774,
      "grad_norm": 0.5037474484911574,
      "learning_rate": 4.365444462792656e-05,
      "loss": 1.7059,
      "num_input_tokens_seen": 20697450384,
      "step": 26307
    },
    {
      "epoch": 2.7910036070443454,
      "grad_norm": 0.42675400430097304,
      "learning_rate": 4.365398194749678e-05,
      "loss": 1.6383,
      "num_input_tokens_seen": 20698237136,
      "step": 26308
    },
    {
      "epoch": 2.791109696583917,
      "grad_norm": 0.3940537058668853,
      "learning_rate": 4.365351925265176e-05,
      "loss": 1.5432,
      "num_input_tokens_seen": 20699023840,
      "step": 26309
    },
    {
      "epoch": 2.7912157861234883,
      "grad_norm": 0.5420259944981346,
      "learning_rate": 4.3653056543391846e-05,
      "loss": 1.6899,
      "num_input_tokens_seen": 20699810560,
      "step": 26310
    },
    {
      "epoch": 2.79132187566306,
      "grad_norm": 0.4017305496398096,
      "learning_rate": 4.365259381971739e-05,
      "loss": 1.5485,
      "num_input_tokens_seen": 20700597328,
      "step": 26311
    },
    {
      "epoch": 2.7914279652026313,
      "grad_norm": 0.5897510877012434,
      "learning_rate": 4.365213108162877e-05,
      "loss": 1.5995,
      "num_input_tokens_seen": 20701384096,
      "step": 26312
    },
    {
      "epoch": 2.7915340547422023,
      "grad_norm": 0.4483289372275278,
      "learning_rate": 4.3651668329126314e-05,
      "loss": 1.555,
      "num_input_tokens_seen": 20702170896,
      "step": 26313
    },
    {
      "epoch": 2.7916401442817738,
      "grad_norm": 0.42495432862556726,
      "learning_rate": 4.365120556221041e-05,
      "loss": 1.5032,
      "num_input_tokens_seen": 20702957696,
      "step": 26314
    },
    {
      "epoch": 2.7917462338213452,
      "grad_norm": 0.4723312115425684,
      "learning_rate": 4.3650742780881395e-05,
      "loss": 1.5845,
      "num_input_tokens_seen": 20703744448,
      "step": 26315
    },
    {
      "epoch": 2.7918523233609167,
      "grad_norm": 0.3956586301326811,
      "learning_rate": 4.365027998513963e-05,
      "loss": 1.6778,
      "num_input_tokens_seen": 20704531232,
      "step": 26316
    },
    {
      "epoch": 2.791958412900488,
      "grad_norm": 0.48423492704680293,
      "learning_rate": 4.3649817174985484e-05,
      "loss": 1.577,
      "num_input_tokens_seen": 20705318016,
      "step": 26317
    },
    {
      "epoch": 2.792064502440059,
      "grad_norm": 0.44321279809478004,
      "learning_rate": 4.36493543504193e-05,
      "loss": 1.5853,
      "num_input_tokens_seen": 20706104848,
      "step": 26318
    },
    {
      "epoch": 2.7921705919796307,
      "grad_norm": 0.4703156312055605,
      "learning_rate": 4.3648891511441445e-05,
      "loss": 1.5933,
      "num_input_tokens_seen": 20706891664,
      "step": 26319
    },
    {
      "epoch": 2.792276681519202,
      "grad_norm": 0.4241053657988306,
      "learning_rate": 4.364842865805228e-05,
      "loss": 1.6941,
      "num_input_tokens_seen": 20707678448,
      "step": 26320
    },
    {
      "epoch": 2.7923827710587736,
      "grad_norm": 0.5129402536687407,
      "learning_rate": 4.364796579025215e-05,
      "loss": 1.5745,
      "num_input_tokens_seen": 20708465216,
      "step": 26321
    },
    {
      "epoch": 2.792488860598345,
      "grad_norm": 0.5342633837378808,
      "learning_rate": 4.3647502908041414e-05,
      "loss": 1.5426,
      "num_input_tokens_seen": 20709252048,
      "step": 26322
    },
    {
      "epoch": 2.792594950137916,
      "grad_norm": 0.5345267538746422,
      "learning_rate": 4.3647040011420444e-05,
      "loss": 1.5365,
      "num_input_tokens_seen": 20710038848,
      "step": 26323
    },
    {
      "epoch": 2.792701039677488,
      "grad_norm": 0.5175498766282265,
      "learning_rate": 4.3646577100389586e-05,
      "loss": 1.5862,
      "num_input_tokens_seen": 20710825664,
      "step": 26324
    },
    {
      "epoch": 2.792807129217059,
      "grad_norm": 0.5887794075083072,
      "learning_rate": 4.36461141749492e-05,
      "loss": 1.5685,
      "num_input_tokens_seen": 20711612512,
      "step": 26325
    },
    {
      "epoch": 2.7929132187566306,
      "grad_norm": 0.40209015593221054,
      "learning_rate": 4.3645651235099646e-05,
      "loss": 1.5976,
      "num_input_tokens_seen": 20712399200,
      "step": 26326
    },
    {
      "epoch": 2.793019308296202,
      "grad_norm": 0.6077414959984304,
      "learning_rate": 4.3645188280841276e-05,
      "loss": 1.5617,
      "num_input_tokens_seen": 20713185952,
      "step": 26327
    },
    {
      "epoch": 2.7931253978357735,
      "grad_norm": 0.49757441703080035,
      "learning_rate": 4.364472531217445e-05,
      "loss": 1.5027,
      "num_input_tokens_seen": 20713972656,
      "step": 26328
    },
    {
      "epoch": 2.793231487375345,
      "grad_norm": 0.48288762182893535,
      "learning_rate": 4.3644262329099535e-05,
      "loss": 1.5434,
      "num_input_tokens_seen": 20714759472,
      "step": 26329
    },
    {
      "epoch": 2.793337576914916,
      "grad_norm": 0.5248036589740168,
      "learning_rate": 4.3643799331616876e-05,
      "loss": 1.6196,
      "num_input_tokens_seen": 20715546256,
      "step": 26330
    },
    {
      "epoch": 2.7934436664544875,
      "grad_norm": 0.5264310179436243,
      "learning_rate": 4.364333631972684e-05,
      "loss": 1.5638,
      "num_input_tokens_seen": 20716332880,
      "step": 26331
    },
    {
      "epoch": 2.793549755994059,
      "grad_norm": 0.37610023761403855,
      "learning_rate": 4.364287329342978e-05,
      "loss": 1.558,
      "num_input_tokens_seen": 20717119632,
      "step": 26332
    },
    {
      "epoch": 2.7936558455336304,
      "grad_norm": 0.4120179439473033,
      "learning_rate": 4.364241025272604e-05,
      "loss": 1.689,
      "num_input_tokens_seen": 20717906272,
      "step": 26333
    },
    {
      "epoch": 2.793761935073202,
      "grad_norm": 0.4053640569009231,
      "learning_rate": 4.364194719761601e-05,
      "loss": 1.574,
      "num_input_tokens_seen": 20718692992,
      "step": 26334
    },
    {
      "epoch": 2.793868024612773,
      "grad_norm": 0.40766862847577334,
      "learning_rate": 4.364148412810002e-05,
      "loss": 1.5589,
      "num_input_tokens_seen": 20719479728,
      "step": 26335
    },
    {
      "epoch": 2.7939741141523444,
      "grad_norm": 0.4024907564502901,
      "learning_rate": 4.364102104417844e-05,
      "loss": 1.581,
      "num_input_tokens_seen": 20720266448,
      "step": 26336
    },
    {
      "epoch": 2.794080203691916,
      "grad_norm": 0.3865583147394634,
      "learning_rate": 4.364055794585163e-05,
      "loss": 1.5646,
      "num_input_tokens_seen": 20721053216,
      "step": 26337
    },
    {
      "epoch": 2.7941862932314874,
      "grad_norm": 0.4092186865546674,
      "learning_rate": 4.364009483311995e-05,
      "loss": 1.5946,
      "num_input_tokens_seen": 20721839968,
      "step": 26338
    },
    {
      "epoch": 2.794292382771059,
      "grad_norm": 0.4250544973663407,
      "learning_rate": 4.363963170598374e-05,
      "loss": 1.6346,
      "num_input_tokens_seen": 20722626672,
      "step": 26339
    },
    {
      "epoch": 2.7943984723106303,
      "grad_norm": 0.4142809210766336,
      "learning_rate": 4.363916856444337e-05,
      "loss": 1.5429,
      "num_input_tokens_seen": 20723413456,
      "step": 26340
    },
    {
      "epoch": 2.794504561850202,
      "grad_norm": 0.4913437548185943,
      "learning_rate": 4.36387054084992e-05,
      "loss": 1.5756,
      "num_input_tokens_seen": 20724200224,
      "step": 26341
    },
    {
      "epoch": 2.794610651389773,
      "grad_norm": 0.3760233743089198,
      "learning_rate": 4.363824223815159e-05,
      "loss": 1.6221,
      "num_input_tokens_seen": 20724986960,
      "step": 26342
    },
    {
      "epoch": 2.7947167409293443,
      "grad_norm": 0.39086197322646676,
      "learning_rate": 4.363777905340089e-05,
      "loss": 1.6244,
      "num_input_tokens_seen": 20725773728,
      "step": 26343
    },
    {
      "epoch": 2.7948228304689158,
      "grad_norm": 0.4433033444041585,
      "learning_rate": 4.363731585424746e-05,
      "loss": 1.5772,
      "num_input_tokens_seen": 20726560576,
      "step": 26344
    },
    {
      "epoch": 2.7949289200084872,
      "grad_norm": 0.38050278514890323,
      "learning_rate": 4.363685264069165e-05,
      "loss": 1.5776,
      "num_input_tokens_seen": 20727347360,
      "step": 26345
    },
    {
      "epoch": 2.7950350095480587,
      "grad_norm": 0.33131804733403986,
      "learning_rate": 4.3636389412733844e-05,
      "loss": 1.5053,
      "num_input_tokens_seen": 20728134192,
      "step": 26346
    },
    {
      "epoch": 2.7951410990876298,
      "grad_norm": 0.4177155000444203,
      "learning_rate": 4.363592617037437e-05,
      "loss": 1.5581,
      "num_input_tokens_seen": 20728920928,
      "step": 26347
    },
    {
      "epoch": 2.7952471886272012,
      "grad_norm": 0.44349862064957735,
      "learning_rate": 4.3635462913613615e-05,
      "loss": 1.6228,
      "num_input_tokens_seen": 20729707744,
      "step": 26348
    },
    {
      "epoch": 2.7953532781667727,
      "grad_norm": 0.4018877343369625,
      "learning_rate": 4.36349996424519e-05,
      "loss": 1.5605,
      "num_input_tokens_seen": 20730494480,
      "step": 26349
    },
    {
      "epoch": 2.795459367706344,
      "grad_norm": 0.3641557910094636,
      "learning_rate": 4.363453635688962e-05,
      "loss": 1.6109,
      "num_input_tokens_seen": 20731281120,
      "step": 26350
    },
    {
      "epoch": 2.7955654572459157,
      "grad_norm": 0.37485023526186434,
      "learning_rate": 4.3634073056927115e-05,
      "loss": 1.5452,
      "num_input_tokens_seen": 20732067920,
      "step": 26351
    },
    {
      "epoch": 2.7956715467854867,
      "grad_norm": 0.3690718885154303,
      "learning_rate": 4.363360974256474e-05,
      "loss": 1.6449,
      "num_input_tokens_seen": 20732854672,
      "step": 26352
    },
    {
      "epoch": 2.7957776363250586,
      "grad_norm": 0.4323919608585459,
      "learning_rate": 4.363314641380286e-05,
      "loss": 1.4703,
      "num_input_tokens_seen": 20733641456,
      "step": 26353
    },
    {
      "epoch": 2.7958837258646296,
      "grad_norm": 0.3861910335445794,
      "learning_rate": 4.3632683070641836e-05,
      "loss": 1.5711,
      "num_input_tokens_seen": 20734428160,
      "step": 26354
    },
    {
      "epoch": 2.795989815404201,
      "grad_norm": 0.4030618684184968,
      "learning_rate": 4.363221971308201e-05,
      "loss": 1.6821,
      "num_input_tokens_seen": 20735214960,
      "step": 26355
    },
    {
      "epoch": 2.7960959049437726,
      "grad_norm": 0.4707607523247867,
      "learning_rate": 4.363175634112377e-05,
      "loss": 1.5424,
      "num_input_tokens_seen": 20736001744,
      "step": 26356
    },
    {
      "epoch": 2.796201994483344,
      "grad_norm": 0.3791088241864469,
      "learning_rate": 4.3631292954767435e-05,
      "loss": 1.5616,
      "num_input_tokens_seen": 20736788544,
      "step": 26357
    },
    {
      "epoch": 2.7963080840229155,
      "grad_norm": 0.33175584477703357,
      "learning_rate": 4.3630829554013393e-05,
      "loss": 1.4178,
      "num_input_tokens_seen": 20737575248,
      "step": 26358
    },
    {
      "epoch": 2.7964141735624866,
      "grad_norm": 0.3840331724595899,
      "learning_rate": 4.363036613886199e-05,
      "loss": 1.5801,
      "num_input_tokens_seen": 20738361968,
      "step": 26359
    },
    {
      "epoch": 2.796520263102058,
      "grad_norm": 0.3968244085756127,
      "learning_rate": 4.362990270931359e-05,
      "loss": 1.6143,
      "num_input_tokens_seen": 20739148688,
      "step": 26360
    },
    {
      "epoch": 2.7966263526416295,
      "grad_norm": 0.35689797454682803,
      "learning_rate": 4.3629439265368544e-05,
      "loss": 1.5229,
      "num_input_tokens_seen": 20739935440,
      "step": 26361
    },
    {
      "epoch": 2.796732442181201,
      "grad_norm": 0.42748691618858875,
      "learning_rate": 4.362897580702722e-05,
      "loss": 1.5373,
      "num_input_tokens_seen": 20740722112,
      "step": 26362
    },
    {
      "epoch": 2.7968385317207725,
      "grad_norm": 0.4175082574152492,
      "learning_rate": 4.362851233428996e-05,
      "loss": 1.574,
      "num_input_tokens_seen": 20741508784,
      "step": 26363
    },
    {
      "epoch": 2.7969446212603435,
      "grad_norm": 0.3521377281210188,
      "learning_rate": 4.3628048847157144e-05,
      "loss": 1.4626,
      "num_input_tokens_seen": 20742295552,
      "step": 26364
    },
    {
      "epoch": 2.797050710799915,
      "grad_norm": 0.39987501495728706,
      "learning_rate": 4.3627585345629105e-05,
      "loss": 1.4964,
      "num_input_tokens_seen": 20743082320,
      "step": 26365
    },
    {
      "epoch": 2.7971568003394864,
      "grad_norm": 0.37042453221214466,
      "learning_rate": 4.362712182970623e-05,
      "loss": 1.6773,
      "num_input_tokens_seen": 20743869008,
      "step": 26366
    },
    {
      "epoch": 2.797262889879058,
      "grad_norm": 0.40269878766248396,
      "learning_rate": 4.362665829938885e-05,
      "loss": 1.599,
      "num_input_tokens_seen": 20744655744,
      "step": 26367
    },
    {
      "epoch": 2.7973689794186294,
      "grad_norm": 0.3521545196178972,
      "learning_rate": 4.362619475467734e-05,
      "loss": 1.5813,
      "num_input_tokens_seen": 20745442464,
      "step": 26368
    },
    {
      "epoch": 2.797475068958201,
      "grad_norm": 0.5413668988263203,
      "learning_rate": 4.362573119557205e-05,
      "loss": 1.601,
      "num_input_tokens_seen": 20746229280,
      "step": 26369
    },
    {
      "epoch": 2.7975811584977723,
      "grad_norm": 0.484127791756812,
      "learning_rate": 4.362526762207334e-05,
      "loss": 1.6039,
      "num_input_tokens_seen": 20747016096,
      "step": 26370
    },
    {
      "epoch": 2.7976872480373434,
      "grad_norm": 0.37847386456986004,
      "learning_rate": 4.3624804034181575e-05,
      "loss": 1.5724,
      "num_input_tokens_seen": 20747802832,
      "step": 26371
    },
    {
      "epoch": 2.797793337576915,
      "grad_norm": 0.39728708646429967,
      "learning_rate": 4.362434043189711e-05,
      "loss": 1.63,
      "num_input_tokens_seen": 20748589616,
      "step": 26372
    },
    {
      "epoch": 2.7978994271164863,
      "grad_norm": 0.4638467205214999,
      "learning_rate": 4.36238768152203e-05,
      "loss": 1.6293,
      "num_input_tokens_seen": 20749376448,
      "step": 26373
    },
    {
      "epoch": 2.798005516656058,
      "grad_norm": 0.4253161097403478,
      "learning_rate": 4.3623413184151504e-05,
      "loss": 1.6712,
      "num_input_tokens_seen": 20750163184,
      "step": 26374
    },
    {
      "epoch": 2.7981116061956293,
      "grad_norm": 0.43739676886785234,
      "learning_rate": 4.362294953869107e-05,
      "loss": 1.5385,
      "num_input_tokens_seen": 20750950000,
      "step": 26375
    },
    {
      "epoch": 2.7982176957352003,
      "grad_norm": 0.38930376202669453,
      "learning_rate": 4.3622485878839384e-05,
      "loss": 1.7498,
      "num_input_tokens_seen": 20751736560,
      "step": 26376
    },
    {
      "epoch": 2.7983237852747718,
      "grad_norm": 0.3659895398852694,
      "learning_rate": 4.362202220459678e-05,
      "loss": 1.6171,
      "num_input_tokens_seen": 20752523456,
      "step": 26377
    },
    {
      "epoch": 2.7984298748143432,
      "grad_norm": 0.4194179101370119,
      "learning_rate": 4.3621558515963616e-05,
      "loss": 1.468,
      "num_input_tokens_seen": 20753310272,
      "step": 26378
    },
    {
      "epoch": 2.7985359643539147,
      "grad_norm": 0.34848852817333825,
      "learning_rate": 4.362109481294027e-05,
      "loss": 1.5367,
      "num_input_tokens_seen": 20754097008,
      "step": 26379
    },
    {
      "epoch": 2.798642053893486,
      "grad_norm": 0.44435685065424446,
      "learning_rate": 4.362063109552708e-05,
      "loss": 1.58,
      "num_input_tokens_seen": 20754883872,
      "step": 26380
    },
    {
      "epoch": 2.7987481434330577,
      "grad_norm": 0.3651320112523483,
      "learning_rate": 4.362016736372442e-05,
      "loss": 1.6097,
      "num_input_tokens_seen": 20755670624,
      "step": 26381
    },
    {
      "epoch": 2.798854232972629,
      "grad_norm": 0.36410031786293967,
      "learning_rate": 4.3619703617532636e-05,
      "loss": 1.4785,
      "num_input_tokens_seen": 20756457408,
      "step": 26382
    },
    {
      "epoch": 2.7989603225122,
      "grad_norm": 0.41645390827598083,
      "learning_rate": 4.361923985695209e-05,
      "loss": 1.6662,
      "num_input_tokens_seen": 20757244096,
      "step": 26383
    },
    {
      "epoch": 2.7990664120517716,
      "grad_norm": 0.4131596457266769,
      "learning_rate": 4.3618776081983144e-05,
      "loss": 1.6466,
      "num_input_tokens_seen": 20758030800,
      "step": 26384
    },
    {
      "epoch": 2.799172501591343,
      "grad_norm": 0.4110183880593397,
      "learning_rate": 4.3618312292626154e-05,
      "loss": 1.5375,
      "num_input_tokens_seen": 20758817552,
      "step": 26385
    },
    {
      "epoch": 2.7992785911309146,
      "grad_norm": 0.37950567174079164,
      "learning_rate": 4.361784848888148e-05,
      "loss": 1.646,
      "num_input_tokens_seen": 20759604320,
      "step": 26386
    },
    {
      "epoch": 2.799384680670486,
      "grad_norm": 0.36233604462274055,
      "learning_rate": 4.361738467074947e-05,
      "loss": 1.6666,
      "num_input_tokens_seen": 20760391024,
      "step": 26387
    },
    {
      "epoch": 2.799490770210057,
      "grad_norm": 0.38873876363265814,
      "learning_rate": 4.36169208382305e-05,
      "loss": 1.6582,
      "num_input_tokens_seen": 20761177712,
      "step": 26388
    },
    {
      "epoch": 2.7995968597496286,
      "grad_norm": 0.33594349628435327,
      "learning_rate": 4.361645699132492e-05,
      "loss": 1.4678,
      "num_input_tokens_seen": 20761964528,
      "step": 26389
    },
    {
      "epoch": 2.7997029492892,
      "grad_norm": 0.37383578454476574,
      "learning_rate": 4.361599313003309e-05,
      "loss": 1.6223,
      "num_input_tokens_seen": 20762751376,
      "step": 26390
    },
    {
      "epoch": 2.7998090388287715,
      "grad_norm": 0.38819369321306957,
      "learning_rate": 4.361552925435536e-05,
      "loss": 1.6739,
      "num_input_tokens_seen": 20763538112,
      "step": 26391
    },
    {
      "epoch": 2.799915128368343,
      "grad_norm": 0.3584191325950597,
      "learning_rate": 4.36150653642921e-05,
      "loss": 1.4966,
      "num_input_tokens_seen": 20764324880,
      "step": 26392
    },
    {
      "epoch": 2.800021217907914,
      "grad_norm": 0.33917273584193947,
      "learning_rate": 4.361460145984366e-05,
      "loss": 1.5226,
      "num_input_tokens_seen": 20765111632,
      "step": 26393
    },
    {
      "epoch": 2.800127307447486,
      "grad_norm": 0.36308465290305564,
      "learning_rate": 4.3614137541010414e-05,
      "loss": 1.5179,
      "num_input_tokens_seen": 20765898416,
      "step": 26394
    },
    {
      "epoch": 2.800233396987057,
      "grad_norm": 0.37244289383588874,
      "learning_rate": 4.361367360779269e-05,
      "loss": 1.6743,
      "num_input_tokens_seen": 20766685136,
      "step": 26395
    },
    {
      "epoch": 2.8003394865266285,
      "grad_norm": 0.3493401325690194,
      "learning_rate": 4.361320966019088e-05,
      "loss": 1.454,
      "num_input_tokens_seen": 20767471984,
      "step": 26396
    },
    {
      "epoch": 2.8004455760662,
      "grad_norm": 0.3642477873036983,
      "learning_rate": 4.361274569820533e-05,
      "loss": 1.6671,
      "num_input_tokens_seen": 20768258704,
      "step": 26397
    },
    {
      "epoch": 2.8005516656057714,
      "grad_norm": 0.4171956719687663,
      "learning_rate": 4.361228172183638e-05,
      "loss": 1.6772,
      "num_input_tokens_seen": 20769045504,
      "step": 26398
    },
    {
      "epoch": 2.800657755145343,
      "grad_norm": 0.43215951491677973,
      "learning_rate": 4.361181773108442e-05,
      "loss": 1.5032,
      "num_input_tokens_seen": 20769832256,
      "step": 26399
    },
    {
      "epoch": 2.800763844684914,
      "grad_norm": 0.3504125004371387,
      "learning_rate": 4.361135372594978e-05,
      "loss": 1.6113,
      "num_input_tokens_seen": 20770618992,
      "step": 26400
    },
    {
      "epoch": 2.8008699342244854,
      "grad_norm": 0.41914185687483185,
      "learning_rate": 4.3610889706432847e-05,
      "loss": 1.622,
      "num_input_tokens_seen": 20771405728,
      "step": 26401
    },
    {
      "epoch": 2.800976023764057,
      "grad_norm": 0.374140618721477,
      "learning_rate": 4.361042567253395e-05,
      "loss": 1.6012,
      "num_input_tokens_seen": 20772192528,
      "step": 26402
    },
    {
      "epoch": 2.8010821133036283,
      "grad_norm": 0.4105395616317962,
      "learning_rate": 4.360996162425347e-05,
      "loss": 1.5869,
      "num_input_tokens_seen": 20772979376,
      "step": 26403
    },
    {
      "epoch": 2.8011882028432,
      "grad_norm": 0.4110314485667932,
      "learning_rate": 4.3609497561591756e-05,
      "loss": 1.5584,
      "num_input_tokens_seen": 20773766096,
      "step": 26404
    },
    {
      "epoch": 2.801294292382771,
      "grad_norm": 0.4589878128166336,
      "learning_rate": 4.360903348454917e-05,
      "loss": 1.5083,
      "num_input_tokens_seen": 20774552896,
      "step": 26405
    },
    {
      "epoch": 2.8014003819223423,
      "grad_norm": 0.3890603469905757,
      "learning_rate": 4.3608569393126066e-05,
      "loss": 1.5375,
      "num_input_tokens_seen": 20775339680,
      "step": 26406
    },
    {
      "epoch": 2.801506471461914,
      "grad_norm": 0.3575477709101885,
      "learning_rate": 4.360810528732281e-05,
      "loss": 1.5131,
      "num_input_tokens_seen": 20776126336,
      "step": 26407
    },
    {
      "epoch": 2.8016125610014853,
      "grad_norm": 0.37977690476665116,
      "learning_rate": 4.3607641167139744e-05,
      "loss": 1.5653,
      "num_input_tokens_seen": 20776913072,
      "step": 26408
    },
    {
      "epoch": 2.8017186505410567,
      "grad_norm": 0.32829823517965734,
      "learning_rate": 4.360717703257725e-05,
      "loss": 1.6229,
      "num_input_tokens_seen": 20777699760,
      "step": 26409
    },
    {
      "epoch": 2.801824740080628,
      "grad_norm": 0.4056569800270962,
      "learning_rate": 4.3606712883635684e-05,
      "loss": 1.6403,
      "num_input_tokens_seen": 20778486480,
      "step": 26410
    },
    {
      "epoch": 2.8019308296201997,
      "grad_norm": 0.3947971646915132,
      "learning_rate": 4.360624872031538e-05,
      "loss": 1.6001,
      "num_input_tokens_seen": 20779273232,
      "step": 26411
    },
    {
      "epoch": 2.8020369191597707,
      "grad_norm": 0.4493786203385776,
      "learning_rate": 4.360578454261672e-05,
      "loss": 1.6601,
      "num_input_tokens_seen": 20780059984,
      "step": 26412
    },
    {
      "epoch": 2.802143008699342,
      "grad_norm": 0.3984541049264146,
      "learning_rate": 4.3605320350540054e-05,
      "loss": 1.583,
      "num_input_tokens_seen": 20780846768,
      "step": 26413
    },
    {
      "epoch": 2.8022490982389137,
      "grad_norm": 0.409599144269452,
      "learning_rate": 4.360485614408574e-05,
      "loss": 1.5651,
      "num_input_tokens_seen": 20781633440,
      "step": 26414
    },
    {
      "epoch": 2.802355187778485,
      "grad_norm": 0.35674459056149,
      "learning_rate": 4.360439192325414e-05,
      "loss": 1.5673,
      "num_input_tokens_seen": 20782420176,
      "step": 26415
    },
    {
      "epoch": 2.8024612773180566,
      "grad_norm": 0.450366238374528,
      "learning_rate": 4.3603927688045613e-05,
      "loss": 1.6045,
      "num_input_tokens_seen": 20783206848,
      "step": 26416
    },
    {
      "epoch": 2.8025673668576276,
      "grad_norm": 0.3250641211618607,
      "learning_rate": 4.360346343846052e-05,
      "loss": 1.497,
      "num_input_tokens_seen": 20783993632,
      "step": 26417
    },
    {
      "epoch": 2.802673456397199,
      "grad_norm": 0.3915643183879315,
      "learning_rate": 4.3602999174499216e-05,
      "loss": 1.5079,
      "num_input_tokens_seen": 20784780464,
      "step": 26418
    },
    {
      "epoch": 2.8027795459367706,
      "grad_norm": 0.42288427038077886,
      "learning_rate": 4.360253489616205e-05,
      "loss": 1.7345,
      "num_input_tokens_seen": 20785567200,
      "step": 26419
    },
    {
      "epoch": 2.802885635476342,
      "grad_norm": 0.4137250811726708,
      "learning_rate": 4.3602070603449404e-05,
      "loss": 1.5468,
      "num_input_tokens_seen": 20786353984,
      "step": 26420
    },
    {
      "epoch": 2.8029917250159135,
      "grad_norm": 0.3897122906221941,
      "learning_rate": 4.360160629636162e-05,
      "loss": 1.6058,
      "num_input_tokens_seen": 20787140736,
      "step": 26421
    },
    {
      "epoch": 2.8030978145554846,
      "grad_norm": 0.40638963189955235,
      "learning_rate": 4.360114197489905e-05,
      "loss": 1.5147,
      "num_input_tokens_seen": 20787927552,
      "step": 26422
    },
    {
      "epoch": 2.8032039040950565,
      "grad_norm": 0.4323908434404077,
      "learning_rate": 4.360067763906208e-05,
      "loss": 1.7806,
      "num_input_tokens_seen": 20788714224,
      "step": 26423
    },
    {
      "epoch": 2.8033099936346275,
      "grad_norm": 0.3830647584199332,
      "learning_rate": 4.360021328885104e-05,
      "loss": 1.6387,
      "num_input_tokens_seen": 20789501008,
      "step": 26424
    },
    {
      "epoch": 2.803416083174199,
      "grad_norm": 0.42661847286535465,
      "learning_rate": 4.3599748924266306e-05,
      "loss": 1.5527,
      "num_input_tokens_seen": 20790287824,
      "step": 26425
    },
    {
      "epoch": 2.8035221727137705,
      "grad_norm": 0.39722718267577006,
      "learning_rate": 4.359928454530823e-05,
      "loss": 1.6213,
      "num_input_tokens_seen": 20791074512,
      "step": 26426
    },
    {
      "epoch": 2.803628262253342,
      "grad_norm": 0.4659053353351567,
      "learning_rate": 4.3598820151977174e-05,
      "loss": 1.7216,
      "num_input_tokens_seen": 20791861168,
      "step": 26427
    },
    {
      "epoch": 2.8037343517929134,
      "grad_norm": 0.4059368827520282,
      "learning_rate": 4.3598355744273495e-05,
      "loss": 1.5943,
      "num_input_tokens_seen": 20792647904,
      "step": 26428
    },
    {
      "epoch": 2.8038404413324844,
      "grad_norm": 0.3943007229335599,
      "learning_rate": 4.359789132219755e-05,
      "loss": 1.502,
      "num_input_tokens_seen": 20793434608,
      "step": 26429
    },
    {
      "epoch": 2.803946530872056,
      "grad_norm": 0.4655355903933016,
      "learning_rate": 4.359742688574971e-05,
      "loss": 1.5874,
      "num_input_tokens_seen": 20794221456,
      "step": 26430
    },
    {
      "epoch": 2.8040526204116274,
      "grad_norm": 0.38357282272352783,
      "learning_rate": 4.359696243493031e-05,
      "loss": 1.6624,
      "num_input_tokens_seen": 20795008192,
      "step": 26431
    },
    {
      "epoch": 2.804158709951199,
      "grad_norm": 0.4350284795582929,
      "learning_rate": 4.359649796973973e-05,
      "loss": 1.5453,
      "num_input_tokens_seen": 20795794944,
      "step": 26432
    },
    {
      "epoch": 2.8042647994907703,
      "grad_norm": 0.391546121133153,
      "learning_rate": 4.359603349017832e-05,
      "loss": 1.5846,
      "num_input_tokens_seen": 20796581664,
      "step": 26433
    },
    {
      "epoch": 2.8043708890303414,
      "grad_norm": 0.5881222587644802,
      "learning_rate": 4.359556899624645e-05,
      "loss": 1.7219,
      "num_input_tokens_seen": 20797368336,
      "step": 26434
    },
    {
      "epoch": 2.804476978569913,
      "grad_norm": 0.35316082513344427,
      "learning_rate": 4.359510448794446e-05,
      "loss": 1.6712,
      "num_input_tokens_seen": 20798155088,
      "step": 26435
    },
    {
      "epoch": 2.8045830681094843,
      "grad_norm": 0.5159857736271427,
      "learning_rate": 4.359463996527272e-05,
      "loss": 1.5568,
      "num_input_tokens_seen": 20798941808,
      "step": 26436
    },
    {
      "epoch": 2.804689157649056,
      "grad_norm": 0.41561728408583565,
      "learning_rate": 4.359417542823159e-05,
      "loss": 1.6025,
      "num_input_tokens_seen": 20799728656,
      "step": 26437
    },
    {
      "epoch": 2.8047952471886273,
      "grad_norm": 0.3490374027065658,
      "learning_rate": 4.3593710876821425e-05,
      "loss": 1.5992,
      "num_input_tokens_seen": 20800515456,
      "step": 26438
    },
    {
      "epoch": 2.8049013367281987,
      "grad_norm": 0.44104936008403794,
      "learning_rate": 4.359324631104259e-05,
      "loss": 1.6474,
      "num_input_tokens_seen": 20801302240,
      "step": 26439
    },
    {
      "epoch": 2.80500742626777,
      "grad_norm": 0.4572190841691302,
      "learning_rate": 4.3592781730895435e-05,
      "loss": 1.5335,
      "num_input_tokens_seen": 20802089072,
      "step": 26440
    },
    {
      "epoch": 2.8051135158073413,
      "grad_norm": 0.36201860693370363,
      "learning_rate": 4.359231713638032e-05,
      "loss": 1.5904,
      "num_input_tokens_seen": 20802875888,
      "step": 26441
    },
    {
      "epoch": 2.8052196053469127,
      "grad_norm": 0.4952955693663134,
      "learning_rate": 4.3591852527497615e-05,
      "loss": 1.5893,
      "num_input_tokens_seen": 20803662592,
      "step": 26442
    },
    {
      "epoch": 2.805325694886484,
      "grad_norm": 0.3722504976776751,
      "learning_rate": 4.359138790424767e-05,
      "loss": 1.5832,
      "num_input_tokens_seen": 20804449360,
      "step": 26443
    },
    {
      "epoch": 2.8054317844260557,
      "grad_norm": 0.4230156788992275,
      "learning_rate": 4.3590923266630846e-05,
      "loss": 1.5106,
      "num_input_tokens_seen": 20805236096,
      "step": 26444
    },
    {
      "epoch": 2.805537873965627,
      "grad_norm": 0.4085970153125649,
      "learning_rate": 4.359045861464751e-05,
      "loss": 1.5577,
      "num_input_tokens_seen": 20806022816,
      "step": 26445
    },
    {
      "epoch": 2.805643963505198,
      "grad_norm": 0.4019580669693204,
      "learning_rate": 4.3589993948298e-05,
      "loss": 1.6186,
      "num_input_tokens_seen": 20806809584,
      "step": 26446
    },
    {
      "epoch": 2.8057500530447697,
      "grad_norm": 0.4791282177546208,
      "learning_rate": 4.3589529267582695e-05,
      "loss": 1.5579,
      "num_input_tokens_seen": 20807596384,
      "step": 26447
    },
    {
      "epoch": 2.805856142584341,
      "grad_norm": 0.4222090824664882,
      "learning_rate": 4.3589064572501946e-05,
      "loss": 1.6555,
      "num_input_tokens_seen": 20808383168,
      "step": 26448
    },
    {
      "epoch": 2.8059622321239126,
      "grad_norm": 0.38958280179314647,
      "learning_rate": 4.358859986305611e-05,
      "loss": 1.6314,
      "num_input_tokens_seen": 20809169856,
      "step": 26449
    },
    {
      "epoch": 2.806068321663484,
      "grad_norm": 0.48507112437367783,
      "learning_rate": 4.3588135139245555e-05,
      "loss": 1.6154,
      "num_input_tokens_seen": 20809956624,
      "step": 26450
    },
    {
      "epoch": 2.806174411203055,
      "grad_norm": 0.45169750878187875,
      "learning_rate": 4.3587670401070637e-05,
      "loss": 1.5656,
      "num_input_tokens_seen": 20810743280,
      "step": 26451
    },
    {
      "epoch": 2.806280500742627,
      "grad_norm": 0.38373286132234863,
      "learning_rate": 4.3587205648531706e-05,
      "loss": 1.5224,
      "num_input_tokens_seen": 20811530032,
      "step": 26452
    },
    {
      "epoch": 2.806386590282198,
      "grad_norm": 0.57838891568077,
      "learning_rate": 4.358674088162913e-05,
      "loss": 1.6723,
      "num_input_tokens_seen": 20812316784,
      "step": 26453
    },
    {
      "epoch": 2.8064926798217695,
      "grad_norm": 1.626704574905826,
      "learning_rate": 4.358627610036327e-05,
      "loss": 1.636,
      "num_input_tokens_seen": 20813103552,
      "step": 26454
    },
    {
      "epoch": 2.806598769361341,
      "grad_norm": 0.3526149213275782,
      "learning_rate": 4.358581130473447e-05,
      "loss": 1.4498,
      "num_input_tokens_seen": 20813890352,
      "step": 26455
    },
    {
      "epoch": 2.8067048589009125,
      "grad_norm": 1.0292075874799262,
      "learning_rate": 4.3585346494743105e-05,
      "loss": 1.6191,
      "num_input_tokens_seen": 20814677168,
      "step": 26456
    },
    {
      "epoch": 2.806810948440484,
      "grad_norm": 0.5944589843640107,
      "learning_rate": 4.358488167038953e-05,
      "loss": 1.6345,
      "num_input_tokens_seen": 20815463952,
      "step": 26457
    },
    {
      "epoch": 2.806917037980055,
      "grad_norm": 0.5027811915456653,
      "learning_rate": 4.3584416831674105e-05,
      "loss": 1.5653,
      "num_input_tokens_seen": 20816250688,
      "step": 26458
    },
    {
      "epoch": 2.8070231275196265,
      "grad_norm": 0.39062204287920005,
      "learning_rate": 4.3583951978597195e-05,
      "loss": 1.552,
      "num_input_tokens_seen": 20817037440,
      "step": 26459
    },
    {
      "epoch": 2.807129217059198,
      "grad_norm": 0.7815841574490343,
      "learning_rate": 4.358348711115914e-05,
      "loss": 1.6716,
      "num_input_tokens_seen": 20817824176,
      "step": 26460
    },
    {
      "epoch": 2.8072353065987694,
      "grad_norm": 0.49981331372103643,
      "learning_rate": 4.358302222936032e-05,
      "loss": 1.5492,
      "num_input_tokens_seen": 20818610976,
      "step": 26461
    },
    {
      "epoch": 2.807341396138341,
      "grad_norm": 0.9500034575291884,
      "learning_rate": 4.358255733320108e-05,
      "loss": 1.6231,
      "num_input_tokens_seen": 20819397776,
      "step": 26462
    },
    {
      "epoch": 2.807447485677912,
      "grad_norm": 0.6628434374608093,
      "learning_rate": 4.358209242268179e-05,
      "loss": 1.5711,
      "num_input_tokens_seen": 20820184592,
      "step": 26463
    },
    {
      "epoch": 2.807553575217484,
      "grad_norm": 1.0105560830826505,
      "learning_rate": 4.3581627497802805e-05,
      "loss": 1.6102,
      "num_input_tokens_seen": 20820971312,
      "step": 26464
    },
    {
      "epoch": 2.807659664757055,
      "grad_norm": 0.8045149640283862,
      "learning_rate": 4.358116255856448e-05,
      "loss": 1.6135,
      "num_input_tokens_seen": 20821758000,
      "step": 26465
    },
    {
      "epoch": 2.8077657542966263,
      "grad_norm": 3.1744991661457367,
      "learning_rate": 4.358069760496717e-05,
      "loss": 1.686,
      "num_input_tokens_seen": 20822544768,
      "step": 26466
    },
    {
      "epoch": 2.807871843836198,
      "grad_norm": 0.7331443611227523,
      "learning_rate": 4.358023263701125e-05,
      "loss": 1.6535,
      "num_input_tokens_seen": 20823331536,
      "step": 26467
    },
    {
      "epoch": 2.8079779333757693,
      "grad_norm": 2.169721185813313,
      "learning_rate": 4.3579767654697076e-05,
      "loss": 1.5885,
      "num_input_tokens_seen": 20824118272,
      "step": 26468
    },
    {
      "epoch": 2.8080840229153408,
      "grad_norm": 0.519326968121242,
      "learning_rate": 4.3579302658025e-05,
      "loss": 1.599,
      "num_input_tokens_seen": 20824905088,
      "step": 26469
    },
    {
      "epoch": 2.808190112454912,
      "grad_norm": 0.9070689863731183,
      "learning_rate": 4.357883764699539e-05,
      "loss": 1.5779,
      "num_input_tokens_seen": 20825691888,
      "step": 26470
    },
    {
      "epoch": 2.8082962019944833,
      "grad_norm": 0.5204732351082001,
      "learning_rate": 4.357837262160858e-05,
      "loss": 1.5125,
      "num_input_tokens_seen": 20826478768,
      "step": 26471
    },
    {
      "epoch": 2.8084022915340547,
      "grad_norm": 0.6598563663492881,
      "learning_rate": 4.357790758186496e-05,
      "loss": 1.4798,
      "num_input_tokens_seen": 20827265536,
      "step": 26472
    },
    {
      "epoch": 2.808508381073626,
      "grad_norm": 0.6443221266667705,
      "learning_rate": 4.3577442527764886e-05,
      "loss": 1.649,
      "num_input_tokens_seen": 20828052320,
      "step": 26473
    },
    {
      "epoch": 2.8086144706131977,
      "grad_norm": 0.4770905615248406,
      "learning_rate": 4.35769774593087e-05,
      "loss": 1.6119,
      "num_input_tokens_seen": 20828839008,
      "step": 26474
    },
    {
      "epoch": 2.8087205601527687,
      "grad_norm": 0.6716954006108591,
      "learning_rate": 4.357651237649677e-05,
      "loss": 1.547,
      "num_input_tokens_seen": 20829625792,
      "step": 26475
    },
    {
      "epoch": 2.80882664969234,
      "grad_norm": 0.4507194853805812,
      "learning_rate": 4.3576047279329456e-05,
      "loss": 1.5905,
      "num_input_tokens_seen": 20830412544,
      "step": 26476
    },
    {
      "epoch": 2.8089327392319117,
      "grad_norm": 0.5314973425304657,
      "learning_rate": 4.357558216780713e-05,
      "loss": 1.5683,
      "num_input_tokens_seen": 20831199312,
      "step": 26477
    },
    {
      "epoch": 2.809038828771483,
      "grad_norm": 0.6309929197364338,
      "learning_rate": 4.3575117041930125e-05,
      "loss": 1.7445,
      "num_input_tokens_seen": 20831986064,
      "step": 26478
    },
    {
      "epoch": 2.8091449183110546,
      "grad_norm": 0.41371228498664353,
      "learning_rate": 4.357465190169882e-05,
      "loss": 1.4873,
      "num_input_tokens_seen": 20832772800,
      "step": 26479
    },
    {
      "epoch": 2.809251007850626,
      "grad_norm": 0.6335442330848029,
      "learning_rate": 4.357418674711357e-05,
      "loss": 1.512,
      "num_input_tokens_seen": 20833559616,
      "step": 26480
    },
    {
      "epoch": 2.8093570973901976,
      "grad_norm": 0.43110266113751183,
      "learning_rate": 4.357372157817473e-05,
      "loss": 1.5342,
      "num_input_tokens_seen": 20834346400,
      "step": 26481
    },
    {
      "epoch": 2.8094631869297686,
      "grad_norm": 0.4979246480309474,
      "learning_rate": 4.3573256394882665e-05,
      "loss": 1.6141,
      "num_input_tokens_seen": 20835133120,
      "step": 26482
    },
    {
      "epoch": 2.80956927646934,
      "grad_norm": 0.5389265956167765,
      "learning_rate": 4.357279119723774e-05,
      "loss": 1.4938,
      "num_input_tokens_seen": 20835919904,
      "step": 26483
    },
    {
      "epoch": 2.8096753660089115,
      "grad_norm": 0.39295141163726427,
      "learning_rate": 4.3572325985240296e-05,
      "loss": 1.5355,
      "num_input_tokens_seen": 20836706688,
      "step": 26484
    },
    {
      "epoch": 2.809781455548483,
      "grad_norm": 0.4631074059661056,
      "learning_rate": 4.3571860758890705e-05,
      "loss": 1.6197,
      "num_input_tokens_seen": 20837493552,
      "step": 26485
    },
    {
      "epoch": 2.8098875450880545,
      "grad_norm": 0.3872693401305708,
      "learning_rate": 4.3571395518189326e-05,
      "loss": 1.4443,
      "num_input_tokens_seen": 20838280384,
      "step": 26486
    },
    {
      "epoch": 2.8099936346276255,
      "grad_norm": 0.4370145675458081,
      "learning_rate": 4.357093026313652e-05,
      "loss": 1.5558,
      "num_input_tokens_seen": 20839067200,
      "step": 26487
    },
    {
      "epoch": 2.810099724167197,
      "grad_norm": 0.4748521487979508,
      "learning_rate": 4.357046499373264e-05,
      "loss": 1.5361,
      "num_input_tokens_seen": 20839853952,
      "step": 26488
    },
    {
      "epoch": 2.8102058137067685,
      "grad_norm": 0.37513191180961863,
      "learning_rate": 4.356999970997805e-05,
      "loss": 1.5377,
      "num_input_tokens_seen": 20840640592,
      "step": 26489
    },
    {
      "epoch": 2.81031190324634,
      "grad_norm": 0.47685137852925735,
      "learning_rate": 4.3569534411873115e-05,
      "loss": 1.6493,
      "num_input_tokens_seen": 20841427376,
      "step": 26490
    },
    {
      "epoch": 2.8104179927859114,
      "grad_norm": 0.4513260332088351,
      "learning_rate": 4.3569069099418186e-05,
      "loss": 1.7371,
      "num_input_tokens_seen": 20842214048,
      "step": 26491
    },
    {
      "epoch": 2.8105240823254825,
      "grad_norm": 0.3929750873778155,
      "learning_rate": 4.3568603772613625e-05,
      "loss": 1.4793,
      "num_input_tokens_seen": 20843000816,
      "step": 26492
    },
    {
      "epoch": 2.8106301718650544,
      "grad_norm": 0.46089414231748593,
      "learning_rate": 4.356813843145979e-05,
      "loss": 1.7179,
      "num_input_tokens_seen": 20843787616,
      "step": 26493
    },
    {
      "epoch": 2.8107362614046254,
      "grad_norm": 0.49704308254130825,
      "learning_rate": 4.356767307595704e-05,
      "loss": 1.6861,
      "num_input_tokens_seen": 20844574304,
      "step": 26494
    },
    {
      "epoch": 2.810842350944197,
      "grad_norm": 0.45987595311203044,
      "learning_rate": 4.356720770610574e-05,
      "loss": 1.5531,
      "num_input_tokens_seen": 20845361120,
      "step": 26495
    },
    {
      "epoch": 2.8109484404837684,
      "grad_norm": 0.5247270944816946,
      "learning_rate": 4.356674232190625e-05,
      "loss": 1.7217,
      "num_input_tokens_seen": 20846147984,
      "step": 26496
    },
    {
      "epoch": 2.81105453002334,
      "grad_norm": 0.5174988669486662,
      "learning_rate": 4.356627692335893e-05,
      "loss": 1.8283,
      "num_input_tokens_seen": 20846934672,
      "step": 26497
    },
    {
      "epoch": 2.8111606195629113,
      "grad_norm": 0.5318393226151623,
      "learning_rate": 4.356581151046413e-05,
      "loss": 1.4827,
      "num_input_tokens_seen": 20847721440,
      "step": 26498
    },
    {
      "epoch": 2.8112667091024823,
      "grad_norm": 0.4955718612680948,
      "learning_rate": 4.356534608322221e-05,
      "loss": 1.6233,
      "num_input_tokens_seen": 20848508160,
      "step": 26499
    },
    {
      "epoch": 2.811372798642054,
      "grad_norm": 0.3911198096614944,
      "learning_rate": 4.356488064163354e-05,
      "loss": 1.6817,
      "num_input_tokens_seen": 20849294912,
      "step": 26500
    },
    {
      "epoch": 2.8114788881816253,
      "grad_norm": 0.46055978547549115,
      "learning_rate": 4.356441518569847e-05,
      "loss": 1.549,
      "num_input_tokens_seen": 20850081680,
      "step": 26501
    },
    {
      "epoch": 2.8115849777211968,
      "grad_norm": 0.4025004949297899,
      "learning_rate": 4.3563949715417375e-05,
      "loss": 1.6693,
      "num_input_tokens_seen": 20850868400,
      "step": 26502
    },
    {
      "epoch": 2.8116910672607682,
      "grad_norm": 0.4083233829578259,
      "learning_rate": 4.35634842307906e-05,
      "loss": 1.6527,
      "num_input_tokens_seen": 20851655184,
      "step": 26503
    },
    {
      "epoch": 2.8117971568003393,
      "grad_norm": 0.44525118380722856,
      "learning_rate": 4.356301873181851e-05,
      "loss": 1.6319,
      "num_input_tokens_seen": 20852442032,
      "step": 26504
    },
    {
      "epoch": 2.8119032463399107,
      "grad_norm": 0.4161218490871048,
      "learning_rate": 4.356255321850146e-05,
      "loss": 1.5441,
      "num_input_tokens_seen": 20853228784,
      "step": 26505
    },
    {
      "epoch": 2.812009335879482,
      "grad_norm": 0.3883818924338207,
      "learning_rate": 4.356208769083981e-05,
      "loss": 1.492,
      "num_input_tokens_seen": 20854015616,
      "step": 26506
    },
    {
      "epoch": 2.8121154254190537,
      "grad_norm": 0.49124919831324015,
      "learning_rate": 4.3561622148833935e-05,
      "loss": 1.6686,
      "num_input_tokens_seen": 20854802464,
      "step": 26507
    },
    {
      "epoch": 2.812221514958625,
      "grad_norm": 0.4051787297755992,
      "learning_rate": 4.3561156592484177e-05,
      "loss": 1.6159,
      "num_input_tokens_seen": 20855589232,
      "step": 26508
    },
    {
      "epoch": 2.8123276044981966,
      "grad_norm": 0.6364225151144224,
      "learning_rate": 4.35606910217909e-05,
      "loss": 1.6727,
      "num_input_tokens_seen": 20856376048,
      "step": 26509
    },
    {
      "epoch": 2.812433694037768,
      "grad_norm": 0.4395714053675122,
      "learning_rate": 4.3560225436754465e-05,
      "loss": 1.7229,
      "num_input_tokens_seen": 20857162816,
      "step": 26510
    },
    {
      "epoch": 2.812539783577339,
      "grad_norm": 0.578851267483874,
      "learning_rate": 4.355975983737524e-05,
      "loss": 1.6832,
      "num_input_tokens_seen": 20857949568,
      "step": 26511
    },
    {
      "epoch": 2.8126458731169106,
      "grad_norm": 0.3637260538597028,
      "learning_rate": 4.3559294223653566e-05,
      "loss": 1.5316,
      "num_input_tokens_seen": 20858736352,
      "step": 26512
    },
    {
      "epoch": 2.812751962656482,
      "grad_norm": 0.7229817247469433,
      "learning_rate": 4.3558828595589825e-05,
      "loss": 1.6242,
      "num_input_tokens_seen": 20859523136,
      "step": 26513
    },
    {
      "epoch": 2.8128580521960536,
      "grad_norm": 0.4172308456470313,
      "learning_rate": 4.355836295318436e-05,
      "loss": 1.539,
      "num_input_tokens_seen": 20860309920,
      "step": 26514
    },
    {
      "epoch": 2.812964141735625,
      "grad_norm": 0.5381406764275609,
      "learning_rate": 4.3557897296437534e-05,
      "loss": 1.6401,
      "num_input_tokens_seen": 20861096608,
      "step": 26515
    },
    {
      "epoch": 2.813070231275196,
      "grad_norm": 0.3966826572305087,
      "learning_rate": 4.3557431625349716e-05,
      "loss": 1.6341,
      "num_input_tokens_seen": 20861883408,
      "step": 26516
    },
    {
      "epoch": 2.8131763208147675,
      "grad_norm": 0.4250763214482686,
      "learning_rate": 4.355696593992126e-05,
      "loss": 1.6463,
      "num_input_tokens_seen": 20862670128,
      "step": 26517
    },
    {
      "epoch": 2.813282410354339,
      "grad_norm": 0.404632475010541,
      "learning_rate": 4.355650024015251e-05,
      "loss": 1.6283,
      "num_input_tokens_seen": 20863456864,
      "step": 26518
    },
    {
      "epoch": 2.8133884998939105,
      "grad_norm": 0.551894496990997,
      "learning_rate": 4.3556034526043856e-05,
      "loss": 1.5673,
      "num_input_tokens_seen": 20864243712,
      "step": 26519
    },
    {
      "epoch": 2.813494589433482,
      "grad_norm": 0.42721515643402497,
      "learning_rate": 4.3555568797595645e-05,
      "loss": 1.5258,
      "num_input_tokens_seen": 20865030480,
      "step": 26520
    },
    {
      "epoch": 2.813600678973053,
      "grad_norm": 0.4750699759014181,
      "learning_rate": 4.355510305480822e-05,
      "loss": 1.6923,
      "num_input_tokens_seen": 20865817200,
      "step": 26521
    },
    {
      "epoch": 2.813706768512625,
      "grad_norm": 0.38442543877362023,
      "learning_rate": 4.355463729768196e-05,
      "loss": 1.5389,
      "num_input_tokens_seen": 20866604016,
      "step": 26522
    },
    {
      "epoch": 2.813812858052196,
      "grad_norm": 0.4349370412826976,
      "learning_rate": 4.355417152621724e-05,
      "loss": 1.6594,
      "num_input_tokens_seen": 20867390656,
      "step": 26523
    },
    {
      "epoch": 2.8139189475917674,
      "grad_norm": 0.4829142082729642,
      "learning_rate": 4.3553705740414386e-05,
      "loss": 1.534,
      "num_input_tokens_seen": 20868177408,
      "step": 26524
    },
    {
      "epoch": 2.814025037131339,
      "grad_norm": 0.501396855593386,
      "learning_rate": 4.355323994027377e-05,
      "loss": 1.7288,
      "num_input_tokens_seen": 20868964224,
      "step": 26525
    },
    {
      "epoch": 2.8141311266709104,
      "grad_norm": 0.41588942964390097,
      "learning_rate": 4.355277412579576e-05,
      "loss": 1.6335,
      "num_input_tokens_seen": 20869751040,
      "step": 26526
    },
    {
      "epoch": 2.814237216210482,
      "grad_norm": 0.6862879755474174,
      "learning_rate": 4.3552308296980703e-05,
      "loss": 1.7387,
      "num_input_tokens_seen": 20870537728,
      "step": 26527
    },
    {
      "epoch": 2.814343305750053,
      "grad_norm": 0.37517420752430164,
      "learning_rate": 4.355184245382897e-05,
      "loss": 1.5688,
      "num_input_tokens_seen": 20871324480,
      "step": 26528
    },
    {
      "epoch": 2.8144493952896243,
      "grad_norm": 0.5514031473653692,
      "learning_rate": 4.355137659634092e-05,
      "loss": 1.5439,
      "num_input_tokens_seen": 20872111168,
      "step": 26529
    },
    {
      "epoch": 2.814555484829196,
      "grad_norm": 0.43386099444618764,
      "learning_rate": 4.355091072451691e-05,
      "loss": 1.591,
      "num_input_tokens_seen": 20872897888,
      "step": 26530
    },
    {
      "epoch": 2.8146615743687673,
      "grad_norm": 0.5952294429834087,
      "learning_rate": 4.3550444838357306e-05,
      "loss": 1.5773,
      "num_input_tokens_seen": 20873684640,
      "step": 26531
    },
    {
      "epoch": 2.8147676639083388,
      "grad_norm": 0.3875743769767284,
      "learning_rate": 4.354997893786246e-05,
      "loss": 1.5381,
      "num_input_tokens_seen": 20874471408,
      "step": 26532
    },
    {
      "epoch": 2.81487375344791,
      "grad_norm": 0.4173477953255852,
      "learning_rate": 4.3549513023032726e-05,
      "loss": 1.6823,
      "num_input_tokens_seen": 20875258176,
      "step": 26533
    },
    {
      "epoch": 2.8149798429874813,
      "grad_norm": 0.46115932344984883,
      "learning_rate": 4.354904709386848e-05,
      "loss": 1.5905,
      "num_input_tokens_seen": 20876044832,
      "step": 26534
    },
    {
      "epoch": 2.8150859325270527,
      "grad_norm": 0.42846133393089075,
      "learning_rate": 4.354858115037007e-05,
      "loss": 1.5479,
      "num_input_tokens_seen": 20876831600,
      "step": 26535
    },
    {
      "epoch": 2.8151920220666242,
      "grad_norm": 0.3689208142710258,
      "learning_rate": 4.3548115192537865e-05,
      "loss": 1.6237,
      "num_input_tokens_seen": 20877618336,
      "step": 26536
    },
    {
      "epoch": 2.8152981116061957,
      "grad_norm": 0.43358704740306336,
      "learning_rate": 4.354764922037221e-05,
      "loss": 1.5988,
      "num_input_tokens_seen": 20878405040,
      "step": 26537
    },
    {
      "epoch": 2.815404201145767,
      "grad_norm": 0.3974311098093186,
      "learning_rate": 4.354718323387349e-05,
      "loss": 1.6349,
      "num_input_tokens_seen": 20879191792,
      "step": 26538
    },
    {
      "epoch": 2.8155102906853386,
      "grad_norm": 0.41672775107001075,
      "learning_rate": 4.354671723304205e-05,
      "loss": 1.6325,
      "num_input_tokens_seen": 20879978576,
      "step": 26539
    },
    {
      "epoch": 2.8156163802249097,
      "grad_norm": 0.47773479745683867,
      "learning_rate": 4.354625121787824e-05,
      "loss": 1.6154,
      "num_input_tokens_seen": 20880765376,
      "step": 26540
    },
    {
      "epoch": 2.815722469764481,
      "grad_norm": 0.3990850610673719,
      "learning_rate": 4.354578518838244e-05,
      "loss": 1.5815,
      "num_input_tokens_seen": 20881552096,
      "step": 26541
    },
    {
      "epoch": 2.8158285593040526,
      "grad_norm": 0.439898735626559,
      "learning_rate": 4.3545319144555005e-05,
      "loss": 1.6087,
      "num_input_tokens_seen": 20882338896,
      "step": 26542
    },
    {
      "epoch": 2.815934648843624,
      "grad_norm": 0.4536520818379167,
      "learning_rate": 4.3544853086396285e-05,
      "loss": 1.6165,
      "num_input_tokens_seen": 20883125552,
      "step": 26543
    },
    {
      "epoch": 2.8160407383831956,
      "grad_norm": 0.4096304043150812,
      "learning_rate": 4.354438701390665e-05,
      "loss": 1.5843,
      "num_input_tokens_seen": 20883912400,
      "step": 26544
    },
    {
      "epoch": 2.8161468279227666,
      "grad_norm": 0.49956791731731354,
      "learning_rate": 4.3543920927086454e-05,
      "loss": 1.6552,
      "num_input_tokens_seen": 20884699136,
      "step": 26545
    },
    {
      "epoch": 2.816252917462338,
      "grad_norm": 0.4007662108236322,
      "learning_rate": 4.354345482593606e-05,
      "loss": 1.4317,
      "num_input_tokens_seen": 20885486000,
      "step": 26546
    },
    {
      "epoch": 2.8163590070019096,
      "grad_norm": 0.5264597006582035,
      "learning_rate": 4.354298871045583e-05,
      "loss": 1.6822,
      "num_input_tokens_seen": 20886272720,
      "step": 26547
    },
    {
      "epoch": 2.816465096541481,
      "grad_norm": 0.43794053772256375,
      "learning_rate": 4.354252258064612e-05,
      "loss": 1.6516,
      "num_input_tokens_seen": 20887059312,
      "step": 26548
    },
    {
      "epoch": 2.8165711860810525,
      "grad_norm": 0.5071276678034856,
      "learning_rate": 4.354205643650729e-05,
      "loss": 1.5921,
      "num_input_tokens_seen": 20887846080,
      "step": 26549
    },
    {
      "epoch": 2.8166772756206235,
      "grad_norm": 0.4005395283023414,
      "learning_rate": 4.354159027803971e-05,
      "loss": 1.6278,
      "num_input_tokens_seen": 20888632768,
      "step": 26550
    },
    {
      "epoch": 2.8167833651601955,
      "grad_norm": 0.38084879965214924,
      "learning_rate": 4.354112410524373e-05,
      "loss": 1.6771,
      "num_input_tokens_seen": 20889419488,
      "step": 26551
    },
    {
      "epoch": 2.8168894546997665,
      "grad_norm": 0.4279604772607066,
      "learning_rate": 4.354065791811971e-05,
      "loss": 1.51,
      "num_input_tokens_seen": 20890206336,
      "step": 26552
    },
    {
      "epoch": 2.816995544239338,
      "grad_norm": 0.43741435044275073,
      "learning_rate": 4.354019171666802e-05,
      "loss": 1.5489,
      "num_input_tokens_seen": 20890993072,
      "step": 26553
    },
    {
      "epoch": 2.8171016337789094,
      "grad_norm": 0.573854444265047,
      "learning_rate": 4.353972550088901e-05,
      "loss": 1.6255,
      "num_input_tokens_seen": 20891779872,
      "step": 26554
    },
    {
      "epoch": 2.817207723318481,
      "grad_norm": 0.3843481209024628,
      "learning_rate": 4.353925927078304e-05,
      "loss": 1.6185,
      "num_input_tokens_seen": 20892566544,
      "step": 26555
    },
    {
      "epoch": 2.8173138128580524,
      "grad_norm": 0.3849128100441632,
      "learning_rate": 4.353879302635049e-05,
      "loss": 1.516,
      "num_input_tokens_seen": 20893353312,
      "step": 26556
    },
    {
      "epoch": 2.8174199023976234,
      "grad_norm": 0.3985147603967328,
      "learning_rate": 4.3538326767591686e-05,
      "loss": 1.6263,
      "num_input_tokens_seen": 20894140000,
      "step": 26557
    },
    {
      "epoch": 2.817525991937195,
      "grad_norm": 0.32567079890735157,
      "learning_rate": 4.353786049450702e-05,
      "loss": 1.4728,
      "num_input_tokens_seen": 20894926864,
      "step": 26558
    },
    {
      "epoch": 2.8176320814767664,
      "grad_norm": 0.4246780803710281,
      "learning_rate": 4.353739420709683e-05,
      "loss": 1.5669,
      "num_input_tokens_seen": 20895713584,
      "step": 26559
    },
    {
      "epoch": 2.817738171016338,
      "grad_norm": 0.3735607548025116,
      "learning_rate": 4.353692790536149e-05,
      "loss": 1.5491,
      "num_input_tokens_seen": 20896500320,
      "step": 26560
    },
    {
      "epoch": 2.8178442605559093,
      "grad_norm": 0.4105582206227182,
      "learning_rate": 4.353646158930136e-05,
      "loss": 1.5676,
      "num_input_tokens_seen": 20897287136,
      "step": 26561
    },
    {
      "epoch": 2.8179503500954803,
      "grad_norm": 0.3596876515816072,
      "learning_rate": 4.353599525891679e-05,
      "loss": 1.4479,
      "num_input_tokens_seen": 20898073984,
      "step": 26562
    },
    {
      "epoch": 2.8180564396350523,
      "grad_norm": 0.4327451522119734,
      "learning_rate": 4.353552891420815e-05,
      "loss": 1.6724,
      "num_input_tokens_seen": 20898860704,
      "step": 26563
    },
    {
      "epoch": 2.8181625291746233,
      "grad_norm": 0.5447044862856155,
      "learning_rate": 4.35350625551758e-05,
      "loss": 1.6218,
      "num_input_tokens_seen": 20899647456,
      "step": 26564
    },
    {
      "epoch": 2.8182686187141948,
      "grad_norm": 0.5568851850348516,
      "learning_rate": 4.3534596181820085e-05,
      "loss": 1.6787,
      "num_input_tokens_seen": 20900434208,
      "step": 26565
    },
    {
      "epoch": 2.8183747082537662,
      "grad_norm": 0.4830729141448435,
      "learning_rate": 4.353412979414139e-05,
      "loss": 1.7026,
      "num_input_tokens_seen": 20901220928,
      "step": 26566
    },
    {
      "epoch": 2.8184807977933377,
      "grad_norm": 0.4510756370501354,
      "learning_rate": 4.353366339214006e-05,
      "loss": 1.5846,
      "num_input_tokens_seen": 20902007712,
      "step": 26567
    },
    {
      "epoch": 2.818586887332909,
      "grad_norm": 0.5156910933218104,
      "learning_rate": 4.353319697581646e-05,
      "loss": 1.6158,
      "num_input_tokens_seen": 20902794512,
      "step": 26568
    },
    {
      "epoch": 2.81869297687248,
      "grad_norm": 0.37945528943190043,
      "learning_rate": 4.353273054517095e-05,
      "loss": 1.6419,
      "num_input_tokens_seen": 20903581216,
      "step": 26569
    },
    {
      "epoch": 2.8187990664120517,
      "grad_norm": 0.4830848256920506,
      "learning_rate": 4.353226410020389e-05,
      "loss": 1.5748,
      "num_input_tokens_seen": 20904367952,
      "step": 26570
    },
    {
      "epoch": 2.818905155951623,
      "grad_norm": 0.42965862840798347,
      "learning_rate": 4.353179764091563e-05,
      "loss": 1.547,
      "num_input_tokens_seen": 20905154704,
      "step": 26571
    },
    {
      "epoch": 2.8190112454911946,
      "grad_norm": 0.41852394924930536,
      "learning_rate": 4.353133116730655e-05,
      "loss": 1.6131,
      "num_input_tokens_seen": 20905941456,
      "step": 26572
    },
    {
      "epoch": 2.819117335030766,
      "grad_norm": 0.5599948333197612,
      "learning_rate": 4.3530864679377e-05,
      "loss": 1.645,
      "num_input_tokens_seen": 20906728224,
      "step": 26573
    },
    {
      "epoch": 2.819223424570337,
      "grad_norm": 0.3569701899234403,
      "learning_rate": 4.353039817712734e-05,
      "loss": 1.4816,
      "num_input_tokens_seen": 20907515104,
      "step": 26574
    },
    {
      "epoch": 2.8193295141099086,
      "grad_norm": 0.4995572753240544,
      "learning_rate": 4.3529931660557935e-05,
      "loss": 1.6807,
      "num_input_tokens_seen": 20908301904,
      "step": 26575
    },
    {
      "epoch": 2.81943560364948,
      "grad_norm": 0.5023140041081721,
      "learning_rate": 4.352946512966914e-05,
      "loss": 1.7488,
      "num_input_tokens_seen": 20909088624,
      "step": 26576
    },
    {
      "epoch": 2.8195416931890516,
      "grad_norm": 0.4115588958227865,
      "learning_rate": 4.3528998584461316e-05,
      "loss": 1.6722,
      "num_input_tokens_seen": 20909875360,
      "step": 26577
    },
    {
      "epoch": 2.819647782728623,
      "grad_norm": 0.5007285390526403,
      "learning_rate": 4.352853202493483e-05,
      "loss": 1.4798,
      "num_input_tokens_seen": 20910662096,
      "step": 26578
    },
    {
      "epoch": 2.8197538722681945,
      "grad_norm": 0.39341763152262127,
      "learning_rate": 4.352806545109003e-05,
      "loss": 1.5158,
      "num_input_tokens_seen": 20911448880,
      "step": 26579
    },
    {
      "epoch": 2.819859961807766,
      "grad_norm": 0.42502861214848353,
      "learning_rate": 4.35275988629273e-05,
      "loss": 1.6263,
      "num_input_tokens_seen": 20912235600,
      "step": 26580
    },
    {
      "epoch": 2.819966051347337,
      "grad_norm": 0.46428407483429246,
      "learning_rate": 4.352713226044697e-05,
      "loss": 1.6782,
      "num_input_tokens_seen": 20913022272,
      "step": 26581
    },
    {
      "epoch": 2.8200721408869085,
      "grad_norm": 0.4081339568234282,
      "learning_rate": 4.352666564364942e-05,
      "loss": 1.5852,
      "num_input_tokens_seen": 20913809088,
      "step": 26582
    },
    {
      "epoch": 2.82017823042648,
      "grad_norm": 0.5179727656306528,
      "learning_rate": 4.3526199012535004e-05,
      "loss": 1.6838,
      "num_input_tokens_seen": 20914595776,
      "step": 26583
    },
    {
      "epoch": 2.8202843199660514,
      "grad_norm": 0.48004400085054916,
      "learning_rate": 4.3525732367104096e-05,
      "loss": 1.6845,
      "num_input_tokens_seen": 20915382672,
      "step": 26584
    },
    {
      "epoch": 2.820390409505623,
      "grad_norm": 0.37937642635812246,
      "learning_rate": 4.352526570735703e-05,
      "loss": 1.6437,
      "num_input_tokens_seen": 20916169392,
      "step": 26585
    },
    {
      "epoch": 2.820496499045194,
      "grad_norm": 0.48515728702982697,
      "learning_rate": 4.352479903329419e-05,
      "loss": 1.6337,
      "num_input_tokens_seen": 20916956240,
      "step": 26586
    },
    {
      "epoch": 2.8206025885847654,
      "grad_norm": 0.41661949202503373,
      "learning_rate": 4.352433234491594e-05,
      "loss": 1.4907,
      "num_input_tokens_seen": 20917742896,
      "step": 26587
    },
    {
      "epoch": 2.820708678124337,
      "grad_norm": 0.39515743480007526,
      "learning_rate": 4.352386564222262e-05,
      "loss": 1.5752,
      "num_input_tokens_seen": 20918529648,
      "step": 26588
    },
    {
      "epoch": 2.8208147676639084,
      "grad_norm": 0.4908412185474374,
      "learning_rate": 4.3523398925214595e-05,
      "loss": 1.6009,
      "num_input_tokens_seen": 20919316416,
      "step": 26589
    },
    {
      "epoch": 2.82092085720348,
      "grad_norm": 0.3456325928514411,
      "learning_rate": 4.3522932193892236e-05,
      "loss": 1.5549,
      "num_input_tokens_seen": 20920103152,
      "step": 26590
    },
    {
      "epoch": 2.821026946743051,
      "grad_norm": 0.4092330697110499,
      "learning_rate": 4.35224654482559e-05,
      "loss": 1.5165,
      "num_input_tokens_seen": 20920890048,
      "step": 26591
    },
    {
      "epoch": 2.821133036282623,
      "grad_norm": 0.39169759202419674,
      "learning_rate": 4.352199868830594e-05,
      "loss": 1.4524,
      "num_input_tokens_seen": 20921676864,
      "step": 26592
    },
    {
      "epoch": 2.821239125822194,
      "grad_norm": 0.3986535784773747,
      "learning_rate": 4.352153191404273e-05,
      "loss": 1.4904,
      "num_input_tokens_seen": 20922463664,
      "step": 26593
    },
    {
      "epoch": 2.8213452153617653,
      "grad_norm": 0.42743010524651404,
      "learning_rate": 4.352106512546662e-05,
      "loss": 1.6038,
      "num_input_tokens_seen": 20923250368,
      "step": 26594
    },
    {
      "epoch": 2.8214513049013368,
      "grad_norm": 0.3856006876274857,
      "learning_rate": 4.3520598322577976e-05,
      "loss": 1.476,
      "num_input_tokens_seen": 20924037088,
      "step": 26595
    },
    {
      "epoch": 2.8215573944409083,
      "grad_norm": 0.3568601631262695,
      "learning_rate": 4.3520131505377155e-05,
      "loss": 1.5353,
      "num_input_tokens_seen": 20924823888,
      "step": 26596
    },
    {
      "epoch": 2.8216634839804797,
      "grad_norm": 0.4040378498894575,
      "learning_rate": 4.351966467386452e-05,
      "loss": 1.5614,
      "num_input_tokens_seen": 20925610704,
      "step": 26597
    },
    {
      "epoch": 2.8217695735200508,
      "grad_norm": 0.4327444558483534,
      "learning_rate": 4.351919782804043e-05,
      "loss": 1.5766,
      "num_input_tokens_seen": 20926397488,
      "step": 26598
    },
    {
      "epoch": 2.8218756630596222,
      "grad_norm": 0.39485221415446886,
      "learning_rate": 4.351873096790525e-05,
      "loss": 1.6832,
      "num_input_tokens_seen": 20927184304,
      "step": 26599
    },
    {
      "epoch": 2.8219817525991937,
      "grad_norm": 0.34971468893730534,
      "learning_rate": 4.351826409345934e-05,
      "loss": 1.4877,
      "num_input_tokens_seen": 20927971088,
      "step": 26600
    },
    {
      "epoch": 2.822087842138765,
      "grad_norm": 0.375338596693846,
      "learning_rate": 4.351779720470305e-05,
      "loss": 1.4766,
      "num_input_tokens_seen": 20928757872,
      "step": 26601
    },
    {
      "epoch": 2.8221939316783367,
      "grad_norm": 0.36727428525462,
      "learning_rate": 4.351733030163676e-05,
      "loss": 1.4782,
      "num_input_tokens_seen": 20929544656,
      "step": 26602
    },
    {
      "epoch": 2.8223000212179077,
      "grad_norm": 0.401343729687544,
      "learning_rate": 4.351686338426082e-05,
      "loss": 1.6279,
      "num_input_tokens_seen": 20930331472,
      "step": 26603
    },
    {
      "epoch": 2.822406110757479,
      "grad_norm": 0.33638575789286157,
      "learning_rate": 4.3516396452575584e-05,
      "loss": 1.4672,
      "num_input_tokens_seen": 20931118304,
      "step": 26604
    },
    {
      "epoch": 2.8225122002970506,
      "grad_norm": 0.4065246057140909,
      "learning_rate": 4.3515929506581424e-05,
      "loss": 1.6835,
      "num_input_tokens_seen": 20931905024,
      "step": 26605
    },
    {
      "epoch": 2.822618289836622,
      "grad_norm": 0.39866143489829087,
      "learning_rate": 4.3515462546278697e-05,
      "loss": 1.6969,
      "num_input_tokens_seen": 20932691792,
      "step": 26606
    },
    {
      "epoch": 2.8227243793761936,
      "grad_norm": 0.32725880424751697,
      "learning_rate": 4.351499557166776e-05,
      "loss": 1.5167,
      "num_input_tokens_seen": 20933478576,
      "step": 26607
    },
    {
      "epoch": 2.822830468915765,
      "grad_norm": 0.3598344210002596,
      "learning_rate": 4.351452858274898e-05,
      "loss": 1.5428,
      "num_input_tokens_seen": 20934265264,
      "step": 26608
    },
    {
      "epoch": 2.8229365584553365,
      "grad_norm": 0.36349540789998047,
      "learning_rate": 4.351406157952272e-05,
      "loss": 1.5446,
      "num_input_tokens_seen": 20935052032,
      "step": 26609
    },
    {
      "epoch": 2.8230426479949076,
      "grad_norm": 0.3832504820464499,
      "learning_rate": 4.351359456198933e-05,
      "loss": 1.6153,
      "num_input_tokens_seen": 20935838800,
      "step": 26610
    },
    {
      "epoch": 2.823148737534479,
      "grad_norm": 0.3553795809482344,
      "learning_rate": 4.351312753014918e-05,
      "loss": 1.6123,
      "num_input_tokens_seen": 20936625616,
      "step": 26611
    },
    {
      "epoch": 2.8232548270740505,
      "grad_norm": 0.3609619666241142,
      "learning_rate": 4.3512660484002634e-05,
      "loss": 1.5851,
      "num_input_tokens_seen": 20937412416,
      "step": 26612
    },
    {
      "epoch": 2.823360916613622,
      "grad_norm": 0.2928838781011801,
      "learning_rate": 4.351219342355004e-05,
      "loss": 1.3748,
      "num_input_tokens_seen": 20938199232,
      "step": 26613
    },
    {
      "epoch": 2.8234670061531935,
      "grad_norm": 0.3675563867545386,
      "learning_rate": 4.351172634879177e-05,
      "loss": 1.618,
      "num_input_tokens_seen": 20938986080,
      "step": 26614
    },
    {
      "epoch": 2.8235730956927645,
      "grad_norm": 0.37298005162318965,
      "learning_rate": 4.351125925972818e-05,
      "loss": 1.6581,
      "num_input_tokens_seen": 20939772704,
      "step": 26615
    },
    {
      "epoch": 2.823679185232336,
      "grad_norm": 0.37359752962779297,
      "learning_rate": 4.351079215635963e-05,
      "loss": 1.5838,
      "num_input_tokens_seen": 20940559520,
      "step": 26616
    },
    {
      "epoch": 2.8237852747719074,
      "grad_norm": 0.3427502420846836,
      "learning_rate": 4.3510325038686486e-05,
      "loss": 1.5753,
      "num_input_tokens_seen": 20941346208,
      "step": 26617
    },
    {
      "epoch": 2.823891364311479,
      "grad_norm": 0.37733269012096105,
      "learning_rate": 4.35098579067091e-05,
      "loss": 1.576,
      "num_input_tokens_seen": 20942133008,
      "step": 26618
    },
    {
      "epoch": 2.8239974538510504,
      "grad_norm": 0.36494580498254536,
      "learning_rate": 4.3509390760427847e-05,
      "loss": 1.4518,
      "num_input_tokens_seen": 20942919856,
      "step": 26619
    },
    {
      "epoch": 2.8241035433906214,
      "grad_norm": 0.3415349344433788,
      "learning_rate": 4.3508923599843074e-05,
      "loss": 1.5212,
      "num_input_tokens_seen": 20943706640,
      "step": 26620
    },
    {
      "epoch": 2.8242096329301933,
      "grad_norm": 0.34769537803721035,
      "learning_rate": 4.350845642495515e-05,
      "loss": 1.5614,
      "num_input_tokens_seen": 20944493472,
      "step": 26621
    },
    {
      "epoch": 2.8243157224697644,
      "grad_norm": 0.41425970413476504,
      "learning_rate": 4.350798923576443e-05,
      "loss": 1.6924,
      "num_input_tokens_seen": 20945280304,
      "step": 26622
    },
    {
      "epoch": 2.824421812009336,
      "grad_norm": 0.41922326522439696,
      "learning_rate": 4.350752203227129e-05,
      "loss": 1.6696,
      "num_input_tokens_seen": 20946067088,
      "step": 26623
    },
    {
      "epoch": 2.8245279015489073,
      "grad_norm": 0.3730124999351579,
      "learning_rate": 4.350705481447607e-05,
      "loss": 1.5168,
      "num_input_tokens_seen": 20946853824,
      "step": 26624
    },
    {
      "epoch": 2.824633991088479,
      "grad_norm": 0.4194550667155093,
      "learning_rate": 4.350658758237914e-05,
      "loss": 1.5546,
      "num_input_tokens_seen": 20947640528,
      "step": 26625
    },
    {
      "epoch": 2.8247400806280503,
      "grad_norm": 0.4582568374908869,
      "learning_rate": 4.350612033598087e-05,
      "loss": 1.585,
      "num_input_tokens_seen": 20948427280,
      "step": 26626
    },
    {
      "epoch": 2.8248461701676213,
      "grad_norm": 0.40343577064123953,
      "learning_rate": 4.35056530752816e-05,
      "loss": 1.5051,
      "num_input_tokens_seen": 20949214160,
      "step": 26627
    },
    {
      "epoch": 2.8249522597071928,
      "grad_norm": 0.4553055044671327,
      "learning_rate": 4.350518580028172e-05,
      "loss": 1.5203,
      "num_input_tokens_seen": 20950001040,
      "step": 26628
    },
    {
      "epoch": 2.8250583492467642,
      "grad_norm": 0.39324878189314133,
      "learning_rate": 4.350471851098157e-05,
      "loss": 1.6664,
      "num_input_tokens_seen": 20950787808,
      "step": 26629
    },
    {
      "epoch": 2.8251644387863357,
      "grad_norm": 0.3691995663826492,
      "learning_rate": 4.350425120738151e-05,
      "loss": 1.6412,
      "num_input_tokens_seen": 20951574544,
      "step": 26630
    },
    {
      "epoch": 2.825270528325907,
      "grad_norm": 0.3899679496701693,
      "learning_rate": 4.350378388948192e-05,
      "loss": 1.5606,
      "num_input_tokens_seen": 20952361328,
      "step": 26631
    },
    {
      "epoch": 2.8253766178654782,
      "grad_norm": 0.36947144922115355,
      "learning_rate": 4.350331655728313e-05,
      "loss": 1.6109,
      "num_input_tokens_seen": 20953148048,
      "step": 26632
    },
    {
      "epoch": 2.8254827074050497,
      "grad_norm": 0.4051511781853727,
      "learning_rate": 4.350284921078554e-05,
      "loss": 1.5526,
      "num_input_tokens_seen": 20953934848,
      "step": 26633
    },
    {
      "epoch": 2.825588796944621,
      "grad_norm": 0.3739521770468008,
      "learning_rate": 4.350238184998948e-05,
      "loss": 1.712,
      "num_input_tokens_seen": 20954721568,
      "step": 26634
    },
    {
      "epoch": 2.8256948864841926,
      "grad_norm": 0.48442782957928027,
      "learning_rate": 4.350191447489532e-05,
      "loss": 1.5906,
      "num_input_tokens_seen": 20955508336,
      "step": 26635
    },
    {
      "epoch": 2.825800976023764,
      "grad_norm": 0.3903533769479004,
      "learning_rate": 4.3501447085503434e-05,
      "loss": 1.5788,
      "num_input_tokens_seen": 20956295168,
      "step": 26636
    },
    {
      "epoch": 2.8259070655633356,
      "grad_norm": 0.47926137206575953,
      "learning_rate": 4.350097968181417e-05,
      "loss": 1.635,
      "num_input_tokens_seen": 20957081952,
      "step": 26637
    },
    {
      "epoch": 2.826013155102907,
      "grad_norm": 0.3456386389448514,
      "learning_rate": 4.350051226382789e-05,
      "loss": 1.5714,
      "num_input_tokens_seen": 20957868912,
      "step": 26638
    },
    {
      "epoch": 2.826119244642478,
      "grad_norm": 0.5073760489104052,
      "learning_rate": 4.350004483154495e-05,
      "loss": 1.7218,
      "num_input_tokens_seen": 20958655648,
      "step": 26639
    },
    {
      "epoch": 2.8262253341820496,
      "grad_norm": 0.3753161643743254,
      "learning_rate": 4.349957738496573e-05,
      "loss": 1.5968,
      "num_input_tokens_seen": 20959442528,
      "step": 26640
    },
    {
      "epoch": 2.826331423721621,
      "grad_norm": 0.5010713955273434,
      "learning_rate": 4.3499109924090566e-05,
      "loss": 1.5579,
      "num_input_tokens_seen": 20960229264,
      "step": 26641
    },
    {
      "epoch": 2.8264375132611925,
      "grad_norm": 0.38027460449410405,
      "learning_rate": 4.3498642448919844e-05,
      "loss": 1.4534,
      "num_input_tokens_seen": 20961015984,
      "step": 26642
    },
    {
      "epoch": 2.826543602800764,
      "grad_norm": 0.4145943044651261,
      "learning_rate": 4.349817495945391e-05,
      "loss": 1.656,
      "num_input_tokens_seen": 20961802672,
      "step": 26643
    },
    {
      "epoch": 2.826649692340335,
      "grad_norm": 0.4330368782899017,
      "learning_rate": 4.349770745569313e-05,
      "loss": 1.727,
      "num_input_tokens_seen": 20962589392,
      "step": 26644
    },
    {
      "epoch": 2.8267557818799065,
      "grad_norm": 0.36298895655920965,
      "learning_rate": 4.349723993763786e-05,
      "loss": 1.7282,
      "num_input_tokens_seen": 20963376064,
      "step": 26645
    },
    {
      "epoch": 2.826861871419478,
      "grad_norm": 0.3720479695765924,
      "learning_rate": 4.3496772405288464e-05,
      "loss": 1.5144,
      "num_input_tokens_seen": 20964162896,
      "step": 26646
    },
    {
      "epoch": 2.8269679609590495,
      "grad_norm": 0.33775645932514736,
      "learning_rate": 4.349630485864531e-05,
      "loss": 1.4453,
      "num_input_tokens_seen": 20964949616,
      "step": 26647
    },
    {
      "epoch": 2.827074050498621,
      "grad_norm": 0.3940683479400749,
      "learning_rate": 4.3495837297708756e-05,
      "loss": 1.6117,
      "num_input_tokens_seen": 20965736384,
      "step": 26648
    },
    {
      "epoch": 2.827180140038192,
      "grad_norm": 0.36738248858967626,
      "learning_rate": 4.3495369722479164e-05,
      "loss": 1.4513,
      "num_input_tokens_seen": 20966523184,
      "step": 26649
    },
    {
      "epoch": 2.827286229577764,
      "grad_norm": 0.373810910445689,
      "learning_rate": 4.3494902132956886e-05,
      "loss": 1.6674,
      "num_input_tokens_seen": 20967309936,
      "step": 26650
    },
    {
      "epoch": 2.827392319117335,
      "grad_norm": 0.39111350584982274,
      "learning_rate": 4.349443452914229e-05,
      "loss": 1.6778,
      "num_input_tokens_seen": 20968096704,
      "step": 26651
    },
    {
      "epoch": 2.8274984086569064,
      "grad_norm": 0.3624583093886147,
      "learning_rate": 4.349396691103575e-05,
      "loss": 1.4957,
      "num_input_tokens_seen": 20968883440,
      "step": 26652
    },
    {
      "epoch": 2.827604498196478,
      "grad_norm": 0.44193395731442836,
      "learning_rate": 4.3493499278637604e-05,
      "loss": 1.5612,
      "num_input_tokens_seen": 20969670224,
      "step": 26653
    },
    {
      "epoch": 2.8277105877360493,
      "grad_norm": 0.3573055502627072,
      "learning_rate": 4.3493031631948226e-05,
      "loss": 1.4559,
      "num_input_tokens_seen": 20970456992,
      "step": 26654
    },
    {
      "epoch": 2.827816677275621,
      "grad_norm": 0.449797188906648,
      "learning_rate": 4.349256397096797e-05,
      "loss": 1.5521,
      "num_input_tokens_seen": 20971243776,
      "step": 26655
    },
    {
      "epoch": 2.827922766815192,
      "grad_norm": 0.3954598819491215,
      "learning_rate": 4.3492096295697215e-05,
      "loss": 1.6501,
      "num_input_tokens_seen": 20972030464,
      "step": 26656
    },
    {
      "epoch": 2.8280288563547633,
      "grad_norm": 0.3925044944888648,
      "learning_rate": 4.34916286061363e-05,
      "loss": 1.5268,
      "num_input_tokens_seen": 20972817264,
      "step": 26657
    },
    {
      "epoch": 2.828134945894335,
      "grad_norm": 0.34616632003837433,
      "learning_rate": 4.3491160902285596e-05,
      "loss": 1.416,
      "num_input_tokens_seen": 20973604096,
      "step": 26658
    },
    {
      "epoch": 2.8282410354339063,
      "grad_norm": 0.36589087414600385,
      "learning_rate": 4.349069318414548e-05,
      "loss": 1.6583,
      "num_input_tokens_seen": 20974390912,
      "step": 26659
    },
    {
      "epoch": 2.8283471249734777,
      "grad_norm": 0.40725071945222524,
      "learning_rate": 4.349022545171629e-05,
      "loss": 1.6339,
      "num_input_tokens_seen": 20975177648,
      "step": 26660
    },
    {
      "epoch": 2.8284532145130488,
      "grad_norm": 0.37496154569254025,
      "learning_rate": 4.348975770499839e-05,
      "loss": 1.6558,
      "num_input_tokens_seen": 20975964432,
      "step": 26661
    },
    {
      "epoch": 2.8285593040526207,
      "grad_norm": 0.3822711322368165,
      "learning_rate": 4.348928994399216e-05,
      "loss": 1.4946,
      "num_input_tokens_seen": 20976751248,
      "step": 26662
    },
    {
      "epoch": 2.8286653935921917,
      "grad_norm": 0.3911061790994191,
      "learning_rate": 4.348882216869794e-05,
      "loss": 1.6532,
      "num_input_tokens_seen": 20977538032,
      "step": 26663
    },
    {
      "epoch": 2.828771483131763,
      "grad_norm": 0.4023874537813436,
      "learning_rate": 4.34883543791161e-05,
      "loss": 1.5912,
      "num_input_tokens_seen": 20978324736,
      "step": 26664
    },
    {
      "epoch": 2.8288775726713347,
      "grad_norm": 0.350011301064112,
      "learning_rate": 4.348788657524701e-05,
      "loss": 1.6609,
      "num_input_tokens_seen": 20979111536,
      "step": 26665
    },
    {
      "epoch": 2.828983662210906,
      "grad_norm": 0.40491496643417957,
      "learning_rate": 4.348741875709103e-05,
      "loss": 1.4619,
      "num_input_tokens_seen": 20979898400,
      "step": 26666
    },
    {
      "epoch": 2.8290897517504776,
      "grad_norm": 0.3818735595700356,
      "learning_rate": 4.3486950924648496e-05,
      "loss": 1.5699,
      "num_input_tokens_seen": 20980685184,
      "step": 26667
    },
    {
      "epoch": 2.8291958412900486,
      "grad_norm": 0.4823330694489793,
      "learning_rate": 4.34864830779198e-05,
      "loss": 1.641,
      "num_input_tokens_seen": 20981471984,
      "step": 26668
    },
    {
      "epoch": 2.82930193082962,
      "grad_norm": 0.4026493765928145,
      "learning_rate": 4.348601521690529e-05,
      "loss": 1.5424,
      "num_input_tokens_seen": 20982258704,
      "step": 26669
    },
    {
      "epoch": 2.8294080203691916,
      "grad_norm": 0.4458444809809,
      "learning_rate": 4.348554734160533e-05,
      "loss": 1.5092,
      "num_input_tokens_seen": 20983045552,
      "step": 26670
    },
    {
      "epoch": 2.829514109908763,
      "grad_norm": 0.35666430910081154,
      "learning_rate": 4.348507945202028e-05,
      "loss": 1.5804,
      "num_input_tokens_seen": 20983832256,
      "step": 26671
    },
    {
      "epoch": 2.8296201994483345,
      "grad_norm": 0.32791564871803563,
      "learning_rate": 4.348461154815051e-05,
      "loss": 1.4927,
      "num_input_tokens_seen": 20984619024,
      "step": 26672
    },
    {
      "epoch": 2.8297262889879056,
      "grad_norm": 0.3907728346076939,
      "learning_rate": 4.3484143629996364e-05,
      "loss": 1.4936,
      "num_input_tokens_seen": 20985405696,
      "step": 26673
    },
    {
      "epoch": 2.829832378527477,
      "grad_norm": 0.3686760723341598,
      "learning_rate": 4.3483675697558226e-05,
      "loss": 1.582,
      "num_input_tokens_seen": 20986192528,
      "step": 26674
    },
    {
      "epoch": 2.8299384680670485,
      "grad_norm": 0.3842782157173552,
      "learning_rate": 4.348320775083643e-05,
      "loss": 1.5967,
      "num_input_tokens_seen": 20986979248,
      "step": 26675
    },
    {
      "epoch": 2.83004455760662,
      "grad_norm": 0.41998676782806094,
      "learning_rate": 4.3482739789831365e-05,
      "loss": 1.6776,
      "num_input_tokens_seen": 20987766000,
      "step": 26676
    },
    {
      "epoch": 2.8301506471461915,
      "grad_norm": 0.3503295099391568,
      "learning_rate": 4.348227181454338e-05,
      "loss": 1.609,
      "num_input_tokens_seen": 20988552816,
      "step": 26677
    },
    {
      "epoch": 2.830256736685763,
      "grad_norm": 0.3869211356270289,
      "learning_rate": 4.348180382497283e-05,
      "loss": 1.5405,
      "num_input_tokens_seen": 20989339600,
      "step": 26678
    },
    {
      "epoch": 2.8303628262253344,
      "grad_norm": 0.36529909747484923,
      "learning_rate": 4.34813358211201e-05,
      "loss": 1.5486,
      "num_input_tokens_seen": 20990126416,
      "step": 26679
    },
    {
      "epoch": 2.8304689157649054,
      "grad_norm": 0.43243188772344204,
      "learning_rate": 4.348086780298552e-05,
      "loss": 1.6242,
      "num_input_tokens_seen": 20990913216,
      "step": 26680
    },
    {
      "epoch": 2.830575005304477,
      "grad_norm": 0.3716257172321105,
      "learning_rate": 4.3480399770569476e-05,
      "loss": 1.6352,
      "num_input_tokens_seen": 20991700064,
      "step": 26681
    },
    {
      "epoch": 2.8306810948440484,
      "grad_norm": 0.4312992244671483,
      "learning_rate": 4.347993172387232e-05,
      "loss": 1.5676,
      "num_input_tokens_seen": 20992486752,
      "step": 26682
    },
    {
      "epoch": 2.83078718438362,
      "grad_norm": 0.41127528973853794,
      "learning_rate": 4.347946366289442e-05,
      "loss": 1.6881,
      "num_input_tokens_seen": 20993273552,
      "step": 26683
    },
    {
      "epoch": 2.8308932739231913,
      "grad_norm": 0.3878866312559697,
      "learning_rate": 4.3478995587636115e-05,
      "loss": 1.7364,
      "num_input_tokens_seen": 20994060240,
      "step": 26684
    },
    {
      "epoch": 2.8309993634627624,
      "grad_norm": 0.36258639532206227,
      "learning_rate": 4.34785274980978e-05,
      "loss": 1.524,
      "num_input_tokens_seen": 20994847072,
      "step": 26685
    },
    {
      "epoch": 2.831105453002334,
      "grad_norm": 0.3795101076069856,
      "learning_rate": 4.347805939427982e-05,
      "loss": 1.4849,
      "num_input_tokens_seen": 20995633904,
      "step": 26686
    },
    {
      "epoch": 2.8312115425419053,
      "grad_norm": 0.35189960715815394,
      "learning_rate": 4.3477591276182533e-05,
      "loss": 1.555,
      "num_input_tokens_seen": 20996420704,
      "step": 26687
    },
    {
      "epoch": 2.831317632081477,
      "grad_norm": 0.41262918375371765,
      "learning_rate": 4.3477123143806307e-05,
      "loss": 1.7162,
      "num_input_tokens_seen": 20997207536,
      "step": 26688
    },
    {
      "epoch": 2.8314237216210483,
      "grad_norm": 0.3750512193992017,
      "learning_rate": 4.34766549971515e-05,
      "loss": 1.5865,
      "num_input_tokens_seen": 20997994288,
      "step": 26689
    },
    {
      "epoch": 2.8315298111606193,
      "grad_norm": 0.38243158066425065,
      "learning_rate": 4.347618683621849e-05,
      "loss": 1.6165,
      "num_input_tokens_seen": 20998781056,
      "step": 26690
    },
    {
      "epoch": 2.831635900700191,
      "grad_norm": 0.35783791906684154,
      "learning_rate": 4.347571866100761e-05,
      "loss": 1.5304,
      "num_input_tokens_seen": 20999567824,
      "step": 26691
    },
    {
      "epoch": 2.8317419902397623,
      "grad_norm": 0.36523629844547456,
      "learning_rate": 4.3475250471519244e-05,
      "loss": 1.5302,
      "num_input_tokens_seen": 21000354480,
      "step": 26692
    },
    {
      "epoch": 2.8318480797793337,
      "grad_norm": 0.3493773045683455,
      "learning_rate": 4.347478226775374e-05,
      "loss": 1.4609,
      "num_input_tokens_seen": 21001141328,
      "step": 26693
    },
    {
      "epoch": 2.831954169318905,
      "grad_norm": 0.34718404125351604,
      "learning_rate": 4.347431404971147e-05,
      "loss": 1.4965,
      "num_input_tokens_seen": 21001928160,
      "step": 26694
    },
    {
      "epoch": 2.8320602588584767,
      "grad_norm": 0.3987326357545426,
      "learning_rate": 4.347384581739279e-05,
      "loss": 1.6158,
      "num_input_tokens_seen": 21002714944,
      "step": 26695
    },
    {
      "epoch": 2.832166348398048,
      "grad_norm": 0.35868481273103836,
      "learning_rate": 4.347337757079807e-05,
      "loss": 1.531,
      "num_input_tokens_seen": 21003501744,
      "step": 26696
    },
    {
      "epoch": 2.832272437937619,
      "grad_norm": 0.417400465320233,
      "learning_rate": 4.3472909309927654e-05,
      "loss": 1.6674,
      "num_input_tokens_seen": 21004288496,
      "step": 26697
    },
    {
      "epoch": 2.8323785274771907,
      "grad_norm": 0.4343348319456109,
      "learning_rate": 4.347244103478193e-05,
      "loss": 1.6173,
      "num_input_tokens_seen": 21005075200,
      "step": 26698
    },
    {
      "epoch": 2.832484617016762,
      "grad_norm": 0.4579981133984072,
      "learning_rate": 4.347197274536124e-05,
      "loss": 1.4516,
      "num_input_tokens_seen": 21005862032,
      "step": 26699
    },
    {
      "epoch": 2.8325907065563336,
      "grad_norm": 0.46783932955294905,
      "learning_rate": 4.347150444166595e-05,
      "loss": 1.6655,
      "num_input_tokens_seen": 21006648864,
      "step": 26700
    },
    {
      "epoch": 2.832696796095905,
      "grad_norm": 0.49030766494273165,
      "learning_rate": 4.3471036123696425e-05,
      "loss": 1.6702,
      "num_input_tokens_seen": 21007435712,
      "step": 26701
    },
    {
      "epoch": 2.832802885635476,
      "grad_norm": 0.3639587849893089,
      "learning_rate": 4.3470567791453024e-05,
      "loss": 1.5615,
      "num_input_tokens_seen": 21008222448,
      "step": 26702
    },
    {
      "epoch": 2.8329089751750476,
      "grad_norm": 0.4909749840770512,
      "learning_rate": 4.347009944493611e-05,
      "loss": 1.7409,
      "num_input_tokens_seen": 21009009248,
      "step": 26703
    },
    {
      "epoch": 2.833015064714619,
      "grad_norm": 0.39968984285134507,
      "learning_rate": 4.346963108414605e-05,
      "loss": 1.5568,
      "num_input_tokens_seen": 21009795920,
      "step": 26704
    },
    {
      "epoch": 2.8331211542541905,
      "grad_norm": 0.44106240163849114,
      "learning_rate": 4.3469162709083186e-05,
      "loss": 1.6797,
      "num_input_tokens_seen": 21010582624,
      "step": 26705
    },
    {
      "epoch": 2.833227243793762,
      "grad_norm": 0.40020896295764075,
      "learning_rate": 4.3468694319747914e-05,
      "loss": 1.5628,
      "num_input_tokens_seen": 21011369472,
      "step": 26706
    },
    {
      "epoch": 2.8333333333333335,
      "grad_norm": 0.5323513904753129,
      "learning_rate": 4.346822591614056e-05,
      "loss": 1.7289,
      "num_input_tokens_seen": 21012156224,
      "step": 26707
    },
    {
      "epoch": 2.833439422872905,
      "grad_norm": 0.3533910332734016,
      "learning_rate": 4.346775749826152e-05,
      "loss": 1.4729,
      "num_input_tokens_seen": 21012942992,
      "step": 26708
    },
    {
      "epoch": 2.833545512412476,
      "grad_norm": 0.4694458601655428,
      "learning_rate": 4.3467289066111124e-05,
      "loss": 1.6217,
      "num_input_tokens_seen": 21013729744,
      "step": 26709
    },
    {
      "epoch": 2.8336516019520475,
      "grad_norm": 0.4263023334133248,
      "learning_rate": 4.346682061968976e-05,
      "loss": 1.6879,
      "num_input_tokens_seen": 21014516496,
      "step": 26710
    },
    {
      "epoch": 2.833757691491619,
      "grad_norm": 0.38524754072247824,
      "learning_rate": 4.346635215899777e-05,
      "loss": 1.5163,
      "num_input_tokens_seen": 21015303328,
      "step": 26711
    },
    {
      "epoch": 2.8338637810311904,
      "grad_norm": 0.3892035915378793,
      "learning_rate": 4.346588368403554e-05,
      "loss": 1.5682,
      "num_input_tokens_seen": 21016090032,
      "step": 26712
    },
    {
      "epoch": 2.833969870570762,
      "grad_norm": 0.429851130732748,
      "learning_rate": 4.34654151948034e-05,
      "loss": 1.6451,
      "num_input_tokens_seen": 21016876816,
      "step": 26713
    },
    {
      "epoch": 2.834075960110333,
      "grad_norm": 0.5283529679689395,
      "learning_rate": 4.3464946691301736e-05,
      "loss": 1.6603,
      "num_input_tokens_seen": 21017663600,
      "step": 26714
    },
    {
      "epoch": 2.8341820496499044,
      "grad_norm": 0.4315080882991487,
      "learning_rate": 4.34644781735309e-05,
      "loss": 1.6882,
      "num_input_tokens_seen": 21018450320,
      "step": 26715
    },
    {
      "epoch": 2.834288139189476,
      "grad_norm": 0.558276147746486,
      "learning_rate": 4.346400964149126e-05,
      "loss": 1.6535,
      "num_input_tokens_seen": 21019237104,
      "step": 26716
    },
    {
      "epoch": 2.8343942287290473,
      "grad_norm": 0.4048061600882708,
      "learning_rate": 4.3463541095183166e-05,
      "loss": 1.6066,
      "num_input_tokens_seen": 21020023904,
      "step": 26717
    },
    {
      "epoch": 2.834500318268619,
      "grad_norm": 0.42018992426406143,
      "learning_rate": 4.346307253460701e-05,
      "loss": 1.5498,
      "num_input_tokens_seen": 21020810576,
      "step": 26718
    },
    {
      "epoch": 2.83460640780819,
      "grad_norm": 0.5037438643341443,
      "learning_rate": 4.346260395976311e-05,
      "loss": 1.6725,
      "num_input_tokens_seen": 21021597328,
      "step": 26719
    },
    {
      "epoch": 2.8347124973477618,
      "grad_norm": 0.33543347810754576,
      "learning_rate": 4.346213537065187e-05,
      "loss": 1.424,
      "num_input_tokens_seen": 21022384144,
      "step": 26720
    },
    {
      "epoch": 2.834818586887333,
      "grad_norm": 0.5386502935430804,
      "learning_rate": 4.3461666767273626e-05,
      "loss": 1.5644,
      "num_input_tokens_seen": 21023170832,
      "step": 26721
    },
    {
      "epoch": 2.8349246764269043,
      "grad_norm": 0.4010741680631791,
      "learning_rate": 4.346119814962875e-05,
      "loss": 1.5365,
      "num_input_tokens_seen": 21023957648,
      "step": 26722
    },
    {
      "epoch": 2.8350307659664757,
      "grad_norm": 0.372253130218452,
      "learning_rate": 4.346072951771759e-05,
      "loss": 1.4398,
      "num_input_tokens_seen": 21024744384,
      "step": 26723
    },
    {
      "epoch": 2.835136855506047,
      "grad_norm": 0.49130822450614364,
      "learning_rate": 4.346026087154053e-05,
      "loss": 1.5471,
      "num_input_tokens_seen": 21025531120,
      "step": 26724
    },
    {
      "epoch": 2.8352429450456187,
      "grad_norm": 0.3891190030499373,
      "learning_rate": 4.345979221109792e-05,
      "loss": 1.4811,
      "num_input_tokens_seen": 21026317824,
      "step": 26725
    },
    {
      "epoch": 2.8353490345851897,
      "grad_norm": 0.4707562761102299,
      "learning_rate": 4.345932353639013e-05,
      "loss": 1.619,
      "num_input_tokens_seen": 21027104544,
      "step": 26726
    },
    {
      "epoch": 2.835455124124761,
      "grad_norm": 0.401593708672444,
      "learning_rate": 4.3458854847417506e-05,
      "loss": 1.5976,
      "num_input_tokens_seen": 21027891392,
      "step": 26727
    },
    {
      "epoch": 2.8355612136643327,
      "grad_norm": 0.3895804261586926,
      "learning_rate": 4.345838614418043e-05,
      "loss": 1.5927,
      "num_input_tokens_seen": 21028678048,
      "step": 26728
    },
    {
      "epoch": 2.835667303203904,
      "grad_norm": 0.4281071303961155,
      "learning_rate": 4.345791742667925e-05,
      "loss": 1.6077,
      "num_input_tokens_seen": 21029464800,
      "step": 26729
    },
    {
      "epoch": 2.8357733927434756,
      "grad_norm": 0.45195715702545775,
      "learning_rate": 4.3457448694914334e-05,
      "loss": 1.4657,
      "num_input_tokens_seen": 21030251680,
      "step": 26730
    },
    {
      "epoch": 2.8358794822830466,
      "grad_norm": 0.4738930592510914,
      "learning_rate": 4.345697994888604e-05,
      "loss": 1.6219,
      "num_input_tokens_seen": 21031038384,
      "step": 26731
    },
    {
      "epoch": 2.8359855718226186,
      "grad_norm": 0.4880979300210242,
      "learning_rate": 4.345651118859474e-05,
      "loss": 1.5793,
      "num_input_tokens_seen": 21031825168,
      "step": 26732
    },
    {
      "epoch": 2.8360916613621896,
      "grad_norm": 0.3976556904292794,
      "learning_rate": 4.3456042414040784e-05,
      "loss": 1.5151,
      "num_input_tokens_seen": 21032611984,
      "step": 26733
    },
    {
      "epoch": 2.836197750901761,
      "grad_norm": 0.5962887844398563,
      "learning_rate": 4.3455573625224547e-05,
      "loss": 1.5973,
      "num_input_tokens_seen": 21033398784,
      "step": 26734
    },
    {
      "epoch": 2.8363038404413325,
      "grad_norm": 0.37950062357596165,
      "learning_rate": 4.3455104822146375e-05,
      "loss": 1.5343,
      "num_input_tokens_seen": 21034185504,
      "step": 26735
    },
    {
      "epoch": 2.836409929980904,
      "grad_norm": 0.40232170181525984,
      "learning_rate": 4.345463600480664e-05,
      "loss": 1.5342,
      "num_input_tokens_seen": 21034972272,
      "step": 26736
    },
    {
      "epoch": 2.8365160195204755,
      "grad_norm": 0.566445471791347,
      "learning_rate": 4.3454167173205706e-05,
      "loss": 1.5709,
      "num_input_tokens_seen": 21035759040,
      "step": 26737
    },
    {
      "epoch": 2.8366221090600465,
      "grad_norm": 0.402001134064468,
      "learning_rate": 4.345369832734394e-05,
      "loss": 1.7169,
      "num_input_tokens_seen": 21036545760,
      "step": 26738
    },
    {
      "epoch": 2.836728198599618,
      "grad_norm": 0.40420579614153035,
      "learning_rate": 4.345322946722169e-05,
      "loss": 1.5367,
      "num_input_tokens_seen": 21037332624,
      "step": 26739
    },
    {
      "epoch": 2.8368342881391895,
      "grad_norm": 0.38846439495149904,
      "learning_rate": 4.3452760592839324e-05,
      "loss": 1.5789,
      "num_input_tokens_seen": 21038119328,
      "step": 26740
    },
    {
      "epoch": 2.836940377678761,
      "grad_norm": 0.358994565538133,
      "learning_rate": 4.345229170419721e-05,
      "loss": 1.4626,
      "num_input_tokens_seen": 21038906224,
      "step": 26741
    },
    {
      "epoch": 2.8370464672183324,
      "grad_norm": 0.43296426328224263,
      "learning_rate": 4.345182280129571e-05,
      "loss": 1.6493,
      "num_input_tokens_seen": 21039693008,
      "step": 26742
    },
    {
      "epoch": 2.8371525567579035,
      "grad_norm": 0.42547366759224353,
      "learning_rate": 4.345135388413518e-05,
      "loss": 1.6234,
      "num_input_tokens_seen": 21040479744,
      "step": 26743
    },
    {
      "epoch": 2.837258646297475,
      "grad_norm": 0.47117293985479736,
      "learning_rate": 4.3450884952715985e-05,
      "loss": 1.6942,
      "num_input_tokens_seen": 21041266560,
      "step": 26744
    },
    {
      "epoch": 2.8373647358370464,
      "grad_norm": 0.36794105670392085,
      "learning_rate": 4.345041600703849e-05,
      "loss": 1.6154,
      "num_input_tokens_seen": 21042053312,
      "step": 26745
    },
    {
      "epoch": 2.837470825376618,
      "grad_norm": 0.4130669545088116,
      "learning_rate": 4.344994704710305e-05,
      "loss": 1.5932,
      "num_input_tokens_seen": 21042840016,
      "step": 26746
    },
    {
      "epoch": 2.8375769149161894,
      "grad_norm": 0.41047779217544367,
      "learning_rate": 4.344947807291003e-05,
      "loss": 1.6413,
      "num_input_tokens_seen": 21043626768,
      "step": 26747
    },
    {
      "epoch": 2.837683004455761,
      "grad_norm": 0.3941668991754106,
      "learning_rate": 4.3449009084459805e-05,
      "loss": 1.5155,
      "num_input_tokens_seen": 21044413488,
      "step": 26748
    },
    {
      "epoch": 2.8377890939953323,
      "grad_norm": 0.4150532797758473,
      "learning_rate": 4.344854008175271e-05,
      "loss": 1.4422,
      "num_input_tokens_seen": 21045200352,
      "step": 26749
    },
    {
      "epoch": 2.8378951835349033,
      "grad_norm": 0.3709158060571179,
      "learning_rate": 4.344807106478914e-05,
      "loss": 1.6635,
      "num_input_tokens_seen": 21045987056,
      "step": 26750
    },
    {
      "epoch": 2.838001273074475,
      "grad_norm": 0.40851544386615407,
      "learning_rate": 4.344760203356943e-05,
      "loss": 1.5462,
      "num_input_tokens_seen": 21046773888,
      "step": 26751
    },
    {
      "epoch": 2.8381073626140463,
      "grad_norm": 0.3605097176751203,
      "learning_rate": 4.344713298809397e-05,
      "loss": 1.5699,
      "num_input_tokens_seen": 21047560608,
      "step": 26752
    },
    {
      "epoch": 2.8382134521536178,
      "grad_norm": 0.32849471141611897,
      "learning_rate": 4.34466639283631e-05,
      "loss": 1.5182,
      "num_input_tokens_seen": 21048347408,
      "step": 26753
    },
    {
      "epoch": 2.8383195416931892,
      "grad_norm": 0.41696610569757403,
      "learning_rate": 4.3446194854377185e-05,
      "loss": 1.4344,
      "num_input_tokens_seen": 21049134112,
      "step": 26754
    },
    {
      "epoch": 2.8384256312327603,
      "grad_norm": 0.3857775646878918,
      "learning_rate": 4.344572576613659e-05,
      "loss": 1.6051,
      "num_input_tokens_seen": 21049920832,
      "step": 26755
    },
    {
      "epoch": 2.8385317207723317,
      "grad_norm": 0.3753949347104727,
      "learning_rate": 4.344525666364169e-05,
      "loss": 1.5493,
      "num_input_tokens_seen": 21050707584,
      "step": 26756
    },
    {
      "epoch": 2.838637810311903,
      "grad_norm": 0.397603253002591,
      "learning_rate": 4.344478754689283e-05,
      "loss": 1.6293,
      "num_input_tokens_seen": 21051494416,
      "step": 26757
    },
    {
      "epoch": 2.8387438998514747,
      "grad_norm": 0.3501486618511407,
      "learning_rate": 4.344431841589038e-05,
      "loss": 1.6013,
      "num_input_tokens_seen": 21052281088,
      "step": 26758
    },
    {
      "epoch": 2.838849989391046,
      "grad_norm": 0.3288809318367814,
      "learning_rate": 4.3443849270634704e-05,
      "loss": 1.4628,
      "num_input_tokens_seen": 21053067920,
      "step": 26759
    },
    {
      "epoch": 2.838956078930617,
      "grad_norm": 0.36443943860098243,
      "learning_rate": 4.344338011112616e-05,
      "loss": 1.4792,
      "num_input_tokens_seen": 21053854720,
      "step": 26760
    },
    {
      "epoch": 2.839062168470189,
      "grad_norm": 0.35847054805935813,
      "learning_rate": 4.344291093736511e-05,
      "loss": 1.5855,
      "num_input_tokens_seen": 21054641472,
      "step": 26761
    },
    {
      "epoch": 2.83916825800976,
      "grad_norm": 0.42099016695470026,
      "learning_rate": 4.3442441749351923e-05,
      "loss": 1.6457,
      "num_input_tokens_seen": 21055428240,
      "step": 26762
    },
    {
      "epoch": 2.8392743475493316,
      "grad_norm": 0.39858642770996544,
      "learning_rate": 4.3441972547086965e-05,
      "loss": 1.6375,
      "num_input_tokens_seen": 21056215024,
      "step": 26763
    },
    {
      "epoch": 2.839380437088903,
      "grad_norm": 0.36721877503259703,
      "learning_rate": 4.3441503330570575e-05,
      "loss": 1.6287,
      "num_input_tokens_seen": 21057001728,
      "step": 26764
    },
    {
      "epoch": 2.8394865266284746,
      "grad_norm": 0.4210114950554533,
      "learning_rate": 4.344103409980315e-05,
      "loss": 1.5865,
      "num_input_tokens_seen": 21057788480,
      "step": 26765
    },
    {
      "epoch": 2.839592616168046,
      "grad_norm": 0.3158138240525386,
      "learning_rate": 4.344056485478503e-05,
      "loss": 1.4903,
      "num_input_tokens_seen": 21058575248,
      "step": 26766
    },
    {
      "epoch": 2.839698705707617,
      "grad_norm": 0.3616152521031619,
      "learning_rate": 4.3440095595516574e-05,
      "loss": 1.5551,
      "num_input_tokens_seen": 21059362080,
      "step": 26767
    },
    {
      "epoch": 2.8398047952471885,
      "grad_norm": 0.31446044073891466,
      "learning_rate": 4.343962632199816e-05,
      "loss": 1.5098,
      "num_input_tokens_seen": 21060148832,
      "step": 26768
    },
    {
      "epoch": 2.83991088478676,
      "grad_norm": 0.34885497328254567,
      "learning_rate": 4.3439157034230144e-05,
      "loss": 1.4849,
      "num_input_tokens_seen": 21060935648,
      "step": 26769
    },
    {
      "epoch": 2.8400169743263315,
      "grad_norm": 0.34553359941067846,
      "learning_rate": 4.343868773221289e-05,
      "loss": 1.6729,
      "num_input_tokens_seen": 21061722368,
      "step": 26770
    },
    {
      "epoch": 2.840123063865903,
      "grad_norm": 0.3334676959295039,
      "learning_rate": 4.343821841594675e-05,
      "loss": 1.4735,
      "num_input_tokens_seen": 21062509152,
      "step": 26771
    },
    {
      "epoch": 2.840229153405474,
      "grad_norm": 0.37800153185326163,
      "learning_rate": 4.343774908543211e-05,
      "loss": 1.6982,
      "num_input_tokens_seen": 21063295904,
      "step": 26772
    },
    {
      "epoch": 2.8403352429450455,
      "grad_norm": 0.3726304964238771,
      "learning_rate": 4.34372797406693e-05,
      "loss": 1.5022,
      "num_input_tokens_seen": 21064082768,
      "step": 26773
    },
    {
      "epoch": 2.840441332484617,
      "grad_norm": 0.3364959137346672,
      "learning_rate": 4.343681038165872e-05,
      "loss": 1.5982,
      "num_input_tokens_seen": 21064869504,
      "step": 26774
    },
    {
      "epoch": 2.8405474220241884,
      "grad_norm": 0.3448838771579777,
      "learning_rate": 4.3436341008400705e-05,
      "loss": 1.5239,
      "num_input_tokens_seen": 21065656304,
      "step": 26775
    },
    {
      "epoch": 2.84065351156376,
      "grad_norm": 0.3547450484890635,
      "learning_rate": 4.343587162089563e-05,
      "loss": 1.592,
      "num_input_tokens_seen": 21066442992,
      "step": 26776
    },
    {
      "epoch": 2.8407596011033314,
      "grad_norm": 0.42684792322061177,
      "learning_rate": 4.343540221914385e-05,
      "loss": 1.6069,
      "num_input_tokens_seen": 21067229632,
      "step": 26777
    },
    {
      "epoch": 2.840865690642903,
      "grad_norm": 0.3932148366108127,
      "learning_rate": 4.343493280314573e-05,
      "loss": 1.6668,
      "num_input_tokens_seen": 21068016400,
      "step": 26778
    },
    {
      "epoch": 2.840971780182474,
      "grad_norm": 0.43769951848124633,
      "learning_rate": 4.343446337290164e-05,
      "loss": 1.6831,
      "num_input_tokens_seen": 21068803088,
      "step": 26779
    },
    {
      "epoch": 2.8410778697220453,
      "grad_norm": 0.3690696498058811,
      "learning_rate": 4.3433993928411935e-05,
      "loss": 1.6219,
      "num_input_tokens_seen": 21069589808,
      "step": 26780
    },
    {
      "epoch": 2.841183959261617,
      "grad_norm": 0.412728364349612,
      "learning_rate": 4.343352446967699e-05,
      "loss": 1.4531,
      "num_input_tokens_seen": 21070376592,
      "step": 26781
    },
    {
      "epoch": 2.8412900488011883,
      "grad_norm": 0.39018933046504606,
      "learning_rate": 4.343305499669714e-05,
      "loss": 1.5519,
      "num_input_tokens_seen": 21071163312,
      "step": 26782
    },
    {
      "epoch": 2.8413961383407598,
      "grad_norm": 0.359665102660101,
      "learning_rate": 4.343258550947278e-05,
      "loss": 1.5525,
      "num_input_tokens_seen": 21071950112,
      "step": 26783
    },
    {
      "epoch": 2.841502227880331,
      "grad_norm": 0.4013474769853214,
      "learning_rate": 4.3432116008004256e-05,
      "loss": 1.5605,
      "num_input_tokens_seen": 21072736896,
      "step": 26784
    },
    {
      "epoch": 2.8416083174199023,
      "grad_norm": 0.41331732651138536,
      "learning_rate": 4.3431646492291936e-05,
      "loss": 1.4809,
      "num_input_tokens_seen": 21073523680,
      "step": 26785
    },
    {
      "epoch": 2.8417144069594737,
      "grad_norm": 0.40324021899546914,
      "learning_rate": 4.3431176962336174e-05,
      "loss": 1.4586,
      "num_input_tokens_seen": 21074310416,
      "step": 26786
    },
    {
      "epoch": 2.8418204964990452,
      "grad_norm": 0.39838530976080044,
      "learning_rate": 4.3430707418137337e-05,
      "loss": 1.5989,
      "num_input_tokens_seen": 21075097200,
      "step": 26787
    },
    {
      "epoch": 2.8419265860386167,
      "grad_norm": 0.45100226087882833,
      "learning_rate": 4.3430237859695796e-05,
      "loss": 1.5588,
      "num_input_tokens_seen": 21075884000,
      "step": 26788
    },
    {
      "epoch": 2.8420326755781877,
      "grad_norm": 0.42016121033791143,
      "learning_rate": 4.3429768287011905e-05,
      "loss": 1.4983,
      "num_input_tokens_seen": 21076670784,
      "step": 26789
    },
    {
      "epoch": 2.8421387651177596,
      "grad_norm": 0.393762114326665,
      "learning_rate": 4.3429298700086035e-05,
      "loss": 1.4222,
      "num_input_tokens_seen": 21077457680,
      "step": 26790
    },
    {
      "epoch": 2.8422448546573307,
      "grad_norm": 0.35257611400044986,
      "learning_rate": 4.3428829098918547e-05,
      "loss": 1.5972,
      "num_input_tokens_seen": 21078244512,
      "step": 26791
    },
    {
      "epoch": 2.842350944196902,
      "grad_norm": 0.6431981306214523,
      "learning_rate": 4.342835948350979e-05,
      "loss": 1.5521,
      "num_input_tokens_seen": 21079031200,
      "step": 26792
    },
    {
      "epoch": 2.8424570337364736,
      "grad_norm": 0.35228244839025163,
      "learning_rate": 4.3427889853860136e-05,
      "loss": 1.4009,
      "num_input_tokens_seen": 21079818096,
      "step": 26793
    },
    {
      "epoch": 2.842563123276045,
      "grad_norm": 0.8395936392658353,
      "learning_rate": 4.342742020996996e-05,
      "loss": 1.5439,
      "num_input_tokens_seen": 21080604896,
      "step": 26794
    },
    {
      "epoch": 2.8426692128156166,
      "grad_norm": 0.9777938347858177,
      "learning_rate": 4.3426950551839606e-05,
      "loss": 1.572,
      "num_input_tokens_seen": 21081391680,
      "step": 26795
    },
    {
      "epoch": 2.8427753023551876,
      "grad_norm": 0.5568463393020664,
      "learning_rate": 4.342648087946946e-05,
      "loss": 1.5744,
      "num_input_tokens_seen": 21082178432,
      "step": 26796
    },
    {
      "epoch": 2.842881391894759,
      "grad_norm": 1.426200203674274,
      "learning_rate": 4.342601119285985e-05,
      "loss": 1.6878,
      "num_input_tokens_seen": 21082965248,
      "step": 26797
    },
    {
      "epoch": 2.8429874814343306,
      "grad_norm": 0.7577692041175792,
      "learning_rate": 4.342554149201117e-05,
      "loss": 1.4982,
      "num_input_tokens_seen": 21083752048,
      "step": 26798
    },
    {
      "epoch": 2.843093570973902,
      "grad_norm": 1.404650873762677,
      "learning_rate": 4.3425071776923765e-05,
      "loss": 1.6119,
      "num_input_tokens_seen": 21084538816,
      "step": 26799
    },
    {
      "epoch": 2.8431996605134735,
      "grad_norm": 0.7214295289562294,
      "learning_rate": 4.342460204759802e-05,
      "loss": 1.5449,
      "num_input_tokens_seen": 21085325504,
      "step": 26800
    },
    {
      "epoch": 2.8433057500530445,
      "grad_norm": 0.486447687248443,
      "learning_rate": 4.342413230403427e-05,
      "loss": 1.5362,
      "num_input_tokens_seen": 21086112416,
      "step": 26801
    },
    {
      "epoch": 2.843411839592616,
      "grad_norm": 0.8907861558157119,
      "learning_rate": 4.342366254623289e-05,
      "loss": 1.6114,
      "num_input_tokens_seen": 21086899200,
      "step": 26802
    },
    {
      "epoch": 2.8435179291321875,
      "grad_norm": 0.5526318914445741,
      "learning_rate": 4.342319277419425e-05,
      "loss": 1.6121,
      "num_input_tokens_seen": 21087685968,
      "step": 26803
    },
    {
      "epoch": 2.843624018671759,
      "grad_norm": 0.5770957915108753,
      "learning_rate": 4.3422722987918704e-05,
      "loss": 1.5874,
      "num_input_tokens_seen": 21088472768,
      "step": 26804
    },
    {
      "epoch": 2.8437301082113304,
      "grad_norm": 0.7964223005338196,
      "learning_rate": 4.3422253187406626e-05,
      "loss": 1.7229,
      "num_input_tokens_seen": 21089259616,
      "step": 26805
    },
    {
      "epoch": 2.843836197750902,
      "grad_norm": 0.753429439980403,
      "learning_rate": 4.3421783372658364e-05,
      "loss": 1.6534,
      "num_input_tokens_seen": 21090046336,
      "step": 26806
    },
    {
      "epoch": 2.8439422872904734,
      "grad_norm": 0.4838723377580077,
      "learning_rate": 4.342131354367429e-05,
      "loss": 1.5196,
      "num_input_tokens_seen": 21090833136,
      "step": 26807
    },
    {
      "epoch": 2.8440483768300444,
      "grad_norm": 0.9068283257827671,
      "learning_rate": 4.3420843700454763e-05,
      "loss": 1.6119,
      "num_input_tokens_seen": 21091619920,
      "step": 26808
    },
    {
      "epoch": 2.844154466369616,
      "grad_norm": 0.5150752785271991,
      "learning_rate": 4.342037384300015e-05,
      "loss": 1.6214,
      "num_input_tokens_seen": 21092406768,
      "step": 26809
    },
    {
      "epoch": 2.8442605559091874,
      "grad_norm": 0.8275684080921829,
      "learning_rate": 4.3419903971310816e-05,
      "loss": 1.5757,
      "num_input_tokens_seen": 21093193488,
      "step": 26810
    },
    {
      "epoch": 2.844366645448759,
      "grad_norm": 0.4910477615778141,
      "learning_rate": 4.341943408538712e-05,
      "loss": 1.5069,
      "num_input_tokens_seen": 21093980320,
      "step": 26811
    },
    {
      "epoch": 2.8444727349883303,
      "grad_norm": 1.0917014383785488,
      "learning_rate": 4.341896418522943e-05,
      "loss": 1.7324,
      "num_input_tokens_seen": 21094767040,
      "step": 26812
    },
    {
      "epoch": 2.8445788245279013,
      "grad_norm": 0.4415724934863904,
      "learning_rate": 4.3418494270838095e-05,
      "loss": 1.5449,
      "num_input_tokens_seen": 21095553856,
      "step": 26813
    },
    {
      "epoch": 2.844684914067473,
      "grad_norm": 0.9569711748111579,
      "learning_rate": 4.341802434221349e-05,
      "loss": 1.6441,
      "num_input_tokens_seen": 21096340560,
      "step": 26814
    },
    {
      "epoch": 2.8447910036070443,
      "grad_norm": 1.0613070518597274,
      "learning_rate": 4.3417554399355973e-05,
      "loss": 1.5093,
      "num_input_tokens_seen": 21097127328,
      "step": 26815
    },
    {
      "epoch": 2.8448970931466158,
      "grad_norm": 1.0353008732486988,
      "learning_rate": 4.341708444226592e-05,
      "loss": 1.6625,
      "num_input_tokens_seen": 21097914064,
      "step": 26816
    },
    {
      "epoch": 2.8450031826861872,
      "grad_norm": 0.6880278268158426,
      "learning_rate": 4.341661447094368e-05,
      "loss": 1.6085,
      "num_input_tokens_seen": 21098700784,
      "step": 26817
    },
    {
      "epoch": 2.8451092722257583,
      "grad_norm": 1.2569467291827785,
      "learning_rate": 4.341614448538962e-05,
      "loss": 1.6549,
      "num_input_tokens_seen": 21099487504,
      "step": 26818
    },
    {
      "epoch": 2.84521536176533,
      "grad_norm": 0.8847683163629741,
      "learning_rate": 4.3415674485604104e-05,
      "loss": 1.5388,
      "num_input_tokens_seen": 21100274352,
      "step": 26819
    },
    {
      "epoch": 2.845321451304901,
      "grad_norm": 0.9473868480051612,
      "learning_rate": 4.34152044715875e-05,
      "loss": 1.4478,
      "num_input_tokens_seen": 21101061184,
      "step": 26820
    },
    {
      "epoch": 2.8454275408444727,
      "grad_norm": 1.121313753524511,
      "learning_rate": 4.341473444334016e-05,
      "loss": 1.3795,
      "num_input_tokens_seen": 21101848016,
      "step": 26821
    },
    {
      "epoch": 2.845533630384044,
      "grad_norm": 1.4236773934958136,
      "learning_rate": 4.341426440086245e-05,
      "loss": 1.5425,
      "num_input_tokens_seen": 21102634672,
      "step": 26822
    },
    {
      "epoch": 2.8456397199236156,
      "grad_norm": 0.6664907017421111,
      "learning_rate": 4.341379434415474e-05,
      "loss": 1.6093,
      "num_input_tokens_seen": 21103421456,
      "step": 26823
    },
    {
      "epoch": 2.845745809463187,
      "grad_norm": 1.4433673794133377,
      "learning_rate": 4.34133242732174e-05,
      "loss": 1.6651,
      "num_input_tokens_seen": 21104208144,
      "step": 26824
    },
    {
      "epoch": 2.845851899002758,
      "grad_norm": 0.6840757438640862,
      "learning_rate": 4.341285418805078e-05,
      "loss": 1.6944,
      "num_input_tokens_seen": 21104994800,
      "step": 26825
    },
    {
      "epoch": 2.8459579885423296,
      "grad_norm": 0.9250909460572144,
      "learning_rate": 4.341238408865523e-05,
      "loss": 1.5502,
      "num_input_tokens_seen": 21105781632,
      "step": 26826
    },
    {
      "epoch": 2.846064078081901,
      "grad_norm": 0.5522017049882135,
      "learning_rate": 4.341191397503115e-05,
      "loss": 1.643,
      "num_input_tokens_seen": 21106568368,
      "step": 26827
    },
    {
      "epoch": 2.8461701676214726,
      "grad_norm": 0.4957175368028914,
      "learning_rate": 4.341144384717888e-05,
      "loss": 1.5448,
      "num_input_tokens_seen": 21107355104,
      "step": 26828
    },
    {
      "epoch": 2.846276257161044,
      "grad_norm": 0.7142525705762796,
      "learning_rate": 4.341097370509878e-05,
      "loss": 1.538,
      "num_input_tokens_seen": 21108141888,
      "step": 26829
    },
    {
      "epoch": 2.846382346700615,
      "grad_norm": 0.4469841893353551,
      "learning_rate": 4.341050354879121e-05,
      "loss": 1.5831,
      "num_input_tokens_seen": 21108928720,
      "step": 26830
    },
    {
      "epoch": 2.846488436240187,
      "grad_norm": 0.5829900382342788,
      "learning_rate": 4.3410033378256565e-05,
      "loss": 1.5673,
      "num_input_tokens_seen": 21109715568,
      "step": 26831
    },
    {
      "epoch": 2.846594525779758,
      "grad_norm": 0.6501493701762148,
      "learning_rate": 4.3409563193495174e-05,
      "loss": 1.7095,
      "num_input_tokens_seen": 21110502464,
      "step": 26832
    },
    {
      "epoch": 2.8467006153193295,
      "grad_norm": 0.3776889705259038,
      "learning_rate": 4.3409092994507417e-05,
      "loss": 1.5776,
      "num_input_tokens_seen": 21111289200,
      "step": 26833
    },
    {
      "epoch": 2.846806704858901,
      "grad_norm": 0.6711966568910177,
      "learning_rate": 4.340862278129365e-05,
      "loss": 1.5479,
      "num_input_tokens_seen": 21112076016,
      "step": 26834
    },
    {
      "epoch": 2.8469127943984724,
      "grad_norm": 0.5068562830950909,
      "learning_rate": 4.340815255385424e-05,
      "loss": 1.5442,
      "num_input_tokens_seen": 21112862880,
      "step": 26835
    },
    {
      "epoch": 2.847018883938044,
      "grad_norm": 0.5357975429695381,
      "learning_rate": 4.340768231218954e-05,
      "loss": 1.7518,
      "num_input_tokens_seen": 21113649680,
      "step": 26836
    },
    {
      "epoch": 2.847124973477615,
      "grad_norm": 0.5288340834553994,
      "learning_rate": 4.340721205629994e-05,
      "loss": 1.4378,
      "num_input_tokens_seen": 21114436464,
      "step": 26837
    },
    {
      "epoch": 2.8472310630171864,
      "grad_norm": 0.7335524287217606,
      "learning_rate": 4.340674178618578e-05,
      "loss": 1.6292,
      "num_input_tokens_seen": 21115223296,
      "step": 26838
    },
    {
      "epoch": 2.847337152556758,
      "grad_norm": 0.3781896528524507,
      "learning_rate": 4.340627150184743e-05,
      "loss": 1.5195,
      "num_input_tokens_seen": 21116010208,
      "step": 26839
    },
    {
      "epoch": 2.8474432420963294,
      "grad_norm": 0.5971315052770868,
      "learning_rate": 4.340580120328526e-05,
      "loss": 1.5611,
      "num_input_tokens_seen": 21116796992,
      "step": 26840
    },
    {
      "epoch": 2.847549331635901,
      "grad_norm": 0.42707654913792775,
      "learning_rate": 4.340533089049961e-05,
      "loss": 1.6171,
      "num_input_tokens_seen": 21117583744,
      "step": 26841
    },
    {
      "epoch": 2.847655421175472,
      "grad_norm": 0.46688811175087935,
      "learning_rate": 4.3404860563490876e-05,
      "loss": 1.5522,
      "num_input_tokens_seen": 21118370464,
      "step": 26842
    },
    {
      "epoch": 2.8477615107150434,
      "grad_norm": 0.37447399396249614,
      "learning_rate": 4.34043902222594e-05,
      "loss": 1.4801,
      "num_input_tokens_seen": 21119157312,
      "step": 26843
    },
    {
      "epoch": 2.847867600254615,
      "grad_norm": 0.3618364015691333,
      "learning_rate": 4.3403919866805554e-05,
      "loss": 1.5504,
      "num_input_tokens_seen": 21119944128,
      "step": 26844
    },
    {
      "epoch": 2.8479736897941863,
      "grad_norm": 0.46001533307364667,
      "learning_rate": 4.340344949712969e-05,
      "loss": 1.716,
      "num_input_tokens_seen": 21120730928,
      "step": 26845
    },
    {
      "epoch": 2.8480797793337578,
      "grad_norm": 0.36899748022430695,
      "learning_rate": 4.340297911323219e-05,
      "loss": 1.58,
      "num_input_tokens_seen": 21121517664,
      "step": 26846
    },
    {
      "epoch": 2.8481858688733293,
      "grad_norm": 0.43403433271390507,
      "learning_rate": 4.34025087151134e-05,
      "loss": 1.6869,
      "num_input_tokens_seen": 21122304400,
      "step": 26847
    },
    {
      "epoch": 2.8482919584129007,
      "grad_norm": 0.37509809159565516,
      "learning_rate": 4.3402038302773695e-05,
      "loss": 1.5164,
      "num_input_tokens_seen": 21123091136,
      "step": 26848
    },
    {
      "epoch": 2.8483980479524718,
      "grad_norm": 0.5031478455369935,
      "learning_rate": 4.340156787621344e-05,
      "loss": 1.756,
      "num_input_tokens_seen": 21123877888,
      "step": 26849
    },
    {
      "epoch": 2.8485041374920432,
      "grad_norm": 0.45558754728045475,
      "learning_rate": 4.3401097435432986e-05,
      "loss": 1.5571,
      "num_input_tokens_seen": 21124664704,
      "step": 26850
    },
    {
      "epoch": 2.8486102270316147,
      "grad_norm": 0.45454037615240556,
      "learning_rate": 4.3400626980432705e-05,
      "loss": 1.5551,
      "num_input_tokens_seen": 21125451344,
      "step": 26851
    },
    {
      "epoch": 2.848716316571186,
      "grad_norm": 0.4544848446396718,
      "learning_rate": 4.3400156511212964e-05,
      "loss": 1.6037,
      "num_input_tokens_seen": 21126238112,
      "step": 26852
    },
    {
      "epoch": 2.8488224061107577,
      "grad_norm": 0.39910069925880653,
      "learning_rate": 4.3399686027774114e-05,
      "loss": 1.4878,
      "num_input_tokens_seen": 21127024896,
      "step": 26853
    },
    {
      "epoch": 2.8489284956503287,
      "grad_norm": 0.4664512249457041,
      "learning_rate": 4.339921553011653e-05,
      "loss": 1.6202,
      "num_input_tokens_seen": 21127811696,
      "step": 26854
    },
    {
      "epoch": 2.8490345851899,
      "grad_norm": 0.36430683399190994,
      "learning_rate": 4.3398745018240575e-05,
      "loss": 1.6584,
      "num_input_tokens_seen": 21128598416,
      "step": 26855
    },
    {
      "epoch": 2.8491406747294716,
      "grad_norm": 0.3739891338173713,
      "learning_rate": 4.339827449214661e-05,
      "loss": 1.6008,
      "num_input_tokens_seen": 21129385200,
      "step": 26856
    },
    {
      "epoch": 2.849246764269043,
      "grad_norm": 0.4051084210909523,
      "learning_rate": 4.3397803951835e-05,
      "loss": 1.6584,
      "num_input_tokens_seen": 21130171888,
      "step": 26857
    },
    {
      "epoch": 2.8493528538086146,
      "grad_norm": 0.4572226933889828,
      "learning_rate": 4.33973333973061e-05,
      "loss": 1.631,
      "num_input_tokens_seen": 21130958608,
      "step": 26858
    },
    {
      "epoch": 2.8494589433481856,
      "grad_norm": 0.41450196695696434,
      "learning_rate": 4.3396862828560284e-05,
      "loss": 1.5744,
      "num_input_tokens_seen": 21131745328,
      "step": 26859
    },
    {
      "epoch": 2.8495650328877575,
      "grad_norm": 0.4298358871034672,
      "learning_rate": 4.339639224559791e-05,
      "loss": 1.4992,
      "num_input_tokens_seen": 21132532144,
      "step": 26860
    },
    {
      "epoch": 2.8496711224273286,
      "grad_norm": 0.47017719889407067,
      "learning_rate": 4.339592164841935e-05,
      "loss": 1.6239,
      "num_input_tokens_seen": 21133318880,
      "step": 26861
    },
    {
      "epoch": 2.8497772119669,
      "grad_norm": 0.45547590044991043,
      "learning_rate": 4.3395451037024956e-05,
      "loss": 1.5811,
      "num_input_tokens_seen": 21134105744,
      "step": 26862
    },
    {
      "epoch": 2.8498833015064715,
      "grad_norm": 0.4994239421726788,
      "learning_rate": 4.3394980411415096e-05,
      "loss": 1.7451,
      "num_input_tokens_seen": 21134892496,
      "step": 26863
    },
    {
      "epoch": 2.849989391046043,
      "grad_norm": 0.5263154606691057,
      "learning_rate": 4.339450977159014e-05,
      "loss": 1.5957,
      "num_input_tokens_seen": 21135679232,
      "step": 26864
    },
    {
      "epoch": 2.8500954805856145,
      "grad_norm": 0.41896765643849415,
      "learning_rate": 4.3394039117550445e-05,
      "loss": 1.624,
      "num_input_tokens_seen": 21136465984,
      "step": 26865
    },
    {
      "epoch": 2.8502015701251855,
      "grad_norm": 0.5275184235307776,
      "learning_rate": 4.339356844929637e-05,
      "loss": 1.4695,
      "num_input_tokens_seen": 21137252736,
      "step": 26866
    },
    {
      "epoch": 2.850307659664757,
      "grad_norm": 0.4795485666306815,
      "learning_rate": 4.3393097766828293e-05,
      "loss": 1.6562,
      "num_input_tokens_seen": 21138039424,
      "step": 26867
    },
    {
      "epoch": 2.8504137492043284,
      "grad_norm": 0.39560301082773686,
      "learning_rate": 4.339262707014656e-05,
      "loss": 1.6424,
      "num_input_tokens_seen": 21138826144,
      "step": 26868
    },
    {
      "epoch": 2.8505198387439,
      "grad_norm": 0.5705179089500921,
      "learning_rate": 4.3392156359251556e-05,
      "loss": 1.5981,
      "num_input_tokens_seen": 21139612896,
      "step": 26869
    },
    {
      "epoch": 2.8506259282834714,
      "grad_norm": 0.46557657679613923,
      "learning_rate": 4.339168563414363e-05,
      "loss": 1.5585,
      "num_input_tokens_seen": 21140399648,
      "step": 26870
    },
    {
      "epoch": 2.8507320178230424,
      "grad_norm": 0.41105239793755777,
      "learning_rate": 4.339121489482315e-05,
      "loss": 1.7106,
      "num_input_tokens_seen": 21141186432,
      "step": 26871
    },
    {
      "epoch": 2.850838107362614,
      "grad_norm": 0.43690218865165115,
      "learning_rate": 4.3390744141290474e-05,
      "loss": 1.4939,
      "num_input_tokens_seen": 21141973200,
      "step": 26872
    },
    {
      "epoch": 2.8509441969021854,
      "grad_norm": 0.4559617706521728,
      "learning_rate": 4.339027337354598e-05,
      "loss": 1.5444,
      "num_input_tokens_seen": 21142759904,
      "step": 26873
    },
    {
      "epoch": 2.851050286441757,
      "grad_norm": 0.3734255169326065,
      "learning_rate": 4.338980259159001e-05,
      "loss": 1.5679,
      "num_input_tokens_seen": 21143546752,
      "step": 26874
    },
    {
      "epoch": 2.8511563759813283,
      "grad_norm": 0.5130080155743866,
      "learning_rate": 4.3389331795422945e-05,
      "loss": 1.6636,
      "num_input_tokens_seen": 21144333488,
      "step": 26875
    },
    {
      "epoch": 2.8512624655209,
      "grad_norm": 0.49110028377376,
      "learning_rate": 4.3388860985045146e-05,
      "loss": 1.5062,
      "num_input_tokens_seen": 21145120288,
      "step": 26876
    },
    {
      "epoch": 2.8513685550604713,
      "grad_norm": 0.4597329382271463,
      "learning_rate": 4.3388390160456974e-05,
      "loss": 1.731,
      "num_input_tokens_seen": 21145907040,
      "step": 26877
    },
    {
      "epoch": 2.8514746446000423,
      "grad_norm": 0.38206573981676517,
      "learning_rate": 4.338791932165879e-05,
      "loss": 1.686,
      "num_input_tokens_seen": 21146693792,
      "step": 26878
    },
    {
      "epoch": 2.8515807341396138,
      "grad_norm": 0.4755464820215422,
      "learning_rate": 4.3387448468650965e-05,
      "loss": 1.5806,
      "num_input_tokens_seen": 21147480608,
      "step": 26879
    },
    {
      "epoch": 2.8516868236791852,
      "grad_norm": 0.6183603935875273,
      "learning_rate": 4.3386977601433854e-05,
      "loss": 1.6275,
      "num_input_tokens_seen": 21148267312,
      "step": 26880
    },
    {
      "epoch": 2.8517929132187567,
      "grad_norm": 0.3786479519151149,
      "learning_rate": 4.338650672000783e-05,
      "loss": 1.6157,
      "num_input_tokens_seen": 21149054112,
      "step": 26881
    },
    {
      "epoch": 2.851899002758328,
      "grad_norm": 0.6242368910912194,
      "learning_rate": 4.338603582437326e-05,
      "loss": 1.6346,
      "num_input_tokens_seen": 21149840720,
      "step": 26882
    },
    {
      "epoch": 2.8520050922978992,
      "grad_norm": 0.3741038764225404,
      "learning_rate": 4.33855649145305e-05,
      "loss": 1.5798,
      "num_input_tokens_seen": 21150627392,
      "step": 26883
    },
    {
      "epoch": 2.8521111818374707,
      "grad_norm": 0.4059288297302019,
      "learning_rate": 4.338509399047991e-05,
      "loss": 1.5668,
      "num_input_tokens_seen": 21151414096,
      "step": 26884
    },
    {
      "epoch": 2.852217271377042,
      "grad_norm": 0.47393444586198075,
      "learning_rate": 4.338462305222185e-05,
      "loss": 1.6253,
      "num_input_tokens_seen": 21152200960,
      "step": 26885
    },
    {
      "epoch": 2.8523233609166136,
      "grad_norm": 0.5069208346216008,
      "learning_rate": 4.33841520997567e-05,
      "loss": 1.6193,
      "num_input_tokens_seen": 21152987680,
      "step": 26886
    },
    {
      "epoch": 2.852429450456185,
      "grad_norm": 0.3535034312292297,
      "learning_rate": 4.338368113308482e-05,
      "loss": 1.4421,
      "num_input_tokens_seen": 21153774448,
      "step": 26887
    },
    {
      "epoch": 2.852535539995756,
      "grad_norm": 0.5147511743151606,
      "learning_rate": 4.338321015220657e-05,
      "loss": 1.6704,
      "num_input_tokens_seen": 21154561264,
      "step": 26888
    },
    {
      "epoch": 2.852641629535328,
      "grad_norm": 0.3529218648122089,
      "learning_rate": 4.3382739157122315e-05,
      "loss": 1.4604,
      "num_input_tokens_seen": 21155348032,
      "step": 26889
    },
    {
      "epoch": 2.852747719074899,
      "grad_norm": 0.38098907272911375,
      "learning_rate": 4.3382268147832415e-05,
      "loss": 1.5329,
      "num_input_tokens_seen": 21156134880,
      "step": 26890
    },
    {
      "epoch": 2.8528538086144706,
      "grad_norm": 0.4256312505522983,
      "learning_rate": 4.3381797124337244e-05,
      "loss": 1.6073,
      "num_input_tokens_seen": 21156921648,
      "step": 26891
    },
    {
      "epoch": 2.852959898154042,
      "grad_norm": 0.4486347037707839,
      "learning_rate": 4.3381326086637154e-05,
      "loss": 1.6261,
      "num_input_tokens_seen": 21157708464,
      "step": 26892
    },
    {
      "epoch": 2.8530659876936135,
      "grad_norm": 0.37283335157460284,
      "learning_rate": 4.338085503473251e-05,
      "loss": 1.5895,
      "num_input_tokens_seen": 21158495136,
      "step": 26893
    },
    {
      "epoch": 2.853172077233185,
      "grad_norm": 0.38218232286993054,
      "learning_rate": 4.338038396862369e-05,
      "loss": 1.5735,
      "num_input_tokens_seen": 21159281872,
      "step": 26894
    },
    {
      "epoch": 2.853278166772756,
      "grad_norm": 0.48611140792330937,
      "learning_rate": 4.337991288831104e-05,
      "loss": 1.5984,
      "num_input_tokens_seen": 21160068656,
      "step": 26895
    },
    {
      "epoch": 2.8533842563123275,
      "grad_norm": 0.39246002444116196,
      "learning_rate": 4.337944179379494e-05,
      "loss": 1.4296,
      "num_input_tokens_seen": 21160855424,
      "step": 26896
    },
    {
      "epoch": 2.853490345851899,
      "grad_norm": 0.41512639826925374,
      "learning_rate": 4.3378970685075745e-05,
      "loss": 1.5602,
      "num_input_tokens_seen": 21161642240,
      "step": 26897
    },
    {
      "epoch": 2.8535964353914705,
      "grad_norm": 0.3865569406805059,
      "learning_rate": 4.337849956215382e-05,
      "loss": 1.6354,
      "num_input_tokens_seen": 21162429056,
      "step": 26898
    },
    {
      "epoch": 2.853702524931042,
      "grad_norm": 0.3581508410893947,
      "learning_rate": 4.3378028425029526e-05,
      "loss": 1.5995,
      "num_input_tokens_seen": 21163215744,
      "step": 26899
    },
    {
      "epoch": 2.853808614470613,
      "grad_norm": 0.3749914266901069,
      "learning_rate": 4.337755727370324e-05,
      "loss": 1.5745,
      "num_input_tokens_seen": 21164002464,
      "step": 26900
    },
    {
      "epoch": 2.8539147040101844,
      "grad_norm": 0.38392949080070554,
      "learning_rate": 4.3377086108175306e-05,
      "loss": 1.5954,
      "num_input_tokens_seen": 21164789232,
      "step": 26901
    },
    {
      "epoch": 2.854020793549756,
      "grad_norm": 0.49761025756813815,
      "learning_rate": 4.337661492844611e-05,
      "loss": 1.6159,
      "num_input_tokens_seen": 21165576080,
      "step": 26902
    },
    {
      "epoch": 2.8541268830893274,
      "grad_norm": 0.5364794949842109,
      "learning_rate": 4.3376143734515995e-05,
      "loss": 1.6142,
      "num_input_tokens_seen": 21166362896,
      "step": 26903
    },
    {
      "epoch": 2.854232972628899,
      "grad_norm": 0.47416776024830903,
      "learning_rate": 4.337567252638534e-05,
      "loss": 1.6491,
      "num_input_tokens_seen": 21167149664,
      "step": 26904
    },
    {
      "epoch": 2.8543390621684703,
      "grad_norm": 0.5813009296992786,
      "learning_rate": 4.3375201304054505e-05,
      "loss": 1.6006,
      "num_input_tokens_seen": 21167936448,
      "step": 26905
    },
    {
      "epoch": 2.854445151708042,
      "grad_norm": 0.4541884697417135,
      "learning_rate": 4.337473006752385e-05,
      "loss": 1.5568,
      "num_input_tokens_seen": 21168723184,
      "step": 26906
    },
    {
      "epoch": 2.854551241247613,
      "grad_norm": 0.6021059015596432,
      "learning_rate": 4.337425881679374e-05,
      "loss": 1.5424,
      "num_input_tokens_seen": 21169509936,
      "step": 26907
    },
    {
      "epoch": 2.8546573307871843,
      "grad_norm": 0.3417918819527003,
      "learning_rate": 4.3373787551864556e-05,
      "loss": 1.4054,
      "num_input_tokens_seen": 21170296784,
      "step": 26908
    },
    {
      "epoch": 2.854763420326756,
      "grad_norm": 0.5133039809536228,
      "learning_rate": 4.3373316272736644e-05,
      "loss": 1.4833,
      "num_input_tokens_seen": 21171083600,
      "step": 26909
    },
    {
      "epoch": 2.8548695098663273,
      "grad_norm": 0.39152531921100725,
      "learning_rate": 4.3372844979410366e-05,
      "loss": 1.536,
      "num_input_tokens_seen": 21171870352,
      "step": 26910
    },
    {
      "epoch": 2.8549755994058987,
      "grad_norm": 0.37331578991895253,
      "learning_rate": 4.337237367188609e-05,
      "loss": 1.4318,
      "num_input_tokens_seen": 21172657232,
      "step": 26911
    },
    {
      "epoch": 2.8550816889454698,
      "grad_norm": 0.45069870863042666,
      "learning_rate": 4.337190235016419e-05,
      "loss": 1.6637,
      "num_input_tokens_seen": 21173444096,
      "step": 26912
    },
    {
      "epoch": 2.8551877784850412,
      "grad_norm": 0.4561868960532244,
      "learning_rate": 4.337143101424502e-05,
      "loss": 1.6145,
      "num_input_tokens_seen": 21174230832,
      "step": 26913
    },
    {
      "epoch": 2.8552938680246127,
      "grad_norm": 0.4101819843409807,
      "learning_rate": 4.337095966412895e-05,
      "loss": 1.6634,
      "num_input_tokens_seen": 21175017632,
      "step": 26914
    },
    {
      "epoch": 2.855399957564184,
      "grad_norm": 0.3613714379138116,
      "learning_rate": 4.337048829981634e-05,
      "loss": 1.4924,
      "num_input_tokens_seen": 21175804512,
      "step": 26915
    },
    {
      "epoch": 2.8555060471037557,
      "grad_norm": 0.44767670445122554,
      "learning_rate": 4.337001692130755e-05,
      "loss": 1.5261,
      "num_input_tokens_seen": 21176591360,
      "step": 26916
    },
    {
      "epoch": 2.8556121366433267,
      "grad_norm": 0.35818813067823474,
      "learning_rate": 4.336954552860295e-05,
      "loss": 1.5829,
      "num_input_tokens_seen": 21177378160,
      "step": 26917
    },
    {
      "epoch": 2.8557182261828986,
      "grad_norm": 0.35884850616591396,
      "learning_rate": 4.3369074121702914e-05,
      "loss": 1.5389,
      "num_input_tokens_seen": 21178164928,
      "step": 26918
    },
    {
      "epoch": 2.8558243157224696,
      "grad_norm": 0.3850608699094039,
      "learning_rate": 4.336860270060779e-05,
      "loss": 1.5028,
      "num_input_tokens_seen": 21178951680,
      "step": 26919
    },
    {
      "epoch": 2.855930405262041,
      "grad_norm": 0.4224568443281389,
      "learning_rate": 4.336813126531795e-05,
      "loss": 1.5561,
      "num_input_tokens_seen": 21179738448,
      "step": 26920
    },
    {
      "epoch": 2.8560364948016126,
      "grad_norm": 0.3989586071740722,
      "learning_rate": 4.336765981583376e-05,
      "loss": 1.4324,
      "num_input_tokens_seen": 21180525168,
      "step": 26921
    },
    {
      "epoch": 2.856142584341184,
      "grad_norm": 0.38340956884642274,
      "learning_rate": 4.3367188352155575e-05,
      "loss": 1.5676,
      "num_input_tokens_seen": 21181311952,
      "step": 26922
    },
    {
      "epoch": 2.8562486738807555,
      "grad_norm": 0.39218241734452874,
      "learning_rate": 4.336671687428376e-05,
      "loss": 1.5977,
      "num_input_tokens_seen": 21182098704,
      "step": 26923
    },
    {
      "epoch": 2.8563547634203266,
      "grad_norm": 0.42267617603289837,
      "learning_rate": 4.3366245382218706e-05,
      "loss": 1.5435,
      "num_input_tokens_seen": 21182885536,
      "step": 26924
    },
    {
      "epoch": 2.856460852959898,
      "grad_norm": 0.3923879815339683,
      "learning_rate": 4.336577387596074e-05,
      "loss": 1.594,
      "num_input_tokens_seen": 21183672224,
      "step": 26925
    },
    {
      "epoch": 2.8565669424994695,
      "grad_norm": 0.4181859322615796,
      "learning_rate": 4.336530235551025e-05,
      "loss": 1.6863,
      "num_input_tokens_seen": 21184459088,
      "step": 26926
    },
    {
      "epoch": 2.856673032039041,
      "grad_norm": 0.42116234348004866,
      "learning_rate": 4.336483082086759e-05,
      "loss": 1.6735,
      "num_input_tokens_seen": 21185245840,
      "step": 26927
    },
    {
      "epoch": 2.8567791215786125,
      "grad_norm": 0.3732698174393805,
      "learning_rate": 4.336435927203313e-05,
      "loss": 1.6671,
      "num_input_tokens_seen": 21186032528,
      "step": 26928
    },
    {
      "epoch": 2.8568852111181835,
      "grad_norm": 0.41234059491850383,
      "learning_rate": 4.3363887709007225e-05,
      "loss": 1.5482,
      "num_input_tokens_seen": 21186819312,
      "step": 26929
    },
    {
      "epoch": 2.8569913006577554,
      "grad_norm": 0.4130411607396857,
      "learning_rate": 4.336341613179025e-05,
      "loss": 1.606,
      "num_input_tokens_seen": 21187606048,
      "step": 26930
    },
    {
      "epoch": 2.8570973901973264,
      "grad_norm": 0.35692721160875407,
      "learning_rate": 4.336294454038257e-05,
      "loss": 1.4538,
      "num_input_tokens_seen": 21188392832,
      "step": 26931
    },
    {
      "epoch": 2.857203479736898,
      "grad_norm": 0.41570395937510435,
      "learning_rate": 4.336247293478455e-05,
      "loss": 1.5393,
      "num_input_tokens_seen": 21189179584,
      "step": 26932
    },
    {
      "epoch": 2.8573095692764694,
      "grad_norm": 0.3724694083062475,
      "learning_rate": 4.3362001314996535e-05,
      "loss": 1.5414,
      "num_input_tokens_seen": 21189966400,
      "step": 26933
    },
    {
      "epoch": 2.857415658816041,
      "grad_norm": 0.4360802502556668,
      "learning_rate": 4.3361529681018915e-05,
      "loss": 1.5819,
      "num_input_tokens_seen": 21190753088,
      "step": 26934
    },
    {
      "epoch": 2.8575217483556123,
      "grad_norm": 0.48313389255012573,
      "learning_rate": 4.336105803285204e-05,
      "loss": 1.5683,
      "num_input_tokens_seen": 21191539856,
      "step": 26935
    },
    {
      "epoch": 2.8576278378951834,
      "grad_norm": 0.48347912964782747,
      "learning_rate": 4.336058637049628e-05,
      "loss": 1.5861,
      "num_input_tokens_seen": 21192326608,
      "step": 26936
    },
    {
      "epoch": 2.857733927434755,
      "grad_norm": 0.5015923227031799,
      "learning_rate": 4.336011469395199e-05,
      "loss": 1.514,
      "num_input_tokens_seen": 21193113408,
      "step": 26937
    },
    {
      "epoch": 2.8578400169743263,
      "grad_norm": 0.4442923177718828,
      "learning_rate": 4.3359643003219554e-05,
      "loss": 1.6048,
      "num_input_tokens_seen": 21193900192,
      "step": 26938
    },
    {
      "epoch": 2.857946106513898,
      "grad_norm": 0.39807354731565747,
      "learning_rate": 4.335917129829932e-05,
      "loss": 1.564,
      "num_input_tokens_seen": 21194686912,
      "step": 26939
    },
    {
      "epoch": 2.8580521960534693,
      "grad_norm": 0.39228384959797125,
      "learning_rate": 4.3358699579191655e-05,
      "loss": 1.6731,
      "num_input_tokens_seen": 21195473552,
      "step": 26940
    },
    {
      "epoch": 2.8581582855930403,
      "grad_norm": 0.37466673910525367,
      "learning_rate": 4.335822784589693e-05,
      "loss": 1.6555,
      "num_input_tokens_seen": 21196260336,
      "step": 26941
    },
    {
      "epoch": 2.858264375132612,
      "grad_norm": 0.41248092365276534,
      "learning_rate": 4.335775609841549e-05,
      "loss": 1.7096,
      "num_input_tokens_seen": 21197047040,
      "step": 26942
    },
    {
      "epoch": 2.8583704646721833,
      "grad_norm": 0.3693690728154932,
      "learning_rate": 4.335728433674773e-05,
      "loss": 1.5798,
      "num_input_tokens_seen": 21197833808,
      "step": 26943
    },
    {
      "epoch": 2.8584765542117547,
      "grad_norm": 0.4099653232093442,
      "learning_rate": 4.3356812560894e-05,
      "loss": 1.5751,
      "num_input_tokens_seen": 21198620560,
      "step": 26944
    },
    {
      "epoch": 2.858582643751326,
      "grad_norm": 0.3970848312509333,
      "learning_rate": 4.335634077085465e-05,
      "loss": 1.4712,
      "num_input_tokens_seen": 21199407376,
      "step": 26945
    },
    {
      "epoch": 2.8586887332908977,
      "grad_norm": 0.35697345713124423,
      "learning_rate": 4.335586896663008e-05,
      "loss": 1.4921,
      "num_input_tokens_seen": 21200194112,
      "step": 26946
    },
    {
      "epoch": 2.858794822830469,
      "grad_norm": 1.231975849270502,
      "learning_rate": 4.335539714822061e-05,
      "loss": 1.6539,
      "num_input_tokens_seen": 21200980960,
      "step": 26947
    },
    {
      "epoch": 2.85890091237004,
      "grad_norm": 6.797571120228489,
      "learning_rate": 4.3354925315626644e-05,
      "loss": 1.5625,
      "num_input_tokens_seen": 21201767632,
      "step": 26948
    },
    {
      "epoch": 2.8590070019096117,
      "grad_norm": 2.0419723115375814,
      "learning_rate": 4.335445346884852e-05,
      "loss": 1.6482,
      "num_input_tokens_seen": 21202554368,
      "step": 26949
    },
    {
      "epoch": 2.859113091449183,
      "grad_norm": 0.9536920536222753,
      "learning_rate": 4.335398160788662e-05,
      "loss": 1.5189,
      "num_input_tokens_seen": 21203341296,
      "step": 26950
    },
    {
      "epoch": 2.8592191809887546,
      "grad_norm": 3.0161378225718987,
      "learning_rate": 4.33535097327413e-05,
      "loss": 1.5868,
      "num_input_tokens_seen": 21204127984,
      "step": 26951
    },
    {
      "epoch": 2.859325270528326,
      "grad_norm": 1.455195813369798,
      "learning_rate": 4.335303784341292e-05,
      "loss": 1.4848,
      "num_input_tokens_seen": 21204914784,
      "step": 26952
    },
    {
      "epoch": 2.859431360067897,
      "grad_norm": 0.6692558331614599,
      "learning_rate": 4.335256593990186e-05,
      "loss": 1.4772,
      "num_input_tokens_seen": 21205701616,
      "step": 26953
    },
    {
      "epoch": 2.8595374496074686,
      "grad_norm": 0.9350735269459354,
      "learning_rate": 4.335209402220848e-05,
      "loss": 1.6803,
      "num_input_tokens_seen": 21206488384,
      "step": 26954
    },
    {
      "epoch": 2.85964353914704,
      "grad_norm": 1.0527187287832518,
      "learning_rate": 4.335162209033313e-05,
      "loss": 1.6512,
      "num_input_tokens_seen": 21207275136,
      "step": 26955
    },
    {
      "epoch": 2.8597496286866115,
      "grad_norm": 0.5288962528680714,
      "learning_rate": 4.335115014427619e-05,
      "loss": 1.5862,
      "num_input_tokens_seen": 21208061968,
      "step": 26956
    },
    {
      "epoch": 2.859855718226183,
      "grad_norm": 0.6858692405045467,
      "learning_rate": 4.335067818403801e-05,
      "loss": 1.5965,
      "num_input_tokens_seen": 21208848752,
      "step": 26957
    },
    {
      "epoch": 2.859961807765754,
      "grad_norm": 0.5075494984739946,
      "learning_rate": 4.335020620961897e-05,
      "loss": 1.5547,
      "num_input_tokens_seen": 21209635488,
      "step": 26958
    },
    {
      "epoch": 2.860067897305326,
      "grad_norm": 0.4983785432286895,
      "learning_rate": 4.334973422101943e-05,
      "loss": 1.376,
      "num_input_tokens_seen": 21210422272,
      "step": 26959
    },
    {
      "epoch": 2.860173986844897,
      "grad_norm": 0.5319965654565162,
      "learning_rate": 4.334926221823976e-05,
      "loss": 1.6899,
      "num_input_tokens_seen": 21211208976,
      "step": 26960
    },
    {
      "epoch": 2.8602800763844685,
      "grad_norm": 0.3960873089001047,
      "learning_rate": 4.334879020128031e-05,
      "loss": 1.5785,
      "num_input_tokens_seen": 21211995808,
      "step": 26961
    },
    {
      "epoch": 2.86038616592404,
      "grad_norm": 0.4863087349507619,
      "learning_rate": 4.334831817014146e-05,
      "loss": 1.3692,
      "num_input_tokens_seen": 21212782624,
      "step": 26962
    },
    {
      "epoch": 2.8604922554636114,
      "grad_norm": 0.6332992531970685,
      "learning_rate": 4.334784612482356e-05,
      "loss": 1.6607,
      "num_input_tokens_seen": 21213569408,
      "step": 26963
    },
    {
      "epoch": 2.860598345003183,
      "grad_norm": 0.570875508652445,
      "learning_rate": 4.334737406532698e-05,
      "loss": 1.7127,
      "num_input_tokens_seen": 21214356160,
      "step": 26964
    },
    {
      "epoch": 2.860704434542754,
      "grad_norm": 0.648076185612899,
      "learning_rate": 4.33469019916521e-05,
      "loss": 1.61,
      "num_input_tokens_seen": 21215142928,
      "step": 26965
    },
    {
      "epoch": 2.8608105240823254,
      "grad_norm": 0.5257642976675415,
      "learning_rate": 4.334642990379927e-05,
      "loss": 1.5383,
      "num_input_tokens_seen": 21215929600,
      "step": 26966
    },
    {
      "epoch": 2.860916613621897,
      "grad_norm": 0.5990337387836899,
      "learning_rate": 4.334595780176885e-05,
      "loss": 1.5059,
      "num_input_tokens_seen": 21216716368,
      "step": 26967
    },
    {
      "epoch": 2.8610227031614683,
      "grad_norm": 0.5073817548568117,
      "learning_rate": 4.334548568556121e-05,
      "loss": 1.6527,
      "num_input_tokens_seen": 21217503184,
      "step": 26968
    },
    {
      "epoch": 2.86112879270104,
      "grad_norm": 0.535699278741644,
      "learning_rate": 4.334501355517673e-05,
      "loss": 1.5429,
      "num_input_tokens_seen": 21218289952,
      "step": 26969
    },
    {
      "epoch": 2.861234882240611,
      "grad_norm": 0.5414568629470128,
      "learning_rate": 4.334454141061576e-05,
      "loss": 1.5464,
      "num_input_tokens_seen": 21219076672,
      "step": 26970
    },
    {
      "epoch": 2.8613409717801823,
      "grad_norm": 0.5108437167225438,
      "learning_rate": 4.334406925187866e-05,
      "loss": 1.6348,
      "num_input_tokens_seen": 21219863504,
      "step": 26971
    },
    {
      "epoch": 2.861447061319754,
      "grad_norm": 0.4734131758633008,
      "learning_rate": 4.33435970789658e-05,
      "loss": 1.6679,
      "num_input_tokens_seen": 21220650320,
      "step": 26972
    },
    {
      "epoch": 2.8615531508593253,
      "grad_norm": 0.7597475881352531,
      "learning_rate": 4.334312489187755e-05,
      "loss": 1.8668,
      "num_input_tokens_seen": 21221437024,
      "step": 26973
    },
    {
      "epoch": 2.8616592403988967,
      "grad_norm": 0.4310064478802653,
      "learning_rate": 4.334265269061427e-05,
      "loss": 1.623,
      "num_input_tokens_seen": 21222223792,
      "step": 26974
    },
    {
      "epoch": 2.861765329938468,
      "grad_norm": 0.48162869702553696,
      "learning_rate": 4.3342180475176334e-05,
      "loss": 1.5016,
      "num_input_tokens_seen": 21223010640,
      "step": 26975
    },
    {
      "epoch": 2.8618714194780397,
      "grad_norm": 0.5244804196923326,
      "learning_rate": 4.334170824556408e-05,
      "loss": 1.5775,
      "num_input_tokens_seen": 21223797488,
      "step": 26976
    },
    {
      "epoch": 2.8619775090176107,
      "grad_norm": 0.43886537193612446,
      "learning_rate": 4.334123600177791e-05,
      "loss": 1.6795,
      "num_input_tokens_seen": 21224584144,
      "step": 26977
    },
    {
      "epoch": 2.862083598557182,
      "grad_norm": 0.47451453789619,
      "learning_rate": 4.334076374381817e-05,
      "loss": 1.6895,
      "num_input_tokens_seen": 21225370848,
      "step": 26978
    },
    {
      "epoch": 2.8621896880967537,
      "grad_norm": 0.4850618907399356,
      "learning_rate": 4.3340291471685216e-05,
      "loss": 1.4877,
      "num_input_tokens_seen": 21226157696,
      "step": 26979
    },
    {
      "epoch": 2.862295777636325,
      "grad_norm": 0.4241535951715842,
      "learning_rate": 4.333981918537943e-05,
      "loss": 1.5047,
      "num_input_tokens_seen": 21226944448,
      "step": 26980
    },
    {
      "epoch": 2.8624018671758966,
      "grad_norm": 0.5005851897558249,
      "learning_rate": 4.333934688490117e-05,
      "loss": 1.613,
      "num_input_tokens_seen": 21227731216,
      "step": 26981
    },
    {
      "epoch": 2.8625079567154676,
      "grad_norm": 0.4500014713600935,
      "learning_rate": 4.33388745702508e-05,
      "loss": 1.564,
      "num_input_tokens_seen": 21228517952,
      "step": 26982
    },
    {
      "epoch": 2.862614046255039,
      "grad_norm": 0.599752340589514,
      "learning_rate": 4.333840224142868e-05,
      "loss": 1.6891,
      "num_input_tokens_seen": 21229304752,
      "step": 26983
    },
    {
      "epoch": 2.8627201357946106,
      "grad_norm": 0.4840757090460189,
      "learning_rate": 4.3337929898435186e-05,
      "loss": 1.5582,
      "num_input_tokens_seen": 21230091488,
      "step": 26984
    },
    {
      "epoch": 2.862826225334182,
      "grad_norm": 0.44862875654469814,
      "learning_rate": 4.3337457541270674e-05,
      "loss": 1.6301,
      "num_input_tokens_seen": 21230878192,
      "step": 26985
    },
    {
      "epoch": 2.8629323148737535,
      "grad_norm": 0.5860995732704323,
      "learning_rate": 4.333698516993552e-05,
      "loss": 1.7614,
      "num_input_tokens_seen": 21231664976,
      "step": 26986
    },
    {
      "epoch": 2.8630384044133246,
      "grad_norm": 0.39570748320232785,
      "learning_rate": 4.333651278443008e-05,
      "loss": 1.6427,
      "num_input_tokens_seen": 21232451808,
      "step": 26987
    },
    {
      "epoch": 2.8631444939528965,
      "grad_norm": 0.5404292286808242,
      "learning_rate": 4.333604038475472e-05,
      "loss": 1.6132,
      "num_input_tokens_seen": 21233238544,
      "step": 26988
    },
    {
      "epoch": 2.8632505834924675,
      "grad_norm": 0.5082482694931051,
      "learning_rate": 4.3335567970909803e-05,
      "loss": 1.5916,
      "num_input_tokens_seen": 21234025328,
      "step": 26989
    },
    {
      "epoch": 2.863356673032039,
      "grad_norm": 0.5159500482228842,
      "learning_rate": 4.3335095542895695e-05,
      "loss": 1.5568,
      "num_input_tokens_seen": 21234812128,
      "step": 26990
    },
    {
      "epoch": 2.8634627625716105,
      "grad_norm": 0.4424201685381363,
      "learning_rate": 4.3334623100712766e-05,
      "loss": 1.4545,
      "num_input_tokens_seen": 21235598832,
      "step": 26991
    },
    {
      "epoch": 2.863568852111182,
      "grad_norm": 0.42903272992766783,
      "learning_rate": 4.333415064436138e-05,
      "loss": 1.5752,
      "num_input_tokens_seen": 21236385616,
      "step": 26992
    },
    {
      "epoch": 2.8636749416507534,
      "grad_norm": 0.48718844133044376,
      "learning_rate": 4.33336781738419e-05,
      "loss": 1.4935,
      "num_input_tokens_seen": 21237172432,
      "step": 26993
    },
    {
      "epoch": 2.8637810311903245,
      "grad_norm": 0.35326282124289266,
      "learning_rate": 4.33332056891547e-05,
      "loss": 1.6034,
      "num_input_tokens_seen": 21237959264,
      "step": 26994
    },
    {
      "epoch": 2.863887120729896,
      "grad_norm": 0.4613245144820762,
      "learning_rate": 4.3332733190300124e-05,
      "loss": 1.665,
      "num_input_tokens_seen": 21238746064,
      "step": 26995
    },
    {
      "epoch": 2.8639932102694674,
      "grad_norm": 0.41623804873943343,
      "learning_rate": 4.3332260677278555e-05,
      "loss": 1.4808,
      "num_input_tokens_seen": 21239532752,
      "step": 26996
    },
    {
      "epoch": 2.864099299809039,
      "grad_norm": 0.36451672740973967,
      "learning_rate": 4.3331788150090347e-05,
      "loss": 1.5757,
      "num_input_tokens_seen": 21240319520,
      "step": 26997
    },
    {
      "epoch": 2.8642053893486104,
      "grad_norm": 0.5003827053409411,
      "learning_rate": 4.333131560873588e-05,
      "loss": 1.5022,
      "num_input_tokens_seen": 21241106304,
      "step": 26998
    },
    {
      "epoch": 2.8643114788881814,
      "grad_norm": 0.5490803106947741,
      "learning_rate": 4.33308430532155e-05,
      "loss": 1.4959,
      "num_input_tokens_seen": 21241893072,
      "step": 26999
    },
    {
      "epoch": 2.864417568427753,
      "grad_norm": 0.38195188827234255,
      "learning_rate": 4.333037048352959e-05,
      "loss": 1.6363,
      "num_input_tokens_seen": 21242679824,
      "step": 27000
    },
    {
      "epoch": 2.864417568427753,
      "eval_loss": 1.6422624588012695,
      "eval_runtime": 64.6678,
      "eval_samples_per_second": 46.391,
      "eval_steps_per_second": 0.495,
      "num_input_tokens_seen": 21242679824,
      "step": 27000
    },
    {
      "epoch": 2.8645236579673243,
      "grad_norm": 0.4910937718831045,
      "learning_rate": 4.332989789967851e-05,
      "loss": 1.4701,
      "num_input_tokens_seen": 21243466592,
      "step": 27001
    },
    {
      "epoch": 2.864629747506896,
      "grad_norm": 0.8767312752233835,
      "learning_rate": 4.332942530166262e-05,
      "loss": 1.5242,
      "num_input_tokens_seen": 21244253408,
      "step": 27002
    },
    {
      "epoch": 2.8647358370464673,
      "grad_norm": 0.512553271590501,
      "learning_rate": 4.3328952689482285e-05,
      "loss": 1.5469,
      "num_input_tokens_seen": 21245040112,
      "step": 27003
    },
    {
      "epoch": 2.8648419265860388,
      "grad_norm": 1.2542213289365225,
      "learning_rate": 4.332848006313787e-05,
      "loss": 1.5415,
      "num_input_tokens_seen": 21245826832,
      "step": 27004
    },
    {
      "epoch": 2.8649480161256102,
      "grad_norm": 0.5158919623308525,
      "learning_rate": 4.332800742262975e-05,
      "loss": 1.5356,
      "num_input_tokens_seen": 21246613536,
      "step": 27005
    },
    {
      "epoch": 2.8650541056651813,
      "grad_norm": 0.8088035721974225,
      "learning_rate": 4.3327534767958276e-05,
      "loss": 1.6091,
      "num_input_tokens_seen": 21247400288,
      "step": 27006
    },
    {
      "epoch": 2.8651601952047527,
      "grad_norm": 0.5178648235304479,
      "learning_rate": 4.332706209912383e-05,
      "loss": 1.5173,
      "num_input_tokens_seen": 21248187104,
      "step": 27007
    },
    {
      "epoch": 2.865266284744324,
      "grad_norm": 0.6633350464256349,
      "learning_rate": 4.3326589416126764e-05,
      "loss": 1.5857,
      "num_input_tokens_seen": 21248973856,
      "step": 27008
    },
    {
      "epoch": 2.8653723742838957,
      "grad_norm": 0.4027987130554774,
      "learning_rate": 4.332611671896745e-05,
      "loss": 1.5607,
      "num_input_tokens_seen": 21249760576,
      "step": 27009
    },
    {
      "epoch": 2.865478463823467,
      "grad_norm": 0.6568669863027576,
      "learning_rate": 4.332564400764625e-05,
      "loss": 1.5834,
      "num_input_tokens_seen": 21250547408,
      "step": 27010
    },
    {
      "epoch": 2.865584553363038,
      "grad_norm": 0.3927576932860481,
      "learning_rate": 4.3325171282163524e-05,
      "loss": 1.5341,
      "num_input_tokens_seen": 21251334224,
      "step": 27011
    },
    {
      "epoch": 2.8656906429026097,
      "grad_norm": 0.47616155472571664,
      "learning_rate": 4.3324698542519646e-05,
      "loss": 1.6771,
      "num_input_tokens_seen": 21252120944,
      "step": 27012
    },
    {
      "epoch": 2.865796732442181,
      "grad_norm": 0.4536842728648922,
      "learning_rate": 4.332422578871498e-05,
      "loss": 1.656,
      "num_input_tokens_seen": 21252907616,
      "step": 27013
    },
    {
      "epoch": 2.8659028219817526,
      "grad_norm": 0.3908289061281222,
      "learning_rate": 4.332375302074989e-05,
      "loss": 1.6415,
      "num_input_tokens_seen": 21253694320,
      "step": 27014
    },
    {
      "epoch": 2.866008911521324,
      "grad_norm": 0.3805187926439546,
      "learning_rate": 4.3323280238624744e-05,
      "loss": 1.4763,
      "num_input_tokens_seen": 21254481232,
      "step": 27015
    },
    {
      "epoch": 2.8661150010608956,
      "grad_norm": 0.44254258693753484,
      "learning_rate": 4.33228074423399e-05,
      "loss": 1.5897,
      "num_input_tokens_seen": 21255267984,
      "step": 27016
    },
    {
      "epoch": 2.866221090600467,
      "grad_norm": 0.4035520427826197,
      "learning_rate": 4.332233463189574e-05,
      "loss": 1.5888,
      "num_input_tokens_seen": 21256054736,
      "step": 27017
    },
    {
      "epoch": 2.866327180140038,
      "grad_norm": 0.47083217662109533,
      "learning_rate": 4.3321861807292604e-05,
      "loss": 1.6325,
      "num_input_tokens_seen": 21256841552,
      "step": 27018
    },
    {
      "epoch": 2.8664332696796095,
      "grad_norm": 0.3814975324302438,
      "learning_rate": 4.3321388968530874e-05,
      "loss": 1.6212,
      "num_input_tokens_seen": 21257628256,
      "step": 27019
    },
    {
      "epoch": 2.866539359219181,
      "grad_norm": 0.39617902666879845,
      "learning_rate": 4.332091611561091e-05,
      "loss": 1.6086,
      "num_input_tokens_seen": 21258414992,
      "step": 27020
    },
    {
      "epoch": 2.8666454487587525,
      "grad_norm": 0.37758813037139655,
      "learning_rate": 4.3320443248533084e-05,
      "loss": 1.6319,
      "num_input_tokens_seen": 21259201728,
      "step": 27021
    },
    {
      "epoch": 2.866751538298324,
      "grad_norm": 0.38278371549310314,
      "learning_rate": 4.3319970367297755e-05,
      "loss": 1.4704,
      "num_input_tokens_seen": 21259988512,
      "step": 27022
    },
    {
      "epoch": 2.866857627837895,
      "grad_norm": 0.39516451458677204,
      "learning_rate": 4.3319497471905293e-05,
      "loss": 1.7299,
      "num_input_tokens_seen": 21260775264,
      "step": 27023
    },
    {
      "epoch": 2.8669637173774665,
      "grad_norm": 0.4741090955641674,
      "learning_rate": 4.331902456235606e-05,
      "loss": 1.662,
      "num_input_tokens_seen": 21261562064,
      "step": 27024
    },
    {
      "epoch": 2.867069806917038,
      "grad_norm": 0.45296322157667795,
      "learning_rate": 4.3318551638650416e-05,
      "loss": 1.6221,
      "num_input_tokens_seen": 21262348848,
      "step": 27025
    },
    {
      "epoch": 2.8671758964566094,
      "grad_norm": 0.41093039726156577,
      "learning_rate": 4.3318078700788746e-05,
      "loss": 1.6221,
      "num_input_tokens_seen": 21263135648,
      "step": 27026
    },
    {
      "epoch": 2.867281985996181,
      "grad_norm": 0.4943433656801391,
      "learning_rate": 4.331760574877139e-05,
      "loss": 1.6095,
      "num_input_tokens_seen": 21263922416,
      "step": 27027
    },
    {
      "epoch": 2.867388075535752,
      "grad_norm": 0.4177424107676978,
      "learning_rate": 4.331713278259873e-05,
      "loss": 1.4839,
      "num_input_tokens_seen": 21264709264,
      "step": 27028
    },
    {
      "epoch": 2.867494165075324,
      "grad_norm": 0.3648311913298735,
      "learning_rate": 4.3316659802271125e-05,
      "loss": 1.5744,
      "num_input_tokens_seen": 21265495968,
      "step": 27029
    },
    {
      "epoch": 2.867600254614895,
      "grad_norm": 0.38664008244316916,
      "learning_rate": 4.331618680778895e-05,
      "loss": 1.5044,
      "num_input_tokens_seen": 21266282720,
      "step": 27030
    },
    {
      "epoch": 2.8677063441544663,
      "grad_norm": 0.4373903677307017,
      "learning_rate": 4.331571379915256e-05,
      "loss": 1.564,
      "num_input_tokens_seen": 21267069584,
      "step": 27031
    },
    {
      "epoch": 2.867812433694038,
      "grad_norm": 0.5274117258528889,
      "learning_rate": 4.331524077636232e-05,
      "loss": 1.5189,
      "num_input_tokens_seen": 21267856432,
      "step": 27032
    },
    {
      "epoch": 2.8679185232336093,
      "grad_norm": 0.42357759095266184,
      "learning_rate": 4.33147677394186e-05,
      "loss": 1.5909,
      "num_input_tokens_seen": 21268643280,
      "step": 27033
    },
    {
      "epoch": 2.8680246127731808,
      "grad_norm": 0.46805616946755474,
      "learning_rate": 4.3314294688321765e-05,
      "loss": 1.4852,
      "num_input_tokens_seen": 21269430080,
      "step": 27034
    },
    {
      "epoch": 2.868130702312752,
      "grad_norm": 0.3692742453763149,
      "learning_rate": 4.331382162307218e-05,
      "loss": 1.54,
      "num_input_tokens_seen": 21270216944,
      "step": 27035
    },
    {
      "epoch": 2.8682367918523233,
      "grad_norm": 0.3650687817515683,
      "learning_rate": 4.3313348543670214e-05,
      "loss": 1.5945,
      "num_input_tokens_seen": 21271003664,
      "step": 27036
    },
    {
      "epoch": 2.8683428813918947,
      "grad_norm": 0.3651814825049057,
      "learning_rate": 4.331287545011623e-05,
      "loss": 1.6115,
      "num_input_tokens_seen": 21271790480,
      "step": 27037
    },
    {
      "epoch": 2.8684489709314662,
      "grad_norm": 0.38971459292439276,
      "learning_rate": 4.331240234241059e-05,
      "loss": 1.5437,
      "num_input_tokens_seen": 21272577280,
      "step": 27038
    },
    {
      "epoch": 2.8685550604710377,
      "grad_norm": 0.3966271430695779,
      "learning_rate": 4.331192922055366e-05,
      "loss": 1.6059,
      "num_input_tokens_seen": 21273363984,
      "step": 27039
    },
    {
      "epoch": 2.8686611500106087,
      "grad_norm": 0.4182144599570699,
      "learning_rate": 4.331145608454582e-05,
      "loss": 1.6129,
      "num_input_tokens_seen": 21274150720,
      "step": 27040
    },
    {
      "epoch": 2.86876723955018,
      "grad_norm": 0.42077986831205727,
      "learning_rate": 4.331098293438741e-05,
      "loss": 1.5555,
      "num_input_tokens_seen": 21274937536,
      "step": 27041
    },
    {
      "epoch": 2.8688733290897517,
      "grad_norm": 0.47883915520095705,
      "learning_rate": 4.331050977007882e-05,
      "loss": 1.5922,
      "num_input_tokens_seen": 21275724368,
      "step": 27042
    },
    {
      "epoch": 2.868979418629323,
      "grad_norm": 0.38891566330831423,
      "learning_rate": 4.33100365916204e-05,
      "loss": 1.727,
      "num_input_tokens_seen": 21276511120,
      "step": 27043
    },
    {
      "epoch": 2.8690855081688946,
      "grad_norm": 0.47511375823001184,
      "learning_rate": 4.3309563399012524e-05,
      "loss": 1.4895,
      "num_input_tokens_seen": 21277297904,
      "step": 27044
    },
    {
      "epoch": 2.869191597708466,
      "grad_norm": 0.40370490312659424,
      "learning_rate": 4.3309090192255555e-05,
      "loss": 1.4938,
      "num_input_tokens_seen": 21278084592,
      "step": 27045
    },
    {
      "epoch": 2.8692976872480376,
      "grad_norm": 0.409189451459474,
      "learning_rate": 4.3308616971349856e-05,
      "loss": 1.6444,
      "num_input_tokens_seen": 21278871376,
      "step": 27046
    },
    {
      "epoch": 2.8694037767876086,
      "grad_norm": 0.40743690258984755,
      "learning_rate": 4.3308143736295794e-05,
      "loss": 1.6212,
      "num_input_tokens_seen": 21279658096,
      "step": 27047
    },
    {
      "epoch": 2.86950986632718,
      "grad_norm": 0.37625598015518014,
      "learning_rate": 4.330767048709374e-05,
      "loss": 1.7085,
      "num_input_tokens_seen": 21280444864,
      "step": 27048
    },
    {
      "epoch": 2.8696159558667516,
      "grad_norm": 0.361573954684747,
      "learning_rate": 4.330719722374405e-05,
      "loss": 1.4731,
      "num_input_tokens_seen": 21281231664,
      "step": 27049
    },
    {
      "epoch": 2.869722045406323,
      "grad_norm": 0.3785027814272239,
      "learning_rate": 4.3306723946247095e-05,
      "loss": 1.7055,
      "num_input_tokens_seen": 21282018448,
      "step": 27050
    },
    {
      "epoch": 2.8698281349458945,
      "grad_norm": 0.3586518986161968,
      "learning_rate": 4.330625065460325e-05,
      "loss": 1.5854,
      "num_input_tokens_seen": 21282805184,
      "step": 27051
    },
    {
      "epoch": 2.8699342244854655,
      "grad_norm": 0.36701538821050683,
      "learning_rate": 4.330577734881286e-05,
      "loss": 1.5384,
      "num_input_tokens_seen": 21283592096,
      "step": 27052
    },
    {
      "epoch": 2.870040314025037,
      "grad_norm": 0.3932893507484093,
      "learning_rate": 4.3305304028876306e-05,
      "loss": 1.633,
      "num_input_tokens_seen": 21284378944,
      "step": 27053
    },
    {
      "epoch": 2.8701464035646085,
      "grad_norm": 0.37166715445781473,
      "learning_rate": 4.3304830694793955e-05,
      "loss": 1.5526,
      "num_input_tokens_seen": 21285165664,
      "step": 27054
    },
    {
      "epoch": 2.87025249310418,
      "grad_norm": 0.3543400218149761,
      "learning_rate": 4.330435734656617e-05,
      "loss": 1.6808,
      "num_input_tokens_seen": 21285952464,
      "step": 27055
    },
    {
      "epoch": 2.8703585826437514,
      "grad_norm": 0.3527561832459223,
      "learning_rate": 4.330388398419331e-05,
      "loss": 1.5271,
      "num_input_tokens_seen": 21286739248,
      "step": 27056
    },
    {
      "epoch": 2.8704646721833225,
      "grad_norm": 0.4191732495682384,
      "learning_rate": 4.3303410607675745e-05,
      "loss": 1.5929,
      "num_input_tokens_seen": 21287526016,
      "step": 27057
    },
    {
      "epoch": 2.8705707617228944,
      "grad_norm": 0.3289451411184496,
      "learning_rate": 4.330293721701384e-05,
      "loss": 1.5642,
      "num_input_tokens_seen": 21288312848,
      "step": 27058
    },
    {
      "epoch": 2.8706768512624654,
      "grad_norm": 0.3713419089153047,
      "learning_rate": 4.330246381220796e-05,
      "loss": 1.5597,
      "num_input_tokens_seen": 21289099648,
      "step": 27059
    },
    {
      "epoch": 2.870782940802037,
      "grad_norm": 0.3735601730951685,
      "learning_rate": 4.330199039325848e-05,
      "loss": 1.4428,
      "num_input_tokens_seen": 21289886368,
      "step": 27060
    },
    {
      "epoch": 2.8708890303416084,
      "grad_norm": 0.3574941125784233,
      "learning_rate": 4.3301516960165753e-05,
      "loss": 1.6101,
      "num_input_tokens_seen": 21290673120,
      "step": 27061
    },
    {
      "epoch": 2.87099511988118,
      "grad_norm": 0.31802171712922556,
      "learning_rate": 4.330104351293015e-05,
      "loss": 1.419,
      "num_input_tokens_seen": 21291459936,
      "step": 27062
    },
    {
      "epoch": 2.8711012094207513,
      "grad_norm": 0.4015289879688864,
      "learning_rate": 4.3300570051552046e-05,
      "loss": 1.654,
      "num_input_tokens_seen": 21292246640,
      "step": 27063
    },
    {
      "epoch": 2.8712072989603223,
      "grad_norm": 0.3777093849733639,
      "learning_rate": 4.330009657603179e-05,
      "loss": 1.646,
      "num_input_tokens_seen": 21293033344,
      "step": 27064
    },
    {
      "epoch": 2.871313388499894,
      "grad_norm": 0.34871119427136005,
      "learning_rate": 4.329962308636976e-05,
      "loss": 1.6369,
      "num_input_tokens_seen": 21293820128,
      "step": 27065
    },
    {
      "epoch": 2.8714194780394653,
      "grad_norm": 0.4819820416589447,
      "learning_rate": 4.329914958256632e-05,
      "loss": 1.6013,
      "num_input_tokens_seen": 21294606960,
      "step": 27066
    },
    {
      "epoch": 2.8715255675790368,
      "grad_norm": 0.3504217888162854,
      "learning_rate": 4.329867606462184e-05,
      "loss": 1.5307,
      "num_input_tokens_seen": 21295393760,
      "step": 27067
    },
    {
      "epoch": 2.8716316571186082,
      "grad_norm": 0.5098753828366936,
      "learning_rate": 4.329820253253666e-05,
      "loss": 1.5881,
      "num_input_tokens_seen": 21296180560,
      "step": 27068
    },
    {
      "epoch": 2.8717377466581793,
      "grad_norm": 0.8561047624799203,
      "learning_rate": 4.329772898631118e-05,
      "loss": 1.6258,
      "num_input_tokens_seen": 21296967344,
      "step": 27069
    },
    {
      "epoch": 2.8718438361977507,
      "grad_norm": 0.6563082448134308,
      "learning_rate": 4.329725542594575e-05,
      "loss": 1.584,
      "num_input_tokens_seen": 21297754032,
      "step": 27070
    },
    {
      "epoch": 2.871949925737322,
      "grad_norm": 0.6270922039563812,
      "learning_rate": 4.329678185144074e-05,
      "loss": 1.6055,
      "num_input_tokens_seen": 21298540816,
      "step": 27071
    },
    {
      "epoch": 2.8720560152768937,
      "grad_norm": 0.4262250740638814,
      "learning_rate": 4.329630826279651e-05,
      "loss": 1.5621,
      "num_input_tokens_seen": 21299327552,
      "step": 27072
    },
    {
      "epoch": 2.872162104816465,
      "grad_norm": 0.4646619457250937,
      "learning_rate": 4.329583466001343e-05,
      "loss": 1.5191,
      "num_input_tokens_seen": 21300114336,
      "step": 27073
    },
    {
      "epoch": 2.8722681943560366,
      "grad_norm": 0.8694463449336758,
      "learning_rate": 4.3295361043091865e-05,
      "loss": 1.687,
      "num_input_tokens_seen": 21300900928,
      "step": 27074
    },
    {
      "epoch": 2.872374283895608,
      "grad_norm": 0.6632163126390576,
      "learning_rate": 4.3294887412032186e-05,
      "loss": 1.6138,
      "num_input_tokens_seen": 21301687648,
      "step": 27075
    },
    {
      "epoch": 2.872480373435179,
      "grad_norm": 0.5394416855433276,
      "learning_rate": 4.329441376683475e-05,
      "loss": 1.6655,
      "num_input_tokens_seen": 21302474416,
      "step": 27076
    },
    {
      "epoch": 2.8725864629747506,
      "grad_norm": 0.7329726542290008,
      "learning_rate": 4.329394010749994e-05,
      "loss": 1.665,
      "num_input_tokens_seen": 21303261120,
      "step": 27077
    },
    {
      "epoch": 2.872692552514322,
      "grad_norm": 1.3115663913278337,
      "learning_rate": 4.329346643402809e-05,
      "loss": 1.639,
      "num_input_tokens_seen": 21304047856,
      "step": 27078
    },
    {
      "epoch": 2.8727986420538936,
      "grad_norm": 0.469517237065431,
      "learning_rate": 4.32929927464196e-05,
      "loss": 1.6216,
      "num_input_tokens_seen": 21304834592,
      "step": 27079
    },
    {
      "epoch": 2.872904731593465,
      "grad_norm": 0.8934919389886827,
      "learning_rate": 4.329251904467482e-05,
      "loss": 1.6985,
      "num_input_tokens_seen": 21305621248,
      "step": 27080
    },
    {
      "epoch": 2.873010821133036,
      "grad_norm": 0.7539599915550428,
      "learning_rate": 4.3292045328794115e-05,
      "loss": 1.6543,
      "num_input_tokens_seen": 21306407984,
      "step": 27081
    },
    {
      "epoch": 2.8731169106726075,
      "grad_norm": 0.7759181281484171,
      "learning_rate": 4.329157159877786e-05,
      "loss": 1.5803,
      "num_input_tokens_seen": 21307194672,
      "step": 27082
    },
    {
      "epoch": 2.873223000212179,
      "grad_norm": 0.6691961164191972,
      "learning_rate": 4.32910978546264e-05,
      "loss": 1.714,
      "num_input_tokens_seen": 21307981328,
      "step": 27083
    },
    {
      "epoch": 2.8733290897517505,
      "grad_norm": 0.6075661574957907,
      "learning_rate": 4.329062409634013e-05,
      "loss": 1.5654,
      "num_input_tokens_seen": 21308768112,
      "step": 27084
    },
    {
      "epoch": 2.873435179291322,
      "grad_norm": 0.4366238850158305,
      "learning_rate": 4.3290150323919396e-05,
      "loss": 1.6301,
      "num_input_tokens_seen": 21309554832,
      "step": 27085
    },
    {
      "epoch": 2.873541268830893,
      "grad_norm": 0.7627483736363951,
      "learning_rate": 4.328967653736458e-05,
      "loss": 1.7182,
      "num_input_tokens_seen": 21310341568,
      "step": 27086
    },
    {
      "epoch": 2.873647358370465,
      "grad_norm": 0.6341848536031021,
      "learning_rate": 4.328920273667603e-05,
      "loss": 1.6622,
      "num_input_tokens_seen": 21311128256,
      "step": 27087
    },
    {
      "epoch": 2.873753447910036,
      "grad_norm": 0.5978407009738262,
      "learning_rate": 4.3288728921854126e-05,
      "loss": 1.4701,
      "num_input_tokens_seen": 21311915120,
      "step": 27088
    },
    {
      "epoch": 2.8738595374496074,
      "grad_norm": 0.6391848635824043,
      "learning_rate": 4.328825509289922e-05,
      "loss": 1.7151,
      "num_input_tokens_seen": 21312701888,
      "step": 27089
    },
    {
      "epoch": 2.873965626989179,
      "grad_norm": 0.6580325279186309,
      "learning_rate": 4.32877812498117e-05,
      "loss": 1.6968,
      "num_input_tokens_seen": 21313488592,
      "step": 27090
    },
    {
      "epoch": 2.8740717165287504,
      "grad_norm": 0.6054430896398079,
      "learning_rate": 4.328730739259191e-05,
      "loss": 1.6194,
      "num_input_tokens_seen": 21314275392,
      "step": 27091
    },
    {
      "epoch": 2.874177806068322,
      "grad_norm": 0.7198751107120545,
      "learning_rate": 4.328683352124023e-05,
      "loss": 1.5249,
      "num_input_tokens_seen": 21315062112,
      "step": 27092
    },
    {
      "epoch": 2.874283895607893,
      "grad_norm": 0.5381797754166657,
      "learning_rate": 4.328635963575702e-05,
      "loss": 1.5498,
      "num_input_tokens_seen": 21315848896,
      "step": 27093
    },
    {
      "epoch": 2.8743899851474644,
      "grad_norm": 0.4887113481985857,
      "learning_rate": 4.3285885736142644e-05,
      "loss": 1.557,
      "num_input_tokens_seen": 21316635504,
      "step": 27094
    },
    {
      "epoch": 2.874496074687036,
      "grad_norm": 0.6765710068098597,
      "learning_rate": 4.3285411822397476e-05,
      "loss": 1.5482,
      "num_input_tokens_seen": 21317422240,
      "step": 27095
    },
    {
      "epoch": 2.8746021642266073,
      "grad_norm": 0.512887768003006,
      "learning_rate": 4.3284937894521874e-05,
      "loss": 1.5218,
      "num_input_tokens_seen": 21318208976,
      "step": 27096
    },
    {
      "epoch": 2.874708253766179,
      "grad_norm": 0.7195821513447995,
      "learning_rate": 4.328446395251622e-05,
      "loss": 1.653,
      "num_input_tokens_seen": 21318995680,
      "step": 27097
    },
    {
      "epoch": 2.87481434330575,
      "grad_norm": 0.5797856948422639,
      "learning_rate": 4.328398999638086e-05,
      "loss": 1.6832,
      "num_input_tokens_seen": 21319782400,
      "step": 27098
    },
    {
      "epoch": 2.8749204328453217,
      "grad_norm": 0.5710895245218852,
      "learning_rate": 4.3283516026116164e-05,
      "loss": 1.7158,
      "num_input_tokens_seen": 21320569120,
      "step": 27099
    },
    {
      "epoch": 2.8750265223848928,
      "grad_norm": 0.4486787273463443,
      "learning_rate": 4.328304204172251e-05,
      "loss": 1.4425,
      "num_input_tokens_seen": 21321355904,
      "step": 27100
    },
    {
      "epoch": 2.8751326119244642,
      "grad_norm": 0.42469805402418764,
      "learning_rate": 4.3282568043200256e-05,
      "loss": 1.5416,
      "num_input_tokens_seen": 21322142640,
      "step": 27101
    },
    {
      "epoch": 2.8752387014640357,
      "grad_norm": 0.46792830204643804,
      "learning_rate": 4.3282094030549775e-05,
      "loss": 1.5174,
      "num_input_tokens_seen": 21322929488,
      "step": 27102
    },
    {
      "epoch": 2.875344791003607,
      "grad_norm": 0.6454355656693102,
      "learning_rate": 4.328162000377142e-05,
      "loss": 1.723,
      "num_input_tokens_seen": 21323716256,
      "step": 27103
    },
    {
      "epoch": 2.8754508805431787,
      "grad_norm": 0.6346523985336888,
      "learning_rate": 4.3281145962865575e-05,
      "loss": 1.5499,
      "num_input_tokens_seen": 21324503088,
      "step": 27104
    },
    {
      "epoch": 2.8755569700827497,
      "grad_norm": 0.7224408952417641,
      "learning_rate": 4.328067190783259e-05,
      "loss": 1.4634,
      "num_input_tokens_seen": 21325289840,
      "step": 27105
    },
    {
      "epoch": 2.875663059622321,
      "grad_norm": 0.5334857521847954,
      "learning_rate": 4.328019783867284e-05,
      "loss": 1.6639,
      "num_input_tokens_seen": 21326076624,
      "step": 27106
    },
    {
      "epoch": 2.8757691491618926,
      "grad_norm": 0.5532150498827304,
      "learning_rate": 4.327972375538668e-05,
      "loss": 1.628,
      "num_input_tokens_seen": 21326863440,
      "step": 27107
    },
    {
      "epoch": 2.875875238701464,
      "grad_norm": 0.5632180044040126,
      "learning_rate": 4.3279249657974493e-05,
      "loss": 1.4943,
      "num_input_tokens_seen": 21327650304,
      "step": 27108
    },
    {
      "epoch": 2.8759813282410356,
      "grad_norm": 0.4763136081329554,
      "learning_rate": 4.327877554643664e-05,
      "loss": 1.6008,
      "num_input_tokens_seen": 21328437056,
      "step": 27109
    },
    {
      "epoch": 2.8760874177806066,
      "grad_norm": 0.444359251880826,
      "learning_rate": 4.3278301420773494e-05,
      "loss": 1.6149,
      "num_input_tokens_seen": 21329223840,
      "step": 27110
    },
    {
      "epoch": 2.876193507320178,
      "grad_norm": 0.6165518297546383,
      "learning_rate": 4.32778272809854e-05,
      "loss": 1.723,
      "num_input_tokens_seen": 21330010576,
      "step": 27111
    },
    {
      "epoch": 2.8762995968597496,
      "grad_norm": 0.5102301493864979,
      "learning_rate": 4.327735312707274e-05,
      "loss": 1.6941,
      "num_input_tokens_seen": 21330797360,
      "step": 27112
    },
    {
      "epoch": 2.876405686399321,
      "grad_norm": 0.40826647123866516,
      "learning_rate": 4.327687895903588e-05,
      "loss": 1.5311,
      "num_input_tokens_seen": 21331584096,
      "step": 27113
    },
    {
      "epoch": 2.8765117759388925,
      "grad_norm": 0.4725941524841294,
      "learning_rate": 4.327640477687518e-05,
      "loss": 1.5112,
      "num_input_tokens_seen": 21332370896,
      "step": 27114
    },
    {
      "epoch": 2.876617865478464,
      "grad_norm": 0.4717238845285693,
      "learning_rate": 4.3275930580591014e-05,
      "loss": 1.6715,
      "num_input_tokens_seen": 21333157760,
      "step": 27115
    },
    {
      "epoch": 2.8767239550180355,
      "grad_norm": 0.4413237466619853,
      "learning_rate": 4.327545637018375e-05,
      "loss": 1.6375,
      "num_input_tokens_seen": 21333944528,
      "step": 27116
    },
    {
      "epoch": 2.8768300445576065,
      "grad_norm": 0.44373398731624325,
      "learning_rate": 4.3274982145653745e-05,
      "loss": 1.628,
      "num_input_tokens_seen": 21334731216,
      "step": 27117
    },
    {
      "epoch": 2.876936134097178,
      "grad_norm": 0.44573891547389843,
      "learning_rate": 4.327450790700137e-05,
      "loss": 1.6268,
      "num_input_tokens_seen": 21335517984,
      "step": 27118
    },
    {
      "epoch": 2.8770422236367494,
      "grad_norm": 0.5038217004934311,
      "learning_rate": 4.3274033654226994e-05,
      "loss": 1.5911,
      "num_input_tokens_seen": 21336304640,
      "step": 27119
    },
    {
      "epoch": 2.877148313176321,
      "grad_norm": 0.3941334181687575,
      "learning_rate": 4.3273559387330975e-05,
      "loss": 1.5358,
      "num_input_tokens_seen": 21337091376,
      "step": 27120
    },
    {
      "epoch": 2.8772544027158924,
      "grad_norm": 0.519858841208146,
      "learning_rate": 4.327308510631369e-05,
      "loss": 1.6651,
      "num_input_tokens_seen": 21337878048,
      "step": 27121
    },
    {
      "epoch": 2.8773604922554634,
      "grad_norm": 0.399669904577764,
      "learning_rate": 4.32726108111755e-05,
      "loss": 1.4678,
      "num_input_tokens_seen": 21338664944,
      "step": 27122
    },
    {
      "epoch": 2.877466581795035,
      "grad_norm": 0.3341824174202593,
      "learning_rate": 4.327213650191677e-05,
      "loss": 1.4111,
      "num_input_tokens_seen": 21339451696,
      "step": 27123
    },
    {
      "epoch": 2.8775726713346064,
      "grad_norm": 0.4023607269445865,
      "learning_rate": 4.327166217853787e-05,
      "loss": 1.4555,
      "num_input_tokens_seen": 21340238512,
      "step": 27124
    },
    {
      "epoch": 2.877678760874178,
      "grad_norm": 0.4134872660593115,
      "learning_rate": 4.327118784103917e-05,
      "loss": 1.5646,
      "num_input_tokens_seen": 21341025344,
      "step": 27125
    },
    {
      "epoch": 2.8777848504137493,
      "grad_norm": 0.3629575492541391,
      "learning_rate": 4.327071348942103e-05,
      "loss": 1.5435,
      "num_input_tokens_seen": 21341812176,
      "step": 27126
    },
    {
      "epoch": 2.8778909399533203,
      "grad_norm": 0.35912074561851903,
      "learning_rate": 4.327023912368382e-05,
      "loss": 1.527,
      "num_input_tokens_seen": 21342599008,
      "step": 27127
    },
    {
      "epoch": 2.8779970294928923,
      "grad_norm": 0.43898153520755795,
      "learning_rate": 4.3269764743827904e-05,
      "loss": 1.6371,
      "num_input_tokens_seen": 21343385776,
      "step": 27128
    },
    {
      "epoch": 2.8781031190324633,
      "grad_norm": 0.4442157924268248,
      "learning_rate": 4.3269290349853645e-05,
      "loss": 1.5608,
      "num_input_tokens_seen": 21344172592,
      "step": 27129
    },
    {
      "epoch": 2.8782092085720348,
      "grad_norm": 0.45840949385173185,
      "learning_rate": 4.326881594176142e-05,
      "loss": 1.6792,
      "num_input_tokens_seen": 21344959344,
      "step": 27130
    },
    {
      "epoch": 2.8783152981116062,
      "grad_norm": 0.3531651317444461,
      "learning_rate": 4.326834151955159e-05,
      "loss": 1.4499,
      "num_input_tokens_seen": 21345746224,
      "step": 27131
    },
    {
      "epoch": 2.8784213876511777,
      "grad_norm": 0.5198889929306396,
      "learning_rate": 4.326786708322452e-05,
      "loss": 1.6305,
      "num_input_tokens_seen": 21346532912,
      "step": 27132
    },
    {
      "epoch": 2.878527477190749,
      "grad_norm": 0.3869449540920821,
      "learning_rate": 4.326739263278058e-05,
      "loss": 1.6727,
      "num_input_tokens_seen": 21347319712,
      "step": 27133
    },
    {
      "epoch": 2.8786335667303202,
      "grad_norm": 0.42211126932245696,
      "learning_rate": 4.326691816822013e-05,
      "loss": 1.5404,
      "num_input_tokens_seen": 21348106512,
      "step": 27134
    },
    {
      "epoch": 2.8787396562698917,
      "grad_norm": 0.4015513661442661,
      "learning_rate": 4.326644368954354e-05,
      "loss": 1.6176,
      "num_input_tokens_seen": 21348893296,
      "step": 27135
    },
    {
      "epoch": 2.878845745809463,
      "grad_norm": 0.33725263173974235,
      "learning_rate": 4.326596919675119e-05,
      "loss": 1.5378,
      "num_input_tokens_seen": 21349680080,
      "step": 27136
    },
    {
      "epoch": 2.8789518353490346,
      "grad_norm": 0.4044902691780856,
      "learning_rate": 4.326549468984343e-05,
      "loss": 1.595,
      "num_input_tokens_seen": 21350466896,
      "step": 27137
    },
    {
      "epoch": 2.879057924888606,
      "grad_norm": 0.37063130013548545,
      "learning_rate": 4.326502016882063e-05,
      "loss": 1.5817,
      "num_input_tokens_seen": 21351253712,
      "step": 27138
    },
    {
      "epoch": 2.879164014428177,
      "grad_norm": 0.439862821473637,
      "learning_rate": 4.326454563368316e-05,
      "loss": 1.687,
      "num_input_tokens_seen": 21352040512,
      "step": 27139
    },
    {
      "epoch": 2.8792701039677486,
      "grad_norm": 0.42040788718334543,
      "learning_rate": 4.326407108443138e-05,
      "loss": 1.7942,
      "num_input_tokens_seen": 21352827200,
      "step": 27140
    },
    {
      "epoch": 2.87937619350732,
      "grad_norm": 0.48978059300078375,
      "learning_rate": 4.3263596521065666e-05,
      "loss": 1.5711,
      "num_input_tokens_seen": 21353614016,
      "step": 27141
    },
    {
      "epoch": 2.8794822830468916,
      "grad_norm": 0.36795836249825215,
      "learning_rate": 4.326312194358638e-05,
      "loss": 1.6682,
      "num_input_tokens_seen": 21354400688,
      "step": 27142
    },
    {
      "epoch": 2.879588372586463,
      "grad_norm": 0.44624136743833454,
      "learning_rate": 4.326264735199389e-05,
      "loss": 1.623,
      "num_input_tokens_seen": 21355187376,
      "step": 27143
    },
    {
      "epoch": 2.8796944621260345,
      "grad_norm": 0.4921960007803103,
      "learning_rate": 4.326217274628856e-05,
      "loss": 1.6583,
      "num_input_tokens_seen": 21355974080,
      "step": 27144
    },
    {
      "epoch": 2.879800551665606,
      "grad_norm": 0.4056374567793064,
      "learning_rate": 4.326169812647076e-05,
      "loss": 1.5885,
      "num_input_tokens_seen": 21356760832,
      "step": 27145
    },
    {
      "epoch": 2.879906641205177,
      "grad_norm": 0.47269670291411914,
      "learning_rate": 4.326122349254086e-05,
      "loss": 1.6036,
      "num_input_tokens_seen": 21357547552,
      "step": 27146
    },
    {
      "epoch": 2.8800127307447485,
      "grad_norm": 0.4405668479088092,
      "learning_rate": 4.326074884449921e-05,
      "loss": 1.6411,
      "num_input_tokens_seen": 21358334352,
      "step": 27147
    },
    {
      "epoch": 2.88011882028432,
      "grad_norm": 0.5075864809393406,
      "learning_rate": 4.32602741823462e-05,
      "loss": 1.5392,
      "num_input_tokens_seen": 21359121216,
      "step": 27148
    },
    {
      "epoch": 2.8802249098238915,
      "grad_norm": 0.48251332265624197,
      "learning_rate": 4.3259799506082175e-05,
      "loss": 1.5024,
      "num_input_tokens_seen": 21359908128,
      "step": 27149
    },
    {
      "epoch": 2.880330999363463,
      "grad_norm": 0.39488813719543686,
      "learning_rate": 4.325932481570753e-05,
      "loss": 1.5917,
      "num_input_tokens_seen": 21360694864,
      "step": 27150
    },
    {
      "epoch": 2.880437088903034,
      "grad_norm": 0.47404364304295626,
      "learning_rate": 4.3258850111222605e-05,
      "loss": 1.5856,
      "num_input_tokens_seen": 21361481680,
      "step": 27151
    },
    {
      "epoch": 2.8805431784426054,
      "grad_norm": 0.4247733222462625,
      "learning_rate": 4.325837539262777e-05,
      "loss": 1.5924,
      "num_input_tokens_seen": 21362268464,
      "step": 27152
    },
    {
      "epoch": 2.880649267982177,
      "grad_norm": 0.402285585358874,
      "learning_rate": 4.3257900659923415e-05,
      "loss": 1.5141,
      "num_input_tokens_seen": 21363055152,
      "step": 27153
    },
    {
      "epoch": 2.8807553575217484,
      "grad_norm": 0.47171132893429923,
      "learning_rate": 4.325742591310987e-05,
      "loss": 1.5702,
      "num_input_tokens_seen": 21363841904,
      "step": 27154
    },
    {
      "epoch": 2.88086144706132,
      "grad_norm": 0.45471363813106425,
      "learning_rate": 4.325695115218753e-05,
      "loss": 1.6787,
      "num_input_tokens_seen": 21364628704,
      "step": 27155
    },
    {
      "epoch": 2.880967536600891,
      "grad_norm": 0.3509529909813032,
      "learning_rate": 4.325647637715676e-05,
      "loss": 1.5266,
      "num_input_tokens_seen": 21365415536,
      "step": 27156
    },
    {
      "epoch": 2.881073626140463,
      "grad_norm": 0.39675883211843227,
      "learning_rate": 4.325600158801791e-05,
      "loss": 1.6194,
      "num_input_tokens_seen": 21366202272,
      "step": 27157
    },
    {
      "epoch": 2.881179715680034,
      "grad_norm": 0.4236215878087916,
      "learning_rate": 4.325552678477137e-05,
      "loss": 1.6375,
      "num_input_tokens_seen": 21366989056,
      "step": 27158
    },
    {
      "epoch": 2.8812858052196053,
      "grad_norm": 0.3606946706533868,
      "learning_rate": 4.325505196741749e-05,
      "loss": 1.4446,
      "num_input_tokens_seen": 21367775776,
      "step": 27159
    },
    {
      "epoch": 2.881391894759177,
      "grad_norm": 0.4272350263257159,
      "learning_rate": 4.3254577135956636e-05,
      "loss": 1.5876,
      "num_input_tokens_seen": 21368562576,
      "step": 27160
    },
    {
      "epoch": 2.8814979842987483,
      "grad_norm": 0.42431085361909177,
      "learning_rate": 4.325410229038919e-05,
      "loss": 1.587,
      "num_input_tokens_seen": 21369349296,
      "step": 27161
    },
    {
      "epoch": 2.8816040738383197,
      "grad_norm": 0.4181770024770634,
      "learning_rate": 4.325362743071549e-05,
      "loss": 1.5422,
      "num_input_tokens_seen": 21370136128,
      "step": 27162
    },
    {
      "epoch": 2.8817101633778908,
      "grad_norm": 0.4979829946044746,
      "learning_rate": 4.325315255693594e-05,
      "loss": 1.6098,
      "num_input_tokens_seen": 21370922928,
      "step": 27163
    },
    {
      "epoch": 2.8818162529174622,
      "grad_norm": 0.38734008508581896,
      "learning_rate": 4.325267766905089e-05,
      "loss": 1.6709,
      "num_input_tokens_seen": 21371709648,
      "step": 27164
    },
    {
      "epoch": 2.8819223424570337,
      "grad_norm": 0.4578567811811382,
      "learning_rate": 4.32522027670607e-05,
      "loss": 1.5696,
      "num_input_tokens_seen": 21372496416,
      "step": 27165
    },
    {
      "epoch": 2.882028431996605,
      "grad_norm": 0.4444200499753773,
      "learning_rate": 4.325172785096575e-05,
      "loss": 1.6006,
      "num_input_tokens_seen": 21373283152,
      "step": 27166
    },
    {
      "epoch": 2.8821345215361767,
      "grad_norm": 0.40824038651955646,
      "learning_rate": 4.325125292076639e-05,
      "loss": 1.6324,
      "num_input_tokens_seen": 21374069760,
      "step": 27167
    },
    {
      "epoch": 2.8822406110757477,
      "grad_norm": 0.3690151596027421,
      "learning_rate": 4.3250777976462997e-05,
      "loss": 1.5546,
      "num_input_tokens_seen": 21374856560,
      "step": 27168
    },
    {
      "epoch": 2.882346700615319,
      "grad_norm": 0.5453774025649336,
      "learning_rate": 4.325030301805595e-05,
      "loss": 1.6593,
      "num_input_tokens_seen": 21375643264,
      "step": 27169
    },
    {
      "epoch": 2.8824527901548906,
      "grad_norm": 0.40540042915096414,
      "learning_rate": 4.3249828045545596e-05,
      "loss": 1.7676,
      "num_input_tokens_seen": 21376429888,
      "step": 27170
    },
    {
      "epoch": 2.882558879694462,
      "grad_norm": 0.42434504768871917,
      "learning_rate": 4.324935305893231e-05,
      "loss": 1.6191,
      "num_input_tokens_seen": 21377216592,
      "step": 27171
    },
    {
      "epoch": 2.8826649692340336,
      "grad_norm": 0.3933793744997766,
      "learning_rate": 4.3248878058216464e-05,
      "loss": 1.604,
      "num_input_tokens_seen": 21378003392,
      "step": 27172
    },
    {
      "epoch": 2.882771058773605,
      "grad_norm": 0.3834393090539651,
      "learning_rate": 4.3248403043398416e-05,
      "loss": 1.5351,
      "num_input_tokens_seen": 21378790144,
      "step": 27173
    },
    {
      "epoch": 2.8828771483131765,
      "grad_norm": 0.4026104371885662,
      "learning_rate": 4.324792801447854e-05,
      "loss": 1.6411,
      "num_input_tokens_seen": 21379576912,
      "step": 27174
    },
    {
      "epoch": 2.8829832378527476,
      "grad_norm": 0.3623592422081868,
      "learning_rate": 4.3247452971457206e-05,
      "loss": 1.6838,
      "num_input_tokens_seen": 21380363600,
      "step": 27175
    },
    {
      "epoch": 2.883089327392319,
      "grad_norm": 0.376057382106609,
      "learning_rate": 4.324697791433476e-05,
      "loss": 1.4635,
      "num_input_tokens_seen": 21381150352,
      "step": 27176
    },
    {
      "epoch": 2.8831954169318905,
      "grad_norm": 0.36176322480495293,
      "learning_rate": 4.32465028431116e-05,
      "loss": 1.601,
      "num_input_tokens_seen": 21381937088,
      "step": 27177
    },
    {
      "epoch": 2.883301506471462,
      "grad_norm": 0.36026280467259103,
      "learning_rate": 4.324602775778807e-05,
      "loss": 1.5641,
      "num_input_tokens_seen": 21382723792,
      "step": 27178
    },
    {
      "epoch": 2.8834075960110335,
      "grad_norm": 0.39860830877355075,
      "learning_rate": 4.324555265836455e-05,
      "loss": 1.6358,
      "num_input_tokens_seen": 21383510512,
      "step": 27179
    },
    {
      "epoch": 2.8835136855506045,
      "grad_norm": 0.35145315503080965,
      "learning_rate": 4.32450775448414e-05,
      "loss": 1.5867,
      "num_input_tokens_seen": 21384297344,
      "step": 27180
    },
    {
      "epoch": 2.883619775090176,
      "grad_norm": 0.3677158127250901,
      "learning_rate": 4.324460241721899e-05,
      "loss": 1.5641,
      "num_input_tokens_seen": 21385084064,
      "step": 27181
    },
    {
      "epoch": 2.8837258646297474,
      "grad_norm": 0.40014353916736134,
      "learning_rate": 4.3244127275497685e-05,
      "loss": 1.6641,
      "num_input_tokens_seen": 21385870896,
      "step": 27182
    },
    {
      "epoch": 2.883831954169319,
      "grad_norm": 0.37649045292332084,
      "learning_rate": 4.324365211967786e-05,
      "loss": 1.7209,
      "num_input_tokens_seen": 21386657504,
      "step": 27183
    },
    {
      "epoch": 2.8839380437088904,
      "grad_norm": 0.3312347209848123,
      "learning_rate": 4.324317694975987e-05,
      "loss": 1.5193,
      "num_input_tokens_seen": 21387444288,
      "step": 27184
    },
    {
      "epoch": 2.8840441332484614,
      "grad_norm": 0.3941682205686095,
      "learning_rate": 4.3242701765744084e-05,
      "loss": 1.5248,
      "num_input_tokens_seen": 21388231024,
      "step": 27185
    },
    {
      "epoch": 2.8841502227880333,
      "grad_norm": 0.3492615924901792,
      "learning_rate": 4.3242226567630885e-05,
      "loss": 1.515,
      "num_input_tokens_seen": 21389017856,
      "step": 27186
    },
    {
      "epoch": 2.8842563123276044,
      "grad_norm": 0.3643893313913175,
      "learning_rate": 4.324175135542062e-05,
      "loss": 1.6713,
      "num_input_tokens_seen": 21389804640,
      "step": 27187
    },
    {
      "epoch": 2.884362401867176,
      "grad_norm": 0.45962507204536623,
      "learning_rate": 4.324127612911366e-05,
      "loss": 1.6271,
      "num_input_tokens_seen": 21390591424,
      "step": 27188
    },
    {
      "epoch": 2.8844684914067473,
      "grad_norm": 0.37114513159684476,
      "learning_rate": 4.3240800888710385e-05,
      "loss": 1.6275,
      "num_input_tokens_seen": 21391378272,
      "step": 27189
    },
    {
      "epoch": 2.884574580946319,
      "grad_norm": 0.5487111680299769,
      "learning_rate": 4.324032563421116e-05,
      "loss": 1.7053,
      "num_input_tokens_seen": 21392165040,
      "step": 27190
    },
    {
      "epoch": 2.8846806704858903,
      "grad_norm": 0.3460180241963407,
      "learning_rate": 4.323985036561633e-05,
      "loss": 1.5541,
      "num_input_tokens_seen": 21392951904,
      "step": 27191
    },
    {
      "epoch": 2.8847867600254613,
      "grad_norm": 0.35364831991757195,
      "learning_rate": 4.323937508292629e-05,
      "loss": 1.6541,
      "num_input_tokens_seen": 21393738656,
      "step": 27192
    },
    {
      "epoch": 2.884892849565033,
      "grad_norm": 0.3812786665614805,
      "learning_rate": 4.3238899786141396e-05,
      "loss": 1.4802,
      "num_input_tokens_seen": 21394525344,
      "step": 27193
    },
    {
      "epoch": 2.8849989391046043,
      "grad_norm": 0.3301427506813807,
      "learning_rate": 4.3238424475262016e-05,
      "loss": 1.4903,
      "num_input_tokens_seen": 21395312112,
      "step": 27194
    },
    {
      "epoch": 2.8851050286441757,
      "grad_norm": 0.36710291620279695,
      "learning_rate": 4.3237949150288516e-05,
      "loss": 1.5228,
      "num_input_tokens_seen": 21396098880,
      "step": 27195
    },
    {
      "epoch": 2.885211118183747,
      "grad_norm": 0.35509329428468606,
      "learning_rate": 4.323747381122126e-05,
      "loss": 1.6414,
      "num_input_tokens_seen": 21396885696,
      "step": 27196
    },
    {
      "epoch": 2.8853172077233182,
      "grad_norm": 0.37577606564693294,
      "learning_rate": 4.3236998458060626e-05,
      "loss": 1.4942,
      "num_input_tokens_seen": 21397672416,
      "step": 27197
    },
    {
      "epoch": 2.88542329726289,
      "grad_norm": 0.33833462244070356,
      "learning_rate": 4.323652309080697e-05,
      "loss": 1.474,
      "num_input_tokens_seen": 21398459168,
      "step": 27198
    },
    {
      "epoch": 2.885529386802461,
      "grad_norm": 0.36345822188018984,
      "learning_rate": 4.323604770946066e-05,
      "loss": 1.5259,
      "num_input_tokens_seen": 21399245824,
      "step": 27199
    },
    {
      "epoch": 2.8856354763420327,
      "grad_norm": 0.3761923852728471,
      "learning_rate": 4.3235572314022076e-05,
      "loss": 1.6696,
      "num_input_tokens_seen": 21400032608,
      "step": 27200
    },
    {
      "epoch": 2.885741565881604,
      "grad_norm": 0.33965029006610475,
      "learning_rate": 4.323509690449157e-05,
      "loss": 1.5492,
      "num_input_tokens_seen": 21400819504,
      "step": 27201
    },
    {
      "epoch": 2.8858476554211756,
      "grad_norm": 0.4001936583520743,
      "learning_rate": 4.323462148086952e-05,
      "loss": 1.5962,
      "num_input_tokens_seen": 21401606192,
      "step": 27202
    },
    {
      "epoch": 2.885953744960747,
      "grad_norm": 0.4226139861696331,
      "learning_rate": 4.323414604315629e-05,
      "loss": 1.6576,
      "num_input_tokens_seen": 21402392912,
      "step": 27203
    },
    {
      "epoch": 2.886059834500318,
      "grad_norm": 0.35771193657276773,
      "learning_rate": 4.323367059135225e-05,
      "loss": 1.7419,
      "num_input_tokens_seen": 21403179616,
      "step": 27204
    },
    {
      "epoch": 2.8861659240398896,
      "grad_norm": 0.3637837766833892,
      "learning_rate": 4.3233195125457754e-05,
      "loss": 1.5474,
      "num_input_tokens_seen": 21403966448,
      "step": 27205
    },
    {
      "epoch": 2.886272013579461,
      "grad_norm": 0.3995046524129384,
      "learning_rate": 4.3232719645473186e-05,
      "loss": 1.4426,
      "num_input_tokens_seen": 21404753136,
      "step": 27206
    },
    {
      "epoch": 2.8863781031190325,
      "grad_norm": 0.3848208379368966,
      "learning_rate": 4.323224415139891e-05,
      "loss": 1.5358,
      "num_input_tokens_seen": 21405539888,
      "step": 27207
    },
    {
      "epoch": 2.886484192658604,
      "grad_norm": 0.4577441607575362,
      "learning_rate": 4.323176864323528e-05,
      "loss": 1.5883,
      "num_input_tokens_seen": 21406326576,
      "step": 27208
    },
    {
      "epoch": 2.886590282198175,
      "grad_norm": 0.3963756734930739,
      "learning_rate": 4.3231293120982686e-05,
      "loss": 1.6102,
      "num_input_tokens_seen": 21407113376,
      "step": 27209
    },
    {
      "epoch": 2.8866963717377465,
      "grad_norm": 0.3596342853343599,
      "learning_rate": 4.323081758464148e-05,
      "loss": 1.5405,
      "num_input_tokens_seen": 21407900128,
      "step": 27210
    },
    {
      "epoch": 2.886802461277318,
      "grad_norm": 0.5045585824898866,
      "learning_rate": 4.3230342034212033e-05,
      "loss": 1.6518,
      "num_input_tokens_seen": 21408686880,
      "step": 27211
    },
    {
      "epoch": 2.8869085508168895,
      "grad_norm": 0.36230229756327387,
      "learning_rate": 4.3229866469694716e-05,
      "loss": 1.5231,
      "num_input_tokens_seen": 21409473760,
      "step": 27212
    },
    {
      "epoch": 2.887014640356461,
      "grad_norm": 0.4865717705192204,
      "learning_rate": 4.322939089108989e-05,
      "loss": 1.5612,
      "num_input_tokens_seen": 21410260416,
      "step": 27213
    },
    {
      "epoch": 2.8871207298960324,
      "grad_norm": 0.4562010217639043,
      "learning_rate": 4.322891529839792e-05,
      "loss": 1.6048,
      "num_input_tokens_seen": 21411047136,
      "step": 27214
    },
    {
      "epoch": 2.887226819435604,
      "grad_norm": 0.4498983533662855,
      "learning_rate": 4.322843969161918e-05,
      "loss": 1.6827,
      "num_input_tokens_seen": 21411833904,
      "step": 27215
    },
    {
      "epoch": 2.887332908975175,
      "grad_norm": 0.474239393705085,
      "learning_rate": 4.3227964070754046e-05,
      "loss": 1.4632,
      "num_input_tokens_seen": 21412620688,
      "step": 27216
    },
    {
      "epoch": 2.8874389985147464,
      "grad_norm": 0.4266871445854782,
      "learning_rate": 4.322748843580287e-05,
      "loss": 1.5477,
      "num_input_tokens_seen": 21413407376,
      "step": 27217
    },
    {
      "epoch": 2.887545088054318,
      "grad_norm": 0.580800779334769,
      "learning_rate": 4.322701278676603e-05,
      "loss": 1.5415,
      "num_input_tokens_seen": 21414194176,
      "step": 27218
    },
    {
      "epoch": 2.8876511775938893,
      "grad_norm": 0.461199008065543,
      "learning_rate": 4.3226537123643884e-05,
      "loss": 1.5988,
      "num_input_tokens_seen": 21414980944,
      "step": 27219
    },
    {
      "epoch": 2.887757267133461,
      "grad_norm": 0.5101994766632869,
      "learning_rate": 4.322606144643681e-05,
      "loss": 1.6231,
      "num_input_tokens_seen": 21415767584,
      "step": 27220
    },
    {
      "epoch": 2.887863356673032,
      "grad_norm": 0.5041448202839762,
      "learning_rate": 4.322558575514517e-05,
      "loss": 1.6613,
      "num_input_tokens_seen": 21416554336,
      "step": 27221
    },
    {
      "epoch": 2.8879694462126033,
      "grad_norm": 0.47201473026686896,
      "learning_rate": 4.3225110049769326e-05,
      "loss": 1.6075,
      "num_input_tokens_seen": 21417340976,
      "step": 27222
    },
    {
      "epoch": 2.888075535752175,
      "grad_norm": 0.4305823087079762,
      "learning_rate": 4.322463433030965e-05,
      "loss": 1.5742,
      "num_input_tokens_seen": 21418127728,
      "step": 27223
    },
    {
      "epoch": 2.8881816252917463,
      "grad_norm": 0.3896548379834007,
      "learning_rate": 4.3224158596766516e-05,
      "loss": 1.505,
      "num_input_tokens_seen": 21418914416,
      "step": 27224
    },
    {
      "epoch": 2.8882877148313177,
      "grad_norm": 0.545502964105697,
      "learning_rate": 4.322368284914029e-05,
      "loss": 1.5168,
      "num_input_tokens_seen": 21419701216,
      "step": 27225
    },
    {
      "epoch": 2.8883938043708888,
      "grad_norm": 0.4012409661109059,
      "learning_rate": 4.322320708743134e-05,
      "loss": 1.5138,
      "num_input_tokens_seen": 21420488064,
      "step": 27226
    },
    {
      "epoch": 2.8884998939104607,
      "grad_norm": 0.4376092944410957,
      "learning_rate": 4.3222731311640017e-05,
      "loss": 1.52,
      "num_input_tokens_seen": 21421274800,
      "step": 27227
    },
    {
      "epoch": 2.8886059834500317,
      "grad_norm": 0.34392871710895845,
      "learning_rate": 4.322225552176671e-05,
      "loss": 1.4901,
      "num_input_tokens_seen": 21422061504,
      "step": 27228
    },
    {
      "epoch": 2.888712072989603,
      "grad_norm": 0.469432445376928,
      "learning_rate": 4.3221779717811785e-05,
      "loss": 1.5833,
      "num_input_tokens_seen": 21422848320,
      "step": 27229
    },
    {
      "epoch": 2.8888181625291747,
      "grad_norm": 0.3662149795091812,
      "learning_rate": 4.322130389977559e-05,
      "loss": 1.5896,
      "num_input_tokens_seen": 21423635072,
      "step": 27230
    },
    {
      "epoch": 2.888924252068746,
      "grad_norm": 0.404825872579997,
      "learning_rate": 4.322082806765851e-05,
      "loss": 1.6746,
      "num_input_tokens_seen": 21424421904,
      "step": 27231
    },
    {
      "epoch": 2.8890303416083176,
      "grad_norm": 0.4095173143475162,
      "learning_rate": 4.322035222146091e-05,
      "loss": 1.6628,
      "num_input_tokens_seen": 21425208592,
      "step": 27232
    },
    {
      "epoch": 2.8891364311478887,
      "grad_norm": 0.40876138879315876,
      "learning_rate": 4.321987636118317e-05,
      "loss": 1.659,
      "num_input_tokens_seen": 21425995296,
      "step": 27233
    },
    {
      "epoch": 2.88924252068746,
      "grad_norm": 0.41451002291876593,
      "learning_rate": 4.321940048682562e-05,
      "loss": 1.6255,
      "num_input_tokens_seen": 21426782128,
      "step": 27234
    },
    {
      "epoch": 2.8893486102270316,
      "grad_norm": 0.37652746681473265,
      "learning_rate": 4.321892459838867e-05,
      "loss": 1.5563,
      "num_input_tokens_seen": 21427568976,
      "step": 27235
    },
    {
      "epoch": 2.889454699766603,
      "grad_norm": 0.41686345351298604,
      "learning_rate": 4.321844869587266e-05,
      "loss": 1.6589,
      "num_input_tokens_seen": 21428355728,
      "step": 27236
    },
    {
      "epoch": 2.8895607893061745,
      "grad_norm": 0.46147239367969256,
      "learning_rate": 4.321797277927797e-05,
      "loss": 1.5759,
      "num_input_tokens_seen": 21429142304,
      "step": 27237
    },
    {
      "epoch": 2.8896668788457456,
      "grad_norm": 0.38625672416875206,
      "learning_rate": 4.3217496848604966e-05,
      "loss": 1.5857,
      "num_input_tokens_seen": 21429928928,
      "step": 27238
    },
    {
      "epoch": 2.889772968385317,
      "grad_norm": 0.3958999759368793,
      "learning_rate": 4.3217020903854016e-05,
      "loss": 1.5372,
      "num_input_tokens_seen": 21430715712,
      "step": 27239
    },
    {
      "epoch": 2.8898790579248885,
      "grad_norm": 0.4350238323963961,
      "learning_rate": 4.3216544945025487e-05,
      "loss": 1.6383,
      "num_input_tokens_seen": 21431502496,
      "step": 27240
    },
    {
      "epoch": 2.88998514746446,
      "grad_norm": 0.36472867533290876,
      "learning_rate": 4.321606897211974e-05,
      "loss": 1.4994,
      "num_input_tokens_seen": 21432289296,
      "step": 27241
    },
    {
      "epoch": 2.8900912370040315,
      "grad_norm": 0.43102647284696627,
      "learning_rate": 4.3215592985137154e-05,
      "loss": 1.47,
      "num_input_tokens_seen": 21433076016,
      "step": 27242
    },
    {
      "epoch": 2.890197326543603,
      "grad_norm": 0.413253016465392,
      "learning_rate": 4.32151169840781e-05,
      "loss": 1.5942,
      "num_input_tokens_seen": 21433862800,
      "step": 27243
    },
    {
      "epoch": 2.8903034160831744,
      "grad_norm": 0.39782119371011904,
      "learning_rate": 4.3214640968942924e-05,
      "loss": 1.5175,
      "num_input_tokens_seen": 21434649648,
      "step": 27244
    },
    {
      "epoch": 2.8904095056227455,
      "grad_norm": 0.40820536030374754,
      "learning_rate": 4.3214164939732015e-05,
      "loss": 1.5623,
      "num_input_tokens_seen": 21435436400,
      "step": 27245
    },
    {
      "epoch": 2.890515595162317,
      "grad_norm": 0.3688484952399121,
      "learning_rate": 4.3213688896445736e-05,
      "loss": 1.5236,
      "num_input_tokens_seen": 21436223232,
      "step": 27246
    },
    {
      "epoch": 2.8906216847018884,
      "grad_norm": 0.3886651435677783,
      "learning_rate": 4.321321283908445e-05,
      "loss": 1.5705,
      "num_input_tokens_seen": 21437009936,
      "step": 27247
    },
    {
      "epoch": 2.89072777424146,
      "grad_norm": 0.41515019107935414,
      "learning_rate": 4.3212736767648524e-05,
      "loss": 1.4081,
      "num_input_tokens_seen": 21437796768,
      "step": 27248
    },
    {
      "epoch": 2.8908338637810314,
      "grad_norm": 0.3822332194039967,
      "learning_rate": 4.3212260682138336e-05,
      "loss": 1.551,
      "num_input_tokens_seen": 21438583488,
      "step": 27249
    },
    {
      "epoch": 2.8909399533206024,
      "grad_norm": 0.3779804144781674,
      "learning_rate": 4.3211784582554236e-05,
      "loss": 1.6624,
      "num_input_tokens_seen": 21439370240,
      "step": 27250
    },
    {
      "epoch": 2.891046042860174,
      "grad_norm": 0.3657927288683212,
      "learning_rate": 4.3211308468896615e-05,
      "loss": 1.5368,
      "num_input_tokens_seen": 21440157072,
      "step": 27251
    },
    {
      "epoch": 2.8911521323997453,
      "grad_norm": 0.3715289417563599,
      "learning_rate": 4.321083234116583e-05,
      "loss": 1.4921,
      "num_input_tokens_seen": 21440943856,
      "step": 27252
    },
    {
      "epoch": 2.891258221939317,
      "grad_norm": 0.3334569974951043,
      "learning_rate": 4.3210356199362244e-05,
      "loss": 1.5829,
      "num_input_tokens_seen": 21441730640,
      "step": 27253
    },
    {
      "epoch": 2.8913643114788883,
      "grad_norm": 0.4007040429747865,
      "learning_rate": 4.320988004348623e-05,
      "loss": 1.646,
      "num_input_tokens_seen": 21442517472,
      "step": 27254
    },
    {
      "epoch": 2.8914704010184593,
      "grad_norm": 0.3692924504375717,
      "learning_rate": 4.320940387353815e-05,
      "loss": 1.6488,
      "num_input_tokens_seen": 21443304144,
      "step": 27255
    },
    {
      "epoch": 2.8915764905580312,
      "grad_norm": 0.36991754269107,
      "learning_rate": 4.320892768951838e-05,
      "loss": 1.5755,
      "num_input_tokens_seen": 21444090848,
      "step": 27256
    },
    {
      "epoch": 2.8916825800976023,
      "grad_norm": 0.3686717048565443,
      "learning_rate": 4.320845149142729e-05,
      "loss": 1.4801,
      "num_input_tokens_seen": 21444877616,
      "step": 27257
    },
    {
      "epoch": 2.8917886696371737,
      "grad_norm": 0.3581948447197881,
      "learning_rate": 4.320797527926523e-05,
      "loss": 1.5231,
      "num_input_tokens_seen": 21445664448,
      "step": 27258
    },
    {
      "epoch": 2.891894759176745,
      "grad_norm": 0.3866497577062136,
      "learning_rate": 4.32074990530326e-05,
      "loss": 1.5739,
      "num_input_tokens_seen": 21446451072,
      "step": 27259
    },
    {
      "epoch": 2.8920008487163167,
      "grad_norm": 0.3504537862578796,
      "learning_rate": 4.3207022812729734e-05,
      "loss": 1.6105,
      "num_input_tokens_seen": 21447237888,
      "step": 27260
    },
    {
      "epoch": 2.892106938255888,
      "grad_norm": 0.3786182792484743,
      "learning_rate": 4.320654655835702e-05,
      "loss": 1.5362,
      "num_input_tokens_seen": 21448024688,
      "step": 27261
    },
    {
      "epoch": 2.892213027795459,
      "grad_norm": 0.4851300424275621,
      "learning_rate": 4.3206070289914825e-05,
      "loss": 1.5705,
      "num_input_tokens_seen": 21448811408,
      "step": 27262
    },
    {
      "epoch": 2.8923191173350307,
      "grad_norm": 0.4636412578437226,
      "learning_rate": 4.3205594007403504e-05,
      "loss": 1.7017,
      "num_input_tokens_seen": 21449598112,
      "step": 27263
    },
    {
      "epoch": 2.892425206874602,
      "grad_norm": 0.4834287254380587,
      "learning_rate": 4.320511771082344e-05,
      "loss": 1.6144,
      "num_input_tokens_seen": 21450384832,
      "step": 27264
    },
    {
      "epoch": 2.8925312964141736,
      "grad_norm": 0.4224239712880075,
      "learning_rate": 4.320464140017499e-05,
      "loss": 1.5233,
      "num_input_tokens_seen": 21451171696,
      "step": 27265
    },
    {
      "epoch": 2.892637385953745,
      "grad_norm": 0.5836116858478483,
      "learning_rate": 4.320416507545853e-05,
      "loss": 1.6232,
      "num_input_tokens_seen": 21451958512,
      "step": 27266
    },
    {
      "epoch": 2.892743475493316,
      "grad_norm": 0.4464434768870804,
      "learning_rate": 4.320368873667443e-05,
      "loss": 1.6217,
      "num_input_tokens_seen": 21452745360,
      "step": 27267
    },
    {
      "epoch": 2.8928495650328876,
      "grad_norm": 0.4802972277433859,
      "learning_rate": 4.320321238382305e-05,
      "loss": 1.4403,
      "num_input_tokens_seen": 21453532272,
      "step": 27268
    },
    {
      "epoch": 2.892955654572459,
      "grad_norm": 0.6201897701614136,
      "learning_rate": 4.320273601690476e-05,
      "loss": 1.5803,
      "num_input_tokens_seen": 21454319056,
      "step": 27269
    },
    {
      "epoch": 2.8930617441120305,
      "grad_norm": 0.38898564111630335,
      "learning_rate": 4.320225963591993e-05,
      "loss": 1.544,
      "num_input_tokens_seen": 21455105776,
      "step": 27270
    },
    {
      "epoch": 2.893167833651602,
      "grad_norm": 0.4737152342644761,
      "learning_rate": 4.3201783240868933e-05,
      "loss": 1.5317,
      "num_input_tokens_seen": 21455892512,
      "step": 27271
    },
    {
      "epoch": 2.8932739231911735,
      "grad_norm": 0.3749373477787223,
      "learning_rate": 4.320130683175213e-05,
      "loss": 1.5598,
      "num_input_tokens_seen": 21456679360,
      "step": 27272
    },
    {
      "epoch": 2.893380012730745,
      "grad_norm": 0.385752550481721,
      "learning_rate": 4.320083040856989e-05,
      "loss": 1.5804,
      "num_input_tokens_seen": 21457466192,
      "step": 27273
    },
    {
      "epoch": 2.893486102270316,
      "grad_norm": 0.4888191588124339,
      "learning_rate": 4.3200353971322576e-05,
      "loss": 1.6228,
      "num_input_tokens_seen": 21458252928,
      "step": 27274
    },
    {
      "epoch": 2.8935921918098875,
      "grad_norm": 0.3544595280886472,
      "learning_rate": 4.3199877520010565e-05,
      "loss": 1.5976,
      "num_input_tokens_seen": 21459039632,
      "step": 27275
    },
    {
      "epoch": 2.893698281349459,
      "grad_norm": 0.3820778715072616,
      "learning_rate": 4.319940105463423e-05,
      "loss": 1.5985,
      "num_input_tokens_seen": 21459826368,
      "step": 27276
    },
    {
      "epoch": 2.8938043708890304,
      "grad_norm": 0.5163007447400844,
      "learning_rate": 4.3198924575193935e-05,
      "loss": 1.7898,
      "num_input_tokens_seen": 21460613072,
      "step": 27277
    },
    {
      "epoch": 2.893910460428602,
      "grad_norm": 0.3488433242810465,
      "learning_rate": 4.3198448081690034e-05,
      "loss": 1.5595,
      "num_input_tokens_seen": 21461399888,
      "step": 27278
    },
    {
      "epoch": 2.894016549968173,
      "grad_norm": 0.5508733335733819,
      "learning_rate": 4.3197971574122905e-05,
      "loss": 1.4908,
      "num_input_tokens_seen": 21462186624,
      "step": 27279
    },
    {
      "epoch": 2.8941226395077444,
      "grad_norm": 0.40435421357656476,
      "learning_rate": 4.319749505249292e-05,
      "loss": 1.5975,
      "num_input_tokens_seen": 21462973472,
      "step": 27280
    },
    {
      "epoch": 2.894228729047316,
      "grad_norm": 0.4965092963790749,
      "learning_rate": 4.319701851680045e-05,
      "loss": 1.6475,
      "num_input_tokens_seen": 21463760176,
      "step": 27281
    },
    {
      "epoch": 2.8943348185868873,
      "grad_norm": 0.48984841509165383,
      "learning_rate": 4.319654196704586e-05,
      "loss": 1.6361,
      "num_input_tokens_seen": 21464546992,
      "step": 27282
    },
    {
      "epoch": 2.894440908126459,
      "grad_norm": 0.3728992136973042,
      "learning_rate": 4.3196065403229515e-05,
      "loss": 1.4859,
      "num_input_tokens_seen": 21465333728,
      "step": 27283
    },
    {
      "epoch": 2.89454699766603,
      "grad_norm": 0.4403809182495125,
      "learning_rate": 4.3195588825351774e-05,
      "loss": 1.5557,
      "num_input_tokens_seen": 21466120512,
      "step": 27284
    },
    {
      "epoch": 2.8946530872056018,
      "grad_norm": 0.4160456557789496,
      "learning_rate": 4.319511223341303e-05,
      "loss": 1.4964,
      "num_input_tokens_seen": 21466907312,
      "step": 27285
    },
    {
      "epoch": 2.894759176745173,
      "grad_norm": 0.45365414268586707,
      "learning_rate": 4.3194635627413625e-05,
      "loss": 1.6991,
      "num_input_tokens_seen": 21467694064,
      "step": 27286
    },
    {
      "epoch": 2.8948652662847443,
      "grad_norm": 0.3740924511034734,
      "learning_rate": 4.319415900735395e-05,
      "loss": 1.4879,
      "num_input_tokens_seen": 21468480960,
      "step": 27287
    },
    {
      "epoch": 2.8949713558243158,
      "grad_norm": 0.3748103857668645,
      "learning_rate": 4.319368237323436e-05,
      "loss": 1.5013,
      "num_input_tokens_seen": 21469267808,
      "step": 27288
    },
    {
      "epoch": 2.8950774453638872,
      "grad_norm": 0.35100663218025846,
      "learning_rate": 4.319320572505522e-05,
      "loss": 1.5678,
      "num_input_tokens_seen": 21470054672,
      "step": 27289
    },
    {
      "epoch": 2.8951835349034587,
      "grad_norm": 0.35718717549779194,
      "learning_rate": 4.319272906281691e-05,
      "loss": 1.5456,
      "num_input_tokens_seen": 21470841392,
      "step": 27290
    },
    {
      "epoch": 2.8952896244430297,
      "grad_norm": 0.3550320617991649,
      "learning_rate": 4.319225238651978e-05,
      "loss": 1.5764,
      "num_input_tokens_seen": 21471628192,
      "step": 27291
    },
    {
      "epoch": 2.895395713982601,
      "grad_norm": 0.342810614595291,
      "learning_rate": 4.319177569616423e-05,
      "loss": 1.5435,
      "num_input_tokens_seen": 21472414960,
      "step": 27292
    },
    {
      "epoch": 2.8955018035221727,
      "grad_norm": 0.42928461543767427,
      "learning_rate": 4.31912989917506e-05,
      "loss": 1.6318,
      "num_input_tokens_seen": 21473201696,
      "step": 27293
    },
    {
      "epoch": 2.895607893061744,
      "grad_norm": 0.3997590555249213,
      "learning_rate": 4.319082227327927e-05,
      "loss": 1.6226,
      "num_input_tokens_seen": 21473988416,
      "step": 27294
    },
    {
      "epoch": 2.8957139826013156,
      "grad_norm": 0.5008775204063902,
      "learning_rate": 4.3190345540750606e-05,
      "loss": 1.7068,
      "num_input_tokens_seen": 21474775152,
      "step": 27295
    },
    {
      "epoch": 2.8958200721408867,
      "grad_norm": 0.35805849734282963,
      "learning_rate": 4.3189868794164976e-05,
      "loss": 1.6061,
      "num_input_tokens_seen": 21475561856,
      "step": 27296
    },
    {
      "epoch": 2.8959261616804586,
      "grad_norm": 0.4732619962664052,
      "learning_rate": 4.318939203352275e-05,
      "loss": 1.6735,
      "num_input_tokens_seen": 21476348560,
      "step": 27297
    },
    {
      "epoch": 2.8960322512200296,
      "grad_norm": 0.34449997840377533,
      "learning_rate": 4.318891525882429e-05,
      "loss": 1.4341,
      "num_input_tokens_seen": 21477135408,
      "step": 27298
    },
    {
      "epoch": 2.896138340759601,
      "grad_norm": 0.3539920312170759,
      "learning_rate": 4.318843847006998e-05,
      "loss": 1.5699,
      "num_input_tokens_seen": 21477922192,
      "step": 27299
    },
    {
      "epoch": 2.8962444302991726,
      "grad_norm": 0.39203757004654916,
      "learning_rate": 4.3187961667260166e-05,
      "loss": 1.5743,
      "num_input_tokens_seen": 21478709008,
      "step": 27300
    },
    {
      "epoch": 2.896350519838744,
      "grad_norm": 0.3940355690619057,
      "learning_rate": 4.3187484850395244e-05,
      "loss": 1.6208,
      "num_input_tokens_seen": 21479495792,
      "step": 27301
    },
    {
      "epoch": 2.8964566093783155,
      "grad_norm": 0.4241882888907209,
      "learning_rate": 4.318700801947556e-05,
      "loss": 1.6413,
      "num_input_tokens_seen": 21480282608,
      "step": 27302
    },
    {
      "epoch": 2.8965626989178865,
      "grad_norm": 0.40692047649139323,
      "learning_rate": 4.318653117450149e-05,
      "loss": 1.6127,
      "num_input_tokens_seen": 21481069328,
      "step": 27303
    },
    {
      "epoch": 2.896668788457458,
      "grad_norm": 0.42898903054051263,
      "learning_rate": 4.31860543154734e-05,
      "loss": 1.6521,
      "num_input_tokens_seen": 21481856144,
      "step": 27304
    },
    {
      "epoch": 2.8967748779970295,
      "grad_norm": 0.6152263027409334,
      "learning_rate": 4.318557744239166e-05,
      "loss": 1.5999,
      "num_input_tokens_seen": 21482642832,
      "step": 27305
    },
    {
      "epoch": 2.896880967536601,
      "grad_norm": 0.3710595394225803,
      "learning_rate": 4.318510055525664e-05,
      "loss": 1.5481,
      "num_input_tokens_seen": 21483429616,
      "step": 27306
    },
    {
      "epoch": 2.8969870570761724,
      "grad_norm": 0.5247324707712965,
      "learning_rate": 4.3184623654068714e-05,
      "loss": 1.526,
      "num_input_tokens_seen": 21484216432,
      "step": 27307
    },
    {
      "epoch": 2.8970931466157435,
      "grad_norm": 0.43987737864252957,
      "learning_rate": 4.318414673882824e-05,
      "loss": 1.6821,
      "num_input_tokens_seen": 21485003200,
      "step": 27308
    },
    {
      "epoch": 2.897199236155315,
      "grad_norm": 0.365463160330911,
      "learning_rate": 4.318366980953559e-05,
      "loss": 1.4893,
      "num_input_tokens_seen": 21485789984,
      "step": 27309
    },
    {
      "epoch": 2.8973053256948864,
      "grad_norm": 0.48075103034836236,
      "learning_rate": 4.318319286619113e-05,
      "loss": 1.5635,
      "num_input_tokens_seen": 21486576768,
      "step": 27310
    },
    {
      "epoch": 2.897411415234458,
      "grad_norm": 0.3574642120075646,
      "learning_rate": 4.3182715908795246e-05,
      "loss": 1.56,
      "num_input_tokens_seen": 21487363504,
      "step": 27311
    },
    {
      "epoch": 2.8975175047740294,
      "grad_norm": 0.40301979489315126,
      "learning_rate": 4.318223893734829e-05,
      "loss": 1.6778,
      "num_input_tokens_seen": 21488150272,
      "step": 27312
    },
    {
      "epoch": 2.897623594313601,
      "grad_norm": 0.43157030789340006,
      "learning_rate": 4.318176195185062e-05,
      "loss": 1.6462,
      "num_input_tokens_seen": 21488937024,
      "step": 27313
    },
    {
      "epoch": 2.8977296838531723,
      "grad_norm": 0.3582752206364991,
      "learning_rate": 4.3181284952302624e-05,
      "loss": 1.5609,
      "num_input_tokens_seen": 21489723840,
      "step": 27314
    },
    {
      "epoch": 2.8978357733927433,
      "grad_norm": 0.5596021858928096,
      "learning_rate": 4.3180807938704664e-05,
      "loss": 1.7581,
      "num_input_tokens_seen": 21490510544,
      "step": 27315
    },
    {
      "epoch": 2.897941862932315,
      "grad_norm": 0.35004044425626835,
      "learning_rate": 4.318033091105711e-05,
      "loss": 1.5866,
      "num_input_tokens_seen": 21491297376,
      "step": 27316
    },
    {
      "epoch": 2.8980479524718863,
      "grad_norm": 0.387904029801278,
      "learning_rate": 4.317985386936033e-05,
      "loss": 1.5239,
      "num_input_tokens_seen": 21492084064,
      "step": 27317
    },
    {
      "epoch": 2.8981540420114578,
      "grad_norm": 0.41747327521191996,
      "learning_rate": 4.317937681361469e-05,
      "loss": 1.4152,
      "num_input_tokens_seen": 21492870864,
      "step": 27318
    },
    {
      "epoch": 2.8982601315510292,
      "grad_norm": 0.35098753991994264,
      "learning_rate": 4.3178899743820565e-05,
      "loss": 1.4398,
      "num_input_tokens_seen": 21493657616,
      "step": 27319
    },
    {
      "epoch": 2.8983662210906003,
      "grad_norm": 0.35312860008553937,
      "learning_rate": 4.317842265997831e-05,
      "loss": 1.529,
      "num_input_tokens_seen": 21494444336,
      "step": 27320
    },
    {
      "epoch": 2.8984723106301717,
      "grad_norm": 0.3803670605573017,
      "learning_rate": 4.3177945562088314e-05,
      "loss": 1.6328,
      "num_input_tokens_seen": 21495231072,
      "step": 27321
    },
    {
      "epoch": 2.898578400169743,
      "grad_norm": 0.39256308851918537,
      "learning_rate": 4.317746845015094e-05,
      "loss": 1.619,
      "num_input_tokens_seen": 21496017792,
      "step": 27322
    },
    {
      "epoch": 2.8986844897093147,
      "grad_norm": 0.37563273865288044,
      "learning_rate": 4.3176991324166535e-05,
      "loss": 1.6319,
      "num_input_tokens_seen": 21496804640,
      "step": 27323
    },
    {
      "epoch": 2.898790579248886,
      "grad_norm": 0.4039805043110749,
      "learning_rate": 4.31765141841355e-05,
      "loss": 1.5362,
      "num_input_tokens_seen": 21497591344,
      "step": 27324
    },
    {
      "epoch": 2.898896668788457,
      "grad_norm": 0.40040477899665616,
      "learning_rate": 4.317603703005818e-05,
      "loss": 1.5365,
      "num_input_tokens_seen": 21498378144,
      "step": 27325
    },
    {
      "epoch": 2.899002758328029,
      "grad_norm": 0.38795435831704767,
      "learning_rate": 4.3175559861934955e-05,
      "loss": 1.6858,
      "num_input_tokens_seen": 21499164832,
      "step": 27326
    },
    {
      "epoch": 2.8991088478676,
      "grad_norm": 0.38235927549956317,
      "learning_rate": 4.317508267976619e-05,
      "loss": 1.5393,
      "num_input_tokens_seen": 21499951536,
      "step": 27327
    },
    {
      "epoch": 2.8992149374071716,
      "grad_norm": 0.46842161885163053,
      "learning_rate": 4.317460548355226e-05,
      "loss": 1.6414,
      "num_input_tokens_seen": 21500738176,
      "step": 27328
    },
    {
      "epoch": 2.899321026946743,
      "grad_norm": 0.3782341471966052,
      "learning_rate": 4.3174128273293514e-05,
      "loss": 1.5625,
      "num_input_tokens_seen": 21501524912,
      "step": 27329
    },
    {
      "epoch": 2.8994271164863146,
      "grad_norm": 0.3595462619653966,
      "learning_rate": 4.317365104899034e-05,
      "loss": 1.5934,
      "num_input_tokens_seen": 21502311552,
      "step": 27330
    },
    {
      "epoch": 2.899533206025886,
      "grad_norm": 0.40661711472672707,
      "learning_rate": 4.3173173810643105e-05,
      "loss": 1.5181,
      "num_input_tokens_seen": 21503098304,
      "step": 27331
    },
    {
      "epoch": 2.899639295565457,
      "grad_norm": 0.4491770877977341,
      "learning_rate": 4.317269655825218e-05,
      "loss": 1.6227,
      "num_input_tokens_seen": 21503885104,
      "step": 27332
    },
    {
      "epoch": 2.8997453851050286,
      "grad_norm": 0.36140392441735925,
      "learning_rate": 4.317221929181792e-05,
      "loss": 1.564,
      "num_input_tokens_seen": 21504671888,
      "step": 27333
    },
    {
      "epoch": 2.8998514746446,
      "grad_norm": 0.4788400414672554,
      "learning_rate": 4.317174201134071e-05,
      "loss": 1.5242,
      "num_input_tokens_seen": 21505458672,
      "step": 27334
    },
    {
      "epoch": 2.8999575641841715,
      "grad_norm": 0.3876607136028546,
      "learning_rate": 4.31712647168209e-05,
      "loss": 1.5518,
      "num_input_tokens_seen": 21506245440,
      "step": 27335
    },
    {
      "epoch": 2.900063653723743,
      "grad_norm": 0.5303401933812517,
      "learning_rate": 4.317078740825887e-05,
      "loss": 1.5827,
      "num_input_tokens_seen": 21507032128,
      "step": 27336
    },
    {
      "epoch": 2.900169743263314,
      "grad_norm": 0.40851477742565356,
      "learning_rate": 4.3170310085655e-05,
      "loss": 1.5361,
      "num_input_tokens_seen": 21507818928,
      "step": 27337
    },
    {
      "epoch": 2.9002758328028855,
      "grad_norm": 0.35763542153248906,
      "learning_rate": 4.316983274900964e-05,
      "loss": 1.5333,
      "num_input_tokens_seen": 21508605632,
      "step": 27338
    },
    {
      "epoch": 2.900381922342457,
      "grad_norm": 0.4538521128937257,
      "learning_rate": 4.316935539832317e-05,
      "loss": 1.6116,
      "num_input_tokens_seen": 21509392432,
      "step": 27339
    },
    {
      "epoch": 2.9004880118820284,
      "grad_norm": 0.48200631849999304,
      "learning_rate": 4.316887803359595e-05,
      "loss": 1.661,
      "num_input_tokens_seen": 21510179088,
      "step": 27340
    },
    {
      "epoch": 2.9005941014216,
      "grad_norm": 0.6131322094552613,
      "learning_rate": 4.3168400654828356e-05,
      "loss": 1.5857,
      "num_input_tokens_seen": 21510965840,
      "step": 27341
    },
    {
      "epoch": 2.9007001909611714,
      "grad_norm": 0.6013428368658859,
      "learning_rate": 4.316792326202076e-05,
      "loss": 1.6601,
      "num_input_tokens_seen": 21511752544,
      "step": 27342
    },
    {
      "epoch": 2.900806280500743,
      "grad_norm": 0.41504434017832986,
      "learning_rate": 4.316744585517352e-05,
      "loss": 1.5439,
      "num_input_tokens_seen": 21512539232,
      "step": 27343
    },
    {
      "epoch": 2.900912370040314,
      "grad_norm": 0.5892680272750228,
      "learning_rate": 4.3166968434287014e-05,
      "loss": 1.5661,
      "num_input_tokens_seen": 21513325936,
      "step": 27344
    },
    {
      "epoch": 2.9010184595798854,
      "grad_norm": 0.5288036936136687,
      "learning_rate": 4.316649099936161e-05,
      "loss": 1.7191,
      "num_input_tokens_seen": 21514112800,
      "step": 27345
    },
    {
      "epoch": 2.901124549119457,
      "grad_norm": 0.6898913677771372,
      "learning_rate": 4.316601355039767e-05,
      "loss": 1.6081,
      "num_input_tokens_seen": 21514899504,
      "step": 27346
    },
    {
      "epoch": 2.9012306386590283,
      "grad_norm": 0.5345593982212645,
      "learning_rate": 4.316553608739556e-05,
      "loss": 1.5578,
      "num_input_tokens_seen": 21515686288,
      "step": 27347
    },
    {
      "epoch": 2.9013367281986,
      "grad_norm": 0.4494674884439881,
      "learning_rate": 4.3165058610355675e-05,
      "loss": 1.5539,
      "num_input_tokens_seen": 21516473072,
      "step": 27348
    },
    {
      "epoch": 2.901442817738171,
      "grad_norm": 0.392028844678477,
      "learning_rate": 4.316458111927836e-05,
      "loss": 1.5603,
      "num_input_tokens_seen": 21517259760,
      "step": 27349
    },
    {
      "epoch": 2.9015489072777423,
      "grad_norm": 0.41414870352803973,
      "learning_rate": 4.3164103614163983e-05,
      "loss": 1.6,
      "num_input_tokens_seen": 21518046576,
      "step": 27350
    },
    {
      "epoch": 2.9016549968173138,
      "grad_norm": 0.3518940634059459,
      "learning_rate": 4.316362609501292e-05,
      "loss": 1.5336,
      "num_input_tokens_seen": 21518833392,
      "step": 27351
    },
    {
      "epoch": 2.9017610863568852,
      "grad_norm": 0.49110891136629703,
      "learning_rate": 4.316314856182555e-05,
      "loss": 1.6386,
      "num_input_tokens_seen": 21519620208,
      "step": 27352
    },
    {
      "epoch": 2.9018671758964567,
      "grad_norm": 0.40808598324845113,
      "learning_rate": 4.316267101460222e-05,
      "loss": 1.5132,
      "num_input_tokens_seen": 21520406912,
      "step": 27353
    },
    {
      "epoch": 2.9019732654360277,
      "grad_norm": 0.37869519577431104,
      "learning_rate": 4.3162193453343315e-05,
      "loss": 1.5709,
      "num_input_tokens_seen": 21521193664,
      "step": 27354
    },
    {
      "epoch": 2.9020793549755997,
      "grad_norm": 0.40628745790323484,
      "learning_rate": 4.3161715878049205e-05,
      "loss": 1.4893,
      "num_input_tokens_seen": 21521980368,
      "step": 27355
    },
    {
      "epoch": 2.9021854445151707,
      "grad_norm": 0.36178251128014194,
      "learning_rate": 4.316123828872025e-05,
      "loss": 1.5628,
      "num_input_tokens_seen": 21522767136,
      "step": 27356
    },
    {
      "epoch": 2.902291534054742,
      "grad_norm": 0.5261825168106559,
      "learning_rate": 4.316076068535681e-05,
      "loss": 1.6214,
      "num_input_tokens_seen": 21523553840,
      "step": 27357
    },
    {
      "epoch": 2.9023976235943136,
      "grad_norm": 0.3823176731106455,
      "learning_rate": 4.3160283067959284e-05,
      "loss": 1.6856,
      "num_input_tokens_seen": 21524340624,
      "step": 27358
    },
    {
      "epoch": 2.902503713133885,
      "grad_norm": 0.40327192515283034,
      "learning_rate": 4.3159805436528025e-05,
      "loss": 1.5668,
      "num_input_tokens_seen": 21525127376,
      "step": 27359
    },
    {
      "epoch": 2.9026098026734566,
      "grad_norm": 0.3596651924236582,
      "learning_rate": 4.3159327791063394e-05,
      "loss": 1.6078,
      "num_input_tokens_seen": 21525914208,
      "step": 27360
    },
    {
      "epoch": 2.9027158922130276,
      "grad_norm": 0.361760493447912,
      "learning_rate": 4.3158850131565766e-05,
      "loss": 1.4161,
      "num_input_tokens_seen": 21526701040,
      "step": 27361
    },
    {
      "epoch": 2.902821981752599,
      "grad_norm": 0.3498137196694869,
      "learning_rate": 4.315837245803551e-05,
      "loss": 1.5973,
      "num_input_tokens_seen": 21527487840,
      "step": 27362
    },
    {
      "epoch": 2.9029280712921706,
      "grad_norm": 0.34657783594834285,
      "learning_rate": 4.3157894770473006e-05,
      "loss": 1.6605,
      "num_input_tokens_seen": 21528274624,
      "step": 27363
    },
    {
      "epoch": 2.903034160831742,
      "grad_norm": 0.3888830786502815,
      "learning_rate": 4.3157417068878606e-05,
      "loss": 1.5483,
      "num_input_tokens_seen": 21529061456,
      "step": 27364
    },
    {
      "epoch": 2.9031402503713135,
      "grad_norm": 0.3463611350289596,
      "learning_rate": 4.315693935325269e-05,
      "loss": 1.5989,
      "num_input_tokens_seen": 21529848176,
      "step": 27365
    },
    {
      "epoch": 2.9032463399108845,
      "grad_norm": 0.3777473729319879,
      "learning_rate": 4.315646162359562e-05,
      "loss": 1.5942,
      "num_input_tokens_seen": 21530634912,
      "step": 27366
    },
    {
      "epoch": 2.9033524294504565,
      "grad_norm": 0.36795727310919824,
      "learning_rate": 4.315598387990778e-05,
      "loss": 1.6254,
      "num_input_tokens_seen": 21531421696,
      "step": 27367
    },
    {
      "epoch": 2.9034585189900275,
      "grad_norm": 0.4103056328522964,
      "learning_rate": 4.315550612218952e-05,
      "loss": 1.6523,
      "num_input_tokens_seen": 21532208528,
      "step": 27368
    },
    {
      "epoch": 2.903564608529599,
      "grad_norm": 0.4436068792130376,
      "learning_rate": 4.315502835044122e-05,
      "loss": 1.6349,
      "num_input_tokens_seen": 21532995232,
      "step": 27369
    },
    {
      "epoch": 2.9036706980691704,
      "grad_norm": 0.3527713277754062,
      "learning_rate": 4.3154550564663244e-05,
      "loss": 1.5772,
      "num_input_tokens_seen": 21533782080,
      "step": 27370
    },
    {
      "epoch": 2.903776787608742,
      "grad_norm": 0.4499756843286383,
      "learning_rate": 4.315407276485596e-05,
      "loss": 1.5477,
      "num_input_tokens_seen": 21534568896,
      "step": 27371
    },
    {
      "epoch": 2.9038828771483134,
      "grad_norm": 0.3359175411093961,
      "learning_rate": 4.315359495101975e-05,
      "loss": 1.5361,
      "num_input_tokens_seen": 21535355584,
      "step": 27372
    },
    {
      "epoch": 2.9039889666878844,
      "grad_norm": 0.39665669656964636,
      "learning_rate": 4.315311712315497e-05,
      "loss": 1.6579,
      "num_input_tokens_seen": 21536142368,
      "step": 27373
    },
    {
      "epoch": 2.904095056227456,
      "grad_norm": 0.44365506328772014,
      "learning_rate": 4.3152639281262e-05,
      "loss": 1.6989,
      "num_input_tokens_seen": 21536929040,
      "step": 27374
    },
    {
      "epoch": 2.9042011457670274,
      "grad_norm": 0.3823011308200409,
      "learning_rate": 4.315216142534119e-05,
      "loss": 1.5998,
      "num_input_tokens_seen": 21537715936,
      "step": 27375
    },
    {
      "epoch": 2.904307235306599,
      "grad_norm": 0.4226631132894157,
      "learning_rate": 4.315168355539293e-05,
      "loss": 1.6523,
      "num_input_tokens_seen": 21538502672,
      "step": 27376
    },
    {
      "epoch": 2.9044133248461703,
      "grad_norm": 0.4466881509196398,
      "learning_rate": 4.315120567141758e-05,
      "loss": 1.6183,
      "num_input_tokens_seen": 21539289360,
      "step": 27377
    },
    {
      "epoch": 2.9045194143857413,
      "grad_norm": 0.36221944899850467,
      "learning_rate": 4.315072777341552e-05,
      "loss": 1.5658,
      "num_input_tokens_seen": 21540076208,
      "step": 27378
    },
    {
      "epoch": 2.904625503925313,
      "grad_norm": 0.42727656119343815,
      "learning_rate": 4.31502498613871e-05,
      "loss": 1.6052,
      "num_input_tokens_seen": 21540862912,
      "step": 27379
    },
    {
      "epoch": 2.9047315934648843,
      "grad_norm": 0.4124160777266735,
      "learning_rate": 4.31497719353327e-05,
      "loss": 1.6751,
      "num_input_tokens_seen": 21541649616,
      "step": 27380
    },
    {
      "epoch": 2.9048376830044558,
      "grad_norm": 0.38955154370956374,
      "learning_rate": 4.314929399525269e-05,
      "loss": 1.5454,
      "num_input_tokens_seen": 21542436368,
      "step": 27381
    },
    {
      "epoch": 2.9049437725440272,
      "grad_norm": 0.41641476034015995,
      "learning_rate": 4.3148816041147444e-05,
      "loss": 1.6586,
      "num_input_tokens_seen": 21543223232,
      "step": 27382
    },
    {
      "epoch": 2.9050498620835987,
      "grad_norm": 0.4388121414805452,
      "learning_rate": 4.3148338073017315e-05,
      "loss": 1.7493,
      "num_input_tokens_seen": 21544009952,
      "step": 27383
    },
    {
      "epoch": 2.90515595162317,
      "grad_norm": 0.41601187602693296,
      "learning_rate": 4.314786009086269e-05,
      "loss": 1.6136,
      "num_input_tokens_seen": 21544796704,
      "step": 27384
    },
    {
      "epoch": 2.9052620411627412,
      "grad_norm": 0.3705934852120689,
      "learning_rate": 4.314738209468393e-05,
      "loss": 1.5815,
      "num_input_tokens_seen": 21545583536,
      "step": 27385
    },
    {
      "epoch": 2.9053681307023127,
      "grad_norm": 0.3935072860322145,
      "learning_rate": 4.314690408448141e-05,
      "loss": 1.6136,
      "num_input_tokens_seen": 21546370256,
      "step": 27386
    },
    {
      "epoch": 2.905474220241884,
      "grad_norm": 0.3775083884107315,
      "learning_rate": 4.3146426060255486e-05,
      "loss": 1.5218,
      "num_input_tokens_seen": 21547157056,
      "step": 27387
    },
    {
      "epoch": 2.9055803097814557,
      "grad_norm": 0.3673802427880881,
      "learning_rate": 4.314594802200654e-05,
      "loss": 1.5809,
      "num_input_tokens_seen": 21547943824,
      "step": 27388
    },
    {
      "epoch": 2.905686399321027,
      "grad_norm": 0.3860877429066219,
      "learning_rate": 4.3145469969734944e-05,
      "loss": 1.5546,
      "num_input_tokens_seen": 21548730672,
      "step": 27389
    },
    {
      "epoch": 2.905792488860598,
      "grad_norm": 0.45115831926966343,
      "learning_rate": 4.314499190344105e-05,
      "loss": 1.5196,
      "num_input_tokens_seen": 21549517488,
      "step": 27390
    },
    {
      "epoch": 2.9058985784001696,
      "grad_norm": 0.39542161706939166,
      "learning_rate": 4.314451382312524e-05,
      "loss": 1.5251,
      "num_input_tokens_seen": 21550304208,
      "step": 27391
    },
    {
      "epoch": 2.906004667939741,
      "grad_norm": 0.45117884156549964,
      "learning_rate": 4.314403572878789e-05,
      "loss": 1.4281,
      "num_input_tokens_seen": 21551090992,
      "step": 27392
    },
    {
      "epoch": 2.9061107574793126,
      "grad_norm": 0.39492687436529195,
      "learning_rate": 4.3143557620429354e-05,
      "loss": 1.5499,
      "num_input_tokens_seen": 21551877648,
      "step": 27393
    },
    {
      "epoch": 2.906216847018884,
      "grad_norm": 0.3454407502356815,
      "learning_rate": 4.314307949805001e-05,
      "loss": 1.5682,
      "num_input_tokens_seen": 21552664544,
      "step": 27394
    },
    {
      "epoch": 2.906322936558455,
      "grad_norm": 0.38486036230024784,
      "learning_rate": 4.3142601361650236e-05,
      "loss": 1.5987,
      "num_input_tokens_seen": 21553451280,
      "step": 27395
    },
    {
      "epoch": 2.906429026098027,
      "grad_norm": 0.38176719241958657,
      "learning_rate": 4.3142123211230384e-05,
      "loss": 1.735,
      "num_input_tokens_seen": 21554238064,
      "step": 27396
    },
    {
      "epoch": 2.906535115637598,
      "grad_norm": 0.40311882622529543,
      "learning_rate": 4.3141645046790835e-05,
      "loss": 1.5737,
      "num_input_tokens_seen": 21555024832,
      "step": 27397
    },
    {
      "epoch": 2.9066412051771695,
      "grad_norm": 0.3821666668571402,
      "learning_rate": 4.314116686833195e-05,
      "loss": 1.5479,
      "num_input_tokens_seen": 21555811632,
      "step": 27398
    },
    {
      "epoch": 2.906747294716741,
      "grad_norm": 0.42657288894990086,
      "learning_rate": 4.3140688675854106e-05,
      "loss": 1.4941,
      "num_input_tokens_seen": 21556598368,
      "step": 27399
    },
    {
      "epoch": 2.9068533842563125,
      "grad_norm": 0.3936389468526937,
      "learning_rate": 4.314021046935767e-05,
      "loss": 1.5724,
      "num_input_tokens_seen": 21557385088,
      "step": 27400
    },
    {
      "epoch": 2.906959473795884,
      "grad_norm": 0.4662989467368863,
      "learning_rate": 4.313973224884301e-05,
      "loss": 1.5969,
      "num_input_tokens_seen": 21558171808,
      "step": 27401
    },
    {
      "epoch": 2.907065563335455,
      "grad_norm": 0.38346778305977874,
      "learning_rate": 4.31392540143105e-05,
      "loss": 1.433,
      "num_input_tokens_seen": 21558958640,
      "step": 27402
    },
    {
      "epoch": 2.9071716528750264,
      "grad_norm": 0.44515705455088334,
      "learning_rate": 4.313877576576051e-05,
      "loss": 1.4631,
      "num_input_tokens_seen": 21559745392,
      "step": 27403
    },
    {
      "epoch": 2.907277742414598,
      "grad_norm": 0.3106921544662066,
      "learning_rate": 4.3138297503193405e-05,
      "loss": 1.4997,
      "num_input_tokens_seen": 21560532144,
      "step": 27404
    },
    {
      "epoch": 2.9073838319541694,
      "grad_norm": 0.4217062477841179,
      "learning_rate": 4.3137819226609554e-05,
      "loss": 1.5658,
      "num_input_tokens_seen": 21561318944,
      "step": 27405
    },
    {
      "epoch": 2.907489921493741,
      "grad_norm": 0.38121840492108183,
      "learning_rate": 4.313734093600933e-05,
      "loss": 1.7082,
      "num_input_tokens_seen": 21562105648,
      "step": 27406
    },
    {
      "epoch": 2.907596011033312,
      "grad_norm": 0.39970303182880457,
      "learning_rate": 4.313686263139309e-05,
      "loss": 1.5879,
      "num_input_tokens_seen": 21562892480,
      "step": 27407
    },
    {
      "epoch": 2.9077021005728834,
      "grad_norm": 0.49461568140986906,
      "learning_rate": 4.313638431276122e-05,
      "loss": 1.7149,
      "num_input_tokens_seen": 21563679200,
      "step": 27408
    },
    {
      "epoch": 2.907808190112455,
      "grad_norm": 0.3667208707539251,
      "learning_rate": 4.31359059801141e-05,
      "loss": 1.5907,
      "num_input_tokens_seen": 21564465904,
      "step": 27409
    },
    {
      "epoch": 2.9079142796520263,
      "grad_norm": 0.535920697842273,
      "learning_rate": 4.3135427633452066e-05,
      "loss": 1.6475,
      "num_input_tokens_seen": 21565252640,
      "step": 27410
    },
    {
      "epoch": 2.908020369191598,
      "grad_norm": 0.4065184179886756,
      "learning_rate": 4.3134949272775516e-05,
      "loss": 1.5807,
      "num_input_tokens_seen": 21566039440,
      "step": 27411
    },
    {
      "epoch": 2.9081264587311693,
      "grad_norm": 0.4805534153378204,
      "learning_rate": 4.31344708980848e-05,
      "loss": 1.608,
      "num_input_tokens_seen": 21566826176,
      "step": 27412
    },
    {
      "epoch": 2.9082325482707407,
      "grad_norm": 0.4535392598383059,
      "learning_rate": 4.313399250938031e-05,
      "loss": 1.667,
      "num_input_tokens_seen": 21567612896,
      "step": 27413
    },
    {
      "epoch": 2.9083386378103118,
      "grad_norm": 0.5351512913717409,
      "learning_rate": 4.313351410666239e-05,
      "loss": 1.5768,
      "num_input_tokens_seen": 21568399648,
      "step": 27414
    },
    {
      "epoch": 2.9084447273498832,
      "grad_norm": 0.38719977149625534,
      "learning_rate": 4.313303568993142e-05,
      "loss": 1.6303,
      "num_input_tokens_seen": 21569186336,
      "step": 27415
    },
    {
      "epoch": 2.9085508168894547,
      "grad_norm": 0.6296973324550323,
      "learning_rate": 4.313255725918778e-05,
      "loss": 1.6481,
      "num_input_tokens_seen": 21569973120,
      "step": 27416
    },
    {
      "epoch": 2.908656906429026,
      "grad_norm": 0.4436243833925193,
      "learning_rate": 4.313207881443183e-05,
      "loss": 1.6108,
      "num_input_tokens_seen": 21570759888,
      "step": 27417
    },
    {
      "epoch": 2.9087629959685977,
      "grad_norm": 0.42821949613786336,
      "learning_rate": 4.313160035566395e-05,
      "loss": 1.6203,
      "num_input_tokens_seen": 21571546720,
      "step": 27418
    },
    {
      "epoch": 2.9088690855081687,
      "grad_norm": 0.5006718832024585,
      "learning_rate": 4.313112188288449e-05,
      "loss": 1.718,
      "num_input_tokens_seen": 21572333472,
      "step": 27419
    },
    {
      "epoch": 2.90897517504774,
      "grad_norm": 0.4142508832308697,
      "learning_rate": 4.313064339609384e-05,
      "loss": 1.6056,
      "num_input_tokens_seen": 21573120336,
      "step": 27420
    },
    {
      "epoch": 2.9090812645873116,
      "grad_norm": 0.5022575073481068,
      "learning_rate": 4.313016489529235e-05,
      "loss": 1.551,
      "num_input_tokens_seen": 21573907088,
      "step": 27421
    },
    {
      "epoch": 2.909187354126883,
      "grad_norm": 0.42813007570356654,
      "learning_rate": 4.3129686380480406e-05,
      "loss": 1.5962,
      "num_input_tokens_seen": 21574693792,
      "step": 27422
    },
    {
      "epoch": 2.9092934436664546,
      "grad_norm": 0.5443481144026354,
      "learning_rate": 4.312920785165837e-05,
      "loss": 1.5365,
      "num_input_tokens_seen": 21575480560,
      "step": 27423
    },
    {
      "epoch": 2.9093995332060256,
      "grad_norm": 0.49361855324831155,
      "learning_rate": 4.312872930882662e-05,
      "loss": 1.5179,
      "num_input_tokens_seen": 21576267440,
      "step": 27424
    },
    {
      "epoch": 2.9095056227455975,
      "grad_norm": 0.5508474643318992,
      "learning_rate": 4.312825075198552e-05,
      "loss": 1.6109,
      "num_input_tokens_seen": 21577054160,
      "step": 27425
    },
    {
      "epoch": 2.9096117122851686,
      "grad_norm": 0.5704484683115922,
      "learning_rate": 4.312777218113543e-05,
      "loss": 1.5217,
      "num_input_tokens_seen": 21577840896,
      "step": 27426
    },
    {
      "epoch": 2.90971780182474,
      "grad_norm": 0.38520820135540834,
      "learning_rate": 4.3127293596276735e-05,
      "loss": 1.501,
      "num_input_tokens_seen": 21578627728,
      "step": 27427
    },
    {
      "epoch": 2.9098238913643115,
      "grad_norm": 0.5859929609905945,
      "learning_rate": 4.31268149974098e-05,
      "loss": 1.6574,
      "num_input_tokens_seen": 21579414464,
      "step": 27428
    },
    {
      "epoch": 2.909929980903883,
      "grad_norm": 0.4032235015000028,
      "learning_rate": 4.3126336384534993e-05,
      "loss": 1.534,
      "num_input_tokens_seen": 21580201264,
      "step": 27429
    },
    {
      "epoch": 2.9100360704434545,
      "grad_norm": 0.4163348247320873,
      "learning_rate": 4.312585775765269e-05,
      "loss": 1.6179,
      "num_input_tokens_seen": 21580988032,
      "step": 27430
    },
    {
      "epoch": 2.9101421599830255,
      "grad_norm": 0.5307446109410309,
      "learning_rate": 4.3125379116763256e-05,
      "loss": 1.6339,
      "num_input_tokens_seen": 21581774880,
      "step": 27431
    },
    {
      "epoch": 2.910248249522597,
      "grad_norm": 0.43222835541667665,
      "learning_rate": 4.3124900461867054e-05,
      "loss": 1.6107,
      "num_input_tokens_seen": 21582561616,
      "step": 27432
    },
    {
      "epoch": 2.9103543390621684,
      "grad_norm": 0.4223556361118578,
      "learning_rate": 4.312442179296446e-05,
      "loss": 1.6336,
      "num_input_tokens_seen": 21583348320,
      "step": 27433
    },
    {
      "epoch": 2.91046042860174,
      "grad_norm": 0.5075925193414775,
      "learning_rate": 4.312394311005585e-05,
      "loss": 1.6468,
      "num_input_tokens_seen": 21584134976,
      "step": 27434
    },
    {
      "epoch": 2.9105665181413114,
      "grad_norm": 0.4065054198585305,
      "learning_rate": 4.312346441314159e-05,
      "loss": 1.5791,
      "num_input_tokens_seen": 21584921696,
      "step": 27435
    },
    {
      "epoch": 2.9106726076808824,
      "grad_norm": 0.46135803055793173,
      "learning_rate": 4.312298570222204e-05,
      "loss": 1.6261,
      "num_input_tokens_seen": 21585708400,
      "step": 27436
    },
    {
      "epoch": 2.910778697220454,
      "grad_norm": 0.40289199951909305,
      "learning_rate": 4.3122506977297584e-05,
      "loss": 1.5456,
      "num_input_tokens_seen": 21586495168,
      "step": 27437
    },
    {
      "epoch": 2.9108847867600254,
      "grad_norm": 0.44323268389443554,
      "learning_rate": 4.312202823836859e-05,
      "loss": 1.6864,
      "num_input_tokens_seen": 21587281872,
      "step": 27438
    },
    {
      "epoch": 2.910990876299597,
      "grad_norm": 0.36836762393677264,
      "learning_rate": 4.312154948543542e-05,
      "loss": 1.641,
      "num_input_tokens_seen": 21588068672,
      "step": 27439
    },
    {
      "epoch": 2.9110969658391683,
      "grad_norm": 0.3598919279360586,
      "learning_rate": 4.312107071849845e-05,
      "loss": 1.4803,
      "num_input_tokens_seen": 21588855584,
      "step": 27440
    },
    {
      "epoch": 2.91120305537874,
      "grad_norm": 0.37800625903236895,
      "learning_rate": 4.312059193755804e-05,
      "loss": 1.6475,
      "num_input_tokens_seen": 21589642352,
      "step": 27441
    },
    {
      "epoch": 2.9113091449183113,
      "grad_norm": 0.3975144008554528,
      "learning_rate": 4.312011314261458e-05,
      "loss": 1.5407,
      "num_input_tokens_seen": 21590429152,
      "step": 27442
    },
    {
      "epoch": 2.9114152344578823,
      "grad_norm": 0.3516483154366956,
      "learning_rate": 4.311963433366842e-05,
      "loss": 1.4897,
      "num_input_tokens_seen": 21591215984,
      "step": 27443
    },
    {
      "epoch": 2.911521323997454,
      "grad_norm": 0.37979315606750985,
      "learning_rate": 4.311915551071994e-05,
      "loss": 1.5261,
      "num_input_tokens_seen": 21592002832,
      "step": 27444
    },
    {
      "epoch": 2.9116274135370253,
      "grad_norm": 0.35202101851917333,
      "learning_rate": 4.311867667376952e-05,
      "loss": 1.5386,
      "num_input_tokens_seen": 21592789632,
      "step": 27445
    },
    {
      "epoch": 2.9117335030765967,
      "grad_norm": 0.41072506563099603,
      "learning_rate": 4.3118197822817504e-05,
      "loss": 1.5565,
      "num_input_tokens_seen": 21593576352,
      "step": 27446
    },
    {
      "epoch": 2.911839592616168,
      "grad_norm": 0.3798004631091614,
      "learning_rate": 4.3117718957864286e-05,
      "loss": 1.5814,
      "num_input_tokens_seen": 21594363088,
      "step": 27447
    },
    {
      "epoch": 2.9119456821557392,
      "grad_norm": 0.3862871063394478,
      "learning_rate": 4.311724007891022e-05,
      "loss": 1.5609,
      "num_input_tokens_seen": 21595149888,
      "step": 27448
    },
    {
      "epoch": 2.9120517716953107,
      "grad_norm": 0.39417243264984964,
      "learning_rate": 4.3116761185955675e-05,
      "loss": 1.6628,
      "num_input_tokens_seen": 21595936672,
      "step": 27449
    },
    {
      "epoch": 2.912157861234882,
      "grad_norm": 0.3733814222150192,
      "learning_rate": 4.311628227900104e-05,
      "loss": 1.4614,
      "num_input_tokens_seen": 21596723392,
      "step": 27450
    },
    {
      "epoch": 2.9122639507744537,
      "grad_norm": 0.38954243276974343,
      "learning_rate": 4.311580335804667e-05,
      "loss": 1.6483,
      "num_input_tokens_seen": 21597510160,
      "step": 27451
    },
    {
      "epoch": 2.912370040314025,
      "grad_norm": 0.615299958006649,
      "learning_rate": 4.311532442309294e-05,
      "loss": 1.5014,
      "num_input_tokens_seen": 21598297008,
      "step": 27452
    },
    {
      "epoch": 2.912476129853596,
      "grad_norm": 0.3862874592223971,
      "learning_rate": 4.311484547414022e-05,
      "loss": 1.4627,
      "num_input_tokens_seen": 21599083728,
      "step": 27453
    },
    {
      "epoch": 2.912582219393168,
      "grad_norm": 0.4447172316686674,
      "learning_rate": 4.311436651118887e-05,
      "loss": 1.5464,
      "num_input_tokens_seen": 21599870512,
      "step": 27454
    },
    {
      "epoch": 2.912688308932739,
      "grad_norm": 0.43974668522616656,
      "learning_rate": 4.3113887534239284e-05,
      "loss": 1.7201,
      "num_input_tokens_seen": 21600657248,
      "step": 27455
    },
    {
      "epoch": 2.9127943984723106,
      "grad_norm": 0.4273475056035098,
      "learning_rate": 4.311340854329181e-05,
      "loss": 1.5407,
      "num_input_tokens_seen": 21601444096,
      "step": 27456
    },
    {
      "epoch": 2.912900488011882,
      "grad_norm": 0.5367473157858901,
      "learning_rate": 4.3112929538346824e-05,
      "loss": 1.5705,
      "num_input_tokens_seen": 21602230896,
      "step": 27457
    },
    {
      "epoch": 2.9130065775514535,
      "grad_norm": 0.5973861629216042,
      "learning_rate": 4.3112450519404704e-05,
      "loss": 1.6581,
      "num_input_tokens_seen": 21603017696,
      "step": 27458
    },
    {
      "epoch": 2.913112667091025,
      "grad_norm": 0.39846108262754243,
      "learning_rate": 4.3111971486465805e-05,
      "loss": 1.4982,
      "num_input_tokens_seen": 21603804480,
      "step": 27459
    },
    {
      "epoch": 2.913218756630596,
      "grad_norm": 0.6634098491843788,
      "learning_rate": 4.311149243953051e-05,
      "loss": 1.6641,
      "num_input_tokens_seen": 21604591248,
      "step": 27460
    },
    {
      "epoch": 2.9133248461701675,
      "grad_norm": 0.36380728343530866,
      "learning_rate": 4.311101337859919e-05,
      "loss": 1.5599,
      "num_input_tokens_seen": 21605377984,
      "step": 27461
    },
    {
      "epoch": 2.913430935709739,
      "grad_norm": 0.5875282090208488,
      "learning_rate": 4.3110534303672194e-05,
      "loss": 1.5538,
      "num_input_tokens_seen": 21606164704,
      "step": 27462
    },
    {
      "epoch": 2.9135370252493105,
      "grad_norm": 0.46112610017164246,
      "learning_rate": 4.311005521474992e-05,
      "loss": 1.5641,
      "num_input_tokens_seen": 21606951424,
      "step": 27463
    },
    {
      "epoch": 2.913643114788882,
      "grad_norm": 0.5382572137883389,
      "learning_rate": 4.310957611183273e-05,
      "loss": 1.5604,
      "num_input_tokens_seen": 21607738192,
      "step": 27464
    },
    {
      "epoch": 2.913749204328453,
      "grad_norm": 0.42106302260153056,
      "learning_rate": 4.310909699492098e-05,
      "loss": 1.6334,
      "num_input_tokens_seen": 21608525024,
      "step": 27465
    },
    {
      "epoch": 2.913855293868025,
      "grad_norm": 0.4169925115365902,
      "learning_rate": 4.310861786401505e-05,
      "loss": 1.6806,
      "num_input_tokens_seen": 21609311760,
      "step": 27466
    },
    {
      "epoch": 2.913961383407596,
      "grad_norm": 0.420093275388774,
      "learning_rate": 4.3108138719115325e-05,
      "loss": 1.4991,
      "num_input_tokens_seen": 21610098576,
      "step": 27467
    },
    {
      "epoch": 2.9140674729471674,
      "grad_norm": 1.0772959794646613,
      "learning_rate": 4.310765956022216e-05,
      "loss": 1.5563,
      "num_input_tokens_seen": 21610885360,
      "step": 27468
    },
    {
      "epoch": 2.914173562486739,
      "grad_norm": 0.5862119535533367,
      "learning_rate": 4.310718038733592e-05,
      "loss": 1.4871,
      "num_input_tokens_seen": 21611672160,
      "step": 27469
    },
    {
      "epoch": 2.9142796520263103,
      "grad_norm": 1.788957821256674,
      "learning_rate": 4.310670120045698e-05,
      "loss": 1.5933,
      "num_input_tokens_seen": 21612458896,
      "step": 27470
    },
    {
      "epoch": 2.914385741565882,
      "grad_norm": 0.5079369831301067,
      "learning_rate": 4.310622199958573e-05,
      "loss": 1.7048,
      "num_input_tokens_seen": 21613245600,
      "step": 27471
    },
    {
      "epoch": 2.914491831105453,
      "grad_norm": 0.5503765564873339,
      "learning_rate": 4.3105742784722505e-05,
      "loss": 1.5704,
      "num_input_tokens_seen": 21614032368,
      "step": 27472
    },
    {
      "epoch": 2.9145979206450243,
      "grad_norm": 1.440128919056701,
      "learning_rate": 4.31052635558677e-05,
      "loss": 1.6111,
      "num_input_tokens_seen": 21614819136,
      "step": 27473
    },
    {
      "epoch": 2.914704010184596,
      "grad_norm": 0.7574654517815801,
      "learning_rate": 4.3104784313021673e-05,
      "loss": 1.6228,
      "num_input_tokens_seen": 21615605920,
      "step": 27474
    },
    {
      "epoch": 2.9148100997241673,
      "grad_norm": 0.684629651119136,
      "learning_rate": 4.310430505618481e-05,
      "loss": 1.4861,
      "num_input_tokens_seen": 21616392704,
      "step": 27475
    },
    {
      "epoch": 2.9149161892637387,
      "grad_norm": 0.6292425881291769,
      "learning_rate": 4.3103825785357464e-05,
      "loss": 1.612,
      "num_input_tokens_seen": 21617179456,
      "step": 27476
    },
    {
      "epoch": 2.9150222788033098,
      "grad_norm": 0.8947109310026211,
      "learning_rate": 4.310334650054001e-05,
      "loss": 1.7445,
      "num_input_tokens_seen": 21617966208,
      "step": 27477
    },
    {
      "epoch": 2.9151283683428812,
      "grad_norm": 0.6521531433923126,
      "learning_rate": 4.310286720173283e-05,
      "loss": 1.5631,
      "num_input_tokens_seen": 21618752944,
      "step": 27478
    },
    {
      "epoch": 2.9152344578824527,
      "grad_norm": 0.6731330650884598,
      "learning_rate": 4.310238788893628e-05,
      "loss": 1.5288,
      "num_input_tokens_seen": 21619539728,
      "step": 27479
    },
    {
      "epoch": 2.915340547422024,
      "grad_norm": 0.5032017382503117,
      "learning_rate": 4.310190856215073e-05,
      "loss": 1.6707,
      "num_input_tokens_seen": 21620326384,
      "step": 27480
    },
    {
      "epoch": 2.9154466369615957,
      "grad_norm": 0.4404090233819595,
      "learning_rate": 4.310142922137657e-05,
      "loss": 1.5301,
      "num_input_tokens_seen": 21621113168,
      "step": 27481
    },
    {
      "epoch": 2.915552726501167,
      "grad_norm": 0.50642826616553,
      "learning_rate": 4.310094986661415e-05,
      "loss": 1.6815,
      "num_input_tokens_seen": 21621899872,
      "step": 27482
    },
    {
      "epoch": 2.9156588160407386,
      "grad_norm": 0.3949159582985796,
      "learning_rate": 4.3100470497863845e-05,
      "loss": 1.5457,
      "num_input_tokens_seen": 21622686640,
      "step": 27483
    },
    {
      "epoch": 2.9157649055803097,
      "grad_norm": 0.5983246810896548,
      "learning_rate": 4.309999111512603e-05,
      "loss": 1.6302,
      "num_input_tokens_seen": 21623473440,
      "step": 27484
    },
    {
      "epoch": 2.915870995119881,
      "grad_norm": 0.4058661976482082,
      "learning_rate": 4.309951171840107e-05,
      "loss": 1.6099,
      "num_input_tokens_seen": 21624260224,
      "step": 27485
    },
    {
      "epoch": 2.9159770846594526,
      "grad_norm": 0.546583237976769,
      "learning_rate": 4.3099032307689336e-05,
      "loss": 1.6963,
      "num_input_tokens_seen": 21625046976,
      "step": 27486
    },
    {
      "epoch": 2.916083174199024,
      "grad_norm": 0.3800602692026771,
      "learning_rate": 4.3098552882991207e-05,
      "loss": 1.5147,
      "num_input_tokens_seen": 21625833728,
      "step": 27487
    },
    {
      "epoch": 2.9161892637385955,
      "grad_norm": 0.5543931126887325,
      "learning_rate": 4.309807344430704e-05,
      "loss": 1.5572,
      "num_input_tokens_seen": 21626620544,
      "step": 27488
    },
    {
      "epoch": 2.9162953532781666,
      "grad_norm": 0.4480736656021051,
      "learning_rate": 4.309759399163722e-05,
      "loss": 1.5566,
      "num_input_tokens_seen": 21627407248,
      "step": 27489
    },
    {
      "epoch": 2.916401442817738,
      "grad_norm": 0.5119597850140516,
      "learning_rate": 4.3097114524982106e-05,
      "loss": 1.5573,
      "num_input_tokens_seen": 21628194064,
      "step": 27490
    },
    {
      "epoch": 2.9165075323573095,
      "grad_norm": 0.4253749699989976,
      "learning_rate": 4.309663504434208e-05,
      "loss": 1.6489,
      "num_input_tokens_seen": 21628980864,
      "step": 27491
    },
    {
      "epoch": 2.916613621896881,
      "grad_norm": 0.46551032528298836,
      "learning_rate": 4.30961555497175e-05,
      "loss": 1.4211,
      "num_input_tokens_seen": 21629767680,
      "step": 27492
    },
    {
      "epoch": 2.9167197114364525,
      "grad_norm": 0.4659000236128042,
      "learning_rate": 4.309567604110875e-05,
      "loss": 1.583,
      "num_input_tokens_seen": 21630554544,
      "step": 27493
    },
    {
      "epoch": 2.9168258009760235,
      "grad_norm": 0.4655524138812201,
      "learning_rate": 4.309519651851618e-05,
      "loss": 1.677,
      "num_input_tokens_seen": 21631341392,
      "step": 27494
    },
    {
      "epoch": 2.9169318905155954,
      "grad_norm": 0.43582945218808866,
      "learning_rate": 4.309471698194017e-05,
      "loss": 1.633,
      "num_input_tokens_seen": 21632128176,
      "step": 27495
    },
    {
      "epoch": 2.9170379800551665,
      "grad_norm": 0.41853577554968885,
      "learning_rate": 4.309423743138111e-05,
      "loss": 1.5391,
      "num_input_tokens_seen": 21632914912,
      "step": 27496
    },
    {
      "epoch": 2.917144069594738,
      "grad_norm": 0.41396362140401566,
      "learning_rate": 4.309375786683935e-05,
      "loss": 1.6565,
      "num_input_tokens_seen": 21633701712,
      "step": 27497
    },
    {
      "epoch": 2.9172501591343094,
      "grad_norm": 0.5520820342746992,
      "learning_rate": 4.309327828831526e-05,
      "loss": 1.588,
      "num_input_tokens_seen": 21634488576,
      "step": 27498
    },
    {
      "epoch": 2.917356248673881,
      "grad_norm": 0.4365895261666081,
      "learning_rate": 4.309279869580921e-05,
      "loss": 1.6327,
      "num_input_tokens_seen": 21635275344,
      "step": 27499
    },
    {
      "epoch": 2.9174623382134524,
      "grad_norm": 0.4195898595678484,
      "learning_rate": 4.309231908932159e-05,
      "loss": 1.5419,
      "num_input_tokens_seen": 21636062112,
      "step": 27500
    },
    {
      "epoch": 2.9175684277530234,
      "grad_norm": 0.5767200625982872,
      "learning_rate": 4.3091839468852746e-05,
      "loss": 1.6266,
      "num_input_tokens_seen": 21636848912,
      "step": 27501
    },
    {
      "epoch": 2.917674517292595,
      "grad_norm": 0.36547471172904944,
      "learning_rate": 4.309135983440307e-05,
      "loss": 1.5902,
      "num_input_tokens_seen": 21637635696,
      "step": 27502
    },
    {
      "epoch": 2.9177806068321663,
      "grad_norm": 0.44255428018907744,
      "learning_rate": 4.309088018597291e-05,
      "loss": 1.5665,
      "num_input_tokens_seen": 21638422480,
      "step": 27503
    },
    {
      "epoch": 2.917886696371738,
      "grad_norm": 0.4217122296936706,
      "learning_rate": 4.309040052356265e-05,
      "loss": 1.5727,
      "num_input_tokens_seen": 21639209232,
      "step": 27504
    },
    {
      "epoch": 2.9179927859113093,
      "grad_norm": 0.6751189266916329,
      "learning_rate": 4.3089920847172664e-05,
      "loss": 1.5516,
      "num_input_tokens_seen": 21639995936,
      "step": 27505
    },
    {
      "epoch": 2.9180988754508803,
      "grad_norm": 0.38930449735168027,
      "learning_rate": 4.3089441156803315e-05,
      "loss": 1.5905,
      "num_input_tokens_seen": 21640782704,
      "step": 27506
    },
    {
      "epoch": 2.918204964990452,
      "grad_norm": 0.492712208029617,
      "learning_rate": 4.308896145245498e-05,
      "loss": 1.5517,
      "num_input_tokens_seen": 21641569504,
      "step": 27507
    },
    {
      "epoch": 2.9183110545300233,
      "grad_norm": 0.3792905072664794,
      "learning_rate": 4.308848173412803e-05,
      "loss": 1.5292,
      "num_input_tokens_seen": 21642356256,
      "step": 27508
    },
    {
      "epoch": 2.9184171440695947,
      "grad_norm": 0.4085096861565657,
      "learning_rate": 4.3088002001822825e-05,
      "loss": 1.5674,
      "num_input_tokens_seen": 21643143040,
      "step": 27509
    },
    {
      "epoch": 2.918523233609166,
      "grad_norm": 0.4452697782252968,
      "learning_rate": 4.3087522255539734e-05,
      "loss": 1.5792,
      "num_input_tokens_seen": 21643929744,
      "step": 27510
    },
    {
      "epoch": 2.9186293231487377,
      "grad_norm": 0.3577343436401741,
      "learning_rate": 4.308704249527915e-05,
      "loss": 1.5819,
      "num_input_tokens_seen": 21644716496,
      "step": 27511
    },
    {
      "epoch": 2.918735412688309,
      "grad_norm": 0.4078184699985648,
      "learning_rate": 4.308656272104143e-05,
      "loss": 1.5506,
      "num_input_tokens_seen": 21645503200,
      "step": 27512
    },
    {
      "epoch": 2.91884150222788,
      "grad_norm": 0.3872861499933275,
      "learning_rate": 4.308608293282694e-05,
      "loss": 1.6383,
      "num_input_tokens_seen": 21646289936,
      "step": 27513
    },
    {
      "epoch": 2.9189475917674517,
      "grad_norm": 0.37299325345480266,
      "learning_rate": 4.308560313063606e-05,
      "loss": 1.5021,
      "num_input_tokens_seen": 21647076752,
      "step": 27514
    },
    {
      "epoch": 2.919053681307023,
      "grad_norm": 0.37320251625757744,
      "learning_rate": 4.3085123314469155e-05,
      "loss": 1.6813,
      "num_input_tokens_seen": 21647863424,
      "step": 27515
    },
    {
      "epoch": 2.9191597708465946,
      "grad_norm": 0.44844576886075044,
      "learning_rate": 4.308464348432659e-05,
      "loss": 1.582,
      "num_input_tokens_seen": 21648650112,
      "step": 27516
    },
    {
      "epoch": 2.919265860386166,
      "grad_norm": 0.39872804106258747,
      "learning_rate": 4.3084163640208754e-05,
      "loss": 1.6093,
      "num_input_tokens_seen": 21649436912,
      "step": 27517
    },
    {
      "epoch": 2.919371949925737,
      "grad_norm": 0.4379610493746989,
      "learning_rate": 4.3083683782116e-05,
      "loss": 1.5752,
      "num_input_tokens_seen": 21650223648,
      "step": 27518
    },
    {
      "epoch": 2.9194780394653086,
      "grad_norm": 0.38670344146499985,
      "learning_rate": 4.308320391004871e-05,
      "loss": 1.5659,
      "num_input_tokens_seen": 21651010432,
      "step": 27519
    },
    {
      "epoch": 2.91958412900488,
      "grad_norm": 0.39971473800006235,
      "learning_rate": 4.308272402400725e-05,
      "loss": 1.575,
      "num_input_tokens_seen": 21651797184,
      "step": 27520
    },
    {
      "epoch": 2.9196902185444515,
      "grad_norm": 0.4477053497961182,
      "learning_rate": 4.3082244123991996e-05,
      "loss": 1.5963,
      "num_input_tokens_seen": 21652583920,
      "step": 27521
    },
    {
      "epoch": 2.919796308084023,
      "grad_norm": 0.3654947411918621,
      "learning_rate": 4.3081764210003306e-05,
      "loss": 1.5407,
      "num_input_tokens_seen": 21653370656,
      "step": 27522
    },
    {
      "epoch": 2.919902397623594,
      "grad_norm": 0.40903984951609806,
      "learning_rate": 4.308128428204156e-05,
      "loss": 1.5881,
      "num_input_tokens_seen": 21654157296,
      "step": 27523
    },
    {
      "epoch": 2.920008487163166,
      "grad_norm": 0.4185760916422052,
      "learning_rate": 4.3080804340107134e-05,
      "loss": 1.5456,
      "num_input_tokens_seen": 21654944080,
      "step": 27524
    },
    {
      "epoch": 2.920114576702737,
      "grad_norm": 0.44682297836030854,
      "learning_rate": 4.308032438420039e-05,
      "loss": 1.6749,
      "num_input_tokens_seen": 21655730880,
      "step": 27525
    },
    {
      "epoch": 2.9202206662423085,
      "grad_norm": 0.40588022977730454,
      "learning_rate": 4.30798444143217e-05,
      "loss": 1.5955,
      "num_input_tokens_seen": 21656517680,
      "step": 27526
    },
    {
      "epoch": 2.92032675578188,
      "grad_norm": 0.4351907243777164,
      "learning_rate": 4.3079364430471435e-05,
      "loss": 1.5312,
      "num_input_tokens_seen": 21657304432,
      "step": 27527
    },
    {
      "epoch": 2.9204328453214514,
      "grad_norm": 0.42245105960250084,
      "learning_rate": 4.307888443264998e-05,
      "loss": 1.6773,
      "num_input_tokens_seen": 21658091152,
      "step": 27528
    },
    {
      "epoch": 2.920538934861023,
      "grad_norm": 0.4157924551626529,
      "learning_rate": 4.307840442085768e-05,
      "loss": 1.5606,
      "num_input_tokens_seen": 21658877936,
      "step": 27529
    },
    {
      "epoch": 2.920645024400594,
      "grad_norm": 0.39521037283655547,
      "learning_rate": 4.307792439509492e-05,
      "loss": 1.5734,
      "num_input_tokens_seen": 21659664608,
      "step": 27530
    },
    {
      "epoch": 2.9207511139401654,
      "grad_norm": 0.4355130195328107,
      "learning_rate": 4.307744435536207e-05,
      "loss": 1.6339,
      "num_input_tokens_seen": 21660451392,
      "step": 27531
    },
    {
      "epoch": 2.920857203479737,
      "grad_norm": 0.41574838711587103,
      "learning_rate": 4.3076964301659504e-05,
      "loss": 1.5563,
      "num_input_tokens_seen": 21661238144,
      "step": 27532
    },
    {
      "epoch": 2.9209632930193083,
      "grad_norm": 0.3562347073411452,
      "learning_rate": 4.3076484233987596e-05,
      "loss": 1.6072,
      "num_input_tokens_seen": 21662024896,
      "step": 27533
    },
    {
      "epoch": 2.92106938255888,
      "grad_norm": 0.3634677462671911,
      "learning_rate": 4.3076004152346705e-05,
      "loss": 1.5353,
      "num_input_tokens_seen": 21662811728,
      "step": 27534
    },
    {
      "epoch": 2.921175472098451,
      "grad_norm": 0.4507696780326754,
      "learning_rate": 4.307552405673722e-05,
      "loss": 1.5994,
      "num_input_tokens_seen": 21663598448,
      "step": 27535
    },
    {
      "epoch": 2.9212815616380223,
      "grad_norm": 0.48066147015256916,
      "learning_rate": 4.307504394715948e-05,
      "loss": 1.5988,
      "num_input_tokens_seen": 21664385136,
      "step": 27536
    },
    {
      "epoch": 2.921387651177594,
      "grad_norm": 0.41366601494446986,
      "learning_rate": 4.307456382361389e-05,
      "loss": 1.5275,
      "num_input_tokens_seen": 21665171888,
      "step": 27537
    },
    {
      "epoch": 2.9214937407171653,
      "grad_norm": 0.37542875526880226,
      "learning_rate": 4.307408368610081e-05,
      "loss": 1.5422,
      "num_input_tokens_seen": 21665958672,
      "step": 27538
    },
    {
      "epoch": 2.9215998302567368,
      "grad_norm": 0.3924512666750911,
      "learning_rate": 4.30736035346206e-05,
      "loss": 1.6041,
      "num_input_tokens_seen": 21666745392,
      "step": 27539
    },
    {
      "epoch": 2.9217059197963082,
      "grad_norm": 0.4263743570083326,
      "learning_rate": 4.307312336917364e-05,
      "loss": 1.4773,
      "num_input_tokens_seen": 21667532256,
      "step": 27540
    },
    {
      "epoch": 2.9218120093358797,
      "grad_norm": 0.3602041528998629,
      "learning_rate": 4.3072643189760306e-05,
      "loss": 1.582,
      "num_input_tokens_seen": 21668319008,
      "step": 27541
    },
    {
      "epoch": 2.9219180988754507,
      "grad_norm": 0.3761827288990319,
      "learning_rate": 4.307216299638096e-05,
      "loss": 1.5419,
      "num_input_tokens_seen": 21669105760,
      "step": 27542
    },
    {
      "epoch": 2.922024188415022,
      "grad_norm": 0.3696561315352152,
      "learning_rate": 4.307168278903598e-05,
      "loss": 1.544,
      "num_input_tokens_seen": 21669892528,
      "step": 27543
    },
    {
      "epoch": 2.9221302779545937,
      "grad_norm": 0.39483667383264964,
      "learning_rate": 4.307120256772573e-05,
      "loss": 1.6179,
      "num_input_tokens_seen": 21670679248,
      "step": 27544
    },
    {
      "epoch": 2.922236367494165,
      "grad_norm": 0.37242946990365805,
      "learning_rate": 4.307072233245059e-05,
      "loss": 1.7261,
      "num_input_tokens_seen": 21671465936,
      "step": 27545
    },
    {
      "epoch": 2.9223424570337366,
      "grad_norm": 0.38018440431918743,
      "learning_rate": 4.307024208321092e-05,
      "loss": 1.5671,
      "num_input_tokens_seen": 21672252784,
      "step": 27546
    },
    {
      "epoch": 2.9224485465733077,
      "grad_norm": 0.400703632512902,
      "learning_rate": 4.30697618200071e-05,
      "loss": 1.6311,
      "num_input_tokens_seen": 21673039520,
      "step": 27547
    },
    {
      "epoch": 2.922554636112879,
      "grad_norm": 0.3408826622994259,
      "learning_rate": 4.3069281542839495e-05,
      "loss": 1.4744,
      "num_input_tokens_seen": 21673826352,
      "step": 27548
    },
    {
      "epoch": 2.9226607256524506,
      "grad_norm": 0.386605202463081,
      "learning_rate": 4.306880125170848e-05,
      "loss": 1.5206,
      "num_input_tokens_seen": 21674613056,
      "step": 27549
    },
    {
      "epoch": 2.922766815192022,
      "grad_norm": 0.356091834696093,
      "learning_rate": 4.306832094661443e-05,
      "loss": 1.561,
      "num_input_tokens_seen": 21675399840,
      "step": 27550
    },
    {
      "epoch": 2.9228729047315936,
      "grad_norm": 0.4510030967690133,
      "learning_rate": 4.306784062755771e-05,
      "loss": 1.6087,
      "num_input_tokens_seen": 21676186592,
      "step": 27551
    },
    {
      "epoch": 2.9229789942711646,
      "grad_norm": 0.32649363506786194,
      "learning_rate": 4.3067360294538697e-05,
      "loss": 1.5903,
      "num_input_tokens_seen": 21676973392,
      "step": 27552
    },
    {
      "epoch": 2.9230850838107365,
      "grad_norm": 0.4871737162682375,
      "learning_rate": 4.306687994755775e-05,
      "loss": 1.5794,
      "num_input_tokens_seen": 21677760192,
      "step": 27553
    },
    {
      "epoch": 2.9231911733503075,
      "grad_norm": 0.3664730948814938,
      "learning_rate": 4.3066399586615245e-05,
      "loss": 1.512,
      "num_input_tokens_seen": 21678546960,
      "step": 27554
    },
    {
      "epoch": 2.923297262889879,
      "grad_norm": 0.48041050989030515,
      "learning_rate": 4.306591921171157e-05,
      "loss": 1.5152,
      "num_input_tokens_seen": 21679333824,
      "step": 27555
    },
    {
      "epoch": 2.9234033524294505,
      "grad_norm": 0.45388079891073047,
      "learning_rate": 4.3065438822847073e-05,
      "loss": 1.554,
      "num_input_tokens_seen": 21680120576,
      "step": 27556
    },
    {
      "epoch": 2.923509441969022,
      "grad_norm": 0.49528351634515555,
      "learning_rate": 4.306495842002214e-05,
      "loss": 1.5168,
      "num_input_tokens_seen": 21680907408,
      "step": 27557
    },
    {
      "epoch": 2.9236155315085934,
      "grad_norm": 0.5291751446838933,
      "learning_rate": 4.306447800323713e-05,
      "loss": 1.5388,
      "num_input_tokens_seen": 21681694144,
      "step": 27558
    },
    {
      "epoch": 2.9237216210481645,
      "grad_norm": 0.4211365443921044,
      "learning_rate": 4.306399757249243e-05,
      "loss": 1.6019,
      "num_input_tokens_seen": 21682480944,
      "step": 27559
    },
    {
      "epoch": 2.923827710587736,
      "grad_norm": 0.5191996219838039,
      "learning_rate": 4.3063517127788397e-05,
      "loss": 1.4992,
      "num_input_tokens_seen": 21683267664,
      "step": 27560
    },
    {
      "epoch": 2.9239338001273074,
      "grad_norm": 0.41218268272572345,
      "learning_rate": 4.306303666912541e-05,
      "loss": 1.7191,
      "num_input_tokens_seen": 21684054352,
      "step": 27561
    },
    {
      "epoch": 2.924039889666879,
      "grad_norm": 0.43805606980059136,
      "learning_rate": 4.306255619650384e-05,
      "loss": 1.6359,
      "num_input_tokens_seen": 21684841152,
      "step": 27562
    },
    {
      "epoch": 2.9241459792064504,
      "grad_norm": 0.379335039321782,
      "learning_rate": 4.306207570992406e-05,
      "loss": 1.5238,
      "num_input_tokens_seen": 21685627920,
      "step": 27563
    },
    {
      "epoch": 2.9242520687460214,
      "grad_norm": 0.3993210561330935,
      "learning_rate": 4.306159520938643e-05,
      "loss": 1.6421,
      "num_input_tokens_seen": 21686414672,
      "step": 27564
    },
    {
      "epoch": 2.9243581582855933,
      "grad_norm": 0.407894777430185,
      "learning_rate": 4.306111469489133e-05,
      "loss": 1.5015,
      "num_input_tokens_seen": 21687201424,
      "step": 27565
    },
    {
      "epoch": 2.9244642478251643,
      "grad_norm": 0.38660111837880956,
      "learning_rate": 4.306063416643913e-05,
      "loss": 1.5745,
      "num_input_tokens_seen": 21687988240,
      "step": 27566
    },
    {
      "epoch": 2.924570337364736,
      "grad_norm": 0.3995612405718346,
      "learning_rate": 4.306015362403021e-05,
      "loss": 1.646,
      "num_input_tokens_seen": 21688774976,
      "step": 27567
    },
    {
      "epoch": 2.9246764269043073,
      "grad_norm": 0.36405604149545706,
      "learning_rate": 4.3059673067664925e-05,
      "loss": 1.6414,
      "num_input_tokens_seen": 21689561744,
      "step": 27568
    },
    {
      "epoch": 2.9247825164438788,
      "grad_norm": 0.3469611577030515,
      "learning_rate": 4.3059192497343656e-05,
      "loss": 1.5122,
      "num_input_tokens_seen": 21690348560,
      "step": 27569
    },
    {
      "epoch": 2.9248886059834502,
      "grad_norm": 0.5355128254985939,
      "learning_rate": 4.3058711913066774e-05,
      "loss": 1.6,
      "num_input_tokens_seen": 21691135312,
      "step": 27570
    },
    {
      "epoch": 2.9249946955230213,
      "grad_norm": 0.44218405207665823,
      "learning_rate": 4.305823131483465e-05,
      "loss": 1.6535,
      "num_input_tokens_seen": 21691922112,
      "step": 27571
    },
    {
      "epoch": 2.9251007850625927,
      "grad_norm": 0.3961241390685555,
      "learning_rate": 4.305775070264765e-05,
      "loss": 1.529,
      "num_input_tokens_seen": 21692708960,
      "step": 27572
    },
    {
      "epoch": 2.925206874602164,
      "grad_norm": 0.3803896191647976,
      "learning_rate": 4.3057270076506154e-05,
      "loss": 1.5642,
      "num_input_tokens_seen": 21693495712,
      "step": 27573
    },
    {
      "epoch": 2.9253129641417357,
      "grad_norm": 0.4704585174472906,
      "learning_rate": 4.305678943641054e-05,
      "loss": 1.6365,
      "num_input_tokens_seen": 21694282432,
      "step": 27574
    },
    {
      "epoch": 2.925419053681307,
      "grad_norm": 0.44039855088892677,
      "learning_rate": 4.305630878236115e-05,
      "loss": 1.6352,
      "num_input_tokens_seen": 21695069088,
      "step": 27575
    },
    {
      "epoch": 2.925525143220878,
      "grad_norm": 0.44093442296343704,
      "learning_rate": 4.3055828114358384e-05,
      "loss": 1.4721,
      "num_input_tokens_seen": 21695855856,
      "step": 27576
    },
    {
      "epoch": 2.9256312327604497,
      "grad_norm": 0.47833293577874064,
      "learning_rate": 4.3055347432402604e-05,
      "loss": 1.5465,
      "num_input_tokens_seen": 21696642672,
      "step": 27577
    },
    {
      "epoch": 2.925737322300021,
      "grad_norm": 0.44172674244641796,
      "learning_rate": 4.305486673649418e-05,
      "loss": 1.6182,
      "num_input_tokens_seen": 21697429536,
      "step": 27578
    },
    {
      "epoch": 2.9258434118395926,
      "grad_norm": 0.6339792154354382,
      "learning_rate": 4.305438602663349e-05,
      "loss": 1.687,
      "num_input_tokens_seen": 21698216352,
      "step": 27579
    },
    {
      "epoch": 2.925949501379164,
      "grad_norm": 0.416244064407513,
      "learning_rate": 4.305390530282089e-05,
      "loss": 1.585,
      "num_input_tokens_seen": 21699003184,
      "step": 27580
    },
    {
      "epoch": 2.9260555909187356,
      "grad_norm": 0.6728992146047716,
      "learning_rate": 4.3053424565056766e-05,
      "loss": 1.6054,
      "num_input_tokens_seen": 21699789968,
      "step": 27581
    },
    {
      "epoch": 2.926161680458307,
      "grad_norm": 0.33145251231391865,
      "learning_rate": 4.305294381334149e-05,
      "loss": 1.4871,
      "num_input_tokens_seen": 21700576784,
      "step": 27582
    },
    {
      "epoch": 2.926267769997878,
      "grad_norm": 0.42908933950393097,
      "learning_rate": 4.305246304767542e-05,
      "loss": 1.5176,
      "num_input_tokens_seen": 21701363584,
      "step": 27583
    },
    {
      "epoch": 2.9263738595374496,
      "grad_norm": 0.40129787121732396,
      "learning_rate": 4.305198226805894e-05,
      "loss": 1.4422,
      "num_input_tokens_seen": 21702150400,
      "step": 27584
    },
    {
      "epoch": 2.926479949077021,
      "grad_norm": 0.4205335368180463,
      "learning_rate": 4.3051501474492416e-05,
      "loss": 1.5375,
      "num_input_tokens_seen": 21702937184,
      "step": 27585
    },
    {
      "epoch": 2.9265860386165925,
      "grad_norm": 0.4051740415977121,
      "learning_rate": 4.3051020666976226e-05,
      "loss": 1.591,
      "num_input_tokens_seen": 21703723872,
      "step": 27586
    },
    {
      "epoch": 2.926692128156164,
      "grad_norm": 0.7210654114032248,
      "learning_rate": 4.305053984551074e-05,
      "loss": 1.4939,
      "num_input_tokens_seen": 21704510544,
      "step": 27587
    },
    {
      "epoch": 2.926798217695735,
      "grad_norm": 0.45953435843951096,
      "learning_rate": 4.305005901009632e-05,
      "loss": 1.5129,
      "num_input_tokens_seen": 21705297264,
      "step": 27588
    },
    {
      "epoch": 2.9269043072353065,
      "grad_norm": 0.5183851167616916,
      "learning_rate": 4.3049578160733347e-05,
      "loss": 1.5514,
      "num_input_tokens_seen": 21706084112,
      "step": 27589
    },
    {
      "epoch": 2.927010396774878,
      "grad_norm": 0.41577777270243577,
      "learning_rate": 4.304909729742219e-05,
      "loss": 1.5672,
      "num_input_tokens_seen": 21706870864,
      "step": 27590
    },
    {
      "epoch": 2.9271164863144494,
      "grad_norm": 0.6352355892658271,
      "learning_rate": 4.304861642016321e-05,
      "loss": 1.6095,
      "num_input_tokens_seen": 21707657648,
      "step": 27591
    },
    {
      "epoch": 2.927222575854021,
      "grad_norm": 0.852761107127146,
      "learning_rate": 4.30481355289568e-05,
      "loss": 1.5245,
      "num_input_tokens_seen": 21708444432,
      "step": 27592
    },
    {
      "epoch": 2.927328665393592,
      "grad_norm": 0.506074201269415,
      "learning_rate": 4.304765462380332e-05,
      "loss": 1.7327,
      "num_input_tokens_seen": 21709231280,
      "step": 27593
    },
    {
      "epoch": 2.927434754933164,
      "grad_norm": 0.6148882765647361,
      "learning_rate": 4.304717370470314e-05,
      "loss": 1.5963,
      "num_input_tokens_seen": 21710018048,
      "step": 27594
    },
    {
      "epoch": 2.927540844472735,
      "grad_norm": 0.6029496067857912,
      "learning_rate": 4.3046692771656624e-05,
      "loss": 1.4953,
      "num_input_tokens_seen": 21710804816,
      "step": 27595
    },
    {
      "epoch": 2.9276469340123064,
      "grad_norm": 0.528451904593865,
      "learning_rate": 4.3046211824664174e-05,
      "loss": 1.6267,
      "num_input_tokens_seen": 21711591648,
      "step": 27596
    },
    {
      "epoch": 2.927753023551878,
      "grad_norm": 0.56471154789919,
      "learning_rate": 4.3045730863726126e-05,
      "loss": 1.5319,
      "num_input_tokens_seen": 21712378400,
      "step": 27597
    },
    {
      "epoch": 2.9278591130914493,
      "grad_norm": 0.555554646274268,
      "learning_rate": 4.304524988884287e-05,
      "loss": 1.5493,
      "num_input_tokens_seen": 21713165120,
      "step": 27598
    },
    {
      "epoch": 2.927965202631021,
      "grad_norm": 0.6154518064334059,
      "learning_rate": 4.3044768900014774e-05,
      "loss": 1.4769,
      "num_input_tokens_seen": 21713951920,
      "step": 27599
    },
    {
      "epoch": 2.928071292170592,
      "grad_norm": 0.5130010717294698,
      "learning_rate": 4.304428789724221e-05,
      "loss": 1.6619,
      "num_input_tokens_seen": 21714738624,
      "step": 27600
    },
    {
      "epoch": 2.9281773817101633,
      "grad_norm": 0.5598230352764345,
      "learning_rate": 4.304380688052555e-05,
      "loss": 1.586,
      "num_input_tokens_seen": 21715525312,
      "step": 27601
    },
    {
      "epoch": 2.9282834712497348,
      "grad_norm": 0.4007188013707843,
      "learning_rate": 4.304332584986517e-05,
      "loss": 1.5791,
      "num_input_tokens_seen": 21716312144,
      "step": 27602
    },
    {
      "epoch": 2.9283895607893062,
      "grad_norm": 0.4133835302799463,
      "learning_rate": 4.304284480526143e-05,
      "loss": 1.5925,
      "num_input_tokens_seen": 21717098912,
      "step": 27603
    },
    {
      "epoch": 2.9284956503288777,
      "grad_norm": 0.4320713911583817,
      "learning_rate": 4.3042363746714714e-05,
      "loss": 1.5453,
      "num_input_tokens_seen": 21717885648,
      "step": 27604
    },
    {
      "epoch": 2.9286017398684487,
      "grad_norm": 0.4245299760106677,
      "learning_rate": 4.304188267422539e-05,
      "loss": 1.6002,
      "num_input_tokens_seen": 21718672336,
      "step": 27605
    },
    {
      "epoch": 2.92870782940802,
      "grad_norm": 0.4004784083466106,
      "learning_rate": 4.304140158779382e-05,
      "loss": 1.5357,
      "num_input_tokens_seen": 21719459136,
      "step": 27606
    },
    {
      "epoch": 2.9288139189475917,
      "grad_norm": 0.37931794788509254,
      "learning_rate": 4.304092048742039e-05,
      "loss": 1.6171,
      "num_input_tokens_seen": 21720245904,
      "step": 27607
    },
    {
      "epoch": 2.928920008487163,
      "grad_norm": 0.3909453386215686,
      "learning_rate": 4.3040439373105466e-05,
      "loss": 1.5216,
      "num_input_tokens_seen": 21721032704,
      "step": 27608
    },
    {
      "epoch": 2.9290260980267346,
      "grad_norm": 0.41148783768200714,
      "learning_rate": 4.3039958244849415e-05,
      "loss": 1.6183,
      "num_input_tokens_seen": 21721819488,
      "step": 27609
    },
    {
      "epoch": 2.929132187566306,
      "grad_norm": 0.40652554563346655,
      "learning_rate": 4.303947710265262e-05,
      "loss": 1.5481,
      "num_input_tokens_seen": 21722606256,
      "step": 27610
    },
    {
      "epoch": 2.9292382771058776,
      "grad_norm": 0.4091008094888237,
      "learning_rate": 4.303899594651545e-05,
      "loss": 1.5224,
      "num_input_tokens_seen": 21723393056,
      "step": 27611
    },
    {
      "epoch": 2.9293443666454486,
      "grad_norm": 0.3837344477168319,
      "learning_rate": 4.303851477643826e-05,
      "loss": 1.6334,
      "num_input_tokens_seen": 21724179824,
      "step": 27612
    },
    {
      "epoch": 2.92945045618502,
      "grad_norm": 0.3844174348414935,
      "learning_rate": 4.3038033592421444e-05,
      "loss": 1.7045,
      "num_input_tokens_seen": 21724966560,
      "step": 27613
    },
    {
      "epoch": 2.9295565457245916,
      "grad_norm": 0.36413145163582983,
      "learning_rate": 4.303755239446536e-05,
      "loss": 1.5878,
      "num_input_tokens_seen": 21725753280,
      "step": 27614
    },
    {
      "epoch": 2.929662635264163,
      "grad_norm": 0.41219504502401694,
      "learning_rate": 4.303707118257039e-05,
      "loss": 1.6604,
      "num_input_tokens_seen": 21726539984,
      "step": 27615
    },
    {
      "epoch": 2.9297687248037345,
      "grad_norm": 0.3599714710592959,
      "learning_rate": 4.30365899567369e-05,
      "loss": 1.5605,
      "num_input_tokens_seen": 21727326736,
      "step": 27616
    },
    {
      "epoch": 2.9298748143433055,
      "grad_norm": 0.4074141335870216,
      "learning_rate": 4.303610871696526e-05,
      "loss": 1.5047,
      "num_input_tokens_seen": 21728113488,
      "step": 27617
    },
    {
      "epoch": 2.929980903882877,
      "grad_norm": 0.4507322339625336,
      "learning_rate": 4.303562746325584e-05,
      "loss": 1.6783,
      "num_input_tokens_seen": 21728900192,
      "step": 27618
    },
    {
      "epoch": 2.9300869934224485,
      "grad_norm": 0.42340389764522934,
      "learning_rate": 4.3035146195609035e-05,
      "loss": 1.7245,
      "num_input_tokens_seen": 21729686976,
      "step": 27619
    },
    {
      "epoch": 2.93019308296202,
      "grad_norm": 0.38910227979173134,
      "learning_rate": 4.303466491402518e-05,
      "loss": 1.5407,
      "num_input_tokens_seen": 21730473744,
      "step": 27620
    },
    {
      "epoch": 2.9302991725015914,
      "grad_norm": 0.5531483960778397,
      "learning_rate": 4.3034183618504667e-05,
      "loss": 1.5615,
      "num_input_tokens_seen": 21731260512,
      "step": 27621
    },
    {
      "epoch": 2.9304052620411625,
      "grad_norm": 0.41741518345178,
      "learning_rate": 4.303370230904787e-05,
      "loss": 1.5503,
      "num_input_tokens_seen": 21732047344,
      "step": 27622
    },
    {
      "epoch": 2.9305113515807344,
      "grad_norm": 0.5475499366895311,
      "learning_rate": 4.303322098565516e-05,
      "loss": 1.5947,
      "num_input_tokens_seen": 21732834080,
      "step": 27623
    },
    {
      "epoch": 2.9306174411203054,
      "grad_norm": 0.4321037610847198,
      "learning_rate": 4.3032739648326904e-05,
      "loss": 1.5592,
      "num_input_tokens_seen": 21733620768,
      "step": 27624
    },
    {
      "epoch": 2.930723530659877,
      "grad_norm": 0.5775281988024529,
      "learning_rate": 4.303225829706347e-05,
      "loss": 1.6018,
      "num_input_tokens_seen": 21734407552,
      "step": 27625
    },
    {
      "epoch": 2.9308296201994484,
      "grad_norm": 0.44524332101980907,
      "learning_rate": 4.303177693186524e-05,
      "loss": 1.6234,
      "num_input_tokens_seen": 21735194288,
      "step": 27626
    },
    {
      "epoch": 2.93093570973902,
      "grad_norm": 0.41685303439141064,
      "learning_rate": 4.3031295552732585e-05,
      "loss": 1.5866,
      "num_input_tokens_seen": 21735981056,
      "step": 27627
    },
    {
      "epoch": 2.9310417992785913,
      "grad_norm": 0.4846267966020217,
      "learning_rate": 4.3030814159665866e-05,
      "loss": 1.505,
      "num_input_tokens_seen": 21736767936,
      "step": 27628
    },
    {
      "epoch": 2.9311478888181624,
      "grad_norm": 0.4096212030575293,
      "learning_rate": 4.303033275266547e-05,
      "loss": 1.5334,
      "num_input_tokens_seen": 21737554720,
      "step": 27629
    },
    {
      "epoch": 2.931253978357734,
      "grad_norm": 0.48811496170514623,
      "learning_rate": 4.3029851331731765e-05,
      "loss": 1.4855,
      "num_input_tokens_seen": 21738341472,
      "step": 27630
    },
    {
      "epoch": 2.9313600678973053,
      "grad_norm": 0.39312407583496517,
      "learning_rate": 4.3029369896865116e-05,
      "loss": 1.5215,
      "num_input_tokens_seen": 21739128256,
      "step": 27631
    },
    {
      "epoch": 2.9314661574368768,
      "grad_norm": 0.39967562485369934,
      "learning_rate": 4.302888844806589e-05,
      "loss": 1.5638,
      "num_input_tokens_seen": 21739914992,
      "step": 27632
    },
    {
      "epoch": 2.9315722469764482,
      "grad_norm": 0.416820491279532,
      "learning_rate": 4.302840698533448e-05,
      "loss": 1.5761,
      "num_input_tokens_seen": 21740701744,
      "step": 27633
    },
    {
      "epoch": 2.9316783365160193,
      "grad_norm": 0.3849903681779313,
      "learning_rate": 4.302792550867124e-05,
      "loss": 1.5788,
      "num_input_tokens_seen": 21741488480,
      "step": 27634
    },
    {
      "epoch": 2.9317844260555908,
      "grad_norm": 0.40368154445017096,
      "learning_rate": 4.3027444018076545e-05,
      "loss": 1.5757,
      "num_input_tokens_seen": 21742275232,
      "step": 27635
    },
    {
      "epoch": 2.9318905155951622,
      "grad_norm": 0.5054099572176403,
      "learning_rate": 4.302696251355078e-05,
      "loss": 1.576,
      "num_input_tokens_seen": 21743062096,
      "step": 27636
    },
    {
      "epoch": 2.9319966051347337,
      "grad_norm": 0.40080425321960406,
      "learning_rate": 4.30264809950943e-05,
      "loss": 1.5982,
      "num_input_tokens_seen": 21743848816,
      "step": 27637
    },
    {
      "epoch": 2.932102694674305,
      "grad_norm": 0.42982133405192813,
      "learning_rate": 4.302599946270749e-05,
      "loss": 1.5805,
      "num_input_tokens_seen": 21744635664,
      "step": 27638
    },
    {
      "epoch": 2.9322087842138767,
      "grad_norm": 0.37863053286201354,
      "learning_rate": 4.302551791639071e-05,
      "loss": 1.5395,
      "num_input_tokens_seen": 21745422448,
      "step": 27639
    },
    {
      "epoch": 2.932314873753448,
      "grad_norm": 0.4030990034349565,
      "learning_rate": 4.302503635614434e-05,
      "loss": 1.613,
      "num_input_tokens_seen": 21746209232,
      "step": 27640
    },
    {
      "epoch": 2.932420963293019,
      "grad_norm": 0.36774005089426154,
      "learning_rate": 4.302455478196875e-05,
      "loss": 1.5394,
      "num_input_tokens_seen": 21746996032,
      "step": 27641
    },
    {
      "epoch": 2.9325270528325906,
      "grad_norm": 0.39030751691168203,
      "learning_rate": 4.302407319386432e-05,
      "loss": 1.6008,
      "num_input_tokens_seen": 21747782752,
      "step": 27642
    },
    {
      "epoch": 2.932633142372162,
      "grad_norm": 0.3268872426636912,
      "learning_rate": 4.3023591591831415e-05,
      "loss": 1.5119,
      "num_input_tokens_seen": 21748569472,
      "step": 27643
    },
    {
      "epoch": 2.9327392319117336,
      "grad_norm": 0.3350707609853339,
      "learning_rate": 4.30231099758704e-05,
      "loss": 1.5096,
      "num_input_tokens_seen": 21749356224,
      "step": 27644
    },
    {
      "epoch": 2.932845321451305,
      "grad_norm": 0.43404905589064985,
      "learning_rate": 4.302262834598165e-05,
      "loss": 1.6062,
      "num_input_tokens_seen": 21750142960,
      "step": 27645
    },
    {
      "epoch": 2.932951410990876,
      "grad_norm": 0.36336592199221474,
      "learning_rate": 4.3022146702165555e-05,
      "loss": 1.5178,
      "num_input_tokens_seen": 21750929760,
      "step": 27646
    },
    {
      "epoch": 2.9330575005304476,
      "grad_norm": 0.4222954968237631,
      "learning_rate": 4.3021665044422466e-05,
      "loss": 1.4806,
      "num_input_tokens_seen": 21751716480,
      "step": 27647
    },
    {
      "epoch": 2.933163590070019,
      "grad_norm": 0.4756924486115046,
      "learning_rate": 4.3021183372752774e-05,
      "loss": 1.5866,
      "num_input_tokens_seen": 21752503328,
      "step": 27648
    },
    {
      "epoch": 2.9332696796095905,
      "grad_norm": 0.4543440666800773,
      "learning_rate": 4.302070168715683e-05,
      "loss": 1.7036,
      "num_input_tokens_seen": 21753290048,
      "step": 27649
    },
    {
      "epoch": 2.933375769149162,
      "grad_norm": 0.5226514071134689,
      "learning_rate": 4.302021998763501e-05,
      "loss": 1.5876,
      "num_input_tokens_seen": 21754076768,
      "step": 27650
    },
    {
      "epoch": 2.9334818586887335,
      "grad_norm": 0.4080026215495547,
      "learning_rate": 4.3019738274187704e-05,
      "loss": 1.5825,
      "num_input_tokens_seen": 21754863600,
      "step": 27651
    },
    {
      "epoch": 2.933587948228305,
      "grad_norm": 0.3617563296602535,
      "learning_rate": 4.301925654681527e-05,
      "loss": 1.598,
      "num_input_tokens_seen": 21755650352,
      "step": 27652
    },
    {
      "epoch": 2.933694037767876,
      "grad_norm": 0.47041116704905306,
      "learning_rate": 4.301877480551808e-05,
      "loss": 1.6115,
      "num_input_tokens_seen": 21756437136,
      "step": 27653
    },
    {
      "epoch": 2.9338001273074474,
      "grad_norm": 0.38846211013483284,
      "learning_rate": 4.301829305029651e-05,
      "loss": 1.4885,
      "num_input_tokens_seen": 21757223920,
      "step": 27654
    },
    {
      "epoch": 2.933906216847019,
      "grad_norm": 0.4601599239816527,
      "learning_rate": 4.3017811281150933e-05,
      "loss": 1.5714,
      "num_input_tokens_seen": 21758010704,
      "step": 27655
    },
    {
      "epoch": 2.9340123063865904,
      "grad_norm": 0.40081407581740086,
      "learning_rate": 4.3017329498081724e-05,
      "loss": 1.5909,
      "num_input_tokens_seen": 21758797584,
      "step": 27656
    },
    {
      "epoch": 2.934118395926162,
      "grad_norm": 0.42530048018384853,
      "learning_rate": 4.3016847701089245e-05,
      "loss": 1.5418,
      "num_input_tokens_seen": 21759584304,
      "step": 27657
    },
    {
      "epoch": 2.934224485465733,
      "grad_norm": 0.41728254074149046,
      "learning_rate": 4.301636589017388e-05,
      "loss": 1.5962,
      "num_input_tokens_seen": 21760371024,
      "step": 27658
    },
    {
      "epoch": 2.9343305750053044,
      "grad_norm": 0.42286090086950046,
      "learning_rate": 4.3015884065336e-05,
      "loss": 1.5237,
      "num_input_tokens_seen": 21761157824,
      "step": 27659
    },
    {
      "epoch": 2.934436664544876,
      "grad_norm": 0.3512016918407416,
      "learning_rate": 4.301540222657596e-05,
      "loss": 1.6147,
      "num_input_tokens_seen": 21761944528,
      "step": 27660
    },
    {
      "epoch": 2.9345427540844473,
      "grad_norm": 0.36607893152843307,
      "learning_rate": 4.3014920373894155e-05,
      "loss": 1.5418,
      "num_input_tokens_seen": 21762731296,
      "step": 27661
    },
    {
      "epoch": 2.934648843624019,
      "grad_norm": 0.3776363587812774,
      "learning_rate": 4.301443850729095e-05,
      "loss": 1.4858,
      "num_input_tokens_seen": 21763518048,
      "step": 27662
    },
    {
      "epoch": 2.93475493316359,
      "grad_norm": 0.4408028564910806,
      "learning_rate": 4.301395662676671e-05,
      "loss": 1.6686,
      "num_input_tokens_seen": 21764304720,
      "step": 27663
    },
    {
      "epoch": 2.9348610227031617,
      "grad_norm": 0.38873692141074057,
      "learning_rate": 4.301347473232181e-05,
      "loss": 1.5841,
      "num_input_tokens_seen": 21765091408,
      "step": 27664
    },
    {
      "epoch": 2.9349671122427328,
      "grad_norm": 0.37479295157978615,
      "learning_rate": 4.3012992823956634e-05,
      "loss": 1.5316,
      "num_input_tokens_seen": 21765878160,
      "step": 27665
    },
    {
      "epoch": 2.9350732017823042,
      "grad_norm": 0.39191593218535836,
      "learning_rate": 4.301251090167154e-05,
      "loss": 1.4731,
      "num_input_tokens_seen": 21766664944,
      "step": 27666
    },
    {
      "epoch": 2.9351792913218757,
      "grad_norm": 0.35768014427770706,
      "learning_rate": 4.301202896546691e-05,
      "loss": 1.5445,
      "num_input_tokens_seen": 21767451696,
      "step": 27667
    },
    {
      "epoch": 2.935285380861447,
      "grad_norm": 0.3552188374506022,
      "learning_rate": 4.301154701534311e-05,
      "loss": 1.5596,
      "num_input_tokens_seen": 21768238464,
      "step": 27668
    },
    {
      "epoch": 2.9353914704010187,
      "grad_norm": 0.3540120825841626,
      "learning_rate": 4.301106505130051e-05,
      "loss": 1.5575,
      "num_input_tokens_seen": 21769025248,
      "step": 27669
    },
    {
      "epoch": 2.9354975599405897,
      "grad_norm": 0.3792514435893614,
      "learning_rate": 4.3010583073339505e-05,
      "loss": 1.5317,
      "num_input_tokens_seen": 21769812032,
      "step": 27670
    },
    {
      "epoch": 2.935603649480161,
      "grad_norm": 0.393366968726708,
      "learning_rate": 4.301010108146044e-05,
      "loss": 1.6604,
      "num_input_tokens_seen": 21770598784,
      "step": 27671
    },
    {
      "epoch": 2.9357097390197326,
      "grad_norm": 0.3446880146420511,
      "learning_rate": 4.3009619075663686e-05,
      "loss": 1.4741,
      "num_input_tokens_seen": 21771385632,
      "step": 27672
    },
    {
      "epoch": 2.935815828559304,
      "grad_norm": 0.3800422367845519,
      "learning_rate": 4.300913705594964e-05,
      "loss": 1.5411,
      "num_input_tokens_seen": 21772172352,
      "step": 27673
    },
    {
      "epoch": 2.9359219180988756,
      "grad_norm": 0.4198859925061123,
      "learning_rate": 4.300865502231866e-05,
      "loss": 1.6725,
      "num_input_tokens_seen": 21772959120,
      "step": 27674
    },
    {
      "epoch": 2.9360280076384466,
      "grad_norm": 0.4021237386896201,
      "learning_rate": 4.300817297477111e-05,
      "loss": 1.6739,
      "num_input_tokens_seen": 21773745968,
      "step": 27675
    },
    {
      "epoch": 2.936134097178018,
      "grad_norm": 0.36887001594887897,
      "learning_rate": 4.3007690913307384e-05,
      "loss": 1.5799,
      "num_input_tokens_seen": 21774532640,
      "step": 27676
    },
    {
      "epoch": 2.9362401867175896,
      "grad_norm": 0.3534529062573566,
      "learning_rate": 4.300720883792784e-05,
      "loss": 1.5371,
      "num_input_tokens_seen": 21775319424,
      "step": 27677
    },
    {
      "epoch": 2.936346276257161,
      "grad_norm": 0.3411299705618071,
      "learning_rate": 4.3006726748632846e-05,
      "loss": 1.4781,
      "num_input_tokens_seen": 21776106272,
      "step": 27678
    },
    {
      "epoch": 2.9364523657967325,
      "grad_norm": 0.37926750651565183,
      "learning_rate": 4.300624464542279e-05,
      "loss": 1.5266,
      "num_input_tokens_seen": 21776893024,
      "step": 27679
    },
    {
      "epoch": 2.936558455336304,
      "grad_norm": 0.41430275055219656,
      "learning_rate": 4.300576252829803e-05,
      "loss": 1.5884,
      "num_input_tokens_seen": 21777679760,
      "step": 27680
    },
    {
      "epoch": 2.9366645448758755,
      "grad_norm": 0.3588743283823785,
      "learning_rate": 4.300528039725895e-05,
      "loss": 1.547,
      "num_input_tokens_seen": 21778466624,
      "step": 27681
    },
    {
      "epoch": 2.9367706344154465,
      "grad_norm": 0.3924476200726367,
      "learning_rate": 4.3004798252305914e-05,
      "loss": 1.5389,
      "num_input_tokens_seen": 21779253408,
      "step": 27682
    },
    {
      "epoch": 2.936876723955018,
      "grad_norm": 0.41389561295460187,
      "learning_rate": 4.300431609343931e-05,
      "loss": 1.5626,
      "num_input_tokens_seen": 21780040176,
      "step": 27683
    },
    {
      "epoch": 2.9369828134945895,
      "grad_norm": 0.4444853728030492,
      "learning_rate": 4.3003833920659484e-05,
      "loss": 1.588,
      "num_input_tokens_seen": 21780826928,
      "step": 27684
    },
    {
      "epoch": 2.937088903034161,
      "grad_norm": 0.43587498017860826,
      "learning_rate": 4.300335173396683e-05,
      "loss": 1.6126,
      "num_input_tokens_seen": 21781613792,
      "step": 27685
    },
    {
      "epoch": 2.9371949925737324,
      "grad_norm": 0.38714242098436347,
      "learning_rate": 4.300286953336171e-05,
      "loss": 1.4649,
      "num_input_tokens_seen": 21782400464,
      "step": 27686
    },
    {
      "epoch": 2.9373010821133034,
      "grad_norm": 0.43734143593359814,
      "learning_rate": 4.3002387318844504e-05,
      "loss": 1.5849,
      "num_input_tokens_seen": 21783187152,
      "step": 27687
    },
    {
      "epoch": 2.937407171652875,
      "grad_norm": 0.36996674811437796,
      "learning_rate": 4.300190509041558e-05,
      "loss": 1.4294,
      "num_input_tokens_seen": 21783973952,
      "step": 27688
    },
    {
      "epoch": 2.9375132611924464,
      "grad_norm": 0.4136756575867047,
      "learning_rate": 4.300142284807531e-05,
      "loss": 1.5297,
      "num_input_tokens_seen": 21784760656,
      "step": 27689
    },
    {
      "epoch": 2.937619350732018,
      "grad_norm": 0.35995515716178406,
      "learning_rate": 4.300094059182408e-05,
      "loss": 1.5594,
      "num_input_tokens_seen": 21785547440,
      "step": 27690
    },
    {
      "epoch": 2.9377254402715893,
      "grad_norm": 0.3657473739832077,
      "learning_rate": 4.300045832166224e-05,
      "loss": 1.5102,
      "num_input_tokens_seen": 21786334272,
      "step": 27691
    },
    {
      "epoch": 2.9378315298111604,
      "grad_norm": 0.3357057185918461,
      "learning_rate": 4.299997603759018e-05,
      "loss": 1.5006,
      "num_input_tokens_seen": 21787121088,
      "step": 27692
    },
    {
      "epoch": 2.9379376193507323,
      "grad_norm": 0.3804014258046497,
      "learning_rate": 4.2999493739608266e-05,
      "loss": 1.5614,
      "num_input_tokens_seen": 21787907888,
      "step": 27693
    },
    {
      "epoch": 2.9380437088903033,
      "grad_norm": 0.388287850448847,
      "learning_rate": 4.299901142771686e-05,
      "loss": 1.561,
      "num_input_tokens_seen": 21788694624,
      "step": 27694
    },
    {
      "epoch": 2.938149798429875,
      "grad_norm": 0.4607114400339651,
      "learning_rate": 4.2998529101916364e-05,
      "loss": 1.5906,
      "num_input_tokens_seen": 21789481392,
      "step": 27695
    },
    {
      "epoch": 2.9382558879694463,
      "grad_norm": 0.41591186487321785,
      "learning_rate": 4.299804676220712e-05,
      "loss": 1.6777,
      "num_input_tokens_seen": 21790268048,
      "step": 27696
    },
    {
      "epoch": 2.9383619775090177,
      "grad_norm": 0.4707200819941311,
      "learning_rate": 4.299756440858952e-05,
      "loss": 1.5684,
      "num_input_tokens_seen": 21791054848,
      "step": 27697
    },
    {
      "epoch": 2.938468067048589,
      "grad_norm": 0.5544465886919213,
      "learning_rate": 4.2997082041063926e-05,
      "loss": 1.6339,
      "num_input_tokens_seen": 21791841552,
      "step": 27698
    },
    {
      "epoch": 2.9385741565881602,
      "grad_norm": 0.3925619145011489,
      "learning_rate": 4.2996599659630714e-05,
      "loss": 1.5079,
      "num_input_tokens_seen": 21792628240,
      "step": 27699
    },
    {
      "epoch": 2.9386802461277317,
      "grad_norm": 0.5757817350531619,
      "learning_rate": 4.299611726429026e-05,
      "loss": 1.5943,
      "num_input_tokens_seen": 21793415040,
      "step": 27700
    },
    {
      "epoch": 2.938786335667303,
      "grad_norm": 0.4536098177857426,
      "learning_rate": 4.299563485504293e-05,
      "loss": 1.5706,
      "num_input_tokens_seen": 21794201776,
      "step": 27701
    },
    {
      "epoch": 2.9388924252068747,
      "grad_norm": 0.5048272007360435,
      "learning_rate": 4.299515243188911e-05,
      "loss": 1.6736,
      "num_input_tokens_seen": 21794988592,
      "step": 27702
    },
    {
      "epoch": 2.938998514746446,
      "grad_norm": 0.6543289668461384,
      "learning_rate": 4.2994669994829163e-05,
      "loss": 1.6326,
      "num_input_tokens_seen": 21795775328,
      "step": 27703
    },
    {
      "epoch": 2.939104604286017,
      "grad_norm": 0.38561810082683545,
      "learning_rate": 4.2994187543863464e-05,
      "loss": 1.628,
      "num_input_tokens_seen": 21796562176,
      "step": 27704
    },
    {
      "epoch": 2.9392106938255886,
      "grad_norm": 0.5499577555094715,
      "learning_rate": 4.299370507899238e-05,
      "loss": 1.5152,
      "num_input_tokens_seen": 21797348944,
      "step": 27705
    },
    {
      "epoch": 2.93931678336516,
      "grad_norm": 0.46689301489156637,
      "learning_rate": 4.299322260021629e-05,
      "loss": 1.6935,
      "num_input_tokens_seen": 21798135776,
      "step": 27706
    },
    {
      "epoch": 2.9394228729047316,
      "grad_norm": 0.37601160607138046,
      "learning_rate": 4.2992740107535564e-05,
      "loss": 1.5873,
      "num_input_tokens_seen": 21798922560,
      "step": 27707
    },
    {
      "epoch": 2.939528962444303,
      "grad_norm": 0.8160957072178284,
      "learning_rate": 4.299225760095058e-05,
      "loss": 1.7039,
      "num_input_tokens_seen": 21799709248,
      "step": 27708
    },
    {
      "epoch": 2.9396350519838745,
      "grad_norm": 0.46092969927251926,
      "learning_rate": 4.29917750804617e-05,
      "loss": 1.6019,
      "num_input_tokens_seen": 21800495936,
      "step": 27709
    },
    {
      "epoch": 2.939741141523446,
      "grad_norm": 0.7385437739002108,
      "learning_rate": 4.2991292546069315e-05,
      "loss": 1.6084,
      "num_input_tokens_seen": 21801282560,
      "step": 27710
    },
    {
      "epoch": 2.939847231063017,
      "grad_norm": 0.3879966144872189,
      "learning_rate": 4.299080999777378e-05,
      "loss": 1.5106,
      "num_input_tokens_seen": 21802069424,
      "step": 27711
    },
    {
      "epoch": 2.9399533206025885,
      "grad_norm": 0.578749156631077,
      "learning_rate": 4.299032743557548e-05,
      "loss": 1.594,
      "num_input_tokens_seen": 21802856176,
      "step": 27712
    },
    {
      "epoch": 2.94005941014216,
      "grad_norm": 0.39453969093339214,
      "learning_rate": 4.2989844859474784e-05,
      "loss": 1.5764,
      "num_input_tokens_seen": 21803642912,
      "step": 27713
    },
    {
      "epoch": 2.9401654996817315,
      "grad_norm": 0.3501468098264091,
      "learning_rate": 4.2989362269472055e-05,
      "loss": 1.5475,
      "num_input_tokens_seen": 21804429712,
      "step": 27714
    },
    {
      "epoch": 2.940271589221303,
      "grad_norm": 0.617369927061531,
      "learning_rate": 4.298887966556768e-05,
      "loss": 1.5309,
      "num_input_tokens_seen": 21805216480,
      "step": 27715
    },
    {
      "epoch": 2.940377678760874,
      "grad_norm": 0.4067428150650172,
      "learning_rate": 4.298839704776202e-05,
      "loss": 1.6101,
      "num_input_tokens_seen": 21806003296,
      "step": 27716
    },
    {
      "epoch": 2.9404837683004454,
      "grad_norm": 0.5915683095160352,
      "learning_rate": 4.298791441605546e-05,
      "loss": 1.6467,
      "num_input_tokens_seen": 21806790096,
      "step": 27717
    },
    {
      "epoch": 2.940589857840017,
      "grad_norm": 0.43389217564709676,
      "learning_rate": 4.2987431770448374e-05,
      "loss": 1.735,
      "num_input_tokens_seen": 21807576880,
      "step": 27718
    },
    {
      "epoch": 2.9406959473795884,
      "grad_norm": 0.3628236148469237,
      "learning_rate": 4.298694911094112e-05,
      "loss": 1.5142,
      "num_input_tokens_seen": 21808363744,
      "step": 27719
    },
    {
      "epoch": 2.94080203691916,
      "grad_norm": 0.3972595192378481,
      "learning_rate": 4.2986466437534076e-05,
      "loss": 1.5596,
      "num_input_tokens_seen": 21809150608,
      "step": 27720
    },
    {
      "epoch": 2.940908126458731,
      "grad_norm": 0.4397432178511875,
      "learning_rate": 4.2985983750227623e-05,
      "loss": 1.6377,
      "num_input_tokens_seen": 21809937344,
      "step": 27721
    },
    {
      "epoch": 2.941014215998303,
      "grad_norm": 0.3530539697680026,
      "learning_rate": 4.298550104902213e-05,
      "loss": 1.461,
      "num_input_tokens_seen": 21810724112,
      "step": 27722
    },
    {
      "epoch": 2.941120305537874,
      "grad_norm": 0.6399031093209181,
      "learning_rate": 4.298501833391798e-05,
      "loss": 1.5342,
      "num_input_tokens_seen": 21811510816,
      "step": 27723
    },
    {
      "epoch": 2.9412263950774453,
      "grad_norm": 0.6713671310116966,
      "learning_rate": 4.298453560491552e-05,
      "loss": 1.7459,
      "num_input_tokens_seen": 21812297536,
      "step": 27724
    },
    {
      "epoch": 2.941332484617017,
      "grad_norm": 0.48858993894236313,
      "learning_rate": 4.298405286201515e-05,
      "loss": 1.5863,
      "num_input_tokens_seen": 21813084288,
      "step": 27725
    },
    {
      "epoch": 2.9414385741565883,
      "grad_norm": 0.42937818021256513,
      "learning_rate": 4.298357010521722e-05,
      "loss": 1.6109,
      "num_input_tokens_seen": 21813871056,
      "step": 27726
    },
    {
      "epoch": 2.9415446636961597,
      "grad_norm": 0.5020387556662637,
      "learning_rate": 4.298308733452212e-05,
      "loss": 1.5724,
      "num_input_tokens_seen": 21814657776,
      "step": 27727
    },
    {
      "epoch": 2.9416507532357308,
      "grad_norm": 0.4251190445619987,
      "learning_rate": 4.2982604549930214e-05,
      "loss": 1.5132,
      "num_input_tokens_seen": 21815444512,
      "step": 27728
    },
    {
      "epoch": 2.9417568427753022,
      "grad_norm": 0.6274176074773078,
      "learning_rate": 4.298212175144189e-05,
      "loss": 1.5467,
      "num_input_tokens_seen": 21816231232,
      "step": 27729
    },
    {
      "epoch": 2.9418629323148737,
      "grad_norm": 0.34495324179519044,
      "learning_rate": 4.29816389390575e-05,
      "loss": 1.5732,
      "num_input_tokens_seen": 21817017968,
      "step": 27730
    },
    {
      "epoch": 2.941969021854445,
      "grad_norm": 0.427264065298732,
      "learning_rate": 4.298115611277743e-05,
      "loss": 1.4968,
      "num_input_tokens_seen": 21817804672,
      "step": 27731
    },
    {
      "epoch": 2.9420751113940167,
      "grad_norm": 0.4723669683980986,
      "learning_rate": 4.298067327260205e-05,
      "loss": 1.5262,
      "num_input_tokens_seen": 21818591472,
      "step": 27732
    },
    {
      "epoch": 2.9421812009335877,
      "grad_norm": 0.3859821719495676,
      "learning_rate": 4.298019041853174e-05,
      "loss": 1.6347,
      "num_input_tokens_seen": 21819378192,
      "step": 27733
    },
    {
      "epoch": 2.9422872904731596,
      "grad_norm": 0.5545749208379341,
      "learning_rate": 4.297970755056685e-05,
      "loss": 1.6025,
      "num_input_tokens_seen": 21820164912,
      "step": 27734
    },
    {
      "epoch": 2.9423933800127307,
      "grad_norm": 0.3673689336934674,
      "learning_rate": 4.297922466870779e-05,
      "loss": 1.4774,
      "num_input_tokens_seen": 21820951584,
      "step": 27735
    },
    {
      "epoch": 2.942499469552302,
      "grad_norm": 0.35164496883131374,
      "learning_rate": 4.29787417729549e-05,
      "loss": 1.4623,
      "num_input_tokens_seen": 21821738336,
      "step": 27736
    },
    {
      "epoch": 2.9426055590918736,
      "grad_norm": 0.3956114577259186,
      "learning_rate": 4.297825886330856e-05,
      "loss": 1.6311,
      "num_input_tokens_seen": 21822525040,
      "step": 27737
    },
    {
      "epoch": 2.942711648631445,
      "grad_norm": 0.3839733533892421,
      "learning_rate": 4.297777593976916e-05,
      "loss": 1.7338,
      "num_input_tokens_seen": 21823311792,
      "step": 27738
    },
    {
      "epoch": 2.9428177381710166,
      "grad_norm": 0.49160466537968456,
      "learning_rate": 4.297729300233706e-05,
      "loss": 1.6702,
      "num_input_tokens_seen": 21824098480,
      "step": 27739
    },
    {
      "epoch": 2.9429238277105876,
      "grad_norm": 0.4786236507534412,
      "learning_rate": 4.297681005101264e-05,
      "loss": 1.4974,
      "num_input_tokens_seen": 21824885312,
      "step": 27740
    },
    {
      "epoch": 2.943029917250159,
      "grad_norm": 0.3829990044187692,
      "learning_rate": 4.2976327085796256e-05,
      "loss": 1.6459,
      "num_input_tokens_seen": 21825672048,
      "step": 27741
    },
    {
      "epoch": 2.9431360067897305,
      "grad_norm": 0.5327995588580654,
      "learning_rate": 4.29758441066883e-05,
      "loss": 1.7234,
      "num_input_tokens_seen": 21826458688,
      "step": 27742
    },
    {
      "epoch": 2.943242096329302,
      "grad_norm": 0.3944979946879019,
      "learning_rate": 4.297536111368915e-05,
      "loss": 1.6105,
      "num_input_tokens_seen": 21827245520,
      "step": 27743
    },
    {
      "epoch": 2.9433481858688735,
      "grad_norm": 0.41003711749894467,
      "learning_rate": 4.297487810679915e-05,
      "loss": 1.681,
      "num_input_tokens_seen": 21828032320,
      "step": 27744
    },
    {
      "epoch": 2.9434542754084445,
      "grad_norm": 0.47528591500661804,
      "learning_rate": 4.29743950860187e-05,
      "loss": 1.5644,
      "num_input_tokens_seen": 21828819104,
      "step": 27745
    },
    {
      "epoch": 2.943560364948016,
      "grad_norm": 0.36517094701875674,
      "learning_rate": 4.297391205134817e-05,
      "loss": 1.5547,
      "num_input_tokens_seen": 21829605904,
      "step": 27746
    },
    {
      "epoch": 2.9436664544875875,
      "grad_norm": 0.4157777471505639,
      "learning_rate": 4.297342900278792e-05,
      "loss": 1.548,
      "num_input_tokens_seen": 21830392592,
      "step": 27747
    },
    {
      "epoch": 2.943772544027159,
      "grad_norm": 0.38277904590456363,
      "learning_rate": 4.2972945940338335e-05,
      "loss": 1.5466,
      "num_input_tokens_seen": 21831179360,
      "step": 27748
    },
    {
      "epoch": 2.9438786335667304,
      "grad_norm": 0.39786022481030875,
      "learning_rate": 4.297246286399979e-05,
      "loss": 1.5379,
      "num_input_tokens_seen": 21831966128,
      "step": 27749
    },
    {
      "epoch": 2.943984723106302,
      "grad_norm": 0.36104672559941814,
      "learning_rate": 4.2971979773772645e-05,
      "loss": 1.4843,
      "num_input_tokens_seen": 21832752912,
      "step": 27750
    },
    {
      "epoch": 2.9440908126458734,
      "grad_norm": 0.4200300494618799,
      "learning_rate": 4.2971496669657285e-05,
      "loss": 1.7268,
      "num_input_tokens_seen": 21833539600,
      "step": 27751
    },
    {
      "epoch": 2.9441969021854444,
      "grad_norm": 0.3965442665737858,
      "learning_rate": 4.2971013551654074e-05,
      "loss": 1.5454,
      "num_input_tokens_seen": 21834326352,
      "step": 27752
    },
    {
      "epoch": 2.944302991725016,
      "grad_norm": 0.4596487653250898,
      "learning_rate": 4.29705304197634e-05,
      "loss": 1.6517,
      "num_input_tokens_seen": 21835113072,
      "step": 27753
    },
    {
      "epoch": 2.9444090812645873,
      "grad_norm": 0.39189593337599216,
      "learning_rate": 4.2970047273985626e-05,
      "loss": 1.5506,
      "num_input_tokens_seen": 21835899840,
      "step": 27754
    },
    {
      "epoch": 2.944515170804159,
      "grad_norm": 0.4180560283905871,
      "learning_rate": 4.296956411432112e-05,
      "loss": 1.6579,
      "num_input_tokens_seen": 21836686608,
      "step": 27755
    },
    {
      "epoch": 2.9446212603437303,
      "grad_norm": 0.3624275575387333,
      "learning_rate": 4.296908094077027e-05,
      "loss": 1.4435,
      "num_input_tokens_seen": 21837473408,
      "step": 27756
    },
    {
      "epoch": 2.9447273498833013,
      "grad_norm": 0.38759741625939254,
      "learning_rate": 4.2968597753333437e-05,
      "loss": 1.5549,
      "num_input_tokens_seen": 21838260096,
      "step": 27757
    },
    {
      "epoch": 2.944833439422873,
      "grad_norm": 0.40974510823255705,
      "learning_rate": 4.2968114552011e-05,
      "loss": 1.5355,
      "num_input_tokens_seen": 21839046896,
      "step": 27758
    },
    {
      "epoch": 2.9449395289624443,
      "grad_norm": 0.43151522787214547,
      "learning_rate": 4.296763133680333e-05,
      "loss": 1.5918,
      "num_input_tokens_seen": 21839833568,
      "step": 27759
    },
    {
      "epoch": 2.9450456185020157,
      "grad_norm": 0.37072956219652825,
      "learning_rate": 4.29671481077108e-05,
      "loss": 1.5712,
      "num_input_tokens_seen": 21840620240,
      "step": 27760
    },
    {
      "epoch": 2.945151708041587,
      "grad_norm": 0.37566126620568097,
      "learning_rate": 4.2966664864733786e-05,
      "loss": 1.5949,
      "num_input_tokens_seen": 21841406976,
      "step": 27761
    },
    {
      "epoch": 2.9452577975811582,
      "grad_norm": 0.4686618117898278,
      "learning_rate": 4.296618160787266e-05,
      "loss": 1.5226,
      "num_input_tokens_seen": 21842193808,
      "step": 27762
    },
    {
      "epoch": 2.94536388712073,
      "grad_norm": 0.3723561980015172,
      "learning_rate": 4.29656983371278e-05,
      "loss": 1.5459,
      "num_input_tokens_seen": 21842980640,
      "step": 27763
    },
    {
      "epoch": 2.945469976660301,
      "grad_norm": 0.4039223501301601,
      "learning_rate": 4.296521505249958e-05,
      "loss": 1.6121,
      "num_input_tokens_seen": 21843767408,
      "step": 27764
    },
    {
      "epoch": 2.9455760661998727,
      "grad_norm": 0.4008721293233543,
      "learning_rate": 4.296473175398836e-05,
      "loss": 1.4743,
      "num_input_tokens_seen": 21844554240,
      "step": 27765
    },
    {
      "epoch": 2.945682155739444,
      "grad_norm": 0.36257786494704336,
      "learning_rate": 4.2964248441594524e-05,
      "loss": 1.6161,
      "num_input_tokens_seen": 21845340960,
      "step": 27766
    },
    {
      "epoch": 2.9457882452790156,
      "grad_norm": 0.399275002745755,
      "learning_rate": 4.296376511531844e-05,
      "loss": 1.5958,
      "num_input_tokens_seen": 21846127776,
      "step": 27767
    },
    {
      "epoch": 2.945894334818587,
      "grad_norm": 0.35030438662393343,
      "learning_rate": 4.296328177516049e-05,
      "loss": 1.6294,
      "num_input_tokens_seen": 21846914496,
      "step": 27768
    },
    {
      "epoch": 2.946000424358158,
      "grad_norm": 0.3802139006826669,
      "learning_rate": 4.296279842112105e-05,
      "loss": 1.6002,
      "num_input_tokens_seen": 21847701296,
      "step": 27769
    },
    {
      "epoch": 2.9461065138977296,
      "grad_norm": 0.3922319605768069,
      "learning_rate": 4.2962315053200474e-05,
      "loss": 1.6037,
      "num_input_tokens_seen": 21848488112,
      "step": 27770
    },
    {
      "epoch": 2.946212603437301,
      "grad_norm": 0.3459193062497634,
      "learning_rate": 4.296183167139916e-05,
      "loss": 1.4965,
      "num_input_tokens_seen": 21849274832,
      "step": 27771
    },
    {
      "epoch": 2.9463186929768725,
      "grad_norm": 0.3693824946468618,
      "learning_rate": 4.296134827571746e-05,
      "loss": 1.6319,
      "num_input_tokens_seen": 21850061600,
      "step": 27772
    },
    {
      "epoch": 2.946424782516444,
      "grad_norm": 0.369974279422086,
      "learning_rate": 4.296086486615576e-05,
      "loss": 1.6458,
      "num_input_tokens_seen": 21850848304,
      "step": 27773
    },
    {
      "epoch": 2.946530872056015,
      "grad_norm": 0.364666078206421,
      "learning_rate": 4.296038144271443e-05,
      "loss": 1.6708,
      "num_input_tokens_seen": 21851635040,
      "step": 27774
    },
    {
      "epoch": 2.9466369615955865,
      "grad_norm": 0.38318871520480097,
      "learning_rate": 4.295989800539385e-05,
      "loss": 1.6922,
      "num_input_tokens_seen": 21852421744,
      "step": 27775
    },
    {
      "epoch": 2.946743051135158,
      "grad_norm": 0.33822893053617253,
      "learning_rate": 4.295941455419438e-05,
      "loss": 1.5613,
      "num_input_tokens_seen": 21853208592,
      "step": 27776
    },
    {
      "epoch": 2.9468491406747295,
      "grad_norm": 0.39830462377623005,
      "learning_rate": 4.295893108911641e-05,
      "loss": 1.6035,
      "num_input_tokens_seen": 21853995360,
      "step": 27777
    },
    {
      "epoch": 2.946955230214301,
      "grad_norm": 0.3826752024177325,
      "learning_rate": 4.295844761016029e-05,
      "loss": 1.6599,
      "num_input_tokens_seen": 21854782048,
      "step": 27778
    },
    {
      "epoch": 2.9470613197538724,
      "grad_norm": 0.363415620687285,
      "learning_rate": 4.295796411732642e-05,
      "loss": 1.6162,
      "num_input_tokens_seen": 21855568768,
      "step": 27779
    },
    {
      "epoch": 2.947167409293444,
      "grad_norm": 0.4292432507829308,
      "learning_rate": 4.2957480610615164e-05,
      "loss": 1.6456,
      "num_input_tokens_seen": 21856355568,
      "step": 27780
    },
    {
      "epoch": 2.947273498833015,
      "grad_norm": 0.38351041387540297,
      "learning_rate": 4.2956997090026884e-05,
      "loss": 1.6724,
      "num_input_tokens_seen": 21857142320,
      "step": 27781
    },
    {
      "epoch": 2.9473795883725864,
      "grad_norm": 0.37111293106066895,
      "learning_rate": 4.2956513555561975e-05,
      "loss": 1.6156,
      "num_input_tokens_seen": 21857929040,
      "step": 27782
    },
    {
      "epoch": 2.947485677912158,
      "grad_norm": 0.3693247919490928,
      "learning_rate": 4.2956030007220795e-05,
      "loss": 1.5012,
      "num_input_tokens_seen": 21858715856,
      "step": 27783
    },
    {
      "epoch": 2.9475917674517293,
      "grad_norm": 0.4104895594654398,
      "learning_rate": 4.295554644500371e-05,
      "loss": 1.5023,
      "num_input_tokens_seen": 21859502688,
      "step": 27784
    },
    {
      "epoch": 2.947697856991301,
      "grad_norm": 0.3601403382817962,
      "learning_rate": 4.2955062868911125e-05,
      "loss": 1.5317,
      "num_input_tokens_seen": 21860289472,
      "step": 27785
    },
    {
      "epoch": 2.947803946530872,
      "grad_norm": 0.3712573729869277,
      "learning_rate": 4.2954579278943385e-05,
      "loss": 1.4894,
      "num_input_tokens_seen": 21861076240,
      "step": 27786
    },
    {
      "epoch": 2.9479100360704433,
      "grad_norm": 0.364252350147149,
      "learning_rate": 4.295409567510087e-05,
      "loss": 1.5551,
      "num_input_tokens_seen": 21861862992,
      "step": 27787
    },
    {
      "epoch": 2.948016125610015,
      "grad_norm": 0.35388762225678516,
      "learning_rate": 4.295361205738396e-05,
      "loss": 1.4928,
      "num_input_tokens_seen": 21862649840,
      "step": 27788
    },
    {
      "epoch": 2.9481222151495863,
      "grad_norm": 0.4459336108869238,
      "learning_rate": 4.2953128425793024e-05,
      "loss": 1.5882,
      "num_input_tokens_seen": 21863436704,
      "step": 27789
    },
    {
      "epoch": 2.9482283046891578,
      "grad_norm": 0.4040021195631679,
      "learning_rate": 4.2952644780328445e-05,
      "loss": 1.5061,
      "num_input_tokens_seen": 21864223536,
      "step": 27790
    },
    {
      "epoch": 2.948334394228729,
      "grad_norm": 0.40304418912314066,
      "learning_rate": 4.295216112099058e-05,
      "loss": 1.4123,
      "num_input_tokens_seen": 21865010320,
      "step": 27791
    },
    {
      "epoch": 2.9484404837683007,
      "grad_norm": 0.3788661577252479,
      "learning_rate": 4.2951677447779815e-05,
      "loss": 1.4295,
      "num_input_tokens_seen": 21865797152,
      "step": 27792
    },
    {
      "epoch": 2.9485465733078717,
      "grad_norm": 0.37010929917679336,
      "learning_rate": 4.2951193760696516e-05,
      "loss": 1.5416,
      "num_input_tokens_seen": 21866583888,
      "step": 27793
    },
    {
      "epoch": 2.948652662847443,
      "grad_norm": 0.41245123751865065,
      "learning_rate": 4.295071005974107e-05,
      "loss": 1.6535,
      "num_input_tokens_seen": 21867370624,
      "step": 27794
    },
    {
      "epoch": 2.9487587523870147,
      "grad_norm": 0.39466398523253726,
      "learning_rate": 4.2950226344913834e-05,
      "loss": 1.6953,
      "num_input_tokens_seen": 21868157408,
      "step": 27795
    },
    {
      "epoch": 2.948864841926586,
      "grad_norm": 0.4117904150357466,
      "learning_rate": 4.2949742616215197e-05,
      "loss": 1.636,
      "num_input_tokens_seen": 21868944208,
      "step": 27796
    },
    {
      "epoch": 2.9489709314661576,
      "grad_norm": 0.4147858840672238,
      "learning_rate": 4.2949258873645514e-05,
      "loss": 1.5804,
      "num_input_tokens_seen": 21869730864,
      "step": 27797
    },
    {
      "epoch": 2.9490770210057287,
      "grad_norm": 0.5360301467423499,
      "learning_rate": 4.294877511720518e-05,
      "loss": 1.6344,
      "num_input_tokens_seen": 21870517728,
      "step": 27798
    },
    {
      "epoch": 2.9491831105453,
      "grad_norm": 0.4215084660077665,
      "learning_rate": 4.2948291346894556e-05,
      "loss": 1.5595,
      "num_input_tokens_seen": 21871304480,
      "step": 27799
    },
    {
      "epoch": 2.9492892000848716,
      "grad_norm": 0.45616120256314113,
      "learning_rate": 4.2947807562714014e-05,
      "loss": 1.5144,
      "num_input_tokens_seen": 21872091312,
      "step": 27800
    },
    {
      "epoch": 2.949395289624443,
      "grad_norm": 0.38726134241414384,
      "learning_rate": 4.294732376466394e-05,
      "loss": 1.6237,
      "num_input_tokens_seen": 21872878064,
      "step": 27801
    },
    {
      "epoch": 2.9495013791640146,
      "grad_norm": 0.37053996897232283,
      "learning_rate": 4.29468399527447e-05,
      "loss": 1.5725,
      "num_input_tokens_seen": 21873664848,
      "step": 27802
    },
    {
      "epoch": 2.9496074687035856,
      "grad_norm": 0.3364246007260268,
      "learning_rate": 4.294635612695667e-05,
      "loss": 1.5021,
      "num_input_tokens_seen": 21874451648,
      "step": 27803
    },
    {
      "epoch": 2.949713558243157,
      "grad_norm": 0.36905433033790747,
      "learning_rate": 4.294587228730022e-05,
      "loss": 1.6087,
      "num_input_tokens_seen": 21875238464,
      "step": 27804
    },
    {
      "epoch": 2.9498196477827285,
      "grad_norm": 0.3607734964742946,
      "learning_rate": 4.294538843377572e-05,
      "loss": 1.4834,
      "num_input_tokens_seen": 21876025248,
      "step": 27805
    },
    {
      "epoch": 2.9499257373223,
      "grad_norm": 0.3382289982319465,
      "learning_rate": 4.294490456638356e-05,
      "loss": 1.5813,
      "num_input_tokens_seen": 21876811920,
      "step": 27806
    },
    {
      "epoch": 2.9500318268618715,
      "grad_norm": 0.3809020556961803,
      "learning_rate": 4.294442068512411e-05,
      "loss": 1.6118,
      "num_input_tokens_seen": 21877598736,
      "step": 27807
    },
    {
      "epoch": 2.950137916401443,
      "grad_norm": 0.43320892667222766,
      "learning_rate": 4.294393678999773e-05,
      "loss": 1.5663,
      "num_input_tokens_seen": 21878385600,
      "step": 27808
    },
    {
      "epoch": 2.9502440059410144,
      "grad_norm": 0.4966305402187583,
      "learning_rate": 4.29434528810048e-05,
      "loss": 1.6083,
      "num_input_tokens_seen": 21879172320,
      "step": 27809
    },
    {
      "epoch": 2.9503500954805855,
      "grad_norm": 0.37574904824244215,
      "learning_rate": 4.2942968958145704e-05,
      "loss": 1.5336,
      "num_input_tokens_seen": 21879959264,
      "step": 27810
    },
    {
      "epoch": 2.950456185020157,
      "grad_norm": 0.35863195863508723,
      "learning_rate": 4.2942485021420796e-05,
      "loss": 1.6121,
      "num_input_tokens_seen": 21880746032,
      "step": 27811
    },
    {
      "epoch": 2.9505622745597284,
      "grad_norm": 0.43553161158120207,
      "learning_rate": 4.2942001070830466e-05,
      "loss": 1.5378,
      "num_input_tokens_seen": 21881532736,
      "step": 27812
    },
    {
      "epoch": 2.9506683640993,
      "grad_norm": 0.32687381072255167,
      "learning_rate": 4.294151710637509e-05,
      "loss": 1.5017,
      "num_input_tokens_seen": 21882319616,
      "step": 27813
    },
    {
      "epoch": 2.9507744536388714,
      "grad_norm": 0.42698050600016857,
      "learning_rate": 4.294103312805503e-05,
      "loss": 1.6782,
      "num_input_tokens_seen": 21883106368,
      "step": 27814
    },
    {
      "epoch": 2.9508805431784424,
      "grad_norm": 0.39434926446595225,
      "learning_rate": 4.2940549135870665e-05,
      "loss": 1.5275,
      "num_input_tokens_seen": 21883893056,
      "step": 27815
    },
    {
      "epoch": 2.950986632718014,
      "grad_norm": 0.3957231058051494,
      "learning_rate": 4.2940065129822385e-05,
      "loss": 1.5626,
      "num_input_tokens_seen": 21884679856,
      "step": 27816
    },
    {
      "epoch": 2.9510927222575853,
      "grad_norm": 0.7730075381581651,
      "learning_rate": 4.2939581109910534e-05,
      "loss": 1.5771,
      "num_input_tokens_seen": 21885466592,
      "step": 27817
    },
    {
      "epoch": 2.951198811797157,
      "grad_norm": 0.6267654221135643,
      "learning_rate": 4.2939097076135504e-05,
      "loss": 1.5662,
      "num_input_tokens_seen": 21886253424,
      "step": 27818
    },
    {
      "epoch": 2.9513049013367283,
      "grad_norm": 0.4373647733438387,
      "learning_rate": 4.293861302849766e-05,
      "loss": 1.5172,
      "num_input_tokens_seen": 21887040160,
      "step": 27819
    },
    {
      "epoch": 2.9514109908762993,
      "grad_norm": 0.3711652014776955,
      "learning_rate": 4.2938128966997395e-05,
      "loss": 1.6238,
      "num_input_tokens_seen": 21887826912,
      "step": 27820
    },
    {
      "epoch": 2.9515170804158712,
      "grad_norm": 0.46618774530837975,
      "learning_rate": 4.293764489163506e-05,
      "loss": 1.608,
      "num_input_tokens_seen": 21888613744,
      "step": 27821
    },
    {
      "epoch": 2.9516231699554423,
      "grad_norm": 0.4004951136979877,
      "learning_rate": 4.2937160802411045e-05,
      "loss": 1.6929,
      "num_input_tokens_seen": 21889400480,
      "step": 27822
    },
    {
      "epoch": 2.9517292594950137,
      "grad_norm": 0.34490498398312824,
      "learning_rate": 4.2936676699325715e-05,
      "loss": 1.5026,
      "num_input_tokens_seen": 21890187200,
      "step": 27823
    },
    {
      "epoch": 2.951835349034585,
      "grad_norm": 0.4128876916342588,
      "learning_rate": 4.293619258237945e-05,
      "loss": 1.6584,
      "num_input_tokens_seen": 21890973952,
      "step": 27824
    },
    {
      "epoch": 2.9519414385741567,
      "grad_norm": 0.43372765872164165,
      "learning_rate": 4.293570845157262e-05,
      "loss": 1.6762,
      "num_input_tokens_seen": 21891760736,
      "step": 27825
    },
    {
      "epoch": 2.952047528113728,
      "grad_norm": 0.34046218799060596,
      "learning_rate": 4.293522430690561e-05,
      "loss": 1.5319,
      "num_input_tokens_seen": 21892547568,
      "step": 27826
    },
    {
      "epoch": 2.952153617653299,
      "grad_norm": 0.4195248502618669,
      "learning_rate": 4.293474014837877e-05,
      "loss": 1.6206,
      "num_input_tokens_seen": 21893334320,
      "step": 27827
    },
    {
      "epoch": 2.9522597071928707,
      "grad_norm": 0.38183391845066533,
      "learning_rate": 4.29342559759925e-05,
      "loss": 1.5673,
      "num_input_tokens_seen": 21894121088,
      "step": 27828
    },
    {
      "epoch": 2.952365796732442,
      "grad_norm": 0.44223284744633035,
      "learning_rate": 4.293377178974716e-05,
      "loss": 1.4412,
      "num_input_tokens_seen": 21894907824,
      "step": 27829
    },
    {
      "epoch": 2.9524718862720136,
      "grad_norm": 0.38947543089384656,
      "learning_rate": 4.293328758964312e-05,
      "loss": 1.5682,
      "num_input_tokens_seen": 21895694624,
      "step": 27830
    },
    {
      "epoch": 2.952577975811585,
      "grad_norm": 0.5254075745288966,
      "learning_rate": 4.2932803375680774e-05,
      "loss": 1.3631,
      "num_input_tokens_seen": 21896481376,
      "step": 27831
    },
    {
      "epoch": 2.952684065351156,
      "grad_norm": 0.4093580648476982,
      "learning_rate": 4.293231914786048e-05,
      "loss": 1.5385,
      "num_input_tokens_seen": 21897268176,
      "step": 27832
    },
    {
      "epoch": 2.952790154890728,
      "grad_norm": 0.5513673970750723,
      "learning_rate": 4.2931834906182614e-05,
      "loss": 1.5659,
      "num_input_tokens_seen": 21898054992,
      "step": 27833
    },
    {
      "epoch": 2.952896244430299,
      "grad_norm": 0.7077649835015185,
      "learning_rate": 4.293135065064755e-05,
      "loss": 1.4953,
      "num_input_tokens_seen": 21898841728,
      "step": 27834
    },
    {
      "epoch": 2.9530023339698706,
      "grad_norm": 0.5424024153128284,
      "learning_rate": 4.293086638125566e-05,
      "loss": 1.5543,
      "num_input_tokens_seen": 21899628480,
      "step": 27835
    },
    {
      "epoch": 2.953108423509442,
      "grad_norm": 0.756005647326789,
      "learning_rate": 4.293038209800733e-05,
      "loss": 1.629,
      "num_input_tokens_seen": 21900415232,
      "step": 27836
    },
    {
      "epoch": 2.9532145130490135,
      "grad_norm": 0.5065636164426309,
      "learning_rate": 4.292989780090293e-05,
      "loss": 1.5714,
      "num_input_tokens_seen": 21901202000,
      "step": 27837
    },
    {
      "epoch": 2.953320602588585,
      "grad_norm": 0.5643142948287371,
      "learning_rate": 4.292941348994283e-05,
      "loss": 1.4924,
      "num_input_tokens_seen": 21901988800,
      "step": 27838
    },
    {
      "epoch": 2.953426692128156,
      "grad_norm": 0.713820376823565,
      "learning_rate": 4.2928929165127393e-05,
      "loss": 1.6108,
      "num_input_tokens_seen": 21902775536,
      "step": 27839
    },
    {
      "epoch": 2.9535327816677275,
      "grad_norm": 0.62867392574605,
      "learning_rate": 4.2928444826457014e-05,
      "loss": 1.652,
      "num_input_tokens_seen": 21903562240,
      "step": 27840
    },
    {
      "epoch": 2.953638871207299,
      "grad_norm": 0.3901699776654185,
      "learning_rate": 4.292796047393206e-05,
      "loss": 1.5292,
      "num_input_tokens_seen": 21904348976,
      "step": 27841
    },
    {
      "epoch": 2.9537449607468704,
      "grad_norm": 0.4995447422912617,
      "learning_rate": 4.292747610755291e-05,
      "loss": 1.6748,
      "num_input_tokens_seen": 21905135776,
      "step": 27842
    },
    {
      "epoch": 2.953851050286442,
      "grad_norm": 0.5640005867058158,
      "learning_rate": 4.2926991727319924e-05,
      "loss": 1.6345,
      "num_input_tokens_seen": 21905922560,
      "step": 27843
    },
    {
      "epoch": 2.953957139826013,
      "grad_norm": 0.446599355150269,
      "learning_rate": 4.2926507333233484e-05,
      "loss": 1.4886,
      "num_input_tokens_seen": 21906709392,
      "step": 27844
    },
    {
      "epoch": 2.9540632293655844,
      "grad_norm": 0.6395063748674106,
      "learning_rate": 4.2926022925293976e-05,
      "loss": 1.5566,
      "num_input_tokens_seen": 21907496208,
      "step": 27845
    },
    {
      "epoch": 2.954169318905156,
      "grad_norm": 0.4725960957086478,
      "learning_rate": 4.292553850350175e-05,
      "loss": 1.5811,
      "num_input_tokens_seen": 21908282912,
      "step": 27846
    },
    {
      "epoch": 2.9542754084447274,
      "grad_norm": 0.7192520741724762,
      "learning_rate": 4.292505406785719e-05,
      "loss": 1.595,
      "num_input_tokens_seen": 21909069728,
      "step": 27847
    },
    {
      "epoch": 2.954381497984299,
      "grad_norm": 0.41665162461830807,
      "learning_rate": 4.292456961836069e-05,
      "loss": 1.6862,
      "num_input_tokens_seen": 21909856400,
      "step": 27848
    },
    {
      "epoch": 2.9544875875238703,
      "grad_norm": 0.5770110471965034,
      "learning_rate": 4.29240851550126e-05,
      "loss": 1.5135,
      "num_input_tokens_seen": 21910643136,
      "step": 27849
    },
    {
      "epoch": 2.954593677063442,
      "grad_norm": 0.504982418980782,
      "learning_rate": 4.2923600677813305e-05,
      "loss": 1.7271,
      "num_input_tokens_seen": 21911429952,
      "step": 27850
    },
    {
      "epoch": 2.954699766603013,
      "grad_norm": 0.8449943703133802,
      "learning_rate": 4.292311618676318e-05,
      "loss": 1.4838,
      "num_input_tokens_seen": 21912216784,
      "step": 27851
    },
    {
      "epoch": 2.9548058561425843,
      "grad_norm": 0.7331025930615133,
      "learning_rate": 4.29226316818626e-05,
      "loss": 1.5649,
      "num_input_tokens_seen": 21913003632,
      "step": 27852
    },
    {
      "epoch": 2.9549119456821558,
      "grad_norm": 0.6616758891291273,
      "learning_rate": 4.2922147163111924e-05,
      "loss": 1.447,
      "num_input_tokens_seen": 21913790368,
      "step": 27853
    },
    {
      "epoch": 2.9550180352217272,
      "grad_norm": 0.5295883297357451,
      "learning_rate": 4.292166263051155e-05,
      "loss": 1.5408,
      "num_input_tokens_seen": 21914577104,
      "step": 27854
    },
    {
      "epoch": 2.9551241247612987,
      "grad_norm": 0.5350993797767338,
      "learning_rate": 4.292117808406183e-05,
      "loss": 1.4251,
      "num_input_tokens_seen": 21915363888,
      "step": 27855
    },
    {
      "epoch": 2.9552302143008697,
      "grad_norm": 0.5942599475907837,
      "learning_rate": 4.292069352376315e-05,
      "loss": 1.6044,
      "num_input_tokens_seen": 21916150672,
      "step": 27856
    },
    {
      "epoch": 2.955336303840441,
      "grad_norm": 0.5230154772416221,
      "learning_rate": 4.29202089496159e-05,
      "loss": 1.5106,
      "num_input_tokens_seen": 21916937472,
      "step": 27857
    },
    {
      "epoch": 2.9554423933800127,
      "grad_norm": 0.8231981797625769,
      "learning_rate": 4.291972436162042e-05,
      "loss": 1.4784,
      "num_input_tokens_seen": 21917724288,
      "step": 27858
    },
    {
      "epoch": 2.955548482919584,
      "grad_norm": 0.5353094301467635,
      "learning_rate": 4.2919239759777116e-05,
      "loss": 1.7192,
      "num_input_tokens_seen": 21918510928,
      "step": 27859
    },
    {
      "epoch": 2.9556545724591556,
      "grad_norm": 1.3044856618152223,
      "learning_rate": 4.2918755144086345e-05,
      "loss": 1.6732,
      "num_input_tokens_seen": 21919297664,
      "step": 27860
    },
    {
      "epoch": 2.9557606619987267,
      "grad_norm": 0.625201977448212,
      "learning_rate": 4.2918270514548483e-05,
      "loss": 1.5192,
      "num_input_tokens_seen": 21920084448,
      "step": 27861
    },
    {
      "epoch": 2.9558667515382986,
      "grad_norm": 0.9958317552510446,
      "learning_rate": 4.291778587116391e-05,
      "loss": 1.6521,
      "num_input_tokens_seen": 21920871168,
      "step": 27862
    },
    {
      "epoch": 2.9559728410778696,
      "grad_norm": 0.5656428201074429,
      "learning_rate": 4.291730121393299e-05,
      "loss": 1.4621,
      "num_input_tokens_seen": 21921657968,
      "step": 27863
    },
    {
      "epoch": 2.956078930617441,
      "grad_norm": 0.4770594376043522,
      "learning_rate": 4.291681654285612e-05,
      "loss": 1.6394,
      "num_input_tokens_seen": 21922444768,
      "step": 27864
    },
    {
      "epoch": 2.9561850201570126,
      "grad_norm": 0.47385710928917163,
      "learning_rate": 4.2916331857933644e-05,
      "loss": 1.4526,
      "num_input_tokens_seen": 21923231584,
      "step": 27865
    },
    {
      "epoch": 2.956291109696584,
      "grad_norm": 0.47805534492994006,
      "learning_rate": 4.291584715916596e-05,
      "loss": 1.7072,
      "num_input_tokens_seen": 21924018320,
      "step": 27866
    },
    {
      "epoch": 2.9563971992361555,
      "grad_norm": 0.4782542125128632,
      "learning_rate": 4.2915362446553434e-05,
      "loss": 1.5202,
      "num_input_tokens_seen": 21924805184,
      "step": 27867
    },
    {
      "epoch": 2.9565032887757265,
      "grad_norm": 0.5759324845755399,
      "learning_rate": 4.291487772009645e-05,
      "loss": 1.5795,
      "num_input_tokens_seen": 21925592016,
      "step": 27868
    },
    {
      "epoch": 2.956609378315298,
      "grad_norm": 0.5704031365647649,
      "learning_rate": 4.291439297979536e-05,
      "loss": 1.5785,
      "num_input_tokens_seen": 21926378832,
      "step": 27869
    },
    {
      "epoch": 2.9567154678548695,
      "grad_norm": 0.4365371956504316,
      "learning_rate": 4.291390822565056e-05,
      "loss": 1.5115,
      "num_input_tokens_seen": 21927165568,
      "step": 27870
    },
    {
      "epoch": 2.956821557394441,
      "grad_norm": 0.8645568135185067,
      "learning_rate": 4.2913423457662416e-05,
      "loss": 1.5691,
      "num_input_tokens_seen": 21927952320,
      "step": 27871
    },
    {
      "epoch": 2.9569276469340124,
      "grad_norm": 0.46813601645435216,
      "learning_rate": 4.29129386758313e-05,
      "loss": 1.5265,
      "num_input_tokens_seen": 21928739088,
      "step": 27872
    },
    {
      "epoch": 2.9570337364735835,
      "grad_norm": 0.7331597815546975,
      "learning_rate": 4.29124538801576e-05,
      "loss": 1.6348,
      "num_input_tokens_seen": 21929525952,
      "step": 27873
    },
    {
      "epoch": 2.957139826013155,
      "grad_norm": 0.40020913851514395,
      "learning_rate": 4.291196907064168e-05,
      "loss": 1.6128,
      "num_input_tokens_seen": 21930312720,
      "step": 27874
    },
    {
      "epoch": 2.9572459155527264,
      "grad_norm": 0.578033963895234,
      "learning_rate": 4.291148424728391e-05,
      "loss": 1.6606,
      "num_input_tokens_seen": 21931099344,
      "step": 27875
    },
    {
      "epoch": 2.957352005092298,
      "grad_norm": 0.5827042169630307,
      "learning_rate": 4.291099941008467e-05,
      "loss": 1.6628,
      "num_input_tokens_seen": 21931885984,
      "step": 27876
    },
    {
      "epoch": 2.9574580946318694,
      "grad_norm": 0.5559728406546226,
      "learning_rate": 4.291051455904434e-05,
      "loss": 1.5503,
      "num_input_tokens_seen": 21932672736,
      "step": 27877
    },
    {
      "epoch": 2.957564184171441,
      "grad_norm": 0.4309611847508404,
      "learning_rate": 4.291002969416329e-05,
      "loss": 1.5935,
      "num_input_tokens_seen": 21933459568,
      "step": 27878
    },
    {
      "epoch": 2.9576702737110123,
      "grad_norm": 0.5212302367478814,
      "learning_rate": 4.290954481544189e-05,
      "loss": 1.6126,
      "num_input_tokens_seen": 21934246320,
      "step": 27879
    },
    {
      "epoch": 2.9577763632505834,
      "grad_norm": 0.646148074746903,
      "learning_rate": 4.2909059922880526e-05,
      "loss": 1.696,
      "num_input_tokens_seen": 21935033072,
      "step": 27880
    },
    {
      "epoch": 2.957882452790155,
      "grad_norm": 0.731841696770996,
      "learning_rate": 4.290857501647956e-05,
      "loss": 1.5755,
      "num_input_tokens_seen": 21935819840,
      "step": 27881
    },
    {
      "epoch": 2.9579885423297263,
      "grad_norm": 0.4393393952125609,
      "learning_rate": 4.290809009623937e-05,
      "loss": 1.5791,
      "num_input_tokens_seen": 21936606608,
      "step": 27882
    },
    {
      "epoch": 2.9580946318692978,
      "grad_norm": 0.4550807009257317,
      "learning_rate": 4.290760516216035e-05,
      "loss": 1.568,
      "num_input_tokens_seen": 21937393344,
      "step": 27883
    },
    {
      "epoch": 2.9582007214088692,
      "grad_norm": 0.49565516028578943,
      "learning_rate": 4.290712021424284e-05,
      "loss": 1.6276,
      "num_input_tokens_seen": 21938180080,
      "step": 27884
    },
    {
      "epoch": 2.9583068109484403,
      "grad_norm": 0.744714054480504,
      "learning_rate": 4.2906635252487236e-05,
      "loss": 1.5643,
      "num_input_tokens_seen": 21938966848,
      "step": 27885
    },
    {
      "epoch": 2.9584129004880118,
      "grad_norm": 0.5516803063165256,
      "learning_rate": 4.2906150276893914e-05,
      "loss": 1.634,
      "num_input_tokens_seen": 21939753632,
      "step": 27886
    },
    {
      "epoch": 2.9585189900275832,
      "grad_norm": 0.4959471975311256,
      "learning_rate": 4.2905665287463246e-05,
      "loss": 1.6622,
      "num_input_tokens_seen": 21940540400,
      "step": 27887
    },
    {
      "epoch": 2.9586250795671547,
      "grad_norm": 0.5877239829215211,
      "learning_rate": 4.29051802841956e-05,
      "loss": 1.5858,
      "num_input_tokens_seen": 21941327168,
      "step": 27888
    },
    {
      "epoch": 2.958731169106726,
      "grad_norm": 0.5168494064361875,
      "learning_rate": 4.290469526709136e-05,
      "loss": 1.5082,
      "num_input_tokens_seen": 21942113888,
      "step": 27889
    },
    {
      "epoch": 2.958837258646297,
      "grad_norm": 0.5459586761084396,
      "learning_rate": 4.290421023615089e-05,
      "loss": 1.5343,
      "num_input_tokens_seen": 21942900672,
      "step": 27890
    },
    {
      "epoch": 2.958943348185869,
      "grad_norm": 0.528725782092364,
      "learning_rate": 4.2903725191374574e-05,
      "loss": 1.5084,
      "num_input_tokens_seen": 21943687440,
      "step": 27891
    },
    {
      "epoch": 2.95904943772544,
      "grad_norm": 0.41764815825769475,
      "learning_rate": 4.2903240132762794e-05,
      "loss": 1.6182,
      "num_input_tokens_seen": 21944474288,
      "step": 27892
    },
    {
      "epoch": 2.9591555272650116,
      "grad_norm": 0.38703999345261597,
      "learning_rate": 4.290275506031591e-05,
      "loss": 1.5898,
      "num_input_tokens_seen": 21945260992,
      "step": 27893
    },
    {
      "epoch": 2.959261616804583,
      "grad_norm": 0.37180391934523727,
      "learning_rate": 4.2902269974034295e-05,
      "loss": 1.4265,
      "num_input_tokens_seen": 21946047776,
      "step": 27894
    },
    {
      "epoch": 2.9593677063441546,
      "grad_norm": 0.4314494965408253,
      "learning_rate": 4.290178487391834e-05,
      "loss": 1.5597,
      "num_input_tokens_seen": 21946834560,
      "step": 27895
    },
    {
      "epoch": 2.959473795883726,
      "grad_norm": 0.44525140167952254,
      "learning_rate": 4.290129975996841e-05,
      "loss": 1.5553,
      "num_input_tokens_seen": 21947621280,
      "step": 27896
    },
    {
      "epoch": 2.959579885423297,
      "grad_norm": 0.3691813463182943,
      "learning_rate": 4.2900814632184876e-05,
      "loss": 1.5237,
      "num_input_tokens_seen": 21948408032,
      "step": 27897
    },
    {
      "epoch": 2.9596859749628686,
      "grad_norm": 0.5377350189242732,
      "learning_rate": 4.290032949056812e-05,
      "loss": 1.4927,
      "num_input_tokens_seen": 21949194784,
      "step": 27898
    },
    {
      "epoch": 2.95979206450244,
      "grad_norm": 0.36555924357991076,
      "learning_rate": 4.289984433511852e-05,
      "loss": 1.5607,
      "num_input_tokens_seen": 21949981600,
      "step": 27899
    },
    {
      "epoch": 2.9598981540420115,
      "grad_norm": 0.5417327870175438,
      "learning_rate": 4.289935916583644e-05,
      "loss": 1.6217,
      "num_input_tokens_seen": 21950768352,
      "step": 27900
    },
    {
      "epoch": 2.960004243581583,
      "grad_norm": 0.3401379644841683,
      "learning_rate": 4.289887398272226e-05,
      "loss": 1.4713,
      "num_input_tokens_seen": 21951555184,
      "step": 27901
    },
    {
      "epoch": 2.960110333121154,
      "grad_norm": 0.48016037901968617,
      "learning_rate": 4.2898388785776354e-05,
      "loss": 1.6592,
      "num_input_tokens_seen": 21952341952,
      "step": 27902
    },
    {
      "epoch": 2.9602164226607255,
      "grad_norm": 0.6195060767495713,
      "learning_rate": 4.2897903574999103e-05,
      "loss": 1.5611,
      "num_input_tokens_seen": 21953128720,
      "step": 27903
    },
    {
      "epoch": 2.960322512200297,
      "grad_norm": 0.43622984648635915,
      "learning_rate": 4.2897418350390875e-05,
      "loss": 1.5616,
      "num_input_tokens_seen": 21953915504,
      "step": 27904
    },
    {
      "epoch": 2.9604286017398684,
      "grad_norm": 0.6246549335143092,
      "learning_rate": 4.289693311195205e-05,
      "loss": 1.5373,
      "num_input_tokens_seen": 21954702272,
      "step": 27905
    },
    {
      "epoch": 2.96053469127944,
      "grad_norm": 0.43476457394057655,
      "learning_rate": 4.2896447859683e-05,
      "loss": 1.5153,
      "num_input_tokens_seen": 21955489088,
      "step": 27906
    },
    {
      "epoch": 2.9606407808190114,
      "grad_norm": 0.4451549612895389,
      "learning_rate": 4.2895962593584094e-05,
      "loss": 1.5111,
      "num_input_tokens_seen": 21956275872,
      "step": 27907
    },
    {
      "epoch": 2.960746870358583,
      "grad_norm": 0.6724121189590075,
      "learning_rate": 4.289547731365572e-05,
      "loss": 1.6862,
      "num_input_tokens_seen": 21957062576,
      "step": 27908
    },
    {
      "epoch": 2.960852959898154,
      "grad_norm": 0.39649221048713623,
      "learning_rate": 4.289499201989824e-05,
      "loss": 1.4958,
      "num_input_tokens_seen": 21957849392,
      "step": 27909
    },
    {
      "epoch": 2.9609590494377254,
      "grad_norm": 0.5116193820536808,
      "learning_rate": 4.2894506712312036e-05,
      "loss": 1.7374,
      "num_input_tokens_seen": 21958636160,
      "step": 27910
    },
    {
      "epoch": 2.961065138977297,
      "grad_norm": 0.3901684191181178,
      "learning_rate": 4.289402139089749e-05,
      "loss": 1.5304,
      "num_input_tokens_seen": 21959422896,
      "step": 27911
    },
    {
      "epoch": 2.9611712285168683,
      "grad_norm": 0.35307254815017863,
      "learning_rate": 4.289353605565496e-05,
      "loss": 1.5485,
      "num_input_tokens_seen": 21960209696,
      "step": 27912
    },
    {
      "epoch": 2.96127731805644,
      "grad_norm": 0.3426298910913994,
      "learning_rate": 4.2893050706584836e-05,
      "loss": 1.5331,
      "num_input_tokens_seen": 21960996512,
      "step": 27913
    },
    {
      "epoch": 2.961383407596011,
      "grad_norm": 0.3698375254271502,
      "learning_rate": 4.289256534368749e-05,
      "loss": 1.6156,
      "num_input_tokens_seen": 21961783264,
      "step": 27914
    },
    {
      "epoch": 2.9614894971355823,
      "grad_norm": 0.41088429926500475,
      "learning_rate": 4.289207996696328e-05,
      "loss": 1.6759,
      "num_input_tokens_seen": 21962570096,
      "step": 27915
    },
    {
      "epoch": 2.9615955866751538,
      "grad_norm": 0.3992168704029555,
      "learning_rate": 4.289159457641261e-05,
      "loss": 1.664,
      "num_input_tokens_seen": 21963356736,
      "step": 27916
    },
    {
      "epoch": 2.9617016762147252,
      "grad_norm": 0.36083065173003587,
      "learning_rate": 4.289110917203584e-05,
      "loss": 1.5284,
      "num_input_tokens_seen": 21964143568,
      "step": 27917
    },
    {
      "epoch": 2.9618077657542967,
      "grad_norm": 0.36667313138126245,
      "learning_rate": 4.289062375383334e-05,
      "loss": 1.6915,
      "num_input_tokens_seen": 21964930240,
      "step": 27918
    },
    {
      "epoch": 2.9619138552938677,
      "grad_norm": 0.419500581225064,
      "learning_rate": 4.289013832180549e-05,
      "loss": 1.7507,
      "num_input_tokens_seen": 21965716960,
      "step": 27919
    },
    {
      "epoch": 2.9620199448334397,
      "grad_norm": 0.3669009263052527,
      "learning_rate": 4.288965287595267e-05,
      "loss": 1.6378,
      "num_input_tokens_seen": 21966503664,
      "step": 27920
    },
    {
      "epoch": 2.9621260343730107,
      "grad_norm": 0.4839626586728477,
      "learning_rate": 4.288916741627525e-05,
      "loss": 1.6777,
      "num_input_tokens_seen": 21967290496,
      "step": 27921
    },
    {
      "epoch": 2.962232123912582,
      "grad_norm": 0.36723086589989007,
      "learning_rate": 4.2888681942773606e-05,
      "loss": 1.5219,
      "num_input_tokens_seen": 21968077328,
      "step": 27922
    },
    {
      "epoch": 2.9623382134521536,
      "grad_norm": 0.4394700443059437,
      "learning_rate": 4.2888196455448114e-05,
      "loss": 1.607,
      "num_input_tokens_seen": 21968864128,
      "step": 27923
    },
    {
      "epoch": 2.962444302991725,
      "grad_norm": 0.3951993319953994,
      "learning_rate": 4.2887710954299147e-05,
      "loss": 1.5968,
      "num_input_tokens_seen": 21969650864,
      "step": 27924
    },
    {
      "epoch": 2.9625503925312966,
      "grad_norm": 0.39552560355654437,
      "learning_rate": 4.288722543932709e-05,
      "loss": 1.5443,
      "num_input_tokens_seen": 21970437664,
      "step": 27925
    },
    {
      "epoch": 2.9626564820708676,
      "grad_norm": 0.4225838721519967,
      "learning_rate": 4.28867399105323e-05,
      "loss": 1.6242,
      "num_input_tokens_seen": 21971224368,
      "step": 27926
    },
    {
      "epoch": 2.962762571610439,
      "grad_norm": 0.3907131402436647,
      "learning_rate": 4.288625436791517e-05,
      "loss": 1.5667,
      "num_input_tokens_seen": 21972011120,
      "step": 27927
    },
    {
      "epoch": 2.9628686611500106,
      "grad_norm": 0.4236827685056103,
      "learning_rate": 4.288576881147606e-05,
      "loss": 1.6487,
      "num_input_tokens_seen": 21972797904,
      "step": 27928
    },
    {
      "epoch": 2.962974750689582,
      "grad_norm": 0.45617648598252425,
      "learning_rate": 4.288528324121536e-05,
      "loss": 1.5164,
      "num_input_tokens_seen": 21973584720,
      "step": 27929
    },
    {
      "epoch": 2.9630808402291535,
      "grad_norm": 0.49448107660208535,
      "learning_rate": 4.288479765713343e-05,
      "loss": 1.5771,
      "num_input_tokens_seen": 21974371440,
      "step": 27930
    },
    {
      "epoch": 2.9631869297687246,
      "grad_norm": 0.40404236664922244,
      "learning_rate": 4.288431205923066e-05,
      "loss": 1.6546,
      "num_input_tokens_seen": 21975158160,
      "step": 27931
    },
    {
      "epoch": 2.9632930193082965,
      "grad_norm": 0.37797523776341907,
      "learning_rate": 4.288382644750742e-05,
      "loss": 1.6227,
      "num_input_tokens_seen": 21975944944,
      "step": 27932
    },
    {
      "epoch": 2.9633991088478675,
      "grad_norm": 0.41727684576325497,
      "learning_rate": 4.288334082196407e-05,
      "loss": 1.6025,
      "num_input_tokens_seen": 21976731648,
      "step": 27933
    },
    {
      "epoch": 2.963505198387439,
      "grad_norm": 0.37212059193973296,
      "learning_rate": 4.288285518260101e-05,
      "loss": 1.4548,
      "num_input_tokens_seen": 21977518448,
      "step": 27934
    },
    {
      "epoch": 2.9636112879270105,
      "grad_norm": 0.4293261031232066,
      "learning_rate": 4.28823695294186e-05,
      "loss": 1.6951,
      "num_input_tokens_seen": 21978305264,
      "step": 27935
    },
    {
      "epoch": 2.963717377466582,
      "grad_norm": 0.5504955900039489,
      "learning_rate": 4.288188386241723e-05,
      "loss": 1.7142,
      "num_input_tokens_seen": 21979091936,
      "step": 27936
    },
    {
      "epoch": 2.9638234670061534,
      "grad_norm": 0.32744994990993076,
      "learning_rate": 4.288139818159726e-05,
      "loss": 1.5692,
      "num_input_tokens_seen": 21979878592,
      "step": 27937
    },
    {
      "epoch": 2.9639295565457244,
      "grad_norm": 0.5534994528875065,
      "learning_rate": 4.2880912486959056e-05,
      "loss": 1.6622,
      "num_input_tokens_seen": 21980665344,
      "step": 27938
    },
    {
      "epoch": 2.964035646085296,
      "grad_norm": 0.4042034703206419,
      "learning_rate": 4.2880426778503016e-05,
      "loss": 1.6013,
      "num_input_tokens_seen": 21981452032,
      "step": 27939
    },
    {
      "epoch": 2.9641417356248674,
      "grad_norm": 0.3998378229625562,
      "learning_rate": 4.287994105622951e-05,
      "loss": 1.6585,
      "num_input_tokens_seen": 21982238752,
      "step": 27940
    },
    {
      "epoch": 2.964247825164439,
      "grad_norm": 0.5943556547598199,
      "learning_rate": 4.2879455320138906e-05,
      "loss": 1.5772,
      "num_input_tokens_seen": 21983025568,
      "step": 27941
    },
    {
      "epoch": 2.9643539147040103,
      "grad_norm": 0.35862524168326554,
      "learning_rate": 4.2878969570231595e-05,
      "loss": 1.5096,
      "num_input_tokens_seen": 21983812336,
      "step": 27942
    },
    {
      "epoch": 2.9644600042435814,
      "grad_norm": 0.4029590462446328,
      "learning_rate": 4.287848380650793e-05,
      "loss": 1.5778,
      "num_input_tokens_seen": 21984599088,
      "step": 27943
    },
    {
      "epoch": 2.964566093783153,
      "grad_norm": 0.5540215517934038,
      "learning_rate": 4.28779980289683e-05,
      "loss": 1.6241,
      "num_input_tokens_seen": 21985385760,
      "step": 27944
    },
    {
      "epoch": 2.9646721833227243,
      "grad_norm": 0.5233796466061114,
      "learning_rate": 4.287751223761308e-05,
      "loss": 1.5889,
      "num_input_tokens_seen": 21986172496,
      "step": 27945
    },
    {
      "epoch": 2.964778272862296,
      "grad_norm": 0.4613439060011603,
      "learning_rate": 4.2877026432442636e-05,
      "loss": 1.5827,
      "num_input_tokens_seen": 21986959280,
      "step": 27946
    },
    {
      "epoch": 2.9648843624018673,
      "grad_norm": 0.5550100127622296,
      "learning_rate": 4.287654061345736e-05,
      "loss": 1.585,
      "num_input_tokens_seen": 21987746032,
      "step": 27947
    },
    {
      "epoch": 2.9649904519414387,
      "grad_norm": 0.43553666421799136,
      "learning_rate": 4.287605478065762e-05,
      "loss": 1.5577,
      "num_input_tokens_seen": 21988532816,
      "step": 27948
    },
    {
      "epoch": 2.96509654148101,
      "grad_norm": 0.4690001660565944,
      "learning_rate": 4.2875568934043776e-05,
      "loss": 1.4976,
      "num_input_tokens_seen": 21989319696,
      "step": 27949
    },
    {
      "epoch": 2.9652026310205812,
      "grad_norm": 0.46777990868683567,
      "learning_rate": 4.2875083073616215e-05,
      "loss": 1.5303,
      "num_input_tokens_seen": 21990106480,
      "step": 27950
    },
    {
      "epoch": 2.9653087205601527,
      "grad_norm": 0.4212365392219221,
      "learning_rate": 4.287459719937533e-05,
      "loss": 1.6563,
      "num_input_tokens_seen": 21990893264,
      "step": 27951
    },
    {
      "epoch": 2.965414810099724,
      "grad_norm": 0.4873193882789754,
      "learning_rate": 4.287411131132147e-05,
      "loss": 1.5974,
      "num_input_tokens_seen": 21991680064,
      "step": 27952
    },
    {
      "epoch": 2.9655208996392957,
      "grad_norm": 0.39375723868664103,
      "learning_rate": 4.287362540945503e-05,
      "loss": 1.6636,
      "num_input_tokens_seen": 21992466928,
      "step": 27953
    },
    {
      "epoch": 2.965626989178867,
      "grad_norm": 0.4333387162864625,
      "learning_rate": 4.2873139493776374e-05,
      "loss": 1.5839,
      "num_input_tokens_seen": 21993253600,
      "step": 27954
    },
    {
      "epoch": 2.965733078718438,
      "grad_norm": 0.3369810351436437,
      "learning_rate": 4.2872653564285874e-05,
      "loss": 1.5217,
      "num_input_tokens_seen": 21994040432,
      "step": 27955
    },
    {
      "epoch": 2.9658391682580096,
      "grad_norm": 0.4029773754088739,
      "learning_rate": 4.287216762098392e-05,
      "loss": 1.5979,
      "num_input_tokens_seen": 21994827216,
      "step": 27956
    },
    {
      "epoch": 2.965945257797581,
      "grad_norm": 0.3720497291140769,
      "learning_rate": 4.287168166387087e-05,
      "loss": 1.5222,
      "num_input_tokens_seen": 21995614032,
      "step": 27957
    },
    {
      "epoch": 2.9660513473371526,
      "grad_norm": 0.3859702261043763,
      "learning_rate": 4.287119569294711e-05,
      "loss": 1.6369,
      "num_input_tokens_seen": 21996400768,
      "step": 27958
    },
    {
      "epoch": 2.966157436876724,
      "grad_norm": 0.40187387549839926,
      "learning_rate": 4.2870709708213016e-05,
      "loss": 1.7204,
      "num_input_tokens_seen": 21997187488,
      "step": 27959
    },
    {
      "epoch": 2.966263526416295,
      "grad_norm": 0.36045035979487594,
      "learning_rate": 4.287022370966897e-05,
      "loss": 1.4637,
      "num_input_tokens_seen": 21997974256,
      "step": 27960
    },
    {
      "epoch": 2.966369615955867,
      "grad_norm": 0.3916424024174295,
      "learning_rate": 4.286973769731533e-05,
      "loss": 1.582,
      "num_input_tokens_seen": 21998760960,
      "step": 27961
    },
    {
      "epoch": 2.966475705495438,
      "grad_norm": 0.3616564020069483,
      "learning_rate": 4.286925167115249e-05,
      "loss": 1.5273,
      "num_input_tokens_seen": 21999547680,
      "step": 27962
    },
    {
      "epoch": 2.9665817950350095,
      "grad_norm": 0.4222261351407382,
      "learning_rate": 4.2868765631180807e-05,
      "loss": 1.5574,
      "num_input_tokens_seen": 22000334480,
      "step": 27963
    },
    {
      "epoch": 2.966687884574581,
      "grad_norm": 0.4388972822251515,
      "learning_rate": 4.286827957740067e-05,
      "loss": 1.5827,
      "num_input_tokens_seen": 22001121216,
      "step": 27964
    },
    {
      "epoch": 2.9667939741141525,
      "grad_norm": 0.4105295221774161,
      "learning_rate": 4.2867793509812445e-05,
      "loss": 1.6403,
      "num_input_tokens_seen": 22001907968,
      "step": 27965
    },
    {
      "epoch": 2.966900063653724,
      "grad_norm": 0.40273166559523227,
      "learning_rate": 4.2867307428416527e-05,
      "loss": 1.6344,
      "num_input_tokens_seen": 22002694720,
      "step": 27966
    },
    {
      "epoch": 2.967006153193295,
      "grad_norm": 0.37352284504097805,
      "learning_rate": 4.2866821333213266e-05,
      "loss": 1.4393,
      "num_input_tokens_seen": 22003481520,
      "step": 27967
    },
    {
      "epoch": 2.9671122427328664,
      "grad_norm": 0.43840104250028183,
      "learning_rate": 4.286633522420306e-05,
      "loss": 1.6279,
      "num_input_tokens_seen": 22004268272,
      "step": 27968
    },
    {
      "epoch": 2.967218332272438,
      "grad_norm": 0.3709589344846048,
      "learning_rate": 4.2865849101386265e-05,
      "loss": 1.5093,
      "num_input_tokens_seen": 22005055072,
      "step": 27969
    },
    {
      "epoch": 2.9673244218120094,
      "grad_norm": 0.36140096687336026,
      "learning_rate": 4.286536296476327e-05,
      "loss": 1.5982,
      "num_input_tokens_seen": 22005841856,
      "step": 27970
    },
    {
      "epoch": 2.967430511351581,
      "grad_norm": 0.3870345177349252,
      "learning_rate": 4.2864876814334444e-05,
      "loss": 1.4887,
      "num_input_tokens_seen": 22006628656,
      "step": 27971
    },
    {
      "epoch": 2.967536600891152,
      "grad_norm": 0.38123488138157524,
      "learning_rate": 4.2864390650100174e-05,
      "loss": 1.6432,
      "num_input_tokens_seen": 22007415312,
      "step": 27972
    },
    {
      "epoch": 2.9676426904307234,
      "grad_norm": 0.4416049604591306,
      "learning_rate": 4.286390447206082e-05,
      "loss": 1.6539,
      "num_input_tokens_seen": 22008202192,
      "step": 27973
    },
    {
      "epoch": 2.967748779970295,
      "grad_norm": 0.3889127025058296,
      "learning_rate": 4.2863418280216764e-05,
      "loss": 1.7168,
      "num_input_tokens_seen": 22008988912,
      "step": 27974
    },
    {
      "epoch": 2.9678548695098663,
      "grad_norm": 0.3992928652062264,
      "learning_rate": 4.286293207456838e-05,
      "loss": 1.5352,
      "num_input_tokens_seen": 22009775648,
      "step": 27975
    },
    {
      "epoch": 2.967960959049438,
      "grad_norm": 0.44474148059203494,
      "learning_rate": 4.286244585511605e-05,
      "loss": 1.5219,
      "num_input_tokens_seen": 22010562432,
      "step": 27976
    },
    {
      "epoch": 2.9680670485890093,
      "grad_norm": 0.3454591326514658,
      "learning_rate": 4.2861959621860146e-05,
      "loss": 1.5317,
      "num_input_tokens_seen": 22011349248,
      "step": 27977
    },
    {
      "epoch": 2.9681731381285807,
      "grad_norm": 0.42523576758486836,
      "learning_rate": 4.286147337480105e-05,
      "loss": 1.5688,
      "num_input_tokens_seen": 22012136064,
      "step": 27978
    },
    {
      "epoch": 2.9682792276681518,
      "grad_norm": 0.478303189487852,
      "learning_rate": 4.2860987113939124e-05,
      "loss": 1.5834,
      "num_input_tokens_seen": 22012922768,
      "step": 27979
    },
    {
      "epoch": 2.9683853172077233,
      "grad_norm": 0.38820280206218516,
      "learning_rate": 4.2860500839274756e-05,
      "loss": 1.518,
      "num_input_tokens_seen": 22013709520,
      "step": 27980
    },
    {
      "epoch": 2.9684914067472947,
      "grad_norm": 0.4303212955108303,
      "learning_rate": 4.286001455080831e-05,
      "loss": 1.6521,
      "num_input_tokens_seen": 22014496272,
      "step": 27981
    },
    {
      "epoch": 2.968597496286866,
      "grad_norm": 0.4068797148828097,
      "learning_rate": 4.285952824854017e-05,
      "loss": 1.521,
      "num_input_tokens_seen": 22015283088,
      "step": 27982
    },
    {
      "epoch": 2.9687035858264377,
      "grad_norm": 0.4846638707702789,
      "learning_rate": 4.285904193247071e-05,
      "loss": 1.6076,
      "num_input_tokens_seen": 22016069792,
      "step": 27983
    },
    {
      "epoch": 2.9688096753660087,
      "grad_norm": 0.42370031571833194,
      "learning_rate": 4.285855560260031e-05,
      "loss": 1.7245,
      "num_input_tokens_seen": 22016856576,
      "step": 27984
    },
    {
      "epoch": 2.96891576490558,
      "grad_norm": 0.3895125770710798,
      "learning_rate": 4.285806925892934e-05,
      "loss": 1.5446,
      "num_input_tokens_seen": 22017643408,
      "step": 27985
    },
    {
      "epoch": 2.9690218544451517,
      "grad_norm": 0.39083010435132526,
      "learning_rate": 4.285758290145818e-05,
      "loss": 1.6518,
      "num_input_tokens_seen": 22018430080,
      "step": 27986
    },
    {
      "epoch": 2.969127943984723,
      "grad_norm": 0.41805260748658996,
      "learning_rate": 4.2857096530187204e-05,
      "loss": 1.5264,
      "num_input_tokens_seen": 22019216784,
      "step": 27987
    },
    {
      "epoch": 2.9692340335242946,
      "grad_norm": 0.3567586429541558,
      "learning_rate": 4.2856610145116794e-05,
      "loss": 1.4267,
      "num_input_tokens_seen": 22020003648,
      "step": 27988
    },
    {
      "epoch": 2.9693401230638656,
      "grad_norm": 0.33829888609035136,
      "learning_rate": 4.285612374624731e-05,
      "loss": 1.4697,
      "num_input_tokens_seen": 22020790384,
      "step": 27989
    },
    {
      "epoch": 2.9694462126034376,
      "grad_norm": 0.3390175485512524,
      "learning_rate": 4.2855637333579143e-05,
      "loss": 1.5217,
      "num_input_tokens_seen": 22021577136,
      "step": 27990
    },
    {
      "epoch": 2.9695523021430086,
      "grad_norm": 0.3788213330153482,
      "learning_rate": 4.285515090711266e-05,
      "loss": 1.6213,
      "num_input_tokens_seen": 22022363840,
      "step": 27991
    },
    {
      "epoch": 2.96965839168258,
      "grad_norm": 0.36342406552577877,
      "learning_rate": 4.2854664466848236e-05,
      "loss": 1.5329,
      "num_input_tokens_seen": 22023150688,
      "step": 27992
    },
    {
      "epoch": 2.9697644812221515,
      "grad_norm": 0.3269926911727736,
      "learning_rate": 4.285417801278626e-05,
      "loss": 1.4731,
      "num_input_tokens_seen": 22023937520,
      "step": 27993
    },
    {
      "epoch": 2.969870570761723,
      "grad_norm": 0.42026746583512853,
      "learning_rate": 4.2853691544927095e-05,
      "loss": 1.6156,
      "num_input_tokens_seen": 22024724224,
      "step": 27994
    },
    {
      "epoch": 2.9699766603012945,
      "grad_norm": 0.41947290519821495,
      "learning_rate": 4.2853205063271124e-05,
      "loss": 1.6918,
      "num_input_tokens_seen": 22025510976,
      "step": 27995
    },
    {
      "epoch": 2.9700827498408655,
      "grad_norm": 0.5002900449752327,
      "learning_rate": 4.2852718567818714e-05,
      "loss": 1.6008,
      "num_input_tokens_seen": 22026297760,
      "step": 27996
    },
    {
      "epoch": 2.970188839380437,
      "grad_norm": 0.3840697469129792,
      "learning_rate": 4.285223205857025e-05,
      "loss": 1.5519,
      "num_input_tokens_seen": 22027084576,
      "step": 27997
    },
    {
      "epoch": 2.9702949289200085,
      "grad_norm": 0.4564085062349539,
      "learning_rate": 4.285174553552611e-05,
      "loss": 1.6941,
      "num_input_tokens_seen": 22027871312,
      "step": 27998
    },
    {
      "epoch": 2.97040101845958,
      "grad_norm": 0.42239957806350586,
      "learning_rate": 4.285125899868666e-05,
      "loss": 1.6052,
      "num_input_tokens_seen": 22028658064,
      "step": 27999
    },
    {
      "epoch": 2.9705071079991514,
      "grad_norm": 0.46979917706104385,
      "learning_rate": 4.285077244805228e-05,
      "loss": 1.6282,
      "num_input_tokens_seen": 22029444800,
      "step": 28000
    },
    {
      "epoch": 2.9705071079991514,
      "eval_loss": 1.6313313245773315,
      "eval_runtime": 64.8443,
      "eval_samples_per_second": 46.265,
      "eval_steps_per_second": 0.493,
      "num_input_tokens_seen": 22029444800,
      "step": 28000
    },
    {
      "epoch": 2.9706131975387224,
      "grad_norm": 0.4605462922728864,
      "learning_rate": 4.2850285883623345e-05,
      "loss": 1.5457,
      "num_input_tokens_seen": 22030231632,
      "step": 28001
    },
    {
      "epoch": 2.9707192870782944,
      "grad_norm": 0.5001545508638374,
      "learning_rate": 4.284979930540024e-05,
      "loss": 1.5383,
      "num_input_tokens_seen": 22031018416,
      "step": 28002
    },
    {
      "epoch": 2.9708253766178654,
      "grad_norm": 0.4187193579511224,
      "learning_rate": 4.284931271338333e-05,
      "loss": 1.5761,
      "num_input_tokens_seen": 22031805248,
      "step": 28003
    },
    {
      "epoch": 2.970931466157437,
      "grad_norm": 0.4701243784973156,
      "learning_rate": 4.2848826107572994e-05,
      "loss": 1.6091,
      "num_input_tokens_seen": 22032591936,
      "step": 28004
    },
    {
      "epoch": 2.9710375556970083,
      "grad_norm": 0.49537216694862773,
      "learning_rate": 4.284833948796961e-05,
      "loss": 1.6239,
      "num_input_tokens_seen": 22033378720,
      "step": 28005
    },
    {
      "epoch": 2.97114364523658,
      "grad_norm": 0.4451298505683942,
      "learning_rate": 4.284785285457355e-05,
      "loss": 1.6555,
      "num_input_tokens_seen": 22034165520,
      "step": 28006
    },
    {
      "epoch": 2.9712497347761513,
      "grad_norm": 0.5136079774740309,
      "learning_rate": 4.2847366207385195e-05,
      "loss": 1.5425,
      "num_input_tokens_seen": 22034952336,
      "step": 28007
    },
    {
      "epoch": 2.9713558243157223,
      "grad_norm": 0.4847009471038084,
      "learning_rate": 4.2846879546404915e-05,
      "loss": 1.6314,
      "num_input_tokens_seen": 22035739104,
      "step": 28008
    },
    {
      "epoch": 2.971461913855294,
      "grad_norm": 0.5490115753672563,
      "learning_rate": 4.28463928716331e-05,
      "loss": 1.6235,
      "num_input_tokens_seen": 22036525856,
      "step": 28009
    },
    {
      "epoch": 2.9715680033948653,
      "grad_norm": 0.5272956343726218,
      "learning_rate": 4.2845906183070104e-05,
      "loss": 1.7539,
      "num_input_tokens_seen": 22037312544,
      "step": 28010
    },
    {
      "epoch": 2.9716740929344367,
      "grad_norm": 0.4197750116822328,
      "learning_rate": 4.2845419480716324e-05,
      "loss": 1.6143,
      "num_input_tokens_seen": 22038099280,
      "step": 28011
    },
    {
      "epoch": 2.971780182474008,
      "grad_norm": 0.3951401349959605,
      "learning_rate": 4.284493276457213e-05,
      "loss": 1.5735,
      "num_input_tokens_seen": 22038886016,
      "step": 28012
    },
    {
      "epoch": 2.9718862720135792,
      "grad_norm": 0.5061216262824911,
      "learning_rate": 4.2844446034637886e-05,
      "loss": 1.5157,
      "num_input_tokens_seen": 22039672800,
      "step": 28013
    },
    {
      "epoch": 2.9719923615531507,
      "grad_norm": 0.3992365619374592,
      "learning_rate": 4.284395929091398e-05,
      "loss": 1.6674,
      "num_input_tokens_seen": 22040459584,
      "step": 28014
    },
    {
      "epoch": 2.972098451092722,
      "grad_norm": 0.44203198751033496,
      "learning_rate": 4.28434725334008e-05,
      "loss": 1.5689,
      "num_input_tokens_seen": 22041246304,
      "step": 28015
    },
    {
      "epoch": 2.9722045406322937,
      "grad_norm": 0.5719077441843684,
      "learning_rate": 4.2842985762098686e-05,
      "loss": 1.557,
      "num_input_tokens_seen": 22042033104,
      "step": 28016
    },
    {
      "epoch": 2.972310630171865,
      "grad_norm": 0.4753581395521205,
      "learning_rate": 4.284249897700805e-05,
      "loss": 1.7439,
      "num_input_tokens_seen": 22042819808,
      "step": 28017
    },
    {
      "epoch": 2.9724167197114366,
      "grad_norm": 0.7507534662960375,
      "learning_rate": 4.2842012178129254e-05,
      "loss": 1.6206,
      "num_input_tokens_seen": 22043606592,
      "step": 28018
    },
    {
      "epoch": 2.972522809251008,
      "grad_norm": 0.46595228586610443,
      "learning_rate": 4.2841525365462666e-05,
      "loss": 1.5264,
      "num_input_tokens_seen": 22044393344,
      "step": 28019
    },
    {
      "epoch": 2.972628898790579,
      "grad_norm": 0.6040098910203238,
      "learning_rate": 4.284103853900868e-05,
      "loss": 1.6364,
      "num_input_tokens_seen": 22045180096,
      "step": 28020
    },
    {
      "epoch": 2.9727349883301506,
      "grad_norm": 0.38751404044870286,
      "learning_rate": 4.284055169876766e-05,
      "loss": 1.5977,
      "num_input_tokens_seen": 22045966912,
      "step": 28021
    },
    {
      "epoch": 2.972841077869722,
      "grad_norm": 0.44037870776441207,
      "learning_rate": 4.284006484473998e-05,
      "loss": 1.5516,
      "num_input_tokens_seen": 22046753648,
      "step": 28022
    },
    {
      "epoch": 2.9729471674092935,
      "grad_norm": 0.4651325556865089,
      "learning_rate": 4.2839577976926025e-05,
      "loss": 1.6062,
      "num_input_tokens_seen": 22047540528,
      "step": 28023
    },
    {
      "epoch": 2.973053256948865,
      "grad_norm": 0.48174952824305955,
      "learning_rate": 4.283909109532617e-05,
      "loss": 1.7037,
      "num_input_tokens_seen": 22048327168,
      "step": 28024
    },
    {
      "epoch": 2.973159346488436,
      "grad_norm": 0.4446398960906406,
      "learning_rate": 4.283860419994079e-05,
      "loss": 1.6049,
      "num_input_tokens_seen": 22049113872,
      "step": 28025
    },
    {
      "epoch": 2.9732654360280075,
      "grad_norm": 0.48390753430093686,
      "learning_rate": 4.2838117290770255e-05,
      "loss": 1.5065,
      "num_input_tokens_seen": 22049900544,
      "step": 28026
    },
    {
      "epoch": 2.973371525567579,
      "grad_norm": 0.5055643640575359,
      "learning_rate": 4.283763036781495e-05,
      "loss": 1.5472,
      "num_input_tokens_seen": 22050687328,
      "step": 28027
    },
    {
      "epoch": 2.9734776151071505,
      "grad_norm": 0.44632962406672066,
      "learning_rate": 4.283714343107524e-05,
      "loss": 1.6016,
      "num_input_tokens_seen": 22051474064,
      "step": 28028
    },
    {
      "epoch": 2.973583704646722,
      "grad_norm": 0.4552894178397612,
      "learning_rate": 4.283665648055152e-05,
      "loss": 1.5058,
      "num_input_tokens_seen": 22052260912,
      "step": 28029
    },
    {
      "epoch": 2.973689794186293,
      "grad_norm": 0.38362503980248785,
      "learning_rate": 4.283616951624415e-05,
      "loss": 1.5225,
      "num_input_tokens_seen": 22053047600,
      "step": 28030
    },
    {
      "epoch": 2.973795883725865,
      "grad_norm": 0.6086020957097357,
      "learning_rate": 4.283568253815351e-05,
      "loss": 1.5279,
      "num_input_tokens_seen": 22053834352,
      "step": 28031
    },
    {
      "epoch": 2.973901973265436,
      "grad_norm": 0.34479020388708204,
      "learning_rate": 4.283519554627998e-05,
      "loss": 1.5213,
      "num_input_tokens_seen": 22054621104,
      "step": 28032
    },
    {
      "epoch": 2.9740080628050074,
      "grad_norm": 0.5013454037795756,
      "learning_rate": 4.2834708540623936e-05,
      "loss": 1.7185,
      "num_input_tokens_seen": 22055407792,
      "step": 28033
    },
    {
      "epoch": 2.974114152344579,
      "grad_norm": 0.5428223999312167,
      "learning_rate": 4.2834221521185744e-05,
      "loss": 1.5731,
      "num_input_tokens_seen": 22056194576,
      "step": 28034
    },
    {
      "epoch": 2.9742202418841504,
      "grad_norm": 0.3463775258510089,
      "learning_rate": 4.28337344879658e-05,
      "loss": 1.6124,
      "num_input_tokens_seen": 22056981280,
      "step": 28035
    },
    {
      "epoch": 2.974326331423722,
      "grad_norm": 0.534174630361933,
      "learning_rate": 4.283324744096446e-05,
      "loss": 1.5473,
      "num_input_tokens_seen": 22057768064,
      "step": 28036
    },
    {
      "epoch": 2.974432420963293,
      "grad_norm": 0.3667660491285587,
      "learning_rate": 4.283276038018211e-05,
      "loss": 1.5383,
      "num_input_tokens_seen": 22058554864,
      "step": 28037
    },
    {
      "epoch": 2.9745385105028643,
      "grad_norm": 0.37967983787543796,
      "learning_rate": 4.283227330561914e-05,
      "loss": 1.5091,
      "num_input_tokens_seen": 22059341600,
      "step": 28038
    },
    {
      "epoch": 2.974644600042436,
      "grad_norm": 0.4387488583631022,
      "learning_rate": 4.2831786217275905e-05,
      "loss": 1.5986,
      "num_input_tokens_seen": 22060128272,
      "step": 28039
    },
    {
      "epoch": 2.9747506895820073,
      "grad_norm": 0.4197724162353434,
      "learning_rate": 4.2831299115152776e-05,
      "loss": 1.548,
      "num_input_tokens_seen": 22060915024,
      "step": 28040
    },
    {
      "epoch": 2.9748567791215788,
      "grad_norm": 0.397735931840746,
      "learning_rate": 4.283081199925016e-05,
      "loss": 1.7158,
      "num_input_tokens_seen": 22061701760,
      "step": 28041
    },
    {
      "epoch": 2.97496286866115,
      "grad_norm": 0.3330753770967419,
      "learning_rate": 4.28303248695684e-05,
      "loss": 1.5906,
      "num_input_tokens_seen": 22062488576,
      "step": 28042
    },
    {
      "epoch": 2.9750689582007213,
      "grad_norm": 0.40454463345331065,
      "learning_rate": 4.2829837726107904e-05,
      "loss": 1.5867,
      "num_input_tokens_seen": 22063275264,
      "step": 28043
    },
    {
      "epoch": 2.9751750477402927,
      "grad_norm": 0.3664501938958051,
      "learning_rate": 4.282935056886902e-05,
      "loss": 1.595,
      "num_input_tokens_seen": 22064062064,
      "step": 28044
    },
    {
      "epoch": 2.975281137279864,
      "grad_norm": 0.3535989271435907,
      "learning_rate": 4.2828863397852146e-05,
      "loss": 1.5533,
      "num_input_tokens_seen": 22064848752,
      "step": 28045
    },
    {
      "epoch": 2.9753872268194357,
      "grad_norm": 0.3297472889760027,
      "learning_rate": 4.2828376213057645e-05,
      "loss": 1.546,
      "num_input_tokens_seen": 22065635504,
      "step": 28046
    },
    {
      "epoch": 2.975493316359007,
      "grad_norm": 0.38932645377459213,
      "learning_rate": 4.2827889014485904e-05,
      "loss": 1.5728,
      "num_input_tokens_seen": 22066422288,
      "step": 28047
    },
    {
      "epoch": 2.9755994058985786,
      "grad_norm": 0.36805792856832115,
      "learning_rate": 4.2827401802137286e-05,
      "loss": 1.4794,
      "num_input_tokens_seen": 22067209040,
      "step": 28048
    },
    {
      "epoch": 2.9757054954381497,
      "grad_norm": 0.45329238399038946,
      "learning_rate": 4.282691457601218e-05,
      "loss": 1.5976,
      "num_input_tokens_seen": 22067995728,
      "step": 28049
    },
    {
      "epoch": 2.975811584977721,
      "grad_norm": 0.38381054415995125,
      "learning_rate": 4.2826427336110955e-05,
      "loss": 1.561,
      "num_input_tokens_seen": 22068782496,
      "step": 28050
    },
    {
      "epoch": 2.9759176745172926,
      "grad_norm": 0.5064185783051689,
      "learning_rate": 4.282594008243399e-05,
      "loss": 1.5552,
      "num_input_tokens_seen": 22069569152,
      "step": 28051
    },
    {
      "epoch": 2.976023764056864,
      "grad_norm": 0.36220856747722263,
      "learning_rate": 4.2825452814981655e-05,
      "loss": 1.6291,
      "num_input_tokens_seen": 22070355904,
      "step": 28052
    },
    {
      "epoch": 2.9761298535964356,
      "grad_norm": 0.3865198103316498,
      "learning_rate": 4.282496553375434e-05,
      "loss": 1.4381,
      "num_input_tokens_seen": 22071142672,
      "step": 28053
    },
    {
      "epoch": 2.9762359431360066,
      "grad_norm": 0.4711641195046005,
      "learning_rate": 4.282447823875241e-05,
      "loss": 1.589,
      "num_input_tokens_seen": 22071929472,
      "step": 28054
    },
    {
      "epoch": 2.976342032675578,
      "grad_norm": 0.39502595188599404,
      "learning_rate": 4.282399092997625e-05,
      "loss": 1.5899,
      "num_input_tokens_seen": 22072716160,
      "step": 28055
    },
    {
      "epoch": 2.9764481222151495,
      "grad_norm": 0.37244484895622104,
      "learning_rate": 4.2823503607426235e-05,
      "loss": 1.5928,
      "num_input_tokens_seen": 22073503008,
      "step": 28056
    },
    {
      "epoch": 2.976554211754721,
      "grad_norm": 0.4149330828913968,
      "learning_rate": 4.282301627110273e-05,
      "loss": 1.6509,
      "num_input_tokens_seen": 22074289760,
      "step": 28057
    },
    {
      "epoch": 2.9766603012942925,
      "grad_norm": 0.353543237820765,
      "learning_rate": 4.282252892100613e-05,
      "loss": 1.5674,
      "num_input_tokens_seen": 22075076544,
      "step": 28058
    },
    {
      "epoch": 2.9767663908338635,
      "grad_norm": 0.3842621656613764,
      "learning_rate": 4.2822041557136805e-05,
      "loss": 1.487,
      "num_input_tokens_seen": 22075863344,
      "step": 28059
    },
    {
      "epoch": 2.9768724803734354,
      "grad_norm": 0.5578563152499728,
      "learning_rate": 4.282155417949513e-05,
      "loss": 1.6357,
      "num_input_tokens_seen": 22076650128,
      "step": 28060
    },
    {
      "epoch": 2.9769785699130065,
      "grad_norm": 0.5109827712962627,
      "learning_rate": 4.282106678808147e-05,
      "loss": 1.6111,
      "num_input_tokens_seen": 22077437056,
      "step": 28061
    },
    {
      "epoch": 2.977084659452578,
      "grad_norm": 0.40862881627225184,
      "learning_rate": 4.282057938289622e-05,
      "loss": 1.5888,
      "num_input_tokens_seen": 22078223760,
      "step": 28062
    },
    {
      "epoch": 2.9771907489921494,
      "grad_norm": 0.33842106694411506,
      "learning_rate": 4.2820091963939746e-05,
      "loss": 1.5195,
      "num_input_tokens_seen": 22079010560,
      "step": 28063
    },
    {
      "epoch": 2.977296838531721,
      "grad_norm": 0.38364096655009927,
      "learning_rate": 4.2819604531212434e-05,
      "loss": 1.4336,
      "num_input_tokens_seen": 22079797312,
      "step": 28064
    },
    {
      "epoch": 2.9774029280712924,
      "grad_norm": 0.3649461560559358,
      "learning_rate": 4.281911708471464e-05,
      "loss": 1.6032,
      "num_input_tokens_seen": 22080583984,
      "step": 28065
    },
    {
      "epoch": 2.9775090176108634,
      "grad_norm": 0.3363779745064149,
      "learning_rate": 4.281862962444677e-05,
      "loss": 1.5375,
      "num_input_tokens_seen": 22081370752,
      "step": 28066
    },
    {
      "epoch": 2.977615107150435,
      "grad_norm": 0.42168896781281845,
      "learning_rate": 4.281814215040918e-05,
      "loss": 1.6068,
      "num_input_tokens_seen": 22082157424,
      "step": 28067
    },
    {
      "epoch": 2.9777211966900063,
      "grad_norm": 0.35485846422514056,
      "learning_rate": 4.281765466260226e-05,
      "loss": 1.5478,
      "num_input_tokens_seen": 22082944256,
      "step": 28068
    },
    {
      "epoch": 2.977827286229578,
      "grad_norm": 0.4012277028209092,
      "learning_rate": 4.281716716102637e-05,
      "loss": 1.5009,
      "num_input_tokens_seen": 22083730912,
      "step": 28069
    },
    {
      "epoch": 2.9779333757691493,
      "grad_norm": 0.4039979767513426,
      "learning_rate": 4.2816679645681895e-05,
      "loss": 1.5623,
      "num_input_tokens_seen": 22084517616,
      "step": 28070
    },
    {
      "epoch": 2.9780394653087203,
      "grad_norm": 0.3885284148224437,
      "learning_rate": 4.281619211656922e-05,
      "loss": 1.5447,
      "num_input_tokens_seen": 22085304336,
      "step": 28071
    },
    {
      "epoch": 2.978145554848292,
      "grad_norm": 0.40256805352149827,
      "learning_rate": 4.281570457368871e-05,
      "loss": 1.6989,
      "num_input_tokens_seen": 22086091120,
      "step": 28072
    },
    {
      "epoch": 2.9782516443878633,
      "grad_norm": 0.4120272395107765,
      "learning_rate": 4.281521701704074e-05,
      "loss": 1.5164,
      "num_input_tokens_seen": 22086878032,
      "step": 28073
    },
    {
      "epoch": 2.9783577339274347,
      "grad_norm": 0.36618407595170327,
      "learning_rate": 4.28147294466257e-05,
      "loss": 1.5984,
      "num_input_tokens_seen": 22087664784,
      "step": 28074
    },
    {
      "epoch": 2.978463823467006,
      "grad_norm": 0.40102923061590073,
      "learning_rate": 4.2814241862443966e-05,
      "loss": 1.5083,
      "num_input_tokens_seen": 22088451488,
      "step": 28075
    },
    {
      "epoch": 2.9785699130065777,
      "grad_norm": 0.3298702996167757,
      "learning_rate": 4.28137542644959e-05,
      "loss": 1.5567,
      "num_input_tokens_seen": 22089238224,
      "step": 28076
    },
    {
      "epoch": 2.978676002546149,
      "grad_norm": 0.3360948739538632,
      "learning_rate": 4.281326665278189e-05,
      "loss": 1.4692,
      "num_input_tokens_seen": 22090025008,
      "step": 28077
    },
    {
      "epoch": 2.97878209208572,
      "grad_norm": 0.35604429256798853,
      "learning_rate": 4.2812779027302305e-05,
      "loss": 1.4975,
      "num_input_tokens_seen": 22090811728,
      "step": 28078
    },
    {
      "epoch": 2.9788881816252917,
      "grad_norm": 0.4110625292977031,
      "learning_rate": 4.281229138805753e-05,
      "loss": 1.5265,
      "num_input_tokens_seen": 22091598432,
      "step": 28079
    },
    {
      "epoch": 2.978994271164863,
      "grad_norm": 0.44620622973384244,
      "learning_rate": 4.281180373504795e-05,
      "loss": 1.6476,
      "num_input_tokens_seen": 22092385248,
      "step": 28080
    },
    {
      "epoch": 2.9791003607044346,
      "grad_norm": 0.39820773927429404,
      "learning_rate": 4.2811316068273923e-05,
      "loss": 1.5567,
      "num_input_tokens_seen": 22093172064,
      "step": 28081
    },
    {
      "epoch": 2.979206450244006,
      "grad_norm": 0.3680958448265889,
      "learning_rate": 4.281082838773583e-05,
      "loss": 1.4808,
      "num_input_tokens_seen": 22093958896,
      "step": 28082
    },
    {
      "epoch": 2.979312539783577,
      "grad_norm": 0.3574069308726257,
      "learning_rate": 4.281034069343405e-05,
      "loss": 1.5084,
      "num_input_tokens_seen": 22094745680,
      "step": 28083
    },
    {
      "epoch": 2.9794186293231486,
      "grad_norm": 0.427863035227283,
      "learning_rate": 4.280985298536897e-05,
      "loss": 1.5763,
      "num_input_tokens_seen": 22095532416,
      "step": 28084
    },
    {
      "epoch": 2.97952471886272,
      "grad_norm": 0.3788550148939336,
      "learning_rate": 4.2809365263540954e-05,
      "loss": 1.6013,
      "num_input_tokens_seen": 22096319184,
      "step": 28085
    },
    {
      "epoch": 2.9796308084022916,
      "grad_norm": 0.4103616431943585,
      "learning_rate": 4.280887752795038e-05,
      "loss": 1.4856,
      "num_input_tokens_seen": 22097105968,
      "step": 28086
    },
    {
      "epoch": 2.979736897941863,
      "grad_norm": 0.3225312573947475,
      "learning_rate": 4.280838977859763e-05,
      "loss": 1.4492,
      "num_input_tokens_seen": 22097892816,
      "step": 28087
    },
    {
      "epoch": 2.979842987481434,
      "grad_norm": 0.34702667171886403,
      "learning_rate": 4.2807902015483084e-05,
      "loss": 1.6384,
      "num_input_tokens_seen": 22098679536,
      "step": 28088
    },
    {
      "epoch": 2.979949077021006,
      "grad_norm": 0.4983141292554224,
      "learning_rate": 4.28074142386071e-05,
      "loss": 1.6463,
      "num_input_tokens_seen": 22099466272,
      "step": 28089
    },
    {
      "epoch": 2.980055166560577,
      "grad_norm": 0.3587864870520179,
      "learning_rate": 4.280692644797008e-05,
      "loss": 1.5506,
      "num_input_tokens_seen": 22100253008,
      "step": 28090
    },
    {
      "epoch": 2.9801612561001485,
      "grad_norm": 0.5646422044305257,
      "learning_rate": 4.280643864357239e-05,
      "loss": 1.6083,
      "num_input_tokens_seen": 22101039792,
      "step": 28091
    },
    {
      "epoch": 2.98026734563972,
      "grad_norm": 0.396300969793427,
      "learning_rate": 4.2805950825414396e-05,
      "loss": 1.5673,
      "num_input_tokens_seen": 22101826608,
      "step": 28092
    },
    {
      "epoch": 2.9803734351792914,
      "grad_norm": 0.45065721451362867,
      "learning_rate": 4.2805462993496495e-05,
      "loss": 1.6526,
      "num_input_tokens_seen": 22102613344,
      "step": 28093
    },
    {
      "epoch": 2.980479524718863,
      "grad_norm": 0.5033819296680504,
      "learning_rate": 4.280497514781906e-05,
      "loss": 1.7339,
      "num_input_tokens_seen": 22103400112,
      "step": 28094
    },
    {
      "epoch": 2.980585614258434,
      "grad_norm": 0.3518108807392516,
      "learning_rate": 4.2804487288382454e-05,
      "loss": 1.5288,
      "num_input_tokens_seen": 22104186800,
      "step": 28095
    },
    {
      "epoch": 2.9806917037980054,
      "grad_norm": 0.45996363483856656,
      "learning_rate": 4.2803999415187066e-05,
      "loss": 1.57,
      "num_input_tokens_seen": 22104973552,
      "step": 28096
    },
    {
      "epoch": 2.980797793337577,
      "grad_norm": 0.3646446384456061,
      "learning_rate": 4.280351152823327e-05,
      "loss": 1.6119,
      "num_input_tokens_seen": 22105760288,
      "step": 28097
    },
    {
      "epoch": 2.9809038828771484,
      "grad_norm": 0.4392838570621293,
      "learning_rate": 4.280302362752144e-05,
      "loss": 1.5813,
      "num_input_tokens_seen": 22106547072,
      "step": 28098
    },
    {
      "epoch": 2.98100997241672,
      "grad_norm": 0.44331436978525757,
      "learning_rate": 4.280253571305196e-05,
      "loss": 1.6036,
      "num_input_tokens_seen": 22107333872,
      "step": 28099
    },
    {
      "epoch": 2.981116061956291,
      "grad_norm": 0.34970718374624943,
      "learning_rate": 4.28020477848252e-05,
      "loss": 1.5059,
      "num_input_tokens_seen": 22108120720,
      "step": 28100
    },
    {
      "epoch": 2.981222151495863,
      "grad_norm": 0.4069918388181135,
      "learning_rate": 4.280155984284153e-05,
      "loss": 1.6455,
      "num_input_tokens_seen": 22108907472,
      "step": 28101
    },
    {
      "epoch": 2.981328241035434,
      "grad_norm": 0.4069079614490096,
      "learning_rate": 4.280107188710135e-05,
      "loss": 1.687,
      "num_input_tokens_seen": 22109694240,
      "step": 28102
    },
    {
      "epoch": 2.9814343305750053,
      "grad_norm": 0.3359755615832614,
      "learning_rate": 4.280058391760502e-05,
      "loss": 1.4508,
      "num_input_tokens_seen": 22110481008,
      "step": 28103
    },
    {
      "epoch": 2.9815404201145768,
      "grad_norm": 0.349500257362335,
      "learning_rate": 4.280009593435293e-05,
      "loss": 1.4422,
      "num_input_tokens_seen": 22111267792,
      "step": 28104
    },
    {
      "epoch": 2.9816465096541482,
      "grad_norm": 0.35703136673759195,
      "learning_rate": 4.279960793734543e-05,
      "loss": 1.444,
      "num_input_tokens_seen": 22112054592,
      "step": 28105
    },
    {
      "epoch": 2.9817525991937197,
      "grad_norm": 0.4537236340736481,
      "learning_rate": 4.279911992658292e-05,
      "loss": 1.5647,
      "num_input_tokens_seen": 22112841312,
      "step": 28106
    },
    {
      "epoch": 2.9818586887332907,
      "grad_norm": 0.4405610983582856,
      "learning_rate": 4.279863190206578e-05,
      "loss": 1.5482,
      "num_input_tokens_seen": 22113628000,
      "step": 28107
    },
    {
      "epoch": 2.981964778272862,
      "grad_norm": 0.5521247471605758,
      "learning_rate": 4.279814386379438e-05,
      "loss": 1.5249,
      "num_input_tokens_seen": 22114414784,
      "step": 28108
    },
    {
      "epoch": 2.9820708678124337,
      "grad_norm": 0.480831287299842,
      "learning_rate": 4.279765581176909e-05,
      "loss": 1.6373,
      "num_input_tokens_seen": 22115201536,
      "step": 28109
    },
    {
      "epoch": 2.982176957352005,
      "grad_norm": 0.4796290771142134,
      "learning_rate": 4.27971677459903e-05,
      "loss": 1.6109,
      "num_input_tokens_seen": 22115988320,
      "step": 28110
    },
    {
      "epoch": 2.9822830468915766,
      "grad_norm": 0.711037312814835,
      "learning_rate": 4.279667966645837e-05,
      "loss": 1.669,
      "num_input_tokens_seen": 22116775184,
      "step": 28111
    },
    {
      "epoch": 2.9823891364311477,
      "grad_norm": 0.41793161399461437,
      "learning_rate": 4.279619157317371e-05,
      "loss": 1.6854,
      "num_input_tokens_seen": 22117561952,
      "step": 28112
    },
    {
      "epoch": 2.982495225970719,
      "grad_norm": 0.7830224642572972,
      "learning_rate": 4.2795703466136646e-05,
      "loss": 1.5635,
      "num_input_tokens_seen": 22118348800,
      "step": 28113
    },
    {
      "epoch": 2.9826013155102906,
      "grad_norm": 0.4326434093279566,
      "learning_rate": 4.2795215345347605e-05,
      "loss": 1.5338,
      "num_input_tokens_seen": 22119135616,
      "step": 28114
    },
    {
      "epoch": 2.982707405049862,
      "grad_norm": 0.4706842864106817,
      "learning_rate": 4.279472721080694e-05,
      "loss": 1.6479,
      "num_input_tokens_seen": 22119922352,
      "step": 28115
    },
    {
      "epoch": 2.9828134945894336,
      "grad_norm": 0.7795317032063307,
      "learning_rate": 4.279423906251503e-05,
      "loss": 1.6161,
      "num_input_tokens_seen": 22120709024,
      "step": 28116
    },
    {
      "epoch": 2.982919584129005,
      "grad_norm": 0.3835697357123277,
      "learning_rate": 4.279375090047225e-05,
      "loss": 1.596,
      "num_input_tokens_seen": 22121495840,
      "step": 28117
    },
    {
      "epoch": 2.9830256736685765,
      "grad_norm": 0.7424981714244544,
      "learning_rate": 4.2793262724678996e-05,
      "loss": 1.6848,
      "num_input_tokens_seen": 22122282544,
      "step": 28118
    },
    {
      "epoch": 2.9831317632081475,
      "grad_norm": 0.3678702281416964,
      "learning_rate": 4.279277453513561e-05,
      "loss": 1.6505,
      "num_input_tokens_seen": 22123069328,
      "step": 28119
    },
    {
      "epoch": 2.983237852747719,
      "grad_norm": 0.47128075446683676,
      "learning_rate": 4.2792286331842506e-05,
      "loss": 1.6321,
      "num_input_tokens_seen": 22123856016,
      "step": 28120
    },
    {
      "epoch": 2.9833439422872905,
      "grad_norm": 0.4017715614503138,
      "learning_rate": 4.279179811480004e-05,
      "loss": 1.5352,
      "num_input_tokens_seen": 22124642832,
      "step": 28121
    },
    {
      "epoch": 2.983450031826862,
      "grad_norm": 0.40856277426839166,
      "learning_rate": 4.2791309884008594e-05,
      "loss": 1.6399,
      "num_input_tokens_seen": 22125429616,
      "step": 28122
    },
    {
      "epoch": 2.9835561213664334,
      "grad_norm": 0.4018391149270142,
      "learning_rate": 4.279082163946855e-05,
      "loss": 1.5802,
      "num_input_tokens_seen": 22126216416,
      "step": 28123
    },
    {
      "epoch": 2.9836622109060045,
      "grad_norm": 0.37231483038097357,
      "learning_rate": 4.2790333381180276e-05,
      "loss": 1.5825,
      "num_input_tokens_seen": 22127003104,
      "step": 28124
    },
    {
      "epoch": 2.983768300445576,
      "grad_norm": 0.3582382188486804,
      "learning_rate": 4.278984510914416e-05,
      "loss": 1.5235,
      "num_input_tokens_seen": 22127789936,
      "step": 28125
    },
    {
      "epoch": 2.9838743899851474,
      "grad_norm": 0.3767492563177601,
      "learning_rate": 4.278935682336056e-05,
      "loss": 1.6569,
      "num_input_tokens_seen": 22128576720,
      "step": 28126
    },
    {
      "epoch": 2.983980479524719,
      "grad_norm": 0.3337334424131671,
      "learning_rate": 4.278886852382988e-05,
      "loss": 1.5357,
      "num_input_tokens_seen": 22129363504,
      "step": 28127
    },
    {
      "epoch": 2.9840865690642904,
      "grad_norm": 0.4666702536084531,
      "learning_rate": 4.278838021055248e-05,
      "loss": 1.6982,
      "num_input_tokens_seen": 22130150336,
      "step": 28128
    },
    {
      "epoch": 2.9841926586038614,
      "grad_norm": 0.33791715007539075,
      "learning_rate": 4.2787891883528744e-05,
      "loss": 1.5968,
      "num_input_tokens_seen": 22130937200,
      "step": 28129
    },
    {
      "epoch": 2.9842987481434333,
      "grad_norm": 0.37174604616344603,
      "learning_rate": 4.278740354275904e-05,
      "loss": 1.666,
      "num_input_tokens_seen": 22131723904,
      "step": 28130
    },
    {
      "epoch": 2.9844048376830044,
      "grad_norm": 0.3194396908112907,
      "learning_rate": 4.278691518824376e-05,
      "loss": 1.3608,
      "num_input_tokens_seen": 22132510704,
      "step": 28131
    },
    {
      "epoch": 2.984510927222576,
      "grad_norm": 0.38904752023530714,
      "learning_rate": 4.2786426819983274e-05,
      "loss": 1.6312,
      "num_input_tokens_seen": 22133297472,
      "step": 28132
    },
    {
      "epoch": 2.9846170167621473,
      "grad_norm": 0.3759760297345713,
      "learning_rate": 4.278593843797796e-05,
      "loss": 1.5275,
      "num_input_tokens_seen": 22134084304,
      "step": 28133
    },
    {
      "epoch": 2.9847231063017188,
      "grad_norm": 0.37742494240439645,
      "learning_rate": 4.2785450042228186e-05,
      "loss": 1.5545,
      "num_input_tokens_seen": 22134871136,
      "step": 28134
    },
    {
      "epoch": 2.9848291958412903,
      "grad_norm": 0.38249327882421724,
      "learning_rate": 4.278496163273434e-05,
      "loss": 1.5377,
      "num_input_tokens_seen": 22135657888,
      "step": 28135
    },
    {
      "epoch": 2.9849352853808613,
      "grad_norm": 0.4939439324379479,
      "learning_rate": 4.2784473209496804e-05,
      "loss": 1.5964,
      "num_input_tokens_seen": 22136444672,
      "step": 28136
    },
    {
      "epoch": 2.9850413749204328,
      "grad_norm": 0.3947933910902677,
      "learning_rate": 4.278398477251595e-05,
      "loss": 1.5805,
      "num_input_tokens_seen": 22137231408,
      "step": 28137
    },
    {
      "epoch": 2.9851474644600042,
      "grad_norm": 0.4504923626753867,
      "learning_rate": 4.278349632179215e-05,
      "loss": 1.5391,
      "num_input_tokens_seen": 22138018160,
      "step": 28138
    },
    {
      "epoch": 2.9852535539995757,
      "grad_norm": 0.40917055590564844,
      "learning_rate": 4.2783007857325786e-05,
      "loss": 1.6292,
      "num_input_tokens_seen": 22138804992,
      "step": 28139
    },
    {
      "epoch": 2.985359643539147,
      "grad_norm": 0.4699046705207757,
      "learning_rate": 4.2782519379117234e-05,
      "loss": 1.6595,
      "num_input_tokens_seen": 22139591664,
      "step": 28140
    },
    {
      "epoch": 2.985465733078718,
      "grad_norm": 0.5170611674531802,
      "learning_rate": 4.278203088716687e-05,
      "loss": 1.6549,
      "num_input_tokens_seen": 22140378464,
      "step": 28141
    },
    {
      "epoch": 2.9855718226182897,
      "grad_norm": 0.40975539550046863,
      "learning_rate": 4.278154238147508e-05,
      "loss": 1.6297,
      "num_input_tokens_seen": 22141165200,
      "step": 28142
    },
    {
      "epoch": 2.985677912157861,
      "grad_norm": 0.42887430769416757,
      "learning_rate": 4.2781053862042236e-05,
      "loss": 1.5622,
      "num_input_tokens_seen": 22141952048,
      "step": 28143
    },
    {
      "epoch": 2.9857840016974326,
      "grad_norm": 0.5990984795015332,
      "learning_rate": 4.278056532886871e-05,
      "loss": 1.6612,
      "num_input_tokens_seen": 22142738880,
      "step": 28144
    },
    {
      "epoch": 2.985890091237004,
      "grad_norm": 0.34584106766391126,
      "learning_rate": 4.278007678195489e-05,
      "loss": 1.5461,
      "num_input_tokens_seen": 22143525584,
      "step": 28145
    },
    {
      "epoch": 2.9859961807765756,
      "grad_norm": 0.7314043863162276,
      "learning_rate": 4.277958822130115e-05,
      "loss": 1.5678,
      "num_input_tokens_seen": 22144312336,
      "step": 28146
    },
    {
      "epoch": 2.986102270316147,
      "grad_norm": 0.3693459654176189,
      "learning_rate": 4.277909964690786e-05,
      "loss": 1.5131,
      "num_input_tokens_seen": 22145099104,
      "step": 28147
    },
    {
      "epoch": 2.986208359855718,
      "grad_norm": 0.6217506195828821,
      "learning_rate": 4.277861105877541e-05,
      "loss": 1.683,
      "num_input_tokens_seen": 22145885872,
      "step": 28148
    },
    {
      "epoch": 2.9863144493952896,
      "grad_norm": 0.3972040383978245,
      "learning_rate": 4.277812245690417e-05,
      "loss": 1.5856,
      "num_input_tokens_seen": 22146672640,
      "step": 28149
    },
    {
      "epoch": 2.986420538934861,
      "grad_norm": 0.4560102538086489,
      "learning_rate": 4.2777633841294515e-05,
      "loss": 1.7371,
      "num_input_tokens_seen": 22147459472,
      "step": 28150
    },
    {
      "epoch": 2.9865266284744325,
      "grad_norm": 0.4430679926116665,
      "learning_rate": 4.2777145211946824e-05,
      "loss": 1.4837,
      "num_input_tokens_seen": 22148246240,
      "step": 28151
    },
    {
      "epoch": 2.986632718014004,
      "grad_norm": 0.4334775418401019,
      "learning_rate": 4.277665656886148e-05,
      "loss": 1.5778,
      "num_input_tokens_seen": 22149033056,
      "step": 28152
    },
    {
      "epoch": 2.986738807553575,
      "grad_norm": 0.4061104048255807,
      "learning_rate": 4.277616791203886e-05,
      "loss": 1.4459,
      "num_input_tokens_seen": 22149819920,
      "step": 28153
    },
    {
      "epoch": 2.9868448970931465,
      "grad_norm": 0.3670973432522293,
      "learning_rate": 4.2775679241479336e-05,
      "loss": 1.6,
      "num_input_tokens_seen": 22150606640,
      "step": 28154
    },
    {
      "epoch": 2.986950986632718,
      "grad_norm": 0.5968668818144847,
      "learning_rate": 4.277519055718329e-05,
      "loss": 1.6107,
      "num_input_tokens_seen": 22151393408,
      "step": 28155
    },
    {
      "epoch": 2.9870570761722894,
      "grad_norm": 0.3883101503120418,
      "learning_rate": 4.277470185915109e-05,
      "loss": 1.5281,
      "num_input_tokens_seen": 22152180112,
      "step": 28156
    },
    {
      "epoch": 2.987163165711861,
      "grad_norm": 0.4224831591998581,
      "learning_rate": 4.277421314738313e-05,
      "loss": 1.501,
      "num_input_tokens_seen": 22152966928,
      "step": 28157
    },
    {
      "epoch": 2.987269255251432,
      "grad_norm": 0.4276175208223503,
      "learning_rate": 4.277372442187978e-05,
      "loss": 1.4116,
      "num_input_tokens_seen": 22153753744,
      "step": 28158
    },
    {
      "epoch": 2.987375344791004,
      "grad_norm": 0.45801256601015816,
      "learning_rate": 4.277323568264142e-05,
      "loss": 1.5854,
      "num_input_tokens_seen": 22154540512,
      "step": 28159
    },
    {
      "epoch": 2.987481434330575,
      "grad_norm": 0.39378966893407585,
      "learning_rate": 4.2772746929668415e-05,
      "loss": 1.6764,
      "num_input_tokens_seen": 22155327232,
      "step": 28160
    },
    {
      "epoch": 2.9875875238701464,
      "grad_norm": 0.37190544023841543,
      "learning_rate": 4.2772258162961166e-05,
      "loss": 1.5502,
      "num_input_tokens_seen": 22156114016,
      "step": 28161
    },
    {
      "epoch": 2.987693613409718,
      "grad_norm": 0.40414880319623714,
      "learning_rate": 4.277176938252003e-05,
      "loss": 1.5273,
      "num_input_tokens_seen": 22156900800,
      "step": 28162
    },
    {
      "epoch": 2.9877997029492893,
      "grad_norm": 0.3625478789520666,
      "learning_rate": 4.2771280588345386e-05,
      "loss": 1.7316,
      "num_input_tokens_seen": 22157687584,
      "step": 28163
    },
    {
      "epoch": 2.987905792488861,
      "grad_norm": 0.49123334870299745,
      "learning_rate": 4.277079178043763e-05,
      "loss": 1.7471,
      "num_input_tokens_seen": 22158474352,
      "step": 28164
    },
    {
      "epoch": 2.988011882028432,
      "grad_norm": 0.3596866742670189,
      "learning_rate": 4.277030295879711e-05,
      "loss": 1.6372,
      "num_input_tokens_seen": 22159261136,
      "step": 28165
    },
    {
      "epoch": 2.9881179715680033,
      "grad_norm": 0.4462881910001033,
      "learning_rate": 4.276981412342424e-05,
      "loss": 1.6737,
      "num_input_tokens_seen": 22160047840,
      "step": 28166
    },
    {
      "epoch": 2.9882240611075748,
      "grad_norm": 0.3782745653636827,
      "learning_rate": 4.276932527431937e-05,
      "loss": 1.5607,
      "num_input_tokens_seen": 22160834624,
      "step": 28167
    },
    {
      "epoch": 2.9883301506471462,
      "grad_norm": 0.3879271868463235,
      "learning_rate": 4.2768836411482895e-05,
      "loss": 1.6753,
      "num_input_tokens_seen": 22161621344,
      "step": 28168
    },
    {
      "epoch": 2.9884362401867177,
      "grad_norm": 0.37524513936864573,
      "learning_rate": 4.2768347534915174e-05,
      "loss": 1.5832,
      "num_input_tokens_seen": 22162408080,
      "step": 28169
    },
    {
      "epoch": 2.9885423297262887,
      "grad_norm": 0.3427536481482086,
      "learning_rate": 4.2767858644616596e-05,
      "loss": 1.5365,
      "num_input_tokens_seen": 22163194736,
      "step": 28170
    },
    {
      "epoch": 2.9886484192658602,
      "grad_norm": 0.3784664293401107,
      "learning_rate": 4.276736974058755e-05,
      "loss": 1.6201,
      "num_input_tokens_seen": 22163981440,
      "step": 28171
    },
    {
      "epoch": 2.9887545088054317,
      "grad_norm": 0.43414977685543554,
      "learning_rate": 4.2766880822828395e-05,
      "loss": 1.6064,
      "num_input_tokens_seen": 22164768240,
      "step": 28172
    },
    {
      "epoch": 2.988860598345003,
      "grad_norm": 0.3840807550455174,
      "learning_rate": 4.2766391891339506e-05,
      "loss": 1.5731,
      "num_input_tokens_seen": 22165554912,
      "step": 28173
    },
    {
      "epoch": 2.9889666878845746,
      "grad_norm": 0.37760896653242415,
      "learning_rate": 4.276590294612128e-05,
      "loss": 1.5963,
      "num_input_tokens_seen": 22166341648,
      "step": 28174
    },
    {
      "epoch": 2.989072777424146,
      "grad_norm": 0.42318571672537586,
      "learning_rate": 4.2765413987174085e-05,
      "loss": 1.5555,
      "num_input_tokens_seen": 22167128384,
      "step": 28175
    },
    {
      "epoch": 2.9891788669637176,
      "grad_norm": 0.4402211579301468,
      "learning_rate": 4.27649250144983e-05,
      "loss": 1.6997,
      "num_input_tokens_seen": 22167915088,
      "step": 28176
    },
    {
      "epoch": 2.9892849565032886,
      "grad_norm": 0.35901131571854883,
      "learning_rate": 4.27644360280943e-05,
      "loss": 1.4983,
      "num_input_tokens_seen": 22168701872,
      "step": 28177
    },
    {
      "epoch": 2.98939104604286,
      "grad_norm": 0.6811985075916583,
      "learning_rate": 4.276394702796247e-05,
      "loss": 1.6705,
      "num_input_tokens_seen": 22169488672,
      "step": 28178
    },
    {
      "epoch": 2.9894971355824316,
      "grad_norm": 0.5823967972732853,
      "learning_rate": 4.2763458014103176e-05,
      "loss": 1.4101,
      "num_input_tokens_seen": 22170275520,
      "step": 28179
    },
    {
      "epoch": 2.989603225122003,
      "grad_norm": 0.6238224340186145,
      "learning_rate": 4.2762968986516806e-05,
      "loss": 1.6173,
      "num_input_tokens_seen": 22171062240,
      "step": 28180
    },
    {
      "epoch": 2.9897093146615745,
      "grad_norm": 0.49859439026627633,
      "learning_rate": 4.276247994520374e-05,
      "loss": 1.649,
      "num_input_tokens_seen": 22171848960,
      "step": 28181
    },
    {
      "epoch": 2.9898154042011456,
      "grad_norm": 0.5291273380635857,
      "learning_rate": 4.276199089016434e-05,
      "loss": 1.661,
      "num_input_tokens_seen": 22172635760,
      "step": 28182
    },
    {
      "epoch": 2.989921493740717,
      "grad_norm": 0.5435281761919902,
      "learning_rate": 4.2761501821399e-05,
      "loss": 1.4669,
      "num_input_tokens_seen": 22173422480,
      "step": 28183
    },
    {
      "epoch": 2.9900275832802885,
      "grad_norm": 0.5471645596149659,
      "learning_rate": 4.27610127389081e-05,
      "loss": 1.6202,
      "num_input_tokens_seen": 22174209280,
      "step": 28184
    },
    {
      "epoch": 2.99013367281986,
      "grad_norm": 0.4260597683768602,
      "learning_rate": 4.2760523642691996e-05,
      "loss": 1.4606,
      "num_input_tokens_seen": 22174996096,
      "step": 28185
    },
    {
      "epoch": 2.9902397623594315,
      "grad_norm": 0.6057439374567148,
      "learning_rate": 4.276003453275109e-05,
      "loss": 1.5682,
      "num_input_tokens_seen": 22175782784,
      "step": 28186
    },
    {
      "epoch": 2.9903458518990025,
      "grad_norm": 0.5648369682653923,
      "learning_rate": 4.275954540908575e-05,
      "loss": 1.6763,
      "num_input_tokens_seen": 22176569600,
      "step": 28187
    },
    {
      "epoch": 2.9904519414385744,
      "grad_norm": 0.42028037583206507,
      "learning_rate": 4.275905627169635e-05,
      "loss": 1.5725,
      "num_input_tokens_seen": 22177356336,
      "step": 28188
    },
    {
      "epoch": 2.9905580309781454,
      "grad_norm": 0.5016756097506809,
      "learning_rate": 4.2758567120583276e-05,
      "loss": 1.5137,
      "num_input_tokens_seen": 22178143056,
      "step": 28189
    },
    {
      "epoch": 2.990664120517717,
      "grad_norm": 0.43076810121743225,
      "learning_rate": 4.27580779557469e-05,
      "loss": 1.5635,
      "num_input_tokens_seen": 22178929872,
      "step": 28190
    },
    {
      "epoch": 2.9907702100572884,
      "grad_norm": 0.3951077770170917,
      "learning_rate": 4.2757588777187606e-05,
      "loss": 1.5251,
      "num_input_tokens_seen": 22179716688,
      "step": 28191
    },
    {
      "epoch": 2.99087629959686,
      "grad_norm": 0.5012398921818094,
      "learning_rate": 4.275709958490577e-05,
      "loss": 1.4234,
      "num_input_tokens_seen": 22180503472,
      "step": 28192
    },
    {
      "epoch": 2.9909823891364313,
      "grad_norm": 0.4936373262502281,
      "learning_rate": 4.275661037890176e-05,
      "loss": 1.5934,
      "num_input_tokens_seen": 22181290320,
      "step": 28193
    },
    {
      "epoch": 2.9910884786760024,
      "grad_norm": 0.4556507909703841,
      "learning_rate": 4.275612115917596e-05,
      "loss": 1.6436,
      "num_input_tokens_seen": 22182077040,
      "step": 28194
    },
    {
      "epoch": 2.991194568215574,
      "grad_norm": 0.39266731306332475,
      "learning_rate": 4.2755631925728765e-05,
      "loss": 1.5824,
      "num_input_tokens_seen": 22182863792,
      "step": 28195
    },
    {
      "epoch": 2.9913006577551453,
      "grad_norm": 0.534358198434389,
      "learning_rate": 4.2755142678560535e-05,
      "loss": 1.5787,
      "num_input_tokens_seen": 22183650528,
      "step": 28196
    },
    {
      "epoch": 2.991406747294717,
      "grad_norm": 0.49418207979785295,
      "learning_rate": 4.275465341767164e-05,
      "loss": 1.5996,
      "num_input_tokens_seen": 22184437296,
      "step": 28197
    },
    {
      "epoch": 2.9915128368342883,
      "grad_norm": 0.3678229700276374,
      "learning_rate": 4.275416414306248e-05,
      "loss": 1.4084,
      "num_input_tokens_seen": 22185224160,
      "step": 28198
    },
    {
      "epoch": 2.9916189263738593,
      "grad_norm": 0.4726184633737841,
      "learning_rate": 4.2753674854733425e-05,
      "loss": 1.6886,
      "num_input_tokens_seen": 22186010992,
      "step": 28199
    },
    {
      "epoch": 2.991725015913431,
      "grad_norm": 0.47086208053428014,
      "learning_rate": 4.2753185552684846e-05,
      "loss": 1.566,
      "num_input_tokens_seen": 22186797664,
      "step": 28200
    },
    {
      "epoch": 2.9918311054530022,
      "grad_norm": 0.35922246589046464,
      "learning_rate": 4.2752696236917125e-05,
      "loss": 1.5472,
      "num_input_tokens_seen": 22187584464,
      "step": 28201
    },
    {
      "epoch": 2.9919371949925737,
      "grad_norm": 0.37642362343664526,
      "learning_rate": 4.275220690743064e-05,
      "loss": 1.5989,
      "num_input_tokens_seen": 22188371344,
      "step": 28202
    },
    {
      "epoch": 2.992043284532145,
      "grad_norm": 0.527226431975809,
      "learning_rate": 4.275171756422578e-05,
      "loss": 1.6212,
      "num_input_tokens_seen": 22189158112,
      "step": 28203
    },
    {
      "epoch": 2.9921493740717167,
      "grad_norm": 0.4403966246047557,
      "learning_rate": 4.27512282073029e-05,
      "loss": 1.5208,
      "num_input_tokens_seen": 22189944896,
      "step": 28204
    },
    {
      "epoch": 2.992255463611288,
      "grad_norm": 0.47004176984344936,
      "learning_rate": 4.27507388366624e-05,
      "loss": 1.6894,
      "num_input_tokens_seen": 22190731680,
      "step": 28205
    },
    {
      "epoch": 2.992361553150859,
      "grad_norm": 0.42961216939117475,
      "learning_rate": 4.275024945230465e-05,
      "loss": 1.4674,
      "num_input_tokens_seen": 22191518464,
      "step": 28206
    },
    {
      "epoch": 2.9924676426904306,
      "grad_norm": 0.39780328825484973,
      "learning_rate": 4.274976005423002e-05,
      "loss": 1.5453,
      "num_input_tokens_seen": 22192305184,
      "step": 28207
    },
    {
      "epoch": 2.992573732230002,
      "grad_norm": 0.401432064756872,
      "learning_rate": 4.274927064243891e-05,
      "loss": 1.5683,
      "num_input_tokens_seen": 22193091952,
      "step": 28208
    },
    {
      "epoch": 2.9926798217695736,
      "grad_norm": 0.3686823223025502,
      "learning_rate": 4.274878121693168e-05,
      "loss": 1.5564,
      "num_input_tokens_seen": 22193878752,
      "step": 28209
    },
    {
      "epoch": 2.992785911309145,
      "grad_norm": 0.4630252389074821,
      "learning_rate": 4.27482917777087e-05,
      "loss": 1.5556,
      "num_input_tokens_seen": 22194665504,
      "step": 28210
    },
    {
      "epoch": 2.992892000848716,
      "grad_norm": 0.3940866628651114,
      "learning_rate": 4.274780232477038e-05,
      "loss": 1.6286,
      "num_input_tokens_seen": 22195452256,
      "step": 28211
    },
    {
      "epoch": 2.9929980903882876,
      "grad_norm": 0.518224624738651,
      "learning_rate": 4.274731285811707e-05,
      "loss": 1.622,
      "num_input_tokens_seen": 22196239008,
      "step": 28212
    },
    {
      "epoch": 2.993104179927859,
      "grad_norm": 0.3946276746425608,
      "learning_rate": 4.2746823377749154e-05,
      "loss": 1.6654,
      "num_input_tokens_seen": 22197025840,
      "step": 28213
    },
    {
      "epoch": 2.9932102694674305,
      "grad_norm": 0.37144009809537054,
      "learning_rate": 4.274633388366702e-05,
      "loss": 1.5514,
      "num_input_tokens_seen": 22197812656,
      "step": 28214
    },
    {
      "epoch": 2.993316359007002,
      "grad_norm": 0.35956691894095094,
      "learning_rate": 4.274584437587103e-05,
      "loss": 1.4753,
      "num_input_tokens_seen": 22198599440,
      "step": 28215
    },
    {
      "epoch": 2.9934224485465735,
      "grad_norm": 0.41690555792523626,
      "learning_rate": 4.2745354854361585e-05,
      "loss": 1.5999,
      "num_input_tokens_seen": 22199386096,
      "step": 28216
    },
    {
      "epoch": 2.993528538086145,
      "grad_norm": 0.4471540161539557,
      "learning_rate": 4.2744865319139045e-05,
      "loss": 1.663,
      "num_input_tokens_seen": 22200172784,
      "step": 28217
    },
    {
      "epoch": 2.993634627625716,
      "grad_norm": 0.37794976765626953,
      "learning_rate": 4.2744375770203795e-05,
      "loss": 1.5477,
      "num_input_tokens_seen": 22200959632,
      "step": 28218
    },
    {
      "epoch": 2.9937407171652874,
      "grad_norm": 0.4393164531834796,
      "learning_rate": 4.2743886207556205e-05,
      "loss": 1.6507,
      "num_input_tokens_seen": 22201746352,
      "step": 28219
    },
    {
      "epoch": 2.993846806704859,
      "grad_norm": 0.3812892007539593,
      "learning_rate": 4.2743396631196664e-05,
      "loss": 1.5665,
      "num_input_tokens_seen": 22202533168,
      "step": 28220
    },
    {
      "epoch": 2.9939528962444304,
      "grad_norm": 0.36295121519389023,
      "learning_rate": 4.274290704112555e-05,
      "loss": 1.6046,
      "num_input_tokens_seen": 22203319888,
      "step": 28221
    },
    {
      "epoch": 2.994058985784002,
      "grad_norm": 0.5064672180554106,
      "learning_rate": 4.274241743734324e-05,
      "loss": 1.5772,
      "num_input_tokens_seen": 22204106608,
      "step": 28222
    },
    {
      "epoch": 2.994165075323573,
      "grad_norm": 0.38137372279370996,
      "learning_rate": 4.27419278198501e-05,
      "loss": 1.5017,
      "num_input_tokens_seen": 22204893424,
      "step": 28223
    },
    {
      "epoch": 2.9942711648631444,
      "grad_norm": 0.5030886553072337,
      "learning_rate": 4.274143818864653e-05,
      "loss": 1.5943,
      "num_input_tokens_seen": 22205680176,
      "step": 28224
    },
    {
      "epoch": 2.994377254402716,
      "grad_norm": 0.3666419281482287,
      "learning_rate": 4.274094854373289e-05,
      "loss": 1.6015,
      "num_input_tokens_seen": 22206466832,
      "step": 28225
    },
    {
      "epoch": 2.9944833439422873,
      "grad_norm": 0.3735541300530097,
      "learning_rate": 4.274045888510957e-05,
      "loss": 1.4327,
      "num_input_tokens_seen": 22207253696,
      "step": 28226
    },
    {
      "epoch": 2.994589433481859,
      "grad_norm": 0.5182385197703927,
      "learning_rate": 4.273996921277694e-05,
      "loss": 1.4859,
      "num_input_tokens_seen": 22208040496,
      "step": 28227
    },
    {
      "epoch": 2.99469552302143,
      "grad_norm": 0.44726562029191885,
      "learning_rate": 4.273947952673538e-05,
      "loss": 1.5451,
      "num_input_tokens_seen": 22208827296,
      "step": 28228
    },
    {
      "epoch": 2.9948016125610017,
      "grad_norm": 0.6101633822954015,
      "learning_rate": 4.273898982698528e-05,
      "loss": 1.5931,
      "num_input_tokens_seen": 22209614160,
      "step": 28229
    },
    {
      "epoch": 2.9949077021005728,
      "grad_norm": 0.5724214754020395,
      "learning_rate": 4.2738500113527003e-05,
      "loss": 1.5607,
      "num_input_tokens_seen": 22210400864,
      "step": 28230
    },
    {
      "epoch": 2.9950137916401443,
      "grad_norm": 0.5502533368218132,
      "learning_rate": 4.273801038636094e-05,
      "loss": 1.6741,
      "num_input_tokens_seen": 22211187600,
      "step": 28231
    },
    {
      "epoch": 2.9951198811797157,
      "grad_norm": 0.41950495953617734,
      "learning_rate": 4.273752064548745e-05,
      "loss": 1.4924,
      "num_input_tokens_seen": 22211974336,
      "step": 28232
    },
    {
      "epoch": 2.995225970719287,
      "grad_norm": 0.47564492365087635,
      "learning_rate": 4.273703089090694e-05,
      "loss": 1.5888,
      "num_input_tokens_seen": 22212761120,
      "step": 28233
    },
    {
      "epoch": 2.9953320602588587,
      "grad_norm": 0.4498240049571088,
      "learning_rate": 4.273654112261977e-05,
      "loss": 1.6522,
      "num_input_tokens_seen": 22213547824,
      "step": 28234
    },
    {
      "epoch": 2.9954381497984297,
      "grad_norm": 0.39299093540281704,
      "learning_rate": 4.273605134062631e-05,
      "loss": 1.5667,
      "num_input_tokens_seen": 22214334656,
      "step": 28235
    },
    {
      "epoch": 2.995544239338001,
      "grad_norm": 0.4669699972806904,
      "learning_rate": 4.2735561544926955e-05,
      "loss": 1.7315,
      "num_input_tokens_seen": 22215121360,
      "step": 28236
    },
    {
      "epoch": 2.9956503288775727,
      "grad_norm": 0.36306874843180226,
      "learning_rate": 4.273507173552208e-05,
      "loss": 1.6038,
      "num_input_tokens_seen": 22215908080,
      "step": 28237
    },
    {
      "epoch": 2.995756418417144,
      "grad_norm": 0.37565823779693763,
      "learning_rate": 4.273458191241206e-05,
      "loss": 1.5877,
      "num_input_tokens_seen": 22216694864,
      "step": 28238
    },
    {
      "epoch": 2.9958625079567156,
      "grad_norm": 0.3997941018868025,
      "learning_rate": 4.273409207559728e-05,
      "loss": 1.5894,
      "num_input_tokens_seen": 22217481616,
      "step": 28239
    },
    {
      "epoch": 2.9959685974962866,
      "grad_norm": 0.38548867255921904,
      "learning_rate": 4.2733602225078114e-05,
      "loss": 1.5134,
      "num_input_tokens_seen": 22218268400,
      "step": 28240
    },
    {
      "epoch": 2.996074687035858,
      "grad_norm": 0.4087978241659296,
      "learning_rate": 4.273311236085493e-05,
      "loss": 1.5669,
      "num_input_tokens_seen": 22219055200,
      "step": 28241
    },
    {
      "epoch": 2.9961807765754296,
      "grad_norm": 0.37841065243361555,
      "learning_rate": 4.273262248292813e-05,
      "loss": 1.5594,
      "num_input_tokens_seen": 22219842016,
      "step": 28242
    },
    {
      "epoch": 2.996286866115001,
      "grad_norm": 0.4243929116212661,
      "learning_rate": 4.273213259129807e-05,
      "loss": 1.4749,
      "num_input_tokens_seen": 22220628768,
      "step": 28243
    },
    {
      "epoch": 2.9963929556545725,
      "grad_norm": 0.3448933270648687,
      "learning_rate": 4.273164268596515e-05,
      "loss": 1.5149,
      "num_input_tokens_seen": 22221415552,
      "step": 28244
    },
    {
      "epoch": 2.996499045194144,
      "grad_norm": 0.37671112503456,
      "learning_rate": 4.273115276692973e-05,
      "loss": 1.6895,
      "num_input_tokens_seen": 22222202288,
      "step": 28245
    },
    {
      "epoch": 2.9966051347337155,
      "grad_norm": 0.4138599108332149,
      "learning_rate": 4.2730662834192196e-05,
      "loss": 1.5887,
      "num_input_tokens_seen": 22222989072,
      "step": 28246
    },
    {
      "epoch": 2.9967112242732865,
      "grad_norm": 0.3501970892620455,
      "learning_rate": 4.273017288775292e-05,
      "loss": 1.695,
      "num_input_tokens_seen": 22223775888,
      "step": 28247
    },
    {
      "epoch": 2.996817313812858,
      "grad_norm": 0.36198738910779077,
      "learning_rate": 4.272968292761229e-05,
      "loss": 1.5217,
      "num_input_tokens_seen": 22224562672,
      "step": 28248
    },
    {
      "epoch": 2.9969234033524295,
      "grad_norm": 0.35545657594981417,
      "learning_rate": 4.272919295377069e-05,
      "loss": 1.5498,
      "num_input_tokens_seen": 22225349472,
      "step": 28249
    },
    {
      "epoch": 2.997029492892001,
      "grad_norm": 0.3205908881247463,
      "learning_rate": 4.272870296622848e-05,
      "loss": 1.4526,
      "num_input_tokens_seen": 22226136208,
      "step": 28250
    },
    {
      "epoch": 2.9971355824315724,
      "grad_norm": 0.3449246697759026,
      "learning_rate": 4.2728212964986054e-05,
      "loss": 1.4426,
      "num_input_tokens_seen": 22226922976,
      "step": 28251
    },
    {
      "epoch": 2.9972416719711434,
      "grad_norm": 0.4702716177382626,
      "learning_rate": 4.272772295004378e-05,
      "loss": 1.5368,
      "num_input_tokens_seen": 22227709792,
      "step": 28252
    },
    {
      "epoch": 2.997347761510715,
      "grad_norm": 0.3612536490002631,
      "learning_rate": 4.272723292140205e-05,
      "loss": 1.5885,
      "num_input_tokens_seen": 22228496560,
      "step": 28253
    },
    {
      "epoch": 2.9974538510502864,
      "grad_norm": 0.44893259078450515,
      "learning_rate": 4.272674287906122e-05,
      "loss": 1.5818,
      "num_input_tokens_seen": 22229283312,
      "step": 28254
    },
    {
      "epoch": 2.997559940589858,
      "grad_norm": 0.46474571895866923,
      "learning_rate": 4.27262528230217e-05,
      "loss": 1.5932,
      "num_input_tokens_seen": 22230070048,
      "step": 28255
    },
    {
      "epoch": 2.9976660301294293,
      "grad_norm": 0.5797371680371541,
      "learning_rate": 4.2725762753283835e-05,
      "loss": 1.5462,
      "num_input_tokens_seen": 22230856880,
      "step": 28256
    },
    {
      "epoch": 2.9977721196690004,
      "grad_norm": 0.43290641290753795,
      "learning_rate": 4.272527266984804e-05,
      "loss": 1.6478,
      "num_input_tokens_seen": 22231643680,
      "step": 28257
    },
    {
      "epoch": 2.9978782092085723,
      "grad_norm": 0.4039311976770569,
      "learning_rate": 4.272478257271466e-05,
      "loss": 1.4763,
      "num_input_tokens_seen": 22232430496,
      "step": 28258
    },
    {
      "epoch": 2.9979842987481433,
      "grad_norm": 0.6587434121299668,
      "learning_rate": 4.272429246188409e-05,
      "loss": 1.6029,
      "num_input_tokens_seen": 22233217296,
      "step": 28259
    },
    {
      "epoch": 2.998090388287715,
      "grad_norm": 0.3771159628252549,
      "learning_rate": 4.2723802337356714e-05,
      "loss": 1.4955,
      "num_input_tokens_seen": 22234004112,
      "step": 28260
    },
    {
      "epoch": 2.9981964778272863,
      "grad_norm": 0.605178033052878,
      "learning_rate": 4.2723312199132897e-05,
      "loss": 1.6163,
      "num_input_tokens_seen": 22234790960,
      "step": 28261
    },
    {
      "epoch": 2.9983025673668577,
      "grad_norm": 0.4544918817827187,
      "learning_rate": 4.272282204721303e-05,
      "loss": 1.6313,
      "num_input_tokens_seen": 22235577760,
      "step": 28262
    },
    {
      "epoch": 2.998408656906429,
      "grad_norm": 0.47559249762814243,
      "learning_rate": 4.2722331881597476e-05,
      "loss": 1.4334,
      "num_input_tokens_seen": 22236364544,
      "step": 28263
    },
    {
      "epoch": 2.9985147464460002,
      "grad_norm": 0.5506920940721188,
      "learning_rate": 4.272184170228664e-05,
      "loss": 1.5688,
      "num_input_tokens_seen": 22237151232,
      "step": 28264
    },
    {
      "epoch": 2.9986208359855717,
      "grad_norm": 0.4085218571260773,
      "learning_rate": 4.272135150928087e-05,
      "loss": 1.5464,
      "num_input_tokens_seen": 22237938112,
      "step": 28265
    },
    {
      "epoch": 2.998726925525143,
      "grad_norm": 0.41929057050729296,
      "learning_rate": 4.2720861302580565e-05,
      "loss": 1.5995,
      "num_input_tokens_seen": 22238724928,
      "step": 28266
    },
    {
      "epoch": 2.9988330150647147,
      "grad_norm": 0.460675804978055,
      "learning_rate": 4.2720371082186095e-05,
      "loss": 1.6389,
      "num_input_tokens_seen": 22239511744,
      "step": 28267
    },
    {
      "epoch": 2.998939104604286,
      "grad_norm": 0.39525971646344815,
      "learning_rate": 4.2719880848097847e-05,
      "loss": 1.5266,
      "num_input_tokens_seen": 22240298528,
      "step": 28268
    },
    {
      "epoch": 2.999045194143857,
      "grad_norm": 0.5350188999617252,
      "learning_rate": 4.271939060031619e-05,
      "loss": 1.5486,
      "num_input_tokens_seen": 22241085344,
      "step": 28269
    },
    {
      "epoch": 2.9991512836834286,
      "grad_norm": 0.37816780207145767,
      "learning_rate": 4.271890033884152e-05,
      "loss": 1.5366,
      "num_input_tokens_seen": 22241872160,
      "step": 28270
    },
    {
      "epoch": 2.999257373223,
      "grad_norm": 0.4250269713511335,
      "learning_rate": 4.2718410063674185e-05,
      "loss": 1.4971,
      "num_input_tokens_seen": 22242658976,
      "step": 28271
    },
    {
      "epoch": 2.9993634627625716,
      "grad_norm": 0.4013678443283118,
      "learning_rate": 4.27179197748146e-05,
      "loss": 1.6182,
      "num_input_tokens_seen": 22243445760,
      "step": 28272
    },
    {
      "epoch": 2.999469552302143,
      "grad_norm": 0.46743939964807746,
      "learning_rate": 4.2717429472263116e-05,
      "loss": 1.533,
      "num_input_tokens_seen": 22244232576,
      "step": 28273
    },
    {
      "epoch": 2.9995756418417145,
      "grad_norm": 0.42954166130028126,
      "learning_rate": 4.271693915602012e-05,
      "loss": 1.6057,
      "num_input_tokens_seen": 22245019232,
      "step": 28274
    },
    {
      "epoch": 2.999681731381286,
      "grad_norm": 0.4369169425221547,
      "learning_rate": 4.2716448826086e-05,
      "loss": 1.5476,
      "num_input_tokens_seen": 22245805920,
      "step": 28275
    },
    {
      "epoch": 2.999787820920857,
      "grad_norm": 0.379791043566523,
      "learning_rate": 4.2715958482461124e-05,
      "loss": 1.4919,
      "num_input_tokens_seen": 22246592704,
      "step": 28276
    },
    {
      "epoch": 2.9998939104604285,
      "grad_norm": 0.4238323535607863,
      "learning_rate": 4.271546812514588e-05,
      "loss": 1.5287,
      "num_input_tokens_seen": 22247379408,
      "step": 28277
    },
    {
      "epoch": 3.0,
      "grad_norm": 0.36997333230838314,
      "learning_rate": 4.271497775414064e-05,
      "loss": 1.6051,
      "num_input_tokens_seen": 22248166192,
      "step": 28278
    },
    {
      "epoch": 3.0001060895395715,
      "grad_norm": 0.46496157357751644,
      "learning_rate": 4.271448736944579e-05,
      "loss": 1.3476,
      "num_input_tokens_seen": 22248953008,
      "step": 28279
    },
    {
      "epoch": 3.000212179079143,
      "grad_norm": 0.4688760087150703,
      "learning_rate": 4.27139969710617e-05,
      "loss": 1.509,
      "num_input_tokens_seen": 22249739744,
      "step": 28280
    },
    {
      "epoch": 3.000318268618714,
      "grad_norm": 0.5742366763614851,
      "learning_rate": 4.271350655898875e-05,
      "loss": 1.4084,
      "num_input_tokens_seen": 22250526512,
      "step": 28281
    },
    {
      "epoch": 3.0004243581582855,
      "grad_norm": 0.5527412203536843,
      "learning_rate": 4.271301613322732e-05,
      "loss": 1.4938,
      "num_input_tokens_seen": 22251313392,
      "step": 28282
    },
    {
      "epoch": 3.000530447697857,
      "grad_norm": 0.5271529233139828,
      "learning_rate": 4.2712525693777795e-05,
      "loss": 1.3996,
      "num_input_tokens_seen": 22252100160,
      "step": 28283
    },
    {
      "epoch": 3.0006365372374284,
      "grad_norm": 0.5309455023769414,
      "learning_rate": 4.2712035240640545e-05,
      "loss": 1.3654,
      "num_input_tokens_seen": 22252886928,
      "step": 28284
    },
    {
      "epoch": 3.000742626777,
      "grad_norm": 0.5624991496207189,
      "learning_rate": 4.271154477381596e-05,
      "loss": 1.4434,
      "num_input_tokens_seen": 22253673584,
      "step": 28285
    },
    {
      "epoch": 3.0008487163165714,
      "grad_norm": 0.6513657100124731,
      "learning_rate": 4.271105429330441e-05,
      "loss": 1.4747,
      "num_input_tokens_seen": 22254460352,
      "step": 28286
    },
    {
      "epoch": 3.0009548058561424,
      "grad_norm": 0.4781041395409205,
      "learning_rate": 4.271056379910628e-05,
      "loss": 1.4239,
      "num_input_tokens_seen": 22255247152,
      "step": 28287
    },
    {
      "epoch": 3.001060895395714,
      "grad_norm": 0.6781282791939559,
      "learning_rate": 4.2710073291221944e-05,
      "loss": 1.4231,
      "num_input_tokens_seen": 22256033904,
      "step": 28288
    },
    {
      "epoch": 3.0011669849352853,
      "grad_norm": 0.6905846922902078,
      "learning_rate": 4.270958276965178e-05,
      "loss": 1.5628,
      "num_input_tokens_seen": 22256820704,
      "step": 28289
    },
    {
      "epoch": 3.001273074474857,
      "grad_norm": 1.2408543837497308,
      "learning_rate": 4.2709092234396174e-05,
      "loss": 1.4247,
      "num_input_tokens_seen": 22257607408,
      "step": 28290
    },
    {
      "epoch": 3.0013791640144283,
      "grad_norm": 0.6964258742484731,
      "learning_rate": 4.27086016854555e-05,
      "loss": 1.5606,
      "num_input_tokens_seen": 22258394240,
      "step": 28291
    },
    {
      "epoch": 3.0014852535539998,
      "grad_norm": 0.9151987727129383,
      "learning_rate": 4.270811112283014e-05,
      "loss": 1.3954,
      "num_input_tokens_seen": 22259180912,
      "step": 28292
    },
    {
      "epoch": 3.001591343093571,
      "grad_norm": 0.6978595848323825,
      "learning_rate": 4.270762054652046e-05,
      "loss": 1.4272,
      "num_input_tokens_seen": 22259967712,
      "step": 28293
    },
    {
      "epoch": 3.0016974326331423,
      "grad_norm": 0.6262719942003687,
      "learning_rate": 4.270712995652687e-05,
      "loss": 1.4448,
      "num_input_tokens_seen": 22260754464,
      "step": 28294
    },
    {
      "epoch": 3.0018035221727137,
      "grad_norm": 0.7706982015766092,
      "learning_rate": 4.270663935284972e-05,
      "loss": 1.362,
      "num_input_tokens_seen": 22261541248,
      "step": 28295
    },
    {
      "epoch": 3.001909611712285,
      "grad_norm": 0.5446243824568058,
      "learning_rate": 4.270614873548939e-05,
      "loss": 1.5283,
      "num_input_tokens_seen": 22262327984,
      "step": 28296
    },
    {
      "epoch": 3.0020157012518567,
      "grad_norm": 1.0236454535070725,
      "learning_rate": 4.2705658104446276e-05,
      "loss": 1.4753,
      "num_input_tokens_seen": 22263114736,
      "step": 28297
    },
    {
      "epoch": 3.002121790791428,
      "grad_norm": 0.6389755169709301,
      "learning_rate": 4.270516745972075e-05,
      "loss": 1.5896,
      "num_input_tokens_seen": 22263901520,
      "step": 28298
    },
    {
      "epoch": 3.002227880330999,
      "grad_norm": 0.5554285267162867,
      "learning_rate": 4.270467680131319e-05,
      "loss": 1.3767,
      "num_input_tokens_seen": 22264688288,
      "step": 28299
    },
    {
      "epoch": 3.0023339698705707,
      "grad_norm": 0.5346812543323329,
      "learning_rate": 4.2704186129223975e-05,
      "loss": 1.3493,
      "num_input_tokens_seen": 22265475152,
      "step": 28300
    },
    {
      "epoch": 3.002440059410142,
      "grad_norm": 0.530204918920359,
      "learning_rate": 4.270369544345348e-05,
      "loss": 1.3959,
      "num_input_tokens_seen": 22266261920,
      "step": 28301
    },
    {
      "epoch": 3.0025461489497136,
      "grad_norm": 0.5736398001563587,
      "learning_rate": 4.2703204744002095e-05,
      "loss": 1.4291,
      "num_input_tokens_seen": 22267048752,
      "step": 28302
    },
    {
      "epoch": 3.002652238489285,
      "grad_norm": 0.5035823504404515,
      "learning_rate": 4.2702714030870196e-05,
      "loss": 1.4253,
      "num_input_tokens_seen": 22267835520,
      "step": 28303
    },
    {
      "epoch": 3.0027583280288566,
      "grad_norm": 0.6140840257635035,
      "learning_rate": 4.270222330405815e-05,
      "loss": 1.5569,
      "num_input_tokens_seen": 22268622384,
      "step": 28304
    },
    {
      "epoch": 3.0028644175684276,
      "grad_norm": 0.4468370998137424,
      "learning_rate": 4.2701732563566343e-05,
      "loss": 1.4366,
      "num_input_tokens_seen": 22269409216,
      "step": 28305
    },
    {
      "epoch": 3.002970507107999,
      "grad_norm": 0.5314055584621331,
      "learning_rate": 4.270124180939516e-05,
      "loss": 1.4908,
      "num_input_tokens_seen": 22270196048,
      "step": 28306
    },
    {
      "epoch": 3.0030765966475705,
      "grad_norm": 0.552024005063355,
      "learning_rate": 4.270075104154498e-05,
      "loss": 1.4836,
      "num_input_tokens_seen": 22270982832,
      "step": 28307
    },
    {
      "epoch": 3.003182686187142,
      "grad_norm": 0.5204809061445037,
      "learning_rate": 4.270026026001618e-05,
      "loss": 1.4638,
      "num_input_tokens_seen": 22271769632,
      "step": 28308
    },
    {
      "epoch": 3.0032887757267135,
      "grad_norm": 0.5865888815829418,
      "learning_rate": 4.2699769464809136e-05,
      "loss": 1.5028,
      "num_input_tokens_seen": 22272556304,
      "step": 28309
    },
    {
      "epoch": 3.003394865266285,
      "grad_norm": 0.4616261144889807,
      "learning_rate": 4.2699278655924235e-05,
      "loss": 1.5215,
      "num_input_tokens_seen": 22273343088,
      "step": 28310
    },
    {
      "epoch": 3.003500954805856,
      "grad_norm": 0.4257779441682229,
      "learning_rate": 4.269878783336184e-05,
      "loss": 1.3086,
      "num_input_tokens_seen": 22274129888,
      "step": 28311
    },
    {
      "epoch": 3.0036070443454275,
      "grad_norm": 0.5560408250480533,
      "learning_rate": 4.269829699712235e-05,
      "loss": 1.4107,
      "num_input_tokens_seen": 22274916720,
      "step": 28312
    },
    {
      "epoch": 3.003713133884999,
      "grad_norm": 0.5637196944095219,
      "learning_rate": 4.269780614720613e-05,
      "loss": 1.4636,
      "num_input_tokens_seen": 22275703456,
      "step": 28313
    },
    {
      "epoch": 3.0038192234245704,
      "grad_norm": 1.0478357588486846,
      "learning_rate": 4.269731528361356e-05,
      "loss": 1.5581,
      "num_input_tokens_seen": 22276490240,
      "step": 28314
    },
    {
      "epoch": 3.003925312964142,
      "grad_norm": 0.44507075548909647,
      "learning_rate": 4.2696824406345035e-05,
      "loss": 1.3755,
      "num_input_tokens_seen": 22277277072,
      "step": 28315
    },
    {
      "epoch": 3.004031402503713,
      "grad_norm": 0.5959398811386967,
      "learning_rate": 4.2696333515400924e-05,
      "loss": 1.3284,
      "num_input_tokens_seen": 22278063872,
      "step": 28316
    },
    {
      "epoch": 3.0041374920432844,
      "grad_norm": 0.5599375717112758,
      "learning_rate": 4.2695842610781594e-05,
      "loss": 1.6017,
      "num_input_tokens_seen": 22278850624,
      "step": 28317
    },
    {
      "epoch": 3.004243581582856,
      "grad_norm": 0.4807546356632136,
      "learning_rate": 4.269535169248744e-05,
      "loss": 1.4984,
      "num_input_tokens_seen": 22279637360,
      "step": 28318
    },
    {
      "epoch": 3.0043496711224273,
      "grad_norm": 0.5319898988765315,
      "learning_rate": 4.269486076051884e-05,
      "loss": 1.3755,
      "num_input_tokens_seen": 22280424112,
      "step": 28319
    },
    {
      "epoch": 3.004455760661999,
      "grad_norm": 0.543519710455217,
      "learning_rate": 4.269436981487617e-05,
      "loss": 1.3813,
      "num_input_tokens_seen": 22281210880,
      "step": 28320
    },
    {
      "epoch": 3.0045618502015703,
      "grad_norm": 0.4381682895100303,
      "learning_rate": 4.269387885555981e-05,
      "loss": 1.4181,
      "num_input_tokens_seen": 22281997632,
      "step": 28321
    },
    {
      "epoch": 3.0046679397411413,
      "grad_norm": 0.4365136211399638,
      "learning_rate": 4.2693387882570145e-05,
      "loss": 1.4247,
      "num_input_tokens_seen": 22282784432,
      "step": 28322
    },
    {
      "epoch": 3.004774029280713,
      "grad_norm": 0.49299406771972526,
      "learning_rate": 4.269289689590754e-05,
      "loss": 1.4119,
      "num_input_tokens_seen": 22283571200,
      "step": 28323
    },
    {
      "epoch": 3.0048801188202843,
      "grad_norm": 0.4460738156688239,
      "learning_rate": 4.269240589557239e-05,
      "loss": 1.3898,
      "num_input_tokens_seen": 22284357968,
      "step": 28324
    },
    {
      "epoch": 3.0049862083598557,
      "grad_norm": 0.45910177397440577,
      "learning_rate": 4.2691914881565066e-05,
      "loss": 1.5717,
      "num_input_tokens_seen": 22285144688,
      "step": 28325
    },
    {
      "epoch": 3.0050922978994272,
      "grad_norm": 0.46854274555176995,
      "learning_rate": 4.269142385388595e-05,
      "loss": 1.5112,
      "num_input_tokens_seen": 22285931456,
      "step": 28326
    },
    {
      "epoch": 3.0051983874389987,
      "grad_norm": 0.40963646368701295,
      "learning_rate": 4.2690932812535425e-05,
      "loss": 1.4262,
      "num_input_tokens_seen": 22286718336,
      "step": 28327
    },
    {
      "epoch": 3.0053044769785697,
      "grad_norm": 0.4378054287892018,
      "learning_rate": 4.2690441757513856e-05,
      "loss": 1.4259,
      "num_input_tokens_seen": 22287505104,
      "step": 28328
    },
    {
      "epoch": 3.005410566518141,
      "grad_norm": 0.5652249230202347,
      "learning_rate": 4.2689950688821636e-05,
      "loss": 1.3864,
      "num_input_tokens_seen": 22288291824,
      "step": 28329
    },
    {
      "epoch": 3.0055166560577127,
      "grad_norm": 0.5143911779368375,
      "learning_rate": 4.2689459606459144e-05,
      "loss": 1.4656,
      "num_input_tokens_seen": 22289078720,
      "step": 28330
    },
    {
      "epoch": 3.005622745597284,
      "grad_norm": 0.49692901827644104,
      "learning_rate": 4.268896851042675e-05,
      "loss": 1.3122,
      "num_input_tokens_seen": 22289865456,
      "step": 28331
    },
    {
      "epoch": 3.0057288351368556,
      "grad_norm": 0.48481435904592135,
      "learning_rate": 4.268847740072485e-05,
      "loss": 1.4301,
      "num_input_tokens_seen": 22290652208,
      "step": 28332
    },
    {
      "epoch": 3.005834924676427,
      "grad_norm": 0.4875245074064199,
      "learning_rate": 4.268798627735381e-05,
      "loss": 1.4747,
      "num_input_tokens_seen": 22291439040,
      "step": 28333
    },
    {
      "epoch": 3.005941014215998,
      "grad_norm": 0.4739979638081542,
      "learning_rate": 4.268749514031401e-05,
      "loss": 1.5116,
      "num_input_tokens_seen": 22292225760,
      "step": 28334
    },
    {
      "epoch": 3.0060471037555696,
      "grad_norm": 0.45248012792613695,
      "learning_rate": 4.268700398960583e-05,
      "loss": 1.4084,
      "num_input_tokens_seen": 22293012544,
      "step": 28335
    },
    {
      "epoch": 3.006153193295141,
      "grad_norm": 0.5382376571656198,
      "learning_rate": 4.268651282522966e-05,
      "loss": 1.5348,
      "num_input_tokens_seen": 22293799296,
      "step": 28336
    },
    {
      "epoch": 3.0062592828347126,
      "grad_norm": 0.4715419657924561,
      "learning_rate": 4.268602164718587e-05,
      "loss": 1.5694,
      "num_input_tokens_seen": 22294586032,
      "step": 28337
    },
    {
      "epoch": 3.006365372374284,
      "grad_norm": 0.46596680754833203,
      "learning_rate": 4.268553045547484e-05,
      "loss": 1.5478,
      "num_input_tokens_seen": 22295372672,
      "step": 28338
    },
    {
      "epoch": 3.0064714619138555,
      "grad_norm": 0.3735266421435883,
      "learning_rate": 4.2685039250096956e-05,
      "loss": 1.3823,
      "num_input_tokens_seen": 22296159472,
      "step": 28339
    },
    {
      "epoch": 3.0065775514534265,
      "grad_norm": 0.4580267228955047,
      "learning_rate": 4.2684548031052586e-05,
      "loss": 1.3938,
      "num_input_tokens_seen": 22296946304,
      "step": 28340
    },
    {
      "epoch": 3.006683640992998,
      "grad_norm": 0.5266918425058311,
      "learning_rate": 4.268405679834212e-05,
      "loss": 1.4927,
      "num_input_tokens_seen": 22297733200,
      "step": 28341
    },
    {
      "epoch": 3.0067897305325695,
      "grad_norm": 0.46772229250284963,
      "learning_rate": 4.2683565551965933e-05,
      "loss": 1.438,
      "num_input_tokens_seen": 22298520048,
      "step": 28342
    },
    {
      "epoch": 3.006895820072141,
      "grad_norm": 0.4604091660717721,
      "learning_rate": 4.26830742919244e-05,
      "loss": 1.4861,
      "num_input_tokens_seen": 22299306784,
      "step": 28343
    },
    {
      "epoch": 3.0070019096117124,
      "grad_norm": 0.41512268572503297,
      "learning_rate": 4.2682583018217914e-05,
      "loss": 1.459,
      "num_input_tokens_seen": 22300093568,
      "step": 28344
    },
    {
      "epoch": 3.007107999151284,
      "grad_norm": 0.5172557836966653,
      "learning_rate": 4.268209173084684e-05,
      "loss": 1.5865,
      "num_input_tokens_seen": 22300880384,
      "step": 28345
    },
    {
      "epoch": 3.007214088690855,
      "grad_norm": 0.5156268762439836,
      "learning_rate": 4.268160042981157e-05,
      "loss": 1.5061,
      "num_input_tokens_seen": 22301667168,
      "step": 28346
    },
    {
      "epoch": 3.0073201782304264,
      "grad_norm": 0.6148555856939135,
      "learning_rate": 4.2681109115112474e-05,
      "loss": 1.468,
      "num_input_tokens_seen": 22302453936,
      "step": 28347
    },
    {
      "epoch": 3.007426267769998,
      "grad_norm": 0.3859356632555212,
      "learning_rate": 4.268061778674993e-05,
      "loss": 1.4443,
      "num_input_tokens_seen": 22303240656,
      "step": 28348
    },
    {
      "epoch": 3.0075323573095694,
      "grad_norm": 0.534529709928419,
      "learning_rate": 4.268012644472434e-05,
      "loss": 1.5513,
      "num_input_tokens_seen": 22304027280,
      "step": 28349
    },
    {
      "epoch": 3.007638446849141,
      "grad_norm": 0.4380662633267012,
      "learning_rate": 4.267963508903605e-05,
      "loss": 1.4858,
      "num_input_tokens_seen": 22304814016,
      "step": 28350
    },
    {
      "epoch": 3.007744536388712,
      "grad_norm": 0.44251224868519334,
      "learning_rate": 4.267914371968547e-05,
      "loss": 1.428,
      "num_input_tokens_seen": 22305600832,
      "step": 28351
    },
    {
      "epoch": 3.0078506259282833,
      "grad_norm": 0.4431212533747307,
      "learning_rate": 4.267865233667296e-05,
      "loss": 1.4597,
      "num_input_tokens_seen": 22306387616,
      "step": 28352
    },
    {
      "epoch": 3.007956715467855,
      "grad_norm": 0.4330688992793762,
      "learning_rate": 4.2678160939998904e-05,
      "loss": 1.4862,
      "num_input_tokens_seen": 22307174384,
      "step": 28353
    },
    {
      "epoch": 3.0080628050074263,
      "grad_norm": 0.4922170646859234,
      "learning_rate": 4.267766952966369e-05,
      "loss": 1.5384,
      "num_input_tokens_seen": 22307961168,
      "step": 28354
    },
    {
      "epoch": 3.0081688945469978,
      "grad_norm": 0.49678890956358635,
      "learning_rate": 4.267717810566769e-05,
      "loss": 1.404,
      "num_input_tokens_seen": 22308748016,
      "step": 28355
    },
    {
      "epoch": 3.0082749840865692,
      "grad_norm": 0.5657231976925923,
      "learning_rate": 4.2676686668011286e-05,
      "loss": 1.4459,
      "num_input_tokens_seen": 22309534752,
      "step": 28356
    },
    {
      "epoch": 3.0083810736261403,
      "grad_norm": 0.47022905716143626,
      "learning_rate": 4.2676195216694856e-05,
      "loss": 1.3763,
      "num_input_tokens_seen": 22310321440,
      "step": 28357
    },
    {
      "epoch": 3.0084871631657117,
      "grad_norm": 0.5766535915320246,
      "learning_rate": 4.267570375171878e-05,
      "loss": 1.4205,
      "num_input_tokens_seen": 22311108160,
      "step": 28358
    },
    {
      "epoch": 3.008593252705283,
      "grad_norm": 0.5333492343646128,
      "learning_rate": 4.267521227308343e-05,
      "loss": 1.3948,
      "num_input_tokens_seen": 22311894816,
      "step": 28359
    },
    {
      "epoch": 3.0086993422448547,
      "grad_norm": 0.48358291514208124,
      "learning_rate": 4.267472078078921e-05,
      "loss": 1.4983,
      "num_input_tokens_seen": 22312681568,
      "step": 28360
    },
    {
      "epoch": 3.008805431784426,
      "grad_norm": 0.44948433889259554,
      "learning_rate": 4.2674229274836474e-05,
      "loss": 1.5463,
      "num_input_tokens_seen": 22313468320,
      "step": 28361
    },
    {
      "epoch": 3.0089115213239976,
      "grad_norm": 0.4340757534524745,
      "learning_rate": 4.267373775522562e-05,
      "loss": 1.4185,
      "num_input_tokens_seen": 22314255040,
      "step": 28362
    },
    {
      "epoch": 3.0090176108635687,
      "grad_norm": 0.4942033101739029,
      "learning_rate": 4.267324622195702e-05,
      "loss": 1.4994,
      "num_input_tokens_seen": 22315041776,
      "step": 28363
    },
    {
      "epoch": 3.00912370040314,
      "grad_norm": 0.48827479741022944,
      "learning_rate": 4.2672754675031045e-05,
      "loss": 1.3653,
      "num_input_tokens_seen": 22315828576,
      "step": 28364
    },
    {
      "epoch": 3.0092297899427116,
      "grad_norm": 0.5620339333772992,
      "learning_rate": 4.267226311444809e-05,
      "loss": 1.5096,
      "num_input_tokens_seen": 22316615280,
      "step": 28365
    },
    {
      "epoch": 3.009335879482283,
      "grad_norm": 0.4565787758282203,
      "learning_rate": 4.2671771540208524e-05,
      "loss": 1.5118,
      "num_input_tokens_seen": 22317402128,
      "step": 28366
    },
    {
      "epoch": 3.0094419690218546,
      "grad_norm": 0.42702427504634244,
      "learning_rate": 4.2671279952312734e-05,
      "loss": 1.503,
      "num_input_tokens_seen": 22318188880,
      "step": 28367
    },
    {
      "epoch": 3.009548058561426,
      "grad_norm": 0.503256502908786,
      "learning_rate": 4.2670788350761106e-05,
      "loss": 1.4074,
      "num_input_tokens_seen": 22318975632,
      "step": 28368
    },
    {
      "epoch": 3.009654148100997,
      "grad_norm": 0.5470634599701434,
      "learning_rate": 4.2670296735554e-05,
      "loss": 1.4033,
      "num_input_tokens_seen": 22319762416,
      "step": 28369
    },
    {
      "epoch": 3.0097602376405685,
      "grad_norm": 0.6568445297342995,
      "learning_rate": 4.266980510669181e-05,
      "loss": 1.4566,
      "num_input_tokens_seen": 22320549152,
      "step": 28370
    },
    {
      "epoch": 3.00986632718014,
      "grad_norm": 0.49824675198961976,
      "learning_rate": 4.266931346417492e-05,
      "loss": 1.3636,
      "num_input_tokens_seen": 22321335872,
      "step": 28371
    },
    {
      "epoch": 3.0099724167197115,
      "grad_norm": 0.5698147108226767,
      "learning_rate": 4.2668821808003686e-05,
      "loss": 1.5291,
      "num_input_tokens_seen": 22322122576,
      "step": 28372
    },
    {
      "epoch": 3.010078506259283,
      "grad_norm": 0.4633389733083115,
      "learning_rate": 4.2668330138178526e-05,
      "loss": 1.371,
      "num_input_tokens_seen": 22322909328,
      "step": 28373
    },
    {
      "epoch": 3.0101845957988544,
      "grad_norm": 0.4308243289155725,
      "learning_rate": 4.2667838454699784e-05,
      "loss": 1.4543,
      "num_input_tokens_seen": 22323695968,
      "step": 28374
    },
    {
      "epoch": 3.0102906853384255,
      "grad_norm": 0.5075561898032009,
      "learning_rate": 4.266734675756786e-05,
      "loss": 1.3558,
      "num_input_tokens_seen": 22324482752,
      "step": 28375
    },
    {
      "epoch": 3.010396774877997,
      "grad_norm": 0.5348871584861739,
      "learning_rate": 4.266685504678313e-05,
      "loss": 1.439,
      "num_input_tokens_seen": 22325269680,
      "step": 28376
    },
    {
      "epoch": 3.0105028644175684,
      "grad_norm": 0.39635434136329173,
      "learning_rate": 4.266636332234597e-05,
      "loss": 1.4365,
      "num_input_tokens_seen": 22326056480,
      "step": 28377
    },
    {
      "epoch": 3.01060895395714,
      "grad_norm": 0.5445614246237235,
      "learning_rate": 4.266587158425676e-05,
      "loss": 1.5918,
      "num_input_tokens_seen": 22326843200,
      "step": 28378
    },
    {
      "epoch": 3.0107150434967114,
      "grad_norm": 0.49761015631869193,
      "learning_rate": 4.266537983251589e-05,
      "loss": 1.5084,
      "num_input_tokens_seen": 22327630032,
      "step": 28379
    },
    {
      "epoch": 3.0108211330362824,
      "grad_norm": 0.538300525307031,
      "learning_rate": 4.2664888067123735e-05,
      "loss": 1.4523,
      "num_input_tokens_seen": 22328416832,
      "step": 28380
    },
    {
      "epoch": 3.010927222575854,
      "grad_norm": 0.4541227314445053,
      "learning_rate": 4.266439628808066e-05,
      "loss": 1.4433,
      "num_input_tokens_seen": 22329203584,
      "step": 28381
    },
    {
      "epoch": 3.0110333121154254,
      "grad_norm": 0.413036817534329,
      "learning_rate": 4.2663904495387064e-05,
      "loss": 1.4449,
      "num_input_tokens_seen": 22329990352,
      "step": 28382
    },
    {
      "epoch": 3.011139401654997,
      "grad_norm": 0.5229417389484086,
      "learning_rate": 4.266341268904333e-05,
      "loss": 1.5195,
      "num_input_tokens_seen": 22330777152,
      "step": 28383
    },
    {
      "epoch": 3.0112454911945683,
      "grad_norm": 0.4354153625756029,
      "learning_rate": 4.2662920869049816e-05,
      "loss": 1.4736,
      "num_input_tokens_seen": 22331563952,
      "step": 28384
    },
    {
      "epoch": 3.0113515807341398,
      "grad_norm": 0.525834514140952,
      "learning_rate": 4.266242903540692e-05,
      "loss": 1.5026,
      "num_input_tokens_seen": 22332350640,
      "step": 28385
    },
    {
      "epoch": 3.011457670273711,
      "grad_norm": 0.47756723247676547,
      "learning_rate": 4.266193718811502e-05,
      "loss": 1.4965,
      "num_input_tokens_seen": 22333137360,
      "step": 28386
    },
    {
      "epoch": 3.0115637598132823,
      "grad_norm": 0.37627070148307346,
      "learning_rate": 4.2661445327174486e-05,
      "loss": 1.3937,
      "num_input_tokens_seen": 22333924176,
      "step": 28387
    },
    {
      "epoch": 3.0116698493528538,
      "grad_norm": 0.5411394082190067,
      "learning_rate": 4.2660953452585704e-05,
      "loss": 1.5175,
      "num_input_tokens_seen": 22334710928,
      "step": 28388
    },
    {
      "epoch": 3.0117759388924252,
      "grad_norm": 0.617916700326155,
      "learning_rate": 4.2660461564349066e-05,
      "loss": 1.4936,
      "num_input_tokens_seen": 22335497760,
      "step": 28389
    },
    {
      "epoch": 3.0118820284319967,
      "grad_norm": 0.45334739403914925,
      "learning_rate": 4.265996966246494e-05,
      "loss": 1.4722,
      "num_input_tokens_seen": 22336284496,
      "step": 28390
    },
    {
      "epoch": 3.011988117971568,
      "grad_norm": 0.503226423133427,
      "learning_rate": 4.26594777469337e-05,
      "loss": 1.4873,
      "num_input_tokens_seen": 22337071168,
      "step": 28391
    },
    {
      "epoch": 3.012094207511139,
      "grad_norm": 0.42083816815314434,
      "learning_rate": 4.265898581775574e-05,
      "loss": 1.5275,
      "num_input_tokens_seen": 22337857920,
      "step": 28392
    },
    {
      "epoch": 3.0122002970507107,
      "grad_norm": 0.4994086356199605,
      "learning_rate": 4.265849387493143e-05,
      "loss": 1.442,
      "num_input_tokens_seen": 22338644704,
      "step": 28393
    },
    {
      "epoch": 3.012306386590282,
      "grad_norm": 0.4535117563404916,
      "learning_rate": 4.2658001918461155e-05,
      "loss": 1.4311,
      "num_input_tokens_seen": 22339431408,
      "step": 28394
    },
    {
      "epoch": 3.0124124761298536,
      "grad_norm": 0.5040268294922423,
      "learning_rate": 4.26575099483453e-05,
      "loss": 1.5474,
      "num_input_tokens_seen": 22340218144,
      "step": 28395
    },
    {
      "epoch": 3.012518565669425,
      "grad_norm": 0.40544140467611406,
      "learning_rate": 4.2657017964584235e-05,
      "loss": 1.4232,
      "num_input_tokens_seen": 22341004912,
      "step": 28396
    },
    {
      "epoch": 3.0126246552089966,
      "grad_norm": 0.4289931955695525,
      "learning_rate": 4.265652596717834e-05,
      "loss": 1.4734,
      "num_input_tokens_seen": 22341791664,
      "step": 28397
    },
    {
      "epoch": 3.0127307447485676,
      "grad_norm": 0.4669706360178382,
      "learning_rate": 4.2656033956128e-05,
      "loss": 1.6429,
      "num_input_tokens_seen": 22342578432,
      "step": 28398
    },
    {
      "epoch": 3.012836834288139,
      "grad_norm": 0.4368747385438768,
      "learning_rate": 4.2655541931433605e-05,
      "loss": 1.493,
      "num_input_tokens_seen": 22343365216,
      "step": 28399
    },
    {
      "epoch": 3.0129429238277106,
      "grad_norm": 0.5711994428547259,
      "learning_rate": 4.265504989309552e-05,
      "loss": 1.4581,
      "num_input_tokens_seen": 22344152016,
      "step": 28400
    },
    {
      "epoch": 3.013049013367282,
      "grad_norm": 0.5705815876942014,
      "learning_rate": 4.265455784111413e-05,
      "loss": 1.6158,
      "num_input_tokens_seen": 22344938816,
      "step": 28401
    },
    {
      "epoch": 3.0131551029068535,
      "grad_norm": 0.49279710920986364,
      "learning_rate": 4.265406577548981e-05,
      "loss": 1.647,
      "num_input_tokens_seen": 22345725680,
      "step": 28402
    },
    {
      "epoch": 3.013261192446425,
      "grad_norm": 0.5189578853203063,
      "learning_rate": 4.265357369622295e-05,
      "loss": 1.3945,
      "num_input_tokens_seen": 22346512416,
      "step": 28403
    },
    {
      "epoch": 3.013367281985996,
      "grad_norm": 0.4007001546626987,
      "learning_rate": 4.265308160331393e-05,
      "loss": 1.397,
      "num_input_tokens_seen": 22347299200,
      "step": 28404
    },
    {
      "epoch": 3.0134733715255675,
      "grad_norm": 0.47193702483902356,
      "learning_rate": 4.265258949676312e-05,
      "loss": 1.4694,
      "num_input_tokens_seen": 22348085904,
      "step": 28405
    },
    {
      "epoch": 3.013579461065139,
      "grad_norm": 0.525428759904428,
      "learning_rate": 4.265209737657092e-05,
      "loss": 1.4318,
      "num_input_tokens_seen": 22348872656,
      "step": 28406
    },
    {
      "epoch": 3.0136855506047104,
      "grad_norm": 0.4464474661468077,
      "learning_rate": 4.265160524273768e-05,
      "loss": 1.5253,
      "num_input_tokens_seen": 22349659360,
      "step": 28407
    },
    {
      "epoch": 3.013791640144282,
      "grad_norm": 0.5601823129940569,
      "learning_rate": 4.265111309526381e-05,
      "loss": 1.4258,
      "num_input_tokens_seen": 22350446192,
      "step": 28408
    },
    {
      "epoch": 3.0138977296838534,
      "grad_norm": 0.4842176393417999,
      "learning_rate": 4.265062093414968e-05,
      "loss": 1.3005,
      "num_input_tokens_seen": 22351232960,
      "step": 28409
    },
    {
      "epoch": 3.0140038192234244,
      "grad_norm": 0.6530133100626352,
      "learning_rate": 4.2650128759395656e-05,
      "loss": 1.4754,
      "num_input_tokens_seen": 22352019728,
      "step": 28410
    },
    {
      "epoch": 3.014109908762996,
      "grad_norm": 0.5475091417366731,
      "learning_rate": 4.264963657100213e-05,
      "loss": 1.3103,
      "num_input_tokens_seen": 22352806496,
      "step": 28411
    },
    {
      "epoch": 3.0142159983025674,
      "grad_norm": 0.5863163368119603,
      "learning_rate": 4.264914436896949e-05,
      "loss": 1.4482,
      "num_input_tokens_seen": 22353593200,
      "step": 28412
    },
    {
      "epoch": 3.014322087842139,
      "grad_norm": 0.5641951671075044,
      "learning_rate": 4.264865215329811e-05,
      "loss": 1.4918,
      "num_input_tokens_seen": 22354379872,
      "step": 28413
    },
    {
      "epoch": 3.0144281773817103,
      "grad_norm": 0.598264932020621,
      "learning_rate": 4.264815992398836e-05,
      "loss": 1.4769,
      "num_input_tokens_seen": 22355166656,
      "step": 28414
    },
    {
      "epoch": 3.0145342669212813,
      "grad_norm": 0.4757145659527207,
      "learning_rate": 4.264766768104064e-05,
      "loss": 1.4193,
      "num_input_tokens_seen": 22355953312,
      "step": 28415
    },
    {
      "epoch": 3.014640356460853,
      "grad_norm": 0.6096169283923285,
      "learning_rate": 4.2647175424455324e-05,
      "loss": 1.4788,
      "num_input_tokens_seen": 22356740064,
      "step": 28416
    },
    {
      "epoch": 3.0147464460004243,
      "grad_norm": 0.45991530080933707,
      "learning_rate": 4.264668315423277e-05,
      "loss": 1.5106,
      "num_input_tokens_seen": 22357526816,
      "step": 28417
    },
    {
      "epoch": 3.0148525355399958,
      "grad_norm": 0.6303777058407237,
      "learning_rate": 4.264619087037339e-05,
      "loss": 1.4623,
      "num_input_tokens_seen": 22358313632,
      "step": 28418
    },
    {
      "epoch": 3.0149586250795672,
      "grad_norm": 0.41420727951222125,
      "learning_rate": 4.264569857287756e-05,
      "loss": 1.5399,
      "num_input_tokens_seen": 22359100384,
      "step": 28419
    },
    {
      "epoch": 3.0150647146191387,
      "grad_norm": 0.6029640118009099,
      "learning_rate": 4.264520626174564e-05,
      "loss": 1.4783,
      "num_input_tokens_seen": 22359887136,
      "step": 28420
    },
    {
      "epoch": 3.0151708041587097,
      "grad_norm": 0.4382288596738169,
      "learning_rate": 4.264471393697802e-05,
      "loss": 1.4406,
      "num_input_tokens_seen": 22360673904,
      "step": 28421
    },
    {
      "epoch": 3.0152768936982812,
      "grad_norm": 0.5762191839469226,
      "learning_rate": 4.264422159857508e-05,
      "loss": 1.5037,
      "num_input_tokens_seen": 22361460640,
      "step": 28422
    },
    {
      "epoch": 3.0153829832378527,
      "grad_norm": 0.5378642084354471,
      "learning_rate": 4.264372924653722e-05,
      "loss": 1.4112,
      "num_input_tokens_seen": 22362247456,
      "step": 28423
    },
    {
      "epoch": 3.015489072777424,
      "grad_norm": 0.51758252564012,
      "learning_rate": 4.264323688086479e-05,
      "loss": 1.3591,
      "num_input_tokens_seen": 22363034240,
      "step": 28424
    },
    {
      "epoch": 3.0155951623169956,
      "grad_norm": 0.616088628767405,
      "learning_rate": 4.264274450155819e-05,
      "loss": 1.5393,
      "num_input_tokens_seen": 22363820912,
      "step": 28425
    },
    {
      "epoch": 3.015701251856567,
      "grad_norm": 0.43702355201974463,
      "learning_rate": 4.2642252108617785e-05,
      "loss": 1.5826,
      "num_input_tokens_seen": 22364607600,
      "step": 28426
    },
    {
      "epoch": 3.015807341396138,
      "grad_norm": 0.5043602100645822,
      "learning_rate": 4.2641759702043977e-05,
      "loss": 1.3635,
      "num_input_tokens_seen": 22365394416,
      "step": 28427
    },
    {
      "epoch": 3.0159134309357096,
      "grad_norm": 0.5018753907839439,
      "learning_rate": 4.264126728183713e-05,
      "loss": 1.375,
      "num_input_tokens_seen": 22366181248,
      "step": 28428
    },
    {
      "epoch": 3.016019520475281,
      "grad_norm": 0.4176721654038313,
      "learning_rate": 4.264077484799763e-05,
      "loss": 1.4279,
      "num_input_tokens_seen": 22366967984,
      "step": 28429
    },
    {
      "epoch": 3.0161256100148526,
      "grad_norm": 0.5454854163044494,
      "learning_rate": 4.2640282400525855e-05,
      "loss": 1.2828,
      "num_input_tokens_seen": 22367754752,
      "step": 28430
    },
    {
      "epoch": 3.016231699554424,
      "grad_norm": 0.5649136018609778,
      "learning_rate": 4.263978993942219e-05,
      "loss": 1.514,
      "num_input_tokens_seen": 22368541520,
      "step": 28431
    },
    {
      "epoch": 3.0163377890939955,
      "grad_norm": 0.5983056042298968,
      "learning_rate": 4.263929746468702e-05,
      "loss": 1.5827,
      "num_input_tokens_seen": 22369328256,
      "step": 28432
    },
    {
      "epoch": 3.0164438786335666,
      "grad_norm": 0.5850542162033999,
      "learning_rate": 4.263880497632071e-05,
      "loss": 1.4204,
      "num_input_tokens_seen": 22370115040,
      "step": 28433
    },
    {
      "epoch": 3.016549968173138,
      "grad_norm": 0.4323862632541357,
      "learning_rate": 4.2638312474323645e-05,
      "loss": 1.3732,
      "num_input_tokens_seen": 22370901760,
      "step": 28434
    },
    {
      "epoch": 3.0166560577127095,
      "grad_norm": 0.4865156511695844,
      "learning_rate": 4.2637819958696215e-05,
      "loss": 1.4406,
      "num_input_tokens_seen": 22371688528,
      "step": 28435
    },
    {
      "epoch": 3.016762147252281,
      "grad_norm": 0.5272413438089119,
      "learning_rate": 4.263732742943879e-05,
      "loss": 1.4428,
      "num_input_tokens_seen": 22372475280,
      "step": 28436
    },
    {
      "epoch": 3.0168682367918525,
      "grad_norm": 0.4316903723011745,
      "learning_rate": 4.263683488655177e-05,
      "loss": 1.4506,
      "num_input_tokens_seen": 22373262016,
      "step": 28437
    },
    {
      "epoch": 3.016974326331424,
      "grad_norm": 0.6578166223628238,
      "learning_rate": 4.2636342330035504e-05,
      "loss": 1.4319,
      "num_input_tokens_seen": 22374048800,
      "step": 28438
    },
    {
      "epoch": 3.017080415870995,
      "grad_norm": 0.5276853280625227,
      "learning_rate": 4.26358497598904e-05,
      "loss": 1.3971,
      "num_input_tokens_seen": 22374835600,
      "step": 28439
    },
    {
      "epoch": 3.0171865054105664,
      "grad_norm": 0.4899496287422095,
      "learning_rate": 4.263535717611683e-05,
      "loss": 1.533,
      "num_input_tokens_seen": 22375622320,
      "step": 28440
    },
    {
      "epoch": 3.017292594950138,
      "grad_norm": 0.45253659284650133,
      "learning_rate": 4.263486457871517e-05,
      "loss": 1.4676,
      "num_input_tokens_seen": 22376409120,
      "step": 28441
    },
    {
      "epoch": 3.0173986844897094,
      "grad_norm": 0.42147040884716636,
      "learning_rate": 4.2634371967685805e-05,
      "loss": 1.3881,
      "num_input_tokens_seen": 22377195920,
      "step": 28442
    },
    {
      "epoch": 3.017504774029281,
      "grad_norm": 0.5129781822286954,
      "learning_rate": 4.2633879343029114e-05,
      "loss": 1.5002,
      "num_input_tokens_seen": 22377982624,
      "step": 28443
    },
    {
      "epoch": 3.0176108635688523,
      "grad_norm": 0.48502012935958155,
      "learning_rate": 4.263338670474548e-05,
      "loss": 1.3566,
      "num_input_tokens_seen": 22378769376,
      "step": 28444
    },
    {
      "epoch": 3.0177169531084234,
      "grad_norm": 0.5846818610951156,
      "learning_rate": 4.263289405283528e-05,
      "loss": 1.6325,
      "num_input_tokens_seen": 22379556080,
      "step": 28445
    },
    {
      "epoch": 3.017823042647995,
      "grad_norm": 0.5419312582242186,
      "learning_rate": 4.26324013872989e-05,
      "loss": 1.5057,
      "num_input_tokens_seen": 22380342816,
      "step": 28446
    },
    {
      "epoch": 3.0179291321875663,
      "grad_norm": 0.419812771233436,
      "learning_rate": 4.263190870813671e-05,
      "loss": 1.4293,
      "num_input_tokens_seen": 22381129648,
      "step": 28447
    },
    {
      "epoch": 3.018035221727138,
      "grad_norm": 0.5789421321223212,
      "learning_rate": 4.26314160153491e-05,
      "loss": 1.4176,
      "num_input_tokens_seen": 22381916288,
      "step": 28448
    },
    {
      "epoch": 3.0181413112667093,
      "grad_norm": 0.4896346733610903,
      "learning_rate": 4.263092330893645e-05,
      "loss": 1.3487,
      "num_input_tokens_seen": 22382702992,
      "step": 28449
    },
    {
      "epoch": 3.0182474008062803,
      "grad_norm": 0.5034832432123343,
      "learning_rate": 4.263043058889915e-05,
      "loss": 1.3945,
      "num_input_tokens_seen": 22383489744,
      "step": 28450
    },
    {
      "epoch": 3.0183534903458518,
      "grad_norm": 0.5822463363331772,
      "learning_rate": 4.2629937855237564e-05,
      "loss": 1.464,
      "num_input_tokens_seen": 22384276544,
      "step": 28451
    },
    {
      "epoch": 3.0184595798854232,
      "grad_norm": 0.5956679168925206,
      "learning_rate": 4.2629445107952084e-05,
      "loss": 1.3519,
      "num_input_tokens_seen": 22385063376,
      "step": 28452
    },
    {
      "epoch": 3.0185656694249947,
      "grad_norm": 0.5722414564796143,
      "learning_rate": 4.262895234704307e-05,
      "loss": 1.482,
      "num_input_tokens_seen": 22385850208,
      "step": 28453
    },
    {
      "epoch": 3.018671758964566,
      "grad_norm": 0.7535679437131716,
      "learning_rate": 4.262845957251094e-05,
      "loss": 1.4385,
      "num_input_tokens_seen": 22386636912,
      "step": 28454
    },
    {
      "epoch": 3.0187778485041377,
      "grad_norm": 0.4752568630048999,
      "learning_rate": 4.262796678435603e-05,
      "loss": 1.3564,
      "num_input_tokens_seen": 22387423616,
      "step": 28455
    },
    {
      "epoch": 3.0188839380437087,
      "grad_norm": 0.7002367811691875,
      "learning_rate": 4.262747398257876e-05,
      "loss": 1.4434,
      "num_input_tokens_seen": 22388210416,
      "step": 28456
    },
    {
      "epoch": 3.01899002758328,
      "grad_norm": 0.5374153248071808,
      "learning_rate": 4.2626981167179494e-05,
      "loss": 1.3873,
      "num_input_tokens_seen": 22388997184,
      "step": 28457
    },
    {
      "epoch": 3.0190961171228516,
      "grad_norm": 0.43523599365778404,
      "learning_rate": 4.2626488338158615e-05,
      "loss": 1.3556,
      "num_input_tokens_seen": 22389783968,
      "step": 28458
    },
    {
      "epoch": 3.019202206662423,
      "grad_norm": 0.5458982409917857,
      "learning_rate": 4.2625995495516505e-05,
      "loss": 1.4188,
      "num_input_tokens_seen": 22390570608,
      "step": 28459
    },
    {
      "epoch": 3.0193082962019946,
      "grad_norm": 0.4645929395654828,
      "learning_rate": 4.2625502639253535e-05,
      "loss": 1.3797,
      "num_input_tokens_seen": 22391357424,
      "step": 28460
    },
    {
      "epoch": 3.019414385741566,
      "grad_norm": 0.43879733432356127,
      "learning_rate": 4.262500976937009e-05,
      "loss": 1.4322,
      "num_input_tokens_seen": 22392144208,
      "step": 28461
    },
    {
      "epoch": 3.019520475281137,
      "grad_norm": 0.6973042464973248,
      "learning_rate": 4.262451688586657e-05,
      "loss": 1.5581,
      "num_input_tokens_seen": 22392930960,
      "step": 28462
    },
    {
      "epoch": 3.0196265648207086,
      "grad_norm": 0.47493577656964275,
      "learning_rate": 4.2624023988743335e-05,
      "loss": 1.5642,
      "num_input_tokens_seen": 22393717632,
      "step": 28463
    },
    {
      "epoch": 3.01973265436028,
      "grad_norm": 0.6202013201001153,
      "learning_rate": 4.2623531078000765e-05,
      "loss": 1.403,
      "num_input_tokens_seen": 22394504416,
      "step": 28464
    },
    {
      "epoch": 3.0198387438998515,
      "grad_norm": 0.5008449641012895,
      "learning_rate": 4.262303815363925e-05,
      "loss": 1.3606,
      "num_input_tokens_seen": 22395291248,
      "step": 28465
    },
    {
      "epoch": 3.019944833439423,
      "grad_norm": 0.563890090102308,
      "learning_rate": 4.262254521565917e-05,
      "loss": 1.4321,
      "num_input_tokens_seen": 22396078000,
      "step": 28466
    },
    {
      "epoch": 3.0200509229789945,
      "grad_norm": 0.6152141988559491,
      "learning_rate": 4.262205226406091e-05,
      "loss": 1.5279,
      "num_input_tokens_seen": 22396864800,
      "step": 28467
    },
    {
      "epoch": 3.0201570125185655,
      "grad_norm": 0.6354655877919132,
      "learning_rate": 4.262155929884484e-05,
      "loss": 1.5472,
      "num_input_tokens_seen": 22397651536,
      "step": 28468
    },
    {
      "epoch": 3.020263102058137,
      "grad_norm": 0.4554983054751686,
      "learning_rate": 4.2621066320011336e-05,
      "loss": 1.4985,
      "num_input_tokens_seen": 22398438288,
      "step": 28469
    },
    {
      "epoch": 3.0203691915977084,
      "grad_norm": 0.5707054720938807,
      "learning_rate": 4.26205733275608e-05,
      "loss": 1.4594,
      "num_input_tokens_seen": 22399225024,
      "step": 28470
    },
    {
      "epoch": 3.02047528113728,
      "grad_norm": 0.4138178530815261,
      "learning_rate": 4.2620080321493606e-05,
      "loss": 1.4411,
      "num_input_tokens_seen": 22400011840,
      "step": 28471
    },
    {
      "epoch": 3.0205813706768514,
      "grad_norm": 0.5629165417966044,
      "learning_rate": 4.2619587301810116e-05,
      "loss": 1.3564,
      "num_input_tokens_seen": 22400798672,
      "step": 28472
    },
    {
      "epoch": 3.020687460216423,
      "grad_norm": 0.5835995810900938,
      "learning_rate": 4.2619094268510735e-05,
      "loss": 1.3749,
      "num_input_tokens_seen": 22401585408,
      "step": 28473
    },
    {
      "epoch": 3.020793549755994,
      "grad_norm": 0.5063526767481886,
      "learning_rate": 4.2618601221595835e-05,
      "loss": 1.4282,
      "num_input_tokens_seen": 22402372160,
      "step": 28474
    },
    {
      "epoch": 3.0208996392955654,
      "grad_norm": 0.5416626074301346,
      "learning_rate": 4.2618108161065795e-05,
      "loss": 1.5002,
      "num_input_tokens_seen": 22403159008,
      "step": 28475
    },
    {
      "epoch": 3.021005728835137,
      "grad_norm": 0.5847367886411183,
      "learning_rate": 4.2617615086921e-05,
      "loss": 1.4833,
      "num_input_tokens_seen": 22403945680,
      "step": 28476
    },
    {
      "epoch": 3.0211118183747083,
      "grad_norm": 0.5390661888727237,
      "learning_rate": 4.2617121999161826e-05,
      "loss": 1.5136,
      "num_input_tokens_seen": 22404732384,
      "step": 28477
    },
    {
      "epoch": 3.02121790791428,
      "grad_norm": 0.6703209312592319,
      "learning_rate": 4.2616628897788664e-05,
      "loss": 1.4327,
      "num_input_tokens_seen": 22405519184,
      "step": 28478
    },
    {
      "epoch": 3.021323997453851,
      "grad_norm": 0.49165544654263416,
      "learning_rate": 4.261613578280188e-05,
      "loss": 1.5093,
      "num_input_tokens_seen": 22406306048,
      "step": 28479
    },
    {
      "epoch": 3.0214300869934223,
      "grad_norm": 0.45345370558139586,
      "learning_rate": 4.261564265420187e-05,
      "loss": 1.4208,
      "num_input_tokens_seen": 22407092832,
      "step": 28480
    },
    {
      "epoch": 3.021536176532994,
      "grad_norm": 0.8614364225933053,
      "learning_rate": 4.2615149511989e-05,
      "loss": 1.5109,
      "num_input_tokens_seen": 22407879536,
      "step": 28481
    },
    {
      "epoch": 3.0216422660725653,
      "grad_norm": 0.6936988448387089,
      "learning_rate": 4.261465635616367e-05,
      "loss": 1.4938,
      "num_input_tokens_seen": 22408666384,
      "step": 28482
    },
    {
      "epoch": 3.0217483556121367,
      "grad_norm": 0.6404212052477063,
      "learning_rate": 4.261416318672624e-05,
      "loss": 1.3362,
      "num_input_tokens_seen": 22409453200,
      "step": 28483
    },
    {
      "epoch": 3.021854445151708,
      "grad_norm": 0.552020931428872,
      "learning_rate": 4.261367000367711e-05,
      "loss": 1.5531,
      "num_input_tokens_seen": 22410239952,
      "step": 28484
    },
    {
      "epoch": 3.0219605346912792,
      "grad_norm": 0.5228611132499726,
      "learning_rate": 4.2613176807016646e-05,
      "loss": 1.4603,
      "num_input_tokens_seen": 22411026704,
      "step": 28485
    },
    {
      "epoch": 3.0220666242308507,
      "grad_norm": 0.4890451674441794,
      "learning_rate": 4.261268359674524e-05,
      "loss": 1.4987,
      "num_input_tokens_seen": 22411813408,
      "step": 28486
    },
    {
      "epoch": 3.022172713770422,
      "grad_norm": 0.5573836247075408,
      "learning_rate": 4.261219037286327e-05,
      "loss": 1.5669,
      "num_input_tokens_seen": 22412600144,
      "step": 28487
    },
    {
      "epoch": 3.0222788033099937,
      "grad_norm": 0.47643216524670406,
      "learning_rate": 4.261169713537111e-05,
      "loss": 1.3829,
      "num_input_tokens_seen": 22413386816,
      "step": 28488
    },
    {
      "epoch": 3.022384892849565,
      "grad_norm": 0.47546331668850367,
      "learning_rate": 4.261120388426915e-05,
      "loss": 1.4509,
      "num_input_tokens_seen": 22414173616,
      "step": 28489
    },
    {
      "epoch": 3.0224909823891366,
      "grad_norm": 0.5642717293291217,
      "learning_rate": 4.261071061955777e-05,
      "loss": 1.5454,
      "num_input_tokens_seen": 22414960400,
      "step": 28490
    },
    {
      "epoch": 3.0225970719287076,
      "grad_norm": 0.43548204559840964,
      "learning_rate": 4.261021734123735e-05,
      "loss": 1.418,
      "num_input_tokens_seen": 22415747184,
      "step": 28491
    },
    {
      "epoch": 3.022703161468279,
      "grad_norm": 0.7475561334791788,
      "learning_rate": 4.2609724049308267e-05,
      "loss": 1.452,
      "num_input_tokens_seen": 22416533872,
      "step": 28492
    },
    {
      "epoch": 3.0228092510078506,
      "grad_norm": 0.4926620896324854,
      "learning_rate": 4.260923074377091e-05,
      "loss": 1.4906,
      "num_input_tokens_seen": 22417320544,
      "step": 28493
    },
    {
      "epoch": 3.022915340547422,
      "grad_norm": 0.6938564916582599,
      "learning_rate": 4.260873742462566e-05,
      "loss": 1.5904,
      "num_input_tokens_seen": 22418107296,
      "step": 28494
    },
    {
      "epoch": 3.0230214300869935,
      "grad_norm": 0.45803483090150565,
      "learning_rate": 4.260824409187288e-05,
      "loss": 1.4519,
      "num_input_tokens_seen": 22418894144,
      "step": 28495
    },
    {
      "epoch": 3.023127519626565,
      "grad_norm": 0.5106072959395739,
      "learning_rate": 4.260775074551298e-05,
      "loss": 1.4606,
      "num_input_tokens_seen": 22419680880,
      "step": 28496
    },
    {
      "epoch": 3.023233609166136,
      "grad_norm": 0.42479397434145805,
      "learning_rate": 4.2607257385546314e-05,
      "loss": 1.5008,
      "num_input_tokens_seen": 22420467664,
      "step": 28497
    },
    {
      "epoch": 3.0233396987057075,
      "grad_norm": 0.5177607207454599,
      "learning_rate": 4.260676401197329e-05,
      "loss": 1.5476,
      "num_input_tokens_seen": 22421254400,
      "step": 28498
    },
    {
      "epoch": 3.023445788245279,
      "grad_norm": 0.46944911803993983,
      "learning_rate": 4.260627062479427e-05,
      "loss": 1.5288,
      "num_input_tokens_seen": 22422041120,
      "step": 28499
    },
    {
      "epoch": 3.0235518777848505,
      "grad_norm": 0.5514452976938793,
      "learning_rate": 4.2605777224009635e-05,
      "loss": 1.3537,
      "num_input_tokens_seen": 22422827888,
      "step": 28500
    },
    {
      "epoch": 3.023657967324422,
      "grad_norm": 0.3947619258393274,
      "learning_rate": 4.260528380961978e-05,
      "loss": 1.4512,
      "num_input_tokens_seen": 22423614688,
      "step": 28501
    },
    {
      "epoch": 3.0237640568639934,
      "grad_norm": 0.4286092889901293,
      "learning_rate": 4.260479038162507e-05,
      "loss": 1.4539,
      "num_input_tokens_seen": 22424401504,
      "step": 28502
    },
    {
      "epoch": 3.0238701464035644,
      "grad_norm": 0.38732290843660566,
      "learning_rate": 4.26042969400259e-05,
      "loss": 1.4975,
      "num_input_tokens_seen": 22425188288,
      "step": 28503
    },
    {
      "epoch": 3.023976235943136,
      "grad_norm": 0.4786542987283521,
      "learning_rate": 4.260380348482265e-05,
      "loss": 1.4912,
      "num_input_tokens_seen": 22425975024,
      "step": 28504
    },
    {
      "epoch": 3.0240823254827074,
      "grad_norm": 0.43258166358641914,
      "learning_rate": 4.2603310016015685e-05,
      "loss": 1.523,
      "num_input_tokens_seen": 22426761664,
      "step": 28505
    },
    {
      "epoch": 3.024188415022279,
      "grad_norm": 0.4977327090087728,
      "learning_rate": 4.260281653360541e-05,
      "loss": 1.4,
      "num_input_tokens_seen": 22427548528,
      "step": 28506
    },
    {
      "epoch": 3.0242945045618503,
      "grad_norm": 0.44259849760393616,
      "learning_rate": 4.260232303759219e-05,
      "loss": 1.5289,
      "num_input_tokens_seen": 22428335248,
      "step": 28507
    },
    {
      "epoch": 3.024400594101422,
      "grad_norm": 0.6255856006235296,
      "learning_rate": 4.2601829527976414e-05,
      "loss": 1.4886,
      "num_input_tokens_seen": 22429122048,
      "step": 28508
    },
    {
      "epoch": 3.024506683640993,
      "grad_norm": 0.40280433966507995,
      "learning_rate": 4.2601336004758455e-05,
      "loss": 1.4113,
      "num_input_tokens_seen": 22429908800,
      "step": 28509
    },
    {
      "epoch": 3.0246127731805643,
      "grad_norm": 0.6680506029878678,
      "learning_rate": 4.2600842467938705e-05,
      "loss": 1.4942,
      "num_input_tokens_seen": 22430695488,
      "step": 28510
    },
    {
      "epoch": 3.024718862720136,
      "grad_norm": 0.39772218084243305,
      "learning_rate": 4.260034891751754e-05,
      "loss": 1.3786,
      "num_input_tokens_seen": 22431482336,
      "step": 28511
    },
    {
      "epoch": 3.0248249522597073,
      "grad_norm": 0.7052093573063629,
      "learning_rate": 4.2599855353495345e-05,
      "loss": 1.502,
      "num_input_tokens_seen": 22432269056,
      "step": 28512
    },
    {
      "epoch": 3.0249310417992787,
      "grad_norm": 0.43783055121884873,
      "learning_rate": 4.2599361775872494e-05,
      "loss": 1.6414,
      "num_input_tokens_seen": 22433055856,
      "step": 28513
    },
    {
      "epoch": 3.0250371313388498,
      "grad_norm": 0.6044510568610144,
      "learning_rate": 4.259886818464936e-05,
      "loss": 1.417,
      "num_input_tokens_seen": 22433842608,
      "step": 28514
    },
    {
      "epoch": 3.0251432208784212,
      "grad_norm": 0.5104157788386366,
      "learning_rate": 4.259837457982636e-05,
      "loss": 1.4959,
      "num_input_tokens_seen": 22434629360,
      "step": 28515
    },
    {
      "epoch": 3.0252493104179927,
      "grad_norm": 0.45105947392408097,
      "learning_rate": 4.259788096140384e-05,
      "loss": 1.3856,
      "num_input_tokens_seen": 22435416128,
      "step": 28516
    },
    {
      "epoch": 3.025355399957564,
      "grad_norm": 0.573287228771895,
      "learning_rate": 4.2597387329382196e-05,
      "loss": 1.4617,
      "num_input_tokens_seen": 22436202832,
      "step": 28517
    },
    {
      "epoch": 3.0254614894971357,
      "grad_norm": 0.46142684960719976,
      "learning_rate": 4.259689368376181e-05,
      "loss": 1.4427,
      "num_input_tokens_seen": 22436989600,
      "step": 28518
    },
    {
      "epoch": 3.025567579036707,
      "grad_norm": 0.7006806046120574,
      "learning_rate": 4.259640002454306e-05,
      "loss": 1.4342,
      "num_input_tokens_seen": 22437776288,
      "step": 28519
    },
    {
      "epoch": 3.025673668576278,
      "grad_norm": 0.47500530491497567,
      "learning_rate": 4.2595906351726325e-05,
      "loss": 1.4632,
      "num_input_tokens_seen": 22438563088,
      "step": 28520
    },
    {
      "epoch": 3.0257797581158496,
      "grad_norm": 0.6679382981467714,
      "learning_rate": 4.2595412665311984e-05,
      "loss": 1.4357,
      "num_input_tokens_seen": 22439349856,
      "step": 28521
    },
    {
      "epoch": 3.025885847655421,
      "grad_norm": 0.42322815084245324,
      "learning_rate": 4.2594918965300434e-05,
      "loss": 1.5858,
      "num_input_tokens_seen": 22440136688,
      "step": 28522
    },
    {
      "epoch": 3.0259919371949926,
      "grad_norm": 0.5172458283910248,
      "learning_rate": 4.259442525169204e-05,
      "loss": 1.5071,
      "num_input_tokens_seen": 22440923424,
      "step": 28523
    },
    {
      "epoch": 3.026098026734564,
      "grad_norm": 0.4187254402238725,
      "learning_rate": 4.2593931524487196e-05,
      "loss": 1.3463,
      "num_input_tokens_seen": 22441710304,
      "step": 28524
    },
    {
      "epoch": 3.0262041162741355,
      "grad_norm": 0.40515826757472523,
      "learning_rate": 4.2593437783686286e-05,
      "loss": 1.4026,
      "num_input_tokens_seen": 22442497056,
      "step": 28525
    },
    {
      "epoch": 3.0263102058137066,
      "grad_norm": 0.6484120309113883,
      "learning_rate": 4.259294402928967e-05,
      "loss": 1.4883,
      "num_input_tokens_seen": 22443283904,
      "step": 28526
    },
    {
      "epoch": 3.026416295353278,
      "grad_norm": 0.4049205519856867,
      "learning_rate": 4.2592450261297744e-05,
      "loss": 1.453,
      "num_input_tokens_seen": 22444070656,
      "step": 28527
    },
    {
      "epoch": 3.0265223848928495,
      "grad_norm": 0.4896061289064279,
      "learning_rate": 4.259195647971089e-05,
      "loss": 1.4751,
      "num_input_tokens_seen": 22444857456,
      "step": 28528
    },
    {
      "epoch": 3.026628474432421,
      "grad_norm": 0.4139674127964932,
      "learning_rate": 4.259146268452949e-05,
      "loss": 1.4088,
      "num_input_tokens_seen": 22445644176,
      "step": 28529
    },
    {
      "epoch": 3.0267345639719925,
      "grad_norm": 0.4363351723578688,
      "learning_rate": 4.2590968875753936e-05,
      "loss": 1.3392,
      "num_input_tokens_seen": 22446430880,
      "step": 28530
    },
    {
      "epoch": 3.026840653511564,
      "grad_norm": 0.4901294396055549,
      "learning_rate": 4.259047505338458e-05,
      "loss": 1.4872,
      "num_input_tokens_seen": 22447217568,
      "step": 28531
    },
    {
      "epoch": 3.026946743051135,
      "grad_norm": 0.4759947877412158,
      "learning_rate": 4.258998121742182e-05,
      "loss": 1.5964,
      "num_input_tokens_seen": 22448004304,
      "step": 28532
    },
    {
      "epoch": 3.0270528325907065,
      "grad_norm": 0.416240289178476,
      "learning_rate": 4.258948736786606e-05,
      "loss": 1.4227,
      "num_input_tokens_seen": 22448791024,
      "step": 28533
    },
    {
      "epoch": 3.027158922130278,
      "grad_norm": 0.46208141256991303,
      "learning_rate": 4.258899350471764e-05,
      "loss": 1.5757,
      "num_input_tokens_seen": 22449577760,
      "step": 28534
    },
    {
      "epoch": 3.0272650116698494,
      "grad_norm": 0.42695394014666693,
      "learning_rate": 4.2588499627976964e-05,
      "loss": 1.4389,
      "num_input_tokens_seen": 22450364496,
      "step": 28535
    },
    {
      "epoch": 3.027371101209421,
      "grad_norm": 0.4760083642060161,
      "learning_rate": 4.258800573764442e-05,
      "loss": 1.5486,
      "num_input_tokens_seen": 22451151248,
      "step": 28536
    },
    {
      "epoch": 3.0274771907489924,
      "grad_norm": 0.4957471789412765,
      "learning_rate": 4.258751183372037e-05,
      "loss": 1.5828,
      "num_input_tokens_seen": 22451938048,
      "step": 28537
    },
    {
      "epoch": 3.0275832802885634,
      "grad_norm": 0.5267267777806109,
      "learning_rate": 4.258701791620522e-05,
      "loss": 1.4504,
      "num_input_tokens_seen": 22452724752,
      "step": 28538
    },
    {
      "epoch": 3.027689369828135,
      "grad_norm": 0.4306342456197957,
      "learning_rate": 4.258652398509933e-05,
      "loss": 1.5105,
      "num_input_tokens_seen": 22453511520,
      "step": 28539
    },
    {
      "epoch": 3.0277954593677063,
      "grad_norm": 0.3852375433977538,
      "learning_rate": 4.258603004040309e-05,
      "loss": 1.3146,
      "num_input_tokens_seen": 22454298272,
      "step": 28540
    },
    {
      "epoch": 3.027901548907278,
      "grad_norm": 0.40754668903534147,
      "learning_rate": 4.258553608211688e-05,
      "loss": 1.3905,
      "num_input_tokens_seen": 22455085104,
      "step": 28541
    },
    {
      "epoch": 3.0280076384468493,
      "grad_norm": 0.4711295894327563,
      "learning_rate": 4.258504211024109e-05,
      "loss": 1.4967,
      "num_input_tokens_seen": 22455871824,
      "step": 28542
    },
    {
      "epoch": 3.0281137279864208,
      "grad_norm": 0.4790578944138036,
      "learning_rate": 4.2584548124776095e-05,
      "loss": 1.5055,
      "num_input_tokens_seen": 22456658528,
      "step": 28543
    },
    {
      "epoch": 3.028219817525992,
      "grad_norm": 0.6264848960321194,
      "learning_rate": 4.258405412572228e-05,
      "loss": 1.4987,
      "num_input_tokens_seen": 22457445136,
      "step": 28544
    },
    {
      "epoch": 3.0283259070655633,
      "grad_norm": 0.4085624590441535,
      "learning_rate": 4.258356011308002e-05,
      "loss": 1.3053,
      "num_input_tokens_seen": 22458231920,
      "step": 28545
    },
    {
      "epoch": 3.0284319966051347,
      "grad_norm": 0.5330207707105711,
      "learning_rate": 4.25830660868497e-05,
      "loss": 1.4523,
      "num_input_tokens_seen": 22459018688,
      "step": 28546
    },
    {
      "epoch": 3.028538086144706,
      "grad_norm": 0.4491143787480775,
      "learning_rate": 4.25825720470317e-05,
      "loss": 1.4295,
      "num_input_tokens_seen": 22459805360,
      "step": 28547
    },
    {
      "epoch": 3.0286441756842777,
      "grad_norm": 0.4454742643783676,
      "learning_rate": 4.258207799362641e-05,
      "loss": 1.4233,
      "num_input_tokens_seen": 22460592160,
      "step": 28548
    },
    {
      "epoch": 3.0287502652238487,
      "grad_norm": 0.3977067196967656,
      "learning_rate": 4.25815839266342e-05,
      "loss": 1.3758,
      "num_input_tokens_seen": 22461379008,
      "step": 28549
    },
    {
      "epoch": 3.02885635476342,
      "grad_norm": 0.41682619004533056,
      "learning_rate": 4.258108984605546e-05,
      "loss": 1.3614,
      "num_input_tokens_seen": 22462165776,
      "step": 28550
    },
    {
      "epoch": 3.0289624443029917,
      "grad_norm": 0.42295941398057935,
      "learning_rate": 4.258059575189057e-05,
      "loss": 1.4787,
      "num_input_tokens_seen": 22462952528,
      "step": 28551
    },
    {
      "epoch": 3.029068533842563,
      "grad_norm": 0.42621624010487813,
      "learning_rate": 4.258010164413991e-05,
      "loss": 1.4363,
      "num_input_tokens_seen": 22463739344,
      "step": 28552
    },
    {
      "epoch": 3.0291746233821346,
      "grad_norm": 0.4055239834865173,
      "learning_rate": 4.257960752280387e-05,
      "loss": 1.5033,
      "num_input_tokens_seen": 22464526080,
      "step": 28553
    },
    {
      "epoch": 3.029280712921706,
      "grad_norm": 0.39964271523726136,
      "learning_rate": 4.2579113387882817e-05,
      "loss": 1.4386,
      "num_input_tokens_seen": 22465312944,
      "step": 28554
    },
    {
      "epoch": 3.029386802461277,
      "grad_norm": 0.4859683943234269,
      "learning_rate": 4.2578619239377147e-05,
      "loss": 1.5008,
      "num_input_tokens_seen": 22466099792,
      "step": 28555
    },
    {
      "epoch": 3.0294928920008486,
      "grad_norm": 0.4860992563124226,
      "learning_rate": 4.2578125077287237e-05,
      "loss": 1.5017,
      "num_input_tokens_seen": 22466886528,
      "step": 28556
    },
    {
      "epoch": 3.02959898154042,
      "grad_norm": 0.4133177512496461,
      "learning_rate": 4.257763090161346e-05,
      "loss": 1.4655,
      "num_input_tokens_seen": 22467673360,
      "step": 28557
    },
    {
      "epoch": 3.0297050710799915,
      "grad_norm": 0.5054041529947529,
      "learning_rate": 4.25771367123562e-05,
      "loss": 1.418,
      "num_input_tokens_seen": 22468460096,
      "step": 28558
    },
    {
      "epoch": 3.029811160619563,
      "grad_norm": 0.39413673310794684,
      "learning_rate": 4.257664250951586e-05,
      "loss": 1.4021,
      "num_input_tokens_seen": 22469246944,
      "step": 28559
    },
    {
      "epoch": 3.0299172501591345,
      "grad_norm": 0.4234739226179459,
      "learning_rate": 4.25761482930928e-05,
      "loss": 1.4754,
      "num_input_tokens_seen": 22470033696,
      "step": 28560
    },
    {
      "epoch": 3.0300233396987055,
      "grad_norm": 0.42562422728516613,
      "learning_rate": 4.2575654063087414e-05,
      "loss": 1.568,
      "num_input_tokens_seen": 22470820560,
      "step": 28561
    },
    {
      "epoch": 3.030129429238277,
      "grad_norm": 0.3711264757944412,
      "learning_rate": 4.2575159819500067e-05,
      "loss": 1.348,
      "num_input_tokens_seen": 22471607280,
      "step": 28562
    },
    {
      "epoch": 3.0302355187778485,
      "grad_norm": 0.4026781404608326,
      "learning_rate": 4.257466556233116e-05,
      "loss": 1.3228,
      "num_input_tokens_seen": 22472394064,
      "step": 28563
    },
    {
      "epoch": 3.03034160831742,
      "grad_norm": 0.41630035461925863,
      "learning_rate": 4.257417129158107e-05,
      "loss": 1.4047,
      "num_input_tokens_seen": 22473180768,
      "step": 28564
    },
    {
      "epoch": 3.0304476978569914,
      "grad_norm": 0.44636145113824643,
      "learning_rate": 4.257367700725016e-05,
      "loss": 1.5063,
      "num_input_tokens_seen": 22473967488,
      "step": 28565
    },
    {
      "epoch": 3.030553787396563,
      "grad_norm": 0.4776016068509018,
      "learning_rate": 4.257318270933884e-05,
      "loss": 1.4375,
      "num_input_tokens_seen": 22474754208,
      "step": 28566
    },
    {
      "epoch": 3.030659876936134,
      "grad_norm": 0.4451288679817157,
      "learning_rate": 4.257268839784748e-05,
      "loss": 1.4987,
      "num_input_tokens_seen": 22475541024,
      "step": 28567
    },
    {
      "epoch": 3.0307659664757054,
      "grad_norm": 0.39799557577792294,
      "learning_rate": 4.257219407277646e-05,
      "loss": 1.4011,
      "num_input_tokens_seen": 22476327808,
      "step": 28568
    },
    {
      "epoch": 3.030872056015277,
      "grad_norm": 0.41241096971857255,
      "learning_rate": 4.257169973412617e-05,
      "loss": 1.4396,
      "num_input_tokens_seen": 22477114592,
      "step": 28569
    },
    {
      "epoch": 3.0309781455548483,
      "grad_norm": 0.5151441576839705,
      "learning_rate": 4.257120538189697e-05,
      "loss": 1.4833,
      "num_input_tokens_seen": 22477901360,
      "step": 28570
    },
    {
      "epoch": 3.03108423509442,
      "grad_norm": 0.7081503443299142,
      "learning_rate": 4.2570711016089275e-05,
      "loss": 1.4468,
      "num_input_tokens_seen": 22478688080,
      "step": 28571
    },
    {
      "epoch": 3.0311903246339913,
      "grad_norm": 0.4415981138392665,
      "learning_rate": 4.257021663670344e-05,
      "loss": 1.4421,
      "num_input_tokens_seen": 22479474880,
      "step": 28572
    },
    {
      "epoch": 3.0312964141735623,
      "grad_norm": 0.6392426073659505,
      "learning_rate": 4.256972224373986e-05,
      "loss": 1.4243,
      "num_input_tokens_seen": 22480261600,
      "step": 28573
    },
    {
      "epoch": 3.031402503713134,
      "grad_norm": 0.4523366683801457,
      "learning_rate": 4.256922783719892e-05,
      "loss": 1.4482,
      "num_input_tokens_seen": 22481048384,
      "step": 28574
    },
    {
      "epoch": 3.0315085932527053,
      "grad_norm": 0.5515071245359408,
      "learning_rate": 4.2568733417081e-05,
      "loss": 1.4407,
      "num_input_tokens_seen": 22481835184,
      "step": 28575
    },
    {
      "epoch": 3.0316146827922767,
      "grad_norm": 0.4001175160083314,
      "learning_rate": 4.256823898338647e-05,
      "loss": 1.4366,
      "num_input_tokens_seen": 22482621856,
      "step": 28576
    },
    {
      "epoch": 3.0317207723318482,
      "grad_norm": 0.5296290528834264,
      "learning_rate": 4.256774453611572e-05,
      "loss": 1.3911,
      "num_input_tokens_seen": 22483408656,
      "step": 28577
    },
    {
      "epoch": 3.0318268618714193,
      "grad_norm": 0.3989999481007379,
      "learning_rate": 4.256725007526913e-05,
      "loss": 1.3742,
      "num_input_tokens_seen": 22484195488,
      "step": 28578
    },
    {
      "epoch": 3.0319329514109907,
      "grad_norm": 0.5032025322318647,
      "learning_rate": 4.256675560084709e-05,
      "loss": 1.5561,
      "num_input_tokens_seen": 22484982240,
      "step": 28579
    },
    {
      "epoch": 3.032039040950562,
      "grad_norm": 0.5442367253367931,
      "learning_rate": 4.256626111284997e-05,
      "loss": 1.4934,
      "num_input_tokens_seen": 22485768992,
      "step": 28580
    },
    {
      "epoch": 3.0321451304901337,
      "grad_norm": 0.38921687319135245,
      "learning_rate": 4.2565766611278164e-05,
      "loss": 1.3221,
      "num_input_tokens_seen": 22486555824,
      "step": 28581
    },
    {
      "epoch": 3.032251220029705,
      "grad_norm": 0.6778254900935093,
      "learning_rate": 4.256527209613205e-05,
      "loss": 1.3418,
      "num_input_tokens_seen": 22487342656,
      "step": 28582
    },
    {
      "epoch": 3.0323573095692766,
      "grad_norm": 0.4039164686067401,
      "learning_rate": 4.256477756741201e-05,
      "loss": 1.4065,
      "num_input_tokens_seen": 22488129296,
      "step": 28583
    },
    {
      "epoch": 3.0324633991088477,
      "grad_norm": 0.5955327389690602,
      "learning_rate": 4.256428302511842e-05,
      "loss": 1.4849,
      "num_input_tokens_seen": 22488916032,
      "step": 28584
    },
    {
      "epoch": 3.032569488648419,
      "grad_norm": 0.5607360996453757,
      "learning_rate": 4.2563788469251666e-05,
      "loss": 1.4365,
      "num_input_tokens_seen": 22489702704,
      "step": 28585
    },
    {
      "epoch": 3.0326755781879906,
      "grad_norm": 0.4951155210413546,
      "learning_rate": 4.256329389981214e-05,
      "loss": 1.4723,
      "num_input_tokens_seen": 22490489408,
      "step": 28586
    },
    {
      "epoch": 3.032781667727562,
      "grad_norm": 0.6559558801859857,
      "learning_rate": 4.2562799316800205e-05,
      "loss": 1.518,
      "num_input_tokens_seen": 22491276112,
      "step": 28587
    },
    {
      "epoch": 3.0328877572671336,
      "grad_norm": 0.5510730441537668,
      "learning_rate": 4.256230472021626e-05,
      "loss": 1.4275,
      "num_input_tokens_seen": 22492062832,
      "step": 28588
    },
    {
      "epoch": 3.032993846806705,
      "grad_norm": 0.557076584702663,
      "learning_rate": 4.256181011006069e-05,
      "loss": 1.4405,
      "num_input_tokens_seen": 22492849552,
      "step": 28589
    },
    {
      "epoch": 3.033099936346276,
      "grad_norm": 0.4318903938901435,
      "learning_rate": 4.256131548633385e-05,
      "loss": 1.3248,
      "num_input_tokens_seen": 22493636336,
      "step": 28590
    },
    {
      "epoch": 3.0332060258858475,
      "grad_norm": 0.47215442686815096,
      "learning_rate": 4.2560820849036155e-05,
      "loss": 1.3805,
      "num_input_tokens_seen": 22494423200,
      "step": 28591
    },
    {
      "epoch": 3.033312115425419,
      "grad_norm": 0.45881556372406035,
      "learning_rate": 4.256032619816797e-05,
      "loss": 1.5141,
      "num_input_tokens_seen": 22495209920,
      "step": 28592
    },
    {
      "epoch": 3.0334182049649905,
      "grad_norm": 0.4715226014507535,
      "learning_rate": 4.255983153372968e-05,
      "loss": 1.5014,
      "num_input_tokens_seen": 22495996736,
      "step": 28593
    },
    {
      "epoch": 3.033524294504562,
      "grad_norm": 0.4273402620279691,
      "learning_rate": 4.2559336855721665e-05,
      "loss": 1.3658,
      "num_input_tokens_seen": 22496783488,
      "step": 28594
    },
    {
      "epoch": 3.0336303840441334,
      "grad_norm": 0.5093154016615804,
      "learning_rate": 4.255884216414431e-05,
      "loss": 1.5466,
      "num_input_tokens_seen": 22497570256,
      "step": 28595
    },
    {
      "epoch": 3.0337364735837045,
      "grad_norm": 0.4195176913093391,
      "learning_rate": 4.2558347458998e-05,
      "loss": 1.4119,
      "num_input_tokens_seen": 22498356976,
      "step": 28596
    },
    {
      "epoch": 3.033842563123276,
      "grad_norm": 0.43459411469804987,
      "learning_rate": 4.255785274028311e-05,
      "loss": 1.4213,
      "num_input_tokens_seen": 22499143808,
      "step": 28597
    },
    {
      "epoch": 3.0339486526628474,
      "grad_norm": 0.4261214412389307,
      "learning_rate": 4.255735800800003e-05,
      "loss": 1.4255,
      "num_input_tokens_seen": 22499930544,
      "step": 28598
    },
    {
      "epoch": 3.034054742202419,
      "grad_norm": 0.4381227735921754,
      "learning_rate": 4.255686326214914e-05,
      "loss": 1.4139,
      "num_input_tokens_seen": 22500717232,
      "step": 28599
    },
    {
      "epoch": 3.0341608317419904,
      "grad_norm": 0.42850395947075676,
      "learning_rate": 4.2556368502730816e-05,
      "loss": 1.5855,
      "num_input_tokens_seen": 22501504048,
      "step": 28600
    },
    {
      "epoch": 3.034266921281562,
      "grad_norm": 0.4470098372191536,
      "learning_rate": 4.255587372974545e-05,
      "loss": 1.4543,
      "num_input_tokens_seen": 22502290832,
      "step": 28601
    },
    {
      "epoch": 3.034373010821133,
      "grad_norm": 0.46775104132522766,
      "learning_rate": 4.255537894319342e-05,
      "loss": 1.5527,
      "num_input_tokens_seen": 22503077568,
      "step": 28602
    },
    {
      "epoch": 3.0344791003607043,
      "grad_norm": 0.3603592375600793,
      "learning_rate": 4.2554884143075104e-05,
      "loss": 1.3037,
      "num_input_tokens_seen": 22503864416,
      "step": 28603
    },
    {
      "epoch": 3.034585189900276,
      "grad_norm": 0.4584632371874738,
      "learning_rate": 4.255438932939089e-05,
      "loss": 1.5391,
      "num_input_tokens_seen": 22504651120,
      "step": 28604
    },
    {
      "epoch": 3.0346912794398473,
      "grad_norm": 0.4662645113788482,
      "learning_rate": 4.2553894502141165e-05,
      "loss": 1.4184,
      "num_input_tokens_seen": 22505437952,
      "step": 28605
    },
    {
      "epoch": 3.0347973689794188,
      "grad_norm": 0.4301968794889928,
      "learning_rate": 4.25533996613263e-05,
      "loss": 1.5888,
      "num_input_tokens_seen": 22506224688,
      "step": 28606
    },
    {
      "epoch": 3.0349034585189902,
      "grad_norm": 0.4316060878047335,
      "learning_rate": 4.255290480694668e-05,
      "loss": 1.5021,
      "num_input_tokens_seen": 22507011472,
      "step": 28607
    },
    {
      "epoch": 3.0350095480585613,
      "grad_norm": 0.4461722284959265,
      "learning_rate": 4.255240993900269e-05,
      "loss": 1.5044,
      "num_input_tokens_seen": 22507798256,
      "step": 28608
    },
    {
      "epoch": 3.0351156375981327,
      "grad_norm": 0.440044561558228,
      "learning_rate": 4.255191505749472e-05,
      "loss": 1.4162,
      "num_input_tokens_seen": 22508584976,
      "step": 28609
    },
    {
      "epoch": 3.035221727137704,
      "grad_norm": 0.4546364948703567,
      "learning_rate": 4.2551420162423144e-05,
      "loss": 1.5677,
      "num_input_tokens_seen": 22509371760,
      "step": 28610
    },
    {
      "epoch": 3.0353278166772757,
      "grad_norm": 0.5509549544397796,
      "learning_rate": 4.2550925253788345e-05,
      "loss": 1.4101,
      "num_input_tokens_seen": 22510158544,
      "step": 28611
    },
    {
      "epoch": 3.035433906216847,
      "grad_norm": 0.45217913552701966,
      "learning_rate": 4.25504303315907e-05,
      "loss": 1.4486,
      "num_input_tokens_seen": 22510945360,
      "step": 28612
    },
    {
      "epoch": 3.0355399957564186,
      "grad_norm": 0.47057967432583353,
      "learning_rate": 4.2549935395830605e-05,
      "loss": 1.4249,
      "num_input_tokens_seen": 22511732144,
      "step": 28613
    },
    {
      "epoch": 3.0356460852959897,
      "grad_norm": 0.5416518168167155,
      "learning_rate": 4.254944044650842e-05,
      "loss": 1.3502,
      "num_input_tokens_seen": 22512518896,
      "step": 28614
    },
    {
      "epoch": 3.035752174835561,
      "grad_norm": 0.4508174500531696,
      "learning_rate": 4.2548945483624566e-05,
      "loss": 1.4987,
      "num_input_tokens_seen": 22513305792,
      "step": 28615
    },
    {
      "epoch": 3.0358582643751326,
      "grad_norm": 0.4438325391622361,
      "learning_rate": 4.2548450507179386e-05,
      "loss": 1.3305,
      "num_input_tokens_seen": 22514092448,
      "step": 28616
    },
    {
      "epoch": 3.035964353914704,
      "grad_norm": 0.5159358492720889,
      "learning_rate": 4.2547955517173276e-05,
      "loss": 1.5052,
      "num_input_tokens_seen": 22514879216,
      "step": 28617
    },
    {
      "epoch": 3.0360704434542756,
      "grad_norm": 0.3966784855454441,
      "learning_rate": 4.254746051360663e-05,
      "loss": 1.4512,
      "num_input_tokens_seen": 22515666000,
      "step": 28618
    },
    {
      "epoch": 3.0361765329938466,
      "grad_norm": 0.4322706586610563,
      "learning_rate": 4.254696549647982e-05,
      "loss": 1.4506,
      "num_input_tokens_seen": 22516452816,
      "step": 28619
    },
    {
      "epoch": 3.036282622533418,
      "grad_norm": 0.4452789100444908,
      "learning_rate": 4.254647046579322e-05,
      "loss": 1.5081,
      "num_input_tokens_seen": 22517239552,
      "step": 28620
    },
    {
      "epoch": 3.0363887120729895,
      "grad_norm": 0.42643380522473545,
      "learning_rate": 4.254597542154724e-05,
      "loss": 1.4877,
      "num_input_tokens_seen": 22518026320,
      "step": 28621
    },
    {
      "epoch": 3.036494801612561,
      "grad_norm": 0.46476277148831263,
      "learning_rate": 4.254548036374223e-05,
      "loss": 1.387,
      "num_input_tokens_seen": 22518813040,
      "step": 28622
    },
    {
      "epoch": 3.0366008911521325,
      "grad_norm": 0.5127048598822224,
      "learning_rate": 4.2544985292378595e-05,
      "loss": 1.4557,
      "num_input_tokens_seen": 22519599712,
      "step": 28623
    },
    {
      "epoch": 3.036706980691704,
      "grad_norm": 0.5826806264614673,
      "learning_rate": 4.2544490207456704e-05,
      "loss": 1.5034,
      "num_input_tokens_seen": 22520386512,
      "step": 28624
    },
    {
      "epoch": 3.036813070231275,
      "grad_norm": 0.44705085684008367,
      "learning_rate": 4.254399510897695e-05,
      "loss": 1.375,
      "num_input_tokens_seen": 22521173344,
      "step": 28625
    },
    {
      "epoch": 3.0369191597708465,
      "grad_norm": 0.41204755079510713,
      "learning_rate": 4.2543499996939714e-05,
      "loss": 1.501,
      "num_input_tokens_seen": 22521960144,
      "step": 28626
    },
    {
      "epoch": 3.037025249310418,
      "grad_norm": 0.4666630107090767,
      "learning_rate": 4.254300487134537e-05,
      "loss": 1.5336,
      "num_input_tokens_seen": 22522746816,
      "step": 28627
    },
    {
      "epoch": 3.0371313388499894,
      "grad_norm": 0.3976166565863266,
      "learning_rate": 4.2542509732194313e-05,
      "loss": 1.4541,
      "num_input_tokens_seen": 22523533584,
      "step": 28628
    },
    {
      "epoch": 3.037237428389561,
      "grad_norm": 0.36536388060049557,
      "learning_rate": 4.254201457948691e-05,
      "loss": 1.2869,
      "num_input_tokens_seen": 22524320416,
      "step": 28629
    },
    {
      "epoch": 3.0373435179291324,
      "grad_norm": 0.4094331115751775,
      "learning_rate": 4.2541519413223564e-05,
      "loss": 1.4247,
      "num_input_tokens_seen": 22525107168,
      "step": 28630
    },
    {
      "epoch": 3.0374496074687034,
      "grad_norm": 0.43304825441157907,
      "learning_rate": 4.254102423340464e-05,
      "loss": 1.4067,
      "num_input_tokens_seen": 22525893888,
      "step": 28631
    },
    {
      "epoch": 3.037555697008275,
      "grad_norm": 0.454628809881767,
      "learning_rate": 4.254052904003053e-05,
      "loss": 1.4663,
      "num_input_tokens_seen": 22526680656,
      "step": 28632
    },
    {
      "epoch": 3.0376617865478464,
      "grad_norm": 0.44776131895703003,
      "learning_rate": 4.254003383310161e-05,
      "loss": 1.5342,
      "num_input_tokens_seen": 22527467328,
      "step": 28633
    },
    {
      "epoch": 3.037767876087418,
      "grad_norm": 0.573890171824088,
      "learning_rate": 4.2539538612618265e-05,
      "loss": 1.5359,
      "num_input_tokens_seen": 22528254112,
      "step": 28634
    },
    {
      "epoch": 3.0378739656269893,
      "grad_norm": 0.4183560200121775,
      "learning_rate": 4.253904337858089e-05,
      "loss": 1.4015,
      "num_input_tokens_seen": 22529040848,
      "step": 28635
    },
    {
      "epoch": 3.0379800551665608,
      "grad_norm": 0.5446256012049222,
      "learning_rate": 4.253854813098985e-05,
      "loss": 1.6127,
      "num_input_tokens_seen": 22529827696,
      "step": 28636
    },
    {
      "epoch": 3.038086144706132,
      "grad_norm": 0.42615755740562417,
      "learning_rate": 4.253805286984553e-05,
      "loss": 1.3503,
      "num_input_tokens_seen": 22530614592,
      "step": 28637
    },
    {
      "epoch": 3.0381922342457033,
      "grad_norm": 0.47092044381183573,
      "learning_rate": 4.253755759514833e-05,
      "loss": 1.585,
      "num_input_tokens_seen": 22531401312,
      "step": 28638
    },
    {
      "epoch": 3.0382983237852748,
      "grad_norm": 0.4119346463862204,
      "learning_rate": 4.25370623068986e-05,
      "loss": 1.4237,
      "num_input_tokens_seen": 22532188064,
      "step": 28639
    },
    {
      "epoch": 3.0384044133248462,
      "grad_norm": 0.43944660749158115,
      "learning_rate": 4.253656700509676e-05,
      "loss": 1.5061,
      "num_input_tokens_seen": 22532974784,
      "step": 28640
    },
    {
      "epoch": 3.0385105028644177,
      "grad_norm": 0.502139878145424,
      "learning_rate": 4.253607168974317e-05,
      "loss": 1.5485,
      "num_input_tokens_seen": 22533761584,
      "step": 28641
    },
    {
      "epoch": 3.038616592403989,
      "grad_norm": 0.4118994806248931,
      "learning_rate": 4.253557636083822e-05,
      "loss": 1.3932,
      "num_input_tokens_seen": 22534548400,
      "step": 28642
    },
    {
      "epoch": 3.03872268194356,
      "grad_norm": 0.44238160181588276,
      "learning_rate": 4.253508101838229e-05,
      "loss": 1.411,
      "num_input_tokens_seen": 22535335168,
      "step": 28643
    },
    {
      "epoch": 3.0388287714831317,
      "grad_norm": 0.5241054020561225,
      "learning_rate": 4.2534585662375757e-05,
      "loss": 1.4835,
      "num_input_tokens_seen": 22536121968,
      "step": 28644
    },
    {
      "epoch": 3.038934861022703,
      "grad_norm": 0.46696272348838985,
      "learning_rate": 4.253409029281902e-05,
      "loss": 1.3982,
      "num_input_tokens_seen": 22536908736,
      "step": 28645
    },
    {
      "epoch": 3.0390409505622746,
      "grad_norm": 0.5152825356295756,
      "learning_rate": 4.253359490971245e-05,
      "loss": 1.3432,
      "num_input_tokens_seen": 22537695536,
      "step": 28646
    },
    {
      "epoch": 3.039147040101846,
      "grad_norm": 0.42775792375652827,
      "learning_rate": 4.2533099513056426e-05,
      "loss": 1.4174,
      "num_input_tokens_seen": 22538482304,
      "step": 28647
    },
    {
      "epoch": 3.039253129641417,
      "grad_norm": 0.4646609658684388,
      "learning_rate": 4.2532604102851346e-05,
      "loss": 1.2961,
      "num_input_tokens_seen": 22539269088,
      "step": 28648
    },
    {
      "epoch": 3.0393592191809886,
      "grad_norm": 0.4116080775365495,
      "learning_rate": 4.253210867909759e-05,
      "loss": 1.4676,
      "num_input_tokens_seen": 22540055824,
      "step": 28649
    },
    {
      "epoch": 3.03946530872056,
      "grad_norm": 0.4457760132185134,
      "learning_rate": 4.253161324179552e-05,
      "loss": 1.5058,
      "num_input_tokens_seen": 22540842512,
      "step": 28650
    },
    {
      "epoch": 3.0395713982601316,
      "grad_norm": 0.4191080475967438,
      "learning_rate": 4.253111779094554e-05,
      "loss": 1.4816,
      "num_input_tokens_seen": 22541629232,
      "step": 28651
    },
    {
      "epoch": 3.039677487799703,
      "grad_norm": 0.44146743940235633,
      "learning_rate": 4.253062232654803e-05,
      "loss": 1.5166,
      "num_input_tokens_seen": 22542416016,
      "step": 28652
    },
    {
      "epoch": 3.0397835773392745,
      "grad_norm": 0.387913182296119,
      "learning_rate": 4.2530126848603366e-05,
      "loss": 1.439,
      "num_input_tokens_seen": 22543202848,
      "step": 28653
    },
    {
      "epoch": 3.0398896668788455,
      "grad_norm": 0.4084178195667373,
      "learning_rate": 4.2529631357111935e-05,
      "loss": 1.4976,
      "num_input_tokens_seen": 22543989584,
      "step": 28654
    },
    {
      "epoch": 3.039995756418417,
      "grad_norm": 0.49161121335879143,
      "learning_rate": 4.252913585207412e-05,
      "loss": 1.503,
      "num_input_tokens_seen": 22544776432,
      "step": 28655
    },
    {
      "epoch": 3.0401018459579885,
      "grad_norm": 0.396867776435822,
      "learning_rate": 4.25286403334903e-05,
      "loss": 1.4338,
      "num_input_tokens_seen": 22545563264,
      "step": 28656
    },
    {
      "epoch": 3.04020793549756,
      "grad_norm": 0.4303700487329518,
      "learning_rate": 4.252814480136086e-05,
      "loss": 1.4255,
      "num_input_tokens_seen": 22546350032,
      "step": 28657
    },
    {
      "epoch": 3.0403140250371314,
      "grad_norm": 0.3865627939667828,
      "learning_rate": 4.252764925568619e-05,
      "loss": 1.5545,
      "num_input_tokens_seen": 22547136816,
      "step": 28658
    },
    {
      "epoch": 3.040420114576703,
      "grad_norm": 0.4226761766282169,
      "learning_rate": 4.252715369646666e-05,
      "loss": 1.5241,
      "num_input_tokens_seen": 22547923536,
      "step": 28659
    },
    {
      "epoch": 3.040526204116274,
      "grad_norm": 0.39979809760094076,
      "learning_rate": 4.252665812370267e-05,
      "loss": 1.5788,
      "num_input_tokens_seen": 22548710320,
      "step": 28660
    },
    {
      "epoch": 3.0406322936558454,
      "grad_norm": 0.4272962927522145,
      "learning_rate": 4.2526162537394574e-05,
      "loss": 1.3831,
      "num_input_tokens_seen": 22549497104,
      "step": 28661
    },
    {
      "epoch": 3.040738383195417,
      "grad_norm": 0.49319421533890895,
      "learning_rate": 4.2525666937542794e-05,
      "loss": 1.4471,
      "num_input_tokens_seen": 22550283872,
      "step": 28662
    },
    {
      "epoch": 3.0408444727349884,
      "grad_norm": 0.3968184962854142,
      "learning_rate": 4.252517132414768e-05,
      "loss": 1.4661,
      "num_input_tokens_seen": 22551070640,
      "step": 28663
    },
    {
      "epoch": 3.04095056227456,
      "grad_norm": 0.38090729245102156,
      "learning_rate": 4.252467569720964e-05,
      "loss": 1.4659,
      "num_input_tokens_seen": 22551857456,
      "step": 28664
    },
    {
      "epoch": 3.0410566518141313,
      "grad_norm": 0.3657223571439408,
      "learning_rate": 4.252418005672903e-05,
      "loss": 1.3571,
      "num_input_tokens_seen": 22552644272,
      "step": 28665
    },
    {
      "epoch": 3.0411627413537023,
      "grad_norm": 0.4357033246353355,
      "learning_rate": 4.2523684402706253e-05,
      "loss": 1.4303,
      "num_input_tokens_seen": 22553431040,
      "step": 28666
    },
    {
      "epoch": 3.041268830893274,
      "grad_norm": 0.4400039856688097,
      "learning_rate": 4.25231887351417e-05,
      "loss": 1.3776,
      "num_input_tokens_seen": 22554217792,
      "step": 28667
    },
    {
      "epoch": 3.0413749204328453,
      "grad_norm": 0.41652723931310204,
      "learning_rate": 4.252269305403572e-05,
      "loss": 1.3305,
      "num_input_tokens_seen": 22555004576,
      "step": 28668
    },
    {
      "epoch": 3.0414810099724168,
      "grad_norm": 0.5814808045598601,
      "learning_rate": 4.252219735938873e-05,
      "loss": 1.4262,
      "num_input_tokens_seen": 22555791328,
      "step": 28669
    },
    {
      "epoch": 3.0415870995119882,
      "grad_norm": 0.45520409261600164,
      "learning_rate": 4.25217016512011e-05,
      "loss": 1.3874,
      "num_input_tokens_seen": 22556578144,
      "step": 28670
    },
    {
      "epoch": 3.0416931890515597,
      "grad_norm": 0.49523068328970343,
      "learning_rate": 4.252120592947321e-05,
      "loss": 1.4242,
      "num_input_tokens_seen": 22557364880,
      "step": 28671
    },
    {
      "epoch": 3.0417992785911308,
      "grad_norm": 0.3879254500185295,
      "learning_rate": 4.2520710194205446e-05,
      "loss": 1.3694,
      "num_input_tokens_seen": 22558151648,
      "step": 28672
    },
    {
      "epoch": 3.0419053681307022,
      "grad_norm": 0.4847911210639243,
      "learning_rate": 4.2520214445398186e-05,
      "loss": 1.4463,
      "num_input_tokens_seen": 22558938448,
      "step": 28673
    },
    {
      "epoch": 3.0420114576702737,
      "grad_norm": 0.4564752388030329,
      "learning_rate": 4.251971868305183e-05,
      "loss": 1.4896,
      "num_input_tokens_seen": 22559725216,
      "step": 28674
    },
    {
      "epoch": 3.042117547209845,
      "grad_norm": 0.5359692474547783,
      "learning_rate": 4.251922290716674e-05,
      "loss": 1.3916,
      "num_input_tokens_seen": 22560512032,
      "step": 28675
    },
    {
      "epoch": 3.0422236367494166,
      "grad_norm": 0.39395985686887813,
      "learning_rate": 4.251872711774331e-05,
      "loss": 1.3868,
      "num_input_tokens_seen": 22561298816,
      "step": 28676
    },
    {
      "epoch": 3.042329726288988,
      "grad_norm": 0.5940479867990369,
      "learning_rate": 4.251823131478193e-05,
      "loss": 1.5541,
      "num_input_tokens_seen": 22562085536,
      "step": 28677
    },
    {
      "epoch": 3.042435815828559,
      "grad_norm": 0.4634071680052991,
      "learning_rate": 4.2517735498282964e-05,
      "loss": 1.521,
      "num_input_tokens_seen": 22562872400,
      "step": 28678
    },
    {
      "epoch": 3.0425419053681306,
      "grad_norm": 0.74958879569087,
      "learning_rate": 4.251723966824681e-05,
      "loss": 1.4626,
      "num_input_tokens_seen": 22563659200,
      "step": 28679
    },
    {
      "epoch": 3.042647994907702,
      "grad_norm": 0.4778023991236711,
      "learning_rate": 4.251674382467385e-05,
      "loss": 1.5484,
      "num_input_tokens_seen": 22564445936,
      "step": 28680
    },
    {
      "epoch": 3.0427540844472736,
      "grad_norm": 0.7654197988403557,
      "learning_rate": 4.251624796756446e-05,
      "loss": 1.3435,
      "num_input_tokens_seen": 22565232736,
      "step": 28681
    },
    {
      "epoch": 3.042860173986845,
      "grad_norm": 0.5731100441903013,
      "learning_rate": 4.2515752096919034e-05,
      "loss": 1.5277,
      "num_input_tokens_seen": 22566019408,
      "step": 28682
    },
    {
      "epoch": 3.042966263526416,
      "grad_norm": 0.6564950743900245,
      "learning_rate": 4.2515256212737945e-05,
      "loss": 1.4452,
      "num_input_tokens_seen": 22566806192,
      "step": 28683
    },
    {
      "epoch": 3.0430723530659876,
      "grad_norm": 0.6796564921264792,
      "learning_rate": 4.2514760315021574e-05,
      "loss": 1.4995,
      "num_input_tokens_seen": 22567592880,
      "step": 28684
    },
    {
      "epoch": 3.043178442605559,
      "grad_norm": 0.7833642109228721,
      "learning_rate": 4.251426440377032e-05,
      "loss": 1.4956,
      "num_input_tokens_seen": 22568379712,
      "step": 28685
    },
    {
      "epoch": 3.0432845321451305,
      "grad_norm": 0.46872955489176926,
      "learning_rate": 4.2513768478984553e-05,
      "loss": 1.5475,
      "num_input_tokens_seen": 22569166496,
      "step": 28686
    },
    {
      "epoch": 3.043390621684702,
      "grad_norm": 0.5882272493496258,
      "learning_rate": 4.251327254066465e-05,
      "loss": 1.4085,
      "num_input_tokens_seen": 22569953280,
      "step": 28687
    },
    {
      "epoch": 3.0434967112242735,
      "grad_norm": 0.38738253198906814,
      "learning_rate": 4.251277658881102e-05,
      "loss": 1.4831,
      "num_input_tokens_seen": 22570740000,
      "step": 28688
    },
    {
      "epoch": 3.0436028007638445,
      "grad_norm": 0.43207825485675505,
      "learning_rate": 4.2512280623424016e-05,
      "loss": 1.4741,
      "num_input_tokens_seen": 22571526784,
      "step": 28689
    },
    {
      "epoch": 3.043708890303416,
      "grad_norm": 0.44997016907405546,
      "learning_rate": 4.251178464450405e-05,
      "loss": 1.3316,
      "num_input_tokens_seen": 22572313616,
      "step": 28690
    },
    {
      "epoch": 3.0438149798429874,
      "grad_norm": 0.41013346019284397,
      "learning_rate": 4.251128865205148e-05,
      "loss": 1.4697,
      "num_input_tokens_seen": 22573100288,
      "step": 28691
    },
    {
      "epoch": 3.043921069382559,
      "grad_norm": 0.44992692795672823,
      "learning_rate": 4.25107926460667e-05,
      "loss": 1.4768,
      "num_input_tokens_seen": 22573887072,
      "step": 28692
    },
    {
      "epoch": 3.0440271589221304,
      "grad_norm": 0.5090765486166081,
      "learning_rate": 4.2510296626550096e-05,
      "loss": 1.4556,
      "num_input_tokens_seen": 22574673824,
      "step": 28693
    },
    {
      "epoch": 3.044133248461702,
      "grad_norm": 0.4669790357389525,
      "learning_rate": 4.2509800593502045e-05,
      "loss": 1.475,
      "num_input_tokens_seen": 22575460608,
      "step": 28694
    },
    {
      "epoch": 3.044239338001273,
      "grad_norm": 0.42768052528155315,
      "learning_rate": 4.250930454692294e-05,
      "loss": 1.4619,
      "num_input_tokens_seen": 22576247328,
      "step": 28695
    },
    {
      "epoch": 3.0443454275408444,
      "grad_norm": 0.38050289232086165,
      "learning_rate": 4.2508808486813156e-05,
      "loss": 1.4333,
      "num_input_tokens_seen": 22577034160,
      "step": 28696
    },
    {
      "epoch": 3.044451517080416,
      "grad_norm": 0.38661035876134975,
      "learning_rate": 4.250831241317308e-05,
      "loss": 1.4882,
      "num_input_tokens_seen": 22577820928,
      "step": 28697
    },
    {
      "epoch": 3.0445576066199873,
      "grad_norm": 0.46476353992140174,
      "learning_rate": 4.250781632600309e-05,
      "loss": 1.425,
      "num_input_tokens_seen": 22578607664,
      "step": 28698
    },
    {
      "epoch": 3.044663696159559,
      "grad_norm": 0.4633324604146512,
      "learning_rate": 4.250732022530357e-05,
      "loss": 1.3295,
      "num_input_tokens_seen": 22579394400,
      "step": 28699
    },
    {
      "epoch": 3.0447697856991303,
      "grad_norm": 0.4488567867738417,
      "learning_rate": 4.250682411107492e-05,
      "loss": 1.4534,
      "num_input_tokens_seen": 22580181152,
      "step": 28700
    },
    {
      "epoch": 3.0448758752387013,
      "grad_norm": 0.4924917031648804,
      "learning_rate": 4.2506327983317496e-05,
      "loss": 1.523,
      "num_input_tokens_seen": 22580967872,
      "step": 28701
    },
    {
      "epoch": 3.0449819647782728,
      "grad_norm": 0.47105125275656845,
      "learning_rate": 4.25058318420317e-05,
      "loss": 1.4798,
      "num_input_tokens_seen": 22581754592,
      "step": 28702
    },
    {
      "epoch": 3.0450880543178442,
      "grad_norm": 0.5769792504517405,
      "learning_rate": 4.250533568721792e-05,
      "loss": 1.4267,
      "num_input_tokens_seen": 22582541296,
      "step": 28703
    },
    {
      "epoch": 3.0451941438574157,
      "grad_norm": 0.4319680303274163,
      "learning_rate": 4.2504839518876514e-05,
      "loss": 1.3078,
      "num_input_tokens_seen": 22583328176,
      "step": 28704
    },
    {
      "epoch": 3.045300233396987,
      "grad_norm": 0.4033611394649854,
      "learning_rate": 4.250434333700789e-05,
      "loss": 1.4201,
      "num_input_tokens_seen": 22584114944,
      "step": 28705
    },
    {
      "epoch": 3.0454063229365587,
      "grad_norm": 0.5719737030282955,
      "learning_rate": 4.250384714161242e-05,
      "loss": 1.4977,
      "num_input_tokens_seen": 22584901808,
      "step": 28706
    },
    {
      "epoch": 3.0455124124761297,
      "grad_norm": 0.5495831232718796,
      "learning_rate": 4.25033509326905e-05,
      "loss": 1.3677,
      "num_input_tokens_seen": 22585688400,
      "step": 28707
    },
    {
      "epoch": 3.045618502015701,
      "grad_norm": 0.4214692471316447,
      "learning_rate": 4.2502854710242497e-05,
      "loss": 1.487,
      "num_input_tokens_seen": 22586475120,
      "step": 28708
    },
    {
      "epoch": 3.0457245915552726,
      "grad_norm": 0.4124529473515351,
      "learning_rate": 4.25023584742688e-05,
      "loss": 1.6305,
      "num_input_tokens_seen": 22587261792,
      "step": 28709
    },
    {
      "epoch": 3.045830681094844,
      "grad_norm": 0.4790019420377781,
      "learning_rate": 4.25018622247698e-05,
      "loss": 1.3952,
      "num_input_tokens_seen": 22588048608,
      "step": 28710
    },
    {
      "epoch": 3.0459367706344156,
      "grad_norm": 0.42607166099349253,
      "learning_rate": 4.2501365961745864e-05,
      "loss": 1.5184,
      "num_input_tokens_seen": 22588835376,
      "step": 28711
    },
    {
      "epoch": 3.046042860173987,
      "grad_norm": 0.6000936399208423,
      "learning_rate": 4.250086968519739e-05,
      "loss": 1.5647,
      "num_input_tokens_seen": 22589622128,
      "step": 28712
    },
    {
      "epoch": 3.046148949713558,
      "grad_norm": 0.4077497753515629,
      "learning_rate": 4.250037339512476e-05,
      "loss": 1.3966,
      "num_input_tokens_seen": 22590408864,
      "step": 28713
    },
    {
      "epoch": 3.0462550392531296,
      "grad_norm": 0.42737527033835926,
      "learning_rate": 4.249987709152835e-05,
      "loss": 1.415,
      "num_input_tokens_seen": 22591195680,
      "step": 28714
    },
    {
      "epoch": 3.046361128792701,
      "grad_norm": 0.569782320135375,
      "learning_rate": 4.249938077440856e-05,
      "loss": 1.5826,
      "num_input_tokens_seen": 22591982432,
      "step": 28715
    },
    {
      "epoch": 3.0464672183322725,
      "grad_norm": 0.5168287417399168,
      "learning_rate": 4.249888444376575e-05,
      "loss": 1.5053,
      "num_input_tokens_seen": 22592769248,
      "step": 28716
    },
    {
      "epoch": 3.046573307871844,
      "grad_norm": 0.7252180102323948,
      "learning_rate": 4.249838809960032e-05,
      "loss": 1.4738,
      "num_input_tokens_seen": 22593555952,
      "step": 28717
    },
    {
      "epoch": 3.046679397411415,
      "grad_norm": 0.6400167682682324,
      "learning_rate": 4.2497891741912656e-05,
      "loss": 1.586,
      "num_input_tokens_seen": 22594342720,
      "step": 28718
    },
    {
      "epoch": 3.0467854869509865,
      "grad_norm": 0.5292605532384966,
      "learning_rate": 4.249739537070312e-05,
      "loss": 1.4087,
      "num_input_tokens_seen": 22595129392,
      "step": 28719
    },
    {
      "epoch": 3.046891576490558,
      "grad_norm": 0.9614636523371172,
      "learning_rate": 4.2496898985972125e-05,
      "loss": 1.5749,
      "num_input_tokens_seen": 22595916128,
      "step": 28720
    },
    {
      "epoch": 3.0469976660301294,
      "grad_norm": 0.44911592883481244,
      "learning_rate": 4.249640258772003e-05,
      "loss": 1.4316,
      "num_input_tokens_seen": 22596702864,
      "step": 28721
    },
    {
      "epoch": 3.047103755569701,
      "grad_norm": 0.9878869590160252,
      "learning_rate": 4.249590617594723e-05,
      "loss": 1.4448,
      "num_input_tokens_seen": 22597489616,
      "step": 28722
    },
    {
      "epoch": 3.0472098451092724,
      "grad_norm": 0.4487726726169653,
      "learning_rate": 4.249540975065411e-05,
      "loss": 1.4126,
      "num_input_tokens_seen": 22598276368,
      "step": 28723
    },
    {
      "epoch": 3.0473159346488434,
      "grad_norm": 0.7724628330538564,
      "learning_rate": 4.249491331184105e-05,
      "loss": 1.4142,
      "num_input_tokens_seen": 22599063136,
      "step": 28724
    },
    {
      "epoch": 3.047422024188415,
      "grad_norm": 0.629943914351932,
      "learning_rate": 4.2494416859508436e-05,
      "loss": 1.4425,
      "num_input_tokens_seen": 22599849792,
      "step": 28725
    },
    {
      "epoch": 3.0475281137279864,
      "grad_norm": 0.5412939668042024,
      "learning_rate": 4.249392039365664e-05,
      "loss": 1.4259,
      "num_input_tokens_seen": 22600636512,
      "step": 28726
    },
    {
      "epoch": 3.047634203267558,
      "grad_norm": 0.8243308998810825,
      "learning_rate": 4.249342391428607e-05,
      "loss": 1.4786,
      "num_input_tokens_seen": 22601423312,
      "step": 28727
    },
    {
      "epoch": 3.0477402928071293,
      "grad_norm": 0.48481806412442396,
      "learning_rate": 4.249292742139709e-05,
      "loss": 1.475,
      "num_input_tokens_seen": 22602210032,
      "step": 28728
    },
    {
      "epoch": 3.047846382346701,
      "grad_norm": 0.7246176674522341,
      "learning_rate": 4.2492430914990084e-05,
      "loss": 1.4571,
      "num_input_tokens_seen": 22602996880,
      "step": 28729
    },
    {
      "epoch": 3.047952471886272,
      "grad_norm": 0.634355394868239,
      "learning_rate": 4.249193439506544e-05,
      "loss": 1.4988,
      "num_input_tokens_seen": 22603783712,
      "step": 28730
    },
    {
      "epoch": 3.0480585614258433,
      "grad_norm": 0.47785655921045883,
      "learning_rate": 4.249143786162355e-05,
      "loss": 1.3557,
      "num_input_tokens_seen": 22604570512,
      "step": 28731
    },
    {
      "epoch": 3.048164650965415,
      "grad_norm": 0.6960040785012466,
      "learning_rate": 4.249094131466479e-05,
      "loss": 1.4748,
      "num_input_tokens_seen": 22605357312,
      "step": 28732
    },
    {
      "epoch": 3.0482707405049863,
      "grad_norm": 0.6358449178685219,
      "learning_rate": 4.249044475418954e-05,
      "loss": 1.5432,
      "num_input_tokens_seen": 22606144064,
      "step": 28733
    },
    {
      "epoch": 3.0483768300445577,
      "grad_norm": 0.585525622958067,
      "learning_rate": 4.248994818019819e-05,
      "loss": 1.4859,
      "num_input_tokens_seen": 22606930832,
      "step": 28734
    },
    {
      "epoch": 3.048482919584129,
      "grad_norm": 0.8159369022413145,
      "learning_rate": 4.248945159269112e-05,
      "loss": 1.504,
      "num_input_tokens_seen": 22607717536,
      "step": 28735
    },
    {
      "epoch": 3.0485890091237002,
      "grad_norm": 0.41205773936505063,
      "learning_rate": 4.248895499166871e-05,
      "loss": 1.4467,
      "num_input_tokens_seen": 22608504448,
      "step": 28736
    },
    {
      "epoch": 3.0486950986632717,
      "grad_norm": 0.8835450915814488,
      "learning_rate": 4.2488458377131354e-05,
      "loss": 1.4897,
      "num_input_tokens_seen": 22609291216,
      "step": 28737
    },
    {
      "epoch": 3.048801188202843,
      "grad_norm": 0.506440992424188,
      "learning_rate": 4.248796174907943e-05,
      "loss": 1.5302,
      "num_input_tokens_seen": 22610077952,
      "step": 28738
    },
    {
      "epoch": 3.0489072777424147,
      "grad_norm": 0.6877968513313465,
      "learning_rate": 4.2487465107513316e-05,
      "loss": 1.3696,
      "num_input_tokens_seen": 22610864736,
      "step": 28739
    },
    {
      "epoch": 3.049013367281986,
      "grad_norm": 0.624825142118653,
      "learning_rate": 4.248696845243341e-05,
      "loss": 1.364,
      "num_input_tokens_seen": 22611651456,
      "step": 28740
    },
    {
      "epoch": 3.0491194568215576,
      "grad_norm": 0.5010924470572301,
      "learning_rate": 4.248647178384009e-05,
      "loss": 1.4548,
      "num_input_tokens_seen": 22612438224,
      "step": 28741
    },
    {
      "epoch": 3.0492255463611286,
      "grad_norm": 0.7445151461649417,
      "learning_rate": 4.248597510173373e-05,
      "loss": 1.498,
      "num_input_tokens_seen": 22613225008,
      "step": 28742
    },
    {
      "epoch": 3.0493316359007,
      "grad_norm": 0.44004586482008484,
      "learning_rate": 4.248547840611472e-05,
      "loss": 1.4278,
      "num_input_tokens_seen": 22614011728,
      "step": 28743
    },
    {
      "epoch": 3.0494377254402716,
      "grad_norm": 0.6756413720993116,
      "learning_rate": 4.248498169698345e-05,
      "loss": 1.4808,
      "num_input_tokens_seen": 22614798576,
      "step": 28744
    },
    {
      "epoch": 3.049543814979843,
      "grad_norm": 0.4371528069919153,
      "learning_rate": 4.24844849743403e-05,
      "loss": 1.4605,
      "num_input_tokens_seen": 22615585264,
      "step": 28745
    },
    {
      "epoch": 3.0496499045194145,
      "grad_norm": 0.6344607397924072,
      "learning_rate": 4.2483988238185654e-05,
      "loss": 1.5476,
      "num_input_tokens_seen": 22616371952,
      "step": 28746
    },
    {
      "epoch": 3.0497559940589856,
      "grad_norm": 0.5281937075785507,
      "learning_rate": 4.2483491488519885e-05,
      "loss": 1.5315,
      "num_input_tokens_seen": 22617158656,
      "step": 28747
    },
    {
      "epoch": 3.049862083598557,
      "grad_norm": 0.5084564015621514,
      "learning_rate": 4.2482994725343407e-05,
      "loss": 1.4679,
      "num_input_tokens_seen": 22617945440,
      "step": 28748
    },
    {
      "epoch": 3.0499681731381285,
      "grad_norm": 0.436631110929692,
      "learning_rate": 4.248249794865657e-05,
      "loss": 1.4944,
      "num_input_tokens_seen": 22618732176,
      "step": 28749
    },
    {
      "epoch": 3.0500742626777,
      "grad_norm": 0.4597689227878237,
      "learning_rate": 4.248200115845977e-05,
      "loss": 1.447,
      "num_input_tokens_seen": 22619518944,
      "step": 28750
    },
    {
      "epoch": 3.0501803522172715,
      "grad_norm": 0.40610002365560854,
      "learning_rate": 4.24815043547534e-05,
      "loss": 1.5081,
      "num_input_tokens_seen": 22620305648,
      "step": 28751
    },
    {
      "epoch": 3.050286441756843,
      "grad_norm": 0.4126614497108935,
      "learning_rate": 4.248100753753783e-05,
      "loss": 1.2433,
      "num_input_tokens_seen": 22621092496,
      "step": 28752
    },
    {
      "epoch": 3.050392531296414,
      "grad_norm": 0.46081938462805777,
      "learning_rate": 4.248051070681345e-05,
      "loss": 1.3541,
      "num_input_tokens_seen": 22621879344,
      "step": 28753
    },
    {
      "epoch": 3.0504986208359854,
      "grad_norm": 0.48642902661482074,
      "learning_rate": 4.2480013862580646e-05,
      "loss": 1.5014,
      "num_input_tokens_seen": 22622666128,
      "step": 28754
    },
    {
      "epoch": 3.050604710375557,
      "grad_norm": 0.6491384769768017,
      "learning_rate": 4.24795170048398e-05,
      "loss": 1.4245,
      "num_input_tokens_seen": 22623452848,
      "step": 28755
    },
    {
      "epoch": 3.0507107999151284,
      "grad_norm": 0.6840192605829377,
      "learning_rate": 4.24790201335913e-05,
      "loss": 1.4651,
      "num_input_tokens_seen": 22624239680,
      "step": 28756
    },
    {
      "epoch": 3.0508168894547,
      "grad_norm": 1.7195647319518286,
      "learning_rate": 4.2478523248835525e-05,
      "loss": 1.3412,
      "num_input_tokens_seen": 22625026464,
      "step": 28757
    },
    {
      "epoch": 3.0509229789942713,
      "grad_norm": 1.1059362004931905,
      "learning_rate": 4.2478026350572856e-05,
      "loss": 1.4707,
      "num_input_tokens_seen": 22625813136,
      "step": 28758
    },
    {
      "epoch": 3.0510290685338424,
      "grad_norm": 0.9482018639887821,
      "learning_rate": 4.247752943880368e-05,
      "loss": 1.4754,
      "num_input_tokens_seen": 22626599968,
      "step": 28759
    },
    {
      "epoch": 3.051135158073414,
      "grad_norm": 0.7619802278754578,
      "learning_rate": 4.247703251352839e-05,
      "loss": 1.5409,
      "num_input_tokens_seen": 22627386624,
      "step": 28760
    },
    {
      "epoch": 3.0512412476129853,
      "grad_norm": 0.7041340680506921,
      "learning_rate": 4.247653557474736e-05,
      "loss": 1.3678,
      "num_input_tokens_seen": 22628173392,
      "step": 28761
    },
    {
      "epoch": 3.051347337152557,
      "grad_norm": 0.709393195742814,
      "learning_rate": 4.247603862246097e-05,
      "loss": 1.3762,
      "num_input_tokens_seen": 22628960080,
      "step": 28762
    },
    {
      "epoch": 3.0514534266921283,
      "grad_norm": 0.708923364872986,
      "learning_rate": 4.2475541656669606e-05,
      "loss": 1.5948,
      "num_input_tokens_seen": 22629746816,
      "step": 28763
    },
    {
      "epoch": 3.0515595162316997,
      "grad_norm": 0.4288800483558467,
      "learning_rate": 4.247504467737367e-05,
      "loss": 1.3278,
      "num_input_tokens_seen": 22630533584,
      "step": 28764
    },
    {
      "epoch": 3.0516656057712708,
      "grad_norm": 0.741600342329869,
      "learning_rate": 4.247454768457352e-05,
      "loss": 1.3881,
      "num_input_tokens_seen": 22631320400,
      "step": 28765
    },
    {
      "epoch": 3.0517716953108422,
      "grad_norm": 0.584523975346776,
      "learning_rate": 4.2474050678269564e-05,
      "loss": 1.3775,
      "num_input_tokens_seen": 22632107200,
      "step": 28766
    },
    {
      "epoch": 3.0518777848504137,
      "grad_norm": 0.5191397642959669,
      "learning_rate": 4.247355365846216e-05,
      "loss": 1.5596,
      "num_input_tokens_seen": 22632893856,
      "step": 28767
    },
    {
      "epoch": 3.051983874389985,
      "grad_norm": 0.5800289001920866,
      "learning_rate": 4.2473056625151716e-05,
      "loss": 1.5142,
      "num_input_tokens_seen": 22633680592,
      "step": 28768
    },
    {
      "epoch": 3.0520899639295567,
      "grad_norm": 0.6016838373447749,
      "learning_rate": 4.247255957833861e-05,
      "loss": 1.444,
      "num_input_tokens_seen": 22634467360,
      "step": 28769
    },
    {
      "epoch": 3.052196053469128,
      "grad_norm": 0.4832536012416645,
      "learning_rate": 4.247206251802322e-05,
      "loss": 1.4071,
      "num_input_tokens_seen": 22635254144,
      "step": 28770
    },
    {
      "epoch": 3.052302143008699,
      "grad_norm": 0.5700319501204383,
      "learning_rate": 4.247156544420593e-05,
      "loss": 1.4718,
      "num_input_tokens_seen": 22636040928,
      "step": 28771
    },
    {
      "epoch": 3.0524082325482707,
      "grad_norm": 0.7413899098713977,
      "learning_rate": 4.247106835688712e-05,
      "loss": 1.3843,
      "num_input_tokens_seen": 22636827696,
      "step": 28772
    },
    {
      "epoch": 3.052514322087842,
      "grad_norm": 0.4738296855732493,
      "learning_rate": 4.2470571256067195e-05,
      "loss": 1.431,
      "num_input_tokens_seen": 22637614480,
      "step": 28773
    },
    {
      "epoch": 3.0526204116274136,
      "grad_norm": 0.5057512496460594,
      "learning_rate": 4.247007414174652e-05,
      "loss": 1.3427,
      "num_input_tokens_seen": 22638401280,
      "step": 28774
    },
    {
      "epoch": 3.052726501166985,
      "grad_norm": 0.7680227681335328,
      "learning_rate": 4.246957701392548e-05,
      "loss": 1.5028,
      "num_input_tokens_seen": 22639188000,
      "step": 28775
    },
    {
      "epoch": 3.0528325907065565,
      "grad_norm": 0.6272653173179229,
      "learning_rate": 4.2469079872604464e-05,
      "loss": 1.3902,
      "num_input_tokens_seen": 22639974800,
      "step": 28776
    },
    {
      "epoch": 3.0529386802461276,
      "grad_norm": 0.6031886793505417,
      "learning_rate": 4.2468582717783864e-05,
      "loss": 1.4766,
      "num_input_tokens_seen": 22640761632,
      "step": 28777
    },
    {
      "epoch": 3.053044769785699,
      "grad_norm": 0.4922190498315963,
      "learning_rate": 4.246808554946405e-05,
      "loss": 1.5704,
      "num_input_tokens_seen": 22641548352,
      "step": 28778
    },
    {
      "epoch": 3.0531508593252705,
      "grad_norm": 0.5687018012591801,
      "learning_rate": 4.246758836764541e-05,
      "loss": 1.4467,
      "num_input_tokens_seen": 22642335152,
      "step": 28779
    },
    {
      "epoch": 3.053256948864842,
      "grad_norm": 0.6070775595139146,
      "learning_rate": 4.246709117232833e-05,
      "loss": 1.3821,
      "num_input_tokens_seen": 22643121872,
      "step": 28780
    },
    {
      "epoch": 3.0533630384044135,
      "grad_norm": 0.4969196371474619,
      "learning_rate": 4.24665939635132e-05,
      "loss": 1.4917,
      "num_input_tokens_seen": 22643908592,
      "step": 28781
    },
    {
      "epoch": 3.0534691279439845,
      "grad_norm": 0.8159233524257623,
      "learning_rate": 4.24660967412004e-05,
      "loss": 1.4756,
      "num_input_tokens_seen": 22644695376,
      "step": 28782
    },
    {
      "epoch": 3.053575217483556,
      "grad_norm": 0.4295059187871652,
      "learning_rate": 4.2465599505390305e-05,
      "loss": 1.4627,
      "num_input_tokens_seen": 22645482128,
      "step": 28783
    },
    {
      "epoch": 3.0536813070231275,
      "grad_norm": 0.5214783825615308,
      "learning_rate": 4.246510225608331e-05,
      "loss": 1.3981,
      "num_input_tokens_seen": 22646268896,
      "step": 28784
    },
    {
      "epoch": 3.053787396562699,
      "grad_norm": 0.3921911231594586,
      "learning_rate": 4.24646049932798e-05,
      "loss": 1.4244,
      "num_input_tokens_seen": 22647055664,
      "step": 28785
    },
    {
      "epoch": 3.0538934861022704,
      "grad_norm": 0.4504083070100164,
      "learning_rate": 4.246410771698015e-05,
      "loss": 1.3982,
      "num_input_tokens_seen": 22647842352,
      "step": 28786
    },
    {
      "epoch": 3.053999575641842,
      "grad_norm": 0.4238690915470453,
      "learning_rate": 4.2463610427184755e-05,
      "loss": 1.4029,
      "num_input_tokens_seen": 22648629168,
      "step": 28787
    },
    {
      "epoch": 3.054105665181413,
      "grad_norm": 0.4296783565242455,
      "learning_rate": 4.2463113123894e-05,
      "loss": 1.4095,
      "num_input_tokens_seen": 22649415936,
      "step": 28788
    },
    {
      "epoch": 3.0542117547209844,
      "grad_norm": 0.520727116936357,
      "learning_rate": 4.246261580710825e-05,
      "loss": 1.6745,
      "num_input_tokens_seen": 22650202608,
      "step": 28789
    },
    {
      "epoch": 3.054317844260556,
      "grad_norm": 0.5049359279239161,
      "learning_rate": 4.2462118476827905e-05,
      "loss": 1.5157,
      "num_input_tokens_seen": 22650989360,
      "step": 28790
    },
    {
      "epoch": 3.0544239338001273,
      "grad_norm": 0.45209648495079197,
      "learning_rate": 4.2461621133053356e-05,
      "loss": 1.5422,
      "num_input_tokens_seen": 22651776048,
      "step": 28791
    },
    {
      "epoch": 3.054530023339699,
      "grad_norm": 0.4445493470026578,
      "learning_rate": 4.246112377578497e-05,
      "loss": 1.5154,
      "num_input_tokens_seen": 22652562832,
      "step": 28792
    },
    {
      "epoch": 3.0546361128792703,
      "grad_norm": 0.5136992261003259,
      "learning_rate": 4.246062640502314e-05,
      "loss": 1.5149,
      "num_input_tokens_seen": 22653349536,
      "step": 28793
    },
    {
      "epoch": 3.0547422024188413,
      "grad_norm": 0.4150796391330813,
      "learning_rate": 4.2460129020768255e-05,
      "loss": 1.478,
      "num_input_tokens_seen": 22654136288,
      "step": 28794
    },
    {
      "epoch": 3.054848291958413,
      "grad_norm": 0.42743760028586086,
      "learning_rate": 4.245963162302069e-05,
      "loss": 1.5202,
      "num_input_tokens_seen": 22654923072,
      "step": 28795
    },
    {
      "epoch": 3.0549543814979843,
      "grad_norm": 0.44817285270603135,
      "learning_rate": 4.245913421178084e-05,
      "loss": 1.4607,
      "num_input_tokens_seen": 22655709856,
      "step": 28796
    },
    {
      "epoch": 3.0550604710375557,
      "grad_norm": 0.4676734400501508,
      "learning_rate": 4.2458636787049075e-05,
      "loss": 1.5834,
      "num_input_tokens_seen": 22656496512,
      "step": 28797
    },
    {
      "epoch": 3.055166560577127,
      "grad_norm": 0.44575160950654796,
      "learning_rate": 4.24581393488258e-05,
      "loss": 1.3977,
      "num_input_tokens_seen": 22657283328,
      "step": 28798
    },
    {
      "epoch": 3.0552726501166987,
      "grad_norm": 0.5453149327829759,
      "learning_rate": 4.2457641897111375e-05,
      "loss": 1.6091,
      "num_input_tokens_seen": 22658070128,
      "step": 28799
    },
    {
      "epoch": 3.0553787396562697,
      "grad_norm": 0.41303438358177047,
      "learning_rate": 4.2457144431906204e-05,
      "loss": 1.4706,
      "num_input_tokens_seen": 22658856896,
      "step": 28800
    },
    {
      "epoch": 3.055484829195841,
      "grad_norm": 0.4672466100847928,
      "learning_rate": 4.2456646953210664e-05,
      "loss": 1.3773,
      "num_input_tokens_seen": 22659643696,
      "step": 28801
    },
    {
      "epoch": 3.0555909187354127,
      "grad_norm": 0.4390052512217601,
      "learning_rate": 4.245614946102514e-05,
      "loss": 1.4816,
      "num_input_tokens_seen": 22660430368,
      "step": 28802
    },
    {
      "epoch": 3.055697008274984,
      "grad_norm": 0.5295510268811316,
      "learning_rate": 4.245565195535001e-05,
      "loss": 1.6528,
      "num_input_tokens_seen": 22661217104,
      "step": 28803
    },
    {
      "epoch": 3.0558030978145556,
      "grad_norm": 0.46361609594462433,
      "learning_rate": 4.245515443618567e-05,
      "loss": 1.3548,
      "num_input_tokens_seen": 22662003936,
      "step": 28804
    },
    {
      "epoch": 3.055909187354127,
      "grad_norm": 0.403194735815519,
      "learning_rate": 4.2454656903532496e-05,
      "loss": 1.3442,
      "num_input_tokens_seen": 22662790720,
      "step": 28805
    },
    {
      "epoch": 3.056015276893698,
      "grad_norm": 0.4098268152979923,
      "learning_rate": 4.2454159357390873e-05,
      "loss": 1.3462,
      "num_input_tokens_seen": 22663577504,
      "step": 28806
    },
    {
      "epoch": 3.0561213664332696,
      "grad_norm": 0.5192370871095948,
      "learning_rate": 4.245366179776119e-05,
      "loss": 1.3362,
      "num_input_tokens_seen": 22664364320,
      "step": 28807
    },
    {
      "epoch": 3.056227455972841,
      "grad_norm": 0.5989674562284593,
      "learning_rate": 4.245316422464383e-05,
      "loss": 1.4647,
      "num_input_tokens_seen": 22665150992,
      "step": 28808
    },
    {
      "epoch": 3.0563335455124125,
      "grad_norm": 0.6781451354603344,
      "learning_rate": 4.2452666638039177e-05,
      "loss": 1.3913,
      "num_input_tokens_seen": 22665937728,
      "step": 28809
    },
    {
      "epoch": 3.056439635051984,
      "grad_norm": 0.5396213216941548,
      "learning_rate": 4.2452169037947606e-05,
      "loss": 1.4033,
      "num_input_tokens_seen": 22666724464,
      "step": 28810
    },
    {
      "epoch": 3.0565457245915555,
      "grad_norm": 0.39860413771553466,
      "learning_rate": 4.245167142436953e-05,
      "loss": 1.344,
      "num_input_tokens_seen": 22667511312,
      "step": 28811
    },
    {
      "epoch": 3.0566518141311265,
      "grad_norm": 0.6332482652545969,
      "learning_rate": 4.24511737973053e-05,
      "loss": 1.4595,
      "num_input_tokens_seen": 22668298128,
      "step": 28812
    },
    {
      "epoch": 3.056757903670698,
      "grad_norm": 0.5930959290000526,
      "learning_rate": 4.245067615675532e-05,
      "loss": 1.4616,
      "num_input_tokens_seen": 22669084944,
      "step": 28813
    },
    {
      "epoch": 3.0568639932102695,
      "grad_norm": 0.5408404954444274,
      "learning_rate": 4.2450178502719965e-05,
      "loss": 1.4435,
      "num_input_tokens_seen": 22669871680,
      "step": 28814
    },
    {
      "epoch": 3.056970082749841,
      "grad_norm": 0.7171698060630111,
      "learning_rate": 4.2449680835199626e-05,
      "loss": 1.3679,
      "num_input_tokens_seen": 22670658416,
      "step": 28815
    },
    {
      "epoch": 3.0570761722894124,
      "grad_norm": 0.4437673542972254,
      "learning_rate": 4.244918315419469e-05,
      "loss": 1.5022,
      "num_input_tokens_seen": 22671445248,
      "step": 28816
    },
    {
      "epoch": 3.0571822618289834,
      "grad_norm": 0.6679467527518597,
      "learning_rate": 4.244868545970554e-05,
      "loss": 1.4893,
      "num_input_tokens_seen": 22672232096,
      "step": 28817
    },
    {
      "epoch": 3.057288351368555,
      "grad_norm": 0.5866452694761584,
      "learning_rate": 4.244818775173255e-05,
      "loss": 1.466,
      "num_input_tokens_seen": 22673018864,
      "step": 28818
    },
    {
      "epoch": 3.0573944409081264,
      "grad_norm": 0.48420043226477105,
      "learning_rate": 4.244769003027611e-05,
      "loss": 1.4516,
      "num_input_tokens_seen": 22673805696,
      "step": 28819
    },
    {
      "epoch": 3.057500530447698,
      "grad_norm": 0.45716714411256654,
      "learning_rate": 4.244719229533661e-05,
      "loss": 1.4009,
      "num_input_tokens_seen": 22674592496,
      "step": 28820
    },
    {
      "epoch": 3.0576066199872693,
      "grad_norm": 0.5905982666030235,
      "learning_rate": 4.244669454691444e-05,
      "loss": 1.4395,
      "num_input_tokens_seen": 22675379296,
      "step": 28821
    },
    {
      "epoch": 3.057712709526841,
      "grad_norm": 0.3911195852960292,
      "learning_rate": 4.2446196785009965e-05,
      "loss": 1.4368,
      "num_input_tokens_seen": 22676166096,
      "step": 28822
    },
    {
      "epoch": 3.057818799066412,
      "grad_norm": 0.606658998264589,
      "learning_rate": 4.244569900962359e-05,
      "loss": 1.4433,
      "num_input_tokens_seen": 22676952864,
      "step": 28823
    },
    {
      "epoch": 3.0579248886059833,
      "grad_norm": 0.45331188849477694,
      "learning_rate": 4.2445201220755686e-05,
      "loss": 1.4189,
      "num_input_tokens_seen": 22677739648,
      "step": 28824
    },
    {
      "epoch": 3.058030978145555,
      "grad_norm": 0.41451037572952487,
      "learning_rate": 4.244470341840664e-05,
      "loss": 1.4893,
      "num_input_tokens_seen": 22678526480,
      "step": 28825
    },
    {
      "epoch": 3.0581370676851263,
      "grad_norm": 0.5311108968874614,
      "learning_rate": 4.244420560257685e-05,
      "loss": 1.4652,
      "num_input_tokens_seen": 22679313312,
      "step": 28826
    },
    {
      "epoch": 3.0582431572246978,
      "grad_norm": 0.4118293627344989,
      "learning_rate": 4.244370777326668e-05,
      "loss": 1.4258,
      "num_input_tokens_seen": 22680100064,
      "step": 28827
    },
    {
      "epoch": 3.0583492467642692,
      "grad_norm": 0.4431622006175459,
      "learning_rate": 4.2443209930476526e-05,
      "loss": 1.4566,
      "num_input_tokens_seen": 22680886800,
      "step": 28828
    },
    {
      "epoch": 3.0584553363038403,
      "grad_norm": 0.4842861516847194,
      "learning_rate": 4.2442712074206766e-05,
      "loss": 1.4956,
      "num_input_tokens_seen": 22681673584,
      "step": 28829
    },
    {
      "epoch": 3.0585614258434117,
      "grad_norm": 0.4071582382248346,
      "learning_rate": 4.24422142044578e-05,
      "loss": 1.5279,
      "num_input_tokens_seen": 22682460400,
      "step": 28830
    },
    {
      "epoch": 3.058667515382983,
      "grad_norm": 0.4339671680962572,
      "learning_rate": 4.2441716321229996e-05,
      "loss": 1.4935,
      "num_input_tokens_seen": 22683247216,
      "step": 28831
    },
    {
      "epoch": 3.0587736049225547,
      "grad_norm": 0.5085830976087063,
      "learning_rate": 4.244121842452375e-05,
      "loss": 1.4132,
      "num_input_tokens_seen": 22684033904,
      "step": 28832
    },
    {
      "epoch": 3.058879694462126,
      "grad_norm": 0.5108960580931265,
      "learning_rate": 4.2440720514339435e-05,
      "loss": 1.4987,
      "num_input_tokens_seen": 22684820640,
      "step": 28833
    },
    {
      "epoch": 3.0589857840016976,
      "grad_norm": 0.4330067062744935,
      "learning_rate": 4.244022259067745e-05,
      "loss": 1.3516,
      "num_input_tokens_seen": 22685607440,
      "step": 28834
    },
    {
      "epoch": 3.0590918735412687,
      "grad_norm": 0.45289347760986987,
      "learning_rate": 4.243972465353817e-05,
      "loss": 1.4647,
      "num_input_tokens_seen": 22686394160,
      "step": 28835
    },
    {
      "epoch": 3.05919796308084,
      "grad_norm": 0.43139336514503407,
      "learning_rate": 4.243922670292198e-05,
      "loss": 1.5339,
      "num_input_tokens_seen": 22687180816,
      "step": 28836
    },
    {
      "epoch": 3.0593040526204116,
      "grad_norm": 0.4389084368080828,
      "learning_rate": 4.243872873882927e-05,
      "loss": 1.4397,
      "num_input_tokens_seen": 22687967568,
      "step": 28837
    },
    {
      "epoch": 3.059410142159983,
      "grad_norm": 0.4944313142805435,
      "learning_rate": 4.2438230761260424e-05,
      "loss": 1.3885,
      "num_input_tokens_seen": 22688754400,
      "step": 28838
    },
    {
      "epoch": 3.0595162316995546,
      "grad_norm": 0.4860659457947325,
      "learning_rate": 4.2437732770215824e-05,
      "loss": 1.5016,
      "num_input_tokens_seen": 22689541232,
      "step": 28839
    },
    {
      "epoch": 3.059622321239126,
      "grad_norm": 0.4538236012356117,
      "learning_rate": 4.243723476569586e-05,
      "loss": 1.4819,
      "num_input_tokens_seen": 22690327968,
      "step": 28840
    },
    {
      "epoch": 3.059728410778697,
      "grad_norm": 0.42199217906741887,
      "learning_rate": 4.24367367477009e-05,
      "loss": 1.5635,
      "num_input_tokens_seen": 22691114736,
      "step": 28841
    },
    {
      "epoch": 3.0598345003182685,
      "grad_norm": 0.42574926430671955,
      "learning_rate": 4.243623871623135e-05,
      "loss": 1.4611,
      "num_input_tokens_seen": 22691901488,
      "step": 28842
    },
    {
      "epoch": 3.05994058985784,
      "grad_norm": 0.4734023557619005,
      "learning_rate": 4.243574067128759e-05,
      "loss": 1.491,
      "num_input_tokens_seen": 22692688176,
      "step": 28843
    },
    {
      "epoch": 3.0600466793974115,
      "grad_norm": 0.38090240157968724,
      "learning_rate": 4.2435242612869996e-05,
      "loss": 1.3773,
      "num_input_tokens_seen": 22693474976,
      "step": 28844
    },
    {
      "epoch": 3.060152768936983,
      "grad_norm": 0.3981863263551518,
      "learning_rate": 4.243474454097895e-05,
      "loss": 1.3711,
      "num_input_tokens_seen": 22694261808,
      "step": 28845
    },
    {
      "epoch": 3.060258858476554,
      "grad_norm": 0.44199054020438866,
      "learning_rate": 4.2434246455614855e-05,
      "loss": 1.482,
      "num_input_tokens_seen": 22695048560,
      "step": 28846
    },
    {
      "epoch": 3.0603649480161255,
      "grad_norm": 0.4346117767328087,
      "learning_rate": 4.243374835677809e-05,
      "loss": 1.5189,
      "num_input_tokens_seen": 22695835328,
      "step": 28847
    },
    {
      "epoch": 3.060471037555697,
      "grad_norm": 0.4488354901791405,
      "learning_rate": 4.243325024446903e-05,
      "loss": 1.5211,
      "num_input_tokens_seen": 22696622176,
      "step": 28848
    },
    {
      "epoch": 3.0605771270952684,
      "grad_norm": 0.40719304326295497,
      "learning_rate": 4.2432752118688066e-05,
      "loss": 1.4494,
      "num_input_tokens_seen": 22697408992,
      "step": 28849
    },
    {
      "epoch": 3.06068321663484,
      "grad_norm": 0.5385939226995318,
      "learning_rate": 4.243225397943558e-05,
      "loss": 1.5554,
      "num_input_tokens_seen": 22698195680,
      "step": 28850
    },
    {
      "epoch": 3.0607893061744114,
      "grad_norm": 0.4345909052303914,
      "learning_rate": 4.243175582671197e-05,
      "loss": 1.5186,
      "num_input_tokens_seen": 22698982416,
      "step": 28851
    },
    {
      "epoch": 3.0608953957139824,
      "grad_norm": 0.5721076954592195,
      "learning_rate": 4.24312576605176e-05,
      "loss": 1.5451,
      "num_input_tokens_seen": 22699769072,
      "step": 28852
    },
    {
      "epoch": 3.061001485253554,
      "grad_norm": 0.48675262620678666,
      "learning_rate": 4.243075948085287e-05,
      "loss": 1.4515,
      "num_input_tokens_seen": 22700555840,
      "step": 28853
    },
    {
      "epoch": 3.0611075747931253,
      "grad_norm": 0.5144502420188798,
      "learning_rate": 4.243026128771815e-05,
      "loss": 1.4487,
      "num_input_tokens_seen": 22701342592,
      "step": 28854
    },
    {
      "epoch": 3.061213664332697,
      "grad_norm": 0.4041104149344762,
      "learning_rate": 4.242976308111385e-05,
      "loss": 1.3978,
      "num_input_tokens_seen": 22702129456,
      "step": 28855
    },
    {
      "epoch": 3.0613197538722683,
      "grad_norm": 0.5173867164295273,
      "learning_rate": 4.242926486104033e-05,
      "loss": 1.5103,
      "num_input_tokens_seen": 22702916272,
      "step": 28856
    },
    {
      "epoch": 3.0614258434118398,
      "grad_norm": 0.404205576063577,
      "learning_rate": 4.2428766627497996e-05,
      "loss": 1.4586,
      "num_input_tokens_seen": 22703703072,
      "step": 28857
    },
    {
      "epoch": 3.061531932951411,
      "grad_norm": 0.4627844198738895,
      "learning_rate": 4.2428268380487214e-05,
      "loss": 1.4958,
      "num_input_tokens_seen": 22704489776,
      "step": 28858
    },
    {
      "epoch": 3.0616380224909823,
      "grad_norm": 0.41098147269012086,
      "learning_rate": 4.242777012000838e-05,
      "loss": 1.4334,
      "num_input_tokens_seen": 22705276528,
      "step": 28859
    },
    {
      "epoch": 3.0617441120305537,
      "grad_norm": 0.41065982177861304,
      "learning_rate": 4.2427271846061875e-05,
      "loss": 1.2923,
      "num_input_tokens_seen": 22706063280,
      "step": 28860
    },
    {
      "epoch": 3.061850201570125,
      "grad_norm": 0.4768201825641852,
      "learning_rate": 4.242677355864809e-05,
      "loss": 1.4561,
      "num_input_tokens_seen": 22706850032,
      "step": 28861
    },
    {
      "epoch": 3.0619562911096967,
      "grad_norm": 0.5690076304362884,
      "learning_rate": 4.24262752577674e-05,
      "loss": 1.3836,
      "num_input_tokens_seen": 22707636816,
      "step": 28862
    },
    {
      "epoch": 3.062062380649268,
      "grad_norm": 0.48006146836123187,
      "learning_rate": 4.2425776943420205e-05,
      "loss": 1.495,
      "num_input_tokens_seen": 22708423568,
      "step": 28863
    },
    {
      "epoch": 3.062168470188839,
      "grad_norm": 0.46475565429116406,
      "learning_rate": 4.242527861560687e-05,
      "loss": 1.5615,
      "num_input_tokens_seen": 22709210432,
      "step": 28864
    },
    {
      "epoch": 3.0622745597284107,
      "grad_norm": 0.4463472764221413,
      "learning_rate": 4.24247802743278e-05,
      "loss": 1.4791,
      "num_input_tokens_seen": 22709997184,
      "step": 28865
    },
    {
      "epoch": 3.062380649267982,
      "grad_norm": 0.43862853961826687,
      "learning_rate": 4.242428191958337e-05,
      "loss": 1.3248,
      "num_input_tokens_seen": 22710784000,
      "step": 28866
    },
    {
      "epoch": 3.0624867388075536,
      "grad_norm": 0.44160929661839626,
      "learning_rate": 4.242378355137396e-05,
      "loss": 1.4589,
      "num_input_tokens_seen": 22711570752,
      "step": 28867
    },
    {
      "epoch": 3.062592828347125,
      "grad_norm": 0.3882148242836463,
      "learning_rate": 4.2423285169699964e-05,
      "loss": 1.4366,
      "num_input_tokens_seen": 22712357536,
      "step": 28868
    },
    {
      "epoch": 3.0626989178866966,
      "grad_norm": 0.4861874545400928,
      "learning_rate": 4.242278677456176e-05,
      "loss": 1.4376,
      "num_input_tokens_seen": 22713144320,
      "step": 28869
    },
    {
      "epoch": 3.0628050074262676,
      "grad_norm": 0.46199595446929775,
      "learning_rate": 4.242228836595975e-05,
      "loss": 1.4914,
      "num_input_tokens_seen": 22713931104,
      "step": 28870
    },
    {
      "epoch": 3.062911096965839,
      "grad_norm": 0.45635978257183774,
      "learning_rate": 4.24217899438943e-05,
      "loss": 1.4376,
      "num_input_tokens_seen": 22714717888,
      "step": 28871
    },
    {
      "epoch": 3.0630171865054105,
      "grad_norm": 0.48081360404276163,
      "learning_rate": 4.24212915083658e-05,
      "loss": 1.5908,
      "num_input_tokens_seen": 22715504688,
      "step": 28872
    },
    {
      "epoch": 3.063123276044982,
      "grad_norm": 0.5314099862162549,
      "learning_rate": 4.2420793059374644e-05,
      "loss": 1.4027,
      "num_input_tokens_seen": 22716291488,
      "step": 28873
    },
    {
      "epoch": 3.0632293655845535,
      "grad_norm": 0.398472606437252,
      "learning_rate": 4.24202945969212e-05,
      "loss": 1.364,
      "num_input_tokens_seen": 22717078352,
      "step": 28874
    },
    {
      "epoch": 3.063335455124125,
      "grad_norm": 0.7179045484448108,
      "learning_rate": 4.241979612100587e-05,
      "loss": 1.5359,
      "num_input_tokens_seen": 22717865136,
      "step": 28875
    },
    {
      "epoch": 3.063441544663696,
      "grad_norm": 0.4779717151589371,
      "learning_rate": 4.241929763162903e-05,
      "loss": 1.4714,
      "num_input_tokens_seen": 22718651840,
      "step": 28876
    },
    {
      "epoch": 3.0635476342032675,
      "grad_norm": 0.5455019936461194,
      "learning_rate": 4.2418799128791073e-05,
      "loss": 1.5764,
      "num_input_tokens_seen": 22719438592,
      "step": 28877
    },
    {
      "epoch": 3.063653723742839,
      "grad_norm": 0.4766101104800618,
      "learning_rate": 4.241830061249237e-05,
      "loss": 1.4687,
      "num_input_tokens_seen": 22720225408,
      "step": 28878
    },
    {
      "epoch": 3.0637598132824104,
      "grad_norm": 0.4366129982524239,
      "learning_rate": 4.2417802082733324e-05,
      "loss": 1.4321,
      "num_input_tokens_seen": 22721012208,
      "step": 28879
    },
    {
      "epoch": 3.063865902821982,
      "grad_norm": 0.5610236226764583,
      "learning_rate": 4.241730353951431e-05,
      "loss": 1.4851,
      "num_input_tokens_seen": 22721798912,
      "step": 28880
    },
    {
      "epoch": 3.0639719923615534,
      "grad_norm": 0.4216975932618805,
      "learning_rate": 4.2416804982835715e-05,
      "loss": 1.5831,
      "num_input_tokens_seen": 22722585600,
      "step": 28881
    },
    {
      "epoch": 3.0640780819011244,
      "grad_norm": 0.7511829618016419,
      "learning_rate": 4.241630641269792e-05,
      "loss": 1.3445,
      "num_input_tokens_seen": 22723372400,
      "step": 28882
    },
    {
      "epoch": 3.064184171440696,
      "grad_norm": 0.39600749750926034,
      "learning_rate": 4.2415807829101314e-05,
      "loss": 1.3909,
      "num_input_tokens_seen": 22724159264,
      "step": 28883
    },
    {
      "epoch": 3.0642902609802674,
      "grad_norm": 0.5570321629464637,
      "learning_rate": 4.241530923204629e-05,
      "loss": 1.517,
      "num_input_tokens_seen": 22724946048,
      "step": 28884
    },
    {
      "epoch": 3.064396350519839,
      "grad_norm": 0.45678304444094175,
      "learning_rate": 4.241481062153322e-05,
      "loss": 1.3779,
      "num_input_tokens_seen": 22725732832,
      "step": 28885
    },
    {
      "epoch": 3.0645024400594103,
      "grad_norm": 0.49568291528878927,
      "learning_rate": 4.2414311997562494e-05,
      "loss": 1.4411,
      "num_input_tokens_seen": 22726519536,
      "step": 28886
    },
    {
      "epoch": 3.0646085295989813,
      "grad_norm": 0.4506345869513881,
      "learning_rate": 4.24138133601345e-05,
      "loss": 1.3528,
      "num_input_tokens_seen": 22727306384,
      "step": 28887
    },
    {
      "epoch": 3.064714619138553,
      "grad_norm": 0.578718639530784,
      "learning_rate": 4.2413314709249616e-05,
      "loss": 1.4058,
      "num_input_tokens_seen": 22728093184,
      "step": 28888
    },
    {
      "epoch": 3.0648207086781243,
      "grad_norm": 0.46736078561892297,
      "learning_rate": 4.241281604490824e-05,
      "loss": 1.4197,
      "num_input_tokens_seen": 22728880016,
      "step": 28889
    },
    {
      "epoch": 3.0649267982176958,
      "grad_norm": 0.4789211126807366,
      "learning_rate": 4.241231736711076e-05,
      "loss": 1.3629,
      "num_input_tokens_seen": 22729666784,
      "step": 28890
    },
    {
      "epoch": 3.0650328877572672,
      "grad_norm": 0.5478267190554259,
      "learning_rate": 4.241181867585754e-05,
      "loss": 1.5147,
      "num_input_tokens_seen": 22730453552,
      "step": 28891
    },
    {
      "epoch": 3.0651389772968387,
      "grad_norm": 0.5239969396394754,
      "learning_rate": 4.241131997114898e-05,
      "loss": 1.4252,
      "num_input_tokens_seen": 22731240320,
      "step": 28892
    },
    {
      "epoch": 3.0652450668364097,
      "grad_norm": 0.4674368914012744,
      "learning_rate": 4.2410821252985466e-05,
      "loss": 1.4538,
      "num_input_tokens_seen": 22732027104,
      "step": 28893
    },
    {
      "epoch": 3.065351156375981,
      "grad_norm": 0.5316830668597493,
      "learning_rate": 4.2410322521367376e-05,
      "loss": 1.4309,
      "num_input_tokens_seen": 22732813840,
      "step": 28894
    },
    {
      "epoch": 3.0654572459155527,
      "grad_norm": 0.47962659789576,
      "learning_rate": 4.24098237762951e-05,
      "loss": 1.3907,
      "num_input_tokens_seen": 22733600624,
      "step": 28895
    },
    {
      "epoch": 3.065563335455124,
      "grad_norm": 0.46827381009281216,
      "learning_rate": 4.240932501776903e-05,
      "loss": 1.3721,
      "num_input_tokens_seen": 22734387296,
      "step": 28896
    },
    {
      "epoch": 3.0656694249946956,
      "grad_norm": 0.40464224690152384,
      "learning_rate": 4.240882624578954e-05,
      "loss": 1.4262,
      "num_input_tokens_seen": 22735174064,
      "step": 28897
    },
    {
      "epoch": 3.065775514534267,
      "grad_norm": 0.41461316537666376,
      "learning_rate": 4.240832746035701e-05,
      "loss": 1.4855,
      "num_input_tokens_seen": 22735960800,
      "step": 28898
    },
    {
      "epoch": 3.065881604073838,
      "grad_norm": 0.39308225113649836,
      "learning_rate": 4.240782866147185e-05,
      "loss": 1.356,
      "num_input_tokens_seen": 22736747536,
      "step": 28899
    },
    {
      "epoch": 3.0659876936134096,
      "grad_norm": 0.42233930333467945,
      "learning_rate": 4.2407329849134425e-05,
      "loss": 1.4233,
      "num_input_tokens_seen": 22737534320,
      "step": 28900
    },
    {
      "epoch": 3.066093783152981,
      "grad_norm": 0.38450404660556226,
      "learning_rate": 4.240683102334512e-05,
      "loss": 1.4138,
      "num_input_tokens_seen": 22738321248,
      "step": 28901
    },
    {
      "epoch": 3.0661998726925526,
      "grad_norm": 0.44852715624979955,
      "learning_rate": 4.2406332184104334e-05,
      "loss": 1.5714,
      "num_input_tokens_seen": 22739108000,
      "step": 28902
    },
    {
      "epoch": 3.066305962232124,
      "grad_norm": 0.4735482736605878,
      "learning_rate": 4.2405833331412445e-05,
      "loss": 1.4361,
      "num_input_tokens_seen": 22739894736,
      "step": 28903
    },
    {
      "epoch": 3.0664120517716955,
      "grad_norm": 0.45905656834703096,
      "learning_rate": 4.240533446526984e-05,
      "loss": 1.5424,
      "num_input_tokens_seen": 22740681504,
      "step": 28904
    },
    {
      "epoch": 3.0665181413112665,
      "grad_norm": 0.4582816669772989,
      "learning_rate": 4.240483558567689e-05,
      "loss": 1.4685,
      "num_input_tokens_seen": 22741468240,
      "step": 28905
    },
    {
      "epoch": 3.066624230850838,
      "grad_norm": 0.5210872208104127,
      "learning_rate": 4.2404336692634015e-05,
      "loss": 1.5659,
      "num_input_tokens_seen": 22742255008,
      "step": 28906
    },
    {
      "epoch": 3.0667303203904095,
      "grad_norm": 0.43331189702268624,
      "learning_rate": 4.240383778614157e-05,
      "loss": 1.4282,
      "num_input_tokens_seen": 22743041776,
      "step": 28907
    },
    {
      "epoch": 3.066836409929981,
      "grad_norm": 0.5011466016292309,
      "learning_rate": 4.2403338866199946e-05,
      "loss": 1.5655,
      "num_input_tokens_seen": 22743828544,
      "step": 28908
    },
    {
      "epoch": 3.0669424994695524,
      "grad_norm": 0.4591381823934913,
      "learning_rate": 4.2402839932809534e-05,
      "loss": 1.4507,
      "num_input_tokens_seen": 22744615376,
      "step": 28909
    },
    {
      "epoch": 3.067048589009124,
      "grad_norm": 0.42103088621634693,
      "learning_rate": 4.2402340985970727e-05,
      "loss": 1.4401,
      "num_input_tokens_seen": 22745402128,
      "step": 28910
    },
    {
      "epoch": 3.067154678548695,
      "grad_norm": 0.46974904428223957,
      "learning_rate": 4.240184202568389e-05,
      "loss": 1.4904,
      "num_input_tokens_seen": 22746188816,
      "step": 28911
    },
    {
      "epoch": 3.0672607680882664,
      "grad_norm": 0.5145320049243762,
      "learning_rate": 4.240134305194942e-05,
      "loss": 1.5651,
      "num_input_tokens_seen": 22746975648,
      "step": 28912
    },
    {
      "epoch": 3.067366857627838,
      "grad_norm": 0.4059002634916951,
      "learning_rate": 4.2400844064767706e-05,
      "loss": 1.3239,
      "num_input_tokens_seen": 22747762416,
      "step": 28913
    },
    {
      "epoch": 3.0674729471674094,
      "grad_norm": 0.5626004476893902,
      "learning_rate": 4.2400345064139135e-05,
      "loss": 1.4535,
      "num_input_tokens_seen": 22748549104,
      "step": 28914
    },
    {
      "epoch": 3.067579036706981,
      "grad_norm": 0.4647706323408055,
      "learning_rate": 4.239984605006408e-05,
      "loss": 1.4875,
      "num_input_tokens_seen": 22749335888,
      "step": 28915
    },
    {
      "epoch": 3.067685126246552,
      "grad_norm": 0.4889894080194381,
      "learning_rate": 4.239934702254294e-05,
      "loss": 1.3881,
      "num_input_tokens_seen": 22750122656,
      "step": 28916
    },
    {
      "epoch": 3.0677912157861233,
      "grad_norm": 0.4673042206143898,
      "learning_rate": 4.2398847981576094e-05,
      "loss": 1.498,
      "num_input_tokens_seen": 22750909408,
      "step": 28917
    },
    {
      "epoch": 3.067897305325695,
      "grad_norm": 0.47396467664650577,
      "learning_rate": 4.239834892716392e-05,
      "loss": 1.4646,
      "num_input_tokens_seen": 22751696128,
      "step": 28918
    },
    {
      "epoch": 3.0680033948652663,
      "grad_norm": 0.5141738511973876,
      "learning_rate": 4.2397849859306824e-05,
      "loss": 1.5002,
      "num_input_tokens_seen": 22752482928,
      "step": 28919
    },
    {
      "epoch": 3.0681094844048378,
      "grad_norm": 0.5146715220854187,
      "learning_rate": 4.239735077800518e-05,
      "loss": 1.4806,
      "num_input_tokens_seen": 22753269600,
      "step": 28920
    },
    {
      "epoch": 3.0682155739444092,
      "grad_norm": 0.5775815065829663,
      "learning_rate": 4.239685168325937e-05,
      "loss": 1.5762,
      "num_input_tokens_seen": 22754056432,
      "step": 28921
    },
    {
      "epoch": 3.0683216634839803,
      "grad_norm": 0.4607170803054564,
      "learning_rate": 4.2396352575069785e-05,
      "loss": 1.4895,
      "num_input_tokens_seen": 22754843152,
      "step": 28922
    },
    {
      "epoch": 3.0684277530235518,
      "grad_norm": 0.558719698239911,
      "learning_rate": 4.2395853453436804e-05,
      "loss": 1.4591,
      "num_input_tokens_seen": 22755629984,
      "step": 28923
    },
    {
      "epoch": 3.0685338425631232,
      "grad_norm": 0.40883262972573553,
      "learning_rate": 4.239535431836083e-05,
      "loss": 1.4018,
      "num_input_tokens_seen": 22756416800,
      "step": 28924
    },
    {
      "epoch": 3.0686399321026947,
      "grad_norm": 0.45723670137498373,
      "learning_rate": 4.239485516984222e-05,
      "loss": 1.5142,
      "num_input_tokens_seen": 22757203600,
      "step": 28925
    },
    {
      "epoch": 3.068746021642266,
      "grad_norm": 0.4061957557149961,
      "learning_rate": 4.2394356007881386e-05,
      "loss": 1.587,
      "num_input_tokens_seen": 22757990368,
      "step": 28926
    },
    {
      "epoch": 3.0688521111818376,
      "grad_norm": 0.4797773858645579,
      "learning_rate": 4.2393856832478706e-05,
      "loss": 1.3471,
      "num_input_tokens_seen": 22758777152,
      "step": 28927
    },
    {
      "epoch": 3.0689582007214087,
      "grad_norm": 0.4276158436602064,
      "learning_rate": 4.2393357643634555e-05,
      "loss": 1.4192,
      "num_input_tokens_seen": 22759563952,
      "step": 28928
    },
    {
      "epoch": 3.06906429026098,
      "grad_norm": 0.45730817930486783,
      "learning_rate": 4.239285844134934e-05,
      "loss": 1.505,
      "num_input_tokens_seen": 22760350736,
      "step": 28929
    },
    {
      "epoch": 3.0691703798005516,
      "grad_norm": 0.45865081605195107,
      "learning_rate": 4.2392359225623426e-05,
      "loss": 1.3381,
      "num_input_tokens_seen": 22761137536,
      "step": 28930
    },
    {
      "epoch": 3.069276469340123,
      "grad_norm": 0.46568539185986435,
      "learning_rate": 4.239185999645721e-05,
      "loss": 1.4027,
      "num_input_tokens_seen": 22761924224,
      "step": 28931
    },
    {
      "epoch": 3.0693825588796946,
      "grad_norm": 0.54389164659354,
      "learning_rate": 4.2391360753851076e-05,
      "loss": 1.469,
      "num_input_tokens_seen": 22762711024,
      "step": 28932
    },
    {
      "epoch": 3.069488648419266,
      "grad_norm": 0.5495873475393069,
      "learning_rate": 4.23908614978054e-05,
      "loss": 1.5403,
      "num_input_tokens_seen": 22763497776,
      "step": 28933
    },
    {
      "epoch": 3.069594737958837,
      "grad_norm": 0.41282290247920833,
      "learning_rate": 4.2390362228320586e-05,
      "loss": 1.4103,
      "num_input_tokens_seen": 22764284448,
      "step": 28934
    },
    {
      "epoch": 3.0697008274984086,
      "grad_norm": 0.5780240397769738,
      "learning_rate": 4.238986294539701e-05,
      "loss": 1.4338,
      "num_input_tokens_seen": 22765071232,
      "step": 28935
    },
    {
      "epoch": 3.06980691703798,
      "grad_norm": 0.4901404272038853,
      "learning_rate": 4.2389363649035055e-05,
      "loss": 1.5589,
      "num_input_tokens_seen": 22765857952,
      "step": 28936
    },
    {
      "epoch": 3.0699130065775515,
      "grad_norm": 0.6034480178702418,
      "learning_rate": 4.238886433923511e-05,
      "loss": 1.5512,
      "num_input_tokens_seen": 22766644720,
      "step": 28937
    },
    {
      "epoch": 3.070019096117123,
      "grad_norm": 0.451519366476363,
      "learning_rate": 4.238836501599756e-05,
      "loss": 1.6052,
      "num_input_tokens_seen": 22767431456,
      "step": 28938
    },
    {
      "epoch": 3.0701251856566945,
      "grad_norm": 0.5308459111676654,
      "learning_rate": 4.2387865679322794e-05,
      "loss": 1.3235,
      "num_input_tokens_seen": 22768218240,
      "step": 28939
    },
    {
      "epoch": 3.0702312751962655,
      "grad_norm": 0.5104759077992789,
      "learning_rate": 4.2387366329211194e-05,
      "loss": 1.5919,
      "num_input_tokens_seen": 22769004976,
      "step": 28940
    },
    {
      "epoch": 3.070337364735837,
      "grad_norm": 0.4619024848902206,
      "learning_rate": 4.238686696566314e-05,
      "loss": 1.3831,
      "num_input_tokens_seen": 22769791712,
      "step": 28941
    },
    {
      "epoch": 3.0704434542754084,
      "grad_norm": 0.43876551467525576,
      "learning_rate": 4.2386367588679036e-05,
      "loss": 1.3909,
      "num_input_tokens_seen": 22770578400,
      "step": 28942
    },
    {
      "epoch": 3.07054954381498,
      "grad_norm": 0.4417784516215513,
      "learning_rate": 4.238586819825926e-05,
      "loss": 1.5075,
      "num_input_tokens_seen": 22771365184,
      "step": 28943
    },
    {
      "epoch": 3.0706556333545514,
      "grad_norm": 0.45402862021796553,
      "learning_rate": 4.238536879440419e-05,
      "loss": 1.5468,
      "num_input_tokens_seen": 22772152064,
      "step": 28944
    },
    {
      "epoch": 3.0707617228941224,
      "grad_norm": 0.4339364396009794,
      "learning_rate": 4.238486937711421e-05,
      "loss": 1.4006,
      "num_input_tokens_seen": 22772938880,
      "step": 28945
    },
    {
      "epoch": 3.070867812433694,
      "grad_norm": 0.40327678479498064,
      "learning_rate": 4.2384369946389724e-05,
      "loss": 1.3766,
      "num_input_tokens_seen": 22773725776,
      "step": 28946
    },
    {
      "epoch": 3.0709739019732654,
      "grad_norm": 0.4224937476078689,
      "learning_rate": 4.238387050223111e-05,
      "loss": 1.4492,
      "num_input_tokens_seen": 22774512576,
      "step": 28947
    },
    {
      "epoch": 3.071079991512837,
      "grad_norm": 0.42401186638837246,
      "learning_rate": 4.238337104463874e-05,
      "loss": 1.4427,
      "num_input_tokens_seen": 22775299392,
      "step": 28948
    },
    {
      "epoch": 3.0711860810524083,
      "grad_norm": 0.47263890946306975,
      "learning_rate": 4.238287157361301e-05,
      "loss": 1.4893,
      "num_input_tokens_seen": 22776086192,
      "step": 28949
    },
    {
      "epoch": 3.07129217059198,
      "grad_norm": 0.442899940644273,
      "learning_rate": 4.238237208915431e-05,
      "loss": 1.4607,
      "num_input_tokens_seen": 22776873040,
      "step": 28950
    },
    {
      "epoch": 3.071398260131551,
      "grad_norm": 0.7599084142921052,
      "learning_rate": 4.2381872591263026e-05,
      "loss": 1.4956,
      "num_input_tokens_seen": 22777659744,
      "step": 28951
    },
    {
      "epoch": 3.0715043496711223,
      "grad_norm": 0.44400620628105314,
      "learning_rate": 4.2381373079939534e-05,
      "loss": 1.428,
      "num_input_tokens_seen": 22778446448,
      "step": 28952
    },
    {
      "epoch": 3.0716104392106938,
      "grad_norm": 0.6640642220736207,
      "learning_rate": 4.2380873555184234e-05,
      "loss": 1.5373,
      "num_input_tokens_seen": 22779233216,
      "step": 28953
    },
    {
      "epoch": 3.0717165287502652,
      "grad_norm": 0.5452035464222657,
      "learning_rate": 4.2380374016997506e-05,
      "loss": 1.4562,
      "num_input_tokens_seen": 22780019984,
      "step": 28954
    },
    {
      "epoch": 3.0718226182898367,
      "grad_norm": 0.5584686934704649,
      "learning_rate": 4.2379874465379735e-05,
      "loss": 1.4643,
      "num_input_tokens_seen": 22780806752,
      "step": 28955
    },
    {
      "epoch": 3.071928707829408,
      "grad_norm": 0.4766851680742493,
      "learning_rate": 4.23793749003313e-05,
      "loss": 1.473,
      "num_input_tokens_seen": 22781593536,
      "step": 28956
    },
    {
      "epoch": 3.072034797368979,
      "grad_norm": 0.4100669832105186,
      "learning_rate": 4.23788753218526e-05,
      "loss": 1.357,
      "num_input_tokens_seen": 22782380272,
      "step": 28957
    },
    {
      "epoch": 3.0721408869085507,
      "grad_norm": 0.5064366771496557,
      "learning_rate": 4.237837572994401e-05,
      "loss": 1.6304,
      "num_input_tokens_seen": 22783166928,
      "step": 28958
    },
    {
      "epoch": 3.072246976448122,
      "grad_norm": 0.4432595714091217,
      "learning_rate": 4.237787612460593e-05,
      "loss": 1.5053,
      "num_input_tokens_seen": 22783953712,
      "step": 28959
    },
    {
      "epoch": 3.0723530659876936,
      "grad_norm": 0.4899196129931416,
      "learning_rate": 4.237737650583873e-05,
      "loss": 1.4863,
      "num_input_tokens_seen": 22784740464,
      "step": 28960
    },
    {
      "epoch": 3.072459155527265,
      "grad_norm": 0.5302470135273992,
      "learning_rate": 4.2376876873642804e-05,
      "loss": 1.5057,
      "num_input_tokens_seen": 22785527216,
      "step": 28961
    },
    {
      "epoch": 3.0725652450668366,
      "grad_norm": 0.39350364333481636,
      "learning_rate": 4.237637722801854e-05,
      "loss": 1.3907,
      "num_input_tokens_seen": 22786314000,
      "step": 28962
    },
    {
      "epoch": 3.0726713346064076,
      "grad_norm": 0.4633743429861771,
      "learning_rate": 4.2375877568966314e-05,
      "loss": 1.5234,
      "num_input_tokens_seen": 22787100832,
      "step": 28963
    },
    {
      "epoch": 3.072777424145979,
      "grad_norm": 0.42493017393517746,
      "learning_rate": 4.237537789648653e-05,
      "loss": 1.408,
      "num_input_tokens_seen": 22787887584,
      "step": 28964
    },
    {
      "epoch": 3.0728835136855506,
      "grad_norm": 0.4814130336160299,
      "learning_rate": 4.237487821057956e-05,
      "loss": 1.4814,
      "num_input_tokens_seen": 22788674352,
      "step": 28965
    },
    {
      "epoch": 3.072989603225122,
      "grad_norm": 0.40195786403839995,
      "learning_rate": 4.2374378511245795e-05,
      "loss": 1.4731,
      "num_input_tokens_seen": 22789461136,
      "step": 28966
    },
    {
      "epoch": 3.0730956927646935,
      "grad_norm": 0.42422143154892106,
      "learning_rate": 4.237387879848561e-05,
      "loss": 1.4477,
      "num_input_tokens_seen": 22790247904,
      "step": 28967
    },
    {
      "epoch": 3.073201782304265,
      "grad_norm": 0.4205459108232079,
      "learning_rate": 4.237337907229941e-05,
      "loss": 1.4848,
      "num_input_tokens_seen": 22791034688,
      "step": 28968
    },
    {
      "epoch": 3.073307871843836,
      "grad_norm": 0.48507027763833016,
      "learning_rate": 4.237287933268758e-05,
      "loss": 1.5515,
      "num_input_tokens_seen": 22791821472,
      "step": 28969
    },
    {
      "epoch": 3.0734139613834075,
      "grad_norm": 0.43016830415380813,
      "learning_rate": 4.237237957965049e-05,
      "loss": 1.4449,
      "num_input_tokens_seen": 22792608256,
      "step": 28970
    },
    {
      "epoch": 3.073520050922979,
      "grad_norm": 0.45755239141733284,
      "learning_rate": 4.237187981318853e-05,
      "loss": 1.5866,
      "num_input_tokens_seen": 22793394960,
      "step": 28971
    },
    {
      "epoch": 3.0736261404625504,
      "grad_norm": 0.4663159602359086,
      "learning_rate": 4.23713800333021e-05,
      "loss": 1.5273,
      "num_input_tokens_seen": 22794181680,
      "step": 28972
    },
    {
      "epoch": 3.073732230002122,
      "grad_norm": 0.4080928464895981,
      "learning_rate": 4.2370880239991576e-05,
      "loss": 1.2933,
      "num_input_tokens_seen": 22794968400,
      "step": 28973
    },
    {
      "epoch": 3.0738383195416934,
      "grad_norm": 0.5253947739207959,
      "learning_rate": 4.237038043325734e-05,
      "loss": 1.4134,
      "num_input_tokens_seen": 22795755120,
      "step": 28974
    },
    {
      "epoch": 3.0739444090812644,
      "grad_norm": 0.4393912731820994,
      "learning_rate": 4.236988061309979e-05,
      "loss": 1.4844,
      "num_input_tokens_seen": 22796541904,
      "step": 28975
    },
    {
      "epoch": 3.074050498620836,
      "grad_norm": 0.5047831772158746,
      "learning_rate": 4.23693807795193e-05,
      "loss": 1.4669,
      "num_input_tokens_seen": 22797328656,
      "step": 28976
    },
    {
      "epoch": 3.0741565881604074,
      "grad_norm": 0.4492732011454798,
      "learning_rate": 4.236888093251626e-05,
      "loss": 1.4541,
      "num_input_tokens_seen": 22798115392,
      "step": 28977
    },
    {
      "epoch": 3.074262677699979,
      "grad_norm": 0.4152460952452638,
      "learning_rate": 4.236838107209107e-05,
      "loss": 1.3681,
      "num_input_tokens_seen": 22798902096,
      "step": 28978
    },
    {
      "epoch": 3.0743687672395503,
      "grad_norm": 0.43426413085546106,
      "learning_rate": 4.2367881198244097e-05,
      "loss": 1.5151,
      "num_input_tokens_seen": 22799688880,
      "step": 28979
    },
    {
      "epoch": 3.074474856779122,
      "grad_norm": 0.4594074297558465,
      "learning_rate": 4.236738131097574e-05,
      "loss": 1.5132,
      "num_input_tokens_seen": 22800475744,
      "step": 28980
    },
    {
      "epoch": 3.074580946318693,
      "grad_norm": 0.46448426162020184,
      "learning_rate": 4.236688141028637e-05,
      "loss": 1.3677,
      "num_input_tokens_seen": 22801262544,
      "step": 28981
    },
    {
      "epoch": 3.0746870358582643,
      "grad_norm": 0.4123281632185014,
      "learning_rate": 4.2366381496176386e-05,
      "loss": 1.3308,
      "num_input_tokens_seen": 22802049392,
      "step": 28982
    },
    {
      "epoch": 3.074793125397836,
      "grad_norm": 0.4794412749394818,
      "learning_rate": 4.236588156864618e-05,
      "loss": 1.4799,
      "num_input_tokens_seen": 22802836208,
      "step": 28983
    },
    {
      "epoch": 3.0748992149374073,
      "grad_norm": 0.5327462641825821,
      "learning_rate": 4.2365381627696124e-05,
      "loss": 1.3998,
      "num_input_tokens_seen": 22803622912,
      "step": 28984
    },
    {
      "epoch": 3.0750053044769787,
      "grad_norm": 0.4685392969457181,
      "learning_rate": 4.2364881673326615e-05,
      "loss": 1.4669,
      "num_input_tokens_seen": 22804409744,
      "step": 28985
    },
    {
      "epoch": 3.0751113940165498,
      "grad_norm": 0.43690511338652527,
      "learning_rate": 4.236438170553804e-05,
      "loss": 1.499,
      "num_input_tokens_seen": 22805196528,
      "step": 28986
    },
    {
      "epoch": 3.0752174835561212,
      "grad_norm": 0.40938487333053053,
      "learning_rate": 4.236388172433077e-05,
      "loss": 1.5162,
      "num_input_tokens_seen": 22805983440,
      "step": 28987
    },
    {
      "epoch": 3.0753235730956927,
      "grad_norm": 0.47800299674910973,
      "learning_rate": 4.23633817297052e-05,
      "loss": 1.3852,
      "num_input_tokens_seen": 22806770240,
      "step": 28988
    },
    {
      "epoch": 3.075429662635264,
      "grad_norm": 0.4315117177723476,
      "learning_rate": 4.2362881721661726e-05,
      "loss": 1.39,
      "num_input_tokens_seen": 22807556944,
      "step": 28989
    },
    {
      "epoch": 3.0755357521748357,
      "grad_norm": 0.5294415561747072,
      "learning_rate": 4.236238170020072e-05,
      "loss": 1.4854,
      "num_input_tokens_seen": 22808343776,
      "step": 28990
    },
    {
      "epoch": 3.075641841714407,
      "grad_norm": 0.40480232867947386,
      "learning_rate": 4.236188166532258e-05,
      "loss": 1.4213,
      "num_input_tokens_seen": 22809130496,
      "step": 28991
    },
    {
      "epoch": 3.075747931253978,
      "grad_norm": 0.39537575774262124,
      "learning_rate": 4.236138161702768e-05,
      "loss": 1.4274,
      "num_input_tokens_seen": 22809917200,
      "step": 28992
    },
    {
      "epoch": 3.0758540207935496,
      "grad_norm": 0.482313630788209,
      "learning_rate": 4.2360881555316424e-05,
      "loss": 1.4952,
      "num_input_tokens_seen": 22810704000,
      "step": 28993
    },
    {
      "epoch": 3.075960110333121,
      "grad_norm": 0.4766042420321079,
      "learning_rate": 4.236038148018918e-05,
      "loss": 1.4042,
      "num_input_tokens_seen": 22811490736,
      "step": 28994
    },
    {
      "epoch": 3.0760661998726926,
      "grad_norm": 0.5118802949423185,
      "learning_rate": 4.235988139164635e-05,
      "loss": 1.4818,
      "num_input_tokens_seen": 22812277504,
      "step": 28995
    },
    {
      "epoch": 3.076172289412264,
      "grad_norm": 0.45405013412175305,
      "learning_rate": 4.2359381289688305e-05,
      "loss": 1.4636,
      "num_input_tokens_seen": 22813064256,
      "step": 28996
    },
    {
      "epoch": 3.0762783789518355,
      "grad_norm": 0.5350781547478272,
      "learning_rate": 4.2358881174315444e-05,
      "loss": 1.55,
      "num_input_tokens_seen": 22813851056,
      "step": 28997
    },
    {
      "epoch": 3.0763844684914066,
      "grad_norm": 0.43433690517108975,
      "learning_rate": 4.235838104552814e-05,
      "loss": 1.3745,
      "num_input_tokens_seen": 22814637760,
      "step": 28998
    },
    {
      "epoch": 3.076490558030978,
      "grad_norm": 0.5036555763422049,
      "learning_rate": 4.2357880903326806e-05,
      "loss": 1.6064,
      "num_input_tokens_seen": 22815424512,
      "step": 28999
    },
    {
      "epoch": 3.0765966475705495,
      "grad_norm": 0.4604627937897988,
      "learning_rate": 4.23573807477118e-05,
      "loss": 1.4964,
      "num_input_tokens_seen": 22816211280,
      "step": 29000
    },
    {
      "epoch": 3.0765966475705495,
      "eval_loss": 1.6428227424621582,
      "eval_runtime": 65.6322,
      "eval_samples_per_second": 45.709,
      "eval_steps_per_second": 0.488,
      "num_input_tokens_seen": 22816211280,
      "step": 29000
    },
    {
      "epoch": 3.076702737110121,
      "grad_norm": 0.5184711606652085,
      "learning_rate": 4.2356880578683524e-05,
      "loss": 1.6376,
      "num_input_tokens_seen": 22816998000,
      "step": 29001
    },
    {
      "epoch": 3.0768088266496925,
      "grad_norm": 0.5535202202337041,
      "learning_rate": 4.235638039624236e-05,
      "loss": 1.3469,
      "num_input_tokens_seen": 22817784816,
      "step": 29002
    },
    {
      "epoch": 3.076914916189264,
      "grad_norm": 0.4565685124304399,
      "learning_rate": 4.235588020038869e-05,
      "loss": 1.6234,
      "num_input_tokens_seen": 22818571536,
      "step": 29003
    },
    {
      "epoch": 3.077021005728835,
      "grad_norm": 0.5220057177726558,
      "learning_rate": 4.23553799911229e-05,
      "loss": 1.5826,
      "num_input_tokens_seen": 22819358208,
      "step": 29004
    },
    {
      "epoch": 3.0771270952684064,
      "grad_norm": 0.5095165439124444,
      "learning_rate": 4.2354879768445385e-05,
      "loss": 1.3839,
      "num_input_tokens_seen": 22820145040,
      "step": 29005
    },
    {
      "epoch": 3.077233184807978,
      "grad_norm": 0.581623210122679,
      "learning_rate": 4.235437953235654e-05,
      "loss": 1.4068,
      "num_input_tokens_seen": 22820931824,
      "step": 29006
    },
    {
      "epoch": 3.0773392743475494,
      "grad_norm": 0.5445807103029535,
      "learning_rate": 4.235387928285673e-05,
      "loss": 1.4195,
      "num_input_tokens_seen": 22821718608,
      "step": 29007
    },
    {
      "epoch": 3.077445363887121,
      "grad_norm": 0.5590945173027887,
      "learning_rate": 4.235337901994635e-05,
      "loss": 1.311,
      "num_input_tokens_seen": 22822505408,
      "step": 29008
    },
    {
      "epoch": 3.0775514534266923,
      "grad_norm": 0.5991541376956803,
      "learning_rate": 4.235287874362579e-05,
      "loss": 1.4761,
      "num_input_tokens_seen": 22823292192,
      "step": 29009
    },
    {
      "epoch": 3.0776575429662634,
      "grad_norm": 0.6580759695326529,
      "learning_rate": 4.235237845389544e-05,
      "loss": 1.5205,
      "num_input_tokens_seen": 22824078944,
      "step": 29010
    },
    {
      "epoch": 3.077763632505835,
      "grad_norm": 0.6097888474693131,
      "learning_rate": 4.235187815075567e-05,
      "loss": 1.4694,
      "num_input_tokens_seen": 22824865664,
      "step": 29011
    },
    {
      "epoch": 3.0778697220454063,
      "grad_norm": 0.562924366070307,
      "learning_rate": 4.235137783420688e-05,
      "loss": 1.4891,
      "num_input_tokens_seen": 22825652400,
      "step": 29012
    },
    {
      "epoch": 3.077975811584978,
      "grad_norm": 1.1061022547535,
      "learning_rate": 4.2350877504249466e-05,
      "loss": 1.5364,
      "num_input_tokens_seen": 22826439200,
      "step": 29013
    },
    {
      "epoch": 3.0780819011245493,
      "grad_norm": 0.5604056257503469,
      "learning_rate": 4.235037716088379e-05,
      "loss": 1.4283,
      "num_input_tokens_seen": 22827225888,
      "step": 29014
    },
    {
      "epoch": 3.0781879906641203,
      "grad_norm": 1.0982534337017473,
      "learning_rate": 4.234987680411026e-05,
      "loss": 1.4566,
      "num_input_tokens_seen": 22828012704,
      "step": 29015
    },
    {
      "epoch": 3.0782940802036918,
      "grad_norm": 0.5465409218786397,
      "learning_rate": 4.234937643392925e-05,
      "loss": 1.5897,
      "num_input_tokens_seen": 22828799456,
      "step": 29016
    },
    {
      "epoch": 3.0784001697432632,
      "grad_norm": 1.0126301350170448,
      "learning_rate": 4.2348876050341145e-05,
      "loss": 1.4518,
      "num_input_tokens_seen": 22829586208,
      "step": 29017
    },
    {
      "epoch": 3.0785062592828347,
      "grad_norm": 0.6184609680008939,
      "learning_rate": 4.234837565334635e-05,
      "loss": 1.5057,
      "num_input_tokens_seen": 22830372976,
      "step": 29018
    },
    {
      "epoch": 3.078612348822406,
      "grad_norm": 0.8291424723736804,
      "learning_rate": 4.234787524294523e-05,
      "loss": 1.5132,
      "num_input_tokens_seen": 22831159696,
      "step": 29019
    },
    {
      "epoch": 3.0787184383619777,
      "grad_norm": 0.47691404142735827,
      "learning_rate": 4.234737481913818e-05,
      "loss": 1.4262,
      "num_input_tokens_seen": 22831946528,
      "step": 29020
    },
    {
      "epoch": 3.0788245279015487,
      "grad_norm": 0.8030818639994557,
      "learning_rate": 4.23468743819256e-05,
      "loss": 1.3765,
      "num_input_tokens_seen": 22832733360,
      "step": 29021
    },
    {
      "epoch": 3.07893061744112,
      "grad_norm": 0.5444889652710307,
      "learning_rate": 4.234637393130786e-05,
      "loss": 1.5046,
      "num_input_tokens_seen": 22833520032,
      "step": 29022
    },
    {
      "epoch": 3.0790367069806917,
      "grad_norm": 1.0837477176567047,
      "learning_rate": 4.2345873467285346e-05,
      "loss": 1.4173,
      "num_input_tokens_seen": 22834306704,
      "step": 29023
    },
    {
      "epoch": 3.079142796520263,
      "grad_norm": 0.48530193831473806,
      "learning_rate": 4.234537298985845e-05,
      "loss": 1.4842,
      "num_input_tokens_seen": 22835093520,
      "step": 29024
    },
    {
      "epoch": 3.0792488860598346,
      "grad_norm": 0.7405843708917005,
      "learning_rate": 4.234487249902756e-05,
      "loss": 1.4362,
      "num_input_tokens_seen": 22835880304,
      "step": 29025
    },
    {
      "epoch": 3.079354975599406,
      "grad_norm": 0.5059155852690969,
      "learning_rate": 4.234437199479306e-05,
      "loss": 1.4807,
      "num_input_tokens_seen": 22836667024,
      "step": 29026
    },
    {
      "epoch": 3.079461065138977,
      "grad_norm": 0.5987770285266594,
      "learning_rate": 4.2343871477155343e-05,
      "loss": 1.5079,
      "num_input_tokens_seen": 22837453792,
      "step": 29027
    },
    {
      "epoch": 3.0795671546785486,
      "grad_norm": 0.9329268907729134,
      "learning_rate": 4.234337094611479e-05,
      "loss": 1.4458,
      "num_input_tokens_seen": 22838240592,
      "step": 29028
    },
    {
      "epoch": 3.07967324421812,
      "grad_norm": 0.48940477325177695,
      "learning_rate": 4.234287040167179e-05,
      "loss": 1.3532,
      "num_input_tokens_seen": 22839027280,
      "step": 29029
    },
    {
      "epoch": 3.0797793337576915,
      "grad_norm": 0.8164002761995763,
      "learning_rate": 4.234236984382672e-05,
      "loss": 1.477,
      "num_input_tokens_seen": 22839814064,
      "step": 29030
    },
    {
      "epoch": 3.079885423297263,
      "grad_norm": 0.5831634290452139,
      "learning_rate": 4.2341869272579984e-05,
      "loss": 1.3963,
      "num_input_tokens_seen": 22840600832,
      "step": 29031
    },
    {
      "epoch": 3.0799915128368345,
      "grad_norm": 0.5411112708615937,
      "learning_rate": 4.234136868793196e-05,
      "loss": 1.4348,
      "num_input_tokens_seen": 22841387568,
      "step": 29032
    },
    {
      "epoch": 3.0800976023764055,
      "grad_norm": 0.6340548425712736,
      "learning_rate": 4.2340868089883036e-05,
      "loss": 1.4556,
      "num_input_tokens_seen": 22842174352,
      "step": 29033
    },
    {
      "epoch": 3.080203691915977,
      "grad_norm": 0.5812505223444518,
      "learning_rate": 4.234036747843359e-05,
      "loss": 1.3818,
      "num_input_tokens_seen": 22842961072,
      "step": 29034
    },
    {
      "epoch": 3.0803097814555485,
      "grad_norm": 0.5023515828853611,
      "learning_rate": 4.233986685358402e-05,
      "loss": 1.4805,
      "num_input_tokens_seen": 22843747840,
      "step": 29035
    },
    {
      "epoch": 3.08041587099512,
      "grad_norm": 0.6272273258310426,
      "learning_rate": 4.233936621533471e-05,
      "loss": 1.4988,
      "num_input_tokens_seen": 22844534576,
      "step": 29036
    },
    {
      "epoch": 3.0805219605346914,
      "grad_norm": 0.4565587687453616,
      "learning_rate": 4.233886556368605e-05,
      "loss": 1.4518,
      "num_input_tokens_seen": 22845321408,
      "step": 29037
    },
    {
      "epoch": 3.080628050074263,
      "grad_norm": 0.39124662666077265,
      "learning_rate": 4.233836489863842e-05,
      "loss": 1.3832,
      "num_input_tokens_seen": 22846108176,
      "step": 29038
    },
    {
      "epoch": 3.080734139613834,
      "grad_norm": 0.6345196485363689,
      "learning_rate": 4.233786422019221e-05,
      "loss": 1.5762,
      "num_input_tokens_seen": 22846894976,
      "step": 29039
    },
    {
      "epoch": 3.0808402291534054,
      "grad_norm": 0.5960269566417598,
      "learning_rate": 4.233736352834781e-05,
      "loss": 1.4351,
      "num_input_tokens_seen": 22847681760,
      "step": 29040
    },
    {
      "epoch": 3.080946318692977,
      "grad_norm": 0.6107339119517964,
      "learning_rate": 4.23368628231056e-05,
      "loss": 1.4891,
      "num_input_tokens_seen": 22848468544,
      "step": 29041
    },
    {
      "epoch": 3.0810524082325483,
      "grad_norm": 0.7442586263445794,
      "learning_rate": 4.2336362104465976e-05,
      "loss": 1.5357,
      "num_input_tokens_seen": 22849255280,
      "step": 29042
    },
    {
      "epoch": 3.08115849777212,
      "grad_norm": 0.5062609027186391,
      "learning_rate": 4.233586137242932e-05,
      "loss": 1.5199,
      "num_input_tokens_seen": 22850042032,
      "step": 29043
    },
    {
      "epoch": 3.081264587311691,
      "grad_norm": 0.52037276447812,
      "learning_rate": 4.233536062699601e-05,
      "loss": 1.4446,
      "num_input_tokens_seen": 22850828848,
      "step": 29044
    },
    {
      "epoch": 3.0813706768512623,
      "grad_norm": 0.5955880986326296,
      "learning_rate": 4.2334859868166455e-05,
      "loss": 1.5254,
      "num_input_tokens_seen": 22851615648,
      "step": 29045
    },
    {
      "epoch": 3.081476766390834,
      "grad_norm": 0.4269256747678078,
      "learning_rate": 4.2334359095941023e-05,
      "loss": 1.4119,
      "num_input_tokens_seen": 22852402400,
      "step": 29046
    },
    {
      "epoch": 3.0815828559304053,
      "grad_norm": 0.49942599298756885,
      "learning_rate": 4.2333858310320105e-05,
      "loss": 1.5604,
      "num_input_tokens_seen": 22853189152,
      "step": 29047
    },
    {
      "epoch": 3.0816889454699767,
      "grad_norm": 0.5008848830323392,
      "learning_rate": 4.233335751130409e-05,
      "loss": 1.3819,
      "num_input_tokens_seen": 22853975920,
      "step": 29048
    },
    {
      "epoch": 3.081795035009548,
      "grad_norm": 0.47916713284172135,
      "learning_rate": 4.2332856698893365e-05,
      "loss": 1.4123,
      "num_input_tokens_seen": 22854762672,
      "step": 29049
    },
    {
      "epoch": 3.0819011245491192,
      "grad_norm": 0.45594703987974994,
      "learning_rate": 4.233235587308832e-05,
      "loss": 1.4137,
      "num_input_tokens_seen": 22855549504,
      "step": 29050
    },
    {
      "epoch": 3.0820072140886907,
      "grad_norm": 0.501518133007716,
      "learning_rate": 4.233185503388933e-05,
      "loss": 1.3893,
      "num_input_tokens_seen": 22856336192,
      "step": 29051
    },
    {
      "epoch": 3.082113303628262,
      "grad_norm": 0.6035255464532169,
      "learning_rate": 4.233135418129681e-05,
      "loss": 1.4839,
      "num_input_tokens_seen": 22857123008,
      "step": 29052
    },
    {
      "epoch": 3.0822193931678337,
      "grad_norm": 0.5442876428822515,
      "learning_rate": 4.2330853315311114e-05,
      "loss": 1.5086,
      "num_input_tokens_seen": 22857909760,
      "step": 29053
    },
    {
      "epoch": 3.082325482707405,
      "grad_norm": 0.4547578065587246,
      "learning_rate": 4.233035243593264e-05,
      "loss": 1.5113,
      "num_input_tokens_seen": 22858696528,
      "step": 29054
    },
    {
      "epoch": 3.0824315722469766,
      "grad_norm": 0.46964414254082504,
      "learning_rate": 4.232985154316179e-05,
      "loss": 1.4952,
      "num_input_tokens_seen": 22859483392,
      "step": 29055
    },
    {
      "epoch": 3.0825376617865476,
      "grad_norm": 0.501488819135944,
      "learning_rate": 4.2329350636998936e-05,
      "loss": 1.4648,
      "num_input_tokens_seen": 22860270080,
      "step": 29056
    },
    {
      "epoch": 3.082643751326119,
      "grad_norm": 0.4037400430783754,
      "learning_rate": 4.232884971744446e-05,
      "loss": 1.3769,
      "num_input_tokens_seen": 22861056864,
      "step": 29057
    },
    {
      "epoch": 3.0827498408656906,
      "grad_norm": 0.5734996931280282,
      "learning_rate": 4.232834878449876e-05,
      "loss": 1.5586,
      "num_input_tokens_seen": 22861843616,
      "step": 29058
    },
    {
      "epoch": 3.082855930405262,
      "grad_norm": 0.4648595513683757,
      "learning_rate": 4.232784783816223e-05,
      "loss": 1.4239,
      "num_input_tokens_seen": 22862630464,
      "step": 29059
    },
    {
      "epoch": 3.0829620199448335,
      "grad_norm": 0.4381377281897817,
      "learning_rate": 4.232734687843524e-05,
      "loss": 1.3451,
      "num_input_tokens_seen": 22863417248,
      "step": 29060
    },
    {
      "epoch": 3.083068109484405,
      "grad_norm": 0.4422866400753014,
      "learning_rate": 4.232684590531818e-05,
      "loss": 1.5519,
      "num_input_tokens_seen": 22864203936,
      "step": 29061
    },
    {
      "epoch": 3.083174199023976,
      "grad_norm": 0.4131657516846561,
      "learning_rate": 4.232634491881145e-05,
      "loss": 1.4353,
      "num_input_tokens_seen": 22864990656,
      "step": 29062
    },
    {
      "epoch": 3.0832802885635475,
      "grad_norm": 0.42920067696636877,
      "learning_rate": 4.2325843918915434e-05,
      "loss": 1.5416,
      "num_input_tokens_seen": 22865777312,
      "step": 29063
    },
    {
      "epoch": 3.083386378103119,
      "grad_norm": 0.49252003863474164,
      "learning_rate": 4.23253429056305e-05,
      "loss": 1.443,
      "num_input_tokens_seen": 22866564144,
      "step": 29064
    },
    {
      "epoch": 3.0834924676426905,
      "grad_norm": 0.45977441975100475,
      "learning_rate": 4.2324841878957054e-05,
      "loss": 1.4753,
      "num_input_tokens_seen": 22867350976,
      "step": 29065
    },
    {
      "epoch": 3.083598557182262,
      "grad_norm": 0.415360861649472,
      "learning_rate": 4.232434083889548e-05,
      "loss": 1.4517,
      "num_input_tokens_seen": 22868137760,
      "step": 29066
    },
    {
      "epoch": 3.0837046467218334,
      "grad_norm": 0.5100354829942475,
      "learning_rate": 4.232383978544616e-05,
      "loss": 1.5293,
      "num_input_tokens_seen": 22868924528,
      "step": 29067
    },
    {
      "epoch": 3.0838107362614045,
      "grad_norm": 0.4675211230172874,
      "learning_rate": 4.23233387186095e-05,
      "loss": 1.514,
      "num_input_tokens_seen": 22869711216,
      "step": 29068
    },
    {
      "epoch": 3.083916825800976,
      "grad_norm": 0.43788235383381907,
      "learning_rate": 4.232283763838586e-05,
      "loss": 1.5662,
      "num_input_tokens_seen": 22870497936,
      "step": 29069
    },
    {
      "epoch": 3.0840229153405474,
      "grad_norm": 0.44647145083037343,
      "learning_rate": 4.2322336544775635e-05,
      "loss": 1.412,
      "num_input_tokens_seen": 22871284688,
      "step": 29070
    },
    {
      "epoch": 3.084129004880119,
      "grad_norm": 0.4923299233992939,
      "learning_rate": 4.232183543777922e-05,
      "loss": 1.3787,
      "num_input_tokens_seen": 22872071552,
      "step": 29071
    },
    {
      "epoch": 3.0842350944196903,
      "grad_norm": 0.5713726474024833,
      "learning_rate": 4.232133431739701e-05,
      "loss": 1.4783,
      "num_input_tokens_seen": 22872858224,
      "step": 29072
    },
    {
      "epoch": 3.084341183959262,
      "grad_norm": 0.6212453688397297,
      "learning_rate": 4.232083318362937e-05,
      "loss": 1.3983,
      "num_input_tokens_seen": 22873644960,
      "step": 29073
    },
    {
      "epoch": 3.084447273498833,
      "grad_norm": 0.6947418769676837,
      "learning_rate": 4.23203320364767e-05,
      "loss": 1.602,
      "num_input_tokens_seen": 22874431632,
      "step": 29074
    },
    {
      "epoch": 3.0845533630384043,
      "grad_norm": 0.5499874597088544,
      "learning_rate": 4.231983087593938e-05,
      "loss": 1.3528,
      "num_input_tokens_seen": 22875218480,
      "step": 29075
    },
    {
      "epoch": 3.084659452577976,
      "grad_norm": 0.7761583356371206,
      "learning_rate": 4.2319329702017816e-05,
      "loss": 1.5615,
      "num_input_tokens_seen": 22876005216,
      "step": 29076
    },
    {
      "epoch": 3.0847655421175473,
      "grad_norm": 0.4236546477449436,
      "learning_rate": 4.231882851471237e-05,
      "loss": 1.4911,
      "num_input_tokens_seen": 22876791952,
      "step": 29077
    },
    {
      "epoch": 3.0848716316571188,
      "grad_norm": 0.6262284549181739,
      "learning_rate": 4.231832731402345e-05,
      "loss": 1.4958,
      "num_input_tokens_seen": 22877578688,
      "step": 29078
    },
    {
      "epoch": 3.0849777211966902,
      "grad_norm": 0.735419023629039,
      "learning_rate": 4.231782609995143e-05,
      "loss": 1.4396,
      "num_input_tokens_seen": 22878365488,
      "step": 29079
    },
    {
      "epoch": 3.0850838107362613,
      "grad_norm": 0.5102424421839784,
      "learning_rate": 4.2317324872496704e-05,
      "loss": 1.4372,
      "num_input_tokens_seen": 22879152256,
      "step": 29080
    },
    {
      "epoch": 3.0851899002758327,
      "grad_norm": 0.596072037541406,
      "learning_rate": 4.231682363165966e-05,
      "loss": 1.4304,
      "num_input_tokens_seen": 22879938976,
      "step": 29081
    },
    {
      "epoch": 3.085295989815404,
      "grad_norm": 0.5355265659624096,
      "learning_rate": 4.231632237744067e-05,
      "loss": 1.3973,
      "num_input_tokens_seen": 22880725712,
      "step": 29082
    },
    {
      "epoch": 3.0854020793549757,
      "grad_norm": 0.5102944731054792,
      "learning_rate": 4.2315821109840146e-05,
      "loss": 1.5965,
      "num_input_tokens_seen": 22881512512,
      "step": 29083
    },
    {
      "epoch": 3.085508168894547,
      "grad_norm": 0.8217603193699289,
      "learning_rate": 4.231531982885847e-05,
      "loss": 1.5873,
      "num_input_tokens_seen": 22882299264,
      "step": 29084
    },
    {
      "epoch": 3.085614258434118,
      "grad_norm": 0.44447952660102735,
      "learning_rate": 4.231481853449601e-05,
      "loss": 1.5084,
      "num_input_tokens_seen": 22883086064,
      "step": 29085
    },
    {
      "epoch": 3.0857203479736897,
      "grad_norm": 0.6387210530300652,
      "learning_rate": 4.2314317226753175e-05,
      "loss": 1.4309,
      "num_input_tokens_seen": 22883872848,
      "step": 29086
    },
    {
      "epoch": 3.085826437513261,
      "grad_norm": 0.48183509086955195,
      "learning_rate": 4.2313815905630337e-05,
      "loss": 1.4587,
      "num_input_tokens_seen": 22884659584,
      "step": 29087
    },
    {
      "epoch": 3.0859325270528326,
      "grad_norm": 0.40439256170123977,
      "learning_rate": 4.2313314571127894e-05,
      "loss": 1.527,
      "num_input_tokens_seen": 22885446272,
      "step": 29088
    },
    {
      "epoch": 3.086038616592404,
      "grad_norm": 0.6811405004796165,
      "learning_rate": 4.231281322324623e-05,
      "loss": 1.5206,
      "num_input_tokens_seen": 22886233008,
      "step": 29089
    },
    {
      "epoch": 3.0861447061319756,
      "grad_norm": 0.530174904284429,
      "learning_rate": 4.231231186198572e-05,
      "loss": 1.4282,
      "num_input_tokens_seen": 22887019824,
      "step": 29090
    },
    {
      "epoch": 3.0862507956715466,
      "grad_norm": 0.41611333965205377,
      "learning_rate": 4.231181048734678e-05,
      "loss": 1.3982,
      "num_input_tokens_seen": 22887806640,
      "step": 29091
    },
    {
      "epoch": 3.086356885211118,
      "grad_norm": 0.594430265408942,
      "learning_rate": 4.231130909932977e-05,
      "loss": 1.5028,
      "num_input_tokens_seen": 22888593456,
      "step": 29092
    },
    {
      "epoch": 3.0864629747506895,
      "grad_norm": 0.4567469277425258,
      "learning_rate": 4.23108076979351e-05,
      "loss": 1.3944,
      "num_input_tokens_seen": 22889380352,
      "step": 29093
    },
    {
      "epoch": 3.086569064290261,
      "grad_norm": 0.5752521486629874,
      "learning_rate": 4.2310306283163125e-05,
      "loss": 1.4808,
      "num_input_tokens_seen": 22890167152,
      "step": 29094
    },
    {
      "epoch": 3.0866751538298325,
      "grad_norm": 0.43959655987580665,
      "learning_rate": 4.230980485501427e-05,
      "loss": 1.3294,
      "num_input_tokens_seen": 22890953872,
      "step": 29095
    },
    {
      "epoch": 3.086781243369404,
      "grad_norm": 0.4233461994053098,
      "learning_rate": 4.2309303413488904e-05,
      "loss": 1.4042,
      "num_input_tokens_seen": 22891740720,
      "step": 29096
    },
    {
      "epoch": 3.086887332908975,
      "grad_norm": 0.4540386896866316,
      "learning_rate": 4.230880195858741e-05,
      "loss": 1.6114,
      "num_input_tokens_seen": 22892527424,
      "step": 29097
    },
    {
      "epoch": 3.0869934224485465,
      "grad_norm": 0.44673761761360936,
      "learning_rate": 4.2308300490310195e-05,
      "loss": 1.4425,
      "num_input_tokens_seen": 22893314080,
      "step": 29098
    },
    {
      "epoch": 3.087099511988118,
      "grad_norm": 0.38100010168489556,
      "learning_rate": 4.2307799008657624e-05,
      "loss": 1.4488,
      "num_input_tokens_seen": 22894100880,
      "step": 29099
    },
    {
      "epoch": 3.0872056015276894,
      "grad_norm": 0.42225970875921187,
      "learning_rate": 4.230729751363009e-05,
      "loss": 1.4818,
      "num_input_tokens_seen": 22894887680,
      "step": 29100
    },
    {
      "epoch": 3.087311691067261,
      "grad_norm": 0.40245002061564916,
      "learning_rate": 4.230679600522799e-05,
      "loss": 1.3115,
      "num_input_tokens_seen": 22895674416,
      "step": 29101
    },
    {
      "epoch": 3.0874177806068324,
      "grad_norm": 0.4738736424840595,
      "learning_rate": 4.23062944834517e-05,
      "loss": 1.4432,
      "num_input_tokens_seen": 22896461200,
      "step": 29102
    },
    {
      "epoch": 3.0875238701464034,
      "grad_norm": 0.43375821861359704,
      "learning_rate": 4.230579294830161e-05,
      "loss": 1.5214,
      "num_input_tokens_seen": 22897247872,
      "step": 29103
    },
    {
      "epoch": 3.087629959685975,
      "grad_norm": 0.5412232555405933,
      "learning_rate": 4.230529139977812e-05,
      "loss": 1.4996,
      "num_input_tokens_seen": 22898034592,
      "step": 29104
    },
    {
      "epoch": 3.0877360492255463,
      "grad_norm": 0.4426092096292846,
      "learning_rate": 4.2304789837881615e-05,
      "loss": 1.5622,
      "num_input_tokens_seen": 22898821280,
      "step": 29105
    },
    {
      "epoch": 3.087842138765118,
      "grad_norm": 0.41534476075612636,
      "learning_rate": 4.230428826261247e-05,
      "loss": 1.3546,
      "num_input_tokens_seen": 22899608080,
      "step": 29106
    },
    {
      "epoch": 3.0879482283046893,
      "grad_norm": 0.7556309361396927,
      "learning_rate": 4.230378667397107e-05,
      "loss": 1.4803,
      "num_input_tokens_seen": 22900394912,
      "step": 29107
    },
    {
      "epoch": 3.0880543178442608,
      "grad_norm": 0.41197547889427666,
      "learning_rate": 4.230328507195782e-05,
      "loss": 1.3633,
      "num_input_tokens_seen": 22901181632,
      "step": 29108
    },
    {
      "epoch": 3.088160407383832,
      "grad_norm": 0.7305552595044197,
      "learning_rate": 4.2302783456573104e-05,
      "loss": 1.3574,
      "num_input_tokens_seen": 22901968480,
      "step": 29109
    },
    {
      "epoch": 3.0882664969234033,
      "grad_norm": 0.5883130915707847,
      "learning_rate": 4.230228182781729e-05,
      "loss": 1.5384,
      "num_input_tokens_seen": 22902755248,
      "step": 29110
    },
    {
      "epoch": 3.0883725864629747,
      "grad_norm": 0.781972969331453,
      "learning_rate": 4.230178018569079e-05,
      "loss": 1.4764,
      "num_input_tokens_seen": 22903542016,
      "step": 29111
    },
    {
      "epoch": 3.088478676002546,
      "grad_norm": 0.5946906074340829,
      "learning_rate": 4.2301278530193986e-05,
      "loss": 1.3522,
      "num_input_tokens_seen": 22904328896,
      "step": 29112
    },
    {
      "epoch": 3.0885847655421177,
      "grad_norm": 0.48403403849642734,
      "learning_rate": 4.230077686132725e-05,
      "loss": 1.4493,
      "num_input_tokens_seen": 22905115632,
      "step": 29113
    },
    {
      "epoch": 3.0886908550816887,
      "grad_norm": 0.6660012892662053,
      "learning_rate": 4.2300275179090985e-05,
      "loss": 1.3642,
      "num_input_tokens_seen": 22905902368,
      "step": 29114
    },
    {
      "epoch": 3.08879694462126,
      "grad_norm": 0.43684850607041414,
      "learning_rate": 4.2299773483485584e-05,
      "loss": 1.5382,
      "num_input_tokens_seen": 22906689168,
      "step": 29115
    },
    {
      "epoch": 3.0889030341608317,
      "grad_norm": 0.5741880363281178,
      "learning_rate": 4.229927177451142e-05,
      "loss": 1.4323,
      "num_input_tokens_seen": 22907475920,
      "step": 29116
    },
    {
      "epoch": 3.089009123700403,
      "grad_norm": 0.44669664010325794,
      "learning_rate": 4.229877005216888e-05,
      "loss": 1.4735,
      "num_input_tokens_seen": 22908262736,
      "step": 29117
    },
    {
      "epoch": 3.0891152132399746,
      "grad_norm": 0.4594393989390884,
      "learning_rate": 4.229826831645837e-05,
      "loss": 1.4551,
      "num_input_tokens_seen": 22909049584,
      "step": 29118
    },
    {
      "epoch": 3.089221302779546,
      "grad_norm": 0.42313909441783193,
      "learning_rate": 4.2297766567380256e-05,
      "loss": 1.5224,
      "num_input_tokens_seen": 22909836336,
      "step": 29119
    },
    {
      "epoch": 3.089327392319117,
      "grad_norm": 0.51651595082655,
      "learning_rate": 4.2297264804934936e-05,
      "loss": 1.4118,
      "num_input_tokens_seen": 22910623120,
      "step": 29120
    },
    {
      "epoch": 3.0894334818586886,
      "grad_norm": 0.505831094838494,
      "learning_rate": 4.22967630291228e-05,
      "loss": 1.5272,
      "num_input_tokens_seen": 22911409888,
      "step": 29121
    },
    {
      "epoch": 3.08953957139826,
      "grad_norm": 0.4183924638465009,
      "learning_rate": 4.229626123994424e-05,
      "loss": 1.4504,
      "num_input_tokens_seen": 22912196656,
      "step": 29122
    },
    {
      "epoch": 3.0896456609378316,
      "grad_norm": 0.47767139461615504,
      "learning_rate": 4.2295759437399625e-05,
      "loss": 1.5282,
      "num_input_tokens_seen": 22912983440,
      "step": 29123
    },
    {
      "epoch": 3.089751750477403,
      "grad_norm": 0.4470047314931231,
      "learning_rate": 4.229525762148936e-05,
      "loss": 1.4766,
      "num_input_tokens_seen": 22913770256,
      "step": 29124
    },
    {
      "epoch": 3.0898578400169745,
      "grad_norm": 0.4307983985433586,
      "learning_rate": 4.2294755792213826e-05,
      "loss": 1.4143,
      "num_input_tokens_seen": 22914557024,
      "step": 29125
    },
    {
      "epoch": 3.0899639295565455,
      "grad_norm": 0.4512779887324187,
      "learning_rate": 4.229425394957341e-05,
      "loss": 1.4867,
      "num_input_tokens_seen": 22915343792,
      "step": 29126
    },
    {
      "epoch": 3.090070019096117,
      "grad_norm": 1.0526774047199496,
      "learning_rate": 4.2293752093568504e-05,
      "loss": 1.4631,
      "num_input_tokens_seen": 22916130608,
      "step": 29127
    },
    {
      "epoch": 3.0901761086356885,
      "grad_norm": 0.4559229607916994,
      "learning_rate": 4.22932502241995e-05,
      "loss": 1.5777,
      "num_input_tokens_seen": 22916917360,
      "step": 29128
    },
    {
      "epoch": 3.09028219817526,
      "grad_norm": 0.4725948891984167,
      "learning_rate": 4.229274834146677e-05,
      "loss": 1.3609,
      "num_input_tokens_seen": 22917704240,
      "step": 29129
    },
    {
      "epoch": 3.0903882877148314,
      "grad_norm": 0.4919216611705805,
      "learning_rate": 4.229224644537072e-05,
      "loss": 1.4438,
      "num_input_tokens_seen": 22918490976,
      "step": 29130
    },
    {
      "epoch": 3.090494377254403,
      "grad_norm": 0.442124514771381,
      "learning_rate": 4.229174453591173e-05,
      "loss": 1.427,
      "num_input_tokens_seen": 22919277712,
      "step": 29131
    },
    {
      "epoch": 3.090600466793974,
      "grad_norm": 0.5809433658960624,
      "learning_rate": 4.229124261309017e-05,
      "loss": 1.4959,
      "num_input_tokens_seen": 22920064512,
      "step": 29132
    },
    {
      "epoch": 3.0907065563335454,
      "grad_norm": 0.5179116412508475,
      "learning_rate": 4.229074067690646e-05,
      "loss": 1.405,
      "num_input_tokens_seen": 22920851200,
      "step": 29133
    },
    {
      "epoch": 3.090812645873117,
      "grad_norm": 0.4732765237315254,
      "learning_rate": 4.2290238727360976e-05,
      "loss": 1.4731,
      "num_input_tokens_seen": 22921638016,
      "step": 29134
    },
    {
      "epoch": 3.0909187354126884,
      "grad_norm": 0.47343168214907444,
      "learning_rate": 4.2289736764454094e-05,
      "loss": 1.4431,
      "num_input_tokens_seen": 22922424752,
      "step": 29135
    },
    {
      "epoch": 3.09102482495226,
      "grad_norm": 0.3609325311871423,
      "learning_rate": 4.2289234788186215e-05,
      "loss": 1.3896,
      "num_input_tokens_seen": 22923211632,
      "step": 29136
    },
    {
      "epoch": 3.0911309144918313,
      "grad_norm": 0.3999773131432355,
      "learning_rate": 4.228873279855772e-05,
      "loss": 1.384,
      "num_input_tokens_seen": 22923998400,
      "step": 29137
    },
    {
      "epoch": 3.0912370040314023,
      "grad_norm": 0.4506739610838951,
      "learning_rate": 4.2288230795569e-05,
      "loss": 1.6093,
      "num_input_tokens_seen": 22924785184,
      "step": 29138
    },
    {
      "epoch": 3.091343093570974,
      "grad_norm": 0.4634817852655815,
      "learning_rate": 4.228772877922044e-05,
      "loss": 1.4348,
      "num_input_tokens_seen": 22925572016,
      "step": 29139
    },
    {
      "epoch": 3.0914491831105453,
      "grad_norm": 0.49218376615823844,
      "learning_rate": 4.228722674951243e-05,
      "loss": 1.325,
      "num_input_tokens_seen": 22926358864,
      "step": 29140
    },
    {
      "epoch": 3.0915552726501168,
      "grad_norm": 0.5448630917037773,
      "learning_rate": 4.228672470644537e-05,
      "loss": 1.4272,
      "num_input_tokens_seen": 22927145616,
      "step": 29141
    },
    {
      "epoch": 3.0916613621896882,
      "grad_norm": 0.45427525895105786,
      "learning_rate": 4.2286222650019625e-05,
      "loss": 1.5547,
      "num_input_tokens_seen": 22927932352,
      "step": 29142
    },
    {
      "epoch": 3.0917674517292597,
      "grad_norm": 0.7047235361652252,
      "learning_rate": 4.22857205802356e-05,
      "loss": 1.5674,
      "num_input_tokens_seen": 22928719088,
      "step": 29143
    },
    {
      "epoch": 3.0918735412688307,
      "grad_norm": 0.4187604987854303,
      "learning_rate": 4.2285218497093674e-05,
      "loss": 1.4337,
      "num_input_tokens_seen": 22929505824,
      "step": 29144
    },
    {
      "epoch": 3.091979630808402,
      "grad_norm": 0.43533197854508265,
      "learning_rate": 4.228471640059424e-05,
      "loss": 1.3692,
      "num_input_tokens_seen": 22930292688,
      "step": 29145
    },
    {
      "epoch": 3.0920857203479737,
      "grad_norm": 0.6373562143852789,
      "learning_rate": 4.228421429073769e-05,
      "loss": 1.5199,
      "num_input_tokens_seen": 22931079360,
      "step": 29146
    },
    {
      "epoch": 3.092191809887545,
      "grad_norm": 0.4106600066494987,
      "learning_rate": 4.22837121675244e-05,
      "loss": 1.4008,
      "num_input_tokens_seen": 22931866096,
      "step": 29147
    },
    {
      "epoch": 3.0922978994271166,
      "grad_norm": 0.6762757889120077,
      "learning_rate": 4.228321003095476e-05,
      "loss": 1.3593,
      "num_input_tokens_seen": 22932652848,
      "step": 29148
    },
    {
      "epoch": 3.092403988966688,
      "grad_norm": 0.5452278643328538,
      "learning_rate": 4.228270788102917e-05,
      "loss": 1.6264,
      "num_input_tokens_seen": 22933439632,
      "step": 29149
    },
    {
      "epoch": 3.092510078506259,
      "grad_norm": 0.48457472241521715,
      "learning_rate": 4.2282205717748005e-05,
      "loss": 1.4338,
      "num_input_tokens_seen": 22934226288,
      "step": 29150
    },
    {
      "epoch": 3.0926161680458306,
      "grad_norm": 0.761169435589847,
      "learning_rate": 4.2281703541111664e-05,
      "loss": 1.3469,
      "num_input_tokens_seen": 22935013088,
      "step": 29151
    },
    {
      "epoch": 3.092722257585402,
      "grad_norm": 0.45228967252502006,
      "learning_rate": 4.228120135112053e-05,
      "loss": 1.4748,
      "num_input_tokens_seen": 22935799808,
      "step": 29152
    },
    {
      "epoch": 3.0928283471249736,
      "grad_norm": 0.5956441450259594,
      "learning_rate": 4.228069914777498e-05,
      "loss": 1.331,
      "num_input_tokens_seen": 22936586608,
      "step": 29153
    },
    {
      "epoch": 3.092934436664545,
      "grad_norm": 0.550017501091577,
      "learning_rate": 4.2280196931075425e-05,
      "loss": 1.5252,
      "num_input_tokens_seen": 22937373344,
      "step": 29154
    },
    {
      "epoch": 3.093040526204116,
      "grad_norm": 0.3670842050567368,
      "learning_rate": 4.227969470102223e-05,
      "loss": 1.2521,
      "num_input_tokens_seen": 22938160176,
      "step": 29155
    },
    {
      "epoch": 3.0931466157436875,
      "grad_norm": 0.6126495079235131,
      "learning_rate": 4.22791924576158e-05,
      "loss": 1.4314,
      "num_input_tokens_seen": 22938946864,
      "step": 29156
    },
    {
      "epoch": 3.093252705283259,
      "grad_norm": 0.47576140200377276,
      "learning_rate": 4.227869020085652e-05,
      "loss": 1.3971,
      "num_input_tokens_seen": 22939733584,
      "step": 29157
    },
    {
      "epoch": 3.0933587948228305,
      "grad_norm": 0.48483958266036903,
      "learning_rate": 4.2278187930744775e-05,
      "loss": 1.5469,
      "num_input_tokens_seen": 22940520416,
      "step": 29158
    },
    {
      "epoch": 3.093464884362402,
      "grad_norm": 0.8326277452030089,
      "learning_rate": 4.227768564728095e-05,
      "loss": 1.5121,
      "num_input_tokens_seen": 22941307264,
      "step": 29159
    },
    {
      "epoch": 3.0935709739019734,
      "grad_norm": 0.47655547406132776,
      "learning_rate": 4.227718335046544e-05,
      "loss": 1.3482,
      "num_input_tokens_seen": 22942093952,
      "step": 29160
    },
    {
      "epoch": 3.0936770634415445,
      "grad_norm": 0.8817247202569062,
      "learning_rate": 4.2276681040298625e-05,
      "loss": 1.5162,
      "num_input_tokens_seen": 22942880736,
      "step": 29161
    },
    {
      "epoch": 3.093783152981116,
      "grad_norm": 0.503256069858756,
      "learning_rate": 4.22761787167809e-05,
      "loss": 1.4325,
      "num_input_tokens_seen": 22943667584,
      "step": 29162
    },
    {
      "epoch": 3.0938892425206874,
      "grad_norm": 0.7723443823682521,
      "learning_rate": 4.2275676379912654e-05,
      "loss": 1.4036,
      "num_input_tokens_seen": 22944454352,
      "step": 29163
    },
    {
      "epoch": 3.093995332060259,
      "grad_norm": 0.47662949548755473,
      "learning_rate": 4.2275174029694265e-05,
      "loss": 1.5357,
      "num_input_tokens_seen": 22945241072,
      "step": 29164
    },
    {
      "epoch": 3.0941014215998304,
      "grad_norm": 0.4587383835518042,
      "learning_rate": 4.227467166612613e-05,
      "loss": 1.5202,
      "num_input_tokens_seen": 22946027792,
      "step": 29165
    },
    {
      "epoch": 3.094207511139402,
      "grad_norm": 0.4352501272932697,
      "learning_rate": 4.2274169289208644e-05,
      "loss": 1.4877,
      "num_input_tokens_seen": 22946814560,
      "step": 29166
    },
    {
      "epoch": 3.094313600678973,
      "grad_norm": 0.43860746681633417,
      "learning_rate": 4.227366689894218e-05,
      "loss": 1.4475,
      "num_input_tokens_seen": 22947601312,
      "step": 29167
    },
    {
      "epoch": 3.0944196902185443,
      "grad_norm": 0.47428289373784677,
      "learning_rate": 4.2273164495327136e-05,
      "loss": 1.4923,
      "num_input_tokens_seen": 22948388080,
      "step": 29168
    },
    {
      "epoch": 3.094525779758116,
      "grad_norm": 0.44648752388104845,
      "learning_rate": 4.227266207836389e-05,
      "loss": 1.5643,
      "num_input_tokens_seen": 22949174736,
      "step": 29169
    },
    {
      "epoch": 3.0946318692976873,
      "grad_norm": 0.4178770232909501,
      "learning_rate": 4.2272159648052846e-05,
      "loss": 1.3782,
      "num_input_tokens_seen": 22949961552,
      "step": 29170
    },
    {
      "epoch": 3.0947379588372588,
      "grad_norm": 0.5171813446981343,
      "learning_rate": 4.2271657204394376e-05,
      "loss": 1.5643,
      "num_input_tokens_seen": 22950748288,
      "step": 29171
    },
    {
      "epoch": 3.0948440483768302,
      "grad_norm": 0.4059894072960734,
      "learning_rate": 4.227115474738888e-05,
      "loss": 1.3883,
      "num_input_tokens_seen": 22951535056,
      "step": 29172
    },
    {
      "epoch": 3.0949501379164013,
      "grad_norm": 0.40891395370418326,
      "learning_rate": 4.2270652277036746e-05,
      "loss": 1.4264,
      "num_input_tokens_seen": 22952321856,
      "step": 29173
    },
    {
      "epoch": 3.0950562274559728,
      "grad_norm": 0.48027445057998963,
      "learning_rate": 4.227014979333835e-05,
      "loss": 1.4986,
      "num_input_tokens_seen": 22953108560,
      "step": 29174
    },
    {
      "epoch": 3.0951623169955442,
      "grad_norm": 0.3764242109575928,
      "learning_rate": 4.2269647296294105e-05,
      "loss": 1.3682,
      "num_input_tokens_seen": 22953895360,
      "step": 29175
    },
    {
      "epoch": 3.0952684065351157,
      "grad_norm": 0.6393782191093298,
      "learning_rate": 4.226914478590437e-05,
      "loss": 1.5769,
      "num_input_tokens_seen": 22954682176,
      "step": 29176
    },
    {
      "epoch": 3.095374496074687,
      "grad_norm": 0.41268833902963425,
      "learning_rate": 4.2268642262169544e-05,
      "loss": 1.3542,
      "num_input_tokens_seen": 22955468960,
      "step": 29177
    },
    {
      "epoch": 3.0954805856142587,
      "grad_norm": 0.6117948877157615,
      "learning_rate": 4.226813972509003e-05,
      "loss": 1.4516,
      "num_input_tokens_seen": 22956255696,
      "step": 29178
    },
    {
      "epoch": 3.0955866751538297,
      "grad_norm": 0.4889252179940833,
      "learning_rate": 4.22676371746662e-05,
      "loss": 1.5666,
      "num_input_tokens_seen": 22957042400,
      "step": 29179
    },
    {
      "epoch": 3.095692764693401,
      "grad_norm": 0.4337824947576193,
      "learning_rate": 4.226713461089844e-05,
      "loss": 1.527,
      "num_input_tokens_seen": 22957829184,
      "step": 29180
    },
    {
      "epoch": 3.0957988542329726,
      "grad_norm": 0.5776883440999075,
      "learning_rate": 4.226663203378715e-05,
      "loss": 1.4801,
      "num_input_tokens_seen": 22958616000,
      "step": 29181
    },
    {
      "epoch": 3.095904943772544,
      "grad_norm": 0.4543459831464712,
      "learning_rate": 4.226612944333271e-05,
      "loss": 1.4069,
      "num_input_tokens_seen": 22959402720,
      "step": 29182
    },
    {
      "epoch": 3.0960110333121156,
      "grad_norm": 0.44240719990940924,
      "learning_rate": 4.226562683953551e-05,
      "loss": 1.5023,
      "num_input_tokens_seen": 22960189472,
      "step": 29183
    },
    {
      "epoch": 3.0961171228516866,
      "grad_norm": 0.4146017610938903,
      "learning_rate": 4.226512422239595e-05,
      "loss": 1.5347,
      "num_input_tokens_seen": 22960976176,
      "step": 29184
    },
    {
      "epoch": 3.096223212391258,
      "grad_norm": 0.39726064871512107,
      "learning_rate": 4.22646215919144e-05,
      "loss": 1.4223,
      "num_input_tokens_seen": 22961763008,
      "step": 29185
    },
    {
      "epoch": 3.0963293019308296,
      "grad_norm": 0.4167929591090594,
      "learning_rate": 4.2264118948091266e-05,
      "loss": 1.5707,
      "num_input_tokens_seen": 22962549664,
      "step": 29186
    },
    {
      "epoch": 3.096435391470401,
      "grad_norm": 0.47836676966657926,
      "learning_rate": 4.226361629092691e-05,
      "loss": 1.5602,
      "num_input_tokens_seen": 22963336384,
      "step": 29187
    },
    {
      "epoch": 3.0965414810099725,
      "grad_norm": 0.4030553559725273,
      "learning_rate": 4.226311362042176e-05,
      "loss": 1.4487,
      "num_input_tokens_seen": 22964123184,
      "step": 29188
    },
    {
      "epoch": 3.096647570549544,
      "grad_norm": 0.4145256169162477,
      "learning_rate": 4.2262610936576166e-05,
      "loss": 1.4145,
      "num_input_tokens_seen": 22964910048,
      "step": 29189
    },
    {
      "epoch": 3.096753660089115,
      "grad_norm": 0.3885240359451082,
      "learning_rate": 4.2262108239390544e-05,
      "loss": 1.3996,
      "num_input_tokens_seen": 22965696784,
      "step": 29190
    },
    {
      "epoch": 3.0968597496286865,
      "grad_norm": 0.44465548785856623,
      "learning_rate": 4.2261605528865264e-05,
      "loss": 1.5988,
      "num_input_tokens_seen": 22966483584,
      "step": 29191
    },
    {
      "epoch": 3.096965839168258,
      "grad_norm": 0.44899215930020697,
      "learning_rate": 4.226110280500072e-05,
      "loss": 1.5385,
      "num_input_tokens_seen": 22967270368,
      "step": 29192
    },
    {
      "epoch": 3.0970719287078294,
      "grad_norm": 0.3725086885668196,
      "learning_rate": 4.226060006779731e-05,
      "loss": 1.3923,
      "num_input_tokens_seen": 22968057184,
      "step": 29193
    },
    {
      "epoch": 3.097178018247401,
      "grad_norm": 0.5284163528389594,
      "learning_rate": 4.226009731725541e-05,
      "loss": 1.464,
      "num_input_tokens_seen": 22968843920,
      "step": 29194
    },
    {
      "epoch": 3.0972841077869724,
      "grad_norm": 0.45449543529562586,
      "learning_rate": 4.2259594553375415e-05,
      "loss": 1.3534,
      "num_input_tokens_seen": 22969630784,
      "step": 29195
    },
    {
      "epoch": 3.0973901973265434,
      "grad_norm": 0.42204643007892506,
      "learning_rate": 4.225909177615771e-05,
      "loss": 1.4635,
      "num_input_tokens_seen": 22970417536,
      "step": 29196
    },
    {
      "epoch": 3.097496286866115,
      "grad_norm": 0.4154379860664613,
      "learning_rate": 4.225858898560268e-05,
      "loss": 1.3544,
      "num_input_tokens_seen": 22971204320,
      "step": 29197
    },
    {
      "epoch": 3.0976023764056864,
      "grad_norm": 0.5426515180798192,
      "learning_rate": 4.2258086181710735e-05,
      "loss": 1.5314,
      "num_input_tokens_seen": 22971991088,
      "step": 29198
    },
    {
      "epoch": 3.097708465945258,
      "grad_norm": 0.4219946770447606,
      "learning_rate": 4.2257583364482235e-05,
      "loss": 1.5244,
      "num_input_tokens_seen": 22972777840,
      "step": 29199
    },
    {
      "epoch": 3.0978145554848293,
      "grad_norm": 0.5701887778023045,
      "learning_rate": 4.225708053391758e-05,
      "loss": 1.3965,
      "num_input_tokens_seen": 22973564576,
      "step": 29200
    },
    {
      "epoch": 3.097920645024401,
      "grad_norm": 0.4034417734891009,
      "learning_rate": 4.2256577690017164e-05,
      "loss": 1.4232,
      "num_input_tokens_seen": 22974351408,
      "step": 29201
    },
    {
      "epoch": 3.098026734563972,
      "grad_norm": 0.5205560124953746,
      "learning_rate": 4.2256074832781366e-05,
      "loss": 1.4994,
      "num_input_tokens_seen": 22975138208,
      "step": 29202
    },
    {
      "epoch": 3.0981328241035433,
      "grad_norm": 0.5347226169584932,
      "learning_rate": 4.225557196221058e-05,
      "loss": 1.4024,
      "num_input_tokens_seen": 22975924960,
      "step": 29203
    },
    {
      "epoch": 3.0982389136431148,
      "grad_norm": 0.4908050564775492,
      "learning_rate": 4.22550690783052e-05,
      "loss": 1.514,
      "num_input_tokens_seen": 22976711680,
      "step": 29204
    },
    {
      "epoch": 3.0983450031826862,
      "grad_norm": 0.5247159245478752,
      "learning_rate": 4.2254566181065606e-05,
      "loss": 1.5031,
      "num_input_tokens_seen": 22977498400,
      "step": 29205
    },
    {
      "epoch": 3.0984510927222577,
      "grad_norm": 0.49654594058826457,
      "learning_rate": 4.22540632704922e-05,
      "loss": 1.4731,
      "num_input_tokens_seen": 22978285088,
      "step": 29206
    },
    {
      "epoch": 3.098557182261829,
      "grad_norm": 0.48484637896186644,
      "learning_rate": 4.225356034658534e-05,
      "loss": 1.3282,
      "num_input_tokens_seen": 22979071824,
      "step": 29207
    },
    {
      "epoch": 3.0986632718014,
      "grad_norm": 0.4930613931140969,
      "learning_rate": 4.225305740934545e-05,
      "loss": 1.3896,
      "num_input_tokens_seen": 22979858768,
      "step": 29208
    },
    {
      "epoch": 3.0987693613409717,
      "grad_norm": 0.445089219819598,
      "learning_rate": 4.2252554458772895e-05,
      "loss": 1.4359,
      "num_input_tokens_seen": 22980645552,
      "step": 29209
    },
    {
      "epoch": 3.098875450880543,
      "grad_norm": 0.46388787318412905,
      "learning_rate": 4.225205149486808e-05,
      "loss": 1.4657,
      "num_input_tokens_seen": 22981432288,
      "step": 29210
    },
    {
      "epoch": 3.0989815404201146,
      "grad_norm": 0.44052060834531787,
      "learning_rate": 4.225154851763138e-05,
      "loss": 1.4754,
      "num_input_tokens_seen": 22982219088,
      "step": 29211
    },
    {
      "epoch": 3.099087629959686,
      "grad_norm": 0.5104007482920694,
      "learning_rate": 4.225104552706319e-05,
      "loss": 1.4616,
      "num_input_tokens_seen": 22983005776,
      "step": 29212
    },
    {
      "epoch": 3.099193719499257,
      "grad_norm": 0.36101804558681294,
      "learning_rate": 4.22505425231639e-05,
      "loss": 1.5098,
      "num_input_tokens_seen": 22983792672,
      "step": 29213
    },
    {
      "epoch": 3.0992998090388286,
      "grad_norm": 0.4425503503932334,
      "learning_rate": 4.2250039505933894e-05,
      "loss": 1.5248,
      "num_input_tokens_seen": 22984579392,
      "step": 29214
    },
    {
      "epoch": 3.0994058985784,
      "grad_norm": 0.40110767930035546,
      "learning_rate": 4.2249536475373566e-05,
      "loss": 1.4006,
      "num_input_tokens_seen": 22985366080,
      "step": 29215
    },
    {
      "epoch": 3.0995119881179716,
      "grad_norm": 0.42991697232949855,
      "learning_rate": 4.2249033431483305e-05,
      "loss": 1.5024,
      "num_input_tokens_seen": 22986152816,
      "step": 29216
    },
    {
      "epoch": 3.099618077657543,
      "grad_norm": 0.44339544369625483,
      "learning_rate": 4.2248530374263496e-05,
      "loss": 1.5444,
      "num_input_tokens_seen": 22986939552,
      "step": 29217
    },
    {
      "epoch": 3.0997241671971145,
      "grad_norm": 0.3918616940402647,
      "learning_rate": 4.224802730371452e-05,
      "loss": 1.498,
      "num_input_tokens_seen": 22987726256,
      "step": 29218
    },
    {
      "epoch": 3.0998302567366856,
      "grad_norm": 0.4245583577465492,
      "learning_rate": 4.224752421983679e-05,
      "loss": 1.4183,
      "num_input_tokens_seen": 22988513024,
      "step": 29219
    },
    {
      "epoch": 3.099936346276257,
      "grad_norm": 0.42093439139994576,
      "learning_rate": 4.224702112263067e-05,
      "loss": 1.4863,
      "num_input_tokens_seen": 22989299776,
      "step": 29220
    },
    {
      "epoch": 3.1000424358158285,
      "grad_norm": 0.41049541637641457,
      "learning_rate": 4.224651801209655e-05,
      "loss": 1.3838,
      "num_input_tokens_seen": 22990086496,
      "step": 29221
    },
    {
      "epoch": 3.1001485253554,
      "grad_norm": 0.533142952945929,
      "learning_rate": 4.224601488823484e-05,
      "loss": 1.5744,
      "num_input_tokens_seen": 22990873312,
      "step": 29222
    },
    {
      "epoch": 3.1002546148949714,
      "grad_norm": 0.48747736295551164,
      "learning_rate": 4.224551175104591e-05,
      "loss": 1.4351,
      "num_input_tokens_seen": 22991660144,
      "step": 29223
    },
    {
      "epoch": 3.100360704434543,
      "grad_norm": 0.4487259317709515,
      "learning_rate": 4.224500860053016e-05,
      "loss": 1.3651,
      "num_input_tokens_seen": 22992446976,
      "step": 29224
    },
    {
      "epoch": 3.100466793974114,
      "grad_norm": 0.48424441098126403,
      "learning_rate": 4.224450543668797e-05,
      "loss": 1.4565,
      "num_input_tokens_seen": 22993233712,
      "step": 29225
    },
    {
      "epoch": 3.1005728835136854,
      "grad_norm": 0.6179424908822403,
      "learning_rate": 4.224400225951973e-05,
      "loss": 1.4839,
      "num_input_tokens_seen": 22994020448,
      "step": 29226
    },
    {
      "epoch": 3.100678973053257,
      "grad_norm": 0.5031978997609582,
      "learning_rate": 4.224349906902583e-05,
      "loss": 1.3392,
      "num_input_tokens_seen": 22994807344,
      "step": 29227
    },
    {
      "epoch": 3.1007850625928284,
      "grad_norm": 0.44968867054086303,
      "learning_rate": 4.2242995865206664e-05,
      "loss": 1.457,
      "num_input_tokens_seen": 22995594128,
      "step": 29228
    },
    {
      "epoch": 3.1008911521324,
      "grad_norm": 0.5178725392217762,
      "learning_rate": 4.2242492648062617e-05,
      "loss": 1.4409,
      "num_input_tokens_seen": 22996380928,
      "step": 29229
    },
    {
      "epoch": 3.1009972416719713,
      "grad_norm": 0.43333294347698353,
      "learning_rate": 4.2241989417594077e-05,
      "loss": 1.5211,
      "num_input_tokens_seen": 22997167760,
      "step": 29230
    },
    {
      "epoch": 3.1011033312115424,
      "grad_norm": 0.47256175602123834,
      "learning_rate": 4.224148617380143e-05,
      "loss": 1.4273,
      "num_input_tokens_seen": 22997954480,
      "step": 29231
    },
    {
      "epoch": 3.101209420751114,
      "grad_norm": 0.43248383678839536,
      "learning_rate": 4.224098291668507e-05,
      "loss": 1.4318,
      "num_input_tokens_seen": 22998741184,
      "step": 29232
    },
    {
      "epoch": 3.1013155102906853,
      "grad_norm": 0.4481236527637364,
      "learning_rate": 4.224047964624539e-05,
      "loss": 1.3371,
      "num_input_tokens_seen": 22999527936,
      "step": 29233
    },
    {
      "epoch": 3.101421599830257,
      "grad_norm": 0.5973517039795494,
      "learning_rate": 4.2239976362482766e-05,
      "loss": 1.5533,
      "num_input_tokens_seen": 23000314848,
      "step": 29234
    },
    {
      "epoch": 3.1015276893698283,
      "grad_norm": 0.4261943944339189,
      "learning_rate": 4.223947306539759e-05,
      "loss": 1.4164,
      "num_input_tokens_seen": 23001101648,
      "step": 29235
    },
    {
      "epoch": 3.1016337789093997,
      "grad_norm": 0.4784168714158534,
      "learning_rate": 4.223896975499026e-05,
      "loss": 1.3819,
      "num_input_tokens_seen": 23001888368,
      "step": 29236
    },
    {
      "epoch": 3.1017398684489708,
      "grad_norm": 0.44452892912769304,
      "learning_rate": 4.223846643126117e-05,
      "loss": 1.4951,
      "num_input_tokens_seen": 23002675216,
      "step": 29237
    },
    {
      "epoch": 3.1018459579885422,
      "grad_norm": 0.4888012797091361,
      "learning_rate": 4.223796309421069e-05,
      "loss": 1.4286,
      "num_input_tokens_seen": 23003462064,
      "step": 29238
    },
    {
      "epoch": 3.1019520475281137,
      "grad_norm": 0.4298333903464107,
      "learning_rate": 4.223745974383921e-05,
      "loss": 1.4983,
      "num_input_tokens_seen": 23004248928,
      "step": 29239
    },
    {
      "epoch": 3.102058137067685,
      "grad_norm": 0.39805707550196856,
      "learning_rate": 4.223695638014714e-05,
      "loss": 1.4545,
      "num_input_tokens_seen": 23005035648,
      "step": 29240
    },
    {
      "epoch": 3.1021642266072567,
      "grad_norm": 0.47027625511347765,
      "learning_rate": 4.2236453003134855e-05,
      "loss": 1.5104,
      "num_input_tokens_seen": 23005822384,
      "step": 29241
    },
    {
      "epoch": 3.102270316146828,
      "grad_norm": 0.5120502273658882,
      "learning_rate": 4.223594961280274e-05,
      "loss": 1.5278,
      "num_input_tokens_seen": 23006609040,
      "step": 29242
    },
    {
      "epoch": 3.102376405686399,
      "grad_norm": 0.5690299258799236,
      "learning_rate": 4.223544620915119e-05,
      "loss": 1.4622,
      "num_input_tokens_seen": 23007395760,
      "step": 29243
    },
    {
      "epoch": 3.1024824952259706,
      "grad_norm": 0.40515563907831537,
      "learning_rate": 4.223494279218059e-05,
      "loss": 1.3793,
      "num_input_tokens_seen": 23008182624,
      "step": 29244
    },
    {
      "epoch": 3.102588584765542,
      "grad_norm": 0.5522371141812379,
      "learning_rate": 4.2234439361891334e-05,
      "loss": 1.3973,
      "num_input_tokens_seen": 23008969424,
      "step": 29245
    },
    {
      "epoch": 3.1026946743051136,
      "grad_norm": 0.4062633722943901,
      "learning_rate": 4.223393591828381e-05,
      "loss": 1.4931,
      "num_input_tokens_seen": 23009756144,
      "step": 29246
    },
    {
      "epoch": 3.102800763844685,
      "grad_norm": 0.433808350901048,
      "learning_rate": 4.2233432461358405e-05,
      "loss": 1.4972,
      "num_input_tokens_seen": 23010542912,
      "step": 29247
    },
    {
      "epoch": 3.1029068533842565,
      "grad_norm": 0.41771414526456024,
      "learning_rate": 4.223292899111551e-05,
      "loss": 1.3804,
      "num_input_tokens_seen": 23011329712,
      "step": 29248
    },
    {
      "epoch": 3.1030129429238276,
      "grad_norm": 0.4232649988514989,
      "learning_rate": 4.223242550755552e-05,
      "loss": 1.3525,
      "num_input_tokens_seen": 23012116544,
      "step": 29249
    },
    {
      "epoch": 3.103119032463399,
      "grad_norm": 0.43377685752658995,
      "learning_rate": 4.223192201067881e-05,
      "loss": 1.3875,
      "num_input_tokens_seen": 23012903248,
      "step": 29250
    },
    {
      "epoch": 3.1032251220029705,
      "grad_norm": 0.4234732378507401,
      "learning_rate": 4.2231418500485774e-05,
      "loss": 1.4855,
      "num_input_tokens_seen": 23013690128,
      "step": 29251
    },
    {
      "epoch": 3.103331211542542,
      "grad_norm": 0.4443245575240843,
      "learning_rate": 4.22309149769768e-05,
      "loss": 1.4933,
      "num_input_tokens_seen": 23014476944,
      "step": 29252
    },
    {
      "epoch": 3.1034373010821135,
      "grad_norm": 0.45088071221902537,
      "learning_rate": 4.223041144015229e-05,
      "loss": 1.5334,
      "num_input_tokens_seen": 23015263664,
      "step": 29253
    },
    {
      "epoch": 3.1035433906216845,
      "grad_norm": 0.42576539506222216,
      "learning_rate": 4.222990789001262e-05,
      "loss": 1.4491,
      "num_input_tokens_seen": 23016050480,
      "step": 29254
    },
    {
      "epoch": 3.103649480161256,
      "grad_norm": 0.4412549918942007,
      "learning_rate": 4.222940432655818e-05,
      "loss": 1.4422,
      "num_input_tokens_seen": 23016837312,
      "step": 29255
    },
    {
      "epoch": 3.1037555697008274,
      "grad_norm": 0.4403079452591254,
      "learning_rate": 4.222890074978937e-05,
      "loss": 1.3723,
      "num_input_tokens_seen": 23017624096,
      "step": 29256
    },
    {
      "epoch": 3.103861659240399,
      "grad_norm": 0.45319225162374105,
      "learning_rate": 4.222839715970655e-05,
      "loss": 1.3284,
      "num_input_tokens_seen": 23018410992,
      "step": 29257
    },
    {
      "epoch": 3.1039677487799704,
      "grad_norm": 0.4747315519095298,
      "learning_rate": 4.222789355631016e-05,
      "loss": 1.3318,
      "num_input_tokens_seen": 23019197744,
      "step": 29258
    },
    {
      "epoch": 3.104073838319542,
      "grad_norm": 0.46061227833863355,
      "learning_rate": 4.222738993960054e-05,
      "loss": 1.4371,
      "num_input_tokens_seen": 23019984560,
      "step": 29259
    },
    {
      "epoch": 3.104179927859113,
      "grad_norm": 0.4610306778764703,
      "learning_rate": 4.22268863095781e-05,
      "loss": 1.3438,
      "num_input_tokens_seen": 23020771328,
      "step": 29260
    },
    {
      "epoch": 3.1042860173986844,
      "grad_norm": 0.5927735459967137,
      "learning_rate": 4.2226382666243235e-05,
      "loss": 1.4747,
      "num_input_tokens_seen": 23021557952,
      "step": 29261
    },
    {
      "epoch": 3.104392106938256,
      "grad_norm": 0.5124399554694921,
      "learning_rate": 4.222587900959633e-05,
      "loss": 1.3882,
      "num_input_tokens_seen": 23022344832,
      "step": 29262
    },
    {
      "epoch": 3.1044981964778273,
      "grad_norm": 0.5300664919472384,
      "learning_rate": 4.2225375339637764e-05,
      "loss": 1.4536,
      "num_input_tokens_seen": 23023131584,
      "step": 29263
    },
    {
      "epoch": 3.104604286017399,
      "grad_norm": 0.6383254587517525,
      "learning_rate": 4.222487165636793e-05,
      "loss": 1.3787,
      "num_input_tokens_seen": 23023918432,
      "step": 29264
    },
    {
      "epoch": 3.1047103755569703,
      "grad_norm": 0.4668576155405196,
      "learning_rate": 4.222436795978723e-05,
      "loss": 1.4693,
      "num_input_tokens_seen": 23024705200,
      "step": 29265
    },
    {
      "epoch": 3.1048164650965413,
      "grad_norm": 0.5600210398734295,
      "learning_rate": 4.2223864249896026e-05,
      "loss": 1.4334,
      "num_input_tokens_seen": 23025491904,
      "step": 29266
    },
    {
      "epoch": 3.1049225546361128,
      "grad_norm": 0.47288080210947614,
      "learning_rate": 4.2223360526694746e-05,
      "loss": 1.5419,
      "num_input_tokens_seen": 23026278576,
      "step": 29267
    },
    {
      "epoch": 3.1050286441756842,
      "grad_norm": 0.40346413078874965,
      "learning_rate": 4.2222856790183746e-05,
      "loss": 1.3432,
      "num_input_tokens_seen": 23027065296,
      "step": 29268
    },
    {
      "epoch": 3.1051347337152557,
      "grad_norm": 0.4562377095826803,
      "learning_rate": 4.2222353040363426e-05,
      "loss": 1.3578,
      "num_input_tokens_seen": 23027852144,
      "step": 29269
    },
    {
      "epoch": 3.105240823254827,
      "grad_norm": 0.4049616696034492,
      "learning_rate": 4.2221849277234185e-05,
      "loss": 1.4439,
      "num_input_tokens_seen": 23028638880,
      "step": 29270
    },
    {
      "epoch": 3.1053469127943987,
      "grad_norm": 0.4289436811938129,
      "learning_rate": 4.2221345500796404e-05,
      "loss": 1.673,
      "num_input_tokens_seen": 23029425520,
      "step": 29271
    },
    {
      "epoch": 3.1054530023339697,
      "grad_norm": 0.4269222009293087,
      "learning_rate": 4.222084171105047e-05,
      "loss": 1.4418,
      "num_input_tokens_seen": 23030212288,
      "step": 29272
    },
    {
      "epoch": 3.105559091873541,
      "grad_norm": 0.4882073163252463,
      "learning_rate": 4.2220337907996776e-05,
      "loss": 1.4534,
      "num_input_tokens_seen": 23030999168,
      "step": 29273
    },
    {
      "epoch": 3.1056651814131127,
      "grad_norm": 0.4881149998985335,
      "learning_rate": 4.22198340916357e-05,
      "loss": 1.4925,
      "num_input_tokens_seen": 23031785968,
      "step": 29274
    },
    {
      "epoch": 3.105771270952684,
      "grad_norm": 0.4700966497827513,
      "learning_rate": 4.221933026196766e-05,
      "loss": 1.3971,
      "num_input_tokens_seen": 23032572768,
      "step": 29275
    },
    {
      "epoch": 3.1058773604922556,
      "grad_norm": 0.47384988122600713,
      "learning_rate": 4.2218826418993014e-05,
      "loss": 1.5093,
      "num_input_tokens_seen": 23033359488,
      "step": 29276
    },
    {
      "epoch": 3.105983450031827,
      "grad_norm": 0.4087477463967787,
      "learning_rate": 4.2218322562712165e-05,
      "loss": 1.4653,
      "num_input_tokens_seen": 23034146176,
      "step": 29277
    },
    {
      "epoch": 3.106089539571398,
      "grad_norm": 0.42169927576126065,
      "learning_rate": 4.221781869312551e-05,
      "loss": 1.4295,
      "num_input_tokens_seen": 23034932912,
      "step": 29278
    },
    {
      "epoch": 3.1061956291109696,
      "grad_norm": 0.43548183878572,
      "learning_rate": 4.221731481023342e-05,
      "loss": 1.4595,
      "num_input_tokens_seen": 23035719680,
      "step": 29279
    },
    {
      "epoch": 3.106301718650541,
      "grad_norm": 0.5359531554247577,
      "learning_rate": 4.2216810914036295e-05,
      "loss": 1.5622,
      "num_input_tokens_seen": 23036506464,
      "step": 29280
    },
    {
      "epoch": 3.1064078081901125,
      "grad_norm": 0.3806171728810316,
      "learning_rate": 4.221630700453453e-05,
      "loss": 1.3734,
      "num_input_tokens_seen": 23037293168,
      "step": 29281
    },
    {
      "epoch": 3.106513897729684,
      "grad_norm": 0.5417352800423424,
      "learning_rate": 4.22158030817285e-05,
      "loss": 1.3727,
      "num_input_tokens_seen": 23038079920,
      "step": 29282
    },
    {
      "epoch": 3.106619987269255,
      "grad_norm": 0.4426455609940608,
      "learning_rate": 4.2215299145618604e-05,
      "loss": 1.4315,
      "num_input_tokens_seen": 23038866672,
      "step": 29283
    },
    {
      "epoch": 3.1067260768088265,
      "grad_norm": 0.5062325470245778,
      "learning_rate": 4.2214795196205235e-05,
      "loss": 1.563,
      "num_input_tokens_seen": 23039653408,
      "step": 29284
    },
    {
      "epoch": 3.106832166348398,
      "grad_norm": 0.4091622260503561,
      "learning_rate": 4.221429123348878e-05,
      "loss": 1.3448,
      "num_input_tokens_seen": 23040440080,
      "step": 29285
    },
    {
      "epoch": 3.1069382558879695,
      "grad_norm": 0.4414898152636292,
      "learning_rate": 4.221378725746962e-05,
      "loss": 1.5283,
      "num_input_tokens_seen": 23041226848,
      "step": 29286
    },
    {
      "epoch": 3.107044345427541,
      "grad_norm": 0.45787008888319425,
      "learning_rate": 4.221328326814815e-05,
      "loss": 1.3919,
      "num_input_tokens_seen": 23042013648,
      "step": 29287
    },
    {
      "epoch": 3.1071504349671124,
      "grad_norm": 0.40113130067391045,
      "learning_rate": 4.221277926552476e-05,
      "loss": 1.467,
      "num_input_tokens_seen": 23042800400,
      "step": 29288
    },
    {
      "epoch": 3.1072565245066834,
      "grad_norm": 0.49609347412579535,
      "learning_rate": 4.221227524959984e-05,
      "loss": 1.4684,
      "num_input_tokens_seen": 23043587184,
      "step": 29289
    },
    {
      "epoch": 3.107362614046255,
      "grad_norm": 0.46514545585288597,
      "learning_rate": 4.2211771220373784e-05,
      "loss": 1.5398,
      "num_input_tokens_seen": 23044374016,
      "step": 29290
    },
    {
      "epoch": 3.1074687035858264,
      "grad_norm": 0.4348454757790365,
      "learning_rate": 4.221126717784697e-05,
      "loss": 1.4851,
      "num_input_tokens_seen": 23045160816,
      "step": 29291
    },
    {
      "epoch": 3.107574793125398,
      "grad_norm": 0.4069024460482597,
      "learning_rate": 4.221076312201979e-05,
      "loss": 1.5164,
      "num_input_tokens_seen": 23045947600,
      "step": 29292
    },
    {
      "epoch": 3.1076808826649693,
      "grad_norm": 0.4099141749792655,
      "learning_rate": 4.2210259052892646e-05,
      "loss": 1.4335,
      "num_input_tokens_seen": 23046734416,
      "step": 29293
    },
    {
      "epoch": 3.107786972204541,
      "grad_norm": 0.3849976877110374,
      "learning_rate": 4.220975497046592e-05,
      "loss": 1.5235,
      "num_input_tokens_seen": 23047521152,
      "step": 29294
    },
    {
      "epoch": 3.107893061744112,
      "grad_norm": 0.4443349087028058,
      "learning_rate": 4.220925087473999e-05,
      "loss": 1.5516,
      "num_input_tokens_seen": 23048307872,
      "step": 29295
    },
    {
      "epoch": 3.1079991512836833,
      "grad_norm": 0.41845034809709203,
      "learning_rate": 4.220874676571527e-05,
      "loss": 1.5588,
      "num_input_tokens_seen": 23049094608,
      "step": 29296
    },
    {
      "epoch": 3.108105240823255,
      "grad_norm": 0.4788758930030818,
      "learning_rate": 4.220824264339213e-05,
      "loss": 1.5077,
      "num_input_tokens_seen": 23049881376,
      "step": 29297
    },
    {
      "epoch": 3.1082113303628263,
      "grad_norm": 0.42778226402216196,
      "learning_rate": 4.220773850777095e-05,
      "loss": 1.5081,
      "num_input_tokens_seen": 23050668032,
      "step": 29298
    },
    {
      "epoch": 3.1083174199023977,
      "grad_norm": 0.4800742362102014,
      "learning_rate": 4.2207234358852147e-05,
      "loss": 1.5612,
      "num_input_tokens_seen": 23051454816,
      "step": 29299
    },
    {
      "epoch": 3.108423509441969,
      "grad_norm": 0.5333647931508994,
      "learning_rate": 4.22067301966361e-05,
      "loss": 1.5305,
      "num_input_tokens_seen": 23052241536,
      "step": 29300
    },
    {
      "epoch": 3.1085295989815402,
      "grad_norm": 0.4391932822901387,
      "learning_rate": 4.22062260211232e-05,
      "loss": 1.519,
      "num_input_tokens_seen": 23053028272,
      "step": 29301
    },
    {
      "epoch": 3.1086356885211117,
      "grad_norm": 0.4012154240750749,
      "learning_rate": 4.2205721832313824e-05,
      "loss": 1.4473,
      "num_input_tokens_seen": 23053815072,
      "step": 29302
    },
    {
      "epoch": 3.108741778060683,
      "grad_norm": 0.45984784956846625,
      "learning_rate": 4.220521763020837e-05,
      "loss": 1.5568,
      "num_input_tokens_seen": 23054601840,
      "step": 29303
    },
    {
      "epoch": 3.1088478676002547,
      "grad_norm": 0.4262794282752106,
      "learning_rate": 4.220471341480724e-05,
      "loss": 1.5398,
      "num_input_tokens_seen": 23055388576,
      "step": 29304
    },
    {
      "epoch": 3.108953957139826,
      "grad_norm": 0.4044886693605463,
      "learning_rate": 4.220420918611081e-05,
      "loss": 1.3902,
      "num_input_tokens_seen": 23056175312,
      "step": 29305
    },
    {
      "epoch": 3.1090600466793976,
      "grad_norm": 0.4437965746412561,
      "learning_rate": 4.220370494411946e-05,
      "loss": 1.684,
      "num_input_tokens_seen": 23056962064,
      "step": 29306
    },
    {
      "epoch": 3.1091661362189686,
      "grad_norm": 0.41427545980168745,
      "learning_rate": 4.22032006888336e-05,
      "loss": 1.5381,
      "num_input_tokens_seen": 23057748864,
      "step": 29307
    },
    {
      "epoch": 3.10927222575854,
      "grad_norm": 0.4332011751233596,
      "learning_rate": 4.220269642025361e-05,
      "loss": 1.5062,
      "num_input_tokens_seen": 23058535552,
      "step": 29308
    },
    {
      "epoch": 3.1093783152981116,
      "grad_norm": 0.4361721891878864,
      "learning_rate": 4.220219213837988e-05,
      "loss": 1.4191,
      "num_input_tokens_seen": 23059322288,
      "step": 29309
    },
    {
      "epoch": 3.109484404837683,
      "grad_norm": 0.4347307885055042,
      "learning_rate": 4.2201687843212806e-05,
      "loss": 1.459,
      "num_input_tokens_seen": 23060109040,
      "step": 29310
    },
    {
      "epoch": 3.1095904943772545,
      "grad_norm": 0.4880324537312752,
      "learning_rate": 4.220118353475277e-05,
      "loss": 1.4842,
      "num_input_tokens_seen": 23060895760,
      "step": 29311
    },
    {
      "epoch": 3.1096965839168256,
      "grad_norm": 0.401156263038956,
      "learning_rate": 4.220067921300016e-05,
      "loss": 1.4581,
      "num_input_tokens_seen": 23061682464,
      "step": 29312
    },
    {
      "epoch": 3.109802673456397,
      "grad_norm": 0.46705635359647085,
      "learning_rate": 4.220017487795538e-05,
      "loss": 1.5058,
      "num_input_tokens_seen": 23062469232,
      "step": 29313
    },
    {
      "epoch": 3.1099087629959685,
      "grad_norm": 0.37586013767854676,
      "learning_rate": 4.2199670529618795e-05,
      "loss": 1.4535,
      "num_input_tokens_seen": 23063255936,
      "step": 29314
    },
    {
      "epoch": 3.11001485253554,
      "grad_norm": 0.5677660213688401,
      "learning_rate": 4.219916616799082e-05,
      "loss": 1.5274,
      "num_input_tokens_seen": 23064042736,
      "step": 29315
    },
    {
      "epoch": 3.1101209420751115,
      "grad_norm": 0.3836965132494133,
      "learning_rate": 4.2198661793071825e-05,
      "loss": 1.4368,
      "num_input_tokens_seen": 23064829520,
      "step": 29316
    },
    {
      "epoch": 3.110227031614683,
      "grad_norm": 0.5257710282950117,
      "learning_rate": 4.2198157404862214e-05,
      "loss": 1.3359,
      "num_input_tokens_seen": 23065616320,
      "step": 29317
    },
    {
      "epoch": 3.110333121154254,
      "grad_norm": 0.4168978283066474,
      "learning_rate": 4.219765300336238e-05,
      "loss": 1.4228,
      "num_input_tokens_seen": 23066403088,
      "step": 29318
    },
    {
      "epoch": 3.1104392106938255,
      "grad_norm": 0.4238553989386269,
      "learning_rate": 4.2197148588572696e-05,
      "loss": 1.5519,
      "num_input_tokens_seen": 23067189840,
      "step": 29319
    },
    {
      "epoch": 3.110545300233397,
      "grad_norm": 0.518140722568325,
      "learning_rate": 4.219664416049356e-05,
      "loss": 1.4227,
      "num_input_tokens_seen": 23067976608,
      "step": 29320
    },
    {
      "epoch": 3.1106513897729684,
      "grad_norm": 0.4328129993226505,
      "learning_rate": 4.219613971912536e-05,
      "loss": 1.5148,
      "num_input_tokens_seen": 23068763248,
      "step": 29321
    },
    {
      "epoch": 3.11075747931254,
      "grad_norm": 0.40444653883793097,
      "learning_rate": 4.219563526446849e-05,
      "loss": 1.6136,
      "num_input_tokens_seen": 23069550048,
      "step": 29322
    },
    {
      "epoch": 3.1108635688521113,
      "grad_norm": 0.4531501609944253,
      "learning_rate": 4.219513079652334e-05,
      "loss": 1.5156,
      "num_input_tokens_seen": 23070336704,
      "step": 29323
    },
    {
      "epoch": 3.1109696583916824,
      "grad_norm": 0.41391120549127663,
      "learning_rate": 4.219462631529029e-05,
      "loss": 1.4314,
      "num_input_tokens_seen": 23071123488,
      "step": 29324
    },
    {
      "epoch": 3.111075747931254,
      "grad_norm": 0.41913392849199377,
      "learning_rate": 4.219412182076975e-05,
      "loss": 1.3978,
      "num_input_tokens_seen": 23071910336,
      "step": 29325
    },
    {
      "epoch": 3.1111818374708253,
      "grad_norm": 0.6002215366862423,
      "learning_rate": 4.219361731296209e-05,
      "loss": 1.6311,
      "num_input_tokens_seen": 23072697088,
      "step": 29326
    },
    {
      "epoch": 3.111287927010397,
      "grad_norm": 0.4234236465114292,
      "learning_rate": 4.21931127918677e-05,
      "loss": 1.4424,
      "num_input_tokens_seen": 23073483888,
      "step": 29327
    },
    {
      "epoch": 3.1113940165499683,
      "grad_norm": 0.5573521921121861,
      "learning_rate": 4.2192608257486986e-05,
      "loss": 1.3703,
      "num_input_tokens_seen": 23074270656,
      "step": 29328
    },
    {
      "epoch": 3.1115001060895398,
      "grad_norm": 0.5800216623252887,
      "learning_rate": 4.219210370982033e-05,
      "loss": 1.5145,
      "num_input_tokens_seen": 23075057392,
      "step": 29329
    },
    {
      "epoch": 3.111606195629111,
      "grad_norm": 0.4645255016685027,
      "learning_rate": 4.219159914886811e-05,
      "loss": 1.4714,
      "num_input_tokens_seen": 23075844064,
      "step": 29330
    },
    {
      "epoch": 3.1117122851686823,
      "grad_norm": 0.5625223381427668,
      "learning_rate": 4.2191094574630736e-05,
      "loss": 1.2937,
      "num_input_tokens_seen": 23076630848,
      "step": 29331
    },
    {
      "epoch": 3.1118183747082537,
      "grad_norm": 0.4166649763020876,
      "learning_rate": 4.219058998710859e-05,
      "loss": 1.5877,
      "num_input_tokens_seen": 23077417504,
      "step": 29332
    },
    {
      "epoch": 3.111924464247825,
      "grad_norm": 0.5240064532751679,
      "learning_rate": 4.2190085386302054e-05,
      "loss": 1.4803,
      "num_input_tokens_seen": 23078204368,
      "step": 29333
    },
    {
      "epoch": 3.1120305537873967,
      "grad_norm": 0.4790017227512271,
      "learning_rate": 4.2189580772211524e-05,
      "loss": 1.3461,
      "num_input_tokens_seen": 23078991232,
      "step": 29334
    },
    {
      "epoch": 3.112136643326968,
      "grad_norm": 0.5094033961331056,
      "learning_rate": 4.218907614483739e-05,
      "loss": 1.3157,
      "num_input_tokens_seen": 23079777984,
      "step": 29335
    },
    {
      "epoch": 3.112242732866539,
      "grad_norm": 0.4918860636060381,
      "learning_rate": 4.218857150418005e-05,
      "loss": 1.5071,
      "num_input_tokens_seen": 23080564672,
      "step": 29336
    },
    {
      "epoch": 3.1123488224061107,
      "grad_norm": 0.4447468277667368,
      "learning_rate": 4.2188066850239886e-05,
      "loss": 1.3441,
      "num_input_tokens_seen": 23081351472,
      "step": 29337
    },
    {
      "epoch": 3.112454911945682,
      "grad_norm": 0.4737930046277275,
      "learning_rate": 4.218756218301728e-05,
      "loss": 1.5451,
      "num_input_tokens_seen": 23082138304,
      "step": 29338
    },
    {
      "epoch": 3.1125610014852536,
      "grad_norm": 0.5095767382050075,
      "learning_rate": 4.2187057502512634e-05,
      "loss": 1.4312,
      "num_input_tokens_seen": 23082925120,
      "step": 29339
    },
    {
      "epoch": 3.112667091024825,
      "grad_norm": 0.5149795075171424,
      "learning_rate": 4.218655280872634e-05,
      "loss": 1.5759,
      "num_input_tokens_seen": 23083711856,
      "step": 29340
    },
    {
      "epoch": 3.1127731805643966,
      "grad_norm": 0.48242358433164145,
      "learning_rate": 4.218604810165877e-05,
      "loss": 1.4344,
      "num_input_tokens_seen": 23084498608,
      "step": 29341
    },
    {
      "epoch": 3.1128792701039676,
      "grad_norm": 0.4613762564701448,
      "learning_rate": 4.2185543381310335e-05,
      "loss": 1.5184,
      "num_input_tokens_seen": 23085285392,
      "step": 29342
    },
    {
      "epoch": 3.112985359643539,
      "grad_norm": 0.47647351157940726,
      "learning_rate": 4.218503864768142e-05,
      "loss": 1.4494,
      "num_input_tokens_seen": 23086072096,
      "step": 29343
    },
    {
      "epoch": 3.1130914491831105,
      "grad_norm": 0.4210923243058768,
      "learning_rate": 4.21845339007724e-05,
      "loss": 1.5605,
      "num_input_tokens_seen": 23086858864,
      "step": 29344
    },
    {
      "epoch": 3.113197538722682,
      "grad_norm": 0.3961360317373367,
      "learning_rate": 4.218402914058368e-05,
      "loss": 1.4786,
      "num_input_tokens_seen": 23087645568,
      "step": 29345
    },
    {
      "epoch": 3.1133036282622535,
      "grad_norm": 0.3803937766110951,
      "learning_rate": 4.218352436711566e-05,
      "loss": 1.4476,
      "num_input_tokens_seen": 23088432416,
      "step": 29346
    },
    {
      "epoch": 3.113409717801825,
      "grad_norm": 0.5256870851992662,
      "learning_rate": 4.21830195803687e-05,
      "loss": 1.5061,
      "num_input_tokens_seen": 23089219184,
      "step": 29347
    },
    {
      "epoch": 3.113515807341396,
      "grad_norm": 0.4798882254978795,
      "learning_rate": 4.2182514780343214e-05,
      "loss": 1.3897,
      "num_input_tokens_seen": 23090006064,
      "step": 29348
    },
    {
      "epoch": 3.1136218968809675,
      "grad_norm": 0.9333894614261476,
      "learning_rate": 4.218200996703958e-05,
      "loss": 1.4501,
      "num_input_tokens_seen": 23090792928,
      "step": 29349
    },
    {
      "epoch": 3.113727986420539,
      "grad_norm": 0.5724510471188138,
      "learning_rate": 4.21815051404582e-05,
      "loss": 1.4453,
      "num_input_tokens_seen": 23091579648,
      "step": 29350
    },
    {
      "epoch": 3.1138340759601104,
      "grad_norm": 1.0153852061190616,
      "learning_rate": 4.218100030059945e-05,
      "loss": 1.4064,
      "num_input_tokens_seen": 23092366480,
      "step": 29351
    },
    {
      "epoch": 3.113940165499682,
      "grad_norm": 0.402885128549098,
      "learning_rate": 4.218049544746373e-05,
      "loss": 1.4299,
      "num_input_tokens_seen": 23093153248,
      "step": 29352
    },
    {
      "epoch": 3.114046255039253,
      "grad_norm": 0.9456788323777906,
      "learning_rate": 4.217999058105143e-05,
      "loss": 1.5263,
      "num_input_tokens_seen": 23093940016,
      "step": 29353
    },
    {
      "epoch": 3.1141523445788244,
      "grad_norm": 0.4696768066834488,
      "learning_rate": 4.217948570136293e-05,
      "loss": 1.4271,
      "num_input_tokens_seen": 23094726832,
      "step": 29354
    },
    {
      "epoch": 3.114258434118396,
      "grad_norm": 0.5228475261148346,
      "learning_rate": 4.217898080839863e-05,
      "loss": 1.4945,
      "num_input_tokens_seen": 23095513632,
      "step": 29355
    },
    {
      "epoch": 3.1143645236579673,
      "grad_norm": 0.48445148025343077,
      "learning_rate": 4.217847590215892e-05,
      "loss": 1.455,
      "num_input_tokens_seen": 23096300416,
      "step": 29356
    },
    {
      "epoch": 3.114470613197539,
      "grad_norm": 0.4981139463657566,
      "learning_rate": 4.217797098264419e-05,
      "loss": 1.4983,
      "num_input_tokens_seen": 23097087136,
      "step": 29357
    },
    {
      "epoch": 3.1145767027371103,
      "grad_norm": 0.5516687051899809,
      "learning_rate": 4.217746604985483e-05,
      "loss": 1.6406,
      "num_input_tokens_seen": 23097873840,
      "step": 29358
    },
    {
      "epoch": 3.1146827922766813,
      "grad_norm": 0.45671463908300647,
      "learning_rate": 4.217696110379122e-05,
      "loss": 1.3669,
      "num_input_tokens_seen": 23098660640,
      "step": 29359
    },
    {
      "epoch": 3.114788881816253,
      "grad_norm": 0.4968563858694098,
      "learning_rate": 4.217645614445376e-05,
      "loss": 1.4473,
      "num_input_tokens_seen": 23099447376,
      "step": 29360
    },
    {
      "epoch": 3.1148949713558243,
      "grad_norm": 0.49534842654760664,
      "learning_rate": 4.217595117184284e-05,
      "loss": 1.4263,
      "num_input_tokens_seen": 23100234096,
      "step": 29361
    },
    {
      "epoch": 3.1150010608953957,
      "grad_norm": 0.48977331332388374,
      "learning_rate": 4.2175446185958855e-05,
      "loss": 1.49,
      "num_input_tokens_seen": 23101020768,
      "step": 29362
    },
    {
      "epoch": 3.115107150434967,
      "grad_norm": 0.5367078481019139,
      "learning_rate": 4.217494118680219e-05,
      "loss": 1.4425,
      "num_input_tokens_seen": 23101807536,
      "step": 29363
    },
    {
      "epoch": 3.1152132399745387,
      "grad_norm": 0.5840349769905877,
      "learning_rate": 4.2174436174373224e-05,
      "loss": 1.5246,
      "num_input_tokens_seen": 23102594416,
      "step": 29364
    },
    {
      "epoch": 3.1153193295141097,
      "grad_norm": 0.4914078800145349,
      "learning_rate": 4.2173931148672366e-05,
      "loss": 1.4475,
      "num_input_tokens_seen": 23103381184,
      "step": 29365
    },
    {
      "epoch": 3.115425419053681,
      "grad_norm": 0.5354237255194297,
      "learning_rate": 4.2173426109699985e-05,
      "loss": 1.3886,
      "num_input_tokens_seen": 23104168080,
      "step": 29366
    },
    {
      "epoch": 3.1155315085932527,
      "grad_norm": 0.900048808886245,
      "learning_rate": 4.2172921057456496e-05,
      "loss": 1.5895,
      "num_input_tokens_seen": 23104954816,
      "step": 29367
    },
    {
      "epoch": 3.115637598132824,
      "grad_norm": 0.5823904474459083,
      "learning_rate": 4.217241599194227e-05,
      "loss": 1.5205,
      "num_input_tokens_seen": 23105741584,
      "step": 29368
    },
    {
      "epoch": 3.1157436876723956,
      "grad_norm": 0.6774193698025878,
      "learning_rate": 4.2171910913157715e-05,
      "loss": 1.4613,
      "num_input_tokens_seen": 23106528384,
      "step": 29369
    },
    {
      "epoch": 3.115849777211967,
      "grad_norm": 0.513546964071228,
      "learning_rate": 4.21714058211032e-05,
      "loss": 1.4939,
      "num_input_tokens_seen": 23107315104,
      "step": 29370
    },
    {
      "epoch": 3.115955866751538,
      "grad_norm": 0.4106830235437744,
      "learning_rate": 4.217090071577914e-05,
      "loss": 1.5653,
      "num_input_tokens_seen": 23108101776,
      "step": 29371
    },
    {
      "epoch": 3.1160619562911096,
      "grad_norm": 0.4684707376611524,
      "learning_rate": 4.21703955971859e-05,
      "loss": 1.4871,
      "num_input_tokens_seen": 23108888496,
      "step": 29372
    },
    {
      "epoch": 3.116168045830681,
      "grad_norm": 0.4917972603930274,
      "learning_rate": 4.216989046532389e-05,
      "loss": 1.4061,
      "num_input_tokens_seen": 23109675280,
      "step": 29373
    },
    {
      "epoch": 3.1162741353702526,
      "grad_norm": 0.4531536026162947,
      "learning_rate": 4.2169385320193486e-05,
      "loss": 1.5075,
      "num_input_tokens_seen": 23110461936,
      "step": 29374
    },
    {
      "epoch": 3.116380224909824,
      "grad_norm": 0.4193421173894932,
      "learning_rate": 4.216888016179509e-05,
      "loss": 1.4458,
      "num_input_tokens_seen": 23111248784,
      "step": 29375
    },
    {
      "epoch": 3.1164863144493955,
      "grad_norm": 0.40570890120851993,
      "learning_rate": 4.216837499012908e-05,
      "loss": 1.4133,
      "num_input_tokens_seen": 23112035536,
      "step": 29376
    },
    {
      "epoch": 3.1165924039889665,
      "grad_norm": 0.5427036226684063,
      "learning_rate": 4.216786980519586e-05,
      "loss": 1.4927,
      "num_input_tokens_seen": 23112822352,
      "step": 29377
    },
    {
      "epoch": 3.116698493528538,
      "grad_norm": 0.39836512135467395,
      "learning_rate": 4.2167364606995804e-05,
      "loss": 1.448,
      "num_input_tokens_seen": 23113609056,
      "step": 29378
    },
    {
      "epoch": 3.1168045830681095,
      "grad_norm": 0.48328642741481015,
      "learning_rate": 4.2166859395529325e-05,
      "loss": 1.4265,
      "num_input_tokens_seen": 23114395808,
      "step": 29379
    },
    {
      "epoch": 3.116910672607681,
      "grad_norm": 0.5253721140065164,
      "learning_rate": 4.21663541707968e-05,
      "loss": 1.5447,
      "num_input_tokens_seen": 23115182640,
      "step": 29380
    },
    {
      "epoch": 3.1170167621472524,
      "grad_norm": 0.44232664961774965,
      "learning_rate": 4.216584893279861e-05,
      "loss": 1.4896,
      "num_input_tokens_seen": 23115969408,
      "step": 29381
    },
    {
      "epoch": 3.1171228516868235,
      "grad_norm": 0.6820288903131329,
      "learning_rate": 4.216534368153516e-05,
      "loss": 1.6246,
      "num_input_tokens_seen": 23116756144,
      "step": 29382
    },
    {
      "epoch": 3.117228941226395,
      "grad_norm": 0.5128767219801136,
      "learning_rate": 4.216483841700684e-05,
      "loss": 1.5671,
      "num_input_tokens_seen": 23117542912,
      "step": 29383
    },
    {
      "epoch": 3.1173350307659664,
      "grad_norm": 0.4833828395605226,
      "learning_rate": 4.2164333139214035e-05,
      "loss": 1.3357,
      "num_input_tokens_seen": 23118329760,
      "step": 29384
    },
    {
      "epoch": 3.117441120305538,
      "grad_norm": 0.6930293929814689,
      "learning_rate": 4.2163827848157134e-05,
      "loss": 1.5617,
      "num_input_tokens_seen": 23119116496,
      "step": 29385
    },
    {
      "epoch": 3.1175472098451094,
      "grad_norm": 0.4791013396608726,
      "learning_rate": 4.216332254383654e-05,
      "loss": 1.4054,
      "num_input_tokens_seen": 23119903376,
      "step": 29386
    },
    {
      "epoch": 3.117653299384681,
      "grad_norm": 0.4877903106638266,
      "learning_rate": 4.216281722625262e-05,
      "loss": 1.5158,
      "num_input_tokens_seen": 23120690208,
      "step": 29387
    },
    {
      "epoch": 3.117759388924252,
      "grad_norm": 0.4596406344147088,
      "learning_rate": 4.2162311895405784e-05,
      "loss": 1.4487,
      "num_input_tokens_seen": 23121476960,
      "step": 29388
    },
    {
      "epoch": 3.1178654784638233,
      "grad_norm": 0.4942078535151461,
      "learning_rate": 4.2161806551296425e-05,
      "loss": 1.472,
      "num_input_tokens_seen": 23122263712,
      "step": 29389
    },
    {
      "epoch": 3.117971568003395,
      "grad_norm": 0.43663169995030476,
      "learning_rate": 4.2161301193924915e-05,
      "loss": 1.5356,
      "num_input_tokens_seen": 23123050496,
      "step": 29390
    },
    {
      "epoch": 3.1180776575429663,
      "grad_norm": 0.45869048464942447,
      "learning_rate": 4.2160795823291655e-05,
      "loss": 1.4857,
      "num_input_tokens_seen": 23123837296,
      "step": 29391
    },
    {
      "epoch": 3.1181837470825378,
      "grad_norm": 0.521863460529963,
      "learning_rate": 4.216029043939704e-05,
      "loss": 1.3432,
      "num_input_tokens_seen": 23124624176,
      "step": 29392
    },
    {
      "epoch": 3.1182898366221092,
      "grad_norm": 0.43820753673314056,
      "learning_rate": 4.215978504224145e-05,
      "loss": 1.3023,
      "num_input_tokens_seen": 23125411072,
      "step": 29393
    },
    {
      "epoch": 3.1183959261616803,
      "grad_norm": 0.5828083576012737,
      "learning_rate": 4.215927963182529e-05,
      "loss": 1.4661,
      "num_input_tokens_seen": 23126197792,
      "step": 29394
    },
    {
      "epoch": 3.1185020157012517,
      "grad_norm": 0.3927570482848973,
      "learning_rate": 4.2158774208148944e-05,
      "loss": 1.4143,
      "num_input_tokens_seen": 23126984544,
      "step": 29395
    },
    {
      "epoch": 3.118608105240823,
      "grad_norm": 0.4083121970320913,
      "learning_rate": 4.21582687712128e-05,
      "loss": 1.4714,
      "num_input_tokens_seen": 23127771328,
      "step": 29396
    },
    {
      "epoch": 3.1187141947803947,
      "grad_norm": 0.40829839478825036,
      "learning_rate": 4.2157763321017244e-05,
      "loss": 1.3983,
      "num_input_tokens_seen": 23128558032,
      "step": 29397
    },
    {
      "epoch": 3.118820284319966,
      "grad_norm": 0.43977765521312834,
      "learning_rate": 4.215725785756267e-05,
      "loss": 1.5768,
      "num_input_tokens_seen": 23129344816,
      "step": 29398
    },
    {
      "epoch": 3.1189263738595376,
      "grad_norm": 0.45853099701578354,
      "learning_rate": 4.215675238084947e-05,
      "loss": 1.572,
      "num_input_tokens_seen": 23130131632,
      "step": 29399
    },
    {
      "epoch": 3.1190324633991087,
      "grad_norm": 0.3828023349109912,
      "learning_rate": 4.215624689087804e-05,
      "loss": 1.4365,
      "num_input_tokens_seen": 23130918432,
      "step": 29400
    },
    {
      "epoch": 3.11913855293868,
      "grad_norm": 0.39648273199142736,
      "learning_rate": 4.215574138764877e-05,
      "loss": 1.4918,
      "num_input_tokens_seen": 23131705152,
      "step": 29401
    },
    {
      "epoch": 3.1192446424782516,
      "grad_norm": 0.6767706904982608,
      "learning_rate": 4.215523587116204e-05,
      "loss": 1.5219,
      "num_input_tokens_seen": 23132491888,
      "step": 29402
    },
    {
      "epoch": 3.119350732017823,
      "grad_norm": 0.6425410834596736,
      "learning_rate": 4.2154730341418246e-05,
      "loss": 1.4351,
      "num_input_tokens_seen": 23133278640,
      "step": 29403
    },
    {
      "epoch": 3.1194568215573946,
      "grad_norm": 0.4028188006703249,
      "learning_rate": 4.2154224798417785e-05,
      "loss": 1.3628,
      "num_input_tokens_seen": 23134065424,
      "step": 29404
    },
    {
      "epoch": 3.119562911096966,
      "grad_norm": 0.5303403471054757,
      "learning_rate": 4.2153719242161036e-05,
      "loss": 1.4723,
      "num_input_tokens_seen": 23134852288,
      "step": 29405
    },
    {
      "epoch": 3.119669000636537,
      "grad_norm": 0.4502389874870487,
      "learning_rate": 4.2153213672648396e-05,
      "loss": 1.541,
      "num_input_tokens_seen": 23135639024,
      "step": 29406
    },
    {
      "epoch": 3.1197750901761085,
      "grad_norm": 0.4245828885165117,
      "learning_rate": 4.215270808988026e-05,
      "loss": 1.3915,
      "num_input_tokens_seen": 23136425792,
      "step": 29407
    },
    {
      "epoch": 3.11988117971568,
      "grad_norm": 0.5076187922060454,
      "learning_rate": 4.2152202493857015e-05,
      "loss": 1.3293,
      "num_input_tokens_seen": 23137212640,
      "step": 29408
    },
    {
      "epoch": 3.1199872692552515,
      "grad_norm": 0.4593346642967564,
      "learning_rate": 4.215169688457905e-05,
      "loss": 1.4873,
      "num_input_tokens_seen": 23137999376,
      "step": 29409
    },
    {
      "epoch": 3.120093358794823,
      "grad_norm": 0.5468433287834725,
      "learning_rate": 4.215119126204675e-05,
      "loss": 1.4957,
      "num_input_tokens_seen": 23138786128,
      "step": 29410
    },
    {
      "epoch": 3.1201994483343944,
      "grad_norm": 0.36757791160448844,
      "learning_rate": 4.215068562626052e-05,
      "loss": 1.355,
      "num_input_tokens_seen": 23139572880,
      "step": 29411
    },
    {
      "epoch": 3.1203055378739655,
      "grad_norm": 0.5051204034387533,
      "learning_rate": 4.215017997722075e-05,
      "loss": 1.5629,
      "num_input_tokens_seen": 23140359648,
      "step": 29412
    },
    {
      "epoch": 3.120411627413537,
      "grad_norm": 0.4310791089140693,
      "learning_rate": 4.2149674314927815e-05,
      "loss": 1.507,
      "num_input_tokens_seen": 23141146432,
      "step": 29413
    },
    {
      "epoch": 3.1205177169531084,
      "grad_norm": 0.4689340876075057,
      "learning_rate": 4.214916863938212e-05,
      "loss": 1.4742,
      "num_input_tokens_seen": 23141933264,
      "step": 29414
    },
    {
      "epoch": 3.12062380649268,
      "grad_norm": 0.43658075911910915,
      "learning_rate": 4.214866295058405e-05,
      "loss": 1.4313,
      "num_input_tokens_seen": 23142720032,
      "step": 29415
    },
    {
      "epoch": 3.1207298960322514,
      "grad_norm": 0.461017322018353,
      "learning_rate": 4.214815724853399e-05,
      "loss": 1.4566,
      "num_input_tokens_seen": 23143506752,
      "step": 29416
    },
    {
      "epoch": 3.120835985571823,
      "grad_norm": 0.4771609522567017,
      "learning_rate": 4.214765153323234e-05,
      "loss": 1.376,
      "num_input_tokens_seen": 23144293552,
      "step": 29417
    },
    {
      "epoch": 3.120942075111394,
      "grad_norm": 0.4645403532391403,
      "learning_rate": 4.214714580467949e-05,
      "loss": 1.5276,
      "num_input_tokens_seen": 23145080288,
      "step": 29418
    },
    {
      "epoch": 3.1210481646509654,
      "grad_norm": 0.4903636329022309,
      "learning_rate": 4.214664006287583e-05,
      "loss": 1.516,
      "num_input_tokens_seen": 23145867040,
      "step": 29419
    },
    {
      "epoch": 3.121154254190537,
      "grad_norm": 0.4289945425941378,
      "learning_rate": 4.214613430782174e-05,
      "loss": 1.4671,
      "num_input_tokens_seen": 23146653744,
      "step": 29420
    },
    {
      "epoch": 3.1212603437301083,
      "grad_norm": 0.42952007467808767,
      "learning_rate": 4.214562853951764e-05,
      "loss": 1.5011,
      "num_input_tokens_seen": 23147440416,
      "step": 29421
    },
    {
      "epoch": 3.1213664332696798,
      "grad_norm": 0.48739761646480345,
      "learning_rate": 4.2145122757963886e-05,
      "loss": 1.5626,
      "num_input_tokens_seen": 23148227136,
      "step": 29422
    },
    {
      "epoch": 3.121472522809251,
      "grad_norm": 0.52006224913903,
      "learning_rate": 4.214461696316088e-05,
      "loss": 1.4653,
      "num_input_tokens_seen": 23149013920,
      "step": 29423
    },
    {
      "epoch": 3.1215786123488223,
      "grad_norm": 0.4530195288535274,
      "learning_rate": 4.214411115510903e-05,
      "loss": 1.5171,
      "num_input_tokens_seen": 23149800720,
      "step": 29424
    },
    {
      "epoch": 3.1216847018883938,
      "grad_norm": 0.42508487809324524,
      "learning_rate": 4.21436053338087e-05,
      "loss": 1.3585,
      "num_input_tokens_seen": 23150587504,
      "step": 29425
    },
    {
      "epoch": 3.1217907914279652,
      "grad_norm": 0.41613460115942924,
      "learning_rate": 4.2143099499260305e-05,
      "loss": 1.3849,
      "num_input_tokens_seen": 23151374304,
      "step": 29426
    },
    {
      "epoch": 3.1218968809675367,
      "grad_norm": 0.4249331732538274,
      "learning_rate": 4.214259365146423e-05,
      "loss": 1.4766,
      "num_input_tokens_seen": 23152161120,
      "step": 29427
    },
    {
      "epoch": 3.122002970507108,
      "grad_norm": 0.5369450955098983,
      "learning_rate": 4.2142087790420845e-05,
      "loss": 1.4226,
      "num_input_tokens_seen": 23152947904,
      "step": 29428
    },
    {
      "epoch": 3.122109060046679,
      "grad_norm": 0.40467283950345184,
      "learning_rate": 4.214158191613057e-05,
      "loss": 1.2682,
      "num_input_tokens_seen": 23153734688,
      "step": 29429
    },
    {
      "epoch": 3.1222151495862507,
      "grad_norm": 0.3923720766965681,
      "learning_rate": 4.214107602859378e-05,
      "loss": 1.4079,
      "num_input_tokens_seen": 23154521504,
      "step": 29430
    },
    {
      "epoch": 3.122321239125822,
      "grad_norm": 0.41601074468021704,
      "learning_rate": 4.2140570127810874e-05,
      "loss": 1.4434,
      "num_input_tokens_seen": 23155308320,
      "step": 29431
    },
    {
      "epoch": 3.1224273286653936,
      "grad_norm": 0.42974366667236436,
      "learning_rate": 4.214006421378224e-05,
      "loss": 1.3279,
      "num_input_tokens_seen": 23156095168,
      "step": 29432
    },
    {
      "epoch": 3.122533418204965,
      "grad_norm": 0.3982396390461697,
      "learning_rate": 4.213955828650826e-05,
      "loss": 1.3762,
      "num_input_tokens_seen": 23156882032,
      "step": 29433
    },
    {
      "epoch": 3.1226395077445366,
      "grad_norm": 0.5345226333135424,
      "learning_rate": 4.213905234598934e-05,
      "loss": 1.5164,
      "num_input_tokens_seen": 23157668816,
      "step": 29434
    },
    {
      "epoch": 3.1227455972841076,
      "grad_norm": 0.4413530881886891,
      "learning_rate": 4.213854639222585e-05,
      "loss": 1.4335,
      "num_input_tokens_seen": 23158455712,
      "step": 29435
    },
    {
      "epoch": 3.122851686823679,
      "grad_norm": 0.4370060566636095,
      "learning_rate": 4.213804042521821e-05,
      "loss": 1.3402,
      "num_input_tokens_seen": 23159242512,
      "step": 29436
    },
    {
      "epoch": 3.1229577763632506,
      "grad_norm": 0.44399156970122683,
      "learning_rate": 4.2137534444966784e-05,
      "loss": 1.5164,
      "num_input_tokens_seen": 23160029216,
      "step": 29437
    },
    {
      "epoch": 3.123063865902822,
      "grad_norm": 0.405818700100465,
      "learning_rate": 4.213702845147198e-05,
      "loss": 1.472,
      "num_input_tokens_seen": 23160815984,
      "step": 29438
    },
    {
      "epoch": 3.1231699554423935,
      "grad_norm": 0.41918936861307105,
      "learning_rate": 4.213652244473418e-05,
      "loss": 1.5518,
      "num_input_tokens_seen": 23161602768,
      "step": 29439
    },
    {
      "epoch": 3.123276044981965,
      "grad_norm": 0.5383423576609931,
      "learning_rate": 4.213601642475378e-05,
      "loss": 1.4465,
      "num_input_tokens_seen": 23162389536,
      "step": 29440
    },
    {
      "epoch": 3.123382134521536,
      "grad_norm": 0.5794290806478959,
      "learning_rate": 4.213551039153117e-05,
      "loss": 1.4851,
      "num_input_tokens_seen": 23163176320,
      "step": 29441
    },
    {
      "epoch": 3.1234882240611075,
      "grad_norm": 0.546655870578227,
      "learning_rate": 4.2135004345066735e-05,
      "loss": 1.5427,
      "num_input_tokens_seen": 23163963088,
      "step": 29442
    },
    {
      "epoch": 3.123594313600679,
      "grad_norm": 0.49643298028536065,
      "learning_rate": 4.213449828536088e-05,
      "loss": 1.498,
      "num_input_tokens_seen": 23164749856,
      "step": 29443
    },
    {
      "epoch": 3.1237004031402504,
      "grad_norm": 0.595554617160625,
      "learning_rate": 4.213399221241398e-05,
      "loss": 1.4464,
      "num_input_tokens_seen": 23165536512,
      "step": 29444
    },
    {
      "epoch": 3.123806492679822,
      "grad_norm": 0.4817687847875444,
      "learning_rate": 4.213348612622644e-05,
      "loss": 1.4493,
      "num_input_tokens_seen": 23166323088,
      "step": 29445
    },
    {
      "epoch": 3.1239125822193934,
      "grad_norm": 0.7961820788055711,
      "learning_rate": 4.213298002679864e-05,
      "loss": 1.3965,
      "num_input_tokens_seen": 23167109792,
      "step": 29446
    },
    {
      "epoch": 3.1240186717589644,
      "grad_norm": 0.44626457085696175,
      "learning_rate": 4.213247391413098e-05,
      "loss": 1.4981,
      "num_input_tokens_seen": 23167896480,
      "step": 29447
    },
    {
      "epoch": 3.124124761298536,
      "grad_norm": 0.46306260828186363,
      "learning_rate": 4.2131967788223835e-05,
      "loss": 1.5265,
      "num_input_tokens_seen": 23168683248,
      "step": 29448
    },
    {
      "epoch": 3.1242308508381074,
      "grad_norm": 0.5482025946489304,
      "learning_rate": 4.213146164907762e-05,
      "loss": 1.5051,
      "num_input_tokens_seen": 23169469936,
      "step": 29449
    },
    {
      "epoch": 3.124336940377679,
      "grad_norm": 0.44021600134793976,
      "learning_rate": 4.213095549669272e-05,
      "loss": 1.3678,
      "num_input_tokens_seen": 23170256768,
      "step": 29450
    },
    {
      "epoch": 3.1244430299172503,
      "grad_norm": 0.45345602697419635,
      "learning_rate": 4.21304493310695e-05,
      "loss": 1.3683,
      "num_input_tokens_seen": 23171043536,
      "step": 29451
    },
    {
      "epoch": 3.1245491194568213,
      "grad_norm": 0.5133348040664661,
      "learning_rate": 4.212994315220839e-05,
      "loss": 1.512,
      "num_input_tokens_seen": 23171830288,
      "step": 29452
    },
    {
      "epoch": 3.124655208996393,
      "grad_norm": 0.5769616659943335,
      "learning_rate": 4.212943696010975e-05,
      "loss": 1.5212,
      "num_input_tokens_seen": 23172617104,
      "step": 29453
    },
    {
      "epoch": 3.1247612985359643,
      "grad_norm": 0.42875364813507266,
      "learning_rate": 4.212893075477399e-05,
      "loss": 1.4356,
      "num_input_tokens_seen": 23173403904,
      "step": 29454
    },
    {
      "epoch": 3.1248673880755358,
      "grad_norm": 0.43713913661927306,
      "learning_rate": 4.2128424536201495e-05,
      "loss": 1.3579,
      "num_input_tokens_seen": 23174190704,
      "step": 29455
    },
    {
      "epoch": 3.1249734776151072,
      "grad_norm": 0.5146534883115658,
      "learning_rate": 4.2127918304392656e-05,
      "loss": 1.4747,
      "num_input_tokens_seen": 23174977504,
      "step": 29456
    },
    {
      "epoch": 3.1250795671546787,
      "grad_norm": 0.41595806314286987,
      "learning_rate": 4.212741205934786e-05,
      "loss": 1.5352,
      "num_input_tokens_seen": 23175764256,
      "step": 29457
    },
    {
      "epoch": 3.1251856566942497,
      "grad_norm": 0.5535955989069336,
      "learning_rate": 4.2126905801067503e-05,
      "loss": 1.4394,
      "num_input_tokens_seen": 23176551008,
      "step": 29458
    },
    {
      "epoch": 3.125291746233821,
      "grad_norm": 0.43089565609281877,
      "learning_rate": 4.212639952955198e-05,
      "loss": 1.4339,
      "num_input_tokens_seen": 23177337792,
      "step": 29459
    },
    {
      "epoch": 3.1253978357733927,
      "grad_norm": 0.4208702692580924,
      "learning_rate": 4.212589324480168e-05,
      "loss": 1.3801,
      "num_input_tokens_seen": 23178124512,
      "step": 29460
    },
    {
      "epoch": 3.125503925312964,
      "grad_norm": 0.5690404379969413,
      "learning_rate": 4.212538694681699e-05,
      "loss": 1.4041,
      "num_input_tokens_seen": 23178911232,
      "step": 29461
    },
    {
      "epoch": 3.1256100148525356,
      "grad_norm": 0.46246629334725287,
      "learning_rate": 4.2124880635598296e-05,
      "loss": 1.4108,
      "num_input_tokens_seen": 23179698000,
      "step": 29462
    },
    {
      "epoch": 3.125716104392107,
      "grad_norm": 0.5815779683068136,
      "learning_rate": 4.212437431114601e-05,
      "loss": 1.5735,
      "num_input_tokens_seen": 23180484784,
      "step": 29463
    },
    {
      "epoch": 3.125822193931678,
      "grad_norm": 0.3899152553388255,
      "learning_rate": 4.21238679734605e-05,
      "loss": 1.4919,
      "num_input_tokens_seen": 23181271600,
      "step": 29464
    },
    {
      "epoch": 3.1259282834712496,
      "grad_norm": 0.49820664826548067,
      "learning_rate": 4.212336162254217e-05,
      "loss": 1.3452,
      "num_input_tokens_seen": 23182058400,
      "step": 29465
    },
    {
      "epoch": 3.126034373010821,
      "grad_norm": 0.5453027284602315,
      "learning_rate": 4.2122855258391405e-05,
      "loss": 1.6277,
      "num_input_tokens_seen": 23182844992,
      "step": 29466
    },
    {
      "epoch": 3.1261404625503926,
      "grad_norm": 0.516719891921439,
      "learning_rate": 4.2122348881008604e-05,
      "loss": 1.4711,
      "num_input_tokens_seen": 23183631728,
      "step": 29467
    },
    {
      "epoch": 3.126246552089964,
      "grad_norm": 0.44973146294325667,
      "learning_rate": 4.212184249039416e-05,
      "loss": 1.3431,
      "num_input_tokens_seen": 23184418464,
      "step": 29468
    },
    {
      "epoch": 3.1263526416295355,
      "grad_norm": 0.4306523261287133,
      "learning_rate": 4.212133608654845e-05,
      "loss": 1.434,
      "num_input_tokens_seen": 23185205216,
      "step": 29469
    },
    {
      "epoch": 3.1264587311691066,
      "grad_norm": 0.4393931849838502,
      "learning_rate": 4.2120829669471874e-05,
      "loss": 1.4766,
      "num_input_tokens_seen": 23185991920,
      "step": 29470
    },
    {
      "epoch": 3.126564820708678,
      "grad_norm": 0.5122242758437857,
      "learning_rate": 4.212032323916483e-05,
      "loss": 1.4685,
      "num_input_tokens_seen": 23186778640,
      "step": 29471
    },
    {
      "epoch": 3.1266709102482495,
      "grad_norm": 0.4689279088318534,
      "learning_rate": 4.211981679562769e-05,
      "loss": 1.4955,
      "num_input_tokens_seen": 23187565424,
      "step": 29472
    },
    {
      "epoch": 3.126776999787821,
      "grad_norm": 0.456587885274462,
      "learning_rate": 4.211931033886086e-05,
      "loss": 1.5773,
      "num_input_tokens_seen": 23188352144,
      "step": 29473
    },
    {
      "epoch": 3.1268830893273925,
      "grad_norm": 0.40822489574386633,
      "learning_rate": 4.211880386886474e-05,
      "loss": 1.4407,
      "num_input_tokens_seen": 23189138848,
      "step": 29474
    },
    {
      "epoch": 3.126989178866964,
      "grad_norm": 0.4726376740390207,
      "learning_rate": 4.2118297385639706e-05,
      "loss": 1.4714,
      "num_input_tokens_seen": 23189925584,
      "step": 29475
    },
    {
      "epoch": 3.127095268406535,
      "grad_norm": 0.4987465107726774,
      "learning_rate": 4.2117790889186156e-05,
      "loss": 1.5516,
      "num_input_tokens_seen": 23190712272,
      "step": 29476
    },
    {
      "epoch": 3.1272013579461064,
      "grad_norm": 0.4312771446672232,
      "learning_rate": 4.211728437950447e-05,
      "loss": 1.3898,
      "num_input_tokens_seen": 23191498944,
      "step": 29477
    },
    {
      "epoch": 3.127307447485678,
      "grad_norm": 0.40987204165340746,
      "learning_rate": 4.2116777856595055e-05,
      "loss": 1.5146,
      "num_input_tokens_seen": 23192285808,
      "step": 29478
    },
    {
      "epoch": 3.1274135370252494,
      "grad_norm": 0.5584119205010888,
      "learning_rate": 4.21162713204583e-05,
      "loss": 1.5525,
      "num_input_tokens_seen": 23193072608,
      "step": 29479
    },
    {
      "epoch": 3.127519626564821,
      "grad_norm": 0.4090994505327974,
      "learning_rate": 4.211576477109459e-05,
      "loss": 1.5239,
      "num_input_tokens_seen": 23193859360,
      "step": 29480
    },
    {
      "epoch": 3.127625716104392,
      "grad_norm": 0.44744956677672376,
      "learning_rate": 4.211525820850432e-05,
      "loss": 1.5109,
      "num_input_tokens_seen": 23194646080,
      "step": 29481
    },
    {
      "epoch": 3.1277318056439634,
      "grad_norm": 0.45032352634457223,
      "learning_rate": 4.2114751632687877e-05,
      "loss": 1.4451,
      "num_input_tokens_seen": 23195432912,
      "step": 29482
    },
    {
      "epoch": 3.127837895183535,
      "grad_norm": 0.43167360401696614,
      "learning_rate": 4.2114245043645663e-05,
      "loss": 1.493,
      "num_input_tokens_seen": 23196219648,
      "step": 29483
    },
    {
      "epoch": 3.1279439847231063,
      "grad_norm": 0.40361294828161837,
      "learning_rate": 4.211373844137806e-05,
      "loss": 1.3989,
      "num_input_tokens_seen": 23197006304,
      "step": 29484
    },
    {
      "epoch": 3.128050074262678,
      "grad_norm": 0.39478743209856276,
      "learning_rate": 4.2113231825885455e-05,
      "loss": 1.4109,
      "num_input_tokens_seen": 23197793024,
      "step": 29485
    },
    {
      "epoch": 3.1281561638022493,
      "grad_norm": 0.384256859993114,
      "learning_rate": 4.211272519716826e-05,
      "loss": 1.4372,
      "num_input_tokens_seen": 23198579760,
      "step": 29486
    },
    {
      "epoch": 3.1282622533418207,
      "grad_norm": 0.3770453915809788,
      "learning_rate": 4.211221855522685e-05,
      "loss": 1.4128,
      "num_input_tokens_seen": 23199366480,
      "step": 29487
    },
    {
      "epoch": 3.1283683428813918,
      "grad_norm": 0.42408718516881366,
      "learning_rate": 4.211171190006161e-05,
      "loss": 1.5113,
      "num_input_tokens_seen": 23200153264,
      "step": 29488
    },
    {
      "epoch": 3.1284744324209632,
      "grad_norm": 0.4202132670627721,
      "learning_rate": 4.211120523167295e-05,
      "loss": 1.5243,
      "num_input_tokens_seen": 23200940080,
      "step": 29489
    },
    {
      "epoch": 3.1285805219605347,
      "grad_norm": 0.3704855129991283,
      "learning_rate": 4.211069855006124e-05,
      "loss": 1.3963,
      "num_input_tokens_seen": 23201726928,
      "step": 29490
    },
    {
      "epoch": 3.128686611500106,
      "grad_norm": 0.41118557206223677,
      "learning_rate": 4.211019185522689e-05,
      "loss": 1.4145,
      "num_input_tokens_seen": 23202513632,
      "step": 29491
    },
    {
      "epoch": 3.1287927010396777,
      "grad_norm": 0.4025436145297392,
      "learning_rate": 4.2109685147170294e-05,
      "loss": 1.4126,
      "num_input_tokens_seen": 23203300368,
      "step": 29492
    },
    {
      "epoch": 3.1288987905792487,
      "grad_norm": 0.4772954181580308,
      "learning_rate": 4.2109178425891825e-05,
      "loss": 1.4691,
      "num_input_tokens_seen": 23204087168,
      "step": 29493
    },
    {
      "epoch": 3.12900488011882,
      "grad_norm": 0.4380045098471942,
      "learning_rate": 4.2108671691391896e-05,
      "loss": 1.4579,
      "num_input_tokens_seen": 23204873952,
      "step": 29494
    },
    {
      "epoch": 3.1291109696583916,
      "grad_norm": 0.423311119429991,
      "learning_rate": 4.210816494367088e-05,
      "loss": 1.4942,
      "num_input_tokens_seen": 23205660672,
      "step": 29495
    },
    {
      "epoch": 3.129217059197963,
      "grad_norm": 0.40620069398492387,
      "learning_rate": 4.210765818272917e-05,
      "loss": 1.4258,
      "num_input_tokens_seen": 23206447344,
      "step": 29496
    },
    {
      "epoch": 3.1293231487375346,
      "grad_norm": 0.3962638335305029,
      "learning_rate": 4.210715140856718e-05,
      "loss": 1.5004,
      "num_input_tokens_seen": 23207234096,
      "step": 29497
    },
    {
      "epoch": 3.129429238277106,
      "grad_norm": 0.41797669803699466,
      "learning_rate": 4.2106644621185274e-05,
      "loss": 1.519,
      "num_input_tokens_seen": 23208020848,
      "step": 29498
    },
    {
      "epoch": 3.129535327816677,
      "grad_norm": 0.4152125276685468,
      "learning_rate": 4.210613782058386e-05,
      "loss": 1.6275,
      "num_input_tokens_seen": 23208807584,
      "step": 29499
    },
    {
      "epoch": 3.1296414173562486,
      "grad_norm": 0.3912822823936068,
      "learning_rate": 4.2105631006763325e-05,
      "loss": 1.3569,
      "num_input_tokens_seen": 23209594336,
      "step": 29500
    },
    {
      "epoch": 3.12974750689582,
      "grad_norm": 0.41291247863318675,
      "learning_rate": 4.210512417972405e-05,
      "loss": 1.5731,
      "num_input_tokens_seen": 23210381040,
      "step": 29501
    },
    {
      "epoch": 3.1298535964353915,
      "grad_norm": 0.4149202200344235,
      "learning_rate": 4.210461733946645e-05,
      "loss": 1.4957,
      "num_input_tokens_seen": 23211167824,
      "step": 29502
    },
    {
      "epoch": 3.129959685974963,
      "grad_norm": 0.39641199561804025,
      "learning_rate": 4.21041104859909e-05,
      "loss": 1.402,
      "num_input_tokens_seen": 23211954608,
      "step": 29503
    },
    {
      "epoch": 3.1300657755145345,
      "grad_norm": 0.6720570071599379,
      "learning_rate": 4.2103603619297795e-05,
      "loss": 1.5746,
      "num_input_tokens_seen": 23212741344,
      "step": 29504
    },
    {
      "epoch": 3.1301718650541055,
      "grad_norm": 0.4442509187831829,
      "learning_rate": 4.2103096739387524e-05,
      "loss": 1.4621,
      "num_input_tokens_seen": 23213528208,
      "step": 29505
    },
    {
      "epoch": 3.130277954593677,
      "grad_norm": 0.8650575346313376,
      "learning_rate": 4.2102589846260476e-05,
      "loss": 1.4799,
      "num_input_tokens_seen": 23214315056,
      "step": 29506
    },
    {
      "epoch": 3.1303840441332484,
      "grad_norm": 0.6284754654874084,
      "learning_rate": 4.210208293991706e-05,
      "loss": 1.468,
      "num_input_tokens_seen": 23215101840,
      "step": 29507
    },
    {
      "epoch": 3.13049013367282,
      "grad_norm": 0.7135936720085871,
      "learning_rate": 4.210157602035765e-05,
      "loss": 1.5277,
      "num_input_tokens_seen": 23215888544,
      "step": 29508
    },
    {
      "epoch": 3.1305962232123914,
      "grad_norm": 0.45370019553461666,
      "learning_rate": 4.210106908758264e-05,
      "loss": 1.4268,
      "num_input_tokens_seen": 23216675248,
      "step": 29509
    },
    {
      "epoch": 3.1307023127519624,
      "grad_norm": 0.5935748313555161,
      "learning_rate": 4.210056214159244e-05,
      "loss": 1.462,
      "num_input_tokens_seen": 23217462064,
      "step": 29510
    },
    {
      "epoch": 3.130808402291534,
      "grad_norm": 0.4263809374709987,
      "learning_rate": 4.2100055182387414e-05,
      "loss": 1.3553,
      "num_input_tokens_seen": 23218248848,
      "step": 29511
    },
    {
      "epoch": 3.1309144918311054,
      "grad_norm": 0.5837220070806225,
      "learning_rate": 4.209954820996797e-05,
      "loss": 1.3961,
      "num_input_tokens_seen": 23219035680,
      "step": 29512
    },
    {
      "epoch": 3.131020581370677,
      "grad_norm": 0.4567145353479878,
      "learning_rate": 4.2099041224334504e-05,
      "loss": 1.3887,
      "num_input_tokens_seen": 23219822512,
      "step": 29513
    },
    {
      "epoch": 3.1311266709102483,
      "grad_norm": 0.4719294399496068,
      "learning_rate": 4.209853422548739e-05,
      "loss": 1.4975,
      "num_input_tokens_seen": 23220609296,
      "step": 29514
    },
    {
      "epoch": 3.13123276044982,
      "grad_norm": 0.6057220721249716,
      "learning_rate": 4.209802721342704e-05,
      "loss": 1.553,
      "num_input_tokens_seen": 23221396144,
      "step": 29515
    },
    {
      "epoch": 3.1313388499893913,
      "grad_norm": 0.38876027611521996,
      "learning_rate": 4.209752018815383e-05,
      "loss": 1.3431,
      "num_input_tokens_seen": 23222182848,
      "step": 29516
    },
    {
      "epoch": 3.1314449395289623,
      "grad_norm": 0.6696328772510786,
      "learning_rate": 4.2097013149668156e-05,
      "loss": 1.4132,
      "num_input_tokens_seen": 23222969584,
      "step": 29517
    },
    {
      "epoch": 3.1315510290685338,
      "grad_norm": 0.4096056252134626,
      "learning_rate": 4.2096506097970415e-05,
      "loss": 1.3936,
      "num_input_tokens_seen": 23223756368,
      "step": 29518
    },
    {
      "epoch": 3.1316571186081053,
      "grad_norm": 0.5829606744585577,
      "learning_rate": 4.209599903306099e-05,
      "loss": 1.6056,
      "num_input_tokens_seen": 23224543168,
      "step": 29519
    },
    {
      "epoch": 3.1317632081476767,
      "grad_norm": 0.4437437348643955,
      "learning_rate": 4.209549195494029e-05,
      "loss": 1.4181,
      "num_input_tokens_seen": 23225330000,
      "step": 29520
    },
    {
      "epoch": 3.131869297687248,
      "grad_norm": 0.4708924984758934,
      "learning_rate": 4.209498486360869e-05,
      "loss": 1.5143,
      "num_input_tokens_seen": 23226116736,
      "step": 29521
    },
    {
      "epoch": 3.1319753872268192,
      "grad_norm": 0.4609878280210894,
      "learning_rate": 4.209447775906659e-05,
      "loss": 1.4058,
      "num_input_tokens_seen": 23226903456,
      "step": 29522
    },
    {
      "epoch": 3.1320814767663907,
      "grad_norm": 0.4193788052717245,
      "learning_rate": 4.209397064131437e-05,
      "loss": 1.405,
      "num_input_tokens_seen": 23227690256,
      "step": 29523
    },
    {
      "epoch": 3.132187566305962,
      "grad_norm": 0.43237586949224466,
      "learning_rate": 4.2093463510352446e-05,
      "loss": 1.4311,
      "num_input_tokens_seen": 23228476992,
      "step": 29524
    },
    {
      "epoch": 3.1322936558455337,
      "grad_norm": 0.44852652286365946,
      "learning_rate": 4.209295636618118e-05,
      "loss": 1.45,
      "num_input_tokens_seen": 23229263840,
      "step": 29525
    },
    {
      "epoch": 3.132399745385105,
      "grad_norm": 0.5527163535510086,
      "learning_rate": 4.2092449208800985e-05,
      "loss": 1.3681,
      "num_input_tokens_seen": 23230050608,
      "step": 29526
    },
    {
      "epoch": 3.1325058349246766,
      "grad_norm": 0.4471288197634639,
      "learning_rate": 4.209194203821225e-05,
      "loss": 1.4928,
      "num_input_tokens_seen": 23230837264,
      "step": 29527
    },
    {
      "epoch": 3.1326119244642476,
      "grad_norm": 0.44355407972159167,
      "learning_rate": 4.209143485441536e-05,
      "loss": 1.4872,
      "num_input_tokens_seen": 23231624000,
      "step": 29528
    },
    {
      "epoch": 3.132718014003819,
      "grad_norm": 0.4517897349270456,
      "learning_rate": 4.209092765741072e-05,
      "loss": 1.3961,
      "num_input_tokens_seen": 23232410736,
      "step": 29529
    },
    {
      "epoch": 3.1328241035433906,
      "grad_norm": 0.4232342992320882,
      "learning_rate": 4.2090420447198696e-05,
      "loss": 1.4398,
      "num_input_tokens_seen": 23233197440,
      "step": 29530
    },
    {
      "epoch": 3.132930193082962,
      "grad_norm": 0.4383084758414686,
      "learning_rate": 4.208991322377971e-05,
      "loss": 1.429,
      "num_input_tokens_seen": 23233984192,
      "step": 29531
    },
    {
      "epoch": 3.1330362826225335,
      "grad_norm": 0.40047903526486056,
      "learning_rate": 4.208940598715413e-05,
      "loss": 1.4363,
      "num_input_tokens_seen": 23234770976,
      "step": 29532
    },
    {
      "epoch": 3.133142372162105,
      "grad_norm": 0.3619981064109409,
      "learning_rate": 4.208889873732237e-05,
      "loss": 1.3539,
      "num_input_tokens_seen": 23235557728,
      "step": 29533
    },
    {
      "epoch": 3.133248461701676,
      "grad_norm": 0.4942649593542114,
      "learning_rate": 4.20883914742848e-05,
      "loss": 1.4469,
      "num_input_tokens_seen": 23236344512,
      "step": 29534
    },
    {
      "epoch": 3.1333545512412475,
      "grad_norm": 0.46151597126665844,
      "learning_rate": 4.208788419804183e-05,
      "loss": 1.5126,
      "num_input_tokens_seen": 23237131280,
      "step": 29535
    },
    {
      "epoch": 3.133460640780819,
      "grad_norm": 0.730788517277327,
      "learning_rate": 4.208737690859384e-05,
      "loss": 1.422,
      "num_input_tokens_seen": 23237918080,
      "step": 29536
    },
    {
      "epoch": 3.1335667303203905,
      "grad_norm": 0.4983262009879195,
      "learning_rate": 4.208686960594123e-05,
      "loss": 1.6386,
      "num_input_tokens_seen": 23238704720,
      "step": 29537
    },
    {
      "epoch": 3.133672819859962,
      "grad_norm": 0.8236656642579305,
      "learning_rate": 4.208636229008438e-05,
      "loss": 1.5021,
      "num_input_tokens_seen": 23239491520,
      "step": 29538
    },
    {
      "epoch": 3.1337789093995334,
      "grad_norm": 0.4546939425531328,
      "learning_rate": 4.2085854961023704e-05,
      "loss": 1.5198,
      "num_input_tokens_seen": 23240278208,
      "step": 29539
    },
    {
      "epoch": 3.1338849989391044,
      "grad_norm": 0.5771621403459728,
      "learning_rate": 4.208534761875957e-05,
      "loss": 1.5729,
      "num_input_tokens_seen": 23241064944,
      "step": 29540
    },
    {
      "epoch": 3.133991088478676,
      "grad_norm": 0.7420766697679747,
      "learning_rate": 4.208484026329238e-05,
      "loss": 1.4538,
      "num_input_tokens_seen": 23241851760,
      "step": 29541
    },
    {
      "epoch": 3.1340971780182474,
      "grad_norm": 0.7214617571426412,
      "learning_rate": 4.208433289462254e-05,
      "loss": 1.5273,
      "num_input_tokens_seen": 23242638560,
      "step": 29542
    },
    {
      "epoch": 3.134203267557819,
      "grad_norm": 0.6588441782906924,
      "learning_rate": 4.208382551275041e-05,
      "loss": 1.3726,
      "num_input_tokens_seen": 23243425280,
      "step": 29543
    },
    {
      "epoch": 3.1343093570973903,
      "grad_norm": 0.5503119673298139,
      "learning_rate": 4.208331811767642e-05,
      "loss": 1.4086,
      "num_input_tokens_seen": 23244212112,
      "step": 29544
    },
    {
      "epoch": 3.134415446636962,
      "grad_norm": 0.5188374402642081,
      "learning_rate": 4.2082810709400926e-05,
      "loss": 1.3873,
      "num_input_tokens_seen": 23244998896,
      "step": 29545
    },
    {
      "epoch": 3.134521536176533,
      "grad_norm": 1.0426754032540622,
      "learning_rate": 4.208230328792435e-05,
      "loss": 1.4229,
      "num_input_tokens_seen": 23245785664,
      "step": 29546
    },
    {
      "epoch": 3.1346276257161043,
      "grad_norm": 0.5651492323516839,
      "learning_rate": 4.2081795853247066e-05,
      "loss": 1.5601,
      "num_input_tokens_seen": 23246572384,
      "step": 29547
    },
    {
      "epoch": 3.134733715255676,
      "grad_norm": 0.7746015188589108,
      "learning_rate": 4.208128840536947e-05,
      "loss": 1.3899,
      "num_input_tokens_seen": 23247359120,
      "step": 29548
    },
    {
      "epoch": 3.1348398047952473,
      "grad_norm": 0.6362087440929314,
      "learning_rate": 4.208078094429195e-05,
      "loss": 1.5059,
      "num_input_tokens_seen": 23248145888,
      "step": 29549
    },
    {
      "epoch": 3.1349458943348187,
      "grad_norm": 0.4559738640143972,
      "learning_rate": 4.208027347001492e-05,
      "loss": 1.3477,
      "num_input_tokens_seen": 23248932624,
      "step": 29550
    },
    {
      "epoch": 3.1350519838743898,
      "grad_norm": 0.6681743252024246,
      "learning_rate": 4.2079765982538745e-05,
      "loss": 1.4723,
      "num_input_tokens_seen": 23249719360,
      "step": 29551
    },
    {
      "epoch": 3.1351580734139612,
      "grad_norm": 0.40778443711711004,
      "learning_rate": 4.2079258481863824e-05,
      "loss": 1.3905,
      "num_input_tokens_seen": 23250506160,
      "step": 29552
    },
    {
      "epoch": 3.1352641629535327,
      "grad_norm": 0.4736806228879759,
      "learning_rate": 4.2078750967990564e-05,
      "loss": 1.5234,
      "num_input_tokens_seen": 23251292864,
      "step": 29553
    },
    {
      "epoch": 3.135370252493104,
      "grad_norm": 0.48570909936888995,
      "learning_rate": 4.207824344091934e-05,
      "loss": 1.4263,
      "num_input_tokens_seen": 23252079648,
      "step": 29554
    },
    {
      "epoch": 3.1354763420326757,
      "grad_norm": 0.4324753262509503,
      "learning_rate": 4.207773590065055e-05,
      "loss": 1.3565,
      "num_input_tokens_seen": 23252866432,
      "step": 29555
    },
    {
      "epoch": 3.135582431572247,
      "grad_norm": 0.3893520410925287,
      "learning_rate": 4.207722834718458e-05,
      "loss": 1.3803,
      "num_input_tokens_seen": 23253653232,
      "step": 29556
    },
    {
      "epoch": 3.135688521111818,
      "grad_norm": 0.7806854033461506,
      "learning_rate": 4.2076720780521845e-05,
      "loss": 1.5826,
      "num_input_tokens_seen": 23254440064,
      "step": 29557
    },
    {
      "epoch": 3.1357946106513896,
      "grad_norm": 0.44848931299085965,
      "learning_rate": 4.207621320066272e-05,
      "loss": 1.4866,
      "num_input_tokens_seen": 23255226752,
      "step": 29558
    },
    {
      "epoch": 3.135900700190961,
      "grad_norm": 0.6167625557431884,
      "learning_rate": 4.207570560760759e-05,
      "loss": 1.448,
      "num_input_tokens_seen": 23256013440,
      "step": 29559
    },
    {
      "epoch": 3.1360067897305326,
      "grad_norm": 0.47095923706418236,
      "learning_rate": 4.207519800135685e-05,
      "loss": 1.4593,
      "num_input_tokens_seen": 23256800224,
      "step": 29560
    },
    {
      "epoch": 3.136112879270104,
      "grad_norm": 0.45240749334300046,
      "learning_rate": 4.207469038191091e-05,
      "loss": 1.4035,
      "num_input_tokens_seen": 23257587024,
      "step": 29561
    },
    {
      "epoch": 3.1362189688096755,
      "grad_norm": 0.45245500802781835,
      "learning_rate": 4.207418274927014e-05,
      "loss": 1.5638,
      "num_input_tokens_seen": 23258373744,
      "step": 29562
    },
    {
      "epoch": 3.1363250583492466,
      "grad_norm": 0.39035164329942806,
      "learning_rate": 4.2073675103434956e-05,
      "loss": 1.2567,
      "num_input_tokens_seen": 23259160544,
      "step": 29563
    },
    {
      "epoch": 3.136431147888818,
      "grad_norm": 0.4874016079833388,
      "learning_rate": 4.207316744440573e-05,
      "loss": 1.5946,
      "num_input_tokens_seen": 23259947200,
      "step": 29564
    },
    {
      "epoch": 3.1365372374283895,
      "grad_norm": 0.4429862720720603,
      "learning_rate": 4.207265977218286e-05,
      "loss": 1.4657,
      "num_input_tokens_seen": 23260733984,
      "step": 29565
    },
    {
      "epoch": 3.136643326967961,
      "grad_norm": 0.5044357616749727,
      "learning_rate": 4.207215208676674e-05,
      "loss": 1.4956,
      "num_input_tokens_seen": 23261520736,
      "step": 29566
    },
    {
      "epoch": 3.1367494165075325,
      "grad_norm": 0.46002330202498937,
      "learning_rate": 4.207164438815776e-05,
      "loss": 1.5124,
      "num_input_tokens_seen": 23262307440,
      "step": 29567
    },
    {
      "epoch": 3.136855506047104,
      "grad_norm": 0.5751300400434306,
      "learning_rate": 4.207113667635631e-05,
      "loss": 1.4044,
      "num_input_tokens_seen": 23263094256,
      "step": 29568
    },
    {
      "epoch": 3.136961595586675,
      "grad_norm": 0.4487542705715601,
      "learning_rate": 4.2070628951362795e-05,
      "loss": 1.3815,
      "num_input_tokens_seen": 23263881104,
      "step": 29569
    },
    {
      "epoch": 3.1370676851262465,
      "grad_norm": 0.4775774814067672,
      "learning_rate": 4.207012121317759e-05,
      "loss": 1.5113,
      "num_input_tokens_seen": 23264667840,
      "step": 29570
    },
    {
      "epoch": 3.137173774665818,
      "grad_norm": 0.46568215431824944,
      "learning_rate": 4.2069613461801106e-05,
      "loss": 1.3988,
      "num_input_tokens_seen": 23265454544,
      "step": 29571
    },
    {
      "epoch": 3.1372798642053894,
      "grad_norm": 0.45998219983587063,
      "learning_rate": 4.206910569723372e-05,
      "loss": 1.6668,
      "num_input_tokens_seen": 23266241328,
      "step": 29572
    },
    {
      "epoch": 3.137385953744961,
      "grad_norm": 0.44125904067430666,
      "learning_rate": 4.206859791947584e-05,
      "loss": 1.4723,
      "num_input_tokens_seen": 23267028096,
      "step": 29573
    },
    {
      "epoch": 3.1374920432845324,
      "grad_norm": 0.41136979801145807,
      "learning_rate": 4.2068090128527835e-05,
      "loss": 1.478,
      "num_input_tokens_seen": 23267814832,
      "step": 29574
    },
    {
      "epoch": 3.1375981328241034,
      "grad_norm": 0.4146459637220431,
      "learning_rate": 4.206758232439012e-05,
      "loss": 1.4351,
      "num_input_tokens_seen": 23268601600,
      "step": 29575
    },
    {
      "epoch": 3.137704222363675,
      "grad_norm": 0.43341039138291987,
      "learning_rate": 4.206707450706308e-05,
      "loss": 1.4802,
      "num_input_tokens_seen": 23269388320,
      "step": 29576
    },
    {
      "epoch": 3.1378103119032463,
      "grad_norm": 0.4045884115255091,
      "learning_rate": 4.206656667654709e-05,
      "loss": 1.4987,
      "num_input_tokens_seen": 23270175088,
      "step": 29577
    },
    {
      "epoch": 3.137916401442818,
      "grad_norm": 0.43544905374138826,
      "learning_rate": 4.206605883284257e-05,
      "loss": 1.6726,
      "num_input_tokens_seen": 23270961856,
      "step": 29578
    },
    {
      "epoch": 3.1380224909823893,
      "grad_norm": 0.4259414204008195,
      "learning_rate": 4.2065550975949894e-05,
      "loss": 1.4347,
      "num_input_tokens_seen": 23271748592,
      "step": 29579
    },
    {
      "epoch": 3.1381285805219603,
      "grad_norm": 0.39452469702728554,
      "learning_rate": 4.206504310586947e-05,
      "loss": 1.5531,
      "num_input_tokens_seen": 23272535280,
      "step": 29580
    },
    {
      "epoch": 3.138234670061532,
      "grad_norm": 0.4268895086065038,
      "learning_rate": 4.2064535222601674e-05,
      "loss": 1.4813,
      "num_input_tokens_seen": 23273322128,
      "step": 29581
    },
    {
      "epoch": 3.1383407596011033,
      "grad_norm": 0.4378560634627714,
      "learning_rate": 4.2064027326146916e-05,
      "loss": 1.5292,
      "num_input_tokens_seen": 23274108832,
      "step": 29582
    },
    {
      "epoch": 3.1384468491406747,
      "grad_norm": 0.496617719386911,
      "learning_rate": 4.206351941650557e-05,
      "loss": 1.4316,
      "num_input_tokens_seen": 23274895632,
      "step": 29583
    },
    {
      "epoch": 3.138552938680246,
      "grad_norm": 0.3898428235789021,
      "learning_rate": 4.206301149367803e-05,
      "loss": 1.4471,
      "num_input_tokens_seen": 23275682320,
      "step": 29584
    },
    {
      "epoch": 3.1386590282198177,
      "grad_norm": 0.4172779529912498,
      "learning_rate": 4.2062503557664714e-05,
      "loss": 1.4299,
      "num_input_tokens_seen": 23276469072,
      "step": 29585
    },
    {
      "epoch": 3.138765117759389,
      "grad_norm": 0.418914160916207,
      "learning_rate": 4.206199560846598e-05,
      "loss": 1.4004,
      "num_input_tokens_seen": 23277255920,
      "step": 29586
    },
    {
      "epoch": 3.13887120729896,
      "grad_norm": 0.4175897089309167,
      "learning_rate": 4.206148764608224e-05,
      "loss": 1.4479,
      "num_input_tokens_seen": 23278042624,
      "step": 29587
    },
    {
      "epoch": 3.1389772968385317,
      "grad_norm": 0.3934146789946527,
      "learning_rate": 4.206097967051389e-05,
      "loss": 1.4753,
      "num_input_tokens_seen": 23278829376,
      "step": 29588
    },
    {
      "epoch": 3.139083386378103,
      "grad_norm": 0.4211756555024103,
      "learning_rate": 4.2060471681761304e-05,
      "loss": 1.4737,
      "num_input_tokens_seen": 23279616112,
      "step": 29589
    },
    {
      "epoch": 3.1391894759176746,
      "grad_norm": 0.487749702630204,
      "learning_rate": 4.2059963679824895e-05,
      "loss": 1.5056,
      "num_input_tokens_seen": 23280402768,
      "step": 29590
    },
    {
      "epoch": 3.139295565457246,
      "grad_norm": 0.521341853612137,
      "learning_rate": 4.2059455664705036e-05,
      "loss": 1.4884,
      "num_input_tokens_seen": 23281189536,
      "step": 29591
    },
    {
      "epoch": 3.139401654996817,
      "grad_norm": 0.42427121503593546,
      "learning_rate": 4.2058947636402145e-05,
      "loss": 1.4116,
      "num_input_tokens_seen": 23281976240,
      "step": 29592
    },
    {
      "epoch": 3.1395077445363886,
      "grad_norm": 0.41654470683453626,
      "learning_rate": 4.2058439594916596e-05,
      "loss": 1.3554,
      "num_input_tokens_seen": 23282763072,
      "step": 29593
    },
    {
      "epoch": 3.13961383407596,
      "grad_norm": 0.5009526103919532,
      "learning_rate": 4.205793154024878e-05,
      "loss": 1.7094,
      "num_input_tokens_seen": 23283549824,
      "step": 29594
    },
    {
      "epoch": 3.1397199236155315,
      "grad_norm": 0.45393978867583634,
      "learning_rate": 4.2057423472399095e-05,
      "loss": 1.5918,
      "num_input_tokens_seen": 23284336656,
      "step": 29595
    },
    {
      "epoch": 3.139826013155103,
      "grad_norm": 0.40427079707096275,
      "learning_rate": 4.2056915391367936e-05,
      "loss": 1.4625,
      "num_input_tokens_seen": 23285123536,
      "step": 29596
    },
    {
      "epoch": 3.1399321026946745,
      "grad_norm": 0.3661543119346742,
      "learning_rate": 4.20564072971557e-05,
      "loss": 1.3487,
      "num_input_tokens_seen": 23285910368,
      "step": 29597
    },
    {
      "epoch": 3.1400381922342455,
      "grad_norm": 0.48604840384298925,
      "learning_rate": 4.205589918976276e-05,
      "loss": 1.469,
      "num_input_tokens_seen": 23286697168,
      "step": 29598
    },
    {
      "epoch": 3.140144281773817,
      "grad_norm": 0.4933483040761102,
      "learning_rate": 4.205539106918953e-05,
      "loss": 1.5077,
      "num_input_tokens_seen": 23287483984,
      "step": 29599
    },
    {
      "epoch": 3.1402503713133885,
      "grad_norm": 0.3922544499345898,
      "learning_rate": 4.2054882935436394e-05,
      "loss": 1.4457,
      "num_input_tokens_seen": 23288270752,
      "step": 29600
    },
    {
      "epoch": 3.14035646085296,
      "grad_norm": 0.37864886873683073,
      "learning_rate": 4.2054374788503734e-05,
      "loss": 1.4554,
      "num_input_tokens_seen": 23289057664,
      "step": 29601
    },
    {
      "epoch": 3.1404625503925314,
      "grad_norm": 0.4425245172085423,
      "learning_rate": 4.205386662839197e-05,
      "loss": 1.5118,
      "num_input_tokens_seen": 23289844464,
      "step": 29602
    },
    {
      "epoch": 3.140568639932103,
      "grad_norm": 0.5107953828246482,
      "learning_rate": 4.205335845510146e-05,
      "loss": 1.6036,
      "num_input_tokens_seen": 23290631152,
      "step": 29603
    },
    {
      "epoch": 3.140674729471674,
      "grad_norm": 0.42985201995427075,
      "learning_rate": 4.205285026863263e-05,
      "loss": 1.423,
      "num_input_tokens_seen": 23291417968,
      "step": 29604
    },
    {
      "epoch": 3.1407808190112454,
      "grad_norm": 0.5043938046208425,
      "learning_rate": 4.205234206898586e-05,
      "loss": 1.3017,
      "num_input_tokens_seen": 23292204736,
      "step": 29605
    },
    {
      "epoch": 3.140886908550817,
      "grad_norm": 0.4285452938329002,
      "learning_rate": 4.205183385616153e-05,
      "loss": 1.439,
      "num_input_tokens_seen": 23292991600,
      "step": 29606
    },
    {
      "epoch": 3.1409929980903883,
      "grad_norm": 0.5905815253919704,
      "learning_rate": 4.2051325630160044e-05,
      "loss": 1.4439,
      "num_input_tokens_seen": 23293778352,
      "step": 29607
    },
    {
      "epoch": 3.14109908762996,
      "grad_norm": 0.40797799699441845,
      "learning_rate": 4.20508173909818e-05,
      "loss": 1.4673,
      "num_input_tokens_seen": 23294565184,
      "step": 29608
    },
    {
      "epoch": 3.141205177169531,
      "grad_norm": 0.5093743596811283,
      "learning_rate": 4.205030913862718e-05,
      "loss": 1.3244,
      "num_input_tokens_seen": 23295351968,
      "step": 29609
    },
    {
      "epoch": 3.1413112667091023,
      "grad_norm": 0.5339954361579548,
      "learning_rate": 4.2049800873096576e-05,
      "loss": 1.3773,
      "num_input_tokens_seen": 23296138768,
      "step": 29610
    },
    {
      "epoch": 3.141417356248674,
      "grad_norm": 0.4633998492803324,
      "learning_rate": 4.20492925943904e-05,
      "loss": 1.4615,
      "num_input_tokens_seen": 23296925488,
      "step": 29611
    },
    {
      "epoch": 3.1415234457882453,
      "grad_norm": 0.47107236079657966,
      "learning_rate": 4.204878430250903e-05,
      "loss": 1.4047,
      "num_input_tokens_seen": 23297712320,
      "step": 29612
    },
    {
      "epoch": 3.1416295353278167,
      "grad_norm": 0.46232592235846137,
      "learning_rate": 4.2048275997452846e-05,
      "loss": 1.5558,
      "num_input_tokens_seen": 23298499088,
      "step": 29613
    },
    {
      "epoch": 3.141735624867388,
      "grad_norm": 0.41209748550465086,
      "learning_rate": 4.204776767922226e-05,
      "loss": 1.5538,
      "num_input_tokens_seen": 23299285824,
      "step": 29614
    },
    {
      "epoch": 3.1418417144069597,
      "grad_norm": 0.44124266630030395,
      "learning_rate": 4.2047259347817655e-05,
      "loss": 1.5506,
      "num_input_tokens_seen": 23300072608,
      "step": 29615
    },
    {
      "epoch": 3.1419478039465307,
      "grad_norm": 0.4157718495416117,
      "learning_rate": 4.204675100323944e-05,
      "loss": 1.5407,
      "num_input_tokens_seen": 23300859392,
      "step": 29616
    },
    {
      "epoch": 3.142053893486102,
      "grad_norm": 0.4170177822661583,
      "learning_rate": 4.204624264548799e-05,
      "loss": 1.498,
      "num_input_tokens_seen": 23301646112,
      "step": 29617
    },
    {
      "epoch": 3.1421599830256737,
      "grad_norm": 0.4525708413512157,
      "learning_rate": 4.20457342745637e-05,
      "loss": 1.5886,
      "num_input_tokens_seen": 23302432768,
      "step": 29618
    },
    {
      "epoch": 3.142266072565245,
      "grad_norm": 0.4311967565891144,
      "learning_rate": 4.204522589046698e-05,
      "loss": 1.3577,
      "num_input_tokens_seen": 23303219520,
      "step": 29619
    },
    {
      "epoch": 3.1423721621048166,
      "grad_norm": 0.46722086632746535,
      "learning_rate": 4.2044717493198195e-05,
      "loss": 1.3957,
      "num_input_tokens_seen": 23304006352,
      "step": 29620
    },
    {
      "epoch": 3.1424782516443877,
      "grad_norm": 0.41512468572116523,
      "learning_rate": 4.204420908275776e-05,
      "loss": 1.4114,
      "num_input_tokens_seen": 23304793168,
      "step": 29621
    },
    {
      "epoch": 3.142584341183959,
      "grad_norm": 0.5124147319730737,
      "learning_rate": 4.2043700659146056e-05,
      "loss": 1.5361,
      "num_input_tokens_seen": 23305579856,
      "step": 29622
    },
    {
      "epoch": 3.1426904307235306,
      "grad_norm": 0.4884248072350978,
      "learning_rate": 4.204319222236348e-05,
      "loss": 1.4817,
      "num_input_tokens_seen": 23306366560,
      "step": 29623
    },
    {
      "epoch": 3.142796520263102,
      "grad_norm": 0.3974775139207863,
      "learning_rate": 4.204268377241043e-05,
      "loss": 1.412,
      "num_input_tokens_seen": 23307153296,
      "step": 29624
    },
    {
      "epoch": 3.1429026098026736,
      "grad_norm": 0.4325639747360119,
      "learning_rate": 4.204217530928729e-05,
      "loss": 1.3659,
      "num_input_tokens_seen": 23307940176,
      "step": 29625
    },
    {
      "epoch": 3.143008699342245,
      "grad_norm": 0.403166976617688,
      "learning_rate": 4.204166683299446e-05,
      "loss": 1.4678,
      "num_input_tokens_seen": 23308726992,
      "step": 29626
    },
    {
      "epoch": 3.143114788881816,
      "grad_norm": 0.44293152043397765,
      "learning_rate": 4.204115834353233e-05,
      "loss": 1.4579,
      "num_input_tokens_seen": 23309513760,
      "step": 29627
    },
    {
      "epoch": 3.1432208784213875,
      "grad_norm": 0.44634406126072906,
      "learning_rate": 4.204064984090129e-05,
      "loss": 1.48,
      "num_input_tokens_seen": 23310300528,
      "step": 29628
    },
    {
      "epoch": 3.143326967960959,
      "grad_norm": 0.4111302602403994,
      "learning_rate": 4.204014132510174e-05,
      "loss": 1.4591,
      "num_input_tokens_seen": 23311087280,
      "step": 29629
    },
    {
      "epoch": 3.1434330575005305,
      "grad_norm": 0.4015108643758621,
      "learning_rate": 4.2039632796134064e-05,
      "loss": 1.4603,
      "num_input_tokens_seen": 23311874064,
      "step": 29630
    },
    {
      "epoch": 3.143539147040102,
      "grad_norm": 0.44320997203724094,
      "learning_rate": 4.203912425399866e-05,
      "loss": 1.6159,
      "num_input_tokens_seen": 23312660800,
      "step": 29631
    },
    {
      "epoch": 3.1436452365796734,
      "grad_norm": 0.42892342349290347,
      "learning_rate": 4.2038615698695925e-05,
      "loss": 1.4907,
      "num_input_tokens_seen": 23313447616,
      "step": 29632
    },
    {
      "epoch": 3.1437513261192445,
      "grad_norm": 0.3915877730195964,
      "learning_rate": 4.2038107130226246e-05,
      "loss": 1.5008,
      "num_input_tokens_seen": 23314234544,
      "step": 29633
    },
    {
      "epoch": 3.143857415658816,
      "grad_norm": 0.4178723294008511,
      "learning_rate": 4.2037598548590016e-05,
      "loss": 1.4848,
      "num_input_tokens_seen": 23315021360,
      "step": 29634
    },
    {
      "epoch": 3.1439635051983874,
      "grad_norm": 0.3955215811394694,
      "learning_rate": 4.2037089953787634e-05,
      "loss": 1.4369,
      "num_input_tokens_seen": 23315808144,
      "step": 29635
    },
    {
      "epoch": 3.144069594737959,
      "grad_norm": 0.3726951622169958,
      "learning_rate": 4.203658134581948e-05,
      "loss": 1.4431,
      "num_input_tokens_seen": 23316594976,
      "step": 29636
    },
    {
      "epoch": 3.1441756842775304,
      "grad_norm": 0.6582239998012194,
      "learning_rate": 4.203607272468596e-05,
      "loss": 1.6535,
      "num_input_tokens_seen": 23317381728,
      "step": 29637
    },
    {
      "epoch": 3.144281773817102,
      "grad_norm": 0.4113358844756197,
      "learning_rate": 4.203556409038747e-05,
      "loss": 1.5221,
      "num_input_tokens_seen": 23318168464,
      "step": 29638
    },
    {
      "epoch": 3.144387863356673,
      "grad_norm": 0.4996374900571872,
      "learning_rate": 4.203505544292439e-05,
      "loss": 1.4423,
      "num_input_tokens_seen": 23318955312,
      "step": 29639
    },
    {
      "epoch": 3.1444939528962443,
      "grad_norm": 0.47142282551381914,
      "learning_rate": 4.203454678229712e-05,
      "loss": 1.4113,
      "num_input_tokens_seen": 23319742176,
      "step": 29640
    },
    {
      "epoch": 3.144600042435816,
      "grad_norm": 0.5410649945003496,
      "learning_rate": 4.203403810850605e-05,
      "loss": 1.3639,
      "num_input_tokens_seen": 23320528944,
      "step": 29641
    },
    {
      "epoch": 3.1447061319753873,
      "grad_norm": 0.42524364882175025,
      "learning_rate": 4.203352942155158e-05,
      "loss": 1.5139,
      "num_input_tokens_seen": 23321315712,
      "step": 29642
    },
    {
      "epoch": 3.1448122215149588,
      "grad_norm": 0.4450018525908776,
      "learning_rate": 4.203302072143409e-05,
      "loss": 1.5159,
      "num_input_tokens_seen": 23322102400,
      "step": 29643
    },
    {
      "epoch": 3.1449183110545302,
      "grad_norm": 0.44624639661884363,
      "learning_rate": 4.203251200815399e-05,
      "loss": 1.4847,
      "num_input_tokens_seen": 23322889264,
      "step": 29644
    },
    {
      "epoch": 3.1450244005941013,
      "grad_norm": 0.38516020993777683,
      "learning_rate": 4.2032003281711654e-05,
      "loss": 1.3948,
      "num_input_tokens_seen": 23323676096,
      "step": 29645
    },
    {
      "epoch": 3.1451304901336727,
      "grad_norm": 0.41705598470342126,
      "learning_rate": 4.20314945421075e-05,
      "loss": 1.3423,
      "num_input_tokens_seen": 23324462864,
      "step": 29646
    },
    {
      "epoch": 3.145236579673244,
      "grad_norm": 0.46569530966325784,
      "learning_rate": 4.203098578934189e-05,
      "loss": 1.5652,
      "num_input_tokens_seen": 23325249552,
      "step": 29647
    },
    {
      "epoch": 3.1453426692128157,
      "grad_norm": 0.42312956512392047,
      "learning_rate": 4.2030477023415244e-05,
      "loss": 1.5007,
      "num_input_tokens_seen": 23326036352,
      "step": 29648
    },
    {
      "epoch": 3.145448758752387,
      "grad_norm": 0.5589260559429935,
      "learning_rate": 4.202996824432794e-05,
      "loss": 1.4586,
      "num_input_tokens_seen": 23326823088,
      "step": 29649
    },
    {
      "epoch": 3.145554848291958,
      "grad_norm": 0.41600017241210174,
      "learning_rate": 4.2029459452080386e-05,
      "loss": 1.5009,
      "num_input_tokens_seen": 23327609792,
      "step": 29650
    },
    {
      "epoch": 3.1456609378315297,
      "grad_norm": 0.49318026997558356,
      "learning_rate": 4.202895064667296e-05,
      "loss": 1.5144,
      "num_input_tokens_seen": 23328396560,
      "step": 29651
    },
    {
      "epoch": 3.145767027371101,
      "grad_norm": 0.496033318855688,
      "learning_rate": 4.2028441828106055e-05,
      "loss": 1.5562,
      "num_input_tokens_seen": 23329183200,
      "step": 29652
    },
    {
      "epoch": 3.1458731169106726,
      "grad_norm": 0.44831962529836905,
      "learning_rate": 4.202793299638008e-05,
      "loss": 1.4601,
      "num_input_tokens_seen": 23329969984,
      "step": 29653
    },
    {
      "epoch": 3.145979206450244,
      "grad_norm": 0.5397747301099572,
      "learning_rate": 4.202742415149541e-05,
      "loss": 1.4274,
      "num_input_tokens_seen": 23330756736,
      "step": 29654
    },
    {
      "epoch": 3.1460852959898156,
      "grad_norm": 0.436123990628648,
      "learning_rate": 4.2026915293452454e-05,
      "loss": 1.6434,
      "num_input_tokens_seen": 23331543536,
      "step": 29655
    },
    {
      "epoch": 3.1461913855293866,
      "grad_norm": 0.40668833004317817,
      "learning_rate": 4.202640642225159e-05,
      "loss": 1.3708,
      "num_input_tokens_seen": 23332330272,
      "step": 29656
    },
    {
      "epoch": 3.146297475068958,
      "grad_norm": 0.5786486940626407,
      "learning_rate": 4.202589753789322e-05,
      "loss": 1.5565,
      "num_input_tokens_seen": 23333116992,
      "step": 29657
    },
    {
      "epoch": 3.1464035646085295,
      "grad_norm": 0.5260242948787599,
      "learning_rate": 4.202538864037774e-05,
      "loss": 1.5786,
      "num_input_tokens_seen": 23333903728,
      "step": 29658
    },
    {
      "epoch": 3.146509654148101,
      "grad_norm": 0.44787006217332864,
      "learning_rate": 4.2024879729705535e-05,
      "loss": 1.4745,
      "num_input_tokens_seen": 23334690480,
      "step": 29659
    },
    {
      "epoch": 3.1466157436876725,
      "grad_norm": 0.5803093464706671,
      "learning_rate": 4.2024370805877e-05,
      "loss": 1.3178,
      "num_input_tokens_seen": 23335477232,
      "step": 29660
    },
    {
      "epoch": 3.146721833227244,
      "grad_norm": 0.39364715687980045,
      "learning_rate": 4.202386186889253e-05,
      "loss": 1.3893,
      "num_input_tokens_seen": 23336264000,
      "step": 29661
    },
    {
      "epoch": 3.146827922766815,
      "grad_norm": 0.4750497004037266,
      "learning_rate": 4.202335291875253e-05,
      "loss": 1.4878,
      "num_input_tokens_seen": 23337050704,
      "step": 29662
    },
    {
      "epoch": 3.1469340123063865,
      "grad_norm": 0.5785835328004794,
      "learning_rate": 4.202284395545737e-05,
      "loss": 1.4699,
      "num_input_tokens_seen": 23337837440,
      "step": 29663
    },
    {
      "epoch": 3.147040101845958,
      "grad_norm": 0.4465285632933728,
      "learning_rate": 4.202233497900746e-05,
      "loss": 1.5055,
      "num_input_tokens_seen": 23338624176,
      "step": 29664
    },
    {
      "epoch": 3.1471461913855294,
      "grad_norm": 0.5386506130020678,
      "learning_rate": 4.2021825989403193e-05,
      "loss": 1.4241,
      "num_input_tokens_seen": 23339410928,
      "step": 29665
    },
    {
      "epoch": 3.147252280925101,
      "grad_norm": 0.45361784941121214,
      "learning_rate": 4.202131698664496e-05,
      "loss": 1.3813,
      "num_input_tokens_seen": 23340197648,
      "step": 29666
    },
    {
      "epoch": 3.1473583704646724,
      "grad_norm": 0.4596148145991117,
      "learning_rate": 4.2020807970733146e-05,
      "loss": 1.5758,
      "num_input_tokens_seen": 23340984432,
      "step": 29667
    },
    {
      "epoch": 3.1474644600042434,
      "grad_norm": 0.477694952622727,
      "learning_rate": 4.202029894166816e-05,
      "loss": 1.4005,
      "num_input_tokens_seen": 23341771200,
      "step": 29668
    },
    {
      "epoch": 3.147570549543815,
      "grad_norm": 0.47015593499526487,
      "learning_rate": 4.201978989945038e-05,
      "loss": 1.4113,
      "num_input_tokens_seen": 23342557984,
      "step": 29669
    },
    {
      "epoch": 3.1476766390833864,
      "grad_norm": 0.42830315517919454,
      "learning_rate": 4.20192808440802e-05,
      "loss": 1.5283,
      "num_input_tokens_seen": 23343344768,
      "step": 29670
    },
    {
      "epoch": 3.147782728622958,
      "grad_norm": 0.5827510774275578,
      "learning_rate": 4.201877177555802e-05,
      "loss": 1.4161,
      "num_input_tokens_seen": 23344131424,
      "step": 29671
    },
    {
      "epoch": 3.1478888181625293,
      "grad_norm": 0.4751031910846802,
      "learning_rate": 4.201826269388425e-05,
      "loss": 1.4787,
      "num_input_tokens_seen": 23344918240,
      "step": 29672
    },
    {
      "epoch": 3.1479949077021008,
      "grad_norm": 0.3912894123886362,
      "learning_rate": 4.201775359905925e-05,
      "loss": 1.3018,
      "num_input_tokens_seen": 23345705008,
      "step": 29673
    },
    {
      "epoch": 3.148100997241672,
      "grad_norm": 0.6967959280752463,
      "learning_rate": 4.2017244491083426e-05,
      "loss": 1.4626,
      "num_input_tokens_seen": 23346491840,
      "step": 29674
    },
    {
      "epoch": 3.1482070867812433,
      "grad_norm": 0.4430381205246519,
      "learning_rate": 4.201673536995718e-05,
      "loss": 1.5616,
      "num_input_tokens_seen": 23347278496,
      "step": 29675
    },
    {
      "epoch": 3.1483131763208148,
      "grad_norm": 0.8506509184835558,
      "learning_rate": 4.201622623568091e-05,
      "loss": 1.4259,
      "num_input_tokens_seen": 23348065296,
      "step": 29676
    },
    {
      "epoch": 3.1484192658603862,
      "grad_norm": 0.48744419178484377,
      "learning_rate": 4.201571708825499e-05,
      "loss": 1.4416,
      "num_input_tokens_seen": 23348852048,
      "step": 29677
    },
    {
      "epoch": 3.1485253553999577,
      "grad_norm": 0.5554324889420064,
      "learning_rate": 4.2015207927679825e-05,
      "loss": 1.3562,
      "num_input_tokens_seen": 23349638816,
      "step": 29678
    },
    {
      "epoch": 3.1486314449395287,
      "grad_norm": 0.529051177783182,
      "learning_rate": 4.201469875395581e-05,
      "loss": 1.3887,
      "num_input_tokens_seen": 23350425616,
      "step": 29679
    },
    {
      "epoch": 3.1487375344791,
      "grad_norm": 0.4284364311186583,
      "learning_rate": 4.201418956708333e-05,
      "loss": 1.475,
      "num_input_tokens_seen": 23351212352,
      "step": 29680
    },
    {
      "epoch": 3.1488436240186717,
      "grad_norm": 0.4416765746160287,
      "learning_rate": 4.201368036706278e-05,
      "loss": 1.3581,
      "num_input_tokens_seen": 23351999232,
      "step": 29681
    },
    {
      "epoch": 3.148949713558243,
      "grad_norm": 0.5399852201654114,
      "learning_rate": 4.201317115389456e-05,
      "loss": 1.4057,
      "num_input_tokens_seen": 23352785952,
      "step": 29682
    },
    {
      "epoch": 3.1490558030978146,
      "grad_norm": 0.46516752146075996,
      "learning_rate": 4.2012661927579064e-05,
      "loss": 1.5385,
      "num_input_tokens_seen": 23353572704,
      "step": 29683
    },
    {
      "epoch": 3.149161892637386,
      "grad_norm": 0.5415105681384075,
      "learning_rate": 4.201215268811668e-05,
      "loss": 1.4543,
      "num_input_tokens_seen": 23354359520,
      "step": 29684
    },
    {
      "epoch": 3.1492679821769576,
      "grad_norm": 0.5086260793988504,
      "learning_rate": 4.201164343550781e-05,
      "loss": 1.533,
      "num_input_tokens_seen": 23355146240,
      "step": 29685
    },
    {
      "epoch": 3.1493740717165286,
      "grad_norm": 0.3957325877147417,
      "learning_rate": 4.201113416975283e-05,
      "loss": 1.4398,
      "num_input_tokens_seen": 23355933008,
      "step": 29686
    },
    {
      "epoch": 3.1494801612561,
      "grad_norm": 0.4761394382745919,
      "learning_rate": 4.201062489085214e-05,
      "loss": 1.5068,
      "num_input_tokens_seen": 23356719808,
      "step": 29687
    },
    {
      "epoch": 3.1495862507956716,
      "grad_norm": 0.43874537452038825,
      "learning_rate": 4.2010115598806155e-05,
      "loss": 1.4475,
      "num_input_tokens_seen": 23357506560,
      "step": 29688
    },
    {
      "epoch": 3.149692340335243,
      "grad_norm": 0.49760988550950686,
      "learning_rate": 4.2009606293615245e-05,
      "loss": 1.4145,
      "num_input_tokens_seen": 23358293424,
      "step": 29689
    },
    {
      "epoch": 3.1497984298748145,
      "grad_norm": 0.3939581191037704,
      "learning_rate": 4.2009096975279814e-05,
      "loss": 1.4295,
      "num_input_tokens_seen": 23359080240,
      "step": 29690
    },
    {
      "epoch": 3.1499045194143855,
      "grad_norm": 0.44836107447421947,
      "learning_rate": 4.200858764380025e-05,
      "loss": 1.4937,
      "num_input_tokens_seen": 23359867024,
      "step": 29691
    },
    {
      "epoch": 3.150010608953957,
      "grad_norm": 0.44639469872351656,
      "learning_rate": 4.2008078299176945e-05,
      "loss": 1.459,
      "num_input_tokens_seen": 23360653760,
      "step": 29692
    },
    {
      "epoch": 3.1501166984935285,
      "grad_norm": 0.4270934512792078,
      "learning_rate": 4.200756894141029e-05,
      "loss": 1.395,
      "num_input_tokens_seen": 23361440624,
      "step": 29693
    },
    {
      "epoch": 3.1502227880331,
      "grad_norm": 0.5116443502332466,
      "learning_rate": 4.200705957050069e-05,
      "loss": 1.5987,
      "num_input_tokens_seen": 23362227312,
      "step": 29694
    },
    {
      "epoch": 3.1503288775726714,
      "grad_norm": 0.43203027430378355,
      "learning_rate": 4.200655018644854e-05,
      "loss": 1.5008,
      "num_input_tokens_seen": 23363014048,
      "step": 29695
    },
    {
      "epoch": 3.150434967112243,
      "grad_norm": 0.5507155735799849,
      "learning_rate": 4.200604078925423e-05,
      "loss": 1.4717,
      "num_input_tokens_seen": 23363800768,
      "step": 29696
    },
    {
      "epoch": 3.150541056651814,
      "grad_norm": 0.42005072970864754,
      "learning_rate": 4.200553137891814e-05,
      "loss": 1.4723,
      "num_input_tokens_seen": 23364587536,
      "step": 29697
    },
    {
      "epoch": 3.1506471461913854,
      "grad_norm": 0.49514708313886935,
      "learning_rate": 4.2005021955440675e-05,
      "loss": 1.5045,
      "num_input_tokens_seen": 23365374352,
      "step": 29698
    },
    {
      "epoch": 3.150753235730957,
      "grad_norm": 0.5649719502228466,
      "learning_rate": 4.200451251882223e-05,
      "loss": 1.4467,
      "num_input_tokens_seen": 23366161008,
      "step": 29699
    },
    {
      "epoch": 3.1508593252705284,
      "grad_norm": 0.4484917383602787,
      "learning_rate": 4.2004003069063205e-05,
      "loss": 1.4643,
      "num_input_tokens_seen": 23366947824,
      "step": 29700
    },
    {
      "epoch": 3.1509654148101,
      "grad_norm": 0.5498386804715597,
      "learning_rate": 4.200349360616397e-05,
      "loss": 1.3864,
      "num_input_tokens_seen": 23367734672,
      "step": 29701
    },
    {
      "epoch": 3.1510715043496713,
      "grad_norm": 0.45532242444572635,
      "learning_rate": 4.200298413012494e-05,
      "loss": 1.3737,
      "num_input_tokens_seen": 23368521424,
      "step": 29702
    },
    {
      "epoch": 3.1511775938892423,
      "grad_norm": 0.4157399609435614,
      "learning_rate": 4.200247464094651e-05,
      "loss": 1.3724,
      "num_input_tokens_seen": 23369308160,
      "step": 29703
    },
    {
      "epoch": 3.151283683428814,
      "grad_norm": 0.5766716744894063,
      "learning_rate": 4.2001965138629064e-05,
      "loss": 1.4936,
      "num_input_tokens_seen": 23370094976,
      "step": 29704
    },
    {
      "epoch": 3.1513897729683853,
      "grad_norm": 0.5221993482299397,
      "learning_rate": 4.200145562317299e-05,
      "loss": 1.4899,
      "num_input_tokens_seen": 23370881808,
      "step": 29705
    },
    {
      "epoch": 3.1514958625079568,
      "grad_norm": 0.4192641827355102,
      "learning_rate": 4.2000946094578695e-05,
      "loss": 1.4522,
      "num_input_tokens_seen": 23371668592,
      "step": 29706
    },
    {
      "epoch": 3.1516019520475282,
      "grad_norm": 0.7068220569754834,
      "learning_rate": 4.200043655284657e-05,
      "loss": 1.5759,
      "num_input_tokens_seen": 23372455360,
      "step": 29707
    },
    {
      "epoch": 3.1517080415870997,
      "grad_norm": 0.48514581822821995,
      "learning_rate": 4.1999926997977e-05,
      "loss": 1.3871,
      "num_input_tokens_seen": 23373242208,
      "step": 29708
    },
    {
      "epoch": 3.1518141311266707,
      "grad_norm": 0.5928533216410634,
      "learning_rate": 4.1999417429970387e-05,
      "loss": 1.4653,
      "num_input_tokens_seen": 23374028880,
      "step": 29709
    },
    {
      "epoch": 3.1519202206662422,
      "grad_norm": 0.6223018383537424,
      "learning_rate": 4.199890784882713e-05,
      "loss": 1.2898,
      "num_input_tokens_seen": 23374815600,
      "step": 29710
    },
    {
      "epoch": 3.1520263102058137,
      "grad_norm": 0.4810479589872137,
      "learning_rate": 4.199839825454761e-05,
      "loss": 1.5958,
      "num_input_tokens_seen": 23375602272,
      "step": 29711
    },
    {
      "epoch": 3.152132399745385,
      "grad_norm": 0.5833399080143618,
      "learning_rate": 4.199788864713223e-05,
      "loss": 1.4463,
      "num_input_tokens_seen": 23376389088,
      "step": 29712
    },
    {
      "epoch": 3.1522384892849566,
      "grad_norm": 0.7266131465550973,
      "learning_rate": 4.199737902658137e-05,
      "loss": 1.5378,
      "num_input_tokens_seen": 23377175856,
      "step": 29713
    },
    {
      "epoch": 3.152344578824528,
      "grad_norm": 0.5591075943582738,
      "learning_rate": 4.1996869392895446e-05,
      "loss": 1.5501,
      "num_input_tokens_seen": 23377962512,
      "step": 29714
    },
    {
      "epoch": 3.152450668364099,
      "grad_norm": 0.8310474899587255,
      "learning_rate": 4.1996359746074844e-05,
      "loss": 1.5325,
      "num_input_tokens_seen": 23378749296,
      "step": 29715
    },
    {
      "epoch": 3.1525567579036706,
      "grad_norm": 0.4899701450256917,
      "learning_rate": 4.199585008611994e-05,
      "loss": 1.5353,
      "num_input_tokens_seen": 23379536112,
      "step": 29716
    },
    {
      "epoch": 3.152662847443242,
      "grad_norm": 0.6594821785493895,
      "learning_rate": 4.1995340413031145e-05,
      "loss": 1.4291,
      "num_input_tokens_seen": 23380322976,
      "step": 29717
    },
    {
      "epoch": 3.1527689369828136,
      "grad_norm": 0.43934547399504026,
      "learning_rate": 4.1994830726808853e-05,
      "loss": 1.4653,
      "num_input_tokens_seen": 23381109664,
      "step": 29718
    },
    {
      "epoch": 3.152875026522385,
      "grad_norm": 0.4282016444256684,
      "learning_rate": 4.199432102745345e-05,
      "loss": 1.5198,
      "num_input_tokens_seen": 23381896400,
      "step": 29719
    },
    {
      "epoch": 3.152981116061956,
      "grad_norm": 0.44160000657721116,
      "learning_rate": 4.199381131496535e-05,
      "loss": 1.5336,
      "num_input_tokens_seen": 23382683152,
      "step": 29720
    },
    {
      "epoch": 3.1530872056015276,
      "grad_norm": 0.5054017936754135,
      "learning_rate": 4.199330158934491e-05,
      "loss": 1.4304,
      "num_input_tokens_seen": 23383469936,
      "step": 29721
    },
    {
      "epoch": 3.153193295141099,
      "grad_norm": 0.4341388443497373,
      "learning_rate": 4.1992791850592563e-05,
      "loss": 1.4763,
      "num_input_tokens_seen": 23384256672,
      "step": 29722
    },
    {
      "epoch": 3.1532993846806705,
      "grad_norm": 0.5075633675414681,
      "learning_rate": 4.199228209870867e-05,
      "loss": 1.3668,
      "num_input_tokens_seen": 23385043408,
      "step": 29723
    },
    {
      "epoch": 3.153405474220242,
      "grad_norm": 0.48829673211386193,
      "learning_rate": 4.1991772333693654e-05,
      "loss": 1.4707,
      "num_input_tokens_seen": 23385830096,
      "step": 29724
    },
    {
      "epoch": 3.1535115637598135,
      "grad_norm": 0.3691745313625239,
      "learning_rate": 4.1991262555547885e-05,
      "loss": 1.4149,
      "num_input_tokens_seen": 23386616880,
      "step": 29725
    },
    {
      "epoch": 3.1536176532993845,
      "grad_norm": 0.4390104253763064,
      "learning_rate": 4.199075276427177e-05,
      "loss": 1.4026,
      "num_input_tokens_seen": 23387403536,
      "step": 29726
    },
    {
      "epoch": 3.153723742838956,
      "grad_norm": 0.418425948818711,
      "learning_rate": 4.19902429598657e-05,
      "loss": 1.5539,
      "num_input_tokens_seen": 23388190288,
      "step": 29727
    },
    {
      "epoch": 3.1538298323785274,
      "grad_norm": 0.46498271081495623,
      "learning_rate": 4.198973314233007e-05,
      "loss": 1.4871,
      "num_input_tokens_seen": 23388977040,
      "step": 29728
    },
    {
      "epoch": 3.153935921918099,
      "grad_norm": 0.40918292273306345,
      "learning_rate": 4.198922331166527e-05,
      "loss": 1.4482,
      "num_input_tokens_seen": 23389763776,
      "step": 29729
    },
    {
      "epoch": 3.1540420114576704,
      "grad_norm": 0.6692073163657928,
      "learning_rate": 4.19887134678717e-05,
      "loss": 1.5258,
      "num_input_tokens_seen": 23390550528,
      "step": 29730
    },
    {
      "epoch": 3.154148100997242,
      "grad_norm": 0.37703175822535245,
      "learning_rate": 4.198820361094975e-05,
      "loss": 1.5218,
      "num_input_tokens_seen": 23391337232,
      "step": 29731
    },
    {
      "epoch": 3.154254190536813,
      "grad_norm": 0.5381927743982893,
      "learning_rate": 4.198769374089981e-05,
      "loss": 1.5294,
      "num_input_tokens_seen": 23392123968,
      "step": 29732
    },
    {
      "epoch": 3.1543602800763844,
      "grad_norm": 0.442238349077979,
      "learning_rate": 4.1987183857722276e-05,
      "loss": 1.4855,
      "num_input_tokens_seen": 23392910624,
      "step": 29733
    },
    {
      "epoch": 3.154466369615956,
      "grad_norm": 0.3984416258747419,
      "learning_rate": 4.198667396141755e-05,
      "loss": 1.3217,
      "num_input_tokens_seen": 23393697360,
      "step": 29734
    },
    {
      "epoch": 3.1545724591555273,
      "grad_norm": 0.4546298365411377,
      "learning_rate": 4.198616405198603e-05,
      "loss": 1.4598,
      "num_input_tokens_seen": 23394484144,
      "step": 29735
    },
    {
      "epoch": 3.154678548695099,
      "grad_norm": 0.41001330070778536,
      "learning_rate": 4.1985654129428086e-05,
      "loss": 1.5317,
      "num_input_tokens_seen": 23395270880,
      "step": 29736
    },
    {
      "epoch": 3.1547846382346703,
      "grad_norm": 0.42290511882180143,
      "learning_rate": 4.198514419374414e-05,
      "loss": 1.3683,
      "num_input_tokens_seen": 23396057568,
      "step": 29737
    },
    {
      "epoch": 3.1548907277742413,
      "grad_norm": 0.4261623923343406,
      "learning_rate": 4.198463424493456e-05,
      "loss": 1.5116,
      "num_input_tokens_seen": 23396844368,
      "step": 29738
    },
    {
      "epoch": 3.1549968173138128,
      "grad_norm": 0.3931196021863638,
      "learning_rate": 4.198412428299977e-05,
      "loss": 1.4018,
      "num_input_tokens_seen": 23397631136,
      "step": 29739
    },
    {
      "epoch": 3.1551029068533842,
      "grad_norm": 0.3986243500113351,
      "learning_rate": 4.1983614307940136e-05,
      "loss": 1.4418,
      "num_input_tokens_seen": 23398417808,
      "step": 29740
    },
    {
      "epoch": 3.1552089963929557,
      "grad_norm": 0.37723357742195157,
      "learning_rate": 4.1983104319756055e-05,
      "loss": 1.434,
      "num_input_tokens_seen": 23399204576,
      "step": 29741
    },
    {
      "epoch": 3.155315085932527,
      "grad_norm": 0.4328367463465544,
      "learning_rate": 4.198259431844794e-05,
      "loss": 1.4556,
      "num_input_tokens_seen": 23399991360,
      "step": 29742
    },
    {
      "epoch": 3.1554211754720987,
      "grad_norm": 0.49183560428257106,
      "learning_rate": 4.198208430401617e-05,
      "loss": 1.4601,
      "num_input_tokens_seen": 23400778096,
      "step": 29743
    },
    {
      "epoch": 3.1555272650116697,
      "grad_norm": 0.4091185962288086,
      "learning_rate": 4.1981574276461146e-05,
      "loss": 1.569,
      "num_input_tokens_seen": 23401564960,
      "step": 29744
    },
    {
      "epoch": 3.155633354551241,
      "grad_norm": 0.504265623283317,
      "learning_rate": 4.198106423578326e-05,
      "loss": 1.5098,
      "num_input_tokens_seen": 23402351696,
      "step": 29745
    },
    {
      "epoch": 3.1557394440908126,
      "grad_norm": 0.36959893282637396,
      "learning_rate": 4.1980554181982904e-05,
      "loss": 1.334,
      "num_input_tokens_seen": 23403138512,
      "step": 29746
    },
    {
      "epoch": 3.155845533630384,
      "grad_norm": 0.44397996112267235,
      "learning_rate": 4.198004411506048e-05,
      "loss": 1.533,
      "num_input_tokens_seen": 23403925280,
      "step": 29747
    },
    {
      "epoch": 3.1559516231699556,
      "grad_norm": 0.4431554436074514,
      "learning_rate": 4.197953403501637e-05,
      "loss": 1.5695,
      "num_input_tokens_seen": 23404712032,
      "step": 29748
    },
    {
      "epoch": 3.1560577127095266,
      "grad_norm": 0.3843545214879998,
      "learning_rate": 4.1979023941850976e-05,
      "loss": 1.4005,
      "num_input_tokens_seen": 23405498800,
      "step": 29749
    },
    {
      "epoch": 3.156163802249098,
      "grad_norm": 0.49609387020645185,
      "learning_rate": 4.197851383556469e-05,
      "loss": 1.4835,
      "num_input_tokens_seen": 23406285584,
      "step": 29750
    },
    {
      "epoch": 3.1562698917886696,
      "grad_norm": 0.36254127590215246,
      "learning_rate": 4.1978003716157905e-05,
      "loss": 1.3842,
      "num_input_tokens_seen": 23407072416,
      "step": 29751
    },
    {
      "epoch": 3.156375981328241,
      "grad_norm": 0.40091798220448327,
      "learning_rate": 4.197749358363102e-05,
      "loss": 1.4713,
      "num_input_tokens_seen": 23407859264,
      "step": 29752
    },
    {
      "epoch": 3.1564820708678125,
      "grad_norm": 0.5365274254936151,
      "learning_rate": 4.197698343798442e-05,
      "loss": 1.4433,
      "num_input_tokens_seen": 23408646112,
      "step": 29753
    },
    {
      "epoch": 3.156588160407384,
      "grad_norm": 0.3887042391163538,
      "learning_rate": 4.1976473279218516e-05,
      "loss": 1.4471,
      "num_input_tokens_seen": 23409432848,
      "step": 29754
    },
    {
      "epoch": 3.156694249946955,
      "grad_norm": 0.4706136577173176,
      "learning_rate": 4.197596310733368e-05,
      "loss": 1.3714,
      "num_input_tokens_seen": 23410219632,
      "step": 29755
    },
    {
      "epoch": 3.1568003394865265,
      "grad_norm": 0.4161584127381087,
      "learning_rate": 4.197545292233033e-05,
      "loss": 1.5372,
      "num_input_tokens_seen": 23411006304,
      "step": 29756
    },
    {
      "epoch": 3.156906429026098,
      "grad_norm": 0.4586619401218108,
      "learning_rate": 4.197494272420884e-05,
      "loss": 1.4,
      "num_input_tokens_seen": 23411792992,
      "step": 29757
    },
    {
      "epoch": 3.1570125185656694,
      "grad_norm": 0.3954316101917115,
      "learning_rate": 4.197443251296961e-05,
      "loss": 1.4918,
      "num_input_tokens_seen": 23412579792,
      "step": 29758
    },
    {
      "epoch": 3.157118608105241,
      "grad_norm": 0.49612202012746515,
      "learning_rate": 4.197392228861304e-05,
      "loss": 1.3711,
      "num_input_tokens_seen": 23413366528,
      "step": 29759
    },
    {
      "epoch": 3.1572246976448124,
      "grad_norm": 0.41024281683333946,
      "learning_rate": 4.197341205113952e-05,
      "loss": 1.4254,
      "num_input_tokens_seen": 23414153248,
      "step": 29760
    },
    {
      "epoch": 3.1573307871843834,
      "grad_norm": 0.4189308743448224,
      "learning_rate": 4.197290180054945e-05,
      "loss": 1.4833,
      "num_input_tokens_seen": 23414939952,
      "step": 29761
    },
    {
      "epoch": 3.157436876723955,
      "grad_norm": 0.41469603971313257,
      "learning_rate": 4.1972391536843214e-05,
      "loss": 1.5319,
      "num_input_tokens_seen": 23415726800,
      "step": 29762
    },
    {
      "epoch": 3.1575429662635264,
      "grad_norm": 0.4358444978337068,
      "learning_rate": 4.197188126002122e-05,
      "loss": 1.513,
      "num_input_tokens_seen": 23416513632,
      "step": 29763
    },
    {
      "epoch": 3.157649055803098,
      "grad_norm": 0.3965927416098702,
      "learning_rate": 4.197137097008384e-05,
      "loss": 1.4328,
      "num_input_tokens_seen": 23417300400,
      "step": 29764
    },
    {
      "epoch": 3.1577551453426693,
      "grad_norm": 0.39891752015039483,
      "learning_rate": 4.197086066703149e-05,
      "loss": 1.4656,
      "num_input_tokens_seen": 23418087152,
      "step": 29765
    },
    {
      "epoch": 3.157861234882241,
      "grad_norm": 0.40039641940229215,
      "learning_rate": 4.1970350350864564e-05,
      "loss": 1.5014,
      "num_input_tokens_seen": 23418873856,
      "step": 29766
    },
    {
      "epoch": 3.157967324421812,
      "grad_norm": 0.39178952768700304,
      "learning_rate": 4.196984002158344e-05,
      "loss": 1.5006,
      "num_input_tokens_seen": 23419660608,
      "step": 29767
    },
    {
      "epoch": 3.1580734139613833,
      "grad_norm": 0.38655677549228784,
      "learning_rate": 4.196932967918852e-05,
      "loss": 1.4161,
      "num_input_tokens_seen": 23420447296,
      "step": 29768
    },
    {
      "epoch": 3.1581795035009548,
      "grad_norm": 0.42892466485268893,
      "learning_rate": 4.1968819323680206e-05,
      "loss": 1.4261,
      "num_input_tokens_seen": 23421234144,
      "step": 29769
    },
    {
      "epoch": 3.1582855930405263,
      "grad_norm": 0.45166839179936946,
      "learning_rate": 4.1968308955058885e-05,
      "loss": 1.486,
      "num_input_tokens_seen": 23422020912,
      "step": 29770
    },
    {
      "epoch": 3.1583916825800977,
      "grad_norm": 0.5113096920966976,
      "learning_rate": 4.196779857332496e-05,
      "loss": 1.4512,
      "num_input_tokens_seen": 23422807760,
      "step": 29771
    },
    {
      "epoch": 3.158497772119669,
      "grad_norm": 0.4325237250416838,
      "learning_rate": 4.19672881784788e-05,
      "loss": 1.4494,
      "num_input_tokens_seen": 23423594560,
      "step": 29772
    },
    {
      "epoch": 3.1586038616592402,
      "grad_norm": 0.43676360502535144,
      "learning_rate": 4.1966777770520823e-05,
      "loss": 1.5045,
      "num_input_tokens_seen": 23424381392,
      "step": 29773
    },
    {
      "epoch": 3.1587099511988117,
      "grad_norm": 0.49586385086437906,
      "learning_rate": 4.1966267349451426e-05,
      "loss": 1.5613,
      "num_input_tokens_seen": 23425168128,
      "step": 29774
    },
    {
      "epoch": 3.158816040738383,
      "grad_norm": 0.46721049890079214,
      "learning_rate": 4.1965756915270996e-05,
      "loss": 1.4474,
      "num_input_tokens_seen": 23425954848,
      "step": 29775
    },
    {
      "epoch": 3.1589221302779547,
      "grad_norm": 0.42313746785644507,
      "learning_rate": 4.1965246467979925e-05,
      "loss": 1.36,
      "num_input_tokens_seen": 23426741504,
      "step": 29776
    },
    {
      "epoch": 3.159028219817526,
      "grad_norm": 0.40100758868453185,
      "learning_rate": 4.196473600757861e-05,
      "loss": 1.4942,
      "num_input_tokens_seen": 23427528208,
      "step": 29777
    },
    {
      "epoch": 3.159134309357097,
      "grad_norm": 0.42575128833146514,
      "learning_rate": 4.1964225534067435e-05,
      "loss": 1.4863,
      "num_input_tokens_seen": 23428314944,
      "step": 29778
    },
    {
      "epoch": 3.1592403988966686,
      "grad_norm": 0.4199340035212714,
      "learning_rate": 4.1963715047446815e-05,
      "loss": 1.4584,
      "num_input_tokens_seen": 23429101744,
      "step": 29779
    },
    {
      "epoch": 3.15934648843624,
      "grad_norm": 0.4441293025542235,
      "learning_rate": 4.196320454771713e-05,
      "loss": 1.4451,
      "num_input_tokens_seen": 23429888512,
      "step": 29780
    },
    {
      "epoch": 3.1594525779758116,
      "grad_norm": 0.4102795551842501,
      "learning_rate": 4.196269403487878e-05,
      "loss": 1.4475,
      "num_input_tokens_seen": 23430675312,
      "step": 29781
    },
    {
      "epoch": 3.159558667515383,
      "grad_norm": 0.4742198833770713,
      "learning_rate": 4.196218350893215e-05,
      "loss": 1.5707,
      "num_input_tokens_seen": 23431462048,
      "step": 29782
    },
    {
      "epoch": 3.1596647570549545,
      "grad_norm": 0.4832665294042788,
      "learning_rate": 4.196167296987765e-05,
      "loss": 1.6378,
      "num_input_tokens_seen": 23432248896,
      "step": 29783
    },
    {
      "epoch": 3.159770846594526,
      "grad_norm": 0.42774315010125186,
      "learning_rate": 4.1961162417715663e-05,
      "loss": 1.3176,
      "num_input_tokens_seen": 23433035600,
      "step": 29784
    },
    {
      "epoch": 3.159876936134097,
      "grad_norm": 0.49144239568666875,
      "learning_rate": 4.19606518524466e-05,
      "loss": 1.4932,
      "num_input_tokens_seen": 23433822480,
      "step": 29785
    },
    {
      "epoch": 3.1599830256736685,
      "grad_norm": 0.42846606700027007,
      "learning_rate": 4.196014127407083e-05,
      "loss": 1.4978,
      "num_input_tokens_seen": 23434609152,
      "step": 29786
    },
    {
      "epoch": 3.16008911521324,
      "grad_norm": 0.523399727058769,
      "learning_rate": 4.195963068258876e-05,
      "loss": 1.4711,
      "num_input_tokens_seen": 23435395920,
      "step": 29787
    },
    {
      "epoch": 3.1601952047528115,
      "grad_norm": 0.44362809266440845,
      "learning_rate": 4.195912007800079e-05,
      "loss": 1.5475,
      "num_input_tokens_seen": 23436182624,
      "step": 29788
    },
    {
      "epoch": 3.160301294292383,
      "grad_norm": 0.4559324406649442,
      "learning_rate": 4.195860946030731e-05,
      "loss": 1.519,
      "num_input_tokens_seen": 23436969488,
      "step": 29789
    },
    {
      "epoch": 3.160407383831954,
      "grad_norm": 0.525803064774365,
      "learning_rate": 4.1958098829508705e-05,
      "loss": 1.49,
      "num_input_tokens_seen": 23437756224,
      "step": 29790
    },
    {
      "epoch": 3.1605134733715254,
      "grad_norm": 0.40596923257031525,
      "learning_rate": 4.195758818560539e-05,
      "loss": 1.4752,
      "num_input_tokens_seen": 23438543024,
      "step": 29791
    },
    {
      "epoch": 3.160619562911097,
      "grad_norm": 0.45041443108318885,
      "learning_rate": 4.1957077528597743e-05,
      "loss": 1.2871,
      "num_input_tokens_seen": 23439329776,
      "step": 29792
    },
    {
      "epoch": 3.1607256524506684,
      "grad_norm": 0.4367008874790616,
      "learning_rate": 4.1956566858486165e-05,
      "loss": 1.4557,
      "num_input_tokens_seen": 23440116576,
      "step": 29793
    },
    {
      "epoch": 3.16083174199024,
      "grad_norm": 0.4671441008231053,
      "learning_rate": 4.1956056175271055e-05,
      "loss": 1.3671,
      "num_input_tokens_seen": 23440903376,
      "step": 29794
    },
    {
      "epoch": 3.1609378315298113,
      "grad_norm": 0.482422007053764,
      "learning_rate": 4.195554547895279e-05,
      "loss": 1.4889,
      "num_input_tokens_seen": 23441690192,
      "step": 29795
    },
    {
      "epoch": 3.1610439210693824,
      "grad_norm": 0.4094544256687605,
      "learning_rate": 4.1955034769531784e-05,
      "loss": 1.4937,
      "num_input_tokens_seen": 23442476976,
      "step": 29796
    },
    {
      "epoch": 3.161150010608954,
      "grad_norm": 0.4863597988794274,
      "learning_rate": 4.195452404700842e-05,
      "loss": 1.4155,
      "num_input_tokens_seen": 23443263712,
      "step": 29797
    },
    {
      "epoch": 3.1612561001485253,
      "grad_norm": 0.4221082708253454,
      "learning_rate": 4.195401331138311e-05,
      "loss": 1.4459,
      "num_input_tokens_seen": 23444050400,
      "step": 29798
    },
    {
      "epoch": 3.161362189688097,
      "grad_norm": 0.3833476511615454,
      "learning_rate": 4.195350256265623e-05,
      "loss": 1.4434,
      "num_input_tokens_seen": 23444837136,
      "step": 29799
    },
    {
      "epoch": 3.1614682792276683,
      "grad_norm": 0.45670968295447334,
      "learning_rate": 4.195299180082817e-05,
      "loss": 1.4201,
      "num_input_tokens_seen": 23445623936,
      "step": 29800
    },
    {
      "epoch": 3.1615743687672397,
      "grad_norm": 0.34685248270528035,
      "learning_rate": 4.195248102589935e-05,
      "loss": 1.2261,
      "num_input_tokens_seen": 23446410768,
      "step": 29801
    },
    {
      "epoch": 3.1616804583068108,
      "grad_norm": 0.46593071071935716,
      "learning_rate": 4.195197023787014e-05,
      "loss": 1.5588,
      "num_input_tokens_seen": 23447197552,
      "step": 29802
    },
    {
      "epoch": 3.1617865478463822,
      "grad_norm": 0.45296050548832406,
      "learning_rate": 4.195145943674095e-05,
      "loss": 1.507,
      "num_input_tokens_seen": 23447984320,
      "step": 29803
    },
    {
      "epoch": 3.1618926373859537,
      "grad_norm": 0.4396753147749192,
      "learning_rate": 4.195094862251217e-05,
      "loss": 1.5187,
      "num_input_tokens_seen": 23448771120,
      "step": 29804
    },
    {
      "epoch": 3.161998726925525,
      "grad_norm": 0.485231526887588,
      "learning_rate": 4.195043779518419e-05,
      "loss": 1.5216,
      "num_input_tokens_seen": 23449557856,
      "step": 29805
    },
    {
      "epoch": 3.1621048164650967,
      "grad_norm": 0.40363796869938856,
      "learning_rate": 4.194992695475741e-05,
      "loss": 1.4728,
      "num_input_tokens_seen": 23450344640,
      "step": 29806
    },
    {
      "epoch": 3.162210906004668,
      "grad_norm": 0.504964473860432,
      "learning_rate": 4.1949416101232234e-05,
      "loss": 1.5148,
      "num_input_tokens_seen": 23451131440,
      "step": 29807
    },
    {
      "epoch": 3.162316995544239,
      "grad_norm": 0.5144878261253213,
      "learning_rate": 4.194890523460903e-05,
      "loss": 1.4745,
      "num_input_tokens_seen": 23451918272,
      "step": 29808
    },
    {
      "epoch": 3.1624230850838106,
      "grad_norm": 0.4076736295057817,
      "learning_rate": 4.194839435488822e-05,
      "loss": 1.4384,
      "num_input_tokens_seen": 23452705024,
      "step": 29809
    },
    {
      "epoch": 3.162529174623382,
      "grad_norm": 0.5263518381118676,
      "learning_rate": 4.194788346207018e-05,
      "loss": 1.5273,
      "num_input_tokens_seen": 23453491728,
      "step": 29810
    },
    {
      "epoch": 3.1626352641629536,
      "grad_norm": 0.4169546380729184,
      "learning_rate": 4.194737255615532e-05,
      "loss": 1.4557,
      "num_input_tokens_seen": 23454278592,
      "step": 29811
    },
    {
      "epoch": 3.162741353702525,
      "grad_norm": 0.4119003908787973,
      "learning_rate": 4.194686163714403e-05,
      "loss": 1.4013,
      "num_input_tokens_seen": 23455065360,
      "step": 29812
    },
    {
      "epoch": 3.1628474432420965,
      "grad_norm": 0.508259540975455,
      "learning_rate": 4.1946350705036695e-05,
      "loss": 1.3926,
      "num_input_tokens_seen": 23455852176,
      "step": 29813
    },
    {
      "epoch": 3.1629535327816676,
      "grad_norm": 0.4708461585054856,
      "learning_rate": 4.1945839759833725e-05,
      "loss": 1.5582,
      "num_input_tokens_seen": 23456639024,
      "step": 29814
    },
    {
      "epoch": 3.163059622321239,
      "grad_norm": 0.48197228447226415,
      "learning_rate": 4.19453288015355e-05,
      "loss": 1.4891,
      "num_input_tokens_seen": 23457425760,
      "step": 29815
    },
    {
      "epoch": 3.1631657118608105,
      "grad_norm": 0.4853145771225387,
      "learning_rate": 4.1944817830142424e-05,
      "loss": 1.3336,
      "num_input_tokens_seen": 23458212592,
      "step": 29816
    },
    {
      "epoch": 3.163271801400382,
      "grad_norm": 0.46912259324325906,
      "learning_rate": 4.194430684565489e-05,
      "loss": 1.5217,
      "num_input_tokens_seen": 23458999392,
      "step": 29817
    },
    {
      "epoch": 3.1633778909399535,
      "grad_norm": 0.47757719590040254,
      "learning_rate": 4.1943795848073296e-05,
      "loss": 1.5293,
      "num_input_tokens_seen": 23459786128,
      "step": 29818
    },
    {
      "epoch": 3.1634839804795245,
      "grad_norm": 0.44211293319579315,
      "learning_rate": 4.1943284837398034e-05,
      "loss": 1.5805,
      "num_input_tokens_seen": 23460572880,
      "step": 29819
    },
    {
      "epoch": 3.163590070019096,
      "grad_norm": 0.5222438885369467,
      "learning_rate": 4.19427738136295e-05,
      "loss": 1.3894,
      "num_input_tokens_seen": 23461359712,
      "step": 29820
    },
    {
      "epoch": 3.1636961595586675,
      "grad_norm": 0.4440428784542078,
      "learning_rate": 4.1942262776768084e-05,
      "loss": 1.4069,
      "num_input_tokens_seen": 23462146528,
      "step": 29821
    },
    {
      "epoch": 3.163802249098239,
      "grad_norm": 0.41686532687514993,
      "learning_rate": 4.194175172681418e-05,
      "loss": 1.3794,
      "num_input_tokens_seen": 23462933232,
      "step": 29822
    },
    {
      "epoch": 3.1639083386378104,
      "grad_norm": 0.40806374674923573,
      "learning_rate": 4.1941240663768194e-05,
      "loss": 1.4776,
      "num_input_tokens_seen": 23463720080,
      "step": 29823
    },
    {
      "epoch": 3.164014428177382,
      "grad_norm": 0.4028579619167591,
      "learning_rate": 4.194072958763051e-05,
      "loss": 1.5231,
      "num_input_tokens_seen": 23464506768,
      "step": 29824
    },
    {
      "epoch": 3.164120517716953,
      "grad_norm": 0.39096616719103516,
      "learning_rate": 4.1940218498401536e-05,
      "loss": 1.5075,
      "num_input_tokens_seen": 23465293456,
      "step": 29825
    },
    {
      "epoch": 3.1642266072565244,
      "grad_norm": 0.424165317506723,
      "learning_rate": 4.193970739608165e-05,
      "loss": 1.4685,
      "num_input_tokens_seen": 23466080112,
      "step": 29826
    },
    {
      "epoch": 3.164332696796096,
      "grad_norm": 0.39989209128163045,
      "learning_rate": 4.1939196280671254e-05,
      "loss": 1.4411,
      "num_input_tokens_seen": 23466866928,
      "step": 29827
    },
    {
      "epoch": 3.1644387863356673,
      "grad_norm": 0.43476477832805577,
      "learning_rate": 4.1938685152170754e-05,
      "loss": 1.4281,
      "num_input_tokens_seen": 23467653696,
      "step": 29828
    },
    {
      "epoch": 3.164544875875239,
      "grad_norm": 0.40077122693181416,
      "learning_rate": 4.193817401058052e-05,
      "loss": 1.5281,
      "num_input_tokens_seen": 23468440496,
      "step": 29829
    },
    {
      "epoch": 3.1646509654148103,
      "grad_norm": 0.4571664234157852,
      "learning_rate": 4.1937662855900975e-05,
      "loss": 1.3896,
      "num_input_tokens_seen": 23469227200,
      "step": 29830
    },
    {
      "epoch": 3.1647570549543813,
      "grad_norm": 0.43466582903429,
      "learning_rate": 4.1937151688132495e-05,
      "loss": 1.4264,
      "num_input_tokens_seen": 23470014032,
      "step": 29831
    },
    {
      "epoch": 3.164863144493953,
      "grad_norm": 0.4822223948170753,
      "learning_rate": 4.193664050727548e-05,
      "loss": 1.4098,
      "num_input_tokens_seen": 23470800864,
      "step": 29832
    },
    {
      "epoch": 3.1649692340335243,
      "grad_norm": 0.411666970887613,
      "learning_rate": 4.193612931333033e-05,
      "loss": 1.4907,
      "num_input_tokens_seen": 23471587600,
      "step": 29833
    },
    {
      "epoch": 3.1650753235730957,
      "grad_norm": 0.42366257611483815,
      "learning_rate": 4.193561810629744e-05,
      "loss": 1.4306,
      "num_input_tokens_seen": 23472374368,
      "step": 29834
    },
    {
      "epoch": 3.165181413112667,
      "grad_norm": 0.4378223658177837,
      "learning_rate": 4.193510688617719e-05,
      "loss": 1.4665,
      "num_input_tokens_seen": 23473161152,
      "step": 29835
    },
    {
      "epoch": 3.1652875026522387,
      "grad_norm": 0.42770340151276076,
      "learning_rate": 4.193459565297e-05,
      "loss": 1.3892,
      "num_input_tokens_seen": 23473947856,
      "step": 29836
    },
    {
      "epoch": 3.1653935921918097,
      "grad_norm": 0.45931365002819885,
      "learning_rate": 4.193408440667624e-05,
      "loss": 1.4454,
      "num_input_tokens_seen": 23474734640,
      "step": 29837
    },
    {
      "epoch": 3.165499681731381,
      "grad_norm": 0.48146285238767017,
      "learning_rate": 4.1933573147296326e-05,
      "loss": 1.4434,
      "num_input_tokens_seen": 23475521424,
      "step": 29838
    },
    {
      "epoch": 3.1656057712709527,
      "grad_norm": 0.41413890433869865,
      "learning_rate": 4.193306187483063e-05,
      "loss": 1.539,
      "num_input_tokens_seen": 23476308160,
      "step": 29839
    },
    {
      "epoch": 3.165711860810524,
      "grad_norm": 0.42726138671196295,
      "learning_rate": 4.193255058927957e-05,
      "loss": 1.4305,
      "num_input_tokens_seen": 23477094944,
      "step": 29840
    },
    {
      "epoch": 3.1658179503500956,
      "grad_norm": 0.48062720578815143,
      "learning_rate": 4.193203929064353e-05,
      "loss": 1.6099,
      "num_input_tokens_seen": 23477881648,
      "step": 29841
    },
    {
      "epoch": 3.165924039889667,
      "grad_norm": 0.4297435583252632,
      "learning_rate": 4.1931527978922906e-05,
      "loss": 1.4449,
      "num_input_tokens_seen": 23478668416,
      "step": 29842
    },
    {
      "epoch": 3.166030129429238,
      "grad_norm": 0.4438882304092633,
      "learning_rate": 4.1931016654118096e-05,
      "loss": 1.4939,
      "num_input_tokens_seen": 23479455136,
      "step": 29843
    },
    {
      "epoch": 3.1661362189688096,
      "grad_norm": 0.42110356795694864,
      "learning_rate": 4.193050531622949e-05,
      "loss": 1.3297,
      "num_input_tokens_seen": 23480241920,
      "step": 29844
    },
    {
      "epoch": 3.166242308508381,
      "grad_norm": 0.41165009006612746,
      "learning_rate": 4.192999396525749e-05,
      "loss": 1.4583,
      "num_input_tokens_seen": 23481028720,
      "step": 29845
    },
    {
      "epoch": 3.1663483980479525,
      "grad_norm": 0.417205458018646,
      "learning_rate": 4.192948260120249e-05,
      "loss": 1.6397,
      "num_input_tokens_seen": 23481815472,
      "step": 29846
    },
    {
      "epoch": 3.166454487587524,
      "grad_norm": 0.41850660710658144,
      "learning_rate": 4.192897122406487e-05,
      "loss": 1.4648,
      "num_input_tokens_seen": 23482602256,
      "step": 29847
    },
    {
      "epoch": 3.166560577127095,
      "grad_norm": 0.3870893762741122,
      "learning_rate": 4.192845983384505e-05,
      "loss": 1.3998,
      "num_input_tokens_seen": 23483389008,
      "step": 29848
    },
    {
      "epoch": 3.1666666666666665,
      "grad_norm": 0.41331766169360074,
      "learning_rate": 4.192794843054341e-05,
      "loss": 1.4917,
      "num_input_tokens_seen": 23484175776,
      "step": 29849
    },
    {
      "epoch": 3.166772756206238,
      "grad_norm": 0.4196857027943545,
      "learning_rate": 4.192743701416035e-05,
      "loss": 1.4532,
      "num_input_tokens_seen": 23484962608,
      "step": 29850
    },
    {
      "epoch": 3.1668788457458095,
      "grad_norm": 0.4496843771987352,
      "learning_rate": 4.192692558469626e-05,
      "loss": 1.381,
      "num_input_tokens_seen": 23485749328,
      "step": 29851
    },
    {
      "epoch": 3.166984935285381,
      "grad_norm": 0.42396738109641907,
      "learning_rate": 4.192641414215154e-05,
      "loss": 1.401,
      "num_input_tokens_seen": 23486536096,
      "step": 29852
    },
    {
      "epoch": 3.1670910248249524,
      "grad_norm": 0.38681676457821634,
      "learning_rate": 4.192590268652658e-05,
      "loss": 1.4084,
      "num_input_tokens_seen": 23487322864,
      "step": 29853
    },
    {
      "epoch": 3.167197114364524,
      "grad_norm": 0.47870298793698574,
      "learning_rate": 4.192539121782178e-05,
      "loss": 1.5165,
      "num_input_tokens_seen": 23488109616,
      "step": 29854
    },
    {
      "epoch": 3.167303203904095,
      "grad_norm": 0.5086478850361882,
      "learning_rate": 4.192487973603754e-05,
      "loss": 1.5593,
      "num_input_tokens_seen": 23488896368,
      "step": 29855
    },
    {
      "epoch": 3.1674092934436664,
      "grad_norm": 0.5274522662868694,
      "learning_rate": 4.192436824117424e-05,
      "loss": 1.5368,
      "num_input_tokens_seen": 23489683120,
      "step": 29856
    },
    {
      "epoch": 3.167515382983238,
      "grad_norm": 0.43563768381564,
      "learning_rate": 4.192385673323229e-05,
      "loss": 1.4198,
      "num_input_tokens_seen": 23490469872,
      "step": 29857
    },
    {
      "epoch": 3.1676214725228093,
      "grad_norm": 0.4002757798381551,
      "learning_rate": 4.1923345212212086e-05,
      "loss": 1.4176,
      "num_input_tokens_seen": 23491256624,
      "step": 29858
    },
    {
      "epoch": 3.167727562062381,
      "grad_norm": 0.4040361420844472,
      "learning_rate": 4.1922833678114006e-05,
      "loss": 1.4089,
      "num_input_tokens_seen": 23492043536,
      "step": 29859
    },
    {
      "epoch": 3.167833651601952,
      "grad_norm": 0.3941703255805687,
      "learning_rate": 4.192232213093846e-05,
      "loss": 1.4725,
      "num_input_tokens_seen": 23492830288,
      "step": 29860
    },
    {
      "epoch": 3.1679397411415233,
      "grad_norm": 0.39491229793563376,
      "learning_rate": 4.192181057068585e-05,
      "loss": 1.4621,
      "num_input_tokens_seen": 23493617056,
      "step": 29861
    },
    {
      "epoch": 3.168045830681095,
      "grad_norm": 0.47076764049163977,
      "learning_rate": 4.192129899735655e-05,
      "loss": 1.5901,
      "num_input_tokens_seen": 23494403776,
      "step": 29862
    },
    {
      "epoch": 3.1681519202206663,
      "grad_norm": 0.3822593930026294,
      "learning_rate": 4.192078741095098e-05,
      "loss": 1.5027,
      "num_input_tokens_seen": 23495190544,
      "step": 29863
    },
    {
      "epoch": 3.1682580097602377,
      "grad_norm": 0.40438585248655956,
      "learning_rate": 4.1920275811469514e-05,
      "loss": 1.4718,
      "num_input_tokens_seen": 23495977376,
      "step": 29864
    },
    {
      "epoch": 3.1683640992998092,
      "grad_norm": 0.4005355953478756,
      "learning_rate": 4.191976419891255e-05,
      "loss": 1.3753,
      "num_input_tokens_seen": 23496764208,
      "step": 29865
    },
    {
      "epoch": 3.1684701888393803,
      "grad_norm": 0.5507886763580983,
      "learning_rate": 4.191925257328049e-05,
      "loss": 1.4337,
      "num_input_tokens_seen": 23497551040,
      "step": 29866
    },
    {
      "epoch": 3.1685762783789517,
      "grad_norm": 0.4234909048778913,
      "learning_rate": 4.191874093457373e-05,
      "loss": 1.457,
      "num_input_tokens_seen": 23498337760,
      "step": 29867
    },
    {
      "epoch": 3.168682367918523,
      "grad_norm": 0.4618981187375724,
      "learning_rate": 4.191822928279266e-05,
      "loss": 1.5001,
      "num_input_tokens_seen": 23499124528,
      "step": 29868
    },
    {
      "epoch": 3.1687884574580947,
      "grad_norm": 0.3790090584388466,
      "learning_rate": 4.191771761793769e-05,
      "loss": 1.5417,
      "num_input_tokens_seen": 23499911232,
      "step": 29869
    },
    {
      "epoch": 3.168894546997666,
      "grad_norm": 0.4389567530327692,
      "learning_rate": 4.19172059400092e-05,
      "loss": 1.4449,
      "num_input_tokens_seen": 23500698000,
      "step": 29870
    },
    {
      "epoch": 3.1690006365372376,
      "grad_norm": 0.45076078144102716,
      "learning_rate": 4.191669424900758e-05,
      "loss": 1.5354,
      "num_input_tokens_seen": 23501484704,
      "step": 29871
    },
    {
      "epoch": 3.1691067260768087,
      "grad_norm": 0.4768365984176158,
      "learning_rate": 4.191618254493325e-05,
      "loss": 1.5648,
      "num_input_tokens_seen": 23502271488,
      "step": 29872
    },
    {
      "epoch": 3.16921281561638,
      "grad_norm": 0.3654456924708398,
      "learning_rate": 4.191567082778658e-05,
      "loss": 1.2268,
      "num_input_tokens_seen": 23503058288,
      "step": 29873
    },
    {
      "epoch": 3.1693189051559516,
      "grad_norm": 0.4353239082751961,
      "learning_rate": 4.191515909756798e-05,
      "loss": 1.4611,
      "num_input_tokens_seen": 23503845008,
      "step": 29874
    },
    {
      "epoch": 3.169424994695523,
      "grad_norm": 0.3939537317839038,
      "learning_rate": 4.1914647354277834e-05,
      "loss": 1.3726,
      "num_input_tokens_seen": 23504631824,
      "step": 29875
    },
    {
      "epoch": 3.1695310842350946,
      "grad_norm": 0.5094248042723947,
      "learning_rate": 4.1914135597916554e-05,
      "loss": 1.3711,
      "num_input_tokens_seen": 23505418560,
      "step": 29876
    },
    {
      "epoch": 3.1696371737746656,
      "grad_norm": 0.460113013840231,
      "learning_rate": 4.191362382848452e-05,
      "loss": 1.3635,
      "num_input_tokens_seen": 23506205344,
      "step": 29877
    },
    {
      "epoch": 3.169743263314237,
      "grad_norm": 0.46195658095166053,
      "learning_rate": 4.191311204598214e-05,
      "loss": 1.5099,
      "num_input_tokens_seen": 23506992176,
      "step": 29878
    },
    {
      "epoch": 3.1698493528538085,
      "grad_norm": 0.4157317972988096,
      "learning_rate": 4.19126002504098e-05,
      "loss": 1.4944,
      "num_input_tokens_seen": 23507778992,
      "step": 29879
    },
    {
      "epoch": 3.16995544239338,
      "grad_norm": 0.47006828842499726,
      "learning_rate": 4.1912088441767894e-05,
      "loss": 1.4134,
      "num_input_tokens_seen": 23508565840,
      "step": 29880
    },
    {
      "epoch": 3.1700615319329515,
      "grad_norm": 0.4495924570729447,
      "learning_rate": 4.191157662005683e-05,
      "loss": 1.4424,
      "num_input_tokens_seen": 23509352592,
      "step": 29881
    },
    {
      "epoch": 3.170167621472523,
      "grad_norm": 0.5432158202265415,
      "learning_rate": 4.1911064785276996e-05,
      "loss": 1.5406,
      "num_input_tokens_seen": 23510139424,
      "step": 29882
    },
    {
      "epoch": 3.1702737110120944,
      "grad_norm": 0.4362183101520184,
      "learning_rate": 4.1910552937428785e-05,
      "loss": 1.3852,
      "num_input_tokens_seen": 23510926208,
      "step": 29883
    },
    {
      "epoch": 3.1703798005516655,
      "grad_norm": 0.4314763607684791,
      "learning_rate": 4.191004107651259e-05,
      "loss": 1.4945,
      "num_input_tokens_seen": 23511712928,
      "step": 29884
    },
    {
      "epoch": 3.170485890091237,
      "grad_norm": 0.5634174749562991,
      "learning_rate": 4.190952920252882e-05,
      "loss": 1.48,
      "num_input_tokens_seen": 23512499664,
      "step": 29885
    },
    {
      "epoch": 3.1705919796308084,
      "grad_norm": 0.43656019912379446,
      "learning_rate": 4.190901731547785e-05,
      "loss": 1.3698,
      "num_input_tokens_seen": 23513286464,
      "step": 29886
    },
    {
      "epoch": 3.17069806917038,
      "grad_norm": 0.48996798207222464,
      "learning_rate": 4.19085054153601e-05,
      "loss": 1.3595,
      "num_input_tokens_seen": 23514073184,
      "step": 29887
    },
    {
      "epoch": 3.1708041587099514,
      "grad_norm": 0.4010405605391759,
      "learning_rate": 4.1907993502175944e-05,
      "loss": 1.4602,
      "num_input_tokens_seen": 23514859968,
      "step": 29888
    },
    {
      "epoch": 3.1709102482495224,
      "grad_norm": 0.42764695498670274,
      "learning_rate": 4.1907481575925795e-05,
      "loss": 1.4923,
      "num_input_tokens_seen": 23515646768,
      "step": 29889
    },
    {
      "epoch": 3.171016337789094,
      "grad_norm": 0.4919800028037176,
      "learning_rate": 4.190696963661004e-05,
      "loss": 1.484,
      "num_input_tokens_seen": 23516433536,
      "step": 29890
    },
    {
      "epoch": 3.1711224273286653,
      "grad_norm": 0.36879676748763623,
      "learning_rate": 4.1906457684229066e-05,
      "loss": 1.4303,
      "num_input_tokens_seen": 23517220256,
      "step": 29891
    },
    {
      "epoch": 3.171228516868237,
      "grad_norm": 0.48687332387494947,
      "learning_rate": 4.190594571878329e-05,
      "loss": 1.4842,
      "num_input_tokens_seen": 23518007056,
      "step": 29892
    },
    {
      "epoch": 3.1713346064078083,
      "grad_norm": 0.3947971383430686,
      "learning_rate": 4.190543374027308e-05,
      "loss": 1.4179,
      "num_input_tokens_seen": 23518793888,
      "step": 29893
    },
    {
      "epoch": 3.1714406959473798,
      "grad_norm": 0.3993911517094877,
      "learning_rate": 4.1904921748698856e-05,
      "loss": 1.4505,
      "num_input_tokens_seen": 23519580688,
      "step": 29894
    },
    {
      "epoch": 3.171546785486951,
      "grad_norm": 0.40690111919436267,
      "learning_rate": 4.1904409744061005e-05,
      "loss": 1.4523,
      "num_input_tokens_seen": 23520367472,
      "step": 29895
    },
    {
      "epoch": 3.1716528750265223,
      "grad_norm": 0.46224970939278714,
      "learning_rate": 4.190389772635992e-05,
      "loss": 1.4928,
      "num_input_tokens_seen": 23521154256,
      "step": 29896
    },
    {
      "epoch": 3.1717589645660937,
      "grad_norm": 0.4127404902386564,
      "learning_rate": 4.1903385695596e-05,
      "loss": 1.4694,
      "num_input_tokens_seen": 23521940992,
      "step": 29897
    },
    {
      "epoch": 3.171865054105665,
      "grad_norm": 0.3999385302992798,
      "learning_rate": 4.1902873651769635e-05,
      "loss": 1.4516,
      "num_input_tokens_seen": 23522727792,
      "step": 29898
    },
    {
      "epoch": 3.1719711436452367,
      "grad_norm": 0.384073705070494,
      "learning_rate": 4.1902361594881234e-05,
      "loss": 1.4082,
      "num_input_tokens_seen": 23523514688,
      "step": 29899
    },
    {
      "epoch": 3.172077233184808,
      "grad_norm": 0.40043491865246034,
      "learning_rate": 4.190184952493117e-05,
      "loss": 1.4072,
      "num_input_tokens_seen": 23524301456,
      "step": 29900
    },
    {
      "epoch": 3.172183322724379,
      "grad_norm": 0.5065577465080687,
      "learning_rate": 4.190133744191986e-05,
      "loss": 1.4758,
      "num_input_tokens_seen": 23525088208,
      "step": 29901
    },
    {
      "epoch": 3.1722894122639507,
      "grad_norm": 0.4489216917746673,
      "learning_rate": 4.190082534584769e-05,
      "loss": 1.3474,
      "num_input_tokens_seen": 23525874960,
      "step": 29902
    },
    {
      "epoch": 3.172395501803522,
      "grad_norm": 0.4745512475213532,
      "learning_rate": 4.190031323671507e-05,
      "loss": 1.4658,
      "num_input_tokens_seen": 23526661776,
      "step": 29903
    },
    {
      "epoch": 3.1725015913430936,
      "grad_norm": 0.41877719981802336,
      "learning_rate": 4.1899801114522376e-05,
      "loss": 1.5419,
      "num_input_tokens_seen": 23527448544,
      "step": 29904
    },
    {
      "epoch": 3.172607680882665,
      "grad_norm": 0.4165547561521164,
      "learning_rate": 4.189928897927001e-05,
      "loss": 1.4399,
      "num_input_tokens_seen": 23528235328,
      "step": 29905
    },
    {
      "epoch": 3.1727137704222366,
      "grad_norm": 0.46191130587432544,
      "learning_rate": 4.189877683095837e-05,
      "loss": 1.5427,
      "num_input_tokens_seen": 23529022096,
      "step": 29906
    },
    {
      "epoch": 3.1728198599618076,
      "grad_norm": 0.45511426043925823,
      "learning_rate": 4.189826466958785e-05,
      "loss": 1.4672,
      "num_input_tokens_seen": 23529808944,
      "step": 29907
    },
    {
      "epoch": 3.172925949501379,
      "grad_norm": 0.4367433552590843,
      "learning_rate": 4.189775249515885e-05,
      "loss": 1.5473,
      "num_input_tokens_seen": 23530595728,
      "step": 29908
    },
    {
      "epoch": 3.1730320390409505,
      "grad_norm": 0.4228824641465432,
      "learning_rate": 4.189724030767176e-05,
      "loss": 1.3785,
      "num_input_tokens_seen": 23531382544,
      "step": 29909
    },
    {
      "epoch": 3.173138128580522,
      "grad_norm": 0.4647824389027669,
      "learning_rate": 4.189672810712698e-05,
      "loss": 1.3251,
      "num_input_tokens_seen": 23532169392,
      "step": 29910
    },
    {
      "epoch": 3.1732442181200935,
      "grad_norm": 0.4741449839241739,
      "learning_rate": 4.189621589352491e-05,
      "loss": 1.3629,
      "num_input_tokens_seen": 23532956208,
      "step": 29911
    },
    {
      "epoch": 3.173350307659665,
      "grad_norm": 0.4469976629974204,
      "learning_rate": 4.189570366686593e-05,
      "loss": 1.4739,
      "num_input_tokens_seen": 23533743008,
      "step": 29912
    },
    {
      "epoch": 3.173456397199236,
      "grad_norm": 0.5211688818048602,
      "learning_rate": 4.189519142715045e-05,
      "loss": 1.3899,
      "num_input_tokens_seen": 23534529776,
      "step": 29913
    },
    {
      "epoch": 3.1735624867388075,
      "grad_norm": 0.4177039569232829,
      "learning_rate": 4.189467917437886e-05,
      "loss": 1.4227,
      "num_input_tokens_seen": 23535316496,
      "step": 29914
    },
    {
      "epoch": 3.173668576278379,
      "grad_norm": 0.470746378483179,
      "learning_rate": 4.1894166908551564e-05,
      "loss": 1.405,
      "num_input_tokens_seen": 23536103392,
      "step": 29915
    },
    {
      "epoch": 3.1737746658179504,
      "grad_norm": 0.5210635811669772,
      "learning_rate": 4.189365462966894e-05,
      "loss": 1.463,
      "num_input_tokens_seen": 23536890144,
      "step": 29916
    },
    {
      "epoch": 3.173880755357522,
      "grad_norm": 0.4549988114509861,
      "learning_rate": 4.1893142337731405e-05,
      "loss": 1.4763,
      "num_input_tokens_seen": 23537676976,
      "step": 29917
    },
    {
      "epoch": 3.173986844897093,
      "grad_norm": 0.43968162486407986,
      "learning_rate": 4.189263003273934e-05,
      "loss": 1.3275,
      "num_input_tokens_seen": 23538463744,
      "step": 29918
    },
    {
      "epoch": 3.1740929344366644,
      "grad_norm": 0.3789747055749768,
      "learning_rate": 4.1892117714693155e-05,
      "loss": 1.2431,
      "num_input_tokens_seen": 23539250592,
      "step": 29919
    },
    {
      "epoch": 3.174199023976236,
      "grad_norm": 0.48773595284271254,
      "learning_rate": 4.1891605383593227e-05,
      "loss": 1.4064,
      "num_input_tokens_seen": 23540037328,
      "step": 29920
    },
    {
      "epoch": 3.1743051135158074,
      "grad_norm": 0.44031671420928903,
      "learning_rate": 4.189109303943997e-05,
      "loss": 1.4844,
      "num_input_tokens_seen": 23540824096,
      "step": 29921
    },
    {
      "epoch": 3.174411203055379,
      "grad_norm": 0.46971126690107257,
      "learning_rate": 4.189058068223377e-05,
      "loss": 1.5115,
      "num_input_tokens_seen": 23541610832,
      "step": 29922
    },
    {
      "epoch": 3.1745172925949503,
      "grad_norm": 0.44549247651417895,
      "learning_rate": 4.1890068311975014e-05,
      "loss": 1.4205,
      "num_input_tokens_seen": 23542397664,
      "step": 29923
    },
    {
      "epoch": 3.1746233821345213,
      "grad_norm": 0.5345546869916932,
      "learning_rate": 4.1889555928664124e-05,
      "loss": 1.4593,
      "num_input_tokens_seen": 23543184384,
      "step": 29924
    },
    {
      "epoch": 3.174729471674093,
      "grad_norm": 0.6098611041269064,
      "learning_rate": 4.188904353230147e-05,
      "loss": 1.3925,
      "num_input_tokens_seen": 23543971104,
      "step": 29925
    },
    {
      "epoch": 3.1748355612136643,
      "grad_norm": 0.5644243196666138,
      "learning_rate": 4.188853112288747e-05,
      "loss": 1.4917,
      "num_input_tokens_seen": 23544757840,
      "step": 29926
    },
    {
      "epoch": 3.1749416507532358,
      "grad_norm": 0.5006790736882445,
      "learning_rate": 4.18880187004225e-05,
      "loss": 1.5313,
      "num_input_tokens_seen": 23545544640,
      "step": 29927
    },
    {
      "epoch": 3.1750477402928072,
      "grad_norm": 0.7048406609505274,
      "learning_rate": 4.1887506264906964e-05,
      "loss": 1.5159,
      "num_input_tokens_seen": 23546331392,
      "step": 29928
    },
    {
      "epoch": 3.1751538298323787,
      "grad_norm": 0.5674272653894179,
      "learning_rate": 4.1886993816341266e-05,
      "loss": 1.5012,
      "num_input_tokens_seen": 23547118128,
      "step": 29929
    },
    {
      "epoch": 3.1752599193719497,
      "grad_norm": 0.5012972915074289,
      "learning_rate": 4.1886481354725785e-05,
      "loss": 1.4506,
      "num_input_tokens_seen": 23547904928,
      "step": 29930
    },
    {
      "epoch": 3.175366008911521,
      "grad_norm": 0.5158892173722598,
      "learning_rate": 4.1885968880060935e-05,
      "loss": 1.5086,
      "num_input_tokens_seen": 23548691664,
      "step": 29931
    },
    {
      "epoch": 3.1754720984510927,
      "grad_norm": 0.6031091243822104,
      "learning_rate": 4.18854563923471e-05,
      "loss": 1.379,
      "num_input_tokens_seen": 23549478448,
      "step": 29932
    },
    {
      "epoch": 3.175578187990664,
      "grad_norm": 0.4061257727786749,
      "learning_rate": 4.188494389158468e-05,
      "loss": 1.3967,
      "num_input_tokens_seen": 23550265232,
      "step": 29933
    },
    {
      "epoch": 3.1756842775302356,
      "grad_norm": 0.41241239906757,
      "learning_rate": 4.188443137777407e-05,
      "loss": 1.4372,
      "num_input_tokens_seen": 23551051984,
      "step": 29934
    },
    {
      "epoch": 3.175790367069807,
      "grad_norm": 0.4362862063444022,
      "learning_rate": 4.188391885091567e-05,
      "loss": 1.4201,
      "num_input_tokens_seen": 23551838768,
      "step": 29935
    },
    {
      "epoch": 3.175896456609378,
      "grad_norm": 0.45518656843137917,
      "learning_rate": 4.188340631100987e-05,
      "loss": 1.393,
      "num_input_tokens_seen": 23552625584,
      "step": 29936
    },
    {
      "epoch": 3.1760025461489496,
      "grad_norm": 0.5777201996748607,
      "learning_rate": 4.188289375805706e-05,
      "loss": 1.5073,
      "num_input_tokens_seen": 23553412384,
      "step": 29937
    },
    {
      "epoch": 3.176108635688521,
      "grad_norm": 0.48475791027100046,
      "learning_rate": 4.1882381192057665e-05,
      "loss": 1.47,
      "num_input_tokens_seen": 23554199152,
      "step": 29938
    },
    {
      "epoch": 3.1762147252280926,
      "grad_norm": 0.4997654562587381,
      "learning_rate": 4.1881868613012044e-05,
      "loss": 1.2827,
      "num_input_tokens_seen": 23554986000,
      "step": 29939
    },
    {
      "epoch": 3.176320814767664,
      "grad_norm": 0.4592160082184525,
      "learning_rate": 4.188135602092062e-05,
      "loss": 1.494,
      "num_input_tokens_seen": 23555772784,
      "step": 29940
    },
    {
      "epoch": 3.1764269043072355,
      "grad_norm": 0.4624573715701615,
      "learning_rate": 4.188084341578378e-05,
      "loss": 1.4684,
      "num_input_tokens_seen": 23556559648,
      "step": 29941
    },
    {
      "epoch": 3.1765329938468065,
      "grad_norm": 0.5099389853748355,
      "learning_rate": 4.1880330797601915e-05,
      "loss": 1.554,
      "num_input_tokens_seen": 23557346496,
      "step": 29942
    },
    {
      "epoch": 3.176639083386378,
      "grad_norm": 0.4740697052570474,
      "learning_rate": 4.1879818166375425e-05,
      "loss": 1.4605,
      "num_input_tokens_seen": 23558133264,
      "step": 29943
    },
    {
      "epoch": 3.1767451729259495,
      "grad_norm": 0.42254861712445785,
      "learning_rate": 4.18793055221047e-05,
      "loss": 1.5168,
      "num_input_tokens_seen": 23558920128,
      "step": 29944
    },
    {
      "epoch": 3.176851262465521,
      "grad_norm": 0.34940683225202607,
      "learning_rate": 4.187879286479016e-05,
      "loss": 1.4371,
      "num_input_tokens_seen": 23559706848,
      "step": 29945
    },
    {
      "epoch": 3.1769573520050924,
      "grad_norm": 0.39049035443854224,
      "learning_rate": 4.187828019443217e-05,
      "loss": 1.4029,
      "num_input_tokens_seen": 23560493552,
      "step": 29946
    },
    {
      "epoch": 3.1770634415446635,
      "grad_norm": 0.40027440290430566,
      "learning_rate": 4.187776751103115e-05,
      "loss": 1.493,
      "num_input_tokens_seen": 23561280288,
      "step": 29947
    },
    {
      "epoch": 3.177169531084235,
      "grad_norm": 0.3808032490861212,
      "learning_rate": 4.187725481458747e-05,
      "loss": 1.5289,
      "num_input_tokens_seen": 23562067040,
      "step": 29948
    },
    {
      "epoch": 3.1772756206238064,
      "grad_norm": 0.4621990468840433,
      "learning_rate": 4.187674210510156e-05,
      "loss": 1.4094,
      "num_input_tokens_seen": 23562853776,
      "step": 29949
    },
    {
      "epoch": 3.177381710163378,
      "grad_norm": 0.43344386153596925,
      "learning_rate": 4.18762293825738e-05,
      "loss": 1.5086,
      "num_input_tokens_seen": 23563640496,
      "step": 29950
    },
    {
      "epoch": 3.1774877997029494,
      "grad_norm": 0.46616902484002654,
      "learning_rate": 4.187571664700458e-05,
      "loss": 1.3785,
      "num_input_tokens_seen": 23564427296,
      "step": 29951
    },
    {
      "epoch": 3.177593889242521,
      "grad_norm": 0.43408772592713557,
      "learning_rate": 4.18752038983943e-05,
      "loss": 1.4612,
      "num_input_tokens_seen": 23565214016,
      "step": 29952
    },
    {
      "epoch": 3.1776999787820923,
      "grad_norm": 0.4729454507194216,
      "learning_rate": 4.1874691136743355e-05,
      "loss": 1.5257,
      "num_input_tokens_seen": 23566000768,
      "step": 29953
    },
    {
      "epoch": 3.1778060683216633,
      "grad_norm": 0.4558730667059096,
      "learning_rate": 4.1874178362052144e-05,
      "loss": 1.5415,
      "num_input_tokens_seen": 23566787520,
      "step": 29954
    },
    {
      "epoch": 3.177912157861235,
      "grad_norm": 0.4234410074990566,
      "learning_rate": 4.1873665574321064e-05,
      "loss": 1.4599,
      "num_input_tokens_seen": 23567574208,
      "step": 29955
    },
    {
      "epoch": 3.1780182474008063,
      "grad_norm": 0.41610336766101513,
      "learning_rate": 4.1873152773550514e-05,
      "loss": 1.4623,
      "num_input_tokens_seen": 23568361008,
      "step": 29956
    },
    {
      "epoch": 3.1781243369403778,
      "grad_norm": 0.4621404010493824,
      "learning_rate": 4.187263995974089e-05,
      "loss": 1.4059,
      "num_input_tokens_seen": 23569147856,
      "step": 29957
    },
    {
      "epoch": 3.1782304264799492,
      "grad_norm": 0.4457251328597589,
      "learning_rate": 4.1872127132892574e-05,
      "loss": 1.4704,
      "num_input_tokens_seen": 23569934560,
      "step": 29958
    },
    {
      "epoch": 3.1783365160195203,
      "grad_norm": 0.4874811019693489,
      "learning_rate": 4.187161429300598e-05,
      "loss": 1.3373,
      "num_input_tokens_seen": 23570721280,
      "step": 29959
    },
    {
      "epoch": 3.1784426055590917,
      "grad_norm": 0.422912509684092,
      "learning_rate": 4.187110144008149e-05,
      "loss": 1.3992,
      "num_input_tokens_seen": 23571508032,
      "step": 29960
    },
    {
      "epoch": 3.1785486950986632,
      "grad_norm": 0.3980518395075689,
      "learning_rate": 4.187058857411952e-05,
      "loss": 1.3841,
      "num_input_tokens_seen": 23572294768,
      "step": 29961
    },
    {
      "epoch": 3.1786547846382347,
      "grad_norm": 0.4453303064361264,
      "learning_rate": 4.187007569512045e-05,
      "loss": 1.39,
      "num_input_tokens_seen": 23573081536,
      "step": 29962
    },
    {
      "epoch": 3.178760874177806,
      "grad_norm": 0.42933645933914233,
      "learning_rate": 4.1869562803084676e-05,
      "loss": 1.5149,
      "num_input_tokens_seen": 23573868352,
      "step": 29963
    },
    {
      "epoch": 3.1788669637173776,
      "grad_norm": 0.5201363440663872,
      "learning_rate": 4.1869049898012603e-05,
      "loss": 1.4146,
      "num_input_tokens_seen": 23574655152,
      "step": 29964
    },
    {
      "epoch": 3.1789730532569487,
      "grad_norm": 0.4914156995550611,
      "learning_rate": 4.1868536979904626e-05,
      "loss": 1.5022,
      "num_input_tokens_seen": 23575441904,
      "step": 29965
    },
    {
      "epoch": 3.17907914279652,
      "grad_norm": 0.4350911436896668,
      "learning_rate": 4.186802404876114e-05,
      "loss": 1.4987,
      "num_input_tokens_seen": 23576228656,
      "step": 29966
    },
    {
      "epoch": 3.1791852323360916,
      "grad_norm": 0.5209156437824517,
      "learning_rate": 4.186751110458252e-05,
      "loss": 1.3809,
      "num_input_tokens_seen": 23577015488,
      "step": 29967
    },
    {
      "epoch": 3.179291321875663,
      "grad_norm": 0.5441110526697681,
      "learning_rate": 4.18669981473692e-05,
      "loss": 1.5179,
      "num_input_tokens_seen": 23577802240,
      "step": 29968
    },
    {
      "epoch": 3.1793974114152346,
      "grad_norm": 0.5837122904039891,
      "learning_rate": 4.1866485177121564e-05,
      "loss": 1.3959,
      "num_input_tokens_seen": 23578589024,
      "step": 29969
    },
    {
      "epoch": 3.179503500954806,
      "grad_norm": 0.6500942076361802,
      "learning_rate": 4.1865972193839985e-05,
      "loss": 1.4015,
      "num_input_tokens_seen": 23579375808,
      "step": 29970
    },
    {
      "epoch": 3.179609590494377,
      "grad_norm": 0.4523753830519425,
      "learning_rate": 4.1865459197524894e-05,
      "loss": 1.4527,
      "num_input_tokens_seen": 23580162576,
      "step": 29971
    },
    {
      "epoch": 3.1797156800339486,
      "grad_norm": 0.7321475495674539,
      "learning_rate": 4.186494618817666e-05,
      "loss": 1.5996,
      "num_input_tokens_seen": 23580949312,
      "step": 29972
    },
    {
      "epoch": 3.17982176957352,
      "grad_norm": 0.44142633891754746,
      "learning_rate": 4.186443316579569e-05,
      "loss": 1.4898,
      "num_input_tokens_seen": 23581736064,
      "step": 29973
    },
    {
      "epoch": 3.1799278591130915,
      "grad_norm": 0.5264218116400333,
      "learning_rate": 4.18639201303824e-05,
      "loss": 1.5013,
      "num_input_tokens_seen": 23582522800,
      "step": 29974
    },
    {
      "epoch": 3.180033948652663,
      "grad_norm": 0.6004679557302822,
      "learning_rate": 4.1863407081937145e-05,
      "loss": 1.5953,
      "num_input_tokens_seen": 23583309536,
      "step": 29975
    },
    {
      "epoch": 3.1801400381922345,
      "grad_norm": 0.5294676322676657,
      "learning_rate": 4.186289402046035e-05,
      "loss": 1.5959,
      "num_input_tokens_seen": 23584096320,
      "step": 29976
    },
    {
      "epoch": 3.1802461277318055,
      "grad_norm": 0.732594892044353,
      "learning_rate": 4.186238094595241e-05,
      "loss": 1.4163,
      "num_input_tokens_seen": 23584883120,
      "step": 29977
    },
    {
      "epoch": 3.180352217271377,
      "grad_norm": 0.5366334104751233,
      "learning_rate": 4.186186785841371e-05,
      "loss": 1.4113,
      "num_input_tokens_seen": 23585669984,
      "step": 29978
    },
    {
      "epoch": 3.1804583068109484,
      "grad_norm": 0.5988271282533701,
      "learning_rate": 4.186135475784466e-05,
      "loss": 1.5353,
      "num_input_tokens_seen": 23586456768,
      "step": 29979
    },
    {
      "epoch": 3.18056439635052,
      "grad_norm": 0.5032899647110538,
      "learning_rate": 4.186084164424564e-05,
      "loss": 1.4876,
      "num_input_tokens_seen": 23587243456,
      "step": 29980
    },
    {
      "epoch": 3.1806704858900914,
      "grad_norm": 0.46566063492575216,
      "learning_rate": 4.186032851761707e-05,
      "loss": 1.5229,
      "num_input_tokens_seen": 23588030176,
      "step": 29981
    },
    {
      "epoch": 3.180776575429663,
      "grad_norm": 0.6681099275823087,
      "learning_rate": 4.1859815377959325e-05,
      "loss": 1.4142,
      "num_input_tokens_seen": 23588816928,
      "step": 29982
    },
    {
      "epoch": 3.180882664969234,
      "grad_norm": 0.49573363869876674,
      "learning_rate": 4.185930222527281e-05,
      "loss": 1.4794,
      "num_input_tokens_seen": 23589603696,
      "step": 29983
    },
    {
      "epoch": 3.1809887545088054,
      "grad_norm": 0.5915379088032585,
      "learning_rate": 4.1858789059557925e-05,
      "loss": 1.4645,
      "num_input_tokens_seen": 23590390480,
      "step": 29984
    },
    {
      "epoch": 3.181094844048377,
      "grad_norm": 0.7093297052930914,
      "learning_rate": 4.185827588081506e-05,
      "loss": 1.5344,
      "num_input_tokens_seen": 23591177136,
      "step": 29985
    },
    {
      "epoch": 3.1812009335879483,
      "grad_norm": 0.5352200700875438,
      "learning_rate": 4.185776268904461e-05,
      "loss": 1.4379,
      "num_input_tokens_seen": 23591963840,
      "step": 29986
    },
    {
      "epoch": 3.18130702312752,
      "grad_norm": 0.7699779496414949,
      "learning_rate": 4.185724948424697e-05,
      "loss": 1.3451,
      "num_input_tokens_seen": 23592750496,
      "step": 29987
    },
    {
      "epoch": 3.181413112667091,
      "grad_norm": 0.4424864557736559,
      "learning_rate": 4.185673626642256e-05,
      "loss": 1.3513,
      "num_input_tokens_seen": 23593537280,
      "step": 29988
    },
    {
      "epoch": 3.1815192022066623,
      "grad_norm": 0.8966664803103657,
      "learning_rate": 4.185622303557175e-05,
      "loss": 1.4955,
      "num_input_tokens_seen": 23594324112,
      "step": 29989
    },
    {
      "epoch": 3.1816252917462338,
      "grad_norm": 0.5088384145471555,
      "learning_rate": 4.185570979169494e-05,
      "loss": 1.3534,
      "num_input_tokens_seen": 23595110928,
      "step": 29990
    },
    {
      "epoch": 3.1817313812858052,
      "grad_norm": 0.5684241429881525,
      "learning_rate": 4.185519653479254e-05,
      "loss": 1.4481,
      "num_input_tokens_seen": 23595897776,
      "step": 29991
    },
    {
      "epoch": 3.1818374708253767,
      "grad_norm": 0.5442467132764311,
      "learning_rate": 4.185468326486494e-05,
      "loss": 1.4285,
      "num_input_tokens_seen": 23596684512,
      "step": 29992
    },
    {
      "epoch": 3.181943560364948,
      "grad_norm": 0.5570938136140506,
      "learning_rate": 4.185416998191253e-05,
      "loss": 1.5637,
      "num_input_tokens_seen": 23597471264,
      "step": 29993
    },
    {
      "epoch": 3.182049649904519,
      "grad_norm": 0.4458927038838298,
      "learning_rate": 4.1853656685935705e-05,
      "loss": 1.528,
      "num_input_tokens_seen": 23598258064,
      "step": 29994
    },
    {
      "epoch": 3.1821557394440907,
      "grad_norm": 0.5872751327757241,
      "learning_rate": 4.185314337693488e-05,
      "loss": 1.3534,
      "num_input_tokens_seen": 23599044912,
      "step": 29995
    },
    {
      "epoch": 3.182261828983662,
      "grad_norm": 0.6948567750654134,
      "learning_rate": 4.185263005491044e-05,
      "loss": 1.4939,
      "num_input_tokens_seen": 23599831696,
      "step": 29996
    },
    {
      "epoch": 3.1823679185232336,
      "grad_norm": 0.5390366092321391,
      "learning_rate": 4.185211671986277e-05,
      "loss": 1.4531,
      "num_input_tokens_seen": 23600618512,
      "step": 29997
    },
    {
      "epoch": 3.182474008062805,
      "grad_norm": 0.8127485396161888,
      "learning_rate": 4.185160337179229e-05,
      "loss": 1.423,
      "num_input_tokens_seen": 23601405168,
      "step": 29998
    },
    {
      "epoch": 3.1825800976023766,
      "grad_norm": 0.42558404781463793,
      "learning_rate": 4.185109001069938e-05,
      "loss": 1.4834,
      "num_input_tokens_seen": 23602191824,
      "step": 29999
    },
    {
      "epoch": 3.1826861871419476,
      "grad_norm": 0.8020050332633245,
      "learning_rate": 4.185057663658445e-05,
      "loss": 1.5936,
      "num_input_tokens_seen": 23602978576,
      "step": 30000
    },
    {
      "epoch": 3.1826861871419476,
      "eval_loss": 1.6343203783035278,
      "eval_runtime": 66.1996,
      "eval_samples_per_second": 45.317,
      "eval_steps_per_second": 0.483,
      "num_input_tokens_seen": 23602978576,
      "step": 30000
    },
    {
      "epoch": 3.182792276681519,
      "grad_norm": 0.533908463884016,
      "learning_rate": 4.185006324944788e-05,
      "loss": 1.4646,
      "num_input_tokens_seen": 23603765232,
      "step": 30001
    },
    {
      "epoch": 3.1828983662210906,
      "grad_norm": 0.4082200399025542,
      "learning_rate": 4.184954984929008e-05,
      "loss": 1.4984,
      "num_input_tokens_seen": 23604551968,
      "step": 30002
    },
    {
      "epoch": 3.183004455760662,
      "grad_norm": 0.5175764026933567,
      "learning_rate": 4.1849036436111444e-05,
      "loss": 1.4278,
      "num_input_tokens_seen": 23605338720,
      "step": 30003
    },
    {
      "epoch": 3.1831105453002335,
      "grad_norm": 0.5725504690162804,
      "learning_rate": 4.1848523009912366e-05,
      "loss": 1.3587,
      "num_input_tokens_seen": 23606125376,
      "step": 30004
    },
    {
      "epoch": 3.183216634839805,
      "grad_norm": 0.43851354297482736,
      "learning_rate": 4.184800957069323e-05,
      "loss": 1.4978,
      "num_input_tokens_seen": 23606912208,
      "step": 30005
    },
    {
      "epoch": 3.183322724379376,
      "grad_norm": 0.6720889968447377,
      "learning_rate": 4.1847496118454465e-05,
      "loss": 1.4283,
      "num_input_tokens_seen": 23607699024,
      "step": 30006
    },
    {
      "epoch": 3.1834288139189475,
      "grad_norm": 0.5364271488856922,
      "learning_rate": 4.184698265319644e-05,
      "loss": 1.483,
      "num_input_tokens_seen": 23608485856,
      "step": 30007
    },
    {
      "epoch": 3.183534903458519,
      "grad_norm": 0.44205957662735135,
      "learning_rate": 4.184646917491957e-05,
      "loss": 1.5147,
      "num_input_tokens_seen": 23609272560,
      "step": 30008
    },
    {
      "epoch": 3.1836409929980904,
      "grad_norm": 0.6816167803727954,
      "learning_rate": 4.184595568362424e-05,
      "loss": 1.5004,
      "num_input_tokens_seen": 23610059312,
      "step": 30009
    },
    {
      "epoch": 3.183747082537662,
      "grad_norm": 0.5495643507249374,
      "learning_rate": 4.184544217931084e-05,
      "loss": 1.4645,
      "num_input_tokens_seen": 23610846096,
      "step": 30010
    },
    {
      "epoch": 3.1838531720772334,
      "grad_norm": 0.4907019286937058,
      "learning_rate": 4.184492866197979e-05,
      "loss": 1.3222,
      "num_input_tokens_seen": 23611632976,
      "step": 30011
    },
    {
      "epoch": 3.1839592616168044,
      "grad_norm": 0.6233677255869932,
      "learning_rate": 4.1844415131631464e-05,
      "loss": 1.4078,
      "num_input_tokens_seen": 23612419776,
      "step": 30012
    },
    {
      "epoch": 3.184065351156376,
      "grad_norm": 0.4173139762666637,
      "learning_rate": 4.1843901588266276e-05,
      "loss": 1.4399,
      "num_input_tokens_seen": 23613206640,
      "step": 30013
    },
    {
      "epoch": 3.1841714406959474,
      "grad_norm": 0.5273774201464683,
      "learning_rate": 4.1843388031884604e-05,
      "loss": 1.5399,
      "num_input_tokens_seen": 23613993360,
      "step": 30014
    },
    {
      "epoch": 3.184277530235519,
      "grad_norm": 0.5732399849178655,
      "learning_rate": 4.184287446248686e-05,
      "loss": 1.4877,
      "num_input_tokens_seen": 23614780112,
      "step": 30015
    },
    {
      "epoch": 3.1843836197750903,
      "grad_norm": 0.5111079591150609,
      "learning_rate": 4.184236088007344e-05,
      "loss": 1.4909,
      "num_input_tokens_seen": 23615566896,
      "step": 30016
    },
    {
      "epoch": 3.1844897093146614,
      "grad_norm": 0.5179327365520012,
      "learning_rate": 4.184184728464474e-05,
      "loss": 1.4864,
      "num_input_tokens_seen": 23616353696,
      "step": 30017
    },
    {
      "epoch": 3.184595798854233,
      "grad_norm": 0.4779680411299519,
      "learning_rate": 4.184133367620115e-05,
      "loss": 1.5527,
      "num_input_tokens_seen": 23617140432,
      "step": 30018
    },
    {
      "epoch": 3.1847018883938043,
      "grad_norm": 0.5503801817156073,
      "learning_rate": 4.184082005474307e-05,
      "loss": 1.514,
      "num_input_tokens_seen": 23617927152,
      "step": 30019
    },
    {
      "epoch": 3.1848079779333758,
      "grad_norm": 0.4709673645313698,
      "learning_rate": 4.1840306420270904e-05,
      "loss": 1.4874,
      "num_input_tokens_seen": 23618713776,
      "step": 30020
    },
    {
      "epoch": 3.1849140674729473,
      "grad_norm": 0.4398369916855803,
      "learning_rate": 4.1839792772785045e-05,
      "loss": 1.3571,
      "num_input_tokens_seen": 23619500608,
      "step": 30021
    },
    {
      "epoch": 3.1850201570125187,
      "grad_norm": 0.4808304346215073,
      "learning_rate": 4.183927911228588e-05,
      "loss": 1.546,
      "num_input_tokens_seen": 23620287424,
      "step": 30022
    },
    {
      "epoch": 3.1851262465520898,
      "grad_norm": 0.6302086098348292,
      "learning_rate": 4.183876543877382e-05,
      "loss": 1.5256,
      "num_input_tokens_seen": 23621074208,
      "step": 30023
    },
    {
      "epoch": 3.1852323360916612,
      "grad_norm": 0.41420576526235936,
      "learning_rate": 4.183825175224925e-05,
      "loss": 1.4225,
      "num_input_tokens_seen": 23621860960,
      "step": 30024
    },
    {
      "epoch": 3.1853384256312327,
      "grad_norm": 0.7112387368190317,
      "learning_rate": 4.183773805271258e-05,
      "loss": 1.3359,
      "num_input_tokens_seen": 23622647808,
      "step": 30025
    },
    {
      "epoch": 3.185444515170804,
      "grad_norm": 0.4904677023507163,
      "learning_rate": 4.1837224340164195e-05,
      "loss": 1.6024,
      "num_input_tokens_seen": 23623434464,
      "step": 30026
    },
    {
      "epoch": 3.1855506047103757,
      "grad_norm": 0.5840974889192163,
      "learning_rate": 4.1836710614604504e-05,
      "loss": 1.3717,
      "num_input_tokens_seen": 23624221200,
      "step": 30027
    },
    {
      "epoch": 3.185656694249947,
      "grad_norm": 0.4891684134217326,
      "learning_rate": 4.183619687603389e-05,
      "loss": 1.5059,
      "num_input_tokens_seen": 23625007920,
      "step": 30028
    },
    {
      "epoch": 3.185762783789518,
      "grad_norm": 0.5085302692581063,
      "learning_rate": 4.1835683124452766e-05,
      "loss": 1.4286,
      "num_input_tokens_seen": 23625794720,
      "step": 30029
    },
    {
      "epoch": 3.1858688733290896,
      "grad_norm": 0.7082056355687854,
      "learning_rate": 4.1835169359861505e-05,
      "loss": 1.433,
      "num_input_tokens_seen": 23626581552,
      "step": 30030
    },
    {
      "epoch": 3.185974962868661,
      "grad_norm": 0.4722009909404772,
      "learning_rate": 4.183465558226053e-05,
      "loss": 1.4547,
      "num_input_tokens_seen": 23627368304,
      "step": 30031
    },
    {
      "epoch": 3.1860810524082326,
      "grad_norm": 0.5761443615906163,
      "learning_rate": 4.1834141791650225e-05,
      "loss": 1.3961,
      "num_input_tokens_seen": 23628155152,
      "step": 30032
    },
    {
      "epoch": 3.186187141947804,
      "grad_norm": 0.4437545081432321,
      "learning_rate": 4.1833627988030986e-05,
      "loss": 1.503,
      "num_input_tokens_seen": 23628941936,
      "step": 30033
    },
    {
      "epoch": 3.1862932314873755,
      "grad_norm": 0.5566087787315595,
      "learning_rate": 4.183311417140322e-05,
      "loss": 1.5969,
      "num_input_tokens_seen": 23629728784,
      "step": 30034
    },
    {
      "epoch": 3.1863993210269466,
      "grad_norm": 0.5653915524146439,
      "learning_rate": 4.1832600341767315e-05,
      "loss": 1.4519,
      "num_input_tokens_seen": 23630515488,
      "step": 30035
    },
    {
      "epoch": 3.186505410566518,
      "grad_norm": 0.43206693320103984,
      "learning_rate": 4.183208649912367e-05,
      "loss": 1.4772,
      "num_input_tokens_seen": 23631302240,
      "step": 30036
    },
    {
      "epoch": 3.1866115001060895,
      "grad_norm": 0.5239550817021295,
      "learning_rate": 4.183157264347268e-05,
      "loss": 1.3864,
      "num_input_tokens_seen": 23632088992,
      "step": 30037
    },
    {
      "epoch": 3.186717589645661,
      "grad_norm": 0.48392403624660163,
      "learning_rate": 4.183105877481475e-05,
      "loss": 1.5497,
      "num_input_tokens_seen": 23632875664,
      "step": 30038
    },
    {
      "epoch": 3.1868236791852325,
      "grad_norm": 0.3915481763476761,
      "learning_rate": 4.183054489315026e-05,
      "loss": 1.409,
      "num_input_tokens_seen": 23633662480,
      "step": 30039
    },
    {
      "epoch": 3.186929768724804,
      "grad_norm": 0.4335491568494891,
      "learning_rate": 4.1830030998479626e-05,
      "loss": 1.5026,
      "num_input_tokens_seen": 23634449120,
      "step": 30040
    },
    {
      "epoch": 3.187035858264375,
      "grad_norm": 0.439755525521959,
      "learning_rate": 4.1829517090803236e-05,
      "loss": 1.4536,
      "num_input_tokens_seen": 23635235856,
      "step": 30041
    },
    {
      "epoch": 3.1871419478039464,
      "grad_norm": 0.5133040444731336,
      "learning_rate": 4.1829003170121496e-05,
      "loss": 1.4608,
      "num_input_tokens_seen": 23636022656,
      "step": 30042
    },
    {
      "epoch": 3.187248037343518,
      "grad_norm": 0.46509926147130987,
      "learning_rate": 4.1828489236434784e-05,
      "loss": 1.4617,
      "num_input_tokens_seen": 23636809344,
      "step": 30043
    },
    {
      "epoch": 3.1873541268830894,
      "grad_norm": 0.4461097149104968,
      "learning_rate": 4.1827975289743515e-05,
      "loss": 1.4755,
      "num_input_tokens_seen": 23637596128,
      "step": 30044
    },
    {
      "epoch": 3.187460216422661,
      "grad_norm": 0.4543508494896534,
      "learning_rate": 4.182746133004809e-05,
      "loss": 1.4621,
      "num_input_tokens_seen": 23638382896,
      "step": 30045
    },
    {
      "epoch": 3.187566305962232,
      "grad_norm": 0.45264495908366237,
      "learning_rate": 4.182694735734888e-05,
      "loss": 1.4232,
      "num_input_tokens_seen": 23639169632,
      "step": 30046
    },
    {
      "epoch": 3.1876723955018034,
      "grad_norm": 0.46114743734148433,
      "learning_rate": 4.182643337164631e-05,
      "loss": 1.3537,
      "num_input_tokens_seen": 23639956480,
      "step": 30047
    },
    {
      "epoch": 3.187778485041375,
      "grad_norm": 0.42125042776598004,
      "learning_rate": 4.182591937294076e-05,
      "loss": 1.5178,
      "num_input_tokens_seen": 23640743184,
      "step": 30048
    },
    {
      "epoch": 3.1878845745809463,
      "grad_norm": 0.48866637818087094,
      "learning_rate": 4.182540536123264e-05,
      "loss": 1.5271,
      "num_input_tokens_seen": 23641529968,
      "step": 30049
    },
    {
      "epoch": 3.187990664120518,
      "grad_norm": 0.4094737227216989,
      "learning_rate": 4.1824891336522336e-05,
      "loss": 1.4128,
      "num_input_tokens_seen": 23642316768,
      "step": 30050
    },
    {
      "epoch": 3.1880967536600893,
      "grad_norm": 0.4608378656095056,
      "learning_rate": 4.1824377298810255e-05,
      "loss": 1.5728,
      "num_input_tokens_seen": 23643103632,
      "step": 30051
    },
    {
      "epoch": 3.1882028431996607,
      "grad_norm": 0.6965648520209902,
      "learning_rate": 4.182386324809679e-05,
      "loss": 1.569,
      "num_input_tokens_seen": 23643890368,
      "step": 30052
    },
    {
      "epoch": 3.1883089327392318,
      "grad_norm": 0.37059960025748273,
      "learning_rate": 4.182334918438232e-05,
      "loss": 1.3244,
      "num_input_tokens_seen": 23644677232,
      "step": 30053
    },
    {
      "epoch": 3.1884150222788032,
      "grad_norm": 0.683772357892213,
      "learning_rate": 4.182283510766728e-05,
      "loss": 1.4288,
      "num_input_tokens_seen": 23645464112,
      "step": 30054
    },
    {
      "epoch": 3.1885211118183747,
      "grad_norm": 0.49258748362618865,
      "learning_rate": 4.1822321017952035e-05,
      "loss": 1.4198,
      "num_input_tokens_seen": 23646250928,
      "step": 30055
    },
    {
      "epoch": 3.188627201357946,
      "grad_norm": 0.6109207446402601,
      "learning_rate": 4.182180691523699e-05,
      "loss": 1.4809,
      "num_input_tokens_seen": 23647037728,
      "step": 30056
    },
    {
      "epoch": 3.1887332908975177,
      "grad_norm": 0.471043223541394,
      "learning_rate": 4.182129279952256e-05,
      "loss": 1.4545,
      "num_input_tokens_seen": 23647824448,
      "step": 30057
    },
    {
      "epoch": 3.1888393804370887,
      "grad_norm": 0.46031110725590557,
      "learning_rate": 4.1820778670809116e-05,
      "loss": 1.5129,
      "num_input_tokens_seen": 23648611104,
      "step": 30058
    },
    {
      "epoch": 3.18894546997666,
      "grad_norm": 0.5168174053368993,
      "learning_rate": 4.1820264529097076e-05,
      "loss": 1.395,
      "num_input_tokens_seen": 23649397888,
      "step": 30059
    },
    {
      "epoch": 3.1890515595162316,
      "grad_norm": 0.4645298997648633,
      "learning_rate": 4.181975037438683e-05,
      "loss": 1.4139,
      "num_input_tokens_seen": 23650184688,
      "step": 30060
    },
    {
      "epoch": 3.189157649055803,
      "grad_norm": 0.5015152478242584,
      "learning_rate": 4.181923620667877e-05,
      "loss": 1.4113,
      "num_input_tokens_seen": 23650971536,
      "step": 30061
    },
    {
      "epoch": 3.1892637385953746,
      "grad_norm": 0.5522660165644152,
      "learning_rate": 4.181872202597329e-05,
      "loss": 1.5483,
      "num_input_tokens_seen": 23651758288,
      "step": 30062
    },
    {
      "epoch": 3.189369828134946,
      "grad_norm": 0.4055111333790568,
      "learning_rate": 4.181820783227081e-05,
      "loss": 1.3525,
      "num_input_tokens_seen": 23652545056,
      "step": 30063
    },
    {
      "epoch": 3.189475917674517,
      "grad_norm": 0.4867562836399067,
      "learning_rate": 4.18176936255717e-05,
      "loss": 1.4545,
      "num_input_tokens_seen": 23653331824,
      "step": 30064
    },
    {
      "epoch": 3.1895820072140886,
      "grad_norm": 0.5715966850019334,
      "learning_rate": 4.1817179405876375e-05,
      "loss": 1.6716,
      "num_input_tokens_seen": 23654118512,
      "step": 30065
    },
    {
      "epoch": 3.18968809675366,
      "grad_norm": 0.49005545867252365,
      "learning_rate": 4.181666517318523e-05,
      "loss": 1.4909,
      "num_input_tokens_seen": 23654905360,
      "step": 30066
    },
    {
      "epoch": 3.1897941862932315,
      "grad_norm": 0.5153777135721062,
      "learning_rate": 4.181615092749866e-05,
      "loss": 1.4609,
      "num_input_tokens_seen": 23655692208,
      "step": 30067
    },
    {
      "epoch": 3.189900275832803,
      "grad_norm": 0.40033880997728666,
      "learning_rate": 4.181563666881706e-05,
      "loss": 1.4701,
      "num_input_tokens_seen": 23656478976,
      "step": 30068
    },
    {
      "epoch": 3.1900063653723745,
      "grad_norm": 0.42456641970819425,
      "learning_rate": 4.181512239714083e-05,
      "loss": 1.4092,
      "num_input_tokens_seen": 23657265744,
      "step": 30069
    },
    {
      "epoch": 3.1901124549119455,
      "grad_norm": 0.5633768560116355,
      "learning_rate": 4.181460811247037e-05,
      "loss": 1.5261,
      "num_input_tokens_seen": 23658052464,
      "step": 30070
    },
    {
      "epoch": 3.190218544451517,
      "grad_norm": 0.394619195518874,
      "learning_rate": 4.1814093814806065e-05,
      "loss": 1.4582,
      "num_input_tokens_seen": 23658839216,
      "step": 30071
    },
    {
      "epoch": 3.1903246339910885,
      "grad_norm": 0.41414500745748084,
      "learning_rate": 4.181357950414832e-05,
      "loss": 1.3953,
      "num_input_tokens_seen": 23659625984,
      "step": 30072
    },
    {
      "epoch": 3.19043072353066,
      "grad_norm": 0.6557704026063766,
      "learning_rate": 4.181306518049754e-05,
      "loss": 1.495,
      "num_input_tokens_seen": 23660412608,
      "step": 30073
    },
    {
      "epoch": 3.1905368130702314,
      "grad_norm": 0.4515654834090201,
      "learning_rate": 4.1812550843854124e-05,
      "loss": 1.4877,
      "num_input_tokens_seen": 23661199360,
      "step": 30074
    },
    {
      "epoch": 3.190642902609803,
      "grad_norm": 0.525634929197967,
      "learning_rate": 4.181203649421845e-05,
      "loss": 1.4399,
      "num_input_tokens_seen": 23661986080,
      "step": 30075
    },
    {
      "epoch": 3.190748992149374,
      "grad_norm": 0.42969514315290114,
      "learning_rate": 4.181152213159094e-05,
      "loss": 1.4602,
      "num_input_tokens_seen": 23662772848,
      "step": 30076
    },
    {
      "epoch": 3.1908550816889454,
      "grad_norm": 0.4115417591382882,
      "learning_rate": 4.181100775597197e-05,
      "loss": 1.4528,
      "num_input_tokens_seen": 23663559536,
      "step": 30077
    },
    {
      "epoch": 3.190961171228517,
      "grad_norm": 0.4701276875687279,
      "learning_rate": 4.1810493367361946e-05,
      "loss": 1.4599,
      "num_input_tokens_seen": 23664346208,
      "step": 30078
    },
    {
      "epoch": 3.1910672607680883,
      "grad_norm": 0.47928097960209537,
      "learning_rate": 4.1809978965761265e-05,
      "loss": 1.4946,
      "num_input_tokens_seen": 23665133088,
      "step": 30079
    },
    {
      "epoch": 3.19117335030766,
      "grad_norm": 0.39018824704578786,
      "learning_rate": 4.180946455117033e-05,
      "loss": 1.4168,
      "num_input_tokens_seen": 23665919920,
      "step": 30080
    },
    {
      "epoch": 3.1912794398472313,
      "grad_norm": 0.4233105176038995,
      "learning_rate": 4.1808950123589536e-05,
      "loss": 1.408,
      "num_input_tokens_seen": 23666706672,
      "step": 30081
    },
    {
      "epoch": 3.1913855293868023,
      "grad_norm": 0.4356997802976659,
      "learning_rate": 4.1808435683019274e-05,
      "loss": 1.5056,
      "num_input_tokens_seen": 23667493456,
      "step": 30082
    },
    {
      "epoch": 3.191491618926374,
      "grad_norm": 0.42905696011633954,
      "learning_rate": 4.1807921229459945e-05,
      "loss": 1.4608,
      "num_input_tokens_seen": 23668280208,
      "step": 30083
    },
    {
      "epoch": 3.1915977084659453,
      "grad_norm": 0.4179490541986875,
      "learning_rate": 4.180740676291195e-05,
      "loss": 1.4443,
      "num_input_tokens_seen": 23669066912,
      "step": 30084
    },
    {
      "epoch": 3.1917037980055167,
      "grad_norm": 0.3934771752141974,
      "learning_rate": 4.1806892283375685e-05,
      "loss": 1.4564,
      "num_input_tokens_seen": 23669853712,
      "step": 30085
    },
    {
      "epoch": 3.191809887545088,
      "grad_norm": 0.44241947987190505,
      "learning_rate": 4.1806377790851546e-05,
      "loss": 1.3122,
      "num_input_tokens_seen": 23670640560,
      "step": 30086
    },
    {
      "epoch": 3.1919159770846592,
      "grad_norm": 0.4845180765981446,
      "learning_rate": 4.180586328533993e-05,
      "loss": 1.4869,
      "num_input_tokens_seen": 23671427248,
      "step": 30087
    },
    {
      "epoch": 3.1920220666242307,
      "grad_norm": 0.4978818824495779,
      "learning_rate": 4.180534876684124e-05,
      "loss": 1.5028,
      "num_input_tokens_seen": 23672213968,
      "step": 30088
    },
    {
      "epoch": 3.192128156163802,
      "grad_norm": 0.443685622022585,
      "learning_rate": 4.1804834235355866e-05,
      "loss": 1.4162,
      "num_input_tokens_seen": 23673000720,
      "step": 30089
    },
    {
      "epoch": 3.1922342457033737,
      "grad_norm": 0.7586699286549708,
      "learning_rate": 4.1804319690884206e-05,
      "loss": 1.5796,
      "num_input_tokens_seen": 23673787536,
      "step": 30090
    },
    {
      "epoch": 3.192340335242945,
      "grad_norm": 0.5349323445472461,
      "learning_rate": 4.1803805133426664e-05,
      "loss": 1.4293,
      "num_input_tokens_seen": 23674574272,
      "step": 30091
    },
    {
      "epoch": 3.1924464247825166,
      "grad_norm": 0.7148954182997284,
      "learning_rate": 4.180329056298364e-05,
      "loss": 1.3342,
      "num_input_tokens_seen": 23675361152,
      "step": 30092
    },
    {
      "epoch": 3.1925525143220876,
      "grad_norm": 0.4934406541887519,
      "learning_rate": 4.180277597955552e-05,
      "loss": 1.608,
      "num_input_tokens_seen": 23676147952,
      "step": 30093
    },
    {
      "epoch": 3.192658603861659,
      "grad_norm": 0.5702427812602254,
      "learning_rate": 4.180226138314271e-05,
      "loss": 1.4295,
      "num_input_tokens_seen": 23676934688,
      "step": 30094
    },
    {
      "epoch": 3.1927646934012306,
      "grad_norm": 0.5680505117708894,
      "learning_rate": 4.18017467737456e-05,
      "loss": 1.4768,
      "num_input_tokens_seen": 23677721504,
      "step": 30095
    },
    {
      "epoch": 3.192870782940802,
      "grad_norm": 0.468427247334676,
      "learning_rate": 4.18012321513646e-05,
      "loss": 1.5153,
      "num_input_tokens_seen": 23678508288,
      "step": 30096
    },
    {
      "epoch": 3.1929768724803735,
      "grad_norm": 1.5537778760128922,
      "learning_rate": 4.18007175160001e-05,
      "loss": 1.504,
      "num_input_tokens_seen": 23679295104,
      "step": 30097
    },
    {
      "epoch": 3.193082962019945,
      "grad_norm": 0.6400235388507167,
      "learning_rate": 4.180020286765249e-05,
      "loss": 1.5545,
      "num_input_tokens_seen": 23680081792,
      "step": 30098
    },
    {
      "epoch": 3.193189051559516,
      "grad_norm": 1.0849348316960075,
      "learning_rate": 4.179968820632219e-05,
      "loss": 1.5193,
      "num_input_tokens_seen": 23680868576,
      "step": 30099
    },
    {
      "epoch": 3.1932951410990875,
      "grad_norm": 0.6187977462952027,
      "learning_rate": 4.1799173532009574e-05,
      "loss": 1.4554,
      "num_input_tokens_seen": 23681655344,
      "step": 30100
    },
    {
      "epoch": 3.193401230638659,
      "grad_norm": 0.7043637851973638,
      "learning_rate": 4.1798658844715054e-05,
      "loss": 1.5014,
      "num_input_tokens_seen": 23682442112,
      "step": 30101
    },
    {
      "epoch": 3.1935073201782305,
      "grad_norm": 0.5964773237287571,
      "learning_rate": 4.179814414443902e-05,
      "loss": 1.3724,
      "num_input_tokens_seen": 23683228864,
      "step": 30102
    },
    {
      "epoch": 3.193613409717802,
      "grad_norm": 0.5483346828764127,
      "learning_rate": 4.179762943118188e-05,
      "loss": 1.4154,
      "num_input_tokens_seen": 23684015616,
      "step": 30103
    },
    {
      "epoch": 3.1937194992573734,
      "grad_norm": 0.4786185965008687,
      "learning_rate": 4.1797114704944016e-05,
      "loss": 1.3852,
      "num_input_tokens_seen": 23684802416,
      "step": 30104
    },
    {
      "epoch": 3.1938255887969444,
      "grad_norm": 0.7749693079726971,
      "learning_rate": 4.1796599965725834e-05,
      "loss": 1.4159,
      "num_input_tokens_seen": 23685589152,
      "step": 30105
    },
    {
      "epoch": 3.193931678336516,
      "grad_norm": 0.5077872570674695,
      "learning_rate": 4.1796085213527746e-05,
      "loss": 1.4494,
      "num_input_tokens_seen": 23686375904,
      "step": 30106
    },
    {
      "epoch": 3.1940377678760874,
      "grad_norm": 0.6387716078595987,
      "learning_rate": 4.1795570448350126e-05,
      "loss": 1.3499,
      "num_input_tokens_seen": 23687162704,
      "step": 30107
    },
    {
      "epoch": 3.194143857415659,
      "grad_norm": 0.5109227884371406,
      "learning_rate": 4.1795055670193385e-05,
      "loss": 1.4199,
      "num_input_tokens_seen": 23687949472,
      "step": 30108
    },
    {
      "epoch": 3.1942499469552303,
      "grad_norm": 0.5731433568853128,
      "learning_rate": 4.179454087905791e-05,
      "loss": 1.4945,
      "num_input_tokens_seen": 23688736336,
      "step": 30109
    },
    {
      "epoch": 3.194356036494802,
      "grad_norm": 0.807085333458118,
      "learning_rate": 4.179402607494412e-05,
      "loss": 1.5733,
      "num_input_tokens_seen": 23689523104,
      "step": 30110
    },
    {
      "epoch": 3.194462126034373,
      "grad_norm": 0.4768179705037632,
      "learning_rate": 4.179351125785238e-05,
      "loss": 1.4049,
      "num_input_tokens_seen": 23690309872,
      "step": 30111
    },
    {
      "epoch": 3.1945682155739443,
      "grad_norm": 0.6551993581771466,
      "learning_rate": 4.179299642778313e-05,
      "loss": 1.5671,
      "num_input_tokens_seen": 23691096608,
      "step": 30112
    },
    {
      "epoch": 3.194674305113516,
      "grad_norm": 0.5187733687006624,
      "learning_rate": 4.179248158473673e-05,
      "loss": 1.4681,
      "num_input_tokens_seen": 23691883408,
      "step": 30113
    },
    {
      "epoch": 3.1947803946530873,
      "grad_norm": 0.5085114461533712,
      "learning_rate": 4.1791966728713594e-05,
      "loss": 1.406,
      "num_input_tokens_seen": 23692670224,
      "step": 30114
    },
    {
      "epoch": 3.1948864841926587,
      "grad_norm": 0.6665962307402121,
      "learning_rate": 4.179145185971413e-05,
      "loss": 1.514,
      "num_input_tokens_seen": 23693457008,
      "step": 30115
    },
    {
      "epoch": 3.19499257373223,
      "grad_norm": 0.48407156767904536,
      "learning_rate": 4.179093697773871e-05,
      "loss": 1.469,
      "num_input_tokens_seen": 23694243744,
      "step": 30116
    },
    {
      "epoch": 3.1950986632718013,
      "grad_norm": 0.5057262418171681,
      "learning_rate": 4.179042208278775e-05,
      "loss": 1.5317,
      "num_input_tokens_seen": 23695030512,
      "step": 30117
    },
    {
      "epoch": 3.1952047528113727,
      "grad_norm": 0.49638773982261325,
      "learning_rate": 4.1789907174861655e-05,
      "loss": 1.4496,
      "num_input_tokens_seen": 23695817264,
      "step": 30118
    },
    {
      "epoch": 3.195310842350944,
      "grad_norm": 0.49625504201229437,
      "learning_rate": 4.17893922539608e-05,
      "loss": 1.5074,
      "num_input_tokens_seen": 23696603984,
      "step": 30119
    },
    {
      "epoch": 3.1954169318905157,
      "grad_norm": 0.4848226561993776,
      "learning_rate": 4.17888773200856e-05,
      "loss": 1.5312,
      "num_input_tokens_seen": 23697390656,
      "step": 30120
    },
    {
      "epoch": 3.195523021430087,
      "grad_norm": 0.4738692498163435,
      "learning_rate": 4.178836237323645e-05,
      "loss": 1.4055,
      "num_input_tokens_seen": 23698177440,
      "step": 30121
    },
    {
      "epoch": 3.1956291109696586,
      "grad_norm": 0.5021647029364056,
      "learning_rate": 4.1787847413413744e-05,
      "loss": 1.4701,
      "num_input_tokens_seen": 23698964224,
      "step": 30122
    },
    {
      "epoch": 3.1957352005092297,
      "grad_norm": 0.4583240445242219,
      "learning_rate": 4.1787332440617886e-05,
      "loss": 1.4181,
      "num_input_tokens_seen": 23699750976,
      "step": 30123
    },
    {
      "epoch": 3.195841290048801,
      "grad_norm": 0.536131451013435,
      "learning_rate": 4.1786817454849263e-05,
      "loss": 1.5513,
      "num_input_tokens_seen": 23700537664,
      "step": 30124
    },
    {
      "epoch": 3.1959473795883726,
      "grad_norm": 0.46962512037480886,
      "learning_rate": 4.1786302456108284e-05,
      "loss": 1.5033,
      "num_input_tokens_seen": 23701324416,
      "step": 30125
    },
    {
      "epoch": 3.196053469127944,
      "grad_norm": 0.4617012801111625,
      "learning_rate": 4.178578744439534e-05,
      "loss": 1.5884,
      "num_input_tokens_seen": 23702111152,
      "step": 30126
    },
    {
      "epoch": 3.1961595586675156,
      "grad_norm": 0.48753513188711045,
      "learning_rate": 4.178527241971084e-05,
      "loss": 1.4805,
      "num_input_tokens_seen": 23702897920,
      "step": 30127
    },
    {
      "epoch": 3.1962656482070866,
      "grad_norm": 0.4085417111557037,
      "learning_rate": 4.178475738205517e-05,
      "loss": 1.4504,
      "num_input_tokens_seen": 23703684672,
      "step": 30128
    },
    {
      "epoch": 3.196371737746658,
      "grad_norm": 0.5445705279674597,
      "learning_rate": 4.1784242331428726e-05,
      "loss": 1.3892,
      "num_input_tokens_seen": 23704471472,
      "step": 30129
    },
    {
      "epoch": 3.1964778272862295,
      "grad_norm": 0.46262892571174696,
      "learning_rate": 4.178372726783192e-05,
      "loss": 1.4664,
      "num_input_tokens_seen": 23705258208,
      "step": 30130
    },
    {
      "epoch": 3.196583916825801,
      "grad_norm": 0.5194433168269357,
      "learning_rate": 4.178321219126514e-05,
      "loss": 1.414,
      "num_input_tokens_seen": 23706045024,
      "step": 30131
    },
    {
      "epoch": 3.1966900063653725,
      "grad_norm": 0.44402002031789534,
      "learning_rate": 4.1782697101728786e-05,
      "loss": 1.4027,
      "num_input_tokens_seen": 23706831824,
      "step": 30132
    },
    {
      "epoch": 3.196796095904944,
      "grad_norm": 0.5519950410905443,
      "learning_rate": 4.178218199922325e-05,
      "loss": 1.423,
      "num_input_tokens_seen": 23707618560,
      "step": 30133
    },
    {
      "epoch": 3.196902185444515,
      "grad_norm": 0.5474413659090535,
      "learning_rate": 4.1781666883748946e-05,
      "loss": 1.4715,
      "num_input_tokens_seen": 23708405312,
      "step": 30134
    },
    {
      "epoch": 3.1970082749840865,
      "grad_norm": 0.42474139057223925,
      "learning_rate": 4.178115175530626e-05,
      "loss": 1.5415,
      "num_input_tokens_seen": 23709192096,
      "step": 30135
    },
    {
      "epoch": 3.197114364523658,
      "grad_norm": 0.4108428166759723,
      "learning_rate": 4.178063661389559e-05,
      "loss": 1.3774,
      "num_input_tokens_seen": 23709978880,
      "step": 30136
    },
    {
      "epoch": 3.1972204540632294,
      "grad_norm": 0.5871708458266781,
      "learning_rate": 4.1780121459517326e-05,
      "loss": 1.5399,
      "num_input_tokens_seen": 23710765488,
      "step": 30137
    },
    {
      "epoch": 3.197326543602801,
      "grad_norm": 0.483456800277863,
      "learning_rate": 4.1779606292171884e-05,
      "loss": 1.4062,
      "num_input_tokens_seen": 23711552272,
      "step": 30138
    },
    {
      "epoch": 3.1974326331423724,
      "grad_norm": 0.5122367987918165,
      "learning_rate": 4.1779091111859655e-05,
      "loss": 1.5156,
      "num_input_tokens_seen": 23712338992,
      "step": 30139
    },
    {
      "epoch": 3.1975387226819434,
      "grad_norm": 0.46485929930479125,
      "learning_rate": 4.177857591858104e-05,
      "loss": 1.4557,
      "num_input_tokens_seen": 23713125744,
      "step": 30140
    },
    {
      "epoch": 3.197644812221515,
      "grad_norm": 0.4372696976667607,
      "learning_rate": 4.1778060712336436e-05,
      "loss": 1.4944,
      "num_input_tokens_seen": 23713912544,
      "step": 30141
    },
    {
      "epoch": 3.1977509017610863,
      "grad_norm": 0.4629207806325404,
      "learning_rate": 4.177754549312624e-05,
      "loss": 1.4608,
      "num_input_tokens_seen": 23714699376,
      "step": 30142
    },
    {
      "epoch": 3.197856991300658,
      "grad_norm": 0.5005277980868068,
      "learning_rate": 4.1777030260950846e-05,
      "loss": 1.5526,
      "num_input_tokens_seen": 23715486128,
      "step": 30143
    },
    {
      "epoch": 3.1979630808402293,
      "grad_norm": 0.3823624925891351,
      "learning_rate": 4.1776515015810646e-05,
      "loss": 1.4625,
      "num_input_tokens_seen": 23716272896,
      "step": 30144
    },
    {
      "epoch": 3.1980691703798003,
      "grad_norm": 0.40335252637484265,
      "learning_rate": 4.177599975770606e-05,
      "loss": 1.4536,
      "num_input_tokens_seen": 23717059616,
      "step": 30145
    },
    {
      "epoch": 3.198175259919372,
      "grad_norm": 0.4223765596147532,
      "learning_rate": 4.1775484486637474e-05,
      "loss": 1.5051,
      "num_input_tokens_seen": 23717846416,
      "step": 30146
    },
    {
      "epoch": 3.1982813494589433,
      "grad_norm": 0.4119915630877152,
      "learning_rate": 4.1774969202605274e-05,
      "loss": 1.3418,
      "num_input_tokens_seen": 23718633136,
      "step": 30147
    },
    {
      "epoch": 3.1983874389985147,
      "grad_norm": 0.404971959283824,
      "learning_rate": 4.177445390560988e-05,
      "loss": 1.4182,
      "num_input_tokens_seen": 23719419952,
      "step": 30148
    },
    {
      "epoch": 3.198493528538086,
      "grad_norm": 0.4581244205127999,
      "learning_rate": 4.1773938595651675e-05,
      "loss": 1.6061,
      "num_input_tokens_seen": 23720206688,
      "step": 30149
    },
    {
      "epoch": 3.1985996180776577,
      "grad_norm": 0.4165213203520512,
      "learning_rate": 4.177342327273107e-05,
      "loss": 1.4364,
      "num_input_tokens_seen": 23720993408,
      "step": 30150
    },
    {
      "epoch": 3.198705707617229,
      "grad_norm": 0.4025428159455764,
      "learning_rate": 4.177290793684845e-05,
      "loss": 1.4033,
      "num_input_tokens_seen": 23721780208,
      "step": 30151
    },
    {
      "epoch": 3.1988117971568,
      "grad_norm": 0.4498812038684664,
      "learning_rate": 4.177239258800422e-05,
      "loss": 1.4481,
      "num_input_tokens_seen": 23722567040,
      "step": 30152
    },
    {
      "epoch": 3.1989178866963717,
      "grad_norm": 0.39049050448654765,
      "learning_rate": 4.1771877226198776e-05,
      "loss": 1.5116,
      "num_input_tokens_seen": 23723353728,
      "step": 30153
    },
    {
      "epoch": 3.199023976235943,
      "grad_norm": 0.46230678344389486,
      "learning_rate": 4.177136185143251e-05,
      "loss": 1.5254,
      "num_input_tokens_seen": 23724140528,
      "step": 30154
    },
    {
      "epoch": 3.1991300657755146,
      "grad_norm": 0.4350300559903337,
      "learning_rate": 4.177084646370584e-05,
      "loss": 1.488,
      "num_input_tokens_seen": 23724927232,
      "step": 30155
    },
    {
      "epoch": 3.199236155315086,
      "grad_norm": 0.4272525146196191,
      "learning_rate": 4.177033106301915e-05,
      "loss": 1.5187,
      "num_input_tokens_seen": 23725713904,
      "step": 30156
    },
    {
      "epoch": 3.199342244854657,
      "grad_norm": 0.43601371912998127,
      "learning_rate": 4.176981564937284e-05,
      "loss": 1.5041,
      "num_input_tokens_seen": 23726500624,
      "step": 30157
    },
    {
      "epoch": 3.1994483343942286,
      "grad_norm": 0.38889120422749307,
      "learning_rate": 4.176930022276731e-05,
      "loss": 1.4031,
      "num_input_tokens_seen": 23727287440,
      "step": 30158
    },
    {
      "epoch": 3.1995544239338,
      "grad_norm": 0.38103952010738523,
      "learning_rate": 4.1768784783202945e-05,
      "loss": 1.4531,
      "num_input_tokens_seen": 23728074240,
      "step": 30159
    },
    {
      "epoch": 3.1996605134733715,
      "grad_norm": 0.4663842484958735,
      "learning_rate": 4.1768269330680165e-05,
      "loss": 1.5778,
      "num_input_tokens_seen": 23728861008,
      "step": 30160
    },
    {
      "epoch": 3.199766603012943,
      "grad_norm": 0.42779655738822236,
      "learning_rate": 4.176775386519935e-05,
      "loss": 1.5201,
      "num_input_tokens_seen": 23729647632,
      "step": 30161
    },
    {
      "epoch": 3.1998726925525145,
      "grad_norm": 0.4834110115673665,
      "learning_rate": 4.176723838676092e-05,
      "loss": 1.5276,
      "num_input_tokens_seen": 23730434352,
      "step": 30162
    },
    {
      "epoch": 3.1999787820920855,
      "grad_norm": 0.5193013465927069,
      "learning_rate": 4.176672289536525e-05,
      "loss": 1.5959,
      "num_input_tokens_seen": 23731221152,
      "step": 30163
    },
    {
      "epoch": 3.200084871631657,
      "grad_norm": 0.6046178087959471,
      "learning_rate": 4.1766207391012756e-05,
      "loss": 1.419,
      "num_input_tokens_seen": 23732007904,
      "step": 30164
    },
    {
      "epoch": 3.2001909611712285,
      "grad_norm": 0.621751631374726,
      "learning_rate": 4.176569187370382e-05,
      "loss": 1.4155,
      "num_input_tokens_seen": 23732794576,
      "step": 30165
    },
    {
      "epoch": 3.2002970507108,
      "grad_norm": 0.5157328740222134,
      "learning_rate": 4.176517634343886e-05,
      "loss": 1.5217,
      "num_input_tokens_seen": 23733581392,
      "step": 30166
    },
    {
      "epoch": 3.2004031402503714,
      "grad_norm": 0.6172328589985444,
      "learning_rate": 4.176466080021826e-05,
      "loss": 1.6087,
      "num_input_tokens_seen": 23734368176,
      "step": 30167
    },
    {
      "epoch": 3.200509229789943,
      "grad_norm": 0.5050492165020876,
      "learning_rate": 4.1764145244042415e-05,
      "loss": 1.4402,
      "num_input_tokens_seen": 23735154928,
      "step": 30168
    },
    {
      "epoch": 3.200615319329514,
      "grad_norm": 0.589028658157342,
      "learning_rate": 4.176362967491173e-05,
      "loss": 1.4751,
      "num_input_tokens_seen": 23735941696,
      "step": 30169
    },
    {
      "epoch": 3.2007214088690854,
      "grad_norm": 0.4814615815387251,
      "learning_rate": 4.176311409282662e-05,
      "loss": 1.4658,
      "num_input_tokens_seen": 23736728480,
      "step": 30170
    },
    {
      "epoch": 3.200827498408657,
      "grad_norm": 0.5728773928683285,
      "learning_rate": 4.176259849778745e-05,
      "loss": 1.4156,
      "num_input_tokens_seen": 23737515264,
      "step": 30171
    },
    {
      "epoch": 3.2009335879482284,
      "grad_norm": 0.43182004322827416,
      "learning_rate": 4.176208288979464e-05,
      "loss": 1.3435,
      "num_input_tokens_seen": 23738302032,
      "step": 30172
    },
    {
      "epoch": 3.2010396774878,
      "grad_norm": 0.4874712532174237,
      "learning_rate": 4.176156726884859e-05,
      "loss": 1.5771,
      "num_input_tokens_seen": 23739088800,
      "step": 30173
    },
    {
      "epoch": 3.2011457670273713,
      "grad_norm": 0.5838181670412372,
      "learning_rate": 4.176105163494969e-05,
      "loss": 1.5132,
      "num_input_tokens_seen": 23739875504,
      "step": 30174
    },
    {
      "epoch": 3.2012518565669423,
      "grad_norm": 0.5544968396849307,
      "learning_rate": 4.176053598809834e-05,
      "loss": 1.4234,
      "num_input_tokens_seen": 23740662240,
      "step": 30175
    },
    {
      "epoch": 3.201357946106514,
      "grad_norm": 0.4034795429528717,
      "learning_rate": 4.1760020328294935e-05,
      "loss": 1.4068,
      "num_input_tokens_seen": 23741449104,
      "step": 30176
    },
    {
      "epoch": 3.2014640356460853,
      "grad_norm": 0.4238766492042166,
      "learning_rate": 4.175950465553988e-05,
      "loss": 1.4848,
      "num_input_tokens_seen": 23742235904,
      "step": 30177
    },
    {
      "epoch": 3.2015701251856568,
      "grad_norm": 0.8837352344164089,
      "learning_rate": 4.175898896983358e-05,
      "loss": 1.521,
      "num_input_tokens_seen": 23743022736,
      "step": 30178
    },
    {
      "epoch": 3.2016762147252282,
      "grad_norm": 0.6326427641850715,
      "learning_rate": 4.1758473271176415e-05,
      "loss": 1.4826,
      "num_input_tokens_seen": 23743809488,
      "step": 30179
    },
    {
      "epoch": 3.2017823042647997,
      "grad_norm": 0.6864935439719139,
      "learning_rate": 4.175795755956881e-05,
      "loss": 1.4835,
      "num_input_tokens_seen": 23744596240,
      "step": 30180
    },
    {
      "epoch": 3.2018883938043707,
      "grad_norm": 0.42753868794966016,
      "learning_rate": 4.1757441835011124e-05,
      "loss": 1.4994,
      "num_input_tokens_seen": 23745382912,
      "step": 30181
    },
    {
      "epoch": 3.201994483343942,
      "grad_norm": 0.5833223068971757,
      "learning_rate": 4.175692609750379e-05,
      "loss": 1.3558,
      "num_input_tokens_seen": 23746169648,
      "step": 30182
    },
    {
      "epoch": 3.2021005728835137,
      "grad_norm": 0.5767836597248587,
      "learning_rate": 4.17564103470472e-05,
      "loss": 1.523,
      "num_input_tokens_seen": 23746956496,
      "step": 30183
    },
    {
      "epoch": 3.202206662423085,
      "grad_norm": 0.4105029207533916,
      "learning_rate": 4.175589458364174e-05,
      "loss": 1.5303,
      "num_input_tokens_seen": 23747743216,
      "step": 30184
    },
    {
      "epoch": 3.2023127519626566,
      "grad_norm": 0.9123127821124634,
      "learning_rate": 4.175537880728781e-05,
      "loss": 1.5574,
      "num_input_tokens_seen": 23748529984,
      "step": 30185
    },
    {
      "epoch": 3.2024188415022277,
      "grad_norm": 0.4043536903366154,
      "learning_rate": 4.175486301798583e-05,
      "loss": 1.4647,
      "num_input_tokens_seen": 23749316816,
      "step": 30186
    },
    {
      "epoch": 3.202524931041799,
      "grad_norm": 0.7814861188140266,
      "learning_rate": 4.175434721573618e-05,
      "loss": 1.3778,
      "num_input_tokens_seen": 23750103552,
      "step": 30187
    },
    {
      "epoch": 3.2026310205813706,
      "grad_norm": 0.4938265345931318,
      "learning_rate": 4.175383140053925e-05,
      "loss": 1.4555,
      "num_input_tokens_seen": 23750890320,
      "step": 30188
    },
    {
      "epoch": 3.202737110120942,
      "grad_norm": 0.5994907590365579,
      "learning_rate": 4.175331557239547e-05,
      "loss": 1.4427,
      "num_input_tokens_seen": 23751677136,
      "step": 30189
    },
    {
      "epoch": 3.2028431996605136,
      "grad_norm": 0.582503796038966,
      "learning_rate": 4.17527997313052e-05,
      "loss": 1.3644,
      "num_input_tokens_seen": 23752463904,
      "step": 30190
    },
    {
      "epoch": 3.202949289200085,
      "grad_norm": 0.47616967214532085,
      "learning_rate": 4.175228387726887e-05,
      "loss": 1.4399,
      "num_input_tokens_seen": 23753250720,
      "step": 30191
    },
    {
      "epoch": 3.203055378739656,
      "grad_norm": 0.7305949791131517,
      "learning_rate": 4.175176801028687e-05,
      "loss": 1.4695,
      "num_input_tokens_seen": 23754037600,
      "step": 30192
    },
    {
      "epoch": 3.2031614682792275,
      "grad_norm": 0.4609404970342999,
      "learning_rate": 4.175125213035959e-05,
      "loss": 1.3798,
      "num_input_tokens_seen": 23754824304,
      "step": 30193
    },
    {
      "epoch": 3.203267557818799,
      "grad_norm": 0.5121477712652823,
      "learning_rate": 4.175073623748743e-05,
      "loss": 1.4854,
      "num_input_tokens_seen": 23755611104,
      "step": 30194
    },
    {
      "epoch": 3.2033736473583705,
      "grad_norm": 0.48969022190790534,
      "learning_rate": 4.1750220331670794e-05,
      "loss": 1.4027,
      "num_input_tokens_seen": 23756397840,
      "step": 30195
    },
    {
      "epoch": 3.203479736897942,
      "grad_norm": 0.4662556513034923,
      "learning_rate": 4.1749704412910085e-05,
      "loss": 1.4382,
      "num_input_tokens_seen": 23757184592,
      "step": 30196
    },
    {
      "epoch": 3.2035858264375134,
      "grad_norm": 0.5479430247410363,
      "learning_rate": 4.174918848120569e-05,
      "loss": 1.4622,
      "num_input_tokens_seen": 23757971264,
      "step": 30197
    },
    {
      "epoch": 3.2036919159770845,
      "grad_norm": 0.4450755287671837,
      "learning_rate": 4.174867253655801e-05,
      "loss": 1.5364,
      "num_input_tokens_seen": 23758758016,
      "step": 30198
    },
    {
      "epoch": 3.203798005516656,
      "grad_norm": 0.46562181060826874,
      "learning_rate": 4.174815657896746e-05,
      "loss": 1.5254,
      "num_input_tokens_seen": 23759544816,
      "step": 30199
    },
    {
      "epoch": 3.2039040950562274,
      "grad_norm": 0.44181023953511783,
      "learning_rate": 4.1747640608434414e-05,
      "loss": 1.4273,
      "num_input_tokens_seen": 23760331552,
      "step": 30200
    },
    {
      "epoch": 3.204010184595799,
      "grad_norm": 0.5209958093161724,
      "learning_rate": 4.174712462495929e-05,
      "loss": 1.4887,
      "num_input_tokens_seen": 23761118304,
      "step": 30201
    },
    {
      "epoch": 3.2041162741353704,
      "grad_norm": 0.5199566516505671,
      "learning_rate": 4.174660862854247e-05,
      "loss": 1.5186,
      "num_input_tokens_seen": 23761905056,
      "step": 30202
    },
    {
      "epoch": 3.204222363674942,
      "grad_norm": 0.46477332463068893,
      "learning_rate": 4.174609261918437e-05,
      "loss": 1.5359,
      "num_input_tokens_seen": 23762691776,
      "step": 30203
    },
    {
      "epoch": 3.204328453214513,
      "grad_norm": 0.4903986223428757,
      "learning_rate": 4.1745576596885385e-05,
      "loss": 1.4582,
      "num_input_tokens_seen": 23763478544,
      "step": 30204
    },
    {
      "epoch": 3.2044345427540843,
      "grad_norm": 0.4671956922819375,
      "learning_rate": 4.17450605616459e-05,
      "loss": 1.4983,
      "num_input_tokens_seen": 23764265296,
      "step": 30205
    },
    {
      "epoch": 3.204540632293656,
      "grad_norm": 0.5443661374242694,
      "learning_rate": 4.174454451346633e-05,
      "loss": 1.5466,
      "num_input_tokens_seen": 23765052080,
      "step": 30206
    },
    {
      "epoch": 3.2046467218332273,
      "grad_norm": 0.4483985497688887,
      "learning_rate": 4.1744028452347065e-05,
      "loss": 1.4586,
      "num_input_tokens_seen": 23765838864,
      "step": 30207
    },
    {
      "epoch": 3.2047528113727988,
      "grad_norm": 0.43544699362596906,
      "learning_rate": 4.174351237828851e-05,
      "loss": 1.4799,
      "num_input_tokens_seen": 23766625616,
      "step": 30208
    },
    {
      "epoch": 3.2048589009123702,
      "grad_norm": 0.5509189739139908,
      "learning_rate": 4.174299629129105e-05,
      "loss": 1.6216,
      "num_input_tokens_seen": 23767412400,
      "step": 30209
    },
    {
      "epoch": 3.2049649904519413,
      "grad_norm": 0.5105891522754268,
      "learning_rate": 4.1742480191355105e-05,
      "loss": 1.6162,
      "num_input_tokens_seen": 23768199152,
      "step": 30210
    },
    {
      "epoch": 3.2050710799915128,
      "grad_norm": 0.44120968498135493,
      "learning_rate": 4.1741964078481054e-05,
      "loss": 1.5256,
      "num_input_tokens_seen": 23768985872,
      "step": 30211
    },
    {
      "epoch": 3.2051771695310842,
      "grad_norm": 0.39181979999361943,
      "learning_rate": 4.174144795266931e-05,
      "loss": 1.4118,
      "num_input_tokens_seen": 23769772672,
      "step": 30212
    },
    {
      "epoch": 3.2052832590706557,
      "grad_norm": 0.48177148648722773,
      "learning_rate": 4.174093181392027e-05,
      "loss": 1.6491,
      "num_input_tokens_seen": 23770559440,
      "step": 30213
    },
    {
      "epoch": 3.205389348610227,
      "grad_norm": 0.42916465822917166,
      "learning_rate": 4.1740415662234325e-05,
      "loss": 1.472,
      "num_input_tokens_seen": 23771346224,
      "step": 30214
    },
    {
      "epoch": 3.205495438149798,
      "grad_norm": 0.44157567986740087,
      "learning_rate": 4.173989949761187e-05,
      "loss": 1.4024,
      "num_input_tokens_seen": 23772133008,
      "step": 30215
    },
    {
      "epoch": 3.2056015276893697,
      "grad_norm": 0.43780664197663355,
      "learning_rate": 4.173938332005331e-05,
      "loss": 1.4514,
      "num_input_tokens_seen": 23772919744,
      "step": 30216
    },
    {
      "epoch": 3.205707617228941,
      "grad_norm": 0.445135773148138,
      "learning_rate": 4.173886712955907e-05,
      "loss": 1.3827,
      "num_input_tokens_seen": 23773706576,
      "step": 30217
    },
    {
      "epoch": 3.2058137067685126,
      "grad_norm": 0.3990251312827065,
      "learning_rate": 4.17383509261295e-05,
      "loss": 1.4072,
      "num_input_tokens_seen": 23774493360,
      "step": 30218
    },
    {
      "epoch": 3.205919796308084,
      "grad_norm": 0.40501494724023424,
      "learning_rate": 4.1737834709765036e-05,
      "loss": 1.3878,
      "num_input_tokens_seen": 23775280176,
      "step": 30219
    },
    {
      "epoch": 3.2060258858476556,
      "grad_norm": 0.4375780158060323,
      "learning_rate": 4.1737318480466056e-05,
      "loss": 1.5174,
      "num_input_tokens_seen": 23776067008,
      "step": 30220
    },
    {
      "epoch": 3.206131975387227,
      "grad_norm": 0.460522544457315,
      "learning_rate": 4.173680223823297e-05,
      "loss": 1.4298,
      "num_input_tokens_seen": 23776853792,
      "step": 30221
    },
    {
      "epoch": 3.206238064926798,
      "grad_norm": 0.47929244208313393,
      "learning_rate": 4.173628598306618e-05,
      "loss": 1.484,
      "num_input_tokens_seen": 23777640528,
      "step": 30222
    },
    {
      "epoch": 3.2063441544663696,
      "grad_norm": 0.397274080273463,
      "learning_rate": 4.173576971496608e-05,
      "loss": 1.3812,
      "num_input_tokens_seen": 23778427376,
      "step": 30223
    },
    {
      "epoch": 3.206450244005941,
      "grad_norm": 0.45864190190307796,
      "learning_rate": 4.1735253433933066e-05,
      "loss": 1.4274,
      "num_input_tokens_seen": 23779214208,
      "step": 30224
    },
    {
      "epoch": 3.2065563335455125,
      "grad_norm": 0.40730649257912777,
      "learning_rate": 4.1734737139967526e-05,
      "loss": 1.2918,
      "num_input_tokens_seen": 23780001072,
      "step": 30225
    },
    {
      "epoch": 3.206662423085084,
      "grad_norm": 0.4292023065109403,
      "learning_rate": 4.173422083306989e-05,
      "loss": 1.49,
      "num_input_tokens_seen": 23780787792,
      "step": 30226
    },
    {
      "epoch": 3.206768512624655,
      "grad_norm": 0.48252896960021097,
      "learning_rate": 4.173370451324053e-05,
      "loss": 1.499,
      "num_input_tokens_seen": 23781574560,
      "step": 30227
    },
    {
      "epoch": 3.2068746021642265,
      "grad_norm": 0.4355787323939408,
      "learning_rate": 4.1733188180479854e-05,
      "loss": 1.5094,
      "num_input_tokens_seen": 23782361376,
      "step": 30228
    },
    {
      "epoch": 3.206980691703798,
      "grad_norm": 0.4044547910697323,
      "learning_rate": 4.173267183478827e-05,
      "loss": 1.4117,
      "num_input_tokens_seen": 23783148160,
      "step": 30229
    },
    {
      "epoch": 3.2070867812433694,
      "grad_norm": 0.4148603931089871,
      "learning_rate": 4.1732155476166155e-05,
      "loss": 1.4894,
      "num_input_tokens_seen": 23783934816,
      "step": 30230
    },
    {
      "epoch": 3.207192870782941,
      "grad_norm": 0.3977896773057861,
      "learning_rate": 4.173163910461393e-05,
      "loss": 1.4046,
      "num_input_tokens_seen": 23784721696,
      "step": 30231
    },
    {
      "epoch": 3.2072989603225124,
      "grad_norm": 0.3859106194588826,
      "learning_rate": 4.173112272013199e-05,
      "loss": 1.551,
      "num_input_tokens_seen": 23785508432,
      "step": 30232
    },
    {
      "epoch": 3.2074050498620834,
      "grad_norm": 0.4030565383240668,
      "learning_rate": 4.173060632272072e-05,
      "loss": 1.5391,
      "num_input_tokens_seen": 23786295184,
      "step": 30233
    },
    {
      "epoch": 3.207511139401655,
      "grad_norm": 0.38156270914702056,
      "learning_rate": 4.173008991238053e-05,
      "loss": 1.5042,
      "num_input_tokens_seen": 23787081920,
      "step": 30234
    },
    {
      "epoch": 3.2076172289412264,
      "grad_norm": 0.44862174389516046,
      "learning_rate": 4.172957348911182e-05,
      "loss": 1.4871,
      "num_input_tokens_seen": 23787868672,
      "step": 30235
    },
    {
      "epoch": 3.207723318480798,
      "grad_norm": 0.39354758191536976,
      "learning_rate": 4.172905705291498e-05,
      "loss": 1.3516,
      "num_input_tokens_seen": 23788655472,
      "step": 30236
    },
    {
      "epoch": 3.2078294080203693,
      "grad_norm": 0.3932905623232694,
      "learning_rate": 4.172854060379042e-05,
      "loss": 1.466,
      "num_input_tokens_seen": 23789442208,
      "step": 30237
    },
    {
      "epoch": 3.207935497559941,
      "grad_norm": 0.44578997687093314,
      "learning_rate": 4.172802414173854e-05,
      "loss": 1.3916,
      "num_input_tokens_seen": 23790229008,
      "step": 30238
    },
    {
      "epoch": 3.208041587099512,
      "grad_norm": 0.394172952209328,
      "learning_rate": 4.172750766675973e-05,
      "loss": 1.4944,
      "num_input_tokens_seen": 23791015696,
      "step": 30239
    },
    {
      "epoch": 3.2081476766390833,
      "grad_norm": 0.5177452119505923,
      "learning_rate": 4.1726991178854386e-05,
      "loss": 1.5026,
      "num_input_tokens_seen": 23791802416,
      "step": 30240
    },
    {
      "epoch": 3.2082537661786548,
      "grad_norm": 0.5092051441367771,
      "learning_rate": 4.172647467802292e-05,
      "loss": 1.4959,
      "num_input_tokens_seen": 23792589264,
      "step": 30241
    },
    {
      "epoch": 3.2083598557182262,
      "grad_norm": 0.4363144049849581,
      "learning_rate": 4.172595816426572e-05,
      "loss": 1.5994,
      "num_input_tokens_seen": 23793376000,
      "step": 30242
    },
    {
      "epoch": 3.2084659452577977,
      "grad_norm": 0.4386895082798546,
      "learning_rate": 4.17254416375832e-05,
      "loss": 1.3883,
      "num_input_tokens_seen": 23794162688,
      "step": 30243
    },
    {
      "epoch": 3.2085720347973687,
      "grad_norm": 0.4742645690063156,
      "learning_rate": 4.1724925097975745e-05,
      "loss": 1.5254,
      "num_input_tokens_seen": 23794949424,
      "step": 30244
    },
    {
      "epoch": 3.20867812433694,
      "grad_norm": 0.4127900232630466,
      "learning_rate": 4.172440854544376e-05,
      "loss": 1.4222,
      "num_input_tokens_seen": 23795736208,
      "step": 30245
    },
    {
      "epoch": 3.2087842138765117,
      "grad_norm": 0.506032466932487,
      "learning_rate": 4.172389197998764e-05,
      "loss": 1.4736,
      "num_input_tokens_seen": 23796523072,
      "step": 30246
    },
    {
      "epoch": 3.208890303416083,
      "grad_norm": 0.38115720169646317,
      "learning_rate": 4.172337540160779e-05,
      "loss": 1.4667,
      "num_input_tokens_seen": 23797309856,
      "step": 30247
    },
    {
      "epoch": 3.2089963929556546,
      "grad_norm": 0.41408046756017974,
      "learning_rate": 4.17228588103046e-05,
      "loss": 1.4596,
      "num_input_tokens_seen": 23798096608,
      "step": 30248
    },
    {
      "epoch": 3.209102482495226,
      "grad_norm": 0.43406536623699277,
      "learning_rate": 4.172234220607848e-05,
      "loss": 1.3733,
      "num_input_tokens_seen": 23798883376,
      "step": 30249
    },
    {
      "epoch": 3.2092085720347976,
      "grad_norm": 0.3892757165451695,
      "learning_rate": 4.1721825588929824e-05,
      "loss": 1.4409,
      "num_input_tokens_seen": 23799670128,
      "step": 30250
    },
    {
      "epoch": 3.2093146615743686,
      "grad_norm": 0.3701055094815936,
      "learning_rate": 4.172130895885903e-05,
      "loss": 1.3064,
      "num_input_tokens_seen": 23800456944,
      "step": 30251
    },
    {
      "epoch": 3.20942075111394,
      "grad_norm": 0.44462322958236167,
      "learning_rate": 4.172079231586651e-05,
      "loss": 1.567,
      "num_input_tokens_seen": 23801243632,
      "step": 30252
    },
    {
      "epoch": 3.2095268406535116,
      "grad_norm": 0.4165965143979494,
      "learning_rate": 4.1720275659952635e-05,
      "loss": 1.4008,
      "num_input_tokens_seen": 23802030416,
      "step": 30253
    },
    {
      "epoch": 3.209632930193083,
      "grad_norm": 0.45215246671286863,
      "learning_rate": 4.171975899111783e-05,
      "loss": 1.4561,
      "num_input_tokens_seen": 23802817184,
      "step": 30254
    },
    {
      "epoch": 3.2097390197326545,
      "grad_norm": 0.453747589000367,
      "learning_rate": 4.171924230936249e-05,
      "loss": 1.4285,
      "num_input_tokens_seen": 23803603904,
      "step": 30255
    },
    {
      "epoch": 3.2098451092722255,
      "grad_norm": 0.4047496679632433,
      "learning_rate": 4.1718725614687005e-05,
      "loss": 1.43,
      "num_input_tokens_seen": 23804390752,
      "step": 30256
    },
    {
      "epoch": 3.209951198811797,
      "grad_norm": 0.43942554637549885,
      "learning_rate": 4.171820890709178e-05,
      "loss": 1.5269,
      "num_input_tokens_seen": 23805177504,
      "step": 30257
    },
    {
      "epoch": 3.2100572883513685,
      "grad_norm": 0.46795591146840004,
      "learning_rate": 4.1717692186577215e-05,
      "loss": 1.4967,
      "num_input_tokens_seen": 23805964400,
      "step": 30258
    },
    {
      "epoch": 3.21016337789094,
      "grad_norm": 0.4271657212538138,
      "learning_rate": 4.171717545314371e-05,
      "loss": 1.4548,
      "num_input_tokens_seen": 23806751200,
      "step": 30259
    },
    {
      "epoch": 3.2102694674305114,
      "grad_norm": 0.4502935192087123,
      "learning_rate": 4.171665870679166e-05,
      "loss": 1.439,
      "num_input_tokens_seen": 23807537968,
      "step": 30260
    },
    {
      "epoch": 3.210375556970083,
      "grad_norm": 0.4618458499116429,
      "learning_rate": 4.171614194752146e-05,
      "loss": 1.4749,
      "num_input_tokens_seen": 23808324832,
      "step": 30261
    },
    {
      "epoch": 3.210481646509654,
      "grad_norm": 0.4862862791556043,
      "learning_rate": 4.171562517533353e-05,
      "loss": 1.5012,
      "num_input_tokens_seen": 23809111536,
      "step": 30262
    },
    {
      "epoch": 3.2105877360492254,
      "grad_norm": 0.45934568346517324,
      "learning_rate": 4.171510839022824e-05,
      "loss": 1.4801,
      "num_input_tokens_seen": 23809898288,
      "step": 30263
    },
    {
      "epoch": 3.210693825588797,
      "grad_norm": 0.49309638563191727,
      "learning_rate": 4.171459159220601e-05,
      "loss": 1.3351,
      "num_input_tokens_seen": 23810685072,
      "step": 30264
    },
    {
      "epoch": 3.2107999151283684,
      "grad_norm": 0.4770212786024442,
      "learning_rate": 4.171407478126724e-05,
      "loss": 1.4387,
      "num_input_tokens_seen": 23811471792,
      "step": 30265
    },
    {
      "epoch": 3.21090600466794,
      "grad_norm": 0.4846485019817147,
      "learning_rate": 4.171355795741232e-05,
      "loss": 1.4358,
      "num_input_tokens_seen": 23812258592,
      "step": 30266
    },
    {
      "epoch": 3.2110120942075113,
      "grad_norm": 0.6610480798458125,
      "learning_rate": 4.1713041120641646e-05,
      "loss": 1.4818,
      "num_input_tokens_seen": 23813045392,
      "step": 30267
    },
    {
      "epoch": 3.2111181837470824,
      "grad_norm": 0.41165221752476483,
      "learning_rate": 4.171252427095563e-05,
      "loss": 1.4091,
      "num_input_tokens_seen": 23813832128,
      "step": 30268
    },
    {
      "epoch": 3.211224273286654,
      "grad_norm": 0.6999354876344104,
      "learning_rate": 4.171200740835467e-05,
      "loss": 1.4014,
      "num_input_tokens_seen": 23814619008,
      "step": 30269
    },
    {
      "epoch": 3.2113303628262253,
      "grad_norm": 0.5016749704783385,
      "learning_rate": 4.171149053283916e-05,
      "loss": 1.5005,
      "num_input_tokens_seen": 23815405840,
      "step": 30270
    },
    {
      "epoch": 3.211436452365797,
      "grad_norm": 0.5491406713175359,
      "learning_rate": 4.1710973644409494e-05,
      "loss": 1.3409,
      "num_input_tokens_seen": 23816192496,
      "step": 30271
    },
    {
      "epoch": 3.2115425419053683,
      "grad_norm": 0.45713258207809804,
      "learning_rate": 4.171045674306608e-05,
      "loss": 1.4389,
      "num_input_tokens_seen": 23816979280,
      "step": 30272
    },
    {
      "epoch": 3.2116486314449397,
      "grad_norm": 0.5223764992699584,
      "learning_rate": 4.1709939828809317e-05,
      "loss": 1.4617,
      "num_input_tokens_seen": 23817766032,
      "step": 30273
    },
    {
      "epoch": 3.2117547209845108,
      "grad_norm": 0.3792411968171984,
      "learning_rate": 4.170942290163961e-05,
      "loss": 1.3563,
      "num_input_tokens_seen": 23818552880,
      "step": 30274
    },
    {
      "epoch": 3.2118608105240822,
      "grad_norm": 0.42006778181885585,
      "learning_rate": 4.170890596155734e-05,
      "loss": 1.497,
      "num_input_tokens_seen": 23819339664,
      "step": 30275
    },
    {
      "epoch": 3.2119669000636537,
      "grad_norm": 0.4921563173200965,
      "learning_rate": 4.170838900856292e-05,
      "loss": 1.4582,
      "num_input_tokens_seen": 23820126416,
      "step": 30276
    },
    {
      "epoch": 3.212072989603225,
      "grad_norm": 0.4123170875412738,
      "learning_rate": 4.1707872042656746e-05,
      "loss": 1.4666,
      "num_input_tokens_seen": 23820913136,
      "step": 30277
    },
    {
      "epoch": 3.2121790791427967,
      "grad_norm": 0.42490617703326644,
      "learning_rate": 4.170735506383922e-05,
      "loss": 1.4612,
      "num_input_tokens_seen": 23821699776,
      "step": 30278
    },
    {
      "epoch": 3.212285168682368,
      "grad_norm": 0.464595557789988,
      "learning_rate": 4.1706838072110757e-05,
      "loss": 1.3831,
      "num_input_tokens_seen": 23822486512,
      "step": 30279
    },
    {
      "epoch": 3.212391258221939,
      "grad_norm": 0.46203488121660014,
      "learning_rate": 4.170632106747172e-05,
      "loss": 1.379,
      "num_input_tokens_seen": 23823273360,
      "step": 30280
    },
    {
      "epoch": 3.2124973477615106,
      "grad_norm": 0.4565881429601109,
      "learning_rate": 4.170580404992252e-05,
      "loss": 1.4604,
      "num_input_tokens_seen": 23824060080,
      "step": 30281
    },
    {
      "epoch": 3.212603437301082,
      "grad_norm": 0.42374241981188665,
      "learning_rate": 4.1705287019463584e-05,
      "loss": 1.3253,
      "num_input_tokens_seen": 23824846928,
      "step": 30282
    },
    {
      "epoch": 3.2127095268406536,
      "grad_norm": 0.47218505679632805,
      "learning_rate": 4.1704769976095286e-05,
      "loss": 1.4733,
      "num_input_tokens_seen": 23825633664,
      "step": 30283
    },
    {
      "epoch": 3.212815616380225,
      "grad_norm": 0.3810293379219377,
      "learning_rate": 4.170425291981803e-05,
      "loss": 1.3295,
      "num_input_tokens_seen": 23826420528,
      "step": 30284
    },
    {
      "epoch": 3.212921705919796,
      "grad_norm": 0.5654598089958331,
      "learning_rate": 4.170373585063222e-05,
      "loss": 1.5945,
      "num_input_tokens_seen": 23827207312,
      "step": 30285
    },
    {
      "epoch": 3.2130277954593676,
      "grad_norm": 0.41691403178678305,
      "learning_rate": 4.1703218768538255e-05,
      "loss": 1.5938,
      "num_input_tokens_seen": 23827994096,
      "step": 30286
    },
    {
      "epoch": 3.213133884998939,
      "grad_norm": 0.46276862573747707,
      "learning_rate": 4.170270167353653e-05,
      "loss": 1.4121,
      "num_input_tokens_seen": 23828780832,
      "step": 30287
    },
    {
      "epoch": 3.2132399745385105,
      "grad_norm": 0.4442551524591154,
      "learning_rate": 4.1702184565627445e-05,
      "loss": 1.5141,
      "num_input_tokens_seen": 23829567744,
      "step": 30288
    },
    {
      "epoch": 3.213346064078082,
      "grad_norm": 0.38648833911784763,
      "learning_rate": 4.170166744481141e-05,
      "loss": 1.4782,
      "num_input_tokens_seen": 23830354480,
      "step": 30289
    },
    {
      "epoch": 3.2134521536176535,
      "grad_norm": 0.4146614742695923,
      "learning_rate": 4.170115031108881e-05,
      "loss": 1.3734,
      "num_input_tokens_seen": 23831141328,
      "step": 30290
    },
    {
      "epoch": 3.2135582431572245,
      "grad_norm": 0.41316398369519397,
      "learning_rate": 4.170063316446005e-05,
      "loss": 1.465,
      "num_input_tokens_seen": 23831928080,
      "step": 30291
    },
    {
      "epoch": 3.213664332696796,
      "grad_norm": 0.410968768729689,
      "learning_rate": 4.170011600492553e-05,
      "loss": 1.3576,
      "num_input_tokens_seen": 23832714784,
      "step": 30292
    },
    {
      "epoch": 3.2137704222363674,
      "grad_norm": 0.5049889816308225,
      "learning_rate": 4.1699598832485655e-05,
      "loss": 1.5784,
      "num_input_tokens_seen": 23833501488,
      "step": 30293
    },
    {
      "epoch": 3.213876511775939,
      "grad_norm": 0.4077649437307205,
      "learning_rate": 4.169908164714081e-05,
      "loss": 1.4645,
      "num_input_tokens_seen": 23834288240,
      "step": 30294
    },
    {
      "epoch": 3.2139826013155104,
      "grad_norm": 0.47334691661566636,
      "learning_rate": 4.169856444889142e-05,
      "loss": 1.4069,
      "num_input_tokens_seen": 23835074992,
      "step": 30295
    },
    {
      "epoch": 3.214088690855082,
      "grad_norm": 0.388428600431979,
      "learning_rate": 4.169804723773786e-05,
      "loss": 1.48,
      "num_input_tokens_seen": 23835861648,
      "step": 30296
    },
    {
      "epoch": 3.214194780394653,
      "grad_norm": 0.4594592653470326,
      "learning_rate": 4.169753001368054e-05,
      "loss": 1.5073,
      "num_input_tokens_seen": 23836648432,
      "step": 30297
    },
    {
      "epoch": 3.2143008699342244,
      "grad_norm": 0.3997900857879208,
      "learning_rate": 4.169701277671986e-05,
      "loss": 1.3559,
      "num_input_tokens_seen": 23837435248,
      "step": 30298
    },
    {
      "epoch": 3.214406959473796,
      "grad_norm": 0.6543925634759892,
      "learning_rate": 4.1696495526856224e-05,
      "loss": 1.6163,
      "num_input_tokens_seen": 23838222000,
      "step": 30299
    },
    {
      "epoch": 3.2145130490133673,
      "grad_norm": 0.5175704750907971,
      "learning_rate": 4.169597826409002e-05,
      "loss": 1.4807,
      "num_input_tokens_seen": 23839008752,
      "step": 30300
    },
    {
      "epoch": 3.214619138552939,
      "grad_norm": 0.4451197297635519,
      "learning_rate": 4.169546098842165e-05,
      "loss": 1.435,
      "num_input_tokens_seen": 23839795488,
      "step": 30301
    },
    {
      "epoch": 3.2147252280925103,
      "grad_norm": 0.41833201274450643,
      "learning_rate": 4.1694943699851524e-05,
      "loss": 1.3874,
      "num_input_tokens_seen": 23840582240,
      "step": 30302
    },
    {
      "epoch": 3.2148313176320813,
      "grad_norm": 0.4320453407184333,
      "learning_rate": 4.1694426398380035e-05,
      "loss": 1.5368,
      "num_input_tokens_seen": 23841368992,
      "step": 30303
    },
    {
      "epoch": 3.2149374071716528,
      "grad_norm": 0.40864657100045193,
      "learning_rate": 4.169390908400758e-05,
      "loss": 1.4889,
      "num_input_tokens_seen": 23842155664,
      "step": 30304
    },
    {
      "epoch": 3.2150434967112242,
      "grad_norm": 0.4045611305635608,
      "learning_rate": 4.1693391756734565e-05,
      "loss": 1.464,
      "num_input_tokens_seen": 23842942400,
      "step": 30305
    },
    {
      "epoch": 3.2151495862507957,
      "grad_norm": 0.47263164339652025,
      "learning_rate": 4.1692874416561375e-05,
      "loss": 1.497,
      "num_input_tokens_seen": 23843729168,
      "step": 30306
    },
    {
      "epoch": 3.215255675790367,
      "grad_norm": 0.39008512770428033,
      "learning_rate": 4.169235706348844e-05,
      "loss": 1.4087,
      "num_input_tokens_seen": 23844515984,
      "step": 30307
    },
    {
      "epoch": 3.2153617653299387,
      "grad_norm": 0.398598702511265,
      "learning_rate": 4.1691839697516134e-05,
      "loss": 1.4831,
      "num_input_tokens_seen": 23845302672,
      "step": 30308
    },
    {
      "epoch": 3.2154678548695097,
      "grad_norm": 0.37341176818403643,
      "learning_rate": 4.169132231864486e-05,
      "loss": 1.4036,
      "num_input_tokens_seen": 23846089440,
      "step": 30309
    },
    {
      "epoch": 3.215573944409081,
      "grad_norm": 0.4228636581452227,
      "learning_rate": 4.169080492687503e-05,
      "loss": 1.4825,
      "num_input_tokens_seen": 23846876240,
      "step": 30310
    },
    {
      "epoch": 3.2156800339486526,
      "grad_norm": 0.4026203533592924,
      "learning_rate": 4.169028752220702e-05,
      "loss": 1.4038,
      "num_input_tokens_seen": 23847663040,
      "step": 30311
    },
    {
      "epoch": 3.215786123488224,
      "grad_norm": 0.4957020915271816,
      "learning_rate": 4.168977010464126e-05,
      "loss": 1.3803,
      "num_input_tokens_seen": 23848449776,
      "step": 30312
    },
    {
      "epoch": 3.2158922130277956,
      "grad_norm": 0.39880547097544194,
      "learning_rate": 4.168925267417813e-05,
      "loss": 1.5177,
      "num_input_tokens_seen": 23849236576,
      "step": 30313
    },
    {
      "epoch": 3.2159983025673666,
      "grad_norm": 0.42925621239868206,
      "learning_rate": 4.168873523081803e-05,
      "loss": 1.5286,
      "num_input_tokens_seen": 23850023360,
      "step": 30314
    },
    {
      "epoch": 3.216104392106938,
      "grad_norm": 0.4177797264672029,
      "learning_rate": 4.1688217774561376e-05,
      "loss": 1.5497,
      "num_input_tokens_seen": 23850810176,
      "step": 30315
    },
    {
      "epoch": 3.2162104816465096,
      "grad_norm": 0.4494697046055251,
      "learning_rate": 4.168770030540855e-05,
      "loss": 1.4583,
      "num_input_tokens_seen": 23851596928,
      "step": 30316
    },
    {
      "epoch": 3.216316571186081,
      "grad_norm": 0.4206353961284098,
      "learning_rate": 4.168718282335997e-05,
      "loss": 1.4335,
      "num_input_tokens_seen": 23852383632,
      "step": 30317
    },
    {
      "epoch": 3.2164226607256525,
      "grad_norm": 0.368502203741695,
      "learning_rate": 4.1686665328416005e-05,
      "loss": 1.3473,
      "num_input_tokens_seen": 23853170496,
      "step": 30318
    },
    {
      "epoch": 3.216528750265224,
      "grad_norm": 0.4831437148777334,
      "learning_rate": 4.1686147820577095e-05,
      "loss": 1.6589,
      "num_input_tokens_seen": 23853957280,
      "step": 30319
    },
    {
      "epoch": 3.2166348398047955,
      "grad_norm": 0.4677650961184925,
      "learning_rate": 4.16856302998436e-05,
      "loss": 1.5319,
      "num_input_tokens_seen": 23854744096,
      "step": 30320
    },
    {
      "epoch": 3.2167409293443665,
      "grad_norm": 0.4321445965825101,
      "learning_rate": 4.168511276621595e-05,
      "loss": 1.4753,
      "num_input_tokens_seen": 23855530848,
      "step": 30321
    },
    {
      "epoch": 3.216847018883938,
      "grad_norm": 0.4104391279530787,
      "learning_rate": 4.1684595219694546e-05,
      "loss": 1.4597,
      "num_input_tokens_seen": 23856317568,
      "step": 30322
    },
    {
      "epoch": 3.2169531084235095,
      "grad_norm": 0.41559524179644075,
      "learning_rate": 4.168407766027976e-05,
      "loss": 1.502,
      "num_input_tokens_seen": 23857104320,
      "step": 30323
    },
    {
      "epoch": 3.217059197963081,
      "grad_norm": 0.4202173532549395,
      "learning_rate": 4.1683560087972014e-05,
      "loss": 1.4757,
      "num_input_tokens_seen": 23857891072,
      "step": 30324
    },
    {
      "epoch": 3.2171652875026524,
      "grad_norm": 0.4080478339566373,
      "learning_rate": 4.1683042502771695e-05,
      "loss": 1.4033,
      "num_input_tokens_seen": 23858677856,
      "step": 30325
    },
    {
      "epoch": 3.2172713770422234,
      "grad_norm": 0.44984662565945066,
      "learning_rate": 4.168252490467922e-05,
      "loss": 1.4883,
      "num_input_tokens_seen": 23859464608,
      "step": 30326
    },
    {
      "epoch": 3.217377466581795,
      "grad_norm": 0.42797363197691496,
      "learning_rate": 4.168200729369498e-05,
      "loss": 1.4294,
      "num_input_tokens_seen": 23860251488,
      "step": 30327
    },
    {
      "epoch": 3.2174835561213664,
      "grad_norm": 0.5199715621992844,
      "learning_rate": 4.1681489669819364e-05,
      "loss": 1.4393,
      "num_input_tokens_seen": 23861038224,
      "step": 30328
    },
    {
      "epoch": 3.217589645660938,
      "grad_norm": 0.4815633244774048,
      "learning_rate": 4.168097203305279e-05,
      "loss": 1.5642,
      "num_input_tokens_seen": 23861824928,
      "step": 30329
    },
    {
      "epoch": 3.2176957352005093,
      "grad_norm": 0.6029841460335975,
      "learning_rate": 4.168045438339564e-05,
      "loss": 1.475,
      "num_input_tokens_seen": 23862611648,
      "step": 30330
    },
    {
      "epoch": 3.217801824740081,
      "grad_norm": 0.4258680964139781,
      "learning_rate": 4.1679936720848334e-05,
      "loss": 1.4662,
      "num_input_tokens_seen": 23863398384,
      "step": 30331
    },
    {
      "epoch": 3.217907914279652,
      "grad_norm": 0.5514309073073462,
      "learning_rate": 4.1679419045411264e-05,
      "loss": 1.4075,
      "num_input_tokens_seen": 23864185200,
      "step": 30332
    },
    {
      "epoch": 3.2180140038192233,
      "grad_norm": 0.6066786651155897,
      "learning_rate": 4.167890135708482e-05,
      "loss": 1.5108,
      "num_input_tokens_seen": 23864971920,
      "step": 30333
    },
    {
      "epoch": 3.218120093358795,
      "grad_norm": 0.47345625495262084,
      "learning_rate": 4.167838365586942e-05,
      "loss": 1.4125,
      "num_input_tokens_seen": 23865758656,
      "step": 30334
    },
    {
      "epoch": 3.2182261828983663,
      "grad_norm": 0.8738402412532779,
      "learning_rate": 4.167786594176545e-05,
      "loss": 1.4064,
      "num_input_tokens_seen": 23866545440,
      "step": 30335
    },
    {
      "epoch": 3.2183322724379377,
      "grad_norm": 0.4301898863137886,
      "learning_rate": 4.1677348214773314e-05,
      "loss": 1.4471,
      "num_input_tokens_seen": 23867332208,
      "step": 30336
    },
    {
      "epoch": 3.218438361977509,
      "grad_norm": 0.9411989768502095,
      "learning_rate": 4.1676830474893415e-05,
      "loss": 1.4448,
      "num_input_tokens_seen": 23868118992,
      "step": 30337
    },
    {
      "epoch": 3.2185444515170802,
      "grad_norm": 0.632761934912743,
      "learning_rate": 4.167631272212615e-05,
      "loss": 1.5551,
      "num_input_tokens_seen": 23868905744,
      "step": 30338
    },
    {
      "epoch": 3.2186505410566517,
      "grad_norm": 0.7052518955219959,
      "learning_rate": 4.167579495647192e-05,
      "loss": 1.5244,
      "num_input_tokens_seen": 23869692512,
      "step": 30339
    },
    {
      "epoch": 3.218756630596223,
      "grad_norm": 0.7373700197477329,
      "learning_rate": 4.167527717793112e-05,
      "loss": 1.6109,
      "num_input_tokens_seen": 23870479280,
      "step": 30340
    },
    {
      "epoch": 3.2188627201357947,
      "grad_norm": 0.4077699948995092,
      "learning_rate": 4.167475938650416e-05,
      "loss": 1.3961,
      "num_input_tokens_seen": 23871266064,
      "step": 30341
    },
    {
      "epoch": 3.218968809675366,
      "grad_norm": 0.5908533934572889,
      "learning_rate": 4.1674241582191434e-05,
      "loss": 1.4174,
      "num_input_tokens_seen": 23872052816,
      "step": 30342
    },
    {
      "epoch": 3.2190748992149376,
      "grad_norm": 0.4678822090611558,
      "learning_rate": 4.1673723764993344e-05,
      "loss": 1.3809,
      "num_input_tokens_seen": 23872839600,
      "step": 30343
    },
    {
      "epoch": 3.2191809887545086,
      "grad_norm": 0.4444168621308264,
      "learning_rate": 4.1673205934910284e-05,
      "loss": 1.4276,
      "num_input_tokens_seen": 23873626384,
      "step": 30344
    },
    {
      "epoch": 3.21928707829408,
      "grad_norm": 0.6511744475902586,
      "learning_rate": 4.167268809194267e-05,
      "loss": 1.4772,
      "num_input_tokens_seen": 23874413104,
      "step": 30345
    },
    {
      "epoch": 3.2193931678336516,
      "grad_norm": 0.4979087726026908,
      "learning_rate": 4.167217023609089e-05,
      "loss": 1.3745,
      "num_input_tokens_seen": 23875199792,
      "step": 30346
    },
    {
      "epoch": 3.219499257373223,
      "grad_norm": 0.6538391730407328,
      "learning_rate": 4.167165236735534e-05,
      "loss": 1.4737,
      "num_input_tokens_seen": 23875986544,
      "step": 30347
    },
    {
      "epoch": 3.2196053469127945,
      "grad_norm": 0.4895719686020864,
      "learning_rate": 4.167113448573643e-05,
      "loss": 1.3905,
      "num_input_tokens_seen": 23876773248,
      "step": 30348
    },
    {
      "epoch": 3.219711436452366,
      "grad_norm": 0.48013795652579655,
      "learning_rate": 4.167061659123456e-05,
      "loss": 1.4391,
      "num_input_tokens_seen": 23877560000,
      "step": 30349
    },
    {
      "epoch": 3.219817525991937,
      "grad_norm": 0.6297229720530484,
      "learning_rate": 4.167009868385011e-05,
      "loss": 1.466,
      "num_input_tokens_seen": 23878346784,
      "step": 30350
    },
    {
      "epoch": 3.2199236155315085,
      "grad_norm": 0.4985609913025919,
      "learning_rate": 4.1669580763583516e-05,
      "loss": 1.4644,
      "num_input_tokens_seen": 23879133488,
      "step": 30351
    },
    {
      "epoch": 3.22002970507108,
      "grad_norm": 0.5422719490961513,
      "learning_rate": 4.1669062830435154e-05,
      "loss": 1.4303,
      "num_input_tokens_seen": 23879920400,
      "step": 30352
    },
    {
      "epoch": 3.2201357946106515,
      "grad_norm": 0.38438289746554993,
      "learning_rate": 4.1668544884405426e-05,
      "loss": 1.3696,
      "num_input_tokens_seen": 23880707168,
      "step": 30353
    },
    {
      "epoch": 3.220241884150223,
      "grad_norm": 0.4783188256089853,
      "learning_rate": 4.1668026925494727e-05,
      "loss": 1.4001,
      "num_input_tokens_seen": 23881493984,
      "step": 30354
    },
    {
      "epoch": 3.220347973689794,
      "grad_norm": 0.48279964619186894,
      "learning_rate": 4.166750895370348e-05,
      "loss": 1.4528,
      "num_input_tokens_seen": 23882280736,
      "step": 30355
    },
    {
      "epoch": 3.2204540632293654,
      "grad_norm": 0.4779295418418088,
      "learning_rate": 4.166699096903207e-05,
      "loss": 1.5049,
      "num_input_tokens_seen": 23883067376,
      "step": 30356
    },
    {
      "epoch": 3.220560152768937,
      "grad_norm": 0.4874844201771389,
      "learning_rate": 4.16664729714809e-05,
      "loss": 1.4187,
      "num_input_tokens_seen": 23883854160,
      "step": 30357
    },
    {
      "epoch": 3.2206662423085084,
      "grad_norm": 0.590770824616718,
      "learning_rate": 4.1665954961050356e-05,
      "loss": 1.4179,
      "num_input_tokens_seen": 23884641088,
      "step": 30358
    },
    {
      "epoch": 3.22077233184808,
      "grad_norm": 0.5941266558060252,
      "learning_rate": 4.1665436937740866e-05,
      "loss": 1.5101,
      "num_input_tokens_seen": 23885427904,
      "step": 30359
    },
    {
      "epoch": 3.2208784213876513,
      "grad_norm": 0.4138065997289587,
      "learning_rate": 4.166491890155281e-05,
      "loss": 1.4722,
      "num_input_tokens_seen": 23886214624,
      "step": 30360
    },
    {
      "epoch": 3.2209845109272224,
      "grad_norm": 0.49592117754465254,
      "learning_rate": 4.1664400852486586e-05,
      "loss": 1.4085,
      "num_input_tokens_seen": 23887001312,
      "step": 30361
    },
    {
      "epoch": 3.221090600466794,
      "grad_norm": 0.3924526467757673,
      "learning_rate": 4.166388279054261e-05,
      "loss": 1.4177,
      "num_input_tokens_seen": 23887788096,
      "step": 30362
    },
    {
      "epoch": 3.2211966900063653,
      "grad_norm": 0.565265439446293,
      "learning_rate": 4.166336471572127e-05,
      "loss": 1.4726,
      "num_input_tokens_seen": 23888574864,
      "step": 30363
    },
    {
      "epoch": 3.221302779545937,
      "grad_norm": 0.4548958363426647,
      "learning_rate": 4.166284662802297e-05,
      "loss": 1.4449,
      "num_input_tokens_seen": 23889361616,
      "step": 30364
    },
    {
      "epoch": 3.2214088690855083,
      "grad_norm": 0.46953146906040893,
      "learning_rate": 4.166232852744812e-05,
      "loss": 1.388,
      "num_input_tokens_seen": 23890148560,
      "step": 30365
    },
    {
      "epoch": 3.2215149586250797,
      "grad_norm": 0.5203195821257535,
      "learning_rate": 4.1661810413997106e-05,
      "loss": 1.5879,
      "num_input_tokens_seen": 23890935328,
      "step": 30366
    },
    {
      "epoch": 3.221621048164651,
      "grad_norm": 0.45975369124209275,
      "learning_rate": 4.166129228767033e-05,
      "loss": 1.4243,
      "num_input_tokens_seen": 23891722128,
      "step": 30367
    },
    {
      "epoch": 3.2217271377042223,
      "grad_norm": 0.5919549718273498,
      "learning_rate": 4.1660774148468194e-05,
      "loss": 1.5229,
      "num_input_tokens_seen": 23892508880,
      "step": 30368
    },
    {
      "epoch": 3.2218332272437937,
      "grad_norm": 0.4310316640658968,
      "learning_rate": 4.166025599639111e-05,
      "loss": 1.4259,
      "num_input_tokens_seen": 23893295664,
      "step": 30369
    },
    {
      "epoch": 3.221939316783365,
      "grad_norm": 0.5121624921437508,
      "learning_rate": 4.165973783143947e-05,
      "loss": 1.4481,
      "num_input_tokens_seen": 23894082496,
      "step": 30370
    },
    {
      "epoch": 3.2220454063229367,
      "grad_norm": 0.5058547020697702,
      "learning_rate": 4.1659219653613666e-05,
      "loss": 1.4294,
      "num_input_tokens_seen": 23894869296,
      "step": 30371
    },
    {
      "epoch": 3.222151495862508,
      "grad_norm": 0.5114268146017051,
      "learning_rate": 4.165870146291411e-05,
      "loss": 1.4725,
      "num_input_tokens_seen": 23895656080,
      "step": 30372
    },
    {
      "epoch": 3.222257585402079,
      "grad_norm": 0.5271235170872512,
      "learning_rate": 4.1658183259341194e-05,
      "loss": 1.3905,
      "num_input_tokens_seen": 23896442912,
      "step": 30373
    },
    {
      "epoch": 3.2223636749416507,
      "grad_norm": 0.5058656953194167,
      "learning_rate": 4.1657665042895324e-05,
      "loss": 1.515,
      "num_input_tokens_seen": 23897229632,
      "step": 30374
    },
    {
      "epoch": 3.222469764481222,
      "grad_norm": 0.46977637912737225,
      "learning_rate": 4.16571468135769e-05,
      "loss": 1.4022,
      "num_input_tokens_seen": 23898016336,
      "step": 30375
    },
    {
      "epoch": 3.2225758540207936,
      "grad_norm": 0.5868909354829975,
      "learning_rate": 4.165662857138632e-05,
      "loss": 1.4661,
      "num_input_tokens_seen": 23898803056,
      "step": 30376
    },
    {
      "epoch": 3.222681943560365,
      "grad_norm": 0.46092753946283027,
      "learning_rate": 4.165611031632399e-05,
      "loss": 1.4998,
      "num_input_tokens_seen": 23899589824,
      "step": 30377
    },
    {
      "epoch": 3.2227880330999366,
      "grad_norm": 0.7079364373568308,
      "learning_rate": 4.16555920483903e-05,
      "loss": 1.4668,
      "num_input_tokens_seen": 23900376608,
      "step": 30378
    },
    {
      "epoch": 3.2228941226395076,
      "grad_norm": 0.45103516157266804,
      "learning_rate": 4.165507376758567e-05,
      "loss": 1.4646,
      "num_input_tokens_seen": 23901163312,
      "step": 30379
    },
    {
      "epoch": 3.223000212179079,
      "grad_norm": 0.3925131206561029,
      "learning_rate": 4.165455547391047e-05,
      "loss": 1.3189,
      "num_input_tokens_seen": 23901950144,
      "step": 30380
    },
    {
      "epoch": 3.2231063017186505,
      "grad_norm": 0.5253800369825922,
      "learning_rate": 4.165403716736513e-05,
      "loss": 1.5349,
      "num_input_tokens_seen": 23902736912,
      "step": 30381
    },
    {
      "epoch": 3.223212391258222,
      "grad_norm": 0.4353054479228671,
      "learning_rate": 4.165351884795004e-05,
      "loss": 1.4592,
      "num_input_tokens_seen": 23903523712,
      "step": 30382
    },
    {
      "epoch": 3.2233184807977935,
      "grad_norm": 0.471535828143916,
      "learning_rate": 4.16530005156656e-05,
      "loss": 1.5116,
      "num_input_tokens_seen": 23904310544,
      "step": 30383
    },
    {
      "epoch": 3.2234245703373645,
      "grad_norm": 0.4847655038338272,
      "learning_rate": 4.165248217051221e-05,
      "loss": 1.5333,
      "num_input_tokens_seen": 23905097232,
      "step": 30384
    },
    {
      "epoch": 3.223530659876936,
      "grad_norm": 0.43285705107735883,
      "learning_rate": 4.165196381249026e-05,
      "loss": 1.5002,
      "num_input_tokens_seen": 23905884000,
      "step": 30385
    },
    {
      "epoch": 3.2236367494165075,
      "grad_norm": 0.4643649332842644,
      "learning_rate": 4.165144544160017e-05,
      "loss": 1.4992,
      "num_input_tokens_seen": 23906670752,
      "step": 30386
    },
    {
      "epoch": 3.223742838956079,
      "grad_norm": 0.4161405787041641,
      "learning_rate": 4.165092705784233e-05,
      "loss": 1.4468,
      "num_input_tokens_seen": 23907457520,
      "step": 30387
    },
    {
      "epoch": 3.2238489284956504,
      "grad_norm": 0.4240929873328995,
      "learning_rate": 4.165040866121714e-05,
      "loss": 1.5084,
      "num_input_tokens_seen": 23908244256,
      "step": 30388
    },
    {
      "epoch": 3.223955018035222,
      "grad_norm": 0.4686211797870575,
      "learning_rate": 4.1649890251725e-05,
      "loss": 1.4674,
      "num_input_tokens_seen": 23909031056,
      "step": 30389
    },
    {
      "epoch": 3.2240611075747934,
      "grad_norm": 0.4791039237894451,
      "learning_rate": 4.1649371829366315e-05,
      "loss": 1.4351,
      "num_input_tokens_seen": 23909817792,
      "step": 30390
    },
    {
      "epoch": 3.2241671971143644,
      "grad_norm": 0.4491625331710156,
      "learning_rate": 4.164885339414149e-05,
      "loss": 1.4748,
      "num_input_tokens_seen": 23910604656,
      "step": 30391
    },
    {
      "epoch": 3.224273286653936,
      "grad_norm": 0.44846667370663934,
      "learning_rate": 4.1648334946050914e-05,
      "loss": 1.5291,
      "num_input_tokens_seen": 23911391440,
      "step": 30392
    },
    {
      "epoch": 3.2243793761935073,
      "grad_norm": 0.4172696300679824,
      "learning_rate": 4.164781648509499e-05,
      "loss": 1.4269,
      "num_input_tokens_seen": 23912178256,
      "step": 30393
    },
    {
      "epoch": 3.224485465733079,
      "grad_norm": 0.4296649132607345,
      "learning_rate": 4.1647298011274135e-05,
      "loss": 1.4828,
      "num_input_tokens_seen": 23912965024,
      "step": 30394
    },
    {
      "epoch": 3.2245915552726503,
      "grad_norm": 0.471611312842421,
      "learning_rate": 4.164677952458873e-05,
      "loss": 1.5522,
      "num_input_tokens_seen": 23913751856,
      "step": 30395
    },
    {
      "epoch": 3.2246976448122213,
      "grad_norm": 0.49148908300216493,
      "learning_rate": 4.1646261025039176e-05,
      "loss": 1.5304,
      "num_input_tokens_seen": 23914538544,
      "step": 30396
    },
    {
      "epoch": 3.224803734351793,
      "grad_norm": 0.425512862925436,
      "learning_rate": 4.1645742512625886e-05,
      "loss": 1.5718,
      "num_input_tokens_seen": 23915325232,
      "step": 30397
    },
    {
      "epoch": 3.2249098238913643,
      "grad_norm": 0.44776006638718985,
      "learning_rate": 4.164522398734925e-05,
      "loss": 1.5313,
      "num_input_tokens_seen": 23916112016,
      "step": 30398
    },
    {
      "epoch": 3.2250159134309357,
      "grad_norm": 0.45076725761543046,
      "learning_rate": 4.164470544920968e-05,
      "loss": 1.4815,
      "num_input_tokens_seen": 23916898848,
      "step": 30399
    },
    {
      "epoch": 3.225122002970507,
      "grad_norm": 0.3970985932795046,
      "learning_rate": 4.1644186898207566e-05,
      "loss": 1.3548,
      "num_input_tokens_seen": 23917685712,
      "step": 30400
    },
    {
      "epoch": 3.2252280925100787,
      "grad_norm": 0.4469224313771109,
      "learning_rate": 4.164366833434331e-05,
      "loss": 1.4209,
      "num_input_tokens_seen": 23918472496,
      "step": 30401
    },
    {
      "epoch": 3.2253341820496497,
      "grad_norm": 0.443073764841444,
      "learning_rate": 4.1643149757617326e-05,
      "loss": 1.4839,
      "num_input_tokens_seen": 23919259200,
      "step": 30402
    },
    {
      "epoch": 3.225440271589221,
      "grad_norm": 0.4663992301343081,
      "learning_rate": 4.164263116802999e-05,
      "loss": 1.4239,
      "num_input_tokens_seen": 23920046032,
      "step": 30403
    },
    {
      "epoch": 3.2255463611287927,
      "grad_norm": 0.5138553772520316,
      "learning_rate": 4.1642112565581726e-05,
      "loss": 1.5309,
      "num_input_tokens_seen": 23920832864,
      "step": 30404
    },
    {
      "epoch": 3.225652450668364,
      "grad_norm": 0.44776665393018966,
      "learning_rate": 4.1641593950272927e-05,
      "loss": 1.456,
      "num_input_tokens_seen": 23921619648,
      "step": 30405
    },
    {
      "epoch": 3.2257585402079356,
      "grad_norm": 0.4123858185165631,
      "learning_rate": 4.1641075322103985e-05,
      "loss": 1.3773,
      "num_input_tokens_seen": 23922406432,
      "step": 30406
    },
    {
      "epoch": 3.225864629747507,
      "grad_norm": 0.6139434847834232,
      "learning_rate": 4.1640556681075315e-05,
      "loss": 1.5231,
      "num_input_tokens_seen": 23923193216,
      "step": 30407
    },
    {
      "epoch": 3.225970719287078,
      "grad_norm": 0.43136543715922615,
      "learning_rate": 4.16400380271873e-05,
      "loss": 1.4139,
      "num_input_tokens_seen": 23923980080,
      "step": 30408
    },
    {
      "epoch": 3.2260768088266496,
      "grad_norm": 0.6490092678730367,
      "learning_rate": 4.163951936044037e-05,
      "loss": 1.4227,
      "num_input_tokens_seen": 23924766848,
      "step": 30409
    },
    {
      "epoch": 3.226182898366221,
      "grad_norm": 0.5626591336963412,
      "learning_rate": 4.16390006808349e-05,
      "loss": 1.4686,
      "num_input_tokens_seen": 23925553680,
      "step": 30410
    },
    {
      "epoch": 3.2262889879057925,
      "grad_norm": 0.49123282106947613,
      "learning_rate": 4.163848198837129e-05,
      "loss": 1.5006,
      "num_input_tokens_seen": 23926340448,
      "step": 30411
    },
    {
      "epoch": 3.226395077445364,
      "grad_norm": 0.6657483469808202,
      "learning_rate": 4.163796328304996e-05,
      "loss": 1.5509,
      "num_input_tokens_seen": 23927127248,
      "step": 30412
    },
    {
      "epoch": 3.226501166984935,
      "grad_norm": 0.4239891951901955,
      "learning_rate": 4.163744456487129e-05,
      "loss": 1.4208,
      "num_input_tokens_seen": 23927913904,
      "step": 30413
    },
    {
      "epoch": 3.2266072565245065,
      "grad_norm": 0.5533258872237264,
      "learning_rate": 4.16369258338357e-05,
      "loss": 1.4492,
      "num_input_tokens_seen": 23928700672,
      "step": 30414
    },
    {
      "epoch": 3.226713346064078,
      "grad_norm": 0.6033336302286944,
      "learning_rate": 4.163640708994358e-05,
      "loss": 1.4758,
      "num_input_tokens_seen": 23929487408,
      "step": 30415
    },
    {
      "epoch": 3.2268194356036495,
      "grad_norm": 0.4350323856870577,
      "learning_rate": 4.163588833319533e-05,
      "loss": 1.4327,
      "num_input_tokens_seen": 23930274176,
      "step": 30416
    },
    {
      "epoch": 3.226925525143221,
      "grad_norm": 0.7739653319719171,
      "learning_rate": 4.1635369563591355e-05,
      "loss": 1.5543,
      "num_input_tokens_seen": 23931060864,
      "step": 30417
    },
    {
      "epoch": 3.2270316146827924,
      "grad_norm": 0.4137831184448903,
      "learning_rate": 4.163485078113205e-05,
      "loss": 1.5035,
      "num_input_tokens_seen": 23931847616,
      "step": 30418
    },
    {
      "epoch": 3.227137704222364,
      "grad_norm": 0.623955894772134,
      "learning_rate": 4.163433198581783e-05,
      "loss": 1.3087,
      "num_input_tokens_seen": 23932634320,
      "step": 30419
    },
    {
      "epoch": 3.227243793761935,
      "grad_norm": 0.48387391087341164,
      "learning_rate": 4.1633813177649084e-05,
      "loss": 1.3819,
      "num_input_tokens_seen": 23933421104,
      "step": 30420
    },
    {
      "epoch": 3.2273498833015064,
      "grad_norm": 0.4721203073250374,
      "learning_rate": 4.1633294356626204e-05,
      "loss": 1.4861,
      "num_input_tokens_seen": 23934207792,
      "step": 30421
    },
    {
      "epoch": 3.227455972841078,
      "grad_norm": 0.6897818163692061,
      "learning_rate": 4.163277552274962e-05,
      "loss": 1.4865,
      "num_input_tokens_seen": 23934994608,
      "step": 30422
    },
    {
      "epoch": 3.2275620623806494,
      "grad_norm": 0.4391093599058375,
      "learning_rate": 4.1632256676019696e-05,
      "loss": 1.3649,
      "num_input_tokens_seen": 23935781472,
      "step": 30423
    },
    {
      "epoch": 3.227668151920221,
      "grad_norm": 0.5109890435425809,
      "learning_rate": 4.163173781643687e-05,
      "loss": 1.4031,
      "num_input_tokens_seen": 23936568336,
      "step": 30424
    },
    {
      "epoch": 3.227774241459792,
      "grad_norm": 0.4999907627653963,
      "learning_rate": 4.1631218944001514e-05,
      "loss": 1.447,
      "num_input_tokens_seen": 23937355136,
      "step": 30425
    },
    {
      "epoch": 3.2278803309993633,
      "grad_norm": 0.4471524856954945,
      "learning_rate": 4.163070005871404e-05,
      "loss": 1.3543,
      "num_input_tokens_seen": 23938141904,
      "step": 30426
    },
    {
      "epoch": 3.227986420538935,
      "grad_norm": 0.8145795795448488,
      "learning_rate": 4.1630181160574856e-05,
      "loss": 1.5245,
      "num_input_tokens_seen": 23938928640,
      "step": 30427
    },
    {
      "epoch": 3.2280925100785063,
      "grad_norm": 0.5900017477385467,
      "learning_rate": 4.1629662249584345e-05,
      "loss": 1.5233,
      "num_input_tokens_seen": 23939715376,
      "step": 30428
    },
    {
      "epoch": 3.2281985996180778,
      "grad_norm": 0.6605666194784626,
      "learning_rate": 4.162914332574293e-05,
      "loss": 1.4312,
      "num_input_tokens_seen": 23940502240,
      "step": 30429
    },
    {
      "epoch": 3.2283046891576492,
      "grad_norm": 0.4800136795004634,
      "learning_rate": 4.1628624389050997e-05,
      "loss": 1.5308,
      "num_input_tokens_seen": 23941289024,
      "step": 30430
    },
    {
      "epoch": 3.2284107786972203,
      "grad_norm": 0.5748239441022318,
      "learning_rate": 4.1628105439508946e-05,
      "loss": 1.3493,
      "num_input_tokens_seen": 23942075792,
      "step": 30431
    },
    {
      "epoch": 3.2285168682367917,
      "grad_norm": 0.531146406460507,
      "learning_rate": 4.162758647711719e-05,
      "loss": 1.4558,
      "num_input_tokens_seen": 23942862608,
      "step": 30432
    },
    {
      "epoch": 3.228622957776363,
      "grad_norm": 0.48452573451249625,
      "learning_rate": 4.162706750187612e-05,
      "loss": 1.5243,
      "num_input_tokens_seen": 23943649376,
      "step": 30433
    },
    {
      "epoch": 3.2287290473159347,
      "grad_norm": 0.5740980350279914,
      "learning_rate": 4.162654851378615e-05,
      "loss": 1.3224,
      "num_input_tokens_seen": 23944436240,
      "step": 30434
    },
    {
      "epoch": 3.228835136855506,
      "grad_norm": 0.49378963448514007,
      "learning_rate": 4.1626029512847655e-05,
      "loss": 1.4598,
      "num_input_tokens_seen": 23945223024,
      "step": 30435
    },
    {
      "epoch": 3.2289412263950776,
      "grad_norm": 0.45665799072656077,
      "learning_rate": 4.162551049906106e-05,
      "loss": 1.4028,
      "num_input_tokens_seen": 23946009776,
      "step": 30436
    },
    {
      "epoch": 3.2290473159346487,
      "grad_norm": 0.8104149269170147,
      "learning_rate": 4.1624991472426756e-05,
      "loss": 1.4379,
      "num_input_tokens_seen": 23946796576,
      "step": 30437
    },
    {
      "epoch": 3.22915340547422,
      "grad_norm": 0.41993091251239373,
      "learning_rate": 4.162447243294515e-05,
      "loss": 1.4801,
      "num_input_tokens_seen": 23947583296,
      "step": 30438
    },
    {
      "epoch": 3.2292594950137916,
      "grad_norm": 0.5880340728881392,
      "learning_rate": 4.162395338061664e-05,
      "loss": 1.5197,
      "num_input_tokens_seen": 23948370016,
      "step": 30439
    },
    {
      "epoch": 3.229365584553363,
      "grad_norm": 0.48086762339988004,
      "learning_rate": 4.162343431544162e-05,
      "loss": 1.4228,
      "num_input_tokens_seen": 23949156752,
      "step": 30440
    },
    {
      "epoch": 3.2294716740929346,
      "grad_norm": 0.4243821901522238,
      "learning_rate": 4.16229152374205e-05,
      "loss": 1.3195,
      "num_input_tokens_seen": 23949943552,
      "step": 30441
    },
    {
      "epoch": 3.229577763632506,
      "grad_norm": 0.5535661719714324,
      "learning_rate": 4.162239614655368e-05,
      "loss": 1.4555,
      "num_input_tokens_seen": 23950730240,
      "step": 30442
    },
    {
      "epoch": 3.229683853172077,
      "grad_norm": 0.42478660162626247,
      "learning_rate": 4.1621877042841564e-05,
      "loss": 1.3591,
      "num_input_tokens_seen": 23951516976,
      "step": 30443
    },
    {
      "epoch": 3.2297899427116485,
      "grad_norm": 0.5111194766369854,
      "learning_rate": 4.1621357926284545e-05,
      "loss": 1.5575,
      "num_input_tokens_seen": 23952303648,
      "step": 30444
    },
    {
      "epoch": 3.22989603225122,
      "grad_norm": 0.5141798196412586,
      "learning_rate": 4.162083879688303e-05,
      "loss": 1.498,
      "num_input_tokens_seen": 23953090416,
      "step": 30445
    },
    {
      "epoch": 3.2300021217907915,
      "grad_norm": 0.47220871889068294,
      "learning_rate": 4.162031965463742e-05,
      "loss": 1.5074,
      "num_input_tokens_seen": 23953877296,
      "step": 30446
    },
    {
      "epoch": 3.230108211330363,
      "grad_norm": 0.5844437389311091,
      "learning_rate": 4.1619800499548114e-05,
      "loss": 1.5145,
      "num_input_tokens_seen": 23954664048,
      "step": 30447
    },
    {
      "epoch": 3.2302143008699344,
      "grad_norm": 0.4419200115598829,
      "learning_rate": 4.161928133161551e-05,
      "loss": 1.4551,
      "num_input_tokens_seen": 23955450752,
      "step": 30448
    },
    {
      "epoch": 3.2303203904095055,
      "grad_norm": 0.4279901267276933,
      "learning_rate": 4.161876215084001e-05,
      "loss": 1.4049,
      "num_input_tokens_seen": 23956237600,
      "step": 30449
    },
    {
      "epoch": 3.230426479949077,
      "grad_norm": 0.7996730214808605,
      "learning_rate": 4.161824295722202e-05,
      "loss": 1.4468,
      "num_input_tokens_seen": 23957024368,
      "step": 30450
    },
    {
      "epoch": 3.2305325694886484,
      "grad_norm": 0.47914718571719667,
      "learning_rate": 4.161772375076195e-05,
      "loss": 1.3986,
      "num_input_tokens_seen": 23957811248,
      "step": 30451
    },
    {
      "epoch": 3.23063865902822,
      "grad_norm": 0.597715190103223,
      "learning_rate": 4.161720453146019e-05,
      "loss": 1.5694,
      "num_input_tokens_seen": 23958597904,
      "step": 30452
    },
    {
      "epoch": 3.2307447485677914,
      "grad_norm": 0.6185879686356132,
      "learning_rate": 4.161668529931713e-05,
      "loss": 1.4539,
      "num_input_tokens_seen": 23959384656,
      "step": 30453
    },
    {
      "epoch": 3.2308508381073624,
      "grad_norm": 0.5453079221442743,
      "learning_rate": 4.161616605433318e-05,
      "loss": 1.5772,
      "num_input_tokens_seen": 23960171408,
      "step": 30454
    },
    {
      "epoch": 3.230956927646934,
      "grad_norm": 0.6643210755123283,
      "learning_rate": 4.161564679650876e-05,
      "loss": 1.5159,
      "num_input_tokens_seen": 23960958192,
      "step": 30455
    },
    {
      "epoch": 3.2310630171865053,
      "grad_norm": 0.4799026034750908,
      "learning_rate": 4.161512752584425e-05,
      "loss": 1.3861,
      "num_input_tokens_seen": 23961745024,
      "step": 30456
    },
    {
      "epoch": 3.231169106726077,
      "grad_norm": 0.47117316421329786,
      "learning_rate": 4.161460824234005e-05,
      "loss": 1.4049,
      "num_input_tokens_seen": 23962531712,
      "step": 30457
    },
    {
      "epoch": 3.2312751962656483,
      "grad_norm": 0.5968434178720582,
      "learning_rate": 4.1614088945996576e-05,
      "loss": 1.4425,
      "num_input_tokens_seen": 23963318432,
      "step": 30458
    },
    {
      "epoch": 3.2313812858052198,
      "grad_norm": 0.4085837404148623,
      "learning_rate": 4.161356963681422e-05,
      "loss": 1.4819,
      "num_input_tokens_seen": 23964105072,
      "step": 30459
    },
    {
      "epoch": 3.231487375344791,
      "grad_norm": 0.48815891660203975,
      "learning_rate": 4.161305031479339e-05,
      "loss": 1.5035,
      "num_input_tokens_seen": 23964891824,
      "step": 30460
    },
    {
      "epoch": 3.2315934648843623,
      "grad_norm": 0.5367707020437296,
      "learning_rate": 4.1612530979934474e-05,
      "loss": 1.5645,
      "num_input_tokens_seen": 23965678528,
      "step": 30461
    },
    {
      "epoch": 3.2316995544239338,
      "grad_norm": 0.40962072937147176,
      "learning_rate": 4.161201163223788e-05,
      "loss": 1.376,
      "num_input_tokens_seen": 23966465232,
      "step": 30462
    },
    {
      "epoch": 3.2318056439635052,
      "grad_norm": 0.5320718371289952,
      "learning_rate": 4.1611492271704017e-05,
      "loss": 1.5515,
      "num_input_tokens_seen": 23967251888,
      "step": 30463
    },
    {
      "epoch": 3.2319117335030767,
      "grad_norm": 0.4155885015995471,
      "learning_rate": 4.1610972898333276e-05,
      "loss": 1.4266,
      "num_input_tokens_seen": 23968038656,
      "step": 30464
    },
    {
      "epoch": 3.232017823042648,
      "grad_norm": 0.4075465657403821,
      "learning_rate": 4.161045351212607e-05,
      "loss": 1.4463,
      "num_input_tokens_seen": 23968825424,
      "step": 30465
    },
    {
      "epoch": 3.232123912582219,
      "grad_norm": 0.6252072587527222,
      "learning_rate": 4.1609934113082784e-05,
      "loss": 1.4978,
      "num_input_tokens_seen": 23969612224,
      "step": 30466
    },
    {
      "epoch": 3.2322300021217907,
      "grad_norm": 0.40722026175463455,
      "learning_rate": 4.160941470120383e-05,
      "loss": 1.4391,
      "num_input_tokens_seen": 23970399040,
      "step": 30467
    },
    {
      "epoch": 3.232336091661362,
      "grad_norm": 0.44899213374265917,
      "learning_rate": 4.160889527648961e-05,
      "loss": 1.4313,
      "num_input_tokens_seen": 23971185776,
      "step": 30468
    },
    {
      "epoch": 3.2324421812009336,
      "grad_norm": 0.4344554309871295,
      "learning_rate": 4.160837583894053e-05,
      "loss": 1.4131,
      "num_input_tokens_seen": 23971972592,
      "step": 30469
    },
    {
      "epoch": 3.232548270740505,
      "grad_norm": 0.3941472851010592,
      "learning_rate": 4.160785638855697e-05,
      "loss": 1.5403,
      "num_input_tokens_seen": 23972759312,
      "step": 30470
    },
    {
      "epoch": 3.2326543602800766,
      "grad_norm": 0.4397534233217655,
      "learning_rate": 4.160733692533934e-05,
      "loss": 1.4507,
      "num_input_tokens_seen": 23973546128,
      "step": 30471
    },
    {
      "epoch": 3.2327604498196476,
      "grad_norm": 0.4172060033682076,
      "learning_rate": 4.160681744928807e-05,
      "loss": 1.4862,
      "num_input_tokens_seen": 23974332864,
      "step": 30472
    },
    {
      "epoch": 3.232866539359219,
      "grad_norm": 0.43688088037103173,
      "learning_rate": 4.160629796040353e-05,
      "loss": 1.4397,
      "num_input_tokens_seen": 23975119616,
      "step": 30473
    },
    {
      "epoch": 3.2329726288987906,
      "grad_norm": 0.3784720262337412,
      "learning_rate": 4.160577845868613e-05,
      "loss": 1.3897,
      "num_input_tokens_seen": 23975906416,
      "step": 30474
    },
    {
      "epoch": 3.233078718438362,
      "grad_norm": 0.4438819893562554,
      "learning_rate": 4.1605258944136274e-05,
      "loss": 1.5434,
      "num_input_tokens_seen": 23976693200,
      "step": 30475
    },
    {
      "epoch": 3.2331848079779335,
      "grad_norm": 0.49041154431260797,
      "learning_rate": 4.160473941675435e-05,
      "loss": 1.37,
      "num_input_tokens_seen": 23977479968,
      "step": 30476
    },
    {
      "epoch": 3.233290897517505,
      "grad_norm": 0.4296493060794257,
      "learning_rate": 4.1604219876540786e-05,
      "loss": 1.454,
      "num_input_tokens_seen": 23978266736,
      "step": 30477
    },
    {
      "epoch": 3.233396987057076,
      "grad_norm": 0.5197717177214836,
      "learning_rate": 4.160370032349595e-05,
      "loss": 1.5015,
      "num_input_tokens_seen": 23979053472,
      "step": 30478
    },
    {
      "epoch": 3.2335030765966475,
      "grad_norm": 0.3844059202765108,
      "learning_rate": 4.160318075762027e-05,
      "loss": 1.4147,
      "num_input_tokens_seen": 23979840272,
      "step": 30479
    },
    {
      "epoch": 3.233609166136219,
      "grad_norm": 0.4591054675834554,
      "learning_rate": 4.160266117891415e-05,
      "loss": 1.4748,
      "num_input_tokens_seen": 23980627024,
      "step": 30480
    },
    {
      "epoch": 3.2337152556757904,
      "grad_norm": 0.44726549956668055,
      "learning_rate": 4.160214158737798e-05,
      "loss": 1.5409,
      "num_input_tokens_seen": 23981413648,
      "step": 30481
    },
    {
      "epoch": 3.233821345215362,
      "grad_norm": 0.43314612044885953,
      "learning_rate": 4.160162198301214e-05,
      "loss": 1.4638,
      "num_input_tokens_seen": 23982200448,
      "step": 30482
    },
    {
      "epoch": 3.233927434754933,
      "grad_norm": 0.41820273925630913,
      "learning_rate": 4.1601102365817066e-05,
      "loss": 1.4531,
      "num_input_tokens_seen": 23982987232,
      "step": 30483
    },
    {
      "epoch": 3.2340335242945044,
      "grad_norm": 0.4002984734139052,
      "learning_rate": 4.1600582735793154e-05,
      "loss": 1.5161,
      "num_input_tokens_seen": 23983773968,
      "step": 30484
    },
    {
      "epoch": 3.234139613834076,
      "grad_norm": 0.39551694662294945,
      "learning_rate": 4.160006309294079e-05,
      "loss": 1.4616,
      "num_input_tokens_seen": 23984560656,
      "step": 30485
    },
    {
      "epoch": 3.2342457033736474,
      "grad_norm": 0.37190211455082217,
      "learning_rate": 4.159954343726039e-05,
      "loss": 1.4582,
      "num_input_tokens_seen": 23985347408,
      "step": 30486
    },
    {
      "epoch": 3.234351792913219,
      "grad_norm": 0.4171686893805214,
      "learning_rate": 4.1599023768752347e-05,
      "loss": 1.4751,
      "num_input_tokens_seen": 23986134096,
      "step": 30487
    },
    {
      "epoch": 3.2344578824527903,
      "grad_norm": 0.40933013548983616,
      "learning_rate": 4.159850408741707e-05,
      "loss": 1.4602,
      "num_input_tokens_seen": 23986920800,
      "step": 30488
    },
    {
      "epoch": 3.234563971992362,
      "grad_norm": 0.40655058013327455,
      "learning_rate": 4.1597984393254954e-05,
      "loss": 1.4531,
      "num_input_tokens_seen": 23987707488,
      "step": 30489
    },
    {
      "epoch": 3.234670061531933,
      "grad_norm": 0.4270006525162447,
      "learning_rate": 4.1597464686266396e-05,
      "loss": 1.4835,
      "num_input_tokens_seen": 23988494272,
      "step": 30490
    },
    {
      "epoch": 3.2347761510715043,
      "grad_norm": 0.4724573105270892,
      "learning_rate": 4.1596944966451815e-05,
      "loss": 1.4781,
      "num_input_tokens_seen": 23989281072,
      "step": 30491
    },
    {
      "epoch": 3.2348822406110758,
      "grad_norm": 0.41203731761380535,
      "learning_rate": 4.159642523381159e-05,
      "loss": 1.4012,
      "num_input_tokens_seen": 23990067872,
      "step": 30492
    },
    {
      "epoch": 3.2349883301506472,
      "grad_norm": 0.7871299240224814,
      "learning_rate": 4.1595905488346146e-05,
      "loss": 1.5611,
      "num_input_tokens_seen": 23990854640,
      "step": 30493
    },
    {
      "epoch": 3.2350944196902187,
      "grad_norm": 0.462339597770663,
      "learning_rate": 4.1595385730055865e-05,
      "loss": 1.4655,
      "num_input_tokens_seen": 23991641424,
      "step": 30494
    },
    {
      "epoch": 3.2352005092297897,
      "grad_norm": 0.4803428328231729,
      "learning_rate": 4.159486595894116e-05,
      "loss": 1.5134,
      "num_input_tokens_seen": 23992428224,
      "step": 30495
    },
    {
      "epoch": 3.235306598769361,
      "grad_norm": 0.45949141339277166,
      "learning_rate": 4.159434617500243e-05,
      "loss": 1.5727,
      "num_input_tokens_seen": 23993215056,
      "step": 30496
    },
    {
      "epoch": 3.2354126883089327,
      "grad_norm": 0.45013049078259,
      "learning_rate": 4.1593826378240075e-05,
      "loss": 1.3803,
      "num_input_tokens_seen": 23994001776,
      "step": 30497
    },
    {
      "epoch": 3.235518777848504,
      "grad_norm": 0.3937304501100476,
      "learning_rate": 4.15933065686545e-05,
      "loss": 1.5612,
      "num_input_tokens_seen": 23994788448,
      "step": 30498
    },
    {
      "epoch": 3.2356248673880756,
      "grad_norm": 0.43704500832610943,
      "learning_rate": 4.15927867462461e-05,
      "loss": 1.3986,
      "num_input_tokens_seen": 23995575248,
      "step": 30499
    },
    {
      "epoch": 3.235730956927647,
      "grad_norm": 0.48588236671854823,
      "learning_rate": 4.159226691101528e-05,
      "loss": 1.4964,
      "num_input_tokens_seen": 23996362064,
      "step": 30500
    },
    {
      "epoch": 3.235837046467218,
      "grad_norm": 0.4792760171934747,
      "learning_rate": 4.159174706296245e-05,
      "loss": 1.4823,
      "num_input_tokens_seen": 23997148816,
      "step": 30501
    },
    {
      "epoch": 3.2359431360067896,
      "grad_norm": 0.4063709122967235,
      "learning_rate": 4.1591227202088004e-05,
      "loss": 1.4279,
      "num_input_tokens_seen": 23997935664,
      "step": 30502
    },
    {
      "epoch": 3.236049225546361,
      "grad_norm": 0.43834131946423666,
      "learning_rate": 4.159070732839234e-05,
      "loss": 1.3501,
      "num_input_tokens_seen": 23998722528,
      "step": 30503
    },
    {
      "epoch": 3.2361553150859326,
      "grad_norm": 0.424203558031899,
      "learning_rate": 4.1590187441875863e-05,
      "loss": 1.5081,
      "num_input_tokens_seen": 23999509328,
      "step": 30504
    },
    {
      "epoch": 3.236261404625504,
      "grad_norm": 0.465479820984791,
      "learning_rate": 4.158966754253898e-05,
      "loss": 1.5706,
      "num_input_tokens_seen": 24000296176,
      "step": 30505
    },
    {
      "epoch": 3.2363674941650755,
      "grad_norm": 0.37758565102376473,
      "learning_rate": 4.1589147630382085e-05,
      "loss": 1.4122,
      "num_input_tokens_seen": 24001082912,
      "step": 30506
    },
    {
      "epoch": 3.2364735837046466,
      "grad_norm": 0.4102339883438795,
      "learning_rate": 4.1588627705405594e-05,
      "loss": 1.338,
      "num_input_tokens_seen": 24001869680,
      "step": 30507
    },
    {
      "epoch": 3.236579673244218,
      "grad_norm": 0.437283245062154,
      "learning_rate": 4.158810776760989e-05,
      "loss": 1.4248,
      "num_input_tokens_seen": 24002656416,
      "step": 30508
    },
    {
      "epoch": 3.2366857627837895,
      "grad_norm": 0.4522406649347418,
      "learning_rate": 4.158758781699538e-05,
      "loss": 1.4848,
      "num_input_tokens_seen": 24003443152,
      "step": 30509
    },
    {
      "epoch": 3.236791852323361,
      "grad_norm": 0.4450389474915721,
      "learning_rate": 4.158706785356247e-05,
      "loss": 1.4868,
      "num_input_tokens_seen": 24004229840,
      "step": 30510
    },
    {
      "epoch": 3.2368979418629324,
      "grad_norm": 0.46538200457316087,
      "learning_rate": 4.1586547877311564e-05,
      "loss": 1.4549,
      "num_input_tokens_seen": 24005016544,
      "step": 30511
    },
    {
      "epoch": 3.2370040314025035,
      "grad_norm": 0.43076867580718253,
      "learning_rate": 4.1586027888243064e-05,
      "loss": 1.4497,
      "num_input_tokens_seen": 24005803376,
      "step": 30512
    },
    {
      "epoch": 3.237110120942075,
      "grad_norm": 0.4397973670488931,
      "learning_rate": 4.158550788635737e-05,
      "loss": 1.3898,
      "num_input_tokens_seen": 24006590256,
      "step": 30513
    },
    {
      "epoch": 3.2372162104816464,
      "grad_norm": 0.4314155664523879,
      "learning_rate": 4.158498787165487e-05,
      "loss": 1.4394,
      "num_input_tokens_seen": 24007376976,
      "step": 30514
    },
    {
      "epoch": 3.237322300021218,
      "grad_norm": 0.40237934070376513,
      "learning_rate": 4.1584467844135984e-05,
      "loss": 1.454,
      "num_input_tokens_seen": 24008163696,
      "step": 30515
    },
    {
      "epoch": 3.2374283895607894,
      "grad_norm": 0.46563816121113416,
      "learning_rate": 4.1583947803801106e-05,
      "loss": 1.5484,
      "num_input_tokens_seen": 24008950448,
      "step": 30516
    },
    {
      "epoch": 3.237534479100361,
      "grad_norm": 0.3935263706186804,
      "learning_rate": 4.158342775065064e-05,
      "loss": 1.4753,
      "num_input_tokens_seen": 24009737184,
      "step": 30517
    },
    {
      "epoch": 3.2376405686399323,
      "grad_norm": 0.41238404976231585,
      "learning_rate": 4.158290768468499e-05,
      "loss": 1.3675,
      "num_input_tokens_seen": 24010523936,
      "step": 30518
    },
    {
      "epoch": 3.2377466581795034,
      "grad_norm": 0.542863480983887,
      "learning_rate": 4.158238760590455e-05,
      "loss": 1.6058,
      "num_input_tokens_seen": 24011310768,
      "step": 30519
    },
    {
      "epoch": 3.237852747719075,
      "grad_norm": 0.4122411427432745,
      "learning_rate": 4.158186751430974e-05,
      "loss": 1.4361,
      "num_input_tokens_seen": 24012097616,
      "step": 30520
    },
    {
      "epoch": 3.2379588372586463,
      "grad_norm": 0.4499165471581322,
      "learning_rate": 4.158134740990094e-05,
      "loss": 1.4238,
      "num_input_tokens_seen": 24012884336,
      "step": 30521
    },
    {
      "epoch": 3.238064926798218,
      "grad_norm": 0.4322342327674622,
      "learning_rate": 4.158082729267856e-05,
      "loss": 1.5742,
      "num_input_tokens_seen": 24013671024,
      "step": 30522
    },
    {
      "epoch": 3.2381710163377893,
      "grad_norm": 0.45484946379179503,
      "learning_rate": 4.158030716264301e-05,
      "loss": 1.4328,
      "num_input_tokens_seen": 24014457888,
      "step": 30523
    },
    {
      "epoch": 3.2382771058773603,
      "grad_norm": 0.5605310927838764,
      "learning_rate": 4.157978701979468e-05,
      "loss": 1.3999,
      "num_input_tokens_seen": 24015244624,
      "step": 30524
    },
    {
      "epoch": 3.2383831954169318,
      "grad_norm": 0.5053055552774187,
      "learning_rate": 4.157926686413398e-05,
      "loss": 1.5534,
      "num_input_tokens_seen": 24016031360,
      "step": 30525
    },
    {
      "epoch": 3.2384892849565032,
      "grad_norm": 0.47704485530778074,
      "learning_rate": 4.1578746695661303e-05,
      "loss": 1.5103,
      "num_input_tokens_seen": 24016818096,
      "step": 30526
    },
    {
      "epoch": 3.2385953744960747,
      "grad_norm": 0.5012452908452283,
      "learning_rate": 4.157822651437706e-05,
      "loss": 1.4497,
      "num_input_tokens_seen": 24017604912,
      "step": 30527
    },
    {
      "epoch": 3.238701464035646,
      "grad_norm": 0.4120477975842557,
      "learning_rate": 4.157770632028165e-05,
      "loss": 1.4916,
      "num_input_tokens_seen": 24018391616,
      "step": 30528
    },
    {
      "epoch": 3.2388075535752177,
      "grad_norm": 0.5813029750352564,
      "learning_rate": 4.1577186113375476e-05,
      "loss": 1.5422,
      "num_input_tokens_seen": 24019178288,
      "step": 30529
    },
    {
      "epoch": 3.2389136431147887,
      "grad_norm": 0.37433776623862985,
      "learning_rate": 4.157666589365894e-05,
      "loss": 1.3783,
      "num_input_tokens_seen": 24019965040,
      "step": 30530
    },
    {
      "epoch": 3.23901973265436,
      "grad_norm": 0.4853377397609148,
      "learning_rate": 4.157614566113245e-05,
      "loss": 1.5483,
      "num_input_tokens_seen": 24020751744,
      "step": 30531
    },
    {
      "epoch": 3.2391258221939316,
      "grad_norm": 0.4916960788527797,
      "learning_rate": 4.157562541579639e-05,
      "loss": 1.3879,
      "num_input_tokens_seen": 24021538464,
      "step": 30532
    },
    {
      "epoch": 3.239231911733503,
      "grad_norm": 0.4334421358546128,
      "learning_rate": 4.1575105157651176e-05,
      "loss": 1.445,
      "num_input_tokens_seen": 24022325280,
      "step": 30533
    },
    {
      "epoch": 3.2393380012730746,
      "grad_norm": 0.47439741248734346,
      "learning_rate": 4.157458488669721e-05,
      "loss": 1.4606,
      "num_input_tokens_seen": 24023112016,
      "step": 30534
    },
    {
      "epoch": 3.239444090812646,
      "grad_norm": 0.44213592576495403,
      "learning_rate": 4.1574064602934885e-05,
      "loss": 1.5539,
      "num_input_tokens_seen": 24023898816,
      "step": 30535
    },
    {
      "epoch": 3.239550180352217,
      "grad_norm": 0.38112040420894183,
      "learning_rate": 4.157354430636461e-05,
      "loss": 1.3433,
      "num_input_tokens_seen": 24024685632,
      "step": 30536
    },
    {
      "epoch": 3.2396562698917886,
      "grad_norm": 0.40002661902965164,
      "learning_rate": 4.1573023996986794e-05,
      "loss": 1.3443,
      "num_input_tokens_seen": 24025472544,
      "step": 30537
    },
    {
      "epoch": 3.23976235943136,
      "grad_norm": 0.426550617200087,
      "learning_rate": 4.157250367480182e-05,
      "loss": 1.4356,
      "num_input_tokens_seen": 24026259376,
      "step": 30538
    },
    {
      "epoch": 3.2398684489709315,
      "grad_norm": 0.4335896472642286,
      "learning_rate": 4.157198333981011e-05,
      "loss": 1.523,
      "num_input_tokens_seen": 24027046128,
      "step": 30539
    },
    {
      "epoch": 3.239974538510503,
      "grad_norm": 0.34960981118106965,
      "learning_rate": 4.157146299201206e-05,
      "loss": 1.4111,
      "num_input_tokens_seen": 24027832896,
      "step": 30540
    },
    {
      "epoch": 3.2400806280500745,
      "grad_norm": 0.4934097380660582,
      "learning_rate": 4.157094263140806e-05,
      "loss": 1.4523,
      "num_input_tokens_seen": 24028619648,
      "step": 30541
    },
    {
      "epoch": 3.2401867175896455,
      "grad_norm": 0.39650586494739726,
      "learning_rate": 4.157042225799853e-05,
      "loss": 1.394,
      "num_input_tokens_seen": 24029406432,
      "step": 30542
    },
    {
      "epoch": 3.240292807129217,
      "grad_norm": 0.43637050380198644,
      "learning_rate": 4.156990187178386e-05,
      "loss": 1.4249,
      "num_input_tokens_seen": 24030193136,
      "step": 30543
    },
    {
      "epoch": 3.2403988966687884,
      "grad_norm": 0.44803257633191207,
      "learning_rate": 4.156938147276446e-05,
      "loss": 1.4262,
      "num_input_tokens_seen": 24030979968,
      "step": 30544
    },
    {
      "epoch": 3.24050498620836,
      "grad_norm": 0.44800736586541,
      "learning_rate": 4.1568861060940715e-05,
      "loss": 1.5338,
      "num_input_tokens_seen": 24031766688,
      "step": 30545
    },
    {
      "epoch": 3.2406110757479314,
      "grad_norm": 0.5982866775798013,
      "learning_rate": 4.1568340636313053e-05,
      "loss": 1.574,
      "num_input_tokens_seen": 24032553520,
      "step": 30546
    },
    {
      "epoch": 3.240717165287503,
      "grad_norm": 0.4162845245032069,
      "learning_rate": 4.1567820198881866e-05,
      "loss": 1.5038,
      "num_input_tokens_seen": 24033340400,
      "step": 30547
    },
    {
      "epoch": 3.240823254827074,
      "grad_norm": 0.43276522469556694,
      "learning_rate": 4.1567299748647544e-05,
      "loss": 1.3166,
      "num_input_tokens_seen": 24034127216,
      "step": 30548
    },
    {
      "epoch": 3.2409293443666454,
      "grad_norm": 0.5098442143524027,
      "learning_rate": 4.15667792856105e-05,
      "loss": 1.4164,
      "num_input_tokens_seen": 24034913968,
      "step": 30549
    },
    {
      "epoch": 3.241035433906217,
      "grad_norm": 0.40923603599082137,
      "learning_rate": 4.156625880977114e-05,
      "loss": 1.4925,
      "num_input_tokens_seen": 24035700704,
      "step": 30550
    },
    {
      "epoch": 3.2411415234457883,
      "grad_norm": 0.5237511162594131,
      "learning_rate": 4.156573832112986e-05,
      "loss": 1.5086,
      "num_input_tokens_seen": 24036487440,
      "step": 30551
    },
    {
      "epoch": 3.24124761298536,
      "grad_norm": 0.5172390398599169,
      "learning_rate": 4.1565217819687064e-05,
      "loss": 1.5625,
      "num_input_tokens_seen": 24037274304,
      "step": 30552
    },
    {
      "epoch": 3.241353702524931,
      "grad_norm": 0.4979852510568754,
      "learning_rate": 4.1564697305443154e-05,
      "loss": 1.4256,
      "num_input_tokens_seen": 24038061008,
      "step": 30553
    },
    {
      "epoch": 3.2414597920645023,
      "grad_norm": 0.570737971760009,
      "learning_rate": 4.156417677839853e-05,
      "loss": 1.6617,
      "num_input_tokens_seen": 24038847648,
      "step": 30554
    },
    {
      "epoch": 3.2415658816040738,
      "grad_norm": 0.415976039234631,
      "learning_rate": 4.156365623855359e-05,
      "loss": 1.5016,
      "num_input_tokens_seen": 24039634496,
      "step": 30555
    },
    {
      "epoch": 3.2416719711436452,
      "grad_norm": 0.5653243970040818,
      "learning_rate": 4.156313568590875e-05,
      "loss": 1.5133,
      "num_input_tokens_seen": 24040421328,
      "step": 30556
    },
    {
      "epoch": 3.2417780606832167,
      "grad_norm": 0.49296326655871475,
      "learning_rate": 4.156261512046441e-05,
      "loss": 1.4131,
      "num_input_tokens_seen": 24041208064,
      "step": 30557
    },
    {
      "epoch": 3.241884150222788,
      "grad_norm": 0.43182561423240023,
      "learning_rate": 4.156209454222096e-05,
      "loss": 1.498,
      "num_input_tokens_seen": 24041994800,
      "step": 30558
    },
    {
      "epoch": 3.2419902397623592,
      "grad_norm": 0.5741927231886783,
      "learning_rate": 4.156157395117881e-05,
      "loss": 1.488,
      "num_input_tokens_seen": 24042781552,
      "step": 30559
    },
    {
      "epoch": 3.2420963293019307,
      "grad_norm": 0.45052471282174217,
      "learning_rate": 4.1561053347338365e-05,
      "loss": 1.4437,
      "num_input_tokens_seen": 24043568368,
      "step": 30560
    },
    {
      "epoch": 3.242202418841502,
      "grad_norm": 0.5156266251217031,
      "learning_rate": 4.1560532730700016e-05,
      "loss": 1.4079,
      "num_input_tokens_seen": 24044355104,
      "step": 30561
    },
    {
      "epoch": 3.2423085083810737,
      "grad_norm": 0.41687176077244875,
      "learning_rate": 4.156001210126418e-05,
      "loss": 1.2684,
      "num_input_tokens_seen": 24045141904,
      "step": 30562
    },
    {
      "epoch": 3.242414597920645,
      "grad_norm": 0.5648640179000962,
      "learning_rate": 4.1559491459031247e-05,
      "loss": 1.467,
      "num_input_tokens_seen": 24045928704,
      "step": 30563
    },
    {
      "epoch": 3.2425206874602166,
      "grad_norm": 0.4521977091177656,
      "learning_rate": 4.155897080400163e-05,
      "loss": 1.4921,
      "num_input_tokens_seen": 24046715504,
      "step": 30564
    },
    {
      "epoch": 3.2426267769997876,
      "grad_norm": 0.46785071198513584,
      "learning_rate": 4.155845013617573e-05,
      "loss": 1.4246,
      "num_input_tokens_seen": 24047502368,
      "step": 30565
    },
    {
      "epoch": 3.242732866539359,
      "grad_norm": 0.5725361139151861,
      "learning_rate": 4.155792945555393e-05,
      "loss": 1.4965,
      "num_input_tokens_seen": 24048289024,
      "step": 30566
    },
    {
      "epoch": 3.2428389560789306,
      "grad_norm": 0.42922135329523076,
      "learning_rate": 4.155740876213666e-05,
      "loss": 1.4463,
      "num_input_tokens_seen": 24049075824,
      "step": 30567
    },
    {
      "epoch": 3.242945045618502,
      "grad_norm": 0.4898266055112051,
      "learning_rate": 4.155688805592431e-05,
      "loss": 1.4032,
      "num_input_tokens_seen": 24049862560,
      "step": 30568
    },
    {
      "epoch": 3.2430511351580735,
      "grad_norm": 0.4884864156462148,
      "learning_rate": 4.155636733691728e-05,
      "loss": 1.5218,
      "num_input_tokens_seen": 24050649280,
      "step": 30569
    },
    {
      "epoch": 3.243157224697645,
      "grad_norm": 0.4812894200216654,
      "learning_rate": 4.155584660511598e-05,
      "loss": 1.4705,
      "num_input_tokens_seen": 24051436064,
      "step": 30570
    },
    {
      "epoch": 3.243263314237216,
      "grad_norm": 0.4839690751434629,
      "learning_rate": 4.15553258605208e-05,
      "loss": 1.4234,
      "num_input_tokens_seen": 24052222816,
      "step": 30571
    },
    {
      "epoch": 3.2433694037767875,
      "grad_norm": 0.4488615472440575,
      "learning_rate": 4.1554805103132154e-05,
      "loss": 1.4955,
      "num_input_tokens_seen": 24053009520,
      "step": 30572
    },
    {
      "epoch": 3.243475493316359,
      "grad_norm": 0.4459194623108448,
      "learning_rate": 4.155428433295044e-05,
      "loss": 1.4754,
      "num_input_tokens_seen": 24053796352,
      "step": 30573
    },
    {
      "epoch": 3.2435815828559305,
      "grad_norm": 0.5594513988352152,
      "learning_rate": 4.155376354997606e-05,
      "loss": 1.4376,
      "num_input_tokens_seen": 24054583184,
      "step": 30574
    },
    {
      "epoch": 3.243687672395502,
      "grad_norm": 0.41721766490425977,
      "learning_rate": 4.155324275420942e-05,
      "loss": 1.4049,
      "num_input_tokens_seen": 24055370032,
      "step": 30575
    },
    {
      "epoch": 3.2437937619350734,
      "grad_norm": 0.4851885427047604,
      "learning_rate": 4.1552721945650917e-05,
      "loss": 1.4813,
      "num_input_tokens_seen": 24056156864,
      "step": 30576
    },
    {
      "epoch": 3.2438998514746444,
      "grad_norm": 0.44118873796709185,
      "learning_rate": 4.155220112430096e-05,
      "loss": 1.4804,
      "num_input_tokens_seen": 24056943600,
      "step": 30577
    },
    {
      "epoch": 3.244005941014216,
      "grad_norm": 0.4031776223578998,
      "learning_rate": 4.155168029015995e-05,
      "loss": 1.4126,
      "num_input_tokens_seen": 24057730384,
      "step": 30578
    },
    {
      "epoch": 3.2441120305537874,
      "grad_norm": 0.4739763265450994,
      "learning_rate": 4.155115944322827e-05,
      "loss": 1.4577,
      "num_input_tokens_seen": 24058517056,
      "step": 30579
    },
    {
      "epoch": 3.244218120093359,
      "grad_norm": 0.48061530943541947,
      "learning_rate": 4.155063858350635e-05,
      "loss": 1.4297,
      "num_input_tokens_seen": 24059303872,
      "step": 30580
    },
    {
      "epoch": 3.2443242096329303,
      "grad_norm": 0.5107368800475355,
      "learning_rate": 4.1550117710994584e-05,
      "loss": 1.4595,
      "num_input_tokens_seen": 24060090688,
      "step": 30581
    },
    {
      "epoch": 3.2444302991725014,
      "grad_norm": 0.4557347346583052,
      "learning_rate": 4.154959682569338e-05,
      "loss": 1.4828,
      "num_input_tokens_seen": 24060877408,
      "step": 30582
    },
    {
      "epoch": 3.244536388712073,
      "grad_norm": 0.4970078309061284,
      "learning_rate": 4.154907592760312e-05,
      "loss": 1.6099,
      "num_input_tokens_seen": 24061664128,
      "step": 30583
    },
    {
      "epoch": 3.2446424782516443,
      "grad_norm": 0.422516786343713,
      "learning_rate": 4.1548555016724226e-05,
      "loss": 1.4383,
      "num_input_tokens_seen": 24062450928,
      "step": 30584
    },
    {
      "epoch": 3.244748567791216,
      "grad_norm": 0.4920100790384351,
      "learning_rate": 4.1548034093057095e-05,
      "loss": 1.4479,
      "num_input_tokens_seen": 24063237696,
      "step": 30585
    },
    {
      "epoch": 3.2448546573307873,
      "grad_norm": 0.47626072048684753,
      "learning_rate": 4.1547513156602125e-05,
      "loss": 1.582,
      "num_input_tokens_seen": 24064024432,
      "step": 30586
    },
    {
      "epoch": 3.2449607468703587,
      "grad_norm": 0.43765175911754617,
      "learning_rate": 4.154699220735972e-05,
      "loss": 1.3786,
      "num_input_tokens_seen": 24064811248,
      "step": 30587
    },
    {
      "epoch": 3.24506683640993,
      "grad_norm": 0.5305073884385675,
      "learning_rate": 4.15464712453303e-05,
      "loss": 1.4973,
      "num_input_tokens_seen": 24065597968,
      "step": 30588
    },
    {
      "epoch": 3.2451729259495012,
      "grad_norm": 0.4250219843900404,
      "learning_rate": 4.154595027051423e-05,
      "loss": 1.5176,
      "num_input_tokens_seen": 24066384752,
      "step": 30589
    },
    {
      "epoch": 3.2452790154890727,
      "grad_norm": 0.4682582221813739,
      "learning_rate": 4.1545429282911955e-05,
      "loss": 1.3735,
      "num_input_tokens_seen": 24067171680,
      "step": 30590
    },
    {
      "epoch": 3.245385105028644,
      "grad_norm": 0.4473176568539449,
      "learning_rate": 4.154490828252385e-05,
      "loss": 1.504,
      "num_input_tokens_seen": 24067958512,
      "step": 30591
    },
    {
      "epoch": 3.2454911945682157,
      "grad_norm": 0.43636926199476855,
      "learning_rate": 4.1544387269350324e-05,
      "loss": 1.4383,
      "num_input_tokens_seen": 24068745280,
      "step": 30592
    },
    {
      "epoch": 3.245597284107787,
      "grad_norm": 0.46322544288702816,
      "learning_rate": 4.154386624339178e-05,
      "loss": 1.4821,
      "num_input_tokens_seen": 24069532064,
      "step": 30593
    },
    {
      "epoch": 3.245703373647358,
      "grad_norm": 0.42067146703682134,
      "learning_rate": 4.1543345204648624e-05,
      "loss": 1.4213,
      "num_input_tokens_seen": 24070318896,
      "step": 30594
    },
    {
      "epoch": 3.2458094631869296,
      "grad_norm": 0.45622690009870076,
      "learning_rate": 4.154282415312126e-05,
      "loss": 1.4537,
      "num_input_tokens_seen": 24071105616,
      "step": 30595
    },
    {
      "epoch": 3.245915552726501,
      "grad_norm": 0.5221459532620081,
      "learning_rate": 4.154230308881008e-05,
      "loss": 1.5915,
      "num_input_tokens_seen": 24071892416,
      "step": 30596
    },
    {
      "epoch": 3.2460216422660726,
      "grad_norm": 0.3997400800576342,
      "learning_rate": 4.15417820117155e-05,
      "loss": 1.3692,
      "num_input_tokens_seen": 24072679136,
      "step": 30597
    },
    {
      "epoch": 3.246127731805644,
      "grad_norm": 0.48895497094475515,
      "learning_rate": 4.154126092183791e-05,
      "loss": 1.432,
      "num_input_tokens_seen": 24073465872,
      "step": 30598
    },
    {
      "epoch": 3.2462338213452155,
      "grad_norm": 0.45934195803496836,
      "learning_rate": 4.154073981917772e-05,
      "loss": 1.483,
      "num_input_tokens_seen": 24074252640,
      "step": 30599
    },
    {
      "epoch": 3.2463399108847866,
      "grad_norm": 0.4227593698828389,
      "learning_rate": 4.154021870373534e-05,
      "loss": 1.4672,
      "num_input_tokens_seen": 24075039392,
      "step": 30600
    },
    {
      "epoch": 3.246446000424358,
      "grad_norm": 0.4312506430500814,
      "learning_rate": 4.153969757551115e-05,
      "loss": 1.5357,
      "num_input_tokens_seen": 24075826128,
      "step": 30601
    },
    {
      "epoch": 3.2465520899639295,
      "grad_norm": 0.4532268782658338,
      "learning_rate": 4.153917643450558e-05,
      "loss": 1.5561,
      "num_input_tokens_seen": 24076612928,
      "step": 30602
    },
    {
      "epoch": 3.246658179503501,
      "grad_norm": 0.4693022848847889,
      "learning_rate": 4.153865528071901e-05,
      "loss": 1.5165,
      "num_input_tokens_seen": 24077399696,
      "step": 30603
    },
    {
      "epoch": 3.2467642690430725,
      "grad_norm": 0.42496581569773556,
      "learning_rate": 4.153813411415186e-05,
      "loss": 1.4337,
      "num_input_tokens_seen": 24078186528,
      "step": 30604
    },
    {
      "epoch": 3.246870358582644,
      "grad_norm": 0.7692055131396148,
      "learning_rate": 4.153761293480452e-05,
      "loss": 1.5951,
      "num_input_tokens_seen": 24078973200,
      "step": 30605
    },
    {
      "epoch": 3.246976448122215,
      "grad_norm": 0.603280191467201,
      "learning_rate": 4.1537091742677405e-05,
      "loss": 1.4536,
      "num_input_tokens_seen": 24079759984,
      "step": 30606
    },
    {
      "epoch": 3.2470825376617864,
      "grad_norm": 0.5195558943750691,
      "learning_rate": 4.15365705377709e-05,
      "loss": 1.4995,
      "num_input_tokens_seen": 24080546720,
      "step": 30607
    },
    {
      "epoch": 3.247188627201358,
      "grad_norm": 0.5833647498106017,
      "learning_rate": 4.153604932008543e-05,
      "loss": 1.4049,
      "num_input_tokens_seen": 24081333456,
      "step": 30608
    },
    {
      "epoch": 3.2472947167409294,
      "grad_norm": 0.48145476400575377,
      "learning_rate": 4.153552808962138e-05,
      "loss": 1.4564,
      "num_input_tokens_seen": 24082120192,
      "step": 30609
    },
    {
      "epoch": 3.247400806280501,
      "grad_norm": 0.5199926705107949,
      "learning_rate": 4.153500684637916e-05,
      "loss": 1.4581,
      "num_input_tokens_seen": 24082907024,
      "step": 30610
    },
    {
      "epoch": 3.2475068958200723,
      "grad_norm": 0.5411658938186921,
      "learning_rate": 4.153448559035916e-05,
      "loss": 1.5022,
      "num_input_tokens_seen": 24083693728,
      "step": 30611
    },
    {
      "epoch": 3.2476129853596434,
      "grad_norm": 0.49404730314740103,
      "learning_rate": 4.1533964321561815e-05,
      "loss": 1.4066,
      "num_input_tokens_seen": 24084480496,
      "step": 30612
    },
    {
      "epoch": 3.247719074899215,
      "grad_norm": 0.4386674522223731,
      "learning_rate": 4.15334430399875e-05,
      "loss": 1.4875,
      "num_input_tokens_seen": 24085267232,
      "step": 30613
    },
    {
      "epoch": 3.2478251644387863,
      "grad_norm": 0.42238000504233447,
      "learning_rate": 4.153292174563661e-05,
      "loss": 1.3725,
      "num_input_tokens_seen": 24086054080,
      "step": 30614
    },
    {
      "epoch": 3.247931253978358,
      "grad_norm": 0.5342847458521897,
      "learning_rate": 4.153240043850958e-05,
      "loss": 1.5061,
      "num_input_tokens_seen": 24086840896,
      "step": 30615
    },
    {
      "epoch": 3.2480373435179293,
      "grad_norm": 0.4199765470697313,
      "learning_rate": 4.1531879118606795e-05,
      "loss": 1.4318,
      "num_input_tokens_seen": 24087627552,
      "step": 30616
    },
    {
      "epoch": 3.2481434330575008,
      "grad_norm": 0.8217805026170946,
      "learning_rate": 4.153135778592866e-05,
      "loss": 1.4193,
      "num_input_tokens_seen": 24088414352,
      "step": 30617
    },
    {
      "epoch": 3.248249522597072,
      "grad_norm": 0.45632193394575155,
      "learning_rate": 4.1530836440475575e-05,
      "loss": 1.4101,
      "num_input_tokens_seen": 24089201232,
      "step": 30618
    },
    {
      "epoch": 3.2483556121366433,
      "grad_norm": 0.7851362045839011,
      "learning_rate": 4.153031508224794e-05,
      "loss": 1.4433,
      "num_input_tokens_seen": 24089987984,
      "step": 30619
    },
    {
      "epoch": 3.2484617016762147,
      "grad_norm": 0.5816464853494943,
      "learning_rate": 4.152979371124617e-05,
      "loss": 1.5605,
      "num_input_tokens_seen": 24090774800,
      "step": 30620
    },
    {
      "epoch": 3.248567791215786,
      "grad_norm": 0.4923070558386952,
      "learning_rate": 4.1529272327470655e-05,
      "loss": 1.3427,
      "num_input_tokens_seen": 24091561600,
      "step": 30621
    },
    {
      "epoch": 3.2486738807553577,
      "grad_norm": 0.5580815600191619,
      "learning_rate": 4.15287509309218e-05,
      "loss": 1.5242,
      "num_input_tokens_seen": 24092348400,
      "step": 30622
    },
    {
      "epoch": 3.2487799702949287,
      "grad_norm": 0.5374661007177381,
      "learning_rate": 4.1528229521600015e-05,
      "loss": 1.415,
      "num_input_tokens_seen": 24093135184,
      "step": 30623
    },
    {
      "epoch": 3.2488860598345,
      "grad_norm": 0.5772877149112841,
      "learning_rate": 4.1527708099505704e-05,
      "loss": 1.4444,
      "num_input_tokens_seen": 24093921872,
      "step": 30624
    },
    {
      "epoch": 3.2489921493740717,
      "grad_norm": 0.4531362177709488,
      "learning_rate": 4.152718666463926e-05,
      "loss": 1.4441,
      "num_input_tokens_seen": 24094708608,
      "step": 30625
    },
    {
      "epoch": 3.249098238913643,
      "grad_norm": 0.5650523429850505,
      "learning_rate": 4.1526665217001094e-05,
      "loss": 1.3973,
      "num_input_tokens_seen": 24095495280,
      "step": 30626
    },
    {
      "epoch": 3.2492043284532146,
      "grad_norm": 0.4596431870843672,
      "learning_rate": 4.152614375659161e-05,
      "loss": 1.4902,
      "num_input_tokens_seen": 24096282048,
      "step": 30627
    },
    {
      "epoch": 3.249310417992786,
      "grad_norm": 0.5514375101298641,
      "learning_rate": 4.1525622283411194e-05,
      "loss": 1.5496,
      "num_input_tokens_seen": 24097068752,
      "step": 30628
    },
    {
      "epoch": 3.249416507532357,
      "grad_norm": 0.4591782950475819,
      "learning_rate": 4.152510079746027e-05,
      "loss": 1.4563,
      "num_input_tokens_seen": 24097855520,
      "step": 30629
    },
    {
      "epoch": 3.2495225970719286,
      "grad_norm": 0.4163260494253255,
      "learning_rate": 4.152457929873923e-05,
      "loss": 1.4332,
      "num_input_tokens_seen": 24098642240,
      "step": 30630
    },
    {
      "epoch": 3.2496286866115,
      "grad_norm": 0.47864465269868905,
      "learning_rate": 4.152405778724848e-05,
      "loss": 1.4637,
      "num_input_tokens_seen": 24099429024,
      "step": 30631
    },
    {
      "epoch": 3.2497347761510715,
      "grad_norm": 0.42319848577498004,
      "learning_rate": 4.1523536262988424e-05,
      "loss": 1.4144,
      "num_input_tokens_seen": 24100215792,
      "step": 30632
    },
    {
      "epoch": 3.249840865690643,
      "grad_norm": 0.42085834322141497,
      "learning_rate": 4.1523014725959474e-05,
      "loss": 1.4012,
      "num_input_tokens_seen": 24101002592,
      "step": 30633
    },
    {
      "epoch": 3.2499469552302145,
      "grad_norm": 0.5338124665641151,
      "learning_rate": 4.152249317616201e-05,
      "loss": 1.4888,
      "num_input_tokens_seen": 24101789360,
      "step": 30634
    },
    {
      "epoch": 3.2500530447697855,
      "grad_norm": 0.5074765343020865,
      "learning_rate": 4.1521971613596454e-05,
      "loss": 1.4004,
      "num_input_tokens_seen": 24102576240,
      "step": 30635
    },
    {
      "epoch": 3.250159134309357,
      "grad_norm": 0.524812289876546,
      "learning_rate": 4.15214500382632e-05,
      "loss": 1.5183,
      "num_input_tokens_seen": 24103362992,
      "step": 30636
    },
    {
      "epoch": 3.2502652238489285,
      "grad_norm": 0.39102202187390656,
      "learning_rate": 4.1520928450162654e-05,
      "loss": 1.2991,
      "num_input_tokens_seen": 24104149872,
      "step": 30637
    },
    {
      "epoch": 3.2503713133885,
      "grad_norm": 0.4755511305414397,
      "learning_rate": 4.152040684929522e-05,
      "loss": 1.5083,
      "num_input_tokens_seen": 24104936592,
      "step": 30638
    },
    {
      "epoch": 3.2504774029280714,
      "grad_norm": 0.4710486815504276,
      "learning_rate": 4.1519885235661304e-05,
      "loss": 1.4002,
      "num_input_tokens_seen": 24105723392,
      "step": 30639
    },
    {
      "epoch": 3.2505834924676424,
      "grad_norm": 0.4674414039942136,
      "learning_rate": 4.1519363609261305e-05,
      "loss": 1.5141,
      "num_input_tokens_seen": 24106510112,
      "step": 30640
    },
    {
      "epoch": 3.250689582007214,
      "grad_norm": 0.4940413036856741,
      "learning_rate": 4.1518841970095625e-05,
      "loss": 1.3691,
      "num_input_tokens_seen": 24107296896,
      "step": 30641
    },
    {
      "epoch": 3.2507956715467854,
      "grad_norm": 0.41476394388211657,
      "learning_rate": 4.1518320318164664e-05,
      "loss": 1.4766,
      "num_input_tokens_seen": 24108083696,
      "step": 30642
    },
    {
      "epoch": 3.250901761086357,
      "grad_norm": 0.48288807287696045,
      "learning_rate": 4.1517798653468835e-05,
      "loss": 1.4889,
      "num_input_tokens_seen": 24108870560,
      "step": 30643
    },
    {
      "epoch": 3.2510078506259283,
      "grad_norm": 0.503055829985652,
      "learning_rate": 4.151727697600854e-05,
      "loss": 1.4051,
      "num_input_tokens_seen": 24109657296,
      "step": 30644
    },
    {
      "epoch": 3.2511139401655,
      "grad_norm": 0.5201230091938011,
      "learning_rate": 4.151675528578417e-05,
      "loss": 1.5031,
      "num_input_tokens_seen": 24110444176,
      "step": 30645
    },
    {
      "epoch": 3.2512200297050713,
      "grad_norm": 0.6282779803136159,
      "learning_rate": 4.151623358279614e-05,
      "loss": 1.4348,
      "num_input_tokens_seen": 24111230928,
      "step": 30646
    },
    {
      "epoch": 3.2513261192446423,
      "grad_norm": 0.4949006327412782,
      "learning_rate": 4.151571186704484e-05,
      "loss": 1.4836,
      "num_input_tokens_seen": 24112017680,
      "step": 30647
    },
    {
      "epoch": 3.251432208784214,
      "grad_norm": 0.5055248199151671,
      "learning_rate": 4.151519013853069e-05,
      "loss": 1.4093,
      "num_input_tokens_seen": 24112804464,
      "step": 30648
    },
    {
      "epoch": 3.2515382983237853,
      "grad_norm": 0.42565957895298495,
      "learning_rate": 4.1514668397254085e-05,
      "loss": 1.323,
      "num_input_tokens_seen": 24113591264,
      "step": 30649
    },
    {
      "epoch": 3.2516443878633567,
      "grad_norm": 0.4372877533878893,
      "learning_rate": 4.1514146643215436e-05,
      "loss": 1.4203,
      "num_input_tokens_seen": 24114377968,
      "step": 30650
    },
    {
      "epoch": 3.251750477402928,
      "grad_norm": 0.5624486313866937,
      "learning_rate": 4.151362487641514e-05,
      "loss": 1.4784,
      "num_input_tokens_seen": 24115164672,
      "step": 30651
    },
    {
      "epoch": 3.2518565669424992,
      "grad_norm": 0.43343306977483964,
      "learning_rate": 4.1513103096853585e-05,
      "loss": 1.4553,
      "num_input_tokens_seen": 24115951456,
      "step": 30652
    },
    {
      "epoch": 3.2519626564820707,
      "grad_norm": 0.4494116725772972,
      "learning_rate": 4.1512581304531195e-05,
      "loss": 1.4753,
      "num_input_tokens_seen": 24116738256,
      "step": 30653
    },
    {
      "epoch": 3.252068746021642,
      "grad_norm": 0.5625930320290856,
      "learning_rate": 4.151205949944836e-05,
      "loss": 1.3845,
      "num_input_tokens_seen": 24117525088,
      "step": 30654
    },
    {
      "epoch": 3.2521748355612137,
      "grad_norm": 0.5781774396270642,
      "learning_rate": 4.151153768160551e-05,
      "loss": 1.4838,
      "num_input_tokens_seen": 24118311792,
      "step": 30655
    },
    {
      "epoch": 3.252280925100785,
      "grad_norm": 0.43014634360292,
      "learning_rate": 4.151101585100301e-05,
      "loss": 1.4793,
      "num_input_tokens_seen": 24119098512,
      "step": 30656
    },
    {
      "epoch": 3.2523870146403566,
      "grad_norm": 0.443222042909175,
      "learning_rate": 4.1510494007641286e-05,
      "loss": 1.3527,
      "num_input_tokens_seen": 24119885248,
      "step": 30657
    },
    {
      "epoch": 3.252493104179928,
      "grad_norm": 0.4543174311980182,
      "learning_rate": 4.150997215152074e-05,
      "loss": 1.3694,
      "num_input_tokens_seen": 24120672016,
      "step": 30658
    },
    {
      "epoch": 3.252599193719499,
      "grad_norm": 0.40536321344866544,
      "learning_rate": 4.1509450282641765e-05,
      "loss": 1.5302,
      "num_input_tokens_seen": 24121458864,
      "step": 30659
    },
    {
      "epoch": 3.2527052832590706,
      "grad_norm": 0.5714346540187404,
      "learning_rate": 4.150892840100478e-05,
      "loss": 1.4873,
      "num_input_tokens_seen": 24122245648,
      "step": 30660
    },
    {
      "epoch": 3.252811372798642,
      "grad_norm": 0.40570937410083246,
      "learning_rate": 4.150840650661016e-05,
      "loss": 1.4181,
      "num_input_tokens_seen": 24123032464,
      "step": 30661
    },
    {
      "epoch": 3.2529174623382136,
      "grad_norm": 0.4828569683617628,
      "learning_rate": 4.1507884599458355e-05,
      "loss": 1.4111,
      "num_input_tokens_seen": 24123819296,
      "step": 30662
    },
    {
      "epoch": 3.253023551877785,
      "grad_norm": 0.38346128228898524,
      "learning_rate": 4.150736267954973e-05,
      "loss": 1.3583,
      "num_input_tokens_seen": 24124606112,
      "step": 30663
    },
    {
      "epoch": 3.253129641417356,
      "grad_norm": 0.4166731259245812,
      "learning_rate": 4.1506840746884694e-05,
      "loss": 1.3726,
      "num_input_tokens_seen": 24125392928,
      "step": 30664
    },
    {
      "epoch": 3.2532357309569275,
      "grad_norm": 0.41010733193605536,
      "learning_rate": 4.150631880146366e-05,
      "loss": 1.3756,
      "num_input_tokens_seen": 24126179680,
      "step": 30665
    },
    {
      "epoch": 3.253341820496499,
      "grad_norm": 0.5727281524300815,
      "learning_rate": 4.150579684328702e-05,
      "loss": 1.4726,
      "num_input_tokens_seen": 24126966448,
      "step": 30666
    },
    {
      "epoch": 3.2534479100360705,
      "grad_norm": 0.4127171098997725,
      "learning_rate": 4.150527487235521e-05,
      "loss": 1.3534,
      "num_input_tokens_seen": 24127753264,
      "step": 30667
    },
    {
      "epoch": 3.253553999575642,
      "grad_norm": 0.7618391067514927,
      "learning_rate": 4.150475288866858e-05,
      "loss": 1.5674,
      "num_input_tokens_seen": 24128540032,
      "step": 30668
    },
    {
      "epoch": 3.2536600891152134,
      "grad_norm": 0.4026038934071563,
      "learning_rate": 4.1504230892227566e-05,
      "loss": 1.4404,
      "num_input_tokens_seen": 24129326896,
      "step": 30669
    },
    {
      "epoch": 3.2537661786547845,
      "grad_norm": 0.5240084130988661,
      "learning_rate": 4.1503708883032575e-05,
      "loss": 1.4044,
      "num_input_tokens_seen": 24130113648,
      "step": 30670
    },
    {
      "epoch": 3.253872268194356,
      "grad_norm": 0.4962117889581325,
      "learning_rate": 4.1503186861084e-05,
      "loss": 1.4434,
      "num_input_tokens_seen": 24130900512,
      "step": 30671
    },
    {
      "epoch": 3.2539783577339274,
      "grad_norm": 0.3982037275349716,
      "learning_rate": 4.150266482638224e-05,
      "loss": 1.4414,
      "num_input_tokens_seen": 24131687296,
      "step": 30672
    },
    {
      "epoch": 3.254084447273499,
      "grad_norm": 0.5619835237413857,
      "learning_rate": 4.1502142778927716e-05,
      "loss": 1.5446,
      "num_input_tokens_seen": 24132473968,
      "step": 30673
    },
    {
      "epoch": 3.2541905368130704,
      "grad_norm": 0.43626587950799284,
      "learning_rate": 4.1501620718720816e-05,
      "loss": 1.438,
      "num_input_tokens_seen": 24133260672,
      "step": 30674
    },
    {
      "epoch": 3.254296626352642,
      "grad_norm": 0.4676766734140823,
      "learning_rate": 4.150109864576194e-05,
      "loss": 1.3843,
      "num_input_tokens_seen": 24134047488,
      "step": 30675
    },
    {
      "epoch": 3.254402715892213,
      "grad_norm": 0.5437805915912125,
      "learning_rate": 4.1500576560051505e-05,
      "loss": 1.5115,
      "num_input_tokens_seen": 24134834208,
      "step": 30676
    },
    {
      "epoch": 3.2545088054317843,
      "grad_norm": 0.43314093502293055,
      "learning_rate": 4.150005446158991e-05,
      "loss": 1.477,
      "num_input_tokens_seen": 24135621040,
      "step": 30677
    },
    {
      "epoch": 3.254614894971356,
      "grad_norm": 0.41785753054014113,
      "learning_rate": 4.1499532350377556e-05,
      "loss": 1.5369,
      "num_input_tokens_seen": 24136407792,
      "step": 30678
    },
    {
      "epoch": 3.2547209845109273,
      "grad_norm": 0.48101548600566746,
      "learning_rate": 4.1499010226414845e-05,
      "loss": 1.5469,
      "num_input_tokens_seen": 24137194592,
      "step": 30679
    },
    {
      "epoch": 3.2548270740504988,
      "grad_norm": 0.41918310549163545,
      "learning_rate": 4.1498488089702195e-05,
      "loss": 1.4905,
      "num_input_tokens_seen": 24137981360,
      "step": 30680
    },
    {
      "epoch": 3.25493316359007,
      "grad_norm": 0.45088430115708056,
      "learning_rate": 4.149796594023998e-05,
      "loss": 1.4688,
      "num_input_tokens_seen": 24138768112,
      "step": 30681
    },
    {
      "epoch": 3.2550392531296413,
      "grad_norm": 0.46003472548540386,
      "learning_rate": 4.1497443778028633e-05,
      "loss": 1.4779,
      "num_input_tokens_seen": 24139554928,
      "step": 30682
    },
    {
      "epoch": 3.2551453426692127,
      "grad_norm": 0.41158356565265053,
      "learning_rate": 4.149692160306854e-05,
      "loss": 1.4898,
      "num_input_tokens_seen": 24140341632,
      "step": 30683
    },
    {
      "epoch": 3.255251432208784,
      "grad_norm": 0.44946305084940363,
      "learning_rate": 4.149639941536011e-05,
      "loss": 1.4668,
      "num_input_tokens_seen": 24141128368,
      "step": 30684
    },
    {
      "epoch": 3.2553575217483557,
      "grad_norm": 0.4456689734670978,
      "learning_rate": 4.149587721490375e-05,
      "loss": 1.4359,
      "num_input_tokens_seen": 24141915120,
      "step": 30685
    },
    {
      "epoch": 3.255463611287927,
      "grad_norm": 0.38058919253392376,
      "learning_rate": 4.149535500169985e-05,
      "loss": 1.3782,
      "num_input_tokens_seen": 24142701888,
      "step": 30686
    },
    {
      "epoch": 3.2555697008274986,
      "grad_norm": 0.44759305291383056,
      "learning_rate": 4.149483277574884e-05,
      "loss": 1.4248,
      "num_input_tokens_seen": 24143488720,
      "step": 30687
    },
    {
      "epoch": 3.2556757903670697,
      "grad_norm": 0.427698315074492,
      "learning_rate": 4.14943105370511e-05,
      "loss": 1.4342,
      "num_input_tokens_seen": 24144275600,
      "step": 30688
    },
    {
      "epoch": 3.255781879906641,
      "grad_norm": 0.43217300798384606,
      "learning_rate": 4.149378828560704e-05,
      "loss": 1.5271,
      "num_input_tokens_seen": 24145062240,
      "step": 30689
    },
    {
      "epoch": 3.2558879694462126,
      "grad_norm": 0.37847289916687726,
      "learning_rate": 4.1493266021417064e-05,
      "loss": 1.4266,
      "num_input_tokens_seen": 24145848896,
      "step": 30690
    },
    {
      "epoch": 3.255994058985784,
      "grad_norm": 0.3824084613983686,
      "learning_rate": 4.149274374448158e-05,
      "loss": 1.4217,
      "num_input_tokens_seen": 24146635616,
      "step": 30691
    },
    {
      "epoch": 3.2561001485253556,
      "grad_norm": 0.3929332873163264,
      "learning_rate": 4.149222145480098e-05,
      "loss": 1.5345,
      "num_input_tokens_seen": 24147422352,
      "step": 30692
    },
    {
      "epoch": 3.2562062380649266,
      "grad_norm": 0.4029437581245649,
      "learning_rate": 4.149169915237568e-05,
      "loss": 1.4651,
      "num_input_tokens_seen": 24148209152,
      "step": 30693
    },
    {
      "epoch": 3.256312327604498,
      "grad_norm": 0.40796306949585004,
      "learning_rate": 4.149117683720607e-05,
      "loss": 1.3824,
      "num_input_tokens_seen": 24148995856,
      "step": 30694
    },
    {
      "epoch": 3.2564184171440695,
      "grad_norm": 0.4396578037669569,
      "learning_rate": 4.149065450929257e-05,
      "loss": 1.536,
      "num_input_tokens_seen": 24149782640,
      "step": 30695
    },
    {
      "epoch": 3.256524506683641,
      "grad_norm": 0.4361688389347112,
      "learning_rate": 4.1490132168635585e-05,
      "loss": 1.4152,
      "num_input_tokens_seen": 24150569456,
      "step": 30696
    },
    {
      "epoch": 3.2566305962232125,
      "grad_norm": 0.46069664798222476,
      "learning_rate": 4.1489609815235494e-05,
      "loss": 1.4712,
      "num_input_tokens_seen": 24151356192,
      "step": 30697
    },
    {
      "epoch": 3.256736685762784,
      "grad_norm": 0.4243398800687166,
      "learning_rate": 4.148908744909272e-05,
      "loss": 1.5528,
      "num_input_tokens_seen": 24152142928,
      "step": 30698
    },
    {
      "epoch": 3.256842775302355,
      "grad_norm": 0.4420026537895696,
      "learning_rate": 4.148856507020767e-05,
      "loss": 1.4815,
      "num_input_tokens_seen": 24152929632,
      "step": 30699
    },
    {
      "epoch": 3.2569488648419265,
      "grad_norm": 0.4188012548117244,
      "learning_rate": 4.148804267858074e-05,
      "loss": 1.4891,
      "num_input_tokens_seen": 24153716480,
      "step": 30700
    },
    {
      "epoch": 3.257054954381498,
      "grad_norm": 0.43640526243168426,
      "learning_rate": 4.1487520274212334e-05,
      "loss": 1.4234,
      "num_input_tokens_seen": 24154503296,
      "step": 30701
    },
    {
      "epoch": 3.2571610439210694,
      "grad_norm": 0.4889693852802145,
      "learning_rate": 4.148699785710285e-05,
      "loss": 1.4408,
      "num_input_tokens_seen": 24155290128,
      "step": 30702
    },
    {
      "epoch": 3.257267133460641,
      "grad_norm": 0.4233919665947593,
      "learning_rate": 4.1486475427252704e-05,
      "loss": 1.4671,
      "num_input_tokens_seen": 24156076816,
      "step": 30703
    },
    {
      "epoch": 3.2573732230002124,
      "grad_norm": 0.44121635507772883,
      "learning_rate": 4.1485952984662294e-05,
      "loss": 1.3579,
      "num_input_tokens_seen": 24156863600,
      "step": 30704
    },
    {
      "epoch": 3.2574793125397834,
      "grad_norm": 0.4390239000330953,
      "learning_rate": 4.1485430529332013e-05,
      "loss": 1.4544,
      "num_input_tokens_seen": 24157650368,
      "step": 30705
    },
    {
      "epoch": 3.257585402079355,
      "grad_norm": 0.473303992273103,
      "learning_rate": 4.148490806126228e-05,
      "loss": 1.5102,
      "num_input_tokens_seen": 24158437232,
      "step": 30706
    },
    {
      "epoch": 3.2576914916189263,
      "grad_norm": 0.44036090522286153,
      "learning_rate": 4.14843855804535e-05,
      "loss": 1.5948,
      "num_input_tokens_seen": 24159224000,
      "step": 30707
    },
    {
      "epoch": 3.257797581158498,
      "grad_norm": 0.4477894133103671,
      "learning_rate": 4.1483863086906065e-05,
      "loss": 1.5189,
      "num_input_tokens_seen": 24160010624,
      "step": 30708
    },
    {
      "epoch": 3.2579036706980693,
      "grad_norm": 0.5285864151053002,
      "learning_rate": 4.148334058062038e-05,
      "loss": 1.613,
      "num_input_tokens_seen": 24160797296,
      "step": 30709
    },
    {
      "epoch": 3.2580097602376403,
      "grad_norm": 0.4126119548978501,
      "learning_rate": 4.1482818061596864e-05,
      "loss": 1.4264,
      "num_input_tokens_seen": 24161583936,
      "step": 30710
    },
    {
      "epoch": 3.258115849777212,
      "grad_norm": 0.49803303149668776,
      "learning_rate": 4.14822955298359e-05,
      "loss": 1.4201,
      "num_input_tokens_seen": 24162370768,
      "step": 30711
    },
    {
      "epoch": 3.2582219393167833,
      "grad_norm": 0.455263009790628,
      "learning_rate": 4.1481772985337906e-05,
      "loss": 1.4652,
      "num_input_tokens_seen": 24163157488,
      "step": 30712
    },
    {
      "epoch": 3.2583280288563548,
      "grad_norm": 0.4501456444157058,
      "learning_rate": 4.148125042810328e-05,
      "loss": 1.4277,
      "num_input_tokens_seen": 24163944160,
      "step": 30713
    },
    {
      "epoch": 3.2584341183959262,
      "grad_norm": 0.5056031290789735,
      "learning_rate": 4.148072785813243e-05,
      "loss": 1.52,
      "num_input_tokens_seen": 24164730928,
      "step": 30714
    },
    {
      "epoch": 3.2585402079354977,
      "grad_norm": 0.3841647420782823,
      "learning_rate": 4.1480205275425756e-05,
      "loss": 1.3342,
      "num_input_tokens_seen": 24165517632,
      "step": 30715
    },
    {
      "epoch": 3.258646297475069,
      "grad_norm": 0.5065304491325224,
      "learning_rate": 4.147968267998367e-05,
      "loss": 1.4431,
      "num_input_tokens_seen": 24166304320,
      "step": 30716
    },
    {
      "epoch": 3.25875238701464,
      "grad_norm": 0.5070885996393975,
      "learning_rate": 4.147916007180655e-05,
      "loss": 1.6747,
      "num_input_tokens_seen": 24167091040,
      "step": 30717
    },
    {
      "epoch": 3.2588584765542117,
      "grad_norm": 0.4204565710505391,
      "learning_rate": 4.1478637450894836e-05,
      "loss": 1.4133,
      "num_input_tokens_seen": 24167877776,
      "step": 30718
    },
    {
      "epoch": 3.258964566093783,
      "grad_norm": 0.48893336471225096,
      "learning_rate": 4.147811481724891e-05,
      "loss": 1.356,
      "num_input_tokens_seen": 24168664528,
      "step": 30719
    },
    {
      "epoch": 3.2590706556333546,
      "grad_norm": 0.5061872157639256,
      "learning_rate": 4.147759217086918e-05,
      "loss": 1.4345,
      "num_input_tokens_seen": 24169451312,
      "step": 30720
    },
    {
      "epoch": 3.259176745172926,
      "grad_norm": 0.5226277706325249,
      "learning_rate": 4.147706951175605e-05,
      "loss": 1.4512,
      "num_input_tokens_seen": 24170238032,
      "step": 30721
    },
    {
      "epoch": 3.259282834712497,
      "grad_norm": 0.4440657308192886,
      "learning_rate": 4.1476546839909916e-05,
      "loss": 1.4893,
      "num_input_tokens_seen": 24171024768,
      "step": 30722
    },
    {
      "epoch": 3.2593889242520686,
      "grad_norm": 0.4462370028817648,
      "learning_rate": 4.1476024155331205e-05,
      "loss": 1.4298,
      "num_input_tokens_seen": 24171811648,
      "step": 30723
    },
    {
      "epoch": 3.25949501379164,
      "grad_norm": 0.5000231674192958,
      "learning_rate": 4.1475501458020295e-05,
      "loss": 1.5743,
      "num_input_tokens_seen": 24172598464,
      "step": 30724
    },
    {
      "epoch": 3.2596011033312116,
      "grad_norm": 0.44279320293835867,
      "learning_rate": 4.14749787479776e-05,
      "loss": 1.4827,
      "num_input_tokens_seen": 24173385184,
      "step": 30725
    },
    {
      "epoch": 3.259707192870783,
      "grad_norm": 0.519286827485328,
      "learning_rate": 4.147445602520354e-05,
      "loss": 1.4792,
      "num_input_tokens_seen": 24174171984,
      "step": 30726
    },
    {
      "epoch": 3.2598132824103545,
      "grad_norm": 0.41749619739282967,
      "learning_rate": 4.147393328969849e-05,
      "loss": 1.3946,
      "num_input_tokens_seen": 24174958784,
      "step": 30727
    },
    {
      "epoch": 3.259919371949926,
      "grad_norm": 0.5605987469789109,
      "learning_rate": 4.1473410541462866e-05,
      "loss": 1.4503,
      "num_input_tokens_seen": 24175745616,
      "step": 30728
    },
    {
      "epoch": 3.260025461489497,
      "grad_norm": 0.5581856596991399,
      "learning_rate": 4.147288778049708e-05,
      "loss": 1.494,
      "num_input_tokens_seen": 24176532384,
      "step": 30729
    },
    {
      "epoch": 3.2601315510290685,
      "grad_norm": 0.5592857154775267,
      "learning_rate": 4.147236500680153e-05,
      "loss": 1.4192,
      "num_input_tokens_seen": 24177319296,
      "step": 30730
    },
    {
      "epoch": 3.26023764056864,
      "grad_norm": 0.5340309746691231,
      "learning_rate": 4.1471842220376614e-05,
      "loss": 1.4975,
      "num_input_tokens_seen": 24178106032,
      "step": 30731
    },
    {
      "epoch": 3.2603437301082114,
      "grad_norm": 0.45450598756474947,
      "learning_rate": 4.1471319421222745e-05,
      "loss": 1.4085,
      "num_input_tokens_seen": 24178892880,
      "step": 30732
    },
    {
      "epoch": 3.260449819647783,
      "grad_norm": 0.5031588443693614,
      "learning_rate": 4.147079660934032e-05,
      "loss": 1.4788,
      "num_input_tokens_seen": 24179679760,
      "step": 30733
    },
    {
      "epoch": 3.260555909187354,
      "grad_norm": 0.4517470310492609,
      "learning_rate": 4.147027378472975e-05,
      "loss": 1.4185,
      "num_input_tokens_seen": 24180466576,
      "step": 30734
    },
    {
      "epoch": 3.2606619987269254,
      "grad_norm": 0.4930199465980353,
      "learning_rate": 4.146975094739144e-05,
      "loss": 1.4487,
      "num_input_tokens_seen": 24181253312,
      "step": 30735
    },
    {
      "epoch": 3.260768088266497,
      "grad_norm": 0.5061490198042992,
      "learning_rate": 4.146922809732578e-05,
      "loss": 1.5707,
      "num_input_tokens_seen": 24182040032,
      "step": 30736
    },
    {
      "epoch": 3.2608741778060684,
      "grad_norm": 0.41497867837271357,
      "learning_rate": 4.14687052345332e-05,
      "loss": 1.4325,
      "num_input_tokens_seen": 24182826848,
      "step": 30737
    },
    {
      "epoch": 3.26098026734564,
      "grad_norm": 0.46905095682521597,
      "learning_rate": 4.1468182359014076e-05,
      "loss": 1.4909,
      "num_input_tokens_seen": 24183613600,
      "step": 30738
    },
    {
      "epoch": 3.261086356885211,
      "grad_norm": 0.42547624064193373,
      "learning_rate": 4.146765947076883e-05,
      "loss": 1.4453,
      "num_input_tokens_seen": 24184400432,
      "step": 30739
    },
    {
      "epoch": 3.2611924464247823,
      "grad_norm": 0.44511333651714186,
      "learning_rate": 4.146713656979785e-05,
      "loss": 1.47,
      "num_input_tokens_seen": 24185187184,
      "step": 30740
    },
    {
      "epoch": 3.261298535964354,
      "grad_norm": 0.4459730226568283,
      "learning_rate": 4.146661365610155e-05,
      "loss": 1.494,
      "num_input_tokens_seen": 24185973936,
      "step": 30741
    },
    {
      "epoch": 3.2614046255039253,
      "grad_norm": 0.4644491259797919,
      "learning_rate": 4.1466090729680346e-05,
      "loss": 1.5199,
      "num_input_tokens_seen": 24186760688,
      "step": 30742
    },
    {
      "epoch": 3.2615107150434968,
      "grad_norm": 0.43625512652410364,
      "learning_rate": 4.146556779053462e-05,
      "loss": 1.6335,
      "num_input_tokens_seen": 24187547440,
      "step": 30743
    },
    {
      "epoch": 3.2616168045830682,
      "grad_norm": 0.43862699465973154,
      "learning_rate": 4.146504483866479e-05,
      "loss": 1.4709,
      "num_input_tokens_seen": 24188334256,
      "step": 30744
    },
    {
      "epoch": 3.2617228941226397,
      "grad_norm": 0.5197052848787064,
      "learning_rate": 4.146452187407126e-05,
      "loss": 1.4367,
      "num_input_tokens_seen": 24189121040,
      "step": 30745
    },
    {
      "epoch": 3.2618289836622107,
      "grad_norm": 0.41775756015654253,
      "learning_rate": 4.146399889675443e-05,
      "loss": 1.5421,
      "num_input_tokens_seen": 24189907792,
      "step": 30746
    },
    {
      "epoch": 3.261935073201782,
      "grad_norm": 0.47377149891118847,
      "learning_rate": 4.14634759067147e-05,
      "loss": 1.4144,
      "num_input_tokens_seen": 24190694528,
      "step": 30747
    },
    {
      "epoch": 3.2620411627413537,
      "grad_norm": 0.4289215895269273,
      "learning_rate": 4.146295290395248e-05,
      "loss": 1.5479,
      "num_input_tokens_seen": 24191481200,
      "step": 30748
    },
    {
      "epoch": 3.262147252280925,
      "grad_norm": 0.4652046714675569,
      "learning_rate": 4.146242988846818e-05,
      "loss": 1.4881,
      "num_input_tokens_seen": 24192267984,
      "step": 30749
    },
    {
      "epoch": 3.2622533418204966,
      "grad_norm": 0.43304998105694265,
      "learning_rate": 4.146190686026219e-05,
      "loss": 1.4658,
      "num_input_tokens_seen": 24193054752,
      "step": 30750
    },
    {
      "epoch": 3.2623594313600677,
      "grad_norm": 0.3957701131071265,
      "learning_rate": 4.146138381933492e-05,
      "loss": 1.3768,
      "num_input_tokens_seen": 24193841488,
      "step": 30751
    },
    {
      "epoch": 3.262465520899639,
      "grad_norm": 0.4005343012107729,
      "learning_rate": 4.146086076568677e-05,
      "loss": 1.4437,
      "num_input_tokens_seen": 24194628192,
      "step": 30752
    },
    {
      "epoch": 3.2625716104392106,
      "grad_norm": 0.409599182458242,
      "learning_rate": 4.146033769931816e-05,
      "loss": 1.4157,
      "num_input_tokens_seen": 24195414928,
      "step": 30753
    },
    {
      "epoch": 3.262677699978782,
      "grad_norm": 0.4510772972125306,
      "learning_rate": 4.1459814620229485e-05,
      "loss": 1.4145,
      "num_input_tokens_seen": 24196201696,
      "step": 30754
    },
    {
      "epoch": 3.2627837895183536,
      "grad_norm": 0.4100756015514305,
      "learning_rate": 4.1459291528421145e-05,
      "loss": 1.5097,
      "num_input_tokens_seen": 24196988512,
      "step": 30755
    },
    {
      "epoch": 3.262889879057925,
      "grad_norm": 0.43232253035237134,
      "learning_rate": 4.145876842389355e-05,
      "loss": 1.4159,
      "num_input_tokens_seen": 24197775296,
      "step": 30756
    },
    {
      "epoch": 3.2629959685974965,
      "grad_norm": 0.4941453678367236,
      "learning_rate": 4.1458245306647095e-05,
      "loss": 1.34,
      "num_input_tokens_seen": 24198562144,
      "step": 30757
    },
    {
      "epoch": 3.2631020581370676,
      "grad_norm": 0.38608934806123074,
      "learning_rate": 4.145772217668219e-05,
      "loss": 1.3767,
      "num_input_tokens_seen": 24199348944,
      "step": 30758
    },
    {
      "epoch": 3.263208147676639,
      "grad_norm": 0.49442965525008514,
      "learning_rate": 4.145719903399925e-05,
      "loss": 1.553,
      "num_input_tokens_seen": 24200135696,
      "step": 30759
    },
    {
      "epoch": 3.2633142372162105,
      "grad_norm": 0.471864308017153,
      "learning_rate": 4.1456675878598664e-05,
      "loss": 1.3743,
      "num_input_tokens_seen": 24200922528,
      "step": 30760
    },
    {
      "epoch": 3.263420326755782,
      "grad_norm": 0.4498459446732273,
      "learning_rate": 4.145615271048084e-05,
      "loss": 1.4221,
      "num_input_tokens_seen": 24201709280,
      "step": 30761
    },
    {
      "epoch": 3.2635264162953534,
      "grad_norm": 0.7316629405354456,
      "learning_rate": 4.145562952964619e-05,
      "loss": 1.5226,
      "num_input_tokens_seen": 24202496016,
      "step": 30762
    },
    {
      "epoch": 3.2636325058349245,
      "grad_norm": 0.4334245575322189,
      "learning_rate": 4.145510633609511e-05,
      "loss": 1.3495,
      "num_input_tokens_seen": 24203282784,
      "step": 30763
    },
    {
      "epoch": 3.263738595374496,
      "grad_norm": 0.6855124416658175,
      "learning_rate": 4.145458312982801e-05,
      "loss": 1.504,
      "num_input_tokens_seen": 24204069680,
      "step": 30764
    },
    {
      "epoch": 3.2638446849140674,
      "grad_norm": 0.4210220109561746,
      "learning_rate": 4.145405991084528e-05,
      "loss": 1.4743,
      "num_input_tokens_seen": 24204856416,
      "step": 30765
    },
    {
      "epoch": 3.263950774453639,
      "grad_norm": 0.44007859634177005,
      "learning_rate": 4.145353667914734e-05,
      "loss": 1.4294,
      "num_input_tokens_seen": 24205643200,
      "step": 30766
    },
    {
      "epoch": 3.2640568639932104,
      "grad_norm": 0.5270165032741203,
      "learning_rate": 4.145301343473459e-05,
      "loss": 1.426,
      "num_input_tokens_seen": 24206429968,
      "step": 30767
    },
    {
      "epoch": 3.264162953532782,
      "grad_norm": 0.5117149515705305,
      "learning_rate": 4.1452490177607436e-05,
      "loss": 1.4499,
      "num_input_tokens_seen": 24207216640,
      "step": 30768
    },
    {
      "epoch": 3.264269043072353,
      "grad_norm": 0.4474863765108349,
      "learning_rate": 4.145196690776628e-05,
      "loss": 1.48,
      "num_input_tokens_seen": 24208003424,
      "step": 30769
    },
    {
      "epoch": 3.2643751326119244,
      "grad_norm": 0.3891589222345575,
      "learning_rate": 4.145144362521153e-05,
      "loss": 1.3024,
      "num_input_tokens_seen": 24208790224,
      "step": 30770
    },
    {
      "epoch": 3.264481222151496,
      "grad_norm": 0.47668564092982657,
      "learning_rate": 4.145092032994358e-05,
      "loss": 1.5082,
      "num_input_tokens_seen": 24209576928,
      "step": 30771
    },
    {
      "epoch": 3.2645873116910673,
      "grad_norm": 0.471249648987187,
      "learning_rate": 4.145039702196285e-05,
      "loss": 1.4567,
      "num_input_tokens_seen": 24210363680,
      "step": 30772
    },
    {
      "epoch": 3.264693401230639,
      "grad_norm": 0.43855752764728917,
      "learning_rate": 4.144987370126973e-05,
      "loss": 1.5142,
      "num_input_tokens_seen": 24211150448,
      "step": 30773
    },
    {
      "epoch": 3.2647994907702103,
      "grad_norm": 0.4981460885569596,
      "learning_rate": 4.1449350367864633e-05,
      "loss": 1.3723,
      "num_input_tokens_seen": 24211937280,
      "step": 30774
    },
    {
      "epoch": 3.2649055803097813,
      "grad_norm": 0.539683465570695,
      "learning_rate": 4.144882702174795e-05,
      "loss": 1.4848,
      "num_input_tokens_seen": 24212724032,
      "step": 30775
    },
    {
      "epoch": 3.2650116698493528,
      "grad_norm": 0.6434338603555051,
      "learning_rate": 4.144830366292011e-05,
      "loss": 1.5709,
      "num_input_tokens_seen": 24213510768,
      "step": 30776
    },
    {
      "epoch": 3.2651177593889242,
      "grad_norm": 0.5279975817112381,
      "learning_rate": 4.14477802913815e-05,
      "loss": 1.492,
      "num_input_tokens_seen": 24214297520,
      "step": 30777
    },
    {
      "epoch": 3.2652238489284957,
      "grad_norm": 0.43979404000279576,
      "learning_rate": 4.144725690713253e-05,
      "loss": 1.3618,
      "num_input_tokens_seen": 24215084336,
      "step": 30778
    },
    {
      "epoch": 3.265329938468067,
      "grad_norm": 0.5686074893937747,
      "learning_rate": 4.1446733510173597e-05,
      "loss": 1.3517,
      "num_input_tokens_seen": 24215871088,
      "step": 30779
    },
    {
      "epoch": 3.265436028007638,
      "grad_norm": 0.5660524542829848,
      "learning_rate": 4.144621010050511e-05,
      "loss": 1.5344,
      "num_input_tokens_seen": 24216657776,
      "step": 30780
    },
    {
      "epoch": 3.2655421175472097,
      "grad_norm": 0.42658731406559874,
      "learning_rate": 4.144568667812748e-05,
      "loss": 1.4918,
      "num_input_tokens_seen": 24217444528,
      "step": 30781
    },
    {
      "epoch": 3.265648207086781,
      "grad_norm": 0.5235882014814224,
      "learning_rate": 4.14451632430411e-05,
      "loss": 1.3836,
      "num_input_tokens_seen": 24218231312,
      "step": 30782
    },
    {
      "epoch": 3.2657542966263526,
      "grad_norm": 0.5158809381846668,
      "learning_rate": 4.144463979524639e-05,
      "loss": 1.4099,
      "num_input_tokens_seen": 24219018064,
      "step": 30783
    },
    {
      "epoch": 3.265860386165924,
      "grad_norm": 0.41655577275238925,
      "learning_rate": 4.144411633474373e-05,
      "loss": 1.3184,
      "num_input_tokens_seen": 24219804976,
      "step": 30784
    },
    {
      "epoch": 3.2659664757054956,
      "grad_norm": 0.5379880838262495,
      "learning_rate": 4.144359286153355e-05,
      "loss": 1.4453,
      "num_input_tokens_seen": 24220591664,
      "step": 30785
    },
    {
      "epoch": 3.266072565245067,
      "grad_norm": 0.46588559334234814,
      "learning_rate": 4.1443069375616244e-05,
      "loss": 1.4151,
      "num_input_tokens_seen": 24221378416,
      "step": 30786
    },
    {
      "epoch": 3.266178654784638,
      "grad_norm": 0.4308921971909804,
      "learning_rate": 4.144254587699221e-05,
      "loss": 1.4867,
      "num_input_tokens_seen": 24222165184,
      "step": 30787
    },
    {
      "epoch": 3.2662847443242096,
      "grad_norm": 0.42074612958721147,
      "learning_rate": 4.144202236566187e-05,
      "loss": 1.4426,
      "num_input_tokens_seen": 24222951968,
      "step": 30788
    },
    {
      "epoch": 3.266390833863781,
      "grad_norm": 0.4342117665363451,
      "learning_rate": 4.1441498841625605e-05,
      "loss": 1.4577,
      "num_input_tokens_seen": 24223738592,
      "step": 30789
    },
    {
      "epoch": 3.2664969234033525,
      "grad_norm": 0.47114918719388205,
      "learning_rate": 4.144097530488384e-05,
      "loss": 1.4904,
      "num_input_tokens_seen": 24224525424,
      "step": 30790
    },
    {
      "epoch": 3.266603012942924,
      "grad_norm": 0.3953364083961951,
      "learning_rate": 4.144045175543697e-05,
      "loss": 1.3059,
      "num_input_tokens_seen": 24225312160,
      "step": 30791
    },
    {
      "epoch": 3.266709102482495,
      "grad_norm": 0.46008417532086693,
      "learning_rate": 4.14399281932854e-05,
      "loss": 1.4445,
      "num_input_tokens_seen": 24226098848,
      "step": 30792
    },
    {
      "epoch": 3.2668151920220665,
      "grad_norm": 0.45123429949188015,
      "learning_rate": 4.143940461842954e-05,
      "loss": 1.3868,
      "num_input_tokens_seen": 24226885696,
      "step": 30793
    },
    {
      "epoch": 3.266921281561638,
      "grad_norm": 0.3838234783888398,
      "learning_rate": 4.1438881030869786e-05,
      "loss": 1.4598,
      "num_input_tokens_seen": 24227672464,
      "step": 30794
    },
    {
      "epoch": 3.2670273711012094,
      "grad_norm": 0.46334107839765626,
      "learning_rate": 4.143835743060655e-05,
      "loss": 1.4851,
      "num_input_tokens_seen": 24228459296,
      "step": 30795
    },
    {
      "epoch": 3.267133460640781,
      "grad_norm": 0.45491933150925684,
      "learning_rate": 4.143783381764023e-05,
      "loss": 1.4212,
      "num_input_tokens_seen": 24229246144,
      "step": 30796
    },
    {
      "epoch": 3.2672395501803524,
      "grad_norm": 0.38606297618842883,
      "learning_rate": 4.143731019197123e-05,
      "loss": 1.4678,
      "num_input_tokens_seen": 24230032848,
      "step": 30797
    },
    {
      "epoch": 3.2673456397199234,
      "grad_norm": 0.4335051783338627,
      "learning_rate": 4.143678655359997e-05,
      "loss": 1.4433,
      "num_input_tokens_seen": 24230819536,
      "step": 30798
    },
    {
      "epoch": 3.267451729259495,
      "grad_norm": 0.4034367254112699,
      "learning_rate": 4.143626290252684e-05,
      "loss": 1.5334,
      "num_input_tokens_seen": 24231606256,
      "step": 30799
    },
    {
      "epoch": 3.2675578187990664,
      "grad_norm": 0.4579512905774567,
      "learning_rate": 4.143573923875225e-05,
      "loss": 1.6204,
      "num_input_tokens_seen": 24232392880,
      "step": 30800
    },
    {
      "epoch": 3.267663908338638,
      "grad_norm": 0.4686491161246383,
      "learning_rate": 4.14352155622766e-05,
      "loss": 1.5186,
      "num_input_tokens_seen": 24233179584,
      "step": 30801
    },
    {
      "epoch": 3.2677699978782093,
      "grad_norm": 0.45626932123114844,
      "learning_rate": 4.14346918731003e-05,
      "loss": 1.4944,
      "num_input_tokens_seen": 24233966400,
      "step": 30802
    },
    {
      "epoch": 3.267876087417781,
      "grad_norm": 0.40218496299499423,
      "learning_rate": 4.143416817122375e-05,
      "loss": 1.4552,
      "num_input_tokens_seen": 24234753168,
      "step": 30803
    },
    {
      "epoch": 3.267982176957352,
      "grad_norm": 0.5267810626040932,
      "learning_rate": 4.1433644456647344e-05,
      "loss": 1.3988,
      "num_input_tokens_seen": 24235539952,
      "step": 30804
    },
    {
      "epoch": 3.2680882664969233,
      "grad_norm": 0.3772144328378214,
      "learning_rate": 4.143312072937152e-05,
      "loss": 1.4317,
      "num_input_tokens_seen": 24236326800,
      "step": 30805
    },
    {
      "epoch": 3.2681943560364948,
      "grad_norm": 0.5107988489557531,
      "learning_rate": 4.143259698939666e-05,
      "loss": 1.4157,
      "num_input_tokens_seen": 24237113568,
      "step": 30806
    },
    {
      "epoch": 3.2683004455760662,
      "grad_norm": 0.4298815027425082,
      "learning_rate": 4.143207323672316e-05,
      "loss": 1.4556,
      "num_input_tokens_seen": 24237900368,
      "step": 30807
    },
    {
      "epoch": 3.2684065351156377,
      "grad_norm": 0.6281501047314967,
      "learning_rate": 4.1431549471351445e-05,
      "loss": 1.5172,
      "num_input_tokens_seen": 24238687168,
      "step": 30808
    },
    {
      "epoch": 3.2685126246552088,
      "grad_norm": 0.5117482282141307,
      "learning_rate": 4.143102569328191e-05,
      "loss": 1.5814,
      "num_input_tokens_seen": 24239473952,
      "step": 30809
    },
    {
      "epoch": 3.2686187141947802,
      "grad_norm": 0.6237750116693104,
      "learning_rate": 4.143050190251496e-05,
      "loss": 1.59,
      "num_input_tokens_seen": 24240260688,
      "step": 30810
    },
    {
      "epoch": 3.2687248037343517,
      "grad_norm": 0.4632976628428309,
      "learning_rate": 4.142997809905099e-05,
      "loss": 1.4272,
      "num_input_tokens_seen": 24241047360,
      "step": 30811
    },
    {
      "epoch": 3.268830893273923,
      "grad_norm": 0.45100442626850046,
      "learning_rate": 4.142945428289043e-05,
      "loss": 1.309,
      "num_input_tokens_seen": 24241834160,
      "step": 30812
    },
    {
      "epoch": 3.2689369828134947,
      "grad_norm": 0.5177560776952677,
      "learning_rate": 4.142893045403366e-05,
      "loss": 1.5995,
      "num_input_tokens_seen": 24242620832,
      "step": 30813
    },
    {
      "epoch": 3.269043072353066,
      "grad_norm": 0.44112562093908475,
      "learning_rate": 4.14284066124811e-05,
      "loss": 1.4293,
      "num_input_tokens_seen": 24243407552,
      "step": 30814
    },
    {
      "epoch": 3.2691491618926376,
      "grad_norm": 0.5716219556044353,
      "learning_rate": 4.142788275823315e-05,
      "loss": 1.4818,
      "num_input_tokens_seen": 24244194240,
      "step": 30815
    },
    {
      "epoch": 3.2692552514322086,
      "grad_norm": 0.42103480546528127,
      "learning_rate": 4.1427358891290216e-05,
      "loss": 1.3456,
      "num_input_tokens_seen": 24244981072,
      "step": 30816
    },
    {
      "epoch": 3.26936134097178,
      "grad_norm": 0.45194729480573764,
      "learning_rate": 4.142683501165269e-05,
      "loss": 1.3171,
      "num_input_tokens_seen": 24245767840,
      "step": 30817
    },
    {
      "epoch": 3.2694674305113516,
      "grad_norm": 0.433878370070949,
      "learning_rate": 4.142631111932099e-05,
      "loss": 1.4772,
      "num_input_tokens_seen": 24246554592,
      "step": 30818
    },
    {
      "epoch": 3.269573520050923,
      "grad_norm": 0.45098495312856335,
      "learning_rate": 4.142578721429553e-05,
      "loss": 1.3361,
      "num_input_tokens_seen": 24247341408,
      "step": 30819
    },
    {
      "epoch": 3.2696796095904945,
      "grad_norm": 0.4464610523656822,
      "learning_rate": 4.14252632965767e-05,
      "loss": 1.3485,
      "num_input_tokens_seen": 24248128160,
      "step": 30820
    },
    {
      "epoch": 3.2697856991300656,
      "grad_norm": 0.47022084484268745,
      "learning_rate": 4.1424739366164906e-05,
      "loss": 1.4414,
      "num_input_tokens_seen": 24248914912,
      "step": 30821
    },
    {
      "epoch": 3.269891788669637,
      "grad_norm": 0.37324345841047607,
      "learning_rate": 4.142421542306055e-05,
      "loss": 1.3191,
      "num_input_tokens_seen": 24249701856,
      "step": 30822
    },
    {
      "epoch": 3.2699978782092085,
      "grad_norm": 0.48739192879209137,
      "learning_rate": 4.1423691467264055e-05,
      "loss": 1.4954,
      "num_input_tokens_seen": 24250488672,
      "step": 30823
    },
    {
      "epoch": 3.27010396774878,
      "grad_norm": 0.5493887101597486,
      "learning_rate": 4.142316749877581e-05,
      "loss": 1.4871,
      "num_input_tokens_seen": 24251275408,
      "step": 30824
    },
    {
      "epoch": 3.2702100572883515,
      "grad_norm": 0.4450874849618933,
      "learning_rate": 4.142264351759621e-05,
      "loss": 1.4753,
      "num_input_tokens_seen": 24252062096,
      "step": 30825
    },
    {
      "epoch": 3.270316146827923,
      "grad_norm": 0.547273968875358,
      "learning_rate": 4.1422119523725685e-05,
      "loss": 1.6483,
      "num_input_tokens_seen": 24252848896,
      "step": 30826
    },
    {
      "epoch": 3.2704222363674944,
      "grad_norm": 0.4215963346035687,
      "learning_rate": 4.142159551716462e-05,
      "loss": 1.4118,
      "num_input_tokens_seen": 24253635696,
      "step": 30827
    },
    {
      "epoch": 3.2705283259070654,
      "grad_norm": 0.5255074480506141,
      "learning_rate": 4.1421071497913434e-05,
      "loss": 1.4225,
      "num_input_tokens_seen": 24254422480,
      "step": 30828
    },
    {
      "epoch": 3.270634415446637,
      "grad_norm": 0.47957448627546295,
      "learning_rate": 4.1420547465972526e-05,
      "loss": 1.3888,
      "num_input_tokens_seen": 24255209200,
      "step": 30829
    },
    {
      "epoch": 3.2707405049862084,
      "grad_norm": 0.4145491295509612,
      "learning_rate": 4.14200234213423e-05,
      "loss": 1.4553,
      "num_input_tokens_seen": 24255995920,
      "step": 30830
    },
    {
      "epoch": 3.27084659452578,
      "grad_norm": 0.558842249939994,
      "learning_rate": 4.141949936402316e-05,
      "loss": 1.4824,
      "num_input_tokens_seen": 24256782640,
      "step": 30831
    },
    {
      "epoch": 3.2709526840653513,
      "grad_norm": 0.4578327321104682,
      "learning_rate": 4.141897529401551e-05,
      "loss": 1.4808,
      "num_input_tokens_seen": 24257569504,
      "step": 30832
    },
    {
      "epoch": 3.2710587736049224,
      "grad_norm": 0.4215814976742726,
      "learning_rate": 4.141845121131976e-05,
      "loss": 1.4334,
      "num_input_tokens_seen": 24258356288,
      "step": 30833
    },
    {
      "epoch": 3.271164863144494,
      "grad_norm": 0.4085738988647543,
      "learning_rate": 4.1417927115936316e-05,
      "loss": 1.4486,
      "num_input_tokens_seen": 24259143136,
      "step": 30834
    },
    {
      "epoch": 3.2712709526840653,
      "grad_norm": 0.4659095113026318,
      "learning_rate": 4.141740300786557e-05,
      "loss": 1.4982,
      "num_input_tokens_seen": 24259929920,
      "step": 30835
    },
    {
      "epoch": 3.271377042223637,
      "grad_norm": 0.5038624439050612,
      "learning_rate": 4.1416878887107946e-05,
      "loss": 1.5317,
      "num_input_tokens_seen": 24260716688,
      "step": 30836
    },
    {
      "epoch": 3.2714831317632083,
      "grad_norm": 0.47769620086014786,
      "learning_rate": 4.141635475366384e-05,
      "loss": 1.5086,
      "num_input_tokens_seen": 24261503488,
      "step": 30837
    },
    {
      "epoch": 3.2715892213027797,
      "grad_norm": 0.4457332622184608,
      "learning_rate": 4.1415830607533656e-05,
      "loss": 1.3901,
      "num_input_tokens_seen": 24262290288,
      "step": 30838
    },
    {
      "epoch": 3.2716953108423508,
      "grad_norm": 0.4101626770816144,
      "learning_rate": 4.14153064487178e-05,
      "loss": 1.4331,
      "num_input_tokens_seen": 24263077040,
      "step": 30839
    },
    {
      "epoch": 3.2718014003819222,
      "grad_norm": 0.4487826572591147,
      "learning_rate": 4.141478227721667e-05,
      "loss": 1.4648,
      "num_input_tokens_seen": 24263863808,
      "step": 30840
    },
    {
      "epoch": 3.2719074899214937,
      "grad_norm": 0.45483892849912355,
      "learning_rate": 4.1414258093030685e-05,
      "loss": 1.5189,
      "num_input_tokens_seen": 24264650560,
      "step": 30841
    },
    {
      "epoch": 3.272013579461065,
      "grad_norm": 0.4483161536801665,
      "learning_rate": 4.141373389616024e-05,
      "loss": 1.4348,
      "num_input_tokens_seen": 24265437248,
      "step": 30842
    },
    {
      "epoch": 3.2721196690006367,
      "grad_norm": 0.4626050118151276,
      "learning_rate": 4.141320968660575e-05,
      "loss": 1.4026,
      "num_input_tokens_seen": 24266223952,
      "step": 30843
    },
    {
      "epoch": 3.272225758540208,
      "grad_norm": 0.4237845103141816,
      "learning_rate": 4.14126854643676e-05,
      "loss": 1.577,
      "num_input_tokens_seen": 24267010720,
      "step": 30844
    },
    {
      "epoch": 3.272331848079779,
      "grad_norm": 0.4435622743374141,
      "learning_rate": 4.141216122944621e-05,
      "loss": 1.4403,
      "num_input_tokens_seen": 24267797360,
      "step": 30845
    },
    {
      "epoch": 3.2724379376193506,
      "grad_norm": 0.4900785512740139,
      "learning_rate": 4.1411636981841995e-05,
      "loss": 1.4478,
      "num_input_tokens_seen": 24268584064,
      "step": 30846
    },
    {
      "epoch": 3.272544027158922,
      "grad_norm": 0.47182546860906877,
      "learning_rate": 4.141111272155534e-05,
      "loss": 1.5517,
      "num_input_tokens_seen": 24269370816,
      "step": 30847
    },
    {
      "epoch": 3.2726501166984936,
      "grad_norm": 0.5138790864480923,
      "learning_rate": 4.1410588448586663e-05,
      "loss": 1.6089,
      "num_input_tokens_seen": 24270157584,
      "step": 30848
    },
    {
      "epoch": 3.272756206238065,
      "grad_norm": 0.42838611876304494,
      "learning_rate": 4.1410064162936355e-05,
      "loss": 1.3912,
      "num_input_tokens_seen": 24270944352,
      "step": 30849
    },
    {
      "epoch": 3.272862295777636,
      "grad_norm": 0.42036249688112143,
      "learning_rate": 4.1409539864604846e-05,
      "loss": 1.4242,
      "num_input_tokens_seen": 24271731136,
      "step": 30850
    },
    {
      "epoch": 3.2729683853172076,
      "grad_norm": 0.43175723818935235,
      "learning_rate": 4.1409015553592515e-05,
      "loss": 1.4868,
      "num_input_tokens_seen": 24272517920,
      "step": 30851
    },
    {
      "epoch": 3.273074474856779,
      "grad_norm": 0.41538441815027943,
      "learning_rate": 4.140849122989978e-05,
      "loss": 1.4027,
      "num_input_tokens_seen": 24273304656,
      "step": 30852
    },
    {
      "epoch": 3.2731805643963505,
      "grad_norm": 0.452420355923106,
      "learning_rate": 4.140796689352705e-05,
      "loss": 1.4345,
      "num_input_tokens_seen": 24274091392,
      "step": 30853
    },
    {
      "epoch": 3.273286653935922,
      "grad_norm": 0.40676197049503326,
      "learning_rate": 4.140744254447472e-05,
      "loss": 1.4254,
      "num_input_tokens_seen": 24274878224,
      "step": 30854
    },
    {
      "epoch": 3.2733927434754935,
      "grad_norm": 0.49704965103513915,
      "learning_rate": 4.14069181827432e-05,
      "loss": 1.5508,
      "num_input_tokens_seen": 24275665040,
      "step": 30855
    },
    {
      "epoch": 3.273498833015065,
      "grad_norm": 0.41151993765206635,
      "learning_rate": 4.140639380833289e-05,
      "loss": 1.4413,
      "num_input_tokens_seen": 24276451760,
      "step": 30856
    },
    {
      "epoch": 3.273604922554636,
      "grad_norm": 0.551018402997036,
      "learning_rate": 4.140586942124421e-05,
      "loss": 1.4726,
      "num_input_tokens_seen": 24277238496,
      "step": 30857
    },
    {
      "epoch": 3.2737110120942075,
      "grad_norm": 0.4302834025133528,
      "learning_rate": 4.140534502147755e-05,
      "loss": 1.4633,
      "num_input_tokens_seen": 24278025248,
      "step": 30858
    },
    {
      "epoch": 3.273817101633779,
      "grad_norm": 0.5385388434268209,
      "learning_rate": 4.1404820609033327e-05,
      "loss": 1.4369,
      "num_input_tokens_seen": 24278812048,
      "step": 30859
    },
    {
      "epoch": 3.2739231911733504,
      "grad_norm": 0.3987971728421496,
      "learning_rate": 4.140429618391193e-05,
      "loss": 1.3756,
      "num_input_tokens_seen": 24279598832,
      "step": 30860
    },
    {
      "epoch": 3.274029280712922,
      "grad_norm": 0.5186759690297731,
      "learning_rate": 4.140377174611378e-05,
      "loss": 1.472,
      "num_input_tokens_seen": 24280385584,
      "step": 30861
    },
    {
      "epoch": 3.274135370252493,
      "grad_norm": 0.5105999862350616,
      "learning_rate": 4.140324729563927e-05,
      "loss": 1.4855,
      "num_input_tokens_seen": 24281172320,
      "step": 30862
    },
    {
      "epoch": 3.2742414597920644,
      "grad_norm": 0.524657592088171,
      "learning_rate": 4.140272283248882e-05,
      "loss": 1.4875,
      "num_input_tokens_seen": 24281959024,
      "step": 30863
    },
    {
      "epoch": 3.274347549331636,
      "grad_norm": 0.4458632417988174,
      "learning_rate": 4.140219835666282e-05,
      "loss": 1.5627,
      "num_input_tokens_seen": 24282745760,
      "step": 30864
    },
    {
      "epoch": 3.2744536388712073,
      "grad_norm": 0.41273378683657985,
      "learning_rate": 4.1401673868161696e-05,
      "loss": 1.3977,
      "num_input_tokens_seen": 24283532528,
      "step": 30865
    },
    {
      "epoch": 3.274559728410779,
      "grad_norm": 0.4737610467350804,
      "learning_rate": 4.1401149366985827e-05,
      "loss": 1.4563,
      "num_input_tokens_seen": 24284319248,
      "step": 30866
    },
    {
      "epoch": 3.2746658179503503,
      "grad_norm": 0.4574227961703205,
      "learning_rate": 4.140062485313564e-05,
      "loss": 1.3848,
      "num_input_tokens_seen": 24285105952,
      "step": 30867
    },
    {
      "epoch": 3.2747719074899213,
      "grad_norm": 0.41004247695480556,
      "learning_rate": 4.1400100326611524e-05,
      "loss": 1.4119,
      "num_input_tokens_seen": 24285892720,
      "step": 30868
    },
    {
      "epoch": 3.274877997029493,
      "grad_norm": 0.47728584027747406,
      "learning_rate": 4.139957578741389e-05,
      "loss": 1.3878,
      "num_input_tokens_seen": 24286679472,
      "step": 30869
    },
    {
      "epoch": 3.2749840865690643,
      "grad_norm": 0.4003977492850248,
      "learning_rate": 4.139905123554315e-05,
      "loss": 1.5334,
      "num_input_tokens_seen": 24287466192,
      "step": 30870
    },
    {
      "epoch": 3.2750901761086357,
      "grad_norm": 0.42929646347518463,
      "learning_rate": 4.1398526670999705e-05,
      "loss": 1.3832,
      "num_input_tokens_seen": 24288253024,
      "step": 30871
    },
    {
      "epoch": 3.275196265648207,
      "grad_norm": 0.3955647067640097,
      "learning_rate": 4.139800209378396e-05,
      "loss": 1.4834,
      "num_input_tokens_seen": 24289039808,
      "step": 30872
    },
    {
      "epoch": 3.2753023551877787,
      "grad_norm": 0.4672745411703687,
      "learning_rate": 4.139747750389632e-05,
      "loss": 1.4699,
      "num_input_tokens_seen": 24289826592,
      "step": 30873
    },
    {
      "epoch": 3.2754084447273497,
      "grad_norm": 0.4233198730979696,
      "learning_rate": 4.1396952901337184e-05,
      "loss": 1.4193,
      "num_input_tokens_seen": 24290613376,
      "step": 30874
    },
    {
      "epoch": 3.275514534266921,
      "grad_norm": 0.45121969391311517,
      "learning_rate": 4.139642828610697e-05,
      "loss": 1.4695,
      "num_input_tokens_seen": 24291400192,
      "step": 30875
    },
    {
      "epoch": 3.2756206238064927,
      "grad_norm": 0.45119853493853773,
      "learning_rate": 4.139590365820607e-05,
      "loss": 1.5188,
      "num_input_tokens_seen": 24292186944,
      "step": 30876
    },
    {
      "epoch": 3.275726713346064,
      "grad_norm": 0.41824348546105555,
      "learning_rate": 4.1395379017634903e-05,
      "loss": 1.4647,
      "num_input_tokens_seen": 24292973664,
      "step": 30877
    },
    {
      "epoch": 3.2758328028856356,
      "grad_norm": 0.5757115890307429,
      "learning_rate": 4.139485436439387e-05,
      "loss": 1.468,
      "num_input_tokens_seen": 24293760496,
      "step": 30878
    },
    {
      "epoch": 3.2759388924252066,
      "grad_norm": 0.5768739467850513,
      "learning_rate": 4.139432969848337e-05,
      "loss": 1.5313,
      "num_input_tokens_seen": 24294547280,
      "step": 30879
    },
    {
      "epoch": 3.276044981964778,
      "grad_norm": 0.5024773903262927,
      "learning_rate": 4.139380501990382e-05,
      "loss": 1.4597,
      "num_input_tokens_seen": 24295334064,
      "step": 30880
    },
    {
      "epoch": 3.2761510715043496,
      "grad_norm": 0.5653708946072705,
      "learning_rate": 4.1393280328655615e-05,
      "loss": 1.5482,
      "num_input_tokens_seen": 24296120816,
      "step": 30881
    },
    {
      "epoch": 3.276257161043921,
      "grad_norm": 0.40627037339194794,
      "learning_rate": 4.139275562473916e-05,
      "loss": 1.4361,
      "num_input_tokens_seen": 24296907568,
      "step": 30882
    },
    {
      "epoch": 3.2763632505834925,
      "grad_norm": 0.39325238285473235,
      "learning_rate": 4.139223090815487e-05,
      "loss": 1.5435,
      "num_input_tokens_seen": 24297694272,
      "step": 30883
    },
    {
      "epoch": 3.276469340123064,
      "grad_norm": 0.5345405603941901,
      "learning_rate": 4.139170617890314e-05,
      "loss": 1.4081,
      "num_input_tokens_seen": 24298481088,
      "step": 30884
    },
    {
      "epoch": 3.2765754296626355,
      "grad_norm": 0.3984191048704333,
      "learning_rate": 4.1391181436984385e-05,
      "loss": 1.3419,
      "num_input_tokens_seen": 24299267904,
      "step": 30885
    },
    {
      "epoch": 3.2766815192022065,
      "grad_norm": 0.39464913824982134,
      "learning_rate": 4.1390656682399e-05,
      "loss": 1.4131,
      "num_input_tokens_seen": 24300054688,
      "step": 30886
    },
    {
      "epoch": 3.276787608741778,
      "grad_norm": 0.4297515729802853,
      "learning_rate": 4.13901319151474e-05,
      "loss": 1.4488,
      "num_input_tokens_seen": 24300841488,
      "step": 30887
    },
    {
      "epoch": 3.2768936982813495,
      "grad_norm": 0.4687040399026353,
      "learning_rate": 4.138960713522998e-05,
      "loss": 1.3698,
      "num_input_tokens_seen": 24301628224,
      "step": 30888
    },
    {
      "epoch": 3.276999787820921,
      "grad_norm": 0.4112812297073972,
      "learning_rate": 4.1389082342647166e-05,
      "loss": 1.3974,
      "num_input_tokens_seen": 24302415168,
      "step": 30889
    },
    {
      "epoch": 3.2771058773604924,
      "grad_norm": 0.4536011266337296,
      "learning_rate": 4.138855753739934e-05,
      "loss": 1.4144,
      "num_input_tokens_seen": 24303201936,
      "step": 30890
    },
    {
      "epoch": 3.2772119669000634,
      "grad_norm": 0.46000113098722917,
      "learning_rate": 4.138803271948693e-05,
      "loss": 1.4754,
      "num_input_tokens_seen": 24303988800,
      "step": 30891
    },
    {
      "epoch": 3.277318056439635,
      "grad_norm": 0.46054595929156755,
      "learning_rate": 4.138750788891031e-05,
      "loss": 1.4985,
      "num_input_tokens_seen": 24304775616,
      "step": 30892
    },
    {
      "epoch": 3.2774241459792064,
      "grad_norm": 0.4190133107213398,
      "learning_rate": 4.138698304566992e-05,
      "loss": 1.489,
      "num_input_tokens_seen": 24305562336,
      "step": 30893
    },
    {
      "epoch": 3.277530235518778,
      "grad_norm": 0.4783138344366014,
      "learning_rate": 4.1386458189766144e-05,
      "loss": 1.4051,
      "num_input_tokens_seen": 24306349040,
      "step": 30894
    },
    {
      "epoch": 3.2776363250583493,
      "grad_norm": 0.47463486053727366,
      "learning_rate": 4.1385933321199396e-05,
      "loss": 1.4594,
      "num_input_tokens_seen": 24307135840,
      "step": 30895
    },
    {
      "epoch": 3.277742414597921,
      "grad_norm": 0.4114826333874462,
      "learning_rate": 4.138540843997008e-05,
      "loss": 1.4674,
      "num_input_tokens_seen": 24307922592,
      "step": 30896
    },
    {
      "epoch": 3.2778485041374923,
      "grad_norm": 0.4350583954875377,
      "learning_rate": 4.13848835460786e-05,
      "loss": 1.4227,
      "num_input_tokens_seen": 24308709360,
      "step": 30897
    },
    {
      "epoch": 3.2779545936770633,
      "grad_norm": 0.49983055744549537,
      "learning_rate": 4.138435863952536e-05,
      "loss": 1.5472,
      "num_input_tokens_seen": 24309496144,
      "step": 30898
    },
    {
      "epoch": 3.278060683216635,
      "grad_norm": 0.4348461146601403,
      "learning_rate": 4.138383372031077e-05,
      "loss": 1.4987,
      "num_input_tokens_seen": 24310282848,
      "step": 30899
    },
    {
      "epoch": 3.2781667727562063,
      "grad_norm": 0.5874856163110833,
      "learning_rate": 4.138330878843523e-05,
      "loss": 1.5914,
      "num_input_tokens_seen": 24311069632,
      "step": 30900
    },
    {
      "epoch": 3.2782728622957777,
      "grad_norm": 0.5272131058014176,
      "learning_rate": 4.1382783843899155e-05,
      "loss": 1.3615,
      "num_input_tokens_seen": 24311856416,
      "step": 30901
    },
    {
      "epoch": 3.278378951835349,
      "grad_norm": 0.5347628143028369,
      "learning_rate": 4.138225888670295e-05,
      "loss": 1.5098,
      "num_input_tokens_seen": 24312643152,
      "step": 30902
    },
    {
      "epoch": 3.2784850413749203,
      "grad_norm": 0.6566246432577432,
      "learning_rate": 4.138173391684701e-05,
      "loss": 1.4042,
      "num_input_tokens_seen": 24313429872,
      "step": 30903
    },
    {
      "epoch": 3.2785911309144917,
      "grad_norm": 0.46490734428881036,
      "learning_rate": 4.138120893433175e-05,
      "loss": 1.4333,
      "num_input_tokens_seen": 24314216608,
      "step": 30904
    },
    {
      "epoch": 3.278697220454063,
      "grad_norm": 0.5505360008979604,
      "learning_rate": 4.1380683939157574e-05,
      "loss": 1.5881,
      "num_input_tokens_seen": 24315003504,
      "step": 30905
    },
    {
      "epoch": 3.2788033099936347,
      "grad_norm": 0.5275956902083443,
      "learning_rate": 4.1380158931324874e-05,
      "loss": 1.5365,
      "num_input_tokens_seen": 24315790192,
      "step": 30906
    },
    {
      "epoch": 3.278909399533206,
      "grad_norm": 0.49204086322052537,
      "learning_rate": 4.1379633910834074e-05,
      "loss": 1.3927,
      "num_input_tokens_seen": 24316576944,
      "step": 30907
    },
    {
      "epoch": 3.279015489072777,
      "grad_norm": 0.5512296106124029,
      "learning_rate": 4.137910887768558e-05,
      "loss": 1.4076,
      "num_input_tokens_seen": 24317363664,
      "step": 30908
    },
    {
      "epoch": 3.2791215786123487,
      "grad_norm": 0.4150086248148924,
      "learning_rate": 4.137858383187978e-05,
      "loss": 1.4317,
      "num_input_tokens_seen": 24318150448,
      "step": 30909
    },
    {
      "epoch": 3.27922766815192,
      "grad_norm": 0.5288469901380664,
      "learning_rate": 4.1378058773417105e-05,
      "loss": 1.4672,
      "num_input_tokens_seen": 24318937264,
      "step": 30910
    },
    {
      "epoch": 3.2793337576914916,
      "grad_norm": 0.5125420735554294,
      "learning_rate": 4.137753370229794e-05,
      "loss": 1.5207,
      "num_input_tokens_seen": 24319724112,
      "step": 30911
    },
    {
      "epoch": 3.279439847231063,
      "grad_norm": 0.4207825704407766,
      "learning_rate": 4.137700861852269e-05,
      "loss": 1.4973,
      "num_input_tokens_seen": 24320510832,
      "step": 30912
    },
    {
      "epoch": 3.2795459367706346,
      "grad_norm": 0.7754751901507311,
      "learning_rate": 4.137648352209178e-05,
      "loss": 1.4651,
      "num_input_tokens_seen": 24321297632,
      "step": 30913
    },
    {
      "epoch": 3.279652026310206,
      "grad_norm": 0.4942594425152882,
      "learning_rate": 4.13759584130056e-05,
      "loss": 1.5563,
      "num_input_tokens_seen": 24322084384,
      "step": 30914
    },
    {
      "epoch": 3.279758115849777,
      "grad_norm": 0.8503565942335461,
      "learning_rate": 4.137543329126456e-05,
      "loss": 1.4015,
      "num_input_tokens_seen": 24322871136,
      "step": 30915
    },
    {
      "epoch": 3.2798642053893485,
      "grad_norm": 0.48761767886539276,
      "learning_rate": 4.137490815686906e-05,
      "loss": 1.4104,
      "num_input_tokens_seen": 24323657760,
      "step": 30916
    },
    {
      "epoch": 3.27997029492892,
      "grad_norm": 0.6180663628216242,
      "learning_rate": 4.137438300981952e-05,
      "loss": 1.4524,
      "num_input_tokens_seen": 24324444560,
      "step": 30917
    },
    {
      "epoch": 3.2800763844684915,
      "grad_norm": 0.48719091777843776,
      "learning_rate": 4.137385785011634e-05,
      "loss": 1.4104,
      "num_input_tokens_seen": 24325231312,
      "step": 30918
    },
    {
      "epoch": 3.280182474008063,
      "grad_norm": 0.44392737188593445,
      "learning_rate": 4.137333267775991e-05,
      "loss": 1.5296,
      "num_input_tokens_seen": 24326018032,
      "step": 30919
    },
    {
      "epoch": 3.280288563547634,
      "grad_norm": 0.5427567361736705,
      "learning_rate": 4.1372807492750653e-05,
      "loss": 1.5867,
      "num_input_tokens_seen": 24326804688,
      "step": 30920
    },
    {
      "epoch": 3.2803946530872055,
      "grad_norm": 0.49960838550820724,
      "learning_rate": 4.137228229508897e-05,
      "loss": 1.4434,
      "num_input_tokens_seen": 24327591440,
      "step": 30921
    },
    {
      "epoch": 3.280500742626777,
      "grad_norm": 0.4022940701962975,
      "learning_rate": 4.137175708477528e-05,
      "loss": 1.3579,
      "num_input_tokens_seen": 24328378176,
      "step": 30922
    },
    {
      "epoch": 3.2806068321663484,
      "grad_norm": 0.41265047987996273,
      "learning_rate": 4.1371231861809965e-05,
      "loss": 1.4522,
      "num_input_tokens_seen": 24329164832,
      "step": 30923
    },
    {
      "epoch": 3.28071292170592,
      "grad_norm": 0.4606275711145232,
      "learning_rate": 4.137070662619344e-05,
      "loss": 1.5287,
      "num_input_tokens_seen": 24329951552,
      "step": 30924
    },
    {
      "epoch": 3.2808190112454914,
      "grad_norm": 0.43081344927461857,
      "learning_rate": 4.137018137792612e-05,
      "loss": 1.4918,
      "num_input_tokens_seen": 24330738256,
      "step": 30925
    },
    {
      "epoch": 3.280925100785063,
      "grad_norm": 0.42949367755263557,
      "learning_rate": 4.1369656117008404e-05,
      "loss": 1.552,
      "num_input_tokens_seen": 24331524992,
      "step": 30926
    },
    {
      "epoch": 3.281031190324634,
      "grad_norm": 0.4592733419550478,
      "learning_rate": 4.136913084344069e-05,
      "loss": 1.4707,
      "num_input_tokens_seen": 24332311744,
      "step": 30927
    },
    {
      "epoch": 3.2811372798642053,
      "grad_norm": 0.49483703559138237,
      "learning_rate": 4.1368605557223405e-05,
      "loss": 1.3693,
      "num_input_tokens_seen": 24333098512,
      "step": 30928
    },
    {
      "epoch": 3.281243369403777,
      "grad_norm": 0.5165401098643373,
      "learning_rate": 4.1368080258356934e-05,
      "loss": 1.4823,
      "num_input_tokens_seen": 24333885216,
      "step": 30929
    },
    {
      "epoch": 3.2813494589433483,
      "grad_norm": 0.37933987693184423,
      "learning_rate": 4.136755494684169e-05,
      "loss": 1.4173,
      "num_input_tokens_seen": 24334671952,
      "step": 30930
    },
    {
      "epoch": 3.2814555484829198,
      "grad_norm": 0.4106256937564464,
      "learning_rate": 4.136702962267809e-05,
      "loss": 1.4306,
      "num_input_tokens_seen": 24335458800,
      "step": 30931
    },
    {
      "epoch": 3.281561638022491,
      "grad_norm": 0.4557379210813925,
      "learning_rate": 4.136650428586652e-05,
      "loss": 1.507,
      "num_input_tokens_seen": 24336245600,
      "step": 30932
    },
    {
      "epoch": 3.2816677275620623,
      "grad_norm": 0.4595312943017308,
      "learning_rate": 4.1365978936407395e-05,
      "loss": 1.4874,
      "num_input_tokens_seen": 24337032416,
      "step": 30933
    },
    {
      "epoch": 3.2817738171016337,
      "grad_norm": 0.49516571675177373,
      "learning_rate": 4.1365453574301125e-05,
      "loss": 1.5486,
      "num_input_tokens_seen": 24337819168,
      "step": 30934
    },
    {
      "epoch": 3.281879906641205,
      "grad_norm": 0.41440831075557627,
      "learning_rate": 4.1364928199548105e-05,
      "loss": 1.4455,
      "num_input_tokens_seen": 24338605920,
      "step": 30935
    },
    {
      "epoch": 3.2819859961807767,
      "grad_norm": 0.49535574470727467,
      "learning_rate": 4.136440281214876e-05,
      "loss": 1.5582,
      "num_input_tokens_seen": 24339392736,
      "step": 30936
    },
    {
      "epoch": 3.282092085720348,
      "grad_norm": 0.4741551098689151,
      "learning_rate": 4.136387741210348e-05,
      "loss": 1.4843,
      "num_input_tokens_seen": 24340179536,
      "step": 30937
    },
    {
      "epoch": 3.282198175259919,
      "grad_norm": 0.5002359130362517,
      "learning_rate": 4.1363351999412674e-05,
      "loss": 1.4929,
      "num_input_tokens_seen": 24340966304,
      "step": 30938
    },
    {
      "epoch": 3.2823042647994907,
      "grad_norm": 0.43908341570447657,
      "learning_rate": 4.136282657407675e-05,
      "loss": 1.4822,
      "num_input_tokens_seen": 24341752992,
      "step": 30939
    },
    {
      "epoch": 3.282410354339062,
      "grad_norm": 0.48218061087550673,
      "learning_rate": 4.1362301136096116e-05,
      "loss": 1.3989,
      "num_input_tokens_seen": 24342539728,
      "step": 30940
    },
    {
      "epoch": 3.2825164438786336,
      "grad_norm": 0.3854646941053862,
      "learning_rate": 4.1361775685471176e-05,
      "loss": 1.4864,
      "num_input_tokens_seen": 24343326512,
      "step": 30941
    },
    {
      "epoch": 3.282622533418205,
      "grad_norm": 0.41082163019959606,
      "learning_rate": 4.136125022220234e-05,
      "loss": 1.4685,
      "num_input_tokens_seen": 24344113200,
      "step": 30942
    },
    {
      "epoch": 3.2827286229577766,
      "grad_norm": 0.4321586162864439,
      "learning_rate": 4.1360724746290004e-05,
      "loss": 1.545,
      "num_input_tokens_seen": 24344899872,
      "step": 30943
    },
    {
      "epoch": 3.2828347124973476,
      "grad_norm": 0.4123351816483588,
      "learning_rate": 4.136019925773458e-05,
      "loss": 1.5143,
      "num_input_tokens_seen": 24345686624,
      "step": 30944
    },
    {
      "epoch": 3.282940802036919,
      "grad_norm": 0.3699574829333565,
      "learning_rate": 4.135967375653647e-05,
      "loss": 1.3911,
      "num_input_tokens_seen": 24346473424,
      "step": 30945
    },
    {
      "epoch": 3.2830468915764905,
      "grad_norm": 0.46668145960771423,
      "learning_rate": 4.135914824269609e-05,
      "loss": 1.4803,
      "num_input_tokens_seen": 24347260208,
      "step": 30946
    },
    {
      "epoch": 3.283152981116062,
      "grad_norm": 0.4463288640722789,
      "learning_rate": 4.135862271621383e-05,
      "loss": 1.4926,
      "num_input_tokens_seen": 24348047008,
      "step": 30947
    },
    {
      "epoch": 3.2832590706556335,
      "grad_norm": 0.4227299524521846,
      "learning_rate": 4.1358097177090125e-05,
      "loss": 1.4362,
      "num_input_tokens_seen": 24348833696,
      "step": 30948
    },
    {
      "epoch": 3.2833651601952045,
      "grad_norm": 0.43392782163708843,
      "learning_rate": 4.135757162532535e-05,
      "loss": 1.4738,
      "num_input_tokens_seen": 24349620528,
      "step": 30949
    },
    {
      "epoch": 3.283471249734776,
      "grad_norm": 0.4008458022408748,
      "learning_rate": 4.135704606091993e-05,
      "loss": 1.343,
      "num_input_tokens_seen": 24350407296,
      "step": 30950
    },
    {
      "epoch": 3.2835773392743475,
      "grad_norm": 0.3981347665056197,
      "learning_rate": 4.1356520483874264e-05,
      "loss": 1.5374,
      "num_input_tokens_seen": 24351194112,
      "step": 30951
    },
    {
      "epoch": 3.283683428813919,
      "grad_norm": 0.4935122467015361,
      "learning_rate": 4.1355994894188754e-05,
      "loss": 1.4154,
      "num_input_tokens_seen": 24351980864,
      "step": 30952
    },
    {
      "epoch": 3.2837895183534904,
      "grad_norm": 0.43999104564383096,
      "learning_rate": 4.135546929186381e-05,
      "loss": 1.4824,
      "num_input_tokens_seen": 24352767680,
      "step": 30953
    },
    {
      "epoch": 3.283895607893062,
      "grad_norm": 0.39728278745087076,
      "learning_rate": 4.135494367689984e-05,
      "loss": 1.4537,
      "num_input_tokens_seen": 24353554416,
      "step": 30954
    },
    {
      "epoch": 3.2840016974326334,
      "grad_norm": 0.5028938901756989,
      "learning_rate": 4.135441804929726e-05,
      "loss": 1.4389,
      "num_input_tokens_seen": 24354341136,
      "step": 30955
    },
    {
      "epoch": 3.2841077869722044,
      "grad_norm": 0.5196295639280994,
      "learning_rate": 4.135389240905645e-05,
      "loss": 1.5436,
      "num_input_tokens_seen": 24355127696,
      "step": 30956
    },
    {
      "epoch": 3.284213876511776,
      "grad_norm": 0.49371973426277643,
      "learning_rate": 4.135336675617784e-05,
      "loss": 1.4953,
      "num_input_tokens_seen": 24355914384,
      "step": 30957
    },
    {
      "epoch": 3.2843199660513474,
      "grad_norm": 0.4889646831897899,
      "learning_rate": 4.135284109066183e-05,
      "loss": 1.3739,
      "num_input_tokens_seen": 24356701104,
      "step": 30958
    },
    {
      "epoch": 3.284426055590919,
      "grad_norm": 0.4301322827245585,
      "learning_rate": 4.135231541250882e-05,
      "loss": 1.4044,
      "num_input_tokens_seen": 24357487888,
      "step": 30959
    },
    {
      "epoch": 3.2845321451304903,
      "grad_norm": 0.4389273914521629,
      "learning_rate": 4.135178972171922e-05,
      "loss": 1.4921,
      "num_input_tokens_seen": 24358274608,
      "step": 30960
    },
    {
      "epoch": 3.2846382346700613,
      "grad_norm": 0.4150111568264955,
      "learning_rate": 4.1351264018293445e-05,
      "loss": 1.5859,
      "num_input_tokens_seen": 24359061376,
      "step": 30961
    },
    {
      "epoch": 3.284744324209633,
      "grad_norm": 0.4052128857739548,
      "learning_rate": 4.135073830223189e-05,
      "loss": 1.4844,
      "num_input_tokens_seen": 24359848176,
      "step": 30962
    },
    {
      "epoch": 3.2848504137492043,
      "grad_norm": 0.4254771761961701,
      "learning_rate": 4.1350212573534955e-05,
      "loss": 1.4331,
      "num_input_tokens_seen": 24360635040,
      "step": 30963
    },
    {
      "epoch": 3.2849565032887758,
      "grad_norm": 0.42731764507986436,
      "learning_rate": 4.1349686832203064e-05,
      "loss": 1.4269,
      "num_input_tokens_seen": 24361421840,
      "step": 30964
    },
    {
      "epoch": 3.2850625928283472,
      "grad_norm": 0.3566800506182542,
      "learning_rate": 4.134916107823661e-05,
      "loss": 1.4678,
      "num_input_tokens_seen": 24362208640,
      "step": 30965
    },
    {
      "epoch": 3.2851686823679187,
      "grad_norm": 0.50995802792061,
      "learning_rate": 4.1348635311636e-05,
      "loss": 1.6306,
      "num_input_tokens_seen": 24362995392,
      "step": 30966
    },
    {
      "epoch": 3.2852747719074897,
      "grad_norm": 0.44046046031475117,
      "learning_rate": 4.1348109532401654e-05,
      "loss": 1.5008,
      "num_input_tokens_seen": 24363782064,
      "step": 30967
    },
    {
      "epoch": 3.285380861447061,
      "grad_norm": 0.42750255318335795,
      "learning_rate": 4.134758374053397e-05,
      "loss": 1.4056,
      "num_input_tokens_seen": 24364568752,
      "step": 30968
    },
    {
      "epoch": 3.2854869509866327,
      "grad_norm": 0.4211989989682366,
      "learning_rate": 4.134705793603334e-05,
      "loss": 1.4942,
      "num_input_tokens_seen": 24365355488,
      "step": 30969
    },
    {
      "epoch": 3.285593040526204,
      "grad_norm": 0.4177236589850871,
      "learning_rate": 4.134653211890019e-05,
      "loss": 1.487,
      "num_input_tokens_seen": 24366142192,
      "step": 30970
    },
    {
      "epoch": 3.2856991300657756,
      "grad_norm": 0.4841975806314344,
      "learning_rate": 4.134600628913492e-05,
      "loss": 1.376,
      "num_input_tokens_seen": 24366928960,
      "step": 30971
    },
    {
      "epoch": 3.285805219605347,
      "grad_norm": 0.4785668179347058,
      "learning_rate": 4.134548044673794e-05,
      "loss": 1.5498,
      "num_input_tokens_seen": 24367715808,
      "step": 30972
    },
    {
      "epoch": 3.285911309144918,
      "grad_norm": 0.4456049419658097,
      "learning_rate": 4.134495459170965e-05,
      "loss": 1.4675,
      "num_input_tokens_seen": 24368502560,
      "step": 30973
    },
    {
      "epoch": 3.2860173986844896,
      "grad_norm": 0.4856306881460132,
      "learning_rate": 4.134442872405045e-05,
      "loss": 1.566,
      "num_input_tokens_seen": 24369289328,
      "step": 30974
    },
    {
      "epoch": 3.286123488224061,
      "grad_norm": 0.5004360742389702,
      "learning_rate": 4.134390284376077e-05,
      "loss": 1.5163,
      "num_input_tokens_seen": 24370076096,
      "step": 30975
    },
    {
      "epoch": 3.2862295777636326,
      "grad_norm": 0.5587198384925817,
      "learning_rate": 4.1343376950841e-05,
      "loss": 1.5315,
      "num_input_tokens_seen": 24370862800,
      "step": 30976
    },
    {
      "epoch": 3.286335667303204,
      "grad_norm": 0.4442007291850424,
      "learning_rate": 4.1342851045291536e-05,
      "loss": 1.4864,
      "num_input_tokens_seen": 24371649584,
      "step": 30977
    },
    {
      "epoch": 3.286441756842775,
      "grad_norm": 0.5756189157558121,
      "learning_rate": 4.1342325127112805e-05,
      "loss": 1.4974,
      "num_input_tokens_seen": 24372436400,
      "step": 30978
    },
    {
      "epoch": 3.2865478463823465,
      "grad_norm": 0.47797399242092126,
      "learning_rate": 4.13417991963052e-05,
      "loss": 1.5558,
      "num_input_tokens_seen": 24373223200,
      "step": 30979
    },
    {
      "epoch": 3.286653935921918,
      "grad_norm": 0.4709450150304711,
      "learning_rate": 4.134127325286913e-05,
      "loss": 1.5318,
      "num_input_tokens_seen": 24374009952,
      "step": 30980
    },
    {
      "epoch": 3.2867600254614895,
      "grad_norm": 0.4405932283138398,
      "learning_rate": 4.134074729680501e-05,
      "loss": 1.3299,
      "num_input_tokens_seen": 24374796640,
      "step": 30981
    },
    {
      "epoch": 3.286866115001061,
      "grad_norm": 0.46932801191815837,
      "learning_rate": 4.134022132811324e-05,
      "loss": 1.5323,
      "num_input_tokens_seen": 24375583424,
      "step": 30982
    },
    {
      "epoch": 3.2869722045406324,
      "grad_norm": 0.46017739210650843,
      "learning_rate": 4.133969534679423e-05,
      "loss": 1.4293,
      "num_input_tokens_seen": 24376370288,
      "step": 30983
    },
    {
      "epoch": 3.287078294080204,
      "grad_norm": 0.5002833925410032,
      "learning_rate": 4.133916935284837e-05,
      "loss": 1.5088,
      "num_input_tokens_seen": 24377156976,
      "step": 30984
    },
    {
      "epoch": 3.287184383619775,
      "grad_norm": 0.40645424151547727,
      "learning_rate": 4.133864334627608e-05,
      "loss": 1.3534,
      "num_input_tokens_seen": 24377943760,
      "step": 30985
    },
    {
      "epoch": 3.2872904731593464,
      "grad_norm": 0.39248228768872323,
      "learning_rate": 4.133811732707778e-05,
      "loss": 1.4283,
      "num_input_tokens_seen": 24378730544,
      "step": 30986
    },
    {
      "epoch": 3.287396562698918,
      "grad_norm": 0.4009585348281312,
      "learning_rate": 4.133759129525385e-05,
      "loss": 1.4628,
      "num_input_tokens_seen": 24379517424,
      "step": 30987
    },
    {
      "epoch": 3.2875026522384894,
      "grad_norm": 0.47671272989666097,
      "learning_rate": 4.133706525080472e-05,
      "loss": 1.6283,
      "num_input_tokens_seen": 24380304160,
      "step": 30988
    },
    {
      "epoch": 3.287608741778061,
      "grad_norm": 0.6588500818223002,
      "learning_rate": 4.133653919373077e-05,
      "loss": 1.5497,
      "num_input_tokens_seen": 24381090880,
      "step": 30989
    },
    {
      "epoch": 3.287714831317632,
      "grad_norm": 0.3566858141416211,
      "learning_rate": 4.133601312403244e-05,
      "loss": 1.3695,
      "num_input_tokens_seen": 24381877728,
      "step": 30990
    },
    {
      "epoch": 3.2878209208572033,
      "grad_norm": 0.5088544115317508,
      "learning_rate": 4.13354870417101e-05,
      "loss": 1.5246,
      "num_input_tokens_seen": 24382664544,
      "step": 30991
    },
    {
      "epoch": 3.287927010396775,
      "grad_norm": 0.4193988960969345,
      "learning_rate": 4.133496094676419e-05,
      "loss": 1.4035,
      "num_input_tokens_seen": 24383451376,
      "step": 30992
    },
    {
      "epoch": 3.2880330999363463,
      "grad_norm": 0.44427174172060935,
      "learning_rate": 4.133443483919509e-05,
      "loss": 1.3246,
      "num_input_tokens_seen": 24384238128,
      "step": 30993
    },
    {
      "epoch": 3.2881391894759178,
      "grad_norm": 0.3962646966695725,
      "learning_rate": 4.133390871900322e-05,
      "loss": 1.4684,
      "num_input_tokens_seen": 24385024944,
      "step": 30994
    },
    {
      "epoch": 3.2882452790154892,
      "grad_norm": 0.4084991971562801,
      "learning_rate": 4.133338258618899e-05,
      "loss": 1.4439,
      "num_input_tokens_seen": 24385811760,
      "step": 30995
    },
    {
      "epoch": 3.2883513685550607,
      "grad_norm": 0.46150248134835686,
      "learning_rate": 4.13328564407528e-05,
      "loss": 1.4924,
      "num_input_tokens_seen": 24386598528,
      "step": 30996
    },
    {
      "epoch": 3.2884574580946317,
      "grad_norm": 0.4746286761203573,
      "learning_rate": 4.133233028269505e-05,
      "loss": 1.4242,
      "num_input_tokens_seen": 24387385328,
      "step": 30997
    },
    {
      "epoch": 3.288563547634203,
      "grad_norm": 0.5260092878446582,
      "learning_rate": 4.133180411201617e-05,
      "loss": 1.3622,
      "num_input_tokens_seen": 24388172080,
      "step": 30998
    },
    {
      "epoch": 3.2886696371737747,
      "grad_norm": 0.5272638068122109,
      "learning_rate": 4.133127792871654e-05,
      "loss": 1.5697,
      "num_input_tokens_seen": 24388958928,
      "step": 30999
    },
    {
      "epoch": 3.288775726713346,
      "grad_norm": 0.4971639133220992,
      "learning_rate": 4.133075173279658e-05,
      "loss": 1.5386,
      "num_input_tokens_seen": 24389745632,
      "step": 31000
    },
    {
      "epoch": 3.288775726713346,
      "eval_loss": 1.6251516342163086,
      "eval_runtime": 67.235,
      "eval_samples_per_second": 44.62,
      "eval_steps_per_second": 0.476,
      "num_input_tokens_seen": 24389745632,
      "step": 31000
    },
    {
      "epoch": 3.2888818162529176,
      "grad_norm": 0.46610069935777254,
      "learning_rate": 4.133022552425669e-05,
      "loss": 1.3117,
      "num_input_tokens_seen": 24390532480,
      "step": 31001
    },
    {
      "epoch": 3.2889879057924887,
      "grad_norm": 0.4468920121785009,
      "learning_rate": 4.1329699303097285e-05,
      "loss": 1.4517,
      "num_input_tokens_seen": 24391319184,
      "step": 31002
    },
    {
      "epoch": 3.28909399533206,
      "grad_norm": 0.43571682305753323,
      "learning_rate": 4.1329173069318774e-05,
      "loss": 1.5151,
      "num_input_tokens_seen": 24392105888,
      "step": 31003
    },
    {
      "epoch": 3.2892000848716316,
      "grad_norm": 0.5296087861521577,
      "learning_rate": 4.1328646822921546e-05,
      "loss": 1.4568,
      "num_input_tokens_seen": 24392892656,
      "step": 31004
    },
    {
      "epoch": 3.289306174411203,
      "grad_norm": 0.4574589435821561,
      "learning_rate": 4.132812056390603e-05,
      "loss": 1.4249,
      "num_input_tokens_seen": 24393679392,
      "step": 31005
    },
    {
      "epoch": 3.2894122639507746,
      "grad_norm": 0.6796139534329031,
      "learning_rate": 4.132759429227261e-05,
      "loss": 1.5105,
      "num_input_tokens_seen": 24394466192,
      "step": 31006
    },
    {
      "epoch": 3.2895183534903456,
      "grad_norm": 0.4918654368866589,
      "learning_rate": 4.1327068008021705e-05,
      "loss": 1.4501,
      "num_input_tokens_seen": 24395252976,
      "step": 31007
    },
    {
      "epoch": 3.289624443029917,
      "grad_norm": 0.5021411588277919,
      "learning_rate": 4.132654171115373e-05,
      "loss": 1.455,
      "num_input_tokens_seen": 24396039664,
      "step": 31008
    },
    {
      "epoch": 3.2897305325694886,
      "grad_norm": 0.46627410066060626,
      "learning_rate": 4.132601540166907e-05,
      "loss": 1.5133,
      "num_input_tokens_seen": 24396826448,
      "step": 31009
    },
    {
      "epoch": 3.28983662210906,
      "grad_norm": 0.5852725166432567,
      "learning_rate": 4.132548907956816e-05,
      "loss": 1.563,
      "num_input_tokens_seen": 24397613216,
      "step": 31010
    },
    {
      "epoch": 3.2899427116486315,
      "grad_norm": 0.5153759939974042,
      "learning_rate": 4.132496274485138e-05,
      "loss": 1.4418,
      "num_input_tokens_seen": 24398399952,
      "step": 31011
    },
    {
      "epoch": 3.290048801188203,
      "grad_norm": 0.6389640600381766,
      "learning_rate": 4.132443639751915e-05,
      "loss": 1.5198,
      "num_input_tokens_seen": 24399186656,
      "step": 31012
    },
    {
      "epoch": 3.2901548907277745,
      "grad_norm": 0.5146133227969791,
      "learning_rate": 4.132391003757188e-05,
      "loss": 1.5307,
      "num_input_tokens_seen": 24399973472,
      "step": 31013
    },
    {
      "epoch": 3.2902609802673455,
      "grad_norm": 0.5093789315773096,
      "learning_rate": 4.132338366500996e-05,
      "loss": 1.5047,
      "num_input_tokens_seen": 24400760304,
      "step": 31014
    },
    {
      "epoch": 3.290367069806917,
      "grad_norm": 0.48353568425908633,
      "learning_rate": 4.1322857279833813e-05,
      "loss": 1.4849,
      "num_input_tokens_seen": 24401547024,
      "step": 31015
    },
    {
      "epoch": 3.2904731593464884,
      "grad_norm": 0.46029600955628264,
      "learning_rate": 4.1322330882043846e-05,
      "loss": 1.3968,
      "num_input_tokens_seen": 24402333824,
      "step": 31016
    },
    {
      "epoch": 3.29057924888606,
      "grad_norm": 0.5542642092771412,
      "learning_rate": 4.132180447164046e-05,
      "loss": 1.2975,
      "num_input_tokens_seen": 24403120672,
      "step": 31017
    },
    {
      "epoch": 3.2906853384256314,
      "grad_norm": 0.5305449811018065,
      "learning_rate": 4.1321278048624055e-05,
      "loss": 1.5155,
      "num_input_tokens_seen": 24403907376,
      "step": 31018
    },
    {
      "epoch": 3.2907914279652024,
      "grad_norm": 0.4821560802252711,
      "learning_rate": 4.132075161299505e-05,
      "loss": 1.4672,
      "num_input_tokens_seen": 24404694016,
      "step": 31019
    },
    {
      "epoch": 3.290897517504774,
      "grad_norm": 0.46315875961218,
      "learning_rate": 4.1320225164753844e-05,
      "loss": 1.4354,
      "num_input_tokens_seen": 24405480848,
      "step": 31020
    },
    {
      "epoch": 3.2910036070443454,
      "grad_norm": 0.6119835508280524,
      "learning_rate": 4.131969870390086e-05,
      "loss": 1.4902,
      "num_input_tokens_seen": 24406267552,
      "step": 31021
    },
    {
      "epoch": 3.291109696583917,
      "grad_norm": 0.41202540727327397,
      "learning_rate": 4.131917223043648e-05,
      "loss": 1.391,
      "num_input_tokens_seen": 24407054384,
      "step": 31022
    },
    {
      "epoch": 3.2912157861234883,
      "grad_norm": 0.45388259615728865,
      "learning_rate": 4.131864574436112e-05,
      "loss": 1.5023,
      "num_input_tokens_seen": 24407841136,
      "step": 31023
    },
    {
      "epoch": 3.29132187566306,
      "grad_norm": 0.4117601825046039,
      "learning_rate": 4.131811924567519e-05,
      "loss": 1.4391,
      "num_input_tokens_seen": 24408628000,
      "step": 31024
    },
    {
      "epoch": 3.2914279652026313,
      "grad_norm": 0.4637304061171958,
      "learning_rate": 4.131759273437911e-05,
      "loss": 1.5677,
      "num_input_tokens_seen": 24409414752,
      "step": 31025
    },
    {
      "epoch": 3.2915340547422023,
      "grad_norm": 0.40173209853861613,
      "learning_rate": 4.131706621047325e-05,
      "loss": 1.3731,
      "num_input_tokens_seen": 24410201568,
      "step": 31026
    },
    {
      "epoch": 3.2916401442817738,
      "grad_norm": 0.47979421134837363,
      "learning_rate": 4.131653967395806e-05,
      "loss": 1.6048,
      "num_input_tokens_seen": 24410988384,
      "step": 31027
    },
    {
      "epoch": 3.2917462338213452,
      "grad_norm": 0.4222703229979035,
      "learning_rate": 4.131601312483392e-05,
      "loss": 1.4543,
      "num_input_tokens_seen": 24411775152,
      "step": 31028
    },
    {
      "epoch": 3.2918523233609167,
      "grad_norm": 0.4508172022256214,
      "learning_rate": 4.131548656310124e-05,
      "loss": 1.5079,
      "num_input_tokens_seen": 24412561888,
      "step": 31029
    },
    {
      "epoch": 3.291958412900488,
      "grad_norm": 0.4166479182695853,
      "learning_rate": 4.131495998876044e-05,
      "loss": 1.5231,
      "num_input_tokens_seen": 24413348608,
      "step": 31030
    },
    {
      "epoch": 3.292064502440059,
      "grad_norm": 0.4312128670550236,
      "learning_rate": 4.13144334018119e-05,
      "loss": 1.5178,
      "num_input_tokens_seen": 24414135408,
      "step": 31031
    },
    {
      "epoch": 3.2921705919796307,
      "grad_norm": 0.48512333834676075,
      "learning_rate": 4.131390680225606e-05,
      "loss": 1.4888,
      "num_input_tokens_seen": 24414922160,
      "step": 31032
    },
    {
      "epoch": 3.292276681519202,
      "grad_norm": 0.4794792681085706,
      "learning_rate": 4.131338019009331e-05,
      "loss": 1.4681,
      "num_input_tokens_seen": 24415709056,
      "step": 31033
    },
    {
      "epoch": 3.2923827710587736,
      "grad_norm": 0.424649882143893,
      "learning_rate": 4.131285356532405e-05,
      "loss": 1.3435,
      "num_input_tokens_seen": 24416495824,
      "step": 31034
    },
    {
      "epoch": 3.292488860598345,
      "grad_norm": 0.5124912865169038,
      "learning_rate": 4.131232692794871e-05,
      "loss": 1.5764,
      "num_input_tokens_seen": 24417282576,
      "step": 31035
    },
    {
      "epoch": 3.2925949501379166,
      "grad_norm": 0.43143395481268726,
      "learning_rate": 4.131180027796767e-05,
      "loss": 1.4852,
      "num_input_tokens_seen": 24418069328,
      "step": 31036
    },
    {
      "epoch": 3.2927010396774876,
      "grad_norm": 0.46753820046088107,
      "learning_rate": 4.1311273615381354e-05,
      "loss": 1.5024,
      "num_input_tokens_seen": 24418856144,
      "step": 31037
    },
    {
      "epoch": 3.292807129217059,
      "grad_norm": 0.43246392796988037,
      "learning_rate": 4.131074694019016e-05,
      "loss": 1.5519,
      "num_input_tokens_seen": 24419642912,
      "step": 31038
    },
    {
      "epoch": 3.2929132187566306,
      "grad_norm": 0.4543804752753083,
      "learning_rate": 4.1310220252394505e-05,
      "loss": 1.5537,
      "num_input_tokens_seen": 24420429600,
      "step": 31039
    },
    {
      "epoch": 3.293019308296202,
      "grad_norm": 0.507756203873699,
      "learning_rate": 4.1309693551994786e-05,
      "loss": 1.554,
      "num_input_tokens_seen": 24421216336,
      "step": 31040
    },
    {
      "epoch": 3.2931253978357735,
      "grad_norm": 0.4544444266594413,
      "learning_rate": 4.130916683899142e-05,
      "loss": 1.4892,
      "num_input_tokens_seen": 24422003056,
      "step": 31041
    },
    {
      "epoch": 3.293231487375345,
      "grad_norm": 0.5007873766158419,
      "learning_rate": 4.13086401133848e-05,
      "loss": 1.5164,
      "num_input_tokens_seen": 24422789840,
      "step": 31042
    },
    {
      "epoch": 3.293337576914916,
      "grad_norm": 0.4367793832620208,
      "learning_rate": 4.130811337517535e-05,
      "loss": 1.5097,
      "num_input_tokens_seen": 24423576560,
      "step": 31043
    },
    {
      "epoch": 3.2934436664544875,
      "grad_norm": 0.4840621763016629,
      "learning_rate": 4.130758662436347e-05,
      "loss": 1.4705,
      "num_input_tokens_seen": 24424363344,
      "step": 31044
    },
    {
      "epoch": 3.293549755994059,
      "grad_norm": 0.47593740417169494,
      "learning_rate": 4.130705986094956e-05,
      "loss": 1.3464,
      "num_input_tokens_seen": 24425150176,
      "step": 31045
    },
    {
      "epoch": 3.2936558455336304,
      "grad_norm": 0.38794653605293355,
      "learning_rate": 4.130653308493403e-05,
      "loss": 1.3511,
      "num_input_tokens_seen": 24425936960,
      "step": 31046
    },
    {
      "epoch": 3.293761935073202,
      "grad_norm": 0.5170769456047237,
      "learning_rate": 4.130600629631729e-05,
      "loss": 1.5556,
      "num_input_tokens_seen": 24426723616,
      "step": 31047
    },
    {
      "epoch": 3.293868024612773,
      "grad_norm": 0.45389001968792136,
      "learning_rate": 4.130547949509975e-05,
      "loss": 1.4486,
      "num_input_tokens_seen": 24427510336,
      "step": 31048
    },
    {
      "epoch": 3.2939741141523444,
      "grad_norm": 0.47045610512787606,
      "learning_rate": 4.1304952681281814e-05,
      "loss": 1.4959,
      "num_input_tokens_seen": 24428297072,
      "step": 31049
    },
    {
      "epoch": 3.294080203691916,
      "grad_norm": 0.43829948004315067,
      "learning_rate": 4.1304425854863894e-05,
      "loss": 1.3803,
      "num_input_tokens_seen": 24429083904,
      "step": 31050
    },
    {
      "epoch": 3.2941862932314874,
      "grad_norm": 0.41772707405499415,
      "learning_rate": 4.130389901584638e-05,
      "loss": 1.5232,
      "num_input_tokens_seen": 24429870672,
      "step": 31051
    },
    {
      "epoch": 3.294292382771059,
      "grad_norm": 0.49537935526429083,
      "learning_rate": 4.1303372164229705e-05,
      "loss": 1.3875,
      "num_input_tokens_seen": 24430657456,
      "step": 31052
    },
    {
      "epoch": 3.2943984723106303,
      "grad_norm": 0.40548344125640795,
      "learning_rate": 4.130284530001425e-05,
      "loss": 1.4555,
      "num_input_tokens_seen": 24431444208,
      "step": 31053
    },
    {
      "epoch": 3.294504561850202,
      "grad_norm": 0.5355311015709037,
      "learning_rate": 4.1302318423200444e-05,
      "loss": 1.4946,
      "num_input_tokens_seen": 24432230880,
      "step": 31054
    },
    {
      "epoch": 3.294610651389773,
      "grad_norm": 0.40130875496297,
      "learning_rate": 4.130179153378868e-05,
      "loss": 1.4447,
      "num_input_tokens_seen": 24433017648,
      "step": 31055
    },
    {
      "epoch": 3.2947167409293443,
      "grad_norm": 0.44382278773335143,
      "learning_rate": 4.130126463177937e-05,
      "loss": 1.4357,
      "num_input_tokens_seen": 24433804400,
      "step": 31056
    },
    {
      "epoch": 3.2948228304689158,
      "grad_norm": 0.508884241956236,
      "learning_rate": 4.130073771717292e-05,
      "loss": 1.5033,
      "num_input_tokens_seen": 24434591168,
      "step": 31057
    },
    {
      "epoch": 3.2949289200084872,
      "grad_norm": 0.4310412843471182,
      "learning_rate": 4.130021078996974e-05,
      "loss": 1.5415,
      "num_input_tokens_seen": 24435377920,
      "step": 31058
    },
    {
      "epoch": 3.2950350095480587,
      "grad_norm": 0.5711454361984067,
      "learning_rate": 4.1299683850170236e-05,
      "loss": 1.5138,
      "num_input_tokens_seen": 24436164736,
      "step": 31059
    },
    {
      "epoch": 3.2951410990876298,
      "grad_norm": 0.40734494209117533,
      "learning_rate": 4.129915689777481e-05,
      "loss": 1.4018,
      "num_input_tokens_seen": 24436951552,
      "step": 31060
    },
    {
      "epoch": 3.2952471886272012,
      "grad_norm": 0.4832325780306758,
      "learning_rate": 4.1298629932783883e-05,
      "loss": 1.3489,
      "num_input_tokens_seen": 24437738256,
      "step": 31061
    },
    {
      "epoch": 3.2953532781667727,
      "grad_norm": 0.49215347968482487,
      "learning_rate": 4.1298102955197844e-05,
      "loss": 1.5675,
      "num_input_tokens_seen": 24438525072,
      "step": 31062
    },
    {
      "epoch": 3.295459367706344,
      "grad_norm": 0.3939207049002086,
      "learning_rate": 4.129757596501711e-05,
      "loss": 1.4591,
      "num_input_tokens_seen": 24439311840,
      "step": 31063
    },
    {
      "epoch": 3.2955654572459157,
      "grad_norm": 0.46344744596817494,
      "learning_rate": 4.129704896224209e-05,
      "loss": 1.4984,
      "num_input_tokens_seen": 24440098656,
      "step": 31064
    },
    {
      "epoch": 3.295671546785487,
      "grad_norm": 0.42592045411739127,
      "learning_rate": 4.129652194687319e-05,
      "loss": 1.4389,
      "num_input_tokens_seen": 24440885440,
      "step": 31065
    },
    {
      "epoch": 3.295777636325058,
      "grad_norm": 0.5557472944208347,
      "learning_rate": 4.129599491891082e-05,
      "loss": 1.5019,
      "num_input_tokens_seen": 24441672208,
      "step": 31066
    },
    {
      "epoch": 3.2958837258646296,
      "grad_norm": 0.48628838769919985,
      "learning_rate": 4.129546787835537e-05,
      "loss": 1.4711,
      "num_input_tokens_seen": 24442459008,
      "step": 31067
    },
    {
      "epoch": 3.295989815404201,
      "grad_norm": 0.547137043028034,
      "learning_rate": 4.129494082520727e-05,
      "loss": 1.3919,
      "num_input_tokens_seen": 24443245824,
      "step": 31068
    },
    {
      "epoch": 3.2960959049437726,
      "grad_norm": 0.5029569203128562,
      "learning_rate": 4.129441375946692e-05,
      "loss": 1.5326,
      "num_input_tokens_seen": 24444032544,
      "step": 31069
    },
    {
      "epoch": 3.296201994483344,
      "grad_norm": 0.5027101165105367,
      "learning_rate": 4.129388668113472e-05,
      "loss": 1.4411,
      "num_input_tokens_seen": 24444819328,
      "step": 31070
    },
    {
      "epoch": 3.2963080840229155,
      "grad_norm": 0.48718668886655353,
      "learning_rate": 4.129335959021108e-05,
      "loss": 1.3414,
      "num_input_tokens_seen": 24445606160,
      "step": 31071
    },
    {
      "epoch": 3.2964141735624866,
      "grad_norm": 0.4574301165758144,
      "learning_rate": 4.129283248669642e-05,
      "loss": 1.3859,
      "num_input_tokens_seen": 24446393008,
      "step": 31072
    },
    {
      "epoch": 3.296520263102058,
      "grad_norm": 0.4985409972818537,
      "learning_rate": 4.129230537059113e-05,
      "loss": 1.4276,
      "num_input_tokens_seen": 24447179664,
      "step": 31073
    },
    {
      "epoch": 3.2966263526416295,
      "grad_norm": 0.40561902466057886,
      "learning_rate": 4.1291778241895625e-05,
      "loss": 1.4219,
      "num_input_tokens_seen": 24447966464,
      "step": 31074
    },
    {
      "epoch": 3.296732442181201,
      "grad_norm": 0.568785928828286,
      "learning_rate": 4.129125110061031e-05,
      "loss": 1.4646,
      "num_input_tokens_seen": 24448753168,
      "step": 31075
    },
    {
      "epoch": 3.2968385317207725,
      "grad_norm": 0.4670692788402855,
      "learning_rate": 4.12907239467356e-05,
      "loss": 1.4787,
      "num_input_tokens_seen": 24449539984,
      "step": 31076
    },
    {
      "epoch": 3.2969446212603435,
      "grad_norm": 0.5770928957766733,
      "learning_rate": 4.1290196780271886e-05,
      "loss": 1.5355,
      "num_input_tokens_seen": 24450326672,
      "step": 31077
    },
    {
      "epoch": 3.297050710799915,
      "grad_norm": 0.5821197187566277,
      "learning_rate": 4.12896696012196e-05,
      "loss": 1.4665,
      "num_input_tokens_seen": 24451113504,
      "step": 31078
    },
    {
      "epoch": 3.2971568003394864,
      "grad_norm": 0.5418465619136242,
      "learning_rate": 4.128914240957913e-05,
      "loss": 1.5755,
      "num_input_tokens_seen": 24451900192,
      "step": 31079
    },
    {
      "epoch": 3.297262889879058,
      "grad_norm": 0.6193022628424729,
      "learning_rate": 4.128861520535088e-05,
      "loss": 1.5696,
      "num_input_tokens_seen": 24452687008,
      "step": 31080
    },
    {
      "epoch": 3.2973689794186294,
      "grad_norm": 0.4637971348356106,
      "learning_rate": 4.1288087988535276e-05,
      "loss": 1.5172,
      "num_input_tokens_seen": 24453473792,
      "step": 31081
    },
    {
      "epoch": 3.297475068958201,
      "grad_norm": 0.6423925166434122,
      "learning_rate": 4.128756075913272e-05,
      "loss": 1.4847,
      "num_input_tokens_seen": 24454260464,
      "step": 31082
    },
    {
      "epoch": 3.2975811584977723,
      "grad_norm": 0.36661933354666115,
      "learning_rate": 4.12870335171436e-05,
      "loss": 1.3232,
      "num_input_tokens_seen": 24455047280,
      "step": 31083
    },
    {
      "epoch": 3.2976872480373434,
      "grad_norm": 0.5808920483988039,
      "learning_rate": 4.128650626256835e-05,
      "loss": 1.5183,
      "num_input_tokens_seen": 24455834032,
      "step": 31084
    },
    {
      "epoch": 3.297793337576915,
      "grad_norm": 0.5817702966009348,
      "learning_rate": 4.128597899540736e-05,
      "loss": 1.4149,
      "num_input_tokens_seen": 24456620656,
      "step": 31085
    },
    {
      "epoch": 3.2978994271164863,
      "grad_norm": 0.6965905805834857,
      "learning_rate": 4.128545171566104e-05,
      "loss": 1.4142,
      "num_input_tokens_seen": 24457407440,
      "step": 31086
    },
    {
      "epoch": 3.298005516656058,
      "grad_norm": 0.5972706702441917,
      "learning_rate": 4.128492442332981e-05,
      "loss": 1.3462,
      "num_input_tokens_seen": 24458194192,
      "step": 31087
    },
    {
      "epoch": 3.2981116061956293,
      "grad_norm": 0.5708776596208024,
      "learning_rate": 4.128439711841407e-05,
      "loss": 1.4117,
      "num_input_tokens_seen": 24458980992,
      "step": 31088
    },
    {
      "epoch": 3.2982176957352003,
      "grad_norm": 0.7612675171004317,
      "learning_rate": 4.128386980091421e-05,
      "loss": 1.4554,
      "num_input_tokens_seen": 24459767744,
      "step": 31089
    },
    {
      "epoch": 3.2983237852747718,
      "grad_norm": 0.44432952521299907,
      "learning_rate": 4.128334247083066e-05,
      "loss": 1.3566,
      "num_input_tokens_seen": 24460554544,
      "step": 31090
    },
    {
      "epoch": 3.2984298748143432,
      "grad_norm": 0.8877910713014937,
      "learning_rate": 4.128281512816382e-05,
      "loss": 1.3989,
      "num_input_tokens_seen": 24461341248,
      "step": 31091
    },
    {
      "epoch": 3.2985359643539147,
      "grad_norm": 0.7094091637601129,
      "learning_rate": 4.128228777291411e-05,
      "loss": 1.5094,
      "num_input_tokens_seen": 24462127984,
      "step": 31092
    },
    {
      "epoch": 3.298642053893486,
      "grad_norm": 1.0476993619435624,
      "learning_rate": 4.128176040508191e-05,
      "loss": 1.5066,
      "num_input_tokens_seen": 24462914768,
      "step": 31093
    },
    {
      "epoch": 3.2987481434330577,
      "grad_norm": 0.8096123417520456,
      "learning_rate": 4.128123302466766e-05,
      "loss": 1.4019,
      "num_input_tokens_seen": 24463701520,
      "step": 31094
    },
    {
      "epoch": 3.298854232972629,
      "grad_norm": 0.4216674789654785,
      "learning_rate": 4.128070563167174e-05,
      "loss": 1.3209,
      "num_input_tokens_seen": 24464488304,
      "step": 31095
    },
    {
      "epoch": 3.2989603225122,
      "grad_norm": 1.1157207536756608,
      "learning_rate": 4.1280178226094566e-05,
      "loss": 1.4937,
      "num_input_tokens_seen": 24465275008,
      "step": 31096
    },
    {
      "epoch": 3.2990664120517716,
      "grad_norm": 0.5749459657798767,
      "learning_rate": 4.1279650807936556e-05,
      "loss": 1.4907,
      "num_input_tokens_seen": 24466061808,
      "step": 31097
    },
    {
      "epoch": 3.299172501591343,
      "grad_norm": 0.8885854981776922,
      "learning_rate": 4.12791233771981e-05,
      "loss": 1.4866,
      "num_input_tokens_seen": 24466848592,
      "step": 31098
    },
    {
      "epoch": 3.2992785911309146,
      "grad_norm": 0.8166213468796135,
      "learning_rate": 4.127859593387962e-05,
      "loss": 1.4628,
      "num_input_tokens_seen": 24467635264,
      "step": 31099
    },
    {
      "epoch": 3.299384680670486,
      "grad_norm": 0.6750672624254309,
      "learning_rate": 4.1278068477981525e-05,
      "loss": 1.5244,
      "num_input_tokens_seen": 24468421968,
      "step": 31100
    },
    {
      "epoch": 3.299490770210057,
      "grad_norm": 0.7719172060215101,
      "learning_rate": 4.127754100950421e-05,
      "loss": 1.4623,
      "num_input_tokens_seen": 24469208752,
      "step": 31101
    },
    {
      "epoch": 3.2995968597496286,
      "grad_norm": 0.47118503936326095,
      "learning_rate": 4.127701352844808e-05,
      "loss": 1.4121,
      "num_input_tokens_seen": 24469995536,
      "step": 31102
    },
    {
      "epoch": 3.2997029492892,
      "grad_norm": 0.6392880232949809,
      "learning_rate": 4.127648603481357e-05,
      "loss": 1.4375,
      "num_input_tokens_seen": 24470782336,
      "step": 31103
    },
    {
      "epoch": 3.2998090388287715,
      "grad_norm": 0.5405178714604242,
      "learning_rate": 4.1275958528601056e-05,
      "loss": 1.4364,
      "num_input_tokens_seen": 24471569072,
      "step": 31104
    },
    {
      "epoch": 3.299915128368343,
      "grad_norm": 0.6627271606129876,
      "learning_rate": 4.1275431009810965e-05,
      "loss": 1.4102,
      "num_input_tokens_seen": 24472355888,
      "step": 31105
    },
    {
      "epoch": 3.3000212179079145,
      "grad_norm": 0.4869353713042254,
      "learning_rate": 4.1274903478443696e-05,
      "loss": 1.5141,
      "num_input_tokens_seen": 24473142704,
      "step": 31106
    },
    {
      "epoch": 3.3001273074474855,
      "grad_norm": 0.5273236397200055,
      "learning_rate": 4.127437593449967e-05,
      "loss": 1.5244,
      "num_input_tokens_seen": 24473929424,
      "step": 31107
    },
    {
      "epoch": 3.300233396987057,
      "grad_norm": 0.6255205678613828,
      "learning_rate": 4.127384837797926e-05,
      "loss": 1.4304,
      "num_input_tokens_seen": 24474716304,
      "step": 31108
    },
    {
      "epoch": 3.3003394865266285,
      "grad_norm": 0.4796042368461938,
      "learning_rate": 4.1273320808882913e-05,
      "loss": 1.4063,
      "num_input_tokens_seen": 24475503024,
      "step": 31109
    },
    {
      "epoch": 3.3004455760662,
      "grad_norm": 0.49326818275625745,
      "learning_rate": 4.127279322721102e-05,
      "loss": 1.5269,
      "num_input_tokens_seen": 24476289648,
      "step": 31110
    },
    {
      "epoch": 3.3005516656057714,
      "grad_norm": 0.47143622709797256,
      "learning_rate": 4.127226563296399e-05,
      "loss": 1.474,
      "num_input_tokens_seen": 24477076368,
      "step": 31111
    },
    {
      "epoch": 3.300657755145343,
      "grad_norm": 0.5498802889933412,
      "learning_rate": 4.127173802614223e-05,
      "loss": 1.5469,
      "num_input_tokens_seen": 24477863104,
      "step": 31112
    },
    {
      "epoch": 3.300763844684914,
      "grad_norm": 0.48415113998398496,
      "learning_rate": 4.127121040674615e-05,
      "loss": 1.415,
      "num_input_tokens_seen": 24478649920,
      "step": 31113
    },
    {
      "epoch": 3.3008699342244854,
      "grad_norm": 0.4840025063693587,
      "learning_rate": 4.127068277477615e-05,
      "loss": 1.3954,
      "num_input_tokens_seen": 24479436720,
      "step": 31114
    },
    {
      "epoch": 3.300976023764057,
      "grad_norm": 0.4760472744684354,
      "learning_rate": 4.127015513023265e-05,
      "loss": 1.3768,
      "num_input_tokens_seen": 24480223520,
      "step": 31115
    },
    {
      "epoch": 3.3010821133036283,
      "grad_norm": 0.4613160651901776,
      "learning_rate": 4.126962747311605e-05,
      "loss": 1.4363,
      "num_input_tokens_seen": 24481010192,
      "step": 31116
    },
    {
      "epoch": 3.3011882028432,
      "grad_norm": 0.5236308807382694,
      "learning_rate": 4.126909980342676e-05,
      "loss": 1.5018,
      "num_input_tokens_seen": 24481796976,
      "step": 31117
    },
    {
      "epoch": 3.301294292382771,
      "grad_norm": 0.4438054468162154,
      "learning_rate": 4.1268572121165187e-05,
      "loss": 1.4718,
      "num_input_tokens_seen": 24482583792,
      "step": 31118
    },
    {
      "epoch": 3.3014003819223423,
      "grad_norm": 0.4760914279657317,
      "learning_rate": 4.126804442633173e-05,
      "loss": 1.3827,
      "num_input_tokens_seen": 24483370496,
      "step": 31119
    },
    {
      "epoch": 3.301506471461914,
      "grad_norm": 0.5747564659505843,
      "learning_rate": 4.126751671892681e-05,
      "loss": 1.5039,
      "num_input_tokens_seen": 24484157328,
      "step": 31120
    },
    {
      "epoch": 3.3016125610014853,
      "grad_norm": 0.4930966893753616,
      "learning_rate": 4.126698899895084e-05,
      "loss": 1.4875,
      "num_input_tokens_seen": 24484944064,
      "step": 31121
    },
    {
      "epoch": 3.3017186505410567,
      "grad_norm": 0.4540965634905657,
      "learning_rate": 4.126646126640421e-05,
      "loss": 1.5088,
      "num_input_tokens_seen": 24485730816,
      "step": 31122
    },
    {
      "epoch": 3.301824740080628,
      "grad_norm": 0.42752370642762544,
      "learning_rate": 4.1265933521287336e-05,
      "loss": 1.5519,
      "num_input_tokens_seen": 24486517616,
      "step": 31123
    },
    {
      "epoch": 3.3019308296201997,
      "grad_norm": 0.6022472298934246,
      "learning_rate": 4.126540576360063e-05,
      "loss": 1.5682,
      "num_input_tokens_seen": 24487304304,
      "step": 31124
    },
    {
      "epoch": 3.3020369191597707,
      "grad_norm": 0.45259825700788653,
      "learning_rate": 4.1264877993344495e-05,
      "loss": 1.5424,
      "num_input_tokens_seen": 24488091040,
      "step": 31125
    },
    {
      "epoch": 3.302143008699342,
      "grad_norm": 0.5025643976564418,
      "learning_rate": 4.126435021051934e-05,
      "loss": 1.3366,
      "num_input_tokens_seen": 24488877696,
      "step": 31126
    },
    {
      "epoch": 3.3022490982389137,
      "grad_norm": 0.4592055818262367,
      "learning_rate": 4.1263822415125565e-05,
      "loss": 1.4998,
      "num_input_tokens_seen": 24489664464,
      "step": 31127
    },
    {
      "epoch": 3.302355187778485,
      "grad_norm": 0.4833913869021145,
      "learning_rate": 4.1263294607163597e-05,
      "loss": 1.5545,
      "num_input_tokens_seen": 24490451312,
      "step": 31128
    },
    {
      "epoch": 3.3024612773180566,
      "grad_norm": 0.47841148528169736,
      "learning_rate": 4.126276678663382e-05,
      "loss": 1.532,
      "num_input_tokens_seen": 24491238112,
      "step": 31129
    },
    {
      "epoch": 3.3025673668576276,
      "grad_norm": 0.42288052277336985,
      "learning_rate": 4.126223895353666e-05,
      "loss": 1.3549,
      "num_input_tokens_seen": 24492024880,
      "step": 31130
    },
    {
      "epoch": 3.302673456397199,
      "grad_norm": 0.449441082645223,
      "learning_rate": 4.126171110787252e-05,
      "loss": 1.5092,
      "num_input_tokens_seen": 24492811584,
      "step": 31131
    },
    {
      "epoch": 3.3027795459367706,
      "grad_norm": 0.44787229055329114,
      "learning_rate": 4.1261183249641796e-05,
      "loss": 1.442,
      "num_input_tokens_seen": 24493598336,
      "step": 31132
    },
    {
      "epoch": 3.302885635476342,
      "grad_norm": 0.43824677866119,
      "learning_rate": 4.1260655378844925e-05,
      "loss": 1.521,
      "num_input_tokens_seen": 24494385072,
      "step": 31133
    },
    {
      "epoch": 3.3029917250159135,
      "grad_norm": 0.43463873662254304,
      "learning_rate": 4.126012749548228e-05,
      "loss": 1.4489,
      "num_input_tokens_seen": 24495171808,
      "step": 31134
    },
    {
      "epoch": 3.303097814555485,
      "grad_norm": 0.5452300255023564,
      "learning_rate": 4.12595995995543e-05,
      "loss": 1.4608,
      "num_input_tokens_seen": 24495958576,
      "step": 31135
    },
    {
      "epoch": 3.303203904095056,
      "grad_norm": 0.43107249584524937,
      "learning_rate": 4.125907169106137e-05,
      "loss": 1.4062,
      "num_input_tokens_seen": 24496745328,
      "step": 31136
    },
    {
      "epoch": 3.3033099936346275,
      "grad_norm": 0.45756292285859695,
      "learning_rate": 4.12585437700039e-05,
      "loss": 1.4997,
      "num_input_tokens_seen": 24497532192,
      "step": 31137
    },
    {
      "epoch": 3.303416083174199,
      "grad_norm": 0.41367459740967016,
      "learning_rate": 4.125801583638231e-05,
      "loss": 1.372,
      "num_input_tokens_seen": 24498318912,
      "step": 31138
    },
    {
      "epoch": 3.3035221727137705,
      "grad_norm": 0.49025337075973136,
      "learning_rate": 4.125748789019701e-05,
      "loss": 1.428,
      "num_input_tokens_seen": 24499105552,
      "step": 31139
    },
    {
      "epoch": 3.303628262253342,
      "grad_norm": 0.4365696460757711,
      "learning_rate": 4.1256959931448396e-05,
      "loss": 1.4023,
      "num_input_tokens_seen": 24499892336,
      "step": 31140
    },
    {
      "epoch": 3.3037343517929134,
      "grad_norm": 0.46274428272538004,
      "learning_rate": 4.1256431960136876e-05,
      "loss": 1.4611,
      "num_input_tokens_seen": 24500679056,
      "step": 31141
    },
    {
      "epoch": 3.3038404413324844,
      "grad_norm": 0.4352748007562247,
      "learning_rate": 4.125590397626287e-05,
      "loss": 1.5884,
      "num_input_tokens_seen": 24501465904,
      "step": 31142
    },
    {
      "epoch": 3.303946530872056,
      "grad_norm": 0.420911999874615,
      "learning_rate": 4.125537597982677e-05,
      "loss": 1.4114,
      "num_input_tokens_seen": 24502252592,
      "step": 31143
    },
    {
      "epoch": 3.3040526204116274,
      "grad_norm": 0.428845601350069,
      "learning_rate": 4.1254847970829e-05,
      "loss": 1.4742,
      "num_input_tokens_seen": 24503039296,
      "step": 31144
    },
    {
      "epoch": 3.304158709951199,
      "grad_norm": 0.463709609494589,
      "learning_rate": 4.125431994926996e-05,
      "loss": 1.449,
      "num_input_tokens_seen": 24503826048,
      "step": 31145
    },
    {
      "epoch": 3.3042647994907703,
      "grad_norm": 0.49035715094510074,
      "learning_rate": 4.125379191515005e-05,
      "loss": 1.4252,
      "num_input_tokens_seen": 24504612912,
      "step": 31146
    },
    {
      "epoch": 3.3043708890303414,
      "grad_norm": 0.4885284363611023,
      "learning_rate": 4.12532638684697e-05,
      "loss": 1.475,
      "num_input_tokens_seen": 24505399632,
      "step": 31147
    },
    {
      "epoch": 3.304476978569913,
      "grad_norm": 0.4862265114821958,
      "learning_rate": 4.125273580922929e-05,
      "loss": 1.51,
      "num_input_tokens_seen": 24506186384,
      "step": 31148
    },
    {
      "epoch": 3.3045830681094843,
      "grad_norm": 0.4858744298069256,
      "learning_rate": 4.125220773742925e-05,
      "loss": 1.3858,
      "num_input_tokens_seen": 24506973088,
      "step": 31149
    },
    {
      "epoch": 3.304689157649056,
      "grad_norm": 0.5484198328826644,
      "learning_rate": 4.1251679653069984e-05,
      "loss": 1.3858,
      "num_input_tokens_seen": 24507759824,
      "step": 31150
    },
    {
      "epoch": 3.3047952471886273,
      "grad_norm": 0.48037079678264877,
      "learning_rate": 4.125115155615189e-05,
      "loss": 1.4263,
      "num_input_tokens_seen": 24508546608,
      "step": 31151
    },
    {
      "epoch": 3.3049013367281987,
      "grad_norm": 0.4830234404675246,
      "learning_rate": 4.125062344667538e-05,
      "loss": 1.4849,
      "num_input_tokens_seen": 24509333392,
      "step": 31152
    },
    {
      "epoch": 3.30500742626777,
      "grad_norm": 0.4996419048605196,
      "learning_rate": 4.125009532464088e-05,
      "loss": 1.3684,
      "num_input_tokens_seen": 24510120176,
      "step": 31153
    },
    {
      "epoch": 3.3051135158073413,
      "grad_norm": 0.4338918080132944,
      "learning_rate": 4.124956719004877e-05,
      "loss": 1.5436,
      "num_input_tokens_seen": 24510906800,
      "step": 31154
    },
    {
      "epoch": 3.3052196053469127,
      "grad_norm": 0.40766041787023144,
      "learning_rate": 4.124903904289947e-05,
      "loss": 1.4209,
      "num_input_tokens_seen": 24511693584,
      "step": 31155
    },
    {
      "epoch": 3.305325694886484,
      "grad_norm": 0.521302470774016,
      "learning_rate": 4.1248510883193404e-05,
      "loss": 1.4243,
      "num_input_tokens_seen": 24512480448,
      "step": 31156
    },
    {
      "epoch": 3.3054317844260557,
      "grad_norm": 0.38278614960284096,
      "learning_rate": 4.1247982710930954e-05,
      "loss": 1.3923,
      "num_input_tokens_seen": 24513267216,
      "step": 31157
    },
    {
      "epoch": 3.305537873965627,
      "grad_norm": 0.562568345820585,
      "learning_rate": 4.124745452611254e-05,
      "loss": 1.3764,
      "num_input_tokens_seen": 24514054080,
      "step": 31158
    },
    {
      "epoch": 3.305643963505198,
      "grad_norm": 0.4613947612570022,
      "learning_rate": 4.124692632873857e-05,
      "loss": 1.5117,
      "num_input_tokens_seen": 24514840896,
      "step": 31159
    },
    {
      "epoch": 3.3057500530447697,
      "grad_norm": 0.4853748277475142,
      "learning_rate": 4.124639811880946e-05,
      "loss": 1.4099,
      "num_input_tokens_seen": 24515627584,
      "step": 31160
    },
    {
      "epoch": 3.305856142584341,
      "grad_norm": 0.4186193692340564,
      "learning_rate": 4.12458698963256e-05,
      "loss": 1.4923,
      "num_input_tokens_seen": 24516414256,
      "step": 31161
    },
    {
      "epoch": 3.3059622321239126,
      "grad_norm": 0.46612639488156116,
      "learning_rate": 4.124534166128742e-05,
      "loss": 1.4592,
      "num_input_tokens_seen": 24517201008,
      "step": 31162
    },
    {
      "epoch": 3.306068321663484,
      "grad_norm": 0.593263775435826,
      "learning_rate": 4.124481341369531e-05,
      "loss": 1.4684,
      "num_input_tokens_seen": 24517987712,
      "step": 31163
    },
    {
      "epoch": 3.3061744112030556,
      "grad_norm": 0.572407075484026,
      "learning_rate": 4.124428515354968e-05,
      "loss": 1.5188,
      "num_input_tokens_seen": 24518774480,
      "step": 31164
    },
    {
      "epoch": 3.306280500742627,
      "grad_norm": 0.4665646439082913,
      "learning_rate": 4.124375688085095e-05,
      "loss": 1.5146,
      "num_input_tokens_seen": 24519561184,
      "step": 31165
    },
    {
      "epoch": 3.306386590282198,
      "grad_norm": 0.6300703785754296,
      "learning_rate": 4.124322859559951e-05,
      "loss": 1.4217,
      "num_input_tokens_seen": 24520347952,
      "step": 31166
    },
    {
      "epoch": 3.3064926798217695,
      "grad_norm": 0.43651088013849393,
      "learning_rate": 4.124270029779579e-05,
      "loss": 1.4199,
      "num_input_tokens_seen": 24521134624,
      "step": 31167
    },
    {
      "epoch": 3.306598769361341,
      "grad_norm": 0.4688449589642386,
      "learning_rate": 4.124217198744019e-05,
      "loss": 1.3886,
      "num_input_tokens_seen": 24521921376,
      "step": 31168
    },
    {
      "epoch": 3.3067048589009125,
      "grad_norm": 0.6308804406781919,
      "learning_rate": 4.124164366453311e-05,
      "loss": 1.5123,
      "num_input_tokens_seen": 24522708192,
      "step": 31169
    },
    {
      "epoch": 3.306810948440484,
      "grad_norm": 0.37468775486331823,
      "learning_rate": 4.1241115329074965e-05,
      "loss": 1.354,
      "num_input_tokens_seen": 24523494944,
      "step": 31170
    },
    {
      "epoch": 3.306917037980055,
      "grad_norm": 0.47491457407526355,
      "learning_rate": 4.124058698106617e-05,
      "loss": 1.5061,
      "num_input_tokens_seen": 24524281712,
      "step": 31171
    },
    {
      "epoch": 3.3070231275196265,
      "grad_norm": 0.4487279480931606,
      "learning_rate": 4.1240058620507115e-05,
      "loss": 1.4144,
      "num_input_tokens_seen": 24525068464,
      "step": 31172
    },
    {
      "epoch": 3.307129217059198,
      "grad_norm": 0.4604500451995281,
      "learning_rate": 4.123953024739822e-05,
      "loss": 1.297,
      "num_input_tokens_seen": 24525855392,
      "step": 31173
    },
    {
      "epoch": 3.3072353065987694,
      "grad_norm": 0.4300811407027272,
      "learning_rate": 4.12390018617399e-05,
      "loss": 1.4121,
      "num_input_tokens_seen": 24526642080,
      "step": 31174
    },
    {
      "epoch": 3.307341396138341,
      "grad_norm": 0.41860545268208693,
      "learning_rate": 4.1238473463532554e-05,
      "loss": 1.4633,
      "num_input_tokens_seen": 24527428800,
      "step": 31175
    },
    {
      "epoch": 3.307447485677912,
      "grad_norm": 0.5676565411818698,
      "learning_rate": 4.123794505277658e-05,
      "loss": 1.4349,
      "num_input_tokens_seen": 24528215520,
      "step": 31176
    },
    {
      "epoch": 3.3075535752174834,
      "grad_norm": 0.4109184282178497,
      "learning_rate": 4.1237416629472416e-05,
      "loss": 1.3932,
      "num_input_tokens_seen": 24529002272,
      "step": 31177
    },
    {
      "epoch": 3.307659664757055,
      "grad_norm": 0.4640634732826404,
      "learning_rate": 4.123688819362045e-05,
      "loss": 1.5071,
      "num_input_tokens_seen": 24529788992,
      "step": 31178
    },
    {
      "epoch": 3.3077657542966263,
      "grad_norm": 0.4454722021259421,
      "learning_rate": 4.123635974522109e-05,
      "loss": 1.4498,
      "num_input_tokens_seen": 24530575776,
      "step": 31179
    },
    {
      "epoch": 3.307871843836198,
      "grad_norm": 0.46021655899160774,
      "learning_rate": 4.123583128427474e-05,
      "loss": 1.4538,
      "num_input_tokens_seen": 24531362496,
      "step": 31180
    },
    {
      "epoch": 3.3079779333757693,
      "grad_norm": 0.5052512039887623,
      "learning_rate": 4.123530281078182e-05,
      "loss": 1.3985,
      "num_input_tokens_seen": 24532149296,
      "step": 31181
    },
    {
      "epoch": 3.3080840229153408,
      "grad_norm": 0.5265616187189474,
      "learning_rate": 4.1234774324742744e-05,
      "loss": 1.5184,
      "num_input_tokens_seen": 24532936096,
      "step": 31182
    },
    {
      "epoch": 3.308190112454912,
      "grad_norm": 0.4677451002598619,
      "learning_rate": 4.1234245826157904e-05,
      "loss": 1.3679,
      "num_input_tokens_seen": 24533722880,
      "step": 31183
    },
    {
      "epoch": 3.3082962019944833,
      "grad_norm": 0.4330641585804071,
      "learning_rate": 4.123371731502771e-05,
      "loss": 1.5875,
      "num_input_tokens_seen": 24534509664,
      "step": 31184
    },
    {
      "epoch": 3.3084022915340547,
      "grad_norm": 0.49320518432401755,
      "learning_rate": 4.123318879135257e-05,
      "loss": 1.3825,
      "num_input_tokens_seen": 24535296368,
      "step": 31185
    },
    {
      "epoch": 3.308508381073626,
      "grad_norm": 0.47405723699058855,
      "learning_rate": 4.123266025513292e-05,
      "loss": 1.516,
      "num_input_tokens_seen": 24536083168,
      "step": 31186
    },
    {
      "epoch": 3.3086144706131977,
      "grad_norm": 0.5247491966258144,
      "learning_rate": 4.123213170636913e-05,
      "loss": 1.4213,
      "num_input_tokens_seen": 24536869904,
      "step": 31187
    },
    {
      "epoch": 3.3087205601527687,
      "grad_norm": 0.4666177115658359,
      "learning_rate": 4.123160314506163e-05,
      "loss": 1.5153,
      "num_input_tokens_seen": 24537656672,
      "step": 31188
    },
    {
      "epoch": 3.30882664969234,
      "grad_norm": 0.5721149717044183,
      "learning_rate": 4.1231074571210825e-05,
      "loss": 1.5249,
      "num_input_tokens_seen": 24538443424,
      "step": 31189
    },
    {
      "epoch": 3.3089327392319117,
      "grad_norm": 0.37776777218290397,
      "learning_rate": 4.1230545984817114e-05,
      "loss": 1.4858,
      "num_input_tokens_seen": 24539230144,
      "step": 31190
    },
    {
      "epoch": 3.309038828771483,
      "grad_norm": 0.4910210087931354,
      "learning_rate": 4.1230017385880926e-05,
      "loss": 1.4561,
      "num_input_tokens_seen": 24540016912,
      "step": 31191
    },
    {
      "epoch": 3.3091449183110546,
      "grad_norm": 0.5222964537724408,
      "learning_rate": 4.1229488774402646e-05,
      "loss": 1.5628,
      "num_input_tokens_seen": 24540803680,
      "step": 31192
    },
    {
      "epoch": 3.309251007850626,
      "grad_norm": 0.42229544091391136,
      "learning_rate": 4.12289601503827e-05,
      "loss": 1.4978,
      "num_input_tokens_seen": 24541590384,
      "step": 31193
    },
    {
      "epoch": 3.3093570973901976,
      "grad_norm": 0.5801773094489929,
      "learning_rate": 4.1228431513821487e-05,
      "loss": 1.4923,
      "num_input_tokens_seen": 24542377184,
      "step": 31194
    },
    {
      "epoch": 3.3094631869297686,
      "grad_norm": 0.4384545112168399,
      "learning_rate": 4.122790286471941e-05,
      "loss": 1.4817,
      "num_input_tokens_seen": 24543163888,
      "step": 31195
    },
    {
      "epoch": 3.30956927646934,
      "grad_norm": 0.5377426339506963,
      "learning_rate": 4.12273742030769e-05,
      "loss": 1.5151,
      "num_input_tokens_seen": 24543950576,
      "step": 31196
    },
    {
      "epoch": 3.3096753660089115,
      "grad_norm": 0.4458344534932437,
      "learning_rate": 4.1226845528894345e-05,
      "loss": 1.4291,
      "num_input_tokens_seen": 24544737424,
      "step": 31197
    },
    {
      "epoch": 3.309781455548483,
      "grad_norm": 0.4217781592536622,
      "learning_rate": 4.122631684217216e-05,
      "loss": 1.4917,
      "num_input_tokens_seen": 24545524160,
      "step": 31198
    },
    {
      "epoch": 3.3098875450880545,
      "grad_norm": 0.6220172523081305,
      "learning_rate": 4.1225788142910757e-05,
      "loss": 1.5706,
      "num_input_tokens_seen": 24546310896,
      "step": 31199
    },
    {
      "epoch": 3.3099936346276255,
      "grad_norm": 0.4274304028527259,
      "learning_rate": 4.122525943111054e-05,
      "loss": 1.4976,
      "num_input_tokens_seen": 24547097696,
      "step": 31200
    },
    {
      "epoch": 3.310099724167197,
      "grad_norm": 0.5122499659572972,
      "learning_rate": 4.1224730706771915e-05,
      "loss": 1.4507,
      "num_input_tokens_seen": 24547884528,
      "step": 31201
    },
    {
      "epoch": 3.3102058137067685,
      "grad_norm": 0.39693905485452263,
      "learning_rate": 4.122420196989529e-05,
      "loss": 1.4229,
      "num_input_tokens_seen": 24548671248,
      "step": 31202
    },
    {
      "epoch": 3.31031190324634,
      "grad_norm": 0.40724540372325163,
      "learning_rate": 4.1223673220481086e-05,
      "loss": 1.2849,
      "num_input_tokens_seen": 24549458144,
      "step": 31203
    },
    {
      "epoch": 3.3104179927859114,
      "grad_norm": 0.4657812296847538,
      "learning_rate": 4.122314445852971e-05,
      "loss": 1.5016,
      "num_input_tokens_seen": 24550244976,
      "step": 31204
    },
    {
      "epoch": 3.310524082325483,
      "grad_norm": 0.5593626397608099,
      "learning_rate": 4.122261568404154e-05,
      "loss": 1.5275,
      "num_input_tokens_seen": 24551031712,
      "step": 31205
    },
    {
      "epoch": 3.310630171865054,
      "grad_norm": 0.46700986994999183,
      "learning_rate": 4.1222086897017034e-05,
      "loss": 1.5896,
      "num_input_tokens_seen": 24551818448,
      "step": 31206
    },
    {
      "epoch": 3.3107362614046254,
      "grad_norm": 0.46140959811247134,
      "learning_rate": 4.122155809745656e-05,
      "loss": 1.355,
      "num_input_tokens_seen": 24552605328,
      "step": 31207
    },
    {
      "epoch": 3.310842350944197,
      "grad_norm": 0.4436559142640931,
      "learning_rate": 4.1221029285360545e-05,
      "loss": 1.4263,
      "num_input_tokens_seen": 24553392192,
      "step": 31208
    },
    {
      "epoch": 3.3109484404837684,
      "grad_norm": 0.41758569246516075,
      "learning_rate": 4.122050046072939e-05,
      "loss": 1.5066,
      "num_input_tokens_seen": 24554178848,
      "step": 31209
    },
    {
      "epoch": 3.31105453002334,
      "grad_norm": 0.5527133635122141,
      "learning_rate": 4.121997162356353e-05,
      "loss": 1.5474,
      "num_input_tokens_seen": 24554965520,
      "step": 31210
    },
    {
      "epoch": 3.3111606195629113,
      "grad_norm": 0.44809449520047095,
      "learning_rate": 4.121944277386332e-05,
      "loss": 1.4979,
      "num_input_tokens_seen": 24555752288,
      "step": 31211
    },
    {
      "epoch": 3.3112667091024823,
      "grad_norm": 0.5137634166043683,
      "learning_rate": 4.1218913911629226e-05,
      "loss": 1.4806,
      "num_input_tokens_seen": 24556539040,
      "step": 31212
    },
    {
      "epoch": 3.311372798642054,
      "grad_norm": 0.4530644630699771,
      "learning_rate": 4.121838503686162e-05,
      "loss": 1.3364,
      "num_input_tokens_seen": 24557325840,
      "step": 31213
    },
    {
      "epoch": 3.3114788881816253,
      "grad_norm": 0.43205566505913745,
      "learning_rate": 4.121785614956093e-05,
      "loss": 1.4262,
      "num_input_tokens_seen": 24558112608,
      "step": 31214
    },
    {
      "epoch": 3.3115849777211968,
      "grad_norm": 0.5103067657880946,
      "learning_rate": 4.121732724972754e-05,
      "loss": 1.4537,
      "num_input_tokens_seen": 24558899360,
      "step": 31215
    },
    {
      "epoch": 3.3116910672607682,
      "grad_norm": 0.5206820855232561,
      "learning_rate": 4.121679833736189e-05,
      "loss": 1.2878,
      "num_input_tokens_seen": 24559686160,
      "step": 31216
    },
    {
      "epoch": 3.3117971568003393,
      "grad_norm": 0.4480351298829235,
      "learning_rate": 4.121626941246437e-05,
      "loss": 1.3374,
      "num_input_tokens_seen": 24560473008,
      "step": 31217
    },
    {
      "epoch": 3.3119032463399107,
      "grad_norm": 0.5575081924631192,
      "learning_rate": 4.121574047503539e-05,
      "loss": 1.4412,
      "num_input_tokens_seen": 24561259792,
      "step": 31218
    },
    {
      "epoch": 3.312009335879482,
      "grad_norm": 0.4823859246218616,
      "learning_rate": 4.121521152507537e-05,
      "loss": 1.5007,
      "num_input_tokens_seen": 24562046496,
      "step": 31219
    },
    {
      "epoch": 3.3121154254190537,
      "grad_norm": 0.56072715129064,
      "learning_rate": 4.12146825625847e-05,
      "loss": 1.4928,
      "num_input_tokens_seen": 24562833232,
      "step": 31220
    },
    {
      "epoch": 3.312221514958625,
      "grad_norm": 0.47112253448852554,
      "learning_rate": 4.121415358756381e-05,
      "loss": 1.548,
      "num_input_tokens_seen": 24563620000,
      "step": 31221
    },
    {
      "epoch": 3.3123276044981966,
      "grad_norm": 0.4322288912631199,
      "learning_rate": 4.121362460001309e-05,
      "loss": 1.4232,
      "num_input_tokens_seen": 24564406784,
      "step": 31222
    },
    {
      "epoch": 3.312433694037768,
      "grad_norm": 0.4145160662630209,
      "learning_rate": 4.121309559993295e-05,
      "loss": 1.4642,
      "num_input_tokens_seen": 24565193568,
      "step": 31223
    },
    {
      "epoch": 3.312539783577339,
      "grad_norm": 0.46997834754812784,
      "learning_rate": 4.121256658732382e-05,
      "loss": 1.492,
      "num_input_tokens_seen": 24565980272,
      "step": 31224
    },
    {
      "epoch": 3.3126458731169106,
      "grad_norm": 0.44729768799862046,
      "learning_rate": 4.121203756218609e-05,
      "loss": 1.4761,
      "num_input_tokens_seen": 24566767072,
      "step": 31225
    },
    {
      "epoch": 3.312751962656482,
      "grad_norm": 0.38261229100816324,
      "learning_rate": 4.121150852452017e-05,
      "loss": 1.369,
      "num_input_tokens_seen": 24567553824,
      "step": 31226
    },
    {
      "epoch": 3.3128580521960536,
      "grad_norm": 0.4329375487460417,
      "learning_rate": 4.1210979474326475e-05,
      "loss": 1.4054,
      "num_input_tokens_seen": 24568340576,
      "step": 31227
    },
    {
      "epoch": 3.312964141735625,
      "grad_norm": 0.3700097395998998,
      "learning_rate": 4.1210450411605406e-05,
      "loss": 1.4215,
      "num_input_tokens_seen": 24569127424,
      "step": 31228
    },
    {
      "epoch": 3.313070231275196,
      "grad_norm": 0.4590544873915313,
      "learning_rate": 4.120992133635738e-05,
      "loss": 1.3447,
      "num_input_tokens_seen": 24569914272,
      "step": 31229
    },
    {
      "epoch": 3.3131763208147675,
      "grad_norm": 0.45463311912474813,
      "learning_rate": 4.1209392248582795e-05,
      "loss": 1.454,
      "num_input_tokens_seen": 24570701072,
      "step": 31230
    },
    {
      "epoch": 3.313282410354339,
      "grad_norm": 0.4432891336070556,
      "learning_rate": 4.120886314828207e-05,
      "loss": 1.4741,
      "num_input_tokens_seen": 24571487808,
      "step": 31231
    },
    {
      "epoch": 3.3133884998939105,
      "grad_norm": 0.4187864510835168,
      "learning_rate": 4.120833403545562e-05,
      "loss": 1.4878,
      "num_input_tokens_seen": 24572274576,
      "step": 31232
    },
    {
      "epoch": 3.313494589433482,
      "grad_norm": 0.4771103950969078,
      "learning_rate": 4.120780491010384e-05,
      "loss": 1.6536,
      "num_input_tokens_seen": 24573061296,
      "step": 31233
    },
    {
      "epoch": 3.3136006789730534,
      "grad_norm": 0.42445639779403443,
      "learning_rate": 4.120727577222714e-05,
      "loss": 1.5054,
      "num_input_tokens_seen": 24573848016,
      "step": 31234
    },
    {
      "epoch": 3.3137067685126245,
      "grad_norm": 0.3659579941271703,
      "learning_rate": 4.1206746621825934e-05,
      "loss": 1.4093,
      "num_input_tokens_seen": 24574634832,
      "step": 31235
    },
    {
      "epoch": 3.313812858052196,
      "grad_norm": 0.4639916994268334,
      "learning_rate": 4.1206217458900636e-05,
      "loss": 1.5636,
      "num_input_tokens_seen": 24575421552,
      "step": 31236
    },
    {
      "epoch": 3.3139189475917674,
      "grad_norm": 0.37038554197167867,
      "learning_rate": 4.1205688283451646e-05,
      "loss": 1.3181,
      "num_input_tokens_seen": 24576208400,
      "step": 31237
    },
    {
      "epoch": 3.314025037131339,
      "grad_norm": 0.7045715910989434,
      "learning_rate": 4.1205159095479374e-05,
      "loss": 1.5887,
      "num_input_tokens_seen": 24576995104,
      "step": 31238
    },
    {
      "epoch": 3.3141311266709104,
      "grad_norm": 0.4263688031110484,
      "learning_rate": 4.120462989498423e-05,
      "loss": 1.3995,
      "num_input_tokens_seen": 24577781936,
      "step": 31239
    },
    {
      "epoch": 3.314237216210482,
      "grad_norm": 0.5360620088402638,
      "learning_rate": 4.120410068196663e-05,
      "loss": 1.5137,
      "num_input_tokens_seen": 24578568784,
      "step": 31240
    },
    {
      "epoch": 3.314343305750053,
      "grad_norm": 0.40926854263022805,
      "learning_rate": 4.120357145642697e-05,
      "loss": 1.4459,
      "num_input_tokens_seen": 24579355568,
      "step": 31241
    },
    {
      "epoch": 3.3144493952896243,
      "grad_norm": 0.43563171532014844,
      "learning_rate": 4.120304221836566e-05,
      "loss": 1.549,
      "num_input_tokens_seen": 24580142320,
      "step": 31242
    },
    {
      "epoch": 3.314555484829196,
      "grad_norm": 0.45374831209151606,
      "learning_rate": 4.120251296778312e-05,
      "loss": 1.4072,
      "num_input_tokens_seen": 24580929104,
      "step": 31243
    },
    {
      "epoch": 3.3146615743687673,
      "grad_norm": 0.42756673795847217,
      "learning_rate": 4.120198370467976e-05,
      "loss": 1.4679,
      "num_input_tokens_seen": 24581715792,
      "step": 31244
    },
    {
      "epoch": 3.3147676639083388,
      "grad_norm": 0.4399568330332088,
      "learning_rate": 4.120145442905598e-05,
      "loss": 1.3942,
      "num_input_tokens_seen": 24582502592,
      "step": 31245
    },
    {
      "epoch": 3.31487375344791,
      "grad_norm": 0.48809457096657227,
      "learning_rate": 4.1200925140912187e-05,
      "loss": 1.4212,
      "num_input_tokens_seen": 24583289408,
      "step": 31246
    },
    {
      "epoch": 3.3149798429874813,
      "grad_norm": 0.48187607664034127,
      "learning_rate": 4.1200395840248795e-05,
      "loss": 1.4261,
      "num_input_tokens_seen": 24584076112,
      "step": 31247
    },
    {
      "epoch": 3.3150859325270527,
      "grad_norm": 0.675808901979411,
      "learning_rate": 4.119986652706621e-05,
      "loss": 1.4999,
      "num_input_tokens_seen": 24584862912,
      "step": 31248
    },
    {
      "epoch": 3.3151920220666242,
      "grad_norm": 0.48983374094020254,
      "learning_rate": 4.119933720136484e-05,
      "loss": 1.519,
      "num_input_tokens_seen": 24585649744,
      "step": 31249
    },
    {
      "epoch": 3.3152981116061957,
      "grad_norm": 0.5684917819513164,
      "learning_rate": 4.119880786314511e-05,
      "loss": 1.4432,
      "num_input_tokens_seen": 24586436512,
      "step": 31250
    },
    {
      "epoch": 3.315404201145767,
      "grad_norm": 0.476644615749681,
      "learning_rate": 4.1198278512407406e-05,
      "loss": 1.5598,
      "num_input_tokens_seen": 24587223248,
      "step": 31251
    },
    {
      "epoch": 3.3155102906853386,
      "grad_norm": 0.5719851860964676,
      "learning_rate": 4.1197749149152156e-05,
      "loss": 1.5509,
      "num_input_tokens_seen": 24588009808,
      "step": 31252
    },
    {
      "epoch": 3.3156163802249097,
      "grad_norm": 0.44325090816764606,
      "learning_rate": 4.119721977337976e-05,
      "loss": 1.5202,
      "num_input_tokens_seen": 24588796624,
      "step": 31253
    },
    {
      "epoch": 3.315722469764481,
      "grad_norm": 0.5804660853574884,
      "learning_rate": 4.119669038509062e-05,
      "loss": 1.5109,
      "num_input_tokens_seen": 24589583344,
      "step": 31254
    },
    {
      "epoch": 3.3158285593040526,
      "grad_norm": 0.44188210671043804,
      "learning_rate": 4.119616098428516e-05,
      "loss": 1.4049,
      "num_input_tokens_seen": 24590370128,
      "step": 31255
    },
    {
      "epoch": 3.315934648843624,
      "grad_norm": 0.6272312480733183,
      "learning_rate": 4.1195631570963775e-05,
      "loss": 1.3884,
      "num_input_tokens_seen": 24591156960,
      "step": 31256
    },
    {
      "epoch": 3.3160407383831956,
      "grad_norm": 0.4010926597653032,
      "learning_rate": 4.119510214512689e-05,
      "loss": 1.4035,
      "num_input_tokens_seen": 24591943712,
      "step": 31257
    },
    {
      "epoch": 3.3161468279227666,
      "grad_norm": 0.5013154299816357,
      "learning_rate": 4.1194572706774907e-05,
      "loss": 1.4578,
      "num_input_tokens_seen": 24592730432,
      "step": 31258
    },
    {
      "epoch": 3.316252917462338,
      "grad_norm": 0.469310921187421,
      "learning_rate": 4.119404325590822e-05,
      "loss": 1.5747,
      "num_input_tokens_seen": 24593517200,
      "step": 31259
    },
    {
      "epoch": 3.3163590070019096,
      "grad_norm": 0.4315316752669925,
      "learning_rate": 4.119351379252726e-05,
      "loss": 1.4086,
      "num_input_tokens_seen": 24594303968,
      "step": 31260
    },
    {
      "epoch": 3.316465096541481,
      "grad_norm": 0.5527103669169467,
      "learning_rate": 4.119298431663243e-05,
      "loss": 1.5263,
      "num_input_tokens_seen": 24595090784,
      "step": 31261
    },
    {
      "epoch": 3.3165711860810525,
      "grad_norm": 0.4581438238796008,
      "learning_rate": 4.119245482822413e-05,
      "loss": 1.5269,
      "num_input_tokens_seen": 24595877584,
      "step": 31262
    },
    {
      "epoch": 3.316677275620624,
      "grad_norm": 0.5086717665033273,
      "learning_rate": 4.119192532730278e-05,
      "loss": 1.4507,
      "num_input_tokens_seen": 24596664272,
      "step": 31263
    },
    {
      "epoch": 3.3167833651601955,
      "grad_norm": 0.41014846614855943,
      "learning_rate": 4.119139581386878e-05,
      "loss": 1.3194,
      "num_input_tokens_seen": 24597451040,
      "step": 31264
    },
    {
      "epoch": 3.3168894546997665,
      "grad_norm": 0.5061084433696514,
      "learning_rate": 4.119086628792256e-05,
      "loss": 1.4732,
      "num_input_tokens_seen": 24598237872,
      "step": 31265
    },
    {
      "epoch": 3.316995544239338,
      "grad_norm": 0.43791289906443037,
      "learning_rate": 4.11903367494645e-05,
      "loss": 1.319,
      "num_input_tokens_seen": 24599024576,
      "step": 31266
    },
    {
      "epoch": 3.3171016337789094,
      "grad_norm": 0.5120150154270499,
      "learning_rate": 4.1189807198495025e-05,
      "loss": 1.5769,
      "num_input_tokens_seen": 24599811312,
      "step": 31267
    },
    {
      "epoch": 3.317207723318481,
      "grad_norm": 0.42554761536595326,
      "learning_rate": 4.118927763501454e-05,
      "loss": 1.5185,
      "num_input_tokens_seen": 24600598064,
      "step": 31268
    },
    {
      "epoch": 3.3173138128580524,
      "grad_norm": 0.5832170337421542,
      "learning_rate": 4.118874805902346e-05,
      "loss": 1.5622,
      "num_input_tokens_seen": 24601384912,
      "step": 31269
    },
    {
      "epoch": 3.3174199023976234,
      "grad_norm": 0.4524348964089151,
      "learning_rate": 4.118821847052219e-05,
      "loss": 1.4515,
      "num_input_tokens_seen": 24602171680,
      "step": 31270
    },
    {
      "epoch": 3.317525991937195,
      "grad_norm": 0.4735830042335873,
      "learning_rate": 4.1187688869511134e-05,
      "loss": 1.4569,
      "num_input_tokens_seen": 24602958560,
      "step": 31271
    },
    {
      "epoch": 3.3176320814767664,
      "grad_norm": 0.6145190891395421,
      "learning_rate": 4.1187159255990716e-05,
      "loss": 1.4367,
      "num_input_tokens_seen": 24603745360,
      "step": 31272
    },
    {
      "epoch": 3.317738171016338,
      "grad_norm": 0.43999522762801646,
      "learning_rate": 4.118662962996133e-05,
      "loss": 1.5127,
      "num_input_tokens_seen": 24604532080,
      "step": 31273
    },
    {
      "epoch": 3.3178442605559093,
      "grad_norm": 0.6076752242003212,
      "learning_rate": 4.11860999914234e-05,
      "loss": 1.4295,
      "num_input_tokens_seen": 24605318848,
      "step": 31274
    },
    {
      "epoch": 3.3179503500954803,
      "grad_norm": 0.46467818612540185,
      "learning_rate": 4.1185570340377315e-05,
      "loss": 1.4719,
      "num_input_tokens_seen": 24606105648,
      "step": 31275
    },
    {
      "epoch": 3.318056439635052,
      "grad_norm": 0.6091083748194637,
      "learning_rate": 4.118504067682351e-05,
      "loss": 1.4116,
      "num_input_tokens_seen": 24606892432,
      "step": 31276
    },
    {
      "epoch": 3.3181625291746233,
      "grad_norm": 0.6026060168804638,
      "learning_rate": 4.118451100076237e-05,
      "loss": 1.465,
      "num_input_tokens_seen": 24607679248,
      "step": 31277
    },
    {
      "epoch": 3.3182686187141948,
      "grad_norm": 0.47854967826751166,
      "learning_rate": 4.1183981312194313e-05,
      "loss": 1.4697,
      "num_input_tokens_seen": 24608466048,
      "step": 31278
    },
    {
      "epoch": 3.3183747082537662,
      "grad_norm": 0.607456286009134,
      "learning_rate": 4.118345161111975e-05,
      "loss": 1.5242,
      "num_input_tokens_seen": 24609252816,
      "step": 31279
    },
    {
      "epoch": 3.3184807977933377,
      "grad_norm": 0.42116897285212723,
      "learning_rate": 4.1182921897539095e-05,
      "loss": 1.552,
      "num_input_tokens_seen": 24610039568,
      "step": 31280
    },
    {
      "epoch": 3.318586887332909,
      "grad_norm": 0.5286485151688669,
      "learning_rate": 4.1182392171452755e-05,
      "loss": 1.4321,
      "num_input_tokens_seen": 24610826384,
      "step": 31281
    },
    {
      "epoch": 3.31869297687248,
      "grad_norm": 0.5164728542026926,
      "learning_rate": 4.1181862432861126e-05,
      "loss": 1.5671,
      "num_input_tokens_seen": 24611613184,
      "step": 31282
    },
    {
      "epoch": 3.3187990664120517,
      "grad_norm": 0.4868781627819965,
      "learning_rate": 4.118133268176465e-05,
      "loss": 1.3891,
      "num_input_tokens_seen": 24612400000,
      "step": 31283
    },
    {
      "epoch": 3.318905155951623,
      "grad_norm": 0.668922990180109,
      "learning_rate": 4.1180802918163694e-05,
      "loss": 1.5667,
      "num_input_tokens_seen": 24613186800,
      "step": 31284
    },
    {
      "epoch": 3.3190112454911946,
      "grad_norm": 0.43717808607415876,
      "learning_rate": 4.11802731420587e-05,
      "loss": 1.4492,
      "num_input_tokens_seen": 24613973664,
      "step": 31285
    },
    {
      "epoch": 3.319117335030766,
      "grad_norm": 0.5412823929773728,
      "learning_rate": 4.117974335345006e-05,
      "loss": 1.536,
      "num_input_tokens_seen": 24614760480,
      "step": 31286
    },
    {
      "epoch": 3.319223424570337,
      "grad_norm": 0.4818384199884777,
      "learning_rate": 4.1179213552338194e-05,
      "loss": 1.5145,
      "num_input_tokens_seen": 24615547312,
      "step": 31287
    },
    {
      "epoch": 3.3193295141099086,
      "grad_norm": 0.43108622012429754,
      "learning_rate": 4.11786837387235e-05,
      "loss": 1.4392,
      "num_input_tokens_seen": 24616334080,
      "step": 31288
    },
    {
      "epoch": 3.31943560364948,
      "grad_norm": 0.5142308773035529,
      "learning_rate": 4.11781539126064e-05,
      "loss": 1.3478,
      "num_input_tokens_seen": 24617120912,
      "step": 31289
    },
    {
      "epoch": 3.3195416931890516,
      "grad_norm": 0.4950545284018753,
      "learning_rate": 4.11776240739873e-05,
      "loss": 1.6156,
      "num_input_tokens_seen": 24617907616,
      "step": 31290
    },
    {
      "epoch": 3.319647782728623,
      "grad_norm": 0.5576193923732903,
      "learning_rate": 4.11770942228666e-05,
      "loss": 1.5334,
      "num_input_tokens_seen": 24618694384,
      "step": 31291
    },
    {
      "epoch": 3.3197538722681945,
      "grad_norm": 0.45571675174089427,
      "learning_rate": 4.1176564359244714e-05,
      "loss": 1.4821,
      "num_input_tokens_seen": 24619481120,
      "step": 31292
    },
    {
      "epoch": 3.319859961807766,
      "grad_norm": 0.4971487180100006,
      "learning_rate": 4.117603448312206e-05,
      "loss": 1.464,
      "num_input_tokens_seen": 24620267920,
      "step": 31293
    },
    {
      "epoch": 3.319966051347337,
      "grad_norm": 0.37509282671235283,
      "learning_rate": 4.1175504594499036e-05,
      "loss": 1.4386,
      "num_input_tokens_seen": 24621054720,
      "step": 31294
    },
    {
      "epoch": 3.3200721408869085,
      "grad_norm": 0.41008837757898053,
      "learning_rate": 4.1174974693376055e-05,
      "loss": 1.3851,
      "num_input_tokens_seen": 24621841568,
      "step": 31295
    },
    {
      "epoch": 3.32017823042648,
      "grad_norm": 0.39391091034229386,
      "learning_rate": 4.117444477975354e-05,
      "loss": 1.3562,
      "num_input_tokens_seen": 24622628384,
      "step": 31296
    },
    {
      "epoch": 3.3202843199660514,
      "grad_norm": 0.39971836557467016,
      "learning_rate": 4.1173914853631877e-05,
      "loss": 1.3208,
      "num_input_tokens_seen": 24623415104,
      "step": 31297
    },
    {
      "epoch": 3.320390409505623,
      "grad_norm": 0.4389053828568949,
      "learning_rate": 4.117338491501149e-05,
      "loss": 1.5054,
      "num_input_tokens_seen": 24624201792,
      "step": 31298
    },
    {
      "epoch": 3.320496499045194,
      "grad_norm": 0.4463336302280447,
      "learning_rate": 4.117285496389279e-05,
      "loss": 1.4807,
      "num_input_tokens_seen": 24624988464,
      "step": 31299
    },
    {
      "epoch": 3.3206025885847654,
      "grad_norm": 0.403372278368815,
      "learning_rate": 4.117232500027618e-05,
      "loss": 1.525,
      "num_input_tokens_seen": 24625775184,
      "step": 31300
    },
    {
      "epoch": 3.320708678124337,
      "grad_norm": 0.4255379132448684,
      "learning_rate": 4.117179502416207e-05,
      "loss": 1.5271,
      "num_input_tokens_seen": 24626561936,
      "step": 31301
    },
    {
      "epoch": 3.3208147676639084,
      "grad_norm": 0.3820038650132481,
      "learning_rate": 4.1171265035550875e-05,
      "loss": 1.4877,
      "num_input_tokens_seen": 24627348752,
      "step": 31302
    },
    {
      "epoch": 3.32092085720348,
      "grad_norm": 0.43802337569076033,
      "learning_rate": 4.1170735034443e-05,
      "loss": 1.4497,
      "num_input_tokens_seen": 24628135616,
      "step": 31303
    },
    {
      "epoch": 3.3210269467430513,
      "grad_norm": 0.4386527600037254,
      "learning_rate": 4.1170205020838855e-05,
      "loss": 1.455,
      "num_input_tokens_seen": 24628922464,
      "step": 31304
    },
    {
      "epoch": 3.3211330362826224,
      "grad_norm": 0.4327661185309156,
      "learning_rate": 4.1169674994738846e-05,
      "loss": 1.4214,
      "num_input_tokens_seen": 24629709264,
      "step": 31305
    },
    {
      "epoch": 3.321239125822194,
      "grad_norm": 0.42805573194936875,
      "learning_rate": 4.1169144956143394e-05,
      "loss": 1.5128,
      "num_input_tokens_seen": 24630495984,
      "step": 31306
    },
    {
      "epoch": 3.3213452153617653,
      "grad_norm": 0.5812604455824394,
      "learning_rate": 4.116861490505289e-05,
      "loss": 1.3968,
      "num_input_tokens_seen": 24631282816,
      "step": 31307
    },
    {
      "epoch": 3.3214513049013368,
      "grad_norm": 0.5313888301700587,
      "learning_rate": 4.1168084841467764e-05,
      "loss": 1.5053,
      "num_input_tokens_seen": 24632069520,
      "step": 31308
    },
    {
      "epoch": 3.3215573944409083,
      "grad_norm": 0.4477558036726174,
      "learning_rate": 4.116755476538841e-05,
      "loss": 1.499,
      "num_input_tokens_seen": 24632856416,
      "step": 31309
    },
    {
      "epoch": 3.3216634839804797,
      "grad_norm": 0.3806942591064448,
      "learning_rate": 4.116702467681525e-05,
      "loss": 1.3554,
      "num_input_tokens_seen": 24633643152,
      "step": 31310
    },
    {
      "epoch": 3.3217695735200508,
      "grad_norm": 0.6803628028770924,
      "learning_rate": 4.116649457574869e-05,
      "loss": 1.4891,
      "num_input_tokens_seen": 24634429904,
      "step": 31311
    },
    {
      "epoch": 3.3218756630596222,
      "grad_norm": 0.4359745969149315,
      "learning_rate": 4.116596446218913e-05,
      "loss": 1.374,
      "num_input_tokens_seen": 24635216752,
      "step": 31312
    },
    {
      "epoch": 3.3219817525991937,
      "grad_norm": 1.609978712133678,
      "learning_rate": 4.1165434336136985e-05,
      "loss": 1.3383,
      "num_input_tokens_seen": 24636003568,
      "step": 31313
    },
    {
      "epoch": 3.322087842138765,
      "grad_norm": 0.7381272459810485,
      "learning_rate": 4.116490419759268e-05,
      "loss": 1.4177,
      "num_input_tokens_seen": 24636790352,
      "step": 31314
    },
    {
      "epoch": 3.3221939316783367,
      "grad_norm": 0.9258051660667133,
      "learning_rate": 4.11643740465566e-05,
      "loss": 1.5196,
      "num_input_tokens_seen": 24637577072,
      "step": 31315
    },
    {
      "epoch": 3.3223000212179077,
      "grad_norm": 0.5551756927154677,
      "learning_rate": 4.116384388302917e-05,
      "loss": 1.4955,
      "num_input_tokens_seen": 24638363808,
      "step": 31316
    },
    {
      "epoch": 3.322406110757479,
      "grad_norm": 0.7690064618188508,
      "learning_rate": 4.11633137070108e-05,
      "loss": 1.5534,
      "num_input_tokens_seen": 24639150576,
      "step": 31317
    },
    {
      "epoch": 3.3225122002970506,
      "grad_norm": 0.5953012271573708,
      "learning_rate": 4.1162783518501886e-05,
      "loss": 1.4623,
      "num_input_tokens_seen": 24639937360,
      "step": 31318
    },
    {
      "epoch": 3.322618289836622,
      "grad_norm": 0.5388340170152714,
      "learning_rate": 4.1162253317502855e-05,
      "loss": 1.5432,
      "num_input_tokens_seen": 24640724032,
      "step": 31319
    },
    {
      "epoch": 3.3227243793761936,
      "grad_norm": 0.5315716434024789,
      "learning_rate": 4.11617231040141e-05,
      "loss": 1.3946,
      "num_input_tokens_seen": 24641510816,
      "step": 31320
    },
    {
      "epoch": 3.322830468915765,
      "grad_norm": 0.7075689208862119,
      "learning_rate": 4.116119287803605e-05,
      "loss": 1.4951,
      "num_input_tokens_seen": 24642297616,
      "step": 31321
    },
    {
      "epoch": 3.3229365584553365,
      "grad_norm": 0.3740852037330369,
      "learning_rate": 4.116066263956909e-05,
      "loss": 1.4011,
      "num_input_tokens_seen": 24643084448,
      "step": 31322
    },
    {
      "epoch": 3.3230426479949076,
      "grad_norm": 0.4715653447210006,
      "learning_rate": 4.116013238861366e-05,
      "loss": 1.3864,
      "num_input_tokens_seen": 24643871168,
      "step": 31323
    },
    {
      "epoch": 3.323148737534479,
      "grad_norm": 0.559580545341049,
      "learning_rate": 4.115960212517014e-05,
      "loss": 1.5469,
      "num_input_tokens_seen": 24644658000,
      "step": 31324
    },
    {
      "epoch": 3.3232548270740505,
      "grad_norm": 0.4143831762580135,
      "learning_rate": 4.1159071849238964e-05,
      "loss": 1.4148,
      "num_input_tokens_seen": 24645444832,
      "step": 31325
    },
    {
      "epoch": 3.323360916613622,
      "grad_norm": 0.5287295670579492,
      "learning_rate": 4.115854156082053e-05,
      "loss": 1.4765,
      "num_input_tokens_seen": 24646231584,
      "step": 31326
    },
    {
      "epoch": 3.3234670061531935,
      "grad_norm": 0.51559159217855,
      "learning_rate": 4.115801125991524e-05,
      "loss": 1.5107,
      "num_input_tokens_seen": 24647018368,
      "step": 31327
    },
    {
      "epoch": 3.3235730956927645,
      "grad_norm": 0.49616144134495294,
      "learning_rate": 4.115748094652352e-05,
      "loss": 1.4855,
      "num_input_tokens_seen": 24647805200,
      "step": 31328
    },
    {
      "epoch": 3.323679185232336,
      "grad_norm": 0.48896124374325484,
      "learning_rate": 4.1156950620645776e-05,
      "loss": 1.5035,
      "num_input_tokens_seen": 24648591952,
      "step": 31329
    },
    {
      "epoch": 3.3237852747719074,
      "grad_norm": 0.6904413787656248,
      "learning_rate": 4.1156420282282416e-05,
      "loss": 1.4783,
      "num_input_tokens_seen": 24649378640,
      "step": 31330
    },
    {
      "epoch": 3.323891364311479,
      "grad_norm": 0.4392130123914094,
      "learning_rate": 4.1155889931433844e-05,
      "loss": 1.5725,
      "num_input_tokens_seen": 24650165328,
      "step": 31331
    },
    {
      "epoch": 3.3239974538510504,
      "grad_norm": 0.5502115341746137,
      "learning_rate": 4.115535956810047e-05,
      "loss": 1.4874,
      "num_input_tokens_seen": 24650952048,
      "step": 31332
    },
    {
      "epoch": 3.324103543390622,
      "grad_norm": 0.47623676037706314,
      "learning_rate": 4.115482919228272e-05,
      "loss": 1.3966,
      "num_input_tokens_seen": 24651738688,
      "step": 31333
    },
    {
      "epoch": 3.324209632930193,
      "grad_norm": 0.4514015999241708,
      "learning_rate": 4.115429880398098e-05,
      "loss": 1.5072,
      "num_input_tokens_seen": 24652525488,
      "step": 31334
    },
    {
      "epoch": 3.3243157224697644,
      "grad_norm": 0.4972300105771763,
      "learning_rate": 4.115376840319568e-05,
      "loss": 1.3479,
      "num_input_tokens_seen": 24653312224,
      "step": 31335
    },
    {
      "epoch": 3.324421812009336,
      "grad_norm": 0.4311296098397507,
      "learning_rate": 4.115323798992722e-05,
      "loss": 1.5149,
      "num_input_tokens_seen": 24654098992,
      "step": 31336
    },
    {
      "epoch": 3.3245279015489073,
      "grad_norm": 0.6173096630419885,
      "learning_rate": 4.115270756417601e-05,
      "loss": 1.3747,
      "num_input_tokens_seen": 24654885696,
      "step": 31337
    },
    {
      "epoch": 3.324633991088479,
      "grad_norm": 0.4689419901734195,
      "learning_rate": 4.1152177125942455e-05,
      "loss": 1.4777,
      "num_input_tokens_seen": 24655672432,
      "step": 31338
    },
    {
      "epoch": 3.3247400806280503,
      "grad_norm": 0.47593259610214067,
      "learning_rate": 4.115164667522698e-05,
      "loss": 1.635,
      "num_input_tokens_seen": 24656459168,
      "step": 31339
    },
    {
      "epoch": 3.3248461701676213,
      "grad_norm": 0.41754728896130344,
      "learning_rate": 4.115111621202998e-05,
      "loss": 1.4173,
      "num_input_tokens_seen": 24657245920,
      "step": 31340
    },
    {
      "epoch": 3.3249522597071928,
      "grad_norm": 0.3513779173200669,
      "learning_rate": 4.1150585736351875e-05,
      "loss": 1.2366,
      "num_input_tokens_seen": 24658032736,
      "step": 31341
    },
    {
      "epoch": 3.3250583492467642,
      "grad_norm": 0.4015259400607391,
      "learning_rate": 4.1150055248193076e-05,
      "loss": 1.3436,
      "num_input_tokens_seen": 24658819504,
      "step": 31342
    },
    {
      "epoch": 3.3251644387863357,
      "grad_norm": 0.4012248975123812,
      "learning_rate": 4.114952474755398e-05,
      "loss": 1.3413,
      "num_input_tokens_seen": 24659606208,
      "step": 31343
    },
    {
      "epoch": 3.325270528325907,
      "grad_norm": 0.43490308092743774,
      "learning_rate": 4.1148994234435015e-05,
      "loss": 1.4602,
      "num_input_tokens_seen": 24660393056,
      "step": 31344
    },
    {
      "epoch": 3.3253766178654782,
      "grad_norm": 0.42932228100181274,
      "learning_rate": 4.1148463708836574e-05,
      "loss": 1.4011,
      "num_input_tokens_seen": 24661179856,
      "step": 31345
    },
    {
      "epoch": 3.3254827074050497,
      "grad_norm": 0.55092338899023,
      "learning_rate": 4.114793317075908e-05,
      "loss": 1.5081,
      "num_input_tokens_seen": 24661966592,
      "step": 31346
    },
    {
      "epoch": 3.325588796944621,
      "grad_norm": 0.42343623267185704,
      "learning_rate": 4.114740262020292e-05,
      "loss": 1.4601,
      "num_input_tokens_seen": 24662753344,
      "step": 31347
    },
    {
      "epoch": 3.3256948864841926,
      "grad_norm": 0.604204650329972,
      "learning_rate": 4.114687205716854e-05,
      "loss": 1.4411,
      "num_input_tokens_seen": 24663540112,
      "step": 31348
    },
    {
      "epoch": 3.325800976023764,
      "grad_norm": 0.4527534132868782,
      "learning_rate": 4.114634148165632e-05,
      "loss": 1.7154,
      "num_input_tokens_seen": 24664326736,
      "step": 31349
    },
    {
      "epoch": 3.3259070655633356,
      "grad_norm": 0.6000991306208417,
      "learning_rate": 4.1145810893666694e-05,
      "loss": 1.4202,
      "num_input_tokens_seen": 24665113488,
      "step": 31350
    },
    {
      "epoch": 3.326013155102907,
      "grad_norm": 0.45276037511195805,
      "learning_rate": 4.114528029320005e-05,
      "loss": 1.3294,
      "num_input_tokens_seen": 24665900272,
      "step": 31351
    },
    {
      "epoch": 3.326119244642478,
      "grad_norm": 0.3452012928714454,
      "learning_rate": 4.11447496802568e-05,
      "loss": 1.2868,
      "num_input_tokens_seen": 24666687120,
      "step": 31352
    },
    {
      "epoch": 3.3262253341820496,
      "grad_norm": 0.7092164437337131,
      "learning_rate": 4.114421905483738e-05,
      "loss": 1.4766,
      "num_input_tokens_seen": 24667473840,
      "step": 31353
    },
    {
      "epoch": 3.326331423721621,
      "grad_norm": 0.41506022230653106,
      "learning_rate": 4.114368841694216e-05,
      "loss": 1.4338,
      "num_input_tokens_seen": 24668260672,
      "step": 31354
    },
    {
      "epoch": 3.3264375132611925,
      "grad_norm": 0.6619901090628795,
      "learning_rate": 4.1143157766571585e-05,
      "loss": 1.5598,
      "num_input_tokens_seen": 24669047376,
      "step": 31355
    },
    {
      "epoch": 3.326543602800764,
      "grad_norm": 0.5353210804510428,
      "learning_rate": 4.114262710372605e-05,
      "loss": 1.4494,
      "num_input_tokens_seen": 24669834160,
      "step": 31356
    },
    {
      "epoch": 3.326649692340335,
      "grad_norm": 0.5685838925760863,
      "learning_rate": 4.1142096428405964e-05,
      "loss": 1.4109,
      "num_input_tokens_seen": 24670620912,
      "step": 31357
    },
    {
      "epoch": 3.3267557818799065,
      "grad_norm": 0.5677701404842445,
      "learning_rate": 4.114156574061174e-05,
      "loss": 1.4387,
      "num_input_tokens_seen": 24671407728,
      "step": 31358
    },
    {
      "epoch": 3.326861871419478,
      "grad_norm": 0.45252771110680967,
      "learning_rate": 4.114103504034379e-05,
      "loss": 1.3787,
      "num_input_tokens_seen": 24672194560,
      "step": 31359
    },
    {
      "epoch": 3.3269679609590495,
      "grad_norm": 0.557172173387865,
      "learning_rate": 4.1140504327602516e-05,
      "loss": 1.5008,
      "num_input_tokens_seen": 24672981376,
      "step": 31360
    },
    {
      "epoch": 3.327074050498621,
      "grad_norm": 0.4156068596913284,
      "learning_rate": 4.113997360238834e-05,
      "loss": 1.4909,
      "num_input_tokens_seen": 24673768160,
      "step": 31361
    },
    {
      "epoch": 3.3271801400381924,
      "grad_norm": 0.47319405678124593,
      "learning_rate": 4.113944286470166e-05,
      "loss": 1.4388,
      "num_input_tokens_seen": 24674554912,
      "step": 31362
    },
    {
      "epoch": 3.327286229577764,
      "grad_norm": 0.446149552841388,
      "learning_rate": 4.1138912114542896e-05,
      "loss": 1.4515,
      "num_input_tokens_seen": 24675341680,
      "step": 31363
    },
    {
      "epoch": 3.327392319117335,
      "grad_norm": 0.41628645817140314,
      "learning_rate": 4.113838135191245e-05,
      "loss": 1.4603,
      "num_input_tokens_seen": 24676128496,
      "step": 31364
    },
    {
      "epoch": 3.3274984086569064,
      "grad_norm": 0.40888554455159265,
      "learning_rate": 4.113785057681074e-05,
      "loss": 1.3523,
      "num_input_tokens_seen": 24676915248,
      "step": 31365
    },
    {
      "epoch": 3.327604498196478,
      "grad_norm": 0.4898184829722291,
      "learning_rate": 4.113731978923817e-05,
      "loss": 1.4094,
      "num_input_tokens_seen": 24677702016,
      "step": 31366
    },
    {
      "epoch": 3.3277105877360493,
      "grad_norm": 0.4609606348186503,
      "learning_rate": 4.113678898919516e-05,
      "loss": 1.4942,
      "num_input_tokens_seen": 24678488768,
      "step": 31367
    },
    {
      "epoch": 3.327816677275621,
      "grad_norm": 0.5537247707683175,
      "learning_rate": 4.113625817668211e-05,
      "loss": 1.3367,
      "num_input_tokens_seen": 24679275504,
      "step": 31368
    },
    {
      "epoch": 3.327922766815192,
      "grad_norm": 0.4647255555012033,
      "learning_rate": 4.1135727351699424e-05,
      "loss": 1.5003,
      "num_input_tokens_seen": 24680062256,
      "step": 31369
    },
    {
      "epoch": 3.3280288563547633,
      "grad_norm": 0.51544641219624,
      "learning_rate": 4.1135196514247534e-05,
      "loss": 1.4602,
      "num_input_tokens_seen": 24680849088,
      "step": 31370
    },
    {
      "epoch": 3.328134945894335,
      "grad_norm": 0.40653458437492646,
      "learning_rate": 4.113466566432683e-05,
      "loss": 1.3577,
      "num_input_tokens_seen": 24681635936,
      "step": 31371
    },
    {
      "epoch": 3.3282410354339063,
      "grad_norm": 0.4399269025011814,
      "learning_rate": 4.113413480193773e-05,
      "loss": 1.4961,
      "num_input_tokens_seen": 24682422672,
      "step": 31372
    },
    {
      "epoch": 3.3283471249734777,
      "grad_norm": 0.44115354839340615,
      "learning_rate": 4.113360392708065e-05,
      "loss": 1.511,
      "num_input_tokens_seen": 24683209472,
      "step": 31373
    },
    {
      "epoch": 3.328453214513049,
      "grad_norm": 0.3849887247316683,
      "learning_rate": 4.1133073039755986e-05,
      "loss": 1.483,
      "num_input_tokens_seen": 24683996160,
      "step": 31374
    },
    {
      "epoch": 3.3285593040526202,
      "grad_norm": 0.47854218983139424,
      "learning_rate": 4.113254213996416e-05,
      "loss": 1.5122,
      "num_input_tokens_seen": 24684782928,
      "step": 31375
    },
    {
      "epoch": 3.3286653935921917,
      "grad_norm": 0.40760014165145536,
      "learning_rate": 4.113201122770558e-05,
      "loss": 1.4766,
      "num_input_tokens_seen": 24685569712,
      "step": 31376
    },
    {
      "epoch": 3.328771483131763,
      "grad_norm": 0.48037125432980576,
      "learning_rate": 4.113148030298065e-05,
      "loss": 1.4831,
      "num_input_tokens_seen": 24686356384,
      "step": 31377
    },
    {
      "epoch": 3.3288775726713347,
      "grad_norm": 0.3969663369543847,
      "learning_rate": 4.113094936578979e-05,
      "loss": 1.3916,
      "num_input_tokens_seen": 24687143152,
      "step": 31378
    },
    {
      "epoch": 3.328983662210906,
      "grad_norm": 0.518189389410412,
      "learning_rate": 4.113041841613341e-05,
      "loss": 1.4577,
      "num_input_tokens_seen": 24687929856,
      "step": 31379
    },
    {
      "epoch": 3.3290897517504776,
      "grad_norm": 0.5633879476625233,
      "learning_rate": 4.112988745401191e-05,
      "loss": 1.4067,
      "num_input_tokens_seen": 24688716672,
      "step": 31380
    },
    {
      "epoch": 3.3291958412900486,
      "grad_norm": 0.4463561285881811,
      "learning_rate": 4.112935647942571e-05,
      "loss": 1.4462,
      "num_input_tokens_seen": 24689503456,
      "step": 31381
    },
    {
      "epoch": 3.32930193082962,
      "grad_norm": 0.4341027840680239,
      "learning_rate": 4.112882549237521e-05,
      "loss": 1.4349,
      "num_input_tokens_seen": 24690290272,
      "step": 31382
    },
    {
      "epoch": 3.3294080203691916,
      "grad_norm": 0.46334084003618836,
      "learning_rate": 4.112829449286083e-05,
      "loss": 1.4188,
      "num_input_tokens_seen": 24691077008,
      "step": 31383
    },
    {
      "epoch": 3.329514109908763,
      "grad_norm": 0.4511272127565856,
      "learning_rate": 4.112776348088298e-05,
      "loss": 1.4966,
      "num_input_tokens_seen": 24691863808,
      "step": 31384
    },
    {
      "epoch": 3.3296201994483345,
      "grad_norm": 0.44491523114914916,
      "learning_rate": 4.112723245644206e-05,
      "loss": 1.3848,
      "num_input_tokens_seen": 24692650672,
      "step": 31385
    },
    {
      "epoch": 3.3297262889879056,
      "grad_norm": 0.434859909414931,
      "learning_rate": 4.1126701419538505e-05,
      "loss": 1.4743,
      "num_input_tokens_seen": 24693437456,
      "step": 31386
    },
    {
      "epoch": 3.329832378527477,
      "grad_norm": 0.39532058314383817,
      "learning_rate": 4.1126170370172694e-05,
      "loss": 1.4709,
      "num_input_tokens_seen": 24694224192,
      "step": 31387
    },
    {
      "epoch": 3.3299384680670485,
      "grad_norm": 0.4165315701179037,
      "learning_rate": 4.1125639308345056e-05,
      "loss": 1.3695,
      "num_input_tokens_seen": 24695011024,
      "step": 31388
    },
    {
      "epoch": 3.33004455760662,
      "grad_norm": 0.45376024103662044,
      "learning_rate": 4.1125108234056e-05,
      "loss": 1.4128,
      "num_input_tokens_seen": 24695797776,
      "step": 31389
    },
    {
      "epoch": 3.3301506471461915,
      "grad_norm": 0.4650141446493654,
      "learning_rate": 4.112457714730593e-05,
      "loss": 1.5974,
      "num_input_tokens_seen": 24696584496,
      "step": 31390
    },
    {
      "epoch": 3.330256736685763,
      "grad_norm": 0.4069844611739891,
      "learning_rate": 4.1124046048095256e-05,
      "loss": 1.4609,
      "num_input_tokens_seen": 24697371296,
      "step": 31391
    },
    {
      "epoch": 3.3303628262253344,
      "grad_norm": 0.4593595264421443,
      "learning_rate": 4.11235149364244e-05,
      "loss": 1.4765,
      "num_input_tokens_seen": 24698158112,
      "step": 31392
    },
    {
      "epoch": 3.3304689157649054,
      "grad_norm": 0.4517576756832554,
      "learning_rate": 4.112298381229376e-05,
      "loss": 1.5036,
      "num_input_tokens_seen": 24698944928,
      "step": 31393
    },
    {
      "epoch": 3.330575005304477,
      "grad_norm": 0.42468429479021663,
      "learning_rate": 4.112245267570375e-05,
      "loss": 1.518,
      "num_input_tokens_seen": 24699731648,
      "step": 31394
    },
    {
      "epoch": 3.3306810948440484,
      "grad_norm": 0.41336299994108916,
      "learning_rate": 4.1121921526654784e-05,
      "loss": 1.4679,
      "num_input_tokens_seen": 24700518384,
      "step": 31395
    },
    {
      "epoch": 3.33078718438362,
      "grad_norm": 0.42600559264553317,
      "learning_rate": 4.1121390365147266e-05,
      "loss": 1.3293,
      "num_input_tokens_seen": 24701305152,
      "step": 31396
    },
    {
      "epoch": 3.3308932739231913,
      "grad_norm": 0.40244076145149715,
      "learning_rate": 4.1120859191181614e-05,
      "loss": 1.3882,
      "num_input_tokens_seen": 24702091952,
      "step": 31397
    },
    {
      "epoch": 3.3309993634627624,
      "grad_norm": 0.44434693045155693,
      "learning_rate": 4.1120328004758235e-05,
      "loss": 1.3564,
      "num_input_tokens_seen": 24702878848,
      "step": 31398
    },
    {
      "epoch": 3.331105453002334,
      "grad_norm": 0.40471564874431853,
      "learning_rate": 4.111979680587754e-05,
      "loss": 1.4054,
      "num_input_tokens_seen": 24703665568,
      "step": 31399
    },
    {
      "epoch": 3.3312115425419053,
      "grad_norm": 0.4850565454839966,
      "learning_rate": 4.1119265594539936e-05,
      "loss": 1.4781,
      "num_input_tokens_seen": 24704452256,
      "step": 31400
    },
    {
      "epoch": 3.331317632081477,
      "grad_norm": 0.4332309856052565,
      "learning_rate": 4.111873437074584e-05,
      "loss": 1.3455,
      "num_input_tokens_seen": 24705239056,
      "step": 31401
    },
    {
      "epoch": 3.3314237216210483,
      "grad_norm": 0.4587270859602362,
      "learning_rate": 4.1118203134495656e-05,
      "loss": 1.4626,
      "num_input_tokens_seen": 24706025920,
      "step": 31402
    },
    {
      "epoch": 3.3315298111606197,
      "grad_norm": 0.4037754159718374,
      "learning_rate": 4.11176718857898e-05,
      "loss": 1.5376,
      "num_input_tokens_seen": 24706812624,
      "step": 31403
    },
    {
      "epoch": 3.3316359007001908,
      "grad_norm": 0.5074994436186862,
      "learning_rate": 4.111714062462868e-05,
      "loss": 1.6382,
      "num_input_tokens_seen": 24707599360,
      "step": 31404
    },
    {
      "epoch": 3.3317419902397623,
      "grad_norm": 0.4658222151865471,
      "learning_rate": 4.111660935101271e-05,
      "loss": 1.3907,
      "num_input_tokens_seen": 24708386160,
      "step": 31405
    },
    {
      "epoch": 3.3318480797793337,
      "grad_norm": 0.5015374311660936,
      "learning_rate": 4.11160780649423e-05,
      "loss": 1.3786,
      "num_input_tokens_seen": 24709172896,
      "step": 31406
    },
    {
      "epoch": 3.331954169318905,
      "grad_norm": 0.611069674830272,
      "learning_rate": 4.111554676641784e-05,
      "loss": 1.5629,
      "num_input_tokens_seen": 24709959712,
      "step": 31407
    },
    {
      "epoch": 3.3320602588584767,
      "grad_norm": 0.42730948586240497,
      "learning_rate": 4.111501545543977e-05,
      "loss": 1.4802,
      "num_input_tokens_seen": 24710746528,
      "step": 31408
    },
    {
      "epoch": 3.332166348398048,
      "grad_norm": 0.4797802924190413,
      "learning_rate": 4.111448413200849e-05,
      "loss": 1.402,
      "num_input_tokens_seen": 24711533376,
      "step": 31409
    },
    {
      "epoch": 3.332272437937619,
      "grad_norm": 0.5837921712083235,
      "learning_rate": 4.111395279612441e-05,
      "loss": 1.4368,
      "num_input_tokens_seen": 24712320048,
      "step": 31410
    },
    {
      "epoch": 3.3323785274771907,
      "grad_norm": 0.5784233640279537,
      "learning_rate": 4.1113421447787934e-05,
      "loss": 1.4778,
      "num_input_tokens_seen": 24713106912,
      "step": 31411
    },
    {
      "epoch": 3.332484617016762,
      "grad_norm": 0.5222531069605022,
      "learning_rate": 4.111289008699949e-05,
      "loss": 1.4362,
      "num_input_tokens_seen": 24713893680,
      "step": 31412
    },
    {
      "epoch": 3.3325907065563336,
      "grad_norm": 0.44423389157107185,
      "learning_rate": 4.111235871375947e-05,
      "loss": 1.4945,
      "num_input_tokens_seen": 24714680384,
      "step": 31413
    },
    {
      "epoch": 3.332696796095905,
      "grad_norm": 0.5666483413367646,
      "learning_rate": 4.111182732806829e-05,
      "loss": 1.4683,
      "num_input_tokens_seen": 24715467120,
      "step": 31414
    },
    {
      "epoch": 3.332802885635476,
      "grad_norm": 0.42945101630164406,
      "learning_rate": 4.111129592992636e-05,
      "loss": 1.388,
      "num_input_tokens_seen": 24716253952,
      "step": 31415
    },
    {
      "epoch": 3.3329089751750476,
      "grad_norm": 0.43190522970646067,
      "learning_rate": 4.11107645193341e-05,
      "loss": 1.3777,
      "num_input_tokens_seen": 24717040768,
      "step": 31416
    },
    {
      "epoch": 3.333015064714619,
      "grad_norm": 0.5742477056858817,
      "learning_rate": 4.111023309629192e-05,
      "loss": 1.4285,
      "num_input_tokens_seen": 24717827568,
      "step": 31417
    },
    {
      "epoch": 3.3331211542541905,
      "grad_norm": 0.41174474390539595,
      "learning_rate": 4.110970166080022e-05,
      "loss": 1.4434,
      "num_input_tokens_seen": 24718614336,
      "step": 31418
    },
    {
      "epoch": 3.333227243793762,
      "grad_norm": 0.7661989863974304,
      "learning_rate": 4.110917021285941e-05,
      "loss": 1.5654,
      "num_input_tokens_seen": 24719400976,
      "step": 31419
    },
    {
      "epoch": 3.3333333333333335,
      "grad_norm": 0.4363869350380127,
      "learning_rate": 4.11086387524699e-05,
      "loss": 1.3573,
      "num_input_tokens_seen": 24720187776,
      "step": 31420
    },
    {
      "epoch": 3.333439422872905,
      "grad_norm": 0.5016862151399571,
      "learning_rate": 4.110810727963211e-05,
      "loss": 1.4893,
      "num_input_tokens_seen": 24720974608,
      "step": 31421
    },
    {
      "epoch": 3.333545512412476,
      "grad_norm": 0.6233180065617189,
      "learning_rate": 4.110757579434645e-05,
      "loss": 1.5265,
      "num_input_tokens_seen": 24721761296,
      "step": 31422
    },
    {
      "epoch": 3.3336516019520475,
      "grad_norm": 0.40168517190263386,
      "learning_rate": 4.110704429661333e-05,
      "loss": 1.4274,
      "num_input_tokens_seen": 24722548096,
      "step": 31423
    },
    {
      "epoch": 3.333757691491619,
      "grad_norm": 0.6420051334227589,
      "learning_rate": 4.110651278643316e-05,
      "loss": 1.5364,
      "num_input_tokens_seen": 24723334912,
      "step": 31424
    },
    {
      "epoch": 3.3338637810311904,
      "grad_norm": 0.4674229153647136,
      "learning_rate": 4.110598126380635e-05,
      "loss": 1.5663,
      "num_input_tokens_seen": 24724121792,
      "step": 31425
    },
    {
      "epoch": 3.333969870570762,
      "grad_norm": 0.5105125266186926,
      "learning_rate": 4.1105449728733306e-05,
      "loss": 1.4758,
      "num_input_tokens_seen": 24724908576,
      "step": 31426
    },
    {
      "epoch": 3.334075960110333,
      "grad_norm": 0.5673219347582507,
      "learning_rate": 4.110491818121445e-05,
      "loss": 1.5441,
      "num_input_tokens_seen": 24725695392,
      "step": 31427
    },
    {
      "epoch": 3.3341820496499044,
      "grad_norm": 0.44913041989197583,
      "learning_rate": 4.1104386621250177e-05,
      "loss": 1.4118,
      "num_input_tokens_seen": 24726482144,
      "step": 31428
    },
    {
      "epoch": 3.334288139189476,
      "grad_norm": 0.5155282891903689,
      "learning_rate": 4.110385504884091e-05,
      "loss": 1.3897,
      "num_input_tokens_seen": 24727269008,
      "step": 31429
    },
    {
      "epoch": 3.3343942287290473,
      "grad_norm": 0.4816408372862262,
      "learning_rate": 4.110332346398706e-05,
      "loss": 1.3923,
      "num_input_tokens_seen": 24728055776,
      "step": 31430
    },
    {
      "epoch": 3.334500318268619,
      "grad_norm": 0.4453452188269069,
      "learning_rate": 4.110279186668903e-05,
      "loss": 1.4327,
      "num_input_tokens_seen": 24728842464,
      "step": 31431
    },
    {
      "epoch": 3.3346064078081903,
      "grad_norm": 0.48677284228089196,
      "learning_rate": 4.110226025694723e-05,
      "loss": 1.4328,
      "num_input_tokens_seen": 24729629264,
      "step": 31432
    },
    {
      "epoch": 3.3347124973477613,
      "grad_norm": 0.5805253813516416,
      "learning_rate": 4.110172863476209e-05,
      "loss": 1.4817,
      "num_input_tokens_seen": 24730416016,
      "step": 31433
    },
    {
      "epoch": 3.334818586887333,
      "grad_norm": 0.44420227728437506,
      "learning_rate": 4.1101197000134e-05,
      "loss": 1.4652,
      "num_input_tokens_seen": 24731202768,
      "step": 31434
    },
    {
      "epoch": 3.3349246764269043,
      "grad_norm": 0.6559731995566016,
      "learning_rate": 4.110066535306337e-05,
      "loss": 1.5298,
      "num_input_tokens_seen": 24731989552,
      "step": 31435
    },
    {
      "epoch": 3.3350307659664757,
      "grad_norm": 0.3991317359241926,
      "learning_rate": 4.1100133693550625e-05,
      "loss": 1.4637,
      "num_input_tokens_seen": 24732776320,
      "step": 31436
    },
    {
      "epoch": 3.335136855506047,
      "grad_norm": 0.5498945174889271,
      "learning_rate": 4.109960202159617e-05,
      "loss": 1.5174,
      "num_input_tokens_seen": 24733563040,
      "step": 31437
    },
    {
      "epoch": 3.3352429450456187,
      "grad_norm": 0.4818004656636491,
      "learning_rate": 4.109907033720041e-05,
      "loss": 1.3797,
      "num_input_tokens_seen": 24734349792,
      "step": 31438
    },
    {
      "epoch": 3.3353490345851897,
      "grad_norm": 0.4464689585352539,
      "learning_rate": 4.109853864036376e-05,
      "loss": 1.4688,
      "num_input_tokens_seen": 24735136608,
      "step": 31439
    },
    {
      "epoch": 3.335455124124761,
      "grad_norm": 0.508195184747738,
      "learning_rate": 4.1098006931086644e-05,
      "loss": 1.6039,
      "num_input_tokens_seen": 24735923312,
      "step": 31440
    },
    {
      "epoch": 3.3355612136643327,
      "grad_norm": 0.5923119466897555,
      "learning_rate": 4.109747520936945e-05,
      "loss": 1.4778,
      "num_input_tokens_seen": 24736710128,
      "step": 31441
    },
    {
      "epoch": 3.335667303203904,
      "grad_norm": 0.5240185634107921,
      "learning_rate": 4.10969434752126e-05,
      "loss": 1.4577,
      "num_input_tokens_seen": 24737496896,
      "step": 31442
    },
    {
      "epoch": 3.3357733927434756,
      "grad_norm": 0.5348350044388429,
      "learning_rate": 4.1096411728616506e-05,
      "loss": 1.4618,
      "num_input_tokens_seen": 24738283680,
      "step": 31443
    },
    {
      "epoch": 3.3358794822830466,
      "grad_norm": 0.6063845129156752,
      "learning_rate": 4.1095879969581576e-05,
      "loss": 1.6481,
      "num_input_tokens_seen": 24739070400,
      "step": 31444
    },
    {
      "epoch": 3.335985571822618,
      "grad_norm": 0.5055308782687313,
      "learning_rate": 4.1095348198108224e-05,
      "loss": 1.4948,
      "num_input_tokens_seen": 24739857200,
      "step": 31445
    },
    {
      "epoch": 3.3360916613621896,
      "grad_norm": 0.6614051848067223,
      "learning_rate": 4.109481641419686e-05,
      "loss": 1.5377,
      "num_input_tokens_seen": 24740644016,
      "step": 31446
    },
    {
      "epoch": 3.336197750901761,
      "grad_norm": 0.45915677594350085,
      "learning_rate": 4.109428461784789e-05,
      "loss": 1.4291,
      "num_input_tokens_seen": 24741430752,
      "step": 31447
    },
    {
      "epoch": 3.3363038404413325,
      "grad_norm": 0.4754168737169199,
      "learning_rate": 4.109375280906174e-05,
      "loss": 1.5471,
      "num_input_tokens_seen": 24742217536,
      "step": 31448
    },
    {
      "epoch": 3.336409929980904,
      "grad_norm": 0.5691522572495344,
      "learning_rate": 4.10932209878388e-05,
      "loss": 1.5011,
      "num_input_tokens_seen": 24743004272,
      "step": 31449
    },
    {
      "epoch": 3.3365160195204755,
      "grad_norm": 0.4776471097984029,
      "learning_rate": 4.109268915417949e-05,
      "loss": 1.4735,
      "num_input_tokens_seen": 24743790896,
      "step": 31450
    },
    {
      "epoch": 3.3366221090600465,
      "grad_norm": 0.5078229906859887,
      "learning_rate": 4.109215730808422e-05,
      "loss": 1.4421,
      "num_input_tokens_seen": 24744577744,
      "step": 31451
    },
    {
      "epoch": 3.336728198599618,
      "grad_norm": 0.5335386455209259,
      "learning_rate": 4.109162544955342e-05,
      "loss": 1.4961,
      "num_input_tokens_seen": 24745364560,
      "step": 31452
    },
    {
      "epoch": 3.3368342881391895,
      "grad_norm": 0.4730734344374535,
      "learning_rate": 4.109109357858746e-05,
      "loss": 1.374,
      "num_input_tokens_seen": 24746151376,
      "step": 31453
    },
    {
      "epoch": 3.336940377678761,
      "grad_norm": 0.5050734516833059,
      "learning_rate": 4.109056169518679e-05,
      "loss": 1.466,
      "num_input_tokens_seen": 24746938096,
      "step": 31454
    },
    {
      "epoch": 3.3370464672183324,
      "grad_norm": 0.4502512110781512,
      "learning_rate": 4.10900297993518e-05,
      "loss": 1.4778,
      "num_input_tokens_seen": 24747724832,
      "step": 31455
    },
    {
      "epoch": 3.3371525567579035,
      "grad_norm": 0.5088374461768627,
      "learning_rate": 4.1089497891082915e-05,
      "loss": 1.4793,
      "num_input_tokens_seen": 24748511568,
      "step": 31456
    },
    {
      "epoch": 3.337258646297475,
      "grad_norm": 0.47296413834024664,
      "learning_rate": 4.108896597038053e-05,
      "loss": 1.5551,
      "num_input_tokens_seen": 24749298400,
      "step": 31457
    },
    {
      "epoch": 3.3373647358370464,
      "grad_norm": 0.47340032218458195,
      "learning_rate": 4.108843403724507e-05,
      "loss": 1.5358,
      "num_input_tokens_seen": 24750085168,
      "step": 31458
    },
    {
      "epoch": 3.337470825376618,
      "grad_norm": 0.49885969392597196,
      "learning_rate": 4.108790209167694e-05,
      "loss": 1.4951,
      "num_input_tokens_seen": 24750871936,
      "step": 31459
    },
    {
      "epoch": 3.3375769149161894,
      "grad_norm": 0.4825130569929042,
      "learning_rate": 4.108737013367655e-05,
      "loss": 1.4413,
      "num_input_tokens_seen": 24751658704,
      "step": 31460
    },
    {
      "epoch": 3.337683004455761,
      "grad_norm": 0.43962155656054364,
      "learning_rate": 4.108683816324431e-05,
      "loss": 1.4619,
      "num_input_tokens_seen": 24752445504,
      "step": 31461
    },
    {
      "epoch": 3.3377890939953323,
      "grad_norm": 0.42750458907098754,
      "learning_rate": 4.108630618038063e-05,
      "loss": 1.3747,
      "num_input_tokens_seen": 24753232272,
      "step": 31462
    },
    {
      "epoch": 3.3378951835349033,
      "grad_norm": 0.4639069785193144,
      "learning_rate": 4.1085774185085936e-05,
      "loss": 1.4515,
      "num_input_tokens_seen": 24754019008,
      "step": 31463
    },
    {
      "epoch": 3.338001273074475,
      "grad_norm": 0.5058185721239495,
      "learning_rate": 4.1085242177360614e-05,
      "loss": 1.6267,
      "num_input_tokens_seen": 24754805792,
      "step": 31464
    },
    {
      "epoch": 3.3381073626140463,
      "grad_norm": 0.3853840414926451,
      "learning_rate": 4.10847101572051e-05,
      "loss": 1.3674,
      "num_input_tokens_seen": 24755592608,
      "step": 31465
    },
    {
      "epoch": 3.3382134521536178,
      "grad_norm": 0.5266388208298433,
      "learning_rate": 4.1084178124619785e-05,
      "loss": 1.616,
      "num_input_tokens_seen": 24756379264,
      "step": 31466
    },
    {
      "epoch": 3.3383195416931892,
      "grad_norm": 0.4588788216855989,
      "learning_rate": 4.10836460796051e-05,
      "loss": 1.3777,
      "num_input_tokens_seen": 24757166144,
      "step": 31467
    },
    {
      "epoch": 3.3384256312327603,
      "grad_norm": 0.4489152705140976,
      "learning_rate": 4.108311402216144e-05,
      "loss": 1.5519,
      "num_input_tokens_seen": 24757952976,
      "step": 31468
    },
    {
      "epoch": 3.3385317207723317,
      "grad_norm": 0.4231916847159847,
      "learning_rate": 4.108258195228922e-05,
      "loss": 1.5474,
      "num_input_tokens_seen": 24758739712,
      "step": 31469
    },
    {
      "epoch": 3.338637810311903,
      "grad_norm": 0.45343873860236844,
      "learning_rate": 4.1082049869988846e-05,
      "loss": 1.5229,
      "num_input_tokens_seen": 24759526496,
      "step": 31470
    },
    {
      "epoch": 3.3387438998514747,
      "grad_norm": 0.40352843005837247,
      "learning_rate": 4.1081517775260745e-05,
      "loss": 1.4101,
      "num_input_tokens_seen": 24760313264,
      "step": 31471
    },
    {
      "epoch": 3.338849989391046,
      "grad_norm": 0.42760589648627984,
      "learning_rate": 4.1080985668105315e-05,
      "loss": 1.4092,
      "num_input_tokens_seen": 24761100080,
      "step": 31472
    },
    {
      "epoch": 3.3389560789306176,
      "grad_norm": 0.38908500007335256,
      "learning_rate": 4.108045354852297e-05,
      "loss": 1.4814,
      "num_input_tokens_seen": 24761886864,
      "step": 31473
    },
    {
      "epoch": 3.3390621684701887,
      "grad_norm": 0.43930629663280596,
      "learning_rate": 4.107992141651413e-05,
      "loss": 1.4866,
      "num_input_tokens_seen": 24762673600,
      "step": 31474
    },
    {
      "epoch": 3.33916825800976,
      "grad_norm": 0.429750695229382,
      "learning_rate": 4.1079389272079195e-05,
      "loss": 1.4643,
      "num_input_tokens_seen": 24763460384,
      "step": 31475
    },
    {
      "epoch": 3.3392743475493316,
      "grad_norm": 0.39699711068943,
      "learning_rate": 4.107885711521858e-05,
      "loss": 1.4194,
      "num_input_tokens_seen": 24764247120,
      "step": 31476
    },
    {
      "epoch": 3.339380437088903,
      "grad_norm": 0.3954926047102467,
      "learning_rate": 4.107832494593269e-05,
      "loss": 1.3682,
      "num_input_tokens_seen": 24765033888,
      "step": 31477
    },
    {
      "epoch": 3.3394865266284746,
      "grad_norm": 0.48943537567318757,
      "learning_rate": 4.1077792764221944e-05,
      "loss": 1.4362,
      "num_input_tokens_seen": 24765820672,
      "step": 31478
    },
    {
      "epoch": 3.339592616168046,
      "grad_norm": 0.48696275960442775,
      "learning_rate": 4.107726057008676e-05,
      "loss": 1.5397,
      "num_input_tokens_seen": 24766607456,
      "step": 31479
    },
    {
      "epoch": 3.339698705707617,
      "grad_norm": 0.45769272801820016,
      "learning_rate": 4.1076728363527536e-05,
      "loss": 1.3696,
      "num_input_tokens_seen": 24767394304,
      "step": 31480
    },
    {
      "epoch": 3.3398047952471885,
      "grad_norm": 0.444705551632329,
      "learning_rate": 4.107619614454468e-05,
      "loss": 1.4661,
      "num_input_tokens_seen": 24768181104,
      "step": 31481
    },
    {
      "epoch": 3.33991088478676,
      "grad_norm": 0.5343631514682585,
      "learning_rate": 4.1075663913138627e-05,
      "loss": 1.4846,
      "num_input_tokens_seen": 24768967776,
      "step": 31482
    },
    {
      "epoch": 3.3400169743263315,
      "grad_norm": 0.5368965243677276,
      "learning_rate": 4.107513166930976e-05,
      "loss": 1.4771,
      "num_input_tokens_seen": 24769754560,
      "step": 31483
    },
    {
      "epoch": 3.340123063865903,
      "grad_norm": 0.5132529158081128,
      "learning_rate": 4.107459941305851e-05,
      "loss": 1.5325,
      "num_input_tokens_seen": 24770541392,
      "step": 31484
    },
    {
      "epoch": 3.340229153405474,
      "grad_norm": 0.47932474994008656,
      "learning_rate": 4.1074067144385274e-05,
      "loss": 1.4425,
      "num_input_tokens_seen": 24771328064,
      "step": 31485
    },
    {
      "epoch": 3.3403352429450455,
      "grad_norm": 0.6206824592977915,
      "learning_rate": 4.1073534863290476e-05,
      "loss": 1.4909,
      "num_input_tokens_seen": 24772114800,
      "step": 31486
    },
    {
      "epoch": 3.340441332484617,
      "grad_norm": 0.6454528490783393,
      "learning_rate": 4.1073002569774523e-05,
      "loss": 1.577,
      "num_input_tokens_seen": 24772901472,
      "step": 31487
    },
    {
      "epoch": 3.3405474220241884,
      "grad_norm": 0.4368710665483179,
      "learning_rate": 4.1072470263837815e-05,
      "loss": 1.4601,
      "num_input_tokens_seen": 24773688192,
      "step": 31488
    },
    {
      "epoch": 3.34065351156376,
      "grad_norm": 0.4100729696466441,
      "learning_rate": 4.1071937945480785e-05,
      "loss": 1.454,
      "num_input_tokens_seen": 24774474944,
      "step": 31489
    },
    {
      "epoch": 3.3407596011033314,
      "grad_norm": 0.42758982156006275,
      "learning_rate": 4.1071405614703826e-05,
      "loss": 1.4198,
      "num_input_tokens_seen": 24775261792,
      "step": 31490
    },
    {
      "epoch": 3.340865690642903,
      "grad_norm": 0.4592009175493438,
      "learning_rate": 4.107087327150736e-05,
      "loss": 1.3909,
      "num_input_tokens_seen": 24776048672,
      "step": 31491
    },
    {
      "epoch": 3.340971780182474,
      "grad_norm": 0.4704282185000245,
      "learning_rate": 4.10703409158918e-05,
      "loss": 1.5043,
      "num_input_tokens_seen": 24776835408,
      "step": 31492
    },
    {
      "epoch": 3.3410778697220453,
      "grad_norm": 0.45480752145520453,
      "learning_rate": 4.106980854785755e-05,
      "loss": 1.4982,
      "num_input_tokens_seen": 24777622048,
      "step": 31493
    },
    {
      "epoch": 3.341183959261617,
      "grad_norm": 0.40589165260892174,
      "learning_rate": 4.1069276167405014e-05,
      "loss": 1.4496,
      "num_input_tokens_seen": 24778408832,
      "step": 31494
    },
    {
      "epoch": 3.3412900488011883,
      "grad_norm": 0.5865153857964666,
      "learning_rate": 4.1068743774534624e-05,
      "loss": 1.4761,
      "num_input_tokens_seen": 24779195584,
      "step": 31495
    },
    {
      "epoch": 3.3413961383407598,
      "grad_norm": 0.5718582713290805,
      "learning_rate": 4.1068211369246765e-05,
      "loss": 1.4962,
      "num_input_tokens_seen": 24779982272,
      "step": 31496
    },
    {
      "epoch": 3.341502227880331,
      "grad_norm": 0.5110908050825944,
      "learning_rate": 4.106767895154188e-05,
      "loss": 1.6142,
      "num_input_tokens_seen": 24780768960,
      "step": 31497
    },
    {
      "epoch": 3.3416083174199023,
      "grad_norm": 0.4189283632672897,
      "learning_rate": 4.1067146521420354e-05,
      "loss": 1.4728,
      "num_input_tokens_seen": 24781555856,
      "step": 31498
    },
    {
      "epoch": 3.3417144069594737,
      "grad_norm": 0.5024594626834922,
      "learning_rate": 4.1066614078882616e-05,
      "loss": 1.3762,
      "num_input_tokens_seen": 24782342592,
      "step": 31499
    },
    {
      "epoch": 3.3418204964990452,
      "grad_norm": 0.48819190651071775,
      "learning_rate": 4.106608162392907e-05,
      "loss": 1.4099,
      "num_input_tokens_seen": 24783129328,
      "step": 31500
    },
    {
      "epoch": 3.3419265860386167,
      "grad_norm": 0.4441545821479735,
      "learning_rate": 4.1065549156560124e-05,
      "loss": 1.5307,
      "num_input_tokens_seen": 24783916064,
      "step": 31501
    },
    {
      "epoch": 3.342032675578188,
      "grad_norm": 0.6169192549678427,
      "learning_rate": 4.106501667677619e-05,
      "loss": 1.423,
      "num_input_tokens_seen": 24784702752,
      "step": 31502
    },
    {
      "epoch": 3.342138765117759,
      "grad_norm": 0.4078913435108872,
      "learning_rate": 4.106448418457769e-05,
      "loss": 1.4272,
      "num_input_tokens_seen": 24785489488,
      "step": 31503
    },
    {
      "epoch": 3.3422448546573307,
      "grad_norm": 0.5782825785101846,
      "learning_rate": 4.106395167996502e-05,
      "loss": 1.5628,
      "num_input_tokens_seen": 24786276240,
      "step": 31504
    },
    {
      "epoch": 3.342350944196902,
      "grad_norm": 0.4034824240679426,
      "learning_rate": 4.10634191629386e-05,
      "loss": 1.3954,
      "num_input_tokens_seen": 24787063120,
      "step": 31505
    },
    {
      "epoch": 3.3424570337364736,
      "grad_norm": 0.4821047057158332,
      "learning_rate": 4.106288663349884e-05,
      "loss": 1.5754,
      "num_input_tokens_seen": 24787849840,
      "step": 31506
    },
    {
      "epoch": 3.342563123276045,
      "grad_norm": 0.5398688553075532,
      "learning_rate": 4.106235409164616e-05,
      "loss": 1.3771,
      "num_input_tokens_seen": 24788636656,
      "step": 31507
    },
    {
      "epoch": 3.3426692128156166,
      "grad_norm": 0.45533835224330016,
      "learning_rate": 4.106182153738096e-05,
      "loss": 1.5033,
      "num_input_tokens_seen": 24789423344,
      "step": 31508
    },
    {
      "epoch": 3.3427753023551876,
      "grad_norm": 0.49403952064436496,
      "learning_rate": 4.106128897070366e-05,
      "loss": 1.4978,
      "num_input_tokens_seen": 24790210080,
      "step": 31509
    },
    {
      "epoch": 3.342881391894759,
      "grad_norm": 0.40185826829359145,
      "learning_rate": 4.106075639161466e-05,
      "loss": 1.4346,
      "num_input_tokens_seen": 24790996816,
      "step": 31510
    },
    {
      "epoch": 3.3429874814343306,
      "grad_norm": 0.48966333292492564,
      "learning_rate": 4.106022380011438e-05,
      "loss": 1.4004,
      "num_input_tokens_seen": 24791783600,
      "step": 31511
    },
    {
      "epoch": 3.343093570973902,
      "grad_norm": 0.4107933545422242,
      "learning_rate": 4.105969119620324e-05,
      "loss": 1.4645,
      "num_input_tokens_seen": 24792570432,
      "step": 31512
    },
    {
      "epoch": 3.3431996605134735,
      "grad_norm": 0.4534207015618205,
      "learning_rate": 4.105915857988163e-05,
      "loss": 1.4469,
      "num_input_tokens_seen": 24793357200,
      "step": 31513
    },
    {
      "epoch": 3.3433057500530445,
      "grad_norm": 0.47921295540304615,
      "learning_rate": 4.1058625951149975e-05,
      "loss": 1.4264,
      "num_input_tokens_seen": 24794144080,
      "step": 31514
    },
    {
      "epoch": 3.343411839592616,
      "grad_norm": 0.4380104793400796,
      "learning_rate": 4.105809331000869e-05,
      "loss": 1.5214,
      "num_input_tokens_seen": 24794930880,
      "step": 31515
    },
    {
      "epoch": 3.3435179291321875,
      "grad_norm": 0.43093425682598485,
      "learning_rate": 4.105756065645818e-05,
      "loss": 1.519,
      "num_input_tokens_seen": 24795717584,
      "step": 31516
    },
    {
      "epoch": 3.343624018671759,
      "grad_norm": 0.46010274979259796,
      "learning_rate": 4.105702799049886e-05,
      "loss": 1.4377,
      "num_input_tokens_seen": 24796504448,
      "step": 31517
    },
    {
      "epoch": 3.3437301082113304,
      "grad_norm": 0.40979496820265965,
      "learning_rate": 4.1056495312131135e-05,
      "loss": 1.4012,
      "num_input_tokens_seen": 24797291216,
      "step": 31518
    },
    {
      "epoch": 3.343836197750902,
      "grad_norm": 0.4545461168025153,
      "learning_rate": 4.105596262135543e-05,
      "loss": 1.4656,
      "num_input_tokens_seen": 24798078016,
      "step": 31519
    },
    {
      "epoch": 3.3439422872904734,
      "grad_norm": 0.3909780161830012,
      "learning_rate": 4.1055429918172133e-05,
      "loss": 1.4532,
      "num_input_tokens_seen": 24798864768,
      "step": 31520
    },
    {
      "epoch": 3.3440483768300444,
      "grad_norm": 0.40719277356703776,
      "learning_rate": 4.105489720258168e-05,
      "loss": 1.4223,
      "num_input_tokens_seen": 24799651568,
      "step": 31521
    },
    {
      "epoch": 3.344154466369616,
      "grad_norm": 0.5033910802091537,
      "learning_rate": 4.1054364474584476e-05,
      "loss": 1.5752,
      "num_input_tokens_seen": 24800438288,
      "step": 31522
    },
    {
      "epoch": 3.3442605559091874,
      "grad_norm": 0.46862780664423026,
      "learning_rate": 4.1053831734180926e-05,
      "loss": 1.4942,
      "num_input_tokens_seen": 24801225072,
      "step": 31523
    },
    {
      "epoch": 3.344366645448759,
      "grad_norm": 0.44397931599125734,
      "learning_rate": 4.105329898137145e-05,
      "loss": 1.4331,
      "num_input_tokens_seen": 24802011728,
      "step": 31524
    },
    {
      "epoch": 3.3444727349883303,
      "grad_norm": 0.4325498217510152,
      "learning_rate": 4.105276621615646e-05,
      "loss": 1.4276,
      "num_input_tokens_seen": 24802798528,
      "step": 31525
    },
    {
      "epoch": 3.3445788245279013,
      "grad_norm": 0.4313645509864614,
      "learning_rate": 4.105223343853635e-05,
      "loss": 1.4476,
      "num_input_tokens_seen": 24803585344,
      "step": 31526
    },
    {
      "epoch": 3.344684914067473,
      "grad_norm": 0.6194667524843118,
      "learning_rate": 4.105170064851155e-05,
      "loss": 1.4488,
      "num_input_tokens_seen": 24804372128,
      "step": 31527
    },
    {
      "epoch": 3.3447910036070443,
      "grad_norm": 0.506454231796092,
      "learning_rate": 4.1051167846082475e-05,
      "loss": 1.4122,
      "num_input_tokens_seen": 24805158944,
      "step": 31528
    },
    {
      "epoch": 3.3448970931466158,
      "grad_norm": 0.5154368594479727,
      "learning_rate": 4.105063503124952e-05,
      "loss": 1.4712,
      "num_input_tokens_seen": 24805945712,
      "step": 31529
    },
    {
      "epoch": 3.3450031826861872,
      "grad_norm": 0.7442967192623344,
      "learning_rate": 4.105010220401311e-05,
      "loss": 1.4762,
      "num_input_tokens_seen": 24806732528,
      "step": 31530
    },
    {
      "epoch": 3.3451092722257587,
      "grad_norm": 0.5163147783042941,
      "learning_rate": 4.104956936437364e-05,
      "loss": 1.352,
      "num_input_tokens_seen": 24807519264,
      "step": 31531
    },
    {
      "epoch": 3.34521536176533,
      "grad_norm": 0.7919036475417927,
      "learning_rate": 4.104903651233155e-05,
      "loss": 1.5526,
      "num_input_tokens_seen": 24808306016,
      "step": 31532
    },
    {
      "epoch": 3.345321451304901,
      "grad_norm": 0.5310477680858199,
      "learning_rate": 4.104850364788723e-05,
      "loss": 1.4679,
      "num_input_tokens_seen": 24809092704,
      "step": 31533
    },
    {
      "epoch": 3.3454275408444727,
      "grad_norm": 0.6933239206696123,
      "learning_rate": 4.104797077104109e-05,
      "loss": 1.4218,
      "num_input_tokens_seen": 24809879392,
      "step": 31534
    },
    {
      "epoch": 3.345533630384044,
      "grad_norm": 0.37393410178012687,
      "learning_rate": 4.104743788179356e-05,
      "loss": 1.3771,
      "num_input_tokens_seen": 24810666160,
      "step": 31535
    },
    {
      "epoch": 3.3456397199236156,
      "grad_norm": 0.5043251210750377,
      "learning_rate": 4.104690498014503e-05,
      "loss": 1.5023,
      "num_input_tokens_seen": 24811452816,
      "step": 31536
    },
    {
      "epoch": 3.345745809463187,
      "grad_norm": 0.5510869377391558,
      "learning_rate": 4.104637206609593e-05,
      "loss": 1.4068,
      "num_input_tokens_seen": 24812239600,
      "step": 31537
    },
    {
      "epoch": 3.345851899002758,
      "grad_norm": 0.47431248440397034,
      "learning_rate": 4.1045839139646655e-05,
      "loss": 1.5882,
      "num_input_tokens_seen": 24813026304,
      "step": 31538
    },
    {
      "epoch": 3.3459579885423296,
      "grad_norm": 0.5963554699115786,
      "learning_rate": 4.104530620079764e-05,
      "loss": 1.4064,
      "num_input_tokens_seen": 24813813056,
      "step": 31539
    },
    {
      "epoch": 3.346064078081901,
      "grad_norm": 0.4348561244629713,
      "learning_rate": 4.104477324954927e-05,
      "loss": 1.3552,
      "num_input_tokens_seen": 24814599776,
      "step": 31540
    },
    {
      "epoch": 3.3461701676214726,
      "grad_norm": 0.4662460334722366,
      "learning_rate": 4.1044240285901984e-05,
      "loss": 1.5427,
      "num_input_tokens_seen": 24815386544,
      "step": 31541
    },
    {
      "epoch": 3.346276257161044,
      "grad_norm": 0.4059223172445582,
      "learning_rate": 4.104370730985617e-05,
      "loss": 1.466,
      "num_input_tokens_seen": 24816173296,
      "step": 31542
    },
    {
      "epoch": 3.346382346700615,
      "grad_norm": 0.4185753407928681,
      "learning_rate": 4.104317432141226e-05,
      "loss": 1.5631,
      "num_input_tokens_seen": 24816959952,
      "step": 31543
    },
    {
      "epoch": 3.3464884362401865,
      "grad_norm": 0.6377612418483252,
      "learning_rate": 4.104264132057064e-05,
      "loss": 1.5395,
      "num_input_tokens_seen": 24817746656,
      "step": 31544
    },
    {
      "epoch": 3.346594525779758,
      "grad_norm": 0.5270491051372227,
      "learning_rate": 4.104210830733175e-05,
      "loss": 1.3933,
      "num_input_tokens_seen": 24818533408,
      "step": 31545
    },
    {
      "epoch": 3.3467006153193295,
      "grad_norm": 0.4652419899893655,
      "learning_rate": 4.104157528169599e-05,
      "loss": 1.3688,
      "num_input_tokens_seen": 24819320096,
      "step": 31546
    },
    {
      "epoch": 3.346806704858901,
      "grad_norm": 0.39876628354890614,
      "learning_rate": 4.104104224366376e-05,
      "loss": 1.418,
      "num_input_tokens_seen": 24820106848,
      "step": 31547
    },
    {
      "epoch": 3.3469127943984724,
      "grad_norm": 0.5189032606101104,
      "learning_rate": 4.104050919323549e-05,
      "loss": 1.5377,
      "num_input_tokens_seen": 24820893648,
      "step": 31548
    },
    {
      "epoch": 3.347018883938044,
      "grad_norm": 0.5253813752811406,
      "learning_rate": 4.1039976130411586e-05,
      "loss": 1.5222,
      "num_input_tokens_seen": 24821680352,
      "step": 31549
    },
    {
      "epoch": 3.347124973477615,
      "grad_norm": 0.47173097380936047,
      "learning_rate": 4.103944305519246e-05,
      "loss": 1.4192,
      "num_input_tokens_seen": 24822467120,
      "step": 31550
    },
    {
      "epoch": 3.3472310630171864,
      "grad_norm": 0.5332752853486064,
      "learning_rate": 4.103890996757852e-05,
      "loss": 1.454,
      "num_input_tokens_seen": 24823253856,
      "step": 31551
    },
    {
      "epoch": 3.347337152556758,
      "grad_norm": 0.4857296889630071,
      "learning_rate": 4.103837686757018e-05,
      "loss": 1.5907,
      "num_input_tokens_seen": 24824040512,
      "step": 31552
    },
    {
      "epoch": 3.3474432420963294,
      "grad_norm": 0.698080802454092,
      "learning_rate": 4.103784375516786e-05,
      "loss": 1.4848,
      "num_input_tokens_seen": 24824827312,
      "step": 31553
    },
    {
      "epoch": 3.347549331635901,
      "grad_norm": 0.3892655614336013,
      "learning_rate": 4.103731063037196e-05,
      "loss": 1.462,
      "num_input_tokens_seen": 24825614112,
      "step": 31554
    },
    {
      "epoch": 3.347655421175472,
      "grad_norm": 0.5175787403578318,
      "learning_rate": 4.10367774931829e-05,
      "loss": 1.5509,
      "num_input_tokens_seen": 24826400896,
      "step": 31555
    },
    {
      "epoch": 3.3477615107150434,
      "grad_norm": 0.4575717723268245,
      "learning_rate": 4.103624434360108e-05,
      "loss": 1.34,
      "num_input_tokens_seen": 24827187648,
      "step": 31556
    },
    {
      "epoch": 3.347867600254615,
      "grad_norm": 0.4292134882215899,
      "learning_rate": 4.1035711181626924e-05,
      "loss": 1.5032,
      "num_input_tokens_seen": 24827974384,
      "step": 31557
    },
    {
      "epoch": 3.3479736897941863,
      "grad_norm": 0.4906361351783381,
      "learning_rate": 4.1035178007260844e-05,
      "loss": 1.4375,
      "num_input_tokens_seen": 24828761232,
      "step": 31558
    },
    {
      "epoch": 3.3480797793337578,
      "grad_norm": 0.3973038448231539,
      "learning_rate": 4.1034644820503254e-05,
      "loss": 1.3516,
      "num_input_tokens_seen": 24829548080,
      "step": 31559
    },
    {
      "epoch": 3.3481858688733293,
      "grad_norm": 0.4645761713463954,
      "learning_rate": 4.1034111621354555e-05,
      "loss": 1.4722,
      "num_input_tokens_seen": 24830334848,
      "step": 31560
    },
    {
      "epoch": 3.3482919584129007,
      "grad_norm": 0.4247387386889434,
      "learning_rate": 4.103357840981516e-05,
      "loss": 1.4371,
      "num_input_tokens_seen": 24831121568,
      "step": 31561
    },
    {
      "epoch": 3.3483980479524718,
      "grad_norm": 0.4180667342282875,
      "learning_rate": 4.1033045185885495e-05,
      "loss": 1.386,
      "num_input_tokens_seen": 24831908400,
      "step": 31562
    },
    {
      "epoch": 3.3485041374920432,
      "grad_norm": 0.439360274113249,
      "learning_rate": 4.1032511949565954e-05,
      "loss": 1.4931,
      "num_input_tokens_seen": 24832695120,
      "step": 31563
    },
    {
      "epoch": 3.3486102270316147,
      "grad_norm": 0.39950740567429727,
      "learning_rate": 4.1031978700856964e-05,
      "loss": 1.513,
      "num_input_tokens_seen": 24833481904,
      "step": 31564
    },
    {
      "epoch": 3.348716316571186,
      "grad_norm": 0.38154183027239597,
      "learning_rate": 4.103144543975893e-05,
      "loss": 1.4705,
      "num_input_tokens_seen": 24834268720,
      "step": 31565
    },
    {
      "epoch": 3.3488224061107577,
      "grad_norm": 0.37965753894071713,
      "learning_rate": 4.103091216627227e-05,
      "loss": 1.4101,
      "num_input_tokens_seen": 24835055440,
      "step": 31566
    },
    {
      "epoch": 3.3489284956503287,
      "grad_norm": 0.43839537634019626,
      "learning_rate": 4.1030378880397384e-05,
      "loss": 1.442,
      "num_input_tokens_seen": 24835842224,
      "step": 31567
    },
    {
      "epoch": 3.3490345851899,
      "grad_norm": 0.444170176837866,
      "learning_rate": 4.10298455821347e-05,
      "loss": 1.6114,
      "num_input_tokens_seen": 24836628944,
      "step": 31568
    },
    {
      "epoch": 3.3491406747294716,
      "grad_norm": 0.4108729129015867,
      "learning_rate": 4.1029312271484613e-05,
      "loss": 1.339,
      "num_input_tokens_seen": 24837415824,
      "step": 31569
    },
    {
      "epoch": 3.349246764269043,
      "grad_norm": 0.4052104956802565,
      "learning_rate": 4.102877894844755e-05,
      "loss": 1.3877,
      "num_input_tokens_seen": 24838202624,
      "step": 31570
    },
    {
      "epoch": 3.3493528538086146,
      "grad_norm": 0.39924835293029437,
      "learning_rate": 4.102824561302392e-05,
      "loss": 1.4963,
      "num_input_tokens_seen": 24838989344,
      "step": 31571
    },
    {
      "epoch": 3.349458943348186,
      "grad_norm": 0.4236520108898719,
      "learning_rate": 4.102771226521413e-05,
      "loss": 1.4054,
      "num_input_tokens_seen": 24839776144,
      "step": 31572
    },
    {
      "epoch": 3.349565032887757,
      "grad_norm": 0.3945332809782751,
      "learning_rate": 4.102717890501858e-05,
      "loss": 1.5183,
      "num_input_tokens_seen": 24840562928,
      "step": 31573
    },
    {
      "epoch": 3.3496711224273286,
      "grad_norm": 0.41618478315499685,
      "learning_rate": 4.1026645532437715e-05,
      "loss": 1.4471,
      "num_input_tokens_seen": 24841349680,
      "step": 31574
    },
    {
      "epoch": 3.3497772119669,
      "grad_norm": 0.3716791673943511,
      "learning_rate": 4.1026112147471915e-05,
      "loss": 1.3743,
      "num_input_tokens_seen": 24842136448,
      "step": 31575
    },
    {
      "epoch": 3.3498833015064715,
      "grad_norm": 0.44207754952238937,
      "learning_rate": 4.102557875012161e-05,
      "loss": 1.3343,
      "num_input_tokens_seen": 24842923280,
      "step": 31576
    },
    {
      "epoch": 3.349989391046043,
      "grad_norm": 0.4377855740374084,
      "learning_rate": 4.1025045340387214e-05,
      "loss": 1.4774,
      "num_input_tokens_seen": 24843710064,
      "step": 31577
    },
    {
      "epoch": 3.3500954805856145,
      "grad_norm": 0.43310735963579877,
      "learning_rate": 4.1024511918269126e-05,
      "loss": 1.4766,
      "num_input_tokens_seen": 24844496784,
      "step": 31578
    },
    {
      "epoch": 3.3502015701251855,
      "grad_norm": 0.49103336179851886,
      "learning_rate": 4.102397848376777e-05,
      "loss": 1.5145,
      "num_input_tokens_seen": 24845283584,
      "step": 31579
    },
    {
      "epoch": 3.350307659664757,
      "grad_norm": 0.3994383581316197,
      "learning_rate": 4.1023445036883556e-05,
      "loss": 1.3063,
      "num_input_tokens_seen": 24846070400,
      "step": 31580
    },
    {
      "epoch": 3.3504137492043284,
      "grad_norm": 0.4327210560973877,
      "learning_rate": 4.1022911577616886e-05,
      "loss": 1.5211,
      "num_input_tokens_seen": 24846857120,
      "step": 31581
    },
    {
      "epoch": 3.3505198387439,
      "grad_norm": 0.4254815377268464,
      "learning_rate": 4.102237810596819e-05,
      "loss": 1.5442,
      "num_input_tokens_seen": 24847643824,
      "step": 31582
    },
    {
      "epoch": 3.3506259282834714,
      "grad_norm": 0.42416096075891724,
      "learning_rate": 4.102184462193785e-05,
      "loss": 1.4908,
      "num_input_tokens_seen": 24848430560,
      "step": 31583
    },
    {
      "epoch": 3.3507320178230424,
      "grad_norm": 0.4221182715428169,
      "learning_rate": 4.1021311125526315e-05,
      "loss": 1.4653,
      "num_input_tokens_seen": 24849217296,
      "step": 31584
    },
    {
      "epoch": 3.350838107362614,
      "grad_norm": 0.45605018240378226,
      "learning_rate": 4.102077761673399e-05,
      "loss": 1.6047,
      "num_input_tokens_seen": 24850003952,
      "step": 31585
    },
    {
      "epoch": 3.3509441969021854,
      "grad_norm": 0.43123279247319624,
      "learning_rate": 4.1020244095561265e-05,
      "loss": 1.3997,
      "num_input_tokens_seen": 24850790800,
      "step": 31586
    },
    {
      "epoch": 3.351050286441757,
      "grad_norm": 0.448463081522885,
      "learning_rate": 4.101971056200856e-05,
      "loss": 1.5832,
      "num_input_tokens_seen": 24851577520,
      "step": 31587
    },
    {
      "epoch": 3.3511563759813283,
      "grad_norm": 0.3962095403057257,
      "learning_rate": 4.1019177016076305e-05,
      "loss": 1.3347,
      "num_input_tokens_seen": 24852364320,
      "step": 31588
    },
    {
      "epoch": 3.3512624655209,
      "grad_norm": 0.5136341185159271,
      "learning_rate": 4.1018643457764894e-05,
      "loss": 1.3792,
      "num_input_tokens_seen": 24853151152,
      "step": 31589
    },
    {
      "epoch": 3.3513685550604713,
      "grad_norm": 0.4414429304255244,
      "learning_rate": 4.101810988707475e-05,
      "loss": 1.4975,
      "num_input_tokens_seen": 24853937920,
      "step": 31590
    },
    {
      "epoch": 3.3514746446000423,
      "grad_norm": 0.4785874471799117,
      "learning_rate": 4.101757630400628e-05,
      "loss": 1.5401,
      "num_input_tokens_seen": 24854724656,
      "step": 31591
    },
    {
      "epoch": 3.3515807341396138,
      "grad_norm": 0.44247867534796703,
      "learning_rate": 4.101704270855989e-05,
      "loss": 1.5019,
      "num_input_tokens_seen": 24855511376,
      "step": 31592
    },
    {
      "epoch": 3.3516868236791852,
      "grad_norm": 0.44583233186167054,
      "learning_rate": 4.1016509100736e-05,
      "loss": 1.475,
      "num_input_tokens_seen": 24856298192,
      "step": 31593
    },
    {
      "epoch": 3.3517929132187567,
      "grad_norm": 0.5790751285895696,
      "learning_rate": 4.101597548053503e-05,
      "loss": 1.4785,
      "num_input_tokens_seen": 24857084960,
      "step": 31594
    },
    {
      "epoch": 3.351899002758328,
      "grad_norm": 0.41719588629781235,
      "learning_rate": 4.101544184795738e-05,
      "loss": 1.4211,
      "num_input_tokens_seen": 24857871808,
      "step": 31595
    },
    {
      "epoch": 3.3520050922978992,
      "grad_norm": 0.4797052605061299,
      "learning_rate": 4.101490820300347e-05,
      "loss": 1.4568,
      "num_input_tokens_seen": 24858658592,
      "step": 31596
    },
    {
      "epoch": 3.3521111818374707,
      "grad_norm": 0.4161808265180936,
      "learning_rate": 4.1014374545673695e-05,
      "loss": 1.4139,
      "num_input_tokens_seen": 24859445328,
      "step": 31597
    },
    {
      "epoch": 3.352217271377042,
      "grad_norm": 0.45488370219221946,
      "learning_rate": 4.101384087596849e-05,
      "loss": 1.4159,
      "num_input_tokens_seen": 24860232064,
      "step": 31598
    },
    {
      "epoch": 3.3523233609166136,
      "grad_norm": 0.4174766511442083,
      "learning_rate": 4.101330719388826e-05,
      "loss": 1.4132,
      "num_input_tokens_seen": 24861018912,
      "step": 31599
    },
    {
      "epoch": 3.352429450456185,
      "grad_norm": 0.49299589392360976,
      "learning_rate": 4.101277349943342e-05,
      "loss": 1.3778,
      "num_input_tokens_seen": 24861805744,
      "step": 31600
    },
    {
      "epoch": 3.3525355399957566,
      "grad_norm": 0.4038844223109624,
      "learning_rate": 4.1012239792604365e-05,
      "loss": 1.4701,
      "num_input_tokens_seen": 24862592592,
      "step": 31601
    },
    {
      "epoch": 3.3526416295353276,
      "grad_norm": 0.48147389933161405,
      "learning_rate": 4.101170607340153e-05,
      "loss": 1.4352,
      "num_input_tokens_seen": 24863379440,
      "step": 31602
    },
    {
      "epoch": 3.352747719074899,
      "grad_norm": 0.4075119384509724,
      "learning_rate": 4.1011172341825324e-05,
      "loss": 1.4901,
      "num_input_tokens_seen": 24864166224,
      "step": 31603
    },
    {
      "epoch": 3.3528538086144706,
      "grad_norm": 0.4084913717921241,
      "learning_rate": 4.1010638597876146e-05,
      "loss": 1.461,
      "num_input_tokens_seen": 24864952992,
      "step": 31604
    },
    {
      "epoch": 3.352959898154042,
      "grad_norm": 0.44711913584662566,
      "learning_rate": 4.101010484155442e-05,
      "loss": 1.49,
      "num_input_tokens_seen": 24865739680,
      "step": 31605
    },
    {
      "epoch": 3.3530659876936135,
      "grad_norm": 0.4646504985274082,
      "learning_rate": 4.1009571072860556e-05,
      "loss": 1.5785,
      "num_input_tokens_seen": 24866526464,
      "step": 31606
    },
    {
      "epoch": 3.353172077233185,
      "grad_norm": 0.43045032985017095,
      "learning_rate": 4.1009037291794964e-05,
      "loss": 1.5066,
      "num_input_tokens_seen": 24867313312,
      "step": 31607
    },
    {
      "epoch": 3.353278166772756,
      "grad_norm": 0.4576488763958658,
      "learning_rate": 4.1008503498358055e-05,
      "loss": 1.5686,
      "num_input_tokens_seen": 24868099984,
      "step": 31608
    },
    {
      "epoch": 3.3533842563123275,
      "grad_norm": 0.38028915736671304,
      "learning_rate": 4.100796969255024e-05,
      "loss": 1.463,
      "num_input_tokens_seen": 24868886688,
      "step": 31609
    },
    {
      "epoch": 3.353490345851899,
      "grad_norm": 0.4009662373767056,
      "learning_rate": 4.1007435874371944e-05,
      "loss": 1.5582,
      "num_input_tokens_seen": 24869673376,
      "step": 31610
    },
    {
      "epoch": 3.3535964353914705,
      "grad_norm": 0.4395984424464392,
      "learning_rate": 4.100690204382357e-05,
      "loss": 1.3965,
      "num_input_tokens_seen": 24870460144,
      "step": 31611
    },
    {
      "epoch": 3.353702524931042,
      "grad_norm": 0.41869626256698955,
      "learning_rate": 4.100636820090553e-05,
      "loss": 1.5002,
      "num_input_tokens_seen": 24871246912,
      "step": 31612
    },
    {
      "epoch": 3.353808614470613,
      "grad_norm": 0.43900773062577686,
      "learning_rate": 4.1005834345618234e-05,
      "loss": 1.4713,
      "num_input_tokens_seen": 24872033632,
      "step": 31613
    },
    {
      "epoch": 3.3539147040101844,
      "grad_norm": 0.4789143253616371,
      "learning_rate": 4.10053004779621e-05,
      "loss": 1.3739,
      "num_input_tokens_seen": 24872820464,
      "step": 31614
    },
    {
      "epoch": 3.354020793549756,
      "grad_norm": 0.39655197263336606,
      "learning_rate": 4.100476659793755e-05,
      "loss": 1.5083,
      "num_input_tokens_seen": 24873607312,
      "step": 31615
    },
    {
      "epoch": 3.3541268830893274,
      "grad_norm": 0.38717747628911253,
      "learning_rate": 4.1004232705544974e-05,
      "loss": 1.3919,
      "num_input_tokens_seen": 24874394128,
      "step": 31616
    },
    {
      "epoch": 3.354232972628899,
      "grad_norm": 0.49177833846479,
      "learning_rate": 4.10036988007848e-05,
      "loss": 1.5632,
      "num_input_tokens_seen": 24875180848,
      "step": 31617
    },
    {
      "epoch": 3.3543390621684703,
      "grad_norm": 0.44967650601704856,
      "learning_rate": 4.100316488365744e-05,
      "loss": 1.506,
      "num_input_tokens_seen": 24875967536,
      "step": 31618
    },
    {
      "epoch": 3.354445151708042,
      "grad_norm": 0.4041495928319427,
      "learning_rate": 4.1002630954163304e-05,
      "loss": 1.3492,
      "num_input_tokens_seen": 24876754288,
      "step": 31619
    },
    {
      "epoch": 3.354551241247613,
      "grad_norm": 0.3958202191550729,
      "learning_rate": 4.10020970123028e-05,
      "loss": 1.4207,
      "num_input_tokens_seen": 24877541072,
      "step": 31620
    },
    {
      "epoch": 3.3546573307871843,
      "grad_norm": 0.41999346792051157,
      "learning_rate": 4.100156305807635e-05,
      "loss": 1.4235,
      "num_input_tokens_seen": 24878327920,
      "step": 31621
    },
    {
      "epoch": 3.354763420326756,
      "grad_norm": 0.38411984638714775,
      "learning_rate": 4.100102909148436e-05,
      "loss": 1.3287,
      "num_input_tokens_seen": 24879114720,
      "step": 31622
    },
    {
      "epoch": 3.3548695098663273,
      "grad_norm": 0.4521013816696997,
      "learning_rate": 4.100049511252724e-05,
      "loss": 1.4811,
      "num_input_tokens_seen": 24879901408,
      "step": 31623
    },
    {
      "epoch": 3.3549755994058987,
      "grad_norm": 0.4481822920576837,
      "learning_rate": 4.099996112120541e-05,
      "loss": 1.5279,
      "num_input_tokens_seen": 24880688096,
      "step": 31624
    },
    {
      "epoch": 3.3550816889454698,
      "grad_norm": 0.46196285530081466,
      "learning_rate": 4.099942711751928e-05,
      "loss": 1.5482,
      "num_input_tokens_seen": 24881474864,
      "step": 31625
    },
    {
      "epoch": 3.3551877784850412,
      "grad_norm": 0.38707747053833536,
      "learning_rate": 4.099889310146926e-05,
      "loss": 1.4441,
      "num_input_tokens_seen": 24882261600,
      "step": 31626
    },
    {
      "epoch": 3.3552938680246127,
      "grad_norm": 0.44935777123524967,
      "learning_rate": 4.099835907305577e-05,
      "loss": 1.4221,
      "num_input_tokens_seen": 24883048368,
      "step": 31627
    },
    {
      "epoch": 3.355399957564184,
      "grad_norm": 0.4214627788572606,
      "learning_rate": 4.099782503227921e-05,
      "loss": 1.4723,
      "num_input_tokens_seen": 24883835104,
      "step": 31628
    },
    {
      "epoch": 3.3555060471037557,
      "grad_norm": 0.40475569153798135,
      "learning_rate": 4.099729097914e-05,
      "loss": 1.3257,
      "num_input_tokens_seen": 24884621888,
      "step": 31629
    },
    {
      "epoch": 3.355612136643327,
      "grad_norm": 0.49365367900618345,
      "learning_rate": 4.099675691363856e-05,
      "loss": 1.5448,
      "num_input_tokens_seen": 24885408624,
      "step": 31630
    },
    {
      "epoch": 3.3557182261828986,
      "grad_norm": 0.38491872519650944,
      "learning_rate": 4.09962228357753e-05,
      "loss": 1.3601,
      "num_input_tokens_seen": 24886195536,
      "step": 31631
    },
    {
      "epoch": 3.3558243157224696,
      "grad_norm": 0.563125697300264,
      "learning_rate": 4.099568874555062e-05,
      "loss": 1.5582,
      "num_input_tokens_seen": 24886982272,
      "step": 31632
    },
    {
      "epoch": 3.355930405262041,
      "grad_norm": 0.4005845665267778,
      "learning_rate": 4.099515464296494e-05,
      "loss": 1.408,
      "num_input_tokens_seen": 24887768944,
      "step": 31633
    },
    {
      "epoch": 3.3560364948016126,
      "grad_norm": 0.5555977735290185,
      "learning_rate": 4.099462052801867e-05,
      "loss": 1.456,
      "num_input_tokens_seen": 24888555664,
      "step": 31634
    },
    {
      "epoch": 3.356142584341184,
      "grad_norm": 0.4157919444915979,
      "learning_rate": 4.099408640071224e-05,
      "loss": 1.4732,
      "num_input_tokens_seen": 24889342480,
      "step": 31635
    },
    {
      "epoch": 3.3562486738807555,
      "grad_norm": 0.4237730770320375,
      "learning_rate": 4.099355226104604e-05,
      "loss": 1.388,
      "num_input_tokens_seen": 24890129184,
      "step": 31636
    },
    {
      "epoch": 3.3563547634203266,
      "grad_norm": 0.48497101104987145,
      "learning_rate": 4.0993018109020494e-05,
      "loss": 1.4417,
      "num_input_tokens_seen": 24890916064,
      "step": 31637
    },
    {
      "epoch": 3.356460852959898,
      "grad_norm": 0.4342600033716523,
      "learning_rate": 4.099248394463601e-05,
      "loss": 1.4421,
      "num_input_tokens_seen": 24891702864,
      "step": 31638
    },
    {
      "epoch": 3.3565669424994695,
      "grad_norm": 0.4166182167462934,
      "learning_rate": 4.099194976789301e-05,
      "loss": 1.4667,
      "num_input_tokens_seen": 24892489664,
      "step": 31639
    },
    {
      "epoch": 3.356673032039041,
      "grad_norm": 0.4294374055933806,
      "learning_rate": 4.0991415578791893e-05,
      "loss": 1.5207,
      "num_input_tokens_seen": 24893276416,
      "step": 31640
    },
    {
      "epoch": 3.3567791215786125,
      "grad_norm": 0.4814471030021512,
      "learning_rate": 4.099088137733309e-05,
      "loss": 1.5711,
      "num_input_tokens_seen": 24894063088,
      "step": 31641
    },
    {
      "epoch": 3.3568852111181835,
      "grad_norm": 0.49235553121942227,
      "learning_rate": 4.0990347163516995e-05,
      "loss": 1.5195,
      "num_input_tokens_seen": 24894849840,
      "step": 31642
    },
    {
      "epoch": 3.356991300657755,
      "grad_norm": 0.4596689288762631,
      "learning_rate": 4.098981293734403e-05,
      "loss": 1.4245,
      "num_input_tokens_seen": 24895636656,
      "step": 31643
    },
    {
      "epoch": 3.3570973901973264,
      "grad_norm": 0.5186501688654438,
      "learning_rate": 4.0989278698814606e-05,
      "loss": 1.5579,
      "num_input_tokens_seen": 24896423424,
      "step": 31644
    },
    {
      "epoch": 3.357203479736898,
      "grad_norm": 0.4562006647050058,
      "learning_rate": 4.098874444792914e-05,
      "loss": 1.6014,
      "num_input_tokens_seen": 24897210112,
      "step": 31645
    },
    {
      "epoch": 3.3573095692764694,
      "grad_norm": 0.4456779275603546,
      "learning_rate": 4.0988210184688035e-05,
      "loss": 1.483,
      "num_input_tokens_seen": 24897996864,
      "step": 31646
    },
    {
      "epoch": 3.357415658816041,
      "grad_norm": 0.5054793259054761,
      "learning_rate": 4.0987675909091716e-05,
      "loss": 1.4795,
      "num_input_tokens_seen": 24898783552,
      "step": 31647
    },
    {
      "epoch": 3.3575217483556123,
      "grad_norm": 0.4241457418144734,
      "learning_rate": 4.098714162114059e-05,
      "loss": 1.4819,
      "num_input_tokens_seen": 24899570368,
      "step": 31648
    },
    {
      "epoch": 3.3576278378951834,
      "grad_norm": 0.41234185424436215,
      "learning_rate": 4.098660732083507e-05,
      "loss": 1.5303,
      "num_input_tokens_seen": 24900357104,
      "step": 31649
    },
    {
      "epoch": 3.357733927434755,
      "grad_norm": 0.3940594676678108,
      "learning_rate": 4.0986073008175565e-05,
      "loss": 1.3521,
      "num_input_tokens_seen": 24901143760,
      "step": 31650
    },
    {
      "epoch": 3.3578400169743263,
      "grad_norm": 0.4544494042771029,
      "learning_rate": 4.09855386831625e-05,
      "loss": 1.4385,
      "num_input_tokens_seen": 24901930640,
      "step": 31651
    },
    {
      "epoch": 3.357946106513898,
      "grad_norm": 0.4747643995586009,
      "learning_rate": 4.098500434579626e-05,
      "loss": 1.4646,
      "num_input_tokens_seen": 24902717440,
      "step": 31652
    },
    {
      "epoch": 3.3580521960534693,
      "grad_norm": 0.4007950361886402,
      "learning_rate": 4.0984469996077294e-05,
      "loss": 1.4035,
      "num_input_tokens_seen": 24903504096,
      "step": 31653
    },
    {
      "epoch": 3.3581582855930403,
      "grad_norm": 0.5134084724047465,
      "learning_rate": 4.0983935634006e-05,
      "loss": 1.4884,
      "num_input_tokens_seen": 24904290752,
      "step": 31654
    },
    {
      "epoch": 3.358264375132612,
      "grad_norm": 0.42542037568139607,
      "learning_rate": 4.098340125958279e-05,
      "loss": 1.5422,
      "num_input_tokens_seen": 24905077504,
      "step": 31655
    },
    {
      "epoch": 3.3583704646721833,
      "grad_norm": 0.534346580754973,
      "learning_rate": 4.098286687280807e-05,
      "loss": 1.5773,
      "num_input_tokens_seen": 24905864224,
      "step": 31656
    },
    {
      "epoch": 3.3584765542117547,
      "grad_norm": 0.4848321573992459,
      "learning_rate": 4.098233247368226e-05,
      "loss": 1.5421,
      "num_input_tokens_seen": 24906650992,
      "step": 31657
    },
    {
      "epoch": 3.358582643751326,
      "grad_norm": 0.521806038990366,
      "learning_rate": 4.098179806220578e-05,
      "loss": 1.398,
      "num_input_tokens_seen": 24907437744,
      "step": 31658
    },
    {
      "epoch": 3.3586887332908977,
      "grad_norm": 0.4822299051165856,
      "learning_rate": 4.098126363837902e-05,
      "loss": 1.4716,
      "num_input_tokens_seen": 24908224576,
      "step": 31659
    },
    {
      "epoch": 3.358794822830469,
      "grad_norm": 0.6412349461076337,
      "learning_rate": 4.0980729202202416e-05,
      "loss": 1.5828,
      "num_input_tokens_seen": 24909011424,
      "step": 31660
    },
    {
      "epoch": 3.35890091237004,
      "grad_norm": 0.4413996063483633,
      "learning_rate": 4.098019475367638e-05,
      "loss": 1.5182,
      "num_input_tokens_seen": 24909798192,
      "step": 31661
    },
    {
      "epoch": 3.3590070019096117,
      "grad_norm": 0.5872792146711483,
      "learning_rate": 4.097966029280131e-05,
      "loss": 1.5209,
      "num_input_tokens_seen": 24910584960,
      "step": 31662
    },
    {
      "epoch": 3.359113091449183,
      "grad_norm": 0.41309003272353645,
      "learning_rate": 4.097912581957763e-05,
      "loss": 1.4382,
      "num_input_tokens_seen": 24911371760,
      "step": 31663
    },
    {
      "epoch": 3.3592191809887546,
      "grad_norm": 0.4560489614902153,
      "learning_rate": 4.0978591334005755e-05,
      "loss": 1.4008,
      "num_input_tokens_seen": 24912158592,
      "step": 31664
    },
    {
      "epoch": 3.359325270528326,
      "grad_norm": 0.43614703609119265,
      "learning_rate": 4.097805683608609e-05,
      "loss": 1.4981,
      "num_input_tokens_seen": 24912945328,
      "step": 31665
    },
    {
      "epoch": 3.359431360067897,
      "grad_norm": 0.4244769788061111,
      "learning_rate": 4.097752232581905e-05,
      "loss": 1.3721,
      "num_input_tokens_seen": 24913732144,
      "step": 31666
    },
    {
      "epoch": 3.3595374496074686,
      "grad_norm": 0.4521322791875698,
      "learning_rate": 4.097698780320505e-05,
      "loss": 1.5901,
      "num_input_tokens_seen": 24914518928,
      "step": 31667
    },
    {
      "epoch": 3.35964353914704,
      "grad_norm": 0.46583968677838355,
      "learning_rate": 4.097645326824451e-05,
      "loss": 1.5571,
      "num_input_tokens_seen": 24915305696,
      "step": 31668
    },
    {
      "epoch": 3.3597496286866115,
      "grad_norm": 0.4344271038071689,
      "learning_rate": 4.097591872093782e-05,
      "loss": 1.4756,
      "num_input_tokens_seen": 24916092432,
      "step": 31669
    },
    {
      "epoch": 3.359855718226183,
      "grad_norm": 0.4633405072606645,
      "learning_rate": 4.0975384161285424e-05,
      "loss": 1.3809,
      "num_input_tokens_seen": 24916879120,
      "step": 31670
    },
    {
      "epoch": 3.3599618077657545,
      "grad_norm": 0.4292016606590095,
      "learning_rate": 4.097484958928771e-05,
      "loss": 1.4895,
      "num_input_tokens_seen": 24917665888,
      "step": 31671
    },
    {
      "epoch": 3.3600678973053255,
      "grad_norm": 0.4303784278536826,
      "learning_rate": 4.0974315004945106e-05,
      "loss": 1.4031,
      "num_input_tokens_seen": 24918452640,
      "step": 31672
    },
    {
      "epoch": 3.360173986844897,
      "grad_norm": 0.4247950851738586,
      "learning_rate": 4.0973780408258025e-05,
      "loss": 1.4783,
      "num_input_tokens_seen": 24919239328,
      "step": 31673
    },
    {
      "epoch": 3.3602800763844685,
      "grad_norm": 0.49049385513843313,
      "learning_rate": 4.097324579922687e-05,
      "loss": 1.5555,
      "num_input_tokens_seen": 24920026064,
      "step": 31674
    },
    {
      "epoch": 3.36038616592404,
      "grad_norm": 0.43663606770407337,
      "learning_rate": 4.0972711177852055e-05,
      "loss": 1.5127,
      "num_input_tokens_seen": 24920812800,
      "step": 31675
    },
    {
      "epoch": 3.3604922554636114,
      "grad_norm": 0.48379242138304035,
      "learning_rate": 4.0972176544134e-05,
      "loss": 1.4518,
      "num_input_tokens_seen": 24921599536,
      "step": 31676
    },
    {
      "epoch": 3.360598345003183,
      "grad_norm": 0.40173127928173413,
      "learning_rate": 4.097164189807311e-05,
      "loss": 1.4075,
      "num_input_tokens_seen": 24922386272,
      "step": 31677
    },
    {
      "epoch": 3.360704434542754,
      "grad_norm": 0.46188056788397397,
      "learning_rate": 4.097110723966981e-05,
      "loss": 1.4573,
      "num_input_tokens_seen": 24923173072,
      "step": 31678
    },
    {
      "epoch": 3.3608105240823254,
      "grad_norm": 0.36130091146483784,
      "learning_rate": 4.097057256892451e-05,
      "loss": 1.3218,
      "num_input_tokens_seen": 24923959840,
      "step": 31679
    },
    {
      "epoch": 3.360916613621897,
      "grad_norm": 0.4361240921560526,
      "learning_rate": 4.097003788583762e-05,
      "loss": 1.5297,
      "num_input_tokens_seen": 24924746544,
      "step": 31680
    },
    {
      "epoch": 3.3610227031614683,
      "grad_norm": 0.4229211794952691,
      "learning_rate": 4.0969503190409554e-05,
      "loss": 1.5021,
      "num_input_tokens_seen": 24925533328,
      "step": 31681
    },
    {
      "epoch": 3.36112879270104,
      "grad_norm": 0.5484148409710444,
      "learning_rate": 4.096896848264072e-05,
      "loss": 1.5476,
      "num_input_tokens_seen": 24926320032,
      "step": 31682
    },
    {
      "epoch": 3.361234882240611,
      "grad_norm": 0.4612319408005067,
      "learning_rate": 4.0968433762531534e-05,
      "loss": 1.5174,
      "num_input_tokens_seen": 24927106832,
      "step": 31683
    },
    {
      "epoch": 3.3613409717801823,
      "grad_norm": 0.4619210782436093,
      "learning_rate": 4.096789903008241e-05,
      "loss": 1.4643,
      "num_input_tokens_seen": 24927893664,
      "step": 31684
    },
    {
      "epoch": 3.361447061319754,
      "grad_norm": 0.40496410343662537,
      "learning_rate": 4.096736428529377e-05,
      "loss": 1.4112,
      "num_input_tokens_seen": 24928680480,
      "step": 31685
    },
    {
      "epoch": 3.3615531508593253,
      "grad_norm": 0.43971774206402814,
      "learning_rate": 4.096682952816602e-05,
      "loss": 1.4728,
      "num_input_tokens_seen": 24929467152,
      "step": 31686
    },
    {
      "epoch": 3.3616592403988967,
      "grad_norm": 0.4668406574352018,
      "learning_rate": 4.0966294758699565e-05,
      "loss": 1.5475,
      "num_input_tokens_seen": 24930253952,
      "step": 31687
    },
    {
      "epoch": 3.361765329938468,
      "grad_norm": 0.39049331691943423,
      "learning_rate": 4.096575997689483e-05,
      "loss": 1.3397,
      "num_input_tokens_seen": 24931040720,
      "step": 31688
    },
    {
      "epoch": 3.3618714194780397,
      "grad_norm": 0.4841615801642915,
      "learning_rate": 4.096522518275222e-05,
      "loss": 1.5511,
      "num_input_tokens_seen": 24931827520,
      "step": 31689
    },
    {
      "epoch": 3.3619775090176107,
      "grad_norm": 0.41418444203304927,
      "learning_rate": 4.096469037627216e-05,
      "loss": 1.4744,
      "num_input_tokens_seen": 24932614352,
      "step": 31690
    },
    {
      "epoch": 3.362083598557182,
      "grad_norm": 0.404983041970307,
      "learning_rate": 4.0964155557455056e-05,
      "loss": 1.4335,
      "num_input_tokens_seen": 24933401120,
      "step": 31691
    },
    {
      "epoch": 3.3621896880967537,
      "grad_norm": 0.40897563587614216,
      "learning_rate": 4.096362072630131e-05,
      "loss": 1.4597,
      "num_input_tokens_seen": 24934187968,
      "step": 31692
    },
    {
      "epoch": 3.362295777636325,
      "grad_norm": 0.5819316049017321,
      "learning_rate": 4.096308588281135e-05,
      "loss": 1.5287,
      "num_input_tokens_seen": 24934974672,
      "step": 31693
    },
    {
      "epoch": 3.3624018671758966,
      "grad_norm": 0.4039735286226606,
      "learning_rate": 4.096255102698559e-05,
      "loss": 1.5013,
      "num_input_tokens_seen": 24935761392,
      "step": 31694
    },
    {
      "epoch": 3.3625079567154676,
      "grad_norm": 0.48280423609129836,
      "learning_rate": 4.096201615882443e-05,
      "loss": 1.394,
      "num_input_tokens_seen": 24936548208,
      "step": 31695
    },
    {
      "epoch": 3.362614046255039,
      "grad_norm": 0.4261654712700507,
      "learning_rate": 4.09614812783283e-05,
      "loss": 1.5274,
      "num_input_tokens_seen": 24937334848,
      "step": 31696
    },
    {
      "epoch": 3.3627201357946106,
      "grad_norm": 0.4449504320138681,
      "learning_rate": 4.096094638549761e-05,
      "loss": 1.3757,
      "num_input_tokens_seen": 24938121600,
      "step": 31697
    },
    {
      "epoch": 3.362826225334182,
      "grad_norm": 0.548502462028905,
      "learning_rate": 4.0960411480332766e-05,
      "loss": 1.4373,
      "num_input_tokens_seen": 24938908384,
      "step": 31698
    },
    {
      "epoch": 3.3629323148737535,
      "grad_norm": 0.4398732514188704,
      "learning_rate": 4.0959876562834184e-05,
      "loss": 1.3962,
      "num_input_tokens_seen": 24939695184,
      "step": 31699
    },
    {
      "epoch": 3.363038404413325,
      "grad_norm": 0.5248500094561963,
      "learning_rate": 4.0959341633002275e-05,
      "loss": 1.5043,
      "num_input_tokens_seen": 24940482000,
      "step": 31700
    },
    {
      "epoch": 3.363144493952896,
      "grad_norm": 0.37571004727960056,
      "learning_rate": 4.095880669083746e-05,
      "loss": 1.4589,
      "num_input_tokens_seen": 24941268848,
      "step": 31701
    },
    {
      "epoch": 3.3632505834924675,
      "grad_norm": 0.5363372004804898,
      "learning_rate": 4.095827173634014e-05,
      "loss": 1.3737,
      "num_input_tokens_seen": 24942055648,
      "step": 31702
    },
    {
      "epoch": 3.363356673032039,
      "grad_norm": 0.3759357318684262,
      "learning_rate": 4.095773676951074e-05,
      "loss": 1.5076,
      "num_input_tokens_seen": 24942842432,
      "step": 31703
    },
    {
      "epoch": 3.3634627625716105,
      "grad_norm": 0.48123499234071926,
      "learning_rate": 4.095720179034966e-05,
      "loss": 1.5284,
      "num_input_tokens_seen": 24943629168,
      "step": 31704
    },
    {
      "epoch": 3.363568852111182,
      "grad_norm": 0.40379671851100574,
      "learning_rate": 4.095666679885733e-05,
      "loss": 1.4224,
      "num_input_tokens_seen": 24944415968,
      "step": 31705
    },
    {
      "epoch": 3.3636749416507534,
      "grad_norm": 0.4613431504405501,
      "learning_rate": 4.095613179503416e-05,
      "loss": 1.491,
      "num_input_tokens_seen": 24945202720,
      "step": 31706
    },
    {
      "epoch": 3.3637810311903245,
      "grad_norm": 0.46463445655154395,
      "learning_rate": 4.095559677888056e-05,
      "loss": 1.5507,
      "num_input_tokens_seen": 24945989408,
      "step": 31707
    },
    {
      "epoch": 3.363887120729896,
      "grad_norm": 0.4432973259212663,
      "learning_rate": 4.095506175039694e-05,
      "loss": 1.4629,
      "num_input_tokens_seen": 24946776176,
      "step": 31708
    },
    {
      "epoch": 3.3639932102694674,
      "grad_norm": 0.43535210093902865,
      "learning_rate": 4.095452670958371e-05,
      "loss": 1.3751,
      "num_input_tokens_seen": 24947562944,
      "step": 31709
    },
    {
      "epoch": 3.364099299809039,
      "grad_norm": 0.4036544381553427,
      "learning_rate": 4.09539916564413e-05,
      "loss": 1.5084,
      "num_input_tokens_seen": 24948349680,
      "step": 31710
    },
    {
      "epoch": 3.3642053893486104,
      "grad_norm": 0.4191172809114195,
      "learning_rate": 4.095345659097011e-05,
      "loss": 1.4298,
      "num_input_tokens_seen": 24949136448,
      "step": 31711
    },
    {
      "epoch": 3.3643114788881814,
      "grad_norm": 0.44072973846844965,
      "learning_rate": 4.095292151317056e-05,
      "loss": 1.5308,
      "num_input_tokens_seen": 24949923280,
      "step": 31712
    },
    {
      "epoch": 3.364417568427753,
      "grad_norm": 0.4116913080858184,
      "learning_rate": 4.0952386423043056e-05,
      "loss": 1.5025,
      "num_input_tokens_seen": 24950710032,
      "step": 31713
    },
    {
      "epoch": 3.3645236579673243,
      "grad_norm": 0.4641509688406748,
      "learning_rate": 4.0951851320588014e-05,
      "loss": 1.4104,
      "num_input_tokens_seen": 24951496816,
      "step": 31714
    },
    {
      "epoch": 3.364629747506896,
      "grad_norm": 0.4048270180158634,
      "learning_rate": 4.095131620580585e-05,
      "loss": 1.3637,
      "num_input_tokens_seen": 24952283664,
      "step": 31715
    },
    {
      "epoch": 3.3647358370464673,
      "grad_norm": 0.4088596503062794,
      "learning_rate": 4.095078107869697e-05,
      "loss": 1.4823,
      "num_input_tokens_seen": 24953070416,
      "step": 31716
    },
    {
      "epoch": 3.3648419265860388,
      "grad_norm": 0.6571181050102661,
      "learning_rate": 4.0950245939261814e-05,
      "loss": 1.5418,
      "num_input_tokens_seen": 24953857152,
      "step": 31717
    },
    {
      "epoch": 3.3649480161256102,
      "grad_norm": 0.49060537607108745,
      "learning_rate": 4.094971078750076e-05,
      "loss": 1.5341,
      "num_input_tokens_seen": 24954643968,
      "step": 31718
    },
    {
      "epoch": 3.3650541056651813,
      "grad_norm": 0.5027194422381264,
      "learning_rate": 4.0949175623414246e-05,
      "loss": 1.4442,
      "num_input_tokens_seen": 24955430816,
      "step": 31719
    },
    {
      "epoch": 3.3651601952047527,
      "grad_norm": 0.6167885144454567,
      "learning_rate": 4.094864044700267e-05,
      "loss": 1.4923,
      "num_input_tokens_seen": 24956217600,
      "step": 31720
    },
    {
      "epoch": 3.365266284744324,
      "grad_norm": 0.5139789099709342,
      "learning_rate": 4.094810525826646e-05,
      "loss": 1.472,
      "num_input_tokens_seen": 24957004400,
      "step": 31721
    },
    {
      "epoch": 3.3653723742838957,
      "grad_norm": 0.5658695210668927,
      "learning_rate": 4.094757005720602e-05,
      "loss": 1.4919,
      "num_input_tokens_seen": 24957791232,
      "step": 31722
    },
    {
      "epoch": 3.365478463823467,
      "grad_norm": 0.385710541402764,
      "learning_rate": 4.094703484382176e-05,
      "loss": 1.4163,
      "num_input_tokens_seen": 24958577936,
      "step": 31723
    },
    {
      "epoch": 3.365584553363038,
      "grad_norm": 0.4395899632259653,
      "learning_rate": 4.094649961811411e-05,
      "loss": 1.4809,
      "num_input_tokens_seen": 24959364656,
      "step": 31724
    },
    {
      "epoch": 3.3656906429026097,
      "grad_norm": 0.4521668980206523,
      "learning_rate": 4.094596438008347e-05,
      "loss": 1.3932,
      "num_input_tokens_seen": 24960151488,
      "step": 31725
    },
    {
      "epoch": 3.365796732442181,
      "grad_norm": 0.4384220904700748,
      "learning_rate": 4.0945429129730254e-05,
      "loss": 1.5302,
      "num_input_tokens_seen": 24960938208,
      "step": 31726
    },
    {
      "epoch": 3.3659028219817526,
      "grad_norm": 0.44336676537418224,
      "learning_rate": 4.094489386705487e-05,
      "loss": 1.4643,
      "num_input_tokens_seen": 24961724928,
      "step": 31727
    },
    {
      "epoch": 3.366008911521324,
      "grad_norm": 0.43327173873129415,
      "learning_rate": 4.0944358592057753e-05,
      "loss": 1.4756,
      "num_input_tokens_seen": 24962511728,
      "step": 31728
    },
    {
      "epoch": 3.3661150010608956,
      "grad_norm": 0.449934817187766,
      "learning_rate": 4.0943823304739295e-05,
      "loss": 1.4307,
      "num_input_tokens_seen": 24963298496,
      "step": 31729
    },
    {
      "epoch": 3.366221090600467,
      "grad_norm": 0.501024998403459,
      "learning_rate": 4.094328800509992e-05,
      "loss": 1.4781,
      "num_input_tokens_seen": 24964085248,
      "step": 31730
    },
    {
      "epoch": 3.366327180140038,
      "grad_norm": 0.42903228637715934,
      "learning_rate": 4.094275269314004e-05,
      "loss": 1.4662,
      "num_input_tokens_seen": 24964871984,
      "step": 31731
    },
    {
      "epoch": 3.3664332696796095,
      "grad_norm": 0.4067778322801015,
      "learning_rate": 4.094221736886007e-05,
      "loss": 1.4082,
      "num_input_tokens_seen": 24965658768,
      "step": 31732
    },
    {
      "epoch": 3.366539359219181,
      "grad_norm": 0.49603318131139257,
      "learning_rate": 4.094168203226042e-05,
      "loss": 1.5608,
      "num_input_tokens_seen": 24966445568,
      "step": 31733
    },
    {
      "epoch": 3.3666454487587525,
      "grad_norm": 0.3911762446414868,
      "learning_rate": 4.094114668334151e-05,
      "loss": 1.3347,
      "num_input_tokens_seen": 24967232384,
      "step": 31734
    },
    {
      "epoch": 3.366751538298324,
      "grad_norm": 0.3797874574533096,
      "learning_rate": 4.094061132210375e-05,
      "loss": 1.3111,
      "num_input_tokens_seen": 24968019248,
      "step": 31735
    },
    {
      "epoch": 3.366857627837895,
      "grad_norm": 0.43400741423028294,
      "learning_rate": 4.0940075948547545e-05,
      "loss": 1.4717,
      "num_input_tokens_seen": 24968806064,
      "step": 31736
    },
    {
      "epoch": 3.3669637173774665,
      "grad_norm": 0.3945417771788336,
      "learning_rate": 4.093954056267332e-05,
      "loss": 1.3694,
      "num_input_tokens_seen": 24969592896,
      "step": 31737
    },
    {
      "epoch": 3.367069806917038,
      "grad_norm": 0.5273364046088268,
      "learning_rate": 4.0939005164481495e-05,
      "loss": 1.5582,
      "num_input_tokens_seen": 24970379680,
      "step": 31738
    },
    {
      "epoch": 3.3671758964566094,
      "grad_norm": 0.3845249762345073,
      "learning_rate": 4.093846975397246e-05,
      "loss": 1.3997,
      "num_input_tokens_seen": 24971166496,
      "step": 31739
    },
    {
      "epoch": 3.367281985996181,
      "grad_norm": 0.43744315418462826,
      "learning_rate": 4.0937934331146656e-05,
      "loss": 1.3849,
      "num_input_tokens_seen": 24971953280,
      "step": 31740
    },
    {
      "epoch": 3.3673880755357524,
      "grad_norm": 0.41204674107459616,
      "learning_rate": 4.093739889600448e-05,
      "loss": 1.3527,
      "num_input_tokens_seen": 24972740000,
      "step": 31741
    },
    {
      "epoch": 3.3674941650753234,
      "grad_norm": 0.4960190309758364,
      "learning_rate": 4.093686344854635e-05,
      "loss": 1.5666,
      "num_input_tokens_seen": 24973526800,
      "step": 31742
    },
    {
      "epoch": 3.367600254614895,
      "grad_norm": 0.42527205853639904,
      "learning_rate": 4.093632798877267e-05,
      "loss": 1.4285,
      "num_input_tokens_seen": 24974313632,
      "step": 31743
    },
    {
      "epoch": 3.3677063441544663,
      "grad_norm": 0.47475896615965,
      "learning_rate": 4.093579251668388e-05,
      "loss": 1.4285,
      "num_input_tokens_seen": 24975100432,
      "step": 31744
    },
    {
      "epoch": 3.367812433694038,
      "grad_norm": 0.4435926359668698,
      "learning_rate": 4.093525703228037e-05,
      "loss": 1.4848,
      "num_input_tokens_seen": 24975887136,
      "step": 31745
    },
    {
      "epoch": 3.3679185232336093,
      "grad_norm": 0.42168904389577855,
      "learning_rate": 4.093472153556256e-05,
      "loss": 1.5049,
      "num_input_tokens_seen": 24976673888,
      "step": 31746
    },
    {
      "epoch": 3.3680246127731808,
      "grad_norm": 0.49821376062996636,
      "learning_rate": 4.0934186026530854e-05,
      "loss": 1.5209,
      "num_input_tokens_seen": 24977460560,
      "step": 31747
    },
    {
      "epoch": 3.368130702312752,
      "grad_norm": 0.5142026989946239,
      "learning_rate": 4.09336505051857e-05,
      "loss": 1.4814,
      "num_input_tokens_seen": 24978247424,
      "step": 31748
    },
    {
      "epoch": 3.3682367918523233,
      "grad_norm": 0.43535562774653913,
      "learning_rate": 4.0933114971527466e-05,
      "loss": 1.3814,
      "num_input_tokens_seen": 24979034208,
      "step": 31749
    },
    {
      "epoch": 3.3683428813918947,
      "grad_norm": 0.6342256537188625,
      "learning_rate": 4.09325794255566e-05,
      "loss": 1.5684,
      "num_input_tokens_seen": 24979820976,
      "step": 31750
    },
    {
      "epoch": 3.3684489709314662,
      "grad_norm": 0.5474059549046268,
      "learning_rate": 4.09320438672735e-05,
      "loss": 1.4564,
      "num_input_tokens_seen": 24980607840,
      "step": 31751
    },
    {
      "epoch": 3.3685550604710377,
      "grad_norm": 0.5660520397171283,
      "learning_rate": 4.093150829667859e-05,
      "loss": 1.4444,
      "num_input_tokens_seen": 24981394544,
      "step": 31752
    },
    {
      "epoch": 3.3686611500106087,
      "grad_norm": 0.5809769118448334,
      "learning_rate": 4.093097271377227e-05,
      "loss": 1.4442,
      "num_input_tokens_seen": 24982181232,
      "step": 31753
    },
    {
      "epoch": 3.36876723955018,
      "grad_norm": 0.5017068398622606,
      "learning_rate": 4.0930437118554965e-05,
      "loss": 1.3241,
      "num_input_tokens_seen": 24982968016,
      "step": 31754
    },
    {
      "epoch": 3.3688733290897517,
      "grad_norm": 0.5426590628376029,
      "learning_rate": 4.092990151102708e-05,
      "loss": 1.3866,
      "num_input_tokens_seen": 24983754752,
      "step": 31755
    },
    {
      "epoch": 3.368979418629323,
      "grad_norm": 0.623848332174009,
      "learning_rate": 4.0929365891189045e-05,
      "loss": 1.4662,
      "num_input_tokens_seen": 24984541488,
      "step": 31756
    },
    {
      "epoch": 3.3690855081688946,
      "grad_norm": 0.48188527905875866,
      "learning_rate": 4.092883025904126e-05,
      "loss": 1.3817,
      "num_input_tokens_seen": 24985328256,
      "step": 31757
    },
    {
      "epoch": 3.369191597708466,
      "grad_norm": 0.4968007440976394,
      "learning_rate": 4.092829461458414e-05,
      "loss": 1.5358,
      "num_input_tokens_seen": 24986115104,
      "step": 31758
    },
    {
      "epoch": 3.3692976872480376,
      "grad_norm": 0.4474142052184711,
      "learning_rate": 4.09277589578181e-05,
      "loss": 1.4596,
      "num_input_tokens_seen": 24986901888,
      "step": 31759
    },
    {
      "epoch": 3.3694037767876086,
      "grad_norm": 0.46075785175743833,
      "learning_rate": 4.0927223288743563e-05,
      "loss": 1.5403,
      "num_input_tokens_seen": 24987688640,
      "step": 31760
    },
    {
      "epoch": 3.36950986632718,
      "grad_norm": 0.44364311419903923,
      "learning_rate": 4.092668760736092e-05,
      "loss": 1.5075,
      "num_input_tokens_seen": 24988475424,
      "step": 31761
    },
    {
      "epoch": 3.3696159558667516,
      "grad_norm": 0.43432394043158506,
      "learning_rate": 4.0926151913670615e-05,
      "loss": 1.3054,
      "num_input_tokens_seen": 24989262320,
      "step": 31762
    },
    {
      "epoch": 3.369722045406323,
      "grad_norm": 0.38110374823277926,
      "learning_rate": 4.092561620767305e-05,
      "loss": 1.4087,
      "num_input_tokens_seen": 24990049104,
      "step": 31763
    },
    {
      "epoch": 3.3698281349458945,
      "grad_norm": 0.4531635245667426,
      "learning_rate": 4.0925080489368614e-05,
      "loss": 1.49,
      "num_input_tokens_seen": 24990835824,
      "step": 31764
    },
    {
      "epoch": 3.3699342244854655,
      "grad_norm": 0.584720957695824,
      "learning_rate": 4.092454475875777e-05,
      "loss": 1.5148,
      "num_input_tokens_seen": 24991622528,
      "step": 31765
    },
    {
      "epoch": 3.370040314025037,
      "grad_norm": 0.43640125232658333,
      "learning_rate": 4.0924009015840886e-05,
      "loss": 1.4131,
      "num_input_tokens_seen": 24992409280,
      "step": 31766
    },
    {
      "epoch": 3.3701464035646085,
      "grad_norm": 0.5033208115107439,
      "learning_rate": 4.0923473260618406e-05,
      "loss": 1.3444,
      "num_input_tokens_seen": 24993196064,
      "step": 31767
    },
    {
      "epoch": 3.37025249310418,
      "grad_norm": 0.43960403320468094,
      "learning_rate": 4.0922937493090725e-05,
      "loss": 1.5216,
      "num_input_tokens_seen": 24993982832,
      "step": 31768
    },
    {
      "epoch": 3.3703585826437514,
      "grad_norm": 0.7441559499280518,
      "learning_rate": 4.0922401713258265e-05,
      "loss": 1.4555,
      "num_input_tokens_seen": 24994769616,
      "step": 31769
    },
    {
      "epoch": 3.370464672183323,
      "grad_norm": 0.4355762905431977,
      "learning_rate": 4.092186592112145e-05,
      "loss": 1.4612,
      "num_input_tokens_seen": 24995556432,
      "step": 31770
    },
    {
      "epoch": 3.370570761722894,
      "grad_norm": 0.6297818157845361,
      "learning_rate": 4.092133011668067e-05,
      "loss": 1.3959,
      "num_input_tokens_seen": 24996343184,
      "step": 31771
    },
    {
      "epoch": 3.3706768512624654,
      "grad_norm": 0.53811730041824,
      "learning_rate": 4.0920794299936365e-05,
      "loss": 1.5104,
      "num_input_tokens_seen": 24997129936,
      "step": 31772
    },
    {
      "epoch": 3.370782940802037,
      "grad_norm": 0.4401970245798979,
      "learning_rate": 4.092025847088893e-05,
      "loss": 1.3964,
      "num_input_tokens_seen": 24997916656,
      "step": 31773
    },
    {
      "epoch": 3.3708890303416084,
      "grad_norm": 0.5762391324210242,
      "learning_rate": 4.0919722629538794e-05,
      "loss": 1.4754,
      "num_input_tokens_seen": 24998703456,
      "step": 31774
    },
    {
      "epoch": 3.37099511988118,
      "grad_norm": 0.437829051455964,
      "learning_rate": 4.091918677588636e-05,
      "loss": 1.4373,
      "num_input_tokens_seen": 24999490224,
      "step": 31775
    },
    {
      "epoch": 3.3711012094207513,
      "grad_norm": 0.4904393526275508,
      "learning_rate": 4.0918650909932043e-05,
      "loss": 1.4921,
      "num_input_tokens_seen": 25000277056,
      "step": 31776
    },
    {
      "epoch": 3.3712072989603223,
      "grad_norm": 0.6260827879974725,
      "learning_rate": 4.0918115031676266e-05,
      "loss": 1.5881,
      "num_input_tokens_seen": 25001063824,
      "step": 31777
    },
    {
      "epoch": 3.371313388499894,
      "grad_norm": 0.41900868081872333,
      "learning_rate": 4.091757914111943e-05,
      "loss": 1.4114,
      "num_input_tokens_seen": 25001850736,
      "step": 31778
    },
    {
      "epoch": 3.3714194780394653,
      "grad_norm": 0.6959400196781863,
      "learning_rate": 4.091704323826195e-05,
      "loss": 1.4634,
      "num_input_tokens_seen": 25002637584,
      "step": 31779
    },
    {
      "epoch": 3.3715255675790368,
      "grad_norm": 0.4717702330539321,
      "learning_rate": 4.091650732310426e-05,
      "loss": 1.5319,
      "num_input_tokens_seen": 25003424368,
      "step": 31780
    },
    {
      "epoch": 3.3716316571186082,
      "grad_norm": 0.5213500649135338,
      "learning_rate": 4.091597139564676e-05,
      "loss": 1.3707,
      "num_input_tokens_seen": 25004211088,
      "step": 31781
    },
    {
      "epoch": 3.3717377466581793,
      "grad_norm": 0.5427949637914102,
      "learning_rate": 4.091543545588985e-05,
      "loss": 1.4744,
      "num_input_tokens_seen": 25004997824,
      "step": 31782
    },
    {
      "epoch": 3.3718438361977507,
      "grad_norm": 0.47467683373847686,
      "learning_rate": 4.091489950383397e-05,
      "loss": 1.5792,
      "num_input_tokens_seen": 25005784464,
      "step": 31783
    },
    {
      "epoch": 3.371949925737322,
      "grad_norm": 0.47476481963813427,
      "learning_rate": 4.091436353947952e-05,
      "loss": 1.3714,
      "num_input_tokens_seen": 25006571296,
      "step": 31784
    },
    {
      "epoch": 3.3720560152768937,
      "grad_norm": 0.5590740198450808,
      "learning_rate": 4.091382756282692e-05,
      "loss": 1.5222,
      "num_input_tokens_seen": 25007358144,
      "step": 31785
    },
    {
      "epoch": 3.372162104816465,
      "grad_norm": 0.47069865360005436,
      "learning_rate": 4.091329157387658e-05,
      "loss": 1.5183,
      "num_input_tokens_seen": 25008144912,
      "step": 31786
    },
    {
      "epoch": 3.3722681943560366,
      "grad_norm": 0.44803894195091454,
      "learning_rate": 4.091275557262891e-05,
      "loss": 1.4475,
      "num_input_tokens_seen": 25008931808,
      "step": 31787
    },
    {
      "epoch": 3.372374283895608,
      "grad_norm": 0.4756740941222149,
      "learning_rate": 4.091221955908433e-05,
      "loss": 1.4852,
      "num_input_tokens_seen": 25009718544,
      "step": 31788
    },
    {
      "epoch": 3.372480373435179,
      "grad_norm": 0.42616155233227476,
      "learning_rate": 4.091168353324325e-05,
      "loss": 1.5618,
      "num_input_tokens_seen": 25010505248,
      "step": 31789
    },
    {
      "epoch": 3.3725864629747506,
      "grad_norm": 0.43044642107856534,
      "learning_rate": 4.0911147495106096e-05,
      "loss": 1.4996,
      "num_input_tokens_seen": 25011292032,
      "step": 31790
    },
    {
      "epoch": 3.372692552514322,
      "grad_norm": 0.42840887384327125,
      "learning_rate": 4.0910611444673274e-05,
      "loss": 1.4404,
      "num_input_tokens_seen": 25012078864,
      "step": 31791
    },
    {
      "epoch": 3.3727986420538936,
      "grad_norm": 0.43952234640383964,
      "learning_rate": 4.091007538194519e-05,
      "loss": 1.493,
      "num_input_tokens_seen": 25012865616,
      "step": 31792
    },
    {
      "epoch": 3.372904731593465,
      "grad_norm": 0.4271027393102342,
      "learning_rate": 4.090953930692228e-05,
      "loss": 1.4327,
      "num_input_tokens_seen": 25013652336,
      "step": 31793
    },
    {
      "epoch": 3.373010821133036,
      "grad_norm": 0.46852515181325727,
      "learning_rate": 4.090900321960493e-05,
      "loss": 1.5235,
      "num_input_tokens_seen": 25014439040,
      "step": 31794
    },
    {
      "epoch": 3.3731169106726075,
      "grad_norm": 0.4214686149948228,
      "learning_rate": 4.090846711999359e-05,
      "loss": 1.4639,
      "num_input_tokens_seen": 25015225776,
      "step": 31795
    },
    {
      "epoch": 3.373223000212179,
      "grad_norm": 0.5530033327414943,
      "learning_rate": 4.090793100808863e-05,
      "loss": 1.5581,
      "num_input_tokens_seen": 25016012576,
      "step": 31796
    },
    {
      "epoch": 3.3733290897517505,
      "grad_norm": 0.45514300739894775,
      "learning_rate": 4.09073948838905e-05,
      "loss": 1.5405,
      "num_input_tokens_seen": 25016799456,
      "step": 31797
    },
    {
      "epoch": 3.373435179291322,
      "grad_norm": 0.46027982513144144,
      "learning_rate": 4.0906858747399604e-05,
      "loss": 1.5602,
      "num_input_tokens_seen": 25017586272,
      "step": 31798
    },
    {
      "epoch": 3.3735412688308934,
      "grad_norm": 0.4253190146632263,
      "learning_rate": 4.090632259861634e-05,
      "loss": 1.3789,
      "num_input_tokens_seen": 25018373088,
      "step": 31799
    },
    {
      "epoch": 3.373647358370465,
      "grad_norm": 0.37848694887002043,
      "learning_rate": 4.090578643754115e-05,
      "loss": 1.4769,
      "num_input_tokens_seen": 25019159872,
      "step": 31800
    },
    {
      "epoch": 3.373753447910036,
      "grad_norm": 0.4178953833592075,
      "learning_rate": 4.090525026417443e-05,
      "loss": 1.3758,
      "num_input_tokens_seen": 25019946624,
      "step": 31801
    },
    {
      "epoch": 3.3738595374496074,
      "grad_norm": 0.3989512839317044,
      "learning_rate": 4.0904714078516607e-05,
      "loss": 1.4695,
      "num_input_tokens_seen": 25020733360,
      "step": 31802
    },
    {
      "epoch": 3.373965626989179,
      "grad_norm": 0.4515314154482633,
      "learning_rate": 4.090417788056807e-05,
      "loss": 1.3974,
      "num_input_tokens_seen": 25021520096,
      "step": 31803
    },
    {
      "epoch": 3.3740717165287504,
      "grad_norm": 0.3970047458957235,
      "learning_rate": 4.090364167032927e-05,
      "loss": 1.4063,
      "num_input_tokens_seen": 25022306832,
      "step": 31804
    },
    {
      "epoch": 3.374177806068322,
      "grad_norm": 0.4762106355513545,
      "learning_rate": 4.0903105447800595e-05,
      "loss": 1.4686,
      "num_input_tokens_seen": 25023093616,
      "step": 31805
    },
    {
      "epoch": 3.374283895607893,
      "grad_norm": 0.4168279664776551,
      "learning_rate": 4.090256921298247e-05,
      "loss": 1.444,
      "num_input_tokens_seen": 25023880416,
      "step": 31806
    },
    {
      "epoch": 3.3743899851474644,
      "grad_norm": 0.4836933141521888,
      "learning_rate": 4.09020329658753e-05,
      "loss": 1.4549,
      "num_input_tokens_seen": 25024667168,
      "step": 31807
    },
    {
      "epoch": 3.374496074687036,
      "grad_norm": 0.68910415017202,
      "learning_rate": 4.09014967064795e-05,
      "loss": 1.5238,
      "num_input_tokens_seen": 25025453936,
      "step": 31808
    },
    {
      "epoch": 3.3746021642266073,
      "grad_norm": 0.5265829809373506,
      "learning_rate": 4.09009604347955e-05,
      "loss": 1.5077,
      "num_input_tokens_seen": 25026240640,
      "step": 31809
    },
    {
      "epoch": 3.374708253766179,
      "grad_norm": 0.440235287970528,
      "learning_rate": 4.090042415082371e-05,
      "loss": 1.4288,
      "num_input_tokens_seen": 25027027440,
      "step": 31810
    },
    {
      "epoch": 3.37481434330575,
      "grad_norm": 0.4351532978892863,
      "learning_rate": 4.089988785456453e-05,
      "loss": 1.3956,
      "num_input_tokens_seen": 25027814208,
      "step": 31811
    },
    {
      "epoch": 3.3749204328453213,
      "grad_norm": 0.49526185507695947,
      "learning_rate": 4.0899351546018386e-05,
      "loss": 1.5226,
      "num_input_tokens_seen": 25028600960,
      "step": 31812
    },
    {
      "epoch": 3.3750265223848928,
      "grad_norm": 0.42080618101088485,
      "learning_rate": 4.0898815225185684e-05,
      "loss": 1.4004,
      "num_input_tokens_seen": 25029387664,
      "step": 31813
    },
    {
      "epoch": 3.3751326119244642,
      "grad_norm": 0.4919252267631938,
      "learning_rate": 4.0898278892066844e-05,
      "loss": 1.504,
      "num_input_tokens_seen": 25030174384,
      "step": 31814
    },
    {
      "epoch": 3.3752387014640357,
      "grad_norm": 0.4356908138430772,
      "learning_rate": 4.0897742546662285e-05,
      "loss": 1.3537,
      "num_input_tokens_seen": 25030961088,
      "step": 31815
    },
    {
      "epoch": 3.375344791003607,
      "grad_norm": 0.5109933214540542,
      "learning_rate": 4.0897206188972415e-05,
      "loss": 1.4387,
      "num_input_tokens_seen": 25031747920,
      "step": 31816
    },
    {
      "epoch": 3.3754508805431787,
      "grad_norm": 0.405256567474922,
      "learning_rate": 4.089666981899766e-05,
      "loss": 1.3583,
      "num_input_tokens_seen": 25032534752,
      "step": 31817
    },
    {
      "epoch": 3.3755569700827497,
      "grad_norm": 0.4562700744515597,
      "learning_rate": 4.0896133436738414e-05,
      "loss": 1.4729,
      "num_input_tokens_seen": 25033321488,
      "step": 31818
    },
    {
      "epoch": 3.375663059622321,
      "grad_norm": 0.4220594170349395,
      "learning_rate": 4.08955970421951e-05,
      "loss": 1.4455,
      "num_input_tokens_seen": 25034108208,
      "step": 31819
    },
    {
      "epoch": 3.3757691491618926,
      "grad_norm": 0.4485125797225129,
      "learning_rate": 4.0895060635368146e-05,
      "loss": 1.411,
      "num_input_tokens_seen": 25034894896,
      "step": 31820
    },
    {
      "epoch": 3.375875238701464,
      "grad_norm": 0.5554456975459507,
      "learning_rate": 4.089452421625795e-05,
      "loss": 1.5074,
      "num_input_tokens_seen": 25035681696,
      "step": 31821
    },
    {
      "epoch": 3.3759813282410356,
      "grad_norm": 0.4313283068176669,
      "learning_rate": 4.0893987784864926e-05,
      "loss": 1.4034,
      "num_input_tokens_seen": 25036468448,
      "step": 31822
    },
    {
      "epoch": 3.3760874177806066,
      "grad_norm": 0.4321848992425093,
      "learning_rate": 4.089345134118951e-05,
      "loss": 1.4435,
      "num_input_tokens_seen": 25037255216,
      "step": 31823
    },
    {
      "epoch": 3.376193507320178,
      "grad_norm": 0.4801239476746036,
      "learning_rate": 4.0892914885232095e-05,
      "loss": 1.4953,
      "num_input_tokens_seen": 25038041904,
      "step": 31824
    },
    {
      "epoch": 3.3762995968597496,
      "grad_norm": 0.39800302100884727,
      "learning_rate": 4.0892378416993095e-05,
      "loss": 1.4533,
      "num_input_tokens_seen": 25038828672,
      "step": 31825
    },
    {
      "epoch": 3.376405686399321,
      "grad_norm": 0.41866749427097466,
      "learning_rate": 4.089184193647293e-05,
      "loss": 1.3471,
      "num_input_tokens_seen": 25039615376,
      "step": 31826
    },
    {
      "epoch": 3.3765117759388925,
      "grad_norm": 0.4368100893134511,
      "learning_rate": 4.089130544367202e-05,
      "loss": 1.4213,
      "num_input_tokens_seen": 25040402112,
      "step": 31827
    },
    {
      "epoch": 3.376617865478464,
      "grad_norm": 0.4452312692531338,
      "learning_rate": 4.0890768938590775e-05,
      "loss": 1.5364,
      "num_input_tokens_seen": 25041188784,
      "step": 31828
    },
    {
      "epoch": 3.3767239550180355,
      "grad_norm": 0.3995201239214413,
      "learning_rate": 4.089023242122961e-05,
      "loss": 1.3792,
      "num_input_tokens_seen": 25041975680,
      "step": 31829
    },
    {
      "epoch": 3.3768300445576065,
      "grad_norm": 0.4123074277204485,
      "learning_rate": 4.088969589158895e-05,
      "loss": 1.4845,
      "num_input_tokens_seen": 25042762416,
      "step": 31830
    },
    {
      "epoch": 3.376936134097178,
      "grad_norm": 0.3811779026795719,
      "learning_rate": 4.088915934966919e-05,
      "loss": 1.3667,
      "num_input_tokens_seen": 25043549264,
      "step": 31831
    },
    {
      "epoch": 3.3770422236367494,
      "grad_norm": 0.4113720438983829,
      "learning_rate": 4.088862279547075e-05,
      "loss": 1.4821,
      "num_input_tokens_seen": 25044335952,
      "step": 31832
    },
    {
      "epoch": 3.377148313176321,
      "grad_norm": 0.44961732099152013,
      "learning_rate": 4.088808622899405e-05,
      "loss": 1.5275,
      "num_input_tokens_seen": 25045122800,
      "step": 31833
    },
    {
      "epoch": 3.3772544027158924,
      "grad_norm": 0.4084971569325706,
      "learning_rate": 4.088754965023951e-05,
      "loss": 1.4988,
      "num_input_tokens_seen": 25045909424,
      "step": 31834
    },
    {
      "epoch": 3.3773604922554634,
      "grad_norm": 0.44334791853133404,
      "learning_rate": 4.0887013059207534e-05,
      "loss": 1.4882,
      "num_input_tokens_seen": 25046696240,
      "step": 31835
    },
    {
      "epoch": 3.377466581795035,
      "grad_norm": 0.41540687584176295,
      "learning_rate": 4.088647645589854e-05,
      "loss": 1.4846,
      "num_input_tokens_seen": 25047483024,
      "step": 31836
    },
    {
      "epoch": 3.3775726713346064,
      "grad_norm": 0.42764830288102573,
      "learning_rate": 4.088593984031294e-05,
      "loss": 1.408,
      "num_input_tokens_seen": 25048269760,
      "step": 31837
    },
    {
      "epoch": 3.377678760874178,
      "grad_norm": 0.4710461815843489,
      "learning_rate": 4.088540321245116e-05,
      "loss": 1.5036,
      "num_input_tokens_seen": 25049056512,
      "step": 31838
    },
    {
      "epoch": 3.3777848504137493,
      "grad_norm": 0.4421678872479261,
      "learning_rate": 4.08848665723136e-05,
      "loss": 1.5433,
      "num_input_tokens_seen": 25049843280,
      "step": 31839
    },
    {
      "epoch": 3.377890939953321,
      "grad_norm": 0.48980049387042834,
      "learning_rate": 4.0884329919900675e-05,
      "loss": 1.4201,
      "num_input_tokens_seen": 25050630080,
      "step": 31840
    },
    {
      "epoch": 3.377997029492892,
      "grad_norm": 0.4452155994144238,
      "learning_rate": 4.088379325521282e-05,
      "loss": 1.5169,
      "num_input_tokens_seen": 25051416848,
      "step": 31841
    },
    {
      "epoch": 3.3781031190324633,
      "grad_norm": 0.472034578227766,
      "learning_rate": 4.088325657825043e-05,
      "loss": 1.491,
      "num_input_tokens_seen": 25052203568,
      "step": 31842
    },
    {
      "epoch": 3.3782092085720348,
      "grad_norm": 0.5194838260117004,
      "learning_rate": 4.088271988901392e-05,
      "loss": 1.5261,
      "num_input_tokens_seen": 25052990304,
      "step": 31843
    },
    {
      "epoch": 3.3783152981116062,
      "grad_norm": 0.4351685744622083,
      "learning_rate": 4.088218318750372e-05,
      "loss": 1.4154,
      "num_input_tokens_seen": 25053777008,
      "step": 31844
    },
    {
      "epoch": 3.3784213876511777,
      "grad_norm": 0.7401283537617609,
      "learning_rate": 4.088164647372022e-05,
      "loss": 1.5289,
      "num_input_tokens_seen": 25054563760,
      "step": 31845
    },
    {
      "epoch": 3.378527477190749,
      "grad_norm": 0.4441742759738346,
      "learning_rate": 4.088110974766386e-05,
      "loss": 1.5261,
      "num_input_tokens_seen": 25055350448,
      "step": 31846
    },
    {
      "epoch": 3.3786335667303202,
      "grad_norm": 0.5003452186106062,
      "learning_rate": 4.088057300933505e-05,
      "loss": 1.3423,
      "num_input_tokens_seen": 25056137152,
      "step": 31847
    },
    {
      "epoch": 3.3787396562698917,
      "grad_norm": 0.6777959016023708,
      "learning_rate": 4.088003625873419e-05,
      "loss": 1.5536,
      "num_input_tokens_seen": 25056923984,
      "step": 31848
    },
    {
      "epoch": 3.378845745809463,
      "grad_norm": 0.5392103208613939,
      "learning_rate": 4.0879499495861704e-05,
      "loss": 1.5375,
      "num_input_tokens_seen": 25057710736,
      "step": 31849
    },
    {
      "epoch": 3.3789518353490346,
      "grad_norm": 0.6279045106331169,
      "learning_rate": 4.087896272071801e-05,
      "loss": 1.3785,
      "num_input_tokens_seen": 25058497632,
      "step": 31850
    },
    {
      "epoch": 3.379057924888606,
      "grad_norm": 0.4299579236704978,
      "learning_rate": 4.0878425933303524e-05,
      "loss": 1.4526,
      "num_input_tokens_seen": 25059284288,
      "step": 31851
    },
    {
      "epoch": 3.379164014428177,
      "grad_norm": 0.49813329180616345,
      "learning_rate": 4.087788913361864e-05,
      "loss": 1.4692,
      "num_input_tokens_seen": 25060070992,
      "step": 31852
    },
    {
      "epoch": 3.3792701039677486,
      "grad_norm": 0.4848455941325542,
      "learning_rate": 4.087735232166381e-05,
      "loss": 1.5461,
      "num_input_tokens_seen": 25060857744,
      "step": 31853
    },
    {
      "epoch": 3.37937619350732,
      "grad_norm": 0.4195258020316352,
      "learning_rate": 4.087681549743941e-05,
      "loss": 1.3403,
      "num_input_tokens_seen": 25061644528,
      "step": 31854
    },
    {
      "epoch": 3.3794822830468916,
      "grad_norm": 0.5449748993419827,
      "learning_rate": 4.087627866094589e-05,
      "loss": 1.5437,
      "num_input_tokens_seen": 25062431312,
      "step": 31855
    },
    {
      "epoch": 3.379588372586463,
      "grad_norm": 0.41715388673373277,
      "learning_rate": 4.087574181218363e-05,
      "loss": 1.4919,
      "num_input_tokens_seen": 25063218160,
      "step": 31856
    },
    {
      "epoch": 3.3796944621260345,
      "grad_norm": 0.4665190155797736,
      "learning_rate": 4.087520495115308e-05,
      "loss": 1.4655,
      "num_input_tokens_seen": 25064004928,
      "step": 31857
    },
    {
      "epoch": 3.379800551665606,
      "grad_norm": 0.3939908077745153,
      "learning_rate": 4.087466807785463e-05,
      "loss": 1.4999,
      "num_input_tokens_seen": 25064791760,
      "step": 31858
    },
    {
      "epoch": 3.379906641205177,
      "grad_norm": 0.43771884680161605,
      "learning_rate": 4.08741311922887e-05,
      "loss": 1.5463,
      "num_input_tokens_seen": 25065578464,
      "step": 31859
    },
    {
      "epoch": 3.3800127307447485,
      "grad_norm": 0.47443987348556427,
      "learning_rate": 4.08735942944557e-05,
      "loss": 1.5669,
      "num_input_tokens_seen": 25066365232,
      "step": 31860
    },
    {
      "epoch": 3.38011882028432,
      "grad_norm": 0.40945490930410966,
      "learning_rate": 4.087305738435606e-05,
      "loss": 1.4314,
      "num_input_tokens_seen": 25067151904,
      "step": 31861
    },
    {
      "epoch": 3.3802249098238915,
      "grad_norm": 0.45132916812410884,
      "learning_rate": 4.0872520461990194e-05,
      "loss": 1.4263,
      "num_input_tokens_seen": 25067938768,
      "step": 31862
    },
    {
      "epoch": 3.380330999363463,
      "grad_norm": 0.501521012589669,
      "learning_rate": 4.08719835273585e-05,
      "loss": 1.5069,
      "num_input_tokens_seen": 25068725520,
      "step": 31863
    },
    {
      "epoch": 3.380437088903034,
      "grad_norm": 0.4172084241722064,
      "learning_rate": 4.08714465804614e-05,
      "loss": 1.4875,
      "num_input_tokens_seen": 25069512304,
      "step": 31864
    },
    {
      "epoch": 3.3805431784426054,
      "grad_norm": 0.560016922689468,
      "learning_rate": 4.0870909621299324e-05,
      "loss": 1.3527,
      "num_input_tokens_seen": 25070299136,
      "step": 31865
    },
    {
      "epoch": 3.380649267982177,
      "grad_norm": 0.4759358829953225,
      "learning_rate": 4.087037264987267e-05,
      "loss": 1.5722,
      "num_input_tokens_seen": 25071085808,
      "step": 31866
    },
    {
      "epoch": 3.3807553575217484,
      "grad_norm": 0.46938180941227053,
      "learning_rate": 4.0869835666181854e-05,
      "loss": 1.3858,
      "num_input_tokens_seen": 25071872640,
      "step": 31867
    },
    {
      "epoch": 3.38086144706132,
      "grad_norm": 0.5704749199587918,
      "learning_rate": 4.0869298670227294e-05,
      "loss": 1.4472,
      "num_input_tokens_seen": 25072659504,
      "step": 31868
    },
    {
      "epoch": 3.3809675366008913,
      "grad_norm": 0.4076431861675014,
      "learning_rate": 4.086876166200941e-05,
      "loss": 1.4922,
      "num_input_tokens_seen": 25073446304,
      "step": 31869
    },
    {
      "epoch": 3.3810736261404624,
      "grad_norm": 0.5971618540614019,
      "learning_rate": 4.0868224641528614e-05,
      "loss": 1.3176,
      "num_input_tokens_seen": 25074233152,
      "step": 31870
    },
    {
      "epoch": 3.381179715680034,
      "grad_norm": 0.4612981831980691,
      "learning_rate": 4.086768760878531e-05,
      "loss": 1.3854,
      "num_input_tokens_seen": 25075019968,
      "step": 31871
    },
    {
      "epoch": 3.3812858052196053,
      "grad_norm": 0.4364471552066804,
      "learning_rate": 4.086715056377993e-05,
      "loss": 1.4519,
      "num_input_tokens_seen": 25075806704,
      "step": 31872
    },
    {
      "epoch": 3.381391894759177,
      "grad_norm": 0.7291152895018931,
      "learning_rate": 4.086661350651288e-05,
      "loss": 1.3379,
      "num_input_tokens_seen": 25076593520,
      "step": 31873
    },
    {
      "epoch": 3.3814979842987483,
      "grad_norm": 0.3880724516455009,
      "learning_rate": 4.086607643698459e-05,
      "loss": 1.4236,
      "num_input_tokens_seen": 25077380160,
      "step": 31874
    },
    {
      "epoch": 3.3816040738383197,
      "grad_norm": 0.6346825335827336,
      "learning_rate": 4.0865539355195444e-05,
      "loss": 1.407,
      "num_input_tokens_seen": 25078166912,
      "step": 31875
    },
    {
      "epoch": 3.3817101633778908,
      "grad_norm": 0.4589314679323247,
      "learning_rate": 4.0865002261145877e-05,
      "loss": 1.4062,
      "num_input_tokens_seen": 25078953648,
      "step": 31876
    },
    {
      "epoch": 3.3818162529174622,
      "grad_norm": 0.52338167066808,
      "learning_rate": 4.086446515483631e-05,
      "loss": 1.5868,
      "num_input_tokens_seen": 25079740384,
      "step": 31877
    },
    {
      "epoch": 3.3819223424570337,
      "grad_norm": 0.5375334438937506,
      "learning_rate": 4.086392803626714e-05,
      "loss": 1.5017,
      "num_input_tokens_seen": 25080527184,
      "step": 31878
    },
    {
      "epoch": 3.382028431996605,
      "grad_norm": 0.4259414192959885,
      "learning_rate": 4.0863390905438795e-05,
      "loss": 1.5059,
      "num_input_tokens_seen": 25081313968,
      "step": 31879
    },
    {
      "epoch": 3.3821345215361767,
      "grad_norm": 0.5474976435880632,
      "learning_rate": 4.086285376235169e-05,
      "loss": 1.4399,
      "num_input_tokens_seen": 25082100736,
      "step": 31880
    },
    {
      "epoch": 3.3822406110757477,
      "grad_norm": 0.4654652141059402,
      "learning_rate": 4.086231660700623e-05,
      "loss": 1.479,
      "num_input_tokens_seen": 25082887488,
      "step": 31881
    },
    {
      "epoch": 3.382346700615319,
      "grad_norm": 0.4850811381454901,
      "learning_rate": 4.0861779439402846e-05,
      "loss": 1.4005,
      "num_input_tokens_seen": 25083674192,
      "step": 31882
    },
    {
      "epoch": 3.3824527901548906,
      "grad_norm": 0.40645999597108945,
      "learning_rate": 4.086124225954194e-05,
      "loss": 1.4519,
      "num_input_tokens_seen": 25084460928,
      "step": 31883
    },
    {
      "epoch": 3.382558879694462,
      "grad_norm": 0.5122321508984611,
      "learning_rate": 4.086070506742393e-05,
      "loss": 1.5535,
      "num_input_tokens_seen": 25085247680,
      "step": 31884
    },
    {
      "epoch": 3.3826649692340336,
      "grad_norm": 0.3974040810604495,
      "learning_rate": 4.086016786304924e-05,
      "loss": 1.3923,
      "num_input_tokens_seen": 25086034448,
      "step": 31885
    },
    {
      "epoch": 3.382771058773605,
      "grad_norm": 0.48618699674144406,
      "learning_rate": 4.085963064641827e-05,
      "loss": 1.5926,
      "num_input_tokens_seen": 25086821216,
      "step": 31886
    },
    {
      "epoch": 3.3828771483131765,
      "grad_norm": 0.4172531292547626,
      "learning_rate": 4.0859093417531445e-05,
      "loss": 1.5065,
      "num_input_tokens_seen": 25087607952,
      "step": 31887
    },
    {
      "epoch": 3.3829832378527476,
      "grad_norm": 0.46266356552566046,
      "learning_rate": 4.0858556176389185e-05,
      "loss": 1.4177,
      "num_input_tokens_seen": 25088394720,
      "step": 31888
    },
    {
      "epoch": 3.383089327392319,
      "grad_norm": 0.4534990968370421,
      "learning_rate": 4.0858018922991884e-05,
      "loss": 1.3972,
      "num_input_tokens_seen": 25089181520,
      "step": 31889
    },
    {
      "epoch": 3.3831954169318905,
      "grad_norm": 0.42757557159195025,
      "learning_rate": 4.085748165733998e-05,
      "loss": 1.4619,
      "num_input_tokens_seen": 25089968272,
      "step": 31890
    },
    {
      "epoch": 3.383301506471462,
      "grad_norm": 0.479699624563322,
      "learning_rate": 4.085694437943388e-05,
      "loss": 1.4115,
      "num_input_tokens_seen": 25090755120,
      "step": 31891
    },
    {
      "epoch": 3.3834075960110335,
      "grad_norm": 0.497682248566055,
      "learning_rate": 4.0856407089273996e-05,
      "loss": 1.4189,
      "num_input_tokens_seen": 25091541936,
      "step": 31892
    },
    {
      "epoch": 3.3835136855506045,
      "grad_norm": 0.422957845473535,
      "learning_rate": 4.085586978686075e-05,
      "loss": 1.4519,
      "num_input_tokens_seen": 25092328736,
      "step": 31893
    },
    {
      "epoch": 3.383619775090176,
      "grad_norm": 0.4945796941246286,
      "learning_rate": 4.0855332472194545e-05,
      "loss": 1.4926,
      "num_input_tokens_seen": 25093115408,
      "step": 31894
    },
    {
      "epoch": 3.3837258646297474,
      "grad_norm": 0.42266302493590663,
      "learning_rate": 4.085479514527581e-05,
      "loss": 1.4312,
      "num_input_tokens_seen": 25093902144,
      "step": 31895
    },
    {
      "epoch": 3.383831954169319,
      "grad_norm": 0.4224398046950891,
      "learning_rate": 4.0854257806104954e-05,
      "loss": 1.4118,
      "num_input_tokens_seen": 25094688880,
      "step": 31896
    },
    {
      "epoch": 3.3839380437088904,
      "grad_norm": 0.440812880321183,
      "learning_rate": 4.085372045468239e-05,
      "loss": 1.5048,
      "num_input_tokens_seen": 25095475600,
      "step": 31897
    },
    {
      "epoch": 3.384044133248462,
      "grad_norm": 0.4693441372176421,
      "learning_rate": 4.085318309100854e-05,
      "loss": 1.4617,
      "num_input_tokens_seen": 25096262352,
      "step": 31898
    },
    {
      "epoch": 3.3841502227880333,
      "grad_norm": 0.4570145762897007,
      "learning_rate": 4.085264571508381e-05,
      "loss": 1.5355,
      "num_input_tokens_seen": 25097049104,
      "step": 31899
    },
    {
      "epoch": 3.3842563123276044,
      "grad_norm": 0.47988464726269064,
      "learning_rate": 4.085210832690862e-05,
      "loss": 1.5698,
      "num_input_tokens_seen": 25097835824,
      "step": 31900
    },
    {
      "epoch": 3.384362401867176,
      "grad_norm": 0.3920611817963833,
      "learning_rate": 4.0851570926483396e-05,
      "loss": 1.4264,
      "num_input_tokens_seen": 25098622576,
      "step": 31901
    },
    {
      "epoch": 3.3844684914067473,
      "grad_norm": 0.4640109259341536,
      "learning_rate": 4.0851033513808535e-05,
      "loss": 1.4348,
      "num_input_tokens_seen": 25099409312,
      "step": 31902
    },
    {
      "epoch": 3.384574580946319,
      "grad_norm": 0.40122910999509737,
      "learning_rate": 4.085049608888446e-05,
      "loss": 1.4492,
      "num_input_tokens_seen": 25100196064,
      "step": 31903
    },
    {
      "epoch": 3.3846806704858903,
      "grad_norm": 0.425463756520819,
      "learning_rate": 4.084995865171159e-05,
      "loss": 1.4027,
      "num_input_tokens_seen": 25100982816,
      "step": 31904
    },
    {
      "epoch": 3.3847867600254613,
      "grad_norm": 0.46893508658626093,
      "learning_rate": 4.084942120229033e-05,
      "loss": 1.3578,
      "num_input_tokens_seen": 25101769632,
      "step": 31905
    },
    {
      "epoch": 3.384892849565033,
      "grad_norm": 0.4078242170694487,
      "learning_rate": 4.0848883740621114e-05,
      "loss": 1.5113,
      "num_input_tokens_seen": 25102556352,
      "step": 31906
    },
    {
      "epoch": 3.3849989391046043,
      "grad_norm": 0.4398175874152007,
      "learning_rate": 4.084834626670434e-05,
      "loss": 1.3747,
      "num_input_tokens_seen": 25103343136,
      "step": 31907
    },
    {
      "epoch": 3.3851050286441757,
      "grad_norm": 0.42247494731513463,
      "learning_rate": 4.084780878054043e-05,
      "loss": 1.5212,
      "num_input_tokens_seen": 25104129856,
      "step": 31908
    },
    {
      "epoch": 3.385211118183747,
      "grad_norm": 0.39176218238699345,
      "learning_rate": 4.0847271282129793e-05,
      "loss": 1.4344,
      "num_input_tokens_seen": 25104916656,
      "step": 31909
    },
    {
      "epoch": 3.3853172077233182,
      "grad_norm": 0.4494954861360121,
      "learning_rate": 4.084673377147286e-05,
      "loss": 1.4232,
      "num_input_tokens_seen": 25105703408,
      "step": 31910
    },
    {
      "epoch": 3.3854232972628897,
      "grad_norm": 0.47537046357129836,
      "learning_rate": 4.084619624857002e-05,
      "loss": 1.4323,
      "num_input_tokens_seen": 25106490160,
      "step": 31911
    },
    {
      "epoch": 3.385529386802461,
      "grad_norm": 0.4833732044354836,
      "learning_rate": 4.084565871342172e-05,
      "loss": 1.514,
      "num_input_tokens_seen": 25107276960,
      "step": 31912
    },
    {
      "epoch": 3.3856354763420327,
      "grad_norm": 0.4675887795931618,
      "learning_rate": 4.0845121166028355e-05,
      "loss": 1.5529,
      "num_input_tokens_seen": 25108063632,
      "step": 31913
    },
    {
      "epoch": 3.385741565881604,
      "grad_norm": 0.42545727494467306,
      "learning_rate": 4.0844583606390344e-05,
      "loss": 1.4166,
      "num_input_tokens_seen": 25108850320,
      "step": 31914
    },
    {
      "epoch": 3.3858476554211756,
      "grad_norm": 0.449137644865279,
      "learning_rate": 4.084404603450811e-05,
      "loss": 1.5383,
      "num_input_tokens_seen": 25109637136,
      "step": 31915
    },
    {
      "epoch": 3.385953744960747,
      "grad_norm": 0.4266747706213418,
      "learning_rate": 4.084350845038205e-05,
      "loss": 1.5223,
      "num_input_tokens_seen": 25110423904,
      "step": 31916
    },
    {
      "epoch": 3.386059834500318,
      "grad_norm": 0.4799153982072007,
      "learning_rate": 4.08429708540126e-05,
      "loss": 1.4067,
      "num_input_tokens_seen": 25111210784,
      "step": 31917
    },
    {
      "epoch": 3.3861659240398896,
      "grad_norm": 0.5131784778274336,
      "learning_rate": 4.084243324540017e-05,
      "loss": 1.5899,
      "num_input_tokens_seen": 25111997536,
      "step": 31918
    },
    {
      "epoch": 3.386272013579461,
      "grad_norm": 0.46959627389608455,
      "learning_rate": 4.084189562454516e-05,
      "loss": 1.4909,
      "num_input_tokens_seen": 25112784288,
      "step": 31919
    },
    {
      "epoch": 3.3863781031190325,
      "grad_norm": 0.5710819238854913,
      "learning_rate": 4.0841357991448006e-05,
      "loss": 1.5129,
      "num_input_tokens_seen": 25113571056,
      "step": 31920
    },
    {
      "epoch": 3.386484192658604,
      "grad_norm": 0.40346542512730466,
      "learning_rate": 4.084082034610912e-05,
      "loss": 1.5287,
      "num_input_tokens_seen": 25114357824,
      "step": 31921
    },
    {
      "epoch": 3.386590282198175,
      "grad_norm": 0.602364726789304,
      "learning_rate": 4.0840282688528905e-05,
      "loss": 1.3689,
      "num_input_tokens_seen": 25115144624,
      "step": 31922
    },
    {
      "epoch": 3.3866963717377465,
      "grad_norm": 0.5468889440828425,
      "learning_rate": 4.0839745018707784e-05,
      "loss": 1.5659,
      "num_input_tokens_seen": 25115931440,
      "step": 31923
    },
    {
      "epoch": 3.386802461277318,
      "grad_norm": 0.6260789342893991,
      "learning_rate": 4.083920733664618e-05,
      "loss": 1.5439,
      "num_input_tokens_seen": 25116718240,
      "step": 31924
    },
    {
      "epoch": 3.3869085508168895,
      "grad_norm": 0.5912669711447565,
      "learning_rate": 4.0838669642344496e-05,
      "loss": 1.49,
      "num_input_tokens_seen": 25117504992,
      "step": 31925
    },
    {
      "epoch": 3.387014640356461,
      "grad_norm": 0.5074618427485987,
      "learning_rate": 4.083813193580316e-05,
      "loss": 1.4433,
      "num_input_tokens_seen": 25118291824,
      "step": 31926
    },
    {
      "epoch": 3.3871207298960324,
      "grad_norm": 0.6156167569195365,
      "learning_rate": 4.083759421702257e-05,
      "loss": 1.362,
      "num_input_tokens_seen": 25119078640,
      "step": 31927
    },
    {
      "epoch": 3.387226819435604,
      "grad_norm": 0.46187553974187473,
      "learning_rate": 4.083705648600315e-05,
      "loss": 1.4529,
      "num_input_tokens_seen": 25119865392,
      "step": 31928
    },
    {
      "epoch": 3.387332908975175,
      "grad_norm": 0.6361191306722878,
      "learning_rate": 4.0836518742745326e-05,
      "loss": 1.5538,
      "num_input_tokens_seen": 25120652240,
      "step": 31929
    },
    {
      "epoch": 3.3874389985147464,
      "grad_norm": 0.5597910100394319,
      "learning_rate": 4.0835980987249506e-05,
      "loss": 1.5291,
      "num_input_tokens_seen": 25121439024,
      "step": 31930
    },
    {
      "epoch": 3.387545088054318,
      "grad_norm": 0.44648772200378417,
      "learning_rate": 4.08354432195161e-05,
      "loss": 1.4867,
      "num_input_tokens_seen": 25122225680,
      "step": 31931
    },
    {
      "epoch": 3.3876511775938893,
      "grad_norm": 0.5858880216393831,
      "learning_rate": 4.083490543954553e-05,
      "loss": 1.3985,
      "num_input_tokens_seen": 25123012432,
      "step": 31932
    },
    {
      "epoch": 3.387757267133461,
      "grad_norm": 0.4065110090548457,
      "learning_rate": 4.0834367647338214e-05,
      "loss": 1.4026,
      "num_input_tokens_seen": 25123799152,
      "step": 31933
    },
    {
      "epoch": 3.387863356673032,
      "grad_norm": 0.5252051469790006,
      "learning_rate": 4.0833829842894556e-05,
      "loss": 1.3873,
      "num_input_tokens_seen": 25124585984,
      "step": 31934
    },
    {
      "epoch": 3.3879694462126033,
      "grad_norm": 0.6737107106435705,
      "learning_rate": 4.083329202621498e-05,
      "loss": 1.3738,
      "num_input_tokens_seen": 25125372864,
      "step": 31935
    },
    {
      "epoch": 3.388075535752175,
      "grad_norm": 0.4009205808322847,
      "learning_rate": 4.08327541972999e-05,
      "loss": 1.3967,
      "num_input_tokens_seen": 25126159568,
      "step": 31936
    },
    {
      "epoch": 3.3881816252917463,
      "grad_norm": 0.7674646155741983,
      "learning_rate": 4.083221635614973e-05,
      "loss": 1.3618,
      "num_input_tokens_seen": 25126946416,
      "step": 31937
    },
    {
      "epoch": 3.3882877148313177,
      "grad_norm": 0.4954738154577654,
      "learning_rate": 4.08316785027649e-05,
      "loss": 1.4129,
      "num_input_tokens_seen": 25127733184,
      "step": 31938
    },
    {
      "epoch": 3.388393804370889,
      "grad_norm": 0.4693511886546492,
      "learning_rate": 4.0831140637145805e-05,
      "loss": 1.3611,
      "num_input_tokens_seen": 25128519888,
      "step": 31939
    },
    {
      "epoch": 3.3884998939104602,
      "grad_norm": 0.6633220559583819,
      "learning_rate": 4.083060275929287e-05,
      "loss": 1.4111,
      "num_input_tokens_seen": 25129306816,
      "step": 31940
    },
    {
      "epoch": 3.3886059834500317,
      "grad_norm": 0.5375741970958628,
      "learning_rate": 4.083006486920651e-05,
      "loss": 1.5182,
      "num_input_tokens_seen": 25130093552,
      "step": 31941
    },
    {
      "epoch": 3.388712072989603,
      "grad_norm": 0.5652305317927012,
      "learning_rate": 4.082952696688713e-05,
      "loss": 1.4344,
      "num_input_tokens_seen": 25130880384,
      "step": 31942
    },
    {
      "epoch": 3.3888181625291747,
      "grad_norm": 0.8289518084465335,
      "learning_rate": 4.0828989052335165e-05,
      "loss": 1.4621,
      "num_input_tokens_seen": 25131667200,
      "step": 31943
    },
    {
      "epoch": 3.388924252068746,
      "grad_norm": 0.4106006243742582,
      "learning_rate": 4.082845112555103e-05,
      "loss": 1.3397,
      "num_input_tokens_seen": 25132454000,
      "step": 31944
    },
    {
      "epoch": 3.3890303416083176,
      "grad_norm": 0.7344423782087559,
      "learning_rate": 4.082791318653512e-05,
      "loss": 1.5123,
      "num_input_tokens_seen": 25133240720,
      "step": 31945
    },
    {
      "epoch": 3.3891364311478887,
      "grad_norm": 0.4083090728003462,
      "learning_rate": 4.082737523528786e-05,
      "loss": 1.4607,
      "num_input_tokens_seen": 25134027600,
      "step": 31946
    },
    {
      "epoch": 3.38924252068746,
      "grad_norm": 0.5055647400189839,
      "learning_rate": 4.082683727180968e-05,
      "loss": 1.5537,
      "num_input_tokens_seen": 25134814432,
      "step": 31947
    },
    {
      "epoch": 3.3893486102270316,
      "grad_norm": 0.5317948231860146,
      "learning_rate": 4.0826299296100976e-05,
      "loss": 1.4112,
      "num_input_tokens_seen": 25135601216,
      "step": 31948
    },
    {
      "epoch": 3.389454699766603,
      "grad_norm": 0.42503960517734835,
      "learning_rate": 4.082576130816218e-05,
      "loss": 1.4087,
      "num_input_tokens_seen": 25136387952,
      "step": 31949
    },
    {
      "epoch": 3.3895607893061745,
      "grad_norm": 0.5110147958577871,
      "learning_rate": 4.08252233079937e-05,
      "loss": 1.4437,
      "num_input_tokens_seen": 25137174768,
      "step": 31950
    },
    {
      "epoch": 3.3896668788457456,
      "grad_norm": 0.42342318412371677,
      "learning_rate": 4.0824685295595946e-05,
      "loss": 1.3858,
      "num_input_tokens_seen": 25137961568,
      "step": 31951
    },
    {
      "epoch": 3.389772968385317,
      "grad_norm": 0.5155711867126858,
      "learning_rate": 4.0824147270969346e-05,
      "loss": 1.4076,
      "num_input_tokens_seen": 25138748288,
      "step": 31952
    },
    {
      "epoch": 3.3898790579248885,
      "grad_norm": 0.45897811648148823,
      "learning_rate": 4.08236092341143e-05,
      "loss": 1.4992,
      "num_input_tokens_seen": 25139535088,
      "step": 31953
    },
    {
      "epoch": 3.38998514746446,
      "grad_norm": 0.48229246140491244,
      "learning_rate": 4.082307118503124e-05,
      "loss": 1.4775,
      "num_input_tokens_seen": 25140321824,
      "step": 31954
    },
    {
      "epoch": 3.3900912370040315,
      "grad_norm": 0.4798295606341616,
      "learning_rate": 4.0822533123720574e-05,
      "loss": 1.3322,
      "num_input_tokens_seen": 25141108528,
      "step": 31955
    },
    {
      "epoch": 3.390197326543603,
      "grad_norm": 0.7018888010631933,
      "learning_rate": 4.0821995050182714e-05,
      "loss": 1.5541,
      "num_input_tokens_seen": 25141895280,
      "step": 31956
    },
    {
      "epoch": 3.3903034160831744,
      "grad_norm": 0.462671705069503,
      "learning_rate": 4.0821456964418095e-05,
      "loss": 1.5294,
      "num_input_tokens_seen": 25142682032,
      "step": 31957
    },
    {
      "epoch": 3.3904095056227455,
      "grad_norm": 0.601228817739696,
      "learning_rate": 4.0820918866427105e-05,
      "loss": 1.5312,
      "num_input_tokens_seen": 25143468784,
      "step": 31958
    },
    {
      "epoch": 3.390515595162317,
      "grad_norm": 0.40749084669443963,
      "learning_rate": 4.0820380756210177e-05,
      "loss": 1.4033,
      "num_input_tokens_seen": 25144255536,
      "step": 31959
    },
    {
      "epoch": 3.3906216847018884,
      "grad_norm": 0.6089667987600211,
      "learning_rate": 4.081984263376772e-05,
      "loss": 1.5955,
      "num_input_tokens_seen": 25145042384,
      "step": 31960
    },
    {
      "epoch": 3.39072777424146,
      "grad_norm": 0.4914400732311298,
      "learning_rate": 4.081930449910015e-05,
      "loss": 1.5298,
      "num_input_tokens_seen": 25145829264,
      "step": 31961
    },
    {
      "epoch": 3.3908338637810314,
      "grad_norm": 0.4147132428828378,
      "learning_rate": 4.081876635220789e-05,
      "loss": 1.531,
      "num_input_tokens_seen": 25146616032,
      "step": 31962
    },
    {
      "epoch": 3.3909399533206024,
      "grad_norm": 0.4449041429357416,
      "learning_rate": 4.081822819309136e-05,
      "loss": 1.4156,
      "num_input_tokens_seen": 25147402768,
      "step": 31963
    },
    {
      "epoch": 3.391046042860174,
      "grad_norm": 0.40105306858544665,
      "learning_rate": 4.081769002175095e-05,
      "loss": 1.5017,
      "num_input_tokens_seen": 25148189600,
      "step": 31964
    },
    {
      "epoch": 3.3911521323997453,
      "grad_norm": 0.3959532902447241,
      "learning_rate": 4.081715183818711e-05,
      "loss": 1.4001,
      "num_input_tokens_seen": 25148976416,
      "step": 31965
    },
    {
      "epoch": 3.391258221939317,
      "grad_norm": 0.4719434313006491,
      "learning_rate": 4.081661364240022e-05,
      "loss": 1.6832,
      "num_input_tokens_seen": 25149763152,
      "step": 31966
    },
    {
      "epoch": 3.3913643114788883,
      "grad_norm": 0.40063241199590605,
      "learning_rate": 4.081607543439073e-05,
      "loss": 1.4822,
      "num_input_tokens_seen": 25150549920,
      "step": 31967
    },
    {
      "epoch": 3.3914704010184598,
      "grad_norm": 0.4075202108321645,
      "learning_rate": 4.081553721415904e-05,
      "loss": 1.3847,
      "num_input_tokens_seen": 25151336704,
      "step": 31968
    },
    {
      "epoch": 3.391576490558031,
      "grad_norm": 0.39775224937013026,
      "learning_rate": 4.0814998981705564e-05,
      "loss": 1.4591,
      "num_input_tokens_seen": 25152123536,
      "step": 31969
    },
    {
      "epoch": 3.3916825800976023,
      "grad_norm": 0.49136092440349194,
      "learning_rate": 4.081446073703073e-05,
      "loss": 1.5312,
      "num_input_tokens_seen": 25152910272,
      "step": 31970
    },
    {
      "epoch": 3.3917886696371737,
      "grad_norm": 0.4411520196351924,
      "learning_rate": 4.081392248013493e-05,
      "loss": 1.5161,
      "num_input_tokens_seen": 25153696992,
      "step": 31971
    },
    {
      "epoch": 3.391894759176745,
      "grad_norm": 0.5013317096827697,
      "learning_rate": 4.08133842110186e-05,
      "loss": 1.6353,
      "num_input_tokens_seen": 25154483680,
      "step": 31972
    },
    {
      "epoch": 3.3920008487163167,
      "grad_norm": 0.4059632150550358,
      "learning_rate": 4.081284592968215e-05,
      "loss": 1.4756,
      "num_input_tokens_seen": 25155270368,
      "step": 31973
    },
    {
      "epoch": 3.392106938255888,
      "grad_norm": 0.39016275892716035,
      "learning_rate": 4.0812307636126e-05,
      "loss": 1.4921,
      "num_input_tokens_seen": 25156057168,
      "step": 31974
    },
    {
      "epoch": 3.392213027795459,
      "grad_norm": 0.4157108094854106,
      "learning_rate": 4.0811769330350564e-05,
      "loss": 1.4541,
      "num_input_tokens_seen": 25156843872,
      "step": 31975
    },
    {
      "epoch": 3.3923191173350307,
      "grad_norm": 0.4071901787855677,
      "learning_rate": 4.081123101235626e-05,
      "loss": 1.4563,
      "num_input_tokens_seen": 25157630656,
      "step": 31976
    },
    {
      "epoch": 3.392425206874602,
      "grad_norm": 0.5450718910181074,
      "learning_rate": 4.0810692682143486e-05,
      "loss": 1.3765,
      "num_input_tokens_seen": 25158417440,
      "step": 31977
    },
    {
      "epoch": 3.3925312964141736,
      "grad_norm": 0.3935490644239305,
      "learning_rate": 4.081015433971268e-05,
      "loss": 1.3764,
      "num_input_tokens_seen": 25159204176,
      "step": 31978
    },
    {
      "epoch": 3.392637385953745,
      "grad_norm": 0.4692167631011441,
      "learning_rate": 4.0809615985064255e-05,
      "loss": 1.3913,
      "num_input_tokens_seen": 25159990992,
      "step": 31979
    },
    {
      "epoch": 3.392743475493316,
      "grad_norm": 0.45788999519673435,
      "learning_rate": 4.080907761819862e-05,
      "loss": 1.5923,
      "num_input_tokens_seen": 25160777824,
      "step": 31980
    },
    {
      "epoch": 3.3928495650328876,
      "grad_norm": 0.3872833419118275,
      "learning_rate": 4.080853923911619e-05,
      "loss": 1.4773,
      "num_input_tokens_seen": 25161564544,
      "step": 31981
    },
    {
      "epoch": 3.392955654572459,
      "grad_norm": 0.5889070367039165,
      "learning_rate": 4.080800084781739e-05,
      "loss": 1.5628,
      "num_input_tokens_seen": 25162351216,
      "step": 31982
    },
    {
      "epoch": 3.3930617441120305,
      "grad_norm": 0.3837077455514424,
      "learning_rate": 4.080746244430262e-05,
      "loss": 1.4812,
      "num_input_tokens_seen": 25163137936,
      "step": 31983
    },
    {
      "epoch": 3.393167833651602,
      "grad_norm": 0.48645261208932455,
      "learning_rate": 4.080692402857232e-05,
      "loss": 1.4742,
      "num_input_tokens_seen": 25163924736,
      "step": 31984
    },
    {
      "epoch": 3.3932739231911735,
      "grad_norm": 0.39506340875084256,
      "learning_rate": 4.0806385600626884e-05,
      "loss": 1.4424,
      "num_input_tokens_seen": 25164711456,
      "step": 31985
    },
    {
      "epoch": 3.393380012730745,
      "grad_norm": 0.41030502940903785,
      "learning_rate": 4.080584716046675e-05,
      "loss": 1.5351,
      "num_input_tokens_seen": 25165498240,
      "step": 31986
    },
    {
      "epoch": 3.393486102270316,
      "grad_norm": 0.4851595403299651,
      "learning_rate": 4.0805308708092306e-05,
      "loss": 1.5377,
      "num_input_tokens_seen": 25166284960,
      "step": 31987
    },
    {
      "epoch": 3.3935921918098875,
      "grad_norm": 0.44927970327353406,
      "learning_rate": 4.0804770243503985e-05,
      "loss": 1.5104,
      "num_input_tokens_seen": 25167071776,
      "step": 31988
    },
    {
      "epoch": 3.393698281349459,
      "grad_norm": 0.43017554047983675,
      "learning_rate": 4.080423176670221e-05,
      "loss": 1.5738,
      "num_input_tokens_seen": 25167858448,
      "step": 31989
    },
    {
      "epoch": 3.3938043708890304,
      "grad_norm": 0.43263495728950535,
      "learning_rate": 4.080369327768738e-05,
      "loss": 1.5329,
      "num_input_tokens_seen": 25168645200,
      "step": 31990
    },
    {
      "epoch": 3.393910460428602,
      "grad_norm": 0.5433522625302917,
      "learning_rate": 4.080315477645993e-05,
      "loss": 1.4187,
      "num_input_tokens_seen": 25169432016,
      "step": 31991
    },
    {
      "epoch": 3.394016549968173,
      "grad_norm": 0.38075461460801036,
      "learning_rate": 4.0802616263020256e-05,
      "loss": 1.4072,
      "num_input_tokens_seen": 25170218784,
      "step": 31992
    },
    {
      "epoch": 3.3941226395077444,
      "grad_norm": 0.4446288106282291,
      "learning_rate": 4.080207773736878e-05,
      "loss": 1.3468,
      "num_input_tokens_seen": 25171005520,
      "step": 31993
    },
    {
      "epoch": 3.394228729047316,
      "grad_norm": 0.5836906812696471,
      "learning_rate": 4.080153919950593e-05,
      "loss": 1.5659,
      "num_input_tokens_seen": 25171792432,
      "step": 31994
    },
    {
      "epoch": 3.3943348185868873,
      "grad_norm": 0.44471258655042595,
      "learning_rate": 4.080100064943212e-05,
      "loss": 1.4549,
      "num_input_tokens_seen": 25172579248,
      "step": 31995
    },
    {
      "epoch": 3.394440908126459,
      "grad_norm": 0.578064463075656,
      "learning_rate": 4.080046208714775e-05,
      "loss": 1.482,
      "num_input_tokens_seen": 25173366016,
      "step": 31996
    },
    {
      "epoch": 3.3945469976660303,
      "grad_norm": 0.4183346095910273,
      "learning_rate": 4.0799923512653246e-05,
      "loss": 1.3992,
      "num_input_tokens_seen": 25174152752,
      "step": 31997
    },
    {
      "epoch": 3.3946530872056018,
      "grad_norm": 0.5396835700621666,
      "learning_rate": 4.079938492594904e-05,
      "loss": 1.5855,
      "num_input_tokens_seen": 25174939552,
      "step": 31998
    },
    {
      "epoch": 3.394759176745173,
      "grad_norm": 0.5113085288938953,
      "learning_rate": 4.079884632703551e-05,
      "loss": 1.4891,
      "num_input_tokens_seen": 25175726240,
      "step": 31999
    },
    {
      "epoch": 3.3948652662847443,
      "grad_norm": 0.44347518153841964,
      "learning_rate": 4.079830771591311e-05,
      "loss": 1.4058,
      "num_input_tokens_seen": 25176513008,
      "step": 32000
    },
    {
      "epoch": 3.3948652662847443,
      "eval_loss": 1.6207246780395508,
      "eval_runtime": 65.1853,
      "eval_samples_per_second": 46.023,
      "eval_steps_per_second": 0.491,
      "num_input_tokens_seen": 25176513008,
      "step": 32000
    },
    {
      "epoch": 3.3949713558243158,
      "grad_norm": 0.4731418236666197,
      "learning_rate": 4.079776909258224e-05,
      "loss": 1.5006,
      "num_input_tokens_seen": 25177299728,
      "step": 32001
    },
    {
      "epoch": 3.3950774453638872,
      "grad_norm": 0.43940918051482186,
      "learning_rate": 4.079723045704332e-05,
      "loss": 1.3697,
      "num_input_tokens_seen": 25178086496,
      "step": 32002
    },
    {
      "epoch": 3.3951835349034587,
      "grad_norm": 0.4040598919896221,
      "learning_rate": 4.079669180929675e-05,
      "loss": 1.41,
      "num_input_tokens_seen": 25178873312,
      "step": 32003
    },
    {
      "epoch": 3.3952896244430297,
      "grad_norm": 0.47993845775766986,
      "learning_rate": 4.079615314934297e-05,
      "loss": 1.4272,
      "num_input_tokens_seen": 25179660128,
      "step": 32004
    },
    {
      "epoch": 3.395395713982601,
      "grad_norm": 0.4069437710592715,
      "learning_rate": 4.0795614477182385e-05,
      "loss": 1.3778,
      "num_input_tokens_seen": 25180446816,
      "step": 32005
    },
    {
      "epoch": 3.3955018035221727,
      "grad_norm": 0.4513508340262296,
      "learning_rate": 4.0795075792815415e-05,
      "loss": 1.5054,
      "num_input_tokens_seen": 25181233584,
      "step": 32006
    },
    {
      "epoch": 3.395607893061744,
      "grad_norm": 0.5168812512351373,
      "learning_rate": 4.079453709624248e-05,
      "loss": 1.5095,
      "num_input_tokens_seen": 25182020288,
      "step": 32007
    },
    {
      "epoch": 3.3957139826013156,
      "grad_norm": 0.39479034501051574,
      "learning_rate": 4.079399838746398e-05,
      "loss": 1.426,
      "num_input_tokens_seen": 25182806992,
      "step": 32008
    },
    {
      "epoch": 3.395820072140887,
      "grad_norm": 0.4948189796609258,
      "learning_rate": 4.079345966648034e-05,
      "loss": 1.415,
      "num_input_tokens_seen": 25183593792,
      "step": 32009
    },
    {
      "epoch": 3.395926161680458,
      "grad_norm": 0.39816079183804576,
      "learning_rate": 4.0792920933291986e-05,
      "loss": 1.4458,
      "num_input_tokens_seen": 25184380512,
      "step": 32010
    },
    {
      "epoch": 3.3960322512200296,
      "grad_norm": 0.4231628321648644,
      "learning_rate": 4.079238218789932e-05,
      "loss": 1.4353,
      "num_input_tokens_seen": 25185167168,
      "step": 32011
    },
    {
      "epoch": 3.396138340759601,
      "grad_norm": 0.4226027279919194,
      "learning_rate": 4.079184343030277e-05,
      "loss": 1.4189,
      "num_input_tokens_seen": 25185953952,
      "step": 32012
    },
    {
      "epoch": 3.3962444302991726,
      "grad_norm": 0.40093459885784105,
      "learning_rate": 4.079130466050274e-05,
      "loss": 1.3771,
      "num_input_tokens_seen": 25186740816,
      "step": 32013
    },
    {
      "epoch": 3.396350519838744,
      "grad_norm": 0.40514910193298476,
      "learning_rate": 4.079076587849965e-05,
      "loss": 1.4935,
      "num_input_tokens_seen": 25187527600,
      "step": 32014
    },
    {
      "epoch": 3.3964566093783155,
      "grad_norm": 0.5492068156287447,
      "learning_rate": 4.079022708429393e-05,
      "loss": 1.6224,
      "num_input_tokens_seen": 25188314304,
      "step": 32015
    },
    {
      "epoch": 3.3965626989178865,
      "grad_norm": 0.368135975191931,
      "learning_rate": 4.0789688277885984e-05,
      "loss": 1.5016,
      "num_input_tokens_seen": 25189101040,
      "step": 32016
    },
    {
      "epoch": 3.396668788457458,
      "grad_norm": 0.5390728312161351,
      "learning_rate": 4.0789149459276226e-05,
      "loss": 1.5223,
      "num_input_tokens_seen": 25189887776,
      "step": 32017
    },
    {
      "epoch": 3.3967748779970295,
      "grad_norm": 0.4731915564366723,
      "learning_rate": 4.078861062846507e-05,
      "loss": 1.5196,
      "num_input_tokens_seen": 25190674544,
      "step": 32018
    },
    {
      "epoch": 3.396880967536601,
      "grad_norm": 0.5797130246632349,
      "learning_rate": 4.078807178545295e-05,
      "loss": 1.467,
      "num_input_tokens_seen": 25191461376,
      "step": 32019
    },
    {
      "epoch": 3.3969870570761724,
      "grad_norm": 0.5369366300963706,
      "learning_rate": 4.0787532930240276e-05,
      "loss": 1.4708,
      "num_input_tokens_seen": 25192248128,
      "step": 32020
    },
    {
      "epoch": 3.3970931466157435,
      "grad_norm": 0.49975875191246355,
      "learning_rate": 4.078699406282745e-05,
      "loss": 1.4671,
      "num_input_tokens_seen": 25193034880,
      "step": 32021
    },
    {
      "epoch": 3.397199236155315,
      "grad_norm": 0.7890178927194239,
      "learning_rate": 4.07864551832149e-05,
      "loss": 1.5743,
      "num_input_tokens_seen": 25193821552,
      "step": 32022
    },
    {
      "epoch": 3.3973053256948864,
      "grad_norm": 0.5201450495004408,
      "learning_rate": 4.078591629140304e-05,
      "loss": 1.499,
      "num_input_tokens_seen": 25194608272,
      "step": 32023
    },
    {
      "epoch": 3.397411415234458,
      "grad_norm": 0.7423545669115382,
      "learning_rate": 4.078537738739229e-05,
      "loss": 1.5782,
      "num_input_tokens_seen": 25195394944,
      "step": 32024
    },
    {
      "epoch": 3.3975175047740294,
      "grad_norm": 0.4592681227055691,
      "learning_rate": 4.078483847118306e-05,
      "loss": 1.4352,
      "num_input_tokens_seen": 25196181680,
      "step": 32025
    },
    {
      "epoch": 3.397623594313601,
      "grad_norm": 0.5752115487557422,
      "learning_rate": 4.078429954277577e-05,
      "loss": 1.519,
      "num_input_tokens_seen": 25196968384,
      "step": 32026
    },
    {
      "epoch": 3.3977296838531723,
      "grad_norm": 0.5172835837573204,
      "learning_rate": 4.078376060217084e-05,
      "loss": 1.5313,
      "num_input_tokens_seen": 25197755168,
      "step": 32027
    },
    {
      "epoch": 3.3978357733927433,
      "grad_norm": 0.5258510783834873,
      "learning_rate": 4.0783221649368685e-05,
      "loss": 1.4437,
      "num_input_tokens_seen": 25198541968,
      "step": 32028
    },
    {
      "epoch": 3.397941862932315,
      "grad_norm": 0.5448642012521694,
      "learning_rate": 4.078268268436971e-05,
      "loss": 1.3638,
      "num_input_tokens_seen": 25199328784,
      "step": 32029
    },
    {
      "epoch": 3.3980479524718863,
      "grad_norm": 0.45628508561254855,
      "learning_rate": 4.0782143707174345e-05,
      "loss": 1.3708,
      "num_input_tokens_seen": 25200115584,
      "step": 32030
    },
    {
      "epoch": 3.3981540420114578,
      "grad_norm": 0.5651544596861302,
      "learning_rate": 4.0781604717783004e-05,
      "loss": 1.5621,
      "num_input_tokens_seen": 25200902304,
      "step": 32031
    },
    {
      "epoch": 3.3982601315510292,
      "grad_norm": 0.44807172947488705,
      "learning_rate": 4.078106571619611e-05,
      "loss": 1.4052,
      "num_input_tokens_seen": 25201689056,
      "step": 32032
    },
    {
      "epoch": 3.3983662210906003,
      "grad_norm": 0.3992310246409128,
      "learning_rate": 4.078052670241406e-05,
      "loss": 1.4124,
      "num_input_tokens_seen": 25202475936,
      "step": 32033
    },
    {
      "epoch": 3.3984723106301717,
      "grad_norm": 0.526613169020108,
      "learning_rate": 4.077998767643728e-05,
      "loss": 1.4362,
      "num_input_tokens_seen": 25203262736,
      "step": 32034
    },
    {
      "epoch": 3.398578400169743,
      "grad_norm": 0.46116435558278096,
      "learning_rate": 4.0779448638266196e-05,
      "loss": 1.4558,
      "num_input_tokens_seen": 25204049472,
      "step": 32035
    },
    {
      "epoch": 3.3986844897093147,
      "grad_norm": 0.5363308044957795,
      "learning_rate": 4.0778909587901216e-05,
      "loss": 1.4996,
      "num_input_tokens_seen": 25204836176,
      "step": 32036
    },
    {
      "epoch": 3.398790579248886,
      "grad_norm": 0.5906583259289078,
      "learning_rate": 4.0778370525342757e-05,
      "loss": 1.4346,
      "num_input_tokens_seen": 25205622944,
      "step": 32037
    },
    {
      "epoch": 3.3988966687884576,
      "grad_norm": 0.4897774301262955,
      "learning_rate": 4.077783145059124e-05,
      "loss": 1.4285,
      "num_input_tokens_seen": 25206409680,
      "step": 32038
    },
    {
      "epoch": 3.3990027583280287,
      "grad_norm": 0.4732225031891018,
      "learning_rate": 4.0777292363647065e-05,
      "loss": 1.4192,
      "num_input_tokens_seen": 25207196480,
      "step": 32039
    },
    {
      "epoch": 3.3991088478676,
      "grad_norm": 0.4300481550263711,
      "learning_rate": 4.077675326451067e-05,
      "loss": 1.4408,
      "num_input_tokens_seen": 25207983248,
      "step": 32040
    },
    {
      "epoch": 3.3992149374071716,
      "grad_norm": 0.4439440691949942,
      "learning_rate": 4.077621415318246e-05,
      "loss": 1.5052,
      "num_input_tokens_seen": 25208770016,
      "step": 32041
    },
    {
      "epoch": 3.399321026946743,
      "grad_norm": 0.4689268998031787,
      "learning_rate": 4.0775675029662865e-05,
      "loss": 1.4685,
      "num_input_tokens_seen": 25209556816,
      "step": 32042
    },
    {
      "epoch": 3.3994271164863146,
      "grad_norm": 0.510259801999753,
      "learning_rate": 4.077513589395228e-05,
      "loss": 1.5353,
      "num_input_tokens_seen": 25210343488,
      "step": 32043
    },
    {
      "epoch": 3.399533206025886,
      "grad_norm": 0.4135154052212246,
      "learning_rate": 4.077459674605113e-05,
      "loss": 1.3908,
      "num_input_tokens_seen": 25211130208,
      "step": 32044
    },
    {
      "epoch": 3.399639295565457,
      "grad_norm": 0.5018216374407967,
      "learning_rate": 4.0774057585959845e-05,
      "loss": 1.4475,
      "num_input_tokens_seen": 25211917024,
      "step": 32045
    },
    {
      "epoch": 3.3997453851050286,
      "grad_norm": 0.4210083281167748,
      "learning_rate": 4.077351841367884e-05,
      "loss": 1.3449,
      "num_input_tokens_seen": 25212703824,
      "step": 32046
    },
    {
      "epoch": 3.3998514746446,
      "grad_norm": 0.4866067159294525,
      "learning_rate": 4.0772979229208505e-05,
      "loss": 1.3952,
      "num_input_tokens_seen": 25213490576,
      "step": 32047
    },
    {
      "epoch": 3.3999575641841715,
      "grad_norm": 0.4657345145179949,
      "learning_rate": 4.077244003254927e-05,
      "loss": 1.4796,
      "num_input_tokens_seen": 25214277312,
      "step": 32048
    },
    {
      "epoch": 3.400063653723743,
      "grad_norm": 0.4048717020469351,
      "learning_rate": 4.077190082370157e-05,
      "loss": 1.4786,
      "num_input_tokens_seen": 25215064096,
      "step": 32049
    },
    {
      "epoch": 3.400169743263314,
      "grad_norm": 0.4373618362144535,
      "learning_rate": 4.0771361602665806e-05,
      "loss": 1.4671,
      "num_input_tokens_seen": 25215850912,
      "step": 32050
    },
    {
      "epoch": 3.4002758328028855,
      "grad_norm": 0.4679317041932052,
      "learning_rate": 4.077082236944239e-05,
      "loss": 1.5611,
      "num_input_tokens_seen": 25216637648,
      "step": 32051
    },
    {
      "epoch": 3.400381922342457,
      "grad_norm": 0.4214903523196514,
      "learning_rate": 4.077028312403175e-05,
      "loss": 1.463,
      "num_input_tokens_seen": 25217424368,
      "step": 32052
    },
    {
      "epoch": 3.4004880118820284,
      "grad_norm": 0.41625312041272555,
      "learning_rate": 4.076974386643429e-05,
      "loss": 1.4266,
      "num_input_tokens_seen": 25218211136,
      "step": 32053
    },
    {
      "epoch": 3.4005941014216,
      "grad_norm": 0.4245556012802915,
      "learning_rate": 4.076920459665045e-05,
      "loss": 1.3823,
      "num_input_tokens_seen": 25218997920,
      "step": 32054
    },
    {
      "epoch": 3.4007001909611714,
      "grad_norm": 0.39079747703653306,
      "learning_rate": 4.0768665314680627e-05,
      "loss": 1.422,
      "num_input_tokens_seen": 25219784592,
      "step": 32055
    },
    {
      "epoch": 3.400806280500743,
      "grad_norm": 0.4476761305913343,
      "learning_rate": 4.076812602052523e-05,
      "loss": 1.4599,
      "num_input_tokens_seen": 25220571456,
      "step": 32056
    },
    {
      "epoch": 3.400912370040314,
      "grad_norm": 0.44455530724041126,
      "learning_rate": 4.07675867141847e-05,
      "loss": 1.4307,
      "num_input_tokens_seen": 25221358240,
      "step": 32057
    },
    {
      "epoch": 3.4010184595798854,
      "grad_norm": 0.3753086510273664,
      "learning_rate": 4.0767047395659444e-05,
      "loss": 1.4013,
      "num_input_tokens_seen": 25222145056,
      "step": 32058
    },
    {
      "epoch": 3.401124549119457,
      "grad_norm": 0.4047690338966131,
      "learning_rate": 4.076650806494987e-05,
      "loss": 1.5334,
      "num_input_tokens_seen": 25222931760,
      "step": 32059
    },
    {
      "epoch": 3.4012306386590283,
      "grad_norm": 0.49355664576186786,
      "learning_rate": 4.0765968722056395e-05,
      "loss": 1.5421,
      "num_input_tokens_seen": 25223718448,
      "step": 32060
    },
    {
      "epoch": 3.4013367281986,
      "grad_norm": 0.40823234514207096,
      "learning_rate": 4.0765429366979444e-05,
      "loss": 1.3672,
      "num_input_tokens_seen": 25224505216,
      "step": 32061
    },
    {
      "epoch": 3.401442817738171,
      "grad_norm": 0.458703583275662,
      "learning_rate": 4.076488999971945e-05,
      "loss": 1.3774,
      "num_input_tokens_seen": 25225291952,
      "step": 32062
    },
    {
      "epoch": 3.4015489072777423,
      "grad_norm": 0.4660513162971208,
      "learning_rate": 4.0764350620276795e-05,
      "loss": 1.4544,
      "num_input_tokens_seen": 25226078720,
      "step": 32063
    },
    {
      "epoch": 3.4016549968173138,
      "grad_norm": 0.39283742541005184,
      "learning_rate": 4.076381122865191e-05,
      "loss": 1.4621,
      "num_input_tokens_seen": 25226865616,
      "step": 32064
    },
    {
      "epoch": 3.4017610863568852,
      "grad_norm": 0.5722979684510766,
      "learning_rate": 4.0763271824845214e-05,
      "loss": 1.498,
      "num_input_tokens_seen": 25227652336,
      "step": 32065
    },
    {
      "epoch": 3.4018671758964567,
      "grad_norm": 0.40839740366854027,
      "learning_rate": 4.0762732408857135e-05,
      "loss": 1.4912,
      "num_input_tokens_seen": 25228439104,
      "step": 32066
    },
    {
      "epoch": 3.401973265436028,
      "grad_norm": 0.4307943754482952,
      "learning_rate": 4.076219298068808e-05,
      "loss": 1.3644,
      "num_input_tokens_seen": 25229225984,
      "step": 32067
    },
    {
      "epoch": 3.402079354975599,
      "grad_norm": 0.6922426049407174,
      "learning_rate": 4.076165354033845e-05,
      "loss": 1.5418,
      "num_input_tokens_seen": 25230012752,
      "step": 32068
    },
    {
      "epoch": 3.4021854445151707,
      "grad_norm": 0.4550516685363149,
      "learning_rate": 4.0761114087808684e-05,
      "loss": 1.4718,
      "num_input_tokens_seen": 25230799408,
      "step": 32069
    },
    {
      "epoch": 3.402291534054742,
      "grad_norm": 0.58048768518131,
      "learning_rate": 4.076057462309919e-05,
      "loss": 1.5807,
      "num_input_tokens_seen": 25231586112,
      "step": 32070
    },
    {
      "epoch": 3.4023976235943136,
      "grad_norm": 0.4726069503540491,
      "learning_rate": 4.0760035146210394e-05,
      "loss": 1.4312,
      "num_input_tokens_seen": 25232373008,
      "step": 32071
    },
    {
      "epoch": 3.402503713133885,
      "grad_norm": 0.3796408151408107,
      "learning_rate": 4.07594956571427e-05,
      "loss": 1.2945,
      "num_input_tokens_seen": 25233159808,
      "step": 32072
    },
    {
      "epoch": 3.4026098026734566,
      "grad_norm": 0.5447920048313166,
      "learning_rate": 4.075895615589653e-05,
      "loss": 1.4279,
      "num_input_tokens_seen": 25233946480,
      "step": 32073
    },
    {
      "epoch": 3.4027158922130276,
      "grad_norm": 0.4519625493504028,
      "learning_rate": 4.07584166424723e-05,
      "loss": 1.5262,
      "num_input_tokens_seen": 25234733168,
      "step": 32074
    },
    {
      "epoch": 3.402821981752599,
      "grad_norm": 0.4891063684997465,
      "learning_rate": 4.075787711687042e-05,
      "loss": 1.4154,
      "num_input_tokens_seen": 25235519904,
      "step": 32075
    },
    {
      "epoch": 3.4029280712921706,
      "grad_norm": 0.5008176093183345,
      "learning_rate": 4.075733757909133e-05,
      "loss": 1.5625,
      "num_input_tokens_seen": 25236306560,
      "step": 32076
    },
    {
      "epoch": 3.403034160831742,
      "grad_norm": 0.4596228917142774,
      "learning_rate": 4.075679802913543e-05,
      "loss": 1.5007,
      "num_input_tokens_seen": 25237093408,
      "step": 32077
    },
    {
      "epoch": 3.4031402503713135,
      "grad_norm": 0.5938891134136818,
      "learning_rate": 4.075625846700313e-05,
      "loss": 1.4985,
      "num_input_tokens_seen": 25237880160,
      "step": 32078
    },
    {
      "epoch": 3.4032463399108845,
      "grad_norm": 0.3964931842914871,
      "learning_rate": 4.075571889269486e-05,
      "loss": 1.4629,
      "num_input_tokens_seen": 25238666864,
      "step": 32079
    },
    {
      "epoch": 3.403352429450456,
      "grad_norm": 0.4974154453149187,
      "learning_rate": 4.075517930621103e-05,
      "loss": 1.3641,
      "num_input_tokens_seen": 25239453664,
      "step": 32080
    },
    {
      "epoch": 3.4034585189900275,
      "grad_norm": 0.4534191669866611,
      "learning_rate": 4.075463970755207e-05,
      "loss": 1.4159,
      "num_input_tokens_seen": 25240240512,
      "step": 32081
    },
    {
      "epoch": 3.403564608529599,
      "grad_norm": 0.4720059664882283,
      "learning_rate": 4.075410009671838e-05,
      "loss": 1.5591,
      "num_input_tokens_seen": 25241027248,
      "step": 32082
    },
    {
      "epoch": 3.4036706980691704,
      "grad_norm": 0.46126386821605364,
      "learning_rate": 4.0753560473710385e-05,
      "loss": 1.3856,
      "num_input_tokens_seen": 25241813968,
      "step": 32083
    },
    {
      "epoch": 3.403776787608742,
      "grad_norm": 0.4702577372185186,
      "learning_rate": 4.07530208385285e-05,
      "loss": 1.4615,
      "num_input_tokens_seen": 25242600720,
      "step": 32084
    },
    {
      "epoch": 3.4038828771483134,
      "grad_norm": 0.47596755294299753,
      "learning_rate": 4.0752481191173135e-05,
      "loss": 1.4675,
      "num_input_tokens_seen": 25243387424,
      "step": 32085
    },
    {
      "epoch": 3.4039889666878844,
      "grad_norm": 0.44729812013246223,
      "learning_rate": 4.075194153164472e-05,
      "loss": 1.4256,
      "num_input_tokens_seen": 25244174352,
      "step": 32086
    },
    {
      "epoch": 3.404095056227456,
      "grad_norm": 0.4715430363495923,
      "learning_rate": 4.0751401859943674e-05,
      "loss": 1.4234,
      "num_input_tokens_seen": 25244961120,
      "step": 32087
    },
    {
      "epoch": 3.4042011457670274,
      "grad_norm": 0.45115468373148987,
      "learning_rate": 4.075086217607039e-05,
      "loss": 1.3671,
      "num_input_tokens_seen": 25245747920,
      "step": 32088
    },
    {
      "epoch": 3.404307235306599,
      "grad_norm": 0.44391423983655853,
      "learning_rate": 4.0750322480025316e-05,
      "loss": 1.4908,
      "num_input_tokens_seen": 25246534672,
      "step": 32089
    },
    {
      "epoch": 3.4044133248461703,
      "grad_norm": 0.44777002473299715,
      "learning_rate": 4.074978277180885e-05,
      "loss": 1.5882,
      "num_input_tokens_seen": 25247321312,
      "step": 32090
    },
    {
      "epoch": 3.4045194143857413,
      "grad_norm": 0.4544260233265266,
      "learning_rate": 4.074924305142142e-05,
      "loss": 1.5229,
      "num_input_tokens_seen": 25248108096,
      "step": 32091
    },
    {
      "epoch": 3.404625503925313,
      "grad_norm": 0.395354257848937,
      "learning_rate": 4.074870331886343e-05,
      "loss": 1.4203,
      "num_input_tokens_seen": 25248894816,
      "step": 32092
    },
    {
      "epoch": 3.4047315934648843,
      "grad_norm": 0.454896691918949,
      "learning_rate": 4.074816357413531e-05,
      "loss": 1.5441,
      "num_input_tokens_seen": 25249681584,
      "step": 32093
    },
    {
      "epoch": 3.4048376830044558,
      "grad_norm": 0.3988845906566807,
      "learning_rate": 4.074762381723747e-05,
      "loss": 1.4822,
      "num_input_tokens_seen": 25250468384,
      "step": 32094
    },
    {
      "epoch": 3.4049437725440272,
      "grad_norm": 0.4657741382699467,
      "learning_rate": 4.074708404817033e-05,
      "loss": 1.4765,
      "num_input_tokens_seen": 25251255232,
      "step": 32095
    },
    {
      "epoch": 3.4050498620835987,
      "grad_norm": 0.4648175835067794,
      "learning_rate": 4.0746544266934296e-05,
      "loss": 1.5004,
      "num_input_tokens_seen": 25252042096,
      "step": 32096
    },
    {
      "epoch": 3.40515595162317,
      "grad_norm": 0.3941013297277622,
      "learning_rate": 4.07460044735298e-05,
      "loss": 1.3978,
      "num_input_tokens_seen": 25252828832,
      "step": 32097
    },
    {
      "epoch": 3.4052620411627412,
      "grad_norm": 0.44023611151817366,
      "learning_rate": 4.074546466795725e-05,
      "loss": 1.4972,
      "num_input_tokens_seen": 25253615552,
      "step": 32098
    },
    {
      "epoch": 3.4053681307023127,
      "grad_norm": 0.4068121576335671,
      "learning_rate": 4.074492485021708e-05,
      "loss": 1.501,
      "num_input_tokens_seen": 25254402256,
      "step": 32099
    },
    {
      "epoch": 3.405474220241884,
      "grad_norm": 0.46142987051067297,
      "learning_rate": 4.074438502030968e-05,
      "loss": 1.4592,
      "num_input_tokens_seen": 25255189072,
      "step": 32100
    },
    {
      "epoch": 3.4055803097814557,
      "grad_norm": 0.43109797249192006,
      "learning_rate": 4.074384517823549e-05,
      "loss": 1.2865,
      "num_input_tokens_seen": 25255975856,
      "step": 32101
    },
    {
      "epoch": 3.405686399321027,
      "grad_norm": 0.4031072433999092,
      "learning_rate": 4.074330532399492e-05,
      "loss": 1.4962,
      "num_input_tokens_seen": 25256762576,
      "step": 32102
    },
    {
      "epoch": 3.405792488860598,
      "grad_norm": 0.4512056731550505,
      "learning_rate": 4.074276545758838e-05,
      "loss": 1.4825,
      "num_input_tokens_seen": 25257549312,
      "step": 32103
    },
    {
      "epoch": 3.4058985784001696,
      "grad_norm": 0.430368209338229,
      "learning_rate": 4.074222557901629e-05,
      "loss": 1.5733,
      "num_input_tokens_seen": 25258336048,
      "step": 32104
    },
    {
      "epoch": 3.406004667939741,
      "grad_norm": 0.43014914088432704,
      "learning_rate": 4.074168568827907e-05,
      "loss": 1.3632,
      "num_input_tokens_seen": 25259122768,
      "step": 32105
    },
    {
      "epoch": 3.4061107574793126,
      "grad_norm": 0.46085506736445303,
      "learning_rate": 4.0741145785377146e-05,
      "loss": 1.5177,
      "num_input_tokens_seen": 25259909584,
      "step": 32106
    },
    {
      "epoch": 3.406216847018884,
      "grad_norm": 0.4060632002922016,
      "learning_rate": 4.0740605870310925e-05,
      "loss": 1.5002,
      "num_input_tokens_seen": 25260696384,
      "step": 32107
    },
    {
      "epoch": 3.4063229365584555,
      "grad_norm": 0.4764020063406017,
      "learning_rate": 4.0740065943080816e-05,
      "loss": 1.4261,
      "num_input_tokens_seen": 25261483104,
      "step": 32108
    },
    {
      "epoch": 3.4064290260980266,
      "grad_norm": 0.416839303296639,
      "learning_rate": 4.073952600368726e-05,
      "loss": 1.376,
      "num_input_tokens_seen": 25262269920,
      "step": 32109
    },
    {
      "epoch": 3.406535115637598,
      "grad_norm": 0.45998398337618795,
      "learning_rate": 4.073898605213065e-05,
      "loss": 1.5009,
      "num_input_tokens_seen": 25263056720,
      "step": 32110
    },
    {
      "epoch": 3.4066412051771695,
      "grad_norm": 0.4997728004149248,
      "learning_rate": 4.073844608841141e-05,
      "loss": 1.5148,
      "num_input_tokens_seen": 25263843472,
      "step": 32111
    },
    {
      "epoch": 3.406747294716741,
      "grad_norm": 0.41904704144403737,
      "learning_rate": 4.0737906112529965e-05,
      "loss": 1.4949,
      "num_input_tokens_seen": 25264630224,
      "step": 32112
    },
    {
      "epoch": 3.4068533842563125,
      "grad_norm": 0.5265477633237426,
      "learning_rate": 4.073736612448673e-05,
      "loss": 1.5333,
      "num_input_tokens_seen": 25265416976,
      "step": 32113
    },
    {
      "epoch": 3.406959473795884,
      "grad_norm": 0.42907887173045073,
      "learning_rate": 4.073682612428211e-05,
      "loss": 1.4425,
      "num_input_tokens_seen": 25266203632,
      "step": 32114
    },
    {
      "epoch": 3.407065563335455,
      "grad_norm": 0.4798847973569606,
      "learning_rate": 4.073628611191655e-05,
      "loss": 1.3931,
      "num_input_tokens_seen": 25266990496,
      "step": 32115
    },
    {
      "epoch": 3.4071716528750264,
      "grad_norm": 0.39897505818870205,
      "learning_rate": 4.073574608739044e-05,
      "loss": 1.4313,
      "num_input_tokens_seen": 25267777296,
      "step": 32116
    },
    {
      "epoch": 3.407277742414598,
      "grad_norm": 0.38803352697664567,
      "learning_rate": 4.073520605070421e-05,
      "loss": 1.4097,
      "num_input_tokens_seen": 25268564032,
      "step": 32117
    },
    {
      "epoch": 3.4073838319541694,
      "grad_norm": 0.4931859084806422,
      "learning_rate": 4.073466600185827e-05,
      "loss": 1.4045,
      "num_input_tokens_seen": 25269350768,
      "step": 32118
    },
    {
      "epoch": 3.407489921493741,
      "grad_norm": 0.43819691077886513,
      "learning_rate": 4.073412594085305e-05,
      "loss": 1.4181,
      "num_input_tokens_seen": 25270137568,
      "step": 32119
    },
    {
      "epoch": 3.407596011033312,
      "grad_norm": 0.5097058525144167,
      "learning_rate": 4.073358586768895e-05,
      "loss": 1.4473,
      "num_input_tokens_seen": 25270924272,
      "step": 32120
    },
    {
      "epoch": 3.4077021005728834,
      "grad_norm": 0.38923928517270456,
      "learning_rate": 4.0733045782366394e-05,
      "loss": 1.5267,
      "num_input_tokens_seen": 25271711024,
      "step": 32121
    },
    {
      "epoch": 3.407808190112455,
      "grad_norm": 0.4371021192712947,
      "learning_rate": 4.0732505684885813e-05,
      "loss": 1.3928,
      "num_input_tokens_seen": 25272497696,
      "step": 32122
    },
    {
      "epoch": 3.4079142796520263,
      "grad_norm": 0.3982235407228389,
      "learning_rate": 4.073196557524761e-05,
      "loss": 1.4521,
      "num_input_tokens_seen": 25273284528,
      "step": 32123
    },
    {
      "epoch": 3.408020369191598,
      "grad_norm": 0.4451112193320875,
      "learning_rate": 4.0731425453452206e-05,
      "loss": 1.3877,
      "num_input_tokens_seen": 25274071360,
      "step": 32124
    },
    {
      "epoch": 3.4081264587311693,
      "grad_norm": 0.4377802466772626,
      "learning_rate": 4.0730885319500013e-05,
      "loss": 1.3295,
      "num_input_tokens_seen": 25274858080,
      "step": 32125
    },
    {
      "epoch": 3.4082325482707407,
      "grad_norm": 0.4320565327928625,
      "learning_rate": 4.073034517339146e-05,
      "loss": 1.4488,
      "num_input_tokens_seen": 25275644912,
      "step": 32126
    },
    {
      "epoch": 3.4083386378103118,
      "grad_norm": 0.42590712745041337,
      "learning_rate": 4.0729805015126956e-05,
      "loss": 1.4504,
      "num_input_tokens_seen": 25276431664,
      "step": 32127
    },
    {
      "epoch": 3.4084447273498832,
      "grad_norm": 0.41918230409459234,
      "learning_rate": 4.072926484470692e-05,
      "loss": 1.5114,
      "num_input_tokens_seen": 25277218352,
      "step": 32128
    },
    {
      "epoch": 3.4085508168894547,
      "grad_norm": 0.4189521785771988,
      "learning_rate": 4.072872466213176e-05,
      "loss": 1.4873,
      "num_input_tokens_seen": 25278005072,
      "step": 32129
    },
    {
      "epoch": 3.408656906429026,
      "grad_norm": 0.4334333555727518,
      "learning_rate": 4.072818446740191e-05,
      "loss": 1.5208,
      "num_input_tokens_seen": 25278791824,
      "step": 32130
    },
    {
      "epoch": 3.4087629959685977,
      "grad_norm": 0.4515822081136638,
      "learning_rate": 4.072764426051778e-05,
      "loss": 1.4269,
      "num_input_tokens_seen": 25279578560,
      "step": 32131
    },
    {
      "epoch": 3.4088690855081687,
      "grad_norm": 0.41436604241209235,
      "learning_rate": 4.0727104041479796e-05,
      "loss": 1.3856,
      "num_input_tokens_seen": 25280365328,
      "step": 32132
    },
    {
      "epoch": 3.40897517504774,
      "grad_norm": 0.36779465856092514,
      "learning_rate": 4.072656381028836e-05,
      "loss": 1.3061,
      "num_input_tokens_seen": 25281152112,
      "step": 32133
    },
    {
      "epoch": 3.4090812645873116,
      "grad_norm": 0.42663649735994447,
      "learning_rate": 4.072602356694389e-05,
      "loss": 1.4327,
      "num_input_tokens_seen": 25281938960,
      "step": 32134
    },
    {
      "epoch": 3.409187354126883,
      "grad_norm": 0.4191295742135602,
      "learning_rate": 4.072548331144682e-05,
      "loss": 1.4667,
      "num_input_tokens_seen": 25282725744,
      "step": 32135
    },
    {
      "epoch": 3.4092934436664546,
      "grad_norm": 0.4494515928762283,
      "learning_rate": 4.072494304379756e-05,
      "loss": 1.5729,
      "num_input_tokens_seen": 25283512496,
      "step": 32136
    },
    {
      "epoch": 3.409399533206026,
      "grad_norm": 0.43231296464869556,
      "learning_rate": 4.0724402763996517e-05,
      "loss": 1.5364,
      "num_input_tokens_seen": 25284299248,
      "step": 32137
    },
    {
      "epoch": 3.409505622745597,
      "grad_norm": 0.4814986155896516,
      "learning_rate": 4.072386247204413e-05,
      "loss": 1.5328,
      "num_input_tokens_seen": 25285085984,
      "step": 32138
    },
    {
      "epoch": 3.4096117122851686,
      "grad_norm": 0.44130157707156925,
      "learning_rate": 4.072332216794079e-05,
      "loss": 1.3836,
      "num_input_tokens_seen": 25285872816,
      "step": 32139
    },
    {
      "epoch": 3.40971780182474,
      "grad_norm": 0.3921009090977161,
      "learning_rate": 4.072278185168693e-05,
      "loss": 1.3983,
      "num_input_tokens_seen": 25286659520,
      "step": 32140
    },
    {
      "epoch": 3.4098238913643115,
      "grad_norm": 0.5020336880619413,
      "learning_rate": 4.0722241523282975e-05,
      "loss": 1.4469,
      "num_input_tokens_seen": 25287446256,
      "step": 32141
    },
    {
      "epoch": 3.409929980903883,
      "grad_norm": 0.4616123107362248,
      "learning_rate": 4.072170118272932e-05,
      "loss": 1.4316,
      "num_input_tokens_seen": 25288233040,
      "step": 32142
    },
    {
      "epoch": 3.4100360704434545,
      "grad_norm": 0.4893411811126261,
      "learning_rate": 4.0721160830026406e-05,
      "loss": 1.5051,
      "num_input_tokens_seen": 25289019728,
      "step": 32143
    },
    {
      "epoch": 3.4101421599830255,
      "grad_norm": 0.5713329103442161,
      "learning_rate": 4.072062046517464e-05,
      "loss": 1.5429,
      "num_input_tokens_seen": 25289806544,
      "step": 32144
    },
    {
      "epoch": 3.410248249522597,
      "grad_norm": 0.5289009212247593,
      "learning_rate": 4.072008008817443e-05,
      "loss": 1.3489,
      "num_input_tokens_seen": 25290593296,
      "step": 32145
    },
    {
      "epoch": 3.4103543390621684,
      "grad_norm": 0.48240963558234246,
      "learning_rate": 4.071953969902621e-05,
      "loss": 1.5501,
      "num_input_tokens_seen": 25291380080,
      "step": 32146
    },
    {
      "epoch": 3.41046042860174,
      "grad_norm": 0.4477057416324783,
      "learning_rate": 4.071899929773039e-05,
      "loss": 1.486,
      "num_input_tokens_seen": 25292166912,
      "step": 32147
    },
    {
      "epoch": 3.4105665181413114,
      "grad_norm": 0.46828669425989283,
      "learning_rate": 4.071845888428739e-05,
      "loss": 1.3639,
      "num_input_tokens_seen": 25292953712,
      "step": 32148
    },
    {
      "epoch": 3.4106726076808824,
      "grad_norm": 0.45018269707930525,
      "learning_rate": 4.071791845869763e-05,
      "loss": 1.547,
      "num_input_tokens_seen": 25293740512,
      "step": 32149
    },
    {
      "epoch": 3.410778697220454,
      "grad_norm": 0.5242223647382143,
      "learning_rate": 4.0717378020961515e-05,
      "loss": 1.5126,
      "num_input_tokens_seen": 25294527264,
      "step": 32150
    },
    {
      "epoch": 3.4108847867600254,
      "grad_norm": 0.4297717663755966,
      "learning_rate": 4.0716837571079483e-05,
      "loss": 1.4399,
      "num_input_tokens_seen": 25295314096,
      "step": 32151
    },
    {
      "epoch": 3.410990876299597,
      "grad_norm": 0.44937189032340535,
      "learning_rate": 4.071629710905193e-05,
      "loss": 1.4684,
      "num_input_tokens_seen": 25296100864,
      "step": 32152
    },
    {
      "epoch": 3.4110969658391683,
      "grad_norm": 0.5021910020377026,
      "learning_rate": 4.071575663487929e-05,
      "loss": 1.4802,
      "num_input_tokens_seen": 25296887632,
      "step": 32153
    },
    {
      "epoch": 3.41120305537874,
      "grad_norm": 0.445181674915423,
      "learning_rate": 4.0715216148561966e-05,
      "loss": 1.3908,
      "num_input_tokens_seen": 25297674416,
      "step": 32154
    },
    {
      "epoch": 3.4113091449183113,
      "grad_norm": 0.50761949837981,
      "learning_rate": 4.0714675650100386e-05,
      "loss": 1.4497,
      "num_input_tokens_seen": 25298461184,
      "step": 32155
    },
    {
      "epoch": 3.4114152344578823,
      "grad_norm": 0.4400239480814474,
      "learning_rate": 4.071413513949497e-05,
      "loss": 1.4783,
      "num_input_tokens_seen": 25299247920,
      "step": 32156
    },
    {
      "epoch": 3.411521323997454,
      "grad_norm": 0.43094760764330936,
      "learning_rate": 4.071359461674613e-05,
      "loss": 1.3614,
      "num_input_tokens_seen": 25300034784,
      "step": 32157
    },
    {
      "epoch": 3.4116274135370253,
      "grad_norm": 0.5089195923882364,
      "learning_rate": 4.0713054081854285e-05,
      "loss": 1.5075,
      "num_input_tokens_seen": 25300821552,
      "step": 32158
    },
    {
      "epoch": 3.4117335030765967,
      "grad_norm": 0.5077166652849708,
      "learning_rate": 4.071251353481985e-05,
      "loss": 1.524,
      "num_input_tokens_seen": 25301608336,
      "step": 32159
    },
    {
      "epoch": 3.411839592616168,
      "grad_norm": 0.5787471388349577,
      "learning_rate": 4.0711972975643255e-05,
      "loss": 1.4588,
      "num_input_tokens_seen": 25302395088,
      "step": 32160
    },
    {
      "epoch": 3.4119456821557392,
      "grad_norm": 0.5465342048604176,
      "learning_rate": 4.07114324043249e-05,
      "loss": 1.4355,
      "num_input_tokens_seen": 25303181792,
      "step": 32161
    },
    {
      "epoch": 3.4120517716953107,
      "grad_norm": 0.4748431048964494,
      "learning_rate": 4.071089182086522e-05,
      "loss": 1.359,
      "num_input_tokens_seen": 25303968608,
      "step": 32162
    },
    {
      "epoch": 3.412157861234882,
      "grad_norm": 0.6065903630409042,
      "learning_rate": 4.0710351225264606e-05,
      "loss": 1.5665,
      "num_input_tokens_seen": 25304755248,
      "step": 32163
    },
    {
      "epoch": 3.4122639507744537,
      "grad_norm": 0.3848393694425305,
      "learning_rate": 4.070981061752351e-05,
      "loss": 1.3693,
      "num_input_tokens_seen": 25305542016,
      "step": 32164
    },
    {
      "epoch": 3.412370040314025,
      "grad_norm": 0.6605790759392026,
      "learning_rate": 4.070926999764233e-05,
      "loss": 1.465,
      "num_input_tokens_seen": 25306328736,
      "step": 32165
    },
    {
      "epoch": 3.4124761298535966,
      "grad_norm": 0.4705144006338498,
      "learning_rate": 4.070872936562148e-05,
      "loss": 1.4771,
      "num_input_tokens_seen": 25307115552,
      "step": 32166
    },
    {
      "epoch": 3.412582219393168,
      "grad_norm": 0.5956527051954803,
      "learning_rate": 4.0708188721461395e-05,
      "loss": 1.446,
      "num_input_tokens_seen": 25307902336,
      "step": 32167
    },
    {
      "epoch": 3.412688308932739,
      "grad_norm": 0.5823460251841424,
      "learning_rate": 4.0707648065162476e-05,
      "loss": 1.3975,
      "num_input_tokens_seen": 25308689072,
      "step": 32168
    },
    {
      "epoch": 3.4127943984723106,
      "grad_norm": 0.42606747697777714,
      "learning_rate": 4.070710739672515e-05,
      "loss": 1.4996,
      "num_input_tokens_seen": 25309475712,
      "step": 32169
    },
    {
      "epoch": 3.412900488011882,
      "grad_norm": 0.9977553008173177,
      "learning_rate": 4.070656671614983e-05,
      "loss": 1.5099,
      "num_input_tokens_seen": 25310262352,
      "step": 32170
    },
    {
      "epoch": 3.4130065775514535,
      "grad_norm": 0.42718766935547586,
      "learning_rate": 4.070602602343694e-05,
      "loss": 1.3768,
      "num_input_tokens_seen": 25311049088,
      "step": 32171
    },
    {
      "epoch": 3.413112667091025,
      "grad_norm": 1.0257790811262304,
      "learning_rate": 4.070548531858689e-05,
      "loss": 1.4287,
      "num_input_tokens_seen": 25311835856,
      "step": 32172
    },
    {
      "epoch": 3.413218756630596,
      "grad_norm": 0.4415535544081194,
      "learning_rate": 4.070494460160011e-05,
      "loss": 1.4798,
      "num_input_tokens_seen": 25312622576,
      "step": 32173
    },
    {
      "epoch": 3.4133248461701675,
      "grad_norm": 0.8224587889661841,
      "learning_rate": 4.0704403872476995e-05,
      "loss": 1.501,
      "num_input_tokens_seen": 25313409360,
      "step": 32174
    },
    {
      "epoch": 3.413430935709739,
      "grad_norm": 0.5641219893733578,
      "learning_rate": 4.070386313121798e-05,
      "loss": 1.4957,
      "num_input_tokens_seen": 25314196256,
      "step": 32175
    },
    {
      "epoch": 3.4135370252493105,
      "grad_norm": 0.4724930216121314,
      "learning_rate": 4.0703322377823485e-05,
      "loss": 1.3626,
      "num_input_tokens_seen": 25314983024,
      "step": 32176
    },
    {
      "epoch": 3.413643114788882,
      "grad_norm": 0.6992718949122523,
      "learning_rate": 4.070278161229393e-05,
      "loss": 1.396,
      "num_input_tokens_seen": 25315769824,
      "step": 32177
    },
    {
      "epoch": 3.413749204328453,
      "grad_norm": 0.50292410103286,
      "learning_rate": 4.070224083462971e-05,
      "loss": 1.3465,
      "num_input_tokens_seen": 25316556624,
      "step": 32178
    },
    {
      "epoch": 3.4138552938680244,
      "grad_norm": 0.5010748448849838,
      "learning_rate": 4.0701700044831276e-05,
      "loss": 1.4464,
      "num_input_tokens_seen": 25317343488,
      "step": 32179
    },
    {
      "epoch": 3.413961383407596,
      "grad_norm": 0.7880121408441124,
      "learning_rate": 4.070115924289902e-05,
      "loss": 1.4304,
      "num_input_tokens_seen": 25318130304,
      "step": 32180
    },
    {
      "epoch": 3.4140674729471674,
      "grad_norm": 0.471598051002333,
      "learning_rate": 4.070061842883337e-05,
      "loss": 1.4908,
      "num_input_tokens_seen": 25318917072,
      "step": 32181
    },
    {
      "epoch": 3.414173562486739,
      "grad_norm": 0.5654284876137438,
      "learning_rate": 4.070007760263475e-05,
      "loss": 1.5774,
      "num_input_tokens_seen": 25319703888,
      "step": 32182
    },
    {
      "epoch": 3.4142796520263103,
      "grad_norm": 0.5974632412705688,
      "learning_rate": 4.0699536764303555e-05,
      "loss": 1.5609,
      "num_input_tokens_seen": 25320490640,
      "step": 32183
    },
    {
      "epoch": 3.414385741565882,
      "grad_norm": 0.49159419150983535,
      "learning_rate": 4.069899591384023e-05,
      "loss": 1.4568,
      "num_input_tokens_seen": 25321277344,
      "step": 32184
    },
    {
      "epoch": 3.414491831105453,
      "grad_norm": 0.48937400808384457,
      "learning_rate": 4.0698455051245175e-05,
      "loss": 1.4384,
      "num_input_tokens_seen": 25322064096,
      "step": 32185
    },
    {
      "epoch": 3.4145979206450243,
      "grad_norm": 0.4813902779047014,
      "learning_rate": 4.069791417651882e-05,
      "loss": 1.4346,
      "num_input_tokens_seen": 25322850912,
      "step": 32186
    },
    {
      "epoch": 3.414704010184596,
      "grad_norm": 0.4758319998670223,
      "learning_rate": 4.069737328966158e-05,
      "loss": 1.4934,
      "num_input_tokens_seen": 25323637760,
      "step": 32187
    },
    {
      "epoch": 3.4148100997241673,
      "grad_norm": 0.5337322815140052,
      "learning_rate": 4.069683239067387e-05,
      "loss": 1.3687,
      "num_input_tokens_seen": 25324424544,
      "step": 32188
    },
    {
      "epoch": 3.4149161892637387,
      "grad_norm": 0.45295298486968083,
      "learning_rate": 4.06962914795561e-05,
      "loss": 1.5191,
      "num_input_tokens_seen": 25325211264,
      "step": 32189
    },
    {
      "epoch": 3.4150222788033098,
      "grad_norm": 0.6398909905516359,
      "learning_rate": 4.0695750556308696e-05,
      "loss": 1.5003,
      "num_input_tokens_seen": 25325998032,
      "step": 32190
    },
    {
      "epoch": 3.4151283683428812,
      "grad_norm": 0.56475063695261,
      "learning_rate": 4.0695209620932085e-05,
      "loss": 1.6038,
      "num_input_tokens_seen": 25326784752,
      "step": 32191
    },
    {
      "epoch": 3.4152344578824527,
      "grad_norm": 0.6397288218313424,
      "learning_rate": 4.0694668673426675e-05,
      "loss": 1.4993,
      "num_input_tokens_seen": 25327571552,
      "step": 32192
    },
    {
      "epoch": 3.415340547422024,
      "grad_norm": 0.43467139698086493,
      "learning_rate": 4.0694127713792884e-05,
      "loss": 1.3606,
      "num_input_tokens_seen": 25328358336,
      "step": 32193
    },
    {
      "epoch": 3.4154466369615957,
      "grad_norm": 0.5220652071592876,
      "learning_rate": 4.069358674203113e-05,
      "loss": 1.3918,
      "num_input_tokens_seen": 25329145136,
      "step": 32194
    },
    {
      "epoch": 3.415552726501167,
      "grad_norm": 0.5364266042329368,
      "learning_rate": 4.0693045758141835e-05,
      "loss": 1.4759,
      "num_input_tokens_seen": 25329931904,
      "step": 32195
    },
    {
      "epoch": 3.4156588160407386,
      "grad_norm": 0.47488346911748064,
      "learning_rate": 4.069250476212542e-05,
      "loss": 1.5022,
      "num_input_tokens_seen": 25330718656,
      "step": 32196
    },
    {
      "epoch": 3.4157649055803097,
      "grad_norm": 0.5226869189563493,
      "learning_rate": 4.069196375398229e-05,
      "loss": 1.5348,
      "num_input_tokens_seen": 25331505296,
      "step": 32197
    },
    {
      "epoch": 3.415870995119881,
      "grad_norm": 0.4300456455938264,
      "learning_rate": 4.069142273371287e-05,
      "loss": 1.3713,
      "num_input_tokens_seen": 25332292192,
      "step": 32198
    },
    {
      "epoch": 3.4159770846594526,
      "grad_norm": 0.6383859274114799,
      "learning_rate": 4.0690881701317586e-05,
      "loss": 1.4764,
      "num_input_tokens_seen": 25333078976,
      "step": 32199
    },
    {
      "epoch": 3.416083174199024,
      "grad_norm": 0.5166854891848398,
      "learning_rate": 4.0690340656796844e-05,
      "loss": 1.4613,
      "num_input_tokens_seen": 25333865680,
      "step": 32200
    },
    {
      "epoch": 3.4161892637385955,
      "grad_norm": 0.5146221786552693,
      "learning_rate": 4.068979960015107e-05,
      "loss": 1.5596,
      "num_input_tokens_seen": 25334652512,
      "step": 32201
    },
    {
      "epoch": 3.4162953532781666,
      "grad_norm": 0.5221041035494256,
      "learning_rate": 4.0689258531380667e-05,
      "loss": 1.4136,
      "num_input_tokens_seen": 25335439312,
      "step": 32202
    },
    {
      "epoch": 3.416401442817738,
      "grad_norm": 0.4127268955551659,
      "learning_rate": 4.068871745048608e-05,
      "loss": 1.3633,
      "num_input_tokens_seen": 25336226112,
      "step": 32203
    },
    {
      "epoch": 3.4165075323573095,
      "grad_norm": 0.5848484680913233,
      "learning_rate": 4.068817635746771e-05,
      "loss": 1.4883,
      "num_input_tokens_seen": 25337012896,
      "step": 32204
    },
    {
      "epoch": 3.416613621896881,
      "grad_norm": 0.43921156865929734,
      "learning_rate": 4.0687635252325974e-05,
      "loss": 1.4663,
      "num_input_tokens_seen": 25337799648,
      "step": 32205
    },
    {
      "epoch": 3.4167197114364525,
      "grad_norm": 0.43690171259252325,
      "learning_rate": 4.0687094135061296e-05,
      "loss": 1.4594,
      "num_input_tokens_seen": 25338586464,
      "step": 32206
    },
    {
      "epoch": 3.416825800976024,
      "grad_norm": 0.46232125420856607,
      "learning_rate": 4.0686553005674087e-05,
      "loss": 1.4501,
      "num_input_tokens_seen": 25339373200,
      "step": 32207
    },
    {
      "epoch": 3.416931890515595,
      "grad_norm": 0.4169823642392577,
      "learning_rate": 4.068601186416478e-05,
      "loss": 1.3795,
      "num_input_tokens_seen": 25340159920,
      "step": 32208
    },
    {
      "epoch": 3.4170379800551665,
      "grad_norm": 0.5375810163994263,
      "learning_rate": 4.068547071053378e-05,
      "loss": 1.5238,
      "num_input_tokens_seen": 25340946720,
      "step": 32209
    },
    {
      "epoch": 3.417144069594738,
      "grad_norm": 0.38887900624569405,
      "learning_rate": 4.0684929544781505e-05,
      "loss": 1.4621,
      "num_input_tokens_seen": 25341733536,
      "step": 32210
    },
    {
      "epoch": 3.4172501591343094,
      "grad_norm": 0.43493419928731575,
      "learning_rate": 4.0684388366908374e-05,
      "loss": 1.5371,
      "num_input_tokens_seen": 25342520432,
      "step": 32211
    },
    {
      "epoch": 3.417356248673881,
      "grad_norm": 0.41237410390019746,
      "learning_rate": 4.068384717691481e-05,
      "loss": 1.5208,
      "num_input_tokens_seen": 25343307136,
      "step": 32212
    },
    {
      "epoch": 3.4174623382134524,
      "grad_norm": 0.4533520453758759,
      "learning_rate": 4.068330597480123e-05,
      "loss": 1.3785,
      "num_input_tokens_seen": 25344094048,
      "step": 32213
    },
    {
      "epoch": 3.4175684277530234,
      "grad_norm": 0.4583414607622575,
      "learning_rate": 4.068276476056806e-05,
      "loss": 1.4766,
      "num_input_tokens_seen": 25344880800,
      "step": 32214
    },
    {
      "epoch": 3.417674517292595,
      "grad_norm": 0.5569543344324814,
      "learning_rate": 4.06822235342157e-05,
      "loss": 1.4697,
      "num_input_tokens_seen": 25345667568,
      "step": 32215
    },
    {
      "epoch": 3.4177806068321663,
      "grad_norm": 0.43800670925273283,
      "learning_rate": 4.068168229574458e-05,
      "loss": 1.4769,
      "num_input_tokens_seen": 25346454368,
      "step": 32216
    },
    {
      "epoch": 3.417886696371738,
      "grad_norm": 0.39887309034787855,
      "learning_rate": 4.0681141045155114e-05,
      "loss": 1.3358,
      "num_input_tokens_seen": 25347241216,
      "step": 32217
    },
    {
      "epoch": 3.4179927859113093,
      "grad_norm": 0.44930026969253506,
      "learning_rate": 4.0680599782447724e-05,
      "loss": 1.4318,
      "num_input_tokens_seen": 25348027984,
      "step": 32218
    },
    {
      "epoch": 3.4180988754508803,
      "grad_norm": 0.42810789118774556,
      "learning_rate": 4.068005850762283e-05,
      "loss": 1.4939,
      "num_input_tokens_seen": 25348814720,
      "step": 32219
    },
    {
      "epoch": 3.418204964990452,
      "grad_norm": 0.4255455687525577,
      "learning_rate": 4.0679517220680843e-05,
      "loss": 1.5737,
      "num_input_tokens_seen": 25349601584,
      "step": 32220
    },
    {
      "epoch": 3.4183110545300233,
      "grad_norm": 0.4101228830730172,
      "learning_rate": 4.067897592162218e-05,
      "loss": 1.4982,
      "num_input_tokens_seen": 25350388288,
      "step": 32221
    },
    {
      "epoch": 3.4184171440695947,
      "grad_norm": 0.4284012155302315,
      "learning_rate": 4.0678434610447266e-05,
      "loss": 1.4423,
      "num_input_tokens_seen": 25351175072,
      "step": 32222
    },
    {
      "epoch": 3.418523233609166,
      "grad_norm": 0.3695763647042545,
      "learning_rate": 4.067789328715653e-05,
      "loss": 1.4321,
      "num_input_tokens_seen": 25351961808,
      "step": 32223
    },
    {
      "epoch": 3.4186293231487377,
      "grad_norm": 0.3914478644114406,
      "learning_rate": 4.067735195175037e-05,
      "loss": 1.5186,
      "num_input_tokens_seen": 25352748544,
      "step": 32224
    },
    {
      "epoch": 3.418735412688309,
      "grad_norm": 0.4140373304272677,
      "learning_rate": 4.067681060422921e-05,
      "loss": 1.4324,
      "num_input_tokens_seen": 25353535360,
      "step": 32225
    },
    {
      "epoch": 3.41884150222788,
      "grad_norm": 0.4233549676658839,
      "learning_rate": 4.067626924459347e-05,
      "loss": 1.4738,
      "num_input_tokens_seen": 25354322176,
      "step": 32226
    },
    {
      "epoch": 3.4189475917674517,
      "grad_norm": 0.42547639431342504,
      "learning_rate": 4.0675727872843574e-05,
      "loss": 1.4279,
      "num_input_tokens_seen": 25355109008,
      "step": 32227
    },
    {
      "epoch": 3.419053681307023,
      "grad_norm": 0.39074681555607055,
      "learning_rate": 4.067518648897993e-05,
      "loss": 1.4011,
      "num_input_tokens_seen": 25355895744,
      "step": 32228
    },
    {
      "epoch": 3.4191597708465946,
      "grad_norm": 0.3519334449920354,
      "learning_rate": 4.067464509300297e-05,
      "loss": 1.4362,
      "num_input_tokens_seen": 25356682528,
      "step": 32229
    },
    {
      "epoch": 3.419265860386166,
      "grad_norm": 0.4409735417534029,
      "learning_rate": 4.06741036849131e-05,
      "loss": 1.4504,
      "num_input_tokens_seen": 25357469216,
      "step": 32230
    },
    {
      "epoch": 3.419371949925737,
      "grad_norm": 0.42763527616991853,
      "learning_rate": 4.067356226471074e-05,
      "loss": 1.4985,
      "num_input_tokens_seen": 25358255888,
      "step": 32231
    },
    {
      "epoch": 3.4194780394653086,
      "grad_norm": 0.4209288613400396,
      "learning_rate": 4.0673020832396316e-05,
      "loss": 1.4595,
      "num_input_tokens_seen": 25359042688,
      "step": 32232
    },
    {
      "epoch": 3.41958412900488,
      "grad_norm": 0.4314667468753665,
      "learning_rate": 4.067247938797023e-05,
      "loss": 1.4675,
      "num_input_tokens_seen": 25359829424,
      "step": 32233
    },
    {
      "epoch": 3.4196902185444515,
      "grad_norm": 0.48777092697599567,
      "learning_rate": 4.0671937931432923e-05,
      "loss": 1.3531,
      "num_input_tokens_seen": 25360616240,
      "step": 32234
    },
    {
      "epoch": 3.419796308084023,
      "grad_norm": 0.40535055996874897,
      "learning_rate": 4.06713964627848e-05,
      "loss": 1.4546,
      "num_input_tokens_seen": 25361403104,
      "step": 32235
    },
    {
      "epoch": 3.4199023976235945,
      "grad_norm": 0.5529872904659353,
      "learning_rate": 4.067085498202629e-05,
      "loss": 1.3888,
      "num_input_tokens_seen": 25362189920,
      "step": 32236
    },
    {
      "epoch": 3.4200084871631655,
      "grad_norm": 0.4073843451656331,
      "learning_rate": 4.0670313489157785e-05,
      "loss": 1.4342,
      "num_input_tokens_seen": 25362976672,
      "step": 32237
    },
    {
      "epoch": 3.420114576702737,
      "grad_norm": 0.5127902338138771,
      "learning_rate": 4.0669771984179733e-05,
      "loss": 1.5379,
      "num_input_tokens_seen": 25363763344,
      "step": 32238
    },
    {
      "epoch": 3.4202206662423085,
      "grad_norm": 0.4333809710470376,
      "learning_rate": 4.066923046709253e-05,
      "loss": 1.4323,
      "num_input_tokens_seen": 25364550080,
      "step": 32239
    },
    {
      "epoch": 3.42032675578188,
      "grad_norm": 0.5154842211724796,
      "learning_rate": 4.066868893789662e-05,
      "loss": 1.3142,
      "num_input_tokens_seen": 25365336912,
      "step": 32240
    },
    {
      "epoch": 3.4204328453214514,
      "grad_norm": 0.5016005288065987,
      "learning_rate": 4.0668147396592406e-05,
      "loss": 1.5247,
      "num_input_tokens_seen": 25366123648,
      "step": 32241
    },
    {
      "epoch": 3.420538934861023,
      "grad_norm": 0.4395033752880819,
      "learning_rate": 4.06676058431803e-05,
      "loss": 1.4383,
      "num_input_tokens_seen": 25366910432,
      "step": 32242
    },
    {
      "epoch": 3.420645024400594,
      "grad_norm": 0.5547571626472138,
      "learning_rate": 4.0667064277660724e-05,
      "loss": 1.5083,
      "num_input_tokens_seen": 25367697200,
      "step": 32243
    },
    {
      "epoch": 3.4207511139401654,
      "grad_norm": 0.4780105101833968,
      "learning_rate": 4.0666522700034114e-05,
      "loss": 1.5346,
      "num_input_tokens_seen": 25368483952,
      "step": 32244
    },
    {
      "epoch": 3.420857203479737,
      "grad_norm": 0.4463266026978747,
      "learning_rate": 4.066598111030087e-05,
      "loss": 1.2774,
      "num_input_tokens_seen": 25369270768,
      "step": 32245
    },
    {
      "epoch": 3.4209632930193083,
      "grad_norm": 0.5648778112868406,
      "learning_rate": 4.066543950846141e-05,
      "loss": 1.5112,
      "num_input_tokens_seen": 25370057488,
      "step": 32246
    },
    {
      "epoch": 3.42106938255888,
      "grad_norm": 0.45573588893525874,
      "learning_rate": 4.066489789451616e-05,
      "loss": 1.5344,
      "num_input_tokens_seen": 25370844304,
      "step": 32247
    },
    {
      "epoch": 3.421175472098451,
      "grad_norm": 0.429562452138203,
      "learning_rate": 4.0664356268465544e-05,
      "loss": 1.2709,
      "num_input_tokens_seen": 25371631136,
      "step": 32248
    },
    {
      "epoch": 3.4212815616380223,
      "grad_norm": 0.48448125600579545,
      "learning_rate": 4.066381463030996e-05,
      "loss": 1.4136,
      "num_input_tokens_seen": 25372418000,
      "step": 32249
    },
    {
      "epoch": 3.421387651177594,
      "grad_norm": 0.4746166339995782,
      "learning_rate": 4.066327298004985e-05,
      "loss": 1.4204,
      "num_input_tokens_seen": 25373204736,
      "step": 32250
    },
    {
      "epoch": 3.4214937407171653,
      "grad_norm": 0.4773896765946507,
      "learning_rate": 4.066273131768562e-05,
      "loss": 1.4583,
      "num_input_tokens_seen": 25373991520,
      "step": 32251
    },
    {
      "epoch": 3.4215998302567368,
      "grad_norm": 0.4112535049588081,
      "learning_rate": 4.0662189643217686e-05,
      "loss": 1.524,
      "num_input_tokens_seen": 25374778320,
      "step": 32252
    },
    {
      "epoch": 3.4217059197963082,
      "grad_norm": 0.4237692573955666,
      "learning_rate": 4.066164795664648e-05,
      "loss": 1.5022,
      "num_input_tokens_seen": 25375565088,
      "step": 32253
    },
    {
      "epoch": 3.4218120093358797,
      "grad_norm": 0.5689634660785701,
      "learning_rate": 4.06611062579724e-05,
      "loss": 1.5089,
      "num_input_tokens_seen": 25376351808,
      "step": 32254
    },
    {
      "epoch": 3.4219180988754507,
      "grad_norm": 0.41512118645727936,
      "learning_rate": 4.066056454719589e-05,
      "loss": 1.4176,
      "num_input_tokens_seen": 25377138528,
      "step": 32255
    },
    {
      "epoch": 3.422024188415022,
      "grad_norm": 0.7293705847071664,
      "learning_rate": 4.066002282431735e-05,
      "loss": 1.5222,
      "num_input_tokens_seen": 25377925216,
      "step": 32256
    },
    {
      "epoch": 3.4221302779545937,
      "grad_norm": 0.46078606180232473,
      "learning_rate": 4.0659481089337196e-05,
      "loss": 1.4447,
      "num_input_tokens_seen": 25378712048,
      "step": 32257
    },
    {
      "epoch": 3.422236367494165,
      "grad_norm": 0.5308713635815052,
      "learning_rate": 4.0658939342255864e-05,
      "loss": 1.4158,
      "num_input_tokens_seen": 25379498832,
      "step": 32258
    },
    {
      "epoch": 3.4223424570337366,
      "grad_norm": 0.5478802651596324,
      "learning_rate": 4.065839758307376e-05,
      "loss": 1.3968,
      "num_input_tokens_seen": 25380285584,
      "step": 32259
    },
    {
      "epoch": 3.4224485465733077,
      "grad_norm": 0.584386984711067,
      "learning_rate": 4.065785581179131e-05,
      "loss": 1.4271,
      "num_input_tokens_seen": 25381072272,
      "step": 32260
    },
    {
      "epoch": 3.422554636112879,
      "grad_norm": 0.49823633525964983,
      "learning_rate": 4.065731402840892e-05,
      "loss": 1.4985,
      "num_input_tokens_seen": 25381859104,
      "step": 32261
    },
    {
      "epoch": 3.4226607256524506,
      "grad_norm": 0.5202262846802566,
      "learning_rate": 4.0656772232927024e-05,
      "loss": 1.5253,
      "num_input_tokens_seen": 25382645760,
      "step": 32262
    },
    {
      "epoch": 3.422766815192022,
      "grad_norm": 0.451722118754041,
      "learning_rate": 4.065623042534603e-05,
      "loss": 1.5089,
      "num_input_tokens_seen": 25383432592,
      "step": 32263
    },
    {
      "epoch": 3.4228729047315936,
      "grad_norm": 0.5658319641797226,
      "learning_rate": 4.065568860566637e-05,
      "loss": 1.4589,
      "num_input_tokens_seen": 25384219248,
      "step": 32264
    },
    {
      "epoch": 3.422978994271165,
      "grad_norm": 0.44618036476220874,
      "learning_rate": 4.065514677388844e-05,
      "loss": 1.3825,
      "num_input_tokens_seen": 25385006064,
      "step": 32265
    },
    {
      "epoch": 3.4230850838107365,
      "grad_norm": 0.5869689120810532,
      "learning_rate": 4.065460493001267e-05,
      "loss": 1.5314,
      "num_input_tokens_seen": 25385792912,
      "step": 32266
    },
    {
      "epoch": 3.4231911733503075,
      "grad_norm": 0.5055903884331946,
      "learning_rate": 4.0654063074039495e-05,
      "loss": 1.4607,
      "num_input_tokens_seen": 25386579728,
      "step": 32267
    },
    {
      "epoch": 3.423297262889879,
      "grad_norm": 0.4313402259723823,
      "learning_rate": 4.065352120596931e-05,
      "loss": 1.4264,
      "num_input_tokens_seen": 25387366432,
      "step": 32268
    },
    {
      "epoch": 3.4234033524294505,
      "grad_norm": 0.41648834461012235,
      "learning_rate": 4.0652979325802544e-05,
      "loss": 1.4128,
      "num_input_tokens_seen": 25388153136,
      "step": 32269
    },
    {
      "epoch": 3.423509441969022,
      "grad_norm": 0.4126947118206432,
      "learning_rate": 4.0652437433539616e-05,
      "loss": 1.5037,
      "num_input_tokens_seen": 25388939840,
      "step": 32270
    },
    {
      "epoch": 3.4236155315085934,
      "grad_norm": 0.3941453040575345,
      "learning_rate": 4.065189552918094e-05,
      "loss": 1.4962,
      "num_input_tokens_seen": 25389726544,
      "step": 32271
    },
    {
      "epoch": 3.4237216210481645,
      "grad_norm": 0.5045906996692795,
      "learning_rate": 4.065135361272695e-05,
      "loss": 1.4861,
      "num_input_tokens_seen": 25390513232,
      "step": 32272
    },
    {
      "epoch": 3.423827710587736,
      "grad_norm": 0.39382145401702945,
      "learning_rate": 4.065081168417804e-05,
      "loss": 1.3436,
      "num_input_tokens_seen": 25391300112,
      "step": 32273
    },
    {
      "epoch": 3.4239338001273074,
      "grad_norm": 0.4686378623858496,
      "learning_rate": 4.065026974353465e-05,
      "loss": 1.5087,
      "num_input_tokens_seen": 25392086896,
      "step": 32274
    },
    {
      "epoch": 3.424039889666879,
      "grad_norm": 0.5995367826564302,
      "learning_rate": 4.064972779079719e-05,
      "loss": 1.6377,
      "num_input_tokens_seen": 25392873616,
      "step": 32275
    },
    {
      "epoch": 3.4241459792064504,
      "grad_norm": 0.3811425021563706,
      "learning_rate": 4.0649185825966075e-05,
      "loss": 1.4124,
      "num_input_tokens_seen": 25393660400,
      "step": 32276
    },
    {
      "epoch": 3.4242520687460214,
      "grad_norm": 0.516715759800204,
      "learning_rate": 4.064864384904174e-05,
      "loss": 1.4729,
      "num_input_tokens_seen": 25394447248,
      "step": 32277
    },
    {
      "epoch": 3.424358158285593,
      "grad_norm": 0.44732520885905813,
      "learning_rate": 4.064810186002458e-05,
      "loss": 1.4185,
      "num_input_tokens_seen": 25395234048,
      "step": 32278
    },
    {
      "epoch": 3.4244642478251643,
      "grad_norm": 0.41263994607412663,
      "learning_rate": 4.064755985891502e-05,
      "loss": 1.5038,
      "num_input_tokens_seen": 25396020784,
      "step": 32279
    },
    {
      "epoch": 3.424570337364736,
      "grad_norm": 0.5174444680808968,
      "learning_rate": 4.06470178457135e-05,
      "loss": 1.4528,
      "num_input_tokens_seen": 25396807536,
      "step": 32280
    },
    {
      "epoch": 3.4246764269043073,
      "grad_norm": 0.4378683632730766,
      "learning_rate": 4.0646475820420415e-05,
      "loss": 1.5539,
      "num_input_tokens_seen": 25397594336,
      "step": 32281
    },
    {
      "epoch": 3.4247825164438788,
      "grad_norm": 0.45213046556305364,
      "learning_rate": 4.064593378303619e-05,
      "loss": 1.3619,
      "num_input_tokens_seen": 25398381120,
      "step": 32282
    },
    {
      "epoch": 3.4248886059834502,
      "grad_norm": 0.4812535647424849,
      "learning_rate": 4.0645391733561253e-05,
      "loss": 1.5162,
      "num_input_tokens_seen": 25399167776,
      "step": 32283
    },
    {
      "epoch": 3.4249946955230213,
      "grad_norm": 0.4657438973188403,
      "learning_rate": 4.0644849671996016e-05,
      "loss": 1.5524,
      "num_input_tokens_seen": 25399954560,
      "step": 32284
    },
    {
      "epoch": 3.4251007850625927,
      "grad_norm": 0.4987857122910328,
      "learning_rate": 4.0644307598340895e-05,
      "loss": 1.4466,
      "num_input_tokens_seen": 25400741296,
      "step": 32285
    },
    {
      "epoch": 3.425206874602164,
      "grad_norm": 0.4487757678931662,
      "learning_rate": 4.0643765512596316e-05,
      "loss": 1.4204,
      "num_input_tokens_seen": 25401528080,
      "step": 32286
    },
    {
      "epoch": 3.4253129641417357,
      "grad_norm": 0.4420235438691191,
      "learning_rate": 4.06432234147627e-05,
      "loss": 1.4495,
      "num_input_tokens_seen": 25402314896,
      "step": 32287
    },
    {
      "epoch": 3.425419053681307,
      "grad_norm": 0.5111003289226597,
      "learning_rate": 4.064268130484045e-05,
      "loss": 1.4823,
      "num_input_tokens_seen": 25403101760,
      "step": 32288
    },
    {
      "epoch": 3.425525143220878,
      "grad_norm": 0.45628535452325786,
      "learning_rate": 4.064213918283e-05,
      "loss": 1.4192,
      "num_input_tokens_seen": 25403888496,
      "step": 32289
    },
    {
      "epoch": 3.4256312327604497,
      "grad_norm": 0.45517203574511034,
      "learning_rate": 4.064159704873175e-05,
      "loss": 1.494,
      "num_input_tokens_seen": 25404675216,
      "step": 32290
    },
    {
      "epoch": 3.425737322300021,
      "grad_norm": 0.4853004537374461,
      "learning_rate": 4.064105490254615e-05,
      "loss": 1.4264,
      "num_input_tokens_seen": 25405461984,
      "step": 32291
    },
    {
      "epoch": 3.4258434118395926,
      "grad_norm": 0.40004950027310077,
      "learning_rate": 4.06405127442736e-05,
      "loss": 1.3458,
      "num_input_tokens_seen": 25406248800,
      "step": 32292
    },
    {
      "epoch": 3.425949501379164,
      "grad_norm": 0.4866095372792427,
      "learning_rate": 4.063997057391451e-05,
      "loss": 1.4237,
      "num_input_tokens_seen": 25407035536,
      "step": 32293
    },
    {
      "epoch": 3.4260555909187356,
      "grad_norm": 0.43885824759589576,
      "learning_rate": 4.063942839146931e-05,
      "loss": 1.4963,
      "num_input_tokens_seen": 25407822256,
      "step": 32294
    },
    {
      "epoch": 3.426161680458307,
      "grad_norm": 0.48047292505815786,
      "learning_rate": 4.063888619693843e-05,
      "loss": 1.463,
      "num_input_tokens_seen": 25408608992,
      "step": 32295
    },
    {
      "epoch": 3.426267769997878,
      "grad_norm": 0.48486570787523464,
      "learning_rate": 4.063834399032227e-05,
      "loss": 1.4987,
      "num_input_tokens_seen": 25409395808,
      "step": 32296
    },
    {
      "epoch": 3.4263738595374496,
      "grad_norm": 0.519566975021211,
      "learning_rate": 4.063780177162127e-05,
      "loss": 1.5487,
      "num_input_tokens_seen": 25410182560,
      "step": 32297
    },
    {
      "epoch": 3.426479949077021,
      "grad_norm": 0.4708063556465245,
      "learning_rate": 4.0637259540835815e-05,
      "loss": 1.4822,
      "num_input_tokens_seen": 25410969248,
      "step": 32298
    },
    {
      "epoch": 3.4265860386165925,
      "grad_norm": 0.426914240569338,
      "learning_rate": 4.063671729796635e-05,
      "loss": 1.4937,
      "num_input_tokens_seen": 25411756048,
      "step": 32299
    },
    {
      "epoch": 3.426692128156164,
      "grad_norm": 0.3989199123576826,
      "learning_rate": 4.0636175043013296e-05,
      "loss": 1.387,
      "num_input_tokens_seen": 25412542816,
      "step": 32300
    },
    {
      "epoch": 3.426798217695735,
      "grad_norm": 0.4392322446750507,
      "learning_rate": 4.063563277597706e-05,
      "loss": 1.5608,
      "num_input_tokens_seen": 25413329696,
      "step": 32301
    },
    {
      "epoch": 3.4269043072353065,
      "grad_norm": 0.4790961538722707,
      "learning_rate": 4.0635090496858074e-05,
      "loss": 1.451,
      "num_input_tokens_seen": 25414116576,
      "step": 32302
    },
    {
      "epoch": 3.427010396774878,
      "grad_norm": 0.4198805468584909,
      "learning_rate": 4.063454820565674e-05,
      "loss": 1.4405,
      "num_input_tokens_seen": 25414903312,
      "step": 32303
    },
    {
      "epoch": 3.4271164863144494,
      "grad_norm": 0.42454604065905455,
      "learning_rate": 4.0634005902373484e-05,
      "loss": 1.5118,
      "num_input_tokens_seen": 25415690064,
      "step": 32304
    },
    {
      "epoch": 3.427222575854021,
      "grad_norm": 0.4612960886329331,
      "learning_rate": 4.0633463587008735e-05,
      "loss": 1.517,
      "num_input_tokens_seen": 25416476800,
      "step": 32305
    },
    {
      "epoch": 3.4273286653935924,
      "grad_norm": 0.4329649768092385,
      "learning_rate": 4.063292125956289e-05,
      "loss": 1.3758,
      "num_input_tokens_seen": 25417263648,
      "step": 32306
    },
    {
      "epoch": 3.4274347549331634,
      "grad_norm": 0.4423324060497509,
      "learning_rate": 4.06323789200364e-05,
      "loss": 1.4427,
      "num_input_tokens_seen": 25418050432,
      "step": 32307
    },
    {
      "epoch": 3.427540844472735,
      "grad_norm": 0.394156653077229,
      "learning_rate": 4.063183656842966e-05,
      "loss": 1.3554,
      "num_input_tokens_seen": 25418837120,
      "step": 32308
    },
    {
      "epoch": 3.4276469340123064,
      "grad_norm": 0.43759401821405386,
      "learning_rate": 4.063129420474309e-05,
      "loss": 1.5306,
      "num_input_tokens_seen": 25419623904,
      "step": 32309
    },
    {
      "epoch": 3.427753023551878,
      "grad_norm": 0.4611721260975542,
      "learning_rate": 4.063075182897712e-05,
      "loss": 1.549,
      "num_input_tokens_seen": 25420410656,
      "step": 32310
    },
    {
      "epoch": 3.4278591130914493,
      "grad_norm": 0.43069428116365566,
      "learning_rate": 4.0630209441132164e-05,
      "loss": 1.3814,
      "num_input_tokens_seen": 25421197456,
      "step": 32311
    },
    {
      "epoch": 3.427965202631021,
      "grad_norm": 0.4946047080239237,
      "learning_rate": 4.062966704120864e-05,
      "loss": 1.5035,
      "num_input_tokens_seen": 25421984256,
      "step": 32312
    },
    {
      "epoch": 3.428071292170592,
      "grad_norm": 0.4014066046386136,
      "learning_rate": 4.062912462920696e-05,
      "loss": 1.3675,
      "num_input_tokens_seen": 25422771040,
      "step": 32313
    },
    {
      "epoch": 3.4281773817101633,
      "grad_norm": 0.4504418319402376,
      "learning_rate": 4.0628582205127565e-05,
      "loss": 1.3647,
      "num_input_tokens_seen": 25423557872,
      "step": 32314
    },
    {
      "epoch": 3.4282834712497348,
      "grad_norm": 0.40910971216098513,
      "learning_rate": 4.062803976897085e-05,
      "loss": 1.4403,
      "num_input_tokens_seen": 25424344640,
      "step": 32315
    },
    {
      "epoch": 3.4283895607893062,
      "grad_norm": 0.5258520779462952,
      "learning_rate": 4.062749732073725e-05,
      "loss": 1.5668,
      "num_input_tokens_seen": 25425131280,
      "step": 32316
    },
    {
      "epoch": 3.4284956503288777,
      "grad_norm": 0.4068902136140117,
      "learning_rate": 4.062695486042717e-05,
      "loss": 1.4409,
      "num_input_tokens_seen": 25425918096,
      "step": 32317
    },
    {
      "epoch": 3.4286017398684487,
      "grad_norm": 0.41881027063222864,
      "learning_rate": 4.062641238804105e-05,
      "loss": 1.4307,
      "num_input_tokens_seen": 25426704816,
      "step": 32318
    },
    {
      "epoch": 3.42870782940802,
      "grad_norm": 0.4756080853952967,
      "learning_rate": 4.062586990357928e-05,
      "loss": 1.5408,
      "num_input_tokens_seen": 25427491600,
      "step": 32319
    },
    {
      "epoch": 3.4288139189475917,
      "grad_norm": 0.37368611746709257,
      "learning_rate": 4.062532740704231e-05,
      "loss": 1.4445,
      "num_input_tokens_seen": 25428278480,
      "step": 32320
    },
    {
      "epoch": 3.428920008487163,
      "grad_norm": 0.41776200984364387,
      "learning_rate": 4.062478489843055e-05,
      "loss": 1.4297,
      "num_input_tokens_seen": 25429065200,
      "step": 32321
    },
    {
      "epoch": 3.4290260980267346,
      "grad_norm": 0.43515412605464304,
      "learning_rate": 4.0624242377744404e-05,
      "loss": 1.4666,
      "num_input_tokens_seen": 25429851920,
      "step": 32322
    },
    {
      "epoch": 3.429132187566306,
      "grad_norm": 0.41811566129542765,
      "learning_rate": 4.0623699844984306e-05,
      "loss": 1.4401,
      "num_input_tokens_seen": 25430638752,
      "step": 32323
    },
    {
      "epoch": 3.4292382771058776,
      "grad_norm": 0.5373141348102376,
      "learning_rate": 4.062315730015067e-05,
      "loss": 1.634,
      "num_input_tokens_seen": 25431425472,
      "step": 32324
    },
    {
      "epoch": 3.4293443666454486,
      "grad_norm": 0.3789672965116359,
      "learning_rate": 4.062261474324391e-05,
      "loss": 1.2929,
      "num_input_tokens_seen": 25432212208,
      "step": 32325
    },
    {
      "epoch": 3.42945045618502,
      "grad_norm": 0.5158474419561748,
      "learning_rate": 4.062207217426446e-05,
      "loss": 1.4241,
      "num_input_tokens_seen": 25432998912,
      "step": 32326
    },
    {
      "epoch": 3.4295565457245916,
      "grad_norm": 0.41869615421084083,
      "learning_rate": 4.062152959321273e-05,
      "loss": 1.5152,
      "num_input_tokens_seen": 25433785744,
      "step": 32327
    },
    {
      "epoch": 3.429662635264163,
      "grad_norm": 0.53777435756182,
      "learning_rate": 4.062098700008914e-05,
      "loss": 1.4744,
      "num_input_tokens_seen": 25434572512,
      "step": 32328
    },
    {
      "epoch": 3.4297687248037345,
      "grad_norm": 0.3962045250266749,
      "learning_rate": 4.062044439489411e-05,
      "loss": 1.3863,
      "num_input_tokens_seen": 25435359216,
      "step": 32329
    },
    {
      "epoch": 3.4298748143433055,
      "grad_norm": 0.4904526147008256,
      "learning_rate": 4.0619901777628053e-05,
      "loss": 1.4924,
      "num_input_tokens_seen": 25436145984,
      "step": 32330
    },
    {
      "epoch": 3.429980903882877,
      "grad_norm": 0.48618495093017505,
      "learning_rate": 4.06193591482914e-05,
      "loss": 1.4595,
      "num_input_tokens_seen": 25436932736,
      "step": 32331
    },
    {
      "epoch": 3.4300869934224485,
      "grad_norm": 0.4428102974100881,
      "learning_rate": 4.061881650688457e-05,
      "loss": 1.3664,
      "num_input_tokens_seen": 25437719584,
      "step": 32332
    },
    {
      "epoch": 3.43019308296202,
      "grad_norm": 0.39185604647345534,
      "learning_rate": 4.0618273853407964e-05,
      "loss": 1.3835,
      "num_input_tokens_seen": 25438506288,
      "step": 32333
    },
    {
      "epoch": 3.4302991725015914,
      "grad_norm": 0.5130195462993361,
      "learning_rate": 4.061773118786203e-05,
      "loss": 1.4636,
      "num_input_tokens_seen": 25439293120,
      "step": 32334
    },
    {
      "epoch": 3.430405262041163,
      "grad_norm": 0.4302612631175492,
      "learning_rate": 4.0617188510247154e-05,
      "loss": 1.5139,
      "num_input_tokens_seen": 25440079920,
      "step": 32335
    },
    {
      "epoch": 3.430511351580734,
      "grad_norm": 0.5813112920139641,
      "learning_rate": 4.061664582056378e-05,
      "loss": 1.5855,
      "num_input_tokens_seen": 25440866560,
      "step": 32336
    },
    {
      "epoch": 3.4306174411203054,
      "grad_norm": 0.3945476606789001,
      "learning_rate": 4.061610311881233e-05,
      "loss": 1.411,
      "num_input_tokens_seen": 25441653376,
      "step": 32337
    },
    {
      "epoch": 3.430723530659877,
      "grad_norm": 0.603774790916062,
      "learning_rate": 4.06155604049932e-05,
      "loss": 1.5124,
      "num_input_tokens_seen": 25442440192,
      "step": 32338
    },
    {
      "epoch": 3.4308296201994484,
      "grad_norm": 0.443221300070436,
      "learning_rate": 4.061501767910683e-05,
      "loss": 1.3668,
      "num_input_tokens_seen": 25443227040,
      "step": 32339
    },
    {
      "epoch": 3.43093570973902,
      "grad_norm": 0.5000764108503429,
      "learning_rate": 4.061447494115363e-05,
      "loss": 1.4839,
      "num_input_tokens_seen": 25444013792,
      "step": 32340
    },
    {
      "epoch": 3.4310417992785913,
      "grad_norm": 0.47875626750724326,
      "learning_rate": 4.061393219113403e-05,
      "loss": 1.4349,
      "num_input_tokens_seen": 25444800624,
      "step": 32341
    },
    {
      "epoch": 3.4311478888181624,
      "grad_norm": 0.5035975907375894,
      "learning_rate": 4.061338942904843e-05,
      "loss": 1.4616,
      "num_input_tokens_seen": 25445587408,
      "step": 32342
    },
    {
      "epoch": 3.431253978357734,
      "grad_norm": 0.5238860973733773,
      "learning_rate": 4.061284665489726e-05,
      "loss": 1.4015,
      "num_input_tokens_seen": 25446374080,
      "step": 32343
    },
    {
      "epoch": 3.4313600678973053,
      "grad_norm": 0.40513769140323735,
      "learning_rate": 4.0612303868680953e-05,
      "loss": 1.371,
      "num_input_tokens_seen": 25447160896,
      "step": 32344
    },
    {
      "epoch": 3.4314661574368768,
      "grad_norm": 0.630232275566777,
      "learning_rate": 4.0611761070399906e-05,
      "loss": 1.3709,
      "num_input_tokens_seen": 25447947776,
      "step": 32345
    },
    {
      "epoch": 3.4315722469764482,
      "grad_norm": 0.48662941909671,
      "learning_rate": 4.061121826005455e-05,
      "loss": 1.4188,
      "num_input_tokens_seen": 25448734560,
      "step": 32346
    },
    {
      "epoch": 3.4316783365160193,
      "grad_norm": 0.5897107347382908,
      "learning_rate": 4.061067543764531e-05,
      "loss": 1.5989,
      "num_input_tokens_seen": 25449521376,
      "step": 32347
    },
    {
      "epoch": 3.4317844260555908,
      "grad_norm": 0.5183306598314968,
      "learning_rate": 4.061013260317258e-05,
      "loss": 1.4773,
      "num_input_tokens_seen": 25450308112,
      "step": 32348
    },
    {
      "epoch": 3.4318905155951622,
      "grad_norm": 0.4680374788550846,
      "learning_rate": 4.0609589756636813e-05,
      "loss": 1.5056,
      "num_input_tokens_seen": 25451094816,
      "step": 32349
    },
    {
      "epoch": 3.4319966051347337,
      "grad_norm": 0.4720191424838152,
      "learning_rate": 4.060904689803841e-05,
      "loss": 1.4804,
      "num_input_tokens_seen": 25451881584,
      "step": 32350
    },
    {
      "epoch": 3.432102694674305,
      "grad_norm": 0.4221752976588713,
      "learning_rate": 4.060850402737779e-05,
      "loss": 1.4088,
      "num_input_tokens_seen": 25452668336,
      "step": 32351
    },
    {
      "epoch": 3.4322087842138767,
      "grad_norm": 0.5072783643248711,
      "learning_rate": 4.060796114465538e-05,
      "loss": 1.6414,
      "num_input_tokens_seen": 25453454976,
      "step": 32352
    },
    {
      "epoch": 3.432314873753448,
      "grad_norm": 0.46291195550520625,
      "learning_rate": 4.060741824987159e-05,
      "loss": 1.4252,
      "num_input_tokens_seen": 25454241840,
      "step": 32353
    },
    {
      "epoch": 3.432420963293019,
      "grad_norm": 0.43564049881972083,
      "learning_rate": 4.0606875343026853e-05,
      "loss": 1.3355,
      "num_input_tokens_seen": 25455028608,
      "step": 32354
    },
    {
      "epoch": 3.4325270528325906,
      "grad_norm": 0.45829783917764744,
      "learning_rate": 4.060633242412157e-05,
      "loss": 1.4633,
      "num_input_tokens_seen": 25455815424,
      "step": 32355
    },
    {
      "epoch": 3.432633142372162,
      "grad_norm": 0.5096757356707446,
      "learning_rate": 4.060578949315618e-05,
      "loss": 1.508,
      "num_input_tokens_seen": 25456602144,
      "step": 32356
    },
    {
      "epoch": 3.4327392319117336,
      "grad_norm": 0.42499052266579124,
      "learning_rate": 4.0605246550131095e-05,
      "loss": 1.4193,
      "num_input_tokens_seen": 25457389008,
      "step": 32357
    },
    {
      "epoch": 3.432845321451305,
      "grad_norm": 0.44989944059897796,
      "learning_rate": 4.0604703595046726e-05,
      "loss": 1.3502,
      "num_input_tokens_seen": 25458175888,
      "step": 32358
    },
    {
      "epoch": 3.432951410990876,
      "grad_norm": 0.4169047709926919,
      "learning_rate": 4.060416062790351e-05,
      "loss": 1.5058,
      "num_input_tokens_seen": 25458962592,
      "step": 32359
    },
    {
      "epoch": 3.4330575005304476,
      "grad_norm": 0.5526731820284054,
      "learning_rate": 4.060361764870185e-05,
      "loss": 1.4881,
      "num_input_tokens_seen": 25459749280,
      "step": 32360
    },
    {
      "epoch": 3.433163590070019,
      "grad_norm": 0.43436804737339035,
      "learning_rate": 4.060307465744217e-05,
      "loss": 1.4684,
      "num_input_tokens_seen": 25460536128,
      "step": 32361
    },
    {
      "epoch": 3.4332696796095905,
      "grad_norm": 0.5235276838221424,
      "learning_rate": 4.0602531654124894e-05,
      "loss": 1.5037,
      "num_input_tokens_seen": 25461322880,
      "step": 32362
    },
    {
      "epoch": 3.433375769149162,
      "grad_norm": 0.5117045291449838,
      "learning_rate": 4.0601988638750435e-05,
      "loss": 1.4358,
      "num_input_tokens_seen": 25462109680,
      "step": 32363
    },
    {
      "epoch": 3.4334818586887335,
      "grad_norm": 0.4444602096881856,
      "learning_rate": 4.0601445611319227e-05,
      "loss": 1.4884,
      "num_input_tokens_seen": 25462896352,
      "step": 32364
    },
    {
      "epoch": 3.433587948228305,
      "grad_norm": 0.43390716296717724,
      "learning_rate": 4.060090257183167e-05,
      "loss": 1.4299,
      "num_input_tokens_seen": 25463683040,
      "step": 32365
    },
    {
      "epoch": 3.433694037767876,
      "grad_norm": 0.5055533225938166,
      "learning_rate": 4.06003595202882e-05,
      "loss": 1.6232,
      "num_input_tokens_seen": 25464469728,
      "step": 32366
    },
    {
      "epoch": 3.4338001273074474,
      "grad_norm": 0.43793501783392785,
      "learning_rate": 4.0599816456689226e-05,
      "loss": 1.5304,
      "num_input_tokens_seen": 25465256608,
      "step": 32367
    },
    {
      "epoch": 3.433906216847019,
      "grad_norm": 0.6029371852691088,
      "learning_rate": 4.059927338103517e-05,
      "loss": 1.494,
      "num_input_tokens_seen": 25466043312,
      "step": 32368
    },
    {
      "epoch": 3.4340123063865904,
      "grad_norm": 0.42404926048520747,
      "learning_rate": 4.0598730293326456e-05,
      "loss": 1.5008,
      "num_input_tokens_seen": 25466830032,
      "step": 32369
    },
    {
      "epoch": 3.434118395926162,
      "grad_norm": 0.8405490325521995,
      "learning_rate": 4.0598187193563506e-05,
      "loss": 1.5797,
      "num_input_tokens_seen": 25467616768,
      "step": 32370
    },
    {
      "epoch": 3.434224485465733,
      "grad_norm": 0.52383771965137,
      "learning_rate": 4.0597644081746736e-05,
      "loss": 1.3997,
      "num_input_tokens_seen": 25468403536,
      "step": 32371
    },
    {
      "epoch": 3.4343305750053044,
      "grad_norm": 0.7121210207710692,
      "learning_rate": 4.059710095787656e-05,
      "loss": 1.4067,
      "num_input_tokens_seen": 25469190240,
      "step": 32372
    },
    {
      "epoch": 3.434436664544876,
      "grad_norm": 0.45468347561809636,
      "learning_rate": 4.059655782195339e-05,
      "loss": 1.4689,
      "num_input_tokens_seen": 25469977040,
      "step": 32373
    },
    {
      "epoch": 3.4345427540844473,
      "grad_norm": 0.6325756719161023,
      "learning_rate": 4.0596014673977666e-05,
      "loss": 1.4373,
      "num_input_tokens_seen": 25470763856,
      "step": 32374
    },
    {
      "epoch": 3.434648843624019,
      "grad_norm": 0.5845023606561219,
      "learning_rate": 4.05954715139498e-05,
      "loss": 1.4713,
      "num_input_tokens_seen": 25471550576,
      "step": 32375
    },
    {
      "epoch": 3.4347549331635903,
      "grad_norm": 0.6643774432042614,
      "learning_rate": 4.0594928341870205e-05,
      "loss": 1.4942,
      "num_input_tokens_seen": 25472337280,
      "step": 32376
    },
    {
      "epoch": 3.4348610227031613,
      "grad_norm": 0.46083923125748216,
      "learning_rate": 4.0594385157739325e-05,
      "loss": 1.3747,
      "num_input_tokens_seen": 25473124064,
      "step": 32377
    },
    {
      "epoch": 3.4349671122427328,
      "grad_norm": 0.5466361948031931,
      "learning_rate": 4.0593841961557544e-05,
      "loss": 1.4752,
      "num_input_tokens_seen": 25473910768,
      "step": 32378
    },
    {
      "epoch": 3.4350732017823042,
      "grad_norm": 0.438779304219638,
      "learning_rate": 4.059329875332531e-05,
      "loss": 1.4678,
      "num_input_tokens_seen": 25474697584,
      "step": 32379
    },
    {
      "epoch": 3.4351792913218757,
      "grad_norm": 0.5128174616137425,
      "learning_rate": 4.059275553304303e-05,
      "loss": 1.5222,
      "num_input_tokens_seen": 25475484288,
      "step": 32380
    },
    {
      "epoch": 3.435285380861447,
      "grad_norm": 0.4359573479470624,
      "learning_rate": 4.059221230071112e-05,
      "loss": 1.3881,
      "num_input_tokens_seen": 25476271168,
      "step": 32381
    },
    {
      "epoch": 3.4353914704010187,
      "grad_norm": 0.5189536773508386,
      "learning_rate": 4.059166905633002e-05,
      "loss": 1.5417,
      "num_input_tokens_seen": 25477057936,
      "step": 32382
    },
    {
      "epoch": 3.4354975599405897,
      "grad_norm": 0.43074708003689177,
      "learning_rate": 4.059112579990012e-05,
      "loss": 1.5569,
      "num_input_tokens_seen": 25477844720,
      "step": 32383
    },
    {
      "epoch": 3.435603649480161,
      "grad_norm": 0.5701850530458819,
      "learning_rate": 4.059058253142186e-05,
      "loss": 1.408,
      "num_input_tokens_seen": 25478631504,
      "step": 32384
    },
    {
      "epoch": 3.4357097390197326,
      "grad_norm": 0.39327523531686853,
      "learning_rate": 4.059003925089566e-05,
      "loss": 1.323,
      "num_input_tokens_seen": 25479418256,
      "step": 32385
    },
    {
      "epoch": 3.435815828559304,
      "grad_norm": 0.4660131523473805,
      "learning_rate": 4.058949595832193e-05,
      "loss": 1.501,
      "num_input_tokens_seen": 25480204944,
      "step": 32386
    },
    {
      "epoch": 3.4359219180988756,
      "grad_norm": 0.47063086533417864,
      "learning_rate": 4.05889526537011e-05,
      "loss": 1.4466,
      "num_input_tokens_seen": 25480991808,
      "step": 32387
    },
    {
      "epoch": 3.4360280076384466,
      "grad_norm": 0.4134684344150723,
      "learning_rate": 4.058840933703359e-05,
      "loss": 1.501,
      "num_input_tokens_seen": 25481778608,
      "step": 32388
    },
    {
      "epoch": 3.436134097178018,
      "grad_norm": 0.5636972265566743,
      "learning_rate": 4.05878660083198e-05,
      "loss": 1.4271,
      "num_input_tokens_seen": 25482565456,
      "step": 32389
    },
    {
      "epoch": 3.4362401867175896,
      "grad_norm": 0.40352722735065805,
      "learning_rate": 4.058732266756017e-05,
      "loss": 1.4745,
      "num_input_tokens_seen": 25483352160,
      "step": 32390
    },
    {
      "epoch": 3.436346276257161,
      "grad_norm": 0.3958253612838768,
      "learning_rate": 4.058677931475511e-05,
      "loss": 1.3065,
      "num_input_tokens_seen": 25484138912,
      "step": 32391
    },
    {
      "epoch": 3.4364523657967325,
      "grad_norm": 0.5057717662877038,
      "learning_rate": 4.0586235949905055e-05,
      "loss": 1.4462,
      "num_input_tokens_seen": 25484925712,
      "step": 32392
    },
    {
      "epoch": 3.436558455336304,
      "grad_norm": 0.41964155687579363,
      "learning_rate": 4.05856925730104e-05,
      "loss": 1.4583,
      "num_input_tokens_seen": 25485712320,
      "step": 32393
    },
    {
      "epoch": 3.4366645448758755,
      "grad_norm": 0.5189247277061254,
      "learning_rate": 4.0585149184071596e-05,
      "loss": 1.3956,
      "num_input_tokens_seen": 25486499152,
      "step": 32394
    },
    {
      "epoch": 3.4367706344154465,
      "grad_norm": 0.4870463813639586,
      "learning_rate": 4.058460578308904e-05,
      "loss": 1.5823,
      "num_input_tokens_seen": 25487285824,
      "step": 32395
    },
    {
      "epoch": 3.436876723955018,
      "grad_norm": 0.5311679915049231,
      "learning_rate": 4.058406237006315e-05,
      "loss": 1.426,
      "num_input_tokens_seen": 25488072576,
      "step": 32396
    },
    {
      "epoch": 3.4369828134945895,
      "grad_norm": 0.5355333199665872,
      "learning_rate": 4.0583518944994365e-05,
      "loss": 1.4786,
      "num_input_tokens_seen": 25488859280,
      "step": 32397
    },
    {
      "epoch": 3.437088903034161,
      "grad_norm": 0.5371920710359098,
      "learning_rate": 4.058297550788309e-05,
      "loss": 1.4732,
      "num_input_tokens_seen": 25489646016,
      "step": 32398
    },
    {
      "epoch": 3.4371949925737324,
      "grad_norm": 0.4601128176684528,
      "learning_rate": 4.058243205872975e-05,
      "loss": 1.3704,
      "num_input_tokens_seen": 25490432816,
      "step": 32399
    },
    {
      "epoch": 3.4373010821133034,
      "grad_norm": 0.49525538315162276,
      "learning_rate": 4.058188859753476e-05,
      "loss": 1.4833,
      "num_input_tokens_seen": 25491219552,
      "step": 32400
    },
    {
      "epoch": 3.437407171652875,
      "grad_norm": 0.4522046184637763,
      "learning_rate": 4.058134512429854e-05,
      "loss": 1.3956,
      "num_input_tokens_seen": 25492006336,
      "step": 32401
    },
    {
      "epoch": 3.4375132611924464,
      "grad_norm": 0.47589266390318585,
      "learning_rate": 4.0580801639021516e-05,
      "loss": 1.4947,
      "num_input_tokens_seen": 25492793040,
      "step": 32402
    },
    {
      "epoch": 3.437619350732018,
      "grad_norm": 0.3928442938322317,
      "learning_rate": 4.0580258141704106e-05,
      "loss": 1.4581,
      "num_input_tokens_seen": 25493579824,
      "step": 32403
    },
    {
      "epoch": 3.4377254402715893,
      "grad_norm": 0.4928830673045153,
      "learning_rate": 4.057971463234674e-05,
      "loss": 1.53,
      "num_input_tokens_seen": 25494366592,
      "step": 32404
    },
    {
      "epoch": 3.437831529811161,
      "grad_norm": 0.4069840610438935,
      "learning_rate": 4.0579171110949824e-05,
      "loss": 1.4422,
      "num_input_tokens_seen": 25495153440,
      "step": 32405
    },
    {
      "epoch": 3.437937619350732,
      "grad_norm": 0.4941094493877643,
      "learning_rate": 4.057862757751377e-05,
      "loss": 1.4019,
      "num_input_tokens_seen": 25495940272,
      "step": 32406
    },
    {
      "epoch": 3.4380437088903033,
      "grad_norm": 0.4841701823682863,
      "learning_rate": 4.057808403203902e-05,
      "loss": 1.5631,
      "num_input_tokens_seen": 25496726912,
      "step": 32407
    },
    {
      "epoch": 3.438149798429875,
      "grad_norm": 0.6121728450120484,
      "learning_rate": 4.0577540474525975e-05,
      "loss": 1.5146,
      "num_input_tokens_seen": 25497513584,
      "step": 32408
    },
    {
      "epoch": 3.4382558879694463,
      "grad_norm": 0.476136283050862,
      "learning_rate": 4.057699690497507e-05,
      "loss": 1.4099,
      "num_input_tokens_seen": 25498300352,
      "step": 32409
    },
    {
      "epoch": 3.4383619775090177,
      "grad_norm": 0.47625565958833194,
      "learning_rate": 4.057645332338672e-05,
      "loss": 1.5228,
      "num_input_tokens_seen": 25499087168,
      "step": 32410
    },
    {
      "epoch": 3.438468067048589,
      "grad_norm": 0.554245399142227,
      "learning_rate": 4.057590972976134e-05,
      "loss": 1.4205,
      "num_input_tokens_seen": 25499873872,
      "step": 32411
    },
    {
      "epoch": 3.4385741565881602,
      "grad_norm": 0.5021654432217001,
      "learning_rate": 4.057536612409936e-05,
      "loss": 1.4987,
      "num_input_tokens_seen": 25500660688,
      "step": 32412
    },
    {
      "epoch": 3.4386802461277317,
      "grad_norm": 0.438876129181372,
      "learning_rate": 4.057482250640119e-05,
      "loss": 1.3764,
      "num_input_tokens_seen": 25501447424,
      "step": 32413
    },
    {
      "epoch": 3.438786335667303,
      "grad_norm": 0.43042764857655347,
      "learning_rate": 4.057427887666726e-05,
      "loss": 1.4571,
      "num_input_tokens_seen": 25502234224,
      "step": 32414
    },
    {
      "epoch": 3.4388924252068747,
      "grad_norm": 0.46198602990817567,
      "learning_rate": 4.057373523489797e-05,
      "loss": 1.6175,
      "num_input_tokens_seen": 25503020960,
      "step": 32415
    },
    {
      "epoch": 3.438998514746446,
      "grad_norm": 0.4385456307065443,
      "learning_rate": 4.057319158109376e-05,
      "loss": 1.5156,
      "num_input_tokens_seen": 25503807760,
      "step": 32416
    },
    {
      "epoch": 3.439104604286017,
      "grad_norm": 0.41003741935575855,
      "learning_rate": 4.0572647915255055e-05,
      "loss": 1.4764,
      "num_input_tokens_seen": 25504594560,
      "step": 32417
    },
    {
      "epoch": 3.4392106938255886,
      "grad_norm": 0.4575899018062675,
      "learning_rate": 4.057210423738226e-05,
      "loss": 1.3228,
      "num_input_tokens_seen": 25505381392,
      "step": 32418
    },
    {
      "epoch": 3.43931678336516,
      "grad_norm": 0.43970496141681004,
      "learning_rate": 4.057156054747579e-05,
      "loss": 1.5776,
      "num_input_tokens_seen": 25506168176,
      "step": 32419
    },
    {
      "epoch": 3.4394228729047316,
      "grad_norm": 0.47770212302847903,
      "learning_rate": 4.057101684553608e-05,
      "loss": 1.5084,
      "num_input_tokens_seen": 25506954912,
      "step": 32420
    },
    {
      "epoch": 3.439528962444303,
      "grad_norm": 0.45721929216963264,
      "learning_rate": 4.057047313156355e-05,
      "loss": 1.4441,
      "num_input_tokens_seen": 25507741648,
      "step": 32421
    },
    {
      "epoch": 3.4396350519838745,
      "grad_norm": 0.433309493855598,
      "learning_rate": 4.05699294055586e-05,
      "loss": 1.4969,
      "num_input_tokens_seen": 25508528336,
      "step": 32422
    },
    {
      "epoch": 3.439741141523446,
      "grad_norm": 0.6316117913092038,
      "learning_rate": 4.0569385667521686e-05,
      "loss": 1.5341,
      "num_input_tokens_seen": 25509315040,
      "step": 32423
    },
    {
      "epoch": 3.439847231063017,
      "grad_norm": 0.45059406866507373,
      "learning_rate": 4.0568841917453195e-05,
      "loss": 1.5274,
      "num_input_tokens_seen": 25510101840,
      "step": 32424
    },
    {
      "epoch": 3.4399533206025885,
      "grad_norm": 0.5376646625504056,
      "learning_rate": 4.056829815535357e-05,
      "loss": 1.4791,
      "num_input_tokens_seen": 25510888592,
      "step": 32425
    },
    {
      "epoch": 3.44005941014216,
      "grad_norm": 0.43341541814018536,
      "learning_rate": 4.056775438122321e-05,
      "loss": 1.5493,
      "num_input_tokens_seen": 25511675328,
      "step": 32426
    },
    {
      "epoch": 3.4401654996817315,
      "grad_norm": 0.4298363975815829,
      "learning_rate": 4.0567210595062554e-05,
      "loss": 1.5102,
      "num_input_tokens_seen": 25512462192,
      "step": 32427
    },
    {
      "epoch": 3.440271589221303,
      "grad_norm": 0.5530599314934876,
      "learning_rate": 4.056666679687201e-05,
      "loss": 1.4472,
      "num_input_tokens_seen": 25513249040,
      "step": 32428
    },
    {
      "epoch": 3.440377678760874,
      "grad_norm": 0.3501507065172379,
      "learning_rate": 4.056612298665201e-05,
      "loss": 1.2797,
      "num_input_tokens_seen": 25514035888,
      "step": 32429
    },
    {
      "epoch": 3.4404837683004454,
      "grad_norm": 0.5129372185426776,
      "learning_rate": 4.0565579164402955e-05,
      "loss": 1.4982,
      "num_input_tokens_seen": 25514822624,
      "step": 32430
    },
    {
      "epoch": 3.440589857840017,
      "grad_norm": 0.40742691520607394,
      "learning_rate": 4.056503533012528e-05,
      "loss": 1.5062,
      "num_input_tokens_seen": 25515609456,
      "step": 32431
    },
    {
      "epoch": 3.4406959473795884,
      "grad_norm": 0.4953873150587522,
      "learning_rate": 4.056449148381941e-05,
      "loss": 1.5739,
      "num_input_tokens_seen": 25516396288,
      "step": 32432
    },
    {
      "epoch": 3.44080203691916,
      "grad_norm": 0.5239896492530274,
      "learning_rate": 4.0563947625485756e-05,
      "loss": 1.5848,
      "num_input_tokens_seen": 25517182976,
      "step": 32433
    },
    {
      "epoch": 3.4409081264587313,
      "grad_norm": 0.4557016585731025,
      "learning_rate": 4.0563403755124736e-05,
      "loss": 1.4768,
      "num_input_tokens_seen": 25517969920,
      "step": 32434
    },
    {
      "epoch": 3.441014215998303,
      "grad_norm": 0.42710704452369275,
      "learning_rate": 4.056285987273678e-05,
      "loss": 1.4265,
      "num_input_tokens_seen": 25518756656,
      "step": 32435
    },
    {
      "epoch": 3.441120305537874,
      "grad_norm": 0.5431487860848373,
      "learning_rate": 4.056231597832229e-05,
      "loss": 1.4718,
      "num_input_tokens_seen": 25519543408,
      "step": 32436
    },
    {
      "epoch": 3.4412263950774453,
      "grad_norm": 0.43066831434846037,
      "learning_rate": 4.056177207188171e-05,
      "loss": 1.3681,
      "num_input_tokens_seen": 25520330192,
      "step": 32437
    },
    {
      "epoch": 3.441332484617017,
      "grad_norm": 0.5548154952316434,
      "learning_rate": 4.0561228153415445e-05,
      "loss": 1.4926,
      "num_input_tokens_seen": 25521116992,
      "step": 32438
    },
    {
      "epoch": 3.4414385741565883,
      "grad_norm": 0.5018797198029288,
      "learning_rate": 4.0560684222923916e-05,
      "loss": 1.3817,
      "num_input_tokens_seen": 25521903728,
      "step": 32439
    },
    {
      "epoch": 3.4415446636961597,
      "grad_norm": 0.4580163546807382,
      "learning_rate": 4.0560140280407554e-05,
      "loss": 1.4071,
      "num_input_tokens_seen": 25522690528,
      "step": 32440
    },
    {
      "epoch": 3.4416507532357308,
      "grad_norm": 0.602738116494633,
      "learning_rate": 4.0559596325866774e-05,
      "loss": 1.6308,
      "num_input_tokens_seen": 25523477200,
      "step": 32441
    },
    {
      "epoch": 3.4417568427753022,
      "grad_norm": 0.5761320614538026,
      "learning_rate": 4.055905235930198e-05,
      "loss": 1.5351,
      "num_input_tokens_seen": 25524263952,
      "step": 32442
    },
    {
      "epoch": 3.4418629323148737,
      "grad_norm": 0.4636390793107363,
      "learning_rate": 4.0558508380713625e-05,
      "loss": 1.3976,
      "num_input_tokens_seen": 25525050672,
      "step": 32443
    },
    {
      "epoch": 3.441969021854445,
      "grad_norm": 0.5141760282534872,
      "learning_rate": 4.0557964390102096e-05,
      "loss": 1.542,
      "num_input_tokens_seen": 25525837552,
      "step": 32444
    },
    {
      "epoch": 3.4420751113940167,
      "grad_norm": 0.5046205703962856,
      "learning_rate": 4.0557420387467836e-05,
      "loss": 1.5074,
      "num_input_tokens_seen": 25526624304,
      "step": 32445
    },
    {
      "epoch": 3.4421812009335877,
      "grad_norm": 0.4214101190116431,
      "learning_rate": 4.055687637281126e-05,
      "loss": 1.3324,
      "num_input_tokens_seen": 25527411136,
      "step": 32446
    },
    {
      "epoch": 3.442287290473159,
      "grad_norm": 0.5646854286120738,
      "learning_rate": 4.055633234613279e-05,
      "loss": 1.4987,
      "num_input_tokens_seen": 25528197952,
      "step": 32447
    },
    {
      "epoch": 3.4423933800127307,
      "grad_norm": 0.6114040396801071,
      "learning_rate": 4.0555788307432834e-05,
      "loss": 1.5552,
      "num_input_tokens_seen": 25528984688,
      "step": 32448
    },
    {
      "epoch": 3.442499469552302,
      "grad_norm": 0.5773577039603844,
      "learning_rate": 4.055524425671182e-05,
      "loss": 1.5948,
      "num_input_tokens_seen": 25529771456,
      "step": 32449
    },
    {
      "epoch": 3.4426055590918736,
      "grad_norm": 0.4831608432016146,
      "learning_rate": 4.055470019397018e-05,
      "loss": 1.3921,
      "num_input_tokens_seen": 25530558272,
      "step": 32450
    },
    {
      "epoch": 3.442711648631445,
      "grad_norm": 0.726790859434754,
      "learning_rate": 4.055415611920832e-05,
      "loss": 1.4782,
      "num_input_tokens_seen": 25531345120,
      "step": 32451
    },
    {
      "epoch": 3.4428177381710166,
      "grad_norm": 0.5246776529605707,
      "learning_rate": 4.055361203242666e-05,
      "loss": 1.4695,
      "num_input_tokens_seen": 25532131888,
      "step": 32452
    },
    {
      "epoch": 3.4429238277105876,
      "grad_norm": 0.6486231693103676,
      "learning_rate": 4.055306793362562e-05,
      "loss": 1.4963,
      "num_input_tokens_seen": 25532918672,
      "step": 32453
    },
    {
      "epoch": 3.443029917250159,
      "grad_norm": 0.5348586693087506,
      "learning_rate": 4.055252382280564e-05,
      "loss": 1.5086,
      "num_input_tokens_seen": 25533705456,
      "step": 32454
    },
    {
      "epoch": 3.4431360067897305,
      "grad_norm": 0.533757527289347,
      "learning_rate": 4.055197969996711e-05,
      "loss": 1.3775,
      "num_input_tokens_seen": 25534492208,
      "step": 32455
    },
    {
      "epoch": 3.443242096329302,
      "grad_norm": 0.4617014184885915,
      "learning_rate": 4.055143556511049e-05,
      "loss": 1.4026,
      "num_input_tokens_seen": 25535278976,
      "step": 32456
    },
    {
      "epoch": 3.4433481858688735,
      "grad_norm": 0.5206233135604507,
      "learning_rate": 4.055089141823616e-05,
      "loss": 1.5249,
      "num_input_tokens_seen": 25536065712,
      "step": 32457
    },
    {
      "epoch": 3.4434542754084445,
      "grad_norm": 0.502240576037126,
      "learning_rate": 4.0550347259344553e-05,
      "loss": 1.3886,
      "num_input_tokens_seen": 25536852560,
      "step": 32458
    },
    {
      "epoch": 3.443560364948016,
      "grad_norm": 0.4813406016968567,
      "learning_rate": 4.05498030884361e-05,
      "loss": 1.466,
      "num_input_tokens_seen": 25537639344,
      "step": 32459
    },
    {
      "epoch": 3.4436664544875875,
      "grad_norm": 0.6248192894569388,
      "learning_rate": 4.0549258905511214e-05,
      "loss": 1.5788,
      "num_input_tokens_seen": 25538426080,
      "step": 32460
    },
    {
      "epoch": 3.443772544027159,
      "grad_norm": 0.5314927812757625,
      "learning_rate": 4.054871471057032e-05,
      "loss": 1.5184,
      "num_input_tokens_seen": 25539212752,
      "step": 32461
    },
    {
      "epoch": 3.4438786335667304,
      "grad_norm": 0.45106485003399277,
      "learning_rate": 4.054817050361384e-05,
      "loss": 1.4287,
      "num_input_tokens_seen": 25539999472,
      "step": 32462
    },
    {
      "epoch": 3.443984723106302,
      "grad_norm": 0.7629039148389724,
      "learning_rate": 4.054762628464218e-05,
      "loss": 1.3378,
      "num_input_tokens_seen": 25540786400,
      "step": 32463
    },
    {
      "epoch": 3.4440908126458734,
      "grad_norm": 0.5172254972858848,
      "learning_rate": 4.054708205365577e-05,
      "loss": 1.5042,
      "num_input_tokens_seen": 25541573184,
      "step": 32464
    },
    {
      "epoch": 3.4441969021854444,
      "grad_norm": 0.6274894314363942,
      "learning_rate": 4.054653781065504e-05,
      "loss": 1.4423,
      "num_input_tokens_seen": 25542359856,
      "step": 32465
    },
    {
      "epoch": 3.444302991725016,
      "grad_norm": 0.6132557845733269,
      "learning_rate": 4.05459935556404e-05,
      "loss": 1.4413,
      "num_input_tokens_seen": 25543146720,
      "step": 32466
    },
    {
      "epoch": 3.4444090812645873,
      "grad_norm": 0.4418701833292372,
      "learning_rate": 4.054544928861227e-05,
      "loss": 1.4908,
      "num_input_tokens_seen": 25543933504,
      "step": 32467
    },
    {
      "epoch": 3.444515170804159,
      "grad_norm": 0.6924905783973269,
      "learning_rate": 4.054490500957107e-05,
      "loss": 1.4044,
      "num_input_tokens_seen": 25544720336,
      "step": 32468
    },
    {
      "epoch": 3.4446212603437303,
      "grad_norm": 0.525283397586343,
      "learning_rate": 4.054436071851723e-05,
      "loss": 1.5867,
      "num_input_tokens_seen": 25545507088,
      "step": 32469
    },
    {
      "epoch": 3.4447273498833013,
      "grad_norm": 0.5933679617860386,
      "learning_rate": 4.0543816415451155e-05,
      "loss": 1.3772,
      "num_input_tokens_seen": 25546293856,
      "step": 32470
    },
    {
      "epoch": 3.444833439422873,
      "grad_norm": 0.5372960218878449,
      "learning_rate": 4.054327210037328e-05,
      "loss": 1.3876,
      "num_input_tokens_seen": 25547080560,
      "step": 32471
    },
    {
      "epoch": 3.4449395289624443,
      "grad_norm": 0.48885045596063936,
      "learning_rate": 4.054272777328402e-05,
      "loss": 1.6753,
      "num_input_tokens_seen": 25547867248,
      "step": 32472
    },
    {
      "epoch": 3.4450456185020157,
      "grad_norm": 0.5047395289438134,
      "learning_rate": 4.05421834341838e-05,
      "loss": 1.4585,
      "num_input_tokens_seen": 25548654016,
      "step": 32473
    },
    {
      "epoch": 3.445151708041587,
      "grad_norm": 0.49145364043746725,
      "learning_rate": 4.054163908307303e-05,
      "loss": 1.4567,
      "num_input_tokens_seen": 25549440768,
      "step": 32474
    },
    {
      "epoch": 3.4452577975811587,
      "grad_norm": 0.47153893356844456,
      "learning_rate": 4.054109471995214e-05,
      "loss": 1.394,
      "num_input_tokens_seen": 25550227520,
      "step": 32475
    },
    {
      "epoch": 3.4453638871207297,
      "grad_norm": 0.5724058309392372,
      "learning_rate": 4.0540550344821556e-05,
      "loss": 1.5497,
      "num_input_tokens_seen": 25551014256,
      "step": 32476
    },
    {
      "epoch": 3.445469976660301,
      "grad_norm": 0.5006379807296966,
      "learning_rate": 4.054000595768168e-05,
      "loss": 1.3925,
      "num_input_tokens_seen": 25551801072,
      "step": 32477
    },
    {
      "epoch": 3.4455760661998727,
      "grad_norm": 0.5208626528839697,
      "learning_rate": 4.053946155853294e-05,
      "loss": 1.4425,
      "num_input_tokens_seen": 25552587808,
      "step": 32478
    },
    {
      "epoch": 3.445682155739444,
      "grad_norm": 0.4814922019931069,
      "learning_rate": 4.053891714737577e-05,
      "loss": 1.4233,
      "num_input_tokens_seen": 25553374608,
      "step": 32479
    },
    {
      "epoch": 3.4457882452790156,
      "grad_norm": 0.4765741489673488,
      "learning_rate": 4.053837272421058e-05,
      "loss": 1.5204,
      "num_input_tokens_seen": 25554161392,
      "step": 32480
    },
    {
      "epoch": 3.445894334818587,
      "grad_norm": 0.4291134621995887,
      "learning_rate": 4.0537828289037796e-05,
      "loss": 1.466,
      "num_input_tokens_seen": 25554948176,
      "step": 32481
    },
    {
      "epoch": 3.446000424358158,
      "grad_norm": 0.4995187568394411,
      "learning_rate": 4.053728384185782e-05,
      "loss": 1.489,
      "num_input_tokens_seen": 25555734928,
      "step": 32482
    },
    {
      "epoch": 3.4461065138977296,
      "grad_norm": 0.4408289742419643,
      "learning_rate": 4.0536739382671096e-05,
      "loss": 1.4637,
      "num_input_tokens_seen": 25556521632,
      "step": 32483
    },
    {
      "epoch": 3.446212603437301,
      "grad_norm": 0.5013024939193107,
      "learning_rate": 4.053619491147803e-05,
      "loss": 1.542,
      "num_input_tokens_seen": 25557308400,
      "step": 32484
    },
    {
      "epoch": 3.4463186929768725,
      "grad_norm": 0.47077369133868063,
      "learning_rate": 4.053565042827906e-05,
      "loss": 1.4906,
      "num_input_tokens_seen": 25558095120,
      "step": 32485
    },
    {
      "epoch": 3.446424782516444,
      "grad_norm": 0.44434226325789944,
      "learning_rate": 4.0535105933074586e-05,
      "loss": 1.3304,
      "num_input_tokens_seen": 25558881856,
      "step": 32486
    },
    {
      "epoch": 3.446530872056015,
      "grad_norm": 0.4959345096575675,
      "learning_rate": 4.0534561425865035e-05,
      "loss": 1.5528,
      "num_input_tokens_seen": 25559668576,
      "step": 32487
    },
    {
      "epoch": 3.4466369615955865,
      "grad_norm": 0.616333456796312,
      "learning_rate": 4.053401690665084e-05,
      "loss": 1.5198,
      "num_input_tokens_seen": 25560455312,
      "step": 32488
    },
    {
      "epoch": 3.446743051135158,
      "grad_norm": 0.4625030106806512,
      "learning_rate": 4.05334723754324e-05,
      "loss": 1.5119,
      "num_input_tokens_seen": 25561242064,
      "step": 32489
    },
    {
      "epoch": 3.4468491406747295,
      "grad_norm": 0.5193225542263864,
      "learning_rate": 4.053292783221017e-05,
      "loss": 1.4188,
      "num_input_tokens_seen": 25562028832,
      "step": 32490
    },
    {
      "epoch": 3.446955230214301,
      "grad_norm": 0.5452222286460346,
      "learning_rate": 4.053238327698453e-05,
      "loss": 1.486,
      "num_input_tokens_seen": 25562815648,
      "step": 32491
    },
    {
      "epoch": 3.4470613197538724,
      "grad_norm": 0.4330506159570314,
      "learning_rate": 4.053183870975592e-05,
      "loss": 1.4837,
      "num_input_tokens_seen": 25563602384,
      "step": 32492
    },
    {
      "epoch": 3.447167409293444,
      "grad_norm": 0.6192651729167326,
      "learning_rate": 4.0531294130524775e-05,
      "loss": 1.5943,
      "num_input_tokens_seen": 25564389120,
      "step": 32493
    },
    {
      "epoch": 3.447273498833015,
      "grad_norm": 0.4163258996510532,
      "learning_rate": 4.0530749539291494e-05,
      "loss": 1.5703,
      "num_input_tokens_seen": 25565175968,
      "step": 32494
    },
    {
      "epoch": 3.4473795883725864,
      "grad_norm": 0.5529155620117439,
      "learning_rate": 4.05302049360565e-05,
      "loss": 1.5647,
      "num_input_tokens_seen": 25565962800,
      "step": 32495
    },
    {
      "epoch": 3.447485677912158,
      "grad_norm": 0.49430132057757287,
      "learning_rate": 4.052966032082022e-05,
      "loss": 1.5314,
      "num_input_tokens_seen": 25566749504,
      "step": 32496
    },
    {
      "epoch": 3.4475917674517293,
      "grad_norm": 0.41306813519964924,
      "learning_rate": 4.052911569358308e-05,
      "loss": 1.3737,
      "num_input_tokens_seen": 25567536304,
      "step": 32497
    },
    {
      "epoch": 3.447697856991301,
      "grad_norm": 0.4460991701979258,
      "learning_rate": 4.052857105434549e-05,
      "loss": 1.3809,
      "num_input_tokens_seen": 25568323088,
      "step": 32498
    },
    {
      "epoch": 3.447803946530872,
      "grad_norm": 0.447124828413322,
      "learning_rate": 4.052802640310788e-05,
      "loss": 1.4829,
      "num_input_tokens_seen": 25569109936,
      "step": 32499
    },
    {
      "epoch": 3.4479100360704433,
      "grad_norm": 0.43666545376135435,
      "learning_rate": 4.0527481739870665e-05,
      "loss": 1.465,
      "num_input_tokens_seen": 25569896768,
      "step": 32500
    },
    {
      "epoch": 3.448016125610015,
      "grad_norm": 0.4916617744077805,
      "learning_rate": 4.0526937064634266e-05,
      "loss": 1.577,
      "num_input_tokens_seen": 25570683488,
      "step": 32501
    },
    {
      "epoch": 3.4481222151495863,
      "grad_norm": 0.47632797658004755,
      "learning_rate": 4.052639237739911e-05,
      "loss": 1.5051,
      "num_input_tokens_seen": 25571470224,
      "step": 32502
    },
    {
      "epoch": 3.4482283046891578,
      "grad_norm": 0.5472381460005935,
      "learning_rate": 4.052584767816561e-05,
      "loss": 1.5191,
      "num_input_tokens_seen": 25572257024,
      "step": 32503
    },
    {
      "epoch": 3.4483343942287292,
      "grad_norm": 0.42961894511999765,
      "learning_rate": 4.0525302966934197e-05,
      "loss": 1.4446,
      "num_input_tokens_seen": 25573043808,
      "step": 32504
    },
    {
      "epoch": 3.4484404837683003,
      "grad_norm": 0.4031803425799162,
      "learning_rate": 4.052475824370528e-05,
      "loss": 1.3184,
      "num_input_tokens_seen": 25573830496,
      "step": 32505
    },
    {
      "epoch": 3.4485465733078717,
      "grad_norm": 0.4321855111412942,
      "learning_rate": 4.052421350847928e-05,
      "loss": 1.3698,
      "num_input_tokens_seen": 25574617168,
      "step": 32506
    },
    {
      "epoch": 3.448652662847443,
      "grad_norm": 0.43622338769062297,
      "learning_rate": 4.052366876125664e-05,
      "loss": 1.5797,
      "num_input_tokens_seen": 25575403984,
      "step": 32507
    },
    {
      "epoch": 3.4487587523870147,
      "grad_norm": 0.4502364956117563,
      "learning_rate": 4.052312400203775e-05,
      "loss": 1.5187,
      "num_input_tokens_seen": 25576190704,
      "step": 32508
    },
    {
      "epoch": 3.448864841926586,
      "grad_norm": 0.41837008503867984,
      "learning_rate": 4.0522579230823044e-05,
      "loss": 1.4788,
      "num_input_tokens_seen": 25576977440,
      "step": 32509
    },
    {
      "epoch": 3.4489709314661576,
      "grad_norm": 0.3935383643514507,
      "learning_rate": 4.052203444761295e-05,
      "loss": 1.4327,
      "num_input_tokens_seen": 25577764240,
      "step": 32510
    },
    {
      "epoch": 3.4490770210057287,
      "grad_norm": 0.4443694809180164,
      "learning_rate": 4.052148965240788e-05,
      "loss": 1.4405,
      "num_input_tokens_seen": 25578551024,
      "step": 32511
    },
    {
      "epoch": 3.4491831105453,
      "grad_norm": 0.46401476702472627,
      "learning_rate": 4.0520944845208256e-05,
      "loss": 1.5779,
      "num_input_tokens_seen": 25579337712,
      "step": 32512
    },
    {
      "epoch": 3.4492892000848716,
      "grad_norm": 0.5389664029701766,
      "learning_rate": 4.05204000260145e-05,
      "loss": 1.4936,
      "num_input_tokens_seen": 25580124432,
      "step": 32513
    },
    {
      "epoch": 3.449395289624443,
      "grad_norm": 0.4599338529899996,
      "learning_rate": 4.051985519482705e-05,
      "loss": 1.5879,
      "num_input_tokens_seen": 25580911216,
      "step": 32514
    },
    {
      "epoch": 3.4495013791640146,
      "grad_norm": 0.4153860456513708,
      "learning_rate": 4.05193103516463e-05,
      "loss": 1.4563,
      "num_input_tokens_seen": 25581698064,
      "step": 32515
    },
    {
      "epoch": 3.4496074687035856,
      "grad_norm": 0.759363986091644,
      "learning_rate": 4.0518765496472675e-05,
      "loss": 1.4489,
      "num_input_tokens_seen": 25582484848,
      "step": 32516
    },
    {
      "epoch": 3.449713558243157,
      "grad_norm": 0.46132674756136266,
      "learning_rate": 4.0518220629306614e-05,
      "loss": 1.4213,
      "num_input_tokens_seen": 25583271648,
      "step": 32517
    },
    {
      "epoch": 3.4498196477827285,
      "grad_norm": 0.5555120723989634,
      "learning_rate": 4.0517675750148524e-05,
      "loss": 1.4593,
      "num_input_tokens_seen": 25584058416,
      "step": 32518
    },
    {
      "epoch": 3.4499257373223,
      "grad_norm": 0.5127439409301583,
      "learning_rate": 4.0517130858998833e-05,
      "loss": 1.5477,
      "num_input_tokens_seen": 25584845184,
      "step": 32519
    },
    {
      "epoch": 3.4500318268618715,
      "grad_norm": 0.4384228361846915,
      "learning_rate": 4.0516585955857955e-05,
      "loss": 1.4459,
      "num_input_tokens_seen": 25585631920,
      "step": 32520
    },
    {
      "epoch": 3.450137916401443,
      "grad_norm": 0.5785479439430466,
      "learning_rate": 4.0516041040726315e-05,
      "loss": 1.3931,
      "num_input_tokens_seen": 25586418688,
      "step": 32521
    },
    {
      "epoch": 3.4502440059410144,
      "grad_norm": 0.4892584047900775,
      "learning_rate": 4.0515496113604334e-05,
      "loss": 1.5155,
      "num_input_tokens_seen": 25587205488,
      "step": 32522
    },
    {
      "epoch": 3.4503500954805855,
      "grad_norm": 0.6445878149826221,
      "learning_rate": 4.051495117449243e-05,
      "loss": 1.3459,
      "num_input_tokens_seen": 25587992368,
      "step": 32523
    },
    {
      "epoch": 3.450456185020157,
      "grad_norm": 0.40783885439682915,
      "learning_rate": 4.051440622339103e-05,
      "loss": 1.4145,
      "num_input_tokens_seen": 25588779200,
      "step": 32524
    },
    {
      "epoch": 3.4505622745597284,
      "grad_norm": 0.40914275769459607,
      "learning_rate": 4.0513861260300555e-05,
      "loss": 1.4121,
      "num_input_tokens_seen": 25589565952,
      "step": 32525
    },
    {
      "epoch": 3.4506683640993,
      "grad_norm": 0.533879630522679,
      "learning_rate": 4.0513316285221426e-05,
      "loss": 1.4887,
      "num_input_tokens_seen": 25590352672,
      "step": 32526
    },
    {
      "epoch": 3.4507744536388714,
      "grad_norm": 0.4819670372144378,
      "learning_rate": 4.051277129815405e-05,
      "loss": 1.4852,
      "num_input_tokens_seen": 25591139360,
      "step": 32527
    },
    {
      "epoch": 3.4508805431784424,
      "grad_norm": 0.4236439244726869,
      "learning_rate": 4.0512226299098866e-05,
      "loss": 1.5067,
      "num_input_tokens_seen": 25591926016,
      "step": 32528
    },
    {
      "epoch": 3.450986632718014,
      "grad_norm": 0.473141043417878,
      "learning_rate": 4.051168128805629e-05,
      "loss": 1.5066,
      "num_input_tokens_seen": 25592712832,
      "step": 32529
    },
    {
      "epoch": 3.4510927222575853,
      "grad_norm": 0.4186492054462812,
      "learning_rate": 4.051113626502674e-05,
      "loss": 1.4328,
      "num_input_tokens_seen": 25593499648,
      "step": 32530
    },
    {
      "epoch": 3.451198811797157,
      "grad_norm": 0.46989182681225344,
      "learning_rate": 4.0510591230010645e-05,
      "loss": 1.4897,
      "num_input_tokens_seen": 25594286432,
      "step": 32531
    },
    {
      "epoch": 3.4513049013367283,
      "grad_norm": 0.494962974796101,
      "learning_rate": 4.051004618300841e-05,
      "loss": 1.4663,
      "num_input_tokens_seen": 25595073312,
      "step": 32532
    },
    {
      "epoch": 3.4514109908762998,
      "grad_norm": 0.5126977680999867,
      "learning_rate": 4.050950112402047e-05,
      "loss": 1.5335,
      "num_input_tokens_seen": 25595859984,
      "step": 32533
    },
    {
      "epoch": 3.4515170804158712,
      "grad_norm": 0.48584872259675993,
      "learning_rate": 4.050895605304724e-05,
      "loss": 1.4571,
      "num_input_tokens_seen": 25596646752,
      "step": 32534
    },
    {
      "epoch": 3.4516231699554423,
      "grad_norm": 0.42651878683969174,
      "learning_rate": 4.050841097008915e-05,
      "loss": 1.4683,
      "num_input_tokens_seen": 25597433520,
      "step": 32535
    },
    {
      "epoch": 3.4517292594950137,
      "grad_norm": 0.44874787752879575,
      "learning_rate": 4.050786587514661e-05,
      "loss": 1.5236,
      "num_input_tokens_seen": 25598220304,
      "step": 32536
    },
    {
      "epoch": 3.451835349034585,
      "grad_norm": 0.45494896275043767,
      "learning_rate": 4.050732076822005e-05,
      "loss": 1.5261,
      "num_input_tokens_seen": 25599007008,
      "step": 32537
    },
    {
      "epoch": 3.4519414385741567,
      "grad_norm": 0.3722634637666617,
      "learning_rate": 4.0506775649309885e-05,
      "loss": 1.3695,
      "num_input_tokens_seen": 25599793808,
      "step": 32538
    },
    {
      "epoch": 3.452047528113728,
      "grad_norm": 0.4610416563003679,
      "learning_rate": 4.0506230518416545e-05,
      "loss": 1.5862,
      "num_input_tokens_seen": 25600580544,
      "step": 32539
    },
    {
      "epoch": 3.452153617653299,
      "grad_norm": 0.4750478646373137,
      "learning_rate": 4.050568537554044e-05,
      "loss": 1.4549,
      "num_input_tokens_seen": 25601367296,
      "step": 32540
    },
    {
      "epoch": 3.4522597071928707,
      "grad_norm": 0.42202325007552594,
      "learning_rate": 4.050514022068199e-05,
      "loss": 1.4704,
      "num_input_tokens_seen": 25602154192,
      "step": 32541
    },
    {
      "epoch": 3.452365796732442,
      "grad_norm": 0.4358293581182928,
      "learning_rate": 4.0504595053841634e-05,
      "loss": 1.333,
      "num_input_tokens_seen": 25602940928,
      "step": 32542
    },
    {
      "epoch": 3.4524718862720136,
      "grad_norm": 0.45508080189076405,
      "learning_rate": 4.0504049875019774e-05,
      "loss": 1.4927,
      "num_input_tokens_seen": 25603727632,
      "step": 32543
    },
    {
      "epoch": 3.452577975811585,
      "grad_norm": 0.45474494165949186,
      "learning_rate": 4.0503504684216844e-05,
      "loss": 1.5837,
      "num_input_tokens_seen": 25604514320,
      "step": 32544
    },
    {
      "epoch": 3.452684065351156,
      "grad_norm": 0.4222227822306904,
      "learning_rate": 4.0502959481433256e-05,
      "loss": 1.3857,
      "num_input_tokens_seen": 25605301088,
      "step": 32545
    },
    {
      "epoch": 3.4527901548907276,
      "grad_norm": 0.4267011101247672,
      "learning_rate": 4.0502414266669443e-05,
      "loss": 1.436,
      "num_input_tokens_seen": 25606087872,
      "step": 32546
    },
    {
      "epoch": 3.452896244430299,
      "grad_norm": 0.44489594875348876,
      "learning_rate": 4.050186903992581e-05,
      "loss": 1.427,
      "num_input_tokens_seen": 25606874656,
      "step": 32547
    },
    {
      "epoch": 3.4530023339698706,
      "grad_norm": 0.4109931818935527,
      "learning_rate": 4.050132380120279e-05,
      "loss": 1.4055,
      "num_input_tokens_seen": 25607661440,
      "step": 32548
    },
    {
      "epoch": 3.453108423509442,
      "grad_norm": 0.42908758406395725,
      "learning_rate": 4.0500778550500804e-05,
      "loss": 1.4358,
      "num_input_tokens_seen": 25608448160,
      "step": 32549
    },
    {
      "epoch": 3.4532145130490135,
      "grad_norm": 0.49452233256097294,
      "learning_rate": 4.050023328782026e-05,
      "loss": 1.5516,
      "num_input_tokens_seen": 25609234928,
      "step": 32550
    },
    {
      "epoch": 3.453320602588585,
      "grad_norm": 0.4673403396412324,
      "learning_rate": 4.0499688013161606e-05,
      "loss": 1.5614,
      "num_input_tokens_seen": 25610021680,
      "step": 32551
    },
    {
      "epoch": 3.453426692128156,
      "grad_norm": 0.5010747341193886,
      "learning_rate": 4.0499142726525246e-05,
      "loss": 1.4608,
      "num_input_tokens_seen": 25610808464,
      "step": 32552
    },
    {
      "epoch": 3.4535327816677275,
      "grad_norm": 0.40142191122183796,
      "learning_rate": 4.04985974279116e-05,
      "loss": 1.3957,
      "num_input_tokens_seen": 25611595280,
      "step": 32553
    },
    {
      "epoch": 3.453638871207299,
      "grad_norm": 0.4675030022467362,
      "learning_rate": 4.04980521173211e-05,
      "loss": 1.4875,
      "num_input_tokens_seen": 25612382048,
      "step": 32554
    },
    {
      "epoch": 3.4537449607468704,
      "grad_norm": 0.48783214179188955,
      "learning_rate": 4.049750679475415e-05,
      "loss": 1.4882,
      "num_input_tokens_seen": 25613168896,
      "step": 32555
    },
    {
      "epoch": 3.453851050286442,
      "grad_norm": 0.4549742114660317,
      "learning_rate": 4.049696146021118e-05,
      "loss": 1.5573,
      "num_input_tokens_seen": 25613955664,
      "step": 32556
    },
    {
      "epoch": 3.453957139826013,
      "grad_norm": 0.4864904327879114,
      "learning_rate": 4.049641611369262e-05,
      "loss": 1.495,
      "num_input_tokens_seen": 25614742320,
      "step": 32557
    },
    {
      "epoch": 3.4540632293655844,
      "grad_norm": 0.4206611263560569,
      "learning_rate": 4.0495870755198886e-05,
      "loss": 1.3727,
      "num_input_tokens_seen": 25615529216,
      "step": 32558
    },
    {
      "epoch": 3.454169318905156,
      "grad_norm": 0.40223410607946397,
      "learning_rate": 4.049532538473039e-05,
      "loss": 1.4298,
      "num_input_tokens_seen": 25616316032,
      "step": 32559
    },
    {
      "epoch": 3.4542754084447274,
      "grad_norm": 0.47134982674454273,
      "learning_rate": 4.049478000228756e-05,
      "loss": 1.5982,
      "num_input_tokens_seen": 25617102704,
      "step": 32560
    },
    {
      "epoch": 3.454381497984299,
      "grad_norm": 0.5094249745322709,
      "learning_rate": 4.049423460787083e-05,
      "loss": 1.4642,
      "num_input_tokens_seen": 25617889392,
      "step": 32561
    },
    {
      "epoch": 3.4544875875238703,
      "grad_norm": 0.5075028394064086,
      "learning_rate": 4.04936892014806e-05,
      "loss": 1.5649,
      "num_input_tokens_seen": 25618676064,
      "step": 32562
    },
    {
      "epoch": 3.454593677063442,
      "grad_norm": 0.5988916785135037,
      "learning_rate": 4.04931437831173e-05,
      "loss": 1.3992,
      "num_input_tokens_seen": 25619462768,
      "step": 32563
    },
    {
      "epoch": 3.454699766603013,
      "grad_norm": 0.49948765381488414,
      "learning_rate": 4.0492598352781356e-05,
      "loss": 1.4335,
      "num_input_tokens_seen": 25620249568,
      "step": 32564
    },
    {
      "epoch": 3.4548058561425843,
      "grad_norm": 0.43292710385612904,
      "learning_rate": 4.049205291047319e-05,
      "loss": 1.3485,
      "num_input_tokens_seen": 25621036416,
      "step": 32565
    },
    {
      "epoch": 3.4549119456821558,
      "grad_norm": 0.5015517845337227,
      "learning_rate": 4.0491507456193225e-05,
      "loss": 1.4815,
      "num_input_tokens_seen": 25621823104,
      "step": 32566
    },
    {
      "epoch": 3.4550180352217272,
      "grad_norm": 0.6389135391330282,
      "learning_rate": 4.049096198994187e-05,
      "loss": 1.4416,
      "num_input_tokens_seen": 25622609936,
      "step": 32567
    },
    {
      "epoch": 3.4551241247612987,
      "grad_norm": 0.4671876868670878,
      "learning_rate": 4.049041651171955e-05,
      "loss": 1.4186,
      "num_input_tokens_seen": 25623396752,
      "step": 32568
    },
    {
      "epoch": 3.4552302143008697,
      "grad_norm": 0.47191711745831116,
      "learning_rate": 4.048987102152669e-05,
      "loss": 1.3935,
      "num_input_tokens_seen": 25624183552,
      "step": 32569
    },
    {
      "epoch": 3.455336303840441,
      "grad_norm": 0.4981381013467197,
      "learning_rate": 4.048932551936373e-05,
      "loss": 1.5578,
      "num_input_tokens_seen": 25624970288,
      "step": 32570
    },
    {
      "epoch": 3.4554423933800127,
      "grad_norm": 0.5269090980033749,
      "learning_rate": 4.0488780005231055e-05,
      "loss": 1.4208,
      "num_input_tokens_seen": 25625756992,
      "step": 32571
    },
    {
      "epoch": 3.455548482919584,
      "grad_norm": 0.46156439645820235,
      "learning_rate": 4.0488234479129116e-05,
      "loss": 1.4232,
      "num_input_tokens_seen": 25626543792,
      "step": 32572
    },
    {
      "epoch": 3.4556545724591556,
      "grad_norm": 0.4312501913597488,
      "learning_rate": 4.048768894105832e-05,
      "loss": 1.431,
      "num_input_tokens_seen": 25627330560,
      "step": 32573
    },
    {
      "epoch": 3.455760661998727,
      "grad_norm": 0.5042375197328108,
      "learning_rate": 4.048714339101909e-05,
      "loss": 1.4557,
      "num_input_tokens_seen": 25628117248,
      "step": 32574
    },
    {
      "epoch": 3.455866751538298,
      "grad_norm": 0.48484114931126177,
      "learning_rate": 4.048659782901185e-05,
      "loss": 1.394,
      "num_input_tokens_seen": 25628904000,
      "step": 32575
    },
    {
      "epoch": 3.4559728410778696,
      "grad_norm": 0.40326211982012367,
      "learning_rate": 4.048605225503703e-05,
      "loss": 1.496,
      "num_input_tokens_seen": 25629690816,
      "step": 32576
    },
    {
      "epoch": 3.456078930617441,
      "grad_norm": 0.4387310475552709,
      "learning_rate": 4.048550666909503e-05,
      "loss": 1.4159,
      "num_input_tokens_seen": 25630477664,
      "step": 32577
    },
    {
      "epoch": 3.4561850201570126,
      "grad_norm": 0.41269671510008793,
      "learning_rate": 4.048496107118629e-05,
      "loss": 1.4247,
      "num_input_tokens_seen": 25631264480,
      "step": 32578
    },
    {
      "epoch": 3.456291109696584,
      "grad_norm": 0.39625524903751547,
      "learning_rate": 4.048441546131123e-05,
      "loss": 1.4059,
      "num_input_tokens_seen": 25632051184,
      "step": 32579
    },
    {
      "epoch": 3.4563971992361555,
      "grad_norm": 0.405149726239935,
      "learning_rate": 4.048386983947027e-05,
      "loss": 1.4638,
      "num_input_tokens_seen": 25632837936,
      "step": 32580
    },
    {
      "epoch": 3.4565032887757265,
      "grad_norm": 0.3945324413989779,
      "learning_rate": 4.0483324205663826e-05,
      "loss": 1.3707,
      "num_input_tokens_seen": 25633624752,
      "step": 32581
    },
    {
      "epoch": 3.456609378315298,
      "grad_norm": 0.4342649234199937,
      "learning_rate": 4.048277855989232e-05,
      "loss": 1.4753,
      "num_input_tokens_seen": 25634411584,
      "step": 32582
    },
    {
      "epoch": 3.4567154678548695,
      "grad_norm": 0.4098279276051375,
      "learning_rate": 4.048223290215619e-05,
      "loss": 1.4942,
      "num_input_tokens_seen": 25635198368,
      "step": 32583
    },
    {
      "epoch": 3.456821557394441,
      "grad_norm": 0.4440929282135654,
      "learning_rate": 4.048168723245583e-05,
      "loss": 1.4365,
      "num_input_tokens_seen": 25635985088,
      "step": 32584
    },
    {
      "epoch": 3.4569276469340124,
      "grad_norm": 0.3866122629421683,
      "learning_rate": 4.048114155079168e-05,
      "loss": 1.4066,
      "num_input_tokens_seen": 25636771840,
      "step": 32585
    },
    {
      "epoch": 3.4570337364735835,
      "grad_norm": 0.5243743464333026,
      "learning_rate": 4.048059585716416e-05,
      "loss": 1.4116,
      "num_input_tokens_seen": 25637558704,
      "step": 32586
    },
    {
      "epoch": 3.457139826013155,
      "grad_norm": 0.4883293534357008,
      "learning_rate": 4.048005015157369e-05,
      "loss": 1.5324,
      "num_input_tokens_seen": 25638345536,
      "step": 32587
    },
    {
      "epoch": 3.4572459155527264,
      "grad_norm": 0.5998077346253538,
      "learning_rate": 4.047950443402069e-05,
      "loss": 1.4958,
      "num_input_tokens_seen": 25639132256,
      "step": 32588
    },
    {
      "epoch": 3.457352005092298,
      "grad_norm": 0.4790659521563061,
      "learning_rate": 4.047895870450559e-05,
      "loss": 1.331,
      "num_input_tokens_seen": 25639919008,
      "step": 32589
    },
    {
      "epoch": 3.4574580946318694,
      "grad_norm": 0.38036486160810407,
      "learning_rate": 4.047841296302879e-05,
      "loss": 1.4002,
      "num_input_tokens_seen": 25640705872,
      "step": 32590
    },
    {
      "epoch": 3.457564184171441,
      "grad_norm": 0.6104919709372807,
      "learning_rate": 4.047786720959074e-05,
      "loss": 1.6095,
      "num_input_tokens_seen": 25641492640,
      "step": 32591
    },
    {
      "epoch": 3.4576702737110123,
      "grad_norm": 0.4186102559498198,
      "learning_rate": 4.047732144419184e-05,
      "loss": 1.5223,
      "num_input_tokens_seen": 25642279376,
      "step": 32592
    },
    {
      "epoch": 3.4577763632505834,
      "grad_norm": 0.5190698128395994,
      "learning_rate": 4.0476775666832526e-05,
      "loss": 1.4786,
      "num_input_tokens_seen": 25643066048,
      "step": 32593
    },
    {
      "epoch": 3.457882452790155,
      "grad_norm": 0.5262111053826324,
      "learning_rate": 4.0476229877513214e-05,
      "loss": 1.4744,
      "num_input_tokens_seen": 25643852896,
      "step": 32594
    },
    {
      "epoch": 3.4579885423297263,
      "grad_norm": 0.40172122238664915,
      "learning_rate": 4.047568407623432e-05,
      "loss": 1.4353,
      "num_input_tokens_seen": 25644639648,
      "step": 32595
    },
    {
      "epoch": 3.4580946318692978,
      "grad_norm": 0.6399583066364068,
      "learning_rate": 4.047513826299628e-05,
      "loss": 1.4864,
      "num_input_tokens_seen": 25645426512,
      "step": 32596
    },
    {
      "epoch": 3.4582007214088692,
      "grad_norm": 0.5041553305825263,
      "learning_rate": 4.04745924377995e-05,
      "loss": 1.5183,
      "num_input_tokens_seen": 25646213344,
      "step": 32597
    },
    {
      "epoch": 3.4583068109484403,
      "grad_norm": 0.5891555860089102,
      "learning_rate": 4.047404660064441e-05,
      "loss": 1.4943,
      "num_input_tokens_seen": 25647000112,
      "step": 32598
    },
    {
      "epoch": 3.4584129004880118,
      "grad_norm": 0.7343159617337572,
      "learning_rate": 4.047350075153144e-05,
      "loss": 1.5547,
      "num_input_tokens_seen": 25647786752,
      "step": 32599
    },
    {
      "epoch": 3.4585189900275832,
      "grad_norm": 0.49403508698958526,
      "learning_rate": 4.047295489046099e-05,
      "loss": 1.6025,
      "num_input_tokens_seen": 25648573424,
      "step": 32600
    },
    {
      "epoch": 3.4586250795671547,
      "grad_norm": 0.8278632636992459,
      "learning_rate": 4.04724090174335e-05,
      "loss": 1.4098,
      "num_input_tokens_seen": 25649360192,
      "step": 32601
    },
    {
      "epoch": 3.458731169106726,
      "grad_norm": 0.5368040325871848,
      "learning_rate": 4.047186313244938e-05,
      "loss": 1.5146,
      "num_input_tokens_seen": 25650147024,
      "step": 32602
    },
    {
      "epoch": 3.4588372586462977,
      "grad_norm": 0.6080107819146009,
      "learning_rate": 4.047131723550907e-05,
      "loss": 1.4365,
      "num_input_tokens_seen": 25650933792,
      "step": 32603
    },
    {
      "epoch": 3.4589433481858687,
      "grad_norm": 0.6749949444438226,
      "learning_rate": 4.047077132661297e-05,
      "loss": 1.5113,
      "num_input_tokens_seen": 25651720576,
      "step": 32604
    },
    {
      "epoch": 3.45904943772544,
      "grad_norm": 0.4752112949297097,
      "learning_rate": 4.047022540576152e-05,
      "loss": 1.4502,
      "num_input_tokens_seen": 25652507360,
      "step": 32605
    },
    {
      "epoch": 3.4591555272650116,
      "grad_norm": 0.49064362080955,
      "learning_rate": 4.046967947295512e-05,
      "loss": 1.4158,
      "num_input_tokens_seen": 25653294144,
      "step": 32606
    },
    {
      "epoch": 3.459261616804583,
      "grad_norm": 0.6368686459137225,
      "learning_rate": 4.046913352819423e-05,
      "loss": 1.4703,
      "num_input_tokens_seen": 25654080912,
      "step": 32607
    },
    {
      "epoch": 3.4593677063441546,
      "grad_norm": 0.4386254168647874,
      "learning_rate": 4.046858757147922e-05,
      "loss": 1.4059,
      "num_input_tokens_seen": 25654867712,
      "step": 32608
    },
    {
      "epoch": 3.459473795883726,
      "grad_norm": 0.5298949158673065,
      "learning_rate": 4.046804160281056e-05,
      "loss": 1.5159,
      "num_input_tokens_seen": 25655654576,
      "step": 32609
    },
    {
      "epoch": 3.459579885423297,
      "grad_norm": 0.5123381505919825,
      "learning_rate": 4.046749562218864e-05,
      "loss": 1.5246,
      "num_input_tokens_seen": 25656441440,
      "step": 32610
    },
    {
      "epoch": 3.4596859749628686,
      "grad_norm": 0.5222680777140224,
      "learning_rate": 4.046694962961389e-05,
      "loss": 1.579,
      "num_input_tokens_seen": 25657228192,
      "step": 32611
    },
    {
      "epoch": 3.45979206450244,
      "grad_norm": 0.5522903164482454,
      "learning_rate": 4.0466403625086745e-05,
      "loss": 1.5196,
      "num_input_tokens_seen": 25658015056,
      "step": 32612
    },
    {
      "epoch": 3.4598981540420115,
      "grad_norm": 0.43178264989318665,
      "learning_rate": 4.046585760860761e-05,
      "loss": 1.4332,
      "num_input_tokens_seen": 25658801840,
      "step": 32613
    },
    {
      "epoch": 3.460004243581583,
      "grad_norm": 0.4699535491825751,
      "learning_rate": 4.0465311580176915e-05,
      "loss": 1.4459,
      "num_input_tokens_seen": 25659588608,
      "step": 32614
    },
    {
      "epoch": 3.460110333121154,
      "grad_norm": 0.5801399026939137,
      "learning_rate": 4.0464765539795093e-05,
      "loss": 1.4285,
      "num_input_tokens_seen": 25660375424,
      "step": 32615
    },
    {
      "epoch": 3.4602164226607255,
      "grad_norm": 0.43812814457261595,
      "learning_rate": 4.046421948746254e-05,
      "loss": 1.5065,
      "num_input_tokens_seen": 25661162112,
      "step": 32616
    },
    {
      "epoch": 3.460322512200297,
      "grad_norm": 0.4347364336351376,
      "learning_rate": 4.0463673423179696e-05,
      "loss": 1.4908,
      "num_input_tokens_seen": 25661948816,
      "step": 32617
    },
    {
      "epoch": 3.4604286017398684,
      "grad_norm": 0.48438244775844874,
      "learning_rate": 4.0463127346946975e-05,
      "loss": 1.5076,
      "num_input_tokens_seen": 25662735584,
      "step": 32618
    },
    {
      "epoch": 3.46053469127944,
      "grad_norm": 0.39396707097377964,
      "learning_rate": 4.046258125876481e-05,
      "loss": 1.4019,
      "num_input_tokens_seen": 25663522448,
      "step": 32619
    },
    {
      "epoch": 3.4606407808190114,
      "grad_norm": 0.4311625559176553,
      "learning_rate": 4.0462035158633613e-05,
      "loss": 1.486,
      "num_input_tokens_seen": 25664309232,
      "step": 32620
    },
    {
      "epoch": 3.460746870358583,
      "grad_norm": 0.46592836817274497,
      "learning_rate": 4.0461489046553814e-05,
      "loss": 1.5419,
      "num_input_tokens_seen": 25665095984,
      "step": 32621
    },
    {
      "epoch": 3.460852959898154,
      "grad_norm": 0.5568398510795592,
      "learning_rate": 4.046094292252582e-05,
      "loss": 1.42,
      "num_input_tokens_seen": 25665882736,
      "step": 32622
    },
    {
      "epoch": 3.4609590494377254,
      "grad_norm": 0.3840568100018727,
      "learning_rate": 4.046039678655007e-05,
      "loss": 1.4336,
      "num_input_tokens_seen": 25666669568,
      "step": 32623
    },
    {
      "epoch": 3.461065138977297,
      "grad_norm": 0.4335144616145027,
      "learning_rate": 4.0459850638626974e-05,
      "loss": 1.5247,
      "num_input_tokens_seen": 25667456368,
      "step": 32624
    },
    {
      "epoch": 3.4611712285168683,
      "grad_norm": 0.38123757958376175,
      "learning_rate": 4.0459304478756966e-05,
      "loss": 1.3689,
      "num_input_tokens_seen": 25668243168,
      "step": 32625
    },
    {
      "epoch": 3.46127731805644,
      "grad_norm": 0.37844501333979536,
      "learning_rate": 4.045875830694046e-05,
      "loss": 1.3854,
      "num_input_tokens_seen": 25669029840,
      "step": 32626
    },
    {
      "epoch": 3.461383407596011,
      "grad_norm": 0.3892940590959524,
      "learning_rate": 4.0458212123177874e-05,
      "loss": 1.4027,
      "num_input_tokens_seen": 25669816608,
      "step": 32627
    },
    {
      "epoch": 3.4614894971355823,
      "grad_norm": 0.3881700439244853,
      "learning_rate": 4.045766592746964e-05,
      "loss": 1.4277,
      "num_input_tokens_seen": 25670603424,
      "step": 32628
    },
    {
      "epoch": 3.4615955866751538,
      "grad_norm": 0.39751286652835277,
      "learning_rate": 4.045711971981617e-05,
      "loss": 1.4571,
      "num_input_tokens_seen": 25671390208,
      "step": 32629
    },
    {
      "epoch": 3.4617016762147252,
      "grad_norm": 0.38501417676724364,
      "learning_rate": 4.045657350021789e-05,
      "loss": 1.3424,
      "num_input_tokens_seen": 25672177040,
      "step": 32630
    },
    {
      "epoch": 3.4618077657542967,
      "grad_norm": 0.38037796014148856,
      "learning_rate": 4.0456027268675226e-05,
      "loss": 1.4696,
      "num_input_tokens_seen": 25672963744,
      "step": 32631
    },
    {
      "epoch": 3.461913855293868,
      "grad_norm": 0.41626815320512955,
      "learning_rate": 4.04554810251886e-05,
      "loss": 1.453,
      "num_input_tokens_seen": 25673750576,
      "step": 32632
    },
    {
      "epoch": 3.4620199448334397,
      "grad_norm": 0.42217303731008743,
      "learning_rate": 4.0454934769758434e-05,
      "loss": 1.4661,
      "num_input_tokens_seen": 25674537296,
      "step": 32633
    },
    {
      "epoch": 3.4621260343730107,
      "grad_norm": 0.3806660098324386,
      "learning_rate": 4.0454388502385145e-05,
      "loss": 1.3326,
      "num_input_tokens_seen": 25675324144,
      "step": 32634
    },
    {
      "epoch": 3.462232123912582,
      "grad_norm": 0.4145425427228494,
      "learning_rate": 4.045384222306916e-05,
      "loss": 1.4793,
      "num_input_tokens_seen": 25676110944,
      "step": 32635
    },
    {
      "epoch": 3.4623382134521536,
      "grad_norm": 0.467071201407811,
      "learning_rate": 4.04532959318109e-05,
      "loss": 1.3963,
      "num_input_tokens_seen": 25676897712,
      "step": 32636
    },
    {
      "epoch": 3.462444302991725,
      "grad_norm": 0.47226922263648086,
      "learning_rate": 4.0452749628610784e-05,
      "loss": 1.4803,
      "num_input_tokens_seen": 25677684528,
      "step": 32637
    },
    {
      "epoch": 3.4625503925312966,
      "grad_norm": 0.42678417735796964,
      "learning_rate": 4.045220331346923e-05,
      "loss": 1.4113,
      "num_input_tokens_seen": 25678471232,
      "step": 32638
    },
    {
      "epoch": 3.4626564820708676,
      "grad_norm": 0.4584092397553164,
      "learning_rate": 4.0451656986386676e-05,
      "loss": 1.3666,
      "num_input_tokens_seen": 25679258048,
      "step": 32639
    },
    {
      "epoch": 3.462762571610439,
      "grad_norm": 0.40027549203768603,
      "learning_rate": 4.0451110647363535e-05,
      "loss": 1.3827,
      "num_input_tokens_seen": 25680044880,
      "step": 32640
    },
    {
      "epoch": 3.4628686611500106,
      "grad_norm": 0.5346901994835008,
      "learning_rate": 4.045056429640022e-05,
      "loss": 1.5019,
      "num_input_tokens_seen": 25680831696,
      "step": 32641
    },
    {
      "epoch": 3.462974750689582,
      "grad_norm": 0.5446803296309752,
      "learning_rate": 4.045001793349716e-05,
      "loss": 1.5275,
      "num_input_tokens_seen": 25681618432,
      "step": 32642
    },
    {
      "epoch": 3.4630808402291535,
      "grad_norm": 0.6377878307183572,
      "learning_rate": 4.0449471558654794e-05,
      "loss": 1.4074,
      "num_input_tokens_seen": 25682405184,
      "step": 32643
    },
    {
      "epoch": 3.463186929768725,
      "grad_norm": 0.6622879969974536,
      "learning_rate": 4.044892517187352e-05,
      "loss": 1.5626,
      "num_input_tokens_seen": 25683191920,
      "step": 32644
    },
    {
      "epoch": 3.463293019308296,
      "grad_norm": 0.49900758259862926,
      "learning_rate": 4.0448378773153775e-05,
      "loss": 1.4462,
      "num_input_tokens_seen": 25683978656,
      "step": 32645
    },
    {
      "epoch": 3.4633991088478675,
      "grad_norm": 0.5708834051199068,
      "learning_rate": 4.044783236249598e-05,
      "loss": 1.4941,
      "num_input_tokens_seen": 25684765440,
      "step": 32646
    },
    {
      "epoch": 3.463505198387439,
      "grad_norm": 0.39711325044778684,
      "learning_rate": 4.044728593990055e-05,
      "loss": 1.3847,
      "num_input_tokens_seen": 25685552192,
      "step": 32647
    },
    {
      "epoch": 3.4636112879270105,
      "grad_norm": 0.5400718308357185,
      "learning_rate": 4.0446739505367904e-05,
      "loss": 1.5031,
      "num_input_tokens_seen": 25686338896,
      "step": 32648
    },
    {
      "epoch": 3.463717377466582,
      "grad_norm": 0.5290134187183411,
      "learning_rate": 4.044619305889848e-05,
      "loss": 1.5333,
      "num_input_tokens_seen": 25687125648,
      "step": 32649
    },
    {
      "epoch": 3.4638234670061534,
      "grad_norm": 0.41774091159429305,
      "learning_rate": 4.044564660049268e-05,
      "loss": 1.4512,
      "num_input_tokens_seen": 25687912384,
      "step": 32650
    },
    {
      "epoch": 3.4639295565457244,
      "grad_norm": 0.45719896274022814,
      "learning_rate": 4.0445100130150946e-05,
      "loss": 1.5071,
      "num_input_tokens_seen": 25688699120,
      "step": 32651
    },
    {
      "epoch": 3.464035646085296,
      "grad_norm": 0.5033957581438158,
      "learning_rate": 4.044455364787368e-05,
      "loss": 1.4692,
      "num_input_tokens_seen": 25689485968,
      "step": 32652
    },
    {
      "epoch": 3.4641417356248674,
      "grad_norm": 0.39342361446921786,
      "learning_rate": 4.044400715366133e-05,
      "loss": 1.3889,
      "num_input_tokens_seen": 25690272848,
      "step": 32653
    },
    {
      "epoch": 3.464247825164439,
      "grad_norm": 0.4946580786775417,
      "learning_rate": 4.0443460647514307e-05,
      "loss": 1.3868,
      "num_input_tokens_seen": 25691059600,
      "step": 32654
    },
    {
      "epoch": 3.4643539147040103,
      "grad_norm": 0.44879201931926954,
      "learning_rate": 4.044291412943302e-05,
      "loss": 1.3684,
      "num_input_tokens_seen": 25691846320,
      "step": 32655
    },
    {
      "epoch": 3.4644600042435814,
      "grad_norm": 0.4615246663255848,
      "learning_rate": 4.044236759941791e-05,
      "loss": 1.4238,
      "num_input_tokens_seen": 25692633104,
      "step": 32656
    },
    {
      "epoch": 3.464566093783153,
      "grad_norm": 0.5213815136201365,
      "learning_rate": 4.0441821057469383e-05,
      "loss": 1.3965,
      "num_input_tokens_seen": 25693419888,
      "step": 32657
    },
    {
      "epoch": 3.4646721833227243,
      "grad_norm": 0.46972334778733543,
      "learning_rate": 4.044127450358788e-05,
      "loss": 1.5398,
      "num_input_tokens_seen": 25694206624,
      "step": 32658
    },
    {
      "epoch": 3.464778272862296,
      "grad_norm": 0.5882992618696011,
      "learning_rate": 4.0440727937773806e-05,
      "loss": 1.5749,
      "num_input_tokens_seen": 25694993440,
      "step": 32659
    },
    {
      "epoch": 3.4648843624018673,
      "grad_norm": 0.44282015937315666,
      "learning_rate": 4.044018136002759e-05,
      "loss": 1.4488,
      "num_input_tokens_seen": 25695780192,
      "step": 32660
    },
    {
      "epoch": 3.4649904519414387,
      "grad_norm": 0.4820399621473697,
      "learning_rate": 4.0439634770349656e-05,
      "loss": 1.4187,
      "num_input_tokens_seen": 25696566944,
      "step": 32661
    },
    {
      "epoch": 3.46509654148101,
      "grad_norm": 0.528851239376396,
      "learning_rate": 4.0439088168740426e-05,
      "loss": 1.5004,
      "num_input_tokens_seen": 25697353680,
      "step": 32662
    },
    {
      "epoch": 3.4652026310205812,
      "grad_norm": 0.4216619264180074,
      "learning_rate": 4.043854155520032e-05,
      "loss": 1.3812,
      "num_input_tokens_seen": 25698140496,
      "step": 32663
    },
    {
      "epoch": 3.4653087205601527,
      "grad_norm": 0.5952237047737321,
      "learning_rate": 4.043799492972976e-05,
      "loss": 1.4703,
      "num_input_tokens_seen": 25698927248,
      "step": 32664
    },
    {
      "epoch": 3.465414810099724,
      "grad_norm": 0.6103464456863067,
      "learning_rate": 4.043744829232918e-05,
      "loss": 1.5725,
      "num_input_tokens_seen": 25699714128,
      "step": 32665
    },
    {
      "epoch": 3.4655208996392957,
      "grad_norm": 0.6158279976807587,
      "learning_rate": 4.043690164299899e-05,
      "loss": 1.4252,
      "num_input_tokens_seen": 25700500912,
      "step": 32666
    },
    {
      "epoch": 3.465626989178867,
      "grad_norm": 0.530249381795596,
      "learning_rate": 4.043635498173961e-05,
      "loss": 1.5041,
      "num_input_tokens_seen": 25701287744,
      "step": 32667
    },
    {
      "epoch": 3.465733078718438,
      "grad_norm": 0.5009879283089756,
      "learning_rate": 4.043580830855147e-05,
      "loss": 1.4888,
      "num_input_tokens_seen": 25702074464,
      "step": 32668
    },
    {
      "epoch": 3.4658391682580096,
      "grad_norm": 0.526062640850286,
      "learning_rate": 4.043526162343499e-05,
      "loss": 1.4035,
      "num_input_tokens_seen": 25702861264,
      "step": 32669
    },
    {
      "epoch": 3.465945257797581,
      "grad_norm": 0.42541158893310316,
      "learning_rate": 4.0434714926390596e-05,
      "loss": 1.4571,
      "num_input_tokens_seen": 25703648016,
      "step": 32670
    },
    {
      "epoch": 3.4660513473371526,
      "grad_norm": 0.4808815600819967,
      "learning_rate": 4.04341682174187e-05,
      "loss": 1.5485,
      "num_input_tokens_seen": 25704434848,
      "step": 32671
    },
    {
      "epoch": 3.466157436876724,
      "grad_norm": 0.45879890531374445,
      "learning_rate": 4.043362149651974e-05,
      "loss": 1.5505,
      "num_input_tokens_seen": 25705221632,
      "step": 32672
    },
    {
      "epoch": 3.4662635264162955,
      "grad_norm": 0.3856877600398379,
      "learning_rate": 4.043307476369412e-05,
      "loss": 1.3827,
      "num_input_tokens_seen": 25706008368,
      "step": 32673
    },
    {
      "epoch": 3.4663696159558666,
      "grad_norm": 0.6174951672396531,
      "learning_rate": 4.0432528018942285e-05,
      "loss": 1.4461,
      "num_input_tokens_seen": 25706795152,
      "step": 32674
    },
    {
      "epoch": 3.466475705495438,
      "grad_norm": 0.4035016659534365,
      "learning_rate": 4.043198126226464e-05,
      "loss": 1.441,
      "num_input_tokens_seen": 25707581968,
      "step": 32675
    },
    {
      "epoch": 3.4665817950350095,
      "grad_norm": 0.4626636497583786,
      "learning_rate": 4.043143449366161e-05,
      "loss": 1.3957,
      "num_input_tokens_seen": 25708368752,
      "step": 32676
    },
    {
      "epoch": 3.466687884574581,
      "grad_norm": 0.45046698147756065,
      "learning_rate": 4.0430887713133624e-05,
      "loss": 1.3772,
      "num_input_tokens_seen": 25709155600,
      "step": 32677
    },
    {
      "epoch": 3.4667939741141525,
      "grad_norm": 0.4955957860665642,
      "learning_rate": 4.04303409206811e-05,
      "loss": 1.4963,
      "num_input_tokens_seen": 25709942336,
      "step": 32678
    },
    {
      "epoch": 3.466900063653724,
      "grad_norm": 0.482380452629759,
      "learning_rate": 4.042979411630446e-05,
      "loss": 1.5209,
      "num_input_tokens_seen": 25710729056,
      "step": 32679
    },
    {
      "epoch": 3.467006153193295,
      "grad_norm": 0.4966561434983894,
      "learning_rate": 4.0429247300004126e-05,
      "loss": 1.5446,
      "num_input_tokens_seen": 25711515792,
      "step": 32680
    },
    {
      "epoch": 3.4671122427328664,
      "grad_norm": 0.44818797896301815,
      "learning_rate": 4.042870047178052e-05,
      "loss": 1.4568,
      "num_input_tokens_seen": 25712302496,
      "step": 32681
    },
    {
      "epoch": 3.467218332272438,
      "grad_norm": 0.37096787394307223,
      "learning_rate": 4.042815363163407e-05,
      "loss": 1.3388,
      "num_input_tokens_seen": 25713089216,
      "step": 32682
    },
    {
      "epoch": 3.4673244218120094,
      "grad_norm": 0.4210232831561361,
      "learning_rate": 4.04276067795652e-05,
      "loss": 1.3748,
      "num_input_tokens_seen": 25713875952,
      "step": 32683
    },
    {
      "epoch": 3.467430511351581,
      "grad_norm": 0.4322413242162338,
      "learning_rate": 4.042705991557433e-05,
      "loss": 1.3935,
      "num_input_tokens_seen": 25714662720,
      "step": 32684
    },
    {
      "epoch": 3.467536600891152,
      "grad_norm": 0.4375118860799846,
      "learning_rate": 4.0426513039661876e-05,
      "loss": 1.5184,
      "num_input_tokens_seen": 25715449456,
      "step": 32685
    },
    {
      "epoch": 3.4676426904307234,
      "grad_norm": 0.4499590393334921,
      "learning_rate": 4.0425966151828266e-05,
      "loss": 1.4689,
      "num_input_tokens_seen": 25716236272,
      "step": 32686
    },
    {
      "epoch": 3.467748779970295,
      "grad_norm": 0.5922034004305375,
      "learning_rate": 4.0425419252073915e-05,
      "loss": 1.4905,
      "num_input_tokens_seen": 25717023056,
      "step": 32687
    },
    {
      "epoch": 3.4678548695098663,
      "grad_norm": 0.4447475613733477,
      "learning_rate": 4.042487234039926e-05,
      "loss": 1.4487,
      "num_input_tokens_seen": 25717809808,
      "step": 32688
    },
    {
      "epoch": 3.467960959049438,
      "grad_norm": 0.6017152530494166,
      "learning_rate": 4.042432541680472e-05,
      "loss": 1.5813,
      "num_input_tokens_seen": 25718596560,
      "step": 32689
    },
    {
      "epoch": 3.4680670485890093,
      "grad_norm": 0.41786486792185346,
      "learning_rate": 4.042377848129071e-05,
      "loss": 1.5006,
      "num_input_tokens_seen": 25719383360,
      "step": 32690
    },
    {
      "epoch": 3.4681731381285807,
      "grad_norm": 0.48119878025750323,
      "learning_rate": 4.0423231533857654e-05,
      "loss": 1.4621,
      "num_input_tokens_seen": 25720170176,
      "step": 32691
    },
    {
      "epoch": 3.4682792276681518,
      "grad_norm": 0.4403302850103261,
      "learning_rate": 4.0422684574505976e-05,
      "loss": 1.5728,
      "num_input_tokens_seen": 25720957008,
      "step": 32692
    },
    {
      "epoch": 3.4683853172077233,
      "grad_norm": 0.617892926455976,
      "learning_rate": 4.0422137603236104e-05,
      "loss": 1.4786,
      "num_input_tokens_seen": 25721743760,
      "step": 32693
    },
    {
      "epoch": 3.4684914067472947,
      "grad_norm": 0.40906327013111254,
      "learning_rate": 4.042159062004846e-05,
      "loss": 1.3479,
      "num_input_tokens_seen": 25722530560,
      "step": 32694
    },
    {
      "epoch": 3.468597496286866,
      "grad_norm": 0.4725718472885149,
      "learning_rate": 4.042104362494346e-05,
      "loss": 1.4393,
      "num_input_tokens_seen": 25723317312,
      "step": 32695
    },
    {
      "epoch": 3.4687035858264377,
      "grad_norm": 0.411121593424658,
      "learning_rate": 4.042049661792152e-05,
      "loss": 1.3958,
      "num_input_tokens_seen": 25724104064,
      "step": 32696
    },
    {
      "epoch": 3.4688096753660087,
      "grad_norm": 0.4549573510399513,
      "learning_rate": 4.041994959898308e-05,
      "loss": 1.5283,
      "num_input_tokens_seen": 25724890832,
      "step": 32697
    },
    {
      "epoch": 3.46891576490558,
      "grad_norm": 0.4240941333158694,
      "learning_rate": 4.041940256812856e-05,
      "loss": 1.3997,
      "num_input_tokens_seen": 25725677728,
      "step": 32698
    },
    {
      "epoch": 3.4690218544451517,
      "grad_norm": 0.41321119633138437,
      "learning_rate": 4.041885552535837e-05,
      "loss": 1.4557,
      "num_input_tokens_seen": 25726464480,
      "step": 32699
    },
    {
      "epoch": 3.469127943984723,
      "grad_norm": 0.509752980704825,
      "learning_rate": 4.041830847067295e-05,
      "loss": 1.515,
      "num_input_tokens_seen": 25727251152,
      "step": 32700
    },
    {
      "epoch": 3.4692340335242946,
      "grad_norm": 0.41429754998176865,
      "learning_rate": 4.041776140407271e-05,
      "loss": 1.4476,
      "num_input_tokens_seen": 25728037856,
      "step": 32701
    },
    {
      "epoch": 3.469340123063866,
      "grad_norm": 0.6334149416620566,
      "learning_rate": 4.041721432555807e-05,
      "loss": 1.4957,
      "num_input_tokens_seen": 25728824576,
      "step": 32702
    },
    {
      "epoch": 3.469446212603437,
      "grad_norm": 0.5187913037917538,
      "learning_rate": 4.041666723512947e-05,
      "loss": 1.4934,
      "num_input_tokens_seen": 25729611360,
      "step": 32703
    },
    {
      "epoch": 3.4695523021430086,
      "grad_norm": 0.5706238306803251,
      "learning_rate": 4.041612013278732e-05,
      "loss": 1.4114,
      "num_input_tokens_seen": 25730398144,
      "step": 32704
    },
    {
      "epoch": 3.46965839168258,
      "grad_norm": 0.5135731718633366,
      "learning_rate": 4.0415573018532037e-05,
      "loss": 1.4802,
      "num_input_tokens_seen": 25731184912,
      "step": 32705
    },
    {
      "epoch": 3.4697644812221515,
      "grad_norm": 0.48222740948722753,
      "learning_rate": 4.041502589236406e-05,
      "loss": 1.4175,
      "num_input_tokens_seen": 25731971728,
      "step": 32706
    },
    {
      "epoch": 3.469870570761723,
      "grad_norm": 0.423258688847202,
      "learning_rate": 4.041447875428379e-05,
      "loss": 1.4443,
      "num_input_tokens_seen": 25732758496,
      "step": 32707
    },
    {
      "epoch": 3.4699766603012945,
      "grad_norm": 0.47266036094664254,
      "learning_rate": 4.0413931604291676e-05,
      "loss": 1.5456,
      "num_input_tokens_seen": 25733545264,
      "step": 32708
    },
    {
      "epoch": 3.4700827498408655,
      "grad_norm": 0.4251468534993836,
      "learning_rate": 4.041338444238812e-05,
      "loss": 1.4367,
      "num_input_tokens_seen": 25734331936,
      "step": 32709
    },
    {
      "epoch": 3.470188839380437,
      "grad_norm": 0.4523733520100885,
      "learning_rate": 4.0412837268573556e-05,
      "loss": 1.5383,
      "num_input_tokens_seen": 25735118720,
      "step": 32710
    },
    {
      "epoch": 3.4702949289200085,
      "grad_norm": 0.4559035408467535,
      "learning_rate": 4.0412290082848406e-05,
      "loss": 1.4947,
      "num_input_tokens_seen": 25735905456,
      "step": 32711
    },
    {
      "epoch": 3.47040101845958,
      "grad_norm": 0.3887105469820688,
      "learning_rate": 4.0411742885213086e-05,
      "loss": 1.42,
      "num_input_tokens_seen": 25736692240,
      "step": 32712
    },
    {
      "epoch": 3.4705071079991514,
      "grad_norm": 0.4001000600863978,
      "learning_rate": 4.041119567566803e-05,
      "loss": 1.4089,
      "num_input_tokens_seen": 25737479056,
      "step": 32713
    },
    {
      "epoch": 3.4706131975387224,
      "grad_norm": 0.4320626341370876,
      "learning_rate": 4.041064845421365e-05,
      "loss": 1.4734,
      "num_input_tokens_seen": 25738265744,
      "step": 32714
    },
    {
      "epoch": 3.470719287078294,
      "grad_norm": 0.44340635671679596,
      "learning_rate": 4.0410101220850374e-05,
      "loss": 1.5276,
      "num_input_tokens_seen": 25739052416,
      "step": 32715
    },
    {
      "epoch": 3.4708253766178654,
      "grad_norm": 0.4028445133181788,
      "learning_rate": 4.0409553975578625e-05,
      "loss": 1.4232,
      "num_input_tokens_seen": 25739839136,
      "step": 32716
    },
    {
      "epoch": 3.470931466157437,
      "grad_norm": 0.3750852229835669,
      "learning_rate": 4.0409006718398826e-05,
      "loss": 1.3586,
      "num_input_tokens_seen": 25740625888,
      "step": 32717
    },
    {
      "epoch": 3.4710375556970083,
      "grad_norm": 0.398277326214011,
      "learning_rate": 4.040845944931139e-05,
      "loss": 1.4344,
      "num_input_tokens_seen": 25741412656,
      "step": 32718
    },
    {
      "epoch": 3.47114364523658,
      "grad_norm": 0.44358479585074745,
      "learning_rate": 4.040791216831675e-05,
      "loss": 1.4456,
      "num_input_tokens_seen": 25742199504,
      "step": 32719
    },
    {
      "epoch": 3.4712497347761513,
      "grad_norm": 0.44878020605478525,
      "learning_rate": 4.040736487541534e-05,
      "loss": 1.4934,
      "num_input_tokens_seen": 25742986272,
      "step": 32720
    },
    {
      "epoch": 3.4713558243157223,
      "grad_norm": 0.41829414170149676,
      "learning_rate": 4.040681757060756e-05,
      "loss": 1.4267,
      "num_input_tokens_seen": 25743773040,
      "step": 32721
    },
    {
      "epoch": 3.471461913855294,
      "grad_norm": 0.4776407716242269,
      "learning_rate": 4.040627025389385e-05,
      "loss": 1.4341,
      "num_input_tokens_seen": 25744559808,
      "step": 32722
    },
    {
      "epoch": 3.4715680033948653,
      "grad_norm": 0.4337835140211775,
      "learning_rate": 4.040572292527462e-05,
      "loss": 1.54,
      "num_input_tokens_seen": 25745346608,
      "step": 32723
    },
    {
      "epoch": 3.4716740929344367,
      "grad_norm": 0.4157273199252457,
      "learning_rate": 4.04051755847503e-05,
      "loss": 1.4526,
      "num_input_tokens_seen": 25746133264,
      "step": 32724
    },
    {
      "epoch": 3.471780182474008,
      "grad_norm": 0.4123699771024155,
      "learning_rate": 4.0404628232321316e-05,
      "loss": 1.4052,
      "num_input_tokens_seen": 25746920032,
      "step": 32725
    },
    {
      "epoch": 3.4718862720135792,
      "grad_norm": 0.40240180631474737,
      "learning_rate": 4.040408086798808e-05,
      "loss": 1.412,
      "num_input_tokens_seen": 25747706768,
      "step": 32726
    },
    {
      "epoch": 3.4719923615531507,
      "grad_norm": 0.35379233108270425,
      "learning_rate": 4.040353349175103e-05,
      "loss": 1.326,
      "num_input_tokens_seen": 25748493584,
      "step": 32727
    },
    {
      "epoch": 3.472098451092722,
      "grad_norm": 0.427412584364185,
      "learning_rate": 4.040298610361058e-05,
      "loss": 1.4171,
      "num_input_tokens_seen": 25749280336,
      "step": 32728
    },
    {
      "epoch": 3.4722045406322937,
      "grad_norm": 0.3607158523651092,
      "learning_rate": 4.040243870356716e-05,
      "loss": 1.456,
      "num_input_tokens_seen": 25750067104,
      "step": 32729
    },
    {
      "epoch": 3.472310630171865,
      "grad_norm": 0.42903047500163505,
      "learning_rate": 4.040189129162118e-05,
      "loss": 1.4628,
      "num_input_tokens_seen": 25750853776,
      "step": 32730
    },
    {
      "epoch": 3.4724167197114366,
      "grad_norm": 0.44108736808120574,
      "learning_rate": 4.0401343867773064e-05,
      "loss": 1.484,
      "num_input_tokens_seen": 25751640528,
      "step": 32731
    },
    {
      "epoch": 3.472522809251008,
      "grad_norm": 0.4018348505085741,
      "learning_rate": 4.040079643202325e-05,
      "loss": 1.493,
      "num_input_tokens_seen": 25752427312,
      "step": 32732
    },
    {
      "epoch": 3.472628898790579,
      "grad_norm": 0.4040690102223979,
      "learning_rate": 4.040024898437215e-05,
      "loss": 1.4516,
      "num_input_tokens_seen": 25753214128,
      "step": 32733
    },
    {
      "epoch": 3.4727349883301506,
      "grad_norm": 0.4297309573392057,
      "learning_rate": 4.0399701524820186e-05,
      "loss": 1.5075,
      "num_input_tokens_seen": 25754000896,
      "step": 32734
    },
    {
      "epoch": 3.472841077869722,
      "grad_norm": 0.4606940226209538,
      "learning_rate": 4.039915405336779e-05,
      "loss": 1.3979,
      "num_input_tokens_seen": 25754787760,
      "step": 32735
    },
    {
      "epoch": 3.4729471674092935,
      "grad_norm": 0.4154466211724789,
      "learning_rate": 4.039860657001538e-05,
      "loss": 1.4481,
      "num_input_tokens_seen": 25755574560,
      "step": 32736
    },
    {
      "epoch": 3.473053256948865,
      "grad_norm": 0.43864277371880894,
      "learning_rate": 4.039805907476338e-05,
      "loss": 1.5961,
      "num_input_tokens_seen": 25756361312,
      "step": 32737
    },
    {
      "epoch": 3.473159346488436,
      "grad_norm": 0.39135402157230453,
      "learning_rate": 4.0397511567612205e-05,
      "loss": 1.4574,
      "num_input_tokens_seen": 25757148144,
      "step": 32738
    },
    {
      "epoch": 3.4732654360280075,
      "grad_norm": 0.4064730202609121,
      "learning_rate": 4.039696404856229e-05,
      "loss": 1.4134,
      "num_input_tokens_seen": 25757934880,
      "step": 32739
    },
    {
      "epoch": 3.473371525567579,
      "grad_norm": 0.490353467748479,
      "learning_rate": 4.039641651761406e-05,
      "loss": 1.4312,
      "num_input_tokens_seen": 25758721648,
      "step": 32740
    },
    {
      "epoch": 3.4734776151071505,
      "grad_norm": 0.5068842494638407,
      "learning_rate": 4.039586897476791e-05,
      "loss": 1.3753,
      "num_input_tokens_seen": 25759508512,
      "step": 32741
    },
    {
      "epoch": 3.473583704646722,
      "grad_norm": 0.5307630403758357,
      "learning_rate": 4.03953214200243e-05,
      "loss": 1.4793,
      "num_input_tokens_seen": 25760295328,
      "step": 32742
    },
    {
      "epoch": 3.4736897941862934,
      "grad_norm": 0.5201109970113145,
      "learning_rate": 4.0394773853383635e-05,
      "loss": 1.487,
      "num_input_tokens_seen": 25761082096,
      "step": 32743
    },
    {
      "epoch": 3.4737958837258645,
      "grad_norm": 0.5473996539288086,
      "learning_rate": 4.039422627484633e-05,
      "loss": 1.5781,
      "num_input_tokens_seen": 25761868864,
      "step": 32744
    },
    {
      "epoch": 3.473901973265436,
      "grad_norm": 0.5175034895557055,
      "learning_rate": 4.039367868441284e-05,
      "loss": 1.5688,
      "num_input_tokens_seen": 25762655648,
      "step": 32745
    },
    {
      "epoch": 3.4740080628050074,
      "grad_norm": 0.5659061415332411,
      "learning_rate": 4.039313108208356e-05,
      "loss": 1.4895,
      "num_input_tokens_seen": 25763442400,
      "step": 32746
    },
    {
      "epoch": 3.474114152344579,
      "grad_norm": 0.4422122326789748,
      "learning_rate": 4.039258346785891e-05,
      "loss": 1.4285,
      "num_input_tokens_seen": 25764229216,
      "step": 32747
    },
    {
      "epoch": 3.4742202418841504,
      "grad_norm": 0.49215281933516714,
      "learning_rate": 4.039203584173933e-05,
      "loss": 1.4787,
      "num_input_tokens_seen": 25765015984,
      "step": 32748
    },
    {
      "epoch": 3.474326331423722,
      "grad_norm": 0.6081920101512891,
      "learning_rate": 4.039148820372523e-05,
      "loss": 1.5355,
      "num_input_tokens_seen": 25765802752,
      "step": 32749
    },
    {
      "epoch": 3.474432420963293,
      "grad_norm": 0.38182662558609076,
      "learning_rate": 4.0390940553817045e-05,
      "loss": 1.3465,
      "num_input_tokens_seen": 25766589536,
      "step": 32750
    },
    {
      "epoch": 3.4745385105028643,
      "grad_norm": 0.5183036163026351,
      "learning_rate": 4.039039289201519e-05,
      "loss": 1.5808,
      "num_input_tokens_seen": 25767376272,
      "step": 32751
    },
    {
      "epoch": 3.474644600042436,
      "grad_norm": 0.49060264309970647,
      "learning_rate": 4.03898452183201e-05,
      "loss": 1.429,
      "num_input_tokens_seen": 25768163088,
      "step": 32752
    },
    {
      "epoch": 3.4747506895820073,
      "grad_norm": 0.46797533336408825,
      "learning_rate": 4.038929753273217e-05,
      "loss": 1.4853,
      "num_input_tokens_seen": 25768949776,
      "step": 32753
    },
    {
      "epoch": 3.4748567791215788,
      "grad_norm": 0.49953325005479426,
      "learning_rate": 4.038874983525186e-05,
      "loss": 1.3732,
      "num_input_tokens_seen": 25769736608,
      "step": 32754
    },
    {
      "epoch": 3.47496286866115,
      "grad_norm": 0.43223566103594807,
      "learning_rate": 4.038820212587957e-05,
      "loss": 1.3948,
      "num_input_tokens_seen": 25770523392,
      "step": 32755
    },
    {
      "epoch": 3.4750689582007213,
      "grad_norm": 0.4760380370571602,
      "learning_rate": 4.038765440461573e-05,
      "loss": 1.4528,
      "num_input_tokens_seen": 25771310128,
      "step": 32756
    },
    {
      "epoch": 3.4751750477402927,
      "grad_norm": 0.5514444958803523,
      "learning_rate": 4.038710667146076e-05,
      "loss": 1.4744,
      "num_input_tokens_seen": 25772096848,
      "step": 32757
    },
    {
      "epoch": 3.475281137279864,
      "grad_norm": 0.43003428230744384,
      "learning_rate": 4.038655892641509e-05,
      "loss": 1.3906,
      "num_input_tokens_seen": 25772883536,
      "step": 32758
    },
    {
      "epoch": 3.4753872268194357,
      "grad_norm": 0.5030304631512974,
      "learning_rate": 4.0386011169479135e-05,
      "loss": 1.4721,
      "num_input_tokens_seen": 25773670352,
      "step": 32759
    },
    {
      "epoch": 3.475493316359007,
      "grad_norm": 0.6123898548915991,
      "learning_rate": 4.038546340065331e-05,
      "loss": 1.4254,
      "num_input_tokens_seen": 25774457152,
      "step": 32760
    },
    {
      "epoch": 3.4755994058985786,
      "grad_norm": 0.42959767843715163,
      "learning_rate": 4.038491561993807e-05,
      "loss": 1.4682,
      "num_input_tokens_seen": 25775243920,
      "step": 32761
    },
    {
      "epoch": 3.4757054954381497,
      "grad_norm": 0.5549204882580202,
      "learning_rate": 4.0384367827333816e-05,
      "loss": 1.3865,
      "num_input_tokens_seen": 25776030704,
      "step": 32762
    },
    {
      "epoch": 3.475811584977721,
      "grad_norm": 0.42889908561724116,
      "learning_rate": 4.038382002284096e-05,
      "loss": 1.5369,
      "num_input_tokens_seen": 25776817424,
      "step": 32763
    },
    {
      "epoch": 3.4759176745172926,
      "grad_norm": 0.4822464051307325,
      "learning_rate": 4.038327220645995e-05,
      "loss": 1.3534,
      "num_input_tokens_seen": 25777604160,
      "step": 32764
    },
    {
      "epoch": 3.476023764056864,
      "grad_norm": 0.45755782996133093,
      "learning_rate": 4.038272437819119e-05,
      "loss": 1.4103,
      "num_input_tokens_seen": 25778390976,
      "step": 32765
    },
    {
      "epoch": 3.4761298535964356,
      "grad_norm": 0.46717105789213303,
      "learning_rate": 4.038217653803513e-05,
      "loss": 1.4848,
      "num_input_tokens_seen": 25779177760,
      "step": 32766
    },
    {
      "epoch": 3.4762359431360066,
      "grad_norm": 0.5831514432023542,
      "learning_rate": 4.038162868599216e-05,
      "loss": 1.5606,
      "num_input_tokens_seen": 25779964480,
      "step": 32767
    },
    {
      "epoch": 3.476342032675578,
      "grad_norm": 0.4790251821340834,
      "learning_rate": 4.0381080822062725e-05,
      "loss": 1.3695,
      "num_input_tokens_seen": 25780751296,
      "step": 32768
    },
    {
      "epoch": 3.4764481222151495,
      "grad_norm": 0.42254163866987215,
      "learning_rate": 4.038053294624724e-05,
      "loss": 1.5219,
      "num_input_tokens_seen": 25781538048,
      "step": 32769
    },
    {
      "epoch": 3.476554211754721,
      "grad_norm": 0.41726336366025973,
      "learning_rate": 4.037998505854613e-05,
      "loss": 1.4738,
      "num_input_tokens_seen": 25782324768,
      "step": 32770
    },
    {
      "epoch": 3.4766603012942925,
      "grad_norm": 0.4299370850279935,
      "learning_rate": 4.037943715895982e-05,
      "loss": 1.5284,
      "num_input_tokens_seen": 25783111472,
      "step": 32771
    },
    {
      "epoch": 3.476766390833864,
      "grad_norm": 0.4814809041334355,
      "learning_rate": 4.0378889247488726e-05,
      "loss": 1.4344,
      "num_input_tokens_seen": 25783898208,
      "step": 32772
    },
    {
      "epoch": 3.476872480373435,
      "grad_norm": 0.4159110527085761,
      "learning_rate": 4.037834132413328e-05,
      "loss": 1.445,
      "num_input_tokens_seen": 25784685088,
      "step": 32773
    },
    {
      "epoch": 3.4769785699130065,
      "grad_norm": 0.3890760365823713,
      "learning_rate": 4.037779338889391e-05,
      "loss": 1.4256,
      "num_input_tokens_seen": 25785471872,
      "step": 32774
    },
    {
      "epoch": 3.477084659452578,
      "grad_norm": 0.4327574102363425,
      "learning_rate": 4.0377245441771037e-05,
      "loss": 1.3597,
      "num_input_tokens_seen": 25786258656,
      "step": 32775
    },
    {
      "epoch": 3.4771907489921494,
      "grad_norm": 0.4033480073457415,
      "learning_rate": 4.037669748276507e-05,
      "loss": 1.4836,
      "num_input_tokens_seen": 25787045424,
      "step": 32776
    },
    {
      "epoch": 3.477296838531721,
      "grad_norm": 0.4106388600925642,
      "learning_rate": 4.037614951187644e-05,
      "loss": 1.4776,
      "num_input_tokens_seen": 25787832064,
      "step": 32777
    },
    {
      "epoch": 3.4774029280712924,
      "grad_norm": 0.49257925099514466,
      "learning_rate": 4.037560152910558e-05,
      "loss": 1.4162,
      "num_input_tokens_seen": 25788618784,
      "step": 32778
    },
    {
      "epoch": 3.4775090176108634,
      "grad_norm": 0.39635668904639815,
      "learning_rate": 4.03750535344529e-05,
      "loss": 1.4277,
      "num_input_tokens_seen": 25789405600,
      "step": 32779
    },
    {
      "epoch": 3.477615107150435,
      "grad_norm": 0.6542482395478052,
      "learning_rate": 4.037450552791883e-05,
      "loss": 1.494,
      "num_input_tokens_seen": 25790192336,
      "step": 32780
    },
    {
      "epoch": 3.4777211966900063,
      "grad_norm": 0.41416976293580154,
      "learning_rate": 4.03739575095038e-05,
      "loss": 1.5055,
      "num_input_tokens_seen": 25790979152,
      "step": 32781
    },
    {
      "epoch": 3.477827286229578,
      "grad_norm": 0.5606906934734752,
      "learning_rate": 4.0373409479208226e-05,
      "loss": 1.4696,
      "num_input_tokens_seen": 25791765968,
      "step": 32782
    },
    {
      "epoch": 3.4779333757691493,
      "grad_norm": 0.44584671303193163,
      "learning_rate": 4.0372861437032525e-05,
      "loss": 1.4264,
      "num_input_tokens_seen": 25792552624,
      "step": 32783
    },
    {
      "epoch": 3.4780394653087203,
      "grad_norm": 0.45862138920937046,
      "learning_rate": 4.037231338297713e-05,
      "loss": 1.4644,
      "num_input_tokens_seen": 25793339328,
      "step": 32784
    },
    {
      "epoch": 3.478145554848292,
      "grad_norm": 0.4649713605744645,
      "learning_rate": 4.037176531704246e-05,
      "loss": 1.5126,
      "num_input_tokens_seen": 25794126112,
      "step": 32785
    },
    {
      "epoch": 3.4782516443878633,
      "grad_norm": 0.4288041102363395,
      "learning_rate": 4.0371217239228956e-05,
      "loss": 1.4423,
      "num_input_tokens_seen": 25794912912,
      "step": 32786
    },
    {
      "epoch": 3.4783577339274347,
      "grad_norm": 0.518581496326514,
      "learning_rate": 4.037066914953701e-05,
      "loss": 1.5678,
      "num_input_tokens_seen": 25795699616,
      "step": 32787
    },
    {
      "epoch": 3.478463823467006,
      "grad_norm": 0.43858104770762046,
      "learning_rate": 4.037012104796707e-05,
      "loss": 1.494,
      "num_input_tokens_seen": 25796486336,
      "step": 32788
    },
    {
      "epoch": 3.4785699130065777,
      "grad_norm": 0.4693598484134526,
      "learning_rate": 4.036957293451954e-05,
      "loss": 1.6035,
      "num_input_tokens_seen": 25797273200,
      "step": 32789
    },
    {
      "epoch": 3.478676002546149,
      "grad_norm": 0.6511143766922399,
      "learning_rate": 4.0369024809194866e-05,
      "loss": 1.6143,
      "num_input_tokens_seen": 25798059920,
      "step": 32790
    },
    {
      "epoch": 3.47878209208572,
      "grad_norm": 0.4234305140722843,
      "learning_rate": 4.036847667199346e-05,
      "loss": 1.5304,
      "num_input_tokens_seen": 25798846688,
      "step": 32791
    },
    {
      "epoch": 3.4788881816252917,
      "grad_norm": 0.4700225885066606,
      "learning_rate": 4.036792852291574e-05,
      "loss": 1.3811,
      "num_input_tokens_seen": 25799633424,
      "step": 32792
    },
    {
      "epoch": 3.478994271164863,
      "grad_norm": 0.5675016400057272,
      "learning_rate": 4.036738036196215e-05,
      "loss": 1.5245,
      "num_input_tokens_seen": 25800420240,
      "step": 32793
    },
    {
      "epoch": 3.4791003607044346,
      "grad_norm": 0.43214308595232087,
      "learning_rate": 4.036683218913309e-05,
      "loss": 1.4661,
      "num_input_tokens_seen": 25801207040,
      "step": 32794
    },
    {
      "epoch": 3.479206450244006,
      "grad_norm": 0.5527112269321932,
      "learning_rate": 4.036628400442899e-05,
      "loss": 1.4329,
      "num_input_tokens_seen": 25801993776,
      "step": 32795
    },
    {
      "epoch": 3.479312539783577,
      "grad_norm": 0.4646703568603895,
      "learning_rate": 4.0365735807850275e-05,
      "loss": 1.3089,
      "num_input_tokens_seen": 25802780624,
      "step": 32796
    },
    {
      "epoch": 3.4794186293231486,
      "grad_norm": 0.4038498192673363,
      "learning_rate": 4.036518759939737e-05,
      "loss": 1.4896,
      "num_input_tokens_seen": 25803567376,
      "step": 32797
    },
    {
      "epoch": 3.47952471886272,
      "grad_norm": 0.43813242170436745,
      "learning_rate": 4.0364639379070706e-05,
      "loss": 1.3795,
      "num_input_tokens_seen": 25804354048,
      "step": 32798
    },
    {
      "epoch": 3.4796308084022916,
      "grad_norm": 0.7100772937326142,
      "learning_rate": 4.03640911468707e-05,
      "loss": 1.4594,
      "num_input_tokens_seen": 25805140832,
      "step": 32799
    },
    {
      "epoch": 3.479736897941863,
      "grad_norm": 0.44928561787160276,
      "learning_rate": 4.036354290279777e-05,
      "loss": 1.485,
      "num_input_tokens_seen": 25805927648,
      "step": 32800
    },
    {
      "epoch": 3.4798429874814345,
      "grad_norm": 0.5693815015246393,
      "learning_rate": 4.0362994646852346e-05,
      "loss": 1.4466,
      "num_input_tokens_seen": 25806714432,
      "step": 32801
    },
    {
      "epoch": 3.479949077021006,
      "grad_norm": 0.5093732946098724,
      "learning_rate": 4.036244637903485e-05,
      "loss": 1.5187,
      "num_input_tokens_seen": 25807501216,
      "step": 32802
    },
    {
      "epoch": 3.480055166560577,
      "grad_norm": 0.48677681784995985,
      "learning_rate": 4.036189809934571e-05,
      "loss": 1.5459,
      "num_input_tokens_seen": 25808287936,
      "step": 32803
    },
    {
      "epoch": 3.4801612561001485,
      "grad_norm": 0.4426309661688871,
      "learning_rate": 4.036134980778534e-05,
      "loss": 1.4929,
      "num_input_tokens_seen": 25809074624,
      "step": 32804
    },
    {
      "epoch": 3.48026734563972,
      "grad_norm": 0.4624165567278003,
      "learning_rate": 4.036080150435417e-05,
      "loss": 1.3728,
      "num_input_tokens_seen": 25809861392,
      "step": 32805
    },
    {
      "epoch": 3.4803734351792914,
      "grad_norm": 0.4163218783457695,
      "learning_rate": 4.036025318905263e-05,
      "loss": 1.4632,
      "num_input_tokens_seen": 25810648176,
      "step": 32806
    },
    {
      "epoch": 3.480479524718863,
      "grad_norm": 0.5166573969524587,
      "learning_rate": 4.0359704861881133e-05,
      "loss": 1.4864,
      "num_input_tokens_seen": 25811434960,
      "step": 32807
    },
    {
      "epoch": 3.480585614258434,
      "grad_norm": 0.3719725454467606,
      "learning_rate": 4.0359156522840104e-05,
      "loss": 1.3996,
      "num_input_tokens_seen": 25812221776,
      "step": 32808
    },
    {
      "epoch": 3.4806917037980054,
      "grad_norm": 0.4147574032875154,
      "learning_rate": 4.035860817192997e-05,
      "loss": 1.3964,
      "num_input_tokens_seen": 25813008560,
      "step": 32809
    },
    {
      "epoch": 3.480797793337577,
      "grad_norm": 0.44211230211897007,
      "learning_rate": 4.0358059809151164e-05,
      "loss": 1.4371,
      "num_input_tokens_seen": 25813795344,
      "step": 32810
    },
    {
      "epoch": 3.4809038828771484,
      "grad_norm": 0.45229561498537024,
      "learning_rate": 4.0357511434504095e-05,
      "loss": 1.5741,
      "num_input_tokens_seen": 25814582064,
      "step": 32811
    },
    {
      "epoch": 3.48100997241672,
      "grad_norm": 0.45622134402035164,
      "learning_rate": 4.0356963047989186e-05,
      "loss": 1.5132,
      "num_input_tokens_seen": 25815368816,
      "step": 32812
    },
    {
      "epoch": 3.481116061956291,
      "grad_norm": 0.3975542870215266,
      "learning_rate": 4.0356414649606864e-05,
      "loss": 1.4774,
      "num_input_tokens_seen": 25816155552,
      "step": 32813
    },
    {
      "epoch": 3.4812221514958623,
      "grad_norm": 0.3774521357734804,
      "learning_rate": 4.035586623935756e-05,
      "loss": 1.4035,
      "num_input_tokens_seen": 25816942304,
      "step": 32814
    },
    {
      "epoch": 3.481328241035434,
      "grad_norm": 0.4809272971363791,
      "learning_rate": 4.03553178172417e-05,
      "loss": 1.3886,
      "num_input_tokens_seen": 25817729104,
      "step": 32815
    },
    {
      "epoch": 3.4814343305750053,
      "grad_norm": 0.38819521928765505,
      "learning_rate": 4.035476938325969e-05,
      "loss": 1.3881,
      "num_input_tokens_seen": 25818515840,
      "step": 32816
    },
    {
      "epoch": 3.4815404201145768,
      "grad_norm": 0.39983612355669895,
      "learning_rate": 4.035422093741197e-05,
      "loss": 1.4375,
      "num_input_tokens_seen": 25819302560,
      "step": 32817
    },
    {
      "epoch": 3.4816465096541482,
      "grad_norm": 0.45733555231686485,
      "learning_rate": 4.035367247969896e-05,
      "loss": 1.4525,
      "num_input_tokens_seen": 25820089264,
      "step": 32818
    },
    {
      "epoch": 3.4817525991937197,
      "grad_norm": 0.44518943066968825,
      "learning_rate": 4.035312401012108e-05,
      "loss": 1.4993,
      "num_input_tokens_seen": 25820876032,
      "step": 32819
    },
    {
      "epoch": 3.4818586887332907,
      "grad_norm": 0.5340863379108455,
      "learning_rate": 4.035257552867876e-05,
      "loss": 1.4333,
      "num_input_tokens_seen": 25821662752,
      "step": 32820
    },
    {
      "epoch": 3.481964778272862,
      "grad_norm": 0.4423111388444171,
      "learning_rate": 4.035202703537242e-05,
      "loss": 1.3747,
      "num_input_tokens_seen": 25822449504,
      "step": 32821
    },
    {
      "epoch": 3.4820708678124337,
      "grad_norm": 0.4623585139340441,
      "learning_rate": 4.035147853020248e-05,
      "loss": 1.5078,
      "num_input_tokens_seen": 25823236240,
      "step": 32822
    },
    {
      "epoch": 3.482176957352005,
      "grad_norm": 0.454647176358603,
      "learning_rate": 4.035093001316937e-05,
      "loss": 1.468,
      "num_input_tokens_seen": 25824022928,
      "step": 32823
    },
    {
      "epoch": 3.4822830468915766,
      "grad_norm": 0.44343438885871284,
      "learning_rate": 4.035038148427351e-05,
      "loss": 1.4568,
      "num_input_tokens_seen": 25824809744,
      "step": 32824
    },
    {
      "epoch": 3.4823891364311477,
      "grad_norm": 0.4369016980690256,
      "learning_rate": 4.0349832943515325e-05,
      "loss": 1.3233,
      "num_input_tokens_seen": 25825596464,
      "step": 32825
    },
    {
      "epoch": 3.482495225970719,
      "grad_norm": 0.5397824241001234,
      "learning_rate": 4.034928439089524e-05,
      "loss": 1.505,
      "num_input_tokens_seen": 25826383152,
      "step": 32826
    },
    {
      "epoch": 3.4826013155102906,
      "grad_norm": 0.4892683001179298,
      "learning_rate": 4.034873582641368e-05,
      "loss": 1.4994,
      "num_input_tokens_seen": 25827169904,
      "step": 32827
    },
    {
      "epoch": 3.482707405049862,
      "grad_norm": 0.46316131675835237,
      "learning_rate": 4.034818725007107e-05,
      "loss": 1.4189,
      "num_input_tokens_seen": 25827956704,
      "step": 32828
    },
    {
      "epoch": 3.4828134945894336,
      "grad_norm": 0.4282105635392867,
      "learning_rate": 4.034763866186783e-05,
      "loss": 1.4696,
      "num_input_tokens_seen": 25828743520,
      "step": 32829
    },
    {
      "epoch": 3.482919584129005,
      "grad_norm": 0.4385827179752036,
      "learning_rate": 4.034709006180438e-05,
      "loss": 1.4532,
      "num_input_tokens_seen": 25829530336,
      "step": 32830
    },
    {
      "epoch": 3.4830256736685765,
      "grad_norm": 0.47812929125717457,
      "learning_rate": 4.0346541449881156e-05,
      "loss": 1.504,
      "num_input_tokens_seen": 25830317072,
      "step": 32831
    },
    {
      "epoch": 3.4831317632081475,
      "grad_norm": 0.4026945317047098,
      "learning_rate": 4.034599282609857e-05,
      "loss": 1.4398,
      "num_input_tokens_seen": 25831103728,
      "step": 32832
    },
    {
      "epoch": 3.483237852747719,
      "grad_norm": 0.47009685921842564,
      "learning_rate": 4.034544419045705e-05,
      "loss": 1.5201,
      "num_input_tokens_seen": 25831890528,
      "step": 32833
    },
    {
      "epoch": 3.4833439422872905,
      "grad_norm": 0.47840056364733663,
      "learning_rate": 4.034489554295702e-05,
      "loss": 1.5932,
      "num_input_tokens_seen": 25832677296,
      "step": 32834
    },
    {
      "epoch": 3.483450031826862,
      "grad_norm": 0.4343601021262069,
      "learning_rate": 4.034434688359891e-05,
      "loss": 1.5563,
      "num_input_tokens_seen": 25833464112,
      "step": 32835
    },
    {
      "epoch": 3.4835561213664334,
      "grad_norm": 0.46081330208615445,
      "learning_rate": 4.0343798212383136e-05,
      "loss": 1.4862,
      "num_input_tokens_seen": 25834250912,
      "step": 32836
    },
    {
      "epoch": 3.4836622109060045,
      "grad_norm": 0.4106349397470375,
      "learning_rate": 4.034324952931013e-05,
      "loss": 1.4366,
      "num_input_tokens_seen": 25835037712,
      "step": 32837
    },
    {
      "epoch": 3.483768300445576,
      "grad_norm": 0.5311682166975141,
      "learning_rate": 4.034270083438031e-05,
      "loss": 1.5184,
      "num_input_tokens_seen": 25835824560,
      "step": 32838
    },
    {
      "epoch": 3.4838743899851474,
      "grad_norm": 0.41258715714783795,
      "learning_rate": 4.034215212759409e-05,
      "loss": 1.4315,
      "num_input_tokens_seen": 25836611392,
      "step": 32839
    },
    {
      "epoch": 3.483980479524719,
      "grad_norm": 0.45534774832564445,
      "learning_rate": 4.034160340895192e-05,
      "loss": 1.5075,
      "num_input_tokens_seen": 25837398224,
      "step": 32840
    },
    {
      "epoch": 3.4840865690642904,
      "grad_norm": 0.40399939076476876,
      "learning_rate": 4.03410546784542e-05,
      "loss": 1.4314,
      "num_input_tokens_seen": 25838185024,
      "step": 32841
    },
    {
      "epoch": 3.484192658603862,
      "grad_norm": 0.44448200128534326,
      "learning_rate": 4.034050593610137e-05,
      "loss": 1.4334,
      "num_input_tokens_seen": 25838971744,
      "step": 32842
    },
    {
      "epoch": 3.484298748143433,
      "grad_norm": 0.45523858561485403,
      "learning_rate": 4.033995718189384e-05,
      "loss": 1.4814,
      "num_input_tokens_seen": 25839758480,
      "step": 32843
    },
    {
      "epoch": 3.4844048376830044,
      "grad_norm": 0.48570491619478223,
      "learning_rate": 4.033940841583204e-05,
      "loss": 1.4407,
      "num_input_tokens_seen": 25840545232,
      "step": 32844
    },
    {
      "epoch": 3.484510927222576,
      "grad_norm": 0.384509989564316,
      "learning_rate": 4.0338859637916405e-05,
      "loss": 1.3292,
      "num_input_tokens_seen": 25841331984,
      "step": 32845
    },
    {
      "epoch": 3.4846170167621473,
      "grad_norm": 0.43573212224915364,
      "learning_rate": 4.033831084814734e-05,
      "loss": 1.4349,
      "num_input_tokens_seen": 25842118688,
      "step": 32846
    },
    {
      "epoch": 3.4847231063017188,
      "grad_norm": 0.5249424862467124,
      "learning_rate": 4.033776204652528e-05,
      "loss": 1.4021,
      "num_input_tokens_seen": 25842905408,
      "step": 32847
    },
    {
      "epoch": 3.4848291958412903,
      "grad_norm": 0.4317978099797848,
      "learning_rate": 4.0337213233050646e-05,
      "loss": 1.5087,
      "num_input_tokens_seen": 25843692128,
      "step": 32848
    },
    {
      "epoch": 3.4849352853808613,
      "grad_norm": 0.5300550865704151,
      "learning_rate": 4.033666440772387e-05,
      "loss": 1.4944,
      "num_input_tokens_seen": 25844478912,
      "step": 32849
    },
    {
      "epoch": 3.4850413749204328,
      "grad_norm": 0.646942231986143,
      "learning_rate": 4.033611557054536e-05,
      "loss": 1.3334,
      "num_input_tokens_seen": 25845265664,
      "step": 32850
    },
    {
      "epoch": 3.4851474644600042,
      "grad_norm": 0.45541619549241696,
      "learning_rate": 4.033556672151556e-05,
      "loss": 1.4788,
      "num_input_tokens_seen": 25846052464,
      "step": 32851
    },
    {
      "epoch": 3.4852535539995757,
      "grad_norm": 0.7024959156488724,
      "learning_rate": 4.0335017860634886e-05,
      "loss": 1.4837,
      "num_input_tokens_seen": 25846839248,
      "step": 32852
    },
    {
      "epoch": 3.485359643539147,
      "grad_norm": 0.5669594257076795,
      "learning_rate": 4.033446898790375e-05,
      "loss": 1.4608,
      "num_input_tokens_seen": 25847625952,
      "step": 32853
    },
    {
      "epoch": 3.485465733078718,
      "grad_norm": 0.631691609071019,
      "learning_rate": 4.033392010332259e-05,
      "loss": 1.3632,
      "num_input_tokens_seen": 25848412768,
      "step": 32854
    },
    {
      "epoch": 3.4855718226182897,
      "grad_norm": 0.7660407416954769,
      "learning_rate": 4.0333371206891826e-05,
      "loss": 1.4399,
      "num_input_tokens_seen": 25849199520,
      "step": 32855
    },
    {
      "epoch": 3.485677912157861,
      "grad_norm": 0.4250341153830804,
      "learning_rate": 4.0332822298611885e-05,
      "loss": 1.5312,
      "num_input_tokens_seen": 25849986288,
      "step": 32856
    },
    {
      "epoch": 3.4857840016974326,
      "grad_norm": 0.8918894258619395,
      "learning_rate": 4.033227337848319e-05,
      "loss": 1.3177,
      "num_input_tokens_seen": 25850773040,
      "step": 32857
    },
    {
      "epoch": 3.485890091237004,
      "grad_norm": 0.43025481679567185,
      "learning_rate": 4.033172444650616e-05,
      "loss": 1.422,
      "num_input_tokens_seen": 25851559824,
      "step": 32858
    },
    {
      "epoch": 3.4859961807765756,
      "grad_norm": 0.6247892773389152,
      "learning_rate": 4.0331175502681226e-05,
      "loss": 1.3299,
      "num_input_tokens_seen": 25852346656,
      "step": 32859
    },
    {
      "epoch": 3.486102270316147,
      "grad_norm": 0.5514430729795385,
      "learning_rate": 4.03306265470088e-05,
      "loss": 1.3436,
      "num_input_tokens_seen": 25853133472,
      "step": 32860
    },
    {
      "epoch": 3.486208359855718,
      "grad_norm": 0.4888373710131422,
      "learning_rate": 4.0330077579489336e-05,
      "loss": 1.5627,
      "num_input_tokens_seen": 25853920352,
      "step": 32861
    },
    {
      "epoch": 3.4863144493952896,
      "grad_norm": 0.6023883278416856,
      "learning_rate": 4.032952860012322e-05,
      "loss": 1.5287,
      "num_input_tokens_seen": 25854707008,
      "step": 32862
    },
    {
      "epoch": 3.486420538934861,
      "grad_norm": 0.5729982418014347,
      "learning_rate": 4.03289796089109e-05,
      "loss": 1.3995,
      "num_input_tokens_seen": 25855493776,
      "step": 32863
    },
    {
      "epoch": 3.4865266284744325,
      "grad_norm": 0.5289521381834535,
      "learning_rate": 4.03284306058528e-05,
      "loss": 1.4724,
      "num_input_tokens_seen": 25856280464,
      "step": 32864
    },
    {
      "epoch": 3.486632718014004,
      "grad_norm": 0.6400097023622457,
      "learning_rate": 4.0327881590949326e-05,
      "loss": 1.4169,
      "num_input_tokens_seen": 25857067152,
      "step": 32865
    },
    {
      "epoch": 3.486738807553575,
      "grad_norm": 0.5634449898989317,
      "learning_rate": 4.0327332564200925e-05,
      "loss": 1.6124,
      "num_input_tokens_seen": 25857853904,
      "step": 32866
    },
    {
      "epoch": 3.4868448970931465,
      "grad_norm": 0.6499171629748999,
      "learning_rate": 4.0326783525608e-05,
      "loss": 1.4358,
      "num_input_tokens_seen": 25858640752,
      "step": 32867
    },
    {
      "epoch": 3.486950986632718,
      "grad_norm": 0.5184613729073354,
      "learning_rate": 4.0326234475170996e-05,
      "loss": 1.4926,
      "num_input_tokens_seen": 25859427472,
      "step": 32868
    },
    {
      "epoch": 3.4870570761722894,
      "grad_norm": 0.4707068044789482,
      "learning_rate": 4.032568541289033e-05,
      "loss": 1.4787,
      "num_input_tokens_seen": 25860214192,
      "step": 32869
    },
    {
      "epoch": 3.487163165711861,
      "grad_norm": 0.5217855987035811,
      "learning_rate": 4.0325136338766426e-05,
      "loss": 1.5373,
      "num_input_tokens_seen": 25861000976,
      "step": 32870
    },
    {
      "epoch": 3.4872692552514324,
      "grad_norm": 0.502187637100162,
      "learning_rate": 4.0324587252799695e-05,
      "loss": 1.492,
      "num_input_tokens_seen": 25861787648,
      "step": 32871
    },
    {
      "epoch": 3.4873753447910034,
      "grad_norm": 0.4242657564328684,
      "learning_rate": 4.0324038154990576e-05,
      "loss": 1.4879,
      "num_input_tokens_seen": 25862574368,
      "step": 32872
    },
    {
      "epoch": 3.487481434330575,
      "grad_norm": 0.4677452797840436,
      "learning_rate": 4.032348904533949e-05,
      "loss": 1.3844,
      "num_input_tokens_seen": 25863361200,
      "step": 32873
    },
    {
      "epoch": 3.4875875238701464,
      "grad_norm": 0.511426356781075,
      "learning_rate": 4.032293992384687e-05,
      "loss": 1.4302,
      "num_input_tokens_seen": 25864148016,
      "step": 32874
    },
    {
      "epoch": 3.487693613409718,
      "grad_norm": 0.4421933719088404,
      "learning_rate": 4.032239079051312e-05,
      "loss": 1.5828,
      "num_input_tokens_seen": 25864934800,
      "step": 32875
    },
    {
      "epoch": 3.4877997029492893,
      "grad_norm": 0.4631183395771192,
      "learning_rate": 4.0321841645338685e-05,
      "loss": 1.4874,
      "num_input_tokens_seen": 25865721632,
      "step": 32876
    },
    {
      "epoch": 3.487905792488861,
      "grad_norm": 0.4377998819312576,
      "learning_rate": 4.032129248832397e-05,
      "loss": 1.5009,
      "num_input_tokens_seen": 25866508368,
      "step": 32877
    },
    {
      "epoch": 3.488011882028432,
      "grad_norm": 0.40194881398967064,
      "learning_rate": 4.0320743319469426e-05,
      "loss": 1.4012,
      "num_input_tokens_seen": 25867295104,
      "step": 32878
    },
    {
      "epoch": 3.4881179715680033,
      "grad_norm": 0.5009557026505573,
      "learning_rate": 4.032019413877545e-05,
      "loss": 1.4863,
      "num_input_tokens_seen": 25868081824,
      "step": 32879
    },
    {
      "epoch": 3.4882240611075748,
      "grad_norm": 0.7421533898356532,
      "learning_rate": 4.0319644946242474e-05,
      "loss": 1.5342,
      "num_input_tokens_seen": 25868868640,
      "step": 32880
    },
    {
      "epoch": 3.4883301506471462,
      "grad_norm": 0.4924618934093426,
      "learning_rate": 4.0319095741870925e-05,
      "loss": 1.5617,
      "num_input_tokens_seen": 25869655328,
      "step": 32881
    },
    {
      "epoch": 3.4884362401867177,
      "grad_norm": 0.667172581874353,
      "learning_rate": 4.031854652566124e-05,
      "loss": 1.5523,
      "num_input_tokens_seen": 25870442080,
      "step": 32882
    },
    {
      "epoch": 3.4885423297262887,
      "grad_norm": 0.5109195399733829,
      "learning_rate": 4.031799729761382e-05,
      "loss": 1.4805,
      "num_input_tokens_seen": 25871228896,
      "step": 32883
    },
    {
      "epoch": 3.4886484192658602,
      "grad_norm": 0.5880179915469345,
      "learning_rate": 4.031744805772911e-05,
      "loss": 1.3235,
      "num_input_tokens_seen": 25872015584,
      "step": 32884
    },
    {
      "epoch": 3.4887545088054317,
      "grad_norm": 0.5718946893637139,
      "learning_rate": 4.031689880600752e-05,
      "loss": 1.3796,
      "num_input_tokens_seen": 25872802384,
      "step": 32885
    },
    {
      "epoch": 3.488860598345003,
      "grad_norm": 0.4772369669078885,
      "learning_rate": 4.031634954244948e-05,
      "loss": 1.445,
      "num_input_tokens_seen": 25873589104,
      "step": 32886
    },
    {
      "epoch": 3.4889666878845746,
      "grad_norm": 0.4477649943883261,
      "learning_rate": 4.031580026705542e-05,
      "loss": 1.46,
      "num_input_tokens_seen": 25874376000,
      "step": 32887
    },
    {
      "epoch": 3.489072777424146,
      "grad_norm": 0.527359061980971,
      "learning_rate": 4.031525097982576e-05,
      "loss": 1.4881,
      "num_input_tokens_seen": 25875162848,
      "step": 32888
    },
    {
      "epoch": 3.4891788669637176,
      "grad_norm": 0.49405658426531424,
      "learning_rate": 4.031470168076091e-05,
      "loss": 1.5231,
      "num_input_tokens_seen": 25875949568,
      "step": 32889
    },
    {
      "epoch": 3.4892849565032886,
      "grad_norm": 0.4134393698452717,
      "learning_rate": 4.0314152369861324e-05,
      "loss": 1.5237,
      "num_input_tokens_seen": 25876736288,
      "step": 32890
    },
    {
      "epoch": 3.48939104604286,
      "grad_norm": 0.5099679738561048,
      "learning_rate": 4.03136030471274e-05,
      "loss": 1.4896,
      "num_input_tokens_seen": 25877523088,
      "step": 32891
    },
    {
      "epoch": 3.4894971355824316,
      "grad_norm": 0.41236652532806756,
      "learning_rate": 4.031305371255958e-05,
      "loss": 1.3798,
      "num_input_tokens_seen": 25878309824,
      "step": 32892
    },
    {
      "epoch": 3.489603225122003,
      "grad_norm": 0.6256854741393209,
      "learning_rate": 4.031250436615828e-05,
      "loss": 1.5819,
      "num_input_tokens_seen": 25879096528,
      "step": 32893
    },
    {
      "epoch": 3.4897093146615745,
      "grad_norm": 0.5140773112963609,
      "learning_rate": 4.031195500792392e-05,
      "loss": 1.5171,
      "num_input_tokens_seen": 25879883264,
      "step": 32894
    },
    {
      "epoch": 3.4898154042011456,
      "grad_norm": 0.5650446635971427,
      "learning_rate": 4.0311405637856936e-05,
      "loss": 1.4418,
      "num_input_tokens_seen": 25880670048,
      "step": 32895
    },
    {
      "epoch": 3.489921493740717,
      "grad_norm": 0.4213807145463679,
      "learning_rate": 4.031085625595774e-05,
      "loss": 1.4428,
      "num_input_tokens_seen": 25881456864,
      "step": 32896
    },
    {
      "epoch": 3.4900275832802885,
      "grad_norm": 0.5261349880319871,
      "learning_rate": 4.031030686222676e-05,
      "loss": 1.4706,
      "num_input_tokens_seen": 25882243648,
      "step": 32897
    },
    {
      "epoch": 3.49013367281986,
      "grad_norm": 0.44574025665970135,
      "learning_rate": 4.0309757456664445e-05,
      "loss": 1.4982,
      "num_input_tokens_seen": 25883030384,
      "step": 32898
    },
    {
      "epoch": 3.4902397623594315,
      "grad_norm": 0.4245279575321966,
      "learning_rate": 4.030920803927118e-05,
      "loss": 1.3198,
      "num_input_tokens_seen": 25883817104,
      "step": 32899
    },
    {
      "epoch": 3.490345851899003,
      "grad_norm": 0.5362577682050574,
      "learning_rate": 4.0308658610047414e-05,
      "loss": 1.5837,
      "num_input_tokens_seen": 25884603856,
      "step": 32900
    },
    {
      "epoch": 3.4904519414385744,
      "grad_norm": 0.4322587700174925,
      "learning_rate": 4.030810916899357e-05,
      "loss": 1.5164,
      "num_input_tokens_seen": 25885390592,
      "step": 32901
    },
    {
      "epoch": 3.4905580309781454,
      "grad_norm": 0.5085887259869047,
      "learning_rate": 4.030755971611007e-05,
      "loss": 1.4634,
      "num_input_tokens_seen": 25886177328,
      "step": 32902
    },
    {
      "epoch": 3.490664120517717,
      "grad_norm": 0.4551613250674511,
      "learning_rate": 4.0307010251397325e-05,
      "loss": 1.4293,
      "num_input_tokens_seen": 25886964128,
      "step": 32903
    },
    {
      "epoch": 3.4907702100572884,
      "grad_norm": 0.5269569495184366,
      "learning_rate": 4.030646077485578e-05,
      "loss": 1.5813,
      "num_input_tokens_seen": 25887750896,
      "step": 32904
    },
    {
      "epoch": 3.49087629959686,
      "grad_norm": 0.4087490663208129,
      "learning_rate": 4.030591128648585e-05,
      "loss": 1.4752,
      "num_input_tokens_seen": 25888537664,
      "step": 32905
    },
    {
      "epoch": 3.4909823891364313,
      "grad_norm": 0.47784354613607916,
      "learning_rate": 4.0305361786287954e-05,
      "loss": 1.4186,
      "num_input_tokens_seen": 25889324416,
      "step": 32906
    },
    {
      "epoch": 3.4910884786760024,
      "grad_norm": 0.4905035062878964,
      "learning_rate": 4.030481227426254e-05,
      "loss": 1.4337,
      "num_input_tokens_seen": 25890111136,
      "step": 32907
    },
    {
      "epoch": 3.491194568215574,
      "grad_norm": 0.4484768956951409,
      "learning_rate": 4.030426275041e-05,
      "loss": 1.6182,
      "num_input_tokens_seen": 25890897840,
      "step": 32908
    },
    {
      "epoch": 3.4913006577551453,
      "grad_norm": 0.4997535044359221,
      "learning_rate": 4.0303713214730774e-05,
      "loss": 1.5091,
      "num_input_tokens_seen": 25891684624,
      "step": 32909
    },
    {
      "epoch": 3.491406747294717,
      "grad_norm": 0.44792637801343876,
      "learning_rate": 4.03031636672253e-05,
      "loss": 1.4859,
      "num_input_tokens_seen": 25892471312,
      "step": 32910
    },
    {
      "epoch": 3.4915128368342883,
      "grad_norm": 0.4129183072654405,
      "learning_rate": 4.030261410789399e-05,
      "loss": 1.3669,
      "num_input_tokens_seen": 25893258064,
      "step": 32911
    },
    {
      "epoch": 3.4916189263738593,
      "grad_norm": 0.46393288294354185,
      "learning_rate": 4.0302064536737263e-05,
      "loss": 1.4714,
      "num_input_tokens_seen": 25894044976,
      "step": 32912
    },
    {
      "epoch": 3.4917250159134308,
      "grad_norm": 0.38884975231982893,
      "learning_rate": 4.030151495375554e-05,
      "loss": 1.4229,
      "num_input_tokens_seen": 25894831760,
      "step": 32913
    },
    {
      "epoch": 3.4918311054530022,
      "grad_norm": 0.3929930806380061,
      "learning_rate": 4.030096535894927e-05,
      "loss": 1.4408,
      "num_input_tokens_seen": 25895618544,
      "step": 32914
    },
    {
      "epoch": 3.4919371949925737,
      "grad_norm": 0.42392327978197425,
      "learning_rate": 4.0300415752318854e-05,
      "loss": 1.4849,
      "num_input_tokens_seen": 25896405184,
      "step": 32915
    },
    {
      "epoch": 3.492043284532145,
      "grad_norm": 0.4410151152967643,
      "learning_rate": 4.029986613386473e-05,
      "loss": 1.5284,
      "num_input_tokens_seen": 25897191936,
      "step": 32916
    },
    {
      "epoch": 3.4921493740717167,
      "grad_norm": 0.43593460309355736,
      "learning_rate": 4.0299316503587324e-05,
      "loss": 1.5618,
      "num_input_tokens_seen": 25897978704,
      "step": 32917
    },
    {
      "epoch": 3.492255463611288,
      "grad_norm": 0.5305229114465053,
      "learning_rate": 4.0298766861487044e-05,
      "loss": 1.5105,
      "num_input_tokens_seen": 25898765488,
      "step": 32918
    },
    {
      "epoch": 3.492361553150859,
      "grad_norm": 0.4211364937844331,
      "learning_rate": 4.029821720756433e-05,
      "loss": 1.4975,
      "num_input_tokens_seen": 25899552384,
      "step": 32919
    },
    {
      "epoch": 3.4924676426904306,
      "grad_norm": 0.4512234772502901,
      "learning_rate": 4.029766754181961e-05,
      "loss": 1.479,
      "num_input_tokens_seen": 25900339104,
      "step": 32920
    },
    {
      "epoch": 3.492573732230002,
      "grad_norm": 0.47076456943017114,
      "learning_rate": 4.0297117864253294e-05,
      "loss": 1.4498,
      "num_input_tokens_seen": 25901125872,
      "step": 32921
    },
    {
      "epoch": 3.4926798217695736,
      "grad_norm": 0.44399317488717144,
      "learning_rate": 4.0296568174865814e-05,
      "loss": 1.4761,
      "num_input_tokens_seen": 25901912768,
      "step": 32922
    },
    {
      "epoch": 3.492785911309145,
      "grad_norm": 0.43702292112072005,
      "learning_rate": 4.0296018473657596e-05,
      "loss": 1.3783,
      "num_input_tokens_seen": 25902699536,
      "step": 32923
    },
    {
      "epoch": 3.492892000848716,
      "grad_norm": 0.41549656288615994,
      "learning_rate": 4.029546876062906e-05,
      "loss": 1.4552,
      "num_input_tokens_seen": 25903486304,
      "step": 32924
    },
    {
      "epoch": 3.4929980903882876,
      "grad_norm": 0.4377009919654875,
      "learning_rate": 4.029491903578064e-05,
      "loss": 1.4827,
      "num_input_tokens_seen": 25904272992,
      "step": 32925
    },
    {
      "epoch": 3.493104179927859,
      "grad_norm": 0.45382334392582796,
      "learning_rate": 4.029436929911276e-05,
      "loss": 1.5495,
      "num_input_tokens_seen": 25905059840,
      "step": 32926
    },
    {
      "epoch": 3.4932102694674305,
      "grad_norm": 0.4483712240105192,
      "learning_rate": 4.0293819550625825e-05,
      "loss": 1.4001,
      "num_input_tokens_seen": 25905846592,
      "step": 32927
    },
    {
      "epoch": 3.493316359007002,
      "grad_norm": 0.510480525050893,
      "learning_rate": 4.029326979032029e-05,
      "loss": 1.4151,
      "num_input_tokens_seen": 25906633376,
      "step": 32928
    },
    {
      "epoch": 3.4934224485465735,
      "grad_norm": 0.3904599867353436,
      "learning_rate": 4.029272001819655e-05,
      "loss": 1.4609,
      "num_input_tokens_seen": 25907420288,
      "step": 32929
    },
    {
      "epoch": 3.493528538086145,
      "grad_norm": 0.45258696825672046,
      "learning_rate": 4.029217023425506e-05,
      "loss": 1.4213,
      "num_input_tokens_seen": 25908206992,
      "step": 32930
    },
    {
      "epoch": 3.493634627625716,
      "grad_norm": 0.44853382007357884,
      "learning_rate": 4.0291620438496225e-05,
      "loss": 1.4957,
      "num_input_tokens_seen": 25908993808,
      "step": 32931
    },
    {
      "epoch": 3.4937407171652874,
      "grad_norm": 0.4269206084195341,
      "learning_rate": 4.029107063092047e-05,
      "loss": 1.4768,
      "num_input_tokens_seen": 25909780544,
      "step": 32932
    },
    {
      "epoch": 3.493846806704859,
      "grad_norm": 0.46153865211031403,
      "learning_rate": 4.029052081152822e-05,
      "loss": 1.3908,
      "num_input_tokens_seen": 25910567296,
      "step": 32933
    },
    {
      "epoch": 3.4939528962444304,
      "grad_norm": 0.5193869806050334,
      "learning_rate": 4.028997098031991e-05,
      "loss": 1.549,
      "num_input_tokens_seen": 25911354064,
      "step": 32934
    },
    {
      "epoch": 3.494058985784002,
      "grad_norm": 0.43290877284947193,
      "learning_rate": 4.028942113729597e-05,
      "loss": 1.4271,
      "num_input_tokens_seen": 25912140816,
      "step": 32935
    },
    {
      "epoch": 3.494165075323573,
      "grad_norm": 0.6071338278249833,
      "learning_rate": 4.02888712824568e-05,
      "loss": 1.4178,
      "num_input_tokens_seen": 25912927520,
      "step": 32936
    },
    {
      "epoch": 3.4942711648631444,
      "grad_norm": 0.5030342564561693,
      "learning_rate": 4.0288321415802845e-05,
      "loss": 1.6371,
      "num_input_tokens_seen": 25913714352,
      "step": 32937
    },
    {
      "epoch": 3.494377254402716,
      "grad_norm": 0.5390397581961318,
      "learning_rate": 4.028777153733452e-05,
      "loss": 1.4199,
      "num_input_tokens_seen": 25914501136,
      "step": 32938
    },
    {
      "epoch": 3.4944833439422873,
      "grad_norm": 0.4747001766241661,
      "learning_rate": 4.0287221647052257e-05,
      "loss": 1.4347,
      "num_input_tokens_seen": 25915287824,
      "step": 32939
    },
    {
      "epoch": 3.494589433481859,
      "grad_norm": 0.4743210940248277,
      "learning_rate": 4.0286671744956474e-05,
      "loss": 1.4475,
      "num_input_tokens_seen": 25916074576,
      "step": 32940
    },
    {
      "epoch": 3.4946955230214303,
      "grad_norm": 0.4694106547027251,
      "learning_rate": 4.02861218310476e-05,
      "loss": 1.3843,
      "num_input_tokens_seen": 25916861408,
      "step": 32941
    },
    {
      "epoch": 3.4948016125610013,
      "grad_norm": 0.46396882820922214,
      "learning_rate": 4.028557190532606e-05,
      "loss": 1.4975,
      "num_input_tokens_seen": 25917648208,
      "step": 32942
    },
    {
      "epoch": 3.4949077021005728,
      "grad_norm": 0.463220709294241,
      "learning_rate": 4.028502196779228e-05,
      "loss": 1.449,
      "num_input_tokens_seen": 25918434928,
      "step": 32943
    },
    {
      "epoch": 3.4950137916401443,
      "grad_norm": 0.44866486227956376,
      "learning_rate": 4.028447201844668e-05,
      "loss": 1.4553,
      "num_input_tokens_seen": 25919221712,
      "step": 32944
    },
    {
      "epoch": 3.4951198811797157,
      "grad_norm": 0.4651180942567765,
      "learning_rate": 4.028392205728969e-05,
      "loss": 1.4075,
      "num_input_tokens_seen": 25920008512,
      "step": 32945
    },
    {
      "epoch": 3.495225970719287,
      "grad_norm": 0.6647743925076768,
      "learning_rate": 4.0283372084321735e-05,
      "loss": 1.5083,
      "num_input_tokens_seen": 25920795376,
      "step": 32946
    },
    {
      "epoch": 3.4953320602588587,
      "grad_norm": 0.43176523030930974,
      "learning_rate": 4.028282209954324e-05,
      "loss": 1.4471,
      "num_input_tokens_seen": 25921582240,
      "step": 32947
    },
    {
      "epoch": 3.4954381497984297,
      "grad_norm": 0.45045674165523836,
      "learning_rate": 4.028227210295463e-05,
      "loss": 1.452,
      "num_input_tokens_seen": 25922369088,
      "step": 32948
    },
    {
      "epoch": 3.495544239338001,
      "grad_norm": 0.47992569368972754,
      "learning_rate": 4.028172209455632e-05,
      "loss": 1.5216,
      "num_input_tokens_seen": 25923156000,
      "step": 32949
    },
    {
      "epoch": 3.4956503288775727,
      "grad_norm": 0.4820264419384305,
      "learning_rate": 4.028117207434875e-05,
      "loss": 1.4142,
      "num_input_tokens_seen": 25923942752,
      "step": 32950
    },
    {
      "epoch": 3.495756418417144,
      "grad_norm": 0.7033654209157831,
      "learning_rate": 4.028062204233234e-05,
      "loss": 1.4911,
      "num_input_tokens_seen": 25924729632,
      "step": 32951
    },
    {
      "epoch": 3.4958625079567156,
      "grad_norm": 0.5011052736683065,
      "learning_rate": 4.0280071998507505e-05,
      "loss": 1.3592,
      "num_input_tokens_seen": 25925516432,
      "step": 32952
    },
    {
      "epoch": 3.4959685974962866,
      "grad_norm": 0.700130640714279,
      "learning_rate": 4.027952194287469e-05,
      "loss": 1.4859,
      "num_input_tokens_seen": 25926303200,
      "step": 32953
    },
    {
      "epoch": 3.496074687035858,
      "grad_norm": 0.41396725759856123,
      "learning_rate": 4.02789718754343e-05,
      "loss": 1.3765,
      "num_input_tokens_seen": 25927089936,
      "step": 32954
    },
    {
      "epoch": 3.4961807765754296,
      "grad_norm": 0.5348671171957865,
      "learning_rate": 4.027842179618678e-05,
      "loss": 1.4125,
      "num_input_tokens_seen": 25927876624,
      "step": 32955
    },
    {
      "epoch": 3.496286866115001,
      "grad_norm": 0.5006457715907305,
      "learning_rate": 4.027787170513253e-05,
      "loss": 1.4651,
      "num_input_tokens_seen": 25928663424,
      "step": 32956
    },
    {
      "epoch": 3.4963929556545725,
      "grad_norm": 0.4508551343747306,
      "learning_rate": 4.0277321602272e-05,
      "loss": 1.4566,
      "num_input_tokens_seen": 25929450224,
      "step": 32957
    },
    {
      "epoch": 3.496499045194144,
      "grad_norm": 0.4609067408230449,
      "learning_rate": 4.0276771487605596e-05,
      "loss": 1.449,
      "num_input_tokens_seen": 25930237008,
      "step": 32958
    },
    {
      "epoch": 3.4966051347337155,
      "grad_norm": 0.501413349419456,
      "learning_rate": 4.027622136113376e-05,
      "loss": 1.3829,
      "num_input_tokens_seen": 25931023856,
      "step": 32959
    },
    {
      "epoch": 3.4967112242732865,
      "grad_norm": 0.43696411881153663,
      "learning_rate": 4.02756712228569e-05,
      "loss": 1.4109,
      "num_input_tokens_seen": 25931810608,
      "step": 32960
    },
    {
      "epoch": 3.496817313812858,
      "grad_norm": 0.38654117593981774,
      "learning_rate": 4.027512107277546e-05,
      "loss": 1.3798,
      "num_input_tokens_seen": 25932597392,
      "step": 32961
    },
    {
      "epoch": 3.4969234033524295,
      "grad_norm": 0.4728234288101639,
      "learning_rate": 4.027457091088984e-05,
      "loss": 1.4352,
      "num_input_tokens_seen": 25933384256,
      "step": 32962
    },
    {
      "epoch": 3.497029492892001,
      "grad_norm": 0.4230721021175731,
      "learning_rate": 4.027402073720049e-05,
      "loss": 1.4666,
      "num_input_tokens_seen": 25934171120,
      "step": 32963
    },
    {
      "epoch": 3.4971355824315724,
      "grad_norm": 0.49350615658606134,
      "learning_rate": 4.027347055170782e-05,
      "loss": 1.4845,
      "num_input_tokens_seen": 25934957824,
      "step": 32964
    },
    {
      "epoch": 3.4972416719711434,
      "grad_norm": 0.45518202419186354,
      "learning_rate": 4.0272920354412266e-05,
      "loss": 1.3907,
      "num_input_tokens_seen": 25935744656,
      "step": 32965
    },
    {
      "epoch": 3.497347761510715,
      "grad_norm": 0.4367499199530635,
      "learning_rate": 4.0272370145314244e-05,
      "loss": 1.4309,
      "num_input_tokens_seen": 25936531440,
      "step": 32966
    },
    {
      "epoch": 3.4974538510502864,
      "grad_norm": 0.46794680002778427,
      "learning_rate": 4.027181992441418e-05,
      "loss": 1.3678,
      "num_input_tokens_seen": 25937318304,
      "step": 32967
    },
    {
      "epoch": 3.497559940589858,
      "grad_norm": 0.4050845027335689,
      "learning_rate": 4.02712696917125e-05,
      "loss": 1.3967,
      "num_input_tokens_seen": 25938105072,
      "step": 32968
    },
    {
      "epoch": 3.4976660301294293,
      "grad_norm": 0.3997810271082945,
      "learning_rate": 4.027071944720964e-05,
      "loss": 1.443,
      "num_input_tokens_seen": 25938891968,
      "step": 32969
    },
    {
      "epoch": 3.497772119669001,
      "grad_norm": 0.42748015612560514,
      "learning_rate": 4.0270169190906e-05,
      "loss": 1.454,
      "num_input_tokens_seen": 25939678704,
      "step": 32970
    },
    {
      "epoch": 3.497878209208572,
      "grad_norm": 0.4191321695006798,
      "learning_rate": 4.0269618922802044e-05,
      "loss": 1.4689,
      "num_input_tokens_seen": 25940465472,
      "step": 32971
    },
    {
      "epoch": 3.4979842987481433,
      "grad_norm": 0.3851754524398899,
      "learning_rate": 4.026906864289816e-05,
      "loss": 1.3325,
      "num_input_tokens_seen": 25941252272,
      "step": 32972
    },
    {
      "epoch": 3.498090388287715,
      "grad_norm": 0.48363619333884433,
      "learning_rate": 4.0268518351194786e-05,
      "loss": 1.5191,
      "num_input_tokens_seen": 25942039056,
      "step": 32973
    },
    {
      "epoch": 3.4981964778272863,
      "grad_norm": 0.4390232376377041,
      "learning_rate": 4.026796804769235e-05,
      "loss": 1.5018,
      "num_input_tokens_seen": 25942825776,
      "step": 32974
    },
    {
      "epoch": 3.4983025673668577,
      "grad_norm": 0.47114113326783985,
      "learning_rate": 4.0267417732391286e-05,
      "loss": 1.4738,
      "num_input_tokens_seen": 25943612560,
      "step": 32975
    },
    {
      "epoch": 3.498408656906429,
      "grad_norm": 0.43182403624221244,
      "learning_rate": 4.0266867405292e-05,
      "loss": 1.4829,
      "num_input_tokens_seen": 25944399344,
      "step": 32976
    },
    {
      "epoch": 3.4985147464460002,
      "grad_norm": 0.44227743994573926,
      "learning_rate": 4.026631706639493e-05,
      "loss": 1.4579,
      "num_input_tokens_seen": 25945186096,
      "step": 32977
    },
    {
      "epoch": 3.4986208359855717,
      "grad_norm": 0.5098392952299844,
      "learning_rate": 4.0265766715700506e-05,
      "loss": 1.5496,
      "num_input_tokens_seen": 25945972832,
      "step": 32978
    },
    {
      "epoch": 3.498726925525143,
      "grad_norm": 0.4462596852553201,
      "learning_rate": 4.026521635320913e-05,
      "loss": 1.4948,
      "num_input_tokens_seen": 25946759552,
      "step": 32979
    },
    {
      "epoch": 3.4988330150647147,
      "grad_norm": 0.5299957962533298,
      "learning_rate": 4.0264665978921254e-05,
      "loss": 1.5659,
      "num_input_tokens_seen": 25947546288,
      "step": 32980
    },
    {
      "epoch": 3.498939104604286,
      "grad_norm": 0.44637253788341547,
      "learning_rate": 4.026411559283729e-05,
      "loss": 1.5037,
      "num_input_tokens_seen": 25948332976,
      "step": 32981
    },
    {
      "epoch": 3.499045194143857,
      "grad_norm": 0.5322021769770426,
      "learning_rate": 4.026356519495766e-05,
      "loss": 1.4315,
      "num_input_tokens_seen": 25949119760,
      "step": 32982
    },
    {
      "epoch": 3.4991512836834286,
      "grad_norm": 0.4467991272411154,
      "learning_rate": 4.026301478528279e-05,
      "loss": 1.4156,
      "num_input_tokens_seen": 25949906528,
      "step": 32983
    },
    {
      "epoch": 3.499257373223,
      "grad_norm": 0.5906450789078561,
      "learning_rate": 4.0262464363813124e-05,
      "loss": 1.5909,
      "num_input_tokens_seen": 25950693344,
      "step": 32984
    },
    {
      "epoch": 3.4993634627625716,
      "grad_norm": 0.5761230089620466,
      "learning_rate": 4.0261913930549065e-05,
      "loss": 1.5393,
      "num_input_tokens_seen": 25951480112,
      "step": 32985
    },
    {
      "epoch": 3.499469552302143,
      "grad_norm": 0.56457019636137,
      "learning_rate": 4.0261363485491055e-05,
      "loss": 1.5447,
      "num_input_tokens_seen": 25952266848,
      "step": 32986
    },
    {
      "epoch": 3.4995756418417145,
      "grad_norm": 0.5207969034918714,
      "learning_rate": 4.026081302863951e-05,
      "loss": 1.519,
      "num_input_tokens_seen": 25953053616,
      "step": 32987
    },
    {
      "epoch": 3.499681731381286,
      "grad_norm": 0.47116863521873215,
      "learning_rate": 4.026026255999484e-05,
      "loss": 1.5435,
      "num_input_tokens_seen": 25953840432,
      "step": 32988
    },
    {
      "epoch": 3.499787820920857,
      "grad_norm": 0.6267726778915652,
      "learning_rate": 4.0259712079557505e-05,
      "loss": 1.5616,
      "num_input_tokens_seen": 25954627120,
      "step": 32989
    },
    {
      "epoch": 3.4998939104604285,
      "grad_norm": 0.5083699821592528,
      "learning_rate": 4.025916158732791e-05,
      "loss": 1.5451,
      "num_input_tokens_seen": 25955413888,
      "step": 32990
    },
    {
      "epoch": 3.5,
      "grad_norm": 0.6431248799140452,
      "learning_rate": 4.0258611083306474e-05,
      "loss": 1.4697,
      "num_input_tokens_seen": 25956200640,
      "step": 32991
    },
    {
      "epoch": 3.5001060895395715,
      "grad_norm": 0.44383550293992513,
      "learning_rate": 4.0258060567493634e-05,
      "loss": 1.4572,
      "num_input_tokens_seen": 25956987584,
      "step": 32992
    },
    {
      "epoch": 3.500212179079143,
      "grad_norm": 0.6898888105996908,
      "learning_rate": 4.025751003988981e-05,
      "loss": 1.6197,
      "num_input_tokens_seen": 25957774320,
      "step": 32993
    },
    {
      "epoch": 3.500318268618714,
      "grad_norm": 0.5485402853881219,
      "learning_rate": 4.0256959500495437e-05,
      "loss": 1.4973,
      "num_input_tokens_seen": 25958561056,
      "step": 32994
    },
    {
      "epoch": 3.5004243581582855,
      "grad_norm": 0.645828959700599,
      "learning_rate": 4.0256408949310934e-05,
      "loss": 1.5192,
      "num_input_tokens_seen": 25959347760,
      "step": 32995
    },
    {
      "epoch": 3.500530447697857,
      "grad_norm": 0.5706589806207593,
      "learning_rate": 4.025585838633672e-05,
      "loss": 1.5308,
      "num_input_tokens_seen": 25960134528,
      "step": 32996
    },
    {
      "epoch": 3.5006365372374284,
      "grad_norm": 0.614863467191132,
      "learning_rate": 4.025530781157323e-05,
      "loss": 1.5156,
      "num_input_tokens_seen": 25960921200,
      "step": 32997
    },
    {
      "epoch": 3.500742626777,
      "grad_norm": 0.5497350641563054,
      "learning_rate": 4.025475722502088e-05,
      "loss": 1.4588,
      "num_input_tokens_seen": 25961707952,
      "step": 32998
    },
    {
      "epoch": 3.5008487163165714,
      "grad_norm": 0.4901868936978712,
      "learning_rate": 4.0254206626680106e-05,
      "loss": 1.5004,
      "num_input_tokens_seen": 25962494688,
      "step": 32999
    },
    {
      "epoch": 3.500954805856143,
      "grad_norm": 0.5659512917348287,
      "learning_rate": 4.025365601655133e-05,
      "loss": 1.3948,
      "num_input_tokens_seen": 25963281456,
      "step": 33000
    },
    {
      "epoch": 3.500954805856143,
      "eval_loss": 1.6114273071289062,
      "eval_runtime": 65.6855,
      "eval_samples_per_second": 45.672,
      "eval_steps_per_second": 0.487,
      "num_input_tokens_seen": 25963281456,
      "step": 33000
    },
    {
      "epoch": 3.501060895395714,
      "grad_norm": 0.5214390188496718,
      "learning_rate": 4.025310539463497e-05,
      "loss": 1.5473,
      "num_input_tokens_seen": 25964068176,
      "step": 33001
    },
    {
      "epoch": 3.5011669849352853,
      "grad_norm": 0.413188693760858,
      "learning_rate": 4.025255476093147e-05,
      "loss": 1.3728,
      "num_input_tokens_seen": 25964854944,
      "step": 33002
    },
    {
      "epoch": 3.501273074474857,
      "grad_norm": 0.47423911708428307,
      "learning_rate": 4.025200411544123e-05,
      "loss": 1.4242,
      "num_input_tokens_seen": 25965641728,
      "step": 33003
    },
    {
      "epoch": 3.5013791640144283,
      "grad_norm": 0.46914120869946735,
      "learning_rate": 4.02514534581647e-05,
      "loss": 1.349,
      "num_input_tokens_seen": 25966428576,
      "step": 33004
    },
    {
      "epoch": 3.5014852535539998,
      "grad_norm": 0.40669085859494414,
      "learning_rate": 4.025090278910229e-05,
      "loss": 1.3815,
      "num_input_tokens_seen": 25967215344,
      "step": 33005
    },
    {
      "epoch": 3.501591343093571,
      "grad_norm": 0.4823452355682156,
      "learning_rate": 4.025035210825442e-05,
      "loss": 1.3804,
      "num_input_tokens_seen": 25968002128,
      "step": 33006
    },
    {
      "epoch": 3.5016974326331423,
      "grad_norm": 0.396678802645212,
      "learning_rate": 4.0249801415621535e-05,
      "loss": 1.4683,
      "num_input_tokens_seen": 25968788880,
      "step": 33007
    },
    {
      "epoch": 3.5018035221727137,
      "grad_norm": 0.4334812782074908,
      "learning_rate": 4.024925071120405e-05,
      "loss": 1.4345,
      "num_input_tokens_seen": 25969575680,
      "step": 33008
    },
    {
      "epoch": 3.501909611712285,
      "grad_norm": 0.41883102978170084,
      "learning_rate": 4.024869999500239e-05,
      "loss": 1.4268,
      "num_input_tokens_seen": 25970362512,
      "step": 33009
    },
    {
      "epoch": 3.5020157012518567,
      "grad_norm": 0.3723752064822658,
      "learning_rate": 4.0248149267016985e-05,
      "loss": 1.2596,
      "num_input_tokens_seen": 25971149232,
      "step": 33010
    },
    {
      "epoch": 3.5021217907914277,
      "grad_norm": 0.4137616156435011,
      "learning_rate": 4.0247598527248254e-05,
      "loss": 1.4082,
      "num_input_tokens_seen": 25971935904,
      "step": 33011
    },
    {
      "epoch": 3.5022278803309996,
      "grad_norm": 0.4525630888828247,
      "learning_rate": 4.024704777569663e-05,
      "loss": 1.5056,
      "num_input_tokens_seen": 25972722656,
      "step": 33012
    },
    {
      "epoch": 3.5023339698705707,
      "grad_norm": 0.45331797577565186,
      "learning_rate": 4.024649701236253e-05,
      "loss": 1.419,
      "num_input_tokens_seen": 25973509392,
      "step": 33013
    },
    {
      "epoch": 3.502440059410142,
      "grad_norm": 0.4073344344735795,
      "learning_rate": 4.024594623724639e-05,
      "loss": 1.4697,
      "num_input_tokens_seen": 25974296192,
      "step": 33014
    },
    {
      "epoch": 3.5025461489497136,
      "grad_norm": 0.4348179357972846,
      "learning_rate": 4.0245395450348626e-05,
      "loss": 1.4222,
      "num_input_tokens_seen": 25975082960,
      "step": 33015
    },
    {
      "epoch": 3.502652238489285,
      "grad_norm": 0.3835715771905451,
      "learning_rate": 4.024484465166967e-05,
      "loss": 1.5315,
      "num_input_tokens_seen": 25975869728,
      "step": 33016
    },
    {
      "epoch": 3.5027583280288566,
      "grad_norm": 0.4520171270905199,
      "learning_rate": 4.0244293841209946e-05,
      "loss": 1.4187,
      "num_input_tokens_seen": 25976656560,
      "step": 33017
    },
    {
      "epoch": 3.5028644175684276,
      "grad_norm": 0.49501996253048636,
      "learning_rate": 4.024374301896988e-05,
      "loss": 1.5604,
      "num_input_tokens_seen": 25977443344,
      "step": 33018
    },
    {
      "epoch": 3.502970507107999,
      "grad_norm": 0.5057910050480519,
      "learning_rate": 4.024319218494989e-05,
      "loss": 1.5109,
      "num_input_tokens_seen": 25978230176,
      "step": 33019
    },
    {
      "epoch": 3.5030765966475705,
      "grad_norm": 0.445153579651694,
      "learning_rate": 4.024264133915041e-05,
      "loss": 1.454,
      "num_input_tokens_seen": 25979017040,
      "step": 33020
    },
    {
      "epoch": 3.503182686187142,
      "grad_norm": 0.4456553631687441,
      "learning_rate": 4.024209048157187e-05,
      "loss": 1.4301,
      "num_input_tokens_seen": 25979803776,
      "step": 33021
    },
    {
      "epoch": 3.5032887757267135,
      "grad_norm": 0.554528193920159,
      "learning_rate": 4.024153961221468e-05,
      "loss": 1.6192,
      "num_input_tokens_seen": 25980590512,
      "step": 33022
    },
    {
      "epoch": 3.5033948652662845,
      "grad_norm": 0.41466767235184027,
      "learning_rate": 4.024098873107929e-05,
      "loss": 1.4937,
      "num_input_tokens_seen": 25981377312,
      "step": 33023
    },
    {
      "epoch": 3.503500954805856,
      "grad_norm": 0.5653694515652447,
      "learning_rate": 4.02404378381661e-05,
      "loss": 1.3752,
      "num_input_tokens_seen": 25982164000,
      "step": 33024
    },
    {
      "epoch": 3.5036070443454275,
      "grad_norm": 0.4702448280561137,
      "learning_rate": 4.023988693347555e-05,
      "loss": 1.564,
      "num_input_tokens_seen": 25982950672,
      "step": 33025
    },
    {
      "epoch": 3.503713133884999,
      "grad_norm": 0.5333489400106907,
      "learning_rate": 4.023933601700806e-05,
      "loss": 1.3155,
      "num_input_tokens_seen": 25983737568,
      "step": 33026
    },
    {
      "epoch": 3.5038192234245704,
      "grad_norm": 0.6260452799652937,
      "learning_rate": 4.023878508876406e-05,
      "loss": 1.5329,
      "num_input_tokens_seen": 25984524320,
      "step": 33027
    },
    {
      "epoch": 3.503925312964142,
      "grad_norm": 0.4039003836761323,
      "learning_rate": 4.023823414874398e-05,
      "loss": 1.4938,
      "num_input_tokens_seen": 25985311040,
      "step": 33028
    },
    {
      "epoch": 3.5040314025037134,
      "grad_norm": 0.6548804389631935,
      "learning_rate": 4.023768319694823e-05,
      "loss": 1.415,
      "num_input_tokens_seen": 25986097872,
      "step": 33029
    },
    {
      "epoch": 3.5041374920432844,
      "grad_norm": 0.4100146126817183,
      "learning_rate": 4.023713223337725e-05,
      "loss": 1.479,
      "num_input_tokens_seen": 25986884640,
      "step": 33030
    },
    {
      "epoch": 3.504243581582856,
      "grad_norm": 0.40825085217234724,
      "learning_rate": 4.023658125803146e-05,
      "loss": 1.42,
      "num_input_tokens_seen": 25987671472,
      "step": 33031
    },
    {
      "epoch": 3.5043496711224273,
      "grad_norm": 0.5074134134647995,
      "learning_rate": 4.023603027091129e-05,
      "loss": 1.462,
      "num_input_tokens_seen": 25988458224,
      "step": 33032
    },
    {
      "epoch": 3.504455760661999,
      "grad_norm": 0.4096171545829096,
      "learning_rate": 4.0235479272017164e-05,
      "loss": 1.4084,
      "num_input_tokens_seen": 25989244976,
      "step": 33033
    },
    {
      "epoch": 3.5045618502015703,
      "grad_norm": 0.3976555022310768,
      "learning_rate": 4.02349282613495e-05,
      "loss": 1.4081,
      "num_input_tokens_seen": 25990031728,
      "step": 33034
    },
    {
      "epoch": 3.5046679397411413,
      "grad_norm": 0.43407560305448917,
      "learning_rate": 4.023437723890873e-05,
      "loss": 1.4181,
      "num_input_tokens_seen": 25990818544,
      "step": 33035
    },
    {
      "epoch": 3.504774029280713,
      "grad_norm": 0.4416247076186142,
      "learning_rate": 4.023382620469529e-05,
      "loss": 1.5097,
      "num_input_tokens_seen": 25991605280,
      "step": 33036
    },
    {
      "epoch": 3.5048801188202843,
      "grad_norm": 0.4384806793289544,
      "learning_rate": 4.023327515870959e-05,
      "loss": 1.5378,
      "num_input_tokens_seen": 25992391984,
      "step": 33037
    },
    {
      "epoch": 3.5049862083598557,
      "grad_norm": 0.44831751754535215,
      "learning_rate": 4.0232724100952054e-05,
      "loss": 1.5736,
      "num_input_tokens_seen": 25993178656,
      "step": 33038
    },
    {
      "epoch": 3.5050922978994272,
      "grad_norm": 0.41500437608402524,
      "learning_rate": 4.023217303142313e-05,
      "loss": 1.587,
      "num_input_tokens_seen": 25993965376,
      "step": 33039
    },
    {
      "epoch": 3.5051983874389983,
      "grad_norm": 0.4303828768700133,
      "learning_rate": 4.023162195012322e-05,
      "loss": 1.4398,
      "num_input_tokens_seen": 25994752144,
      "step": 33040
    },
    {
      "epoch": 3.50530447697857,
      "grad_norm": 0.41866784658262723,
      "learning_rate": 4.0231070857052764e-05,
      "loss": 1.4034,
      "num_input_tokens_seen": 25995539008,
      "step": 33041
    },
    {
      "epoch": 3.505410566518141,
      "grad_norm": 0.3889023009843761,
      "learning_rate": 4.023051975221218e-05,
      "loss": 1.4352,
      "num_input_tokens_seen": 25996325808,
      "step": 33042
    },
    {
      "epoch": 3.5055166560577127,
      "grad_norm": 0.4608277441647644,
      "learning_rate": 4.02299686356019e-05,
      "loss": 1.401,
      "num_input_tokens_seen": 25997112608,
      "step": 33043
    },
    {
      "epoch": 3.505622745597284,
      "grad_norm": 0.49576737625084794,
      "learning_rate": 4.022941750722235e-05,
      "loss": 1.4365,
      "num_input_tokens_seen": 25997899408,
      "step": 33044
    },
    {
      "epoch": 3.5057288351368556,
      "grad_norm": 0.4685303686561711,
      "learning_rate": 4.022886636707395e-05,
      "loss": 1.4276,
      "num_input_tokens_seen": 25998686224,
      "step": 33045
    },
    {
      "epoch": 3.505834924676427,
      "grad_norm": 0.4539111092724558,
      "learning_rate": 4.022831521515713e-05,
      "loss": 1.5182,
      "num_input_tokens_seen": 25999473040,
      "step": 33046
    },
    {
      "epoch": 3.505941014215998,
      "grad_norm": 0.44849225848490476,
      "learning_rate": 4.022776405147231e-05,
      "loss": 1.4075,
      "num_input_tokens_seen": 26000259760,
      "step": 33047
    },
    {
      "epoch": 3.5060471037555696,
      "grad_norm": 0.5269805864993464,
      "learning_rate": 4.0227212876019925e-05,
      "loss": 1.501,
      "num_input_tokens_seen": 26001046496,
      "step": 33048
    },
    {
      "epoch": 3.506153193295141,
      "grad_norm": 0.4635468179397595,
      "learning_rate": 4.0226661688800395e-05,
      "loss": 1.418,
      "num_input_tokens_seen": 26001833168,
      "step": 33049
    },
    {
      "epoch": 3.5062592828347126,
      "grad_norm": 0.4748931322572693,
      "learning_rate": 4.022611048981415e-05,
      "loss": 1.5335,
      "num_input_tokens_seen": 26002619936,
      "step": 33050
    },
    {
      "epoch": 3.506365372374284,
      "grad_norm": 0.42866908222491196,
      "learning_rate": 4.022555927906161e-05,
      "loss": 1.4023,
      "num_input_tokens_seen": 26003406800,
      "step": 33051
    },
    {
      "epoch": 3.506471461913855,
      "grad_norm": 0.5323398558449007,
      "learning_rate": 4.0225008056543214e-05,
      "loss": 1.4784,
      "num_input_tokens_seen": 26004193552,
      "step": 33052
    },
    {
      "epoch": 3.5065775514534265,
      "grad_norm": 0.47838375373591285,
      "learning_rate": 4.022445682225937e-05,
      "loss": 1.4997,
      "num_input_tokens_seen": 26004980320,
      "step": 33053
    },
    {
      "epoch": 3.506683640992998,
      "grad_norm": 0.4679211363798971,
      "learning_rate": 4.022390557621051e-05,
      "loss": 1.432,
      "num_input_tokens_seen": 26005767024,
      "step": 33054
    },
    {
      "epoch": 3.5067897305325695,
      "grad_norm": 0.4859022140392333,
      "learning_rate": 4.022335431839707e-05,
      "loss": 1.4081,
      "num_input_tokens_seen": 26006553792,
      "step": 33055
    },
    {
      "epoch": 3.506895820072141,
      "grad_norm": 0.4658783971022373,
      "learning_rate": 4.022280304881946e-05,
      "loss": 1.545,
      "num_input_tokens_seen": 26007340528,
      "step": 33056
    },
    {
      "epoch": 3.5070019096117124,
      "grad_norm": 0.4639274656175755,
      "learning_rate": 4.0222251767478124e-05,
      "loss": 1.4669,
      "num_input_tokens_seen": 26008127280,
      "step": 33057
    },
    {
      "epoch": 3.507107999151284,
      "grad_norm": 0.47451912648495176,
      "learning_rate": 4.022170047437347e-05,
      "loss": 1.5286,
      "num_input_tokens_seen": 26008914096,
      "step": 33058
    },
    {
      "epoch": 3.507214088690855,
      "grad_norm": 0.47627118371127375,
      "learning_rate": 4.022114916950594e-05,
      "loss": 1.5087,
      "num_input_tokens_seen": 26009700864,
      "step": 33059
    },
    {
      "epoch": 3.5073201782304264,
      "grad_norm": 0.4561968229044717,
      "learning_rate": 4.022059785287595e-05,
      "loss": 1.448,
      "num_input_tokens_seen": 26010487584,
      "step": 33060
    },
    {
      "epoch": 3.507426267769998,
      "grad_norm": 0.4345218124206127,
      "learning_rate": 4.022004652448392e-05,
      "loss": 1.4604,
      "num_input_tokens_seen": 26011274368,
      "step": 33061
    },
    {
      "epoch": 3.5075323573095694,
      "grad_norm": 0.40762447484952735,
      "learning_rate": 4.021949518433029e-05,
      "loss": 1.3181,
      "num_input_tokens_seen": 26012061216,
      "step": 33062
    },
    {
      "epoch": 3.507638446849141,
      "grad_norm": 0.43266936664507183,
      "learning_rate": 4.021894383241549e-05,
      "loss": 1.4355,
      "num_input_tokens_seen": 26012848000,
      "step": 33063
    },
    {
      "epoch": 3.507744536388712,
      "grad_norm": 0.44331386317981514,
      "learning_rate": 4.021839246873993e-05,
      "loss": 1.4355,
      "num_input_tokens_seen": 26013634832,
      "step": 33064
    },
    {
      "epoch": 3.5078506259282833,
      "grad_norm": 0.4774479087864568,
      "learning_rate": 4.021784109330404e-05,
      "loss": 1.5555,
      "num_input_tokens_seen": 26014421568,
      "step": 33065
    },
    {
      "epoch": 3.507956715467855,
      "grad_norm": 0.5112336086254977,
      "learning_rate": 4.021728970610825e-05,
      "loss": 1.4455,
      "num_input_tokens_seen": 26015208464,
      "step": 33066
    },
    {
      "epoch": 3.5080628050074263,
      "grad_norm": 0.4486200775745959,
      "learning_rate": 4.021673830715299e-05,
      "loss": 1.5772,
      "num_input_tokens_seen": 26015995280,
      "step": 33067
    },
    {
      "epoch": 3.5081688945469978,
      "grad_norm": 0.5151842406503021,
      "learning_rate": 4.0216186896438676e-05,
      "loss": 1.3835,
      "num_input_tokens_seen": 26016782064,
      "step": 33068
    },
    {
      "epoch": 3.508274984086569,
      "grad_norm": 0.4201083656449668,
      "learning_rate": 4.021563547396574e-05,
      "loss": 1.4338,
      "num_input_tokens_seen": 26017568800,
      "step": 33069
    },
    {
      "epoch": 3.5083810736261407,
      "grad_norm": 0.4166265054937741,
      "learning_rate": 4.021508403973461e-05,
      "loss": 1.3253,
      "num_input_tokens_seen": 26018355552,
      "step": 33070
    },
    {
      "epoch": 3.5084871631657117,
      "grad_norm": 0.385273456075017,
      "learning_rate": 4.02145325937457e-05,
      "loss": 1.4105,
      "num_input_tokens_seen": 26019142320,
      "step": 33071
    },
    {
      "epoch": 3.508593252705283,
      "grad_norm": 0.4321884629039733,
      "learning_rate": 4.0213981135999454e-05,
      "loss": 1.4542,
      "num_input_tokens_seen": 26019929008,
      "step": 33072
    },
    {
      "epoch": 3.5086993422448547,
      "grad_norm": 0.5220781985689863,
      "learning_rate": 4.021342966649629e-05,
      "loss": 1.4169,
      "num_input_tokens_seen": 26020715824,
      "step": 33073
    },
    {
      "epoch": 3.508805431784426,
      "grad_norm": 0.4514922168261064,
      "learning_rate": 4.0212878185236635e-05,
      "loss": 1.5333,
      "num_input_tokens_seen": 26021502576,
      "step": 33074
    },
    {
      "epoch": 3.5089115213239976,
      "grad_norm": 0.4438511715387856,
      "learning_rate": 4.021232669222091e-05,
      "loss": 1.4731,
      "num_input_tokens_seen": 26022289360,
      "step": 33075
    },
    {
      "epoch": 3.5090176108635687,
      "grad_norm": 0.6706754658049253,
      "learning_rate": 4.021177518744955e-05,
      "loss": 1.4757,
      "num_input_tokens_seen": 26023076192,
      "step": 33076
    },
    {
      "epoch": 3.50912370040314,
      "grad_norm": 0.45513208671190447,
      "learning_rate": 4.021122367092297e-05,
      "loss": 1.6274,
      "num_input_tokens_seen": 26023863088,
      "step": 33077
    },
    {
      "epoch": 3.5092297899427116,
      "grad_norm": 0.4299405068198562,
      "learning_rate": 4.02106721426416e-05,
      "loss": 1.4415,
      "num_input_tokens_seen": 26024649824,
      "step": 33078
    },
    {
      "epoch": 3.509335879482283,
      "grad_norm": 0.4845821658824766,
      "learning_rate": 4.021012060260588e-05,
      "loss": 1.535,
      "num_input_tokens_seen": 26025436560,
      "step": 33079
    },
    {
      "epoch": 3.5094419690218546,
      "grad_norm": 0.5008024147731912,
      "learning_rate": 4.020956905081622e-05,
      "loss": 1.5753,
      "num_input_tokens_seen": 26026223280,
      "step": 33080
    },
    {
      "epoch": 3.5095480585614256,
      "grad_norm": 0.4704278781384438,
      "learning_rate": 4.020901748727305e-05,
      "loss": 1.5228,
      "num_input_tokens_seen": 26027010096,
      "step": 33081
    },
    {
      "epoch": 3.5096541481009975,
      "grad_norm": 0.5160296676941136,
      "learning_rate": 4.0208465911976804e-05,
      "loss": 1.5013,
      "num_input_tokens_seen": 26027796864,
      "step": 33082
    },
    {
      "epoch": 3.5097602376405685,
      "grad_norm": 0.41622465947660453,
      "learning_rate": 4.02079143249279e-05,
      "loss": 1.38,
      "num_input_tokens_seen": 26028583696,
      "step": 33083
    },
    {
      "epoch": 3.50986632718014,
      "grad_norm": 0.4447340702860479,
      "learning_rate": 4.020736272612676e-05,
      "loss": 1.4393,
      "num_input_tokens_seen": 26029370496,
      "step": 33084
    },
    {
      "epoch": 3.5099724167197115,
      "grad_norm": 0.43246284223342696,
      "learning_rate": 4.0206811115573816e-05,
      "loss": 1.4848,
      "num_input_tokens_seen": 26030157216,
      "step": 33085
    },
    {
      "epoch": 3.510078506259283,
      "grad_norm": 0.518292434011343,
      "learning_rate": 4.02062594932695e-05,
      "loss": 1.506,
      "num_input_tokens_seen": 26030943984,
      "step": 33086
    },
    {
      "epoch": 3.5101845957988544,
      "grad_norm": 0.4241367350746488,
      "learning_rate": 4.020570785921422e-05,
      "loss": 1.5628,
      "num_input_tokens_seen": 26031730736,
      "step": 33087
    },
    {
      "epoch": 3.5102906853384255,
      "grad_norm": 0.4865936845476747,
      "learning_rate": 4.020515621340843e-05,
      "loss": 1.5384,
      "num_input_tokens_seen": 26032517440,
      "step": 33088
    },
    {
      "epoch": 3.510396774877997,
      "grad_norm": 0.5904336172884881,
      "learning_rate": 4.0204604555852546e-05,
      "loss": 1.4072,
      "num_input_tokens_seen": 26033304288,
      "step": 33089
    },
    {
      "epoch": 3.5105028644175684,
      "grad_norm": 0.4463221291739624,
      "learning_rate": 4.020405288654697e-05,
      "loss": 1.4745,
      "num_input_tokens_seen": 26034091088,
      "step": 33090
    },
    {
      "epoch": 3.51060895395714,
      "grad_norm": 0.7553224551102653,
      "learning_rate": 4.020350120549216e-05,
      "loss": 1.5076,
      "num_input_tokens_seen": 26034877792,
      "step": 33091
    },
    {
      "epoch": 3.5107150434967114,
      "grad_norm": 0.4023236234918593,
      "learning_rate": 4.020294951268853e-05,
      "loss": 1.389,
      "num_input_tokens_seen": 26035664544,
      "step": 33092
    },
    {
      "epoch": 3.5108211330362824,
      "grad_norm": 0.5126543286282863,
      "learning_rate": 4.020239780813651e-05,
      "loss": 1.4597,
      "num_input_tokens_seen": 26036451264,
      "step": 33093
    },
    {
      "epoch": 3.510927222575854,
      "grad_norm": 0.5260940621771053,
      "learning_rate": 4.0201846091836516e-05,
      "loss": 1.4534,
      "num_input_tokens_seen": 26037238032,
      "step": 33094
    },
    {
      "epoch": 3.5110333121154254,
      "grad_norm": 0.5318371504833954,
      "learning_rate": 4.020129436378899e-05,
      "loss": 1.4519,
      "num_input_tokens_seen": 26038024896,
      "step": 33095
    },
    {
      "epoch": 3.511139401654997,
      "grad_norm": 0.38229127109766115,
      "learning_rate": 4.020074262399434e-05,
      "loss": 1.2602,
      "num_input_tokens_seen": 26038811808,
      "step": 33096
    },
    {
      "epoch": 3.5112454911945683,
      "grad_norm": 0.3918536065145978,
      "learning_rate": 4.0200190872453003e-05,
      "loss": 1.4563,
      "num_input_tokens_seen": 26039598544,
      "step": 33097
    },
    {
      "epoch": 3.5113515807341398,
      "grad_norm": 0.5550644112266857,
      "learning_rate": 4.019963910916541e-05,
      "loss": 1.4778,
      "num_input_tokens_seen": 26040385312,
      "step": 33098
    },
    {
      "epoch": 3.5114576702737113,
      "grad_norm": 0.49369376129320713,
      "learning_rate": 4.019908733413198e-05,
      "loss": 1.4358,
      "num_input_tokens_seen": 26041172128,
      "step": 33099
    },
    {
      "epoch": 3.5115637598132823,
      "grad_norm": 0.5209531247722908,
      "learning_rate": 4.0198535547353145e-05,
      "loss": 1.48,
      "num_input_tokens_seen": 26041958928,
      "step": 33100
    },
    {
      "epoch": 3.5116698493528538,
      "grad_norm": 0.4807478913450433,
      "learning_rate": 4.019798374882931e-05,
      "loss": 1.4342,
      "num_input_tokens_seen": 26042745728,
      "step": 33101
    },
    {
      "epoch": 3.5117759388924252,
      "grad_norm": 0.43988467778875656,
      "learning_rate": 4.019743193856094e-05,
      "loss": 1.5093,
      "num_input_tokens_seen": 26043532480,
      "step": 33102
    },
    {
      "epoch": 3.5118820284319967,
      "grad_norm": 0.4725774645185506,
      "learning_rate": 4.0196880116548433e-05,
      "loss": 1.5521,
      "num_input_tokens_seen": 26044319280,
      "step": 33103
    },
    {
      "epoch": 3.511988117971568,
      "grad_norm": 0.45680870485834835,
      "learning_rate": 4.0196328282792226e-05,
      "loss": 1.5287,
      "num_input_tokens_seen": 26045106080,
      "step": 33104
    },
    {
      "epoch": 3.512094207511139,
      "grad_norm": 0.4000114234344226,
      "learning_rate": 4.019577643729274e-05,
      "loss": 1.3673,
      "num_input_tokens_seen": 26045892816,
      "step": 33105
    },
    {
      "epoch": 3.5122002970507107,
      "grad_norm": 0.5708214356724246,
      "learning_rate": 4.019522458005041e-05,
      "loss": 1.3898,
      "num_input_tokens_seen": 26046679664,
      "step": 33106
    },
    {
      "epoch": 3.512306386590282,
      "grad_norm": 0.42515027396456695,
      "learning_rate": 4.019467271106564e-05,
      "loss": 1.4786,
      "num_input_tokens_seen": 26047466368,
      "step": 33107
    },
    {
      "epoch": 3.5124124761298536,
      "grad_norm": 0.5367853460948315,
      "learning_rate": 4.019412083033888e-05,
      "loss": 1.46,
      "num_input_tokens_seen": 26048253056,
      "step": 33108
    },
    {
      "epoch": 3.512518565669425,
      "grad_norm": 0.46026988862823703,
      "learning_rate": 4.019356893787055e-05,
      "loss": 1.4075,
      "num_input_tokens_seen": 26049039856,
      "step": 33109
    },
    {
      "epoch": 3.512624655208996,
      "grad_norm": 0.6121338793815128,
      "learning_rate": 4.019301703366108e-05,
      "loss": 1.5704,
      "num_input_tokens_seen": 26049826592,
      "step": 33110
    },
    {
      "epoch": 3.512730744748568,
      "grad_norm": 0.575749796698696,
      "learning_rate": 4.019246511771089e-05,
      "loss": 1.5132,
      "num_input_tokens_seen": 26050613408,
      "step": 33111
    },
    {
      "epoch": 3.512836834288139,
      "grad_norm": 0.536936560741842,
      "learning_rate": 4.0191913190020416e-05,
      "loss": 1.4411,
      "num_input_tokens_seen": 26051400224,
      "step": 33112
    },
    {
      "epoch": 3.5129429238277106,
      "grad_norm": 0.5856885819023768,
      "learning_rate": 4.0191361250590065e-05,
      "loss": 1.4446,
      "num_input_tokens_seen": 26052186928,
      "step": 33113
    },
    {
      "epoch": 3.513049013367282,
      "grad_norm": 0.48077208862952014,
      "learning_rate": 4.0190809299420285e-05,
      "loss": 1.4032,
      "num_input_tokens_seen": 26052973744,
      "step": 33114
    },
    {
      "epoch": 3.5131551029068535,
      "grad_norm": 0.7062306251063888,
      "learning_rate": 4.019025733651148e-05,
      "loss": 1.5497,
      "num_input_tokens_seen": 26053760544,
      "step": 33115
    },
    {
      "epoch": 3.513261192446425,
      "grad_norm": 0.4810011214555731,
      "learning_rate": 4.01897053618641e-05,
      "loss": 1.4522,
      "num_input_tokens_seen": 26054547312,
      "step": 33116
    },
    {
      "epoch": 3.513367281985996,
      "grad_norm": 0.6320218118426172,
      "learning_rate": 4.018915337547856e-05,
      "loss": 1.5404,
      "num_input_tokens_seen": 26055334080,
      "step": 33117
    },
    {
      "epoch": 3.5134733715255675,
      "grad_norm": 0.4956649357950251,
      "learning_rate": 4.018860137735529e-05,
      "loss": 1.3967,
      "num_input_tokens_seen": 26056120784,
      "step": 33118
    },
    {
      "epoch": 3.513579461065139,
      "grad_norm": 0.5352563422083322,
      "learning_rate": 4.0188049367494713e-05,
      "loss": 1.5994,
      "num_input_tokens_seen": 26056907488,
      "step": 33119
    },
    {
      "epoch": 3.5136855506047104,
      "grad_norm": 0.6666215755840063,
      "learning_rate": 4.0187497345897254e-05,
      "loss": 1.4933,
      "num_input_tokens_seen": 26057694208,
      "step": 33120
    },
    {
      "epoch": 3.513791640144282,
      "grad_norm": 0.5151969557327827,
      "learning_rate": 4.018694531256335e-05,
      "loss": 1.4117,
      "num_input_tokens_seen": 26058480976,
      "step": 33121
    },
    {
      "epoch": 3.513897729683853,
      "grad_norm": 0.7584760844555025,
      "learning_rate": 4.018639326749341e-05,
      "loss": 1.5657,
      "num_input_tokens_seen": 26059267696,
      "step": 33122
    },
    {
      "epoch": 3.5140038192234244,
      "grad_norm": 0.49197165887016475,
      "learning_rate": 4.018584121068788e-05,
      "loss": 1.4747,
      "num_input_tokens_seen": 26060054448,
      "step": 33123
    },
    {
      "epoch": 3.514109908762996,
      "grad_norm": 0.5488893189661836,
      "learning_rate": 4.018528914214718e-05,
      "loss": 1.5492,
      "num_input_tokens_seen": 26060841168,
      "step": 33124
    },
    {
      "epoch": 3.5142159983025674,
      "grad_norm": 0.5750217401007021,
      "learning_rate": 4.018473706187172e-05,
      "loss": 1.3874,
      "num_input_tokens_seen": 26061627872,
      "step": 33125
    },
    {
      "epoch": 3.514322087842139,
      "grad_norm": 0.5085724471444125,
      "learning_rate": 4.018418496986195e-05,
      "loss": 1.4142,
      "num_input_tokens_seen": 26062414656,
      "step": 33126
    },
    {
      "epoch": 3.5144281773817103,
      "grad_norm": 0.44192336775640906,
      "learning_rate": 4.018363286611829e-05,
      "loss": 1.5324,
      "num_input_tokens_seen": 26063201424,
      "step": 33127
    },
    {
      "epoch": 3.514534266921282,
      "grad_norm": 0.5264020911631427,
      "learning_rate": 4.018308075064116e-05,
      "loss": 1.4488,
      "num_input_tokens_seen": 26063988112,
      "step": 33128
    },
    {
      "epoch": 3.514640356460853,
      "grad_norm": 0.4434014329765717,
      "learning_rate": 4.018252862343098e-05,
      "loss": 1.2856,
      "num_input_tokens_seen": 26064774928,
      "step": 33129
    },
    {
      "epoch": 3.5147464460004243,
      "grad_norm": 0.546774561024293,
      "learning_rate": 4.0181976484488206e-05,
      "loss": 1.4803,
      "num_input_tokens_seen": 26065561648,
      "step": 33130
    },
    {
      "epoch": 3.5148525355399958,
      "grad_norm": 0.41359590589809486,
      "learning_rate": 4.018142433381323e-05,
      "loss": 1.5188,
      "num_input_tokens_seen": 26066348432,
      "step": 33131
    },
    {
      "epoch": 3.5149586250795672,
      "grad_norm": 0.4420946938763227,
      "learning_rate": 4.0180872171406506e-05,
      "loss": 1.4554,
      "num_input_tokens_seen": 26067135152,
      "step": 33132
    },
    {
      "epoch": 3.5150647146191387,
      "grad_norm": 0.42802016715719876,
      "learning_rate": 4.018031999726845e-05,
      "loss": 1.4971,
      "num_input_tokens_seen": 26067921904,
      "step": 33133
    },
    {
      "epoch": 3.5151708041587097,
      "grad_norm": 0.4485144025794112,
      "learning_rate": 4.0179767811399485e-05,
      "loss": 1.4462,
      "num_input_tokens_seen": 26068708672,
      "step": 33134
    },
    {
      "epoch": 3.5152768936982812,
      "grad_norm": 0.45226267536764186,
      "learning_rate": 4.017921561380004e-05,
      "loss": 1.5122,
      "num_input_tokens_seen": 26069495440,
      "step": 33135
    },
    {
      "epoch": 3.5153829832378527,
      "grad_norm": 0.5120356829154095,
      "learning_rate": 4.017866340447054e-05,
      "loss": 1.4732,
      "num_input_tokens_seen": 26070282192,
      "step": 33136
    },
    {
      "epoch": 3.515489072777424,
      "grad_norm": 0.4256259540273296,
      "learning_rate": 4.0178111183411416e-05,
      "loss": 1.4244,
      "num_input_tokens_seen": 26071068976,
      "step": 33137
    },
    {
      "epoch": 3.5155951623169956,
      "grad_norm": 0.4915191705681473,
      "learning_rate": 4.0177558950623096e-05,
      "loss": 1.5908,
      "num_input_tokens_seen": 26071855776,
      "step": 33138
    },
    {
      "epoch": 3.5157012518565667,
      "grad_norm": 0.44704566110965177,
      "learning_rate": 4.0177006706106e-05,
      "loss": 1.4326,
      "num_input_tokens_seen": 26072642592,
      "step": 33139
    },
    {
      "epoch": 3.5158073413961386,
      "grad_norm": 0.4435568487467748,
      "learning_rate": 4.017645444986056e-05,
      "loss": 1.4542,
      "num_input_tokens_seen": 26073429488,
      "step": 33140
    },
    {
      "epoch": 3.5159134309357096,
      "grad_norm": 0.39930776210352825,
      "learning_rate": 4.01759021818872e-05,
      "loss": 1.4081,
      "num_input_tokens_seen": 26074216288,
      "step": 33141
    },
    {
      "epoch": 3.516019520475281,
      "grad_norm": 0.4251206048698919,
      "learning_rate": 4.0175349902186355e-05,
      "loss": 1.4613,
      "num_input_tokens_seen": 26075003072,
      "step": 33142
    },
    {
      "epoch": 3.5161256100148526,
      "grad_norm": 0.40873967554935864,
      "learning_rate": 4.017479761075844e-05,
      "loss": 1.4728,
      "num_input_tokens_seen": 26075789856,
      "step": 33143
    },
    {
      "epoch": 3.516231699554424,
      "grad_norm": 0.39881932688220556,
      "learning_rate": 4.0174245307603886e-05,
      "loss": 1.4578,
      "num_input_tokens_seen": 26076576672,
      "step": 33144
    },
    {
      "epoch": 3.5163377890939955,
      "grad_norm": 0.43633393288630395,
      "learning_rate": 4.017369299272312e-05,
      "loss": 1.5233,
      "num_input_tokens_seen": 26077363344,
      "step": 33145
    },
    {
      "epoch": 3.5164438786335666,
      "grad_norm": 0.4983776944901149,
      "learning_rate": 4.017314066611657e-05,
      "loss": 1.4755,
      "num_input_tokens_seen": 26078150032,
      "step": 33146
    },
    {
      "epoch": 3.516549968173138,
      "grad_norm": 0.4641468908920871,
      "learning_rate": 4.0172588327784664e-05,
      "loss": 1.3613,
      "num_input_tokens_seen": 26078936832,
      "step": 33147
    },
    {
      "epoch": 3.5166560577127095,
      "grad_norm": 0.5036960571073078,
      "learning_rate": 4.017203597772782e-05,
      "loss": 1.5074,
      "num_input_tokens_seen": 26079723584,
      "step": 33148
    },
    {
      "epoch": 3.516762147252281,
      "grad_norm": 0.4527133273038058,
      "learning_rate": 4.017148361594648e-05,
      "loss": 1.3911,
      "num_input_tokens_seen": 26080510384,
      "step": 33149
    },
    {
      "epoch": 3.5168682367918525,
      "grad_norm": 0.4479887987344183,
      "learning_rate": 4.017093124244105e-05,
      "loss": 1.45,
      "num_input_tokens_seen": 26081297136,
      "step": 33150
    },
    {
      "epoch": 3.5169743263314235,
      "grad_norm": 0.42939908853364717,
      "learning_rate": 4.017037885721199e-05,
      "loss": 1.5151,
      "num_input_tokens_seen": 26082083936,
      "step": 33151
    },
    {
      "epoch": 3.517080415870995,
      "grad_norm": 0.4444905695340276,
      "learning_rate": 4.016982646025969e-05,
      "loss": 1.5299,
      "num_input_tokens_seen": 26082870624,
      "step": 33152
    },
    {
      "epoch": 3.5171865054105664,
      "grad_norm": 0.4624054094061957,
      "learning_rate": 4.01692740515846e-05,
      "loss": 1.4112,
      "num_input_tokens_seen": 26083657344,
      "step": 33153
    },
    {
      "epoch": 3.517292594950138,
      "grad_norm": 0.4379131429000432,
      "learning_rate": 4.016872163118714e-05,
      "loss": 1.4207,
      "num_input_tokens_seen": 26084444160,
      "step": 33154
    },
    {
      "epoch": 3.5173986844897094,
      "grad_norm": 0.5034926330866107,
      "learning_rate": 4.016816919906773e-05,
      "loss": 1.4547,
      "num_input_tokens_seen": 26085230928,
      "step": 33155
    },
    {
      "epoch": 3.517504774029281,
      "grad_norm": 0.4895469417695134,
      "learning_rate": 4.016761675522681e-05,
      "loss": 1.5209,
      "num_input_tokens_seen": 26086017712,
      "step": 33156
    },
    {
      "epoch": 3.5176108635688523,
      "grad_norm": 0.4317427733295487,
      "learning_rate": 4.0167064299664805e-05,
      "loss": 1.4834,
      "num_input_tokens_seen": 26086804496,
      "step": 33157
    },
    {
      "epoch": 3.5177169531084234,
      "grad_norm": 0.4104573490086635,
      "learning_rate": 4.0166511832382136e-05,
      "loss": 1.3377,
      "num_input_tokens_seen": 26087591280,
      "step": 33158
    },
    {
      "epoch": 3.517823042647995,
      "grad_norm": 0.47882419055928244,
      "learning_rate": 4.016595935337922e-05,
      "loss": 1.3653,
      "num_input_tokens_seen": 26088378144,
      "step": 33159
    },
    {
      "epoch": 3.5179291321875663,
      "grad_norm": 0.432439364727693,
      "learning_rate": 4.016540686265651e-05,
      "loss": 1.365,
      "num_input_tokens_seen": 26089164928,
      "step": 33160
    },
    {
      "epoch": 3.518035221727138,
      "grad_norm": 0.4355331429254947,
      "learning_rate": 4.016485436021441e-05,
      "loss": 1.5095,
      "num_input_tokens_seen": 26089951776,
      "step": 33161
    },
    {
      "epoch": 3.5181413112667093,
      "grad_norm": 0.5228515328676273,
      "learning_rate": 4.0164301846053364e-05,
      "loss": 1.5167,
      "num_input_tokens_seen": 26090738576,
      "step": 33162
    },
    {
      "epoch": 3.5182474008062803,
      "grad_norm": 0.4424109977032808,
      "learning_rate": 4.016374932017378e-05,
      "loss": 1.4675,
      "num_input_tokens_seen": 26091525344,
      "step": 33163
    },
    {
      "epoch": 3.5183534903458518,
      "grad_norm": 0.4656610961615292,
      "learning_rate": 4.016319678257611e-05,
      "loss": 1.3946,
      "num_input_tokens_seen": 26092312160,
      "step": 33164
    },
    {
      "epoch": 3.5184595798854232,
      "grad_norm": 0.5127040604361937,
      "learning_rate": 4.016264423326075e-05,
      "loss": 1.4281,
      "num_input_tokens_seen": 26093098992,
      "step": 33165
    },
    {
      "epoch": 3.5185656694249947,
      "grad_norm": 0.4939970847950187,
      "learning_rate": 4.016209167222815e-05,
      "loss": 1.4724,
      "num_input_tokens_seen": 26093885792,
      "step": 33166
    },
    {
      "epoch": 3.518671758964566,
      "grad_norm": 0.4110457877342247,
      "learning_rate": 4.0161539099478726e-05,
      "loss": 1.3865,
      "num_input_tokens_seen": 26094672528,
      "step": 33167
    },
    {
      "epoch": 3.518777848504137,
      "grad_norm": 0.4372070056713868,
      "learning_rate": 4.0160986515012924e-05,
      "loss": 1.3739,
      "num_input_tokens_seen": 26095459312,
      "step": 33168
    },
    {
      "epoch": 3.518883938043709,
      "grad_norm": 0.41426337219353565,
      "learning_rate": 4.016043391883114e-05,
      "loss": 1.4289,
      "num_input_tokens_seen": 26096246064,
      "step": 33169
    },
    {
      "epoch": 3.51899002758328,
      "grad_norm": 0.5274751487042504,
      "learning_rate": 4.015988131093383e-05,
      "loss": 1.533,
      "num_input_tokens_seen": 26097032880,
      "step": 33170
    },
    {
      "epoch": 3.5190961171228516,
      "grad_norm": 0.4766666497264244,
      "learning_rate": 4.015932869132139e-05,
      "loss": 1.5014,
      "num_input_tokens_seen": 26097819712,
      "step": 33171
    },
    {
      "epoch": 3.519202206662423,
      "grad_norm": 0.44657872361084916,
      "learning_rate": 4.015877605999429e-05,
      "loss": 1.5145,
      "num_input_tokens_seen": 26098606560,
      "step": 33172
    },
    {
      "epoch": 3.5193082962019946,
      "grad_norm": 0.42913247692226464,
      "learning_rate": 4.0158223416952924e-05,
      "loss": 1.3919,
      "num_input_tokens_seen": 26099393344,
      "step": 33173
    },
    {
      "epoch": 3.519414385741566,
      "grad_norm": 0.448430978848073,
      "learning_rate": 4.015767076219772e-05,
      "loss": 1.4072,
      "num_input_tokens_seen": 26100180048,
      "step": 33174
    },
    {
      "epoch": 3.519520475281137,
      "grad_norm": 0.40576310254657555,
      "learning_rate": 4.015711809572912e-05,
      "loss": 1.4608,
      "num_input_tokens_seen": 26100966816,
      "step": 33175
    },
    {
      "epoch": 3.5196265648207086,
      "grad_norm": 0.36480865802908985,
      "learning_rate": 4.015656541754754e-05,
      "loss": 1.3604,
      "num_input_tokens_seen": 26101753664,
      "step": 33176
    },
    {
      "epoch": 3.51973265436028,
      "grad_norm": 0.44693507644499775,
      "learning_rate": 4.015601272765341e-05,
      "loss": 1.4765,
      "num_input_tokens_seen": 26102540448,
      "step": 33177
    },
    {
      "epoch": 3.5198387438998515,
      "grad_norm": 0.3885651523388833,
      "learning_rate": 4.015546002604716e-05,
      "loss": 1.4176,
      "num_input_tokens_seen": 26103327264,
      "step": 33178
    },
    {
      "epoch": 3.519944833439423,
      "grad_norm": 0.4095509787083708,
      "learning_rate": 4.0154907312729216e-05,
      "loss": 1.4282,
      "num_input_tokens_seen": 26104113968,
      "step": 33179
    },
    {
      "epoch": 3.520050922978994,
      "grad_norm": 0.4203857236680013,
      "learning_rate": 4.0154354587700004e-05,
      "loss": 1.3692,
      "num_input_tokens_seen": 26104900736,
      "step": 33180
    },
    {
      "epoch": 3.520157012518566,
      "grad_norm": 0.4145054273553859,
      "learning_rate": 4.015380185095995e-05,
      "loss": 1.3993,
      "num_input_tokens_seen": 26105687520,
      "step": 33181
    },
    {
      "epoch": 3.520263102058137,
      "grad_norm": 0.5390286041491358,
      "learning_rate": 4.015324910250948e-05,
      "loss": 1.6582,
      "num_input_tokens_seen": 26106474304,
      "step": 33182
    },
    {
      "epoch": 3.5203691915977084,
      "grad_norm": 0.45796140523265527,
      "learning_rate": 4.015269634234903e-05,
      "loss": 1.5632,
      "num_input_tokens_seen": 26107260912,
      "step": 33183
    },
    {
      "epoch": 3.52047528113728,
      "grad_norm": 0.43394224500229234,
      "learning_rate": 4.0152143570479017e-05,
      "loss": 1.4654,
      "num_input_tokens_seen": 26108047680,
      "step": 33184
    },
    {
      "epoch": 3.5205813706768514,
      "grad_norm": 0.4450943813417119,
      "learning_rate": 4.015159078689987e-05,
      "loss": 1.5073,
      "num_input_tokens_seen": 26108834416,
      "step": 33185
    },
    {
      "epoch": 3.520687460216423,
      "grad_norm": 0.43576705490186635,
      "learning_rate": 4.015103799161203e-05,
      "loss": 1.3631,
      "num_input_tokens_seen": 26109621232,
      "step": 33186
    },
    {
      "epoch": 3.520793549755994,
      "grad_norm": 0.44258224925958733,
      "learning_rate": 4.01504851846159e-05,
      "loss": 1.3689,
      "num_input_tokens_seen": 26110408048,
      "step": 33187
    },
    {
      "epoch": 3.5208996392955654,
      "grad_norm": 0.45761974802476496,
      "learning_rate": 4.0149932365911925e-05,
      "loss": 1.4776,
      "num_input_tokens_seen": 26111194800,
      "step": 33188
    },
    {
      "epoch": 3.521005728835137,
      "grad_norm": 0.42231476723487316,
      "learning_rate": 4.014937953550052e-05,
      "loss": 1.4936,
      "num_input_tokens_seen": 26111981536,
      "step": 33189
    },
    {
      "epoch": 3.5211118183747083,
      "grad_norm": 0.466914239459063,
      "learning_rate": 4.014882669338212e-05,
      "loss": 1.4788,
      "num_input_tokens_seen": 26112768272,
      "step": 33190
    },
    {
      "epoch": 3.52121790791428,
      "grad_norm": 0.46924543290008225,
      "learning_rate": 4.014827383955716e-05,
      "loss": 1.4989,
      "num_input_tokens_seen": 26113555056,
      "step": 33191
    },
    {
      "epoch": 3.521323997453851,
      "grad_norm": 0.4866628590333764,
      "learning_rate": 4.014772097402606e-05,
      "loss": 1.5028,
      "num_input_tokens_seen": 26114341856,
      "step": 33192
    },
    {
      "epoch": 3.5214300869934223,
      "grad_norm": 0.48321489818032687,
      "learning_rate": 4.0147168096789235e-05,
      "loss": 1.4822,
      "num_input_tokens_seen": 26115128704,
      "step": 33193
    },
    {
      "epoch": 3.521536176532994,
      "grad_norm": 0.4724285414987472,
      "learning_rate": 4.014661520784713e-05,
      "loss": 1.4621,
      "num_input_tokens_seen": 26115915504,
      "step": 33194
    },
    {
      "epoch": 3.5216422660725653,
      "grad_norm": 0.42076920653199096,
      "learning_rate": 4.014606230720016e-05,
      "loss": 1.4665,
      "num_input_tokens_seen": 26116702272,
      "step": 33195
    },
    {
      "epoch": 3.5217483556121367,
      "grad_norm": 0.45451880631781594,
      "learning_rate": 4.014550939484876e-05,
      "loss": 1.4798,
      "num_input_tokens_seen": 26117488992,
      "step": 33196
    },
    {
      "epoch": 3.521854445151708,
      "grad_norm": 0.4744059499856488,
      "learning_rate": 4.014495647079336e-05,
      "loss": 1.4749,
      "num_input_tokens_seen": 26118275680,
      "step": 33197
    },
    {
      "epoch": 3.5219605346912797,
      "grad_norm": 0.520221284058073,
      "learning_rate": 4.0144403535034375e-05,
      "loss": 1.446,
      "num_input_tokens_seen": 26119062480,
      "step": 33198
    },
    {
      "epoch": 3.5220666242308507,
      "grad_norm": 0.40877263669909736,
      "learning_rate": 4.014385058757224e-05,
      "loss": 1.3606,
      "num_input_tokens_seen": 26119849200,
      "step": 33199
    },
    {
      "epoch": 3.522172713770422,
      "grad_norm": 0.5464777861442099,
      "learning_rate": 4.0143297628407385e-05,
      "loss": 1.3748,
      "num_input_tokens_seen": 26120636032,
      "step": 33200
    },
    {
      "epoch": 3.5222788033099937,
      "grad_norm": 0.4399360925916338,
      "learning_rate": 4.014274465754023e-05,
      "loss": 1.4007,
      "num_input_tokens_seen": 26121422832,
      "step": 33201
    },
    {
      "epoch": 3.522384892849565,
      "grad_norm": 0.5500079579643238,
      "learning_rate": 4.0142191674971206e-05,
      "loss": 1.587,
      "num_input_tokens_seen": 26122209584,
      "step": 33202
    },
    {
      "epoch": 3.5224909823891366,
      "grad_norm": 0.4181649239598048,
      "learning_rate": 4.014163868070074e-05,
      "loss": 1.4517,
      "num_input_tokens_seen": 26122996320,
      "step": 33203
    },
    {
      "epoch": 3.5225970719287076,
      "grad_norm": 0.49166849874173096,
      "learning_rate": 4.0141085674729275e-05,
      "loss": 1.4759,
      "num_input_tokens_seen": 26123783088,
      "step": 33204
    },
    {
      "epoch": 3.522703161468279,
      "grad_norm": 0.502266619690613,
      "learning_rate": 4.014053265705721e-05,
      "loss": 1.3659,
      "num_input_tokens_seen": 26124569856,
      "step": 33205
    },
    {
      "epoch": 3.5228092510078506,
      "grad_norm": 0.4479429005982918,
      "learning_rate": 4.0139979627684985e-05,
      "loss": 1.4849,
      "num_input_tokens_seen": 26125356576,
      "step": 33206
    },
    {
      "epoch": 3.522915340547422,
      "grad_norm": 0.6140339372237548,
      "learning_rate": 4.013942658661303e-05,
      "loss": 1.5237,
      "num_input_tokens_seen": 26126143296,
      "step": 33207
    },
    {
      "epoch": 3.5230214300869935,
      "grad_norm": 0.45477758021200737,
      "learning_rate": 4.013887353384177e-05,
      "loss": 1.4293,
      "num_input_tokens_seen": 26126930080,
      "step": 33208
    },
    {
      "epoch": 3.5231275196265646,
      "grad_norm": 0.5518152315711198,
      "learning_rate": 4.0138320469371635e-05,
      "loss": 1.5082,
      "num_input_tokens_seen": 26127716800,
      "step": 33209
    },
    {
      "epoch": 3.5232336091661365,
      "grad_norm": 0.47765530641995,
      "learning_rate": 4.013776739320304e-05,
      "loss": 1.4897,
      "num_input_tokens_seen": 26128503504,
      "step": 33210
    },
    {
      "epoch": 3.5233396987057075,
      "grad_norm": 0.4577767652608538,
      "learning_rate": 4.0137214305336435e-05,
      "loss": 1.5026,
      "num_input_tokens_seen": 26129290352,
      "step": 33211
    },
    {
      "epoch": 3.523445788245279,
      "grad_norm": 0.5018379660722481,
      "learning_rate": 4.013666120577223e-05,
      "loss": 1.4681,
      "num_input_tokens_seen": 26130077152,
      "step": 33212
    },
    {
      "epoch": 3.5235518777848505,
      "grad_norm": 0.47743529238878135,
      "learning_rate": 4.013610809451086e-05,
      "loss": 1.3873,
      "num_input_tokens_seen": 26130863920,
      "step": 33213
    },
    {
      "epoch": 3.523657967324422,
      "grad_norm": 0.5488389430233324,
      "learning_rate": 4.013555497155275e-05,
      "loss": 1.3621,
      "num_input_tokens_seen": 26131650768,
      "step": 33214
    },
    {
      "epoch": 3.5237640568639934,
      "grad_norm": 0.5664702230919001,
      "learning_rate": 4.013500183689832e-05,
      "loss": 1.4647,
      "num_input_tokens_seen": 26132437552,
      "step": 33215
    },
    {
      "epoch": 3.5238701464035644,
      "grad_norm": 0.5096639191757285,
      "learning_rate": 4.013444869054801e-05,
      "loss": 1.4016,
      "num_input_tokens_seen": 26133224336,
      "step": 33216
    },
    {
      "epoch": 3.523976235943136,
      "grad_norm": 0.424397283207046,
      "learning_rate": 4.013389553250224e-05,
      "loss": 1.4063,
      "num_input_tokens_seen": 26134011152,
      "step": 33217
    },
    {
      "epoch": 3.5240823254827074,
      "grad_norm": 0.5170329666330182,
      "learning_rate": 4.013334236276144e-05,
      "loss": 1.4345,
      "num_input_tokens_seen": 26134797920,
      "step": 33218
    },
    {
      "epoch": 3.524188415022279,
      "grad_norm": 0.5317560877832819,
      "learning_rate": 4.013278918132604e-05,
      "loss": 1.4308,
      "num_input_tokens_seen": 26135584736,
      "step": 33219
    },
    {
      "epoch": 3.5242945045618503,
      "grad_norm": 0.5419581395382062,
      "learning_rate": 4.013223598819647e-05,
      "loss": 1.3989,
      "num_input_tokens_seen": 26136371568,
      "step": 33220
    },
    {
      "epoch": 3.5244005941014214,
      "grad_norm": 0.49770732817677465,
      "learning_rate": 4.0131682783373134e-05,
      "loss": 1.4604,
      "num_input_tokens_seen": 26137158304,
      "step": 33221
    },
    {
      "epoch": 3.524506683640993,
      "grad_norm": 0.3825138573140267,
      "learning_rate": 4.013112956685648e-05,
      "loss": 1.3678,
      "num_input_tokens_seen": 26137945040,
      "step": 33222
    },
    {
      "epoch": 3.5246127731805643,
      "grad_norm": 0.4786020944036485,
      "learning_rate": 4.013057633864695e-05,
      "loss": 1.4675,
      "num_input_tokens_seen": 26138731680,
      "step": 33223
    },
    {
      "epoch": 3.524718862720136,
      "grad_norm": 0.43510853163340074,
      "learning_rate": 4.0130023098744946e-05,
      "loss": 1.4081,
      "num_input_tokens_seen": 26139518384,
      "step": 33224
    },
    {
      "epoch": 3.5248249522597073,
      "grad_norm": 0.4677789863159102,
      "learning_rate": 4.01294698471509e-05,
      "loss": 1.4276,
      "num_input_tokens_seen": 26140305088,
      "step": 33225
    },
    {
      "epoch": 3.5249310417992787,
      "grad_norm": 0.41286035977738467,
      "learning_rate": 4.012891658386525e-05,
      "loss": 1.4398,
      "num_input_tokens_seen": 26141091840,
      "step": 33226
    },
    {
      "epoch": 3.52503713133885,
      "grad_norm": 0.4068023769504892,
      "learning_rate": 4.012836330888842e-05,
      "loss": 1.432,
      "num_input_tokens_seen": 26141878560,
      "step": 33227
    },
    {
      "epoch": 3.5251432208784212,
      "grad_norm": 0.4132159951844147,
      "learning_rate": 4.0127810022220825e-05,
      "loss": 1.416,
      "num_input_tokens_seen": 26142665280,
      "step": 33228
    },
    {
      "epoch": 3.5252493104179927,
      "grad_norm": 0.4453814943227195,
      "learning_rate": 4.01272567238629e-05,
      "loss": 1.4245,
      "num_input_tokens_seen": 26143451968,
      "step": 33229
    },
    {
      "epoch": 3.525355399957564,
      "grad_norm": 0.4056366749744377,
      "learning_rate": 4.012670341381508e-05,
      "loss": 1.4552,
      "num_input_tokens_seen": 26144238752,
      "step": 33230
    },
    {
      "epoch": 3.5254614894971357,
      "grad_norm": 0.45891925135756806,
      "learning_rate": 4.01261500920778e-05,
      "loss": 1.3984,
      "num_input_tokens_seen": 26145025536,
      "step": 33231
    },
    {
      "epoch": 3.525567579036707,
      "grad_norm": 0.43239925463816103,
      "learning_rate": 4.012559675865146e-05,
      "loss": 1.4145,
      "num_input_tokens_seen": 26145812368,
      "step": 33232
    },
    {
      "epoch": 3.525673668576278,
      "grad_norm": 0.463259100640793,
      "learning_rate": 4.0125043413536505e-05,
      "loss": 1.3622,
      "num_input_tokens_seen": 26146599136,
      "step": 33233
    },
    {
      "epoch": 3.5257797581158496,
      "grad_norm": 0.45280220289997675,
      "learning_rate": 4.012449005673336e-05,
      "loss": 1.6392,
      "num_input_tokens_seen": 26147385840,
      "step": 33234
    },
    {
      "epoch": 3.525885847655421,
      "grad_norm": 0.35566205186766847,
      "learning_rate": 4.012393668824246e-05,
      "loss": 1.3866,
      "num_input_tokens_seen": 26148172592,
      "step": 33235
    },
    {
      "epoch": 3.5259919371949926,
      "grad_norm": 0.5460967566810278,
      "learning_rate": 4.012338330806422e-05,
      "loss": 1.5549,
      "num_input_tokens_seen": 26148959328,
      "step": 33236
    },
    {
      "epoch": 3.526098026734564,
      "grad_norm": 0.40643768748441045,
      "learning_rate": 4.012282991619907e-05,
      "loss": 1.4357,
      "num_input_tokens_seen": 26149746128,
      "step": 33237
    },
    {
      "epoch": 3.526204116274135,
      "grad_norm": 0.4401807278645532,
      "learning_rate": 4.012227651264744e-05,
      "loss": 1.4699,
      "num_input_tokens_seen": 26150532912,
      "step": 33238
    },
    {
      "epoch": 3.526310205813707,
      "grad_norm": 0.3823455019261506,
      "learning_rate": 4.012172309740977e-05,
      "loss": 1.3432,
      "num_input_tokens_seen": 26151319696,
      "step": 33239
    },
    {
      "epoch": 3.526416295353278,
      "grad_norm": 0.3768930597669934,
      "learning_rate": 4.0121169670486466e-05,
      "loss": 1.3284,
      "num_input_tokens_seen": 26152106608,
      "step": 33240
    },
    {
      "epoch": 3.5265223848928495,
      "grad_norm": 0.45945687232435306,
      "learning_rate": 4.012061623187797e-05,
      "loss": 1.4952,
      "num_input_tokens_seen": 26152893424,
      "step": 33241
    },
    {
      "epoch": 3.526628474432421,
      "grad_norm": 0.44307158047660566,
      "learning_rate": 4.01200627815847e-05,
      "loss": 1.5253,
      "num_input_tokens_seen": 26153680240,
      "step": 33242
    },
    {
      "epoch": 3.5267345639719925,
      "grad_norm": 0.48494868074547975,
      "learning_rate": 4.01195093196071e-05,
      "loss": 1.4752,
      "num_input_tokens_seen": 26154467040,
      "step": 33243
    },
    {
      "epoch": 3.526840653511564,
      "grad_norm": 0.43717854105647364,
      "learning_rate": 4.011895584594557e-05,
      "loss": 1.4724,
      "num_input_tokens_seen": 26155253840,
      "step": 33244
    },
    {
      "epoch": 3.526946743051135,
      "grad_norm": 0.47446794563950545,
      "learning_rate": 4.011840236060057e-05,
      "loss": 1.4931,
      "num_input_tokens_seen": 26156040608,
      "step": 33245
    },
    {
      "epoch": 3.5270528325907065,
      "grad_norm": 0.46331571967537244,
      "learning_rate": 4.011784886357251e-05,
      "loss": 1.4053,
      "num_input_tokens_seen": 26156827344,
      "step": 33246
    },
    {
      "epoch": 3.527158922130278,
      "grad_norm": 0.676651805862988,
      "learning_rate": 4.011729535486181e-05,
      "loss": 1.5423,
      "num_input_tokens_seen": 26157614032,
      "step": 33247
    },
    {
      "epoch": 3.5272650116698494,
      "grad_norm": 0.40086013161929485,
      "learning_rate": 4.011674183446892e-05,
      "loss": 1.4518,
      "num_input_tokens_seen": 26158400848,
      "step": 33248
    },
    {
      "epoch": 3.527371101209421,
      "grad_norm": 0.49091641917946516,
      "learning_rate": 4.0116188302394246e-05,
      "loss": 1.5235,
      "num_input_tokens_seen": 26159187648,
      "step": 33249
    },
    {
      "epoch": 3.527477190748992,
      "grad_norm": 0.5714288046969936,
      "learning_rate": 4.0115634758638234e-05,
      "loss": 1.5149,
      "num_input_tokens_seen": 26159974432,
      "step": 33250
    },
    {
      "epoch": 3.5275832802885634,
      "grad_norm": 0.4854431619379947,
      "learning_rate": 4.011508120320129e-05,
      "loss": 1.4711,
      "num_input_tokens_seen": 26160761152,
      "step": 33251
    },
    {
      "epoch": 3.527689369828135,
      "grad_norm": 0.6413517912612674,
      "learning_rate": 4.011452763608387e-05,
      "loss": 1.5132,
      "num_input_tokens_seen": 26161547936,
      "step": 33252
    },
    {
      "epoch": 3.5277954593677063,
      "grad_norm": 0.426242805671066,
      "learning_rate": 4.0113974057286374e-05,
      "loss": 1.4133,
      "num_input_tokens_seen": 26162334672,
      "step": 33253
    },
    {
      "epoch": 3.527901548907278,
      "grad_norm": 0.6323708328630887,
      "learning_rate": 4.011342046680925e-05,
      "loss": 1.4906,
      "num_input_tokens_seen": 26163121312,
      "step": 33254
    },
    {
      "epoch": 3.5280076384468493,
      "grad_norm": 0.5919068316224086,
      "learning_rate": 4.0112866864652914e-05,
      "loss": 1.4964,
      "num_input_tokens_seen": 26163908032,
      "step": 33255
    },
    {
      "epoch": 3.5281137279864208,
      "grad_norm": 0.49996799388753344,
      "learning_rate": 4.01123132508178e-05,
      "loss": 1.4436,
      "num_input_tokens_seen": 26164694864,
      "step": 33256
    },
    {
      "epoch": 3.528219817525992,
      "grad_norm": 0.6155514526212458,
      "learning_rate": 4.011175962530433e-05,
      "loss": 1.3884,
      "num_input_tokens_seen": 26165481648,
      "step": 33257
    },
    {
      "epoch": 3.5283259070655633,
      "grad_norm": 0.46806983419344417,
      "learning_rate": 4.011120598811294e-05,
      "loss": 1.5092,
      "num_input_tokens_seen": 26166268400,
      "step": 33258
    },
    {
      "epoch": 3.5284319966051347,
      "grad_norm": 0.5093482214862618,
      "learning_rate": 4.011065233924406e-05,
      "loss": 1.406,
      "num_input_tokens_seen": 26167055216,
      "step": 33259
    },
    {
      "epoch": 3.528538086144706,
      "grad_norm": 0.5022532962480588,
      "learning_rate": 4.01100986786981e-05,
      "loss": 1.3738,
      "num_input_tokens_seen": 26167842080,
      "step": 33260
    },
    {
      "epoch": 3.5286441756842777,
      "grad_norm": 0.5254964975173736,
      "learning_rate": 4.01095450064755e-05,
      "loss": 1.4215,
      "num_input_tokens_seen": 26168628880,
      "step": 33261
    },
    {
      "epoch": 3.5287502652238487,
      "grad_norm": 0.43049776159312336,
      "learning_rate": 4.0108991322576696e-05,
      "loss": 1.3924,
      "num_input_tokens_seen": 26169415680,
      "step": 33262
    },
    {
      "epoch": 3.52885635476342,
      "grad_norm": 0.4657804846831879,
      "learning_rate": 4.010843762700209e-05,
      "loss": 1.4359,
      "num_input_tokens_seen": 26170202432,
      "step": 33263
    },
    {
      "epoch": 3.5289624443029917,
      "grad_norm": 0.48509549251530576,
      "learning_rate": 4.0107883919752145e-05,
      "loss": 1.5013,
      "num_input_tokens_seen": 26170989248,
      "step": 33264
    },
    {
      "epoch": 3.529068533842563,
      "grad_norm": 0.5239155681550558,
      "learning_rate": 4.0107330200827267e-05,
      "loss": 1.503,
      "num_input_tokens_seen": 26171776080,
      "step": 33265
    },
    {
      "epoch": 3.5291746233821346,
      "grad_norm": 0.39193403406511107,
      "learning_rate": 4.010677647022788e-05,
      "loss": 1.5582,
      "num_input_tokens_seen": 26172562816,
      "step": 33266
    },
    {
      "epoch": 3.5292807129217056,
      "grad_norm": 0.48811210061194865,
      "learning_rate": 4.0106222727954425e-05,
      "loss": 1.4493,
      "num_input_tokens_seen": 26173349616,
      "step": 33267
    },
    {
      "epoch": 3.5293868024612776,
      "grad_norm": 0.41163786997259744,
      "learning_rate": 4.0105668974007317e-05,
      "loss": 1.4263,
      "num_input_tokens_seen": 26174136416,
      "step": 33268
    },
    {
      "epoch": 3.5294928920008486,
      "grad_norm": 0.5201328857135252,
      "learning_rate": 4.0105115208387e-05,
      "loss": 1.51,
      "num_input_tokens_seen": 26174923136,
      "step": 33269
    },
    {
      "epoch": 3.52959898154042,
      "grad_norm": 0.48812709528599435,
      "learning_rate": 4.010456143109389e-05,
      "loss": 1.5481,
      "num_input_tokens_seen": 26175709840,
      "step": 33270
    },
    {
      "epoch": 3.5297050710799915,
      "grad_norm": 0.515343081201391,
      "learning_rate": 4.010400764212841e-05,
      "loss": 1.4657,
      "num_input_tokens_seen": 26176496560,
      "step": 33271
    },
    {
      "epoch": 3.529811160619563,
      "grad_norm": 0.4875548029365499,
      "learning_rate": 4.0103453841491005e-05,
      "loss": 1.6,
      "num_input_tokens_seen": 26177283376,
      "step": 33272
    },
    {
      "epoch": 3.5299172501591345,
      "grad_norm": 0.4286930989203009,
      "learning_rate": 4.010290002918209e-05,
      "loss": 1.4509,
      "num_input_tokens_seen": 26178070176,
      "step": 33273
    },
    {
      "epoch": 3.5300233396987055,
      "grad_norm": 0.462341640942549,
      "learning_rate": 4.01023462052021e-05,
      "loss": 1.5233,
      "num_input_tokens_seen": 26178856896,
      "step": 33274
    },
    {
      "epoch": 3.530129429238277,
      "grad_norm": 0.39913569739860805,
      "learning_rate": 4.0101792369551463e-05,
      "loss": 1.4223,
      "num_input_tokens_seen": 26179643648,
      "step": 33275
    },
    {
      "epoch": 3.5302355187778485,
      "grad_norm": 0.4028042283375325,
      "learning_rate": 4.01012385222306e-05,
      "loss": 1.4353,
      "num_input_tokens_seen": 26180430448,
      "step": 33276
    },
    {
      "epoch": 3.53034160831742,
      "grad_norm": 0.4507380351925564,
      "learning_rate": 4.010068466323994e-05,
      "loss": 1.4865,
      "num_input_tokens_seen": 26181217280,
      "step": 33277
    },
    {
      "epoch": 3.5304476978569914,
      "grad_norm": 0.5479249675980895,
      "learning_rate": 4.010013079257992e-05,
      "loss": 1.439,
      "num_input_tokens_seen": 26182004064,
      "step": 33278
    },
    {
      "epoch": 3.5305537873965624,
      "grad_norm": 0.4297255623913701,
      "learning_rate": 4.009957691025096e-05,
      "loss": 1.4836,
      "num_input_tokens_seen": 26182790880,
      "step": 33279
    },
    {
      "epoch": 3.5306598769361344,
      "grad_norm": 0.632377711186557,
      "learning_rate": 4.009902301625349e-05,
      "loss": 1.5005,
      "num_input_tokens_seen": 26183577536,
      "step": 33280
    },
    {
      "epoch": 3.5307659664757054,
      "grad_norm": 0.46953213932995325,
      "learning_rate": 4.0098469110587935e-05,
      "loss": 1.504,
      "num_input_tokens_seen": 26184364272,
      "step": 33281
    },
    {
      "epoch": 3.530872056015277,
      "grad_norm": 0.4352750966206316,
      "learning_rate": 4.009791519325473e-05,
      "loss": 1.4695,
      "num_input_tokens_seen": 26185151104,
      "step": 33282
    },
    {
      "epoch": 3.5309781455548483,
      "grad_norm": 0.45459447645064904,
      "learning_rate": 4.0097361264254296e-05,
      "loss": 1.4189,
      "num_input_tokens_seen": 26185937888,
      "step": 33283
    },
    {
      "epoch": 3.53108423509442,
      "grad_norm": 0.4487135957607373,
      "learning_rate": 4.009680732358707e-05,
      "loss": 1.5898,
      "num_input_tokens_seen": 26186724624,
      "step": 33284
    },
    {
      "epoch": 3.5311903246339913,
      "grad_norm": 0.48983615142861225,
      "learning_rate": 4.0096253371253466e-05,
      "loss": 1.478,
      "num_input_tokens_seen": 26187511392,
      "step": 33285
    },
    {
      "epoch": 3.5312964141735623,
      "grad_norm": 0.4378520741010351,
      "learning_rate": 4.009569940725393e-05,
      "loss": 1.4504,
      "num_input_tokens_seen": 26188298128,
      "step": 33286
    },
    {
      "epoch": 3.531402503713134,
      "grad_norm": 0.4327783922882669,
      "learning_rate": 4.009514543158887e-05,
      "loss": 1.4927,
      "num_input_tokens_seen": 26189084992,
      "step": 33287
    },
    {
      "epoch": 3.5315085932527053,
      "grad_norm": 0.4836301608537704,
      "learning_rate": 4.0094591444258734e-05,
      "loss": 1.485,
      "num_input_tokens_seen": 26189871776,
      "step": 33288
    },
    {
      "epoch": 3.5316146827922767,
      "grad_norm": 0.49866407517105027,
      "learning_rate": 4.009403744526393e-05,
      "loss": 1.3999,
      "num_input_tokens_seen": 26190658640,
      "step": 33289
    },
    {
      "epoch": 3.5317207723318482,
      "grad_norm": 0.4222902420468336,
      "learning_rate": 4.0093483434604906e-05,
      "loss": 1.3526,
      "num_input_tokens_seen": 26191445424,
      "step": 33290
    },
    {
      "epoch": 3.5318268618714193,
      "grad_norm": 0.496146436238828,
      "learning_rate": 4.0092929412282075e-05,
      "loss": 1.52,
      "num_input_tokens_seen": 26192232272,
      "step": 33291
    },
    {
      "epoch": 3.5319329514109907,
      "grad_norm": 0.42103098889568824,
      "learning_rate": 4.009237537829588e-05,
      "loss": 1.5596,
      "num_input_tokens_seen": 26193018976,
      "step": 33292
    },
    {
      "epoch": 3.532039040950562,
      "grad_norm": 0.43621613386444685,
      "learning_rate": 4.009182133264673e-05,
      "loss": 1.4446,
      "num_input_tokens_seen": 26193805872,
      "step": 33293
    },
    {
      "epoch": 3.5321451304901337,
      "grad_norm": 0.44213083192840347,
      "learning_rate": 4.009126727533506e-05,
      "loss": 1.4836,
      "num_input_tokens_seen": 26194592592,
      "step": 33294
    },
    {
      "epoch": 3.532251220029705,
      "grad_norm": 0.4055659547200788,
      "learning_rate": 4.009071320636132e-05,
      "loss": 1.3414,
      "num_input_tokens_seen": 26195379392,
      "step": 33295
    },
    {
      "epoch": 3.5323573095692766,
      "grad_norm": 0.4068793826427471,
      "learning_rate": 4.0090159125725906e-05,
      "loss": 1.4215,
      "num_input_tokens_seen": 26196166128,
      "step": 33296
    },
    {
      "epoch": 3.532463399108848,
      "grad_norm": 0.39047664690714773,
      "learning_rate": 4.008960503342926e-05,
      "loss": 1.4313,
      "num_input_tokens_seen": 26196952832,
      "step": 33297
    },
    {
      "epoch": 3.532569488648419,
      "grad_norm": 0.4161112393889203,
      "learning_rate": 4.008905092947182e-05,
      "loss": 1.4238,
      "num_input_tokens_seen": 26197739632,
      "step": 33298
    },
    {
      "epoch": 3.5326755781879906,
      "grad_norm": 0.44178774755232975,
      "learning_rate": 4.008849681385399e-05,
      "loss": 1.3646,
      "num_input_tokens_seen": 26198526416,
      "step": 33299
    },
    {
      "epoch": 3.532781667727562,
      "grad_norm": 0.39728397929487796,
      "learning_rate": 4.008794268657622e-05,
      "loss": 1.4348,
      "num_input_tokens_seen": 26199313264,
      "step": 33300
    },
    {
      "epoch": 3.5328877572671336,
      "grad_norm": 0.4480068551577233,
      "learning_rate": 4.0087388547638926e-05,
      "loss": 1.4096,
      "num_input_tokens_seen": 26200100048,
      "step": 33301
    },
    {
      "epoch": 3.532993846806705,
      "grad_norm": 0.38711628642567075,
      "learning_rate": 4.008683439704255e-05,
      "loss": 1.3467,
      "num_input_tokens_seen": 26200886832,
      "step": 33302
    },
    {
      "epoch": 3.533099936346276,
      "grad_norm": 0.525721594789668,
      "learning_rate": 4.00862802347875e-05,
      "loss": 1.4459,
      "num_input_tokens_seen": 26201673600,
      "step": 33303
    },
    {
      "epoch": 3.5332060258858475,
      "grad_norm": 0.44340426323940824,
      "learning_rate": 4.008572606087422e-05,
      "loss": 1.4871,
      "num_input_tokens_seen": 26202460352,
      "step": 33304
    },
    {
      "epoch": 3.533312115425419,
      "grad_norm": 0.5355091042872815,
      "learning_rate": 4.008517187530314e-05,
      "loss": 1.4647,
      "num_input_tokens_seen": 26203247168,
      "step": 33305
    },
    {
      "epoch": 3.5334182049649905,
      "grad_norm": 0.3882906845179714,
      "learning_rate": 4.0084617678074674e-05,
      "loss": 1.4872,
      "num_input_tokens_seen": 26204033904,
      "step": 33306
    },
    {
      "epoch": 3.533524294504562,
      "grad_norm": 0.6398872829871471,
      "learning_rate": 4.008406346918926e-05,
      "loss": 1.4867,
      "num_input_tokens_seen": 26204820672,
      "step": 33307
    },
    {
      "epoch": 3.533630384044133,
      "grad_norm": 0.5026580833732603,
      "learning_rate": 4.008350924864732e-05,
      "loss": 1.5271,
      "num_input_tokens_seen": 26205607360,
      "step": 33308
    },
    {
      "epoch": 3.533736473583705,
      "grad_norm": 0.5886007695478286,
      "learning_rate": 4.00829550164493e-05,
      "loss": 1.4139,
      "num_input_tokens_seen": 26206394144,
      "step": 33309
    },
    {
      "epoch": 3.533842563123276,
      "grad_norm": 0.430413758611535,
      "learning_rate": 4.00824007725956e-05,
      "loss": 1.4522,
      "num_input_tokens_seen": 26207180944,
      "step": 33310
    },
    {
      "epoch": 3.5339486526628474,
      "grad_norm": 0.653362746900914,
      "learning_rate": 4.0081846517086664e-05,
      "loss": 1.5044,
      "num_input_tokens_seen": 26207967648,
      "step": 33311
    },
    {
      "epoch": 3.534054742202419,
      "grad_norm": 0.4670946718404713,
      "learning_rate": 4.008129224992293e-05,
      "loss": 1.4306,
      "num_input_tokens_seen": 26208754368,
      "step": 33312
    },
    {
      "epoch": 3.5341608317419904,
      "grad_norm": 0.4635128241321185,
      "learning_rate": 4.008073797110481e-05,
      "loss": 1.3788,
      "num_input_tokens_seen": 26209541120,
      "step": 33313
    },
    {
      "epoch": 3.534266921281562,
      "grad_norm": 0.593840599209861,
      "learning_rate": 4.008018368063274e-05,
      "loss": 1.5486,
      "num_input_tokens_seen": 26210327712,
      "step": 33314
    },
    {
      "epoch": 3.534373010821133,
      "grad_norm": 0.5027911046748498,
      "learning_rate": 4.007962937850714e-05,
      "loss": 1.4753,
      "num_input_tokens_seen": 26211114496,
      "step": 33315
    },
    {
      "epoch": 3.5344791003607043,
      "grad_norm": 0.45077262398728163,
      "learning_rate": 4.0079075064728454e-05,
      "loss": 1.4467,
      "num_input_tokens_seen": 26211901200,
      "step": 33316
    },
    {
      "epoch": 3.534585189900276,
      "grad_norm": 0.5190448685572177,
      "learning_rate": 4.00785207392971e-05,
      "loss": 1.3866,
      "num_input_tokens_seen": 26212688064,
      "step": 33317
    },
    {
      "epoch": 3.5346912794398473,
      "grad_norm": 0.48442968178841866,
      "learning_rate": 4.00779664022135e-05,
      "loss": 1.5626,
      "num_input_tokens_seen": 26213474768,
      "step": 33318
    },
    {
      "epoch": 3.5347973689794188,
      "grad_norm": 0.5942377557980691,
      "learning_rate": 4.00774120534781e-05,
      "loss": 1.5238,
      "num_input_tokens_seen": 26214261520,
      "step": 33319
    },
    {
      "epoch": 3.53490345851899,
      "grad_norm": 0.5267690940435814,
      "learning_rate": 4.007685769309131e-05,
      "loss": 1.4819,
      "num_input_tokens_seen": 26215048368,
      "step": 33320
    },
    {
      "epoch": 3.5350095480585613,
      "grad_norm": 0.4872793619433804,
      "learning_rate": 4.0076303321053564e-05,
      "loss": 1.3901,
      "num_input_tokens_seen": 26215835152,
      "step": 33321
    },
    {
      "epoch": 3.5351156375981327,
      "grad_norm": 0.5164977356811992,
      "learning_rate": 4.00757489373653e-05,
      "loss": 1.4484,
      "num_input_tokens_seen": 26216621920,
      "step": 33322
    },
    {
      "epoch": 3.535221727137704,
      "grad_norm": 0.4814294129810364,
      "learning_rate": 4.0075194542026936e-05,
      "loss": 1.5759,
      "num_input_tokens_seen": 26217408608,
      "step": 33323
    },
    {
      "epoch": 3.5353278166772757,
      "grad_norm": 0.5601231089615667,
      "learning_rate": 4.007464013503891e-05,
      "loss": 1.4952,
      "num_input_tokens_seen": 26218195424,
      "step": 33324
    },
    {
      "epoch": 3.535433906216847,
      "grad_norm": 0.48446850389977253,
      "learning_rate": 4.0074085716401644e-05,
      "loss": 1.4451,
      "num_input_tokens_seen": 26218982208,
      "step": 33325
    },
    {
      "epoch": 3.5355399957564186,
      "grad_norm": 0.5319165101943719,
      "learning_rate": 4.007353128611556e-05,
      "loss": 1.4754,
      "num_input_tokens_seen": 26219768944,
      "step": 33326
    },
    {
      "epoch": 3.5356460852959897,
      "grad_norm": 0.5534129864351601,
      "learning_rate": 4.00729768441811e-05,
      "loss": 1.4518,
      "num_input_tokens_seen": 26220555712,
      "step": 33327
    },
    {
      "epoch": 3.535752174835561,
      "grad_norm": 0.5675783812128975,
      "learning_rate": 4.0072422390598686e-05,
      "loss": 1.4612,
      "num_input_tokens_seen": 26221342448,
      "step": 33328
    },
    {
      "epoch": 3.5358582643751326,
      "grad_norm": 0.548832124539336,
      "learning_rate": 4.007186792536874e-05,
      "loss": 1.5032,
      "num_input_tokens_seen": 26222129184,
      "step": 33329
    },
    {
      "epoch": 3.535964353914704,
      "grad_norm": 0.4262139662641705,
      "learning_rate": 4.00713134484917e-05,
      "loss": 1.5005,
      "num_input_tokens_seen": 26222915920,
      "step": 33330
    },
    {
      "epoch": 3.5360704434542756,
      "grad_norm": 0.5461656393943244,
      "learning_rate": 4.0070758959967993e-05,
      "loss": 1.4891,
      "num_input_tokens_seen": 26223702576,
      "step": 33331
    },
    {
      "epoch": 3.5361765329938466,
      "grad_norm": 0.49037870884109813,
      "learning_rate": 4.0070204459798045e-05,
      "loss": 1.5519,
      "num_input_tokens_seen": 26224489328,
      "step": 33332
    },
    {
      "epoch": 3.536282622533418,
      "grad_norm": 0.4406936237587548,
      "learning_rate": 4.006964994798228e-05,
      "loss": 1.3929,
      "num_input_tokens_seen": 26225276064,
      "step": 33333
    },
    {
      "epoch": 3.5363887120729895,
      "grad_norm": 0.6257237351998624,
      "learning_rate": 4.006909542452113e-05,
      "loss": 1.4779,
      "num_input_tokens_seen": 26226062832,
      "step": 33334
    },
    {
      "epoch": 3.536494801612561,
      "grad_norm": 0.4203482099559406,
      "learning_rate": 4.0068540889415034e-05,
      "loss": 1.4651,
      "num_input_tokens_seen": 26226849584,
      "step": 33335
    },
    {
      "epoch": 3.5366008911521325,
      "grad_norm": 0.5086975907819279,
      "learning_rate": 4.006798634266441e-05,
      "loss": 1.3762,
      "num_input_tokens_seen": 26227636272,
      "step": 33336
    },
    {
      "epoch": 3.5367069806917035,
      "grad_norm": 0.46925240005759494,
      "learning_rate": 4.006743178426969e-05,
      "loss": 1.4165,
      "num_input_tokens_seen": 26228422944,
      "step": 33337
    },
    {
      "epoch": 3.5368130702312754,
      "grad_norm": 0.46458098474787735,
      "learning_rate": 4.006687721423129e-05,
      "loss": 1.4872,
      "num_input_tokens_seen": 26229209760,
      "step": 33338
    },
    {
      "epoch": 3.5369191597708465,
      "grad_norm": 0.46148008085536035,
      "learning_rate": 4.006632263254966e-05,
      "loss": 1.4089,
      "num_input_tokens_seen": 26229996624,
      "step": 33339
    },
    {
      "epoch": 3.537025249310418,
      "grad_norm": 0.49660246329167995,
      "learning_rate": 4.006576803922521e-05,
      "loss": 1.5705,
      "num_input_tokens_seen": 26230783344,
      "step": 33340
    },
    {
      "epoch": 3.5371313388499894,
      "grad_norm": 0.43541290742535144,
      "learning_rate": 4.006521343425839e-05,
      "loss": 1.5058,
      "num_input_tokens_seen": 26231570000,
      "step": 33341
    },
    {
      "epoch": 3.537237428389561,
      "grad_norm": 0.48241990860655426,
      "learning_rate": 4.0064658817649606e-05,
      "loss": 1.449,
      "num_input_tokens_seen": 26232356704,
      "step": 33342
    },
    {
      "epoch": 3.5373435179291324,
      "grad_norm": 0.4501495220905505,
      "learning_rate": 4.00641041893993e-05,
      "loss": 1.5082,
      "num_input_tokens_seen": 26233143440,
      "step": 33343
    },
    {
      "epoch": 3.5374496074687034,
      "grad_norm": 0.38140824310408145,
      "learning_rate": 4.006354954950788e-05,
      "loss": 1.3917,
      "num_input_tokens_seen": 26233930240,
      "step": 33344
    },
    {
      "epoch": 3.537555697008275,
      "grad_norm": 0.4808804640120515,
      "learning_rate": 4.0062994897975815e-05,
      "loss": 1.5042,
      "num_input_tokens_seen": 26234716992,
      "step": 33345
    },
    {
      "epoch": 3.5376617865478464,
      "grad_norm": 0.41531627776569907,
      "learning_rate": 4.00624402348035e-05,
      "loss": 1.4012,
      "num_input_tokens_seen": 26235503824,
      "step": 33346
    },
    {
      "epoch": 3.537767876087418,
      "grad_norm": 0.41938768587908276,
      "learning_rate": 4.0061885559991366e-05,
      "loss": 1.5059,
      "num_input_tokens_seen": 26236290576,
      "step": 33347
    },
    {
      "epoch": 3.5378739656269893,
      "grad_norm": 0.48569430684654313,
      "learning_rate": 4.006133087353985e-05,
      "loss": 1.5658,
      "num_input_tokens_seen": 26237077296,
      "step": 33348
    },
    {
      "epoch": 3.5379800551665603,
      "grad_norm": 0.4351837321232212,
      "learning_rate": 4.0060776175449386e-05,
      "loss": 1.5052,
      "num_input_tokens_seen": 26237864208,
      "step": 33349
    },
    {
      "epoch": 3.5380861447061323,
      "grad_norm": 0.42597996109561365,
      "learning_rate": 4.0060221465720396e-05,
      "loss": 1.4306,
      "num_input_tokens_seen": 26238650976,
      "step": 33350
    },
    {
      "epoch": 3.5381922342457033,
      "grad_norm": 0.42244428542007967,
      "learning_rate": 4.005966674435331e-05,
      "loss": 1.6385,
      "num_input_tokens_seen": 26239437696,
      "step": 33351
    },
    {
      "epoch": 3.5382983237852748,
      "grad_norm": 0.4294905122151203,
      "learning_rate": 4.005911201134855e-05,
      "loss": 1.3813,
      "num_input_tokens_seen": 26240224528,
      "step": 33352
    },
    {
      "epoch": 3.5384044133248462,
      "grad_norm": 0.41307358069654576,
      "learning_rate": 4.005855726670655e-05,
      "loss": 1.3693,
      "num_input_tokens_seen": 26241011296,
      "step": 33353
    },
    {
      "epoch": 3.5385105028644177,
      "grad_norm": 0.4799123324544824,
      "learning_rate": 4.005800251042774e-05,
      "loss": 1.4607,
      "num_input_tokens_seen": 26241798160,
      "step": 33354
    },
    {
      "epoch": 3.538616592403989,
      "grad_norm": 0.43676839237115644,
      "learning_rate": 4.0057447742512547e-05,
      "loss": 1.4981,
      "num_input_tokens_seen": 26242584864,
      "step": 33355
    },
    {
      "epoch": 3.53872268194356,
      "grad_norm": 0.5002989236239043,
      "learning_rate": 4.0056892962961404e-05,
      "loss": 1.5263,
      "num_input_tokens_seen": 26243371584,
      "step": 33356
    },
    {
      "epoch": 3.5388287714831317,
      "grad_norm": 0.49774363517672393,
      "learning_rate": 4.005633817177473e-05,
      "loss": 1.508,
      "num_input_tokens_seen": 26244158352,
      "step": 33357
    },
    {
      "epoch": 3.538934861022703,
      "grad_norm": 0.4678927118249129,
      "learning_rate": 4.005578336895296e-05,
      "loss": 1.4744,
      "num_input_tokens_seen": 26244945056,
      "step": 33358
    },
    {
      "epoch": 3.5390409505622746,
      "grad_norm": 0.42099883217804435,
      "learning_rate": 4.0055228554496525e-05,
      "loss": 1.3985,
      "num_input_tokens_seen": 26245731792,
      "step": 33359
    },
    {
      "epoch": 3.539147040101846,
      "grad_norm": 0.8444509497077206,
      "learning_rate": 4.0054673728405855e-05,
      "loss": 1.5596,
      "num_input_tokens_seen": 26246518496,
      "step": 33360
    },
    {
      "epoch": 3.539253129641417,
      "grad_norm": 0.5188554867506038,
      "learning_rate": 4.005411889068137e-05,
      "loss": 1.4662,
      "num_input_tokens_seen": 26247305248,
      "step": 33361
    },
    {
      "epoch": 3.5393592191809886,
      "grad_norm": 0.7594081627047242,
      "learning_rate": 4.005356404132351e-05,
      "loss": 1.4614,
      "num_input_tokens_seen": 26248092032,
      "step": 33362
    },
    {
      "epoch": 3.53946530872056,
      "grad_norm": 0.41422111062188227,
      "learning_rate": 4.005300918033269e-05,
      "loss": 1.3552,
      "num_input_tokens_seen": 26248878736,
      "step": 33363
    },
    {
      "epoch": 3.5395713982601316,
      "grad_norm": 0.645405559878878,
      "learning_rate": 4.005245430770934e-05,
      "loss": 1.5708,
      "num_input_tokens_seen": 26249665472,
      "step": 33364
    },
    {
      "epoch": 3.539677487799703,
      "grad_norm": 0.5393862802445054,
      "learning_rate": 4.005189942345391e-05,
      "loss": 1.412,
      "num_input_tokens_seen": 26250452288,
      "step": 33365
    },
    {
      "epoch": 3.5397835773392745,
      "grad_norm": 0.7218769940184983,
      "learning_rate": 4.00513445275668e-05,
      "loss": 1.363,
      "num_input_tokens_seen": 26251239136,
      "step": 33366
    },
    {
      "epoch": 3.539889666878846,
      "grad_norm": 0.49414208730630294,
      "learning_rate": 4.005078962004847e-05,
      "loss": 1.5076,
      "num_input_tokens_seen": 26252025904,
      "step": 33367
    },
    {
      "epoch": 3.539995756418417,
      "grad_norm": 0.4627656524627674,
      "learning_rate": 4.005023470089931e-05,
      "loss": 1.434,
      "num_input_tokens_seen": 26252812752,
      "step": 33368
    },
    {
      "epoch": 3.5401018459579885,
      "grad_norm": 0.44122942621175865,
      "learning_rate": 4.004967977011979e-05,
      "loss": 1.4151,
      "num_input_tokens_seen": 26253599488,
      "step": 33369
    },
    {
      "epoch": 3.54020793549756,
      "grad_norm": 0.43813188242331347,
      "learning_rate": 4.004912482771031e-05,
      "loss": 1.4752,
      "num_input_tokens_seen": 26254386272,
      "step": 33370
    },
    {
      "epoch": 3.5403140250371314,
      "grad_norm": 0.461336622376536,
      "learning_rate": 4.00485698736713e-05,
      "loss": 1.3507,
      "num_input_tokens_seen": 26255173040,
      "step": 33371
    },
    {
      "epoch": 3.540420114576703,
      "grad_norm": 0.5649146708836491,
      "learning_rate": 4.0048014908003204e-05,
      "loss": 1.5313,
      "num_input_tokens_seen": 26255959808,
      "step": 33372
    },
    {
      "epoch": 3.540526204116274,
      "grad_norm": 0.5903648199019821,
      "learning_rate": 4.004745993070645e-05,
      "loss": 1.4846,
      "num_input_tokens_seen": 26256746528,
      "step": 33373
    },
    {
      "epoch": 3.5406322936558454,
      "grad_norm": 0.47579687036080787,
      "learning_rate": 4.004690494178145e-05,
      "loss": 1.4283,
      "num_input_tokens_seen": 26257533360,
      "step": 33374
    },
    {
      "epoch": 3.540738383195417,
      "grad_norm": 0.8282246548380003,
      "learning_rate": 4.004634994122865e-05,
      "loss": 1.4462,
      "num_input_tokens_seen": 26258320096,
      "step": 33375
    },
    {
      "epoch": 3.5408444727349884,
      "grad_norm": 0.6641294156539154,
      "learning_rate": 4.004579492904848e-05,
      "loss": 1.5377,
      "num_input_tokens_seen": 26259106800,
      "step": 33376
    },
    {
      "epoch": 3.54095056227456,
      "grad_norm": 0.6136306590800568,
      "learning_rate": 4.0045239905241344e-05,
      "loss": 1.4643,
      "num_input_tokens_seen": 26259893632,
      "step": 33377
    },
    {
      "epoch": 3.541056651814131,
      "grad_norm": 0.5134606997914807,
      "learning_rate": 4.00446848698077e-05,
      "loss": 1.4222,
      "num_input_tokens_seen": 26260680464,
      "step": 33378
    },
    {
      "epoch": 3.541162741353703,
      "grad_norm": 0.5935657708227369,
      "learning_rate": 4.0044129822747955e-05,
      "loss": 1.5272,
      "num_input_tokens_seen": 26261467184,
      "step": 33379
    },
    {
      "epoch": 3.541268830893274,
      "grad_norm": 0.4657383835539319,
      "learning_rate": 4.004357476406256e-05,
      "loss": 1.4345,
      "num_input_tokens_seen": 26262253872,
      "step": 33380
    },
    {
      "epoch": 3.5413749204328453,
      "grad_norm": 0.5964398264609796,
      "learning_rate": 4.004301969375193e-05,
      "loss": 1.5609,
      "num_input_tokens_seen": 26263040640,
      "step": 33381
    },
    {
      "epoch": 3.5414810099724168,
      "grad_norm": 0.49073179348890783,
      "learning_rate": 4.004246461181649e-05,
      "loss": 1.5635,
      "num_input_tokens_seen": 26263827344,
      "step": 33382
    },
    {
      "epoch": 3.5415870995119882,
      "grad_norm": 0.49500572268874615,
      "learning_rate": 4.004190951825667e-05,
      "loss": 1.424,
      "num_input_tokens_seen": 26264614112,
      "step": 33383
    },
    {
      "epoch": 3.5416931890515597,
      "grad_norm": 0.5602016975269117,
      "learning_rate": 4.004135441307291e-05,
      "loss": 1.4354,
      "num_input_tokens_seen": 26265400832,
      "step": 33384
    },
    {
      "epoch": 3.5417992785911308,
      "grad_norm": 0.4203650810820445,
      "learning_rate": 4.004079929626563e-05,
      "loss": 1.4739,
      "num_input_tokens_seen": 26266187664,
      "step": 33385
    },
    {
      "epoch": 3.5419053681307022,
      "grad_norm": 0.5506621342718857,
      "learning_rate": 4.0040244167835266e-05,
      "loss": 1.5667,
      "num_input_tokens_seen": 26266974352,
      "step": 33386
    },
    {
      "epoch": 3.5420114576702737,
      "grad_norm": 0.5145028736857198,
      "learning_rate": 4.003968902778224e-05,
      "loss": 1.4896,
      "num_input_tokens_seen": 26267761168,
      "step": 33387
    },
    {
      "epoch": 3.542117547209845,
      "grad_norm": 0.4373792771304899,
      "learning_rate": 4.0039133876106985e-05,
      "loss": 1.4676,
      "num_input_tokens_seen": 26268547952,
      "step": 33388
    },
    {
      "epoch": 3.5422236367494166,
      "grad_norm": 0.548627775319921,
      "learning_rate": 4.0038578712809924e-05,
      "loss": 1.4316,
      "num_input_tokens_seen": 26269334768,
      "step": 33389
    },
    {
      "epoch": 3.5423297262889877,
      "grad_norm": 0.4702224620727645,
      "learning_rate": 4.00380235378915e-05,
      "loss": 1.5019,
      "num_input_tokens_seen": 26270121568,
      "step": 33390
    },
    {
      "epoch": 3.542435815828559,
      "grad_norm": 0.5864818855355511,
      "learning_rate": 4.003746835135212e-05,
      "loss": 1.5199,
      "num_input_tokens_seen": 26270908272,
      "step": 33391
    },
    {
      "epoch": 3.5425419053681306,
      "grad_norm": 0.4037511230721259,
      "learning_rate": 4.003691315319224e-05,
      "loss": 1.5173,
      "num_input_tokens_seen": 26271695088,
      "step": 33392
    },
    {
      "epoch": 3.542647994907702,
      "grad_norm": 0.4698723528323873,
      "learning_rate": 4.003635794341227e-05,
      "loss": 1.533,
      "num_input_tokens_seen": 26272481840,
      "step": 33393
    },
    {
      "epoch": 3.5427540844472736,
      "grad_norm": 0.40174453928044807,
      "learning_rate": 4.003580272201264e-05,
      "loss": 1.3759,
      "num_input_tokens_seen": 26273268592,
      "step": 33394
    },
    {
      "epoch": 3.542860173986845,
      "grad_norm": 0.48242516938721647,
      "learning_rate": 4.003524748899379e-05,
      "loss": 1.4524,
      "num_input_tokens_seen": 26274055328,
      "step": 33395
    },
    {
      "epoch": 3.5429662635264165,
      "grad_norm": 0.3979591073157052,
      "learning_rate": 4.003469224435613e-05,
      "loss": 1.4174,
      "num_input_tokens_seen": 26274842224,
      "step": 33396
    },
    {
      "epoch": 3.5430723530659876,
      "grad_norm": 0.6253964011819904,
      "learning_rate": 4.003413698810011e-05,
      "loss": 1.5154,
      "num_input_tokens_seen": 26275628928,
      "step": 33397
    },
    {
      "epoch": 3.543178442605559,
      "grad_norm": 0.4450407966584829,
      "learning_rate": 4.003358172022614e-05,
      "loss": 1.3928,
      "num_input_tokens_seen": 26276415712,
      "step": 33398
    },
    {
      "epoch": 3.5432845321451305,
      "grad_norm": 0.688871526246441,
      "learning_rate": 4.003302644073467e-05,
      "loss": 1.4924,
      "num_input_tokens_seen": 26277202544,
      "step": 33399
    },
    {
      "epoch": 3.543390621684702,
      "grad_norm": 0.6269316582497233,
      "learning_rate": 4.0032471149626114e-05,
      "loss": 1.4852,
      "num_input_tokens_seen": 26277989264,
      "step": 33400
    },
    {
      "epoch": 3.5434967112242735,
      "grad_norm": 0.4975066753537397,
      "learning_rate": 4.0031915846900905e-05,
      "loss": 1.4074,
      "num_input_tokens_seen": 26278776048,
      "step": 33401
    },
    {
      "epoch": 3.5436028007638445,
      "grad_norm": 0.5056453564043737,
      "learning_rate": 4.003136053255948e-05,
      "loss": 1.513,
      "num_input_tokens_seen": 26279562800,
      "step": 33402
    },
    {
      "epoch": 3.543708890303416,
      "grad_norm": 0.4620031764673872,
      "learning_rate": 4.003080520660225e-05,
      "loss": 1.4545,
      "num_input_tokens_seen": 26280349600,
      "step": 33403
    },
    {
      "epoch": 3.5438149798429874,
      "grad_norm": 0.46493606430329576,
      "learning_rate": 4.003024986902966e-05,
      "loss": 1.5708,
      "num_input_tokens_seen": 26281136240,
      "step": 33404
    },
    {
      "epoch": 3.543921069382559,
      "grad_norm": 0.552748672705047,
      "learning_rate": 4.002969451984213e-05,
      "loss": 1.4758,
      "num_input_tokens_seen": 26281923040,
      "step": 33405
    },
    {
      "epoch": 3.5440271589221304,
      "grad_norm": 0.4405096745422118,
      "learning_rate": 4.00291391590401e-05,
      "loss": 1.3915,
      "num_input_tokens_seen": 26282709856,
      "step": 33406
    },
    {
      "epoch": 3.5441332484617014,
      "grad_norm": 0.5582103342935953,
      "learning_rate": 4.0028583786623986e-05,
      "loss": 1.4511,
      "num_input_tokens_seen": 26283496608,
      "step": 33407
    },
    {
      "epoch": 3.5442393380012733,
      "grad_norm": 0.4975862187178045,
      "learning_rate": 4.0028028402594225e-05,
      "loss": 1.4111,
      "num_input_tokens_seen": 26284283360,
      "step": 33408
    },
    {
      "epoch": 3.5443454275408444,
      "grad_norm": 0.47474656205040205,
      "learning_rate": 4.002747300695124e-05,
      "loss": 1.4956,
      "num_input_tokens_seen": 26285070208,
      "step": 33409
    },
    {
      "epoch": 3.544451517080416,
      "grad_norm": 1.0059734299164784,
      "learning_rate": 4.002691759969547e-05,
      "loss": 1.4054,
      "num_input_tokens_seen": 26285857024,
      "step": 33410
    },
    {
      "epoch": 3.5445576066199873,
      "grad_norm": 0.4970032009220287,
      "learning_rate": 4.002636218082734e-05,
      "loss": 1.4738,
      "num_input_tokens_seen": 26286643744,
      "step": 33411
    },
    {
      "epoch": 3.544663696159559,
      "grad_norm": 0.712670515432479,
      "learning_rate": 4.002580675034728e-05,
      "loss": 1.4668,
      "num_input_tokens_seen": 26287430576,
      "step": 33412
    },
    {
      "epoch": 3.5447697856991303,
      "grad_norm": 0.537152409932199,
      "learning_rate": 4.002525130825572e-05,
      "loss": 1.5003,
      "num_input_tokens_seen": 26288217312,
      "step": 33413
    },
    {
      "epoch": 3.5448758752387013,
      "grad_norm": 0.8588913399933933,
      "learning_rate": 4.002469585455307e-05,
      "loss": 1.4398,
      "num_input_tokens_seen": 26289003968,
      "step": 33414
    },
    {
      "epoch": 3.5449819647782728,
      "grad_norm": 0.5971695361951901,
      "learning_rate": 4.002414038923979e-05,
      "loss": 1.4442,
      "num_input_tokens_seen": 26289790736,
      "step": 33415
    },
    {
      "epoch": 3.5450880543178442,
      "grad_norm": 0.748003313325806,
      "learning_rate": 4.0023584912316294e-05,
      "loss": 1.4041,
      "num_input_tokens_seen": 26290577472,
      "step": 33416
    },
    {
      "epoch": 3.5451941438574157,
      "grad_norm": 0.6031993372262073,
      "learning_rate": 4.002302942378301e-05,
      "loss": 1.4817,
      "num_input_tokens_seen": 26291364272,
      "step": 33417
    },
    {
      "epoch": 3.545300233396987,
      "grad_norm": 0.5064457337782815,
      "learning_rate": 4.002247392364037e-05,
      "loss": 1.4403,
      "num_input_tokens_seen": 26292150976,
      "step": 33418
    },
    {
      "epoch": 3.545406322936558,
      "grad_norm": 0.7165382387884419,
      "learning_rate": 4.0021918411888805e-05,
      "loss": 1.581,
      "num_input_tokens_seen": 26292937776,
      "step": 33419
    },
    {
      "epoch": 3.5455124124761297,
      "grad_norm": 0.48013757026102255,
      "learning_rate": 4.002136288852874e-05,
      "loss": 1.4901,
      "num_input_tokens_seen": 26293724512,
      "step": 33420
    },
    {
      "epoch": 3.545618502015701,
      "grad_norm": 0.5781279670041383,
      "learning_rate": 4.0020807353560606e-05,
      "loss": 1.4772,
      "num_input_tokens_seen": 26294511200,
      "step": 33421
    },
    {
      "epoch": 3.5457245915552726,
      "grad_norm": 0.6217935231405461,
      "learning_rate": 4.002025180698483e-05,
      "loss": 1.4189,
      "num_input_tokens_seen": 26295297952,
      "step": 33422
    },
    {
      "epoch": 3.545830681094844,
      "grad_norm": 0.6051330466551372,
      "learning_rate": 4.0019696248801855e-05,
      "loss": 1.3581,
      "num_input_tokens_seen": 26296084848,
      "step": 33423
    },
    {
      "epoch": 3.5459367706344156,
      "grad_norm": 0.957568900674093,
      "learning_rate": 4.001914067901209e-05,
      "loss": 1.4128,
      "num_input_tokens_seen": 26296871664,
      "step": 33424
    },
    {
      "epoch": 3.546042860173987,
      "grad_norm": 0.5235547953128867,
      "learning_rate": 4.0018585097615976e-05,
      "loss": 1.3343,
      "num_input_tokens_seen": 26297658352,
      "step": 33425
    },
    {
      "epoch": 3.546148949713558,
      "grad_norm": 0.9516880125908211,
      "learning_rate": 4.0018029504613944e-05,
      "loss": 1.3771,
      "num_input_tokens_seen": 26298445232,
      "step": 33426
    },
    {
      "epoch": 3.5462550392531296,
      "grad_norm": 0.5090200846944162,
      "learning_rate": 4.001747390000641e-05,
      "loss": 1.4337,
      "num_input_tokens_seen": 26299232032,
      "step": 33427
    },
    {
      "epoch": 3.546361128792701,
      "grad_norm": 0.749513967484996,
      "learning_rate": 4.001691828379382e-05,
      "loss": 1.4375,
      "num_input_tokens_seen": 26300018896,
      "step": 33428
    },
    {
      "epoch": 3.5464672183322725,
      "grad_norm": 0.6098610818395255,
      "learning_rate": 4.001636265597659e-05,
      "loss": 1.444,
      "num_input_tokens_seen": 26300805632,
      "step": 33429
    },
    {
      "epoch": 3.546573307871844,
      "grad_norm": 0.7603334236049708,
      "learning_rate": 4.001580701655516e-05,
      "loss": 1.41,
      "num_input_tokens_seen": 26301592400,
      "step": 33430
    },
    {
      "epoch": 3.546679397411415,
      "grad_norm": 0.5974060033564478,
      "learning_rate": 4.001525136552996e-05,
      "loss": 1.556,
      "num_input_tokens_seen": 26302379184,
      "step": 33431
    },
    {
      "epoch": 3.5467854869509865,
      "grad_norm": 0.5799980821292321,
      "learning_rate": 4.001469570290141e-05,
      "loss": 1.5063,
      "num_input_tokens_seen": 26303165952,
      "step": 33432
    },
    {
      "epoch": 3.546891576490558,
      "grad_norm": 0.5371929597007571,
      "learning_rate": 4.001414002866994e-05,
      "loss": 1.6088,
      "num_input_tokens_seen": 26303952736,
      "step": 33433
    },
    {
      "epoch": 3.5469976660301294,
      "grad_norm": 0.6128377359359589,
      "learning_rate": 4.0013584342835984e-05,
      "loss": 1.4354,
      "num_input_tokens_seen": 26304739472,
      "step": 33434
    },
    {
      "epoch": 3.547103755569701,
      "grad_norm": 0.6158797609233893,
      "learning_rate": 4.0013028645399974e-05,
      "loss": 1.5589,
      "num_input_tokens_seen": 26305526208,
      "step": 33435
    },
    {
      "epoch": 3.547209845109272,
      "grad_norm": 0.6978174329440359,
      "learning_rate": 4.001247293636233e-05,
      "loss": 1.4867,
      "num_input_tokens_seen": 26306313024,
      "step": 33436
    },
    {
      "epoch": 3.547315934648844,
      "grad_norm": 0.6759479155493333,
      "learning_rate": 4.001191721572349e-05,
      "loss": 1.5845,
      "num_input_tokens_seen": 26307099824,
      "step": 33437
    },
    {
      "epoch": 3.547422024188415,
      "grad_norm": 0.45339316710032707,
      "learning_rate": 4.001136148348389e-05,
      "loss": 1.426,
      "num_input_tokens_seen": 26307886640,
      "step": 33438
    },
    {
      "epoch": 3.5475281137279864,
      "grad_norm": 0.504565218584292,
      "learning_rate": 4.001080573964394e-05,
      "loss": 1.5299,
      "num_input_tokens_seen": 26308673360,
      "step": 33439
    },
    {
      "epoch": 3.547634203267558,
      "grad_norm": 0.48647689850605486,
      "learning_rate": 4.0010249984204084e-05,
      "loss": 1.5064,
      "num_input_tokens_seen": 26309460144,
      "step": 33440
    },
    {
      "epoch": 3.5477402928071293,
      "grad_norm": 0.45334440726825986,
      "learning_rate": 4.000969421716475e-05,
      "loss": 1.4226,
      "num_input_tokens_seen": 26310246992,
      "step": 33441
    },
    {
      "epoch": 3.547846382346701,
      "grad_norm": 0.4599757004877373,
      "learning_rate": 4.000913843852636e-05,
      "loss": 1.3505,
      "num_input_tokens_seen": 26311033728,
      "step": 33442
    },
    {
      "epoch": 3.547952471886272,
      "grad_norm": 0.42857547891431236,
      "learning_rate": 4.000858264828935e-05,
      "loss": 1.4693,
      "num_input_tokens_seen": 26311820464,
      "step": 33443
    },
    {
      "epoch": 3.5480585614258433,
      "grad_norm": 0.4977438740146203,
      "learning_rate": 4.000802684645415e-05,
      "loss": 1.5427,
      "num_input_tokens_seen": 26312607216,
      "step": 33444
    },
    {
      "epoch": 3.548164650965415,
      "grad_norm": 0.4517774681776054,
      "learning_rate": 4.000747103302118e-05,
      "loss": 1.398,
      "num_input_tokens_seen": 26313394032,
      "step": 33445
    },
    {
      "epoch": 3.5482707405049863,
      "grad_norm": 0.45241039858055526,
      "learning_rate": 4.000691520799088e-05,
      "loss": 1.4502,
      "num_input_tokens_seen": 26314180736,
      "step": 33446
    },
    {
      "epoch": 3.5483768300445577,
      "grad_norm": 0.4367177095763627,
      "learning_rate": 4.000635937136368e-05,
      "loss": 1.4518,
      "num_input_tokens_seen": 26314967392,
      "step": 33447
    },
    {
      "epoch": 3.5484829195841288,
      "grad_norm": 0.46188134216742455,
      "learning_rate": 4.000580352314001e-05,
      "loss": 1.4258,
      "num_input_tokens_seen": 26315754160,
      "step": 33448
    },
    {
      "epoch": 3.5485890091237007,
      "grad_norm": 0.4615021719206726,
      "learning_rate": 4.000524766332028e-05,
      "loss": 1.5463,
      "num_input_tokens_seen": 26316540944,
      "step": 33449
    },
    {
      "epoch": 3.5486950986632717,
      "grad_norm": 0.4306838074847117,
      "learning_rate": 4.000469179190495e-05,
      "loss": 1.4811,
      "num_input_tokens_seen": 26317327712,
      "step": 33450
    },
    {
      "epoch": 3.548801188202843,
      "grad_norm": 0.4953726646394312,
      "learning_rate": 4.000413590889443e-05,
      "loss": 1.4293,
      "num_input_tokens_seen": 26318114544,
      "step": 33451
    },
    {
      "epoch": 3.5489072777424147,
      "grad_norm": 0.4026987027786294,
      "learning_rate": 4.0003580014289144e-05,
      "loss": 1.4042,
      "num_input_tokens_seen": 26318901360,
      "step": 33452
    },
    {
      "epoch": 3.549013367281986,
      "grad_norm": 0.45438509353707895,
      "learning_rate": 4.000302410808954e-05,
      "loss": 1.502,
      "num_input_tokens_seen": 26319688160,
      "step": 33453
    },
    {
      "epoch": 3.5491194568215576,
      "grad_norm": 0.4472569311502514,
      "learning_rate": 4.0002468190296036e-05,
      "loss": 1.4473,
      "num_input_tokens_seen": 26320474848,
      "step": 33454
    },
    {
      "epoch": 3.5492255463611286,
      "grad_norm": 0.4187812370895379,
      "learning_rate": 4.000191226090907e-05,
      "loss": 1.4301,
      "num_input_tokens_seen": 26321261648,
      "step": 33455
    },
    {
      "epoch": 3.5493316359007,
      "grad_norm": 0.47461410707034907,
      "learning_rate": 4.000135631992906e-05,
      "loss": 1.5823,
      "num_input_tokens_seen": 26322048560,
      "step": 33456
    },
    {
      "epoch": 3.5494377254402716,
      "grad_norm": 0.5016232047825261,
      "learning_rate": 4.000080036735645e-05,
      "loss": 1.454,
      "num_input_tokens_seen": 26322835264,
      "step": 33457
    },
    {
      "epoch": 3.549543814979843,
      "grad_norm": 0.5472462929293805,
      "learning_rate": 4.000024440319166e-05,
      "loss": 1.4937,
      "num_input_tokens_seen": 26323622032,
      "step": 33458
    },
    {
      "epoch": 3.5496499045194145,
      "grad_norm": 0.3957277069934133,
      "learning_rate": 3.999968842743511e-05,
      "loss": 1.3746,
      "num_input_tokens_seen": 26324408768,
      "step": 33459
    },
    {
      "epoch": 3.5497559940589856,
      "grad_norm": 0.4783632408938752,
      "learning_rate": 3.999913244008725e-05,
      "loss": 1.4724,
      "num_input_tokens_seen": 26325195504,
      "step": 33460
    },
    {
      "epoch": 3.549862083598557,
      "grad_norm": 0.47544381151550313,
      "learning_rate": 3.99985764411485e-05,
      "loss": 1.578,
      "num_input_tokens_seen": 26325982256,
      "step": 33461
    },
    {
      "epoch": 3.5499681731381285,
      "grad_norm": 0.4190761928827675,
      "learning_rate": 3.999802043061929e-05,
      "loss": 1.4932,
      "num_input_tokens_seen": 26326769024,
      "step": 33462
    },
    {
      "epoch": 3.5500742626777,
      "grad_norm": 0.485684183495883,
      "learning_rate": 3.999746440850005e-05,
      "loss": 1.4459,
      "num_input_tokens_seen": 26327555840,
      "step": 33463
    },
    {
      "epoch": 3.5501803522172715,
      "grad_norm": 0.6093423675436792,
      "learning_rate": 3.999690837479121e-05,
      "loss": 1.4148,
      "num_input_tokens_seen": 26328342688,
      "step": 33464
    },
    {
      "epoch": 3.550286441756843,
      "grad_norm": 0.45996961894419813,
      "learning_rate": 3.9996352329493205e-05,
      "loss": 1.4567,
      "num_input_tokens_seen": 26329129536,
      "step": 33465
    },
    {
      "epoch": 3.5503925312964144,
      "grad_norm": 0.6491261917300231,
      "learning_rate": 3.999579627260645e-05,
      "loss": 1.3675,
      "num_input_tokens_seen": 26329916272,
      "step": 33466
    },
    {
      "epoch": 3.5504986208359854,
      "grad_norm": 0.5022916882797466,
      "learning_rate": 3.999524020413139e-05,
      "loss": 1.4796,
      "num_input_tokens_seen": 26330703040,
      "step": 33467
    },
    {
      "epoch": 3.550604710375557,
      "grad_norm": 0.44264818125153665,
      "learning_rate": 3.999468412406844e-05,
      "loss": 1.5014,
      "num_input_tokens_seen": 26331489840,
      "step": 33468
    },
    {
      "epoch": 3.5507107999151284,
      "grad_norm": 0.4766801112812952,
      "learning_rate": 3.9994128032418045e-05,
      "loss": 1.4276,
      "num_input_tokens_seen": 26332276656,
      "step": 33469
    },
    {
      "epoch": 3.5508168894547,
      "grad_norm": 0.7032289931913099,
      "learning_rate": 3.9993571929180625e-05,
      "loss": 1.4991,
      "num_input_tokens_seen": 26333063376,
      "step": 33470
    },
    {
      "epoch": 3.5509229789942713,
      "grad_norm": 0.7095544713858444,
      "learning_rate": 3.999301581435661e-05,
      "loss": 1.4123,
      "num_input_tokens_seen": 26333850128,
      "step": 33471
    },
    {
      "epoch": 3.5510290685338424,
      "grad_norm": 0.5687496642570516,
      "learning_rate": 3.999245968794644e-05,
      "loss": 1.4315,
      "num_input_tokens_seen": 26334636928,
      "step": 33472
    },
    {
      "epoch": 3.551135158073414,
      "grad_norm": 0.5455859047947073,
      "learning_rate": 3.999190354995053e-05,
      "loss": 1.4635,
      "num_input_tokens_seen": 26335423744,
      "step": 33473
    },
    {
      "epoch": 3.5512412476129853,
      "grad_norm": 0.5789795964716171,
      "learning_rate": 3.999134740036932e-05,
      "loss": 1.4348,
      "num_input_tokens_seen": 26336210528,
      "step": 33474
    },
    {
      "epoch": 3.551347337152557,
      "grad_norm": 0.5416819250645106,
      "learning_rate": 3.999079123920323e-05,
      "loss": 1.4816,
      "num_input_tokens_seen": 26336997296,
      "step": 33475
    },
    {
      "epoch": 3.5514534266921283,
      "grad_norm": 0.4678519602449338,
      "learning_rate": 3.999023506645271e-05,
      "loss": 1.4422,
      "num_input_tokens_seen": 26337784032,
      "step": 33476
    },
    {
      "epoch": 3.5515595162316993,
      "grad_norm": 0.585374311638444,
      "learning_rate": 3.9989678882118164e-05,
      "loss": 1.4958,
      "num_input_tokens_seen": 26338570864,
      "step": 33477
    },
    {
      "epoch": 3.551665605771271,
      "grad_norm": 0.5110889210871643,
      "learning_rate": 3.9989122686200046e-05,
      "loss": 1.4145,
      "num_input_tokens_seen": 26339357632,
      "step": 33478
    },
    {
      "epoch": 3.5517716953108422,
      "grad_norm": 0.47460681526158466,
      "learning_rate": 3.998856647869876e-05,
      "loss": 1.3295,
      "num_input_tokens_seen": 26340144416,
      "step": 33479
    },
    {
      "epoch": 3.5518777848504137,
      "grad_norm": 0.47542653418812214,
      "learning_rate": 3.9988010259614756e-05,
      "loss": 1.4639,
      "num_input_tokens_seen": 26340931184,
      "step": 33480
    },
    {
      "epoch": 3.551983874389985,
      "grad_norm": 0.5005228699730764,
      "learning_rate": 3.998745402894846e-05,
      "loss": 1.548,
      "num_input_tokens_seen": 26341718000,
      "step": 33481
    },
    {
      "epoch": 3.5520899639295567,
      "grad_norm": 0.5064860437399914,
      "learning_rate": 3.9986897786700295e-05,
      "loss": 1.476,
      "num_input_tokens_seen": 26342504720,
      "step": 33482
    },
    {
      "epoch": 3.552196053469128,
      "grad_norm": 0.4024644141618303,
      "learning_rate": 3.9986341532870696e-05,
      "loss": 1.3709,
      "num_input_tokens_seen": 26343291488,
      "step": 33483
    },
    {
      "epoch": 3.552302143008699,
      "grad_norm": 0.4732430160478333,
      "learning_rate": 3.99857852674601e-05,
      "loss": 1.4183,
      "num_input_tokens_seen": 26344078272,
      "step": 33484
    },
    {
      "epoch": 3.5524082325482707,
      "grad_norm": 0.5120886906212455,
      "learning_rate": 3.998522899046891e-05,
      "loss": 1.4324,
      "num_input_tokens_seen": 26344865056,
      "step": 33485
    },
    {
      "epoch": 3.552514322087842,
      "grad_norm": 0.4645364737994243,
      "learning_rate": 3.998467270189759e-05,
      "loss": 1.5034,
      "num_input_tokens_seen": 26345651680,
      "step": 33486
    },
    {
      "epoch": 3.5526204116274136,
      "grad_norm": 0.6309565747253152,
      "learning_rate": 3.9984116401746554e-05,
      "loss": 1.5915,
      "num_input_tokens_seen": 26346438384,
      "step": 33487
    },
    {
      "epoch": 3.552726501166985,
      "grad_norm": 0.4640159101213638,
      "learning_rate": 3.998356009001622e-05,
      "loss": 1.5023,
      "num_input_tokens_seen": 26347225200,
      "step": 33488
    },
    {
      "epoch": 3.552832590706556,
      "grad_norm": 0.5515659952176075,
      "learning_rate": 3.998300376670705e-05,
      "loss": 1.4228,
      "num_input_tokens_seen": 26348011840,
      "step": 33489
    },
    {
      "epoch": 3.5529386802461276,
      "grad_norm": 0.6870593640072047,
      "learning_rate": 3.998244743181944e-05,
      "loss": 1.4749,
      "num_input_tokens_seen": 26348798688,
      "step": 33490
    },
    {
      "epoch": 3.553044769785699,
      "grad_norm": 0.4104684161169785,
      "learning_rate": 3.998189108535384e-05,
      "loss": 1.3773,
      "num_input_tokens_seen": 26349585584,
      "step": 33491
    },
    {
      "epoch": 3.5531508593252705,
      "grad_norm": 0.6666910635788007,
      "learning_rate": 3.998133472731067e-05,
      "loss": 1.4826,
      "num_input_tokens_seen": 26350372288,
      "step": 33492
    },
    {
      "epoch": 3.553256948864842,
      "grad_norm": 0.4811092825333211,
      "learning_rate": 3.998077835769037e-05,
      "loss": 1.3458,
      "num_input_tokens_seen": 26351159120,
      "step": 33493
    },
    {
      "epoch": 3.5533630384044135,
      "grad_norm": 0.6563791052826133,
      "learning_rate": 3.998022197649336e-05,
      "loss": 1.4703,
      "num_input_tokens_seen": 26351945840,
      "step": 33494
    },
    {
      "epoch": 3.553469127943985,
      "grad_norm": 0.659746401432794,
      "learning_rate": 3.9979665583720074e-05,
      "loss": 1.5483,
      "num_input_tokens_seen": 26352732656,
      "step": 33495
    },
    {
      "epoch": 3.553575217483556,
      "grad_norm": 0.47172152697044717,
      "learning_rate": 3.9979109179370946e-05,
      "loss": 1.4315,
      "num_input_tokens_seen": 26353519376,
      "step": 33496
    },
    {
      "epoch": 3.5536813070231275,
      "grad_norm": 0.73385519813138,
      "learning_rate": 3.99785527634464e-05,
      "loss": 1.4997,
      "num_input_tokens_seen": 26354306160,
      "step": 33497
    },
    {
      "epoch": 3.553787396562699,
      "grad_norm": 0.562269729753518,
      "learning_rate": 3.9977996335946865e-05,
      "loss": 1.4375,
      "num_input_tokens_seen": 26355092944,
      "step": 33498
    },
    {
      "epoch": 3.5538934861022704,
      "grad_norm": 0.7960202510195606,
      "learning_rate": 3.9977439896872774e-05,
      "loss": 1.4941,
      "num_input_tokens_seen": 26355879792,
      "step": 33499
    },
    {
      "epoch": 3.553999575641842,
      "grad_norm": 0.6926774695154169,
      "learning_rate": 3.997688344622455e-05,
      "loss": 1.5055,
      "num_input_tokens_seen": 26356666432,
      "step": 33500
    },
    {
      "epoch": 3.554105665181413,
      "grad_norm": 0.40482661995866975,
      "learning_rate": 3.9976326984002644e-05,
      "loss": 1.3608,
      "num_input_tokens_seen": 26357453168,
      "step": 33501
    },
    {
      "epoch": 3.5542117547209844,
      "grad_norm": 1.3271771363832223,
      "learning_rate": 3.9975770510207466e-05,
      "loss": 1.4886,
      "num_input_tokens_seen": 26358239824,
      "step": 33502
    },
    {
      "epoch": 3.554317844260556,
      "grad_norm": 0.7519194264635651,
      "learning_rate": 3.997521402483946e-05,
      "loss": 1.4601,
      "num_input_tokens_seen": 26359026528,
      "step": 33503
    },
    {
      "epoch": 3.5544239338001273,
      "grad_norm": 1.3156769158320478,
      "learning_rate": 3.997465752789903e-05,
      "loss": 1.4521,
      "num_input_tokens_seen": 26359813264,
      "step": 33504
    },
    {
      "epoch": 3.554530023339699,
      "grad_norm": 1.0288424927525979,
      "learning_rate": 3.9974101019386636e-05,
      "loss": 1.4519,
      "num_input_tokens_seen": 26360600048,
      "step": 33505
    },
    {
      "epoch": 3.55463611287927,
      "grad_norm": 0.7520427129426249,
      "learning_rate": 3.997354449930269e-05,
      "loss": 1.4529,
      "num_input_tokens_seen": 26361386704,
      "step": 33506
    },
    {
      "epoch": 3.5547422024188418,
      "grad_norm": 0.719036261258495,
      "learning_rate": 3.997298796764764e-05,
      "loss": 1.5596,
      "num_input_tokens_seen": 26362173536,
      "step": 33507
    },
    {
      "epoch": 3.554848291958413,
      "grad_norm": 0.6580027000728003,
      "learning_rate": 3.99724314244219e-05,
      "loss": 1.3939,
      "num_input_tokens_seen": 26362960288,
      "step": 33508
    },
    {
      "epoch": 3.5549543814979843,
      "grad_norm": 0.5926954621916175,
      "learning_rate": 3.9971874869625896e-05,
      "loss": 1.4769,
      "num_input_tokens_seen": 26363747104,
      "step": 33509
    },
    {
      "epoch": 3.5550604710375557,
      "grad_norm": 0.6473116368556084,
      "learning_rate": 3.997131830326007e-05,
      "loss": 1.4747,
      "num_input_tokens_seen": 26364533840,
      "step": 33510
    },
    {
      "epoch": 3.555166560577127,
      "grad_norm": 0.4572782586947898,
      "learning_rate": 3.997076172532486e-05,
      "loss": 1.4554,
      "num_input_tokens_seen": 26365320672,
      "step": 33511
    },
    {
      "epoch": 3.5552726501166987,
      "grad_norm": 0.6914135010224359,
      "learning_rate": 3.997020513582067e-05,
      "loss": 1.3392,
      "num_input_tokens_seen": 26366107392,
      "step": 33512
    },
    {
      "epoch": 3.5553787396562697,
      "grad_norm": 0.4708388568171501,
      "learning_rate": 3.996964853474795e-05,
      "loss": 1.3928,
      "num_input_tokens_seen": 26366894224,
      "step": 33513
    },
    {
      "epoch": 3.555484829195841,
      "grad_norm": 0.5452520014358929,
      "learning_rate": 3.996909192210712e-05,
      "loss": 1.5411,
      "num_input_tokens_seen": 26367681008,
      "step": 33514
    },
    {
      "epoch": 3.5555909187354127,
      "grad_norm": 0.49994190222096185,
      "learning_rate": 3.996853529789862e-05,
      "loss": 1.4623,
      "num_input_tokens_seen": 26368467680,
      "step": 33515
    },
    {
      "epoch": 3.555697008274984,
      "grad_norm": 0.4839072598722242,
      "learning_rate": 3.996797866212287e-05,
      "loss": 1.5201,
      "num_input_tokens_seen": 26369254496,
      "step": 33516
    },
    {
      "epoch": 3.5558030978145556,
      "grad_norm": 0.45892640192090367,
      "learning_rate": 3.996742201478031e-05,
      "loss": 1.4303,
      "num_input_tokens_seen": 26370041200,
      "step": 33517
    },
    {
      "epoch": 3.5559091873541266,
      "grad_norm": 0.4531877280013174,
      "learning_rate": 3.996686535587136e-05,
      "loss": 1.4517,
      "num_input_tokens_seen": 26370828016,
      "step": 33518
    },
    {
      "epoch": 3.556015276893698,
      "grad_norm": 0.5127710408948537,
      "learning_rate": 3.996630868539647e-05,
      "loss": 1.4889,
      "num_input_tokens_seen": 26371614880,
      "step": 33519
    },
    {
      "epoch": 3.5561213664332696,
      "grad_norm": 0.4637663174018589,
      "learning_rate": 3.9965752003356044e-05,
      "loss": 1.4114,
      "num_input_tokens_seen": 26372401648,
      "step": 33520
    },
    {
      "epoch": 3.556227455972841,
      "grad_norm": 0.5167153465949355,
      "learning_rate": 3.9965195309750524e-05,
      "loss": 1.4162,
      "num_input_tokens_seen": 26373188368,
      "step": 33521
    },
    {
      "epoch": 3.5563335455124125,
      "grad_norm": 0.4300445795250969,
      "learning_rate": 3.996463860458035e-05,
      "loss": 1.5183,
      "num_input_tokens_seen": 26373975072,
      "step": 33522
    },
    {
      "epoch": 3.556439635051984,
      "grad_norm": 0.5061636653377349,
      "learning_rate": 3.996408188784593e-05,
      "loss": 1.5635,
      "num_input_tokens_seen": 26374761808,
      "step": 33523
    },
    {
      "epoch": 3.5565457245915555,
      "grad_norm": 0.6464000256783391,
      "learning_rate": 3.996352515954771e-05,
      "loss": 1.6159,
      "num_input_tokens_seen": 26375548592,
      "step": 33524
    },
    {
      "epoch": 3.5566518141311265,
      "grad_norm": 0.4793574534303806,
      "learning_rate": 3.996296841968612e-05,
      "loss": 1.3445,
      "num_input_tokens_seen": 26376335440,
      "step": 33525
    },
    {
      "epoch": 3.556757903670698,
      "grad_norm": 0.5528585440356569,
      "learning_rate": 3.996241166826159e-05,
      "loss": 1.4689,
      "num_input_tokens_seen": 26377122128,
      "step": 33526
    },
    {
      "epoch": 3.5568639932102695,
      "grad_norm": 0.6223178520232964,
      "learning_rate": 3.996185490527454e-05,
      "loss": 1.4673,
      "num_input_tokens_seen": 26377908960,
      "step": 33527
    },
    {
      "epoch": 3.556970082749841,
      "grad_norm": 0.4226326859278294,
      "learning_rate": 3.996129813072541e-05,
      "loss": 1.473,
      "num_input_tokens_seen": 26378695744,
      "step": 33528
    },
    {
      "epoch": 3.5570761722894124,
      "grad_norm": 0.5510389299604359,
      "learning_rate": 3.996074134461463e-05,
      "loss": 1.498,
      "num_input_tokens_seen": 26379482496,
      "step": 33529
    },
    {
      "epoch": 3.5571822618289834,
      "grad_norm": 0.46355304004370135,
      "learning_rate": 3.9960184546942625e-05,
      "loss": 1.4275,
      "num_input_tokens_seen": 26380269392,
      "step": 33530
    },
    {
      "epoch": 3.557288351368555,
      "grad_norm": 0.44722064550993834,
      "learning_rate": 3.995962773770982e-05,
      "loss": 1.511,
      "num_input_tokens_seen": 26381056192,
      "step": 33531
    },
    {
      "epoch": 3.5573944409081264,
      "grad_norm": 0.5258166363865716,
      "learning_rate": 3.995907091691667e-05,
      "loss": 1.3928,
      "num_input_tokens_seen": 26381843056,
      "step": 33532
    },
    {
      "epoch": 3.557500530447698,
      "grad_norm": 0.43223495080123137,
      "learning_rate": 3.995851408456358e-05,
      "loss": 1.4227,
      "num_input_tokens_seen": 26382629872,
      "step": 33533
    },
    {
      "epoch": 3.5576066199872693,
      "grad_norm": 0.45549197114682155,
      "learning_rate": 3.9957957240650986e-05,
      "loss": 1.5702,
      "num_input_tokens_seen": 26383416672,
      "step": 33534
    },
    {
      "epoch": 3.5577127095268404,
      "grad_norm": 0.604890422130492,
      "learning_rate": 3.9957400385179333e-05,
      "loss": 1.5447,
      "num_input_tokens_seen": 26384203536,
      "step": 33535
    },
    {
      "epoch": 3.5578187990664123,
      "grad_norm": 0.4299669319767776,
      "learning_rate": 3.9956843518149035e-05,
      "loss": 1.4054,
      "num_input_tokens_seen": 26384990304,
      "step": 33536
    },
    {
      "epoch": 3.5579248886059833,
      "grad_norm": 0.4530246476547636,
      "learning_rate": 3.9956286639560525e-05,
      "loss": 1.4278,
      "num_input_tokens_seen": 26385777136,
      "step": 33537
    },
    {
      "epoch": 3.558030978145555,
      "grad_norm": 0.43858072603731013,
      "learning_rate": 3.995572974941424e-05,
      "loss": 1.5361,
      "num_input_tokens_seen": 26386563920,
      "step": 33538
    },
    {
      "epoch": 3.5581370676851263,
      "grad_norm": 0.47553320597757087,
      "learning_rate": 3.99551728477106e-05,
      "loss": 1.382,
      "num_input_tokens_seen": 26387350784,
      "step": 33539
    },
    {
      "epoch": 3.5582431572246978,
      "grad_norm": 0.4843997050584764,
      "learning_rate": 3.995461593445004e-05,
      "loss": 1.3059,
      "num_input_tokens_seen": 26388137488,
      "step": 33540
    },
    {
      "epoch": 3.5583492467642692,
      "grad_norm": 0.6877858772154861,
      "learning_rate": 3.995405900963299e-05,
      "loss": 1.5423,
      "num_input_tokens_seen": 26388924208,
      "step": 33541
    },
    {
      "epoch": 3.5584553363038403,
      "grad_norm": 0.48703806643725817,
      "learning_rate": 3.9953502073259895e-05,
      "loss": 1.5115,
      "num_input_tokens_seen": 26389710960,
      "step": 33542
    },
    {
      "epoch": 3.5585614258434117,
      "grad_norm": 0.5497800544696437,
      "learning_rate": 3.995294512533117e-05,
      "loss": 1.46,
      "num_input_tokens_seen": 26390497712,
      "step": 33543
    },
    {
      "epoch": 3.558667515382983,
      "grad_norm": 0.4374475149502799,
      "learning_rate": 3.995238816584723e-05,
      "loss": 1.3492,
      "num_input_tokens_seen": 26391284480,
      "step": 33544
    },
    {
      "epoch": 3.5587736049225547,
      "grad_norm": 0.47540531586213514,
      "learning_rate": 3.995183119480854e-05,
      "loss": 1.4963,
      "num_input_tokens_seen": 26392071312,
      "step": 33545
    },
    {
      "epoch": 3.558879694462126,
      "grad_norm": 0.4846841366546358,
      "learning_rate": 3.9951274212215506e-05,
      "loss": 1.4184,
      "num_input_tokens_seen": 26392858160,
      "step": 33546
    },
    {
      "epoch": 3.558985784001697,
      "grad_norm": 0.4616695800596781,
      "learning_rate": 3.995071721806857e-05,
      "loss": 1.4542,
      "num_input_tokens_seen": 26393644960,
      "step": 33547
    },
    {
      "epoch": 3.559091873541269,
      "grad_norm": 0.47394209790142544,
      "learning_rate": 3.995016021236816e-05,
      "loss": 1.4926,
      "num_input_tokens_seen": 26394431728,
      "step": 33548
    },
    {
      "epoch": 3.55919796308084,
      "grad_norm": 0.4053826390728332,
      "learning_rate": 3.9949603195114706e-05,
      "loss": 1.4291,
      "num_input_tokens_seen": 26395218400,
      "step": 33549
    },
    {
      "epoch": 3.5593040526204116,
      "grad_norm": 0.4133269270518049,
      "learning_rate": 3.994904616630863e-05,
      "loss": 1.3868,
      "num_input_tokens_seen": 26396005248,
      "step": 33550
    },
    {
      "epoch": 3.559410142159983,
      "grad_norm": 0.44036663498209605,
      "learning_rate": 3.994848912595037e-05,
      "loss": 1.3757,
      "num_input_tokens_seen": 26396791952,
      "step": 33551
    },
    {
      "epoch": 3.5595162316995546,
      "grad_norm": 0.4335653414185735,
      "learning_rate": 3.994793207404036e-05,
      "loss": 1.424,
      "num_input_tokens_seen": 26397578688,
      "step": 33552
    },
    {
      "epoch": 3.559622321239126,
      "grad_norm": 0.440925748127703,
      "learning_rate": 3.994737501057902e-05,
      "loss": 1.4398,
      "num_input_tokens_seen": 26398365504,
      "step": 33553
    },
    {
      "epoch": 3.559728410778697,
      "grad_norm": 0.4956238085060509,
      "learning_rate": 3.9946817935566804e-05,
      "loss": 1.441,
      "num_input_tokens_seen": 26399152352,
      "step": 33554
    },
    {
      "epoch": 3.5598345003182685,
      "grad_norm": 0.4121970400159656,
      "learning_rate": 3.994626084900411e-05,
      "loss": 1.4906,
      "num_input_tokens_seen": 26399939136,
      "step": 33555
    },
    {
      "epoch": 3.55994058985784,
      "grad_norm": 0.6510130651774114,
      "learning_rate": 3.9945703750891395e-05,
      "loss": 1.4904,
      "num_input_tokens_seen": 26400725968,
      "step": 33556
    },
    {
      "epoch": 3.5600466793974115,
      "grad_norm": 0.4645138048897721,
      "learning_rate": 3.994514664122907e-05,
      "loss": 1.5309,
      "num_input_tokens_seen": 26401512688,
      "step": 33557
    },
    {
      "epoch": 3.560152768936983,
      "grad_norm": 0.517309310897563,
      "learning_rate": 3.9944589520017576e-05,
      "loss": 1.4903,
      "num_input_tokens_seen": 26402299552,
      "step": 33558
    },
    {
      "epoch": 3.560258858476554,
      "grad_norm": 0.42805311728286227,
      "learning_rate": 3.994403238725734e-05,
      "loss": 1.4204,
      "num_input_tokens_seen": 26403086336,
      "step": 33559
    },
    {
      "epoch": 3.5603649480161255,
      "grad_norm": 0.48953666272922497,
      "learning_rate": 3.9943475242948795e-05,
      "loss": 1.5491,
      "num_input_tokens_seen": 26403873024,
      "step": 33560
    },
    {
      "epoch": 3.560471037555697,
      "grad_norm": 0.44954492247256905,
      "learning_rate": 3.994291808709237e-05,
      "loss": 1.3711,
      "num_input_tokens_seen": 26404659744,
      "step": 33561
    },
    {
      "epoch": 3.5605771270952684,
      "grad_norm": 0.43282180887800065,
      "learning_rate": 3.99423609196885e-05,
      "loss": 1.5215,
      "num_input_tokens_seen": 26405446496,
      "step": 33562
    },
    {
      "epoch": 3.56068321663484,
      "grad_norm": 0.43129669836969464,
      "learning_rate": 3.9941803740737616e-05,
      "loss": 1.4593,
      "num_input_tokens_seen": 26406233184,
      "step": 33563
    },
    {
      "epoch": 3.5607893061744114,
      "grad_norm": 0.49303123857966097,
      "learning_rate": 3.994124655024013e-05,
      "loss": 1.5327,
      "num_input_tokens_seen": 26407019968,
      "step": 33564
    },
    {
      "epoch": 3.560895395713983,
      "grad_norm": 0.4202225463849833,
      "learning_rate": 3.99406893481965e-05,
      "loss": 1.4871,
      "num_input_tokens_seen": 26407806704,
      "step": 33565
    },
    {
      "epoch": 3.561001485253554,
      "grad_norm": 0.4340068110284993,
      "learning_rate": 3.9940132134607144e-05,
      "loss": 1.4303,
      "num_input_tokens_seen": 26408593424,
      "step": 33566
    },
    {
      "epoch": 3.5611075747931253,
      "grad_norm": 0.41700824206770853,
      "learning_rate": 3.993957490947249e-05,
      "loss": 1.4025,
      "num_input_tokens_seen": 26409380256,
      "step": 33567
    },
    {
      "epoch": 3.561213664332697,
      "grad_norm": 0.40752871427690374,
      "learning_rate": 3.993901767279297e-05,
      "loss": 1.4499,
      "num_input_tokens_seen": 26410166992,
      "step": 33568
    },
    {
      "epoch": 3.5613197538722683,
      "grad_norm": 0.404446806737037,
      "learning_rate": 3.993846042456901e-05,
      "loss": 1.363,
      "num_input_tokens_seen": 26410953808,
      "step": 33569
    },
    {
      "epoch": 3.5614258434118398,
      "grad_norm": 0.46456671577146474,
      "learning_rate": 3.993790316480105e-05,
      "loss": 1.4733,
      "num_input_tokens_seen": 26411740528,
      "step": 33570
    },
    {
      "epoch": 3.561531932951411,
      "grad_norm": 0.4538149431534651,
      "learning_rate": 3.993734589348952e-05,
      "loss": 1.5024,
      "num_input_tokens_seen": 26412527296,
      "step": 33571
    },
    {
      "epoch": 3.5616380224909823,
      "grad_norm": 0.4087506752637721,
      "learning_rate": 3.993678861063485e-05,
      "loss": 1.4479,
      "num_input_tokens_seen": 26413314112,
      "step": 33572
    },
    {
      "epoch": 3.5617441120305537,
      "grad_norm": 0.3999065593670727,
      "learning_rate": 3.993623131623746e-05,
      "loss": 1.4322,
      "num_input_tokens_seen": 26414100816,
      "step": 33573
    },
    {
      "epoch": 3.561850201570125,
      "grad_norm": 0.3959391156320838,
      "learning_rate": 3.993567401029779e-05,
      "loss": 1.4174,
      "num_input_tokens_seen": 26414887584,
      "step": 33574
    },
    {
      "epoch": 3.5619562911096967,
      "grad_norm": 0.37280416705345043,
      "learning_rate": 3.9935116692816275e-05,
      "loss": 1.4347,
      "num_input_tokens_seen": 26415674352,
      "step": 33575
    },
    {
      "epoch": 3.5620623806492677,
      "grad_norm": 0.38495472581464757,
      "learning_rate": 3.9934559363793336e-05,
      "loss": 1.4833,
      "num_input_tokens_seen": 26416461200,
      "step": 33576
    },
    {
      "epoch": 3.5621684701888396,
      "grad_norm": 0.4776404337162321,
      "learning_rate": 3.9934002023229404e-05,
      "loss": 1.5524,
      "num_input_tokens_seen": 26417247904,
      "step": 33577
    },
    {
      "epoch": 3.5622745597284107,
      "grad_norm": 0.4164201207400935,
      "learning_rate": 3.993344467112492e-05,
      "loss": 1.5053,
      "num_input_tokens_seen": 26418034576,
      "step": 33578
    },
    {
      "epoch": 3.562380649267982,
      "grad_norm": 0.4828823632656695,
      "learning_rate": 3.99328873074803e-05,
      "loss": 1.5703,
      "num_input_tokens_seen": 26418821344,
      "step": 33579
    },
    {
      "epoch": 3.5624867388075536,
      "grad_norm": 0.5477435484805184,
      "learning_rate": 3.993232993229599e-05,
      "loss": 1.4422,
      "num_input_tokens_seen": 26419608096,
      "step": 33580
    },
    {
      "epoch": 3.562592828347125,
      "grad_norm": 0.43582049427965464,
      "learning_rate": 3.993177254557241e-05,
      "loss": 1.455,
      "num_input_tokens_seen": 26420394864,
      "step": 33581
    },
    {
      "epoch": 3.5626989178866966,
      "grad_norm": 0.4627645157758009,
      "learning_rate": 3.9931215147309996e-05,
      "loss": 1.4697,
      "num_input_tokens_seen": 26421181568,
      "step": 33582
    },
    {
      "epoch": 3.5628050074262676,
      "grad_norm": 0.4572641706663056,
      "learning_rate": 3.993065773750918e-05,
      "loss": 1.4543,
      "num_input_tokens_seen": 26421968336,
      "step": 33583
    },
    {
      "epoch": 3.562911096965839,
      "grad_norm": 0.5789184023744566,
      "learning_rate": 3.993010031617039e-05,
      "loss": 1.489,
      "num_input_tokens_seen": 26422755072,
      "step": 33584
    },
    {
      "epoch": 3.5630171865054105,
      "grad_norm": 0.49048911442218096,
      "learning_rate": 3.992954288329405e-05,
      "loss": 1.5134,
      "num_input_tokens_seen": 26423541808,
      "step": 33585
    },
    {
      "epoch": 3.563123276044982,
      "grad_norm": 0.4958429782017891,
      "learning_rate": 3.99289854388806e-05,
      "loss": 1.5324,
      "num_input_tokens_seen": 26424328512,
      "step": 33586
    },
    {
      "epoch": 3.5632293655845535,
      "grad_norm": 0.4850754502632116,
      "learning_rate": 3.992842798293047e-05,
      "loss": 1.4667,
      "num_input_tokens_seen": 26425115264,
      "step": 33587
    },
    {
      "epoch": 3.5633354551241245,
      "grad_norm": 0.44815804265874276,
      "learning_rate": 3.992787051544409e-05,
      "loss": 1.4098,
      "num_input_tokens_seen": 26425902064,
      "step": 33588
    },
    {
      "epoch": 3.563441544663696,
      "grad_norm": 0.5016226901369626,
      "learning_rate": 3.992731303642189e-05,
      "loss": 1.4448,
      "num_input_tokens_seen": 26426688784,
      "step": 33589
    },
    {
      "epoch": 3.5635476342032675,
      "grad_norm": 0.4911154788822435,
      "learning_rate": 3.992675554586429e-05,
      "loss": 1.5527,
      "num_input_tokens_seen": 26427475520,
      "step": 33590
    },
    {
      "epoch": 3.563653723742839,
      "grad_norm": 0.4363412851775137,
      "learning_rate": 3.992619804377175e-05,
      "loss": 1.3985,
      "num_input_tokens_seen": 26428262288,
      "step": 33591
    },
    {
      "epoch": 3.5637598132824104,
      "grad_norm": 0.4924191166145649,
      "learning_rate": 3.9925640530144666e-05,
      "loss": 1.6302,
      "num_input_tokens_seen": 26429049008,
      "step": 33592
    },
    {
      "epoch": 3.563865902821982,
      "grad_norm": 0.45332774705873097,
      "learning_rate": 3.992508300498349e-05,
      "loss": 1.4452,
      "num_input_tokens_seen": 26429835680,
      "step": 33593
    },
    {
      "epoch": 3.5639719923615534,
      "grad_norm": 0.40743592069385265,
      "learning_rate": 3.9924525468288645e-05,
      "loss": 1.3887,
      "num_input_tokens_seen": 26430622528,
      "step": 33594
    },
    {
      "epoch": 3.5640780819011244,
      "grad_norm": 0.4901804235588375,
      "learning_rate": 3.9923967920060566e-05,
      "loss": 1.5705,
      "num_input_tokens_seen": 26431409248,
      "step": 33595
    },
    {
      "epoch": 3.564184171440696,
      "grad_norm": 0.4116240224024665,
      "learning_rate": 3.9923410360299686e-05,
      "loss": 1.4306,
      "num_input_tokens_seen": 26432196016,
      "step": 33596
    },
    {
      "epoch": 3.5642902609802674,
      "grad_norm": 0.4823023749612538,
      "learning_rate": 3.992285278900643e-05,
      "loss": 1.3664,
      "num_input_tokens_seen": 26432982848,
      "step": 33597
    },
    {
      "epoch": 3.564396350519839,
      "grad_norm": 0.4779032747938241,
      "learning_rate": 3.992229520618124e-05,
      "loss": 1.4767,
      "num_input_tokens_seen": 26433769632,
      "step": 33598
    },
    {
      "epoch": 3.5645024400594103,
      "grad_norm": 0.5335186877581954,
      "learning_rate": 3.9921737611824524e-05,
      "loss": 1.4874,
      "num_input_tokens_seen": 26434556400,
      "step": 33599
    },
    {
      "epoch": 3.5646085295989813,
      "grad_norm": 0.5071730249015016,
      "learning_rate": 3.992118000593673e-05,
      "loss": 1.5235,
      "num_input_tokens_seen": 26435343088,
      "step": 33600
    },
    {
      "epoch": 3.564714619138553,
      "grad_norm": 0.4589345886962098,
      "learning_rate": 3.992062238851829e-05,
      "loss": 1.3841,
      "num_input_tokens_seen": 26436129840,
      "step": 33601
    },
    {
      "epoch": 3.5648207086781243,
      "grad_norm": 0.5063606684814298,
      "learning_rate": 3.992006475956963e-05,
      "loss": 1.3189,
      "num_input_tokens_seen": 26436916656,
      "step": 33602
    },
    {
      "epoch": 3.5649267982176958,
      "grad_norm": 0.46411999180986047,
      "learning_rate": 3.991950711909118e-05,
      "loss": 1.5425,
      "num_input_tokens_seen": 26437703408,
      "step": 33603
    },
    {
      "epoch": 3.5650328877572672,
      "grad_norm": 0.5363444888875964,
      "learning_rate": 3.991894946708338e-05,
      "loss": 1.5817,
      "num_input_tokens_seen": 26438490144,
      "step": 33604
    },
    {
      "epoch": 3.5651389772968383,
      "grad_norm": 0.494329045326216,
      "learning_rate": 3.9918391803546644e-05,
      "loss": 1.5602,
      "num_input_tokens_seen": 26439276896,
      "step": 33605
    },
    {
      "epoch": 3.56524506683641,
      "grad_norm": 0.42490847887898664,
      "learning_rate": 3.991783412848141e-05,
      "loss": 1.3608,
      "num_input_tokens_seen": 26440063600,
      "step": 33606
    },
    {
      "epoch": 3.565351156375981,
      "grad_norm": 0.502364092134939,
      "learning_rate": 3.991727644188812e-05,
      "loss": 1.3649,
      "num_input_tokens_seen": 26440850320,
      "step": 33607
    },
    {
      "epoch": 3.5654572459155527,
      "grad_norm": 0.46890528271771864,
      "learning_rate": 3.99167187437672e-05,
      "loss": 1.4761,
      "num_input_tokens_seen": 26441637024,
      "step": 33608
    },
    {
      "epoch": 3.565563335455124,
      "grad_norm": 0.4766478689927477,
      "learning_rate": 3.991616103411907e-05,
      "loss": 1.5412,
      "num_input_tokens_seen": 26442423840,
      "step": 33609
    },
    {
      "epoch": 3.5656694249946956,
      "grad_norm": 0.47895101872051005,
      "learning_rate": 3.9915603312944165e-05,
      "loss": 1.4594,
      "num_input_tokens_seen": 26443210576,
      "step": 33610
    },
    {
      "epoch": 3.565775514534267,
      "grad_norm": 0.4656690547303369,
      "learning_rate": 3.991504558024293e-05,
      "loss": 1.5024,
      "num_input_tokens_seen": 26443997408,
      "step": 33611
    },
    {
      "epoch": 3.565881604073838,
      "grad_norm": 0.43892959652227465,
      "learning_rate": 3.9914487836015776e-05,
      "loss": 1.5382,
      "num_input_tokens_seen": 26444784144,
      "step": 33612
    },
    {
      "epoch": 3.5659876936134096,
      "grad_norm": 0.47756627900118526,
      "learning_rate": 3.9913930080263154e-05,
      "loss": 1.4507,
      "num_input_tokens_seen": 26445570944,
      "step": 33613
    },
    {
      "epoch": 3.566093783152981,
      "grad_norm": 0.5798475181333621,
      "learning_rate": 3.991337231298547e-05,
      "loss": 1.4788,
      "num_input_tokens_seen": 26446357680,
      "step": 33614
    },
    {
      "epoch": 3.5661998726925526,
      "grad_norm": 0.5162898921029669,
      "learning_rate": 3.991281453418317e-05,
      "loss": 1.4598,
      "num_input_tokens_seen": 26447144416,
      "step": 33615
    },
    {
      "epoch": 3.566305962232124,
      "grad_norm": 0.5027718187821285,
      "learning_rate": 3.9912256743856705e-05,
      "loss": 1.3701,
      "num_input_tokens_seen": 26447931152,
      "step": 33616
    },
    {
      "epoch": 3.566412051771695,
      "grad_norm": 0.43168179683734,
      "learning_rate": 3.991169894200647e-05,
      "loss": 1.51,
      "num_input_tokens_seen": 26448717856,
      "step": 33617
    },
    {
      "epoch": 3.5665181413112665,
      "grad_norm": 0.5831277516738623,
      "learning_rate": 3.9911141128632914e-05,
      "loss": 1.6292,
      "num_input_tokens_seen": 26449504608,
      "step": 33618
    },
    {
      "epoch": 3.566624230850838,
      "grad_norm": 0.4708076991251843,
      "learning_rate": 3.991058330373646e-05,
      "loss": 1.6472,
      "num_input_tokens_seen": 26450291328,
      "step": 33619
    },
    {
      "epoch": 3.5667303203904095,
      "grad_norm": 0.6408288799518148,
      "learning_rate": 3.9910025467317554e-05,
      "loss": 1.45,
      "num_input_tokens_seen": 26451078048,
      "step": 33620
    },
    {
      "epoch": 3.566836409929981,
      "grad_norm": 0.4218372183366581,
      "learning_rate": 3.990946761937661e-05,
      "loss": 1.4241,
      "num_input_tokens_seen": 26451864784,
      "step": 33621
    },
    {
      "epoch": 3.5669424994695524,
      "grad_norm": 0.48337572448905763,
      "learning_rate": 3.990890975991407e-05,
      "loss": 1.5257,
      "num_input_tokens_seen": 26452651488,
      "step": 33622
    },
    {
      "epoch": 3.567048589009124,
      "grad_norm": 0.4331585745724279,
      "learning_rate": 3.990835188893036e-05,
      "loss": 1.5276,
      "num_input_tokens_seen": 26453438240,
      "step": 33623
    },
    {
      "epoch": 3.567154678548695,
      "grad_norm": 0.44796219711639185,
      "learning_rate": 3.9907794006425925e-05,
      "loss": 1.4824,
      "num_input_tokens_seen": 26454224960,
      "step": 33624
    },
    {
      "epoch": 3.5672607680882664,
      "grad_norm": 0.45230108955408255,
      "learning_rate": 3.990723611240117e-05,
      "loss": 1.4837,
      "num_input_tokens_seen": 26455011696,
      "step": 33625
    },
    {
      "epoch": 3.567366857627838,
      "grad_norm": 0.40899781459454426,
      "learning_rate": 3.990667820685655e-05,
      "loss": 1.4449,
      "num_input_tokens_seen": 26455798400,
      "step": 33626
    },
    {
      "epoch": 3.5674729471674094,
      "grad_norm": 0.4523868541283002,
      "learning_rate": 3.9906120289792484e-05,
      "loss": 1.4729,
      "num_input_tokens_seen": 26456585232,
      "step": 33627
    },
    {
      "epoch": 3.567579036706981,
      "grad_norm": 0.41491081344981495,
      "learning_rate": 3.9905562361209396e-05,
      "loss": 1.3213,
      "num_input_tokens_seen": 26457372080,
      "step": 33628
    },
    {
      "epoch": 3.567685126246552,
      "grad_norm": 0.3957372910657224,
      "learning_rate": 3.990500442110774e-05,
      "loss": 1.3165,
      "num_input_tokens_seen": 26458158880,
      "step": 33629
    },
    {
      "epoch": 3.5677912157861233,
      "grad_norm": 0.4064462139625672,
      "learning_rate": 3.990444646948792e-05,
      "loss": 1.5012,
      "num_input_tokens_seen": 26458945600,
      "step": 33630
    },
    {
      "epoch": 3.567897305325695,
      "grad_norm": 0.4317780740757377,
      "learning_rate": 3.99038885063504e-05,
      "loss": 1.4252,
      "num_input_tokens_seen": 26459732432,
      "step": 33631
    },
    {
      "epoch": 3.5680033948652663,
      "grad_norm": 0.3583350819392368,
      "learning_rate": 3.9903330531695574e-05,
      "loss": 1.3442,
      "num_input_tokens_seen": 26460519232,
      "step": 33632
    },
    {
      "epoch": 3.5681094844048378,
      "grad_norm": 0.381286055451762,
      "learning_rate": 3.99027725455239e-05,
      "loss": 1.4499,
      "num_input_tokens_seen": 26461305984,
      "step": 33633
    },
    {
      "epoch": 3.5682155739444092,
      "grad_norm": 0.41703431307606276,
      "learning_rate": 3.99022145478358e-05,
      "loss": 1.4351,
      "num_input_tokens_seen": 26462092816,
      "step": 33634
    },
    {
      "epoch": 3.5683216634839807,
      "grad_norm": 0.37407973709683173,
      "learning_rate": 3.9901656538631704e-05,
      "loss": 1.4176,
      "num_input_tokens_seen": 26462879616,
      "step": 33635
    },
    {
      "epoch": 3.5684277530235518,
      "grad_norm": 0.536381105170471,
      "learning_rate": 3.990109851791205e-05,
      "loss": 1.4628,
      "num_input_tokens_seen": 26463666400,
      "step": 33636
    },
    {
      "epoch": 3.5685338425631232,
      "grad_norm": 0.46779094564796353,
      "learning_rate": 3.9900540485677265e-05,
      "loss": 1.5755,
      "num_input_tokens_seen": 26464453152,
      "step": 33637
    },
    {
      "epoch": 3.5686399321026947,
      "grad_norm": 0.49072158362585494,
      "learning_rate": 3.989998244192777e-05,
      "loss": 1.2687,
      "num_input_tokens_seen": 26465239968,
      "step": 33638
    },
    {
      "epoch": 3.568746021642266,
      "grad_norm": 0.5249314741169127,
      "learning_rate": 3.9899424386664007e-05,
      "loss": 1.4518,
      "num_input_tokens_seen": 26466026672,
      "step": 33639
    },
    {
      "epoch": 3.5688521111818376,
      "grad_norm": 0.4345522356944064,
      "learning_rate": 3.9898866319886416e-05,
      "loss": 1.5099,
      "num_input_tokens_seen": 26466813376,
      "step": 33640
    },
    {
      "epoch": 3.5689582007214087,
      "grad_norm": 0.47747714634488647,
      "learning_rate": 3.989830824159541e-05,
      "loss": 1.4637,
      "num_input_tokens_seen": 26467600176,
      "step": 33641
    },
    {
      "epoch": 3.56906429026098,
      "grad_norm": 0.4283430258573939,
      "learning_rate": 3.9897750151791434e-05,
      "loss": 1.4926,
      "num_input_tokens_seen": 26468386976,
      "step": 33642
    },
    {
      "epoch": 3.5691703798005516,
      "grad_norm": 0.36913597421567695,
      "learning_rate": 3.989719205047491e-05,
      "loss": 1.2641,
      "num_input_tokens_seen": 26469173760,
      "step": 33643
    },
    {
      "epoch": 3.569276469340123,
      "grad_norm": 0.4234008464167135,
      "learning_rate": 3.989663393764628e-05,
      "loss": 1.524,
      "num_input_tokens_seen": 26469960544,
      "step": 33644
    },
    {
      "epoch": 3.5693825588796946,
      "grad_norm": 0.3871702326052175,
      "learning_rate": 3.9896075813305956e-05,
      "loss": 1.4929,
      "num_input_tokens_seen": 26470747376,
      "step": 33645
    },
    {
      "epoch": 3.5694886484192656,
      "grad_norm": 0.45698971487937406,
      "learning_rate": 3.989551767745439e-05,
      "loss": 1.4905,
      "num_input_tokens_seen": 26471534144,
      "step": 33646
    },
    {
      "epoch": 3.5695947379588375,
      "grad_norm": 0.4200427354988856,
      "learning_rate": 3.9894959530092e-05,
      "loss": 1.373,
      "num_input_tokens_seen": 26472320912,
      "step": 33647
    },
    {
      "epoch": 3.5697008274984086,
      "grad_norm": 0.5341546806991284,
      "learning_rate": 3.989440137121923e-05,
      "loss": 1.5429,
      "num_input_tokens_seen": 26473107680,
      "step": 33648
    },
    {
      "epoch": 3.56980691703798,
      "grad_norm": 0.5054834690055745,
      "learning_rate": 3.98938432008365e-05,
      "loss": 1.3334,
      "num_input_tokens_seen": 26473894480,
      "step": 33649
    },
    {
      "epoch": 3.5699130065775515,
      "grad_norm": 0.4418796817551475,
      "learning_rate": 3.9893285018944236e-05,
      "loss": 1.5132,
      "num_input_tokens_seen": 26474681264,
      "step": 33650
    },
    {
      "epoch": 3.570019096117123,
      "grad_norm": 0.4168837591843892,
      "learning_rate": 3.989272682554289e-05,
      "loss": 1.5155,
      "num_input_tokens_seen": 26475468032,
      "step": 33651
    },
    {
      "epoch": 3.5701251856566945,
      "grad_norm": 0.5172234922378095,
      "learning_rate": 3.9892168620632875e-05,
      "loss": 1.5632,
      "num_input_tokens_seen": 26476254800,
      "step": 33652
    },
    {
      "epoch": 3.5702312751962655,
      "grad_norm": 0.4404802221160248,
      "learning_rate": 3.989161040421463e-05,
      "loss": 1.3185,
      "num_input_tokens_seen": 26477041552,
      "step": 33653
    },
    {
      "epoch": 3.570337364735837,
      "grad_norm": 0.7012019238860647,
      "learning_rate": 3.9891052176288594e-05,
      "loss": 1.4667,
      "num_input_tokens_seen": 26477828304,
      "step": 33654
    },
    {
      "epoch": 3.5704434542754084,
      "grad_norm": 0.49268633211519364,
      "learning_rate": 3.9890493936855175e-05,
      "loss": 1.4229,
      "num_input_tokens_seen": 26478615104,
      "step": 33655
    },
    {
      "epoch": 3.57054954381498,
      "grad_norm": 0.5231195546896777,
      "learning_rate": 3.9889935685914834e-05,
      "loss": 1.5791,
      "num_input_tokens_seen": 26479401872,
      "step": 33656
    },
    {
      "epoch": 3.5706556333545514,
      "grad_norm": 0.5067689230456481,
      "learning_rate": 3.988937742346798e-05,
      "loss": 1.6082,
      "num_input_tokens_seen": 26480188704,
      "step": 33657
    },
    {
      "epoch": 3.5707617228941224,
      "grad_norm": 0.4799954991404884,
      "learning_rate": 3.9888819149515046e-05,
      "loss": 1.4167,
      "num_input_tokens_seen": 26480975488,
      "step": 33658
    },
    {
      "epoch": 3.570867812433694,
      "grad_norm": 0.7001224653802809,
      "learning_rate": 3.988826086405648e-05,
      "loss": 1.4131,
      "num_input_tokens_seen": 26481762304,
      "step": 33659
    },
    {
      "epoch": 3.5709739019732654,
      "grad_norm": 0.3834127186529598,
      "learning_rate": 3.98877025670927e-05,
      "loss": 1.4956,
      "num_input_tokens_seen": 26482549024,
      "step": 33660
    },
    {
      "epoch": 3.571079991512837,
      "grad_norm": 0.6254938951306303,
      "learning_rate": 3.9887144258624136e-05,
      "loss": 1.3984,
      "num_input_tokens_seen": 26483335776,
      "step": 33661
    },
    {
      "epoch": 3.5711860810524083,
      "grad_norm": 0.5039310515460205,
      "learning_rate": 3.988658593865123e-05,
      "loss": 1.4486,
      "num_input_tokens_seen": 26484122544,
      "step": 33662
    },
    {
      "epoch": 3.57129217059198,
      "grad_norm": 0.4229703146442602,
      "learning_rate": 3.9886027607174404e-05,
      "loss": 1.415,
      "num_input_tokens_seen": 26484909312,
      "step": 33663
    },
    {
      "epoch": 3.5713982601315513,
      "grad_norm": 0.574369209329189,
      "learning_rate": 3.98854692641941e-05,
      "loss": 1.5002,
      "num_input_tokens_seen": 26485695968,
      "step": 33664
    },
    {
      "epoch": 3.5715043496711223,
      "grad_norm": 0.5773688941747167,
      "learning_rate": 3.9884910909710725e-05,
      "loss": 1.4391,
      "num_input_tokens_seen": 26486482720,
      "step": 33665
    },
    {
      "epoch": 3.5716104392106938,
      "grad_norm": 0.6303898962763845,
      "learning_rate": 3.988435254372474e-05,
      "loss": 1.5025,
      "num_input_tokens_seen": 26487269536,
      "step": 33666
    },
    {
      "epoch": 3.5717165287502652,
      "grad_norm": 0.5076360366678176,
      "learning_rate": 3.988379416623657e-05,
      "loss": 1.413,
      "num_input_tokens_seen": 26488056304,
      "step": 33667
    },
    {
      "epoch": 3.5718226182898367,
      "grad_norm": 0.36543660323958954,
      "learning_rate": 3.988323577724663e-05,
      "loss": 1.4064,
      "num_input_tokens_seen": 26488843136,
      "step": 33668
    },
    {
      "epoch": 3.571928707829408,
      "grad_norm": 0.517473800389531,
      "learning_rate": 3.988267737675536e-05,
      "loss": 1.4076,
      "num_input_tokens_seen": 26489629920,
      "step": 33669
    },
    {
      "epoch": 3.572034797368979,
      "grad_norm": 0.4171028966851603,
      "learning_rate": 3.98821189647632e-05,
      "loss": 1.5421,
      "num_input_tokens_seen": 26490416720,
      "step": 33670
    },
    {
      "epoch": 3.5721408869085507,
      "grad_norm": 0.4480050568832862,
      "learning_rate": 3.9881560541270565e-05,
      "loss": 1.4437,
      "num_input_tokens_seen": 26491203552,
      "step": 33671
    },
    {
      "epoch": 3.572246976448122,
      "grad_norm": 0.4843895653104303,
      "learning_rate": 3.988100210627791e-05,
      "loss": 1.5239,
      "num_input_tokens_seen": 26491990256,
      "step": 33672
    },
    {
      "epoch": 3.5723530659876936,
      "grad_norm": 0.41393407732018606,
      "learning_rate": 3.988044365978565e-05,
      "loss": 1.4444,
      "num_input_tokens_seen": 26492777104,
      "step": 33673
    },
    {
      "epoch": 3.572459155527265,
      "grad_norm": 0.48570737704939304,
      "learning_rate": 3.987988520179422e-05,
      "loss": 1.4887,
      "num_input_tokens_seen": 26493563808,
      "step": 33674
    },
    {
      "epoch": 3.572565245066836,
      "grad_norm": 0.6409917373738125,
      "learning_rate": 3.987932673230404e-05,
      "loss": 1.5946,
      "num_input_tokens_seen": 26494350512,
      "step": 33675
    },
    {
      "epoch": 3.572671334606408,
      "grad_norm": 0.4277230387676631,
      "learning_rate": 3.987876825131557e-05,
      "loss": 1.4549,
      "num_input_tokens_seen": 26495137328,
      "step": 33676
    },
    {
      "epoch": 3.572777424145979,
      "grad_norm": 0.4609780885791238,
      "learning_rate": 3.987820975882922e-05,
      "loss": 1.4734,
      "num_input_tokens_seen": 26495924128,
      "step": 33677
    },
    {
      "epoch": 3.5728835136855506,
      "grad_norm": 0.4683640049294939,
      "learning_rate": 3.987765125484542e-05,
      "loss": 1.5037,
      "num_input_tokens_seen": 26496710832,
      "step": 33678
    },
    {
      "epoch": 3.572989603225122,
      "grad_norm": 0.4724586145969184,
      "learning_rate": 3.987709273936461e-05,
      "loss": 1.5016,
      "num_input_tokens_seen": 26497497552,
      "step": 33679
    },
    {
      "epoch": 3.5730956927646935,
      "grad_norm": 0.38393094618252094,
      "learning_rate": 3.987653421238722e-05,
      "loss": 1.4245,
      "num_input_tokens_seen": 26498284400,
      "step": 33680
    },
    {
      "epoch": 3.573201782304265,
      "grad_norm": 0.5943387471722211,
      "learning_rate": 3.987597567391368e-05,
      "loss": 1.4723,
      "num_input_tokens_seen": 26499071168,
      "step": 33681
    },
    {
      "epoch": 3.573307871843836,
      "grad_norm": 0.47795158170828056,
      "learning_rate": 3.987541712394443e-05,
      "loss": 1.4824,
      "num_input_tokens_seen": 26499857920,
      "step": 33682
    },
    {
      "epoch": 3.5734139613834075,
      "grad_norm": 0.45212450706115437,
      "learning_rate": 3.987485856247988e-05,
      "loss": 1.4916,
      "num_input_tokens_seen": 26500644720,
      "step": 33683
    },
    {
      "epoch": 3.573520050922979,
      "grad_norm": 0.5824394894699368,
      "learning_rate": 3.987429998952048e-05,
      "loss": 1.4942,
      "num_input_tokens_seen": 26501431552,
      "step": 33684
    },
    {
      "epoch": 3.5736261404625504,
      "grad_norm": 0.4211835953684281,
      "learning_rate": 3.987374140506667e-05,
      "loss": 1.3699,
      "num_input_tokens_seen": 26502218304,
      "step": 33685
    },
    {
      "epoch": 3.573732230002122,
      "grad_norm": 0.4091319920660722,
      "learning_rate": 3.987318280911885e-05,
      "loss": 1.4177,
      "num_input_tokens_seen": 26503005072,
      "step": 33686
    },
    {
      "epoch": 3.573838319541693,
      "grad_norm": 0.5010989565065856,
      "learning_rate": 3.987262420167748e-05,
      "loss": 1.4471,
      "num_input_tokens_seen": 26503791856,
      "step": 33687
    },
    {
      "epoch": 3.5739444090812644,
      "grad_norm": 0.4631032946974323,
      "learning_rate": 3.9872065582742986e-05,
      "loss": 1.5606,
      "num_input_tokens_seen": 26504578608,
      "step": 33688
    },
    {
      "epoch": 3.574050498620836,
      "grad_norm": 0.3890516402296988,
      "learning_rate": 3.987150695231579e-05,
      "loss": 1.3989,
      "num_input_tokens_seen": 26505365344,
      "step": 33689
    },
    {
      "epoch": 3.5741565881604074,
      "grad_norm": 0.5861682327107963,
      "learning_rate": 3.987094831039634e-05,
      "loss": 1.5999,
      "num_input_tokens_seen": 26506152016,
      "step": 33690
    },
    {
      "epoch": 3.574262677699979,
      "grad_norm": 0.43534888150238404,
      "learning_rate": 3.987038965698504e-05,
      "loss": 1.5541,
      "num_input_tokens_seen": 26506938912,
      "step": 33691
    },
    {
      "epoch": 3.5743687672395503,
      "grad_norm": 0.6137036156627823,
      "learning_rate": 3.986983099208235e-05,
      "loss": 1.4384,
      "num_input_tokens_seen": 26507725760,
      "step": 33692
    },
    {
      "epoch": 3.574474856779122,
      "grad_norm": 0.4621139586537912,
      "learning_rate": 3.986927231568869e-05,
      "loss": 1.4434,
      "num_input_tokens_seen": 26508512480,
      "step": 33693
    },
    {
      "epoch": 3.574580946318693,
      "grad_norm": 0.4405533901252459,
      "learning_rate": 3.98687136278045e-05,
      "loss": 1.4131,
      "num_input_tokens_seen": 26509299296,
      "step": 33694
    },
    {
      "epoch": 3.5746870358582643,
      "grad_norm": 0.4301086368680736,
      "learning_rate": 3.986815492843019e-05,
      "loss": 1.4429,
      "num_input_tokens_seen": 26510086048,
      "step": 33695
    },
    {
      "epoch": 3.574793125397836,
      "grad_norm": 0.4615902507400043,
      "learning_rate": 3.986759621756622e-05,
      "loss": 1.4523,
      "num_input_tokens_seen": 26510872816,
      "step": 33696
    },
    {
      "epoch": 3.5748992149374073,
      "grad_norm": 0.4580402540783553,
      "learning_rate": 3.9867037495213e-05,
      "loss": 1.4675,
      "num_input_tokens_seen": 26511659520,
      "step": 33697
    },
    {
      "epoch": 3.5750053044769787,
      "grad_norm": 0.4435842752887794,
      "learning_rate": 3.986647876137097e-05,
      "loss": 1.4081,
      "num_input_tokens_seen": 26512446352,
      "step": 33698
    },
    {
      "epoch": 3.5751113940165498,
      "grad_norm": 0.4621642048199761,
      "learning_rate": 3.9865920016040556e-05,
      "loss": 1.4372,
      "num_input_tokens_seen": 26513233104,
      "step": 33699
    },
    {
      "epoch": 3.5752174835561212,
      "grad_norm": 0.4269582876165597,
      "learning_rate": 3.986536125922221e-05,
      "loss": 1.4219,
      "num_input_tokens_seen": 26514019776,
      "step": 33700
    },
    {
      "epoch": 3.5753235730956927,
      "grad_norm": 0.47599648894961766,
      "learning_rate": 3.986480249091634e-05,
      "loss": 1.4474,
      "num_input_tokens_seen": 26514806544,
      "step": 33701
    },
    {
      "epoch": 3.575429662635264,
      "grad_norm": 0.47642516301648946,
      "learning_rate": 3.986424371112338e-05,
      "loss": 1.4414,
      "num_input_tokens_seen": 26515593200,
      "step": 33702
    },
    {
      "epoch": 3.5755357521748357,
      "grad_norm": 0.4246743253977914,
      "learning_rate": 3.986368491984378e-05,
      "loss": 1.4395,
      "num_input_tokens_seen": 26516380016,
      "step": 33703
    },
    {
      "epoch": 3.5756418417144067,
      "grad_norm": 0.6012537051224179,
      "learning_rate": 3.986312611707796e-05,
      "loss": 1.5132,
      "num_input_tokens_seen": 26517166768,
      "step": 33704
    },
    {
      "epoch": 3.5757479312539786,
      "grad_norm": 0.45925516265054045,
      "learning_rate": 3.986256730282634e-05,
      "loss": 1.5313,
      "num_input_tokens_seen": 26517953488,
      "step": 33705
    },
    {
      "epoch": 3.5758540207935496,
      "grad_norm": 0.5164401623670735,
      "learning_rate": 3.986200847708938e-05,
      "loss": 1.4574,
      "num_input_tokens_seen": 26518740288,
      "step": 33706
    },
    {
      "epoch": 3.575960110333121,
      "grad_norm": 0.5575155797655199,
      "learning_rate": 3.986144963986748e-05,
      "loss": 1.5074,
      "num_input_tokens_seen": 26519527072,
      "step": 33707
    },
    {
      "epoch": 3.5760661998726926,
      "grad_norm": 0.4525315670080318,
      "learning_rate": 3.98608907911611e-05,
      "loss": 1.431,
      "num_input_tokens_seen": 26520313792,
      "step": 33708
    },
    {
      "epoch": 3.576172289412264,
      "grad_norm": 0.617009844069337,
      "learning_rate": 3.986033193097065e-05,
      "loss": 1.5911,
      "num_input_tokens_seen": 26521100528,
      "step": 33709
    },
    {
      "epoch": 3.5762783789518355,
      "grad_norm": 0.4220009549017356,
      "learning_rate": 3.985977305929658e-05,
      "loss": 1.4957,
      "num_input_tokens_seen": 26521887312,
      "step": 33710
    },
    {
      "epoch": 3.5763844684914066,
      "grad_norm": 0.49400270470856233,
      "learning_rate": 3.9859214176139306e-05,
      "loss": 1.4325,
      "num_input_tokens_seen": 26522674080,
      "step": 33711
    },
    {
      "epoch": 3.576490558030978,
      "grad_norm": 0.5220372059363256,
      "learning_rate": 3.985865528149927e-05,
      "loss": 1.4814,
      "num_input_tokens_seen": 26523460848,
      "step": 33712
    },
    {
      "epoch": 3.5765966475705495,
      "grad_norm": 0.42047791713077604,
      "learning_rate": 3.985809637537691e-05,
      "loss": 1.4121,
      "num_input_tokens_seen": 26524247680,
      "step": 33713
    },
    {
      "epoch": 3.576702737110121,
      "grad_norm": 0.6055278445838175,
      "learning_rate": 3.9857537457772645e-05,
      "loss": 1.4481,
      "num_input_tokens_seen": 26525034416,
      "step": 33714
    },
    {
      "epoch": 3.5768088266496925,
      "grad_norm": 0.5347640671405676,
      "learning_rate": 3.9856978528686905e-05,
      "loss": 1.4231,
      "num_input_tokens_seen": 26525821104,
      "step": 33715
    },
    {
      "epoch": 3.5769149161892635,
      "grad_norm": 0.7639516139842434,
      "learning_rate": 3.985641958812013e-05,
      "loss": 1.5189,
      "num_input_tokens_seen": 26526607840,
      "step": 33716
    },
    {
      "epoch": 3.5770210057288354,
      "grad_norm": 0.6078951243387488,
      "learning_rate": 3.985586063607275e-05,
      "loss": 1.5072,
      "num_input_tokens_seen": 26527394704,
      "step": 33717
    },
    {
      "epoch": 3.5771270952684064,
      "grad_norm": 0.561768452376288,
      "learning_rate": 3.98553016725452e-05,
      "loss": 1.4736,
      "num_input_tokens_seen": 26528181440,
      "step": 33718
    },
    {
      "epoch": 3.577233184807978,
      "grad_norm": 0.5616115080034239,
      "learning_rate": 3.9854742697537905e-05,
      "loss": 1.5738,
      "num_input_tokens_seen": 26528968272,
      "step": 33719
    },
    {
      "epoch": 3.5773392743475494,
      "grad_norm": 0.43670753353683467,
      "learning_rate": 3.98541837110513e-05,
      "loss": 1.393,
      "num_input_tokens_seen": 26529755120,
      "step": 33720
    },
    {
      "epoch": 3.577445363887121,
      "grad_norm": 0.612555156960047,
      "learning_rate": 3.9853624713085827e-05,
      "loss": 1.4748,
      "num_input_tokens_seen": 26530541904,
      "step": 33721
    },
    {
      "epoch": 3.5775514534266923,
      "grad_norm": 0.4888664787581081,
      "learning_rate": 3.9853065703641895e-05,
      "loss": 1.6221,
      "num_input_tokens_seen": 26531328624,
      "step": 33722
    },
    {
      "epoch": 3.5776575429662634,
      "grad_norm": 0.41232730590791344,
      "learning_rate": 3.985250668271996e-05,
      "loss": 1.4153,
      "num_input_tokens_seen": 26532115360,
      "step": 33723
    },
    {
      "epoch": 3.577763632505835,
      "grad_norm": 0.4863087911496789,
      "learning_rate": 3.9851947650320434e-05,
      "loss": 1.4372,
      "num_input_tokens_seen": 26532902016,
      "step": 33724
    },
    {
      "epoch": 3.5778697220454063,
      "grad_norm": 0.5239301653063042,
      "learning_rate": 3.9851388606443765e-05,
      "loss": 1.5105,
      "num_input_tokens_seen": 26533688752,
      "step": 33725
    },
    {
      "epoch": 3.577975811584978,
      "grad_norm": 0.44474143806660427,
      "learning_rate": 3.985082955109038e-05,
      "loss": 1.4447,
      "num_input_tokens_seen": 26534475504,
      "step": 33726
    },
    {
      "epoch": 3.5780819011245493,
      "grad_norm": 0.5522140585851574,
      "learning_rate": 3.985027048426071e-05,
      "loss": 1.3557,
      "num_input_tokens_seen": 26535262320,
      "step": 33727
    },
    {
      "epoch": 3.5781879906641203,
      "grad_norm": 0.4104616945411215,
      "learning_rate": 3.984971140595518e-05,
      "loss": 1.4081,
      "num_input_tokens_seen": 26536049056,
      "step": 33728
    },
    {
      "epoch": 3.5782940802036918,
      "grad_norm": 0.5335054344185968,
      "learning_rate": 3.984915231617423e-05,
      "loss": 1.5217,
      "num_input_tokens_seen": 26536835872,
      "step": 33729
    },
    {
      "epoch": 3.5784001697432632,
      "grad_norm": 0.5337204342146946,
      "learning_rate": 3.98485932149183e-05,
      "loss": 1.4895,
      "num_input_tokens_seen": 26537622624,
      "step": 33730
    },
    {
      "epoch": 3.5785062592828347,
      "grad_norm": 0.4413027068466922,
      "learning_rate": 3.984803410218781e-05,
      "loss": 1.469,
      "num_input_tokens_seen": 26538409376,
      "step": 33731
    },
    {
      "epoch": 3.578612348822406,
      "grad_norm": 0.5129041891148284,
      "learning_rate": 3.984747497798319e-05,
      "loss": 1.4805,
      "num_input_tokens_seen": 26539196128,
      "step": 33732
    },
    {
      "epoch": 3.5787184383619777,
      "grad_norm": 0.45529445163015275,
      "learning_rate": 3.984691584230488e-05,
      "loss": 1.5061,
      "num_input_tokens_seen": 26539982928,
      "step": 33733
    },
    {
      "epoch": 3.578824527901549,
      "grad_norm": 0.4633907589727438,
      "learning_rate": 3.984635669515331e-05,
      "loss": 1.4287,
      "num_input_tokens_seen": 26540769712,
      "step": 33734
    },
    {
      "epoch": 3.57893061744112,
      "grad_norm": 0.47160985524165006,
      "learning_rate": 3.9845797536528906e-05,
      "loss": 1.3492,
      "num_input_tokens_seen": 26541556560,
      "step": 33735
    },
    {
      "epoch": 3.5790367069806917,
      "grad_norm": 0.467375081684264,
      "learning_rate": 3.984523836643211e-05,
      "loss": 1.4689,
      "num_input_tokens_seen": 26542343248,
      "step": 33736
    },
    {
      "epoch": 3.579142796520263,
      "grad_norm": 0.41248948765453675,
      "learning_rate": 3.9844679184863346e-05,
      "loss": 1.2865,
      "num_input_tokens_seen": 26543130080,
      "step": 33737
    },
    {
      "epoch": 3.5792488860598346,
      "grad_norm": 0.4993268163615659,
      "learning_rate": 3.984411999182305e-05,
      "loss": 1.4194,
      "num_input_tokens_seen": 26543916864,
      "step": 33738
    },
    {
      "epoch": 3.579354975599406,
      "grad_norm": 0.435981346351967,
      "learning_rate": 3.984356078731165e-05,
      "loss": 1.3888,
      "num_input_tokens_seen": 26544703664,
      "step": 33739
    },
    {
      "epoch": 3.579461065138977,
      "grad_norm": 0.518241854868769,
      "learning_rate": 3.984300157132959e-05,
      "loss": 1.6012,
      "num_input_tokens_seen": 26545490480,
      "step": 33740
    },
    {
      "epoch": 3.5795671546785486,
      "grad_norm": 0.49160015917887256,
      "learning_rate": 3.9842442343877296e-05,
      "loss": 1.3679,
      "num_input_tokens_seen": 26546277280,
      "step": 33741
    },
    {
      "epoch": 3.57967324421812,
      "grad_norm": 0.4974007480453717,
      "learning_rate": 3.984188310495519e-05,
      "loss": 1.4616,
      "num_input_tokens_seen": 26547064048,
      "step": 33742
    },
    {
      "epoch": 3.5797793337576915,
      "grad_norm": 0.47126062406174835,
      "learning_rate": 3.984132385456372e-05,
      "loss": 1.4341,
      "num_input_tokens_seen": 26547850768,
      "step": 33743
    },
    {
      "epoch": 3.579885423297263,
      "grad_norm": 0.41299514060017223,
      "learning_rate": 3.98407645927033e-05,
      "loss": 1.3501,
      "num_input_tokens_seen": 26548637648,
      "step": 33744
    },
    {
      "epoch": 3.579991512836834,
      "grad_norm": 0.5090181358760626,
      "learning_rate": 3.984020531937438e-05,
      "loss": 1.4796,
      "num_input_tokens_seen": 26549424400,
      "step": 33745
    },
    {
      "epoch": 3.580097602376406,
      "grad_norm": 0.4964049490861068,
      "learning_rate": 3.983964603457738e-05,
      "loss": 1.5251,
      "num_input_tokens_seen": 26550211104,
      "step": 33746
    },
    {
      "epoch": 3.580203691915977,
      "grad_norm": 0.5916684492018516,
      "learning_rate": 3.9839086738312736e-05,
      "loss": 1.506,
      "num_input_tokens_seen": 26550998000,
      "step": 33747
    },
    {
      "epoch": 3.5803097814555485,
      "grad_norm": 0.5101881637386748,
      "learning_rate": 3.9838527430580886e-05,
      "loss": 1.5145,
      "num_input_tokens_seen": 26551784688,
      "step": 33748
    },
    {
      "epoch": 3.58041587099512,
      "grad_norm": 0.668978322510736,
      "learning_rate": 3.983796811138226e-05,
      "loss": 1.4981,
      "num_input_tokens_seen": 26552571456,
      "step": 33749
    },
    {
      "epoch": 3.5805219605346914,
      "grad_norm": 0.6018539497957107,
      "learning_rate": 3.9837408780717275e-05,
      "loss": 1.6971,
      "num_input_tokens_seen": 26553358144,
      "step": 33750
    },
    {
      "epoch": 3.580628050074263,
      "grad_norm": 0.6534249451011254,
      "learning_rate": 3.983684943858639e-05,
      "loss": 1.4534,
      "num_input_tokens_seen": 26554144880,
      "step": 33751
    },
    {
      "epoch": 3.580734139613834,
      "grad_norm": 0.6446709951696359,
      "learning_rate": 3.9836290084990015e-05,
      "loss": 1.5161,
      "num_input_tokens_seen": 26554931648,
      "step": 33752
    },
    {
      "epoch": 3.5808402291534054,
      "grad_norm": 0.42159549161160514,
      "learning_rate": 3.983573071992859e-05,
      "loss": 1.5255,
      "num_input_tokens_seen": 26555718320,
      "step": 33753
    },
    {
      "epoch": 3.580946318692977,
      "grad_norm": 0.7842995529825283,
      "learning_rate": 3.9835171343402554e-05,
      "loss": 1.4299,
      "num_input_tokens_seen": 26556505040,
      "step": 33754
    },
    {
      "epoch": 3.5810524082325483,
      "grad_norm": 0.3823883159684017,
      "learning_rate": 3.983461195541233e-05,
      "loss": 1.4101,
      "num_input_tokens_seen": 26557291920,
      "step": 33755
    },
    {
      "epoch": 3.58115849777212,
      "grad_norm": 0.5543311063732781,
      "learning_rate": 3.983405255595835e-05,
      "loss": 1.5801,
      "num_input_tokens_seen": 26558078672,
      "step": 33756
    },
    {
      "epoch": 3.581264587311691,
      "grad_norm": 0.4717868003399615,
      "learning_rate": 3.983349314504105e-05,
      "loss": 1.5079,
      "num_input_tokens_seen": 26558865376,
      "step": 33757
    },
    {
      "epoch": 3.5813706768512623,
      "grad_norm": 0.44582132814758657,
      "learning_rate": 3.983293372266086e-05,
      "loss": 1.5072,
      "num_input_tokens_seen": 26559652160,
      "step": 33758
    },
    {
      "epoch": 3.581476766390834,
      "grad_norm": 0.4492339569691717,
      "learning_rate": 3.983237428881822e-05,
      "loss": 1.4906,
      "num_input_tokens_seen": 26560438800,
      "step": 33759
    },
    {
      "epoch": 3.5815828559304053,
      "grad_norm": 0.50269882378691,
      "learning_rate": 3.983181484351356e-05,
      "loss": 1.4325,
      "num_input_tokens_seen": 26561225520,
      "step": 33760
    },
    {
      "epoch": 3.5816889454699767,
      "grad_norm": 0.43764136786663216,
      "learning_rate": 3.9831255386747305e-05,
      "loss": 1.4123,
      "num_input_tokens_seen": 26562012304,
      "step": 33761
    },
    {
      "epoch": 3.581795035009548,
      "grad_norm": 0.415439509749622,
      "learning_rate": 3.983069591851988e-05,
      "loss": 1.4333,
      "num_input_tokens_seen": 26562799072,
      "step": 33762
    },
    {
      "epoch": 3.5819011245491197,
      "grad_norm": 0.4236820598242291,
      "learning_rate": 3.9830136438831746e-05,
      "loss": 1.4494,
      "num_input_tokens_seen": 26563585840,
      "step": 33763
    },
    {
      "epoch": 3.5820072140886907,
      "grad_norm": 0.4108165466143588,
      "learning_rate": 3.98295769476833e-05,
      "loss": 1.4476,
      "num_input_tokens_seen": 26564372592,
      "step": 33764
    },
    {
      "epoch": 3.582113303628262,
      "grad_norm": 0.48128685330753834,
      "learning_rate": 3.9829017445075e-05,
      "loss": 1.3804,
      "num_input_tokens_seen": 26565159296,
      "step": 33765
    },
    {
      "epoch": 3.5822193931678337,
      "grad_norm": 0.47168283253788673,
      "learning_rate": 3.982845793100728e-05,
      "loss": 1.486,
      "num_input_tokens_seen": 26565946000,
      "step": 33766
    },
    {
      "epoch": 3.582325482707405,
      "grad_norm": 0.4348011394049032,
      "learning_rate": 3.9827898405480553e-05,
      "loss": 1.4464,
      "num_input_tokens_seen": 26566732736,
      "step": 33767
    },
    {
      "epoch": 3.5824315722469766,
      "grad_norm": 0.43617786343170795,
      "learning_rate": 3.982733886849526e-05,
      "loss": 1.4553,
      "num_input_tokens_seen": 26567519504,
      "step": 33768
    },
    {
      "epoch": 3.5825376617865476,
      "grad_norm": 0.41253383829239043,
      "learning_rate": 3.982677932005184e-05,
      "loss": 1.4266,
      "num_input_tokens_seen": 26568306336,
      "step": 33769
    },
    {
      "epoch": 3.582643751326119,
      "grad_norm": 0.47836063213311575,
      "learning_rate": 3.982621976015071e-05,
      "loss": 1.5221,
      "num_input_tokens_seen": 26569093104,
      "step": 33770
    },
    {
      "epoch": 3.5827498408656906,
      "grad_norm": 0.4285197645114603,
      "learning_rate": 3.9825660188792325e-05,
      "loss": 1.4651,
      "num_input_tokens_seen": 26569879856,
      "step": 33771
    },
    {
      "epoch": 3.582855930405262,
      "grad_norm": 0.4947143905721716,
      "learning_rate": 3.9825100605977094e-05,
      "loss": 1.5811,
      "num_input_tokens_seen": 26570666576,
      "step": 33772
    },
    {
      "epoch": 3.5829620199448335,
      "grad_norm": 0.46512312413591,
      "learning_rate": 3.982454101170547e-05,
      "loss": 1.5281,
      "num_input_tokens_seen": 26571453248,
      "step": 33773
    },
    {
      "epoch": 3.5830681094844046,
      "grad_norm": 0.4310678717814627,
      "learning_rate": 3.9823981405977875e-05,
      "loss": 1.5212,
      "num_input_tokens_seen": 26572240112,
      "step": 33774
    },
    {
      "epoch": 3.5831741990239765,
      "grad_norm": 0.4406636667316618,
      "learning_rate": 3.9823421788794736e-05,
      "loss": 1.4292,
      "num_input_tokens_seen": 26573026976,
      "step": 33775
    },
    {
      "epoch": 3.5832802885635475,
      "grad_norm": 0.5050899459571531,
      "learning_rate": 3.982286216015649e-05,
      "loss": 1.4704,
      "num_input_tokens_seen": 26573813712,
      "step": 33776
    },
    {
      "epoch": 3.583386378103119,
      "grad_norm": 0.4523285446978084,
      "learning_rate": 3.982230252006358e-05,
      "loss": 1.3918,
      "num_input_tokens_seen": 26574600480,
      "step": 33777
    },
    {
      "epoch": 3.5834924676426905,
      "grad_norm": 0.4841739355850922,
      "learning_rate": 3.982174286851642e-05,
      "loss": 1.3799,
      "num_input_tokens_seen": 26575387232,
      "step": 33778
    },
    {
      "epoch": 3.583598557182262,
      "grad_norm": 0.4336535102256543,
      "learning_rate": 3.982118320551545e-05,
      "loss": 1.527,
      "num_input_tokens_seen": 26576173968,
      "step": 33779
    },
    {
      "epoch": 3.5837046467218334,
      "grad_norm": 0.4134846438375278,
      "learning_rate": 3.9820623531061115e-05,
      "loss": 1.3547,
      "num_input_tokens_seen": 26576960736,
      "step": 33780
    },
    {
      "epoch": 3.5838107362614045,
      "grad_norm": 0.4833730460797165,
      "learning_rate": 3.982006384515383e-05,
      "loss": 1.4093,
      "num_input_tokens_seen": 26577747568,
      "step": 33781
    },
    {
      "epoch": 3.583916825800976,
      "grad_norm": 0.44728548843287835,
      "learning_rate": 3.981950414779404e-05,
      "loss": 1.5971,
      "num_input_tokens_seen": 26578534240,
      "step": 33782
    },
    {
      "epoch": 3.5840229153405474,
      "grad_norm": 0.43377021177799463,
      "learning_rate": 3.981894443898218e-05,
      "loss": 1.5031,
      "num_input_tokens_seen": 26579320992,
      "step": 33783
    },
    {
      "epoch": 3.584129004880119,
      "grad_norm": 0.49736530171460297,
      "learning_rate": 3.981838471871865e-05,
      "loss": 1.5079,
      "num_input_tokens_seen": 26580107712,
      "step": 33784
    },
    {
      "epoch": 3.5842350944196903,
      "grad_norm": 0.4840321799124547,
      "learning_rate": 3.9817824987003925e-05,
      "loss": 1.5142,
      "num_input_tokens_seen": 26580894464,
      "step": 33785
    },
    {
      "epoch": 3.5843411839592614,
      "grad_norm": 0.430363645482441,
      "learning_rate": 3.981726524383842e-05,
      "loss": 1.4612,
      "num_input_tokens_seen": 26581681216,
      "step": 33786
    },
    {
      "epoch": 3.584447273498833,
      "grad_norm": 0.44581494059338034,
      "learning_rate": 3.981670548922256e-05,
      "loss": 1.4599,
      "num_input_tokens_seen": 26582467936,
      "step": 33787
    },
    {
      "epoch": 3.5845533630384043,
      "grad_norm": 0.5374776818213772,
      "learning_rate": 3.981614572315678e-05,
      "loss": 1.5656,
      "num_input_tokens_seen": 26583254720,
      "step": 33788
    },
    {
      "epoch": 3.584659452577976,
      "grad_norm": 0.39887963975580526,
      "learning_rate": 3.981558594564153e-05,
      "loss": 1.5122,
      "num_input_tokens_seen": 26584041584,
      "step": 33789
    },
    {
      "epoch": 3.5847655421175473,
      "grad_norm": 0.5893991218104495,
      "learning_rate": 3.9815026156677224e-05,
      "loss": 1.445,
      "num_input_tokens_seen": 26584828352,
      "step": 33790
    },
    {
      "epoch": 3.5848716316571188,
      "grad_norm": 0.4886825249632259,
      "learning_rate": 3.9814466356264304e-05,
      "loss": 1.4889,
      "num_input_tokens_seen": 26585615168,
      "step": 33791
    },
    {
      "epoch": 3.5849777211966902,
      "grad_norm": 0.4154911465055524,
      "learning_rate": 3.98139065444032e-05,
      "loss": 1.3744,
      "num_input_tokens_seen": 26586401984,
      "step": 33792
    },
    {
      "epoch": 3.5850838107362613,
      "grad_norm": 0.5015692120997532,
      "learning_rate": 3.981334672109433e-05,
      "loss": 1.4265,
      "num_input_tokens_seen": 26587188752,
      "step": 33793
    },
    {
      "epoch": 3.5851899002758327,
      "grad_norm": 0.44948060263125855,
      "learning_rate": 3.981278688633816e-05,
      "loss": 1.5188,
      "num_input_tokens_seen": 26587975568,
      "step": 33794
    },
    {
      "epoch": 3.585295989815404,
      "grad_norm": 0.508182411919972,
      "learning_rate": 3.981222704013508e-05,
      "loss": 1.6042,
      "num_input_tokens_seen": 26588762336,
      "step": 33795
    },
    {
      "epoch": 3.5854020793549757,
      "grad_norm": 0.4792181795842176,
      "learning_rate": 3.981166718248557e-05,
      "loss": 1.5673,
      "num_input_tokens_seen": 26589549008,
      "step": 33796
    },
    {
      "epoch": 3.585508168894547,
      "grad_norm": 0.3958302120467958,
      "learning_rate": 3.981110731339003e-05,
      "loss": 1.4039,
      "num_input_tokens_seen": 26590335808,
      "step": 33797
    },
    {
      "epoch": 3.585614258434118,
      "grad_norm": 0.41557713758088394,
      "learning_rate": 3.9810547432848896e-05,
      "loss": 1.4439,
      "num_input_tokens_seen": 26591122592,
      "step": 33798
    },
    {
      "epoch": 3.5857203479736897,
      "grad_norm": 0.6860170939360783,
      "learning_rate": 3.980998754086261e-05,
      "loss": 1.6007,
      "num_input_tokens_seen": 26591909296,
      "step": 33799
    },
    {
      "epoch": 3.585826437513261,
      "grad_norm": 0.48888847010240905,
      "learning_rate": 3.9809427637431594e-05,
      "loss": 1.4369,
      "num_input_tokens_seen": 26592696128,
      "step": 33800
    },
    {
      "epoch": 3.5859325270528326,
      "grad_norm": 0.5654634932359768,
      "learning_rate": 3.9808867722556286e-05,
      "loss": 1.3746,
      "num_input_tokens_seen": 26593482912,
      "step": 33801
    },
    {
      "epoch": 3.586038616592404,
      "grad_norm": 0.44575269574649834,
      "learning_rate": 3.980830779623712e-05,
      "loss": 1.4496,
      "num_input_tokens_seen": 26594269680,
      "step": 33802
    },
    {
      "epoch": 3.586144706131975,
      "grad_norm": 0.487307560422181,
      "learning_rate": 3.9807747858474536e-05,
      "loss": 1.4382,
      "num_input_tokens_seen": 26595056560,
      "step": 33803
    },
    {
      "epoch": 3.586250795671547,
      "grad_norm": 0.4713517297907428,
      "learning_rate": 3.980718790926895e-05,
      "loss": 1.4924,
      "num_input_tokens_seen": 26595843360,
      "step": 33804
    },
    {
      "epoch": 3.586356885211118,
      "grad_norm": 0.45725936862330513,
      "learning_rate": 3.9806627948620814e-05,
      "loss": 1.4292,
      "num_input_tokens_seen": 26596630064,
      "step": 33805
    },
    {
      "epoch": 3.5864629747506895,
      "grad_norm": 0.5955342870373976,
      "learning_rate": 3.980606797653055e-05,
      "loss": 1.5652,
      "num_input_tokens_seen": 26597416832,
      "step": 33806
    },
    {
      "epoch": 3.586569064290261,
      "grad_norm": 0.4743675857858492,
      "learning_rate": 3.980550799299858e-05,
      "loss": 1.4432,
      "num_input_tokens_seen": 26598203696,
      "step": 33807
    },
    {
      "epoch": 3.5866751538298325,
      "grad_norm": 0.4717167648192954,
      "learning_rate": 3.9804947998025356e-05,
      "loss": 1.3388,
      "num_input_tokens_seen": 26598990464,
      "step": 33808
    },
    {
      "epoch": 3.586781243369404,
      "grad_norm": 0.43375350887055536,
      "learning_rate": 3.9804387991611306e-05,
      "loss": 1.4658,
      "num_input_tokens_seen": 26599777200,
      "step": 33809
    },
    {
      "epoch": 3.586887332908975,
      "grad_norm": 0.4409698295309476,
      "learning_rate": 3.980382797375685e-05,
      "loss": 1.4391,
      "num_input_tokens_seen": 26600563872,
      "step": 33810
    },
    {
      "epoch": 3.5869934224485465,
      "grad_norm": 0.4992576151965646,
      "learning_rate": 3.980326794446243e-05,
      "loss": 1.3618,
      "num_input_tokens_seen": 26601350704,
      "step": 33811
    },
    {
      "epoch": 3.587099511988118,
      "grad_norm": 0.4742932454724157,
      "learning_rate": 3.9802707903728484e-05,
      "loss": 1.4417,
      "num_input_tokens_seen": 26602137536,
      "step": 33812
    },
    {
      "epoch": 3.5872056015276894,
      "grad_norm": 0.4511867421221336,
      "learning_rate": 3.980214785155544e-05,
      "loss": 1.3714,
      "num_input_tokens_seen": 26602924240,
      "step": 33813
    },
    {
      "epoch": 3.587311691067261,
      "grad_norm": 0.4902828056272928,
      "learning_rate": 3.9801587787943725e-05,
      "loss": 1.5423,
      "num_input_tokens_seen": 26603710976,
      "step": 33814
    },
    {
      "epoch": 3.587417780606832,
      "grad_norm": 0.49127796446252303,
      "learning_rate": 3.980102771289378e-05,
      "loss": 1.532,
      "num_input_tokens_seen": 26604497728,
      "step": 33815
    },
    {
      "epoch": 3.587523870146404,
      "grad_norm": 0.4037681805387579,
      "learning_rate": 3.980046762640605e-05,
      "loss": 1.5513,
      "num_input_tokens_seen": 26605284560,
      "step": 33816
    },
    {
      "epoch": 3.587629959685975,
      "grad_norm": 0.4826816645739335,
      "learning_rate": 3.979990752848093e-05,
      "loss": 1.3582,
      "num_input_tokens_seen": 26606071360,
      "step": 33817
    },
    {
      "epoch": 3.5877360492255463,
      "grad_norm": 0.4228632451974709,
      "learning_rate": 3.979934741911889e-05,
      "loss": 1.419,
      "num_input_tokens_seen": 26606858096,
      "step": 33818
    },
    {
      "epoch": 3.587842138765118,
      "grad_norm": 0.419285215921917,
      "learning_rate": 3.979878729832034e-05,
      "loss": 1.4302,
      "num_input_tokens_seen": 26607644928,
      "step": 33819
    },
    {
      "epoch": 3.5879482283046893,
      "grad_norm": 0.43648958308671226,
      "learning_rate": 3.979822716608572e-05,
      "loss": 1.4528,
      "num_input_tokens_seen": 26608431712,
      "step": 33820
    },
    {
      "epoch": 3.5880543178442608,
      "grad_norm": 0.49287861000080324,
      "learning_rate": 3.9797667022415477e-05,
      "loss": 1.5221,
      "num_input_tokens_seen": 26609218464,
      "step": 33821
    },
    {
      "epoch": 3.588160407383832,
      "grad_norm": 0.5935803817181042,
      "learning_rate": 3.979710686731002e-05,
      "loss": 1.6907,
      "num_input_tokens_seen": 26610005216,
      "step": 33822
    },
    {
      "epoch": 3.5882664969234033,
      "grad_norm": 0.6025096198739509,
      "learning_rate": 3.97965467007698e-05,
      "loss": 1.6161,
      "num_input_tokens_seen": 26610791936,
      "step": 33823
    },
    {
      "epoch": 3.5883725864629747,
      "grad_norm": 0.5632210759700296,
      "learning_rate": 3.979598652279524e-05,
      "loss": 1.4693,
      "num_input_tokens_seen": 26611578624,
      "step": 33824
    },
    {
      "epoch": 3.588478676002546,
      "grad_norm": 0.48851866032273406,
      "learning_rate": 3.9795426333386774e-05,
      "loss": 1.5357,
      "num_input_tokens_seen": 26612365376,
      "step": 33825
    },
    {
      "epoch": 3.5885847655421177,
      "grad_norm": 0.5483763054560119,
      "learning_rate": 3.979486613254484e-05,
      "loss": 1.4602,
      "num_input_tokens_seen": 26613152112,
      "step": 33826
    },
    {
      "epoch": 3.5886908550816887,
      "grad_norm": 0.44022564257230673,
      "learning_rate": 3.979430592026986e-05,
      "loss": 1.455,
      "num_input_tokens_seen": 26613938864,
      "step": 33827
    },
    {
      "epoch": 3.58879694462126,
      "grad_norm": 0.4905242895229058,
      "learning_rate": 3.979374569656228e-05,
      "loss": 1.4514,
      "num_input_tokens_seen": 26614725616,
      "step": 33828
    },
    {
      "epoch": 3.5889030341608317,
      "grad_norm": 0.4779074071826364,
      "learning_rate": 3.9793185461422536e-05,
      "loss": 1.3877,
      "num_input_tokens_seen": 26615512352,
      "step": 33829
    },
    {
      "epoch": 3.589009123700403,
      "grad_norm": 0.41873901425356136,
      "learning_rate": 3.9792625214851036e-05,
      "loss": 1.5385,
      "num_input_tokens_seen": 26616299152,
      "step": 33830
    },
    {
      "epoch": 3.5891152132399746,
      "grad_norm": 0.44882938037015435,
      "learning_rate": 3.979206495684824e-05,
      "loss": 1.4758,
      "num_input_tokens_seen": 26617085936,
      "step": 33831
    },
    {
      "epoch": 3.589221302779546,
      "grad_norm": 0.4960027012525199,
      "learning_rate": 3.979150468741456e-05,
      "loss": 1.5334,
      "num_input_tokens_seen": 26617872672,
      "step": 33832
    },
    {
      "epoch": 3.5893273923191176,
      "grad_norm": 0.43053156620777305,
      "learning_rate": 3.979094440655045e-05,
      "loss": 1.3979,
      "num_input_tokens_seen": 26618659360,
      "step": 33833
    },
    {
      "epoch": 3.5894334818586886,
      "grad_norm": 0.5080203885961452,
      "learning_rate": 3.979038411425633e-05,
      "loss": 1.4157,
      "num_input_tokens_seen": 26619446080,
      "step": 33834
    },
    {
      "epoch": 3.58953957139826,
      "grad_norm": 0.4513341801082204,
      "learning_rate": 3.978982381053264e-05,
      "loss": 1.3271,
      "num_input_tokens_seen": 26620232912,
      "step": 33835
    },
    {
      "epoch": 3.5896456609378316,
      "grad_norm": 0.38368119897988756,
      "learning_rate": 3.978926349537979e-05,
      "loss": 1.2954,
      "num_input_tokens_seen": 26621019696,
      "step": 33836
    },
    {
      "epoch": 3.589751750477403,
      "grad_norm": 0.4679087706732648,
      "learning_rate": 3.9788703168798246e-05,
      "loss": 1.4814,
      "num_input_tokens_seen": 26621806368,
      "step": 33837
    },
    {
      "epoch": 3.5898578400169745,
      "grad_norm": 0.4481667086366149,
      "learning_rate": 3.978814283078842e-05,
      "loss": 1.5335,
      "num_input_tokens_seen": 26622593120,
      "step": 33838
    },
    {
      "epoch": 3.5899639295565455,
      "grad_norm": 0.4663853879055109,
      "learning_rate": 3.978758248135076e-05,
      "loss": 1.4913,
      "num_input_tokens_seen": 26623379808,
      "step": 33839
    },
    {
      "epoch": 3.590070019096117,
      "grad_norm": 0.44256509907846775,
      "learning_rate": 3.9787022120485684e-05,
      "loss": 1.4026,
      "num_input_tokens_seen": 26624166576,
      "step": 33840
    },
    {
      "epoch": 3.5901761086356885,
      "grad_norm": 0.5441931519559392,
      "learning_rate": 3.9786461748193624e-05,
      "loss": 1.5514,
      "num_input_tokens_seen": 26624953296,
      "step": 33841
    },
    {
      "epoch": 3.59028219817526,
      "grad_norm": 0.5863430162202229,
      "learning_rate": 3.978590136447503e-05,
      "loss": 1.5069,
      "num_input_tokens_seen": 26625740016,
      "step": 33842
    },
    {
      "epoch": 3.5903882877148314,
      "grad_norm": 0.470228763980586,
      "learning_rate": 3.9785340969330325e-05,
      "loss": 1.445,
      "num_input_tokens_seen": 26626526752,
      "step": 33843
    },
    {
      "epoch": 3.5904943772544025,
      "grad_norm": 0.406829511663943,
      "learning_rate": 3.978478056275994e-05,
      "loss": 1.4726,
      "num_input_tokens_seen": 26627313504,
      "step": 33844
    },
    {
      "epoch": 3.5906004667939744,
      "grad_norm": 0.6563835529383005,
      "learning_rate": 3.9784220144764306e-05,
      "loss": 1.5024,
      "num_input_tokens_seen": 26628100256,
      "step": 33845
    },
    {
      "epoch": 3.5907065563335454,
      "grad_norm": 0.3966283048564012,
      "learning_rate": 3.9783659715343865e-05,
      "loss": 1.4741,
      "num_input_tokens_seen": 26628887072,
      "step": 33846
    },
    {
      "epoch": 3.590812645873117,
      "grad_norm": 0.48801502471585784,
      "learning_rate": 3.9783099274499044e-05,
      "loss": 1.4518,
      "num_input_tokens_seen": 26629673808,
      "step": 33847
    },
    {
      "epoch": 3.5909187354126884,
      "grad_norm": 0.4528023587565032,
      "learning_rate": 3.978253882223028e-05,
      "loss": 1.4957,
      "num_input_tokens_seen": 26630460512,
      "step": 33848
    },
    {
      "epoch": 3.59102482495226,
      "grad_norm": 0.4592983393979401,
      "learning_rate": 3.978197835853801e-05,
      "loss": 1.4154,
      "num_input_tokens_seen": 26631247200,
      "step": 33849
    },
    {
      "epoch": 3.5911309144918313,
      "grad_norm": 0.41954733006360245,
      "learning_rate": 3.9781417883422646e-05,
      "loss": 1.4202,
      "num_input_tokens_seen": 26632034000,
      "step": 33850
    },
    {
      "epoch": 3.5912370040314023,
      "grad_norm": 0.5427580596795832,
      "learning_rate": 3.978085739688464e-05,
      "loss": 1.4414,
      "num_input_tokens_seen": 26632820768,
      "step": 33851
    },
    {
      "epoch": 3.591343093570974,
      "grad_norm": 0.40971986785842207,
      "learning_rate": 3.978029689892443e-05,
      "loss": 1.4113,
      "num_input_tokens_seen": 26633607456,
      "step": 33852
    },
    {
      "epoch": 3.5914491831105453,
      "grad_norm": 0.6591197887596277,
      "learning_rate": 3.977973638954243e-05,
      "loss": 1.4991,
      "num_input_tokens_seen": 26634394288,
      "step": 33853
    },
    {
      "epoch": 3.5915552726501168,
      "grad_norm": 0.4142007699095921,
      "learning_rate": 3.977917586873909e-05,
      "loss": 1.4464,
      "num_input_tokens_seen": 26635181056,
      "step": 33854
    },
    {
      "epoch": 3.5916613621896882,
      "grad_norm": 0.5331617799936658,
      "learning_rate": 3.977861533651483e-05,
      "loss": 1.4398,
      "num_input_tokens_seen": 26635967856,
      "step": 33855
    },
    {
      "epoch": 3.5917674517292593,
      "grad_norm": 0.5007399473292058,
      "learning_rate": 3.97780547928701e-05,
      "loss": 1.3818,
      "num_input_tokens_seen": 26636754688,
      "step": 33856
    },
    {
      "epoch": 3.5918735412688307,
      "grad_norm": 0.4094381347382189,
      "learning_rate": 3.977749423780533e-05,
      "loss": 1.4289,
      "num_input_tokens_seen": 26637541504,
      "step": 33857
    },
    {
      "epoch": 3.591979630808402,
      "grad_norm": 0.4895319215686507,
      "learning_rate": 3.977693367132093e-05,
      "loss": 1.4711,
      "num_input_tokens_seen": 26638328320,
      "step": 33858
    },
    {
      "epoch": 3.5920857203479737,
      "grad_norm": 0.4274103914265631,
      "learning_rate": 3.9776373093417346e-05,
      "loss": 1.4801,
      "num_input_tokens_seen": 26639115072,
      "step": 33859
    },
    {
      "epoch": 3.592191809887545,
      "grad_norm": 0.41926114100574835,
      "learning_rate": 3.977581250409502e-05,
      "loss": 1.3806,
      "num_input_tokens_seen": 26639901824,
      "step": 33860
    },
    {
      "epoch": 3.5922978994271166,
      "grad_norm": 0.46026271832524623,
      "learning_rate": 3.977525190335438e-05,
      "loss": 1.4405,
      "num_input_tokens_seen": 26640688608,
      "step": 33861
    },
    {
      "epoch": 3.592403988966688,
      "grad_norm": 0.4671595699208,
      "learning_rate": 3.9774691291195866e-05,
      "loss": 1.3753,
      "num_input_tokens_seen": 26641475312,
      "step": 33862
    },
    {
      "epoch": 3.592510078506259,
      "grad_norm": 0.5063030200466997,
      "learning_rate": 3.977413066761989e-05,
      "loss": 1.4705,
      "num_input_tokens_seen": 26642262112,
      "step": 33863
    },
    {
      "epoch": 3.5926161680458306,
      "grad_norm": 0.5888653660193418,
      "learning_rate": 3.977357003262691e-05,
      "loss": 1.3967,
      "num_input_tokens_seen": 26643048928,
      "step": 33864
    },
    {
      "epoch": 3.592722257585402,
      "grad_norm": 0.5016652388774596,
      "learning_rate": 3.9773009386217356e-05,
      "loss": 1.4163,
      "num_input_tokens_seen": 26643835776,
      "step": 33865
    },
    {
      "epoch": 3.5928283471249736,
      "grad_norm": 0.5888718609147876,
      "learning_rate": 3.9772448728391634e-05,
      "loss": 1.4758,
      "num_input_tokens_seen": 26644622608,
      "step": 33866
    },
    {
      "epoch": 3.592934436664545,
      "grad_norm": 0.6986309497061023,
      "learning_rate": 3.9771888059150206e-05,
      "loss": 1.4949,
      "num_input_tokens_seen": 26645409472,
      "step": 33867
    },
    {
      "epoch": 3.593040526204116,
      "grad_norm": 0.5029742253962364,
      "learning_rate": 3.977132737849349e-05,
      "loss": 1.5966,
      "num_input_tokens_seen": 26646196208,
      "step": 33868
    },
    {
      "epoch": 3.5931466157436875,
      "grad_norm": 0.5406517580336335,
      "learning_rate": 3.9770766686421944e-05,
      "loss": 1.3883,
      "num_input_tokens_seen": 26646982992,
      "step": 33869
    },
    {
      "epoch": 3.593252705283259,
      "grad_norm": 0.4485416454216386,
      "learning_rate": 3.977020598293597e-05,
      "loss": 1.5238,
      "num_input_tokens_seen": 26647769776,
      "step": 33870
    },
    {
      "epoch": 3.5933587948228305,
      "grad_norm": 0.518611740833052,
      "learning_rate": 3.9769645268036017e-05,
      "loss": 1.412,
      "num_input_tokens_seen": 26648556432,
      "step": 33871
    },
    {
      "epoch": 3.593464884362402,
      "grad_norm": 0.450797589468243,
      "learning_rate": 3.976908454172251e-05,
      "loss": 1.4413,
      "num_input_tokens_seen": 26649343152,
      "step": 33872
    },
    {
      "epoch": 3.593570973901973,
      "grad_norm": 0.45386794358982513,
      "learning_rate": 3.9768523803995894e-05,
      "loss": 1.3844,
      "num_input_tokens_seen": 26650129952,
      "step": 33873
    },
    {
      "epoch": 3.593677063441545,
      "grad_norm": 0.5302973022023648,
      "learning_rate": 3.976796305485659e-05,
      "loss": 1.4131,
      "num_input_tokens_seen": 26650916704,
      "step": 33874
    },
    {
      "epoch": 3.593783152981116,
      "grad_norm": 0.4948136731006206,
      "learning_rate": 3.976740229430505e-05,
      "loss": 1.3767,
      "num_input_tokens_seen": 26651703456,
      "step": 33875
    },
    {
      "epoch": 3.5938892425206874,
      "grad_norm": 0.5414971179235897,
      "learning_rate": 3.976684152234168e-05,
      "loss": 1.3625,
      "num_input_tokens_seen": 26652490320,
      "step": 33876
    },
    {
      "epoch": 3.593995332060259,
      "grad_norm": 0.46489384143987716,
      "learning_rate": 3.976628073896693e-05,
      "loss": 1.461,
      "num_input_tokens_seen": 26653277088,
      "step": 33877
    },
    {
      "epoch": 3.5941014215998304,
      "grad_norm": 0.6037136798540019,
      "learning_rate": 3.9765719944181246e-05,
      "loss": 1.3817,
      "num_input_tokens_seen": 26654063904,
      "step": 33878
    },
    {
      "epoch": 3.594207511139402,
      "grad_norm": 0.4446440921461801,
      "learning_rate": 3.976515913798503e-05,
      "loss": 1.4552,
      "num_input_tokens_seen": 26654850704,
      "step": 33879
    },
    {
      "epoch": 3.594313600678973,
      "grad_norm": 0.6352411162844043,
      "learning_rate": 3.9764598320378743e-05,
      "loss": 1.4264,
      "num_input_tokens_seen": 26655637488,
      "step": 33880
    },
    {
      "epoch": 3.5944196902185443,
      "grad_norm": 0.39805959694562654,
      "learning_rate": 3.9764037491362805e-05,
      "loss": 1.3524,
      "num_input_tokens_seen": 26656424304,
      "step": 33881
    },
    {
      "epoch": 3.594525779758116,
      "grad_norm": 0.5207793076598092,
      "learning_rate": 3.9763476650937645e-05,
      "loss": 1.4772,
      "num_input_tokens_seen": 26657210992,
      "step": 33882
    },
    {
      "epoch": 3.5946318692976873,
      "grad_norm": 0.5412978410679472,
      "learning_rate": 3.9762915799103716e-05,
      "loss": 1.3816,
      "num_input_tokens_seen": 26657997840,
      "step": 33883
    },
    {
      "epoch": 3.5947379588372588,
      "grad_norm": 0.5316005549347289,
      "learning_rate": 3.9762354935861426e-05,
      "loss": 1.4993,
      "num_input_tokens_seen": 26658784480,
      "step": 33884
    },
    {
      "epoch": 3.59484404837683,
      "grad_norm": 0.40670034633937757,
      "learning_rate": 3.9761794061211235e-05,
      "loss": 1.3798,
      "num_input_tokens_seen": 26659571376,
      "step": 33885
    },
    {
      "epoch": 3.5949501379164013,
      "grad_norm": 0.5038729640339193,
      "learning_rate": 3.976123317515356e-05,
      "loss": 1.4616,
      "num_input_tokens_seen": 26660358096,
      "step": 33886
    },
    {
      "epoch": 3.5950562274559728,
      "grad_norm": 0.46370310311437607,
      "learning_rate": 3.9760672277688825e-05,
      "loss": 1.3747,
      "num_input_tokens_seen": 26661144816,
      "step": 33887
    },
    {
      "epoch": 3.5951623169955442,
      "grad_norm": 0.634361878678872,
      "learning_rate": 3.976011136881748e-05,
      "loss": 1.5683,
      "num_input_tokens_seen": 26661931456,
      "step": 33888
    },
    {
      "epoch": 3.5952684065351157,
      "grad_norm": 0.44977414917184094,
      "learning_rate": 3.975955044853996e-05,
      "loss": 1.4639,
      "num_input_tokens_seen": 26662718256,
      "step": 33889
    },
    {
      "epoch": 3.595374496074687,
      "grad_norm": 0.5155977085226155,
      "learning_rate": 3.9758989516856685e-05,
      "loss": 1.5611,
      "num_input_tokens_seen": 26663505024,
      "step": 33890
    },
    {
      "epoch": 3.5954805856142587,
      "grad_norm": 0.5241720803058795,
      "learning_rate": 3.97584285737681e-05,
      "loss": 1.3365,
      "num_input_tokens_seen": 26664291808,
      "step": 33891
    },
    {
      "epoch": 3.5955866751538297,
      "grad_norm": 0.5447051509857486,
      "learning_rate": 3.9757867619274635e-05,
      "loss": 1.4876,
      "num_input_tokens_seen": 26665078528,
      "step": 33892
    },
    {
      "epoch": 3.595692764693401,
      "grad_norm": 0.6127797225815043,
      "learning_rate": 3.975730665337672e-05,
      "loss": 1.3086,
      "num_input_tokens_seen": 26665865392,
      "step": 33893
    },
    {
      "epoch": 3.5957988542329726,
      "grad_norm": 0.6610460646599008,
      "learning_rate": 3.9756745676074805e-05,
      "loss": 1.4816,
      "num_input_tokens_seen": 26666652176,
      "step": 33894
    },
    {
      "epoch": 3.595904943772544,
      "grad_norm": 0.45901493546413596,
      "learning_rate": 3.975618468736929e-05,
      "loss": 1.432,
      "num_input_tokens_seen": 26667438992,
      "step": 33895
    },
    {
      "epoch": 3.5960110333121156,
      "grad_norm": 0.5077078719024467,
      "learning_rate": 3.975562368726063e-05,
      "loss": 1.4661,
      "num_input_tokens_seen": 26668225680,
      "step": 33896
    },
    {
      "epoch": 3.5961171228516866,
      "grad_norm": 0.4603996088868515,
      "learning_rate": 3.975506267574927e-05,
      "loss": 1.3962,
      "num_input_tokens_seen": 26669012496,
      "step": 33897
    },
    {
      "epoch": 3.596223212391258,
      "grad_norm": 0.5064039349597891,
      "learning_rate": 3.975450165283563e-05,
      "loss": 1.4766,
      "num_input_tokens_seen": 26669799184,
      "step": 33898
    },
    {
      "epoch": 3.5963293019308296,
      "grad_norm": 0.4790996671849479,
      "learning_rate": 3.9753940618520136e-05,
      "loss": 1.5906,
      "num_input_tokens_seen": 26670586000,
      "step": 33899
    },
    {
      "epoch": 3.596435391470401,
      "grad_norm": 0.4247132682708326,
      "learning_rate": 3.9753379572803226e-05,
      "loss": 1.3564,
      "num_input_tokens_seen": 26671372800,
      "step": 33900
    },
    {
      "epoch": 3.5965414810099725,
      "grad_norm": 0.4751036688760783,
      "learning_rate": 3.975281851568535e-05,
      "loss": 1.5179,
      "num_input_tokens_seen": 26672159408,
      "step": 33901
    },
    {
      "epoch": 3.5966475705495435,
      "grad_norm": 0.46925811534366213,
      "learning_rate": 3.975225744716692e-05,
      "loss": 1.5267,
      "num_input_tokens_seen": 26672946192,
      "step": 33902
    },
    {
      "epoch": 3.5967536600891155,
      "grad_norm": 0.4020368462690659,
      "learning_rate": 3.975169636724838e-05,
      "loss": 1.3632,
      "num_input_tokens_seen": 26673733040,
      "step": 33903
    },
    {
      "epoch": 3.5968597496286865,
      "grad_norm": 0.42272828678695684,
      "learning_rate": 3.975113527593016e-05,
      "loss": 1.3623,
      "num_input_tokens_seen": 26674519888,
      "step": 33904
    },
    {
      "epoch": 3.596965839168258,
      "grad_norm": 0.4639480930887647,
      "learning_rate": 3.975057417321271e-05,
      "loss": 1.3514,
      "num_input_tokens_seen": 26675306672,
      "step": 33905
    },
    {
      "epoch": 3.5970719287078294,
      "grad_norm": 0.4760375268526817,
      "learning_rate": 3.975001305909643e-05,
      "loss": 1.3839,
      "num_input_tokens_seen": 26676093456,
      "step": 33906
    },
    {
      "epoch": 3.597178018247401,
      "grad_norm": 0.3958214022843341,
      "learning_rate": 3.974945193358178e-05,
      "loss": 1.463,
      "num_input_tokens_seen": 26676880256,
      "step": 33907
    },
    {
      "epoch": 3.5972841077869724,
      "grad_norm": 0.46364406275012804,
      "learning_rate": 3.974889079666919e-05,
      "loss": 1.5403,
      "num_input_tokens_seen": 26677667088,
      "step": 33908
    },
    {
      "epoch": 3.5973901973265434,
      "grad_norm": 0.5149543663611788,
      "learning_rate": 3.9748329648359085e-05,
      "loss": 1.5039,
      "num_input_tokens_seen": 26678453840,
      "step": 33909
    },
    {
      "epoch": 3.597496286866115,
      "grad_norm": 0.4315472501411551,
      "learning_rate": 3.97477684886519e-05,
      "loss": 1.4614,
      "num_input_tokens_seen": 26679240656,
      "step": 33910
    },
    {
      "epoch": 3.5976023764056864,
      "grad_norm": 0.6771116025608219,
      "learning_rate": 3.974720731754808e-05,
      "loss": 1.4355,
      "num_input_tokens_seen": 26680027376,
      "step": 33911
    },
    {
      "epoch": 3.597708465945258,
      "grad_norm": 0.40955300648270987,
      "learning_rate": 3.974664613504805e-05,
      "loss": 1.4596,
      "num_input_tokens_seen": 26680814128,
      "step": 33912
    },
    {
      "epoch": 3.5978145554848293,
      "grad_norm": 0.385252553835444,
      "learning_rate": 3.974608494115224e-05,
      "loss": 1.3122,
      "num_input_tokens_seen": 26681600928,
      "step": 33913
    },
    {
      "epoch": 3.5979206450244003,
      "grad_norm": 0.6029020391294637,
      "learning_rate": 3.974552373586109e-05,
      "loss": 1.4089,
      "num_input_tokens_seen": 26682387664,
      "step": 33914
    },
    {
      "epoch": 3.5980267345639723,
      "grad_norm": 0.39021070631009397,
      "learning_rate": 3.974496251917503e-05,
      "loss": 1.3716,
      "num_input_tokens_seen": 26683174432,
      "step": 33915
    },
    {
      "epoch": 3.5981328241035433,
      "grad_norm": 0.42397728566395365,
      "learning_rate": 3.97444012910945e-05,
      "loss": 1.2822,
      "num_input_tokens_seen": 26683961264,
      "step": 33916
    },
    {
      "epoch": 3.5982389136431148,
      "grad_norm": 0.5861908679023816,
      "learning_rate": 3.974384005161993e-05,
      "loss": 1.4894,
      "num_input_tokens_seen": 26684748080,
      "step": 33917
    },
    {
      "epoch": 3.5983450031826862,
      "grad_norm": 0.38899717295671665,
      "learning_rate": 3.974327880075175e-05,
      "loss": 1.4173,
      "num_input_tokens_seen": 26685534880,
      "step": 33918
    },
    {
      "epoch": 3.5984510927222577,
      "grad_norm": 0.5506822580193313,
      "learning_rate": 3.9742717538490396e-05,
      "loss": 1.5175,
      "num_input_tokens_seen": 26686321648,
      "step": 33919
    },
    {
      "epoch": 3.598557182261829,
      "grad_norm": 0.48944030304047337,
      "learning_rate": 3.97421562648363e-05,
      "loss": 1.4527,
      "num_input_tokens_seen": 26687108368,
      "step": 33920
    },
    {
      "epoch": 3.5986632718014,
      "grad_norm": 0.46769005519874507,
      "learning_rate": 3.974159497978991e-05,
      "loss": 1.4761,
      "num_input_tokens_seen": 26687895136,
      "step": 33921
    },
    {
      "epoch": 3.5987693613409717,
      "grad_norm": 0.5526832400327335,
      "learning_rate": 3.974103368335164e-05,
      "loss": 1.4456,
      "num_input_tokens_seen": 26688681872,
      "step": 33922
    },
    {
      "epoch": 3.598875450880543,
      "grad_norm": 0.39808589624177776,
      "learning_rate": 3.9740472375521934e-05,
      "loss": 1.476,
      "num_input_tokens_seen": 26689468640,
      "step": 33923
    },
    {
      "epoch": 3.5989815404201146,
      "grad_norm": 0.44086041574100726,
      "learning_rate": 3.9739911056301215e-05,
      "loss": 1.61,
      "num_input_tokens_seen": 26690255296,
      "step": 33924
    },
    {
      "epoch": 3.599087629959686,
      "grad_norm": 0.48972331571097394,
      "learning_rate": 3.9739349725689936e-05,
      "loss": 1.5144,
      "num_input_tokens_seen": 26691042016,
      "step": 33925
    },
    {
      "epoch": 3.599193719499257,
      "grad_norm": 0.4704496333675199,
      "learning_rate": 3.973878838368851e-05,
      "loss": 1.5242,
      "num_input_tokens_seen": 26691828800,
      "step": 33926
    },
    {
      "epoch": 3.5992998090388286,
      "grad_norm": 0.5091402411445515,
      "learning_rate": 3.9738227030297385e-05,
      "loss": 1.4211,
      "num_input_tokens_seen": 26692615584,
      "step": 33927
    },
    {
      "epoch": 3.5994058985784,
      "grad_norm": 0.48112028967243115,
      "learning_rate": 3.9737665665516993e-05,
      "loss": 1.3956,
      "num_input_tokens_seen": 26693402336,
      "step": 33928
    },
    {
      "epoch": 3.5995119881179716,
      "grad_norm": 0.433555084187037,
      "learning_rate": 3.973710428934776e-05,
      "loss": 1.4607,
      "num_input_tokens_seen": 26694189168,
      "step": 33929
    },
    {
      "epoch": 3.599618077657543,
      "grad_norm": 0.5646318398340199,
      "learning_rate": 3.973654290179013e-05,
      "loss": 1.4164,
      "num_input_tokens_seen": 26694975984,
      "step": 33930
    },
    {
      "epoch": 3.5997241671971145,
      "grad_norm": 0.39393404889800515,
      "learning_rate": 3.973598150284453e-05,
      "loss": 1.4682,
      "num_input_tokens_seen": 26695762800,
      "step": 33931
    },
    {
      "epoch": 3.599830256736686,
      "grad_norm": 0.5300201180103954,
      "learning_rate": 3.97354200925114e-05,
      "loss": 1.4659,
      "num_input_tokens_seen": 26696549600,
      "step": 33932
    },
    {
      "epoch": 3.599936346276257,
      "grad_norm": 0.43463495093627047,
      "learning_rate": 3.973485867079117e-05,
      "loss": 1.4411,
      "num_input_tokens_seen": 26697336336,
      "step": 33933
    },
    {
      "epoch": 3.6000424358158285,
      "grad_norm": 0.46879463950172157,
      "learning_rate": 3.973429723768427e-05,
      "loss": 1.47,
      "num_input_tokens_seen": 26698123104,
      "step": 33934
    },
    {
      "epoch": 3.6001485253554,
      "grad_norm": 0.5669285227015485,
      "learning_rate": 3.973373579319113e-05,
      "loss": 1.4379,
      "num_input_tokens_seen": 26698909920,
      "step": 33935
    },
    {
      "epoch": 3.6002546148949714,
      "grad_norm": 0.41244107757090726,
      "learning_rate": 3.9733174337312206e-05,
      "loss": 1.4974,
      "num_input_tokens_seen": 26699696640,
      "step": 33936
    },
    {
      "epoch": 3.600360704434543,
      "grad_norm": 0.6254423710800278,
      "learning_rate": 3.9732612870047916e-05,
      "loss": 1.5144,
      "num_input_tokens_seen": 26700483392,
      "step": 33937
    },
    {
      "epoch": 3.600466793974114,
      "grad_norm": 0.4556713261112888,
      "learning_rate": 3.973205139139868e-05,
      "loss": 1.4701,
      "num_input_tokens_seen": 26701270112,
      "step": 33938
    },
    {
      "epoch": 3.6005728835136854,
      "grad_norm": 0.4481553439339952,
      "learning_rate": 3.973148990136496e-05,
      "loss": 1.5089,
      "num_input_tokens_seen": 26702056848,
      "step": 33939
    },
    {
      "epoch": 3.600678973053257,
      "grad_norm": 0.4260974287790221,
      "learning_rate": 3.973092839994718e-05,
      "loss": 1.333,
      "num_input_tokens_seen": 26702843616,
      "step": 33940
    },
    {
      "epoch": 3.6007850625928284,
      "grad_norm": 0.4738293907819176,
      "learning_rate": 3.973036688714575e-05,
      "loss": 1.5115,
      "num_input_tokens_seen": 26703630416,
      "step": 33941
    },
    {
      "epoch": 3.6008911521324,
      "grad_norm": 0.41040113557982894,
      "learning_rate": 3.972980536296115e-05,
      "loss": 1.4996,
      "num_input_tokens_seen": 26704417168,
      "step": 33942
    },
    {
      "epoch": 3.600997241671971,
      "grad_norm": 0.5156295192800956,
      "learning_rate": 3.972924382739377e-05,
      "loss": 1.4546,
      "num_input_tokens_seen": 26705203872,
      "step": 33943
    },
    {
      "epoch": 3.601103331211543,
      "grad_norm": 0.46633412783861056,
      "learning_rate": 3.972868228044407e-05,
      "loss": 1.4363,
      "num_input_tokens_seen": 26705990592,
      "step": 33944
    },
    {
      "epoch": 3.601209420751114,
      "grad_norm": 0.40367205357267655,
      "learning_rate": 3.972812072211248e-05,
      "loss": 1.5329,
      "num_input_tokens_seen": 26706777312,
      "step": 33945
    },
    {
      "epoch": 3.6013155102906853,
      "grad_norm": 0.400874138400239,
      "learning_rate": 3.9727559152399425e-05,
      "loss": 1.3722,
      "num_input_tokens_seen": 26707564208,
      "step": 33946
    },
    {
      "epoch": 3.601421599830257,
      "grad_norm": 0.39352738152767974,
      "learning_rate": 3.9726997571305345e-05,
      "loss": 1.4515,
      "num_input_tokens_seen": 26708350944,
      "step": 33947
    },
    {
      "epoch": 3.6015276893698283,
      "grad_norm": 0.41104316683734926,
      "learning_rate": 3.972643597883068e-05,
      "loss": 1.3472,
      "num_input_tokens_seen": 26709137712,
      "step": 33948
    },
    {
      "epoch": 3.6016337789093997,
      "grad_norm": 0.5021586402849945,
      "learning_rate": 3.972587437497585e-05,
      "loss": 1.6052,
      "num_input_tokens_seen": 26709924448,
      "step": 33949
    },
    {
      "epoch": 3.6017398684489708,
      "grad_norm": 0.43285410156543563,
      "learning_rate": 3.972531275974129e-05,
      "loss": 1.422,
      "num_input_tokens_seen": 26710711264,
      "step": 33950
    },
    {
      "epoch": 3.6018459579885422,
      "grad_norm": 0.4908882976087327,
      "learning_rate": 3.972475113312745e-05,
      "loss": 1.415,
      "num_input_tokens_seen": 26711497984,
      "step": 33951
    },
    {
      "epoch": 3.6019520475281137,
      "grad_norm": 0.5470699827033048,
      "learning_rate": 3.9724189495134754e-05,
      "loss": 1.5603,
      "num_input_tokens_seen": 26712284752,
      "step": 33952
    },
    {
      "epoch": 3.602058137067685,
      "grad_norm": 0.5214089552257958,
      "learning_rate": 3.972362784576363e-05,
      "loss": 1.4484,
      "num_input_tokens_seen": 26713071472,
      "step": 33953
    },
    {
      "epoch": 3.6021642266072567,
      "grad_norm": 0.4963542739402612,
      "learning_rate": 3.9723066185014526e-05,
      "loss": 1.4223,
      "num_input_tokens_seen": 26713858288,
      "step": 33954
    },
    {
      "epoch": 3.6022703161468277,
      "grad_norm": 0.5595740966206855,
      "learning_rate": 3.972250451288787e-05,
      "loss": 1.6337,
      "num_input_tokens_seen": 26714645008,
      "step": 33955
    },
    {
      "epoch": 3.602376405686399,
      "grad_norm": 0.4582903289342032,
      "learning_rate": 3.972194282938409e-05,
      "loss": 1.4796,
      "num_input_tokens_seen": 26715431712,
      "step": 33956
    },
    {
      "epoch": 3.6024824952259706,
      "grad_norm": 0.48744385320251904,
      "learning_rate": 3.9721381134503625e-05,
      "loss": 1.5035,
      "num_input_tokens_seen": 26716218432,
      "step": 33957
    },
    {
      "epoch": 3.602588584765542,
      "grad_norm": 0.47908369035247766,
      "learning_rate": 3.9720819428246915e-05,
      "loss": 1.4804,
      "num_input_tokens_seen": 26717005120,
      "step": 33958
    },
    {
      "epoch": 3.6026946743051136,
      "grad_norm": 0.5796136123090765,
      "learning_rate": 3.972025771061438e-05,
      "loss": 1.5213,
      "num_input_tokens_seen": 26717791904,
      "step": 33959
    },
    {
      "epoch": 3.602800763844685,
      "grad_norm": 0.44655788348217684,
      "learning_rate": 3.9719695981606464e-05,
      "loss": 1.3795,
      "num_input_tokens_seen": 26718578656,
      "step": 33960
    },
    {
      "epoch": 3.6029068533842565,
      "grad_norm": 0.4807965109756338,
      "learning_rate": 3.9719134241223596e-05,
      "loss": 1.3625,
      "num_input_tokens_seen": 26719365488,
      "step": 33961
    },
    {
      "epoch": 3.6030129429238276,
      "grad_norm": 0.4453256755242342,
      "learning_rate": 3.9718572489466215e-05,
      "loss": 1.5413,
      "num_input_tokens_seen": 26720152176,
      "step": 33962
    },
    {
      "epoch": 3.603119032463399,
      "grad_norm": 0.43506472752316827,
      "learning_rate": 3.971801072633475e-05,
      "loss": 1.5201,
      "num_input_tokens_seen": 26720938848,
      "step": 33963
    },
    {
      "epoch": 3.6032251220029705,
      "grad_norm": 0.40088461932094405,
      "learning_rate": 3.9717448951829644e-05,
      "loss": 1.3884,
      "num_input_tokens_seen": 26721725792,
      "step": 33964
    },
    {
      "epoch": 3.603331211542542,
      "grad_norm": 0.4421644755110001,
      "learning_rate": 3.971688716595132e-05,
      "loss": 1.4752,
      "num_input_tokens_seen": 26722512640,
      "step": 33965
    },
    {
      "epoch": 3.6034373010821135,
      "grad_norm": 0.4331464710204606,
      "learning_rate": 3.971632536870023e-05,
      "loss": 1.5044,
      "num_input_tokens_seen": 26723299456,
      "step": 33966
    },
    {
      "epoch": 3.6035433906216845,
      "grad_norm": 0.4197822154377062,
      "learning_rate": 3.971576356007678e-05,
      "loss": 1.4175,
      "num_input_tokens_seen": 26724086272,
      "step": 33967
    },
    {
      "epoch": 3.603649480161256,
      "grad_norm": 0.3987414592240916,
      "learning_rate": 3.971520174008143e-05,
      "loss": 1.4425,
      "num_input_tokens_seen": 26724873072,
      "step": 33968
    },
    {
      "epoch": 3.6037555697008274,
      "grad_norm": 0.46394742814245954,
      "learning_rate": 3.971463990871459e-05,
      "loss": 1.4941,
      "num_input_tokens_seen": 26725659888,
      "step": 33969
    },
    {
      "epoch": 3.603861659240399,
      "grad_norm": 0.451411591095045,
      "learning_rate": 3.9714078065976724e-05,
      "loss": 1.5448,
      "num_input_tokens_seen": 26726446576,
      "step": 33970
    },
    {
      "epoch": 3.6039677487799704,
      "grad_norm": 0.49304662523110726,
      "learning_rate": 3.971351621186824e-05,
      "loss": 1.4945,
      "num_input_tokens_seen": 26727233232,
      "step": 33971
    },
    {
      "epoch": 3.6040738383195414,
      "grad_norm": 0.4549865356608423,
      "learning_rate": 3.971295434638959e-05,
      "loss": 1.5407,
      "num_input_tokens_seen": 26728019920,
      "step": 33972
    },
    {
      "epoch": 3.6041799278591133,
      "grad_norm": 0.4967524769792621,
      "learning_rate": 3.9712392469541196e-05,
      "loss": 1.4892,
      "num_input_tokens_seen": 26728806752,
      "step": 33973
    },
    {
      "epoch": 3.6042860173986844,
      "grad_norm": 0.4644926978770554,
      "learning_rate": 3.971183058132349e-05,
      "loss": 1.4884,
      "num_input_tokens_seen": 26729593440,
      "step": 33974
    },
    {
      "epoch": 3.604392106938256,
      "grad_norm": 0.49919751556805336,
      "learning_rate": 3.971126868173693e-05,
      "loss": 1.4912,
      "num_input_tokens_seen": 26730380240,
      "step": 33975
    },
    {
      "epoch": 3.6044981964778273,
      "grad_norm": 0.4907652306265524,
      "learning_rate": 3.971070677078192e-05,
      "loss": 1.5109,
      "num_input_tokens_seen": 26731167040,
      "step": 33976
    },
    {
      "epoch": 3.604604286017399,
      "grad_norm": 0.40174013437964584,
      "learning_rate": 3.971014484845891e-05,
      "loss": 1.4393,
      "num_input_tokens_seen": 26731953952,
      "step": 33977
    },
    {
      "epoch": 3.6047103755569703,
      "grad_norm": 0.4580625616101629,
      "learning_rate": 3.970958291476833e-05,
      "loss": 1.4124,
      "num_input_tokens_seen": 26732740672,
      "step": 33978
    },
    {
      "epoch": 3.6048164650965413,
      "grad_norm": 0.45242600928347204,
      "learning_rate": 3.9709020969710616e-05,
      "loss": 1.564,
      "num_input_tokens_seen": 26733527456,
      "step": 33979
    },
    {
      "epoch": 3.6049225546361128,
      "grad_norm": 0.41644920464549867,
      "learning_rate": 3.970845901328621e-05,
      "loss": 1.4338,
      "num_input_tokens_seen": 26734314096,
      "step": 33980
    },
    {
      "epoch": 3.6050286441756842,
      "grad_norm": 0.424140738512609,
      "learning_rate": 3.9707897045495534e-05,
      "loss": 1.3473,
      "num_input_tokens_seen": 26735100912,
      "step": 33981
    },
    {
      "epoch": 3.6051347337152557,
      "grad_norm": 0.48555539505847495,
      "learning_rate": 3.9707335066339025e-05,
      "loss": 1.4664,
      "num_input_tokens_seen": 26735887648,
      "step": 33982
    },
    {
      "epoch": 3.605240823254827,
      "grad_norm": 0.4442396055408978,
      "learning_rate": 3.9706773075817116e-05,
      "loss": 1.5302,
      "num_input_tokens_seen": 26736674464,
      "step": 33983
    },
    {
      "epoch": 3.6053469127943982,
      "grad_norm": 0.5039645393414899,
      "learning_rate": 3.970621107393025e-05,
      "loss": 1.4971,
      "num_input_tokens_seen": 26737461168,
      "step": 33984
    },
    {
      "epoch": 3.60545300233397,
      "grad_norm": 0.4635187249539705,
      "learning_rate": 3.9705649060678854e-05,
      "loss": 1.5066,
      "num_input_tokens_seen": 26738247824,
      "step": 33985
    },
    {
      "epoch": 3.605559091873541,
      "grad_norm": 0.4777249173956537,
      "learning_rate": 3.970508703606337e-05,
      "loss": 1.379,
      "num_input_tokens_seen": 26739034576,
      "step": 33986
    },
    {
      "epoch": 3.6056651814131127,
      "grad_norm": 0.48533782304611445,
      "learning_rate": 3.9704525000084216e-05,
      "loss": 1.5552,
      "num_input_tokens_seen": 26739821296,
      "step": 33987
    },
    {
      "epoch": 3.605771270952684,
      "grad_norm": 0.48800973584219515,
      "learning_rate": 3.970396295274183e-05,
      "loss": 1.4659,
      "num_input_tokens_seen": 26740608064,
      "step": 33988
    },
    {
      "epoch": 3.6058773604922556,
      "grad_norm": 0.40550730227054543,
      "learning_rate": 3.970340089403667e-05,
      "loss": 1.4891,
      "num_input_tokens_seen": 26741394880,
      "step": 33989
    },
    {
      "epoch": 3.605983450031827,
      "grad_norm": 0.49095446684919186,
      "learning_rate": 3.970283882396915e-05,
      "loss": 1.4561,
      "num_input_tokens_seen": 26742181600,
      "step": 33990
    },
    {
      "epoch": 3.606089539571398,
      "grad_norm": 0.46344076150509006,
      "learning_rate": 3.97022767425397e-05,
      "loss": 1.5739,
      "num_input_tokens_seen": 26742968336,
      "step": 33991
    },
    {
      "epoch": 3.6061956291109696,
      "grad_norm": 0.4112381219689617,
      "learning_rate": 3.970171464974877e-05,
      "loss": 1.3875,
      "num_input_tokens_seen": 26743755056,
      "step": 33992
    },
    {
      "epoch": 3.606301718650541,
      "grad_norm": 0.43417785311702056,
      "learning_rate": 3.970115254559678e-05,
      "loss": 1.5169,
      "num_input_tokens_seen": 26744541744,
      "step": 33993
    },
    {
      "epoch": 3.6064078081901125,
      "grad_norm": 0.395682060363914,
      "learning_rate": 3.9700590430084174e-05,
      "loss": 1.3488,
      "num_input_tokens_seen": 26745328496,
      "step": 33994
    },
    {
      "epoch": 3.606513897729684,
      "grad_norm": 0.494480581528576,
      "learning_rate": 3.970002830321138e-05,
      "loss": 1.4969,
      "num_input_tokens_seen": 26746115280,
      "step": 33995
    },
    {
      "epoch": 3.606619987269255,
      "grad_norm": 0.43773229616896475,
      "learning_rate": 3.969946616497884e-05,
      "loss": 1.5049,
      "num_input_tokens_seen": 26746902032,
      "step": 33996
    },
    {
      "epoch": 3.6067260768088265,
      "grad_norm": 0.525727470546999,
      "learning_rate": 3.9698904015386975e-05,
      "loss": 1.5805,
      "num_input_tokens_seen": 26747688736,
      "step": 33997
    },
    {
      "epoch": 3.606832166348398,
      "grad_norm": 0.4217750588530196,
      "learning_rate": 3.969834185443624e-05,
      "loss": 1.5596,
      "num_input_tokens_seen": 26748475392,
      "step": 33998
    },
    {
      "epoch": 3.6069382558879695,
      "grad_norm": 0.4918875763694512,
      "learning_rate": 3.9697779682127044e-05,
      "loss": 1.5251,
      "num_input_tokens_seen": 26749262128,
      "step": 33999
    },
    {
      "epoch": 3.607044345427541,
      "grad_norm": 0.42660310953873165,
      "learning_rate": 3.969721749845985e-05,
      "loss": 1.477,
      "num_input_tokens_seen": 26750048896,
      "step": 34000
    },
    {
      "epoch": 3.607044345427541,
      "eval_loss": 1.6025934219360352,
      "eval_runtime": 64.6172,
      "eval_samples_per_second": 46.427,
      "eval_steps_per_second": 0.495,
      "num_input_tokens_seen": 26750048896,
      "step": 34000
    },
    {
      "epoch": 3.6071504349671124,
      "grad_norm": 0.4090069494574699,
      "learning_rate": 3.969665530343507e-05,
      "loss": 1.3358,
      "num_input_tokens_seen": 26750835632,
      "step": 34001
    },
    {
      "epoch": 3.607256524506684,
      "grad_norm": 0.42276442232772204,
      "learning_rate": 3.9696093097053145e-05,
      "loss": 1.4278,
      "num_input_tokens_seen": 26751622432,
      "step": 34002
    },
    {
      "epoch": 3.607362614046255,
      "grad_norm": 0.48290615856120245,
      "learning_rate": 3.969553087931451e-05,
      "loss": 1.5095,
      "num_input_tokens_seen": 26752409248,
      "step": 34003
    },
    {
      "epoch": 3.6074687035858264,
      "grad_norm": 0.4544095072644429,
      "learning_rate": 3.969496865021961e-05,
      "loss": 1.48,
      "num_input_tokens_seen": 26753196000,
      "step": 34004
    },
    {
      "epoch": 3.607574793125398,
      "grad_norm": 0.5087444718099072,
      "learning_rate": 3.969440640976886e-05,
      "loss": 1.3959,
      "num_input_tokens_seen": 26753982720,
      "step": 34005
    },
    {
      "epoch": 3.6076808826649693,
      "grad_norm": 0.4692087335025501,
      "learning_rate": 3.96938441579627e-05,
      "loss": 1.3548,
      "num_input_tokens_seen": 26754769520,
      "step": 34006
    },
    {
      "epoch": 3.607786972204541,
      "grad_norm": 0.4296043505571582,
      "learning_rate": 3.9693281894801577e-05,
      "loss": 1.4452,
      "num_input_tokens_seen": 26755556256,
      "step": 34007
    },
    {
      "epoch": 3.607893061744112,
      "grad_norm": 0.5525394789696143,
      "learning_rate": 3.969271962028591e-05,
      "loss": 1.4071,
      "num_input_tokens_seen": 26756343040,
      "step": 34008
    },
    {
      "epoch": 3.6079991512836833,
      "grad_norm": 0.49579532719887753,
      "learning_rate": 3.9692157334416144e-05,
      "loss": 1.4265,
      "num_input_tokens_seen": 26757129808,
      "step": 34009
    },
    {
      "epoch": 3.608105240823255,
      "grad_norm": 0.6133631607598398,
      "learning_rate": 3.969159503719271e-05,
      "loss": 1.5238,
      "num_input_tokens_seen": 26757916608,
      "step": 34010
    },
    {
      "epoch": 3.6082113303628263,
      "grad_norm": 0.4960653879022622,
      "learning_rate": 3.969103272861605e-05,
      "loss": 1.5993,
      "num_input_tokens_seen": 26758703328,
      "step": 34011
    },
    {
      "epoch": 3.6083174199023977,
      "grad_norm": 0.4174562384747911,
      "learning_rate": 3.969047040868658e-05,
      "loss": 1.4668,
      "num_input_tokens_seen": 26759490064,
      "step": 34012
    },
    {
      "epoch": 3.6084235094419688,
      "grad_norm": 0.48356922156541776,
      "learning_rate": 3.968990807740475e-05,
      "loss": 1.5552,
      "num_input_tokens_seen": 26760276768,
      "step": 34013
    },
    {
      "epoch": 3.6085295989815407,
      "grad_norm": 0.4592080238065322,
      "learning_rate": 3.968934573477099e-05,
      "loss": 1.4793,
      "num_input_tokens_seen": 26761063568,
      "step": 34014
    },
    {
      "epoch": 3.6086356885211117,
      "grad_norm": 0.4621457508843479,
      "learning_rate": 3.9688783380785734e-05,
      "loss": 1.4988,
      "num_input_tokens_seen": 26761850256,
      "step": 34015
    },
    {
      "epoch": 3.608741778060683,
      "grad_norm": 0.46475692219013837,
      "learning_rate": 3.9688221015449415e-05,
      "loss": 1.5363,
      "num_input_tokens_seen": 26762637136,
      "step": 34016
    },
    {
      "epoch": 3.6088478676002547,
      "grad_norm": 0.44593537709208475,
      "learning_rate": 3.968765863876247e-05,
      "loss": 1.3089,
      "num_input_tokens_seen": 26763424000,
      "step": 34017
    },
    {
      "epoch": 3.608953957139826,
      "grad_norm": 0.45105476305480924,
      "learning_rate": 3.968709625072534e-05,
      "loss": 1.5822,
      "num_input_tokens_seen": 26764210784,
      "step": 34018
    },
    {
      "epoch": 3.6090600466793976,
      "grad_norm": 0.4503799620325424,
      "learning_rate": 3.968653385133845e-05,
      "loss": 1.4922,
      "num_input_tokens_seen": 26764997536,
      "step": 34019
    },
    {
      "epoch": 3.6091661362189686,
      "grad_norm": 0.42204138713319156,
      "learning_rate": 3.968597144060223e-05,
      "loss": 1.2949,
      "num_input_tokens_seen": 26765784368,
      "step": 34020
    },
    {
      "epoch": 3.60927222575854,
      "grad_norm": 0.43071940857991226,
      "learning_rate": 3.9685409018517125e-05,
      "loss": 1.4813,
      "num_input_tokens_seen": 26766571088,
      "step": 34021
    },
    {
      "epoch": 3.6093783152981116,
      "grad_norm": 0.4313475364060998,
      "learning_rate": 3.968484658508357e-05,
      "loss": 1.5143,
      "num_input_tokens_seen": 26767357808,
      "step": 34022
    },
    {
      "epoch": 3.609484404837683,
      "grad_norm": 0.46683269757767587,
      "learning_rate": 3.9684284140302e-05,
      "loss": 1.5776,
      "num_input_tokens_seen": 26768144448,
      "step": 34023
    },
    {
      "epoch": 3.6095904943772545,
      "grad_norm": 0.41072274399046776,
      "learning_rate": 3.968372168417284e-05,
      "loss": 1.5058,
      "num_input_tokens_seen": 26768931264,
      "step": 34024
    },
    {
      "epoch": 3.6096965839168256,
      "grad_norm": 0.435671612255152,
      "learning_rate": 3.9683159216696535e-05,
      "loss": 1.4017,
      "num_input_tokens_seen": 26769718016,
      "step": 34025
    },
    {
      "epoch": 3.609802673456397,
      "grad_norm": 0.5047735617461646,
      "learning_rate": 3.9682596737873515e-05,
      "loss": 1.4153,
      "num_input_tokens_seen": 26770504720,
      "step": 34026
    },
    {
      "epoch": 3.6099087629959685,
      "grad_norm": 0.5095282948116754,
      "learning_rate": 3.968203424770421e-05,
      "loss": 1.4158,
      "num_input_tokens_seen": 26771291504,
      "step": 34027
    },
    {
      "epoch": 3.61001485253554,
      "grad_norm": 0.47197585294178557,
      "learning_rate": 3.968147174618907e-05,
      "loss": 1.5027,
      "num_input_tokens_seen": 26772078320,
      "step": 34028
    },
    {
      "epoch": 3.6101209420751115,
      "grad_norm": 0.4444774935861254,
      "learning_rate": 3.968090923332851e-05,
      "loss": 1.4007,
      "num_input_tokens_seen": 26772865120,
      "step": 34029
    },
    {
      "epoch": 3.610227031614683,
      "grad_norm": 0.4789542955937873,
      "learning_rate": 3.968034670912297e-05,
      "loss": 1.5584,
      "num_input_tokens_seen": 26773651984,
      "step": 34030
    },
    {
      "epoch": 3.6103331211542544,
      "grad_norm": 0.4170129136601625,
      "learning_rate": 3.9679784173572896e-05,
      "loss": 1.3463,
      "num_input_tokens_seen": 26774438704,
      "step": 34031
    },
    {
      "epoch": 3.6104392106938255,
      "grad_norm": 0.5703172857043515,
      "learning_rate": 3.967922162667872e-05,
      "loss": 1.4795,
      "num_input_tokens_seen": 26775225536,
      "step": 34032
    },
    {
      "epoch": 3.610545300233397,
      "grad_norm": 0.47958917850788635,
      "learning_rate": 3.967865906844086e-05,
      "loss": 1.608,
      "num_input_tokens_seen": 26776012304,
      "step": 34033
    },
    {
      "epoch": 3.6106513897729684,
      "grad_norm": 0.5612722774432202,
      "learning_rate": 3.9678096498859774e-05,
      "loss": 1.409,
      "num_input_tokens_seen": 26776799152,
      "step": 34034
    },
    {
      "epoch": 3.61075747931254,
      "grad_norm": 0.41657813173879704,
      "learning_rate": 3.9677533917935884e-05,
      "loss": 1.3489,
      "num_input_tokens_seen": 26777585952,
      "step": 34035
    },
    {
      "epoch": 3.6108635688521113,
      "grad_norm": 0.47454287599434597,
      "learning_rate": 3.967697132566962e-05,
      "loss": 1.4932,
      "num_input_tokens_seen": 26778372752,
      "step": 34036
    },
    {
      "epoch": 3.6109696583916824,
      "grad_norm": 0.49122412643425223,
      "learning_rate": 3.967640872206143e-05,
      "loss": 1.5149,
      "num_input_tokens_seen": 26779159456,
      "step": 34037
    },
    {
      "epoch": 3.611075747931254,
      "grad_norm": 0.42448858392896144,
      "learning_rate": 3.967584610711174e-05,
      "loss": 1.3598,
      "num_input_tokens_seen": 26779946240,
      "step": 34038
    },
    {
      "epoch": 3.6111818374708253,
      "grad_norm": 0.629387395392581,
      "learning_rate": 3.967528348082098e-05,
      "loss": 1.7325,
      "num_input_tokens_seen": 26780732880,
      "step": 34039
    },
    {
      "epoch": 3.611287927010397,
      "grad_norm": 0.5570157741858802,
      "learning_rate": 3.96747208431896e-05,
      "loss": 1.4469,
      "num_input_tokens_seen": 26781519632,
      "step": 34040
    },
    {
      "epoch": 3.6113940165499683,
      "grad_norm": 0.513112518368547,
      "learning_rate": 3.9674158194218026e-05,
      "loss": 1.4121,
      "num_input_tokens_seen": 26782306352,
      "step": 34041
    },
    {
      "epoch": 3.6115001060895393,
      "grad_norm": 0.4293602033914617,
      "learning_rate": 3.967359553390669e-05,
      "loss": 1.4088,
      "num_input_tokens_seen": 26783093136,
      "step": 34042
    },
    {
      "epoch": 3.6116061956291112,
      "grad_norm": 0.6579473426638016,
      "learning_rate": 3.967303286225603e-05,
      "loss": 1.4912,
      "num_input_tokens_seen": 26783880000,
      "step": 34043
    },
    {
      "epoch": 3.6117122851686823,
      "grad_norm": 0.4792992246055378,
      "learning_rate": 3.967247017926649e-05,
      "loss": 1.5595,
      "num_input_tokens_seen": 26784666672,
      "step": 34044
    },
    {
      "epoch": 3.6118183747082537,
      "grad_norm": 0.630277699793266,
      "learning_rate": 3.967190748493848e-05,
      "loss": 1.4313,
      "num_input_tokens_seen": 26785453472,
      "step": 34045
    },
    {
      "epoch": 3.611924464247825,
      "grad_norm": 0.574538569101571,
      "learning_rate": 3.9671344779272454e-05,
      "loss": 1.5159,
      "num_input_tokens_seen": 26786240224,
      "step": 34046
    },
    {
      "epoch": 3.6120305537873967,
      "grad_norm": 0.562364839557853,
      "learning_rate": 3.967078206226885e-05,
      "loss": 1.4341,
      "num_input_tokens_seen": 26787027072,
      "step": 34047
    },
    {
      "epoch": 3.612136643326968,
      "grad_norm": 0.6033070353126468,
      "learning_rate": 3.967021933392809e-05,
      "loss": 1.4672,
      "num_input_tokens_seen": 26787813824,
      "step": 34048
    },
    {
      "epoch": 3.612242732866539,
      "grad_norm": 0.4714600946466597,
      "learning_rate": 3.9669656594250625e-05,
      "loss": 1.4336,
      "num_input_tokens_seen": 26788600576,
      "step": 34049
    },
    {
      "epoch": 3.6123488224061107,
      "grad_norm": 0.8896362219947276,
      "learning_rate": 3.966909384323687e-05,
      "loss": 1.4866,
      "num_input_tokens_seen": 26789387360,
      "step": 34050
    },
    {
      "epoch": 3.612454911945682,
      "grad_norm": 0.4425400073438423,
      "learning_rate": 3.9668531080887275e-05,
      "loss": 1.5141,
      "num_input_tokens_seen": 26790174064,
      "step": 34051
    },
    {
      "epoch": 3.6125610014852536,
      "grad_norm": 0.63588828980834,
      "learning_rate": 3.966796830720226e-05,
      "loss": 1.4197,
      "num_input_tokens_seen": 26790960880,
      "step": 34052
    },
    {
      "epoch": 3.612667091024825,
      "grad_norm": 0.4557715047715077,
      "learning_rate": 3.9667405522182286e-05,
      "loss": 1.4363,
      "num_input_tokens_seen": 26791747664,
      "step": 34053
    },
    {
      "epoch": 3.612773180564396,
      "grad_norm": 0.4598676925383596,
      "learning_rate": 3.9666842725827756e-05,
      "loss": 1.4526,
      "num_input_tokens_seen": 26792534336,
      "step": 34054
    },
    {
      "epoch": 3.6128792701039676,
      "grad_norm": 0.6097302006384302,
      "learning_rate": 3.9666279918139126e-05,
      "loss": 1.4564,
      "num_input_tokens_seen": 26793321152,
      "step": 34055
    },
    {
      "epoch": 3.612985359643539,
      "grad_norm": 0.42509760991254414,
      "learning_rate": 3.966571709911683e-05,
      "loss": 1.5279,
      "num_input_tokens_seen": 26794107968,
      "step": 34056
    },
    {
      "epoch": 3.6130914491831105,
      "grad_norm": 0.42341202799089084,
      "learning_rate": 3.966515426876129e-05,
      "loss": 1.4218,
      "num_input_tokens_seen": 26794894704,
      "step": 34057
    },
    {
      "epoch": 3.613197538722682,
      "grad_norm": 0.5554869435201235,
      "learning_rate": 3.966459142707296e-05,
      "loss": 1.5591,
      "num_input_tokens_seen": 26795681520,
      "step": 34058
    },
    {
      "epoch": 3.6133036282622535,
      "grad_norm": 0.4128182161706151,
      "learning_rate": 3.966402857405225e-05,
      "loss": 1.4131,
      "num_input_tokens_seen": 26796468320,
      "step": 34059
    },
    {
      "epoch": 3.613409717801825,
      "grad_norm": 0.4856699789193857,
      "learning_rate": 3.9663465709699614e-05,
      "loss": 1.4752,
      "num_input_tokens_seen": 26797255104,
      "step": 34060
    },
    {
      "epoch": 3.613515807341396,
      "grad_norm": 0.3952225683607172,
      "learning_rate": 3.966290283401549e-05,
      "loss": 1.4451,
      "num_input_tokens_seen": 26798041792,
      "step": 34061
    },
    {
      "epoch": 3.6136218968809675,
      "grad_norm": 0.4787754678286231,
      "learning_rate": 3.966233994700029e-05,
      "loss": 1.4729,
      "num_input_tokens_seen": 26798828544,
      "step": 34062
    },
    {
      "epoch": 3.613727986420539,
      "grad_norm": 0.4337781617382052,
      "learning_rate": 3.966177704865448e-05,
      "loss": 1.4599,
      "num_input_tokens_seen": 26799615248,
      "step": 34063
    },
    {
      "epoch": 3.6138340759601104,
      "grad_norm": 0.5236824945852704,
      "learning_rate": 3.9661214138978466e-05,
      "loss": 1.4388,
      "num_input_tokens_seen": 26800401984,
      "step": 34064
    },
    {
      "epoch": 3.613940165499682,
      "grad_norm": 0.39158676174085477,
      "learning_rate": 3.9660651217972705e-05,
      "loss": 1.4034,
      "num_input_tokens_seen": 26801188848,
      "step": 34065
    },
    {
      "epoch": 3.614046255039253,
      "grad_norm": 0.5110469543394085,
      "learning_rate": 3.966008828563762e-05,
      "loss": 1.5134,
      "num_input_tokens_seen": 26801975664,
      "step": 34066
    },
    {
      "epoch": 3.6141523445788244,
      "grad_norm": 0.42238850958037844,
      "learning_rate": 3.9659525341973646e-05,
      "loss": 1.3785,
      "num_input_tokens_seen": 26802762400,
      "step": 34067
    },
    {
      "epoch": 3.614258434118396,
      "grad_norm": 0.395844604404419,
      "learning_rate": 3.965896238698122e-05,
      "loss": 1.4173,
      "num_input_tokens_seen": 26803549200,
      "step": 34068
    },
    {
      "epoch": 3.6143645236579673,
      "grad_norm": 0.46435707256921777,
      "learning_rate": 3.9658399420660784e-05,
      "loss": 1.5039,
      "num_input_tokens_seen": 26804335952,
      "step": 34069
    },
    {
      "epoch": 3.614470613197539,
      "grad_norm": 0.5144092519363813,
      "learning_rate": 3.965783644301276e-05,
      "loss": 1.4612,
      "num_input_tokens_seen": 26805122624,
      "step": 34070
    },
    {
      "epoch": 3.61457670273711,
      "grad_norm": 0.45904036730769565,
      "learning_rate": 3.96572734540376e-05,
      "loss": 1.4342,
      "num_input_tokens_seen": 26805909376,
      "step": 34071
    },
    {
      "epoch": 3.6146827922766818,
      "grad_norm": 0.4305726735216243,
      "learning_rate": 3.9656710453735726e-05,
      "loss": 1.4313,
      "num_input_tokens_seen": 26806696144,
      "step": 34072
    },
    {
      "epoch": 3.614788881816253,
      "grad_norm": 0.41974665186709864,
      "learning_rate": 3.965614744210757e-05,
      "loss": 1.5249,
      "num_input_tokens_seen": 26807482784,
      "step": 34073
    },
    {
      "epoch": 3.6148949713558243,
      "grad_norm": 0.5044190174057445,
      "learning_rate": 3.965558441915358e-05,
      "loss": 1.3324,
      "num_input_tokens_seen": 26808269584,
      "step": 34074
    },
    {
      "epoch": 3.6150010608953957,
      "grad_norm": 0.4442330747300774,
      "learning_rate": 3.965502138487418e-05,
      "loss": 1.5895,
      "num_input_tokens_seen": 26809056416,
      "step": 34075
    },
    {
      "epoch": 3.615107150434967,
      "grad_norm": 0.4525629082388596,
      "learning_rate": 3.965445833926981e-05,
      "loss": 1.4589,
      "num_input_tokens_seen": 26809843216,
      "step": 34076
    },
    {
      "epoch": 3.6152132399745387,
      "grad_norm": 0.6280299291930447,
      "learning_rate": 3.9653895282340906e-05,
      "loss": 1.5147,
      "num_input_tokens_seen": 26810629984,
      "step": 34077
    },
    {
      "epoch": 3.6153193295141097,
      "grad_norm": 0.41241545449377254,
      "learning_rate": 3.96533322140879e-05,
      "loss": 1.4865,
      "num_input_tokens_seen": 26811416768,
      "step": 34078
    },
    {
      "epoch": 3.615425419053681,
      "grad_norm": 0.4949631862397204,
      "learning_rate": 3.9652769134511234e-05,
      "loss": 1.5244,
      "num_input_tokens_seen": 26812203488,
      "step": 34079
    },
    {
      "epoch": 3.6155315085932527,
      "grad_norm": 0.4505772119401742,
      "learning_rate": 3.965220604361133e-05,
      "loss": 1.4467,
      "num_input_tokens_seen": 26812990240,
      "step": 34080
    },
    {
      "epoch": 3.615637598132824,
      "grad_norm": 0.43709066990691103,
      "learning_rate": 3.9651642941388636e-05,
      "loss": 1.4952,
      "num_input_tokens_seen": 26813776880,
      "step": 34081
    },
    {
      "epoch": 3.6157436876723956,
      "grad_norm": 0.47415614668306555,
      "learning_rate": 3.965107982784358e-05,
      "loss": 1.4222,
      "num_input_tokens_seen": 26814563696,
      "step": 34082
    },
    {
      "epoch": 3.6158497772119667,
      "grad_norm": 0.4571853397203879,
      "learning_rate": 3.9650516702976603e-05,
      "loss": 1.6924,
      "num_input_tokens_seen": 26815350448,
      "step": 34083
    },
    {
      "epoch": 3.6159558667515386,
      "grad_norm": 0.42868932006794275,
      "learning_rate": 3.964995356678813e-05,
      "loss": 1.4709,
      "num_input_tokens_seen": 26816137200,
      "step": 34084
    },
    {
      "epoch": 3.6160619562911096,
      "grad_norm": 0.3928936744691308,
      "learning_rate": 3.964939041927861e-05,
      "loss": 1.4062,
      "num_input_tokens_seen": 26816923984,
      "step": 34085
    },
    {
      "epoch": 3.616168045830681,
      "grad_norm": 0.4777992977594237,
      "learning_rate": 3.964882726044846e-05,
      "loss": 1.3698,
      "num_input_tokens_seen": 26817710736,
      "step": 34086
    },
    {
      "epoch": 3.6162741353702526,
      "grad_norm": 0.4373705325749533,
      "learning_rate": 3.9648264090298136e-05,
      "loss": 1.4396,
      "num_input_tokens_seen": 26818497408,
      "step": 34087
    },
    {
      "epoch": 3.616380224909824,
      "grad_norm": 0.4437578343580345,
      "learning_rate": 3.964770090882806e-05,
      "loss": 1.3678,
      "num_input_tokens_seen": 26819284192,
      "step": 34088
    },
    {
      "epoch": 3.6164863144493955,
      "grad_norm": 0.39033639625940797,
      "learning_rate": 3.9647137716038675e-05,
      "loss": 1.4088,
      "num_input_tokens_seen": 26820070880,
      "step": 34089
    },
    {
      "epoch": 3.6165924039889665,
      "grad_norm": 0.6182797217037638,
      "learning_rate": 3.9646574511930406e-05,
      "loss": 1.4672,
      "num_input_tokens_seen": 26820857584,
      "step": 34090
    },
    {
      "epoch": 3.616698493528538,
      "grad_norm": 0.46630178064084205,
      "learning_rate": 3.9646011296503696e-05,
      "loss": 1.4983,
      "num_input_tokens_seen": 26821644320,
      "step": 34091
    },
    {
      "epoch": 3.6168045830681095,
      "grad_norm": 0.44998949249743236,
      "learning_rate": 3.964544806975898e-05,
      "loss": 1.4131,
      "num_input_tokens_seen": 26822431136,
      "step": 34092
    },
    {
      "epoch": 3.616910672607681,
      "grad_norm": 0.4151045501195623,
      "learning_rate": 3.964488483169669e-05,
      "loss": 1.3937,
      "num_input_tokens_seen": 26823217856,
      "step": 34093
    },
    {
      "epoch": 3.6170167621472524,
      "grad_norm": 0.4301050921519263,
      "learning_rate": 3.964432158231726e-05,
      "loss": 1.3954,
      "num_input_tokens_seen": 26824004656,
      "step": 34094
    },
    {
      "epoch": 3.6171228516868235,
      "grad_norm": 0.4305954555478021,
      "learning_rate": 3.9643758321621134e-05,
      "loss": 1.4735,
      "num_input_tokens_seen": 26824791376,
      "step": 34095
    },
    {
      "epoch": 3.617228941226395,
      "grad_norm": 0.42657465873008205,
      "learning_rate": 3.964319504960874e-05,
      "loss": 1.3839,
      "num_input_tokens_seen": 26825578128,
      "step": 34096
    },
    {
      "epoch": 3.6173350307659664,
      "grad_norm": 0.4690803530573838,
      "learning_rate": 3.9642631766280516e-05,
      "loss": 1.4264,
      "num_input_tokens_seen": 26826364944,
      "step": 34097
    },
    {
      "epoch": 3.617441120305538,
      "grad_norm": 0.42251491399157054,
      "learning_rate": 3.9642068471636887e-05,
      "loss": 1.3698,
      "num_input_tokens_seen": 26827151792,
      "step": 34098
    },
    {
      "epoch": 3.6175472098451094,
      "grad_norm": 0.39940689942509067,
      "learning_rate": 3.96415051656783e-05,
      "loss": 1.4919,
      "num_input_tokens_seen": 26827938576,
      "step": 34099
    },
    {
      "epoch": 3.617653299384681,
      "grad_norm": 0.5023882810353834,
      "learning_rate": 3.964094184840519e-05,
      "loss": 1.6729,
      "num_input_tokens_seen": 26828725328,
      "step": 34100
    },
    {
      "epoch": 3.6177593889242523,
      "grad_norm": 0.36897663812497733,
      "learning_rate": 3.964037851981799e-05,
      "loss": 1.4229,
      "num_input_tokens_seen": 26829512048,
      "step": 34101
    },
    {
      "epoch": 3.6178654784638233,
      "grad_norm": 0.47883641391835147,
      "learning_rate": 3.963981517991713e-05,
      "loss": 1.5206,
      "num_input_tokens_seen": 26830298720,
      "step": 34102
    },
    {
      "epoch": 3.617971568003395,
      "grad_norm": 0.43595078619273336,
      "learning_rate": 3.9639251828703064e-05,
      "loss": 1.4695,
      "num_input_tokens_seen": 26831085552,
      "step": 34103
    },
    {
      "epoch": 3.6180776575429663,
      "grad_norm": 0.5481505830628575,
      "learning_rate": 3.96386884661762e-05,
      "loss": 1.4963,
      "num_input_tokens_seen": 26831872288,
      "step": 34104
    },
    {
      "epoch": 3.6181837470825378,
      "grad_norm": 0.4695673898480593,
      "learning_rate": 3.963812509233699e-05,
      "loss": 1.3652,
      "num_input_tokens_seen": 26832659024,
      "step": 34105
    },
    {
      "epoch": 3.6182898366221092,
      "grad_norm": 0.43784577698784144,
      "learning_rate": 3.963756170718587e-05,
      "loss": 1.4013,
      "num_input_tokens_seen": 26833445760,
      "step": 34106
    },
    {
      "epoch": 3.6183959261616803,
      "grad_norm": 0.47448800658723617,
      "learning_rate": 3.963699831072327e-05,
      "loss": 1.3802,
      "num_input_tokens_seen": 26834232544,
      "step": 34107
    },
    {
      "epoch": 3.6185020157012517,
      "grad_norm": 0.40840597110649784,
      "learning_rate": 3.963643490294963e-05,
      "loss": 1.4169,
      "num_input_tokens_seen": 26835019312,
      "step": 34108
    },
    {
      "epoch": 3.618608105240823,
      "grad_norm": 0.4599574120953678,
      "learning_rate": 3.963587148386538e-05,
      "loss": 1.4743,
      "num_input_tokens_seen": 26835806192,
      "step": 34109
    },
    {
      "epoch": 3.6187141947803947,
      "grad_norm": 0.5280201821193521,
      "learning_rate": 3.963530805347095e-05,
      "loss": 1.3562,
      "num_input_tokens_seen": 26836592960,
      "step": 34110
    },
    {
      "epoch": 3.618820284319966,
      "grad_norm": 0.4446247704135785,
      "learning_rate": 3.96347446117668e-05,
      "loss": 1.4704,
      "num_input_tokens_seen": 26837379728,
      "step": 34111
    },
    {
      "epoch": 3.618926373859537,
      "grad_norm": 0.4925532220741901,
      "learning_rate": 3.9634181158753336e-05,
      "loss": 1.4719,
      "num_input_tokens_seen": 26838166512,
      "step": 34112
    },
    {
      "epoch": 3.619032463399109,
      "grad_norm": 0.48090882464518253,
      "learning_rate": 3.9633617694431016e-05,
      "loss": 1.3868,
      "num_input_tokens_seen": 26838953232,
      "step": 34113
    },
    {
      "epoch": 3.61913855293868,
      "grad_norm": 0.4735216031027975,
      "learning_rate": 3.963305421880026e-05,
      "loss": 1.4042,
      "num_input_tokens_seen": 26839739952,
      "step": 34114
    },
    {
      "epoch": 3.6192446424782516,
      "grad_norm": 0.6244348772673937,
      "learning_rate": 3.963249073186151e-05,
      "loss": 1.5025,
      "num_input_tokens_seen": 26840526720,
      "step": 34115
    },
    {
      "epoch": 3.619350732017823,
      "grad_norm": 0.5168621056096903,
      "learning_rate": 3.963192723361519e-05,
      "loss": 1.4784,
      "num_input_tokens_seen": 26841313536,
      "step": 34116
    },
    {
      "epoch": 3.6194568215573946,
      "grad_norm": 0.4397836590145361,
      "learning_rate": 3.9631363724061754e-05,
      "loss": 1.4429,
      "num_input_tokens_seen": 26842100288,
      "step": 34117
    },
    {
      "epoch": 3.619562911096966,
      "grad_norm": 0.44999691897579996,
      "learning_rate": 3.963080020320163e-05,
      "loss": 1.4023,
      "num_input_tokens_seen": 26842887072,
      "step": 34118
    },
    {
      "epoch": 3.619669000636537,
      "grad_norm": 0.42987251490865425,
      "learning_rate": 3.963023667103526e-05,
      "loss": 1.493,
      "num_input_tokens_seen": 26843673888,
      "step": 34119
    },
    {
      "epoch": 3.6197750901761085,
      "grad_norm": 0.5056238800245006,
      "learning_rate": 3.962967312756306e-05,
      "loss": 1.4645,
      "num_input_tokens_seen": 26844460720,
      "step": 34120
    },
    {
      "epoch": 3.61988117971568,
      "grad_norm": 0.3796558841148826,
      "learning_rate": 3.9629109572785486e-05,
      "loss": 1.385,
      "num_input_tokens_seen": 26845247616,
      "step": 34121
    },
    {
      "epoch": 3.6199872692552515,
      "grad_norm": 0.4907910730224331,
      "learning_rate": 3.9628546006702966e-05,
      "loss": 1.5204,
      "num_input_tokens_seen": 26846034288,
      "step": 34122
    },
    {
      "epoch": 3.620093358794823,
      "grad_norm": 0.4359038127653144,
      "learning_rate": 3.962798242931594e-05,
      "loss": 1.4903,
      "num_input_tokens_seen": 26846820976,
      "step": 34123
    },
    {
      "epoch": 3.620199448334394,
      "grad_norm": 0.4549173449739702,
      "learning_rate": 3.962741884062482e-05,
      "loss": 1.4156,
      "num_input_tokens_seen": 26847607712,
      "step": 34124
    },
    {
      "epoch": 3.6203055378739655,
      "grad_norm": 0.5148767159069513,
      "learning_rate": 3.9626855240630075e-05,
      "loss": 1.392,
      "num_input_tokens_seen": 26848394464,
      "step": 34125
    },
    {
      "epoch": 3.620411627413537,
      "grad_norm": 0.41426291244287444,
      "learning_rate": 3.9626291629332116e-05,
      "loss": 1.3368,
      "num_input_tokens_seen": 26849181328,
      "step": 34126
    },
    {
      "epoch": 3.6205177169531084,
      "grad_norm": 0.4781066049248881,
      "learning_rate": 3.96257280067314e-05,
      "loss": 1.4786,
      "num_input_tokens_seen": 26849968016,
      "step": 34127
    },
    {
      "epoch": 3.62062380649268,
      "grad_norm": 0.5119249887739424,
      "learning_rate": 3.962516437282834e-05,
      "loss": 1.4299,
      "num_input_tokens_seen": 26850754720,
      "step": 34128
    },
    {
      "epoch": 3.6207298960322514,
      "grad_norm": 0.42071871843086966,
      "learning_rate": 3.9624600727623386e-05,
      "loss": 1.4515,
      "num_input_tokens_seen": 26851541392,
      "step": 34129
    },
    {
      "epoch": 3.620835985571823,
      "grad_norm": 0.5336198967814851,
      "learning_rate": 3.962403707111697e-05,
      "loss": 1.4315,
      "num_input_tokens_seen": 26852328256,
      "step": 34130
    },
    {
      "epoch": 3.620942075111394,
      "grad_norm": 0.4557285539224972,
      "learning_rate": 3.9623473403309524e-05,
      "loss": 1.4419,
      "num_input_tokens_seen": 26853115072,
      "step": 34131
    },
    {
      "epoch": 3.6210481646509654,
      "grad_norm": 0.5042833707214646,
      "learning_rate": 3.962290972420149e-05,
      "loss": 1.4163,
      "num_input_tokens_seen": 26853901920,
      "step": 34132
    },
    {
      "epoch": 3.621154254190537,
      "grad_norm": 0.4919419846714831,
      "learning_rate": 3.96223460337933e-05,
      "loss": 1.4649,
      "num_input_tokens_seen": 26854688688,
      "step": 34133
    },
    {
      "epoch": 3.6212603437301083,
      "grad_norm": 0.40728531499871135,
      "learning_rate": 3.9621782332085384e-05,
      "loss": 1.3537,
      "num_input_tokens_seen": 26855475472,
      "step": 34134
    },
    {
      "epoch": 3.6213664332696798,
      "grad_norm": 0.5731052565172137,
      "learning_rate": 3.9621218619078196e-05,
      "loss": 1.3755,
      "num_input_tokens_seen": 26856262320,
      "step": 34135
    },
    {
      "epoch": 3.621472522809251,
      "grad_norm": 0.4199446884928731,
      "learning_rate": 3.9620654894772143e-05,
      "loss": 1.4211,
      "num_input_tokens_seen": 26857049120,
      "step": 34136
    },
    {
      "epoch": 3.6215786123488223,
      "grad_norm": 0.5778671606820844,
      "learning_rate": 3.9620091159167695e-05,
      "loss": 1.5474,
      "num_input_tokens_seen": 26857835904,
      "step": 34137
    },
    {
      "epoch": 3.6216847018883938,
      "grad_norm": 0.4547027616349244,
      "learning_rate": 3.961952741226526e-05,
      "loss": 1.4869,
      "num_input_tokens_seen": 26858622656,
      "step": 34138
    },
    {
      "epoch": 3.6217907914279652,
      "grad_norm": 0.4043608521607106,
      "learning_rate": 3.9618963654065276e-05,
      "loss": 1.3381,
      "num_input_tokens_seen": 26859409472,
      "step": 34139
    },
    {
      "epoch": 3.6218968809675367,
      "grad_norm": 0.4636207810082137,
      "learning_rate": 3.96183998845682e-05,
      "loss": 1.478,
      "num_input_tokens_seen": 26860196160,
      "step": 34140
    },
    {
      "epoch": 3.6220029705071077,
      "grad_norm": 0.4658170415969997,
      "learning_rate": 3.961783610377444e-05,
      "loss": 1.4613,
      "num_input_tokens_seen": 26860982832,
      "step": 34141
    },
    {
      "epoch": 3.6221090600466797,
      "grad_norm": 0.4889014697406481,
      "learning_rate": 3.961727231168446e-05,
      "loss": 1.4411,
      "num_input_tokens_seen": 26861769600,
      "step": 34142
    },
    {
      "epoch": 3.6222151495862507,
      "grad_norm": 0.4610352077505705,
      "learning_rate": 3.961670850829867e-05,
      "loss": 1.377,
      "num_input_tokens_seen": 26862556448,
      "step": 34143
    },
    {
      "epoch": 3.622321239125822,
      "grad_norm": 0.5575687313040634,
      "learning_rate": 3.9616144693617515e-05,
      "loss": 1.4959,
      "num_input_tokens_seen": 26863343344,
      "step": 34144
    },
    {
      "epoch": 3.6224273286653936,
      "grad_norm": 0.4345883976249768,
      "learning_rate": 3.961558086764144e-05,
      "loss": 1.5303,
      "num_input_tokens_seen": 26864130096,
      "step": 34145
    },
    {
      "epoch": 3.622533418204965,
      "grad_norm": 0.4611842889611686,
      "learning_rate": 3.9615017030370874e-05,
      "loss": 1.51,
      "num_input_tokens_seen": 26864916864,
      "step": 34146
    },
    {
      "epoch": 3.6226395077445366,
      "grad_norm": 0.450871279689126,
      "learning_rate": 3.961445318180625e-05,
      "loss": 1.4573,
      "num_input_tokens_seen": 26865703648,
      "step": 34147
    },
    {
      "epoch": 3.6227455972841076,
      "grad_norm": 0.507888484605506,
      "learning_rate": 3.9613889321948e-05,
      "loss": 1.3793,
      "num_input_tokens_seen": 26866490464,
      "step": 34148
    },
    {
      "epoch": 3.622851686823679,
      "grad_norm": 0.4426121401847281,
      "learning_rate": 3.961332545079657e-05,
      "loss": 1.4449,
      "num_input_tokens_seen": 26867277200,
      "step": 34149
    },
    {
      "epoch": 3.6229577763632506,
      "grad_norm": 0.4899050903074927,
      "learning_rate": 3.9612761568352394e-05,
      "loss": 1.4147,
      "num_input_tokens_seen": 26868063920,
      "step": 34150
    },
    {
      "epoch": 3.623063865902822,
      "grad_norm": 0.530707557405866,
      "learning_rate": 3.961219767461589e-05,
      "loss": 1.557,
      "num_input_tokens_seen": 26868850640,
      "step": 34151
    },
    {
      "epoch": 3.6231699554423935,
      "grad_norm": 0.45979688803607716,
      "learning_rate": 3.961163376958752e-05,
      "loss": 1.4981,
      "num_input_tokens_seen": 26869637312,
      "step": 34152
    },
    {
      "epoch": 3.6232760449819645,
      "grad_norm": 0.539288295838935,
      "learning_rate": 3.961106985326771e-05,
      "loss": 1.3425,
      "num_input_tokens_seen": 26870424160,
      "step": 34153
    },
    {
      "epoch": 3.623382134521536,
      "grad_norm": 0.44051827291642076,
      "learning_rate": 3.961050592565689e-05,
      "loss": 1.5244,
      "num_input_tokens_seen": 26871210912,
      "step": 34154
    },
    {
      "epoch": 3.6234882240611075,
      "grad_norm": 0.47707266340782584,
      "learning_rate": 3.96099419867555e-05,
      "loss": 1.5674,
      "num_input_tokens_seen": 26871997712,
      "step": 34155
    },
    {
      "epoch": 3.623594313600679,
      "grad_norm": 0.4660297369786744,
      "learning_rate": 3.960937803656397e-05,
      "loss": 1.6147,
      "num_input_tokens_seen": 26872784448,
      "step": 34156
    },
    {
      "epoch": 3.6237004031402504,
      "grad_norm": 0.4417972501185434,
      "learning_rate": 3.960881407508275e-05,
      "loss": 1.4619,
      "num_input_tokens_seen": 26873571216,
      "step": 34157
    },
    {
      "epoch": 3.623806492679822,
      "grad_norm": 0.37748302491376534,
      "learning_rate": 3.9608250102312264e-05,
      "loss": 1.5029,
      "num_input_tokens_seen": 26874357952,
      "step": 34158
    },
    {
      "epoch": 3.6239125822193934,
      "grad_norm": 0.45338292946060554,
      "learning_rate": 3.9607686118252954e-05,
      "loss": 1.451,
      "num_input_tokens_seen": 26875144592,
      "step": 34159
    },
    {
      "epoch": 3.6240186717589644,
      "grad_norm": 0.5149953893340488,
      "learning_rate": 3.960712212290525e-05,
      "loss": 1.3803,
      "num_input_tokens_seen": 26875931264,
      "step": 34160
    },
    {
      "epoch": 3.624124761298536,
      "grad_norm": 0.48319338787615834,
      "learning_rate": 3.960655811626959e-05,
      "loss": 1.4741,
      "num_input_tokens_seen": 26876718048,
      "step": 34161
    },
    {
      "epoch": 3.6242308508381074,
      "grad_norm": 0.4888278442149225,
      "learning_rate": 3.960599409834641e-05,
      "loss": 1.489,
      "num_input_tokens_seen": 26877504816,
      "step": 34162
    },
    {
      "epoch": 3.624336940377679,
      "grad_norm": 0.502711858049652,
      "learning_rate": 3.960543006913615e-05,
      "loss": 1.3893,
      "num_input_tokens_seen": 26878291536,
      "step": 34163
    },
    {
      "epoch": 3.6244430299172503,
      "grad_norm": 0.49708825090332004,
      "learning_rate": 3.9604866028639246e-05,
      "loss": 1.4514,
      "num_input_tokens_seen": 26879078240,
      "step": 34164
    },
    {
      "epoch": 3.6245491194568213,
      "grad_norm": 0.5945295348864897,
      "learning_rate": 3.960430197685612e-05,
      "loss": 1.4528,
      "num_input_tokens_seen": 26879864992,
      "step": 34165
    },
    {
      "epoch": 3.624655208996393,
      "grad_norm": 0.4163737510111367,
      "learning_rate": 3.960373791378722e-05,
      "loss": 1.3898,
      "num_input_tokens_seen": 26880651760,
      "step": 34166
    },
    {
      "epoch": 3.6247612985359643,
      "grad_norm": 0.5459037423519968,
      "learning_rate": 3.9603173839432975e-05,
      "loss": 1.4501,
      "num_input_tokens_seen": 26881438544,
      "step": 34167
    },
    {
      "epoch": 3.6248673880755358,
      "grad_norm": 0.41187412496170595,
      "learning_rate": 3.9602609753793834e-05,
      "loss": 1.3258,
      "num_input_tokens_seen": 26882225376,
      "step": 34168
    },
    {
      "epoch": 3.6249734776151072,
      "grad_norm": 0.4898305839339421,
      "learning_rate": 3.960204565687022e-05,
      "loss": 1.5228,
      "num_input_tokens_seen": 26883012112,
      "step": 34169
    },
    {
      "epoch": 3.6250795671546783,
      "grad_norm": 0.5573947243435835,
      "learning_rate": 3.960148154866258e-05,
      "loss": 1.53,
      "num_input_tokens_seen": 26883798880,
      "step": 34170
    },
    {
      "epoch": 3.62518565669425,
      "grad_norm": 0.5160985190428773,
      "learning_rate": 3.960091742917134e-05,
      "loss": 1.4862,
      "num_input_tokens_seen": 26884585648,
      "step": 34171
    },
    {
      "epoch": 3.625291746233821,
      "grad_norm": 0.5772933243220855,
      "learning_rate": 3.960035329839694e-05,
      "loss": 1.4597,
      "num_input_tokens_seen": 26885372416,
      "step": 34172
    },
    {
      "epoch": 3.6253978357733927,
      "grad_norm": 0.5017917889527506,
      "learning_rate": 3.9599789156339815e-05,
      "loss": 1.4067,
      "num_input_tokens_seen": 26886159184,
      "step": 34173
    },
    {
      "epoch": 3.625503925312964,
      "grad_norm": 0.5181382910949449,
      "learning_rate": 3.95992250030004e-05,
      "loss": 1.3522,
      "num_input_tokens_seen": 26886945952,
      "step": 34174
    },
    {
      "epoch": 3.6256100148525356,
      "grad_norm": 0.4676724444446522,
      "learning_rate": 3.959866083837913e-05,
      "loss": 1.4097,
      "num_input_tokens_seen": 26887732784,
      "step": 34175
    },
    {
      "epoch": 3.625716104392107,
      "grad_norm": 0.47591693534095764,
      "learning_rate": 3.959809666247645e-05,
      "loss": 1.4547,
      "num_input_tokens_seen": 26888519600,
      "step": 34176
    },
    {
      "epoch": 3.625822193931678,
      "grad_norm": 0.5672142773946365,
      "learning_rate": 3.959753247529279e-05,
      "loss": 1.4216,
      "num_input_tokens_seen": 26889306352,
      "step": 34177
    },
    {
      "epoch": 3.6259282834712496,
      "grad_norm": 0.4425056840860884,
      "learning_rate": 3.9596968276828575e-05,
      "loss": 1.4155,
      "num_input_tokens_seen": 26890093056,
      "step": 34178
    },
    {
      "epoch": 3.626034373010821,
      "grad_norm": 0.5379104763543928,
      "learning_rate": 3.959640406708426e-05,
      "loss": 1.5119,
      "num_input_tokens_seen": 26890879776,
      "step": 34179
    },
    {
      "epoch": 3.6261404625503926,
      "grad_norm": 0.603710379034855,
      "learning_rate": 3.959583984606027e-05,
      "loss": 1.4445,
      "num_input_tokens_seen": 26891666528,
      "step": 34180
    },
    {
      "epoch": 3.626246552089964,
      "grad_norm": 0.5519282262261449,
      "learning_rate": 3.959527561375703e-05,
      "loss": 1.4062,
      "num_input_tokens_seen": 26892453312,
      "step": 34181
    },
    {
      "epoch": 3.626352641629535,
      "grad_norm": 0.5665524264767007,
      "learning_rate": 3.9594711370175006e-05,
      "loss": 1.544,
      "num_input_tokens_seen": 26893240112,
      "step": 34182
    },
    {
      "epoch": 3.626458731169107,
      "grad_norm": 0.49640781056218625,
      "learning_rate": 3.9594147115314614e-05,
      "loss": 1.4394,
      "num_input_tokens_seen": 26894026928,
      "step": 34183
    },
    {
      "epoch": 3.626564820708678,
      "grad_norm": 0.4887305162092447,
      "learning_rate": 3.959358284917629e-05,
      "loss": 1.5752,
      "num_input_tokens_seen": 26894813712,
      "step": 34184
    },
    {
      "epoch": 3.6266709102482495,
      "grad_norm": 0.4473294566855552,
      "learning_rate": 3.9593018571760475e-05,
      "loss": 1.4248,
      "num_input_tokens_seen": 26895600448,
      "step": 34185
    },
    {
      "epoch": 3.626776999787821,
      "grad_norm": 0.4393141953638429,
      "learning_rate": 3.95924542830676e-05,
      "loss": 1.4148,
      "num_input_tokens_seen": 26896387216,
      "step": 34186
    },
    {
      "epoch": 3.6268830893273925,
      "grad_norm": 0.43855674913549375,
      "learning_rate": 3.959188998309812e-05,
      "loss": 1.4372,
      "num_input_tokens_seen": 26897173984,
      "step": 34187
    },
    {
      "epoch": 3.626989178866964,
      "grad_norm": 0.42007222989075027,
      "learning_rate": 3.959132567185244e-05,
      "loss": 1.4905,
      "num_input_tokens_seen": 26897960752,
      "step": 34188
    },
    {
      "epoch": 3.627095268406535,
      "grad_norm": 0.4637473828526589,
      "learning_rate": 3.959076134933102e-05,
      "loss": 1.5563,
      "num_input_tokens_seen": 26898747488,
      "step": 34189
    },
    {
      "epoch": 3.6272013579461064,
      "grad_norm": 0.49640760945423457,
      "learning_rate": 3.9590197015534284e-05,
      "loss": 1.5208,
      "num_input_tokens_seen": 26899534320,
      "step": 34190
    },
    {
      "epoch": 3.627307447485678,
      "grad_norm": 0.4172854121670411,
      "learning_rate": 3.958963267046267e-05,
      "loss": 1.4437,
      "num_input_tokens_seen": 26900321008,
      "step": 34191
    },
    {
      "epoch": 3.6274135370252494,
      "grad_norm": 0.4302659752355247,
      "learning_rate": 3.9589068314116615e-05,
      "loss": 1.5591,
      "num_input_tokens_seen": 26901107776,
      "step": 34192
    },
    {
      "epoch": 3.627519626564821,
      "grad_norm": 0.43462522909701845,
      "learning_rate": 3.958850394649656e-05,
      "loss": 1.4778,
      "num_input_tokens_seen": 26901894544,
      "step": 34193
    },
    {
      "epoch": 3.627625716104392,
      "grad_norm": 0.4749471191561049,
      "learning_rate": 3.958793956760294e-05,
      "loss": 1.5081,
      "num_input_tokens_seen": 26902681392,
      "step": 34194
    },
    {
      "epoch": 3.6277318056439634,
      "grad_norm": 0.3913300019455651,
      "learning_rate": 3.958737517743618e-05,
      "loss": 1.3894,
      "num_input_tokens_seen": 26903468272,
      "step": 34195
    },
    {
      "epoch": 3.627837895183535,
      "grad_norm": 0.42996388885629694,
      "learning_rate": 3.958681077599673e-05,
      "loss": 1.4478,
      "num_input_tokens_seen": 26904255120,
      "step": 34196
    },
    {
      "epoch": 3.6279439847231063,
      "grad_norm": 0.4753861060250001,
      "learning_rate": 3.958624636328502e-05,
      "loss": 1.5944,
      "num_input_tokens_seen": 26905041888,
      "step": 34197
    },
    {
      "epoch": 3.628050074262678,
      "grad_norm": 0.4435610762563151,
      "learning_rate": 3.9585681939301484e-05,
      "loss": 1.481,
      "num_input_tokens_seen": 26905828528,
      "step": 34198
    },
    {
      "epoch": 3.6281561638022493,
      "grad_norm": 0.4440161081221167,
      "learning_rate": 3.958511750404657e-05,
      "loss": 1.4439,
      "num_input_tokens_seen": 26906615264,
      "step": 34199
    },
    {
      "epoch": 3.6282622533418207,
      "grad_norm": 0.4411553479763551,
      "learning_rate": 3.958455305752069e-05,
      "loss": 1.4942,
      "num_input_tokens_seen": 26907401936,
      "step": 34200
    },
    {
      "epoch": 3.6283683428813918,
      "grad_norm": 0.4132992963440259,
      "learning_rate": 3.9583988599724304e-05,
      "loss": 1.5053,
      "num_input_tokens_seen": 26908188640,
      "step": 34201
    },
    {
      "epoch": 3.6284744324209632,
      "grad_norm": 0.43572823202562533,
      "learning_rate": 3.9583424130657844e-05,
      "loss": 1.4203,
      "num_input_tokens_seen": 26908975360,
      "step": 34202
    },
    {
      "epoch": 3.6285805219605347,
      "grad_norm": 0.47400207675148104,
      "learning_rate": 3.958285965032173e-05,
      "loss": 1.4655,
      "num_input_tokens_seen": 26909762128,
      "step": 34203
    },
    {
      "epoch": 3.628686611500106,
      "grad_norm": 0.4090912254150276,
      "learning_rate": 3.958229515871642e-05,
      "loss": 1.4317,
      "num_input_tokens_seen": 26910548832,
      "step": 34204
    },
    {
      "epoch": 3.6287927010396777,
      "grad_norm": 0.44877397897184723,
      "learning_rate": 3.9581730655842334e-05,
      "loss": 1.3966,
      "num_input_tokens_seen": 26911335616,
      "step": 34205
    },
    {
      "epoch": 3.6288987905792487,
      "grad_norm": 0.3893978659156866,
      "learning_rate": 3.958116614169992e-05,
      "loss": 1.3576,
      "num_input_tokens_seen": 26912122416,
      "step": 34206
    },
    {
      "epoch": 3.62900488011882,
      "grad_norm": 0.43886164961624335,
      "learning_rate": 3.95806016162896e-05,
      "loss": 1.4434,
      "num_input_tokens_seen": 26912909216,
      "step": 34207
    },
    {
      "epoch": 3.6291109696583916,
      "grad_norm": 0.42266431115097397,
      "learning_rate": 3.958003707961183e-05,
      "loss": 1.517,
      "num_input_tokens_seen": 26913695872,
      "step": 34208
    },
    {
      "epoch": 3.629217059197963,
      "grad_norm": 0.602563811576222,
      "learning_rate": 3.957947253166703e-05,
      "loss": 1.5381,
      "num_input_tokens_seen": 26914482688,
      "step": 34209
    },
    {
      "epoch": 3.6293231487375346,
      "grad_norm": 0.5017754892496958,
      "learning_rate": 3.9578907972455644e-05,
      "loss": 1.4242,
      "num_input_tokens_seen": 26915269504,
      "step": 34210
    },
    {
      "epoch": 3.6294292382771056,
      "grad_norm": 0.449653252851774,
      "learning_rate": 3.9578343401978104e-05,
      "loss": 1.5584,
      "num_input_tokens_seen": 26916056256,
      "step": 34211
    },
    {
      "epoch": 3.6295353278166775,
      "grad_norm": 0.39735026947054003,
      "learning_rate": 3.957777882023484e-05,
      "loss": 1.3938,
      "num_input_tokens_seen": 26916843104,
      "step": 34212
    },
    {
      "epoch": 3.6296414173562486,
      "grad_norm": 0.4269461104529043,
      "learning_rate": 3.957721422722631e-05,
      "loss": 1.4508,
      "num_input_tokens_seen": 26917629904,
      "step": 34213
    },
    {
      "epoch": 3.62974750689582,
      "grad_norm": 0.4689111626479574,
      "learning_rate": 3.9576649622952926e-05,
      "loss": 1.5113,
      "num_input_tokens_seen": 26918416768,
      "step": 34214
    },
    {
      "epoch": 3.6298535964353915,
      "grad_norm": 0.4113103513469904,
      "learning_rate": 3.9576085007415144e-05,
      "loss": 1.4356,
      "num_input_tokens_seen": 26919203552,
      "step": 34215
    },
    {
      "epoch": 3.629959685974963,
      "grad_norm": 0.5021294421411958,
      "learning_rate": 3.9575520380613376e-05,
      "loss": 1.5803,
      "num_input_tokens_seen": 26919990288,
      "step": 34216
    },
    {
      "epoch": 3.6300657755145345,
      "grad_norm": 0.4142897759248694,
      "learning_rate": 3.957495574254809e-05,
      "loss": 1.3944,
      "num_input_tokens_seen": 26920777056,
      "step": 34217
    },
    {
      "epoch": 3.6301718650541055,
      "grad_norm": 0.4357175860858931,
      "learning_rate": 3.9574391093219696e-05,
      "loss": 1.5194,
      "num_input_tokens_seen": 26921563808,
      "step": 34218
    },
    {
      "epoch": 3.630277954593677,
      "grad_norm": 0.383863984498278,
      "learning_rate": 3.9573826432628646e-05,
      "loss": 1.3477,
      "num_input_tokens_seen": 26922350640,
      "step": 34219
    },
    {
      "epoch": 3.6303840441332484,
      "grad_norm": 0.42003493693119726,
      "learning_rate": 3.957326176077536e-05,
      "loss": 1.3602,
      "num_input_tokens_seen": 26923137488,
      "step": 34220
    },
    {
      "epoch": 3.63049013367282,
      "grad_norm": 0.3837632718930444,
      "learning_rate": 3.9572697077660304e-05,
      "loss": 1.4545,
      "num_input_tokens_seen": 26923924288,
      "step": 34221
    },
    {
      "epoch": 3.6305962232123914,
      "grad_norm": 0.4542679221883723,
      "learning_rate": 3.957213238328388e-05,
      "loss": 1.605,
      "num_input_tokens_seen": 26924711056,
      "step": 34222
    },
    {
      "epoch": 3.6307023127519624,
      "grad_norm": 0.41648620467603953,
      "learning_rate": 3.957156767764654e-05,
      "loss": 1.6052,
      "num_input_tokens_seen": 26925497808,
      "step": 34223
    },
    {
      "epoch": 3.630808402291534,
      "grad_norm": 0.45797255989822594,
      "learning_rate": 3.957100296074873e-05,
      "loss": 1.3727,
      "num_input_tokens_seen": 26926284656,
      "step": 34224
    },
    {
      "epoch": 3.6309144918311054,
      "grad_norm": 0.4440010876237974,
      "learning_rate": 3.957043823259087e-05,
      "loss": 1.6037,
      "num_input_tokens_seen": 26927071376,
      "step": 34225
    },
    {
      "epoch": 3.631020581370677,
      "grad_norm": 0.4507738801674941,
      "learning_rate": 3.95698734931734e-05,
      "loss": 1.394,
      "num_input_tokens_seen": 26927858160,
      "step": 34226
    },
    {
      "epoch": 3.6311266709102483,
      "grad_norm": 0.4504269768591209,
      "learning_rate": 3.9569308742496765e-05,
      "loss": 1.42,
      "num_input_tokens_seen": 26928644912,
      "step": 34227
    },
    {
      "epoch": 3.63123276044982,
      "grad_norm": 0.430296267070834,
      "learning_rate": 3.956874398056139e-05,
      "loss": 1.4227,
      "num_input_tokens_seen": 26929431616,
      "step": 34228
    },
    {
      "epoch": 3.6313388499893913,
      "grad_norm": 0.508626253838568,
      "learning_rate": 3.956817920736772e-05,
      "loss": 1.2873,
      "num_input_tokens_seen": 26930218448,
      "step": 34229
    },
    {
      "epoch": 3.6314449395289623,
      "grad_norm": 0.4693008074872325,
      "learning_rate": 3.956761442291619e-05,
      "loss": 1.5831,
      "num_input_tokens_seen": 26931005184,
      "step": 34230
    },
    {
      "epoch": 3.6315510290685338,
      "grad_norm": 0.6145248934993448,
      "learning_rate": 3.956704962720723e-05,
      "loss": 1.5521,
      "num_input_tokens_seen": 26931791952,
      "step": 34231
    },
    {
      "epoch": 3.6316571186081053,
      "grad_norm": 0.4947835860339211,
      "learning_rate": 3.956648482024129e-05,
      "loss": 1.4949,
      "num_input_tokens_seen": 26932578528,
      "step": 34232
    },
    {
      "epoch": 3.6317632081476767,
      "grad_norm": 0.5270179001493774,
      "learning_rate": 3.956592000201879e-05,
      "loss": 1.4558,
      "num_input_tokens_seen": 26933365328,
      "step": 34233
    },
    {
      "epoch": 3.631869297687248,
      "grad_norm": 0.5184774645225249,
      "learning_rate": 3.9565355172540174e-05,
      "loss": 1.4804,
      "num_input_tokens_seen": 26934152048,
      "step": 34234
    },
    {
      "epoch": 3.6319753872268192,
      "grad_norm": 0.6019541414820465,
      "learning_rate": 3.956479033180589e-05,
      "loss": 1.4831,
      "num_input_tokens_seen": 26934938800,
      "step": 34235
    },
    {
      "epoch": 3.6320814767663907,
      "grad_norm": 0.45834383890916763,
      "learning_rate": 3.956422547981635e-05,
      "loss": 1.4427,
      "num_input_tokens_seen": 26935725536,
      "step": 34236
    },
    {
      "epoch": 3.632187566305962,
      "grad_norm": 0.4232857201854646,
      "learning_rate": 3.956366061657201e-05,
      "loss": 1.361,
      "num_input_tokens_seen": 26936512240,
      "step": 34237
    },
    {
      "epoch": 3.6322936558455337,
      "grad_norm": 0.5780000683156803,
      "learning_rate": 3.95630957420733e-05,
      "loss": 1.5134,
      "num_input_tokens_seen": 26937299008,
      "step": 34238
    },
    {
      "epoch": 3.632399745385105,
      "grad_norm": 0.42573914510328464,
      "learning_rate": 3.956253085632066e-05,
      "loss": 1.4982,
      "num_input_tokens_seen": 26938085728,
      "step": 34239
    },
    {
      "epoch": 3.632505834924676,
      "grad_norm": 0.5649785178228206,
      "learning_rate": 3.9561965959314526e-05,
      "loss": 1.3979,
      "num_input_tokens_seen": 26938872496,
      "step": 34240
    },
    {
      "epoch": 3.632611924464248,
      "grad_norm": 0.4168605663279402,
      "learning_rate": 3.9561401051055324e-05,
      "loss": 1.3959,
      "num_input_tokens_seen": 26939659152,
      "step": 34241
    },
    {
      "epoch": 3.632718014003819,
      "grad_norm": 0.6234632122869985,
      "learning_rate": 3.95608361315435e-05,
      "loss": 1.5466,
      "num_input_tokens_seen": 26940445904,
      "step": 34242
    },
    {
      "epoch": 3.6328241035433906,
      "grad_norm": 0.4301498736980017,
      "learning_rate": 3.956027120077949e-05,
      "loss": 1.3776,
      "num_input_tokens_seen": 26941232704,
      "step": 34243
    },
    {
      "epoch": 3.632930193082962,
      "grad_norm": 0.49470004358231195,
      "learning_rate": 3.955970625876373e-05,
      "loss": 1.4671,
      "num_input_tokens_seen": 26942019440,
      "step": 34244
    },
    {
      "epoch": 3.6330362826225335,
      "grad_norm": 0.42208295163477555,
      "learning_rate": 3.955914130549665e-05,
      "loss": 1.3958,
      "num_input_tokens_seen": 26942806192,
      "step": 34245
    },
    {
      "epoch": 3.633142372162105,
      "grad_norm": 0.5534401203271222,
      "learning_rate": 3.95585763409787e-05,
      "loss": 1.5153,
      "num_input_tokens_seen": 26943592848,
      "step": 34246
    },
    {
      "epoch": 3.633248461701676,
      "grad_norm": 0.4522467865067109,
      "learning_rate": 3.955801136521031e-05,
      "loss": 1.5454,
      "num_input_tokens_seen": 26944379568,
      "step": 34247
    },
    {
      "epoch": 3.6333545512412475,
      "grad_norm": 0.38053676420417126,
      "learning_rate": 3.955744637819192e-05,
      "loss": 1.2345,
      "num_input_tokens_seen": 26945166384,
      "step": 34248
    },
    {
      "epoch": 3.633460640780819,
      "grad_norm": 0.4441914253250426,
      "learning_rate": 3.955688137992395e-05,
      "loss": 1.4063,
      "num_input_tokens_seen": 26945953168,
      "step": 34249
    },
    {
      "epoch": 3.6335667303203905,
      "grad_norm": 0.38575108627859545,
      "learning_rate": 3.955631637040686e-05,
      "loss": 1.3556,
      "num_input_tokens_seen": 26946740000,
      "step": 34250
    },
    {
      "epoch": 3.633672819859962,
      "grad_norm": 0.47431858748513017,
      "learning_rate": 3.955575134964107e-05,
      "loss": 1.3103,
      "num_input_tokens_seen": 26947526832,
      "step": 34251
    },
    {
      "epoch": 3.633778909399533,
      "grad_norm": 0.40711852520568986,
      "learning_rate": 3.955518631762703e-05,
      "loss": 1.3698,
      "num_input_tokens_seen": 26948313664,
      "step": 34252
    },
    {
      "epoch": 3.6338849989391044,
      "grad_norm": 0.38430029729426884,
      "learning_rate": 3.955462127436516e-05,
      "loss": 1.2982,
      "num_input_tokens_seen": 26949100448,
      "step": 34253
    },
    {
      "epoch": 3.633991088478676,
      "grad_norm": 0.453043880625853,
      "learning_rate": 3.955405621985591e-05,
      "loss": 1.4295,
      "num_input_tokens_seen": 26949887248,
      "step": 34254
    },
    {
      "epoch": 3.6340971780182474,
      "grad_norm": 0.3835195514651148,
      "learning_rate": 3.955349115409971e-05,
      "loss": 1.38,
      "num_input_tokens_seen": 26950674080,
      "step": 34255
    },
    {
      "epoch": 3.634203267557819,
      "grad_norm": 0.48239145023598595,
      "learning_rate": 3.9552926077096996e-05,
      "loss": 1.5281,
      "num_input_tokens_seen": 26951460752,
      "step": 34256
    },
    {
      "epoch": 3.6343093570973903,
      "grad_norm": 0.42060896109095947,
      "learning_rate": 3.955236098884821e-05,
      "loss": 1.3712,
      "num_input_tokens_seen": 26952247568,
      "step": 34257
    },
    {
      "epoch": 3.634415446636962,
      "grad_norm": 0.4223794774437255,
      "learning_rate": 3.955179588935379e-05,
      "loss": 1.4837,
      "num_input_tokens_seen": 26953034208,
      "step": 34258
    },
    {
      "epoch": 3.634521536176533,
      "grad_norm": 0.3908564711419285,
      "learning_rate": 3.9551230778614176e-05,
      "loss": 1.4007,
      "num_input_tokens_seen": 26953820976,
      "step": 34259
    },
    {
      "epoch": 3.6346276257161043,
      "grad_norm": 0.4060461843152789,
      "learning_rate": 3.9550665656629785e-05,
      "loss": 1.3589,
      "num_input_tokens_seen": 26954607808,
      "step": 34260
    },
    {
      "epoch": 3.634733715255676,
      "grad_norm": 0.47697572602437727,
      "learning_rate": 3.955010052340107e-05,
      "loss": 1.6526,
      "num_input_tokens_seen": 26955394544,
      "step": 34261
    },
    {
      "epoch": 3.6348398047952473,
      "grad_norm": 0.46957008257950583,
      "learning_rate": 3.954953537892847e-05,
      "loss": 1.4887,
      "num_input_tokens_seen": 26956181280,
      "step": 34262
    },
    {
      "epoch": 3.6349458943348187,
      "grad_norm": 0.46765421253199657,
      "learning_rate": 3.9548970223212414e-05,
      "loss": 1.3653,
      "num_input_tokens_seen": 26956968080,
      "step": 34263
    },
    {
      "epoch": 3.6350519838743898,
      "grad_norm": 0.4720747504660728,
      "learning_rate": 3.954840505625334e-05,
      "loss": 1.4444,
      "num_input_tokens_seen": 26957754848,
      "step": 34264
    },
    {
      "epoch": 3.6351580734139612,
      "grad_norm": 0.3806100536359213,
      "learning_rate": 3.954783987805168e-05,
      "loss": 1.4001,
      "num_input_tokens_seen": 26958541584,
      "step": 34265
    },
    {
      "epoch": 3.6352641629535327,
      "grad_norm": 0.4125826230784033,
      "learning_rate": 3.954727468860788e-05,
      "loss": 1.3404,
      "num_input_tokens_seen": 26959328400,
      "step": 34266
    },
    {
      "epoch": 3.635370252493104,
      "grad_norm": 0.4752306698160852,
      "learning_rate": 3.9546709487922375e-05,
      "loss": 1.5098,
      "num_input_tokens_seen": 26960115104,
      "step": 34267
    },
    {
      "epoch": 3.6354763420326757,
      "grad_norm": 0.38210272514211713,
      "learning_rate": 3.9546144275995594e-05,
      "loss": 1.4313,
      "num_input_tokens_seen": 26960901904,
      "step": 34268
    },
    {
      "epoch": 3.635582431572247,
      "grad_norm": 0.3977551039301975,
      "learning_rate": 3.954557905282799e-05,
      "loss": 1.4025,
      "num_input_tokens_seen": 26961688816,
      "step": 34269
    },
    {
      "epoch": 3.6356885211118186,
      "grad_norm": 0.4454812717937361,
      "learning_rate": 3.9545013818419975e-05,
      "loss": 1.4437,
      "num_input_tokens_seen": 26962475456,
      "step": 34270
    },
    {
      "epoch": 3.6357946106513896,
      "grad_norm": 0.43893558977368324,
      "learning_rate": 3.9544448572772005e-05,
      "loss": 1.434,
      "num_input_tokens_seen": 26963262256,
      "step": 34271
    },
    {
      "epoch": 3.635900700190961,
      "grad_norm": 0.44615754431138327,
      "learning_rate": 3.954388331588452e-05,
      "loss": 1.46,
      "num_input_tokens_seen": 26964049008,
      "step": 34272
    },
    {
      "epoch": 3.6360067897305326,
      "grad_norm": 0.4795185173020937,
      "learning_rate": 3.954331804775794e-05,
      "loss": 1.4198,
      "num_input_tokens_seen": 26964835744,
      "step": 34273
    },
    {
      "epoch": 3.636112879270104,
      "grad_norm": 0.5128064188296417,
      "learning_rate": 3.954275276839271e-05,
      "loss": 1.5128,
      "num_input_tokens_seen": 26965622512,
      "step": 34274
    },
    {
      "epoch": 3.6362189688096755,
      "grad_norm": 0.48686751908108294,
      "learning_rate": 3.954218747778927e-05,
      "loss": 1.4158,
      "num_input_tokens_seen": 26966409216,
      "step": 34275
    },
    {
      "epoch": 3.6363250583492466,
      "grad_norm": 0.45345667968692577,
      "learning_rate": 3.954162217594806e-05,
      "loss": 1.3937,
      "num_input_tokens_seen": 26967196000,
      "step": 34276
    },
    {
      "epoch": 3.636431147888818,
      "grad_norm": 0.4042640527294351,
      "learning_rate": 3.95410568628695e-05,
      "loss": 1.4386,
      "num_input_tokens_seen": 26967982880,
      "step": 34277
    },
    {
      "epoch": 3.6365372374283895,
      "grad_norm": 0.5076446101671895,
      "learning_rate": 3.9540491538554045e-05,
      "loss": 1.4826,
      "num_input_tokens_seen": 26968769520,
      "step": 34278
    },
    {
      "epoch": 3.636643326967961,
      "grad_norm": 0.4253390677014351,
      "learning_rate": 3.953992620300213e-05,
      "loss": 1.5113,
      "num_input_tokens_seen": 26969556176,
      "step": 34279
    },
    {
      "epoch": 3.6367494165075325,
      "grad_norm": 0.381503999926288,
      "learning_rate": 3.9539360856214175e-05,
      "loss": 1.3023,
      "num_input_tokens_seen": 26970342928,
      "step": 34280
    },
    {
      "epoch": 3.6368555060471035,
      "grad_norm": 0.46968781275025256,
      "learning_rate": 3.9538795498190635e-05,
      "loss": 1.457,
      "num_input_tokens_seen": 26971129808,
      "step": 34281
    },
    {
      "epoch": 3.6369615955866754,
      "grad_norm": 0.40848386902928324,
      "learning_rate": 3.953823012893194e-05,
      "loss": 1.3915,
      "num_input_tokens_seen": 26971916512,
      "step": 34282
    },
    {
      "epoch": 3.6370676851262465,
      "grad_norm": 0.5884767798471908,
      "learning_rate": 3.953766474843853e-05,
      "loss": 1.534,
      "num_input_tokens_seen": 26972703232,
      "step": 34283
    },
    {
      "epoch": 3.637173774665818,
      "grad_norm": 0.42120086022399017,
      "learning_rate": 3.9537099356710824e-05,
      "loss": 1.5414,
      "num_input_tokens_seen": 26973489936,
      "step": 34284
    },
    {
      "epoch": 3.6372798642053894,
      "grad_norm": 0.5473324089455508,
      "learning_rate": 3.9536533953749294e-05,
      "loss": 1.5428,
      "num_input_tokens_seen": 26974276656,
      "step": 34285
    },
    {
      "epoch": 3.637385953744961,
      "grad_norm": 0.5207930951880584,
      "learning_rate": 3.9535968539554344e-05,
      "loss": 1.5656,
      "num_input_tokens_seen": 26975063392,
      "step": 34286
    },
    {
      "epoch": 3.6374920432845324,
      "grad_norm": 0.5275624777989852,
      "learning_rate": 3.953540311412644e-05,
      "loss": 1.3389,
      "num_input_tokens_seen": 26975850224,
      "step": 34287
    },
    {
      "epoch": 3.6375981328241034,
      "grad_norm": 0.6157976466363636,
      "learning_rate": 3.9534837677465985e-05,
      "loss": 1.3826,
      "num_input_tokens_seen": 26976637008,
      "step": 34288
    },
    {
      "epoch": 3.637704222363675,
      "grad_norm": 0.48723292678739794,
      "learning_rate": 3.953427222957344e-05,
      "loss": 1.4899,
      "num_input_tokens_seen": 26977423712,
      "step": 34289
    },
    {
      "epoch": 3.6378103119032463,
      "grad_norm": 0.7033179481690524,
      "learning_rate": 3.953370677044924e-05,
      "loss": 1.401,
      "num_input_tokens_seen": 26978210528,
      "step": 34290
    },
    {
      "epoch": 3.637916401442818,
      "grad_norm": 0.5195099569815917,
      "learning_rate": 3.9533141300093814e-05,
      "loss": 1.5201,
      "num_input_tokens_seen": 26978997248,
      "step": 34291
    },
    {
      "epoch": 3.6380224909823893,
      "grad_norm": 0.5283650266167522,
      "learning_rate": 3.95325758185076e-05,
      "loss": 1.5087,
      "num_input_tokens_seen": 26979783920,
      "step": 34292
    },
    {
      "epoch": 3.6381285805219603,
      "grad_norm": 0.5103533594452695,
      "learning_rate": 3.953201032569105e-05,
      "loss": 1.424,
      "num_input_tokens_seen": 26980570720,
      "step": 34293
    },
    {
      "epoch": 3.638234670061532,
      "grad_norm": 0.47739437316809996,
      "learning_rate": 3.953144482164458e-05,
      "loss": 1.4815,
      "num_input_tokens_seen": 26981357472,
      "step": 34294
    },
    {
      "epoch": 3.6383407596011033,
      "grad_norm": 0.6214943297489394,
      "learning_rate": 3.9530879306368626e-05,
      "loss": 1.4421,
      "num_input_tokens_seen": 26982144192,
      "step": 34295
    },
    {
      "epoch": 3.6384468491406747,
      "grad_norm": 0.4660788359743802,
      "learning_rate": 3.9530313779863654e-05,
      "loss": 1.4625,
      "num_input_tokens_seen": 26982930896,
      "step": 34296
    },
    {
      "epoch": 3.638552938680246,
      "grad_norm": 0.4844065505538351,
      "learning_rate": 3.9529748242130074e-05,
      "loss": 1.4984,
      "num_input_tokens_seen": 26983717680,
      "step": 34297
    },
    {
      "epoch": 3.6386590282198177,
      "grad_norm": 0.43478527461925937,
      "learning_rate": 3.9529182693168327e-05,
      "loss": 1.4332,
      "num_input_tokens_seen": 26984504480,
      "step": 34298
    },
    {
      "epoch": 3.638765117759389,
      "grad_norm": 0.46245486591898594,
      "learning_rate": 3.952861713297886e-05,
      "loss": 1.4108,
      "num_input_tokens_seen": 26985291328,
      "step": 34299
    },
    {
      "epoch": 3.63887120729896,
      "grad_norm": 0.46101973165456667,
      "learning_rate": 3.952805156156209e-05,
      "loss": 1.4112,
      "num_input_tokens_seen": 26986078080,
      "step": 34300
    },
    {
      "epoch": 3.6389772968385317,
      "grad_norm": 0.3946011641064261,
      "learning_rate": 3.952748597891849e-05,
      "loss": 1.4801,
      "num_input_tokens_seen": 26986864800,
      "step": 34301
    },
    {
      "epoch": 3.639083386378103,
      "grad_norm": 0.4854374929379734,
      "learning_rate": 3.952692038504846e-05,
      "loss": 1.4911,
      "num_input_tokens_seen": 26987651536,
      "step": 34302
    },
    {
      "epoch": 3.6391894759176746,
      "grad_norm": 0.4184486925080743,
      "learning_rate": 3.952635477995246e-05,
      "loss": 1.41,
      "num_input_tokens_seen": 26988438368,
      "step": 34303
    },
    {
      "epoch": 3.639295565457246,
      "grad_norm": 0.4193284895084174,
      "learning_rate": 3.952578916363091e-05,
      "loss": 1.5531,
      "num_input_tokens_seen": 26989225216,
      "step": 34304
    },
    {
      "epoch": 3.639401654996817,
      "grad_norm": 0.3941380923529112,
      "learning_rate": 3.952522353608427e-05,
      "loss": 1.403,
      "num_input_tokens_seen": 26990012080,
      "step": 34305
    },
    {
      "epoch": 3.6395077445363886,
      "grad_norm": 0.44170820396158267,
      "learning_rate": 3.9524657897312945e-05,
      "loss": 1.5134,
      "num_input_tokens_seen": 26990798880,
      "step": 34306
    },
    {
      "epoch": 3.63961383407596,
      "grad_norm": 0.38266577911554706,
      "learning_rate": 3.95240922473174e-05,
      "loss": 1.4345,
      "num_input_tokens_seen": 26991585600,
      "step": 34307
    },
    {
      "epoch": 3.6397199236155315,
      "grad_norm": 0.46589143373039865,
      "learning_rate": 3.952352658609807e-05,
      "loss": 1.4398,
      "num_input_tokens_seen": 26992372384,
      "step": 34308
    },
    {
      "epoch": 3.639826013155103,
      "grad_norm": 0.4787647857440765,
      "learning_rate": 3.952296091365537e-05,
      "loss": 1.5511,
      "num_input_tokens_seen": 26993159200,
      "step": 34309
    },
    {
      "epoch": 3.639932102694674,
      "grad_norm": 0.4738984528453439,
      "learning_rate": 3.9522395229989766e-05,
      "loss": 1.4434,
      "num_input_tokens_seen": 26993945968,
      "step": 34310
    },
    {
      "epoch": 3.640038192234246,
      "grad_norm": 0.48147392547359,
      "learning_rate": 3.952182953510167e-05,
      "loss": 1.4463,
      "num_input_tokens_seen": 26994732704,
      "step": 34311
    },
    {
      "epoch": 3.640144281773817,
      "grad_norm": 0.4529278167937137,
      "learning_rate": 3.952126382899154e-05,
      "loss": 1.5168,
      "num_input_tokens_seen": 26995519440,
      "step": 34312
    },
    {
      "epoch": 3.6402503713133885,
      "grad_norm": 0.5663782393884179,
      "learning_rate": 3.95206981116598e-05,
      "loss": 1.3839,
      "num_input_tokens_seen": 26996306144,
      "step": 34313
    },
    {
      "epoch": 3.64035646085296,
      "grad_norm": 0.4468198652251549,
      "learning_rate": 3.952013238310689e-05,
      "loss": 1.5594,
      "num_input_tokens_seen": 26997092880,
      "step": 34314
    },
    {
      "epoch": 3.6404625503925314,
      "grad_norm": 0.44401018870063996,
      "learning_rate": 3.951956664333325e-05,
      "loss": 1.3662,
      "num_input_tokens_seen": 26997879520,
      "step": 34315
    },
    {
      "epoch": 3.640568639932103,
      "grad_norm": 0.5918292752938699,
      "learning_rate": 3.951900089233931e-05,
      "loss": 1.5676,
      "num_input_tokens_seen": 26998666320,
      "step": 34316
    },
    {
      "epoch": 3.640674729471674,
      "grad_norm": 0.47195521482056124,
      "learning_rate": 3.951843513012551e-05,
      "loss": 1.5324,
      "num_input_tokens_seen": 26999453072,
      "step": 34317
    },
    {
      "epoch": 3.6407808190112454,
      "grad_norm": 0.5187310298311639,
      "learning_rate": 3.9517869356692295e-05,
      "loss": 1.5316,
      "num_input_tokens_seen": 27000239776,
      "step": 34318
    },
    {
      "epoch": 3.640886908550817,
      "grad_norm": 0.40961335055104775,
      "learning_rate": 3.951730357204009e-05,
      "loss": 1.3886,
      "num_input_tokens_seen": 27001026416,
      "step": 34319
    },
    {
      "epoch": 3.6409929980903883,
      "grad_norm": 0.4295673595571277,
      "learning_rate": 3.9516737776169346e-05,
      "loss": 1.4913,
      "num_input_tokens_seen": 27001813120,
      "step": 34320
    },
    {
      "epoch": 3.64109908762996,
      "grad_norm": 0.5335668539356845,
      "learning_rate": 3.9516171969080495e-05,
      "loss": 1.568,
      "num_input_tokens_seen": 27002599776,
      "step": 34321
    },
    {
      "epoch": 3.641205177169531,
      "grad_norm": 0.4562766952336319,
      "learning_rate": 3.9515606150773967e-05,
      "loss": 1.5581,
      "num_input_tokens_seen": 27003386560,
      "step": 34322
    },
    {
      "epoch": 3.6413112667091023,
      "grad_norm": 0.5409702851598143,
      "learning_rate": 3.95150403212502e-05,
      "loss": 1.6082,
      "num_input_tokens_seen": 27004173264,
      "step": 34323
    },
    {
      "epoch": 3.641417356248674,
      "grad_norm": 0.4448974278425444,
      "learning_rate": 3.9514474480509646e-05,
      "loss": 1.441,
      "num_input_tokens_seen": 27004960032,
      "step": 34324
    },
    {
      "epoch": 3.6415234457882453,
      "grad_norm": 0.4244200116330751,
      "learning_rate": 3.951390862855272e-05,
      "loss": 1.4863,
      "num_input_tokens_seen": 27005746768,
      "step": 34325
    },
    {
      "epoch": 3.6416295353278167,
      "grad_norm": 0.4676170652158603,
      "learning_rate": 3.951334276537988e-05,
      "loss": 1.4397,
      "num_input_tokens_seen": 27006533504,
      "step": 34326
    },
    {
      "epoch": 3.641735624867388,
      "grad_norm": 0.4009238261776475,
      "learning_rate": 3.951277689099155e-05,
      "loss": 1.2727,
      "num_input_tokens_seen": 27007320272,
      "step": 34327
    },
    {
      "epoch": 3.6418417144069597,
      "grad_norm": 0.3930596801692473,
      "learning_rate": 3.951221100538818e-05,
      "loss": 1.5182,
      "num_input_tokens_seen": 27008107040,
      "step": 34328
    },
    {
      "epoch": 3.6419478039465307,
      "grad_norm": 0.3604855853531878,
      "learning_rate": 3.9511645108570196e-05,
      "loss": 1.3389,
      "num_input_tokens_seen": 27008893888,
      "step": 34329
    },
    {
      "epoch": 3.642053893486102,
      "grad_norm": 0.42688949567172463,
      "learning_rate": 3.9511079200538036e-05,
      "loss": 1.4644,
      "num_input_tokens_seen": 27009680704,
      "step": 34330
    },
    {
      "epoch": 3.6421599830256737,
      "grad_norm": 0.4240359169439048,
      "learning_rate": 3.9510513281292137e-05,
      "loss": 1.497,
      "num_input_tokens_seen": 27010467488,
      "step": 34331
    },
    {
      "epoch": 3.642266072565245,
      "grad_norm": 0.4825552314846939,
      "learning_rate": 3.9509947350832944e-05,
      "loss": 1.5536,
      "num_input_tokens_seen": 27011254272,
      "step": 34332
    },
    {
      "epoch": 3.6423721621048166,
      "grad_norm": 0.4825885505776887,
      "learning_rate": 3.9509381409160884e-05,
      "loss": 1.3589,
      "num_input_tokens_seen": 27012041008,
      "step": 34333
    },
    {
      "epoch": 3.6424782516443877,
      "grad_norm": 0.40166105646618483,
      "learning_rate": 3.9508815456276406e-05,
      "loss": 1.4046,
      "num_input_tokens_seen": 27012827760,
      "step": 34334
    },
    {
      "epoch": 3.642584341183959,
      "grad_norm": 0.40832644883294994,
      "learning_rate": 3.9508249492179935e-05,
      "loss": 1.3561,
      "num_input_tokens_seen": 27013614624,
      "step": 34335
    },
    {
      "epoch": 3.6426904307235306,
      "grad_norm": 0.4530973803044028,
      "learning_rate": 3.950768351687193e-05,
      "loss": 1.5021,
      "num_input_tokens_seen": 27014401328,
      "step": 34336
    },
    {
      "epoch": 3.642796520263102,
      "grad_norm": 0.3868320416371612,
      "learning_rate": 3.950711753035279e-05,
      "loss": 1.3803,
      "num_input_tokens_seen": 27015188096,
      "step": 34337
    },
    {
      "epoch": 3.6429026098026736,
      "grad_norm": 0.4697414254948705,
      "learning_rate": 3.9506551532622996e-05,
      "loss": 1.4552,
      "num_input_tokens_seen": 27015974848,
      "step": 34338
    },
    {
      "epoch": 3.6430086993422446,
      "grad_norm": 0.4395749300828248,
      "learning_rate": 3.9505985523682954e-05,
      "loss": 1.3915,
      "num_input_tokens_seen": 27016761536,
      "step": 34339
    },
    {
      "epoch": 3.6431147888818165,
      "grad_norm": 0.5247487454609856,
      "learning_rate": 3.950541950353311e-05,
      "loss": 1.4243,
      "num_input_tokens_seen": 27017548288,
      "step": 34340
    },
    {
      "epoch": 3.6432208784213875,
      "grad_norm": 0.5808318338740209,
      "learning_rate": 3.95048534721739e-05,
      "loss": 1.518,
      "num_input_tokens_seen": 27018335024,
      "step": 34341
    },
    {
      "epoch": 3.643326967960959,
      "grad_norm": 0.5186161193997877,
      "learning_rate": 3.950428742960577e-05,
      "loss": 1.4748,
      "num_input_tokens_seen": 27019121776,
      "step": 34342
    },
    {
      "epoch": 3.6434330575005305,
      "grad_norm": 0.4761689969371323,
      "learning_rate": 3.950372137582916e-05,
      "loss": 1.3472,
      "num_input_tokens_seen": 27019908496,
      "step": 34343
    },
    {
      "epoch": 3.643539147040102,
      "grad_norm": 0.5748965856139342,
      "learning_rate": 3.950315531084449e-05,
      "loss": 1.6767,
      "num_input_tokens_seen": 27020695280,
      "step": 34344
    },
    {
      "epoch": 3.6436452365796734,
      "grad_norm": 0.47384166958527707,
      "learning_rate": 3.950258923465221e-05,
      "loss": 1.4597,
      "num_input_tokens_seen": 27021482032,
      "step": 34345
    },
    {
      "epoch": 3.6437513261192445,
      "grad_norm": 0.4573164040714399,
      "learning_rate": 3.950202314725275e-05,
      "loss": 1.3287,
      "num_input_tokens_seen": 27022268768,
      "step": 34346
    },
    {
      "epoch": 3.643857415658816,
      "grad_norm": 0.5273177218376752,
      "learning_rate": 3.950145704864656e-05,
      "loss": 1.5008,
      "num_input_tokens_seen": 27023055520,
      "step": 34347
    },
    {
      "epoch": 3.6439635051983874,
      "grad_norm": 0.45619086490899424,
      "learning_rate": 3.9500890938834066e-05,
      "loss": 1.3296,
      "num_input_tokens_seen": 27023842416,
      "step": 34348
    },
    {
      "epoch": 3.644069594737959,
      "grad_norm": 0.5355310068086581,
      "learning_rate": 3.9500324817815716e-05,
      "loss": 1.4386,
      "num_input_tokens_seen": 27024629248,
      "step": 34349
    },
    {
      "epoch": 3.6441756842775304,
      "grad_norm": 0.4428599390868262,
      "learning_rate": 3.949975868559193e-05,
      "loss": 1.4258,
      "num_input_tokens_seen": 27025416048,
      "step": 34350
    },
    {
      "epoch": 3.6442817738171014,
      "grad_norm": 0.5687182592234004,
      "learning_rate": 3.949919254216316e-05,
      "loss": 1.5252,
      "num_input_tokens_seen": 27026202672,
      "step": 34351
    },
    {
      "epoch": 3.6443878633566733,
      "grad_norm": 0.48640254895854096,
      "learning_rate": 3.949862638752984e-05,
      "loss": 1.4628,
      "num_input_tokens_seen": 27026989424,
      "step": 34352
    },
    {
      "epoch": 3.6444939528962443,
      "grad_norm": 0.4295683625826269,
      "learning_rate": 3.9498060221692406e-05,
      "loss": 1.402,
      "num_input_tokens_seen": 27027776176,
      "step": 34353
    },
    {
      "epoch": 3.644600042435816,
      "grad_norm": 0.543119699816138,
      "learning_rate": 3.94974940446513e-05,
      "loss": 1.4444,
      "num_input_tokens_seen": 27028563056,
      "step": 34354
    },
    {
      "epoch": 3.6447061319753873,
      "grad_norm": 0.44371991953767026,
      "learning_rate": 3.949692785640695e-05,
      "loss": 1.6044,
      "num_input_tokens_seen": 27029349776,
      "step": 34355
    },
    {
      "epoch": 3.6448122215149588,
      "grad_norm": 0.458767012280789,
      "learning_rate": 3.94963616569598e-05,
      "loss": 1.3353,
      "num_input_tokens_seen": 27030136608,
      "step": 34356
    },
    {
      "epoch": 3.6449183110545302,
      "grad_norm": 0.5292980750132478,
      "learning_rate": 3.949579544631029e-05,
      "loss": 1.4573,
      "num_input_tokens_seen": 27030923456,
      "step": 34357
    },
    {
      "epoch": 3.6450244005941013,
      "grad_norm": 0.6652812531750697,
      "learning_rate": 3.949522922445885e-05,
      "loss": 1.5011,
      "num_input_tokens_seen": 27031710272,
      "step": 34358
    },
    {
      "epoch": 3.6451304901336727,
      "grad_norm": 0.5211932763055422,
      "learning_rate": 3.949466299140593e-05,
      "loss": 1.4735,
      "num_input_tokens_seen": 27032496976,
      "step": 34359
    },
    {
      "epoch": 3.645236579673244,
      "grad_norm": 0.8953446144312199,
      "learning_rate": 3.9494096747151955e-05,
      "loss": 1.5529,
      "num_input_tokens_seen": 27033283712,
      "step": 34360
    },
    {
      "epoch": 3.6453426692128157,
      "grad_norm": 0.7869062516372963,
      "learning_rate": 3.949353049169737e-05,
      "loss": 1.3877,
      "num_input_tokens_seen": 27034070528,
      "step": 34361
    },
    {
      "epoch": 3.645448758752387,
      "grad_norm": 0.7913835228573596,
      "learning_rate": 3.9492964225042605e-05,
      "loss": 1.3768,
      "num_input_tokens_seen": 27034857264,
      "step": 34362
    },
    {
      "epoch": 3.645554848291958,
      "grad_norm": 0.5022462086173237,
      "learning_rate": 3.949239794718811e-05,
      "loss": 1.4439,
      "num_input_tokens_seen": 27035644080,
      "step": 34363
    },
    {
      "epoch": 3.6456609378315297,
      "grad_norm": 0.9954047626162484,
      "learning_rate": 3.9491831658134305e-05,
      "loss": 1.3997,
      "num_input_tokens_seen": 27036430848,
      "step": 34364
    },
    {
      "epoch": 3.645767027371101,
      "grad_norm": 0.47792878870056393,
      "learning_rate": 3.949126535788165e-05,
      "loss": 1.4782,
      "num_input_tokens_seen": 27037217616,
      "step": 34365
    },
    {
      "epoch": 3.6458731169106726,
      "grad_norm": 0.7362345955487306,
      "learning_rate": 3.949069904643056e-05,
      "loss": 1.4906,
      "num_input_tokens_seen": 27038004400,
      "step": 34366
    },
    {
      "epoch": 3.645979206450244,
      "grad_norm": 0.7846947058450643,
      "learning_rate": 3.949013272378148e-05,
      "loss": 1.3098,
      "num_input_tokens_seen": 27038791232,
      "step": 34367
    },
    {
      "epoch": 3.6460852959898156,
      "grad_norm": 0.6906340661208576,
      "learning_rate": 3.9489566389934866e-05,
      "loss": 1.5429,
      "num_input_tokens_seen": 27039577904,
      "step": 34368
    },
    {
      "epoch": 3.646191385529387,
      "grad_norm": 0.7005952761828159,
      "learning_rate": 3.948900004489112e-05,
      "loss": 1.5446,
      "num_input_tokens_seen": 27040364688,
      "step": 34369
    },
    {
      "epoch": 3.646297475068958,
      "grad_norm": 0.5581491482979626,
      "learning_rate": 3.948843368865072e-05,
      "loss": 1.371,
      "num_input_tokens_seen": 27041151488,
      "step": 34370
    },
    {
      "epoch": 3.6464035646085295,
      "grad_norm": 0.4104516613917099,
      "learning_rate": 3.9487867321214065e-05,
      "loss": 1.3704,
      "num_input_tokens_seen": 27041938272,
      "step": 34371
    },
    {
      "epoch": 3.646509654148101,
      "grad_norm": 0.6924026948017697,
      "learning_rate": 3.948730094258163e-05,
      "loss": 1.3749,
      "num_input_tokens_seen": 27042725024,
      "step": 34372
    },
    {
      "epoch": 3.6466157436876725,
      "grad_norm": 0.5731606368744079,
      "learning_rate": 3.9486734552753815e-05,
      "loss": 1.4516,
      "num_input_tokens_seen": 27043511872,
      "step": 34373
    },
    {
      "epoch": 3.646721833227244,
      "grad_norm": 0.468684323815512,
      "learning_rate": 3.948616815173109e-05,
      "loss": 1.4908,
      "num_input_tokens_seen": 27044298560,
      "step": 34374
    },
    {
      "epoch": 3.646827922766815,
      "grad_norm": 0.5685228314964216,
      "learning_rate": 3.9485601739513874e-05,
      "loss": 1.4619,
      "num_input_tokens_seen": 27045085376,
      "step": 34375
    },
    {
      "epoch": 3.6469340123063865,
      "grad_norm": 0.47491047867531033,
      "learning_rate": 3.9485035316102614e-05,
      "loss": 1.4202,
      "num_input_tokens_seen": 27045872160,
      "step": 34376
    },
    {
      "epoch": 3.647040101845958,
      "grad_norm": 0.5030896721880148,
      "learning_rate": 3.948446888149774e-05,
      "loss": 1.4494,
      "num_input_tokens_seen": 27046658912,
      "step": 34377
    },
    {
      "epoch": 3.6471461913855294,
      "grad_norm": 0.5612942989992189,
      "learning_rate": 3.9483902435699696e-05,
      "loss": 1.431,
      "num_input_tokens_seen": 27047445728,
      "step": 34378
    },
    {
      "epoch": 3.647252280925101,
      "grad_norm": 0.46413176884516694,
      "learning_rate": 3.948333597870892e-05,
      "loss": 1.4084,
      "num_input_tokens_seen": 27048232496,
      "step": 34379
    },
    {
      "epoch": 3.647358370464672,
      "grad_norm": 0.5252376479028358,
      "learning_rate": 3.948276951052584e-05,
      "loss": 1.3772,
      "num_input_tokens_seen": 27049019264,
      "step": 34380
    },
    {
      "epoch": 3.647464460004244,
      "grad_norm": 0.47860413269596336,
      "learning_rate": 3.94822030311509e-05,
      "loss": 1.366,
      "num_input_tokens_seen": 27049806160,
      "step": 34381
    },
    {
      "epoch": 3.647570549543815,
      "grad_norm": 0.4719515966741101,
      "learning_rate": 3.948163654058454e-05,
      "loss": 1.3712,
      "num_input_tokens_seen": 27050592944,
      "step": 34382
    },
    {
      "epoch": 3.6476766390833864,
      "grad_norm": 0.4994672820462282,
      "learning_rate": 3.9481070038827206e-05,
      "loss": 1.3593,
      "num_input_tokens_seen": 27051379728,
      "step": 34383
    },
    {
      "epoch": 3.647782728622958,
      "grad_norm": 0.5141660788148282,
      "learning_rate": 3.948050352587932e-05,
      "loss": 1.5332,
      "num_input_tokens_seen": 27052166464,
      "step": 34384
    },
    {
      "epoch": 3.6478888181625293,
      "grad_norm": 0.4286622651210835,
      "learning_rate": 3.947993700174132e-05,
      "loss": 1.4661,
      "num_input_tokens_seen": 27052953184,
      "step": 34385
    },
    {
      "epoch": 3.6479949077021008,
      "grad_norm": 0.4668927199490885,
      "learning_rate": 3.9479370466413656e-05,
      "loss": 1.3659,
      "num_input_tokens_seen": 27053740016,
      "step": 34386
    },
    {
      "epoch": 3.648100997241672,
      "grad_norm": 0.5199444792417282,
      "learning_rate": 3.9478803919896755e-05,
      "loss": 1.5228,
      "num_input_tokens_seen": 27054526704,
      "step": 34387
    },
    {
      "epoch": 3.6482070867812433,
      "grad_norm": 0.5259671803724811,
      "learning_rate": 3.9478237362191063e-05,
      "loss": 1.5542,
      "num_input_tokens_seen": 27055313456,
      "step": 34388
    },
    {
      "epoch": 3.6483131763208148,
      "grad_norm": 0.6021638266462368,
      "learning_rate": 3.947767079329701e-05,
      "loss": 1.3835,
      "num_input_tokens_seen": 27056100320,
      "step": 34389
    },
    {
      "epoch": 3.6484192658603862,
      "grad_norm": 0.4630363894528338,
      "learning_rate": 3.9477104213215045e-05,
      "loss": 1.3554,
      "num_input_tokens_seen": 27056887168,
      "step": 34390
    },
    {
      "epoch": 3.6485253553999577,
      "grad_norm": 0.5053761623305427,
      "learning_rate": 3.9476537621945585e-05,
      "loss": 1.311,
      "num_input_tokens_seen": 27057673952,
      "step": 34391
    },
    {
      "epoch": 3.6486314449395287,
      "grad_norm": 0.656175537369705,
      "learning_rate": 3.947597101948909e-05,
      "loss": 1.5287,
      "num_input_tokens_seen": 27058460592,
      "step": 34392
    },
    {
      "epoch": 3.6487375344791,
      "grad_norm": 0.458465480020712,
      "learning_rate": 3.947540440584599e-05,
      "loss": 1.4271,
      "num_input_tokens_seen": 27059247296,
      "step": 34393
    },
    {
      "epoch": 3.6488436240186717,
      "grad_norm": 0.5468561936379813,
      "learning_rate": 3.947483778101673e-05,
      "loss": 1.3728,
      "num_input_tokens_seen": 27060034080,
      "step": 34394
    },
    {
      "epoch": 3.648949713558243,
      "grad_norm": 0.49142322711978964,
      "learning_rate": 3.947427114500173e-05,
      "loss": 1.4078,
      "num_input_tokens_seen": 27060820864,
      "step": 34395
    },
    {
      "epoch": 3.6490558030978146,
      "grad_norm": 0.5230590099149565,
      "learning_rate": 3.947370449780143e-05,
      "loss": 1.604,
      "num_input_tokens_seen": 27061607616,
      "step": 34396
    },
    {
      "epoch": 3.649161892637386,
      "grad_norm": 0.4852292277644476,
      "learning_rate": 3.947313783941629e-05,
      "loss": 1.3896,
      "num_input_tokens_seen": 27062394288,
      "step": 34397
    },
    {
      "epoch": 3.6492679821769576,
      "grad_norm": 0.4770536340910092,
      "learning_rate": 3.947257116984673e-05,
      "loss": 1.3945,
      "num_input_tokens_seen": 27063181024,
      "step": 34398
    },
    {
      "epoch": 3.6493740717165286,
      "grad_norm": 0.47339590492463457,
      "learning_rate": 3.94720044890932e-05,
      "loss": 1.3495,
      "num_input_tokens_seen": 27063967792,
      "step": 34399
    },
    {
      "epoch": 3.6494801612561,
      "grad_norm": 0.5335676426167586,
      "learning_rate": 3.9471437797156114e-05,
      "loss": 1.3878,
      "num_input_tokens_seen": 27064754608,
      "step": 34400
    },
    {
      "epoch": 3.6495862507956716,
      "grad_norm": 0.4764129066921043,
      "learning_rate": 3.947087109403593e-05,
      "loss": 1.5712,
      "num_input_tokens_seen": 27065541392,
      "step": 34401
    },
    {
      "epoch": 3.649692340335243,
      "grad_norm": 0.6224835314066279,
      "learning_rate": 3.947030437973308e-05,
      "loss": 1.4294,
      "num_input_tokens_seen": 27066328160,
      "step": 34402
    },
    {
      "epoch": 3.6497984298748145,
      "grad_norm": 0.4113674694481915,
      "learning_rate": 3.946973765424801e-05,
      "loss": 1.46,
      "num_input_tokens_seen": 27067114928,
      "step": 34403
    },
    {
      "epoch": 3.6499045194143855,
      "grad_norm": 0.5586253957032525,
      "learning_rate": 3.946917091758115e-05,
      "loss": 1.4185,
      "num_input_tokens_seen": 27067901648,
      "step": 34404
    },
    {
      "epoch": 3.650010608953957,
      "grad_norm": 0.44279295346125835,
      "learning_rate": 3.9468604169732935e-05,
      "loss": 1.4321,
      "num_input_tokens_seen": 27068688400,
      "step": 34405
    },
    {
      "epoch": 3.6501166984935285,
      "grad_norm": 0.43638669370374833,
      "learning_rate": 3.946803741070381e-05,
      "loss": 1.4238,
      "num_input_tokens_seen": 27069475248,
      "step": 34406
    },
    {
      "epoch": 3.6502227880331,
      "grad_norm": 0.4701333822482625,
      "learning_rate": 3.946747064049421e-05,
      "loss": 1.5119,
      "num_input_tokens_seen": 27070261920,
      "step": 34407
    },
    {
      "epoch": 3.6503288775726714,
      "grad_norm": 0.45711960287878856,
      "learning_rate": 3.946690385910458e-05,
      "loss": 1.5813,
      "num_input_tokens_seen": 27071048640,
      "step": 34408
    },
    {
      "epoch": 3.6504349671122425,
      "grad_norm": 0.49725738124739927,
      "learning_rate": 3.946633706653534e-05,
      "loss": 1.3731,
      "num_input_tokens_seen": 27071835456,
      "step": 34409
    },
    {
      "epoch": 3.6505410566518144,
      "grad_norm": 0.44240596401196336,
      "learning_rate": 3.946577026278694e-05,
      "loss": 1.4422,
      "num_input_tokens_seen": 27072622128,
      "step": 34410
    },
    {
      "epoch": 3.6506471461913854,
      "grad_norm": 0.46538291974971974,
      "learning_rate": 3.946520344785982e-05,
      "loss": 1.3838,
      "num_input_tokens_seen": 27073408928,
      "step": 34411
    },
    {
      "epoch": 3.650753235730957,
      "grad_norm": 0.48779748903694875,
      "learning_rate": 3.946463662175441e-05,
      "loss": 1.4798,
      "num_input_tokens_seen": 27074195728,
      "step": 34412
    },
    {
      "epoch": 3.6508593252705284,
      "grad_norm": 0.4522025939424938,
      "learning_rate": 3.946406978447117e-05,
      "loss": 1.4037,
      "num_input_tokens_seen": 27074982480,
      "step": 34413
    },
    {
      "epoch": 3.6509654148101,
      "grad_norm": 0.5171944874440266,
      "learning_rate": 3.9463502936010504e-05,
      "loss": 1.5932,
      "num_input_tokens_seen": 27075769232,
      "step": 34414
    },
    {
      "epoch": 3.6510715043496713,
      "grad_norm": 0.4680243761240779,
      "learning_rate": 3.946293607637288e-05,
      "loss": 1.4799,
      "num_input_tokens_seen": 27076556048,
      "step": 34415
    },
    {
      "epoch": 3.6511775938892423,
      "grad_norm": 0.37833989645522453,
      "learning_rate": 3.946236920555871e-05,
      "loss": 1.4126,
      "num_input_tokens_seen": 27077342736,
      "step": 34416
    },
    {
      "epoch": 3.651283683428814,
      "grad_norm": 0.480791742818025,
      "learning_rate": 3.946180232356845e-05,
      "loss": 1.4556,
      "num_input_tokens_seen": 27078129552,
      "step": 34417
    },
    {
      "epoch": 3.6513897729683853,
      "grad_norm": 0.42931122264100346,
      "learning_rate": 3.946123543040254e-05,
      "loss": 1.5214,
      "num_input_tokens_seen": 27078916256,
      "step": 34418
    },
    {
      "epoch": 3.6514958625079568,
      "grad_norm": 0.47928464920361286,
      "learning_rate": 3.9460668526061405e-05,
      "loss": 1.5586,
      "num_input_tokens_seen": 27079702976,
      "step": 34419
    },
    {
      "epoch": 3.6516019520475282,
      "grad_norm": 0.4057446560702932,
      "learning_rate": 3.946010161054549e-05,
      "loss": 1.4268,
      "num_input_tokens_seen": 27080489712,
      "step": 34420
    },
    {
      "epoch": 3.6517080415870993,
      "grad_norm": 0.5248717159773756,
      "learning_rate": 3.945953468385524e-05,
      "loss": 1.4637,
      "num_input_tokens_seen": 27081276480,
      "step": 34421
    },
    {
      "epoch": 3.6518141311266707,
      "grad_norm": 0.4586193969843446,
      "learning_rate": 3.945896774599108e-05,
      "loss": 1.5759,
      "num_input_tokens_seen": 27082063232,
      "step": 34422
    },
    {
      "epoch": 3.6519202206662422,
      "grad_norm": 0.47817461001872663,
      "learning_rate": 3.9458400796953454e-05,
      "loss": 1.3218,
      "num_input_tokens_seen": 27082850128,
      "step": 34423
    },
    {
      "epoch": 3.6520263102058137,
      "grad_norm": 0.3881399690660806,
      "learning_rate": 3.9457833836742795e-05,
      "loss": 1.3882,
      "num_input_tokens_seen": 27083636912,
      "step": 34424
    },
    {
      "epoch": 3.652132399745385,
      "grad_norm": 0.5474821684513723,
      "learning_rate": 3.9457266865359555e-05,
      "loss": 1.4011,
      "num_input_tokens_seen": 27084423680,
      "step": 34425
    },
    {
      "epoch": 3.6522384892849566,
      "grad_norm": 0.5011849315849632,
      "learning_rate": 3.945669988280416e-05,
      "loss": 1.4548,
      "num_input_tokens_seen": 27085210528,
      "step": 34426
    },
    {
      "epoch": 3.652344578824528,
      "grad_norm": 0.4912672446175382,
      "learning_rate": 3.945613288907705e-05,
      "loss": 1.4664,
      "num_input_tokens_seen": 27085997328,
      "step": 34427
    },
    {
      "epoch": 3.652450668364099,
      "grad_norm": 0.4234402821157782,
      "learning_rate": 3.945556588417867e-05,
      "loss": 1.3474,
      "num_input_tokens_seen": 27086784144,
      "step": 34428
    },
    {
      "epoch": 3.6525567579036706,
      "grad_norm": 0.5220036245754128,
      "learning_rate": 3.9454998868109447e-05,
      "loss": 1.4697,
      "num_input_tokens_seen": 27087570896,
      "step": 34429
    },
    {
      "epoch": 3.652662847443242,
      "grad_norm": 0.4087737040340249,
      "learning_rate": 3.945443184086983e-05,
      "loss": 1.3864,
      "num_input_tokens_seen": 27088357680,
      "step": 34430
    },
    {
      "epoch": 3.6527689369828136,
      "grad_norm": 0.5335222489483292,
      "learning_rate": 3.945386480246025e-05,
      "loss": 1.468,
      "num_input_tokens_seen": 27089144416,
      "step": 34431
    },
    {
      "epoch": 3.652875026522385,
      "grad_norm": 0.43428329593710496,
      "learning_rate": 3.9453297752881145e-05,
      "loss": 1.3246,
      "num_input_tokens_seen": 27089931136,
      "step": 34432
    },
    {
      "epoch": 3.652981116061956,
      "grad_norm": 0.4991188705436919,
      "learning_rate": 3.9452730692132954e-05,
      "loss": 1.4345,
      "num_input_tokens_seen": 27090717936,
      "step": 34433
    },
    {
      "epoch": 3.6530872056015276,
      "grad_norm": 0.5794539631747131,
      "learning_rate": 3.945216362021612e-05,
      "loss": 1.4022,
      "num_input_tokens_seen": 27091504688,
      "step": 34434
    },
    {
      "epoch": 3.653193295141099,
      "grad_norm": 0.47149790880263215,
      "learning_rate": 3.9451596537131086e-05,
      "loss": 1.4462,
      "num_input_tokens_seen": 27092291472,
      "step": 34435
    },
    {
      "epoch": 3.6532993846806705,
      "grad_norm": 0.6422740716498472,
      "learning_rate": 3.9451029442878276e-05,
      "loss": 1.5013,
      "num_input_tokens_seen": 27093078192,
      "step": 34436
    },
    {
      "epoch": 3.653405474220242,
      "grad_norm": 0.4268555958432423,
      "learning_rate": 3.945046233745813e-05,
      "loss": 1.333,
      "num_input_tokens_seen": 27093864944,
      "step": 34437
    },
    {
      "epoch": 3.653511563759813,
      "grad_norm": 0.8246048361984842,
      "learning_rate": 3.9449895220871094e-05,
      "loss": 1.5609,
      "num_input_tokens_seen": 27094651792,
      "step": 34438
    },
    {
      "epoch": 3.653617653299385,
      "grad_norm": 0.4323366852618238,
      "learning_rate": 3.9449328093117597e-05,
      "loss": 1.4765,
      "num_input_tokens_seen": 27095438496,
      "step": 34439
    },
    {
      "epoch": 3.653723742838956,
      "grad_norm": 0.86962351595433,
      "learning_rate": 3.94487609541981e-05,
      "loss": 1.5929,
      "num_input_tokens_seen": 27096225264,
      "step": 34440
    },
    {
      "epoch": 3.6538298323785274,
      "grad_norm": 0.47928965236322935,
      "learning_rate": 3.944819380411301e-05,
      "loss": 1.4435,
      "num_input_tokens_seen": 27097012096,
      "step": 34441
    },
    {
      "epoch": 3.653935921918099,
      "grad_norm": 0.6569683859662112,
      "learning_rate": 3.944762664286278e-05,
      "loss": 1.4439,
      "num_input_tokens_seen": 27097798816,
      "step": 34442
    },
    {
      "epoch": 3.6540420114576704,
      "grad_norm": 0.5501911972516471,
      "learning_rate": 3.944705947044785e-05,
      "loss": 1.458,
      "num_input_tokens_seen": 27098585600,
      "step": 34443
    },
    {
      "epoch": 3.654148100997242,
      "grad_norm": 0.5151343466550719,
      "learning_rate": 3.944649228686866e-05,
      "loss": 1.5161,
      "num_input_tokens_seen": 27099372368,
      "step": 34444
    },
    {
      "epoch": 3.654254190536813,
      "grad_norm": 0.521832323040952,
      "learning_rate": 3.944592509212564e-05,
      "loss": 1.4457,
      "num_input_tokens_seen": 27100159056,
      "step": 34445
    },
    {
      "epoch": 3.6543602800763844,
      "grad_norm": 0.4726163310901836,
      "learning_rate": 3.9445357886219235e-05,
      "loss": 1.5561,
      "num_input_tokens_seen": 27100945792,
      "step": 34446
    },
    {
      "epoch": 3.654466369615956,
      "grad_norm": 0.41622488453270284,
      "learning_rate": 3.944479066914988e-05,
      "loss": 1.4241,
      "num_input_tokens_seen": 27101732480,
      "step": 34447
    },
    {
      "epoch": 3.6545724591555273,
      "grad_norm": 0.5476557048791564,
      "learning_rate": 3.9444223440918014e-05,
      "loss": 1.3927,
      "num_input_tokens_seen": 27102519328,
      "step": 34448
    },
    {
      "epoch": 3.654678548695099,
      "grad_norm": 0.40539996129059597,
      "learning_rate": 3.944365620152408e-05,
      "loss": 1.4347,
      "num_input_tokens_seen": 27103306128,
      "step": 34449
    },
    {
      "epoch": 3.65478463823467,
      "grad_norm": 0.4924971213203625,
      "learning_rate": 3.944308895096851e-05,
      "loss": 1.444,
      "num_input_tokens_seen": 27104092832,
      "step": 34450
    },
    {
      "epoch": 3.6548907277742417,
      "grad_norm": 0.4296563653817587,
      "learning_rate": 3.944252168925174e-05,
      "loss": 1.3993,
      "num_input_tokens_seen": 27104879536,
      "step": 34451
    },
    {
      "epoch": 3.6549968173138128,
      "grad_norm": 0.5059236369615354,
      "learning_rate": 3.9441954416374224e-05,
      "loss": 1.5293,
      "num_input_tokens_seen": 27105666352,
      "step": 34452
    },
    {
      "epoch": 3.6551029068533842,
      "grad_norm": 0.48119544428660244,
      "learning_rate": 3.9441387132336385e-05,
      "loss": 1.4406,
      "num_input_tokens_seen": 27106453056,
      "step": 34453
    },
    {
      "epoch": 3.6552089963929557,
      "grad_norm": 0.4835782088472341,
      "learning_rate": 3.944081983713866e-05,
      "loss": 1.43,
      "num_input_tokens_seen": 27107239824,
      "step": 34454
    },
    {
      "epoch": 3.655315085932527,
      "grad_norm": 0.4061827610992499,
      "learning_rate": 3.94402525307815e-05,
      "loss": 1.4959,
      "num_input_tokens_seen": 27108026592,
      "step": 34455
    },
    {
      "epoch": 3.6554211754720987,
      "grad_norm": 0.4870072355550432,
      "learning_rate": 3.943968521326533e-05,
      "loss": 1.4398,
      "num_input_tokens_seen": 27108813376,
      "step": 34456
    },
    {
      "epoch": 3.6555272650116697,
      "grad_norm": 0.46564469884788684,
      "learning_rate": 3.9439117884590605e-05,
      "loss": 1.5196,
      "num_input_tokens_seen": 27109600192,
      "step": 34457
    },
    {
      "epoch": 3.655633354551241,
      "grad_norm": 0.42382817991447447,
      "learning_rate": 3.943855054475775e-05,
      "loss": 1.4272,
      "num_input_tokens_seen": 27110386992,
      "step": 34458
    },
    {
      "epoch": 3.6557394440908126,
      "grad_norm": 0.4263569560203765,
      "learning_rate": 3.94379831937672e-05,
      "loss": 1.4175,
      "num_input_tokens_seen": 27111173888,
      "step": 34459
    },
    {
      "epoch": 3.655845533630384,
      "grad_norm": 0.40962067497334836,
      "learning_rate": 3.9437415831619405e-05,
      "loss": 1.409,
      "num_input_tokens_seen": 27111960672,
      "step": 34460
    },
    {
      "epoch": 3.6559516231699556,
      "grad_norm": 0.40072671324989106,
      "learning_rate": 3.9436848458314796e-05,
      "loss": 1.4483,
      "num_input_tokens_seen": 27112747424,
      "step": 34461
    },
    {
      "epoch": 3.6560577127095266,
      "grad_norm": 0.45544988025570504,
      "learning_rate": 3.9436281073853814e-05,
      "loss": 1.4762,
      "num_input_tokens_seen": 27113534256,
      "step": 34462
    },
    {
      "epoch": 3.656163802249098,
      "grad_norm": 0.43985798713221325,
      "learning_rate": 3.94357136782369e-05,
      "loss": 1.4794,
      "num_input_tokens_seen": 27114320944,
      "step": 34463
    },
    {
      "epoch": 3.6562698917886696,
      "grad_norm": 0.43730855804940477,
      "learning_rate": 3.943514627146449e-05,
      "loss": 1.5164,
      "num_input_tokens_seen": 27115107600,
      "step": 34464
    },
    {
      "epoch": 3.656375981328241,
      "grad_norm": 0.4229402805883199,
      "learning_rate": 3.943457885353702e-05,
      "loss": 1.4434,
      "num_input_tokens_seen": 27115894304,
      "step": 34465
    },
    {
      "epoch": 3.6564820708678125,
      "grad_norm": 0.5666939414145518,
      "learning_rate": 3.943401142445493e-05,
      "loss": 1.4923,
      "num_input_tokens_seen": 27116681024,
      "step": 34466
    },
    {
      "epoch": 3.656588160407384,
      "grad_norm": 0.5594075880988089,
      "learning_rate": 3.9433443984218666e-05,
      "loss": 1.5974,
      "num_input_tokens_seen": 27117467696,
      "step": 34467
    },
    {
      "epoch": 3.6566942499469555,
      "grad_norm": 0.4225018518952347,
      "learning_rate": 3.943287653282866e-05,
      "loss": 1.5538,
      "num_input_tokens_seen": 27118254368,
      "step": 34468
    },
    {
      "epoch": 3.6568003394865265,
      "grad_norm": 0.7147424841711187,
      "learning_rate": 3.943230907028535e-05,
      "loss": 1.5016,
      "num_input_tokens_seen": 27119041184,
      "step": 34469
    },
    {
      "epoch": 3.656906429026098,
      "grad_norm": 0.40724716206861844,
      "learning_rate": 3.943174159658917e-05,
      "loss": 1.4571,
      "num_input_tokens_seen": 27119827952,
      "step": 34470
    },
    {
      "epoch": 3.6570125185656694,
      "grad_norm": 0.6607370019008283,
      "learning_rate": 3.943117411174056e-05,
      "loss": 1.4825,
      "num_input_tokens_seen": 27120614608,
      "step": 34471
    },
    {
      "epoch": 3.657118608105241,
      "grad_norm": 0.5254896081575884,
      "learning_rate": 3.943060661573997e-05,
      "loss": 1.4736,
      "num_input_tokens_seen": 27121401280,
      "step": 34472
    },
    {
      "epoch": 3.6572246976448124,
      "grad_norm": 0.5720815131344748,
      "learning_rate": 3.943003910858782e-05,
      "loss": 1.5029,
      "num_input_tokens_seen": 27122187968,
      "step": 34473
    },
    {
      "epoch": 3.6573307871843834,
      "grad_norm": 0.5522316533341606,
      "learning_rate": 3.9429471590284576e-05,
      "loss": 1.4161,
      "num_input_tokens_seen": 27122974704,
      "step": 34474
    },
    {
      "epoch": 3.657436876723955,
      "grad_norm": 0.48461927781644737,
      "learning_rate": 3.942890406083065e-05,
      "loss": 1.5193,
      "num_input_tokens_seen": 27123761440,
      "step": 34475
    },
    {
      "epoch": 3.6575429662635264,
      "grad_norm": 0.46675558992373106,
      "learning_rate": 3.9428336520226496e-05,
      "loss": 1.4244,
      "num_input_tokens_seen": 27124548224,
      "step": 34476
    },
    {
      "epoch": 3.657649055803098,
      "grad_norm": 0.45371972242604286,
      "learning_rate": 3.9427768968472537e-05,
      "loss": 1.4571,
      "num_input_tokens_seen": 27125335072,
      "step": 34477
    },
    {
      "epoch": 3.6577551453426693,
      "grad_norm": 0.5838753032603602,
      "learning_rate": 3.9427201405569225e-05,
      "loss": 1.5082,
      "num_input_tokens_seen": 27126121936,
      "step": 34478
    },
    {
      "epoch": 3.6578612348822404,
      "grad_norm": 0.4561838276631167,
      "learning_rate": 3.9426633831517e-05,
      "loss": 1.4541,
      "num_input_tokens_seen": 27126908752,
      "step": 34479
    },
    {
      "epoch": 3.6579673244218123,
      "grad_norm": 0.4147440446823411,
      "learning_rate": 3.942606624631629e-05,
      "loss": 1.3963,
      "num_input_tokens_seen": 27127695568,
      "step": 34480
    },
    {
      "epoch": 3.6580734139613833,
      "grad_norm": 0.5118119482336531,
      "learning_rate": 3.942549864996754e-05,
      "loss": 1.56,
      "num_input_tokens_seen": 27128482288,
      "step": 34481
    },
    {
      "epoch": 3.6581795035009548,
      "grad_norm": 0.4067422877467225,
      "learning_rate": 3.942493104247119e-05,
      "loss": 1.379,
      "num_input_tokens_seen": 27129269008,
      "step": 34482
    },
    {
      "epoch": 3.6582855930405263,
      "grad_norm": 0.4466757989347223,
      "learning_rate": 3.942436342382768e-05,
      "loss": 1.5718,
      "num_input_tokens_seen": 27130055728,
      "step": 34483
    },
    {
      "epoch": 3.6583916825800977,
      "grad_norm": 0.45509926097907144,
      "learning_rate": 3.942379579403744e-05,
      "loss": 1.4018,
      "num_input_tokens_seen": 27130842480,
      "step": 34484
    },
    {
      "epoch": 3.658497772119669,
      "grad_norm": 0.3832129592336389,
      "learning_rate": 3.9423228153100916e-05,
      "loss": 1.3178,
      "num_input_tokens_seen": 27131629216,
      "step": 34485
    },
    {
      "epoch": 3.6586038616592402,
      "grad_norm": 0.5332483649627088,
      "learning_rate": 3.942266050101855e-05,
      "loss": 1.4239,
      "num_input_tokens_seen": 27132415936,
      "step": 34486
    },
    {
      "epoch": 3.6587099511988117,
      "grad_norm": 0.41979687987563596,
      "learning_rate": 3.942209283779076e-05,
      "loss": 1.5912,
      "num_input_tokens_seen": 27133202672,
      "step": 34487
    },
    {
      "epoch": 3.658816040738383,
      "grad_norm": 0.4261688888341753,
      "learning_rate": 3.942152516341801e-05,
      "loss": 1.5231,
      "num_input_tokens_seen": 27133989440,
      "step": 34488
    },
    {
      "epoch": 3.6589221302779547,
      "grad_norm": 0.5128836760688991,
      "learning_rate": 3.9420957477900735e-05,
      "loss": 1.5235,
      "num_input_tokens_seen": 27134776144,
      "step": 34489
    },
    {
      "epoch": 3.659028219817526,
      "grad_norm": 0.4898375624503486,
      "learning_rate": 3.9420389781239354e-05,
      "loss": 1.5146,
      "num_input_tokens_seen": 27135562880,
      "step": 34490
    },
    {
      "epoch": 3.659134309357097,
      "grad_norm": 0.39397987934488266,
      "learning_rate": 3.941982207343432e-05,
      "loss": 1.467,
      "num_input_tokens_seen": 27136349600,
      "step": 34491
    },
    {
      "epoch": 3.6592403988966686,
      "grad_norm": 0.42796410011517927,
      "learning_rate": 3.941925435448608e-05,
      "loss": 1.3983,
      "num_input_tokens_seen": 27137136368,
      "step": 34492
    },
    {
      "epoch": 3.65934648843624,
      "grad_norm": 0.3927419674182695,
      "learning_rate": 3.941868662439506e-05,
      "loss": 1.339,
      "num_input_tokens_seen": 27137923120,
      "step": 34493
    },
    {
      "epoch": 3.6594525779758116,
      "grad_norm": 0.4767748730355156,
      "learning_rate": 3.94181188831617e-05,
      "loss": 1.494,
      "num_input_tokens_seen": 27138709856,
      "step": 34494
    },
    {
      "epoch": 3.659558667515383,
      "grad_norm": 0.40532449974220713,
      "learning_rate": 3.941755113078644e-05,
      "loss": 1.3796,
      "num_input_tokens_seen": 27139496640,
      "step": 34495
    },
    {
      "epoch": 3.6596647570549545,
      "grad_norm": 0.4375986575447874,
      "learning_rate": 3.9416983367269724e-05,
      "loss": 1.4688,
      "num_input_tokens_seen": 27140283440,
      "step": 34496
    },
    {
      "epoch": 3.659770846594526,
      "grad_norm": 0.42548940913431404,
      "learning_rate": 3.941641559261198e-05,
      "loss": 1.429,
      "num_input_tokens_seen": 27141070208,
      "step": 34497
    },
    {
      "epoch": 3.659876936134097,
      "grad_norm": 0.37022029253208727,
      "learning_rate": 3.941584780681365e-05,
      "loss": 1.4572,
      "num_input_tokens_seen": 27141856976,
      "step": 34498
    },
    {
      "epoch": 3.6599830256736685,
      "grad_norm": 0.3730638237508737,
      "learning_rate": 3.941528000987519e-05,
      "loss": 1.3835,
      "num_input_tokens_seen": 27142643824,
      "step": 34499
    },
    {
      "epoch": 3.66008911521324,
      "grad_norm": 0.5809428981548577,
      "learning_rate": 3.941471220179701e-05,
      "loss": 1.5012,
      "num_input_tokens_seen": 27143430656,
      "step": 34500
    },
    {
      "epoch": 3.6601952047528115,
      "grad_norm": 0.4586131159097486,
      "learning_rate": 3.9414144382579574e-05,
      "loss": 1.442,
      "num_input_tokens_seen": 27144217424,
      "step": 34501
    },
    {
      "epoch": 3.660301294292383,
      "grad_norm": 0.5537540262793118,
      "learning_rate": 3.9413576552223305e-05,
      "loss": 1.3979,
      "num_input_tokens_seen": 27145004192,
      "step": 34502
    },
    {
      "epoch": 3.660407383831954,
      "grad_norm": 0.4837542850661596,
      "learning_rate": 3.941300871072865e-05,
      "loss": 1.4365,
      "num_input_tokens_seen": 27145790864,
      "step": 34503
    },
    {
      "epoch": 3.6605134733715254,
      "grad_norm": 0.5844622374037755,
      "learning_rate": 3.941244085809604e-05,
      "loss": 1.4959,
      "num_input_tokens_seen": 27146577648,
      "step": 34504
    },
    {
      "epoch": 3.660619562911097,
      "grad_norm": 0.6156389225735501,
      "learning_rate": 3.9411872994325923e-05,
      "loss": 1.4164,
      "num_input_tokens_seen": 27147364432,
      "step": 34505
    },
    {
      "epoch": 3.6607256524506684,
      "grad_norm": 0.5308647090050947,
      "learning_rate": 3.941130511941873e-05,
      "loss": 1.5003,
      "num_input_tokens_seen": 27148151152,
      "step": 34506
    },
    {
      "epoch": 3.66083174199024,
      "grad_norm": 0.7773231950487312,
      "learning_rate": 3.9410737233374904e-05,
      "loss": 1.4175,
      "num_input_tokens_seen": 27148937888,
      "step": 34507
    },
    {
      "epoch": 3.660937831529811,
      "grad_norm": 0.4338839094289118,
      "learning_rate": 3.9410169336194884e-05,
      "loss": 1.4167,
      "num_input_tokens_seen": 27149724608,
      "step": 34508
    },
    {
      "epoch": 3.661043921069383,
      "grad_norm": 0.6775600451057721,
      "learning_rate": 3.940960142787911e-05,
      "loss": 1.4609,
      "num_input_tokens_seen": 27150511344,
      "step": 34509
    },
    {
      "epoch": 3.661150010608954,
      "grad_norm": 0.46179886892794364,
      "learning_rate": 3.9409033508428015e-05,
      "loss": 1.3537,
      "num_input_tokens_seen": 27151298144,
      "step": 34510
    },
    {
      "epoch": 3.6612561001485253,
      "grad_norm": 0.5482147064506773,
      "learning_rate": 3.9408465577842046e-05,
      "loss": 1.5078,
      "num_input_tokens_seen": 27152085024,
      "step": 34511
    },
    {
      "epoch": 3.661362189688097,
      "grad_norm": 0.45008341422559356,
      "learning_rate": 3.940789763612163e-05,
      "loss": 1.4246,
      "num_input_tokens_seen": 27152871712,
      "step": 34512
    },
    {
      "epoch": 3.6614682792276683,
      "grad_norm": 0.39979675758298416,
      "learning_rate": 3.940732968326722e-05,
      "loss": 1.4154,
      "num_input_tokens_seen": 27153658512,
      "step": 34513
    },
    {
      "epoch": 3.6615743687672397,
      "grad_norm": 0.43965002792988545,
      "learning_rate": 3.940676171927925e-05,
      "loss": 1.4893,
      "num_input_tokens_seen": 27154445200,
      "step": 34514
    },
    {
      "epoch": 3.6616804583068108,
      "grad_norm": 0.48314496200931006,
      "learning_rate": 3.940619374415815e-05,
      "loss": 1.4591,
      "num_input_tokens_seen": 27155231984,
      "step": 34515
    },
    {
      "epoch": 3.6617865478463822,
      "grad_norm": 0.4036023429001033,
      "learning_rate": 3.9405625757904376e-05,
      "loss": 1.5145,
      "num_input_tokens_seen": 27156018688,
      "step": 34516
    },
    {
      "epoch": 3.6618926373859537,
      "grad_norm": 0.6427770266346314,
      "learning_rate": 3.9405057760518346e-05,
      "loss": 1.4755,
      "num_input_tokens_seen": 27156805376,
      "step": 34517
    },
    {
      "epoch": 3.661998726925525,
      "grad_norm": 0.3939424909985752,
      "learning_rate": 3.9404489752000514e-05,
      "loss": 1.5106,
      "num_input_tokens_seen": 27157592176,
      "step": 34518
    },
    {
      "epoch": 3.6621048164650967,
      "grad_norm": 0.5274078376198907,
      "learning_rate": 3.9403921732351315e-05,
      "loss": 1.4152,
      "num_input_tokens_seen": 27158379056,
      "step": 34519
    },
    {
      "epoch": 3.6622109060046677,
      "grad_norm": 0.5098837420371142,
      "learning_rate": 3.940335370157119e-05,
      "loss": 1.4623,
      "num_input_tokens_seen": 27159165696,
      "step": 34520
    },
    {
      "epoch": 3.662316995544239,
      "grad_norm": 0.39273384695928265,
      "learning_rate": 3.940278565966058e-05,
      "loss": 1.479,
      "num_input_tokens_seen": 27159952496,
      "step": 34521
    },
    {
      "epoch": 3.6624230850838106,
      "grad_norm": 0.6501500076710645,
      "learning_rate": 3.940221760661991e-05,
      "loss": 1.4916,
      "num_input_tokens_seen": 27160739216,
      "step": 34522
    },
    {
      "epoch": 3.662529174623382,
      "grad_norm": 0.43666418565864995,
      "learning_rate": 3.9401649542449637e-05,
      "loss": 1.4247,
      "num_input_tokens_seen": 27161525968,
      "step": 34523
    },
    {
      "epoch": 3.6626352641629536,
      "grad_norm": 0.4272547372636589,
      "learning_rate": 3.940108146715019e-05,
      "loss": 1.5372,
      "num_input_tokens_seen": 27162312720,
      "step": 34524
    },
    {
      "epoch": 3.662741353702525,
      "grad_norm": 0.589996499411867,
      "learning_rate": 3.9400513380722e-05,
      "loss": 1.3956,
      "num_input_tokens_seen": 27163099552,
      "step": 34525
    },
    {
      "epoch": 3.6628474432420965,
      "grad_norm": 0.5019616695327225,
      "learning_rate": 3.939994528316553e-05,
      "loss": 1.4325,
      "num_input_tokens_seen": 27163886400,
      "step": 34526
    },
    {
      "epoch": 3.6629535327816676,
      "grad_norm": 0.5383425480943107,
      "learning_rate": 3.93993771744812e-05,
      "loss": 1.4583,
      "num_input_tokens_seen": 27164673136,
      "step": 34527
    },
    {
      "epoch": 3.663059622321239,
      "grad_norm": 0.501448482962326,
      "learning_rate": 3.939880905466945e-05,
      "loss": 1.4429,
      "num_input_tokens_seen": 27165459936,
      "step": 34528
    },
    {
      "epoch": 3.6631657118608105,
      "grad_norm": 0.4846619226747214,
      "learning_rate": 3.939824092373073e-05,
      "loss": 1.401,
      "num_input_tokens_seen": 27166246656,
      "step": 34529
    },
    {
      "epoch": 3.663271801400382,
      "grad_norm": 0.4936959542857652,
      "learning_rate": 3.9397672781665464e-05,
      "loss": 1.4426,
      "num_input_tokens_seen": 27167033536,
      "step": 34530
    },
    {
      "epoch": 3.6633778909399535,
      "grad_norm": 0.4553617239542759,
      "learning_rate": 3.93971046284741e-05,
      "loss": 1.3693,
      "num_input_tokens_seen": 27167820384,
      "step": 34531
    },
    {
      "epoch": 3.6634839804795245,
      "grad_norm": 0.4823209958939268,
      "learning_rate": 3.939653646415709e-05,
      "loss": 1.5359,
      "num_input_tokens_seen": 27168607104,
      "step": 34532
    },
    {
      "epoch": 3.663590070019096,
      "grad_norm": 0.4300654967262609,
      "learning_rate": 3.939596828871484e-05,
      "loss": 1.4637,
      "num_input_tokens_seen": 27169393840,
      "step": 34533
    },
    {
      "epoch": 3.6636961595586675,
      "grad_norm": 0.574560257972712,
      "learning_rate": 3.9395400102147815e-05,
      "loss": 1.5925,
      "num_input_tokens_seen": 27170180528,
      "step": 34534
    },
    {
      "epoch": 3.663802249098239,
      "grad_norm": 0.4378823069689712,
      "learning_rate": 3.939483190445645e-05,
      "loss": 1.3952,
      "num_input_tokens_seen": 27170967376,
      "step": 34535
    },
    {
      "epoch": 3.6639083386378104,
      "grad_norm": 0.514235083687692,
      "learning_rate": 3.939426369564118e-05,
      "loss": 1.409,
      "num_input_tokens_seen": 27171754176,
      "step": 34536
    },
    {
      "epoch": 3.6640144281773814,
      "grad_norm": 0.46560657395084054,
      "learning_rate": 3.939369547570244e-05,
      "loss": 1.4015,
      "num_input_tokens_seen": 27172540944,
      "step": 34537
    },
    {
      "epoch": 3.6641205177169534,
      "grad_norm": 0.38164259878874734,
      "learning_rate": 3.939312724464068e-05,
      "loss": 1.3655,
      "num_input_tokens_seen": 27173327824,
      "step": 34538
    },
    {
      "epoch": 3.6642266072565244,
      "grad_norm": 0.4420277773723173,
      "learning_rate": 3.9392559002456335e-05,
      "loss": 1.3178,
      "num_input_tokens_seen": 27174114576,
      "step": 34539
    },
    {
      "epoch": 3.664332696796096,
      "grad_norm": 0.5420193027129149,
      "learning_rate": 3.9391990749149845e-05,
      "loss": 1.5201,
      "num_input_tokens_seen": 27174901440,
      "step": 34540
    },
    {
      "epoch": 3.6644387863356673,
      "grad_norm": 0.5086115729792509,
      "learning_rate": 3.939142248472164e-05,
      "loss": 1.4406,
      "num_input_tokens_seen": 27175688176,
      "step": 34541
    },
    {
      "epoch": 3.664544875875239,
      "grad_norm": 0.5437295110559821,
      "learning_rate": 3.939085420917217e-05,
      "loss": 1.4936,
      "num_input_tokens_seen": 27176474880,
      "step": 34542
    },
    {
      "epoch": 3.6646509654148103,
      "grad_norm": 0.4747425075064383,
      "learning_rate": 3.939028592250186e-05,
      "loss": 1.4446,
      "num_input_tokens_seen": 27177261664,
      "step": 34543
    },
    {
      "epoch": 3.6647570549543813,
      "grad_norm": 0.5316096852689418,
      "learning_rate": 3.938971762471117e-05,
      "loss": 1.5486,
      "num_input_tokens_seen": 27178048448,
      "step": 34544
    },
    {
      "epoch": 3.664863144493953,
      "grad_norm": 0.4575353439707409,
      "learning_rate": 3.9389149315800526e-05,
      "loss": 1.4882,
      "num_input_tokens_seen": 27178835200,
      "step": 34545
    },
    {
      "epoch": 3.6649692340335243,
      "grad_norm": 0.4168479183093451,
      "learning_rate": 3.938858099577038e-05,
      "loss": 1.4484,
      "num_input_tokens_seen": 27179621952,
      "step": 34546
    },
    {
      "epoch": 3.6650753235730957,
      "grad_norm": 0.486592362742961,
      "learning_rate": 3.9388012664621145e-05,
      "loss": 1.4528,
      "num_input_tokens_seen": 27180408672,
      "step": 34547
    },
    {
      "epoch": 3.665181413112667,
      "grad_norm": 0.43658350782261657,
      "learning_rate": 3.938744432235327e-05,
      "loss": 1.3918,
      "num_input_tokens_seen": 27181195456,
      "step": 34548
    },
    {
      "epoch": 3.6652875026522382,
      "grad_norm": 0.5246136846860043,
      "learning_rate": 3.938687596896722e-05,
      "loss": 1.555,
      "num_input_tokens_seen": 27181982208,
      "step": 34549
    },
    {
      "epoch": 3.66539359219181,
      "grad_norm": 0.41092642882371966,
      "learning_rate": 3.9386307604463404e-05,
      "loss": 1.4563,
      "num_input_tokens_seen": 27182768976,
      "step": 34550
    },
    {
      "epoch": 3.665499681731381,
      "grad_norm": 0.6436009304718737,
      "learning_rate": 3.938573922884228e-05,
      "loss": 1.4154,
      "num_input_tokens_seen": 27183555776,
      "step": 34551
    },
    {
      "epoch": 3.6656057712709527,
      "grad_norm": 0.5602505504914751,
      "learning_rate": 3.938517084210427e-05,
      "loss": 1.5067,
      "num_input_tokens_seen": 27184342528,
      "step": 34552
    },
    {
      "epoch": 3.665711860810524,
      "grad_norm": 0.4762450943652466,
      "learning_rate": 3.9384602444249815e-05,
      "loss": 1.4017,
      "num_input_tokens_seen": 27185129344,
      "step": 34553
    },
    {
      "epoch": 3.6658179503500956,
      "grad_norm": 0.6129987785126056,
      "learning_rate": 3.938403403527938e-05,
      "loss": 1.4768,
      "num_input_tokens_seen": 27185916128,
      "step": 34554
    },
    {
      "epoch": 3.665924039889667,
      "grad_norm": 0.4772383366394174,
      "learning_rate": 3.938346561519337e-05,
      "loss": 1.5624,
      "num_input_tokens_seen": 27186702848,
      "step": 34555
    },
    {
      "epoch": 3.666030129429238,
      "grad_norm": 0.5226479393063639,
      "learning_rate": 3.938289718399225e-05,
      "loss": 1.5517,
      "num_input_tokens_seen": 27187489584,
      "step": 34556
    },
    {
      "epoch": 3.6661362189688096,
      "grad_norm": 0.5083732255394847,
      "learning_rate": 3.938232874167644e-05,
      "loss": 1.5439,
      "num_input_tokens_seen": 27188276272,
      "step": 34557
    },
    {
      "epoch": 3.666242308508381,
      "grad_norm": 0.5176539141125451,
      "learning_rate": 3.9381760288246396e-05,
      "loss": 1.5193,
      "num_input_tokens_seen": 27189063024,
      "step": 34558
    },
    {
      "epoch": 3.6663483980479525,
      "grad_norm": 0.5312925677545911,
      "learning_rate": 3.9381191823702547e-05,
      "loss": 1.4327,
      "num_input_tokens_seen": 27189849808,
      "step": 34559
    },
    {
      "epoch": 3.666454487587524,
      "grad_norm": 0.44178405223266226,
      "learning_rate": 3.938062334804534e-05,
      "loss": 1.4894,
      "num_input_tokens_seen": 27190636528,
      "step": 34560
    },
    {
      "epoch": 3.666560577127095,
      "grad_norm": 0.48912205432383565,
      "learning_rate": 3.93800548612752e-05,
      "loss": 1.4875,
      "num_input_tokens_seen": 27191423360,
      "step": 34561
    },
    {
      "epoch": 3.6666666666666665,
      "grad_norm": 0.4948298182120451,
      "learning_rate": 3.9379486363392584e-05,
      "loss": 1.4415,
      "num_input_tokens_seen": 27192210064,
      "step": 34562
    },
    {
      "epoch": 3.666772756206238,
      "grad_norm": 0.4527467903170911,
      "learning_rate": 3.937891785439791e-05,
      "loss": 1.402,
      "num_input_tokens_seen": 27192996832,
      "step": 34563
    },
    {
      "epoch": 3.6668788457458095,
      "grad_norm": 0.5492030128030145,
      "learning_rate": 3.9378349334291645e-05,
      "loss": 1.5488,
      "num_input_tokens_seen": 27193783536,
      "step": 34564
    },
    {
      "epoch": 3.666984935285381,
      "grad_norm": 0.4678808865096367,
      "learning_rate": 3.937778080307421e-05,
      "loss": 1.4941,
      "num_input_tokens_seen": 27194570240,
      "step": 34565
    },
    {
      "epoch": 3.6670910248249524,
      "grad_norm": 0.42996072005425834,
      "learning_rate": 3.937721226074604e-05,
      "loss": 1.3223,
      "num_input_tokens_seen": 27195357008,
      "step": 34566
    },
    {
      "epoch": 3.667197114364524,
      "grad_norm": 0.5434515173192608,
      "learning_rate": 3.937664370730758e-05,
      "loss": 1.5626,
      "num_input_tokens_seen": 27196143680,
      "step": 34567
    },
    {
      "epoch": 3.667303203904095,
      "grad_norm": 0.5039330317523214,
      "learning_rate": 3.937607514275928e-05,
      "loss": 1.5307,
      "num_input_tokens_seen": 27196930352,
      "step": 34568
    },
    {
      "epoch": 3.6674092934436664,
      "grad_norm": 0.46418713842227116,
      "learning_rate": 3.9375506567101574e-05,
      "loss": 1.5139,
      "num_input_tokens_seen": 27197717136,
      "step": 34569
    },
    {
      "epoch": 3.667515382983238,
      "grad_norm": 0.4719765841519063,
      "learning_rate": 3.937493798033489e-05,
      "loss": 1.5409,
      "num_input_tokens_seen": 27198503840,
      "step": 34570
    },
    {
      "epoch": 3.6676214725228093,
      "grad_norm": 0.5972915531268721,
      "learning_rate": 3.9374369382459684e-05,
      "loss": 1.5346,
      "num_input_tokens_seen": 27199290656,
      "step": 34571
    },
    {
      "epoch": 3.667727562062381,
      "grad_norm": 0.46569340441125373,
      "learning_rate": 3.937380077347639e-05,
      "loss": 1.3966,
      "num_input_tokens_seen": 27200077424,
      "step": 34572
    },
    {
      "epoch": 3.667833651601952,
      "grad_norm": 0.48347910270270056,
      "learning_rate": 3.9373232153385434e-05,
      "loss": 1.38,
      "num_input_tokens_seen": 27200864208,
      "step": 34573
    },
    {
      "epoch": 3.6679397411415233,
      "grad_norm": 0.417854954714717,
      "learning_rate": 3.937266352218727e-05,
      "loss": 1.3723,
      "num_input_tokens_seen": 27201650944,
      "step": 34574
    },
    {
      "epoch": 3.668045830681095,
      "grad_norm": 0.48523740277127103,
      "learning_rate": 3.9372094879882334e-05,
      "loss": 1.4654,
      "num_input_tokens_seen": 27202437728,
      "step": 34575
    },
    {
      "epoch": 3.6681519202206663,
      "grad_norm": 0.4980313720993158,
      "learning_rate": 3.937152622647106e-05,
      "loss": 1.3939,
      "num_input_tokens_seen": 27203224496,
      "step": 34576
    },
    {
      "epoch": 3.6682580097602377,
      "grad_norm": 0.4312093542646743,
      "learning_rate": 3.9370957561953894e-05,
      "loss": 1.5371,
      "num_input_tokens_seen": 27204011152,
      "step": 34577
    },
    {
      "epoch": 3.668364099299809,
      "grad_norm": 0.566824472207431,
      "learning_rate": 3.937038888633128e-05,
      "loss": 1.4915,
      "num_input_tokens_seen": 27204797888,
      "step": 34578
    },
    {
      "epoch": 3.6684701888393807,
      "grad_norm": 0.39349875426033504,
      "learning_rate": 3.9369820199603644e-05,
      "loss": 1.4233,
      "num_input_tokens_seen": 27205584736,
      "step": 34579
    },
    {
      "epoch": 3.6685762783789517,
      "grad_norm": 0.4931612396345943,
      "learning_rate": 3.936925150177143e-05,
      "loss": 1.4272,
      "num_input_tokens_seen": 27206371488,
      "step": 34580
    },
    {
      "epoch": 3.668682367918523,
      "grad_norm": 0.5484173123415598,
      "learning_rate": 3.9368682792835096e-05,
      "loss": 1.4432,
      "num_input_tokens_seen": 27207158272,
      "step": 34581
    },
    {
      "epoch": 3.6687884574580947,
      "grad_norm": 0.4424876048912804,
      "learning_rate": 3.9368114072795047e-05,
      "loss": 1.5686,
      "num_input_tokens_seen": 27207945008,
      "step": 34582
    },
    {
      "epoch": 3.668894546997666,
      "grad_norm": 0.5882882071598792,
      "learning_rate": 3.936754534165175e-05,
      "loss": 1.5026,
      "num_input_tokens_seen": 27208731792,
      "step": 34583
    },
    {
      "epoch": 3.6690006365372376,
      "grad_norm": 0.458189650970686,
      "learning_rate": 3.9366976599405635e-05,
      "loss": 1.4882,
      "num_input_tokens_seen": 27209518448,
      "step": 34584
    },
    {
      "epoch": 3.6691067260768087,
      "grad_norm": 0.46769116546478395,
      "learning_rate": 3.936640784605714e-05,
      "loss": 1.4905,
      "num_input_tokens_seen": 27210305120,
      "step": 34585
    },
    {
      "epoch": 3.66921281561638,
      "grad_norm": 0.42262376172436994,
      "learning_rate": 3.9365839081606713e-05,
      "loss": 1.4825,
      "num_input_tokens_seen": 27211091968,
      "step": 34586
    },
    {
      "epoch": 3.6693189051559516,
      "grad_norm": 0.5102719652664963,
      "learning_rate": 3.936527030605478e-05,
      "loss": 1.5168,
      "num_input_tokens_seen": 27211878672,
      "step": 34587
    },
    {
      "epoch": 3.669424994695523,
      "grad_norm": 0.4260374469752251,
      "learning_rate": 3.936470151940179e-05,
      "loss": 1.4014,
      "num_input_tokens_seen": 27212665424,
      "step": 34588
    },
    {
      "epoch": 3.6695310842350946,
      "grad_norm": 0.4215672195737435,
      "learning_rate": 3.9364132721648184e-05,
      "loss": 1.5065,
      "num_input_tokens_seen": 27213452208,
      "step": 34589
    },
    {
      "epoch": 3.6696371737746656,
      "grad_norm": 0.45948334795939,
      "learning_rate": 3.9363563912794386e-05,
      "loss": 1.452,
      "num_input_tokens_seen": 27214238960,
      "step": 34590
    },
    {
      "epoch": 3.669743263314237,
      "grad_norm": 0.40330567354579394,
      "learning_rate": 3.936299509284086e-05,
      "loss": 1.49,
      "num_input_tokens_seen": 27215025824,
      "step": 34591
    },
    {
      "epoch": 3.6698493528538085,
      "grad_norm": 0.43279166464743213,
      "learning_rate": 3.936242626178803e-05,
      "loss": 1.4399,
      "num_input_tokens_seen": 27215812624,
      "step": 34592
    },
    {
      "epoch": 3.66995544239338,
      "grad_norm": 0.48586279682854244,
      "learning_rate": 3.936185741963633e-05,
      "loss": 1.6315,
      "num_input_tokens_seen": 27216599312,
      "step": 34593
    },
    {
      "epoch": 3.6700615319329515,
      "grad_norm": 0.4490348512005472,
      "learning_rate": 3.936128856638621e-05,
      "loss": 1.513,
      "num_input_tokens_seen": 27217386112,
      "step": 34594
    },
    {
      "epoch": 3.670167621472523,
      "grad_norm": 0.44662231741442127,
      "learning_rate": 3.936071970203812e-05,
      "loss": 1.4553,
      "num_input_tokens_seen": 27218172816,
      "step": 34595
    },
    {
      "epoch": 3.6702737110120944,
      "grad_norm": 0.4083727073719932,
      "learning_rate": 3.9360150826592476e-05,
      "loss": 1.4638,
      "num_input_tokens_seen": 27218959600,
      "step": 34596
    },
    {
      "epoch": 3.6703798005516655,
      "grad_norm": 0.37266851007732893,
      "learning_rate": 3.935958194004973e-05,
      "loss": 1.4268,
      "num_input_tokens_seen": 27219746352,
      "step": 34597
    },
    {
      "epoch": 3.670485890091237,
      "grad_norm": 0.43009664161716904,
      "learning_rate": 3.935901304241032e-05,
      "loss": 1.393,
      "num_input_tokens_seen": 27220533088,
      "step": 34598
    },
    {
      "epoch": 3.6705919796308084,
      "grad_norm": 0.419054648612902,
      "learning_rate": 3.9358444133674694e-05,
      "loss": 1.5302,
      "num_input_tokens_seen": 27221319904,
      "step": 34599
    },
    {
      "epoch": 3.67069806917038,
      "grad_norm": 0.6712652262684158,
      "learning_rate": 3.9357875213843276e-05,
      "loss": 1.6356,
      "num_input_tokens_seen": 27222106624,
      "step": 34600
    },
    {
      "epoch": 3.6708041587099514,
      "grad_norm": 0.4370430279759496,
      "learning_rate": 3.935730628291652e-05,
      "loss": 1.5187,
      "num_input_tokens_seen": 27222893456,
      "step": 34601
    },
    {
      "epoch": 3.6709102482495224,
      "grad_norm": 0.6254130963813306,
      "learning_rate": 3.935673734089485e-05,
      "loss": 1.5154,
      "num_input_tokens_seen": 27223680192,
      "step": 34602
    },
    {
      "epoch": 3.671016337789094,
      "grad_norm": 0.4393300514668003,
      "learning_rate": 3.935616838777872e-05,
      "loss": 1.4814,
      "num_input_tokens_seen": 27224466864,
      "step": 34603
    },
    {
      "epoch": 3.6711224273286653,
      "grad_norm": 0.6524232235684572,
      "learning_rate": 3.935559942356856e-05,
      "loss": 1.4552,
      "num_input_tokens_seen": 27225253616,
      "step": 34604
    },
    {
      "epoch": 3.671228516868237,
      "grad_norm": 0.3902244117457652,
      "learning_rate": 3.935503044826482e-05,
      "loss": 1.387,
      "num_input_tokens_seen": 27226040400,
      "step": 34605
    },
    {
      "epoch": 3.6713346064078083,
      "grad_norm": 0.4772451778708784,
      "learning_rate": 3.9354461461867934e-05,
      "loss": 1.5009,
      "num_input_tokens_seen": 27226827168,
      "step": 34606
    },
    {
      "epoch": 3.6714406959473793,
      "grad_norm": 0.5075924580597901,
      "learning_rate": 3.9353892464378326e-05,
      "loss": 1.5306,
      "num_input_tokens_seen": 27227613840,
      "step": 34607
    },
    {
      "epoch": 3.6715467854869512,
      "grad_norm": 0.41749844243867196,
      "learning_rate": 3.935332345579646e-05,
      "loss": 1.5356,
      "num_input_tokens_seen": 27228400560,
      "step": 34608
    },
    {
      "epoch": 3.6716528750265223,
      "grad_norm": 0.5842593243186732,
      "learning_rate": 3.935275443612277e-05,
      "loss": 1.4961,
      "num_input_tokens_seen": 27229187424,
      "step": 34609
    },
    {
      "epoch": 3.6717589645660937,
      "grad_norm": 0.4481543510667262,
      "learning_rate": 3.93521854053577e-05,
      "loss": 1.4153,
      "num_input_tokens_seen": 27229974176,
      "step": 34610
    },
    {
      "epoch": 3.671865054105665,
      "grad_norm": 0.46158136550230294,
      "learning_rate": 3.935161636350168e-05,
      "loss": 1.5274,
      "num_input_tokens_seen": 27230760928,
      "step": 34611
    },
    {
      "epoch": 3.6719711436452367,
      "grad_norm": 0.42408591227492903,
      "learning_rate": 3.935104731055514e-05,
      "loss": 1.4151,
      "num_input_tokens_seen": 27231547616,
      "step": 34612
    },
    {
      "epoch": 3.672077233184808,
      "grad_norm": 0.4209198086080995,
      "learning_rate": 3.935047824651854e-05,
      "loss": 1.5044,
      "num_input_tokens_seen": 27232334256,
      "step": 34613
    },
    {
      "epoch": 3.672183322724379,
      "grad_norm": 0.3834729666598018,
      "learning_rate": 3.9349909171392304e-05,
      "loss": 1.3953,
      "num_input_tokens_seen": 27233121088,
      "step": 34614
    },
    {
      "epoch": 3.6722894122639507,
      "grad_norm": 0.48555953183995676,
      "learning_rate": 3.934934008517689e-05,
      "loss": 1.6164,
      "num_input_tokens_seen": 27233907840,
      "step": 34615
    },
    {
      "epoch": 3.672395501803522,
      "grad_norm": 0.4051806876507273,
      "learning_rate": 3.934877098787272e-05,
      "loss": 1.3489,
      "num_input_tokens_seen": 27234694672,
      "step": 34616
    },
    {
      "epoch": 3.6725015913430936,
      "grad_norm": 0.4774463975837439,
      "learning_rate": 3.934820187948024e-05,
      "loss": 1.4564,
      "num_input_tokens_seen": 27235481456,
      "step": 34617
    },
    {
      "epoch": 3.672607680882665,
      "grad_norm": 0.4804810424550898,
      "learning_rate": 3.9347632759999895e-05,
      "loss": 1.5682,
      "num_input_tokens_seen": 27236268160,
      "step": 34618
    },
    {
      "epoch": 3.672713770422236,
      "grad_norm": 0.5399538591865871,
      "learning_rate": 3.934706362943212e-05,
      "loss": 1.6234,
      "num_input_tokens_seen": 27237054864,
      "step": 34619
    },
    {
      "epoch": 3.672819859961808,
      "grad_norm": 0.45675328377468744,
      "learning_rate": 3.934649448777735e-05,
      "loss": 1.5839,
      "num_input_tokens_seen": 27237841536,
      "step": 34620
    },
    {
      "epoch": 3.672925949501379,
      "grad_norm": 0.5416231208081008,
      "learning_rate": 3.9345925335036036e-05,
      "loss": 1.4973,
      "num_input_tokens_seen": 27238628288,
      "step": 34621
    },
    {
      "epoch": 3.6730320390409505,
      "grad_norm": 0.48218578185882877,
      "learning_rate": 3.934535617120861e-05,
      "loss": 1.437,
      "num_input_tokens_seen": 27239414960,
      "step": 34622
    },
    {
      "epoch": 3.673138128580522,
      "grad_norm": 0.5100693959316397,
      "learning_rate": 3.934478699629551e-05,
      "loss": 1.5079,
      "num_input_tokens_seen": 27240201760,
      "step": 34623
    },
    {
      "epoch": 3.6732442181200935,
      "grad_norm": 0.533136489183656,
      "learning_rate": 3.934421781029719e-05,
      "loss": 1.4406,
      "num_input_tokens_seen": 27240988592,
      "step": 34624
    },
    {
      "epoch": 3.673350307659665,
      "grad_norm": 0.6117034537420357,
      "learning_rate": 3.934364861321407e-05,
      "loss": 1.4336,
      "num_input_tokens_seen": 27241775328,
      "step": 34625
    },
    {
      "epoch": 3.673456397199236,
      "grad_norm": 0.5023346856034283,
      "learning_rate": 3.9343079405046604e-05,
      "loss": 1.4408,
      "num_input_tokens_seen": 27242562048,
      "step": 34626
    },
    {
      "epoch": 3.6735624867388075,
      "grad_norm": 0.5971100331405859,
      "learning_rate": 3.9342510185795226e-05,
      "loss": 1.6085,
      "num_input_tokens_seen": 27243348800,
      "step": 34627
    },
    {
      "epoch": 3.673668576278379,
      "grad_norm": 0.4470050964898837,
      "learning_rate": 3.9341940955460374e-05,
      "loss": 1.4998,
      "num_input_tokens_seen": 27244135616,
      "step": 34628
    },
    {
      "epoch": 3.6737746658179504,
      "grad_norm": 0.5312014381739648,
      "learning_rate": 3.934137171404249e-05,
      "loss": 1.4823,
      "num_input_tokens_seen": 27244922368,
      "step": 34629
    },
    {
      "epoch": 3.673880755357522,
      "grad_norm": 0.5963925003865856,
      "learning_rate": 3.934080246154201e-05,
      "loss": 1.4721,
      "num_input_tokens_seen": 27245709104,
      "step": 34630
    },
    {
      "epoch": 3.673986844897093,
      "grad_norm": 0.5478245565310638,
      "learning_rate": 3.9340233197959396e-05,
      "loss": 1.3815,
      "num_input_tokens_seen": 27246495824,
      "step": 34631
    },
    {
      "epoch": 3.6740929344366644,
      "grad_norm": 0.5440104894993154,
      "learning_rate": 3.9339663923295055e-05,
      "loss": 1.4724,
      "num_input_tokens_seen": 27247282528,
      "step": 34632
    },
    {
      "epoch": 3.674199023976236,
      "grad_norm": 0.5242529557663184,
      "learning_rate": 3.933909463754945e-05,
      "loss": 1.5292,
      "num_input_tokens_seen": 27248069312,
      "step": 34633
    },
    {
      "epoch": 3.6743051135158074,
      "grad_norm": 0.6092277223555163,
      "learning_rate": 3.933852534072301e-05,
      "loss": 1.4218,
      "num_input_tokens_seen": 27248856080,
      "step": 34634
    },
    {
      "epoch": 3.674411203055379,
      "grad_norm": 0.474374143129247,
      "learning_rate": 3.933795603281618e-05,
      "loss": 1.4817,
      "num_input_tokens_seen": 27249642800,
      "step": 34635
    },
    {
      "epoch": 3.6745172925949503,
      "grad_norm": 0.45292431598080213,
      "learning_rate": 3.93373867138294e-05,
      "loss": 1.3405,
      "num_input_tokens_seen": 27250429744,
      "step": 34636
    },
    {
      "epoch": 3.6746233821345218,
      "grad_norm": 0.536627270869443,
      "learning_rate": 3.93368173837631e-05,
      "loss": 1.5523,
      "num_input_tokens_seen": 27251216480,
      "step": 34637
    },
    {
      "epoch": 3.674729471674093,
      "grad_norm": 0.5226946960600475,
      "learning_rate": 3.933624804261774e-05,
      "loss": 1.4801,
      "num_input_tokens_seen": 27252003200,
      "step": 34638
    },
    {
      "epoch": 3.6748355612136643,
      "grad_norm": 0.49294468126051494,
      "learning_rate": 3.933567869039374e-05,
      "loss": 1.5306,
      "num_input_tokens_seen": 27252789984,
      "step": 34639
    },
    {
      "epoch": 3.6749416507532358,
      "grad_norm": 0.4287281564244738,
      "learning_rate": 3.933510932709156e-05,
      "loss": 1.4794,
      "num_input_tokens_seen": 27253576720,
      "step": 34640
    },
    {
      "epoch": 3.6750477402928072,
      "grad_norm": 0.421546921834924,
      "learning_rate": 3.933453995271161e-05,
      "loss": 1.4254,
      "num_input_tokens_seen": 27254363488,
      "step": 34641
    },
    {
      "epoch": 3.6751538298323787,
      "grad_norm": 0.3980850178642188,
      "learning_rate": 3.9333970567254364e-05,
      "loss": 1.341,
      "num_input_tokens_seen": 27255150256,
      "step": 34642
    },
    {
      "epoch": 3.6752599193719497,
      "grad_norm": 0.5498236592414117,
      "learning_rate": 3.933340117072024e-05,
      "loss": 1.4638,
      "num_input_tokens_seen": 27255937072,
      "step": 34643
    },
    {
      "epoch": 3.675366008911521,
      "grad_norm": 0.4992918262411879,
      "learning_rate": 3.933283176310968e-05,
      "loss": 1.5126,
      "num_input_tokens_seen": 27256723824,
      "step": 34644
    },
    {
      "epoch": 3.6754720984510927,
      "grad_norm": 0.5917174358068056,
      "learning_rate": 3.933226234442313e-05,
      "loss": 1.5123,
      "num_input_tokens_seen": 27257510560,
      "step": 34645
    },
    {
      "epoch": 3.675578187990664,
      "grad_norm": 0.43161700620664023,
      "learning_rate": 3.933169291466103e-05,
      "loss": 1.4262,
      "num_input_tokens_seen": 27258297296,
      "step": 34646
    },
    {
      "epoch": 3.6756842775302356,
      "grad_norm": 0.5619477060490542,
      "learning_rate": 3.933112347382382e-05,
      "loss": 1.4699,
      "num_input_tokens_seen": 27259084064,
      "step": 34647
    },
    {
      "epoch": 3.6757903670698067,
      "grad_norm": 0.4030759725792815,
      "learning_rate": 3.9330554021911936e-05,
      "loss": 1.5262,
      "num_input_tokens_seen": 27259870864,
      "step": 34648
    },
    {
      "epoch": 3.6758964566093786,
      "grad_norm": 0.5494166578049339,
      "learning_rate": 3.932998455892582e-05,
      "loss": 1.4804,
      "num_input_tokens_seen": 27260657664,
      "step": 34649
    },
    {
      "epoch": 3.6760025461489496,
      "grad_norm": 0.4740718523505883,
      "learning_rate": 3.932941508486591e-05,
      "loss": 1.4731,
      "num_input_tokens_seen": 27261444352,
      "step": 34650
    },
    {
      "epoch": 3.676108635688521,
      "grad_norm": 0.49089439472226887,
      "learning_rate": 3.932884559973265e-05,
      "loss": 1.4378,
      "num_input_tokens_seen": 27262231088,
      "step": 34651
    },
    {
      "epoch": 3.6762147252280926,
      "grad_norm": 0.40042205584572865,
      "learning_rate": 3.932827610352648e-05,
      "loss": 1.4407,
      "num_input_tokens_seen": 27263017920,
      "step": 34652
    },
    {
      "epoch": 3.676320814767664,
      "grad_norm": 0.37693851135116585,
      "learning_rate": 3.932770659624784e-05,
      "loss": 1.4026,
      "num_input_tokens_seen": 27263804720,
      "step": 34653
    },
    {
      "epoch": 3.6764269043072355,
      "grad_norm": 0.381343324261006,
      "learning_rate": 3.932713707789717e-05,
      "loss": 1.469,
      "num_input_tokens_seen": 27264591472,
      "step": 34654
    },
    {
      "epoch": 3.6765329938468065,
      "grad_norm": 0.4528498120645327,
      "learning_rate": 3.93265675484749e-05,
      "loss": 1.432,
      "num_input_tokens_seen": 27265378272,
      "step": 34655
    },
    {
      "epoch": 3.676639083386378,
      "grad_norm": 0.5155320596302441,
      "learning_rate": 3.9325998007981494e-05,
      "loss": 1.5032,
      "num_input_tokens_seen": 27266165040,
      "step": 34656
    },
    {
      "epoch": 3.6767451729259495,
      "grad_norm": 0.4571888735664991,
      "learning_rate": 3.932542845641736e-05,
      "loss": 1.4775,
      "num_input_tokens_seen": 27266951808,
      "step": 34657
    },
    {
      "epoch": 3.676851262465521,
      "grad_norm": 0.37348078130518464,
      "learning_rate": 3.9324858893782964e-05,
      "loss": 1.5017,
      "num_input_tokens_seen": 27267738608,
      "step": 34658
    },
    {
      "epoch": 3.6769573520050924,
      "grad_norm": 0.6973329635547729,
      "learning_rate": 3.932428932007873e-05,
      "loss": 1.5904,
      "num_input_tokens_seen": 27268525312,
      "step": 34659
    },
    {
      "epoch": 3.6770634415446635,
      "grad_norm": 0.37210437242401373,
      "learning_rate": 3.932371973530512e-05,
      "loss": 1.4721,
      "num_input_tokens_seen": 27269312080,
      "step": 34660
    },
    {
      "epoch": 3.677169531084235,
      "grad_norm": 0.6328846426537015,
      "learning_rate": 3.932315013946255e-05,
      "loss": 1.6062,
      "num_input_tokens_seen": 27270098848,
      "step": 34661
    },
    {
      "epoch": 3.6772756206238064,
      "grad_norm": 0.4407415576714835,
      "learning_rate": 3.932258053255147e-05,
      "loss": 1.3867,
      "num_input_tokens_seen": 27270885632,
      "step": 34662
    },
    {
      "epoch": 3.677381710163378,
      "grad_norm": 0.5403548628528976,
      "learning_rate": 3.932201091457232e-05,
      "loss": 1.4978,
      "num_input_tokens_seen": 27271672512,
      "step": 34663
    },
    {
      "epoch": 3.6774877997029494,
      "grad_norm": 0.36634545078536335,
      "learning_rate": 3.932144128552555e-05,
      "loss": 1.2588,
      "num_input_tokens_seen": 27272459296,
      "step": 34664
    },
    {
      "epoch": 3.677593889242521,
      "grad_norm": 0.4577713945890248,
      "learning_rate": 3.932087164541158e-05,
      "loss": 1.4107,
      "num_input_tokens_seen": 27273246032,
      "step": 34665
    },
    {
      "epoch": 3.6776999787820923,
      "grad_norm": 0.4815067165192338,
      "learning_rate": 3.9320301994230854e-05,
      "loss": 1.5342,
      "num_input_tokens_seen": 27274032800,
      "step": 34666
    },
    {
      "epoch": 3.6778060683216633,
      "grad_norm": 0.48090283320698374,
      "learning_rate": 3.931973233198384e-05,
      "loss": 1.4602,
      "num_input_tokens_seen": 27274819552,
      "step": 34667
    },
    {
      "epoch": 3.677912157861235,
      "grad_norm": 0.4906686569349625,
      "learning_rate": 3.931916265867094e-05,
      "loss": 1.4785,
      "num_input_tokens_seen": 27275606208,
      "step": 34668
    },
    {
      "epoch": 3.6780182474008063,
      "grad_norm": 0.37104513059742916,
      "learning_rate": 3.931859297429261e-05,
      "loss": 1.3974,
      "num_input_tokens_seen": 27276393040,
      "step": 34669
    },
    {
      "epoch": 3.6781243369403778,
      "grad_norm": 0.4232926092498456,
      "learning_rate": 3.9318023278849306e-05,
      "loss": 1.5263,
      "num_input_tokens_seen": 27277179728,
      "step": 34670
    },
    {
      "epoch": 3.6782304264799492,
      "grad_norm": 0.405803970109636,
      "learning_rate": 3.9317453572341446e-05,
      "loss": 1.4646,
      "num_input_tokens_seen": 27277966416,
      "step": 34671
    },
    {
      "epoch": 3.6783365160195203,
      "grad_norm": 0.47352815610712923,
      "learning_rate": 3.931688385476947e-05,
      "loss": 1.4983,
      "num_input_tokens_seen": 27278753168,
      "step": 34672
    },
    {
      "epoch": 3.6784426055590917,
      "grad_norm": 0.4202431228138019,
      "learning_rate": 3.931631412613384e-05,
      "loss": 1.3836,
      "num_input_tokens_seen": 27279539920,
      "step": 34673
    },
    {
      "epoch": 3.6785486950986632,
      "grad_norm": 0.36777890107169103,
      "learning_rate": 3.931574438643497e-05,
      "loss": 1.3949,
      "num_input_tokens_seen": 27280326656,
      "step": 34674
    },
    {
      "epoch": 3.6786547846382347,
      "grad_norm": 0.40070520392252174,
      "learning_rate": 3.9315174635673326e-05,
      "loss": 1.5023,
      "num_input_tokens_seen": 27281113376,
      "step": 34675
    },
    {
      "epoch": 3.678760874177806,
      "grad_norm": 0.4321433415529205,
      "learning_rate": 3.931460487384933e-05,
      "loss": 1.4713,
      "num_input_tokens_seen": 27281900144,
      "step": 34676
    },
    {
      "epoch": 3.678866963717377,
      "grad_norm": 0.41667497284952326,
      "learning_rate": 3.931403510096342e-05,
      "loss": 1.4925,
      "num_input_tokens_seen": 27282686896,
      "step": 34677
    },
    {
      "epoch": 3.678973053256949,
      "grad_norm": 0.4336847948088452,
      "learning_rate": 3.9313465317016046e-05,
      "loss": 1.365,
      "num_input_tokens_seen": 27283473648,
      "step": 34678
    },
    {
      "epoch": 3.67907914279652,
      "grad_norm": 0.41297675150267865,
      "learning_rate": 3.931289552200765e-05,
      "loss": 1.4233,
      "num_input_tokens_seen": 27284260400,
      "step": 34679
    },
    {
      "epoch": 3.6791852323360916,
      "grad_norm": 0.44512726160196153,
      "learning_rate": 3.931232571593866e-05,
      "loss": 1.4476,
      "num_input_tokens_seen": 27285047168,
      "step": 34680
    },
    {
      "epoch": 3.679291321875663,
      "grad_norm": 0.4193519414133756,
      "learning_rate": 3.931175589880954e-05,
      "loss": 1.5745,
      "num_input_tokens_seen": 27285833904,
      "step": 34681
    },
    {
      "epoch": 3.6793974114152346,
      "grad_norm": 0.4072592718054353,
      "learning_rate": 3.931118607062071e-05,
      "loss": 1.3766,
      "num_input_tokens_seen": 27286620752,
      "step": 34682
    },
    {
      "epoch": 3.679503500954806,
      "grad_norm": 0.4711255725744656,
      "learning_rate": 3.9310616231372606e-05,
      "loss": 1.5198,
      "num_input_tokens_seen": 27287407488,
      "step": 34683
    },
    {
      "epoch": 3.679609590494377,
      "grad_norm": 0.47449640172723134,
      "learning_rate": 3.931004638106568e-05,
      "loss": 1.6125,
      "num_input_tokens_seen": 27288194192,
      "step": 34684
    },
    {
      "epoch": 3.6797156800339486,
      "grad_norm": 0.41442072565540633,
      "learning_rate": 3.930947651970038e-05,
      "loss": 1.3334,
      "num_input_tokens_seen": 27288980912,
      "step": 34685
    },
    {
      "epoch": 3.67982176957352,
      "grad_norm": 0.4044558684816665,
      "learning_rate": 3.930890664727713e-05,
      "loss": 1.2966,
      "num_input_tokens_seen": 27289767680,
      "step": 34686
    },
    {
      "epoch": 3.6799278591130915,
      "grad_norm": 0.4827462127608115,
      "learning_rate": 3.930833676379637e-05,
      "loss": 1.3903,
      "num_input_tokens_seen": 27290554544,
      "step": 34687
    },
    {
      "epoch": 3.680033948652663,
      "grad_norm": 0.4467730028590742,
      "learning_rate": 3.930776686925856e-05,
      "loss": 1.4401,
      "num_input_tokens_seen": 27291341408,
      "step": 34688
    },
    {
      "epoch": 3.680140038192234,
      "grad_norm": 0.4534056383102413,
      "learning_rate": 3.930719696366412e-05,
      "loss": 1.4587,
      "num_input_tokens_seen": 27292128176,
      "step": 34689
    },
    {
      "epoch": 3.6802461277318055,
      "grad_norm": 0.4346230323488975,
      "learning_rate": 3.93066270470135e-05,
      "loss": 1.4311,
      "num_input_tokens_seen": 27292914992,
      "step": 34690
    },
    {
      "epoch": 3.680352217271377,
      "grad_norm": 0.6530497884629829,
      "learning_rate": 3.930605711930714e-05,
      "loss": 1.4202,
      "num_input_tokens_seen": 27293701760,
      "step": 34691
    },
    {
      "epoch": 3.6804583068109484,
      "grad_norm": 0.6926958145780191,
      "learning_rate": 3.9305487180545475e-05,
      "loss": 1.5376,
      "num_input_tokens_seen": 27294488432,
      "step": 34692
    },
    {
      "epoch": 3.68056439635052,
      "grad_norm": 0.40738100716733755,
      "learning_rate": 3.930491723072895e-05,
      "loss": 1.455,
      "num_input_tokens_seen": 27295275152,
      "step": 34693
    },
    {
      "epoch": 3.6806704858900914,
      "grad_norm": 0.48549016037993875,
      "learning_rate": 3.930434726985801e-05,
      "loss": 1.4381,
      "num_input_tokens_seen": 27296061952,
      "step": 34694
    },
    {
      "epoch": 3.680776575429663,
      "grad_norm": 0.42059947798230946,
      "learning_rate": 3.9303777297933084e-05,
      "loss": 1.4394,
      "num_input_tokens_seen": 27296848832,
      "step": 34695
    },
    {
      "epoch": 3.680882664969234,
      "grad_norm": 0.4102237571300604,
      "learning_rate": 3.930320731495462e-05,
      "loss": 1.424,
      "num_input_tokens_seen": 27297635680,
      "step": 34696
    },
    {
      "epoch": 3.6809887545088054,
      "grad_norm": 0.41252069261912044,
      "learning_rate": 3.930263732092306e-05,
      "loss": 1.4641,
      "num_input_tokens_seen": 27298422400,
      "step": 34697
    },
    {
      "epoch": 3.681094844048377,
      "grad_norm": 0.4211807020202793,
      "learning_rate": 3.930206731583884e-05,
      "loss": 1.4381,
      "num_input_tokens_seen": 27299209136,
      "step": 34698
    },
    {
      "epoch": 3.6812009335879483,
      "grad_norm": 0.4137558804535554,
      "learning_rate": 3.93014972997024e-05,
      "loss": 1.4538,
      "num_input_tokens_seen": 27299995856,
      "step": 34699
    },
    {
      "epoch": 3.68130702312752,
      "grad_norm": 0.397296736927756,
      "learning_rate": 3.9300927272514184e-05,
      "loss": 1.3863,
      "num_input_tokens_seen": 27300782672,
      "step": 34700
    },
    {
      "epoch": 3.681413112667091,
      "grad_norm": 0.40835747326253463,
      "learning_rate": 3.930035723427463e-05,
      "loss": 1.4877,
      "num_input_tokens_seen": 27301569360,
      "step": 34701
    },
    {
      "epoch": 3.6815192022066623,
      "grad_norm": 0.4255860329870016,
      "learning_rate": 3.929978718498418e-05,
      "loss": 1.4941,
      "num_input_tokens_seen": 27302356160,
      "step": 34702
    },
    {
      "epoch": 3.6816252917462338,
      "grad_norm": 0.44344824339353617,
      "learning_rate": 3.9299217124643275e-05,
      "loss": 1.4919,
      "num_input_tokens_seen": 27303142992,
      "step": 34703
    },
    {
      "epoch": 3.6817313812858052,
      "grad_norm": 0.47100368736681847,
      "learning_rate": 3.9298647053252343e-05,
      "loss": 1.5423,
      "num_input_tokens_seen": 27303929776,
      "step": 34704
    },
    {
      "epoch": 3.6818374708253767,
      "grad_norm": 0.3945438761001702,
      "learning_rate": 3.9298076970811854e-05,
      "loss": 1.3996,
      "num_input_tokens_seen": 27304716512,
      "step": 34705
    },
    {
      "epoch": 3.6819435603649477,
      "grad_norm": 0.46285705831547497,
      "learning_rate": 3.929750687732222e-05,
      "loss": 1.4353,
      "num_input_tokens_seen": 27305503280,
      "step": 34706
    },
    {
      "epoch": 3.6820496499045197,
      "grad_norm": 0.4251595647141997,
      "learning_rate": 3.92969367727839e-05,
      "loss": 1.5254,
      "num_input_tokens_seen": 27306290032,
      "step": 34707
    },
    {
      "epoch": 3.6821557394440907,
      "grad_norm": 0.4563242410166381,
      "learning_rate": 3.9296366657197325e-05,
      "loss": 1.4408,
      "num_input_tokens_seen": 27307076896,
      "step": 34708
    },
    {
      "epoch": 3.682261828983662,
      "grad_norm": 0.45730280340932195,
      "learning_rate": 3.929579653056293e-05,
      "loss": 1.4442,
      "num_input_tokens_seen": 27307863632,
      "step": 34709
    },
    {
      "epoch": 3.6823679185232336,
      "grad_norm": 0.4163534790561818,
      "learning_rate": 3.929522639288117e-05,
      "loss": 1.3964,
      "num_input_tokens_seen": 27308650496,
      "step": 34710
    },
    {
      "epoch": 3.682474008062805,
      "grad_norm": 0.44230881342147316,
      "learning_rate": 3.929465624415247e-05,
      "loss": 1.3858,
      "num_input_tokens_seen": 27309437232,
      "step": 34711
    },
    {
      "epoch": 3.6825800976023766,
      "grad_norm": 0.4527458084970406,
      "learning_rate": 3.929408608437729e-05,
      "loss": 1.5301,
      "num_input_tokens_seen": 27310223968,
      "step": 34712
    },
    {
      "epoch": 3.6826861871419476,
      "grad_norm": 0.39499810026082693,
      "learning_rate": 3.9293515913556056e-05,
      "loss": 1.3657,
      "num_input_tokens_seen": 27311010736,
      "step": 34713
    },
    {
      "epoch": 3.682792276681519,
      "grad_norm": 0.44825056597656376,
      "learning_rate": 3.929294573168921e-05,
      "loss": 1.3458,
      "num_input_tokens_seen": 27311797536,
      "step": 34714
    },
    {
      "epoch": 3.6828983662210906,
      "grad_norm": 0.43684190266397305,
      "learning_rate": 3.92923755387772e-05,
      "loss": 1.5187,
      "num_input_tokens_seen": 27312584272,
      "step": 34715
    },
    {
      "epoch": 3.683004455760662,
      "grad_norm": 0.43231085985660694,
      "learning_rate": 3.929180533482045e-05,
      "loss": 1.5098,
      "num_input_tokens_seen": 27313370992,
      "step": 34716
    },
    {
      "epoch": 3.6831105453002335,
      "grad_norm": 0.40927075543461283,
      "learning_rate": 3.929123511981943e-05,
      "loss": 1.323,
      "num_input_tokens_seen": 27314157856,
      "step": 34717
    },
    {
      "epoch": 3.6832166348398045,
      "grad_norm": 0.4404175792084373,
      "learning_rate": 3.929066489377455e-05,
      "loss": 1.382,
      "num_input_tokens_seen": 27314944672,
      "step": 34718
    },
    {
      "epoch": 3.6833227243793765,
      "grad_norm": 0.40957868772528955,
      "learning_rate": 3.929009465668627e-05,
      "loss": 1.3661,
      "num_input_tokens_seen": 27315731456,
      "step": 34719
    },
    {
      "epoch": 3.6834288139189475,
      "grad_norm": 0.44275523688263174,
      "learning_rate": 3.9289524408555015e-05,
      "loss": 1.4002,
      "num_input_tokens_seen": 27316518272,
      "step": 34720
    },
    {
      "epoch": 3.683534903458519,
      "grad_norm": 0.4091141756960103,
      "learning_rate": 3.9288954149381243e-05,
      "loss": 1.513,
      "num_input_tokens_seen": 27317304976,
      "step": 34721
    },
    {
      "epoch": 3.6836409929980904,
      "grad_norm": 0.397146217430085,
      "learning_rate": 3.928838387916538e-05,
      "loss": 1.5082,
      "num_input_tokens_seen": 27318091712,
      "step": 34722
    },
    {
      "epoch": 3.683747082537662,
      "grad_norm": 0.3639367583637822,
      "learning_rate": 3.9287813597907875e-05,
      "loss": 1.4459,
      "num_input_tokens_seen": 27318878464,
      "step": 34723
    },
    {
      "epoch": 3.6838531720772334,
      "grad_norm": 0.4498381038064417,
      "learning_rate": 3.928724330560917e-05,
      "loss": 1.4381,
      "num_input_tokens_seen": 27319665216,
      "step": 34724
    },
    {
      "epoch": 3.6839592616168044,
      "grad_norm": 0.46876658633490287,
      "learning_rate": 3.92866730022697e-05,
      "loss": 1.4777,
      "num_input_tokens_seen": 27320452048,
      "step": 34725
    },
    {
      "epoch": 3.684065351156376,
      "grad_norm": 0.3851847929186346,
      "learning_rate": 3.928610268788991e-05,
      "loss": 1.5261,
      "num_input_tokens_seen": 27321238800,
      "step": 34726
    },
    {
      "epoch": 3.6841714406959474,
      "grad_norm": 0.386796373156356,
      "learning_rate": 3.928553236247024e-05,
      "loss": 1.4942,
      "num_input_tokens_seen": 27322025536,
      "step": 34727
    },
    {
      "epoch": 3.684277530235519,
      "grad_norm": 0.4041795799379057,
      "learning_rate": 3.928496202601113e-05,
      "loss": 1.3568,
      "num_input_tokens_seen": 27322812192,
      "step": 34728
    },
    {
      "epoch": 3.6843836197750903,
      "grad_norm": 0.394893429592746,
      "learning_rate": 3.928439167851302e-05,
      "loss": 1.3111,
      "num_input_tokens_seen": 27323599072,
      "step": 34729
    },
    {
      "epoch": 3.6844897093146614,
      "grad_norm": 0.42403249454609226,
      "learning_rate": 3.928382131997635e-05,
      "loss": 1.4303,
      "num_input_tokens_seen": 27324385808,
      "step": 34730
    },
    {
      "epoch": 3.684595798854233,
      "grad_norm": 0.4592977215472892,
      "learning_rate": 3.928325095040156e-05,
      "loss": 1.3492,
      "num_input_tokens_seen": 27325172592,
      "step": 34731
    },
    {
      "epoch": 3.6847018883938043,
      "grad_norm": 0.428846925909124,
      "learning_rate": 3.92826805697891e-05,
      "loss": 1.3962,
      "num_input_tokens_seen": 27325959408,
      "step": 34732
    },
    {
      "epoch": 3.6848079779333758,
      "grad_norm": 0.5651877664314392,
      "learning_rate": 3.92821101781394e-05,
      "loss": 1.4755,
      "num_input_tokens_seen": 27326746144,
      "step": 34733
    },
    {
      "epoch": 3.6849140674729473,
      "grad_norm": 0.38547384852477934,
      "learning_rate": 3.92815397754529e-05,
      "loss": 1.3983,
      "num_input_tokens_seen": 27327532832,
      "step": 34734
    },
    {
      "epoch": 3.6850201570125187,
      "grad_norm": 0.498887913052842,
      "learning_rate": 3.928096936173005e-05,
      "loss": 1.4316,
      "num_input_tokens_seen": 27328319600,
      "step": 34735
    },
    {
      "epoch": 3.68512624655209,
      "grad_norm": 0.4456217915080364,
      "learning_rate": 3.9280398936971284e-05,
      "loss": 1.3561,
      "num_input_tokens_seen": 27329106320,
      "step": 34736
    },
    {
      "epoch": 3.6852323360916612,
      "grad_norm": 0.5057145699495512,
      "learning_rate": 3.927982850117704e-05,
      "loss": 1.5489,
      "num_input_tokens_seen": 27329893056,
      "step": 34737
    },
    {
      "epoch": 3.6853384256312327,
      "grad_norm": 0.5273285775054075,
      "learning_rate": 3.927925805434777e-05,
      "loss": 1.4924,
      "num_input_tokens_seen": 27330679696,
      "step": 34738
    },
    {
      "epoch": 3.685444515170804,
      "grad_norm": 0.43933331869244807,
      "learning_rate": 3.9278687596483907e-05,
      "loss": 1.4266,
      "num_input_tokens_seen": 27331466512,
      "step": 34739
    },
    {
      "epoch": 3.6855506047103757,
      "grad_norm": 0.5594466434196893,
      "learning_rate": 3.927811712758589e-05,
      "loss": 1.3671,
      "num_input_tokens_seen": 27332253280,
      "step": 34740
    },
    {
      "epoch": 3.685656694249947,
      "grad_norm": 0.4335816011615013,
      "learning_rate": 3.9277546647654175e-05,
      "loss": 1.3989,
      "num_input_tokens_seen": 27333040032,
      "step": 34741
    },
    {
      "epoch": 3.685762783789518,
      "grad_norm": 0.6578067845551703,
      "learning_rate": 3.9276976156689174e-05,
      "loss": 1.5104,
      "num_input_tokens_seen": 27333826912,
      "step": 34742
    },
    {
      "epoch": 3.6858688733290896,
      "grad_norm": 0.42665239569676927,
      "learning_rate": 3.927640565469135e-05,
      "loss": 1.4319,
      "num_input_tokens_seen": 27334613712,
      "step": 34743
    },
    {
      "epoch": 3.685974962868661,
      "grad_norm": 0.4282868338556732,
      "learning_rate": 3.927583514166114e-05,
      "loss": 1.4477,
      "num_input_tokens_seen": 27335400496,
      "step": 34744
    },
    {
      "epoch": 3.6860810524082326,
      "grad_norm": 0.6977577646843911,
      "learning_rate": 3.927526461759899e-05,
      "loss": 1.5095,
      "num_input_tokens_seen": 27336187360,
      "step": 34745
    },
    {
      "epoch": 3.686187141947804,
      "grad_norm": 0.5067175146276136,
      "learning_rate": 3.927469408250533e-05,
      "loss": 1.3613,
      "num_input_tokens_seen": 27336974240,
      "step": 34746
    },
    {
      "epoch": 3.686293231487375,
      "grad_norm": 0.5007000525511985,
      "learning_rate": 3.9274123536380605e-05,
      "loss": 1.3352,
      "num_input_tokens_seen": 27337761104,
      "step": 34747
    },
    {
      "epoch": 3.686399321026947,
      "grad_norm": 0.35745839752521347,
      "learning_rate": 3.927355297922525e-05,
      "loss": 1.3021,
      "num_input_tokens_seen": 27338548016,
      "step": 34748
    },
    {
      "epoch": 3.686505410566518,
      "grad_norm": 0.6209905337715937,
      "learning_rate": 3.927298241103972e-05,
      "loss": 1.5646,
      "num_input_tokens_seen": 27339334704,
      "step": 34749
    },
    {
      "epoch": 3.6866115001060895,
      "grad_norm": 0.5309388401808383,
      "learning_rate": 3.927241183182444e-05,
      "loss": 1.6181,
      "num_input_tokens_seen": 27340121408,
      "step": 34750
    },
    {
      "epoch": 3.686717589645661,
      "grad_norm": 0.6791732788856545,
      "learning_rate": 3.927184124157987e-05,
      "loss": 1.5076,
      "num_input_tokens_seen": 27340908144,
      "step": 34751
    },
    {
      "epoch": 3.6868236791852325,
      "grad_norm": 0.529502645108992,
      "learning_rate": 3.927127064030643e-05,
      "loss": 1.5451,
      "num_input_tokens_seen": 27341694848,
      "step": 34752
    },
    {
      "epoch": 3.686929768724804,
      "grad_norm": 0.53758676346675,
      "learning_rate": 3.927070002800457e-05,
      "loss": 1.5451,
      "num_input_tokens_seen": 27342481536,
      "step": 34753
    },
    {
      "epoch": 3.687035858264375,
      "grad_norm": 0.721106647408798,
      "learning_rate": 3.9270129404674735e-05,
      "loss": 1.4824,
      "num_input_tokens_seen": 27343268320,
      "step": 34754
    },
    {
      "epoch": 3.6871419478039464,
      "grad_norm": 0.42144754544301094,
      "learning_rate": 3.926955877031737e-05,
      "loss": 1.465,
      "num_input_tokens_seen": 27344055104,
      "step": 34755
    },
    {
      "epoch": 3.687248037343518,
      "grad_norm": 0.5543241555541307,
      "learning_rate": 3.92689881249329e-05,
      "loss": 1.4732,
      "num_input_tokens_seen": 27344841888,
      "step": 34756
    },
    {
      "epoch": 3.6873541268830894,
      "grad_norm": 0.6320810630975696,
      "learning_rate": 3.926841746852178e-05,
      "loss": 1.417,
      "num_input_tokens_seen": 27345628656,
      "step": 34757
    },
    {
      "epoch": 3.687460216422661,
      "grad_norm": 0.44311243402486744,
      "learning_rate": 3.926784680108444e-05,
      "loss": 1.362,
      "num_input_tokens_seen": 27346415488,
      "step": 34758
    },
    {
      "epoch": 3.687566305962232,
      "grad_norm": 0.6952988781734971,
      "learning_rate": 3.926727612262133e-05,
      "loss": 1.5019,
      "num_input_tokens_seen": 27347202288,
      "step": 34759
    },
    {
      "epoch": 3.6876723955018034,
      "grad_norm": 0.48356450461703093,
      "learning_rate": 3.926670543313289e-05,
      "loss": 1.3865,
      "num_input_tokens_seen": 27347989104,
      "step": 34760
    },
    {
      "epoch": 3.687778485041375,
      "grad_norm": 0.7375369126873997,
      "learning_rate": 3.926613473261956e-05,
      "loss": 1.4376,
      "num_input_tokens_seen": 27348775824,
      "step": 34761
    },
    {
      "epoch": 3.6878845745809463,
      "grad_norm": 0.6276335622929268,
      "learning_rate": 3.9265564021081776e-05,
      "loss": 1.4164,
      "num_input_tokens_seen": 27349562560,
      "step": 34762
    },
    {
      "epoch": 3.687990664120518,
      "grad_norm": 0.5931290533920369,
      "learning_rate": 3.926499329851998e-05,
      "loss": 1.5384,
      "num_input_tokens_seen": 27350349344,
      "step": 34763
    },
    {
      "epoch": 3.6880967536600893,
      "grad_norm": 0.7187237234157797,
      "learning_rate": 3.9264422564934624e-05,
      "loss": 1.5318,
      "num_input_tokens_seen": 27351136160,
      "step": 34764
    },
    {
      "epoch": 3.6882028431996607,
      "grad_norm": 0.45834199900385736,
      "learning_rate": 3.926385182032613e-05,
      "loss": 1.4744,
      "num_input_tokens_seen": 27351922944,
      "step": 34765
    },
    {
      "epoch": 3.6883089327392318,
      "grad_norm": 0.6237601332192105,
      "learning_rate": 3.9263281064694956e-05,
      "loss": 1.4829,
      "num_input_tokens_seen": 27352709776,
      "step": 34766
    },
    {
      "epoch": 3.6884150222788032,
      "grad_norm": 0.41030492232129095,
      "learning_rate": 3.926271029804154e-05,
      "loss": 1.4014,
      "num_input_tokens_seen": 27353496480,
      "step": 34767
    },
    {
      "epoch": 3.6885211118183747,
      "grad_norm": 0.41111585615811186,
      "learning_rate": 3.9262139520366314e-05,
      "loss": 1.3881,
      "num_input_tokens_seen": 27354283232,
      "step": 34768
    },
    {
      "epoch": 3.688627201357946,
      "grad_norm": 0.47824961148099043,
      "learning_rate": 3.9261568731669726e-05,
      "loss": 1.3954,
      "num_input_tokens_seen": 27355070000,
      "step": 34769
    },
    {
      "epoch": 3.6887332908975177,
      "grad_norm": 0.5126016653092679,
      "learning_rate": 3.9260997931952216e-05,
      "loss": 1.4103,
      "num_input_tokens_seen": 27355856816,
      "step": 34770
    },
    {
      "epoch": 3.6888393804370887,
      "grad_norm": 0.5252583665114895,
      "learning_rate": 3.9260427121214225e-05,
      "loss": 1.4154,
      "num_input_tokens_seen": 27356643584,
      "step": 34771
    },
    {
      "epoch": 3.68894546997666,
      "grad_norm": 0.42380712314808644,
      "learning_rate": 3.925985629945619e-05,
      "loss": 1.394,
      "num_input_tokens_seen": 27357430400,
      "step": 34772
    },
    {
      "epoch": 3.6890515595162316,
      "grad_norm": 0.47154361381583176,
      "learning_rate": 3.9259285466678566e-05,
      "loss": 1.5175,
      "num_input_tokens_seen": 27358217104,
      "step": 34773
    },
    {
      "epoch": 3.689157649055803,
      "grad_norm": 0.45415575522149987,
      "learning_rate": 3.925871462288178e-05,
      "loss": 1.4562,
      "num_input_tokens_seen": 27359003888,
      "step": 34774
    },
    {
      "epoch": 3.6892637385953746,
      "grad_norm": 0.44484046053261356,
      "learning_rate": 3.925814376806628e-05,
      "loss": 1.5581,
      "num_input_tokens_seen": 27359790656,
      "step": 34775
    },
    {
      "epoch": 3.6893698281349456,
      "grad_norm": 0.4150699476917299,
      "learning_rate": 3.9257572902232504e-05,
      "loss": 1.5103,
      "num_input_tokens_seen": 27360577328,
      "step": 34776
    },
    {
      "epoch": 3.6894759176745175,
      "grad_norm": 0.45092746191367034,
      "learning_rate": 3.9257002025380894e-05,
      "loss": 1.4301,
      "num_input_tokens_seen": 27361364096,
      "step": 34777
    },
    {
      "epoch": 3.6895820072140886,
      "grad_norm": 0.4067579046720128,
      "learning_rate": 3.925643113751189e-05,
      "loss": 1.4422,
      "num_input_tokens_seen": 27362150912,
      "step": 34778
    },
    {
      "epoch": 3.68968809675366,
      "grad_norm": 0.41265758426721444,
      "learning_rate": 3.925586023862593e-05,
      "loss": 1.4032,
      "num_input_tokens_seen": 27362937744,
      "step": 34779
    },
    {
      "epoch": 3.6897941862932315,
      "grad_norm": 0.41770529179363486,
      "learning_rate": 3.9255289328723465e-05,
      "loss": 1.4552,
      "num_input_tokens_seen": 27363724400,
      "step": 34780
    },
    {
      "epoch": 3.689900275832803,
      "grad_norm": 0.4376091961267854,
      "learning_rate": 3.925471840780494e-05,
      "loss": 1.4377,
      "num_input_tokens_seen": 27364511072,
      "step": 34781
    },
    {
      "epoch": 3.6900063653723745,
      "grad_norm": 0.44448272854104554,
      "learning_rate": 3.925414747587077e-05,
      "loss": 1.46,
      "num_input_tokens_seen": 27365297760,
      "step": 34782
    },
    {
      "epoch": 3.6901124549119455,
      "grad_norm": 0.5042031365598844,
      "learning_rate": 3.925357653292142e-05,
      "loss": 1.3824,
      "num_input_tokens_seen": 27366084544,
      "step": 34783
    },
    {
      "epoch": 3.690218544451517,
      "grad_norm": 0.4584284284543316,
      "learning_rate": 3.9253005578957325e-05,
      "loss": 1.5311,
      "num_input_tokens_seen": 27366871312,
      "step": 34784
    },
    {
      "epoch": 3.6903246339910885,
      "grad_norm": 0.518716114806344,
      "learning_rate": 3.925243461397892e-05,
      "loss": 1.5313,
      "num_input_tokens_seen": 27367657904,
      "step": 34785
    },
    {
      "epoch": 3.69043072353066,
      "grad_norm": 0.45373447527316824,
      "learning_rate": 3.925186363798666e-05,
      "loss": 1.4926,
      "num_input_tokens_seen": 27368444672,
      "step": 34786
    },
    {
      "epoch": 3.6905368130702314,
      "grad_norm": 0.4785871377970344,
      "learning_rate": 3.925129265098098e-05,
      "loss": 1.5143,
      "num_input_tokens_seen": 27369231376,
      "step": 34787
    },
    {
      "epoch": 3.6906429026098024,
      "grad_norm": 0.437452662612776,
      "learning_rate": 3.925072165296231e-05,
      "loss": 1.4003,
      "num_input_tokens_seen": 27370018176,
      "step": 34788
    },
    {
      "epoch": 3.690748992149374,
      "grad_norm": 0.5551048387110467,
      "learning_rate": 3.92501506439311e-05,
      "loss": 1.4119,
      "num_input_tokens_seen": 27370804976,
      "step": 34789
    },
    {
      "epoch": 3.6908550816889454,
      "grad_norm": 0.4131769016534371,
      "learning_rate": 3.92495796238878e-05,
      "loss": 1.4946,
      "num_input_tokens_seen": 27371591760,
      "step": 34790
    },
    {
      "epoch": 3.690961171228517,
      "grad_norm": 0.459029193372392,
      "learning_rate": 3.9249008592832835e-05,
      "loss": 1.3699,
      "num_input_tokens_seen": 27372378560,
      "step": 34791
    },
    {
      "epoch": 3.6910672607680883,
      "grad_norm": 0.5116372804035456,
      "learning_rate": 3.9248437550766657e-05,
      "loss": 1.5379,
      "num_input_tokens_seen": 27373165200,
      "step": 34792
    },
    {
      "epoch": 3.69117335030766,
      "grad_norm": 0.4258384667945732,
      "learning_rate": 3.9247866497689707e-05,
      "loss": 1.5326,
      "num_input_tokens_seen": 27373951936,
      "step": 34793
    },
    {
      "epoch": 3.6912794398472313,
      "grad_norm": 0.44180247689161284,
      "learning_rate": 3.9247295433602426e-05,
      "loss": 1.3756,
      "num_input_tokens_seen": 27374738688,
      "step": 34794
    },
    {
      "epoch": 3.6913855293868023,
      "grad_norm": 0.4734666080397781,
      "learning_rate": 3.924672435850525e-05,
      "loss": 1.4111,
      "num_input_tokens_seen": 27375525360,
      "step": 34795
    },
    {
      "epoch": 3.691491618926374,
      "grad_norm": 0.4241022624807624,
      "learning_rate": 3.9246153272398615e-05,
      "loss": 1.4214,
      "num_input_tokens_seen": 27376312176,
      "step": 34796
    },
    {
      "epoch": 3.6915977084659453,
      "grad_norm": 0.503457473212748,
      "learning_rate": 3.924558217528298e-05,
      "loss": 1.3976,
      "num_input_tokens_seen": 27377098944,
      "step": 34797
    },
    {
      "epoch": 3.6917037980055167,
      "grad_norm": 0.4320887018484134,
      "learning_rate": 3.9245011067158774e-05,
      "loss": 1.4748,
      "num_input_tokens_seen": 27377885712,
      "step": 34798
    },
    {
      "epoch": 3.691809887545088,
      "grad_norm": 0.4364691787595015,
      "learning_rate": 3.924443994802644e-05,
      "loss": 1.4787,
      "num_input_tokens_seen": 27378672512,
      "step": 34799
    },
    {
      "epoch": 3.6919159770846592,
      "grad_norm": 0.41590371276540705,
      "learning_rate": 3.924386881788643e-05,
      "loss": 1.4238,
      "num_input_tokens_seen": 27379459312,
      "step": 34800
    },
    {
      "epoch": 3.6920220666242307,
      "grad_norm": 0.5042656427702666,
      "learning_rate": 3.9243297676739165e-05,
      "loss": 1.5044,
      "num_input_tokens_seen": 27380246032,
      "step": 34801
    },
    {
      "epoch": 3.692128156163802,
      "grad_norm": 0.4353358411865478,
      "learning_rate": 3.92427265245851e-05,
      "loss": 1.3791,
      "num_input_tokens_seen": 27381032880,
      "step": 34802
    },
    {
      "epoch": 3.6922342457033737,
      "grad_norm": 0.47525838956342575,
      "learning_rate": 3.924215536142468e-05,
      "loss": 1.3939,
      "num_input_tokens_seen": 27381819680,
      "step": 34803
    },
    {
      "epoch": 3.692340335242945,
      "grad_norm": 0.45157273251148183,
      "learning_rate": 3.924158418725834e-05,
      "loss": 1.4471,
      "num_input_tokens_seen": 27382606480,
      "step": 34804
    },
    {
      "epoch": 3.692446424782516,
      "grad_norm": 0.5140220632422636,
      "learning_rate": 3.9241013002086515e-05,
      "loss": 1.4393,
      "num_input_tokens_seen": 27383393232,
      "step": 34805
    },
    {
      "epoch": 3.692552514322088,
      "grad_norm": 0.427215259256693,
      "learning_rate": 3.924044180590966e-05,
      "loss": 1.5272,
      "num_input_tokens_seen": 27384179920,
      "step": 34806
    },
    {
      "epoch": 3.692658603861659,
      "grad_norm": 0.4816097311610178,
      "learning_rate": 3.92398705987282e-05,
      "loss": 1.4421,
      "num_input_tokens_seen": 27384966704,
      "step": 34807
    },
    {
      "epoch": 3.6927646934012306,
      "grad_norm": 0.49029653549353763,
      "learning_rate": 3.9239299380542595e-05,
      "loss": 1.5601,
      "num_input_tokens_seen": 27385753472,
      "step": 34808
    },
    {
      "epoch": 3.692870782940802,
      "grad_norm": 0.4440037082162349,
      "learning_rate": 3.923872815135327e-05,
      "loss": 1.548,
      "num_input_tokens_seen": 27386540336,
      "step": 34809
    },
    {
      "epoch": 3.6929768724803735,
      "grad_norm": 0.6108360819401016,
      "learning_rate": 3.923815691116068e-05,
      "loss": 1.5743,
      "num_input_tokens_seen": 27387327056,
      "step": 34810
    },
    {
      "epoch": 3.693082962019945,
      "grad_norm": 0.5536529725277417,
      "learning_rate": 3.923758565996526e-05,
      "loss": 1.5288,
      "num_input_tokens_seen": 27388113840,
      "step": 34811
    },
    {
      "epoch": 3.693189051559516,
      "grad_norm": 0.4511224527562337,
      "learning_rate": 3.923701439776745e-05,
      "loss": 1.4414,
      "num_input_tokens_seen": 27388900592,
      "step": 34812
    },
    {
      "epoch": 3.6932951410990875,
      "grad_norm": 0.6127787260911739,
      "learning_rate": 3.923644312456769e-05,
      "loss": 1.2819,
      "num_input_tokens_seen": 27389687280,
      "step": 34813
    },
    {
      "epoch": 3.693401230638659,
      "grad_norm": 0.44858003848875105,
      "learning_rate": 3.923587184036642e-05,
      "loss": 1.4177,
      "num_input_tokens_seen": 27390474000,
      "step": 34814
    },
    {
      "epoch": 3.6935073201782305,
      "grad_norm": 0.3789980361215614,
      "learning_rate": 3.923530054516409e-05,
      "loss": 1.2798,
      "num_input_tokens_seen": 27391260784,
      "step": 34815
    },
    {
      "epoch": 3.693613409717802,
      "grad_norm": 0.7038498058574191,
      "learning_rate": 3.9234729238961145e-05,
      "loss": 1.491,
      "num_input_tokens_seen": 27392047600,
      "step": 34816
    },
    {
      "epoch": 3.693719499257373,
      "grad_norm": 0.4218861476870797,
      "learning_rate": 3.923415792175801e-05,
      "loss": 1.4396,
      "num_input_tokens_seen": 27392834368,
      "step": 34817
    },
    {
      "epoch": 3.693825588796945,
      "grad_norm": 0.5422033718841324,
      "learning_rate": 3.9233586593555144e-05,
      "loss": 1.3923,
      "num_input_tokens_seen": 27393621136,
      "step": 34818
    },
    {
      "epoch": 3.693931678336516,
      "grad_norm": 0.5471725312109289,
      "learning_rate": 3.923301525435297e-05,
      "loss": 1.467,
      "num_input_tokens_seen": 27394407952,
      "step": 34819
    },
    {
      "epoch": 3.6940377678760874,
      "grad_norm": 0.48383124183077986,
      "learning_rate": 3.923244390415195e-05,
      "loss": 1.4677,
      "num_input_tokens_seen": 27395194704,
      "step": 34820
    },
    {
      "epoch": 3.694143857415659,
      "grad_norm": 0.5275306554319039,
      "learning_rate": 3.9231872542952506e-05,
      "loss": 1.4158,
      "num_input_tokens_seen": 27395981504,
      "step": 34821
    },
    {
      "epoch": 3.6942499469552303,
      "grad_norm": 0.5316824058673706,
      "learning_rate": 3.9231301170755094e-05,
      "loss": 1.389,
      "num_input_tokens_seen": 27396768240,
      "step": 34822
    },
    {
      "epoch": 3.694356036494802,
      "grad_norm": 0.4975661518739039,
      "learning_rate": 3.923072978756015e-05,
      "loss": 1.5003,
      "num_input_tokens_seen": 27397555024,
      "step": 34823
    },
    {
      "epoch": 3.694462126034373,
      "grad_norm": 0.7951947013505521,
      "learning_rate": 3.923015839336811e-05,
      "loss": 1.4753,
      "num_input_tokens_seen": 27398341840,
      "step": 34824
    },
    {
      "epoch": 3.6945682155739443,
      "grad_norm": 0.40857955932533585,
      "learning_rate": 3.9229586988179424e-05,
      "loss": 1.4853,
      "num_input_tokens_seen": 27399128576,
      "step": 34825
    },
    {
      "epoch": 3.694674305113516,
      "grad_norm": 0.6244843203948353,
      "learning_rate": 3.9229015571994533e-05,
      "loss": 1.3835,
      "num_input_tokens_seen": 27399915312,
      "step": 34826
    },
    {
      "epoch": 3.6947803946530873,
      "grad_norm": 0.8214988761487927,
      "learning_rate": 3.9228444144813875e-05,
      "loss": 1.6131,
      "num_input_tokens_seen": 27400702048,
      "step": 34827
    },
    {
      "epoch": 3.6948864841926587,
      "grad_norm": 0.6378783094972553,
      "learning_rate": 3.9227872706637895e-05,
      "loss": 1.3329,
      "num_input_tokens_seen": 27401488848,
      "step": 34828
    },
    {
      "epoch": 3.69499257373223,
      "grad_norm": 0.7578707845424918,
      "learning_rate": 3.9227301257467034e-05,
      "loss": 1.4968,
      "num_input_tokens_seen": 27402275632,
      "step": 34829
    },
    {
      "epoch": 3.6950986632718013,
      "grad_norm": 0.566106901510265,
      "learning_rate": 3.922672979730172e-05,
      "loss": 1.4439,
      "num_input_tokens_seen": 27403062432,
      "step": 34830
    },
    {
      "epoch": 3.6952047528113727,
      "grad_norm": 0.8720048003287406,
      "learning_rate": 3.922615832614241e-05,
      "loss": 1.4383,
      "num_input_tokens_seen": 27403849168,
      "step": 34831
    },
    {
      "epoch": 3.695310842350944,
      "grad_norm": 0.648999491454221,
      "learning_rate": 3.922558684398955e-05,
      "loss": 1.4695,
      "num_input_tokens_seen": 27404635888,
      "step": 34832
    },
    {
      "epoch": 3.6954169318905157,
      "grad_norm": 0.49957689360315455,
      "learning_rate": 3.922501535084357e-05,
      "loss": 1.4334,
      "num_input_tokens_seen": 27405422656,
      "step": 34833
    },
    {
      "epoch": 3.695523021430087,
      "grad_norm": 0.7082709945963156,
      "learning_rate": 3.9224443846704916e-05,
      "loss": 1.5014,
      "num_input_tokens_seen": 27406209376,
      "step": 34834
    },
    {
      "epoch": 3.6956291109696586,
      "grad_norm": 0.49406922406721054,
      "learning_rate": 3.922387233157403e-05,
      "loss": 1.4734,
      "num_input_tokens_seen": 27406996144,
      "step": 34835
    },
    {
      "epoch": 3.6957352005092297,
      "grad_norm": 0.6153029623543272,
      "learning_rate": 3.9223300805451356e-05,
      "loss": 1.4612,
      "num_input_tokens_seen": 27407782912,
      "step": 34836
    },
    {
      "epoch": 3.695841290048801,
      "grad_norm": 0.5179946821170575,
      "learning_rate": 3.922272926833733e-05,
      "loss": 1.5118,
      "num_input_tokens_seen": 27408569728,
      "step": 34837
    },
    {
      "epoch": 3.6959473795883726,
      "grad_norm": 0.47206250126108945,
      "learning_rate": 3.9222157720232394e-05,
      "loss": 1.5197,
      "num_input_tokens_seen": 27409356560,
      "step": 34838
    },
    {
      "epoch": 3.696053469127944,
      "grad_norm": 0.4289855543670887,
      "learning_rate": 3.922158616113699e-05,
      "loss": 1.3838,
      "num_input_tokens_seen": 27410143440,
      "step": 34839
    },
    {
      "epoch": 3.6961595586675156,
      "grad_norm": 0.41825661838212896,
      "learning_rate": 3.922101459105156e-05,
      "loss": 1.3644,
      "num_input_tokens_seen": 27410930112,
      "step": 34840
    },
    {
      "epoch": 3.6962656482070866,
      "grad_norm": 0.4938606499344585,
      "learning_rate": 3.9220443009976556e-05,
      "loss": 1.5445,
      "num_input_tokens_seen": 27411716848,
      "step": 34841
    },
    {
      "epoch": 3.696371737746658,
      "grad_norm": 0.5763994721103696,
      "learning_rate": 3.921987141791241e-05,
      "loss": 1.5887,
      "num_input_tokens_seen": 27412503520,
      "step": 34842
    },
    {
      "epoch": 3.6964778272862295,
      "grad_norm": 0.5000187458215369,
      "learning_rate": 3.9219299814859556e-05,
      "loss": 1.4947,
      "num_input_tokens_seen": 27413290320,
      "step": 34843
    },
    {
      "epoch": 3.696583916825801,
      "grad_norm": 0.4688491471886806,
      "learning_rate": 3.9218728200818455e-05,
      "loss": 1.5598,
      "num_input_tokens_seen": 27414077040,
      "step": 34844
    },
    {
      "epoch": 3.6966900063653725,
      "grad_norm": 0.4849213875752085,
      "learning_rate": 3.9218156575789534e-05,
      "loss": 1.3387,
      "num_input_tokens_seen": 27414863760,
      "step": 34845
    },
    {
      "epoch": 3.6967960959049435,
      "grad_norm": 0.4319075369736969,
      "learning_rate": 3.9217584939773234e-05,
      "loss": 1.4713,
      "num_input_tokens_seen": 27415650560,
      "step": 34846
    },
    {
      "epoch": 3.6969021854445154,
      "grad_norm": 0.44127608725222633,
      "learning_rate": 3.921701329277e-05,
      "loss": 1.4073,
      "num_input_tokens_seen": 27416437344,
      "step": 34847
    },
    {
      "epoch": 3.6970082749840865,
      "grad_norm": 0.5195435615958095,
      "learning_rate": 3.921644163478028e-05,
      "loss": 1.5202,
      "num_input_tokens_seen": 27417224160,
      "step": 34848
    },
    {
      "epoch": 3.697114364523658,
      "grad_norm": 0.4202166259713315,
      "learning_rate": 3.921586996580451e-05,
      "loss": 1.4939,
      "num_input_tokens_seen": 27418010896,
      "step": 34849
    },
    {
      "epoch": 3.6972204540632294,
      "grad_norm": 0.5281163916942392,
      "learning_rate": 3.921529828584314e-05,
      "loss": 1.5948,
      "num_input_tokens_seen": 27418797744,
      "step": 34850
    },
    {
      "epoch": 3.697326543602801,
      "grad_norm": 0.48917742995354285,
      "learning_rate": 3.921472659489659e-05,
      "loss": 1.4619,
      "num_input_tokens_seen": 27419584464,
      "step": 34851
    },
    {
      "epoch": 3.6974326331423724,
      "grad_norm": 0.45320955438117677,
      "learning_rate": 3.9214154892965324e-05,
      "loss": 1.5017,
      "num_input_tokens_seen": 27420371200,
      "step": 34852
    },
    {
      "epoch": 3.6975387226819434,
      "grad_norm": 0.4662855257961453,
      "learning_rate": 3.921358318004978e-05,
      "loss": 1.424,
      "num_input_tokens_seen": 27421158032,
      "step": 34853
    },
    {
      "epoch": 3.697644812221515,
      "grad_norm": 0.42210134208888334,
      "learning_rate": 3.921301145615039e-05,
      "loss": 1.4876,
      "num_input_tokens_seen": 27421944816,
      "step": 34854
    },
    {
      "epoch": 3.6977509017610863,
      "grad_norm": 0.3840764098508934,
      "learning_rate": 3.921243972126761e-05,
      "loss": 1.4347,
      "num_input_tokens_seen": 27422731648,
      "step": 34855
    },
    {
      "epoch": 3.697856991300658,
      "grad_norm": 0.42523017893249576,
      "learning_rate": 3.921186797540187e-05,
      "loss": 1.446,
      "num_input_tokens_seen": 27423518384,
      "step": 34856
    },
    {
      "epoch": 3.6979630808402293,
      "grad_norm": 0.4407619315746195,
      "learning_rate": 3.921129621855361e-05,
      "loss": 1.4048,
      "num_input_tokens_seen": 27424305136,
      "step": 34857
    },
    {
      "epoch": 3.6980691703798003,
      "grad_norm": 0.4209366478170602,
      "learning_rate": 3.921072445072328e-05,
      "loss": 1.4615,
      "num_input_tokens_seen": 27425091968,
      "step": 34858
    },
    {
      "epoch": 3.698175259919372,
      "grad_norm": 0.577380517406032,
      "learning_rate": 3.921015267191131e-05,
      "loss": 1.5386,
      "num_input_tokens_seen": 27425878720,
      "step": 34859
    },
    {
      "epoch": 3.6982813494589433,
      "grad_norm": 0.4347123634117686,
      "learning_rate": 3.920958088211817e-05,
      "loss": 1.4403,
      "num_input_tokens_seen": 27426665488,
      "step": 34860
    },
    {
      "epoch": 3.6983874389985147,
      "grad_norm": 0.5241545369951387,
      "learning_rate": 3.9209009081344275e-05,
      "loss": 1.4309,
      "num_input_tokens_seen": 27427452160,
      "step": 34861
    },
    {
      "epoch": 3.698493528538086,
      "grad_norm": 0.5725651009303726,
      "learning_rate": 3.920843726959007e-05,
      "loss": 1.4965,
      "num_input_tokens_seen": 27428238944,
      "step": 34862
    },
    {
      "epoch": 3.6985996180776577,
      "grad_norm": 0.5809769048141805,
      "learning_rate": 3.9207865446856004e-05,
      "loss": 1.5133,
      "num_input_tokens_seen": 27429025664,
      "step": 34863
    },
    {
      "epoch": 3.698705707617229,
      "grad_norm": 0.5757069409882458,
      "learning_rate": 3.920729361314252e-05,
      "loss": 1.4321,
      "num_input_tokens_seen": 27429812352,
      "step": 34864
    },
    {
      "epoch": 3.6988117971568,
      "grad_norm": 0.40012418167688546,
      "learning_rate": 3.920672176845006e-05,
      "loss": 1.4223,
      "num_input_tokens_seen": 27430599024,
      "step": 34865
    },
    {
      "epoch": 3.6989178866963717,
      "grad_norm": 0.8141595078247652,
      "learning_rate": 3.920614991277905e-05,
      "loss": 1.428,
      "num_input_tokens_seen": 27431385776,
      "step": 34866
    },
    {
      "epoch": 3.699023976235943,
      "grad_norm": 0.40597178549792234,
      "learning_rate": 3.920557804612995e-05,
      "loss": 1.5465,
      "num_input_tokens_seen": 27432172544,
      "step": 34867
    },
    {
      "epoch": 3.6991300657755146,
      "grad_norm": 0.4246944003570282,
      "learning_rate": 3.92050061685032e-05,
      "loss": 1.4369,
      "num_input_tokens_seen": 27432959344,
      "step": 34868
    },
    {
      "epoch": 3.699236155315086,
      "grad_norm": 0.4894451106896965,
      "learning_rate": 3.920443427989923e-05,
      "loss": 1.3169,
      "num_input_tokens_seen": 27433746176,
      "step": 34869
    },
    {
      "epoch": 3.699342244854657,
      "grad_norm": 0.5997499679345065,
      "learning_rate": 3.92038623803185e-05,
      "loss": 1.3585,
      "num_input_tokens_seen": 27434533056,
      "step": 34870
    },
    {
      "epoch": 3.6994483343942286,
      "grad_norm": 0.5633492558435026,
      "learning_rate": 3.9203290469761434e-05,
      "loss": 1.386,
      "num_input_tokens_seen": 27435319728,
      "step": 34871
    },
    {
      "epoch": 3.6995544239338,
      "grad_norm": 0.7172820997769692,
      "learning_rate": 3.920271854822848e-05,
      "loss": 1.4971,
      "num_input_tokens_seen": 27436106544,
      "step": 34872
    },
    {
      "epoch": 3.6996605134733715,
      "grad_norm": 0.43446443107988436,
      "learning_rate": 3.9202146615720095e-05,
      "loss": 1.5038,
      "num_input_tokens_seen": 27436893312,
      "step": 34873
    },
    {
      "epoch": 3.699766603012943,
      "grad_norm": 0.5353247130581992,
      "learning_rate": 3.92015746722367e-05,
      "loss": 1.544,
      "num_input_tokens_seen": 27437680144,
      "step": 34874
    },
    {
      "epoch": 3.699872692552514,
      "grad_norm": 0.6773613538135593,
      "learning_rate": 3.920100271777873e-05,
      "loss": 1.3769,
      "num_input_tokens_seen": 27438466832,
      "step": 34875
    },
    {
      "epoch": 3.699978782092086,
      "grad_norm": 0.4740814545066817,
      "learning_rate": 3.9200430752346665e-05,
      "loss": 1.4041,
      "num_input_tokens_seen": 27439253552,
      "step": 34876
    },
    {
      "epoch": 3.700084871631657,
      "grad_norm": 0.6339136888802226,
      "learning_rate": 3.919985877594091e-05,
      "loss": 1.5307,
      "num_input_tokens_seen": 27440040336,
      "step": 34877
    },
    {
      "epoch": 3.7001909611712285,
      "grad_norm": 0.5664339528718005,
      "learning_rate": 3.919928678856193e-05,
      "loss": 1.5174,
      "num_input_tokens_seen": 27440827040,
      "step": 34878
    },
    {
      "epoch": 3.7002970507108,
      "grad_norm": 0.564713273094818,
      "learning_rate": 3.919871479021015e-05,
      "loss": 1.4399,
      "num_input_tokens_seen": 27441613856,
      "step": 34879
    },
    {
      "epoch": 3.7004031402503714,
      "grad_norm": 0.6029585028946497,
      "learning_rate": 3.9198142780886025e-05,
      "loss": 1.4875,
      "num_input_tokens_seen": 27442400624,
      "step": 34880
    },
    {
      "epoch": 3.700509229789943,
      "grad_norm": 0.3916197050010199,
      "learning_rate": 3.9197570760589986e-05,
      "loss": 1.4148,
      "num_input_tokens_seen": 27443187424,
      "step": 34881
    },
    {
      "epoch": 3.700615319329514,
      "grad_norm": 0.4316283090716191,
      "learning_rate": 3.9196998729322485e-05,
      "loss": 1.3639,
      "num_input_tokens_seen": 27443974192,
      "step": 34882
    },
    {
      "epoch": 3.7007214088690854,
      "grad_norm": 0.4479575217892166,
      "learning_rate": 3.9196426687083956e-05,
      "loss": 1.4293,
      "num_input_tokens_seen": 27444760960,
      "step": 34883
    },
    {
      "epoch": 3.700827498408657,
      "grad_norm": 0.4544231634069955,
      "learning_rate": 3.919585463387485e-05,
      "loss": 1.47,
      "num_input_tokens_seen": 27445547712,
      "step": 34884
    },
    {
      "epoch": 3.7009335879482284,
      "grad_norm": 0.4704322748968029,
      "learning_rate": 3.91952825696956e-05,
      "loss": 1.4676,
      "num_input_tokens_seen": 27446334480,
      "step": 34885
    },
    {
      "epoch": 3.7010396774878,
      "grad_norm": 0.49774099672875144,
      "learning_rate": 3.919471049454666e-05,
      "loss": 1.4821,
      "num_input_tokens_seen": 27447121136,
      "step": 34886
    },
    {
      "epoch": 3.701145767027371,
      "grad_norm": 0.49669227550204503,
      "learning_rate": 3.919413840842846e-05,
      "loss": 1.5689,
      "num_input_tokens_seen": 27447907872,
      "step": 34887
    },
    {
      "epoch": 3.7012518565669423,
      "grad_norm": 0.4768365053638124,
      "learning_rate": 3.9193566311341445e-05,
      "loss": 1.3943,
      "num_input_tokens_seen": 27448694592,
      "step": 34888
    },
    {
      "epoch": 3.701357946106514,
      "grad_norm": 0.5887895662180329,
      "learning_rate": 3.919299420328606e-05,
      "loss": 1.4928,
      "num_input_tokens_seen": 27449481360,
      "step": 34889
    },
    {
      "epoch": 3.7014640356460853,
      "grad_norm": 0.4414573553009895,
      "learning_rate": 3.9192422084262744e-05,
      "loss": 1.3802,
      "num_input_tokens_seen": 27450268160,
      "step": 34890
    },
    {
      "epoch": 3.7015701251856568,
      "grad_norm": 0.39539869289315577,
      "learning_rate": 3.919184995427194e-05,
      "loss": 1.4034,
      "num_input_tokens_seen": 27451054944,
      "step": 34891
    },
    {
      "epoch": 3.7016762147252282,
      "grad_norm": 0.5184307880410914,
      "learning_rate": 3.9191277813314086e-05,
      "loss": 1.5305,
      "num_input_tokens_seen": 27451841680,
      "step": 34892
    },
    {
      "epoch": 3.7017823042647997,
      "grad_norm": 0.41649189644721635,
      "learning_rate": 3.9190705661389635e-05,
      "loss": 1.4421,
      "num_input_tokens_seen": 27452628464,
      "step": 34893
    },
    {
      "epoch": 3.7018883938043707,
      "grad_norm": 0.38689511433803847,
      "learning_rate": 3.919013349849903e-05,
      "loss": 1.3845,
      "num_input_tokens_seen": 27453415216,
      "step": 34894
    },
    {
      "epoch": 3.701994483343942,
      "grad_norm": 0.5675725668072994,
      "learning_rate": 3.9189561324642685e-05,
      "loss": 1.426,
      "num_input_tokens_seen": 27454201968,
      "step": 34895
    },
    {
      "epoch": 3.7021005728835137,
      "grad_norm": 0.4562255901985631,
      "learning_rate": 3.918898913982109e-05,
      "loss": 1.4865,
      "num_input_tokens_seen": 27454988704,
      "step": 34896
    },
    {
      "epoch": 3.702206662423085,
      "grad_norm": 0.4571744059776065,
      "learning_rate": 3.918841694403464e-05,
      "loss": 1.4302,
      "num_input_tokens_seen": 27455775440,
      "step": 34897
    },
    {
      "epoch": 3.7023127519626566,
      "grad_norm": 0.47241564718510654,
      "learning_rate": 3.918784473728381e-05,
      "loss": 1.4964,
      "num_input_tokens_seen": 27456562272,
      "step": 34898
    },
    {
      "epoch": 3.7024188415022277,
      "grad_norm": 0.4477263785965904,
      "learning_rate": 3.918727251956902e-05,
      "loss": 1.4283,
      "num_input_tokens_seen": 27457349040,
      "step": 34899
    },
    {
      "epoch": 3.702524931041799,
      "grad_norm": 0.49330680097449675,
      "learning_rate": 3.918670029089073e-05,
      "loss": 1.5139,
      "num_input_tokens_seen": 27458135760,
      "step": 34900
    },
    {
      "epoch": 3.7026310205813706,
      "grad_norm": 0.4233223698325355,
      "learning_rate": 3.9186128051249373e-05,
      "loss": 1.4801,
      "num_input_tokens_seen": 27458922544,
      "step": 34901
    },
    {
      "epoch": 3.702737110120942,
      "grad_norm": 0.5213693979607901,
      "learning_rate": 3.918555580064539e-05,
      "loss": 1.4441,
      "num_input_tokens_seen": 27459709344,
      "step": 34902
    },
    {
      "epoch": 3.7028431996605136,
      "grad_norm": 0.5695476570043252,
      "learning_rate": 3.9184983539079224e-05,
      "loss": 1.437,
      "num_input_tokens_seen": 27460496064,
      "step": 34903
    },
    {
      "epoch": 3.702949289200085,
      "grad_norm": 0.5926674486230586,
      "learning_rate": 3.918441126655132e-05,
      "loss": 1.4538,
      "num_input_tokens_seen": 27461282784,
      "step": 34904
    },
    {
      "epoch": 3.7030553787396565,
      "grad_norm": 0.6076962959507597,
      "learning_rate": 3.918383898306212e-05,
      "loss": 1.3919,
      "num_input_tokens_seen": 27462069536,
      "step": 34905
    },
    {
      "epoch": 3.7031614682792275,
      "grad_norm": 0.4656200416215596,
      "learning_rate": 3.918326668861207e-05,
      "loss": 1.4917,
      "num_input_tokens_seen": 27462856240,
      "step": 34906
    },
    {
      "epoch": 3.703267557818799,
      "grad_norm": 0.628785366491971,
      "learning_rate": 3.91826943832016e-05,
      "loss": 1.4374,
      "num_input_tokens_seen": 27463642992,
      "step": 34907
    },
    {
      "epoch": 3.7033736473583705,
      "grad_norm": 0.46542151157926703,
      "learning_rate": 3.918212206683116e-05,
      "loss": 1.4592,
      "num_input_tokens_seen": 27464429760,
      "step": 34908
    },
    {
      "epoch": 3.703479736897942,
      "grad_norm": 0.43482377419502544,
      "learning_rate": 3.91815497395012e-05,
      "loss": 1.4718,
      "num_input_tokens_seen": 27465216480,
      "step": 34909
    },
    {
      "epoch": 3.7035858264375134,
      "grad_norm": 0.6074676048809788,
      "learning_rate": 3.918097740121215e-05,
      "loss": 1.5352,
      "num_input_tokens_seen": 27466003200,
      "step": 34910
    },
    {
      "epoch": 3.7036919159770845,
      "grad_norm": 0.4764881679405962,
      "learning_rate": 3.918040505196446e-05,
      "loss": 1.4755,
      "num_input_tokens_seen": 27466789840,
      "step": 34911
    },
    {
      "epoch": 3.703798005516656,
      "grad_norm": 0.5694767828309846,
      "learning_rate": 3.917983269175857e-05,
      "loss": 1.4718,
      "num_input_tokens_seen": 27467576592,
      "step": 34912
    },
    {
      "epoch": 3.7039040950562274,
      "grad_norm": 0.4178865859161954,
      "learning_rate": 3.917926032059491e-05,
      "loss": 1.5043,
      "num_input_tokens_seen": 27468363344,
      "step": 34913
    },
    {
      "epoch": 3.704010184595799,
      "grad_norm": 0.4527806316493464,
      "learning_rate": 3.9178687938473944e-05,
      "loss": 1.4657,
      "num_input_tokens_seen": 27469150144,
      "step": 34914
    },
    {
      "epoch": 3.7041162741353704,
      "grad_norm": 0.4639766711063535,
      "learning_rate": 3.9178115545396096e-05,
      "loss": 1.501,
      "num_input_tokens_seen": 27469936944,
      "step": 34915
    },
    {
      "epoch": 3.7042223636749414,
      "grad_norm": 0.43812754536681114,
      "learning_rate": 3.917754314136183e-05,
      "loss": 1.3562,
      "num_input_tokens_seen": 27470723760,
      "step": 34916
    },
    {
      "epoch": 3.7043284532145133,
      "grad_norm": 0.473451933379662,
      "learning_rate": 3.9176970726371565e-05,
      "loss": 1.404,
      "num_input_tokens_seen": 27471510544,
      "step": 34917
    },
    {
      "epoch": 3.7044345427540843,
      "grad_norm": 0.5102744719783905,
      "learning_rate": 3.9176398300425755e-05,
      "loss": 1.4857,
      "num_input_tokens_seen": 27472297408,
      "step": 34918
    },
    {
      "epoch": 3.704540632293656,
      "grad_norm": 0.41152599857966005,
      "learning_rate": 3.917582586352484e-05,
      "loss": 1.4947,
      "num_input_tokens_seen": 27473084224,
      "step": 34919
    },
    {
      "epoch": 3.7046467218332273,
      "grad_norm": 0.482934738373614,
      "learning_rate": 3.917525341566926e-05,
      "loss": 1.4629,
      "num_input_tokens_seen": 27473870880,
      "step": 34920
    },
    {
      "epoch": 3.7047528113727988,
      "grad_norm": 0.49870117728449265,
      "learning_rate": 3.917468095685946e-05,
      "loss": 1.3974,
      "num_input_tokens_seen": 27474657664,
      "step": 34921
    },
    {
      "epoch": 3.7048589009123702,
      "grad_norm": 0.5092856331133129,
      "learning_rate": 3.917410848709588e-05,
      "loss": 1.4519,
      "num_input_tokens_seen": 27475444368,
      "step": 34922
    },
    {
      "epoch": 3.7049649904519413,
      "grad_norm": 0.5358861592031793,
      "learning_rate": 3.917353600637898e-05,
      "loss": 1.384,
      "num_input_tokens_seen": 27476231136,
      "step": 34923
    },
    {
      "epoch": 3.7050710799915128,
      "grad_norm": 0.49630559314416145,
      "learning_rate": 3.917296351470917e-05,
      "loss": 1.3873,
      "num_input_tokens_seen": 27477017952,
      "step": 34924
    },
    {
      "epoch": 3.7051771695310842,
      "grad_norm": 0.4753465168135026,
      "learning_rate": 3.9172391012086916e-05,
      "loss": 1.5134,
      "num_input_tokens_seen": 27477804736,
      "step": 34925
    },
    {
      "epoch": 3.7052832590706557,
      "grad_norm": 0.745508678353395,
      "learning_rate": 3.9171818498512655e-05,
      "loss": 1.5557,
      "num_input_tokens_seen": 27478591536,
      "step": 34926
    },
    {
      "epoch": 3.705389348610227,
      "grad_norm": 0.5426039358900459,
      "learning_rate": 3.917124597398683e-05,
      "loss": 1.5937,
      "num_input_tokens_seen": 27479378352,
      "step": 34927
    },
    {
      "epoch": 3.705495438149798,
      "grad_norm": 0.7059632182101093,
      "learning_rate": 3.917067343850988e-05,
      "loss": 1.4348,
      "num_input_tokens_seen": 27480165152,
      "step": 34928
    },
    {
      "epoch": 3.7056015276893697,
      "grad_norm": 0.5405025212393857,
      "learning_rate": 3.917010089208225e-05,
      "loss": 1.4689,
      "num_input_tokens_seen": 27480951952,
      "step": 34929
    },
    {
      "epoch": 3.705707617228941,
      "grad_norm": 0.5337254626412069,
      "learning_rate": 3.9169528334704386e-05,
      "loss": 1.4489,
      "num_input_tokens_seen": 27481738752,
      "step": 34930
    },
    {
      "epoch": 3.7058137067685126,
      "grad_norm": 0.5991820526663965,
      "learning_rate": 3.9168955766376716e-05,
      "loss": 1.5365,
      "num_input_tokens_seen": 27482525488,
      "step": 34931
    },
    {
      "epoch": 3.705919796308084,
      "grad_norm": 0.4469142918800623,
      "learning_rate": 3.91683831870997e-05,
      "loss": 1.4011,
      "num_input_tokens_seen": 27483312272,
      "step": 34932
    },
    {
      "epoch": 3.7060258858476556,
      "grad_norm": 0.5354333675031132,
      "learning_rate": 3.916781059687377e-05,
      "loss": 1.5172,
      "num_input_tokens_seen": 27484098960,
      "step": 34933
    },
    {
      "epoch": 3.706131975387227,
      "grad_norm": 0.580978951617665,
      "learning_rate": 3.9167237995699374e-05,
      "loss": 1.4242,
      "num_input_tokens_seen": 27484885728,
      "step": 34934
    },
    {
      "epoch": 3.706238064926798,
      "grad_norm": 0.5406644432407494,
      "learning_rate": 3.916666538357695e-05,
      "loss": 1.5018,
      "num_input_tokens_seen": 27485672512,
      "step": 34935
    },
    {
      "epoch": 3.7063441544663696,
      "grad_norm": 0.547209762889249,
      "learning_rate": 3.916609276050694e-05,
      "loss": 1.4251,
      "num_input_tokens_seen": 27486459136,
      "step": 34936
    },
    {
      "epoch": 3.706450244005941,
      "grad_norm": 0.5994164868457335,
      "learning_rate": 3.91655201264898e-05,
      "loss": 1.469,
      "num_input_tokens_seen": 27487245920,
      "step": 34937
    },
    {
      "epoch": 3.7065563335455125,
      "grad_norm": 0.40920870658068786,
      "learning_rate": 3.9164947481525956e-05,
      "loss": 1.3493,
      "num_input_tokens_seen": 27488032720,
      "step": 34938
    },
    {
      "epoch": 3.706662423085084,
      "grad_norm": 0.5943450019607985,
      "learning_rate": 3.916437482561585e-05,
      "loss": 1.4917,
      "num_input_tokens_seen": 27488819504,
      "step": 34939
    },
    {
      "epoch": 3.706768512624655,
      "grad_norm": 0.5639432637602741,
      "learning_rate": 3.916380215875994e-05,
      "loss": 1.3898,
      "num_input_tokens_seen": 27489606256,
      "step": 34940
    },
    {
      "epoch": 3.7068746021642265,
      "grad_norm": 0.48465498000114143,
      "learning_rate": 3.9163229480958654e-05,
      "loss": 1.466,
      "num_input_tokens_seen": 27490392944,
      "step": 34941
    },
    {
      "epoch": 3.706980691703798,
      "grad_norm": 0.5974497442912706,
      "learning_rate": 3.9162656792212436e-05,
      "loss": 1.4718,
      "num_input_tokens_seen": 27491179776,
      "step": 34942
    },
    {
      "epoch": 3.7070867812433694,
      "grad_norm": 0.5007328943253764,
      "learning_rate": 3.916208409252174e-05,
      "loss": 1.5663,
      "num_input_tokens_seen": 27491966592,
      "step": 34943
    },
    {
      "epoch": 3.707192870782941,
      "grad_norm": 0.44182439039994936,
      "learning_rate": 3.9161511381887e-05,
      "loss": 1.3934,
      "num_input_tokens_seen": 27492753280,
      "step": 34944
    },
    {
      "epoch": 3.707298960322512,
      "grad_norm": 0.4912937872155144,
      "learning_rate": 3.916093866030866e-05,
      "loss": 1.4639,
      "num_input_tokens_seen": 27493540048,
      "step": 34945
    },
    {
      "epoch": 3.707405049862084,
      "grad_norm": 0.49115370789511587,
      "learning_rate": 3.9160365927787154e-05,
      "loss": 1.4784,
      "num_input_tokens_seen": 27494326816,
      "step": 34946
    },
    {
      "epoch": 3.707511139401655,
      "grad_norm": 0.41480780826792296,
      "learning_rate": 3.915979318432293e-05,
      "loss": 1.2697,
      "num_input_tokens_seen": 27495113680,
      "step": 34947
    },
    {
      "epoch": 3.7076172289412264,
      "grad_norm": 0.5283300960923994,
      "learning_rate": 3.915922042991645e-05,
      "loss": 1.5226,
      "num_input_tokens_seen": 27495900480,
      "step": 34948
    },
    {
      "epoch": 3.707723318480798,
      "grad_norm": 0.4073272684858675,
      "learning_rate": 3.9158647664568135e-05,
      "loss": 1.4447,
      "num_input_tokens_seen": 27496687200,
      "step": 34949
    },
    {
      "epoch": 3.7078294080203693,
      "grad_norm": 0.5773629553412074,
      "learning_rate": 3.9158074888278426e-05,
      "loss": 1.3997,
      "num_input_tokens_seen": 27497473936,
      "step": 34950
    },
    {
      "epoch": 3.707935497559941,
      "grad_norm": 0.43739004392820025,
      "learning_rate": 3.915750210104777e-05,
      "loss": 1.4309,
      "num_input_tokens_seen": 27498260624,
      "step": 34951
    },
    {
      "epoch": 3.708041587099512,
      "grad_norm": 0.4509742699321209,
      "learning_rate": 3.9156929302876624e-05,
      "loss": 1.5672,
      "num_input_tokens_seen": 27499047408,
      "step": 34952
    },
    {
      "epoch": 3.7081476766390833,
      "grad_norm": 0.538355491323382,
      "learning_rate": 3.915635649376541e-05,
      "loss": 1.4654,
      "num_input_tokens_seen": 27499834128,
      "step": 34953
    },
    {
      "epoch": 3.7082537661786548,
      "grad_norm": 0.485182302400459,
      "learning_rate": 3.915578367371458e-05,
      "loss": 1.5976,
      "num_input_tokens_seen": 27500620864,
      "step": 34954
    },
    {
      "epoch": 3.7083598557182262,
      "grad_norm": 0.6540730921933169,
      "learning_rate": 3.915521084272458e-05,
      "loss": 1.3687,
      "num_input_tokens_seen": 27501407712,
      "step": 34955
    },
    {
      "epoch": 3.7084659452577977,
      "grad_norm": 0.6791757801723285,
      "learning_rate": 3.915463800079584e-05,
      "loss": 1.5539,
      "num_input_tokens_seen": 27502194416,
      "step": 34956
    },
    {
      "epoch": 3.7085720347973687,
      "grad_norm": 0.5844303548150155,
      "learning_rate": 3.915406514792882e-05,
      "loss": 1.423,
      "num_input_tokens_seen": 27502981168,
      "step": 34957
    },
    {
      "epoch": 3.70867812433694,
      "grad_norm": 0.6837908597733225,
      "learning_rate": 3.915349228412395e-05,
      "loss": 1.5008,
      "num_input_tokens_seen": 27503767904,
      "step": 34958
    },
    {
      "epoch": 3.7087842138765117,
      "grad_norm": 0.4631415398690801,
      "learning_rate": 3.915291940938167e-05,
      "loss": 1.4118,
      "num_input_tokens_seen": 27504554736,
      "step": 34959
    },
    {
      "epoch": 3.708890303416083,
      "grad_norm": 0.6046848455200314,
      "learning_rate": 3.915234652370244e-05,
      "loss": 1.405,
      "num_input_tokens_seen": 27505341488,
      "step": 34960
    },
    {
      "epoch": 3.7089963929556546,
      "grad_norm": 0.4062037324201368,
      "learning_rate": 3.9151773627086686e-05,
      "loss": 1.3978,
      "num_input_tokens_seen": 27506128288,
      "step": 34961
    },
    {
      "epoch": 3.709102482495226,
      "grad_norm": 0.426577438558483,
      "learning_rate": 3.915120071953486e-05,
      "loss": 1.4023,
      "num_input_tokens_seen": 27506915120,
      "step": 34962
    },
    {
      "epoch": 3.7092085720347976,
      "grad_norm": 0.5887006201570949,
      "learning_rate": 3.9150627801047405e-05,
      "loss": 1.4176,
      "num_input_tokens_seen": 27507701840,
      "step": 34963
    },
    {
      "epoch": 3.7093146615743686,
      "grad_norm": 0.40758164038093236,
      "learning_rate": 3.915005487162475e-05,
      "loss": 1.3686,
      "num_input_tokens_seen": 27508488560,
      "step": 34964
    },
    {
      "epoch": 3.70942075111394,
      "grad_norm": 0.552926938943578,
      "learning_rate": 3.914948193126735e-05,
      "loss": 1.3716,
      "num_input_tokens_seen": 27509275296,
      "step": 34965
    },
    {
      "epoch": 3.7095268406535116,
      "grad_norm": 0.43415924467430705,
      "learning_rate": 3.9148908979975645e-05,
      "loss": 1.5201,
      "num_input_tokens_seen": 27510062016,
      "step": 34966
    },
    {
      "epoch": 3.709632930193083,
      "grad_norm": 0.4661724114698112,
      "learning_rate": 3.914833601775008e-05,
      "loss": 1.5428,
      "num_input_tokens_seen": 27510848848,
      "step": 34967
    },
    {
      "epoch": 3.7097390197326545,
      "grad_norm": 0.5572765277489821,
      "learning_rate": 3.9147763044591104e-05,
      "loss": 1.4766,
      "num_input_tokens_seen": 27511635568,
      "step": 34968
    },
    {
      "epoch": 3.7098451092722255,
      "grad_norm": 0.42703895983228163,
      "learning_rate": 3.914719006049914e-05,
      "loss": 1.3332,
      "num_input_tokens_seen": 27512422400,
      "step": 34969
    },
    {
      "epoch": 3.709951198811797,
      "grad_norm": 0.5818881730294329,
      "learning_rate": 3.9146617065474646e-05,
      "loss": 1.3538,
      "num_input_tokens_seen": 27513209152,
      "step": 34970
    },
    {
      "epoch": 3.7100572883513685,
      "grad_norm": 0.4252938475041658,
      "learning_rate": 3.914604405951806e-05,
      "loss": 1.3184,
      "num_input_tokens_seen": 27513995824,
      "step": 34971
    },
    {
      "epoch": 3.71016337789094,
      "grad_norm": 0.4991537418007936,
      "learning_rate": 3.9145471042629834e-05,
      "loss": 1.4947,
      "num_input_tokens_seen": 27514782608,
      "step": 34972
    },
    {
      "epoch": 3.7102694674305114,
      "grad_norm": 0.541832313014851,
      "learning_rate": 3.914489801481039e-05,
      "loss": 1.4771,
      "num_input_tokens_seen": 27515569296,
      "step": 34973
    },
    {
      "epoch": 3.7103755569700825,
      "grad_norm": 0.43697936318829234,
      "learning_rate": 3.91443249760602e-05,
      "loss": 1.444,
      "num_input_tokens_seen": 27516356160,
      "step": 34974
    },
    {
      "epoch": 3.7104816465096544,
      "grad_norm": 0.7751604223992794,
      "learning_rate": 3.914375192637968e-05,
      "loss": 1.54,
      "num_input_tokens_seen": 27517142864,
      "step": 34975
    },
    {
      "epoch": 3.7105877360492254,
      "grad_norm": 0.438738168598879,
      "learning_rate": 3.9143178865769284e-05,
      "loss": 1.4259,
      "num_input_tokens_seen": 27517929616,
      "step": 34976
    },
    {
      "epoch": 3.710693825588797,
      "grad_norm": 0.5276326474171629,
      "learning_rate": 3.9142605794229456e-05,
      "loss": 1.4052,
      "num_input_tokens_seen": 27518716448,
      "step": 34977
    },
    {
      "epoch": 3.7107999151283684,
      "grad_norm": 0.5406193398160551,
      "learning_rate": 3.9142032711760633e-05,
      "loss": 1.3568,
      "num_input_tokens_seen": 27519503264,
      "step": 34978
    },
    {
      "epoch": 3.71090600466794,
      "grad_norm": 0.4675901714270001,
      "learning_rate": 3.9141459618363277e-05,
      "loss": 1.4114,
      "num_input_tokens_seen": 27520290000,
      "step": 34979
    },
    {
      "epoch": 3.7110120942075113,
      "grad_norm": 0.5975826754741338,
      "learning_rate": 3.91408865140378e-05,
      "loss": 1.4324,
      "num_input_tokens_seen": 27521076800,
      "step": 34980
    },
    {
      "epoch": 3.7111181837470824,
      "grad_norm": 0.49879033483551344,
      "learning_rate": 3.914031339878467e-05,
      "loss": 1.5074,
      "num_input_tokens_seen": 27521863568,
      "step": 34981
    },
    {
      "epoch": 3.711224273286654,
      "grad_norm": 0.4101098569767973,
      "learning_rate": 3.913974027260432e-05,
      "loss": 1.4365,
      "num_input_tokens_seen": 27522650272,
      "step": 34982
    },
    {
      "epoch": 3.7113303628262253,
      "grad_norm": 0.48035558053995936,
      "learning_rate": 3.913916713549719e-05,
      "loss": 1.3805,
      "num_input_tokens_seen": 27523437104,
      "step": 34983
    },
    {
      "epoch": 3.711436452365797,
      "grad_norm": 0.4307608322495334,
      "learning_rate": 3.9138593987463725e-05,
      "loss": 1.4255,
      "num_input_tokens_seen": 27524223872,
      "step": 34984
    },
    {
      "epoch": 3.7115425419053683,
      "grad_norm": 0.48451101032818544,
      "learning_rate": 3.913802082850437e-05,
      "loss": 1.4905,
      "num_input_tokens_seen": 27525010704,
      "step": 34985
    },
    {
      "epoch": 3.7116486314449393,
      "grad_norm": 0.49248901604511963,
      "learning_rate": 3.9137447658619566e-05,
      "loss": 1.3699,
      "num_input_tokens_seen": 27525797456,
      "step": 34986
    },
    {
      "epoch": 3.711754720984511,
      "grad_norm": 0.5830911173300128,
      "learning_rate": 3.913687447780976e-05,
      "loss": 1.3446,
      "num_input_tokens_seen": 27526584176,
      "step": 34987
    },
    {
      "epoch": 3.7118608105240822,
      "grad_norm": 0.4103799154868706,
      "learning_rate": 3.913630128607539e-05,
      "loss": 1.4396,
      "num_input_tokens_seen": 27527370944,
      "step": 34988
    },
    {
      "epoch": 3.7119669000636537,
      "grad_norm": 0.6209691124278576,
      "learning_rate": 3.9135728083416904e-05,
      "loss": 1.4446,
      "num_input_tokens_seen": 27528157696,
      "step": 34989
    },
    {
      "epoch": 3.712072989603225,
      "grad_norm": 0.5509830303897115,
      "learning_rate": 3.913515486983475e-05,
      "loss": 1.3897,
      "num_input_tokens_seen": 27528944384,
      "step": 34990
    },
    {
      "epoch": 3.7121790791427967,
      "grad_norm": 0.433545656401871,
      "learning_rate": 3.913458164532935e-05,
      "loss": 1.4634,
      "num_input_tokens_seen": 27529731200,
      "step": 34991
    },
    {
      "epoch": 3.712285168682368,
      "grad_norm": 0.5301712735930733,
      "learning_rate": 3.913400840990116e-05,
      "loss": 1.3849,
      "num_input_tokens_seen": 27530517936,
      "step": 34992
    },
    {
      "epoch": 3.712391258221939,
      "grad_norm": 0.5255189444406457,
      "learning_rate": 3.913343516355063e-05,
      "loss": 1.46,
      "num_input_tokens_seen": 27531304736,
      "step": 34993
    },
    {
      "epoch": 3.7124973477615106,
      "grad_norm": 0.5137378155119964,
      "learning_rate": 3.91328619062782e-05,
      "loss": 1.5548,
      "num_input_tokens_seen": 27532091488,
      "step": 34994
    },
    {
      "epoch": 3.712603437301082,
      "grad_norm": 0.5274700085619201,
      "learning_rate": 3.91322886380843e-05,
      "loss": 1.5615,
      "num_input_tokens_seen": 27532878144,
      "step": 34995
    },
    {
      "epoch": 3.7127095268406536,
      "grad_norm": 0.46654200512487165,
      "learning_rate": 3.9131715358969376e-05,
      "loss": 1.5066,
      "num_input_tokens_seen": 27533664864,
      "step": 34996
    },
    {
      "epoch": 3.712815616380225,
      "grad_norm": 0.3995215635467662,
      "learning_rate": 3.913114206893389e-05,
      "loss": 1.4199,
      "num_input_tokens_seen": 27534451632,
      "step": 34997
    },
    {
      "epoch": 3.712921705919796,
      "grad_norm": 0.5155168056179904,
      "learning_rate": 3.9130568767978265e-05,
      "loss": 1.4854,
      "num_input_tokens_seen": 27535238400,
      "step": 34998
    },
    {
      "epoch": 3.7130277954593676,
      "grad_norm": 0.49178629887771175,
      "learning_rate": 3.9129995456102955e-05,
      "loss": 1.508,
      "num_input_tokens_seen": 27536025184,
      "step": 34999
    },
    {
      "epoch": 3.713133884998939,
      "grad_norm": 0.5333859502703313,
      "learning_rate": 3.91294221333084e-05,
      "loss": 1.5017,
      "num_input_tokens_seen": 27536811888,
      "step": 35000
    },
    {
      "epoch": 3.713133884998939,
      "eval_loss": 1.5939732789993286,
      "eval_runtime": 64.171,
      "eval_samples_per_second": 46.75,
      "eval_steps_per_second": 0.499,
      "num_input_tokens_seen": 27536811888,
      "step": 35000
    },
    {
      "epoch": 3.7132399745385105,
      "grad_norm": 0.42264462753200127,
      "learning_rate": 3.912884879959504e-05,
      "loss": 1.3846,
      "num_input_tokens_seen": 27537598736,
      "step": 35001
    },
    {
      "epoch": 3.713346064078082,
      "grad_norm": 0.4684547715175362,
      "learning_rate": 3.912827545496332e-05,
      "loss": 1.4165,
      "num_input_tokens_seen": 27538385456,
      "step": 35002
    },
    {
      "epoch": 3.7134521536176535,
      "grad_norm": 0.3966466452348463,
      "learning_rate": 3.912770209941369e-05,
      "loss": 1.322,
      "num_input_tokens_seen": 27539172208,
      "step": 35003
    },
    {
      "epoch": 3.713558243157225,
      "grad_norm": 0.48164493498373184,
      "learning_rate": 3.912712873294657e-05,
      "loss": 1.4032,
      "num_input_tokens_seen": 27539958944,
      "step": 35004
    },
    {
      "epoch": 3.713664332696796,
      "grad_norm": 0.3992602561083656,
      "learning_rate": 3.912655535556243e-05,
      "loss": 1.438,
      "num_input_tokens_seen": 27540745744,
      "step": 35005
    },
    {
      "epoch": 3.7137704222363674,
      "grad_norm": 0.45005048633131933,
      "learning_rate": 3.9125981967261704e-05,
      "loss": 1.4187,
      "num_input_tokens_seen": 27541532592,
      "step": 35006
    },
    {
      "epoch": 3.713876511775939,
      "grad_norm": 0.4897784713197863,
      "learning_rate": 3.912540856804483e-05,
      "loss": 1.458,
      "num_input_tokens_seen": 27542319360,
      "step": 35007
    },
    {
      "epoch": 3.7139826013155104,
      "grad_norm": 0.3974854974731843,
      "learning_rate": 3.9124835157912255e-05,
      "loss": 1.5133,
      "num_input_tokens_seen": 27543106128,
      "step": 35008
    },
    {
      "epoch": 3.714088690855082,
      "grad_norm": 0.47311699344319685,
      "learning_rate": 3.9124261736864434e-05,
      "loss": 1.5648,
      "num_input_tokens_seen": 27543892912,
      "step": 35009
    },
    {
      "epoch": 3.714194780394653,
      "grad_norm": 0.4605070613084439,
      "learning_rate": 3.912368830490178e-05,
      "loss": 1.5919,
      "num_input_tokens_seen": 27544679568,
      "step": 35010
    },
    {
      "epoch": 3.7143008699342244,
      "grad_norm": 0.452276817047943,
      "learning_rate": 3.9123114862024756e-05,
      "loss": 1.4301,
      "num_input_tokens_seen": 27545466400,
      "step": 35011
    },
    {
      "epoch": 3.714406959473796,
      "grad_norm": 0.47286949582941556,
      "learning_rate": 3.912254140823381e-05,
      "loss": 1.4152,
      "num_input_tokens_seen": 27546253264,
      "step": 35012
    },
    {
      "epoch": 3.7145130490133673,
      "grad_norm": 0.43143841282705403,
      "learning_rate": 3.912196794352938e-05,
      "loss": 1.4837,
      "num_input_tokens_seen": 27547040096,
      "step": 35013
    },
    {
      "epoch": 3.714619138552939,
      "grad_norm": 0.43220482926229126,
      "learning_rate": 3.91213944679119e-05,
      "loss": 1.4668,
      "num_input_tokens_seen": 27547826912,
      "step": 35014
    },
    {
      "epoch": 3.71472522809251,
      "grad_norm": 0.5018315213082721,
      "learning_rate": 3.912082098138183e-05,
      "loss": 1.5463,
      "num_input_tokens_seen": 27548613696,
      "step": 35015
    },
    {
      "epoch": 3.7148313176320817,
      "grad_norm": 0.4898313096247037,
      "learning_rate": 3.9120247483939597e-05,
      "loss": 1.5065,
      "num_input_tokens_seen": 27549400480,
      "step": 35016
    },
    {
      "epoch": 3.7149374071716528,
      "grad_norm": 0.4573702696781005,
      "learning_rate": 3.911967397558566e-05,
      "loss": 1.4339,
      "num_input_tokens_seen": 27550187264,
      "step": 35017
    },
    {
      "epoch": 3.7150434967112242,
      "grad_norm": 0.44588137128684946,
      "learning_rate": 3.911910045632044e-05,
      "loss": 1.4351,
      "num_input_tokens_seen": 27550974016,
      "step": 35018
    },
    {
      "epoch": 3.7151495862507957,
      "grad_norm": 0.5038275383852561,
      "learning_rate": 3.91185269261444e-05,
      "loss": 1.4208,
      "num_input_tokens_seen": 27551760752,
      "step": 35019
    },
    {
      "epoch": 3.715255675790367,
      "grad_norm": 0.4119382768305259,
      "learning_rate": 3.911795338505798e-05,
      "loss": 1.3512,
      "num_input_tokens_seen": 27552547392,
      "step": 35020
    },
    {
      "epoch": 3.7153617653299387,
      "grad_norm": 0.5161250695306223,
      "learning_rate": 3.9117379833061615e-05,
      "loss": 1.4633,
      "num_input_tokens_seen": 27553334112,
      "step": 35021
    },
    {
      "epoch": 3.7154678548695097,
      "grad_norm": 0.4235999614857138,
      "learning_rate": 3.9116806270155745e-05,
      "loss": 1.4261,
      "num_input_tokens_seen": 27554120960,
      "step": 35022
    },
    {
      "epoch": 3.715573944409081,
      "grad_norm": 0.577575454388341,
      "learning_rate": 3.911623269634084e-05,
      "loss": 1.356,
      "num_input_tokens_seen": 27554907744,
      "step": 35023
    },
    {
      "epoch": 3.7156800339486526,
      "grad_norm": 0.5727384499937928,
      "learning_rate": 3.911565911161731e-05,
      "loss": 1.6829,
      "num_input_tokens_seen": 27555694480,
      "step": 35024
    },
    {
      "epoch": 3.715786123488224,
      "grad_norm": 0.4576926451412897,
      "learning_rate": 3.911508551598562e-05,
      "loss": 1.339,
      "num_input_tokens_seen": 27556481360,
      "step": 35025
    },
    {
      "epoch": 3.7158922130277956,
      "grad_norm": 0.5871829952664096,
      "learning_rate": 3.911451190944621e-05,
      "loss": 1.482,
      "num_input_tokens_seen": 27557268112,
      "step": 35026
    },
    {
      "epoch": 3.7159983025673666,
      "grad_norm": 0.46318005764862,
      "learning_rate": 3.9113938291999507e-05,
      "loss": 1.4324,
      "num_input_tokens_seen": 27558054928,
      "step": 35027
    },
    {
      "epoch": 3.716104392106938,
      "grad_norm": 0.5907136722565238,
      "learning_rate": 3.9113364663645976e-05,
      "loss": 1.4789,
      "num_input_tokens_seen": 27558841680,
      "step": 35028
    },
    {
      "epoch": 3.7162104816465096,
      "grad_norm": 0.5053720860143608,
      "learning_rate": 3.911279102438604e-05,
      "loss": 1.4365,
      "num_input_tokens_seen": 27559628432,
      "step": 35029
    },
    {
      "epoch": 3.716316571186081,
      "grad_norm": 0.5260313789206812,
      "learning_rate": 3.911221737422017e-05,
      "loss": 1.4464,
      "num_input_tokens_seen": 27560415264,
      "step": 35030
    },
    {
      "epoch": 3.7164226607256525,
      "grad_norm": 0.4690472516563776,
      "learning_rate": 3.911164371314878e-05,
      "loss": 1.416,
      "num_input_tokens_seen": 27561202016,
      "step": 35031
    },
    {
      "epoch": 3.716528750265224,
      "grad_norm": 0.4463218384676366,
      "learning_rate": 3.9111070041172324e-05,
      "loss": 1.412,
      "num_input_tokens_seen": 27561988768,
      "step": 35032
    },
    {
      "epoch": 3.7166348398047955,
      "grad_norm": 0.4508690735494478,
      "learning_rate": 3.911049635829126e-05,
      "loss": 1.5839,
      "num_input_tokens_seen": 27562775424,
      "step": 35033
    },
    {
      "epoch": 3.7167409293443665,
      "grad_norm": 0.4844149522701034,
      "learning_rate": 3.910992266450601e-05,
      "loss": 1.4608,
      "num_input_tokens_seen": 27563562144,
      "step": 35034
    },
    {
      "epoch": 3.716847018883938,
      "grad_norm": 0.4068426766211299,
      "learning_rate": 3.9109348959817024e-05,
      "loss": 1.4054,
      "num_input_tokens_seen": 27564348928,
      "step": 35035
    },
    {
      "epoch": 3.7169531084235095,
      "grad_norm": 0.5381601687131518,
      "learning_rate": 3.910877524422475e-05,
      "loss": 1.4068,
      "num_input_tokens_seen": 27565135680,
      "step": 35036
    },
    {
      "epoch": 3.717059197963081,
      "grad_norm": 0.47142936199953306,
      "learning_rate": 3.9108201517729626e-05,
      "loss": 1.5299,
      "num_input_tokens_seen": 27565922432,
      "step": 35037
    },
    {
      "epoch": 3.7171652875026524,
      "grad_norm": 0.43411164383125433,
      "learning_rate": 3.91076277803321e-05,
      "loss": 1.4085,
      "num_input_tokens_seen": 27566709216,
      "step": 35038
    },
    {
      "epoch": 3.7172713770422234,
      "grad_norm": 0.42567806213280684,
      "learning_rate": 3.9107054032032615e-05,
      "loss": 1.3101,
      "num_input_tokens_seen": 27567496032,
      "step": 35039
    },
    {
      "epoch": 3.717377466581795,
      "grad_norm": 0.46753082194242207,
      "learning_rate": 3.910648027283161e-05,
      "loss": 1.4984,
      "num_input_tokens_seen": 27568282720,
      "step": 35040
    },
    {
      "epoch": 3.7174835561213664,
      "grad_norm": 0.4662096222271193,
      "learning_rate": 3.910590650272953e-05,
      "loss": 1.4395,
      "num_input_tokens_seen": 27569069520,
      "step": 35041
    },
    {
      "epoch": 3.717589645660938,
      "grad_norm": 0.5560077012780269,
      "learning_rate": 3.9105332721726824e-05,
      "loss": 1.4818,
      "num_input_tokens_seen": 27569856256,
      "step": 35042
    },
    {
      "epoch": 3.7176957352005093,
      "grad_norm": 0.5855148727093085,
      "learning_rate": 3.910475892982392e-05,
      "loss": 1.4949,
      "num_input_tokens_seen": 27570642992,
      "step": 35043
    },
    {
      "epoch": 3.7178018247400804,
      "grad_norm": 0.4390705422272241,
      "learning_rate": 3.910418512702129e-05,
      "loss": 1.3874,
      "num_input_tokens_seen": 27571429728,
      "step": 35044
    },
    {
      "epoch": 3.7179079142796523,
      "grad_norm": 0.4217544384889393,
      "learning_rate": 3.9103611313319343e-05,
      "loss": 1.3997,
      "num_input_tokens_seen": 27572216512,
      "step": 35045
    },
    {
      "epoch": 3.7180140038192233,
      "grad_norm": 0.4165382530755499,
      "learning_rate": 3.910303748871855e-05,
      "loss": 1.3578,
      "num_input_tokens_seen": 27573003328,
      "step": 35046
    },
    {
      "epoch": 3.718120093358795,
      "grad_norm": 0.45361169998627743,
      "learning_rate": 3.910246365321933e-05,
      "loss": 1.4025,
      "num_input_tokens_seen": 27573790096,
      "step": 35047
    },
    {
      "epoch": 3.7182261828983663,
      "grad_norm": 0.41563182566916923,
      "learning_rate": 3.9101889806822154e-05,
      "loss": 1.4576,
      "num_input_tokens_seen": 27574576816,
      "step": 35048
    },
    {
      "epoch": 3.7183322724379377,
      "grad_norm": 0.4396941189327463,
      "learning_rate": 3.910131594952745e-05,
      "loss": 1.369,
      "num_input_tokens_seen": 27575363504,
      "step": 35049
    },
    {
      "epoch": 3.718438361977509,
      "grad_norm": 0.3983568832014618,
      "learning_rate": 3.910074208133566e-05,
      "loss": 1.3443,
      "num_input_tokens_seen": 27576150304,
      "step": 35050
    },
    {
      "epoch": 3.7185444515170802,
      "grad_norm": 0.45442917075241085,
      "learning_rate": 3.910016820224723e-05,
      "loss": 1.393,
      "num_input_tokens_seen": 27576937136,
      "step": 35051
    },
    {
      "epoch": 3.7186505410566517,
      "grad_norm": 0.5479475832866451,
      "learning_rate": 3.90995943122626e-05,
      "loss": 1.5868,
      "num_input_tokens_seen": 27577723888,
      "step": 35052
    },
    {
      "epoch": 3.718756630596223,
      "grad_norm": 0.5030728545467813,
      "learning_rate": 3.9099020411382226e-05,
      "loss": 1.4577,
      "num_input_tokens_seen": 27578510656,
      "step": 35053
    },
    {
      "epoch": 3.7188627201357947,
      "grad_norm": 0.4556124991728682,
      "learning_rate": 3.909844649960653e-05,
      "loss": 1.4461,
      "num_input_tokens_seen": 27579297456,
      "step": 35054
    },
    {
      "epoch": 3.718968809675366,
      "grad_norm": 0.4447406808005528,
      "learning_rate": 3.909787257693598e-05,
      "loss": 1.5349,
      "num_input_tokens_seen": 27580084272,
      "step": 35055
    },
    {
      "epoch": 3.719074899214937,
      "grad_norm": 0.4083453662774401,
      "learning_rate": 3.909729864337101e-05,
      "loss": 1.4702,
      "num_input_tokens_seen": 27580871008,
      "step": 35056
    },
    {
      "epoch": 3.7191809887545086,
      "grad_norm": 0.43787638122566136,
      "learning_rate": 3.9096724698912045e-05,
      "loss": 1.3883,
      "num_input_tokens_seen": 27581657792,
      "step": 35057
    },
    {
      "epoch": 3.71928707829408,
      "grad_norm": 0.3757584407817867,
      "learning_rate": 3.9096150743559555e-05,
      "loss": 1.3564,
      "num_input_tokens_seen": 27582444560,
      "step": 35058
    },
    {
      "epoch": 3.7193931678336516,
      "grad_norm": 0.4709971141015486,
      "learning_rate": 3.909557677731397e-05,
      "loss": 1.5564,
      "num_input_tokens_seen": 27583231376,
      "step": 35059
    },
    {
      "epoch": 3.719499257373223,
      "grad_norm": 0.4437778817721945,
      "learning_rate": 3.909500280017574e-05,
      "loss": 1.5269,
      "num_input_tokens_seen": 27584018176,
      "step": 35060
    },
    {
      "epoch": 3.7196053469127945,
      "grad_norm": 0.3980244526880374,
      "learning_rate": 3.90944288121453e-05,
      "loss": 1.4038,
      "num_input_tokens_seen": 27584804864,
      "step": 35061
    },
    {
      "epoch": 3.719711436452366,
      "grad_norm": 0.4409160523308971,
      "learning_rate": 3.909385481322311e-05,
      "loss": 1.5443,
      "num_input_tokens_seen": 27585591648,
      "step": 35062
    },
    {
      "epoch": 3.719817525991937,
      "grad_norm": 0.5582512183644912,
      "learning_rate": 3.909328080340959e-05,
      "loss": 1.5488,
      "num_input_tokens_seen": 27586378368,
      "step": 35063
    },
    {
      "epoch": 3.7199236155315085,
      "grad_norm": 0.5119249447549432,
      "learning_rate": 3.909270678270521e-05,
      "loss": 1.4084,
      "num_input_tokens_seen": 27587165120,
      "step": 35064
    },
    {
      "epoch": 3.72002970507108,
      "grad_norm": 0.46299824755379865,
      "learning_rate": 3.909213275111039e-05,
      "loss": 1.4517,
      "num_input_tokens_seen": 27587951936,
      "step": 35065
    },
    {
      "epoch": 3.7201357946106515,
      "grad_norm": 0.4384320728098736,
      "learning_rate": 3.9091558708625584e-05,
      "loss": 1.4083,
      "num_input_tokens_seen": 27588738736,
      "step": 35066
    },
    {
      "epoch": 3.720241884150223,
      "grad_norm": 0.4465837364257814,
      "learning_rate": 3.909098465525124e-05,
      "loss": 1.4331,
      "num_input_tokens_seen": 27589525552,
      "step": 35067
    },
    {
      "epoch": 3.720347973689794,
      "grad_norm": 0.4675062852977758,
      "learning_rate": 3.909041059098779e-05,
      "loss": 1.4505,
      "num_input_tokens_seen": 27590312304,
      "step": 35068
    },
    {
      "epoch": 3.7204540632293654,
      "grad_norm": 0.47394804236200533,
      "learning_rate": 3.908983651583569e-05,
      "loss": 1.5123,
      "num_input_tokens_seen": 27591098976,
      "step": 35069
    },
    {
      "epoch": 3.720560152768937,
      "grad_norm": 0.43308533616835126,
      "learning_rate": 3.908926242979537e-05,
      "loss": 1.3545,
      "num_input_tokens_seen": 27591885744,
      "step": 35070
    },
    {
      "epoch": 3.7206662423085084,
      "grad_norm": 0.5014050443339353,
      "learning_rate": 3.908868833286728e-05,
      "loss": 1.4526,
      "num_input_tokens_seen": 27592672496,
      "step": 35071
    },
    {
      "epoch": 3.72077233184808,
      "grad_norm": 0.4152741665672265,
      "learning_rate": 3.908811422505188e-05,
      "loss": 1.3772,
      "num_input_tokens_seen": 27593459216,
      "step": 35072
    },
    {
      "epoch": 3.720878421387651,
      "grad_norm": 0.3870611909304976,
      "learning_rate": 3.9087540106349585e-05,
      "loss": 1.439,
      "num_input_tokens_seen": 27594246064,
      "step": 35073
    },
    {
      "epoch": 3.720984510927223,
      "grad_norm": 0.5104427077313627,
      "learning_rate": 3.908696597676086e-05,
      "loss": 1.5878,
      "num_input_tokens_seen": 27595032736,
      "step": 35074
    },
    {
      "epoch": 3.721090600466794,
      "grad_norm": 0.44161287201781124,
      "learning_rate": 3.908639183628613e-05,
      "loss": 1.4043,
      "num_input_tokens_seen": 27595819680,
      "step": 35075
    },
    {
      "epoch": 3.7211966900063653,
      "grad_norm": 0.42454007978367414,
      "learning_rate": 3.908581768492586e-05,
      "loss": 1.485,
      "num_input_tokens_seen": 27596606496,
      "step": 35076
    },
    {
      "epoch": 3.721302779545937,
      "grad_norm": 0.40938617171768166,
      "learning_rate": 3.9085243522680485e-05,
      "loss": 1.3308,
      "num_input_tokens_seen": 27597393312,
      "step": 35077
    },
    {
      "epoch": 3.7214088690855083,
      "grad_norm": 0.4648043297965854,
      "learning_rate": 3.908466934955044e-05,
      "loss": 1.461,
      "num_input_tokens_seen": 27598180016,
      "step": 35078
    },
    {
      "epoch": 3.7215149586250797,
      "grad_norm": 0.449225776256096,
      "learning_rate": 3.9084095165536185e-05,
      "loss": 1.4531,
      "num_input_tokens_seen": 27598966720,
      "step": 35079
    },
    {
      "epoch": 3.721621048164651,
      "grad_norm": 0.6118685296627141,
      "learning_rate": 3.908352097063814e-05,
      "loss": 1.4906,
      "num_input_tokens_seen": 27599753488,
      "step": 35080
    },
    {
      "epoch": 3.7217271377042223,
      "grad_norm": 0.4461029143631233,
      "learning_rate": 3.9082946764856776e-05,
      "loss": 1.3223,
      "num_input_tokens_seen": 27600540368,
      "step": 35081
    },
    {
      "epoch": 3.7218332272437937,
      "grad_norm": 0.4912125449022394,
      "learning_rate": 3.908237254819253e-05,
      "loss": 1.5058,
      "num_input_tokens_seen": 27601327168,
      "step": 35082
    },
    {
      "epoch": 3.721939316783365,
      "grad_norm": 0.4754291600809001,
      "learning_rate": 3.9081798320645823e-05,
      "loss": 1.4227,
      "num_input_tokens_seen": 27602113968,
      "step": 35083
    },
    {
      "epoch": 3.7220454063229367,
      "grad_norm": 0.5304770581773335,
      "learning_rate": 3.9081224082217124e-05,
      "loss": 1.5387,
      "num_input_tokens_seen": 27602900768,
      "step": 35084
    },
    {
      "epoch": 3.7221514958625077,
      "grad_norm": 0.49538846767527345,
      "learning_rate": 3.908064983290686e-05,
      "loss": 1.4353,
      "num_input_tokens_seen": 27603687536,
      "step": 35085
    },
    {
      "epoch": 3.7222575854020796,
      "grad_norm": 0.455046505707321,
      "learning_rate": 3.908007557271549e-05,
      "loss": 1.51,
      "num_input_tokens_seen": 27604474272,
      "step": 35086
    },
    {
      "epoch": 3.7223636749416507,
      "grad_norm": 0.46676893750094534,
      "learning_rate": 3.907950130164345e-05,
      "loss": 1.4397,
      "num_input_tokens_seen": 27605261072,
      "step": 35087
    },
    {
      "epoch": 3.722469764481222,
      "grad_norm": 0.5215390373012241,
      "learning_rate": 3.907892701969118e-05,
      "loss": 1.4289,
      "num_input_tokens_seen": 27606047792,
      "step": 35088
    },
    {
      "epoch": 3.7225758540207936,
      "grad_norm": 0.5364538722408122,
      "learning_rate": 3.9078352726859135e-05,
      "loss": 1.5134,
      "num_input_tokens_seen": 27606834512,
      "step": 35089
    },
    {
      "epoch": 3.722681943560365,
      "grad_norm": 0.5678547711044997,
      "learning_rate": 3.907777842314775e-05,
      "loss": 1.3967,
      "num_input_tokens_seen": 27607621296,
      "step": 35090
    },
    {
      "epoch": 3.7227880330999366,
      "grad_norm": 0.5237675863956397,
      "learning_rate": 3.907720410855747e-05,
      "loss": 1.6332,
      "num_input_tokens_seen": 27608408000,
      "step": 35091
    },
    {
      "epoch": 3.7228941226395076,
      "grad_norm": 0.42812212675343875,
      "learning_rate": 3.907662978308874e-05,
      "loss": 1.5416,
      "num_input_tokens_seen": 27609194832,
      "step": 35092
    },
    {
      "epoch": 3.723000212179079,
      "grad_norm": 0.5109953972621314,
      "learning_rate": 3.9076055446742e-05,
      "loss": 1.4281,
      "num_input_tokens_seen": 27609981520,
      "step": 35093
    },
    {
      "epoch": 3.7231063017186505,
      "grad_norm": 0.47247462325886885,
      "learning_rate": 3.907548109951771e-05,
      "loss": 1.4709,
      "num_input_tokens_seen": 27610768288,
      "step": 35094
    },
    {
      "epoch": 3.723212391258222,
      "grad_norm": 0.49458668076386963,
      "learning_rate": 3.907490674141629e-05,
      "loss": 1.4736,
      "num_input_tokens_seen": 27611555008,
      "step": 35095
    },
    {
      "epoch": 3.7233184807977935,
      "grad_norm": 0.5118365149393427,
      "learning_rate": 3.907433237243819e-05,
      "loss": 1.6517,
      "num_input_tokens_seen": 27612341728,
      "step": 35096
    },
    {
      "epoch": 3.7234245703373645,
      "grad_norm": 0.44492731395912793,
      "learning_rate": 3.907375799258387e-05,
      "loss": 1.3783,
      "num_input_tokens_seen": 27613128496,
      "step": 35097
    },
    {
      "epoch": 3.723530659876936,
      "grad_norm": 0.46715867620365276,
      "learning_rate": 3.9073183601853756e-05,
      "loss": 1.4386,
      "num_input_tokens_seen": 27613915280,
      "step": 35098
    },
    {
      "epoch": 3.7236367494165075,
      "grad_norm": 0.43557895940941777,
      "learning_rate": 3.9072609200248306e-05,
      "loss": 1.3696,
      "num_input_tokens_seen": 27614702016,
      "step": 35099
    },
    {
      "epoch": 3.723742838956079,
      "grad_norm": 0.6024625803703706,
      "learning_rate": 3.907203478776795e-05,
      "loss": 1.4231,
      "num_input_tokens_seen": 27615488800,
      "step": 35100
    },
    {
      "epoch": 3.7238489284956504,
      "grad_norm": 0.4398117168973877,
      "learning_rate": 3.907146036441314e-05,
      "loss": 1.4437,
      "num_input_tokens_seen": 27616275488,
      "step": 35101
    },
    {
      "epoch": 3.723955018035222,
      "grad_norm": 0.45089071827207305,
      "learning_rate": 3.907088593018432e-05,
      "loss": 1.4724,
      "num_input_tokens_seen": 27617062240,
      "step": 35102
    },
    {
      "epoch": 3.7240611075747934,
      "grad_norm": 0.4093865591468766,
      "learning_rate": 3.907031148508193e-05,
      "loss": 1.4065,
      "num_input_tokens_seen": 27617849072,
      "step": 35103
    },
    {
      "epoch": 3.7241671971143644,
      "grad_norm": 0.3936645551902304,
      "learning_rate": 3.906973702910642e-05,
      "loss": 1.4235,
      "num_input_tokens_seen": 27618635856,
      "step": 35104
    },
    {
      "epoch": 3.724273286653936,
      "grad_norm": 0.4429126421583358,
      "learning_rate": 3.906916256225823e-05,
      "loss": 1.4835,
      "num_input_tokens_seen": 27619422544,
      "step": 35105
    },
    {
      "epoch": 3.7243793761935073,
      "grad_norm": 0.494794567592568,
      "learning_rate": 3.90685880845378e-05,
      "loss": 1.5133,
      "num_input_tokens_seen": 27620209360,
      "step": 35106
    },
    {
      "epoch": 3.724485465733079,
      "grad_norm": 0.417232135593348,
      "learning_rate": 3.9068013595945576e-05,
      "loss": 1.3819,
      "num_input_tokens_seen": 27620996144,
      "step": 35107
    },
    {
      "epoch": 3.7245915552726503,
      "grad_norm": 0.46306367799046344,
      "learning_rate": 3.9067439096482004e-05,
      "loss": 1.4128,
      "num_input_tokens_seen": 27621783040,
      "step": 35108
    },
    {
      "epoch": 3.7246976448122213,
      "grad_norm": 0.4314483749730331,
      "learning_rate": 3.9066864586147537e-05,
      "loss": 1.4751,
      "num_input_tokens_seen": 27622569824,
      "step": 35109
    },
    {
      "epoch": 3.724803734351793,
      "grad_norm": 0.43014567160767364,
      "learning_rate": 3.90662900649426e-05,
      "loss": 1.4374,
      "num_input_tokens_seen": 27623356544,
      "step": 35110
    },
    {
      "epoch": 3.7249098238913643,
      "grad_norm": 0.49416321891977955,
      "learning_rate": 3.906571553286765e-05,
      "loss": 1.4567,
      "num_input_tokens_seen": 27624143456,
      "step": 35111
    },
    {
      "epoch": 3.7250159134309357,
      "grad_norm": 0.500195829839439,
      "learning_rate": 3.906514098992313e-05,
      "loss": 1.4918,
      "num_input_tokens_seen": 27624930176,
      "step": 35112
    },
    {
      "epoch": 3.725122002970507,
      "grad_norm": 0.5490169608340475,
      "learning_rate": 3.906456643610949e-05,
      "loss": 1.406,
      "num_input_tokens_seen": 27625716944,
      "step": 35113
    },
    {
      "epoch": 3.7252280925100782,
      "grad_norm": 0.48503143369745677,
      "learning_rate": 3.906399187142715e-05,
      "loss": 1.3855,
      "num_input_tokens_seen": 27626503664,
      "step": 35114
    },
    {
      "epoch": 3.72533418204965,
      "grad_norm": 0.539640934736316,
      "learning_rate": 3.906341729587657e-05,
      "loss": 1.5444,
      "num_input_tokens_seen": 27627290400,
      "step": 35115
    },
    {
      "epoch": 3.725440271589221,
      "grad_norm": 0.4464681794920445,
      "learning_rate": 3.9062842709458205e-05,
      "loss": 1.4538,
      "num_input_tokens_seen": 27628077136,
      "step": 35116
    },
    {
      "epoch": 3.7255463611287927,
      "grad_norm": 0.5218374577431472,
      "learning_rate": 3.9062268112172485e-05,
      "loss": 1.4316,
      "num_input_tokens_seen": 27628863888,
      "step": 35117
    },
    {
      "epoch": 3.725652450668364,
      "grad_norm": 0.4911229282498107,
      "learning_rate": 3.906169350401985e-05,
      "loss": 1.4941,
      "num_input_tokens_seen": 27629650624,
      "step": 35118
    },
    {
      "epoch": 3.7257585402079356,
      "grad_norm": 0.4394041513934051,
      "learning_rate": 3.906111888500076e-05,
      "loss": 1.5532,
      "num_input_tokens_seen": 27630437376,
      "step": 35119
    },
    {
      "epoch": 3.725864629747507,
      "grad_norm": 0.4480538678639815,
      "learning_rate": 3.906054425511564e-05,
      "loss": 1.4241,
      "num_input_tokens_seen": 27631224192,
      "step": 35120
    },
    {
      "epoch": 3.725970719287078,
      "grad_norm": 0.4059383910568055,
      "learning_rate": 3.905996961436495e-05,
      "loss": 1.4095,
      "num_input_tokens_seen": 27632010992,
      "step": 35121
    },
    {
      "epoch": 3.7260768088266496,
      "grad_norm": 0.5177531463377912,
      "learning_rate": 3.905939496274913e-05,
      "loss": 1.51,
      "num_input_tokens_seen": 27632797712,
      "step": 35122
    },
    {
      "epoch": 3.726182898366221,
      "grad_norm": 0.39851076906902927,
      "learning_rate": 3.905882030026862e-05,
      "loss": 1.3819,
      "num_input_tokens_seen": 27633584528,
      "step": 35123
    },
    {
      "epoch": 3.7262889879057925,
      "grad_norm": 0.45752649988489075,
      "learning_rate": 3.905824562692386e-05,
      "loss": 1.3392,
      "num_input_tokens_seen": 27634371280,
      "step": 35124
    },
    {
      "epoch": 3.726395077445364,
      "grad_norm": 0.4171028031834371,
      "learning_rate": 3.90576709427153e-05,
      "loss": 1.4454,
      "num_input_tokens_seen": 27635158032,
      "step": 35125
    },
    {
      "epoch": 3.726501166984935,
      "grad_norm": 0.474966578896757,
      "learning_rate": 3.9057096247643396e-05,
      "loss": 1.4636,
      "num_input_tokens_seen": 27635944768,
      "step": 35126
    },
    {
      "epoch": 3.7266072565245065,
      "grad_norm": 0.43338594657279084,
      "learning_rate": 3.905652154170857e-05,
      "loss": 1.4521,
      "num_input_tokens_seen": 27636731600,
      "step": 35127
    },
    {
      "epoch": 3.726713346064078,
      "grad_norm": 0.395981158898342,
      "learning_rate": 3.9055946824911285e-05,
      "loss": 1.374,
      "num_input_tokens_seen": 27637518416,
      "step": 35128
    },
    {
      "epoch": 3.7268194356036495,
      "grad_norm": 0.47648875804623697,
      "learning_rate": 3.9055372097251975e-05,
      "loss": 1.5067,
      "num_input_tokens_seen": 27638305232,
      "step": 35129
    },
    {
      "epoch": 3.726925525143221,
      "grad_norm": 0.4227512179978971,
      "learning_rate": 3.905479735873108e-05,
      "loss": 1.3744,
      "num_input_tokens_seen": 27639092064,
      "step": 35130
    },
    {
      "epoch": 3.7270316146827924,
      "grad_norm": 0.5443589247616228,
      "learning_rate": 3.905422260934905e-05,
      "loss": 1.5161,
      "num_input_tokens_seen": 27639878912,
      "step": 35131
    },
    {
      "epoch": 3.727137704222364,
      "grad_norm": 0.4212248044574438,
      "learning_rate": 3.905364784910633e-05,
      "loss": 1.5167,
      "num_input_tokens_seen": 27640665632,
      "step": 35132
    },
    {
      "epoch": 3.727243793761935,
      "grad_norm": 0.6776972120382455,
      "learning_rate": 3.9053073078003366e-05,
      "loss": 1.4812,
      "num_input_tokens_seen": 27641452416,
      "step": 35133
    },
    {
      "epoch": 3.7273498833015064,
      "grad_norm": 0.4577894817640588,
      "learning_rate": 3.90524982960406e-05,
      "loss": 1.5188,
      "num_input_tokens_seen": 27642239184,
      "step": 35134
    },
    {
      "epoch": 3.727455972841078,
      "grad_norm": 0.537194004066897,
      "learning_rate": 3.905192350321847e-05,
      "loss": 1.5264,
      "num_input_tokens_seen": 27643025984,
      "step": 35135
    },
    {
      "epoch": 3.7275620623806494,
      "grad_norm": 0.545986335543081,
      "learning_rate": 3.9051348699537434e-05,
      "loss": 1.3774,
      "num_input_tokens_seen": 27643812752,
      "step": 35136
    },
    {
      "epoch": 3.727668151920221,
      "grad_norm": 0.39552122064931694,
      "learning_rate": 3.905077388499793e-05,
      "loss": 1.4366,
      "num_input_tokens_seen": 27644599456,
      "step": 35137
    },
    {
      "epoch": 3.727774241459792,
      "grad_norm": 0.642257102688003,
      "learning_rate": 3.905019905960039e-05,
      "loss": 1.401,
      "num_input_tokens_seen": 27645386304,
      "step": 35138
    },
    {
      "epoch": 3.7278803309993633,
      "grad_norm": 0.5172973212198323,
      "learning_rate": 3.9049624223345273e-05,
      "loss": 1.4268,
      "num_input_tokens_seen": 27646173104,
      "step": 35139
    },
    {
      "epoch": 3.727986420538935,
      "grad_norm": 0.6177718720140057,
      "learning_rate": 3.904904937623301e-05,
      "loss": 1.5091,
      "num_input_tokens_seen": 27646959968,
      "step": 35140
    },
    {
      "epoch": 3.7280925100785063,
      "grad_norm": 0.6126036044325108,
      "learning_rate": 3.9048474518264074e-05,
      "loss": 1.4433,
      "num_input_tokens_seen": 27647746656,
      "step": 35141
    },
    {
      "epoch": 3.7281985996180778,
      "grad_norm": 0.499262252027153,
      "learning_rate": 3.9047899649438877e-05,
      "loss": 1.4849,
      "num_input_tokens_seen": 27648533424,
      "step": 35142
    },
    {
      "epoch": 3.728304689157649,
      "grad_norm": 0.6152817767352156,
      "learning_rate": 3.9047324769757874e-05,
      "loss": 1.5677,
      "num_input_tokens_seen": 27649320160,
      "step": 35143
    },
    {
      "epoch": 3.7284107786972207,
      "grad_norm": 0.44238259622088216,
      "learning_rate": 3.9046749879221515e-05,
      "loss": 1.3809,
      "num_input_tokens_seen": 27650106896,
      "step": 35144
    },
    {
      "epoch": 3.7285168682367917,
      "grad_norm": 0.5437799971676972,
      "learning_rate": 3.904617497783024e-05,
      "loss": 1.5331,
      "num_input_tokens_seen": 27650893648,
      "step": 35145
    },
    {
      "epoch": 3.728622957776363,
      "grad_norm": 0.5987481689361994,
      "learning_rate": 3.9045600065584485e-05,
      "loss": 1.5244,
      "num_input_tokens_seen": 27651680368,
      "step": 35146
    },
    {
      "epoch": 3.7287290473159347,
      "grad_norm": 0.5221373117656243,
      "learning_rate": 3.904502514248471e-05,
      "loss": 1.4652,
      "num_input_tokens_seen": 27652467088,
      "step": 35147
    },
    {
      "epoch": 3.728835136855506,
      "grad_norm": 0.5431254186297007,
      "learning_rate": 3.9044450208531345e-05,
      "loss": 1.3719,
      "num_input_tokens_seen": 27653253904,
      "step": 35148
    },
    {
      "epoch": 3.7289412263950776,
      "grad_norm": 0.5435716481180377,
      "learning_rate": 3.904387526372485e-05,
      "loss": 1.3895,
      "num_input_tokens_seen": 27654040608,
      "step": 35149
    },
    {
      "epoch": 3.7290473159346487,
      "grad_norm": 0.4289178774833618,
      "learning_rate": 3.904330030806566e-05,
      "loss": 1.5431,
      "num_input_tokens_seen": 27654827296,
      "step": 35150
    },
    {
      "epoch": 3.72915340547422,
      "grad_norm": 0.4405618052637882,
      "learning_rate": 3.904272534155421e-05,
      "loss": 1.3393,
      "num_input_tokens_seen": 27655614080,
      "step": 35151
    },
    {
      "epoch": 3.7292594950137916,
      "grad_norm": 0.6324209025807596,
      "learning_rate": 3.9042150364190964e-05,
      "loss": 1.5056,
      "num_input_tokens_seen": 27656400928,
      "step": 35152
    },
    {
      "epoch": 3.729365584553363,
      "grad_norm": 0.410185868321639,
      "learning_rate": 3.904157537597635e-05,
      "loss": 1.3973,
      "num_input_tokens_seen": 27657187712,
      "step": 35153
    },
    {
      "epoch": 3.7294716740929346,
      "grad_norm": 0.5535776341385761,
      "learning_rate": 3.904100037691082e-05,
      "loss": 1.4082,
      "num_input_tokens_seen": 27657974608,
      "step": 35154
    },
    {
      "epoch": 3.7295777636325056,
      "grad_norm": 0.4745434330547557,
      "learning_rate": 3.9040425366994814e-05,
      "loss": 1.4351,
      "num_input_tokens_seen": 27658761392,
      "step": 35155
    },
    {
      "epoch": 3.729683853172077,
      "grad_norm": 0.4338164003367998,
      "learning_rate": 3.9039850346228785e-05,
      "loss": 1.4579,
      "num_input_tokens_seen": 27659548192,
      "step": 35156
    },
    {
      "epoch": 3.7297899427116485,
      "grad_norm": 0.4129080910753938,
      "learning_rate": 3.9039275314613165e-05,
      "loss": 1.3134,
      "num_input_tokens_seen": 27660334960,
      "step": 35157
    },
    {
      "epoch": 3.72989603225122,
      "grad_norm": 0.46309208270381574,
      "learning_rate": 3.9038700272148416e-05,
      "loss": 1.4334,
      "num_input_tokens_seen": 27661121696,
      "step": 35158
    },
    {
      "epoch": 3.7300021217907915,
      "grad_norm": 0.4956297488616739,
      "learning_rate": 3.903812521883496e-05,
      "loss": 1.3278,
      "num_input_tokens_seen": 27661908448,
      "step": 35159
    },
    {
      "epoch": 3.730108211330363,
      "grad_norm": 0.4408401576331355,
      "learning_rate": 3.903755015467326e-05,
      "loss": 1.3875,
      "num_input_tokens_seen": 27662695216,
      "step": 35160
    },
    {
      "epoch": 3.7302143008699344,
      "grad_norm": 0.4439094334599459,
      "learning_rate": 3.903697507966375e-05,
      "loss": 1.3951,
      "num_input_tokens_seen": 27663481968,
      "step": 35161
    },
    {
      "epoch": 3.7303203904095055,
      "grad_norm": 0.5620539642607373,
      "learning_rate": 3.903639999380688e-05,
      "loss": 1.4986,
      "num_input_tokens_seen": 27664268768,
      "step": 35162
    },
    {
      "epoch": 3.730426479949077,
      "grad_norm": 0.40007786737740403,
      "learning_rate": 3.903582489710309e-05,
      "loss": 1.5546,
      "num_input_tokens_seen": 27665055536,
      "step": 35163
    },
    {
      "epoch": 3.7305325694886484,
      "grad_norm": 0.6780394334400484,
      "learning_rate": 3.903524978955282e-05,
      "loss": 1.5427,
      "num_input_tokens_seen": 27665842352,
      "step": 35164
    },
    {
      "epoch": 3.73063865902822,
      "grad_norm": 0.38956325192276253,
      "learning_rate": 3.9034674671156534e-05,
      "loss": 1.2932,
      "num_input_tokens_seen": 27666629232,
      "step": 35165
    },
    {
      "epoch": 3.7307447485677914,
      "grad_norm": 0.5639384226815565,
      "learning_rate": 3.9034099541914654e-05,
      "loss": 1.5164,
      "num_input_tokens_seen": 27667415936,
      "step": 35166
    },
    {
      "epoch": 3.7308508381073624,
      "grad_norm": 0.45554663790047045,
      "learning_rate": 3.9033524401827637e-05,
      "loss": 1.3739,
      "num_input_tokens_seen": 27668202720,
      "step": 35167
    },
    {
      "epoch": 3.730956927646934,
      "grad_norm": 0.44914550094167244,
      "learning_rate": 3.903294925089592e-05,
      "loss": 1.4165,
      "num_input_tokens_seen": 27668989472,
      "step": 35168
    },
    {
      "epoch": 3.7310630171865053,
      "grad_norm": 0.689028718432014,
      "learning_rate": 3.903237408911995e-05,
      "loss": 1.5007,
      "num_input_tokens_seen": 27669776128,
      "step": 35169
    },
    {
      "epoch": 3.731169106726077,
      "grad_norm": 0.4117483663919617,
      "learning_rate": 3.903179891650018e-05,
      "loss": 1.4226,
      "num_input_tokens_seen": 27670562832,
      "step": 35170
    },
    {
      "epoch": 3.7312751962656483,
      "grad_norm": 0.4606641144871752,
      "learning_rate": 3.903122373303705e-05,
      "loss": 1.395,
      "num_input_tokens_seen": 27671349568,
      "step": 35171
    },
    {
      "epoch": 3.7313812858052198,
      "grad_norm": 0.4335357083702281,
      "learning_rate": 3.9030648538730996e-05,
      "loss": 1.3698,
      "num_input_tokens_seen": 27672136512,
      "step": 35172
    },
    {
      "epoch": 3.7314873753447912,
      "grad_norm": 0.48123668816651666,
      "learning_rate": 3.903007333358247e-05,
      "loss": 1.4995,
      "num_input_tokens_seen": 27672923280,
      "step": 35173
    },
    {
      "epoch": 3.7315934648843623,
      "grad_norm": 0.4897985928720219,
      "learning_rate": 3.9029498117591915e-05,
      "loss": 1.4437,
      "num_input_tokens_seen": 27673710032,
      "step": 35174
    },
    {
      "epoch": 3.7316995544239338,
      "grad_norm": 0.504502714437639,
      "learning_rate": 3.9028922890759765e-05,
      "loss": 1.4228,
      "num_input_tokens_seen": 27674496720,
      "step": 35175
    },
    {
      "epoch": 3.7318056439635052,
      "grad_norm": 0.4518194198658297,
      "learning_rate": 3.9028347653086494e-05,
      "loss": 1.3748,
      "num_input_tokens_seen": 27675283424,
      "step": 35176
    },
    {
      "epoch": 3.7319117335030767,
      "grad_norm": 0.4354642689843047,
      "learning_rate": 3.902777240457252e-05,
      "loss": 1.3521,
      "num_input_tokens_seen": 27676070144,
      "step": 35177
    },
    {
      "epoch": 3.732017823042648,
      "grad_norm": 0.5022098657498089,
      "learning_rate": 3.9027197145218286e-05,
      "loss": 1.4949,
      "num_input_tokens_seen": 27676856960,
      "step": 35178
    },
    {
      "epoch": 3.732123912582219,
      "grad_norm": 0.4063714014719233,
      "learning_rate": 3.902662187502426e-05,
      "loss": 1.446,
      "num_input_tokens_seen": 27677643712,
      "step": 35179
    },
    {
      "epoch": 3.7322300021217907,
      "grad_norm": 0.5272494195166978,
      "learning_rate": 3.902604659399086e-05,
      "loss": 1.6107,
      "num_input_tokens_seen": 27678430464,
      "step": 35180
    },
    {
      "epoch": 3.732336091661362,
      "grad_norm": 0.4346879865981119,
      "learning_rate": 3.902547130211854e-05,
      "loss": 1.5786,
      "num_input_tokens_seen": 27679217200,
      "step": 35181
    },
    {
      "epoch": 3.7324421812009336,
      "grad_norm": 0.45699204801535964,
      "learning_rate": 3.9024895999407763e-05,
      "loss": 1.5206,
      "num_input_tokens_seen": 27680003856,
      "step": 35182
    },
    {
      "epoch": 3.732548270740505,
      "grad_norm": 0.4391748492507099,
      "learning_rate": 3.902432068585895e-05,
      "loss": 1.447,
      "num_input_tokens_seen": 27680790624,
      "step": 35183
    },
    {
      "epoch": 3.732654360280076,
      "grad_norm": 0.3901903044524335,
      "learning_rate": 3.902374536147255e-05,
      "loss": 1.5459,
      "num_input_tokens_seen": 27681577392,
      "step": 35184
    },
    {
      "epoch": 3.732760449819648,
      "grad_norm": 0.46280069377638783,
      "learning_rate": 3.902317002624902e-05,
      "loss": 1.5737,
      "num_input_tokens_seen": 27682364208,
      "step": 35185
    },
    {
      "epoch": 3.732866539359219,
      "grad_norm": 0.41988096090160815,
      "learning_rate": 3.9022594680188787e-05,
      "loss": 1.4746,
      "num_input_tokens_seen": 27683150864,
      "step": 35186
    },
    {
      "epoch": 3.7329726288987906,
      "grad_norm": 0.41583672676791056,
      "learning_rate": 3.902201932329231e-05,
      "loss": 1.3404,
      "num_input_tokens_seen": 27683937776,
      "step": 35187
    },
    {
      "epoch": 3.733078718438362,
      "grad_norm": 0.5660658456953146,
      "learning_rate": 3.902144395556003e-05,
      "loss": 1.4386,
      "num_input_tokens_seen": 27684724512,
      "step": 35188
    },
    {
      "epoch": 3.7331848079779335,
      "grad_norm": 0.47369096574093106,
      "learning_rate": 3.902086857699238e-05,
      "loss": 1.4095,
      "num_input_tokens_seen": 27685511296,
      "step": 35189
    },
    {
      "epoch": 3.733290897517505,
      "grad_norm": 0.4904243111879626,
      "learning_rate": 3.9020293187589816e-05,
      "loss": 1.395,
      "num_input_tokens_seen": 27686298096,
      "step": 35190
    },
    {
      "epoch": 3.733396987057076,
      "grad_norm": 0.502932341197065,
      "learning_rate": 3.901971778735279e-05,
      "loss": 1.442,
      "num_input_tokens_seen": 27687084912,
      "step": 35191
    },
    {
      "epoch": 3.7335030765966475,
      "grad_norm": 0.49353572978946625,
      "learning_rate": 3.901914237628173e-05,
      "loss": 1.4828,
      "num_input_tokens_seen": 27687871728,
      "step": 35192
    },
    {
      "epoch": 3.733609166136219,
      "grad_norm": 0.4608062414947917,
      "learning_rate": 3.901856695437709e-05,
      "loss": 1.4093,
      "num_input_tokens_seen": 27688658480,
      "step": 35193
    },
    {
      "epoch": 3.7337152556757904,
      "grad_norm": 0.40480218994671907,
      "learning_rate": 3.9017991521639305e-05,
      "loss": 1.4397,
      "num_input_tokens_seen": 27689445312,
      "step": 35194
    },
    {
      "epoch": 3.733821345215362,
      "grad_norm": 0.4479542847096024,
      "learning_rate": 3.9017416078068845e-05,
      "loss": 1.4197,
      "num_input_tokens_seen": 27690232144,
      "step": 35195
    },
    {
      "epoch": 3.733927434754933,
      "grad_norm": 0.4470658414889933,
      "learning_rate": 3.901684062366613e-05,
      "loss": 1.4369,
      "num_input_tokens_seen": 27691018944,
      "step": 35196
    },
    {
      "epoch": 3.7340335242945044,
      "grad_norm": 0.4676354108200634,
      "learning_rate": 3.90162651584316e-05,
      "loss": 1.5142,
      "num_input_tokens_seen": 27691805664,
      "step": 35197
    },
    {
      "epoch": 3.734139613834076,
      "grad_norm": 0.4671742813486195,
      "learning_rate": 3.901568968236573e-05,
      "loss": 1.5547,
      "num_input_tokens_seen": 27692592400,
      "step": 35198
    },
    {
      "epoch": 3.7342457033736474,
      "grad_norm": 0.37695499654783926,
      "learning_rate": 3.901511419546893e-05,
      "loss": 1.423,
      "num_input_tokens_seen": 27693379104,
      "step": 35199
    },
    {
      "epoch": 3.734351792913219,
      "grad_norm": 0.4662044686513182,
      "learning_rate": 3.9014538697741664e-05,
      "loss": 1.4477,
      "num_input_tokens_seen": 27694165856,
      "step": 35200
    },
    {
      "epoch": 3.7344578824527903,
      "grad_norm": 0.4140864567903646,
      "learning_rate": 3.901396318918439e-05,
      "loss": 1.4046,
      "num_input_tokens_seen": 27694952640,
      "step": 35201
    },
    {
      "epoch": 3.734563971992362,
      "grad_norm": 0.5145385305856038,
      "learning_rate": 3.9013387669797516e-05,
      "loss": 1.486,
      "num_input_tokens_seen": 27695739392,
      "step": 35202
    },
    {
      "epoch": 3.734670061531933,
      "grad_norm": 0.443278392796161,
      "learning_rate": 3.9012812139581516e-05,
      "loss": 1.6213,
      "num_input_tokens_seen": 27696526096,
      "step": 35203
    },
    {
      "epoch": 3.7347761510715043,
      "grad_norm": 0.4066540159185294,
      "learning_rate": 3.901223659853682e-05,
      "loss": 1.4803,
      "num_input_tokens_seen": 27697312816,
      "step": 35204
    },
    {
      "epoch": 3.7348822406110758,
      "grad_norm": 0.399279618869451,
      "learning_rate": 3.901166104666389e-05,
      "loss": 1.4143,
      "num_input_tokens_seen": 27698099552,
      "step": 35205
    },
    {
      "epoch": 3.7349883301506472,
      "grad_norm": 0.5104202234698282,
      "learning_rate": 3.901108548396315e-05,
      "loss": 1.3908,
      "num_input_tokens_seen": 27698886304,
      "step": 35206
    },
    {
      "epoch": 3.7350944196902187,
      "grad_norm": 0.5279182241536734,
      "learning_rate": 3.901050991043506e-05,
      "loss": 1.5535,
      "num_input_tokens_seen": 27699673008,
      "step": 35207
    },
    {
      "epoch": 3.7352005092297897,
      "grad_norm": 0.5069721694764359,
      "learning_rate": 3.900993432608006e-05,
      "loss": 1.4519,
      "num_input_tokens_seen": 27700459712,
      "step": 35208
    },
    {
      "epoch": 3.735306598769361,
      "grad_norm": 0.4626290183396857,
      "learning_rate": 3.900935873089859e-05,
      "loss": 1.5346,
      "num_input_tokens_seen": 27701246496,
      "step": 35209
    },
    {
      "epoch": 3.7354126883089327,
      "grad_norm": 0.480653603902024,
      "learning_rate": 3.9008783124891097e-05,
      "loss": 1.5987,
      "num_input_tokens_seen": 27702033296,
      "step": 35210
    },
    {
      "epoch": 3.735518777848504,
      "grad_norm": 0.42883096578050084,
      "learning_rate": 3.900820750805803e-05,
      "loss": 1.4502,
      "num_input_tokens_seen": 27702820048,
      "step": 35211
    },
    {
      "epoch": 3.7356248673880756,
      "grad_norm": 0.40640884841841646,
      "learning_rate": 3.900763188039983e-05,
      "loss": 1.491,
      "num_input_tokens_seen": 27703606752,
      "step": 35212
    },
    {
      "epoch": 3.7357309569276467,
      "grad_norm": 0.4246218959421718,
      "learning_rate": 3.900705624191694e-05,
      "loss": 1.4628,
      "num_input_tokens_seen": 27704393472,
      "step": 35213
    },
    {
      "epoch": 3.7358370464672186,
      "grad_norm": 0.5779508031670652,
      "learning_rate": 3.9006480592609815e-05,
      "loss": 1.4867,
      "num_input_tokens_seen": 27705180304,
      "step": 35214
    },
    {
      "epoch": 3.7359431360067896,
      "grad_norm": 0.4161419424197287,
      "learning_rate": 3.900590493247889e-05,
      "loss": 1.3554,
      "num_input_tokens_seen": 27705967072,
      "step": 35215
    },
    {
      "epoch": 3.736049225546361,
      "grad_norm": 0.420796673575562,
      "learning_rate": 3.900532926152462e-05,
      "loss": 1.3607,
      "num_input_tokens_seen": 27706753920,
      "step": 35216
    },
    {
      "epoch": 3.7361553150859326,
      "grad_norm": 0.542862518140652,
      "learning_rate": 3.900475357974742e-05,
      "loss": 1.5121,
      "num_input_tokens_seen": 27707540768,
      "step": 35217
    },
    {
      "epoch": 3.736261404625504,
      "grad_norm": 0.4331812610537548,
      "learning_rate": 3.900417788714778e-05,
      "loss": 1.3745,
      "num_input_tokens_seen": 27708327568,
      "step": 35218
    },
    {
      "epoch": 3.7363674941650755,
      "grad_norm": 0.42690364849720575,
      "learning_rate": 3.9003602183726114e-05,
      "loss": 1.4037,
      "num_input_tokens_seen": 27709114352,
      "step": 35219
    },
    {
      "epoch": 3.7364735837046466,
      "grad_norm": 0.40688659300839364,
      "learning_rate": 3.9003026469482875e-05,
      "loss": 1.4316,
      "num_input_tokens_seen": 27709901152,
      "step": 35220
    },
    {
      "epoch": 3.736579673244218,
      "grad_norm": 0.4337024965398884,
      "learning_rate": 3.9002450744418505e-05,
      "loss": 1.4408,
      "num_input_tokens_seen": 27710687968,
      "step": 35221
    },
    {
      "epoch": 3.7366857627837895,
      "grad_norm": 0.36966765124459694,
      "learning_rate": 3.900187500853346e-05,
      "loss": 1.3321,
      "num_input_tokens_seen": 27711474720,
      "step": 35222
    },
    {
      "epoch": 3.736791852323361,
      "grad_norm": 0.4886251339873637,
      "learning_rate": 3.900129926182817e-05,
      "loss": 1.4971,
      "num_input_tokens_seen": 27712261520,
      "step": 35223
    },
    {
      "epoch": 3.7368979418629324,
      "grad_norm": 0.41079857791901675,
      "learning_rate": 3.9000723504303085e-05,
      "loss": 1.4866,
      "num_input_tokens_seen": 27713048256,
      "step": 35224
    },
    {
      "epoch": 3.7370040314025035,
      "grad_norm": 0.4955914766865331,
      "learning_rate": 3.900014773595866e-05,
      "loss": 1.4439,
      "num_input_tokens_seen": 27713835040,
      "step": 35225
    },
    {
      "epoch": 3.737110120942075,
      "grad_norm": 0.4408410036320165,
      "learning_rate": 3.8999571956795325e-05,
      "loss": 1.425,
      "num_input_tokens_seen": 27714621808,
      "step": 35226
    },
    {
      "epoch": 3.7372162104816464,
      "grad_norm": 0.39602173810560337,
      "learning_rate": 3.899899616681353e-05,
      "loss": 1.4591,
      "num_input_tokens_seen": 27715408464,
      "step": 35227
    },
    {
      "epoch": 3.737322300021218,
      "grad_norm": 0.457513560467328,
      "learning_rate": 3.899842036601373e-05,
      "loss": 1.512,
      "num_input_tokens_seen": 27716195216,
      "step": 35228
    },
    {
      "epoch": 3.7374283895607894,
      "grad_norm": 0.40511201081753806,
      "learning_rate": 3.8997844554396354e-05,
      "loss": 1.4491,
      "num_input_tokens_seen": 27716981952,
      "step": 35229
    },
    {
      "epoch": 3.737534479100361,
      "grad_norm": 0.4207835964383613,
      "learning_rate": 3.8997268731961854e-05,
      "loss": 1.4112,
      "num_input_tokens_seen": 27717768816,
      "step": 35230
    },
    {
      "epoch": 3.7376405686399323,
      "grad_norm": 0.4293899750934691,
      "learning_rate": 3.899669289871068e-05,
      "loss": 1.5125,
      "num_input_tokens_seen": 27718555584,
      "step": 35231
    },
    {
      "epoch": 3.7377466581795034,
      "grad_norm": 0.4196350670995789,
      "learning_rate": 3.899611705464327e-05,
      "loss": 1.4179,
      "num_input_tokens_seen": 27719342448,
      "step": 35232
    },
    {
      "epoch": 3.737852747719075,
      "grad_norm": 0.4206166050330477,
      "learning_rate": 3.899554119976008e-05,
      "loss": 1.3622,
      "num_input_tokens_seen": 27720129200,
      "step": 35233
    },
    {
      "epoch": 3.7379588372586463,
      "grad_norm": 0.45135652581508956,
      "learning_rate": 3.8994965334061534e-05,
      "loss": 1.4816,
      "num_input_tokens_seen": 27720916080,
      "step": 35234
    },
    {
      "epoch": 3.738064926798218,
      "grad_norm": 0.4175257147527092,
      "learning_rate": 3.89943894575481e-05,
      "loss": 1.4548,
      "num_input_tokens_seen": 27721702896,
      "step": 35235
    },
    {
      "epoch": 3.7381710163377893,
      "grad_norm": 0.45562865421004417,
      "learning_rate": 3.89938135702202e-05,
      "loss": 1.4976,
      "num_input_tokens_seen": 27722489648,
      "step": 35236
    },
    {
      "epoch": 3.7382771058773603,
      "grad_norm": 0.4122292211836226,
      "learning_rate": 3.89932376720783e-05,
      "loss": 1.4146,
      "num_input_tokens_seen": 27723276448,
      "step": 35237
    },
    {
      "epoch": 3.7383831954169318,
      "grad_norm": 0.495738445937184,
      "learning_rate": 3.899266176312283e-05,
      "loss": 1.4639,
      "num_input_tokens_seen": 27724063312,
      "step": 35238
    },
    {
      "epoch": 3.7384892849565032,
      "grad_norm": 0.40679442226978463,
      "learning_rate": 3.899208584335425e-05,
      "loss": 1.3701,
      "num_input_tokens_seen": 27724850144,
      "step": 35239
    },
    {
      "epoch": 3.7385953744960747,
      "grad_norm": 0.39770736172711435,
      "learning_rate": 3.8991509912772996e-05,
      "loss": 1.3522,
      "num_input_tokens_seen": 27725636896,
      "step": 35240
    },
    {
      "epoch": 3.738701464035646,
      "grad_norm": 0.45423869348529133,
      "learning_rate": 3.899093397137951e-05,
      "loss": 1.4704,
      "num_input_tokens_seen": 27726423584,
      "step": 35241
    },
    {
      "epoch": 3.738807553575217,
      "grad_norm": 0.4339149883477766,
      "learning_rate": 3.899035801917424e-05,
      "loss": 1.4312,
      "num_input_tokens_seen": 27727210304,
      "step": 35242
    },
    {
      "epoch": 3.738913643114789,
      "grad_norm": 0.5418885953826942,
      "learning_rate": 3.898978205615763e-05,
      "loss": 1.4254,
      "num_input_tokens_seen": 27727997024,
      "step": 35243
    },
    {
      "epoch": 3.73901973265436,
      "grad_norm": 0.4476821728242773,
      "learning_rate": 3.898920608233013e-05,
      "loss": 1.4375,
      "num_input_tokens_seen": 27728783808,
      "step": 35244
    },
    {
      "epoch": 3.7391258221939316,
      "grad_norm": 0.5355339743878922,
      "learning_rate": 3.898863009769218e-05,
      "loss": 1.4993,
      "num_input_tokens_seen": 27729570528,
      "step": 35245
    },
    {
      "epoch": 3.739231911733503,
      "grad_norm": 0.49740523051466956,
      "learning_rate": 3.898805410224423e-05,
      "loss": 1.4568,
      "num_input_tokens_seen": 27730357264,
      "step": 35246
    },
    {
      "epoch": 3.7393380012730746,
      "grad_norm": 0.49298642301786905,
      "learning_rate": 3.898747809598672e-05,
      "loss": 1.4696,
      "num_input_tokens_seen": 27731144128,
      "step": 35247
    },
    {
      "epoch": 3.739444090812646,
      "grad_norm": 0.7602085524580845,
      "learning_rate": 3.898690207892011e-05,
      "loss": 1.5392,
      "num_input_tokens_seen": 27731930880,
      "step": 35248
    },
    {
      "epoch": 3.739550180352217,
      "grad_norm": 0.43186315851318674,
      "learning_rate": 3.8986326051044815e-05,
      "loss": 1.3872,
      "num_input_tokens_seen": 27732717696,
      "step": 35249
    },
    {
      "epoch": 3.7396562698917886,
      "grad_norm": 1.0053004560216434,
      "learning_rate": 3.89857500123613e-05,
      "loss": 1.4098,
      "num_input_tokens_seen": 27733504464,
      "step": 35250
    },
    {
      "epoch": 3.73976235943136,
      "grad_norm": 0.5280901063639379,
      "learning_rate": 3.8985173962870016e-05,
      "loss": 1.4171,
      "num_input_tokens_seen": 27734291296,
      "step": 35251
    },
    {
      "epoch": 3.7398684489709315,
      "grad_norm": 0.5073118165251889,
      "learning_rate": 3.89845979025714e-05,
      "loss": 1.3374,
      "num_input_tokens_seen": 27735078000,
      "step": 35252
    },
    {
      "epoch": 3.739974538510503,
      "grad_norm": 0.8767442484993796,
      "learning_rate": 3.898402183146589e-05,
      "loss": 1.4785,
      "num_input_tokens_seen": 27735864816,
      "step": 35253
    },
    {
      "epoch": 3.740080628050074,
      "grad_norm": 0.3985117771710994,
      "learning_rate": 3.8983445749553936e-05,
      "loss": 1.4596,
      "num_input_tokens_seen": 27736651568,
      "step": 35254
    },
    {
      "epoch": 3.740186717589646,
      "grad_norm": 0.7621346079053215,
      "learning_rate": 3.8982869656836e-05,
      "loss": 1.5317,
      "num_input_tokens_seen": 27737438208,
      "step": 35255
    },
    {
      "epoch": 3.740292807129217,
      "grad_norm": 0.5177789607751934,
      "learning_rate": 3.898229355331249e-05,
      "loss": 1.4195,
      "num_input_tokens_seen": 27738225072,
      "step": 35256
    },
    {
      "epoch": 3.7403988966687884,
      "grad_norm": 0.6603486936699481,
      "learning_rate": 3.898171743898389e-05,
      "loss": 1.515,
      "num_input_tokens_seen": 27739011968,
      "step": 35257
    },
    {
      "epoch": 3.74050498620836,
      "grad_norm": 0.5218511732289594,
      "learning_rate": 3.898114131385063e-05,
      "loss": 1.4828,
      "num_input_tokens_seen": 27739798688,
      "step": 35258
    },
    {
      "epoch": 3.7406110757479314,
      "grad_norm": 0.4403860558663092,
      "learning_rate": 3.8980565177913147e-05,
      "loss": 1.343,
      "num_input_tokens_seen": 27740585536,
      "step": 35259
    },
    {
      "epoch": 3.740717165287503,
      "grad_norm": 0.5672762901260423,
      "learning_rate": 3.8979989031171896e-05,
      "loss": 1.5627,
      "num_input_tokens_seen": 27741372288,
      "step": 35260
    },
    {
      "epoch": 3.740823254827074,
      "grad_norm": 0.5243164486375157,
      "learning_rate": 3.8979412873627316e-05,
      "loss": 1.4851,
      "num_input_tokens_seen": 27742158992,
      "step": 35261
    },
    {
      "epoch": 3.7409293443666454,
      "grad_norm": 0.3991891518928086,
      "learning_rate": 3.897883670527986e-05,
      "loss": 1.456,
      "num_input_tokens_seen": 27742945760,
      "step": 35262
    },
    {
      "epoch": 3.741035433906217,
      "grad_norm": 0.7941657645592928,
      "learning_rate": 3.897826052612997e-05,
      "loss": 1.4103,
      "num_input_tokens_seen": 27743732384,
      "step": 35263
    },
    {
      "epoch": 3.7411415234457883,
      "grad_norm": 0.4156195111585046,
      "learning_rate": 3.897768433617809e-05,
      "loss": 1.4604,
      "num_input_tokens_seen": 27744519088,
      "step": 35264
    },
    {
      "epoch": 3.74124761298536,
      "grad_norm": 0.5904124635116688,
      "learning_rate": 3.897710813542467e-05,
      "loss": 1.3612,
      "num_input_tokens_seen": 27745305904,
      "step": 35265
    },
    {
      "epoch": 3.741353702524931,
      "grad_norm": 0.45717780001202,
      "learning_rate": 3.897653192387014e-05,
      "loss": 1.3999,
      "num_input_tokens_seen": 27746092672,
      "step": 35266
    },
    {
      "epoch": 3.7414597920645023,
      "grad_norm": 0.46882574564321133,
      "learning_rate": 3.897595570151497e-05,
      "loss": 1.4024,
      "num_input_tokens_seen": 27746879392,
      "step": 35267
    },
    {
      "epoch": 3.7415658816040738,
      "grad_norm": 0.5123917498007503,
      "learning_rate": 3.8975379468359586e-05,
      "loss": 1.5899,
      "num_input_tokens_seen": 27747666112,
      "step": 35268
    },
    {
      "epoch": 3.7416719711436452,
      "grad_norm": 0.5419326682039266,
      "learning_rate": 3.897480322440443e-05,
      "loss": 1.4907,
      "num_input_tokens_seen": 27748452912,
      "step": 35269
    },
    {
      "epoch": 3.7417780606832167,
      "grad_norm": 0.5201411748776775,
      "learning_rate": 3.897422696964996e-05,
      "loss": 1.4379,
      "num_input_tokens_seen": 27749239696,
      "step": 35270
    },
    {
      "epoch": 3.741884150222788,
      "grad_norm": 0.5139229361529273,
      "learning_rate": 3.897365070409662e-05,
      "loss": 1.5082,
      "num_input_tokens_seen": 27750026464,
      "step": 35271
    },
    {
      "epoch": 3.7419902397623597,
      "grad_norm": 0.4238324526985712,
      "learning_rate": 3.897307442774486e-05,
      "loss": 1.3962,
      "num_input_tokens_seen": 27750813296,
      "step": 35272
    },
    {
      "epoch": 3.7420963293019307,
      "grad_norm": 0.56989725299194,
      "learning_rate": 3.8972498140595104e-05,
      "loss": 1.4352,
      "num_input_tokens_seen": 27751600032,
      "step": 35273
    },
    {
      "epoch": 3.742202418841502,
      "grad_norm": 0.3893564037677439,
      "learning_rate": 3.897192184264782e-05,
      "loss": 1.3775,
      "num_input_tokens_seen": 27752386912,
      "step": 35274
    },
    {
      "epoch": 3.7423085083810737,
      "grad_norm": 0.4913089144170139,
      "learning_rate": 3.897134553390344e-05,
      "loss": 1.5183,
      "num_input_tokens_seen": 27753173568,
      "step": 35275
    },
    {
      "epoch": 3.742414597920645,
      "grad_norm": 0.48755547297888446,
      "learning_rate": 3.897076921436242e-05,
      "loss": 1.5213,
      "num_input_tokens_seen": 27753960224,
      "step": 35276
    },
    {
      "epoch": 3.7425206874602166,
      "grad_norm": 0.4776791394084076,
      "learning_rate": 3.89701928840252e-05,
      "loss": 1.5853,
      "num_input_tokens_seen": 27754746928,
      "step": 35277
    },
    {
      "epoch": 3.7426267769997876,
      "grad_norm": 0.40600702572963404,
      "learning_rate": 3.896961654289222e-05,
      "loss": 1.3788,
      "num_input_tokens_seen": 27755533728,
      "step": 35278
    },
    {
      "epoch": 3.742732866539359,
      "grad_norm": 0.5236902552466879,
      "learning_rate": 3.896904019096393e-05,
      "loss": 1.4504,
      "num_input_tokens_seen": 27756320496,
      "step": 35279
    },
    {
      "epoch": 3.7428389560789306,
      "grad_norm": 0.45853848307353984,
      "learning_rate": 3.896846382824077e-05,
      "loss": 1.4515,
      "num_input_tokens_seen": 27757107328,
      "step": 35280
    },
    {
      "epoch": 3.742945045618502,
      "grad_norm": 0.4381845387983215,
      "learning_rate": 3.896788745472321e-05,
      "loss": 1.353,
      "num_input_tokens_seen": 27757894128,
      "step": 35281
    },
    {
      "epoch": 3.7430511351580735,
      "grad_norm": 0.5740350457524236,
      "learning_rate": 3.896731107041166e-05,
      "loss": 1.6304,
      "num_input_tokens_seen": 27758680848,
      "step": 35282
    },
    {
      "epoch": 3.7431572246976446,
      "grad_norm": 0.48279321990643276,
      "learning_rate": 3.8966734675306586e-05,
      "loss": 1.4702,
      "num_input_tokens_seen": 27759467696,
      "step": 35283
    },
    {
      "epoch": 3.7432633142372165,
      "grad_norm": 0.47111564667389194,
      "learning_rate": 3.896615826940843e-05,
      "loss": 1.3604,
      "num_input_tokens_seen": 27760254464,
      "step": 35284
    },
    {
      "epoch": 3.7433694037767875,
      "grad_norm": 0.5390710764524395,
      "learning_rate": 3.8965581852717636e-05,
      "loss": 1.4555,
      "num_input_tokens_seen": 27761041264,
      "step": 35285
    },
    {
      "epoch": 3.743475493316359,
      "grad_norm": 0.4967397718560582,
      "learning_rate": 3.8965005425234654e-05,
      "loss": 1.4179,
      "num_input_tokens_seen": 27761828016,
      "step": 35286
    },
    {
      "epoch": 3.7435815828559305,
      "grad_norm": 0.5669052203733186,
      "learning_rate": 3.896442898695992e-05,
      "loss": 1.499,
      "num_input_tokens_seen": 27762614784,
      "step": 35287
    },
    {
      "epoch": 3.743687672395502,
      "grad_norm": 0.5220212692971167,
      "learning_rate": 3.8963852537893884e-05,
      "loss": 1.4051,
      "num_input_tokens_seen": 27763401568,
      "step": 35288
    },
    {
      "epoch": 3.7437937619350734,
      "grad_norm": 0.49518722625850337,
      "learning_rate": 3.8963276078037004e-05,
      "loss": 1.3861,
      "num_input_tokens_seen": 27764188304,
      "step": 35289
    },
    {
      "epoch": 3.7438998514746444,
      "grad_norm": 0.5134916602630657,
      "learning_rate": 3.8962699607389704e-05,
      "loss": 1.6487,
      "num_input_tokens_seen": 27764974992,
      "step": 35290
    },
    {
      "epoch": 3.744005941014216,
      "grad_norm": 0.5056814180447617,
      "learning_rate": 3.8962123125952444e-05,
      "loss": 1.4412,
      "num_input_tokens_seen": 27765761792,
      "step": 35291
    },
    {
      "epoch": 3.7441120305537874,
      "grad_norm": 0.45398659103623246,
      "learning_rate": 3.896154663372565e-05,
      "loss": 1.458,
      "num_input_tokens_seen": 27766548592,
      "step": 35292
    },
    {
      "epoch": 3.744218120093359,
      "grad_norm": 0.4694810712889635,
      "learning_rate": 3.89609701307098e-05,
      "loss": 1.5246,
      "num_input_tokens_seen": 27767335216,
      "step": 35293
    },
    {
      "epoch": 3.7443242096329303,
      "grad_norm": 0.47774152271421283,
      "learning_rate": 3.8960393616905325e-05,
      "loss": 1.4683,
      "num_input_tokens_seen": 27768121920,
      "step": 35294
    },
    {
      "epoch": 3.7444302991725014,
      "grad_norm": 0.45694931033578534,
      "learning_rate": 3.895981709231266e-05,
      "loss": 1.5043,
      "num_input_tokens_seen": 27768908752,
      "step": 35295
    },
    {
      "epoch": 3.744536388712073,
      "grad_norm": 0.4299624639250027,
      "learning_rate": 3.8959240556932254e-05,
      "loss": 1.3721,
      "num_input_tokens_seen": 27769695616,
      "step": 35296
    },
    {
      "epoch": 3.7446424782516443,
      "grad_norm": 0.47246078163544836,
      "learning_rate": 3.8958664010764554e-05,
      "loss": 1.3684,
      "num_input_tokens_seen": 27770482384,
      "step": 35297
    },
    {
      "epoch": 3.744748567791216,
      "grad_norm": 0.5164396786773248,
      "learning_rate": 3.895808745381002e-05,
      "loss": 1.4753,
      "num_input_tokens_seen": 27771269216,
      "step": 35298
    },
    {
      "epoch": 3.7448546573307873,
      "grad_norm": 0.5001996497676754,
      "learning_rate": 3.895751088606907e-05,
      "loss": 1.4835,
      "num_input_tokens_seen": 27772055904,
      "step": 35299
    },
    {
      "epoch": 3.7449607468703587,
      "grad_norm": 0.6282195443025976,
      "learning_rate": 3.895693430754218e-05,
      "loss": 1.527,
      "num_input_tokens_seen": 27772842496,
      "step": 35300
    },
    {
      "epoch": 3.74506683640993,
      "grad_norm": 0.41959678547989665,
      "learning_rate": 3.895635771822978e-05,
      "loss": 1.4278,
      "num_input_tokens_seen": 27773629264,
      "step": 35301
    },
    {
      "epoch": 3.7451729259495012,
      "grad_norm": 0.6630084901619719,
      "learning_rate": 3.895578111813231e-05,
      "loss": 1.5249,
      "num_input_tokens_seen": 27774416048,
      "step": 35302
    },
    {
      "epoch": 3.7452790154890727,
      "grad_norm": 0.48842268814991746,
      "learning_rate": 3.8955204507250214e-05,
      "loss": 1.574,
      "num_input_tokens_seen": 27775202848,
      "step": 35303
    },
    {
      "epoch": 3.745385105028644,
      "grad_norm": 0.5178514017553904,
      "learning_rate": 3.895462788558396e-05,
      "loss": 1.3414,
      "num_input_tokens_seen": 27775989600,
      "step": 35304
    },
    {
      "epoch": 3.7454911945682157,
      "grad_norm": 0.5464672334478667,
      "learning_rate": 3.895405125313397e-05,
      "loss": 1.5444,
      "num_input_tokens_seen": 27776776352,
      "step": 35305
    },
    {
      "epoch": 3.745597284107787,
      "grad_norm": 0.4263703496961133,
      "learning_rate": 3.8953474609900695e-05,
      "loss": 1.4497,
      "num_input_tokens_seen": 27777563008,
      "step": 35306
    },
    {
      "epoch": 3.745703373647358,
      "grad_norm": 0.5545349211303806,
      "learning_rate": 3.895289795588459e-05,
      "loss": 1.3784,
      "num_input_tokens_seen": 27778349808,
      "step": 35307
    },
    {
      "epoch": 3.7458094631869296,
      "grad_norm": 0.5106426451618694,
      "learning_rate": 3.8952321291086105e-05,
      "loss": 1.5457,
      "num_input_tokens_seen": 27779136576,
      "step": 35308
    },
    {
      "epoch": 3.745915552726501,
      "grad_norm": 0.43239615099789785,
      "learning_rate": 3.895174461550567e-05,
      "loss": 1.4215,
      "num_input_tokens_seen": 27779923392,
      "step": 35309
    },
    {
      "epoch": 3.7460216422660726,
      "grad_norm": 0.40433910198853584,
      "learning_rate": 3.895116792914373e-05,
      "loss": 1.4497,
      "num_input_tokens_seen": 27780710160,
      "step": 35310
    },
    {
      "epoch": 3.746127731805644,
      "grad_norm": 0.4311433723226707,
      "learning_rate": 3.895059123200074e-05,
      "loss": 1.4879,
      "num_input_tokens_seen": 27781496912,
      "step": 35311
    },
    {
      "epoch": 3.746233821345215,
      "grad_norm": 0.37015733172022014,
      "learning_rate": 3.8950014524077136e-05,
      "loss": 1.4012,
      "num_input_tokens_seen": 27782283728,
      "step": 35312
    },
    {
      "epoch": 3.746339910884787,
      "grad_norm": 0.36779722981041013,
      "learning_rate": 3.894943780537338e-05,
      "loss": 1.2648,
      "num_input_tokens_seen": 27783070560,
      "step": 35313
    },
    {
      "epoch": 3.746446000424358,
      "grad_norm": 0.4120567594393995,
      "learning_rate": 3.8948861075889906e-05,
      "loss": 1.3609,
      "num_input_tokens_seen": 27783857376,
      "step": 35314
    },
    {
      "epoch": 3.7465520899639295,
      "grad_norm": 0.43787943638167465,
      "learning_rate": 3.894828433562716e-05,
      "loss": 1.4743,
      "num_input_tokens_seen": 27784644160,
      "step": 35315
    },
    {
      "epoch": 3.746658179503501,
      "grad_norm": 0.4487089277479496,
      "learning_rate": 3.894770758458559e-05,
      "loss": 1.5039,
      "num_input_tokens_seen": 27785430832,
      "step": 35316
    },
    {
      "epoch": 3.7467642690430725,
      "grad_norm": 0.436186271022597,
      "learning_rate": 3.894713082276563e-05,
      "loss": 1.451,
      "num_input_tokens_seen": 27786217632,
      "step": 35317
    },
    {
      "epoch": 3.746870358582644,
      "grad_norm": 0.4779117536032454,
      "learning_rate": 3.894655405016775e-05,
      "loss": 1.4279,
      "num_input_tokens_seen": 27787004336,
      "step": 35318
    },
    {
      "epoch": 3.746976448122215,
      "grad_norm": 0.5043639051547091,
      "learning_rate": 3.894597726679238e-05,
      "loss": 1.4265,
      "num_input_tokens_seen": 27787791136,
      "step": 35319
    },
    {
      "epoch": 3.7470825376617864,
      "grad_norm": 0.461962714346581,
      "learning_rate": 3.894540047263997e-05,
      "loss": 1.4463,
      "num_input_tokens_seen": 27788577968,
      "step": 35320
    },
    {
      "epoch": 3.747188627201358,
      "grad_norm": 0.43847672949841143,
      "learning_rate": 3.894482366771095e-05,
      "loss": 1.3697,
      "num_input_tokens_seen": 27789364832,
      "step": 35321
    },
    {
      "epoch": 3.7472947167409294,
      "grad_norm": 0.47196778434262565,
      "learning_rate": 3.8944246852005794e-05,
      "loss": 1.5027,
      "num_input_tokens_seen": 27790151488,
      "step": 35322
    },
    {
      "epoch": 3.747400806280501,
      "grad_norm": 0.41434545665795514,
      "learning_rate": 3.894367002552493e-05,
      "loss": 1.3698,
      "num_input_tokens_seen": 27790938320,
      "step": 35323
    },
    {
      "epoch": 3.747506895820072,
      "grad_norm": 0.4301257546618904,
      "learning_rate": 3.89430931882688e-05,
      "loss": 1.4825,
      "num_input_tokens_seen": 27791725056,
      "step": 35324
    },
    {
      "epoch": 3.7476129853596434,
      "grad_norm": 0.4465146426675599,
      "learning_rate": 3.894251634023786e-05,
      "loss": 1.327,
      "num_input_tokens_seen": 27792511808,
      "step": 35325
    },
    {
      "epoch": 3.747719074899215,
      "grad_norm": 0.46719480859003787,
      "learning_rate": 3.8941939481432555e-05,
      "loss": 1.5029,
      "num_input_tokens_seen": 27793298592,
      "step": 35326
    },
    {
      "epoch": 3.7478251644387863,
      "grad_norm": 0.4500440976550354,
      "learning_rate": 3.894136261185333e-05,
      "loss": 1.4883,
      "num_input_tokens_seen": 27794085312,
      "step": 35327
    },
    {
      "epoch": 3.747931253978358,
      "grad_norm": 0.45824281816488477,
      "learning_rate": 3.8940785731500625e-05,
      "loss": 1.3834,
      "num_input_tokens_seen": 27794872016,
      "step": 35328
    },
    {
      "epoch": 3.7480373435179293,
      "grad_norm": 0.40095541436440413,
      "learning_rate": 3.8940208840374894e-05,
      "loss": 1.3959,
      "num_input_tokens_seen": 27795658704,
      "step": 35329
    },
    {
      "epoch": 3.7481434330575008,
      "grad_norm": 0.4453397147509813,
      "learning_rate": 3.893963193847657e-05,
      "loss": 1.3871,
      "num_input_tokens_seen": 27796445504,
      "step": 35330
    },
    {
      "epoch": 3.748249522597072,
      "grad_norm": 0.43895896275327195,
      "learning_rate": 3.893905502580612e-05,
      "loss": 1.5219,
      "num_input_tokens_seen": 27797232320,
      "step": 35331
    },
    {
      "epoch": 3.7483556121366433,
      "grad_norm": 0.4340829040342916,
      "learning_rate": 3.8938478102363965e-05,
      "loss": 1.427,
      "num_input_tokens_seen": 27798019136,
      "step": 35332
    },
    {
      "epoch": 3.7484617016762147,
      "grad_norm": 0.3877154701583485,
      "learning_rate": 3.893790116815057e-05,
      "loss": 1.3764,
      "num_input_tokens_seen": 27798805872,
      "step": 35333
    },
    {
      "epoch": 3.748567791215786,
      "grad_norm": 0.409423892532202,
      "learning_rate": 3.893732422316637e-05,
      "loss": 1.3574,
      "num_input_tokens_seen": 27799592704,
      "step": 35334
    },
    {
      "epoch": 3.7486738807553577,
      "grad_norm": 0.4149032008355617,
      "learning_rate": 3.893674726741182e-05,
      "loss": 1.5161,
      "num_input_tokens_seen": 27800379376,
      "step": 35335
    },
    {
      "epoch": 3.7487799702949287,
      "grad_norm": 0.4347200906911461,
      "learning_rate": 3.893617030088736e-05,
      "loss": 1.4934,
      "num_input_tokens_seen": 27801166176,
      "step": 35336
    },
    {
      "epoch": 3.7488860598345,
      "grad_norm": 0.3960901416820806,
      "learning_rate": 3.8935593323593435e-05,
      "loss": 1.3015,
      "num_input_tokens_seen": 27801952976,
      "step": 35337
    },
    {
      "epoch": 3.7489921493740717,
      "grad_norm": 0.41912845357331,
      "learning_rate": 3.8935016335530495e-05,
      "loss": 1.4102,
      "num_input_tokens_seen": 27802739744,
      "step": 35338
    },
    {
      "epoch": 3.749098238913643,
      "grad_norm": 0.4526426673395419,
      "learning_rate": 3.893443933669898e-05,
      "loss": 1.4445,
      "num_input_tokens_seen": 27803526496,
      "step": 35339
    },
    {
      "epoch": 3.7492043284532146,
      "grad_norm": 0.437052356629928,
      "learning_rate": 3.8933862327099336e-05,
      "loss": 1.481,
      "num_input_tokens_seen": 27804313280,
      "step": 35340
    },
    {
      "epoch": 3.7493104179927856,
      "grad_norm": 0.42749316326889375,
      "learning_rate": 3.893328530673202e-05,
      "loss": 1.4391,
      "num_input_tokens_seen": 27805100032,
      "step": 35341
    },
    {
      "epoch": 3.7494165075323576,
      "grad_norm": 0.42343356417903755,
      "learning_rate": 3.893270827559746e-05,
      "loss": 1.4,
      "num_input_tokens_seen": 27805886816,
      "step": 35342
    },
    {
      "epoch": 3.7495225970719286,
      "grad_norm": 0.4757898695062521,
      "learning_rate": 3.893213123369612e-05,
      "loss": 1.5585,
      "num_input_tokens_seen": 27806673520,
      "step": 35343
    },
    {
      "epoch": 3.7496286866115,
      "grad_norm": 0.40972019003984916,
      "learning_rate": 3.8931554181028436e-05,
      "loss": 1.4165,
      "num_input_tokens_seen": 27807460304,
      "step": 35344
    },
    {
      "epoch": 3.7497347761510715,
      "grad_norm": 0.43563691666651316,
      "learning_rate": 3.893097711759485e-05,
      "loss": 1.4737,
      "num_input_tokens_seen": 27808247040,
      "step": 35345
    },
    {
      "epoch": 3.749840865690643,
      "grad_norm": 0.5099460643274139,
      "learning_rate": 3.893040004339582e-05,
      "loss": 1.4734,
      "num_input_tokens_seen": 27809033792,
      "step": 35346
    },
    {
      "epoch": 3.7499469552302145,
      "grad_norm": 0.49460467180022316,
      "learning_rate": 3.892982295843178e-05,
      "loss": 1.5086,
      "num_input_tokens_seen": 27809820608,
      "step": 35347
    },
    {
      "epoch": 3.7500530447697855,
      "grad_norm": 0.520405974459499,
      "learning_rate": 3.892924586270319e-05,
      "loss": 1.4747,
      "num_input_tokens_seen": 27810607296,
      "step": 35348
    },
    {
      "epoch": 3.750159134309357,
      "grad_norm": 0.47732393842169873,
      "learning_rate": 3.892866875621049e-05,
      "loss": 1.3407,
      "num_input_tokens_seen": 27811394080,
      "step": 35349
    },
    {
      "epoch": 3.7502652238489285,
      "grad_norm": 0.4913024191300477,
      "learning_rate": 3.892809163895411e-05,
      "loss": 1.462,
      "num_input_tokens_seen": 27812180816,
      "step": 35350
    },
    {
      "epoch": 3.7503713133885,
      "grad_norm": 0.4898992422355506,
      "learning_rate": 3.892751451093452e-05,
      "loss": 1.4928,
      "num_input_tokens_seen": 27812967568,
      "step": 35351
    },
    {
      "epoch": 3.7504774029280714,
      "grad_norm": 0.4707437925146406,
      "learning_rate": 3.892693737215215e-05,
      "loss": 1.5245,
      "num_input_tokens_seen": 27813754336,
      "step": 35352
    },
    {
      "epoch": 3.7505834924676424,
      "grad_norm": 0.4549535906065534,
      "learning_rate": 3.892636022260745e-05,
      "loss": 1.33,
      "num_input_tokens_seen": 27814541200,
      "step": 35353
    },
    {
      "epoch": 3.7506895820072144,
      "grad_norm": 0.4233202579541412,
      "learning_rate": 3.892578306230087e-05,
      "loss": 1.4097,
      "num_input_tokens_seen": 27815328000,
      "step": 35354
    },
    {
      "epoch": 3.7507956715467854,
      "grad_norm": 0.4677828826101859,
      "learning_rate": 3.892520589123285e-05,
      "loss": 1.4347,
      "num_input_tokens_seen": 27816114736,
      "step": 35355
    },
    {
      "epoch": 3.750901761086357,
      "grad_norm": 0.4411142299516938,
      "learning_rate": 3.892462870940385e-05,
      "loss": 1.4146,
      "num_input_tokens_seen": 27816901504,
      "step": 35356
    },
    {
      "epoch": 3.7510078506259283,
      "grad_norm": 0.49061341594911567,
      "learning_rate": 3.8924051516814295e-05,
      "loss": 1.4822,
      "num_input_tokens_seen": 27817688272,
      "step": 35357
    },
    {
      "epoch": 3.7511139401655,
      "grad_norm": 0.5771728585659933,
      "learning_rate": 3.892347431346465e-05,
      "loss": 1.487,
      "num_input_tokens_seen": 27818475040,
      "step": 35358
    },
    {
      "epoch": 3.7512200297050713,
      "grad_norm": 0.44567959429182746,
      "learning_rate": 3.892289709935535e-05,
      "loss": 1.3715,
      "num_input_tokens_seen": 27819261840,
      "step": 35359
    },
    {
      "epoch": 3.7513261192446423,
      "grad_norm": 0.4422408225781517,
      "learning_rate": 3.8922319874486834e-05,
      "loss": 1.5197,
      "num_input_tokens_seen": 27820048640,
      "step": 35360
    },
    {
      "epoch": 3.751432208784214,
      "grad_norm": 0.526133630874792,
      "learning_rate": 3.892174263885957e-05,
      "loss": 1.4463,
      "num_input_tokens_seen": 27820835440,
      "step": 35361
    },
    {
      "epoch": 3.7515382983237853,
      "grad_norm": 0.4817018988541771,
      "learning_rate": 3.892116539247399e-05,
      "loss": 1.4996,
      "num_input_tokens_seen": 27821622256,
      "step": 35362
    },
    {
      "epoch": 3.7516443878633567,
      "grad_norm": 0.4991798604562165,
      "learning_rate": 3.892058813533054e-05,
      "loss": 1.4447,
      "num_input_tokens_seen": 27822409024,
      "step": 35363
    },
    {
      "epoch": 3.751750477402928,
      "grad_norm": 0.7432210727520969,
      "learning_rate": 3.8920010867429664e-05,
      "loss": 1.4318,
      "num_input_tokens_seen": 27823195792,
      "step": 35364
    },
    {
      "epoch": 3.7518565669424992,
      "grad_norm": 0.5042887481732673,
      "learning_rate": 3.891943358877181e-05,
      "loss": 1.5054,
      "num_input_tokens_seen": 27823982528,
      "step": 35365
    },
    {
      "epoch": 3.7519626564820707,
      "grad_norm": 0.5904068356882006,
      "learning_rate": 3.891885629935743e-05,
      "loss": 1.402,
      "num_input_tokens_seen": 27824769232,
      "step": 35366
    },
    {
      "epoch": 3.752068746021642,
      "grad_norm": 0.4689697201221761,
      "learning_rate": 3.8918278999186976e-05,
      "loss": 1.463,
      "num_input_tokens_seen": 27825556032,
      "step": 35367
    },
    {
      "epoch": 3.7521748355612137,
      "grad_norm": 0.4587530630480327,
      "learning_rate": 3.8917701688260875e-05,
      "loss": 1.4774,
      "num_input_tokens_seen": 27826342752,
      "step": 35368
    },
    {
      "epoch": 3.752280925100785,
      "grad_norm": 0.5117180998243034,
      "learning_rate": 3.891712436657958e-05,
      "loss": 1.4465,
      "num_input_tokens_seen": 27827129408,
      "step": 35369
    },
    {
      "epoch": 3.7523870146403566,
      "grad_norm": 0.48313943078990945,
      "learning_rate": 3.891654703414354e-05,
      "loss": 1.5433,
      "num_input_tokens_seen": 27827916080,
      "step": 35370
    },
    {
      "epoch": 3.752493104179928,
      "grad_norm": 0.46278149084402875,
      "learning_rate": 3.89159696909532e-05,
      "loss": 1.5189,
      "num_input_tokens_seen": 27828702880,
      "step": 35371
    },
    {
      "epoch": 3.752599193719499,
      "grad_norm": 0.5277616661379783,
      "learning_rate": 3.8915392337009014e-05,
      "loss": 1.5546,
      "num_input_tokens_seen": 27829489568,
      "step": 35372
    },
    {
      "epoch": 3.7527052832590706,
      "grad_norm": 0.5312963052529681,
      "learning_rate": 3.891481497231142e-05,
      "loss": 1.3966,
      "num_input_tokens_seen": 27830276400,
      "step": 35373
    },
    {
      "epoch": 3.752811372798642,
      "grad_norm": 0.4643666277677447,
      "learning_rate": 3.891423759686086e-05,
      "loss": 1.465,
      "num_input_tokens_seen": 27831063184,
      "step": 35374
    },
    {
      "epoch": 3.7529174623382136,
      "grad_norm": 0.7132441560805556,
      "learning_rate": 3.891366021065779e-05,
      "loss": 1.4805,
      "num_input_tokens_seen": 27831849824,
      "step": 35375
    },
    {
      "epoch": 3.753023551877785,
      "grad_norm": 0.5771785933158196,
      "learning_rate": 3.891308281370265e-05,
      "loss": 1.4881,
      "num_input_tokens_seen": 27832636592,
      "step": 35376
    },
    {
      "epoch": 3.753129641417356,
      "grad_norm": 0.5287376673627642,
      "learning_rate": 3.8912505405995886e-05,
      "loss": 1.4398,
      "num_input_tokens_seen": 27833423328,
      "step": 35377
    },
    {
      "epoch": 3.7532357309569275,
      "grad_norm": 0.4200317932491434,
      "learning_rate": 3.891192798753795e-05,
      "loss": 1.4418,
      "num_input_tokens_seen": 27834210192,
      "step": 35378
    },
    {
      "epoch": 3.753341820496499,
      "grad_norm": 0.6385705956599829,
      "learning_rate": 3.891135055832928e-05,
      "loss": 1.6025,
      "num_input_tokens_seen": 27834996976,
      "step": 35379
    },
    {
      "epoch": 3.7534479100360705,
      "grad_norm": 0.46305730113849897,
      "learning_rate": 3.891077311837033e-05,
      "loss": 1.4564,
      "num_input_tokens_seen": 27835783728,
      "step": 35380
    },
    {
      "epoch": 3.753553999575642,
      "grad_norm": 0.4270174732873088,
      "learning_rate": 3.891019566766154e-05,
      "loss": 1.3888,
      "num_input_tokens_seen": 27836570416,
      "step": 35381
    },
    {
      "epoch": 3.753660089115213,
      "grad_norm": 0.5359698967184354,
      "learning_rate": 3.8909618206203354e-05,
      "loss": 1.5198,
      "num_input_tokens_seen": 27837357248,
      "step": 35382
    },
    {
      "epoch": 3.753766178654785,
      "grad_norm": 0.4658245171756481,
      "learning_rate": 3.890904073399624e-05,
      "loss": 1.4591,
      "num_input_tokens_seen": 27838144048,
      "step": 35383
    },
    {
      "epoch": 3.753872268194356,
      "grad_norm": 0.5265387192166395,
      "learning_rate": 3.890846325104062e-05,
      "loss": 1.4929,
      "num_input_tokens_seen": 27838930784,
      "step": 35384
    },
    {
      "epoch": 3.7539783577339274,
      "grad_norm": 0.46235126576248603,
      "learning_rate": 3.8907885757336935e-05,
      "loss": 1.5347,
      "num_input_tokens_seen": 27839717504,
      "step": 35385
    },
    {
      "epoch": 3.754084447273499,
      "grad_norm": 0.5196550536074154,
      "learning_rate": 3.890730825288565e-05,
      "loss": 1.5098,
      "num_input_tokens_seen": 27840504336,
      "step": 35386
    },
    {
      "epoch": 3.7541905368130704,
      "grad_norm": 0.4748199758686921,
      "learning_rate": 3.8906730737687214e-05,
      "loss": 1.4512,
      "num_input_tokens_seen": 27841291120,
      "step": 35387
    },
    {
      "epoch": 3.754296626352642,
      "grad_norm": 0.43772660298465377,
      "learning_rate": 3.890615321174206e-05,
      "loss": 1.501,
      "num_input_tokens_seen": 27842077920,
      "step": 35388
    },
    {
      "epoch": 3.754402715892213,
      "grad_norm": 0.627484754307941,
      "learning_rate": 3.890557567505064e-05,
      "loss": 1.4761,
      "num_input_tokens_seen": 27842864656,
      "step": 35389
    },
    {
      "epoch": 3.7545088054317843,
      "grad_norm": 0.45882284830849523,
      "learning_rate": 3.89049981276134e-05,
      "loss": 1.48,
      "num_input_tokens_seen": 27843651344,
      "step": 35390
    },
    {
      "epoch": 3.754614894971356,
      "grad_norm": 0.6262131339639903,
      "learning_rate": 3.8904420569430775e-05,
      "loss": 1.5432,
      "num_input_tokens_seen": 27844438160,
      "step": 35391
    },
    {
      "epoch": 3.7547209845109273,
      "grad_norm": 0.6158357158591056,
      "learning_rate": 3.8903843000503235e-05,
      "loss": 1.6148,
      "num_input_tokens_seen": 27845224928,
      "step": 35392
    },
    {
      "epoch": 3.7548270740504988,
      "grad_norm": 0.7267199851392119,
      "learning_rate": 3.8903265420831205e-05,
      "loss": 1.5286,
      "num_input_tokens_seen": 27846011728,
      "step": 35393
    },
    {
      "epoch": 3.75493316359007,
      "grad_norm": 0.5358249846837361,
      "learning_rate": 3.8902687830415144e-05,
      "loss": 1.4807,
      "num_input_tokens_seen": 27846798528,
      "step": 35394
    },
    {
      "epoch": 3.7550392531296413,
      "grad_norm": 0.4817136893609289,
      "learning_rate": 3.8902110229255493e-05,
      "loss": 1.4065,
      "num_input_tokens_seen": 27847585328,
      "step": 35395
    },
    {
      "epoch": 3.7551453426692127,
      "grad_norm": 0.5809028320223777,
      "learning_rate": 3.89015326173527e-05,
      "loss": 1.4568,
      "num_input_tokens_seen": 27848372128,
      "step": 35396
    },
    {
      "epoch": 3.755251432208784,
      "grad_norm": 0.5202619604200911,
      "learning_rate": 3.8900954994707206e-05,
      "loss": 1.4434,
      "num_input_tokens_seen": 27849159072,
      "step": 35397
    },
    {
      "epoch": 3.7553575217483557,
      "grad_norm": 0.727009792111645,
      "learning_rate": 3.890037736131946e-05,
      "loss": 1.4964,
      "num_input_tokens_seen": 27849945824,
      "step": 35398
    },
    {
      "epoch": 3.755463611287927,
      "grad_norm": 0.45512185963159957,
      "learning_rate": 3.889979971718992e-05,
      "loss": 1.4925,
      "num_input_tokens_seen": 27850732688,
      "step": 35399
    },
    {
      "epoch": 3.7555697008274986,
      "grad_norm": 0.5281753828153476,
      "learning_rate": 3.8899222062319015e-05,
      "loss": 1.3867,
      "num_input_tokens_seen": 27851519440,
      "step": 35400
    },
    {
      "epoch": 3.7556757903670697,
      "grad_norm": 0.5202015063291552,
      "learning_rate": 3.8898644396707204e-05,
      "loss": 1.4486,
      "num_input_tokens_seen": 27852306240,
      "step": 35401
    },
    {
      "epoch": 3.755781879906641,
      "grad_norm": 0.40982258569810603,
      "learning_rate": 3.889806672035492e-05,
      "loss": 1.4464,
      "num_input_tokens_seen": 27853093040,
      "step": 35402
    },
    {
      "epoch": 3.7558879694462126,
      "grad_norm": 0.5220548168824417,
      "learning_rate": 3.8897489033262626e-05,
      "loss": 1.4222,
      "num_input_tokens_seen": 27853879792,
      "step": 35403
    },
    {
      "epoch": 3.755994058985784,
      "grad_norm": 0.5186963192020131,
      "learning_rate": 3.889691133543076e-05,
      "loss": 1.4654,
      "num_input_tokens_seen": 27854666544,
      "step": 35404
    },
    {
      "epoch": 3.7561001485253556,
      "grad_norm": 0.4504947935682157,
      "learning_rate": 3.889633362685976e-05,
      "loss": 1.4014,
      "num_input_tokens_seen": 27855453376,
      "step": 35405
    },
    {
      "epoch": 3.7562062380649266,
      "grad_norm": 0.4583765108070802,
      "learning_rate": 3.889575590755009e-05,
      "loss": 1.3579,
      "num_input_tokens_seen": 27856240160,
      "step": 35406
    },
    {
      "epoch": 3.756312327604498,
      "grad_norm": 0.5119222941127765,
      "learning_rate": 3.889517817750219e-05,
      "loss": 1.5643,
      "num_input_tokens_seen": 27857026864,
      "step": 35407
    },
    {
      "epoch": 3.7564184171440695,
      "grad_norm": 0.44374613610878527,
      "learning_rate": 3.88946004367165e-05,
      "loss": 1.5303,
      "num_input_tokens_seen": 27857813664,
      "step": 35408
    },
    {
      "epoch": 3.756524506683641,
      "grad_norm": 0.5342974420954123,
      "learning_rate": 3.889402268519346e-05,
      "loss": 1.3301,
      "num_input_tokens_seen": 27858600432,
      "step": 35409
    },
    {
      "epoch": 3.7566305962232125,
      "grad_norm": 0.47200434582490186,
      "learning_rate": 3.889344492293354e-05,
      "loss": 1.4753,
      "num_input_tokens_seen": 27859387248,
      "step": 35410
    },
    {
      "epoch": 3.7567366857627835,
      "grad_norm": 0.5408043978512158,
      "learning_rate": 3.8892867149937176e-05,
      "loss": 1.3462,
      "num_input_tokens_seen": 27860174000,
      "step": 35411
    },
    {
      "epoch": 3.7568427753023554,
      "grad_norm": 0.41880747879045827,
      "learning_rate": 3.8892289366204805e-05,
      "loss": 1.5044,
      "num_input_tokens_seen": 27860960704,
      "step": 35412
    },
    {
      "epoch": 3.7569488648419265,
      "grad_norm": 0.4902672829154028,
      "learning_rate": 3.8891711571736874e-05,
      "loss": 1.5128,
      "num_input_tokens_seen": 27861747456,
      "step": 35413
    },
    {
      "epoch": 3.757054954381498,
      "grad_norm": 0.4853289818892653,
      "learning_rate": 3.889113376653385e-05,
      "loss": 1.4549,
      "num_input_tokens_seen": 27862534272,
      "step": 35414
    },
    {
      "epoch": 3.7571610439210694,
      "grad_norm": 0.4489965535087055,
      "learning_rate": 3.8890555950596156e-05,
      "loss": 1.5167,
      "num_input_tokens_seen": 27863320928,
      "step": 35415
    },
    {
      "epoch": 3.757267133460641,
      "grad_norm": 0.4463677533153697,
      "learning_rate": 3.8889978123924256e-05,
      "loss": 1.5218,
      "num_input_tokens_seen": 27864107728,
      "step": 35416
    },
    {
      "epoch": 3.7573732230002124,
      "grad_norm": 0.4128231026251876,
      "learning_rate": 3.888940028651857e-05,
      "loss": 1.3754,
      "num_input_tokens_seen": 27864894416,
      "step": 35417
    },
    {
      "epoch": 3.7574793125397834,
      "grad_norm": 0.4072190229944266,
      "learning_rate": 3.888882243837958e-05,
      "loss": 1.467,
      "num_input_tokens_seen": 27865681184,
      "step": 35418
    },
    {
      "epoch": 3.757585402079355,
      "grad_norm": 0.3916934602639818,
      "learning_rate": 3.888824457950771e-05,
      "loss": 1.3601,
      "num_input_tokens_seen": 27866468016,
      "step": 35419
    },
    {
      "epoch": 3.7576914916189263,
      "grad_norm": 0.5089957274821671,
      "learning_rate": 3.888766670990341e-05,
      "loss": 1.4393,
      "num_input_tokens_seen": 27867254864,
      "step": 35420
    },
    {
      "epoch": 3.757797581158498,
      "grad_norm": 0.4695590226948328,
      "learning_rate": 3.888708882956714e-05,
      "loss": 1.4136,
      "num_input_tokens_seen": 27868041680,
      "step": 35421
    },
    {
      "epoch": 3.7579036706980693,
      "grad_norm": 0.42145206915610206,
      "learning_rate": 3.888651093849932e-05,
      "loss": 1.4386,
      "num_input_tokens_seen": 27868828480,
      "step": 35422
    },
    {
      "epoch": 3.7580097602376403,
      "grad_norm": 0.44326729216001637,
      "learning_rate": 3.888593303670043e-05,
      "loss": 1.5928,
      "num_input_tokens_seen": 27869615280,
      "step": 35423
    },
    {
      "epoch": 3.758115849777212,
      "grad_norm": 0.4431523292614883,
      "learning_rate": 3.888535512417088e-05,
      "loss": 1.5124,
      "num_input_tokens_seen": 27870402000,
      "step": 35424
    },
    {
      "epoch": 3.7582219393167833,
      "grad_norm": 0.4031477807529769,
      "learning_rate": 3.888477720091114e-05,
      "loss": 1.477,
      "num_input_tokens_seen": 27871188800,
      "step": 35425
    },
    {
      "epoch": 3.7583280288563548,
      "grad_norm": 0.4752272620629165,
      "learning_rate": 3.8884199266921664e-05,
      "loss": 1.6286,
      "num_input_tokens_seen": 27871975536,
      "step": 35426
    },
    {
      "epoch": 3.7584341183959262,
      "grad_norm": 0.3848175287529023,
      "learning_rate": 3.888362132220287e-05,
      "loss": 1.4051,
      "num_input_tokens_seen": 27872762368,
      "step": 35427
    },
    {
      "epoch": 3.7585402079354977,
      "grad_norm": 0.4437535638636227,
      "learning_rate": 3.888304336675523e-05,
      "loss": 1.4202,
      "num_input_tokens_seen": 27873549120,
      "step": 35428
    },
    {
      "epoch": 3.758646297475069,
      "grad_norm": 0.447003730159485,
      "learning_rate": 3.888246540057918e-05,
      "loss": 1.4408,
      "num_input_tokens_seen": 27874335824,
      "step": 35429
    },
    {
      "epoch": 3.75875238701464,
      "grad_norm": 0.39442319479663934,
      "learning_rate": 3.888188742367517e-05,
      "loss": 1.4787,
      "num_input_tokens_seen": 27875122608,
      "step": 35430
    },
    {
      "epoch": 3.7588584765542117,
      "grad_norm": 0.3982903421151797,
      "learning_rate": 3.888130943604363e-05,
      "loss": 1.4301,
      "num_input_tokens_seen": 27875909312,
      "step": 35431
    },
    {
      "epoch": 3.758964566093783,
      "grad_norm": 0.41480406866559427,
      "learning_rate": 3.888073143768504e-05,
      "loss": 1.4859,
      "num_input_tokens_seen": 27876696080,
      "step": 35432
    },
    {
      "epoch": 3.7590706556333546,
      "grad_norm": 0.42189734312114985,
      "learning_rate": 3.888015342859982e-05,
      "loss": 1.5462,
      "num_input_tokens_seen": 27877482848,
      "step": 35433
    },
    {
      "epoch": 3.759176745172926,
      "grad_norm": 0.48001049613891533,
      "learning_rate": 3.8879575408788425e-05,
      "loss": 1.5093,
      "num_input_tokens_seen": 27878269552,
      "step": 35434
    },
    {
      "epoch": 3.759282834712497,
      "grad_norm": 0.3814905225959731,
      "learning_rate": 3.88789973782513e-05,
      "loss": 1.4313,
      "num_input_tokens_seen": 27879056416,
      "step": 35435
    },
    {
      "epoch": 3.7593889242520686,
      "grad_norm": 0.47259340903400326,
      "learning_rate": 3.887841933698889e-05,
      "loss": 1.4584,
      "num_input_tokens_seen": 27879843264,
      "step": 35436
    },
    {
      "epoch": 3.75949501379164,
      "grad_norm": 0.4213171742330383,
      "learning_rate": 3.887784128500166e-05,
      "loss": 1.4312,
      "num_input_tokens_seen": 27880630032,
      "step": 35437
    },
    {
      "epoch": 3.7596011033312116,
      "grad_norm": 0.4535527298973827,
      "learning_rate": 3.887726322229003e-05,
      "loss": 1.476,
      "num_input_tokens_seen": 27881416880,
      "step": 35438
    },
    {
      "epoch": 3.759707192870783,
      "grad_norm": 0.43339860125770735,
      "learning_rate": 3.887668514885445e-05,
      "loss": 1.3801,
      "num_input_tokens_seen": 27882203600,
      "step": 35439
    },
    {
      "epoch": 3.759813282410354,
      "grad_norm": 0.4653867936968871,
      "learning_rate": 3.887610706469539e-05,
      "loss": 1.4724,
      "num_input_tokens_seen": 27882990272,
      "step": 35440
    },
    {
      "epoch": 3.759919371949926,
      "grad_norm": 0.39958437937309554,
      "learning_rate": 3.887552896981328e-05,
      "loss": 1.451,
      "num_input_tokens_seen": 27883777008,
      "step": 35441
    },
    {
      "epoch": 3.760025461489497,
      "grad_norm": 0.4235452342017159,
      "learning_rate": 3.887495086420856e-05,
      "loss": 1.4058,
      "num_input_tokens_seen": 27884563792,
      "step": 35442
    },
    {
      "epoch": 3.7601315510290685,
      "grad_norm": 0.4756672987110147,
      "learning_rate": 3.8874372747881695e-05,
      "loss": 1.4328,
      "num_input_tokens_seen": 27885350496,
      "step": 35443
    },
    {
      "epoch": 3.76023764056864,
      "grad_norm": 0.5665135620167598,
      "learning_rate": 3.8873794620833114e-05,
      "loss": 1.5087,
      "num_input_tokens_seen": 27886137248,
      "step": 35444
    },
    {
      "epoch": 3.7603437301082114,
      "grad_norm": 0.4823045391073628,
      "learning_rate": 3.8873216483063265e-05,
      "loss": 1.4446,
      "num_input_tokens_seen": 27886923920,
      "step": 35445
    },
    {
      "epoch": 3.760449819647783,
      "grad_norm": 0.5221648484077319,
      "learning_rate": 3.8872638334572615e-05,
      "loss": 1.4948,
      "num_input_tokens_seen": 27887710656,
      "step": 35446
    },
    {
      "epoch": 3.760555909187354,
      "grad_norm": 0.43473187491457926,
      "learning_rate": 3.887206017536159e-05,
      "loss": 1.5532,
      "num_input_tokens_seen": 27888497424,
      "step": 35447
    },
    {
      "epoch": 3.7606619987269254,
      "grad_norm": 0.5054786338738947,
      "learning_rate": 3.8871482005430646e-05,
      "loss": 1.4757,
      "num_input_tokens_seen": 27889284160,
      "step": 35448
    },
    {
      "epoch": 3.760768088266497,
      "grad_norm": 0.41091342543266735,
      "learning_rate": 3.887090382478023e-05,
      "loss": 1.4846,
      "num_input_tokens_seen": 27890070880,
      "step": 35449
    },
    {
      "epoch": 3.7608741778060684,
      "grad_norm": 0.48782711224064995,
      "learning_rate": 3.8870325633410785e-05,
      "loss": 1.5273,
      "num_input_tokens_seen": 27890857616,
      "step": 35450
    },
    {
      "epoch": 3.76098026734564,
      "grad_norm": 0.43781891923836025,
      "learning_rate": 3.8869747431322756e-05,
      "loss": 1.5149,
      "num_input_tokens_seen": 27891644368,
      "step": 35451
    },
    {
      "epoch": 3.761086356885211,
      "grad_norm": 0.4178526882594592,
      "learning_rate": 3.8869169218516596e-05,
      "loss": 1.3582,
      "num_input_tokens_seen": 27892431168,
      "step": 35452
    },
    {
      "epoch": 3.761192446424783,
      "grad_norm": 0.43832448359774157,
      "learning_rate": 3.8868590994992746e-05,
      "loss": 1.38,
      "num_input_tokens_seen": 27893217984,
      "step": 35453
    },
    {
      "epoch": 3.761298535964354,
      "grad_norm": 0.5009344389902731,
      "learning_rate": 3.8868012760751665e-05,
      "loss": 1.6334,
      "num_input_tokens_seen": 27894004720,
      "step": 35454
    },
    {
      "epoch": 3.7614046255039253,
      "grad_norm": 0.42867680482887216,
      "learning_rate": 3.886743451579378e-05,
      "loss": 1.4317,
      "num_input_tokens_seen": 27894791536,
      "step": 35455
    },
    {
      "epoch": 3.7615107150434968,
      "grad_norm": 0.44685557549547256,
      "learning_rate": 3.8866856260119554e-05,
      "loss": 1.5073,
      "num_input_tokens_seen": 27895578240,
      "step": 35456
    },
    {
      "epoch": 3.7616168045830682,
      "grad_norm": 0.43340018976808875,
      "learning_rate": 3.8866277993729426e-05,
      "loss": 1.4441,
      "num_input_tokens_seen": 27896365024,
      "step": 35457
    },
    {
      "epoch": 3.7617228941226397,
      "grad_norm": 0.37521200506523605,
      "learning_rate": 3.886569971662385e-05,
      "loss": 1.3622,
      "num_input_tokens_seen": 27897151872,
      "step": 35458
    },
    {
      "epoch": 3.7618289836622107,
      "grad_norm": 0.4796595801275531,
      "learning_rate": 3.8865121428803266e-05,
      "loss": 1.3593,
      "num_input_tokens_seen": 27897938640,
      "step": 35459
    },
    {
      "epoch": 3.761935073201782,
      "grad_norm": 0.46198784808904436,
      "learning_rate": 3.8864543130268115e-05,
      "loss": 1.4794,
      "num_input_tokens_seen": 27898725472,
      "step": 35460
    },
    {
      "epoch": 3.7620411627413537,
      "grad_norm": 0.4074803286975221,
      "learning_rate": 3.886396482101886e-05,
      "loss": 1.4452,
      "num_input_tokens_seen": 27899512176,
      "step": 35461
    },
    {
      "epoch": 3.762147252280925,
      "grad_norm": 0.49182806830398174,
      "learning_rate": 3.886338650105594e-05,
      "loss": 1.5202,
      "num_input_tokens_seen": 27900298864,
      "step": 35462
    },
    {
      "epoch": 3.7622533418204966,
      "grad_norm": 0.4061267047063754,
      "learning_rate": 3.88628081703798e-05,
      "loss": 1.3936,
      "num_input_tokens_seen": 27901085680,
      "step": 35463
    },
    {
      "epoch": 3.7623594313600677,
      "grad_norm": 0.8475974896064151,
      "learning_rate": 3.886222982899089e-05,
      "loss": 1.5456,
      "num_input_tokens_seen": 27901872368,
      "step": 35464
    },
    {
      "epoch": 3.762465520899639,
      "grad_norm": 0.39886809231089854,
      "learning_rate": 3.8861651476889646e-05,
      "loss": 1.4752,
      "num_input_tokens_seen": 27902659104,
      "step": 35465
    },
    {
      "epoch": 3.7625716104392106,
      "grad_norm": 0.46481911726524955,
      "learning_rate": 3.886107311407654e-05,
      "loss": 1.4666,
      "num_input_tokens_seen": 27903445984,
      "step": 35466
    },
    {
      "epoch": 3.762677699978782,
      "grad_norm": 0.45734963991174177,
      "learning_rate": 3.886049474055199e-05,
      "loss": 1.3907,
      "num_input_tokens_seen": 27904232800,
      "step": 35467
    },
    {
      "epoch": 3.7627837895183536,
      "grad_norm": 0.5223720435294738,
      "learning_rate": 3.885991635631646e-05,
      "loss": 1.4257,
      "num_input_tokens_seen": 27905019664,
      "step": 35468
    },
    {
      "epoch": 3.762889879057925,
      "grad_norm": 0.4489591096301829,
      "learning_rate": 3.88593379613704e-05,
      "loss": 1.4762,
      "num_input_tokens_seen": 27905806464,
      "step": 35469
    },
    {
      "epoch": 3.7629959685974965,
      "grad_norm": 0.5553094991782843,
      "learning_rate": 3.885875955571425e-05,
      "loss": 1.508,
      "num_input_tokens_seen": 27906593296,
      "step": 35470
    },
    {
      "epoch": 3.7631020581370676,
      "grad_norm": 0.46902423305477126,
      "learning_rate": 3.885818113934845e-05,
      "loss": 1.4732,
      "num_input_tokens_seen": 27907380032,
      "step": 35471
    },
    {
      "epoch": 3.763208147676639,
      "grad_norm": 0.4729173059250415,
      "learning_rate": 3.885760271227345e-05,
      "loss": 1.4222,
      "num_input_tokens_seen": 27908166800,
      "step": 35472
    },
    {
      "epoch": 3.7633142372162105,
      "grad_norm": 0.5021130687368388,
      "learning_rate": 3.885702427448972e-05,
      "loss": 1.4098,
      "num_input_tokens_seen": 27908953568,
      "step": 35473
    },
    {
      "epoch": 3.763420326755782,
      "grad_norm": 0.4653719404599596,
      "learning_rate": 3.885644582599767e-05,
      "loss": 1.4427,
      "num_input_tokens_seen": 27909740304,
      "step": 35474
    },
    {
      "epoch": 3.7635264162953534,
      "grad_norm": 0.5077126599930633,
      "learning_rate": 3.885586736679777e-05,
      "loss": 1.4052,
      "num_input_tokens_seen": 27910527072,
      "step": 35475
    },
    {
      "epoch": 3.7636325058349245,
      "grad_norm": 0.6827706551581716,
      "learning_rate": 3.8855288896890466e-05,
      "loss": 1.4199,
      "num_input_tokens_seen": 27911313808,
      "step": 35476
    },
    {
      "epoch": 3.763738595374496,
      "grad_norm": 0.5421869413144286,
      "learning_rate": 3.8854710416276205e-05,
      "loss": 1.4977,
      "num_input_tokens_seen": 27912100624,
      "step": 35477
    },
    {
      "epoch": 3.7638446849140674,
      "grad_norm": 0.6003601072052311,
      "learning_rate": 3.8854131924955414e-05,
      "loss": 1.4968,
      "num_input_tokens_seen": 27912887504,
      "step": 35478
    },
    {
      "epoch": 3.763950774453639,
      "grad_norm": 0.5398438027671487,
      "learning_rate": 3.885355342292857e-05,
      "loss": 1.4628,
      "num_input_tokens_seen": 27913674208,
      "step": 35479
    },
    {
      "epoch": 3.7640568639932104,
      "grad_norm": 0.6351540793895869,
      "learning_rate": 3.8852974910196104e-05,
      "loss": 1.4331,
      "num_input_tokens_seen": 27914460912,
      "step": 35480
    },
    {
      "epoch": 3.7641629535327814,
      "grad_norm": 0.49526014291869574,
      "learning_rate": 3.885239638675847e-05,
      "loss": 1.5169,
      "num_input_tokens_seen": 27915247680,
      "step": 35481
    },
    {
      "epoch": 3.7642690430723533,
      "grad_norm": 0.5101386843391911,
      "learning_rate": 3.88518178526161e-05,
      "loss": 1.4448,
      "num_input_tokens_seen": 27916034464,
      "step": 35482
    },
    {
      "epoch": 3.7643751326119244,
      "grad_norm": 0.44122975710693485,
      "learning_rate": 3.885123930776946e-05,
      "loss": 1.3964,
      "num_input_tokens_seen": 27916821344,
      "step": 35483
    },
    {
      "epoch": 3.764481222151496,
      "grad_norm": 0.5086842239466712,
      "learning_rate": 3.885066075221899e-05,
      "loss": 1.5629,
      "num_input_tokens_seen": 27917608096,
      "step": 35484
    },
    {
      "epoch": 3.7645873116910673,
      "grad_norm": 0.6503095839293336,
      "learning_rate": 3.885008218596513e-05,
      "loss": 1.4392,
      "num_input_tokens_seen": 27918394832,
      "step": 35485
    },
    {
      "epoch": 3.764693401230639,
      "grad_norm": 0.508239144979643,
      "learning_rate": 3.884950360900833e-05,
      "loss": 1.5344,
      "num_input_tokens_seen": 27919181600,
      "step": 35486
    },
    {
      "epoch": 3.7647994907702103,
      "grad_norm": 0.7159537275730695,
      "learning_rate": 3.884892502134905e-05,
      "loss": 1.4332,
      "num_input_tokens_seen": 27919968288,
      "step": 35487
    },
    {
      "epoch": 3.7649055803097813,
      "grad_norm": 0.4550358042493621,
      "learning_rate": 3.884834642298772e-05,
      "loss": 1.3617,
      "num_input_tokens_seen": 27920755088,
      "step": 35488
    },
    {
      "epoch": 3.7650116698493528,
      "grad_norm": 0.5205456725430146,
      "learning_rate": 3.8847767813924795e-05,
      "loss": 1.4424,
      "num_input_tokens_seen": 27921541856,
      "step": 35489
    },
    {
      "epoch": 3.7651177593889242,
      "grad_norm": 0.5716526911096191,
      "learning_rate": 3.884718919416072e-05,
      "loss": 1.4111,
      "num_input_tokens_seen": 27922328512,
      "step": 35490
    },
    {
      "epoch": 3.7652238489284957,
      "grad_norm": 0.6691082993922038,
      "learning_rate": 3.884661056369595e-05,
      "loss": 1.4367,
      "num_input_tokens_seen": 27923115232,
      "step": 35491
    },
    {
      "epoch": 3.765329938468067,
      "grad_norm": 0.45378486186529277,
      "learning_rate": 3.884603192253092e-05,
      "loss": 1.418,
      "num_input_tokens_seen": 27923902000,
      "step": 35492
    },
    {
      "epoch": 3.765436028007638,
      "grad_norm": 0.4799411195158233,
      "learning_rate": 3.884545327066609e-05,
      "loss": 1.3408,
      "num_input_tokens_seen": 27924688752,
      "step": 35493
    },
    {
      "epoch": 3.7655421175472097,
      "grad_norm": 0.4853185912892175,
      "learning_rate": 3.884487460810189e-05,
      "loss": 1.5408,
      "num_input_tokens_seen": 27925475520,
      "step": 35494
    },
    {
      "epoch": 3.765648207086781,
      "grad_norm": 0.4221292792651118,
      "learning_rate": 3.8844295934838784e-05,
      "loss": 1.4969,
      "num_input_tokens_seen": 27926262272,
      "step": 35495
    },
    {
      "epoch": 3.7657542966263526,
      "grad_norm": 0.38318825098838033,
      "learning_rate": 3.88437172508772e-05,
      "loss": 1.3806,
      "num_input_tokens_seen": 27927049040,
      "step": 35496
    },
    {
      "epoch": 3.765860386165924,
      "grad_norm": 0.4454180775078642,
      "learning_rate": 3.8843138556217613e-05,
      "loss": 1.5471,
      "num_input_tokens_seen": 27927835776,
      "step": 35497
    },
    {
      "epoch": 3.7659664757054956,
      "grad_norm": 0.43881390646932417,
      "learning_rate": 3.8842559850860446e-05,
      "loss": 1.4688,
      "num_input_tokens_seen": 27928622576,
      "step": 35498
    },
    {
      "epoch": 3.766072565245067,
      "grad_norm": 0.47345290670711676,
      "learning_rate": 3.884198113480616e-05,
      "loss": 1.4509,
      "num_input_tokens_seen": 27929409216,
      "step": 35499
    },
    {
      "epoch": 3.766178654784638,
      "grad_norm": 0.42975930894810904,
      "learning_rate": 3.884140240805519e-05,
      "loss": 1.3948,
      "num_input_tokens_seen": 27930196000,
      "step": 35500
    },
    {
      "epoch": 3.7662847443242096,
      "grad_norm": 0.48394645799289915,
      "learning_rate": 3.8840823670608e-05,
      "loss": 1.5243,
      "num_input_tokens_seen": 27930982800,
      "step": 35501
    },
    {
      "epoch": 3.766390833863781,
      "grad_norm": 0.40313391564598894,
      "learning_rate": 3.884024492246502e-05,
      "loss": 1.3224,
      "num_input_tokens_seen": 27931769648,
      "step": 35502
    },
    {
      "epoch": 3.7664969234033525,
      "grad_norm": 0.4568082352717902,
      "learning_rate": 3.883966616362671e-05,
      "loss": 1.4339,
      "num_input_tokens_seen": 27932556400,
      "step": 35503
    },
    {
      "epoch": 3.766603012942924,
      "grad_norm": 0.39777534808551374,
      "learning_rate": 3.883908739409351e-05,
      "loss": 1.3841,
      "num_input_tokens_seen": 27933343136,
      "step": 35504
    },
    {
      "epoch": 3.766709102482495,
      "grad_norm": 0.4407343130357816,
      "learning_rate": 3.8838508613865864e-05,
      "loss": 1.4748,
      "num_input_tokens_seen": 27934129904,
      "step": 35505
    },
    {
      "epoch": 3.7668151920220665,
      "grad_norm": 0.42895369402012157,
      "learning_rate": 3.883792982294423e-05,
      "loss": 1.5145,
      "num_input_tokens_seen": 27934916704,
      "step": 35506
    },
    {
      "epoch": 3.766921281561638,
      "grad_norm": 0.41069169454593,
      "learning_rate": 3.883735102132905e-05,
      "loss": 1.4688,
      "num_input_tokens_seen": 27935703456,
      "step": 35507
    },
    {
      "epoch": 3.7670273711012094,
      "grad_norm": 0.3900704872474674,
      "learning_rate": 3.883677220902077e-05,
      "loss": 1.4103,
      "num_input_tokens_seen": 27936490176,
      "step": 35508
    },
    {
      "epoch": 3.767133460640781,
      "grad_norm": 0.43667584938894904,
      "learning_rate": 3.8836193386019836e-05,
      "loss": 1.5334,
      "num_input_tokens_seen": 27937276912,
      "step": 35509
    },
    {
      "epoch": 3.767239550180352,
      "grad_norm": 0.364812109712544,
      "learning_rate": 3.88356145523267e-05,
      "loss": 1.33,
      "num_input_tokens_seen": 27938063760,
      "step": 35510
    },
    {
      "epoch": 3.767345639719924,
      "grad_norm": 0.5384148028570321,
      "learning_rate": 3.8835035707941815e-05,
      "loss": 1.5251,
      "num_input_tokens_seen": 27938850464,
      "step": 35511
    },
    {
      "epoch": 3.767451729259495,
      "grad_norm": 0.4200607767513745,
      "learning_rate": 3.883445685286561e-05,
      "loss": 1.3698,
      "num_input_tokens_seen": 27939637376,
      "step": 35512
    },
    {
      "epoch": 3.7675578187990664,
      "grad_norm": 0.5180308723549485,
      "learning_rate": 3.8833877987098544e-05,
      "loss": 1.457,
      "num_input_tokens_seen": 27940424144,
      "step": 35513
    },
    {
      "epoch": 3.767663908338638,
      "grad_norm": 0.4832906175236958,
      "learning_rate": 3.883329911064107e-05,
      "loss": 1.3506,
      "num_input_tokens_seen": 27941210912,
      "step": 35514
    },
    {
      "epoch": 3.7677699978782093,
      "grad_norm": 0.45348974754989313,
      "learning_rate": 3.8832720223493614e-05,
      "loss": 1.3475,
      "num_input_tokens_seen": 27941997696,
      "step": 35515
    },
    {
      "epoch": 3.767876087417781,
      "grad_norm": 0.5379529506392804,
      "learning_rate": 3.8832141325656646e-05,
      "loss": 1.5005,
      "num_input_tokens_seen": 27942784432,
      "step": 35516
    },
    {
      "epoch": 3.767982176957352,
      "grad_norm": 0.3998991809469411,
      "learning_rate": 3.883156241713061e-05,
      "loss": 1.4269,
      "num_input_tokens_seen": 27943571248,
      "step": 35517
    },
    {
      "epoch": 3.7680882664969233,
      "grad_norm": 0.5093079472256395,
      "learning_rate": 3.883098349791594e-05,
      "loss": 1.3973,
      "num_input_tokens_seen": 27944357984,
      "step": 35518
    },
    {
      "epoch": 3.7681943560364948,
      "grad_norm": 0.4220435564137376,
      "learning_rate": 3.88304045680131e-05,
      "loss": 1.5449,
      "num_input_tokens_seen": 27945144752,
      "step": 35519
    },
    {
      "epoch": 3.7683004455760662,
      "grad_norm": 0.4784774834085945,
      "learning_rate": 3.8829825627422526e-05,
      "loss": 1.482,
      "num_input_tokens_seen": 27945931472,
      "step": 35520
    },
    {
      "epoch": 3.7684065351156377,
      "grad_norm": 0.45419103431251956,
      "learning_rate": 3.8829246676144663e-05,
      "loss": 1.4852,
      "num_input_tokens_seen": 27946718208,
      "step": 35521
    },
    {
      "epoch": 3.7685126246552088,
      "grad_norm": 0.4944459079874302,
      "learning_rate": 3.882866771417997e-05,
      "loss": 1.4096,
      "num_input_tokens_seen": 27947505072,
      "step": 35522
    },
    {
      "epoch": 3.7686187141947802,
      "grad_norm": 0.5246451967182909,
      "learning_rate": 3.882808874152889e-05,
      "loss": 1.5066,
      "num_input_tokens_seen": 27948291792,
      "step": 35523
    },
    {
      "epoch": 3.7687248037343517,
      "grad_norm": 0.5282766346775735,
      "learning_rate": 3.882750975819186e-05,
      "loss": 1.3444,
      "num_input_tokens_seen": 27949078672,
      "step": 35524
    },
    {
      "epoch": 3.768830893273923,
      "grad_norm": 0.42724493657290746,
      "learning_rate": 3.882693076416934e-05,
      "loss": 1.4035,
      "num_input_tokens_seen": 27949865456,
      "step": 35525
    },
    {
      "epoch": 3.7689369828134947,
      "grad_norm": 0.45747512051014033,
      "learning_rate": 3.882635175946178e-05,
      "loss": 1.3875,
      "num_input_tokens_seen": 27950652176,
      "step": 35526
    },
    {
      "epoch": 3.769043072353066,
      "grad_norm": 0.4738532710910268,
      "learning_rate": 3.882577274406962e-05,
      "loss": 1.4672,
      "num_input_tokens_seen": 27951438944,
      "step": 35527
    },
    {
      "epoch": 3.7691491618926376,
      "grad_norm": 0.6321717377322376,
      "learning_rate": 3.88251937179933e-05,
      "loss": 1.4722,
      "num_input_tokens_seen": 27952225728,
      "step": 35528
    },
    {
      "epoch": 3.7692552514322086,
      "grad_norm": 0.40270462464923334,
      "learning_rate": 3.882461468123329e-05,
      "loss": 1.4811,
      "num_input_tokens_seen": 27953012480,
      "step": 35529
    },
    {
      "epoch": 3.76936134097178,
      "grad_norm": 0.5302091485735156,
      "learning_rate": 3.882403563379001e-05,
      "loss": 1.4174,
      "num_input_tokens_seen": 27953799328,
      "step": 35530
    },
    {
      "epoch": 3.7694674305113516,
      "grad_norm": 0.4808002444971667,
      "learning_rate": 3.8823456575663925e-05,
      "loss": 1.493,
      "num_input_tokens_seen": 27954586080,
      "step": 35531
    },
    {
      "epoch": 3.769573520050923,
      "grad_norm": 0.5240488683440708,
      "learning_rate": 3.882287750685548e-05,
      "loss": 1.4878,
      "num_input_tokens_seen": 27955372896,
      "step": 35532
    },
    {
      "epoch": 3.7696796095904945,
      "grad_norm": 0.5209401236822667,
      "learning_rate": 3.882229842736512e-05,
      "loss": 1.4337,
      "num_input_tokens_seen": 27956159632,
      "step": 35533
    },
    {
      "epoch": 3.7697856991300656,
      "grad_norm": 0.5556716346175294,
      "learning_rate": 3.882171933719329e-05,
      "loss": 1.4076,
      "num_input_tokens_seen": 27956946480,
      "step": 35534
    },
    {
      "epoch": 3.769891788669637,
      "grad_norm": 0.5712551146686267,
      "learning_rate": 3.8821140236340444e-05,
      "loss": 1.4633,
      "num_input_tokens_seen": 27957733296,
      "step": 35535
    },
    {
      "epoch": 3.7699978782092085,
      "grad_norm": 0.4478821937508345,
      "learning_rate": 3.8820561124807024e-05,
      "loss": 1.4349,
      "num_input_tokens_seen": 27958520080,
      "step": 35536
    },
    {
      "epoch": 3.77010396774878,
      "grad_norm": 0.8734593519333966,
      "learning_rate": 3.881998200259348e-05,
      "loss": 1.4704,
      "num_input_tokens_seen": 27959306784,
      "step": 35537
    },
    {
      "epoch": 3.7702100572883515,
      "grad_norm": 0.43867004497945034,
      "learning_rate": 3.881940286970026e-05,
      "loss": 1.3981,
      "num_input_tokens_seen": 27960093648,
      "step": 35538
    },
    {
      "epoch": 3.770316146827923,
      "grad_norm": 0.6443282669557918,
      "learning_rate": 3.8818823726127815e-05,
      "loss": 1.4123,
      "num_input_tokens_seen": 27960880496,
      "step": 35539
    },
    {
      "epoch": 3.7704222363674944,
      "grad_norm": 0.5232418994840511,
      "learning_rate": 3.8818244571876586e-05,
      "loss": 1.473,
      "num_input_tokens_seen": 27961667168,
      "step": 35540
    },
    {
      "epoch": 3.7705283259070654,
      "grad_norm": 0.5040168644857753,
      "learning_rate": 3.881766540694702e-05,
      "loss": 1.424,
      "num_input_tokens_seen": 27962454048,
      "step": 35541
    },
    {
      "epoch": 3.770634415446637,
      "grad_norm": 0.636290041225661,
      "learning_rate": 3.881708623133957e-05,
      "loss": 1.4668,
      "num_input_tokens_seen": 27963240960,
      "step": 35542
    },
    {
      "epoch": 3.7707405049862084,
      "grad_norm": 0.49055650318452676,
      "learning_rate": 3.881650704505468e-05,
      "loss": 1.3742,
      "num_input_tokens_seen": 27964027776,
      "step": 35543
    },
    {
      "epoch": 3.77084659452578,
      "grad_norm": 0.5068695329170039,
      "learning_rate": 3.8815927848092805e-05,
      "loss": 1.3984,
      "num_input_tokens_seen": 27964814560,
      "step": 35544
    },
    {
      "epoch": 3.7709526840653513,
      "grad_norm": 0.8261776254229704,
      "learning_rate": 3.8815348640454383e-05,
      "loss": 1.496,
      "num_input_tokens_seen": 27965601216,
      "step": 35545
    },
    {
      "epoch": 3.7710587736049224,
      "grad_norm": 0.39857088447271943,
      "learning_rate": 3.8814769422139864e-05,
      "loss": 1.5214,
      "num_input_tokens_seen": 27966387920,
      "step": 35546
    },
    {
      "epoch": 3.771164863144494,
      "grad_norm": 0.6166143847035882,
      "learning_rate": 3.881419019314969e-05,
      "loss": 1.326,
      "num_input_tokens_seen": 27967174784,
      "step": 35547
    },
    {
      "epoch": 3.7712709526840653,
      "grad_norm": 0.7338210103540822,
      "learning_rate": 3.8813610953484326e-05,
      "loss": 1.471,
      "num_input_tokens_seen": 27967961584,
      "step": 35548
    },
    {
      "epoch": 3.771377042223637,
      "grad_norm": 0.5558435135164437,
      "learning_rate": 3.881303170314421e-05,
      "loss": 1.4272,
      "num_input_tokens_seen": 27968748320,
      "step": 35549
    },
    {
      "epoch": 3.7714831317632083,
      "grad_norm": 0.5881681384988905,
      "learning_rate": 3.8812452442129775e-05,
      "loss": 1.4987,
      "num_input_tokens_seen": 27969534976,
      "step": 35550
    },
    {
      "epoch": 3.7715892213027793,
      "grad_norm": 0.4752296617882647,
      "learning_rate": 3.8811873170441494e-05,
      "loss": 1.5435,
      "num_input_tokens_seen": 27970321760,
      "step": 35551
    },
    {
      "epoch": 3.771695310842351,
      "grad_norm": 0.5052082772221671,
      "learning_rate": 3.88112938880798e-05,
      "loss": 1.4689,
      "num_input_tokens_seen": 27971108560,
      "step": 35552
    },
    {
      "epoch": 3.7718014003819222,
      "grad_norm": 0.40789395834472586,
      "learning_rate": 3.881071459504514e-05,
      "loss": 1.3957,
      "num_input_tokens_seen": 27971895376,
      "step": 35553
    },
    {
      "epoch": 3.7719074899214937,
      "grad_norm": 0.40865618712546864,
      "learning_rate": 3.881013529133797e-05,
      "loss": 1.4481,
      "num_input_tokens_seen": 27972682080,
      "step": 35554
    },
    {
      "epoch": 3.772013579461065,
      "grad_norm": 0.4482864395814087,
      "learning_rate": 3.880955597695872e-05,
      "loss": 1.3988,
      "num_input_tokens_seen": 27973468736,
      "step": 35555
    },
    {
      "epoch": 3.7721196690006367,
      "grad_norm": 0.5078186882798325,
      "learning_rate": 3.8808976651907864e-05,
      "loss": 1.4852,
      "num_input_tokens_seen": 27974255616,
      "step": 35556
    },
    {
      "epoch": 3.772225758540208,
      "grad_norm": 0.4069574175250439,
      "learning_rate": 3.880839731618583e-05,
      "loss": 1.4088,
      "num_input_tokens_seen": 27975042416,
      "step": 35557
    },
    {
      "epoch": 3.772331848079779,
      "grad_norm": 0.5059093096301442,
      "learning_rate": 3.880781796979308e-05,
      "loss": 1.4541,
      "num_input_tokens_seen": 27975829120,
      "step": 35558
    },
    {
      "epoch": 3.7724379376193506,
      "grad_norm": 0.41234354024436404,
      "learning_rate": 3.880723861273004e-05,
      "loss": 1.3289,
      "num_input_tokens_seen": 27976615904,
      "step": 35559
    },
    {
      "epoch": 3.772544027158922,
      "grad_norm": 0.5804661282524304,
      "learning_rate": 3.880665924499718e-05,
      "loss": 1.463,
      "num_input_tokens_seen": 27977402736,
      "step": 35560
    },
    {
      "epoch": 3.7726501166984936,
      "grad_norm": 0.4000603789362137,
      "learning_rate": 3.880607986659493e-05,
      "loss": 1.337,
      "num_input_tokens_seen": 27978189504,
      "step": 35561
    },
    {
      "epoch": 3.772756206238065,
      "grad_norm": 0.44869859767094306,
      "learning_rate": 3.880550047752376e-05,
      "loss": 1.4114,
      "num_input_tokens_seen": 27978976176,
      "step": 35562
    },
    {
      "epoch": 3.772862295777636,
      "grad_norm": 0.6043742392019515,
      "learning_rate": 3.8804921077784095e-05,
      "loss": 1.504,
      "num_input_tokens_seen": 27979762976,
      "step": 35563
    },
    {
      "epoch": 3.7729683853172076,
      "grad_norm": 0.42408541599621175,
      "learning_rate": 3.8804341667376394e-05,
      "loss": 1.5127,
      "num_input_tokens_seen": 27980549664,
      "step": 35564
    },
    {
      "epoch": 3.773074474856779,
      "grad_norm": 0.5368902401267657,
      "learning_rate": 3.88037622463011e-05,
      "loss": 1.3483,
      "num_input_tokens_seen": 27981336464,
      "step": 35565
    },
    {
      "epoch": 3.7731805643963505,
      "grad_norm": 0.4161928682238121,
      "learning_rate": 3.880318281455867e-05,
      "loss": 1.3469,
      "num_input_tokens_seen": 27982123280,
      "step": 35566
    },
    {
      "epoch": 3.773286653935922,
      "grad_norm": 0.5257725071695007,
      "learning_rate": 3.8802603372149545e-05,
      "loss": 1.3916,
      "num_input_tokens_seen": 27982910144,
      "step": 35567
    },
    {
      "epoch": 3.7733927434754935,
      "grad_norm": 0.40945119095655447,
      "learning_rate": 3.8802023919074165e-05,
      "loss": 1.4038,
      "num_input_tokens_seen": 27983696960,
      "step": 35568
    },
    {
      "epoch": 3.773498833015065,
      "grad_norm": 0.5155567054677161,
      "learning_rate": 3.8801444455332994e-05,
      "loss": 1.4465,
      "num_input_tokens_seen": 27984483664,
      "step": 35569
    },
    {
      "epoch": 3.773604922554636,
      "grad_norm": 0.40369177295379277,
      "learning_rate": 3.8800864980926465e-05,
      "loss": 1.3752,
      "num_input_tokens_seen": 27985270432,
      "step": 35570
    },
    {
      "epoch": 3.7737110120942075,
      "grad_norm": 0.5152223223540588,
      "learning_rate": 3.880028549585504e-05,
      "loss": 1.5381,
      "num_input_tokens_seen": 27986057184,
      "step": 35571
    },
    {
      "epoch": 3.773817101633779,
      "grad_norm": 0.43989917545157264,
      "learning_rate": 3.879970600011916e-05,
      "loss": 1.402,
      "num_input_tokens_seen": 27986844016,
      "step": 35572
    },
    {
      "epoch": 3.7739231911733504,
      "grad_norm": 0.398125767728484,
      "learning_rate": 3.879912649371926e-05,
      "loss": 1.4556,
      "num_input_tokens_seen": 27987630736,
      "step": 35573
    },
    {
      "epoch": 3.774029280712922,
      "grad_norm": 0.49996754104215757,
      "learning_rate": 3.879854697665581e-05,
      "loss": 1.4469,
      "num_input_tokens_seen": 27988417504,
      "step": 35574
    },
    {
      "epoch": 3.774135370252493,
      "grad_norm": 0.5421027786356398,
      "learning_rate": 3.8797967448929244e-05,
      "loss": 1.4497,
      "num_input_tokens_seen": 27989204208,
      "step": 35575
    },
    {
      "epoch": 3.7742414597920644,
      "grad_norm": 0.41644375234754294,
      "learning_rate": 3.8797387910540015e-05,
      "loss": 1.4015,
      "num_input_tokens_seen": 27989991040,
      "step": 35576
    },
    {
      "epoch": 3.774347549331636,
      "grad_norm": 0.7063596681392635,
      "learning_rate": 3.879680836148857e-05,
      "loss": 1.5523,
      "num_input_tokens_seen": 27990777824,
      "step": 35577
    },
    {
      "epoch": 3.7744536388712073,
      "grad_norm": 0.48472837751526665,
      "learning_rate": 3.8796228801775356e-05,
      "loss": 1.3958,
      "num_input_tokens_seen": 27991564624,
      "step": 35578
    },
    {
      "epoch": 3.774559728410779,
      "grad_norm": 0.6615127133580342,
      "learning_rate": 3.879564923140082e-05,
      "loss": 1.4043,
      "num_input_tokens_seen": 27992351360,
      "step": 35579
    },
    {
      "epoch": 3.77466581795035,
      "grad_norm": 0.5723614914889077,
      "learning_rate": 3.8795069650365415e-05,
      "loss": 1.5533,
      "num_input_tokens_seen": 27993138096,
      "step": 35580
    },
    {
      "epoch": 3.7747719074899218,
      "grad_norm": 0.46337378843704485,
      "learning_rate": 3.879449005866958e-05,
      "loss": 1.456,
      "num_input_tokens_seen": 27993924848,
      "step": 35581
    },
    {
      "epoch": 3.774877997029493,
      "grad_norm": 0.6942863401953714,
      "learning_rate": 3.8793910456313774e-05,
      "loss": 1.4785,
      "num_input_tokens_seen": 27994711600,
      "step": 35582
    },
    {
      "epoch": 3.7749840865690643,
      "grad_norm": 0.4501444314113763,
      "learning_rate": 3.8793330843298435e-05,
      "loss": 1.441,
      "num_input_tokens_seen": 27995498352,
      "step": 35583
    },
    {
      "epoch": 3.7750901761086357,
      "grad_norm": 0.6881858187129599,
      "learning_rate": 3.8792751219624013e-05,
      "loss": 1.442,
      "num_input_tokens_seen": 27996285136,
      "step": 35584
    },
    {
      "epoch": 3.775196265648207,
      "grad_norm": 0.6768123761532362,
      "learning_rate": 3.879217158529096e-05,
      "loss": 1.5094,
      "num_input_tokens_seen": 27997071920,
      "step": 35585
    },
    {
      "epoch": 3.7753023551877787,
      "grad_norm": 0.4759099294520888,
      "learning_rate": 3.879159194029972e-05,
      "loss": 1.4486,
      "num_input_tokens_seen": 27997858624,
      "step": 35586
    },
    {
      "epoch": 3.7754084447273497,
      "grad_norm": 0.7437287214985214,
      "learning_rate": 3.879101228465074e-05,
      "loss": 1.5621,
      "num_input_tokens_seen": 27998645376,
      "step": 35587
    },
    {
      "epoch": 3.775514534266921,
      "grad_norm": 0.5337362751416668,
      "learning_rate": 3.8790432618344475e-05,
      "loss": 1.4434,
      "num_input_tokens_seen": 27999432096,
      "step": 35588
    },
    {
      "epoch": 3.7756206238064927,
      "grad_norm": 0.6377000298578026,
      "learning_rate": 3.878985294138137e-05,
      "loss": 1.5206,
      "num_input_tokens_seen": 28000218848,
      "step": 35589
    },
    {
      "epoch": 3.775726713346064,
      "grad_norm": 0.6632730891051417,
      "learning_rate": 3.8789273253761866e-05,
      "loss": 1.419,
      "num_input_tokens_seen": 28001005600,
      "step": 35590
    },
    {
      "epoch": 3.7758328028856356,
      "grad_norm": 0.5601333467600808,
      "learning_rate": 3.8788693555486413e-05,
      "loss": 1.4855,
      "num_input_tokens_seen": 28001792416,
      "step": 35591
    },
    {
      "epoch": 3.7759388924252066,
      "grad_norm": 0.6909328076823532,
      "learning_rate": 3.8788113846555476e-05,
      "loss": 1.4936,
      "num_input_tokens_seen": 28002579152,
      "step": 35592
    },
    {
      "epoch": 3.776044981964778,
      "grad_norm": 0.43519143995176685,
      "learning_rate": 3.8787534126969474e-05,
      "loss": 1.4872,
      "num_input_tokens_seen": 28003365936,
      "step": 35593
    },
    {
      "epoch": 3.7761510715043496,
      "grad_norm": 0.6037374110588755,
      "learning_rate": 3.878695439672888e-05,
      "loss": 1.5094,
      "num_input_tokens_seen": 28004152784,
      "step": 35594
    },
    {
      "epoch": 3.776257161043921,
      "grad_norm": 0.44566991008837153,
      "learning_rate": 3.8786374655834125e-05,
      "loss": 1.4534,
      "num_input_tokens_seen": 28004939568,
      "step": 35595
    },
    {
      "epoch": 3.7763632505834925,
      "grad_norm": 0.519411129857604,
      "learning_rate": 3.8785794904285674e-05,
      "loss": 1.3936,
      "num_input_tokens_seen": 28005726352,
      "step": 35596
    },
    {
      "epoch": 3.776469340123064,
      "grad_norm": 0.542769963161045,
      "learning_rate": 3.878521514208395e-05,
      "loss": 1.4539,
      "num_input_tokens_seen": 28006513040,
      "step": 35597
    },
    {
      "epoch": 3.7765754296626355,
      "grad_norm": 0.41520489025531254,
      "learning_rate": 3.8784635369229424e-05,
      "loss": 1.3869,
      "num_input_tokens_seen": 28007299808,
      "step": 35598
    },
    {
      "epoch": 3.7766815192022065,
      "grad_norm": 0.6076643542257333,
      "learning_rate": 3.878405558572255e-05,
      "loss": 1.5499,
      "num_input_tokens_seen": 28008086576,
      "step": 35599
    },
    {
      "epoch": 3.776787608741778,
      "grad_norm": 0.4812899902477069,
      "learning_rate": 3.8783475791563745e-05,
      "loss": 1.5266,
      "num_input_tokens_seen": 28008873296,
      "step": 35600
    },
    {
      "epoch": 3.7768936982813495,
      "grad_norm": 0.47637586748168226,
      "learning_rate": 3.8782895986753475e-05,
      "loss": 1.399,
      "num_input_tokens_seen": 28009660016,
      "step": 35601
    },
    {
      "epoch": 3.776999787820921,
      "grad_norm": 0.43776183150354514,
      "learning_rate": 3.87823161712922e-05,
      "loss": 1.439,
      "num_input_tokens_seen": 28010446736,
      "step": 35602
    },
    {
      "epoch": 3.7771058773604924,
      "grad_norm": 0.4489744796412001,
      "learning_rate": 3.878173634518034e-05,
      "loss": 1.4692,
      "num_input_tokens_seen": 28011233520,
      "step": 35603
    },
    {
      "epoch": 3.7772119669000634,
      "grad_norm": 0.5350489291769129,
      "learning_rate": 3.878115650841837e-05,
      "loss": 1.6087,
      "num_input_tokens_seen": 28012020240,
      "step": 35604
    },
    {
      "epoch": 3.777318056439635,
      "grad_norm": 0.4174788728325118,
      "learning_rate": 3.878057666100672e-05,
      "loss": 1.4367,
      "num_input_tokens_seen": 28012807040,
      "step": 35605
    },
    {
      "epoch": 3.7774241459792064,
      "grad_norm": 0.49725989818277516,
      "learning_rate": 3.877999680294585e-05,
      "loss": 1.4337,
      "num_input_tokens_seen": 28013593840,
      "step": 35606
    },
    {
      "epoch": 3.777530235518778,
      "grad_norm": 0.4643990779811653,
      "learning_rate": 3.87794169342362e-05,
      "loss": 1.4489,
      "num_input_tokens_seen": 28014380640,
      "step": 35607
    },
    {
      "epoch": 3.7776363250583493,
      "grad_norm": 0.5339853238712253,
      "learning_rate": 3.877883705487821e-05,
      "loss": 1.5411,
      "num_input_tokens_seen": 28015167312,
      "step": 35608
    },
    {
      "epoch": 3.7777424145979204,
      "grad_norm": 0.40235532154498055,
      "learning_rate": 3.877825716487236e-05,
      "loss": 1.3716,
      "num_input_tokens_seen": 28015954096,
      "step": 35609
    },
    {
      "epoch": 3.7778485041374923,
      "grad_norm": 0.45957116433011336,
      "learning_rate": 3.8777677264219057e-05,
      "loss": 1.4264,
      "num_input_tokens_seen": 28016740864,
      "step": 35610
    },
    {
      "epoch": 3.7779545936770633,
      "grad_norm": 0.5356978074325169,
      "learning_rate": 3.877709735291878e-05,
      "loss": 1.4356,
      "num_input_tokens_seen": 28017527600,
      "step": 35611
    },
    {
      "epoch": 3.778060683216635,
      "grad_norm": 0.46434430750181754,
      "learning_rate": 3.877651743097197e-05,
      "loss": 1.3692,
      "num_input_tokens_seen": 28018314336,
      "step": 35612
    },
    {
      "epoch": 3.7781667727562063,
      "grad_norm": 0.4363319613562594,
      "learning_rate": 3.8775937498379065e-05,
      "loss": 1.4539,
      "num_input_tokens_seen": 28019101024,
      "step": 35613
    },
    {
      "epoch": 3.7782728622957777,
      "grad_norm": 0.410267674048387,
      "learning_rate": 3.8775357555140525e-05,
      "loss": 1.4488,
      "num_input_tokens_seen": 28019887808,
      "step": 35614
    },
    {
      "epoch": 3.778378951835349,
      "grad_norm": 0.4309352477601586,
      "learning_rate": 3.877477760125679e-05,
      "loss": 1.5774,
      "num_input_tokens_seen": 28020674528,
      "step": 35615
    },
    {
      "epoch": 3.7784850413749203,
      "grad_norm": 0.43368993111454696,
      "learning_rate": 3.8774197636728304e-05,
      "loss": 1.5724,
      "num_input_tokens_seen": 28021461232,
      "step": 35616
    },
    {
      "epoch": 3.7785911309144917,
      "grad_norm": 0.4137636963237868,
      "learning_rate": 3.877361766155553e-05,
      "loss": 1.4402,
      "num_input_tokens_seen": 28022248000,
      "step": 35617
    },
    {
      "epoch": 3.778697220454063,
      "grad_norm": 0.40949319847838017,
      "learning_rate": 3.877303767573891e-05,
      "loss": 1.4292,
      "num_input_tokens_seen": 28023034752,
      "step": 35618
    },
    {
      "epoch": 3.7788033099936347,
      "grad_norm": 0.41295869451847866,
      "learning_rate": 3.877245767927889e-05,
      "loss": 1.3753,
      "num_input_tokens_seen": 28023821488,
      "step": 35619
    },
    {
      "epoch": 3.778909399533206,
      "grad_norm": 0.4085416984449139,
      "learning_rate": 3.8771877672175915e-05,
      "loss": 1.4286,
      "num_input_tokens_seen": 28024608176,
      "step": 35620
    },
    {
      "epoch": 3.779015489072777,
      "grad_norm": 0.41200706805004805,
      "learning_rate": 3.877129765443044e-05,
      "loss": 1.3592,
      "num_input_tokens_seen": 28025395024,
      "step": 35621
    },
    {
      "epoch": 3.779121578612349,
      "grad_norm": 0.4860970781033759,
      "learning_rate": 3.877071762604291e-05,
      "loss": 1.5221,
      "num_input_tokens_seen": 28026181808,
      "step": 35622
    },
    {
      "epoch": 3.77922766815192,
      "grad_norm": 0.42072190172877916,
      "learning_rate": 3.877013758701377e-05,
      "loss": 1.5315,
      "num_input_tokens_seen": 28026968544,
      "step": 35623
    },
    {
      "epoch": 3.7793337576914916,
      "grad_norm": 0.41270344607785076,
      "learning_rate": 3.876955753734347e-05,
      "loss": 1.4526,
      "num_input_tokens_seen": 28027755312,
      "step": 35624
    },
    {
      "epoch": 3.779439847231063,
      "grad_norm": 0.42860946690260954,
      "learning_rate": 3.876897747703247e-05,
      "loss": 1.4925,
      "num_input_tokens_seen": 28028542048,
      "step": 35625
    },
    {
      "epoch": 3.7795459367706346,
      "grad_norm": 0.4688997780659505,
      "learning_rate": 3.87683974060812e-05,
      "loss": 1.4453,
      "num_input_tokens_seen": 28029328784,
      "step": 35626
    },
    {
      "epoch": 3.779652026310206,
      "grad_norm": 0.45071899570751023,
      "learning_rate": 3.876781732449012e-05,
      "loss": 1.5148,
      "num_input_tokens_seen": 28030115552,
      "step": 35627
    },
    {
      "epoch": 3.779758115849777,
      "grad_norm": 0.4774538463312273,
      "learning_rate": 3.876723723225967e-05,
      "loss": 1.5791,
      "num_input_tokens_seen": 28030902272,
      "step": 35628
    },
    {
      "epoch": 3.7798642053893485,
      "grad_norm": 0.39932001769286973,
      "learning_rate": 3.876665712939031e-05,
      "loss": 1.4526,
      "num_input_tokens_seen": 28031689120,
      "step": 35629
    },
    {
      "epoch": 3.77997029492892,
      "grad_norm": 0.49987818556146496,
      "learning_rate": 3.8766077015882476e-05,
      "loss": 1.4861,
      "num_input_tokens_seen": 28032475824,
      "step": 35630
    },
    {
      "epoch": 3.7800763844684915,
      "grad_norm": 0.4111085108412895,
      "learning_rate": 3.8765496891736625e-05,
      "loss": 1.4323,
      "num_input_tokens_seen": 28033262704,
      "step": 35631
    },
    {
      "epoch": 3.780182474008063,
      "grad_norm": 0.45060409411647057,
      "learning_rate": 3.87649167569532e-05,
      "loss": 1.3167,
      "num_input_tokens_seen": 28034049552,
      "step": 35632
    },
    {
      "epoch": 3.780288563547634,
      "grad_norm": 0.5119117885181548,
      "learning_rate": 3.876433661153265e-05,
      "loss": 1.4942,
      "num_input_tokens_seen": 28034836304,
      "step": 35633
    },
    {
      "epoch": 3.7803946530872055,
      "grad_norm": 0.4182586163581185,
      "learning_rate": 3.876375645547543e-05,
      "loss": 1.3746,
      "num_input_tokens_seen": 28035623104,
      "step": 35634
    },
    {
      "epoch": 3.780500742626777,
      "grad_norm": 0.4718344620320349,
      "learning_rate": 3.8763176288781975e-05,
      "loss": 1.5068,
      "num_input_tokens_seen": 28036409840,
      "step": 35635
    },
    {
      "epoch": 3.7806068321663484,
      "grad_norm": 0.42973375165994165,
      "learning_rate": 3.876259611145275e-05,
      "loss": 1.4429,
      "num_input_tokens_seen": 28037196592,
      "step": 35636
    },
    {
      "epoch": 3.78071292170592,
      "grad_norm": 0.4810491234446286,
      "learning_rate": 3.876201592348819e-05,
      "loss": 1.3882,
      "num_input_tokens_seen": 28037983440,
      "step": 35637
    },
    {
      "epoch": 3.7808190112454914,
      "grad_norm": 0.4076321624932802,
      "learning_rate": 3.876143572488874e-05,
      "loss": 1.415,
      "num_input_tokens_seen": 28038770288,
      "step": 35638
    },
    {
      "epoch": 3.780925100785063,
      "grad_norm": 0.4662156478899353,
      "learning_rate": 3.876085551565487e-05,
      "loss": 1.4564,
      "num_input_tokens_seen": 28039557168,
      "step": 35639
    },
    {
      "epoch": 3.781031190324634,
      "grad_norm": 0.44154072912318904,
      "learning_rate": 3.876027529578701e-05,
      "loss": 1.4945,
      "num_input_tokens_seen": 28040343952,
      "step": 35640
    },
    {
      "epoch": 3.7811372798642053,
      "grad_norm": 0.3822486718262769,
      "learning_rate": 3.875969506528561e-05,
      "loss": 1.3084,
      "num_input_tokens_seen": 28041130736,
      "step": 35641
    },
    {
      "epoch": 3.781243369403777,
      "grad_norm": 0.4158086237506786,
      "learning_rate": 3.875911482415112e-05,
      "loss": 1.4152,
      "num_input_tokens_seen": 28041917536,
      "step": 35642
    },
    {
      "epoch": 3.7813494589433483,
      "grad_norm": 0.40370562793993015,
      "learning_rate": 3.8758534572383996e-05,
      "loss": 1.3355,
      "num_input_tokens_seen": 28042704400,
      "step": 35643
    },
    {
      "epoch": 3.7814555484829198,
      "grad_norm": 0.36517677578039737,
      "learning_rate": 3.875795430998468e-05,
      "loss": 1.3692,
      "num_input_tokens_seen": 28043491216,
      "step": 35644
    },
    {
      "epoch": 3.781561638022491,
      "grad_norm": 0.42690660420311566,
      "learning_rate": 3.875737403695361e-05,
      "loss": 1.4182,
      "num_input_tokens_seen": 28044277968,
      "step": 35645
    },
    {
      "epoch": 3.7816677275620623,
      "grad_norm": 0.45073739756657016,
      "learning_rate": 3.875679375329125e-05,
      "loss": 1.4112,
      "num_input_tokens_seen": 28045064752,
      "step": 35646
    },
    {
      "epoch": 3.7817738171016337,
      "grad_norm": 0.4300091158648047,
      "learning_rate": 3.8756213458998056e-05,
      "loss": 1.3839,
      "num_input_tokens_seen": 28045851584,
      "step": 35647
    },
    {
      "epoch": 3.781879906641205,
      "grad_norm": 0.4575938693596483,
      "learning_rate": 3.875563315407445e-05,
      "loss": 1.4825,
      "num_input_tokens_seen": 28046638304,
      "step": 35648
    },
    {
      "epoch": 3.7819859961807767,
      "grad_norm": 0.4536614689677158,
      "learning_rate": 3.87550528385209e-05,
      "loss": 1.4818,
      "num_input_tokens_seen": 28047425008,
      "step": 35649
    },
    {
      "epoch": 3.7820920857203477,
      "grad_norm": 0.40899177477527465,
      "learning_rate": 3.8754472512337846e-05,
      "loss": 1.4393,
      "num_input_tokens_seen": 28048211792,
      "step": 35650
    },
    {
      "epoch": 3.7821981752599196,
      "grad_norm": 0.43238190869712567,
      "learning_rate": 3.875389217552574e-05,
      "loss": 1.4564,
      "num_input_tokens_seen": 28048998528,
      "step": 35651
    },
    {
      "epoch": 3.7823042647994907,
      "grad_norm": 0.4551462774173442,
      "learning_rate": 3.875331182808503e-05,
      "loss": 1.5208,
      "num_input_tokens_seen": 28049785296,
      "step": 35652
    },
    {
      "epoch": 3.782410354339062,
      "grad_norm": 0.41325980642806887,
      "learning_rate": 3.875273147001617e-05,
      "loss": 1.4768,
      "num_input_tokens_seen": 28050571968,
      "step": 35653
    },
    {
      "epoch": 3.7825164438786336,
      "grad_norm": 0.49168162416065,
      "learning_rate": 3.875215110131959e-05,
      "loss": 1.5702,
      "num_input_tokens_seen": 28051358704,
      "step": 35654
    },
    {
      "epoch": 3.782622533418205,
      "grad_norm": 0.3825878112819858,
      "learning_rate": 3.8751570721995754e-05,
      "loss": 1.3347,
      "num_input_tokens_seen": 28052145552,
      "step": 35655
    },
    {
      "epoch": 3.7827286229577766,
      "grad_norm": 0.4099411249830747,
      "learning_rate": 3.875099033204511e-05,
      "loss": 1.3954,
      "num_input_tokens_seen": 28052932304,
      "step": 35656
    },
    {
      "epoch": 3.7828347124973476,
      "grad_norm": 0.398387859564602,
      "learning_rate": 3.8750409931468104e-05,
      "loss": 1.3891,
      "num_input_tokens_seen": 28053719088,
      "step": 35657
    },
    {
      "epoch": 3.782940802036919,
      "grad_norm": 0.49196843247341066,
      "learning_rate": 3.874982952026519e-05,
      "loss": 1.5084,
      "num_input_tokens_seen": 28054505888,
      "step": 35658
    },
    {
      "epoch": 3.7830468915764905,
      "grad_norm": 0.4355877357810921,
      "learning_rate": 3.874924909843681e-05,
      "loss": 1.4348,
      "num_input_tokens_seen": 28055292672,
      "step": 35659
    },
    {
      "epoch": 3.783152981116062,
      "grad_norm": 0.4232788112250465,
      "learning_rate": 3.8748668665983405e-05,
      "loss": 1.4716,
      "num_input_tokens_seen": 28056079408,
      "step": 35660
    },
    {
      "epoch": 3.7832590706556335,
      "grad_norm": 0.41410919240833755,
      "learning_rate": 3.8748088222905444e-05,
      "loss": 1.3624,
      "num_input_tokens_seen": 28056866144,
      "step": 35661
    },
    {
      "epoch": 3.7833651601952045,
      "grad_norm": 0.4326526486803883,
      "learning_rate": 3.874750776920336e-05,
      "loss": 1.5468,
      "num_input_tokens_seen": 28057652912,
      "step": 35662
    },
    {
      "epoch": 3.783471249734776,
      "grad_norm": 0.3732305897508889,
      "learning_rate": 3.87469273048776e-05,
      "loss": 1.3606,
      "num_input_tokens_seen": 28058439824,
      "step": 35663
    },
    {
      "epoch": 3.7835773392743475,
      "grad_norm": 0.5185703627391027,
      "learning_rate": 3.874634682992862e-05,
      "loss": 1.4913,
      "num_input_tokens_seen": 28059226544,
      "step": 35664
    },
    {
      "epoch": 3.783683428813919,
      "grad_norm": 0.4058285356447537,
      "learning_rate": 3.874576634435687e-05,
      "loss": 1.4879,
      "num_input_tokens_seen": 28060013248,
      "step": 35665
    },
    {
      "epoch": 3.7837895183534904,
      "grad_norm": 0.43272537939055933,
      "learning_rate": 3.874518584816279e-05,
      "loss": 1.3744,
      "num_input_tokens_seen": 28060800016,
      "step": 35666
    },
    {
      "epoch": 3.783895607893062,
      "grad_norm": 0.4955552411479371,
      "learning_rate": 3.874460534134684e-05,
      "loss": 1.6301,
      "num_input_tokens_seen": 28061586752,
      "step": 35667
    },
    {
      "epoch": 3.7840016974326334,
      "grad_norm": 0.5415269922190584,
      "learning_rate": 3.8744024823909455e-05,
      "loss": 1.5734,
      "num_input_tokens_seen": 28062373520,
      "step": 35668
    },
    {
      "epoch": 3.7841077869722044,
      "grad_norm": 0.4263702460475958,
      "learning_rate": 3.874344429585109e-05,
      "loss": 1.3751,
      "num_input_tokens_seen": 28063160304,
      "step": 35669
    },
    {
      "epoch": 3.784213876511776,
      "grad_norm": 0.45127789492821924,
      "learning_rate": 3.874286375717221e-05,
      "loss": 1.5104,
      "num_input_tokens_seen": 28063947040,
      "step": 35670
    },
    {
      "epoch": 3.7843199660513474,
      "grad_norm": 0.46256320565694425,
      "learning_rate": 3.874228320787323e-05,
      "loss": 1.4199,
      "num_input_tokens_seen": 28064733824,
      "step": 35671
    },
    {
      "epoch": 3.784426055590919,
      "grad_norm": 0.49677809954319924,
      "learning_rate": 3.874170264795463e-05,
      "loss": 1.542,
      "num_input_tokens_seen": 28065520640,
      "step": 35672
    },
    {
      "epoch": 3.7845321451304903,
      "grad_norm": 0.47228082383017,
      "learning_rate": 3.8741122077416834e-05,
      "loss": 1.5162,
      "num_input_tokens_seen": 28066307392,
      "step": 35673
    },
    {
      "epoch": 3.7846382346700613,
      "grad_norm": 0.5429529392029255,
      "learning_rate": 3.874054149626031e-05,
      "loss": 1.4009,
      "num_input_tokens_seen": 28067094176,
      "step": 35674
    },
    {
      "epoch": 3.784744324209633,
      "grad_norm": 0.46942653480967583,
      "learning_rate": 3.87399609044855e-05,
      "loss": 1.4025,
      "num_input_tokens_seen": 28067880960,
      "step": 35675
    },
    {
      "epoch": 3.7848504137492043,
      "grad_norm": 0.47326982018213026,
      "learning_rate": 3.8739380302092846e-05,
      "loss": 1.5095,
      "num_input_tokens_seen": 28068667744,
      "step": 35676
    },
    {
      "epoch": 3.7849565032887758,
      "grad_norm": 0.45006058781259595,
      "learning_rate": 3.8738799689082803e-05,
      "loss": 1.5153,
      "num_input_tokens_seen": 28069454512,
      "step": 35677
    },
    {
      "epoch": 3.7850625928283472,
      "grad_norm": 0.5142828163476667,
      "learning_rate": 3.873821906545582e-05,
      "loss": 1.4933,
      "num_input_tokens_seen": 28070241184,
      "step": 35678
    },
    {
      "epoch": 3.7851686823679183,
      "grad_norm": 0.3830550365797306,
      "learning_rate": 3.873763843121235e-05,
      "loss": 1.5242,
      "num_input_tokens_seen": 28071027920,
      "step": 35679
    },
    {
      "epoch": 3.78527477190749,
      "grad_norm": 0.42215078079620727,
      "learning_rate": 3.873705778635282e-05,
      "loss": 1.3678,
      "num_input_tokens_seen": 28071814720,
      "step": 35680
    },
    {
      "epoch": 3.785380861447061,
      "grad_norm": 0.4805790324349204,
      "learning_rate": 3.873647713087771e-05,
      "loss": 1.493,
      "num_input_tokens_seen": 28072601392,
      "step": 35681
    },
    {
      "epoch": 3.7854869509866327,
      "grad_norm": 0.44100353166382406,
      "learning_rate": 3.8735896464787455e-05,
      "loss": 1.4834,
      "num_input_tokens_seen": 28073388192,
      "step": 35682
    },
    {
      "epoch": 3.785593040526204,
      "grad_norm": 0.5285509945150246,
      "learning_rate": 3.873531578808249e-05,
      "loss": 1.5476,
      "num_input_tokens_seen": 28074174976,
      "step": 35683
    },
    {
      "epoch": 3.7856991300657756,
      "grad_norm": 0.5112908783105276,
      "learning_rate": 3.8734735100763286e-05,
      "loss": 1.5226,
      "num_input_tokens_seen": 28074961744,
      "step": 35684
    },
    {
      "epoch": 3.785805219605347,
      "grad_norm": 0.47158027925402546,
      "learning_rate": 3.873415440283027e-05,
      "loss": 1.4535,
      "num_input_tokens_seen": 28075748624,
      "step": 35685
    },
    {
      "epoch": 3.785911309144918,
      "grad_norm": 0.4967666431187055,
      "learning_rate": 3.8733573694283915e-05,
      "loss": 1.564,
      "num_input_tokens_seen": 28076535296,
      "step": 35686
    },
    {
      "epoch": 3.7860173986844896,
      "grad_norm": 0.45531363511005346,
      "learning_rate": 3.873299297512465e-05,
      "loss": 1.4464,
      "num_input_tokens_seen": 28077322176,
      "step": 35687
    },
    {
      "epoch": 3.786123488224061,
      "grad_norm": 0.622516293864356,
      "learning_rate": 3.8732412245352934e-05,
      "loss": 1.4733,
      "num_input_tokens_seen": 28078108960,
      "step": 35688
    },
    {
      "epoch": 3.7862295777636326,
      "grad_norm": 0.427805385342459,
      "learning_rate": 3.8731831504969214e-05,
      "loss": 1.5443,
      "num_input_tokens_seen": 28078895712,
      "step": 35689
    },
    {
      "epoch": 3.786335667303204,
      "grad_norm": 0.4932463200294694,
      "learning_rate": 3.873125075397393e-05,
      "loss": 1.4766,
      "num_input_tokens_seen": 28079682480,
      "step": 35690
    },
    {
      "epoch": 3.786441756842775,
      "grad_norm": 0.41512329478132176,
      "learning_rate": 3.8730669992367545e-05,
      "loss": 1.3632,
      "num_input_tokens_seen": 28080469264,
      "step": 35691
    },
    {
      "epoch": 3.7865478463823465,
      "grad_norm": 0.4878743130885238,
      "learning_rate": 3.87300892201505e-05,
      "loss": 1.5132,
      "num_input_tokens_seen": 28081255936,
      "step": 35692
    },
    {
      "epoch": 3.786653935921918,
      "grad_norm": 0.46575545181763,
      "learning_rate": 3.872950843732325e-05,
      "loss": 1.4468,
      "num_input_tokens_seen": 28082042672,
      "step": 35693
    },
    {
      "epoch": 3.7867600254614895,
      "grad_norm": 0.42696434938904504,
      "learning_rate": 3.872892764388623e-05,
      "loss": 1.416,
      "num_input_tokens_seen": 28082829408,
      "step": 35694
    },
    {
      "epoch": 3.786866115001061,
      "grad_norm": 0.41027133541905403,
      "learning_rate": 3.87283468398399e-05,
      "loss": 1.4434,
      "num_input_tokens_seen": 28083616224,
      "step": 35695
    },
    {
      "epoch": 3.7869722045406324,
      "grad_norm": 0.41430234423960866,
      "learning_rate": 3.872776602518471e-05,
      "loss": 1.4442,
      "num_input_tokens_seen": 28084403056,
      "step": 35696
    },
    {
      "epoch": 3.787078294080204,
      "grad_norm": 0.6225153447007346,
      "learning_rate": 3.8727185199921104e-05,
      "loss": 1.438,
      "num_input_tokens_seen": 28085189792,
      "step": 35697
    },
    {
      "epoch": 3.787184383619775,
      "grad_norm": 0.5211212799736955,
      "learning_rate": 3.872660436404953e-05,
      "loss": 1.3664,
      "num_input_tokens_seen": 28085976496,
      "step": 35698
    },
    {
      "epoch": 3.7872904731593464,
      "grad_norm": 0.46837742891139805,
      "learning_rate": 3.872602351757044e-05,
      "loss": 1.4358,
      "num_input_tokens_seen": 28086763136,
      "step": 35699
    },
    {
      "epoch": 3.787396562698918,
      "grad_norm": 0.5109557449303274,
      "learning_rate": 3.8725442660484276e-05,
      "loss": 1.5003,
      "num_input_tokens_seen": 28087549872,
      "step": 35700
    },
    {
      "epoch": 3.7875026522384894,
      "grad_norm": 0.45525014852287193,
      "learning_rate": 3.87248617927915e-05,
      "loss": 1.4188,
      "num_input_tokens_seen": 28088336624,
      "step": 35701
    },
    {
      "epoch": 3.787608741778061,
      "grad_norm": 0.4358818081658172,
      "learning_rate": 3.872428091449255e-05,
      "loss": 1.4834,
      "num_input_tokens_seen": 28089123344,
      "step": 35702
    },
    {
      "epoch": 3.787714831317632,
      "grad_norm": 0.4833522920929279,
      "learning_rate": 3.872370002558788e-05,
      "loss": 1.4034,
      "num_input_tokens_seen": 28089910096,
      "step": 35703
    },
    {
      "epoch": 3.7878209208572033,
      "grad_norm": 0.43317373090346095,
      "learning_rate": 3.8723119126077934e-05,
      "loss": 1.5218,
      "num_input_tokens_seen": 28090696848,
      "step": 35704
    },
    {
      "epoch": 3.787927010396775,
      "grad_norm": 0.5515805254039534,
      "learning_rate": 3.8722538215963164e-05,
      "loss": 1.4762,
      "num_input_tokens_seen": 28091483680,
      "step": 35705
    },
    {
      "epoch": 3.7880330999363463,
      "grad_norm": 0.4597682503980101,
      "learning_rate": 3.872195729524403e-05,
      "loss": 1.5386,
      "num_input_tokens_seen": 28092270416,
      "step": 35706
    },
    {
      "epoch": 3.7881391894759178,
      "grad_norm": 0.4657147027574636,
      "learning_rate": 3.8721376363920956e-05,
      "loss": 1.4522,
      "num_input_tokens_seen": 28093057232,
      "step": 35707
    },
    {
      "epoch": 3.788245279015489,
      "grad_norm": 0.5807482405211701,
      "learning_rate": 3.872079542199441e-05,
      "loss": 1.4545,
      "num_input_tokens_seen": 28093844016,
      "step": 35708
    },
    {
      "epoch": 3.7883513685550607,
      "grad_norm": 0.41819740733784044,
      "learning_rate": 3.872021446946485e-05,
      "loss": 1.4035,
      "num_input_tokens_seen": 28094630832,
      "step": 35709
    },
    {
      "epoch": 3.7884574580946317,
      "grad_norm": 0.5046162174283326,
      "learning_rate": 3.871963350633269e-05,
      "loss": 1.4988,
      "num_input_tokens_seen": 28095417664,
      "step": 35710
    },
    {
      "epoch": 3.788563547634203,
      "grad_norm": 0.5063324121401562,
      "learning_rate": 3.871905253259841e-05,
      "loss": 1.3632,
      "num_input_tokens_seen": 28096204496,
      "step": 35711
    },
    {
      "epoch": 3.7886696371737747,
      "grad_norm": 0.42006653191615545,
      "learning_rate": 3.8718471548262444e-05,
      "loss": 1.4399,
      "num_input_tokens_seen": 28096991216,
      "step": 35712
    },
    {
      "epoch": 3.788775726713346,
      "grad_norm": 0.5331965326581459,
      "learning_rate": 3.871789055332525e-05,
      "loss": 1.5355,
      "num_input_tokens_seen": 28097777952,
      "step": 35713
    },
    {
      "epoch": 3.7888818162529176,
      "grad_norm": 0.49657539646000937,
      "learning_rate": 3.871730954778727e-05,
      "loss": 1.5228,
      "num_input_tokens_seen": 28098564688,
      "step": 35714
    },
    {
      "epoch": 3.7889879057924887,
      "grad_norm": 0.4573356565194999,
      "learning_rate": 3.871672853164896e-05,
      "loss": 1.5646,
      "num_input_tokens_seen": 28099351424,
      "step": 35715
    },
    {
      "epoch": 3.78909399533206,
      "grad_norm": 0.4789697465001162,
      "learning_rate": 3.871614750491076e-05,
      "loss": 1.5736,
      "num_input_tokens_seen": 28100138272,
      "step": 35716
    },
    {
      "epoch": 3.7892000848716316,
      "grad_norm": 0.5143078047361782,
      "learning_rate": 3.871556646757313e-05,
      "loss": 1.5094,
      "num_input_tokens_seen": 28100925024,
      "step": 35717
    },
    {
      "epoch": 3.789306174411203,
      "grad_norm": 0.42951186527938673,
      "learning_rate": 3.8714985419636504e-05,
      "loss": 1.3799,
      "num_input_tokens_seen": 28101711792,
      "step": 35718
    },
    {
      "epoch": 3.7894122639507746,
      "grad_norm": 0.4453115525031398,
      "learning_rate": 3.871440436110134e-05,
      "loss": 1.3767,
      "num_input_tokens_seen": 28102498624,
      "step": 35719
    },
    {
      "epoch": 3.7895183534903456,
      "grad_norm": 0.45301538054000723,
      "learning_rate": 3.8713823291968094e-05,
      "loss": 1.438,
      "num_input_tokens_seen": 28103285344,
      "step": 35720
    },
    {
      "epoch": 3.7896244430299175,
      "grad_norm": 0.46565386421464644,
      "learning_rate": 3.87132422122372e-05,
      "loss": 1.4881,
      "num_input_tokens_seen": 28104072080,
      "step": 35721
    },
    {
      "epoch": 3.7897305325694886,
      "grad_norm": 0.4780765782999352,
      "learning_rate": 3.871266112190912e-05,
      "loss": 1.4617,
      "num_input_tokens_seen": 28104858944,
      "step": 35722
    },
    {
      "epoch": 3.78983662210906,
      "grad_norm": 0.44579982817209357,
      "learning_rate": 3.8712080020984296e-05,
      "loss": 1.4395,
      "num_input_tokens_seen": 28105645648,
      "step": 35723
    },
    {
      "epoch": 3.7899427116486315,
      "grad_norm": 0.4903709314585387,
      "learning_rate": 3.8711498909463183e-05,
      "loss": 1.4167,
      "num_input_tokens_seen": 28106432416,
      "step": 35724
    },
    {
      "epoch": 3.790048801188203,
      "grad_norm": 0.4773775496461828,
      "learning_rate": 3.8710917787346224e-05,
      "loss": 1.4793,
      "num_input_tokens_seen": 28107219104,
      "step": 35725
    },
    {
      "epoch": 3.7901548907277745,
      "grad_norm": 0.4146967537542071,
      "learning_rate": 3.8710336654633865e-05,
      "loss": 1.424,
      "num_input_tokens_seen": 28108005888,
      "step": 35726
    },
    {
      "epoch": 3.7902609802673455,
      "grad_norm": 0.4705159260756553,
      "learning_rate": 3.870975551132656e-05,
      "loss": 1.4774,
      "num_input_tokens_seen": 28108792688,
      "step": 35727
    },
    {
      "epoch": 3.790367069806917,
      "grad_norm": 0.41920337905089866,
      "learning_rate": 3.8709174357424764e-05,
      "loss": 1.4588,
      "num_input_tokens_seen": 28109579408,
      "step": 35728
    },
    {
      "epoch": 3.7904731593464884,
      "grad_norm": 0.45161582835291547,
      "learning_rate": 3.870859319292892e-05,
      "loss": 1.4704,
      "num_input_tokens_seen": 28110366176,
      "step": 35729
    },
    {
      "epoch": 3.79057924888606,
      "grad_norm": 0.4634416894941981,
      "learning_rate": 3.870801201783948e-05,
      "loss": 1.3895,
      "num_input_tokens_seen": 28111152960,
      "step": 35730
    },
    {
      "epoch": 3.7906853384256314,
      "grad_norm": 0.4251724449994624,
      "learning_rate": 3.8707430832156884e-05,
      "loss": 1.3875,
      "num_input_tokens_seen": 28111939568,
      "step": 35731
    },
    {
      "epoch": 3.7907914279652024,
      "grad_norm": 0.5182335287747978,
      "learning_rate": 3.8706849635881593e-05,
      "loss": 1.5327,
      "num_input_tokens_seen": 28112726240,
      "step": 35732
    },
    {
      "epoch": 3.790897517504774,
      "grad_norm": 0.46326489422664197,
      "learning_rate": 3.870626842901404e-05,
      "loss": 1.4989,
      "num_input_tokens_seen": 28113513056,
      "step": 35733
    },
    {
      "epoch": 3.7910036070443454,
      "grad_norm": 0.48557875047282795,
      "learning_rate": 3.87056872115547e-05,
      "loss": 1.4402,
      "num_input_tokens_seen": 28114299808,
      "step": 35734
    },
    {
      "epoch": 3.791109696583917,
      "grad_norm": 0.4671234260418377,
      "learning_rate": 3.8705105983504e-05,
      "loss": 1.4748,
      "num_input_tokens_seen": 28115086592,
      "step": 35735
    },
    {
      "epoch": 3.7912157861234883,
      "grad_norm": 0.50023384224208,
      "learning_rate": 3.870452474486239e-05,
      "loss": 1.337,
      "num_input_tokens_seen": 28115873408,
      "step": 35736
    },
    {
      "epoch": 3.79132187566306,
      "grad_norm": 0.5427977260919697,
      "learning_rate": 3.8703943495630336e-05,
      "loss": 1.5293,
      "num_input_tokens_seen": 28116660192,
      "step": 35737
    },
    {
      "epoch": 3.7914279652026313,
      "grad_norm": 0.5169064151923385,
      "learning_rate": 3.870336223580827e-05,
      "loss": 1.5216,
      "num_input_tokens_seen": 28117446880,
      "step": 35738
    },
    {
      "epoch": 3.7915340547422023,
      "grad_norm": 0.45568841394999665,
      "learning_rate": 3.8702780965396644e-05,
      "loss": 1.4273,
      "num_input_tokens_seen": 28118233648,
      "step": 35739
    },
    {
      "epoch": 3.7916401442817738,
      "grad_norm": 0.4162472952798797,
      "learning_rate": 3.870219968439592e-05,
      "loss": 1.431,
      "num_input_tokens_seen": 28119020432,
      "step": 35740
    },
    {
      "epoch": 3.7917462338213452,
      "grad_norm": 0.48807296498081215,
      "learning_rate": 3.870161839280653e-05,
      "loss": 1.4542,
      "num_input_tokens_seen": 28119807232,
      "step": 35741
    },
    {
      "epoch": 3.7918523233609167,
      "grad_norm": 0.46326243709444537,
      "learning_rate": 3.870103709062894e-05,
      "loss": 1.4683,
      "num_input_tokens_seen": 28120593936,
      "step": 35742
    },
    {
      "epoch": 3.791958412900488,
      "grad_norm": 0.41568481180788275,
      "learning_rate": 3.870045577786359e-05,
      "loss": 1.3881,
      "num_input_tokens_seen": 28121380720,
      "step": 35743
    },
    {
      "epoch": 3.792064502440059,
      "grad_norm": 0.4873579569064254,
      "learning_rate": 3.869987445451092e-05,
      "loss": 1.4613,
      "num_input_tokens_seen": 28122167440,
      "step": 35744
    },
    {
      "epoch": 3.7921705919796307,
      "grad_norm": 0.4063534151975358,
      "learning_rate": 3.86992931205714e-05,
      "loss": 1.3615,
      "num_input_tokens_seen": 28122954240,
      "step": 35745
    },
    {
      "epoch": 3.792276681519202,
      "grad_norm": 0.390943251533631,
      "learning_rate": 3.869871177604546e-05,
      "loss": 1.4079,
      "num_input_tokens_seen": 28123740912,
      "step": 35746
    },
    {
      "epoch": 3.7923827710587736,
      "grad_norm": 0.41207220862343963,
      "learning_rate": 3.869813042093356e-05,
      "loss": 1.4043,
      "num_input_tokens_seen": 28124527728,
      "step": 35747
    },
    {
      "epoch": 3.792488860598345,
      "grad_norm": 0.44255852299039494,
      "learning_rate": 3.869754905523615e-05,
      "loss": 1.5179,
      "num_input_tokens_seen": 28125314528,
      "step": 35748
    },
    {
      "epoch": 3.792594950137916,
      "grad_norm": 0.40469530882142163,
      "learning_rate": 3.8696967678953674e-05,
      "loss": 1.5362,
      "num_input_tokens_seen": 28126101280,
      "step": 35749
    },
    {
      "epoch": 3.792701039677488,
      "grad_norm": 0.42928048294137516,
      "learning_rate": 3.8696386292086585e-05,
      "loss": 1.4692,
      "num_input_tokens_seen": 28126888048,
      "step": 35750
    },
    {
      "epoch": 3.792807129217059,
      "grad_norm": 0.4624510426870017,
      "learning_rate": 3.8695804894635325e-05,
      "loss": 1.484,
      "num_input_tokens_seen": 28127674784,
      "step": 35751
    },
    {
      "epoch": 3.7929132187566306,
      "grad_norm": 0.38232942828350763,
      "learning_rate": 3.8695223486600355e-05,
      "loss": 1.3663,
      "num_input_tokens_seen": 28128461568,
      "step": 35752
    },
    {
      "epoch": 3.793019308296202,
      "grad_norm": 0.4601903158057079,
      "learning_rate": 3.8694642067982114e-05,
      "loss": 1.4727,
      "num_input_tokens_seen": 28129248304,
      "step": 35753
    },
    {
      "epoch": 3.7931253978357735,
      "grad_norm": 0.48741645944939965,
      "learning_rate": 3.869406063878106e-05,
      "loss": 1.5714,
      "num_input_tokens_seen": 28130035024,
      "step": 35754
    },
    {
      "epoch": 3.793231487375345,
      "grad_norm": 0.4612077353078979,
      "learning_rate": 3.869347919899763e-05,
      "loss": 1.5109,
      "num_input_tokens_seen": 28130821760,
      "step": 35755
    },
    {
      "epoch": 3.793337576914916,
      "grad_norm": 0.4039577118897519,
      "learning_rate": 3.8692897748632285e-05,
      "loss": 1.4614,
      "num_input_tokens_seen": 28131608560,
      "step": 35756
    },
    {
      "epoch": 3.7934436664544875,
      "grad_norm": 0.423471382569848,
      "learning_rate": 3.869231628768547e-05,
      "loss": 1.3634,
      "num_input_tokens_seen": 28132395344,
      "step": 35757
    },
    {
      "epoch": 3.793549755994059,
      "grad_norm": 0.49962343349459587,
      "learning_rate": 3.8691734816157635e-05,
      "loss": 1.5034,
      "num_input_tokens_seen": 28133182144,
      "step": 35758
    },
    {
      "epoch": 3.7936558455336304,
      "grad_norm": 0.4364214535614549,
      "learning_rate": 3.8691153334049226e-05,
      "loss": 1.5183,
      "num_input_tokens_seen": 28133968928,
      "step": 35759
    },
    {
      "epoch": 3.793761935073202,
      "grad_norm": 0.4524385286014582,
      "learning_rate": 3.86905718413607e-05,
      "loss": 1.4407,
      "num_input_tokens_seen": 28134755696,
      "step": 35760
    },
    {
      "epoch": 3.793868024612773,
      "grad_norm": 0.46535336370995883,
      "learning_rate": 3.8689990338092506e-05,
      "loss": 1.447,
      "num_input_tokens_seen": 28135542352,
      "step": 35761
    },
    {
      "epoch": 3.7939741141523444,
      "grad_norm": 0.42661535604459233,
      "learning_rate": 3.868940882424508e-05,
      "loss": 1.4583,
      "num_input_tokens_seen": 28136329168,
      "step": 35762
    },
    {
      "epoch": 3.794080203691916,
      "grad_norm": 0.44866307052257864,
      "learning_rate": 3.868882729981889e-05,
      "loss": 1.5461,
      "num_input_tokens_seen": 28137115920,
      "step": 35763
    },
    {
      "epoch": 3.7941862932314874,
      "grad_norm": 0.4626266002648326,
      "learning_rate": 3.868824576481437e-05,
      "loss": 1.3135,
      "num_input_tokens_seen": 28137902736,
      "step": 35764
    },
    {
      "epoch": 3.794292382771059,
      "grad_norm": 0.45156091836095497,
      "learning_rate": 3.8687664219231975e-05,
      "loss": 1.3511,
      "num_input_tokens_seen": 28138689424,
      "step": 35765
    },
    {
      "epoch": 3.7943984723106303,
      "grad_norm": 0.43957314213052723,
      "learning_rate": 3.868708266307216e-05,
      "loss": 1.4357,
      "num_input_tokens_seen": 28139476144,
      "step": 35766
    },
    {
      "epoch": 3.794504561850202,
      "grad_norm": 0.4644360603561273,
      "learning_rate": 3.868650109633536e-05,
      "loss": 1.4192,
      "num_input_tokens_seen": 28140262912,
      "step": 35767
    },
    {
      "epoch": 3.794610651389773,
      "grad_norm": 0.47433993642873445,
      "learning_rate": 3.868591951902204e-05,
      "loss": 1.5111,
      "num_input_tokens_seen": 28141049616,
      "step": 35768
    },
    {
      "epoch": 3.7947167409293443,
      "grad_norm": 0.44637469722220996,
      "learning_rate": 3.8685337931132634e-05,
      "loss": 1.5655,
      "num_input_tokens_seen": 28141836288,
      "step": 35769
    },
    {
      "epoch": 3.7948228304689158,
      "grad_norm": 0.4360484609127941,
      "learning_rate": 3.8684756332667615e-05,
      "loss": 1.4711,
      "num_input_tokens_seen": 28142622944,
      "step": 35770
    },
    {
      "epoch": 3.7949289200084872,
      "grad_norm": 0.4546542946893912,
      "learning_rate": 3.868417472362741e-05,
      "loss": 1.5634,
      "num_input_tokens_seen": 28143409744,
      "step": 35771
    },
    {
      "epoch": 3.7950350095480587,
      "grad_norm": 0.46487335591905815,
      "learning_rate": 3.868359310401247e-05,
      "loss": 1.5661,
      "num_input_tokens_seen": 28144196560,
      "step": 35772
    },
    {
      "epoch": 3.7951410990876298,
      "grad_norm": 0.5440080028028864,
      "learning_rate": 3.8683011473823264e-05,
      "loss": 1.5478,
      "num_input_tokens_seen": 28144983264,
      "step": 35773
    },
    {
      "epoch": 3.7952471886272012,
      "grad_norm": 0.44246041222179766,
      "learning_rate": 3.868242983306022e-05,
      "loss": 1.4539,
      "num_input_tokens_seen": 28145770016,
      "step": 35774
    },
    {
      "epoch": 3.7953532781667727,
      "grad_norm": 0.665326209889278,
      "learning_rate": 3.86818481817238e-05,
      "loss": 1.5382,
      "num_input_tokens_seen": 28146556688,
      "step": 35775
    },
    {
      "epoch": 3.795459367706344,
      "grad_norm": 0.43624863272801156,
      "learning_rate": 3.868126651981444e-05,
      "loss": 1.4959,
      "num_input_tokens_seen": 28147343440,
      "step": 35776
    },
    {
      "epoch": 3.7955654572459157,
      "grad_norm": 0.6393051078530458,
      "learning_rate": 3.868068484733261e-05,
      "loss": 1.4884,
      "num_input_tokens_seen": 28148130208,
      "step": 35777
    },
    {
      "epoch": 3.7956715467854867,
      "grad_norm": 0.47195080025620456,
      "learning_rate": 3.8680103164278744e-05,
      "loss": 1.5192,
      "num_input_tokens_seen": 28148916976,
      "step": 35778
    },
    {
      "epoch": 3.7957776363250586,
      "grad_norm": 0.4684790233757895,
      "learning_rate": 3.867952147065329e-05,
      "loss": 1.4185,
      "num_input_tokens_seen": 28149703664,
      "step": 35779
    },
    {
      "epoch": 3.7958837258646296,
      "grad_norm": 0.600476387818481,
      "learning_rate": 3.8678939766456715e-05,
      "loss": 1.5973,
      "num_input_tokens_seen": 28150490416,
      "step": 35780
    },
    {
      "epoch": 3.795989815404201,
      "grad_norm": 0.5957950757955844,
      "learning_rate": 3.8678358051689444e-05,
      "loss": 1.5609,
      "num_input_tokens_seen": 28151277072,
      "step": 35781
    },
    {
      "epoch": 3.7960959049437726,
      "grad_norm": 0.4778218990096664,
      "learning_rate": 3.867777632635195e-05,
      "loss": 1.4724,
      "num_input_tokens_seen": 28152063824,
      "step": 35782
    },
    {
      "epoch": 3.796201994483344,
      "grad_norm": 0.524989844045187,
      "learning_rate": 3.8677194590444665e-05,
      "loss": 1.4695,
      "num_input_tokens_seen": 28152850608,
      "step": 35783
    },
    {
      "epoch": 3.7963080840229155,
      "grad_norm": 0.5898814419455363,
      "learning_rate": 3.867661284396805e-05,
      "loss": 1.5742,
      "num_input_tokens_seen": 28153637328,
      "step": 35784
    },
    {
      "epoch": 3.7964141735624866,
      "grad_norm": 0.48484249122004464,
      "learning_rate": 3.867603108692255e-05,
      "loss": 1.4596,
      "num_input_tokens_seen": 28154424160,
      "step": 35785
    },
    {
      "epoch": 3.796520263102058,
      "grad_norm": 0.6054892092865413,
      "learning_rate": 3.867544931930861e-05,
      "loss": 1.4414,
      "num_input_tokens_seen": 28155211008,
      "step": 35786
    },
    {
      "epoch": 3.7966263526416295,
      "grad_norm": 0.43451975503354107,
      "learning_rate": 3.867486754112668e-05,
      "loss": 1.444,
      "num_input_tokens_seen": 28155997728,
      "step": 35787
    },
    {
      "epoch": 3.796732442181201,
      "grad_norm": 0.6583613512936637,
      "learning_rate": 3.867428575237722e-05,
      "loss": 1.4179,
      "num_input_tokens_seen": 28156784464,
      "step": 35788
    },
    {
      "epoch": 3.7968385317207725,
      "grad_norm": 0.47516390343940446,
      "learning_rate": 3.867370395306068e-05,
      "loss": 1.4486,
      "num_input_tokens_seen": 28157571216,
      "step": 35789
    },
    {
      "epoch": 3.7969446212603435,
      "grad_norm": 0.5707540026318915,
      "learning_rate": 3.867312214317749e-05,
      "loss": 1.5503,
      "num_input_tokens_seen": 28158357952,
      "step": 35790
    },
    {
      "epoch": 3.797050710799915,
      "grad_norm": 0.7717556809208882,
      "learning_rate": 3.867254032272812e-05,
      "loss": 1.4914,
      "num_input_tokens_seen": 28159144672,
      "step": 35791
    },
    {
      "epoch": 3.7971568003394864,
      "grad_norm": 0.4039648338914558,
      "learning_rate": 3.867195849171301e-05,
      "loss": 1.3543,
      "num_input_tokens_seen": 28159931488,
      "step": 35792
    },
    {
      "epoch": 3.797262889879058,
      "grad_norm": 0.5406084324445625,
      "learning_rate": 3.867137665013261e-05,
      "loss": 1.4283,
      "num_input_tokens_seen": 28160718400,
      "step": 35793
    },
    {
      "epoch": 3.7973689794186294,
      "grad_norm": 0.6937319709995134,
      "learning_rate": 3.8670794797987374e-05,
      "loss": 1.6011,
      "num_input_tokens_seen": 28161505072,
      "step": 35794
    },
    {
      "epoch": 3.797475068958201,
      "grad_norm": 2.0682316836371983,
      "learning_rate": 3.867021293527775e-05,
      "loss": 1.4175,
      "num_input_tokens_seen": 28162291776,
      "step": 35795
    },
    {
      "epoch": 3.7975811584977723,
      "grad_norm": 0.7111844573968258,
      "learning_rate": 3.866963106200418e-05,
      "loss": 1.4053,
      "num_input_tokens_seen": 28163078640,
      "step": 35796
    },
    {
      "epoch": 3.7976872480373434,
      "grad_norm": 1.7143623412155187,
      "learning_rate": 3.8669049178167125e-05,
      "loss": 1.562,
      "num_input_tokens_seen": 28163865344,
      "step": 35797
    },
    {
      "epoch": 3.797793337576915,
      "grad_norm": 0.5415327366056407,
      "learning_rate": 3.866846728376703e-05,
      "loss": 1.3029,
      "num_input_tokens_seen": 28164652128,
      "step": 35798
    },
    {
      "epoch": 3.7978994271164863,
      "grad_norm": 1.511102458228567,
      "learning_rate": 3.866788537880434e-05,
      "loss": 1.5814,
      "num_input_tokens_seen": 28165438832,
      "step": 35799
    },
    {
      "epoch": 3.798005516656058,
      "grad_norm": 0.5764250182293725,
      "learning_rate": 3.866730346327952e-05,
      "loss": 1.4706,
      "num_input_tokens_seen": 28166225568,
      "step": 35800
    },
    {
      "epoch": 3.7981116061956293,
      "grad_norm": 0.7043218102859078,
      "learning_rate": 3.8666721537192996e-05,
      "loss": 1.5148,
      "num_input_tokens_seen": 28167012336,
      "step": 35801
    },
    {
      "epoch": 3.7982176957352003,
      "grad_norm": 0.5784144066975142,
      "learning_rate": 3.8666139600545234e-05,
      "loss": 1.446,
      "num_input_tokens_seen": 28167799072,
      "step": 35802
    },
    {
      "epoch": 3.7983237852747718,
      "grad_norm": 0.4950723958716408,
      "learning_rate": 3.866555765333668e-05,
      "loss": 1.4967,
      "num_input_tokens_seen": 28168585856,
      "step": 35803
    },
    {
      "epoch": 3.7984298748143432,
      "grad_norm": 0.45836907685742834,
      "learning_rate": 3.86649756955678e-05,
      "loss": 1.3474,
      "num_input_tokens_seen": 28169372688,
      "step": 35804
    },
    {
      "epoch": 3.7985359643539147,
      "grad_norm": 0.633688657208189,
      "learning_rate": 3.8664393727239005e-05,
      "loss": 1.4508,
      "num_input_tokens_seen": 28170159488,
      "step": 35805
    },
    {
      "epoch": 3.798642053893486,
      "grad_norm": 0.669307363724255,
      "learning_rate": 3.8663811748350774e-05,
      "loss": 1.4802,
      "num_input_tokens_seen": 28170946224,
      "step": 35806
    },
    {
      "epoch": 3.7987481434330577,
      "grad_norm": 0.5249413870915972,
      "learning_rate": 3.866322975890355e-05,
      "loss": 1.4398,
      "num_input_tokens_seen": 28171733072,
      "step": 35807
    },
    {
      "epoch": 3.798854232972629,
      "grad_norm": 0.4812742806612401,
      "learning_rate": 3.8662647758897794e-05,
      "loss": 1.4305,
      "num_input_tokens_seen": 28172519760,
      "step": 35808
    },
    {
      "epoch": 3.7989603225122,
      "grad_norm": 0.48830314783804546,
      "learning_rate": 3.866206574833394e-05,
      "loss": 1.5247,
      "num_input_tokens_seen": 28173306480,
      "step": 35809
    },
    {
      "epoch": 3.7990664120517716,
      "grad_norm": 0.4990793451511474,
      "learning_rate": 3.8661483727212435e-05,
      "loss": 1.4305,
      "num_input_tokens_seen": 28174093312,
      "step": 35810
    },
    {
      "epoch": 3.799172501591343,
      "grad_norm": 0.4539082447481765,
      "learning_rate": 3.866090169553374e-05,
      "loss": 1.4815,
      "num_input_tokens_seen": 28174880064,
      "step": 35811
    },
    {
      "epoch": 3.7992785911309146,
      "grad_norm": 0.6453569354643285,
      "learning_rate": 3.86603196532983e-05,
      "loss": 1.4938,
      "num_input_tokens_seen": 28175666768,
      "step": 35812
    },
    {
      "epoch": 3.799384680670486,
      "grad_norm": 0.4858343113634154,
      "learning_rate": 3.8659737600506576e-05,
      "loss": 1.5068,
      "num_input_tokens_seen": 28176453472,
      "step": 35813
    },
    {
      "epoch": 3.799490770210057,
      "grad_norm": 0.49304795667334494,
      "learning_rate": 3.8659155537158996e-05,
      "loss": 1.5384,
      "num_input_tokens_seen": 28177240224,
      "step": 35814
    },
    {
      "epoch": 3.7995968597496286,
      "grad_norm": 0.40075862461916634,
      "learning_rate": 3.865857346325602e-05,
      "loss": 1.4704,
      "num_input_tokens_seen": 28178027024,
      "step": 35815
    },
    {
      "epoch": 3.7997029492892,
      "grad_norm": 0.529868156133941,
      "learning_rate": 3.865799137879811e-05,
      "loss": 1.4152,
      "num_input_tokens_seen": 28178813712,
      "step": 35816
    },
    {
      "epoch": 3.7998090388287715,
      "grad_norm": 0.5424627814807742,
      "learning_rate": 3.8657409283785695e-05,
      "loss": 1.4793,
      "num_input_tokens_seen": 28179600480,
      "step": 35817
    },
    {
      "epoch": 3.799915128368343,
      "grad_norm": 0.4377720811803115,
      "learning_rate": 3.8656827178219235e-05,
      "loss": 1.4986,
      "num_input_tokens_seen": 28180387200,
      "step": 35818
    },
    {
      "epoch": 3.800021217907914,
      "grad_norm": 0.4897629592399168,
      "learning_rate": 3.8656245062099185e-05,
      "loss": 1.4993,
      "num_input_tokens_seen": 28181173888,
      "step": 35819
    },
    {
      "epoch": 3.800127307447486,
      "grad_norm": 0.3947932817208921,
      "learning_rate": 3.8655662935425985e-05,
      "loss": 1.4285,
      "num_input_tokens_seen": 28181960736,
      "step": 35820
    },
    {
      "epoch": 3.800233396987057,
      "grad_norm": 0.42180766829079674,
      "learning_rate": 3.8655080798200096e-05,
      "loss": 1.3815,
      "num_input_tokens_seen": 28182747408,
      "step": 35821
    },
    {
      "epoch": 3.8003394865266285,
      "grad_norm": 0.3925634943741316,
      "learning_rate": 3.865449865042196e-05,
      "loss": 1.4805,
      "num_input_tokens_seen": 28183534208,
      "step": 35822
    },
    {
      "epoch": 3.8004455760662,
      "grad_norm": 0.38068825625141894,
      "learning_rate": 3.865391649209203e-05,
      "loss": 1.4751,
      "num_input_tokens_seen": 28184321024,
      "step": 35823
    },
    {
      "epoch": 3.8005516656057714,
      "grad_norm": 0.4085977781088237,
      "learning_rate": 3.8653334323210735e-05,
      "loss": 1.4668,
      "num_input_tokens_seen": 28185107776,
      "step": 35824
    },
    {
      "epoch": 3.800657755145343,
      "grad_norm": 0.37967372970155006,
      "learning_rate": 3.865275214377856e-05,
      "loss": 1.3257,
      "num_input_tokens_seen": 28185894608,
      "step": 35825
    },
    {
      "epoch": 3.800763844684914,
      "grad_norm": 0.4442477326658248,
      "learning_rate": 3.865216995379594e-05,
      "loss": 1.4456,
      "num_input_tokens_seen": 28186681360,
      "step": 35826
    },
    {
      "epoch": 3.8008699342244854,
      "grad_norm": 0.4166561683133872,
      "learning_rate": 3.8651587753263316e-05,
      "loss": 1.3202,
      "num_input_tokens_seen": 28187468064,
      "step": 35827
    },
    {
      "epoch": 3.800976023764057,
      "grad_norm": 0.4796688510019661,
      "learning_rate": 3.8651005542181155e-05,
      "loss": 1.4762,
      "num_input_tokens_seen": 28188254768,
      "step": 35828
    },
    {
      "epoch": 3.8010821133036283,
      "grad_norm": 0.44443594092090016,
      "learning_rate": 3.865042332054989e-05,
      "loss": 1.3652,
      "num_input_tokens_seen": 28189041568,
      "step": 35829
    },
    {
      "epoch": 3.8011882028432,
      "grad_norm": 0.7734778002393264,
      "learning_rate": 3.864984108836998e-05,
      "loss": 1.3901,
      "num_input_tokens_seen": 28189828304,
      "step": 35830
    },
    {
      "epoch": 3.801294292382771,
      "grad_norm": 0.3828899146623972,
      "learning_rate": 3.8649258845641876e-05,
      "loss": 1.3958,
      "num_input_tokens_seen": 28190615152,
      "step": 35831
    },
    {
      "epoch": 3.8014003819223423,
      "grad_norm": 0.48595788219834607,
      "learning_rate": 3.864867659236603e-05,
      "loss": 1.4257,
      "num_input_tokens_seen": 28191401952,
      "step": 35832
    },
    {
      "epoch": 3.801506471461914,
      "grad_norm": 0.40897357923065525,
      "learning_rate": 3.8648094328542874e-05,
      "loss": 1.3941,
      "num_input_tokens_seen": 28192188752,
      "step": 35833
    },
    {
      "epoch": 3.8016125610014853,
      "grad_norm": 0.4269215279465775,
      "learning_rate": 3.864751205417287e-05,
      "loss": 1.3718,
      "num_input_tokens_seen": 28192975408,
      "step": 35834
    },
    {
      "epoch": 3.8017186505410567,
      "grad_norm": 0.4274021986151735,
      "learning_rate": 3.864692976925649e-05,
      "loss": 1.5096,
      "num_input_tokens_seen": 28193762192,
      "step": 35835
    },
    {
      "epoch": 3.801824740080628,
      "grad_norm": 0.41653703657366087,
      "learning_rate": 3.8646347473794145e-05,
      "loss": 1.4583,
      "num_input_tokens_seen": 28194548928,
      "step": 35836
    },
    {
      "epoch": 3.8019308296201997,
      "grad_norm": 0.5018729895439614,
      "learning_rate": 3.864576516778631e-05,
      "loss": 1.5246,
      "num_input_tokens_seen": 28195335696,
      "step": 35837
    },
    {
      "epoch": 3.8020369191597707,
      "grad_norm": 0.6343163596431203,
      "learning_rate": 3.864518285123343e-05,
      "loss": 1.4687,
      "num_input_tokens_seen": 28196122480,
      "step": 35838
    },
    {
      "epoch": 3.802143008699342,
      "grad_norm": 0.48826692632850793,
      "learning_rate": 3.8644600524135944e-05,
      "loss": 1.4518,
      "num_input_tokens_seen": 28196909248,
      "step": 35839
    },
    {
      "epoch": 3.8022490982389137,
      "grad_norm": 0.6191633709555099,
      "learning_rate": 3.8644018186494314e-05,
      "loss": 1.434,
      "num_input_tokens_seen": 28197695936,
      "step": 35840
    },
    {
      "epoch": 3.802355187778485,
      "grad_norm": 0.44393045603324094,
      "learning_rate": 3.8643435838308995e-05,
      "loss": 1.565,
      "num_input_tokens_seen": 28198482704,
      "step": 35841
    },
    {
      "epoch": 3.8024612773180566,
      "grad_norm": 0.41001342991456996,
      "learning_rate": 3.864285347958042e-05,
      "loss": 1.3489,
      "num_input_tokens_seen": 28199269488,
      "step": 35842
    },
    {
      "epoch": 3.8025673668576276,
      "grad_norm": 0.4840661603077865,
      "learning_rate": 3.8642271110309055e-05,
      "loss": 1.2437,
      "num_input_tokens_seen": 28200056272,
      "step": 35843
    },
    {
      "epoch": 3.802673456397199,
      "grad_norm": 0.3756289069549155,
      "learning_rate": 3.864168873049534e-05,
      "loss": 1.3999,
      "num_input_tokens_seen": 28200843040,
      "step": 35844
    },
    {
      "epoch": 3.8027795459367706,
      "grad_norm": 0.5810799506594275,
      "learning_rate": 3.864110634013973e-05,
      "loss": 1.4562,
      "num_input_tokens_seen": 28201629760,
      "step": 35845
    },
    {
      "epoch": 3.802885635476342,
      "grad_norm": 0.4721455249670414,
      "learning_rate": 3.864052393924266e-05,
      "loss": 1.4063,
      "num_input_tokens_seen": 28202416496,
      "step": 35846
    },
    {
      "epoch": 3.8029917250159135,
      "grad_norm": 0.6826255221967358,
      "learning_rate": 3.863994152780461e-05,
      "loss": 1.6051,
      "num_input_tokens_seen": 28203203200,
      "step": 35847
    },
    {
      "epoch": 3.8030978145554846,
      "grad_norm": 0.47547152154681366,
      "learning_rate": 3.863935910582601e-05,
      "loss": 1.4633,
      "num_input_tokens_seen": 28203989936,
      "step": 35848
    },
    {
      "epoch": 3.8032039040950565,
      "grad_norm": 0.7168063495633663,
      "learning_rate": 3.863877667330731e-05,
      "loss": 1.478,
      "num_input_tokens_seen": 28204776608,
      "step": 35849
    },
    {
      "epoch": 3.8033099936346275,
      "grad_norm": 0.42049526679795607,
      "learning_rate": 3.863819423024896e-05,
      "loss": 1.4676,
      "num_input_tokens_seen": 28205563360,
      "step": 35850
    },
    {
      "epoch": 3.803416083174199,
      "grad_norm": 0.4875969025476781,
      "learning_rate": 3.863761177665142e-05,
      "loss": 1.404,
      "num_input_tokens_seen": 28206350144,
      "step": 35851
    },
    {
      "epoch": 3.8035221727137705,
      "grad_norm": 0.5529799340166128,
      "learning_rate": 3.863702931251513e-05,
      "loss": 1.426,
      "num_input_tokens_seen": 28207136912,
      "step": 35852
    },
    {
      "epoch": 3.803628262253342,
      "grad_norm": 0.5960290776309696,
      "learning_rate": 3.863644683784055e-05,
      "loss": 1.4949,
      "num_input_tokens_seen": 28207923600,
      "step": 35853
    },
    {
      "epoch": 3.8037343517929134,
      "grad_norm": 0.4773768946398177,
      "learning_rate": 3.863586435262812e-05,
      "loss": 1.4714,
      "num_input_tokens_seen": 28208710320,
      "step": 35854
    },
    {
      "epoch": 3.8038404413324844,
      "grad_norm": 0.49510547471276867,
      "learning_rate": 3.863528185687829e-05,
      "loss": 1.5349,
      "num_input_tokens_seen": 28209497024,
      "step": 35855
    },
    {
      "epoch": 3.803946530872056,
      "grad_norm": 0.5129112460761964,
      "learning_rate": 3.8634699350591526e-05,
      "loss": 1.34,
      "num_input_tokens_seen": 28210283840,
      "step": 35856
    },
    {
      "epoch": 3.8040526204116274,
      "grad_norm": 0.5229952951323422,
      "learning_rate": 3.8634116833768256e-05,
      "loss": 1.4193,
      "num_input_tokens_seen": 28211070576,
      "step": 35857
    },
    {
      "epoch": 3.804158709951199,
      "grad_norm": 0.577066714482409,
      "learning_rate": 3.8633534306408946e-05,
      "loss": 1.5121,
      "num_input_tokens_seen": 28211857376,
      "step": 35858
    },
    {
      "epoch": 3.8042647994907703,
      "grad_norm": 0.5631421856750354,
      "learning_rate": 3.863295176851404e-05,
      "loss": 1.5041,
      "num_input_tokens_seen": 28212644144,
      "step": 35859
    },
    {
      "epoch": 3.8043708890303414,
      "grad_norm": 0.5371147582518235,
      "learning_rate": 3.863236922008398e-05,
      "loss": 1.5044,
      "num_input_tokens_seen": 28213430816,
      "step": 35860
    },
    {
      "epoch": 3.804476978569913,
      "grad_norm": 0.5268421901295075,
      "learning_rate": 3.863178666111924e-05,
      "loss": 1.5498,
      "num_input_tokens_seen": 28214217488,
      "step": 35861
    },
    {
      "epoch": 3.8045830681094843,
      "grad_norm": 0.44443550551201866,
      "learning_rate": 3.863120409162024e-05,
      "loss": 1.466,
      "num_input_tokens_seen": 28215004208,
      "step": 35862
    },
    {
      "epoch": 3.804689157649056,
      "grad_norm": 0.4686525607761162,
      "learning_rate": 3.8630621511587456e-05,
      "loss": 1.4957,
      "num_input_tokens_seen": 28215790896,
      "step": 35863
    },
    {
      "epoch": 3.8047952471886273,
      "grad_norm": 0.529343258811784,
      "learning_rate": 3.863003892102133e-05,
      "loss": 1.4898,
      "num_input_tokens_seen": 28216577552,
      "step": 35864
    },
    {
      "epoch": 3.8049013367281987,
      "grad_norm": 0.4431114348652008,
      "learning_rate": 3.8629456319922304e-05,
      "loss": 1.4325,
      "num_input_tokens_seen": 28217364352,
      "step": 35865
    },
    {
      "epoch": 3.80500742626777,
      "grad_norm": 0.43201308077946277,
      "learning_rate": 3.862887370829083e-05,
      "loss": 1.5019,
      "num_input_tokens_seen": 28218151072,
      "step": 35866
    },
    {
      "epoch": 3.8051135158073413,
      "grad_norm": 0.5219680541186715,
      "learning_rate": 3.862829108612737e-05,
      "loss": 1.4175,
      "num_input_tokens_seen": 28218937840,
      "step": 35867
    },
    {
      "epoch": 3.8052196053469127,
      "grad_norm": 0.39981826829656847,
      "learning_rate": 3.862770845343237e-05,
      "loss": 1.301,
      "num_input_tokens_seen": 28219724592,
      "step": 35868
    },
    {
      "epoch": 3.805325694886484,
      "grad_norm": 0.42800591139060845,
      "learning_rate": 3.862712581020627e-05,
      "loss": 1.5299,
      "num_input_tokens_seen": 28220511296,
      "step": 35869
    },
    {
      "epoch": 3.8054317844260557,
      "grad_norm": 0.5274938044770572,
      "learning_rate": 3.862654315644952e-05,
      "loss": 1.416,
      "num_input_tokens_seen": 28221298080,
      "step": 35870
    },
    {
      "epoch": 3.805537873965627,
      "grad_norm": 0.5151863152758467,
      "learning_rate": 3.862596049216258e-05,
      "loss": 1.4561,
      "num_input_tokens_seen": 28222084880,
      "step": 35871
    },
    {
      "epoch": 3.805643963505198,
      "grad_norm": 0.8315999382715658,
      "learning_rate": 3.862537781734591e-05,
      "loss": 1.4395,
      "num_input_tokens_seen": 28222871664,
      "step": 35872
    },
    {
      "epoch": 3.8057500530447697,
      "grad_norm": 0.692974948609846,
      "learning_rate": 3.862479513199994e-05,
      "loss": 1.4426,
      "num_input_tokens_seen": 28223658544,
      "step": 35873
    },
    {
      "epoch": 3.805856142584341,
      "grad_norm": 0.6227175861722413,
      "learning_rate": 3.862421243612512e-05,
      "loss": 1.3907,
      "num_input_tokens_seen": 28224445360,
      "step": 35874
    },
    {
      "epoch": 3.8059622321239126,
      "grad_norm": 0.6344023678078063,
      "learning_rate": 3.862362972972192e-05,
      "loss": 1.4554,
      "num_input_tokens_seen": 28225232176,
      "step": 35875
    },
    {
      "epoch": 3.806068321663484,
      "grad_norm": 0.39238087272085903,
      "learning_rate": 3.8623047012790775e-05,
      "loss": 1.4624,
      "num_input_tokens_seen": 28226018976,
      "step": 35876
    },
    {
      "epoch": 3.806174411203055,
      "grad_norm": 0.745769449285606,
      "learning_rate": 3.8622464285332135e-05,
      "loss": 1.4533,
      "num_input_tokens_seen": 28226805632,
      "step": 35877
    },
    {
      "epoch": 3.806280500742627,
      "grad_norm": 0.4433617990688491,
      "learning_rate": 3.862188154734646e-05,
      "loss": 1.4735,
      "num_input_tokens_seen": 28227592288,
      "step": 35878
    },
    {
      "epoch": 3.806386590282198,
      "grad_norm": 0.6505959515143003,
      "learning_rate": 3.8621298798834194e-05,
      "loss": 1.4262,
      "num_input_tokens_seen": 28228379056,
      "step": 35879
    },
    {
      "epoch": 3.8064926798217695,
      "grad_norm": 0.4937702328873003,
      "learning_rate": 3.862071603979579e-05,
      "loss": 1.3473,
      "num_input_tokens_seen": 28229165776,
      "step": 35880
    },
    {
      "epoch": 3.806598769361341,
      "grad_norm": 0.454197493849544,
      "learning_rate": 3.8620133270231696e-05,
      "loss": 1.2899,
      "num_input_tokens_seen": 28229952624,
      "step": 35881
    },
    {
      "epoch": 3.8067048589009125,
      "grad_norm": 0.6747444820737322,
      "learning_rate": 3.861955049014236e-05,
      "loss": 1.388,
      "num_input_tokens_seen": 28230739424,
      "step": 35882
    },
    {
      "epoch": 3.806810948440484,
      "grad_norm": 0.39317705177577456,
      "learning_rate": 3.861896769952823e-05,
      "loss": 1.4674,
      "num_input_tokens_seen": 28231526160,
      "step": 35883
    },
    {
      "epoch": 3.806917037980055,
      "grad_norm": 0.7456498580348695,
      "learning_rate": 3.861838489838977e-05,
      "loss": 1.5158,
      "num_input_tokens_seen": 28232312848,
      "step": 35884
    },
    {
      "epoch": 3.8070231275196265,
      "grad_norm": 0.41204438962802903,
      "learning_rate": 3.861780208672742e-05,
      "loss": 1.3352,
      "num_input_tokens_seen": 28233099616,
      "step": 35885
    },
    {
      "epoch": 3.807129217059198,
      "grad_norm": 0.5604310704982801,
      "learning_rate": 3.861721926454163e-05,
      "loss": 1.4646,
      "num_input_tokens_seen": 28233886352,
      "step": 35886
    },
    {
      "epoch": 3.8072353065987694,
      "grad_norm": 0.4973942494504945,
      "learning_rate": 3.861663643183285e-05,
      "loss": 1.5238,
      "num_input_tokens_seen": 28234673072,
      "step": 35887
    },
    {
      "epoch": 3.807341396138341,
      "grad_norm": 0.5166144118627979,
      "learning_rate": 3.861605358860154e-05,
      "loss": 1.4433,
      "num_input_tokens_seen": 28235459856,
      "step": 35888
    },
    {
      "epoch": 3.807447485677912,
      "grad_norm": 0.5612120669618271,
      "learning_rate": 3.861547073484814e-05,
      "loss": 1.5082,
      "num_input_tokens_seen": 28236246736,
      "step": 35889
    },
    {
      "epoch": 3.807553575217484,
      "grad_norm": 0.38139585257702097,
      "learning_rate": 3.86148878705731e-05,
      "loss": 1.4463,
      "num_input_tokens_seen": 28237033600,
      "step": 35890
    },
    {
      "epoch": 3.807659664757055,
      "grad_norm": 0.5102963206327591,
      "learning_rate": 3.861430499577687e-05,
      "loss": 1.4059,
      "num_input_tokens_seen": 28237820256,
      "step": 35891
    },
    {
      "epoch": 3.8077657542966263,
      "grad_norm": 0.4531635689192046,
      "learning_rate": 3.861372211045991e-05,
      "loss": 1.5089,
      "num_input_tokens_seen": 28238607024,
      "step": 35892
    },
    {
      "epoch": 3.807871843836198,
      "grad_norm": 0.43753693893020185,
      "learning_rate": 3.861313921462266e-05,
      "loss": 1.4627,
      "num_input_tokens_seen": 28239393760,
      "step": 35893
    },
    {
      "epoch": 3.8079779333757693,
      "grad_norm": 0.6747207148651894,
      "learning_rate": 3.861255630826559e-05,
      "loss": 1.4598,
      "num_input_tokens_seen": 28240180608,
      "step": 35894
    },
    {
      "epoch": 3.8080840229153408,
      "grad_norm": 0.4875733200304795,
      "learning_rate": 3.8611973391389126e-05,
      "loss": 1.4473,
      "num_input_tokens_seen": 28240967424,
      "step": 35895
    },
    {
      "epoch": 3.808190112454912,
      "grad_norm": 1.021143469695648,
      "learning_rate": 3.861139046399373e-05,
      "loss": 1.4832,
      "num_input_tokens_seen": 28241754176,
      "step": 35896
    },
    {
      "epoch": 3.8082962019944833,
      "grad_norm": 0.5171428415506224,
      "learning_rate": 3.861080752607985e-05,
      "loss": 1.4153,
      "num_input_tokens_seen": 28242540992,
      "step": 35897
    },
    {
      "epoch": 3.8084022915340547,
      "grad_norm": 0.8464461639420042,
      "learning_rate": 3.861022457764794e-05,
      "loss": 1.4754,
      "num_input_tokens_seen": 28243327792,
      "step": 35898
    },
    {
      "epoch": 3.808508381073626,
      "grad_norm": 0.43159108859536355,
      "learning_rate": 3.860964161869845e-05,
      "loss": 1.476,
      "num_input_tokens_seen": 28244114432,
      "step": 35899
    },
    {
      "epoch": 3.8086144706131977,
      "grad_norm": 0.6268092714992085,
      "learning_rate": 3.860905864923182e-05,
      "loss": 1.4474,
      "num_input_tokens_seen": 28244901136,
      "step": 35900
    },
    {
      "epoch": 3.8087205601527687,
      "grad_norm": 0.5292431305897255,
      "learning_rate": 3.860847566924851e-05,
      "loss": 1.4477,
      "num_input_tokens_seen": 28245687824,
      "step": 35901
    },
    {
      "epoch": 3.80882664969234,
      "grad_norm": 0.40207128626393324,
      "learning_rate": 3.860789267874897e-05,
      "loss": 1.3418,
      "num_input_tokens_seen": 28246474656,
      "step": 35902
    },
    {
      "epoch": 3.8089327392319117,
      "grad_norm": 0.7673578404027477,
      "learning_rate": 3.8607309677733663e-05,
      "loss": 1.5861,
      "num_input_tokens_seen": 28247261392,
      "step": 35903
    },
    {
      "epoch": 3.809038828771483,
      "grad_norm": 0.5146676399732104,
      "learning_rate": 3.860672666620301e-05,
      "loss": 1.4619,
      "num_input_tokens_seen": 28248048224,
      "step": 35904
    },
    {
      "epoch": 3.8091449183110546,
      "grad_norm": 0.5614310758067018,
      "learning_rate": 3.8606143644157485e-05,
      "loss": 1.5248,
      "num_input_tokens_seen": 28248834880,
      "step": 35905
    },
    {
      "epoch": 3.809251007850626,
      "grad_norm": 0.5147165177796837,
      "learning_rate": 3.860556061159752e-05,
      "loss": 1.5282,
      "num_input_tokens_seen": 28249621584,
      "step": 35906
    },
    {
      "epoch": 3.8093570973901976,
      "grad_norm": 0.48874615538737,
      "learning_rate": 3.860497756852359e-05,
      "loss": 1.3848,
      "num_input_tokens_seen": 28250408288,
      "step": 35907
    },
    {
      "epoch": 3.8094631869297686,
      "grad_norm": 0.4525459815134449,
      "learning_rate": 3.860439451493614e-05,
      "loss": 1.4846,
      "num_input_tokens_seen": 28251195024,
      "step": 35908
    },
    {
      "epoch": 3.80956927646934,
      "grad_norm": 0.48893063009666377,
      "learning_rate": 3.86038114508356e-05,
      "loss": 1.5471,
      "num_input_tokens_seen": 28251981728,
      "step": 35909
    },
    {
      "epoch": 3.8096753660089115,
      "grad_norm": 0.4609591970175257,
      "learning_rate": 3.8603228376222436e-05,
      "loss": 1.444,
      "num_input_tokens_seen": 28252768448,
      "step": 35910
    },
    {
      "epoch": 3.809781455548483,
      "grad_norm": 0.446505960877525,
      "learning_rate": 3.8602645291097094e-05,
      "loss": 1.4201,
      "num_input_tokens_seen": 28253555168,
      "step": 35911
    },
    {
      "epoch": 3.8098875450880545,
      "grad_norm": 0.4073952023653402,
      "learning_rate": 3.860206219546003e-05,
      "loss": 1.4362,
      "num_input_tokens_seen": 28254341936,
      "step": 35912
    },
    {
      "epoch": 3.8099936346276255,
      "grad_norm": 0.42665327196737385,
      "learning_rate": 3.8601479089311685e-05,
      "loss": 1.4096,
      "num_input_tokens_seen": 28255128704,
      "step": 35913
    },
    {
      "epoch": 3.810099724167197,
      "grad_norm": 0.4828070283769826,
      "learning_rate": 3.8600895972652526e-05,
      "loss": 1.3729,
      "num_input_tokens_seen": 28255915504,
      "step": 35914
    },
    {
      "epoch": 3.8102058137067685,
      "grad_norm": 0.4015551592517416,
      "learning_rate": 3.860031284548299e-05,
      "loss": 1.3972,
      "num_input_tokens_seen": 28256702336,
      "step": 35915
    },
    {
      "epoch": 3.81031190324634,
      "grad_norm": 0.5459678127123664,
      "learning_rate": 3.859972970780353e-05,
      "loss": 1.487,
      "num_input_tokens_seen": 28257489040,
      "step": 35916
    },
    {
      "epoch": 3.8104179927859114,
      "grad_norm": 0.47827466325734247,
      "learning_rate": 3.85991465596146e-05,
      "loss": 1.4663,
      "num_input_tokens_seen": 28258275856,
      "step": 35917
    },
    {
      "epoch": 3.8105240823254825,
      "grad_norm": 0.4626468864431309,
      "learning_rate": 3.8598563400916644e-05,
      "loss": 1.4641,
      "num_input_tokens_seen": 28259062592,
      "step": 35918
    },
    {
      "epoch": 3.8106301718650544,
      "grad_norm": 0.5360992321571804,
      "learning_rate": 3.8597980231710116e-05,
      "loss": 1.5214,
      "num_input_tokens_seen": 28259849424,
      "step": 35919
    },
    {
      "epoch": 3.8107362614046254,
      "grad_norm": 0.44885293991823494,
      "learning_rate": 3.859739705199548e-05,
      "loss": 1.482,
      "num_input_tokens_seen": 28260636128,
      "step": 35920
    },
    {
      "epoch": 3.810842350944197,
      "grad_norm": 0.4638090710995705,
      "learning_rate": 3.859681386177316e-05,
      "loss": 1.3544,
      "num_input_tokens_seen": 28261422864,
      "step": 35921
    },
    {
      "epoch": 3.8109484404837684,
      "grad_norm": 0.6498033423450923,
      "learning_rate": 3.859623066104363e-05,
      "loss": 1.4497,
      "num_input_tokens_seen": 28262209664,
      "step": 35922
    },
    {
      "epoch": 3.81105453002334,
      "grad_norm": 0.3962578476622704,
      "learning_rate": 3.8595647449807335e-05,
      "loss": 1.3932,
      "num_input_tokens_seen": 28262996432,
      "step": 35923
    },
    {
      "epoch": 3.8111606195629113,
      "grad_norm": 0.5400727996259561,
      "learning_rate": 3.859506422806471e-05,
      "loss": 1.3908,
      "num_input_tokens_seen": 28263783184,
      "step": 35924
    },
    {
      "epoch": 3.8112667091024823,
      "grad_norm": 0.5112594064852619,
      "learning_rate": 3.8594480995816226e-05,
      "loss": 1.4491,
      "num_input_tokens_seen": 28264569952,
      "step": 35925
    },
    {
      "epoch": 3.811372798642054,
      "grad_norm": 0.6042655346691611,
      "learning_rate": 3.859389775306233e-05,
      "loss": 1.4746,
      "num_input_tokens_seen": 28265356592,
      "step": 35926
    },
    {
      "epoch": 3.8114788881816253,
      "grad_norm": 0.43961634099507474,
      "learning_rate": 3.859331449980346e-05,
      "loss": 1.4484,
      "num_input_tokens_seen": 28266143328,
      "step": 35927
    },
    {
      "epoch": 3.8115849777211968,
      "grad_norm": 0.4933846529928613,
      "learning_rate": 3.859273123604008e-05,
      "loss": 1.5677,
      "num_input_tokens_seen": 28266930032,
      "step": 35928
    },
    {
      "epoch": 3.8116910672607682,
      "grad_norm": 0.4887236723635232,
      "learning_rate": 3.859214796177264e-05,
      "loss": 1.4568,
      "num_input_tokens_seen": 28267716784,
      "step": 35929
    },
    {
      "epoch": 3.8117971568003393,
      "grad_norm": 0.48070274047241424,
      "learning_rate": 3.859156467700158e-05,
      "loss": 1.4346,
      "num_input_tokens_seen": 28268503648,
      "step": 35930
    },
    {
      "epoch": 3.8119032463399107,
      "grad_norm": 0.41718582406470867,
      "learning_rate": 3.859098138172736e-05,
      "loss": 1.3334,
      "num_input_tokens_seen": 28269290496,
      "step": 35931
    },
    {
      "epoch": 3.812009335879482,
      "grad_norm": 0.49781142835682063,
      "learning_rate": 3.8590398075950426e-05,
      "loss": 1.5161,
      "num_input_tokens_seen": 28270077200,
      "step": 35932
    },
    {
      "epoch": 3.8121154254190537,
      "grad_norm": 0.45210569399904876,
      "learning_rate": 3.8589814759671236e-05,
      "loss": 1.5203,
      "num_input_tokens_seen": 28270863920,
      "step": 35933
    },
    {
      "epoch": 3.812221514958625,
      "grad_norm": 0.45745176484164946,
      "learning_rate": 3.858923143289024e-05,
      "loss": 1.3614,
      "num_input_tokens_seen": 28271650784,
      "step": 35934
    },
    {
      "epoch": 3.8123276044981966,
      "grad_norm": 0.4424150294906474,
      "learning_rate": 3.858864809560788e-05,
      "loss": 1.5755,
      "num_input_tokens_seen": 28272437504,
      "step": 35935
    },
    {
      "epoch": 3.812433694037768,
      "grad_norm": 0.44943764288060517,
      "learning_rate": 3.8588064747824605e-05,
      "loss": 1.571,
      "num_input_tokens_seen": 28273224192,
      "step": 35936
    },
    {
      "epoch": 3.812539783577339,
      "grad_norm": 0.45127952088815504,
      "learning_rate": 3.8587481389540875e-05,
      "loss": 1.4942,
      "num_input_tokens_seen": 28274010864,
      "step": 35937
    },
    {
      "epoch": 3.8126458731169106,
      "grad_norm": 0.4435376852834124,
      "learning_rate": 3.858689802075715e-05,
      "loss": 1.4494,
      "num_input_tokens_seen": 28274797568,
      "step": 35938
    },
    {
      "epoch": 3.812751962656482,
      "grad_norm": 0.4153297518358772,
      "learning_rate": 3.858631464147385e-05,
      "loss": 1.4297,
      "num_input_tokens_seen": 28275584320,
      "step": 35939
    },
    {
      "epoch": 3.8128580521960536,
      "grad_norm": 0.47382771610410146,
      "learning_rate": 3.858573125169145e-05,
      "loss": 1.5605,
      "num_input_tokens_seen": 28276371072,
      "step": 35940
    },
    {
      "epoch": 3.812964141735625,
      "grad_norm": 0.4425367013962254,
      "learning_rate": 3.85851478514104e-05,
      "loss": 1.4446,
      "num_input_tokens_seen": 28277157872,
      "step": 35941
    },
    {
      "epoch": 3.813070231275196,
      "grad_norm": 0.4550260959627942,
      "learning_rate": 3.8584564440631145e-05,
      "loss": 1.5309,
      "num_input_tokens_seen": 28277944576,
      "step": 35942
    },
    {
      "epoch": 3.8131763208147675,
      "grad_norm": 0.4729266421225718,
      "learning_rate": 3.8583981019354144e-05,
      "loss": 1.5936,
      "num_input_tokens_seen": 28278731392,
      "step": 35943
    },
    {
      "epoch": 3.813282410354339,
      "grad_norm": 0.4784250446628221,
      "learning_rate": 3.858339758757983e-05,
      "loss": 1.4049,
      "num_input_tokens_seen": 28279518128,
      "step": 35944
    },
    {
      "epoch": 3.8133884998939105,
      "grad_norm": 0.4735496201704416,
      "learning_rate": 3.858281414530866e-05,
      "loss": 1.4086,
      "num_input_tokens_seen": 28280304752,
      "step": 35945
    },
    {
      "epoch": 3.813494589433482,
      "grad_norm": 0.5318323621625104,
      "learning_rate": 3.858223069254111e-05,
      "loss": 1.5511,
      "num_input_tokens_seen": 28281091504,
      "step": 35946
    },
    {
      "epoch": 3.813600678973053,
      "grad_norm": 0.48636382347270685,
      "learning_rate": 3.85816472292776e-05,
      "loss": 1.4385,
      "num_input_tokens_seen": 28281878352,
      "step": 35947
    },
    {
      "epoch": 3.813706768512625,
      "grad_norm": 0.42758906888521453,
      "learning_rate": 3.858106375551859e-05,
      "loss": 1.3717,
      "num_input_tokens_seen": 28282665120,
      "step": 35948
    },
    {
      "epoch": 3.813812858052196,
      "grad_norm": 0.5011625224220505,
      "learning_rate": 3.858048027126454e-05,
      "loss": 1.4144,
      "num_input_tokens_seen": 28283451904,
      "step": 35949
    },
    {
      "epoch": 3.8139189475917674,
      "grad_norm": 0.548577638120316,
      "learning_rate": 3.8579896776515884e-05,
      "loss": 1.4963,
      "num_input_tokens_seen": 28284238656,
      "step": 35950
    },
    {
      "epoch": 3.814025037131339,
      "grad_norm": 0.48967813292566337,
      "learning_rate": 3.857931327127309e-05,
      "loss": 1.4705,
      "num_input_tokens_seen": 28285025424,
      "step": 35951
    },
    {
      "epoch": 3.8141311266709104,
      "grad_norm": 0.5690243150048526,
      "learning_rate": 3.8578729755536594e-05,
      "loss": 1.4904,
      "num_input_tokens_seen": 28285812080,
      "step": 35952
    },
    {
      "epoch": 3.814237216210482,
      "grad_norm": 0.41117461995422827,
      "learning_rate": 3.857814622930686e-05,
      "loss": 1.2625,
      "num_input_tokens_seen": 28286598800,
      "step": 35953
    },
    {
      "epoch": 3.814343305750053,
      "grad_norm": 0.4840324434110302,
      "learning_rate": 3.857756269258433e-05,
      "loss": 1.4931,
      "num_input_tokens_seen": 28287385632,
      "step": 35954
    },
    {
      "epoch": 3.8144493952896243,
      "grad_norm": 0.4894852682782895,
      "learning_rate": 3.857697914536945e-05,
      "loss": 1.534,
      "num_input_tokens_seen": 28288172400,
      "step": 35955
    },
    {
      "epoch": 3.814555484829196,
      "grad_norm": 0.4498914455512524,
      "learning_rate": 3.857639558766269e-05,
      "loss": 1.4957,
      "num_input_tokens_seen": 28288959136,
      "step": 35956
    },
    {
      "epoch": 3.8146615743687673,
      "grad_norm": 0.46025848062793656,
      "learning_rate": 3.857581201946449e-05,
      "loss": 1.3532,
      "num_input_tokens_seen": 28289746064,
      "step": 35957
    },
    {
      "epoch": 3.8147676639083388,
      "grad_norm": 0.5205181608198086,
      "learning_rate": 3.857522844077529e-05,
      "loss": 1.5231,
      "num_input_tokens_seen": 28290532800,
      "step": 35958
    },
    {
      "epoch": 3.81487375344791,
      "grad_norm": 0.40525556508008076,
      "learning_rate": 3.857464485159556e-05,
      "loss": 1.3475,
      "num_input_tokens_seen": 28291319568,
      "step": 35959
    },
    {
      "epoch": 3.8149798429874813,
      "grad_norm": 0.4145132741052184,
      "learning_rate": 3.857406125192574e-05,
      "loss": 1.3447,
      "num_input_tokens_seen": 28292106368,
      "step": 35960
    },
    {
      "epoch": 3.8150859325270527,
      "grad_norm": 0.5031212961941867,
      "learning_rate": 3.8573477641766286e-05,
      "loss": 1.5651,
      "num_input_tokens_seen": 28292893152,
      "step": 35961
    },
    {
      "epoch": 3.8151920220666242,
      "grad_norm": 0.42950584611489784,
      "learning_rate": 3.857289402111765e-05,
      "loss": 1.4739,
      "num_input_tokens_seen": 28293679904,
      "step": 35962
    },
    {
      "epoch": 3.8152981116061957,
      "grad_norm": 0.46885824223550027,
      "learning_rate": 3.8572310389980275e-05,
      "loss": 1.3639,
      "num_input_tokens_seen": 28294466704,
      "step": 35963
    },
    {
      "epoch": 3.815404201145767,
      "grad_norm": 0.44078991832993014,
      "learning_rate": 3.857172674835462e-05,
      "loss": 1.4024,
      "num_input_tokens_seen": 28295253472,
      "step": 35964
    },
    {
      "epoch": 3.8155102906853386,
      "grad_norm": 0.44688983347057004,
      "learning_rate": 3.857114309624113e-05,
      "loss": 1.3596,
      "num_input_tokens_seen": 28296040192,
      "step": 35965
    },
    {
      "epoch": 3.8156163802249097,
      "grad_norm": 0.5842468304064999,
      "learning_rate": 3.857055943364026e-05,
      "loss": 1.6712,
      "num_input_tokens_seen": 28296826896,
      "step": 35966
    },
    {
      "epoch": 3.815722469764481,
      "grad_norm": 0.4258783509399183,
      "learning_rate": 3.856997576055246e-05,
      "loss": 1.3748,
      "num_input_tokens_seen": 28297613712,
      "step": 35967
    },
    {
      "epoch": 3.8158285593040526,
      "grad_norm": 0.5566980041803552,
      "learning_rate": 3.856939207697819e-05,
      "loss": 1.3493,
      "num_input_tokens_seen": 28298400480,
      "step": 35968
    },
    {
      "epoch": 3.815934648843624,
      "grad_norm": 0.46709406934151654,
      "learning_rate": 3.856880838291787e-05,
      "loss": 1.5057,
      "num_input_tokens_seen": 28299187200,
      "step": 35969
    },
    {
      "epoch": 3.8160407383831956,
      "grad_norm": 0.5306691778307658,
      "learning_rate": 3.856822467837199e-05,
      "loss": 1.4098,
      "num_input_tokens_seen": 28299974080,
      "step": 35970
    },
    {
      "epoch": 3.8161468279227666,
      "grad_norm": 0.43910029055714067,
      "learning_rate": 3.856764096334098e-05,
      "loss": 1.4172,
      "num_input_tokens_seen": 28300760912,
      "step": 35971
    },
    {
      "epoch": 3.816252917462338,
      "grad_norm": 0.42310806560889297,
      "learning_rate": 3.856705723782529e-05,
      "loss": 1.453,
      "num_input_tokens_seen": 28301547616,
      "step": 35972
    },
    {
      "epoch": 3.8163590070019096,
      "grad_norm": 0.4288051422968356,
      "learning_rate": 3.8566473501825385e-05,
      "loss": 1.3773,
      "num_input_tokens_seen": 28302334400,
      "step": 35973
    },
    {
      "epoch": 3.816465096541481,
      "grad_norm": 0.47470206884897853,
      "learning_rate": 3.85658897553417e-05,
      "loss": 1.4955,
      "num_input_tokens_seen": 28303121104,
      "step": 35974
    },
    {
      "epoch": 3.8165711860810525,
      "grad_norm": 0.4549900651448508,
      "learning_rate": 3.85653059983747e-05,
      "loss": 1.493,
      "num_input_tokens_seen": 28303907840,
      "step": 35975
    },
    {
      "epoch": 3.8166772756206235,
      "grad_norm": 0.5610453418733559,
      "learning_rate": 3.8564722230924824e-05,
      "loss": 1.4245,
      "num_input_tokens_seen": 28304694544,
      "step": 35976
    },
    {
      "epoch": 3.8167833651601955,
      "grad_norm": 0.5651186352765258,
      "learning_rate": 3.8564138452992525e-05,
      "loss": 1.5077,
      "num_input_tokens_seen": 28305481264,
      "step": 35977
    },
    {
      "epoch": 3.8168894546997665,
      "grad_norm": 0.6308209807428786,
      "learning_rate": 3.8563554664578275e-05,
      "loss": 1.4863,
      "num_input_tokens_seen": 28306268048,
      "step": 35978
    },
    {
      "epoch": 3.816995544239338,
      "grad_norm": 0.5072277833456165,
      "learning_rate": 3.856297086568249e-05,
      "loss": 1.3647,
      "num_input_tokens_seen": 28307054784,
      "step": 35979
    },
    {
      "epoch": 3.8171016337789094,
      "grad_norm": 0.43799150340035353,
      "learning_rate": 3.856238705630564e-05,
      "loss": 1.4261,
      "num_input_tokens_seen": 28307841424,
      "step": 35980
    },
    {
      "epoch": 3.817207723318481,
      "grad_norm": 0.5533338428395269,
      "learning_rate": 3.8561803236448186e-05,
      "loss": 1.3929,
      "num_input_tokens_seen": 28308628304,
      "step": 35981
    },
    {
      "epoch": 3.8173138128580524,
      "grad_norm": 0.5827472657088278,
      "learning_rate": 3.856121940611056e-05,
      "loss": 1.383,
      "num_input_tokens_seen": 28309415136,
      "step": 35982
    },
    {
      "epoch": 3.8174199023976234,
      "grad_norm": 0.5667760182373461,
      "learning_rate": 3.856063556529322e-05,
      "loss": 1.4617,
      "num_input_tokens_seen": 28310201888,
      "step": 35983
    },
    {
      "epoch": 3.817525991937195,
      "grad_norm": 0.5910117000049729,
      "learning_rate": 3.8560051713996634e-05,
      "loss": 1.5855,
      "num_input_tokens_seen": 28310988672,
      "step": 35984
    },
    {
      "epoch": 3.8176320814767664,
      "grad_norm": 0.3673890218244482,
      "learning_rate": 3.8559467852221226e-05,
      "loss": 1.41,
      "num_input_tokens_seen": 28311775472,
      "step": 35985
    },
    {
      "epoch": 3.817738171016338,
      "grad_norm": 0.6744895398283782,
      "learning_rate": 3.855888397996746e-05,
      "loss": 1.5319,
      "num_input_tokens_seen": 28312562304,
      "step": 35986
    },
    {
      "epoch": 3.8178442605559093,
      "grad_norm": 0.4485667744807711,
      "learning_rate": 3.855830009723579e-05,
      "loss": 1.4856,
      "num_input_tokens_seen": 28313349008,
      "step": 35987
    },
    {
      "epoch": 3.8179503500954803,
      "grad_norm": 0.49226399191138576,
      "learning_rate": 3.855771620402666e-05,
      "loss": 1.437,
      "num_input_tokens_seen": 28314135728,
      "step": 35988
    },
    {
      "epoch": 3.8180564396350523,
      "grad_norm": 0.6491908982488049,
      "learning_rate": 3.8557132300340514e-05,
      "loss": 1.4413,
      "num_input_tokens_seen": 28314922496,
      "step": 35989
    },
    {
      "epoch": 3.8181625291746233,
      "grad_norm": 0.441512697161073,
      "learning_rate": 3.8556548386177825e-05,
      "loss": 1.4921,
      "num_input_tokens_seen": 28315709200,
      "step": 35990
    },
    {
      "epoch": 3.8182686187141948,
      "grad_norm": 0.6340344390413492,
      "learning_rate": 3.855596446153904e-05,
      "loss": 1.4524,
      "num_input_tokens_seen": 28316495952,
      "step": 35991
    },
    {
      "epoch": 3.8183747082537662,
      "grad_norm": 0.5198872847187201,
      "learning_rate": 3.855538052642459e-05,
      "loss": 1.4798,
      "num_input_tokens_seen": 28317282608,
      "step": 35992
    },
    {
      "epoch": 3.8184807977933377,
      "grad_norm": 0.49638048912094507,
      "learning_rate": 3.855479658083495e-05,
      "loss": 1.35,
      "num_input_tokens_seen": 28318069376,
      "step": 35993
    },
    {
      "epoch": 3.818586887332909,
      "grad_norm": 0.5976533637924398,
      "learning_rate": 3.855421262477056e-05,
      "loss": 1.436,
      "num_input_tokens_seen": 28318856176,
      "step": 35994
    },
    {
      "epoch": 3.81869297687248,
      "grad_norm": 0.49727786904323706,
      "learning_rate": 3.8553628658231864e-05,
      "loss": 1.3921,
      "num_input_tokens_seen": 28319643024,
      "step": 35995
    },
    {
      "epoch": 3.8187990664120517,
      "grad_norm": 0.5082386984879549,
      "learning_rate": 3.855304468121933e-05,
      "loss": 1.4202,
      "num_input_tokens_seen": 28320429888,
      "step": 35996
    },
    {
      "epoch": 3.818905155951623,
      "grad_norm": 0.6072011066678298,
      "learning_rate": 3.855246069373339e-05,
      "loss": 1.378,
      "num_input_tokens_seen": 28321216544,
      "step": 35997
    },
    {
      "epoch": 3.8190112454911946,
      "grad_norm": 0.5228184113777878,
      "learning_rate": 3.855187669577452e-05,
      "loss": 1.5894,
      "num_input_tokens_seen": 28322003408,
      "step": 35998
    },
    {
      "epoch": 3.819117335030766,
      "grad_norm": 0.6283678780394881,
      "learning_rate": 3.855129268734315e-05,
      "loss": 1.3987,
      "num_input_tokens_seen": 28322790208,
      "step": 35999
    },
    {
      "epoch": 3.819223424570337,
      "grad_norm": 0.5452524166266228,
      "learning_rate": 3.855070866843974e-05,
      "loss": 1.5052,
      "num_input_tokens_seen": 28323576960,
      "step": 36000
    },
    {
      "epoch": 3.819223424570337,
      "eval_loss": 1.5862998962402344,
      "eval_runtime": 65.0547,
      "eval_samples_per_second": 46.115,
      "eval_steps_per_second": 0.492,
      "num_input_tokens_seen": 28323576960,
      "step": 36000
    },
    {
      "epoch": 3.8193295141099086,
      "grad_norm": 0.4796821212232231,
      "learning_rate": 3.8550124639064744e-05,
      "loss": 1.5033,
      "num_input_tokens_seen": 28324363760,
      "step": 36001
    },
    {
      "epoch": 3.81943560364948,
      "grad_norm": 0.617683401946548,
      "learning_rate": 3.85495405992186e-05,
      "loss": 1.4459,
      "num_input_tokens_seen": 28325150576,
      "step": 36002
    },
    {
      "epoch": 3.8195416931890516,
      "grad_norm": 0.4757699534854157,
      "learning_rate": 3.854895654890177e-05,
      "loss": 1.4785,
      "num_input_tokens_seen": 28325937424,
      "step": 36003
    },
    {
      "epoch": 3.819647782728623,
      "grad_norm": 0.5431284147481014,
      "learning_rate": 3.854837248811471e-05,
      "loss": 1.4221,
      "num_input_tokens_seen": 28326724128,
      "step": 36004
    },
    {
      "epoch": 3.8197538722681945,
      "grad_norm": 0.46984973692094906,
      "learning_rate": 3.8547788416857864e-05,
      "loss": 1.3578,
      "num_input_tokens_seen": 28327510992,
      "step": 36005
    },
    {
      "epoch": 3.819859961807766,
      "grad_norm": 0.40443986102404084,
      "learning_rate": 3.854720433513168e-05,
      "loss": 1.4233,
      "num_input_tokens_seen": 28328297728,
      "step": 36006
    },
    {
      "epoch": 3.819966051347337,
      "grad_norm": 0.5652478264609889,
      "learning_rate": 3.854662024293662e-05,
      "loss": 1.3807,
      "num_input_tokens_seen": 28329084592,
      "step": 36007
    },
    {
      "epoch": 3.8200721408869085,
      "grad_norm": 0.5293879984309795,
      "learning_rate": 3.854603614027312e-05,
      "loss": 1.4509,
      "num_input_tokens_seen": 28329871296,
      "step": 36008
    },
    {
      "epoch": 3.82017823042648,
      "grad_norm": 0.5320361400712742,
      "learning_rate": 3.8545452027141654e-05,
      "loss": 1.5606,
      "num_input_tokens_seen": 28330657968,
      "step": 36009
    },
    {
      "epoch": 3.8202843199660514,
      "grad_norm": 0.49574441874692343,
      "learning_rate": 3.8544867903542656e-05,
      "loss": 1.4423,
      "num_input_tokens_seen": 28331444704,
      "step": 36010
    },
    {
      "epoch": 3.820390409505623,
      "grad_norm": 0.47744471628322516,
      "learning_rate": 3.8544283769476574e-05,
      "loss": 1.4124,
      "num_input_tokens_seen": 28332231520,
      "step": 36011
    },
    {
      "epoch": 3.820496499045194,
      "grad_norm": 0.4194876178552952,
      "learning_rate": 3.8543699624943875e-05,
      "loss": 1.451,
      "num_input_tokens_seen": 28333018336,
      "step": 36012
    },
    {
      "epoch": 3.8206025885847654,
      "grad_norm": 0.5071208639756895,
      "learning_rate": 3.8543115469944994e-05,
      "loss": 1.3905,
      "num_input_tokens_seen": 28333805152,
      "step": 36013
    },
    {
      "epoch": 3.820708678124337,
      "grad_norm": 0.5073713138877055,
      "learning_rate": 3.85425313044804e-05,
      "loss": 1.5018,
      "num_input_tokens_seen": 28334591840,
      "step": 36014
    },
    {
      "epoch": 3.8208147676639084,
      "grad_norm": 0.4440623486525513,
      "learning_rate": 3.854194712855053e-05,
      "loss": 1.4268,
      "num_input_tokens_seen": 28335378624,
      "step": 36015
    },
    {
      "epoch": 3.82092085720348,
      "grad_norm": 0.5002177337194103,
      "learning_rate": 3.8541362942155844e-05,
      "loss": 1.4373,
      "num_input_tokens_seen": 28336165392,
      "step": 36016
    },
    {
      "epoch": 3.821026946743051,
      "grad_norm": 0.5324126948275594,
      "learning_rate": 3.854077874529679e-05,
      "loss": 1.5344,
      "num_input_tokens_seen": 28336952064,
      "step": 36017
    },
    {
      "epoch": 3.821133036282623,
      "grad_norm": 0.5715075738763041,
      "learning_rate": 3.854019453797382e-05,
      "loss": 1.4187,
      "num_input_tokens_seen": 28337738848,
      "step": 36018
    },
    {
      "epoch": 3.821239125822194,
      "grad_norm": 0.569543125754462,
      "learning_rate": 3.853961032018737e-05,
      "loss": 1.3827,
      "num_input_tokens_seen": 28338525664,
      "step": 36019
    },
    {
      "epoch": 3.8213452153617653,
      "grad_norm": 0.6798251722446909,
      "learning_rate": 3.853902609193792e-05,
      "loss": 1.5791,
      "num_input_tokens_seen": 28339312384,
      "step": 36020
    },
    {
      "epoch": 3.8214513049013368,
      "grad_norm": 0.44506172292408425,
      "learning_rate": 3.853844185322591e-05,
      "loss": 1.3699,
      "num_input_tokens_seen": 28340099168,
      "step": 36021
    },
    {
      "epoch": 3.8215573944409083,
      "grad_norm": 0.480617273989896,
      "learning_rate": 3.853785760405179e-05,
      "loss": 1.5455,
      "num_input_tokens_seen": 28340885920,
      "step": 36022
    },
    {
      "epoch": 3.8216634839804797,
      "grad_norm": 0.5614529753873098,
      "learning_rate": 3.8537273344416004e-05,
      "loss": 1.5343,
      "num_input_tokens_seen": 28341672640,
      "step": 36023
    },
    {
      "epoch": 3.8217695735200508,
      "grad_norm": 0.5782397530229396,
      "learning_rate": 3.853668907431901e-05,
      "loss": 1.4199,
      "num_input_tokens_seen": 28342459376,
      "step": 36024
    },
    {
      "epoch": 3.8218756630596222,
      "grad_norm": 0.45817851242715507,
      "learning_rate": 3.8536104793761266e-05,
      "loss": 1.4594,
      "num_input_tokens_seen": 28343246112,
      "step": 36025
    },
    {
      "epoch": 3.8219817525991937,
      "grad_norm": 0.47378258495072706,
      "learning_rate": 3.853552050274322e-05,
      "loss": 1.4722,
      "num_input_tokens_seen": 28344032944,
      "step": 36026
    },
    {
      "epoch": 3.822087842138765,
      "grad_norm": 0.44880136909194096,
      "learning_rate": 3.853493620126531e-05,
      "loss": 1.4059,
      "num_input_tokens_seen": 28344819632,
      "step": 36027
    },
    {
      "epoch": 3.8221939316783367,
      "grad_norm": 0.5517275445818396,
      "learning_rate": 3.8534351889328e-05,
      "loss": 1.4887,
      "num_input_tokens_seen": 28345606384,
      "step": 36028
    },
    {
      "epoch": 3.8223000212179077,
      "grad_norm": 0.5113882585870175,
      "learning_rate": 3.8533767566931745e-05,
      "loss": 1.4546,
      "num_input_tokens_seen": 28346393120,
      "step": 36029
    },
    {
      "epoch": 3.822406110757479,
      "grad_norm": 0.47364514028534804,
      "learning_rate": 3.853318323407699e-05,
      "loss": 1.48,
      "num_input_tokens_seen": 28347179888,
      "step": 36030
    },
    {
      "epoch": 3.8225122002970506,
      "grad_norm": 0.40598974757491324,
      "learning_rate": 3.853259889076419e-05,
      "loss": 1.3682,
      "num_input_tokens_seen": 28347966656,
      "step": 36031
    },
    {
      "epoch": 3.822618289836622,
      "grad_norm": 0.5124211585970164,
      "learning_rate": 3.853201453699379e-05,
      "loss": 1.629,
      "num_input_tokens_seen": 28348753392,
      "step": 36032
    },
    {
      "epoch": 3.8227243793761936,
      "grad_norm": 0.4354073873872247,
      "learning_rate": 3.8531430172766244e-05,
      "loss": 1.4874,
      "num_input_tokens_seen": 28349540192,
      "step": 36033
    },
    {
      "epoch": 3.822830468915765,
      "grad_norm": 0.5069826178446614,
      "learning_rate": 3.8530845798082016e-05,
      "loss": 1.4599,
      "num_input_tokens_seen": 28350326976,
      "step": 36034
    },
    {
      "epoch": 3.8229365584553365,
      "grad_norm": 0.5156397135642973,
      "learning_rate": 3.853026141294155e-05,
      "loss": 1.4546,
      "num_input_tokens_seen": 28351113664,
      "step": 36035
    },
    {
      "epoch": 3.8230426479949076,
      "grad_norm": 0.4646293328755922,
      "learning_rate": 3.852967701734528e-05,
      "loss": 1.3373,
      "num_input_tokens_seen": 28351900480,
      "step": 36036
    },
    {
      "epoch": 3.823148737534479,
      "grad_norm": 0.45627603571272407,
      "learning_rate": 3.8529092611293685e-05,
      "loss": 1.38,
      "num_input_tokens_seen": 28352687360,
      "step": 36037
    },
    {
      "epoch": 3.8232548270740505,
      "grad_norm": 0.486887063950717,
      "learning_rate": 3.85285081947872e-05,
      "loss": 1.4866,
      "num_input_tokens_seen": 28353474128,
      "step": 36038
    },
    {
      "epoch": 3.823360916613622,
      "grad_norm": 0.4209595826365021,
      "learning_rate": 3.852792376782627e-05,
      "loss": 1.3436,
      "num_input_tokens_seen": 28354260944,
      "step": 36039
    },
    {
      "epoch": 3.8234670061531935,
      "grad_norm": 0.5965301430112838,
      "learning_rate": 3.852733933041137e-05,
      "loss": 1.5412,
      "num_input_tokens_seen": 28355047680,
      "step": 36040
    },
    {
      "epoch": 3.8235730956927645,
      "grad_norm": 0.4919558639788914,
      "learning_rate": 3.852675488254294e-05,
      "loss": 1.4674,
      "num_input_tokens_seen": 28355834384,
      "step": 36041
    },
    {
      "epoch": 3.823679185232336,
      "grad_norm": 0.4420055337129687,
      "learning_rate": 3.852617042422142e-05,
      "loss": 1.4684,
      "num_input_tokens_seen": 28356621168,
      "step": 36042
    },
    {
      "epoch": 3.8237852747719074,
      "grad_norm": 0.5126020845289073,
      "learning_rate": 3.8525585955447284e-05,
      "loss": 1.469,
      "num_input_tokens_seen": 28357407952,
      "step": 36043
    },
    {
      "epoch": 3.823891364311479,
      "grad_norm": 0.47843129794958095,
      "learning_rate": 3.852500147622097e-05,
      "loss": 1.4886,
      "num_input_tokens_seen": 28358194688,
      "step": 36044
    },
    {
      "epoch": 3.8239974538510504,
      "grad_norm": 0.6153530012324323,
      "learning_rate": 3.852441698654293e-05,
      "loss": 1.465,
      "num_input_tokens_seen": 28358981408,
      "step": 36045
    },
    {
      "epoch": 3.8241035433906214,
      "grad_norm": 0.3919119291840692,
      "learning_rate": 3.8523832486413616e-05,
      "loss": 1.3752,
      "num_input_tokens_seen": 28359768224,
      "step": 36046
    },
    {
      "epoch": 3.8242096329301933,
      "grad_norm": 0.41779417971370486,
      "learning_rate": 3.8523247975833474e-05,
      "loss": 1.4393,
      "num_input_tokens_seen": 28360554960,
      "step": 36047
    },
    {
      "epoch": 3.8243157224697644,
      "grad_norm": 0.4517719499415219,
      "learning_rate": 3.852266345480298e-05,
      "loss": 1.3931,
      "num_input_tokens_seen": 28361341792,
      "step": 36048
    },
    {
      "epoch": 3.824421812009336,
      "grad_norm": 0.4681785365274536,
      "learning_rate": 3.852207892332255e-05,
      "loss": 1.4571,
      "num_input_tokens_seen": 28362128672,
      "step": 36049
    },
    {
      "epoch": 3.8245279015489073,
      "grad_norm": 0.5063976374149534,
      "learning_rate": 3.852149438139266e-05,
      "loss": 1.5005,
      "num_input_tokens_seen": 28362915456,
      "step": 36050
    },
    {
      "epoch": 3.824633991088479,
      "grad_norm": 0.8438963748543238,
      "learning_rate": 3.852090982901376e-05,
      "loss": 1.46,
      "num_input_tokens_seen": 28363702192,
      "step": 36051
    },
    {
      "epoch": 3.8247400806280503,
      "grad_norm": 0.3963359591631753,
      "learning_rate": 3.8520325266186303e-05,
      "loss": 1.3585,
      "num_input_tokens_seen": 28364489024,
      "step": 36052
    },
    {
      "epoch": 3.8248461701676213,
      "grad_norm": 0.5871811475515137,
      "learning_rate": 3.8519740692910735e-05,
      "loss": 1.4543,
      "num_input_tokens_seen": 28365275744,
      "step": 36053
    },
    {
      "epoch": 3.8249522597071928,
      "grad_norm": 0.6658741199909972,
      "learning_rate": 3.8519156109187495e-05,
      "loss": 1.4041,
      "num_input_tokens_seen": 28366062496,
      "step": 36054
    },
    {
      "epoch": 3.8250583492467642,
      "grad_norm": 0.39992721847608587,
      "learning_rate": 3.8518571515017053e-05,
      "loss": 1.4043,
      "num_input_tokens_seen": 28366849312,
      "step": 36055
    },
    {
      "epoch": 3.8251644387863357,
      "grad_norm": 0.5688915283084369,
      "learning_rate": 3.851798691039986e-05,
      "loss": 1.4446,
      "num_input_tokens_seen": 28367636048,
      "step": 36056
    },
    {
      "epoch": 3.825270528325907,
      "grad_norm": 0.6355301209737173,
      "learning_rate": 3.8517402295336364e-05,
      "loss": 1.3581,
      "num_input_tokens_seen": 28368422848,
      "step": 36057
    },
    {
      "epoch": 3.8253766178654782,
      "grad_norm": 0.4480863130955285,
      "learning_rate": 3.851681766982701e-05,
      "loss": 1.4161,
      "num_input_tokens_seen": 28369209568,
      "step": 36058
    },
    {
      "epoch": 3.8254827074050497,
      "grad_norm": 0.48631054447671346,
      "learning_rate": 3.8516233033872264e-05,
      "loss": 1.4878,
      "num_input_tokens_seen": 28369996288,
      "step": 36059
    },
    {
      "epoch": 3.825588796944621,
      "grad_norm": 0.5187028588518284,
      "learning_rate": 3.851564838747256e-05,
      "loss": 1.5686,
      "num_input_tokens_seen": 28370783008,
      "step": 36060
    },
    {
      "epoch": 3.8256948864841926,
      "grad_norm": 0.42229553702915684,
      "learning_rate": 3.8515063730628366e-05,
      "loss": 1.3648,
      "num_input_tokens_seen": 28371569728,
      "step": 36061
    },
    {
      "epoch": 3.825800976023764,
      "grad_norm": 0.5974270375881238,
      "learning_rate": 3.851447906334012e-05,
      "loss": 1.3863,
      "num_input_tokens_seen": 28372356384,
      "step": 36062
    },
    {
      "epoch": 3.8259070655633356,
      "grad_norm": 0.4811265369340656,
      "learning_rate": 3.851389438560829e-05,
      "loss": 1.3744,
      "num_input_tokens_seen": 28373143168,
      "step": 36063
    },
    {
      "epoch": 3.826013155102907,
      "grad_norm": 0.4886929777031564,
      "learning_rate": 3.851330969743332e-05,
      "loss": 1.5494,
      "num_input_tokens_seen": 28373929904,
      "step": 36064
    },
    {
      "epoch": 3.826119244642478,
      "grad_norm": 0.6076414075580118,
      "learning_rate": 3.8512724998815655e-05,
      "loss": 1.3721,
      "num_input_tokens_seen": 28374716656,
      "step": 36065
    },
    {
      "epoch": 3.8262253341820496,
      "grad_norm": 0.5873745281581764,
      "learning_rate": 3.851214028975575e-05,
      "loss": 1.5031,
      "num_input_tokens_seen": 28375503312,
      "step": 36066
    },
    {
      "epoch": 3.826331423721621,
      "grad_norm": 0.7422404899695118,
      "learning_rate": 3.8511555570254065e-05,
      "loss": 1.4009,
      "num_input_tokens_seen": 28376290176,
      "step": 36067
    },
    {
      "epoch": 3.8264375132611925,
      "grad_norm": 0.5613417451263418,
      "learning_rate": 3.8510970840311045e-05,
      "loss": 1.4508,
      "num_input_tokens_seen": 28377076960,
      "step": 36068
    },
    {
      "epoch": 3.826543602800764,
      "grad_norm": 0.46539335010432914,
      "learning_rate": 3.8510386099927145e-05,
      "loss": 1.4348,
      "num_input_tokens_seen": 28377863744,
      "step": 36069
    },
    {
      "epoch": 3.826649692340335,
      "grad_norm": 0.7132358220919843,
      "learning_rate": 3.850980134910281e-05,
      "loss": 1.4871,
      "num_input_tokens_seen": 28378650528,
      "step": 36070
    },
    {
      "epoch": 3.8267557818799065,
      "grad_norm": 0.4114187264975173,
      "learning_rate": 3.85092165878385e-05,
      "loss": 1.5149,
      "num_input_tokens_seen": 28379437296,
      "step": 36071
    },
    {
      "epoch": 3.826861871419478,
      "grad_norm": 0.4847473885202901,
      "learning_rate": 3.850863181613466e-05,
      "loss": 1.4429,
      "num_input_tokens_seen": 28380224080,
      "step": 36072
    },
    {
      "epoch": 3.8269679609590495,
      "grad_norm": 0.5278540925538644,
      "learning_rate": 3.850804703399175e-05,
      "loss": 1.4925,
      "num_input_tokens_seen": 28381010800,
      "step": 36073
    },
    {
      "epoch": 3.827074050498621,
      "grad_norm": 0.36807556301675837,
      "learning_rate": 3.850746224141022e-05,
      "loss": 1.3871,
      "num_input_tokens_seen": 28381797584,
      "step": 36074
    },
    {
      "epoch": 3.827180140038192,
      "grad_norm": 0.546665780817942,
      "learning_rate": 3.8506877438390514e-05,
      "loss": 1.4765,
      "num_input_tokens_seen": 28382584384,
      "step": 36075
    },
    {
      "epoch": 3.827286229577764,
      "grad_norm": 0.46266841909617423,
      "learning_rate": 3.8506292624933094e-05,
      "loss": 1.5284,
      "num_input_tokens_seen": 28383371168,
      "step": 36076
    },
    {
      "epoch": 3.827392319117335,
      "grad_norm": 0.4664387359880029,
      "learning_rate": 3.8505707801038406e-05,
      "loss": 1.5624,
      "num_input_tokens_seen": 28384157952,
      "step": 36077
    },
    {
      "epoch": 3.8274984086569064,
      "grad_norm": 0.5675952141540153,
      "learning_rate": 3.85051229667069e-05,
      "loss": 1.4512,
      "num_input_tokens_seen": 28384944624,
      "step": 36078
    },
    {
      "epoch": 3.827604498196478,
      "grad_norm": 0.42395130351511134,
      "learning_rate": 3.850453812193904e-05,
      "loss": 1.4944,
      "num_input_tokens_seen": 28385731376,
      "step": 36079
    },
    {
      "epoch": 3.8277105877360493,
      "grad_norm": 0.49781840546079564,
      "learning_rate": 3.8503953266735257e-05,
      "loss": 1.4952,
      "num_input_tokens_seen": 28386518144,
      "step": 36080
    },
    {
      "epoch": 3.827816677275621,
      "grad_norm": 0.4345837569044137,
      "learning_rate": 3.850336840109602e-05,
      "loss": 1.4103,
      "num_input_tokens_seen": 28387304896,
      "step": 36081
    },
    {
      "epoch": 3.827922766815192,
      "grad_norm": 0.39237169267529404,
      "learning_rate": 3.850278352502178e-05,
      "loss": 1.4344,
      "num_input_tokens_seen": 28388091600,
      "step": 36082
    },
    {
      "epoch": 3.8280288563547633,
      "grad_norm": 0.4792952744962607,
      "learning_rate": 3.850219863851298e-05,
      "loss": 1.4529,
      "num_input_tokens_seen": 28388878416,
      "step": 36083
    },
    {
      "epoch": 3.828134945894335,
      "grad_norm": 0.43077016554751163,
      "learning_rate": 3.8501613741570074e-05,
      "loss": 1.4275,
      "num_input_tokens_seen": 28389665152,
      "step": 36084
    },
    {
      "epoch": 3.8282410354339063,
      "grad_norm": 0.49681534755543155,
      "learning_rate": 3.8501028834193526e-05,
      "loss": 1.424,
      "num_input_tokens_seen": 28390451936,
      "step": 36085
    },
    {
      "epoch": 3.8283471249734777,
      "grad_norm": 0.4250412333106939,
      "learning_rate": 3.850044391638377e-05,
      "loss": 1.3936,
      "num_input_tokens_seen": 28391238656,
      "step": 36086
    },
    {
      "epoch": 3.8284532145130488,
      "grad_norm": 0.4453826654075395,
      "learning_rate": 3.8499858988141276e-05,
      "loss": 1.4435,
      "num_input_tokens_seen": 28392025424,
      "step": 36087
    },
    {
      "epoch": 3.8285593040526207,
      "grad_norm": 0.4407554759723493,
      "learning_rate": 3.849927404946648e-05,
      "loss": 1.4865,
      "num_input_tokens_seen": 28392812128,
      "step": 36088
    },
    {
      "epoch": 3.8286653935921917,
      "grad_norm": 0.4741544470792299,
      "learning_rate": 3.8498689100359846e-05,
      "loss": 1.5526,
      "num_input_tokens_seen": 28393598848,
      "step": 36089
    },
    {
      "epoch": 3.828771483131763,
      "grad_norm": 0.4161849303448908,
      "learning_rate": 3.8498104140821824e-05,
      "loss": 1.4626,
      "num_input_tokens_seen": 28394385680,
      "step": 36090
    },
    {
      "epoch": 3.8288775726713347,
      "grad_norm": 0.47241745139215074,
      "learning_rate": 3.849751917085286e-05,
      "loss": 1.5222,
      "num_input_tokens_seen": 28395172384,
      "step": 36091
    },
    {
      "epoch": 3.828983662210906,
      "grad_norm": 0.37844227291354127,
      "learning_rate": 3.849693419045341e-05,
      "loss": 1.3917,
      "num_input_tokens_seen": 28395959200,
      "step": 36092
    },
    {
      "epoch": 3.8290897517504776,
      "grad_norm": 0.46110888157710206,
      "learning_rate": 3.8496349199623914e-05,
      "loss": 1.501,
      "num_input_tokens_seen": 28396746080,
      "step": 36093
    },
    {
      "epoch": 3.8291958412900486,
      "grad_norm": 0.3982476311679891,
      "learning_rate": 3.849576419836485e-05,
      "loss": 1.3408,
      "num_input_tokens_seen": 28397532848,
      "step": 36094
    },
    {
      "epoch": 3.82930193082962,
      "grad_norm": 0.4415020924498161,
      "learning_rate": 3.849517918667664e-05,
      "loss": 1.4897,
      "num_input_tokens_seen": 28398319632,
      "step": 36095
    },
    {
      "epoch": 3.8294080203691916,
      "grad_norm": 0.4030664183007768,
      "learning_rate": 3.849459416455977e-05,
      "loss": 1.4329,
      "num_input_tokens_seen": 28399106336,
      "step": 36096
    },
    {
      "epoch": 3.829514109908763,
      "grad_norm": 0.42444727804180654,
      "learning_rate": 3.8494009132014665e-05,
      "loss": 1.4044,
      "num_input_tokens_seen": 28399893168,
      "step": 36097
    },
    {
      "epoch": 3.8296201994483345,
      "grad_norm": 0.42454967020863,
      "learning_rate": 3.849342408904178e-05,
      "loss": 1.4278,
      "num_input_tokens_seen": 28400679808,
      "step": 36098
    },
    {
      "epoch": 3.8297262889879056,
      "grad_norm": 0.39421721590553294,
      "learning_rate": 3.8492839035641586e-05,
      "loss": 1.4973,
      "num_input_tokens_seen": 28401466544,
      "step": 36099
    },
    {
      "epoch": 3.829832378527477,
      "grad_norm": 0.48225468842762975,
      "learning_rate": 3.849225397181451e-05,
      "loss": 1.4002,
      "num_input_tokens_seen": 28402253376,
      "step": 36100
    },
    {
      "epoch": 3.8299384680670485,
      "grad_norm": 0.42450732704827876,
      "learning_rate": 3.8491668897561026e-05,
      "loss": 1.456,
      "num_input_tokens_seen": 28403040224,
      "step": 36101
    },
    {
      "epoch": 3.83004455760662,
      "grad_norm": 0.47089829106978776,
      "learning_rate": 3.849108381288157e-05,
      "loss": 1.4475,
      "num_input_tokens_seen": 28403827024,
      "step": 36102
    },
    {
      "epoch": 3.8301506471461915,
      "grad_norm": 0.42526521375694243,
      "learning_rate": 3.84904987177766e-05,
      "loss": 1.37,
      "num_input_tokens_seen": 28404613856,
      "step": 36103
    },
    {
      "epoch": 3.830256736685763,
      "grad_norm": 0.4408921047862381,
      "learning_rate": 3.848991361224657e-05,
      "loss": 1.4444,
      "num_input_tokens_seen": 28405400592,
      "step": 36104
    },
    {
      "epoch": 3.8303628262253344,
      "grad_norm": 0.4835577731070783,
      "learning_rate": 3.848932849629193e-05,
      "loss": 1.4501,
      "num_input_tokens_seen": 28406187280,
      "step": 36105
    },
    {
      "epoch": 3.8304689157649054,
      "grad_norm": 0.41294702261581595,
      "learning_rate": 3.848874336991313e-05,
      "loss": 1.3866,
      "num_input_tokens_seen": 28406974064,
      "step": 36106
    },
    {
      "epoch": 3.830575005304477,
      "grad_norm": 0.5076886743376177,
      "learning_rate": 3.848815823311063e-05,
      "loss": 1.5365,
      "num_input_tokens_seen": 28407760784,
      "step": 36107
    },
    {
      "epoch": 3.8306810948440484,
      "grad_norm": 0.45256865302837107,
      "learning_rate": 3.848757308588488e-05,
      "loss": 1.4514,
      "num_input_tokens_seen": 28408547568,
      "step": 36108
    },
    {
      "epoch": 3.83078718438362,
      "grad_norm": 0.4422209662787308,
      "learning_rate": 3.848698792823632e-05,
      "loss": 1.3602,
      "num_input_tokens_seen": 28409334448,
      "step": 36109
    },
    {
      "epoch": 3.8308932739231913,
      "grad_norm": 0.4985369288824009,
      "learning_rate": 3.848640276016542e-05,
      "loss": 1.418,
      "num_input_tokens_seen": 28410121248,
      "step": 36110
    },
    {
      "epoch": 3.8309993634627624,
      "grad_norm": 0.5334618028639813,
      "learning_rate": 3.848581758167261e-05,
      "loss": 1.4916,
      "num_input_tokens_seen": 28410908000,
      "step": 36111
    },
    {
      "epoch": 3.831105453002334,
      "grad_norm": 0.417583509769734,
      "learning_rate": 3.8485232392758366e-05,
      "loss": 1.3331,
      "num_input_tokens_seen": 28411694816,
      "step": 36112
    },
    {
      "epoch": 3.8312115425419053,
      "grad_norm": 0.607795708755952,
      "learning_rate": 3.8484647193423134e-05,
      "loss": 1.4823,
      "num_input_tokens_seen": 28412481488,
      "step": 36113
    },
    {
      "epoch": 3.831317632081477,
      "grad_norm": 0.39102018362566665,
      "learning_rate": 3.848406198366735e-05,
      "loss": 1.3701,
      "num_input_tokens_seen": 28413268304,
      "step": 36114
    },
    {
      "epoch": 3.8314237216210483,
      "grad_norm": 0.4470494103146269,
      "learning_rate": 3.8483476763491497e-05,
      "loss": 1.5267,
      "num_input_tokens_seen": 28414055056,
      "step": 36115
    },
    {
      "epoch": 3.8315298111606193,
      "grad_norm": 0.4626334299609441,
      "learning_rate": 3.848289153289599e-05,
      "loss": 1.532,
      "num_input_tokens_seen": 28414841808,
      "step": 36116
    },
    {
      "epoch": 3.831635900700191,
      "grad_norm": 0.42487795474067347,
      "learning_rate": 3.848230629188131e-05,
      "loss": 1.4843,
      "num_input_tokens_seen": 28415628624,
      "step": 36117
    },
    {
      "epoch": 3.8317419902397623,
      "grad_norm": 0.42460988621236273,
      "learning_rate": 3.84817210404479e-05,
      "loss": 1.3794,
      "num_input_tokens_seen": 28416415376,
      "step": 36118
    },
    {
      "epoch": 3.8318480797793337,
      "grad_norm": 0.4308425032135086,
      "learning_rate": 3.848113577859621e-05,
      "loss": 1.4874,
      "num_input_tokens_seen": 28417202176,
      "step": 36119
    },
    {
      "epoch": 3.831954169318905,
      "grad_norm": 0.4571785539149948,
      "learning_rate": 3.8480550506326686e-05,
      "loss": 1.5431,
      "num_input_tokens_seen": 28417988848,
      "step": 36120
    },
    {
      "epoch": 3.8320602588584767,
      "grad_norm": 0.43626607830842395,
      "learning_rate": 3.84799652236398e-05,
      "loss": 1.4599,
      "num_input_tokens_seen": 28418775584,
      "step": 36121
    },
    {
      "epoch": 3.832166348398048,
      "grad_norm": 0.4505898989552561,
      "learning_rate": 3.847937993053599e-05,
      "loss": 1.4192,
      "num_input_tokens_seen": 28419562384,
      "step": 36122
    },
    {
      "epoch": 3.832272437937619,
      "grad_norm": 0.5156742740898719,
      "learning_rate": 3.8478794627015704e-05,
      "loss": 1.575,
      "num_input_tokens_seen": 28420349136,
      "step": 36123
    },
    {
      "epoch": 3.8323785274771907,
      "grad_norm": 0.41442982515976257,
      "learning_rate": 3.847820931307941e-05,
      "loss": 1.4202,
      "num_input_tokens_seen": 28421135888,
      "step": 36124
    },
    {
      "epoch": 3.832484617016762,
      "grad_norm": 0.4155489052740302,
      "learning_rate": 3.847762398872754e-05,
      "loss": 1.3306,
      "num_input_tokens_seen": 28421922688,
      "step": 36125
    },
    {
      "epoch": 3.8325907065563336,
      "grad_norm": 0.5333228261874489,
      "learning_rate": 3.8477038653960564e-05,
      "loss": 1.3902,
      "num_input_tokens_seen": 28422709552,
      "step": 36126
    },
    {
      "epoch": 3.832696796095905,
      "grad_norm": 0.40072593382415667,
      "learning_rate": 3.8476453308778923e-05,
      "loss": 1.3134,
      "num_input_tokens_seen": 28423496368,
      "step": 36127
    },
    {
      "epoch": 3.832802885635476,
      "grad_norm": 0.47146751711099305,
      "learning_rate": 3.847586795318308e-05,
      "loss": 1.3769,
      "num_input_tokens_seen": 28424283072,
      "step": 36128
    },
    {
      "epoch": 3.8329089751750476,
      "grad_norm": 0.6101584888057563,
      "learning_rate": 3.847528258717348e-05,
      "loss": 1.5091,
      "num_input_tokens_seen": 28425069824,
      "step": 36129
    },
    {
      "epoch": 3.833015064714619,
      "grad_norm": 0.5880513500839268,
      "learning_rate": 3.8474697210750584e-05,
      "loss": 1.3561,
      "num_input_tokens_seen": 28425856576,
      "step": 36130
    },
    {
      "epoch": 3.8331211542541905,
      "grad_norm": 0.6718597035417289,
      "learning_rate": 3.8474111823914824e-05,
      "loss": 1.4389,
      "num_input_tokens_seen": 28426643296,
      "step": 36131
    },
    {
      "epoch": 3.833227243793762,
      "grad_norm": 0.47807779521139937,
      "learning_rate": 3.847352642666667e-05,
      "loss": 1.5626,
      "num_input_tokens_seen": 28427430096,
      "step": 36132
    },
    {
      "epoch": 3.8333333333333335,
      "grad_norm": 0.7037978086173041,
      "learning_rate": 3.847294101900658e-05,
      "loss": 1.483,
      "num_input_tokens_seen": 28428216768,
      "step": 36133
    },
    {
      "epoch": 3.833439422872905,
      "grad_norm": 0.423260605720222,
      "learning_rate": 3.847235560093499e-05,
      "loss": 1.3872,
      "num_input_tokens_seen": 28429003568,
      "step": 36134
    },
    {
      "epoch": 3.833545512412476,
      "grad_norm": 0.5005800077020109,
      "learning_rate": 3.8471770172452355e-05,
      "loss": 1.3445,
      "num_input_tokens_seen": 28429790352,
      "step": 36135
    },
    {
      "epoch": 3.8336516019520475,
      "grad_norm": 0.4809934665075813,
      "learning_rate": 3.8471184733559136e-05,
      "loss": 1.4203,
      "num_input_tokens_seen": 28430577120,
      "step": 36136
    },
    {
      "epoch": 3.833757691491619,
      "grad_norm": 0.4384930101874188,
      "learning_rate": 3.847059928425578e-05,
      "loss": 1.4102,
      "num_input_tokens_seen": 28431363888,
      "step": 36137
    },
    {
      "epoch": 3.8338637810311904,
      "grad_norm": 0.45450048397652887,
      "learning_rate": 3.847001382454274e-05,
      "loss": 1.3223,
      "num_input_tokens_seen": 28432150704,
      "step": 36138
    },
    {
      "epoch": 3.833969870570762,
      "grad_norm": 0.5000150917120503,
      "learning_rate": 3.846942835442047e-05,
      "loss": 1.4232,
      "num_input_tokens_seen": 28432937504,
      "step": 36139
    },
    {
      "epoch": 3.834075960110333,
      "grad_norm": 0.4062310963554703,
      "learning_rate": 3.846884287388941e-05,
      "loss": 1.4504,
      "num_input_tokens_seen": 28433724272,
      "step": 36140
    },
    {
      "epoch": 3.8341820496499044,
      "grad_norm": 0.47680188238617227,
      "learning_rate": 3.8468257382950034e-05,
      "loss": 1.4306,
      "num_input_tokens_seen": 28434511040,
      "step": 36141
    },
    {
      "epoch": 3.834288139189476,
      "grad_norm": 0.6404730721572854,
      "learning_rate": 3.8467671881602786e-05,
      "loss": 1.5303,
      "num_input_tokens_seen": 28435297888,
      "step": 36142
    },
    {
      "epoch": 3.8343942287290473,
      "grad_norm": 0.5407692241021295,
      "learning_rate": 3.846708636984811e-05,
      "loss": 1.4212,
      "num_input_tokens_seen": 28436084736,
      "step": 36143
    },
    {
      "epoch": 3.834500318268619,
      "grad_norm": 0.614923968435115,
      "learning_rate": 3.846650084768647e-05,
      "loss": 1.4723,
      "num_input_tokens_seen": 28436871536,
      "step": 36144
    },
    {
      "epoch": 3.83460640780819,
      "grad_norm": 0.40153503532959695,
      "learning_rate": 3.8465915315118315e-05,
      "loss": 1.3666,
      "num_input_tokens_seen": 28437658304,
      "step": 36145
    },
    {
      "epoch": 3.8347124973477618,
      "grad_norm": 0.6100305177509192,
      "learning_rate": 3.8465329772144086e-05,
      "loss": 1.4446,
      "num_input_tokens_seen": 28438445088,
      "step": 36146
    },
    {
      "epoch": 3.834818586887333,
      "grad_norm": 0.5989566864293833,
      "learning_rate": 3.846474421876425e-05,
      "loss": 1.5241,
      "num_input_tokens_seen": 28439231856,
      "step": 36147
    },
    {
      "epoch": 3.8349246764269043,
      "grad_norm": 0.4884525794483805,
      "learning_rate": 3.846415865497925e-05,
      "loss": 1.4456,
      "num_input_tokens_seen": 28440018656,
      "step": 36148
    },
    {
      "epoch": 3.8350307659664757,
      "grad_norm": 0.825657153694663,
      "learning_rate": 3.846357308078955e-05,
      "loss": 1.397,
      "num_input_tokens_seen": 28440805440,
      "step": 36149
    },
    {
      "epoch": 3.835136855506047,
      "grad_norm": 0.4938950634746393,
      "learning_rate": 3.84629874961956e-05,
      "loss": 1.3529,
      "num_input_tokens_seen": 28441592224,
      "step": 36150
    },
    {
      "epoch": 3.8352429450456187,
      "grad_norm": 0.5121108299333537,
      "learning_rate": 3.846240190119784e-05,
      "loss": 1.466,
      "num_input_tokens_seen": 28442378960,
      "step": 36151
    },
    {
      "epoch": 3.8353490345851897,
      "grad_norm": 0.747437582630101,
      "learning_rate": 3.8461816295796735e-05,
      "loss": 1.4699,
      "num_input_tokens_seen": 28443165776,
      "step": 36152
    },
    {
      "epoch": 3.835455124124761,
      "grad_norm": 0.4169758694496056,
      "learning_rate": 3.846123067999273e-05,
      "loss": 1.3838,
      "num_input_tokens_seen": 28443952576,
      "step": 36153
    },
    {
      "epoch": 3.8355612136643327,
      "grad_norm": 0.6603597673583517,
      "learning_rate": 3.8460645053786286e-05,
      "loss": 1.5382,
      "num_input_tokens_seen": 28444739360,
      "step": 36154
    },
    {
      "epoch": 3.835667303203904,
      "grad_norm": 0.5292767169275127,
      "learning_rate": 3.8460059417177844e-05,
      "loss": 1.518,
      "num_input_tokens_seen": 28445526064,
      "step": 36155
    },
    {
      "epoch": 3.8357733927434756,
      "grad_norm": 0.4986870012426701,
      "learning_rate": 3.845947377016787e-05,
      "loss": 1.5442,
      "num_input_tokens_seen": 28446312800,
      "step": 36156
    },
    {
      "epoch": 3.8358794822830466,
      "grad_norm": 0.5627610570068622,
      "learning_rate": 3.84588881127568e-05,
      "loss": 1.3854,
      "num_input_tokens_seen": 28447099648,
      "step": 36157
    },
    {
      "epoch": 3.8359855718226186,
      "grad_norm": 0.4250983444519706,
      "learning_rate": 3.84583024449451e-05,
      "loss": 1.5327,
      "num_input_tokens_seen": 28447886432,
      "step": 36158
    },
    {
      "epoch": 3.8360916613621896,
      "grad_norm": 0.5309022562589741,
      "learning_rate": 3.8457716766733234e-05,
      "loss": 1.4183,
      "num_input_tokens_seen": 28448673232,
      "step": 36159
    },
    {
      "epoch": 3.836197750901761,
      "grad_norm": 0.4880286965189117,
      "learning_rate": 3.845713107812162e-05,
      "loss": 1.4894,
      "num_input_tokens_seen": 28449459984,
      "step": 36160
    },
    {
      "epoch": 3.8363038404413325,
      "grad_norm": 0.4497947640700992,
      "learning_rate": 3.8456545379110734e-05,
      "loss": 1.442,
      "num_input_tokens_seen": 28450246848,
      "step": 36161
    },
    {
      "epoch": 3.836409929980904,
      "grad_norm": 0.7626119610113506,
      "learning_rate": 3.845595966970103e-05,
      "loss": 1.3994,
      "num_input_tokens_seen": 28451033696,
      "step": 36162
    },
    {
      "epoch": 3.8365160195204755,
      "grad_norm": 0.5124827259397191,
      "learning_rate": 3.8455373949892946e-05,
      "loss": 1.5631,
      "num_input_tokens_seen": 28451820432,
      "step": 36163
    },
    {
      "epoch": 3.8366221090600465,
      "grad_norm": 0.6655521975319483,
      "learning_rate": 3.845478821968696e-05,
      "loss": 1.5727,
      "num_input_tokens_seen": 28452607152,
      "step": 36164
    },
    {
      "epoch": 3.836728198599618,
      "grad_norm": 0.39253105955401896,
      "learning_rate": 3.845420247908349e-05,
      "loss": 1.3252,
      "num_input_tokens_seen": 28453393968,
      "step": 36165
    },
    {
      "epoch": 3.8368342881391895,
      "grad_norm": 0.5244565687514806,
      "learning_rate": 3.845361672808302e-05,
      "loss": 1.4096,
      "num_input_tokens_seen": 28454180656,
      "step": 36166
    },
    {
      "epoch": 3.836940377678761,
      "grad_norm": 0.7279990850797888,
      "learning_rate": 3.845303096668598e-05,
      "loss": 1.4156,
      "num_input_tokens_seen": 28454967456,
      "step": 36167
    },
    {
      "epoch": 3.8370464672183324,
      "grad_norm": 0.5283168683809941,
      "learning_rate": 3.8452445194892836e-05,
      "loss": 1.4377,
      "num_input_tokens_seen": 28455754256,
      "step": 36168
    },
    {
      "epoch": 3.8371525567579035,
      "grad_norm": 0.7422700291964948,
      "learning_rate": 3.845185941270404e-05,
      "loss": 1.4738,
      "num_input_tokens_seen": 28456540992,
      "step": 36169
    },
    {
      "epoch": 3.837258646297475,
      "grad_norm": 0.48898946048304465,
      "learning_rate": 3.8451273620120046e-05,
      "loss": 1.4488,
      "num_input_tokens_seen": 28457327808,
      "step": 36170
    },
    {
      "epoch": 3.8373647358370464,
      "grad_norm": 0.6093176727669615,
      "learning_rate": 3.845068781714129e-05,
      "loss": 1.5152,
      "num_input_tokens_seen": 28458114496,
      "step": 36171
    },
    {
      "epoch": 3.837470825376618,
      "grad_norm": 0.7604041778963647,
      "learning_rate": 3.8450102003768245e-05,
      "loss": 1.3381,
      "num_input_tokens_seen": 28458901296,
      "step": 36172
    },
    {
      "epoch": 3.8375769149161894,
      "grad_norm": 0.4578294454147551,
      "learning_rate": 3.8449516180001354e-05,
      "loss": 1.4743,
      "num_input_tokens_seen": 28459688048,
      "step": 36173
    },
    {
      "epoch": 3.837683004455761,
      "grad_norm": 1.1109225160331375,
      "learning_rate": 3.844893034584107e-05,
      "loss": 1.4876,
      "num_input_tokens_seen": 28460474784,
      "step": 36174
    },
    {
      "epoch": 3.8377890939953323,
      "grad_norm": 0.5534658924894135,
      "learning_rate": 3.844834450128785e-05,
      "loss": 1.3741,
      "num_input_tokens_seen": 28461261536,
      "step": 36175
    },
    {
      "epoch": 3.8378951835349033,
      "grad_norm": 0.5690408146731399,
      "learning_rate": 3.8447758646342144e-05,
      "loss": 1.4678,
      "num_input_tokens_seen": 28462048240,
      "step": 36176
    },
    {
      "epoch": 3.838001273074475,
      "grad_norm": 0.5898734250965092,
      "learning_rate": 3.84471727810044e-05,
      "loss": 1.4624,
      "num_input_tokens_seen": 28462835024,
      "step": 36177
    },
    {
      "epoch": 3.8381073626140463,
      "grad_norm": 0.44826251016008073,
      "learning_rate": 3.844658690527508e-05,
      "loss": 1.3631,
      "num_input_tokens_seen": 28463621920,
      "step": 36178
    },
    {
      "epoch": 3.8382134521536178,
      "grad_norm": 0.6255565612250983,
      "learning_rate": 3.8446001019154634e-05,
      "loss": 1.5434,
      "num_input_tokens_seen": 28464408544,
      "step": 36179
    },
    {
      "epoch": 3.8383195416931892,
      "grad_norm": 0.6595064778791375,
      "learning_rate": 3.844541512264351e-05,
      "loss": 1.3865,
      "num_input_tokens_seen": 28465195344,
      "step": 36180
    },
    {
      "epoch": 3.8384256312327603,
      "grad_norm": 0.9121417416051395,
      "learning_rate": 3.844482921574216e-05,
      "loss": 1.3795,
      "num_input_tokens_seen": 28465982160,
      "step": 36181
    },
    {
      "epoch": 3.8385317207723317,
      "grad_norm": 0.8762242213855659,
      "learning_rate": 3.8444243298451054e-05,
      "loss": 1.5336,
      "num_input_tokens_seen": 28466768896,
      "step": 36182
    },
    {
      "epoch": 3.838637810311903,
      "grad_norm": 0.5172833751407214,
      "learning_rate": 3.8443657370770616e-05,
      "loss": 1.3824,
      "num_input_tokens_seen": 28467555728,
      "step": 36183
    },
    {
      "epoch": 3.8387438998514747,
      "grad_norm": 1.5701950637506834,
      "learning_rate": 3.8443071432701325e-05,
      "loss": 1.4381,
      "num_input_tokens_seen": 28468342416,
      "step": 36184
    },
    {
      "epoch": 3.838849989391046,
      "grad_norm": 0.9606963741271803,
      "learning_rate": 3.8442485484243615e-05,
      "loss": 1.5161,
      "num_input_tokens_seen": 28469129104,
      "step": 36185
    },
    {
      "epoch": 3.838956078930617,
      "grad_norm": 0.7342212247636926,
      "learning_rate": 3.844189952539795e-05,
      "loss": 1.3822,
      "num_input_tokens_seen": 28469915968,
      "step": 36186
    },
    {
      "epoch": 3.839062168470189,
      "grad_norm": 2.155610243915122,
      "learning_rate": 3.8441313556164784e-05,
      "loss": 1.4418,
      "num_input_tokens_seen": 28470702800,
      "step": 36187
    },
    {
      "epoch": 3.83916825800976,
      "grad_norm": 1.2160737909022015,
      "learning_rate": 3.8440727576544556e-05,
      "loss": 1.5889,
      "num_input_tokens_seen": 28471489568,
      "step": 36188
    },
    {
      "epoch": 3.8392743475493316,
      "grad_norm": 0.9862362877416649,
      "learning_rate": 3.8440141586537726e-05,
      "loss": 1.4073,
      "num_input_tokens_seen": 28472276320,
      "step": 36189
    },
    {
      "epoch": 3.839380437088903,
      "grad_norm": 1.7303792245941625,
      "learning_rate": 3.843955558614476e-05,
      "loss": 1.4193,
      "num_input_tokens_seen": 28473063136,
      "step": 36190
    },
    {
      "epoch": 3.8394865266284746,
      "grad_norm": 0.716514352623451,
      "learning_rate": 3.8438969575366094e-05,
      "loss": 1.3404,
      "num_input_tokens_seen": 28473850032,
      "step": 36191
    },
    {
      "epoch": 3.839592616168046,
      "grad_norm": 0.9655888825721382,
      "learning_rate": 3.8438383554202186e-05,
      "loss": 1.4782,
      "num_input_tokens_seen": 28474636768,
      "step": 36192
    },
    {
      "epoch": 3.839698705707617,
      "grad_norm": 1.0059989390548836,
      "learning_rate": 3.843779752265349e-05,
      "loss": 1.3695,
      "num_input_tokens_seen": 28475423664,
      "step": 36193
    },
    {
      "epoch": 3.8398047952471885,
      "grad_norm": 0.6272316479223178,
      "learning_rate": 3.843721148072047e-05,
      "loss": 1.4904,
      "num_input_tokens_seen": 28476210400,
      "step": 36194
    },
    {
      "epoch": 3.83991088478676,
      "grad_norm": 0.8266324764767465,
      "learning_rate": 3.843662542840355e-05,
      "loss": 1.522,
      "num_input_tokens_seen": 28476997024,
      "step": 36195
    },
    {
      "epoch": 3.8400169743263315,
      "grad_norm": 0.7090515563011829,
      "learning_rate": 3.8436039365703205e-05,
      "loss": 1.4406,
      "num_input_tokens_seen": 28477783680,
      "step": 36196
    },
    {
      "epoch": 3.840123063865903,
      "grad_norm": 0.591427573225943,
      "learning_rate": 3.843545329261989e-05,
      "loss": 1.3166,
      "num_input_tokens_seen": 28478570528,
      "step": 36197
    },
    {
      "epoch": 3.840229153405474,
      "grad_norm": 0.5343677661075378,
      "learning_rate": 3.843486720915405e-05,
      "loss": 1.4769,
      "num_input_tokens_seen": 28479357344,
      "step": 36198
    },
    {
      "epoch": 3.8403352429450455,
      "grad_norm": 0.8215837028018704,
      "learning_rate": 3.843428111530613e-05,
      "loss": 1.4369,
      "num_input_tokens_seen": 28480144016,
      "step": 36199
    },
    {
      "epoch": 3.840441332484617,
      "grad_norm": 0.5728270561180594,
      "learning_rate": 3.843369501107659e-05,
      "loss": 1.5016,
      "num_input_tokens_seen": 28480930816,
      "step": 36200
    },
    {
      "epoch": 3.8405474220241884,
      "grad_norm": 0.5827750578006249,
      "learning_rate": 3.84331088964659e-05,
      "loss": 1.3558,
      "num_input_tokens_seen": 28481717552,
      "step": 36201
    },
    {
      "epoch": 3.84065351156376,
      "grad_norm": 0.8168704571712727,
      "learning_rate": 3.8432522771474486e-05,
      "loss": 1.5098,
      "num_input_tokens_seen": 28482504320,
      "step": 36202
    },
    {
      "epoch": 3.8407596011033314,
      "grad_norm": 0.467285819242424,
      "learning_rate": 3.843193663610281e-05,
      "loss": 1.4492,
      "num_input_tokens_seen": 28483291056,
      "step": 36203
    },
    {
      "epoch": 3.840865690642903,
      "grad_norm": 0.7150479727864342,
      "learning_rate": 3.843135049035134e-05,
      "loss": 1.3865,
      "num_input_tokens_seen": 28484077904,
      "step": 36204
    },
    {
      "epoch": 3.840971780182474,
      "grad_norm": 0.5459750934825646,
      "learning_rate": 3.8430764334220505e-05,
      "loss": 1.5174,
      "num_input_tokens_seen": 28484864672,
      "step": 36205
    },
    {
      "epoch": 3.8410778697220453,
      "grad_norm": 0.46117429673554206,
      "learning_rate": 3.843017816771077e-05,
      "loss": 1.4286,
      "num_input_tokens_seen": 28485651392,
      "step": 36206
    },
    {
      "epoch": 3.841183959261617,
      "grad_norm": 0.5257950396680626,
      "learning_rate": 3.84295919908226e-05,
      "loss": 1.4307,
      "num_input_tokens_seen": 28486438176,
      "step": 36207
    },
    {
      "epoch": 3.8412900488011883,
      "grad_norm": 0.588658986823119,
      "learning_rate": 3.842900580355642e-05,
      "loss": 1.4935,
      "num_input_tokens_seen": 28487225008,
      "step": 36208
    },
    {
      "epoch": 3.8413961383407598,
      "grad_norm": 0.45631740587935354,
      "learning_rate": 3.8428419605912705e-05,
      "loss": 1.4741,
      "num_input_tokens_seen": 28488011760,
      "step": 36209
    },
    {
      "epoch": 3.841502227880331,
      "grad_norm": 0.5295875814192987,
      "learning_rate": 3.84278333978919e-05,
      "loss": 1.4857,
      "num_input_tokens_seen": 28488798480,
      "step": 36210
    },
    {
      "epoch": 3.8416083174199023,
      "grad_norm": 0.5459379559268442,
      "learning_rate": 3.8427247179494466e-05,
      "loss": 1.4545,
      "num_input_tokens_seen": 28489585440,
      "step": 36211
    },
    {
      "epoch": 3.8417144069594737,
      "grad_norm": 0.4458929692548319,
      "learning_rate": 3.842666095072084e-05,
      "loss": 1.3959,
      "num_input_tokens_seen": 28490372304,
      "step": 36212
    },
    {
      "epoch": 3.8418204964990452,
      "grad_norm": 0.5227524156295827,
      "learning_rate": 3.842607471157149e-05,
      "loss": 1.3857,
      "num_input_tokens_seen": 28491159024,
      "step": 36213
    },
    {
      "epoch": 3.8419265860386167,
      "grad_norm": 0.5294413404897803,
      "learning_rate": 3.842548846204686e-05,
      "loss": 1.476,
      "num_input_tokens_seen": 28491945840,
      "step": 36214
    },
    {
      "epoch": 3.8420326755781877,
      "grad_norm": 0.43289593388620495,
      "learning_rate": 3.8424902202147405e-05,
      "loss": 1.4295,
      "num_input_tokens_seen": 28492732544,
      "step": 36215
    },
    {
      "epoch": 3.8421387651177596,
      "grad_norm": 0.5297920328209095,
      "learning_rate": 3.842431593187359e-05,
      "loss": 1.5562,
      "num_input_tokens_seen": 28493519328,
      "step": 36216
    },
    {
      "epoch": 3.8422448546573307,
      "grad_norm": 0.4889535061863759,
      "learning_rate": 3.842372965122584e-05,
      "loss": 1.4461,
      "num_input_tokens_seen": 28494306112,
      "step": 36217
    },
    {
      "epoch": 3.842350944196902,
      "grad_norm": 0.44290250430934563,
      "learning_rate": 3.8423143360204636e-05,
      "loss": 1.3877,
      "num_input_tokens_seen": 28495092880,
      "step": 36218
    },
    {
      "epoch": 3.8424570337364736,
      "grad_norm": 0.570265315201187,
      "learning_rate": 3.842255705881043e-05,
      "loss": 1.4886,
      "num_input_tokens_seen": 28495879600,
      "step": 36219
    },
    {
      "epoch": 3.842563123276045,
      "grad_norm": 0.43863638352137874,
      "learning_rate": 3.842197074704365e-05,
      "loss": 1.4336,
      "num_input_tokens_seen": 28496666384,
      "step": 36220
    },
    {
      "epoch": 3.8426692128156166,
      "grad_norm": 0.44370744079183727,
      "learning_rate": 3.8421384424904775e-05,
      "loss": 1.5105,
      "num_input_tokens_seen": 28497453168,
      "step": 36221
    },
    {
      "epoch": 3.8427753023551876,
      "grad_norm": 0.44013037405659444,
      "learning_rate": 3.8420798092394236e-05,
      "loss": 1.4872,
      "num_input_tokens_seen": 28498239856,
      "step": 36222
    },
    {
      "epoch": 3.842881391894759,
      "grad_norm": 0.4555971375035088,
      "learning_rate": 3.842021174951251e-05,
      "loss": 1.4071,
      "num_input_tokens_seen": 28499026704,
      "step": 36223
    },
    {
      "epoch": 3.8429874814343306,
      "grad_norm": 0.4430660510375009,
      "learning_rate": 3.841962539626003e-05,
      "loss": 1.388,
      "num_input_tokens_seen": 28499813504,
      "step": 36224
    },
    {
      "epoch": 3.843093570973902,
      "grad_norm": 0.4278487874168531,
      "learning_rate": 3.841903903263727e-05,
      "loss": 1.4558,
      "num_input_tokens_seen": 28500600352,
      "step": 36225
    },
    {
      "epoch": 3.8431996605134735,
      "grad_norm": 0.38532218602731244,
      "learning_rate": 3.8418452658644655e-05,
      "loss": 1.4822,
      "num_input_tokens_seen": 28501387104,
      "step": 36226
    },
    {
      "epoch": 3.8433057500530445,
      "grad_norm": 0.625656233623561,
      "learning_rate": 3.8417866274282655e-05,
      "loss": 1.3586,
      "num_input_tokens_seen": 28502173904,
      "step": 36227
    },
    {
      "epoch": 3.843411839592616,
      "grad_norm": 0.49881910634833687,
      "learning_rate": 3.841727987955173e-05,
      "loss": 1.5124,
      "num_input_tokens_seen": 28502960704,
      "step": 36228
    },
    {
      "epoch": 3.8435179291321875,
      "grad_norm": 0.528880769716662,
      "learning_rate": 3.841669347445232e-05,
      "loss": 1.4466,
      "num_input_tokens_seen": 28503747536,
      "step": 36229
    },
    {
      "epoch": 3.843624018671759,
      "grad_norm": 0.45373683565048983,
      "learning_rate": 3.8416107058984886e-05,
      "loss": 1.3601,
      "num_input_tokens_seen": 28504534288,
      "step": 36230
    },
    {
      "epoch": 3.8437301082113304,
      "grad_norm": 0.5322629675385249,
      "learning_rate": 3.8415520633149884e-05,
      "loss": 1.4068,
      "num_input_tokens_seen": 28505321008,
      "step": 36231
    },
    {
      "epoch": 3.843836197750902,
      "grad_norm": 0.5294892870171309,
      "learning_rate": 3.841493419694775e-05,
      "loss": 1.3344,
      "num_input_tokens_seen": 28506107728,
      "step": 36232
    },
    {
      "epoch": 3.8439422872904734,
      "grad_norm": 0.543185791474629,
      "learning_rate": 3.841434775037895e-05,
      "loss": 1.499,
      "num_input_tokens_seen": 28506894528,
      "step": 36233
    },
    {
      "epoch": 3.8440483768300444,
      "grad_norm": 0.4343466861357737,
      "learning_rate": 3.841376129344394e-05,
      "loss": 1.4658,
      "num_input_tokens_seen": 28507681200,
      "step": 36234
    },
    {
      "epoch": 3.844154466369616,
      "grad_norm": 0.5256725717854993,
      "learning_rate": 3.841317482614316e-05,
      "loss": 1.4333,
      "num_input_tokens_seen": 28508467968,
      "step": 36235
    },
    {
      "epoch": 3.8442605559091874,
      "grad_norm": 0.5058008696681984,
      "learning_rate": 3.8412588348477086e-05,
      "loss": 1.466,
      "num_input_tokens_seen": 28509254736,
      "step": 36236
    },
    {
      "epoch": 3.844366645448759,
      "grad_norm": 0.4514487183687674,
      "learning_rate": 3.841200186044615e-05,
      "loss": 1.5513,
      "num_input_tokens_seen": 28510041520,
      "step": 36237
    },
    {
      "epoch": 3.8444727349883303,
      "grad_norm": 0.6059525632997905,
      "learning_rate": 3.841141536205081e-05,
      "loss": 1.3934,
      "num_input_tokens_seen": 28510828320,
      "step": 36238
    },
    {
      "epoch": 3.8445788245279013,
      "grad_norm": 0.5339936419130404,
      "learning_rate": 3.841082885329152e-05,
      "loss": 1.4128,
      "num_input_tokens_seen": 28511615104,
      "step": 36239
    },
    {
      "epoch": 3.844684914067473,
      "grad_norm": 0.5242720968874297,
      "learning_rate": 3.841024233416874e-05,
      "loss": 1.4491,
      "num_input_tokens_seen": 28512401888,
      "step": 36240
    },
    {
      "epoch": 3.8447910036070443,
      "grad_norm": 0.6296079818759728,
      "learning_rate": 3.840965580468292e-05,
      "loss": 1.4759,
      "num_input_tokens_seen": 28513188592,
      "step": 36241
    },
    {
      "epoch": 3.8448970931466158,
      "grad_norm": 0.45365132048756773,
      "learning_rate": 3.840906926483451e-05,
      "loss": 1.5174,
      "num_input_tokens_seen": 28513975328,
      "step": 36242
    },
    {
      "epoch": 3.8450031826861872,
      "grad_norm": 0.387490899323111,
      "learning_rate": 3.840848271462396e-05,
      "loss": 1.34,
      "num_input_tokens_seen": 28514762176,
      "step": 36243
    },
    {
      "epoch": 3.8451092722257583,
      "grad_norm": 0.5117621765075991,
      "learning_rate": 3.8407896154051736e-05,
      "loss": 1.4983,
      "num_input_tokens_seen": 28515548992,
      "step": 36244
    },
    {
      "epoch": 3.84521536176533,
      "grad_norm": 0.4213042297489381,
      "learning_rate": 3.8407309583118276e-05,
      "loss": 1.4764,
      "num_input_tokens_seen": 28516335744,
      "step": 36245
    },
    {
      "epoch": 3.845321451304901,
      "grad_norm": 0.43664714671134736,
      "learning_rate": 3.8406723001824044e-05,
      "loss": 1.4714,
      "num_input_tokens_seen": 28517122464,
      "step": 36246
    },
    {
      "epoch": 3.8454275408444727,
      "grad_norm": 0.44068705381683854,
      "learning_rate": 3.8406136410169494e-05,
      "loss": 1.431,
      "num_input_tokens_seen": 28517909152,
      "step": 36247
    },
    {
      "epoch": 3.845533630384044,
      "grad_norm": 0.40499610100830347,
      "learning_rate": 3.8405549808155074e-05,
      "loss": 1.4495,
      "num_input_tokens_seen": 28518695904,
      "step": 36248
    },
    {
      "epoch": 3.8456397199236156,
      "grad_norm": 0.4138204240087923,
      "learning_rate": 3.840496319578123e-05,
      "loss": 1.5096,
      "num_input_tokens_seen": 28519482576,
      "step": 36249
    },
    {
      "epoch": 3.845745809463187,
      "grad_norm": 0.4239343163263378,
      "learning_rate": 3.8404376573048426e-05,
      "loss": 1.378,
      "num_input_tokens_seen": 28520269408,
      "step": 36250
    },
    {
      "epoch": 3.845851899002758,
      "grad_norm": 0.4572652942403216,
      "learning_rate": 3.840378993995712e-05,
      "loss": 1.4542,
      "num_input_tokens_seen": 28521056144,
      "step": 36251
    },
    {
      "epoch": 3.8459579885423296,
      "grad_norm": 0.4055757246017911,
      "learning_rate": 3.840320329650775e-05,
      "loss": 1.3806,
      "num_input_tokens_seen": 28521842992,
      "step": 36252
    },
    {
      "epoch": 3.846064078081901,
      "grad_norm": 0.4102392107235198,
      "learning_rate": 3.8402616642700785e-05,
      "loss": 1.3284,
      "num_input_tokens_seen": 28522629840,
      "step": 36253
    },
    {
      "epoch": 3.8461701676214726,
      "grad_norm": 0.4764363672245525,
      "learning_rate": 3.840202997853667e-05,
      "loss": 1.4006,
      "num_input_tokens_seen": 28523416608,
      "step": 36254
    },
    {
      "epoch": 3.846276257161044,
      "grad_norm": 0.37044945021040726,
      "learning_rate": 3.840144330401585e-05,
      "loss": 1.4361,
      "num_input_tokens_seen": 28524203440,
      "step": 36255
    },
    {
      "epoch": 3.846382346700615,
      "grad_norm": 0.4084617137793798,
      "learning_rate": 3.84008566191388e-05,
      "loss": 1.4425,
      "num_input_tokens_seen": 28524990240,
      "step": 36256
    },
    {
      "epoch": 3.846488436240187,
      "grad_norm": 0.4002298340643374,
      "learning_rate": 3.840026992390596e-05,
      "loss": 1.398,
      "num_input_tokens_seen": 28525776976,
      "step": 36257
    },
    {
      "epoch": 3.846594525779758,
      "grad_norm": 0.43127629781372184,
      "learning_rate": 3.839968321831777e-05,
      "loss": 1.4822,
      "num_input_tokens_seen": 28526563728,
      "step": 36258
    },
    {
      "epoch": 3.8467006153193295,
      "grad_norm": 0.39391736134454547,
      "learning_rate": 3.839909650237472e-05,
      "loss": 1.4765,
      "num_input_tokens_seen": 28527350464,
      "step": 36259
    },
    {
      "epoch": 3.846806704858901,
      "grad_norm": 0.4420409481162577,
      "learning_rate": 3.839850977607722e-05,
      "loss": 1.4119,
      "num_input_tokens_seen": 28528137248,
      "step": 36260
    },
    {
      "epoch": 3.8469127943984724,
      "grad_norm": 0.4126662331388541,
      "learning_rate": 3.839792303942576e-05,
      "loss": 1.4563,
      "num_input_tokens_seen": 28528923904,
      "step": 36261
    },
    {
      "epoch": 3.847018883938044,
      "grad_norm": 0.4277012310465562,
      "learning_rate": 3.8397336292420775e-05,
      "loss": 1.3836,
      "num_input_tokens_seen": 28529710736,
      "step": 36262
    },
    {
      "epoch": 3.847124973477615,
      "grad_norm": 0.41968644824616363,
      "learning_rate": 3.839674953506272e-05,
      "loss": 1.4481,
      "num_input_tokens_seen": 28530497584,
      "step": 36263
    },
    {
      "epoch": 3.8472310630171864,
      "grad_norm": 0.4633458352480754,
      "learning_rate": 3.839616276735205e-05,
      "loss": 1.4206,
      "num_input_tokens_seen": 28531284368,
      "step": 36264
    },
    {
      "epoch": 3.847337152556758,
      "grad_norm": 0.3992903738275865,
      "learning_rate": 3.8395575989289224e-05,
      "loss": 1.482,
      "num_input_tokens_seen": 28532071152,
      "step": 36265
    },
    {
      "epoch": 3.8474432420963294,
      "grad_norm": 0.44541050336830434,
      "learning_rate": 3.8394989200874674e-05,
      "loss": 1.4294,
      "num_input_tokens_seen": 28532857968,
      "step": 36266
    },
    {
      "epoch": 3.847549331635901,
      "grad_norm": 0.38831175105162946,
      "learning_rate": 3.8394402402108886e-05,
      "loss": 1.4135,
      "num_input_tokens_seen": 28533644752,
      "step": 36267
    },
    {
      "epoch": 3.847655421175472,
      "grad_norm": 0.4726167830285292,
      "learning_rate": 3.8393815592992295e-05,
      "loss": 1.4382,
      "num_input_tokens_seen": 28534431552,
      "step": 36268
    },
    {
      "epoch": 3.8477615107150434,
      "grad_norm": 0.4236592692937233,
      "learning_rate": 3.839322877352535e-05,
      "loss": 1.497,
      "num_input_tokens_seen": 28535218496,
      "step": 36269
    },
    {
      "epoch": 3.847867600254615,
      "grad_norm": 0.4490569618573864,
      "learning_rate": 3.839264194370851e-05,
      "loss": 1.5003,
      "num_input_tokens_seen": 28536005280,
      "step": 36270
    },
    {
      "epoch": 3.8479736897941863,
      "grad_norm": 0.4086911888611892,
      "learning_rate": 3.8392055103542234e-05,
      "loss": 1.4798,
      "num_input_tokens_seen": 28536792000,
      "step": 36271
    },
    {
      "epoch": 3.8480797793337578,
      "grad_norm": 0.4397923151462151,
      "learning_rate": 3.839146825302697e-05,
      "loss": 1.4506,
      "num_input_tokens_seen": 28537578720,
      "step": 36272
    },
    {
      "epoch": 3.8481858688733293,
      "grad_norm": 0.4551976544180902,
      "learning_rate": 3.839088139216317e-05,
      "loss": 1.3578,
      "num_input_tokens_seen": 28538365520,
      "step": 36273
    },
    {
      "epoch": 3.8482919584129007,
      "grad_norm": 0.40736325097251114,
      "learning_rate": 3.8390294520951284e-05,
      "loss": 1.4246,
      "num_input_tokens_seen": 28539152384,
      "step": 36274
    },
    {
      "epoch": 3.8483980479524718,
      "grad_norm": 0.4770567826943744,
      "learning_rate": 3.838970763939178e-05,
      "loss": 1.3797,
      "num_input_tokens_seen": 28539939104,
      "step": 36275
    },
    {
      "epoch": 3.8485041374920432,
      "grad_norm": 0.4386030442433599,
      "learning_rate": 3.8389120747485105e-05,
      "loss": 1.5098,
      "num_input_tokens_seen": 28540725872,
      "step": 36276
    },
    {
      "epoch": 3.8486102270316147,
      "grad_norm": 0.40187371368230407,
      "learning_rate": 3.8388533845231705e-05,
      "loss": 1.3441,
      "num_input_tokens_seen": 28541512720,
      "step": 36277
    },
    {
      "epoch": 3.848716316571186,
      "grad_norm": 0.5387823165486155,
      "learning_rate": 3.8387946932632035e-05,
      "loss": 1.495,
      "num_input_tokens_seen": 28542299456,
      "step": 36278
    },
    {
      "epoch": 3.8488224061107577,
      "grad_norm": 0.39631923007543596,
      "learning_rate": 3.838736000968656e-05,
      "loss": 1.4042,
      "num_input_tokens_seen": 28543086224,
      "step": 36279
    },
    {
      "epoch": 3.8489284956503287,
      "grad_norm": 0.48976265782370954,
      "learning_rate": 3.838677307639573e-05,
      "loss": 1.4447,
      "num_input_tokens_seen": 28543872992,
      "step": 36280
    },
    {
      "epoch": 3.8490345851899,
      "grad_norm": 0.48926256460891837,
      "learning_rate": 3.8386186132759984e-05,
      "loss": 1.4548,
      "num_input_tokens_seen": 28544659712,
      "step": 36281
    },
    {
      "epoch": 3.8491406747294716,
      "grad_norm": 0.45754870506802287,
      "learning_rate": 3.838559917877979e-05,
      "loss": 1.4166,
      "num_input_tokens_seen": 28545446560,
      "step": 36282
    },
    {
      "epoch": 3.849246764269043,
      "grad_norm": 0.4933577853749039,
      "learning_rate": 3.83850122144556e-05,
      "loss": 1.567,
      "num_input_tokens_seen": 28546233280,
      "step": 36283
    },
    {
      "epoch": 3.8493528538086146,
      "grad_norm": 0.40636682900549587,
      "learning_rate": 3.838442523978786e-05,
      "loss": 1.3196,
      "num_input_tokens_seen": 28547019984,
      "step": 36284
    },
    {
      "epoch": 3.8494589433481856,
      "grad_norm": 0.4980206205984401,
      "learning_rate": 3.8383838254777035e-05,
      "loss": 1.5072,
      "num_input_tokens_seen": 28547806832,
      "step": 36285
    },
    {
      "epoch": 3.8495650328877575,
      "grad_norm": 0.46790767187936944,
      "learning_rate": 3.838325125942357e-05,
      "loss": 1.4786,
      "num_input_tokens_seen": 28548593584,
      "step": 36286
    },
    {
      "epoch": 3.8496711224273286,
      "grad_norm": 0.4313701316399909,
      "learning_rate": 3.8382664253727916e-05,
      "loss": 1.4036,
      "num_input_tokens_seen": 28549380352,
      "step": 36287
    },
    {
      "epoch": 3.8497772119669,
      "grad_norm": 0.4538680137542378,
      "learning_rate": 3.838207723769054e-05,
      "loss": 1.4545,
      "num_input_tokens_seen": 28550167152,
      "step": 36288
    },
    {
      "epoch": 3.8498833015064715,
      "grad_norm": 0.4202102070073288,
      "learning_rate": 3.838149021131188e-05,
      "loss": 1.4818,
      "num_input_tokens_seen": 28550953872,
      "step": 36289
    },
    {
      "epoch": 3.849989391046043,
      "grad_norm": 0.5041820815259125,
      "learning_rate": 3.838090317459241e-05,
      "loss": 1.4459,
      "num_input_tokens_seen": 28551740592,
      "step": 36290
    },
    {
      "epoch": 3.8500954805856145,
      "grad_norm": 0.578766871562844,
      "learning_rate": 3.838031612753255e-05,
      "loss": 1.3409,
      "num_input_tokens_seen": 28552527424,
      "step": 36291
    },
    {
      "epoch": 3.8502015701251855,
      "grad_norm": 0.5030223481982687,
      "learning_rate": 3.837972907013279e-05,
      "loss": 1.3396,
      "num_input_tokens_seen": 28553314128,
      "step": 36292
    },
    {
      "epoch": 3.850307659664757,
      "grad_norm": 0.7418899786927873,
      "learning_rate": 3.837914200239357e-05,
      "loss": 1.4592,
      "num_input_tokens_seen": 28554100912,
      "step": 36293
    },
    {
      "epoch": 3.8504137492043284,
      "grad_norm": 0.5422372829771832,
      "learning_rate": 3.837855492431534e-05,
      "loss": 1.4011,
      "num_input_tokens_seen": 28554887664,
      "step": 36294
    },
    {
      "epoch": 3.8505198387439,
      "grad_norm": 0.44711791083271035,
      "learning_rate": 3.8377967835898544e-05,
      "loss": 1.4077,
      "num_input_tokens_seen": 28555674496,
      "step": 36295
    },
    {
      "epoch": 3.8506259282834714,
      "grad_norm": 0.7759140444432131,
      "learning_rate": 3.837738073714365e-05,
      "loss": 1.5074,
      "num_input_tokens_seen": 28556461168,
      "step": 36296
    },
    {
      "epoch": 3.8507320178230424,
      "grad_norm": 0.5492898153322918,
      "learning_rate": 3.837679362805112e-05,
      "loss": 1.5774,
      "num_input_tokens_seen": 28557247968,
      "step": 36297
    },
    {
      "epoch": 3.850838107362614,
      "grad_norm": 0.4160408549523866,
      "learning_rate": 3.837620650862138e-05,
      "loss": 1.4053,
      "num_input_tokens_seen": 28558034816,
      "step": 36298
    },
    {
      "epoch": 3.8509441969021854,
      "grad_norm": 0.6594910169392548,
      "learning_rate": 3.837561937885492e-05,
      "loss": 1.4201,
      "num_input_tokens_seen": 28558821616,
      "step": 36299
    },
    {
      "epoch": 3.851050286441757,
      "grad_norm": 0.5428109002552961,
      "learning_rate": 3.837503223875216e-05,
      "loss": 1.4903,
      "num_input_tokens_seen": 28559608432,
      "step": 36300
    },
    {
      "epoch": 3.8511563759813283,
      "grad_norm": 0.4531556657036685,
      "learning_rate": 3.837444508831357e-05,
      "loss": 1.4338,
      "num_input_tokens_seen": 28560395136,
      "step": 36301
    },
    {
      "epoch": 3.8512624655209,
      "grad_norm": 0.7783913194744589,
      "learning_rate": 3.8373857927539605e-05,
      "loss": 1.4039,
      "num_input_tokens_seen": 28561181920,
      "step": 36302
    },
    {
      "epoch": 3.8513685550604713,
      "grad_norm": 0.4886036696913508,
      "learning_rate": 3.8373270756430704e-05,
      "loss": 1.4276,
      "num_input_tokens_seen": 28561968672,
      "step": 36303
    },
    {
      "epoch": 3.8514746446000423,
      "grad_norm": 0.5243593152108726,
      "learning_rate": 3.837268357498734e-05,
      "loss": 1.4031,
      "num_input_tokens_seen": 28562755504,
      "step": 36304
    },
    {
      "epoch": 3.8515807341396138,
      "grad_norm": 0.6479957799112016,
      "learning_rate": 3.837209638320996e-05,
      "loss": 1.387,
      "num_input_tokens_seen": 28563542368,
      "step": 36305
    },
    {
      "epoch": 3.8516868236791852,
      "grad_norm": 0.5841981567614433,
      "learning_rate": 3.8371509181099007e-05,
      "loss": 1.5212,
      "num_input_tokens_seen": 28564329136,
      "step": 36306
    },
    {
      "epoch": 3.8517929132187567,
      "grad_norm": 0.6958933618748779,
      "learning_rate": 3.837092196865496e-05,
      "loss": 1.3301,
      "num_input_tokens_seen": 28565115920,
      "step": 36307
    },
    {
      "epoch": 3.851899002758328,
      "grad_norm": 0.4544897024764453,
      "learning_rate": 3.837033474587825e-05,
      "loss": 1.3902,
      "num_input_tokens_seen": 28565902752,
      "step": 36308
    },
    {
      "epoch": 3.8520050922978992,
      "grad_norm": 0.4674224242864861,
      "learning_rate": 3.8369747512769326e-05,
      "loss": 1.4221,
      "num_input_tokens_seen": 28566689552,
      "step": 36309
    },
    {
      "epoch": 3.8521111818374707,
      "grad_norm": 0.6075135607135554,
      "learning_rate": 3.836916026932867e-05,
      "loss": 1.4609,
      "num_input_tokens_seen": 28567476368,
      "step": 36310
    },
    {
      "epoch": 3.852217271377042,
      "grad_norm": 0.471595974940888,
      "learning_rate": 3.836857301555671e-05,
      "loss": 1.4054,
      "num_input_tokens_seen": 28568263136,
      "step": 36311
    },
    {
      "epoch": 3.8523233609166136,
      "grad_norm": 0.4094037894495477,
      "learning_rate": 3.8367985751453914e-05,
      "loss": 1.2609,
      "num_input_tokens_seen": 28569049904,
      "step": 36312
    },
    {
      "epoch": 3.852429450456185,
      "grad_norm": 0.6268123537733992,
      "learning_rate": 3.836739847702073e-05,
      "loss": 1.5262,
      "num_input_tokens_seen": 28569836640,
      "step": 36313
    },
    {
      "epoch": 3.852535539995756,
      "grad_norm": 0.5327216645512127,
      "learning_rate": 3.836681119225761e-05,
      "loss": 1.505,
      "num_input_tokens_seen": 28570623392,
      "step": 36314
    },
    {
      "epoch": 3.852641629535328,
      "grad_norm": 0.5679078834258308,
      "learning_rate": 3.836622389716501e-05,
      "loss": 1.52,
      "num_input_tokens_seen": 28571410128,
      "step": 36315
    },
    {
      "epoch": 3.852747719074899,
      "grad_norm": 0.5928712347007591,
      "learning_rate": 3.836563659174338e-05,
      "loss": 1.556,
      "num_input_tokens_seen": 28572196896,
      "step": 36316
    },
    {
      "epoch": 3.8528538086144706,
      "grad_norm": 0.44500962665532057,
      "learning_rate": 3.836504927599319e-05,
      "loss": 1.4515,
      "num_input_tokens_seen": 28572983536,
      "step": 36317
    },
    {
      "epoch": 3.852959898154042,
      "grad_norm": 0.46424162731080887,
      "learning_rate": 3.836446194991488e-05,
      "loss": 1.4174,
      "num_input_tokens_seen": 28573770240,
      "step": 36318
    },
    {
      "epoch": 3.8530659876936135,
      "grad_norm": 0.4401734600299501,
      "learning_rate": 3.83638746135089e-05,
      "loss": 1.264,
      "num_input_tokens_seen": 28574557008,
      "step": 36319
    },
    {
      "epoch": 3.853172077233185,
      "grad_norm": 0.5171004215889163,
      "learning_rate": 3.836328726677571e-05,
      "loss": 1.5125,
      "num_input_tokens_seen": 28575343712,
      "step": 36320
    },
    {
      "epoch": 3.853278166772756,
      "grad_norm": 0.4277036321853162,
      "learning_rate": 3.836269990971576e-05,
      "loss": 1.3969,
      "num_input_tokens_seen": 28576130544,
      "step": 36321
    },
    {
      "epoch": 3.8533842563123275,
      "grad_norm": 0.502187342677718,
      "learning_rate": 3.836211254232952e-05,
      "loss": 1.5335,
      "num_input_tokens_seen": 28576917280,
      "step": 36322
    },
    {
      "epoch": 3.853490345851899,
      "grad_norm": 0.44601999917646656,
      "learning_rate": 3.8361525164617415e-05,
      "loss": 1.453,
      "num_input_tokens_seen": 28577704016,
      "step": 36323
    },
    {
      "epoch": 3.8535964353914705,
      "grad_norm": 0.46890926758760965,
      "learning_rate": 3.8360937776579933e-05,
      "loss": 1.3548,
      "num_input_tokens_seen": 28578490736,
      "step": 36324
    },
    {
      "epoch": 3.853702524931042,
      "grad_norm": 0.4052474855773182,
      "learning_rate": 3.83603503782175e-05,
      "loss": 1.5077,
      "num_input_tokens_seen": 28579277408,
      "step": 36325
    },
    {
      "epoch": 3.853808614470613,
      "grad_norm": 0.48336803754536456,
      "learning_rate": 3.835976296953058e-05,
      "loss": 1.4082,
      "num_input_tokens_seen": 28580064272,
      "step": 36326
    },
    {
      "epoch": 3.8539147040101844,
      "grad_norm": 0.4639565363086139,
      "learning_rate": 3.8359175550519633e-05,
      "loss": 1.4274,
      "num_input_tokens_seen": 28580851040,
      "step": 36327
    },
    {
      "epoch": 3.854020793549756,
      "grad_norm": 0.45238342040792706,
      "learning_rate": 3.83585881211851e-05,
      "loss": 1.4516,
      "num_input_tokens_seen": 28581637840,
      "step": 36328
    },
    {
      "epoch": 3.8541268830893274,
      "grad_norm": 0.4548765264425345,
      "learning_rate": 3.835800068152745e-05,
      "loss": 1.5515,
      "num_input_tokens_seen": 28582424624,
      "step": 36329
    },
    {
      "epoch": 3.854232972628899,
      "grad_norm": 0.43597961573677724,
      "learning_rate": 3.8357413231547124e-05,
      "loss": 1.5367,
      "num_input_tokens_seen": 28583211424,
      "step": 36330
    },
    {
      "epoch": 3.8543390621684703,
      "grad_norm": 0.39408593852807144,
      "learning_rate": 3.835682577124458e-05,
      "loss": 1.4099,
      "num_input_tokens_seen": 28583998160,
      "step": 36331
    },
    {
      "epoch": 3.854445151708042,
      "grad_norm": 0.7068150750211833,
      "learning_rate": 3.8356238300620275e-05,
      "loss": 1.4349,
      "num_input_tokens_seen": 28584784976,
      "step": 36332
    },
    {
      "epoch": 3.854551241247613,
      "grad_norm": 0.6048842634937825,
      "learning_rate": 3.835565081967466e-05,
      "loss": 1.4006,
      "num_input_tokens_seen": 28585571776,
      "step": 36333
    },
    {
      "epoch": 3.8546573307871843,
      "grad_norm": 0.6079965281646496,
      "learning_rate": 3.835506332840819e-05,
      "loss": 1.468,
      "num_input_tokens_seen": 28586358592,
      "step": 36334
    },
    {
      "epoch": 3.854763420326756,
      "grad_norm": 0.47651177254878496,
      "learning_rate": 3.8354475826821317e-05,
      "loss": 1.465,
      "num_input_tokens_seen": 28587145296,
      "step": 36335
    },
    {
      "epoch": 3.8548695098663273,
      "grad_norm": 0.47665598825364364,
      "learning_rate": 3.8353888314914496e-05,
      "loss": 1.3224,
      "num_input_tokens_seen": 28587932128,
      "step": 36336
    },
    {
      "epoch": 3.8549755994058987,
      "grad_norm": 0.41800335727387034,
      "learning_rate": 3.83533007926882e-05,
      "loss": 1.3962,
      "num_input_tokens_seen": 28588718960,
      "step": 36337
    },
    {
      "epoch": 3.8550816889454698,
      "grad_norm": 0.43108093293002725,
      "learning_rate": 3.8352713260142844e-05,
      "loss": 1.4941,
      "num_input_tokens_seen": 28589505760,
      "step": 36338
    },
    {
      "epoch": 3.8551877784850412,
      "grad_norm": 0.4940895096761094,
      "learning_rate": 3.835212571727891e-05,
      "loss": 1.3493,
      "num_input_tokens_seen": 28590292528,
      "step": 36339
    },
    {
      "epoch": 3.8552938680246127,
      "grad_norm": 0.4520736583905609,
      "learning_rate": 3.835153816409684e-05,
      "loss": 1.4572,
      "num_input_tokens_seen": 28591079264,
      "step": 36340
    },
    {
      "epoch": 3.855399957564184,
      "grad_norm": 0.42157933362825306,
      "learning_rate": 3.83509506005971e-05,
      "loss": 1.4026,
      "num_input_tokens_seen": 28591866016,
      "step": 36341
    },
    {
      "epoch": 3.8555060471037557,
      "grad_norm": 0.4543788862108873,
      "learning_rate": 3.8350363026780136e-05,
      "loss": 1.3435,
      "num_input_tokens_seen": 28592652816,
      "step": 36342
    },
    {
      "epoch": 3.8556121366433267,
      "grad_norm": 0.5132794687035752,
      "learning_rate": 3.834977544264641e-05,
      "loss": 1.5341,
      "num_input_tokens_seen": 28593439552,
      "step": 36343
    },
    {
      "epoch": 3.8557182261828986,
      "grad_norm": 0.476433822251857,
      "learning_rate": 3.834918784819636e-05,
      "loss": 1.4067,
      "num_input_tokens_seen": 28594226272,
      "step": 36344
    },
    {
      "epoch": 3.8558243157224696,
      "grad_norm": 0.46667741042963345,
      "learning_rate": 3.8348600243430446e-05,
      "loss": 1.3348,
      "num_input_tokens_seen": 28595013088,
      "step": 36345
    },
    {
      "epoch": 3.855930405262041,
      "grad_norm": 0.5789921115372444,
      "learning_rate": 3.834801262834913e-05,
      "loss": 1.5765,
      "num_input_tokens_seen": 28595799888,
      "step": 36346
    },
    {
      "epoch": 3.8560364948016126,
      "grad_norm": 0.44474152088897273,
      "learning_rate": 3.834742500295286e-05,
      "loss": 1.4796,
      "num_input_tokens_seen": 28596586704,
      "step": 36347
    },
    {
      "epoch": 3.856142584341184,
      "grad_norm": 0.4247322837838024,
      "learning_rate": 3.8346837367242096e-05,
      "loss": 1.4041,
      "num_input_tokens_seen": 28597373392,
      "step": 36348
    },
    {
      "epoch": 3.8562486738807555,
      "grad_norm": 0.5585899798702015,
      "learning_rate": 3.834624972121728e-05,
      "loss": 1.5524,
      "num_input_tokens_seen": 28598160080,
      "step": 36349
    },
    {
      "epoch": 3.8563547634203266,
      "grad_norm": 0.44547198561377604,
      "learning_rate": 3.834566206487887e-05,
      "loss": 1.4989,
      "num_input_tokens_seen": 28598946816,
      "step": 36350
    },
    {
      "epoch": 3.856460852959898,
      "grad_norm": 0.47909019850083073,
      "learning_rate": 3.8345074398227345e-05,
      "loss": 1.5369,
      "num_input_tokens_seen": 28599733568,
      "step": 36351
    },
    {
      "epoch": 3.8565669424994695,
      "grad_norm": 0.4327320158148632,
      "learning_rate": 3.834448672126312e-05,
      "loss": 1.4146,
      "num_input_tokens_seen": 28600520320,
      "step": 36352
    },
    {
      "epoch": 3.856673032039041,
      "grad_norm": 0.4280589838345341,
      "learning_rate": 3.8343899033986676e-05,
      "loss": 1.4092,
      "num_input_tokens_seen": 28601307072,
      "step": 36353
    },
    {
      "epoch": 3.8567791215786125,
      "grad_norm": 0.4393890815485839,
      "learning_rate": 3.834331133639846e-05,
      "loss": 1.4701,
      "num_input_tokens_seen": 28602093744,
      "step": 36354
    },
    {
      "epoch": 3.8568852111181835,
      "grad_norm": 0.49904850276360035,
      "learning_rate": 3.834272362849891e-05,
      "loss": 1.4458,
      "num_input_tokens_seen": 28602880496,
      "step": 36355
    },
    {
      "epoch": 3.8569913006577554,
      "grad_norm": 0.395978209237265,
      "learning_rate": 3.834213591028851e-05,
      "loss": 1.4602,
      "num_input_tokens_seen": 28603667184,
      "step": 36356
    },
    {
      "epoch": 3.8570973901973264,
      "grad_norm": 0.43365369619115113,
      "learning_rate": 3.83415481817677e-05,
      "loss": 1.4703,
      "num_input_tokens_seen": 28604454000,
      "step": 36357
    },
    {
      "epoch": 3.857203479736898,
      "grad_norm": 0.6209882723144368,
      "learning_rate": 3.8340960442936915e-05,
      "loss": 1.4097,
      "num_input_tokens_seen": 28605240864,
      "step": 36358
    },
    {
      "epoch": 3.8573095692764694,
      "grad_norm": 0.4564642099060499,
      "learning_rate": 3.834037269379664e-05,
      "loss": 1.4668,
      "num_input_tokens_seen": 28606027632,
      "step": 36359
    },
    {
      "epoch": 3.857415658816041,
      "grad_norm": 0.6720772619821004,
      "learning_rate": 3.833978493434731e-05,
      "loss": 1.3973,
      "num_input_tokens_seen": 28606814448,
      "step": 36360
    },
    {
      "epoch": 3.8575217483556123,
      "grad_norm": 0.4638150829825546,
      "learning_rate": 3.833919716458939e-05,
      "loss": 1.473,
      "num_input_tokens_seen": 28607601200,
      "step": 36361
    },
    {
      "epoch": 3.8576278378951834,
      "grad_norm": 0.5699814400371032,
      "learning_rate": 3.8338609384523336e-05,
      "loss": 1.4338,
      "num_input_tokens_seen": 28608387968,
      "step": 36362
    },
    {
      "epoch": 3.857733927434755,
      "grad_norm": 0.606930036526101,
      "learning_rate": 3.833802159414959e-05,
      "loss": 1.4357,
      "num_input_tokens_seen": 28609174816,
      "step": 36363
    },
    {
      "epoch": 3.8578400169743263,
      "grad_norm": 0.48639188164084984,
      "learning_rate": 3.833743379346862e-05,
      "loss": 1.3788,
      "num_input_tokens_seen": 28609961616,
      "step": 36364
    },
    {
      "epoch": 3.857946106513898,
      "grad_norm": 0.47562327391213816,
      "learning_rate": 3.833684598248086e-05,
      "loss": 1.4086,
      "num_input_tokens_seen": 28610748448,
      "step": 36365
    },
    {
      "epoch": 3.8580521960534693,
      "grad_norm": 0.5571367795715277,
      "learning_rate": 3.833625816118678e-05,
      "loss": 1.4074,
      "num_input_tokens_seen": 28611535312,
      "step": 36366
    },
    {
      "epoch": 3.8581582855930403,
      "grad_norm": 0.43833190858000637,
      "learning_rate": 3.8335670329586826e-05,
      "loss": 1.4095,
      "num_input_tokens_seen": 28612322112,
      "step": 36367
    },
    {
      "epoch": 3.858264375132612,
      "grad_norm": 0.4570716190642843,
      "learning_rate": 3.833508248768147e-05,
      "loss": 1.4035,
      "num_input_tokens_seen": 28613108800,
      "step": 36368
    },
    {
      "epoch": 3.8583704646721833,
      "grad_norm": 0.43883881255519763,
      "learning_rate": 3.833449463547114e-05,
      "loss": 1.3864,
      "num_input_tokens_seen": 28613895648,
      "step": 36369
    },
    {
      "epoch": 3.8584765542117547,
      "grad_norm": 0.4681725405367874,
      "learning_rate": 3.833390677295631e-05,
      "loss": 1.4497,
      "num_input_tokens_seen": 28614682416,
      "step": 36370
    },
    {
      "epoch": 3.858582643751326,
      "grad_norm": 0.4894934082253157,
      "learning_rate": 3.833331890013743e-05,
      "loss": 1.5041,
      "num_input_tokens_seen": 28615469152,
      "step": 36371
    },
    {
      "epoch": 3.8586887332908977,
      "grad_norm": 0.5553254134919303,
      "learning_rate": 3.833273101701496e-05,
      "loss": 1.4337,
      "num_input_tokens_seen": 28616255904,
      "step": 36372
    },
    {
      "epoch": 3.858794822830469,
      "grad_norm": 0.43799790012338885,
      "learning_rate": 3.833214312358933e-05,
      "loss": 1.4545,
      "num_input_tokens_seen": 28617042624,
      "step": 36373
    },
    {
      "epoch": 3.85890091237004,
      "grad_norm": 0.502674901757254,
      "learning_rate": 3.833155521986103e-05,
      "loss": 1.5027,
      "num_input_tokens_seen": 28617829312,
      "step": 36374
    },
    {
      "epoch": 3.8590070019096117,
      "grad_norm": 0.4422500235349357,
      "learning_rate": 3.833096730583048e-05,
      "loss": 1.4255,
      "num_input_tokens_seen": 28618616016,
      "step": 36375
    },
    {
      "epoch": 3.859113091449183,
      "grad_norm": 0.47549232092674815,
      "learning_rate": 3.833037938149815e-05,
      "loss": 1.4463,
      "num_input_tokens_seen": 28619402752,
      "step": 36376
    },
    {
      "epoch": 3.8592191809887546,
      "grad_norm": 0.5294913735329461,
      "learning_rate": 3.8329791446864505e-05,
      "loss": 1.5329,
      "num_input_tokens_seen": 28620189584,
      "step": 36377
    },
    {
      "epoch": 3.859325270528326,
      "grad_norm": 0.41913734556568755,
      "learning_rate": 3.832920350192998e-05,
      "loss": 1.367,
      "num_input_tokens_seen": 28620976336,
      "step": 36378
    },
    {
      "epoch": 3.859431360067897,
      "grad_norm": 0.5585842932136724,
      "learning_rate": 3.832861554669503e-05,
      "loss": 1.4337,
      "num_input_tokens_seen": 28621763184,
      "step": 36379
    },
    {
      "epoch": 3.8595374496074686,
      "grad_norm": 0.47558116666249606,
      "learning_rate": 3.832802758116013e-05,
      "loss": 1.4366,
      "num_input_tokens_seen": 28622549984,
      "step": 36380
    },
    {
      "epoch": 3.85964353914704,
      "grad_norm": 0.6547654404919868,
      "learning_rate": 3.832743960532572e-05,
      "loss": 1.4534,
      "num_input_tokens_seen": 28623336816,
      "step": 36381
    },
    {
      "epoch": 3.8597496286866115,
      "grad_norm": 0.48641729659358035,
      "learning_rate": 3.832685161919225e-05,
      "loss": 1.4809,
      "num_input_tokens_seen": 28624123616,
      "step": 36382
    },
    {
      "epoch": 3.859855718226183,
      "grad_norm": 0.467657084343767,
      "learning_rate": 3.832626362276019e-05,
      "loss": 1.3954,
      "num_input_tokens_seen": 28624910480,
      "step": 36383
    },
    {
      "epoch": 3.859961807765754,
      "grad_norm": 0.5972726921361512,
      "learning_rate": 3.8325675616029976e-05,
      "loss": 1.5092,
      "num_input_tokens_seen": 28625697312,
      "step": 36384
    },
    {
      "epoch": 3.860067897305326,
      "grad_norm": 0.5284410264644887,
      "learning_rate": 3.832508759900208e-05,
      "loss": 1.5315,
      "num_input_tokens_seen": 28626484032,
      "step": 36385
    },
    {
      "epoch": 3.860173986844897,
      "grad_norm": 0.5089474990723545,
      "learning_rate": 3.832449957167693e-05,
      "loss": 1.4403,
      "num_input_tokens_seen": 28627270880,
      "step": 36386
    },
    {
      "epoch": 3.8602800763844685,
      "grad_norm": 0.4995916082651886,
      "learning_rate": 3.832391153405501e-05,
      "loss": 1.4228,
      "num_input_tokens_seen": 28628057696,
      "step": 36387
    },
    {
      "epoch": 3.86038616592404,
      "grad_norm": 0.4936140799873529,
      "learning_rate": 3.832332348613676e-05,
      "loss": 1.4905,
      "num_input_tokens_seen": 28628844448,
      "step": 36388
    },
    {
      "epoch": 3.8604922554636114,
      "grad_norm": 0.6902594551056589,
      "learning_rate": 3.832273542792263e-05,
      "loss": 1.4337,
      "num_input_tokens_seen": 28629631200,
      "step": 36389
    },
    {
      "epoch": 3.860598345003183,
      "grad_norm": 0.5227320617345421,
      "learning_rate": 3.8322147359413094e-05,
      "loss": 1.4064,
      "num_input_tokens_seen": 28630417952,
      "step": 36390
    },
    {
      "epoch": 3.860704434542754,
      "grad_norm": 0.6125208879026985,
      "learning_rate": 3.832155928060859e-05,
      "loss": 1.4572,
      "num_input_tokens_seen": 28631204720,
      "step": 36391
    },
    {
      "epoch": 3.8608105240823254,
      "grad_norm": 0.4517685480712698,
      "learning_rate": 3.832097119150957e-05,
      "loss": 1.366,
      "num_input_tokens_seen": 28631991488,
      "step": 36392
    },
    {
      "epoch": 3.860916613621897,
      "grad_norm": 0.5669553765288334,
      "learning_rate": 3.832038309211649e-05,
      "loss": 1.399,
      "num_input_tokens_seen": 28632778304,
      "step": 36393
    },
    {
      "epoch": 3.8610227031614683,
      "grad_norm": 0.5616171479349763,
      "learning_rate": 3.8319794982429824e-05,
      "loss": 1.3974,
      "num_input_tokens_seen": 28633565024,
      "step": 36394
    },
    {
      "epoch": 3.86112879270104,
      "grad_norm": 0.4725515098563165,
      "learning_rate": 3.831920686245e-05,
      "loss": 1.4868,
      "num_input_tokens_seen": 28634351792,
      "step": 36395
    },
    {
      "epoch": 3.861234882240611,
      "grad_norm": 0.5022229336820067,
      "learning_rate": 3.831861873217749e-05,
      "loss": 1.5739,
      "num_input_tokens_seen": 28635138480,
      "step": 36396
    },
    {
      "epoch": 3.8613409717801823,
      "grad_norm": 0.60325872803814,
      "learning_rate": 3.8318030591612734e-05,
      "loss": 1.5697,
      "num_input_tokens_seen": 28635925232,
      "step": 36397
    },
    {
      "epoch": 3.861447061319754,
      "grad_norm": 0.5579197565894775,
      "learning_rate": 3.8317442440756205e-05,
      "loss": 1.4053,
      "num_input_tokens_seen": 28636711936,
      "step": 36398
    },
    {
      "epoch": 3.8615531508593253,
      "grad_norm": 1.0073905121782876,
      "learning_rate": 3.831685427960834e-05,
      "loss": 1.3868,
      "num_input_tokens_seen": 28637498816,
      "step": 36399
    },
    {
      "epoch": 3.8616592403988967,
      "grad_norm": 0.7086018460969107,
      "learning_rate": 3.83162661081696e-05,
      "loss": 1.4672,
      "num_input_tokens_seen": 28638285632,
      "step": 36400
    },
    {
      "epoch": 3.861765329938468,
      "grad_norm": 0.6663912017078085,
      "learning_rate": 3.831567792644044e-05,
      "loss": 1.3908,
      "num_input_tokens_seen": 28639072384,
      "step": 36401
    },
    {
      "epoch": 3.8618714194780397,
      "grad_norm": 1.1259206840555145,
      "learning_rate": 3.8315089734421325e-05,
      "loss": 1.3651,
      "num_input_tokens_seen": 28639859104,
      "step": 36402
    },
    {
      "epoch": 3.8619775090176107,
      "grad_norm": 0.48319651686849185,
      "learning_rate": 3.831450153211269e-05,
      "loss": 1.3697,
      "num_input_tokens_seen": 28640645840,
      "step": 36403
    },
    {
      "epoch": 3.862083598557182,
      "grad_norm": 0.9002823603798795,
      "learning_rate": 3.8313913319515e-05,
      "loss": 1.4454,
      "num_input_tokens_seen": 28641432624,
      "step": 36404
    },
    {
      "epoch": 3.8621896880967537,
      "grad_norm": 0.4986065456528921,
      "learning_rate": 3.831332509662871e-05,
      "loss": 1.3804,
      "num_input_tokens_seen": 28642219408,
      "step": 36405
    },
    {
      "epoch": 3.862295777636325,
      "grad_norm": 0.5471102370115071,
      "learning_rate": 3.831273686345427e-05,
      "loss": 1.488,
      "num_input_tokens_seen": 28643006272,
      "step": 36406
    },
    {
      "epoch": 3.8624018671758966,
      "grad_norm": 0.5333484044105393,
      "learning_rate": 3.8312148619992135e-05,
      "loss": 1.4523,
      "num_input_tokens_seen": 28643793088,
      "step": 36407
    },
    {
      "epoch": 3.8625079567154676,
      "grad_norm": 0.5440435196834176,
      "learning_rate": 3.8311560366242774e-05,
      "loss": 1.6028,
      "num_input_tokens_seen": 28644579776,
      "step": 36408
    },
    {
      "epoch": 3.862614046255039,
      "grad_norm": 0.4354108154241717,
      "learning_rate": 3.8310972102206624e-05,
      "loss": 1.4447,
      "num_input_tokens_seen": 28645366592,
      "step": 36409
    },
    {
      "epoch": 3.8627201357946106,
      "grad_norm": 0.5093271005959017,
      "learning_rate": 3.8310383827884146e-05,
      "loss": 1.3594,
      "num_input_tokens_seen": 28646153392,
      "step": 36410
    },
    {
      "epoch": 3.862826225334182,
      "grad_norm": 0.46968970871586796,
      "learning_rate": 3.8309795543275796e-05,
      "loss": 1.3778,
      "num_input_tokens_seen": 28646940112,
      "step": 36411
    },
    {
      "epoch": 3.8629323148737535,
      "grad_norm": 0.7828238091429199,
      "learning_rate": 3.830920724838202e-05,
      "loss": 1.4719,
      "num_input_tokens_seen": 28647726864,
      "step": 36412
    },
    {
      "epoch": 3.8630384044133246,
      "grad_norm": 0.4039612781822751,
      "learning_rate": 3.8308618943203276e-05,
      "loss": 1.4143,
      "num_input_tokens_seen": 28648513664,
      "step": 36413
    },
    {
      "epoch": 3.8631444939528965,
      "grad_norm": 0.5852350498870659,
      "learning_rate": 3.8308030627740036e-05,
      "loss": 1.5041,
      "num_input_tokens_seen": 28649300448,
      "step": 36414
    },
    {
      "epoch": 3.8632505834924675,
      "grad_norm": 0.4619237056433592,
      "learning_rate": 3.8307442301992725e-05,
      "loss": 1.4656,
      "num_input_tokens_seen": 28650087184,
      "step": 36415
    },
    {
      "epoch": 3.863356673032039,
      "grad_norm": 0.44468299617957924,
      "learning_rate": 3.830685396596182e-05,
      "loss": 1.4419,
      "num_input_tokens_seen": 28650873936,
      "step": 36416
    },
    {
      "epoch": 3.8634627625716105,
      "grad_norm": 0.49736256591221073,
      "learning_rate": 3.8306265619647766e-05,
      "loss": 1.3346,
      "num_input_tokens_seen": 28651660688,
      "step": 36417
    },
    {
      "epoch": 3.863568852111182,
      "grad_norm": 0.6059865456193941,
      "learning_rate": 3.830567726305102e-05,
      "loss": 1.4576,
      "num_input_tokens_seen": 28652447424,
      "step": 36418
    },
    {
      "epoch": 3.8636749416507534,
      "grad_norm": 0.4640962805922583,
      "learning_rate": 3.8305088896172047e-05,
      "loss": 1.4305,
      "num_input_tokens_seen": 28653234208,
      "step": 36419
    },
    {
      "epoch": 3.8637810311903245,
      "grad_norm": 0.689608411516345,
      "learning_rate": 3.8304500519011286e-05,
      "loss": 1.467,
      "num_input_tokens_seen": 28654020976,
      "step": 36420
    },
    {
      "epoch": 3.863887120729896,
      "grad_norm": 0.43411586597310103,
      "learning_rate": 3.830391213156919e-05,
      "loss": 1.2663,
      "num_input_tokens_seen": 28654807808,
      "step": 36421
    },
    {
      "epoch": 3.8639932102694674,
      "grad_norm": 0.5344571379444774,
      "learning_rate": 3.830332373384623e-05,
      "loss": 1.5087,
      "num_input_tokens_seen": 28655594592,
      "step": 36422
    },
    {
      "epoch": 3.864099299809039,
      "grad_norm": 0.7586380355083303,
      "learning_rate": 3.830273532584285e-05,
      "loss": 1.3633,
      "num_input_tokens_seen": 28656381344,
      "step": 36423
    },
    {
      "epoch": 3.8642053893486104,
      "grad_norm": 0.4912017816902739,
      "learning_rate": 3.83021469075595e-05,
      "loss": 1.4711,
      "num_input_tokens_seen": 28657168144,
      "step": 36424
    },
    {
      "epoch": 3.8643114788881814,
      "grad_norm": 0.651950401966476,
      "learning_rate": 3.8301558478996655e-05,
      "loss": 1.3815,
      "num_input_tokens_seen": 28657954928,
      "step": 36425
    },
    {
      "epoch": 3.864417568427753,
      "grad_norm": 0.4880272506923118,
      "learning_rate": 3.830097004015475e-05,
      "loss": 1.4974,
      "num_input_tokens_seen": 28658741776,
      "step": 36426
    },
    {
      "epoch": 3.8645236579673243,
      "grad_norm": 0.5153594210789186,
      "learning_rate": 3.830038159103423e-05,
      "loss": 1.4857,
      "num_input_tokens_seen": 28659528544,
      "step": 36427
    },
    {
      "epoch": 3.864629747506896,
      "grad_norm": 0.506099974644007,
      "learning_rate": 3.8299793131635584e-05,
      "loss": 1.3983,
      "num_input_tokens_seen": 28660315360,
      "step": 36428
    },
    {
      "epoch": 3.8647358370464673,
      "grad_norm": 0.5210813675951702,
      "learning_rate": 3.829920466195924e-05,
      "loss": 1.4755,
      "num_input_tokens_seen": 28661102112,
      "step": 36429
    },
    {
      "epoch": 3.8648419265860388,
      "grad_norm": 0.47626519055996186,
      "learning_rate": 3.8298616182005666e-05,
      "loss": 1.4207,
      "num_input_tokens_seen": 28661888880,
      "step": 36430
    },
    {
      "epoch": 3.8649480161256102,
      "grad_norm": 0.5043152941043529,
      "learning_rate": 3.829802769177531e-05,
      "loss": 1.4615,
      "num_input_tokens_seen": 28662675792,
      "step": 36431
    },
    {
      "epoch": 3.8650541056651813,
      "grad_norm": 0.4455638685574871,
      "learning_rate": 3.829743919126862e-05,
      "loss": 1.3208,
      "num_input_tokens_seen": 28663462528,
      "step": 36432
    },
    {
      "epoch": 3.8651601952047527,
      "grad_norm": 0.5071164183147493,
      "learning_rate": 3.8296850680486076e-05,
      "loss": 1.3237,
      "num_input_tokens_seen": 28664249376,
      "step": 36433
    },
    {
      "epoch": 3.865266284744324,
      "grad_norm": 0.4532274631731406,
      "learning_rate": 3.829626215942811e-05,
      "loss": 1.5061,
      "num_input_tokens_seen": 28665036176,
      "step": 36434
    },
    {
      "epoch": 3.8653723742838957,
      "grad_norm": 0.503594558713603,
      "learning_rate": 3.829567362809518e-05,
      "loss": 1.5025,
      "num_input_tokens_seen": 28665822912,
      "step": 36435
    },
    {
      "epoch": 3.865478463823467,
      "grad_norm": 0.4773212684947014,
      "learning_rate": 3.829508508648773e-05,
      "loss": 1.4078,
      "num_input_tokens_seen": 28666609680,
      "step": 36436
    },
    {
      "epoch": 3.865584553363038,
      "grad_norm": 0.46566122960171774,
      "learning_rate": 3.829449653460625e-05,
      "loss": 1.4663,
      "num_input_tokens_seen": 28667396432,
      "step": 36437
    },
    {
      "epoch": 3.8656906429026097,
      "grad_norm": 0.6637615714206324,
      "learning_rate": 3.829390797245116e-05,
      "loss": 1.572,
      "num_input_tokens_seen": 28668183152,
      "step": 36438
    },
    {
      "epoch": 3.865796732442181,
      "grad_norm": 0.37774535773879314,
      "learning_rate": 3.829331940002294e-05,
      "loss": 1.3783,
      "num_input_tokens_seen": 28668969952,
      "step": 36439
    },
    {
      "epoch": 3.8659028219817526,
      "grad_norm": 0.6171453923951614,
      "learning_rate": 3.829273081732203e-05,
      "loss": 1.509,
      "num_input_tokens_seen": 28669756656,
      "step": 36440
    },
    {
      "epoch": 3.866008911521324,
      "grad_norm": 0.4561456785464352,
      "learning_rate": 3.829214222434887e-05,
      "loss": 1.4566,
      "num_input_tokens_seen": 28670543408,
      "step": 36441
    },
    {
      "epoch": 3.8661150010608956,
      "grad_norm": 0.45373571365904314,
      "learning_rate": 3.829155362110395e-05,
      "loss": 1.5552,
      "num_input_tokens_seen": 28671330240,
      "step": 36442
    },
    {
      "epoch": 3.866221090600467,
      "grad_norm": 0.5032025844603732,
      "learning_rate": 3.829096500758771e-05,
      "loss": 1.4485,
      "num_input_tokens_seen": 28672117040,
      "step": 36443
    },
    {
      "epoch": 3.866327180140038,
      "grad_norm": 0.43921602745841054,
      "learning_rate": 3.8290376383800586e-05,
      "loss": 1.4199,
      "num_input_tokens_seen": 28672903840,
      "step": 36444
    },
    {
      "epoch": 3.8664332696796095,
      "grad_norm": 0.4951999842005467,
      "learning_rate": 3.828978774974306e-05,
      "loss": 1.4635,
      "num_input_tokens_seen": 28673690592,
      "step": 36445
    },
    {
      "epoch": 3.866539359219181,
      "grad_norm": 0.50139806849823,
      "learning_rate": 3.828919910541557e-05,
      "loss": 1.3967,
      "num_input_tokens_seen": 28674477376,
      "step": 36446
    },
    {
      "epoch": 3.8666454487587525,
      "grad_norm": 0.4958271751486926,
      "learning_rate": 3.828861045081859e-05,
      "loss": 1.5953,
      "num_input_tokens_seen": 28675264144,
      "step": 36447
    },
    {
      "epoch": 3.866751538298324,
      "grad_norm": 0.4746716594732444,
      "learning_rate": 3.828802178595255e-05,
      "loss": 1.4198,
      "num_input_tokens_seen": 28676050944,
      "step": 36448
    },
    {
      "epoch": 3.866857627837895,
      "grad_norm": 0.5532200998248132,
      "learning_rate": 3.8287433110817916e-05,
      "loss": 1.3815,
      "num_input_tokens_seen": 28676837728,
      "step": 36449
    },
    {
      "epoch": 3.8669637173774665,
      "grad_norm": 0.39788227790003144,
      "learning_rate": 3.828684442541515e-05,
      "loss": 1.4645,
      "num_input_tokens_seen": 28677624368,
      "step": 36450
    },
    {
      "epoch": 3.867069806917038,
      "grad_norm": 0.6170948068941818,
      "learning_rate": 3.8286255729744705e-05,
      "loss": 1.4795,
      "num_input_tokens_seen": 28678411104,
      "step": 36451
    },
    {
      "epoch": 3.8671758964566094,
      "grad_norm": 0.4718816776324398,
      "learning_rate": 3.8285667023807014e-05,
      "loss": 1.3333,
      "num_input_tokens_seen": 28679197840,
      "step": 36452
    },
    {
      "epoch": 3.867281985996181,
      "grad_norm": 0.638859602534659,
      "learning_rate": 3.828507830760256e-05,
      "loss": 1.4747,
      "num_input_tokens_seen": 28679984544,
      "step": 36453
    },
    {
      "epoch": 3.867388075535752,
      "grad_norm": 0.5879652108548722,
      "learning_rate": 3.828448958113179e-05,
      "loss": 1.5512,
      "num_input_tokens_seen": 28680771216,
      "step": 36454
    },
    {
      "epoch": 3.867494165075324,
      "grad_norm": 0.4838607719857542,
      "learning_rate": 3.8283900844395146e-05,
      "loss": 1.5235,
      "num_input_tokens_seen": 28681557968,
      "step": 36455
    },
    {
      "epoch": 3.867600254614895,
      "grad_norm": 0.7598548029576015,
      "learning_rate": 3.82833120973931e-05,
      "loss": 1.5465,
      "num_input_tokens_seen": 28682344704,
      "step": 36456
    },
    {
      "epoch": 3.8677063441544663,
      "grad_norm": 0.5388069192774168,
      "learning_rate": 3.82827233401261e-05,
      "loss": 1.4174,
      "num_input_tokens_seen": 28683131536,
      "step": 36457
    },
    {
      "epoch": 3.867812433694038,
      "grad_norm": 0.7927481519517552,
      "learning_rate": 3.828213457259461e-05,
      "loss": 1.4988,
      "num_input_tokens_seen": 28683918256,
      "step": 36458
    },
    {
      "epoch": 3.8679185232336093,
      "grad_norm": 0.8367026888405683,
      "learning_rate": 3.828154579479907e-05,
      "loss": 1.5148,
      "num_input_tokens_seen": 28684705072,
      "step": 36459
    },
    {
      "epoch": 3.8680246127731808,
      "grad_norm": 0.42951222826951635,
      "learning_rate": 3.828095700673994e-05,
      "loss": 1.3253,
      "num_input_tokens_seen": 28685491840,
      "step": 36460
    },
    {
      "epoch": 3.868130702312752,
      "grad_norm": 0.774844460295362,
      "learning_rate": 3.828036820841767e-05,
      "loss": 1.3874,
      "num_input_tokens_seen": 28686278608,
      "step": 36461
    },
    {
      "epoch": 3.8682367918523233,
      "grad_norm": 0.839990211858589,
      "learning_rate": 3.827977939983272e-05,
      "loss": 1.4964,
      "num_input_tokens_seen": 28687065392,
      "step": 36462
    },
    {
      "epoch": 3.8683428813918947,
      "grad_norm": 0.5523254419564056,
      "learning_rate": 3.827919058098556e-05,
      "loss": 1.5823,
      "num_input_tokens_seen": 28687852064,
      "step": 36463
    },
    {
      "epoch": 3.8684489709314662,
      "grad_norm": 0.9772057546741006,
      "learning_rate": 3.827860175187661e-05,
      "loss": 1.4708,
      "num_input_tokens_seen": 28688638768,
      "step": 36464
    },
    {
      "epoch": 3.8685550604710377,
      "grad_norm": 0.5712336367966235,
      "learning_rate": 3.827801291250636e-05,
      "loss": 1.3458,
      "num_input_tokens_seen": 28689425632,
      "step": 36465
    },
    {
      "epoch": 3.8686611500106087,
      "grad_norm": 0.4763772951418267,
      "learning_rate": 3.8277424062875255e-05,
      "loss": 1.3845,
      "num_input_tokens_seen": 28690212432,
      "step": 36466
    },
    {
      "epoch": 3.86876723955018,
      "grad_norm": 0.6415434735397241,
      "learning_rate": 3.827683520298374e-05,
      "loss": 1.3446,
      "num_input_tokens_seen": 28690999232,
      "step": 36467
    },
    {
      "epoch": 3.8688733290897517,
      "grad_norm": 0.505600311085422,
      "learning_rate": 3.8276246332832276e-05,
      "loss": 1.4009,
      "num_input_tokens_seen": 28691786080,
      "step": 36468
    },
    {
      "epoch": 3.868979418629323,
      "grad_norm": 0.4294885217377471,
      "learning_rate": 3.827565745242132e-05,
      "loss": 1.33,
      "num_input_tokens_seen": 28692572832,
      "step": 36469
    },
    {
      "epoch": 3.8690855081688946,
      "grad_norm": 0.5281573324735278,
      "learning_rate": 3.8275068561751324e-05,
      "loss": 1.3625,
      "num_input_tokens_seen": 28693359632,
      "step": 36470
    },
    {
      "epoch": 3.869191597708466,
      "grad_norm": 0.46549510954790274,
      "learning_rate": 3.8274479660822746e-05,
      "loss": 1.4538,
      "num_input_tokens_seen": 28694146432,
      "step": 36471
    },
    {
      "epoch": 3.8692976872480376,
      "grad_norm": 0.43300911368854045,
      "learning_rate": 3.827389074963604e-05,
      "loss": 1.4774,
      "num_input_tokens_seen": 28694933184,
      "step": 36472
    },
    {
      "epoch": 3.8694037767876086,
      "grad_norm": 0.5314681912359849,
      "learning_rate": 3.827330182819166e-05,
      "loss": 1.3983,
      "num_input_tokens_seen": 28695719888,
      "step": 36473
    },
    {
      "epoch": 3.86950986632718,
      "grad_norm": 0.5513633078711535,
      "learning_rate": 3.827271289649007e-05,
      "loss": 1.4248,
      "num_input_tokens_seen": 28696506624,
      "step": 36474
    },
    {
      "epoch": 3.8696159558667516,
      "grad_norm": 0.5020173423767273,
      "learning_rate": 3.82721239545317e-05,
      "loss": 1.4456,
      "num_input_tokens_seen": 28697293440,
      "step": 36475
    },
    {
      "epoch": 3.869722045406323,
      "grad_norm": 0.6215960228445356,
      "learning_rate": 3.827153500231704e-05,
      "loss": 1.3064,
      "num_input_tokens_seen": 28698080176,
      "step": 36476
    },
    {
      "epoch": 3.8698281349458945,
      "grad_norm": 0.48857227579222706,
      "learning_rate": 3.8270946039846516e-05,
      "loss": 1.4904,
      "num_input_tokens_seen": 28698866880,
      "step": 36477
    },
    {
      "epoch": 3.8699342244854655,
      "grad_norm": 0.5000625107081091,
      "learning_rate": 3.82703570671206e-05,
      "loss": 1.545,
      "num_input_tokens_seen": 28699653584,
      "step": 36478
    },
    {
      "epoch": 3.870040314025037,
      "grad_norm": 0.49765592823972266,
      "learning_rate": 3.8269768084139736e-05,
      "loss": 1.4981,
      "num_input_tokens_seen": 28700440352,
      "step": 36479
    },
    {
      "epoch": 3.8701464035646085,
      "grad_norm": 0.42814750078052644,
      "learning_rate": 3.826917909090439e-05,
      "loss": 1.4411,
      "num_input_tokens_seen": 28701227072,
      "step": 36480
    },
    {
      "epoch": 3.87025249310418,
      "grad_norm": 0.4631093822962324,
      "learning_rate": 3.8268590087415e-05,
      "loss": 1.4973,
      "num_input_tokens_seen": 28702013792,
      "step": 36481
    },
    {
      "epoch": 3.8703585826437514,
      "grad_norm": 0.5153332560475868,
      "learning_rate": 3.826800107367204e-05,
      "loss": 1.4506,
      "num_input_tokens_seen": 28702800688,
      "step": 36482
    },
    {
      "epoch": 3.8704646721833225,
      "grad_norm": 0.4387916335725498,
      "learning_rate": 3.826741204967597e-05,
      "loss": 1.305,
      "num_input_tokens_seen": 28703587536,
      "step": 36483
    },
    {
      "epoch": 3.8705707617228944,
      "grad_norm": 0.45278840804433623,
      "learning_rate": 3.826682301542722e-05,
      "loss": 1.3694,
      "num_input_tokens_seen": 28704374368,
      "step": 36484
    },
    {
      "epoch": 3.8706768512624654,
      "grad_norm": 0.4353359004907713,
      "learning_rate": 3.826623397092626e-05,
      "loss": 1.3752,
      "num_input_tokens_seen": 28705161184,
      "step": 36485
    },
    {
      "epoch": 3.870782940802037,
      "grad_norm": 0.5541874372305745,
      "learning_rate": 3.826564491617355e-05,
      "loss": 1.4807,
      "num_input_tokens_seen": 28705948016,
      "step": 36486
    },
    {
      "epoch": 3.8708890303416084,
      "grad_norm": 0.5419732361329742,
      "learning_rate": 3.826505585116953e-05,
      "loss": 1.5693,
      "num_input_tokens_seen": 28706734688,
      "step": 36487
    },
    {
      "epoch": 3.87099511988118,
      "grad_norm": 0.4858372323896796,
      "learning_rate": 3.8264466775914665e-05,
      "loss": 1.4439,
      "num_input_tokens_seen": 28707521552,
      "step": 36488
    },
    {
      "epoch": 3.8711012094207513,
      "grad_norm": 0.6051094505809418,
      "learning_rate": 3.8263877690409415e-05,
      "loss": 1.5265,
      "num_input_tokens_seen": 28708308208,
      "step": 36489
    },
    {
      "epoch": 3.8712072989603223,
      "grad_norm": 0.4844662527946649,
      "learning_rate": 3.8263288594654226e-05,
      "loss": 1.5079,
      "num_input_tokens_seen": 28709095008,
      "step": 36490
    },
    {
      "epoch": 3.871313388499894,
      "grad_norm": 0.4735870130298094,
      "learning_rate": 3.826269948864956e-05,
      "loss": 1.4115,
      "num_input_tokens_seen": 28709881744,
      "step": 36491
    },
    {
      "epoch": 3.8714194780394653,
      "grad_norm": 0.4996160059770277,
      "learning_rate": 3.826211037239587e-05,
      "loss": 1.3736,
      "num_input_tokens_seen": 28710668480,
      "step": 36492
    },
    {
      "epoch": 3.8715255675790368,
      "grad_norm": 0.465066908813518,
      "learning_rate": 3.82615212458936e-05,
      "loss": 1.4578,
      "num_input_tokens_seen": 28711455280,
      "step": 36493
    },
    {
      "epoch": 3.8716316571186082,
      "grad_norm": 0.4581630731544318,
      "learning_rate": 3.826093210914322e-05,
      "loss": 1.4827,
      "num_input_tokens_seen": 28712242016,
      "step": 36494
    },
    {
      "epoch": 3.8717377466581793,
      "grad_norm": 0.47483774187059863,
      "learning_rate": 3.8260342962145184e-05,
      "loss": 1.4222,
      "num_input_tokens_seen": 28713028704,
      "step": 36495
    },
    {
      "epoch": 3.8718438361977507,
      "grad_norm": 0.5115727353891374,
      "learning_rate": 3.8259753804899943e-05,
      "loss": 1.454,
      "num_input_tokens_seen": 28713815440,
      "step": 36496
    },
    {
      "epoch": 3.871949925737322,
      "grad_norm": 0.4168333988627149,
      "learning_rate": 3.8259164637407956e-05,
      "loss": 1.4286,
      "num_input_tokens_seen": 28714602256,
      "step": 36497
    },
    {
      "epoch": 3.8720560152768937,
      "grad_norm": 0.5982212781941811,
      "learning_rate": 3.8258575459669674e-05,
      "loss": 1.5044,
      "num_input_tokens_seen": 28715388976,
      "step": 36498
    },
    {
      "epoch": 3.872162104816465,
      "grad_norm": 0.6426362833526063,
      "learning_rate": 3.8257986271685554e-05,
      "loss": 1.5108,
      "num_input_tokens_seen": 28716175792,
      "step": 36499
    },
    {
      "epoch": 3.8722681943560366,
      "grad_norm": 0.4718227547859092,
      "learning_rate": 3.825739707345605e-05,
      "loss": 1.3812,
      "num_input_tokens_seen": 28716962640,
      "step": 36500
    },
    {
      "epoch": 3.872374283895608,
      "grad_norm": 0.5624652994017956,
      "learning_rate": 3.825680786498161e-05,
      "loss": 1.4604,
      "num_input_tokens_seen": 28717749408,
      "step": 36501
    },
    {
      "epoch": 3.872480373435179,
      "grad_norm": 0.42130852554459863,
      "learning_rate": 3.825621864626271e-05,
      "loss": 1.2475,
      "num_input_tokens_seen": 28718536272,
      "step": 36502
    },
    {
      "epoch": 3.8725864629747506,
      "grad_norm": 0.5256243838305495,
      "learning_rate": 3.825562941729979e-05,
      "loss": 1.488,
      "num_input_tokens_seen": 28719323056,
      "step": 36503
    },
    {
      "epoch": 3.872692552514322,
      "grad_norm": 0.619491941879894,
      "learning_rate": 3.825504017809331e-05,
      "loss": 1.5223,
      "num_input_tokens_seen": 28720109728,
      "step": 36504
    },
    {
      "epoch": 3.8727986420538936,
      "grad_norm": 0.61997621962209,
      "learning_rate": 3.8254450928643726e-05,
      "loss": 1.4114,
      "num_input_tokens_seen": 28720896464,
      "step": 36505
    },
    {
      "epoch": 3.872904731593465,
      "grad_norm": 0.47799245294078757,
      "learning_rate": 3.825386166895148e-05,
      "loss": 1.4109,
      "num_input_tokens_seen": 28721683200,
      "step": 36506
    },
    {
      "epoch": 3.873010821133036,
      "grad_norm": 0.46563723732721146,
      "learning_rate": 3.825327239901705e-05,
      "loss": 1.4726,
      "num_input_tokens_seen": 28722470032,
      "step": 36507
    },
    {
      "epoch": 3.8731169106726075,
      "grad_norm": 0.5027364765549573,
      "learning_rate": 3.825268311884088e-05,
      "loss": 1.3652,
      "num_input_tokens_seen": 28723256768,
      "step": 36508
    },
    {
      "epoch": 3.873223000212179,
      "grad_norm": 0.5123863095592932,
      "learning_rate": 3.825209382842341e-05,
      "loss": 1.4543,
      "num_input_tokens_seen": 28724043568,
      "step": 36509
    },
    {
      "epoch": 3.8733290897517505,
      "grad_norm": 0.5187034087217305,
      "learning_rate": 3.8251504527765124e-05,
      "loss": 1.558,
      "num_input_tokens_seen": 28724830336,
      "step": 36510
    },
    {
      "epoch": 3.873435179291322,
      "grad_norm": 0.4582744171285151,
      "learning_rate": 3.8250915216866467e-05,
      "loss": 1.4204,
      "num_input_tokens_seen": 28725617152,
      "step": 36511
    },
    {
      "epoch": 3.873541268830893,
      "grad_norm": 0.5080473353497225,
      "learning_rate": 3.8250325895727886e-05,
      "loss": 1.4835,
      "num_input_tokens_seen": 28726403984,
      "step": 36512
    },
    {
      "epoch": 3.873647358370465,
      "grad_norm": 0.5178851632693099,
      "learning_rate": 3.8249736564349836e-05,
      "loss": 1.5532,
      "num_input_tokens_seen": 28727190736,
      "step": 36513
    },
    {
      "epoch": 3.873753447910036,
      "grad_norm": 0.41450848759832304,
      "learning_rate": 3.824914722273278e-05,
      "loss": 1.3239,
      "num_input_tokens_seen": 28727977488,
      "step": 36514
    },
    {
      "epoch": 3.8738595374496074,
      "grad_norm": 0.4778004566422524,
      "learning_rate": 3.824855787087719e-05,
      "loss": 1.3284,
      "num_input_tokens_seen": 28728764240,
      "step": 36515
    },
    {
      "epoch": 3.873965626989179,
      "grad_norm": 0.5627577014291633,
      "learning_rate": 3.824796850878348e-05,
      "loss": 1.4434,
      "num_input_tokens_seen": 28729550880,
      "step": 36516
    },
    {
      "epoch": 3.8740717165287504,
      "grad_norm": 0.47598612966324366,
      "learning_rate": 3.824737913645214e-05,
      "loss": 1.5575,
      "num_input_tokens_seen": 28730337616,
      "step": 36517
    },
    {
      "epoch": 3.874177806068322,
      "grad_norm": 0.6935269137647089,
      "learning_rate": 3.8246789753883614e-05,
      "loss": 1.4763,
      "num_input_tokens_seen": 28731124416,
      "step": 36518
    },
    {
      "epoch": 3.874283895607893,
      "grad_norm": 0.43405748855342796,
      "learning_rate": 3.8246200361078355e-05,
      "loss": 1.4914,
      "num_input_tokens_seen": 28731911216,
      "step": 36519
    },
    {
      "epoch": 3.8743899851474644,
      "grad_norm": 0.5958377554330377,
      "learning_rate": 3.8245610958036824e-05,
      "loss": 1.3775,
      "num_input_tokens_seen": 28732697984,
      "step": 36520
    },
    {
      "epoch": 3.874496074687036,
      "grad_norm": 0.47182301985168396,
      "learning_rate": 3.824502154475948e-05,
      "loss": 1.5075,
      "num_input_tokens_seen": 28733484816,
      "step": 36521
    },
    {
      "epoch": 3.8746021642266073,
      "grad_norm": 0.42322406053089856,
      "learning_rate": 3.824443212124675e-05,
      "loss": 1.4587,
      "num_input_tokens_seen": 28734271600,
      "step": 36522
    },
    {
      "epoch": 3.874708253766179,
      "grad_norm": 0.5811374276104426,
      "learning_rate": 3.824384268749913e-05,
      "loss": 1.383,
      "num_input_tokens_seen": 28735058320,
      "step": 36523
    },
    {
      "epoch": 3.87481434330575,
      "grad_norm": 0.5087100217212722,
      "learning_rate": 3.824325324351705e-05,
      "loss": 1.5137,
      "num_input_tokens_seen": 28735845040,
      "step": 36524
    },
    {
      "epoch": 3.8749204328453217,
      "grad_norm": 0.5255080104717655,
      "learning_rate": 3.824266378930098e-05,
      "loss": 1.5309,
      "num_input_tokens_seen": 28736631696,
      "step": 36525
    },
    {
      "epoch": 3.8750265223848928,
      "grad_norm": 0.507338238120808,
      "learning_rate": 3.8242074324851365e-05,
      "loss": 1.4715,
      "num_input_tokens_seen": 28737418352,
      "step": 36526
    },
    {
      "epoch": 3.8751326119244642,
      "grad_norm": 0.5258915754936435,
      "learning_rate": 3.824148485016865e-05,
      "loss": 1.4562,
      "num_input_tokens_seen": 28738205136,
      "step": 36527
    },
    {
      "epoch": 3.8752387014640357,
      "grad_norm": 0.40342443679344675,
      "learning_rate": 3.824089536525332e-05,
      "loss": 1.343,
      "num_input_tokens_seen": 28738991920,
      "step": 36528
    },
    {
      "epoch": 3.875344791003607,
      "grad_norm": 0.5117950797905062,
      "learning_rate": 3.8240305870105814e-05,
      "loss": 1.3523,
      "num_input_tokens_seen": 28739778768,
      "step": 36529
    },
    {
      "epoch": 3.8754508805431787,
      "grad_norm": 0.45874328098484435,
      "learning_rate": 3.823971636472658e-05,
      "loss": 1.4076,
      "num_input_tokens_seen": 28740565552,
      "step": 36530
    },
    {
      "epoch": 3.8755569700827497,
      "grad_norm": 0.37868884589681284,
      "learning_rate": 3.823912684911609e-05,
      "loss": 1.2875,
      "num_input_tokens_seen": 28741352384,
      "step": 36531
    },
    {
      "epoch": 3.875663059622321,
      "grad_norm": 0.4459736180101407,
      "learning_rate": 3.8238537323274784e-05,
      "loss": 1.4395,
      "num_input_tokens_seen": 28742139088,
      "step": 36532
    },
    {
      "epoch": 3.8757691491618926,
      "grad_norm": 0.47831877427390485,
      "learning_rate": 3.8237947787203125e-05,
      "loss": 1.3134,
      "num_input_tokens_seen": 28742925856,
      "step": 36533
    },
    {
      "epoch": 3.875875238701464,
      "grad_norm": 0.6008267823747858,
      "learning_rate": 3.823735824090157e-05,
      "loss": 1.4875,
      "num_input_tokens_seen": 28743712496,
      "step": 36534
    },
    {
      "epoch": 3.8759813282410356,
      "grad_norm": 0.4447677661018923,
      "learning_rate": 3.8236768684370575e-05,
      "loss": 1.438,
      "num_input_tokens_seen": 28744499232,
      "step": 36535
    },
    {
      "epoch": 3.8760874177806066,
      "grad_norm": 0.46909419927313495,
      "learning_rate": 3.823617911761059e-05,
      "loss": 1.4634,
      "num_input_tokens_seen": 28745285936,
      "step": 36536
    },
    {
      "epoch": 3.876193507320178,
      "grad_norm": 0.6937760069777025,
      "learning_rate": 3.823558954062208e-05,
      "loss": 1.3627,
      "num_input_tokens_seen": 28746072800,
      "step": 36537
    },
    {
      "epoch": 3.8762995968597496,
      "grad_norm": 0.555632029943116,
      "learning_rate": 3.823499995340549e-05,
      "loss": 1.5202,
      "num_input_tokens_seen": 28746859488,
      "step": 36538
    },
    {
      "epoch": 3.876405686399321,
      "grad_norm": 0.6491275522352186,
      "learning_rate": 3.823441035596128e-05,
      "loss": 1.4188,
      "num_input_tokens_seen": 28747646256,
      "step": 36539
    },
    {
      "epoch": 3.8765117759388925,
      "grad_norm": 0.6750705493884914,
      "learning_rate": 3.823382074828991e-05,
      "loss": 1.3676,
      "num_input_tokens_seen": 28748433024,
      "step": 36540
    },
    {
      "epoch": 3.876617865478464,
      "grad_norm": 0.4094998701915129,
      "learning_rate": 3.823323113039183e-05,
      "loss": 1.4133,
      "num_input_tokens_seen": 28749219824,
      "step": 36541
    },
    {
      "epoch": 3.8767239550180355,
      "grad_norm": 0.6873024291464487,
      "learning_rate": 3.8232641502267494e-05,
      "loss": 1.4153,
      "num_input_tokens_seen": 28750006608,
      "step": 36542
    },
    {
      "epoch": 3.8768300445576065,
      "grad_norm": 0.5860762013631323,
      "learning_rate": 3.8232051863917365e-05,
      "loss": 1.5236,
      "num_input_tokens_seen": 28750793264,
      "step": 36543
    },
    {
      "epoch": 3.876936134097178,
      "grad_norm": 0.622166283082997,
      "learning_rate": 3.8231462215341895e-05,
      "loss": 1.6307,
      "num_input_tokens_seen": 28751579952,
      "step": 36544
    },
    {
      "epoch": 3.8770422236367494,
      "grad_norm": 0.6414251807465237,
      "learning_rate": 3.823087255654154e-05,
      "loss": 1.4011,
      "num_input_tokens_seen": 28752366672,
      "step": 36545
    },
    {
      "epoch": 3.877148313176321,
      "grad_norm": 0.5270036550107153,
      "learning_rate": 3.823028288751675e-05,
      "loss": 1.4064,
      "num_input_tokens_seen": 28753153328,
      "step": 36546
    },
    {
      "epoch": 3.8772544027158924,
      "grad_norm": 0.5536797944704461,
      "learning_rate": 3.8229693208267985e-05,
      "loss": 1.4044,
      "num_input_tokens_seen": 28753939968,
      "step": 36547
    },
    {
      "epoch": 3.8773604922554634,
      "grad_norm": 0.43125279199152816,
      "learning_rate": 3.8229103518795704e-05,
      "loss": 1.4602,
      "num_input_tokens_seen": 28754726704,
      "step": 36548
    },
    {
      "epoch": 3.877466581795035,
      "grad_norm": 0.5992003571587883,
      "learning_rate": 3.8228513819100366e-05,
      "loss": 1.5583,
      "num_input_tokens_seen": 28755513472,
      "step": 36549
    },
    {
      "epoch": 3.8775726713346064,
      "grad_norm": 0.5039291560061553,
      "learning_rate": 3.822792410918241e-05,
      "loss": 1.3989,
      "num_input_tokens_seen": 28756300304,
      "step": 36550
    },
    {
      "epoch": 3.877678760874178,
      "grad_norm": 0.7191374027291039,
      "learning_rate": 3.8227334389042306e-05,
      "loss": 1.4884,
      "num_input_tokens_seen": 28757086992,
      "step": 36551
    },
    {
      "epoch": 3.8777848504137493,
      "grad_norm": 0.5053602727892317,
      "learning_rate": 3.82267446586805e-05,
      "loss": 1.448,
      "num_input_tokens_seen": 28757873840,
      "step": 36552
    },
    {
      "epoch": 3.8778909399533203,
      "grad_norm": 0.47418613326883463,
      "learning_rate": 3.822615491809747e-05,
      "loss": 1.4385,
      "num_input_tokens_seen": 28758660560,
      "step": 36553
    },
    {
      "epoch": 3.8779970294928923,
      "grad_norm": 0.6413407511160558,
      "learning_rate": 3.822556516729365e-05,
      "loss": 1.4982,
      "num_input_tokens_seen": 28759447296,
      "step": 36554
    },
    {
      "epoch": 3.8781031190324633,
      "grad_norm": 0.4596940271292984,
      "learning_rate": 3.822497540626949e-05,
      "loss": 1.4251,
      "num_input_tokens_seen": 28760233968,
      "step": 36555
    },
    {
      "epoch": 3.8782092085720348,
      "grad_norm": 0.3896274405950284,
      "learning_rate": 3.8224385635025464e-05,
      "loss": 1.3925,
      "num_input_tokens_seen": 28761020784,
      "step": 36556
    },
    {
      "epoch": 3.8783152981116062,
      "grad_norm": 0.7475218119129964,
      "learning_rate": 3.822379585356203e-05,
      "loss": 1.4727,
      "num_input_tokens_seen": 28761807536,
      "step": 36557
    },
    {
      "epoch": 3.8784213876511777,
      "grad_norm": 0.4519995965571576,
      "learning_rate": 3.8223206061879626e-05,
      "loss": 1.5405,
      "num_input_tokens_seen": 28762594208,
      "step": 36558
    },
    {
      "epoch": 3.878527477190749,
      "grad_norm": 0.44672583976068564,
      "learning_rate": 3.8222616259978704e-05,
      "loss": 1.4622,
      "num_input_tokens_seen": 28763380880,
      "step": 36559
    },
    {
      "epoch": 3.8786335667303202,
      "grad_norm": 0.493938260060776,
      "learning_rate": 3.822202644785975e-05,
      "loss": 1.4667,
      "num_input_tokens_seen": 28764167584,
      "step": 36560
    },
    {
      "epoch": 3.8787396562698917,
      "grad_norm": 0.36986021943144004,
      "learning_rate": 3.822143662552319e-05,
      "loss": 1.37,
      "num_input_tokens_seen": 28764954416,
      "step": 36561
    },
    {
      "epoch": 3.878845745809463,
      "grad_norm": 0.5277373773803758,
      "learning_rate": 3.82208467929695e-05,
      "loss": 1.4509,
      "num_input_tokens_seen": 28765741200,
      "step": 36562
    },
    {
      "epoch": 3.8789518353490346,
      "grad_norm": 0.41078478005996577,
      "learning_rate": 3.822025695019913e-05,
      "loss": 1.4262,
      "num_input_tokens_seen": 28766528032,
      "step": 36563
    },
    {
      "epoch": 3.879057924888606,
      "grad_norm": 0.4243084778439194,
      "learning_rate": 3.821966709721253e-05,
      "loss": 1.4357,
      "num_input_tokens_seen": 28767314864,
      "step": 36564
    },
    {
      "epoch": 3.879164014428177,
      "grad_norm": 0.5442939083899522,
      "learning_rate": 3.821907723401016e-05,
      "loss": 1.5065,
      "num_input_tokens_seen": 28768101616,
      "step": 36565
    },
    {
      "epoch": 3.8792701039677486,
      "grad_norm": 0.5135995212264135,
      "learning_rate": 3.821848736059247e-05,
      "loss": 1.4611,
      "num_input_tokens_seen": 28768888384,
      "step": 36566
    },
    {
      "epoch": 3.87937619350732,
      "grad_norm": 0.6607645970782605,
      "learning_rate": 3.8217897476959927e-05,
      "loss": 1.4993,
      "num_input_tokens_seen": 28769675120,
      "step": 36567
    },
    {
      "epoch": 3.8794822830468916,
      "grad_norm": 0.6070266779739099,
      "learning_rate": 3.8217307583112975e-05,
      "loss": 1.4476,
      "num_input_tokens_seen": 28770461904,
      "step": 36568
    },
    {
      "epoch": 3.879588372586463,
      "grad_norm": 0.4968966627312046,
      "learning_rate": 3.8216717679052086e-05,
      "loss": 1.4482,
      "num_input_tokens_seen": 28771248736,
      "step": 36569
    },
    {
      "epoch": 3.8796944621260345,
      "grad_norm": 0.577982059479228,
      "learning_rate": 3.821612776477769e-05,
      "loss": 1.5195,
      "num_input_tokens_seen": 28772035440,
      "step": 36570
    },
    {
      "epoch": 3.879800551665606,
      "grad_norm": 0.49586413385155675,
      "learning_rate": 3.8215537840290275e-05,
      "loss": 1.4004,
      "num_input_tokens_seen": 28772822192,
      "step": 36571
    },
    {
      "epoch": 3.879906641205177,
      "grad_norm": 0.5242348597265837,
      "learning_rate": 3.821494790559027e-05,
      "loss": 1.4157,
      "num_input_tokens_seen": 28773608960,
      "step": 36572
    },
    {
      "epoch": 3.8800127307447485,
      "grad_norm": 0.5224170766712014,
      "learning_rate": 3.821435796067814e-05,
      "loss": 1.4171,
      "num_input_tokens_seen": 28774395728,
      "step": 36573
    },
    {
      "epoch": 3.88011882028432,
      "grad_norm": 0.5584762201234632,
      "learning_rate": 3.821376800555434e-05,
      "loss": 1.4945,
      "num_input_tokens_seen": 28775182624,
      "step": 36574
    },
    {
      "epoch": 3.8802249098238915,
      "grad_norm": 0.45573448003950273,
      "learning_rate": 3.8213178040219335e-05,
      "loss": 1.506,
      "num_input_tokens_seen": 28775969456,
      "step": 36575
    },
    {
      "epoch": 3.880330999363463,
      "grad_norm": 0.49284486830215285,
      "learning_rate": 3.821258806467357e-05,
      "loss": 1.4164,
      "num_input_tokens_seen": 28776756128,
      "step": 36576
    },
    {
      "epoch": 3.880437088903034,
      "grad_norm": 0.49011759470362914,
      "learning_rate": 3.8211998078917505e-05,
      "loss": 1.4263,
      "num_input_tokens_seen": 28777542912,
      "step": 36577
    },
    {
      "epoch": 3.8805431784426054,
      "grad_norm": 0.48802228494544925,
      "learning_rate": 3.82114080829516e-05,
      "loss": 1.3946,
      "num_input_tokens_seen": 28778329728,
      "step": 36578
    },
    {
      "epoch": 3.880649267982177,
      "grad_norm": 0.5029172403965867,
      "learning_rate": 3.821081807677629e-05,
      "loss": 1.5515,
      "num_input_tokens_seen": 28779116432,
      "step": 36579
    },
    {
      "epoch": 3.8807553575217484,
      "grad_norm": 0.778025804221758,
      "learning_rate": 3.8210228060392066e-05,
      "loss": 1.4666,
      "num_input_tokens_seen": 28779903088,
      "step": 36580
    },
    {
      "epoch": 3.88086144706132,
      "grad_norm": 0.4245367756630188,
      "learning_rate": 3.820963803379936e-05,
      "loss": 1.4988,
      "num_input_tokens_seen": 28780689856,
      "step": 36581
    },
    {
      "epoch": 3.880967536600891,
      "grad_norm": 0.8944688653236789,
      "learning_rate": 3.820904799699863e-05,
      "loss": 1.4858,
      "num_input_tokens_seen": 28781476640,
      "step": 36582
    },
    {
      "epoch": 3.881073626140463,
      "grad_norm": 0.4983273327915753,
      "learning_rate": 3.820845794999034e-05,
      "loss": 1.4863,
      "num_input_tokens_seen": 28782263344,
      "step": 36583
    },
    {
      "epoch": 3.881179715680034,
      "grad_norm": 0.8318634974847378,
      "learning_rate": 3.8207867892774936e-05,
      "loss": 1.5136,
      "num_input_tokens_seen": 28783050112,
      "step": 36584
    },
    {
      "epoch": 3.8812858052196053,
      "grad_norm": 0.46475585781429807,
      "learning_rate": 3.820727782535288e-05,
      "loss": 1.494,
      "num_input_tokens_seen": 28783836960,
      "step": 36585
    },
    {
      "epoch": 3.881391894759177,
      "grad_norm": 0.48344846778289324,
      "learning_rate": 3.8206687747724635e-05,
      "loss": 1.4036,
      "num_input_tokens_seen": 28784623664,
      "step": 36586
    },
    {
      "epoch": 3.8814979842987483,
      "grad_norm": 0.673251024508026,
      "learning_rate": 3.820609765989064e-05,
      "loss": 1.4315,
      "num_input_tokens_seen": 28785410592,
      "step": 36587
    },
    {
      "epoch": 3.8816040738383197,
      "grad_norm": 0.5150636935935949,
      "learning_rate": 3.820550756185136e-05,
      "loss": 1.4618,
      "num_input_tokens_seen": 28786197424,
      "step": 36588
    },
    {
      "epoch": 3.8817101633778908,
      "grad_norm": 0.5315945990070365,
      "learning_rate": 3.8204917453607255e-05,
      "loss": 1.472,
      "num_input_tokens_seen": 28786984208,
      "step": 36589
    },
    {
      "epoch": 3.8818162529174622,
      "grad_norm": 0.5427349937707374,
      "learning_rate": 3.820432733515878e-05,
      "loss": 1.4385,
      "num_input_tokens_seen": 28787770944,
      "step": 36590
    },
    {
      "epoch": 3.8819223424570337,
      "grad_norm": 0.46947103394754336,
      "learning_rate": 3.8203737206506385e-05,
      "loss": 1.4137,
      "num_input_tokens_seen": 28788557632,
      "step": 36591
    },
    {
      "epoch": 3.882028431996605,
      "grad_norm": 0.5014190166668996,
      "learning_rate": 3.820314706765054e-05,
      "loss": 1.5092,
      "num_input_tokens_seen": 28789344320,
      "step": 36592
    },
    {
      "epoch": 3.8821345215361767,
      "grad_norm": 0.50548839417315,
      "learning_rate": 3.820255691859167e-05,
      "loss": 1.5215,
      "num_input_tokens_seen": 28790131088,
      "step": 36593
    },
    {
      "epoch": 3.8822406110757477,
      "grad_norm": 0.5744347838336633,
      "learning_rate": 3.8201966759330266e-05,
      "loss": 1.5676,
      "num_input_tokens_seen": 28790917872,
      "step": 36594
    },
    {
      "epoch": 3.882346700615319,
      "grad_norm": 0.4498631287596268,
      "learning_rate": 3.820137658986676e-05,
      "loss": 1.4954,
      "num_input_tokens_seen": 28791704576,
      "step": 36595
    },
    {
      "epoch": 3.8824527901548906,
      "grad_norm": 0.45673653178430024,
      "learning_rate": 3.820078641020163e-05,
      "loss": 1.4818,
      "num_input_tokens_seen": 28792491312,
      "step": 36596
    },
    {
      "epoch": 3.882558879694462,
      "grad_norm": 0.4849549077658867,
      "learning_rate": 3.82001962203353e-05,
      "loss": 1.4626,
      "num_input_tokens_seen": 28793278128,
      "step": 36597
    },
    {
      "epoch": 3.8826649692340336,
      "grad_norm": 0.42607241358187997,
      "learning_rate": 3.819960602026826e-05,
      "loss": 1.3937,
      "num_input_tokens_seen": 28794064944,
      "step": 36598
    },
    {
      "epoch": 3.882771058773605,
      "grad_norm": 0.5291862521056845,
      "learning_rate": 3.819901581000096e-05,
      "loss": 1.436,
      "num_input_tokens_seen": 28794851680,
      "step": 36599
    },
    {
      "epoch": 3.8828771483131765,
      "grad_norm": 0.48817727580080433,
      "learning_rate": 3.819842558953384e-05,
      "loss": 1.4898,
      "num_input_tokens_seen": 28795638480,
      "step": 36600
    },
    {
      "epoch": 3.8829832378527476,
      "grad_norm": 0.4498748085874393,
      "learning_rate": 3.819783535886735e-05,
      "loss": 1.5256,
      "num_input_tokens_seen": 28796425200,
      "step": 36601
    },
    {
      "epoch": 3.883089327392319,
      "grad_norm": 0.5105602451009122,
      "learning_rate": 3.819724511800198e-05,
      "loss": 1.5385,
      "num_input_tokens_seen": 28797211888,
      "step": 36602
    },
    {
      "epoch": 3.8831954169318905,
      "grad_norm": 0.4379998178989158,
      "learning_rate": 3.8196654866938154e-05,
      "loss": 1.4369,
      "num_input_tokens_seen": 28797998688,
      "step": 36603
    },
    {
      "epoch": 3.883301506471462,
      "grad_norm": 0.45486730917146695,
      "learning_rate": 3.8196064605676343e-05,
      "loss": 1.4493,
      "num_input_tokens_seen": 28798785456,
      "step": 36604
    },
    {
      "epoch": 3.8834075960110335,
      "grad_norm": 0.45344497939361883,
      "learning_rate": 3.8195474334217e-05,
      "loss": 1.5581,
      "num_input_tokens_seen": 28799572144,
      "step": 36605
    },
    {
      "epoch": 3.8835136855506045,
      "grad_norm": 0.4820378722152688,
      "learning_rate": 3.819488405256059e-05,
      "loss": 1.4115,
      "num_input_tokens_seen": 28800358912,
      "step": 36606
    },
    {
      "epoch": 3.883619775090176,
      "grad_norm": 0.41357456773838297,
      "learning_rate": 3.8194293760707546e-05,
      "loss": 1.4446,
      "num_input_tokens_seen": 28801145712,
      "step": 36607
    },
    {
      "epoch": 3.8837258646297474,
      "grad_norm": 0.5574821491245873,
      "learning_rate": 3.819370345865835e-05,
      "loss": 1.3816,
      "num_input_tokens_seen": 28801932464,
      "step": 36608
    },
    {
      "epoch": 3.883831954169319,
      "grad_norm": 0.5360418598962227,
      "learning_rate": 3.819311314641344e-05,
      "loss": 1.5056,
      "num_input_tokens_seen": 28802719392,
      "step": 36609
    },
    {
      "epoch": 3.8839380437088904,
      "grad_norm": 0.47537402479462854,
      "learning_rate": 3.819252282397328e-05,
      "loss": 1.4369,
      "num_input_tokens_seen": 28803506112,
      "step": 36610
    },
    {
      "epoch": 3.8840441332484614,
      "grad_norm": 0.6070543497771526,
      "learning_rate": 3.819193249133833e-05,
      "loss": 1.4293,
      "num_input_tokens_seen": 28804292864,
      "step": 36611
    },
    {
      "epoch": 3.8841502227880333,
      "grad_norm": 0.48301534028208143,
      "learning_rate": 3.819134214850904e-05,
      "loss": 1.4119,
      "num_input_tokens_seen": 28805079632,
      "step": 36612
    },
    {
      "epoch": 3.8842563123276044,
      "grad_norm": 0.43564567880174465,
      "learning_rate": 3.819075179548587e-05,
      "loss": 1.4467,
      "num_input_tokens_seen": 28805866336,
      "step": 36613
    },
    {
      "epoch": 3.884362401867176,
      "grad_norm": 0.5692846976265288,
      "learning_rate": 3.8190161432269264e-05,
      "loss": 1.51,
      "num_input_tokens_seen": 28806653104,
      "step": 36614
    },
    {
      "epoch": 3.8844684914067473,
      "grad_norm": 0.4646292184524361,
      "learning_rate": 3.818957105885971e-05,
      "loss": 1.4586,
      "num_input_tokens_seen": 28807439920,
      "step": 36615
    },
    {
      "epoch": 3.884574580946319,
      "grad_norm": 0.6071619513433629,
      "learning_rate": 3.818898067525762e-05,
      "loss": 1.446,
      "num_input_tokens_seen": 28808226656,
      "step": 36616
    },
    {
      "epoch": 3.8846806704858903,
      "grad_norm": 0.5389879479133396,
      "learning_rate": 3.818839028146348e-05,
      "loss": 1.5426,
      "num_input_tokens_seen": 28809013360,
      "step": 36617
    },
    {
      "epoch": 3.8847867600254613,
      "grad_norm": 0.463979198735508,
      "learning_rate": 3.818779987747775e-05,
      "loss": 1.4383,
      "num_input_tokens_seen": 28809800032,
      "step": 36618
    },
    {
      "epoch": 3.884892849565033,
      "grad_norm": 0.4990405557534464,
      "learning_rate": 3.818720946330086e-05,
      "loss": 1.4525,
      "num_input_tokens_seen": 28810586848,
      "step": 36619
    },
    {
      "epoch": 3.8849989391046043,
      "grad_norm": 0.4575768654277181,
      "learning_rate": 3.818661903893329e-05,
      "loss": 1.3783,
      "num_input_tokens_seen": 28811373632,
      "step": 36620
    },
    {
      "epoch": 3.8851050286441757,
      "grad_norm": 0.44136021828579003,
      "learning_rate": 3.818602860437548e-05,
      "loss": 1.3227,
      "num_input_tokens_seen": 28812160384,
      "step": 36621
    },
    {
      "epoch": 3.885211118183747,
      "grad_norm": 0.4698916943433177,
      "learning_rate": 3.81854381596279e-05,
      "loss": 1.3619,
      "num_input_tokens_seen": 28812947200,
      "step": 36622
    },
    {
      "epoch": 3.8853172077233182,
      "grad_norm": 0.5363841573989923,
      "learning_rate": 3.8184847704691e-05,
      "loss": 1.4833,
      "num_input_tokens_seen": 28813734000,
      "step": 36623
    },
    {
      "epoch": 3.88542329726289,
      "grad_norm": 0.45450541658722227,
      "learning_rate": 3.818425723956523e-05,
      "loss": 1.4238,
      "num_input_tokens_seen": 28814520768,
      "step": 36624
    },
    {
      "epoch": 3.885529386802461,
      "grad_norm": 0.4865050023402938,
      "learning_rate": 3.818366676425106e-05,
      "loss": 1.5702,
      "num_input_tokens_seen": 28815307424,
      "step": 36625
    },
    {
      "epoch": 3.8856354763420327,
      "grad_norm": 0.5015096812031196,
      "learning_rate": 3.818307627874894e-05,
      "loss": 1.5032,
      "num_input_tokens_seen": 28816094112,
      "step": 36626
    },
    {
      "epoch": 3.885741565881604,
      "grad_norm": 0.4595545576422276,
      "learning_rate": 3.818248578305932e-05,
      "loss": 1.5174,
      "num_input_tokens_seen": 28816880896,
      "step": 36627
    },
    {
      "epoch": 3.8858476554211756,
      "grad_norm": 0.43604956015450674,
      "learning_rate": 3.818189527718267e-05,
      "loss": 1.3781,
      "num_input_tokens_seen": 28817667648,
      "step": 36628
    },
    {
      "epoch": 3.885953744960747,
      "grad_norm": 0.45869848401775515,
      "learning_rate": 3.8181304761119436e-05,
      "loss": 1.4544,
      "num_input_tokens_seen": 28818454416,
      "step": 36629
    },
    {
      "epoch": 3.886059834500318,
      "grad_norm": 0.4309971301132766,
      "learning_rate": 3.8180714234870076e-05,
      "loss": 1.4957,
      "num_input_tokens_seen": 28819241184,
      "step": 36630
    },
    {
      "epoch": 3.8861659240398896,
      "grad_norm": 0.4591223617697513,
      "learning_rate": 3.8180123698435044e-05,
      "loss": 1.5372,
      "num_input_tokens_seen": 28820027936,
      "step": 36631
    },
    {
      "epoch": 3.886272013579461,
      "grad_norm": 0.42480540345291623,
      "learning_rate": 3.817953315181479e-05,
      "loss": 1.4823,
      "num_input_tokens_seen": 28820814672,
      "step": 36632
    },
    {
      "epoch": 3.8863781031190325,
      "grad_norm": 0.45763333298997366,
      "learning_rate": 3.817894259500979e-05,
      "loss": 1.4355,
      "num_input_tokens_seen": 28821601392,
      "step": 36633
    },
    {
      "epoch": 3.886484192658604,
      "grad_norm": 0.45477539330939476,
      "learning_rate": 3.817835202802049e-05,
      "loss": 1.3372,
      "num_input_tokens_seen": 28822388176,
      "step": 36634
    },
    {
      "epoch": 3.886590282198175,
      "grad_norm": 0.5104854331067677,
      "learning_rate": 3.8177761450847346e-05,
      "loss": 1.3815,
      "num_input_tokens_seen": 28823174928,
      "step": 36635
    },
    {
      "epoch": 3.8866963717377465,
      "grad_norm": 0.4814884695566897,
      "learning_rate": 3.817717086349082e-05,
      "loss": 1.4949,
      "num_input_tokens_seen": 28823961696,
      "step": 36636
    },
    {
      "epoch": 3.886802461277318,
      "grad_norm": 0.5117756652595538,
      "learning_rate": 3.817658026595136e-05,
      "loss": 1.453,
      "num_input_tokens_seen": 28824748416,
      "step": 36637
    },
    {
      "epoch": 3.8869085508168895,
      "grad_norm": 0.45394010639939775,
      "learning_rate": 3.817598965822942e-05,
      "loss": 1.5507,
      "num_input_tokens_seen": 28825535184,
      "step": 36638
    },
    {
      "epoch": 3.887014640356461,
      "grad_norm": 0.5114599121062604,
      "learning_rate": 3.8175399040325454e-05,
      "loss": 1.3869,
      "num_input_tokens_seen": 28826321952,
      "step": 36639
    },
    {
      "epoch": 3.8871207298960324,
      "grad_norm": 0.4349979095791637,
      "learning_rate": 3.8174808412239945e-05,
      "loss": 1.3618,
      "num_input_tokens_seen": 28827108736,
      "step": 36640
    },
    {
      "epoch": 3.887226819435604,
      "grad_norm": 0.497028324420932,
      "learning_rate": 3.817421777397332e-05,
      "loss": 1.4858,
      "num_input_tokens_seen": 28827895440,
      "step": 36641
    },
    {
      "epoch": 3.887332908975175,
      "grad_norm": 0.4721152939053753,
      "learning_rate": 3.8173627125526045e-05,
      "loss": 1.4472,
      "num_input_tokens_seen": 28828682256,
      "step": 36642
    },
    {
      "epoch": 3.8874389985147464,
      "grad_norm": 0.4317662548812284,
      "learning_rate": 3.817303646689858e-05,
      "loss": 1.4777,
      "num_input_tokens_seen": 28829469072,
      "step": 36643
    },
    {
      "epoch": 3.887545088054318,
      "grad_norm": 0.49926926111213094,
      "learning_rate": 3.817244579809138e-05,
      "loss": 1.4668,
      "num_input_tokens_seen": 28830255840,
      "step": 36644
    },
    {
      "epoch": 3.8876511775938893,
      "grad_norm": 0.6166123513989236,
      "learning_rate": 3.81718551191049e-05,
      "loss": 1.4452,
      "num_input_tokens_seen": 28831042640,
      "step": 36645
    },
    {
      "epoch": 3.887757267133461,
      "grad_norm": 0.3996067296679268,
      "learning_rate": 3.81712644299396e-05,
      "loss": 1.3723,
      "num_input_tokens_seen": 28831829456,
      "step": 36646
    },
    {
      "epoch": 3.887863356673032,
      "grad_norm": 0.39559791465811595,
      "learning_rate": 3.8170673730595925e-05,
      "loss": 1.3659,
      "num_input_tokens_seen": 28832616320,
      "step": 36647
    },
    {
      "epoch": 3.8879694462126033,
      "grad_norm": 0.4516932256929038,
      "learning_rate": 3.8170083021074345e-05,
      "loss": 1.409,
      "num_input_tokens_seen": 28833403168,
      "step": 36648
    },
    {
      "epoch": 3.888075535752175,
      "grad_norm": 0.47707178193032534,
      "learning_rate": 3.816949230137532e-05,
      "loss": 1.4083,
      "num_input_tokens_seen": 28834190048,
      "step": 36649
    },
    {
      "epoch": 3.8881816252917463,
      "grad_norm": 0.6412377078215817,
      "learning_rate": 3.8168901571499285e-05,
      "loss": 1.3585,
      "num_input_tokens_seen": 28834976800,
      "step": 36650
    },
    {
      "epoch": 3.8882877148313177,
      "grad_norm": 0.4219566592353766,
      "learning_rate": 3.816831083144671e-05,
      "loss": 1.4177,
      "num_input_tokens_seen": 28835763616,
      "step": 36651
    },
    {
      "epoch": 3.8883938043708888,
      "grad_norm": 0.6031730010189058,
      "learning_rate": 3.816772008121806e-05,
      "loss": 1.4298,
      "num_input_tokens_seen": 28836550336,
      "step": 36652
    },
    {
      "epoch": 3.8884998939104607,
      "grad_norm": 0.6914089833701494,
      "learning_rate": 3.8167129320813765e-05,
      "loss": 1.5021,
      "num_input_tokens_seen": 28837337120,
      "step": 36653
    },
    {
      "epoch": 3.8886059834500317,
      "grad_norm": 0.4858408958427422,
      "learning_rate": 3.816653855023431e-05,
      "loss": 1.4027,
      "num_input_tokens_seen": 28838123920,
      "step": 36654
    },
    {
      "epoch": 3.888712072989603,
      "grad_norm": 0.6409584704354795,
      "learning_rate": 3.816594776948014e-05,
      "loss": 1.544,
      "num_input_tokens_seen": 28838910608,
      "step": 36655
    },
    {
      "epoch": 3.8888181625291747,
      "grad_norm": 0.45297161542960757,
      "learning_rate": 3.816535697855171e-05,
      "loss": 1.4481,
      "num_input_tokens_seen": 28839697360,
      "step": 36656
    },
    {
      "epoch": 3.888924252068746,
      "grad_norm": 0.5088636907184128,
      "learning_rate": 3.8164766177449484e-05,
      "loss": 1.4731,
      "num_input_tokens_seen": 28840484096,
      "step": 36657
    },
    {
      "epoch": 3.8890303416083176,
      "grad_norm": 0.46256592867649426,
      "learning_rate": 3.816417536617391e-05,
      "loss": 1.5252,
      "num_input_tokens_seen": 28841270896,
      "step": 36658
    },
    {
      "epoch": 3.8891364311478887,
      "grad_norm": 0.47308217761396537,
      "learning_rate": 3.8163584544725436e-05,
      "loss": 1.4192,
      "num_input_tokens_seen": 28842057600,
      "step": 36659
    },
    {
      "epoch": 3.88924252068746,
      "grad_norm": 0.4412327583232374,
      "learning_rate": 3.816299371310455e-05,
      "loss": 1.2966,
      "num_input_tokens_seen": 28842844384,
      "step": 36660
    },
    {
      "epoch": 3.8893486102270316,
      "grad_norm": 0.47722727928844155,
      "learning_rate": 3.816240287131168e-05,
      "loss": 1.4709,
      "num_input_tokens_seen": 28843631120,
      "step": 36661
    },
    {
      "epoch": 3.889454699766603,
      "grad_norm": 0.5065998977361916,
      "learning_rate": 3.816181201934729e-05,
      "loss": 1.5648,
      "num_input_tokens_seen": 28844417776,
      "step": 36662
    },
    {
      "epoch": 3.8895607893061745,
      "grad_norm": 0.44444827581509216,
      "learning_rate": 3.816122115721184e-05,
      "loss": 1.433,
      "num_input_tokens_seen": 28845204608,
      "step": 36663
    },
    {
      "epoch": 3.8896668788457456,
      "grad_norm": 0.5532440289709895,
      "learning_rate": 3.816063028490578e-05,
      "loss": 1.4797,
      "num_input_tokens_seen": 28845991328,
      "step": 36664
    },
    {
      "epoch": 3.889772968385317,
      "grad_norm": 0.4745398313639473,
      "learning_rate": 3.8160039402429575e-05,
      "loss": 1.4068,
      "num_input_tokens_seen": 28846778112,
      "step": 36665
    },
    {
      "epoch": 3.8898790579248885,
      "grad_norm": 0.6707630827383377,
      "learning_rate": 3.815944850978368e-05,
      "loss": 1.4851,
      "num_input_tokens_seen": 28847564832,
      "step": 36666
    },
    {
      "epoch": 3.88998514746446,
      "grad_norm": 0.43642465258223484,
      "learning_rate": 3.8158857606968544e-05,
      "loss": 1.471,
      "num_input_tokens_seen": 28848351552,
      "step": 36667
    },
    {
      "epoch": 3.8900912370040315,
      "grad_norm": 0.667655372470204,
      "learning_rate": 3.8158266693984635e-05,
      "loss": 1.3911,
      "num_input_tokens_seen": 28849138304,
      "step": 36668
    },
    {
      "epoch": 3.890197326543603,
      "grad_norm": 0.4825807078163834,
      "learning_rate": 3.81576757708324e-05,
      "loss": 1.4502,
      "num_input_tokens_seen": 28849925088,
      "step": 36669
    },
    {
      "epoch": 3.8903034160831744,
      "grad_norm": 0.5331560382515289,
      "learning_rate": 3.8157084837512294e-05,
      "loss": 1.4743,
      "num_input_tokens_seen": 28850711888,
      "step": 36670
    },
    {
      "epoch": 3.8904095056227455,
      "grad_norm": 0.6428202835307286,
      "learning_rate": 3.8156493894024784e-05,
      "loss": 1.4147,
      "num_input_tokens_seen": 28851498736,
      "step": 36671
    },
    {
      "epoch": 3.890515595162317,
      "grad_norm": 0.5044010532592201,
      "learning_rate": 3.8155902940370324e-05,
      "loss": 1.5086,
      "num_input_tokens_seen": 28852285552,
      "step": 36672
    },
    {
      "epoch": 3.8906216847018884,
      "grad_norm": 0.4603679808919009,
      "learning_rate": 3.815531197654936e-05,
      "loss": 1.3989,
      "num_input_tokens_seen": 28853072304,
      "step": 36673
    },
    {
      "epoch": 3.89072777424146,
      "grad_norm": 0.4981478263363329,
      "learning_rate": 3.815472100256236e-05,
      "loss": 1.4883,
      "num_input_tokens_seen": 28853859120,
      "step": 36674
    },
    {
      "epoch": 3.8908338637810314,
      "grad_norm": 0.5595806927636945,
      "learning_rate": 3.815413001840979e-05,
      "loss": 1.501,
      "num_input_tokens_seen": 28854645808,
      "step": 36675
    },
    {
      "epoch": 3.8909399533206024,
      "grad_norm": 0.44438940922965464,
      "learning_rate": 3.815353902409208e-05,
      "loss": 1.4312,
      "num_input_tokens_seen": 28855432560,
      "step": 36676
    },
    {
      "epoch": 3.891046042860174,
      "grad_norm": 0.52060113561706,
      "learning_rate": 3.815294801960971e-05,
      "loss": 1.4369,
      "num_input_tokens_seen": 28856219344,
      "step": 36677
    },
    {
      "epoch": 3.8911521323997453,
      "grad_norm": 0.5862552037459369,
      "learning_rate": 3.8152357004963125e-05,
      "loss": 1.6026,
      "num_input_tokens_seen": 28857006096,
      "step": 36678
    },
    {
      "epoch": 3.891258221939317,
      "grad_norm": 0.49841558663445384,
      "learning_rate": 3.8151765980152774e-05,
      "loss": 1.4332,
      "num_input_tokens_seen": 28857792848,
      "step": 36679
    },
    {
      "epoch": 3.8913643114788883,
      "grad_norm": 0.6609643784539114,
      "learning_rate": 3.815117494517913e-05,
      "loss": 1.3956,
      "num_input_tokens_seen": 28858579680,
      "step": 36680
    },
    {
      "epoch": 3.8914704010184593,
      "grad_norm": 0.5149609821856085,
      "learning_rate": 3.8150583900042655e-05,
      "loss": 1.5688,
      "num_input_tokens_seen": 28859366304,
      "step": 36681
    },
    {
      "epoch": 3.8915764905580312,
      "grad_norm": 0.56879617261111,
      "learning_rate": 3.814999284474379e-05,
      "loss": 1.4324,
      "num_input_tokens_seen": 28860153152,
      "step": 36682
    },
    {
      "epoch": 3.8916825800976023,
      "grad_norm": 0.5533671019039663,
      "learning_rate": 3.814940177928299e-05,
      "loss": 1.5235,
      "num_input_tokens_seen": 28860939904,
      "step": 36683
    },
    {
      "epoch": 3.8917886696371737,
      "grad_norm": 0.45529910670612567,
      "learning_rate": 3.814881070366072e-05,
      "loss": 1.4993,
      "num_input_tokens_seen": 28861726720,
      "step": 36684
    },
    {
      "epoch": 3.891894759176745,
      "grad_norm": 0.627145428418253,
      "learning_rate": 3.814821961787743e-05,
      "loss": 1.4747,
      "num_input_tokens_seen": 28862513456,
      "step": 36685
    },
    {
      "epoch": 3.8920008487163167,
      "grad_norm": 0.46120636611098925,
      "learning_rate": 3.81476285219336e-05,
      "loss": 1.4235,
      "num_input_tokens_seen": 28863300304,
      "step": 36686
    },
    {
      "epoch": 3.892106938255888,
      "grad_norm": 0.5228129211266529,
      "learning_rate": 3.814703741582964e-05,
      "loss": 1.5085,
      "num_input_tokens_seen": 28864087104,
      "step": 36687
    },
    {
      "epoch": 3.892213027795459,
      "grad_norm": 0.5075487241804352,
      "learning_rate": 3.814644629956606e-05,
      "loss": 1.4888,
      "num_input_tokens_seen": 28864873824,
      "step": 36688
    },
    {
      "epoch": 3.8923191173350307,
      "grad_norm": 0.5755567075640123,
      "learning_rate": 3.8145855173143286e-05,
      "loss": 1.5076,
      "num_input_tokens_seen": 28865660560,
      "step": 36689
    },
    {
      "epoch": 3.892425206874602,
      "grad_norm": 0.4421640489354581,
      "learning_rate": 3.8145264036561774e-05,
      "loss": 1.4788,
      "num_input_tokens_seen": 28866447344,
      "step": 36690
    },
    {
      "epoch": 3.8925312964141736,
      "grad_norm": 0.46118719347198306,
      "learning_rate": 3.814467288982199e-05,
      "loss": 1.527,
      "num_input_tokens_seen": 28867234112,
      "step": 36691
    },
    {
      "epoch": 3.892637385953745,
      "grad_norm": 0.465413549394807,
      "learning_rate": 3.8144081732924397e-05,
      "loss": 1.4811,
      "num_input_tokens_seen": 28868020864,
      "step": 36692
    },
    {
      "epoch": 3.892743475493316,
      "grad_norm": 0.39521172426548234,
      "learning_rate": 3.814349056586943e-05,
      "loss": 1.4319,
      "num_input_tokens_seen": 28868807664,
      "step": 36693
    },
    {
      "epoch": 3.8928495650328876,
      "grad_norm": 0.5038218663319399,
      "learning_rate": 3.814289938865757e-05,
      "loss": 1.4793,
      "num_input_tokens_seen": 28869594464,
      "step": 36694
    },
    {
      "epoch": 3.892955654572459,
      "grad_norm": 0.46286544114268724,
      "learning_rate": 3.814230820128926e-05,
      "loss": 1.4329,
      "num_input_tokens_seen": 28870381360,
      "step": 36695
    },
    {
      "epoch": 3.8930617441120305,
      "grad_norm": 0.5026479676975251,
      "learning_rate": 3.8141717003764954e-05,
      "loss": 1.4811,
      "num_input_tokens_seen": 28871168128,
      "step": 36696
    },
    {
      "epoch": 3.893167833651602,
      "grad_norm": 0.40819464490440643,
      "learning_rate": 3.814112579608512e-05,
      "loss": 1.5217,
      "num_input_tokens_seen": 28871954864,
      "step": 36697
    },
    {
      "epoch": 3.8932739231911735,
      "grad_norm": 0.4712897987748068,
      "learning_rate": 3.814053457825021e-05,
      "loss": 1.5184,
      "num_input_tokens_seen": 28872741664,
      "step": 36698
    },
    {
      "epoch": 3.893380012730745,
      "grad_norm": 0.42978381389287246,
      "learning_rate": 3.8139943350260675e-05,
      "loss": 1.4247,
      "num_input_tokens_seen": 28873528400,
      "step": 36699
    },
    {
      "epoch": 3.893486102270316,
      "grad_norm": 0.4807941229114083,
      "learning_rate": 3.8139352112116986e-05,
      "loss": 1.5368,
      "num_input_tokens_seen": 28874315200,
      "step": 36700
    },
    {
      "epoch": 3.8935921918098875,
      "grad_norm": 0.41513347861690253,
      "learning_rate": 3.813876086381958e-05,
      "loss": 1.5044,
      "num_input_tokens_seen": 28875101904,
      "step": 36701
    },
    {
      "epoch": 3.893698281349459,
      "grad_norm": 0.4159945052212001,
      "learning_rate": 3.8138169605368934e-05,
      "loss": 1.4129,
      "num_input_tokens_seen": 28875888672,
      "step": 36702
    },
    {
      "epoch": 3.8938043708890304,
      "grad_norm": 0.42914138291453763,
      "learning_rate": 3.813757833676549e-05,
      "loss": 1.435,
      "num_input_tokens_seen": 28876675488,
      "step": 36703
    },
    {
      "epoch": 3.893910460428602,
      "grad_norm": 0.4085572823891877,
      "learning_rate": 3.8136987058009724e-05,
      "loss": 1.4212,
      "num_input_tokens_seen": 28877462272,
      "step": 36704
    },
    {
      "epoch": 3.894016549968173,
      "grad_norm": 0.4085849861798346,
      "learning_rate": 3.813639576910206e-05,
      "loss": 1.4473,
      "num_input_tokens_seen": 28878249056,
      "step": 36705
    },
    {
      "epoch": 3.8941226395077444,
      "grad_norm": 0.40674678909560147,
      "learning_rate": 3.813580447004299e-05,
      "loss": 1.4793,
      "num_input_tokens_seen": 28879035728,
      "step": 36706
    },
    {
      "epoch": 3.894228729047316,
      "grad_norm": 0.3795454123862975,
      "learning_rate": 3.813521316083295e-05,
      "loss": 1.4369,
      "num_input_tokens_seen": 28879822512,
      "step": 36707
    },
    {
      "epoch": 3.8943348185868873,
      "grad_norm": 0.4168482703940978,
      "learning_rate": 3.813462184147241e-05,
      "loss": 1.4354,
      "num_input_tokens_seen": 28880609328,
      "step": 36708
    },
    {
      "epoch": 3.894440908126459,
      "grad_norm": 0.3961769843322228,
      "learning_rate": 3.813403051196181e-05,
      "loss": 1.3917,
      "num_input_tokens_seen": 28881396032,
      "step": 36709
    },
    {
      "epoch": 3.89454699766603,
      "grad_norm": 0.4885467647349694,
      "learning_rate": 3.8133439172301616e-05,
      "loss": 1.4507,
      "num_input_tokens_seen": 28882182704,
      "step": 36710
    },
    {
      "epoch": 3.8946530872056018,
      "grad_norm": 0.3812341293961959,
      "learning_rate": 3.813284782249229e-05,
      "loss": 1.3291,
      "num_input_tokens_seen": 28882969488,
      "step": 36711
    },
    {
      "epoch": 3.894759176745173,
      "grad_norm": 0.42002691203571463,
      "learning_rate": 3.813225646253429e-05,
      "loss": 1.4301,
      "num_input_tokens_seen": 28883756288,
      "step": 36712
    },
    {
      "epoch": 3.8948652662847443,
      "grad_norm": 0.4434769842961027,
      "learning_rate": 3.8131665092428056e-05,
      "loss": 1.3961,
      "num_input_tokens_seen": 28884543040,
      "step": 36713
    },
    {
      "epoch": 3.8949713558243158,
      "grad_norm": 0.3984048531897654,
      "learning_rate": 3.8131073712174065e-05,
      "loss": 1.4496,
      "num_input_tokens_seen": 28885329824,
      "step": 36714
    },
    {
      "epoch": 3.8950774453638872,
      "grad_norm": 0.3743954622219857,
      "learning_rate": 3.813048232177277e-05,
      "loss": 1.3734,
      "num_input_tokens_seen": 28886116608,
      "step": 36715
    },
    {
      "epoch": 3.8951835349034587,
      "grad_norm": 0.42705602549507793,
      "learning_rate": 3.812989092122461e-05,
      "loss": 1.3924,
      "num_input_tokens_seen": 28886903376,
      "step": 36716
    },
    {
      "epoch": 3.8952896244430297,
      "grad_norm": 0.43334398585037376,
      "learning_rate": 3.812929951053006e-05,
      "loss": 1.4883,
      "num_input_tokens_seen": 28887690144,
      "step": 36717
    },
    {
      "epoch": 3.895395713982601,
      "grad_norm": 0.40470826572057383,
      "learning_rate": 3.812870808968958e-05,
      "loss": 1.4603,
      "num_input_tokens_seen": 28888476896,
      "step": 36718
    },
    {
      "epoch": 3.8955018035221727,
      "grad_norm": 0.4025207240015716,
      "learning_rate": 3.81281166587036e-05,
      "loss": 1.4103,
      "num_input_tokens_seen": 28889263616,
      "step": 36719
    },
    {
      "epoch": 3.895607893061744,
      "grad_norm": 0.5046505288629827,
      "learning_rate": 3.8127525217572615e-05,
      "loss": 1.3723,
      "num_input_tokens_seen": 28890050432,
      "step": 36720
    },
    {
      "epoch": 3.8957139826013156,
      "grad_norm": 0.4850038702557338,
      "learning_rate": 3.8126933766297066e-05,
      "loss": 1.3512,
      "num_input_tokens_seen": 28890837168,
      "step": 36721
    },
    {
      "epoch": 3.8958200721408867,
      "grad_norm": 0.4200161073560534,
      "learning_rate": 3.8126342304877396e-05,
      "loss": 1.4253,
      "num_input_tokens_seen": 28891623904,
      "step": 36722
    },
    {
      "epoch": 3.8959261616804586,
      "grad_norm": 0.45360796670289905,
      "learning_rate": 3.812575083331408e-05,
      "loss": 1.5703,
      "num_input_tokens_seen": 28892410624,
      "step": 36723
    },
    {
      "epoch": 3.8960322512200296,
      "grad_norm": 0.4215717480218684,
      "learning_rate": 3.8125159351607564e-05,
      "loss": 1.3116,
      "num_input_tokens_seen": 28893197488,
      "step": 36724
    },
    {
      "epoch": 3.896138340759601,
      "grad_norm": 0.5320826687142688,
      "learning_rate": 3.812456785975832e-05,
      "loss": 1.3858,
      "num_input_tokens_seen": 28893984256,
      "step": 36725
    },
    {
      "epoch": 3.8962444302991726,
      "grad_norm": 0.5177007362776065,
      "learning_rate": 3.812397635776679e-05,
      "loss": 1.4136,
      "num_input_tokens_seen": 28894770992,
      "step": 36726
    },
    {
      "epoch": 3.896350519838744,
      "grad_norm": 0.6271702371006478,
      "learning_rate": 3.812338484563343e-05,
      "loss": 1.4706,
      "num_input_tokens_seen": 28895557728,
      "step": 36727
    },
    {
      "epoch": 3.8964566093783155,
      "grad_norm": 0.49840186261095737,
      "learning_rate": 3.8122793323358705e-05,
      "loss": 1.4906,
      "num_input_tokens_seen": 28896344544,
      "step": 36728
    },
    {
      "epoch": 3.8965626989178865,
      "grad_norm": 0.4922428743858949,
      "learning_rate": 3.812220179094308e-05,
      "loss": 1.4688,
      "num_input_tokens_seen": 28897131232,
      "step": 36729
    },
    {
      "epoch": 3.896668788457458,
      "grad_norm": 0.521377800519637,
      "learning_rate": 3.8121610248386996e-05,
      "loss": 1.4099,
      "num_input_tokens_seen": 28897917952,
      "step": 36730
    },
    {
      "epoch": 3.8967748779970295,
      "grad_norm": 0.5470359856602589,
      "learning_rate": 3.812101869569091e-05,
      "loss": 1.5336,
      "num_input_tokens_seen": 28898704736,
      "step": 36731
    },
    {
      "epoch": 3.896880967536601,
      "grad_norm": 0.4637911166747033,
      "learning_rate": 3.81204271328553e-05,
      "loss": 1.4159,
      "num_input_tokens_seen": 28899491488,
      "step": 36732
    },
    {
      "epoch": 3.8969870570761724,
      "grad_norm": 0.4984065185910992,
      "learning_rate": 3.81198355598806e-05,
      "loss": 1.424,
      "num_input_tokens_seen": 28900278304,
      "step": 36733
    },
    {
      "epoch": 3.8970931466157435,
      "grad_norm": 0.43370249516816123,
      "learning_rate": 3.8119243976767275e-05,
      "loss": 1.3968,
      "num_input_tokens_seen": 28901065056,
      "step": 36734
    },
    {
      "epoch": 3.897199236155315,
      "grad_norm": 0.5580486531242217,
      "learning_rate": 3.811865238351579e-05,
      "loss": 1.4649,
      "num_input_tokens_seen": 28901851792,
      "step": 36735
    },
    {
      "epoch": 3.8973053256948864,
      "grad_norm": 0.4438705597649483,
      "learning_rate": 3.811806078012659e-05,
      "loss": 1.3455,
      "num_input_tokens_seen": 28902638640,
      "step": 36736
    },
    {
      "epoch": 3.897411415234458,
      "grad_norm": 0.4297529718774885,
      "learning_rate": 3.8117469166600136e-05,
      "loss": 1.3825,
      "num_input_tokens_seen": 28903425376,
      "step": 36737
    },
    {
      "epoch": 3.8975175047740294,
      "grad_norm": 0.4607860713820287,
      "learning_rate": 3.811687754293689e-05,
      "loss": 1.5211,
      "num_input_tokens_seen": 28904212176,
      "step": 36738
    },
    {
      "epoch": 3.897623594313601,
      "grad_norm": 0.4989834358680354,
      "learning_rate": 3.811628590913731e-05,
      "loss": 1.3591,
      "num_input_tokens_seen": 28904999040,
      "step": 36739
    },
    {
      "epoch": 3.8977296838531723,
      "grad_norm": 0.5280071554124276,
      "learning_rate": 3.811569426520184e-05,
      "loss": 1.4471,
      "num_input_tokens_seen": 28905785792,
      "step": 36740
    },
    {
      "epoch": 3.8978357733927433,
      "grad_norm": 0.44966211726080413,
      "learning_rate": 3.811510261113095e-05,
      "loss": 1.4736,
      "num_input_tokens_seen": 28906572544,
      "step": 36741
    },
    {
      "epoch": 3.897941862932315,
      "grad_norm": 0.561290063143678,
      "learning_rate": 3.81145109469251e-05,
      "loss": 1.4762,
      "num_input_tokens_seen": 28907359248,
      "step": 36742
    },
    {
      "epoch": 3.8980479524718863,
      "grad_norm": 0.4396089533864563,
      "learning_rate": 3.811391927258473e-05,
      "loss": 1.435,
      "num_input_tokens_seen": 28908146032,
      "step": 36743
    },
    {
      "epoch": 3.8981540420114578,
      "grad_norm": 0.5216681441219815,
      "learning_rate": 3.811332758811031e-05,
      "loss": 1.3861,
      "num_input_tokens_seen": 28908932816,
      "step": 36744
    },
    {
      "epoch": 3.8982601315510292,
      "grad_norm": 0.525382396339564,
      "learning_rate": 3.81127358935023e-05,
      "loss": 1.518,
      "num_input_tokens_seen": 28909719600,
      "step": 36745
    },
    {
      "epoch": 3.8983662210906003,
      "grad_norm": 0.4551267396991024,
      "learning_rate": 3.811214418876115e-05,
      "loss": 1.4656,
      "num_input_tokens_seen": 28910506320,
      "step": 36746
    },
    {
      "epoch": 3.8984723106301717,
      "grad_norm": 0.5066980365204196,
      "learning_rate": 3.811155247388732e-05,
      "loss": 1.4612,
      "num_input_tokens_seen": 28911293088,
      "step": 36747
    },
    {
      "epoch": 3.898578400169743,
      "grad_norm": 0.4849373582822389,
      "learning_rate": 3.811096074888126e-05,
      "loss": 1.4356,
      "num_input_tokens_seen": 28912079936,
      "step": 36748
    },
    {
      "epoch": 3.8986844897093147,
      "grad_norm": 0.4322487412767376,
      "learning_rate": 3.811036901374345e-05,
      "loss": 1.3841,
      "num_input_tokens_seen": 28912866736,
      "step": 36749
    },
    {
      "epoch": 3.898790579248886,
      "grad_norm": 0.5867301160059929,
      "learning_rate": 3.8109777268474326e-05,
      "loss": 1.4538,
      "num_input_tokens_seen": 28913653424,
      "step": 36750
    },
    {
      "epoch": 3.898896668788457,
      "grad_norm": 0.4461293725920344,
      "learning_rate": 3.810918551307434e-05,
      "loss": 1.4262,
      "num_input_tokens_seen": 28914440208,
      "step": 36751
    },
    {
      "epoch": 3.899002758328029,
      "grad_norm": 0.4264614634115079,
      "learning_rate": 3.810859374754397e-05,
      "loss": 1.3668,
      "num_input_tokens_seen": 28915226928,
      "step": 36752
    },
    {
      "epoch": 3.8991088478676,
      "grad_norm": 0.6986581389665867,
      "learning_rate": 3.810800197188366e-05,
      "loss": 1.4552,
      "num_input_tokens_seen": 28916013648,
      "step": 36753
    },
    {
      "epoch": 3.8992149374071716,
      "grad_norm": 0.4372481869171786,
      "learning_rate": 3.810741018609387e-05,
      "loss": 1.545,
      "num_input_tokens_seen": 28916800368,
      "step": 36754
    },
    {
      "epoch": 3.899321026946743,
      "grad_norm": 0.7010093977914225,
      "learning_rate": 3.8106818390175056e-05,
      "loss": 1.5226,
      "num_input_tokens_seen": 28917587056,
      "step": 36755
    },
    {
      "epoch": 3.8994271164863146,
      "grad_norm": 0.5324654607603803,
      "learning_rate": 3.810622658412768e-05,
      "loss": 1.4267,
      "num_input_tokens_seen": 28918373888,
      "step": 36756
    },
    {
      "epoch": 3.899533206025886,
      "grad_norm": 0.4885700907272385,
      "learning_rate": 3.8105634767952206e-05,
      "loss": 1.5323,
      "num_input_tokens_seen": 28919160736,
      "step": 36757
    },
    {
      "epoch": 3.899639295565457,
      "grad_norm": 0.44052653677668957,
      "learning_rate": 3.810504294164907e-05,
      "loss": 1.3901,
      "num_input_tokens_seen": 28919947536,
      "step": 36758
    },
    {
      "epoch": 3.8997453851050286,
      "grad_norm": 0.5792695331268976,
      "learning_rate": 3.8104451105218745e-05,
      "loss": 1.5656,
      "num_input_tokens_seen": 28920734272,
      "step": 36759
    },
    {
      "epoch": 3.8998514746446,
      "grad_norm": 0.4482821798872944,
      "learning_rate": 3.8103859258661684e-05,
      "loss": 1.4921,
      "num_input_tokens_seen": 28921521104,
      "step": 36760
    },
    {
      "epoch": 3.8999575641841715,
      "grad_norm": 0.5272660268958836,
      "learning_rate": 3.810326740197835e-05,
      "loss": 1.5321,
      "num_input_tokens_seen": 28922307952,
      "step": 36761
    },
    {
      "epoch": 3.900063653723743,
      "grad_norm": 0.5478062989786554,
      "learning_rate": 3.810267553516919e-05,
      "loss": 1.2875,
      "num_input_tokens_seen": 28923094672,
      "step": 36762
    },
    {
      "epoch": 3.900169743263314,
      "grad_norm": 0.4504865472472604,
      "learning_rate": 3.8102083658234666e-05,
      "loss": 1.456,
      "num_input_tokens_seen": 28923881504,
      "step": 36763
    },
    {
      "epoch": 3.9002758328028855,
      "grad_norm": 0.5628864787923533,
      "learning_rate": 3.810149177117524e-05,
      "loss": 1.4034,
      "num_input_tokens_seen": 28924668256,
      "step": 36764
    },
    {
      "epoch": 3.900381922342457,
      "grad_norm": 0.5336309840157365,
      "learning_rate": 3.810089987399136e-05,
      "loss": 1.567,
      "num_input_tokens_seen": 28925454944,
      "step": 36765
    },
    {
      "epoch": 3.9004880118820284,
      "grad_norm": 0.5715209425432735,
      "learning_rate": 3.81003079666835e-05,
      "loss": 1.47,
      "num_input_tokens_seen": 28926241664,
      "step": 36766
    },
    {
      "epoch": 3.9005941014216,
      "grad_norm": 0.6684091611925495,
      "learning_rate": 3.809971604925209e-05,
      "loss": 1.4428,
      "num_input_tokens_seen": 28927028432,
      "step": 36767
    },
    {
      "epoch": 3.9007001909611714,
      "grad_norm": 0.6055703055101649,
      "learning_rate": 3.8099124121697616e-05,
      "loss": 1.4726,
      "num_input_tokens_seen": 28927815136,
      "step": 36768
    },
    {
      "epoch": 3.900806280500743,
      "grad_norm": 0.5035530871127086,
      "learning_rate": 3.809853218402052e-05,
      "loss": 1.3571,
      "num_input_tokens_seen": 28928601872,
      "step": 36769
    },
    {
      "epoch": 3.900912370040314,
      "grad_norm": 0.46654639530891645,
      "learning_rate": 3.809794023622126e-05,
      "loss": 1.4237,
      "num_input_tokens_seen": 28929388640,
      "step": 36770
    },
    {
      "epoch": 3.9010184595798854,
      "grad_norm": 0.6693307210142682,
      "learning_rate": 3.80973482783003e-05,
      "loss": 1.3977,
      "num_input_tokens_seen": 28930175488,
      "step": 36771
    },
    {
      "epoch": 3.901124549119457,
      "grad_norm": 0.517998614307444,
      "learning_rate": 3.8096756310258096e-05,
      "loss": 1.4757,
      "num_input_tokens_seen": 28930962336,
      "step": 36772
    },
    {
      "epoch": 3.9012306386590283,
      "grad_norm": 0.45422153058943004,
      "learning_rate": 3.8096164332095094e-05,
      "loss": 1.4217,
      "num_input_tokens_seen": 28931749056,
      "step": 36773
    },
    {
      "epoch": 3.9013367281986,
      "grad_norm": 0.8933459409210728,
      "learning_rate": 3.809557234381177e-05,
      "loss": 1.3152,
      "num_input_tokens_seen": 28932535840,
      "step": 36774
    },
    {
      "epoch": 3.901442817738171,
      "grad_norm": 0.4433173881806072,
      "learning_rate": 3.809498034540857e-05,
      "loss": 1.3589,
      "num_input_tokens_seen": 28933322544,
      "step": 36775
    },
    {
      "epoch": 3.9015489072777423,
      "grad_norm": 1.146441900987072,
      "learning_rate": 3.809438833688595e-05,
      "loss": 1.5494,
      "num_input_tokens_seen": 28934109344,
      "step": 36776
    },
    {
      "epoch": 3.9016549968173138,
      "grad_norm": 0.4050847315916057,
      "learning_rate": 3.809379631824437e-05,
      "loss": 1.3882,
      "num_input_tokens_seen": 28934896128,
      "step": 36777
    },
    {
      "epoch": 3.9017610863568852,
      "grad_norm": 0.6082282789712938,
      "learning_rate": 3.80932042894843e-05,
      "loss": 1.4798,
      "num_input_tokens_seen": 28935682928,
      "step": 36778
    },
    {
      "epoch": 3.9018671758964567,
      "grad_norm": 0.448131812512629,
      "learning_rate": 3.809261225060617e-05,
      "loss": 1.4487,
      "num_input_tokens_seen": 28936469664,
      "step": 36779
    },
    {
      "epoch": 3.9019732654360277,
      "grad_norm": 0.4671891138672379,
      "learning_rate": 3.809202020161046e-05,
      "loss": 1.3325,
      "num_input_tokens_seen": 28937256480,
      "step": 36780
    },
    {
      "epoch": 3.9020793549755997,
      "grad_norm": 0.6460709015325028,
      "learning_rate": 3.809142814249762e-05,
      "loss": 1.4747,
      "num_input_tokens_seen": 28938043280,
      "step": 36781
    },
    {
      "epoch": 3.9021854445151707,
      "grad_norm": 0.5963875851468938,
      "learning_rate": 3.809083607326811e-05,
      "loss": 1.4755,
      "num_input_tokens_seen": 28938830032,
      "step": 36782
    },
    {
      "epoch": 3.902291534054742,
      "grad_norm": 0.5448199164682883,
      "learning_rate": 3.8090243993922386e-05,
      "loss": 1.4881,
      "num_input_tokens_seen": 28939616752,
      "step": 36783
    },
    {
      "epoch": 3.9023976235943136,
      "grad_norm": 0.5195133208950317,
      "learning_rate": 3.80896519044609e-05,
      "loss": 1.4709,
      "num_input_tokens_seen": 28940403552,
      "step": 36784
    },
    {
      "epoch": 3.902503713133885,
      "grad_norm": 0.5268312565793255,
      "learning_rate": 3.808905980488412e-05,
      "loss": 1.4543,
      "num_input_tokens_seen": 28941190256,
      "step": 36785
    },
    {
      "epoch": 3.9026098026734566,
      "grad_norm": 0.5200946922680066,
      "learning_rate": 3.80884676951925e-05,
      "loss": 1.4624,
      "num_input_tokens_seen": 28941976960,
      "step": 36786
    },
    {
      "epoch": 3.9027158922130276,
      "grad_norm": 0.43185256440638153,
      "learning_rate": 3.8087875575386496e-05,
      "loss": 1.4324,
      "num_input_tokens_seen": 28942763664,
      "step": 36787
    },
    {
      "epoch": 3.902821981752599,
      "grad_norm": 0.41680054540649325,
      "learning_rate": 3.8087283445466564e-05,
      "loss": 1.3817,
      "num_input_tokens_seen": 28943550480,
      "step": 36788
    },
    {
      "epoch": 3.9029280712921706,
      "grad_norm": 0.5792189627334527,
      "learning_rate": 3.808669130543317e-05,
      "loss": 1.386,
      "num_input_tokens_seen": 28944337184,
      "step": 36789
    },
    {
      "epoch": 3.903034160831742,
      "grad_norm": 0.5324212166516045,
      "learning_rate": 3.808609915528675e-05,
      "loss": 1.4314,
      "num_input_tokens_seen": 28945123968,
      "step": 36790
    },
    {
      "epoch": 3.9031402503713135,
      "grad_norm": 0.50456647895433,
      "learning_rate": 3.8085506995027794e-05,
      "loss": 1.4025,
      "num_input_tokens_seen": 28945910784,
      "step": 36791
    },
    {
      "epoch": 3.9032463399108845,
      "grad_norm": 0.6751141542240777,
      "learning_rate": 3.808491482465673e-05,
      "loss": 1.4131,
      "num_input_tokens_seen": 28946697568,
      "step": 36792
    },
    {
      "epoch": 3.9033524294504565,
      "grad_norm": 0.4972798136891585,
      "learning_rate": 3.808432264417403e-05,
      "loss": 1.4809,
      "num_input_tokens_seen": 28947484400,
      "step": 36793
    },
    {
      "epoch": 3.9034585189900275,
      "grad_norm": 0.7031447712232602,
      "learning_rate": 3.808373045358015e-05,
      "loss": 1.5276,
      "num_input_tokens_seen": 28948271136,
      "step": 36794
    },
    {
      "epoch": 3.903564608529599,
      "grad_norm": 0.45395815938039347,
      "learning_rate": 3.808313825287555e-05,
      "loss": 1.3853,
      "num_input_tokens_seen": 28949057984,
      "step": 36795
    },
    {
      "epoch": 3.9036706980691704,
      "grad_norm": 0.5613109859025244,
      "learning_rate": 3.808254604206069e-05,
      "loss": 1.4333,
      "num_input_tokens_seen": 28949844752,
      "step": 36796
    },
    {
      "epoch": 3.903776787608742,
      "grad_norm": 0.6142778870683318,
      "learning_rate": 3.808195382113601e-05,
      "loss": 1.3776,
      "num_input_tokens_seen": 28950631488,
      "step": 36797
    },
    {
      "epoch": 3.9038828771483134,
      "grad_norm": 0.4724297347185401,
      "learning_rate": 3.808136159010198e-05,
      "loss": 1.4033,
      "num_input_tokens_seen": 28951418240,
      "step": 36798
    },
    {
      "epoch": 3.9039889666878844,
      "grad_norm": 0.5652914150715879,
      "learning_rate": 3.808076934895905e-05,
      "loss": 1.434,
      "num_input_tokens_seen": 28952205088,
      "step": 36799
    },
    {
      "epoch": 3.904095056227456,
      "grad_norm": 0.5821829856756063,
      "learning_rate": 3.808017709770771e-05,
      "loss": 1.5121,
      "num_input_tokens_seen": 28952991824,
      "step": 36800
    },
    {
      "epoch": 3.9042011457670274,
      "grad_norm": 0.4680687835166715,
      "learning_rate": 3.807958483634838e-05,
      "loss": 1.4573,
      "num_input_tokens_seen": 28953778544,
      "step": 36801
    },
    {
      "epoch": 3.904307235306599,
      "grad_norm": 0.4536779121877414,
      "learning_rate": 3.8078992564881526e-05,
      "loss": 1.376,
      "num_input_tokens_seen": 28954565296,
      "step": 36802
    },
    {
      "epoch": 3.9044133248461703,
      "grad_norm": 0.5535929960677,
      "learning_rate": 3.8078400283307616e-05,
      "loss": 1.5168,
      "num_input_tokens_seen": 28955352032,
      "step": 36803
    },
    {
      "epoch": 3.9045194143857413,
      "grad_norm": 0.497349803786089,
      "learning_rate": 3.80778079916271e-05,
      "loss": 1.3562,
      "num_input_tokens_seen": 28956138768,
      "step": 36804
    },
    {
      "epoch": 3.904625503925313,
      "grad_norm": 0.4845584151195719,
      "learning_rate": 3.807721568984044e-05,
      "loss": 1.4295,
      "num_input_tokens_seen": 28956925520,
      "step": 36805
    },
    {
      "epoch": 3.9047315934648843,
      "grad_norm": 0.5363360858350577,
      "learning_rate": 3.80766233779481e-05,
      "loss": 1.3932,
      "num_input_tokens_seen": 28957712288,
      "step": 36806
    },
    {
      "epoch": 3.9048376830044558,
      "grad_norm": 0.43555559565541085,
      "learning_rate": 3.8076031055950515e-05,
      "loss": 1.4362,
      "num_input_tokens_seen": 28958499088,
      "step": 36807
    },
    {
      "epoch": 3.9049437725440272,
      "grad_norm": 0.5176431935709133,
      "learning_rate": 3.8075438723848155e-05,
      "loss": 1.4991,
      "num_input_tokens_seen": 28959285760,
      "step": 36808
    },
    {
      "epoch": 3.9050498620835987,
      "grad_norm": 0.4824035596288791,
      "learning_rate": 3.807484638164149e-05,
      "loss": 1.2942,
      "num_input_tokens_seen": 28960072544,
      "step": 36809
    },
    {
      "epoch": 3.90515595162317,
      "grad_norm": 0.41461851391345267,
      "learning_rate": 3.807425402933096e-05,
      "loss": 1.487,
      "num_input_tokens_seen": 28960859248,
      "step": 36810
    },
    {
      "epoch": 3.9052620411627412,
      "grad_norm": 0.4366918195014078,
      "learning_rate": 3.807366166691704e-05,
      "loss": 1.3699,
      "num_input_tokens_seen": 28961645920,
      "step": 36811
    },
    {
      "epoch": 3.9053681307023127,
      "grad_norm": 0.5253519880813003,
      "learning_rate": 3.807306929440017e-05,
      "loss": 1.3358,
      "num_input_tokens_seen": 28962432704,
      "step": 36812
    },
    {
      "epoch": 3.905474220241884,
      "grad_norm": 0.43911945302787203,
      "learning_rate": 3.8072476911780816e-05,
      "loss": 1.4593,
      "num_input_tokens_seen": 28963219504,
      "step": 36813
    },
    {
      "epoch": 3.9055803097814557,
      "grad_norm": 0.42622745466465833,
      "learning_rate": 3.807188451905944e-05,
      "loss": 1.3875,
      "num_input_tokens_seen": 28964006288,
      "step": 36814
    },
    {
      "epoch": 3.905686399321027,
      "grad_norm": 0.5593419202951233,
      "learning_rate": 3.807129211623649e-05,
      "loss": 1.4606,
      "num_input_tokens_seen": 28964793072,
      "step": 36815
    },
    {
      "epoch": 3.905792488860598,
      "grad_norm": 0.4943367905470327,
      "learning_rate": 3.807069970331243e-05,
      "loss": 1.4843,
      "num_input_tokens_seen": 28965579808,
      "step": 36816
    },
    {
      "epoch": 3.9058985784001696,
      "grad_norm": 0.6209062901359043,
      "learning_rate": 3.8070107280287714e-05,
      "loss": 1.4139,
      "num_input_tokens_seen": 28966366544,
      "step": 36817
    },
    {
      "epoch": 3.906004667939741,
      "grad_norm": 0.5569187973658442,
      "learning_rate": 3.806951484716281e-05,
      "loss": 1.44,
      "num_input_tokens_seen": 28967153296,
      "step": 36818
    },
    {
      "epoch": 3.9061107574793126,
      "grad_norm": 0.457086503269335,
      "learning_rate": 3.806892240393816e-05,
      "loss": 1.5002,
      "num_input_tokens_seen": 28967940048,
      "step": 36819
    },
    {
      "epoch": 3.906216847018884,
      "grad_norm": 0.511485212828054,
      "learning_rate": 3.806832995061424e-05,
      "loss": 1.4729,
      "num_input_tokens_seen": 28968726752,
      "step": 36820
    },
    {
      "epoch": 3.906322936558455,
      "grad_norm": 0.5548490009123952,
      "learning_rate": 3.8067737487191494e-05,
      "loss": 1.4417,
      "num_input_tokens_seen": 28969513456,
      "step": 36821
    },
    {
      "epoch": 3.906429026098027,
      "grad_norm": 0.4418459778761449,
      "learning_rate": 3.806714501367038e-05,
      "loss": 1.484,
      "num_input_tokens_seen": 28970300240,
      "step": 36822
    },
    {
      "epoch": 3.906535115637598,
      "grad_norm": 0.671835143432473,
      "learning_rate": 3.806655253005136e-05,
      "loss": 1.4753,
      "num_input_tokens_seen": 28971086992,
      "step": 36823
    },
    {
      "epoch": 3.9066412051771695,
      "grad_norm": 0.4078587077123509,
      "learning_rate": 3.8065960036334896e-05,
      "loss": 1.3072,
      "num_input_tokens_seen": 28971873808,
      "step": 36824
    },
    {
      "epoch": 3.906747294716741,
      "grad_norm": 0.48253921746782685,
      "learning_rate": 3.8065367532521435e-05,
      "loss": 1.4014,
      "num_input_tokens_seen": 28972660560,
      "step": 36825
    },
    {
      "epoch": 3.9068533842563125,
      "grad_norm": 0.512765117004723,
      "learning_rate": 3.806477501861145e-05,
      "loss": 1.3751,
      "num_input_tokens_seen": 28973447344,
      "step": 36826
    },
    {
      "epoch": 3.906959473795884,
      "grad_norm": 0.41299020191848695,
      "learning_rate": 3.8064182494605385e-05,
      "loss": 1.4282,
      "num_input_tokens_seen": 28974234048,
      "step": 36827
    },
    {
      "epoch": 3.907065563335455,
      "grad_norm": 0.5861575348094884,
      "learning_rate": 3.8063589960503706e-05,
      "loss": 1.4835,
      "num_input_tokens_seen": 28975020864,
      "step": 36828
    },
    {
      "epoch": 3.9071716528750264,
      "grad_norm": 0.4056997372534285,
      "learning_rate": 3.8062997416306864e-05,
      "loss": 1.4523,
      "num_input_tokens_seen": 28975807664,
      "step": 36829
    },
    {
      "epoch": 3.907277742414598,
      "grad_norm": 0.4566582676767523,
      "learning_rate": 3.806240486201532e-05,
      "loss": 1.4745,
      "num_input_tokens_seen": 28976594448,
      "step": 36830
    },
    {
      "epoch": 3.9073838319541694,
      "grad_norm": 0.3924974582555788,
      "learning_rate": 3.806181229762954e-05,
      "loss": 1.3698,
      "num_input_tokens_seen": 28977381280,
      "step": 36831
    },
    {
      "epoch": 3.907489921493741,
      "grad_norm": 0.43768693464061303,
      "learning_rate": 3.8061219723149974e-05,
      "loss": 1.3862,
      "num_input_tokens_seen": 28978168144,
      "step": 36832
    },
    {
      "epoch": 3.907596011033312,
      "grad_norm": 0.49396628236115286,
      "learning_rate": 3.806062713857707e-05,
      "loss": 1.5461,
      "num_input_tokens_seen": 28978954848,
      "step": 36833
    },
    {
      "epoch": 3.9077021005728834,
      "grad_norm": 0.37213511673222927,
      "learning_rate": 3.80600345439113e-05,
      "loss": 1.2855,
      "num_input_tokens_seen": 28979741728,
      "step": 36834
    },
    {
      "epoch": 3.907808190112455,
      "grad_norm": 0.44832365934151064,
      "learning_rate": 3.805944193915313e-05,
      "loss": 1.5165,
      "num_input_tokens_seen": 28980528448,
      "step": 36835
    },
    {
      "epoch": 3.9079142796520263,
      "grad_norm": 0.4277645961288552,
      "learning_rate": 3.805884932430299e-05,
      "loss": 1.4613,
      "num_input_tokens_seen": 28981315232,
      "step": 36836
    },
    {
      "epoch": 3.908020369191598,
      "grad_norm": 0.4287102240615917,
      "learning_rate": 3.805825669936137e-05,
      "loss": 1.4598,
      "num_input_tokens_seen": 28982101904,
      "step": 36837
    },
    {
      "epoch": 3.9081264587311693,
      "grad_norm": 0.40888149140634716,
      "learning_rate": 3.8057664064328705e-05,
      "loss": 1.3866,
      "num_input_tokens_seen": 28982888688,
      "step": 36838
    },
    {
      "epoch": 3.9082325482707407,
      "grad_norm": 0.40760212688565917,
      "learning_rate": 3.805707141920546e-05,
      "loss": 1.4053,
      "num_input_tokens_seen": 28983675424,
      "step": 36839
    },
    {
      "epoch": 3.9083386378103118,
      "grad_norm": 0.4679464560512071,
      "learning_rate": 3.80564787639921e-05,
      "loss": 1.401,
      "num_input_tokens_seen": 28984462320,
      "step": 36840
    },
    {
      "epoch": 3.9084447273498832,
      "grad_norm": 0.440420609766094,
      "learning_rate": 3.805588609868907e-05,
      "loss": 1.4734,
      "num_input_tokens_seen": 28985249056,
      "step": 36841
    },
    {
      "epoch": 3.9085508168894547,
      "grad_norm": 0.41956783709188283,
      "learning_rate": 3.805529342329683e-05,
      "loss": 1.3655,
      "num_input_tokens_seen": 28986035824,
      "step": 36842
    },
    {
      "epoch": 3.908656906429026,
      "grad_norm": 0.51174476173614,
      "learning_rate": 3.805470073781585e-05,
      "loss": 1.4752,
      "num_input_tokens_seen": 28986822560,
      "step": 36843
    },
    {
      "epoch": 3.9087629959685977,
      "grad_norm": 0.4059158694462558,
      "learning_rate": 3.8054108042246575e-05,
      "loss": 1.5521,
      "num_input_tokens_seen": 28987609216,
      "step": 36844
    },
    {
      "epoch": 3.9088690855081687,
      "grad_norm": 0.4516290433814863,
      "learning_rate": 3.8053515336589465e-05,
      "loss": 1.5125,
      "num_input_tokens_seen": 28988396000,
      "step": 36845
    },
    {
      "epoch": 3.90897517504774,
      "grad_norm": 0.48754871594884897,
      "learning_rate": 3.8052922620844985e-05,
      "loss": 1.5116,
      "num_input_tokens_seen": 28989182752,
      "step": 36846
    },
    {
      "epoch": 3.9090812645873116,
      "grad_norm": 0.35741513162404526,
      "learning_rate": 3.80523298950136e-05,
      "loss": 1.2995,
      "num_input_tokens_seen": 28989969664,
      "step": 36847
    },
    {
      "epoch": 3.909187354126883,
      "grad_norm": 0.45763093619462214,
      "learning_rate": 3.805173715909574e-05,
      "loss": 1.2743,
      "num_input_tokens_seen": 28990756464,
      "step": 36848
    },
    {
      "epoch": 3.9092934436664546,
      "grad_norm": 0.3954695025387635,
      "learning_rate": 3.8051144413091896e-05,
      "loss": 1.4346,
      "num_input_tokens_seen": 28991543280,
      "step": 36849
    },
    {
      "epoch": 3.9093995332060256,
      "grad_norm": 0.43312843736120316,
      "learning_rate": 3.8050551657002505e-05,
      "loss": 1.5007,
      "num_input_tokens_seen": 28992329968,
      "step": 36850
    },
    {
      "epoch": 3.9095056227455975,
      "grad_norm": 0.46313257161827875,
      "learning_rate": 3.804995889082802e-05,
      "loss": 1.4928,
      "num_input_tokens_seen": 28993116688,
      "step": 36851
    },
    {
      "epoch": 3.9096117122851686,
      "grad_norm": 0.44286129931942486,
      "learning_rate": 3.8049366114568927e-05,
      "loss": 1.4757,
      "num_input_tokens_seen": 28993903424,
      "step": 36852
    },
    {
      "epoch": 3.90971780182474,
      "grad_norm": 0.40262307610065473,
      "learning_rate": 3.8048773328225653e-05,
      "loss": 1.3426,
      "num_input_tokens_seen": 28994690208,
      "step": 36853
    },
    {
      "epoch": 3.9098238913643115,
      "grad_norm": 0.44948961359715434,
      "learning_rate": 3.804818053179868e-05,
      "loss": 1.5097,
      "num_input_tokens_seen": 28995476928,
      "step": 36854
    },
    {
      "epoch": 3.909929980903883,
      "grad_norm": 0.4820592035195871,
      "learning_rate": 3.804758772528845e-05,
      "loss": 1.4389,
      "num_input_tokens_seen": 28996263648,
      "step": 36855
    },
    {
      "epoch": 3.9100360704434545,
      "grad_norm": 0.4520440352283867,
      "learning_rate": 3.804699490869543e-05,
      "loss": 1.4887,
      "num_input_tokens_seen": 28997050400,
      "step": 36856
    },
    {
      "epoch": 3.9101421599830255,
      "grad_norm": 0.5623072043132888,
      "learning_rate": 3.804640208202007e-05,
      "loss": 1.5379,
      "num_input_tokens_seen": 28997837136,
      "step": 36857
    },
    {
      "epoch": 3.910248249522597,
      "grad_norm": 0.4674536434145209,
      "learning_rate": 3.804580924526284e-05,
      "loss": 1.509,
      "num_input_tokens_seen": 28998623872,
      "step": 36858
    },
    {
      "epoch": 3.9103543390621684,
      "grad_norm": 0.46980142958226584,
      "learning_rate": 3.804521639842419e-05,
      "loss": 1.3931,
      "num_input_tokens_seen": 28999410672,
      "step": 36859
    },
    {
      "epoch": 3.91046042860174,
      "grad_norm": 0.4058825038141641,
      "learning_rate": 3.804462354150457e-05,
      "loss": 1.3365,
      "num_input_tokens_seen": 29000197488,
      "step": 36860
    },
    {
      "epoch": 3.9105665181413114,
      "grad_norm": 0.39282309027477474,
      "learning_rate": 3.804403067450446e-05,
      "loss": 1.2985,
      "num_input_tokens_seen": 29000984272,
      "step": 36861
    },
    {
      "epoch": 3.9106726076808824,
      "grad_norm": 0.47244949636922995,
      "learning_rate": 3.8043437797424305e-05,
      "loss": 1.4662,
      "num_input_tokens_seen": 29001771056,
      "step": 36862
    },
    {
      "epoch": 3.910778697220454,
      "grad_norm": 0.4686722689032878,
      "learning_rate": 3.804284491026456e-05,
      "loss": 1.5678,
      "num_input_tokens_seen": 29002557856,
      "step": 36863
    },
    {
      "epoch": 3.9108847867600254,
      "grad_norm": 0.5011239313599466,
      "learning_rate": 3.8042252013025695e-05,
      "loss": 1.4366,
      "num_input_tokens_seen": 29003344720,
      "step": 36864
    },
    {
      "epoch": 3.910990876299597,
      "grad_norm": 0.6125898387541601,
      "learning_rate": 3.8041659105708146e-05,
      "loss": 1.4452,
      "num_input_tokens_seen": 29004131536,
      "step": 36865
    },
    {
      "epoch": 3.9110969658391683,
      "grad_norm": 0.44853313187241634,
      "learning_rate": 3.804106618831239e-05,
      "loss": 1.5181,
      "num_input_tokens_seen": 29004918272,
      "step": 36866
    },
    {
      "epoch": 3.91120305537874,
      "grad_norm": 0.5540919655696004,
      "learning_rate": 3.8040473260838886e-05,
      "loss": 1.5053,
      "num_input_tokens_seen": 29005704976,
      "step": 36867
    },
    {
      "epoch": 3.9113091449183113,
      "grad_norm": 0.43524225333452055,
      "learning_rate": 3.803988032328808e-05,
      "loss": 1.4497,
      "num_input_tokens_seen": 29006491744,
      "step": 36868
    },
    {
      "epoch": 3.9114152344578823,
      "grad_norm": 0.41430276051864,
      "learning_rate": 3.803928737566045e-05,
      "loss": 1.4177,
      "num_input_tokens_seen": 29007278544,
      "step": 36869
    },
    {
      "epoch": 3.911521323997454,
      "grad_norm": 0.513727135296085,
      "learning_rate": 3.803869441795642e-05,
      "loss": 1.5173,
      "num_input_tokens_seen": 29008065264,
      "step": 36870
    },
    {
      "epoch": 3.9116274135370253,
      "grad_norm": 0.40588761807635865,
      "learning_rate": 3.803810145017649e-05,
      "loss": 1.3587,
      "num_input_tokens_seen": 29008852000,
      "step": 36871
    },
    {
      "epoch": 3.9117335030765967,
      "grad_norm": 0.5687919457665785,
      "learning_rate": 3.8037508472321094e-05,
      "loss": 1.5399,
      "num_input_tokens_seen": 29009638832,
      "step": 36872
    },
    {
      "epoch": 3.911839592616168,
      "grad_norm": 0.4332311720954942,
      "learning_rate": 3.803691548439068e-05,
      "loss": 1.4345,
      "num_input_tokens_seen": 29010425648,
      "step": 36873
    },
    {
      "epoch": 3.9119456821557392,
      "grad_norm": 0.47179018736921635,
      "learning_rate": 3.803632248638573e-05,
      "loss": 1.3569,
      "num_input_tokens_seen": 29011212448,
      "step": 36874
    },
    {
      "epoch": 3.9120517716953107,
      "grad_norm": 0.473204058301778,
      "learning_rate": 3.8035729478306697e-05,
      "loss": 1.4748,
      "num_input_tokens_seen": 29011999184,
      "step": 36875
    },
    {
      "epoch": 3.912157861234882,
      "grad_norm": 0.5180429758674743,
      "learning_rate": 3.803513646015403e-05,
      "loss": 1.5333,
      "num_input_tokens_seen": 29012785936,
      "step": 36876
    },
    {
      "epoch": 3.9122639507744537,
      "grad_norm": 0.5412365821121388,
      "learning_rate": 3.8034543431928196e-05,
      "loss": 1.4784,
      "num_input_tokens_seen": 29013572752,
      "step": 36877
    },
    {
      "epoch": 3.912370040314025,
      "grad_norm": 0.4637385562019628,
      "learning_rate": 3.8033950393629647e-05,
      "loss": 1.4294,
      "num_input_tokens_seen": 29014359456,
      "step": 36878
    },
    {
      "epoch": 3.912476129853596,
      "grad_norm": 0.4955433299416348,
      "learning_rate": 3.803335734525884e-05,
      "loss": 1.3763,
      "num_input_tokens_seen": 29015146288,
      "step": 36879
    },
    {
      "epoch": 3.912582219393168,
      "grad_norm": 0.41554573942910356,
      "learning_rate": 3.803276428681623e-05,
      "loss": 1.393,
      "num_input_tokens_seen": 29015933072,
      "step": 36880
    },
    {
      "epoch": 3.912688308932739,
      "grad_norm": 0.45981788377860683,
      "learning_rate": 3.8032171218302304e-05,
      "loss": 1.5331,
      "num_input_tokens_seen": 29016719936,
      "step": 36881
    },
    {
      "epoch": 3.9127943984723106,
      "grad_norm": 0.45849319716002584,
      "learning_rate": 3.8031578139717485e-05,
      "loss": 1.5591,
      "num_input_tokens_seen": 29017506624,
      "step": 36882
    },
    {
      "epoch": 3.912900488011882,
      "grad_norm": 0.4105902777964421,
      "learning_rate": 3.803098505106224e-05,
      "loss": 1.3186,
      "num_input_tokens_seen": 29018293440,
      "step": 36883
    },
    {
      "epoch": 3.9130065775514535,
      "grad_norm": 0.36889611817030793,
      "learning_rate": 3.803039195233704e-05,
      "loss": 1.3442,
      "num_input_tokens_seen": 29019080224,
      "step": 36884
    },
    {
      "epoch": 3.913112667091025,
      "grad_norm": 0.48346178930299527,
      "learning_rate": 3.802979884354233e-05,
      "loss": 1.6093,
      "num_input_tokens_seen": 29019866960,
      "step": 36885
    },
    {
      "epoch": 3.913218756630596,
      "grad_norm": 0.43193936865765,
      "learning_rate": 3.802920572467858e-05,
      "loss": 1.5155,
      "num_input_tokens_seen": 29020653776,
      "step": 36886
    },
    {
      "epoch": 3.9133248461701675,
      "grad_norm": 0.43395015536546794,
      "learning_rate": 3.802861259574624e-05,
      "loss": 1.5103,
      "num_input_tokens_seen": 29021440512,
      "step": 36887
    },
    {
      "epoch": 3.913430935709739,
      "grad_norm": 0.4007090435160419,
      "learning_rate": 3.802801945674577e-05,
      "loss": 1.3642,
      "num_input_tokens_seen": 29022227280,
      "step": 36888
    },
    {
      "epoch": 3.9135370252493105,
      "grad_norm": 0.4747797579572354,
      "learning_rate": 3.802742630767763e-05,
      "loss": 1.3795,
      "num_input_tokens_seen": 29023014160,
      "step": 36889
    },
    {
      "epoch": 3.913643114788882,
      "grad_norm": 0.5128912271976902,
      "learning_rate": 3.802683314854227e-05,
      "loss": 1.4357,
      "num_input_tokens_seen": 29023800992,
      "step": 36890
    },
    {
      "epoch": 3.913749204328453,
      "grad_norm": 0.43076939858249935,
      "learning_rate": 3.802623997934016e-05,
      "loss": 1.3824,
      "num_input_tokens_seen": 29024587760,
      "step": 36891
    },
    {
      "epoch": 3.913855293868025,
      "grad_norm": 0.562717186629887,
      "learning_rate": 3.8025646800071757e-05,
      "loss": 1.5193,
      "num_input_tokens_seen": 29025374528,
      "step": 36892
    },
    {
      "epoch": 3.913961383407596,
      "grad_norm": 0.4014092225387689,
      "learning_rate": 3.8025053610737515e-05,
      "loss": 1.4164,
      "num_input_tokens_seen": 29026161296,
      "step": 36893
    },
    {
      "epoch": 3.9140674729471674,
      "grad_norm": 0.42421633901709227,
      "learning_rate": 3.802446041133789e-05,
      "loss": 1.4082,
      "num_input_tokens_seen": 29026948032,
      "step": 36894
    },
    {
      "epoch": 3.914173562486739,
      "grad_norm": 0.5790988734999222,
      "learning_rate": 3.8023867201873345e-05,
      "loss": 1.4995,
      "num_input_tokens_seen": 29027734736,
      "step": 36895
    },
    {
      "epoch": 3.9142796520263103,
      "grad_norm": 0.46839155139311023,
      "learning_rate": 3.8023273982344345e-05,
      "loss": 1.5394,
      "num_input_tokens_seen": 29028521584,
      "step": 36896
    },
    {
      "epoch": 3.914385741565882,
      "grad_norm": 0.4477002728757936,
      "learning_rate": 3.8022680752751326e-05,
      "loss": 1.3801,
      "num_input_tokens_seen": 29029308288,
      "step": 36897
    },
    {
      "epoch": 3.914491831105453,
      "grad_norm": 0.4454818298217978,
      "learning_rate": 3.8022087513094776e-05,
      "loss": 1.5136,
      "num_input_tokens_seen": 29030094976,
      "step": 36898
    },
    {
      "epoch": 3.9145979206450243,
      "grad_norm": 0.5377627209927093,
      "learning_rate": 3.8021494263375136e-05,
      "loss": 1.4145,
      "num_input_tokens_seen": 29030881648,
      "step": 36899
    },
    {
      "epoch": 3.914704010184596,
      "grad_norm": 0.4447971022236369,
      "learning_rate": 3.802090100359286e-05,
      "loss": 1.3557,
      "num_input_tokens_seen": 29031668432,
      "step": 36900
    },
    {
      "epoch": 3.9148100997241673,
      "grad_norm": 0.4154746770727774,
      "learning_rate": 3.802030773374842e-05,
      "loss": 1.453,
      "num_input_tokens_seen": 29032455216,
      "step": 36901
    },
    {
      "epoch": 3.9149161892637387,
      "grad_norm": 0.5466913838134305,
      "learning_rate": 3.801971445384227e-05,
      "loss": 1.5199,
      "num_input_tokens_seen": 29033241888,
      "step": 36902
    },
    {
      "epoch": 3.9150222788033098,
      "grad_norm": 0.420721346664107,
      "learning_rate": 3.801912116387486e-05,
      "loss": 1.4557,
      "num_input_tokens_seen": 29034028704,
      "step": 36903
    },
    {
      "epoch": 3.9151283683428812,
      "grad_norm": 0.5789926221972067,
      "learning_rate": 3.801852786384666e-05,
      "loss": 1.5225,
      "num_input_tokens_seen": 29034815408,
      "step": 36904
    },
    {
      "epoch": 3.9152344578824527,
      "grad_norm": 0.49491390033466637,
      "learning_rate": 3.801793455375813e-05,
      "loss": 1.4595,
      "num_input_tokens_seen": 29035602160,
      "step": 36905
    },
    {
      "epoch": 3.915340547422024,
      "grad_norm": 0.4595899351127665,
      "learning_rate": 3.801734123360971e-05,
      "loss": 1.3976,
      "num_input_tokens_seen": 29036388912,
      "step": 36906
    },
    {
      "epoch": 3.9154466369615957,
      "grad_norm": 0.46402353821623765,
      "learning_rate": 3.801674790340188e-05,
      "loss": 1.4211,
      "num_input_tokens_seen": 29037175728,
      "step": 36907
    },
    {
      "epoch": 3.915552726501167,
      "grad_norm": 0.509452633494559,
      "learning_rate": 3.801615456313508e-05,
      "loss": 1.4979,
      "num_input_tokens_seen": 29037962496,
      "step": 36908
    },
    {
      "epoch": 3.9156588160407386,
      "grad_norm": 0.531222960135514,
      "learning_rate": 3.801556121280978e-05,
      "loss": 1.4946,
      "num_input_tokens_seen": 29038749312,
      "step": 36909
    },
    {
      "epoch": 3.9157649055803097,
      "grad_norm": 0.46804321231602003,
      "learning_rate": 3.8014967852426444e-05,
      "loss": 1.4714,
      "num_input_tokens_seen": 29039536128,
      "step": 36910
    },
    {
      "epoch": 3.915870995119881,
      "grad_norm": 0.4534496768484651,
      "learning_rate": 3.801437448198551e-05,
      "loss": 1.557,
      "num_input_tokens_seen": 29040322880,
      "step": 36911
    },
    {
      "epoch": 3.9159770846594526,
      "grad_norm": 0.42592532469025146,
      "learning_rate": 3.801378110148747e-05,
      "loss": 1.5221,
      "num_input_tokens_seen": 29041109680,
      "step": 36912
    },
    {
      "epoch": 3.916083174199024,
      "grad_norm": 0.4134646699216212,
      "learning_rate": 3.801318771093274e-05,
      "loss": 1.547,
      "num_input_tokens_seen": 29041896464,
      "step": 36913
    },
    {
      "epoch": 3.9161892637385955,
      "grad_norm": 0.37567537178705646,
      "learning_rate": 3.801259431032181e-05,
      "loss": 1.4159,
      "num_input_tokens_seen": 29042683216,
      "step": 36914
    },
    {
      "epoch": 3.9162953532781666,
      "grad_norm": 0.37347789799083975,
      "learning_rate": 3.8012000899655135e-05,
      "loss": 1.37,
      "num_input_tokens_seen": 29043470128,
      "step": 36915
    },
    {
      "epoch": 3.916401442817738,
      "grad_norm": 0.4072229744756563,
      "learning_rate": 3.801140747893315e-05,
      "loss": 1.3603,
      "num_input_tokens_seen": 29044257024,
      "step": 36916
    },
    {
      "epoch": 3.9165075323573095,
      "grad_norm": 0.37113498564685854,
      "learning_rate": 3.801081404815634e-05,
      "loss": 1.3699,
      "num_input_tokens_seen": 29045043792,
      "step": 36917
    },
    {
      "epoch": 3.916613621896881,
      "grad_norm": 0.47655243319399937,
      "learning_rate": 3.801022060732516e-05,
      "loss": 1.3519,
      "num_input_tokens_seen": 29045830560,
      "step": 36918
    },
    {
      "epoch": 3.9167197114364525,
      "grad_norm": 0.47639227776019094,
      "learning_rate": 3.8009627156440057e-05,
      "loss": 1.4529,
      "num_input_tokens_seen": 29046617344,
      "step": 36919
    },
    {
      "epoch": 3.9168258009760235,
      "grad_norm": 0.40985603423108796,
      "learning_rate": 3.80090336955015e-05,
      "loss": 1.4901,
      "num_input_tokens_seen": 29047404016,
      "step": 36920
    },
    {
      "epoch": 3.9169318905155954,
      "grad_norm": 0.5485982458727772,
      "learning_rate": 3.800844022450994e-05,
      "loss": 1.407,
      "num_input_tokens_seen": 29048190768,
      "step": 36921
    },
    {
      "epoch": 3.9170379800551665,
      "grad_norm": 0.6867795338396248,
      "learning_rate": 3.800784674346584e-05,
      "loss": 1.4074,
      "num_input_tokens_seen": 29048977552,
      "step": 36922
    },
    {
      "epoch": 3.917144069594738,
      "grad_norm": 0.5032275772062297,
      "learning_rate": 3.800725325236966e-05,
      "loss": 1.5288,
      "num_input_tokens_seen": 29049764192,
      "step": 36923
    },
    {
      "epoch": 3.9172501591343094,
      "grad_norm": 0.7918115096630797,
      "learning_rate": 3.800665975122186e-05,
      "loss": 1.4139,
      "num_input_tokens_seen": 29050550976,
      "step": 36924
    },
    {
      "epoch": 3.917356248673881,
      "grad_norm": 0.4457965207626475,
      "learning_rate": 3.800606624002289e-05,
      "loss": 1.3782,
      "num_input_tokens_seen": 29051337792,
      "step": 36925
    },
    {
      "epoch": 3.9174623382134524,
      "grad_norm": 0.5175239539792529,
      "learning_rate": 3.800547271877321e-05,
      "loss": 1.4792,
      "num_input_tokens_seen": 29052124480,
      "step": 36926
    },
    {
      "epoch": 3.9175684277530234,
      "grad_norm": 0.5268410471479963,
      "learning_rate": 3.800487918747328e-05,
      "loss": 1.5153,
      "num_input_tokens_seen": 29052911280,
      "step": 36927
    },
    {
      "epoch": 3.917674517292595,
      "grad_norm": 0.3993375566776831,
      "learning_rate": 3.800428564612357e-05,
      "loss": 1.3232,
      "num_input_tokens_seen": 29053698176,
      "step": 36928
    },
    {
      "epoch": 3.9177806068321663,
      "grad_norm": 0.5421815404483756,
      "learning_rate": 3.800369209472453e-05,
      "loss": 1.4661,
      "num_input_tokens_seen": 29054484912,
      "step": 36929
    },
    {
      "epoch": 3.917886696371738,
      "grad_norm": 0.4558145006017872,
      "learning_rate": 3.800309853327661e-05,
      "loss": 1.4598,
      "num_input_tokens_seen": 29055271712,
      "step": 36930
    },
    {
      "epoch": 3.9179927859113093,
      "grad_norm": 0.39781831957599995,
      "learning_rate": 3.800250496178028e-05,
      "loss": 1.46,
      "num_input_tokens_seen": 29056058432,
      "step": 36931
    },
    {
      "epoch": 3.9180988754508803,
      "grad_norm": 0.531207670368393,
      "learning_rate": 3.8001911380236e-05,
      "loss": 1.4036,
      "num_input_tokens_seen": 29056845168,
      "step": 36932
    },
    {
      "epoch": 3.918204964990452,
      "grad_norm": 0.4450488984750252,
      "learning_rate": 3.800131778864422e-05,
      "loss": 1.5738,
      "num_input_tokens_seen": 29057631824,
      "step": 36933
    },
    {
      "epoch": 3.9183110545300233,
      "grad_norm": 0.46503365014695525,
      "learning_rate": 3.800072418700541e-05,
      "loss": 1.4252,
      "num_input_tokens_seen": 29058418576,
      "step": 36934
    },
    {
      "epoch": 3.9184171440695947,
      "grad_norm": 0.536793288034631,
      "learning_rate": 3.8000130575320015e-05,
      "loss": 1.4811,
      "num_input_tokens_seen": 29059205408,
      "step": 36935
    },
    {
      "epoch": 3.918523233609166,
      "grad_norm": 0.5267378945121177,
      "learning_rate": 3.79995369535885e-05,
      "loss": 1.5301,
      "num_input_tokens_seen": 29059992128,
      "step": 36936
    },
    {
      "epoch": 3.9186293231487377,
      "grad_norm": 0.4389163979187159,
      "learning_rate": 3.7998943321811334e-05,
      "loss": 1.5281,
      "num_input_tokens_seen": 29060778928,
      "step": 36937
    },
    {
      "epoch": 3.918735412688309,
      "grad_norm": 0.4722556100484803,
      "learning_rate": 3.7998349679988955e-05,
      "loss": 1.5355,
      "num_input_tokens_seen": 29061565712,
      "step": 36938
    },
    {
      "epoch": 3.91884150222788,
      "grad_norm": 0.3773373814806442,
      "learning_rate": 3.7997756028121836e-05,
      "loss": 1.3384,
      "num_input_tokens_seen": 29062352496,
      "step": 36939
    },
    {
      "epoch": 3.9189475917674517,
      "grad_norm": 0.49179889702285295,
      "learning_rate": 3.7997162366210424e-05,
      "loss": 1.4698,
      "num_input_tokens_seen": 29063139184,
      "step": 36940
    },
    {
      "epoch": 3.919053681307023,
      "grad_norm": 0.533726481135625,
      "learning_rate": 3.7996568694255194e-05,
      "loss": 1.4433,
      "num_input_tokens_seen": 29063925856,
      "step": 36941
    },
    {
      "epoch": 3.9191597708465946,
      "grad_norm": 0.4380341084028864,
      "learning_rate": 3.79959750122566e-05,
      "loss": 1.359,
      "num_input_tokens_seen": 29064712640,
      "step": 36942
    },
    {
      "epoch": 3.919265860386166,
      "grad_norm": 0.6461488036151145,
      "learning_rate": 3.7995381320215093e-05,
      "loss": 1.3942,
      "num_input_tokens_seen": 29065499456,
      "step": 36943
    },
    {
      "epoch": 3.919371949925737,
      "grad_norm": 0.47715639818016453,
      "learning_rate": 3.7994787618131145e-05,
      "loss": 1.4536,
      "num_input_tokens_seen": 29066286288,
      "step": 36944
    },
    {
      "epoch": 3.9194780394653086,
      "grad_norm": 0.5892578135231157,
      "learning_rate": 3.7994193906005194e-05,
      "loss": 1.5088,
      "num_input_tokens_seen": 29067073152,
      "step": 36945
    },
    {
      "epoch": 3.91958412900488,
      "grad_norm": 0.5074741300834168,
      "learning_rate": 3.799360018383772e-05,
      "loss": 1.5657,
      "num_input_tokens_seen": 29067859856,
      "step": 36946
    },
    {
      "epoch": 3.9196902185444515,
      "grad_norm": 0.48300655697240047,
      "learning_rate": 3.7993006451629175e-05,
      "loss": 1.3961,
      "num_input_tokens_seen": 29068646704,
      "step": 36947
    },
    {
      "epoch": 3.919796308084023,
      "grad_norm": 0.6671298254953277,
      "learning_rate": 3.799241270938001e-05,
      "loss": 1.4705,
      "num_input_tokens_seen": 29069433424,
      "step": 36948
    },
    {
      "epoch": 3.919902397623594,
      "grad_norm": 0.45114049391466854,
      "learning_rate": 3.799181895709069e-05,
      "loss": 1.5239,
      "num_input_tokens_seen": 29070220176,
      "step": 36949
    },
    {
      "epoch": 3.920008487163166,
      "grad_norm": 0.5310326073054144,
      "learning_rate": 3.799122519476168e-05,
      "loss": 1.4892,
      "num_input_tokens_seen": 29071007040,
      "step": 36950
    },
    {
      "epoch": 3.920114576702737,
      "grad_norm": 0.5691450024685886,
      "learning_rate": 3.7990631422393416e-05,
      "loss": 1.536,
      "num_input_tokens_seen": 29071793888,
      "step": 36951
    },
    {
      "epoch": 3.9202206662423085,
      "grad_norm": 0.3830675616722108,
      "learning_rate": 3.799003763998639e-05,
      "loss": 1.3118,
      "num_input_tokens_seen": 29072580656,
      "step": 36952
    },
    {
      "epoch": 3.92032675578188,
      "grad_norm": 0.5245008989405722,
      "learning_rate": 3.798944384754104e-05,
      "loss": 1.4448,
      "num_input_tokens_seen": 29073367424,
      "step": 36953
    },
    {
      "epoch": 3.9204328453214514,
      "grad_norm": 0.5711178867021343,
      "learning_rate": 3.798885004505783e-05,
      "loss": 1.4951,
      "num_input_tokens_seen": 29074154240,
      "step": 36954
    },
    {
      "epoch": 3.920538934861023,
      "grad_norm": 0.4149973823310213,
      "learning_rate": 3.798825623253721e-05,
      "loss": 1.5191,
      "num_input_tokens_seen": 29074941008,
      "step": 36955
    },
    {
      "epoch": 3.920645024400594,
      "grad_norm": 0.6634486039742025,
      "learning_rate": 3.798766240997966e-05,
      "loss": 1.3522,
      "num_input_tokens_seen": 29075727760,
      "step": 36956
    },
    {
      "epoch": 3.9207511139401654,
      "grad_norm": 0.5139281296504913,
      "learning_rate": 3.798706857738561e-05,
      "loss": 1.4943,
      "num_input_tokens_seen": 29076514416,
      "step": 36957
    },
    {
      "epoch": 3.920857203479737,
      "grad_norm": 0.43366143417245767,
      "learning_rate": 3.7986474734755554e-05,
      "loss": 1.4418,
      "num_input_tokens_seen": 29077301232,
      "step": 36958
    },
    {
      "epoch": 3.9209632930193083,
      "grad_norm": 0.7917075755057397,
      "learning_rate": 3.798588088208991e-05,
      "loss": 1.4675,
      "num_input_tokens_seen": 29078087984,
      "step": 36959
    },
    {
      "epoch": 3.92106938255888,
      "grad_norm": 0.4711104325382838,
      "learning_rate": 3.798528701938917e-05,
      "loss": 1.459,
      "num_input_tokens_seen": 29078874800,
      "step": 36960
    },
    {
      "epoch": 3.921175472098451,
      "grad_norm": 0.6017896766605794,
      "learning_rate": 3.7984693146653783e-05,
      "loss": 1.437,
      "num_input_tokens_seen": 29079661504,
      "step": 36961
    },
    {
      "epoch": 3.9212815616380223,
      "grad_norm": 0.5285372668562012,
      "learning_rate": 3.7984099263884195e-05,
      "loss": 1.3842,
      "num_input_tokens_seen": 29080448336,
      "step": 36962
    },
    {
      "epoch": 3.921387651177594,
      "grad_norm": 0.44389457296176077,
      "learning_rate": 3.7983505371080886e-05,
      "loss": 1.3925,
      "num_input_tokens_seen": 29081235152,
      "step": 36963
    },
    {
      "epoch": 3.9214937407171653,
      "grad_norm": 0.5829215063412394,
      "learning_rate": 3.79829114682443e-05,
      "loss": 1.4871,
      "num_input_tokens_seen": 29082021952,
      "step": 36964
    },
    {
      "epoch": 3.9215998302567368,
      "grad_norm": 0.6650832669073925,
      "learning_rate": 3.79823175553749e-05,
      "loss": 1.4189,
      "num_input_tokens_seen": 29082808672,
      "step": 36965
    },
    {
      "epoch": 3.9217059197963082,
      "grad_norm": 0.4777891386876345,
      "learning_rate": 3.798172363247315e-05,
      "loss": 1.5262,
      "num_input_tokens_seen": 29083595280,
      "step": 36966
    },
    {
      "epoch": 3.9218120093358797,
      "grad_norm": 0.6405838837768892,
      "learning_rate": 3.798112969953951e-05,
      "loss": 1.4154,
      "num_input_tokens_seen": 29084382096,
      "step": 36967
    },
    {
      "epoch": 3.9219180988754507,
      "grad_norm": 0.5893165994354324,
      "learning_rate": 3.7980535756574425e-05,
      "loss": 1.4133,
      "num_input_tokens_seen": 29085168976,
      "step": 36968
    },
    {
      "epoch": 3.922024188415022,
      "grad_norm": 0.5606254213985739,
      "learning_rate": 3.7979941803578366e-05,
      "loss": 1.3771,
      "num_input_tokens_seen": 29085955776,
      "step": 36969
    },
    {
      "epoch": 3.9221302779545937,
      "grad_norm": 0.5922937656927735,
      "learning_rate": 3.7979347840551796e-05,
      "loss": 1.316,
      "num_input_tokens_seen": 29086742560,
      "step": 36970
    },
    {
      "epoch": 3.922236367494165,
      "grad_norm": 0.5323254693722516,
      "learning_rate": 3.797875386749516e-05,
      "loss": 1.4295,
      "num_input_tokens_seen": 29087529296,
      "step": 36971
    },
    {
      "epoch": 3.9223424570337366,
      "grad_norm": 0.4506583730716824,
      "learning_rate": 3.7978159884408916e-05,
      "loss": 1.4424,
      "num_input_tokens_seen": 29088316048,
      "step": 36972
    },
    {
      "epoch": 3.9224485465733077,
      "grad_norm": 0.5318243662605532,
      "learning_rate": 3.7977565891293534e-05,
      "loss": 1.4506,
      "num_input_tokens_seen": 29089102784,
      "step": 36973
    },
    {
      "epoch": 3.922554636112879,
      "grad_norm": 0.5706319650111306,
      "learning_rate": 3.797697188814948e-05,
      "loss": 1.3487,
      "num_input_tokens_seen": 29089889600,
      "step": 36974
    },
    {
      "epoch": 3.9226607256524506,
      "grad_norm": 0.4925905164242101,
      "learning_rate": 3.7976377874977196e-05,
      "loss": 1.4774,
      "num_input_tokens_seen": 29090676288,
      "step": 36975
    },
    {
      "epoch": 3.922766815192022,
      "grad_norm": 0.6481274124923334,
      "learning_rate": 3.797578385177715e-05,
      "loss": 1.4958,
      "num_input_tokens_seen": 29091463008,
      "step": 36976
    },
    {
      "epoch": 3.9228729047315936,
      "grad_norm": 0.534811955481053,
      "learning_rate": 3.7975189818549796e-05,
      "loss": 1.3833,
      "num_input_tokens_seen": 29092249792,
      "step": 36977
    },
    {
      "epoch": 3.9229789942711646,
      "grad_norm": 0.5113062902576182,
      "learning_rate": 3.79745957752956e-05,
      "loss": 1.5364,
      "num_input_tokens_seen": 29093036640,
      "step": 36978
    },
    {
      "epoch": 3.9230850838107365,
      "grad_norm": 0.5448751781457356,
      "learning_rate": 3.7974001722015006e-05,
      "loss": 1.387,
      "num_input_tokens_seen": 29093823344,
      "step": 36979
    },
    {
      "epoch": 3.9231911733503075,
      "grad_norm": 0.6609973930261354,
      "learning_rate": 3.79734076587085e-05,
      "loss": 1.4087,
      "num_input_tokens_seen": 29094610064,
      "step": 36980
    },
    {
      "epoch": 3.923297262889879,
      "grad_norm": 0.46586981528216387,
      "learning_rate": 3.797281358537652e-05,
      "loss": 1.3843,
      "num_input_tokens_seen": 29095396848,
      "step": 36981
    },
    {
      "epoch": 3.9234033524294505,
      "grad_norm": 0.541151307622454,
      "learning_rate": 3.797221950201952e-05,
      "loss": 1.4557,
      "num_input_tokens_seen": 29096183552,
      "step": 36982
    },
    {
      "epoch": 3.923509441969022,
      "grad_norm": 0.4255195171067358,
      "learning_rate": 3.797162540863798e-05,
      "loss": 1.4513,
      "num_input_tokens_seen": 29096970256,
      "step": 36983
    },
    {
      "epoch": 3.9236155315085934,
      "grad_norm": 0.4411462309423555,
      "learning_rate": 3.797103130523235e-05,
      "loss": 1.3728,
      "num_input_tokens_seen": 29097757104,
      "step": 36984
    },
    {
      "epoch": 3.9237216210481645,
      "grad_norm": 0.5406614901971147,
      "learning_rate": 3.797043719180308e-05,
      "loss": 1.6008,
      "num_input_tokens_seen": 29098543808,
      "step": 36985
    },
    {
      "epoch": 3.923827710587736,
      "grad_norm": 0.4151259726393982,
      "learning_rate": 3.796984306835064e-05,
      "loss": 1.3456,
      "num_input_tokens_seen": 29099330624,
      "step": 36986
    },
    {
      "epoch": 3.9239338001273074,
      "grad_norm": 0.5060547618219545,
      "learning_rate": 3.796924893487549e-05,
      "loss": 1.4261,
      "num_input_tokens_seen": 29100117424,
      "step": 36987
    },
    {
      "epoch": 3.924039889666879,
      "grad_norm": 0.45672496858580347,
      "learning_rate": 3.796865479137808e-05,
      "loss": 1.5181,
      "num_input_tokens_seen": 29100904256,
      "step": 36988
    },
    {
      "epoch": 3.9241459792064504,
      "grad_norm": 0.4938278949269837,
      "learning_rate": 3.796806063785887e-05,
      "loss": 1.372,
      "num_input_tokens_seen": 29101690992,
      "step": 36989
    },
    {
      "epoch": 3.9242520687460214,
      "grad_norm": 0.46884903986799503,
      "learning_rate": 3.796746647431834e-05,
      "loss": 1.4708,
      "num_input_tokens_seen": 29102477728,
      "step": 36990
    },
    {
      "epoch": 3.9243581582855933,
      "grad_norm": 0.702702853989066,
      "learning_rate": 3.796687230075691e-05,
      "loss": 1.4979,
      "num_input_tokens_seen": 29103264480,
      "step": 36991
    },
    {
      "epoch": 3.9244642478251643,
      "grad_norm": 0.3881196338886773,
      "learning_rate": 3.796627811717508e-05,
      "loss": 1.3724,
      "num_input_tokens_seen": 29104051280,
      "step": 36992
    },
    {
      "epoch": 3.924570337364736,
      "grad_norm": 0.4706100527842949,
      "learning_rate": 3.796568392357328e-05,
      "loss": 1.4506,
      "num_input_tokens_seen": 29104838016,
      "step": 36993
    },
    {
      "epoch": 3.9246764269043073,
      "grad_norm": 0.6121152215375982,
      "learning_rate": 3.796508971995199e-05,
      "loss": 1.3992,
      "num_input_tokens_seen": 29105624800,
      "step": 36994
    },
    {
      "epoch": 3.9247825164438788,
      "grad_norm": 0.41146114114898447,
      "learning_rate": 3.7964495506311646e-05,
      "loss": 1.3374,
      "num_input_tokens_seen": 29106411600,
      "step": 36995
    },
    {
      "epoch": 3.9248886059834502,
      "grad_norm": 0.482575958888708,
      "learning_rate": 3.7963901282652726e-05,
      "loss": 1.425,
      "num_input_tokens_seen": 29107198352,
      "step": 36996
    },
    {
      "epoch": 3.9249946955230213,
      "grad_norm": 0.6086015078509549,
      "learning_rate": 3.7963307048975684e-05,
      "loss": 1.4049,
      "num_input_tokens_seen": 29107985120,
      "step": 36997
    },
    {
      "epoch": 3.9251007850625927,
      "grad_norm": 0.4520832813447048,
      "learning_rate": 3.796271280528097e-05,
      "loss": 1.3773,
      "num_input_tokens_seen": 29108771920,
      "step": 36998
    },
    {
      "epoch": 3.925206874602164,
      "grad_norm": 0.4636514870985903,
      "learning_rate": 3.796211855156907e-05,
      "loss": 1.3486,
      "num_input_tokens_seen": 29109558624,
      "step": 36999
    },
    {
      "epoch": 3.9253129641417357,
      "grad_norm": 0.46379272910462666,
      "learning_rate": 3.796152428784041e-05,
      "loss": 1.44,
      "num_input_tokens_seen": 29110345376,
      "step": 37000
    },
    {
      "epoch": 3.9253129641417357,
      "eval_loss": 1.5774205923080444,
      "eval_runtime": 65.515,
      "eval_samples_per_second": 45.791,
      "eval_steps_per_second": 0.488,
      "num_input_tokens_seen": 29110345376,
      "step": 37000
    },
    {
      "epoch": 3.925419053681307,
      "grad_norm": 0.4261241047334295,
      "learning_rate": 3.7960930014095475e-05,
      "loss": 1.3937,
      "num_input_tokens_seen": 29111132128,
      "step": 37001
    },
    {
      "epoch": 3.925525143220878,
      "grad_norm": 0.42303361014466706,
      "learning_rate": 3.79603357303347e-05,
      "loss": 1.4148,
      "num_input_tokens_seen": 29111918992,
      "step": 37002
    },
    {
      "epoch": 3.9256312327604497,
      "grad_norm": 0.4282420430446106,
      "learning_rate": 3.795974143655858e-05,
      "loss": 1.442,
      "num_input_tokens_seen": 29112705680,
      "step": 37003
    },
    {
      "epoch": 3.925737322300021,
      "grad_norm": 0.45472723796699793,
      "learning_rate": 3.795914713276754e-05,
      "loss": 1.5039,
      "num_input_tokens_seen": 29113492432,
      "step": 37004
    },
    {
      "epoch": 3.9258434118395926,
      "grad_norm": 0.4055170393666531,
      "learning_rate": 3.7958552818962046e-05,
      "loss": 1.3873,
      "num_input_tokens_seen": 29114279200,
      "step": 37005
    },
    {
      "epoch": 3.925949501379164,
      "grad_norm": 0.4258070713807132,
      "learning_rate": 3.7957958495142565e-05,
      "loss": 1.5344,
      "num_input_tokens_seen": 29115065904,
      "step": 37006
    },
    {
      "epoch": 3.9260555909187356,
      "grad_norm": 0.4416681801849838,
      "learning_rate": 3.795736416130956e-05,
      "loss": 1.4978,
      "num_input_tokens_seen": 29115852672,
      "step": 37007
    },
    {
      "epoch": 3.926161680458307,
      "grad_norm": 0.44239236999618037,
      "learning_rate": 3.795676981746348e-05,
      "loss": 1.444,
      "num_input_tokens_seen": 29116639584,
      "step": 37008
    },
    {
      "epoch": 3.926267769997878,
      "grad_norm": 0.452328451757326,
      "learning_rate": 3.795617546360478e-05,
      "loss": 1.4413,
      "num_input_tokens_seen": 29117426256,
      "step": 37009
    },
    {
      "epoch": 3.9263738595374496,
      "grad_norm": 0.8217264605479795,
      "learning_rate": 3.7955581099733936e-05,
      "loss": 1.4408,
      "num_input_tokens_seen": 29118213136,
      "step": 37010
    },
    {
      "epoch": 3.926479949077021,
      "grad_norm": 0.4982586442415499,
      "learning_rate": 3.7954986725851406e-05,
      "loss": 1.5758,
      "num_input_tokens_seen": 29118999760,
      "step": 37011
    },
    {
      "epoch": 3.9265860386165925,
      "grad_norm": 0.7076738918781121,
      "learning_rate": 3.795439234195763e-05,
      "loss": 1.4229,
      "num_input_tokens_seen": 29119786448,
      "step": 37012
    },
    {
      "epoch": 3.926692128156164,
      "grad_norm": 0.5509883077468631,
      "learning_rate": 3.795379794805309e-05,
      "loss": 1.4973,
      "num_input_tokens_seen": 29120573216,
      "step": 37013
    },
    {
      "epoch": 3.926798217695735,
      "grad_norm": 0.4720615622415936,
      "learning_rate": 3.795320354413823e-05,
      "loss": 1.3851,
      "num_input_tokens_seen": 29121359936,
      "step": 37014
    },
    {
      "epoch": 3.9269043072353065,
      "grad_norm": 0.5154809213402146,
      "learning_rate": 3.795260913021351e-05,
      "loss": 1.4817,
      "num_input_tokens_seen": 29122146624,
      "step": 37015
    },
    {
      "epoch": 3.927010396774878,
      "grad_norm": 0.5118396246442218,
      "learning_rate": 3.79520147062794e-05,
      "loss": 1.47,
      "num_input_tokens_seen": 29122933408,
      "step": 37016
    },
    {
      "epoch": 3.9271164863144494,
      "grad_norm": 0.4272605908560704,
      "learning_rate": 3.795142027233635e-05,
      "loss": 1.4432,
      "num_input_tokens_seen": 29123720160,
      "step": 37017
    },
    {
      "epoch": 3.927222575854021,
      "grad_norm": 0.5293209774858529,
      "learning_rate": 3.795082582838483e-05,
      "loss": 1.4255,
      "num_input_tokens_seen": 29124506928,
      "step": 37018
    },
    {
      "epoch": 3.927328665393592,
      "grad_norm": 0.5682024251041192,
      "learning_rate": 3.795023137442528e-05,
      "loss": 1.4587,
      "num_input_tokens_seen": 29125293792,
      "step": 37019
    },
    {
      "epoch": 3.927434754933164,
      "grad_norm": 0.49891524272328147,
      "learning_rate": 3.7949636910458176e-05,
      "loss": 1.5036,
      "num_input_tokens_seen": 29126080528,
      "step": 37020
    },
    {
      "epoch": 3.927540844472735,
      "grad_norm": 0.42658304761140725,
      "learning_rate": 3.794904243648397e-05,
      "loss": 1.4664,
      "num_input_tokens_seen": 29126867328,
      "step": 37021
    },
    {
      "epoch": 3.9276469340123064,
      "grad_norm": 0.49211357613097195,
      "learning_rate": 3.794844795250313e-05,
      "loss": 1.4292,
      "num_input_tokens_seen": 29127654080,
      "step": 37022
    },
    {
      "epoch": 3.927753023551878,
      "grad_norm": 0.43991867450891,
      "learning_rate": 3.7947853458516107e-05,
      "loss": 1.4169,
      "num_input_tokens_seen": 29128440800,
      "step": 37023
    },
    {
      "epoch": 3.9278591130914493,
      "grad_norm": 0.46830281692036446,
      "learning_rate": 3.7947258954523366e-05,
      "loss": 1.4876,
      "num_input_tokens_seen": 29129227504,
      "step": 37024
    },
    {
      "epoch": 3.927965202631021,
      "grad_norm": 0.4563002720273463,
      "learning_rate": 3.794666444052536e-05,
      "loss": 1.3764,
      "num_input_tokens_seen": 29130014272,
      "step": 37025
    },
    {
      "epoch": 3.928071292170592,
      "grad_norm": 0.5564672167823362,
      "learning_rate": 3.794606991652255e-05,
      "loss": 1.4194,
      "num_input_tokens_seen": 29130801056,
      "step": 37026
    },
    {
      "epoch": 3.9281773817101633,
      "grad_norm": 0.4461388825527997,
      "learning_rate": 3.794547538251539e-05,
      "loss": 1.4461,
      "num_input_tokens_seen": 29131587728,
      "step": 37027
    },
    {
      "epoch": 3.9282834712497348,
      "grad_norm": 0.47998701671995275,
      "learning_rate": 3.794488083850436e-05,
      "loss": 1.5006,
      "num_input_tokens_seen": 29132374448,
      "step": 37028
    },
    {
      "epoch": 3.9283895607893062,
      "grad_norm": 0.4928960742604485,
      "learning_rate": 3.7944286284489904e-05,
      "loss": 1.4139,
      "num_input_tokens_seen": 29133161216,
      "step": 37029
    },
    {
      "epoch": 3.9284956503288777,
      "grad_norm": 0.3994185062690216,
      "learning_rate": 3.794369172047248e-05,
      "loss": 1.3598,
      "num_input_tokens_seen": 29133947952,
      "step": 37030
    },
    {
      "epoch": 3.9286017398684487,
      "grad_norm": 0.4846113370440459,
      "learning_rate": 3.794309714645254e-05,
      "loss": 1.5016,
      "num_input_tokens_seen": 29134734688,
      "step": 37031
    },
    {
      "epoch": 3.92870782940802,
      "grad_norm": 0.46665668121175496,
      "learning_rate": 3.794250256243057e-05,
      "loss": 1.5592,
      "num_input_tokens_seen": 29135521360,
      "step": 37032
    },
    {
      "epoch": 3.9288139189475917,
      "grad_norm": 0.489814184634161,
      "learning_rate": 3.794190796840701e-05,
      "loss": 1.467,
      "num_input_tokens_seen": 29136308128,
      "step": 37033
    },
    {
      "epoch": 3.928920008487163,
      "grad_norm": 0.4695630245077104,
      "learning_rate": 3.794131336438232e-05,
      "loss": 1.4478,
      "num_input_tokens_seen": 29137094896,
      "step": 37034
    },
    {
      "epoch": 3.9290260980267346,
      "grad_norm": 0.4524014053247419,
      "learning_rate": 3.794071875035696e-05,
      "loss": 1.4618,
      "num_input_tokens_seen": 29137881664,
      "step": 37035
    },
    {
      "epoch": 3.929132187566306,
      "grad_norm": 0.4465209374792527,
      "learning_rate": 3.79401241263314e-05,
      "loss": 1.3714,
      "num_input_tokens_seen": 29138668384,
      "step": 37036
    },
    {
      "epoch": 3.9292382771058776,
      "grad_norm": 0.4557171260725436,
      "learning_rate": 3.793952949230609e-05,
      "loss": 1.3739,
      "num_input_tokens_seen": 29139455104,
      "step": 37037
    },
    {
      "epoch": 3.9293443666454486,
      "grad_norm": 0.4305233917742848,
      "learning_rate": 3.793893484828149e-05,
      "loss": 1.4821,
      "num_input_tokens_seen": 29140241920,
      "step": 37038
    },
    {
      "epoch": 3.92945045618502,
      "grad_norm": 0.4854375848201249,
      "learning_rate": 3.793834019425806e-05,
      "loss": 1.5492,
      "num_input_tokens_seen": 29141028640,
      "step": 37039
    },
    {
      "epoch": 3.9295565457245916,
      "grad_norm": 0.4075397826238198,
      "learning_rate": 3.793774553023626e-05,
      "loss": 1.3866,
      "num_input_tokens_seen": 29141815376,
      "step": 37040
    },
    {
      "epoch": 3.929662635264163,
      "grad_norm": 0.49289107342735333,
      "learning_rate": 3.793715085621655e-05,
      "loss": 1.463,
      "num_input_tokens_seen": 29142602032,
      "step": 37041
    },
    {
      "epoch": 3.9297687248037345,
      "grad_norm": 0.4502555367429309,
      "learning_rate": 3.79365561721994e-05,
      "loss": 1.4562,
      "num_input_tokens_seen": 29143388800,
      "step": 37042
    },
    {
      "epoch": 3.9298748143433055,
      "grad_norm": 0.44002338603512947,
      "learning_rate": 3.7935961478185244e-05,
      "loss": 1.5083,
      "num_input_tokens_seen": 29144175632,
      "step": 37043
    },
    {
      "epoch": 3.929980903882877,
      "grad_norm": 0.43313148785774547,
      "learning_rate": 3.7935366774174564e-05,
      "loss": 1.4653,
      "num_input_tokens_seen": 29144962272,
      "step": 37044
    },
    {
      "epoch": 3.9300869934224485,
      "grad_norm": 0.4330525145910152,
      "learning_rate": 3.7934772060167804e-05,
      "loss": 1.4473,
      "num_input_tokens_seen": 29145748960,
      "step": 37045
    },
    {
      "epoch": 3.93019308296202,
      "grad_norm": 0.3994236250831631,
      "learning_rate": 3.7934177336165446e-05,
      "loss": 1.4369,
      "num_input_tokens_seen": 29146535600,
      "step": 37046
    },
    {
      "epoch": 3.9302991725015914,
      "grad_norm": 0.4114522146992459,
      "learning_rate": 3.793358260216793e-05,
      "loss": 1.425,
      "num_input_tokens_seen": 29147322512,
      "step": 37047
    },
    {
      "epoch": 3.9304052620411625,
      "grad_norm": 0.4448978490593171,
      "learning_rate": 3.793298785817571e-05,
      "loss": 1.37,
      "num_input_tokens_seen": 29148109296,
      "step": 37048
    },
    {
      "epoch": 3.9305113515807344,
      "grad_norm": 0.40494741451314664,
      "learning_rate": 3.7932393104189264e-05,
      "loss": 1.4881,
      "num_input_tokens_seen": 29148896080,
      "step": 37049
    },
    {
      "epoch": 3.9306174411203054,
      "grad_norm": 0.4572255927133181,
      "learning_rate": 3.7931798340209045e-05,
      "loss": 1.477,
      "num_input_tokens_seen": 29149682832,
      "step": 37050
    },
    {
      "epoch": 3.930723530659877,
      "grad_norm": 0.4384424536992496,
      "learning_rate": 3.793120356623551e-05,
      "loss": 1.4212,
      "num_input_tokens_seen": 29150469536,
      "step": 37051
    },
    {
      "epoch": 3.9308296201994484,
      "grad_norm": 0.7641853393476784,
      "learning_rate": 3.793060878226912e-05,
      "loss": 1.4813,
      "num_input_tokens_seen": 29151256288,
      "step": 37052
    },
    {
      "epoch": 3.93093570973902,
      "grad_norm": 0.39837722868003456,
      "learning_rate": 3.7930013988310345e-05,
      "loss": 1.3342,
      "num_input_tokens_seen": 29152043040,
      "step": 37053
    },
    {
      "epoch": 3.9310417992785913,
      "grad_norm": 0.5691843480257818,
      "learning_rate": 3.7929419184359616e-05,
      "loss": 1.4142,
      "num_input_tokens_seen": 29152829888,
      "step": 37054
    },
    {
      "epoch": 3.9311478888181624,
      "grad_norm": 1.1598234551383828,
      "learning_rate": 3.792882437041743e-05,
      "loss": 1.4688,
      "num_input_tokens_seen": 29153616688,
      "step": 37055
    },
    {
      "epoch": 3.931253978357734,
      "grad_norm": 0.5234416729750755,
      "learning_rate": 3.792822954648422e-05,
      "loss": 1.3958,
      "num_input_tokens_seen": 29154403504,
      "step": 37056
    },
    {
      "epoch": 3.9313600678973053,
      "grad_norm": 1.1485158331500023,
      "learning_rate": 3.792763471256044e-05,
      "loss": 1.5514,
      "num_input_tokens_seen": 29155190208,
      "step": 37057
    },
    {
      "epoch": 3.9314661574368768,
      "grad_norm": 0.5637581011538401,
      "learning_rate": 3.792703986864658e-05,
      "loss": 1.5249,
      "num_input_tokens_seen": 29155976880,
      "step": 37058
    },
    {
      "epoch": 3.9315722469764482,
      "grad_norm": 0.7733253590475966,
      "learning_rate": 3.792644501474308e-05,
      "loss": 1.5022,
      "num_input_tokens_seen": 29156763552,
      "step": 37059
    },
    {
      "epoch": 3.9316783365160193,
      "grad_norm": 0.958397063244978,
      "learning_rate": 3.79258501508504e-05,
      "loss": 1.4004,
      "num_input_tokens_seen": 29157550240,
      "step": 37060
    },
    {
      "epoch": 3.9317844260555908,
      "grad_norm": 0.5373226693393842,
      "learning_rate": 3.7925255276969004e-05,
      "loss": 1.4204,
      "num_input_tokens_seen": 29158337008,
      "step": 37061
    },
    {
      "epoch": 3.9318905155951622,
      "grad_norm": 0.7511058872884812,
      "learning_rate": 3.792466039309935e-05,
      "loss": 1.4386,
      "num_input_tokens_seen": 29159123728,
      "step": 37062
    },
    {
      "epoch": 3.9319966051347337,
      "grad_norm": 0.902897122470353,
      "learning_rate": 3.79240654992419e-05,
      "loss": 1.5224,
      "num_input_tokens_seen": 29159910512,
      "step": 37063
    },
    {
      "epoch": 3.932102694674305,
      "grad_norm": 0.4518526037520854,
      "learning_rate": 3.792347059539711e-05,
      "loss": 1.3596,
      "num_input_tokens_seen": 29160697232,
      "step": 37064
    },
    {
      "epoch": 3.9322087842138767,
      "grad_norm": 1.0172152014858442,
      "learning_rate": 3.7922875681565434e-05,
      "loss": 1.5036,
      "num_input_tokens_seen": 29161483920,
      "step": 37065
    },
    {
      "epoch": 3.932314873753448,
      "grad_norm": 0.693941166228723,
      "learning_rate": 3.7922280757747346e-05,
      "loss": 1.5428,
      "num_input_tokens_seen": 29162270560,
      "step": 37066
    },
    {
      "epoch": 3.932420963293019,
      "grad_norm": 0.48434077469409037,
      "learning_rate": 3.7921685823943295e-05,
      "loss": 1.4735,
      "num_input_tokens_seen": 29163057360,
      "step": 37067
    },
    {
      "epoch": 3.9325270528325906,
      "grad_norm": 0.8120437240040349,
      "learning_rate": 3.792109088015375e-05,
      "loss": 1.4062,
      "num_input_tokens_seen": 29163844064,
      "step": 37068
    },
    {
      "epoch": 3.932633142372162,
      "grad_norm": 0.48864155833745904,
      "learning_rate": 3.792049592637916e-05,
      "loss": 1.3733,
      "num_input_tokens_seen": 29164630896,
      "step": 37069
    },
    {
      "epoch": 3.9327392319117336,
      "grad_norm": 0.5158727110655376,
      "learning_rate": 3.7919900962619994e-05,
      "loss": 1.5301,
      "num_input_tokens_seen": 29165417648,
      "step": 37070
    },
    {
      "epoch": 3.932845321451305,
      "grad_norm": 0.7956818370906168,
      "learning_rate": 3.79193059888767e-05,
      "loss": 1.4881,
      "num_input_tokens_seen": 29166204432,
      "step": 37071
    },
    {
      "epoch": 3.932951410990876,
      "grad_norm": 0.4983411897279792,
      "learning_rate": 3.7918711005149754e-05,
      "loss": 1.3893,
      "num_input_tokens_seen": 29166991232,
      "step": 37072
    },
    {
      "epoch": 3.9330575005304476,
      "grad_norm": 0.5981274556888181,
      "learning_rate": 3.791811601143961e-05,
      "loss": 1.52,
      "num_input_tokens_seen": 29167777936,
      "step": 37073
    },
    {
      "epoch": 3.933163590070019,
      "grad_norm": 0.557816785909252,
      "learning_rate": 3.7917521007746714e-05,
      "loss": 1.3802,
      "num_input_tokens_seen": 29168564672,
      "step": 37074
    },
    {
      "epoch": 3.9332696796095905,
      "grad_norm": 0.4996639583975366,
      "learning_rate": 3.791692599407154e-05,
      "loss": 1.5295,
      "num_input_tokens_seen": 29169351360,
      "step": 37075
    },
    {
      "epoch": 3.933375769149162,
      "grad_norm": 0.45344072304534155,
      "learning_rate": 3.791633097041454e-05,
      "loss": 1.3814,
      "num_input_tokens_seen": 29170138144,
      "step": 37076
    },
    {
      "epoch": 3.9334818586887335,
      "grad_norm": 0.5689033582922951,
      "learning_rate": 3.7915735936776186e-05,
      "loss": 1.4194,
      "num_input_tokens_seen": 29170924944,
      "step": 37077
    },
    {
      "epoch": 3.933587948228305,
      "grad_norm": 0.4701782555752564,
      "learning_rate": 3.791514089315693e-05,
      "loss": 1.3745,
      "num_input_tokens_seen": 29171711728,
      "step": 37078
    },
    {
      "epoch": 3.933694037767876,
      "grad_norm": 0.42773428293038995,
      "learning_rate": 3.791454583955724e-05,
      "loss": 1.4087,
      "num_input_tokens_seen": 29172498480,
      "step": 37079
    },
    {
      "epoch": 3.9338001273074474,
      "grad_norm": 0.5212130230142128,
      "learning_rate": 3.7913950775977555e-05,
      "loss": 1.4082,
      "num_input_tokens_seen": 29173285312,
      "step": 37080
    },
    {
      "epoch": 3.933906216847019,
      "grad_norm": 0.4159976778996072,
      "learning_rate": 3.7913355702418354e-05,
      "loss": 1.3807,
      "num_input_tokens_seen": 29174072160,
      "step": 37081
    },
    {
      "epoch": 3.9340123063865904,
      "grad_norm": 0.43841581004337155,
      "learning_rate": 3.791276061888008e-05,
      "loss": 1.4449,
      "num_input_tokens_seen": 29174858960,
      "step": 37082
    },
    {
      "epoch": 3.934118395926162,
      "grad_norm": 0.4641200347227793,
      "learning_rate": 3.791216552536321e-05,
      "loss": 1.3592,
      "num_input_tokens_seen": 29175645744,
      "step": 37083
    },
    {
      "epoch": 3.934224485465733,
      "grad_norm": 0.3991920259614482,
      "learning_rate": 3.7911570421868204e-05,
      "loss": 1.5068,
      "num_input_tokens_seen": 29176432560,
      "step": 37084
    },
    {
      "epoch": 3.9343305750053044,
      "grad_norm": 0.4100121913890279,
      "learning_rate": 3.791097530839551e-05,
      "loss": 1.3634,
      "num_input_tokens_seen": 29177219344,
      "step": 37085
    },
    {
      "epoch": 3.934436664544876,
      "grad_norm": 0.4753775228176865,
      "learning_rate": 3.7910380184945586e-05,
      "loss": 1.4686,
      "num_input_tokens_seen": 29178006096,
      "step": 37086
    },
    {
      "epoch": 3.9345427540844473,
      "grad_norm": 0.44950791928681455,
      "learning_rate": 3.790978505151891e-05,
      "loss": 1.4769,
      "num_input_tokens_seen": 29178792928,
      "step": 37087
    },
    {
      "epoch": 3.934648843624019,
      "grad_norm": 0.48452134455898827,
      "learning_rate": 3.7909189908115925e-05,
      "loss": 1.4155,
      "num_input_tokens_seen": 29179579632,
      "step": 37088
    },
    {
      "epoch": 3.93475493316359,
      "grad_norm": 0.4476530159310164,
      "learning_rate": 3.79085947547371e-05,
      "loss": 1.3772,
      "num_input_tokens_seen": 29180366320,
      "step": 37089
    },
    {
      "epoch": 3.9348610227031617,
      "grad_norm": 0.45617768031440104,
      "learning_rate": 3.7907999591382894e-05,
      "loss": 1.4729,
      "num_input_tokens_seen": 29181153088,
      "step": 37090
    },
    {
      "epoch": 3.9349671122427328,
      "grad_norm": 0.4356268033896052,
      "learning_rate": 3.790740441805376e-05,
      "loss": 1.3739,
      "num_input_tokens_seen": 29181939824,
      "step": 37091
    },
    {
      "epoch": 3.9350732017823042,
      "grad_norm": 0.4040413896409767,
      "learning_rate": 3.790680923475016e-05,
      "loss": 1.4103,
      "num_input_tokens_seen": 29182726704,
      "step": 37092
    },
    {
      "epoch": 3.9351792913218757,
      "grad_norm": 0.44427254382868403,
      "learning_rate": 3.790621404147257e-05,
      "loss": 1.4721,
      "num_input_tokens_seen": 29183513520,
      "step": 37093
    },
    {
      "epoch": 3.935285380861447,
      "grad_norm": 0.4045785406590982,
      "learning_rate": 3.790561883822142e-05,
      "loss": 1.4501,
      "num_input_tokens_seen": 29184300336,
      "step": 37094
    },
    {
      "epoch": 3.9353914704010187,
      "grad_norm": 0.47095303866307214,
      "learning_rate": 3.790502362499719e-05,
      "loss": 1.4914,
      "num_input_tokens_seen": 29185087072,
      "step": 37095
    },
    {
      "epoch": 3.9354975599405897,
      "grad_norm": 0.443206338942066,
      "learning_rate": 3.7904428401800344e-05,
      "loss": 1.4287,
      "num_input_tokens_seen": 29185873808,
      "step": 37096
    },
    {
      "epoch": 3.935603649480161,
      "grad_norm": 0.4389978742027225,
      "learning_rate": 3.790383316863133e-05,
      "loss": 1.3762,
      "num_input_tokens_seen": 29186660576,
      "step": 37097
    },
    {
      "epoch": 3.9357097390197326,
      "grad_norm": 0.47253062749404534,
      "learning_rate": 3.790323792549061e-05,
      "loss": 1.3887,
      "num_input_tokens_seen": 29187447376,
      "step": 37098
    },
    {
      "epoch": 3.935815828559304,
      "grad_norm": 0.4565037945343925,
      "learning_rate": 3.790264267237865e-05,
      "loss": 1.4601,
      "num_input_tokens_seen": 29188234064,
      "step": 37099
    },
    {
      "epoch": 3.9359219180988756,
      "grad_norm": 0.3956137530508232,
      "learning_rate": 3.790204740929591e-05,
      "loss": 1.3832,
      "num_input_tokens_seen": 29189020944,
      "step": 37100
    },
    {
      "epoch": 3.9360280076384466,
      "grad_norm": 0.44938227604126924,
      "learning_rate": 3.7901452136242835e-05,
      "loss": 1.4495,
      "num_input_tokens_seen": 29189807712,
      "step": 37101
    },
    {
      "epoch": 3.936134097178018,
      "grad_norm": 0.48827510218844794,
      "learning_rate": 3.790085685321991e-05,
      "loss": 1.4697,
      "num_input_tokens_seen": 29190594448,
      "step": 37102
    },
    {
      "epoch": 3.9362401867175896,
      "grad_norm": 0.44127085246785613,
      "learning_rate": 3.790026156022757e-05,
      "loss": 1.5073,
      "num_input_tokens_seen": 29191381120,
      "step": 37103
    },
    {
      "epoch": 3.936346276257161,
      "grad_norm": 0.5368907977208777,
      "learning_rate": 3.7899666257266294e-05,
      "loss": 1.4092,
      "num_input_tokens_seen": 29192167840,
      "step": 37104
    },
    {
      "epoch": 3.9364523657967325,
      "grad_norm": 0.506443355892793,
      "learning_rate": 3.7899070944336524e-05,
      "loss": 1.4475,
      "num_input_tokens_seen": 29192954672,
      "step": 37105
    },
    {
      "epoch": 3.936558455336304,
      "grad_norm": 0.5177473027546495,
      "learning_rate": 3.789847562143874e-05,
      "loss": 1.4716,
      "num_input_tokens_seen": 29193741472,
      "step": 37106
    },
    {
      "epoch": 3.9366645448758755,
      "grad_norm": 0.7776062794723588,
      "learning_rate": 3.789788028857339e-05,
      "loss": 1.5131,
      "num_input_tokens_seen": 29194528256,
      "step": 37107
    },
    {
      "epoch": 3.9367706344154465,
      "grad_norm": 0.5178425752348988,
      "learning_rate": 3.789728494574093e-05,
      "loss": 1.5427,
      "num_input_tokens_seen": 29195315024,
      "step": 37108
    },
    {
      "epoch": 3.936876723955018,
      "grad_norm": 0.5921154572966424,
      "learning_rate": 3.7896689592941836e-05,
      "loss": 1.5264,
      "num_input_tokens_seen": 29196101824,
      "step": 37109
    },
    {
      "epoch": 3.9369828134945895,
      "grad_norm": 0.6320850695721412,
      "learning_rate": 3.7896094230176556e-05,
      "loss": 1.5069,
      "num_input_tokens_seen": 29196888480,
      "step": 37110
    },
    {
      "epoch": 3.937088903034161,
      "grad_norm": 0.46498513753348325,
      "learning_rate": 3.7895498857445555e-05,
      "loss": 1.3739,
      "num_input_tokens_seen": 29197675232,
      "step": 37111
    },
    {
      "epoch": 3.9371949925737324,
      "grad_norm": 0.5072447725754039,
      "learning_rate": 3.7894903474749285e-05,
      "loss": 1.5341,
      "num_input_tokens_seen": 29198462032,
      "step": 37112
    },
    {
      "epoch": 3.9373010821133034,
      "grad_norm": 0.43173472348834196,
      "learning_rate": 3.789430808208823e-05,
      "loss": 1.3903,
      "num_input_tokens_seen": 29199248896,
      "step": 37113
    },
    {
      "epoch": 3.937407171652875,
      "grad_norm": 0.43793825708598355,
      "learning_rate": 3.7893712679462805e-05,
      "loss": 1.3672,
      "num_input_tokens_seen": 29200035600,
      "step": 37114
    },
    {
      "epoch": 3.9375132611924464,
      "grad_norm": 0.464310229500882,
      "learning_rate": 3.789311726687351e-05,
      "loss": 1.4758,
      "num_input_tokens_seen": 29200822288,
      "step": 37115
    },
    {
      "epoch": 3.937619350732018,
      "grad_norm": 0.5019331836795605,
      "learning_rate": 3.7892521844320796e-05,
      "loss": 1.3822,
      "num_input_tokens_seen": 29201609056,
      "step": 37116
    },
    {
      "epoch": 3.9377254402715893,
      "grad_norm": 0.37787062846650443,
      "learning_rate": 3.789192641180511e-05,
      "loss": 1.3972,
      "num_input_tokens_seen": 29202395824,
      "step": 37117
    },
    {
      "epoch": 3.9378315298111604,
      "grad_norm": 0.5190003798711834,
      "learning_rate": 3.789133096932693e-05,
      "loss": 1.5278,
      "num_input_tokens_seen": 29203182608,
      "step": 37118
    },
    {
      "epoch": 3.9379376193507323,
      "grad_norm": 0.46973106918891594,
      "learning_rate": 3.78907355168867e-05,
      "loss": 1.5077,
      "num_input_tokens_seen": 29203969328,
      "step": 37119
    },
    {
      "epoch": 3.9380437088903033,
      "grad_norm": 0.4579303532830973,
      "learning_rate": 3.7890140054484894e-05,
      "loss": 1.5343,
      "num_input_tokens_seen": 29204756016,
      "step": 37120
    },
    {
      "epoch": 3.938149798429875,
      "grad_norm": 0.48297521976112,
      "learning_rate": 3.7889544582121974e-05,
      "loss": 1.4987,
      "num_input_tokens_seen": 29205542768,
      "step": 37121
    },
    {
      "epoch": 3.9382558879694463,
      "grad_norm": 0.4298518354997993,
      "learning_rate": 3.7888949099798374e-05,
      "loss": 1.4701,
      "num_input_tokens_seen": 29206329568,
      "step": 37122
    },
    {
      "epoch": 3.9383619775090177,
      "grad_norm": 0.4827821802919983,
      "learning_rate": 3.788835360751458e-05,
      "loss": 1.4624,
      "num_input_tokens_seen": 29207116432,
      "step": 37123
    },
    {
      "epoch": 3.938468067048589,
      "grad_norm": 0.5137725630336969,
      "learning_rate": 3.788775810527105e-05,
      "loss": 1.5308,
      "num_input_tokens_seen": 29207903136,
      "step": 37124
    },
    {
      "epoch": 3.9385741565881602,
      "grad_norm": 0.45333500976783864,
      "learning_rate": 3.7887162593068226e-05,
      "loss": 1.375,
      "num_input_tokens_seen": 29208689920,
      "step": 37125
    },
    {
      "epoch": 3.9386802461277317,
      "grad_norm": 0.5029677031568575,
      "learning_rate": 3.78865670709066e-05,
      "loss": 1.4191,
      "num_input_tokens_seen": 29209476752,
      "step": 37126
    },
    {
      "epoch": 3.938786335667303,
      "grad_norm": 0.6248172070037715,
      "learning_rate": 3.78859715387866e-05,
      "loss": 1.4107,
      "num_input_tokens_seen": 29210263536,
      "step": 37127
    },
    {
      "epoch": 3.9388924252068747,
      "grad_norm": 0.6095913066031017,
      "learning_rate": 3.78853759967087e-05,
      "loss": 1.423,
      "num_input_tokens_seen": 29211050320,
      "step": 37128
    },
    {
      "epoch": 3.938998514746446,
      "grad_norm": 0.6331606829672976,
      "learning_rate": 3.788478044467336e-05,
      "loss": 1.4123,
      "num_input_tokens_seen": 29211837120,
      "step": 37129
    },
    {
      "epoch": 3.939104604286017,
      "grad_norm": 0.6526993898222855,
      "learning_rate": 3.788418488268104e-05,
      "loss": 1.4064,
      "num_input_tokens_seen": 29212623872,
      "step": 37130
    },
    {
      "epoch": 3.9392106938255886,
      "grad_norm": 0.4507315524270313,
      "learning_rate": 3.7883589310732194e-05,
      "loss": 1.5059,
      "num_input_tokens_seen": 29213410672,
      "step": 37131
    },
    {
      "epoch": 3.93931678336516,
      "grad_norm": 0.477188461737176,
      "learning_rate": 3.78829937288273e-05,
      "loss": 1.4061,
      "num_input_tokens_seen": 29214197344,
      "step": 37132
    },
    {
      "epoch": 3.9394228729047316,
      "grad_norm": 0.8520171904700962,
      "learning_rate": 3.78823981369668e-05,
      "loss": 1.4064,
      "num_input_tokens_seen": 29214984048,
      "step": 37133
    },
    {
      "epoch": 3.939528962444303,
      "grad_norm": 0.5218021621480285,
      "learning_rate": 3.788180253515115e-05,
      "loss": 1.4388,
      "num_input_tokens_seen": 29215770880,
      "step": 37134
    },
    {
      "epoch": 3.9396350519838745,
      "grad_norm": 0.5762402022040607,
      "learning_rate": 3.788120692338084e-05,
      "loss": 1.3427,
      "num_input_tokens_seen": 29216557712,
      "step": 37135
    },
    {
      "epoch": 3.939741141523446,
      "grad_norm": 0.8907548093362774,
      "learning_rate": 3.788061130165631e-05,
      "loss": 1.4305,
      "num_input_tokens_seen": 29217344480,
      "step": 37136
    },
    {
      "epoch": 3.939847231063017,
      "grad_norm": 0.4759279074405969,
      "learning_rate": 3.788001566997801e-05,
      "loss": 1.402,
      "num_input_tokens_seen": 29218131216,
      "step": 37137
    },
    {
      "epoch": 3.9399533206025885,
      "grad_norm": 0.5063156181804453,
      "learning_rate": 3.787942002834642e-05,
      "loss": 1.3238,
      "num_input_tokens_seen": 29218918080,
      "step": 37138
    },
    {
      "epoch": 3.94005941014216,
      "grad_norm": 0.8561777192315965,
      "learning_rate": 3.787882437676199e-05,
      "loss": 1.4827,
      "num_input_tokens_seen": 29219704832,
      "step": 37139
    },
    {
      "epoch": 3.9401654996817315,
      "grad_norm": 0.4411790204793439,
      "learning_rate": 3.7878228715225184e-05,
      "loss": 1.3728,
      "num_input_tokens_seen": 29220491552,
      "step": 37140
    },
    {
      "epoch": 3.940271589221303,
      "grad_norm": 0.8238483899282519,
      "learning_rate": 3.787763304373646e-05,
      "loss": 1.4384,
      "num_input_tokens_seen": 29221278448,
      "step": 37141
    },
    {
      "epoch": 3.940377678760874,
      "grad_norm": 0.7593233053832028,
      "learning_rate": 3.787703736229628e-05,
      "loss": 1.4378,
      "num_input_tokens_seen": 29222065232,
      "step": 37142
    },
    {
      "epoch": 3.9404837683004454,
      "grad_norm": 0.4468200254172114,
      "learning_rate": 3.787644167090509e-05,
      "loss": 1.4988,
      "num_input_tokens_seen": 29222852016,
      "step": 37143
    },
    {
      "epoch": 3.940589857840017,
      "grad_norm": 1.0945615149068044,
      "learning_rate": 3.787584596956338e-05,
      "loss": 1.3936,
      "num_input_tokens_seen": 29223638800,
      "step": 37144
    },
    {
      "epoch": 3.9406959473795884,
      "grad_norm": 0.8102487699096859,
      "learning_rate": 3.787525025827159e-05,
      "loss": 1.4211,
      "num_input_tokens_seen": 29224425552,
      "step": 37145
    },
    {
      "epoch": 3.94080203691916,
      "grad_norm": 0.5512289066766118,
      "learning_rate": 3.787465453703018e-05,
      "loss": 1.4367,
      "num_input_tokens_seen": 29225212416,
      "step": 37146
    },
    {
      "epoch": 3.940908126458731,
      "grad_norm": 1.1051063375334955,
      "learning_rate": 3.7874058805839616e-05,
      "loss": 1.5264,
      "num_input_tokens_seen": 29225999168,
      "step": 37147
    },
    {
      "epoch": 3.941014215998303,
      "grad_norm": 0.7262317434178158,
      "learning_rate": 3.787346306470036e-05,
      "loss": 1.4827,
      "num_input_tokens_seen": 29226785920,
      "step": 37148
    },
    {
      "epoch": 3.941120305537874,
      "grad_norm": 0.5825255543096687,
      "learning_rate": 3.787286731361287e-05,
      "loss": 1.4157,
      "num_input_tokens_seen": 29227572688,
      "step": 37149
    },
    {
      "epoch": 3.9412263950774453,
      "grad_norm": 0.7858810963435032,
      "learning_rate": 3.787227155257761e-05,
      "loss": 1.2989,
      "num_input_tokens_seen": 29228359584,
      "step": 37150
    },
    {
      "epoch": 3.941332484617017,
      "grad_norm": 0.6643341441592576,
      "learning_rate": 3.787167578159502e-05,
      "loss": 1.4046,
      "num_input_tokens_seen": 29229146256,
      "step": 37151
    },
    {
      "epoch": 3.9414385741565883,
      "grad_norm": 0.47659967639582806,
      "learning_rate": 3.7871080000665594e-05,
      "loss": 1.4659,
      "num_input_tokens_seen": 29229932992,
      "step": 37152
    },
    {
      "epoch": 3.9415446636961597,
      "grad_norm": 0.7016014006799208,
      "learning_rate": 3.787048420978977e-05,
      "loss": 1.4127,
      "num_input_tokens_seen": 29230719856,
      "step": 37153
    },
    {
      "epoch": 3.9416507532357308,
      "grad_norm": 0.7855859698789865,
      "learning_rate": 3.786988840896801e-05,
      "loss": 1.4639,
      "num_input_tokens_seen": 29231506560,
      "step": 37154
    },
    {
      "epoch": 3.9417568427753022,
      "grad_norm": 0.4705978525738204,
      "learning_rate": 3.786929259820078e-05,
      "loss": 1.4235,
      "num_input_tokens_seen": 29232293280,
      "step": 37155
    },
    {
      "epoch": 3.9418629323148737,
      "grad_norm": 0.7472680379243709,
      "learning_rate": 3.7868696777488535e-05,
      "loss": 1.4328,
      "num_input_tokens_seen": 29233079984,
      "step": 37156
    },
    {
      "epoch": 3.941969021854445,
      "grad_norm": 0.608399451942681,
      "learning_rate": 3.786810094683174e-05,
      "loss": 1.4832,
      "num_input_tokens_seen": 29233866720,
      "step": 37157
    },
    {
      "epoch": 3.9420751113940167,
      "grad_norm": 0.47587369597016754,
      "learning_rate": 3.786750510623086e-05,
      "loss": 1.4546,
      "num_input_tokens_seen": 29234653504,
      "step": 37158
    },
    {
      "epoch": 3.9421812009335877,
      "grad_norm": 0.739001362522215,
      "learning_rate": 3.786690925568635e-05,
      "loss": 1.5652,
      "num_input_tokens_seen": 29235440256,
      "step": 37159
    },
    {
      "epoch": 3.9422872904731596,
      "grad_norm": 0.5722245548962069,
      "learning_rate": 3.786631339519866e-05,
      "loss": 1.4523,
      "num_input_tokens_seen": 29236227088,
      "step": 37160
    },
    {
      "epoch": 3.9423933800127307,
      "grad_norm": 0.5442092311998586,
      "learning_rate": 3.7865717524768263e-05,
      "loss": 1.5501,
      "num_input_tokens_seen": 29237013712,
      "step": 37161
    },
    {
      "epoch": 3.942499469552302,
      "grad_norm": 0.576403105290546,
      "learning_rate": 3.7865121644395624e-05,
      "loss": 1.4714,
      "num_input_tokens_seen": 29237800480,
      "step": 37162
    },
    {
      "epoch": 3.9426055590918736,
      "grad_norm": 0.5316056687382453,
      "learning_rate": 3.786452575408119e-05,
      "loss": 1.4586,
      "num_input_tokens_seen": 29238587216,
      "step": 37163
    },
    {
      "epoch": 3.942711648631445,
      "grad_norm": 0.4491910513389803,
      "learning_rate": 3.786392985382543e-05,
      "loss": 1.432,
      "num_input_tokens_seen": 29239373984,
      "step": 37164
    },
    {
      "epoch": 3.9428177381710166,
      "grad_norm": 0.7335303846367971,
      "learning_rate": 3.78633339436288e-05,
      "loss": 1.5028,
      "num_input_tokens_seen": 29240160704,
      "step": 37165
    },
    {
      "epoch": 3.9429238277105876,
      "grad_norm": 0.4950613185679863,
      "learning_rate": 3.7862738023491764e-05,
      "loss": 1.4402,
      "num_input_tokens_seen": 29240947488,
      "step": 37166
    },
    {
      "epoch": 3.943029917250159,
      "grad_norm": 0.5166303759249912,
      "learning_rate": 3.7862142093414784e-05,
      "loss": 1.4275,
      "num_input_tokens_seen": 29241734288,
      "step": 37167
    },
    {
      "epoch": 3.9431360067897305,
      "grad_norm": 0.5111337759595651,
      "learning_rate": 3.786154615339832e-05,
      "loss": 1.4079,
      "num_input_tokens_seen": 29242521056,
      "step": 37168
    },
    {
      "epoch": 3.943242096329302,
      "grad_norm": 0.5665175434957591,
      "learning_rate": 3.786095020344283e-05,
      "loss": 1.5357,
      "num_input_tokens_seen": 29243307760,
      "step": 37169
    },
    {
      "epoch": 3.9433481858688735,
      "grad_norm": 0.4780677443353802,
      "learning_rate": 3.7860354243548774e-05,
      "loss": 1.3796,
      "num_input_tokens_seen": 29244094496,
      "step": 37170
    },
    {
      "epoch": 3.9434542754084445,
      "grad_norm": 0.492101819613108,
      "learning_rate": 3.785975827371661e-05,
      "loss": 1.4468,
      "num_input_tokens_seen": 29244881280,
      "step": 37171
    },
    {
      "epoch": 3.943560364948016,
      "grad_norm": 0.5730754383769833,
      "learning_rate": 3.785916229394681e-05,
      "loss": 1.4914,
      "num_input_tokens_seen": 29245668096,
      "step": 37172
    },
    {
      "epoch": 3.9436664544875875,
      "grad_norm": 0.45627796283377603,
      "learning_rate": 3.785856630423982e-05,
      "loss": 1.5135,
      "num_input_tokens_seen": 29246454816,
      "step": 37173
    },
    {
      "epoch": 3.943772544027159,
      "grad_norm": 0.4512079952543611,
      "learning_rate": 3.7857970304596104e-05,
      "loss": 1.4405,
      "num_input_tokens_seen": 29247241616,
      "step": 37174
    },
    {
      "epoch": 3.9438786335667304,
      "grad_norm": 0.4927039197443111,
      "learning_rate": 3.785737429501614e-05,
      "loss": 1.3861,
      "num_input_tokens_seen": 29248028368,
      "step": 37175
    },
    {
      "epoch": 3.943984723106302,
      "grad_norm": 0.4832623564873113,
      "learning_rate": 3.785677827550036e-05,
      "loss": 1.5026,
      "num_input_tokens_seen": 29248815200,
      "step": 37176
    },
    {
      "epoch": 3.9440908126458734,
      "grad_norm": 0.4774535908776991,
      "learning_rate": 3.785618224604924e-05,
      "loss": 1.5335,
      "num_input_tokens_seen": 29249601984,
      "step": 37177
    },
    {
      "epoch": 3.9441969021854444,
      "grad_norm": 0.5091254736026883,
      "learning_rate": 3.785558620666324e-05,
      "loss": 1.4091,
      "num_input_tokens_seen": 29250388736,
      "step": 37178
    },
    {
      "epoch": 3.944302991725016,
      "grad_norm": 0.45487349531892574,
      "learning_rate": 3.785499015734282e-05,
      "loss": 1.5543,
      "num_input_tokens_seen": 29251175616,
      "step": 37179
    },
    {
      "epoch": 3.9444090812645873,
      "grad_norm": 0.4245598420722518,
      "learning_rate": 3.785439409808844e-05,
      "loss": 1.432,
      "num_input_tokens_seen": 29251962416,
      "step": 37180
    },
    {
      "epoch": 3.944515170804159,
      "grad_norm": 0.41736961580945103,
      "learning_rate": 3.785379802890057e-05,
      "loss": 1.415,
      "num_input_tokens_seen": 29252749200,
      "step": 37181
    },
    {
      "epoch": 3.9446212603437303,
      "grad_norm": 0.46877808551770433,
      "learning_rate": 3.785320194977966e-05,
      "loss": 1.4685,
      "num_input_tokens_seen": 29253535952,
      "step": 37182
    },
    {
      "epoch": 3.9447273498833013,
      "grad_norm": 0.4461175658824231,
      "learning_rate": 3.785260586072617e-05,
      "loss": 1.412,
      "num_input_tokens_seen": 29254322688,
      "step": 37183
    },
    {
      "epoch": 3.944833439422873,
      "grad_norm": 0.462325740653263,
      "learning_rate": 3.7852009761740566e-05,
      "loss": 1.5618,
      "num_input_tokens_seen": 29255109472,
      "step": 37184
    },
    {
      "epoch": 3.9449395289624443,
      "grad_norm": 0.4524803912122233,
      "learning_rate": 3.7851413652823306e-05,
      "loss": 1.4125,
      "num_input_tokens_seen": 29255896192,
      "step": 37185
    },
    {
      "epoch": 3.9450456185020157,
      "grad_norm": 0.4378273234694554,
      "learning_rate": 3.785081753397484e-05,
      "loss": 1.3572,
      "num_input_tokens_seen": 29256683024,
      "step": 37186
    },
    {
      "epoch": 3.945151708041587,
      "grad_norm": 0.4494171043766637,
      "learning_rate": 3.785022140519565e-05,
      "loss": 1.4996,
      "num_input_tokens_seen": 29257469808,
      "step": 37187
    },
    {
      "epoch": 3.9452577975811582,
      "grad_norm": 0.4819565173612418,
      "learning_rate": 3.784962526648619e-05,
      "loss": 1.4609,
      "num_input_tokens_seen": 29258256528,
      "step": 37188
    },
    {
      "epoch": 3.94536388712073,
      "grad_norm": 0.4972387045960292,
      "learning_rate": 3.7849029117846903e-05,
      "loss": 1.5651,
      "num_input_tokens_seen": 29259043344,
      "step": 37189
    },
    {
      "epoch": 3.945469976660301,
      "grad_norm": 0.4491486466949273,
      "learning_rate": 3.7848432959278266e-05,
      "loss": 1.606,
      "num_input_tokens_seen": 29259829984,
      "step": 37190
    },
    {
      "epoch": 3.9455760661998727,
      "grad_norm": 0.44211247513644414,
      "learning_rate": 3.784783679078074e-05,
      "loss": 1.326,
      "num_input_tokens_seen": 29260616784,
      "step": 37191
    },
    {
      "epoch": 3.945682155739444,
      "grad_norm": 0.8979489644275216,
      "learning_rate": 3.784724061235479e-05,
      "loss": 1.5103,
      "num_input_tokens_seen": 29261403536,
      "step": 37192
    },
    {
      "epoch": 3.9457882452790156,
      "grad_norm": 0.638368479589357,
      "learning_rate": 3.7846644424000866e-05,
      "loss": 1.5179,
      "num_input_tokens_seen": 29262190240,
      "step": 37193
    },
    {
      "epoch": 3.945894334818587,
      "grad_norm": 0.7566964878930946,
      "learning_rate": 3.784604822571943e-05,
      "loss": 1.4424,
      "num_input_tokens_seen": 29262977040,
      "step": 37194
    },
    {
      "epoch": 3.946000424358158,
      "grad_norm": 0.4268807719481953,
      "learning_rate": 3.784545201751094e-05,
      "loss": 1.4232,
      "num_input_tokens_seen": 29263763840,
      "step": 37195
    },
    {
      "epoch": 3.9461065138977296,
      "grad_norm": 0.4305221288504195,
      "learning_rate": 3.784485579937587e-05,
      "loss": 1.465,
      "num_input_tokens_seen": 29264550592,
      "step": 37196
    },
    {
      "epoch": 3.946212603437301,
      "grad_norm": 0.7594645458654546,
      "learning_rate": 3.7844259571314664e-05,
      "loss": 1.4487,
      "num_input_tokens_seen": 29265337392,
      "step": 37197
    },
    {
      "epoch": 3.9463186929768725,
      "grad_norm": 0.4611801882748923,
      "learning_rate": 3.78436633333278e-05,
      "loss": 1.4347,
      "num_input_tokens_seen": 29266124128,
      "step": 37198
    },
    {
      "epoch": 3.946424782516444,
      "grad_norm": 0.5428157086160746,
      "learning_rate": 3.784306708541573e-05,
      "loss": 1.512,
      "num_input_tokens_seen": 29266910912,
      "step": 37199
    },
    {
      "epoch": 3.946530872056015,
      "grad_norm": 0.6900981730955794,
      "learning_rate": 3.7842470827578905e-05,
      "loss": 1.4835,
      "num_input_tokens_seen": 29267697664,
      "step": 37200
    },
    {
      "epoch": 3.9466369615955865,
      "grad_norm": 0.48664379944009345,
      "learning_rate": 3.78418745598178e-05,
      "loss": 1.5521,
      "num_input_tokens_seen": 29268484352,
      "step": 37201
    },
    {
      "epoch": 3.946743051135158,
      "grad_norm": 0.510178918929551,
      "learning_rate": 3.784127828213288e-05,
      "loss": 1.4122,
      "num_input_tokens_seen": 29269271152,
      "step": 37202
    },
    {
      "epoch": 3.9468491406747295,
      "grad_norm": 0.4785043822984085,
      "learning_rate": 3.784068199452457e-05,
      "loss": 1.4527,
      "num_input_tokens_seen": 29270057904,
      "step": 37203
    },
    {
      "epoch": 3.946955230214301,
      "grad_norm": 0.43648586998778416,
      "learning_rate": 3.784008569699339e-05,
      "loss": 1.4425,
      "num_input_tokens_seen": 29270844656,
      "step": 37204
    },
    {
      "epoch": 3.9470613197538724,
      "grad_norm": 0.49611001450753867,
      "learning_rate": 3.783948938953975e-05,
      "loss": 1.4046,
      "num_input_tokens_seen": 29271631392,
      "step": 37205
    },
    {
      "epoch": 3.947167409293444,
      "grad_norm": 0.465043070003662,
      "learning_rate": 3.783889307216413e-05,
      "loss": 1.4823,
      "num_input_tokens_seen": 29272418112,
      "step": 37206
    },
    {
      "epoch": 3.947273498833015,
      "grad_norm": 0.42940168866383205,
      "learning_rate": 3.7838296744867e-05,
      "loss": 1.4795,
      "num_input_tokens_seen": 29273204848,
      "step": 37207
    },
    {
      "epoch": 3.9473795883725864,
      "grad_norm": 0.5233011489353944,
      "learning_rate": 3.78377004076488e-05,
      "loss": 1.4148,
      "num_input_tokens_seen": 29273991632,
      "step": 37208
    },
    {
      "epoch": 3.947485677912158,
      "grad_norm": 0.45362805480883517,
      "learning_rate": 3.783710406051001e-05,
      "loss": 1.4004,
      "num_input_tokens_seen": 29274778432,
      "step": 37209
    },
    {
      "epoch": 3.9475917674517293,
      "grad_norm": 0.4780351330257448,
      "learning_rate": 3.783650770345108e-05,
      "loss": 1.4858,
      "num_input_tokens_seen": 29275565168,
      "step": 37210
    },
    {
      "epoch": 3.947697856991301,
      "grad_norm": 0.4267650301513433,
      "learning_rate": 3.783591133647247e-05,
      "loss": 1.5268,
      "num_input_tokens_seen": 29276351952,
      "step": 37211
    },
    {
      "epoch": 3.947803946530872,
      "grad_norm": 0.45348399088924907,
      "learning_rate": 3.7835314959574656e-05,
      "loss": 1.4165,
      "num_input_tokens_seen": 29277138784,
      "step": 37212
    },
    {
      "epoch": 3.9479100360704433,
      "grad_norm": 0.4806313158159252,
      "learning_rate": 3.7834718572758076e-05,
      "loss": 1.5969,
      "num_input_tokens_seen": 29277925568,
      "step": 37213
    },
    {
      "epoch": 3.948016125610015,
      "grad_norm": 0.4793789120912246,
      "learning_rate": 3.78341221760232e-05,
      "loss": 1.5057,
      "num_input_tokens_seen": 29278712288,
      "step": 37214
    },
    {
      "epoch": 3.9481222151495863,
      "grad_norm": 0.40379322648500177,
      "learning_rate": 3.783352576937049e-05,
      "loss": 1.3275,
      "num_input_tokens_seen": 29279499024,
      "step": 37215
    },
    {
      "epoch": 3.9482283046891578,
      "grad_norm": 0.4282600367222462,
      "learning_rate": 3.7832929352800425e-05,
      "loss": 1.4979,
      "num_input_tokens_seen": 29280285808,
      "step": 37216
    },
    {
      "epoch": 3.948334394228729,
      "grad_norm": 0.46838581118539735,
      "learning_rate": 3.783233292631343e-05,
      "loss": 1.4218,
      "num_input_tokens_seen": 29281072576,
      "step": 37217
    },
    {
      "epoch": 3.9484404837683007,
      "grad_norm": 0.40073529196783075,
      "learning_rate": 3.783173648991e-05,
      "loss": 1.3458,
      "num_input_tokens_seen": 29281859392,
      "step": 37218
    },
    {
      "epoch": 3.9485465733078717,
      "grad_norm": 0.38652933999788264,
      "learning_rate": 3.7831140043590566e-05,
      "loss": 1.328,
      "num_input_tokens_seen": 29282646224,
      "step": 37219
    },
    {
      "epoch": 3.948652662847443,
      "grad_norm": 0.4683165873595772,
      "learning_rate": 3.7830543587355604e-05,
      "loss": 1.5692,
      "num_input_tokens_seen": 29283432960,
      "step": 37220
    },
    {
      "epoch": 3.9487587523870147,
      "grad_norm": 0.5172781183701085,
      "learning_rate": 3.782994712120559e-05,
      "loss": 1.5176,
      "num_input_tokens_seen": 29284219680,
      "step": 37221
    },
    {
      "epoch": 3.948864841926586,
      "grad_norm": 0.4137436243798747,
      "learning_rate": 3.7829350645140954e-05,
      "loss": 1.4325,
      "num_input_tokens_seen": 29285006448,
      "step": 37222
    },
    {
      "epoch": 3.9489709314661576,
      "grad_norm": 0.4002106761064648,
      "learning_rate": 3.782875415916218e-05,
      "loss": 1.395,
      "num_input_tokens_seen": 29285793200,
      "step": 37223
    },
    {
      "epoch": 3.9490770210057287,
      "grad_norm": 0.36731514574708346,
      "learning_rate": 3.782815766326972e-05,
      "loss": 1.365,
      "num_input_tokens_seen": 29286580016,
      "step": 37224
    },
    {
      "epoch": 3.9491831105453,
      "grad_norm": 0.4513741096433467,
      "learning_rate": 3.782756115746403e-05,
      "loss": 1.4643,
      "num_input_tokens_seen": 29287366848,
      "step": 37225
    },
    {
      "epoch": 3.9492892000848716,
      "grad_norm": 0.41053373051056036,
      "learning_rate": 3.782696464174558e-05,
      "loss": 1.4382,
      "num_input_tokens_seen": 29288153600,
      "step": 37226
    },
    {
      "epoch": 3.949395289624443,
      "grad_norm": 0.3740896693264806,
      "learning_rate": 3.782636811611483e-05,
      "loss": 1.3817,
      "num_input_tokens_seen": 29288940368,
      "step": 37227
    },
    {
      "epoch": 3.9495013791640146,
      "grad_norm": 0.3823378521511503,
      "learning_rate": 3.7825771580572246e-05,
      "loss": 1.3991,
      "num_input_tokens_seen": 29289727184,
      "step": 37228
    },
    {
      "epoch": 3.9496074687035856,
      "grad_norm": 0.3881125315801037,
      "learning_rate": 3.7825175035118274e-05,
      "loss": 1.3539,
      "num_input_tokens_seen": 29290514016,
      "step": 37229
    },
    {
      "epoch": 3.949713558243157,
      "grad_norm": 0.5521238022729565,
      "learning_rate": 3.782457847975338e-05,
      "loss": 1.4593,
      "num_input_tokens_seen": 29291300784,
      "step": 37230
    },
    {
      "epoch": 3.9498196477827285,
      "grad_norm": 0.414550926099993,
      "learning_rate": 3.782398191447804e-05,
      "loss": 1.4389,
      "num_input_tokens_seen": 29292087568,
      "step": 37231
    },
    {
      "epoch": 3.9499257373223,
      "grad_norm": 0.466202764526962,
      "learning_rate": 3.782338533929269e-05,
      "loss": 1.5583,
      "num_input_tokens_seen": 29292874256,
      "step": 37232
    },
    {
      "epoch": 3.9500318268618715,
      "grad_norm": 0.4394260378755151,
      "learning_rate": 3.782278875419781e-05,
      "loss": 1.4822,
      "num_input_tokens_seen": 29293661008,
      "step": 37233
    },
    {
      "epoch": 3.950137916401443,
      "grad_norm": 0.3917612778178608,
      "learning_rate": 3.782219215919385e-05,
      "loss": 1.4663,
      "num_input_tokens_seen": 29294447872,
      "step": 37234
    },
    {
      "epoch": 3.9502440059410144,
      "grad_norm": 0.37692840149714607,
      "learning_rate": 3.782159555428129e-05,
      "loss": 1.4006,
      "num_input_tokens_seen": 29295234656,
      "step": 37235
    },
    {
      "epoch": 3.9503500954805855,
      "grad_norm": 0.39893176739518454,
      "learning_rate": 3.782099893946056e-05,
      "loss": 1.4374,
      "num_input_tokens_seen": 29296021440,
      "step": 37236
    },
    {
      "epoch": 3.950456185020157,
      "grad_norm": 0.3846169374922008,
      "learning_rate": 3.782040231473215e-05,
      "loss": 1.4776,
      "num_input_tokens_seen": 29296808160,
      "step": 37237
    },
    {
      "epoch": 3.9505622745597284,
      "grad_norm": 0.48960279316684807,
      "learning_rate": 3.78198056800965e-05,
      "loss": 1.5061,
      "num_input_tokens_seen": 29297594896,
      "step": 37238
    },
    {
      "epoch": 3.9506683640993,
      "grad_norm": 0.3953364813945979,
      "learning_rate": 3.7819209035554096e-05,
      "loss": 1.4546,
      "num_input_tokens_seen": 29298381632,
      "step": 37239
    },
    {
      "epoch": 3.9507744536388714,
      "grad_norm": 0.5187475286571968,
      "learning_rate": 3.781861238110537e-05,
      "loss": 1.4849,
      "num_input_tokens_seen": 29299168368,
      "step": 37240
    },
    {
      "epoch": 3.9508805431784424,
      "grad_norm": 0.3959624001662705,
      "learning_rate": 3.78180157167508e-05,
      "loss": 1.3322,
      "num_input_tokens_seen": 29299955216,
      "step": 37241
    },
    {
      "epoch": 3.950986632718014,
      "grad_norm": 0.5316985322429703,
      "learning_rate": 3.7817419042490845e-05,
      "loss": 1.3905,
      "num_input_tokens_seen": 29300742048,
      "step": 37242
    },
    {
      "epoch": 3.9510927222575853,
      "grad_norm": 0.4059420790596383,
      "learning_rate": 3.781682235832595e-05,
      "loss": 1.4181,
      "num_input_tokens_seen": 29301528800,
      "step": 37243
    },
    {
      "epoch": 3.951198811797157,
      "grad_norm": 0.48269546332024565,
      "learning_rate": 3.781622566425661e-05,
      "loss": 1.5058,
      "num_input_tokens_seen": 29302315520,
      "step": 37244
    },
    {
      "epoch": 3.9513049013367283,
      "grad_norm": 0.4499518515764688,
      "learning_rate": 3.7815628960283266e-05,
      "loss": 1.47,
      "num_input_tokens_seen": 29303102352,
      "step": 37245
    },
    {
      "epoch": 3.9514109908762993,
      "grad_norm": 0.46222834711198596,
      "learning_rate": 3.781503224640637e-05,
      "loss": 1.3839,
      "num_input_tokens_seen": 29303889120,
      "step": 37246
    },
    {
      "epoch": 3.9515170804158712,
      "grad_norm": 0.5660227495509674,
      "learning_rate": 3.78144355226264e-05,
      "loss": 1.4581,
      "num_input_tokens_seen": 29304675888,
      "step": 37247
    },
    {
      "epoch": 3.9516231699554423,
      "grad_norm": 0.4604020003574949,
      "learning_rate": 3.781383878894381e-05,
      "loss": 1.4525,
      "num_input_tokens_seen": 29305462624,
      "step": 37248
    },
    {
      "epoch": 3.9517292594950137,
      "grad_norm": 0.4518312473516441,
      "learning_rate": 3.7813242045359055e-05,
      "loss": 1.3916,
      "num_input_tokens_seen": 29306249440,
      "step": 37249
    },
    {
      "epoch": 3.951835349034585,
      "grad_norm": 0.5901541794579335,
      "learning_rate": 3.7812645291872606e-05,
      "loss": 1.4553,
      "num_input_tokens_seen": 29307036176,
      "step": 37250
    },
    {
      "epoch": 3.9519414385741567,
      "grad_norm": 0.3934480061462055,
      "learning_rate": 3.7812048528484924e-05,
      "loss": 1.387,
      "num_input_tokens_seen": 29307822944,
      "step": 37251
    },
    {
      "epoch": 3.952047528113728,
      "grad_norm": 0.5494335767605256,
      "learning_rate": 3.7811451755196464e-05,
      "loss": 1.5223,
      "num_input_tokens_seen": 29308609728,
      "step": 37252
    },
    {
      "epoch": 3.952153617653299,
      "grad_norm": 0.4837528027805625,
      "learning_rate": 3.781085497200769e-05,
      "loss": 1.4233,
      "num_input_tokens_seen": 29309396560,
      "step": 37253
    },
    {
      "epoch": 3.9522597071928707,
      "grad_norm": 0.5049629854384006,
      "learning_rate": 3.781025817891906e-05,
      "loss": 1.4188,
      "num_input_tokens_seen": 29310183344,
      "step": 37254
    },
    {
      "epoch": 3.952365796732442,
      "grad_norm": 0.4078661042284341,
      "learning_rate": 3.780966137593104e-05,
      "loss": 1.468,
      "num_input_tokens_seen": 29310970112,
      "step": 37255
    },
    {
      "epoch": 3.9524718862720136,
      "grad_norm": 0.4487247235905569,
      "learning_rate": 3.7809064563044096e-05,
      "loss": 1.4576,
      "num_input_tokens_seen": 29311756784,
      "step": 37256
    },
    {
      "epoch": 3.952577975811585,
      "grad_norm": 0.44058370067071917,
      "learning_rate": 3.7808467740258676e-05,
      "loss": 1.4237,
      "num_input_tokens_seen": 29312543504,
      "step": 37257
    },
    {
      "epoch": 3.952684065351156,
      "grad_norm": 0.4144254049591977,
      "learning_rate": 3.780787090757525e-05,
      "loss": 1.4374,
      "num_input_tokens_seen": 29313330272,
      "step": 37258
    },
    {
      "epoch": 3.952790154890728,
      "grad_norm": 0.43989433042832354,
      "learning_rate": 3.780727406499428e-05,
      "loss": 1.4594,
      "num_input_tokens_seen": 29314116976,
      "step": 37259
    },
    {
      "epoch": 3.952896244430299,
      "grad_norm": 0.4886715595736118,
      "learning_rate": 3.780667721251622e-05,
      "loss": 1.4196,
      "num_input_tokens_seen": 29314903840,
      "step": 37260
    },
    {
      "epoch": 3.9530023339698706,
      "grad_norm": 0.4454645160176298,
      "learning_rate": 3.7806080350141535e-05,
      "loss": 1.3746,
      "num_input_tokens_seen": 29315690672,
      "step": 37261
    },
    {
      "epoch": 3.953108423509442,
      "grad_norm": 0.40701206066230877,
      "learning_rate": 3.7805483477870696e-05,
      "loss": 1.4134,
      "num_input_tokens_seen": 29316477520,
      "step": 37262
    },
    {
      "epoch": 3.9532145130490135,
      "grad_norm": 0.512176911945863,
      "learning_rate": 3.780488659570414e-05,
      "loss": 1.4913,
      "num_input_tokens_seen": 29317264320,
      "step": 37263
    },
    {
      "epoch": 3.953320602588585,
      "grad_norm": 0.41875104708621197,
      "learning_rate": 3.780428970364236e-05,
      "loss": 1.4273,
      "num_input_tokens_seen": 29318051168,
      "step": 37264
    },
    {
      "epoch": 3.953426692128156,
      "grad_norm": 0.526845632778082,
      "learning_rate": 3.7803692801685795e-05,
      "loss": 1.3943,
      "num_input_tokens_seen": 29318837952,
      "step": 37265
    },
    {
      "epoch": 3.9535327816677275,
      "grad_norm": 0.4987923626573529,
      "learning_rate": 3.780309588983491e-05,
      "loss": 1.5588,
      "num_input_tokens_seen": 29319624704,
      "step": 37266
    },
    {
      "epoch": 3.953638871207299,
      "grad_norm": 0.43574983593521527,
      "learning_rate": 3.780249896809016e-05,
      "loss": 1.5093,
      "num_input_tokens_seen": 29320411440,
      "step": 37267
    },
    {
      "epoch": 3.9537449607468704,
      "grad_norm": 0.616347059952014,
      "learning_rate": 3.780190203645202e-05,
      "loss": 1.4193,
      "num_input_tokens_seen": 29321198208,
      "step": 37268
    },
    {
      "epoch": 3.953851050286442,
      "grad_norm": 0.38385942698523795,
      "learning_rate": 3.7801305094920945e-05,
      "loss": 1.3901,
      "num_input_tokens_seen": 29321985024,
      "step": 37269
    },
    {
      "epoch": 3.953957139826013,
      "grad_norm": 0.46587579247002087,
      "learning_rate": 3.7800708143497404e-05,
      "loss": 1.4248,
      "num_input_tokens_seen": 29322771872,
      "step": 37270
    },
    {
      "epoch": 3.9540632293655844,
      "grad_norm": 0.5203320893388265,
      "learning_rate": 3.780011118218184e-05,
      "loss": 1.4175,
      "num_input_tokens_seen": 29323558624,
      "step": 37271
    },
    {
      "epoch": 3.954169318905156,
      "grad_norm": 0.4383764446658736,
      "learning_rate": 3.779951421097474e-05,
      "loss": 1.4825,
      "num_input_tokens_seen": 29324345408,
      "step": 37272
    },
    {
      "epoch": 3.9542754084447274,
      "grad_norm": 0.46854866027671976,
      "learning_rate": 3.779891722987654e-05,
      "loss": 1.4345,
      "num_input_tokens_seen": 29325132160,
      "step": 37273
    },
    {
      "epoch": 3.954381497984299,
      "grad_norm": 0.3949532902873557,
      "learning_rate": 3.779832023888772e-05,
      "loss": 1.3321,
      "num_input_tokens_seen": 29325919008,
      "step": 37274
    },
    {
      "epoch": 3.9544875875238703,
      "grad_norm": 0.40272399183021523,
      "learning_rate": 3.779772323800872e-05,
      "loss": 1.4458,
      "num_input_tokens_seen": 29326705696,
      "step": 37275
    },
    {
      "epoch": 3.954593677063442,
      "grad_norm": 0.414248360060819,
      "learning_rate": 3.779712622724003e-05,
      "loss": 1.4123,
      "num_input_tokens_seen": 29327492432,
      "step": 37276
    },
    {
      "epoch": 3.954699766603013,
      "grad_norm": 0.4244247192566692,
      "learning_rate": 3.779652920658209e-05,
      "loss": 1.3306,
      "num_input_tokens_seen": 29328279264,
      "step": 37277
    },
    {
      "epoch": 3.9548058561425843,
      "grad_norm": 0.4986040955208372,
      "learning_rate": 3.7795932176035364e-05,
      "loss": 1.3834,
      "num_input_tokens_seen": 29329065968,
      "step": 37278
    },
    {
      "epoch": 3.9549119456821558,
      "grad_norm": 0.4081477747129524,
      "learning_rate": 3.779533513560032e-05,
      "loss": 1.4782,
      "num_input_tokens_seen": 29329852736,
      "step": 37279
    },
    {
      "epoch": 3.9550180352217272,
      "grad_norm": 0.4541082084274037,
      "learning_rate": 3.779473808527742e-05,
      "loss": 1.4354,
      "num_input_tokens_seen": 29330639520,
      "step": 37280
    },
    {
      "epoch": 3.9551241247612987,
      "grad_norm": 0.4257574675664943,
      "learning_rate": 3.779414102506712e-05,
      "loss": 1.4744,
      "num_input_tokens_seen": 29331426320,
      "step": 37281
    },
    {
      "epoch": 3.9552302143008697,
      "grad_norm": 0.4429911129585363,
      "learning_rate": 3.779354395496988e-05,
      "loss": 1.5434,
      "num_input_tokens_seen": 29332213056,
      "step": 37282
    },
    {
      "epoch": 3.955336303840441,
      "grad_norm": 0.4280841750191007,
      "learning_rate": 3.779294687498617e-05,
      "loss": 1.4198,
      "num_input_tokens_seen": 29332999904,
      "step": 37283
    },
    {
      "epoch": 3.9554423933800127,
      "grad_norm": 0.4389578865849803,
      "learning_rate": 3.7792349785116446e-05,
      "loss": 1.5369,
      "num_input_tokens_seen": 29333786704,
      "step": 37284
    },
    {
      "epoch": 3.955548482919584,
      "grad_norm": 0.4473215183981335,
      "learning_rate": 3.779175268536117e-05,
      "loss": 1.551,
      "num_input_tokens_seen": 29334573456,
      "step": 37285
    },
    {
      "epoch": 3.9556545724591556,
      "grad_norm": 0.40877559035565625,
      "learning_rate": 3.7791155575720795e-05,
      "loss": 1.3169,
      "num_input_tokens_seen": 29335360256,
      "step": 37286
    },
    {
      "epoch": 3.9557606619987267,
      "grad_norm": 0.6364510904348539,
      "learning_rate": 3.779055845619579e-05,
      "loss": 1.4916,
      "num_input_tokens_seen": 29336146992,
      "step": 37287
    },
    {
      "epoch": 3.9558667515382986,
      "grad_norm": 0.5933681633703647,
      "learning_rate": 3.778996132678663e-05,
      "loss": 1.4213,
      "num_input_tokens_seen": 29336933792,
      "step": 37288
    },
    {
      "epoch": 3.9559728410778696,
      "grad_norm": 0.4801616968817561,
      "learning_rate": 3.778936418749375e-05,
      "loss": 1.4842,
      "num_input_tokens_seen": 29337720576,
      "step": 37289
    },
    {
      "epoch": 3.956078930617441,
      "grad_norm": 0.5047771671432767,
      "learning_rate": 3.778876703831763e-05,
      "loss": 1.4041,
      "num_input_tokens_seen": 29338507360,
      "step": 37290
    },
    {
      "epoch": 3.9561850201570126,
      "grad_norm": 0.4504733774891664,
      "learning_rate": 3.778816987925873e-05,
      "loss": 1.4077,
      "num_input_tokens_seen": 29339294048,
      "step": 37291
    },
    {
      "epoch": 3.956291109696584,
      "grad_norm": 0.5119278249966032,
      "learning_rate": 3.77875727103175e-05,
      "loss": 1.529,
      "num_input_tokens_seen": 29340080816,
      "step": 37292
    },
    {
      "epoch": 3.9563971992361555,
      "grad_norm": 0.399471089301712,
      "learning_rate": 3.778697553149441e-05,
      "loss": 1.3969,
      "num_input_tokens_seen": 29340867520,
      "step": 37293
    },
    {
      "epoch": 3.9565032887757265,
      "grad_norm": 0.4492291103925807,
      "learning_rate": 3.778637834278992e-05,
      "loss": 1.4342,
      "num_input_tokens_seen": 29341654368,
      "step": 37294
    },
    {
      "epoch": 3.956609378315298,
      "grad_norm": 0.42879738249288446,
      "learning_rate": 3.77857811442045e-05,
      "loss": 1.5528,
      "num_input_tokens_seen": 29342441216,
      "step": 37295
    },
    {
      "epoch": 3.9567154678548695,
      "grad_norm": 0.48840694701343434,
      "learning_rate": 3.77851839357386e-05,
      "loss": 1.5262,
      "num_input_tokens_seen": 29343228000,
      "step": 37296
    },
    {
      "epoch": 3.956821557394441,
      "grad_norm": 0.4657274243281394,
      "learning_rate": 3.778458671739268e-05,
      "loss": 1.4884,
      "num_input_tokens_seen": 29344014752,
      "step": 37297
    },
    {
      "epoch": 3.9569276469340124,
      "grad_norm": 0.42162919876003446,
      "learning_rate": 3.778398948916721e-05,
      "loss": 1.4271,
      "num_input_tokens_seen": 29344801536,
      "step": 37298
    },
    {
      "epoch": 3.9570337364735835,
      "grad_norm": 0.37812690752848954,
      "learning_rate": 3.778339225106265e-05,
      "loss": 1.4192,
      "num_input_tokens_seen": 29345588288,
      "step": 37299
    },
    {
      "epoch": 3.957139826013155,
      "grad_norm": 0.4871773516555156,
      "learning_rate": 3.778279500307945e-05,
      "loss": 1.4937,
      "num_input_tokens_seen": 29346375152,
      "step": 37300
    },
    {
      "epoch": 3.9572459155527264,
      "grad_norm": 0.41065637414095985,
      "learning_rate": 3.7782197745218094e-05,
      "loss": 1.4975,
      "num_input_tokens_seen": 29347161920,
      "step": 37301
    },
    {
      "epoch": 3.957352005092298,
      "grad_norm": 0.4297928031494059,
      "learning_rate": 3.778160047747903e-05,
      "loss": 1.487,
      "num_input_tokens_seen": 29347948656,
      "step": 37302
    },
    {
      "epoch": 3.9574580946318694,
      "grad_norm": 0.43377844533630305,
      "learning_rate": 3.778100319986271e-05,
      "loss": 1.5034,
      "num_input_tokens_seen": 29348735376,
      "step": 37303
    },
    {
      "epoch": 3.957564184171441,
      "grad_norm": 0.49314499615391577,
      "learning_rate": 3.778040591236961e-05,
      "loss": 1.4592,
      "num_input_tokens_seen": 29349522160,
      "step": 37304
    },
    {
      "epoch": 3.9576702737110123,
      "grad_norm": 0.41010927736238545,
      "learning_rate": 3.7779808615000186e-05,
      "loss": 1.3895,
      "num_input_tokens_seen": 29350308880,
      "step": 37305
    },
    {
      "epoch": 3.9577763632505834,
      "grad_norm": 0.4057788205288119,
      "learning_rate": 3.77792113077549e-05,
      "loss": 1.4033,
      "num_input_tokens_seen": 29351095600,
      "step": 37306
    },
    {
      "epoch": 3.957882452790155,
      "grad_norm": 0.4556220412426792,
      "learning_rate": 3.7778613990634224e-05,
      "loss": 1.4247,
      "num_input_tokens_seen": 29351882400,
      "step": 37307
    },
    {
      "epoch": 3.9579885423297263,
      "grad_norm": 0.4128841576556244,
      "learning_rate": 3.7778016663638605e-05,
      "loss": 1.4183,
      "num_input_tokens_seen": 29352669152,
      "step": 37308
    },
    {
      "epoch": 3.9580946318692978,
      "grad_norm": 0.39677640582359086,
      "learning_rate": 3.7777419326768506e-05,
      "loss": 1.4509,
      "num_input_tokens_seen": 29353455920,
      "step": 37309
    },
    {
      "epoch": 3.9582007214088692,
      "grad_norm": 0.5719931668066395,
      "learning_rate": 3.7776821980024396e-05,
      "loss": 1.5176,
      "num_input_tokens_seen": 29354242640,
      "step": 37310
    },
    {
      "epoch": 3.9583068109484403,
      "grad_norm": 0.5749890754945022,
      "learning_rate": 3.7776224623406734e-05,
      "loss": 1.5388,
      "num_input_tokens_seen": 29355029408,
      "step": 37311
    },
    {
      "epoch": 3.9584129004880118,
      "grad_norm": 0.7284799676288921,
      "learning_rate": 3.7775627256915974e-05,
      "loss": 1.418,
      "num_input_tokens_seen": 29355816192,
      "step": 37312
    },
    {
      "epoch": 3.9585189900275832,
      "grad_norm": 0.5229643288158011,
      "learning_rate": 3.777502988055259e-05,
      "loss": 1.5032,
      "num_input_tokens_seen": 29356602976,
      "step": 37313
    },
    {
      "epoch": 3.9586250795671547,
      "grad_norm": 0.41844884442407054,
      "learning_rate": 3.777443249431703e-05,
      "loss": 1.4974,
      "num_input_tokens_seen": 29357389728,
      "step": 37314
    },
    {
      "epoch": 3.958731169106726,
      "grad_norm": 0.6449369345284287,
      "learning_rate": 3.7773835098209774e-05,
      "loss": 1.5627,
      "num_input_tokens_seen": 29358176464,
      "step": 37315
    },
    {
      "epoch": 3.958837258646297,
      "grad_norm": 0.5032538217862295,
      "learning_rate": 3.7773237692231266e-05,
      "loss": 1.3439,
      "num_input_tokens_seen": 29358963184,
      "step": 37316
    },
    {
      "epoch": 3.958943348185869,
      "grad_norm": 0.4915947703154899,
      "learning_rate": 3.777264027638198e-05,
      "loss": 1.4283,
      "num_input_tokens_seen": 29359749936,
      "step": 37317
    },
    {
      "epoch": 3.95904943772544,
      "grad_norm": 0.48110826908802046,
      "learning_rate": 3.7772042850662373e-05,
      "loss": 1.4507,
      "num_input_tokens_seen": 29360536624,
      "step": 37318
    },
    {
      "epoch": 3.9591555272650116,
      "grad_norm": 0.446403977712771,
      "learning_rate": 3.77714454150729e-05,
      "loss": 1.438,
      "num_input_tokens_seen": 29361323360,
      "step": 37319
    },
    {
      "epoch": 3.959261616804583,
      "grad_norm": 0.5184250657605461,
      "learning_rate": 3.777084796961402e-05,
      "loss": 1.4261,
      "num_input_tokens_seen": 29362110176,
      "step": 37320
    },
    {
      "epoch": 3.9593677063441546,
      "grad_norm": 0.5404752972038501,
      "learning_rate": 3.777025051428622e-05,
      "loss": 1.425,
      "num_input_tokens_seen": 29362896928,
      "step": 37321
    },
    {
      "epoch": 3.959473795883726,
      "grad_norm": 0.47982963345449203,
      "learning_rate": 3.776965304908994e-05,
      "loss": 1.493,
      "num_input_tokens_seen": 29363683648,
      "step": 37322
    },
    {
      "epoch": 3.959579885423297,
      "grad_norm": 0.5474530428058684,
      "learning_rate": 3.7769055574025644e-05,
      "loss": 1.4122,
      "num_input_tokens_seen": 29364470432,
      "step": 37323
    },
    {
      "epoch": 3.9596859749628686,
      "grad_norm": 0.43177257261521246,
      "learning_rate": 3.77684580890938e-05,
      "loss": 1.4896,
      "num_input_tokens_seen": 29365257120,
      "step": 37324
    },
    {
      "epoch": 3.95979206450244,
      "grad_norm": 0.3859573117449875,
      "learning_rate": 3.776786059429487e-05,
      "loss": 1.3889,
      "num_input_tokens_seen": 29366043984,
      "step": 37325
    },
    {
      "epoch": 3.9598981540420115,
      "grad_norm": 0.4163410061574603,
      "learning_rate": 3.77672630896293e-05,
      "loss": 1.3984,
      "num_input_tokens_seen": 29366830784,
      "step": 37326
    },
    {
      "epoch": 3.960004243581583,
      "grad_norm": 0.47558229625815424,
      "learning_rate": 3.776666557509757e-05,
      "loss": 1.3559,
      "num_input_tokens_seen": 29367617600,
      "step": 37327
    },
    {
      "epoch": 3.960110333121154,
      "grad_norm": 0.46923658245094796,
      "learning_rate": 3.776606805070014e-05,
      "loss": 1.4854,
      "num_input_tokens_seen": 29368404288,
      "step": 37328
    },
    {
      "epoch": 3.9602164226607255,
      "grad_norm": 0.48988588229870755,
      "learning_rate": 3.776547051643746e-05,
      "loss": 1.4253,
      "num_input_tokens_seen": 29369191104,
      "step": 37329
    },
    {
      "epoch": 3.960322512200297,
      "grad_norm": 0.6026099678537035,
      "learning_rate": 3.7764872972310006e-05,
      "loss": 1.3939,
      "num_input_tokens_seen": 29369977920,
      "step": 37330
    },
    {
      "epoch": 3.9604286017398684,
      "grad_norm": 0.4196588266876439,
      "learning_rate": 3.776427541831823e-05,
      "loss": 1.4696,
      "num_input_tokens_seen": 29370764640,
      "step": 37331
    },
    {
      "epoch": 3.96053469127944,
      "grad_norm": 0.3857156718982965,
      "learning_rate": 3.77636778544626e-05,
      "loss": 1.362,
      "num_input_tokens_seen": 29371551488,
      "step": 37332
    },
    {
      "epoch": 3.9606407808190114,
      "grad_norm": 0.6293836434617736,
      "learning_rate": 3.776308028074357e-05,
      "loss": 1.4924,
      "num_input_tokens_seen": 29372338304,
      "step": 37333
    },
    {
      "epoch": 3.960746870358583,
      "grad_norm": 0.38842791156981776,
      "learning_rate": 3.776248269716161e-05,
      "loss": 1.2771,
      "num_input_tokens_seen": 29373125120,
      "step": 37334
    },
    {
      "epoch": 3.960852959898154,
      "grad_norm": 0.5528851078021687,
      "learning_rate": 3.7761885103717166e-05,
      "loss": 1.4151,
      "num_input_tokens_seen": 29373911904,
      "step": 37335
    },
    {
      "epoch": 3.9609590494377254,
      "grad_norm": 0.5422593170755294,
      "learning_rate": 3.776128750041072e-05,
      "loss": 1.4765,
      "num_input_tokens_seen": 29374698656,
      "step": 37336
    },
    {
      "epoch": 3.961065138977297,
      "grad_norm": 0.45139441678153225,
      "learning_rate": 3.7760689887242715e-05,
      "loss": 1.4021,
      "num_input_tokens_seen": 29375485376,
      "step": 37337
    },
    {
      "epoch": 3.9611712285168683,
      "grad_norm": 0.4323116141121808,
      "learning_rate": 3.776009226421364e-05,
      "loss": 1.3311,
      "num_input_tokens_seen": 29376272144,
      "step": 37338
    },
    {
      "epoch": 3.96127731805644,
      "grad_norm": 0.49733859265594466,
      "learning_rate": 3.775949463132393e-05,
      "loss": 1.3917,
      "num_input_tokens_seen": 29377058880,
      "step": 37339
    },
    {
      "epoch": 3.961383407596011,
      "grad_norm": 0.41712059205886876,
      "learning_rate": 3.775889698857407e-05,
      "loss": 1.4614,
      "num_input_tokens_seen": 29377845696,
      "step": 37340
    },
    {
      "epoch": 3.9614894971355823,
      "grad_norm": 0.5248563212626429,
      "learning_rate": 3.775829933596449e-05,
      "loss": 1.4089,
      "num_input_tokens_seen": 29378632464,
      "step": 37341
    },
    {
      "epoch": 3.9615955866751538,
      "grad_norm": 0.3841951788389132,
      "learning_rate": 3.7757701673495685e-05,
      "loss": 1.4319,
      "num_input_tokens_seen": 29379419328,
      "step": 37342
    },
    {
      "epoch": 3.9617016762147252,
      "grad_norm": 0.4987869919459655,
      "learning_rate": 3.7757104001168095e-05,
      "loss": 1.4837,
      "num_input_tokens_seen": 29380205952,
      "step": 37343
    },
    {
      "epoch": 3.9618077657542967,
      "grad_norm": 0.4338506958258913,
      "learning_rate": 3.7756506318982186e-05,
      "loss": 1.3914,
      "num_input_tokens_seen": 29380992752,
      "step": 37344
    },
    {
      "epoch": 3.9619138552938677,
      "grad_norm": 0.4092548583434366,
      "learning_rate": 3.775590862693843e-05,
      "loss": 1.4208,
      "num_input_tokens_seen": 29381779600,
      "step": 37345
    },
    {
      "epoch": 3.9620199448334397,
      "grad_norm": 0.42772423264365855,
      "learning_rate": 3.775531092503728e-05,
      "loss": 1.4482,
      "num_input_tokens_seen": 29382566352,
      "step": 37346
    },
    {
      "epoch": 3.9621260343730107,
      "grad_norm": 0.4316301557993914,
      "learning_rate": 3.7754713213279205e-05,
      "loss": 1.4106,
      "num_input_tokens_seen": 29383353056,
      "step": 37347
    },
    {
      "epoch": 3.962232123912582,
      "grad_norm": 0.40390107070803943,
      "learning_rate": 3.775411549166466e-05,
      "loss": 1.3834,
      "num_input_tokens_seen": 29384139856,
      "step": 37348
    },
    {
      "epoch": 3.9623382134521536,
      "grad_norm": 0.47381585431797835,
      "learning_rate": 3.77535177601941e-05,
      "loss": 1.5157,
      "num_input_tokens_seen": 29384926512,
      "step": 37349
    },
    {
      "epoch": 3.962444302991725,
      "grad_norm": 0.49213376359639616,
      "learning_rate": 3.775292001886801e-05,
      "loss": 1.548,
      "num_input_tokens_seen": 29385713232,
      "step": 37350
    },
    {
      "epoch": 3.9625503925312966,
      "grad_norm": 0.46395239365313157,
      "learning_rate": 3.775232226768683e-05,
      "loss": 1.5311,
      "num_input_tokens_seen": 29386499904,
      "step": 37351
    },
    {
      "epoch": 3.9626564820708676,
      "grad_norm": 0.7020231466598147,
      "learning_rate": 3.775172450665102e-05,
      "loss": 1.3332,
      "num_input_tokens_seen": 29387286816,
      "step": 37352
    },
    {
      "epoch": 3.962762571610439,
      "grad_norm": 0.6825566871760332,
      "learning_rate": 3.7751126735761064e-05,
      "loss": 1.6707,
      "num_input_tokens_seen": 29388073536,
      "step": 37353
    },
    {
      "epoch": 3.9628686611500106,
      "grad_norm": 0.8507067992007035,
      "learning_rate": 3.7750528955017404e-05,
      "loss": 1.4293,
      "num_input_tokens_seen": 29388860352,
      "step": 37354
    },
    {
      "epoch": 3.962974750689582,
      "grad_norm": 0.6376311360031205,
      "learning_rate": 3.7749931164420514e-05,
      "loss": 1.4988,
      "num_input_tokens_seen": 29389647072,
      "step": 37355
    },
    {
      "epoch": 3.9630808402291535,
      "grad_norm": 0.5037768848138445,
      "learning_rate": 3.7749333363970855e-05,
      "loss": 1.3931,
      "num_input_tokens_seen": 29390433792,
      "step": 37356
    },
    {
      "epoch": 3.9631869297687246,
      "grad_norm": 0.6798601821599947,
      "learning_rate": 3.774873555366888e-05,
      "loss": 1.3984,
      "num_input_tokens_seen": 29391220512,
      "step": 37357
    },
    {
      "epoch": 3.9632930193082965,
      "grad_norm": 0.5393686703384426,
      "learning_rate": 3.7748137733515055e-05,
      "loss": 1.4386,
      "num_input_tokens_seen": 29392007232,
      "step": 37358
    },
    {
      "epoch": 3.9633991088478675,
      "grad_norm": 0.4764280253816839,
      "learning_rate": 3.7747539903509856e-05,
      "loss": 1.4159,
      "num_input_tokens_seen": 29392793936,
      "step": 37359
    },
    {
      "epoch": 3.963505198387439,
      "grad_norm": 0.45109460067547086,
      "learning_rate": 3.774694206365371e-05,
      "loss": 1.3797,
      "num_input_tokens_seen": 29393580768,
      "step": 37360
    },
    {
      "epoch": 3.9636112879270105,
      "grad_norm": 0.5396244906499179,
      "learning_rate": 3.7746344213947114e-05,
      "loss": 1.4134,
      "num_input_tokens_seen": 29394367408,
      "step": 37361
    },
    {
      "epoch": 3.963717377466582,
      "grad_norm": 0.5489241044943379,
      "learning_rate": 3.774574635439052e-05,
      "loss": 1.5353,
      "num_input_tokens_seen": 29395154096,
      "step": 37362
    },
    {
      "epoch": 3.9638234670061534,
      "grad_norm": 0.5579516015006794,
      "learning_rate": 3.7745148484984384e-05,
      "loss": 1.4439,
      "num_input_tokens_seen": 29395940896,
      "step": 37363
    },
    {
      "epoch": 3.9639295565457244,
      "grad_norm": 0.5034399698145431,
      "learning_rate": 3.7744550605729165e-05,
      "loss": 1.3719,
      "num_input_tokens_seen": 29396727664,
      "step": 37364
    },
    {
      "epoch": 3.964035646085296,
      "grad_norm": 0.4245259539114928,
      "learning_rate": 3.774395271662534e-05,
      "loss": 1.4908,
      "num_input_tokens_seen": 29397514416,
      "step": 37365
    },
    {
      "epoch": 3.9641417356248674,
      "grad_norm": 0.5772447680693911,
      "learning_rate": 3.774335481767336e-05,
      "loss": 1.5572,
      "num_input_tokens_seen": 29398301184,
      "step": 37366
    },
    {
      "epoch": 3.964247825164439,
      "grad_norm": 0.4911929920631816,
      "learning_rate": 3.774275690887369e-05,
      "loss": 1.5223,
      "num_input_tokens_seen": 29399087968,
      "step": 37367
    },
    {
      "epoch": 3.9643539147040103,
      "grad_norm": 0.539218836774544,
      "learning_rate": 3.7742158990226785e-05,
      "loss": 1.5591,
      "num_input_tokens_seen": 29399874784,
      "step": 37368
    },
    {
      "epoch": 3.9644600042435814,
      "grad_norm": 0.5193887428831697,
      "learning_rate": 3.774156106173311e-05,
      "loss": 1.4162,
      "num_input_tokens_seen": 29400661504,
      "step": 37369
    },
    {
      "epoch": 3.964566093783153,
      "grad_norm": 0.44543338803079635,
      "learning_rate": 3.7740963123393146e-05,
      "loss": 1.3185,
      "num_input_tokens_seen": 29401448272,
      "step": 37370
    },
    {
      "epoch": 3.9646721833227243,
      "grad_norm": 0.528290770610952,
      "learning_rate": 3.7740365175207335e-05,
      "loss": 1.4637,
      "num_input_tokens_seen": 29402234976,
      "step": 37371
    },
    {
      "epoch": 3.964778272862296,
      "grad_norm": 0.46857091067654333,
      "learning_rate": 3.7739767217176134e-05,
      "loss": 1.3374,
      "num_input_tokens_seen": 29403021776,
      "step": 37372
    },
    {
      "epoch": 3.9648843624018673,
      "grad_norm": 0.47787449055054493,
      "learning_rate": 3.773916924930002e-05,
      "loss": 1.4046,
      "num_input_tokens_seen": 29403808544,
      "step": 37373
    },
    {
      "epoch": 3.9649904519414387,
      "grad_norm": 0.41170948047607997,
      "learning_rate": 3.7738571271579456e-05,
      "loss": 1.394,
      "num_input_tokens_seen": 29404595312,
      "step": 37374
    },
    {
      "epoch": 3.96509654148101,
      "grad_norm": 0.46388940515244814,
      "learning_rate": 3.7737973284014894e-05,
      "loss": 1.5137,
      "num_input_tokens_seen": 29405382128,
      "step": 37375
    },
    {
      "epoch": 3.9652026310205812,
      "grad_norm": 0.5350022326821257,
      "learning_rate": 3.77373752866068e-05,
      "loss": 1.4212,
      "num_input_tokens_seen": 29406168928,
      "step": 37376
    },
    {
      "epoch": 3.9653087205601527,
      "grad_norm": 0.4504281339320176,
      "learning_rate": 3.773677727935563e-05,
      "loss": 1.4709,
      "num_input_tokens_seen": 29406955680,
      "step": 37377
    },
    {
      "epoch": 3.965414810099724,
      "grad_norm": 0.4655528240171384,
      "learning_rate": 3.773617926226186e-05,
      "loss": 1.4607,
      "num_input_tokens_seen": 29407742400,
      "step": 37378
    },
    {
      "epoch": 3.9655208996392957,
      "grad_norm": 0.4183442078607305,
      "learning_rate": 3.773558123532594e-05,
      "loss": 1.5251,
      "num_input_tokens_seen": 29408529184,
      "step": 37379
    },
    {
      "epoch": 3.965626989178867,
      "grad_norm": 0.4011502280079134,
      "learning_rate": 3.7734983198548335e-05,
      "loss": 1.4008,
      "num_input_tokens_seen": 29409315984,
      "step": 37380
    },
    {
      "epoch": 3.965733078718438,
      "grad_norm": 0.44109624773887907,
      "learning_rate": 3.7734385151929516e-05,
      "loss": 1.4387,
      "num_input_tokens_seen": 29410102752,
      "step": 37381
    },
    {
      "epoch": 3.9658391682580096,
      "grad_norm": 0.4294887153305339,
      "learning_rate": 3.773378709546993e-05,
      "loss": 1.445,
      "num_input_tokens_seen": 29410889536,
      "step": 37382
    },
    {
      "epoch": 3.965945257797581,
      "grad_norm": 0.4449049583278184,
      "learning_rate": 3.773318902917005e-05,
      "loss": 1.4473,
      "num_input_tokens_seen": 29411676288,
      "step": 37383
    },
    {
      "epoch": 3.9660513473371526,
      "grad_norm": 0.46207799733299393,
      "learning_rate": 3.7732590953030336e-05,
      "loss": 1.4934,
      "num_input_tokens_seen": 29412463024,
      "step": 37384
    },
    {
      "epoch": 3.966157436876724,
      "grad_norm": 0.39244503959084126,
      "learning_rate": 3.773199286705125e-05,
      "loss": 1.3909,
      "num_input_tokens_seen": 29413249792,
      "step": 37385
    },
    {
      "epoch": 3.966263526416295,
      "grad_norm": 0.47245831290155105,
      "learning_rate": 3.7731394771233256e-05,
      "loss": 1.4894,
      "num_input_tokens_seen": 29414036592,
      "step": 37386
    },
    {
      "epoch": 3.966369615955867,
      "grad_norm": 0.4659473339110365,
      "learning_rate": 3.773079666557681e-05,
      "loss": 1.4436,
      "num_input_tokens_seen": 29414823328,
      "step": 37387
    },
    {
      "epoch": 3.966475705495438,
      "grad_norm": 0.3824864220229102,
      "learning_rate": 3.773019855008238e-05,
      "loss": 1.4001,
      "num_input_tokens_seen": 29415610128,
      "step": 37388
    },
    {
      "epoch": 3.9665817950350095,
      "grad_norm": 0.4936945074634362,
      "learning_rate": 3.772960042475042e-05,
      "loss": 1.3787,
      "num_input_tokens_seen": 29416396928,
      "step": 37389
    },
    {
      "epoch": 3.966687884574581,
      "grad_norm": 0.41255049700796276,
      "learning_rate": 3.7729002289581404e-05,
      "loss": 1.3634,
      "num_input_tokens_seen": 29417183776,
      "step": 37390
    },
    {
      "epoch": 3.9667939741141525,
      "grad_norm": 0.5861051940616008,
      "learning_rate": 3.772840414457579e-05,
      "loss": 1.5026,
      "num_input_tokens_seen": 29417970528,
      "step": 37391
    },
    {
      "epoch": 3.966900063653724,
      "grad_norm": 0.438323055357842,
      "learning_rate": 3.772780598973403e-05,
      "loss": 1.503,
      "num_input_tokens_seen": 29418757328,
      "step": 37392
    },
    {
      "epoch": 3.967006153193295,
      "grad_norm": 0.471867098081739,
      "learning_rate": 3.77272078250566e-05,
      "loss": 1.3764,
      "num_input_tokens_seen": 29419544096,
      "step": 37393
    },
    {
      "epoch": 3.9671122427328664,
      "grad_norm": 0.45168219732961773,
      "learning_rate": 3.772660965054397e-05,
      "loss": 1.3828,
      "num_input_tokens_seen": 29420330880,
      "step": 37394
    },
    {
      "epoch": 3.967218332272438,
      "grad_norm": 0.5330272362113284,
      "learning_rate": 3.772601146619657e-05,
      "loss": 1.4783,
      "num_input_tokens_seen": 29421117584,
      "step": 37395
    },
    {
      "epoch": 3.9673244218120094,
      "grad_norm": 0.403138800697222,
      "learning_rate": 3.7725413272014885e-05,
      "loss": 1.3604,
      "num_input_tokens_seen": 29421904432,
      "step": 37396
    },
    {
      "epoch": 3.967430511351581,
      "grad_norm": 0.4445382747257901,
      "learning_rate": 3.7724815067999374e-05,
      "loss": 1.5248,
      "num_input_tokens_seen": 29422691184,
      "step": 37397
    },
    {
      "epoch": 3.967536600891152,
      "grad_norm": 0.3770592514324996,
      "learning_rate": 3.772421685415051e-05,
      "loss": 1.3436,
      "num_input_tokens_seen": 29423477952,
      "step": 37398
    },
    {
      "epoch": 3.9676426904307234,
      "grad_norm": 0.44420993591283814,
      "learning_rate": 3.7723618630468735e-05,
      "loss": 1.3605,
      "num_input_tokens_seen": 29424264736,
      "step": 37399
    },
    {
      "epoch": 3.967748779970295,
      "grad_norm": 0.47510729873460944,
      "learning_rate": 3.772302039695452e-05,
      "loss": 1.4814,
      "num_input_tokens_seen": 29425051552,
      "step": 37400
    },
    {
      "epoch": 3.9678548695098663,
      "grad_norm": 0.43117592513215774,
      "learning_rate": 3.772242215360834e-05,
      "loss": 1.4233,
      "num_input_tokens_seen": 29425838288,
      "step": 37401
    },
    {
      "epoch": 3.967960959049438,
      "grad_norm": 0.45170870154922566,
      "learning_rate": 3.772182390043064e-05,
      "loss": 1.4543,
      "num_input_tokens_seen": 29426625024,
      "step": 37402
    },
    {
      "epoch": 3.9680670485890093,
      "grad_norm": 0.5976650844031655,
      "learning_rate": 3.772122563742188e-05,
      "loss": 1.5559,
      "num_input_tokens_seen": 29427411824,
      "step": 37403
    },
    {
      "epoch": 3.9681731381285807,
      "grad_norm": 0.4495864624238343,
      "learning_rate": 3.772062736458254e-05,
      "loss": 1.4954,
      "num_input_tokens_seen": 29428198560,
      "step": 37404
    },
    {
      "epoch": 3.9682792276681518,
      "grad_norm": 0.5905965769201346,
      "learning_rate": 3.7720029081913064e-05,
      "loss": 1.4536,
      "num_input_tokens_seen": 29428985360,
      "step": 37405
    },
    {
      "epoch": 3.9683853172077233,
      "grad_norm": 0.4363653673497667,
      "learning_rate": 3.771943078941392e-05,
      "loss": 1.4177,
      "num_input_tokens_seen": 29429772112,
      "step": 37406
    },
    {
      "epoch": 3.9684914067472947,
      "grad_norm": 0.5640523868062798,
      "learning_rate": 3.771883248708559e-05,
      "loss": 1.4665,
      "num_input_tokens_seen": 29430558976,
      "step": 37407
    },
    {
      "epoch": 3.968597496286866,
      "grad_norm": 0.4774017075373982,
      "learning_rate": 3.7718234174928506e-05,
      "loss": 1.3384,
      "num_input_tokens_seen": 29431345712,
      "step": 37408
    },
    {
      "epoch": 3.9687035858264377,
      "grad_norm": 0.48672969199249294,
      "learning_rate": 3.7717635852943145e-05,
      "loss": 1.5467,
      "num_input_tokens_seen": 29432132432,
      "step": 37409
    },
    {
      "epoch": 3.9688096753660087,
      "grad_norm": 0.6870742431974703,
      "learning_rate": 3.771703752112997e-05,
      "loss": 1.4937,
      "num_input_tokens_seen": 29432919120,
      "step": 37410
    },
    {
      "epoch": 3.96891576490558,
      "grad_norm": 0.5706598090905758,
      "learning_rate": 3.771643917948945e-05,
      "loss": 1.4109,
      "num_input_tokens_seen": 29433705872,
      "step": 37411
    },
    {
      "epoch": 3.9690218544451517,
      "grad_norm": 0.4805649461089614,
      "learning_rate": 3.771584082802202e-05,
      "loss": 1.4166,
      "num_input_tokens_seen": 29434492720,
      "step": 37412
    },
    {
      "epoch": 3.969127943984723,
      "grad_norm": 0.5376699890848068,
      "learning_rate": 3.7715242466728174e-05,
      "loss": 1.5225,
      "num_input_tokens_seen": 29435279520,
      "step": 37413
    },
    {
      "epoch": 3.9692340335242946,
      "grad_norm": 0.4925541135833961,
      "learning_rate": 3.7714644095608356e-05,
      "loss": 1.5802,
      "num_input_tokens_seen": 29436066256,
      "step": 37414
    },
    {
      "epoch": 3.9693401230638656,
      "grad_norm": 0.5918725740116403,
      "learning_rate": 3.771404571466304e-05,
      "loss": 1.4312,
      "num_input_tokens_seen": 29436852992,
      "step": 37415
    },
    {
      "epoch": 3.9694462126034376,
      "grad_norm": 0.45347886898445444,
      "learning_rate": 3.771344732389268e-05,
      "loss": 1.4295,
      "num_input_tokens_seen": 29437639664,
      "step": 37416
    },
    {
      "epoch": 3.9695523021430086,
      "grad_norm": 0.6009032896256022,
      "learning_rate": 3.771284892329774e-05,
      "loss": 1.3876,
      "num_input_tokens_seen": 29438426384,
      "step": 37417
    },
    {
      "epoch": 3.96965839168258,
      "grad_norm": 0.46451722267651296,
      "learning_rate": 3.771225051287869e-05,
      "loss": 1.4676,
      "num_input_tokens_seen": 29439213024,
      "step": 37418
    },
    {
      "epoch": 3.9697644812221515,
      "grad_norm": 0.48033979151541556,
      "learning_rate": 3.771165209263598e-05,
      "loss": 1.4977,
      "num_input_tokens_seen": 29439999808,
      "step": 37419
    },
    {
      "epoch": 3.969870570761723,
      "grad_norm": 0.5511444675489531,
      "learning_rate": 3.771105366257008e-05,
      "loss": 1.5143,
      "num_input_tokens_seen": 29440786656,
      "step": 37420
    },
    {
      "epoch": 3.9699766603012945,
      "grad_norm": 0.4661437408413085,
      "learning_rate": 3.771045522268144e-05,
      "loss": 1.4795,
      "num_input_tokens_seen": 29441573392,
      "step": 37421
    },
    {
      "epoch": 3.9700827498408655,
      "grad_norm": 0.45028671070960236,
      "learning_rate": 3.770985677297055e-05,
      "loss": 1.3323,
      "num_input_tokens_seen": 29442360192,
      "step": 37422
    },
    {
      "epoch": 3.970188839380437,
      "grad_norm": 0.45911404767089736,
      "learning_rate": 3.770925831343785e-05,
      "loss": 1.4353,
      "num_input_tokens_seen": 29443146896,
      "step": 37423
    },
    {
      "epoch": 3.9702949289200085,
      "grad_norm": 0.4019188071969801,
      "learning_rate": 3.77086598440838e-05,
      "loss": 1.3762,
      "num_input_tokens_seen": 29443933648,
      "step": 37424
    },
    {
      "epoch": 3.97040101845958,
      "grad_norm": 0.4752959630008242,
      "learning_rate": 3.7708061364908874e-05,
      "loss": 1.3689,
      "num_input_tokens_seen": 29444720448,
      "step": 37425
    },
    {
      "epoch": 3.9705071079991514,
      "grad_norm": 0.42672530971214623,
      "learning_rate": 3.770746287591353e-05,
      "loss": 1.3893,
      "num_input_tokens_seen": 29445507344,
      "step": 37426
    },
    {
      "epoch": 3.9706131975387224,
      "grad_norm": 0.4558380533518004,
      "learning_rate": 3.770686437709824e-05,
      "loss": 1.3694,
      "num_input_tokens_seen": 29446294128,
      "step": 37427
    },
    {
      "epoch": 3.9707192870782944,
      "grad_norm": 0.42602393158020724,
      "learning_rate": 3.7706265868463456e-05,
      "loss": 1.4374,
      "num_input_tokens_seen": 29447080864,
      "step": 37428
    },
    {
      "epoch": 3.9708253766178654,
      "grad_norm": 0.43761669371313844,
      "learning_rate": 3.770566735000964e-05,
      "loss": 1.4842,
      "num_input_tokens_seen": 29447867488,
      "step": 37429
    },
    {
      "epoch": 3.970931466157437,
      "grad_norm": 0.3952096839418957,
      "learning_rate": 3.7705068821737255e-05,
      "loss": 1.4802,
      "num_input_tokens_seen": 29448654176,
      "step": 37430
    },
    {
      "epoch": 3.9710375556970083,
      "grad_norm": 0.48379063708111003,
      "learning_rate": 3.770447028364677e-05,
      "loss": 1.3242,
      "num_input_tokens_seen": 29449440896,
      "step": 37431
    },
    {
      "epoch": 3.97114364523658,
      "grad_norm": 0.40723810355299195,
      "learning_rate": 3.7703871735738636e-05,
      "loss": 1.4224,
      "num_input_tokens_seen": 29450227616,
      "step": 37432
    },
    {
      "epoch": 3.9712497347761513,
      "grad_norm": 0.47725908034821024,
      "learning_rate": 3.770327317801333e-05,
      "loss": 1.5627,
      "num_input_tokens_seen": 29451014384,
      "step": 37433
    },
    {
      "epoch": 3.9713558243157223,
      "grad_norm": 0.37189979912440463,
      "learning_rate": 3.770267461047131e-05,
      "loss": 1.388,
      "num_input_tokens_seen": 29451801184,
      "step": 37434
    },
    {
      "epoch": 3.971461913855294,
      "grad_norm": 0.4734007671107599,
      "learning_rate": 3.7702076033113026e-05,
      "loss": 1.4098,
      "num_input_tokens_seen": 29452587984,
      "step": 37435
    },
    {
      "epoch": 3.9715680033948653,
      "grad_norm": 0.44528070216877036,
      "learning_rate": 3.7701477445938956e-05,
      "loss": 1.492,
      "num_input_tokens_seen": 29453374800,
      "step": 37436
    },
    {
      "epoch": 3.9716740929344367,
      "grad_norm": 0.37046400973722354,
      "learning_rate": 3.7700878848949556e-05,
      "loss": 1.3914,
      "num_input_tokens_seen": 29454161600,
      "step": 37437
    },
    {
      "epoch": 3.971780182474008,
      "grad_norm": 0.4996756743830912,
      "learning_rate": 3.770028024214529e-05,
      "loss": 1.4082,
      "num_input_tokens_seen": 29454948352,
      "step": 37438
    },
    {
      "epoch": 3.9718862720135792,
      "grad_norm": 0.3822240562854082,
      "learning_rate": 3.769968162552662e-05,
      "loss": 1.3834,
      "num_input_tokens_seen": 29455735200,
      "step": 37439
    },
    {
      "epoch": 3.9719923615531507,
      "grad_norm": 0.6328416918571573,
      "learning_rate": 3.7699082999094007e-05,
      "loss": 1.4781,
      "num_input_tokens_seen": 29456521824,
      "step": 37440
    },
    {
      "epoch": 3.972098451092722,
      "grad_norm": 0.4900403766411586,
      "learning_rate": 3.7698484362847916e-05,
      "loss": 1.5312,
      "num_input_tokens_seen": 29457308640,
      "step": 37441
    },
    {
      "epoch": 3.9722045406322937,
      "grad_norm": 0.6463186160685409,
      "learning_rate": 3.769788571678881e-05,
      "loss": 1.4303,
      "num_input_tokens_seen": 29458095392,
      "step": 37442
    },
    {
      "epoch": 3.972310630171865,
      "grad_norm": 0.5055372307539262,
      "learning_rate": 3.769728706091714e-05,
      "loss": 1.5027,
      "num_input_tokens_seen": 29458882176,
      "step": 37443
    },
    {
      "epoch": 3.9724167197114366,
      "grad_norm": 0.7014290626328634,
      "learning_rate": 3.7696688395233395e-05,
      "loss": 1.3901,
      "num_input_tokens_seen": 29459668928,
      "step": 37444
    },
    {
      "epoch": 3.972522809251008,
      "grad_norm": 0.43747968148236405,
      "learning_rate": 3.769608971973801e-05,
      "loss": 1.4341,
      "num_input_tokens_seen": 29460455584,
      "step": 37445
    },
    {
      "epoch": 3.972628898790579,
      "grad_norm": 0.4491102010818383,
      "learning_rate": 3.769549103443147e-05,
      "loss": 1.3703,
      "num_input_tokens_seen": 29461242432,
      "step": 37446
    },
    {
      "epoch": 3.9727349883301506,
      "grad_norm": 0.5222152825138571,
      "learning_rate": 3.7694892339314225e-05,
      "loss": 1.4322,
      "num_input_tokens_seen": 29462029168,
      "step": 37447
    },
    {
      "epoch": 3.972841077869722,
      "grad_norm": 0.5189748395765161,
      "learning_rate": 3.769429363438673e-05,
      "loss": 1.4353,
      "num_input_tokens_seen": 29462815856,
      "step": 37448
    },
    {
      "epoch": 3.9729471674092935,
      "grad_norm": 0.4733946761411641,
      "learning_rate": 3.7693694919649466e-05,
      "loss": 1.3954,
      "num_input_tokens_seen": 29463602640,
      "step": 37449
    },
    {
      "epoch": 3.973053256948865,
      "grad_norm": 0.538133800852587,
      "learning_rate": 3.769309619510288e-05,
      "loss": 1.5537,
      "num_input_tokens_seen": 29464389424,
      "step": 37450
    },
    {
      "epoch": 3.973159346488436,
      "grad_norm": 0.40644732560883706,
      "learning_rate": 3.769249746074746e-05,
      "loss": 1.4775,
      "num_input_tokens_seen": 29465176288,
      "step": 37451
    },
    {
      "epoch": 3.9732654360280075,
      "grad_norm": 0.4648968379284428,
      "learning_rate": 3.769189871658363e-05,
      "loss": 1.4464,
      "num_input_tokens_seen": 29465963120,
      "step": 37452
    },
    {
      "epoch": 3.973371525567579,
      "grad_norm": 0.48838217891994223,
      "learning_rate": 3.769129996261188e-05,
      "loss": 1.4921,
      "num_input_tokens_seen": 29466749936,
      "step": 37453
    },
    {
      "epoch": 3.9734776151071505,
      "grad_norm": 0.4240904944572726,
      "learning_rate": 3.769070119883267e-05,
      "loss": 1.452,
      "num_input_tokens_seen": 29467536736,
      "step": 37454
    },
    {
      "epoch": 3.973583704646722,
      "grad_norm": 0.4306534777705758,
      "learning_rate": 3.7690102425246446e-05,
      "loss": 1.4625,
      "num_input_tokens_seen": 29468323424,
      "step": 37455
    },
    {
      "epoch": 3.973689794186293,
      "grad_norm": 0.5133880882455829,
      "learning_rate": 3.76895036418537e-05,
      "loss": 1.5326,
      "num_input_tokens_seen": 29469110080,
      "step": 37456
    },
    {
      "epoch": 3.973795883725865,
      "grad_norm": 0.42024022889732154,
      "learning_rate": 3.768890484865486e-05,
      "loss": 1.4427,
      "num_input_tokens_seen": 29469896864,
      "step": 37457
    },
    {
      "epoch": 3.973901973265436,
      "grad_norm": 0.40926941435231384,
      "learning_rate": 3.768830604565043e-05,
      "loss": 1.385,
      "num_input_tokens_seen": 29470683744,
      "step": 37458
    },
    {
      "epoch": 3.9740080628050074,
      "grad_norm": 0.3800677296593305,
      "learning_rate": 3.768770723284083e-05,
      "loss": 1.3722,
      "num_input_tokens_seen": 29471470496,
      "step": 37459
    },
    {
      "epoch": 3.974114152344579,
      "grad_norm": 0.3939596917545464,
      "learning_rate": 3.768710841022654e-05,
      "loss": 1.3886,
      "num_input_tokens_seen": 29472257216,
      "step": 37460
    },
    {
      "epoch": 3.9742202418841504,
      "grad_norm": 0.44101784476516775,
      "learning_rate": 3.7686509577808035e-05,
      "loss": 1.4452,
      "num_input_tokens_seen": 29473043968,
      "step": 37461
    },
    {
      "epoch": 3.974326331423722,
      "grad_norm": 0.48253175978714113,
      "learning_rate": 3.768591073558577e-05,
      "loss": 1.4045,
      "num_input_tokens_seen": 29473830784,
      "step": 37462
    },
    {
      "epoch": 3.974432420963293,
      "grad_norm": 0.4261595830847702,
      "learning_rate": 3.768531188356019e-05,
      "loss": 1.4281,
      "num_input_tokens_seen": 29474617520,
      "step": 37463
    },
    {
      "epoch": 3.9745385105028643,
      "grad_norm": 0.6383225952951113,
      "learning_rate": 3.7684713021731786e-05,
      "loss": 1.4614,
      "num_input_tokens_seen": 29475404384,
      "step": 37464
    },
    {
      "epoch": 3.974644600042436,
      "grad_norm": 0.45592365804567475,
      "learning_rate": 3.7684114150101007e-05,
      "loss": 1.5177,
      "num_input_tokens_seen": 29476191120,
      "step": 37465
    },
    {
      "epoch": 3.9747506895820073,
      "grad_norm": 0.5740526793147971,
      "learning_rate": 3.7683515268668314e-05,
      "loss": 1.4551,
      "num_input_tokens_seen": 29476977840,
      "step": 37466
    },
    {
      "epoch": 3.9748567791215788,
      "grad_norm": 0.46459810728736367,
      "learning_rate": 3.7682916377434176e-05,
      "loss": 1.3654,
      "num_input_tokens_seen": 29477764768,
      "step": 37467
    },
    {
      "epoch": 3.97496286866115,
      "grad_norm": 0.43930859269589456,
      "learning_rate": 3.7682317476399054e-05,
      "loss": 1.3634,
      "num_input_tokens_seen": 29478551616,
      "step": 37468
    },
    {
      "epoch": 3.9750689582007213,
      "grad_norm": 0.5260257297033722,
      "learning_rate": 3.7681718565563395e-05,
      "loss": 1.3976,
      "num_input_tokens_seen": 29479338416,
      "step": 37469
    },
    {
      "epoch": 3.9751750477402927,
      "grad_norm": 0.4143161987920808,
      "learning_rate": 3.7681119644927694e-05,
      "loss": 1.4257,
      "num_input_tokens_seen": 29480125168,
      "step": 37470
    },
    {
      "epoch": 3.975281137279864,
      "grad_norm": 0.4951653022852462,
      "learning_rate": 3.7680520714492384e-05,
      "loss": 1.5547,
      "num_input_tokens_seen": 29480911872,
      "step": 37471
    },
    {
      "epoch": 3.9753872268194357,
      "grad_norm": 0.5212919499892503,
      "learning_rate": 3.7679921774257946e-05,
      "loss": 1.5365,
      "num_input_tokens_seen": 29481698560,
      "step": 37472
    },
    {
      "epoch": 3.975493316359007,
      "grad_norm": 0.509740193123571,
      "learning_rate": 3.767932282422484e-05,
      "loss": 1.4667,
      "num_input_tokens_seen": 29482485264,
      "step": 37473
    },
    {
      "epoch": 3.9755994058985786,
      "grad_norm": 0.46916176214706956,
      "learning_rate": 3.7678723864393516e-05,
      "loss": 1.3588,
      "num_input_tokens_seen": 29483271968,
      "step": 37474
    },
    {
      "epoch": 3.9757054954381497,
      "grad_norm": 0.41157776124217094,
      "learning_rate": 3.7678124894764446e-05,
      "loss": 1.3481,
      "num_input_tokens_seen": 29484058784,
      "step": 37475
    },
    {
      "epoch": 3.975811584977721,
      "grad_norm": 0.42921124171605823,
      "learning_rate": 3.76775259153381e-05,
      "loss": 1.3657,
      "num_input_tokens_seen": 29484845616,
      "step": 37476
    },
    {
      "epoch": 3.9759176745172926,
      "grad_norm": 0.4339868815667398,
      "learning_rate": 3.767692692611493e-05,
      "loss": 1.526,
      "num_input_tokens_seen": 29485632400,
      "step": 37477
    },
    {
      "epoch": 3.976023764056864,
      "grad_norm": 0.4325073130126552,
      "learning_rate": 3.76763279270954e-05,
      "loss": 1.385,
      "num_input_tokens_seen": 29486419136,
      "step": 37478
    },
    {
      "epoch": 3.9761298535964356,
      "grad_norm": 0.45282279065059067,
      "learning_rate": 3.7675728918279984e-05,
      "loss": 1.41,
      "num_input_tokens_seen": 29487205856,
      "step": 37479
    },
    {
      "epoch": 3.9762359431360066,
      "grad_norm": 0.564261921489765,
      "learning_rate": 3.767512989966914e-05,
      "loss": 1.5425,
      "num_input_tokens_seen": 29487992672,
      "step": 37480
    },
    {
      "epoch": 3.976342032675578,
      "grad_norm": 0.5095981099110889,
      "learning_rate": 3.7674530871263316e-05,
      "loss": 1.4149,
      "num_input_tokens_seen": 29488779440,
      "step": 37481
    },
    {
      "epoch": 3.9764481222151495,
      "grad_norm": 0.5006414219633983,
      "learning_rate": 3.767393183306299e-05,
      "loss": 1.5062,
      "num_input_tokens_seen": 29489566192,
      "step": 37482
    },
    {
      "epoch": 3.976554211754721,
      "grad_norm": 0.5512660779897162,
      "learning_rate": 3.7673332785068616e-05,
      "loss": 1.4254,
      "num_input_tokens_seen": 29490352992,
      "step": 37483
    },
    {
      "epoch": 3.9766603012942925,
      "grad_norm": 0.5033256248976435,
      "learning_rate": 3.7672733727280676e-05,
      "loss": 1.6197,
      "num_input_tokens_seen": 29491139712,
      "step": 37484
    },
    {
      "epoch": 3.9767663908338635,
      "grad_norm": 0.4174618555416758,
      "learning_rate": 3.767213465969961e-05,
      "loss": 1.3425,
      "num_input_tokens_seen": 29491926480,
      "step": 37485
    },
    {
      "epoch": 3.9768724803734354,
      "grad_norm": 0.4586557417640442,
      "learning_rate": 3.767153558232589e-05,
      "loss": 1.4966,
      "num_input_tokens_seen": 29492713264,
      "step": 37486
    },
    {
      "epoch": 3.9769785699130065,
      "grad_norm": 0.3982036770847662,
      "learning_rate": 3.767093649515998e-05,
      "loss": 1.3182,
      "num_input_tokens_seen": 29493500080,
      "step": 37487
    },
    {
      "epoch": 3.977084659452578,
      "grad_norm": 0.4070190551376775,
      "learning_rate": 3.767033739820234e-05,
      "loss": 1.4228,
      "num_input_tokens_seen": 29494286752,
      "step": 37488
    },
    {
      "epoch": 3.9771907489921494,
      "grad_norm": 0.4091837711329741,
      "learning_rate": 3.766973829145344e-05,
      "loss": 1.4945,
      "num_input_tokens_seen": 29495073440,
      "step": 37489
    },
    {
      "epoch": 3.977296838531721,
      "grad_norm": 0.548963432091268,
      "learning_rate": 3.7669139174913735e-05,
      "loss": 1.5071,
      "num_input_tokens_seen": 29495860304,
      "step": 37490
    },
    {
      "epoch": 3.9774029280712924,
      "grad_norm": 0.407897119998682,
      "learning_rate": 3.766854004858369e-05,
      "loss": 1.4068,
      "num_input_tokens_seen": 29496647056,
      "step": 37491
    },
    {
      "epoch": 3.9775090176108634,
      "grad_norm": 0.45956526611397214,
      "learning_rate": 3.766794091246377e-05,
      "loss": 1.2663,
      "num_input_tokens_seen": 29497433872,
      "step": 37492
    },
    {
      "epoch": 3.977615107150435,
      "grad_norm": 0.5966075923580684,
      "learning_rate": 3.766734176655444e-05,
      "loss": 1.4993,
      "num_input_tokens_seen": 29498220688,
      "step": 37493
    },
    {
      "epoch": 3.9777211966900063,
      "grad_norm": 0.45718424135485464,
      "learning_rate": 3.766674261085615e-05,
      "loss": 1.4984,
      "num_input_tokens_seen": 29499007424,
      "step": 37494
    },
    {
      "epoch": 3.977827286229578,
      "grad_norm": 0.585050855465219,
      "learning_rate": 3.766614344536938e-05,
      "loss": 1.5068,
      "num_input_tokens_seen": 29499794176,
      "step": 37495
    },
    {
      "epoch": 3.9779333757691493,
      "grad_norm": 0.8047368205394692,
      "learning_rate": 3.766554427009459e-05,
      "loss": 1.3459,
      "num_input_tokens_seen": 29500580960,
      "step": 37496
    },
    {
      "epoch": 3.9780394653087203,
      "grad_norm": 0.45739499019482505,
      "learning_rate": 3.766494508503224e-05,
      "loss": 1.478,
      "num_input_tokens_seen": 29501367728,
      "step": 37497
    },
    {
      "epoch": 3.978145554848292,
      "grad_norm": 0.7345608582613455,
      "learning_rate": 3.7664345890182785e-05,
      "loss": 1.457,
      "num_input_tokens_seen": 29502154432,
      "step": 37498
    },
    {
      "epoch": 3.9782516443878633,
      "grad_norm": 0.5430803806875244,
      "learning_rate": 3.7663746685546694e-05,
      "loss": 1.3836,
      "num_input_tokens_seen": 29502941216,
      "step": 37499
    },
    {
      "epoch": 3.9783577339274347,
      "grad_norm": 0.49467416128134467,
      "learning_rate": 3.766314747112444e-05,
      "loss": 1.4406,
      "num_input_tokens_seen": 29503728032,
      "step": 37500
    },
    {
      "epoch": 3.978463823467006,
      "grad_norm": 0.6519170999390262,
      "learning_rate": 3.7662548246916466e-05,
      "loss": 1.3393,
      "num_input_tokens_seen": 29504514784,
      "step": 37501
    },
    {
      "epoch": 3.9785699130065777,
      "grad_norm": 0.6585929318505319,
      "learning_rate": 3.7661949012923256e-05,
      "loss": 1.3543,
      "num_input_tokens_seen": 29505301552,
      "step": 37502
    },
    {
      "epoch": 3.978676002546149,
      "grad_norm": 0.47905871812339446,
      "learning_rate": 3.766134976914526e-05,
      "loss": 1.4257,
      "num_input_tokens_seen": 29506088256,
      "step": 37503
    },
    {
      "epoch": 3.97878209208572,
      "grad_norm": 0.8907874385828508,
      "learning_rate": 3.7660750515582945e-05,
      "loss": 1.5002,
      "num_input_tokens_seen": 29506875136,
      "step": 37504
    },
    {
      "epoch": 3.9788881816252917,
      "grad_norm": 0.5512498491589843,
      "learning_rate": 3.766015125223678e-05,
      "loss": 1.4187,
      "num_input_tokens_seen": 29507661920,
      "step": 37505
    },
    {
      "epoch": 3.978994271164863,
      "grad_norm": 0.6268468443635045,
      "learning_rate": 3.76595519791072e-05,
      "loss": 1.4145,
      "num_input_tokens_seen": 29508448752,
      "step": 37506
    },
    {
      "epoch": 3.9791003607044346,
      "grad_norm": 0.48261732289895387,
      "learning_rate": 3.7658952696194704e-05,
      "loss": 1.5598,
      "num_input_tokens_seen": 29509235440,
      "step": 37507
    },
    {
      "epoch": 3.979206450244006,
      "grad_norm": 0.63361582992212,
      "learning_rate": 3.765835340349975e-05,
      "loss": 1.5025,
      "num_input_tokens_seen": 29510022224,
      "step": 37508
    },
    {
      "epoch": 3.979312539783577,
      "grad_norm": 0.5270971280625185,
      "learning_rate": 3.765775410102277e-05,
      "loss": 1.5966,
      "num_input_tokens_seen": 29510808944,
      "step": 37509
    },
    {
      "epoch": 3.9794186293231486,
      "grad_norm": 0.6402055874698394,
      "learning_rate": 3.7657154788764274e-05,
      "loss": 1.5729,
      "num_input_tokens_seen": 29511595680,
      "step": 37510
    },
    {
      "epoch": 3.97952471886272,
      "grad_norm": 0.4167007717723853,
      "learning_rate": 3.765655546672467e-05,
      "loss": 1.3597,
      "num_input_tokens_seen": 29512382448,
      "step": 37511
    },
    {
      "epoch": 3.9796308084022916,
      "grad_norm": 0.5634375044896068,
      "learning_rate": 3.765595613490448e-05,
      "loss": 1.3852,
      "num_input_tokens_seen": 29513169184,
      "step": 37512
    },
    {
      "epoch": 3.979736897941863,
      "grad_norm": 0.5738132516766488,
      "learning_rate": 3.765535679330412e-05,
      "loss": 1.3824,
      "num_input_tokens_seen": 29513956080,
      "step": 37513
    },
    {
      "epoch": 3.979842987481434,
      "grad_norm": 0.4572486205660867,
      "learning_rate": 3.7654757441924085e-05,
      "loss": 1.3543,
      "num_input_tokens_seen": 29514742864,
      "step": 37514
    },
    {
      "epoch": 3.979949077021006,
      "grad_norm": 0.5450674826992472,
      "learning_rate": 3.765415808076481e-05,
      "loss": 1.3613,
      "num_input_tokens_seen": 29515529664,
      "step": 37515
    },
    {
      "epoch": 3.980055166560577,
      "grad_norm": 0.45991805781596995,
      "learning_rate": 3.765355870982678e-05,
      "loss": 1.4304,
      "num_input_tokens_seen": 29516316336,
      "step": 37516
    },
    {
      "epoch": 3.9801612561001485,
      "grad_norm": 0.4927363098357301,
      "learning_rate": 3.765295932911046e-05,
      "loss": 1.4831,
      "num_input_tokens_seen": 29517103072,
      "step": 37517
    },
    {
      "epoch": 3.98026734563972,
      "grad_norm": 0.5317963839670675,
      "learning_rate": 3.765235993861629e-05,
      "loss": 1.3532,
      "num_input_tokens_seen": 29517889840,
      "step": 37518
    },
    {
      "epoch": 3.9803734351792914,
      "grad_norm": 0.5386545033373108,
      "learning_rate": 3.765176053834476e-05,
      "loss": 1.5456,
      "num_input_tokens_seen": 29518676624,
      "step": 37519
    },
    {
      "epoch": 3.980479524718863,
      "grad_norm": 0.46004158377519,
      "learning_rate": 3.765116112829632e-05,
      "loss": 1.4543,
      "num_input_tokens_seen": 29519463392,
      "step": 37520
    },
    {
      "epoch": 3.980585614258434,
      "grad_norm": 0.5997947372441252,
      "learning_rate": 3.765056170847142e-05,
      "loss": 1.4317,
      "num_input_tokens_seen": 29520250128,
      "step": 37521
    },
    {
      "epoch": 3.9806917037980054,
      "grad_norm": 0.44215346121625015,
      "learning_rate": 3.764996227887055e-05,
      "loss": 1.4529,
      "num_input_tokens_seen": 29521036944,
      "step": 37522
    },
    {
      "epoch": 3.980797793337577,
      "grad_norm": 0.507651251768847,
      "learning_rate": 3.764936283949416e-05,
      "loss": 1.5331,
      "num_input_tokens_seen": 29521823712,
      "step": 37523
    },
    {
      "epoch": 3.9809038828771484,
      "grad_norm": 0.6172817085044635,
      "learning_rate": 3.764876339034271e-05,
      "loss": 1.4978,
      "num_input_tokens_seen": 29522610432,
      "step": 37524
    },
    {
      "epoch": 3.98100997241672,
      "grad_norm": 0.4711329887505054,
      "learning_rate": 3.764816393141666e-05,
      "loss": 1.5115,
      "num_input_tokens_seen": 29523397104,
      "step": 37525
    },
    {
      "epoch": 3.981116061956291,
      "grad_norm": 0.6516055861624269,
      "learning_rate": 3.764756446271649e-05,
      "loss": 1.4561,
      "num_input_tokens_seen": 29524183808,
      "step": 37526
    },
    {
      "epoch": 3.981222151495863,
      "grad_norm": 0.40519730928152575,
      "learning_rate": 3.764696498424265e-05,
      "loss": 1.4401,
      "num_input_tokens_seen": 29524970544,
      "step": 37527
    },
    {
      "epoch": 3.981328241035434,
      "grad_norm": 0.4922851729152299,
      "learning_rate": 3.76463654959956e-05,
      "loss": 1.465,
      "num_input_tokens_seen": 29525757232,
      "step": 37528
    },
    {
      "epoch": 3.9814343305750053,
      "grad_norm": 0.493574581261365,
      "learning_rate": 3.764576599797583e-05,
      "loss": 1.3085,
      "num_input_tokens_seen": 29526544016,
      "step": 37529
    },
    {
      "epoch": 3.9815404201145768,
      "grad_norm": 0.44197674684066757,
      "learning_rate": 3.764516649018376e-05,
      "loss": 1.4541,
      "num_input_tokens_seen": 29527330800,
      "step": 37530
    },
    {
      "epoch": 3.9816465096541482,
      "grad_norm": 0.5090366501707962,
      "learning_rate": 3.764456697261989e-05,
      "loss": 1.4321,
      "num_input_tokens_seen": 29528117616,
      "step": 37531
    },
    {
      "epoch": 3.9817525991937197,
      "grad_norm": 0.5580436701346294,
      "learning_rate": 3.764396744528466e-05,
      "loss": 1.3683,
      "num_input_tokens_seen": 29528904384,
      "step": 37532
    },
    {
      "epoch": 3.9818586887332907,
      "grad_norm": 0.4824941283685533,
      "learning_rate": 3.764336790817855e-05,
      "loss": 1.3997,
      "num_input_tokens_seen": 29529691168,
      "step": 37533
    },
    {
      "epoch": 3.981964778272862,
      "grad_norm": 0.6060086949404586,
      "learning_rate": 3.7642768361302016e-05,
      "loss": 1.4069,
      "num_input_tokens_seen": 29530477888,
      "step": 37534
    },
    {
      "epoch": 3.9820708678124337,
      "grad_norm": 0.41586974031990165,
      "learning_rate": 3.764216880465552e-05,
      "loss": 1.4317,
      "num_input_tokens_seen": 29531264592,
      "step": 37535
    },
    {
      "epoch": 3.982176957352005,
      "grad_norm": 0.5110153480140747,
      "learning_rate": 3.764156923823953e-05,
      "loss": 1.3646,
      "num_input_tokens_seen": 29532051408,
      "step": 37536
    },
    {
      "epoch": 3.9822830468915766,
      "grad_norm": 0.48231367510758977,
      "learning_rate": 3.764096966205451e-05,
      "loss": 1.3502,
      "num_input_tokens_seen": 29532838240,
      "step": 37537
    },
    {
      "epoch": 3.9823891364311477,
      "grad_norm": 0.47265038448262325,
      "learning_rate": 3.764037007610091e-05,
      "loss": 1.4761,
      "num_input_tokens_seen": 29533624976,
      "step": 37538
    },
    {
      "epoch": 3.982495225970719,
      "grad_norm": 0.4942567738973419,
      "learning_rate": 3.76397704803792e-05,
      "loss": 1.4769,
      "num_input_tokens_seen": 29534411808,
      "step": 37539
    },
    {
      "epoch": 3.9826013155102906,
      "grad_norm": 0.47597980249905425,
      "learning_rate": 3.763917087488985e-05,
      "loss": 1.3616,
      "num_input_tokens_seen": 29535198528,
      "step": 37540
    },
    {
      "epoch": 3.982707405049862,
      "grad_norm": 0.414427005094428,
      "learning_rate": 3.763857125963333e-05,
      "loss": 1.3233,
      "num_input_tokens_seen": 29535985312,
      "step": 37541
    },
    {
      "epoch": 3.9828134945894336,
      "grad_norm": 0.6382951407730194,
      "learning_rate": 3.763797163461008e-05,
      "loss": 1.4911,
      "num_input_tokens_seen": 29536772192,
      "step": 37542
    },
    {
      "epoch": 3.982919584129005,
      "grad_norm": 0.4127003916914672,
      "learning_rate": 3.763737199982058e-05,
      "loss": 1.4474,
      "num_input_tokens_seen": 29537558976,
      "step": 37543
    },
    {
      "epoch": 3.9830256736685765,
      "grad_norm": 0.5403335820037978,
      "learning_rate": 3.763677235526529e-05,
      "loss": 1.5059,
      "num_input_tokens_seen": 29538345696,
      "step": 37544
    },
    {
      "epoch": 3.9831317632081475,
      "grad_norm": 0.6579118344664685,
      "learning_rate": 3.7636172700944674e-05,
      "loss": 1.4891,
      "num_input_tokens_seen": 29539132464,
      "step": 37545
    },
    {
      "epoch": 3.983237852747719,
      "grad_norm": 0.44903724232679526,
      "learning_rate": 3.7635573036859196e-05,
      "loss": 1.3401,
      "num_input_tokens_seen": 29539919248,
      "step": 37546
    },
    {
      "epoch": 3.9833439422872905,
      "grad_norm": 0.5529692055538822,
      "learning_rate": 3.763497336300931e-05,
      "loss": 1.4281,
      "num_input_tokens_seen": 29540706112,
      "step": 37547
    },
    {
      "epoch": 3.983450031826862,
      "grad_norm": 0.47456326143219524,
      "learning_rate": 3.76343736793955e-05,
      "loss": 1.4352,
      "num_input_tokens_seen": 29541492976,
      "step": 37548
    },
    {
      "epoch": 3.9835561213664334,
      "grad_norm": 0.4153089694990377,
      "learning_rate": 3.7633773986018204e-05,
      "loss": 1.4673,
      "num_input_tokens_seen": 29542279664,
      "step": 37549
    },
    {
      "epoch": 3.9836622109060045,
      "grad_norm": 0.5328031729626043,
      "learning_rate": 3.763317428287791e-05,
      "loss": 1.4784,
      "num_input_tokens_seen": 29543066448,
      "step": 37550
    },
    {
      "epoch": 3.983768300445576,
      "grad_norm": 0.4907722535625535,
      "learning_rate": 3.763257456997507e-05,
      "loss": 1.3814,
      "num_input_tokens_seen": 29543853232,
      "step": 37551
    },
    {
      "epoch": 3.9838743899851474,
      "grad_norm": 0.44529358770434985,
      "learning_rate": 3.7631974847310134e-05,
      "loss": 1.4323,
      "num_input_tokens_seen": 29544640000,
      "step": 37552
    },
    {
      "epoch": 3.983980479524719,
      "grad_norm": 0.5213173414631208,
      "learning_rate": 3.7631375114883585e-05,
      "loss": 1.3815,
      "num_input_tokens_seen": 29545426848,
      "step": 37553
    },
    {
      "epoch": 3.9840865690642904,
      "grad_norm": 0.5425798972064706,
      "learning_rate": 3.763077537269588e-05,
      "loss": 1.4243,
      "num_input_tokens_seen": 29546213648,
      "step": 37554
    },
    {
      "epoch": 3.9841926586038614,
      "grad_norm": 0.42547423421934916,
      "learning_rate": 3.763017562074748e-05,
      "loss": 1.4333,
      "num_input_tokens_seen": 29547000352,
      "step": 37555
    },
    {
      "epoch": 3.9842987481434333,
      "grad_norm": 0.48739160234318807,
      "learning_rate": 3.7629575859038855e-05,
      "loss": 1.3791,
      "num_input_tokens_seen": 29547787072,
      "step": 37556
    },
    {
      "epoch": 3.9844048376830044,
      "grad_norm": 0.4242408046787297,
      "learning_rate": 3.762897608757046e-05,
      "loss": 1.398,
      "num_input_tokens_seen": 29548573792,
      "step": 37557
    },
    {
      "epoch": 3.984510927222576,
      "grad_norm": 0.4983402597283661,
      "learning_rate": 3.762837630634277e-05,
      "loss": 1.4683,
      "num_input_tokens_seen": 29549360512,
      "step": 37558
    },
    {
      "epoch": 3.9846170167621473,
      "grad_norm": 0.4722320925951767,
      "learning_rate": 3.762777651535623e-05,
      "loss": 1.5423,
      "num_input_tokens_seen": 29550147264,
      "step": 37559
    },
    {
      "epoch": 3.9847231063017188,
      "grad_norm": 0.5193403179564261,
      "learning_rate": 3.7627176714611325e-05,
      "loss": 1.4515,
      "num_input_tokens_seen": 29550934048,
      "step": 37560
    },
    {
      "epoch": 3.9848291958412903,
      "grad_norm": 0.4451094701991504,
      "learning_rate": 3.76265769041085e-05,
      "loss": 1.3726,
      "num_input_tokens_seen": 29551720816,
      "step": 37561
    },
    {
      "epoch": 3.9849352853808613,
      "grad_norm": 0.43357685286793035,
      "learning_rate": 3.762597708384824e-05,
      "loss": 1.4574,
      "num_input_tokens_seen": 29552507520,
      "step": 37562
    },
    {
      "epoch": 3.9850413749204328,
      "grad_norm": 0.44579760311026717,
      "learning_rate": 3.762537725383099e-05,
      "loss": 1.3558,
      "num_input_tokens_seen": 29553294352,
      "step": 37563
    },
    {
      "epoch": 3.9851474644600042,
      "grad_norm": 0.6910876399839644,
      "learning_rate": 3.762477741405721e-05,
      "loss": 1.4298,
      "num_input_tokens_seen": 29554081088,
      "step": 37564
    },
    {
      "epoch": 3.9852535539995757,
      "grad_norm": 0.43217582259266407,
      "learning_rate": 3.762417756452738e-05,
      "loss": 1.4155,
      "num_input_tokens_seen": 29554867872,
      "step": 37565
    },
    {
      "epoch": 3.985359643539147,
      "grad_norm": 0.5184813713868135,
      "learning_rate": 3.7623577705241963e-05,
      "loss": 1.3455,
      "num_input_tokens_seen": 29555654736,
      "step": 37566
    },
    {
      "epoch": 3.985465733078718,
      "grad_norm": 0.583517994975882,
      "learning_rate": 3.76229778362014e-05,
      "loss": 1.3253,
      "num_input_tokens_seen": 29556441520,
      "step": 37567
    },
    {
      "epoch": 3.9855718226182897,
      "grad_norm": 0.7403005806329196,
      "learning_rate": 3.7622377957406176e-05,
      "loss": 1.5258,
      "num_input_tokens_seen": 29557228240,
      "step": 37568
    },
    {
      "epoch": 3.985677912157861,
      "grad_norm": 0.5426245118465112,
      "learning_rate": 3.762177806885675e-05,
      "loss": 1.3023,
      "num_input_tokens_seen": 29558014976,
      "step": 37569
    },
    {
      "epoch": 3.9857840016974326,
      "grad_norm": 0.9301068252605614,
      "learning_rate": 3.762117817055359e-05,
      "loss": 1.5012,
      "num_input_tokens_seen": 29558801744,
      "step": 37570
    },
    {
      "epoch": 3.985890091237004,
      "grad_norm": 0.526042945787276,
      "learning_rate": 3.762057826249715e-05,
      "loss": 1.4438,
      "num_input_tokens_seen": 29559588496,
      "step": 37571
    },
    {
      "epoch": 3.9859961807765756,
      "grad_norm": 0.5524507760652486,
      "learning_rate": 3.761997834468789e-05,
      "loss": 1.4164,
      "num_input_tokens_seen": 29560375296,
      "step": 37572
    },
    {
      "epoch": 3.986102270316147,
      "grad_norm": 0.8347697891106027,
      "learning_rate": 3.761937841712629e-05,
      "loss": 1.4566,
      "num_input_tokens_seen": 29561162080,
      "step": 37573
    },
    {
      "epoch": 3.986208359855718,
      "grad_norm": 0.4244093051951257,
      "learning_rate": 3.76187784798128e-05,
      "loss": 1.4046,
      "num_input_tokens_seen": 29561948816,
      "step": 37574
    },
    {
      "epoch": 3.9863144493952896,
      "grad_norm": 0.5781025268947079,
      "learning_rate": 3.761817853274789e-05,
      "loss": 1.4084,
      "num_input_tokens_seen": 29562735600,
      "step": 37575
    },
    {
      "epoch": 3.986420538934861,
      "grad_norm": 0.6262658309589907,
      "learning_rate": 3.761757857593202e-05,
      "loss": 1.4004,
      "num_input_tokens_seen": 29563522416,
      "step": 37576
    },
    {
      "epoch": 3.9865266284744325,
      "grad_norm": 0.5026478343023177,
      "learning_rate": 3.761697860936566e-05,
      "loss": 1.4691,
      "num_input_tokens_seen": 29564309184,
      "step": 37577
    },
    {
      "epoch": 3.986632718014004,
      "grad_norm": 0.5039733423770882,
      "learning_rate": 3.7616378633049265e-05,
      "loss": 1.3786,
      "num_input_tokens_seen": 29565095952,
      "step": 37578
    },
    {
      "epoch": 3.986738807553575,
      "grad_norm": 0.5310652806135426,
      "learning_rate": 3.76157786469833e-05,
      "loss": 1.3865,
      "num_input_tokens_seen": 29565882688,
      "step": 37579
    },
    {
      "epoch": 3.9868448970931465,
      "grad_norm": 0.4329116547918949,
      "learning_rate": 3.7615178651168245e-05,
      "loss": 1.4657,
      "num_input_tokens_seen": 29566669488,
      "step": 37580
    },
    {
      "epoch": 3.986950986632718,
      "grad_norm": 0.5138397307229354,
      "learning_rate": 3.761457864560454e-05,
      "loss": 1.4515,
      "num_input_tokens_seen": 29567456224,
      "step": 37581
    },
    {
      "epoch": 3.9870570761722894,
      "grad_norm": 0.7171636871465891,
      "learning_rate": 3.7613978630292655e-05,
      "loss": 1.4692,
      "num_input_tokens_seen": 29568242928,
      "step": 37582
    },
    {
      "epoch": 3.987163165711861,
      "grad_norm": 0.4419897264958383,
      "learning_rate": 3.761337860523306e-05,
      "loss": 1.3998,
      "num_input_tokens_seen": 29569029760,
      "step": 37583
    },
    {
      "epoch": 3.987269255251432,
      "grad_norm": 0.7257016879020889,
      "learning_rate": 3.761277857042622e-05,
      "loss": 1.4318,
      "num_input_tokens_seen": 29569816464,
      "step": 37584
    },
    {
      "epoch": 3.987375344791004,
      "grad_norm": 0.5101623730480362,
      "learning_rate": 3.761217852587259e-05,
      "loss": 1.5167,
      "num_input_tokens_seen": 29570603216,
      "step": 37585
    },
    {
      "epoch": 3.987481434330575,
      "grad_norm": 0.5428393125847424,
      "learning_rate": 3.761157847157264e-05,
      "loss": 1.4354,
      "num_input_tokens_seen": 29571390032,
      "step": 37586
    },
    {
      "epoch": 3.9875875238701464,
      "grad_norm": 0.6364998246445681,
      "learning_rate": 3.761097840752684e-05,
      "loss": 1.4395,
      "num_input_tokens_seen": 29572176848,
      "step": 37587
    },
    {
      "epoch": 3.987693613409718,
      "grad_norm": 0.47961867462941205,
      "learning_rate": 3.761037833373564e-05,
      "loss": 1.4446,
      "num_input_tokens_seen": 29572963632,
      "step": 37588
    },
    {
      "epoch": 3.9877997029492893,
      "grad_norm": 0.5554911864091951,
      "learning_rate": 3.76097782501995e-05,
      "loss": 1.4817,
      "num_input_tokens_seen": 29573750352,
      "step": 37589
    },
    {
      "epoch": 3.987905792488861,
      "grad_norm": 0.7424767299965641,
      "learning_rate": 3.760917815691891e-05,
      "loss": 1.4244,
      "num_input_tokens_seen": 29574537136,
      "step": 37590
    },
    {
      "epoch": 3.988011882028432,
      "grad_norm": 0.5025682515981602,
      "learning_rate": 3.7608578053894305e-05,
      "loss": 1.3383,
      "num_input_tokens_seen": 29575323936,
      "step": 37591
    },
    {
      "epoch": 3.9881179715680033,
      "grad_norm": 0.5975750808278226,
      "learning_rate": 3.7607977941126165e-05,
      "loss": 1.3579,
      "num_input_tokens_seen": 29576110672,
      "step": 37592
    },
    {
      "epoch": 3.9882240611075748,
      "grad_norm": 0.5588072933037981,
      "learning_rate": 3.760737781861495e-05,
      "loss": 1.3161,
      "num_input_tokens_seen": 29576897456,
      "step": 37593
    },
    {
      "epoch": 3.9883301506471462,
      "grad_norm": 0.5507475426783726,
      "learning_rate": 3.760677768636113e-05,
      "loss": 1.4855,
      "num_input_tokens_seen": 29577684288,
      "step": 37594
    },
    {
      "epoch": 3.9884362401867177,
      "grad_norm": 0.6421979346588671,
      "learning_rate": 3.7606177544365154e-05,
      "loss": 1.5384,
      "num_input_tokens_seen": 29578471072,
      "step": 37595
    },
    {
      "epoch": 3.9885423297262887,
      "grad_norm": 0.6414742765623233,
      "learning_rate": 3.760557739262749e-05,
      "loss": 1.4646,
      "num_input_tokens_seen": 29579257808,
      "step": 37596
    },
    {
      "epoch": 3.9886484192658602,
      "grad_norm": 0.4133805842293063,
      "learning_rate": 3.760497723114862e-05,
      "loss": 1.4257,
      "num_input_tokens_seen": 29580044544,
      "step": 37597
    },
    {
      "epoch": 3.9887545088054317,
      "grad_norm": 0.8254473424552107,
      "learning_rate": 3.7604377059928976e-05,
      "loss": 1.3902,
      "num_input_tokens_seen": 29580831280,
      "step": 37598
    },
    {
      "epoch": 3.988860598345003,
      "grad_norm": 0.5087148413085183,
      "learning_rate": 3.760377687896905e-05,
      "loss": 1.4713,
      "num_input_tokens_seen": 29581618096,
      "step": 37599
    },
    {
      "epoch": 3.9889666878845746,
      "grad_norm": 0.5733209180471478,
      "learning_rate": 3.760317668826929e-05,
      "loss": 1.4739,
      "num_input_tokens_seen": 29582404880,
      "step": 37600
    },
    {
      "epoch": 3.989072777424146,
      "grad_norm": 0.5767728809643533,
      "learning_rate": 3.7602576487830167e-05,
      "loss": 1.4986,
      "num_input_tokens_seen": 29583191520,
      "step": 37601
    },
    {
      "epoch": 3.9891788669637176,
      "grad_norm": 0.5093316496319176,
      "learning_rate": 3.7601976277652146e-05,
      "loss": 1.4417,
      "num_input_tokens_seen": 29583978352,
      "step": 37602
    },
    {
      "epoch": 3.9892849565032886,
      "grad_norm": 0.5061861469818679,
      "learning_rate": 3.760137605773568e-05,
      "loss": 1.4523,
      "num_input_tokens_seen": 29584765072,
      "step": 37603
    },
    {
      "epoch": 3.98939104604286,
      "grad_norm": 0.498151595431817,
      "learning_rate": 3.760077582808125e-05,
      "loss": 1.4699,
      "num_input_tokens_seen": 29585551904,
      "step": 37604
    },
    {
      "epoch": 3.9894971355824316,
      "grad_norm": 0.48611255663809183,
      "learning_rate": 3.76001755886893e-05,
      "loss": 1.3313,
      "num_input_tokens_seen": 29586338640,
      "step": 37605
    },
    {
      "epoch": 3.989603225122003,
      "grad_norm": 0.40139016519942783,
      "learning_rate": 3.759957533956031e-05,
      "loss": 1.3943,
      "num_input_tokens_seen": 29587125440,
      "step": 37606
    },
    {
      "epoch": 3.9897093146615745,
      "grad_norm": 0.4584726809549542,
      "learning_rate": 3.759897508069473e-05,
      "loss": 1.3499,
      "num_input_tokens_seen": 29587912240,
      "step": 37607
    },
    {
      "epoch": 3.9898154042011456,
      "grad_norm": 0.4654930434018974,
      "learning_rate": 3.7598374812093046e-05,
      "loss": 1.3785,
      "num_input_tokens_seen": 29588698976,
      "step": 37608
    },
    {
      "epoch": 3.989921493740717,
      "grad_norm": 0.42780068193912396,
      "learning_rate": 3.75977745337557e-05,
      "loss": 1.3718,
      "num_input_tokens_seen": 29589485760,
      "step": 37609
    },
    {
      "epoch": 3.9900275832802885,
      "grad_norm": 0.4744329656944689,
      "learning_rate": 3.759717424568316e-05,
      "loss": 1.5144,
      "num_input_tokens_seen": 29590272528,
      "step": 37610
    },
    {
      "epoch": 3.99013367281986,
      "grad_norm": 0.45310617013382737,
      "learning_rate": 3.7596573947875904e-05,
      "loss": 1.4876,
      "num_input_tokens_seen": 29591059360,
      "step": 37611
    },
    {
      "epoch": 3.9902397623594315,
      "grad_norm": 0.4655369183107911,
      "learning_rate": 3.759597364033437e-05,
      "loss": 1.4205,
      "num_input_tokens_seen": 29591846144,
      "step": 37612
    },
    {
      "epoch": 3.9903458518990025,
      "grad_norm": 0.48852741029918867,
      "learning_rate": 3.7595373323059046e-05,
      "loss": 1.4619,
      "num_input_tokens_seen": 29592632928,
      "step": 37613
    },
    {
      "epoch": 3.9904519414385744,
      "grad_norm": 0.4079799442624787,
      "learning_rate": 3.759477299605039e-05,
      "loss": 1.3936,
      "num_input_tokens_seen": 29593419664,
      "step": 37614
    },
    {
      "epoch": 3.9905580309781454,
      "grad_norm": 0.4785327646780676,
      "learning_rate": 3.759417265930886e-05,
      "loss": 1.4014,
      "num_input_tokens_seen": 29594206416,
      "step": 37615
    },
    {
      "epoch": 3.990664120517717,
      "grad_norm": 0.4893261820414942,
      "learning_rate": 3.7593572312834924e-05,
      "loss": 1.5892,
      "num_input_tokens_seen": 29594993200,
      "step": 37616
    },
    {
      "epoch": 3.9907702100572884,
      "grad_norm": 0.4671194037718079,
      "learning_rate": 3.759297195662904e-05,
      "loss": 1.4675,
      "num_input_tokens_seen": 29595780032,
      "step": 37617
    },
    {
      "epoch": 3.99087629959686,
      "grad_norm": 0.5714489090664946,
      "learning_rate": 3.759237159069168e-05,
      "loss": 1.5424,
      "num_input_tokens_seen": 29596566688,
      "step": 37618
    },
    {
      "epoch": 3.9909823891364313,
      "grad_norm": 0.4189291835036056,
      "learning_rate": 3.759177121502331e-05,
      "loss": 1.4024,
      "num_input_tokens_seen": 29597353472,
      "step": 37619
    },
    {
      "epoch": 3.9910884786760024,
      "grad_norm": 0.49483111286435183,
      "learning_rate": 3.759117082962438e-05,
      "loss": 1.4991,
      "num_input_tokens_seen": 29598140256,
      "step": 37620
    },
    {
      "epoch": 3.991194568215574,
      "grad_norm": 0.5547054956503557,
      "learning_rate": 3.7590570434495366e-05,
      "loss": 1.4954,
      "num_input_tokens_seen": 29598927024,
      "step": 37621
    },
    {
      "epoch": 3.9913006577551453,
      "grad_norm": 0.5130425605757888,
      "learning_rate": 3.758997002963673e-05,
      "loss": 1.4121,
      "num_input_tokens_seen": 29599713792,
      "step": 37622
    },
    {
      "epoch": 3.991406747294717,
      "grad_norm": 0.4533773528315038,
      "learning_rate": 3.758936961504893e-05,
      "loss": 1.3985,
      "num_input_tokens_seen": 29600500576,
      "step": 37623
    },
    {
      "epoch": 3.9915128368342883,
      "grad_norm": 0.49213842430581756,
      "learning_rate": 3.758876919073244e-05,
      "loss": 1.4899,
      "num_input_tokens_seen": 29601287376,
      "step": 37624
    },
    {
      "epoch": 3.9916189263738593,
      "grad_norm": 0.48775757894183197,
      "learning_rate": 3.7588168756687715e-05,
      "loss": 1.4269,
      "num_input_tokens_seen": 29602074176,
      "step": 37625
    },
    {
      "epoch": 3.991725015913431,
      "grad_norm": 0.43299947981986775,
      "learning_rate": 3.7587568312915226e-05,
      "loss": 1.4024,
      "num_input_tokens_seen": 29602860944,
      "step": 37626
    },
    {
      "epoch": 3.9918311054530022,
      "grad_norm": 0.4514304686985007,
      "learning_rate": 3.758696785941543e-05,
      "loss": 1.3879,
      "num_input_tokens_seen": 29603647712,
      "step": 37627
    },
    {
      "epoch": 3.9919371949925737,
      "grad_norm": 0.45430472587899307,
      "learning_rate": 3.75863673961888e-05,
      "loss": 1.4659,
      "num_input_tokens_seen": 29604434544,
      "step": 37628
    },
    {
      "epoch": 3.992043284532145,
      "grad_norm": 0.44472599681333264,
      "learning_rate": 3.758576692323579e-05,
      "loss": 1.4694,
      "num_input_tokens_seen": 29605221280,
      "step": 37629
    },
    {
      "epoch": 3.9921493740717167,
      "grad_norm": 0.3973416201048742,
      "learning_rate": 3.758516644055686e-05,
      "loss": 1.4769,
      "num_input_tokens_seen": 29606008128,
      "step": 37630
    },
    {
      "epoch": 3.992255463611288,
      "grad_norm": 0.4800760053824367,
      "learning_rate": 3.75845659481525e-05,
      "loss": 1.4482,
      "num_input_tokens_seen": 29606794880,
      "step": 37631
    },
    {
      "epoch": 3.992361553150859,
      "grad_norm": 0.4051620002763484,
      "learning_rate": 3.7583965446023144e-05,
      "loss": 1.4001,
      "num_input_tokens_seen": 29607581632,
      "step": 37632
    },
    {
      "epoch": 3.9924676426904306,
      "grad_norm": 0.42362391590225223,
      "learning_rate": 3.758336493416927e-05,
      "loss": 1.489,
      "num_input_tokens_seen": 29608368384,
      "step": 37633
    },
    {
      "epoch": 3.992573732230002,
      "grad_norm": 0.516765560431932,
      "learning_rate": 3.758276441259135e-05,
      "loss": 1.5956,
      "num_input_tokens_seen": 29609155136,
      "step": 37634
    },
    {
      "epoch": 3.9926798217695736,
      "grad_norm": 0.571619545452064,
      "learning_rate": 3.758216388128983e-05,
      "loss": 1.5699,
      "num_input_tokens_seen": 29609941904,
      "step": 37635
    },
    {
      "epoch": 3.992785911309145,
      "grad_norm": 0.4829544299037679,
      "learning_rate": 3.758156334026519e-05,
      "loss": 1.4803,
      "num_input_tokens_seen": 29610728688,
      "step": 37636
    },
    {
      "epoch": 3.992892000848716,
      "grad_norm": 0.46802838020444176,
      "learning_rate": 3.758096278951788e-05,
      "loss": 1.5201,
      "num_input_tokens_seen": 29611515584,
      "step": 37637
    },
    {
      "epoch": 3.9929980903882876,
      "grad_norm": 0.4411449717318472,
      "learning_rate": 3.7580362229048374e-05,
      "loss": 1.5186,
      "num_input_tokens_seen": 29612302304,
      "step": 37638
    },
    {
      "epoch": 3.993104179927859,
      "grad_norm": 0.45360222936081074,
      "learning_rate": 3.757976165885714e-05,
      "loss": 1.4814,
      "num_input_tokens_seen": 29613089040,
      "step": 37639
    },
    {
      "epoch": 3.9932102694674305,
      "grad_norm": 0.5750623545629217,
      "learning_rate": 3.7579161078944624e-05,
      "loss": 1.4656,
      "num_input_tokens_seen": 29613875792,
      "step": 37640
    },
    {
      "epoch": 3.993316359007002,
      "grad_norm": 0.40688474856528284,
      "learning_rate": 3.7578560489311306e-05,
      "loss": 1.4935,
      "num_input_tokens_seen": 29614662560,
      "step": 37641
    },
    {
      "epoch": 3.9934224485465735,
      "grad_norm": 0.5170254270228415,
      "learning_rate": 3.757795988995765e-05,
      "loss": 1.5287,
      "num_input_tokens_seen": 29615449216,
      "step": 37642
    },
    {
      "epoch": 3.993528538086145,
      "grad_norm": 0.45759938925034704,
      "learning_rate": 3.7577359280884106e-05,
      "loss": 1.5036,
      "num_input_tokens_seen": 29616235904,
      "step": 37643
    },
    {
      "epoch": 3.993634627625716,
      "grad_norm": 0.46594003840297965,
      "learning_rate": 3.757675866209115e-05,
      "loss": 1.4376,
      "num_input_tokens_seen": 29617022704,
      "step": 37644
    },
    {
      "epoch": 3.9937407171652874,
      "grad_norm": 0.46268613852971724,
      "learning_rate": 3.757615803357925e-05,
      "loss": 1.4798,
      "num_input_tokens_seen": 29617809376,
      "step": 37645
    },
    {
      "epoch": 3.993846806704859,
      "grad_norm": 0.4631848227051945,
      "learning_rate": 3.7575557395348856e-05,
      "loss": 1.3837,
      "num_input_tokens_seen": 29618596240,
      "step": 37646
    },
    {
      "epoch": 3.9939528962444304,
      "grad_norm": 0.4039423668007108,
      "learning_rate": 3.7574956747400444e-05,
      "loss": 1.4279,
      "num_input_tokens_seen": 29619383056,
      "step": 37647
    },
    {
      "epoch": 3.994058985784002,
      "grad_norm": 0.5318202576467629,
      "learning_rate": 3.7574356089734484e-05,
      "loss": 1.5665,
      "num_input_tokens_seen": 29620169856,
      "step": 37648
    },
    {
      "epoch": 3.994165075323573,
      "grad_norm": 0.48689939420936035,
      "learning_rate": 3.757375542235142e-05,
      "loss": 1.6343,
      "num_input_tokens_seen": 29620956640,
      "step": 37649
    },
    {
      "epoch": 3.9942711648631444,
      "grad_norm": 0.5560512325549865,
      "learning_rate": 3.757315474525173e-05,
      "loss": 1.4535,
      "num_input_tokens_seen": 29621743328,
      "step": 37650
    },
    {
      "epoch": 3.994377254402716,
      "grad_norm": 0.6118738968885341,
      "learning_rate": 3.757255405843587e-05,
      "loss": 1.4543,
      "num_input_tokens_seen": 29622530032,
      "step": 37651
    },
    {
      "epoch": 3.9944833439422873,
      "grad_norm": 0.6186043967927931,
      "learning_rate": 3.757195336190431e-05,
      "loss": 1.4667,
      "num_input_tokens_seen": 29623316832,
      "step": 37652
    },
    {
      "epoch": 3.994589433481859,
      "grad_norm": 0.5324063059720681,
      "learning_rate": 3.757135265565752e-05,
      "loss": 1.4328,
      "num_input_tokens_seen": 29624103600,
      "step": 37653
    },
    {
      "epoch": 3.99469552302143,
      "grad_norm": 0.5633193574573423,
      "learning_rate": 3.7570751939695955e-05,
      "loss": 1.4976,
      "num_input_tokens_seen": 29624890320,
      "step": 37654
    },
    {
      "epoch": 3.9948016125610017,
      "grad_norm": 0.5970789497809388,
      "learning_rate": 3.757015121402008e-05,
      "loss": 1.5036,
      "num_input_tokens_seen": 29625677088,
      "step": 37655
    },
    {
      "epoch": 3.9949077021005728,
      "grad_norm": 0.6243710160923541,
      "learning_rate": 3.7569550478630356e-05,
      "loss": 1.5051,
      "num_input_tokens_seen": 29626463856,
      "step": 37656
    },
    {
      "epoch": 3.9950137916401443,
      "grad_norm": 0.6034315365682975,
      "learning_rate": 3.756894973352726e-05,
      "loss": 1.5401,
      "num_input_tokens_seen": 29627250608,
      "step": 37657
    },
    {
      "epoch": 3.9951198811797157,
      "grad_norm": 0.7542480320145631,
      "learning_rate": 3.756834897871124e-05,
      "loss": 1.4854,
      "num_input_tokens_seen": 29628037440,
      "step": 37658
    },
    {
      "epoch": 3.995225970719287,
      "grad_norm": 0.5699334498596813,
      "learning_rate": 3.7567748214182785e-05,
      "loss": 1.4229,
      "num_input_tokens_seen": 29628824256,
      "step": 37659
    },
    {
      "epoch": 3.9953320602588587,
      "grad_norm": 0.4977400643760339,
      "learning_rate": 3.756714743994233e-05,
      "loss": 1.3592,
      "num_input_tokens_seen": 29629611024,
      "step": 37660
    },
    {
      "epoch": 3.9954381497984297,
      "grad_norm": 0.6136525688435005,
      "learning_rate": 3.756654665599035e-05,
      "loss": 1.3935,
      "num_input_tokens_seen": 29630397744,
      "step": 37661
    },
    {
      "epoch": 3.995544239338001,
      "grad_norm": 0.46307676714482704,
      "learning_rate": 3.756594586232732e-05,
      "loss": 1.3287,
      "num_input_tokens_seen": 29631184528,
      "step": 37662
    },
    {
      "epoch": 3.9956503288775727,
      "grad_norm": 0.4850670511587535,
      "learning_rate": 3.756534505895369e-05,
      "loss": 1.3921,
      "num_input_tokens_seen": 29631971344,
      "step": 37663
    },
    {
      "epoch": 3.995756418417144,
      "grad_norm": 0.5135641741429959,
      "learning_rate": 3.756474424586993e-05,
      "loss": 1.4243,
      "num_input_tokens_seen": 29632758192,
      "step": 37664
    },
    {
      "epoch": 3.9958625079567156,
      "grad_norm": 0.49391749886611097,
      "learning_rate": 3.756414342307652e-05,
      "loss": 1.4137,
      "num_input_tokens_seen": 29633544992,
      "step": 37665
    },
    {
      "epoch": 3.9959685974962866,
      "grad_norm": 0.433374242492453,
      "learning_rate": 3.7563542590573884e-05,
      "loss": 1.2986,
      "num_input_tokens_seen": 29634331808,
      "step": 37666
    },
    {
      "epoch": 3.996074687035858,
      "grad_norm": 0.5262807322438013,
      "learning_rate": 3.7562941748362524e-05,
      "loss": 1.4542,
      "num_input_tokens_seen": 29635118608,
      "step": 37667
    },
    {
      "epoch": 3.9961807765754296,
      "grad_norm": 0.5065227282186595,
      "learning_rate": 3.7562340896442894e-05,
      "loss": 1.5023,
      "num_input_tokens_seen": 29635905344,
      "step": 37668
    },
    {
      "epoch": 3.996286866115001,
      "grad_norm": 0.40008904590603267,
      "learning_rate": 3.756174003481545e-05,
      "loss": 1.3983,
      "num_input_tokens_seen": 29636692112,
      "step": 37669
    },
    {
      "epoch": 3.9963929556545725,
      "grad_norm": 0.8200121654210888,
      "learning_rate": 3.756113916348066e-05,
      "loss": 1.48,
      "num_input_tokens_seen": 29637478848,
      "step": 37670
    },
    {
      "epoch": 3.996499045194144,
      "grad_norm": 0.5275490175812912,
      "learning_rate": 3.7560538282438994e-05,
      "loss": 1.4641,
      "num_input_tokens_seen": 29638265600,
      "step": 37671
    },
    {
      "epoch": 3.9966051347337155,
      "grad_norm": 0.4411336125198919,
      "learning_rate": 3.7559937391690905e-05,
      "loss": 1.3632,
      "num_input_tokens_seen": 29639052352,
      "step": 37672
    },
    {
      "epoch": 3.9967112242732865,
      "grad_norm": 0.5150270644835345,
      "learning_rate": 3.7559336491236876e-05,
      "loss": 1.4483,
      "num_input_tokens_seen": 29639839104,
      "step": 37673
    },
    {
      "epoch": 3.996817313812858,
      "grad_norm": 0.40446170415288407,
      "learning_rate": 3.755873558107736e-05,
      "loss": 1.3303,
      "num_input_tokens_seen": 29640625984,
      "step": 37674
    },
    {
      "epoch": 3.9969234033524295,
      "grad_norm": 0.5797885304547427,
      "learning_rate": 3.755813466121281e-05,
      "loss": 1.3769,
      "num_input_tokens_seen": 29641412752,
      "step": 37675
    },
    {
      "epoch": 3.997029492892001,
      "grad_norm": 0.4278278760918843,
      "learning_rate": 3.755753373164371e-05,
      "loss": 1.3448,
      "num_input_tokens_seen": 29642199584,
      "step": 37676
    },
    {
      "epoch": 3.9971355824315724,
      "grad_norm": 0.44988256156282386,
      "learning_rate": 3.755693279237052e-05,
      "loss": 1.3777,
      "num_input_tokens_seen": 29642986336,
      "step": 37677
    },
    {
      "epoch": 3.9972416719711434,
      "grad_norm": 0.4421162876379244,
      "learning_rate": 3.75563318433937e-05,
      "loss": 1.5314,
      "num_input_tokens_seen": 29643773136,
      "step": 37678
    },
    {
      "epoch": 3.997347761510715,
      "grad_norm": 0.45072952469883193,
      "learning_rate": 3.755573088471371e-05,
      "loss": 1.4846,
      "num_input_tokens_seen": 29644559856,
      "step": 37679
    },
    {
      "epoch": 3.9974538510502864,
      "grad_norm": 0.43337400013120025,
      "learning_rate": 3.7555129916331025e-05,
      "loss": 1.4189,
      "num_input_tokens_seen": 29645346640,
      "step": 37680
    },
    {
      "epoch": 3.997559940589858,
      "grad_norm": 0.47158721553677085,
      "learning_rate": 3.7554528938246094e-05,
      "loss": 1.3913,
      "num_input_tokens_seen": 29646133472,
      "step": 37681
    },
    {
      "epoch": 3.9976660301294293,
      "grad_norm": 0.40790654788777586,
      "learning_rate": 3.75539279504594e-05,
      "loss": 1.3883,
      "num_input_tokens_seen": 29646920224,
      "step": 37682
    },
    {
      "epoch": 3.9977721196690004,
      "grad_norm": 0.4135081984345846,
      "learning_rate": 3.7553326952971395e-05,
      "loss": 1.3098,
      "num_input_tokens_seen": 29647707040,
      "step": 37683
    },
    {
      "epoch": 3.9978782092085723,
      "grad_norm": 0.4549633109660395,
      "learning_rate": 3.755272594578255e-05,
      "loss": 1.3788,
      "num_input_tokens_seen": 29648493776,
      "step": 37684
    },
    {
      "epoch": 3.9979842987481433,
      "grad_norm": 0.4547445764699726,
      "learning_rate": 3.755212492889332e-05,
      "loss": 1.3362,
      "num_input_tokens_seen": 29649280560,
      "step": 37685
    },
    {
      "epoch": 3.998090388287715,
      "grad_norm": 0.45596117880181397,
      "learning_rate": 3.755152390230419e-05,
      "loss": 1.4965,
      "num_input_tokens_seen": 29650067264,
      "step": 37686
    },
    {
      "epoch": 3.9981964778272863,
      "grad_norm": 0.5370477189720131,
      "learning_rate": 3.75509228660156e-05,
      "loss": 1.5935,
      "num_input_tokens_seen": 29650854048,
      "step": 37687
    },
    {
      "epoch": 3.9983025673668577,
      "grad_norm": 0.4537966664333506,
      "learning_rate": 3.755032182002802e-05,
      "loss": 1.3911,
      "num_input_tokens_seen": 29651640832,
      "step": 37688
    },
    {
      "epoch": 3.998408656906429,
      "grad_norm": 0.4488657876468809,
      "learning_rate": 3.754972076434193e-05,
      "loss": 1.3497,
      "num_input_tokens_seen": 29652427616,
      "step": 37689
    },
    {
      "epoch": 3.9985147464460002,
      "grad_norm": 0.5157506307474609,
      "learning_rate": 3.754911969895778e-05,
      "loss": 1.502,
      "num_input_tokens_seen": 29653214432,
      "step": 37690
    },
    {
      "epoch": 3.9986208359855717,
      "grad_norm": 0.4367481317025479,
      "learning_rate": 3.754851862387604e-05,
      "loss": 1.5011,
      "num_input_tokens_seen": 29654001328,
      "step": 37691
    },
    {
      "epoch": 3.998726925525143,
      "grad_norm": 0.516604312156614,
      "learning_rate": 3.754791753909717e-05,
      "loss": 1.3994,
      "num_input_tokens_seen": 29654788112,
      "step": 37692
    },
    {
      "epoch": 3.9988330150647147,
      "grad_norm": 0.4270100065964502,
      "learning_rate": 3.7547316444621644e-05,
      "loss": 1.4494,
      "num_input_tokens_seen": 29655574912,
      "step": 37693
    },
    {
      "epoch": 3.998939104604286,
      "grad_norm": 0.42260893236583974,
      "learning_rate": 3.7546715340449916e-05,
      "loss": 1.3466,
      "num_input_tokens_seen": 29656361728,
      "step": 37694
    },
    {
      "epoch": 3.999045194143857,
      "grad_norm": 0.4940505348995524,
      "learning_rate": 3.754611422658245e-05,
      "loss": 1.4432,
      "num_input_tokens_seen": 29657148416,
      "step": 37695
    },
    {
      "epoch": 3.9991512836834286,
      "grad_norm": 0.4256752144544832,
      "learning_rate": 3.754551310301972e-05,
      "loss": 1.4293,
      "num_input_tokens_seen": 29657935120,
      "step": 37696
    },
    {
      "epoch": 3.999257373223,
      "grad_norm": 0.4342425293105464,
      "learning_rate": 3.754491196976219e-05,
      "loss": 1.4338,
      "num_input_tokens_seen": 29658721904,
      "step": 37697
    },
    {
      "epoch": 3.9993634627625716,
      "grad_norm": 0.45482567860088957,
      "learning_rate": 3.754431082681031e-05,
      "loss": 1.4712,
      "num_input_tokens_seen": 29659508656,
      "step": 37698
    },
    {
      "epoch": 3.999469552302143,
      "grad_norm": 0.5170687834164356,
      "learning_rate": 3.7543709674164564e-05,
      "loss": 1.4755,
      "num_input_tokens_seen": 29660295536,
      "step": 37699
    },
    {
      "epoch": 3.9995756418417145,
      "grad_norm": 0.5073006395259051,
      "learning_rate": 3.754310851182541e-05,
      "loss": 1.5382,
      "num_input_tokens_seen": 29661082240,
      "step": 37700
    },
    {
      "epoch": 3.999681731381286,
      "grad_norm": 0.4436310956378589,
      "learning_rate": 3.754250733979329e-05,
      "loss": 1.3605,
      "num_input_tokens_seen": 29661869088,
      "step": 37701
    },
    {
      "epoch": 3.999787820920857,
      "grad_norm": 0.5252587107526031,
      "learning_rate": 3.7541906158068705e-05,
      "loss": 1.4596,
      "num_input_tokens_seen": 29662655840,
      "step": 37702
    },
    {
      "epoch": 3.9998939104604285,
      "grad_norm": 0.45105492201762953,
      "learning_rate": 3.75413049666521e-05,
      "loss": 1.4766,
      "num_input_tokens_seen": 29663442656,
      "step": 37703
    },
    {
      "epoch": 4.0,
      "grad_norm": 0.4739926269671169,
      "learning_rate": 3.754070376554394e-05,
      "loss": 1.3987,
      "num_input_tokens_seen": 29664229472,
      "step": 37704
    },
    {
      "epoch": 4.000106089539571,
      "grad_norm": 0.6976732122696542,
      "learning_rate": 3.7540102554744695e-05,
      "loss": 1.2326,
      "num_input_tokens_seen": 29665016256,
      "step": 37705
    },
    {
      "epoch": 4.000212179079143,
      "grad_norm": 0.5414600028713118,
      "learning_rate": 3.7539501334254825e-05,
      "loss": 1.2909,
      "num_input_tokens_seen": 29665802992,
      "step": 37706
    },
    {
      "epoch": 4.000318268618714,
      "grad_norm": 0.7084475328769267,
      "learning_rate": 3.753890010407479e-05,
      "loss": 1.2559,
      "num_input_tokens_seen": 29666589760,
      "step": 37707
    },
    {
      "epoch": 4.000424358158286,
      "grad_norm": 0.660420827454682,
      "learning_rate": 3.753829886420507e-05,
      "loss": 1.239,
      "num_input_tokens_seen": 29667376528,
      "step": 37708
    },
    {
      "epoch": 4.000530447697857,
      "grad_norm": 0.6603873993235091,
      "learning_rate": 3.753769761464613e-05,
      "loss": 1.368,
      "num_input_tokens_seen": 29668163216,
      "step": 37709
    },
    {
      "epoch": 4.000636537237428,
      "grad_norm": 0.6427896490633341,
      "learning_rate": 3.75370963553984e-05,
      "loss": 1.2604,
      "num_input_tokens_seen": 29668949984,
      "step": 37710
    },
    {
      "epoch": 4.000742626777,
      "grad_norm": 0.5621470292836355,
      "learning_rate": 3.753649508646239e-05,
      "loss": 1.2957,
      "num_input_tokens_seen": 29669736752,
      "step": 37711
    },
    {
      "epoch": 4.000848716316571,
      "grad_norm": 0.6938493516506642,
      "learning_rate": 3.753589380783854e-05,
      "loss": 1.3691,
      "num_input_tokens_seen": 29670523440,
      "step": 37712
    },
    {
      "epoch": 4.000954805856143,
      "grad_norm": 0.5363207932647985,
      "learning_rate": 3.753529251952731e-05,
      "loss": 1.3353,
      "num_input_tokens_seen": 29671310144,
      "step": 37713
    },
    {
      "epoch": 4.001060895395714,
      "grad_norm": 0.5672002231191592,
      "learning_rate": 3.753469122152918e-05,
      "loss": 1.2237,
      "num_input_tokens_seen": 29672096848,
      "step": 37714
    },
    {
      "epoch": 4.001166984935286,
      "grad_norm": 0.9294184116398256,
      "learning_rate": 3.753408991384461e-05,
      "loss": 1.4922,
      "num_input_tokens_seen": 29672883568,
      "step": 37715
    },
    {
      "epoch": 4.001273074474857,
      "grad_norm": 0.5328100337568991,
      "learning_rate": 3.7533488596474065e-05,
      "loss": 1.2639,
      "num_input_tokens_seen": 29673670368,
      "step": 37716
    },
    {
      "epoch": 4.001379164014428,
      "grad_norm": 1.145607545452549,
      "learning_rate": 3.7532887269418005e-05,
      "loss": 1.3769,
      "num_input_tokens_seen": 29674457136,
      "step": 37717
    },
    {
      "epoch": 4.001485253554,
      "grad_norm": 0.601701866689245,
      "learning_rate": 3.7532285932676895e-05,
      "loss": 1.4722,
      "num_input_tokens_seen": 29675243904,
      "step": 37718
    },
    {
      "epoch": 4.001591343093571,
      "grad_norm": 0.6927675659694209,
      "learning_rate": 3.75316845862512e-05,
      "loss": 1.2911,
      "num_input_tokens_seen": 29676030672,
      "step": 37719
    },
    {
      "epoch": 4.001697432633143,
      "grad_norm": 0.7347652286841161,
      "learning_rate": 3.75310832301414e-05,
      "loss": 1.2628,
      "num_input_tokens_seen": 29676817488,
      "step": 37720
    },
    {
      "epoch": 4.001803522172714,
      "grad_norm": 0.550483409309823,
      "learning_rate": 3.753048186434793e-05,
      "loss": 1.2641,
      "num_input_tokens_seen": 29677604208,
      "step": 37721
    },
    {
      "epoch": 4.001909611712285,
      "grad_norm": 0.8081723949986659,
      "learning_rate": 3.7529880488871286e-05,
      "loss": 1.3231,
      "num_input_tokens_seen": 29678391056,
      "step": 37722
    },
    {
      "epoch": 4.002015701251857,
      "grad_norm": 0.5489458527753767,
      "learning_rate": 3.752927910371191e-05,
      "loss": 1.3315,
      "num_input_tokens_seen": 29679177856,
      "step": 37723
    },
    {
      "epoch": 4.002121790791428,
      "grad_norm": 0.5857828423091277,
      "learning_rate": 3.7528677708870275e-05,
      "loss": 1.2582,
      "num_input_tokens_seen": 29679964576,
      "step": 37724
    },
    {
      "epoch": 4.002227880331,
      "grad_norm": 0.5236899639866702,
      "learning_rate": 3.752807630434685e-05,
      "loss": 1.2844,
      "num_input_tokens_seen": 29680751424,
      "step": 37725
    },
    {
      "epoch": 4.002333969870571,
      "grad_norm": 0.496424566490757,
      "learning_rate": 3.752747489014209e-05,
      "loss": 1.2508,
      "num_input_tokens_seen": 29681538272,
      "step": 37726
    },
    {
      "epoch": 4.002440059410143,
      "grad_norm": 0.771486220756061,
      "learning_rate": 3.752687346625646e-05,
      "loss": 1.3294,
      "num_input_tokens_seen": 29682325056,
      "step": 37727
    },
    {
      "epoch": 4.002546148949714,
      "grad_norm": 0.6138460141405802,
      "learning_rate": 3.752627203269044e-05,
      "loss": 1.2178,
      "num_input_tokens_seen": 29683111728,
      "step": 37728
    },
    {
      "epoch": 4.002652238489285,
      "grad_norm": 0.5342823842492535,
      "learning_rate": 3.7525670589444485e-05,
      "loss": 1.1578,
      "num_input_tokens_seen": 29683898576,
      "step": 37729
    },
    {
      "epoch": 4.002758328028857,
      "grad_norm": 0.5818886864439752,
      "learning_rate": 3.752506913651905e-05,
      "loss": 1.2545,
      "num_input_tokens_seen": 29684685312,
      "step": 37730
    },
    {
      "epoch": 4.002864417568428,
      "grad_norm": 0.521822229542658,
      "learning_rate": 3.752446767391462e-05,
      "loss": 1.2276,
      "num_input_tokens_seen": 29685472096,
      "step": 37731
    },
    {
      "epoch": 4.0029705071079995,
      "grad_norm": 0.5481616481615178,
      "learning_rate": 3.7523866201631635e-05,
      "loss": 1.1865,
      "num_input_tokens_seen": 29686258864,
      "step": 37732
    },
    {
      "epoch": 4.0030765966475705,
      "grad_norm": 0.7194434492803201,
      "learning_rate": 3.752326471967058e-05,
      "loss": 1.3787,
      "num_input_tokens_seen": 29687045536,
      "step": 37733
    },
    {
      "epoch": 4.003182686187142,
      "grad_norm": 0.5710445196426327,
      "learning_rate": 3.752266322803192e-05,
      "loss": 1.2901,
      "num_input_tokens_seen": 29687832240,
      "step": 37734
    },
    {
      "epoch": 4.0032887757267135,
      "grad_norm": 0.5939497818620096,
      "learning_rate": 3.752206172671611e-05,
      "loss": 1.2507,
      "num_input_tokens_seen": 29688619040,
      "step": 37735
    },
    {
      "epoch": 4.0033948652662845,
      "grad_norm": 0.7006094459682156,
      "learning_rate": 3.752146021572361e-05,
      "loss": 1.3566,
      "num_input_tokens_seen": 29689405888,
      "step": 37736
    },
    {
      "epoch": 4.003500954805856,
      "grad_norm": 0.5023239475685034,
      "learning_rate": 3.752085869505491e-05,
      "loss": 1.2751,
      "num_input_tokens_seen": 29690192720,
      "step": 37737
    },
    {
      "epoch": 4.0036070443454275,
      "grad_norm": 0.5068432646498188,
      "learning_rate": 3.752025716471044e-05,
      "loss": 1.2405,
      "num_input_tokens_seen": 29690979440,
      "step": 37738
    },
    {
      "epoch": 4.0037131338849985,
      "grad_norm": 0.6271339216063769,
      "learning_rate": 3.751965562469069e-05,
      "loss": 1.3813,
      "num_input_tokens_seen": 29691766192,
      "step": 37739
    },
    {
      "epoch": 4.00381922342457,
      "grad_norm": 0.7683297948313962,
      "learning_rate": 3.751905407499612e-05,
      "loss": 1.3009,
      "num_input_tokens_seen": 29692552976,
      "step": 37740
    },
    {
      "epoch": 4.0039253129641414,
      "grad_norm": 0.48270402290178777,
      "learning_rate": 3.751845251562719e-05,
      "loss": 1.3507,
      "num_input_tokens_seen": 29693339712,
      "step": 37741
    },
    {
      "epoch": 4.004031402503713,
      "grad_norm": 0.5656766724271632,
      "learning_rate": 3.751785094658436e-05,
      "loss": 1.4129,
      "num_input_tokens_seen": 29694126496,
      "step": 37742
    },
    {
      "epoch": 4.004137492043284,
      "grad_norm": 0.6740703562479117,
      "learning_rate": 3.751724936786811e-05,
      "loss": 1.2963,
      "num_input_tokens_seen": 29694913232,
      "step": 37743
    },
    {
      "epoch": 4.004243581582856,
      "grad_norm": 0.6160857412825611,
      "learning_rate": 3.75166477794789e-05,
      "loss": 1.3337,
      "num_input_tokens_seen": 29695699984,
      "step": 37744
    },
    {
      "epoch": 4.004349671122427,
      "grad_norm": 0.6271208912704886,
      "learning_rate": 3.751604618141719e-05,
      "loss": 1.2915,
      "num_input_tokens_seen": 29696486768,
      "step": 37745
    },
    {
      "epoch": 4.004455760661998,
      "grad_norm": 0.5063827412823382,
      "learning_rate": 3.7515444573683445e-05,
      "loss": 1.2481,
      "num_input_tokens_seen": 29697273600,
      "step": 37746
    },
    {
      "epoch": 4.00456185020157,
      "grad_norm": 0.566717782445758,
      "learning_rate": 3.751484295627813e-05,
      "loss": 1.2573,
      "num_input_tokens_seen": 29698060320,
      "step": 37747
    },
    {
      "epoch": 4.004667939741141,
      "grad_norm": 0.6736628902986613,
      "learning_rate": 3.7514241329201706e-05,
      "loss": 1.334,
      "num_input_tokens_seen": 29698847008,
      "step": 37748
    },
    {
      "epoch": 4.004774029280713,
      "grad_norm": 0.9040001422663582,
      "learning_rate": 3.751363969245465e-05,
      "loss": 1.3178,
      "num_input_tokens_seen": 29699633808,
      "step": 37749
    },
    {
      "epoch": 4.004880118820284,
      "grad_norm": 0.6847887157247647,
      "learning_rate": 3.751303804603742e-05,
      "loss": 1.2881,
      "num_input_tokens_seen": 29700420528,
      "step": 37750
    },
    {
      "epoch": 4.004986208359855,
      "grad_norm": 0.9247125203357345,
      "learning_rate": 3.7512436389950484e-05,
      "loss": 1.2334,
      "num_input_tokens_seen": 29701207312,
      "step": 37751
    },
    {
      "epoch": 4.005092297899427,
      "grad_norm": 1.010245548243299,
      "learning_rate": 3.751183472419431e-05,
      "loss": 1.4268,
      "num_input_tokens_seen": 29701993952,
      "step": 37752
    },
    {
      "epoch": 4.005198387438998,
      "grad_norm": 0.8748667523106718,
      "learning_rate": 3.751123304876934e-05,
      "loss": 1.2732,
      "num_input_tokens_seen": 29702780704,
      "step": 37753
    },
    {
      "epoch": 4.00530447697857,
      "grad_norm": 1.1052106684814533,
      "learning_rate": 3.751063136367607e-05,
      "loss": 1.2005,
      "num_input_tokens_seen": 29703567440,
      "step": 37754
    },
    {
      "epoch": 4.005410566518141,
      "grad_norm": 0.5336569288229188,
      "learning_rate": 3.751002966891495e-05,
      "loss": 1.3318,
      "num_input_tokens_seen": 29704354128,
      "step": 37755
    },
    {
      "epoch": 4.005516656057713,
      "grad_norm": 1.1809910871555418,
      "learning_rate": 3.7509427964486436e-05,
      "loss": 1.2812,
      "num_input_tokens_seen": 29705140928,
      "step": 37756
    },
    {
      "epoch": 4.005622745597284,
      "grad_norm": 0.7963139529613857,
      "learning_rate": 3.750882625039102e-05,
      "loss": 1.3638,
      "num_input_tokens_seen": 29705927648,
      "step": 37757
    },
    {
      "epoch": 4.005728835136855,
      "grad_norm": 0.7813068287249444,
      "learning_rate": 3.7508224526629135e-05,
      "loss": 1.2402,
      "num_input_tokens_seen": 29706714384,
      "step": 37758
    },
    {
      "epoch": 4.005834924676427,
      "grad_norm": 0.9614959159336789,
      "learning_rate": 3.7507622793201266e-05,
      "loss": 1.2804,
      "num_input_tokens_seen": 29707501120,
      "step": 37759
    },
    {
      "epoch": 4.005941014215998,
      "grad_norm": 0.5171356841230279,
      "learning_rate": 3.750702105010787e-05,
      "loss": 1.3356,
      "num_input_tokens_seen": 29708287856,
      "step": 37760
    },
    {
      "epoch": 4.00604710375557,
      "grad_norm": 0.957420692520544,
      "learning_rate": 3.7506419297349414e-05,
      "loss": 1.2606,
      "num_input_tokens_seen": 29709074656,
      "step": 37761
    },
    {
      "epoch": 4.006153193295141,
      "grad_norm": 0.7813800665767471,
      "learning_rate": 3.7505817534926374e-05,
      "loss": 1.2893,
      "num_input_tokens_seen": 29709861424,
      "step": 37762
    },
    {
      "epoch": 4.006259282834712,
      "grad_norm": 0.6307035643451195,
      "learning_rate": 3.75052157628392e-05,
      "loss": 1.2612,
      "num_input_tokens_seen": 29710648112,
      "step": 37763
    },
    {
      "epoch": 4.006365372374284,
      "grad_norm": 1.142397342064027,
      "learning_rate": 3.750461398108836e-05,
      "loss": 1.2681,
      "num_input_tokens_seen": 29711434960,
      "step": 37764
    },
    {
      "epoch": 4.006471461913855,
      "grad_norm": 0.5168950882794158,
      "learning_rate": 3.7504012189674324e-05,
      "loss": 1.3588,
      "num_input_tokens_seen": 29712221808,
      "step": 37765
    },
    {
      "epoch": 4.006577551453427,
      "grad_norm": 0.7168699845809487,
      "learning_rate": 3.750341038859756e-05,
      "loss": 1.1632,
      "num_input_tokens_seen": 29713008512,
      "step": 37766
    },
    {
      "epoch": 4.006683640992998,
      "grad_norm": 0.8373628713752315,
      "learning_rate": 3.750280857785852e-05,
      "loss": 1.1897,
      "num_input_tokens_seen": 29713795216,
      "step": 37767
    },
    {
      "epoch": 4.00678973053257,
      "grad_norm": 0.6195654357309178,
      "learning_rate": 3.750220675745767e-05,
      "loss": 1.213,
      "num_input_tokens_seen": 29714582160,
      "step": 37768
    },
    {
      "epoch": 4.006895820072141,
      "grad_norm": 1.1670328933988963,
      "learning_rate": 3.7501604927395494e-05,
      "loss": 1.35,
      "num_input_tokens_seen": 29715368864,
      "step": 37769
    },
    {
      "epoch": 4.007001909611712,
      "grad_norm": 0.5515645101159776,
      "learning_rate": 3.750100308767244e-05,
      "loss": 1.296,
      "num_input_tokens_seen": 29716155568,
      "step": 37770
    },
    {
      "epoch": 4.007107999151284,
      "grad_norm": 0.7665384370920575,
      "learning_rate": 3.7500401238288976e-05,
      "loss": 1.4099,
      "num_input_tokens_seen": 29716942368,
      "step": 37771
    },
    {
      "epoch": 4.007214088690855,
      "grad_norm": 0.6010556131011006,
      "learning_rate": 3.749979937924557e-05,
      "loss": 1.4251,
      "num_input_tokens_seen": 29717729072,
      "step": 37772
    },
    {
      "epoch": 4.007320178230427,
      "grad_norm": 0.5152387033636072,
      "learning_rate": 3.7499197510542685e-05,
      "loss": 1.2495,
      "num_input_tokens_seen": 29718515920,
      "step": 37773
    },
    {
      "epoch": 4.007426267769998,
      "grad_norm": 0.7263896858140669,
      "learning_rate": 3.749859563218079e-05,
      "loss": 1.3341,
      "num_input_tokens_seen": 29719302672,
      "step": 37774
    },
    {
      "epoch": 4.007532357309569,
      "grad_norm": 0.4238354730057274,
      "learning_rate": 3.7497993744160335e-05,
      "loss": 1.2047,
      "num_input_tokens_seen": 29720089536,
      "step": 37775
    },
    {
      "epoch": 4.007638446849141,
      "grad_norm": 0.5094939690402129,
      "learning_rate": 3.749739184648181e-05,
      "loss": 1.3448,
      "num_input_tokens_seen": 29720876288,
      "step": 37776
    },
    {
      "epoch": 4.007744536388712,
      "grad_norm": 0.6698041554427908,
      "learning_rate": 3.7496789939145666e-05,
      "loss": 1.3951,
      "num_input_tokens_seen": 29721662992,
      "step": 37777
    },
    {
      "epoch": 4.007850625928284,
      "grad_norm": 0.49298925773120195,
      "learning_rate": 3.749618802215237e-05,
      "loss": 1.2783,
      "num_input_tokens_seen": 29722449744,
      "step": 37778
    },
    {
      "epoch": 4.007956715467855,
      "grad_norm": 0.570886786524582,
      "learning_rate": 3.749558609550238e-05,
      "loss": 1.4047,
      "num_input_tokens_seen": 29723236496,
      "step": 37779
    },
    {
      "epoch": 4.008062805007426,
      "grad_norm": 0.4894184657119668,
      "learning_rate": 3.749498415919617e-05,
      "loss": 1.3159,
      "num_input_tokens_seen": 29724023296,
      "step": 37780
    },
    {
      "epoch": 4.008168894546998,
      "grad_norm": 0.6627674240214202,
      "learning_rate": 3.7494382213234204e-05,
      "loss": 1.3861,
      "num_input_tokens_seen": 29724810096,
      "step": 37781
    },
    {
      "epoch": 4.008274984086569,
      "grad_norm": 0.5347476553353869,
      "learning_rate": 3.749378025761695e-05,
      "loss": 1.2655,
      "num_input_tokens_seen": 29725596880,
      "step": 37782
    },
    {
      "epoch": 4.008381073626141,
      "grad_norm": 0.4814330329345613,
      "learning_rate": 3.7493178292344865e-05,
      "loss": 1.1591,
      "num_input_tokens_seen": 29726383648,
      "step": 37783
    },
    {
      "epoch": 4.008487163165712,
      "grad_norm": 0.6581059956223853,
      "learning_rate": 3.7492576317418416e-05,
      "loss": 1.2728,
      "num_input_tokens_seen": 29727170416,
      "step": 37784
    },
    {
      "epoch": 4.008593252705284,
      "grad_norm": 0.5036456330711059,
      "learning_rate": 3.7491974332838075e-05,
      "loss": 1.281,
      "num_input_tokens_seen": 29727957152,
      "step": 37785
    },
    {
      "epoch": 4.008699342244855,
      "grad_norm": 0.5614699443182907,
      "learning_rate": 3.74913723386043e-05,
      "loss": 1.3139,
      "num_input_tokens_seen": 29728743888,
      "step": 37786
    },
    {
      "epoch": 4.008805431784426,
      "grad_norm": 0.4789148518769393,
      "learning_rate": 3.749077033471756e-05,
      "loss": 1.2242,
      "num_input_tokens_seen": 29729530560,
      "step": 37787
    },
    {
      "epoch": 4.008911521323998,
      "grad_norm": 0.4486458036649472,
      "learning_rate": 3.749016832117832e-05,
      "loss": 1.1832,
      "num_input_tokens_seen": 29730317328,
      "step": 37788
    },
    {
      "epoch": 4.009017610863569,
      "grad_norm": 0.47524519216132194,
      "learning_rate": 3.748956629798705e-05,
      "loss": 1.1326,
      "num_input_tokens_seen": 29731104176,
      "step": 37789
    },
    {
      "epoch": 4.009123700403141,
      "grad_norm": 0.6706609284620958,
      "learning_rate": 3.74889642651442e-05,
      "loss": 1.3736,
      "num_input_tokens_seen": 29731890960,
      "step": 37790
    },
    {
      "epoch": 4.009229789942712,
      "grad_norm": 0.529678187134568,
      "learning_rate": 3.748836222265025e-05,
      "loss": 1.2857,
      "num_input_tokens_seen": 29732677712,
      "step": 37791
    },
    {
      "epoch": 4.009335879482283,
      "grad_norm": 0.6234956548825704,
      "learning_rate": 3.748776017050565e-05,
      "loss": 1.3182,
      "num_input_tokens_seen": 29733464432,
      "step": 37792
    },
    {
      "epoch": 4.009441969021855,
      "grad_norm": 0.481550925840857,
      "learning_rate": 3.748715810871089e-05,
      "loss": 1.3408,
      "num_input_tokens_seen": 29734251200,
      "step": 37793
    },
    {
      "epoch": 4.009548058561426,
      "grad_norm": 0.6921868466626417,
      "learning_rate": 3.748655603726642e-05,
      "loss": 1.4047,
      "num_input_tokens_seen": 29735037840,
      "step": 37794
    },
    {
      "epoch": 4.0096541481009975,
      "grad_norm": 0.5052656983996093,
      "learning_rate": 3.748595395617269e-05,
      "loss": 1.3302,
      "num_input_tokens_seen": 29735824624,
      "step": 37795
    },
    {
      "epoch": 4.0097602376405685,
      "grad_norm": 0.5304114413528341,
      "learning_rate": 3.748535186543019e-05,
      "loss": 1.2693,
      "num_input_tokens_seen": 29736611344,
      "step": 37796
    },
    {
      "epoch": 4.0098663271801405,
      "grad_norm": 0.5074821469695076,
      "learning_rate": 3.748474976503938e-05,
      "loss": 1.3237,
      "num_input_tokens_seen": 29737398032,
      "step": 37797
    },
    {
      "epoch": 4.0099724167197115,
      "grad_norm": 0.5627408442893429,
      "learning_rate": 3.748414765500072e-05,
      "loss": 1.4279,
      "num_input_tokens_seen": 29738184688,
      "step": 37798
    },
    {
      "epoch": 4.0100785062592825,
      "grad_norm": 0.48673574522292995,
      "learning_rate": 3.7483545535314676e-05,
      "loss": 1.297,
      "num_input_tokens_seen": 29738971568,
      "step": 37799
    },
    {
      "epoch": 4.0101845957988544,
      "grad_norm": 0.5193779302550948,
      "learning_rate": 3.748294340598172e-05,
      "loss": 1.2594,
      "num_input_tokens_seen": 29739758432,
      "step": 37800
    },
    {
      "epoch": 4.0102906853384255,
      "grad_norm": 0.6797732863830499,
      "learning_rate": 3.7482341267002306e-05,
      "loss": 1.2662,
      "num_input_tokens_seen": 29740545200,
      "step": 37801
    },
    {
      "epoch": 4.010396774877997,
      "grad_norm": 0.7610996911878319,
      "learning_rate": 3.7481739118376904e-05,
      "loss": 1.3845,
      "num_input_tokens_seen": 29741332000,
      "step": 37802
    },
    {
      "epoch": 4.010502864417568,
      "grad_norm": 0.5514686707028612,
      "learning_rate": 3.748113696010598e-05,
      "loss": 1.2912,
      "num_input_tokens_seen": 29742118752,
      "step": 37803
    },
    {
      "epoch": 4.0106089539571395,
      "grad_norm": 0.8695978667970854,
      "learning_rate": 3.748053479219e-05,
      "loss": 1.3241,
      "num_input_tokens_seen": 29742905536,
      "step": 37804
    },
    {
      "epoch": 4.010715043496711,
      "grad_norm": 0.5589842507803988,
      "learning_rate": 3.747993261462943e-05,
      "loss": 1.2846,
      "num_input_tokens_seen": 29743692336,
      "step": 37805
    },
    {
      "epoch": 4.010821133036282,
      "grad_norm": 0.8148012173789949,
      "learning_rate": 3.747933042742474e-05,
      "loss": 1.3634,
      "num_input_tokens_seen": 29744479136,
      "step": 37806
    },
    {
      "epoch": 4.010927222575854,
      "grad_norm": 0.6860435265826057,
      "learning_rate": 3.7478728230576376e-05,
      "loss": 1.339,
      "num_input_tokens_seen": 29745265872,
      "step": 37807
    },
    {
      "epoch": 4.011033312115425,
      "grad_norm": 0.7114194533477837,
      "learning_rate": 3.747812602408483e-05,
      "loss": 1.3413,
      "num_input_tokens_seen": 29746052704,
      "step": 37808
    },
    {
      "epoch": 4.011139401654996,
      "grad_norm": 0.731341074290468,
      "learning_rate": 3.747752380795055e-05,
      "loss": 1.2836,
      "num_input_tokens_seen": 29746839392,
      "step": 37809
    },
    {
      "epoch": 4.011245491194568,
      "grad_norm": 0.7622117392888736,
      "learning_rate": 3.7476921582174e-05,
      "loss": 1.3466,
      "num_input_tokens_seen": 29747626064,
      "step": 37810
    },
    {
      "epoch": 4.011351580734139,
      "grad_norm": 0.6248724633780173,
      "learning_rate": 3.747631934675566e-05,
      "loss": 1.2515,
      "num_input_tokens_seen": 29748412816,
      "step": 37811
    },
    {
      "epoch": 4.011457670273711,
      "grad_norm": 0.49941904858589936,
      "learning_rate": 3.7475717101695986e-05,
      "loss": 1.3109,
      "num_input_tokens_seen": 29749199504,
      "step": 37812
    },
    {
      "epoch": 4.011563759813282,
      "grad_norm": 0.7368348038902283,
      "learning_rate": 3.7475114846995435e-05,
      "loss": 1.2947,
      "num_input_tokens_seen": 29749986288,
      "step": 37813
    },
    {
      "epoch": 4.011669849352854,
      "grad_norm": 0.4928836472567963,
      "learning_rate": 3.7474512582654484e-05,
      "loss": 1.2581,
      "num_input_tokens_seen": 29750773024,
      "step": 37814
    },
    {
      "epoch": 4.011775938892425,
      "grad_norm": 0.552236723149947,
      "learning_rate": 3.7473910308673607e-05,
      "loss": 1.2042,
      "num_input_tokens_seen": 29751559776,
      "step": 37815
    },
    {
      "epoch": 4.011882028431996,
      "grad_norm": 0.48052893962806925,
      "learning_rate": 3.7473308025053243e-05,
      "loss": 1.2967,
      "num_input_tokens_seen": 29752346640,
      "step": 37816
    },
    {
      "epoch": 4.011988117971568,
      "grad_norm": 0.5719492225493198,
      "learning_rate": 3.7472705731793876e-05,
      "loss": 1.3766,
      "num_input_tokens_seen": 29753133456,
      "step": 37817
    },
    {
      "epoch": 4.012094207511139,
      "grad_norm": 0.5306906830301458,
      "learning_rate": 3.747210342889597e-05,
      "loss": 1.2337,
      "num_input_tokens_seen": 29753920256,
      "step": 37818
    },
    {
      "epoch": 4.012200297050711,
      "grad_norm": 0.6154487831749488,
      "learning_rate": 3.747150111636e-05,
      "loss": 1.3221,
      "num_input_tokens_seen": 29754707040,
      "step": 37819
    },
    {
      "epoch": 4.012306386590282,
      "grad_norm": 0.5811419663831693,
      "learning_rate": 3.74708987941864e-05,
      "loss": 1.2782,
      "num_input_tokens_seen": 29755493824,
      "step": 37820
    },
    {
      "epoch": 4.012412476129853,
      "grad_norm": 0.6168442418874835,
      "learning_rate": 3.7470296462375664e-05,
      "loss": 1.3076,
      "num_input_tokens_seen": 29756280624,
      "step": 37821
    },
    {
      "epoch": 4.012518565669425,
      "grad_norm": 0.49707954732527937,
      "learning_rate": 3.746969412092825e-05,
      "loss": 1.2597,
      "num_input_tokens_seen": 29757067360,
      "step": 37822
    },
    {
      "epoch": 4.012624655208996,
      "grad_norm": 0.5837437904180369,
      "learning_rate": 3.746909176984463e-05,
      "loss": 1.3036,
      "num_input_tokens_seen": 29757854064,
      "step": 37823
    },
    {
      "epoch": 4.012730744748568,
      "grad_norm": 0.533749487597451,
      "learning_rate": 3.7468489409125254e-05,
      "loss": 1.3618,
      "num_input_tokens_seen": 29758640816,
      "step": 37824
    },
    {
      "epoch": 4.012836834288139,
      "grad_norm": 0.6207554624990693,
      "learning_rate": 3.746788703877059e-05,
      "loss": 1.3286,
      "num_input_tokens_seen": 29759427584,
      "step": 37825
    },
    {
      "epoch": 4.012942923827711,
      "grad_norm": 0.5010493681061964,
      "learning_rate": 3.746728465878112e-05,
      "loss": 1.1881,
      "num_input_tokens_seen": 29760214320,
      "step": 37826
    },
    {
      "epoch": 4.013049013367282,
      "grad_norm": 0.5981463410927351,
      "learning_rate": 3.7466682269157285e-05,
      "loss": 1.1837,
      "num_input_tokens_seen": 29761001072,
      "step": 37827
    },
    {
      "epoch": 4.013155102906853,
      "grad_norm": 0.46175592970376605,
      "learning_rate": 3.746607986989957e-05,
      "loss": 1.3088,
      "num_input_tokens_seen": 29761787856,
      "step": 37828
    },
    {
      "epoch": 4.013261192446425,
      "grad_norm": 0.563983957235164,
      "learning_rate": 3.7465477461008435e-05,
      "loss": 1.1633,
      "num_input_tokens_seen": 29762574528,
      "step": 37829
    },
    {
      "epoch": 4.013367281985996,
      "grad_norm": 0.4990101309036777,
      "learning_rate": 3.7464875042484346e-05,
      "loss": 1.2652,
      "num_input_tokens_seen": 29763361360,
      "step": 37830
    },
    {
      "epoch": 4.013473371525568,
      "grad_norm": 0.5543321446700069,
      "learning_rate": 3.7464272614327765e-05,
      "loss": 1.2759,
      "num_input_tokens_seen": 29764148144,
      "step": 37831
    },
    {
      "epoch": 4.013579461065139,
      "grad_norm": 0.5035882584895026,
      "learning_rate": 3.746367017653916e-05,
      "loss": 1.3493,
      "num_input_tokens_seen": 29764934944,
      "step": 37832
    },
    {
      "epoch": 4.01368555060471,
      "grad_norm": 0.5093418832487356,
      "learning_rate": 3.7463067729118995e-05,
      "loss": 1.287,
      "num_input_tokens_seen": 29765721712,
      "step": 37833
    },
    {
      "epoch": 4.013791640144282,
      "grad_norm": 0.5140954721232555,
      "learning_rate": 3.746246527206774e-05,
      "loss": 1.2789,
      "num_input_tokens_seen": 29766508544,
      "step": 37834
    },
    {
      "epoch": 4.013897729683853,
      "grad_norm": 0.5223118465706835,
      "learning_rate": 3.746186280538585e-05,
      "loss": 1.2946,
      "num_input_tokens_seen": 29767295280,
      "step": 37835
    },
    {
      "epoch": 4.014003819223425,
      "grad_norm": 0.590457934927805,
      "learning_rate": 3.746126032907381e-05,
      "loss": 1.3726,
      "num_input_tokens_seen": 29768082016,
      "step": 37836
    },
    {
      "epoch": 4.014109908762996,
      "grad_norm": 0.6111073657682157,
      "learning_rate": 3.746065784313208e-05,
      "loss": 1.2741,
      "num_input_tokens_seen": 29768868880,
      "step": 37837
    },
    {
      "epoch": 4.014215998302568,
      "grad_norm": 0.5047469530078983,
      "learning_rate": 3.74600553475611e-05,
      "loss": 1.2589,
      "num_input_tokens_seen": 29769655648,
      "step": 37838
    },
    {
      "epoch": 4.014322087842139,
      "grad_norm": 0.5133688798480611,
      "learning_rate": 3.745945284236136e-05,
      "loss": 1.3333,
      "num_input_tokens_seen": 29770442368,
      "step": 37839
    },
    {
      "epoch": 4.01442817738171,
      "grad_norm": 0.547322728370674,
      "learning_rate": 3.745885032753332e-05,
      "loss": 1.4521,
      "num_input_tokens_seen": 29771229136,
      "step": 37840
    },
    {
      "epoch": 4.014534266921282,
      "grad_norm": 0.4837882368390743,
      "learning_rate": 3.745824780307745e-05,
      "loss": 1.3051,
      "num_input_tokens_seen": 29772015904,
      "step": 37841
    },
    {
      "epoch": 4.014640356460853,
      "grad_norm": 0.47552547275045515,
      "learning_rate": 3.745764526899421e-05,
      "loss": 1.2229,
      "num_input_tokens_seen": 29772802768,
      "step": 37842
    },
    {
      "epoch": 4.014746446000425,
      "grad_norm": 0.522374524994914,
      "learning_rate": 3.7457042725284076e-05,
      "loss": 1.342,
      "num_input_tokens_seen": 29773589504,
      "step": 37843
    },
    {
      "epoch": 4.014852535539996,
      "grad_norm": 0.7019634717549577,
      "learning_rate": 3.745644017194749e-05,
      "loss": 1.4357,
      "num_input_tokens_seen": 29774376272,
      "step": 37844
    },
    {
      "epoch": 4.014958625079567,
      "grad_norm": 0.5678588132013467,
      "learning_rate": 3.745583760898493e-05,
      "loss": 1.3497,
      "num_input_tokens_seen": 29775163024,
      "step": 37845
    },
    {
      "epoch": 4.015064714619139,
      "grad_norm": 0.5402708510150587,
      "learning_rate": 3.745523503639688e-05,
      "loss": 1.286,
      "num_input_tokens_seen": 29775949728,
      "step": 37846
    },
    {
      "epoch": 4.01517080415871,
      "grad_norm": 0.5745874264777067,
      "learning_rate": 3.745463245418378e-05,
      "loss": 1.365,
      "num_input_tokens_seen": 29776736464,
      "step": 37847
    },
    {
      "epoch": 4.015276893698282,
      "grad_norm": 0.4824352333270647,
      "learning_rate": 3.7454029862346114e-05,
      "loss": 1.2675,
      "num_input_tokens_seen": 29777523296,
      "step": 37848
    },
    {
      "epoch": 4.015382983237853,
      "grad_norm": 0.5588686728350079,
      "learning_rate": 3.7453427260884335e-05,
      "loss": 1.3282,
      "num_input_tokens_seen": 29778310080,
      "step": 37849
    },
    {
      "epoch": 4.015489072777424,
      "grad_norm": 0.6557040750235226,
      "learning_rate": 3.745282464979891e-05,
      "loss": 1.2772,
      "num_input_tokens_seen": 29779096896,
      "step": 37850
    },
    {
      "epoch": 4.015595162316996,
      "grad_norm": 0.8336118076359541,
      "learning_rate": 3.7452222029090304e-05,
      "loss": 1.3934,
      "num_input_tokens_seen": 29779883696,
      "step": 37851
    },
    {
      "epoch": 4.015701251856567,
      "grad_norm": 0.589359748712276,
      "learning_rate": 3.7451619398759e-05,
      "loss": 1.2222,
      "num_input_tokens_seen": 29780670592,
      "step": 37852
    },
    {
      "epoch": 4.015807341396139,
      "grad_norm": 0.5469272118612878,
      "learning_rate": 3.7451016758805435e-05,
      "loss": 1.401,
      "num_input_tokens_seen": 29781457424,
      "step": 37853
    },
    {
      "epoch": 4.01591343093571,
      "grad_norm": 0.5653532142031502,
      "learning_rate": 3.74504141092301e-05,
      "loss": 1.3312,
      "num_input_tokens_seen": 29782244112,
      "step": 37854
    },
    {
      "epoch": 4.0160195204752815,
      "grad_norm": 0.5182657826033845,
      "learning_rate": 3.744981145003345e-05,
      "loss": 1.2604,
      "num_input_tokens_seen": 29783030864,
      "step": 37855
    },
    {
      "epoch": 4.016125610014853,
      "grad_norm": 0.6069938944900114,
      "learning_rate": 3.744920878121594e-05,
      "loss": 1.2155,
      "num_input_tokens_seen": 29783817568,
      "step": 37856
    },
    {
      "epoch": 4.016231699554424,
      "grad_norm": 0.5401949049485443,
      "learning_rate": 3.744860610277806e-05,
      "loss": 1.3095,
      "num_input_tokens_seen": 29784604336,
      "step": 37857
    },
    {
      "epoch": 4.0163377890939955,
      "grad_norm": 0.5302659847318419,
      "learning_rate": 3.744800341472025e-05,
      "loss": 1.2894,
      "num_input_tokens_seen": 29785391088,
      "step": 37858
    },
    {
      "epoch": 4.0164438786335666,
      "grad_norm": 0.5250415533504431,
      "learning_rate": 3.744740071704299e-05,
      "loss": 1.3104,
      "num_input_tokens_seen": 29786177904,
      "step": 37859
    },
    {
      "epoch": 4.0165499681731385,
      "grad_norm": 0.4791072306555418,
      "learning_rate": 3.744679800974675e-05,
      "loss": 1.2639,
      "num_input_tokens_seen": 29786964688,
      "step": 37860
    },
    {
      "epoch": 4.0166560577127095,
      "grad_norm": 0.5465778182928602,
      "learning_rate": 3.7446195292831996e-05,
      "loss": 1.2525,
      "num_input_tokens_seen": 29787751392,
      "step": 37861
    },
    {
      "epoch": 4.0167621472522805,
      "grad_norm": 0.5482592488009902,
      "learning_rate": 3.744559256629917e-05,
      "loss": 1.3474,
      "num_input_tokens_seen": 29788538160,
      "step": 37862
    },
    {
      "epoch": 4.0168682367918525,
      "grad_norm": 0.5186797683026096,
      "learning_rate": 3.744498983014877e-05,
      "loss": 1.2505,
      "num_input_tokens_seen": 29789324960,
      "step": 37863
    },
    {
      "epoch": 4.0169743263314235,
      "grad_norm": 0.6820787083118991,
      "learning_rate": 3.744438708438124e-05,
      "loss": 1.2994,
      "num_input_tokens_seen": 29790111648,
      "step": 37864
    },
    {
      "epoch": 4.017080415870995,
      "grad_norm": 0.6419697320170586,
      "learning_rate": 3.7443784328997055e-05,
      "loss": 1.2932,
      "num_input_tokens_seen": 29790898528,
      "step": 37865
    },
    {
      "epoch": 4.017186505410566,
      "grad_norm": 0.6523575145814722,
      "learning_rate": 3.744318156399667e-05,
      "loss": 1.3803,
      "num_input_tokens_seen": 29791685344,
      "step": 37866
    },
    {
      "epoch": 4.017292594950138,
      "grad_norm": 0.5451696630492676,
      "learning_rate": 3.744257878938057e-05,
      "loss": 1.3043,
      "num_input_tokens_seen": 29792472096,
      "step": 37867
    },
    {
      "epoch": 4.017398684489709,
      "grad_norm": 0.5035177913912839,
      "learning_rate": 3.7441976005149214e-05,
      "loss": 1.2064,
      "num_input_tokens_seen": 29793258896,
      "step": 37868
    },
    {
      "epoch": 4.01750477402928,
      "grad_norm": 0.6553704711831922,
      "learning_rate": 3.744137321130306e-05,
      "loss": 1.4002,
      "num_input_tokens_seen": 29794045632,
      "step": 37869
    },
    {
      "epoch": 4.017610863568852,
      "grad_norm": 0.48903992507371735,
      "learning_rate": 3.7440770407842577e-05,
      "loss": 1.3035,
      "num_input_tokens_seen": 29794832352,
      "step": 37870
    },
    {
      "epoch": 4.017716953108423,
      "grad_norm": 0.6706419042289151,
      "learning_rate": 3.744016759476823e-05,
      "loss": 1.3555,
      "num_input_tokens_seen": 29795619104,
      "step": 37871
    },
    {
      "epoch": 4.017823042647995,
      "grad_norm": 0.5272394427551765,
      "learning_rate": 3.743956477208048e-05,
      "loss": 1.426,
      "num_input_tokens_seen": 29796405840,
      "step": 37872
    },
    {
      "epoch": 4.017929132187566,
      "grad_norm": 0.6443639348066206,
      "learning_rate": 3.743896193977981e-05,
      "loss": 1.3783,
      "num_input_tokens_seen": 29797192512,
      "step": 37873
    },
    {
      "epoch": 4.018035221727137,
      "grad_norm": 0.5652115592264029,
      "learning_rate": 3.743835909786667e-05,
      "loss": 1.4112,
      "num_input_tokens_seen": 29797979264,
      "step": 37874
    },
    {
      "epoch": 4.018141311266709,
      "grad_norm": 0.48450735561647285,
      "learning_rate": 3.743775624634154e-05,
      "loss": 1.3,
      "num_input_tokens_seen": 29798766032,
      "step": 37875
    },
    {
      "epoch": 4.01824740080628,
      "grad_norm": 0.5275103400535589,
      "learning_rate": 3.743715338520486e-05,
      "loss": 1.3505,
      "num_input_tokens_seen": 29799552832,
      "step": 37876
    },
    {
      "epoch": 4.018353490345852,
      "grad_norm": 0.5097781330622523,
      "learning_rate": 3.7436550514457126e-05,
      "loss": 1.2969,
      "num_input_tokens_seen": 29800339600,
      "step": 37877
    },
    {
      "epoch": 4.018459579885423,
      "grad_norm": 0.5756712952805053,
      "learning_rate": 3.7435947634098785e-05,
      "loss": 1.4514,
      "num_input_tokens_seen": 29801126256,
      "step": 37878
    },
    {
      "epoch": 4.018565669424994,
      "grad_norm": 0.713815418099429,
      "learning_rate": 3.743534474413031e-05,
      "loss": 1.4136,
      "num_input_tokens_seen": 29801913024,
      "step": 37879
    },
    {
      "epoch": 4.018671758964566,
      "grad_norm": 0.632396672729433,
      "learning_rate": 3.7434741844552165e-05,
      "loss": 1.2978,
      "num_input_tokens_seen": 29802699792,
      "step": 37880
    },
    {
      "epoch": 4.018777848504137,
      "grad_norm": 0.5108303634104742,
      "learning_rate": 3.7434138935364814e-05,
      "loss": 1.2983,
      "num_input_tokens_seen": 29803486544,
      "step": 37881
    },
    {
      "epoch": 4.018883938043709,
      "grad_norm": 0.4833202365015594,
      "learning_rate": 3.7433536016568735e-05,
      "loss": 1.2713,
      "num_input_tokens_seen": 29804273280,
      "step": 37882
    },
    {
      "epoch": 4.01899002758328,
      "grad_norm": 0.525292409445813,
      "learning_rate": 3.743293308816438e-05,
      "loss": 1.3363,
      "num_input_tokens_seen": 29805060064,
      "step": 37883
    },
    {
      "epoch": 4.019096117122852,
      "grad_norm": 0.5019905587299558,
      "learning_rate": 3.743233015015221e-05,
      "loss": 1.255,
      "num_input_tokens_seen": 29805846752,
      "step": 37884
    },
    {
      "epoch": 4.019202206662423,
      "grad_norm": 0.4648227190606743,
      "learning_rate": 3.743172720253271e-05,
      "loss": 1.2984,
      "num_input_tokens_seen": 29806633536,
      "step": 37885
    },
    {
      "epoch": 4.019308296201994,
      "grad_norm": 0.570863323229307,
      "learning_rate": 3.743112424530633e-05,
      "loss": 1.24,
      "num_input_tokens_seen": 29807420336,
      "step": 37886
    },
    {
      "epoch": 4.019414385741566,
      "grad_norm": 0.4661549690087646,
      "learning_rate": 3.7430521278473544e-05,
      "loss": 1.254,
      "num_input_tokens_seen": 29808207168,
      "step": 37887
    },
    {
      "epoch": 4.019520475281137,
      "grad_norm": 0.46478064010076797,
      "learning_rate": 3.742991830203481e-05,
      "loss": 1.2604,
      "num_input_tokens_seen": 29808993920,
      "step": 37888
    },
    {
      "epoch": 4.019626564820709,
      "grad_norm": 0.4581992116371751,
      "learning_rate": 3.742931531599061e-05,
      "loss": 1.2021,
      "num_input_tokens_seen": 29809780624,
      "step": 37889
    },
    {
      "epoch": 4.01973265436028,
      "grad_norm": 0.4651049887966755,
      "learning_rate": 3.74287123203414e-05,
      "loss": 1.1811,
      "num_input_tokens_seen": 29810567392,
      "step": 37890
    },
    {
      "epoch": 4.019838743899851,
      "grad_norm": 0.49036873552720023,
      "learning_rate": 3.7428109315087637e-05,
      "loss": 1.2802,
      "num_input_tokens_seen": 29811354080,
      "step": 37891
    },
    {
      "epoch": 4.019944833439423,
      "grad_norm": 0.46715862564011995,
      "learning_rate": 3.74275063002298e-05,
      "loss": 1.352,
      "num_input_tokens_seen": 29812140864,
      "step": 37892
    },
    {
      "epoch": 4.020050922978994,
      "grad_norm": 0.48074327657350746,
      "learning_rate": 3.7426903275768355e-05,
      "loss": 1.2429,
      "num_input_tokens_seen": 29812927664,
      "step": 37893
    },
    {
      "epoch": 4.020157012518566,
      "grad_norm": 0.4840910963042216,
      "learning_rate": 3.742630024170376e-05,
      "loss": 1.3824,
      "num_input_tokens_seen": 29813714416,
      "step": 37894
    },
    {
      "epoch": 4.020263102058137,
      "grad_norm": 0.4458035886783403,
      "learning_rate": 3.742569719803649e-05,
      "loss": 1.212,
      "num_input_tokens_seen": 29814501184,
      "step": 37895
    },
    {
      "epoch": 4.020369191597709,
      "grad_norm": 0.6457037565124216,
      "learning_rate": 3.742509414476699e-05,
      "loss": 1.2484,
      "num_input_tokens_seen": 29815287904,
      "step": 37896
    },
    {
      "epoch": 4.02047528113728,
      "grad_norm": 0.4739101448280088,
      "learning_rate": 3.742449108189576e-05,
      "loss": 1.2567,
      "num_input_tokens_seen": 29816074640,
      "step": 37897
    },
    {
      "epoch": 4.020581370676851,
      "grad_norm": 0.9134325511833852,
      "learning_rate": 3.742388800942324e-05,
      "loss": 1.342,
      "num_input_tokens_seen": 29816861280,
      "step": 37898
    },
    {
      "epoch": 4.020687460216423,
      "grad_norm": 0.4927887754902166,
      "learning_rate": 3.74232849273499e-05,
      "loss": 1.2549,
      "num_input_tokens_seen": 29817648048,
      "step": 37899
    },
    {
      "epoch": 4.020793549755994,
      "grad_norm": 0.8794987191885424,
      "learning_rate": 3.742268183567622e-05,
      "loss": 1.2481,
      "num_input_tokens_seen": 29818434768,
      "step": 37900
    },
    {
      "epoch": 4.020899639295566,
      "grad_norm": 0.7469639907851761,
      "learning_rate": 3.742207873440265e-05,
      "loss": 1.3324,
      "num_input_tokens_seen": 29819221616,
      "step": 37901
    },
    {
      "epoch": 4.021005728835137,
      "grad_norm": 1.3560953374146327,
      "learning_rate": 3.742147562352966e-05,
      "loss": 1.3863,
      "num_input_tokens_seen": 29820008320,
      "step": 37902
    },
    {
      "epoch": 4.021111818374708,
      "grad_norm": 0.7227262763873713,
      "learning_rate": 3.742087250305772e-05,
      "loss": 1.3027,
      "num_input_tokens_seen": 29820794992,
      "step": 37903
    },
    {
      "epoch": 4.02121790791428,
      "grad_norm": 0.6358798335120658,
      "learning_rate": 3.74202693729873e-05,
      "loss": 1.3241,
      "num_input_tokens_seen": 29821581824,
      "step": 37904
    },
    {
      "epoch": 4.021323997453851,
      "grad_norm": 0.8223431134317378,
      "learning_rate": 3.741966623331885e-05,
      "loss": 1.2727,
      "num_input_tokens_seen": 29822368608,
      "step": 37905
    },
    {
      "epoch": 4.021430086993423,
      "grad_norm": 0.571801021100268,
      "learning_rate": 3.741906308405285e-05,
      "loss": 1.2664,
      "num_input_tokens_seen": 29823155424,
      "step": 37906
    },
    {
      "epoch": 4.021536176532994,
      "grad_norm": 0.6520239707970507,
      "learning_rate": 3.7418459925189764e-05,
      "loss": 1.3283,
      "num_input_tokens_seen": 29823942208,
      "step": 37907
    },
    {
      "epoch": 4.021642266072565,
      "grad_norm": 0.9289706015774983,
      "learning_rate": 3.741785675673006e-05,
      "loss": 1.4258,
      "num_input_tokens_seen": 29824728992,
      "step": 37908
    },
    {
      "epoch": 4.021748355612137,
      "grad_norm": 0.44333733838432055,
      "learning_rate": 3.74172535786742e-05,
      "loss": 1.1715,
      "num_input_tokens_seen": 29825515696,
      "step": 37909
    },
    {
      "epoch": 4.021854445151708,
      "grad_norm": 0.8314252762018812,
      "learning_rate": 3.7416650391022643e-05,
      "loss": 1.2227,
      "num_input_tokens_seen": 29826302480,
      "step": 37910
    },
    {
      "epoch": 4.02196053469128,
      "grad_norm": 0.870939131724273,
      "learning_rate": 3.7416047193775874e-05,
      "loss": 1.3141,
      "num_input_tokens_seen": 29827089232,
      "step": 37911
    },
    {
      "epoch": 4.022066624230851,
      "grad_norm": 0.6411037298071249,
      "learning_rate": 3.741544398693434e-05,
      "loss": 1.3032,
      "num_input_tokens_seen": 29827875952,
      "step": 37912
    },
    {
      "epoch": 4.022172713770423,
      "grad_norm": 1.0863542116711975,
      "learning_rate": 3.741484077049851e-05,
      "loss": 1.2341,
      "num_input_tokens_seen": 29828662752,
      "step": 37913
    },
    {
      "epoch": 4.022278803309994,
      "grad_norm": 0.5841180938032994,
      "learning_rate": 3.741423754446887e-05,
      "loss": 1.3579,
      "num_input_tokens_seen": 29829449424,
      "step": 37914
    },
    {
      "epoch": 4.022384892849565,
      "grad_norm": 0.8872129845103413,
      "learning_rate": 3.741363430884586e-05,
      "loss": 1.2147,
      "num_input_tokens_seen": 29830236112,
      "step": 37915
    },
    {
      "epoch": 4.022490982389137,
      "grad_norm": 0.872308118243988,
      "learning_rate": 3.741303106362996e-05,
      "loss": 1.24,
      "num_input_tokens_seen": 29831022880,
      "step": 37916
    },
    {
      "epoch": 4.022597071928708,
      "grad_norm": 0.6687077891685352,
      "learning_rate": 3.741242780882164e-05,
      "loss": 1.3667,
      "num_input_tokens_seen": 29831809632,
      "step": 37917
    },
    {
      "epoch": 4.0227031614682796,
      "grad_norm": 0.8692077685056319,
      "learning_rate": 3.741182454442135e-05,
      "loss": 1.2338,
      "num_input_tokens_seen": 29832596400,
      "step": 37918
    },
    {
      "epoch": 4.022809251007851,
      "grad_norm": 0.5570615757509193,
      "learning_rate": 3.7411221270429576e-05,
      "loss": 1.2003,
      "num_input_tokens_seen": 29833383136,
      "step": 37919
    },
    {
      "epoch": 4.022915340547422,
      "grad_norm": 0.7544851184721025,
      "learning_rate": 3.741061798684677e-05,
      "loss": 1.2882,
      "num_input_tokens_seen": 29834169936,
      "step": 37920
    },
    {
      "epoch": 4.0230214300869935,
      "grad_norm": 0.6667305549534034,
      "learning_rate": 3.74100146936734e-05,
      "loss": 1.3367,
      "num_input_tokens_seen": 29834956736,
      "step": 37921
    },
    {
      "epoch": 4.023127519626565,
      "grad_norm": 0.804825914686749,
      "learning_rate": 3.740941139090993e-05,
      "loss": 1.3335,
      "num_input_tokens_seen": 29835743584,
      "step": 37922
    },
    {
      "epoch": 4.0232336091661365,
      "grad_norm": 0.5504629761322757,
      "learning_rate": 3.7408808078556846e-05,
      "loss": 1.2463,
      "num_input_tokens_seen": 29836530352,
      "step": 37923
    },
    {
      "epoch": 4.0233396987057075,
      "grad_norm": 0.709717212443351,
      "learning_rate": 3.740820475661458e-05,
      "loss": 1.3844,
      "num_input_tokens_seen": 29837317072,
      "step": 37924
    },
    {
      "epoch": 4.023445788245279,
      "grad_norm": 0.4837086425104888,
      "learning_rate": 3.740760142508364e-05,
      "loss": 1.2772,
      "num_input_tokens_seen": 29838103808,
      "step": 37925
    },
    {
      "epoch": 4.0235518777848505,
      "grad_norm": 0.5708453720814268,
      "learning_rate": 3.7406998083964456e-05,
      "loss": 1.2719,
      "num_input_tokens_seen": 29838890544,
      "step": 37926
    },
    {
      "epoch": 4.0236579673244215,
      "grad_norm": 0.6572223685402289,
      "learning_rate": 3.740639473325751e-05,
      "loss": 1.3143,
      "num_input_tokens_seen": 29839677232,
      "step": 37927
    },
    {
      "epoch": 4.023764056863993,
      "grad_norm": 0.5292174654153988,
      "learning_rate": 3.7405791372963266e-05,
      "loss": 1.3318,
      "num_input_tokens_seen": 29840463984,
      "step": 37928
    },
    {
      "epoch": 4.023870146403564,
      "grad_norm": 0.5311190469744473,
      "learning_rate": 3.740518800308219e-05,
      "loss": 1.2256,
      "num_input_tokens_seen": 29841250816,
      "step": 37929
    },
    {
      "epoch": 4.023976235943136,
      "grad_norm": 0.5839654958028845,
      "learning_rate": 3.740458462361475e-05,
      "loss": 1.2253,
      "num_input_tokens_seen": 29842037584,
      "step": 37930
    },
    {
      "epoch": 4.024082325482707,
      "grad_norm": 0.49820719087020643,
      "learning_rate": 3.740398123456141e-05,
      "loss": 1.3382,
      "num_input_tokens_seen": 29842824352,
      "step": 37931
    },
    {
      "epoch": 4.024188415022278,
      "grad_norm": 0.6119634654776982,
      "learning_rate": 3.7403377835922645e-05,
      "loss": 1.3154,
      "num_input_tokens_seen": 29843611168,
      "step": 37932
    },
    {
      "epoch": 4.02429450456185,
      "grad_norm": 0.5744448145463598,
      "learning_rate": 3.74027744276989e-05,
      "loss": 1.3635,
      "num_input_tokens_seen": 29844397952,
      "step": 37933
    },
    {
      "epoch": 4.024400594101421,
      "grad_norm": 0.5227108645660756,
      "learning_rate": 3.740217100989066e-05,
      "loss": 1.2922,
      "num_input_tokens_seen": 29845184752,
      "step": 37934
    },
    {
      "epoch": 4.024506683640993,
      "grad_norm": 0.4585444482191682,
      "learning_rate": 3.740156758249839e-05,
      "loss": 1.3255,
      "num_input_tokens_seen": 29845971440,
      "step": 37935
    },
    {
      "epoch": 4.024612773180564,
      "grad_norm": 0.4455337950775999,
      "learning_rate": 3.740096414552255e-05,
      "loss": 1.3162,
      "num_input_tokens_seen": 29846758048,
      "step": 37936
    },
    {
      "epoch": 4.024718862720136,
      "grad_norm": 0.5113134879017387,
      "learning_rate": 3.740036069896361e-05,
      "loss": 1.2643,
      "num_input_tokens_seen": 29847544832,
      "step": 37937
    },
    {
      "epoch": 4.024824952259707,
      "grad_norm": 0.5859477833402377,
      "learning_rate": 3.739975724282203e-05,
      "loss": 1.3888,
      "num_input_tokens_seen": 29848331424,
      "step": 37938
    },
    {
      "epoch": 4.024931041799278,
      "grad_norm": 0.5297115271972112,
      "learning_rate": 3.7399153777098286e-05,
      "loss": 1.2623,
      "num_input_tokens_seen": 29849118160,
      "step": 37939
    },
    {
      "epoch": 4.02503713133885,
      "grad_norm": 0.5496414604450944,
      "learning_rate": 3.739855030179283e-05,
      "loss": 1.3553,
      "num_input_tokens_seen": 29849905040,
      "step": 37940
    },
    {
      "epoch": 4.025143220878421,
      "grad_norm": 0.5396271438068646,
      "learning_rate": 3.7397946816906156e-05,
      "loss": 1.2299,
      "num_input_tokens_seen": 29850691808,
      "step": 37941
    },
    {
      "epoch": 4.025249310417993,
      "grad_norm": 0.5714921499118617,
      "learning_rate": 3.7397343322438697e-05,
      "loss": 1.3699,
      "num_input_tokens_seen": 29851478560,
      "step": 37942
    },
    {
      "epoch": 4.025355399957564,
      "grad_norm": 0.4954440949719848,
      "learning_rate": 3.739673981839095e-05,
      "loss": 1.3063,
      "num_input_tokens_seen": 29852265328,
      "step": 37943
    },
    {
      "epoch": 4.025461489497135,
      "grad_norm": 0.5653373266116839,
      "learning_rate": 3.7396136304763353e-05,
      "loss": 1.2041,
      "num_input_tokens_seen": 29853052144,
      "step": 37944
    },
    {
      "epoch": 4.025567579036707,
      "grad_norm": 0.542656738816545,
      "learning_rate": 3.7395532781556384e-05,
      "loss": 1.3053,
      "num_input_tokens_seen": 29853838928,
      "step": 37945
    },
    {
      "epoch": 4.025673668576278,
      "grad_norm": 0.5089463033885276,
      "learning_rate": 3.739492924877052e-05,
      "loss": 1.3304,
      "num_input_tokens_seen": 29854625584,
      "step": 37946
    },
    {
      "epoch": 4.02577975811585,
      "grad_norm": 0.5846322607661805,
      "learning_rate": 3.739432570640622e-05,
      "loss": 1.2798,
      "num_input_tokens_seen": 29855412336,
      "step": 37947
    },
    {
      "epoch": 4.025885847655421,
      "grad_norm": 0.7408812158629963,
      "learning_rate": 3.739372215446394e-05,
      "loss": 1.4375,
      "num_input_tokens_seen": 29856199024,
      "step": 37948
    },
    {
      "epoch": 4.025991937194992,
      "grad_norm": 0.5561119205311543,
      "learning_rate": 3.7393118592944166e-05,
      "loss": 1.2253,
      "num_input_tokens_seen": 29856985808,
      "step": 37949
    },
    {
      "epoch": 4.026098026734564,
      "grad_norm": 0.6731144342170676,
      "learning_rate": 3.7392515021847344e-05,
      "loss": 1.2153,
      "num_input_tokens_seen": 29857772608,
      "step": 37950
    },
    {
      "epoch": 4.026204116274135,
      "grad_norm": 0.6424634449171015,
      "learning_rate": 3.739191144117395e-05,
      "loss": 1.3815,
      "num_input_tokens_seen": 29858559344,
      "step": 37951
    },
    {
      "epoch": 4.026310205813707,
      "grad_norm": 0.541600137137836,
      "learning_rate": 3.7391307850924455e-05,
      "loss": 1.2966,
      "num_input_tokens_seen": 29859346032,
      "step": 37952
    },
    {
      "epoch": 4.026416295353278,
      "grad_norm": 0.5327523376037757,
      "learning_rate": 3.739070425109932e-05,
      "loss": 1.2577,
      "num_input_tokens_seen": 29860132928,
      "step": 37953
    },
    {
      "epoch": 4.02652238489285,
      "grad_norm": 0.5415384533806586,
      "learning_rate": 3.739010064169901e-05,
      "loss": 1.191,
      "num_input_tokens_seen": 29860919744,
      "step": 37954
    },
    {
      "epoch": 4.026628474432421,
      "grad_norm": 0.5309765269589044,
      "learning_rate": 3.7389497022723993e-05,
      "loss": 1.2143,
      "num_input_tokens_seen": 29861706544,
      "step": 37955
    },
    {
      "epoch": 4.026734563971992,
      "grad_norm": 0.6435916015151509,
      "learning_rate": 3.738889339417474e-05,
      "loss": 1.4132,
      "num_input_tokens_seen": 29862493312,
      "step": 37956
    },
    {
      "epoch": 4.026840653511564,
      "grad_norm": 0.6167784409221764,
      "learning_rate": 3.7388289756051714e-05,
      "loss": 1.3168,
      "num_input_tokens_seen": 29863280080,
      "step": 37957
    },
    {
      "epoch": 4.026946743051135,
      "grad_norm": 0.5126747137543636,
      "learning_rate": 3.738768610835538e-05,
      "loss": 1.1391,
      "num_input_tokens_seen": 29864066880,
      "step": 37958
    },
    {
      "epoch": 4.027052832590707,
      "grad_norm": 0.5350605503584629,
      "learning_rate": 3.73870824510862e-05,
      "loss": 1.3205,
      "num_input_tokens_seen": 29864853664,
      "step": 37959
    },
    {
      "epoch": 4.027158922130278,
      "grad_norm": 0.5492426490464797,
      "learning_rate": 3.738647878424466e-05,
      "loss": 1.2845,
      "num_input_tokens_seen": 29865640512,
      "step": 37960
    },
    {
      "epoch": 4.027265011669849,
      "grad_norm": 0.6088897926871696,
      "learning_rate": 3.7385875107831206e-05,
      "loss": 1.2558,
      "num_input_tokens_seen": 29866427296,
      "step": 37961
    },
    {
      "epoch": 4.027371101209421,
      "grad_norm": 0.594512361264541,
      "learning_rate": 3.7385271421846304e-05,
      "loss": 1.29,
      "num_input_tokens_seen": 29867214080,
      "step": 37962
    },
    {
      "epoch": 4.027477190748992,
      "grad_norm": 0.6690490347466679,
      "learning_rate": 3.738466772629043e-05,
      "loss": 1.351,
      "num_input_tokens_seen": 29868000800,
      "step": 37963
    },
    {
      "epoch": 4.027583280288564,
      "grad_norm": 0.49157699058400606,
      "learning_rate": 3.7384064021164055e-05,
      "loss": 1.2883,
      "num_input_tokens_seen": 29868787472,
      "step": 37964
    },
    {
      "epoch": 4.027689369828135,
      "grad_norm": 0.7528108302180767,
      "learning_rate": 3.738346030646763e-05,
      "loss": 1.3031,
      "num_input_tokens_seen": 29869574256,
      "step": 37965
    },
    {
      "epoch": 4.027795459367707,
      "grad_norm": 0.4751965597726732,
      "learning_rate": 3.738285658220164e-05,
      "loss": 1.2498,
      "num_input_tokens_seen": 29870361104,
      "step": 37966
    },
    {
      "epoch": 4.027901548907278,
      "grad_norm": 0.6010572918490853,
      "learning_rate": 3.7382252848366534e-05,
      "loss": 1.2921,
      "num_input_tokens_seen": 29871147968,
      "step": 37967
    },
    {
      "epoch": 4.028007638446849,
      "grad_norm": 0.7157634100002876,
      "learning_rate": 3.7381649104962793e-05,
      "loss": 1.3543,
      "num_input_tokens_seen": 29871934736,
      "step": 37968
    },
    {
      "epoch": 4.028113727986421,
      "grad_norm": 0.5541923893171127,
      "learning_rate": 3.7381045351990873e-05,
      "loss": 1.3078,
      "num_input_tokens_seen": 29872721552,
      "step": 37969
    },
    {
      "epoch": 4.028219817525992,
      "grad_norm": 0.5838725132230211,
      "learning_rate": 3.7380441589451235e-05,
      "loss": 1.2805,
      "num_input_tokens_seen": 29873508368,
      "step": 37970
    },
    {
      "epoch": 4.028325907065564,
      "grad_norm": 0.6058749776767005,
      "learning_rate": 3.737983781734437e-05,
      "loss": 1.4234,
      "num_input_tokens_seen": 29874295024,
      "step": 37971
    },
    {
      "epoch": 4.028431996605135,
      "grad_norm": 0.6623332747011106,
      "learning_rate": 3.737923403567072e-05,
      "loss": 1.4656,
      "num_input_tokens_seen": 29875081680,
      "step": 37972
    },
    {
      "epoch": 4.028538086144706,
      "grad_norm": 0.6620310659819459,
      "learning_rate": 3.737863024443077e-05,
      "loss": 1.3142,
      "num_input_tokens_seen": 29875868400,
      "step": 37973
    },
    {
      "epoch": 4.028644175684278,
      "grad_norm": 0.4916673972469665,
      "learning_rate": 3.7378026443624966e-05,
      "loss": 1.285,
      "num_input_tokens_seen": 29876655120,
      "step": 37974
    },
    {
      "epoch": 4.028750265223849,
      "grad_norm": 0.6312344786370676,
      "learning_rate": 3.73774226332538e-05,
      "loss": 1.3683,
      "num_input_tokens_seen": 29877441824,
      "step": 37975
    },
    {
      "epoch": 4.028856354763421,
      "grad_norm": 0.5217403262310152,
      "learning_rate": 3.7376818813317716e-05,
      "loss": 1.4026,
      "num_input_tokens_seen": 29878228464,
      "step": 37976
    },
    {
      "epoch": 4.028962444302992,
      "grad_norm": 0.5541834581759242,
      "learning_rate": 3.7376214983817196e-05,
      "loss": 1.2696,
      "num_input_tokens_seen": 29879015184,
      "step": 37977
    },
    {
      "epoch": 4.029068533842563,
      "grad_norm": 0.5265729479110384,
      "learning_rate": 3.737561114475269e-05,
      "loss": 1.3685,
      "num_input_tokens_seen": 29879801904,
      "step": 37978
    },
    {
      "epoch": 4.029174623382135,
      "grad_norm": 0.5057382566213555,
      "learning_rate": 3.737500729612468e-05,
      "loss": 1.2059,
      "num_input_tokens_seen": 29880588720,
      "step": 37979
    },
    {
      "epoch": 4.029280712921706,
      "grad_norm": 0.4607981484692571,
      "learning_rate": 3.737440343793363e-05,
      "loss": 1.2727,
      "num_input_tokens_seen": 29881375520,
      "step": 37980
    },
    {
      "epoch": 4.029386802461278,
      "grad_norm": 0.5034700248101298,
      "learning_rate": 3.737379957018e-05,
      "loss": 1.3134,
      "num_input_tokens_seen": 29882162208,
      "step": 37981
    },
    {
      "epoch": 4.029492892000849,
      "grad_norm": 0.5419045722296495,
      "learning_rate": 3.737319569286427e-05,
      "loss": 1.344,
      "num_input_tokens_seen": 29882949040,
      "step": 37982
    },
    {
      "epoch": 4.0295989815404205,
      "grad_norm": 0.5096447621590139,
      "learning_rate": 3.737259180598689e-05,
      "loss": 1.2936,
      "num_input_tokens_seen": 29883735824,
      "step": 37983
    },
    {
      "epoch": 4.0297050710799915,
      "grad_norm": 0.502507228379848,
      "learning_rate": 3.737198790954833e-05,
      "loss": 1.2493,
      "num_input_tokens_seen": 29884522592,
      "step": 37984
    },
    {
      "epoch": 4.029811160619563,
      "grad_norm": 0.5110256855682391,
      "learning_rate": 3.7371384003549064e-05,
      "loss": 1.3129,
      "num_input_tokens_seen": 29885309200,
      "step": 37985
    },
    {
      "epoch": 4.0299172501591345,
      "grad_norm": 0.5509857738031847,
      "learning_rate": 3.7370780087989556e-05,
      "loss": 1.3403,
      "num_input_tokens_seen": 29886095968,
      "step": 37986
    },
    {
      "epoch": 4.0300233396987055,
      "grad_norm": 0.502413671345256,
      "learning_rate": 3.737017616287027e-05,
      "loss": 1.2886,
      "num_input_tokens_seen": 29886882784,
      "step": 37987
    },
    {
      "epoch": 4.030129429238277,
      "grad_norm": 0.5078037822346911,
      "learning_rate": 3.736957222819168e-05,
      "loss": 1.3919,
      "num_input_tokens_seen": 29887669536,
      "step": 37988
    },
    {
      "epoch": 4.0302355187778485,
      "grad_norm": 0.5248056492780571,
      "learning_rate": 3.736896828395424e-05,
      "loss": 1.2284,
      "num_input_tokens_seen": 29888456240,
      "step": 37989
    },
    {
      "epoch": 4.0303416083174195,
      "grad_norm": 0.4488431628114814,
      "learning_rate": 3.7368364330158434e-05,
      "loss": 1.1955,
      "num_input_tokens_seen": 29889242960,
      "step": 37990
    },
    {
      "epoch": 4.030447697856991,
      "grad_norm": 0.4683397333304478,
      "learning_rate": 3.736776036680471e-05,
      "loss": 1.2675,
      "num_input_tokens_seen": 29890029632,
      "step": 37991
    },
    {
      "epoch": 4.0305537873965624,
      "grad_norm": 0.5505000254043217,
      "learning_rate": 3.736715639389355e-05,
      "loss": 1.3523,
      "num_input_tokens_seen": 29890816400,
      "step": 37992
    },
    {
      "epoch": 4.030659876936134,
      "grad_norm": 0.5275039219341539,
      "learning_rate": 3.7366552411425415e-05,
      "loss": 1.3164,
      "num_input_tokens_seen": 29891603184,
      "step": 37993
    },
    {
      "epoch": 4.030765966475705,
      "grad_norm": 0.5376276565216076,
      "learning_rate": 3.736594841940077e-05,
      "loss": 1.2761,
      "num_input_tokens_seen": 29892389936,
      "step": 37994
    },
    {
      "epoch": 4.030872056015277,
      "grad_norm": 0.5121111059275926,
      "learning_rate": 3.736534441782008e-05,
      "loss": 1.3612,
      "num_input_tokens_seen": 29893176736,
      "step": 37995
    },
    {
      "epoch": 4.030978145554848,
      "grad_norm": 0.5779156830160587,
      "learning_rate": 3.7364740406683816e-05,
      "loss": 1.3137,
      "num_input_tokens_seen": 29893963584,
      "step": 37996
    },
    {
      "epoch": 4.031084235094419,
      "grad_norm": 0.49452459310883456,
      "learning_rate": 3.736413638599244e-05,
      "loss": 1.2844,
      "num_input_tokens_seen": 29894750384,
      "step": 37997
    },
    {
      "epoch": 4.031190324633991,
      "grad_norm": 0.5733444485473783,
      "learning_rate": 3.7363532355746435e-05,
      "loss": 1.3301,
      "num_input_tokens_seen": 29895537120,
      "step": 37998
    },
    {
      "epoch": 4.031296414173562,
      "grad_norm": 0.4824347023745721,
      "learning_rate": 3.736292831594624e-05,
      "loss": 1.2908,
      "num_input_tokens_seen": 29896323792,
      "step": 37999
    },
    {
      "epoch": 4.031402503713134,
      "grad_norm": 0.5646298746167598,
      "learning_rate": 3.736232426659234e-05,
      "loss": 1.336,
      "num_input_tokens_seen": 29897110496,
      "step": 38000
    },
    {
      "epoch": 4.031402503713134,
      "eval_loss": 1.6079082489013672,
      "eval_runtime": 64.5038,
      "eval_samples_per_second": 46.509,
      "eval_steps_per_second": 0.496,
      "num_input_tokens_seen": 29897110496,
      "step": 38000
    },
    {
      "epoch": 4.031508593252705,
      "grad_norm": 0.6038137610567156,
      "learning_rate": 3.736172020768521e-05,
      "loss": 1.2257,
      "num_input_tokens_seen": 29897897328,
      "step": 38001
    },
    {
      "epoch": 4.031614682792276,
      "grad_norm": 0.4867667573999588,
      "learning_rate": 3.736111613922529e-05,
      "loss": 1.3342,
      "num_input_tokens_seen": 29898684112,
      "step": 38002
    },
    {
      "epoch": 4.031720772331848,
      "grad_norm": 1.0686912352335858,
      "learning_rate": 3.7360512061213074e-05,
      "loss": 1.296,
      "num_input_tokens_seen": 29899470848,
      "step": 38003
    },
    {
      "epoch": 4.031826861871419,
      "grad_norm": 0.6614612881537337,
      "learning_rate": 3.735990797364901e-05,
      "loss": 1.2971,
      "num_input_tokens_seen": 29900257616,
      "step": 38004
    },
    {
      "epoch": 4.031932951410991,
      "grad_norm": 0.6514271675922382,
      "learning_rate": 3.735930387653357e-05,
      "loss": 1.3128,
      "num_input_tokens_seen": 29901044352,
      "step": 38005
    },
    {
      "epoch": 4.032039040950562,
      "grad_norm": 0.6073742525844893,
      "learning_rate": 3.7358699769867225e-05,
      "loss": 1.3252,
      "num_input_tokens_seen": 29901831056,
      "step": 38006
    },
    {
      "epoch": 4.032145130490133,
      "grad_norm": 0.8845269449770223,
      "learning_rate": 3.7358095653650443e-05,
      "loss": 1.3258,
      "num_input_tokens_seen": 29902617856,
      "step": 38007
    },
    {
      "epoch": 4.032251220029705,
      "grad_norm": 0.5563620330534151,
      "learning_rate": 3.7357491527883684e-05,
      "loss": 1.3121,
      "num_input_tokens_seen": 29903404656,
      "step": 38008
    },
    {
      "epoch": 4.032357309569276,
      "grad_norm": 0.6074228155342066,
      "learning_rate": 3.735688739256742e-05,
      "loss": 1.3726,
      "num_input_tokens_seen": 29904191376,
      "step": 38009
    },
    {
      "epoch": 4.032463399108848,
      "grad_norm": 0.8829521645397254,
      "learning_rate": 3.7356283247702114e-05,
      "loss": 1.1719,
      "num_input_tokens_seen": 29904978240,
      "step": 38010
    },
    {
      "epoch": 4.032569488648419,
      "grad_norm": 0.6271250388247727,
      "learning_rate": 3.735567909328823e-05,
      "loss": 1.2858,
      "num_input_tokens_seen": 29905765024,
      "step": 38011
    },
    {
      "epoch": 4.032675578187991,
      "grad_norm": 0.6484649066811737,
      "learning_rate": 3.735507492932625e-05,
      "loss": 1.211,
      "num_input_tokens_seen": 29906551808,
      "step": 38012
    },
    {
      "epoch": 4.032781667727562,
      "grad_norm": 0.6495629433470513,
      "learning_rate": 3.735447075581662e-05,
      "loss": 1.3089,
      "num_input_tokens_seen": 29907338432,
      "step": 38013
    },
    {
      "epoch": 4.032887757267133,
      "grad_norm": 0.6357768141014815,
      "learning_rate": 3.7353866572759825e-05,
      "loss": 1.3418,
      "num_input_tokens_seen": 29908125184,
      "step": 38014
    },
    {
      "epoch": 4.032993846806705,
      "grad_norm": 0.70894050067025,
      "learning_rate": 3.735326238015633e-05,
      "loss": 1.2357,
      "num_input_tokens_seen": 29908912016,
      "step": 38015
    },
    {
      "epoch": 4.033099936346276,
      "grad_norm": 0.548976614835757,
      "learning_rate": 3.735265817800658e-05,
      "loss": 1.3082,
      "num_input_tokens_seen": 29909698816,
      "step": 38016
    },
    {
      "epoch": 4.033206025885848,
      "grad_norm": 0.6257672429194214,
      "learning_rate": 3.735205396631107e-05,
      "loss": 1.2302,
      "num_input_tokens_seen": 29910485664,
      "step": 38017
    },
    {
      "epoch": 4.033312115425419,
      "grad_norm": 0.6640870555811819,
      "learning_rate": 3.7351449745070255e-05,
      "loss": 1.3094,
      "num_input_tokens_seen": 29911272432,
      "step": 38018
    },
    {
      "epoch": 4.03341820496499,
      "grad_norm": 0.6454595090492022,
      "learning_rate": 3.73508455142846e-05,
      "loss": 1.2826,
      "num_input_tokens_seen": 29912059136,
      "step": 38019
    },
    {
      "epoch": 4.033524294504562,
      "grad_norm": 0.5226613721874257,
      "learning_rate": 3.735024127395457e-05,
      "loss": 1.2451,
      "num_input_tokens_seen": 29912845920,
      "step": 38020
    },
    {
      "epoch": 4.033630384044133,
      "grad_norm": 0.6121857102293708,
      "learning_rate": 3.734963702408064e-05,
      "loss": 1.3189,
      "num_input_tokens_seen": 29913632560,
      "step": 38021
    },
    {
      "epoch": 4.033736473583705,
      "grad_norm": 0.621157024668092,
      "learning_rate": 3.7349032764663274e-05,
      "loss": 1.3927,
      "num_input_tokens_seen": 29914419328,
      "step": 38022
    },
    {
      "epoch": 4.033842563123276,
      "grad_norm": 0.6494583658393337,
      "learning_rate": 3.734842849570294e-05,
      "loss": 1.2212,
      "num_input_tokens_seen": 29915206112,
      "step": 38023
    },
    {
      "epoch": 4.033948652662848,
      "grad_norm": 0.6405392317795752,
      "learning_rate": 3.734782421720009e-05,
      "loss": 1.2867,
      "num_input_tokens_seen": 29915992864,
      "step": 38024
    },
    {
      "epoch": 4.034054742202419,
      "grad_norm": 0.6805463845812417,
      "learning_rate": 3.7347219929155216e-05,
      "loss": 1.3495,
      "num_input_tokens_seen": 29916779616,
      "step": 38025
    },
    {
      "epoch": 4.03416083174199,
      "grad_norm": 0.5017825189099846,
      "learning_rate": 3.734661563156877e-05,
      "loss": 1.2278,
      "num_input_tokens_seen": 29917566400,
      "step": 38026
    },
    {
      "epoch": 4.034266921281562,
      "grad_norm": 0.5431214629744852,
      "learning_rate": 3.734601132444122e-05,
      "loss": 1.285,
      "num_input_tokens_seen": 29918353088,
      "step": 38027
    },
    {
      "epoch": 4.034373010821133,
      "grad_norm": 0.4907374197988619,
      "learning_rate": 3.7345407007773034e-05,
      "loss": 1.2536,
      "num_input_tokens_seen": 29919139824,
      "step": 38028
    },
    {
      "epoch": 4.034479100360705,
      "grad_norm": 0.4874646037299205,
      "learning_rate": 3.734480268156469e-05,
      "loss": 1.3037,
      "num_input_tokens_seen": 29919926496,
      "step": 38029
    },
    {
      "epoch": 4.034585189900276,
      "grad_norm": 0.529960125801982,
      "learning_rate": 3.7344198345816625e-05,
      "loss": 1.3387,
      "num_input_tokens_seen": 29920713216,
      "step": 38030
    },
    {
      "epoch": 4.034691279439847,
      "grad_norm": 0.5666779454670693,
      "learning_rate": 3.7343594000529344e-05,
      "loss": 1.3599,
      "num_input_tokens_seen": 29921500000,
      "step": 38031
    },
    {
      "epoch": 4.034797368979419,
      "grad_norm": 0.5131645655058459,
      "learning_rate": 3.734298964570329e-05,
      "loss": 1.3589,
      "num_input_tokens_seen": 29922286656,
      "step": 38032
    },
    {
      "epoch": 4.03490345851899,
      "grad_norm": 0.5456216748353663,
      "learning_rate": 3.734238528133893e-05,
      "loss": 1.3728,
      "num_input_tokens_seen": 29923073392,
      "step": 38033
    },
    {
      "epoch": 4.035009548058562,
      "grad_norm": 0.47235077705609796,
      "learning_rate": 3.734178090743674e-05,
      "loss": 1.361,
      "num_input_tokens_seen": 29923860160,
      "step": 38034
    },
    {
      "epoch": 4.035115637598133,
      "grad_norm": 0.5165446134685603,
      "learning_rate": 3.734117652399719e-05,
      "loss": 1.292,
      "num_input_tokens_seen": 29924646960,
      "step": 38035
    },
    {
      "epoch": 4.035221727137705,
      "grad_norm": 0.4892019010655055,
      "learning_rate": 3.7340572131020726e-05,
      "loss": 1.2966,
      "num_input_tokens_seen": 29925433696,
      "step": 38036
    },
    {
      "epoch": 4.035327816677276,
      "grad_norm": 0.6632064376034466,
      "learning_rate": 3.7339967728507845e-05,
      "loss": 1.3188,
      "num_input_tokens_seen": 29926220528,
      "step": 38037
    },
    {
      "epoch": 4.035433906216847,
      "grad_norm": 0.5621421625287911,
      "learning_rate": 3.7339363316459e-05,
      "loss": 1.3226,
      "num_input_tokens_seen": 29927007344,
      "step": 38038
    },
    {
      "epoch": 4.035539995756419,
      "grad_norm": 0.48769844540365836,
      "learning_rate": 3.733875889487464e-05,
      "loss": 1.3108,
      "num_input_tokens_seen": 29927794096,
      "step": 38039
    },
    {
      "epoch": 4.03564608529599,
      "grad_norm": 0.5364442340913126,
      "learning_rate": 3.7338154463755264e-05,
      "loss": 1.2263,
      "num_input_tokens_seen": 29928580864,
      "step": 38040
    },
    {
      "epoch": 4.035752174835562,
      "grad_norm": 0.6029888966264886,
      "learning_rate": 3.733755002310132e-05,
      "loss": 1.3722,
      "num_input_tokens_seen": 29929367616,
      "step": 38041
    },
    {
      "epoch": 4.035858264375133,
      "grad_norm": 0.6049326839222168,
      "learning_rate": 3.733694557291328e-05,
      "loss": 1.4311,
      "num_input_tokens_seen": 29930154400,
      "step": 38042
    },
    {
      "epoch": 4.035964353914704,
      "grad_norm": 0.7178995186427516,
      "learning_rate": 3.733634111319162e-05,
      "loss": 1.25,
      "num_input_tokens_seen": 29930941312,
      "step": 38043
    },
    {
      "epoch": 4.036070443454276,
      "grad_norm": 0.48795372723187497,
      "learning_rate": 3.733573664393678e-05,
      "loss": 1.2782,
      "num_input_tokens_seen": 29931727952,
      "step": 38044
    },
    {
      "epoch": 4.036176532993847,
      "grad_norm": 0.6514140427373563,
      "learning_rate": 3.733513216514925e-05,
      "loss": 1.3011,
      "num_input_tokens_seen": 29932514720,
      "step": 38045
    },
    {
      "epoch": 4.0362826225334185,
      "grad_norm": 0.6127959342506513,
      "learning_rate": 3.73345276768295e-05,
      "loss": 1.3479,
      "num_input_tokens_seen": 29933301520,
      "step": 38046
    },
    {
      "epoch": 4.0363887120729895,
      "grad_norm": 0.5426069041507793,
      "learning_rate": 3.733392317897798e-05,
      "loss": 1.1748,
      "num_input_tokens_seen": 29934088272,
      "step": 38047
    },
    {
      "epoch": 4.036494801612561,
      "grad_norm": 0.7974149921497987,
      "learning_rate": 3.733331867159517e-05,
      "loss": 1.3252,
      "num_input_tokens_seen": 29934875024,
      "step": 38048
    },
    {
      "epoch": 4.0366008911521325,
      "grad_norm": 0.4494508934823245,
      "learning_rate": 3.733271415468153e-05,
      "loss": 1.3135,
      "num_input_tokens_seen": 29935661824,
      "step": 38049
    },
    {
      "epoch": 4.0367069806917035,
      "grad_norm": 0.8497880742315174,
      "learning_rate": 3.733210962823754e-05,
      "loss": 1.3493,
      "num_input_tokens_seen": 29936448512,
      "step": 38050
    },
    {
      "epoch": 4.0368130702312754,
      "grad_norm": 0.6122692968704201,
      "learning_rate": 3.733150509226364e-05,
      "loss": 1.2588,
      "num_input_tokens_seen": 29937235216,
      "step": 38051
    },
    {
      "epoch": 4.0369191597708465,
      "grad_norm": 0.564186716884589,
      "learning_rate": 3.733090054676033e-05,
      "loss": 1.3247,
      "num_input_tokens_seen": 29938021904,
      "step": 38052
    },
    {
      "epoch": 4.037025249310418,
      "grad_norm": 0.7406638383366098,
      "learning_rate": 3.733029599172805e-05,
      "loss": 1.3321,
      "num_input_tokens_seen": 29938808704,
      "step": 38053
    },
    {
      "epoch": 4.037131338849989,
      "grad_norm": 0.48752112535091435,
      "learning_rate": 3.732969142716729e-05,
      "loss": 1.2955,
      "num_input_tokens_seen": 29939595520,
      "step": 38054
    },
    {
      "epoch": 4.0372374283895605,
      "grad_norm": 0.5373486184183323,
      "learning_rate": 3.73290868530785e-05,
      "loss": 1.2875,
      "num_input_tokens_seen": 29940382256,
      "step": 38055
    },
    {
      "epoch": 4.037343517929132,
      "grad_norm": 0.7528675512592197,
      "learning_rate": 3.7328482269462164e-05,
      "loss": 1.2564,
      "num_input_tokens_seen": 29941169072,
      "step": 38056
    },
    {
      "epoch": 4.037449607468703,
      "grad_norm": 0.43819180820632714,
      "learning_rate": 3.7327877676318725e-05,
      "loss": 1.2656,
      "num_input_tokens_seen": 29941955968,
      "step": 38057
    },
    {
      "epoch": 4.037555697008275,
      "grad_norm": 0.9067353380030828,
      "learning_rate": 3.732727307364867e-05,
      "loss": 1.3698,
      "num_input_tokens_seen": 29942742640,
      "step": 38058
    },
    {
      "epoch": 4.037661786547846,
      "grad_norm": 0.48841707589645633,
      "learning_rate": 3.732666846145246e-05,
      "loss": 1.2829,
      "num_input_tokens_seen": 29943529392,
      "step": 38059
    },
    {
      "epoch": 4.037767876087417,
      "grad_norm": 0.6516266958757058,
      "learning_rate": 3.732606383973056e-05,
      "loss": 1.3517,
      "num_input_tokens_seen": 29944316144,
      "step": 38060
    },
    {
      "epoch": 4.037873965626989,
      "grad_norm": 0.6717441602365194,
      "learning_rate": 3.7325459208483446e-05,
      "loss": 1.3176,
      "num_input_tokens_seen": 29945102864,
      "step": 38061
    },
    {
      "epoch": 4.03798005516656,
      "grad_norm": 0.5435400730367455,
      "learning_rate": 3.732485456771157e-05,
      "loss": 1.2811,
      "num_input_tokens_seen": 29945889648,
      "step": 38062
    },
    {
      "epoch": 4.038086144706132,
      "grad_norm": 0.5596403337666821,
      "learning_rate": 3.7324249917415413e-05,
      "loss": 1.2524,
      "num_input_tokens_seen": 29946676432,
      "step": 38063
    },
    {
      "epoch": 4.038192234245703,
      "grad_norm": 0.4876085563517888,
      "learning_rate": 3.732364525759544e-05,
      "loss": 1.2628,
      "num_input_tokens_seen": 29947463248,
      "step": 38064
    },
    {
      "epoch": 4.038298323785275,
      "grad_norm": 0.47993685980251255,
      "learning_rate": 3.732304058825211e-05,
      "loss": 1.1954,
      "num_input_tokens_seen": 29948250064,
      "step": 38065
    },
    {
      "epoch": 4.038404413324846,
      "grad_norm": 0.5228748419422511,
      "learning_rate": 3.732243590938589e-05,
      "loss": 1.3606,
      "num_input_tokens_seen": 29949036816,
      "step": 38066
    },
    {
      "epoch": 4.038510502864417,
      "grad_norm": 0.4935493570611731,
      "learning_rate": 3.732183122099727e-05,
      "loss": 1.3366,
      "num_input_tokens_seen": 29949823584,
      "step": 38067
    },
    {
      "epoch": 4.038616592403989,
      "grad_norm": 0.5184655557350992,
      "learning_rate": 3.732122652308668e-05,
      "loss": 1.3068,
      "num_input_tokens_seen": 29950610320,
      "step": 38068
    },
    {
      "epoch": 4.03872268194356,
      "grad_norm": 0.45716744793033925,
      "learning_rate": 3.7320621815654626e-05,
      "loss": 1.2292,
      "num_input_tokens_seen": 29951397104,
      "step": 38069
    },
    {
      "epoch": 4.038828771483132,
      "grad_norm": 0.49622594010537574,
      "learning_rate": 3.7320017098701546e-05,
      "loss": 1.3048,
      "num_input_tokens_seen": 29952183872,
      "step": 38070
    },
    {
      "epoch": 4.038934861022703,
      "grad_norm": 0.5080309743121352,
      "learning_rate": 3.7319412372227924e-05,
      "loss": 1.3805,
      "num_input_tokens_seen": 29952970784,
      "step": 38071
    },
    {
      "epoch": 4.039040950562274,
      "grad_norm": 0.56409742538167,
      "learning_rate": 3.731880763623422e-05,
      "loss": 1.2376,
      "num_input_tokens_seen": 29953757440,
      "step": 38072
    },
    {
      "epoch": 4.039147040101846,
      "grad_norm": 0.49695935204432795,
      "learning_rate": 3.73182028907209e-05,
      "loss": 1.2907,
      "num_input_tokens_seen": 29954544288,
      "step": 38073
    },
    {
      "epoch": 4.039253129641417,
      "grad_norm": 0.6725912015836285,
      "learning_rate": 3.7317598135688435e-05,
      "loss": 1.2835,
      "num_input_tokens_seen": 29955330928,
      "step": 38074
    },
    {
      "epoch": 4.039359219180989,
      "grad_norm": 0.4910404522862188,
      "learning_rate": 3.73169933711373e-05,
      "loss": 1.2859,
      "num_input_tokens_seen": 29956117728,
      "step": 38075
    },
    {
      "epoch": 4.03946530872056,
      "grad_norm": 0.4804722957719673,
      "learning_rate": 3.731638859706794e-05,
      "loss": 1.3112,
      "num_input_tokens_seen": 29956904576,
      "step": 38076
    },
    {
      "epoch": 4.039571398260131,
      "grad_norm": 0.7238700789074439,
      "learning_rate": 3.731578381348085e-05,
      "loss": 1.335,
      "num_input_tokens_seen": 29957691248,
      "step": 38077
    },
    {
      "epoch": 4.039677487799703,
      "grad_norm": 0.5422954250926006,
      "learning_rate": 3.7315179020376476e-05,
      "loss": 1.3875,
      "num_input_tokens_seen": 29958478000,
      "step": 38078
    },
    {
      "epoch": 4.039783577339274,
      "grad_norm": 0.6067250003877057,
      "learning_rate": 3.73145742177553e-05,
      "loss": 1.3233,
      "num_input_tokens_seen": 29959264736,
      "step": 38079
    },
    {
      "epoch": 4.039889666878846,
      "grad_norm": 0.5517579790708265,
      "learning_rate": 3.7313969405617764e-05,
      "loss": 1.3275,
      "num_input_tokens_seen": 29960051504,
      "step": 38080
    },
    {
      "epoch": 4.039995756418417,
      "grad_norm": 0.566180206849953,
      "learning_rate": 3.7313364583964364e-05,
      "loss": 1.3197,
      "num_input_tokens_seen": 29960838192,
      "step": 38081
    },
    {
      "epoch": 4.040101845957989,
      "grad_norm": 0.683565575633434,
      "learning_rate": 3.731275975279556e-05,
      "loss": 1.2254,
      "num_input_tokens_seen": 29961624976,
      "step": 38082
    },
    {
      "epoch": 4.04020793549756,
      "grad_norm": 0.6406272202312212,
      "learning_rate": 3.7312154912111816e-05,
      "loss": 1.3844,
      "num_input_tokens_seen": 29962411744,
      "step": 38083
    },
    {
      "epoch": 4.040314025037131,
      "grad_norm": 0.5135093630403722,
      "learning_rate": 3.73115500619136e-05,
      "loss": 1.3687,
      "num_input_tokens_seen": 29963198496,
      "step": 38084
    },
    {
      "epoch": 4.040420114576703,
      "grad_norm": 0.7446961044702137,
      "learning_rate": 3.731094520220138e-05,
      "loss": 1.3299,
      "num_input_tokens_seen": 29963985232,
      "step": 38085
    },
    {
      "epoch": 4.040526204116274,
      "grad_norm": 0.5991096216400776,
      "learning_rate": 3.731034033297562e-05,
      "loss": 1.3484,
      "num_input_tokens_seen": 29964771920,
      "step": 38086
    },
    {
      "epoch": 4.040632293655846,
      "grad_norm": 0.635403752720099,
      "learning_rate": 3.7309735454236795e-05,
      "loss": 1.2981,
      "num_input_tokens_seen": 29965558816,
      "step": 38087
    },
    {
      "epoch": 4.040738383195417,
      "grad_norm": 0.8584207550933549,
      "learning_rate": 3.730913056598536e-05,
      "loss": 1.2389,
      "num_input_tokens_seen": 29966345680,
      "step": 38088
    },
    {
      "epoch": 4.040844472734988,
      "grad_norm": 0.6759027310673887,
      "learning_rate": 3.73085256682218e-05,
      "loss": 1.3746,
      "num_input_tokens_seen": 29967132432,
      "step": 38089
    },
    {
      "epoch": 4.04095056227456,
      "grad_norm": 0.6199425328523684,
      "learning_rate": 3.730792076094657e-05,
      "loss": 1.2781,
      "num_input_tokens_seen": 29967919152,
      "step": 38090
    },
    {
      "epoch": 4.041056651814131,
      "grad_norm": 0.47883890586942235,
      "learning_rate": 3.730731584416013e-05,
      "loss": 1.2026,
      "num_input_tokens_seen": 29968705904,
      "step": 38091
    },
    {
      "epoch": 4.041162741353703,
      "grad_norm": 0.5827854327145491,
      "learning_rate": 3.730671091786297e-05,
      "loss": 1.2981,
      "num_input_tokens_seen": 29969492736,
      "step": 38092
    },
    {
      "epoch": 4.041268830893274,
      "grad_norm": 0.830131380216306,
      "learning_rate": 3.730610598205554e-05,
      "loss": 1.2628,
      "num_input_tokens_seen": 29970279488,
      "step": 38093
    },
    {
      "epoch": 4.041374920432846,
      "grad_norm": 0.5449332032828935,
      "learning_rate": 3.730550103673831e-05,
      "loss": 1.324,
      "num_input_tokens_seen": 29971066272,
      "step": 38094
    },
    {
      "epoch": 4.041481009972417,
      "grad_norm": 0.9300034907711473,
      "learning_rate": 3.730489608191176e-05,
      "loss": 1.3349,
      "num_input_tokens_seen": 29971852960,
      "step": 38095
    },
    {
      "epoch": 4.041587099511988,
      "grad_norm": 0.6619250402322576,
      "learning_rate": 3.730429111757633e-05,
      "loss": 1.2479,
      "num_input_tokens_seen": 29972639728,
      "step": 38096
    },
    {
      "epoch": 4.04169318905156,
      "grad_norm": 0.48711688301482087,
      "learning_rate": 3.7303686143732514e-05,
      "loss": 1.3413,
      "num_input_tokens_seen": 29973426544,
      "step": 38097
    },
    {
      "epoch": 4.041799278591131,
      "grad_norm": 0.795035145271664,
      "learning_rate": 3.730308116038077e-05,
      "loss": 1.1261,
      "num_input_tokens_seen": 29974213408,
      "step": 38098
    },
    {
      "epoch": 4.041905368130703,
      "grad_norm": 0.6025106093874445,
      "learning_rate": 3.730247616752157e-05,
      "loss": 1.2319,
      "num_input_tokens_seen": 29975000144,
      "step": 38099
    },
    {
      "epoch": 4.042011457670274,
      "grad_norm": 0.5645826068075483,
      "learning_rate": 3.7301871165155375e-05,
      "loss": 1.2063,
      "num_input_tokens_seen": 29975786896,
      "step": 38100
    },
    {
      "epoch": 4.042117547209845,
      "grad_norm": 1.128217412099834,
      "learning_rate": 3.7301266153282655e-05,
      "loss": 1.4007,
      "num_input_tokens_seen": 29976573632,
      "step": 38101
    },
    {
      "epoch": 4.042223636749417,
      "grad_norm": 0.491160060742402,
      "learning_rate": 3.730066113190387e-05,
      "loss": 1.3477,
      "num_input_tokens_seen": 29977360432,
      "step": 38102
    },
    {
      "epoch": 4.042329726288988,
      "grad_norm": 0.9832060901414911,
      "learning_rate": 3.7300056101019506e-05,
      "loss": 1.308,
      "num_input_tokens_seen": 29978147136,
      "step": 38103
    },
    {
      "epoch": 4.04243581582856,
      "grad_norm": 0.6380941031276648,
      "learning_rate": 3.729945106063001e-05,
      "loss": 1.3104,
      "num_input_tokens_seen": 29978933888,
      "step": 38104
    },
    {
      "epoch": 4.042541905368131,
      "grad_norm": 0.7326221362744622,
      "learning_rate": 3.729884601073587e-05,
      "loss": 1.3712,
      "num_input_tokens_seen": 29979720640,
      "step": 38105
    },
    {
      "epoch": 4.042647994907702,
      "grad_norm": 0.6595992813288852,
      "learning_rate": 3.729824095133753e-05,
      "loss": 1.346,
      "num_input_tokens_seen": 29980507328,
      "step": 38106
    },
    {
      "epoch": 4.042754084447274,
      "grad_norm": 0.5739107113121826,
      "learning_rate": 3.729763588243548e-05,
      "loss": 1.2606,
      "num_input_tokens_seen": 29981294192,
      "step": 38107
    },
    {
      "epoch": 4.042860173986845,
      "grad_norm": 0.7528578796098337,
      "learning_rate": 3.7297030804030176e-05,
      "loss": 1.4077,
      "num_input_tokens_seen": 29982081008,
      "step": 38108
    },
    {
      "epoch": 4.0429662635264165,
      "grad_norm": 0.6216875325432721,
      "learning_rate": 3.729642571612209e-05,
      "loss": 1.3055,
      "num_input_tokens_seen": 29982867824,
      "step": 38109
    },
    {
      "epoch": 4.043072353065988,
      "grad_norm": 0.5313970274441845,
      "learning_rate": 3.729582061871168e-05,
      "loss": 1.2337,
      "num_input_tokens_seen": 29983654528,
      "step": 38110
    },
    {
      "epoch": 4.0431784426055595,
      "grad_norm": 0.5748755046139643,
      "learning_rate": 3.729521551179942e-05,
      "loss": 1.2194,
      "num_input_tokens_seen": 29984441344,
      "step": 38111
    },
    {
      "epoch": 4.0432845321451305,
      "grad_norm": 0.7738620889207476,
      "learning_rate": 3.729461039538578e-05,
      "loss": 1.2874,
      "num_input_tokens_seen": 29985228064,
      "step": 38112
    },
    {
      "epoch": 4.0433906216847015,
      "grad_norm": 0.54904960542979,
      "learning_rate": 3.7294005269471226e-05,
      "loss": 1.3173,
      "num_input_tokens_seen": 29986014816,
      "step": 38113
    },
    {
      "epoch": 4.0434967112242735,
      "grad_norm": 0.7009073989776519,
      "learning_rate": 3.729340013405623e-05,
      "loss": 1.3041,
      "num_input_tokens_seen": 29986801536,
      "step": 38114
    },
    {
      "epoch": 4.0436028007638445,
      "grad_norm": 0.5348887279440367,
      "learning_rate": 3.729279498914126e-05,
      "loss": 1.381,
      "num_input_tokens_seen": 29987588304,
      "step": 38115
    },
    {
      "epoch": 4.043708890303416,
      "grad_norm": 0.6522716096833646,
      "learning_rate": 3.7292189834726756e-05,
      "loss": 1.418,
      "num_input_tokens_seen": 29988374992,
      "step": 38116
    },
    {
      "epoch": 4.043814979842987,
      "grad_norm": 0.5510181823730775,
      "learning_rate": 3.729158467081323e-05,
      "loss": 1.2756,
      "num_input_tokens_seen": 29989161760,
      "step": 38117
    },
    {
      "epoch": 4.0439210693825585,
      "grad_norm": 0.5908488632724204,
      "learning_rate": 3.7290979497401127e-05,
      "loss": 1.2587,
      "num_input_tokens_seen": 29989948544,
      "step": 38118
    },
    {
      "epoch": 4.04402715892213,
      "grad_norm": 0.5184724293689867,
      "learning_rate": 3.7290374314490906e-05,
      "loss": 1.3108,
      "num_input_tokens_seen": 29990735360,
      "step": 38119
    },
    {
      "epoch": 4.044133248461701,
      "grad_norm": 0.7951103290464058,
      "learning_rate": 3.728976912208305e-05,
      "loss": 1.3149,
      "num_input_tokens_seen": 29991522096,
      "step": 38120
    },
    {
      "epoch": 4.044239338001273,
      "grad_norm": 0.5638628355888559,
      "learning_rate": 3.728916392017802e-05,
      "loss": 1.3235,
      "num_input_tokens_seen": 29992308832,
      "step": 38121
    },
    {
      "epoch": 4.044345427540844,
      "grad_norm": 0.5911376604671136,
      "learning_rate": 3.728855870877628e-05,
      "loss": 1.389,
      "num_input_tokens_seen": 29993095488,
      "step": 38122
    },
    {
      "epoch": 4.044451517080416,
      "grad_norm": 0.6304300773719286,
      "learning_rate": 3.728795348787831e-05,
      "loss": 1.2686,
      "num_input_tokens_seen": 29993882336,
      "step": 38123
    },
    {
      "epoch": 4.044557606619987,
      "grad_norm": 0.6078030213410538,
      "learning_rate": 3.728734825748457e-05,
      "loss": 1.3376,
      "num_input_tokens_seen": 29994669184,
      "step": 38124
    },
    {
      "epoch": 4.044663696159558,
      "grad_norm": 0.6520411038417329,
      "learning_rate": 3.728674301759552e-05,
      "loss": 1.3491,
      "num_input_tokens_seen": 29995455968,
      "step": 38125
    },
    {
      "epoch": 4.04476978569913,
      "grad_norm": 0.8344977316078224,
      "learning_rate": 3.7286137768211636e-05,
      "loss": 1.3376,
      "num_input_tokens_seen": 29996242688,
      "step": 38126
    },
    {
      "epoch": 4.044875875238701,
      "grad_norm": 0.5861274365717533,
      "learning_rate": 3.728553250933339e-05,
      "loss": 1.2586,
      "num_input_tokens_seen": 29997029456,
      "step": 38127
    },
    {
      "epoch": 4.044981964778273,
      "grad_norm": 1.003632526569635,
      "learning_rate": 3.728492724096124e-05,
      "loss": 1.2516,
      "num_input_tokens_seen": 29997816224,
      "step": 38128
    },
    {
      "epoch": 4.045088054317844,
      "grad_norm": 0.6481347488206349,
      "learning_rate": 3.728432196309567e-05,
      "loss": 1.4039,
      "num_input_tokens_seen": 29998602944,
      "step": 38129
    },
    {
      "epoch": 4.045194143857415,
      "grad_norm": 0.6723557654200951,
      "learning_rate": 3.728371667573712e-05,
      "loss": 1.2203,
      "num_input_tokens_seen": 29999389744,
      "step": 38130
    },
    {
      "epoch": 4.045300233396987,
      "grad_norm": 0.9334788742664177,
      "learning_rate": 3.728311137888608e-05,
      "loss": 1.3579,
      "num_input_tokens_seen": 30000176496,
      "step": 38131
    },
    {
      "epoch": 4.045406322936558,
      "grad_norm": 0.4896532148605828,
      "learning_rate": 3.728250607254302e-05,
      "loss": 1.1973,
      "num_input_tokens_seen": 30000963216,
      "step": 38132
    },
    {
      "epoch": 4.04551241247613,
      "grad_norm": 1.16230908576887,
      "learning_rate": 3.7281900756708396e-05,
      "loss": 1.4192,
      "num_input_tokens_seen": 30001749952,
      "step": 38133
    },
    {
      "epoch": 4.045618502015701,
      "grad_norm": 0.6984714696682559,
      "learning_rate": 3.728129543138268e-05,
      "loss": 1.4006,
      "num_input_tokens_seen": 30002536736,
      "step": 38134
    },
    {
      "epoch": 4.045724591555273,
      "grad_norm": 0.6434463905281491,
      "learning_rate": 3.728069009656633e-05,
      "loss": 1.2775,
      "num_input_tokens_seen": 30003323552,
      "step": 38135
    },
    {
      "epoch": 4.045830681094844,
      "grad_norm": 0.7248426745053838,
      "learning_rate": 3.728008475225984e-05,
      "loss": 1.2548,
      "num_input_tokens_seen": 30004110368,
      "step": 38136
    },
    {
      "epoch": 4.045936770634415,
      "grad_norm": 0.6901787146418488,
      "learning_rate": 3.727947939846365e-05,
      "loss": 1.3997,
      "num_input_tokens_seen": 30004897136,
      "step": 38137
    },
    {
      "epoch": 4.046042860173987,
      "grad_norm": 0.5448285397069521,
      "learning_rate": 3.7278874035178236e-05,
      "loss": 1.3388,
      "num_input_tokens_seen": 30005683984,
      "step": 38138
    },
    {
      "epoch": 4.046148949713558,
      "grad_norm": 0.6548356899592394,
      "learning_rate": 3.727826866240407e-05,
      "loss": 1.296,
      "num_input_tokens_seen": 30006470752,
      "step": 38139
    },
    {
      "epoch": 4.04625503925313,
      "grad_norm": 0.5977388894211,
      "learning_rate": 3.727766328014162e-05,
      "loss": 1.2925,
      "num_input_tokens_seen": 30007257520,
      "step": 38140
    },
    {
      "epoch": 4.046361128792701,
      "grad_norm": 0.5595218562545293,
      "learning_rate": 3.727705788839136e-05,
      "loss": 1.368,
      "num_input_tokens_seen": 30008044320,
      "step": 38141
    },
    {
      "epoch": 4.046467218332272,
      "grad_norm": 0.6701514849307375,
      "learning_rate": 3.727645248715374e-05,
      "loss": 1.3857,
      "num_input_tokens_seen": 30008831088,
      "step": 38142
    },
    {
      "epoch": 4.046573307871844,
      "grad_norm": 0.5953464924045422,
      "learning_rate": 3.7275847076429235e-05,
      "loss": 1.2104,
      "num_input_tokens_seen": 30009617824,
      "step": 38143
    },
    {
      "epoch": 4.046679397411415,
      "grad_norm": 0.5219752152288104,
      "learning_rate": 3.727524165621833e-05,
      "loss": 1.3256,
      "num_input_tokens_seen": 30010404608,
      "step": 38144
    },
    {
      "epoch": 4.046785486950987,
      "grad_norm": 0.5865727254126852,
      "learning_rate": 3.727463622652146e-05,
      "loss": 1.351,
      "num_input_tokens_seen": 30011191344,
      "step": 38145
    },
    {
      "epoch": 4.046891576490558,
      "grad_norm": 0.4975325704986153,
      "learning_rate": 3.7274030787339125e-05,
      "loss": 1.3637,
      "num_input_tokens_seen": 30011978080,
      "step": 38146
    },
    {
      "epoch": 4.046997666030129,
      "grad_norm": 0.5250770111754675,
      "learning_rate": 3.727342533867178e-05,
      "loss": 1.2856,
      "num_input_tokens_seen": 30012764800,
      "step": 38147
    },
    {
      "epoch": 4.047103755569701,
      "grad_norm": 0.7213589178751904,
      "learning_rate": 3.7272819880519885e-05,
      "loss": 1.3128,
      "num_input_tokens_seen": 30013551664,
      "step": 38148
    },
    {
      "epoch": 4.047209845109272,
      "grad_norm": 0.47690616161360005,
      "learning_rate": 3.727221441288392e-05,
      "loss": 1.2452,
      "num_input_tokens_seen": 30014338384,
      "step": 38149
    },
    {
      "epoch": 4.047315934648844,
      "grad_norm": 0.8762969207695812,
      "learning_rate": 3.7271608935764344e-05,
      "loss": 1.2416,
      "num_input_tokens_seen": 30015125024,
      "step": 38150
    },
    {
      "epoch": 4.047422024188415,
      "grad_norm": 0.4606438169432036,
      "learning_rate": 3.727100344916162e-05,
      "loss": 1.2543,
      "num_input_tokens_seen": 30015911808,
      "step": 38151
    },
    {
      "epoch": 4.047528113727987,
      "grad_norm": 0.5598023468308032,
      "learning_rate": 3.727039795307624e-05,
      "loss": 1.333,
      "num_input_tokens_seen": 30016698448,
      "step": 38152
    },
    {
      "epoch": 4.047634203267558,
      "grad_norm": 0.580030343926846,
      "learning_rate": 3.726979244750865e-05,
      "loss": 1.2772,
      "num_input_tokens_seen": 30017485232,
      "step": 38153
    },
    {
      "epoch": 4.047740292807129,
      "grad_norm": 0.5427506544449154,
      "learning_rate": 3.7269186932459324e-05,
      "loss": 1.1922,
      "num_input_tokens_seen": 30018272080,
      "step": 38154
    },
    {
      "epoch": 4.047846382346701,
      "grad_norm": 0.5727623925984167,
      "learning_rate": 3.7268581407928735e-05,
      "loss": 1.5332,
      "num_input_tokens_seen": 30019058768,
      "step": 38155
    },
    {
      "epoch": 4.047952471886272,
      "grad_norm": 0.6449968920850013,
      "learning_rate": 3.726797587391734e-05,
      "loss": 1.442,
      "num_input_tokens_seen": 30019845424,
      "step": 38156
    },
    {
      "epoch": 4.048058561425844,
      "grad_norm": 0.5305231170627357,
      "learning_rate": 3.7267370330425614e-05,
      "loss": 1.348,
      "num_input_tokens_seen": 30020632224,
      "step": 38157
    },
    {
      "epoch": 4.048164650965415,
      "grad_norm": 0.4923887064445289,
      "learning_rate": 3.7266764777454024e-05,
      "loss": 1.1849,
      "num_input_tokens_seen": 30021418960,
      "step": 38158
    },
    {
      "epoch": 4.048270740504986,
      "grad_norm": 0.605077053629419,
      "learning_rate": 3.726615921500304e-05,
      "loss": 1.3584,
      "num_input_tokens_seen": 30022205680,
      "step": 38159
    },
    {
      "epoch": 4.048376830044558,
      "grad_norm": 0.5695686157046336,
      "learning_rate": 3.726555364307313e-05,
      "loss": 1.3409,
      "num_input_tokens_seen": 30022992416,
      "step": 38160
    },
    {
      "epoch": 4.048482919584129,
      "grad_norm": 0.4980573281444173,
      "learning_rate": 3.726494806166476e-05,
      "loss": 1.2397,
      "num_input_tokens_seen": 30023779216,
      "step": 38161
    },
    {
      "epoch": 4.048589009123701,
      "grad_norm": 0.5458417048164511,
      "learning_rate": 3.726434247077839e-05,
      "loss": 1.3486,
      "num_input_tokens_seen": 30024565952,
      "step": 38162
    },
    {
      "epoch": 4.048695098663272,
      "grad_norm": 0.5337416037662445,
      "learning_rate": 3.7263736870414505e-05,
      "loss": 1.3502,
      "num_input_tokens_seen": 30025352768,
      "step": 38163
    },
    {
      "epoch": 4.048801188202844,
      "grad_norm": 0.517642289475181,
      "learning_rate": 3.726313126057356e-05,
      "loss": 1.3002,
      "num_input_tokens_seen": 30026139520,
      "step": 38164
    },
    {
      "epoch": 4.048907277742415,
      "grad_norm": 0.4371534349078201,
      "learning_rate": 3.726252564125603e-05,
      "loss": 1.1258,
      "num_input_tokens_seen": 30026926304,
      "step": 38165
    },
    {
      "epoch": 4.049013367281986,
      "grad_norm": 0.6880801978063636,
      "learning_rate": 3.726192001246238e-05,
      "loss": 1.3667,
      "num_input_tokens_seen": 30027713120,
      "step": 38166
    },
    {
      "epoch": 4.049119456821558,
      "grad_norm": 0.5307664098688342,
      "learning_rate": 3.726131437419308e-05,
      "loss": 1.2816,
      "num_input_tokens_seen": 30028499952,
      "step": 38167
    },
    {
      "epoch": 4.049225546361129,
      "grad_norm": 0.7146468247254766,
      "learning_rate": 3.726070872644859e-05,
      "loss": 1.361,
      "num_input_tokens_seen": 30029286784,
      "step": 38168
    },
    {
      "epoch": 4.0493316359007006,
      "grad_norm": 0.5748404384523658,
      "learning_rate": 3.726010306922938e-05,
      "loss": 1.2762,
      "num_input_tokens_seen": 30030073552,
      "step": 38169
    },
    {
      "epoch": 4.049437725440272,
      "grad_norm": 0.7330402936638599,
      "learning_rate": 3.725949740253593e-05,
      "loss": 1.3104,
      "num_input_tokens_seen": 30030860288,
      "step": 38170
    },
    {
      "epoch": 4.049543814979843,
      "grad_norm": 0.6052943436769467,
      "learning_rate": 3.725889172636869e-05,
      "loss": 1.2739,
      "num_input_tokens_seen": 30031647120,
      "step": 38171
    },
    {
      "epoch": 4.0496499045194145,
      "grad_norm": 0.6039159536626181,
      "learning_rate": 3.725828604072816e-05,
      "loss": 1.3312,
      "num_input_tokens_seen": 30032433904,
      "step": 38172
    },
    {
      "epoch": 4.049755994058986,
      "grad_norm": 0.7816847497115218,
      "learning_rate": 3.7257680345614765e-05,
      "loss": 1.4604,
      "num_input_tokens_seen": 30033220544,
      "step": 38173
    },
    {
      "epoch": 4.0498620835985575,
      "grad_norm": 0.5311058647964353,
      "learning_rate": 3.725707464102901e-05,
      "loss": 1.2402,
      "num_input_tokens_seen": 30034007280,
      "step": 38174
    },
    {
      "epoch": 4.0499681731381285,
      "grad_norm": 0.6352191141791314,
      "learning_rate": 3.725646892697133e-05,
      "loss": 1.3122,
      "num_input_tokens_seen": 30034794048,
      "step": 38175
    },
    {
      "epoch": 4.0500742626776995,
      "grad_norm": 0.5041774966251651,
      "learning_rate": 3.725586320344222e-05,
      "loss": 1.2762,
      "num_input_tokens_seen": 30035580752,
      "step": 38176
    },
    {
      "epoch": 4.0501803522172715,
      "grad_norm": 0.6419530742809731,
      "learning_rate": 3.725525747044214e-05,
      "loss": 1.3542,
      "num_input_tokens_seen": 30036367488,
      "step": 38177
    },
    {
      "epoch": 4.0502864417568425,
      "grad_norm": 0.5854193513262143,
      "learning_rate": 3.725465172797155e-05,
      "loss": 1.3477,
      "num_input_tokens_seen": 30037154192,
      "step": 38178
    },
    {
      "epoch": 4.050392531296414,
      "grad_norm": 0.6297258665927494,
      "learning_rate": 3.725404597603093e-05,
      "loss": 1.2466,
      "num_input_tokens_seen": 30037941008,
      "step": 38179
    },
    {
      "epoch": 4.050498620835985,
      "grad_norm": 0.580845608714496,
      "learning_rate": 3.725344021462074e-05,
      "loss": 1.3115,
      "num_input_tokens_seen": 30038727776,
      "step": 38180
    },
    {
      "epoch": 4.050604710375557,
      "grad_norm": 0.5352418998316035,
      "learning_rate": 3.7252834443741455e-05,
      "loss": 1.2033,
      "num_input_tokens_seen": 30039514640,
      "step": 38181
    },
    {
      "epoch": 4.050710799915128,
      "grad_norm": 0.7898778140396618,
      "learning_rate": 3.725222866339354e-05,
      "loss": 1.291,
      "num_input_tokens_seen": 30040301360,
      "step": 38182
    },
    {
      "epoch": 4.050816889454699,
      "grad_norm": 0.5327015451397532,
      "learning_rate": 3.7251622873577457e-05,
      "loss": 1.3334,
      "num_input_tokens_seen": 30041088144,
      "step": 38183
    },
    {
      "epoch": 4.050922978994271,
      "grad_norm": 0.7746620077489615,
      "learning_rate": 3.7251017074293686e-05,
      "loss": 1.1972,
      "num_input_tokens_seen": 30041874928,
      "step": 38184
    },
    {
      "epoch": 4.051029068533842,
      "grad_norm": 0.6617664349395521,
      "learning_rate": 3.725041126554268e-05,
      "loss": 1.2345,
      "num_input_tokens_seen": 30042661776,
      "step": 38185
    },
    {
      "epoch": 4.051135158073414,
      "grad_norm": 0.4940079134896586,
      "learning_rate": 3.724980544732493e-05,
      "loss": 1.2707,
      "num_input_tokens_seen": 30043448544,
      "step": 38186
    },
    {
      "epoch": 4.051241247612985,
      "grad_norm": 0.8394992214000869,
      "learning_rate": 3.7249199619640874e-05,
      "loss": 1.3522,
      "num_input_tokens_seen": 30044235248,
      "step": 38187
    },
    {
      "epoch": 4.051347337152556,
      "grad_norm": 0.48819790707490124,
      "learning_rate": 3.7248593782491e-05,
      "loss": 1.2779,
      "num_input_tokens_seen": 30045022032,
      "step": 38188
    },
    {
      "epoch": 4.051453426692128,
      "grad_norm": 0.6633748501538197,
      "learning_rate": 3.724798793587577e-05,
      "loss": 1.3867,
      "num_input_tokens_seen": 30045808736,
      "step": 38189
    },
    {
      "epoch": 4.051559516231699,
      "grad_norm": 0.5556635962479841,
      "learning_rate": 3.724738207979567e-05,
      "loss": 1.3161,
      "num_input_tokens_seen": 30046595552,
      "step": 38190
    },
    {
      "epoch": 4.051665605771271,
      "grad_norm": 0.569507857053345,
      "learning_rate": 3.7246776214251134e-05,
      "loss": 1.4062,
      "num_input_tokens_seen": 30047382272,
      "step": 38191
    },
    {
      "epoch": 4.051771695310842,
      "grad_norm": 0.5641335526321506,
      "learning_rate": 3.724617033924265e-05,
      "loss": 1.311,
      "num_input_tokens_seen": 30048168960,
      "step": 38192
    },
    {
      "epoch": 4.051877784850414,
      "grad_norm": 0.5025758664230473,
      "learning_rate": 3.72455644547707e-05,
      "loss": 1.234,
      "num_input_tokens_seen": 30048955792,
      "step": 38193
    },
    {
      "epoch": 4.051983874389985,
      "grad_norm": 0.6859205746799936,
      "learning_rate": 3.724495856083572e-05,
      "loss": 1.3378,
      "num_input_tokens_seen": 30049742512,
      "step": 38194
    },
    {
      "epoch": 4.052089963929556,
      "grad_norm": 0.5217448172757982,
      "learning_rate": 3.724435265743821e-05,
      "loss": 1.2558,
      "num_input_tokens_seen": 30050529344,
      "step": 38195
    },
    {
      "epoch": 4.052196053469128,
      "grad_norm": 0.6012563849571877,
      "learning_rate": 3.724374674457861e-05,
      "loss": 1.2884,
      "num_input_tokens_seen": 30051316000,
      "step": 38196
    },
    {
      "epoch": 4.052302143008699,
      "grad_norm": 0.5393837614516498,
      "learning_rate": 3.724314082225741e-05,
      "loss": 1.2728,
      "num_input_tokens_seen": 30052102784,
      "step": 38197
    },
    {
      "epoch": 4.052408232548271,
      "grad_norm": 0.6508082662555704,
      "learning_rate": 3.7242534890475066e-05,
      "loss": 1.4292,
      "num_input_tokens_seen": 30052889536,
      "step": 38198
    },
    {
      "epoch": 4.052514322087842,
      "grad_norm": 0.5055122881927147,
      "learning_rate": 3.724192894923205e-05,
      "loss": 1.2372,
      "num_input_tokens_seen": 30053676288,
      "step": 38199
    },
    {
      "epoch": 4.052620411627413,
      "grad_norm": 0.5834473944738178,
      "learning_rate": 3.724132299852884e-05,
      "loss": 1.2818,
      "num_input_tokens_seen": 30054463168,
      "step": 38200
    },
    {
      "epoch": 4.052726501166985,
      "grad_norm": 0.5679676480688469,
      "learning_rate": 3.724071703836589e-05,
      "loss": 1.2514,
      "num_input_tokens_seen": 30055249968,
      "step": 38201
    },
    {
      "epoch": 4.052832590706556,
      "grad_norm": 0.7865861285753668,
      "learning_rate": 3.724011106874366e-05,
      "loss": 1.3235,
      "num_input_tokens_seen": 30056036768,
      "step": 38202
    },
    {
      "epoch": 4.052938680246128,
      "grad_norm": 0.5030773849666098,
      "learning_rate": 3.723950508966265e-05,
      "loss": 1.3034,
      "num_input_tokens_seen": 30056823552,
      "step": 38203
    },
    {
      "epoch": 4.053044769785699,
      "grad_norm": 0.7365015829358027,
      "learning_rate": 3.72388991011233e-05,
      "loss": 1.3163,
      "num_input_tokens_seen": 30057610384,
      "step": 38204
    },
    {
      "epoch": 4.053150859325271,
      "grad_norm": 0.5288304510588501,
      "learning_rate": 3.7238293103126085e-05,
      "loss": 1.3393,
      "num_input_tokens_seen": 30058397216,
      "step": 38205
    },
    {
      "epoch": 4.053256948864842,
      "grad_norm": 0.5611217263150327,
      "learning_rate": 3.723768709567148e-05,
      "loss": 1.3763,
      "num_input_tokens_seen": 30059183984,
      "step": 38206
    },
    {
      "epoch": 4.053363038404413,
      "grad_norm": 0.48987645336456176,
      "learning_rate": 3.723708107875995e-05,
      "loss": 1.1891,
      "num_input_tokens_seen": 30059970736,
      "step": 38207
    },
    {
      "epoch": 4.053469127943985,
      "grad_norm": 0.5019076380688954,
      "learning_rate": 3.723647505239196e-05,
      "loss": 1.2657,
      "num_input_tokens_seen": 30060757520,
      "step": 38208
    },
    {
      "epoch": 4.053575217483556,
      "grad_norm": 0.7186802377043183,
      "learning_rate": 3.723586901656799e-05,
      "loss": 1.3206,
      "num_input_tokens_seen": 30061544304,
      "step": 38209
    },
    {
      "epoch": 4.053681307023128,
      "grad_norm": 0.6254722046935901,
      "learning_rate": 3.7235262971288495e-05,
      "loss": 1.3387,
      "num_input_tokens_seen": 30062331184,
      "step": 38210
    },
    {
      "epoch": 4.053787396562699,
      "grad_norm": 0.9591506130226267,
      "learning_rate": 3.7234656916553946e-05,
      "loss": 1.3569,
      "num_input_tokens_seen": 30063117856,
      "step": 38211
    },
    {
      "epoch": 4.05389348610227,
      "grad_norm": 0.5601979209519455,
      "learning_rate": 3.723405085236481e-05,
      "loss": 1.3283,
      "num_input_tokens_seen": 30063904624,
      "step": 38212
    },
    {
      "epoch": 4.053999575641842,
      "grad_norm": 0.680576700179218,
      "learning_rate": 3.7233444778721565e-05,
      "loss": 1.4071,
      "num_input_tokens_seen": 30064691392,
      "step": 38213
    },
    {
      "epoch": 4.054105665181413,
      "grad_norm": 0.5617908607536757,
      "learning_rate": 3.723283869562467e-05,
      "loss": 1.342,
      "num_input_tokens_seen": 30065478128,
      "step": 38214
    },
    {
      "epoch": 4.054211754720985,
      "grad_norm": 0.5345418094118006,
      "learning_rate": 3.723223260307459e-05,
      "loss": 1.3208,
      "num_input_tokens_seen": 30066264880,
      "step": 38215
    },
    {
      "epoch": 4.054317844260556,
      "grad_norm": 0.5943964827928836,
      "learning_rate": 3.72316265010718e-05,
      "loss": 1.3513,
      "num_input_tokens_seen": 30067051568,
      "step": 38216
    },
    {
      "epoch": 4.054423933800127,
      "grad_norm": 0.5770405184880986,
      "learning_rate": 3.7231020389616776e-05,
      "loss": 1.2494,
      "num_input_tokens_seen": 30067838432,
      "step": 38217
    },
    {
      "epoch": 4.054530023339699,
      "grad_norm": 0.6161925937977656,
      "learning_rate": 3.723041426870998e-05,
      "loss": 1.4006,
      "num_input_tokens_seen": 30068625184,
      "step": 38218
    },
    {
      "epoch": 4.05463611287927,
      "grad_norm": 0.5750710328075852,
      "learning_rate": 3.722980813835187e-05,
      "loss": 1.2643,
      "num_input_tokens_seen": 30069412032,
      "step": 38219
    },
    {
      "epoch": 4.054742202418842,
      "grad_norm": 0.6367708971521342,
      "learning_rate": 3.722920199854293e-05,
      "loss": 1.346,
      "num_input_tokens_seen": 30070198880,
      "step": 38220
    },
    {
      "epoch": 4.054848291958413,
      "grad_norm": 0.4785955064222369,
      "learning_rate": 3.722859584928362e-05,
      "loss": 1.3101,
      "num_input_tokens_seen": 30070985616,
      "step": 38221
    },
    {
      "epoch": 4.054954381497985,
      "grad_norm": 1.0981658717583582,
      "learning_rate": 3.722798969057441e-05,
      "loss": 1.3933,
      "num_input_tokens_seen": 30071772368,
      "step": 38222
    },
    {
      "epoch": 4.055060471037556,
      "grad_norm": 0.5012752983550828,
      "learning_rate": 3.7227383522415765e-05,
      "loss": 1.2317,
      "num_input_tokens_seen": 30072559168,
      "step": 38223
    },
    {
      "epoch": 4.055166560577127,
      "grad_norm": 0.6430820899664332,
      "learning_rate": 3.722677734480816e-05,
      "loss": 1.2572,
      "num_input_tokens_seen": 30073345984,
      "step": 38224
    },
    {
      "epoch": 4.055272650116699,
      "grad_norm": 0.8234569662236447,
      "learning_rate": 3.722617115775205e-05,
      "loss": 1.335,
      "num_input_tokens_seen": 30074132784,
      "step": 38225
    },
    {
      "epoch": 4.05537873965627,
      "grad_norm": 0.7026641213278602,
      "learning_rate": 3.722556496124793e-05,
      "loss": 1.402,
      "num_input_tokens_seen": 30074919600,
      "step": 38226
    },
    {
      "epoch": 4.055484829195842,
      "grad_norm": 0.9415892862749502,
      "learning_rate": 3.7224958755296245e-05,
      "loss": 1.3349,
      "num_input_tokens_seen": 30075706416,
      "step": 38227
    },
    {
      "epoch": 4.055590918735413,
      "grad_norm": 0.57497717660473,
      "learning_rate": 3.722435253989747e-05,
      "loss": 1.2759,
      "num_input_tokens_seen": 30076493184,
      "step": 38228
    },
    {
      "epoch": 4.055697008274984,
      "grad_norm": 0.5509645680276033,
      "learning_rate": 3.722374631505207e-05,
      "loss": 1.2137,
      "num_input_tokens_seen": 30077279904,
      "step": 38229
    },
    {
      "epoch": 4.055803097814556,
      "grad_norm": 1.1196041424082483,
      "learning_rate": 3.722314008076053e-05,
      "loss": 1.4232,
      "num_input_tokens_seen": 30078066576,
      "step": 38230
    },
    {
      "epoch": 4.055909187354127,
      "grad_norm": 0.548026287418084,
      "learning_rate": 3.7222533837023296e-05,
      "loss": 1.2505,
      "num_input_tokens_seen": 30078853456,
      "step": 38231
    },
    {
      "epoch": 4.056015276893699,
      "grad_norm": 0.8718595254098755,
      "learning_rate": 3.722192758384084e-05,
      "loss": 1.3672,
      "num_input_tokens_seen": 30079640176,
      "step": 38232
    },
    {
      "epoch": 4.05612136643327,
      "grad_norm": 0.6844310133004965,
      "learning_rate": 3.722132132121366e-05,
      "loss": 1.2668,
      "num_input_tokens_seen": 30080426944,
      "step": 38233
    },
    {
      "epoch": 4.0562274559728415,
      "grad_norm": 0.520307357465263,
      "learning_rate": 3.722071504914218e-05,
      "loss": 1.2625,
      "num_input_tokens_seen": 30081213680,
      "step": 38234
    },
    {
      "epoch": 4.0563335455124125,
      "grad_norm": 0.8693592027229776,
      "learning_rate": 3.7220108767626896e-05,
      "loss": 1.3825,
      "num_input_tokens_seen": 30082000496,
      "step": 38235
    },
    {
      "epoch": 4.056439635051984,
      "grad_norm": 0.6476562858513567,
      "learning_rate": 3.721950247666827e-05,
      "loss": 1.325,
      "num_input_tokens_seen": 30082787280,
      "step": 38236
    },
    {
      "epoch": 4.0565457245915555,
      "grad_norm": 0.5416332582471373,
      "learning_rate": 3.721889617626677e-05,
      "loss": 1.1252,
      "num_input_tokens_seen": 30083574064,
      "step": 38237
    },
    {
      "epoch": 4.0566518141311265,
      "grad_norm": 0.8957492673277504,
      "learning_rate": 3.721828986642287e-05,
      "loss": 1.3458,
      "num_input_tokens_seen": 30084360816,
      "step": 38238
    },
    {
      "epoch": 4.056757903670698,
      "grad_norm": 0.5590727429755188,
      "learning_rate": 3.721768354713704e-05,
      "loss": 1.2122,
      "num_input_tokens_seen": 30085147552,
      "step": 38239
    },
    {
      "epoch": 4.0568639932102695,
      "grad_norm": 0.7274301941021517,
      "learning_rate": 3.721707721840973e-05,
      "loss": 1.3314,
      "num_input_tokens_seen": 30085934304,
      "step": 38240
    },
    {
      "epoch": 4.0569700827498405,
      "grad_norm": 0.9159216865394366,
      "learning_rate": 3.7216470880241426e-05,
      "loss": 1.3728,
      "num_input_tokens_seen": 30086721120,
      "step": 38241
    },
    {
      "epoch": 4.057076172289412,
      "grad_norm": 0.6552120108240092,
      "learning_rate": 3.721586453263259e-05,
      "loss": 1.3776,
      "num_input_tokens_seen": 30087507872,
      "step": 38242
    },
    {
      "epoch": 4.0571822618289834,
      "grad_norm": 0.9085587646037142,
      "learning_rate": 3.72152581755837e-05,
      "loss": 1.322,
      "num_input_tokens_seen": 30088294640,
      "step": 38243
    },
    {
      "epoch": 4.057288351368555,
      "grad_norm": 0.5608981377583719,
      "learning_rate": 3.721465180909521e-05,
      "loss": 1.3004,
      "num_input_tokens_seen": 30089081392,
      "step": 38244
    },
    {
      "epoch": 4.057394440908126,
      "grad_norm": 0.5754412978314067,
      "learning_rate": 3.721404543316759e-05,
      "loss": 1.2565,
      "num_input_tokens_seen": 30089868240,
      "step": 38245
    },
    {
      "epoch": 4.057500530447697,
      "grad_norm": 0.725609022493567,
      "learning_rate": 3.721343904780133e-05,
      "loss": 1.2657,
      "num_input_tokens_seen": 30090655072,
      "step": 38246
    },
    {
      "epoch": 4.057606619987269,
      "grad_norm": 0.686944773587606,
      "learning_rate": 3.721283265299687e-05,
      "loss": 1.287,
      "num_input_tokens_seen": 30091441728,
      "step": 38247
    },
    {
      "epoch": 4.05771270952684,
      "grad_norm": 0.6088244312595459,
      "learning_rate": 3.721222624875469e-05,
      "loss": 1.2916,
      "num_input_tokens_seen": 30092228512,
      "step": 38248
    },
    {
      "epoch": 4.057818799066412,
      "grad_norm": 0.8846688173669546,
      "learning_rate": 3.721161983507526e-05,
      "loss": 1.2392,
      "num_input_tokens_seen": 30093015392,
      "step": 38249
    },
    {
      "epoch": 4.057924888605983,
      "grad_norm": 0.8256583803695188,
      "learning_rate": 3.7211013411959064e-05,
      "loss": 1.3731,
      "num_input_tokens_seen": 30093802208,
      "step": 38250
    },
    {
      "epoch": 4.058030978145555,
      "grad_norm": 0.7952332343477536,
      "learning_rate": 3.721040697940654e-05,
      "loss": 1.3083,
      "num_input_tokens_seen": 30094589024,
      "step": 38251
    },
    {
      "epoch": 4.058137067685126,
      "grad_norm": 0.8066051404221702,
      "learning_rate": 3.720980053741817e-05,
      "loss": 1.2451,
      "num_input_tokens_seen": 30095375920,
      "step": 38252
    },
    {
      "epoch": 4.058243157224697,
      "grad_norm": 0.7099800277304045,
      "learning_rate": 3.720919408599444e-05,
      "loss": 1.2663,
      "num_input_tokens_seen": 30096162704,
      "step": 38253
    },
    {
      "epoch": 4.058349246764269,
      "grad_norm": 0.6010646967668691,
      "learning_rate": 3.7208587625135786e-05,
      "loss": 1.3846,
      "num_input_tokens_seen": 30096949424,
      "step": 38254
    },
    {
      "epoch": 4.05845533630384,
      "grad_norm": 0.8060194764466447,
      "learning_rate": 3.72079811548427e-05,
      "loss": 1.3305,
      "num_input_tokens_seen": 30097736128,
      "step": 38255
    },
    {
      "epoch": 4.058561425843412,
      "grad_norm": 0.6447331826656578,
      "learning_rate": 3.7207374675115645e-05,
      "loss": 1.3297,
      "num_input_tokens_seen": 30098522880,
      "step": 38256
    },
    {
      "epoch": 4.058667515382983,
      "grad_norm": 0.6147217297472455,
      "learning_rate": 3.7206768185955096e-05,
      "loss": 1.3154,
      "num_input_tokens_seen": 30099309616,
      "step": 38257
    },
    {
      "epoch": 4.058773604922554,
      "grad_norm": 0.7978917606984184,
      "learning_rate": 3.720616168736151e-05,
      "loss": 1.2275,
      "num_input_tokens_seen": 30100096368,
      "step": 38258
    },
    {
      "epoch": 4.058879694462126,
      "grad_norm": 0.5101112435176177,
      "learning_rate": 3.720555517933535e-05,
      "loss": 1.2591,
      "num_input_tokens_seen": 30100883088,
      "step": 38259
    },
    {
      "epoch": 4.058985784001697,
      "grad_norm": 0.8112758297911602,
      "learning_rate": 3.7204948661877106e-05,
      "loss": 1.2993,
      "num_input_tokens_seen": 30101669744,
      "step": 38260
    },
    {
      "epoch": 4.059091873541269,
      "grad_norm": 0.6331568240905581,
      "learning_rate": 3.720434213498724e-05,
      "loss": 1.2882,
      "num_input_tokens_seen": 30102456560,
      "step": 38261
    },
    {
      "epoch": 4.05919796308084,
      "grad_norm": 0.6148284005692515,
      "learning_rate": 3.7203735598666204e-05,
      "loss": 1.3812,
      "num_input_tokens_seen": 30103243376,
      "step": 38262
    },
    {
      "epoch": 4.059304052620412,
      "grad_norm": 0.6382671778046908,
      "learning_rate": 3.720312905291449e-05,
      "loss": 1.3177,
      "num_input_tokens_seen": 30104030192,
      "step": 38263
    },
    {
      "epoch": 4.059410142159983,
      "grad_norm": 0.8542884143675704,
      "learning_rate": 3.7202522497732554e-05,
      "loss": 1.309,
      "num_input_tokens_seen": 30104817008,
      "step": 38264
    },
    {
      "epoch": 4.059516231699554,
      "grad_norm": 0.8137278890638425,
      "learning_rate": 3.720191593312086e-05,
      "loss": 1.398,
      "num_input_tokens_seen": 30105603744,
      "step": 38265
    },
    {
      "epoch": 4.059622321239126,
      "grad_norm": 0.6418233761663137,
      "learning_rate": 3.720130935907988e-05,
      "loss": 1.2724,
      "num_input_tokens_seen": 30106390480,
      "step": 38266
    },
    {
      "epoch": 4.059728410778697,
      "grad_norm": 0.6209502703061998,
      "learning_rate": 3.7200702775610096e-05,
      "loss": 1.3019,
      "num_input_tokens_seen": 30107177280,
      "step": 38267
    },
    {
      "epoch": 4.059834500318269,
      "grad_norm": 0.6572324446341127,
      "learning_rate": 3.7200096182711965e-05,
      "loss": 1.2139,
      "num_input_tokens_seen": 30107964096,
      "step": 38268
    },
    {
      "epoch": 4.05994058985784,
      "grad_norm": 0.6659926911184215,
      "learning_rate": 3.719948958038596e-05,
      "loss": 1.1568,
      "num_input_tokens_seen": 30108750800,
      "step": 38269
    },
    {
      "epoch": 4.060046679397411,
      "grad_norm": 0.6592087345711282,
      "learning_rate": 3.719888296863254e-05,
      "loss": 1.305,
      "num_input_tokens_seen": 30109537552,
      "step": 38270
    },
    {
      "epoch": 4.060152768936983,
      "grad_norm": 0.8218327337068035,
      "learning_rate": 3.7198276347452183e-05,
      "loss": 1.2346,
      "num_input_tokens_seen": 30110324320,
      "step": 38271
    },
    {
      "epoch": 4.060258858476554,
      "grad_norm": 0.6690331606685417,
      "learning_rate": 3.719766971684536e-05,
      "loss": 1.3536,
      "num_input_tokens_seen": 30111110992,
      "step": 38272
    },
    {
      "epoch": 4.060364948016126,
      "grad_norm": 0.7354309617648741,
      "learning_rate": 3.7197063076812534e-05,
      "loss": 1.2759,
      "num_input_tokens_seen": 30111897792,
      "step": 38273
    },
    {
      "epoch": 4.060471037555697,
      "grad_norm": 0.6209428939256164,
      "learning_rate": 3.719645642735417e-05,
      "loss": 1.3394,
      "num_input_tokens_seen": 30112684512,
      "step": 38274
    },
    {
      "epoch": 4.060577127095268,
      "grad_norm": 0.6685235588896251,
      "learning_rate": 3.7195849768470744e-05,
      "loss": 1.2597,
      "num_input_tokens_seen": 30113471328,
      "step": 38275
    },
    {
      "epoch": 4.06068321663484,
      "grad_norm": 0.6158594845752187,
      "learning_rate": 3.7195243100162734e-05,
      "loss": 1.2452,
      "num_input_tokens_seen": 30114258080,
      "step": 38276
    },
    {
      "epoch": 4.060789306174411,
      "grad_norm": 0.5299894657649042,
      "learning_rate": 3.719463642243059e-05,
      "loss": 1.3414,
      "num_input_tokens_seen": 30115044784,
      "step": 38277
    },
    {
      "epoch": 4.060895395713983,
      "grad_norm": 0.6095414734422232,
      "learning_rate": 3.7194029735274786e-05,
      "loss": 1.242,
      "num_input_tokens_seen": 30115831552,
      "step": 38278
    },
    {
      "epoch": 4.061001485253554,
      "grad_norm": 0.5610924287072667,
      "learning_rate": 3.7193423038695804e-05,
      "loss": 1.2394,
      "num_input_tokens_seen": 30116618320,
      "step": 38279
    },
    {
      "epoch": 4.061107574793126,
      "grad_norm": 0.663739227247277,
      "learning_rate": 3.719281633269409e-05,
      "loss": 1.2634,
      "num_input_tokens_seen": 30117405088,
      "step": 38280
    },
    {
      "epoch": 4.061213664332697,
      "grad_norm": 0.6421298819267366,
      "learning_rate": 3.7192209617270135e-05,
      "loss": 1.3018,
      "num_input_tokens_seen": 30118191776,
      "step": 38281
    },
    {
      "epoch": 4.061319753872268,
      "grad_norm": 0.6419459864491005,
      "learning_rate": 3.7191602892424396e-05,
      "loss": 1.3678,
      "num_input_tokens_seen": 30118978480,
      "step": 38282
    },
    {
      "epoch": 4.06142584341184,
      "grad_norm": 0.6780628180477277,
      "learning_rate": 3.719099615815734e-05,
      "loss": 1.3246,
      "num_input_tokens_seen": 30119765152,
      "step": 38283
    },
    {
      "epoch": 4.061531932951411,
      "grad_norm": 0.5060430212075365,
      "learning_rate": 3.719038941446944e-05,
      "loss": 1.3319,
      "num_input_tokens_seen": 30120552000,
      "step": 38284
    },
    {
      "epoch": 4.061638022490983,
      "grad_norm": 0.6355817146237062,
      "learning_rate": 3.718978266136117e-05,
      "loss": 1.2749,
      "num_input_tokens_seen": 30121338880,
      "step": 38285
    },
    {
      "epoch": 4.061744112030554,
      "grad_norm": 0.6301001445987096,
      "learning_rate": 3.718917589883299e-05,
      "loss": 1.3262,
      "num_input_tokens_seen": 30122125632,
      "step": 38286
    },
    {
      "epoch": 4.061850201570125,
      "grad_norm": 0.5794214231104834,
      "learning_rate": 3.718856912688537e-05,
      "loss": 1.2895,
      "num_input_tokens_seen": 30122912320,
      "step": 38287
    },
    {
      "epoch": 4.061956291109697,
      "grad_norm": 0.6747339006521837,
      "learning_rate": 3.7187962345518786e-05,
      "loss": 1.3839,
      "num_input_tokens_seen": 30123699136,
      "step": 38288
    },
    {
      "epoch": 4.062062380649268,
      "grad_norm": 0.5310922039004764,
      "learning_rate": 3.71873555547337e-05,
      "loss": 1.2758,
      "num_input_tokens_seen": 30124485856,
      "step": 38289
    },
    {
      "epoch": 4.06216847018884,
      "grad_norm": 0.6813483443507418,
      "learning_rate": 3.7186748754530585e-05,
      "loss": 1.3556,
      "num_input_tokens_seen": 30125272704,
      "step": 38290
    },
    {
      "epoch": 4.062274559728411,
      "grad_norm": 0.58344571863916,
      "learning_rate": 3.71861419449099e-05,
      "loss": 1.235,
      "num_input_tokens_seen": 30126059536,
      "step": 38291
    },
    {
      "epoch": 4.062380649267983,
      "grad_norm": 0.5052374406399045,
      "learning_rate": 3.718553512587213e-05,
      "loss": 1.3804,
      "num_input_tokens_seen": 30126846208,
      "step": 38292
    },
    {
      "epoch": 4.062486738807554,
      "grad_norm": 0.6084182233334806,
      "learning_rate": 3.7184928297417744e-05,
      "loss": 1.2432,
      "num_input_tokens_seen": 30127632928,
      "step": 38293
    },
    {
      "epoch": 4.062592828347125,
      "grad_norm": 0.48596132647885615,
      "learning_rate": 3.718432145954719e-05,
      "loss": 1.2897,
      "num_input_tokens_seen": 30128419680,
      "step": 38294
    },
    {
      "epoch": 4.062698917886697,
      "grad_norm": 0.4966872465692945,
      "learning_rate": 3.7183714612260953e-05,
      "loss": 1.2977,
      "num_input_tokens_seen": 30129206464,
      "step": 38295
    },
    {
      "epoch": 4.062805007426268,
      "grad_norm": 0.464322486781482,
      "learning_rate": 3.718310775555951e-05,
      "loss": 1.1464,
      "num_input_tokens_seen": 30129993232,
      "step": 38296
    },
    {
      "epoch": 4.0629110969658395,
      "grad_norm": 0.5460698864038458,
      "learning_rate": 3.71825008894433e-05,
      "loss": 1.2406,
      "num_input_tokens_seen": 30130780000,
      "step": 38297
    },
    {
      "epoch": 4.0630171865054105,
      "grad_norm": 0.5315439669537739,
      "learning_rate": 3.718189401391282e-05,
      "loss": 1.2786,
      "num_input_tokens_seen": 30131566688,
      "step": 38298
    },
    {
      "epoch": 4.063123276044982,
      "grad_norm": 0.535227190838477,
      "learning_rate": 3.718128712896853e-05,
      "loss": 1.2923,
      "num_input_tokens_seen": 30132353488,
      "step": 38299
    },
    {
      "epoch": 4.0632293655845535,
      "grad_norm": 0.5865803488002584,
      "learning_rate": 3.71806802346109e-05,
      "loss": 1.4322,
      "num_input_tokens_seen": 30133140304,
      "step": 38300
    },
    {
      "epoch": 4.0633354551241245,
      "grad_norm": 0.6027558865977222,
      "learning_rate": 3.718007333084039e-05,
      "loss": 1.3592,
      "num_input_tokens_seen": 30133927056,
      "step": 38301
    },
    {
      "epoch": 4.0634415446636964,
      "grad_norm": 0.5365612689523175,
      "learning_rate": 3.7179466417657485e-05,
      "loss": 1.2791,
      "num_input_tokens_seen": 30134713728,
      "step": 38302
    },
    {
      "epoch": 4.0635476342032675,
      "grad_norm": 0.5585146053538382,
      "learning_rate": 3.717885949506265e-05,
      "loss": 1.3492,
      "num_input_tokens_seen": 30135500496,
      "step": 38303
    },
    {
      "epoch": 4.0636537237428385,
      "grad_norm": 0.5523814288690593,
      "learning_rate": 3.7178252563056334e-05,
      "loss": 1.3879,
      "num_input_tokens_seen": 30136287264,
      "step": 38304
    },
    {
      "epoch": 4.06375981328241,
      "grad_norm": 0.5288154756435421,
      "learning_rate": 3.717764562163903e-05,
      "loss": 1.1917,
      "num_input_tokens_seen": 30137074048,
      "step": 38305
    },
    {
      "epoch": 4.0638659028219815,
      "grad_norm": 0.5748335090017086,
      "learning_rate": 3.71770386708112e-05,
      "loss": 1.3377,
      "num_input_tokens_seen": 30137860848,
      "step": 38306
    },
    {
      "epoch": 4.063971992361553,
      "grad_norm": 0.639701423847643,
      "learning_rate": 3.7176431710573314e-05,
      "loss": 1.3008,
      "num_input_tokens_seen": 30138647552,
      "step": 38307
    },
    {
      "epoch": 4.064078081901124,
      "grad_norm": 0.6322081570873315,
      "learning_rate": 3.717582474092584e-05,
      "loss": 1.3049,
      "num_input_tokens_seen": 30139434304,
      "step": 38308
    },
    {
      "epoch": 4.064184171440696,
      "grad_norm": 0.45384530254173233,
      "learning_rate": 3.7175217761869235e-05,
      "loss": 1.22,
      "num_input_tokens_seen": 30140221200,
      "step": 38309
    },
    {
      "epoch": 4.064290260980267,
      "grad_norm": 0.5700888957409206,
      "learning_rate": 3.717461077340399e-05,
      "loss": 1.4018,
      "num_input_tokens_seen": 30141007984,
      "step": 38310
    },
    {
      "epoch": 4.064396350519838,
      "grad_norm": 0.5443592267534433,
      "learning_rate": 3.7174003775530554e-05,
      "loss": 1.2402,
      "num_input_tokens_seen": 30141794736,
      "step": 38311
    },
    {
      "epoch": 4.06450244005941,
      "grad_norm": 0.5895086944822037,
      "learning_rate": 3.717339676824941e-05,
      "loss": 1.4404,
      "num_input_tokens_seen": 30142581504,
      "step": 38312
    },
    {
      "epoch": 4.064608529598981,
      "grad_norm": 0.4684420464820731,
      "learning_rate": 3.7172789751561025e-05,
      "loss": 1.162,
      "num_input_tokens_seen": 30143368304,
      "step": 38313
    },
    {
      "epoch": 4.064714619138553,
      "grad_norm": 0.5273253728849754,
      "learning_rate": 3.717218272546586e-05,
      "loss": 1.3699,
      "num_input_tokens_seen": 30144155136,
      "step": 38314
    },
    {
      "epoch": 4.064820708678124,
      "grad_norm": 0.505634585539955,
      "learning_rate": 3.7171575689964396e-05,
      "loss": 1.2971,
      "num_input_tokens_seen": 30144941904,
      "step": 38315
    },
    {
      "epoch": 4.064926798217695,
      "grad_norm": 0.6141195350641739,
      "learning_rate": 3.7170968645057093e-05,
      "loss": 1.3286,
      "num_input_tokens_seen": 30145728640,
      "step": 38316
    },
    {
      "epoch": 4.065032887757267,
      "grad_norm": 0.4609306965832361,
      "learning_rate": 3.717036159074442e-05,
      "loss": 1.1912,
      "num_input_tokens_seen": 30146515408,
      "step": 38317
    },
    {
      "epoch": 4.065138977296838,
      "grad_norm": 0.6251986782379146,
      "learning_rate": 3.7169754527026846e-05,
      "loss": 1.2708,
      "num_input_tokens_seen": 30147302128,
      "step": 38318
    },
    {
      "epoch": 4.06524506683641,
      "grad_norm": 0.46902838738271774,
      "learning_rate": 3.716914745390484e-05,
      "loss": 1.2761,
      "num_input_tokens_seen": 30148088864,
      "step": 38319
    },
    {
      "epoch": 4.065351156375981,
      "grad_norm": 0.6409786483046275,
      "learning_rate": 3.7168540371378876e-05,
      "loss": 1.409,
      "num_input_tokens_seen": 30148875552,
      "step": 38320
    },
    {
      "epoch": 4.065457245915553,
      "grad_norm": 0.45258718796141484,
      "learning_rate": 3.716793327944943e-05,
      "loss": 1.1802,
      "num_input_tokens_seen": 30149662352,
      "step": 38321
    },
    {
      "epoch": 4.065563335455124,
      "grad_norm": 0.5381398735135559,
      "learning_rate": 3.7167326178116965e-05,
      "loss": 1.2538,
      "num_input_tokens_seen": 30150449168,
      "step": 38322
    },
    {
      "epoch": 4.065669424994695,
      "grad_norm": 0.5223330173943446,
      "learning_rate": 3.7166719067381935e-05,
      "loss": 1.3509,
      "num_input_tokens_seen": 30151235888,
      "step": 38323
    },
    {
      "epoch": 4.065775514534267,
      "grad_norm": 0.5255197699306691,
      "learning_rate": 3.7166111947244826e-05,
      "loss": 1.3275,
      "num_input_tokens_seen": 30152022656,
      "step": 38324
    },
    {
      "epoch": 4.065881604073838,
      "grad_norm": 0.5097883648415803,
      "learning_rate": 3.7165504817706105e-05,
      "loss": 1.2585,
      "num_input_tokens_seen": 30152809472,
      "step": 38325
    },
    {
      "epoch": 4.06598769361341,
      "grad_norm": 0.5315022071054895,
      "learning_rate": 3.716489767876623e-05,
      "loss": 1.3419,
      "num_input_tokens_seen": 30153596240,
      "step": 38326
    },
    {
      "epoch": 4.066093783152981,
      "grad_norm": 0.5808467496550196,
      "learning_rate": 3.716429053042569e-05,
      "loss": 1.3729,
      "num_input_tokens_seen": 30154382976,
      "step": 38327
    },
    {
      "epoch": 4.066199872692552,
      "grad_norm": 0.5038333927264989,
      "learning_rate": 3.7163683372684934e-05,
      "loss": 1.2794,
      "num_input_tokens_seen": 30155169760,
      "step": 38328
    },
    {
      "epoch": 4.066305962232124,
      "grad_norm": 0.6523446813266994,
      "learning_rate": 3.716307620554445e-05,
      "loss": 1.4179,
      "num_input_tokens_seen": 30155956512,
      "step": 38329
    },
    {
      "epoch": 4.066412051771695,
      "grad_norm": 0.4656369484871034,
      "learning_rate": 3.7162469029004696e-05,
      "loss": 1.3077,
      "num_input_tokens_seen": 30156743312,
      "step": 38330
    },
    {
      "epoch": 4.066518141311267,
      "grad_norm": 0.6924231170226736,
      "learning_rate": 3.716186184306613e-05,
      "loss": 1.3414,
      "num_input_tokens_seen": 30157530000,
      "step": 38331
    },
    {
      "epoch": 4.066624230850838,
      "grad_norm": 0.5260118702558394,
      "learning_rate": 3.7161254647729246e-05,
      "loss": 1.3363,
      "num_input_tokens_seen": 30158316704,
      "step": 38332
    },
    {
      "epoch": 4.06673032039041,
      "grad_norm": 0.5054670962257113,
      "learning_rate": 3.71606474429945e-05,
      "loss": 1.3581,
      "num_input_tokens_seen": 30159103408,
      "step": 38333
    },
    {
      "epoch": 4.066836409929981,
      "grad_norm": 0.4987387649219196,
      "learning_rate": 3.716004022886236e-05,
      "loss": 1.224,
      "num_input_tokens_seen": 30159890304,
      "step": 38334
    },
    {
      "epoch": 4.066942499469552,
      "grad_norm": 0.5465585216148476,
      "learning_rate": 3.71594330053333e-05,
      "loss": 1.343,
      "num_input_tokens_seen": 30160677040,
      "step": 38335
    },
    {
      "epoch": 4.067048589009124,
      "grad_norm": 0.4503839760834096,
      "learning_rate": 3.715882577240779e-05,
      "loss": 1.2545,
      "num_input_tokens_seen": 30161463776,
      "step": 38336
    },
    {
      "epoch": 4.067154678548695,
      "grad_norm": 0.5719869083725918,
      "learning_rate": 3.7158218530086285e-05,
      "loss": 1.2316,
      "num_input_tokens_seen": 30162250656,
      "step": 38337
    },
    {
      "epoch": 4.067260768088267,
      "grad_norm": 0.5215337739850802,
      "learning_rate": 3.7157611278369275e-05,
      "loss": 1.3558,
      "num_input_tokens_seen": 30163037360,
      "step": 38338
    },
    {
      "epoch": 4.067366857627838,
      "grad_norm": 0.4918938640738856,
      "learning_rate": 3.715700401725723e-05,
      "loss": 1.226,
      "num_input_tokens_seen": 30163824192,
      "step": 38339
    },
    {
      "epoch": 4.067472947167409,
      "grad_norm": 0.6685561613968997,
      "learning_rate": 3.715639674675059e-05,
      "loss": 1.2525,
      "num_input_tokens_seen": 30164611024,
      "step": 38340
    },
    {
      "epoch": 4.067579036706981,
      "grad_norm": 0.5334027771477577,
      "learning_rate": 3.715578946684984e-05,
      "loss": 1.3009,
      "num_input_tokens_seen": 30165397744,
      "step": 38341
    },
    {
      "epoch": 4.067685126246552,
      "grad_norm": 0.5618180106634642,
      "learning_rate": 3.715518217755547e-05,
      "loss": 1.3852,
      "num_input_tokens_seen": 30166184528,
      "step": 38342
    },
    {
      "epoch": 4.067791215786124,
      "grad_norm": 0.4836932835737417,
      "learning_rate": 3.715457487886792e-05,
      "loss": 1.2416,
      "num_input_tokens_seen": 30166971344,
      "step": 38343
    },
    {
      "epoch": 4.067897305325695,
      "grad_norm": 0.5392024734020524,
      "learning_rate": 3.715396757078768e-05,
      "loss": 1.3243,
      "num_input_tokens_seen": 30167758000,
      "step": 38344
    },
    {
      "epoch": 4.068003394865266,
      "grad_norm": 0.5859127825584098,
      "learning_rate": 3.71533602533152e-05,
      "loss": 1.3309,
      "num_input_tokens_seen": 30168544800,
      "step": 38345
    },
    {
      "epoch": 4.068109484404838,
      "grad_norm": 0.6705104602755866,
      "learning_rate": 3.715275292645097e-05,
      "loss": 1.3034,
      "num_input_tokens_seen": 30169331440,
      "step": 38346
    },
    {
      "epoch": 4.068215573944409,
      "grad_norm": 0.5407584588392089,
      "learning_rate": 3.7152145590195444e-05,
      "loss": 1.2729,
      "num_input_tokens_seen": 30170118112,
      "step": 38347
    },
    {
      "epoch": 4.068321663483981,
      "grad_norm": 0.49327693642312403,
      "learning_rate": 3.7151538244549094e-05,
      "loss": 1.2582,
      "num_input_tokens_seen": 30170904960,
      "step": 38348
    },
    {
      "epoch": 4.068427753023552,
      "grad_norm": 0.5271530357160685,
      "learning_rate": 3.71509308895124e-05,
      "loss": 1.2116,
      "num_input_tokens_seen": 30171691840,
      "step": 38349
    },
    {
      "epoch": 4.068533842563124,
      "grad_norm": 0.5250940526949979,
      "learning_rate": 3.715032352508582e-05,
      "loss": 1.3837,
      "num_input_tokens_seen": 30172478576,
      "step": 38350
    },
    {
      "epoch": 4.068639932102695,
      "grad_norm": 0.46524702819019315,
      "learning_rate": 3.714971615126982e-05,
      "loss": 1.2688,
      "num_input_tokens_seen": 30173265328,
      "step": 38351
    },
    {
      "epoch": 4.068746021642266,
      "grad_norm": 0.5631769099455307,
      "learning_rate": 3.714910876806488e-05,
      "loss": 1.3465,
      "num_input_tokens_seen": 30174052000,
      "step": 38352
    },
    {
      "epoch": 4.068852111181838,
      "grad_norm": 0.5368716204928033,
      "learning_rate": 3.7148501375471465e-05,
      "loss": 1.2846,
      "num_input_tokens_seen": 30174838800,
      "step": 38353
    },
    {
      "epoch": 4.068958200721409,
      "grad_norm": 0.5271102578075453,
      "learning_rate": 3.7147893973490045e-05,
      "loss": 1.3312,
      "num_input_tokens_seen": 30175625488,
      "step": 38354
    },
    {
      "epoch": 4.069064290260981,
      "grad_norm": 0.47247736001307017,
      "learning_rate": 3.7147286562121094e-05,
      "loss": 1.2668,
      "num_input_tokens_seen": 30176412256,
      "step": 38355
    },
    {
      "epoch": 4.069170379800552,
      "grad_norm": 0.509395546135054,
      "learning_rate": 3.714667914136507e-05,
      "loss": 1.2728,
      "num_input_tokens_seen": 30177198928,
      "step": 38356
    },
    {
      "epoch": 4.069276469340123,
      "grad_norm": 0.5344016307561329,
      "learning_rate": 3.714607171122245e-05,
      "loss": 1.3889,
      "num_input_tokens_seen": 30177985648,
      "step": 38357
    },
    {
      "epoch": 4.069382558879695,
      "grad_norm": 0.5869200295124073,
      "learning_rate": 3.7145464271693706e-05,
      "loss": 1.3962,
      "num_input_tokens_seen": 30178772384,
      "step": 38358
    },
    {
      "epoch": 4.069488648419266,
      "grad_norm": 0.533071228345238,
      "learning_rate": 3.7144856822779294e-05,
      "loss": 1.3734,
      "num_input_tokens_seen": 30179559056,
      "step": 38359
    },
    {
      "epoch": 4.0695947379588375,
      "grad_norm": 0.6131911941038912,
      "learning_rate": 3.71442493644797e-05,
      "loss": 1.3194,
      "num_input_tokens_seen": 30180345856,
      "step": 38360
    },
    {
      "epoch": 4.069700827498409,
      "grad_norm": 0.5277855778133942,
      "learning_rate": 3.714364189679539e-05,
      "loss": 1.3119,
      "num_input_tokens_seen": 30181132688,
      "step": 38361
    },
    {
      "epoch": 4.0698069170379805,
      "grad_norm": 0.5078475140263237,
      "learning_rate": 3.714303441972682e-05,
      "loss": 1.329,
      "num_input_tokens_seen": 30181919424,
      "step": 38362
    },
    {
      "epoch": 4.0699130065775515,
      "grad_norm": 0.4888325222108436,
      "learning_rate": 3.714242693327448e-05,
      "loss": 1.2596,
      "num_input_tokens_seen": 30182706208,
      "step": 38363
    },
    {
      "epoch": 4.0700190961171225,
      "grad_norm": 0.4964247073753173,
      "learning_rate": 3.714181943743882e-05,
      "loss": 1.1678,
      "num_input_tokens_seen": 30183492960,
      "step": 38364
    },
    {
      "epoch": 4.0701251856566945,
      "grad_norm": 0.6100781487679737,
      "learning_rate": 3.7141211932220324e-05,
      "loss": 1.4205,
      "num_input_tokens_seen": 30184279712,
      "step": 38365
    },
    {
      "epoch": 4.0702312751962655,
      "grad_norm": 0.5037632298973604,
      "learning_rate": 3.714060441761945e-05,
      "loss": 1.3637,
      "num_input_tokens_seen": 30185066496,
      "step": 38366
    },
    {
      "epoch": 4.070337364735837,
      "grad_norm": 0.4913125415887759,
      "learning_rate": 3.7139996893636675e-05,
      "loss": 1.223,
      "num_input_tokens_seen": 30185853328,
      "step": 38367
    },
    {
      "epoch": 4.070443454275408,
      "grad_norm": 0.6048501542758958,
      "learning_rate": 3.713938936027247e-05,
      "loss": 1.2833,
      "num_input_tokens_seen": 30186640064,
      "step": 38368
    },
    {
      "epoch": 4.0705495438149795,
      "grad_norm": 0.5931297192980579,
      "learning_rate": 3.71387818175273e-05,
      "loss": 1.3706,
      "num_input_tokens_seen": 30187426816,
      "step": 38369
    },
    {
      "epoch": 4.070655633354551,
      "grad_norm": 0.7272842091258154,
      "learning_rate": 3.713817426540163e-05,
      "loss": 1.3169,
      "num_input_tokens_seen": 30188213680,
      "step": 38370
    },
    {
      "epoch": 4.070761722894122,
      "grad_norm": 0.5318331685505722,
      "learning_rate": 3.7137566703895935e-05,
      "loss": 1.2486,
      "num_input_tokens_seen": 30189000400,
      "step": 38371
    },
    {
      "epoch": 4.070867812433694,
      "grad_norm": 0.6035232739220663,
      "learning_rate": 3.7136959133010697e-05,
      "loss": 1.3818,
      "num_input_tokens_seen": 30189787264,
      "step": 38372
    },
    {
      "epoch": 4.070973901973265,
      "grad_norm": 0.512386790398537,
      "learning_rate": 3.7136351552746364e-05,
      "loss": 1.2829,
      "num_input_tokens_seen": 30190573952,
      "step": 38373
    },
    {
      "epoch": 4.071079991512837,
      "grad_norm": 0.5167888257914885,
      "learning_rate": 3.713574396310341e-05,
      "loss": 1.188,
      "num_input_tokens_seen": 30191360608,
      "step": 38374
    },
    {
      "epoch": 4.071186081052408,
      "grad_norm": 0.5285918368035192,
      "learning_rate": 3.713513636408232e-05,
      "loss": 1.3078,
      "num_input_tokens_seen": 30192147296,
      "step": 38375
    },
    {
      "epoch": 4.071292170591979,
      "grad_norm": 0.5850346631403515,
      "learning_rate": 3.713452875568355e-05,
      "loss": 1.4433,
      "num_input_tokens_seen": 30192933984,
      "step": 38376
    },
    {
      "epoch": 4.071398260131551,
      "grad_norm": 0.5051028036774847,
      "learning_rate": 3.7133921137907566e-05,
      "loss": 1.3925,
      "num_input_tokens_seen": 30193720736,
      "step": 38377
    },
    {
      "epoch": 4.071504349671122,
      "grad_norm": 0.4920387156821682,
      "learning_rate": 3.713331351075485e-05,
      "loss": 1.2228,
      "num_input_tokens_seen": 30194507520,
      "step": 38378
    },
    {
      "epoch": 4.071610439210694,
      "grad_norm": 0.5665292626475754,
      "learning_rate": 3.713270587422587e-05,
      "loss": 1.2399,
      "num_input_tokens_seen": 30195294288,
      "step": 38379
    },
    {
      "epoch": 4.071716528750265,
      "grad_norm": 0.5635819988436328,
      "learning_rate": 3.7132098228321076e-05,
      "loss": 1.2151,
      "num_input_tokens_seen": 30196081104,
      "step": 38380
    },
    {
      "epoch": 4.071822618289836,
      "grad_norm": 0.5570363413916442,
      "learning_rate": 3.713149057304096e-05,
      "loss": 1.3838,
      "num_input_tokens_seen": 30196867920,
      "step": 38381
    },
    {
      "epoch": 4.071928707829408,
      "grad_norm": 0.46373621332800546,
      "learning_rate": 3.713088290838599e-05,
      "loss": 1.2849,
      "num_input_tokens_seen": 30197654720,
      "step": 38382
    },
    {
      "epoch": 4.072034797368979,
      "grad_norm": 0.6559626599792642,
      "learning_rate": 3.713027523435662e-05,
      "loss": 1.3313,
      "num_input_tokens_seen": 30198441456,
      "step": 38383
    },
    {
      "epoch": 4.072140886908551,
      "grad_norm": 0.5539375875734718,
      "learning_rate": 3.7129667550953334e-05,
      "loss": 1.258,
      "num_input_tokens_seen": 30199228176,
      "step": 38384
    },
    {
      "epoch": 4.072246976448122,
      "grad_norm": 0.8492322388676868,
      "learning_rate": 3.71290598581766e-05,
      "loss": 1.331,
      "num_input_tokens_seen": 30200014816,
      "step": 38385
    },
    {
      "epoch": 4.072353065987693,
      "grad_norm": 0.8030275497162037,
      "learning_rate": 3.7128452156026875e-05,
      "loss": 1.4306,
      "num_input_tokens_seen": 30200801648,
      "step": 38386
    },
    {
      "epoch": 4.072459155527265,
      "grad_norm": 0.649108382317345,
      "learning_rate": 3.712784444450464e-05,
      "loss": 1.3596,
      "num_input_tokens_seen": 30201588384,
      "step": 38387
    },
    {
      "epoch": 4.072565245066836,
      "grad_norm": 0.7235429244859505,
      "learning_rate": 3.712723672361037e-05,
      "loss": 1.2212,
      "num_input_tokens_seen": 30202375104,
      "step": 38388
    },
    {
      "epoch": 4.072671334606408,
      "grad_norm": 0.6079003567616316,
      "learning_rate": 3.712662899334453e-05,
      "loss": 1.4054,
      "num_input_tokens_seen": 30203161824,
      "step": 38389
    },
    {
      "epoch": 4.072777424145979,
      "grad_norm": 0.572015759649529,
      "learning_rate": 3.712602125370758e-05,
      "loss": 1.3433,
      "num_input_tokens_seen": 30203948704,
      "step": 38390
    },
    {
      "epoch": 4.072883513685551,
      "grad_norm": 0.631633735151514,
      "learning_rate": 3.712541350469999e-05,
      "loss": 1.2371,
      "num_input_tokens_seen": 30204735504,
      "step": 38391
    },
    {
      "epoch": 4.072989603225122,
      "grad_norm": 0.43269113442441454,
      "learning_rate": 3.712480574632225e-05,
      "loss": 1.2129,
      "num_input_tokens_seen": 30205522336,
      "step": 38392
    },
    {
      "epoch": 4.073095692764693,
      "grad_norm": 0.6166635523966991,
      "learning_rate": 3.712419797857481e-05,
      "loss": 1.2447,
      "num_input_tokens_seen": 30206309136,
      "step": 38393
    },
    {
      "epoch": 4.073201782304265,
      "grad_norm": 0.4799385220514454,
      "learning_rate": 3.7123590201458144e-05,
      "loss": 1.3428,
      "num_input_tokens_seen": 30207095904,
      "step": 38394
    },
    {
      "epoch": 4.073307871843836,
      "grad_norm": 0.5010684771722608,
      "learning_rate": 3.7122982414972724e-05,
      "loss": 1.2512,
      "num_input_tokens_seen": 30207882656,
      "step": 38395
    },
    {
      "epoch": 4.073413961383408,
      "grad_norm": 0.5440289700584706,
      "learning_rate": 3.712237461911902e-05,
      "loss": 1.3138,
      "num_input_tokens_seen": 30208669360,
      "step": 38396
    },
    {
      "epoch": 4.073520050922979,
      "grad_norm": 0.5993732120535432,
      "learning_rate": 3.7121766813897494e-05,
      "loss": 1.2873,
      "num_input_tokens_seen": 30209456096,
      "step": 38397
    },
    {
      "epoch": 4.07362614046255,
      "grad_norm": 0.5812547708205126,
      "learning_rate": 3.712115899930863e-05,
      "loss": 1.2984,
      "num_input_tokens_seen": 30210242912,
      "step": 38398
    },
    {
      "epoch": 4.073732230002122,
      "grad_norm": 0.5532218541096986,
      "learning_rate": 3.7120551175352894e-05,
      "loss": 1.2822,
      "num_input_tokens_seen": 30211029648,
      "step": 38399
    },
    {
      "epoch": 4.073838319541693,
      "grad_norm": 0.6130483866179132,
      "learning_rate": 3.711994334203074e-05,
      "loss": 1.3025,
      "num_input_tokens_seen": 30211816448,
      "step": 38400
    },
    {
      "epoch": 4.073944409081265,
      "grad_norm": 0.5518021510083505,
      "learning_rate": 3.711933549934266e-05,
      "loss": 1.3446,
      "num_input_tokens_seen": 30212603168,
      "step": 38401
    },
    {
      "epoch": 4.074050498620836,
      "grad_norm": 0.5806971213945974,
      "learning_rate": 3.711872764728911e-05,
      "loss": 1.4547,
      "num_input_tokens_seen": 30213389920,
      "step": 38402
    },
    {
      "epoch": 4.074156588160408,
      "grad_norm": 0.6527941017474296,
      "learning_rate": 3.711811978587055e-05,
      "loss": 1.1862,
      "num_input_tokens_seen": 30214176768,
      "step": 38403
    },
    {
      "epoch": 4.074262677699979,
      "grad_norm": 0.5095539470049916,
      "learning_rate": 3.711751191508748e-05,
      "loss": 1.2009,
      "num_input_tokens_seen": 30214963536,
      "step": 38404
    },
    {
      "epoch": 4.07436876723955,
      "grad_norm": 0.5901934318022507,
      "learning_rate": 3.711690403494034e-05,
      "loss": 1.2975,
      "num_input_tokens_seen": 30215750384,
      "step": 38405
    },
    {
      "epoch": 4.074474856779122,
      "grad_norm": 0.6852908399573678,
      "learning_rate": 3.7116296145429626e-05,
      "loss": 1.3547,
      "num_input_tokens_seen": 30216537120,
      "step": 38406
    },
    {
      "epoch": 4.074580946318693,
      "grad_norm": 0.5025932390659139,
      "learning_rate": 3.711568824655579e-05,
      "loss": 1.3603,
      "num_input_tokens_seen": 30217323872,
      "step": 38407
    },
    {
      "epoch": 4.074687035858265,
      "grad_norm": 0.5969722345538045,
      "learning_rate": 3.711508033831929e-05,
      "loss": 1.2352,
      "num_input_tokens_seen": 30218110656,
      "step": 38408
    },
    {
      "epoch": 4.074793125397836,
      "grad_norm": 0.5030539485794581,
      "learning_rate": 3.711447242072062e-05,
      "loss": 1.3183,
      "num_input_tokens_seen": 30218897424,
      "step": 38409
    },
    {
      "epoch": 4.074899214937407,
      "grad_norm": 0.5761463813830889,
      "learning_rate": 3.711386449376025e-05,
      "loss": 1.3487,
      "num_input_tokens_seen": 30219684240,
      "step": 38410
    },
    {
      "epoch": 4.075005304476979,
      "grad_norm": 0.5716958824524683,
      "learning_rate": 3.711325655743864e-05,
      "loss": 1.3527,
      "num_input_tokens_seen": 30220470960,
      "step": 38411
    },
    {
      "epoch": 4.07511139401655,
      "grad_norm": 0.5464979228726932,
      "learning_rate": 3.711264861175625e-05,
      "loss": 1.2439,
      "num_input_tokens_seen": 30221257760,
      "step": 38412
    },
    {
      "epoch": 4.075217483556122,
      "grad_norm": 0.6574804382863884,
      "learning_rate": 3.711204065671357e-05,
      "loss": 1.2392,
      "num_input_tokens_seen": 30222044448,
      "step": 38413
    },
    {
      "epoch": 4.075323573095693,
      "grad_norm": 0.524453165295176,
      "learning_rate": 3.711143269231105e-05,
      "loss": 1.2187,
      "num_input_tokens_seen": 30222831120,
      "step": 38414
    },
    {
      "epoch": 4.075429662635264,
      "grad_norm": 0.6176040538773444,
      "learning_rate": 3.711082471854918e-05,
      "loss": 1.405,
      "num_input_tokens_seen": 30223617856,
      "step": 38415
    },
    {
      "epoch": 4.075535752174836,
      "grad_norm": 0.6567162516733824,
      "learning_rate": 3.7110216735428414e-05,
      "loss": 1.2425,
      "num_input_tokens_seen": 30224404576,
      "step": 38416
    },
    {
      "epoch": 4.075641841714407,
      "grad_norm": 0.5720909184746682,
      "learning_rate": 3.710960874294923e-05,
      "loss": 1.2881,
      "num_input_tokens_seen": 30225191328,
      "step": 38417
    },
    {
      "epoch": 4.075747931253979,
      "grad_norm": 0.5783727129324977,
      "learning_rate": 3.71090007411121e-05,
      "loss": 1.3956,
      "num_input_tokens_seen": 30225978096,
      "step": 38418
    },
    {
      "epoch": 4.07585402079355,
      "grad_norm": 0.7248562125885797,
      "learning_rate": 3.7108392729917486e-05,
      "loss": 1.2448,
      "num_input_tokens_seen": 30226764880,
      "step": 38419
    },
    {
      "epoch": 4.0759601103331216,
      "grad_norm": 0.619111771557249,
      "learning_rate": 3.7107784709365855e-05,
      "loss": 1.359,
      "num_input_tokens_seen": 30227551616,
      "step": 38420
    },
    {
      "epoch": 4.076066199872693,
      "grad_norm": 0.5508311253796321,
      "learning_rate": 3.7107176679457694e-05,
      "loss": 1.2602,
      "num_input_tokens_seen": 30228338352,
      "step": 38421
    },
    {
      "epoch": 4.076172289412264,
      "grad_norm": 0.7837561680026769,
      "learning_rate": 3.7106568640193465e-05,
      "loss": 1.279,
      "num_input_tokens_seen": 30229125152,
      "step": 38422
    },
    {
      "epoch": 4.0762783789518355,
      "grad_norm": 0.519735500167666,
      "learning_rate": 3.710596059157362e-05,
      "loss": 1.3217,
      "num_input_tokens_seen": 30229911904,
      "step": 38423
    },
    {
      "epoch": 4.076384468491407,
      "grad_norm": 0.6926942464433463,
      "learning_rate": 3.710535253359865e-05,
      "loss": 1.3154,
      "num_input_tokens_seen": 30230698608,
      "step": 38424
    },
    {
      "epoch": 4.0764905580309785,
      "grad_norm": 0.497926668936858,
      "learning_rate": 3.710474446626902e-05,
      "loss": 1.3327,
      "num_input_tokens_seen": 30231485360,
      "step": 38425
    },
    {
      "epoch": 4.0765966475705495,
      "grad_norm": 0.5099419742569459,
      "learning_rate": 3.7104136389585196e-05,
      "loss": 1.316,
      "num_input_tokens_seen": 30232272160,
      "step": 38426
    },
    {
      "epoch": 4.0767027371101205,
      "grad_norm": 0.683710491337273,
      "learning_rate": 3.710352830354766e-05,
      "loss": 1.3366,
      "num_input_tokens_seen": 30233058848,
      "step": 38427
    },
    {
      "epoch": 4.0768088266496925,
      "grad_norm": 0.6546657597721883,
      "learning_rate": 3.7102920208156864e-05,
      "loss": 1.3305,
      "num_input_tokens_seen": 30233845648,
      "step": 38428
    },
    {
      "epoch": 4.0769149161892635,
      "grad_norm": 0.5651208105280425,
      "learning_rate": 3.710231210341329e-05,
      "loss": 1.3331,
      "num_input_tokens_seen": 30234632400,
      "step": 38429
    },
    {
      "epoch": 4.077021005728835,
      "grad_norm": 0.6945396855272833,
      "learning_rate": 3.7101703989317405e-05,
      "loss": 1.2827,
      "num_input_tokens_seen": 30235419184,
      "step": 38430
    },
    {
      "epoch": 4.077127095268406,
      "grad_norm": 0.42802400451305783,
      "learning_rate": 3.7101095865869675e-05,
      "loss": 1.2521,
      "num_input_tokens_seen": 30236205968,
      "step": 38431
    },
    {
      "epoch": 4.077233184807978,
      "grad_norm": 0.5915205330791723,
      "learning_rate": 3.710048773307057e-05,
      "loss": 1.2677,
      "num_input_tokens_seen": 30236992688,
      "step": 38432
    },
    {
      "epoch": 4.077339274347549,
      "grad_norm": 0.5671543666757208,
      "learning_rate": 3.709987959092057e-05,
      "loss": 1.3211,
      "num_input_tokens_seen": 30237779440,
      "step": 38433
    },
    {
      "epoch": 4.07744536388712,
      "grad_norm": 0.6638876721378688,
      "learning_rate": 3.7099271439420134e-05,
      "loss": 1.4321,
      "num_input_tokens_seen": 30238566144,
      "step": 38434
    },
    {
      "epoch": 4.077551453426692,
      "grad_norm": 0.5116725964510263,
      "learning_rate": 3.709866327856973e-05,
      "loss": 1.2775,
      "num_input_tokens_seen": 30239352880,
      "step": 38435
    },
    {
      "epoch": 4.077657542966263,
      "grad_norm": 0.5537405331533487,
      "learning_rate": 3.709805510836985e-05,
      "loss": 1.3235,
      "num_input_tokens_seen": 30240139632,
      "step": 38436
    },
    {
      "epoch": 4.077763632505835,
      "grad_norm": 0.4990694655890548,
      "learning_rate": 3.709744692882093e-05,
      "loss": 1.3042,
      "num_input_tokens_seen": 30240926416,
      "step": 38437
    },
    {
      "epoch": 4.077869722045406,
      "grad_norm": 0.5051431187852506,
      "learning_rate": 3.709683873992348e-05,
      "loss": 1.2458,
      "num_input_tokens_seen": 30241713232,
      "step": 38438
    },
    {
      "epoch": 4.077975811584977,
      "grad_norm": 0.7304203012414437,
      "learning_rate": 3.709623054167794e-05,
      "loss": 1.3693,
      "num_input_tokens_seen": 30242500016,
      "step": 38439
    },
    {
      "epoch": 4.078081901124549,
      "grad_norm": 0.5772990945651469,
      "learning_rate": 3.7095622334084775e-05,
      "loss": 1.2345,
      "num_input_tokens_seen": 30243286800,
      "step": 38440
    },
    {
      "epoch": 4.07818799066412,
      "grad_norm": 0.4958292133474124,
      "learning_rate": 3.7095014117144475e-05,
      "loss": 1.2431,
      "num_input_tokens_seen": 30244073552,
      "step": 38441
    },
    {
      "epoch": 4.078294080203692,
      "grad_norm": 0.6234230956442581,
      "learning_rate": 3.7094405890857506e-05,
      "loss": 1.3782,
      "num_input_tokens_seen": 30244860384,
      "step": 38442
    },
    {
      "epoch": 4.078400169743263,
      "grad_norm": 0.5392297609279579,
      "learning_rate": 3.709379765522433e-05,
      "loss": 1.225,
      "num_input_tokens_seen": 30245647168,
      "step": 38443
    },
    {
      "epoch": 4.078506259282834,
      "grad_norm": 0.5650563841738818,
      "learning_rate": 3.709318941024543e-05,
      "loss": 1.3067,
      "num_input_tokens_seen": 30246433984,
      "step": 38444
    },
    {
      "epoch": 4.078612348822406,
      "grad_norm": 0.5819024656999903,
      "learning_rate": 3.709258115592126e-05,
      "loss": 1.3577,
      "num_input_tokens_seen": 30247220816,
      "step": 38445
    },
    {
      "epoch": 4.078718438361977,
      "grad_norm": 0.48999576510922344,
      "learning_rate": 3.70919728922523e-05,
      "loss": 1.2565,
      "num_input_tokens_seen": 30248007520,
      "step": 38446
    },
    {
      "epoch": 4.078824527901549,
      "grad_norm": 0.5423453299914531,
      "learning_rate": 3.7091364619239025e-05,
      "loss": 1.3078,
      "num_input_tokens_seen": 30248794336,
      "step": 38447
    },
    {
      "epoch": 4.07893061744112,
      "grad_norm": 0.4870369139116922,
      "learning_rate": 3.709075633688189e-05,
      "loss": 1.3241,
      "num_input_tokens_seen": 30249581104,
      "step": 38448
    },
    {
      "epoch": 4.079036706980692,
      "grad_norm": 0.6305156135908794,
      "learning_rate": 3.709014804518137e-05,
      "loss": 1.296,
      "num_input_tokens_seen": 30250367856,
      "step": 38449
    },
    {
      "epoch": 4.079142796520263,
      "grad_norm": 0.6457513758117059,
      "learning_rate": 3.708953974413795e-05,
      "loss": 1.4081,
      "num_input_tokens_seen": 30251154640,
      "step": 38450
    },
    {
      "epoch": 4.079248886059834,
      "grad_norm": 0.49111879312829254,
      "learning_rate": 3.708893143375208e-05,
      "loss": 1.2764,
      "num_input_tokens_seen": 30251941392,
      "step": 38451
    },
    {
      "epoch": 4.079354975599406,
      "grad_norm": 0.6045565032397174,
      "learning_rate": 3.708832311402424e-05,
      "loss": 1.234,
      "num_input_tokens_seen": 30252728272,
      "step": 38452
    },
    {
      "epoch": 4.079461065138977,
      "grad_norm": 0.491173837994995,
      "learning_rate": 3.708771478495491e-05,
      "loss": 1.2167,
      "num_input_tokens_seen": 30253515088,
      "step": 38453
    },
    {
      "epoch": 4.079567154678549,
      "grad_norm": 0.5100676380034892,
      "learning_rate": 3.708710644654453e-05,
      "loss": 1.3772,
      "num_input_tokens_seen": 30254301712,
      "step": 38454
    },
    {
      "epoch": 4.07967324421812,
      "grad_norm": 0.5262549082212723,
      "learning_rate": 3.70864980987936e-05,
      "loss": 1.4324,
      "num_input_tokens_seen": 30255088384,
      "step": 38455
    },
    {
      "epoch": 4.079779333757691,
      "grad_norm": 0.7953475388148036,
      "learning_rate": 3.708588974170258e-05,
      "loss": 1.3822,
      "num_input_tokens_seen": 30255875152,
      "step": 38456
    },
    {
      "epoch": 4.079885423297263,
      "grad_norm": 0.5314366911920269,
      "learning_rate": 3.708528137527193e-05,
      "loss": 1.2792,
      "num_input_tokens_seen": 30256661888,
      "step": 38457
    },
    {
      "epoch": 4.079991512836834,
      "grad_norm": 0.6246523176866927,
      "learning_rate": 3.7084672999502135e-05,
      "loss": 1.3162,
      "num_input_tokens_seen": 30257448720,
      "step": 38458
    },
    {
      "epoch": 4.080097602376406,
      "grad_norm": 0.5317491394066991,
      "learning_rate": 3.708406461439366e-05,
      "loss": 1.3145,
      "num_input_tokens_seen": 30258235472,
      "step": 38459
    },
    {
      "epoch": 4.080203691915977,
      "grad_norm": 0.5322047127233717,
      "learning_rate": 3.708345621994697e-05,
      "loss": 1.2839,
      "num_input_tokens_seen": 30259022288,
      "step": 38460
    },
    {
      "epoch": 4.080309781455549,
      "grad_norm": 0.5993514707461612,
      "learning_rate": 3.7082847816162546e-05,
      "loss": 1.2666,
      "num_input_tokens_seen": 30259809168,
      "step": 38461
    },
    {
      "epoch": 4.08041587099512,
      "grad_norm": 0.5552196138196456,
      "learning_rate": 3.7082239403040843e-05,
      "loss": 1.4068,
      "num_input_tokens_seen": 30260595920,
      "step": 38462
    },
    {
      "epoch": 4.080521960534691,
      "grad_norm": 0.5017609614827995,
      "learning_rate": 3.7081630980582345e-05,
      "loss": 1.2491,
      "num_input_tokens_seen": 30261382720,
      "step": 38463
    },
    {
      "epoch": 4.080628050074263,
      "grad_norm": 0.5153483469745967,
      "learning_rate": 3.708102254878752e-05,
      "loss": 1.2238,
      "num_input_tokens_seen": 30262169536,
      "step": 38464
    },
    {
      "epoch": 4.080734139613834,
      "grad_norm": 0.5653930290449607,
      "learning_rate": 3.708041410765683e-05,
      "loss": 1.343,
      "num_input_tokens_seen": 30262956352,
      "step": 38465
    },
    {
      "epoch": 4.080840229153406,
      "grad_norm": 0.4235455104130802,
      "learning_rate": 3.707980565719075e-05,
      "loss": 1.2387,
      "num_input_tokens_seen": 30263743168,
      "step": 38466
    },
    {
      "epoch": 4.080946318692977,
      "grad_norm": 0.5784903368328337,
      "learning_rate": 3.707919719738976e-05,
      "loss": 1.2893,
      "num_input_tokens_seen": 30264529968,
      "step": 38467
    },
    {
      "epoch": 4.081052408232548,
      "grad_norm": 0.6751061682230841,
      "learning_rate": 3.707858872825432e-05,
      "loss": 1.3458,
      "num_input_tokens_seen": 30265316704,
      "step": 38468
    },
    {
      "epoch": 4.08115849777212,
      "grad_norm": 0.5716596378659495,
      "learning_rate": 3.7077980249784885e-05,
      "loss": 1.3764,
      "num_input_tokens_seen": 30266103440,
      "step": 38469
    },
    {
      "epoch": 4.081264587311691,
      "grad_norm": 0.6579760959566944,
      "learning_rate": 3.7077371761981955e-05,
      "loss": 1.3439,
      "num_input_tokens_seen": 30266890288,
      "step": 38470
    },
    {
      "epoch": 4.081370676851263,
      "grad_norm": 0.5579494805630876,
      "learning_rate": 3.707676326484598e-05,
      "loss": 1.3769,
      "num_input_tokens_seen": 30267677072,
      "step": 38471
    },
    {
      "epoch": 4.081476766390834,
      "grad_norm": 0.5625321571904055,
      "learning_rate": 3.707615475837744e-05,
      "loss": 1.2065,
      "num_input_tokens_seen": 30268463744,
      "step": 38472
    },
    {
      "epoch": 4.081582855930405,
      "grad_norm": 0.6621435319479965,
      "learning_rate": 3.7075546242576806e-05,
      "loss": 1.2325,
      "num_input_tokens_seen": 30269250512,
      "step": 38473
    },
    {
      "epoch": 4.081688945469977,
      "grad_norm": 0.49637797959346186,
      "learning_rate": 3.707493771744454e-05,
      "loss": 1.1843,
      "num_input_tokens_seen": 30270037296,
      "step": 38474
    },
    {
      "epoch": 4.081795035009548,
      "grad_norm": 0.6296612438067513,
      "learning_rate": 3.707432918298112e-05,
      "loss": 1.2324,
      "num_input_tokens_seen": 30270824112,
      "step": 38475
    },
    {
      "epoch": 4.08190112454912,
      "grad_norm": 0.6819327663217861,
      "learning_rate": 3.7073720639187005e-05,
      "loss": 1.3127,
      "num_input_tokens_seen": 30271610880,
      "step": 38476
    },
    {
      "epoch": 4.082007214088691,
      "grad_norm": 0.701718677294482,
      "learning_rate": 3.7073112086062676e-05,
      "loss": 1.2646,
      "num_input_tokens_seen": 30272397632,
      "step": 38477
    },
    {
      "epoch": 4.082113303628263,
      "grad_norm": 0.7077256857315315,
      "learning_rate": 3.7072503523608605e-05,
      "loss": 1.4155,
      "num_input_tokens_seen": 30273184416,
      "step": 38478
    },
    {
      "epoch": 4.082219393167834,
      "grad_norm": 0.5841826422267898,
      "learning_rate": 3.707189495182525e-05,
      "loss": 1.3106,
      "num_input_tokens_seen": 30273971136,
      "step": 38479
    },
    {
      "epoch": 4.082325482707405,
      "grad_norm": 0.8221720618934986,
      "learning_rate": 3.707128637071309e-05,
      "loss": 1.3183,
      "num_input_tokens_seen": 30274757840,
      "step": 38480
    },
    {
      "epoch": 4.082431572246977,
      "grad_norm": 0.5602314972403836,
      "learning_rate": 3.70706777802726e-05,
      "loss": 1.2077,
      "num_input_tokens_seen": 30275544608,
      "step": 38481
    },
    {
      "epoch": 4.082537661786548,
      "grad_norm": 0.6016048480174578,
      "learning_rate": 3.7070069180504244e-05,
      "loss": 1.3888,
      "num_input_tokens_seen": 30276331376,
      "step": 38482
    },
    {
      "epoch": 4.08264375132612,
      "grad_norm": 0.4897459266636105,
      "learning_rate": 3.7069460571408486e-05,
      "loss": 1.2261,
      "num_input_tokens_seen": 30277118112,
      "step": 38483
    },
    {
      "epoch": 4.082749840865691,
      "grad_norm": 0.5726659575230552,
      "learning_rate": 3.7068851952985804e-05,
      "loss": 1.3205,
      "num_input_tokens_seen": 30277904816,
      "step": 38484
    },
    {
      "epoch": 4.082855930405262,
      "grad_norm": 0.5326853820445554,
      "learning_rate": 3.706824332523668e-05,
      "loss": 1.3672,
      "num_input_tokens_seen": 30278691456,
      "step": 38485
    },
    {
      "epoch": 4.0829620199448335,
      "grad_norm": 0.5461034495829543,
      "learning_rate": 3.7067634688161554e-05,
      "loss": 1.2023,
      "num_input_tokens_seen": 30279478240,
      "step": 38486
    },
    {
      "epoch": 4.083068109484405,
      "grad_norm": 0.5976204795915723,
      "learning_rate": 3.706702604176093e-05,
      "loss": 1.321,
      "num_input_tokens_seen": 30280264912,
      "step": 38487
    },
    {
      "epoch": 4.0831741990239765,
      "grad_norm": 0.48398445555642533,
      "learning_rate": 3.7066417386035253e-05,
      "loss": 1.2267,
      "num_input_tokens_seen": 30281051632,
      "step": 38488
    },
    {
      "epoch": 4.0832802885635475,
      "grad_norm": 0.4914628743731627,
      "learning_rate": 3.7065808720985e-05,
      "loss": 1.2653,
      "num_input_tokens_seen": 30281838432,
      "step": 38489
    },
    {
      "epoch": 4.083386378103119,
      "grad_norm": 0.7822164504461696,
      "learning_rate": 3.706520004661065e-05,
      "loss": 1.2816,
      "num_input_tokens_seen": 30282625360,
      "step": 38490
    },
    {
      "epoch": 4.0834924676426905,
      "grad_norm": 0.6414878951212216,
      "learning_rate": 3.706459136291266e-05,
      "loss": 1.2093,
      "num_input_tokens_seen": 30283412096,
      "step": 38491
    },
    {
      "epoch": 4.0835985571822615,
      "grad_norm": 0.5846626032565035,
      "learning_rate": 3.706398266989152e-05,
      "loss": 1.3346,
      "num_input_tokens_seen": 30284198880,
      "step": 38492
    },
    {
      "epoch": 4.083704646721833,
      "grad_norm": 0.47571432734896046,
      "learning_rate": 3.706337396754768e-05,
      "loss": 1.2803,
      "num_input_tokens_seen": 30284985600,
      "step": 38493
    },
    {
      "epoch": 4.0838107362614045,
      "grad_norm": 0.5592975530465505,
      "learning_rate": 3.706276525588162e-05,
      "loss": 1.3603,
      "num_input_tokens_seen": 30285772352,
      "step": 38494
    },
    {
      "epoch": 4.083916825800976,
      "grad_norm": 0.5262597683592768,
      "learning_rate": 3.706215653489381e-05,
      "loss": 1.3494,
      "num_input_tokens_seen": 30286559136,
      "step": 38495
    },
    {
      "epoch": 4.084022915340547,
      "grad_norm": 0.5591570869037593,
      "learning_rate": 3.706154780458472e-05,
      "loss": 1.2875,
      "num_input_tokens_seen": 30287345872,
      "step": 38496
    },
    {
      "epoch": 4.084129004880118,
      "grad_norm": 0.4730219860961147,
      "learning_rate": 3.706093906495481e-05,
      "loss": 1.2116,
      "num_input_tokens_seen": 30288132704,
      "step": 38497
    },
    {
      "epoch": 4.08423509441969,
      "grad_norm": 0.6785577773449449,
      "learning_rate": 3.706033031600457e-05,
      "loss": 1.2801,
      "num_input_tokens_seen": 30288919552,
      "step": 38498
    },
    {
      "epoch": 4.084341183959261,
      "grad_norm": 0.5624861847989416,
      "learning_rate": 3.705972155773446e-05,
      "loss": 1.307,
      "num_input_tokens_seen": 30289706400,
      "step": 38499
    },
    {
      "epoch": 4.084447273498833,
      "grad_norm": 0.5706055111142334,
      "learning_rate": 3.705911279014495e-05,
      "loss": 1.262,
      "num_input_tokens_seen": 30290493136,
      "step": 38500
    },
    {
      "epoch": 4.084553363038404,
      "grad_norm": 0.5340096888306254,
      "learning_rate": 3.705850401323651e-05,
      "loss": 1.3013,
      "num_input_tokens_seen": 30291279968,
      "step": 38501
    },
    {
      "epoch": 4.084659452577976,
      "grad_norm": 0.4863985716440427,
      "learning_rate": 3.7057895227009623e-05,
      "loss": 1.26,
      "num_input_tokens_seen": 30292066672,
      "step": 38502
    },
    {
      "epoch": 4.084765542117547,
      "grad_norm": 0.6922003542169526,
      "learning_rate": 3.7057286431464736e-05,
      "loss": 1.2251,
      "num_input_tokens_seen": 30292853424,
      "step": 38503
    },
    {
      "epoch": 4.084871631657118,
      "grad_norm": 0.5772468264295652,
      "learning_rate": 3.705667762660233e-05,
      "loss": 1.3418,
      "num_input_tokens_seen": 30293640160,
      "step": 38504
    },
    {
      "epoch": 4.08497772119669,
      "grad_norm": 0.7007722448318818,
      "learning_rate": 3.705606881242288e-05,
      "loss": 1.3235,
      "num_input_tokens_seen": 30294426944,
      "step": 38505
    },
    {
      "epoch": 4.085083810736261,
      "grad_norm": 0.6754815171296337,
      "learning_rate": 3.7055459988926855e-05,
      "loss": 1.2874,
      "num_input_tokens_seen": 30295213712,
      "step": 38506
    },
    {
      "epoch": 4.085189900275833,
      "grad_norm": 0.506402775181008,
      "learning_rate": 3.705485115611473e-05,
      "loss": 1.257,
      "num_input_tokens_seen": 30296000480,
      "step": 38507
    },
    {
      "epoch": 4.085295989815404,
      "grad_norm": 0.6091322150127249,
      "learning_rate": 3.705424231398696e-05,
      "loss": 1.1694,
      "num_input_tokens_seen": 30296787264,
      "step": 38508
    },
    {
      "epoch": 4.085402079354975,
      "grad_norm": 0.6408857119726964,
      "learning_rate": 3.705363346254402e-05,
      "loss": 1.3776,
      "num_input_tokens_seen": 30297573968,
      "step": 38509
    },
    {
      "epoch": 4.085508168894547,
      "grad_norm": 0.5297307550647086,
      "learning_rate": 3.70530246017864e-05,
      "loss": 1.3491,
      "num_input_tokens_seen": 30298360704,
      "step": 38510
    },
    {
      "epoch": 4.085614258434118,
      "grad_norm": 0.7359740032432006,
      "learning_rate": 3.705241573171456e-05,
      "loss": 1.3428,
      "num_input_tokens_seen": 30299147408,
      "step": 38511
    },
    {
      "epoch": 4.08572034797369,
      "grad_norm": 0.5532558224281552,
      "learning_rate": 3.705180685232895e-05,
      "loss": 1.2154,
      "num_input_tokens_seen": 30299934080,
      "step": 38512
    },
    {
      "epoch": 4.085826437513261,
      "grad_norm": 0.8492973957426337,
      "learning_rate": 3.705119796363007e-05,
      "loss": 1.3231,
      "num_input_tokens_seen": 30300720832,
      "step": 38513
    },
    {
      "epoch": 4.085932527052832,
      "grad_norm": 0.6361595753554983,
      "learning_rate": 3.705058906561837e-05,
      "loss": 1.3853,
      "num_input_tokens_seen": 30301507568,
      "step": 38514
    },
    {
      "epoch": 4.086038616592404,
      "grad_norm": 0.7256025061650672,
      "learning_rate": 3.7049980158294335e-05,
      "loss": 1.436,
      "num_input_tokens_seen": 30302294304,
      "step": 38515
    },
    {
      "epoch": 4.086144706131975,
      "grad_norm": 0.6262432704298599,
      "learning_rate": 3.7049371241658424e-05,
      "loss": 1.3769,
      "num_input_tokens_seen": 30303081024,
      "step": 38516
    },
    {
      "epoch": 4.086250795671547,
      "grad_norm": 0.6591247383359559,
      "learning_rate": 3.7048762315711114e-05,
      "loss": 1.3562,
      "num_input_tokens_seen": 30303867808,
      "step": 38517
    },
    {
      "epoch": 4.086356885211118,
      "grad_norm": 0.7500137849710867,
      "learning_rate": 3.704815338045288e-05,
      "loss": 1.4218,
      "num_input_tokens_seen": 30304654560,
      "step": 38518
    },
    {
      "epoch": 4.08646297475069,
      "grad_norm": 0.5957793839010528,
      "learning_rate": 3.704754443588417e-05,
      "loss": 1.3735,
      "num_input_tokens_seen": 30305441408,
      "step": 38519
    },
    {
      "epoch": 4.086569064290261,
      "grad_norm": 0.6096854705392079,
      "learning_rate": 3.704693548200548e-05,
      "loss": 1.3039,
      "num_input_tokens_seen": 30306228192,
      "step": 38520
    },
    {
      "epoch": 4.086675153829832,
      "grad_norm": 0.5479052244092699,
      "learning_rate": 3.7046326518817285e-05,
      "loss": 1.3811,
      "num_input_tokens_seen": 30307014896,
      "step": 38521
    },
    {
      "epoch": 4.086781243369404,
      "grad_norm": 0.5733405403141733,
      "learning_rate": 3.704571754632003e-05,
      "loss": 1.3291,
      "num_input_tokens_seen": 30307801616,
      "step": 38522
    },
    {
      "epoch": 4.086887332908975,
      "grad_norm": 0.6009775279170413,
      "learning_rate": 3.70451085645142e-05,
      "loss": 1.3208,
      "num_input_tokens_seen": 30308588384,
      "step": 38523
    },
    {
      "epoch": 4.086993422448547,
      "grad_norm": 0.6183664966851797,
      "learning_rate": 3.704449957340026e-05,
      "loss": 1.3561,
      "num_input_tokens_seen": 30309375120,
      "step": 38524
    },
    {
      "epoch": 4.087099511988118,
      "grad_norm": 0.7299734513180411,
      "learning_rate": 3.704389057297869e-05,
      "loss": 1.3284,
      "num_input_tokens_seen": 30310161824,
      "step": 38525
    },
    {
      "epoch": 4.087205601527689,
      "grad_norm": 0.5664072089887692,
      "learning_rate": 3.704328156324994e-05,
      "loss": 1.2872,
      "num_input_tokens_seen": 30310948736,
      "step": 38526
    },
    {
      "epoch": 4.087311691067261,
      "grad_norm": 0.7581023009640429,
      "learning_rate": 3.7042672544214515e-05,
      "loss": 1.2455,
      "num_input_tokens_seen": 30311735408,
      "step": 38527
    },
    {
      "epoch": 4.087417780606832,
      "grad_norm": 0.467853122991438,
      "learning_rate": 3.704206351587286e-05,
      "loss": 1.2737,
      "num_input_tokens_seen": 30312522240,
      "step": 38528
    },
    {
      "epoch": 4.087523870146404,
      "grad_norm": 0.6565762513333055,
      "learning_rate": 3.7041454478225446e-05,
      "loss": 1.2631,
      "num_input_tokens_seen": 30313309072,
      "step": 38529
    },
    {
      "epoch": 4.087629959685975,
      "grad_norm": 0.7444609788958603,
      "learning_rate": 3.704084543127275e-05,
      "loss": 1.3197,
      "num_input_tokens_seen": 30314095840,
      "step": 38530
    },
    {
      "epoch": 4.087736049225547,
      "grad_norm": 0.5823756087857919,
      "learning_rate": 3.704023637501525e-05,
      "loss": 1.5092,
      "num_input_tokens_seen": 30314882496,
      "step": 38531
    },
    {
      "epoch": 4.087842138765118,
      "grad_norm": 0.6110662817466682,
      "learning_rate": 3.70396273094534e-05,
      "loss": 1.3081,
      "num_input_tokens_seen": 30315669280,
      "step": 38532
    },
    {
      "epoch": 4.087948228304689,
      "grad_norm": 0.5410090451969631,
      "learning_rate": 3.7039018234587684e-05,
      "loss": 1.2813,
      "num_input_tokens_seen": 30316456000,
      "step": 38533
    },
    {
      "epoch": 4.088054317844261,
      "grad_norm": 0.5282146635288699,
      "learning_rate": 3.703840915041856e-05,
      "loss": 1.2681,
      "num_input_tokens_seen": 30317242800,
      "step": 38534
    },
    {
      "epoch": 4.088160407383832,
      "grad_norm": 0.6725542637600546,
      "learning_rate": 3.703780005694652e-05,
      "loss": 1.1984,
      "num_input_tokens_seen": 30318029616,
      "step": 38535
    },
    {
      "epoch": 4.088266496923404,
      "grad_norm": 0.5219666060224132,
      "learning_rate": 3.7037190954172015e-05,
      "loss": 1.2811,
      "num_input_tokens_seen": 30318816352,
      "step": 38536
    },
    {
      "epoch": 4.088372586462975,
      "grad_norm": 0.6047742860716837,
      "learning_rate": 3.7036581842095516e-05,
      "loss": 1.3141,
      "num_input_tokens_seen": 30319603120,
      "step": 38537
    },
    {
      "epoch": 4.088478676002546,
      "grad_norm": 0.78938403445861,
      "learning_rate": 3.703597272071751e-05,
      "loss": 1.2974,
      "num_input_tokens_seen": 30320389904,
      "step": 38538
    },
    {
      "epoch": 4.088584765542118,
      "grad_norm": 0.6252197313999077,
      "learning_rate": 3.7035363590038455e-05,
      "loss": 1.2198,
      "num_input_tokens_seen": 30321176688,
      "step": 38539
    },
    {
      "epoch": 4.088690855081689,
      "grad_norm": 0.6464082424730403,
      "learning_rate": 3.7034754450058814e-05,
      "loss": 1.3168,
      "num_input_tokens_seen": 30321963472,
      "step": 38540
    },
    {
      "epoch": 4.088796944621261,
      "grad_norm": 0.5178592611322111,
      "learning_rate": 3.7034145300779084e-05,
      "loss": 1.294,
      "num_input_tokens_seen": 30322750224,
      "step": 38541
    },
    {
      "epoch": 4.088903034160832,
      "grad_norm": 0.8837730108949675,
      "learning_rate": 3.703353614219971e-05,
      "loss": 1.2592,
      "num_input_tokens_seen": 30323536960,
      "step": 38542
    },
    {
      "epoch": 4.089009123700403,
      "grad_norm": 0.5904393928597942,
      "learning_rate": 3.703292697432117e-05,
      "loss": 1.3319,
      "num_input_tokens_seen": 30324323760,
      "step": 38543
    },
    {
      "epoch": 4.089115213239975,
      "grad_norm": 0.7135143327606566,
      "learning_rate": 3.703231779714395e-05,
      "loss": 1.2645,
      "num_input_tokens_seen": 30325110496,
      "step": 38544
    },
    {
      "epoch": 4.089221302779546,
      "grad_norm": 0.9189148764713561,
      "learning_rate": 3.703170861066849e-05,
      "loss": 1.3822,
      "num_input_tokens_seen": 30325897248,
      "step": 38545
    },
    {
      "epoch": 4.089327392319118,
      "grad_norm": 0.6147696426829515,
      "learning_rate": 3.703109941489529e-05,
      "loss": 1.3803,
      "num_input_tokens_seen": 30326684016,
      "step": 38546
    },
    {
      "epoch": 4.089433481858689,
      "grad_norm": 0.7055834326697048,
      "learning_rate": 3.703049020982481e-05,
      "loss": 1.259,
      "num_input_tokens_seen": 30327470816,
      "step": 38547
    },
    {
      "epoch": 4.0895395713982605,
      "grad_norm": 0.9811158699854455,
      "learning_rate": 3.7029880995457515e-05,
      "loss": 1.3929,
      "num_input_tokens_seen": 30328257520,
      "step": 38548
    },
    {
      "epoch": 4.0896456609378316,
      "grad_norm": 0.7676032237257175,
      "learning_rate": 3.702927177179388e-05,
      "loss": 1.2187,
      "num_input_tokens_seen": 30329044256,
      "step": 38549
    },
    {
      "epoch": 4.089751750477403,
      "grad_norm": 1.0638702945444627,
      "learning_rate": 3.702866253883438e-05,
      "loss": 1.3582,
      "num_input_tokens_seen": 30329830992,
      "step": 38550
    },
    {
      "epoch": 4.0898578400169745,
      "grad_norm": 0.5929406316042058,
      "learning_rate": 3.7028053296579476e-05,
      "loss": 1.3759,
      "num_input_tokens_seen": 30330617696,
      "step": 38551
    },
    {
      "epoch": 4.0899639295565455,
      "grad_norm": 1.1184241317287242,
      "learning_rate": 3.702744404502966e-05,
      "loss": 1.3413,
      "num_input_tokens_seen": 30331404512,
      "step": 38552
    },
    {
      "epoch": 4.0900700190961174,
      "grad_norm": 0.7945517011689623,
      "learning_rate": 3.7026834784185375e-05,
      "loss": 1.185,
      "num_input_tokens_seen": 30332191280,
      "step": 38553
    },
    {
      "epoch": 4.0901761086356885,
      "grad_norm": 0.6943460350779347,
      "learning_rate": 3.702622551404711e-05,
      "loss": 1.2298,
      "num_input_tokens_seen": 30332978032,
      "step": 38554
    },
    {
      "epoch": 4.0902821981752595,
      "grad_norm": 0.9485195746960949,
      "learning_rate": 3.702561623461533e-05,
      "loss": 1.2432,
      "num_input_tokens_seen": 30333764928,
      "step": 38555
    },
    {
      "epoch": 4.090388287714831,
      "grad_norm": 0.7844329567045674,
      "learning_rate": 3.702500694589051e-05,
      "loss": 1.37,
      "num_input_tokens_seen": 30334551680,
      "step": 38556
    },
    {
      "epoch": 4.0904943772544025,
      "grad_norm": 0.6509964237005628,
      "learning_rate": 3.702439764787311e-05,
      "loss": 1.3077,
      "num_input_tokens_seen": 30335338464,
      "step": 38557
    },
    {
      "epoch": 4.090600466793974,
      "grad_norm": 0.781038471584708,
      "learning_rate": 3.7023788340563606e-05,
      "loss": 1.3473,
      "num_input_tokens_seen": 30336125248,
      "step": 38558
    },
    {
      "epoch": 4.090706556333545,
      "grad_norm": 0.5406024240518672,
      "learning_rate": 3.7023179023962485e-05,
      "loss": 1.3255,
      "num_input_tokens_seen": 30336912032,
      "step": 38559
    },
    {
      "epoch": 4.090812645873117,
      "grad_norm": 0.5784446121204717,
      "learning_rate": 3.702256969807019e-05,
      "loss": 1.2768,
      "num_input_tokens_seen": 30337698800,
      "step": 38560
    },
    {
      "epoch": 4.090918735412688,
      "grad_norm": 0.7741850659368386,
      "learning_rate": 3.702196036288722e-05,
      "loss": 1.4432,
      "num_input_tokens_seen": 30338485520,
      "step": 38561
    },
    {
      "epoch": 4.091024824952259,
      "grad_norm": 0.48113101979725226,
      "learning_rate": 3.7021351018414026e-05,
      "loss": 1.1955,
      "num_input_tokens_seen": 30339272352,
      "step": 38562
    },
    {
      "epoch": 4.091130914491831,
      "grad_norm": 0.7610336996370733,
      "learning_rate": 3.7020741664651075e-05,
      "loss": 1.2715,
      "num_input_tokens_seen": 30340059168,
      "step": 38563
    },
    {
      "epoch": 4.091237004031402,
      "grad_norm": 0.6337243941843748,
      "learning_rate": 3.7020132301598857e-05,
      "loss": 1.3175,
      "num_input_tokens_seen": 30340845936,
      "step": 38564
    },
    {
      "epoch": 4.091343093570974,
      "grad_norm": 0.6174532542267318,
      "learning_rate": 3.701952292925784e-05,
      "loss": 1.2696,
      "num_input_tokens_seen": 30341632720,
      "step": 38565
    },
    {
      "epoch": 4.091449183110545,
      "grad_norm": 0.6703791387816443,
      "learning_rate": 3.701891354762847e-05,
      "loss": 1.2781,
      "num_input_tokens_seen": 30342419520,
      "step": 38566
    },
    {
      "epoch": 4.091555272650116,
      "grad_norm": 0.6099045914310587,
      "learning_rate": 3.7018304156711255e-05,
      "loss": 1.2846,
      "num_input_tokens_seen": 30343206272,
      "step": 38567
    },
    {
      "epoch": 4.091661362189688,
      "grad_norm": 0.5103404885968311,
      "learning_rate": 3.701769475650664e-05,
      "loss": 1.2586,
      "num_input_tokens_seen": 30343993008,
      "step": 38568
    },
    {
      "epoch": 4.091767451729259,
      "grad_norm": 0.637011710547263,
      "learning_rate": 3.70170853470151e-05,
      "loss": 1.3766,
      "num_input_tokens_seen": 30344779760,
      "step": 38569
    },
    {
      "epoch": 4.091873541268831,
      "grad_norm": 0.5242230970579929,
      "learning_rate": 3.701647592823711e-05,
      "loss": 1.2016,
      "num_input_tokens_seen": 30345566592,
      "step": 38570
    },
    {
      "epoch": 4.091979630808402,
      "grad_norm": 0.5832054636109434,
      "learning_rate": 3.7015866500173145e-05,
      "loss": 1.4148,
      "num_input_tokens_seen": 30346353392,
      "step": 38571
    },
    {
      "epoch": 4.092085720347974,
      "grad_norm": 0.5819729275145258,
      "learning_rate": 3.701525706282366e-05,
      "loss": 1.2787,
      "num_input_tokens_seen": 30347140144,
      "step": 38572
    },
    {
      "epoch": 4.092191809887545,
      "grad_norm": 0.5743738904372938,
      "learning_rate": 3.7014647616189145e-05,
      "loss": 1.2354,
      "num_input_tokens_seen": 30347926848,
      "step": 38573
    },
    {
      "epoch": 4.092297899427116,
      "grad_norm": 0.6592855750823334,
      "learning_rate": 3.701403816027007e-05,
      "loss": 1.3769,
      "num_input_tokens_seen": 30348713568,
      "step": 38574
    },
    {
      "epoch": 4.092403988966688,
      "grad_norm": 0.43970193917354883,
      "learning_rate": 3.7013428695066885e-05,
      "loss": 1.2787,
      "num_input_tokens_seen": 30349500352,
      "step": 38575
    },
    {
      "epoch": 4.092510078506259,
      "grad_norm": 0.4975965957226977,
      "learning_rate": 3.701281922058008e-05,
      "loss": 1.2886,
      "num_input_tokens_seen": 30350287184,
      "step": 38576
    },
    {
      "epoch": 4.092616168045831,
      "grad_norm": 0.6639424597760833,
      "learning_rate": 3.7012209736810124e-05,
      "loss": 1.4198,
      "num_input_tokens_seen": 30351073936,
      "step": 38577
    },
    {
      "epoch": 4.092722257585402,
      "grad_norm": 0.5194808775498662,
      "learning_rate": 3.7011600243757485e-05,
      "loss": 1.3121,
      "num_input_tokens_seen": 30351860752,
      "step": 38578
    },
    {
      "epoch": 4.092828347124973,
      "grad_norm": 0.664911373872174,
      "learning_rate": 3.7010990741422624e-05,
      "loss": 1.38,
      "num_input_tokens_seen": 30352647424,
      "step": 38579
    },
    {
      "epoch": 4.092934436664545,
      "grad_norm": 0.5793689969919481,
      "learning_rate": 3.701038122980603e-05,
      "loss": 1.3203,
      "num_input_tokens_seen": 30353434208,
      "step": 38580
    },
    {
      "epoch": 4.093040526204116,
      "grad_norm": 0.659345120299346,
      "learning_rate": 3.7009771708908165e-05,
      "loss": 1.3693,
      "num_input_tokens_seen": 30354220880,
      "step": 38581
    },
    {
      "epoch": 4.093146615743688,
      "grad_norm": 0.5020415022076921,
      "learning_rate": 3.70091621787295e-05,
      "loss": 1.2632,
      "num_input_tokens_seen": 30355007632,
      "step": 38582
    },
    {
      "epoch": 4.093252705283259,
      "grad_norm": 0.5133330677012292,
      "learning_rate": 3.70085526392705e-05,
      "loss": 1.4023,
      "num_input_tokens_seen": 30355794352,
      "step": 38583
    },
    {
      "epoch": 4.09335879482283,
      "grad_norm": 0.5471853761233499,
      "learning_rate": 3.700794309053166e-05,
      "loss": 1.3916,
      "num_input_tokens_seen": 30356581104,
      "step": 38584
    },
    {
      "epoch": 4.093464884362402,
      "grad_norm": 0.5476400976393174,
      "learning_rate": 3.700733353251342e-05,
      "loss": 1.3505,
      "num_input_tokens_seen": 30357367840,
      "step": 38585
    },
    {
      "epoch": 4.093570973901973,
      "grad_norm": 0.56331087950082,
      "learning_rate": 3.7006723965216265e-05,
      "loss": 1.2967,
      "num_input_tokens_seen": 30358154608,
      "step": 38586
    },
    {
      "epoch": 4.093677063441545,
      "grad_norm": 0.48877588477184086,
      "learning_rate": 3.700611438864068e-05,
      "loss": 1.3411,
      "num_input_tokens_seen": 30358941328,
      "step": 38587
    },
    {
      "epoch": 4.093783152981116,
      "grad_norm": 0.5793528997306444,
      "learning_rate": 3.7005504802787105e-05,
      "loss": 1.4234,
      "num_input_tokens_seen": 30359728112,
      "step": 38588
    },
    {
      "epoch": 4.093889242520688,
      "grad_norm": 0.4879780003320932,
      "learning_rate": 3.700489520765604e-05,
      "loss": 1.2529,
      "num_input_tokens_seen": 30360514896,
      "step": 38589
    },
    {
      "epoch": 4.093995332060259,
      "grad_norm": 0.5611696148580103,
      "learning_rate": 3.7004285603247934e-05,
      "loss": 1.2567,
      "num_input_tokens_seen": 30361301632,
      "step": 38590
    },
    {
      "epoch": 4.09410142159983,
      "grad_norm": 0.4602446835010033,
      "learning_rate": 3.700367598956328e-05,
      "loss": 1.3162,
      "num_input_tokens_seen": 30362088432,
      "step": 38591
    },
    {
      "epoch": 4.094207511139402,
      "grad_norm": 0.4374096450413925,
      "learning_rate": 3.7003066366602526e-05,
      "loss": 1.1992,
      "num_input_tokens_seen": 30362875184,
      "step": 38592
    },
    {
      "epoch": 4.094313600678973,
      "grad_norm": 0.5580823894839224,
      "learning_rate": 3.700245673436616e-05,
      "loss": 1.2864,
      "num_input_tokens_seen": 30363661968,
      "step": 38593
    },
    {
      "epoch": 4.094419690218545,
      "grad_norm": 0.48050878561004334,
      "learning_rate": 3.700184709285465e-05,
      "loss": 1.3323,
      "num_input_tokens_seen": 30364448736,
      "step": 38594
    },
    {
      "epoch": 4.094525779758116,
      "grad_norm": 0.54006846653206,
      "learning_rate": 3.700123744206846e-05,
      "loss": 1.1627,
      "num_input_tokens_seen": 30365235408,
      "step": 38595
    },
    {
      "epoch": 4.094631869297687,
      "grad_norm": 0.4955447243699964,
      "learning_rate": 3.700062778200807e-05,
      "loss": 1.2928,
      "num_input_tokens_seen": 30366022224,
      "step": 38596
    },
    {
      "epoch": 4.094737958837259,
      "grad_norm": 0.5267684114789636,
      "learning_rate": 3.700001811267394e-05,
      "loss": 1.3459,
      "num_input_tokens_seen": 30366809056,
      "step": 38597
    },
    {
      "epoch": 4.09484404837683,
      "grad_norm": 0.6278585032895904,
      "learning_rate": 3.699940843406655e-05,
      "loss": 1.4097,
      "num_input_tokens_seen": 30367595872,
      "step": 38598
    },
    {
      "epoch": 4.094950137916402,
      "grad_norm": 0.549324968248889,
      "learning_rate": 3.699879874618638e-05,
      "loss": 1.4097,
      "num_input_tokens_seen": 30368382704,
      "step": 38599
    },
    {
      "epoch": 4.095056227455973,
      "grad_norm": 0.6970225144919268,
      "learning_rate": 3.6998189049033874e-05,
      "loss": 1.2294,
      "num_input_tokens_seen": 30369169392,
      "step": 38600
    },
    {
      "epoch": 4.095162316995545,
      "grad_norm": 0.6865139102268086,
      "learning_rate": 3.6997579342609535e-05,
      "loss": 1.2816,
      "num_input_tokens_seen": 30369956096,
      "step": 38601
    },
    {
      "epoch": 4.095268406535116,
      "grad_norm": 0.617263809315531,
      "learning_rate": 3.699696962691381e-05,
      "loss": 1.3743,
      "num_input_tokens_seen": 30370742816,
      "step": 38602
    },
    {
      "epoch": 4.095374496074687,
      "grad_norm": 0.8629779244469895,
      "learning_rate": 3.6996359901947176e-05,
      "loss": 1.3277,
      "num_input_tokens_seen": 30371529584,
      "step": 38603
    },
    {
      "epoch": 4.095480585614259,
      "grad_norm": 0.6076892889834636,
      "learning_rate": 3.699575016771012e-05,
      "loss": 1.378,
      "num_input_tokens_seen": 30372316256,
      "step": 38604
    },
    {
      "epoch": 4.09558667515383,
      "grad_norm": 0.8501220419203178,
      "learning_rate": 3.699514042420308e-05,
      "loss": 1.3244,
      "num_input_tokens_seen": 30373103040,
      "step": 38605
    },
    {
      "epoch": 4.095692764693402,
      "grad_norm": 0.6948536684730107,
      "learning_rate": 3.699453067142656e-05,
      "loss": 1.3353,
      "num_input_tokens_seen": 30373889712,
      "step": 38606
    },
    {
      "epoch": 4.095798854232973,
      "grad_norm": 0.760121140064774,
      "learning_rate": 3.6993920909381016e-05,
      "loss": 1.3393,
      "num_input_tokens_seen": 30374676528,
      "step": 38607
    },
    {
      "epoch": 4.095904943772544,
      "grad_norm": 0.6708491902313212,
      "learning_rate": 3.6993311138066927e-05,
      "loss": 1.3898,
      "num_input_tokens_seen": 30375463200,
      "step": 38608
    },
    {
      "epoch": 4.096011033312116,
      "grad_norm": 0.6586499735513432,
      "learning_rate": 3.699270135748475e-05,
      "loss": 1.3114,
      "num_input_tokens_seen": 30376249952,
      "step": 38609
    },
    {
      "epoch": 4.096117122851687,
      "grad_norm": 0.6153189811292593,
      "learning_rate": 3.699209156763498e-05,
      "loss": 1.3192,
      "num_input_tokens_seen": 30377036688,
      "step": 38610
    },
    {
      "epoch": 4.0962232123912585,
      "grad_norm": 0.5715980375548347,
      "learning_rate": 3.699148176851806e-05,
      "loss": 1.2441,
      "num_input_tokens_seen": 30377823440,
      "step": 38611
    },
    {
      "epoch": 4.09632930193083,
      "grad_norm": 0.5778886026520914,
      "learning_rate": 3.6990871960134484e-05,
      "loss": 1.3228,
      "num_input_tokens_seen": 30378610160,
      "step": 38612
    },
    {
      "epoch": 4.096435391470401,
      "grad_norm": 0.5317823888698143,
      "learning_rate": 3.6990262142484704e-05,
      "loss": 1.2147,
      "num_input_tokens_seen": 30379396880,
      "step": 38613
    },
    {
      "epoch": 4.0965414810099725,
      "grad_norm": 0.6070938604130515,
      "learning_rate": 3.698965231556921e-05,
      "loss": 1.2436,
      "num_input_tokens_seen": 30380183632,
      "step": 38614
    },
    {
      "epoch": 4.0966475705495435,
      "grad_norm": 0.5003438133880161,
      "learning_rate": 3.698904247938846e-05,
      "loss": 1.3202,
      "num_input_tokens_seen": 30380970400,
      "step": 38615
    },
    {
      "epoch": 4.0967536600891155,
      "grad_norm": 0.5634546307213779,
      "learning_rate": 3.698843263394293e-05,
      "loss": 1.2851,
      "num_input_tokens_seen": 30381757152,
      "step": 38616
    },
    {
      "epoch": 4.0968597496286865,
      "grad_norm": 0.6128789789562245,
      "learning_rate": 3.6987822779233095e-05,
      "loss": 1.2131,
      "num_input_tokens_seen": 30382543968,
      "step": 38617
    },
    {
      "epoch": 4.096965839168258,
      "grad_norm": 0.5244922324267806,
      "learning_rate": 3.6987212915259415e-05,
      "loss": 1.3435,
      "num_input_tokens_seen": 30383330672,
      "step": 38618
    },
    {
      "epoch": 4.097071928707829,
      "grad_norm": 0.5565466213808872,
      "learning_rate": 3.698660304202238e-05,
      "loss": 1.2483,
      "num_input_tokens_seen": 30384117504,
      "step": 38619
    },
    {
      "epoch": 4.0971780182474005,
      "grad_norm": 0.602093902822074,
      "learning_rate": 3.6985993159522435e-05,
      "loss": 1.3365,
      "num_input_tokens_seen": 30384904224,
      "step": 38620
    },
    {
      "epoch": 4.097284107786972,
      "grad_norm": 0.433508483890962,
      "learning_rate": 3.698538326776008e-05,
      "loss": 1.1948,
      "num_input_tokens_seen": 30385690992,
      "step": 38621
    },
    {
      "epoch": 4.097390197326543,
      "grad_norm": 0.5287227772812144,
      "learning_rate": 3.698477336673577e-05,
      "loss": 1.3373,
      "num_input_tokens_seen": 30386477760,
      "step": 38622
    },
    {
      "epoch": 4.097496286866115,
      "grad_norm": 0.46174767958443064,
      "learning_rate": 3.6984163456449965e-05,
      "loss": 1.3267,
      "num_input_tokens_seen": 30387264448,
      "step": 38623
    },
    {
      "epoch": 4.097602376405686,
      "grad_norm": 0.6015730408752054,
      "learning_rate": 3.698355353690316e-05,
      "loss": 1.2771,
      "num_input_tokens_seen": 30388051088,
      "step": 38624
    },
    {
      "epoch": 4.097708465945257,
      "grad_norm": 0.4816062288091589,
      "learning_rate": 3.698294360809582e-05,
      "loss": 1.2467,
      "num_input_tokens_seen": 30388837792,
      "step": 38625
    },
    {
      "epoch": 4.097814555484829,
      "grad_norm": 0.5115796717397117,
      "learning_rate": 3.698233367002841e-05,
      "loss": 1.23,
      "num_input_tokens_seen": 30389624640,
      "step": 38626
    },
    {
      "epoch": 4.0979206450244,
      "grad_norm": 0.5495144708235513,
      "learning_rate": 3.69817237227014e-05,
      "loss": 1.3912,
      "num_input_tokens_seen": 30390411392,
      "step": 38627
    },
    {
      "epoch": 4.098026734563972,
      "grad_norm": 0.50610084848522,
      "learning_rate": 3.698111376611527e-05,
      "loss": 1.3221,
      "num_input_tokens_seen": 30391198160,
      "step": 38628
    },
    {
      "epoch": 4.098132824103543,
      "grad_norm": 0.6785422903843626,
      "learning_rate": 3.6980503800270485e-05,
      "loss": 1.3553,
      "num_input_tokens_seen": 30391984960,
      "step": 38629
    },
    {
      "epoch": 4.098238913643115,
      "grad_norm": 0.5586780015250574,
      "learning_rate": 3.697989382516752e-05,
      "loss": 1.2943,
      "num_input_tokens_seen": 30392771632,
      "step": 38630
    },
    {
      "epoch": 4.098345003182686,
      "grad_norm": 0.5591527104319839,
      "learning_rate": 3.697928384080684e-05,
      "loss": 1.3241,
      "num_input_tokens_seen": 30393558336,
      "step": 38631
    },
    {
      "epoch": 4.098451092722257,
      "grad_norm": 0.5312201684007491,
      "learning_rate": 3.697867384718893e-05,
      "loss": 1.3041,
      "num_input_tokens_seen": 30394345104,
      "step": 38632
    },
    {
      "epoch": 4.098557182261829,
      "grad_norm": 0.6076396761199931,
      "learning_rate": 3.6978063844314246e-05,
      "loss": 1.2879,
      "num_input_tokens_seen": 30395131808,
      "step": 38633
    },
    {
      "epoch": 4.0986632718014,
      "grad_norm": 0.5145000729151482,
      "learning_rate": 3.697745383218327e-05,
      "loss": 1.4121,
      "num_input_tokens_seen": 30395918560,
      "step": 38634
    },
    {
      "epoch": 4.098769361340972,
      "grad_norm": 0.6223746239263663,
      "learning_rate": 3.697684381079646e-05,
      "loss": 1.2915,
      "num_input_tokens_seen": 30396705376,
      "step": 38635
    },
    {
      "epoch": 4.098875450880543,
      "grad_norm": 0.5270406749484747,
      "learning_rate": 3.6976233780154306e-05,
      "loss": 1.22,
      "num_input_tokens_seen": 30397492112,
      "step": 38636
    },
    {
      "epoch": 4.098981540420114,
      "grad_norm": 0.48130621910611493,
      "learning_rate": 3.6975623740257256e-05,
      "loss": 1.3673,
      "num_input_tokens_seen": 30398278944,
      "step": 38637
    },
    {
      "epoch": 4.099087629959686,
      "grad_norm": 0.8543591212731807,
      "learning_rate": 3.6975013691105816e-05,
      "loss": 1.38,
      "num_input_tokens_seen": 30399065712,
      "step": 38638
    },
    {
      "epoch": 4.099193719499257,
      "grad_norm": 0.5823455611320724,
      "learning_rate": 3.6974403632700426e-05,
      "loss": 1.3502,
      "num_input_tokens_seen": 30399852432,
      "step": 38639
    },
    {
      "epoch": 4.099299809038829,
      "grad_norm": 0.6553205033692967,
      "learning_rate": 3.697379356504157e-05,
      "loss": 1.3244,
      "num_input_tokens_seen": 30400639104,
      "step": 38640
    },
    {
      "epoch": 4.0994058985784,
      "grad_norm": 0.7884028545755425,
      "learning_rate": 3.697318348812971e-05,
      "loss": 1.3445,
      "num_input_tokens_seen": 30401425872,
      "step": 38641
    },
    {
      "epoch": 4.099511988117971,
      "grad_norm": 0.6138900075341573,
      "learning_rate": 3.697257340196534e-05,
      "loss": 1.3363,
      "num_input_tokens_seen": 30402212720,
      "step": 38642
    },
    {
      "epoch": 4.099618077657543,
      "grad_norm": 0.7720593890454598,
      "learning_rate": 3.6971963306548904e-05,
      "loss": 1.2307,
      "num_input_tokens_seen": 30402999552,
      "step": 38643
    },
    {
      "epoch": 4.099724167197114,
      "grad_norm": 0.6445732858336362,
      "learning_rate": 3.6971353201880885e-05,
      "loss": 1.2759,
      "num_input_tokens_seen": 30403786416,
      "step": 38644
    },
    {
      "epoch": 4.099830256736686,
      "grad_norm": 0.7021126023129659,
      "learning_rate": 3.697074308796177e-05,
      "loss": 1.3465,
      "num_input_tokens_seen": 30404573088,
      "step": 38645
    },
    {
      "epoch": 4.099936346276257,
      "grad_norm": 0.6743825415170236,
      "learning_rate": 3.6970132964791995e-05,
      "loss": 1.3093,
      "num_input_tokens_seen": 30405359856,
      "step": 38646
    },
    {
      "epoch": 4.100042435815829,
      "grad_norm": 0.65631261793464,
      "learning_rate": 3.6969522832372067e-05,
      "loss": 1.4261,
      "num_input_tokens_seen": 30406146656,
      "step": 38647
    },
    {
      "epoch": 4.1001485253554,
      "grad_norm": 0.6334735600597712,
      "learning_rate": 3.696891269070244e-05,
      "loss": 1.2986,
      "num_input_tokens_seen": 30406933376,
      "step": 38648
    },
    {
      "epoch": 4.100254614894971,
      "grad_norm": 0.6784893140520283,
      "learning_rate": 3.696830253978359e-05,
      "loss": 1.3872,
      "num_input_tokens_seen": 30407720064,
      "step": 38649
    },
    {
      "epoch": 4.100360704434543,
      "grad_norm": 0.6343204800358746,
      "learning_rate": 3.696769237961599e-05,
      "loss": 1.4146,
      "num_input_tokens_seen": 30408506816,
      "step": 38650
    },
    {
      "epoch": 4.100466793974114,
      "grad_norm": 0.6885413827442415,
      "learning_rate": 3.69670822102001e-05,
      "loss": 1.3986,
      "num_input_tokens_seen": 30409293568,
      "step": 38651
    },
    {
      "epoch": 4.100572883513686,
      "grad_norm": 0.6500269130317955,
      "learning_rate": 3.6966472031536395e-05,
      "loss": 1.3225,
      "num_input_tokens_seen": 30410080416,
      "step": 38652
    },
    {
      "epoch": 4.100678973053257,
      "grad_norm": 0.6258858509458947,
      "learning_rate": 3.696586184362536e-05,
      "loss": 1.2966,
      "num_input_tokens_seen": 30410867264,
      "step": 38653
    },
    {
      "epoch": 4.100785062592828,
      "grad_norm": 0.5392883567911344,
      "learning_rate": 3.696525164646746e-05,
      "loss": 1.3682,
      "num_input_tokens_seen": 30411653984,
      "step": 38654
    },
    {
      "epoch": 4.1008911521324,
      "grad_norm": 0.5361061008747582,
      "learning_rate": 3.696464144006316e-05,
      "loss": 1.2873,
      "num_input_tokens_seen": 30412440784,
      "step": 38655
    },
    {
      "epoch": 4.100997241671971,
      "grad_norm": 0.4683771933089415,
      "learning_rate": 3.696403122441294e-05,
      "loss": 1.2518,
      "num_input_tokens_seen": 30413227552,
      "step": 38656
    },
    {
      "epoch": 4.101103331211543,
      "grad_norm": 0.5187054137008107,
      "learning_rate": 3.6963420999517276e-05,
      "loss": 1.2864,
      "num_input_tokens_seen": 30414014352,
      "step": 38657
    },
    {
      "epoch": 4.101209420751114,
      "grad_norm": 0.6760442320896942,
      "learning_rate": 3.696281076537662e-05,
      "loss": 1.368,
      "num_input_tokens_seen": 30414801120,
      "step": 38658
    },
    {
      "epoch": 4.101315510290686,
      "grad_norm": 0.45325877380295193,
      "learning_rate": 3.696220052199145e-05,
      "loss": 1.3052,
      "num_input_tokens_seen": 30415587952,
      "step": 38659
    },
    {
      "epoch": 4.101421599830257,
      "grad_norm": 0.4790954633823716,
      "learning_rate": 3.696159026936226e-05,
      "loss": 1.232,
      "num_input_tokens_seen": 30416374720,
      "step": 38660
    },
    {
      "epoch": 4.101527689369828,
      "grad_norm": 0.8714871166608525,
      "learning_rate": 3.6960980007489485e-05,
      "loss": 1.3395,
      "num_input_tokens_seen": 30417161536,
      "step": 38661
    },
    {
      "epoch": 4.1016337789094,
      "grad_norm": 0.6471732300209382,
      "learning_rate": 3.6960369736373623e-05,
      "loss": 1.3665,
      "num_input_tokens_seen": 30417948224,
      "step": 38662
    },
    {
      "epoch": 4.101739868448971,
      "grad_norm": 1.0580812874329257,
      "learning_rate": 3.695975945601514e-05,
      "loss": 1.3925,
      "num_input_tokens_seen": 30418734896,
      "step": 38663
    },
    {
      "epoch": 4.101845957988543,
      "grad_norm": 0.5592629917853117,
      "learning_rate": 3.695914916641451e-05,
      "loss": 1.1785,
      "num_input_tokens_seen": 30419521648,
      "step": 38664
    },
    {
      "epoch": 4.101952047528114,
      "grad_norm": 0.8490114566382622,
      "learning_rate": 3.695853886757219e-05,
      "loss": 1.326,
      "num_input_tokens_seen": 30420308448,
      "step": 38665
    },
    {
      "epoch": 4.102058137067685,
      "grad_norm": 0.6887252156641755,
      "learning_rate": 3.6957928559488664e-05,
      "loss": 1.3904,
      "num_input_tokens_seen": 30421095264,
      "step": 38666
    },
    {
      "epoch": 4.102164226607257,
      "grad_norm": 0.7644150454728984,
      "learning_rate": 3.6957318242164404e-05,
      "loss": 1.2648,
      "num_input_tokens_seen": 30421882048,
      "step": 38667
    },
    {
      "epoch": 4.102270316146828,
      "grad_norm": 0.9249067688583303,
      "learning_rate": 3.695670791559989e-05,
      "loss": 1.297,
      "num_input_tokens_seen": 30422668816,
      "step": 38668
    },
    {
      "epoch": 4.1023764056864,
      "grad_norm": 0.5249911150493682,
      "learning_rate": 3.6956097579795565e-05,
      "loss": 1.2002,
      "num_input_tokens_seen": 30423455648,
      "step": 38669
    },
    {
      "epoch": 4.102482495225971,
      "grad_norm": 0.7836236860099942,
      "learning_rate": 3.695548723475193e-05,
      "loss": 1.2115,
      "num_input_tokens_seen": 30424242400,
      "step": 38670
    },
    {
      "epoch": 4.102588584765542,
      "grad_norm": 0.8457044833926629,
      "learning_rate": 3.6954876880469446e-05,
      "loss": 1.3621,
      "num_input_tokens_seen": 30425029088,
      "step": 38671
    },
    {
      "epoch": 4.102694674305114,
      "grad_norm": 0.7267800717621842,
      "learning_rate": 3.695426651694858e-05,
      "loss": 1.2376,
      "num_input_tokens_seen": 30425815824,
      "step": 38672
    },
    {
      "epoch": 4.102800763844685,
      "grad_norm": 0.9221925838458528,
      "learning_rate": 3.695365614418981e-05,
      "loss": 1.3326,
      "num_input_tokens_seen": 30426602560,
      "step": 38673
    },
    {
      "epoch": 4.1029068533842565,
      "grad_norm": 0.7540256551931941,
      "learning_rate": 3.69530457621936e-05,
      "loss": 1.3173,
      "num_input_tokens_seen": 30427389376,
      "step": 38674
    },
    {
      "epoch": 4.103012942923828,
      "grad_norm": 0.7137264075770474,
      "learning_rate": 3.695243537096043e-05,
      "loss": 1.3673,
      "num_input_tokens_seen": 30428176144,
      "step": 38675
    },
    {
      "epoch": 4.1031190324633995,
      "grad_norm": 0.6621793933578577,
      "learning_rate": 3.6951824970490764e-05,
      "loss": 1.2321,
      "num_input_tokens_seen": 30428962880,
      "step": 38676
    },
    {
      "epoch": 4.1032251220029705,
      "grad_norm": 0.5671306744728153,
      "learning_rate": 3.6951214560785086e-05,
      "loss": 1.2965,
      "num_input_tokens_seen": 30429749648,
      "step": 38677
    },
    {
      "epoch": 4.1033312115425415,
      "grad_norm": 0.8564493274123682,
      "learning_rate": 3.6950604141843855e-05,
      "loss": 1.3743,
      "num_input_tokens_seen": 30430536432,
      "step": 38678
    },
    {
      "epoch": 4.1034373010821135,
      "grad_norm": 0.6030033710715111,
      "learning_rate": 3.694999371366755e-05,
      "loss": 1.3167,
      "num_input_tokens_seen": 30431323200,
      "step": 38679
    },
    {
      "epoch": 4.1035433906216845,
      "grad_norm": 0.7593821399827044,
      "learning_rate": 3.694938327625664e-05,
      "loss": 1.2809,
      "num_input_tokens_seen": 30432109904,
      "step": 38680
    },
    {
      "epoch": 4.103649480161256,
      "grad_norm": 0.6685223228137738,
      "learning_rate": 3.69487728296116e-05,
      "loss": 1.4087,
      "num_input_tokens_seen": 30432896672,
      "step": 38681
    },
    {
      "epoch": 4.103755569700827,
      "grad_norm": 0.5440926737089424,
      "learning_rate": 3.69481623737329e-05,
      "loss": 1.3136,
      "num_input_tokens_seen": 30433683536,
      "step": 38682
    },
    {
      "epoch": 4.1038616592403985,
      "grad_norm": 0.6354157217664526,
      "learning_rate": 3.6947551908621e-05,
      "loss": 1.2865,
      "num_input_tokens_seen": 30434470304,
      "step": 38683
    },
    {
      "epoch": 4.10396774877997,
      "grad_norm": 0.6084822409594444,
      "learning_rate": 3.6946941434276397e-05,
      "loss": 1.4454,
      "num_input_tokens_seen": 30435257056,
      "step": 38684
    },
    {
      "epoch": 4.104073838319541,
      "grad_norm": 0.5043597018109819,
      "learning_rate": 3.694633095069954e-05,
      "loss": 1.3245,
      "num_input_tokens_seen": 30436043792,
      "step": 38685
    },
    {
      "epoch": 4.104179927859113,
      "grad_norm": 0.6672406791581881,
      "learning_rate": 3.694572045789091e-05,
      "loss": 1.253,
      "num_input_tokens_seen": 30436830496,
      "step": 38686
    },
    {
      "epoch": 4.104286017398684,
      "grad_norm": 0.4948172447955969,
      "learning_rate": 3.6945109955850976e-05,
      "loss": 1.2935,
      "num_input_tokens_seen": 30437617264,
      "step": 38687
    },
    {
      "epoch": 4.104392106938256,
      "grad_norm": 0.48819604797120464,
      "learning_rate": 3.6944499444580214e-05,
      "loss": 1.2302,
      "num_input_tokens_seen": 30438404032,
      "step": 38688
    },
    {
      "epoch": 4.104498196477827,
      "grad_norm": 0.7785681665238663,
      "learning_rate": 3.694388892407909e-05,
      "loss": 1.3827,
      "num_input_tokens_seen": 30439190816,
      "step": 38689
    },
    {
      "epoch": 4.104604286017398,
      "grad_norm": 0.5029068981286607,
      "learning_rate": 3.6943278394348077e-05,
      "loss": 1.3019,
      "num_input_tokens_seen": 30439977648,
      "step": 38690
    },
    {
      "epoch": 4.10471037555697,
      "grad_norm": 0.5915805425661067,
      "learning_rate": 3.694266785538766e-05,
      "loss": 1.2624,
      "num_input_tokens_seen": 30440764464,
      "step": 38691
    },
    {
      "epoch": 4.104816465096541,
      "grad_norm": 0.582612227671652,
      "learning_rate": 3.694205730719829e-05,
      "loss": 1.2773,
      "num_input_tokens_seen": 30441551232,
      "step": 38692
    },
    {
      "epoch": 4.104922554636113,
      "grad_norm": 0.5038596864588674,
      "learning_rate": 3.694144674978045e-05,
      "loss": 1.3144,
      "num_input_tokens_seen": 30442338000,
      "step": 38693
    },
    {
      "epoch": 4.105028644175684,
      "grad_norm": 0.6057838160634704,
      "learning_rate": 3.694083618313462e-05,
      "loss": 1.2817,
      "num_input_tokens_seen": 30443124752,
      "step": 38694
    },
    {
      "epoch": 4.105134733715255,
      "grad_norm": 0.5570076015601673,
      "learning_rate": 3.694022560726125e-05,
      "loss": 1.4063,
      "num_input_tokens_seen": 30443911504,
      "step": 38695
    },
    {
      "epoch": 4.105240823254827,
      "grad_norm": 0.5028028193828927,
      "learning_rate": 3.693961502216083e-05,
      "loss": 1.3705,
      "num_input_tokens_seen": 30444698224,
      "step": 38696
    },
    {
      "epoch": 4.105346912794398,
      "grad_norm": 0.588015329909423,
      "learning_rate": 3.693900442783382e-05,
      "loss": 1.3624,
      "num_input_tokens_seen": 30445484928,
      "step": 38697
    },
    {
      "epoch": 4.10545300233397,
      "grad_norm": 0.4924580120039597,
      "learning_rate": 3.6938393824280707e-05,
      "loss": 1.3231,
      "num_input_tokens_seen": 30446271632,
      "step": 38698
    },
    {
      "epoch": 4.105559091873541,
      "grad_norm": 0.4681241269547021,
      "learning_rate": 3.693778321150194e-05,
      "loss": 1.2555,
      "num_input_tokens_seen": 30447058480,
      "step": 38699
    },
    {
      "epoch": 4.105665181413113,
      "grad_norm": 0.6941285140173891,
      "learning_rate": 3.6937172589498014e-05,
      "loss": 1.3763,
      "num_input_tokens_seen": 30447845200,
      "step": 38700
    },
    {
      "epoch": 4.105771270952684,
      "grad_norm": 0.5888643850627855,
      "learning_rate": 3.693656195826939e-05,
      "loss": 1.4562,
      "num_input_tokens_seen": 30448631920,
      "step": 38701
    },
    {
      "epoch": 4.105877360492255,
      "grad_norm": 0.5834701973129067,
      "learning_rate": 3.693595131781654e-05,
      "loss": 1.312,
      "num_input_tokens_seen": 30449418688,
      "step": 38702
    },
    {
      "epoch": 4.105983450031827,
      "grad_norm": 0.5928010981689233,
      "learning_rate": 3.693534066813994e-05,
      "loss": 1.3592,
      "num_input_tokens_seen": 30450205424,
      "step": 38703
    },
    {
      "epoch": 4.106089539571398,
      "grad_norm": 0.6113148821373053,
      "learning_rate": 3.693473000924005e-05,
      "loss": 1.3676,
      "num_input_tokens_seen": 30450992208,
      "step": 38704
    },
    {
      "epoch": 4.10619562911097,
      "grad_norm": 0.5336800045462635,
      "learning_rate": 3.693411934111736e-05,
      "loss": 1.3511,
      "num_input_tokens_seen": 30451778928,
      "step": 38705
    },
    {
      "epoch": 4.106301718650541,
      "grad_norm": 0.4558068898442706,
      "learning_rate": 3.693350866377234e-05,
      "loss": 1.2642,
      "num_input_tokens_seen": 30452565776,
      "step": 38706
    },
    {
      "epoch": 4.106407808190112,
      "grad_norm": 0.4924301291843694,
      "learning_rate": 3.693289797720544e-05,
      "loss": 1.2387,
      "num_input_tokens_seen": 30453352592,
      "step": 38707
    },
    {
      "epoch": 4.106513897729684,
      "grad_norm": 0.5040844091928983,
      "learning_rate": 3.693228728141715e-05,
      "loss": 1.3206,
      "num_input_tokens_seen": 30454139312,
      "step": 38708
    },
    {
      "epoch": 4.106619987269255,
      "grad_norm": 0.5614945044487225,
      "learning_rate": 3.693167657640794e-05,
      "loss": 1.4473,
      "num_input_tokens_seen": 30454926048,
      "step": 38709
    },
    {
      "epoch": 4.106726076808827,
      "grad_norm": 0.4900072456294928,
      "learning_rate": 3.693106586217828e-05,
      "loss": 1.3427,
      "num_input_tokens_seen": 30455712848,
      "step": 38710
    },
    {
      "epoch": 4.106832166348398,
      "grad_norm": 0.5823311883128331,
      "learning_rate": 3.693045513872865e-05,
      "loss": 1.2241,
      "num_input_tokens_seen": 30456499648,
      "step": 38711
    },
    {
      "epoch": 4.106938255887969,
      "grad_norm": 0.4676914622107282,
      "learning_rate": 3.69298444060595e-05,
      "loss": 1.2563,
      "num_input_tokens_seen": 30457286448,
      "step": 38712
    },
    {
      "epoch": 4.107044345427541,
      "grad_norm": 0.5064156472798705,
      "learning_rate": 3.692923366417132e-05,
      "loss": 1.3903,
      "num_input_tokens_seen": 30458073200,
      "step": 38713
    },
    {
      "epoch": 4.107150434967112,
      "grad_norm": 0.4597121631119202,
      "learning_rate": 3.692862291306459e-05,
      "loss": 1.3587,
      "num_input_tokens_seen": 30458860032,
      "step": 38714
    },
    {
      "epoch": 4.107256524506684,
      "grad_norm": 0.46438228574994883,
      "learning_rate": 3.6928012152739755e-05,
      "loss": 1.2698,
      "num_input_tokens_seen": 30459646880,
      "step": 38715
    },
    {
      "epoch": 4.107362614046255,
      "grad_norm": 0.45661545656560426,
      "learning_rate": 3.692740138319731e-05,
      "loss": 1.2621,
      "num_input_tokens_seen": 30460433696,
      "step": 38716
    },
    {
      "epoch": 4.107468703585827,
      "grad_norm": 0.527229560956684,
      "learning_rate": 3.692679060443772e-05,
      "loss": 1.3162,
      "num_input_tokens_seen": 30461220416,
      "step": 38717
    },
    {
      "epoch": 4.107574793125398,
      "grad_norm": 0.4657029575050112,
      "learning_rate": 3.6926179816461456e-05,
      "loss": 1.4073,
      "num_input_tokens_seen": 30462007120,
      "step": 38718
    },
    {
      "epoch": 4.107680882664969,
      "grad_norm": 0.44452602426450005,
      "learning_rate": 3.692556901926899e-05,
      "loss": 1.2947,
      "num_input_tokens_seen": 30462793968,
      "step": 38719
    },
    {
      "epoch": 4.107786972204541,
      "grad_norm": 0.5905519370343933,
      "learning_rate": 3.69249582128608e-05,
      "loss": 1.3184,
      "num_input_tokens_seen": 30463580688,
      "step": 38720
    },
    {
      "epoch": 4.107893061744112,
      "grad_norm": 0.4388026063786718,
      "learning_rate": 3.6924347397237334e-05,
      "loss": 1.2906,
      "num_input_tokens_seen": 30464367440,
      "step": 38721
    },
    {
      "epoch": 4.107999151283684,
      "grad_norm": 0.5241442606761734,
      "learning_rate": 3.69237365723991e-05,
      "loss": 1.3338,
      "num_input_tokens_seen": 30465154272,
      "step": 38722
    },
    {
      "epoch": 4.108105240823255,
      "grad_norm": 0.5564531363168571,
      "learning_rate": 3.6923125738346545e-05,
      "loss": 1.3322,
      "num_input_tokens_seen": 30465941152,
      "step": 38723
    },
    {
      "epoch": 4.108211330362826,
      "grad_norm": 0.48329018696570825,
      "learning_rate": 3.692251489508015e-05,
      "loss": 1.3658,
      "num_input_tokens_seen": 30466727920,
      "step": 38724
    },
    {
      "epoch": 4.108317419902398,
      "grad_norm": 0.5066125713483695,
      "learning_rate": 3.6921904042600384e-05,
      "loss": 1.293,
      "num_input_tokens_seen": 30467514656,
      "step": 38725
    },
    {
      "epoch": 4.108423509441969,
      "grad_norm": 0.6376851311320362,
      "learning_rate": 3.692129318090772e-05,
      "loss": 1.3983,
      "num_input_tokens_seen": 30468301408,
      "step": 38726
    },
    {
      "epoch": 4.108529598981541,
      "grad_norm": 0.5453426753110104,
      "learning_rate": 3.692068231000263e-05,
      "loss": 1.468,
      "num_input_tokens_seen": 30469088208,
      "step": 38727
    },
    {
      "epoch": 4.108635688521112,
      "grad_norm": 0.5257416043802705,
      "learning_rate": 3.692007142988559e-05,
      "loss": 1.2423,
      "num_input_tokens_seen": 30469875040,
      "step": 38728
    },
    {
      "epoch": 4.108741778060684,
      "grad_norm": 0.45575767469818035,
      "learning_rate": 3.691946054055706e-05,
      "loss": 1.2328,
      "num_input_tokens_seen": 30470661776,
      "step": 38729
    },
    {
      "epoch": 4.108847867600255,
      "grad_norm": 0.5126945020912549,
      "learning_rate": 3.691884964201753e-05,
      "loss": 1.2807,
      "num_input_tokens_seen": 30471448576,
      "step": 38730
    },
    {
      "epoch": 4.108953957139826,
      "grad_norm": 0.5262173649441663,
      "learning_rate": 3.6918238734267463e-05,
      "loss": 1.3754,
      "num_input_tokens_seen": 30472235360,
      "step": 38731
    },
    {
      "epoch": 4.109060046679398,
      "grad_norm": 0.5729323197759464,
      "learning_rate": 3.691762781730732e-05,
      "loss": 1.3833,
      "num_input_tokens_seen": 30473022064,
      "step": 38732
    },
    {
      "epoch": 4.109166136218969,
      "grad_norm": 0.4899310958098771,
      "learning_rate": 3.6917016891137597e-05,
      "loss": 1.2772,
      "num_input_tokens_seen": 30473808752,
      "step": 38733
    },
    {
      "epoch": 4.109272225758541,
      "grad_norm": 0.5086333827453215,
      "learning_rate": 3.6916405955758745e-05,
      "loss": 1.3692,
      "num_input_tokens_seen": 30474595568,
      "step": 38734
    },
    {
      "epoch": 4.109378315298112,
      "grad_norm": 0.5780579746790051,
      "learning_rate": 3.691579501117124e-05,
      "loss": 1.2603,
      "num_input_tokens_seen": 30475382240,
      "step": 38735
    },
    {
      "epoch": 4.109484404837683,
      "grad_norm": 0.4877536391695963,
      "learning_rate": 3.691518405737557e-05,
      "loss": 1.3545,
      "num_input_tokens_seen": 30476168976,
      "step": 38736
    },
    {
      "epoch": 4.1095904943772545,
      "grad_norm": 0.7057344649044299,
      "learning_rate": 3.6914573094372196e-05,
      "loss": 1.3155,
      "num_input_tokens_seen": 30476955728,
      "step": 38737
    },
    {
      "epoch": 4.109696583916826,
      "grad_norm": 0.4879985360671436,
      "learning_rate": 3.691396212216158e-05,
      "loss": 1.3786,
      "num_input_tokens_seen": 30477742480,
      "step": 38738
    },
    {
      "epoch": 4.1098026734563975,
      "grad_norm": 0.5010514149201668,
      "learning_rate": 3.6913351140744205e-05,
      "loss": 1.3776,
      "num_input_tokens_seen": 30478529200,
      "step": 38739
    },
    {
      "epoch": 4.1099087629959685,
      "grad_norm": 0.4727361976459503,
      "learning_rate": 3.6912740150120536e-05,
      "loss": 1.3898,
      "num_input_tokens_seen": 30479315952,
      "step": 38740
    },
    {
      "epoch": 4.11001485253554,
      "grad_norm": 0.5708104345642657,
      "learning_rate": 3.691212915029107e-05,
      "loss": 1.3096,
      "num_input_tokens_seen": 30480102752,
      "step": 38741
    },
    {
      "epoch": 4.1101209420751115,
      "grad_norm": 0.5350604283823674,
      "learning_rate": 3.691151814125625e-05,
      "loss": 1.2264,
      "num_input_tokens_seen": 30480889568,
      "step": 38742
    },
    {
      "epoch": 4.1102270316146825,
      "grad_norm": 0.7414352133838689,
      "learning_rate": 3.691090712301655e-05,
      "loss": 1.3251,
      "num_input_tokens_seen": 30481676336,
      "step": 38743
    },
    {
      "epoch": 4.110333121154254,
      "grad_norm": 0.623293527770901,
      "learning_rate": 3.691029609557246e-05,
      "loss": 1.2509,
      "num_input_tokens_seen": 30482463168,
      "step": 38744
    },
    {
      "epoch": 4.1104392106938255,
      "grad_norm": 0.685056894696274,
      "learning_rate": 3.6909685058924446e-05,
      "loss": 1.3378,
      "num_input_tokens_seen": 30483249920,
      "step": 38745
    },
    {
      "epoch": 4.110545300233397,
      "grad_norm": 0.5749934921933745,
      "learning_rate": 3.690907401307296e-05,
      "loss": 1.4338,
      "num_input_tokens_seen": 30484036720,
      "step": 38746
    },
    {
      "epoch": 4.110651389772968,
      "grad_norm": 0.6360961141765811,
      "learning_rate": 3.6908462958018506e-05,
      "loss": 1.2417,
      "num_input_tokens_seen": 30484823536,
      "step": 38747
    },
    {
      "epoch": 4.110757479312539,
      "grad_norm": 0.49876923124500316,
      "learning_rate": 3.690785189376154e-05,
      "loss": 1.3417,
      "num_input_tokens_seen": 30485610304,
      "step": 38748
    },
    {
      "epoch": 4.110863568852111,
      "grad_norm": 0.7672822013191304,
      "learning_rate": 3.690724082030253e-05,
      "loss": 1.1982,
      "num_input_tokens_seen": 30486397008,
      "step": 38749
    },
    {
      "epoch": 4.110969658391682,
      "grad_norm": 0.5071668533931825,
      "learning_rate": 3.690662973764196e-05,
      "loss": 1.3345,
      "num_input_tokens_seen": 30487183792,
      "step": 38750
    },
    {
      "epoch": 4.111075747931254,
      "grad_norm": 0.5618023161757345,
      "learning_rate": 3.6906018645780295e-05,
      "loss": 1.3428,
      "num_input_tokens_seen": 30487970720,
      "step": 38751
    },
    {
      "epoch": 4.111181837470825,
      "grad_norm": 0.849619913737987,
      "learning_rate": 3.6905407544718e-05,
      "loss": 1.3642,
      "num_input_tokens_seen": 30488757488,
      "step": 38752
    },
    {
      "epoch": 4.111287927010396,
      "grad_norm": 0.5692850419369005,
      "learning_rate": 3.690479643445556e-05,
      "loss": 1.3056,
      "num_input_tokens_seen": 30489544288,
      "step": 38753
    },
    {
      "epoch": 4.111394016549968,
      "grad_norm": 0.9077271552450996,
      "learning_rate": 3.6904185314993444e-05,
      "loss": 1.3583,
      "num_input_tokens_seen": 30490331040,
      "step": 38754
    },
    {
      "epoch": 4.111500106089539,
      "grad_norm": 0.5644480953062716,
      "learning_rate": 3.690357418633212e-05,
      "loss": 1.2888,
      "num_input_tokens_seen": 30491117808,
      "step": 38755
    },
    {
      "epoch": 4.111606195629111,
      "grad_norm": 0.7004756237214794,
      "learning_rate": 3.690296304847207e-05,
      "loss": 1.2951,
      "num_input_tokens_seen": 30491904624,
      "step": 38756
    },
    {
      "epoch": 4.111712285168682,
      "grad_norm": 0.640469533990225,
      "learning_rate": 3.690235190141376e-05,
      "loss": 1.3128,
      "num_input_tokens_seen": 30492691408,
      "step": 38757
    },
    {
      "epoch": 4.111818374708254,
      "grad_norm": 0.615918033358804,
      "learning_rate": 3.690174074515765e-05,
      "loss": 1.2699,
      "num_input_tokens_seen": 30493478272,
      "step": 38758
    },
    {
      "epoch": 4.111924464247825,
      "grad_norm": 0.7498981007192643,
      "learning_rate": 3.690112957970423e-05,
      "loss": 1.2268,
      "num_input_tokens_seen": 30494265056,
      "step": 38759
    },
    {
      "epoch": 4.112030553787396,
      "grad_norm": 0.6982624326510426,
      "learning_rate": 3.6900518405053974e-05,
      "loss": 1.2859,
      "num_input_tokens_seen": 30495052000,
      "step": 38760
    },
    {
      "epoch": 4.112136643326968,
      "grad_norm": 0.6631166309512974,
      "learning_rate": 3.689990722120733e-05,
      "loss": 1.3949,
      "num_input_tokens_seen": 30495838752,
      "step": 38761
    },
    {
      "epoch": 4.112242732866539,
      "grad_norm": 0.6676692740442388,
      "learning_rate": 3.68992960281648e-05,
      "loss": 1.2848,
      "num_input_tokens_seen": 30496625504,
      "step": 38762
    },
    {
      "epoch": 4.112348822406111,
      "grad_norm": 0.5928659858991555,
      "learning_rate": 3.689868482592684e-05,
      "loss": 1.2833,
      "num_input_tokens_seen": 30497412320,
      "step": 38763
    },
    {
      "epoch": 4.112454911945682,
      "grad_norm": 0.5069547703010967,
      "learning_rate": 3.689807361449392e-05,
      "loss": 1.2542,
      "num_input_tokens_seen": 30498199088,
      "step": 38764
    },
    {
      "epoch": 4.112561001485253,
      "grad_norm": 0.6373879986044945,
      "learning_rate": 3.6897462393866526e-05,
      "loss": 1.2592,
      "num_input_tokens_seen": 30498985952,
      "step": 38765
    },
    {
      "epoch": 4.112667091024825,
      "grad_norm": 0.5853910054370509,
      "learning_rate": 3.689685116404512e-05,
      "loss": 1.3749,
      "num_input_tokens_seen": 30499772672,
      "step": 38766
    },
    {
      "epoch": 4.112773180564396,
      "grad_norm": 0.5907333195880794,
      "learning_rate": 3.6896239925030175e-05,
      "loss": 1.2845,
      "num_input_tokens_seen": 30500559376,
      "step": 38767
    },
    {
      "epoch": 4.112879270103968,
      "grad_norm": 0.6915963737153336,
      "learning_rate": 3.689562867682217e-05,
      "loss": 1.3101,
      "num_input_tokens_seen": 30501346096,
      "step": 38768
    },
    {
      "epoch": 4.112985359643539,
      "grad_norm": 0.48784381488375206,
      "learning_rate": 3.689501741942156e-05,
      "loss": 1.3932,
      "num_input_tokens_seen": 30502132816,
      "step": 38769
    },
    {
      "epoch": 4.113091449183111,
      "grad_norm": 0.6018901696273893,
      "learning_rate": 3.689440615282884e-05,
      "loss": 1.294,
      "num_input_tokens_seen": 30502919584,
      "step": 38770
    },
    {
      "epoch": 4.113197538722682,
      "grad_norm": 0.6023970019239049,
      "learning_rate": 3.6893794877044476e-05,
      "loss": 1.3083,
      "num_input_tokens_seen": 30503706368,
      "step": 38771
    },
    {
      "epoch": 4.113303628262253,
      "grad_norm": 0.5436342826540763,
      "learning_rate": 3.689318359206892e-05,
      "loss": 1.3336,
      "num_input_tokens_seen": 30504493120,
      "step": 38772
    },
    {
      "epoch": 4.113409717801825,
      "grad_norm": 0.7863735869363431,
      "learning_rate": 3.689257229790267e-05,
      "loss": 1.3542,
      "num_input_tokens_seen": 30505279840,
      "step": 38773
    },
    {
      "epoch": 4.113515807341396,
      "grad_norm": 0.5368856903891619,
      "learning_rate": 3.689196099454619e-05,
      "loss": 1.4175,
      "num_input_tokens_seen": 30506066576,
      "step": 38774
    },
    {
      "epoch": 4.113621896880968,
      "grad_norm": 0.845477871992876,
      "learning_rate": 3.689134968199995e-05,
      "loss": 1.346,
      "num_input_tokens_seen": 30506853296,
      "step": 38775
    },
    {
      "epoch": 4.113727986420539,
      "grad_norm": 0.5696027290936864,
      "learning_rate": 3.689073836026443e-05,
      "loss": 1.2744,
      "num_input_tokens_seen": 30507640160,
      "step": 38776
    },
    {
      "epoch": 4.11383407596011,
      "grad_norm": 0.5048392201454395,
      "learning_rate": 3.689012702934009e-05,
      "loss": 1.3503,
      "num_input_tokens_seen": 30508426896,
      "step": 38777
    },
    {
      "epoch": 4.113940165499682,
      "grad_norm": 0.7858680500759748,
      "learning_rate": 3.68895156892274e-05,
      "loss": 1.2882,
      "num_input_tokens_seen": 30509213728,
      "step": 38778
    },
    {
      "epoch": 4.114046255039253,
      "grad_norm": 0.49388526477713696,
      "learning_rate": 3.688890433992686e-05,
      "loss": 1.3901,
      "num_input_tokens_seen": 30510000336,
      "step": 38779
    },
    {
      "epoch": 4.114152344578825,
      "grad_norm": 0.4684019672537274,
      "learning_rate": 3.688829298143892e-05,
      "loss": 1.1539,
      "num_input_tokens_seen": 30510787136,
      "step": 38780
    },
    {
      "epoch": 4.114258434118396,
      "grad_norm": 0.5045581618314315,
      "learning_rate": 3.688768161376405e-05,
      "loss": 1.2675,
      "num_input_tokens_seen": 30511573984,
      "step": 38781
    },
    {
      "epoch": 4.114364523657967,
      "grad_norm": 0.5297492328202084,
      "learning_rate": 3.688707023690272e-05,
      "loss": 1.2292,
      "num_input_tokens_seen": 30512360752,
      "step": 38782
    },
    {
      "epoch": 4.114470613197539,
      "grad_norm": 0.48621603822231646,
      "learning_rate": 3.688645885085542e-05,
      "loss": 1.312,
      "num_input_tokens_seen": 30513147552,
      "step": 38783
    },
    {
      "epoch": 4.11457670273711,
      "grad_norm": 0.8514626634863199,
      "learning_rate": 3.6885847455622614e-05,
      "loss": 1.4947,
      "num_input_tokens_seen": 30513934384,
      "step": 38784
    },
    {
      "epoch": 4.114682792276682,
      "grad_norm": 0.5044416584354351,
      "learning_rate": 3.688523605120478e-05,
      "loss": 1.2795,
      "num_input_tokens_seen": 30514721088,
      "step": 38785
    },
    {
      "epoch": 4.114788881816253,
      "grad_norm": 0.5292783061486778,
      "learning_rate": 3.688462463760237e-05,
      "loss": 1.277,
      "num_input_tokens_seen": 30515507920,
      "step": 38786
    },
    {
      "epoch": 4.114894971355825,
      "grad_norm": 0.4539729833715637,
      "learning_rate": 3.688401321481588e-05,
      "loss": 1.3142,
      "num_input_tokens_seen": 30516294704,
      "step": 38787
    },
    {
      "epoch": 4.115001060895396,
      "grad_norm": 0.6342399761438965,
      "learning_rate": 3.688340178284577e-05,
      "loss": 1.2448,
      "num_input_tokens_seen": 30517081536,
      "step": 38788
    },
    {
      "epoch": 4.115107150434967,
      "grad_norm": 0.49028264468408156,
      "learning_rate": 3.688279034169252e-05,
      "loss": 1.1699,
      "num_input_tokens_seen": 30517868320,
      "step": 38789
    },
    {
      "epoch": 4.115213239974539,
      "grad_norm": 0.5712494764804888,
      "learning_rate": 3.688217889135659e-05,
      "loss": 1.2747,
      "num_input_tokens_seen": 30518655088,
      "step": 38790
    },
    {
      "epoch": 4.11531932951411,
      "grad_norm": 0.5081161087678688,
      "learning_rate": 3.688156743183847e-05,
      "loss": 1.2892,
      "num_input_tokens_seen": 30519441840,
      "step": 38791
    },
    {
      "epoch": 4.115425419053682,
      "grad_norm": 0.43384980962526754,
      "learning_rate": 3.688095596313862e-05,
      "loss": 1.2266,
      "num_input_tokens_seen": 30520228608,
      "step": 38792
    },
    {
      "epoch": 4.115531508593253,
      "grad_norm": 0.6958922973621606,
      "learning_rate": 3.688034448525751e-05,
      "loss": 1.4064,
      "num_input_tokens_seen": 30521015392,
      "step": 38793
    },
    {
      "epoch": 4.115637598132824,
      "grad_norm": 0.5205197141506238,
      "learning_rate": 3.6879732998195626e-05,
      "loss": 1.3332,
      "num_input_tokens_seen": 30521802192,
      "step": 38794
    },
    {
      "epoch": 4.115743687672396,
      "grad_norm": 0.5108563851802777,
      "learning_rate": 3.687912150195343e-05,
      "loss": 1.3001,
      "num_input_tokens_seen": 30522588960,
      "step": 38795
    },
    {
      "epoch": 4.115849777211967,
      "grad_norm": 0.5023323795357821,
      "learning_rate": 3.68785099965314e-05,
      "loss": 1.2266,
      "num_input_tokens_seen": 30523375712,
      "step": 38796
    },
    {
      "epoch": 4.115955866751539,
      "grad_norm": 0.5128978657721422,
      "learning_rate": 3.687789848193e-05,
      "loss": 1.324,
      "num_input_tokens_seen": 30524162528,
      "step": 38797
    },
    {
      "epoch": 4.11606195629111,
      "grad_norm": 0.48608263504957233,
      "learning_rate": 3.687728695814971e-05,
      "loss": 1.3192,
      "num_input_tokens_seen": 30524949296,
      "step": 38798
    },
    {
      "epoch": 4.1161680458306815,
      "grad_norm": 0.4795430468969012,
      "learning_rate": 3.687667542519101e-05,
      "loss": 1.2255,
      "num_input_tokens_seen": 30525736048,
      "step": 38799
    },
    {
      "epoch": 4.1162741353702526,
      "grad_norm": 0.4557586347657497,
      "learning_rate": 3.6876063883054355e-05,
      "loss": 1.2364,
      "num_input_tokens_seen": 30526522848,
      "step": 38800
    },
    {
      "epoch": 4.116380224909824,
      "grad_norm": 0.5066052421687605,
      "learning_rate": 3.687545233174022e-05,
      "loss": 1.285,
      "num_input_tokens_seen": 30527309600,
      "step": 38801
    },
    {
      "epoch": 4.1164863144493955,
      "grad_norm": 0.5246634248232154,
      "learning_rate": 3.68748407712491e-05,
      "loss": 1.277,
      "num_input_tokens_seen": 30528096320,
      "step": 38802
    },
    {
      "epoch": 4.1165924039889665,
      "grad_norm": 0.5522738905177972,
      "learning_rate": 3.687422920158145e-05,
      "loss": 1.1963,
      "num_input_tokens_seen": 30528883056,
      "step": 38803
    },
    {
      "epoch": 4.1166984935285384,
      "grad_norm": 0.545262154632958,
      "learning_rate": 3.6873617622737734e-05,
      "loss": 1.3219,
      "num_input_tokens_seen": 30529669872,
      "step": 38804
    },
    {
      "epoch": 4.1168045830681095,
      "grad_norm": 0.6696842729278213,
      "learning_rate": 3.687300603471844e-05,
      "loss": 1.2877,
      "num_input_tokens_seen": 30530456608,
      "step": 38805
    },
    {
      "epoch": 4.1169106726076805,
      "grad_norm": 0.47216630011169536,
      "learning_rate": 3.6872394437524033e-05,
      "loss": 1.2901,
      "num_input_tokens_seen": 30531243440,
      "step": 38806
    },
    {
      "epoch": 4.117016762147252,
      "grad_norm": 0.6296862958296321,
      "learning_rate": 3.687178283115499e-05,
      "loss": 1.2541,
      "num_input_tokens_seen": 30532030224,
      "step": 38807
    },
    {
      "epoch": 4.1171228516868235,
      "grad_norm": 0.6391060931163626,
      "learning_rate": 3.687117121561178e-05,
      "loss": 1.2814,
      "num_input_tokens_seen": 30532816992,
      "step": 38808
    },
    {
      "epoch": 4.117228941226395,
      "grad_norm": 0.4996801391483737,
      "learning_rate": 3.687055959089487e-05,
      "loss": 1.249,
      "num_input_tokens_seen": 30533603696,
      "step": 38809
    },
    {
      "epoch": 4.117335030765966,
      "grad_norm": 0.6285222751985778,
      "learning_rate": 3.686994795700475e-05,
      "loss": 1.3574,
      "num_input_tokens_seen": 30534390384,
      "step": 38810
    },
    {
      "epoch": 4.117441120305537,
      "grad_norm": 0.54838055590999,
      "learning_rate": 3.686933631394188e-05,
      "loss": 1.2321,
      "num_input_tokens_seen": 30535177104,
      "step": 38811
    },
    {
      "epoch": 4.117547209845109,
      "grad_norm": 0.5343752425827337,
      "learning_rate": 3.686872466170674e-05,
      "loss": 1.3882,
      "num_input_tokens_seen": 30535963824,
      "step": 38812
    },
    {
      "epoch": 4.11765329938468,
      "grad_norm": 0.6684378308225467,
      "learning_rate": 3.686811300029979e-05,
      "loss": 1.2914,
      "num_input_tokens_seen": 30536750608,
      "step": 38813
    },
    {
      "epoch": 4.117759388924252,
      "grad_norm": 0.51352435355741,
      "learning_rate": 3.6867501329721515e-05,
      "loss": 1.3482,
      "num_input_tokens_seen": 30537537360,
      "step": 38814
    },
    {
      "epoch": 4.117865478463823,
      "grad_norm": 0.6014330276557437,
      "learning_rate": 3.686688964997238e-05,
      "loss": 1.3269,
      "num_input_tokens_seen": 30538324064,
      "step": 38815
    },
    {
      "epoch": 4.117971568003395,
      "grad_norm": 0.46215197925309764,
      "learning_rate": 3.6866277961052866e-05,
      "loss": 1.2915,
      "num_input_tokens_seen": 30539110832,
      "step": 38816
    },
    {
      "epoch": 4.118077657542966,
      "grad_norm": 0.48713648927890196,
      "learning_rate": 3.686566626296344e-05,
      "loss": 1.2207,
      "num_input_tokens_seen": 30539897552,
      "step": 38817
    },
    {
      "epoch": 4.118183747082537,
      "grad_norm": 0.6612012981109745,
      "learning_rate": 3.686505455570457e-05,
      "loss": 1.2046,
      "num_input_tokens_seen": 30540684368,
      "step": 38818
    },
    {
      "epoch": 4.118289836622109,
      "grad_norm": 0.4754889403858712,
      "learning_rate": 3.6864442839276735e-05,
      "loss": 1.2949,
      "num_input_tokens_seen": 30541471200,
      "step": 38819
    },
    {
      "epoch": 4.11839592616168,
      "grad_norm": 0.5522523427602353,
      "learning_rate": 3.6863831113680416e-05,
      "loss": 1.364,
      "num_input_tokens_seen": 30542258000,
      "step": 38820
    },
    {
      "epoch": 4.118502015701252,
      "grad_norm": 0.7093587537887748,
      "learning_rate": 3.686321937891606e-05,
      "loss": 1.4344,
      "num_input_tokens_seen": 30543044832,
      "step": 38821
    },
    {
      "epoch": 4.118608105240823,
      "grad_norm": 0.5303696119019058,
      "learning_rate": 3.686260763498417e-05,
      "loss": 1.3507,
      "num_input_tokens_seen": 30543831584,
      "step": 38822
    },
    {
      "epoch": 4.118714194780394,
      "grad_norm": 0.5644752432616486,
      "learning_rate": 3.6861995881885195e-05,
      "loss": 1.4158,
      "num_input_tokens_seen": 30544618336,
      "step": 38823
    },
    {
      "epoch": 4.118820284319966,
      "grad_norm": 0.527737149935497,
      "learning_rate": 3.686138411961962e-05,
      "loss": 1.4274,
      "num_input_tokens_seen": 30545405120,
      "step": 38824
    },
    {
      "epoch": 4.118926373859537,
      "grad_norm": 0.507740832776217,
      "learning_rate": 3.6860772348187924e-05,
      "loss": 1.2958,
      "num_input_tokens_seen": 30546191920,
      "step": 38825
    },
    {
      "epoch": 4.119032463399109,
      "grad_norm": 0.5317143237775054,
      "learning_rate": 3.6860160567590565e-05,
      "loss": 1.2251,
      "num_input_tokens_seen": 30546978656,
      "step": 38826
    },
    {
      "epoch": 4.11913855293868,
      "grad_norm": 0.49713682024706674,
      "learning_rate": 3.685954877782802e-05,
      "loss": 1.2962,
      "num_input_tokens_seen": 30547765360,
      "step": 38827
    },
    {
      "epoch": 4.119244642478252,
      "grad_norm": 0.5658180893359765,
      "learning_rate": 3.685893697890076e-05,
      "loss": 1.297,
      "num_input_tokens_seen": 30548552128,
      "step": 38828
    },
    {
      "epoch": 4.119350732017823,
      "grad_norm": 0.46874641017704266,
      "learning_rate": 3.685832517080927e-05,
      "loss": 1.2922,
      "num_input_tokens_seen": 30549338912,
      "step": 38829
    },
    {
      "epoch": 4.119456821557394,
      "grad_norm": 0.5192703995457085,
      "learning_rate": 3.685771335355401e-05,
      "loss": 1.3115,
      "num_input_tokens_seen": 30550125568,
      "step": 38830
    },
    {
      "epoch": 4.119562911096966,
      "grad_norm": 0.5298969986063105,
      "learning_rate": 3.6857101527135463e-05,
      "loss": 1.3029,
      "num_input_tokens_seen": 30550912256,
      "step": 38831
    },
    {
      "epoch": 4.119669000636537,
      "grad_norm": 0.5823020317751338,
      "learning_rate": 3.6856489691554085e-05,
      "loss": 1.259,
      "num_input_tokens_seen": 30551699088,
      "step": 38832
    },
    {
      "epoch": 4.119775090176109,
      "grad_norm": 0.6838944865087853,
      "learning_rate": 3.685587784681037e-05,
      "loss": 1.3206,
      "num_input_tokens_seen": 30552485840,
      "step": 38833
    },
    {
      "epoch": 4.11988117971568,
      "grad_norm": 0.6064339725596376,
      "learning_rate": 3.685526599290478e-05,
      "loss": 1.3213,
      "num_input_tokens_seen": 30553272608,
      "step": 38834
    },
    {
      "epoch": 4.119987269255251,
      "grad_norm": 0.6794492246463758,
      "learning_rate": 3.6854654129837776e-05,
      "loss": 1.3608,
      "num_input_tokens_seen": 30554059328,
      "step": 38835
    },
    {
      "epoch": 4.120093358794823,
      "grad_norm": 0.654263274750289,
      "learning_rate": 3.6854042257609856e-05,
      "loss": 1.3019,
      "num_input_tokens_seen": 30554846064,
      "step": 38836
    },
    {
      "epoch": 4.120199448334394,
      "grad_norm": 0.5479502556615834,
      "learning_rate": 3.685343037622148e-05,
      "loss": 1.3158,
      "num_input_tokens_seen": 30555632864,
      "step": 38837
    },
    {
      "epoch": 4.120305537873966,
      "grad_norm": 0.766931203343438,
      "learning_rate": 3.685281848567311e-05,
      "loss": 1.2876,
      "num_input_tokens_seen": 30556419584,
      "step": 38838
    },
    {
      "epoch": 4.120411627413537,
      "grad_norm": 0.5808769688131725,
      "learning_rate": 3.6852206585965245e-05,
      "loss": 1.3871,
      "num_input_tokens_seen": 30557206336,
      "step": 38839
    },
    {
      "epoch": 4.120517716953108,
      "grad_norm": 0.6471834176714356,
      "learning_rate": 3.685159467709833e-05,
      "loss": 1.1471,
      "num_input_tokens_seen": 30557993104,
      "step": 38840
    },
    {
      "epoch": 4.12062380649268,
      "grad_norm": 0.53834867141705,
      "learning_rate": 3.685098275907285e-05,
      "loss": 1.246,
      "num_input_tokens_seen": 30558779936,
      "step": 38841
    },
    {
      "epoch": 4.120729896032251,
      "grad_norm": 0.5779194914073094,
      "learning_rate": 3.685037083188928e-05,
      "loss": 1.3653,
      "num_input_tokens_seen": 30559566720,
      "step": 38842
    },
    {
      "epoch": 4.120835985571823,
      "grad_norm": 0.8464490625984302,
      "learning_rate": 3.6849758895548093e-05,
      "loss": 1.3139,
      "num_input_tokens_seen": 30560353472,
      "step": 38843
    },
    {
      "epoch": 4.120942075111394,
      "grad_norm": 0.5851993537329632,
      "learning_rate": 3.6849146950049764e-05,
      "loss": 1.3041,
      "num_input_tokens_seen": 30561140208,
      "step": 38844
    },
    {
      "epoch": 4.121048164650966,
      "grad_norm": 0.6255833161951684,
      "learning_rate": 3.684853499539476e-05,
      "loss": 1.1847,
      "num_input_tokens_seen": 30561927008,
      "step": 38845
    },
    {
      "epoch": 4.121154254190537,
      "grad_norm": 0.7152927277837429,
      "learning_rate": 3.6847923031583554e-05,
      "loss": 1.387,
      "num_input_tokens_seen": 30562713696,
      "step": 38846
    },
    {
      "epoch": 4.121260343730108,
      "grad_norm": 0.7555699549286129,
      "learning_rate": 3.684731105861662e-05,
      "loss": 1.3265,
      "num_input_tokens_seen": 30563500384,
      "step": 38847
    },
    {
      "epoch": 4.12136643326968,
      "grad_norm": 0.6813347314261489,
      "learning_rate": 3.6846699076494425e-05,
      "loss": 1.3287,
      "num_input_tokens_seen": 30564287056,
      "step": 38848
    },
    {
      "epoch": 4.121472522809251,
      "grad_norm": 0.6608856522943547,
      "learning_rate": 3.684608708521746e-05,
      "loss": 1.3878,
      "num_input_tokens_seen": 30565073808,
      "step": 38849
    },
    {
      "epoch": 4.121578612348823,
      "grad_norm": 0.6047862718670254,
      "learning_rate": 3.684547508478618e-05,
      "loss": 1.2591,
      "num_input_tokens_seen": 30565860656,
      "step": 38850
    },
    {
      "epoch": 4.121684701888394,
      "grad_norm": 0.6220422184012329,
      "learning_rate": 3.684486307520107e-05,
      "loss": 1.284,
      "num_input_tokens_seen": 30566647424,
      "step": 38851
    },
    {
      "epoch": 4.121790791427965,
      "grad_norm": 0.6026120824629198,
      "learning_rate": 3.6844251056462594e-05,
      "loss": 1.3192,
      "num_input_tokens_seen": 30567434176,
      "step": 38852
    },
    {
      "epoch": 4.121896880967537,
      "grad_norm": 0.5340642667222295,
      "learning_rate": 3.684363902857123e-05,
      "loss": 1.3047,
      "num_input_tokens_seen": 30568220960,
      "step": 38853
    },
    {
      "epoch": 4.122002970507108,
      "grad_norm": 0.6075566211891672,
      "learning_rate": 3.684302699152745e-05,
      "loss": 1.24,
      "num_input_tokens_seen": 30569007744,
      "step": 38854
    },
    {
      "epoch": 4.12210906004668,
      "grad_norm": 0.5736939210460883,
      "learning_rate": 3.6842414945331713e-05,
      "loss": 1.4254,
      "num_input_tokens_seen": 30569794480,
      "step": 38855
    },
    {
      "epoch": 4.122215149586251,
      "grad_norm": 0.4869999048564029,
      "learning_rate": 3.684180288998452e-05,
      "loss": 1.2684,
      "num_input_tokens_seen": 30570581312,
      "step": 38856
    },
    {
      "epoch": 4.122321239125823,
      "grad_norm": 0.5534156148715188,
      "learning_rate": 3.684119082548633e-05,
      "loss": 1.4023,
      "num_input_tokens_seen": 30571368096,
      "step": 38857
    },
    {
      "epoch": 4.122427328665394,
      "grad_norm": 0.7185198149413469,
      "learning_rate": 3.6840578751837605e-05,
      "loss": 1.266,
      "num_input_tokens_seen": 30572154784,
      "step": 38858
    },
    {
      "epoch": 4.122533418204965,
      "grad_norm": 0.5098499897355993,
      "learning_rate": 3.683996666903884e-05,
      "loss": 1.2591,
      "num_input_tokens_seen": 30572941552,
      "step": 38859
    },
    {
      "epoch": 4.122639507744537,
      "grad_norm": 0.8616136849519171,
      "learning_rate": 3.683935457709049e-05,
      "loss": 1.2635,
      "num_input_tokens_seen": 30573728352,
      "step": 38860
    },
    {
      "epoch": 4.122745597284108,
      "grad_norm": 0.8893925217823117,
      "learning_rate": 3.683874247599303e-05,
      "loss": 1.2008,
      "num_input_tokens_seen": 30574515168,
      "step": 38861
    },
    {
      "epoch": 4.1228516868236795,
      "grad_norm": 0.8080188332441858,
      "learning_rate": 3.683813036574694e-05,
      "loss": 1.3919,
      "num_input_tokens_seen": 30575301840,
      "step": 38862
    },
    {
      "epoch": 4.122957776363251,
      "grad_norm": 0.884406369520045,
      "learning_rate": 3.68375182463527e-05,
      "loss": 1.2694,
      "num_input_tokens_seen": 30576088624,
      "step": 38863
    },
    {
      "epoch": 4.123063865902822,
      "grad_norm": 0.6125109579672225,
      "learning_rate": 3.683690611781076e-05,
      "loss": 1.2964,
      "num_input_tokens_seen": 30576875360,
      "step": 38864
    },
    {
      "epoch": 4.1231699554423935,
      "grad_norm": 0.6771503573074146,
      "learning_rate": 3.683629398012161e-05,
      "loss": 1.3632,
      "num_input_tokens_seen": 30577662112,
      "step": 38865
    },
    {
      "epoch": 4.1232760449819645,
      "grad_norm": 0.743879421330362,
      "learning_rate": 3.683568183328572e-05,
      "loss": 1.351,
      "num_input_tokens_seen": 30578448800,
      "step": 38866
    },
    {
      "epoch": 4.1233821345215365,
      "grad_norm": 0.5490189332628772,
      "learning_rate": 3.683506967730356e-05,
      "loss": 1.2785,
      "num_input_tokens_seen": 30579235584,
      "step": 38867
    },
    {
      "epoch": 4.1234882240611075,
      "grad_norm": 0.6937636581097433,
      "learning_rate": 3.683445751217561e-05,
      "loss": 1.4227,
      "num_input_tokens_seen": 30580022384,
      "step": 38868
    },
    {
      "epoch": 4.123594313600679,
      "grad_norm": 0.6297869754116073,
      "learning_rate": 3.683384533790234e-05,
      "loss": 1.38,
      "num_input_tokens_seen": 30580809056,
      "step": 38869
    },
    {
      "epoch": 4.12370040314025,
      "grad_norm": 0.5191710526171116,
      "learning_rate": 3.6833233154484215e-05,
      "loss": 1.366,
      "num_input_tokens_seen": 30581595824,
      "step": 38870
    },
    {
      "epoch": 4.1238064926798215,
      "grad_norm": 0.5167492037007348,
      "learning_rate": 3.683262096192172e-05,
      "loss": 1.305,
      "num_input_tokens_seen": 30582382544,
      "step": 38871
    },
    {
      "epoch": 4.123912582219393,
      "grad_norm": 0.6643131104438605,
      "learning_rate": 3.683200876021532e-05,
      "loss": 1.3795,
      "num_input_tokens_seen": 30583169280,
      "step": 38872
    },
    {
      "epoch": 4.124018671758964,
      "grad_norm": 0.5384369698501645,
      "learning_rate": 3.6831396549365495e-05,
      "loss": 1.4261,
      "num_input_tokens_seen": 30583955984,
      "step": 38873
    },
    {
      "epoch": 4.124124761298536,
      "grad_norm": 0.6614790699250754,
      "learning_rate": 3.683078432937271e-05,
      "loss": 1.2817,
      "num_input_tokens_seen": 30584742704,
      "step": 38874
    },
    {
      "epoch": 4.124230850838107,
      "grad_norm": 0.558943717867106,
      "learning_rate": 3.6830172100237434e-05,
      "loss": 1.3017,
      "num_input_tokens_seen": 30585529376,
      "step": 38875
    },
    {
      "epoch": 4.124336940377678,
      "grad_norm": 0.5715762456678919,
      "learning_rate": 3.682955986196016e-05,
      "loss": 1.358,
      "num_input_tokens_seen": 30586316192,
      "step": 38876
    },
    {
      "epoch": 4.12444302991725,
      "grad_norm": 0.5265071822418605,
      "learning_rate": 3.682894761454135e-05,
      "loss": 1.3342,
      "num_input_tokens_seen": 30587102960,
      "step": 38877
    },
    {
      "epoch": 4.124549119456821,
      "grad_norm": 0.4833648225635358,
      "learning_rate": 3.682833535798147e-05,
      "loss": 1.2558,
      "num_input_tokens_seen": 30587889712,
      "step": 38878
    },
    {
      "epoch": 4.124655208996393,
      "grad_norm": 0.5478147462497927,
      "learning_rate": 3.6827723092281e-05,
      "loss": 1.1957,
      "num_input_tokens_seen": 30588676592,
      "step": 38879
    },
    {
      "epoch": 4.124761298535964,
      "grad_norm": 0.500397399254948,
      "learning_rate": 3.682711081744042e-05,
      "loss": 1.2938,
      "num_input_tokens_seen": 30589463344,
      "step": 38880
    },
    {
      "epoch": 4.124867388075535,
      "grad_norm": 0.5042825195640775,
      "learning_rate": 3.682649853346018e-05,
      "loss": 1.3149,
      "num_input_tokens_seen": 30590250112,
      "step": 38881
    },
    {
      "epoch": 4.124973477615107,
      "grad_norm": 0.5277210749011559,
      "learning_rate": 3.6825886240340785e-05,
      "loss": 1.3154,
      "num_input_tokens_seen": 30591036896,
      "step": 38882
    },
    {
      "epoch": 4.125079567154678,
      "grad_norm": 0.5871056822631129,
      "learning_rate": 3.682527393808269e-05,
      "loss": 1.2745,
      "num_input_tokens_seen": 30591823616,
      "step": 38883
    },
    {
      "epoch": 4.12518565669425,
      "grad_norm": 0.5244418160931488,
      "learning_rate": 3.6824661626686366e-05,
      "loss": 1.4073,
      "num_input_tokens_seen": 30592610304,
      "step": 38884
    },
    {
      "epoch": 4.125291746233821,
      "grad_norm": 0.5824645739620418,
      "learning_rate": 3.6824049306152286e-05,
      "loss": 1.4297,
      "num_input_tokens_seen": 30593397040,
      "step": 38885
    },
    {
      "epoch": 4.125397835773393,
      "grad_norm": 0.58488466841683,
      "learning_rate": 3.682343697648093e-05,
      "loss": 1.2857,
      "num_input_tokens_seen": 30594183744,
      "step": 38886
    },
    {
      "epoch": 4.125503925312964,
      "grad_norm": 0.5450577238998745,
      "learning_rate": 3.682282463767277e-05,
      "loss": 1.2499,
      "num_input_tokens_seen": 30594970512,
      "step": 38887
    },
    {
      "epoch": 4.125610014852535,
      "grad_norm": 0.532305500999599,
      "learning_rate": 3.6822212289728284e-05,
      "loss": 1.3466,
      "num_input_tokens_seen": 30595757248,
      "step": 38888
    },
    {
      "epoch": 4.125716104392107,
      "grad_norm": 0.6242159764307589,
      "learning_rate": 3.682159993264793e-05,
      "loss": 1.2611,
      "num_input_tokens_seen": 30596543904,
      "step": 38889
    },
    {
      "epoch": 4.125822193931678,
      "grad_norm": 0.5525485873209531,
      "learning_rate": 3.682098756643219e-05,
      "loss": 1.4344,
      "num_input_tokens_seen": 30597330672,
      "step": 38890
    },
    {
      "epoch": 4.12592828347125,
      "grad_norm": 0.5069969783407202,
      "learning_rate": 3.682037519108155e-05,
      "loss": 1.3319,
      "num_input_tokens_seen": 30598117520,
      "step": 38891
    },
    {
      "epoch": 4.126034373010821,
      "grad_norm": 0.5475647731664371,
      "learning_rate": 3.681976280659646e-05,
      "loss": 1.2886,
      "num_input_tokens_seen": 30598904272,
      "step": 38892
    },
    {
      "epoch": 4.126140462550392,
      "grad_norm": 0.5162227564882321,
      "learning_rate": 3.68191504129774e-05,
      "loss": 1.3256,
      "num_input_tokens_seen": 30599690912,
      "step": 38893
    },
    {
      "epoch": 4.126246552089964,
      "grad_norm": 0.49354124846197206,
      "learning_rate": 3.6818538010224864e-05,
      "loss": 1.3265,
      "num_input_tokens_seen": 30600477776,
      "step": 38894
    },
    {
      "epoch": 4.126352641629535,
      "grad_norm": 0.49556272293320297,
      "learning_rate": 3.68179255983393e-05,
      "loss": 1.2014,
      "num_input_tokens_seen": 30601264592,
      "step": 38895
    },
    {
      "epoch": 4.126458731169107,
      "grad_norm": 0.4875514771780845,
      "learning_rate": 3.681731317732119e-05,
      "loss": 1.2868,
      "num_input_tokens_seen": 30602051328,
      "step": 38896
    },
    {
      "epoch": 4.126564820708678,
      "grad_norm": 0.6081740894942923,
      "learning_rate": 3.6816700747171005e-05,
      "loss": 1.2534,
      "num_input_tokens_seen": 30602838080,
      "step": 38897
    },
    {
      "epoch": 4.12667091024825,
      "grad_norm": 0.5532746493076349,
      "learning_rate": 3.681608830788922e-05,
      "loss": 1.32,
      "num_input_tokens_seen": 30603624864,
      "step": 38898
    },
    {
      "epoch": 4.126776999787821,
      "grad_norm": 0.5946517711856555,
      "learning_rate": 3.6815475859476314e-05,
      "loss": 1.3361,
      "num_input_tokens_seen": 30604411616,
      "step": 38899
    },
    {
      "epoch": 4.126883089327392,
      "grad_norm": 0.6174500444105693,
      "learning_rate": 3.681486340193275e-05,
      "loss": 1.3059,
      "num_input_tokens_seen": 30605198400,
      "step": 38900
    },
    {
      "epoch": 4.126989178866964,
      "grad_norm": 0.4605654454752388,
      "learning_rate": 3.6814250935259005e-05,
      "loss": 1.2246,
      "num_input_tokens_seen": 30605985168,
      "step": 38901
    },
    {
      "epoch": 4.127095268406535,
      "grad_norm": 0.45985340152825244,
      "learning_rate": 3.681363845945556e-05,
      "loss": 1.2756,
      "num_input_tokens_seen": 30606771904,
      "step": 38902
    },
    {
      "epoch": 4.127201357946107,
      "grad_norm": 0.7608550412041799,
      "learning_rate": 3.6813025974522874e-05,
      "loss": 1.2914,
      "num_input_tokens_seen": 30607558688,
      "step": 38903
    },
    {
      "epoch": 4.127307447485678,
      "grad_norm": 0.5062191605250204,
      "learning_rate": 3.681241348046143e-05,
      "loss": 1.3559,
      "num_input_tokens_seen": 30608345440,
      "step": 38904
    },
    {
      "epoch": 4.127413537025249,
      "grad_norm": 0.5599198097616093,
      "learning_rate": 3.68118009772717e-05,
      "loss": 1.2792,
      "num_input_tokens_seen": 30609132208,
      "step": 38905
    },
    {
      "epoch": 4.127519626564821,
      "grad_norm": 0.5052453731525566,
      "learning_rate": 3.6811188464954164e-05,
      "loss": 1.3363,
      "num_input_tokens_seen": 30609919088,
      "step": 38906
    },
    {
      "epoch": 4.127625716104392,
      "grad_norm": 0.5018026533719575,
      "learning_rate": 3.6810575943509276e-05,
      "loss": 1.3104,
      "num_input_tokens_seen": 30610705824,
      "step": 38907
    },
    {
      "epoch": 4.127731805643964,
      "grad_norm": 0.5039030125748059,
      "learning_rate": 3.6809963412937534e-05,
      "loss": 1.272,
      "num_input_tokens_seen": 30611492592,
      "step": 38908
    },
    {
      "epoch": 4.127837895183535,
      "grad_norm": 0.6148352520195457,
      "learning_rate": 3.680935087323939e-05,
      "loss": 1.3847,
      "num_input_tokens_seen": 30612279296,
      "step": 38909
    },
    {
      "epoch": 4.127943984723107,
      "grad_norm": 0.44958464707940304,
      "learning_rate": 3.680873832441533e-05,
      "loss": 1.2712,
      "num_input_tokens_seen": 30613066176,
      "step": 38910
    },
    {
      "epoch": 4.128050074262678,
      "grad_norm": 0.5063349215238561,
      "learning_rate": 3.680812576646582e-05,
      "loss": 1.2326,
      "num_input_tokens_seen": 30613852992,
      "step": 38911
    },
    {
      "epoch": 4.128156163802249,
      "grad_norm": 0.5727845876274182,
      "learning_rate": 3.6807513199391344e-05,
      "loss": 1.2827,
      "num_input_tokens_seen": 30614639792,
      "step": 38912
    },
    {
      "epoch": 4.128262253341821,
      "grad_norm": 0.5640686864032379,
      "learning_rate": 3.6806900623192356e-05,
      "loss": 1.3255,
      "num_input_tokens_seen": 30615426656,
      "step": 38913
    },
    {
      "epoch": 4.128368342881392,
      "grad_norm": 0.6542432556075889,
      "learning_rate": 3.680628803786935e-05,
      "loss": 1.3605,
      "num_input_tokens_seen": 30616213424,
      "step": 38914
    },
    {
      "epoch": 4.128474432420964,
      "grad_norm": 0.4691455776700233,
      "learning_rate": 3.6805675443422795e-05,
      "loss": 1.2575,
      "num_input_tokens_seen": 30617000240,
      "step": 38915
    },
    {
      "epoch": 4.128580521960535,
      "grad_norm": 0.44335092254000413,
      "learning_rate": 3.680506283985316e-05,
      "loss": 1.2431,
      "num_input_tokens_seen": 30617787120,
      "step": 38916
    },
    {
      "epoch": 4.128686611500106,
      "grad_norm": 0.538736722889581,
      "learning_rate": 3.6804450227160914e-05,
      "loss": 1.2924,
      "num_input_tokens_seen": 30618573888,
      "step": 38917
    },
    {
      "epoch": 4.128792701039678,
      "grad_norm": 0.49925459654712157,
      "learning_rate": 3.680383760534653e-05,
      "loss": 1.37,
      "num_input_tokens_seen": 30619360592,
      "step": 38918
    },
    {
      "epoch": 4.128898790579249,
      "grad_norm": 0.5142784340218816,
      "learning_rate": 3.680322497441049e-05,
      "loss": 1.3191,
      "num_input_tokens_seen": 30620147440,
      "step": 38919
    },
    {
      "epoch": 4.129004880118821,
      "grad_norm": 0.7460154091241702,
      "learning_rate": 3.680261233435327e-05,
      "loss": 1.3259,
      "num_input_tokens_seen": 30620934096,
      "step": 38920
    },
    {
      "epoch": 4.129110969658392,
      "grad_norm": 0.7823600514098499,
      "learning_rate": 3.6801999685175334e-05,
      "loss": 1.372,
      "num_input_tokens_seen": 30621720832,
      "step": 38921
    },
    {
      "epoch": 4.129217059197963,
      "grad_norm": 0.76656993337544,
      "learning_rate": 3.680138702687716e-05,
      "loss": 1.2988,
      "num_input_tokens_seen": 30622507536,
      "step": 38922
    },
    {
      "epoch": 4.129323148737535,
      "grad_norm": 0.5836655766262364,
      "learning_rate": 3.6800774359459225e-05,
      "loss": 1.247,
      "num_input_tokens_seen": 30623294384,
      "step": 38923
    },
    {
      "epoch": 4.129429238277106,
      "grad_norm": 0.7368200611188821,
      "learning_rate": 3.680016168292199e-05,
      "loss": 1.2869,
      "num_input_tokens_seen": 30624081168,
      "step": 38924
    },
    {
      "epoch": 4.1295353278166775,
      "grad_norm": 0.9581148789355494,
      "learning_rate": 3.679954899726593e-05,
      "loss": 1.3806,
      "num_input_tokens_seen": 30624867984,
      "step": 38925
    },
    {
      "epoch": 4.129641417356249,
      "grad_norm": 0.8299855888051165,
      "learning_rate": 3.6798936302491535e-05,
      "loss": 1.2854,
      "num_input_tokens_seen": 30625654784,
      "step": 38926
    },
    {
      "epoch": 4.1297475068958205,
      "grad_norm": 1.2861282331945785,
      "learning_rate": 3.679832359859927e-05,
      "loss": 1.3456,
      "num_input_tokens_seen": 30626441568,
      "step": 38927
    },
    {
      "epoch": 4.1298535964353915,
      "grad_norm": 0.6157013642255961,
      "learning_rate": 3.67977108855896e-05,
      "loss": 1.2991,
      "num_input_tokens_seen": 30627228416,
      "step": 38928
    },
    {
      "epoch": 4.1299596859749625,
      "grad_norm": 0.8223688500825818,
      "learning_rate": 3.679709816346301e-05,
      "loss": 1.2561,
      "num_input_tokens_seen": 30628015200,
      "step": 38929
    },
    {
      "epoch": 4.1300657755145345,
      "grad_norm": 1.34781304580677,
      "learning_rate": 3.6796485432219966e-05,
      "loss": 1.305,
      "num_input_tokens_seen": 30628801888,
      "step": 38930
    },
    {
      "epoch": 4.1301718650541055,
      "grad_norm": 0.790732162521247,
      "learning_rate": 3.6795872691860944e-05,
      "loss": 1.3389,
      "num_input_tokens_seen": 30629588640,
      "step": 38931
    },
    {
      "epoch": 4.130277954593677,
      "grad_norm": 0.6547890671307411,
      "learning_rate": 3.679525994238642e-05,
      "loss": 1.4086,
      "num_input_tokens_seen": 30630375504,
      "step": 38932
    },
    {
      "epoch": 4.1303840441332484,
      "grad_norm": 0.7509143077372006,
      "learning_rate": 3.679464718379686e-05,
      "loss": 1.309,
      "num_input_tokens_seen": 30631162240,
      "step": 38933
    },
    {
      "epoch": 4.1304901336728195,
      "grad_norm": 0.5833700832536409,
      "learning_rate": 3.679403441609275e-05,
      "loss": 1.2631,
      "num_input_tokens_seen": 30631949104,
      "step": 38934
    },
    {
      "epoch": 4.130596223212391,
      "grad_norm": 0.7406073423676905,
      "learning_rate": 3.679342163927455e-05,
      "loss": 1.2763,
      "num_input_tokens_seen": 30632735872,
      "step": 38935
    },
    {
      "epoch": 4.130702312751962,
      "grad_norm": 0.5825904832659331,
      "learning_rate": 3.679280885334274e-05,
      "loss": 1.2468,
      "num_input_tokens_seen": 30633522544,
      "step": 38936
    },
    {
      "epoch": 4.130808402291534,
      "grad_norm": 0.5913903233320964,
      "learning_rate": 3.67921960582978e-05,
      "loss": 1.312,
      "num_input_tokens_seen": 30634309280,
      "step": 38937
    },
    {
      "epoch": 4.130914491831105,
      "grad_norm": 0.7347882134943465,
      "learning_rate": 3.6791583254140197e-05,
      "loss": 1.26,
      "num_input_tokens_seen": 30635096016,
      "step": 38938
    },
    {
      "epoch": 4.131020581370677,
      "grad_norm": 0.6668996321475416,
      "learning_rate": 3.6790970440870395e-05,
      "loss": 1.3567,
      "num_input_tokens_seen": 30635882848,
      "step": 38939
    },
    {
      "epoch": 4.131126670910248,
      "grad_norm": 0.5380249876325999,
      "learning_rate": 3.679035761848888e-05,
      "loss": 1.27,
      "num_input_tokens_seen": 30636669616,
      "step": 38940
    },
    {
      "epoch": 4.131232760449819,
      "grad_norm": 0.667563979893696,
      "learning_rate": 3.6789744786996124e-05,
      "loss": 1.2546,
      "num_input_tokens_seen": 30637456336,
      "step": 38941
    },
    {
      "epoch": 4.131338849989391,
      "grad_norm": 0.5862914809232704,
      "learning_rate": 3.6789131946392603e-05,
      "loss": 1.3443,
      "num_input_tokens_seen": 30638243152,
      "step": 38942
    },
    {
      "epoch": 4.131444939528962,
      "grad_norm": 0.8338940714654136,
      "learning_rate": 3.678851909667879e-05,
      "loss": 1.2354,
      "num_input_tokens_seen": 30639029968,
      "step": 38943
    },
    {
      "epoch": 4.131551029068534,
      "grad_norm": 0.5693264179257771,
      "learning_rate": 3.678790623785514e-05,
      "loss": 1.3621,
      "num_input_tokens_seen": 30639816816,
      "step": 38944
    },
    {
      "epoch": 4.131657118608105,
      "grad_norm": 0.6536991171524587,
      "learning_rate": 3.678729336992215e-05,
      "loss": 1.3746,
      "num_input_tokens_seen": 30640603536,
      "step": 38945
    },
    {
      "epoch": 4.131763208147676,
      "grad_norm": 0.7607114242391368,
      "learning_rate": 3.6786680492880296e-05,
      "loss": 1.2665,
      "num_input_tokens_seen": 30641390240,
      "step": 38946
    },
    {
      "epoch": 4.131869297687248,
      "grad_norm": 0.5623692664376388,
      "learning_rate": 3.6786067606730025e-05,
      "loss": 1.3368,
      "num_input_tokens_seen": 30642177024,
      "step": 38947
    },
    {
      "epoch": 4.131975387226819,
      "grad_norm": 0.6804164125138626,
      "learning_rate": 3.678545471147183e-05,
      "loss": 1.2373,
      "num_input_tokens_seen": 30642963760,
      "step": 38948
    },
    {
      "epoch": 4.132081476766391,
      "grad_norm": 0.5006761733096716,
      "learning_rate": 3.678484180710619e-05,
      "loss": 1.3493,
      "num_input_tokens_seen": 30643750512,
      "step": 38949
    },
    {
      "epoch": 4.132187566305962,
      "grad_norm": 0.6012294943071932,
      "learning_rate": 3.6784228893633565e-05,
      "loss": 1.4364,
      "num_input_tokens_seen": 30644537264,
      "step": 38950
    },
    {
      "epoch": 4.132293655845533,
      "grad_norm": 0.4826314098934418,
      "learning_rate": 3.678361597105443e-05,
      "loss": 1.2967,
      "num_input_tokens_seen": 30645324048,
      "step": 38951
    },
    {
      "epoch": 4.132399745385105,
      "grad_norm": 0.5840199143004573,
      "learning_rate": 3.6783003039369276e-05,
      "loss": 1.3613,
      "num_input_tokens_seen": 30646110832,
      "step": 38952
    },
    {
      "epoch": 4.132505834924676,
      "grad_norm": 0.48964617851569503,
      "learning_rate": 3.678239009857854e-05,
      "loss": 1.263,
      "num_input_tokens_seen": 30646897664,
      "step": 38953
    },
    {
      "epoch": 4.132611924464248,
      "grad_norm": 0.7711207572432343,
      "learning_rate": 3.678177714868274e-05,
      "loss": 1.3159,
      "num_input_tokens_seen": 30647684496,
      "step": 38954
    },
    {
      "epoch": 4.132718014003819,
      "grad_norm": 0.5027118929223297,
      "learning_rate": 3.678116418968232e-05,
      "loss": 1.2386,
      "num_input_tokens_seen": 30648471360,
      "step": 38955
    },
    {
      "epoch": 4.132824103543391,
      "grad_norm": 0.5945023998154682,
      "learning_rate": 3.678055122157776e-05,
      "loss": 1.3522,
      "num_input_tokens_seen": 30649258192,
      "step": 38956
    },
    {
      "epoch": 4.132930193082962,
      "grad_norm": 0.49777738825176704,
      "learning_rate": 3.677993824436954e-05,
      "loss": 1.3277,
      "num_input_tokens_seen": 30650044880,
      "step": 38957
    },
    {
      "epoch": 4.133036282622533,
      "grad_norm": 0.5820335418167927,
      "learning_rate": 3.6779325258058125e-05,
      "loss": 1.1958,
      "num_input_tokens_seen": 30650831712,
      "step": 38958
    },
    {
      "epoch": 4.133142372162105,
      "grad_norm": 0.5446684641771274,
      "learning_rate": 3.677871226264399e-05,
      "loss": 1.321,
      "num_input_tokens_seen": 30651618464,
      "step": 38959
    },
    {
      "epoch": 4.133248461701676,
      "grad_norm": 0.5367161666782962,
      "learning_rate": 3.677809925812762e-05,
      "loss": 1.3331,
      "num_input_tokens_seen": 30652405232,
      "step": 38960
    },
    {
      "epoch": 4.133354551241248,
      "grad_norm": 0.6224866207260589,
      "learning_rate": 3.677748624450948e-05,
      "loss": 1.3949,
      "num_input_tokens_seen": 30653191952,
      "step": 38961
    },
    {
      "epoch": 4.133460640780819,
      "grad_norm": 0.5356413056524393,
      "learning_rate": 3.6776873221790044e-05,
      "loss": 1.319,
      "num_input_tokens_seen": 30653978736,
      "step": 38962
    },
    {
      "epoch": 4.13356673032039,
      "grad_norm": 0.6137038507176871,
      "learning_rate": 3.677626018996978e-05,
      "loss": 1.412,
      "num_input_tokens_seen": 30654765456,
      "step": 38963
    },
    {
      "epoch": 4.133672819859962,
      "grad_norm": 0.6314299818074948,
      "learning_rate": 3.677564714904917e-05,
      "loss": 1.2709,
      "num_input_tokens_seen": 30655552224,
      "step": 38964
    },
    {
      "epoch": 4.133778909399533,
      "grad_norm": 0.6731545954879886,
      "learning_rate": 3.677503409902869e-05,
      "loss": 1.3364,
      "num_input_tokens_seen": 30656338928,
      "step": 38965
    },
    {
      "epoch": 4.133884998939105,
      "grad_norm": 0.741860729284866,
      "learning_rate": 3.677442103990881e-05,
      "loss": 1.3438,
      "num_input_tokens_seen": 30657125696,
      "step": 38966
    },
    {
      "epoch": 4.133991088478676,
      "grad_norm": 0.5475201765713825,
      "learning_rate": 3.6773807971689996e-05,
      "loss": 1.1627,
      "num_input_tokens_seen": 30657912464,
      "step": 38967
    },
    {
      "epoch": 4.134097178018248,
      "grad_norm": 0.637230618453857,
      "learning_rate": 3.677319489437273e-05,
      "loss": 1.3012,
      "num_input_tokens_seen": 30658699168,
      "step": 38968
    },
    {
      "epoch": 4.134203267557819,
      "grad_norm": 0.6176654945142486,
      "learning_rate": 3.677258180795748e-05,
      "loss": 1.3367,
      "num_input_tokens_seen": 30659485936,
      "step": 38969
    },
    {
      "epoch": 4.13430935709739,
      "grad_norm": 0.5784834091018907,
      "learning_rate": 3.677196871244473e-05,
      "loss": 1.2565,
      "num_input_tokens_seen": 30660272688,
      "step": 38970
    },
    {
      "epoch": 4.134415446636962,
      "grad_norm": 0.5015945394394036,
      "learning_rate": 3.677135560783496e-05,
      "loss": 1.1782,
      "num_input_tokens_seen": 30661059440,
      "step": 38971
    },
    {
      "epoch": 4.134521536176533,
      "grad_norm": 0.5961926328047497,
      "learning_rate": 3.677074249412861e-05,
      "loss": 1.2827,
      "num_input_tokens_seen": 30661846304,
      "step": 38972
    },
    {
      "epoch": 4.134627625716105,
      "grad_norm": 0.5397397099958843,
      "learning_rate": 3.677012937132619e-05,
      "loss": 1.3102,
      "num_input_tokens_seen": 30662632960,
      "step": 38973
    },
    {
      "epoch": 4.134733715255676,
      "grad_norm": 0.6656580853475114,
      "learning_rate": 3.676951623942815e-05,
      "loss": 1.4057,
      "num_input_tokens_seen": 30663419664,
      "step": 38974
    },
    {
      "epoch": 4.134839804795247,
      "grad_norm": 0.5903456666414036,
      "learning_rate": 3.6768903098434974e-05,
      "loss": 1.2656,
      "num_input_tokens_seen": 30664206496,
      "step": 38975
    },
    {
      "epoch": 4.134945894334819,
      "grad_norm": 0.6606687489469242,
      "learning_rate": 3.676828994834714e-05,
      "loss": 1.2384,
      "num_input_tokens_seen": 30664993264,
      "step": 38976
    },
    {
      "epoch": 4.13505198387439,
      "grad_norm": 0.6159030001687721,
      "learning_rate": 3.6767676789165125e-05,
      "loss": 1.4418,
      "num_input_tokens_seen": 30665780032,
      "step": 38977
    },
    {
      "epoch": 4.135158073413962,
      "grad_norm": 0.7527944155701973,
      "learning_rate": 3.676706362088938e-05,
      "loss": 1.3573,
      "num_input_tokens_seen": 30666566816,
      "step": 38978
    },
    {
      "epoch": 4.135264162953533,
      "grad_norm": 0.5454885793201159,
      "learning_rate": 3.67664504435204e-05,
      "loss": 1.2688,
      "num_input_tokens_seen": 30667353600,
      "step": 38979
    },
    {
      "epoch": 4.135370252493104,
      "grad_norm": 0.6048221752783702,
      "learning_rate": 3.676583725705866e-05,
      "loss": 1.2728,
      "num_input_tokens_seen": 30668140432,
      "step": 38980
    },
    {
      "epoch": 4.135476342032676,
      "grad_norm": 0.6712701259130812,
      "learning_rate": 3.6765224061504605e-05,
      "loss": 1.3912,
      "num_input_tokens_seen": 30668927216,
      "step": 38981
    },
    {
      "epoch": 4.135582431572247,
      "grad_norm": 0.5824105228861075,
      "learning_rate": 3.6764610856858744e-05,
      "loss": 1.2642,
      "num_input_tokens_seen": 30669714000,
      "step": 38982
    },
    {
      "epoch": 4.135688521111819,
      "grad_norm": 0.7057785810707966,
      "learning_rate": 3.6763997643121536e-05,
      "loss": 1.3572,
      "num_input_tokens_seen": 30670500816,
      "step": 38983
    },
    {
      "epoch": 4.13579461065139,
      "grad_norm": 0.5630257550229141,
      "learning_rate": 3.6763384420293456e-05,
      "loss": 1.3169,
      "num_input_tokens_seen": 30671287552,
      "step": 38984
    },
    {
      "epoch": 4.135900700190962,
      "grad_norm": 0.6615962664813224,
      "learning_rate": 3.676277118837497e-05,
      "loss": 1.214,
      "num_input_tokens_seen": 30672074352,
      "step": 38985
    },
    {
      "epoch": 4.136006789730533,
      "grad_norm": 0.6937875334159065,
      "learning_rate": 3.676215794736657e-05,
      "loss": 1.2959,
      "num_input_tokens_seen": 30672861040,
      "step": 38986
    },
    {
      "epoch": 4.136112879270104,
      "grad_norm": 0.5257191714283422,
      "learning_rate": 3.676154469726871e-05,
      "loss": 1.2347,
      "num_input_tokens_seen": 30673647728,
      "step": 38987
    },
    {
      "epoch": 4.1362189688096755,
      "grad_norm": 0.9365274108135474,
      "learning_rate": 3.676093143808188e-05,
      "loss": 1.223,
      "num_input_tokens_seen": 30674434480,
      "step": 38988
    },
    {
      "epoch": 4.136325058349247,
      "grad_norm": 0.7608214222550704,
      "learning_rate": 3.676031816980655e-05,
      "loss": 1.2634,
      "num_input_tokens_seen": 30675221200,
      "step": 38989
    },
    {
      "epoch": 4.1364311478888185,
      "grad_norm": 0.6735671206353145,
      "learning_rate": 3.675970489244319e-05,
      "loss": 1.3098,
      "num_input_tokens_seen": 30676007904,
      "step": 38990
    },
    {
      "epoch": 4.1365372374283895,
      "grad_norm": 0.8826273288898929,
      "learning_rate": 3.6759091605992274e-05,
      "loss": 1.3171,
      "num_input_tokens_seen": 30676794672,
      "step": 38991
    },
    {
      "epoch": 4.1366433269679606,
      "grad_norm": 0.7266000350302084,
      "learning_rate": 3.6758478310454276e-05,
      "loss": 1.3856,
      "num_input_tokens_seen": 30677581488,
      "step": 38992
    },
    {
      "epoch": 4.1367494165075325,
      "grad_norm": 0.67564396325678,
      "learning_rate": 3.675786500582967e-05,
      "loss": 1.2316,
      "num_input_tokens_seen": 30678368256,
      "step": 38993
    },
    {
      "epoch": 4.1368555060471035,
      "grad_norm": 0.7405218998961253,
      "learning_rate": 3.675725169211893e-05,
      "loss": 1.2796,
      "num_input_tokens_seen": 30679154960,
      "step": 38994
    },
    {
      "epoch": 4.136961595586675,
      "grad_norm": 0.6228935092417293,
      "learning_rate": 3.675663836932254e-05,
      "loss": 1.2475,
      "num_input_tokens_seen": 30679941728,
      "step": 38995
    },
    {
      "epoch": 4.1370676851262465,
      "grad_norm": 0.7036059981430713,
      "learning_rate": 3.675602503744095e-05,
      "loss": 1.3154,
      "num_input_tokens_seen": 30680728480,
      "step": 38996
    },
    {
      "epoch": 4.137173774665818,
      "grad_norm": 0.6131537313075606,
      "learning_rate": 3.675541169647466e-05,
      "loss": 1.3086,
      "num_input_tokens_seen": 30681515312,
      "step": 38997
    },
    {
      "epoch": 4.137279864205389,
      "grad_norm": 0.4564455176657372,
      "learning_rate": 3.675479834642413e-05,
      "loss": 1.2481,
      "num_input_tokens_seen": 30682302016,
      "step": 38998
    },
    {
      "epoch": 4.13738595374496,
      "grad_norm": 0.5256876801394723,
      "learning_rate": 3.675418498728983e-05,
      "loss": 1.2671,
      "num_input_tokens_seen": 30683088864,
      "step": 38999
    },
    {
      "epoch": 4.137492043284532,
      "grad_norm": 0.5411736164274662,
      "learning_rate": 3.6753571619072245e-05,
      "loss": 1.2171,
      "num_input_tokens_seen": 30683875680,
      "step": 39000
    },
    {
      "epoch": 4.137492043284532,
      "eval_loss": 1.597307801246643,
      "eval_runtime": 64.765,
      "eval_samples_per_second": 46.321,
      "eval_steps_per_second": 0.494,
      "num_input_tokens_seen": 30683875680,
      "step": 39000
    },
    {
      "epoch": 4.137598132824103,
      "grad_norm": 0.6077764757152706,
      "learning_rate": 3.6752958241771843e-05,
      "loss": 1.4221,
      "num_input_tokens_seen": 30684662416,
      "step": 39001
    },
    {
      "epoch": 4.137704222363675,
      "grad_norm": 0.5997265173112171,
      "learning_rate": 3.675234485538911e-05,
      "loss": 1.3343,
      "num_input_tokens_seen": 30685449184,
      "step": 39002
    },
    {
      "epoch": 4.137810311903246,
      "grad_norm": 1.0451573097397617,
      "learning_rate": 3.6751731459924505e-05,
      "loss": 1.462,
      "num_input_tokens_seen": 30686236000,
      "step": 39003
    },
    {
      "epoch": 4.137916401442817,
      "grad_norm": 0.553679563774123,
      "learning_rate": 3.6751118055378496e-05,
      "loss": 1.3513,
      "num_input_tokens_seen": 30687022768,
      "step": 39004
    },
    {
      "epoch": 4.138022490982389,
      "grad_norm": 0.7096910929196131,
      "learning_rate": 3.675050464175158e-05,
      "loss": 1.3432,
      "num_input_tokens_seen": 30687809552,
      "step": 39005
    },
    {
      "epoch": 4.13812858052196,
      "grad_norm": 0.898400245346989,
      "learning_rate": 3.674989121904422e-05,
      "loss": 1.2873,
      "num_input_tokens_seen": 30688596368,
      "step": 39006
    },
    {
      "epoch": 4.138234670061532,
      "grad_norm": 0.5650862304926375,
      "learning_rate": 3.674927778725688e-05,
      "loss": 1.3101,
      "num_input_tokens_seen": 30689383136,
      "step": 39007
    },
    {
      "epoch": 4.138340759601103,
      "grad_norm": 0.7294900600119356,
      "learning_rate": 3.674866434639005e-05,
      "loss": 1.3626,
      "num_input_tokens_seen": 30690169952,
      "step": 39008
    },
    {
      "epoch": 4.138446849140674,
      "grad_norm": 0.8214579634434894,
      "learning_rate": 3.674805089644419e-05,
      "loss": 1.2854,
      "num_input_tokens_seen": 30690956800,
      "step": 39009
    },
    {
      "epoch": 4.138552938680246,
      "grad_norm": 0.5744711761485836,
      "learning_rate": 3.674743743741978e-05,
      "loss": 1.2903,
      "num_input_tokens_seen": 30691743456,
      "step": 39010
    },
    {
      "epoch": 4.138659028219817,
      "grad_norm": 0.6645903415960882,
      "learning_rate": 3.6746823969317306e-05,
      "loss": 1.266,
      "num_input_tokens_seen": 30692530256,
      "step": 39011
    },
    {
      "epoch": 4.138765117759389,
      "grad_norm": 0.6565219131301404,
      "learning_rate": 3.6746210492137226e-05,
      "loss": 1.3194,
      "num_input_tokens_seen": 30693317040,
      "step": 39012
    },
    {
      "epoch": 4.13887120729896,
      "grad_norm": 0.45363418730168187,
      "learning_rate": 3.6745597005880016e-05,
      "loss": 1.2807,
      "num_input_tokens_seen": 30694103936,
      "step": 39013
    },
    {
      "epoch": 4.138977296838532,
      "grad_norm": 0.6235116993278161,
      "learning_rate": 3.6744983510546156e-05,
      "loss": 1.4032,
      "num_input_tokens_seen": 30694890656,
      "step": 39014
    },
    {
      "epoch": 4.139083386378103,
      "grad_norm": 0.5646322684210392,
      "learning_rate": 3.674437000613612e-05,
      "loss": 1.302,
      "num_input_tokens_seen": 30695677440,
      "step": 39015
    },
    {
      "epoch": 4.139189475917674,
      "grad_norm": 0.6809565469831279,
      "learning_rate": 3.674375649265037e-05,
      "loss": 1.4227,
      "num_input_tokens_seen": 30696464128,
      "step": 39016
    },
    {
      "epoch": 4.139295565457246,
      "grad_norm": 0.6721949811918618,
      "learning_rate": 3.67431429700894e-05,
      "loss": 1.2285,
      "num_input_tokens_seen": 30697250976,
      "step": 39017
    },
    {
      "epoch": 4.139401654996817,
      "grad_norm": 0.6678130003033611,
      "learning_rate": 3.6742529438453664e-05,
      "loss": 1.26,
      "num_input_tokens_seen": 30698037744,
      "step": 39018
    },
    {
      "epoch": 4.139507744536389,
      "grad_norm": 0.5201924198410739,
      "learning_rate": 3.6741915897743653e-05,
      "loss": 1.1828,
      "num_input_tokens_seen": 30698824608,
      "step": 39019
    },
    {
      "epoch": 4.13961383407596,
      "grad_norm": 0.8666299097162198,
      "learning_rate": 3.674130234795983e-05,
      "loss": 1.3803,
      "num_input_tokens_seen": 30699611424,
      "step": 39020
    },
    {
      "epoch": 4.139719923615531,
      "grad_norm": 0.6068432872466093,
      "learning_rate": 3.6740688789102676e-05,
      "loss": 1.3572,
      "num_input_tokens_seen": 30700398208,
      "step": 39021
    },
    {
      "epoch": 4.139826013155103,
      "grad_norm": 0.4565285313363045,
      "learning_rate": 3.6740075221172665e-05,
      "loss": 1.2577,
      "num_input_tokens_seen": 30701185008,
      "step": 39022
    },
    {
      "epoch": 4.139932102694674,
      "grad_norm": 0.5075862089151796,
      "learning_rate": 3.673946164417027e-05,
      "loss": 1.2135,
      "num_input_tokens_seen": 30701971792,
      "step": 39023
    },
    {
      "epoch": 4.140038192234246,
      "grad_norm": 0.5808785928020102,
      "learning_rate": 3.673884805809595e-05,
      "loss": 1.3134,
      "num_input_tokens_seen": 30702758528,
      "step": 39024
    },
    {
      "epoch": 4.140144281773817,
      "grad_norm": 0.7365896375425066,
      "learning_rate": 3.67382344629502e-05,
      "loss": 1.3998,
      "num_input_tokens_seen": 30703545344,
      "step": 39025
    },
    {
      "epoch": 4.140250371313389,
      "grad_norm": 0.6794013749649307,
      "learning_rate": 3.673762085873349e-05,
      "loss": 1.3524,
      "num_input_tokens_seen": 30704332080,
      "step": 39026
    },
    {
      "epoch": 4.14035646085296,
      "grad_norm": 0.6636182256407305,
      "learning_rate": 3.6737007245446285e-05,
      "loss": 1.3536,
      "num_input_tokens_seen": 30705118880,
      "step": 39027
    },
    {
      "epoch": 4.140462550392531,
      "grad_norm": 0.818584863648934,
      "learning_rate": 3.6736393623089075e-05,
      "loss": 1.2308,
      "num_input_tokens_seen": 30705905632,
      "step": 39028
    },
    {
      "epoch": 4.140568639932103,
      "grad_norm": 0.48458583063819677,
      "learning_rate": 3.6735779991662316e-05,
      "loss": 1.2879,
      "num_input_tokens_seen": 30706692304,
      "step": 39029
    },
    {
      "epoch": 4.140674729471674,
      "grad_norm": 0.759449476386674,
      "learning_rate": 3.673516635116649e-05,
      "loss": 1.369,
      "num_input_tokens_seen": 30707479056,
      "step": 39030
    },
    {
      "epoch": 4.140780819011246,
      "grad_norm": 0.5735954542672699,
      "learning_rate": 3.6734552701602074e-05,
      "loss": 1.21,
      "num_input_tokens_seen": 30708265840,
      "step": 39031
    },
    {
      "epoch": 4.140886908550817,
      "grad_norm": 0.6805698113181399,
      "learning_rate": 3.673393904296954e-05,
      "loss": 1.269,
      "num_input_tokens_seen": 30709052624,
      "step": 39032
    },
    {
      "epoch": 4.140992998090388,
      "grad_norm": 0.5281683387370338,
      "learning_rate": 3.673332537526936e-05,
      "loss": 1.3662,
      "num_input_tokens_seen": 30709839376,
      "step": 39033
    },
    {
      "epoch": 4.14109908762996,
      "grad_norm": 0.6329046664037892,
      "learning_rate": 3.673271169850201e-05,
      "loss": 1.2437,
      "num_input_tokens_seen": 30710626240,
      "step": 39034
    },
    {
      "epoch": 4.141205177169531,
      "grad_norm": 0.5642653424465459,
      "learning_rate": 3.673209801266797e-05,
      "loss": 1.3462,
      "num_input_tokens_seen": 30711412992,
      "step": 39035
    },
    {
      "epoch": 4.141311266709103,
      "grad_norm": 0.47293961029749804,
      "learning_rate": 3.6731484317767705e-05,
      "loss": 1.27,
      "num_input_tokens_seen": 30712199792,
      "step": 39036
    },
    {
      "epoch": 4.141417356248674,
      "grad_norm": 0.6207790331320989,
      "learning_rate": 3.6730870613801696e-05,
      "loss": 1.3752,
      "num_input_tokens_seen": 30712986560,
      "step": 39037
    },
    {
      "epoch": 4.141523445788245,
      "grad_norm": 0.5039033377595408,
      "learning_rate": 3.6730256900770414e-05,
      "loss": 1.27,
      "num_input_tokens_seen": 30713773312,
      "step": 39038
    },
    {
      "epoch": 4.141629535327817,
      "grad_norm": 0.8216971635996803,
      "learning_rate": 3.6729643178674335e-05,
      "loss": 1.3996,
      "num_input_tokens_seen": 30714560080,
      "step": 39039
    },
    {
      "epoch": 4.141735624867388,
      "grad_norm": 0.7191163055039287,
      "learning_rate": 3.672902944751393e-05,
      "loss": 1.2989,
      "num_input_tokens_seen": 30715346784,
      "step": 39040
    },
    {
      "epoch": 4.14184171440696,
      "grad_norm": 0.7926581474054147,
      "learning_rate": 3.6728415707289675e-05,
      "loss": 1.2249,
      "num_input_tokens_seen": 30716133536,
      "step": 39041
    },
    {
      "epoch": 4.141947803946531,
      "grad_norm": 0.7587118294627061,
      "learning_rate": 3.6727801958002036e-05,
      "loss": 1.287,
      "num_input_tokens_seen": 30716920288,
      "step": 39042
    },
    {
      "epoch": 4.142053893486103,
      "grad_norm": 0.5210440741700295,
      "learning_rate": 3.672718819965151e-05,
      "loss": 1.2401,
      "num_input_tokens_seen": 30717707088,
      "step": 39043
    },
    {
      "epoch": 4.142159983025674,
      "grad_norm": 0.640716411540105,
      "learning_rate": 3.6726574432238545e-05,
      "loss": 1.3599,
      "num_input_tokens_seen": 30718493872,
      "step": 39044
    },
    {
      "epoch": 4.142266072565245,
      "grad_norm": 0.46402157724472953,
      "learning_rate": 3.672596065576364e-05,
      "loss": 1.2607,
      "num_input_tokens_seen": 30719280688,
      "step": 39045
    },
    {
      "epoch": 4.142372162104817,
      "grad_norm": 0.5014435604543751,
      "learning_rate": 3.672534687022725e-05,
      "loss": 1.2964,
      "num_input_tokens_seen": 30720067424,
      "step": 39046
    },
    {
      "epoch": 4.142478251644388,
      "grad_norm": 0.49581672223836304,
      "learning_rate": 3.672473307562986e-05,
      "loss": 1.3425,
      "num_input_tokens_seen": 30720854144,
      "step": 39047
    },
    {
      "epoch": 4.14258434118396,
      "grad_norm": 0.4969635997798829,
      "learning_rate": 3.6724119271971934e-05,
      "loss": 1.2541,
      "num_input_tokens_seen": 30721640992,
      "step": 39048
    },
    {
      "epoch": 4.142690430723531,
      "grad_norm": 0.6248158708507685,
      "learning_rate": 3.6723505459253954e-05,
      "loss": 1.3429,
      "num_input_tokens_seen": 30722427776,
      "step": 39049
    },
    {
      "epoch": 4.142796520263102,
      "grad_norm": 0.5000250936972889,
      "learning_rate": 3.672289163747639e-05,
      "loss": 1.438,
      "num_input_tokens_seen": 30723214448,
      "step": 39050
    },
    {
      "epoch": 4.1429026098026736,
      "grad_norm": 0.5366452929864531,
      "learning_rate": 3.6722277806639724e-05,
      "loss": 1.291,
      "num_input_tokens_seen": 30724001120,
      "step": 39051
    },
    {
      "epoch": 4.143008699342245,
      "grad_norm": 0.7024675953760824,
      "learning_rate": 3.672166396674443e-05,
      "loss": 1.3769,
      "num_input_tokens_seen": 30724787792,
      "step": 39052
    },
    {
      "epoch": 4.1431147888818165,
      "grad_norm": 0.5753649512309594,
      "learning_rate": 3.672105011779097e-05,
      "loss": 1.3122,
      "num_input_tokens_seen": 30725574592,
      "step": 39053
    },
    {
      "epoch": 4.1432208784213875,
      "grad_norm": 0.5949749551052037,
      "learning_rate": 3.6720436259779835e-05,
      "loss": 1.336,
      "num_input_tokens_seen": 30726361248,
      "step": 39054
    },
    {
      "epoch": 4.1433269679609595,
      "grad_norm": 0.5230548385979303,
      "learning_rate": 3.6719822392711485e-05,
      "loss": 1.3043,
      "num_input_tokens_seen": 30727147904,
      "step": 39055
    },
    {
      "epoch": 4.1434330575005305,
      "grad_norm": 0.448001024074237,
      "learning_rate": 3.6719208516586395e-05,
      "loss": 1.2444,
      "num_input_tokens_seen": 30727934720,
      "step": 39056
    },
    {
      "epoch": 4.1435391470401015,
      "grad_norm": 0.551921420498231,
      "learning_rate": 3.671859463140505e-05,
      "loss": 1.3229,
      "num_input_tokens_seen": 30728721440,
      "step": 39057
    },
    {
      "epoch": 4.143645236579673,
      "grad_norm": 0.543173313307389,
      "learning_rate": 3.6717980737167924e-05,
      "loss": 1.3611,
      "num_input_tokens_seen": 30729508272,
      "step": 39058
    },
    {
      "epoch": 4.1437513261192445,
      "grad_norm": 0.49204146396160614,
      "learning_rate": 3.671736683387548e-05,
      "loss": 1.264,
      "num_input_tokens_seen": 30730295136,
      "step": 39059
    },
    {
      "epoch": 4.143857415658816,
      "grad_norm": 0.6703997424122285,
      "learning_rate": 3.6716752921528197e-05,
      "loss": 1.3888,
      "num_input_tokens_seen": 30731081824,
      "step": 39060
    },
    {
      "epoch": 4.143963505198387,
      "grad_norm": 0.5899123313517749,
      "learning_rate": 3.671613900012655e-05,
      "loss": 1.2977,
      "num_input_tokens_seen": 30731868528,
      "step": 39061
    },
    {
      "epoch": 4.144069594737958,
      "grad_norm": 0.6071637027467258,
      "learning_rate": 3.671552506967102e-05,
      "loss": 1.2195,
      "num_input_tokens_seen": 30732655376,
      "step": 39062
    },
    {
      "epoch": 4.14417568427753,
      "grad_norm": 0.6932705709718945,
      "learning_rate": 3.6714911130162076e-05,
      "loss": 1.2549,
      "num_input_tokens_seen": 30733442208,
      "step": 39063
    },
    {
      "epoch": 4.144281773817101,
      "grad_norm": 0.49406320335038484,
      "learning_rate": 3.6714297181600185e-05,
      "loss": 1.3804,
      "num_input_tokens_seen": 30734228992,
      "step": 39064
    },
    {
      "epoch": 4.144387863356673,
      "grad_norm": 0.7060076578092729,
      "learning_rate": 3.671368322398584e-05,
      "loss": 1.2976,
      "num_input_tokens_seen": 30735015792,
      "step": 39065
    },
    {
      "epoch": 4.144493952896244,
      "grad_norm": 0.5396793263987477,
      "learning_rate": 3.67130692573195e-05,
      "loss": 1.4321,
      "num_input_tokens_seen": 30735802480,
      "step": 39066
    },
    {
      "epoch": 4.144600042435816,
      "grad_norm": 0.5580925197406252,
      "learning_rate": 3.671245528160164e-05,
      "loss": 1.3072,
      "num_input_tokens_seen": 30736589344,
      "step": 39067
    },
    {
      "epoch": 4.144706131975387,
      "grad_norm": 0.6696461492116694,
      "learning_rate": 3.6711841296832744e-05,
      "loss": 1.3803,
      "num_input_tokens_seen": 30737376048,
      "step": 39068
    },
    {
      "epoch": 4.144812221514958,
      "grad_norm": 0.5230113656549719,
      "learning_rate": 3.6711227303013286e-05,
      "loss": 1.2926,
      "num_input_tokens_seen": 30738162864,
      "step": 39069
    },
    {
      "epoch": 4.14491831105453,
      "grad_norm": 0.5872156590656913,
      "learning_rate": 3.671061330014372e-05,
      "loss": 1.3823,
      "num_input_tokens_seen": 30738949600,
      "step": 39070
    },
    {
      "epoch": 4.145024400594101,
      "grad_norm": 0.47676112125510994,
      "learning_rate": 3.6709999288224546e-05,
      "loss": 1.3186,
      "num_input_tokens_seen": 30739736352,
      "step": 39071
    },
    {
      "epoch": 4.145130490133673,
      "grad_norm": 0.7393028076513325,
      "learning_rate": 3.6709385267256225e-05,
      "loss": 1.229,
      "num_input_tokens_seen": 30740523056,
      "step": 39072
    },
    {
      "epoch": 4.145236579673244,
      "grad_norm": 0.5068287346919248,
      "learning_rate": 3.670877123723923e-05,
      "loss": 1.2816,
      "num_input_tokens_seen": 30741309776,
      "step": 39073
    },
    {
      "epoch": 4.145342669212815,
      "grad_norm": 0.5554957848326851,
      "learning_rate": 3.670815719817405e-05,
      "loss": 1.2962,
      "num_input_tokens_seen": 30742096528,
      "step": 39074
    },
    {
      "epoch": 4.145448758752387,
      "grad_norm": 0.7511119442887273,
      "learning_rate": 3.670754315006114e-05,
      "loss": 1.2243,
      "num_input_tokens_seen": 30742883280,
      "step": 39075
    },
    {
      "epoch": 4.145554848291958,
      "grad_norm": 0.6579148260476868,
      "learning_rate": 3.6706929092900987e-05,
      "loss": 1.3601,
      "num_input_tokens_seen": 30743670064,
      "step": 39076
    },
    {
      "epoch": 4.14566093783153,
      "grad_norm": 0.5929243714058511,
      "learning_rate": 3.6706315026694066e-05,
      "loss": 1.1533,
      "num_input_tokens_seen": 30744456848,
      "step": 39077
    },
    {
      "epoch": 4.145767027371101,
      "grad_norm": 0.651707534482934,
      "learning_rate": 3.670570095144084e-05,
      "loss": 1.336,
      "num_input_tokens_seen": 30745243712,
      "step": 39078
    },
    {
      "epoch": 4.145873116910673,
      "grad_norm": 0.4769910295472506,
      "learning_rate": 3.6705086867141805e-05,
      "loss": 1.2754,
      "num_input_tokens_seen": 30746030528,
      "step": 39079
    },
    {
      "epoch": 4.145979206450244,
      "grad_norm": 0.47922238262887334,
      "learning_rate": 3.670447277379741e-05,
      "loss": 1.1613,
      "num_input_tokens_seen": 30746817440,
      "step": 39080
    },
    {
      "epoch": 4.146085295989815,
      "grad_norm": 0.832934356989033,
      "learning_rate": 3.670385867140815e-05,
      "loss": 1.4037,
      "num_input_tokens_seen": 30747604112,
      "step": 39081
    },
    {
      "epoch": 4.146191385529387,
      "grad_norm": 0.5241809680153958,
      "learning_rate": 3.670324455997448e-05,
      "loss": 1.3968,
      "num_input_tokens_seen": 30748390848,
      "step": 39082
    },
    {
      "epoch": 4.146297475068958,
      "grad_norm": 0.879230062557122,
      "learning_rate": 3.67026304394969e-05,
      "loss": 1.2554,
      "num_input_tokens_seen": 30749177648,
      "step": 39083
    },
    {
      "epoch": 4.14640356460853,
      "grad_norm": 0.5791830138593238,
      "learning_rate": 3.670201630997587e-05,
      "loss": 1.3633,
      "num_input_tokens_seen": 30749964336,
      "step": 39084
    },
    {
      "epoch": 4.146509654148101,
      "grad_norm": 0.48076242969844274,
      "learning_rate": 3.670140217141186e-05,
      "loss": 1.2944,
      "num_input_tokens_seen": 30750751120,
      "step": 39085
    },
    {
      "epoch": 4.146615743687672,
      "grad_norm": 0.9311433035043034,
      "learning_rate": 3.6700788023805346e-05,
      "loss": 1.2365,
      "num_input_tokens_seen": 30751537888,
      "step": 39086
    },
    {
      "epoch": 4.146721833227244,
      "grad_norm": 0.6329259296776802,
      "learning_rate": 3.670017386715681e-05,
      "loss": 1.3785,
      "num_input_tokens_seen": 30752324720,
      "step": 39087
    },
    {
      "epoch": 4.146827922766815,
      "grad_norm": 0.6946324583359383,
      "learning_rate": 3.669955970146672e-05,
      "loss": 1.1804,
      "num_input_tokens_seen": 30753111488,
      "step": 39088
    },
    {
      "epoch": 4.146934012306387,
      "grad_norm": 0.9463460270633806,
      "learning_rate": 3.669894552673556e-05,
      "loss": 1.1866,
      "num_input_tokens_seen": 30753898240,
      "step": 39089
    },
    {
      "epoch": 4.147040101845958,
      "grad_norm": 0.48131643777945365,
      "learning_rate": 3.6698331342963795e-05,
      "loss": 1.2609,
      "num_input_tokens_seen": 30754684928,
      "step": 39090
    },
    {
      "epoch": 4.147146191385529,
      "grad_norm": 0.8792168069611148,
      "learning_rate": 3.6697717150151903e-05,
      "loss": 1.3296,
      "num_input_tokens_seen": 30755471648,
      "step": 39091
    },
    {
      "epoch": 4.147252280925101,
      "grad_norm": 0.75757091075941,
      "learning_rate": 3.669710294830036e-05,
      "loss": 1.2598,
      "num_input_tokens_seen": 30756258368,
      "step": 39092
    },
    {
      "epoch": 4.147358370464672,
      "grad_norm": 0.6135850165057685,
      "learning_rate": 3.6696488737409636e-05,
      "loss": 1.3566,
      "num_input_tokens_seen": 30757045136,
      "step": 39093
    },
    {
      "epoch": 4.147464460004244,
      "grad_norm": 0.6200737477743263,
      "learning_rate": 3.669587451748021e-05,
      "loss": 1.3457,
      "num_input_tokens_seen": 30757831904,
      "step": 39094
    },
    {
      "epoch": 4.147570549543815,
      "grad_norm": 0.8446069704238335,
      "learning_rate": 3.669526028851256e-05,
      "loss": 1.2897,
      "num_input_tokens_seen": 30758618688,
      "step": 39095
    },
    {
      "epoch": 4.147676639083387,
      "grad_norm": 0.7569746080777332,
      "learning_rate": 3.669464605050715e-05,
      "loss": 1.3698,
      "num_input_tokens_seen": 30759405568,
      "step": 39096
    },
    {
      "epoch": 4.147782728622958,
      "grad_norm": 0.6538026924749666,
      "learning_rate": 3.6694031803464455e-05,
      "loss": 1.3746,
      "num_input_tokens_seen": 30760192224,
      "step": 39097
    },
    {
      "epoch": 4.147888818162529,
      "grad_norm": 0.8683947313264138,
      "learning_rate": 3.669341754738497e-05,
      "loss": 1.3312,
      "num_input_tokens_seen": 30760978992,
      "step": 39098
    },
    {
      "epoch": 4.147994907702101,
      "grad_norm": 0.5476310784832875,
      "learning_rate": 3.6692803282269146e-05,
      "loss": 1.3465,
      "num_input_tokens_seen": 30761765680,
      "step": 39099
    },
    {
      "epoch": 4.148100997241672,
      "grad_norm": 0.7390829634727517,
      "learning_rate": 3.6692189008117466e-05,
      "loss": 1.3308,
      "num_input_tokens_seen": 30762552416,
      "step": 39100
    },
    {
      "epoch": 4.148207086781244,
      "grad_norm": 0.5411424784320282,
      "learning_rate": 3.669157472493041e-05,
      "loss": 1.2606,
      "num_input_tokens_seen": 30763339104,
      "step": 39101
    },
    {
      "epoch": 4.148313176320815,
      "grad_norm": 0.6750544812494033,
      "learning_rate": 3.6690960432708443e-05,
      "loss": 1.4007,
      "num_input_tokens_seen": 30764125824,
      "step": 39102
    },
    {
      "epoch": 4.148419265860386,
      "grad_norm": 0.6333641630830424,
      "learning_rate": 3.669034613145205e-05,
      "loss": 1.303,
      "num_input_tokens_seen": 30764912560,
      "step": 39103
    },
    {
      "epoch": 4.148525355399958,
      "grad_norm": 0.7485736329980656,
      "learning_rate": 3.6689731821161695e-05,
      "loss": 1.269,
      "num_input_tokens_seen": 30765699328,
      "step": 39104
    },
    {
      "epoch": 4.148631444939529,
      "grad_norm": 0.5856682603424177,
      "learning_rate": 3.6689117501837864e-05,
      "loss": 1.2823,
      "num_input_tokens_seen": 30766486048,
      "step": 39105
    },
    {
      "epoch": 4.148737534479101,
      "grad_norm": 0.9934734408953906,
      "learning_rate": 3.668850317348103e-05,
      "loss": 1.3594,
      "num_input_tokens_seen": 30767272784,
      "step": 39106
    },
    {
      "epoch": 4.148843624018672,
      "grad_norm": 0.6279690794061381,
      "learning_rate": 3.6687888836091645e-05,
      "loss": 1.4313,
      "num_input_tokens_seen": 30768059520,
      "step": 39107
    },
    {
      "epoch": 4.148949713558244,
      "grad_norm": 0.8591570492879513,
      "learning_rate": 3.668727448967022e-05,
      "loss": 1.2108,
      "num_input_tokens_seen": 30768846304,
      "step": 39108
    },
    {
      "epoch": 4.149055803097815,
      "grad_norm": 0.6657118681622901,
      "learning_rate": 3.668666013421721e-05,
      "loss": 1.29,
      "num_input_tokens_seen": 30769633104,
      "step": 39109
    },
    {
      "epoch": 4.149161892637386,
      "grad_norm": 0.5915820303615063,
      "learning_rate": 3.668604576973308e-05,
      "loss": 1.2601,
      "num_input_tokens_seen": 30770419904,
      "step": 39110
    },
    {
      "epoch": 4.149267982176958,
      "grad_norm": 0.6843761090707853,
      "learning_rate": 3.668543139621833e-05,
      "loss": 1.3129,
      "num_input_tokens_seen": 30771206720,
      "step": 39111
    },
    {
      "epoch": 4.149374071716529,
      "grad_norm": 0.934573183389763,
      "learning_rate": 3.6684817013673414e-05,
      "loss": 1.3151,
      "num_input_tokens_seen": 30771993472,
      "step": 39112
    },
    {
      "epoch": 4.1494801612561005,
      "grad_norm": 0.8650687300115999,
      "learning_rate": 3.668420262209882e-05,
      "loss": 1.285,
      "num_input_tokens_seen": 30772780272,
      "step": 39113
    },
    {
      "epoch": 4.149586250795672,
      "grad_norm": 0.6599119372119535,
      "learning_rate": 3.668358822149501e-05,
      "loss": 1.3285,
      "num_input_tokens_seen": 30773566992,
      "step": 39114
    },
    {
      "epoch": 4.149692340335243,
      "grad_norm": 0.5526287022756721,
      "learning_rate": 3.668297381186247e-05,
      "loss": 1.2564,
      "num_input_tokens_seen": 30774353744,
      "step": 39115
    },
    {
      "epoch": 4.1497984298748145,
      "grad_norm": 0.7979788928722396,
      "learning_rate": 3.6682359393201674e-05,
      "loss": 1.307,
      "num_input_tokens_seen": 30775140432,
      "step": 39116
    },
    {
      "epoch": 4.1499045194143855,
      "grad_norm": 0.5378906436219437,
      "learning_rate": 3.668174496551309e-05,
      "loss": 1.2097,
      "num_input_tokens_seen": 30775927200,
      "step": 39117
    },
    {
      "epoch": 4.1500106089539575,
      "grad_norm": 0.5551764315979542,
      "learning_rate": 3.66811305287972e-05,
      "loss": 1.2628,
      "num_input_tokens_seen": 30776713968,
      "step": 39118
    },
    {
      "epoch": 4.1501166984935285,
      "grad_norm": 0.6108507145179547,
      "learning_rate": 3.6680516083054466e-05,
      "loss": 1.4568,
      "num_input_tokens_seen": 30777500688,
      "step": 39119
    },
    {
      "epoch": 4.1502227880330995,
      "grad_norm": 0.5052149021950912,
      "learning_rate": 3.667990162828538e-05,
      "loss": 1.3693,
      "num_input_tokens_seen": 30778287536,
      "step": 39120
    },
    {
      "epoch": 4.150328877572671,
      "grad_norm": 0.5974985817140953,
      "learning_rate": 3.66792871644904e-05,
      "loss": 1.2625,
      "num_input_tokens_seen": 30779074336,
      "step": 39121
    },
    {
      "epoch": 4.1504349671122425,
      "grad_norm": 0.5464850342295609,
      "learning_rate": 3.667867269167002e-05,
      "loss": 1.3286,
      "num_input_tokens_seen": 30779861072,
      "step": 39122
    },
    {
      "epoch": 4.150541056651814,
      "grad_norm": 0.6282225254801891,
      "learning_rate": 3.66780582098247e-05,
      "loss": 1.3826,
      "num_input_tokens_seen": 30780647792,
      "step": 39123
    },
    {
      "epoch": 4.150647146191385,
      "grad_norm": 0.5456058723950697,
      "learning_rate": 3.667744371895492e-05,
      "loss": 1.3117,
      "num_input_tokens_seen": 30781434464,
      "step": 39124
    },
    {
      "epoch": 4.150753235730957,
      "grad_norm": 0.5302541795375877,
      "learning_rate": 3.667682921906115e-05,
      "loss": 1.3924,
      "num_input_tokens_seen": 30782221232,
      "step": 39125
    },
    {
      "epoch": 4.150859325270528,
      "grad_norm": 0.6382534385130172,
      "learning_rate": 3.6676214710143876e-05,
      "loss": 1.4971,
      "num_input_tokens_seen": 30783008032,
      "step": 39126
    },
    {
      "epoch": 4.150965414810099,
      "grad_norm": 0.5708766421556184,
      "learning_rate": 3.667560019220356e-05,
      "loss": 1.2693,
      "num_input_tokens_seen": 30783794784,
      "step": 39127
    },
    {
      "epoch": 4.151071504349671,
      "grad_norm": 0.522502133738816,
      "learning_rate": 3.667498566524068e-05,
      "loss": 1.2964,
      "num_input_tokens_seen": 30784581584,
      "step": 39128
    },
    {
      "epoch": 4.151177593889242,
      "grad_norm": 0.805927505087978,
      "learning_rate": 3.6674371129255727e-05,
      "loss": 1.3044,
      "num_input_tokens_seen": 30785368352,
      "step": 39129
    },
    {
      "epoch": 4.151283683428814,
      "grad_norm": 0.5935526873652467,
      "learning_rate": 3.667375658424915e-05,
      "loss": 1.3313,
      "num_input_tokens_seen": 30786155104,
      "step": 39130
    },
    {
      "epoch": 4.151389772968385,
      "grad_norm": 0.7837350019731396,
      "learning_rate": 3.667314203022144e-05,
      "loss": 1.3408,
      "num_input_tokens_seen": 30786941952,
      "step": 39131
    },
    {
      "epoch": 4.151495862507956,
      "grad_norm": 0.5320242065496978,
      "learning_rate": 3.6672527467173066e-05,
      "loss": 1.2836,
      "num_input_tokens_seen": 30787728672,
      "step": 39132
    },
    {
      "epoch": 4.151601952047528,
      "grad_norm": 0.7302281473739463,
      "learning_rate": 3.667191289510451e-05,
      "loss": 1.289,
      "num_input_tokens_seen": 30788515360,
      "step": 39133
    },
    {
      "epoch": 4.151708041587099,
      "grad_norm": 0.5530331110352537,
      "learning_rate": 3.667129831401624e-05,
      "loss": 1.3787,
      "num_input_tokens_seen": 30789302176,
      "step": 39134
    },
    {
      "epoch": 4.151814131126671,
      "grad_norm": 0.7127558083194488,
      "learning_rate": 3.6670683723908734e-05,
      "loss": 1.3497,
      "num_input_tokens_seen": 30790088912,
      "step": 39135
    },
    {
      "epoch": 4.151920220666242,
      "grad_norm": 0.4885827836905706,
      "learning_rate": 3.667006912478246e-05,
      "loss": 1.3327,
      "num_input_tokens_seen": 30790875664,
      "step": 39136
    },
    {
      "epoch": 4.152026310205814,
      "grad_norm": 0.5976856566056995,
      "learning_rate": 3.6669454516637906e-05,
      "loss": 1.2612,
      "num_input_tokens_seen": 30791662368,
      "step": 39137
    },
    {
      "epoch": 4.152132399745385,
      "grad_norm": 0.471224355956001,
      "learning_rate": 3.6668839899475546e-05,
      "loss": 1.1912,
      "num_input_tokens_seen": 30792449120,
      "step": 39138
    },
    {
      "epoch": 4.152238489284956,
      "grad_norm": 0.6837040635619519,
      "learning_rate": 3.6668225273295835e-05,
      "loss": 1.3253,
      "num_input_tokens_seen": 30793235888,
      "step": 39139
    },
    {
      "epoch": 4.152344578824528,
      "grad_norm": 0.5634115461294177,
      "learning_rate": 3.666761063809927e-05,
      "loss": 1.3615,
      "num_input_tokens_seen": 30794022608,
      "step": 39140
    },
    {
      "epoch": 4.152450668364099,
      "grad_norm": 0.5899811144033507,
      "learning_rate": 3.666699599388632e-05,
      "loss": 1.3143,
      "num_input_tokens_seen": 30794809328,
      "step": 39141
    },
    {
      "epoch": 4.152556757903671,
      "grad_norm": 0.5076438506861952,
      "learning_rate": 3.6666381340657454e-05,
      "loss": 1.1727,
      "num_input_tokens_seen": 30795596064,
      "step": 39142
    },
    {
      "epoch": 4.152662847443242,
      "grad_norm": 0.4908355063061866,
      "learning_rate": 3.666576667841315e-05,
      "loss": 1.3208,
      "num_input_tokens_seen": 30796382816,
      "step": 39143
    },
    {
      "epoch": 4.152768936982813,
      "grad_norm": 0.5613918588402045,
      "learning_rate": 3.666515200715388e-05,
      "loss": 1.2581,
      "num_input_tokens_seen": 30797169600,
      "step": 39144
    },
    {
      "epoch": 4.152875026522385,
      "grad_norm": 0.7732897911179994,
      "learning_rate": 3.666453732688013e-05,
      "loss": 1.4112,
      "num_input_tokens_seen": 30797956336,
      "step": 39145
    },
    {
      "epoch": 4.152981116061956,
      "grad_norm": 0.6046965224676326,
      "learning_rate": 3.666392263759236e-05,
      "loss": 1.2866,
      "num_input_tokens_seen": 30798743056,
      "step": 39146
    },
    {
      "epoch": 4.153087205601528,
      "grad_norm": 0.9252110198635284,
      "learning_rate": 3.6663307939291055e-05,
      "loss": 1.326,
      "num_input_tokens_seen": 30799529808,
      "step": 39147
    },
    {
      "epoch": 4.153193295141099,
      "grad_norm": 0.4860122856063193,
      "learning_rate": 3.6662693231976694e-05,
      "loss": 1.2432,
      "num_input_tokens_seen": 30800316576,
      "step": 39148
    },
    {
      "epoch": 4.15329938468067,
      "grad_norm": 0.6144956616176037,
      "learning_rate": 3.666207851564975e-05,
      "loss": 1.1985,
      "num_input_tokens_seen": 30801103376,
      "step": 39149
    },
    {
      "epoch": 4.153405474220242,
      "grad_norm": 0.6175011940114602,
      "learning_rate": 3.666146379031068e-05,
      "loss": 1.3542,
      "num_input_tokens_seen": 30801890160,
      "step": 39150
    },
    {
      "epoch": 4.153511563759813,
      "grad_norm": 0.579969642648678,
      "learning_rate": 3.6660849055959984e-05,
      "loss": 1.277,
      "num_input_tokens_seen": 30802676944,
      "step": 39151
    },
    {
      "epoch": 4.153617653299385,
      "grad_norm": 0.5792847856586321,
      "learning_rate": 3.6660234312598124e-05,
      "loss": 1.2152,
      "num_input_tokens_seen": 30803463712,
      "step": 39152
    },
    {
      "epoch": 4.153723742838956,
      "grad_norm": 0.8949957610853789,
      "learning_rate": 3.6659619560225574e-05,
      "loss": 1.2939,
      "num_input_tokens_seen": 30804250528,
      "step": 39153
    },
    {
      "epoch": 4.153829832378528,
      "grad_norm": 0.5985398624620655,
      "learning_rate": 3.665900479884281e-05,
      "loss": 1.2071,
      "num_input_tokens_seen": 30805037280,
      "step": 39154
    },
    {
      "epoch": 4.153935921918099,
      "grad_norm": 0.7235204441727672,
      "learning_rate": 3.665839002845032e-05,
      "loss": 1.3158,
      "num_input_tokens_seen": 30805823952,
      "step": 39155
    },
    {
      "epoch": 4.15404201145767,
      "grad_norm": 0.7125171941988693,
      "learning_rate": 3.6657775249048556e-05,
      "loss": 1.3104,
      "num_input_tokens_seen": 30806610704,
      "step": 39156
    },
    {
      "epoch": 4.154148100997242,
      "grad_norm": 0.5372567481557118,
      "learning_rate": 3.665716046063801e-05,
      "loss": 1.3721,
      "num_input_tokens_seen": 30807397376,
      "step": 39157
    },
    {
      "epoch": 4.154254190536813,
      "grad_norm": 0.6834523731208968,
      "learning_rate": 3.665654566321915e-05,
      "loss": 1.2868,
      "num_input_tokens_seen": 30808184096,
      "step": 39158
    },
    {
      "epoch": 4.154360280076385,
      "grad_norm": 0.7392395534205621,
      "learning_rate": 3.665593085679245e-05,
      "loss": 1.2418,
      "num_input_tokens_seen": 30808970896,
      "step": 39159
    },
    {
      "epoch": 4.154466369615956,
      "grad_norm": 0.5255783103220155,
      "learning_rate": 3.66553160413584e-05,
      "loss": 1.2445,
      "num_input_tokens_seen": 30809757648,
      "step": 39160
    },
    {
      "epoch": 4.154572459155527,
      "grad_norm": 0.8310795980667611,
      "learning_rate": 3.6654701216917456e-05,
      "loss": 1.3115,
      "num_input_tokens_seen": 30810544368,
      "step": 39161
    },
    {
      "epoch": 4.154678548695099,
      "grad_norm": 0.5076173549695271,
      "learning_rate": 3.6654086383470105e-05,
      "loss": 1.409,
      "num_input_tokens_seen": 30811331184,
      "step": 39162
    },
    {
      "epoch": 4.15478463823467,
      "grad_norm": 0.5363948049983323,
      "learning_rate": 3.6653471541016814e-05,
      "loss": 1.4076,
      "num_input_tokens_seen": 30812117936,
      "step": 39163
    },
    {
      "epoch": 4.154890727774242,
      "grad_norm": 0.7520954740297682,
      "learning_rate": 3.6652856689558066e-05,
      "loss": 1.2661,
      "num_input_tokens_seen": 30812904656,
      "step": 39164
    },
    {
      "epoch": 4.154996817313813,
      "grad_norm": 0.639744673068227,
      "learning_rate": 3.665224182909433e-05,
      "loss": 1.3374,
      "num_input_tokens_seen": 30813691408,
      "step": 39165
    },
    {
      "epoch": 4.155102906853385,
      "grad_norm": 0.6413900446856688,
      "learning_rate": 3.665162695962609e-05,
      "loss": 1.1959,
      "num_input_tokens_seen": 30814478240,
      "step": 39166
    },
    {
      "epoch": 4.155208996392956,
      "grad_norm": 1.0420364533888051,
      "learning_rate": 3.66510120811538e-05,
      "loss": 1.4491,
      "num_input_tokens_seen": 30815265024,
      "step": 39167
    },
    {
      "epoch": 4.155315085932527,
      "grad_norm": 0.5024542207004209,
      "learning_rate": 3.6650397193677955e-05,
      "loss": 1.3705,
      "num_input_tokens_seen": 30816051792,
      "step": 39168
    },
    {
      "epoch": 4.155421175472099,
      "grad_norm": 0.5737026787119185,
      "learning_rate": 3.664978229719903e-05,
      "loss": 1.3607,
      "num_input_tokens_seen": 30816838560,
      "step": 39169
    },
    {
      "epoch": 4.15552726501167,
      "grad_norm": 0.9349882839731791,
      "learning_rate": 3.664916739171749e-05,
      "loss": 1.3692,
      "num_input_tokens_seen": 30817625296,
      "step": 39170
    },
    {
      "epoch": 4.155633354551242,
      "grad_norm": 0.5415405778219085,
      "learning_rate": 3.664855247723382e-05,
      "loss": 1.3345,
      "num_input_tokens_seen": 30818412096,
      "step": 39171
    },
    {
      "epoch": 4.155739444090813,
      "grad_norm": 0.6547408365567469,
      "learning_rate": 3.664793755374849e-05,
      "loss": 1.2651,
      "num_input_tokens_seen": 30819198784,
      "step": 39172
    },
    {
      "epoch": 4.155845533630384,
      "grad_norm": 0.716753379554533,
      "learning_rate": 3.664732262126197e-05,
      "loss": 1.2442,
      "num_input_tokens_seen": 30819985504,
      "step": 39173
    },
    {
      "epoch": 4.155951623169956,
      "grad_norm": 0.4994832293960033,
      "learning_rate": 3.664670767977475e-05,
      "loss": 1.2351,
      "num_input_tokens_seen": 30820772288,
      "step": 39174
    },
    {
      "epoch": 4.156057712709527,
      "grad_norm": 0.6447162970670036,
      "learning_rate": 3.664609272928728e-05,
      "loss": 1.1691,
      "num_input_tokens_seen": 30821559056,
      "step": 39175
    },
    {
      "epoch": 4.1561638022490985,
      "grad_norm": 0.6178542872402295,
      "learning_rate": 3.664547776980007e-05,
      "loss": 1.3717,
      "num_input_tokens_seen": 30822345744,
      "step": 39176
    },
    {
      "epoch": 4.15626989178867,
      "grad_norm": 0.6716925553673652,
      "learning_rate": 3.6644862801313566e-05,
      "loss": 1.3957,
      "num_input_tokens_seen": 30823132544,
      "step": 39177
    },
    {
      "epoch": 4.156375981328241,
      "grad_norm": 0.5629563730692164,
      "learning_rate": 3.664424782382826e-05,
      "loss": 1.3221,
      "num_input_tokens_seen": 30823919200,
      "step": 39178
    },
    {
      "epoch": 4.1564820708678125,
      "grad_norm": 0.7758686259660613,
      "learning_rate": 3.6643632837344615e-05,
      "loss": 1.3773,
      "num_input_tokens_seen": 30824705888,
      "step": 39179
    },
    {
      "epoch": 4.1565881604073835,
      "grad_norm": 0.5907604049245525,
      "learning_rate": 3.664301784186311e-05,
      "loss": 1.2366,
      "num_input_tokens_seen": 30825492592,
      "step": 39180
    },
    {
      "epoch": 4.1566942499469555,
      "grad_norm": 0.731154131275954,
      "learning_rate": 3.664240283738423e-05,
      "loss": 1.1866,
      "num_input_tokens_seen": 30826279424,
      "step": 39181
    },
    {
      "epoch": 4.1568003394865265,
      "grad_norm": 0.6308927507181822,
      "learning_rate": 3.664178782390844e-05,
      "loss": 1.4637,
      "num_input_tokens_seen": 30827066256,
      "step": 39182
    },
    {
      "epoch": 4.156906429026098,
      "grad_norm": 0.6387461773562871,
      "learning_rate": 3.6641172801436216e-05,
      "loss": 1.2887,
      "num_input_tokens_seen": 30827853024,
      "step": 39183
    },
    {
      "epoch": 4.1570125185656694,
      "grad_norm": 0.7737140077100796,
      "learning_rate": 3.6640557769968045e-05,
      "loss": 1.3047,
      "num_input_tokens_seen": 30828639792,
      "step": 39184
    },
    {
      "epoch": 4.1571186081052405,
      "grad_norm": 0.517003981261698,
      "learning_rate": 3.663994272950438e-05,
      "loss": 1.2121,
      "num_input_tokens_seen": 30829426592,
      "step": 39185
    },
    {
      "epoch": 4.157224697644812,
      "grad_norm": 0.8451944264614702,
      "learning_rate": 3.6639327680045715e-05,
      "loss": 1.3159,
      "num_input_tokens_seen": 30830213424,
      "step": 39186
    },
    {
      "epoch": 4.157330787184383,
      "grad_norm": 0.5992197553476692,
      "learning_rate": 3.663871262159252e-05,
      "loss": 1.2555,
      "num_input_tokens_seen": 30831000064,
      "step": 39187
    },
    {
      "epoch": 4.157436876723955,
      "grad_norm": 0.5504946037775084,
      "learning_rate": 3.663809755414526e-05,
      "loss": 1.3975,
      "num_input_tokens_seen": 30831786800,
      "step": 39188
    },
    {
      "epoch": 4.157542966263526,
      "grad_norm": 0.8146814695444472,
      "learning_rate": 3.663748247770443e-05,
      "loss": 1.3088,
      "num_input_tokens_seen": 30832573504,
      "step": 39189
    },
    {
      "epoch": 4.157649055803097,
      "grad_norm": 0.6336570977748052,
      "learning_rate": 3.663686739227049e-05,
      "loss": 1.3635,
      "num_input_tokens_seen": 30833360240,
      "step": 39190
    },
    {
      "epoch": 4.157755145342669,
      "grad_norm": 0.6909567839667546,
      "learning_rate": 3.663625229784392e-05,
      "loss": 1.2339,
      "num_input_tokens_seen": 30834147008,
      "step": 39191
    },
    {
      "epoch": 4.15786123488224,
      "grad_norm": 0.8125001103640866,
      "learning_rate": 3.66356371944252e-05,
      "loss": 1.2995,
      "num_input_tokens_seen": 30834933760,
      "step": 39192
    },
    {
      "epoch": 4.157967324421812,
      "grad_norm": 0.5649091862076798,
      "learning_rate": 3.6635022082014796e-05,
      "loss": 1.2949,
      "num_input_tokens_seen": 30835720512,
      "step": 39193
    },
    {
      "epoch": 4.158073413961383,
      "grad_norm": 0.6670299759356153,
      "learning_rate": 3.6634406960613194e-05,
      "loss": 1.3271,
      "num_input_tokens_seen": 30836507296,
      "step": 39194
    },
    {
      "epoch": 4.158179503500955,
      "grad_norm": 0.7511179645911711,
      "learning_rate": 3.663379183022086e-05,
      "loss": 1.2967,
      "num_input_tokens_seen": 30837294016,
      "step": 39195
    },
    {
      "epoch": 4.158285593040526,
      "grad_norm": 0.6175091899329505,
      "learning_rate": 3.663317669083827e-05,
      "loss": 1.3239,
      "num_input_tokens_seen": 30838080720,
      "step": 39196
    },
    {
      "epoch": 4.158391682580097,
      "grad_norm": 0.6136789521944781,
      "learning_rate": 3.663256154246591e-05,
      "loss": 1.2512,
      "num_input_tokens_seen": 30838867488,
      "step": 39197
    },
    {
      "epoch": 4.158497772119669,
      "grad_norm": 0.6626999656428032,
      "learning_rate": 3.6631946385104244e-05,
      "loss": 1.4224,
      "num_input_tokens_seen": 30839654224,
      "step": 39198
    },
    {
      "epoch": 4.15860386165924,
      "grad_norm": 0.5669722001465677,
      "learning_rate": 3.663133121875375e-05,
      "loss": 1.3908,
      "num_input_tokens_seen": 30840440928,
      "step": 39199
    },
    {
      "epoch": 4.158709951198812,
      "grad_norm": 0.5981607009751835,
      "learning_rate": 3.66307160434149e-05,
      "loss": 1.2968,
      "num_input_tokens_seen": 30841227680,
      "step": 39200
    },
    {
      "epoch": 4.158816040738383,
      "grad_norm": 0.6797483757532071,
      "learning_rate": 3.6630100859088185e-05,
      "loss": 1.2889,
      "num_input_tokens_seen": 30842014448,
      "step": 39201
    },
    {
      "epoch": 4.158922130277954,
      "grad_norm": 0.5295959117485473,
      "learning_rate": 3.662948566577406e-05,
      "loss": 1.3111,
      "num_input_tokens_seen": 30842801216,
      "step": 39202
    },
    {
      "epoch": 4.159028219817526,
      "grad_norm": 0.5318590931238277,
      "learning_rate": 3.662887046347301e-05,
      "loss": 1.2568,
      "num_input_tokens_seen": 30843588000,
      "step": 39203
    },
    {
      "epoch": 4.159134309357097,
      "grad_norm": 0.4802564020856137,
      "learning_rate": 3.662825525218552e-05,
      "loss": 1.3265,
      "num_input_tokens_seen": 30844374816,
      "step": 39204
    },
    {
      "epoch": 4.159240398896669,
      "grad_norm": 0.5858454900453363,
      "learning_rate": 3.6627640031912045e-05,
      "loss": 1.3643,
      "num_input_tokens_seen": 30845161584,
      "step": 39205
    },
    {
      "epoch": 4.15934648843624,
      "grad_norm": 0.5534866816689612,
      "learning_rate": 3.6627024802653075e-05,
      "loss": 1.3469,
      "num_input_tokens_seen": 30845948432,
      "step": 39206
    },
    {
      "epoch": 4.159452577975811,
      "grad_norm": 0.5701697275990661,
      "learning_rate": 3.662640956440908e-05,
      "loss": 1.3983,
      "num_input_tokens_seen": 30846735136,
      "step": 39207
    },
    {
      "epoch": 4.159558667515383,
      "grad_norm": 0.648118582955569,
      "learning_rate": 3.662579431718054e-05,
      "loss": 1.2679,
      "num_input_tokens_seen": 30847521904,
      "step": 39208
    },
    {
      "epoch": 4.159664757054954,
      "grad_norm": 0.4889219181587223,
      "learning_rate": 3.6625179060967926e-05,
      "loss": 1.2561,
      "num_input_tokens_seen": 30848308608,
      "step": 39209
    },
    {
      "epoch": 4.159770846594526,
      "grad_norm": 0.6479482554834173,
      "learning_rate": 3.662456379577171e-05,
      "loss": 1.3489,
      "num_input_tokens_seen": 30849095456,
      "step": 39210
    },
    {
      "epoch": 4.159876936134097,
      "grad_norm": 0.5984227854950723,
      "learning_rate": 3.662394852159238e-05,
      "loss": 1.4366,
      "num_input_tokens_seen": 30849882208,
      "step": 39211
    },
    {
      "epoch": 4.159983025673669,
      "grad_norm": 0.5759371879654952,
      "learning_rate": 3.66233332384304e-05,
      "loss": 1.4521,
      "num_input_tokens_seen": 30850668944,
      "step": 39212
    },
    {
      "epoch": 4.16008911521324,
      "grad_norm": 0.5801243323878935,
      "learning_rate": 3.6622717946286246e-05,
      "loss": 1.3582,
      "num_input_tokens_seen": 30851455664,
      "step": 39213
    },
    {
      "epoch": 4.160195204752811,
      "grad_norm": 0.5523277495326708,
      "learning_rate": 3.66221026451604e-05,
      "loss": 1.3724,
      "num_input_tokens_seen": 30852242496,
      "step": 39214
    },
    {
      "epoch": 4.160301294292383,
      "grad_norm": 0.5864253266494133,
      "learning_rate": 3.662148733505334e-05,
      "loss": 1.2285,
      "num_input_tokens_seen": 30853029280,
      "step": 39215
    },
    {
      "epoch": 4.160407383831954,
      "grad_norm": 0.49489240445419835,
      "learning_rate": 3.6620872015965525e-05,
      "loss": 1.3319,
      "num_input_tokens_seen": 30853816016,
      "step": 39216
    },
    {
      "epoch": 4.160513473371526,
      "grad_norm": 0.5729134114324537,
      "learning_rate": 3.6620256687897444e-05,
      "loss": 1.2913,
      "num_input_tokens_seen": 30854602832,
      "step": 39217
    },
    {
      "epoch": 4.160619562911097,
      "grad_norm": 0.5858709453835319,
      "learning_rate": 3.6619641350849574e-05,
      "loss": 1.3637,
      "num_input_tokens_seen": 30855389600,
      "step": 39218
    },
    {
      "epoch": 4.160725652450668,
      "grad_norm": 0.5472335690726551,
      "learning_rate": 3.6619026004822376e-05,
      "loss": 1.2717,
      "num_input_tokens_seen": 30856176400,
      "step": 39219
    },
    {
      "epoch": 4.16083174199024,
      "grad_norm": 0.49439507375662123,
      "learning_rate": 3.661841064981635e-05,
      "loss": 1.208,
      "num_input_tokens_seen": 30856963200,
      "step": 39220
    },
    {
      "epoch": 4.160937831529811,
      "grad_norm": 0.5057417572570013,
      "learning_rate": 3.6617795285831946e-05,
      "loss": 1.3245,
      "num_input_tokens_seen": 30857749936,
      "step": 39221
    },
    {
      "epoch": 4.161043921069383,
      "grad_norm": 0.5407288874051739,
      "learning_rate": 3.6617179912869655e-05,
      "loss": 1.205,
      "num_input_tokens_seen": 30858536672,
      "step": 39222
    },
    {
      "epoch": 4.161150010608954,
      "grad_norm": 0.5269743899145972,
      "learning_rate": 3.661656453092994e-05,
      "loss": 1.342,
      "num_input_tokens_seen": 30859323424,
      "step": 39223
    },
    {
      "epoch": 4.161256100148526,
      "grad_norm": 0.5156608949900369,
      "learning_rate": 3.66159491400133e-05,
      "loss": 1.3762,
      "num_input_tokens_seen": 30860110112,
      "step": 39224
    },
    {
      "epoch": 4.161362189688097,
      "grad_norm": 0.5150675161710724,
      "learning_rate": 3.661533374012018e-05,
      "loss": 1.3141,
      "num_input_tokens_seen": 30860896960,
      "step": 39225
    },
    {
      "epoch": 4.161468279227668,
      "grad_norm": 0.5386168628443178,
      "learning_rate": 3.661471833125109e-05,
      "loss": 1.3092,
      "num_input_tokens_seen": 30861683728,
      "step": 39226
    },
    {
      "epoch": 4.16157436876724,
      "grad_norm": 0.5642134012477691,
      "learning_rate": 3.661410291340647e-05,
      "loss": 1.3029,
      "num_input_tokens_seen": 30862470480,
      "step": 39227
    },
    {
      "epoch": 4.161680458306811,
      "grad_norm": 0.7911183322647791,
      "learning_rate": 3.661348748658682e-05,
      "loss": 1.2744,
      "num_input_tokens_seen": 30863257344,
      "step": 39228
    },
    {
      "epoch": 4.161786547846383,
      "grad_norm": 0.49591448770040064,
      "learning_rate": 3.66128720507926e-05,
      "loss": 1.2867,
      "num_input_tokens_seen": 30864044176,
      "step": 39229
    },
    {
      "epoch": 4.161892637385954,
      "grad_norm": 0.7182386645778278,
      "learning_rate": 3.66122566060243e-05,
      "loss": 1.348,
      "num_input_tokens_seen": 30864830832,
      "step": 39230
    },
    {
      "epoch": 4.161998726925525,
      "grad_norm": 0.5548372997754935,
      "learning_rate": 3.661164115228238e-05,
      "loss": 1.3695,
      "num_input_tokens_seen": 30865617680,
      "step": 39231
    },
    {
      "epoch": 4.162104816465097,
      "grad_norm": 0.45144514192564006,
      "learning_rate": 3.6611025689567334e-05,
      "loss": 1.2578,
      "num_input_tokens_seen": 30866404512,
      "step": 39232
    },
    {
      "epoch": 4.162210906004668,
      "grad_norm": 0.6227784188545953,
      "learning_rate": 3.661041021787963e-05,
      "loss": 1.3406,
      "num_input_tokens_seen": 30867191200,
      "step": 39233
    },
    {
      "epoch": 4.16231699554424,
      "grad_norm": 0.5387191631828352,
      "learning_rate": 3.6609794737219733e-05,
      "loss": 1.3071,
      "num_input_tokens_seen": 30867977984,
      "step": 39234
    },
    {
      "epoch": 4.162423085083811,
      "grad_norm": 0.5175215310620014,
      "learning_rate": 3.6609179247588135e-05,
      "loss": 1.2487,
      "num_input_tokens_seen": 30868764752,
      "step": 39235
    },
    {
      "epoch": 4.162529174623382,
      "grad_norm": 0.6019981312723102,
      "learning_rate": 3.66085637489853e-05,
      "loss": 1.376,
      "num_input_tokens_seen": 30869551504,
      "step": 39236
    },
    {
      "epoch": 4.162635264162954,
      "grad_norm": 0.663304326148506,
      "learning_rate": 3.6607948241411705e-05,
      "loss": 1.2509,
      "num_input_tokens_seen": 30870338272,
      "step": 39237
    },
    {
      "epoch": 4.162741353702525,
      "grad_norm": 0.5431658166048088,
      "learning_rate": 3.660733272486783e-05,
      "loss": 1.3091,
      "num_input_tokens_seen": 30871125024,
      "step": 39238
    },
    {
      "epoch": 4.1628474432420965,
      "grad_norm": 0.6758657793579507,
      "learning_rate": 3.6606717199354154e-05,
      "loss": 1.2673,
      "num_input_tokens_seen": 30871911744,
      "step": 39239
    },
    {
      "epoch": 4.162953532781668,
      "grad_norm": 0.7879825176516185,
      "learning_rate": 3.660610166487114e-05,
      "loss": 1.2683,
      "num_input_tokens_seen": 30872698528,
      "step": 39240
    },
    {
      "epoch": 4.1630596223212395,
      "grad_norm": 0.7246737456153888,
      "learning_rate": 3.6605486121419275e-05,
      "loss": 1.1943,
      "num_input_tokens_seen": 30873485296,
      "step": 39241
    },
    {
      "epoch": 4.1631657118608105,
      "grad_norm": 0.6904311670124124,
      "learning_rate": 3.660487056899903e-05,
      "loss": 1.3678,
      "num_input_tokens_seen": 30874272032,
      "step": 39242
    },
    {
      "epoch": 4.1632718014003816,
      "grad_norm": 0.6118014289668403,
      "learning_rate": 3.6604255007610884e-05,
      "loss": 1.4018,
      "num_input_tokens_seen": 30875058816,
      "step": 39243
    },
    {
      "epoch": 4.1633778909399535,
      "grad_norm": 0.5770507270296765,
      "learning_rate": 3.660363943725531e-05,
      "loss": 1.3492,
      "num_input_tokens_seen": 30875845456,
      "step": 39244
    },
    {
      "epoch": 4.1634839804795245,
      "grad_norm": 0.7308133529555205,
      "learning_rate": 3.6603023857932775e-05,
      "loss": 1.3119,
      "num_input_tokens_seen": 30876632144,
      "step": 39245
    },
    {
      "epoch": 4.163590070019096,
      "grad_norm": 0.49698221101629747,
      "learning_rate": 3.660240826964377e-05,
      "loss": 1.2721,
      "num_input_tokens_seen": 30877418960,
      "step": 39246
    },
    {
      "epoch": 4.1636961595586675,
      "grad_norm": 0.5140275156439517,
      "learning_rate": 3.660179267238877e-05,
      "loss": 1.3291,
      "num_input_tokens_seen": 30878205728,
      "step": 39247
    },
    {
      "epoch": 4.1638022490982385,
      "grad_norm": 0.7002629671804529,
      "learning_rate": 3.660117706616824e-05,
      "loss": 1.3998,
      "num_input_tokens_seen": 30878992496,
      "step": 39248
    },
    {
      "epoch": 4.16390833863781,
      "grad_norm": 0.5237244551748635,
      "learning_rate": 3.6600561450982665e-05,
      "loss": 1.2917,
      "num_input_tokens_seen": 30879779328,
      "step": 39249
    },
    {
      "epoch": 4.164014428177381,
      "grad_norm": 0.6032362684108523,
      "learning_rate": 3.6599945826832504e-05,
      "loss": 1.2064,
      "num_input_tokens_seen": 30880566064,
      "step": 39250
    },
    {
      "epoch": 4.164120517716953,
      "grad_norm": 0.48952381928741584,
      "learning_rate": 3.6599330193718254e-05,
      "loss": 1.2785,
      "num_input_tokens_seen": 30881352912,
      "step": 39251
    },
    {
      "epoch": 4.164226607256524,
      "grad_norm": 0.556167848574111,
      "learning_rate": 3.659871455164038e-05,
      "loss": 1.4252,
      "num_input_tokens_seen": 30882139696,
      "step": 39252
    },
    {
      "epoch": 4.164332696796096,
      "grad_norm": 0.46907833671689425,
      "learning_rate": 3.6598098900599364e-05,
      "loss": 1.2481,
      "num_input_tokens_seen": 30882926464,
      "step": 39253
    },
    {
      "epoch": 4.164438786335667,
      "grad_norm": 0.5109318674061443,
      "learning_rate": 3.6597483240595673e-05,
      "loss": 1.3342,
      "num_input_tokens_seen": 30883713216,
      "step": 39254
    },
    {
      "epoch": 4.164544875875238,
      "grad_norm": 0.6692974300943945,
      "learning_rate": 3.65968675716298e-05,
      "loss": 1.4821,
      "num_input_tokens_seen": 30884499904,
      "step": 39255
    },
    {
      "epoch": 4.16465096541481,
      "grad_norm": 0.5175795599151507,
      "learning_rate": 3.6596251893702186e-05,
      "loss": 1.3607,
      "num_input_tokens_seen": 30885286656,
      "step": 39256
    },
    {
      "epoch": 4.164757054954381,
      "grad_norm": 0.5121884326597567,
      "learning_rate": 3.6595636206813344e-05,
      "loss": 1.215,
      "num_input_tokens_seen": 30886073440,
      "step": 39257
    },
    {
      "epoch": 4.164863144493953,
      "grad_norm": 0.4893301208310777,
      "learning_rate": 3.659502051096373e-05,
      "loss": 1.3045,
      "num_input_tokens_seen": 30886860176,
      "step": 39258
    },
    {
      "epoch": 4.164969234033524,
      "grad_norm": 0.48814179089983595,
      "learning_rate": 3.6594404806153823e-05,
      "loss": 1.2844,
      "num_input_tokens_seen": 30887646976,
      "step": 39259
    },
    {
      "epoch": 4.165075323573095,
      "grad_norm": 0.5537879412207174,
      "learning_rate": 3.65937890923841e-05,
      "loss": 1.2868,
      "num_input_tokens_seen": 30888433824,
      "step": 39260
    },
    {
      "epoch": 4.165181413112667,
      "grad_norm": 0.7237760101632268,
      "learning_rate": 3.6593173369655044e-05,
      "loss": 1.2564,
      "num_input_tokens_seen": 30889220576,
      "step": 39261
    },
    {
      "epoch": 4.165287502652238,
      "grad_norm": 0.5382068726235422,
      "learning_rate": 3.659255763796711e-05,
      "loss": 1.3459,
      "num_input_tokens_seen": 30890007328,
      "step": 39262
    },
    {
      "epoch": 4.16539359219181,
      "grad_norm": 0.6732786848828024,
      "learning_rate": 3.65919418973208e-05,
      "loss": 1.3486,
      "num_input_tokens_seen": 30890793984,
      "step": 39263
    },
    {
      "epoch": 4.165499681731381,
      "grad_norm": 0.5728223559097453,
      "learning_rate": 3.659132614771658e-05,
      "loss": 1.427,
      "num_input_tokens_seen": 30891580720,
      "step": 39264
    },
    {
      "epoch": 4.165605771270953,
      "grad_norm": 0.5035263925790511,
      "learning_rate": 3.659071038915491e-05,
      "loss": 1.3592,
      "num_input_tokens_seen": 30892367552,
      "step": 39265
    },
    {
      "epoch": 4.165711860810524,
      "grad_norm": 0.5250928047256062,
      "learning_rate": 3.659009462163629e-05,
      "loss": 1.3471,
      "num_input_tokens_seen": 30893154336,
      "step": 39266
    },
    {
      "epoch": 4.165817950350095,
      "grad_norm": 0.5177655907118999,
      "learning_rate": 3.658947884516117e-05,
      "loss": 1.2451,
      "num_input_tokens_seen": 30893941136,
      "step": 39267
    },
    {
      "epoch": 4.165924039889667,
      "grad_norm": 0.5729594395883041,
      "learning_rate": 3.658886305973006e-05,
      "loss": 1.3574,
      "num_input_tokens_seen": 30894727920,
      "step": 39268
    },
    {
      "epoch": 4.166030129429238,
      "grad_norm": 0.5001468936362787,
      "learning_rate": 3.658824726534341e-05,
      "loss": 1.273,
      "num_input_tokens_seen": 30895514752,
      "step": 39269
    },
    {
      "epoch": 4.16613621896881,
      "grad_norm": 0.5220385135362026,
      "learning_rate": 3.65876314620017e-05,
      "loss": 1.2723,
      "num_input_tokens_seen": 30896301552,
      "step": 39270
    },
    {
      "epoch": 4.166242308508381,
      "grad_norm": 0.48466603556705357,
      "learning_rate": 3.65870156497054e-05,
      "loss": 1.2767,
      "num_input_tokens_seen": 30897088224,
      "step": 39271
    },
    {
      "epoch": 4.166348398047952,
      "grad_norm": 0.6684860563717461,
      "learning_rate": 3.658639982845501e-05,
      "loss": 1.3459,
      "num_input_tokens_seen": 30897875008,
      "step": 39272
    },
    {
      "epoch": 4.166454487587524,
      "grad_norm": 0.5140363854110488,
      "learning_rate": 3.6585783998250986e-05,
      "loss": 1.4171,
      "num_input_tokens_seen": 30898661792,
      "step": 39273
    },
    {
      "epoch": 4.166560577127095,
      "grad_norm": 0.6555279147823851,
      "learning_rate": 3.65851681590938e-05,
      "loss": 1.2898,
      "num_input_tokens_seen": 30899448576,
      "step": 39274
    },
    {
      "epoch": 4.166666666666667,
      "grad_norm": 0.6171242037901492,
      "learning_rate": 3.658455231098394e-05,
      "loss": 1.3557,
      "num_input_tokens_seen": 30900235312,
      "step": 39275
    },
    {
      "epoch": 4.166772756206238,
      "grad_norm": 0.7219130609958558,
      "learning_rate": 3.658393645392188e-05,
      "loss": 1.302,
      "num_input_tokens_seen": 30901022096,
      "step": 39276
    },
    {
      "epoch": 4.16687884574581,
      "grad_norm": 0.6261426785931734,
      "learning_rate": 3.65833205879081e-05,
      "loss": 1.3628,
      "num_input_tokens_seen": 30901808832,
      "step": 39277
    },
    {
      "epoch": 4.166984935285381,
      "grad_norm": 0.5987828922171593,
      "learning_rate": 3.658270471294306e-05,
      "loss": 1.3655,
      "num_input_tokens_seen": 30902595648,
      "step": 39278
    },
    {
      "epoch": 4.167091024824952,
      "grad_norm": 0.6052672983962136,
      "learning_rate": 3.658208882902725e-05,
      "loss": 1.4067,
      "num_input_tokens_seen": 30903382432,
      "step": 39279
    },
    {
      "epoch": 4.167197114364524,
      "grad_norm": 0.568170692212532,
      "learning_rate": 3.658147293616114e-05,
      "loss": 1.3238,
      "num_input_tokens_seen": 30904169136,
      "step": 39280
    },
    {
      "epoch": 4.167303203904095,
      "grad_norm": 0.5066599590284618,
      "learning_rate": 3.6580857034345204e-05,
      "loss": 1.2073,
      "num_input_tokens_seen": 30904955968,
      "step": 39281
    },
    {
      "epoch": 4.167409293443667,
      "grad_norm": 0.5424798939415684,
      "learning_rate": 3.658024112357993e-05,
      "loss": 1.3321,
      "num_input_tokens_seen": 30905742736,
      "step": 39282
    },
    {
      "epoch": 4.167515382983238,
      "grad_norm": 0.7711582418192923,
      "learning_rate": 3.657962520386578e-05,
      "loss": 1.3799,
      "num_input_tokens_seen": 30906529456,
      "step": 39283
    },
    {
      "epoch": 4.167621472522809,
      "grad_norm": 0.49319674257564466,
      "learning_rate": 3.6579009275203235e-05,
      "loss": 1.2276,
      "num_input_tokens_seen": 30907316128,
      "step": 39284
    },
    {
      "epoch": 4.167727562062381,
      "grad_norm": 0.7074496062696463,
      "learning_rate": 3.657839333759278e-05,
      "loss": 1.3238,
      "num_input_tokens_seen": 30908102896,
      "step": 39285
    },
    {
      "epoch": 4.167833651601952,
      "grad_norm": 0.7842205866610936,
      "learning_rate": 3.6577777391034865e-05,
      "loss": 1.3615,
      "num_input_tokens_seen": 30908889664,
      "step": 39286
    },
    {
      "epoch": 4.167939741141524,
      "grad_norm": 0.5592808475722084,
      "learning_rate": 3.657716143553e-05,
      "loss": 1.3571,
      "num_input_tokens_seen": 30909676368,
      "step": 39287
    },
    {
      "epoch": 4.168045830681095,
      "grad_norm": 0.9715358610304973,
      "learning_rate": 3.6576545471078635e-05,
      "loss": 1.2976,
      "num_input_tokens_seen": 30910463088,
      "step": 39288
    },
    {
      "epoch": 4.168151920220666,
      "grad_norm": 0.5692871921757362,
      "learning_rate": 3.657592949768126e-05,
      "loss": 1.4323,
      "num_input_tokens_seen": 30911249872,
      "step": 39289
    },
    {
      "epoch": 4.168258009760238,
      "grad_norm": 0.5598501470521906,
      "learning_rate": 3.6575313515338346e-05,
      "loss": 1.3087,
      "num_input_tokens_seen": 30912036608,
      "step": 39290
    },
    {
      "epoch": 4.168364099299809,
      "grad_norm": 1.1091447073443357,
      "learning_rate": 3.657469752405036e-05,
      "loss": 1.2404,
      "num_input_tokens_seen": 30912823344,
      "step": 39291
    },
    {
      "epoch": 4.168470188839381,
      "grad_norm": 0.49794807611208725,
      "learning_rate": 3.65740815238178e-05,
      "loss": 1.3026,
      "num_input_tokens_seen": 30913610048,
      "step": 39292
    },
    {
      "epoch": 4.168576278378952,
      "grad_norm": 0.5301809278602762,
      "learning_rate": 3.657346551464112e-05,
      "loss": 1.1797,
      "num_input_tokens_seen": 30914396832,
      "step": 39293
    },
    {
      "epoch": 4.168682367918524,
      "grad_norm": 0.9510726381663809,
      "learning_rate": 3.657284949652081e-05,
      "loss": 1.3132,
      "num_input_tokens_seen": 30915183616,
      "step": 39294
    },
    {
      "epoch": 4.168788457458095,
      "grad_norm": 0.43005452688083057,
      "learning_rate": 3.6572233469457344e-05,
      "loss": 1.3021,
      "num_input_tokens_seen": 30915970384,
      "step": 39295
    },
    {
      "epoch": 4.168894546997666,
      "grad_norm": 0.7730518880847735,
      "learning_rate": 3.6571617433451195e-05,
      "loss": 1.3532,
      "num_input_tokens_seen": 30916757200,
      "step": 39296
    },
    {
      "epoch": 4.169000636537238,
      "grad_norm": 0.8307123798189231,
      "learning_rate": 3.657100138850284e-05,
      "loss": 1.4629,
      "num_input_tokens_seen": 30917543984,
      "step": 39297
    },
    {
      "epoch": 4.169106726076809,
      "grad_norm": 1.3446746760682158,
      "learning_rate": 3.657038533461275e-05,
      "loss": 1.2825,
      "num_input_tokens_seen": 30918330688,
      "step": 39298
    },
    {
      "epoch": 4.169212815616381,
      "grad_norm": 1.0617226804488118,
      "learning_rate": 3.656976927178141e-05,
      "loss": 1.306,
      "num_input_tokens_seen": 30919117392,
      "step": 39299
    },
    {
      "epoch": 4.169318905155952,
      "grad_norm": 1.2593386203999606,
      "learning_rate": 3.656915320000929e-05,
      "loss": 1.2938,
      "num_input_tokens_seen": 30919904160,
      "step": 39300
    },
    {
      "epoch": 4.169424994695523,
      "grad_norm": 0.5416838491519941,
      "learning_rate": 3.656853711929686e-05,
      "loss": 1.2473,
      "num_input_tokens_seen": 30920690944,
      "step": 39301
    },
    {
      "epoch": 4.1695310842350946,
      "grad_norm": 1.1854233860177428,
      "learning_rate": 3.656792102964461e-05,
      "loss": 1.3527,
      "num_input_tokens_seen": 30921477712,
      "step": 39302
    },
    {
      "epoch": 4.169637173774666,
      "grad_norm": 0.9383841894445796,
      "learning_rate": 3.6567304931053014e-05,
      "loss": 1.3861,
      "num_input_tokens_seen": 30922264384,
      "step": 39303
    },
    {
      "epoch": 4.1697432633142375,
      "grad_norm": 0.5431724894953807,
      "learning_rate": 3.656668882352255e-05,
      "loss": 1.2584,
      "num_input_tokens_seen": 30923051168,
      "step": 39304
    },
    {
      "epoch": 4.1698493528538085,
      "grad_norm": 0.7991956615109962,
      "learning_rate": 3.656607270705367e-05,
      "loss": 1.2451,
      "num_input_tokens_seen": 30923837936,
      "step": 39305
    },
    {
      "epoch": 4.1699554423933805,
      "grad_norm": 1.2816119477413612,
      "learning_rate": 3.656545658164689e-05,
      "loss": 1.3898,
      "num_input_tokens_seen": 30924624672,
      "step": 39306
    },
    {
      "epoch": 4.1700615319329515,
      "grad_norm": 0.7216111536839596,
      "learning_rate": 3.656484044730265e-05,
      "loss": 1.3567,
      "num_input_tokens_seen": 30925411376,
      "step": 39307
    },
    {
      "epoch": 4.1701676214725225,
      "grad_norm": 0.7669173292589,
      "learning_rate": 3.656422430402144e-05,
      "loss": 1.3077,
      "num_input_tokens_seen": 30926198096,
      "step": 39308
    },
    {
      "epoch": 4.170273711012094,
      "grad_norm": 0.6048158619855413,
      "learning_rate": 3.656360815180374e-05,
      "loss": 1.2753,
      "num_input_tokens_seen": 30926985008,
      "step": 39309
    },
    {
      "epoch": 4.1703798005516655,
      "grad_norm": 0.5723268092246317,
      "learning_rate": 3.656299199065002e-05,
      "loss": 1.2686,
      "num_input_tokens_seen": 30927771744,
      "step": 39310
    },
    {
      "epoch": 4.170485890091237,
      "grad_norm": 0.909460302817548,
      "learning_rate": 3.656237582056077e-05,
      "loss": 1.29,
      "num_input_tokens_seen": 30928558576,
      "step": 39311
    },
    {
      "epoch": 4.170591979630808,
      "grad_norm": 0.5018226223574173,
      "learning_rate": 3.656175964153644e-05,
      "loss": 1.2932,
      "num_input_tokens_seen": 30929345328,
      "step": 39312
    },
    {
      "epoch": 4.170698069170379,
      "grad_norm": 0.67036585997376,
      "learning_rate": 3.6561143453577526e-05,
      "loss": 1.2812,
      "num_input_tokens_seen": 30930132080,
      "step": 39313
    },
    {
      "epoch": 4.170804158709951,
      "grad_norm": 0.7142445901145152,
      "learning_rate": 3.656052725668451e-05,
      "loss": 1.3395,
      "num_input_tokens_seen": 30930918816,
      "step": 39314
    },
    {
      "epoch": 4.170910248249522,
      "grad_norm": 0.4884275178930883,
      "learning_rate": 3.6559911050857856e-05,
      "loss": 1.2724,
      "num_input_tokens_seen": 30931705520,
      "step": 39315
    },
    {
      "epoch": 4.171016337789094,
      "grad_norm": 0.5632848673951694,
      "learning_rate": 3.655929483609803e-05,
      "loss": 1.2795,
      "num_input_tokens_seen": 30932492304,
      "step": 39316
    },
    {
      "epoch": 4.171122427328665,
      "grad_norm": 0.6411972069131303,
      "learning_rate": 3.6558678612405525e-05,
      "loss": 1.3011,
      "num_input_tokens_seen": 30933279088,
      "step": 39317
    },
    {
      "epoch": 4.171228516868236,
      "grad_norm": 0.5844874638806759,
      "learning_rate": 3.655806237978081e-05,
      "loss": 1.393,
      "num_input_tokens_seen": 30934065840,
      "step": 39318
    },
    {
      "epoch": 4.171334606407808,
      "grad_norm": 0.6053597288714337,
      "learning_rate": 3.655744613822437e-05,
      "loss": 1.3825,
      "num_input_tokens_seen": 30934852576,
      "step": 39319
    },
    {
      "epoch": 4.171440695947379,
      "grad_norm": 0.5754521727658292,
      "learning_rate": 3.655682988773666e-05,
      "loss": 1.2622,
      "num_input_tokens_seen": 30935639424,
      "step": 39320
    },
    {
      "epoch": 4.171546785486951,
      "grad_norm": 0.48847409845340645,
      "learning_rate": 3.6556213628318195e-05,
      "loss": 1.3267,
      "num_input_tokens_seen": 30936426288,
      "step": 39321
    },
    {
      "epoch": 4.171652875026522,
      "grad_norm": 0.57917444937607,
      "learning_rate": 3.6555597359969404e-05,
      "loss": 1.272,
      "num_input_tokens_seen": 30937213104,
      "step": 39322
    },
    {
      "epoch": 4.171758964566094,
      "grad_norm": 0.5521047309211974,
      "learning_rate": 3.6554981082690805e-05,
      "loss": 1.3731,
      "num_input_tokens_seen": 30937999840,
      "step": 39323
    },
    {
      "epoch": 4.171865054105665,
      "grad_norm": 0.5212533791083046,
      "learning_rate": 3.6554364796482846e-05,
      "loss": 1.3067,
      "num_input_tokens_seen": 30938786688,
      "step": 39324
    },
    {
      "epoch": 4.171971143645236,
      "grad_norm": 0.5685929361297495,
      "learning_rate": 3.6553748501346015e-05,
      "loss": 1.2275,
      "num_input_tokens_seen": 30939573504,
      "step": 39325
    },
    {
      "epoch": 4.172077233184808,
      "grad_norm": 0.4804931237684396,
      "learning_rate": 3.6553132197280785e-05,
      "loss": 1.1587,
      "num_input_tokens_seen": 30940360320,
      "step": 39326
    },
    {
      "epoch": 4.172183322724379,
      "grad_norm": 0.5721660871939956,
      "learning_rate": 3.655251588428764e-05,
      "loss": 1.2593,
      "num_input_tokens_seen": 30941147088,
      "step": 39327
    },
    {
      "epoch": 4.172289412263951,
      "grad_norm": 0.5660483949261758,
      "learning_rate": 3.655189956236704e-05,
      "loss": 1.3459,
      "num_input_tokens_seen": 30941933824,
      "step": 39328
    },
    {
      "epoch": 4.172395501803522,
      "grad_norm": 0.5193909068650792,
      "learning_rate": 3.655128323151948e-05,
      "loss": 1.2621,
      "num_input_tokens_seen": 30942720560,
      "step": 39329
    },
    {
      "epoch": 4.172501591343093,
      "grad_norm": 0.5523817923356136,
      "learning_rate": 3.655066689174542e-05,
      "loss": 1.2798,
      "num_input_tokens_seen": 30943507232,
      "step": 39330
    },
    {
      "epoch": 4.172607680882665,
      "grad_norm": 0.5267587227286027,
      "learning_rate": 3.655005054304534e-05,
      "loss": 1.2418,
      "num_input_tokens_seen": 30944294048,
      "step": 39331
    },
    {
      "epoch": 4.172713770422236,
      "grad_norm": 0.5423659082251657,
      "learning_rate": 3.654943418541973e-05,
      "loss": 1.3131,
      "num_input_tokens_seen": 30945080832,
      "step": 39332
    },
    {
      "epoch": 4.172819859961808,
      "grad_norm": 0.492528520904627,
      "learning_rate": 3.654881781886906e-05,
      "loss": 1.2723,
      "num_input_tokens_seen": 30945867632,
      "step": 39333
    },
    {
      "epoch": 4.172925949501379,
      "grad_norm": 0.5147380249102765,
      "learning_rate": 3.654820144339379e-05,
      "loss": 1.258,
      "num_input_tokens_seen": 30946654288,
      "step": 39334
    },
    {
      "epoch": 4.173032039040951,
      "grad_norm": 0.5826444553860491,
      "learning_rate": 3.6547585058994416e-05,
      "loss": 1.2788,
      "num_input_tokens_seen": 30947441136,
      "step": 39335
    },
    {
      "epoch": 4.173138128580522,
      "grad_norm": 0.44242122280497964,
      "learning_rate": 3.65469686656714e-05,
      "loss": 1.1455,
      "num_input_tokens_seen": 30948227920,
      "step": 39336
    },
    {
      "epoch": 4.173244218120093,
      "grad_norm": 0.661213164100102,
      "learning_rate": 3.654635226342523e-05,
      "loss": 1.3204,
      "num_input_tokens_seen": 30949014656,
      "step": 39337
    },
    {
      "epoch": 4.173350307659665,
      "grad_norm": 0.4627431709271131,
      "learning_rate": 3.654573585225638e-05,
      "loss": 1.243,
      "num_input_tokens_seen": 30949801536,
      "step": 39338
    },
    {
      "epoch": 4.173456397199236,
      "grad_norm": 0.5584004156861364,
      "learning_rate": 3.654511943216532e-05,
      "loss": 1.3766,
      "num_input_tokens_seen": 30950588288,
      "step": 39339
    },
    {
      "epoch": 4.173562486738808,
      "grad_norm": 0.6074491881426787,
      "learning_rate": 3.654450300315253e-05,
      "loss": 1.4146,
      "num_input_tokens_seen": 30951375072,
      "step": 39340
    },
    {
      "epoch": 4.173668576278379,
      "grad_norm": 0.44626495138530575,
      "learning_rate": 3.654388656521849e-05,
      "loss": 1.1926,
      "num_input_tokens_seen": 30952162000,
      "step": 39341
    },
    {
      "epoch": 4.17377466581795,
      "grad_norm": 0.5411912249771683,
      "learning_rate": 3.654327011836367e-05,
      "loss": 1.2529,
      "num_input_tokens_seen": 30952948752,
      "step": 39342
    },
    {
      "epoch": 4.173880755357522,
      "grad_norm": 0.6071589327259184,
      "learning_rate": 3.654265366258856e-05,
      "loss": 1.2605,
      "num_input_tokens_seen": 30953735616,
      "step": 39343
    },
    {
      "epoch": 4.173986844897093,
      "grad_norm": 0.8047863990046917,
      "learning_rate": 3.654203719789361e-05,
      "loss": 1.4083,
      "num_input_tokens_seen": 30954522352,
      "step": 39344
    },
    {
      "epoch": 4.174092934436665,
      "grad_norm": 0.7035866040024894,
      "learning_rate": 3.6541420724279317e-05,
      "loss": 1.2517,
      "num_input_tokens_seen": 30955309136,
      "step": 39345
    },
    {
      "epoch": 4.174199023976236,
      "grad_norm": 0.7365265538575275,
      "learning_rate": 3.654080424174616e-05,
      "loss": 1.2292,
      "num_input_tokens_seen": 30956095984,
      "step": 39346
    },
    {
      "epoch": 4.174305113515807,
      "grad_norm": 0.6010775710558934,
      "learning_rate": 3.6540187750294606e-05,
      "loss": 1.3084,
      "num_input_tokens_seen": 30956882768,
      "step": 39347
    },
    {
      "epoch": 4.174411203055379,
      "grad_norm": 0.6620948881960326,
      "learning_rate": 3.653957124992513e-05,
      "loss": 1.3581,
      "num_input_tokens_seen": 30957669552,
      "step": 39348
    },
    {
      "epoch": 4.17451729259495,
      "grad_norm": 0.8786713271343206,
      "learning_rate": 3.653895474063821e-05,
      "loss": 1.2944,
      "num_input_tokens_seen": 30958456320,
      "step": 39349
    },
    {
      "epoch": 4.174623382134522,
      "grad_norm": 0.5669898946524222,
      "learning_rate": 3.6538338222434334e-05,
      "loss": 1.3342,
      "num_input_tokens_seen": 30959243200,
      "step": 39350
    },
    {
      "epoch": 4.174729471674093,
      "grad_norm": 0.8122273674035695,
      "learning_rate": 3.6537721695313956e-05,
      "loss": 1.2823,
      "num_input_tokens_seen": 30960029968,
      "step": 39351
    },
    {
      "epoch": 4.174835561213665,
      "grad_norm": 0.5693402281092399,
      "learning_rate": 3.653710515927757e-05,
      "loss": 1.2553,
      "num_input_tokens_seen": 30960816912,
      "step": 39352
    },
    {
      "epoch": 4.174941650753236,
      "grad_norm": 0.48048222573845,
      "learning_rate": 3.6536488614325646e-05,
      "loss": 1.2629,
      "num_input_tokens_seen": 30961603728,
      "step": 39353
    },
    {
      "epoch": 4.175047740292807,
      "grad_norm": 0.6517593335071958,
      "learning_rate": 3.653587206045867e-05,
      "loss": 1.3328,
      "num_input_tokens_seen": 30962390448,
      "step": 39354
    },
    {
      "epoch": 4.175153829832379,
      "grad_norm": 0.5423137722115899,
      "learning_rate": 3.653525549767711e-05,
      "loss": 1.345,
      "num_input_tokens_seen": 30963177168,
      "step": 39355
    },
    {
      "epoch": 4.17525991937195,
      "grad_norm": 0.5910854232312942,
      "learning_rate": 3.653463892598144e-05,
      "loss": 1.3443,
      "num_input_tokens_seen": 30963963904,
      "step": 39356
    },
    {
      "epoch": 4.175366008911522,
      "grad_norm": 0.5935062208344136,
      "learning_rate": 3.6534022345372134e-05,
      "loss": 1.3626,
      "num_input_tokens_seen": 30964750576,
      "step": 39357
    },
    {
      "epoch": 4.175472098451093,
      "grad_norm": 0.5781116625124754,
      "learning_rate": 3.653340575584968e-05,
      "loss": 1.3093,
      "num_input_tokens_seen": 30965537408,
      "step": 39358
    },
    {
      "epoch": 4.175578187990664,
      "grad_norm": 0.558432849012466,
      "learning_rate": 3.653278915741454e-05,
      "loss": 1.3556,
      "num_input_tokens_seen": 30966324240,
      "step": 39359
    },
    {
      "epoch": 4.175684277530236,
      "grad_norm": 0.5562098816776961,
      "learning_rate": 3.653217255006721e-05,
      "loss": 1.3267,
      "num_input_tokens_seen": 30967111008,
      "step": 39360
    },
    {
      "epoch": 4.175790367069807,
      "grad_norm": 0.549532788775642,
      "learning_rate": 3.653155593380816e-05,
      "loss": 1.2971,
      "num_input_tokens_seen": 30967897728,
      "step": 39361
    },
    {
      "epoch": 4.175896456609379,
      "grad_norm": 0.6382795932684816,
      "learning_rate": 3.6530939308637847e-05,
      "loss": 1.3743,
      "num_input_tokens_seen": 30968684464,
      "step": 39362
    },
    {
      "epoch": 4.17600254614895,
      "grad_norm": 0.5255671820509978,
      "learning_rate": 3.653032267455676e-05,
      "loss": 1.2395,
      "num_input_tokens_seen": 30969471152,
      "step": 39363
    },
    {
      "epoch": 4.1761086356885215,
      "grad_norm": 0.5247227678150778,
      "learning_rate": 3.6529706031565394e-05,
      "loss": 1.3499,
      "num_input_tokens_seen": 30970257968,
      "step": 39364
    },
    {
      "epoch": 4.176214725228093,
      "grad_norm": 0.47264297660802634,
      "learning_rate": 3.65290893796642e-05,
      "loss": 1.3346,
      "num_input_tokens_seen": 30971044784,
      "step": 39365
    },
    {
      "epoch": 4.176320814767664,
      "grad_norm": 0.4902104244814263,
      "learning_rate": 3.6528472718853665e-05,
      "loss": 1.2361,
      "num_input_tokens_seen": 30971831584,
      "step": 39366
    },
    {
      "epoch": 4.1764269043072355,
      "grad_norm": 0.6051326842700337,
      "learning_rate": 3.652785604913426e-05,
      "loss": 1.2222,
      "num_input_tokens_seen": 30972618384,
      "step": 39367
    },
    {
      "epoch": 4.1765329938468065,
      "grad_norm": 0.47002431742243855,
      "learning_rate": 3.652723937050647e-05,
      "loss": 1.2602,
      "num_input_tokens_seen": 30973405104,
      "step": 39368
    },
    {
      "epoch": 4.1766390833863785,
      "grad_norm": 0.5449675023345808,
      "learning_rate": 3.6526622682970774e-05,
      "loss": 1.2401,
      "num_input_tokens_seen": 30974191856,
      "step": 39369
    },
    {
      "epoch": 4.1767451729259495,
      "grad_norm": 0.7117236103296514,
      "learning_rate": 3.652600598652764e-05,
      "loss": 1.2832,
      "num_input_tokens_seen": 30974978640,
      "step": 39370
    },
    {
      "epoch": 4.1768512624655205,
      "grad_norm": 0.699737155893603,
      "learning_rate": 3.652538928117754e-05,
      "loss": 1.3381,
      "num_input_tokens_seen": 30975765456,
      "step": 39371
    },
    {
      "epoch": 4.176957352005092,
      "grad_norm": 0.4904606777530366,
      "learning_rate": 3.6524772566920964e-05,
      "loss": 1.1577,
      "num_input_tokens_seen": 30976552176,
      "step": 39372
    },
    {
      "epoch": 4.1770634415446635,
      "grad_norm": 0.5891530356439869,
      "learning_rate": 3.652415584375838e-05,
      "loss": 1.2749,
      "num_input_tokens_seen": 30977338928,
      "step": 39373
    },
    {
      "epoch": 4.177169531084235,
      "grad_norm": 0.5611530662984057,
      "learning_rate": 3.652353911169026e-05,
      "loss": 1.3435,
      "num_input_tokens_seen": 30978125776,
      "step": 39374
    },
    {
      "epoch": 4.177275620623806,
      "grad_norm": 0.4854195629205075,
      "learning_rate": 3.65229223707171e-05,
      "loss": 1.4122,
      "num_input_tokens_seen": 30978912512,
      "step": 39375
    },
    {
      "epoch": 4.1773817101633774,
      "grad_norm": 0.6464137466349704,
      "learning_rate": 3.652230562083935e-05,
      "loss": 1.3611,
      "num_input_tokens_seen": 30979699136,
      "step": 39376
    },
    {
      "epoch": 4.177487799702949,
      "grad_norm": 0.4755638463644394,
      "learning_rate": 3.652168886205751e-05,
      "loss": 1.3291,
      "num_input_tokens_seen": 30980485920,
      "step": 39377
    },
    {
      "epoch": 4.17759388924252,
      "grad_norm": 0.4945479462375802,
      "learning_rate": 3.652107209437204e-05,
      "loss": 1.3339,
      "num_input_tokens_seen": 30981272704,
      "step": 39378
    },
    {
      "epoch": 4.177699978782092,
      "grad_norm": 0.5933782596360128,
      "learning_rate": 3.652045531778343e-05,
      "loss": 1.3001,
      "num_input_tokens_seen": 30982059504,
      "step": 39379
    },
    {
      "epoch": 4.177806068321663,
      "grad_norm": 0.5333132458398465,
      "learning_rate": 3.651983853229215e-05,
      "loss": 1.3594,
      "num_input_tokens_seen": 30982846224,
      "step": 39380
    },
    {
      "epoch": 4.177912157861235,
      "grad_norm": 0.6302098205039238,
      "learning_rate": 3.651922173789867e-05,
      "loss": 1.4294,
      "num_input_tokens_seen": 30983632944,
      "step": 39381
    },
    {
      "epoch": 4.178018247400806,
      "grad_norm": 0.6087156405260294,
      "learning_rate": 3.651860493460348e-05,
      "loss": 1.3631,
      "num_input_tokens_seen": 30984419664,
      "step": 39382
    },
    {
      "epoch": 4.178124336940377,
      "grad_norm": 0.5209842882028494,
      "learning_rate": 3.651798812240705e-05,
      "loss": 1.2738,
      "num_input_tokens_seen": 30985206464,
      "step": 39383
    },
    {
      "epoch": 4.178230426479949,
      "grad_norm": 0.6898282192744158,
      "learning_rate": 3.651737130130986e-05,
      "loss": 1.2719,
      "num_input_tokens_seen": 30985993152,
      "step": 39384
    },
    {
      "epoch": 4.17833651601952,
      "grad_norm": 0.47368305374280034,
      "learning_rate": 3.651675447131237e-05,
      "loss": 1.2672,
      "num_input_tokens_seen": 30986779984,
      "step": 39385
    },
    {
      "epoch": 4.178442605559092,
      "grad_norm": 0.5135055176858483,
      "learning_rate": 3.651613763241508e-05,
      "loss": 1.3846,
      "num_input_tokens_seen": 30987566688,
      "step": 39386
    },
    {
      "epoch": 4.178548695098663,
      "grad_norm": 0.5408307385718302,
      "learning_rate": 3.651552078461846e-05,
      "loss": 1.2671,
      "num_input_tokens_seen": 30988353408,
      "step": 39387
    },
    {
      "epoch": 4.178654784638234,
      "grad_norm": 0.5803604518240375,
      "learning_rate": 3.6514903927922974e-05,
      "loss": 1.2725,
      "num_input_tokens_seen": 30989140176,
      "step": 39388
    },
    {
      "epoch": 4.178760874177806,
      "grad_norm": 0.6703977589064767,
      "learning_rate": 3.651428706232911e-05,
      "loss": 1.4116,
      "num_input_tokens_seen": 30989926912,
      "step": 39389
    },
    {
      "epoch": 4.178866963717377,
      "grad_norm": 0.590628615358744,
      "learning_rate": 3.651367018783734e-05,
      "loss": 1.274,
      "num_input_tokens_seen": 30990713728,
      "step": 39390
    },
    {
      "epoch": 4.178973053256949,
      "grad_norm": 0.8392260581023393,
      "learning_rate": 3.651305330444815e-05,
      "loss": 1.2813,
      "num_input_tokens_seen": 30991500432,
      "step": 39391
    },
    {
      "epoch": 4.17907914279652,
      "grad_norm": 0.5045809010575335,
      "learning_rate": 3.6512436412162015e-05,
      "loss": 1.2046,
      "num_input_tokens_seen": 30992287184,
      "step": 39392
    },
    {
      "epoch": 4.179185232336092,
      "grad_norm": 0.6624417575393349,
      "learning_rate": 3.65118195109794e-05,
      "loss": 1.268,
      "num_input_tokens_seen": 30993074016,
      "step": 39393
    },
    {
      "epoch": 4.179291321875663,
      "grad_norm": 0.5593370772363193,
      "learning_rate": 3.651120260090079e-05,
      "loss": 1.26,
      "num_input_tokens_seen": 30993860768,
      "step": 39394
    },
    {
      "epoch": 4.179397411415234,
      "grad_norm": 0.5260091249895994,
      "learning_rate": 3.651058568192666e-05,
      "loss": 1.285,
      "num_input_tokens_seen": 30994647504,
      "step": 39395
    },
    {
      "epoch": 4.179503500954806,
      "grad_norm": 0.5802602198160149,
      "learning_rate": 3.650996875405748e-05,
      "loss": 1.2173,
      "num_input_tokens_seen": 30995434192,
      "step": 39396
    },
    {
      "epoch": 4.179609590494377,
      "grad_norm": 0.6832168233774846,
      "learning_rate": 3.650935181729375e-05,
      "loss": 1.3533,
      "num_input_tokens_seen": 30996220880,
      "step": 39397
    },
    {
      "epoch": 4.179715680033949,
      "grad_norm": 0.5205878952803523,
      "learning_rate": 3.650873487163592e-05,
      "loss": 1.3033,
      "num_input_tokens_seen": 30997007632,
      "step": 39398
    },
    {
      "epoch": 4.17982176957352,
      "grad_norm": 0.5076491852168334,
      "learning_rate": 3.650811791708447e-05,
      "loss": 1.2963,
      "num_input_tokens_seen": 30997794448,
      "step": 39399
    },
    {
      "epoch": 4.179927859113091,
      "grad_norm": 0.7867436845486679,
      "learning_rate": 3.65075009536399e-05,
      "loss": 1.3687,
      "num_input_tokens_seen": 30998581216,
      "step": 39400
    },
    {
      "epoch": 4.180033948652663,
      "grad_norm": 0.7737612362970725,
      "learning_rate": 3.6506883981302667e-05,
      "loss": 1.2683,
      "num_input_tokens_seen": 30999368048,
      "step": 39401
    },
    {
      "epoch": 4.180140038192234,
      "grad_norm": 0.8845931234409178,
      "learning_rate": 3.650626700007325e-05,
      "loss": 1.3496,
      "num_input_tokens_seen": 31000154768,
      "step": 39402
    },
    {
      "epoch": 4.180246127731806,
      "grad_norm": 0.4768305613953207,
      "learning_rate": 3.650565000995212e-05,
      "loss": 1.1807,
      "num_input_tokens_seen": 31000941616,
      "step": 39403
    },
    {
      "epoch": 4.180352217271377,
      "grad_norm": 0.6028745172884942,
      "learning_rate": 3.650503301093977e-05,
      "loss": 1.3477,
      "num_input_tokens_seen": 31001728368,
      "step": 39404
    },
    {
      "epoch": 4.180458306810948,
      "grad_norm": 0.9045822123635822,
      "learning_rate": 3.650441600303666e-05,
      "loss": 1.4066,
      "num_input_tokens_seen": 31002515056,
      "step": 39405
    },
    {
      "epoch": 4.18056439635052,
      "grad_norm": 0.6253482357324132,
      "learning_rate": 3.650379898624329e-05,
      "loss": 1.3828,
      "num_input_tokens_seen": 31003301776,
      "step": 39406
    },
    {
      "epoch": 4.180670485890091,
      "grad_norm": 0.9973188979984923,
      "learning_rate": 3.6503181960560103e-05,
      "loss": 1.4522,
      "num_input_tokens_seen": 31004088608,
      "step": 39407
    },
    {
      "epoch": 4.180776575429663,
      "grad_norm": 0.5349248023552029,
      "learning_rate": 3.6502564925987606e-05,
      "loss": 1.2809,
      "num_input_tokens_seen": 31004875408,
      "step": 39408
    },
    {
      "epoch": 4.180882664969234,
      "grad_norm": 0.6035092152546929,
      "learning_rate": 3.650194788252627e-05,
      "loss": 1.2701,
      "num_input_tokens_seen": 31005662144,
      "step": 39409
    },
    {
      "epoch": 4.180988754508806,
      "grad_norm": 0.5634159575887127,
      "learning_rate": 3.6501330830176556e-05,
      "loss": 1.3693,
      "num_input_tokens_seen": 31006448992,
      "step": 39410
    },
    {
      "epoch": 4.181094844048377,
      "grad_norm": 0.5624463722943768,
      "learning_rate": 3.6500713768938946e-05,
      "loss": 1.3161,
      "num_input_tokens_seen": 31007235856,
      "step": 39411
    },
    {
      "epoch": 4.181200933587948,
      "grad_norm": 0.5630584881444782,
      "learning_rate": 3.6500096698813934e-05,
      "loss": 1.2991,
      "num_input_tokens_seen": 31008022656,
      "step": 39412
    },
    {
      "epoch": 4.18130702312752,
      "grad_norm": 0.579148873502324,
      "learning_rate": 3.6499479619801974e-05,
      "loss": 1.3795,
      "num_input_tokens_seen": 31008809456,
      "step": 39413
    },
    {
      "epoch": 4.181413112667091,
      "grad_norm": 0.5040778014084188,
      "learning_rate": 3.6498862531903555e-05,
      "loss": 1.3296,
      "num_input_tokens_seen": 31009596128,
      "step": 39414
    },
    {
      "epoch": 4.181519202206663,
      "grad_norm": 0.6470977456895233,
      "learning_rate": 3.6498245435119164e-05,
      "loss": 1.2683,
      "num_input_tokens_seen": 31010382944,
      "step": 39415
    },
    {
      "epoch": 4.181625291746234,
      "grad_norm": 0.5633693584069926,
      "learning_rate": 3.6497628329449254e-05,
      "loss": 1.3286,
      "num_input_tokens_seen": 31011169712,
      "step": 39416
    },
    {
      "epoch": 4.181731381285805,
      "grad_norm": 0.6332327619400249,
      "learning_rate": 3.6497011214894315e-05,
      "loss": 1.3179,
      "num_input_tokens_seen": 31011956432,
      "step": 39417
    },
    {
      "epoch": 4.181837470825377,
      "grad_norm": 0.6966677888993752,
      "learning_rate": 3.6496394091454834e-05,
      "loss": 1.3841,
      "num_input_tokens_seen": 31012743168,
      "step": 39418
    },
    {
      "epoch": 4.181943560364948,
      "grad_norm": 0.5405834746513399,
      "learning_rate": 3.6495776959131264e-05,
      "loss": 1.287,
      "num_input_tokens_seen": 31013529968,
      "step": 39419
    },
    {
      "epoch": 4.18204964990452,
      "grad_norm": 0.705132692859639,
      "learning_rate": 3.649515981792411e-05,
      "loss": 1.2717,
      "num_input_tokens_seen": 31014316768,
      "step": 39420
    },
    {
      "epoch": 4.182155739444091,
      "grad_norm": 0.6843391677455338,
      "learning_rate": 3.649454266783382e-05,
      "loss": 1.3516,
      "num_input_tokens_seen": 31015103488,
      "step": 39421
    },
    {
      "epoch": 4.182261828983663,
      "grad_norm": 0.45692575989263085,
      "learning_rate": 3.6493925508860886e-05,
      "loss": 1.2518,
      "num_input_tokens_seen": 31015890304,
      "step": 39422
    },
    {
      "epoch": 4.182367918523234,
      "grad_norm": 0.6988177522381028,
      "learning_rate": 3.649330834100579e-05,
      "loss": 1.2681,
      "num_input_tokens_seen": 31016677072,
      "step": 39423
    },
    {
      "epoch": 4.182474008062805,
      "grad_norm": 0.5231690531124111,
      "learning_rate": 3.6492691164269e-05,
      "loss": 1.2803,
      "num_input_tokens_seen": 31017463872,
      "step": 39424
    },
    {
      "epoch": 4.182580097602377,
      "grad_norm": 0.5246789715085781,
      "learning_rate": 3.649207397865099e-05,
      "loss": 1.3174,
      "num_input_tokens_seen": 31018250704,
      "step": 39425
    },
    {
      "epoch": 4.182686187141948,
      "grad_norm": 0.5151482185656142,
      "learning_rate": 3.649145678415225e-05,
      "loss": 1.3248,
      "num_input_tokens_seen": 31019037392,
      "step": 39426
    },
    {
      "epoch": 4.1827922766815195,
      "grad_norm": 0.5648110125720384,
      "learning_rate": 3.649083958077325e-05,
      "loss": 1.3599,
      "num_input_tokens_seen": 31019824208,
      "step": 39427
    },
    {
      "epoch": 4.182898366221091,
      "grad_norm": 0.6867306213041035,
      "learning_rate": 3.649022236851446e-05,
      "loss": 1.2936,
      "num_input_tokens_seen": 31020610992,
      "step": 39428
    },
    {
      "epoch": 4.183004455760662,
      "grad_norm": 0.5610634157856573,
      "learning_rate": 3.648960514737637e-05,
      "loss": 1.3145,
      "num_input_tokens_seen": 31021397808,
      "step": 39429
    },
    {
      "epoch": 4.1831105453002335,
      "grad_norm": 0.6001446079154805,
      "learning_rate": 3.6488987917359444e-05,
      "loss": 1.3428,
      "num_input_tokens_seen": 31022184544,
      "step": 39430
    },
    {
      "epoch": 4.1832166348398045,
      "grad_norm": 0.5621016144762675,
      "learning_rate": 3.648837067846417e-05,
      "loss": 1.2626,
      "num_input_tokens_seen": 31022971392,
      "step": 39431
    },
    {
      "epoch": 4.1833227243793765,
      "grad_norm": 0.6112048100792545,
      "learning_rate": 3.648775343069102e-05,
      "loss": 1.3945,
      "num_input_tokens_seen": 31023758144,
      "step": 39432
    },
    {
      "epoch": 4.1834288139189475,
      "grad_norm": 0.603730910529239,
      "learning_rate": 3.648713617404047e-05,
      "loss": 1.2693,
      "num_input_tokens_seen": 31024544848,
      "step": 39433
    },
    {
      "epoch": 4.183534903458519,
      "grad_norm": 0.487310287397941,
      "learning_rate": 3.6486518908513e-05,
      "loss": 1.3322,
      "num_input_tokens_seen": 31025331696,
      "step": 39434
    },
    {
      "epoch": 4.1836409929980904,
      "grad_norm": 0.5798719509989145,
      "learning_rate": 3.6485901634109076e-05,
      "loss": 1.3764,
      "num_input_tokens_seen": 31026118464,
      "step": 39435
    },
    {
      "epoch": 4.1837470825376615,
      "grad_norm": 0.5354521358453805,
      "learning_rate": 3.64852843508292e-05,
      "loss": 1.2882,
      "num_input_tokens_seen": 31026905248,
      "step": 39436
    },
    {
      "epoch": 4.183853172077233,
      "grad_norm": 0.5285188094438926,
      "learning_rate": 3.648466705867381e-05,
      "loss": 1.3362,
      "num_input_tokens_seen": 31027691936,
      "step": 39437
    },
    {
      "epoch": 4.183959261616804,
      "grad_norm": 0.4717911447133787,
      "learning_rate": 3.648404975764343e-05,
      "loss": 1.318,
      "num_input_tokens_seen": 31028478816,
      "step": 39438
    },
    {
      "epoch": 4.184065351156376,
      "grad_norm": 0.7814487472683951,
      "learning_rate": 3.64834324477385e-05,
      "loss": 1.3019,
      "num_input_tokens_seen": 31029265616,
      "step": 39439
    },
    {
      "epoch": 4.184171440695947,
      "grad_norm": 0.5644108802719143,
      "learning_rate": 3.6482815128959516e-05,
      "loss": 1.3807,
      "num_input_tokens_seen": 31030052400,
      "step": 39440
    },
    {
      "epoch": 4.184277530235518,
      "grad_norm": 0.6963405252253861,
      "learning_rate": 3.648219780130695e-05,
      "loss": 1.3628,
      "num_input_tokens_seen": 31030839248,
      "step": 39441
    },
    {
      "epoch": 4.18438361977509,
      "grad_norm": 0.6950657691730143,
      "learning_rate": 3.6481580464781275e-05,
      "loss": 1.413,
      "num_input_tokens_seen": 31031625952,
      "step": 39442
    },
    {
      "epoch": 4.184489709314661,
      "grad_norm": 0.5080457375140186,
      "learning_rate": 3.648096311938297e-05,
      "loss": 1.3854,
      "num_input_tokens_seen": 31032412720,
      "step": 39443
    },
    {
      "epoch": 4.184595798854233,
      "grad_norm": 0.5509456273135047,
      "learning_rate": 3.648034576511252e-05,
      "loss": 1.2167,
      "num_input_tokens_seen": 31033199552,
      "step": 39444
    },
    {
      "epoch": 4.184701888393804,
      "grad_norm": 0.5748606988612118,
      "learning_rate": 3.647972840197039e-05,
      "loss": 1.1424,
      "num_input_tokens_seen": 31033986288,
      "step": 39445
    },
    {
      "epoch": 4.184807977933376,
      "grad_norm": 0.4865992988865641,
      "learning_rate": 3.6479111029957066e-05,
      "loss": 1.253,
      "num_input_tokens_seen": 31034773072,
      "step": 39446
    },
    {
      "epoch": 4.184914067472947,
      "grad_norm": 0.5536380260686378,
      "learning_rate": 3.647849364907302e-05,
      "loss": 1.3465,
      "num_input_tokens_seen": 31035559840,
      "step": 39447
    },
    {
      "epoch": 4.185020157012518,
      "grad_norm": 0.6224895709941353,
      "learning_rate": 3.647787625931873e-05,
      "loss": 1.2789,
      "num_input_tokens_seen": 31036346672,
      "step": 39448
    },
    {
      "epoch": 4.18512624655209,
      "grad_norm": 0.472325550184114,
      "learning_rate": 3.6477258860694676e-05,
      "loss": 1.3384,
      "num_input_tokens_seen": 31037133456,
      "step": 39449
    },
    {
      "epoch": 4.185232336091661,
      "grad_norm": 0.5199284027451906,
      "learning_rate": 3.6476641453201334e-05,
      "loss": 1.3806,
      "num_input_tokens_seen": 31037920176,
      "step": 39450
    },
    {
      "epoch": 4.185338425631233,
      "grad_norm": 0.7003591919450681,
      "learning_rate": 3.647602403683917e-05,
      "loss": 1.2756,
      "num_input_tokens_seen": 31038707024,
      "step": 39451
    },
    {
      "epoch": 4.185444515170804,
      "grad_norm": 0.6306248688149106,
      "learning_rate": 3.647540661160869e-05,
      "loss": 1.2482,
      "num_input_tokens_seen": 31039493808,
      "step": 39452
    },
    {
      "epoch": 4.185550604710375,
      "grad_norm": 0.582698937479894,
      "learning_rate": 3.6474789177510345e-05,
      "loss": 1.166,
      "num_input_tokens_seen": 31040280544,
      "step": 39453
    },
    {
      "epoch": 4.185656694249947,
      "grad_norm": 0.5364123278686072,
      "learning_rate": 3.647417173454461e-05,
      "loss": 1.2936,
      "num_input_tokens_seen": 31041067392,
      "step": 39454
    },
    {
      "epoch": 4.185762783789518,
      "grad_norm": 0.7865348540705651,
      "learning_rate": 3.647355428271198e-05,
      "loss": 1.3963,
      "num_input_tokens_seen": 31041854064,
      "step": 39455
    },
    {
      "epoch": 4.18586887332909,
      "grad_norm": 0.6130175178989686,
      "learning_rate": 3.647293682201292e-05,
      "loss": 1.2886,
      "num_input_tokens_seen": 31042640928,
      "step": 39456
    },
    {
      "epoch": 4.185974962868661,
      "grad_norm": 0.6108913288206999,
      "learning_rate": 3.6472319352447914e-05,
      "loss": 1.2783,
      "num_input_tokens_seen": 31043427696,
      "step": 39457
    },
    {
      "epoch": 4.186081052408232,
      "grad_norm": 0.7459858042409698,
      "learning_rate": 3.647170187401744e-05,
      "loss": 1.3505,
      "num_input_tokens_seen": 31044214432,
      "step": 39458
    },
    {
      "epoch": 4.186187141947804,
      "grad_norm": 0.4806152257620235,
      "learning_rate": 3.6471084386721966e-05,
      "loss": 1.2985,
      "num_input_tokens_seen": 31045001216,
      "step": 39459
    },
    {
      "epoch": 4.186293231487375,
      "grad_norm": 0.7089311361059719,
      "learning_rate": 3.647046689056198e-05,
      "loss": 1.2743,
      "num_input_tokens_seen": 31045787968,
      "step": 39460
    },
    {
      "epoch": 4.186399321026947,
      "grad_norm": 0.5412115027126972,
      "learning_rate": 3.6469849385537944e-05,
      "loss": 1.2025,
      "num_input_tokens_seen": 31046574688,
      "step": 39461
    },
    {
      "epoch": 4.186505410566518,
      "grad_norm": 0.5989954746190042,
      "learning_rate": 3.646923187165036e-05,
      "loss": 1.4454,
      "num_input_tokens_seen": 31047361472,
      "step": 39462
    },
    {
      "epoch": 4.18661150010609,
      "grad_norm": 0.6261474329883876,
      "learning_rate": 3.646861434889967e-05,
      "loss": 1.2919,
      "num_input_tokens_seen": 31048148288,
      "step": 39463
    },
    {
      "epoch": 4.186717589645661,
      "grad_norm": 0.8028803804755058,
      "learning_rate": 3.646799681728639e-05,
      "loss": 1.2961,
      "num_input_tokens_seen": 31048935104,
      "step": 39464
    },
    {
      "epoch": 4.186823679185232,
      "grad_norm": 0.5906416739033887,
      "learning_rate": 3.646737927681096e-05,
      "loss": 1.3354,
      "num_input_tokens_seen": 31049721824,
      "step": 39465
    },
    {
      "epoch": 4.186929768724804,
      "grad_norm": 0.7377251667807665,
      "learning_rate": 3.646676172747389e-05,
      "loss": 1.3649,
      "num_input_tokens_seen": 31050508592,
      "step": 39466
    },
    {
      "epoch": 4.187035858264375,
      "grad_norm": 0.7800135633087721,
      "learning_rate": 3.646614416927564e-05,
      "loss": 1.2671,
      "num_input_tokens_seen": 31051295360,
      "step": 39467
    },
    {
      "epoch": 4.187141947803947,
      "grad_norm": 0.5279781634964437,
      "learning_rate": 3.6465526602216684e-05,
      "loss": 1.3235,
      "num_input_tokens_seen": 31052082080,
      "step": 39468
    },
    {
      "epoch": 4.187248037343518,
      "grad_norm": 1.0686301459123646,
      "learning_rate": 3.6464909026297515e-05,
      "loss": 1.3074,
      "num_input_tokens_seen": 31052868816,
      "step": 39469
    },
    {
      "epoch": 4.187354126883089,
      "grad_norm": 0.5981567516408136,
      "learning_rate": 3.64642914415186e-05,
      "loss": 1.2873,
      "num_input_tokens_seen": 31053655568,
      "step": 39470
    },
    {
      "epoch": 4.187460216422661,
      "grad_norm": 0.5588472129934289,
      "learning_rate": 3.646367384788041e-05,
      "loss": 1.3945,
      "num_input_tokens_seen": 31054442256,
      "step": 39471
    },
    {
      "epoch": 4.187566305962232,
      "grad_norm": 0.7826326516902354,
      "learning_rate": 3.646305624538344e-05,
      "loss": 1.2679,
      "num_input_tokens_seen": 31055228960,
      "step": 39472
    },
    {
      "epoch": 4.187672395501804,
      "grad_norm": 0.5747417163568386,
      "learning_rate": 3.6462438634028145e-05,
      "loss": 1.2626,
      "num_input_tokens_seen": 31056015760,
      "step": 39473
    },
    {
      "epoch": 4.187778485041375,
      "grad_norm": 0.5855968639344911,
      "learning_rate": 3.646182101381502e-05,
      "loss": 1.3509,
      "num_input_tokens_seen": 31056802544,
      "step": 39474
    },
    {
      "epoch": 4.187884574580947,
      "grad_norm": 0.7458536585347726,
      "learning_rate": 3.6461203384744534e-05,
      "loss": 1.3523,
      "num_input_tokens_seen": 31057589328,
      "step": 39475
    },
    {
      "epoch": 4.187990664120518,
      "grad_norm": 0.6367237703759109,
      "learning_rate": 3.6460585746817166e-05,
      "loss": 1.3848,
      "num_input_tokens_seen": 31058376112,
      "step": 39476
    },
    {
      "epoch": 4.188096753660089,
      "grad_norm": 0.6337510902074167,
      "learning_rate": 3.645996810003339e-05,
      "loss": 1.2593,
      "num_input_tokens_seen": 31059162864,
      "step": 39477
    },
    {
      "epoch": 4.188202843199661,
      "grad_norm": 0.6276676293542297,
      "learning_rate": 3.6459350444393696e-05,
      "loss": 1.4256,
      "num_input_tokens_seen": 31059949616,
      "step": 39478
    },
    {
      "epoch": 4.188308932739232,
      "grad_norm": 0.5524742184072008,
      "learning_rate": 3.645873277989855e-05,
      "loss": 1.3196,
      "num_input_tokens_seen": 31060736416,
      "step": 39479
    },
    {
      "epoch": 4.188415022278804,
      "grad_norm": 0.6178479381723746,
      "learning_rate": 3.645811510654843e-05,
      "loss": 1.4131,
      "num_input_tokens_seen": 31061523152,
      "step": 39480
    },
    {
      "epoch": 4.188521111818375,
      "grad_norm": 0.828526232400178,
      "learning_rate": 3.6457497424343814e-05,
      "loss": 1.3693,
      "num_input_tokens_seen": 31062309984,
      "step": 39481
    },
    {
      "epoch": 4.188627201357946,
      "grad_norm": 0.6492545469236193,
      "learning_rate": 3.645687973328517e-05,
      "loss": 1.3181,
      "num_input_tokens_seen": 31063096784,
      "step": 39482
    },
    {
      "epoch": 4.188733290897518,
      "grad_norm": 0.5308632648136281,
      "learning_rate": 3.6456262033373e-05,
      "loss": 1.409,
      "num_input_tokens_seen": 31063883568,
      "step": 39483
    },
    {
      "epoch": 4.188839380437089,
      "grad_norm": 0.7451216466187839,
      "learning_rate": 3.645564432460776e-05,
      "loss": 1.2579,
      "num_input_tokens_seen": 31064670400,
      "step": 39484
    },
    {
      "epoch": 4.188945469976661,
      "grad_norm": 0.5786837813955622,
      "learning_rate": 3.6455026606989936e-05,
      "loss": 1.3087,
      "num_input_tokens_seen": 31065457168,
      "step": 39485
    },
    {
      "epoch": 4.189051559516232,
      "grad_norm": 0.5562115537787389,
      "learning_rate": 3.6454408880520005e-05,
      "loss": 1.375,
      "num_input_tokens_seen": 31066243840,
      "step": 39486
    },
    {
      "epoch": 4.189157649055803,
      "grad_norm": 0.5621607362689133,
      "learning_rate": 3.6453791145198444e-05,
      "loss": 1.3316,
      "num_input_tokens_seen": 31067030704,
      "step": 39487
    },
    {
      "epoch": 4.189263738595375,
      "grad_norm": 0.6049431863244262,
      "learning_rate": 3.645317340102573e-05,
      "loss": 1.2144,
      "num_input_tokens_seen": 31067817488,
      "step": 39488
    },
    {
      "epoch": 4.189369828134946,
      "grad_norm": 0.6424717110277636,
      "learning_rate": 3.645255564800234e-05,
      "loss": 1.3629,
      "num_input_tokens_seen": 31068604272,
      "step": 39489
    },
    {
      "epoch": 4.1894759176745175,
      "grad_norm": 0.5664132049490188,
      "learning_rate": 3.6451937886128746e-05,
      "loss": 1.2814,
      "num_input_tokens_seen": 31069391056,
      "step": 39490
    },
    {
      "epoch": 4.189582007214089,
      "grad_norm": 0.7596519358819331,
      "learning_rate": 3.645132011540543e-05,
      "loss": 1.4331,
      "num_input_tokens_seen": 31070177744,
      "step": 39491
    },
    {
      "epoch": 4.1896880967536605,
      "grad_norm": 0.6267271250628447,
      "learning_rate": 3.645070233583287e-05,
      "loss": 1.3133,
      "num_input_tokens_seen": 31070964496,
      "step": 39492
    },
    {
      "epoch": 4.1897941862932315,
      "grad_norm": 0.7299559181593711,
      "learning_rate": 3.645008454741155e-05,
      "loss": 1.4031,
      "num_input_tokens_seen": 31071751200,
      "step": 39493
    },
    {
      "epoch": 4.189900275832803,
      "grad_norm": 0.6664453141677537,
      "learning_rate": 3.644946675014193e-05,
      "loss": 1.4242,
      "num_input_tokens_seen": 31072538032,
      "step": 39494
    },
    {
      "epoch": 4.1900063653723745,
      "grad_norm": 0.6583630798403546,
      "learning_rate": 3.644884894402451e-05,
      "loss": 1.3798,
      "num_input_tokens_seen": 31073324784,
      "step": 39495
    },
    {
      "epoch": 4.1901124549119455,
      "grad_norm": 0.7477455865115578,
      "learning_rate": 3.644823112905975e-05,
      "loss": 1.2773,
      "num_input_tokens_seen": 31074111536,
      "step": 39496
    },
    {
      "epoch": 4.190218544451517,
      "grad_norm": 0.5415195163488463,
      "learning_rate": 3.644761330524813e-05,
      "loss": 1.2199,
      "num_input_tokens_seen": 31074898256,
      "step": 39497
    },
    {
      "epoch": 4.1903246339910885,
      "grad_norm": 0.6327017577952522,
      "learning_rate": 3.644699547259013e-05,
      "loss": 1.3245,
      "num_input_tokens_seen": 31075685024,
      "step": 39498
    },
    {
      "epoch": 4.1904307235306595,
      "grad_norm": 0.6566713976875332,
      "learning_rate": 3.644637763108623e-05,
      "loss": 1.2548,
      "num_input_tokens_seen": 31076471872,
      "step": 39499
    },
    {
      "epoch": 4.190536813070231,
      "grad_norm": 0.5122093024757154,
      "learning_rate": 3.644575978073691e-05,
      "loss": 1.2705,
      "num_input_tokens_seen": 31077258608,
      "step": 39500
    },
    {
      "epoch": 4.190642902609802,
      "grad_norm": 0.6366947657004467,
      "learning_rate": 3.6445141921542634e-05,
      "loss": 1.256,
      "num_input_tokens_seen": 31078045376,
      "step": 39501
    },
    {
      "epoch": 4.190748992149374,
      "grad_norm": 0.5791216605115466,
      "learning_rate": 3.644452405350389e-05,
      "loss": 1.3995,
      "num_input_tokens_seen": 31078832096,
      "step": 39502
    },
    {
      "epoch": 4.190855081688945,
      "grad_norm": 0.5508242691744024,
      "learning_rate": 3.6443906176621164e-05,
      "loss": 1.2714,
      "num_input_tokens_seen": 31079618816,
      "step": 39503
    },
    {
      "epoch": 4.190961171228517,
      "grad_norm": 0.5989945090709382,
      "learning_rate": 3.644328829089491e-05,
      "loss": 1.3463,
      "num_input_tokens_seen": 31080405664,
      "step": 39504
    },
    {
      "epoch": 4.191067260768088,
      "grad_norm": 0.563377135874902,
      "learning_rate": 3.6442670396325626e-05,
      "loss": 1.2976,
      "num_input_tokens_seen": 31081192352,
      "step": 39505
    },
    {
      "epoch": 4.191173350307659,
      "grad_norm": 0.540110232623798,
      "learning_rate": 3.644205249291378e-05,
      "loss": 1.2905,
      "num_input_tokens_seen": 31081979056,
      "step": 39506
    },
    {
      "epoch": 4.191279439847231,
      "grad_norm": 0.7202701172854858,
      "learning_rate": 3.644143458065985e-05,
      "loss": 1.373,
      "num_input_tokens_seen": 31082765824,
      "step": 39507
    },
    {
      "epoch": 4.191385529386802,
      "grad_norm": 0.5433460571717306,
      "learning_rate": 3.644081665956431e-05,
      "loss": 1.2383,
      "num_input_tokens_seen": 31083552656,
      "step": 39508
    },
    {
      "epoch": 4.191491618926374,
      "grad_norm": 0.5188302279356554,
      "learning_rate": 3.6440198729627654e-05,
      "loss": 1.3085,
      "num_input_tokens_seen": 31084339408,
      "step": 39509
    },
    {
      "epoch": 4.191597708465945,
      "grad_norm": 0.5300149800103594,
      "learning_rate": 3.6439580790850344e-05,
      "loss": 1.4079,
      "num_input_tokens_seen": 31085126176,
      "step": 39510
    },
    {
      "epoch": 4.191703798005516,
      "grad_norm": 0.46938823068256635,
      "learning_rate": 3.643896284323286e-05,
      "loss": 1.2544,
      "num_input_tokens_seen": 31085912976,
      "step": 39511
    },
    {
      "epoch": 4.191809887545088,
      "grad_norm": 0.5619040604324735,
      "learning_rate": 3.643834488677568e-05,
      "loss": 1.2023,
      "num_input_tokens_seen": 31086699776,
      "step": 39512
    },
    {
      "epoch": 4.191915977084659,
      "grad_norm": 0.6116716039274196,
      "learning_rate": 3.6437726921479286e-05,
      "loss": 1.3258,
      "num_input_tokens_seen": 31087486592,
      "step": 39513
    },
    {
      "epoch": 4.192022066624231,
      "grad_norm": 0.6420233426524043,
      "learning_rate": 3.643710894734415e-05,
      "loss": 1.3661,
      "num_input_tokens_seen": 31088273296,
      "step": 39514
    },
    {
      "epoch": 4.192128156163802,
      "grad_norm": 0.5537436222319241,
      "learning_rate": 3.643649096437075e-05,
      "loss": 1.2949,
      "num_input_tokens_seen": 31089060128,
      "step": 39515
    },
    {
      "epoch": 4.192234245703373,
      "grad_norm": 0.7639600315910785,
      "learning_rate": 3.643587297255957e-05,
      "loss": 1.3081,
      "num_input_tokens_seen": 31089846848,
      "step": 39516
    },
    {
      "epoch": 4.192340335242945,
      "grad_norm": 0.7071398253020919,
      "learning_rate": 3.643525497191108e-05,
      "loss": 1.4743,
      "num_input_tokens_seen": 31090633584,
      "step": 39517
    },
    {
      "epoch": 4.192446424782516,
      "grad_norm": 0.6668257623104572,
      "learning_rate": 3.643463696242576e-05,
      "loss": 1.3707,
      "num_input_tokens_seen": 31091420400,
      "step": 39518
    },
    {
      "epoch": 4.192552514322088,
      "grad_norm": 0.6957352791712875,
      "learning_rate": 3.6434018944104095e-05,
      "loss": 1.3417,
      "num_input_tokens_seen": 31092207184,
      "step": 39519
    },
    {
      "epoch": 4.192658603861659,
      "grad_norm": 0.5504254373239819,
      "learning_rate": 3.643340091694655e-05,
      "loss": 1.2523,
      "num_input_tokens_seen": 31092993936,
      "step": 39520
    },
    {
      "epoch": 4.192764693401231,
      "grad_norm": 0.6111338926740367,
      "learning_rate": 3.643278288095361e-05,
      "loss": 1.3741,
      "num_input_tokens_seen": 31093780640,
      "step": 39521
    },
    {
      "epoch": 4.192870782940802,
      "grad_norm": 0.6117816760655654,
      "learning_rate": 3.6432164836125746e-05,
      "loss": 1.2856,
      "num_input_tokens_seen": 31094567392,
      "step": 39522
    },
    {
      "epoch": 4.192976872480373,
      "grad_norm": 0.48977848363544924,
      "learning_rate": 3.643154678246345e-05,
      "loss": 1.2644,
      "num_input_tokens_seen": 31095354272,
      "step": 39523
    },
    {
      "epoch": 4.193082962019945,
      "grad_norm": 0.5375255317502406,
      "learning_rate": 3.643092871996718e-05,
      "loss": 1.3865,
      "num_input_tokens_seen": 31096140912,
      "step": 39524
    },
    {
      "epoch": 4.193189051559516,
      "grad_norm": 0.5211359667871994,
      "learning_rate": 3.6430310648637424e-05,
      "loss": 1.2944,
      "num_input_tokens_seen": 31096927696,
      "step": 39525
    },
    {
      "epoch": 4.193295141099088,
      "grad_norm": 0.4782570426169804,
      "learning_rate": 3.642969256847466e-05,
      "loss": 1.3048,
      "num_input_tokens_seen": 31097714512,
      "step": 39526
    },
    {
      "epoch": 4.193401230638659,
      "grad_norm": 0.5094164646609088,
      "learning_rate": 3.6429074479479373e-05,
      "loss": 1.3344,
      "num_input_tokens_seen": 31098501264,
      "step": 39527
    },
    {
      "epoch": 4.19350732017823,
      "grad_norm": 0.4427216578943454,
      "learning_rate": 3.642845638165202e-05,
      "loss": 1.1572,
      "num_input_tokens_seen": 31099288032,
      "step": 39528
    },
    {
      "epoch": 4.193613409717802,
      "grad_norm": 0.46478647035584325,
      "learning_rate": 3.64278382749931e-05,
      "loss": 1.1918,
      "num_input_tokens_seen": 31100074784,
      "step": 39529
    },
    {
      "epoch": 4.193719499257373,
      "grad_norm": 0.5232410102548803,
      "learning_rate": 3.6427220159503084e-05,
      "loss": 1.2751,
      "num_input_tokens_seen": 31100861504,
      "step": 39530
    },
    {
      "epoch": 4.193825588796945,
      "grad_norm": 0.49933299732367303,
      "learning_rate": 3.642660203518244e-05,
      "loss": 1.2479,
      "num_input_tokens_seen": 31101648272,
      "step": 39531
    },
    {
      "epoch": 4.193931678336516,
      "grad_norm": 0.5410595004746352,
      "learning_rate": 3.6425983902031664e-05,
      "loss": 1.3716,
      "num_input_tokens_seen": 31102435072,
      "step": 39532
    },
    {
      "epoch": 4.194037767876088,
      "grad_norm": 0.5354996423268529,
      "learning_rate": 3.642536576005122e-05,
      "loss": 1.2705,
      "num_input_tokens_seen": 31103221696,
      "step": 39533
    },
    {
      "epoch": 4.194143857415659,
      "grad_norm": 0.5127058468682955,
      "learning_rate": 3.642474760924158e-05,
      "loss": 1.3367,
      "num_input_tokens_seen": 31104008384,
      "step": 39534
    },
    {
      "epoch": 4.19424994695523,
      "grad_norm": 0.6057868922790683,
      "learning_rate": 3.6424129449603234e-05,
      "loss": 1.3519,
      "num_input_tokens_seen": 31104795136,
      "step": 39535
    },
    {
      "epoch": 4.194356036494802,
      "grad_norm": 0.5624810471629685,
      "learning_rate": 3.642351128113666e-05,
      "loss": 1.3793,
      "num_input_tokens_seen": 31105581840,
      "step": 39536
    },
    {
      "epoch": 4.194462126034373,
      "grad_norm": 0.5893327716402647,
      "learning_rate": 3.642289310384232e-05,
      "loss": 1.3398,
      "num_input_tokens_seen": 31106368624,
      "step": 39537
    },
    {
      "epoch": 4.194568215573945,
      "grad_norm": 0.46987314685456694,
      "learning_rate": 3.6422274917720714e-05,
      "loss": 1.221,
      "num_input_tokens_seen": 31107155392,
      "step": 39538
    },
    {
      "epoch": 4.194674305113516,
      "grad_norm": 0.5899469915123224,
      "learning_rate": 3.642165672277231e-05,
      "loss": 1.3294,
      "num_input_tokens_seen": 31107942224,
      "step": 39539
    },
    {
      "epoch": 4.194780394653087,
      "grad_norm": 0.5023444976465551,
      "learning_rate": 3.6421038518997585e-05,
      "loss": 1.239,
      "num_input_tokens_seen": 31108729104,
      "step": 39540
    },
    {
      "epoch": 4.194886484192659,
      "grad_norm": 0.4896932755483352,
      "learning_rate": 3.6420420306397014e-05,
      "loss": 1.1653,
      "num_input_tokens_seen": 31109515984,
      "step": 39541
    },
    {
      "epoch": 4.19499257373223,
      "grad_norm": 0.5635371390464714,
      "learning_rate": 3.641980208497107e-05,
      "loss": 1.383,
      "num_input_tokens_seen": 31110302672,
      "step": 39542
    },
    {
      "epoch": 4.195098663271802,
      "grad_norm": 0.5172398914161043,
      "learning_rate": 3.641918385472025e-05,
      "loss": 1.2783,
      "num_input_tokens_seen": 31111089456,
      "step": 39543
    },
    {
      "epoch": 4.195204752811373,
      "grad_norm": 0.5843264445621601,
      "learning_rate": 3.6418565615645015e-05,
      "loss": 1.3867,
      "num_input_tokens_seen": 31111876240,
      "step": 39544
    },
    {
      "epoch": 4.195310842350944,
      "grad_norm": 0.5700137150979372,
      "learning_rate": 3.641794736774584e-05,
      "loss": 1.2979,
      "num_input_tokens_seen": 31112663056,
      "step": 39545
    },
    {
      "epoch": 4.195416931890516,
      "grad_norm": 0.5174935142282681,
      "learning_rate": 3.6417329111023224e-05,
      "loss": 1.3679,
      "num_input_tokens_seen": 31113449872,
      "step": 39546
    },
    {
      "epoch": 4.195523021430087,
      "grad_norm": 0.5113391473451487,
      "learning_rate": 3.6416710845477626e-05,
      "loss": 1.2419,
      "num_input_tokens_seen": 31114236704,
      "step": 39547
    },
    {
      "epoch": 4.195629110969659,
      "grad_norm": 0.6829415098411612,
      "learning_rate": 3.641609257110952e-05,
      "loss": 1.3212,
      "num_input_tokens_seen": 31115023456,
      "step": 39548
    },
    {
      "epoch": 4.19573520050923,
      "grad_norm": 0.48205608997170546,
      "learning_rate": 3.641547428791941e-05,
      "loss": 1.3903,
      "num_input_tokens_seen": 31115810176,
      "step": 39549
    },
    {
      "epoch": 4.195841290048802,
      "grad_norm": 0.5078730068150609,
      "learning_rate": 3.641485599590774e-05,
      "loss": 1.2278,
      "num_input_tokens_seen": 31116596960,
      "step": 39550
    },
    {
      "epoch": 4.195947379588373,
      "grad_norm": 0.5924083115820786,
      "learning_rate": 3.641423769507501e-05,
      "loss": 1.416,
      "num_input_tokens_seen": 31117383728,
      "step": 39551
    },
    {
      "epoch": 4.196053469127944,
      "grad_norm": 0.5710702930230436,
      "learning_rate": 3.6413619385421694e-05,
      "loss": 1.3797,
      "num_input_tokens_seen": 31118170448,
      "step": 39552
    },
    {
      "epoch": 4.1961595586675156,
      "grad_norm": 0.5222162119052666,
      "learning_rate": 3.641300106694827e-05,
      "loss": 1.2905,
      "num_input_tokens_seen": 31118957264,
      "step": 39553
    },
    {
      "epoch": 4.196265648207087,
      "grad_norm": 0.6933026162605664,
      "learning_rate": 3.6412382739655205e-05,
      "loss": 1.3674,
      "num_input_tokens_seen": 31119744000,
      "step": 39554
    },
    {
      "epoch": 4.1963717377466585,
      "grad_norm": 0.5138256328722953,
      "learning_rate": 3.6411764403542994e-05,
      "loss": 1.4052,
      "num_input_tokens_seen": 31120530816,
      "step": 39555
    },
    {
      "epoch": 4.1964778272862295,
      "grad_norm": 0.7120010496683911,
      "learning_rate": 3.64111460586121e-05,
      "loss": 1.3132,
      "num_input_tokens_seen": 31121317584,
      "step": 39556
    },
    {
      "epoch": 4.196583916825801,
      "grad_norm": 0.5817453539104417,
      "learning_rate": 3.641052770486301e-05,
      "loss": 1.338,
      "num_input_tokens_seen": 31122104352,
      "step": 39557
    },
    {
      "epoch": 4.1966900063653725,
      "grad_norm": 0.509706482826031,
      "learning_rate": 3.6409909342296195e-05,
      "loss": 1.3501,
      "num_input_tokens_seen": 31122891072,
      "step": 39558
    },
    {
      "epoch": 4.1967960959049435,
      "grad_norm": 0.5339346460263114,
      "learning_rate": 3.640929097091215e-05,
      "loss": 1.3534,
      "num_input_tokens_seen": 31123677936,
      "step": 39559
    },
    {
      "epoch": 4.196902185444515,
      "grad_norm": 0.5004410705743049,
      "learning_rate": 3.6408672590711324e-05,
      "loss": 1.2504,
      "num_input_tokens_seen": 31124464656,
      "step": 39560
    },
    {
      "epoch": 4.1970082749840865,
      "grad_norm": 0.5942843325722781,
      "learning_rate": 3.640805420169422e-05,
      "loss": 1.3432,
      "num_input_tokens_seen": 31125251488,
      "step": 39561
    },
    {
      "epoch": 4.197114364523658,
      "grad_norm": 0.5646297955272449,
      "learning_rate": 3.64074358038613e-05,
      "loss": 1.2167,
      "num_input_tokens_seen": 31126038336,
      "step": 39562
    },
    {
      "epoch": 4.197220454063229,
      "grad_norm": 0.5228418210960656,
      "learning_rate": 3.640681739721305e-05,
      "loss": 1.3518,
      "num_input_tokens_seen": 31126825040,
      "step": 39563
    },
    {
      "epoch": 4.1973265436028,
      "grad_norm": 0.4986452664611608,
      "learning_rate": 3.640619898174995e-05,
      "loss": 1.2109,
      "num_input_tokens_seen": 31127611840,
      "step": 39564
    },
    {
      "epoch": 4.197432633142372,
      "grad_norm": 0.5854091408418437,
      "learning_rate": 3.640558055747247e-05,
      "loss": 1.4187,
      "num_input_tokens_seen": 31128398528,
      "step": 39565
    },
    {
      "epoch": 4.197538722681943,
      "grad_norm": 0.535651626345935,
      "learning_rate": 3.6404962124381093e-05,
      "loss": 1.206,
      "num_input_tokens_seen": 31129185264,
      "step": 39566
    },
    {
      "epoch": 4.197644812221515,
      "grad_norm": 0.5130706245445656,
      "learning_rate": 3.6404343682476296e-05,
      "loss": 1.1657,
      "num_input_tokens_seen": 31129972128,
      "step": 39567
    },
    {
      "epoch": 4.197750901761086,
      "grad_norm": 0.4658945981053798,
      "learning_rate": 3.6403725231758555e-05,
      "loss": 1.3107,
      "num_input_tokens_seen": 31130758864,
      "step": 39568
    },
    {
      "epoch": 4.197856991300657,
      "grad_norm": 0.5380839111062345,
      "learning_rate": 3.640310677222836e-05,
      "loss": 1.2805,
      "num_input_tokens_seen": 31131545552,
      "step": 39569
    },
    {
      "epoch": 4.197963080840229,
      "grad_norm": 0.5085588254093388,
      "learning_rate": 3.640248830388617e-05,
      "loss": 1.3715,
      "num_input_tokens_seen": 31132332384,
      "step": 39570
    },
    {
      "epoch": 4.1980691703798,
      "grad_norm": 0.6000672513863684,
      "learning_rate": 3.640186982673247e-05,
      "loss": 1.3767,
      "num_input_tokens_seen": 31133119088,
      "step": 39571
    },
    {
      "epoch": 4.198175259919372,
      "grad_norm": 0.4880686529620165,
      "learning_rate": 3.6401251340767744e-05,
      "loss": 1.2733,
      "num_input_tokens_seen": 31133905856,
      "step": 39572
    },
    {
      "epoch": 4.198281349458943,
      "grad_norm": 0.8098654745429313,
      "learning_rate": 3.6400632845992465e-05,
      "loss": 1.425,
      "num_input_tokens_seen": 31134692592,
      "step": 39573
    },
    {
      "epoch": 4.198387438998514,
      "grad_norm": 0.5331253706340027,
      "learning_rate": 3.640001434240711e-05,
      "loss": 1.3623,
      "num_input_tokens_seen": 31135479328,
      "step": 39574
    },
    {
      "epoch": 4.198493528538086,
      "grad_norm": 0.4716393768032364,
      "learning_rate": 3.639939583001216e-05,
      "loss": 1.3203,
      "num_input_tokens_seen": 31136266064,
      "step": 39575
    },
    {
      "epoch": 4.198599618077657,
      "grad_norm": 0.6379361713319728,
      "learning_rate": 3.63987773088081e-05,
      "loss": 1.4404,
      "num_input_tokens_seen": 31137052720,
      "step": 39576
    },
    {
      "epoch": 4.198705707617229,
      "grad_norm": 0.49804618983488885,
      "learning_rate": 3.6398158778795375e-05,
      "loss": 1.318,
      "num_input_tokens_seen": 31137839536,
      "step": 39577
    },
    {
      "epoch": 4.1988117971568,
      "grad_norm": 0.6516689931541041,
      "learning_rate": 3.639754023997451e-05,
      "loss": 1.3518,
      "num_input_tokens_seen": 31138626224,
      "step": 39578
    },
    {
      "epoch": 4.198917886696372,
      "grad_norm": 0.468226277298204,
      "learning_rate": 3.6396921692345955e-05,
      "loss": 1.3166,
      "num_input_tokens_seen": 31139412960,
      "step": 39579
    },
    {
      "epoch": 4.199023976235943,
      "grad_norm": 0.5911765164237284,
      "learning_rate": 3.639630313591018e-05,
      "loss": 1.3384,
      "num_input_tokens_seen": 31140199712,
      "step": 39580
    },
    {
      "epoch": 4.199130065775514,
      "grad_norm": 0.5053306372504619,
      "learning_rate": 3.639568457066769e-05,
      "loss": 1.4113,
      "num_input_tokens_seen": 31140986448,
      "step": 39581
    },
    {
      "epoch": 4.199236155315086,
      "grad_norm": 0.45855297587203747,
      "learning_rate": 3.639506599661895e-05,
      "loss": 1.3055,
      "num_input_tokens_seen": 31141773216,
      "step": 39582
    },
    {
      "epoch": 4.199342244854657,
      "grad_norm": 0.6447127961819688,
      "learning_rate": 3.6394447413764435e-05,
      "loss": 1.3316,
      "num_input_tokens_seen": 31142559968,
      "step": 39583
    },
    {
      "epoch": 4.199448334394229,
      "grad_norm": 0.5043055266138255,
      "learning_rate": 3.6393828822104626e-05,
      "loss": 1.3541,
      "num_input_tokens_seen": 31143346720,
      "step": 39584
    },
    {
      "epoch": 4.1995544239338,
      "grad_norm": 0.6087746696302822,
      "learning_rate": 3.639321022164e-05,
      "loss": 1.4061,
      "num_input_tokens_seen": 31144133536,
      "step": 39585
    },
    {
      "epoch": 4.199660513473371,
      "grad_norm": 0.48117748143060546,
      "learning_rate": 3.639259161237103e-05,
      "loss": 1.2446,
      "num_input_tokens_seen": 31144920304,
      "step": 39586
    },
    {
      "epoch": 4.199766603012943,
      "grad_norm": 0.49747763093131053,
      "learning_rate": 3.63919729942982e-05,
      "loss": 1.3598,
      "num_input_tokens_seen": 31145707056,
      "step": 39587
    },
    {
      "epoch": 4.199872692552514,
      "grad_norm": 0.5666089286998277,
      "learning_rate": 3.6391354367421994e-05,
      "loss": 1.3202,
      "num_input_tokens_seen": 31146493856,
      "step": 39588
    },
    {
      "epoch": 4.199978782092086,
      "grad_norm": 0.5253285112041748,
      "learning_rate": 3.639073573174287e-05,
      "loss": 1.348,
      "num_input_tokens_seen": 31147280576,
      "step": 39589
    },
    {
      "epoch": 4.200084871631657,
      "grad_norm": 0.51604119659781,
      "learning_rate": 3.6390117087261337e-05,
      "loss": 1.241,
      "num_input_tokens_seen": 31148067392,
      "step": 39590
    },
    {
      "epoch": 4.200190961171229,
      "grad_norm": 0.4410754971138395,
      "learning_rate": 3.638949843397785e-05,
      "loss": 1.1752,
      "num_input_tokens_seen": 31148854160,
      "step": 39591
    },
    {
      "epoch": 4.2002970507108,
      "grad_norm": 0.5943705832834663,
      "learning_rate": 3.6388879771892894e-05,
      "loss": 1.2521,
      "num_input_tokens_seen": 31149640896,
      "step": 39592
    },
    {
      "epoch": 4.200403140250371,
      "grad_norm": 0.5497831998701935,
      "learning_rate": 3.638826110100694e-05,
      "loss": 1.3716,
      "num_input_tokens_seen": 31150427600,
      "step": 39593
    },
    {
      "epoch": 4.200509229789943,
      "grad_norm": 0.5590782455531723,
      "learning_rate": 3.6387642421320475e-05,
      "loss": 1.3134,
      "num_input_tokens_seen": 31151214384,
      "step": 39594
    },
    {
      "epoch": 4.200615319329514,
      "grad_norm": 0.4930934347466966,
      "learning_rate": 3.638702373283398e-05,
      "loss": 1.2049,
      "num_input_tokens_seen": 31152001136,
      "step": 39595
    },
    {
      "epoch": 4.200721408869086,
      "grad_norm": 0.5443300519859168,
      "learning_rate": 3.638640503554792e-05,
      "loss": 1.2221,
      "num_input_tokens_seen": 31152787920,
      "step": 39596
    },
    {
      "epoch": 4.200827498408657,
      "grad_norm": 0.48480811798695933,
      "learning_rate": 3.638578632946278e-05,
      "loss": 1.2934,
      "num_input_tokens_seen": 31153574704,
      "step": 39597
    },
    {
      "epoch": 4.200933587948228,
      "grad_norm": 0.540193964479918,
      "learning_rate": 3.638516761457904e-05,
      "loss": 1.3042,
      "num_input_tokens_seen": 31154361456,
      "step": 39598
    },
    {
      "epoch": 4.2010396774878,
      "grad_norm": 0.5052896508690733,
      "learning_rate": 3.638454889089718e-05,
      "loss": 1.3538,
      "num_input_tokens_seen": 31155148144,
      "step": 39599
    },
    {
      "epoch": 4.201145767027371,
      "grad_norm": 0.506340938861941,
      "learning_rate": 3.638393015841767e-05,
      "loss": 1.2874,
      "num_input_tokens_seen": 31155934880,
      "step": 39600
    },
    {
      "epoch": 4.201251856566943,
      "grad_norm": 0.5681251131549958,
      "learning_rate": 3.6383311417141e-05,
      "loss": 1.3498,
      "num_input_tokens_seen": 31156721600,
      "step": 39601
    },
    {
      "epoch": 4.201357946106514,
      "grad_norm": 0.5501439400159954,
      "learning_rate": 3.638269266706762e-05,
      "loss": 1.2643,
      "num_input_tokens_seen": 31157508304,
      "step": 39602
    },
    {
      "epoch": 4.201464035646085,
      "grad_norm": 0.5092187388236319,
      "learning_rate": 3.638207390819805e-05,
      "loss": 1.255,
      "num_input_tokens_seen": 31158295136,
      "step": 39603
    },
    {
      "epoch": 4.201570125185657,
      "grad_norm": 0.495864680442121,
      "learning_rate": 3.638145514053274e-05,
      "loss": 1.2838,
      "num_input_tokens_seen": 31159081920,
      "step": 39604
    },
    {
      "epoch": 4.201676214725228,
      "grad_norm": 0.5235330718995049,
      "learning_rate": 3.6380836364072177e-05,
      "loss": 1.3943,
      "num_input_tokens_seen": 31159868704,
      "step": 39605
    },
    {
      "epoch": 4.2017823042648,
      "grad_norm": 0.5525217094239571,
      "learning_rate": 3.638021757881684e-05,
      "loss": 1.3217,
      "num_input_tokens_seen": 31160655392,
      "step": 39606
    },
    {
      "epoch": 4.201888393804371,
      "grad_norm": 0.5829252700638919,
      "learning_rate": 3.63795987847672e-05,
      "loss": 1.3639,
      "num_input_tokens_seen": 31161442224,
      "step": 39607
    },
    {
      "epoch": 4.201994483343943,
      "grad_norm": 0.5088466800020043,
      "learning_rate": 3.6378979981923745e-05,
      "loss": 1.2902,
      "num_input_tokens_seen": 31162228928,
      "step": 39608
    },
    {
      "epoch": 4.202100572883514,
      "grad_norm": 0.5404508672874629,
      "learning_rate": 3.6378361170286945e-05,
      "loss": 1.3932,
      "num_input_tokens_seen": 31163015648,
      "step": 39609
    },
    {
      "epoch": 4.202206662423085,
      "grad_norm": 0.4824536566512187,
      "learning_rate": 3.637774234985728e-05,
      "loss": 1.1432,
      "num_input_tokens_seen": 31163802560,
      "step": 39610
    },
    {
      "epoch": 4.202312751962657,
      "grad_norm": 0.5309506989600218,
      "learning_rate": 3.6377123520635236e-05,
      "loss": 1.3372,
      "num_input_tokens_seen": 31164589328,
      "step": 39611
    },
    {
      "epoch": 4.202418841502228,
      "grad_norm": 0.496953505922913,
      "learning_rate": 3.6376504682621275e-05,
      "loss": 1.33,
      "num_input_tokens_seen": 31165376112,
      "step": 39612
    },
    {
      "epoch": 4.2025249310418,
      "grad_norm": 0.5881217423685471,
      "learning_rate": 3.637588583581589e-05,
      "loss": 1.3754,
      "num_input_tokens_seen": 31166162912,
      "step": 39613
    },
    {
      "epoch": 4.202631020581371,
      "grad_norm": 0.5536556018028326,
      "learning_rate": 3.637526698021956e-05,
      "loss": 1.3609,
      "num_input_tokens_seen": 31166949632,
      "step": 39614
    },
    {
      "epoch": 4.2027371101209425,
      "grad_norm": 0.49586835668570706,
      "learning_rate": 3.637464811583275e-05,
      "loss": 1.2915,
      "num_input_tokens_seen": 31167736432,
      "step": 39615
    },
    {
      "epoch": 4.202843199660514,
      "grad_norm": 0.4799153012904485,
      "learning_rate": 3.6374029242655946e-05,
      "loss": 1.3461,
      "num_input_tokens_seen": 31168523152,
      "step": 39616
    },
    {
      "epoch": 4.202949289200085,
      "grad_norm": 0.4597708957739705,
      "learning_rate": 3.637341036068963e-05,
      "loss": 1.2156,
      "num_input_tokens_seen": 31169309952,
      "step": 39617
    },
    {
      "epoch": 4.2030553787396565,
      "grad_norm": 0.6341111345346241,
      "learning_rate": 3.637279146993427e-05,
      "loss": 1.3473,
      "num_input_tokens_seen": 31170096656,
      "step": 39618
    },
    {
      "epoch": 4.2031614682792275,
      "grad_norm": 0.5003042129971412,
      "learning_rate": 3.6372172570390354e-05,
      "loss": 1.3849,
      "num_input_tokens_seen": 31170883344,
      "step": 39619
    },
    {
      "epoch": 4.2032675578187995,
      "grad_norm": 0.6098742395527765,
      "learning_rate": 3.6371553662058354e-05,
      "loss": 1.3736,
      "num_input_tokens_seen": 31171670048,
      "step": 39620
    },
    {
      "epoch": 4.2033736473583705,
      "grad_norm": 0.47032540961917807,
      "learning_rate": 3.637093474493876e-05,
      "loss": 1.3005,
      "num_input_tokens_seen": 31172456832,
      "step": 39621
    },
    {
      "epoch": 4.2034797368979415,
      "grad_norm": 0.7912192960863029,
      "learning_rate": 3.637031581903204e-05,
      "loss": 1.3388,
      "num_input_tokens_seen": 31173243568,
      "step": 39622
    },
    {
      "epoch": 4.203585826437513,
      "grad_norm": 0.5723845666317356,
      "learning_rate": 3.6369696884338664e-05,
      "loss": 1.3471,
      "num_input_tokens_seen": 31174030336,
      "step": 39623
    },
    {
      "epoch": 4.2036919159770845,
      "grad_norm": 0.653293172524503,
      "learning_rate": 3.636907794085912e-05,
      "loss": 1.3107,
      "num_input_tokens_seen": 31174817120,
      "step": 39624
    },
    {
      "epoch": 4.203798005516656,
      "grad_norm": 0.7174459111323338,
      "learning_rate": 3.636845898859389e-05,
      "loss": 1.2477,
      "num_input_tokens_seen": 31175603904,
      "step": 39625
    },
    {
      "epoch": 4.203904095056227,
      "grad_norm": 0.4941495513638307,
      "learning_rate": 3.6367840027543455e-05,
      "loss": 1.3236,
      "num_input_tokens_seen": 31176390592,
      "step": 39626
    },
    {
      "epoch": 4.2040101845957984,
      "grad_norm": 0.5141950860746849,
      "learning_rate": 3.636722105770828e-05,
      "loss": 1.3073,
      "num_input_tokens_seen": 31177177360,
      "step": 39627
    },
    {
      "epoch": 4.20411627413537,
      "grad_norm": 0.6813847071800079,
      "learning_rate": 3.6366602079088846e-05,
      "loss": 1.3839,
      "num_input_tokens_seen": 31177964032,
      "step": 39628
    },
    {
      "epoch": 4.204222363674941,
      "grad_norm": 0.8565111680024031,
      "learning_rate": 3.636598309168564e-05,
      "loss": 1.437,
      "num_input_tokens_seen": 31178750720,
      "step": 39629
    },
    {
      "epoch": 4.204328453214513,
      "grad_norm": 0.46355779192303026,
      "learning_rate": 3.636536409549915e-05,
      "loss": 1.321,
      "num_input_tokens_seen": 31179537536,
      "step": 39630
    },
    {
      "epoch": 4.204434542754084,
      "grad_norm": 0.8999573964744161,
      "learning_rate": 3.6364745090529815e-05,
      "loss": 1.1522,
      "num_input_tokens_seen": 31180324352,
      "step": 39631
    },
    {
      "epoch": 4.204540632293656,
      "grad_norm": 0.6912353853205204,
      "learning_rate": 3.636412607677815e-05,
      "loss": 1.2998,
      "num_input_tokens_seen": 31181111088,
      "step": 39632
    },
    {
      "epoch": 4.204646721833227,
      "grad_norm": 0.4913205675624018,
      "learning_rate": 3.6363507054244624e-05,
      "loss": 1.29,
      "num_input_tokens_seen": 31181897824,
      "step": 39633
    },
    {
      "epoch": 4.204752811372798,
      "grad_norm": 0.8018935744704767,
      "learning_rate": 3.636288802292971e-05,
      "loss": 1.2452,
      "num_input_tokens_seen": 31182684704,
      "step": 39634
    },
    {
      "epoch": 4.20485890091237,
      "grad_norm": 0.8480194384738624,
      "learning_rate": 3.636226898283389e-05,
      "loss": 1.3465,
      "num_input_tokens_seen": 31183471536,
      "step": 39635
    },
    {
      "epoch": 4.204964990451941,
      "grad_norm": 0.527094887013893,
      "learning_rate": 3.6361649933957645e-05,
      "loss": 1.4411,
      "num_input_tokens_seen": 31184258320,
      "step": 39636
    },
    {
      "epoch": 4.205071079991513,
      "grad_norm": 0.8743226622329,
      "learning_rate": 3.636103087630144e-05,
      "loss": 1.2422,
      "num_input_tokens_seen": 31185045088,
      "step": 39637
    },
    {
      "epoch": 4.205177169531084,
      "grad_norm": 0.6885436332281413,
      "learning_rate": 3.636041180986578e-05,
      "loss": 1.3103,
      "num_input_tokens_seen": 31185831728,
      "step": 39638
    },
    {
      "epoch": 4.205283259070655,
      "grad_norm": 0.521466262448004,
      "learning_rate": 3.635979273465112e-05,
      "loss": 1.3931,
      "num_input_tokens_seen": 31186618480,
      "step": 39639
    },
    {
      "epoch": 4.205389348610227,
      "grad_norm": 1.045831578769566,
      "learning_rate": 3.6359173650657935e-05,
      "loss": 1.3381,
      "num_input_tokens_seen": 31187405184,
      "step": 39640
    },
    {
      "epoch": 4.205495438149798,
      "grad_norm": 0.6774982563641242,
      "learning_rate": 3.6358554557886726e-05,
      "loss": 1.3754,
      "num_input_tokens_seen": 31188192016,
      "step": 39641
    },
    {
      "epoch": 4.20560152768937,
      "grad_norm": 0.6812759932612248,
      "learning_rate": 3.635793545633796e-05,
      "loss": 1.43,
      "num_input_tokens_seen": 31188978688,
      "step": 39642
    },
    {
      "epoch": 4.205707617228941,
      "grad_norm": 0.7443088179309247,
      "learning_rate": 3.635731634601211e-05,
      "loss": 1.2136,
      "num_input_tokens_seen": 31189765536,
      "step": 39643
    },
    {
      "epoch": 4.205813706768513,
      "grad_norm": 0.6344859465518176,
      "learning_rate": 3.635669722690966e-05,
      "loss": 1.2524,
      "num_input_tokens_seen": 31190552256,
      "step": 39644
    },
    {
      "epoch": 4.205919796308084,
      "grad_norm": 0.5982867585887673,
      "learning_rate": 3.635607809903108e-05,
      "loss": 1.337,
      "num_input_tokens_seen": 31191338960,
      "step": 39645
    },
    {
      "epoch": 4.206025885847655,
      "grad_norm": 0.7578501127361797,
      "learning_rate": 3.6355458962376866e-05,
      "loss": 1.4122,
      "num_input_tokens_seen": 31192125728,
      "step": 39646
    },
    {
      "epoch": 4.206131975387227,
      "grad_norm": 0.5818505198838952,
      "learning_rate": 3.635483981694749e-05,
      "loss": 1.249,
      "num_input_tokens_seen": 31192912448,
      "step": 39647
    },
    {
      "epoch": 4.206238064926798,
      "grad_norm": 0.6477077752488707,
      "learning_rate": 3.635422066274341e-05,
      "loss": 1.3121,
      "num_input_tokens_seen": 31193699264,
      "step": 39648
    },
    {
      "epoch": 4.20634415446637,
      "grad_norm": 0.6560090623449335,
      "learning_rate": 3.635360149976514e-05,
      "loss": 1.4862,
      "num_input_tokens_seen": 31194485984,
      "step": 39649
    },
    {
      "epoch": 4.206450244005941,
      "grad_norm": 0.5246887790659274,
      "learning_rate": 3.6352982328013136e-05,
      "loss": 1.3798,
      "num_input_tokens_seen": 31195272688,
      "step": 39650
    },
    {
      "epoch": 4.206556333545512,
      "grad_norm": 0.731800909599901,
      "learning_rate": 3.635236314748787e-05,
      "loss": 1.3755,
      "num_input_tokens_seen": 31196059488,
      "step": 39651
    },
    {
      "epoch": 4.206662423085084,
      "grad_norm": 0.5951646795551615,
      "learning_rate": 3.635174395818983e-05,
      "loss": 1.3584,
      "num_input_tokens_seen": 31196846256,
      "step": 39652
    },
    {
      "epoch": 4.206768512624655,
      "grad_norm": 0.561064684453265,
      "learning_rate": 3.635112476011951e-05,
      "loss": 1.3007,
      "num_input_tokens_seen": 31197633104,
      "step": 39653
    },
    {
      "epoch": 4.206874602164227,
      "grad_norm": 0.7226135145680612,
      "learning_rate": 3.635050555327737e-05,
      "loss": 1.3177,
      "num_input_tokens_seen": 31198419856,
      "step": 39654
    },
    {
      "epoch": 4.206980691703798,
      "grad_norm": 0.49850868826164196,
      "learning_rate": 3.634988633766389e-05,
      "loss": 1.2329,
      "num_input_tokens_seen": 31199206608,
      "step": 39655
    },
    {
      "epoch": 4.207086781243369,
      "grad_norm": 0.6437006739368769,
      "learning_rate": 3.634926711327955e-05,
      "loss": 1.3756,
      "num_input_tokens_seen": 31199993392,
      "step": 39656
    },
    {
      "epoch": 4.207192870782941,
      "grad_norm": 0.46852562734676406,
      "learning_rate": 3.634864788012482e-05,
      "loss": 1.3719,
      "num_input_tokens_seen": 31200780144,
      "step": 39657
    },
    {
      "epoch": 4.207298960322512,
      "grad_norm": 0.508979297080114,
      "learning_rate": 3.63480286382002e-05,
      "loss": 1.2934,
      "num_input_tokens_seen": 31201566912,
      "step": 39658
    },
    {
      "epoch": 4.207405049862084,
      "grad_norm": 0.5190053731723163,
      "learning_rate": 3.634740938750616e-05,
      "loss": 1.3191,
      "num_input_tokens_seen": 31202353664,
      "step": 39659
    },
    {
      "epoch": 4.207511139401655,
      "grad_norm": 0.508623724500119,
      "learning_rate": 3.634679012804316e-05,
      "loss": 1.258,
      "num_input_tokens_seen": 31203140352,
      "step": 39660
    },
    {
      "epoch": 4.207617228941227,
      "grad_norm": 0.5221611429065531,
      "learning_rate": 3.6346170859811705e-05,
      "loss": 1.2772,
      "num_input_tokens_seen": 31203927120,
      "step": 39661
    },
    {
      "epoch": 4.207723318480798,
      "grad_norm": 0.47606579737620486,
      "learning_rate": 3.634555158281227e-05,
      "loss": 1.2913,
      "num_input_tokens_seen": 31204713840,
      "step": 39662
    },
    {
      "epoch": 4.207829408020369,
      "grad_norm": 0.5384549074760347,
      "learning_rate": 3.6344932297045306e-05,
      "loss": 1.3031,
      "num_input_tokens_seen": 31205500672,
      "step": 39663
    },
    {
      "epoch": 4.207935497559941,
      "grad_norm": 0.4889848512509541,
      "learning_rate": 3.634431300251132e-05,
      "loss": 1.3319,
      "num_input_tokens_seen": 31206287488,
      "step": 39664
    },
    {
      "epoch": 4.208041587099512,
      "grad_norm": 0.47225141985694563,
      "learning_rate": 3.634369369921079e-05,
      "loss": 1.1876,
      "num_input_tokens_seen": 31207074320,
      "step": 39665
    },
    {
      "epoch": 4.208147676639084,
      "grad_norm": 0.8486833534316056,
      "learning_rate": 3.634307438714417e-05,
      "loss": 1.3355,
      "num_input_tokens_seen": 31207861136,
      "step": 39666
    },
    {
      "epoch": 4.208253766178655,
      "grad_norm": 0.55879632262834,
      "learning_rate": 3.634245506631196e-05,
      "loss": 1.3831,
      "num_input_tokens_seen": 31208647904,
      "step": 39667
    },
    {
      "epoch": 4.208359855718226,
      "grad_norm": 0.6766617836860599,
      "learning_rate": 3.634183573671464e-05,
      "loss": 1.2704,
      "num_input_tokens_seen": 31209434672,
      "step": 39668
    },
    {
      "epoch": 4.208465945257798,
      "grad_norm": 0.4776311545845351,
      "learning_rate": 3.634121639835268e-05,
      "loss": 1.2921,
      "num_input_tokens_seen": 31210221408,
      "step": 39669
    },
    {
      "epoch": 4.208572034797369,
      "grad_norm": 0.5661839086750224,
      "learning_rate": 3.634059705122656e-05,
      "loss": 1.3827,
      "num_input_tokens_seen": 31211008192,
      "step": 39670
    },
    {
      "epoch": 4.208678124336941,
      "grad_norm": 0.6737406644202527,
      "learning_rate": 3.633997769533676e-05,
      "loss": 1.3878,
      "num_input_tokens_seen": 31211794912,
      "step": 39671
    },
    {
      "epoch": 4.208784213876512,
      "grad_norm": 0.5094270558335722,
      "learning_rate": 3.6339358330683755e-05,
      "loss": 1.3143,
      "num_input_tokens_seen": 31212581728,
      "step": 39672
    },
    {
      "epoch": 4.208890303416084,
      "grad_norm": 0.5574053440234892,
      "learning_rate": 3.633873895726803e-05,
      "loss": 1.3784,
      "num_input_tokens_seen": 31213368432,
      "step": 39673
    },
    {
      "epoch": 4.208996392955655,
      "grad_norm": 0.5938403657517728,
      "learning_rate": 3.6338119575090054e-05,
      "loss": 1.254,
      "num_input_tokens_seen": 31214155232,
      "step": 39674
    },
    {
      "epoch": 4.209102482495226,
      "grad_norm": 0.6012948227324175,
      "learning_rate": 3.633750018415032e-05,
      "loss": 1.4352,
      "num_input_tokens_seen": 31214941936,
      "step": 39675
    },
    {
      "epoch": 4.209208572034798,
      "grad_norm": 0.6041150042619914,
      "learning_rate": 3.6336880784449294e-05,
      "loss": 1.3309,
      "num_input_tokens_seen": 31215728688,
      "step": 39676
    },
    {
      "epoch": 4.209314661574369,
      "grad_norm": 0.620686894374782,
      "learning_rate": 3.6336261375987456e-05,
      "loss": 1.3923,
      "num_input_tokens_seen": 31216515440,
      "step": 39677
    },
    {
      "epoch": 4.2094207511139405,
      "grad_norm": 0.6492162364156269,
      "learning_rate": 3.63356419587653e-05,
      "loss": 1.2548,
      "num_input_tokens_seen": 31217302304,
      "step": 39678
    },
    {
      "epoch": 4.209526840653512,
      "grad_norm": 0.7238687661084318,
      "learning_rate": 3.633502253278329e-05,
      "loss": 1.2756,
      "num_input_tokens_seen": 31218089024,
      "step": 39679
    },
    {
      "epoch": 4.209632930193083,
      "grad_norm": 0.7783931788224002,
      "learning_rate": 3.633440309804189e-05,
      "loss": 1.3364,
      "num_input_tokens_seen": 31218875808,
      "step": 39680
    },
    {
      "epoch": 4.2097390197326545,
      "grad_norm": 0.4973738494889529,
      "learning_rate": 3.6333783654541614e-05,
      "loss": 1.2262,
      "num_input_tokens_seen": 31219662560,
      "step": 39681
    },
    {
      "epoch": 4.2098451092722255,
      "grad_norm": 0.5233737534205134,
      "learning_rate": 3.6333164202282914e-05,
      "loss": 1.2479,
      "num_input_tokens_seen": 31220449280,
      "step": 39682
    },
    {
      "epoch": 4.2099511988117975,
      "grad_norm": 0.6680329303662143,
      "learning_rate": 3.633254474126628e-05,
      "loss": 1.3628,
      "num_input_tokens_seen": 31221236000,
      "step": 39683
    },
    {
      "epoch": 4.2100572883513685,
      "grad_norm": 0.5117515307291435,
      "learning_rate": 3.633192527149219e-05,
      "loss": 1.3966,
      "num_input_tokens_seen": 31222022784,
      "step": 39684
    },
    {
      "epoch": 4.2101633778909395,
      "grad_norm": 0.5888628001281049,
      "learning_rate": 3.633130579296112e-05,
      "loss": 1.3145,
      "num_input_tokens_seen": 31222809488,
      "step": 39685
    },
    {
      "epoch": 4.2102694674305114,
      "grad_norm": 0.7182943936341447,
      "learning_rate": 3.6330686305673546e-05,
      "loss": 1.4627,
      "num_input_tokens_seen": 31223596192,
      "step": 39686
    },
    {
      "epoch": 4.2103755569700825,
      "grad_norm": 0.47725198908590494,
      "learning_rate": 3.633006680962995e-05,
      "loss": 1.2284,
      "num_input_tokens_seen": 31224382960,
      "step": 39687
    },
    {
      "epoch": 4.210481646509654,
      "grad_norm": 0.8334859341016533,
      "learning_rate": 3.6329447304830813e-05,
      "loss": 1.3847,
      "num_input_tokens_seen": 31225169632,
      "step": 39688
    },
    {
      "epoch": 4.210587736049225,
      "grad_norm": 0.8700616724420966,
      "learning_rate": 3.632882779127661e-05,
      "loss": 1.2415,
      "num_input_tokens_seen": 31225956496,
      "step": 39689
    },
    {
      "epoch": 4.210693825588797,
      "grad_norm": 0.6892580547668298,
      "learning_rate": 3.632820826896782e-05,
      "loss": 1.2853,
      "num_input_tokens_seen": 31226743328,
      "step": 39690
    },
    {
      "epoch": 4.210799915128368,
      "grad_norm": 0.835640394032656,
      "learning_rate": 3.632758873790493e-05,
      "loss": 1.3619,
      "num_input_tokens_seen": 31227530032,
      "step": 39691
    },
    {
      "epoch": 4.210906004667939,
      "grad_norm": 0.545686134413497,
      "learning_rate": 3.63269691980884e-05,
      "loss": 1.2343,
      "num_input_tokens_seen": 31228316800,
      "step": 39692
    },
    {
      "epoch": 4.211012094207511,
      "grad_norm": 0.6813548406241894,
      "learning_rate": 3.6326349649518734e-05,
      "loss": 1.2473,
      "num_input_tokens_seen": 31229103616,
      "step": 39693
    },
    {
      "epoch": 4.211118183747082,
      "grad_norm": 0.7471122250854534,
      "learning_rate": 3.6325730092196384e-05,
      "loss": 1.4448,
      "num_input_tokens_seen": 31229890352,
      "step": 39694
    },
    {
      "epoch": 4.211224273286654,
      "grad_norm": 0.5063368621586734,
      "learning_rate": 3.632511052612185e-05,
      "loss": 1.3518,
      "num_input_tokens_seen": 31230677040,
      "step": 39695
    },
    {
      "epoch": 4.211330362826225,
      "grad_norm": 0.5054561612991154,
      "learning_rate": 3.632449095129561e-05,
      "loss": 1.2459,
      "num_input_tokens_seen": 31231463760,
      "step": 39696
    },
    {
      "epoch": 4.211436452365796,
      "grad_norm": 0.9740618510019674,
      "learning_rate": 3.632387136771812e-05,
      "loss": 1.3014,
      "num_input_tokens_seen": 31232250480,
      "step": 39697
    },
    {
      "epoch": 4.211542541905368,
      "grad_norm": 0.613625374232294,
      "learning_rate": 3.632325177538989e-05,
      "loss": 1.3301,
      "num_input_tokens_seen": 31233037200,
      "step": 39698
    },
    {
      "epoch": 4.211648631444939,
      "grad_norm": 0.6722358233148455,
      "learning_rate": 3.632263217431137e-05,
      "loss": 1.2678,
      "num_input_tokens_seen": 31233823936,
      "step": 39699
    },
    {
      "epoch": 4.211754720984511,
      "grad_norm": 0.997052461476087,
      "learning_rate": 3.632201256448305e-05,
      "loss": 1.2893,
      "num_input_tokens_seen": 31234610640,
      "step": 39700
    },
    {
      "epoch": 4.211860810524082,
      "grad_norm": 0.6895850358358382,
      "learning_rate": 3.632139294590542e-05,
      "loss": 1.3437,
      "num_input_tokens_seen": 31235397424,
      "step": 39701
    },
    {
      "epoch": 4.211966900063654,
      "grad_norm": 0.892322965597365,
      "learning_rate": 3.632077331857895e-05,
      "loss": 1.3566,
      "num_input_tokens_seen": 31236184112,
      "step": 39702
    },
    {
      "epoch": 4.212072989603225,
      "grad_norm": 0.7742140314461272,
      "learning_rate": 3.632015368250412e-05,
      "loss": 1.4315,
      "num_input_tokens_seen": 31236970880,
      "step": 39703
    },
    {
      "epoch": 4.212179079142796,
      "grad_norm": 0.6115565797274134,
      "learning_rate": 3.63195340376814e-05,
      "loss": 1.4275,
      "num_input_tokens_seen": 31237757744,
      "step": 39704
    },
    {
      "epoch": 4.212285168682368,
      "grad_norm": 0.7332719274717869,
      "learning_rate": 3.631891438411128e-05,
      "loss": 1.3736,
      "num_input_tokens_seen": 31238544528,
      "step": 39705
    },
    {
      "epoch": 4.212391258221939,
      "grad_norm": 0.7796321567754595,
      "learning_rate": 3.631829472179423e-05,
      "loss": 1.318,
      "num_input_tokens_seen": 31239331312,
      "step": 39706
    },
    {
      "epoch": 4.212497347761511,
      "grad_norm": 0.9892803290591161,
      "learning_rate": 3.6317675050730746e-05,
      "loss": 1.3911,
      "num_input_tokens_seen": 31240118080,
      "step": 39707
    },
    {
      "epoch": 4.212603437301082,
      "grad_norm": 0.5468023093472086,
      "learning_rate": 3.6317055370921286e-05,
      "loss": 1.2691,
      "num_input_tokens_seen": 31240904928,
      "step": 39708
    },
    {
      "epoch": 4.212709526840653,
      "grad_norm": 0.5555699312995236,
      "learning_rate": 3.631643568236634e-05,
      "loss": 1.2421,
      "num_input_tokens_seen": 31241691728,
      "step": 39709
    },
    {
      "epoch": 4.212815616380225,
      "grad_norm": 0.5396609518041399,
      "learning_rate": 3.631581598506639e-05,
      "loss": 1.2646,
      "num_input_tokens_seen": 31242478496,
      "step": 39710
    },
    {
      "epoch": 4.212921705919796,
      "grad_norm": 0.732802186903748,
      "learning_rate": 3.63151962790219e-05,
      "loss": 1.3686,
      "num_input_tokens_seen": 31243265232,
      "step": 39711
    },
    {
      "epoch": 4.213027795459368,
      "grad_norm": 0.5260965067805446,
      "learning_rate": 3.631457656423336e-05,
      "loss": 1.313,
      "num_input_tokens_seen": 31244051904,
      "step": 39712
    },
    {
      "epoch": 4.213133884998939,
      "grad_norm": 0.5415276672513315,
      "learning_rate": 3.631395684070125e-05,
      "loss": 1.2961,
      "num_input_tokens_seen": 31244838688,
      "step": 39713
    },
    {
      "epoch": 4.21323997453851,
      "grad_norm": 0.6263836006450937,
      "learning_rate": 3.631333710842605e-05,
      "loss": 1.238,
      "num_input_tokens_seen": 31245625424,
      "step": 39714
    },
    {
      "epoch": 4.213346064078082,
      "grad_norm": 0.5643886457376732,
      "learning_rate": 3.631271736740822e-05,
      "loss": 1.3261,
      "num_input_tokens_seen": 31246412096,
      "step": 39715
    },
    {
      "epoch": 4.213452153617653,
      "grad_norm": 0.5412434381652365,
      "learning_rate": 3.631209761764827e-05,
      "loss": 1.3269,
      "num_input_tokens_seen": 31247198880,
      "step": 39716
    },
    {
      "epoch": 4.213558243157225,
      "grad_norm": 0.6039685958860469,
      "learning_rate": 3.631147785914666e-05,
      "loss": 1.3549,
      "num_input_tokens_seen": 31247985680,
      "step": 39717
    },
    {
      "epoch": 4.213664332696796,
      "grad_norm": 0.5704815684667619,
      "learning_rate": 3.6310858091903864e-05,
      "loss": 1.3262,
      "num_input_tokens_seen": 31248772496,
      "step": 39718
    },
    {
      "epoch": 4.213770422236368,
      "grad_norm": 0.5179110020246284,
      "learning_rate": 3.631023831592037e-05,
      "loss": 1.3326,
      "num_input_tokens_seen": 31249559216,
      "step": 39719
    },
    {
      "epoch": 4.213876511775939,
      "grad_norm": 0.7493947218373359,
      "learning_rate": 3.630961853119667e-05,
      "loss": 1.344,
      "num_input_tokens_seen": 31250345968,
      "step": 39720
    },
    {
      "epoch": 4.21398260131551,
      "grad_norm": 0.507692283810358,
      "learning_rate": 3.6308998737733214e-05,
      "loss": 1.2188,
      "num_input_tokens_seen": 31251132752,
      "step": 39721
    },
    {
      "epoch": 4.214088690855082,
      "grad_norm": 0.5771368586759394,
      "learning_rate": 3.63083789355305e-05,
      "loss": 1.2582,
      "num_input_tokens_seen": 31251919536,
      "step": 39722
    },
    {
      "epoch": 4.214194780394653,
      "grad_norm": 0.510893475897993,
      "learning_rate": 3.6307759124589005e-05,
      "loss": 1.2542,
      "num_input_tokens_seen": 31252706336,
      "step": 39723
    },
    {
      "epoch": 4.214300869934225,
      "grad_norm": 0.5201649071861689,
      "learning_rate": 3.63071393049092e-05,
      "loss": 1.2384,
      "num_input_tokens_seen": 31253493072,
      "step": 39724
    },
    {
      "epoch": 4.214406959473796,
      "grad_norm": 0.536403939717528,
      "learning_rate": 3.6306519476491575e-05,
      "loss": 1.2422,
      "num_input_tokens_seen": 31254279856,
      "step": 39725
    },
    {
      "epoch": 4.214513049013367,
      "grad_norm": 0.57588054306363,
      "learning_rate": 3.630589963933659e-05,
      "loss": 1.444,
      "num_input_tokens_seen": 31255066544,
      "step": 39726
    },
    {
      "epoch": 4.214619138552939,
      "grad_norm": 0.4674835696328118,
      "learning_rate": 3.630527979344476e-05,
      "loss": 1.3344,
      "num_input_tokens_seen": 31255853232,
      "step": 39727
    },
    {
      "epoch": 4.21472522809251,
      "grad_norm": 0.5377761274632505,
      "learning_rate": 3.630465993881653e-05,
      "loss": 1.2983,
      "num_input_tokens_seen": 31256640096,
      "step": 39728
    },
    {
      "epoch": 4.214831317632082,
      "grad_norm": 0.5177042128676346,
      "learning_rate": 3.6304040075452387e-05,
      "loss": 1.3504,
      "num_input_tokens_seen": 31257426816,
      "step": 39729
    },
    {
      "epoch": 4.214937407171653,
      "grad_norm": 0.5015729483230236,
      "learning_rate": 3.6303420203352814e-05,
      "loss": 1.3419,
      "num_input_tokens_seen": 31258213520,
      "step": 39730
    },
    {
      "epoch": 4.215043496711225,
      "grad_norm": 0.571819449286189,
      "learning_rate": 3.630280032251829e-05,
      "loss": 1.3408,
      "num_input_tokens_seen": 31259000240,
      "step": 39731
    },
    {
      "epoch": 4.215149586250796,
      "grad_norm": 0.5168207996697173,
      "learning_rate": 3.63021804329493e-05,
      "loss": 1.2848,
      "num_input_tokens_seen": 31259787072,
      "step": 39732
    },
    {
      "epoch": 4.215255675790367,
      "grad_norm": 0.5090025366946838,
      "learning_rate": 3.630156053464632e-05,
      "loss": 1.2286,
      "num_input_tokens_seen": 31260573888,
      "step": 39733
    },
    {
      "epoch": 4.215361765329939,
      "grad_norm": 0.5596718079630179,
      "learning_rate": 3.630094062760981e-05,
      "loss": 1.286,
      "num_input_tokens_seen": 31261360672,
      "step": 39734
    },
    {
      "epoch": 4.21546785486951,
      "grad_norm": 0.4795851113726426,
      "learning_rate": 3.630032071184027e-05,
      "loss": 1.2909,
      "num_input_tokens_seen": 31262147328,
      "step": 39735
    },
    {
      "epoch": 4.215573944409082,
      "grad_norm": 0.5345992642485949,
      "learning_rate": 3.629970078733818e-05,
      "loss": 1.31,
      "num_input_tokens_seen": 31262934128,
      "step": 39736
    },
    {
      "epoch": 4.215680033948653,
      "grad_norm": 0.603810807448624,
      "learning_rate": 3.6299080854104003e-05,
      "loss": 1.2677,
      "num_input_tokens_seen": 31263720864,
      "step": 39737
    },
    {
      "epoch": 4.215786123488224,
      "grad_norm": 0.6176449943366427,
      "learning_rate": 3.6298460912138246e-05,
      "loss": 1.4503,
      "num_input_tokens_seen": 31264507648,
      "step": 39738
    },
    {
      "epoch": 4.215892213027796,
      "grad_norm": 0.4882171447306236,
      "learning_rate": 3.6297840961441355e-05,
      "loss": 1.3593,
      "num_input_tokens_seen": 31265294400,
      "step": 39739
    },
    {
      "epoch": 4.215998302567367,
      "grad_norm": 0.5373789690073639,
      "learning_rate": 3.6297221002013824e-05,
      "loss": 1.3032,
      "num_input_tokens_seen": 31266081184,
      "step": 39740
    },
    {
      "epoch": 4.2161043921069385,
      "grad_norm": 0.5787268762905896,
      "learning_rate": 3.6296601033856134e-05,
      "loss": 1.3816,
      "num_input_tokens_seen": 31266867984,
      "step": 39741
    },
    {
      "epoch": 4.21621048164651,
      "grad_norm": 0.49340144287206267,
      "learning_rate": 3.629598105696877e-05,
      "loss": 1.2126,
      "num_input_tokens_seen": 31267654768,
      "step": 39742
    },
    {
      "epoch": 4.216316571186081,
      "grad_norm": 0.47953643296736687,
      "learning_rate": 3.629536107135219e-05,
      "loss": 1.224,
      "num_input_tokens_seen": 31268441536,
      "step": 39743
    },
    {
      "epoch": 4.2164226607256525,
      "grad_norm": 0.5287564552373595,
      "learning_rate": 3.629474107700689e-05,
      "loss": 1.3899,
      "num_input_tokens_seen": 31269228240,
      "step": 39744
    },
    {
      "epoch": 4.216528750265224,
      "grad_norm": 0.5119700471146729,
      "learning_rate": 3.629412107393336e-05,
      "loss": 1.2695,
      "num_input_tokens_seen": 31270014992,
      "step": 39745
    },
    {
      "epoch": 4.2166348398047955,
      "grad_norm": 0.5878455890553499,
      "learning_rate": 3.629350106213204e-05,
      "loss": 1.391,
      "num_input_tokens_seen": 31270801792,
      "step": 39746
    },
    {
      "epoch": 4.2167409293443665,
      "grad_norm": 0.46476211180996174,
      "learning_rate": 3.629288104160345e-05,
      "loss": 1.1978,
      "num_input_tokens_seen": 31271588576,
      "step": 39747
    },
    {
      "epoch": 4.216847018883938,
      "grad_norm": 0.4825934021046475,
      "learning_rate": 3.629226101234805e-05,
      "loss": 1.3412,
      "num_input_tokens_seen": 31272375344,
      "step": 39748
    },
    {
      "epoch": 4.2169531084235095,
      "grad_norm": 0.43497859039003806,
      "learning_rate": 3.629164097436632e-05,
      "loss": 1.2521,
      "num_input_tokens_seen": 31273162112,
      "step": 39749
    },
    {
      "epoch": 4.2170591979630805,
      "grad_norm": 0.504408764845544,
      "learning_rate": 3.629102092765875e-05,
      "loss": 1.3192,
      "num_input_tokens_seen": 31273948864,
      "step": 39750
    },
    {
      "epoch": 4.217165287502652,
      "grad_norm": 0.5074309134045498,
      "learning_rate": 3.62904008722258e-05,
      "loss": 1.419,
      "num_input_tokens_seen": 31274735552,
      "step": 39751
    },
    {
      "epoch": 4.217271377042223,
      "grad_norm": 0.5287064752575609,
      "learning_rate": 3.628978080806796e-05,
      "loss": 1.3405,
      "num_input_tokens_seen": 31275522320,
      "step": 39752
    },
    {
      "epoch": 4.217377466581795,
      "grad_norm": 0.652279591709748,
      "learning_rate": 3.628916073518571e-05,
      "loss": 1.2566,
      "num_input_tokens_seen": 31276309072,
      "step": 39753
    },
    {
      "epoch": 4.217483556121366,
      "grad_norm": 0.5238216773924972,
      "learning_rate": 3.628854065357953e-05,
      "loss": 1.3433,
      "num_input_tokens_seen": 31277095808,
      "step": 39754
    },
    {
      "epoch": 4.217589645660937,
      "grad_norm": 0.7820450239805445,
      "learning_rate": 3.6287920563249896e-05,
      "loss": 1.3183,
      "num_input_tokens_seen": 31277882560,
      "step": 39755
    },
    {
      "epoch": 4.217695735200509,
      "grad_norm": 0.4279106532260793,
      "learning_rate": 3.628730046419729e-05,
      "loss": 1.1696,
      "num_input_tokens_seen": 31278669488,
      "step": 39756
    },
    {
      "epoch": 4.21780182474008,
      "grad_norm": 0.6714606108827704,
      "learning_rate": 3.6286680356422185e-05,
      "loss": 1.2883,
      "num_input_tokens_seen": 31279456336,
      "step": 39757
    },
    {
      "epoch": 4.217907914279652,
      "grad_norm": 0.728641873878777,
      "learning_rate": 3.6286060239925066e-05,
      "loss": 1.3169,
      "num_input_tokens_seen": 31280243088,
      "step": 39758
    },
    {
      "epoch": 4.218014003819223,
      "grad_norm": 0.4825283550854342,
      "learning_rate": 3.6285440114706414e-05,
      "loss": 1.2398,
      "num_input_tokens_seen": 31281029904,
      "step": 39759
    },
    {
      "epoch": 4.218120093358795,
      "grad_norm": 0.6962022001489403,
      "learning_rate": 3.6284819980766704e-05,
      "loss": 1.2945,
      "num_input_tokens_seen": 31281816720,
      "step": 39760
    },
    {
      "epoch": 4.218226182898366,
      "grad_norm": 0.6366118299155792,
      "learning_rate": 3.628419983810642e-05,
      "loss": 1.3061,
      "num_input_tokens_seen": 31282603472,
      "step": 39761
    },
    {
      "epoch": 4.218332272437937,
      "grad_norm": 0.6194761160662566,
      "learning_rate": 3.6283579686726035e-05,
      "loss": 1.3261,
      "num_input_tokens_seen": 31283390272,
      "step": 39762
    },
    {
      "epoch": 4.218438361977509,
      "grad_norm": 0.6119654672866112,
      "learning_rate": 3.628295952662602e-05,
      "loss": 1.1415,
      "num_input_tokens_seen": 31284177232,
      "step": 39763
    },
    {
      "epoch": 4.21854445151708,
      "grad_norm": 0.6112695305873667,
      "learning_rate": 3.628233935780688e-05,
      "loss": 1.3534,
      "num_input_tokens_seen": 31284964032,
      "step": 39764
    },
    {
      "epoch": 4.218650541056652,
      "grad_norm": 0.47796552272369053,
      "learning_rate": 3.628171918026907e-05,
      "loss": 1.3129,
      "num_input_tokens_seen": 31285750720,
      "step": 39765
    },
    {
      "epoch": 4.218756630596223,
      "grad_norm": 0.49529706372546584,
      "learning_rate": 3.628109899401308e-05,
      "loss": 1.2222,
      "num_input_tokens_seen": 31286537520,
      "step": 39766
    },
    {
      "epoch": 4.218862720135794,
      "grad_norm": 0.5753536262872059,
      "learning_rate": 3.628047879903939e-05,
      "loss": 1.3917,
      "num_input_tokens_seen": 31287324320,
      "step": 39767
    },
    {
      "epoch": 4.218968809675366,
      "grad_norm": 0.6192965133707276,
      "learning_rate": 3.6279858595348474e-05,
      "loss": 1.3644,
      "num_input_tokens_seen": 31288111056,
      "step": 39768
    },
    {
      "epoch": 4.219074899214937,
      "grad_norm": 0.713685075619652,
      "learning_rate": 3.627923838294082e-05,
      "loss": 1.3194,
      "num_input_tokens_seen": 31288897808,
      "step": 39769
    },
    {
      "epoch": 4.219180988754509,
      "grad_norm": 0.5554141175003511,
      "learning_rate": 3.6278618161816894e-05,
      "loss": 1.3522,
      "num_input_tokens_seen": 31289684640,
      "step": 39770
    },
    {
      "epoch": 4.21928707829408,
      "grad_norm": 0.5537650629376668,
      "learning_rate": 3.627799793197719e-05,
      "loss": 1.313,
      "num_input_tokens_seen": 31290471408,
      "step": 39771
    },
    {
      "epoch": 4.219393167833651,
      "grad_norm": 0.5462514802633558,
      "learning_rate": 3.627737769342218e-05,
      "loss": 1.3283,
      "num_input_tokens_seen": 31291258112,
      "step": 39772
    },
    {
      "epoch": 4.219499257373223,
      "grad_norm": 0.5225276030694743,
      "learning_rate": 3.627675744615234e-05,
      "loss": 1.282,
      "num_input_tokens_seen": 31292044944,
      "step": 39773
    },
    {
      "epoch": 4.219605346912794,
      "grad_norm": 0.5595775020691528,
      "learning_rate": 3.6276137190168144e-05,
      "loss": 1.2862,
      "num_input_tokens_seen": 31292831728,
      "step": 39774
    },
    {
      "epoch": 4.219711436452366,
      "grad_norm": 0.5448448013207176,
      "learning_rate": 3.6275516925470094e-05,
      "loss": 1.2706,
      "num_input_tokens_seen": 31293618560,
      "step": 39775
    },
    {
      "epoch": 4.219817525991937,
      "grad_norm": 0.5383767728880328,
      "learning_rate": 3.627489665205865e-05,
      "loss": 1.3295,
      "num_input_tokens_seen": 31294405296,
      "step": 39776
    },
    {
      "epoch": 4.219923615531509,
      "grad_norm": 0.5608134004368786,
      "learning_rate": 3.627427636993429e-05,
      "loss": 1.3344,
      "num_input_tokens_seen": 31295192032,
      "step": 39777
    },
    {
      "epoch": 4.22002970507108,
      "grad_norm": 0.5300959668083043,
      "learning_rate": 3.627365607909751e-05,
      "loss": 1.258,
      "num_input_tokens_seen": 31295978752,
      "step": 39778
    },
    {
      "epoch": 4.220135794610651,
      "grad_norm": 0.42911287715098,
      "learning_rate": 3.627303577954878e-05,
      "loss": 1.3113,
      "num_input_tokens_seen": 31296765520,
      "step": 39779
    },
    {
      "epoch": 4.220241884150223,
      "grad_norm": 0.8006112218260278,
      "learning_rate": 3.627241547128857e-05,
      "loss": 1.3871,
      "num_input_tokens_seen": 31297552256,
      "step": 39780
    },
    {
      "epoch": 4.220347973689794,
      "grad_norm": 0.5941091534546352,
      "learning_rate": 3.6271795154317375e-05,
      "loss": 1.2977,
      "num_input_tokens_seen": 31298339008,
      "step": 39781
    },
    {
      "epoch": 4.220454063229366,
      "grad_norm": 0.8472715462888449,
      "learning_rate": 3.627117482863567e-05,
      "loss": 1.4343,
      "num_input_tokens_seen": 31299125728,
      "step": 39782
    },
    {
      "epoch": 4.220560152768937,
      "grad_norm": 0.6054557631206351,
      "learning_rate": 3.627055449424393e-05,
      "loss": 1.4125,
      "num_input_tokens_seen": 31299912496,
      "step": 39783
    },
    {
      "epoch": 4.220666242308508,
      "grad_norm": 0.6505077368199638,
      "learning_rate": 3.6269934151142624e-05,
      "loss": 1.1949,
      "num_input_tokens_seen": 31300699312,
      "step": 39784
    },
    {
      "epoch": 4.22077233184808,
      "grad_norm": 0.471682375822199,
      "learning_rate": 3.6269313799332264e-05,
      "loss": 1.4282,
      "num_input_tokens_seen": 31301486048,
      "step": 39785
    },
    {
      "epoch": 4.220878421387651,
      "grad_norm": 0.5445529158728191,
      "learning_rate": 3.626869343881329e-05,
      "loss": 1.3287,
      "num_input_tokens_seen": 31302272864,
      "step": 39786
    },
    {
      "epoch": 4.220984510927223,
      "grad_norm": 0.6022120072309298,
      "learning_rate": 3.626807306958621e-05,
      "loss": 1.3514,
      "num_input_tokens_seen": 31303059712,
      "step": 39787
    },
    {
      "epoch": 4.221090600466794,
      "grad_norm": 0.4588675478696973,
      "learning_rate": 3.6267452691651495e-05,
      "loss": 1.2313,
      "num_input_tokens_seen": 31303846480,
      "step": 39788
    },
    {
      "epoch": 4.221196690006366,
      "grad_norm": 0.5502248555969846,
      "learning_rate": 3.6266832305009616e-05,
      "loss": 1.278,
      "num_input_tokens_seen": 31304633216,
      "step": 39789
    },
    {
      "epoch": 4.221302779545937,
      "grad_norm": 0.45615998001139035,
      "learning_rate": 3.6266211909661064e-05,
      "loss": 1.2458,
      "num_input_tokens_seen": 31305420000,
      "step": 39790
    },
    {
      "epoch": 4.221408869085508,
      "grad_norm": 0.4937214012274611,
      "learning_rate": 3.626559150560631e-05,
      "loss": 1.273,
      "num_input_tokens_seen": 31306206736,
      "step": 39791
    },
    {
      "epoch": 4.22151495862508,
      "grad_norm": 0.48564547389961393,
      "learning_rate": 3.626497109284584e-05,
      "loss": 1.3229,
      "num_input_tokens_seen": 31306993424,
      "step": 39792
    },
    {
      "epoch": 4.221621048164651,
      "grad_norm": 0.5628191255435713,
      "learning_rate": 3.626435067138014e-05,
      "loss": 1.3219,
      "num_input_tokens_seen": 31307780224,
      "step": 39793
    },
    {
      "epoch": 4.221727137704223,
      "grad_norm": 0.47271971888178105,
      "learning_rate": 3.626373024120967e-05,
      "loss": 1.211,
      "num_input_tokens_seen": 31308567072,
      "step": 39794
    },
    {
      "epoch": 4.221833227243794,
      "grad_norm": 0.5362309703351382,
      "learning_rate": 3.626310980233492e-05,
      "loss": 1.3413,
      "num_input_tokens_seen": 31309353792,
      "step": 39795
    },
    {
      "epoch": 4.221939316783365,
      "grad_norm": 0.6353558534903047,
      "learning_rate": 3.626248935475637e-05,
      "loss": 1.3976,
      "num_input_tokens_seen": 31310140528,
      "step": 39796
    },
    {
      "epoch": 4.222045406322937,
      "grad_norm": 0.5560294928022783,
      "learning_rate": 3.62618688984745e-05,
      "loss": 1.397,
      "num_input_tokens_seen": 31310927344,
      "step": 39797
    },
    {
      "epoch": 4.222151495862508,
      "grad_norm": 0.6575668507338704,
      "learning_rate": 3.6261248433489794e-05,
      "loss": 1.3527,
      "num_input_tokens_seen": 31311714128,
      "step": 39798
    },
    {
      "epoch": 4.22225758540208,
      "grad_norm": 0.5583591395152093,
      "learning_rate": 3.6260627959802716e-05,
      "loss": 1.3475,
      "num_input_tokens_seen": 31312500928,
      "step": 39799
    },
    {
      "epoch": 4.222363674941651,
      "grad_norm": 0.661314084905523,
      "learning_rate": 3.626000747741376e-05,
      "loss": 1.2578,
      "num_input_tokens_seen": 31313287728,
      "step": 39800
    },
    {
      "epoch": 4.222469764481223,
      "grad_norm": 0.5111203585444163,
      "learning_rate": 3.62593869863234e-05,
      "loss": 1.3232,
      "num_input_tokens_seen": 31314074512,
      "step": 39801
    },
    {
      "epoch": 4.222575854020794,
      "grad_norm": 0.5158707193432132,
      "learning_rate": 3.625876648653211e-05,
      "loss": 1.3348,
      "num_input_tokens_seen": 31314861280,
      "step": 39802
    },
    {
      "epoch": 4.222681943560365,
      "grad_norm": 0.6681244729486908,
      "learning_rate": 3.625814597804038e-05,
      "loss": 1.369,
      "num_input_tokens_seen": 31315648048,
      "step": 39803
    },
    {
      "epoch": 4.2227880330999366,
      "grad_norm": 0.5555461624117256,
      "learning_rate": 3.625752546084869e-05,
      "loss": 1.4373,
      "num_input_tokens_seen": 31316434848,
      "step": 39804
    },
    {
      "epoch": 4.222894122639508,
      "grad_norm": 0.5437133836545475,
      "learning_rate": 3.6256904934957514e-05,
      "loss": 1.2884,
      "num_input_tokens_seen": 31317221648,
      "step": 39805
    },
    {
      "epoch": 4.2230002121790795,
      "grad_norm": 0.6052276111880921,
      "learning_rate": 3.6256284400367324e-05,
      "loss": 1.4198,
      "num_input_tokens_seen": 31318008320,
      "step": 39806
    },
    {
      "epoch": 4.2231063017186505,
      "grad_norm": 0.448112003192817,
      "learning_rate": 3.6255663857078614e-05,
      "loss": 1.2482,
      "num_input_tokens_seen": 31318795088,
      "step": 39807
    },
    {
      "epoch": 4.223212391258222,
      "grad_norm": 0.6519421821057603,
      "learning_rate": 3.6255043305091864e-05,
      "loss": 1.3343,
      "num_input_tokens_seen": 31319581888,
      "step": 39808
    },
    {
      "epoch": 4.2233184807977935,
      "grad_norm": 0.5832454656511792,
      "learning_rate": 3.6254422744407536e-05,
      "loss": 1.301,
      "num_input_tokens_seen": 31320368704,
      "step": 39809
    },
    {
      "epoch": 4.2234245703373645,
      "grad_norm": 0.5196428708638858,
      "learning_rate": 3.625380217502612e-05,
      "loss": 1.2704,
      "num_input_tokens_seen": 31321155376,
      "step": 39810
    },
    {
      "epoch": 4.223530659876936,
      "grad_norm": 0.5795740759408916,
      "learning_rate": 3.6253181596948104e-05,
      "loss": 1.2248,
      "num_input_tokens_seen": 31321942304,
      "step": 39811
    },
    {
      "epoch": 4.2236367494165075,
      "grad_norm": 0.5271807286494314,
      "learning_rate": 3.625256101017395e-05,
      "loss": 1.2495,
      "num_input_tokens_seen": 31322729184,
      "step": 39812
    },
    {
      "epoch": 4.223742838956079,
      "grad_norm": 0.5104966645184204,
      "learning_rate": 3.625194041470415e-05,
      "loss": 1.4016,
      "num_input_tokens_seen": 31323515920,
      "step": 39813
    },
    {
      "epoch": 4.22384892849565,
      "grad_norm": 0.6072368462446797,
      "learning_rate": 3.6251319810539185e-05,
      "loss": 1.3048,
      "num_input_tokens_seen": 31324302640,
      "step": 39814
    },
    {
      "epoch": 4.223955018035221,
      "grad_norm": 0.6396482705785684,
      "learning_rate": 3.6250699197679525e-05,
      "loss": 1.4074,
      "num_input_tokens_seen": 31325089360,
      "step": 39815
    },
    {
      "epoch": 4.224061107574793,
      "grad_norm": 0.7571070406035117,
      "learning_rate": 3.625007857612566e-05,
      "loss": 1.352,
      "num_input_tokens_seen": 31325876096,
      "step": 39816
    },
    {
      "epoch": 4.224167197114364,
      "grad_norm": 0.6079270357021728,
      "learning_rate": 3.624945794587806e-05,
      "loss": 1.3057,
      "num_input_tokens_seen": 31326662800,
      "step": 39817
    },
    {
      "epoch": 4.224273286653936,
      "grad_norm": 0.6331743603992767,
      "learning_rate": 3.6248837306937214e-05,
      "loss": 1.3388,
      "num_input_tokens_seen": 31327449600,
      "step": 39818
    },
    {
      "epoch": 4.224379376193507,
      "grad_norm": 0.5958455201341303,
      "learning_rate": 3.624821665930359e-05,
      "loss": 1.305,
      "num_input_tokens_seen": 31328236448,
      "step": 39819
    },
    {
      "epoch": 4.224485465733078,
      "grad_norm": 0.5746841390082518,
      "learning_rate": 3.624759600297768e-05,
      "loss": 1.2956,
      "num_input_tokens_seen": 31329023216,
      "step": 39820
    },
    {
      "epoch": 4.22459155527265,
      "grad_norm": 0.5326144612099667,
      "learning_rate": 3.624697533795995e-05,
      "loss": 1.2575,
      "num_input_tokens_seen": 31329809968,
      "step": 39821
    },
    {
      "epoch": 4.224697644812221,
      "grad_norm": 0.5552464101347852,
      "learning_rate": 3.62463546642509e-05,
      "loss": 1.4486,
      "num_input_tokens_seen": 31330596784,
      "step": 39822
    },
    {
      "epoch": 4.224803734351793,
      "grad_norm": 0.9642041430995177,
      "learning_rate": 3.624573398185099e-05,
      "loss": 1.4065,
      "num_input_tokens_seen": 31331383536,
      "step": 39823
    },
    {
      "epoch": 4.224909823891364,
      "grad_norm": 0.591799012506792,
      "learning_rate": 3.62451132907607e-05,
      "loss": 1.3087,
      "num_input_tokens_seen": 31332170272,
      "step": 39824
    },
    {
      "epoch": 4.225015913430935,
      "grad_norm": 0.7071380878699426,
      "learning_rate": 3.6244492590980525e-05,
      "loss": 1.2964,
      "num_input_tokens_seen": 31332957136,
      "step": 39825
    },
    {
      "epoch": 4.225122002970507,
      "grad_norm": 0.655174354926808,
      "learning_rate": 3.624387188251094e-05,
      "loss": 1.2608,
      "num_input_tokens_seen": 31333743936,
      "step": 39826
    },
    {
      "epoch": 4.225228092510078,
      "grad_norm": 0.5306843555522821,
      "learning_rate": 3.624325116535241e-05,
      "loss": 1.3385,
      "num_input_tokens_seen": 31334530720,
      "step": 39827
    },
    {
      "epoch": 4.22533418204965,
      "grad_norm": 0.5926678729389103,
      "learning_rate": 3.624263043950543e-05,
      "loss": 1.2471,
      "num_input_tokens_seen": 31335317536,
      "step": 39828
    },
    {
      "epoch": 4.225440271589221,
      "grad_norm": 0.5706349346003092,
      "learning_rate": 3.624200970497047e-05,
      "loss": 1.253,
      "num_input_tokens_seen": 31336104320,
      "step": 39829
    },
    {
      "epoch": 4.225546361128793,
      "grad_norm": 0.6370398109494759,
      "learning_rate": 3.624138896174803e-05,
      "loss": 1.302,
      "num_input_tokens_seen": 31336891120,
      "step": 39830
    },
    {
      "epoch": 4.225652450668364,
      "grad_norm": 0.6246064059228255,
      "learning_rate": 3.624076820983857e-05,
      "loss": 1.4263,
      "num_input_tokens_seen": 31337677760,
      "step": 39831
    },
    {
      "epoch": 4.225758540207935,
      "grad_norm": 0.47903709158527313,
      "learning_rate": 3.624014744924256e-05,
      "loss": 1.3327,
      "num_input_tokens_seen": 31338464528,
      "step": 39832
    },
    {
      "epoch": 4.225864629747507,
      "grad_norm": 0.6031919572651947,
      "learning_rate": 3.62395266799605e-05,
      "loss": 1.32,
      "num_input_tokens_seen": 31339251200,
      "step": 39833
    },
    {
      "epoch": 4.225970719287078,
      "grad_norm": 0.6939582048363238,
      "learning_rate": 3.6238905901992866e-05,
      "loss": 1.4056,
      "num_input_tokens_seen": 31340037936,
      "step": 39834
    },
    {
      "epoch": 4.22607680882665,
      "grad_norm": 0.5925676383892594,
      "learning_rate": 3.623828511534014e-05,
      "loss": 1.4299,
      "num_input_tokens_seen": 31340824640,
      "step": 39835
    },
    {
      "epoch": 4.226182898366221,
      "grad_norm": 0.6519321430588183,
      "learning_rate": 3.623766432000279e-05,
      "loss": 1.2701,
      "num_input_tokens_seen": 31341611376,
      "step": 39836
    },
    {
      "epoch": 4.226288987905792,
      "grad_norm": 0.43815309332066066,
      "learning_rate": 3.6237043515981304e-05,
      "loss": 1.2174,
      "num_input_tokens_seen": 31342398192,
      "step": 39837
    },
    {
      "epoch": 4.226395077445364,
      "grad_norm": 0.4987538354850008,
      "learning_rate": 3.623642270327616e-05,
      "loss": 1.2021,
      "num_input_tokens_seen": 31343184992,
      "step": 39838
    },
    {
      "epoch": 4.226501166984935,
      "grad_norm": 0.7077425464607096,
      "learning_rate": 3.6235801881887844e-05,
      "loss": 1.4389,
      "num_input_tokens_seen": 31343971712,
      "step": 39839
    },
    {
      "epoch": 4.226607256524507,
      "grad_norm": 0.4638365832347456,
      "learning_rate": 3.6235181051816823e-05,
      "loss": 1.272,
      "num_input_tokens_seen": 31344758528,
      "step": 39840
    },
    {
      "epoch": 4.226713346064078,
      "grad_norm": 0.5680021504550717,
      "learning_rate": 3.623456021306359e-05,
      "loss": 1.3612,
      "num_input_tokens_seen": 31345545312,
      "step": 39841
    },
    {
      "epoch": 4.22681943560365,
      "grad_norm": 0.5184502204941261,
      "learning_rate": 3.623393936562861e-05,
      "loss": 1.389,
      "num_input_tokens_seen": 31346332096,
      "step": 39842
    },
    {
      "epoch": 4.226925525143221,
      "grad_norm": 0.5154796389915977,
      "learning_rate": 3.6233318509512375e-05,
      "loss": 1.3581,
      "num_input_tokens_seen": 31347118992,
      "step": 39843
    },
    {
      "epoch": 4.227031614682792,
      "grad_norm": 0.521415413307606,
      "learning_rate": 3.623269764471536e-05,
      "loss": 1.3268,
      "num_input_tokens_seen": 31347905760,
      "step": 39844
    },
    {
      "epoch": 4.227137704222364,
      "grad_norm": 0.4819575801661482,
      "learning_rate": 3.6232076771238057e-05,
      "loss": 1.2834,
      "num_input_tokens_seen": 31348692592,
      "step": 39845
    },
    {
      "epoch": 4.227243793761935,
      "grad_norm": 0.5595110249290343,
      "learning_rate": 3.623145588908092e-05,
      "loss": 1.2794,
      "num_input_tokens_seen": 31349479408,
      "step": 39846
    },
    {
      "epoch": 4.227349883301507,
      "grad_norm": 0.48593679664190914,
      "learning_rate": 3.623083499824445e-05,
      "loss": 1.2256,
      "num_input_tokens_seen": 31350266144,
      "step": 39847
    },
    {
      "epoch": 4.227455972841078,
      "grad_norm": 0.5384510739445654,
      "learning_rate": 3.623021409872912e-05,
      "loss": 1.3619,
      "num_input_tokens_seen": 31351052896,
      "step": 39848
    },
    {
      "epoch": 4.227562062380649,
      "grad_norm": 0.5292549436360969,
      "learning_rate": 3.62295931905354e-05,
      "loss": 1.2597,
      "num_input_tokens_seen": 31351839616,
      "step": 39849
    },
    {
      "epoch": 4.227668151920221,
      "grad_norm": 0.4887879900800034,
      "learning_rate": 3.6228972273663794e-05,
      "loss": 1.2653,
      "num_input_tokens_seen": 31352626336,
      "step": 39850
    },
    {
      "epoch": 4.227774241459792,
      "grad_norm": 0.5065044545842652,
      "learning_rate": 3.622835134811477e-05,
      "loss": 1.2663,
      "num_input_tokens_seen": 31353413152,
      "step": 39851
    },
    {
      "epoch": 4.227880330999364,
      "grad_norm": 0.503359236773667,
      "learning_rate": 3.622773041388879e-05,
      "loss": 1.3975,
      "num_input_tokens_seen": 31354199872,
      "step": 39852
    },
    {
      "epoch": 4.227986420538935,
      "grad_norm": 0.5684914929423935,
      "learning_rate": 3.6227109470986364e-05,
      "loss": 1.3335,
      "num_input_tokens_seen": 31354986608,
      "step": 39853
    },
    {
      "epoch": 4.228092510078506,
      "grad_norm": 0.4313888316496416,
      "learning_rate": 3.622648851940795e-05,
      "loss": 1.2146,
      "num_input_tokens_seen": 31355773424,
      "step": 39854
    },
    {
      "epoch": 4.228198599618078,
      "grad_norm": 0.5425273522162432,
      "learning_rate": 3.622586755915404e-05,
      "loss": 1.2246,
      "num_input_tokens_seen": 31356560160,
      "step": 39855
    },
    {
      "epoch": 4.228304689157649,
      "grad_norm": 0.551901562805121,
      "learning_rate": 3.6225246590225106e-05,
      "loss": 1.384,
      "num_input_tokens_seen": 31357346960,
      "step": 39856
    },
    {
      "epoch": 4.228410778697221,
      "grad_norm": 0.522897503494025,
      "learning_rate": 3.6224625612621635e-05,
      "loss": 1.3661,
      "num_input_tokens_seen": 31358133792,
      "step": 39857
    },
    {
      "epoch": 4.228516868236792,
      "grad_norm": 0.5047715766499746,
      "learning_rate": 3.6224004626344085e-05,
      "loss": 1.3033,
      "num_input_tokens_seen": 31358920512,
      "step": 39858
    },
    {
      "epoch": 4.228622957776364,
      "grad_norm": 0.5662457067740171,
      "learning_rate": 3.622338363139297e-05,
      "loss": 1.4119,
      "num_input_tokens_seen": 31359707216,
      "step": 39859
    },
    {
      "epoch": 4.228729047315935,
      "grad_norm": 0.5140913968349856,
      "learning_rate": 3.622276262776875e-05,
      "loss": 1.3548,
      "num_input_tokens_seen": 31360493952,
      "step": 39860
    },
    {
      "epoch": 4.228835136855506,
      "grad_norm": 0.49055747812589884,
      "learning_rate": 3.622214161547191e-05,
      "loss": 1.3196,
      "num_input_tokens_seen": 31361280640,
      "step": 39861
    },
    {
      "epoch": 4.228941226395078,
      "grad_norm": 0.5179354121962607,
      "learning_rate": 3.622152059450293e-05,
      "loss": 1.2789,
      "num_input_tokens_seen": 31362067600,
      "step": 39862
    },
    {
      "epoch": 4.229047315934649,
      "grad_norm": 0.46288426476897526,
      "learning_rate": 3.622089956486228e-05,
      "loss": 1.3543,
      "num_input_tokens_seen": 31362854432,
      "step": 39863
    },
    {
      "epoch": 4.229153405474221,
      "grad_norm": 0.49422761309188595,
      "learning_rate": 3.622027852655046e-05,
      "loss": 1.302,
      "num_input_tokens_seen": 31363641264,
      "step": 39864
    },
    {
      "epoch": 4.229259495013792,
      "grad_norm": 0.5022779488451085,
      "learning_rate": 3.621965747956793e-05,
      "loss": 1.3734,
      "num_input_tokens_seen": 31364428016,
      "step": 39865
    },
    {
      "epoch": 4.229365584553363,
      "grad_norm": 0.4713213770410739,
      "learning_rate": 3.621903642391517e-05,
      "loss": 1.3389,
      "num_input_tokens_seen": 31365214816,
      "step": 39866
    },
    {
      "epoch": 4.229471674092935,
      "grad_norm": 0.48778060670078793,
      "learning_rate": 3.621841535959268e-05,
      "loss": 1.3589,
      "num_input_tokens_seen": 31366001568,
      "step": 39867
    },
    {
      "epoch": 4.229577763632506,
      "grad_norm": 0.4667030973584114,
      "learning_rate": 3.6217794286600924e-05,
      "loss": 1.2854,
      "num_input_tokens_seen": 31366788416,
      "step": 39868
    },
    {
      "epoch": 4.2296838531720775,
      "grad_norm": 0.6388190051795537,
      "learning_rate": 3.621717320494038e-05,
      "loss": 1.3193,
      "num_input_tokens_seen": 31367575088,
      "step": 39869
    },
    {
      "epoch": 4.2297899427116485,
      "grad_norm": 0.6198903913548045,
      "learning_rate": 3.6216552114611544e-05,
      "loss": 1.3928,
      "num_input_tokens_seen": 31368361856,
      "step": 39870
    },
    {
      "epoch": 4.2298960322512205,
      "grad_norm": 0.5834845916681977,
      "learning_rate": 3.621593101561489e-05,
      "loss": 1.3689,
      "num_input_tokens_seen": 31369148624,
      "step": 39871
    },
    {
      "epoch": 4.2300021217907915,
      "grad_norm": 0.5612928443764739,
      "learning_rate": 3.6215309907950876e-05,
      "loss": 1.2548,
      "num_input_tokens_seen": 31369935408,
      "step": 39872
    },
    {
      "epoch": 4.2301082113303625,
      "grad_norm": 0.5679337555867522,
      "learning_rate": 3.621468879162001e-05,
      "loss": 1.2829,
      "num_input_tokens_seen": 31370722208,
      "step": 39873
    },
    {
      "epoch": 4.230214300869934,
      "grad_norm": 0.5507039903412817,
      "learning_rate": 3.621406766662276e-05,
      "loss": 1.3198,
      "num_input_tokens_seen": 31371508992,
      "step": 39874
    },
    {
      "epoch": 4.2303203904095055,
      "grad_norm": 0.5688392706319967,
      "learning_rate": 3.62134465329596e-05,
      "loss": 1.4128,
      "num_input_tokens_seen": 31372295856,
      "step": 39875
    },
    {
      "epoch": 4.230426479949077,
      "grad_norm": 0.6038934514778279,
      "learning_rate": 3.621282539063103e-05,
      "loss": 1.2836,
      "num_input_tokens_seen": 31373082624,
      "step": 39876
    },
    {
      "epoch": 4.230532569488648,
      "grad_norm": 0.4889895401053461,
      "learning_rate": 3.621220423963751e-05,
      "loss": 1.2741,
      "num_input_tokens_seen": 31373869360,
      "step": 39877
    },
    {
      "epoch": 4.2306386590282195,
      "grad_norm": 0.4609898169100958,
      "learning_rate": 3.621158307997953e-05,
      "loss": 1.2561,
      "num_input_tokens_seen": 31374656160,
      "step": 39878
    },
    {
      "epoch": 4.230744748567791,
      "grad_norm": 0.5566141565585311,
      "learning_rate": 3.621096191165757e-05,
      "loss": 1.269,
      "num_input_tokens_seen": 31375442896,
      "step": 39879
    },
    {
      "epoch": 4.230850838107362,
      "grad_norm": 0.5223079859865254,
      "learning_rate": 3.6210340734672106e-05,
      "loss": 1.3178,
      "num_input_tokens_seen": 31376229744,
      "step": 39880
    },
    {
      "epoch": 4.230956927646934,
      "grad_norm": 0.5324298323803642,
      "learning_rate": 3.620971954902362e-05,
      "loss": 1.303,
      "num_input_tokens_seen": 31377016464,
      "step": 39881
    },
    {
      "epoch": 4.231063017186505,
      "grad_norm": 0.7787622323192792,
      "learning_rate": 3.620909835471259e-05,
      "loss": 1.2306,
      "num_input_tokens_seen": 31377803200,
      "step": 39882
    },
    {
      "epoch": 4.231169106726076,
      "grad_norm": 0.5445920532506295,
      "learning_rate": 3.6208477151739496e-05,
      "loss": 1.3004,
      "num_input_tokens_seen": 31378589984,
      "step": 39883
    },
    {
      "epoch": 4.231275196265648,
      "grad_norm": 0.8159677001018415,
      "learning_rate": 3.6207855940104825e-05,
      "loss": 1.3466,
      "num_input_tokens_seen": 31379376816,
      "step": 39884
    },
    {
      "epoch": 4.231381285805219,
      "grad_norm": 0.5150695409709926,
      "learning_rate": 3.620723471980905e-05,
      "loss": 1.2756,
      "num_input_tokens_seen": 31380163552,
      "step": 39885
    },
    {
      "epoch": 4.231487375344791,
      "grad_norm": 0.4702735543342518,
      "learning_rate": 3.620661349085265e-05,
      "loss": 1.3747,
      "num_input_tokens_seen": 31380950272,
      "step": 39886
    },
    {
      "epoch": 4.231593464884362,
      "grad_norm": 0.647380500036215,
      "learning_rate": 3.620599225323611e-05,
      "loss": 1.1619,
      "num_input_tokens_seen": 31381736992,
      "step": 39887
    },
    {
      "epoch": 4.231699554423934,
      "grad_norm": 0.5603538035408382,
      "learning_rate": 3.620537100695991e-05,
      "loss": 1.3719,
      "num_input_tokens_seen": 31382523680,
      "step": 39888
    },
    {
      "epoch": 4.231805643963505,
      "grad_norm": 0.6987604737180292,
      "learning_rate": 3.620474975202451e-05,
      "loss": 1.3376,
      "num_input_tokens_seen": 31383310480,
      "step": 39889
    },
    {
      "epoch": 4.231911733503076,
      "grad_norm": 0.6965508153976933,
      "learning_rate": 3.6204128488430434e-05,
      "loss": 1.395,
      "num_input_tokens_seen": 31384097184,
      "step": 39890
    },
    {
      "epoch": 4.232017823042648,
      "grad_norm": 0.5015843747065776,
      "learning_rate": 3.620350721617812e-05,
      "loss": 1.3144,
      "num_input_tokens_seen": 31384883904,
      "step": 39891
    },
    {
      "epoch": 4.232123912582219,
      "grad_norm": 0.8568232329001558,
      "learning_rate": 3.620288593526807e-05,
      "loss": 1.3493,
      "num_input_tokens_seen": 31385670672,
      "step": 39892
    },
    {
      "epoch": 4.232230002121791,
      "grad_norm": 0.5622279947719948,
      "learning_rate": 3.620226464570076e-05,
      "loss": 1.3001,
      "num_input_tokens_seen": 31386457328,
      "step": 39893
    },
    {
      "epoch": 4.232336091661362,
      "grad_norm": 0.5855703022436244,
      "learning_rate": 3.620164334747667e-05,
      "loss": 1.3759,
      "num_input_tokens_seen": 31387244080,
      "step": 39894
    },
    {
      "epoch": 4.232442181200933,
      "grad_norm": 0.5747669249712776,
      "learning_rate": 3.620102204059627e-05,
      "loss": 1.2733,
      "num_input_tokens_seen": 31388030784,
      "step": 39895
    },
    {
      "epoch": 4.232548270740505,
      "grad_norm": 0.5634115146013294,
      "learning_rate": 3.620040072506006e-05,
      "loss": 1.2845,
      "num_input_tokens_seen": 31388817616,
      "step": 39896
    },
    {
      "epoch": 4.232654360280076,
      "grad_norm": 0.7529604496628486,
      "learning_rate": 3.619977940086851e-05,
      "loss": 1.4231,
      "num_input_tokens_seen": 31389604384,
      "step": 39897
    },
    {
      "epoch": 4.232760449819648,
      "grad_norm": 0.5200726980204632,
      "learning_rate": 3.619915806802209e-05,
      "loss": 1.1694,
      "num_input_tokens_seen": 31390391248,
      "step": 39898
    },
    {
      "epoch": 4.232866539359219,
      "grad_norm": 0.5253389326048532,
      "learning_rate": 3.6198536726521295e-05,
      "loss": 1.193,
      "num_input_tokens_seen": 31391178064,
      "step": 39899
    },
    {
      "epoch": 4.232972628898791,
      "grad_norm": 0.53167414473392,
      "learning_rate": 3.619791537636659e-05,
      "loss": 1.3297,
      "num_input_tokens_seen": 31391964816,
      "step": 39900
    },
    {
      "epoch": 4.233078718438362,
      "grad_norm": 0.5842839897526902,
      "learning_rate": 3.619729401755847e-05,
      "loss": 1.324,
      "num_input_tokens_seen": 31392751664,
      "step": 39901
    },
    {
      "epoch": 4.233184807977933,
      "grad_norm": 0.5593799738281756,
      "learning_rate": 3.619667265009741e-05,
      "loss": 1.4022,
      "num_input_tokens_seen": 31393538384,
      "step": 39902
    },
    {
      "epoch": 4.233290897517505,
      "grad_norm": 0.5459779341918897,
      "learning_rate": 3.6196051273983896e-05,
      "loss": 1.2671,
      "num_input_tokens_seen": 31394325152,
      "step": 39903
    },
    {
      "epoch": 4.233396987057076,
      "grad_norm": 0.4725434561284587,
      "learning_rate": 3.619542988921839e-05,
      "loss": 1.3029,
      "num_input_tokens_seen": 31395111872,
      "step": 39904
    },
    {
      "epoch": 4.233503076596648,
      "grad_norm": 0.6017952364312766,
      "learning_rate": 3.6194808495801394e-05,
      "loss": 1.3606,
      "num_input_tokens_seen": 31395898608,
      "step": 39905
    },
    {
      "epoch": 4.233609166136219,
      "grad_norm": 0.4845592060478913,
      "learning_rate": 3.6194187093733375e-05,
      "loss": 1.3604,
      "num_input_tokens_seen": 31396685392,
      "step": 39906
    },
    {
      "epoch": 4.23371525567579,
      "grad_norm": 0.5469492137934316,
      "learning_rate": 3.619356568301482e-05,
      "loss": 1.3168,
      "num_input_tokens_seen": 31397472192,
      "step": 39907
    },
    {
      "epoch": 4.233821345215362,
      "grad_norm": 0.514270134972589,
      "learning_rate": 3.6192944263646205e-05,
      "loss": 1.2795,
      "num_input_tokens_seen": 31398259024,
      "step": 39908
    },
    {
      "epoch": 4.233927434754933,
      "grad_norm": 0.47533055996952567,
      "learning_rate": 3.6192322835628004e-05,
      "loss": 1.2882,
      "num_input_tokens_seen": 31399045776,
      "step": 39909
    },
    {
      "epoch": 4.234033524294505,
      "grad_norm": 0.5060861396986999,
      "learning_rate": 3.619170139896071e-05,
      "loss": 1.4345,
      "num_input_tokens_seen": 31399832592,
      "step": 39910
    },
    {
      "epoch": 4.234139613834076,
      "grad_norm": 0.5070177230221796,
      "learning_rate": 3.61910799536448e-05,
      "loss": 1.2413,
      "num_input_tokens_seen": 31400619344,
      "step": 39911
    },
    {
      "epoch": 4.234245703373647,
      "grad_norm": 0.5454058521865428,
      "learning_rate": 3.6190458499680745e-05,
      "loss": 1.2906,
      "num_input_tokens_seen": 31401406048,
      "step": 39912
    },
    {
      "epoch": 4.234351792913219,
      "grad_norm": 0.5534678384227345,
      "learning_rate": 3.618983703706904e-05,
      "loss": 1.3823,
      "num_input_tokens_seen": 31402192832,
      "step": 39913
    },
    {
      "epoch": 4.23445788245279,
      "grad_norm": 0.5349250307802388,
      "learning_rate": 3.618921556581015e-05,
      "loss": 1.326,
      "num_input_tokens_seen": 31402979536,
      "step": 39914
    },
    {
      "epoch": 4.234563971992362,
      "grad_norm": 0.580385687792311,
      "learning_rate": 3.618859408590456e-05,
      "loss": 1.3005,
      "num_input_tokens_seen": 31403766336,
      "step": 39915
    },
    {
      "epoch": 4.234670061531933,
      "grad_norm": 0.47152838329164726,
      "learning_rate": 3.6187972597352764e-05,
      "loss": 1.2709,
      "num_input_tokens_seen": 31404553120,
      "step": 39916
    },
    {
      "epoch": 4.234776151071505,
      "grad_norm": 0.5179367585811693,
      "learning_rate": 3.6187351100155233e-05,
      "loss": 1.3334,
      "num_input_tokens_seen": 31405339968,
      "step": 39917
    },
    {
      "epoch": 4.234882240611076,
      "grad_norm": 0.5598716380105301,
      "learning_rate": 3.618672959431243e-05,
      "loss": 1.297,
      "num_input_tokens_seen": 31406126656,
      "step": 39918
    },
    {
      "epoch": 4.234988330150647,
      "grad_norm": 0.5628931174582391,
      "learning_rate": 3.618610807982486e-05,
      "loss": 1.3446,
      "num_input_tokens_seen": 31406913488,
      "step": 39919
    },
    {
      "epoch": 4.235094419690219,
      "grad_norm": 0.6058518733019272,
      "learning_rate": 3.6185486556692993e-05,
      "loss": 1.3329,
      "num_input_tokens_seen": 31407700288,
      "step": 39920
    },
    {
      "epoch": 4.23520050922979,
      "grad_norm": 0.6484105485846897,
      "learning_rate": 3.618486502491731e-05,
      "loss": 1.3622,
      "num_input_tokens_seen": 31408487088,
      "step": 39921
    },
    {
      "epoch": 4.235306598769362,
      "grad_norm": 0.4958820347660598,
      "learning_rate": 3.6184243484498295e-05,
      "loss": 1.2502,
      "num_input_tokens_seen": 31409273936,
      "step": 39922
    },
    {
      "epoch": 4.235412688308933,
      "grad_norm": 0.5733901174201274,
      "learning_rate": 3.6183621935436415e-05,
      "loss": 1.3524,
      "num_input_tokens_seen": 31410060720,
      "step": 39923
    },
    {
      "epoch": 4.235518777848504,
      "grad_norm": 0.4917624361209901,
      "learning_rate": 3.618300037773217e-05,
      "loss": 1.3016,
      "num_input_tokens_seen": 31410847472,
      "step": 39924
    },
    {
      "epoch": 4.235624867388076,
      "grad_norm": 0.5106322140429356,
      "learning_rate": 3.618237881138603e-05,
      "loss": 1.361,
      "num_input_tokens_seen": 31411634256,
      "step": 39925
    },
    {
      "epoch": 4.235730956927647,
      "grad_norm": 0.5137352023082056,
      "learning_rate": 3.618175723639846e-05,
      "loss": 1.2979,
      "num_input_tokens_seen": 31412420944,
      "step": 39926
    },
    {
      "epoch": 4.235837046467219,
      "grad_norm": 0.4770283224150202,
      "learning_rate": 3.618113565276997e-05,
      "loss": 1.3127,
      "num_input_tokens_seen": 31413207744,
      "step": 39927
    },
    {
      "epoch": 4.23594313600679,
      "grad_norm": 0.5157427828291352,
      "learning_rate": 3.618051406050103e-05,
      "loss": 1.2395,
      "num_input_tokens_seen": 31413994544,
      "step": 39928
    },
    {
      "epoch": 4.2360492255463615,
      "grad_norm": 0.46397141420385984,
      "learning_rate": 3.617989245959211e-05,
      "loss": 1.2893,
      "num_input_tokens_seen": 31414781264,
      "step": 39929
    },
    {
      "epoch": 4.236155315085933,
      "grad_norm": 0.5690691272398113,
      "learning_rate": 3.61792708500437e-05,
      "loss": 1.2813,
      "num_input_tokens_seen": 31415568016,
      "step": 39930
    },
    {
      "epoch": 4.236261404625504,
      "grad_norm": 0.4914008669011015,
      "learning_rate": 3.6178649231856276e-05,
      "loss": 1.3406,
      "num_input_tokens_seen": 31416354912,
      "step": 39931
    },
    {
      "epoch": 4.2363674941650755,
      "grad_norm": 0.5139593085320311,
      "learning_rate": 3.617802760503032e-05,
      "loss": 1.2717,
      "num_input_tokens_seen": 31417141712,
      "step": 39932
    },
    {
      "epoch": 4.2364735837046466,
      "grad_norm": 0.4878508680965203,
      "learning_rate": 3.6177405969566316e-05,
      "loss": 1.3277,
      "num_input_tokens_seen": 31417928512,
      "step": 39933
    },
    {
      "epoch": 4.2365796732442185,
      "grad_norm": 0.5303833725378805,
      "learning_rate": 3.617678432546474e-05,
      "loss": 1.3157,
      "num_input_tokens_seen": 31418715344,
      "step": 39934
    },
    {
      "epoch": 4.2366857627837895,
      "grad_norm": 0.4966372725197353,
      "learning_rate": 3.617616267272606e-05,
      "loss": 1.2785,
      "num_input_tokens_seen": 31419502160,
      "step": 39935
    },
    {
      "epoch": 4.2367918523233605,
      "grad_norm": 0.5992661049688283,
      "learning_rate": 3.6175541011350775e-05,
      "loss": 1.4099,
      "num_input_tokens_seen": 31420288912,
      "step": 39936
    },
    {
      "epoch": 4.2368979418629324,
      "grad_norm": 0.5584629032381055,
      "learning_rate": 3.617491934133937e-05,
      "loss": 1.2432,
      "num_input_tokens_seen": 31421075728,
      "step": 39937
    },
    {
      "epoch": 4.2370040314025035,
      "grad_norm": 0.5302608455680673,
      "learning_rate": 3.61742976626923e-05,
      "loss": 1.3702,
      "num_input_tokens_seen": 31421862448,
      "step": 39938
    },
    {
      "epoch": 4.237110120942075,
      "grad_norm": 0.5793770147031057,
      "learning_rate": 3.6173675975410074e-05,
      "loss": 1.3392,
      "num_input_tokens_seen": 31422649216,
      "step": 39939
    },
    {
      "epoch": 4.237216210481646,
      "grad_norm": 0.5881357044039993,
      "learning_rate": 3.617305427949316e-05,
      "loss": 1.3963,
      "num_input_tokens_seen": 31423436016,
      "step": 39940
    },
    {
      "epoch": 4.2373223000212175,
      "grad_norm": 0.5219094913508078,
      "learning_rate": 3.617243257494203e-05,
      "loss": 1.3181,
      "num_input_tokens_seen": 31424222832,
      "step": 39941
    },
    {
      "epoch": 4.237428389560789,
      "grad_norm": 0.521250497666638,
      "learning_rate": 3.617181086175717e-05,
      "loss": 1.3156,
      "num_input_tokens_seen": 31425009616,
      "step": 39942
    },
    {
      "epoch": 4.23753447910036,
      "grad_norm": 0.6284916702746515,
      "learning_rate": 3.617118913993907e-05,
      "loss": 1.3027,
      "num_input_tokens_seen": 31425796496,
      "step": 39943
    },
    {
      "epoch": 4.237640568639932,
      "grad_norm": 0.5388837492647038,
      "learning_rate": 3.61705674094882e-05,
      "loss": 1.2763,
      "num_input_tokens_seen": 31426583232,
      "step": 39944
    },
    {
      "epoch": 4.237746658179503,
      "grad_norm": 0.4952590787676972,
      "learning_rate": 3.616994567040505e-05,
      "loss": 1.289,
      "num_input_tokens_seen": 31427369936,
      "step": 39945
    },
    {
      "epoch": 4.237852747719075,
      "grad_norm": 0.6123095783466868,
      "learning_rate": 3.616932392269008e-05,
      "loss": 1.3564,
      "num_input_tokens_seen": 31428156656,
      "step": 39946
    },
    {
      "epoch": 4.237958837258646,
      "grad_norm": 0.5857031583412311,
      "learning_rate": 3.616870216634379e-05,
      "loss": 1.2687,
      "num_input_tokens_seen": 31428943488,
      "step": 39947
    },
    {
      "epoch": 4.238064926798217,
      "grad_norm": 0.4527425726492986,
      "learning_rate": 3.616808040136665e-05,
      "loss": 1.3299,
      "num_input_tokens_seen": 31429730208,
      "step": 39948
    },
    {
      "epoch": 4.238171016337789,
      "grad_norm": 0.4843284246256701,
      "learning_rate": 3.616745862775916e-05,
      "loss": 1.3396,
      "num_input_tokens_seen": 31430516960,
      "step": 39949
    },
    {
      "epoch": 4.23827710587736,
      "grad_norm": 0.5807785925696157,
      "learning_rate": 3.616683684552177e-05,
      "loss": 1.2458,
      "num_input_tokens_seen": 31431303808,
      "step": 39950
    },
    {
      "epoch": 4.238383195416932,
      "grad_norm": 0.5038024103616259,
      "learning_rate": 3.616621505465499e-05,
      "loss": 1.2724,
      "num_input_tokens_seen": 31432090608,
      "step": 39951
    },
    {
      "epoch": 4.238489284956503,
      "grad_norm": 0.5272438650196037,
      "learning_rate": 3.6165593255159276e-05,
      "loss": 1.288,
      "num_input_tokens_seen": 31432877344,
      "step": 39952
    },
    {
      "epoch": 4.238595374496074,
      "grad_norm": 0.5280448061981823,
      "learning_rate": 3.616497144703512e-05,
      "loss": 1.2843,
      "num_input_tokens_seen": 31433664112,
      "step": 39953
    },
    {
      "epoch": 4.238701464035646,
      "grad_norm": 0.5153911808051659,
      "learning_rate": 3.6164349630283006e-05,
      "loss": 1.2726,
      "num_input_tokens_seen": 31434450848,
      "step": 39954
    },
    {
      "epoch": 4.238807553575217,
      "grad_norm": 0.6537871628855166,
      "learning_rate": 3.616372780490341e-05,
      "loss": 1.3889,
      "num_input_tokens_seen": 31435237616,
      "step": 39955
    },
    {
      "epoch": 4.238913643114789,
      "grad_norm": 0.531669428463256,
      "learning_rate": 3.616310597089681e-05,
      "loss": 1.3859,
      "num_input_tokens_seen": 31436024368,
      "step": 39956
    },
    {
      "epoch": 4.23901973265436,
      "grad_norm": 0.5631703215925651,
      "learning_rate": 3.616248412826369e-05,
      "loss": 1.2604,
      "num_input_tokens_seen": 31436811168,
      "step": 39957
    },
    {
      "epoch": 4.239125822193932,
      "grad_norm": 0.5464869602977682,
      "learning_rate": 3.616186227700453e-05,
      "loss": 1.3548,
      "num_input_tokens_seen": 31437597872,
      "step": 39958
    },
    {
      "epoch": 4.239231911733503,
      "grad_norm": 0.5262083215745215,
      "learning_rate": 3.616124041711981e-05,
      "loss": 1.193,
      "num_input_tokens_seen": 31438384656,
      "step": 39959
    },
    {
      "epoch": 4.239338001273074,
      "grad_norm": 0.7612801149974379,
      "learning_rate": 3.6160618548610016e-05,
      "loss": 1.2613,
      "num_input_tokens_seen": 31439171408,
      "step": 39960
    },
    {
      "epoch": 4.239444090812646,
      "grad_norm": 0.4937987292511756,
      "learning_rate": 3.615999667147561e-05,
      "loss": 1.2717,
      "num_input_tokens_seen": 31439958176,
      "step": 39961
    },
    {
      "epoch": 4.239550180352217,
      "grad_norm": 0.5273286793146323,
      "learning_rate": 3.61593747857171e-05,
      "loss": 1.2539,
      "num_input_tokens_seen": 31440745008,
      "step": 39962
    },
    {
      "epoch": 4.239656269891789,
      "grad_norm": 0.5343144344143271,
      "learning_rate": 3.6158752891334944e-05,
      "loss": 1.4656,
      "num_input_tokens_seen": 31441531584,
      "step": 39963
    },
    {
      "epoch": 4.23976235943136,
      "grad_norm": 0.5925374429808024,
      "learning_rate": 3.615813098832963e-05,
      "loss": 1.3706,
      "num_input_tokens_seen": 31442318352,
      "step": 39964
    },
    {
      "epoch": 4.239868448970931,
      "grad_norm": 0.6646070453273752,
      "learning_rate": 3.615750907670165e-05,
      "loss": 1.3966,
      "num_input_tokens_seen": 31443105120,
      "step": 39965
    },
    {
      "epoch": 4.239974538510503,
      "grad_norm": 0.49563100914419705,
      "learning_rate": 3.615688715645146e-05,
      "loss": 1.2499,
      "num_input_tokens_seen": 31443891904,
      "step": 39966
    },
    {
      "epoch": 4.240080628050074,
      "grad_norm": 0.780127868385308,
      "learning_rate": 3.6156265227579575e-05,
      "loss": 1.311,
      "num_input_tokens_seen": 31444678640,
      "step": 39967
    },
    {
      "epoch": 4.240186717589646,
      "grad_norm": 0.5448680037129743,
      "learning_rate": 3.615564329008644e-05,
      "loss": 1.206,
      "num_input_tokens_seen": 31445465376,
      "step": 39968
    },
    {
      "epoch": 4.240292807129217,
      "grad_norm": 0.7376718501801057,
      "learning_rate": 3.615502134397255e-05,
      "loss": 1.3412,
      "num_input_tokens_seen": 31446252080,
      "step": 39969
    },
    {
      "epoch": 4.240398896668789,
      "grad_norm": 0.6951332048771557,
      "learning_rate": 3.6154399389238397e-05,
      "loss": 1.2584,
      "num_input_tokens_seen": 31447038912,
      "step": 39970
    },
    {
      "epoch": 4.24050498620836,
      "grad_norm": 0.6808676403201792,
      "learning_rate": 3.615377742588445e-05,
      "loss": 1.2695,
      "num_input_tokens_seen": 31447825712,
      "step": 39971
    },
    {
      "epoch": 4.240611075747931,
      "grad_norm": 0.6316684285265893,
      "learning_rate": 3.615315545391118e-05,
      "loss": 1.3479,
      "num_input_tokens_seen": 31448612464,
      "step": 39972
    },
    {
      "epoch": 4.240717165287503,
      "grad_norm": 0.6511800251620413,
      "learning_rate": 3.615253347331909e-05,
      "loss": 1.3367,
      "num_input_tokens_seen": 31449399264,
      "step": 39973
    },
    {
      "epoch": 4.240823254827074,
      "grad_norm": 0.5811207450233883,
      "learning_rate": 3.615191148410865e-05,
      "loss": 1.2827,
      "num_input_tokens_seen": 31450185968,
      "step": 39974
    },
    {
      "epoch": 4.240929344366646,
      "grad_norm": 0.6733304515498624,
      "learning_rate": 3.615128948628033e-05,
      "loss": 1.3336,
      "num_input_tokens_seen": 31450972768,
      "step": 39975
    },
    {
      "epoch": 4.241035433906217,
      "grad_norm": 0.6144062802758358,
      "learning_rate": 3.6150667479834626e-05,
      "loss": 1.3429,
      "num_input_tokens_seen": 31451759472,
      "step": 39976
    },
    {
      "epoch": 4.241141523445788,
      "grad_norm": 0.7757321428541972,
      "learning_rate": 3.615004546477202e-05,
      "loss": 1.2526,
      "num_input_tokens_seen": 31452546240,
      "step": 39977
    },
    {
      "epoch": 4.24124761298536,
      "grad_norm": 0.735078857864901,
      "learning_rate": 3.6149423441092976e-05,
      "loss": 1.3155,
      "num_input_tokens_seen": 31453333008,
      "step": 39978
    },
    {
      "epoch": 4.241353702524931,
      "grad_norm": 0.9397764464250996,
      "learning_rate": 3.6148801408797987e-05,
      "loss": 1.3532,
      "num_input_tokens_seen": 31454119760,
      "step": 39979
    },
    {
      "epoch": 4.241459792064503,
      "grad_norm": 0.6685398833254474,
      "learning_rate": 3.614817936788753e-05,
      "loss": 1.3175,
      "num_input_tokens_seen": 31454906448,
      "step": 39980
    },
    {
      "epoch": 4.241565881604074,
      "grad_norm": 0.5889062295175573,
      "learning_rate": 3.614755731836209e-05,
      "loss": 1.312,
      "num_input_tokens_seen": 31455693152,
      "step": 39981
    },
    {
      "epoch": 4.241671971143646,
      "grad_norm": 0.8846317088724578,
      "learning_rate": 3.614693526022215e-05,
      "loss": 1.4289,
      "num_input_tokens_seen": 31456479856,
      "step": 39982
    },
    {
      "epoch": 4.241778060683217,
      "grad_norm": 0.5513696711027809,
      "learning_rate": 3.614631319346818e-05,
      "loss": 1.289,
      "num_input_tokens_seen": 31457266544,
      "step": 39983
    },
    {
      "epoch": 4.241884150222788,
      "grad_norm": 0.5102157056043793,
      "learning_rate": 3.614569111810066e-05,
      "loss": 1.2454,
      "num_input_tokens_seen": 31458053376,
      "step": 39984
    },
    {
      "epoch": 4.24199023976236,
      "grad_norm": 0.8146745606565143,
      "learning_rate": 3.614506903412008e-05,
      "loss": 1.2587,
      "num_input_tokens_seen": 31458840128,
      "step": 39985
    },
    {
      "epoch": 4.242096329301931,
      "grad_norm": 0.6486961386539951,
      "learning_rate": 3.6144446941526925e-05,
      "loss": 1.3205,
      "num_input_tokens_seen": 31459626864,
      "step": 39986
    },
    {
      "epoch": 4.242202418841503,
      "grad_norm": 0.6396484157089428,
      "learning_rate": 3.6143824840321665e-05,
      "loss": 1.3119,
      "num_input_tokens_seen": 31460413616,
      "step": 39987
    },
    {
      "epoch": 4.242308508381074,
      "grad_norm": 0.7100622606730376,
      "learning_rate": 3.6143202730504784e-05,
      "loss": 1.3402,
      "num_input_tokens_seen": 31461200352,
      "step": 39988
    },
    {
      "epoch": 4.242414597920645,
      "grad_norm": 0.5159076681898581,
      "learning_rate": 3.614258061207676e-05,
      "loss": 1.3371,
      "num_input_tokens_seen": 31461987152,
      "step": 39989
    },
    {
      "epoch": 4.242520687460217,
      "grad_norm": 0.6439273898510296,
      "learning_rate": 3.614195848503808e-05,
      "loss": 1.3058,
      "num_input_tokens_seen": 31462773936,
      "step": 39990
    },
    {
      "epoch": 4.242626776999788,
      "grad_norm": 0.7613728056818366,
      "learning_rate": 3.614133634938922e-05,
      "loss": 1.4209,
      "num_input_tokens_seen": 31463560704,
      "step": 39991
    },
    {
      "epoch": 4.2427328665393595,
      "grad_norm": 0.4672739287467186,
      "learning_rate": 3.614071420513067e-05,
      "loss": 1.2741,
      "num_input_tokens_seen": 31464347472,
      "step": 39992
    },
    {
      "epoch": 4.242838956078931,
      "grad_norm": 0.6738844041487217,
      "learning_rate": 3.614009205226289e-05,
      "loss": 1.2809,
      "num_input_tokens_seen": 31465134224,
      "step": 39993
    },
    {
      "epoch": 4.242945045618502,
      "grad_norm": 0.6570534623158832,
      "learning_rate": 3.6139469890786384e-05,
      "loss": 1.335,
      "num_input_tokens_seen": 31465920976,
      "step": 39994
    },
    {
      "epoch": 4.2430511351580735,
      "grad_norm": 0.4980144093578238,
      "learning_rate": 3.613884772070161e-05,
      "loss": 1.307,
      "num_input_tokens_seen": 31466707712,
      "step": 39995
    },
    {
      "epoch": 4.243157224697645,
      "grad_norm": 0.6686587355548672,
      "learning_rate": 3.613822554200907e-05,
      "loss": 1.2994,
      "num_input_tokens_seen": 31467494464,
      "step": 39996
    },
    {
      "epoch": 4.2432633142372165,
      "grad_norm": 0.5568274386590284,
      "learning_rate": 3.6137603354709235e-05,
      "loss": 1.1815,
      "num_input_tokens_seen": 31468281296,
      "step": 39997
    },
    {
      "epoch": 4.2433694037767875,
      "grad_norm": 0.5650563623226913,
      "learning_rate": 3.613698115880259e-05,
      "loss": 1.3568,
      "num_input_tokens_seen": 31469068128,
      "step": 39998
    },
    {
      "epoch": 4.243475493316359,
      "grad_norm": 0.5404405364873729,
      "learning_rate": 3.613635895428961e-05,
      "loss": 1.268,
      "num_input_tokens_seen": 31469854928,
      "step": 39999
    },
    {
      "epoch": 4.2435815828559305,
      "grad_norm": 0.5568407540955402,
      "learning_rate": 3.6135736741170775e-05,
      "loss": 1.4271,
      "num_input_tokens_seen": 31470641648,
      "step": 40000
    },
    {
      "epoch": 4.2435815828559305,
      "eval_loss": 1.5877634286880493,
      "eval_runtime": 64.9915,
      "eval_samples_per_second": 46.16,
      "eval_steps_per_second": 0.492,
      "num_input_tokens_seen": 31470641648,
      "step": 40000
    },
    {
      "epoch": 4.2436876723955015,
      "grad_norm": 0.4747141047734715,
      "learning_rate": 3.613511451944658e-05,
      "loss": 1.3242,
      "num_input_tokens_seen": 31471428368,
      "step": 40001
    },
    {
      "epoch": 4.243793761935073,
      "grad_norm": 0.5878811266204256,
      "learning_rate": 3.613449228911748e-05,
      "loss": 1.4837,
      "num_input_tokens_seen": 31472215120,
      "step": 40002
    },
    {
      "epoch": 4.243899851474644,
      "grad_norm": 0.9185322365493598,
      "learning_rate": 3.6133870050183986e-05,
      "loss": 1.3495,
      "num_input_tokens_seen": 31473001776,
      "step": 40003
    },
    {
      "epoch": 4.244005941014216,
      "grad_norm": 0.5419307684174486,
      "learning_rate": 3.6133247802646554e-05,
      "loss": 1.3264,
      "num_input_tokens_seen": 31473788640,
      "step": 40004
    },
    {
      "epoch": 4.244112030553787,
      "grad_norm": 0.5794290309479265,
      "learning_rate": 3.613262554650568e-05,
      "loss": 1.3103,
      "num_input_tokens_seen": 31474575392,
      "step": 40005
    },
    {
      "epoch": 4.244218120093358,
      "grad_norm": 0.4733348048532076,
      "learning_rate": 3.613200328176184e-05,
      "loss": 1.3141,
      "num_input_tokens_seen": 31475362128,
      "step": 40006
    },
    {
      "epoch": 4.24432420963293,
      "grad_norm": 0.6254904105837995,
      "learning_rate": 3.613138100841551e-05,
      "loss": 1.3061,
      "num_input_tokens_seen": 31476148928,
      "step": 40007
    },
    {
      "epoch": 4.244430299172501,
      "grad_norm": 0.5411399632790505,
      "learning_rate": 3.613075872646718e-05,
      "loss": 1.3566,
      "num_input_tokens_seen": 31476935808,
      "step": 40008
    },
    {
      "epoch": 4.244536388712073,
      "grad_norm": 0.6164323186919916,
      "learning_rate": 3.6130136435917314e-05,
      "loss": 1.2387,
      "num_input_tokens_seen": 31477722592,
      "step": 40009
    },
    {
      "epoch": 4.244642478251644,
      "grad_norm": 0.5335925770312371,
      "learning_rate": 3.612951413676642e-05,
      "loss": 1.2737,
      "num_input_tokens_seen": 31478509296,
      "step": 40010
    },
    {
      "epoch": 4.244748567791216,
      "grad_norm": 0.5338957064593165,
      "learning_rate": 3.612889182901496e-05,
      "loss": 1.215,
      "num_input_tokens_seen": 31479296112,
      "step": 40011
    },
    {
      "epoch": 4.244854657330787,
      "grad_norm": 0.5307255955906891,
      "learning_rate": 3.612826951266342e-05,
      "loss": 1.2402,
      "num_input_tokens_seen": 31480082944,
      "step": 40012
    },
    {
      "epoch": 4.244960746870358,
      "grad_norm": 0.5982378111998967,
      "learning_rate": 3.612764718771228e-05,
      "loss": 1.3212,
      "num_input_tokens_seen": 31480869648,
      "step": 40013
    },
    {
      "epoch": 4.24506683640993,
      "grad_norm": 0.5709462233833242,
      "learning_rate": 3.612702485416202e-05,
      "loss": 1.3127,
      "num_input_tokens_seen": 31481656400,
      "step": 40014
    },
    {
      "epoch": 4.245172925949501,
      "grad_norm": 0.613468154959121,
      "learning_rate": 3.612640251201311e-05,
      "loss": 1.2997,
      "num_input_tokens_seen": 31482443200,
      "step": 40015
    },
    {
      "epoch": 4.245279015489073,
      "grad_norm": 0.5646082671465933,
      "learning_rate": 3.612578016126605e-05,
      "loss": 1.3228,
      "num_input_tokens_seen": 31483229920,
      "step": 40016
    },
    {
      "epoch": 4.245385105028644,
      "grad_norm": 0.5690711475907465,
      "learning_rate": 3.612515780192133e-05,
      "loss": 1.3906,
      "num_input_tokens_seen": 31484016736,
      "step": 40017
    },
    {
      "epoch": 4.245491194568215,
      "grad_norm": 0.4825119299078551,
      "learning_rate": 3.612453543397939e-05,
      "loss": 1.254,
      "num_input_tokens_seen": 31484803520,
      "step": 40018
    },
    {
      "epoch": 4.245597284107787,
      "grad_norm": 0.6021458979922203,
      "learning_rate": 3.612391305744075e-05,
      "loss": 1.3802,
      "num_input_tokens_seen": 31485590192,
      "step": 40019
    },
    {
      "epoch": 4.245703373647358,
      "grad_norm": 0.5251976001666465,
      "learning_rate": 3.612329067230588e-05,
      "loss": 1.3519,
      "num_input_tokens_seen": 31486377040,
      "step": 40020
    },
    {
      "epoch": 4.24580946318693,
      "grad_norm": 0.5549508837692566,
      "learning_rate": 3.612266827857524e-05,
      "loss": 1.3392,
      "num_input_tokens_seen": 31487163888,
      "step": 40021
    },
    {
      "epoch": 4.245915552726501,
      "grad_norm": 0.6265397816390756,
      "learning_rate": 3.6122045876249344e-05,
      "loss": 1.3866,
      "num_input_tokens_seen": 31487950544,
      "step": 40022
    },
    {
      "epoch": 4.246021642266072,
      "grad_norm": 0.4812823744302803,
      "learning_rate": 3.6121423465328655e-05,
      "loss": 1.2701,
      "num_input_tokens_seen": 31488737264,
      "step": 40023
    },
    {
      "epoch": 4.246127731805644,
      "grad_norm": 0.5641092243220613,
      "learning_rate": 3.6120801045813645e-05,
      "loss": 1.3776,
      "num_input_tokens_seen": 31489524032,
      "step": 40024
    },
    {
      "epoch": 4.246233821345215,
      "grad_norm": 0.5134419603822485,
      "learning_rate": 3.6120178617704814e-05,
      "loss": 1.2533,
      "num_input_tokens_seen": 31490310800,
      "step": 40025
    },
    {
      "epoch": 4.246339910884787,
      "grad_norm": 0.539124868999211,
      "learning_rate": 3.611955618100263e-05,
      "loss": 1.3573,
      "num_input_tokens_seen": 31491097520,
      "step": 40026
    },
    {
      "epoch": 4.246446000424358,
      "grad_norm": 0.48711801959020723,
      "learning_rate": 3.611893373570759e-05,
      "loss": 1.1963,
      "num_input_tokens_seen": 31491884320,
      "step": 40027
    },
    {
      "epoch": 4.24655208996393,
      "grad_norm": 0.5815860208115071,
      "learning_rate": 3.611831128182016e-05,
      "loss": 1.3445,
      "num_input_tokens_seen": 31492671280,
      "step": 40028
    },
    {
      "epoch": 4.246658179503501,
      "grad_norm": 0.5127449461474682,
      "learning_rate": 3.611768881934082e-05,
      "loss": 1.2508,
      "num_input_tokens_seen": 31493457952,
      "step": 40029
    },
    {
      "epoch": 4.246764269043072,
      "grad_norm": 0.5211590969758164,
      "learning_rate": 3.6117066348270065e-05,
      "loss": 1.1907,
      "num_input_tokens_seen": 31494244720,
      "step": 40030
    },
    {
      "epoch": 4.246870358582644,
      "grad_norm": 0.5138666321216203,
      "learning_rate": 3.611644386860836e-05,
      "loss": 1.2074,
      "num_input_tokens_seen": 31495031584,
      "step": 40031
    },
    {
      "epoch": 4.246976448122215,
      "grad_norm": 0.4744900135760903,
      "learning_rate": 3.6115821380356196e-05,
      "loss": 1.2532,
      "num_input_tokens_seen": 31495818352,
      "step": 40032
    },
    {
      "epoch": 4.247082537661787,
      "grad_norm": 0.4952402681200685,
      "learning_rate": 3.6115198883514044e-05,
      "loss": 1.2497,
      "num_input_tokens_seen": 31496605136,
      "step": 40033
    },
    {
      "epoch": 4.247188627201358,
      "grad_norm": 0.469930626833172,
      "learning_rate": 3.61145763780824e-05,
      "loss": 1.2679,
      "num_input_tokens_seen": 31497391824,
      "step": 40034
    },
    {
      "epoch": 4.247294716740929,
      "grad_norm": 0.49154866832614547,
      "learning_rate": 3.6113953864061737e-05,
      "loss": 1.2519,
      "num_input_tokens_seen": 31498178656,
      "step": 40035
    },
    {
      "epoch": 4.247400806280501,
      "grad_norm": 0.509943153310781,
      "learning_rate": 3.611333134145254e-05,
      "loss": 1.3076,
      "num_input_tokens_seen": 31498965472,
      "step": 40036
    },
    {
      "epoch": 4.247506895820072,
      "grad_norm": 0.46089238894624296,
      "learning_rate": 3.6112708810255284e-05,
      "loss": 1.3826,
      "num_input_tokens_seen": 31499752272,
      "step": 40037
    },
    {
      "epoch": 4.247612985359644,
      "grad_norm": 0.5269031132989076,
      "learning_rate": 3.611208627047045e-05,
      "loss": 1.2592,
      "num_input_tokens_seen": 31500539072,
      "step": 40038
    },
    {
      "epoch": 4.247719074899215,
      "grad_norm": 0.6304340738698289,
      "learning_rate": 3.611146372209853e-05,
      "loss": 1.3007,
      "num_input_tokens_seen": 31501325792,
      "step": 40039
    },
    {
      "epoch": 4.247825164438787,
      "grad_norm": 0.5930987086310666,
      "learning_rate": 3.611084116513999e-05,
      "loss": 1.3029,
      "num_input_tokens_seen": 31502112496,
      "step": 40040
    },
    {
      "epoch": 4.247931253978358,
      "grad_norm": 0.462241029355937,
      "learning_rate": 3.611021859959531e-05,
      "loss": 1.2437,
      "num_input_tokens_seen": 31502899264,
      "step": 40041
    },
    {
      "epoch": 4.248037343517929,
      "grad_norm": 0.692541220856065,
      "learning_rate": 3.6109596025464995e-05,
      "loss": 1.4891,
      "num_input_tokens_seen": 31503685968,
      "step": 40042
    },
    {
      "epoch": 4.248143433057501,
      "grad_norm": 0.5462348634205868,
      "learning_rate": 3.6108973442749504e-05,
      "loss": 1.3177,
      "num_input_tokens_seen": 31504472688,
      "step": 40043
    },
    {
      "epoch": 4.248249522597072,
      "grad_norm": 0.5116782104160845,
      "learning_rate": 3.610835085144932e-05,
      "loss": 1.3649,
      "num_input_tokens_seen": 31505259408,
      "step": 40044
    },
    {
      "epoch": 4.248355612136644,
      "grad_norm": 0.7149869666619161,
      "learning_rate": 3.610772825156493e-05,
      "loss": 1.4222,
      "num_input_tokens_seen": 31506046048,
      "step": 40045
    },
    {
      "epoch": 4.248461701676215,
      "grad_norm": 0.5708833567801804,
      "learning_rate": 3.610710564309682e-05,
      "loss": 1.3887,
      "num_input_tokens_seen": 31506832832,
      "step": 40046
    },
    {
      "epoch": 4.248567791215786,
      "grad_norm": 0.6173817134562574,
      "learning_rate": 3.6106483026045454e-05,
      "loss": 1.3474,
      "num_input_tokens_seen": 31507619568,
      "step": 40047
    },
    {
      "epoch": 4.248673880755358,
      "grad_norm": 0.460582730103053,
      "learning_rate": 3.610586040041133e-05,
      "loss": 1.1585,
      "num_input_tokens_seen": 31508406400,
      "step": 40048
    },
    {
      "epoch": 4.248779970294929,
      "grad_norm": 0.5785203985734537,
      "learning_rate": 3.610523776619493e-05,
      "loss": 1.4296,
      "num_input_tokens_seen": 31509193152,
      "step": 40049
    },
    {
      "epoch": 4.248886059834501,
      "grad_norm": 0.8025768712537349,
      "learning_rate": 3.6104615123396716e-05,
      "loss": 1.3545,
      "num_input_tokens_seen": 31509979872,
      "step": 40050
    },
    {
      "epoch": 4.248992149374072,
      "grad_norm": 0.511277179335579,
      "learning_rate": 3.610399247201719e-05,
      "loss": 1.2795,
      "num_input_tokens_seen": 31510766608,
      "step": 40051
    },
    {
      "epoch": 4.249098238913643,
      "grad_norm": 0.5769990372295906,
      "learning_rate": 3.610336981205682e-05,
      "loss": 1.3567,
      "num_input_tokens_seen": 31511553440,
      "step": 40052
    },
    {
      "epoch": 4.249204328453215,
      "grad_norm": 0.682319937152834,
      "learning_rate": 3.610274714351609e-05,
      "loss": 1.2773,
      "num_input_tokens_seen": 31512340160,
      "step": 40053
    },
    {
      "epoch": 4.249310417992786,
      "grad_norm": 0.712781301274357,
      "learning_rate": 3.6102124466395484e-05,
      "loss": 1.383,
      "num_input_tokens_seen": 31513126928,
      "step": 40054
    },
    {
      "epoch": 4.249416507532358,
      "grad_norm": 0.569165304138831,
      "learning_rate": 3.6101501780695484e-05,
      "loss": 1.3235,
      "num_input_tokens_seen": 31513913744,
      "step": 40055
    },
    {
      "epoch": 4.249522597071929,
      "grad_norm": 0.925757111562942,
      "learning_rate": 3.6100879086416566e-05,
      "loss": 1.3171,
      "num_input_tokens_seen": 31514700496,
      "step": 40056
    },
    {
      "epoch": 4.2496286866115005,
      "grad_norm": 0.5432906611058395,
      "learning_rate": 3.610025638355922e-05,
      "loss": 1.3258,
      "num_input_tokens_seen": 31515487312,
      "step": 40057
    },
    {
      "epoch": 4.2497347761510715,
      "grad_norm": 0.7946478212499326,
      "learning_rate": 3.6099633672123916e-05,
      "loss": 1.2848,
      "num_input_tokens_seen": 31516274128,
      "step": 40058
    },
    {
      "epoch": 4.249840865690643,
      "grad_norm": 0.542597301106925,
      "learning_rate": 3.609901095211115e-05,
      "loss": 1.3468,
      "num_input_tokens_seen": 31517060944,
      "step": 40059
    },
    {
      "epoch": 4.2499469552302145,
      "grad_norm": 0.4805763827459364,
      "learning_rate": 3.6098388223521384e-05,
      "loss": 1.2312,
      "num_input_tokens_seen": 31517847696,
      "step": 40060
    },
    {
      "epoch": 4.2500530447697855,
      "grad_norm": 0.4936402993564715,
      "learning_rate": 3.6097765486355106e-05,
      "loss": 1.3152,
      "num_input_tokens_seen": 31518634480,
      "step": 40061
    },
    {
      "epoch": 4.250159134309357,
      "grad_norm": 0.5513326082176323,
      "learning_rate": 3.609714274061281e-05,
      "loss": 1.263,
      "num_input_tokens_seen": 31519421184,
      "step": 40062
    },
    {
      "epoch": 4.2502652238489285,
      "grad_norm": 0.5526648024809949,
      "learning_rate": 3.609651998629496e-05,
      "loss": 1.2902,
      "num_input_tokens_seen": 31520207952,
      "step": 40063
    },
    {
      "epoch": 4.2503713133884995,
      "grad_norm": 0.565130124263253,
      "learning_rate": 3.609589722340205e-05,
      "loss": 1.3725,
      "num_input_tokens_seen": 31520994768,
      "step": 40064
    },
    {
      "epoch": 4.250477402928071,
      "grad_norm": 0.5906021622795399,
      "learning_rate": 3.609527445193456e-05,
      "loss": 1.2947,
      "num_input_tokens_seen": 31521781584,
      "step": 40065
    },
    {
      "epoch": 4.250583492467642,
      "grad_norm": 0.5076285508791576,
      "learning_rate": 3.6094651671892966e-05,
      "loss": 1.2844,
      "num_input_tokens_seen": 31522568416,
      "step": 40066
    },
    {
      "epoch": 4.250689582007214,
      "grad_norm": 0.9612249530405247,
      "learning_rate": 3.6094028883277745e-05,
      "loss": 1.3843,
      "num_input_tokens_seen": 31523355088,
      "step": 40067
    },
    {
      "epoch": 4.250795671546785,
      "grad_norm": 0.5826213378616691,
      "learning_rate": 3.6093406086089385e-05,
      "loss": 1.4207,
      "num_input_tokens_seen": 31524141888,
      "step": 40068
    },
    {
      "epoch": 4.250901761086357,
      "grad_norm": 0.5951204778315156,
      "learning_rate": 3.609278328032836e-05,
      "loss": 1.3125,
      "num_input_tokens_seen": 31524928672,
      "step": 40069
    },
    {
      "epoch": 4.251007850625928,
      "grad_norm": 0.6881208505471015,
      "learning_rate": 3.609216046599517e-05,
      "loss": 1.3509,
      "num_input_tokens_seen": 31525715312,
      "step": 40070
    },
    {
      "epoch": 4.251113940165499,
      "grad_norm": 0.6142082280868244,
      "learning_rate": 3.6091537643090276e-05,
      "loss": 1.3482,
      "num_input_tokens_seen": 31526502032,
      "step": 40071
    },
    {
      "epoch": 4.251220029705071,
      "grad_norm": 0.7351196237738139,
      "learning_rate": 3.609091481161417e-05,
      "loss": 1.3753,
      "num_input_tokens_seen": 31527288672,
      "step": 40072
    },
    {
      "epoch": 4.251326119244642,
      "grad_norm": 0.6739340550322199,
      "learning_rate": 3.6090291971567334e-05,
      "loss": 1.2627,
      "num_input_tokens_seen": 31528075408,
      "step": 40073
    },
    {
      "epoch": 4.251432208784214,
      "grad_norm": 0.5462912582812153,
      "learning_rate": 3.6089669122950244e-05,
      "loss": 1.2694,
      "num_input_tokens_seen": 31528862208,
      "step": 40074
    },
    {
      "epoch": 4.251538298323785,
      "grad_norm": 0.672113690853455,
      "learning_rate": 3.6089046265763376e-05,
      "loss": 1.3122,
      "num_input_tokens_seen": 31529648976,
      "step": 40075
    },
    {
      "epoch": 4.251644387863356,
      "grad_norm": 0.6283299584239944,
      "learning_rate": 3.6088423400007224e-05,
      "loss": 1.2224,
      "num_input_tokens_seen": 31530435680,
      "step": 40076
    },
    {
      "epoch": 4.251750477402928,
      "grad_norm": 0.5565514388425215,
      "learning_rate": 3.608780052568227e-05,
      "loss": 1.2692,
      "num_input_tokens_seen": 31531222480,
      "step": 40077
    },
    {
      "epoch": 4.251856566942499,
      "grad_norm": 0.7036008433172879,
      "learning_rate": 3.6087177642788976e-05,
      "loss": 1.3527,
      "num_input_tokens_seen": 31532009184,
      "step": 40078
    },
    {
      "epoch": 4.251962656482071,
      "grad_norm": 0.5139549919734144,
      "learning_rate": 3.608655475132784e-05,
      "loss": 1.3211,
      "num_input_tokens_seen": 31532795952,
      "step": 40079
    },
    {
      "epoch": 4.252068746021642,
      "grad_norm": 0.4981479269280915,
      "learning_rate": 3.608593185129935e-05,
      "loss": 1.2005,
      "num_input_tokens_seen": 31533582784,
      "step": 40080
    },
    {
      "epoch": 4.252174835561213,
      "grad_norm": 0.5886349205493003,
      "learning_rate": 3.6085308942703964e-05,
      "loss": 1.3001,
      "num_input_tokens_seen": 31534369440,
      "step": 40081
    },
    {
      "epoch": 4.252280925100785,
      "grad_norm": 0.5120241259196254,
      "learning_rate": 3.608468602554219e-05,
      "loss": 1.3844,
      "num_input_tokens_seen": 31535156096,
      "step": 40082
    },
    {
      "epoch": 4.252387014640356,
      "grad_norm": 0.4595812245102389,
      "learning_rate": 3.6084063099814486e-05,
      "loss": 1.2989,
      "num_input_tokens_seen": 31535942832,
      "step": 40083
    },
    {
      "epoch": 4.252493104179928,
      "grad_norm": 0.5660352580298897,
      "learning_rate": 3.608344016552134e-05,
      "loss": 1.316,
      "num_input_tokens_seen": 31536729472,
      "step": 40084
    },
    {
      "epoch": 4.252599193719499,
      "grad_norm": 0.6203973822079266,
      "learning_rate": 3.608281722266324e-05,
      "loss": 1.3933,
      "num_input_tokens_seen": 31537516176,
      "step": 40085
    },
    {
      "epoch": 4.252705283259071,
      "grad_norm": 0.5264139693017894,
      "learning_rate": 3.608219427124068e-05,
      "loss": 1.3063,
      "num_input_tokens_seen": 31538302880,
      "step": 40086
    },
    {
      "epoch": 4.252811372798642,
      "grad_norm": 0.5766479297852338,
      "learning_rate": 3.6081571311254106e-05,
      "loss": 1.3053,
      "num_input_tokens_seen": 31539089616,
      "step": 40087
    },
    {
      "epoch": 4.252917462338213,
      "grad_norm": 0.5675130342908997,
      "learning_rate": 3.608094834270402e-05,
      "loss": 1.3466,
      "num_input_tokens_seen": 31539876368,
      "step": 40088
    },
    {
      "epoch": 4.253023551877785,
      "grad_norm": 0.5410425962347696,
      "learning_rate": 3.608032536559091e-05,
      "loss": 1.3708,
      "num_input_tokens_seen": 31540663152,
      "step": 40089
    },
    {
      "epoch": 4.253129641417356,
      "grad_norm": 0.5587760963701551,
      "learning_rate": 3.607970237991525e-05,
      "loss": 1.2216,
      "num_input_tokens_seen": 31541449952,
      "step": 40090
    },
    {
      "epoch": 4.253235730956928,
      "grad_norm": 0.5638227101767224,
      "learning_rate": 3.6079079385677514e-05,
      "loss": 1.4145,
      "num_input_tokens_seen": 31542236672,
      "step": 40091
    },
    {
      "epoch": 4.253341820496499,
      "grad_norm": 0.5124005592060156,
      "learning_rate": 3.60784563828782e-05,
      "loss": 1.254,
      "num_input_tokens_seen": 31543023440,
      "step": 40092
    },
    {
      "epoch": 4.25344791003607,
      "grad_norm": 0.6050575166185187,
      "learning_rate": 3.6077833371517764e-05,
      "loss": 1.2965,
      "num_input_tokens_seen": 31543810272,
      "step": 40093
    },
    {
      "epoch": 4.253553999575642,
      "grad_norm": 0.5167179596412291,
      "learning_rate": 3.6077210351596724e-05,
      "loss": 1.2896,
      "num_input_tokens_seen": 31544597008,
      "step": 40094
    },
    {
      "epoch": 4.253660089115213,
      "grad_norm": 0.49338146942047423,
      "learning_rate": 3.607658732311552e-05,
      "loss": 1.2717,
      "num_input_tokens_seen": 31545383840,
      "step": 40095
    },
    {
      "epoch": 4.253766178654785,
      "grad_norm": 0.549751352281225,
      "learning_rate": 3.607596428607467e-05,
      "loss": 1.315,
      "num_input_tokens_seen": 31546170624,
      "step": 40096
    },
    {
      "epoch": 4.253872268194356,
      "grad_norm": 0.6042014495483177,
      "learning_rate": 3.6075341240474635e-05,
      "loss": 1.4849,
      "num_input_tokens_seen": 31546957296,
      "step": 40097
    },
    {
      "epoch": 4.253978357733928,
      "grad_norm": 0.532220678688755,
      "learning_rate": 3.6074718186315906e-05,
      "loss": 1.3154,
      "num_input_tokens_seen": 31547744016,
      "step": 40098
    },
    {
      "epoch": 4.254084447273499,
      "grad_norm": 0.5320791595698029,
      "learning_rate": 3.607409512359895e-05,
      "loss": 1.3459,
      "num_input_tokens_seen": 31548530848,
      "step": 40099
    },
    {
      "epoch": 4.25419053681307,
      "grad_norm": 0.5629241098642541,
      "learning_rate": 3.6073472052324264e-05,
      "loss": 1.2957,
      "num_input_tokens_seen": 31549317648,
      "step": 40100
    },
    {
      "epoch": 4.254296626352642,
      "grad_norm": 0.5561127012798899,
      "learning_rate": 3.6072848972492326e-05,
      "loss": 1.4431,
      "num_input_tokens_seen": 31550104416,
      "step": 40101
    },
    {
      "epoch": 4.254402715892213,
      "grad_norm": 0.5841396457383826,
      "learning_rate": 3.607222588410361e-05,
      "loss": 1.3098,
      "num_input_tokens_seen": 31550891200,
      "step": 40102
    },
    {
      "epoch": 4.254508805431785,
      "grad_norm": 0.5307455244196915,
      "learning_rate": 3.60716027871586e-05,
      "loss": 1.3696,
      "num_input_tokens_seen": 31551677904,
      "step": 40103
    },
    {
      "epoch": 4.254614894971356,
      "grad_norm": 0.5531740920610869,
      "learning_rate": 3.6070979681657784e-05,
      "loss": 1.2902,
      "num_input_tokens_seen": 31552464640,
      "step": 40104
    },
    {
      "epoch": 4.254720984510927,
      "grad_norm": 0.5421994061792824,
      "learning_rate": 3.607035656760164e-05,
      "loss": 1.286,
      "num_input_tokens_seen": 31553251376,
      "step": 40105
    },
    {
      "epoch": 4.254827074050499,
      "grad_norm": 0.688399051120824,
      "learning_rate": 3.606973344499066e-05,
      "loss": 1.366,
      "num_input_tokens_seen": 31554038112,
      "step": 40106
    },
    {
      "epoch": 4.25493316359007,
      "grad_norm": 0.6754408799789895,
      "learning_rate": 3.60691103138253e-05,
      "loss": 1.3126,
      "num_input_tokens_seen": 31554824832,
      "step": 40107
    },
    {
      "epoch": 4.255039253129642,
      "grad_norm": 0.5192067691098751,
      "learning_rate": 3.606848717410606e-05,
      "loss": 1.3034,
      "num_input_tokens_seen": 31555611616,
      "step": 40108
    },
    {
      "epoch": 4.255145342669213,
      "grad_norm": 0.5073286417851259,
      "learning_rate": 3.606786402583342e-05,
      "loss": 1.2899,
      "num_input_tokens_seen": 31556398352,
      "step": 40109
    },
    {
      "epoch": 4.255251432208784,
      "grad_norm": 0.645664556376681,
      "learning_rate": 3.606724086900786e-05,
      "loss": 1.4523,
      "num_input_tokens_seen": 31557185120,
      "step": 40110
    },
    {
      "epoch": 4.255357521748356,
      "grad_norm": 0.631199049499342,
      "learning_rate": 3.6066617703629854e-05,
      "loss": 1.2629,
      "num_input_tokens_seen": 31557971984,
      "step": 40111
    },
    {
      "epoch": 4.255463611287927,
      "grad_norm": 0.48260086137028213,
      "learning_rate": 3.60659945296999e-05,
      "loss": 1.2705,
      "num_input_tokens_seen": 31558758768,
      "step": 40112
    },
    {
      "epoch": 4.255569700827499,
      "grad_norm": 0.556090173152997,
      "learning_rate": 3.6065371347218466e-05,
      "loss": 1.364,
      "num_input_tokens_seen": 31559545536,
      "step": 40113
    },
    {
      "epoch": 4.25567579036707,
      "grad_norm": 0.4700542651396297,
      "learning_rate": 3.606474815618604e-05,
      "loss": 1.3168,
      "num_input_tokens_seen": 31560332192,
      "step": 40114
    },
    {
      "epoch": 4.255781879906642,
      "grad_norm": 0.5861215204462005,
      "learning_rate": 3.606412495660309e-05,
      "loss": 1.2765,
      "num_input_tokens_seen": 31561118928,
      "step": 40115
    },
    {
      "epoch": 4.255887969446213,
      "grad_norm": 0.6636199467007827,
      "learning_rate": 3.606350174847012e-05,
      "loss": 1.2635,
      "num_input_tokens_seen": 31561905712,
      "step": 40116
    },
    {
      "epoch": 4.255994058985784,
      "grad_norm": 0.6434732287371145,
      "learning_rate": 3.60628785317876e-05,
      "loss": 1.381,
      "num_input_tokens_seen": 31562692464,
      "step": 40117
    },
    {
      "epoch": 4.256100148525356,
      "grad_norm": 0.658991433072006,
      "learning_rate": 3.606225530655601e-05,
      "loss": 1.2707,
      "num_input_tokens_seen": 31563479216,
      "step": 40118
    },
    {
      "epoch": 4.256206238064927,
      "grad_norm": 0.5002415489399626,
      "learning_rate": 3.606163207277584e-05,
      "loss": 1.2849,
      "num_input_tokens_seen": 31564266000,
      "step": 40119
    },
    {
      "epoch": 4.2563123276044985,
      "grad_norm": 0.48842997987082526,
      "learning_rate": 3.6061008830447555e-05,
      "loss": 1.3127,
      "num_input_tokens_seen": 31565052752,
      "step": 40120
    },
    {
      "epoch": 4.2564184171440695,
      "grad_norm": 0.5299760260758748,
      "learning_rate": 3.6060385579571645e-05,
      "loss": 1.2908,
      "num_input_tokens_seen": 31565839504,
      "step": 40121
    },
    {
      "epoch": 4.2565245066836415,
      "grad_norm": 0.5707136489460289,
      "learning_rate": 3.6059762320148604e-05,
      "loss": 1.2885,
      "num_input_tokens_seen": 31566626208,
      "step": 40122
    },
    {
      "epoch": 4.2566305962232125,
      "grad_norm": 0.5179460635238334,
      "learning_rate": 3.6059139052178905e-05,
      "loss": 1.2499,
      "num_input_tokens_seen": 31567412976,
      "step": 40123
    },
    {
      "epoch": 4.2567366857627835,
      "grad_norm": 0.5300895951820563,
      "learning_rate": 3.6058515775663016e-05,
      "loss": 1.4354,
      "num_input_tokens_seen": 31568199760,
      "step": 40124
    },
    {
      "epoch": 4.256842775302355,
      "grad_norm": 0.46348251735472135,
      "learning_rate": 3.605789249060143e-05,
      "loss": 1.3032,
      "num_input_tokens_seen": 31568986560,
      "step": 40125
    },
    {
      "epoch": 4.2569488648419265,
      "grad_norm": 0.5436151899546957,
      "learning_rate": 3.605726919699465e-05,
      "loss": 1.3575,
      "num_input_tokens_seen": 31569773296,
      "step": 40126
    },
    {
      "epoch": 4.257054954381498,
      "grad_norm": 0.47050820417282174,
      "learning_rate": 3.605664589484311e-05,
      "loss": 1.2181,
      "num_input_tokens_seen": 31570560048,
      "step": 40127
    },
    {
      "epoch": 4.257161043921069,
      "grad_norm": 0.5338537736786186,
      "learning_rate": 3.605602258414733e-05,
      "loss": 1.243,
      "num_input_tokens_seen": 31571346864,
      "step": 40128
    },
    {
      "epoch": 4.2572671334606405,
      "grad_norm": 0.5439529405525514,
      "learning_rate": 3.605539926490778e-05,
      "loss": 1.2924,
      "num_input_tokens_seen": 31572133664,
      "step": 40129
    },
    {
      "epoch": 4.257373223000212,
      "grad_norm": 0.4785642103553381,
      "learning_rate": 3.605477593712494e-05,
      "loss": 1.2591,
      "num_input_tokens_seen": 31572920368,
      "step": 40130
    },
    {
      "epoch": 4.257479312539783,
      "grad_norm": 0.4931754098819196,
      "learning_rate": 3.6054152600799304e-05,
      "loss": 1.3203,
      "num_input_tokens_seen": 31573707152,
      "step": 40131
    },
    {
      "epoch": 4.257585402079355,
      "grad_norm": 0.5356716704989904,
      "learning_rate": 3.605352925593133e-05,
      "loss": 1.2949,
      "num_input_tokens_seen": 31574493888,
      "step": 40132
    },
    {
      "epoch": 4.257691491618926,
      "grad_norm": 0.4931716173459722,
      "learning_rate": 3.605290590252152e-05,
      "loss": 1.2231,
      "num_input_tokens_seen": 31575280672,
      "step": 40133
    },
    {
      "epoch": 4.257797581158497,
      "grad_norm": 0.6686480393030386,
      "learning_rate": 3.6052282540570346e-05,
      "loss": 1.351,
      "num_input_tokens_seen": 31576067456,
      "step": 40134
    },
    {
      "epoch": 4.257903670698069,
      "grad_norm": 0.48420492085475536,
      "learning_rate": 3.60516591700783e-05,
      "loss": 1.292,
      "num_input_tokens_seen": 31576854304,
      "step": 40135
    },
    {
      "epoch": 4.25800976023764,
      "grad_norm": 0.6087202896674699,
      "learning_rate": 3.6051035791045845e-05,
      "loss": 1.3257,
      "num_input_tokens_seen": 31577641200,
      "step": 40136
    },
    {
      "epoch": 4.258115849777212,
      "grad_norm": 0.5077583095508231,
      "learning_rate": 3.6050412403473474e-05,
      "loss": 1.3514,
      "num_input_tokens_seen": 31578427984,
      "step": 40137
    },
    {
      "epoch": 4.258221939316783,
      "grad_norm": 0.5806208719903589,
      "learning_rate": 3.604978900736167e-05,
      "loss": 1.3845,
      "num_input_tokens_seen": 31579214784,
      "step": 40138
    },
    {
      "epoch": 4.258328028856354,
      "grad_norm": 0.5268075418496635,
      "learning_rate": 3.604916560271092e-05,
      "loss": 1.1807,
      "num_input_tokens_seen": 31580001520,
      "step": 40139
    },
    {
      "epoch": 4.258434118395926,
      "grad_norm": 0.4861766039938928,
      "learning_rate": 3.60485421895217e-05,
      "loss": 1.2626,
      "num_input_tokens_seen": 31580788320,
      "step": 40140
    },
    {
      "epoch": 4.258540207935497,
      "grad_norm": 0.5997142146991417,
      "learning_rate": 3.604791876779448e-05,
      "loss": 1.285,
      "num_input_tokens_seen": 31581575040,
      "step": 40141
    },
    {
      "epoch": 4.258646297475069,
      "grad_norm": 0.599196408394099,
      "learning_rate": 3.6047295337529764e-05,
      "loss": 1.3572,
      "num_input_tokens_seen": 31582361792,
      "step": 40142
    },
    {
      "epoch": 4.25875238701464,
      "grad_norm": 0.4754856961729808,
      "learning_rate": 3.604667189872802e-05,
      "loss": 1.3468,
      "num_input_tokens_seen": 31583148480,
      "step": 40143
    },
    {
      "epoch": 4.258858476554212,
      "grad_norm": 0.549895831830476,
      "learning_rate": 3.6046048451389724e-05,
      "loss": 1.2743,
      "num_input_tokens_seen": 31583935360,
      "step": 40144
    },
    {
      "epoch": 4.258964566093783,
      "grad_norm": 0.518317784114936,
      "learning_rate": 3.604542499551537e-05,
      "loss": 1.3095,
      "num_input_tokens_seen": 31584722096,
      "step": 40145
    },
    {
      "epoch": 4.259070655633354,
      "grad_norm": 0.5978885779202672,
      "learning_rate": 3.604480153110544e-05,
      "loss": 1.3644,
      "num_input_tokens_seen": 31585508896,
      "step": 40146
    },
    {
      "epoch": 4.259176745172926,
      "grad_norm": 0.5676324787971084,
      "learning_rate": 3.60441780581604e-05,
      "loss": 1.4023,
      "num_input_tokens_seen": 31586295584,
      "step": 40147
    },
    {
      "epoch": 4.259282834712497,
      "grad_norm": 0.5471787818146091,
      "learning_rate": 3.6043554576680755e-05,
      "loss": 1.2367,
      "num_input_tokens_seen": 31587082432,
      "step": 40148
    },
    {
      "epoch": 4.259388924252069,
      "grad_norm": 0.4950045418131245,
      "learning_rate": 3.604293108666697e-05,
      "loss": 1.2511,
      "num_input_tokens_seen": 31587869280,
      "step": 40149
    },
    {
      "epoch": 4.25949501379164,
      "grad_norm": 0.581497974572844,
      "learning_rate": 3.604230758811954e-05,
      "loss": 1.3973,
      "num_input_tokens_seen": 31588656048,
      "step": 40150
    },
    {
      "epoch": 4.259601103331212,
      "grad_norm": 0.47676817150244305,
      "learning_rate": 3.604168408103893e-05,
      "loss": 1.275,
      "num_input_tokens_seen": 31589442848,
      "step": 40151
    },
    {
      "epoch": 4.259707192870783,
      "grad_norm": 0.4987335355441531,
      "learning_rate": 3.6041060565425636e-05,
      "loss": 1.3512,
      "num_input_tokens_seen": 31590229648,
      "step": 40152
    },
    {
      "epoch": 4.259813282410354,
      "grad_norm": 0.48987209103587986,
      "learning_rate": 3.6040437041280126e-05,
      "loss": 1.252,
      "num_input_tokens_seen": 31591016352,
      "step": 40153
    },
    {
      "epoch": 4.259919371949926,
      "grad_norm": 0.5199345690146212,
      "learning_rate": 3.6039813508602894e-05,
      "loss": 1.2882,
      "num_input_tokens_seen": 31591803024,
      "step": 40154
    },
    {
      "epoch": 4.260025461489497,
      "grad_norm": 0.43728146540833024,
      "learning_rate": 3.6039189967394413e-05,
      "loss": 1.279,
      "num_input_tokens_seen": 31592589728,
      "step": 40155
    },
    {
      "epoch": 4.260131551029069,
      "grad_norm": 0.5416187622220107,
      "learning_rate": 3.603856641765518e-05,
      "loss": 1.4242,
      "num_input_tokens_seen": 31593376336,
      "step": 40156
    },
    {
      "epoch": 4.26023764056864,
      "grad_norm": 0.5360571557493924,
      "learning_rate": 3.603794285938567e-05,
      "loss": 1.3588,
      "num_input_tokens_seen": 31594163104,
      "step": 40157
    },
    {
      "epoch": 4.260343730108211,
      "grad_norm": 0.5492095195542803,
      "learning_rate": 3.603731929258635e-05,
      "loss": 1.3034,
      "num_input_tokens_seen": 31594949792,
      "step": 40158
    },
    {
      "epoch": 4.260449819647783,
      "grad_norm": 0.4927139343677471,
      "learning_rate": 3.6036695717257715e-05,
      "loss": 1.2935,
      "num_input_tokens_seen": 31595736496,
      "step": 40159
    },
    {
      "epoch": 4.260555909187354,
      "grad_norm": 0.6664085720065168,
      "learning_rate": 3.6036072133400244e-05,
      "loss": 1.409,
      "num_input_tokens_seen": 31596523248,
      "step": 40160
    },
    {
      "epoch": 4.260661998726926,
      "grad_norm": 0.5038510966689238,
      "learning_rate": 3.6035448541014426e-05,
      "loss": 1.2737,
      "num_input_tokens_seen": 31597310032,
      "step": 40161
    },
    {
      "epoch": 4.260768088266497,
      "grad_norm": 0.6573950208902758,
      "learning_rate": 3.6034824940100735e-05,
      "loss": 1.3046,
      "num_input_tokens_seen": 31598096768,
      "step": 40162
    },
    {
      "epoch": 4.260874177806068,
      "grad_norm": 0.5157664434056364,
      "learning_rate": 3.603420133065966e-05,
      "loss": 1.2986,
      "num_input_tokens_seen": 31598883584,
      "step": 40163
    },
    {
      "epoch": 4.26098026734564,
      "grad_norm": 0.8374832225647373,
      "learning_rate": 3.603357771269167e-05,
      "loss": 1.2838,
      "num_input_tokens_seen": 31599670352,
      "step": 40164
    },
    {
      "epoch": 4.261086356885211,
      "grad_norm": 0.55107134633848,
      "learning_rate": 3.603295408619726e-05,
      "loss": 1.3285,
      "num_input_tokens_seen": 31600457104,
      "step": 40165
    },
    {
      "epoch": 4.261192446424783,
      "grad_norm": 0.5653013104369807,
      "learning_rate": 3.60323304511769e-05,
      "loss": 1.3089,
      "num_input_tokens_seen": 31601243840,
      "step": 40166
    },
    {
      "epoch": 4.261298535964354,
      "grad_norm": 0.5372843827635262,
      "learning_rate": 3.603170680763108e-05,
      "loss": 1.2739,
      "num_input_tokens_seen": 31602030640,
      "step": 40167
    },
    {
      "epoch": 4.261404625503925,
      "grad_norm": 0.44719052774680407,
      "learning_rate": 3.603108315556029e-05,
      "loss": 1.1809,
      "num_input_tokens_seen": 31602817440,
      "step": 40168
    },
    {
      "epoch": 4.261510715043497,
      "grad_norm": 0.5450452627600318,
      "learning_rate": 3.6030459494965005e-05,
      "loss": 1.2487,
      "num_input_tokens_seen": 31603604272,
      "step": 40169
    },
    {
      "epoch": 4.261616804583068,
      "grad_norm": 0.5150586534163831,
      "learning_rate": 3.602983582584569e-05,
      "loss": 1.2634,
      "num_input_tokens_seen": 31604391120,
      "step": 40170
    },
    {
      "epoch": 4.26172289412264,
      "grad_norm": 0.5732873034706093,
      "learning_rate": 3.602921214820285e-05,
      "loss": 1.267,
      "num_input_tokens_seen": 31605177936,
      "step": 40171
    },
    {
      "epoch": 4.261828983662211,
      "grad_norm": 0.7188854463854659,
      "learning_rate": 3.602858846203695e-05,
      "loss": 1.3836,
      "num_input_tokens_seen": 31605964672,
      "step": 40172
    },
    {
      "epoch": 4.261935073201783,
      "grad_norm": 0.620802772013713,
      "learning_rate": 3.6027964767348495e-05,
      "loss": 1.444,
      "num_input_tokens_seen": 31606751328,
      "step": 40173
    },
    {
      "epoch": 4.262041162741354,
      "grad_norm": 0.549385817833265,
      "learning_rate": 3.6027341064137936e-05,
      "loss": 1.2521,
      "num_input_tokens_seen": 31607538128,
      "step": 40174
    },
    {
      "epoch": 4.262147252280925,
      "grad_norm": 0.5341096395237344,
      "learning_rate": 3.602671735240578e-05,
      "loss": 1.3652,
      "num_input_tokens_seen": 31608324896,
      "step": 40175
    },
    {
      "epoch": 4.262253341820497,
      "grad_norm": 0.5124473330151802,
      "learning_rate": 3.6026093632152504e-05,
      "loss": 1.2839,
      "num_input_tokens_seen": 31609111632,
      "step": 40176
    },
    {
      "epoch": 4.262359431360068,
      "grad_norm": 0.5703733956142382,
      "learning_rate": 3.6025469903378586e-05,
      "loss": 1.297,
      "num_input_tokens_seen": 31609898336,
      "step": 40177
    },
    {
      "epoch": 4.26246552089964,
      "grad_norm": 0.6643619041788088,
      "learning_rate": 3.60248461660845e-05,
      "loss": 1.2683,
      "num_input_tokens_seen": 31610685088,
      "step": 40178
    },
    {
      "epoch": 4.262571610439211,
      "grad_norm": 0.7591101875496743,
      "learning_rate": 3.602422242027074e-05,
      "loss": 1.3874,
      "num_input_tokens_seen": 31611471856,
      "step": 40179
    },
    {
      "epoch": 4.2626776999787825,
      "grad_norm": 0.4831757409866201,
      "learning_rate": 3.6023598665937784e-05,
      "loss": 1.3593,
      "num_input_tokens_seen": 31612258656,
      "step": 40180
    },
    {
      "epoch": 4.262783789518354,
      "grad_norm": 0.5167584790976977,
      "learning_rate": 3.602297490308612e-05,
      "loss": 1.2442,
      "num_input_tokens_seen": 31613045488,
      "step": 40181
    },
    {
      "epoch": 4.262889879057925,
      "grad_norm": 0.586028009846223,
      "learning_rate": 3.602235113171622e-05,
      "loss": 1.2806,
      "num_input_tokens_seen": 31613832176,
      "step": 40182
    },
    {
      "epoch": 4.2629959685974965,
      "grad_norm": 0.5681401500599155,
      "learning_rate": 3.6021727351828574e-05,
      "loss": 1.3302,
      "num_input_tokens_seen": 31614618880,
      "step": 40183
    },
    {
      "epoch": 4.2631020581370676,
      "grad_norm": 0.724146545620207,
      "learning_rate": 3.602110356342365e-05,
      "loss": 1.3849,
      "num_input_tokens_seen": 31615405648,
      "step": 40184
    },
    {
      "epoch": 4.2632081476766395,
      "grad_norm": 0.5360662182346488,
      "learning_rate": 3.6020479766501955e-05,
      "loss": 1.271,
      "num_input_tokens_seen": 31616192432,
      "step": 40185
    },
    {
      "epoch": 4.2633142372162105,
      "grad_norm": 0.6035661491516606,
      "learning_rate": 3.6019855961063945e-05,
      "loss": 1.349,
      "num_input_tokens_seen": 31616979152,
      "step": 40186
    },
    {
      "epoch": 4.2634203267557815,
      "grad_norm": 0.7381752840644213,
      "learning_rate": 3.601923214711012e-05,
      "loss": 1.3157,
      "num_input_tokens_seen": 31617765872,
      "step": 40187
    },
    {
      "epoch": 4.2635264162953534,
      "grad_norm": 0.8916032476999665,
      "learning_rate": 3.601860832464096e-05,
      "loss": 1.3918,
      "num_input_tokens_seen": 31618552720,
      "step": 40188
    },
    {
      "epoch": 4.2636325058349245,
      "grad_norm": 0.6253751463460596,
      "learning_rate": 3.601798449365693e-05,
      "loss": 1.3564,
      "num_input_tokens_seen": 31619339520,
      "step": 40189
    },
    {
      "epoch": 4.263738595374496,
      "grad_norm": 0.5599264127796821,
      "learning_rate": 3.601736065415853e-05,
      "loss": 1.2711,
      "num_input_tokens_seen": 31620126208,
      "step": 40190
    },
    {
      "epoch": 4.263844684914067,
      "grad_norm": 0.5267078894472345,
      "learning_rate": 3.601673680614624e-05,
      "loss": 1.2616,
      "num_input_tokens_seen": 31620912976,
      "step": 40191
    },
    {
      "epoch": 4.2639507744536385,
      "grad_norm": 0.6346073635928168,
      "learning_rate": 3.601611294962054e-05,
      "loss": 1.3721,
      "num_input_tokens_seen": 31621699744,
      "step": 40192
    },
    {
      "epoch": 4.26405686399321,
      "grad_norm": 0.48414084802213925,
      "learning_rate": 3.60154890845819e-05,
      "loss": 1.247,
      "num_input_tokens_seen": 31622486592,
      "step": 40193
    },
    {
      "epoch": 4.264162953532781,
      "grad_norm": 0.6017434364061035,
      "learning_rate": 3.601486521103083e-05,
      "loss": 1.2178,
      "num_input_tokens_seen": 31623273440,
      "step": 40194
    },
    {
      "epoch": 4.264269043072353,
      "grad_norm": 0.6570174721499139,
      "learning_rate": 3.6014241328967793e-05,
      "loss": 1.2936,
      "num_input_tokens_seen": 31624060256,
      "step": 40195
    },
    {
      "epoch": 4.264375132611924,
      "grad_norm": 0.6596749837684017,
      "learning_rate": 3.601361743839326e-05,
      "loss": 1.2721,
      "num_input_tokens_seen": 31624847088,
      "step": 40196
    },
    {
      "epoch": 4.264481222151496,
      "grad_norm": 0.6976727778356164,
      "learning_rate": 3.601299353930774e-05,
      "loss": 1.4078,
      "num_input_tokens_seen": 31625633856,
      "step": 40197
    },
    {
      "epoch": 4.264587311691067,
      "grad_norm": 0.5168941194237268,
      "learning_rate": 3.601236963171169e-05,
      "loss": 1.4027,
      "num_input_tokens_seen": 31626420608,
      "step": 40198
    },
    {
      "epoch": 4.264693401230638,
      "grad_norm": 0.5541123969035185,
      "learning_rate": 3.601174571560562e-05,
      "loss": 1.4351,
      "num_input_tokens_seen": 31627207360,
      "step": 40199
    },
    {
      "epoch": 4.26479949077021,
      "grad_norm": 0.5311699203560201,
      "learning_rate": 3.6011121790989984e-05,
      "loss": 1.2674,
      "num_input_tokens_seen": 31627994160,
      "step": 40200
    },
    {
      "epoch": 4.264905580309781,
      "grad_norm": 0.5101213809769971,
      "learning_rate": 3.6010497857865274e-05,
      "loss": 1.3933,
      "num_input_tokens_seen": 31628780880,
      "step": 40201
    },
    {
      "epoch": 4.265011669849353,
      "grad_norm": 0.5901152074167807,
      "learning_rate": 3.6009873916231976e-05,
      "loss": 1.3942,
      "num_input_tokens_seen": 31629567728,
      "step": 40202
    },
    {
      "epoch": 4.265117759388924,
      "grad_norm": 0.49818574712790586,
      "learning_rate": 3.600924996609057e-05,
      "loss": 1.2666,
      "num_input_tokens_seen": 31630354560,
      "step": 40203
    },
    {
      "epoch": 4.265223848928495,
      "grad_norm": 0.5582086914689066,
      "learning_rate": 3.600862600744155e-05,
      "loss": 1.3347,
      "num_input_tokens_seen": 31631141296,
      "step": 40204
    },
    {
      "epoch": 4.265329938468067,
      "grad_norm": 0.5267594663839454,
      "learning_rate": 3.600800204028538e-05,
      "loss": 1.2776,
      "num_input_tokens_seen": 31631927936,
      "step": 40205
    },
    {
      "epoch": 4.265436028007638,
      "grad_norm": 0.4499184755793806,
      "learning_rate": 3.6007378064622546e-05,
      "loss": 1.285,
      "num_input_tokens_seen": 31632714688,
      "step": 40206
    },
    {
      "epoch": 4.26554211754721,
      "grad_norm": 0.6754689542322142,
      "learning_rate": 3.600675408045353e-05,
      "loss": 1.3691,
      "num_input_tokens_seen": 31633501424,
      "step": 40207
    },
    {
      "epoch": 4.265648207086781,
      "grad_norm": 0.49922137055653854,
      "learning_rate": 3.600613008777882e-05,
      "loss": 1.3376,
      "num_input_tokens_seen": 31634288128,
      "step": 40208
    },
    {
      "epoch": 4.265754296626353,
      "grad_norm": 0.6020133772497859,
      "learning_rate": 3.60055060865989e-05,
      "loss": 1.3688,
      "num_input_tokens_seen": 31635074944,
      "step": 40209
    },
    {
      "epoch": 4.265860386165924,
      "grad_norm": 0.5005631340773173,
      "learning_rate": 3.6004882076914246e-05,
      "loss": 1.2252,
      "num_input_tokens_seen": 31635861744,
      "step": 40210
    },
    {
      "epoch": 4.265966475705495,
      "grad_norm": 0.5026601324783574,
      "learning_rate": 3.600425805872535e-05,
      "loss": 1.2767,
      "num_input_tokens_seen": 31636648432,
      "step": 40211
    },
    {
      "epoch": 4.266072565245067,
      "grad_norm": 0.5160322651750074,
      "learning_rate": 3.6003634032032674e-05,
      "loss": 1.2657,
      "num_input_tokens_seen": 31637435216,
      "step": 40212
    },
    {
      "epoch": 4.266178654784638,
      "grad_norm": 0.5582304258762356,
      "learning_rate": 3.600300999683671e-05,
      "loss": 1.2722,
      "num_input_tokens_seen": 31638221904,
      "step": 40213
    },
    {
      "epoch": 4.26628474432421,
      "grad_norm": 0.4955962988219973,
      "learning_rate": 3.600238595313796e-05,
      "loss": 1.1885,
      "num_input_tokens_seen": 31639008720,
      "step": 40214
    },
    {
      "epoch": 4.266390833863781,
      "grad_norm": 0.5745599641219741,
      "learning_rate": 3.600176190093687e-05,
      "loss": 1.2632,
      "num_input_tokens_seen": 31639795424,
      "step": 40215
    },
    {
      "epoch": 4.266496923403352,
      "grad_norm": 0.5216668823848527,
      "learning_rate": 3.6001137840233954e-05,
      "loss": 1.3257,
      "num_input_tokens_seen": 31640582160,
      "step": 40216
    },
    {
      "epoch": 4.266603012942924,
      "grad_norm": 0.5333539659334532,
      "learning_rate": 3.6000513771029675e-05,
      "loss": 1.2929,
      "num_input_tokens_seen": 31641368912,
      "step": 40217
    },
    {
      "epoch": 4.266709102482495,
      "grad_norm": 0.6300306989457167,
      "learning_rate": 3.599988969332452e-05,
      "loss": 1.3345,
      "num_input_tokens_seen": 31642155744,
      "step": 40218
    },
    {
      "epoch": 4.266815192022067,
      "grad_norm": 0.45750778904541983,
      "learning_rate": 3.599926560711898e-05,
      "loss": 1.3116,
      "num_input_tokens_seen": 31642942448,
      "step": 40219
    },
    {
      "epoch": 4.266921281561638,
      "grad_norm": 0.6700167050320066,
      "learning_rate": 3.599864151241353e-05,
      "loss": 1.3728,
      "num_input_tokens_seen": 31643729152,
      "step": 40220
    },
    {
      "epoch": 4.267027371101209,
      "grad_norm": 0.6642734580710256,
      "learning_rate": 3.599801740920865e-05,
      "loss": 1.3621,
      "num_input_tokens_seen": 31644515808,
      "step": 40221
    },
    {
      "epoch": 4.267133460640781,
      "grad_norm": 0.4758994936508588,
      "learning_rate": 3.5997393297504815e-05,
      "loss": 1.3774,
      "num_input_tokens_seen": 31645302592,
      "step": 40222
    },
    {
      "epoch": 4.267239550180352,
      "grad_norm": 0.8514371431968836,
      "learning_rate": 3.599676917730253e-05,
      "loss": 1.3224,
      "num_input_tokens_seen": 31646089408,
      "step": 40223
    },
    {
      "epoch": 4.267345639719924,
      "grad_norm": 0.4607949422619983,
      "learning_rate": 3.599614504860226e-05,
      "loss": 1.3408,
      "num_input_tokens_seen": 31646876224,
      "step": 40224
    },
    {
      "epoch": 4.267451729259495,
      "grad_norm": 0.602648678486763,
      "learning_rate": 3.599552091140449e-05,
      "loss": 1.3098,
      "num_input_tokens_seen": 31647663008,
      "step": 40225
    },
    {
      "epoch": 4.267557818799067,
      "grad_norm": 0.5686428083827503,
      "learning_rate": 3.5994896765709706e-05,
      "loss": 1.3961,
      "num_input_tokens_seen": 31648449792,
      "step": 40226
    },
    {
      "epoch": 4.267663908338638,
      "grad_norm": 0.5229051531476933,
      "learning_rate": 3.599427261151839e-05,
      "loss": 1.341,
      "num_input_tokens_seen": 31649236512,
      "step": 40227
    },
    {
      "epoch": 4.267769997878209,
      "grad_norm": 0.578226844781048,
      "learning_rate": 3.599364844883103e-05,
      "loss": 1.3633,
      "num_input_tokens_seen": 31650023264,
      "step": 40228
    },
    {
      "epoch": 4.267876087417781,
      "grad_norm": 0.4946934873921205,
      "learning_rate": 3.599302427764809e-05,
      "loss": 1.3013,
      "num_input_tokens_seen": 31650810032,
      "step": 40229
    },
    {
      "epoch": 4.267982176957352,
      "grad_norm": 0.5014339450788091,
      "learning_rate": 3.599240009797006e-05,
      "loss": 1.2902,
      "num_input_tokens_seen": 31651596816,
      "step": 40230
    },
    {
      "epoch": 4.268088266496924,
      "grad_norm": 0.4796802626741043,
      "learning_rate": 3.599177590979743e-05,
      "loss": 1.339,
      "num_input_tokens_seen": 31652383536,
      "step": 40231
    },
    {
      "epoch": 4.268194356036495,
      "grad_norm": 0.6049794189281883,
      "learning_rate": 3.599115171313069e-05,
      "loss": 1.3834,
      "num_input_tokens_seen": 31653170304,
      "step": 40232
    },
    {
      "epoch": 4.268300445576066,
      "grad_norm": 0.4885508904047137,
      "learning_rate": 3.5990527507970294e-05,
      "loss": 1.3765,
      "num_input_tokens_seen": 31653957008,
      "step": 40233
    },
    {
      "epoch": 4.268406535115638,
      "grad_norm": 0.5657532501356406,
      "learning_rate": 3.598990329431675e-05,
      "loss": 1.2575,
      "num_input_tokens_seen": 31654743888,
      "step": 40234
    },
    {
      "epoch": 4.268512624655209,
      "grad_norm": 0.5997429737555445,
      "learning_rate": 3.598927907217053e-05,
      "loss": 1.2738,
      "num_input_tokens_seen": 31655530656,
      "step": 40235
    },
    {
      "epoch": 4.268618714194781,
      "grad_norm": 0.545382147657208,
      "learning_rate": 3.598865484153211e-05,
      "loss": 1.3096,
      "num_input_tokens_seen": 31656317344,
      "step": 40236
    },
    {
      "epoch": 4.268724803734352,
      "grad_norm": 0.6520694700830576,
      "learning_rate": 3.598803060240199e-05,
      "loss": 1.3046,
      "num_input_tokens_seen": 31657104112,
      "step": 40237
    },
    {
      "epoch": 4.268830893273924,
      "grad_norm": 0.47007318062550124,
      "learning_rate": 3.598740635478064e-05,
      "loss": 1.2878,
      "num_input_tokens_seen": 31657890880,
      "step": 40238
    },
    {
      "epoch": 4.268936982813495,
      "grad_norm": 0.5378180861393682,
      "learning_rate": 3.5986782098668533e-05,
      "loss": 1.341,
      "num_input_tokens_seen": 31658677616,
      "step": 40239
    },
    {
      "epoch": 4.269043072353066,
      "grad_norm": 0.5216324454961093,
      "learning_rate": 3.598615783406618e-05,
      "loss": 1.2529,
      "num_input_tokens_seen": 31659464368,
      "step": 40240
    },
    {
      "epoch": 4.269149161892638,
      "grad_norm": 0.6174421784093985,
      "learning_rate": 3.598553356097404e-05,
      "loss": 1.3914,
      "num_input_tokens_seen": 31660251136,
      "step": 40241
    },
    {
      "epoch": 4.269255251432209,
      "grad_norm": 0.605574786275921,
      "learning_rate": 3.5984909279392604e-05,
      "loss": 1.3423,
      "num_input_tokens_seen": 31661037936,
      "step": 40242
    },
    {
      "epoch": 4.2693613409717805,
      "grad_norm": 0.5389000654412062,
      "learning_rate": 3.598428498932235e-05,
      "loss": 1.3094,
      "num_input_tokens_seen": 31661824704,
      "step": 40243
    },
    {
      "epoch": 4.269467430511352,
      "grad_norm": 0.4907999244913546,
      "learning_rate": 3.598366069076376e-05,
      "loss": 1.3133,
      "num_input_tokens_seen": 31662611504,
      "step": 40244
    },
    {
      "epoch": 4.269573520050923,
      "grad_norm": 0.49408470942365795,
      "learning_rate": 3.5983036383717326e-05,
      "loss": 1.2911,
      "num_input_tokens_seen": 31663398320,
      "step": 40245
    },
    {
      "epoch": 4.2696796095904945,
      "grad_norm": 0.46282534594937963,
      "learning_rate": 3.598241206818352e-05,
      "loss": 1.2338,
      "num_input_tokens_seen": 31664185200,
      "step": 40246
    },
    {
      "epoch": 4.269785699130066,
      "grad_norm": 0.6195716038720128,
      "learning_rate": 3.598178774416283e-05,
      "loss": 1.2773,
      "num_input_tokens_seen": 31664971952,
      "step": 40247
    },
    {
      "epoch": 4.2698917886696375,
      "grad_norm": 0.5675891844636484,
      "learning_rate": 3.5981163411655735e-05,
      "loss": 1.3686,
      "num_input_tokens_seen": 31665758672,
      "step": 40248
    },
    {
      "epoch": 4.2699978782092085,
      "grad_norm": 0.5042773438056619,
      "learning_rate": 3.598053907066272e-05,
      "loss": 1.2413,
      "num_input_tokens_seen": 31666545520,
      "step": 40249
    },
    {
      "epoch": 4.2701039677487795,
      "grad_norm": 0.5004526638407502,
      "learning_rate": 3.597991472118426e-05,
      "loss": 1.3102,
      "num_input_tokens_seen": 31667332224,
      "step": 40250
    },
    {
      "epoch": 4.2702100572883515,
      "grad_norm": 0.6439511397439999,
      "learning_rate": 3.597929036322085e-05,
      "loss": 1.4029,
      "num_input_tokens_seen": 31668118912,
      "step": 40251
    },
    {
      "epoch": 4.2703161468279225,
      "grad_norm": 0.496069866312621,
      "learning_rate": 3.597866599677297e-05,
      "loss": 1.315,
      "num_input_tokens_seen": 31668905664,
      "step": 40252
    },
    {
      "epoch": 4.270422236367494,
      "grad_norm": 0.5013699013029667,
      "learning_rate": 3.597804162184109e-05,
      "loss": 1.3372,
      "num_input_tokens_seen": 31669692384,
      "step": 40253
    },
    {
      "epoch": 4.270528325907065,
      "grad_norm": 0.5649001794787681,
      "learning_rate": 3.597741723842571e-05,
      "loss": 1.2587,
      "num_input_tokens_seen": 31670479120,
      "step": 40254
    },
    {
      "epoch": 4.270634415446637,
      "grad_norm": 0.5268984082561218,
      "learning_rate": 3.5976792846527305e-05,
      "loss": 1.3926,
      "num_input_tokens_seen": 31671265856,
      "step": 40255
    },
    {
      "epoch": 4.270740504986208,
      "grad_norm": 0.5533009291983382,
      "learning_rate": 3.597616844614635e-05,
      "loss": 1.2479,
      "num_input_tokens_seen": 31672052704,
      "step": 40256
    },
    {
      "epoch": 4.270846594525779,
      "grad_norm": 0.722131462014877,
      "learning_rate": 3.5975544037283336e-05,
      "loss": 1.343,
      "num_input_tokens_seen": 31672839488,
      "step": 40257
    },
    {
      "epoch": 4.270952684065351,
      "grad_norm": 0.5730654798618664,
      "learning_rate": 3.5974919619938744e-05,
      "loss": 1.2505,
      "num_input_tokens_seen": 31673626224,
      "step": 40258
    },
    {
      "epoch": 4.271058773604922,
      "grad_norm": 0.7316299006164535,
      "learning_rate": 3.5974295194113055e-05,
      "loss": 1.3159,
      "num_input_tokens_seen": 31674413008,
      "step": 40259
    },
    {
      "epoch": 4.271164863144494,
      "grad_norm": 0.5328657196527338,
      "learning_rate": 3.597367075980676e-05,
      "loss": 1.2723,
      "num_input_tokens_seen": 31675199776,
      "step": 40260
    },
    {
      "epoch": 4.271270952684065,
      "grad_norm": 0.6888729744032288,
      "learning_rate": 3.597304631702032e-05,
      "loss": 1.3008,
      "num_input_tokens_seen": 31675986384,
      "step": 40261
    },
    {
      "epoch": 4.271377042223636,
      "grad_norm": 0.7566589846555147,
      "learning_rate": 3.5972421865754244e-05,
      "loss": 1.2735,
      "num_input_tokens_seen": 31676773184,
      "step": 40262
    },
    {
      "epoch": 4.271483131763208,
      "grad_norm": 0.5385944349497976,
      "learning_rate": 3.5971797406009e-05,
      "loss": 1.3086,
      "num_input_tokens_seen": 31677559952,
      "step": 40263
    },
    {
      "epoch": 4.271589221302779,
      "grad_norm": 0.7257817169435676,
      "learning_rate": 3.597117293778507e-05,
      "loss": 1.2572,
      "num_input_tokens_seen": 31678346688,
      "step": 40264
    },
    {
      "epoch": 4.271695310842351,
      "grad_norm": 0.6341803682707825,
      "learning_rate": 3.597054846108294e-05,
      "loss": 1.3423,
      "num_input_tokens_seen": 31679133408,
      "step": 40265
    },
    {
      "epoch": 4.271801400381922,
      "grad_norm": 0.5186417210915237,
      "learning_rate": 3.59699239759031e-05,
      "loss": 1.319,
      "num_input_tokens_seen": 31679920192,
      "step": 40266
    },
    {
      "epoch": 4.271907489921494,
      "grad_norm": 0.5627614724039298,
      "learning_rate": 3.596929948224601e-05,
      "loss": 1.287,
      "num_input_tokens_seen": 31680706928,
      "step": 40267
    },
    {
      "epoch": 4.272013579461065,
      "grad_norm": 0.6021388195422906,
      "learning_rate": 3.596867498011218e-05,
      "loss": 1.2833,
      "num_input_tokens_seen": 31681493824,
      "step": 40268
    },
    {
      "epoch": 4.272119669000636,
      "grad_norm": 0.5633280083111986,
      "learning_rate": 3.596805046950207e-05,
      "loss": 1.3247,
      "num_input_tokens_seen": 31682280640,
      "step": 40269
    },
    {
      "epoch": 4.272225758540208,
      "grad_norm": 0.7135080688410672,
      "learning_rate": 3.596742595041617e-05,
      "loss": 1.3673,
      "num_input_tokens_seen": 31683067504,
      "step": 40270
    },
    {
      "epoch": 4.272331848079779,
      "grad_norm": 0.4850508744539568,
      "learning_rate": 3.596680142285498e-05,
      "loss": 1.2714,
      "num_input_tokens_seen": 31683854304,
      "step": 40271
    },
    {
      "epoch": 4.272437937619351,
      "grad_norm": 0.6895998213459146,
      "learning_rate": 3.596617688681896e-05,
      "loss": 1.2217,
      "num_input_tokens_seen": 31684641088,
      "step": 40272
    },
    {
      "epoch": 4.272544027158922,
      "grad_norm": 0.5895343043778901,
      "learning_rate": 3.5965552342308595e-05,
      "loss": 1.3556,
      "num_input_tokens_seen": 31685427904,
      "step": 40273
    },
    {
      "epoch": 4.272650116698493,
      "grad_norm": 0.5016908825119545,
      "learning_rate": 3.596492778932438e-05,
      "loss": 1.3054,
      "num_input_tokens_seen": 31686214672,
      "step": 40274
    },
    {
      "epoch": 4.272756206238065,
      "grad_norm": 0.6956875812161186,
      "learning_rate": 3.596430322786679e-05,
      "loss": 1.3884,
      "num_input_tokens_seen": 31687001392,
      "step": 40275
    },
    {
      "epoch": 4.272862295777636,
      "grad_norm": 0.5726946803748535,
      "learning_rate": 3.596367865793631e-05,
      "loss": 1.3064,
      "num_input_tokens_seen": 31687788176,
      "step": 40276
    },
    {
      "epoch": 4.272968385317208,
      "grad_norm": 0.5117968374916354,
      "learning_rate": 3.596305407953341e-05,
      "loss": 1.2275,
      "num_input_tokens_seen": 31688574944,
      "step": 40277
    },
    {
      "epoch": 4.273074474856779,
      "grad_norm": 0.4517290319309349,
      "learning_rate": 3.596242949265859e-05,
      "loss": 1.28,
      "num_input_tokens_seen": 31689361744,
      "step": 40278
    },
    {
      "epoch": 4.27318056439635,
      "grad_norm": 0.5079550206225724,
      "learning_rate": 3.596180489731233e-05,
      "loss": 1.2919,
      "num_input_tokens_seen": 31690148592,
      "step": 40279
    },
    {
      "epoch": 4.273286653935922,
      "grad_norm": 0.5317207722052864,
      "learning_rate": 3.59611802934951e-05,
      "loss": 1.4283,
      "num_input_tokens_seen": 31690935296,
      "step": 40280
    },
    {
      "epoch": 4.273392743475493,
      "grad_norm": 0.4980280280889411,
      "learning_rate": 3.596055568120741e-05,
      "loss": 1.249,
      "num_input_tokens_seen": 31691722144,
      "step": 40281
    },
    {
      "epoch": 4.273498833015065,
      "grad_norm": 0.5121759591647632,
      "learning_rate": 3.5959931060449705e-05,
      "loss": 1.3715,
      "num_input_tokens_seen": 31692508864,
      "step": 40282
    },
    {
      "epoch": 4.273604922554636,
      "grad_norm": 0.5650353596729623,
      "learning_rate": 3.59593064312225e-05,
      "loss": 1.4641,
      "num_input_tokens_seen": 31693295680,
      "step": 40283
    },
    {
      "epoch": 4.273711012094208,
      "grad_norm": 0.5217547906821163,
      "learning_rate": 3.595868179352625e-05,
      "loss": 1.4482,
      "num_input_tokens_seen": 31694082384,
      "step": 40284
    },
    {
      "epoch": 4.273817101633779,
      "grad_norm": 0.5448898076382488,
      "learning_rate": 3.5958057147361466e-05,
      "loss": 1.3559,
      "num_input_tokens_seen": 31694869104,
      "step": 40285
    },
    {
      "epoch": 4.27392319117335,
      "grad_norm": 0.4549733624721595,
      "learning_rate": 3.59574324927286e-05,
      "loss": 1.3142,
      "num_input_tokens_seen": 31695655920,
      "step": 40286
    },
    {
      "epoch": 4.274029280712922,
      "grad_norm": 0.5354140556647876,
      "learning_rate": 3.595680782962817e-05,
      "loss": 1.2234,
      "num_input_tokens_seen": 31696442784,
      "step": 40287
    },
    {
      "epoch": 4.274135370252493,
      "grad_norm": 0.5402796359431681,
      "learning_rate": 3.595618315806063e-05,
      "loss": 1.2847,
      "num_input_tokens_seen": 31697229600,
      "step": 40288
    },
    {
      "epoch": 4.274241459792065,
      "grad_norm": 0.48451871850563144,
      "learning_rate": 3.595555847802648e-05,
      "loss": 1.2938,
      "num_input_tokens_seen": 31698016448,
      "step": 40289
    },
    {
      "epoch": 4.274347549331636,
      "grad_norm": 0.5650104199004655,
      "learning_rate": 3.5954933789526194e-05,
      "loss": 1.4041,
      "num_input_tokens_seen": 31698803248,
      "step": 40290
    },
    {
      "epoch": 4.274453638871207,
      "grad_norm": 0.6312166518938666,
      "learning_rate": 3.595430909256025e-05,
      "loss": 1.2814,
      "num_input_tokens_seen": 31699590032,
      "step": 40291
    },
    {
      "epoch": 4.274559728410779,
      "grad_norm": 0.5123301399355035,
      "learning_rate": 3.595368438712914e-05,
      "loss": 1.3061,
      "num_input_tokens_seen": 31700376704,
      "step": 40292
    },
    {
      "epoch": 4.27466581795035,
      "grad_norm": 0.6481872410131657,
      "learning_rate": 3.595305967323335e-05,
      "loss": 1.3888,
      "num_input_tokens_seen": 31701163456,
      "step": 40293
    },
    {
      "epoch": 4.274771907489922,
      "grad_norm": 0.5620351209075958,
      "learning_rate": 3.595243495087336e-05,
      "loss": 1.3336,
      "num_input_tokens_seen": 31701950208,
      "step": 40294
    },
    {
      "epoch": 4.274877997029493,
      "grad_norm": 0.4754703234086302,
      "learning_rate": 3.595181022004964e-05,
      "loss": 1.2277,
      "num_input_tokens_seen": 31702737040,
      "step": 40295
    },
    {
      "epoch": 4.274984086569065,
      "grad_norm": 0.7589132525065908,
      "learning_rate": 3.595118548076268e-05,
      "loss": 1.4049,
      "num_input_tokens_seen": 31703523808,
      "step": 40296
    },
    {
      "epoch": 4.275090176108636,
      "grad_norm": 0.4821898669901878,
      "learning_rate": 3.595056073301297e-05,
      "loss": 1.2866,
      "num_input_tokens_seen": 31704310496,
      "step": 40297
    },
    {
      "epoch": 4.275196265648207,
      "grad_norm": 0.7158637940747166,
      "learning_rate": 3.594993597680099e-05,
      "loss": 1.262,
      "num_input_tokens_seen": 31705097296,
      "step": 40298
    },
    {
      "epoch": 4.275302355187779,
      "grad_norm": 0.4403151330988417,
      "learning_rate": 3.594931121212722e-05,
      "loss": 1.175,
      "num_input_tokens_seen": 31705884144,
      "step": 40299
    },
    {
      "epoch": 4.27540844472735,
      "grad_norm": 0.46732788156427973,
      "learning_rate": 3.5948686438992144e-05,
      "loss": 1.1997,
      "num_input_tokens_seen": 31706670880,
      "step": 40300
    },
    {
      "epoch": 4.275514534266922,
      "grad_norm": 0.7761145117367887,
      "learning_rate": 3.594806165739624e-05,
      "loss": 1.3202,
      "num_input_tokens_seen": 31707457648,
      "step": 40301
    },
    {
      "epoch": 4.275620623806493,
      "grad_norm": 0.4683972671938605,
      "learning_rate": 3.594743686734e-05,
      "loss": 1.2711,
      "num_input_tokens_seen": 31708244496,
      "step": 40302
    },
    {
      "epoch": 4.275726713346064,
      "grad_norm": 0.6662700759020204,
      "learning_rate": 3.59468120688239e-05,
      "loss": 1.3214,
      "num_input_tokens_seen": 31709031296,
      "step": 40303
    },
    {
      "epoch": 4.275832802885636,
      "grad_norm": 0.611961760305958,
      "learning_rate": 3.594618726184843e-05,
      "loss": 1.3366,
      "num_input_tokens_seen": 31709818064,
      "step": 40304
    },
    {
      "epoch": 4.275938892425207,
      "grad_norm": 0.5504931850965868,
      "learning_rate": 3.594556244641406e-05,
      "loss": 1.3002,
      "num_input_tokens_seen": 31710604896,
      "step": 40305
    },
    {
      "epoch": 4.276044981964779,
      "grad_norm": 0.5795827310602945,
      "learning_rate": 3.594493762252128e-05,
      "loss": 1.2759,
      "num_input_tokens_seen": 31711391664,
      "step": 40306
    },
    {
      "epoch": 4.27615107150435,
      "grad_norm": 0.8389356480079904,
      "learning_rate": 3.5944312790170575e-05,
      "loss": 1.345,
      "num_input_tokens_seen": 31712178480,
      "step": 40307
    },
    {
      "epoch": 4.276257161043921,
      "grad_norm": 0.6572527219412383,
      "learning_rate": 3.594368794936243e-05,
      "loss": 1.3705,
      "num_input_tokens_seen": 31712965248,
      "step": 40308
    },
    {
      "epoch": 4.2763632505834925,
      "grad_norm": 0.8485195586062513,
      "learning_rate": 3.594306310009732e-05,
      "loss": 1.3028,
      "num_input_tokens_seen": 31713751920,
      "step": 40309
    },
    {
      "epoch": 4.276469340123064,
      "grad_norm": 0.5197205939852934,
      "learning_rate": 3.5942438242375734e-05,
      "loss": 1.2357,
      "num_input_tokens_seen": 31714538688,
      "step": 40310
    },
    {
      "epoch": 4.2765754296626355,
      "grad_norm": 0.7736036483446151,
      "learning_rate": 3.5941813376198155e-05,
      "loss": 1.3149,
      "num_input_tokens_seen": 31715325504,
      "step": 40311
    },
    {
      "epoch": 4.2766815192022065,
      "grad_norm": 0.6038893056994163,
      "learning_rate": 3.594118850156506e-05,
      "loss": 1.2752,
      "num_input_tokens_seen": 31716112400,
      "step": 40312
    },
    {
      "epoch": 4.276787608741778,
      "grad_norm": 0.5509474793904442,
      "learning_rate": 3.5940563618476934e-05,
      "loss": 1.3863,
      "num_input_tokens_seen": 31716899200,
      "step": 40313
    },
    {
      "epoch": 4.2768936982813495,
      "grad_norm": 0.8144413708225222,
      "learning_rate": 3.593993872693427e-05,
      "loss": 1.4117,
      "num_input_tokens_seen": 31717685920,
      "step": 40314
    },
    {
      "epoch": 4.2769997878209205,
      "grad_norm": 0.48155919894780047,
      "learning_rate": 3.593931382693754e-05,
      "loss": 1.2225,
      "num_input_tokens_seen": 31718472720,
      "step": 40315
    },
    {
      "epoch": 4.277105877360492,
      "grad_norm": 0.5266921183793326,
      "learning_rate": 3.593868891848722e-05,
      "loss": 1.2333,
      "num_input_tokens_seen": 31719259456,
      "step": 40316
    },
    {
      "epoch": 4.2772119669000634,
      "grad_norm": 0.7021935941160512,
      "learning_rate": 3.5938064001583805e-05,
      "loss": 1.3782,
      "num_input_tokens_seen": 31720046224,
      "step": 40317
    },
    {
      "epoch": 4.277318056439635,
      "grad_norm": 0.4781754625713956,
      "learning_rate": 3.593743907622778e-05,
      "loss": 1.2849,
      "num_input_tokens_seen": 31720833008,
      "step": 40318
    },
    {
      "epoch": 4.277424145979206,
      "grad_norm": 0.6110233032292344,
      "learning_rate": 3.5936814142419614e-05,
      "loss": 1.2924,
      "num_input_tokens_seen": 31721619776,
      "step": 40319
    },
    {
      "epoch": 4.277530235518778,
      "grad_norm": 0.569383102008018,
      "learning_rate": 3.593618920015981e-05,
      "loss": 1.3851,
      "num_input_tokens_seen": 31722406512,
      "step": 40320
    },
    {
      "epoch": 4.277636325058349,
      "grad_norm": 0.5132161435131202,
      "learning_rate": 3.593556424944884e-05,
      "loss": 1.3233,
      "num_input_tokens_seen": 31723193216,
      "step": 40321
    },
    {
      "epoch": 4.27774241459792,
      "grad_norm": 0.5706028981630539,
      "learning_rate": 3.593493929028718e-05,
      "loss": 1.4306,
      "num_input_tokens_seen": 31723979984,
      "step": 40322
    },
    {
      "epoch": 4.277848504137492,
      "grad_norm": 0.4920101384585815,
      "learning_rate": 3.593431432267532e-05,
      "loss": 1.3686,
      "num_input_tokens_seen": 31724766640,
      "step": 40323
    },
    {
      "epoch": 4.277954593677063,
      "grad_norm": 0.5942802684204499,
      "learning_rate": 3.5933689346613744e-05,
      "loss": 1.4118,
      "num_input_tokens_seen": 31725553472,
      "step": 40324
    },
    {
      "epoch": 4.278060683216635,
      "grad_norm": 0.5686602940629825,
      "learning_rate": 3.593306436210294e-05,
      "loss": 1.3711,
      "num_input_tokens_seen": 31726340192,
      "step": 40325
    },
    {
      "epoch": 4.278166772756206,
      "grad_norm": 0.6156666895338012,
      "learning_rate": 3.593243936914338e-05,
      "loss": 1.2356,
      "num_input_tokens_seen": 31727127040,
      "step": 40326
    },
    {
      "epoch": 4.278272862295777,
      "grad_norm": 0.5863991423711418,
      "learning_rate": 3.5931814367735545e-05,
      "loss": 1.3442,
      "num_input_tokens_seen": 31727913792,
      "step": 40327
    },
    {
      "epoch": 4.278378951835349,
      "grad_norm": 0.5659593573840963,
      "learning_rate": 3.5931189357879934e-05,
      "loss": 1.293,
      "num_input_tokens_seen": 31728700576,
      "step": 40328
    },
    {
      "epoch": 4.27848504137492,
      "grad_norm": 0.5451312109734016,
      "learning_rate": 3.593056433957702e-05,
      "loss": 1.3624,
      "num_input_tokens_seen": 31729487376,
      "step": 40329
    },
    {
      "epoch": 4.278591130914492,
      "grad_norm": 0.6036332822337591,
      "learning_rate": 3.5929939312827275e-05,
      "loss": 1.2975,
      "num_input_tokens_seen": 31730274144,
      "step": 40330
    },
    {
      "epoch": 4.278697220454063,
      "grad_norm": 0.5261016317154935,
      "learning_rate": 3.592931427763121e-05,
      "loss": 1.3585,
      "num_input_tokens_seen": 31731060960,
      "step": 40331
    },
    {
      "epoch": 4.278803309993634,
      "grad_norm": 0.6801235805917185,
      "learning_rate": 3.592868923398929e-05,
      "loss": 1.4725,
      "num_input_tokens_seen": 31731847696,
      "step": 40332
    },
    {
      "epoch": 4.278909399533206,
      "grad_norm": 0.5231213063455923,
      "learning_rate": 3.5928064181901986e-05,
      "loss": 1.3179,
      "num_input_tokens_seen": 31732634544,
      "step": 40333
    },
    {
      "epoch": 4.279015489072777,
      "grad_norm": 0.6152154245607869,
      "learning_rate": 3.5927439121369804e-05,
      "loss": 1.3917,
      "num_input_tokens_seen": 31733421392,
      "step": 40334
    },
    {
      "epoch": 4.279121578612349,
      "grad_norm": 0.4954079990742123,
      "learning_rate": 3.592681405239322e-05,
      "loss": 1.2443,
      "num_input_tokens_seen": 31734208112,
      "step": 40335
    },
    {
      "epoch": 4.27922766815192,
      "grad_norm": 0.5578481926578381,
      "learning_rate": 3.592618897497271e-05,
      "loss": 1.2454,
      "num_input_tokens_seen": 31734994880,
      "step": 40336
    },
    {
      "epoch": 4.279333757691491,
      "grad_norm": 0.5599913958305919,
      "learning_rate": 3.592556388910876e-05,
      "loss": 1.3641,
      "num_input_tokens_seen": 31735781616,
      "step": 40337
    },
    {
      "epoch": 4.279439847231063,
      "grad_norm": 0.5788767506984556,
      "learning_rate": 3.592493879480186e-05,
      "loss": 1.3972,
      "num_input_tokens_seen": 31736568368,
      "step": 40338
    },
    {
      "epoch": 4.279545936770634,
      "grad_norm": 0.48838991443098945,
      "learning_rate": 3.592431369205248e-05,
      "loss": 1.3356,
      "num_input_tokens_seen": 31737355072,
      "step": 40339
    },
    {
      "epoch": 4.279652026310206,
      "grad_norm": 0.585252969265031,
      "learning_rate": 3.592368858086112e-05,
      "loss": 1.4015,
      "num_input_tokens_seen": 31738141856,
      "step": 40340
    },
    {
      "epoch": 4.279758115849777,
      "grad_norm": 0.47127032000860786,
      "learning_rate": 3.592306346122825e-05,
      "loss": 1.3656,
      "num_input_tokens_seen": 31738928640,
      "step": 40341
    },
    {
      "epoch": 4.279864205389349,
      "grad_norm": 0.5622667140194647,
      "learning_rate": 3.592243833315436e-05,
      "loss": 1.3927,
      "num_input_tokens_seen": 31739715344,
      "step": 40342
    },
    {
      "epoch": 4.27997029492892,
      "grad_norm": 0.5075731499025721,
      "learning_rate": 3.5921813196639926e-05,
      "loss": 1.3836,
      "num_input_tokens_seen": 31740502096,
      "step": 40343
    },
    {
      "epoch": 4.280076384468491,
      "grad_norm": 0.5856333713756905,
      "learning_rate": 3.5921188051685433e-05,
      "loss": 1.4144,
      "num_input_tokens_seen": 31741288880,
      "step": 40344
    },
    {
      "epoch": 4.280182474008063,
      "grad_norm": 0.6494556538355128,
      "learning_rate": 3.592056289829137e-05,
      "loss": 1.3346,
      "num_input_tokens_seen": 31742075600,
      "step": 40345
    },
    {
      "epoch": 4.280288563547634,
      "grad_norm": 0.4532539128527571,
      "learning_rate": 3.591993773645822e-05,
      "loss": 1.2536,
      "num_input_tokens_seen": 31742862368,
      "step": 40346
    },
    {
      "epoch": 4.280394653087206,
      "grad_norm": 0.5848875407108097,
      "learning_rate": 3.5919312566186454e-05,
      "loss": 1.3069,
      "num_input_tokens_seen": 31743649152,
      "step": 40347
    },
    {
      "epoch": 4.280500742626777,
      "grad_norm": 0.5874363968895538,
      "learning_rate": 3.591868738747657e-05,
      "loss": 1.2832,
      "num_input_tokens_seen": 31744435952,
      "step": 40348
    },
    {
      "epoch": 4.280606832166349,
      "grad_norm": 0.5294739362042872,
      "learning_rate": 3.5918062200329045e-05,
      "loss": 1.3079,
      "num_input_tokens_seen": 31745222720,
      "step": 40349
    },
    {
      "epoch": 4.28071292170592,
      "grad_norm": 0.5704993293574849,
      "learning_rate": 3.591743700474436e-05,
      "loss": 1.3552,
      "num_input_tokens_seen": 31746009520,
      "step": 40350
    },
    {
      "epoch": 4.280819011245491,
      "grad_norm": 0.5840912139211427,
      "learning_rate": 3.5916811800723e-05,
      "loss": 1.4129,
      "num_input_tokens_seen": 31746796192,
      "step": 40351
    },
    {
      "epoch": 4.280925100785063,
      "grad_norm": 0.6736501606553685,
      "learning_rate": 3.591618658826545e-05,
      "loss": 1.334,
      "num_input_tokens_seen": 31747582960,
      "step": 40352
    },
    {
      "epoch": 4.281031190324634,
      "grad_norm": 0.45009578801459427,
      "learning_rate": 3.591556136737219e-05,
      "loss": 1.2131,
      "num_input_tokens_seen": 31748369744,
      "step": 40353
    },
    {
      "epoch": 4.281137279864206,
      "grad_norm": 0.46940990101888613,
      "learning_rate": 3.5914936138043706e-05,
      "loss": 1.1892,
      "num_input_tokens_seen": 31749156528,
      "step": 40354
    },
    {
      "epoch": 4.281243369403777,
      "grad_norm": 0.5323428099722884,
      "learning_rate": 3.591431090028048e-05,
      "loss": 1.2618,
      "num_input_tokens_seen": 31749943360,
      "step": 40355
    },
    {
      "epoch": 4.281349458943348,
      "grad_norm": 0.6923422744890299,
      "learning_rate": 3.591368565408298e-05,
      "loss": 1.2379,
      "num_input_tokens_seen": 31750730160,
      "step": 40356
    },
    {
      "epoch": 4.28145554848292,
      "grad_norm": 0.5959896750461281,
      "learning_rate": 3.591306039945172e-05,
      "loss": 1.31,
      "num_input_tokens_seen": 31751516896,
      "step": 40357
    },
    {
      "epoch": 4.281561638022491,
      "grad_norm": 0.6707388114509609,
      "learning_rate": 3.5912435136387166e-05,
      "loss": 1.4857,
      "num_input_tokens_seen": 31752303680,
      "step": 40358
    },
    {
      "epoch": 4.281667727562063,
      "grad_norm": 0.5769486814150036,
      "learning_rate": 3.59118098648898e-05,
      "loss": 1.3282,
      "num_input_tokens_seen": 31753090464,
      "step": 40359
    },
    {
      "epoch": 4.281773817101634,
      "grad_norm": 0.44960931450176955,
      "learning_rate": 3.591118458496011e-05,
      "loss": 1.2176,
      "num_input_tokens_seen": 31753877328,
      "step": 40360
    },
    {
      "epoch": 4.281879906641205,
      "grad_norm": 0.723952678725904,
      "learning_rate": 3.5910559296598564e-05,
      "loss": 1.3552,
      "num_input_tokens_seen": 31754664016,
      "step": 40361
    },
    {
      "epoch": 4.281985996180777,
      "grad_norm": 0.5033496272719282,
      "learning_rate": 3.590993399980568e-05,
      "loss": 1.3071,
      "num_input_tokens_seen": 31755450816,
      "step": 40362
    },
    {
      "epoch": 4.282092085720348,
      "grad_norm": 0.6222555525466427,
      "learning_rate": 3.5909308694581905e-05,
      "loss": 1.282,
      "num_input_tokens_seen": 31756237552,
      "step": 40363
    },
    {
      "epoch": 4.28219817525992,
      "grad_norm": 0.49574969097090715,
      "learning_rate": 3.590868338092773e-05,
      "loss": 1.2531,
      "num_input_tokens_seen": 31757024400,
      "step": 40364
    },
    {
      "epoch": 4.282304264799491,
      "grad_norm": 0.5012098442603654,
      "learning_rate": 3.590805805884365e-05,
      "loss": 1.2348,
      "num_input_tokens_seen": 31757811280,
      "step": 40365
    },
    {
      "epoch": 4.282410354339062,
      "grad_norm": 0.5348016726598338,
      "learning_rate": 3.590743272833015e-05,
      "loss": 1.2866,
      "num_input_tokens_seen": 31758598096,
      "step": 40366
    },
    {
      "epoch": 4.282516443878634,
      "grad_norm": 0.6732942799660653,
      "learning_rate": 3.5906807389387706e-05,
      "loss": 1.3871,
      "num_input_tokens_seen": 31759384800,
      "step": 40367
    },
    {
      "epoch": 4.282622533418205,
      "grad_norm": 0.6393880912855856,
      "learning_rate": 3.5906182042016794e-05,
      "loss": 1.311,
      "num_input_tokens_seen": 31760171552,
      "step": 40368
    },
    {
      "epoch": 4.282728622957777,
      "grad_norm": 0.6364428470673115,
      "learning_rate": 3.590555668621791e-05,
      "loss": 1.3337,
      "num_input_tokens_seen": 31760958240,
      "step": 40369
    },
    {
      "epoch": 4.282834712497348,
      "grad_norm": 0.5156609435804702,
      "learning_rate": 3.5904931321991525e-05,
      "loss": 1.3089,
      "num_input_tokens_seen": 31761745008,
      "step": 40370
    },
    {
      "epoch": 4.2829408020369195,
      "grad_norm": 0.5511816860414375,
      "learning_rate": 3.590430594933814e-05,
      "loss": 1.2485,
      "num_input_tokens_seen": 31762531808,
      "step": 40371
    },
    {
      "epoch": 4.2830468915764905,
      "grad_norm": 0.514109148421578,
      "learning_rate": 3.590368056825822e-05,
      "loss": 1.3887,
      "num_input_tokens_seen": 31763318512,
      "step": 40372
    },
    {
      "epoch": 4.283152981116062,
      "grad_norm": 0.5241157090290308,
      "learning_rate": 3.590305517875225e-05,
      "loss": 1.3392,
      "num_input_tokens_seen": 31764105280,
      "step": 40373
    },
    {
      "epoch": 4.2832590706556335,
      "grad_norm": 0.5481416274587829,
      "learning_rate": 3.590242978082073e-05,
      "loss": 1.2893,
      "num_input_tokens_seen": 31764892000,
      "step": 40374
    },
    {
      "epoch": 4.2833651601952045,
      "grad_norm": 0.4936991235184511,
      "learning_rate": 3.5901804374464125e-05,
      "loss": 1.3374,
      "num_input_tokens_seen": 31765678800,
      "step": 40375
    },
    {
      "epoch": 4.283471249734776,
      "grad_norm": 0.5130863268741145,
      "learning_rate": 3.590117895968293e-05,
      "loss": 1.2847,
      "num_input_tokens_seen": 31766465536,
      "step": 40376
    },
    {
      "epoch": 4.2835773392743475,
      "grad_norm": 0.47013754415607356,
      "learning_rate": 3.590055353647762e-05,
      "loss": 1.2765,
      "num_input_tokens_seen": 31767252336,
      "step": 40377
    },
    {
      "epoch": 4.283683428813919,
      "grad_norm": 0.4929423292949599,
      "learning_rate": 3.589992810484869e-05,
      "loss": 1.347,
      "num_input_tokens_seen": 31768038976,
      "step": 40378
    },
    {
      "epoch": 4.28378951835349,
      "grad_norm": 0.5501079085262599,
      "learning_rate": 3.58993026647966e-05,
      "loss": 1.4119,
      "num_input_tokens_seen": 31768825696,
      "step": 40379
    },
    {
      "epoch": 4.2838956078930615,
      "grad_norm": 0.524588895025459,
      "learning_rate": 3.589867721632186e-05,
      "loss": 1.359,
      "num_input_tokens_seen": 31769612560,
      "step": 40380
    },
    {
      "epoch": 4.284001697432633,
      "grad_norm": 0.5014593131335892,
      "learning_rate": 3.5898051759424947e-05,
      "loss": 1.2274,
      "num_input_tokens_seen": 31770399296,
      "step": 40381
    },
    {
      "epoch": 4.284107786972204,
      "grad_norm": 0.5674635058214189,
      "learning_rate": 3.589742629410633e-05,
      "loss": 1.3533,
      "num_input_tokens_seen": 31771186128,
      "step": 40382
    },
    {
      "epoch": 4.284213876511776,
      "grad_norm": 0.522587804967061,
      "learning_rate": 3.5896800820366505e-05,
      "loss": 1.2734,
      "num_input_tokens_seen": 31771972816,
      "step": 40383
    },
    {
      "epoch": 4.284319966051347,
      "grad_norm": 0.6143026097540115,
      "learning_rate": 3.589617533820595e-05,
      "loss": 1.3607,
      "num_input_tokens_seen": 31772759520,
      "step": 40384
    },
    {
      "epoch": 4.284426055590918,
      "grad_norm": 0.49501506620890484,
      "learning_rate": 3.589554984762515e-05,
      "loss": 1.3239,
      "num_input_tokens_seen": 31773546304,
      "step": 40385
    },
    {
      "epoch": 4.28453214513049,
      "grad_norm": 0.45891166875671946,
      "learning_rate": 3.589492434862459e-05,
      "loss": 1.2741,
      "num_input_tokens_seen": 31774333040,
      "step": 40386
    },
    {
      "epoch": 4.284638234670061,
      "grad_norm": 0.4580346365183701,
      "learning_rate": 3.589429884120475e-05,
      "loss": 1.2452,
      "num_input_tokens_seen": 31775119840,
      "step": 40387
    },
    {
      "epoch": 4.284744324209633,
      "grad_norm": 0.5279352140337984,
      "learning_rate": 3.5893673325366115e-05,
      "loss": 1.3923,
      "num_input_tokens_seen": 31775906512,
      "step": 40388
    },
    {
      "epoch": 4.284850413749204,
      "grad_norm": 0.5923755901310177,
      "learning_rate": 3.589304780110918e-05,
      "loss": 1.2957,
      "num_input_tokens_seen": 31776693232,
      "step": 40389
    },
    {
      "epoch": 4.284956503288775,
      "grad_norm": 0.5186504942506782,
      "learning_rate": 3.58924222684344e-05,
      "loss": 1.3122,
      "num_input_tokens_seen": 31777479936,
      "step": 40390
    },
    {
      "epoch": 4.285062592828347,
      "grad_norm": 0.632128828318534,
      "learning_rate": 3.589179672734229e-05,
      "loss": 1.3353,
      "num_input_tokens_seen": 31778266656,
      "step": 40391
    },
    {
      "epoch": 4.285168682367918,
      "grad_norm": 0.5869234282575334,
      "learning_rate": 3.5891171177833314e-05,
      "loss": 1.1573,
      "num_input_tokens_seen": 31779053408,
      "step": 40392
    },
    {
      "epoch": 4.28527477190749,
      "grad_norm": 0.5848642574658202,
      "learning_rate": 3.5890545619907955e-05,
      "loss": 1.339,
      "num_input_tokens_seen": 31779840224,
      "step": 40393
    },
    {
      "epoch": 4.285380861447061,
      "grad_norm": 0.6142153996796836,
      "learning_rate": 3.5889920053566714e-05,
      "loss": 1.302,
      "num_input_tokens_seen": 31780626992,
      "step": 40394
    },
    {
      "epoch": 4.285486950986633,
      "grad_norm": 0.6424098381604032,
      "learning_rate": 3.588929447881005e-05,
      "loss": 1.276,
      "num_input_tokens_seen": 31781413680,
      "step": 40395
    },
    {
      "epoch": 4.285593040526204,
      "grad_norm": 0.5698824152042725,
      "learning_rate": 3.588866889563847e-05,
      "loss": 1.2972,
      "num_input_tokens_seen": 31782200480,
      "step": 40396
    },
    {
      "epoch": 4.285699130065775,
      "grad_norm": 0.5552702856177598,
      "learning_rate": 3.5888043304052434e-05,
      "loss": 1.2744,
      "num_input_tokens_seen": 31782987280,
      "step": 40397
    },
    {
      "epoch": 4.285805219605347,
      "grad_norm": 0.5059023533278861,
      "learning_rate": 3.588741770405245e-05,
      "loss": 1.3507,
      "num_input_tokens_seen": 31783774000,
      "step": 40398
    },
    {
      "epoch": 4.285911309144918,
      "grad_norm": 0.5697889204088314,
      "learning_rate": 3.588679209563898e-05,
      "loss": 1.3759,
      "num_input_tokens_seen": 31784560736,
      "step": 40399
    },
    {
      "epoch": 4.28601739868449,
      "grad_norm": 0.48180179609168183,
      "learning_rate": 3.588616647881252e-05,
      "loss": 1.2312,
      "num_input_tokens_seen": 31785347424,
      "step": 40400
    },
    {
      "epoch": 4.286123488224061,
      "grad_norm": 0.7351493177632032,
      "learning_rate": 3.588554085357355e-05,
      "loss": 1.3222,
      "num_input_tokens_seen": 31786134176,
      "step": 40401
    },
    {
      "epoch": 4.286229577763632,
      "grad_norm": 0.7542209013374552,
      "learning_rate": 3.588491521992256e-05,
      "loss": 1.3443,
      "num_input_tokens_seen": 31786920960,
      "step": 40402
    },
    {
      "epoch": 4.286335667303204,
      "grad_norm": 0.49177741735553665,
      "learning_rate": 3.588428957786001e-05,
      "loss": 1.1989,
      "num_input_tokens_seen": 31787707840,
      "step": 40403
    },
    {
      "epoch": 4.286441756842775,
      "grad_norm": 0.537840557338021,
      "learning_rate": 3.588366392738641e-05,
      "loss": 1.3488,
      "num_input_tokens_seen": 31788494640,
      "step": 40404
    },
    {
      "epoch": 4.286547846382347,
      "grad_norm": 0.5368192670221169,
      "learning_rate": 3.5883038268502233e-05,
      "loss": 1.355,
      "num_input_tokens_seen": 31789281472,
      "step": 40405
    },
    {
      "epoch": 4.286653935921918,
      "grad_norm": 0.43022389364291963,
      "learning_rate": 3.5882412601207974e-05,
      "loss": 1.2109,
      "num_input_tokens_seen": 31790068352,
      "step": 40406
    },
    {
      "epoch": 4.28676002546149,
      "grad_norm": 0.4848005761699109,
      "learning_rate": 3.588178692550409e-05,
      "loss": 1.2416,
      "num_input_tokens_seen": 31790855120,
      "step": 40407
    },
    {
      "epoch": 4.286866115001061,
      "grad_norm": 0.5088648652123933,
      "learning_rate": 3.5881161241391086e-05,
      "loss": 1.3026,
      "num_input_tokens_seen": 31791641808,
      "step": 40408
    },
    {
      "epoch": 4.286972204540632,
      "grad_norm": 0.537275383874028,
      "learning_rate": 3.588053554886944e-05,
      "loss": 1.2723,
      "num_input_tokens_seen": 31792428512,
      "step": 40409
    },
    {
      "epoch": 4.287078294080204,
      "grad_norm": 0.5508026719118339,
      "learning_rate": 3.587990984793964e-05,
      "loss": 1.3744,
      "num_input_tokens_seen": 31793215264,
      "step": 40410
    },
    {
      "epoch": 4.287184383619775,
      "grad_norm": 0.6334986834121851,
      "learning_rate": 3.587928413860216e-05,
      "loss": 1.2798,
      "num_input_tokens_seen": 31794002016,
      "step": 40411
    },
    {
      "epoch": 4.287290473159347,
      "grad_norm": 0.46686067373325485,
      "learning_rate": 3.5878658420857486e-05,
      "loss": 1.2403,
      "num_input_tokens_seen": 31794788848,
      "step": 40412
    },
    {
      "epoch": 4.287396562698918,
      "grad_norm": 0.7015738326825789,
      "learning_rate": 3.587803269470611e-05,
      "loss": 1.3138,
      "num_input_tokens_seen": 31795575584,
      "step": 40413
    },
    {
      "epoch": 4.287502652238489,
      "grad_norm": 0.5319918683306615,
      "learning_rate": 3.5877406960148505e-05,
      "loss": 1.2245,
      "num_input_tokens_seen": 31796362352,
      "step": 40414
    },
    {
      "epoch": 4.287608741778061,
      "grad_norm": 0.6555643288578653,
      "learning_rate": 3.587678121718516e-05,
      "loss": 1.2684,
      "num_input_tokens_seen": 31797149104,
      "step": 40415
    },
    {
      "epoch": 4.287714831317632,
      "grad_norm": 0.508723190172977,
      "learning_rate": 3.587615546581655e-05,
      "loss": 1.2318,
      "num_input_tokens_seen": 31797935952,
      "step": 40416
    },
    {
      "epoch": 4.287820920857204,
      "grad_norm": 0.6702976612209454,
      "learning_rate": 3.587552970604318e-05,
      "loss": 1.3773,
      "num_input_tokens_seen": 31798722752,
      "step": 40417
    },
    {
      "epoch": 4.287927010396775,
      "grad_norm": 0.5200487364377895,
      "learning_rate": 3.5874903937865514e-05,
      "loss": 1.2868,
      "num_input_tokens_seen": 31799509472,
      "step": 40418
    },
    {
      "epoch": 4.288033099936346,
      "grad_norm": 0.6250114214214118,
      "learning_rate": 3.587427816128404e-05,
      "loss": 1.288,
      "num_input_tokens_seen": 31800296304,
      "step": 40419
    },
    {
      "epoch": 4.288139189475918,
      "grad_norm": 0.4851163191172095,
      "learning_rate": 3.587365237629925e-05,
      "loss": 1.3499,
      "num_input_tokens_seen": 31801083040,
      "step": 40420
    },
    {
      "epoch": 4.288245279015489,
      "grad_norm": 0.6059696741486936,
      "learning_rate": 3.587302658291161e-05,
      "loss": 1.333,
      "num_input_tokens_seen": 31801869792,
      "step": 40421
    },
    {
      "epoch": 4.288351368555061,
      "grad_norm": 0.5193486034664585,
      "learning_rate": 3.587240078112162e-05,
      "loss": 1.2823,
      "num_input_tokens_seen": 31802656496,
      "step": 40422
    },
    {
      "epoch": 4.288457458094632,
      "grad_norm": 0.757773798654671,
      "learning_rate": 3.5871774970929764e-05,
      "loss": 1.2922,
      "num_input_tokens_seen": 31803443296,
      "step": 40423
    },
    {
      "epoch": 4.288563547634204,
      "grad_norm": 0.5881589941507706,
      "learning_rate": 3.587114915233651e-05,
      "loss": 1.3377,
      "num_input_tokens_seen": 31804230064,
      "step": 40424
    },
    {
      "epoch": 4.288669637173775,
      "grad_norm": 0.6121744211754755,
      "learning_rate": 3.587052332534235e-05,
      "loss": 1.4145,
      "num_input_tokens_seen": 31805016768,
      "step": 40425
    },
    {
      "epoch": 4.288775726713346,
      "grad_norm": 0.6237309184690738,
      "learning_rate": 3.586989748994777e-05,
      "loss": 1.2888,
      "num_input_tokens_seen": 31805803472,
      "step": 40426
    },
    {
      "epoch": 4.288881816252918,
      "grad_norm": 0.6772122924785,
      "learning_rate": 3.5869271646153256e-05,
      "loss": 1.311,
      "num_input_tokens_seen": 31806590192,
      "step": 40427
    },
    {
      "epoch": 4.288987905792489,
      "grad_norm": 0.5662236860609161,
      "learning_rate": 3.586864579395928e-05,
      "loss": 1.4144,
      "num_input_tokens_seen": 31807376944,
      "step": 40428
    },
    {
      "epoch": 4.289093995332061,
      "grad_norm": 0.5769969367111797,
      "learning_rate": 3.586801993336634e-05,
      "loss": 1.3247,
      "num_input_tokens_seen": 31808163728,
      "step": 40429
    },
    {
      "epoch": 4.289200084871632,
      "grad_norm": 0.7094544226628041,
      "learning_rate": 3.5867394064374916e-05,
      "loss": 1.2697,
      "num_input_tokens_seen": 31808950624,
      "step": 40430
    },
    {
      "epoch": 4.289306174411203,
      "grad_norm": 0.6970232092419157,
      "learning_rate": 3.5866768186985484e-05,
      "loss": 1.3215,
      "num_input_tokens_seen": 31809737296,
      "step": 40431
    },
    {
      "epoch": 4.289412263950775,
      "grad_norm": 0.6372256569125484,
      "learning_rate": 3.586614230119853e-05,
      "loss": 1.2638,
      "num_input_tokens_seen": 31810524160,
      "step": 40432
    },
    {
      "epoch": 4.289518353490346,
      "grad_norm": 0.5106373356022745,
      "learning_rate": 3.5865516407014545e-05,
      "loss": 1.1899,
      "num_input_tokens_seen": 31811310944,
      "step": 40433
    },
    {
      "epoch": 4.2896244430299175,
      "grad_norm": 0.579527145012292,
      "learning_rate": 3.586489050443401e-05,
      "loss": 1.2473,
      "num_input_tokens_seen": 31812097840,
      "step": 40434
    },
    {
      "epoch": 4.2897305325694886,
      "grad_norm": 0.5529732541594659,
      "learning_rate": 3.58642645934574e-05,
      "loss": 1.3674,
      "num_input_tokens_seen": 31812884640,
      "step": 40435
    },
    {
      "epoch": 4.2898366221090605,
      "grad_norm": 0.6201841863203754,
      "learning_rate": 3.58636386740852e-05,
      "loss": 1.4675,
      "num_input_tokens_seen": 31813671456,
      "step": 40436
    },
    {
      "epoch": 4.2899427116486315,
      "grad_norm": 0.5384995610351087,
      "learning_rate": 3.5863012746317916e-05,
      "loss": 1.3634,
      "num_input_tokens_seen": 31814458288,
      "step": 40437
    },
    {
      "epoch": 4.2900488011882025,
      "grad_norm": 0.5073757756047622,
      "learning_rate": 3.5862386810156e-05,
      "loss": 1.2536,
      "num_input_tokens_seen": 31815245072,
      "step": 40438
    },
    {
      "epoch": 4.2901548907277745,
      "grad_norm": 0.5629964773690828,
      "learning_rate": 3.586176086559996e-05,
      "loss": 1.4761,
      "num_input_tokens_seen": 31816031824,
      "step": 40439
    },
    {
      "epoch": 4.2902609802673455,
      "grad_norm": 0.47229151335960895,
      "learning_rate": 3.586113491265026e-05,
      "loss": 1.3137,
      "num_input_tokens_seen": 31816818592,
      "step": 40440
    },
    {
      "epoch": 4.290367069806917,
      "grad_norm": 0.6010935598899464,
      "learning_rate": 3.58605089513074e-05,
      "loss": 1.358,
      "num_input_tokens_seen": 31817605376,
      "step": 40441
    },
    {
      "epoch": 4.290473159346488,
      "grad_norm": 0.5833384818732849,
      "learning_rate": 3.5859882981571855e-05,
      "loss": 1.3074,
      "num_input_tokens_seen": 31818392176,
      "step": 40442
    },
    {
      "epoch": 4.2905792488860595,
      "grad_norm": 0.5151600898529602,
      "learning_rate": 3.585925700344411e-05,
      "loss": 1.3499,
      "num_input_tokens_seen": 31819178944,
      "step": 40443
    },
    {
      "epoch": 4.290685338425631,
      "grad_norm": 0.5263665052851272,
      "learning_rate": 3.585863101692466e-05,
      "loss": 1.324,
      "num_input_tokens_seen": 31819965680,
      "step": 40444
    },
    {
      "epoch": 4.290791427965202,
      "grad_norm": 0.5019425989935709,
      "learning_rate": 3.585800502201396e-05,
      "loss": 1.39,
      "num_input_tokens_seen": 31820752576,
      "step": 40445
    },
    {
      "epoch": 4.290897517504774,
      "grad_norm": 0.495906714748387,
      "learning_rate": 3.5857379018712526e-05,
      "loss": 1.2914,
      "num_input_tokens_seen": 31821539312,
      "step": 40446
    },
    {
      "epoch": 4.291003607044345,
      "grad_norm": 0.5075116159453427,
      "learning_rate": 3.585675300702083e-05,
      "loss": 1.2577,
      "num_input_tokens_seen": 31822326000,
      "step": 40447
    },
    {
      "epoch": 4.291109696583916,
      "grad_norm": 0.5553853382207609,
      "learning_rate": 3.585612698693934e-05,
      "loss": 1.3423,
      "num_input_tokens_seen": 31823112816,
      "step": 40448
    },
    {
      "epoch": 4.291215786123488,
      "grad_norm": 0.6958682605171197,
      "learning_rate": 3.585550095846857e-05,
      "loss": 1.4046,
      "num_input_tokens_seen": 31823899616,
      "step": 40449
    },
    {
      "epoch": 4.291321875663059,
      "grad_norm": 0.569289422436179,
      "learning_rate": 3.585487492160897e-05,
      "loss": 1.2804,
      "num_input_tokens_seen": 31824686400,
      "step": 40450
    },
    {
      "epoch": 4.291427965202631,
      "grad_norm": 0.5479682992844913,
      "learning_rate": 3.5854248876361054e-05,
      "loss": 1.3166,
      "num_input_tokens_seen": 31825473168,
      "step": 40451
    },
    {
      "epoch": 4.291534054742202,
      "grad_norm": 0.7062740831937162,
      "learning_rate": 3.5853622822725296e-05,
      "loss": 1.4041,
      "num_input_tokens_seen": 31826259904,
      "step": 40452
    },
    {
      "epoch": 4.291640144281774,
      "grad_norm": 0.48839441256966254,
      "learning_rate": 3.585299676070216e-05,
      "loss": 1.3205,
      "num_input_tokens_seen": 31827046672,
      "step": 40453
    },
    {
      "epoch": 4.291746233821345,
      "grad_norm": 0.5336030041763756,
      "learning_rate": 3.5852370690292164e-05,
      "loss": 1.2511,
      "num_input_tokens_seen": 31827833456,
      "step": 40454
    },
    {
      "epoch": 4.291852323360916,
      "grad_norm": 0.5182517365108967,
      "learning_rate": 3.5851744611495766e-05,
      "loss": 1.2403,
      "num_input_tokens_seen": 31828620320,
      "step": 40455
    },
    {
      "epoch": 4.291958412900488,
      "grad_norm": 0.49517523876367747,
      "learning_rate": 3.585111852431346e-05,
      "loss": 1.3525,
      "num_input_tokens_seen": 31829407072,
      "step": 40456
    },
    {
      "epoch": 4.292064502440059,
      "grad_norm": 0.5382037457090405,
      "learning_rate": 3.585049242874573e-05,
      "loss": 1.3866,
      "num_input_tokens_seen": 31830193840,
      "step": 40457
    },
    {
      "epoch": 4.292170591979631,
      "grad_norm": 0.4934591001719852,
      "learning_rate": 3.584986632479306e-05,
      "loss": 1.2677,
      "num_input_tokens_seen": 31830980640,
      "step": 40458
    },
    {
      "epoch": 4.292276681519202,
      "grad_norm": 0.5794971073017252,
      "learning_rate": 3.584924021245592e-05,
      "loss": 1.3421,
      "num_input_tokens_seen": 31831767440,
      "step": 40459
    },
    {
      "epoch": 4.292382771058773,
      "grad_norm": 0.66239421254707,
      "learning_rate": 3.584861409173481e-05,
      "loss": 1.4086,
      "num_input_tokens_seen": 31832554144,
      "step": 40460
    },
    {
      "epoch": 4.292488860598345,
      "grad_norm": 0.6911021434642733,
      "learning_rate": 3.5847987962630214e-05,
      "loss": 1.2894,
      "num_input_tokens_seen": 31833340912,
      "step": 40461
    },
    {
      "epoch": 4.292594950137916,
      "grad_norm": 0.6480459085284026,
      "learning_rate": 3.5847361825142606e-05,
      "loss": 1.319,
      "num_input_tokens_seen": 31834127696,
      "step": 40462
    },
    {
      "epoch": 4.292701039677488,
      "grad_norm": 0.9310161163461569,
      "learning_rate": 3.584673567927248e-05,
      "loss": 1.3079,
      "num_input_tokens_seen": 31834914512,
      "step": 40463
    },
    {
      "epoch": 4.292807129217059,
      "grad_norm": 0.6787383837513417,
      "learning_rate": 3.584610952502031e-05,
      "loss": 1.2771,
      "num_input_tokens_seen": 31835701232,
      "step": 40464
    },
    {
      "epoch": 4.292913218756631,
      "grad_norm": 0.6889537712991435,
      "learning_rate": 3.584548336238659e-05,
      "loss": 1.3562,
      "num_input_tokens_seen": 31836487984,
      "step": 40465
    },
    {
      "epoch": 4.293019308296202,
      "grad_norm": 0.7764458646705699,
      "learning_rate": 3.5844857191371796e-05,
      "loss": 1.227,
      "num_input_tokens_seen": 31837274864,
      "step": 40466
    },
    {
      "epoch": 4.293125397835773,
      "grad_norm": 0.6581950755055856,
      "learning_rate": 3.584423101197641e-05,
      "loss": 1.2359,
      "num_input_tokens_seen": 31838061664,
      "step": 40467
    },
    {
      "epoch": 4.293231487375345,
      "grad_norm": 0.7356605510361242,
      "learning_rate": 3.5843604824200925e-05,
      "loss": 1.2798,
      "num_input_tokens_seen": 31838848432,
      "step": 40468
    },
    {
      "epoch": 4.293337576914916,
      "grad_norm": 0.8564800916887182,
      "learning_rate": 3.584297862804583e-05,
      "loss": 1.3749,
      "num_input_tokens_seen": 31839635184,
      "step": 40469
    },
    {
      "epoch": 4.293443666454488,
      "grad_norm": 0.6104797207112866,
      "learning_rate": 3.584235242351159e-05,
      "loss": 1.3675,
      "num_input_tokens_seen": 31840421936,
      "step": 40470
    },
    {
      "epoch": 4.293549755994059,
      "grad_norm": 0.660686635802553,
      "learning_rate": 3.584172621059869e-05,
      "loss": 1.1932,
      "num_input_tokens_seen": 31841208736,
      "step": 40471
    },
    {
      "epoch": 4.29365584553363,
      "grad_norm": 0.7582013018099003,
      "learning_rate": 3.584109998930764e-05,
      "loss": 1.2783,
      "num_input_tokens_seen": 31841995520,
      "step": 40472
    },
    {
      "epoch": 4.293761935073202,
      "grad_norm": 0.5259413233457514,
      "learning_rate": 3.584047375963889e-05,
      "loss": 1.2652,
      "num_input_tokens_seen": 31842782352,
      "step": 40473
    },
    {
      "epoch": 4.293868024612773,
      "grad_norm": 0.7511626401712941,
      "learning_rate": 3.5839847521592945e-05,
      "loss": 1.1619,
      "num_input_tokens_seen": 31843569152,
      "step": 40474
    },
    {
      "epoch": 4.293974114152345,
      "grad_norm": 0.7718189155231855,
      "learning_rate": 3.5839221275170286e-05,
      "loss": 1.3715,
      "num_input_tokens_seen": 31844355968,
      "step": 40475
    },
    {
      "epoch": 4.294080203691916,
      "grad_norm": 0.5113976553920873,
      "learning_rate": 3.583859502037139e-05,
      "loss": 1.2499,
      "num_input_tokens_seen": 31845142784,
      "step": 40476
    },
    {
      "epoch": 4.294186293231487,
      "grad_norm": 0.7679397933940106,
      "learning_rate": 3.583796875719675e-05,
      "loss": 1.2557,
      "num_input_tokens_seen": 31845929504,
      "step": 40477
    },
    {
      "epoch": 4.294292382771059,
      "grad_norm": 0.6651826749523189,
      "learning_rate": 3.5837342485646853e-05,
      "loss": 1.318,
      "num_input_tokens_seen": 31846716240,
      "step": 40478
    },
    {
      "epoch": 4.29439847231063,
      "grad_norm": 0.4881588829645418,
      "learning_rate": 3.5836716205722164e-05,
      "loss": 1.3898,
      "num_input_tokens_seen": 31847502880,
      "step": 40479
    },
    {
      "epoch": 4.294504561850202,
      "grad_norm": 0.6971478644111991,
      "learning_rate": 3.5836089917423185e-05,
      "loss": 1.2931,
      "num_input_tokens_seen": 31848289680,
      "step": 40480
    },
    {
      "epoch": 4.294610651389773,
      "grad_norm": 0.5697144473618769,
      "learning_rate": 3.583546362075039e-05,
      "loss": 1.2779,
      "num_input_tokens_seen": 31849076560,
      "step": 40481
    },
    {
      "epoch": 4.294716740929345,
      "grad_norm": 0.5276006179282609,
      "learning_rate": 3.583483731570427e-05,
      "loss": 1.2592,
      "num_input_tokens_seen": 31849863344,
      "step": 40482
    },
    {
      "epoch": 4.294822830468916,
      "grad_norm": 0.7803671149851902,
      "learning_rate": 3.583421100228531e-05,
      "loss": 1.2896,
      "num_input_tokens_seen": 31850650240,
      "step": 40483
    },
    {
      "epoch": 4.294928920008487,
      "grad_norm": 0.664607464922464,
      "learning_rate": 3.583358468049398e-05,
      "loss": 1.2304,
      "num_input_tokens_seen": 31851437008,
      "step": 40484
    },
    {
      "epoch": 4.295035009548059,
      "grad_norm": 0.5057436993465698,
      "learning_rate": 3.583295835033077e-05,
      "loss": 1.2126,
      "num_input_tokens_seen": 31852223728,
      "step": 40485
    },
    {
      "epoch": 4.29514109908763,
      "grad_norm": 0.8373237321682823,
      "learning_rate": 3.5832332011796174e-05,
      "loss": 1.3321,
      "num_input_tokens_seen": 31853010448,
      "step": 40486
    },
    {
      "epoch": 4.295247188627202,
      "grad_norm": 0.5889192859756414,
      "learning_rate": 3.583170566489068e-05,
      "loss": 1.3106,
      "num_input_tokens_seen": 31853797200,
      "step": 40487
    },
    {
      "epoch": 4.295353278166773,
      "grad_norm": 0.6367100373994115,
      "learning_rate": 3.5831079309614746e-05,
      "loss": 1.2965,
      "num_input_tokens_seen": 31854583968,
      "step": 40488
    },
    {
      "epoch": 4.295459367706345,
      "grad_norm": 0.9959794016204988,
      "learning_rate": 3.5830452945968886e-05,
      "loss": 1.5051,
      "num_input_tokens_seen": 31855370768,
      "step": 40489
    },
    {
      "epoch": 4.295565457245916,
      "grad_norm": 0.5993710083719724,
      "learning_rate": 3.582982657395355e-05,
      "loss": 1.2082,
      "num_input_tokens_seen": 31856157600,
      "step": 40490
    },
    {
      "epoch": 4.295671546785487,
      "grad_norm": 1.056037747664694,
      "learning_rate": 3.5829200193569254e-05,
      "loss": 1.3048,
      "num_input_tokens_seen": 31856944352,
      "step": 40491
    },
    {
      "epoch": 4.295777636325059,
      "grad_norm": 0.7265712974310545,
      "learning_rate": 3.582857380481648e-05,
      "loss": 1.2186,
      "num_input_tokens_seen": 31857731200,
      "step": 40492
    },
    {
      "epoch": 4.29588372586463,
      "grad_norm": 0.5588600529537803,
      "learning_rate": 3.5827947407695685e-05,
      "loss": 1.3142,
      "num_input_tokens_seen": 31858518032,
      "step": 40493
    },
    {
      "epoch": 4.2959898154042016,
      "grad_norm": 1.0038051085881328,
      "learning_rate": 3.5827321002207374e-05,
      "loss": 1.3651,
      "num_input_tokens_seen": 31859304752,
      "step": 40494
    },
    {
      "epoch": 4.296095904943773,
      "grad_norm": 0.5978923229038992,
      "learning_rate": 3.582669458835203e-05,
      "loss": 1.3526,
      "num_input_tokens_seen": 31860091552,
      "step": 40495
    },
    {
      "epoch": 4.296201994483344,
      "grad_norm": 0.662510945846254,
      "learning_rate": 3.5826068166130135e-05,
      "loss": 1.3023,
      "num_input_tokens_seen": 31860878352,
      "step": 40496
    },
    {
      "epoch": 4.2963080840229155,
      "grad_norm": 0.8762849901566888,
      "learning_rate": 3.582544173554217e-05,
      "loss": 1.3248,
      "num_input_tokens_seen": 31861665104,
      "step": 40497
    },
    {
      "epoch": 4.296414173562487,
      "grad_norm": 0.6010918819657937,
      "learning_rate": 3.5824815296588624e-05,
      "loss": 1.3464,
      "num_input_tokens_seen": 31862451824,
      "step": 40498
    },
    {
      "epoch": 4.2965202631020585,
      "grad_norm": 1.0033219372620938,
      "learning_rate": 3.582418884926998e-05,
      "loss": 1.4144,
      "num_input_tokens_seen": 31863238512,
      "step": 40499
    },
    {
      "epoch": 4.2966263526416295,
      "grad_norm": 0.5905249706330647,
      "learning_rate": 3.582356239358671e-05,
      "loss": 1.2367,
      "num_input_tokens_seen": 31864025328,
      "step": 40500
    },
    {
      "epoch": 4.2967324421812005,
      "grad_norm": 0.47461336894632733,
      "learning_rate": 3.582293592953932e-05,
      "loss": 1.1972,
      "num_input_tokens_seen": 31864812080,
      "step": 40501
    },
    {
      "epoch": 4.2968385317207725,
      "grad_norm": 0.5913067499396844,
      "learning_rate": 3.5822309457128275e-05,
      "loss": 1.3213,
      "num_input_tokens_seen": 31865598912,
      "step": 40502
    },
    {
      "epoch": 4.2969446212603435,
      "grad_norm": 0.5941111494074132,
      "learning_rate": 3.582168297635407e-05,
      "loss": 1.3189,
      "num_input_tokens_seen": 31866385616,
      "step": 40503
    },
    {
      "epoch": 4.297050710799915,
      "grad_norm": 0.5196986069465284,
      "learning_rate": 3.582105648721719e-05,
      "loss": 1.2861,
      "num_input_tokens_seen": 31867172368,
      "step": 40504
    },
    {
      "epoch": 4.297156800339486,
      "grad_norm": 0.6273030527717419,
      "learning_rate": 3.5820429989718106e-05,
      "loss": 1.3584,
      "num_input_tokens_seen": 31867959072,
      "step": 40505
    },
    {
      "epoch": 4.2972628898790575,
      "grad_norm": 0.583707440045196,
      "learning_rate": 3.581980348385732e-05,
      "loss": 1.3421,
      "num_input_tokens_seen": 31868745728,
      "step": 40506
    },
    {
      "epoch": 4.297368979418629,
      "grad_norm": 0.6170962323551121,
      "learning_rate": 3.581917696963529e-05,
      "loss": 1.2641,
      "num_input_tokens_seen": 31869532528,
      "step": 40507
    },
    {
      "epoch": 4.2974750689582,
      "grad_norm": 0.5664765304726019,
      "learning_rate": 3.581855044705254e-05,
      "loss": 1.3845,
      "num_input_tokens_seen": 31870319280,
      "step": 40508
    },
    {
      "epoch": 4.297581158497772,
      "grad_norm": 0.6793966765423206,
      "learning_rate": 3.581792391610952e-05,
      "loss": 1.3765,
      "num_input_tokens_seen": 31871106096,
      "step": 40509
    },
    {
      "epoch": 4.297687248037343,
      "grad_norm": 0.47822240628648677,
      "learning_rate": 3.5817297376806725e-05,
      "loss": 1.2659,
      "num_input_tokens_seen": 31871892800,
      "step": 40510
    },
    {
      "epoch": 4.297793337576915,
      "grad_norm": 0.5997140787449472,
      "learning_rate": 3.5816670829144645e-05,
      "loss": 1.2625,
      "num_input_tokens_seen": 31872679504,
      "step": 40511
    },
    {
      "epoch": 4.297899427116486,
      "grad_norm": 0.5481922979797147,
      "learning_rate": 3.581604427312376e-05,
      "loss": 1.295,
      "num_input_tokens_seen": 31873466240,
      "step": 40512
    },
    {
      "epoch": 4.298005516656057,
      "grad_norm": 0.6659554461386954,
      "learning_rate": 3.581541770874455e-05,
      "loss": 1.3563,
      "num_input_tokens_seen": 31874253008,
      "step": 40513
    },
    {
      "epoch": 4.298111606195629,
      "grad_norm": 0.5224094576001611,
      "learning_rate": 3.5814791136007494e-05,
      "loss": 1.2761,
      "num_input_tokens_seen": 31875039760,
      "step": 40514
    },
    {
      "epoch": 4.2982176957352,
      "grad_norm": 0.5210462322044581,
      "learning_rate": 3.58141645549131e-05,
      "loss": 1.3781,
      "num_input_tokens_seen": 31875826592,
      "step": 40515
    },
    {
      "epoch": 4.298323785274772,
      "grad_norm": 0.5741915708470964,
      "learning_rate": 3.581353796546183e-05,
      "loss": 1.317,
      "num_input_tokens_seen": 31876613344,
      "step": 40516
    },
    {
      "epoch": 4.298429874814343,
      "grad_norm": 0.5142376191011037,
      "learning_rate": 3.581291136765418e-05,
      "loss": 1.315,
      "num_input_tokens_seen": 31877400160,
      "step": 40517
    },
    {
      "epoch": 4.298535964353915,
      "grad_norm": 0.6602887448121407,
      "learning_rate": 3.581228476149062e-05,
      "loss": 1.3856,
      "num_input_tokens_seen": 31878186896,
      "step": 40518
    },
    {
      "epoch": 4.298642053893486,
      "grad_norm": 0.5223853708715064,
      "learning_rate": 3.581165814697165e-05,
      "loss": 1.3935,
      "num_input_tokens_seen": 31878973712,
      "step": 40519
    },
    {
      "epoch": 4.298748143433057,
      "grad_norm": 0.4927252122163754,
      "learning_rate": 3.581103152409775e-05,
      "loss": 1.3055,
      "num_input_tokens_seen": 31879760464,
      "step": 40520
    },
    {
      "epoch": 4.298854232972629,
      "grad_norm": 0.5635458359609912,
      "learning_rate": 3.58104048928694e-05,
      "loss": 1.3401,
      "num_input_tokens_seen": 31880547200,
      "step": 40521
    },
    {
      "epoch": 4.2989603225122,
      "grad_norm": 0.5852579863786554,
      "learning_rate": 3.580977825328708e-05,
      "loss": 1.2784,
      "num_input_tokens_seen": 31881333920,
      "step": 40522
    },
    {
      "epoch": 4.299066412051772,
      "grad_norm": 0.5609959381674918,
      "learning_rate": 3.580915160535129e-05,
      "loss": 1.2897,
      "num_input_tokens_seen": 31882120704,
      "step": 40523
    },
    {
      "epoch": 4.299172501591343,
      "grad_norm": 0.6355950761480995,
      "learning_rate": 3.58085249490625e-05,
      "loss": 1.2929,
      "num_input_tokens_seen": 31882907488,
      "step": 40524
    },
    {
      "epoch": 4.299278591130914,
      "grad_norm": 0.5518458347332479,
      "learning_rate": 3.580789828442119e-05,
      "loss": 1.3836,
      "num_input_tokens_seen": 31883694304,
      "step": 40525
    },
    {
      "epoch": 4.299384680670486,
      "grad_norm": 0.6122185183079866,
      "learning_rate": 3.5807271611427866e-05,
      "loss": 1.3052,
      "num_input_tokens_seen": 31884481024,
      "step": 40526
    },
    {
      "epoch": 4.299490770210057,
      "grad_norm": 0.6793012062971746,
      "learning_rate": 3.5806644930083e-05,
      "loss": 1.3923,
      "num_input_tokens_seen": 31885267856,
      "step": 40527
    },
    {
      "epoch": 4.299596859749629,
      "grad_norm": 0.5210221280255494,
      "learning_rate": 3.580601824038707e-05,
      "loss": 1.2699,
      "num_input_tokens_seen": 31886054688,
      "step": 40528
    },
    {
      "epoch": 4.2997029492892,
      "grad_norm": 0.686861911871128,
      "learning_rate": 3.580539154234057e-05,
      "loss": 1.3224,
      "num_input_tokens_seen": 31886841392,
      "step": 40529
    },
    {
      "epoch": 4.299809038828771,
      "grad_norm": 0.5493539223786106,
      "learning_rate": 3.580476483594398e-05,
      "loss": 1.2067,
      "num_input_tokens_seen": 31887628176,
      "step": 40530
    },
    {
      "epoch": 4.299915128368343,
      "grad_norm": 0.6660243084044561,
      "learning_rate": 3.5804138121197786e-05,
      "loss": 1.252,
      "num_input_tokens_seen": 31888414896,
      "step": 40531
    },
    {
      "epoch": 4.300021217907914,
      "grad_norm": 0.5394212772889667,
      "learning_rate": 3.5803511398102463e-05,
      "loss": 1.2538,
      "num_input_tokens_seen": 31889201696,
      "step": 40532
    },
    {
      "epoch": 4.300127307447486,
      "grad_norm": 0.589265868167053,
      "learning_rate": 3.5802884666658506e-05,
      "loss": 1.2963,
      "num_input_tokens_seen": 31889988464,
      "step": 40533
    },
    {
      "epoch": 4.300233396987057,
      "grad_norm": 0.5754717201004397,
      "learning_rate": 3.580225792686641e-05,
      "loss": 1.2973,
      "num_input_tokens_seen": 31890775216,
      "step": 40534
    },
    {
      "epoch": 4.300339486526628,
      "grad_norm": 0.5435203904370817,
      "learning_rate": 3.580163117872663e-05,
      "loss": 1.3179,
      "num_input_tokens_seen": 31891562016,
      "step": 40535
    },
    {
      "epoch": 4.3004455760662,
      "grad_norm": 0.5211834994921709,
      "learning_rate": 3.580100442223967e-05,
      "loss": 1.2988,
      "num_input_tokens_seen": 31892348752,
      "step": 40536
    },
    {
      "epoch": 4.300551665605771,
      "grad_norm": 0.5221002530538481,
      "learning_rate": 3.5800377657406015e-05,
      "loss": 1.2627,
      "num_input_tokens_seen": 31893135552,
      "step": 40537
    },
    {
      "epoch": 4.300657755145343,
      "grad_norm": 0.6591171990631077,
      "learning_rate": 3.579975088422615e-05,
      "loss": 1.205,
      "num_input_tokens_seen": 31893922400,
      "step": 40538
    },
    {
      "epoch": 4.300763844684914,
      "grad_norm": 0.5176016909517495,
      "learning_rate": 3.5799124102700536e-05,
      "loss": 1.3523,
      "num_input_tokens_seen": 31894709248,
      "step": 40539
    },
    {
      "epoch": 4.300869934224486,
      "grad_norm": 0.5997050815439251,
      "learning_rate": 3.5798497312829696e-05,
      "loss": 1.4819,
      "num_input_tokens_seen": 31895495968,
      "step": 40540
    },
    {
      "epoch": 4.300976023764057,
      "grad_norm": 0.47030003576201723,
      "learning_rate": 3.5797870514614084e-05,
      "loss": 1.2458,
      "num_input_tokens_seen": 31896282768,
      "step": 40541
    },
    {
      "epoch": 4.301082113303628,
      "grad_norm": 0.5635764981284666,
      "learning_rate": 3.579724370805419e-05,
      "loss": 1.3666,
      "num_input_tokens_seen": 31897069568,
      "step": 40542
    },
    {
      "epoch": 4.3011882028432,
      "grad_norm": 0.5073987137521383,
      "learning_rate": 3.5796616893150516e-05,
      "loss": 1.258,
      "num_input_tokens_seen": 31897856336,
      "step": 40543
    },
    {
      "epoch": 4.301294292382771,
      "grad_norm": 0.6590757210072681,
      "learning_rate": 3.579599006990352e-05,
      "loss": 1.4159,
      "num_input_tokens_seen": 31898643104,
      "step": 40544
    },
    {
      "epoch": 4.301400381922343,
      "grad_norm": 0.6715511614513785,
      "learning_rate": 3.579536323831371e-05,
      "loss": 1.2463,
      "num_input_tokens_seen": 31899429888,
      "step": 40545
    },
    {
      "epoch": 4.301506471461914,
      "grad_norm": 0.5341099244054207,
      "learning_rate": 3.5794736398381553e-05,
      "loss": 1.2638,
      "num_input_tokens_seen": 31900216624,
      "step": 40546
    },
    {
      "epoch": 4.301612561001486,
      "grad_norm": 0.549794469082359,
      "learning_rate": 3.579410955010755e-05,
      "loss": 1.3027,
      "num_input_tokens_seen": 31901003408,
      "step": 40547
    },
    {
      "epoch": 4.301718650541057,
      "grad_norm": 0.6522534220674232,
      "learning_rate": 3.579348269349216e-05,
      "loss": 1.3096,
      "num_input_tokens_seen": 31901790192,
      "step": 40548
    },
    {
      "epoch": 4.301824740080628,
      "grad_norm": 0.477352929097433,
      "learning_rate": 3.5792855828535893e-05,
      "loss": 1.2653,
      "num_input_tokens_seen": 31902576928,
      "step": 40549
    },
    {
      "epoch": 4.3019308296202,
      "grad_norm": 0.5442234633366445,
      "learning_rate": 3.579222895523922e-05,
      "loss": 1.2491,
      "num_input_tokens_seen": 31903363744,
      "step": 40550
    },
    {
      "epoch": 4.302036919159771,
      "grad_norm": 0.5439430065350951,
      "learning_rate": 3.579160207360264e-05,
      "loss": 1.243,
      "num_input_tokens_seen": 31904150544,
      "step": 40551
    },
    {
      "epoch": 4.302143008699343,
      "grad_norm": 0.45597138385140656,
      "learning_rate": 3.579097518362662e-05,
      "loss": 1.3724,
      "num_input_tokens_seen": 31904937312,
      "step": 40552
    },
    {
      "epoch": 4.302249098238914,
      "grad_norm": 0.6321457931898475,
      "learning_rate": 3.5790348285311644e-05,
      "loss": 1.3108,
      "num_input_tokens_seen": 31905724080,
      "step": 40553
    },
    {
      "epoch": 4.302355187778485,
      "grad_norm": 0.764440685219302,
      "learning_rate": 3.578972137865821e-05,
      "loss": 1.438,
      "num_input_tokens_seen": 31906510832,
      "step": 40554
    },
    {
      "epoch": 4.302461277318057,
      "grad_norm": 0.4500536355949401,
      "learning_rate": 3.578909446366679e-05,
      "loss": 1.231,
      "num_input_tokens_seen": 31907297568,
      "step": 40555
    },
    {
      "epoch": 4.302567366857628,
      "grad_norm": 0.5340797728623864,
      "learning_rate": 3.5788467540337876e-05,
      "loss": 1.2879,
      "num_input_tokens_seen": 31908084288,
      "step": 40556
    },
    {
      "epoch": 4.3026734563972,
      "grad_norm": 0.8095523152500147,
      "learning_rate": 3.578784060867196e-05,
      "loss": 1.3229,
      "num_input_tokens_seen": 31908871120,
      "step": 40557
    },
    {
      "epoch": 4.302779545936771,
      "grad_norm": 0.550675155297359,
      "learning_rate": 3.5787213668669504e-05,
      "loss": 1.3394,
      "num_input_tokens_seen": 31909657824,
      "step": 40558
    },
    {
      "epoch": 4.302885635476342,
      "grad_norm": 0.6948466814217217,
      "learning_rate": 3.578658672033102e-05,
      "loss": 1.3021,
      "num_input_tokens_seen": 31910444544,
      "step": 40559
    },
    {
      "epoch": 4.3029917250159135,
      "grad_norm": 0.5416396467004289,
      "learning_rate": 3.578595976365697e-05,
      "loss": 1.4263,
      "num_input_tokens_seen": 31911231280,
      "step": 40560
    },
    {
      "epoch": 4.303097814555485,
      "grad_norm": 0.7709621960731522,
      "learning_rate": 3.578533279864785e-05,
      "loss": 1.2987,
      "num_input_tokens_seen": 31912017952,
      "step": 40561
    },
    {
      "epoch": 4.3032039040950565,
      "grad_norm": 0.45353870368046184,
      "learning_rate": 3.578470582530413e-05,
      "loss": 1.1691,
      "num_input_tokens_seen": 31912804848,
      "step": 40562
    },
    {
      "epoch": 4.3033099936346275,
      "grad_norm": 0.4914074453147088,
      "learning_rate": 3.5784078843626325e-05,
      "loss": 1.3384,
      "num_input_tokens_seen": 31913591664,
      "step": 40563
    },
    {
      "epoch": 4.303416083174199,
      "grad_norm": 0.6519620892666683,
      "learning_rate": 3.578345185361489e-05,
      "loss": 1.3141,
      "num_input_tokens_seen": 31914378448,
      "step": 40564
    },
    {
      "epoch": 4.3035221727137705,
      "grad_norm": 0.47222764379279664,
      "learning_rate": 3.5782824855270314e-05,
      "loss": 1.3181,
      "num_input_tokens_seen": 31915165216,
      "step": 40565
    },
    {
      "epoch": 4.3036282622533415,
      "grad_norm": 0.6530456219928704,
      "learning_rate": 3.57821978485931e-05,
      "loss": 1.3808,
      "num_input_tokens_seen": 31915952048,
      "step": 40566
    },
    {
      "epoch": 4.303734351792913,
      "grad_norm": 0.6591729117731241,
      "learning_rate": 3.578157083358371e-05,
      "loss": 1.3554,
      "num_input_tokens_seen": 31916738784,
      "step": 40567
    },
    {
      "epoch": 4.3038404413324844,
      "grad_norm": 0.6477606586254571,
      "learning_rate": 3.578094381024264e-05,
      "loss": 1.2723,
      "num_input_tokens_seen": 31917525504,
      "step": 40568
    },
    {
      "epoch": 4.303946530872056,
      "grad_norm": 0.6899297386540653,
      "learning_rate": 3.5780316778570375e-05,
      "loss": 1.3268,
      "num_input_tokens_seen": 31918312256,
      "step": 40569
    },
    {
      "epoch": 4.304052620411627,
      "grad_norm": 0.5324153660876675,
      "learning_rate": 3.57796897385674e-05,
      "loss": 1.2762,
      "num_input_tokens_seen": 31919098928,
      "step": 40570
    },
    {
      "epoch": 4.304158709951198,
      "grad_norm": 0.6265707728396372,
      "learning_rate": 3.577906269023419e-05,
      "loss": 1.28,
      "num_input_tokens_seen": 31919885680,
      "step": 40571
    },
    {
      "epoch": 4.30426479949077,
      "grad_norm": 0.515657240809288,
      "learning_rate": 3.577843563357125e-05,
      "loss": 1.3654,
      "num_input_tokens_seen": 31920672368,
      "step": 40572
    },
    {
      "epoch": 4.304370889030341,
      "grad_norm": 0.4794345024887286,
      "learning_rate": 3.577780856857904e-05,
      "loss": 1.29,
      "num_input_tokens_seen": 31921459120,
      "step": 40573
    },
    {
      "epoch": 4.304476978569913,
      "grad_norm": 0.5669604064180958,
      "learning_rate": 3.577718149525806e-05,
      "loss": 1.357,
      "num_input_tokens_seen": 31922245920,
      "step": 40574
    },
    {
      "epoch": 4.304583068109484,
      "grad_norm": 0.4981905694534395,
      "learning_rate": 3.577655441360879e-05,
      "loss": 1.2991,
      "num_input_tokens_seen": 31923032672,
      "step": 40575
    },
    {
      "epoch": 4.304689157649056,
      "grad_norm": 0.5314002498186706,
      "learning_rate": 3.577592732363171e-05,
      "loss": 1.3826,
      "num_input_tokens_seen": 31923819504,
      "step": 40576
    },
    {
      "epoch": 4.304795247188627,
      "grad_norm": 0.6346580601994889,
      "learning_rate": 3.5775300225327314e-05,
      "loss": 1.303,
      "num_input_tokens_seen": 31924606320,
      "step": 40577
    },
    {
      "epoch": 4.304901336728198,
      "grad_norm": 0.4738469911728634,
      "learning_rate": 3.5774673118696076e-05,
      "loss": 1.3358,
      "num_input_tokens_seen": 31925393136,
      "step": 40578
    },
    {
      "epoch": 4.30500742626777,
      "grad_norm": 0.6302951310654372,
      "learning_rate": 3.577404600373849e-05,
      "loss": 1.3615,
      "num_input_tokens_seen": 31926179920,
      "step": 40579
    },
    {
      "epoch": 4.305113515807341,
      "grad_norm": 0.48809687393671175,
      "learning_rate": 3.5773418880455046e-05,
      "loss": 1.2997,
      "num_input_tokens_seen": 31926966640,
      "step": 40580
    },
    {
      "epoch": 4.305219605346913,
      "grad_norm": 0.5041399138310781,
      "learning_rate": 3.5772791748846216e-05,
      "loss": 1.3171,
      "num_input_tokens_seen": 31927753344,
      "step": 40581
    },
    {
      "epoch": 4.305325694886484,
      "grad_norm": 0.48766650068579903,
      "learning_rate": 3.577216460891248e-05,
      "loss": 1.3283,
      "num_input_tokens_seen": 31928540096,
      "step": 40582
    },
    {
      "epoch": 4.305431784426055,
      "grad_norm": 0.49690408034067296,
      "learning_rate": 3.577153746065434e-05,
      "loss": 1.3059,
      "num_input_tokens_seen": 31929326816,
      "step": 40583
    },
    {
      "epoch": 4.305537873965627,
      "grad_norm": 0.4866479402065398,
      "learning_rate": 3.577091030407227e-05,
      "loss": 1.3178,
      "num_input_tokens_seen": 31930113488,
      "step": 40584
    },
    {
      "epoch": 4.305643963505198,
      "grad_norm": 0.4888417690482424,
      "learning_rate": 3.5770283139166746e-05,
      "loss": 1.329,
      "num_input_tokens_seen": 31930900224,
      "step": 40585
    },
    {
      "epoch": 4.30575005304477,
      "grad_norm": 0.4951427007818306,
      "learning_rate": 3.576965596593828e-05,
      "loss": 1.23,
      "num_input_tokens_seen": 31931686928,
      "step": 40586
    },
    {
      "epoch": 4.305856142584341,
      "grad_norm": 0.5163387767978438,
      "learning_rate": 3.576902878438734e-05,
      "loss": 1.3087,
      "num_input_tokens_seen": 31932473584,
      "step": 40587
    },
    {
      "epoch": 4.305962232123912,
      "grad_norm": 0.47899128954933917,
      "learning_rate": 3.576840159451439e-05,
      "loss": 1.3458,
      "num_input_tokens_seen": 31933260416,
      "step": 40588
    },
    {
      "epoch": 4.306068321663484,
      "grad_norm": 0.5630362071217434,
      "learning_rate": 3.5767774396319956e-05,
      "loss": 1.2425,
      "num_input_tokens_seen": 31934047168,
      "step": 40589
    },
    {
      "epoch": 4.306174411203055,
      "grad_norm": 0.5516902076950467,
      "learning_rate": 3.57671471898045e-05,
      "loss": 1.3457,
      "num_input_tokens_seen": 31934833984,
      "step": 40590
    },
    {
      "epoch": 4.306280500742627,
      "grad_norm": 0.4984754192938308,
      "learning_rate": 3.5766519974968494e-05,
      "loss": 1.3228,
      "num_input_tokens_seen": 31935620768,
      "step": 40591
    },
    {
      "epoch": 4.306386590282198,
      "grad_norm": 0.6033803675437781,
      "learning_rate": 3.5765892751812445e-05,
      "loss": 1.2543,
      "num_input_tokens_seen": 31936407504,
      "step": 40592
    },
    {
      "epoch": 4.30649267982177,
      "grad_norm": 0.505526285881147,
      "learning_rate": 3.576526552033683e-05,
      "loss": 1.3009,
      "num_input_tokens_seen": 31937194272,
      "step": 40593
    },
    {
      "epoch": 4.306598769361341,
      "grad_norm": 0.5283826545364722,
      "learning_rate": 3.576463828054214e-05,
      "loss": 1.4046,
      "num_input_tokens_seen": 31937980976,
      "step": 40594
    },
    {
      "epoch": 4.306704858900912,
      "grad_norm": 0.5004791529986043,
      "learning_rate": 3.576401103242885e-05,
      "loss": 1.2189,
      "num_input_tokens_seen": 31938767824,
      "step": 40595
    },
    {
      "epoch": 4.306810948440484,
      "grad_norm": 0.5493900528175091,
      "learning_rate": 3.576338377599744e-05,
      "loss": 1.3691,
      "num_input_tokens_seen": 31939554496,
      "step": 40596
    },
    {
      "epoch": 4.306917037980055,
      "grad_norm": 0.6602130135833165,
      "learning_rate": 3.5762756511248415e-05,
      "loss": 1.2978,
      "num_input_tokens_seen": 31940341376,
      "step": 40597
    },
    {
      "epoch": 4.307023127519627,
      "grad_norm": 0.575788299229479,
      "learning_rate": 3.576212923818224e-05,
      "loss": 1.3667,
      "num_input_tokens_seen": 31941128144,
      "step": 40598
    },
    {
      "epoch": 4.307129217059198,
      "grad_norm": 0.5078246502860446,
      "learning_rate": 3.576150195679941e-05,
      "loss": 1.3583,
      "num_input_tokens_seen": 31941914816,
      "step": 40599
    },
    {
      "epoch": 4.307235306598769,
      "grad_norm": 0.6116621357581461,
      "learning_rate": 3.576087466710041e-05,
      "loss": 1.1979,
      "num_input_tokens_seen": 31942701696,
      "step": 40600
    },
    {
      "epoch": 4.307341396138341,
      "grad_norm": 0.5242447146782837,
      "learning_rate": 3.5760247369085715e-05,
      "loss": 1.4215,
      "num_input_tokens_seen": 31943488432,
      "step": 40601
    },
    {
      "epoch": 4.307447485677912,
      "grad_norm": 0.4980420242598474,
      "learning_rate": 3.5759620062755814e-05,
      "loss": 1.3922,
      "num_input_tokens_seen": 31944275264,
      "step": 40602
    },
    {
      "epoch": 4.307553575217484,
      "grad_norm": 0.7164409799745565,
      "learning_rate": 3.57589927481112e-05,
      "loss": 1.2563,
      "num_input_tokens_seen": 31945062048,
      "step": 40603
    },
    {
      "epoch": 4.307659664757055,
      "grad_norm": 0.5648255589222622,
      "learning_rate": 3.575836542515235e-05,
      "loss": 1.432,
      "num_input_tokens_seen": 31945848832,
      "step": 40604
    },
    {
      "epoch": 4.307765754296627,
      "grad_norm": 0.5841017469320438,
      "learning_rate": 3.5757738093879754e-05,
      "loss": 1.3243,
      "num_input_tokens_seen": 31946635536,
      "step": 40605
    },
    {
      "epoch": 4.307871843836198,
      "grad_norm": 0.5803047124207137,
      "learning_rate": 3.5757110754293896e-05,
      "loss": 1.3496,
      "num_input_tokens_seen": 31947422288,
      "step": 40606
    },
    {
      "epoch": 4.307977933375769,
      "grad_norm": 0.5477650724275613,
      "learning_rate": 3.575648340639525e-05,
      "loss": 1.3776,
      "num_input_tokens_seen": 31948208960,
      "step": 40607
    },
    {
      "epoch": 4.308084022915341,
      "grad_norm": 0.5812440383953337,
      "learning_rate": 3.575585605018432e-05,
      "loss": 1.4017,
      "num_input_tokens_seen": 31948995696,
      "step": 40608
    },
    {
      "epoch": 4.308190112454912,
      "grad_norm": 0.5259712095474411,
      "learning_rate": 3.5755228685661566e-05,
      "loss": 1.2581,
      "num_input_tokens_seen": 31949782400,
      "step": 40609
    },
    {
      "epoch": 4.308296201994484,
      "grad_norm": 0.6742516304697905,
      "learning_rate": 3.57546013128275e-05,
      "loss": 1.4186,
      "num_input_tokens_seen": 31950569072,
      "step": 40610
    },
    {
      "epoch": 4.308402291534055,
      "grad_norm": 0.5425995357458375,
      "learning_rate": 3.575397393168259e-05,
      "loss": 1.3736,
      "num_input_tokens_seen": 31951355872,
      "step": 40611
    },
    {
      "epoch": 4.308508381073626,
      "grad_norm": 0.6378048512658702,
      "learning_rate": 3.575334654222732e-05,
      "loss": 1.3063,
      "num_input_tokens_seen": 31952142624,
      "step": 40612
    },
    {
      "epoch": 4.308614470613198,
      "grad_norm": 0.558880299328494,
      "learning_rate": 3.575271914446219e-05,
      "loss": 1.4048,
      "num_input_tokens_seen": 31952929392,
      "step": 40613
    },
    {
      "epoch": 4.308720560152769,
      "grad_norm": 0.7041935245082651,
      "learning_rate": 3.575209173838766e-05,
      "loss": 1.318,
      "num_input_tokens_seen": 31953716128,
      "step": 40614
    },
    {
      "epoch": 4.308826649692341,
      "grad_norm": 0.6690867912300641,
      "learning_rate": 3.575146432400424e-05,
      "loss": 1.3572,
      "num_input_tokens_seen": 31954502832,
      "step": 40615
    },
    {
      "epoch": 4.308932739231912,
      "grad_norm": 0.6212232299336414,
      "learning_rate": 3.57508369013124e-05,
      "loss": 1.3473,
      "num_input_tokens_seen": 31955289696,
      "step": 40616
    },
    {
      "epoch": 4.309038828771483,
      "grad_norm": 0.8844785008694607,
      "learning_rate": 3.5750209470312625e-05,
      "loss": 1.374,
      "num_input_tokens_seen": 31956076560,
      "step": 40617
    },
    {
      "epoch": 4.309144918311055,
      "grad_norm": 0.5926295004028794,
      "learning_rate": 3.574958203100541e-05,
      "loss": 1.4065,
      "num_input_tokens_seen": 31956863312,
      "step": 40618
    },
    {
      "epoch": 4.309251007850626,
      "grad_norm": 0.5890086291300626,
      "learning_rate": 3.5748954583391225e-05,
      "loss": 1.3601,
      "num_input_tokens_seen": 31957650048,
      "step": 40619
    },
    {
      "epoch": 4.309357097390198,
      "grad_norm": 0.49961256807711374,
      "learning_rate": 3.574832712747057e-05,
      "loss": 1.1652,
      "num_input_tokens_seen": 31958436896,
      "step": 40620
    },
    {
      "epoch": 4.309463186929769,
      "grad_norm": 0.5158816895687739,
      "learning_rate": 3.574769966324392e-05,
      "loss": 1.3305,
      "num_input_tokens_seen": 31959223696,
      "step": 40621
    },
    {
      "epoch": 4.3095692764693405,
      "grad_norm": 0.5210561445585832,
      "learning_rate": 3.5747072190711764e-05,
      "loss": 1.2399,
      "num_input_tokens_seen": 31960010448,
      "step": 40622
    },
    {
      "epoch": 4.3096753660089115,
      "grad_norm": 0.5083608959552485,
      "learning_rate": 3.574644470987459e-05,
      "loss": 1.3256,
      "num_input_tokens_seen": 31960797216,
      "step": 40623
    },
    {
      "epoch": 4.309781455548483,
      "grad_norm": 0.49775523989031084,
      "learning_rate": 3.5745817220732875e-05,
      "loss": 1.2454,
      "num_input_tokens_seen": 31961583968,
      "step": 40624
    },
    {
      "epoch": 4.3098875450880545,
      "grad_norm": 0.47754425310054827,
      "learning_rate": 3.5745189723287107e-05,
      "loss": 1.3221,
      "num_input_tokens_seen": 31962370800,
      "step": 40625
    },
    {
      "epoch": 4.3099936346276255,
      "grad_norm": 0.5286631250266756,
      "learning_rate": 3.574456221753777e-05,
      "loss": 1.3303,
      "num_input_tokens_seen": 31963157552,
      "step": 40626
    },
    {
      "epoch": 4.310099724167197,
      "grad_norm": 0.45901083636280426,
      "learning_rate": 3.574393470348536e-05,
      "loss": 1.2359,
      "num_input_tokens_seen": 31963944320,
      "step": 40627
    },
    {
      "epoch": 4.3102058137067685,
      "grad_norm": 0.739630207909092,
      "learning_rate": 3.5743307181130345e-05,
      "loss": 1.2809,
      "num_input_tokens_seen": 31964731056,
      "step": 40628
    },
    {
      "epoch": 4.3103119032463395,
      "grad_norm": 0.46626800439185,
      "learning_rate": 3.5742679650473214e-05,
      "loss": 1.2123,
      "num_input_tokens_seen": 31965517776,
      "step": 40629
    },
    {
      "epoch": 4.310417992785911,
      "grad_norm": 0.9196345946782861,
      "learning_rate": 3.574205211151446e-05,
      "loss": 1.4643,
      "num_input_tokens_seen": 31966304480,
      "step": 40630
    },
    {
      "epoch": 4.3105240823254825,
      "grad_norm": 0.5544366618905228,
      "learning_rate": 3.5741424564254564e-05,
      "loss": 1.4182,
      "num_input_tokens_seen": 31967091136,
      "step": 40631
    },
    {
      "epoch": 4.310630171865054,
      "grad_norm": 0.5726261303651374,
      "learning_rate": 3.574079700869401e-05,
      "loss": 1.3406,
      "num_input_tokens_seen": 31967877968,
      "step": 40632
    },
    {
      "epoch": 4.310736261404625,
      "grad_norm": 0.603674655151882,
      "learning_rate": 3.574016944483328e-05,
      "loss": 1.3045,
      "num_input_tokens_seen": 31968664784,
      "step": 40633
    },
    {
      "epoch": 4.310842350944197,
      "grad_norm": 0.6023318846017498,
      "learning_rate": 3.573954187267286e-05,
      "loss": 1.2366,
      "num_input_tokens_seen": 31969451552,
      "step": 40634
    },
    {
      "epoch": 4.310948440483768,
      "grad_norm": 0.566356291119129,
      "learning_rate": 3.573891429221325e-05,
      "loss": 1.358,
      "num_input_tokens_seen": 31970238272,
      "step": 40635
    },
    {
      "epoch": 4.311054530023339,
      "grad_norm": 0.6391319340575061,
      "learning_rate": 3.573828670345491e-05,
      "loss": 1.3847,
      "num_input_tokens_seen": 31971025104,
      "step": 40636
    },
    {
      "epoch": 4.311160619562911,
      "grad_norm": 0.6980891552361277,
      "learning_rate": 3.573765910639834e-05,
      "loss": 1.4238,
      "num_input_tokens_seen": 31971811872,
      "step": 40637
    },
    {
      "epoch": 4.311266709102482,
      "grad_norm": 0.5048150470589472,
      "learning_rate": 3.573703150104403e-05,
      "loss": 1.3411,
      "num_input_tokens_seen": 31972598640,
      "step": 40638
    },
    {
      "epoch": 4.311372798642054,
      "grad_norm": 0.8121542128464414,
      "learning_rate": 3.573640388739244e-05,
      "loss": 1.3387,
      "num_input_tokens_seen": 31973385440,
      "step": 40639
    },
    {
      "epoch": 4.311478888181625,
      "grad_norm": 0.6601376236607104,
      "learning_rate": 3.5735776265444085e-05,
      "loss": 1.2388,
      "num_input_tokens_seen": 31974172192,
      "step": 40640
    },
    {
      "epoch": 4.311584977721196,
      "grad_norm": 0.7702312073747544,
      "learning_rate": 3.573514863519944e-05,
      "loss": 1.3644,
      "num_input_tokens_seen": 31974958976,
      "step": 40641
    },
    {
      "epoch": 4.311691067260768,
      "grad_norm": 0.7407021768067568,
      "learning_rate": 3.573452099665898e-05,
      "loss": 1.3212,
      "num_input_tokens_seen": 31975745776,
      "step": 40642
    },
    {
      "epoch": 4.311797156800339,
      "grad_norm": 0.5537072282154823,
      "learning_rate": 3.57338933498232e-05,
      "loss": 1.3318,
      "num_input_tokens_seen": 31976532528,
      "step": 40643
    },
    {
      "epoch": 4.311903246339911,
      "grad_norm": 0.6072133988112012,
      "learning_rate": 3.5733265694692584e-05,
      "loss": 1.2846,
      "num_input_tokens_seen": 31977319328,
      "step": 40644
    },
    {
      "epoch": 4.312009335879482,
      "grad_norm": 0.5981623248375257,
      "learning_rate": 3.5732638031267606e-05,
      "loss": 1.3671,
      "num_input_tokens_seen": 31978106096,
      "step": 40645
    },
    {
      "epoch": 4.312115425419053,
      "grad_norm": 0.45948002902417007,
      "learning_rate": 3.573201035954877e-05,
      "loss": 1.2945,
      "num_input_tokens_seen": 31978892976,
      "step": 40646
    },
    {
      "epoch": 4.312221514958625,
      "grad_norm": 0.6504724345491188,
      "learning_rate": 3.573138267953655e-05,
      "loss": 1.3943,
      "num_input_tokens_seen": 31979679696,
      "step": 40647
    },
    {
      "epoch": 4.312327604498196,
      "grad_norm": 0.583882187775081,
      "learning_rate": 3.5730754991231424e-05,
      "loss": 1.3978,
      "num_input_tokens_seen": 31980466592,
      "step": 40648
    },
    {
      "epoch": 4.312433694037768,
      "grad_norm": 0.5187754785622584,
      "learning_rate": 3.57301272946339e-05,
      "loss": 1.1956,
      "num_input_tokens_seen": 31981253344,
      "step": 40649
    },
    {
      "epoch": 4.312539783577339,
      "grad_norm": 0.5052608805414103,
      "learning_rate": 3.572949958974443e-05,
      "loss": 1.3043,
      "num_input_tokens_seen": 31982040080,
      "step": 40650
    },
    {
      "epoch": 4.312645873116911,
      "grad_norm": 0.8224405594236137,
      "learning_rate": 3.572887187656353e-05,
      "loss": 1.2268,
      "num_input_tokens_seen": 31982826944,
      "step": 40651
    },
    {
      "epoch": 4.312751962656482,
      "grad_norm": 0.5723352521210601,
      "learning_rate": 3.5728244155091666e-05,
      "loss": 1.3736,
      "num_input_tokens_seen": 31983613696,
      "step": 40652
    },
    {
      "epoch": 4.312858052196053,
      "grad_norm": 0.6708933777455656,
      "learning_rate": 3.572761642532934e-05,
      "loss": 1.4311,
      "num_input_tokens_seen": 31984400496,
      "step": 40653
    },
    {
      "epoch": 4.312964141735625,
      "grad_norm": 0.9585789285990208,
      "learning_rate": 3.572698868727702e-05,
      "loss": 1.3766,
      "num_input_tokens_seen": 31985187136,
      "step": 40654
    },
    {
      "epoch": 4.313070231275196,
      "grad_norm": 0.9537543110362051,
      "learning_rate": 3.57263609409352e-05,
      "loss": 1.3551,
      "num_input_tokens_seen": 31985973792,
      "step": 40655
    },
    {
      "epoch": 4.313176320814768,
      "grad_norm": 0.7185780031448662,
      "learning_rate": 3.572573318630436e-05,
      "loss": 1.3521,
      "num_input_tokens_seen": 31986760592,
      "step": 40656
    },
    {
      "epoch": 4.313282410354339,
      "grad_norm": 0.5746747602263347,
      "learning_rate": 3.572510542338499e-05,
      "loss": 1.2652,
      "num_input_tokens_seen": 31987547408,
      "step": 40657
    },
    {
      "epoch": 4.31338849989391,
      "grad_norm": 0.7088117084607847,
      "learning_rate": 3.572447765217757e-05,
      "loss": 1.3306,
      "num_input_tokens_seen": 31988334176,
      "step": 40658
    },
    {
      "epoch": 4.313494589433482,
      "grad_norm": 0.5275697002728695,
      "learning_rate": 3.572384987268259e-05,
      "loss": 1.2377,
      "num_input_tokens_seen": 31989120976,
      "step": 40659
    },
    {
      "epoch": 4.313600678973053,
      "grad_norm": 0.5841456805981993,
      "learning_rate": 3.572322208490053e-05,
      "loss": 1.4174,
      "num_input_tokens_seen": 31989907808,
      "step": 40660
    },
    {
      "epoch": 4.313706768512625,
      "grad_norm": 0.6423019351176181,
      "learning_rate": 3.572259428883189e-05,
      "loss": 1.3778,
      "num_input_tokens_seen": 31990694624,
      "step": 40661
    },
    {
      "epoch": 4.313812858052196,
      "grad_norm": 0.5138207895234427,
      "learning_rate": 3.572196648447714e-05,
      "loss": 1.3821,
      "num_input_tokens_seen": 31991481312,
      "step": 40662
    },
    {
      "epoch": 4.313918947591768,
      "grad_norm": 0.6629205221475959,
      "learning_rate": 3.572133867183676e-05,
      "loss": 1.3473,
      "num_input_tokens_seen": 31992268144,
      "step": 40663
    },
    {
      "epoch": 4.314025037131339,
      "grad_norm": 0.5144513200786728,
      "learning_rate": 3.572071085091125e-05,
      "loss": 1.2117,
      "num_input_tokens_seen": 31993054864,
      "step": 40664
    },
    {
      "epoch": 4.31413112667091,
      "grad_norm": 0.6871451476817895,
      "learning_rate": 3.572008302170109e-05,
      "loss": 1.3137,
      "num_input_tokens_seen": 31993841616,
      "step": 40665
    },
    {
      "epoch": 4.314237216210482,
      "grad_norm": 0.6133472127416452,
      "learning_rate": 3.571945518420676e-05,
      "loss": 1.2824,
      "num_input_tokens_seen": 31994628448,
      "step": 40666
    },
    {
      "epoch": 4.314343305750053,
      "grad_norm": 0.5661926853620839,
      "learning_rate": 3.571882733842876e-05,
      "loss": 1.3597,
      "num_input_tokens_seen": 31995415248,
      "step": 40667
    },
    {
      "epoch": 4.314449395289625,
      "grad_norm": 0.655667295859818,
      "learning_rate": 3.5718199484367555e-05,
      "loss": 1.3305,
      "num_input_tokens_seen": 31996202032,
      "step": 40668
    },
    {
      "epoch": 4.314555484829196,
      "grad_norm": 0.5449352572740435,
      "learning_rate": 3.5717571622023645e-05,
      "loss": 1.3565,
      "num_input_tokens_seen": 31996988784,
      "step": 40669
    },
    {
      "epoch": 4.314661574368767,
      "grad_norm": 0.6361877714451263,
      "learning_rate": 3.571694375139751e-05,
      "loss": 1.2462,
      "num_input_tokens_seen": 31997775632,
      "step": 40670
    },
    {
      "epoch": 4.314767663908339,
      "grad_norm": 0.5933694038224542,
      "learning_rate": 3.5716315872489625e-05,
      "loss": 1.3035,
      "num_input_tokens_seen": 31998562432,
      "step": 40671
    },
    {
      "epoch": 4.31487375344791,
      "grad_norm": 0.544027916058217,
      "learning_rate": 3.57156879853005e-05,
      "loss": 1.3096,
      "num_input_tokens_seen": 31999349296,
      "step": 40672
    },
    {
      "epoch": 4.314979842987482,
      "grad_norm": 0.5770857470110125,
      "learning_rate": 3.57150600898306e-05,
      "loss": 1.3459,
      "num_input_tokens_seen": 32000136016,
      "step": 40673
    },
    {
      "epoch": 4.315085932527053,
      "grad_norm": 0.5705038900719247,
      "learning_rate": 3.571443218608041e-05,
      "loss": 1.3085,
      "num_input_tokens_seen": 32000922720,
      "step": 40674
    },
    {
      "epoch": 4.315192022066624,
      "grad_norm": 0.6045138729951983,
      "learning_rate": 3.571380427405043e-05,
      "loss": 1.4435,
      "num_input_tokens_seen": 32001709440,
      "step": 40675
    },
    {
      "epoch": 4.315298111606196,
      "grad_norm": 0.5550402053014207,
      "learning_rate": 3.5713176353741135e-05,
      "loss": 1.2809,
      "num_input_tokens_seen": 32002496192,
      "step": 40676
    },
    {
      "epoch": 4.315404201145767,
      "grad_norm": 0.5180909129829003,
      "learning_rate": 3.571254842515301e-05,
      "loss": 1.2997,
      "num_input_tokens_seen": 32003282976,
      "step": 40677
    },
    {
      "epoch": 4.315510290685339,
      "grad_norm": 0.7690385764544853,
      "learning_rate": 3.571192048828654e-05,
      "loss": 1.4029,
      "num_input_tokens_seen": 32004069760,
      "step": 40678
    },
    {
      "epoch": 4.31561638022491,
      "grad_norm": 0.5237118090205002,
      "learning_rate": 3.571129254314221e-05,
      "loss": 1.2051,
      "num_input_tokens_seen": 32004856528,
      "step": 40679
    },
    {
      "epoch": 4.315722469764482,
      "grad_norm": 0.6180148944424029,
      "learning_rate": 3.571066458972051e-05,
      "loss": 1.2867,
      "num_input_tokens_seen": 32005643344,
      "step": 40680
    },
    {
      "epoch": 4.315828559304053,
      "grad_norm": 0.7044234930774469,
      "learning_rate": 3.5710036628021934e-05,
      "loss": 1.4535,
      "num_input_tokens_seen": 32006430048,
      "step": 40681
    },
    {
      "epoch": 4.315934648843624,
      "grad_norm": 0.5273971914544315,
      "learning_rate": 3.5709408658046936e-05,
      "loss": 1.3679,
      "num_input_tokens_seen": 32007216736,
      "step": 40682
    },
    {
      "epoch": 4.316040738383196,
      "grad_norm": 0.6550099897467874,
      "learning_rate": 3.5708780679796034e-05,
      "loss": 1.3638,
      "num_input_tokens_seen": 32008003536,
      "step": 40683
    },
    {
      "epoch": 4.316146827922767,
      "grad_norm": 0.5695967829816425,
      "learning_rate": 3.57081526932697e-05,
      "loss": 1.266,
      "num_input_tokens_seen": 32008790384,
      "step": 40684
    },
    {
      "epoch": 4.3162529174623385,
      "grad_norm": 0.5422180916927881,
      "learning_rate": 3.570752469846841e-05,
      "loss": 1.3209,
      "num_input_tokens_seen": 32009577200,
      "step": 40685
    },
    {
      "epoch": 4.3163590070019096,
      "grad_norm": 0.5317757327795473,
      "learning_rate": 3.5706896695392675e-05,
      "loss": 1.2397,
      "num_input_tokens_seen": 32010363904,
      "step": 40686
    },
    {
      "epoch": 4.3164650965414815,
      "grad_norm": 0.5053307847312387,
      "learning_rate": 3.570626868404295e-05,
      "loss": 1.2856,
      "num_input_tokens_seen": 32011150608,
      "step": 40687
    },
    {
      "epoch": 4.3165711860810525,
      "grad_norm": 0.5227779199402549,
      "learning_rate": 3.570564066441974e-05,
      "loss": 1.2601,
      "num_input_tokens_seen": 32011937360,
      "step": 40688
    },
    {
      "epoch": 4.3166772756206235,
      "grad_norm": 0.6239797038876217,
      "learning_rate": 3.5705012636523526e-05,
      "loss": 1.2878,
      "num_input_tokens_seen": 32012724160,
      "step": 40689
    },
    {
      "epoch": 4.3167833651601955,
      "grad_norm": 0.6337856845156788,
      "learning_rate": 3.5704384600354794e-05,
      "loss": 1.3194,
      "num_input_tokens_seen": 32013510976,
      "step": 40690
    },
    {
      "epoch": 4.3168894546997665,
      "grad_norm": 0.6286218620369557,
      "learning_rate": 3.570375655591403e-05,
      "loss": 1.3393,
      "num_input_tokens_seen": 32014297728,
      "step": 40691
    },
    {
      "epoch": 4.316995544239338,
      "grad_norm": 0.5219246008307803,
      "learning_rate": 3.570312850320171e-05,
      "loss": 1.2999,
      "num_input_tokens_seen": 32015084448,
      "step": 40692
    },
    {
      "epoch": 4.317101633778909,
      "grad_norm": 0.560728140798285,
      "learning_rate": 3.570250044221833e-05,
      "loss": 1.4011,
      "num_input_tokens_seen": 32015871120,
      "step": 40693
    },
    {
      "epoch": 4.3172077233184805,
      "grad_norm": 0.5513447503590203,
      "learning_rate": 3.570187237296437e-05,
      "loss": 1.3044,
      "num_input_tokens_seen": 32016657888,
      "step": 40694
    },
    {
      "epoch": 4.317313812858052,
      "grad_norm": 0.5167361830213195,
      "learning_rate": 3.570124429544032e-05,
      "loss": 1.2533,
      "num_input_tokens_seen": 32017444688,
      "step": 40695
    },
    {
      "epoch": 4.317419902397623,
      "grad_norm": 0.5070341110967475,
      "learning_rate": 3.570061620964665e-05,
      "loss": 1.3501,
      "num_input_tokens_seen": 32018231520,
      "step": 40696
    },
    {
      "epoch": 4.317525991937195,
      "grad_norm": 0.4409184311610087,
      "learning_rate": 3.5699988115583874e-05,
      "loss": 1.2394,
      "num_input_tokens_seen": 32019018352,
      "step": 40697
    },
    {
      "epoch": 4.317632081476766,
      "grad_norm": 0.5290465739128494,
      "learning_rate": 3.569936001325245e-05,
      "loss": 1.333,
      "num_input_tokens_seen": 32019805072,
      "step": 40698
    },
    {
      "epoch": 4.317738171016337,
      "grad_norm": 0.5024052214215902,
      "learning_rate": 3.569873190265288e-05,
      "loss": 1.3134,
      "num_input_tokens_seen": 32020591840,
      "step": 40699
    },
    {
      "epoch": 4.317844260555909,
      "grad_norm": 0.4798200097599905,
      "learning_rate": 3.569810378378564e-05,
      "loss": 1.2909,
      "num_input_tokens_seen": 32021378736,
      "step": 40700
    },
    {
      "epoch": 4.31795035009548,
      "grad_norm": 0.4788860858797267,
      "learning_rate": 3.569747565665123e-05,
      "loss": 1.2682,
      "num_input_tokens_seen": 32022165568,
      "step": 40701
    },
    {
      "epoch": 4.318056439635052,
      "grad_norm": 0.565107289011872,
      "learning_rate": 3.569684752125011e-05,
      "loss": 1.3947,
      "num_input_tokens_seen": 32022952288,
      "step": 40702
    },
    {
      "epoch": 4.318162529174623,
      "grad_norm": 0.5813955684982347,
      "learning_rate": 3.569621937758279e-05,
      "loss": 1.3978,
      "num_input_tokens_seen": 32023739008,
      "step": 40703
    },
    {
      "epoch": 4.318268618714194,
      "grad_norm": 0.561253583289066,
      "learning_rate": 3.5695591225649746e-05,
      "loss": 1.3107,
      "num_input_tokens_seen": 32024525744,
      "step": 40704
    },
    {
      "epoch": 4.318374708253766,
      "grad_norm": 0.6425541098752924,
      "learning_rate": 3.569496306545146e-05,
      "loss": 1.331,
      "num_input_tokens_seen": 32025312464,
      "step": 40705
    },
    {
      "epoch": 4.318480797793337,
      "grad_norm": 0.4863905619655423,
      "learning_rate": 3.569433489698842e-05,
      "loss": 1.2682,
      "num_input_tokens_seen": 32026099296,
      "step": 40706
    },
    {
      "epoch": 4.318586887332909,
      "grad_norm": 0.5913205858799406,
      "learning_rate": 3.5693706720261114e-05,
      "loss": 1.2497,
      "num_input_tokens_seen": 32026886016,
      "step": 40707
    },
    {
      "epoch": 4.31869297687248,
      "grad_norm": 0.5018633788427862,
      "learning_rate": 3.569307853527002e-05,
      "loss": 1.2846,
      "num_input_tokens_seen": 32027672736,
      "step": 40708
    },
    {
      "epoch": 4.318799066412052,
      "grad_norm": 0.6097649986446423,
      "learning_rate": 3.5692450342015635e-05,
      "loss": 1.3543,
      "num_input_tokens_seen": 32028459520,
      "step": 40709
    },
    {
      "epoch": 4.318905155951623,
      "grad_norm": 0.48692296460345874,
      "learning_rate": 3.5691822140498435e-05,
      "loss": 1.3439,
      "num_input_tokens_seen": 32029246320,
      "step": 40710
    },
    {
      "epoch": 4.319011245491194,
      "grad_norm": 0.5081766054085659,
      "learning_rate": 3.5691193930718903e-05,
      "loss": 1.2785,
      "num_input_tokens_seen": 32030033024,
      "step": 40711
    },
    {
      "epoch": 4.319117335030766,
      "grad_norm": 0.4711936180638825,
      "learning_rate": 3.5690565712677534e-05,
      "loss": 1.2649,
      "num_input_tokens_seen": 32030819936,
      "step": 40712
    },
    {
      "epoch": 4.319223424570337,
      "grad_norm": 0.5241428876417,
      "learning_rate": 3.5689937486374816e-05,
      "loss": 1.3091,
      "num_input_tokens_seen": 32031606736,
      "step": 40713
    },
    {
      "epoch": 4.319329514109909,
      "grad_norm": 0.4917062045101091,
      "learning_rate": 3.568930925181122e-05,
      "loss": 1.3011,
      "num_input_tokens_seen": 32032393568,
      "step": 40714
    },
    {
      "epoch": 4.31943560364948,
      "grad_norm": 0.6953486751855786,
      "learning_rate": 3.568868100898725e-05,
      "loss": 1.3201,
      "num_input_tokens_seen": 32033180320,
      "step": 40715
    },
    {
      "epoch": 4.319541693189052,
      "grad_norm": 0.4356410070733362,
      "learning_rate": 3.568805275790337e-05,
      "loss": 1.251,
      "num_input_tokens_seen": 32033967168,
      "step": 40716
    },
    {
      "epoch": 4.319647782728623,
      "grad_norm": 0.61838693757085,
      "learning_rate": 3.5687424498560075e-05,
      "loss": 1.2766,
      "num_input_tokens_seen": 32034753984,
      "step": 40717
    },
    {
      "epoch": 4.319753872268194,
      "grad_norm": 0.5379246251013883,
      "learning_rate": 3.5686796230957866e-05,
      "loss": 1.2174,
      "num_input_tokens_seen": 32035540832,
      "step": 40718
    },
    {
      "epoch": 4.319859961807766,
      "grad_norm": 0.5288196876384853,
      "learning_rate": 3.568616795509721e-05,
      "loss": 1.3068,
      "num_input_tokens_seen": 32036327600,
      "step": 40719
    },
    {
      "epoch": 4.319966051347337,
      "grad_norm": 0.5160897754667059,
      "learning_rate": 3.568553967097858e-05,
      "loss": 1.356,
      "num_input_tokens_seen": 32037114352,
      "step": 40720
    },
    {
      "epoch": 4.320072140886909,
      "grad_norm": 0.4815318025319828,
      "learning_rate": 3.5684911378602495e-05,
      "loss": 1.3199,
      "num_input_tokens_seen": 32037901072,
      "step": 40721
    },
    {
      "epoch": 4.32017823042648,
      "grad_norm": 0.4654167310984744,
      "learning_rate": 3.5684283077969423e-05,
      "loss": 1.2866,
      "num_input_tokens_seen": 32038687856,
      "step": 40722
    },
    {
      "epoch": 4.320284319966051,
      "grad_norm": 0.567208158835976,
      "learning_rate": 3.568365476907985e-05,
      "loss": 1.2271,
      "num_input_tokens_seen": 32039474656,
      "step": 40723
    },
    {
      "epoch": 4.320390409505623,
      "grad_norm": 0.5372684368261472,
      "learning_rate": 3.5683026451934254e-05,
      "loss": 1.358,
      "num_input_tokens_seen": 32040261408,
      "step": 40724
    },
    {
      "epoch": 4.320496499045194,
      "grad_norm": 0.5624780029958927,
      "learning_rate": 3.5682398126533126e-05,
      "loss": 1.2718,
      "num_input_tokens_seen": 32041048176,
      "step": 40725
    },
    {
      "epoch": 4.320602588584766,
      "grad_norm": 0.5031832447744086,
      "learning_rate": 3.568176979287697e-05,
      "loss": 1.1858,
      "num_input_tokens_seen": 32041835024,
      "step": 40726
    },
    {
      "epoch": 4.320708678124337,
      "grad_norm": 0.4490179249916343,
      "learning_rate": 3.568114145096625e-05,
      "loss": 1.3327,
      "num_input_tokens_seen": 32042621744,
      "step": 40727
    },
    {
      "epoch": 4.320814767663908,
      "grad_norm": 0.5748359377057308,
      "learning_rate": 3.568051310080145e-05,
      "loss": 1.3581,
      "num_input_tokens_seen": 32043408544,
      "step": 40728
    },
    {
      "epoch": 4.32092085720348,
      "grad_norm": 0.5594982371952231,
      "learning_rate": 3.567988474238307e-05,
      "loss": 1.3325,
      "num_input_tokens_seen": 32044195392,
      "step": 40729
    },
    {
      "epoch": 4.321026946743051,
      "grad_norm": 0.6025432879951874,
      "learning_rate": 3.567925637571158e-05,
      "loss": 1.3282,
      "num_input_tokens_seen": 32044982096,
      "step": 40730
    },
    {
      "epoch": 4.321133036282623,
      "grad_norm": 0.5226430736495529,
      "learning_rate": 3.567862800078749e-05,
      "loss": 1.2712,
      "num_input_tokens_seen": 32045768912,
      "step": 40731
    },
    {
      "epoch": 4.321239125822194,
      "grad_norm": 0.5088018914679777,
      "learning_rate": 3.567799961761126e-05,
      "loss": 1.2446,
      "num_input_tokens_seen": 32046555696,
      "step": 40732
    },
    {
      "epoch": 4.321345215361766,
      "grad_norm": 0.6332226971339608,
      "learning_rate": 3.567737122618338e-05,
      "loss": 1.3662,
      "num_input_tokens_seen": 32047342464,
      "step": 40733
    },
    {
      "epoch": 4.321451304901337,
      "grad_norm": 0.5015117866241415,
      "learning_rate": 3.567674282650434e-05,
      "loss": 1.4195,
      "num_input_tokens_seen": 32048129152,
      "step": 40734
    },
    {
      "epoch": 4.321557394440908,
      "grad_norm": 0.6225031837060973,
      "learning_rate": 3.567611441857464e-05,
      "loss": 1.294,
      "num_input_tokens_seen": 32048915920,
      "step": 40735
    },
    {
      "epoch": 4.32166348398048,
      "grad_norm": 0.4962591273064561,
      "learning_rate": 3.567548600239474e-05,
      "loss": 1.2743,
      "num_input_tokens_seen": 32049702720,
      "step": 40736
    },
    {
      "epoch": 4.321769573520051,
      "grad_norm": 0.7520701437506261,
      "learning_rate": 3.567485757796514e-05,
      "loss": 1.2228,
      "num_input_tokens_seen": 32050489504,
      "step": 40737
    },
    {
      "epoch": 4.321875663059623,
      "grad_norm": 0.6707487866744398,
      "learning_rate": 3.567422914528633e-05,
      "loss": 1.3993,
      "num_input_tokens_seen": 32051276288,
      "step": 40738
    },
    {
      "epoch": 4.321981752599194,
      "grad_norm": 0.5550820278848956,
      "learning_rate": 3.567360070435878e-05,
      "loss": 1.2678,
      "num_input_tokens_seen": 32052063104,
      "step": 40739
    },
    {
      "epoch": 4.322087842138765,
      "grad_norm": 0.8433793038450561,
      "learning_rate": 3.567297225518299e-05,
      "loss": 1.2856,
      "num_input_tokens_seen": 32052849920,
      "step": 40740
    },
    {
      "epoch": 4.322193931678337,
      "grad_norm": 0.49468000829818476,
      "learning_rate": 3.5672343797759447e-05,
      "loss": 1.2185,
      "num_input_tokens_seen": 32053636608,
      "step": 40741
    },
    {
      "epoch": 4.322300021217908,
      "grad_norm": 0.6774705475980899,
      "learning_rate": 3.567171533208862e-05,
      "loss": 1.4043,
      "num_input_tokens_seen": 32054423312,
      "step": 40742
    },
    {
      "epoch": 4.32240611075748,
      "grad_norm": 0.5109152803394731,
      "learning_rate": 3.5671086858171e-05,
      "loss": 1.2359,
      "num_input_tokens_seen": 32055210144,
      "step": 40743
    },
    {
      "epoch": 4.322512200297051,
      "grad_norm": 0.547783557131747,
      "learning_rate": 3.567045837600709e-05,
      "loss": 1.3378,
      "num_input_tokens_seen": 32055996928,
      "step": 40744
    },
    {
      "epoch": 4.3226182898366226,
      "grad_norm": 0.6373121213187855,
      "learning_rate": 3.566982988559735e-05,
      "loss": 1.2937,
      "num_input_tokens_seen": 32056783680,
      "step": 40745
    },
    {
      "epoch": 4.322724379376194,
      "grad_norm": 0.5940618328805444,
      "learning_rate": 3.5669201386942286e-05,
      "loss": 1.5379,
      "num_input_tokens_seen": 32057570464,
      "step": 40746
    },
    {
      "epoch": 4.322830468915765,
      "grad_norm": 0.9171338753947293,
      "learning_rate": 3.566857288004238e-05,
      "loss": 1.3272,
      "num_input_tokens_seen": 32058357312,
      "step": 40747
    },
    {
      "epoch": 4.3229365584553365,
      "grad_norm": 0.5692598701321178,
      "learning_rate": 3.566794436489811e-05,
      "loss": 1.2598,
      "num_input_tokens_seen": 32059144064,
      "step": 40748
    },
    {
      "epoch": 4.323042647994908,
      "grad_norm": 0.739219932743571,
      "learning_rate": 3.566731584150996e-05,
      "loss": 1.3934,
      "num_input_tokens_seen": 32059930816,
      "step": 40749
    },
    {
      "epoch": 4.3231487375344795,
      "grad_norm": 0.5159038114527683,
      "learning_rate": 3.5666687309878425e-05,
      "loss": 1.4026,
      "num_input_tokens_seen": 32060717600,
      "step": 40750
    },
    {
      "epoch": 4.3232548270740505,
      "grad_norm": 0.6070752793234386,
      "learning_rate": 3.566605877000399e-05,
      "loss": 1.4098,
      "num_input_tokens_seen": 32061504464,
      "step": 40751
    },
    {
      "epoch": 4.3233609166136215,
      "grad_norm": 0.45045585765432894,
      "learning_rate": 3.566543022188714e-05,
      "loss": 1.3672,
      "num_input_tokens_seen": 32062291232,
      "step": 40752
    },
    {
      "epoch": 4.3234670061531935,
      "grad_norm": 0.6720242719401304,
      "learning_rate": 3.566480166552835e-05,
      "loss": 1.4288,
      "num_input_tokens_seen": 32063077968,
      "step": 40753
    },
    {
      "epoch": 4.3235730956927645,
      "grad_norm": 0.5670523519954922,
      "learning_rate": 3.566417310092812e-05,
      "loss": 1.3307,
      "num_input_tokens_seen": 32063864768,
      "step": 40754
    },
    {
      "epoch": 4.323679185232336,
      "grad_norm": 0.5006987235021865,
      "learning_rate": 3.566354452808692e-05,
      "loss": 1.2075,
      "num_input_tokens_seen": 32064651584,
      "step": 40755
    },
    {
      "epoch": 4.323785274771907,
      "grad_norm": 0.47175779325892236,
      "learning_rate": 3.566291594700526e-05,
      "loss": 1.3676,
      "num_input_tokens_seen": 32065438272,
      "step": 40756
    },
    {
      "epoch": 4.3238913643114785,
      "grad_norm": 0.6526205130427751,
      "learning_rate": 3.5662287357683606e-05,
      "loss": 1.3255,
      "num_input_tokens_seen": 32066225072,
      "step": 40757
    },
    {
      "epoch": 4.32399745385105,
      "grad_norm": 0.5611521785767787,
      "learning_rate": 3.566165876012245e-05,
      "loss": 1.3309,
      "num_input_tokens_seen": 32067011856,
      "step": 40758
    },
    {
      "epoch": 4.324103543390621,
      "grad_norm": 0.5339089110861873,
      "learning_rate": 3.566103015432228e-05,
      "loss": 1.3415,
      "num_input_tokens_seen": 32067798656,
      "step": 40759
    },
    {
      "epoch": 4.324209632930193,
      "grad_norm": 0.5923352719502475,
      "learning_rate": 3.566040154028357e-05,
      "loss": 1.3296,
      "num_input_tokens_seen": 32068585376,
      "step": 40760
    },
    {
      "epoch": 4.324315722469764,
      "grad_norm": 0.6242738036273904,
      "learning_rate": 3.565977291800682e-05,
      "loss": 1.3365,
      "num_input_tokens_seen": 32069372208,
      "step": 40761
    },
    {
      "epoch": 4.324421812009336,
      "grad_norm": 0.5970201678996603,
      "learning_rate": 3.565914428749251e-05,
      "loss": 1.4139,
      "num_input_tokens_seen": 32070158976,
      "step": 40762
    },
    {
      "epoch": 4.324527901548907,
      "grad_norm": 0.6805479673320786,
      "learning_rate": 3.5658515648741117e-05,
      "loss": 1.3547,
      "num_input_tokens_seen": 32070945696,
      "step": 40763
    },
    {
      "epoch": 4.324633991088478,
      "grad_norm": 0.5286658805400262,
      "learning_rate": 3.565788700175315e-05,
      "loss": 1.2709,
      "num_input_tokens_seen": 32071732464,
      "step": 40764
    },
    {
      "epoch": 4.32474008062805,
      "grad_norm": 0.6392527628923634,
      "learning_rate": 3.565725834652908e-05,
      "loss": 1.3254,
      "num_input_tokens_seen": 32072519120,
      "step": 40765
    },
    {
      "epoch": 4.324846170167621,
      "grad_norm": 0.4341112335374955,
      "learning_rate": 3.5656629683069384e-05,
      "loss": 1.1905,
      "num_input_tokens_seen": 32073305984,
      "step": 40766
    },
    {
      "epoch": 4.324952259707193,
      "grad_norm": 0.507684249472938,
      "learning_rate": 3.565600101137456e-05,
      "loss": 1.2883,
      "num_input_tokens_seen": 32074092688,
      "step": 40767
    },
    {
      "epoch": 4.325058349246764,
      "grad_norm": 0.5108009213738499,
      "learning_rate": 3.565537233144509e-05,
      "loss": 1.3919,
      "num_input_tokens_seen": 32074879344,
      "step": 40768
    },
    {
      "epoch": 4.325164438786335,
      "grad_norm": 0.48626385732294564,
      "learning_rate": 3.565474364328146e-05,
      "loss": 1.3604,
      "num_input_tokens_seen": 32075666128,
      "step": 40769
    },
    {
      "epoch": 4.325270528325907,
      "grad_norm": 0.5129403213304843,
      "learning_rate": 3.5654114946884166e-05,
      "loss": 1.2394,
      "num_input_tokens_seen": 32076452896,
      "step": 40770
    },
    {
      "epoch": 4.325376617865478,
      "grad_norm": 0.6008430787465541,
      "learning_rate": 3.5653486242253674e-05,
      "loss": 1.3674,
      "num_input_tokens_seen": 32077239680,
      "step": 40771
    },
    {
      "epoch": 4.32548270740505,
      "grad_norm": 0.6738762287989437,
      "learning_rate": 3.565285752939049e-05,
      "loss": 1.3957,
      "num_input_tokens_seen": 32078026416,
      "step": 40772
    },
    {
      "epoch": 4.325588796944621,
      "grad_norm": 0.5102027186288575,
      "learning_rate": 3.565222880829508e-05,
      "loss": 1.4051,
      "num_input_tokens_seen": 32078813120,
      "step": 40773
    },
    {
      "epoch": 4.325694886484193,
      "grad_norm": 0.600111936936635,
      "learning_rate": 3.565160007896795e-05,
      "loss": 1.3617,
      "num_input_tokens_seen": 32079599856,
      "step": 40774
    },
    {
      "epoch": 4.325800976023764,
      "grad_norm": 0.5008930345752209,
      "learning_rate": 3.5650971341409574e-05,
      "loss": 1.2208,
      "num_input_tokens_seen": 32080386752,
      "step": 40775
    },
    {
      "epoch": 4.325907065563335,
      "grad_norm": 0.46776919846257414,
      "learning_rate": 3.565034259562044e-05,
      "loss": 1.2376,
      "num_input_tokens_seen": 32081173536,
      "step": 40776
    },
    {
      "epoch": 4.326013155102907,
      "grad_norm": 0.5943187230573553,
      "learning_rate": 3.564971384160103e-05,
      "loss": 1.3348,
      "num_input_tokens_seen": 32081960288,
      "step": 40777
    },
    {
      "epoch": 4.326119244642478,
      "grad_norm": 0.5384742550081186,
      "learning_rate": 3.564908507935183e-05,
      "loss": 1.2836,
      "num_input_tokens_seen": 32082746992,
      "step": 40778
    },
    {
      "epoch": 4.32622533418205,
      "grad_norm": 0.5912947126699624,
      "learning_rate": 3.564845630887334e-05,
      "loss": 1.4074,
      "num_input_tokens_seen": 32083533776,
      "step": 40779
    },
    {
      "epoch": 4.326331423721621,
      "grad_norm": 0.43864199486885963,
      "learning_rate": 3.564782753016602e-05,
      "loss": 1.318,
      "num_input_tokens_seen": 32084320496,
      "step": 40780
    },
    {
      "epoch": 4.326437513261192,
      "grad_norm": 0.568858339636064,
      "learning_rate": 3.5647198743230396e-05,
      "loss": 1.2597,
      "num_input_tokens_seen": 32085107184,
      "step": 40781
    },
    {
      "epoch": 4.326543602800764,
      "grad_norm": 0.49720385187118166,
      "learning_rate": 3.56465699480669e-05,
      "loss": 1.2762,
      "num_input_tokens_seen": 32085893968,
      "step": 40782
    },
    {
      "epoch": 4.326649692340335,
      "grad_norm": 0.506495128763404,
      "learning_rate": 3.564594114467606e-05,
      "loss": 1.3483,
      "num_input_tokens_seen": 32086680672,
      "step": 40783
    },
    {
      "epoch": 4.326755781879907,
      "grad_norm": 0.5542860789664663,
      "learning_rate": 3.564531233305836e-05,
      "loss": 1.3777,
      "num_input_tokens_seen": 32087467456,
      "step": 40784
    },
    {
      "epoch": 4.326861871419478,
      "grad_norm": 0.5165941794461354,
      "learning_rate": 3.564468351321426e-05,
      "loss": 1.4174,
      "num_input_tokens_seen": 32088254288,
      "step": 40785
    },
    {
      "epoch": 4.326967960959049,
      "grad_norm": 0.5502487267427523,
      "learning_rate": 3.564405468514427e-05,
      "loss": 1.3763,
      "num_input_tokens_seen": 32089041104,
      "step": 40786
    },
    {
      "epoch": 4.327074050498621,
      "grad_norm": 0.5038738463517823,
      "learning_rate": 3.5643425848848864e-05,
      "loss": 1.194,
      "num_input_tokens_seen": 32089827968,
      "step": 40787
    },
    {
      "epoch": 4.327180140038192,
      "grad_norm": 0.48736908356906433,
      "learning_rate": 3.5642797004328523e-05,
      "loss": 1.3478,
      "num_input_tokens_seen": 32090614800,
      "step": 40788
    },
    {
      "epoch": 4.327286229577764,
      "grad_norm": 0.5170549741288651,
      "learning_rate": 3.564216815158376e-05,
      "loss": 1.3335,
      "num_input_tokens_seen": 32091401584,
      "step": 40789
    },
    {
      "epoch": 4.327392319117335,
      "grad_norm": 0.5292282077321515,
      "learning_rate": 3.564153929061502e-05,
      "loss": 1.3779,
      "num_input_tokens_seen": 32092188384,
      "step": 40790
    },
    {
      "epoch": 4.327498408656907,
      "grad_norm": 0.5304946679319609,
      "learning_rate": 3.5640910421422825e-05,
      "loss": 1.4212,
      "num_input_tokens_seen": 32092975152,
      "step": 40791
    },
    {
      "epoch": 4.327604498196478,
      "grad_norm": 0.72119845134523,
      "learning_rate": 3.5640281544007635e-05,
      "loss": 1.3181,
      "num_input_tokens_seen": 32093761840,
      "step": 40792
    },
    {
      "epoch": 4.327710587736049,
      "grad_norm": 0.5319546990523337,
      "learning_rate": 3.563965265836996e-05,
      "loss": 1.3979,
      "num_input_tokens_seen": 32094548656,
      "step": 40793
    },
    {
      "epoch": 4.327816677275621,
      "grad_norm": 0.7182874522201813,
      "learning_rate": 3.563902376451026e-05,
      "loss": 1.3037,
      "num_input_tokens_seen": 32095335392,
      "step": 40794
    },
    {
      "epoch": 4.327922766815192,
      "grad_norm": 0.9607599076304101,
      "learning_rate": 3.563839486242905e-05,
      "loss": 1.4118,
      "num_input_tokens_seen": 32096122128,
      "step": 40795
    },
    {
      "epoch": 4.328028856354764,
      "grad_norm": 0.5310534849662979,
      "learning_rate": 3.563776595212679e-05,
      "loss": 1.2404,
      "num_input_tokens_seen": 32096908944,
      "step": 40796
    },
    {
      "epoch": 4.328134945894335,
      "grad_norm": 1.1659278554387142,
      "learning_rate": 3.563713703360398e-05,
      "loss": 1.2934,
      "num_input_tokens_seen": 32097695744,
      "step": 40797
    },
    {
      "epoch": 4.328241035433906,
      "grad_norm": 0.4727478503629058,
      "learning_rate": 3.56365081068611e-05,
      "loss": 1.2151,
      "num_input_tokens_seen": 32098482544,
      "step": 40798
    },
    {
      "epoch": 4.328347124973478,
      "grad_norm": 0.7836683612918928,
      "learning_rate": 3.5635879171898646e-05,
      "loss": 1.3911,
      "num_input_tokens_seen": 32099269344,
      "step": 40799
    },
    {
      "epoch": 4.328453214513049,
      "grad_norm": 0.6962075282780631,
      "learning_rate": 3.563525022871709e-05,
      "loss": 1.3483,
      "num_input_tokens_seen": 32100056144,
      "step": 40800
    },
    {
      "epoch": 4.328559304052621,
      "grad_norm": 0.5922685197290364,
      "learning_rate": 3.5634621277316923e-05,
      "loss": 1.3231,
      "num_input_tokens_seen": 32100842976,
      "step": 40801
    },
    {
      "epoch": 4.328665393592192,
      "grad_norm": 0.7090934721469934,
      "learning_rate": 3.5633992317698636e-05,
      "loss": 1.3463,
      "num_input_tokens_seen": 32101629632,
      "step": 40802
    },
    {
      "epoch": 4.328771483131764,
      "grad_norm": 0.49375904154448014,
      "learning_rate": 3.563336334986271e-05,
      "loss": 1.3707,
      "num_input_tokens_seen": 32102416416,
      "step": 40803
    },
    {
      "epoch": 4.328877572671335,
      "grad_norm": 0.6551230007057612,
      "learning_rate": 3.563273437380964e-05,
      "loss": 1.2822,
      "num_input_tokens_seen": 32103203168,
      "step": 40804
    },
    {
      "epoch": 4.328983662210906,
      "grad_norm": 0.5159857814950443,
      "learning_rate": 3.56321053895399e-05,
      "loss": 1.2657,
      "num_input_tokens_seen": 32103989984,
      "step": 40805
    },
    {
      "epoch": 4.329089751750478,
      "grad_norm": 0.5100098441968154,
      "learning_rate": 3.563147639705398e-05,
      "loss": 1.2868,
      "num_input_tokens_seen": 32104776832,
      "step": 40806
    },
    {
      "epoch": 4.329195841290049,
      "grad_norm": 0.46181354565103727,
      "learning_rate": 3.563084739635237e-05,
      "loss": 1.2732,
      "num_input_tokens_seen": 32105563616,
      "step": 40807
    },
    {
      "epoch": 4.329301930829621,
      "grad_norm": 0.5861428198697292,
      "learning_rate": 3.5630218387435546e-05,
      "loss": 1.2889,
      "num_input_tokens_seen": 32106350416,
      "step": 40808
    },
    {
      "epoch": 4.329408020369192,
      "grad_norm": 0.48594357401251126,
      "learning_rate": 3.5629589370304006e-05,
      "loss": 1.2057,
      "num_input_tokens_seen": 32107137232,
      "step": 40809
    },
    {
      "epoch": 4.329514109908763,
      "grad_norm": 0.528642324987699,
      "learning_rate": 3.562896034495823e-05,
      "loss": 1.3214,
      "num_input_tokens_seen": 32107924080,
      "step": 40810
    },
    {
      "epoch": 4.3296201994483345,
      "grad_norm": 0.5599782275265694,
      "learning_rate": 3.5628331311398704e-05,
      "loss": 1.3065,
      "num_input_tokens_seen": 32108710848,
      "step": 40811
    },
    {
      "epoch": 4.329726288987906,
      "grad_norm": 0.5359140335621573,
      "learning_rate": 3.5627702269625925e-05,
      "loss": 1.3247,
      "num_input_tokens_seen": 32109497632,
      "step": 40812
    },
    {
      "epoch": 4.3298323785274775,
      "grad_norm": 0.5052894812932238,
      "learning_rate": 3.562707321964036e-05,
      "loss": 1.2765,
      "num_input_tokens_seen": 32110284416,
      "step": 40813
    },
    {
      "epoch": 4.3299384680670485,
      "grad_norm": 0.5017468653071594,
      "learning_rate": 3.562644416144251e-05,
      "loss": 1.2843,
      "num_input_tokens_seen": 32111071168,
      "step": 40814
    },
    {
      "epoch": 4.3300445576066195,
      "grad_norm": 0.464023344857208,
      "learning_rate": 3.562581509503285e-05,
      "loss": 1.323,
      "num_input_tokens_seen": 32111857952,
      "step": 40815
    },
    {
      "epoch": 4.3301506471461915,
      "grad_norm": 0.5079933668056518,
      "learning_rate": 3.562518602041187e-05,
      "loss": 1.3628,
      "num_input_tokens_seen": 32112644624,
      "step": 40816
    },
    {
      "epoch": 4.3302567366857625,
      "grad_norm": 0.4615343547369408,
      "learning_rate": 3.562455693758007e-05,
      "loss": 1.2703,
      "num_input_tokens_seen": 32113431312,
      "step": 40817
    },
    {
      "epoch": 4.330362826225334,
      "grad_norm": 0.5080325627133512,
      "learning_rate": 3.562392784653791e-05,
      "loss": 1.3012,
      "num_input_tokens_seen": 32114218048,
      "step": 40818
    },
    {
      "epoch": 4.3304689157649054,
      "grad_norm": 0.5134168577221341,
      "learning_rate": 3.5623298747285896e-05,
      "loss": 1.3603,
      "num_input_tokens_seen": 32115004832,
      "step": 40819
    },
    {
      "epoch": 4.330575005304477,
      "grad_norm": 0.46076452504965854,
      "learning_rate": 3.562266963982451e-05,
      "loss": 1.3118,
      "num_input_tokens_seen": 32115791552,
      "step": 40820
    },
    {
      "epoch": 4.330681094844048,
      "grad_norm": 0.5076881485100257,
      "learning_rate": 3.5622040524154235e-05,
      "loss": 1.2896,
      "num_input_tokens_seen": 32116578304,
      "step": 40821
    },
    {
      "epoch": 4.330787184383619,
      "grad_norm": 0.5362075114414601,
      "learning_rate": 3.5621411400275564e-05,
      "loss": 1.4393,
      "num_input_tokens_seen": 32117365104,
      "step": 40822
    },
    {
      "epoch": 4.330893273923191,
      "grad_norm": 0.5405780833570242,
      "learning_rate": 3.562078226818897e-05,
      "loss": 1.3266,
      "num_input_tokens_seen": 32118151840,
      "step": 40823
    },
    {
      "epoch": 4.330999363462762,
      "grad_norm": 0.45394923933284315,
      "learning_rate": 3.562015312789495e-05,
      "loss": 1.1998,
      "num_input_tokens_seen": 32118938656,
      "step": 40824
    },
    {
      "epoch": 4.331105453002334,
      "grad_norm": 0.4975448554838517,
      "learning_rate": 3.561952397939399e-05,
      "loss": 1.3236,
      "num_input_tokens_seen": 32119725424,
      "step": 40825
    },
    {
      "epoch": 4.331211542541905,
      "grad_norm": 0.49715877391560437,
      "learning_rate": 3.561889482268657e-05,
      "loss": 1.2189,
      "num_input_tokens_seen": 32120512176,
      "step": 40826
    },
    {
      "epoch": 4.331317632081476,
      "grad_norm": 0.5724662911422301,
      "learning_rate": 3.561826565777319e-05,
      "loss": 1.3776,
      "num_input_tokens_seen": 32121298864,
      "step": 40827
    },
    {
      "epoch": 4.331423721621048,
      "grad_norm": 0.5283025506532465,
      "learning_rate": 3.561763648465431e-05,
      "loss": 1.3142,
      "num_input_tokens_seen": 32122085648,
      "step": 40828
    },
    {
      "epoch": 4.331529811160619,
      "grad_norm": 0.6821998973276924,
      "learning_rate": 3.561700730333044e-05,
      "loss": 1.2952,
      "num_input_tokens_seen": 32122872368,
      "step": 40829
    },
    {
      "epoch": 4.331635900700191,
      "grad_norm": 0.6023977514102179,
      "learning_rate": 3.5616378113802054e-05,
      "loss": 1.3347,
      "num_input_tokens_seen": 32123659216,
      "step": 40830
    },
    {
      "epoch": 4.331741990239762,
      "grad_norm": 0.5913611512496851,
      "learning_rate": 3.5615748916069646e-05,
      "loss": 1.1883,
      "num_input_tokens_seen": 32124446064,
      "step": 40831
    },
    {
      "epoch": 4.331848079779334,
      "grad_norm": 0.4959888688392121,
      "learning_rate": 3.56151197101337e-05,
      "loss": 1.1959,
      "num_input_tokens_seen": 32125232864,
      "step": 40832
    },
    {
      "epoch": 4.331954169318905,
      "grad_norm": 0.6471007503293252,
      "learning_rate": 3.56144904959947e-05,
      "loss": 1.3161,
      "num_input_tokens_seen": 32126019664,
      "step": 40833
    },
    {
      "epoch": 4.332060258858476,
      "grad_norm": 0.5178537773931607,
      "learning_rate": 3.561386127365313e-05,
      "loss": 1.3033,
      "num_input_tokens_seen": 32126806368,
      "step": 40834
    },
    {
      "epoch": 4.332166348398048,
      "grad_norm": 0.4989187120242678,
      "learning_rate": 3.5613232043109485e-05,
      "loss": 1.3597,
      "num_input_tokens_seen": 32127593152,
      "step": 40835
    },
    {
      "epoch": 4.332272437937619,
      "grad_norm": 0.5150512919946166,
      "learning_rate": 3.561260280436425e-05,
      "loss": 1.3139,
      "num_input_tokens_seen": 32128379920,
      "step": 40836
    },
    {
      "epoch": 4.332378527477191,
      "grad_norm": 0.5098130634413409,
      "learning_rate": 3.5611973557417885e-05,
      "loss": 1.4127,
      "num_input_tokens_seen": 32129166688,
      "step": 40837
    },
    {
      "epoch": 4.332484617016762,
      "grad_norm": 0.4672950982786816,
      "learning_rate": 3.561134430227092e-05,
      "loss": 1.3174,
      "num_input_tokens_seen": 32129953504,
      "step": 40838
    },
    {
      "epoch": 4.332590706556333,
      "grad_norm": 0.6407805183809031,
      "learning_rate": 3.5610715038923816e-05,
      "loss": 1.2913,
      "num_input_tokens_seen": 32130740288,
      "step": 40839
    },
    {
      "epoch": 4.332696796095905,
      "grad_norm": 0.6100136619452231,
      "learning_rate": 3.5610085767377046e-05,
      "loss": 1.3672,
      "num_input_tokens_seen": 32131527072,
      "step": 40840
    },
    {
      "epoch": 4.332802885635476,
      "grad_norm": 0.4742115482914285,
      "learning_rate": 3.560945648763113e-05,
      "loss": 1.3482,
      "num_input_tokens_seen": 32132313856,
      "step": 40841
    },
    {
      "epoch": 4.332908975175048,
      "grad_norm": 0.5796782832104156,
      "learning_rate": 3.560882719968653e-05,
      "loss": 1.3332,
      "num_input_tokens_seen": 32133100624,
      "step": 40842
    },
    {
      "epoch": 4.333015064714619,
      "grad_norm": 0.5749733998006823,
      "learning_rate": 3.560819790354375e-05,
      "loss": 1.3819,
      "num_input_tokens_seen": 32133887376,
      "step": 40843
    },
    {
      "epoch": 4.33312115425419,
      "grad_norm": 0.6269871213512804,
      "learning_rate": 3.560756859920326e-05,
      "loss": 1.3672,
      "num_input_tokens_seen": 32134674096,
      "step": 40844
    },
    {
      "epoch": 4.333227243793762,
      "grad_norm": 0.7464196045665508,
      "learning_rate": 3.5606939286665554e-05,
      "loss": 1.4336,
      "num_input_tokens_seen": 32135460896,
      "step": 40845
    },
    {
      "epoch": 4.333333333333333,
      "grad_norm": 0.7698469146545857,
      "learning_rate": 3.560630996593111e-05,
      "loss": 1.3419,
      "num_input_tokens_seen": 32136247696,
      "step": 40846
    },
    {
      "epoch": 4.333439422872905,
      "grad_norm": 0.7277534730136926,
      "learning_rate": 3.5605680637000424e-05,
      "loss": 1.2731,
      "num_input_tokens_seen": 32137034448,
      "step": 40847
    },
    {
      "epoch": 4.333545512412476,
      "grad_norm": 0.7800877291064304,
      "learning_rate": 3.560505129987398e-05,
      "loss": 1.2774,
      "num_input_tokens_seen": 32137821264,
      "step": 40848
    },
    {
      "epoch": 4.333651601952048,
      "grad_norm": 0.486706715819478,
      "learning_rate": 3.560442195455226e-05,
      "loss": 1.2078,
      "num_input_tokens_seen": 32138607968,
      "step": 40849
    },
    {
      "epoch": 4.333757691491619,
      "grad_norm": 0.7153397454765151,
      "learning_rate": 3.560379260103576e-05,
      "loss": 1.2646,
      "num_input_tokens_seen": 32139394752,
      "step": 40850
    },
    {
      "epoch": 4.33386378103119,
      "grad_norm": 0.4752163210888616,
      "learning_rate": 3.560316323932496e-05,
      "loss": 1.2338,
      "num_input_tokens_seen": 32140181472,
      "step": 40851
    },
    {
      "epoch": 4.333969870570762,
      "grad_norm": 0.46878752601474,
      "learning_rate": 3.560253386942034e-05,
      "loss": 1.2631,
      "num_input_tokens_seen": 32140968288,
      "step": 40852
    },
    {
      "epoch": 4.334075960110333,
      "grad_norm": 0.47888475765369776,
      "learning_rate": 3.56019044913224e-05,
      "loss": 1.291,
      "num_input_tokens_seen": 32141754896,
      "step": 40853
    },
    {
      "epoch": 4.334182049649905,
      "grad_norm": 0.6749692044175056,
      "learning_rate": 3.560127510503161e-05,
      "loss": 1.3364,
      "num_input_tokens_seen": 32142541568,
      "step": 40854
    },
    {
      "epoch": 4.334288139189476,
      "grad_norm": 0.53544759317831,
      "learning_rate": 3.560064571054848e-05,
      "loss": 1.3079,
      "num_input_tokens_seen": 32143328304,
      "step": 40855
    },
    {
      "epoch": 4.334394228729048,
      "grad_norm": 0.6174451650303376,
      "learning_rate": 3.560001630787347e-05,
      "loss": 1.2837,
      "num_input_tokens_seen": 32144115136,
      "step": 40856
    },
    {
      "epoch": 4.334500318268619,
      "grad_norm": 0.6316724653160747,
      "learning_rate": 3.559938689700708e-05,
      "loss": 1.2951,
      "num_input_tokens_seen": 32144901856,
      "step": 40857
    },
    {
      "epoch": 4.33460640780819,
      "grad_norm": 0.5388921173187179,
      "learning_rate": 3.5598757477949804e-05,
      "loss": 1.3333,
      "num_input_tokens_seen": 32145688608,
      "step": 40858
    },
    {
      "epoch": 4.334712497347762,
      "grad_norm": 0.5561990121793727,
      "learning_rate": 3.559812805070211e-05,
      "loss": 1.2541,
      "num_input_tokens_seen": 32146475280,
      "step": 40859
    },
    {
      "epoch": 4.334818586887333,
      "grad_norm": 0.5397591764786722,
      "learning_rate": 3.559749861526449e-05,
      "loss": 1.3064,
      "num_input_tokens_seen": 32147262112,
      "step": 40860
    },
    {
      "epoch": 4.334924676426905,
      "grad_norm": 0.4855006368565438,
      "learning_rate": 3.559686917163745e-05,
      "loss": 1.338,
      "num_input_tokens_seen": 32148048912,
      "step": 40861
    },
    {
      "epoch": 4.335030765966476,
      "grad_norm": 0.5057550088488756,
      "learning_rate": 3.559623971982144e-05,
      "loss": 1.2499,
      "num_input_tokens_seen": 32148835600,
      "step": 40862
    },
    {
      "epoch": 4.335136855506047,
      "grad_norm": 0.5469475938653959,
      "learning_rate": 3.559561025981698e-05,
      "loss": 1.2576,
      "num_input_tokens_seen": 32149622304,
      "step": 40863
    },
    {
      "epoch": 4.335242945045619,
      "grad_norm": 0.5230446350495881,
      "learning_rate": 3.5594980791624544e-05,
      "loss": 1.2248,
      "num_input_tokens_seen": 32150408992,
      "step": 40864
    },
    {
      "epoch": 4.33534903458519,
      "grad_norm": 0.5415310115261837,
      "learning_rate": 3.5594351315244614e-05,
      "loss": 1.2081,
      "num_input_tokens_seen": 32151195696,
      "step": 40865
    },
    {
      "epoch": 4.335455124124762,
      "grad_norm": 0.4638318211507631,
      "learning_rate": 3.559372183067768e-05,
      "loss": 1.2279,
      "num_input_tokens_seen": 32151982448,
      "step": 40866
    },
    {
      "epoch": 4.335561213664333,
      "grad_norm": 0.47154338389237244,
      "learning_rate": 3.559309233792423e-05,
      "loss": 1.3083,
      "num_input_tokens_seen": 32152769152,
      "step": 40867
    },
    {
      "epoch": 4.335667303203904,
      "grad_norm": 0.48181553371730723,
      "learning_rate": 3.559246283698475e-05,
      "loss": 1.2298,
      "num_input_tokens_seen": 32153555952,
      "step": 40868
    },
    {
      "epoch": 4.335773392743476,
      "grad_norm": 0.5152431354529995,
      "learning_rate": 3.559183332785972e-05,
      "loss": 1.2616,
      "num_input_tokens_seen": 32154342608,
      "step": 40869
    },
    {
      "epoch": 4.335879482283047,
      "grad_norm": 0.4908553501477028,
      "learning_rate": 3.559120381054963e-05,
      "loss": 1.2876,
      "num_input_tokens_seen": 32155129424,
      "step": 40870
    },
    {
      "epoch": 4.335985571822619,
      "grad_norm": 0.5674327156907353,
      "learning_rate": 3.559057428505498e-05,
      "loss": 1.4041,
      "num_input_tokens_seen": 32155916112,
      "step": 40871
    },
    {
      "epoch": 4.33609166136219,
      "grad_norm": 0.5209057765687792,
      "learning_rate": 3.558994475137624e-05,
      "loss": 1.4011,
      "num_input_tokens_seen": 32156702816,
      "step": 40872
    },
    {
      "epoch": 4.336197750901761,
      "grad_norm": 0.5726824812672976,
      "learning_rate": 3.55893152095139e-05,
      "loss": 1.3547,
      "num_input_tokens_seen": 32157489600,
      "step": 40873
    },
    {
      "epoch": 4.3363038404413325,
      "grad_norm": 0.4912002267651784,
      "learning_rate": 3.5588685659468444e-05,
      "loss": 1.3328,
      "num_input_tokens_seen": 32158276400,
      "step": 40874
    },
    {
      "epoch": 4.336409929980904,
      "grad_norm": 0.5786852936448967,
      "learning_rate": 3.558805610124037e-05,
      "loss": 1.2552,
      "num_input_tokens_seen": 32159063216,
      "step": 40875
    },
    {
      "epoch": 4.3365160195204755,
      "grad_norm": 0.6078067437520782,
      "learning_rate": 3.558742653483016e-05,
      "loss": 1.3618,
      "num_input_tokens_seen": 32159850048,
      "step": 40876
    },
    {
      "epoch": 4.3366221090600465,
      "grad_norm": 0.5774613063194681,
      "learning_rate": 3.558679696023828e-05,
      "loss": 1.3498,
      "num_input_tokens_seen": 32160636752,
      "step": 40877
    },
    {
      "epoch": 4.3367281985996184,
      "grad_norm": 0.5145214176575408,
      "learning_rate": 3.558616737746525e-05,
      "loss": 1.2524,
      "num_input_tokens_seen": 32161423568,
      "step": 40878
    },
    {
      "epoch": 4.3368342881391895,
      "grad_norm": 0.5127350690511597,
      "learning_rate": 3.5585537786511536e-05,
      "loss": 1.3718,
      "num_input_tokens_seen": 32162210352,
      "step": 40879
    },
    {
      "epoch": 4.3369403776787605,
      "grad_norm": 0.5691068165345774,
      "learning_rate": 3.558490818737763e-05,
      "loss": 1.3368,
      "num_input_tokens_seen": 32162997088,
      "step": 40880
    },
    {
      "epoch": 4.337046467218332,
      "grad_norm": 0.4893930202330083,
      "learning_rate": 3.558427858006401e-05,
      "loss": 1.2968,
      "num_input_tokens_seen": 32163783856,
      "step": 40881
    },
    {
      "epoch": 4.3371525567579035,
      "grad_norm": 0.5389003147994761,
      "learning_rate": 3.5583648964571183e-05,
      "loss": 1.3405,
      "num_input_tokens_seen": 32164570560,
      "step": 40882
    },
    {
      "epoch": 4.337258646297475,
      "grad_norm": 0.5942173794838463,
      "learning_rate": 3.558301934089962e-05,
      "loss": 1.2944,
      "num_input_tokens_seen": 32165357344,
      "step": 40883
    },
    {
      "epoch": 4.337364735837046,
      "grad_norm": 0.4653193038810575,
      "learning_rate": 3.55823897090498e-05,
      "loss": 1.3988,
      "num_input_tokens_seen": 32166143984,
      "step": 40884
    },
    {
      "epoch": 4.337470825376618,
      "grad_norm": 0.4988874704892552,
      "learning_rate": 3.5581760069022224e-05,
      "loss": 1.3166,
      "num_input_tokens_seen": 32166930736,
      "step": 40885
    },
    {
      "epoch": 4.337576914916189,
      "grad_norm": 0.5579319511341931,
      "learning_rate": 3.558113042081738e-05,
      "loss": 1.2689,
      "num_input_tokens_seen": 32167717520,
      "step": 40886
    },
    {
      "epoch": 4.33768300445576,
      "grad_norm": 0.5251509999928647,
      "learning_rate": 3.5580500764435745e-05,
      "loss": 1.2399,
      "num_input_tokens_seen": 32168504192,
      "step": 40887
    },
    {
      "epoch": 4.337789093995332,
      "grad_norm": 0.5126339742276137,
      "learning_rate": 3.5579871099877804e-05,
      "loss": 1.2294,
      "num_input_tokens_seen": 32169290928,
      "step": 40888
    },
    {
      "epoch": 4.337895183534903,
      "grad_norm": 0.6731872365353777,
      "learning_rate": 3.557924142714405e-05,
      "loss": 1.3577,
      "num_input_tokens_seen": 32170077696,
      "step": 40889
    },
    {
      "epoch": 4.338001273074475,
      "grad_norm": 0.6364250537988905,
      "learning_rate": 3.557861174623498e-05,
      "loss": 1.3946,
      "num_input_tokens_seen": 32170864432,
      "step": 40890
    },
    {
      "epoch": 4.338107362614046,
      "grad_norm": 0.4915932594100699,
      "learning_rate": 3.557798205715106e-05,
      "loss": 1.2272,
      "num_input_tokens_seen": 32171651152,
      "step": 40891
    },
    {
      "epoch": 4.338213452153617,
      "grad_norm": 0.586025638203458,
      "learning_rate": 3.5577352359892784e-05,
      "loss": 1.3072,
      "num_input_tokens_seen": 32172437968,
      "step": 40892
    },
    {
      "epoch": 4.338319541693189,
      "grad_norm": 0.5249226052804156,
      "learning_rate": 3.5576722654460645e-05,
      "loss": 1.3683,
      "num_input_tokens_seen": 32173224816,
      "step": 40893
    },
    {
      "epoch": 4.33842563123276,
      "grad_norm": 0.5154255576569614,
      "learning_rate": 3.557609294085513e-05,
      "loss": 1.3105,
      "num_input_tokens_seen": 32174011584,
      "step": 40894
    },
    {
      "epoch": 4.338531720772332,
      "grad_norm": 0.5488703552802141,
      "learning_rate": 3.557546321907671e-05,
      "loss": 1.2713,
      "num_input_tokens_seen": 32174798368,
      "step": 40895
    },
    {
      "epoch": 4.338637810311903,
      "grad_norm": 0.5759692943379365,
      "learning_rate": 3.557483348912589e-05,
      "loss": 1.3622,
      "num_input_tokens_seen": 32175585168,
      "step": 40896
    },
    {
      "epoch": 4.338743899851474,
      "grad_norm": 0.5080239233709277,
      "learning_rate": 3.5574203751003145e-05,
      "loss": 1.2694,
      "num_input_tokens_seen": 32176371984,
      "step": 40897
    },
    {
      "epoch": 4.338849989391046,
      "grad_norm": 0.5773054778049809,
      "learning_rate": 3.5573574004708964e-05,
      "loss": 1.3459,
      "num_input_tokens_seen": 32177158752,
      "step": 40898
    },
    {
      "epoch": 4.338956078930617,
      "grad_norm": 0.6105670651690983,
      "learning_rate": 3.557294425024384e-05,
      "loss": 1.3413,
      "num_input_tokens_seen": 32177945520,
      "step": 40899
    },
    {
      "epoch": 4.339062168470189,
      "grad_norm": 0.5271146137824103,
      "learning_rate": 3.5572314487608255e-05,
      "loss": 1.3245,
      "num_input_tokens_seen": 32178732368,
      "step": 40900
    },
    {
      "epoch": 4.33916825800976,
      "grad_norm": 0.5432263458035356,
      "learning_rate": 3.5571684716802695e-05,
      "loss": 1.2916,
      "num_input_tokens_seen": 32179519120,
      "step": 40901
    },
    {
      "epoch": 4.339274347549331,
      "grad_norm": 0.4735592972947348,
      "learning_rate": 3.5571054937827645e-05,
      "loss": 1.2851,
      "num_input_tokens_seen": 32180305840,
      "step": 40902
    },
    {
      "epoch": 4.339380437088903,
      "grad_norm": 0.5352078302466781,
      "learning_rate": 3.557042515068359e-05,
      "loss": 1.3181,
      "num_input_tokens_seen": 32181092640,
      "step": 40903
    },
    {
      "epoch": 4.339486526628474,
      "grad_norm": 0.5520830565910221,
      "learning_rate": 3.556979535537103e-05,
      "loss": 1.3615,
      "num_input_tokens_seen": 32181879408,
      "step": 40904
    },
    {
      "epoch": 4.339592616168046,
      "grad_norm": 0.5912947002935328,
      "learning_rate": 3.5569165551890445e-05,
      "loss": 1.3809,
      "num_input_tokens_seen": 32182666128,
      "step": 40905
    },
    {
      "epoch": 4.339698705707617,
      "grad_norm": 0.4910429881833587,
      "learning_rate": 3.5568535740242305e-05,
      "loss": 1.3041,
      "num_input_tokens_seen": 32183452880,
      "step": 40906
    },
    {
      "epoch": 4.339804795247189,
      "grad_norm": 0.6000238620037861,
      "learning_rate": 3.556790592042712e-05,
      "loss": 1.2527,
      "num_input_tokens_seen": 32184239536,
      "step": 40907
    },
    {
      "epoch": 4.33991088478676,
      "grad_norm": 0.5006589706182463,
      "learning_rate": 3.556727609244537e-05,
      "loss": 1.2374,
      "num_input_tokens_seen": 32185026320,
      "step": 40908
    },
    {
      "epoch": 4.340016974326331,
      "grad_norm": 0.5786588385413745,
      "learning_rate": 3.556664625629753e-05,
      "loss": 1.3112,
      "num_input_tokens_seen": 32185813072,
      "step": 40909
    },
    {
      "epoch": 4.340123063865903,
      "grad_norm": 0.5446387067694212,
      "learning_rate": 3.55660164119841e-05,
      "loss": 1.3705,
      "num_input_tokens_seen": 32186599776,
      "step": 40910
    },
    {
      "epoch": 4.340229153405474,
      "grad_norm": 0.5863412432582182,
      "learning_rate": 3.5565386559505565e-05,
      "loss": 1.2669,
      "num_input_tokens_seen": 32187386512,
      "step": 40911
    },
    {
      "epoch": 4.340335242945046,
      "grad_norm": 0.6323008597132738,
      "learning_rate": 3.55647566988624e-05,
      "loss": 1.4268,
      "num_input_tokens_seen": 32188173296,
      "step": 40912
    },
    {
      "epoch": 4.340441332484617,
      "grad_norm": 0.4828172742225555,
      "learning_rate": 3.556412683005511e-05,
      "loss": 1.2535,
      "num_input_tokens_seen": 32188960128,
      "step": 40913
    },
    {
      "epoch": 4.340547422024189,
      "grad_norm": 0.6441090800098229,
      "learning_rate": 3.556349695308417e-05,
      "loss": 1.2797,
      "num_input_tokens_seen": 32189746976,
      "step": 40914
    },
    {
      "epoch": 4.34065351156376,
      "grad_norm": 0.5275478577120706,
      "learning_rate": 3.5562867067950075e-05,
      "loss": 1.4058,
      "num_input_tokens_seen": 32190533824,
      "step": 40915
    },
    {
      "epoch": 4.340759601103331,
      "grad_norm": 0.5359511710852375,
      "learning_rate": 3.55622371746533e-05,
      "loss": 1.3493,
      "num_input_tokens_seen": 32191320640,
      "step": 40916
    },
    {
      "epoch": 4.340865690642903,
      "grad_norm": 0.4679248348838209,
      "learning_rate": 3.556160727319434e-05,
      "loss": 1.2619,
      "num_input_tokens_seen": 32192107360,
      "step": 40917
    },
    {
      "epoch": 4.340971780182474,
      "grad_norm": 0.5164835417717789,
      "learning_rate": 3.556097736357368e-05,
      "loss": 1.3193,
      "num_input_tokens_seen": 32192894080,
      "step": 40918
    },
    {
      "epoch": 4.341077869722046,
      "grad_norm": 0.6689374968595501,
      "learning_rate": 3.55603474457918e-05,
      "loss": 1.3813,
      "num_input_tokens_seen": 32193680832,
      "step": 40919
    },
    {
      "epoch": 4.341183959261617,
      "grad_norm": 0.6836519259101446,
      "learning_rate": 3.55597175198492e-05,
      "loss": 1.3143,
      "num_input_tokens_seen": 32194467552,
      "step": 40920
    },
    {
      "epoch": 4.341290048801188,
      "grad_norm": 0.8619373093162005,
      "learning_rate": 3.5559087585746364e-05,
      "loss": 1.3718,
      "num_input_tokens_seen": 32195254320,
      "step": 40921
    },
    {
      "epoch": 4.34139613834076,
      "grad_norm": 0.6507603018700874,
      "learning_rate": 3.5558457643483765e-05,
      "loss": 1.472,
      "num_input_tokens_seen": 32196041152,
      "step": 40922
    },
    {
      "epoch": 4.341502227880331,
      "grad_norm": 0.5921193621958224,
      "learning_rate": 3.555782769306191e-05,
      "loss": 1.1781,
      "num_input_tokens_seen": 32196827984,
      "step": 40923
    },
    {
      "epoch": 4.341608317419903,
      "grad_norm": 0.7981741174145082,
      "learning_rate": 3.555719773448127e-05,
      "loss": 1.3244,
      "num_input_tokens_seen": 32197614736,
      "step": 40924
    },
    {
      "epoch": 4.341714406959474,
      "grad_norm": 0.6288708304262746,
      "learning_rate": 3.5556567767742336e-05,
      "loss": 1.2912,
      "num_input_tokens_seen": 32198401504,
      "step": 40925
    },
    {
      "epoch": 4.341820496499045,
      "grad_norm": 0.8432061689725227,
      "learning_rate": 3.55559377928456e-05,
      "loss": 1.4518,
      "num_input_tokens_seen": 32199188208,
      "step": 40926
    },
    {
      "epoch": 4.341926586038617,
      "grad_norm": 0.583730030007161,
      "learning_rate": 3.555530780979154e-05,
      "loss": 1.3936,
      "num_input_tokens_seen": 32199974960,
      "step": 40927
    },
    {
      "epoch": 4.342032675578188,
      "grad_norm": 0.6000519052587747,
      "learning_rate": 3.5554677818580654e-05,
      "loss": 1.3935,
      "num_input_tokens_seen": 32200761680,
      "step": 40928
    },
    {
      "epoch": 4.34213876511776,
      "grad_norm": 0.9040866414477606,
      "learning_rate": 3.555404781921342e-05,
      "loss": 1.3393,
      "num_input_tokens_seen": 32201548384,
      "step": 40929
    },
    {
      "epoch": 4.342244854657331,
      "grad_norm": 0.6236414607553097,
      "learning_rate": 3.5553417811690325e-05,
      "loss": 1.2513,
      "num_input_tokens_seen": 32202335136,
      "step": 40930
    },
    {
      "epoch": 4.342350944196903,
      "grad_norm": 0.8986449755620718,
      "learning_rate": 3.555278779601186e-05,
      "loss": 1.3183,
      "num_input_tokens_seen": 32203121904,
      "step": 40931
    },
    {
      "epoch": 4.342457033736474,
      "grad_norm": 0.6303664517082379,
      "learning_rate": 3.555215777217851e-05,
      "loss": 1.3766,
      "num_input_tokens_seen": 32203908624,
      "step": 40932
    },
    {
      "epoch": 4.342563123276045,
      "grad_norm": 0.6274371350190314,
      "learning_rate": 3.5551527740190767e-05,
      "loss": 1.3288,
      "num_input_tokens_seen": 32204695408,
      "step": 40933
    },
    {
      "epoch": 4.342669212815617,
      "grad_norm": 0.7941905496437562,
      "learning_rate": 3.55508977000491e-05,
      "loss": 1.3557,
      "num_input_tokens_seen": 32205482160,
      "step": 40934
    },
    {
      "epoch": 4.342775302355188,
      "grad_norm": 0.5749424199142321,
      "learning_rate": 3.5550267651754015e-05,
      "loss": 1.384,
      "num_input_tokens_seen": 32206268880,
      "step": 40935
    },
    {
      "epoch": 4.3428813918947595,
      "grad_norm": 0.7483121200575535,
      "learning_rate": 3.5549637595305994e-05,
      "loss": 1.3389,
      "num_input_tokens_seen": 32207055600,
      "step": 40936
    },
    {
      "epoch": 4.3429874814343306,
      "grad_norm": 0.482609079200701,
      "learning_rate": 3.554900753070553e-05,
      "loss": 1.3298,
      "num_input_tokens_seen": 32207842240,
      "step": 40937
    },
    {
      "epoch": 4.343093570973902,
      "grad_norm": 0.5356129434795671,
      "learning_rate": 3.554837745795309e-05,
      "loss": 1.2892,
      "num_input_tokens_seen": 32208629072,
      "step": 40938
    },
    {
      "epoch": 4.3431996605134735,
      "grad_norm": 0.612944869484172,
      "learning_rate": 3.554774737704918e-05,
      "loss": 1.3773,
      "num_input_tokens_seen": 32209415952,
      "step": 40939
    },
    {
      "epoch": 4.3433057500530445,
      "grad_norm": 0.5370645379762586,
      "learning_rate": 3.554711728799428e-05,
      "loss": 1.2102,
      "num_input_tokens_seen": 32210202752,
      "step": 40940
    },
    {
      "epoch": 4.3434118395926165,
      "grad_norm": 0.7656367388467511,
      "learning_rate": 3.554648719078888e-05,
      "loss": 1.1811,
      "num_input_tokens_seen": 32210989520,
      "step": 40941
    },
    {
      "epoch": 4.3435179291321875,
      "grad_norm": 0.9030212371390418,
      "learning_rate": 3.554585708543347e-05,
      "loss": 1.3793,
      "num_input_tokens_seen": 32211776288,
      "step": 40942
    },
    {
      "epoch": 4.343624018671759,
      "grad_norm": 0.5621200297204941,
      "learning_rate": 3.5545226971928515e-05,
      "loss": 1.3524,
      "num_input_tokens_seen": 32212563104,
      "step": 40943
    },
    {
      "epoch": 4.34373010821133,
      "grad_norm": 1.133501238058734,
      "learning_rate": 3.554459685027452e-05,
      "loss": 1.268,
      "num_input_tokens_seen": 32213349888,
      "step": 40944
    },
    {
      "epoch": 4.3438361977509015,
      "grad_norm": 0.5192346988592089,
      "learning_rate": 3.5543966720471985e-05,
      "loss": 1.3761,
      "num_input_tokens_seen": 32214136560,
      "step": 40945
    },
    {
      "epoch": 4.343942287290473,
      "grad_norm": 0.7101362019837035,
      "learning_rate": 3.554333658252137e-05,
      "loss": 1.3961,
      "num_input_tokens_seen": 32214923360,
      "step": 40946
    },
    {
      "epoch": 4.344048376830044,
      "grad_norm": 0.8319976315558278,
      "learning_rate": 3.554270643642317e-05,
      "loss": 1.3818,
      "num_input_tokens_seen": 32215710064,
      "step": 40947
    },
    {
      "epoch": 4.344154466369616,
      "grad_norm": 0.5284165859406824,
      "learning_rate": 3.554207628217789e-05,
      "loss": 1.2942,
      "num_input_tokens_seen": 32216496928,
      "step": 40948
    },
    {
      "epoch": 4.344260555909187,
      "grad_norm": 0.6843331183355126,
      "learning_rate": 3.5541446119785994e-05,
      "loss": 1.289,
      "num_input_tokens_seen": 32217283536,
      "step": 40949
    },
    {
      "epoch": 4.344366645448758,
      "grad_norm": 0.5707017170947254,
      "learning_rate": 3.5540815949247975e-05,
      "loss": 1.3194,
      "num_input_tokens_seen": 32218070352,
      "step": 40950
    },
    {
      "epoch": 4.34447273498833,
      "grad_norm": 0.6312244718482005,
      "learning_rate": 3.5540185770564325e-05,
      "loss": 1.2849,
      "num_input_tokens_seen": 32218857200,
      "step": 40951
    },
    {
      "epoch": 4.344578824527901,
      "grad_norm": 0.5784280691265683,
      "learning_rate": 3.553955558373553e-05,
      "loss": 1.2795,
      "num_input_tokens_seen": 32219643968,
      "step": 40952
    },
    {
      "epoch": 4.344684914067473,
      "grad_norm": 0.5153535386947637,
      "learning_rate": 3.5538925388762076e-05,
      "loss": 1.3335,
      "num_input_tokens_seen": 32220430736,
      "step": 40953
    },
    {
      "epoch": 4.344791003607044,
      "grad_norm": 0.6180188904352603,
      "learning_rate": 3.553829518564445e-05,
      "loss": 1.316,
      "num_input_tokens_seen": 32221217504,
      "step": 40954
    },
    {
      "epoch": 4.344897093146615,
      "grad_norm": 0.6453133586042921,
      "learning_rate": 3.5537664974383136e-05,
      "loss": 1.3643,
      "num_input_tokens_seen": 32222004336,
      "step": 40955
    },
    {
      "epoch": 4.345003182686187,
      "grad_norm": 0.7202024717396205,
      "learning_rate": 3.5537034754978635e-05,
      "loss": 1.2925,
      "num_input_tokens_seen": 32222791008,
      "step": 40956
    },
    {
      "epoch": 4.345109272225758,
      "grad_norm": 0.549185456098797,
      "learning_rate": 3.55364045274314e-05,
      "loss": 1.3002,
      "num_input_tokens_seen": 32223577776,
      "step": 40957
    },
    {
      "epoch": 4.34521536176533,
      "grad_norm": 0.6489962362923445,
      "learning_rate": 3.553577429174196e-05,
      "loss": 1.3532,
      "num_input_tokens_seen": 32224364544,
      "step": 40958
    },
    {
      "epoch": 4.345321451304901,
      "grad_norm": 0.6137817441078123,
      "learning_rate": 3.553514404791078e-05,
      "loss": 1.3467,
      "num_input_tokens_seen": 32225151440,
      "step": 40959
    },
    {
      "epoch": 4.345427540844473,
      "grad_norm": 0.6368532470566097,
      "learning_rate": 3.553451379593834e-05,
      "loss": 1.3148,
      "num_input_tokens_seen": 32225938160,
      "step": 40960
    },
    {
      "epoch": 4.345533630384044,
      "grad_norm": 0.5703149034533762,
      "learning_rate": 3.553388353582515e-05,
      "loss": 1.3354,
      "num_input_tokens_seen": 32226724832,
      "step": 40961
    },
    {
      "epoch": 4.345639719923615,
      "grad_norm": 0.5618383735827616,
      "learning_rate": 3.5533253267571676e-05,
      "loss": 1.2646,
      "num_input_tokens_seen": 32227511600,
      "step": 40962
    },
    {
      "epoch": 4.345745809463187,
      "grad_norm": 0.5601613090994826,
      "learning_rate": 3.553262299117841e-05,
      "loss": 1.3233,
      "num_input_tokens_seen": 32228298432,
      "step": 40963
    },
    {
      "epoch": 4.345851899002758,
      "grad_norm": 0.505763887098873,
      "learning_rate": 3.553199270664585e-05,
      "loss": 1.2398,
      "num_input_tokens_seen": 32229085120,
      "step": 40964
    },
    {
      "epoch": 4.34595798854233,
      "grad_norm": 0.7581038274004201,
      "learning_rate": 3.553136241397448e-05,
      "loss": 1.2949,
      "num_input_tokens_seen": 32229871984,
      "step": 40965
    },
    {
      "epoch": 4.346064078081901,
      "grad_norm": 0.5118251961188954,
      "learning_rate": 3.553073211316476e-05,
      "loss": 1.1646,
      "num_input_tokens_seen": 32230658688,
      "step": 40966
    },
    {
      "epoch": 4.346170167621472,
      "grad_norm": 0.7221035762393205,
      "learning_rate": 3.553010180421722e-05,
      "loss": 1.2796,
      "num_input_tokens_seen": 32231445456,
      "step": 40967
    },
    {
      "epoch": 4.346276257161044,
      "grad_norm": 0.4977443238951382,
      "learning_rate": 3.552947148713232e-05,
      "loss": 1.2238,
      "num_input_tokens_seen": 32232232224,
      "step": 40968
    },
    {
      "epoch": 4.346382346700615,
      "grad_norm": 0.5510284853316345,
      "learning_rate": 3.5528841161910554e-05,
      "loss": 1.3661,
      "num_input_tokens_seen": 32233018928,
      "step": 40969
    },
    {
      "epoch": 4.346488436240187,
      "grad_norm": 0.5261783878785363,
      "learning_rate": 3.5528210828552407e-05,
      "loss": 1.2644,
      "num_input_tokens_seen": 32233805696,
      "step": 40970
    },
    {
      "epoch": 4.346594525779758,
      "grad_norm": 0.5106299149457258,
      "learning_rate": 3.5527580487058365e-05,
      "loss": 1.2531,
      "num_input_tokens_seen": 32234592432,
      "step": 40971
    },
    {
      "epoch": 4.34670061531933,
      "grad_norm": 0.596767586335255,
      "learning_rate": 3.552695013742892e-05,
      "loss": 1.3157,
      "num_input_tokens_seen": 32235379280,
      "step": 40972
    },
    {
      "epoch": 4.346806704858901,
      "grad_norm": 0.6757689285279054,
      "learning_rate": 3.552631977966456e-05,
      "loss": 1.3558,
      "num_input_tokens_seen": 32236166080,
      "step": 40973
    },
    {
      "epoch": 4.346912794398472,
      "grad_norm": 0.5963792198049989,
      "learning_rate": 3.552568941376576e-05,
      "loss": 1.361,
      "num_input_tokens_seen": 32236952944,
      "step": 40974
    },
    {
      "epoch": 4.347018883938044,
      "grad_norm": 0.5089476359078491,
      "learning_rate": 3.552505903973302e-05,
      "loss": 1.2932,
      "num_input_tokens_seen": 32237739712,
      "step": 40975
    },
    {
      "epoch": 4.347124973477615,
      "grad_norm": 0.5966388864949621,
      "learning_rate": 3.5524428657566834e-05,
      "loss": 1.3393,
      "num_input_tokens_seen": 32238526528,
      "step": 40976
    },
    {
      "epoch": 4.347231063017187,
      "grad_norm": 0.49394251090264446,
      "learning_rate": 3.552379826726767e-05,
      "loss": 1.2353,
      "num_input_tokens_seen": 32239313264,
      "step": 40977
    },
    {
      "epoch": 4.347337152556758,
      "grad_norm": 0.5230967266821519,
      "learning_rate": 3.552316786883602e-05,
      "loss": 1.3751,
      "num_input_tokens_seen": 32240100176,
      "step": 40978
    },
    {
      "epoch": 4.347443242096329,
      "grad_norm": 0.5497811970442068,
      "learning_rate": 3.552253746227238e-05,
      "loss": 1.3247,
      "num_input_tokens_seen": 32240886992,
      "step": 40979
    },
    {
      "epoch": 4.347549331635901,
      "grad_norm": 0.6429424889572156,
      "learning_rate": 3.5521907047577226e-05,
      "loss": 1.3496,
      "num_input_tokens_seen": 32241673728,
      "step": 40980
    },
    {
      "epoch": 4.347655421175472,
      "grad_norm": 0.5551976009000722,
      "learning_rate": 3.5521276624751054e-05,
      "loss": 1.2861,
      "num_input_tokens_seen": 32242460592,
      "step": 40981
    },
    {
      "epoch": 4.347761510715044,
      "grad_norm": 0.6615412840103253,
      "learning_rate": 3.552064619379435e-05,
      "loss": 1.4016,
      "num_input_tokens_seen": 32243247376,
      "step": 40982
    },
    {
      "epoch": 4.347867600254615,
      "grad_norm": 0.5884553274069878,
      "learning_rate": 3.552001575470759e-05,
      "loss": 1.3427,
      "num_input_tokens_seen": 32244034144,
      "step": 40983
    },
    {
      "epoch": 4.347973689794186,
      "grad_norm": 0.7354697542426478,
      "learning_rate": 3.551938530749128e-05,
      "loss": 1.2958,
      "num_input_tokens_seen": 32244820928,
      "step": 40984
    },
    {
      "epoch": 4.348079779333758,
      "grad_norm": 0.6153147125242073,
      "learning_rate": 3.55187548521459e-05,
      "loss": 1.3034,
      "num_input_tokens_seen": 32245607632,
      "step": 40985
    },
    {
      "epoch": 4.348185868873329,
      "grad_norm": 0.4974676346249526,
      "learning_rate": 3.5518124388671924e-05,
      "loss": 1.2317,
      "num_input_tokens_seen": 32246394400,
      "step": 40986
    },
    {
      "epoch": 4.348291958412901,
      "grad_norm": 1.0482788222053818,
      "learning_rate": 3.551749391706986e-05,
      "loss": 1.3074,
      "num_input_tokens_seen": 32247181152,
      "step": 40987
    },
    {
      "epoch": 4.348398047952472,
      "grad_norm": 0.5430685223590979,
      "learning_rate": 3.5516863437340184e-05,
      "loss": 1.3181,
      "num_input_tokens_seen": 32247967936,
      "step": 40988
    },
    {
      "epoch": 4.348504137492044,
      "grad_norm": 0.6281577895013261,
      "learning_rate": 3.551623294948338e-05,
      "loss": 1.2339,
      "num_input_tokens_seen": 32248754656,
      "step": 40989
    },
    {
      "epoch": 4.348610227031615,
      "grad_norm": 0.6713890294676804,
      "learning_rate": 3.5515602453499944e-05,
      "loss": 1.255,
      "num_input_tokens_seen": 32249541440,
      "step": 40990
    },
    {
      "epoch": 4.348716316571186,
      "grad_norm": 0.5567074639956221,
      "learning_rate": 3.551497194939036e-05,
      "loss": 1.3742,
      "num_input_tokens_seen": 32250328176,
      "step": 40991
    },
    {
      "epoch": 4.348822406110758,
      "grad_norm": 0.7655734226212362,
      "learning_rate": 3.551434143715511e-05,
      "loss": 1.2966,
      "num_input_tokens_seen": 32251114976,
      "step": 40992
    },
    {
      "epoch": 4.348928495650329,
      "grad_norm": 0.6956750786715638,
      "learning_rate": 3.551371091679469e-05,
      "loss": 1.3439,
      "num_input_tokens_seen": 32251901696,
      "step": 40993
    },
    {
      "epoch": 4.349034585189901,
      "grad_norm": 0.5711141368598202,
      "learning_rate": 3.5513080388309586e-05,
      "loss": 1.2949,
      "num_input_tokens_seen": 32252688512,
      "step": 40994
    },
    {
      "epoch": 4.349140674729472,
      "grad_norm": 0.7861230949142006,
      "learning_rate": 3.551244985170027e-05,
      "loss": 1.4564,
      "num_input_tokens_seen": 32253475296,
      "step": 40995
    },
    {
      "epoch": 4.349246764269043,
      "grad_norm": 0.682271969214558,
      "learning_rate": 3.551181930696725e-05,
      "loss": 1.2959,
      "num_input_tokens_seen": 32254262064,
      "step": 40996
    },
    {
      "epoch": 4.349352853808615,
      "grad_norm": 0.6547800568417045,
      "learning_rate": 3.5511188754111e-05,
      "loss": 1.2862,
      "num_input_tokens_seen": 32255048816,
      "step": 40997
    },
    {
      "epoch": 4.349458943348186,
      "grad_norm": 0.6554884822865292,
      "learning_rate": 3.551055819313201e-05,
      "loss": 1.2952,
      "num_input_tokens_seen": 32255835568,
      "step": 40998
    },
    {
      "epoch": 4.3495650328877575,
      "grad_norm": 0.4977845599022719,
      "learning_rate": 3.550992762403077e-05,
      "loss": 1.2269,
      "num_input_tokens_seen": 32256622496,
      "step": 40999
    },
    {
      "epoch": 4.349671122427329,
      "grad_norm": 0.47923598962630487,
      "learning_rate": 3.550929704680777e-05,
      "loss": 1.2387,
      "num_input_tokens_seen": 32257409344,
      "step": 41000
    },
    {
      "epoch": 4.349671122427329,
      "eval_loss": 1.580567717552185,
      "eval_runtime": 65.1051,
      "eval_samples_per_second": 46.079,
      "eval_steps_per_second": 0.492,
      "num_input_tokens_seen": 32257409344,
      "step": 41000
    },
    {
      "epoch": 4.3497772119669005,
      "grad_norm": 0.5509184465333803,
      "learning_rate": 3.55086664614635e-05,
      "loss": 1.2157,
      "num_input_tokens_seen": 32258196176,
      "step": 41001
    },
    {
      "epoch": 4.3498833015064715,
      "grad_norm": 0.5605931944410619,
      "learning_rate": 3.550803586799843e-05,
      "loss": 1.2057,
      "num_input_tokens_seen": 32258982944,
      "step": 41002
    },
    {
      "epoch": 4.3499893910460425,
      "grad_norm": 0.4710859852252018,
      "learning_rate": 3.550740526641306e-05,
      "loss": 1.2624,
      "num_input_tokens_seen": 32259769696,
      "step": 41003
    },
    {
      "epoch": 4.3500954805856145,
      "grad_norm": 0.4920623354150286,
      "learning_rate": 3.5506774656707875e-05,
      "loss": 1.308,
      "num_input_tokens_seen": 32260556432,
      "step": 41004
    },
    {
      "epoch": 4.3502015701251855,
      "grad_norm": 0.5381018263068919,
      "learning_rate": 3.550614403888337e-05,
      "loss": 1.3423,
      "num_input_tokens_seen": 32261343168,
      "step": 41005
    },
    {
      "epoch": 4.350307659664757,
      "grad_norm": 0.5368830876510557,
      "learning_rate": 3.550551341294002e-05,
      "loss": 1.2622,
      "num_input_tokens_seen": 32262130000,
      "step": 41006
    },
    {
      "epoch": 4.350413749204328,
      "grad_norm": 0.43840256047991905,
      "learning_rate": 3.5504882778878315e-05,
      "loss": 1.2263,
      "num_input_tokens_seen": 32262916928,
      "step": 41007
    },
    {
      "epoch": 4.3505198387438995,
      "grad_norm": 0.5653238638683956,
      "learning_rate": 3.5504252136698744e-05,
      "loss": 1.2692,
      "num_input_tokens_seen": 32263703616,
      "step": 41008
    },
    {
      "epoch": 4.350625928283471,
      "grad_norm": 0.5159216557077976,
      "learning_rate": 3.55036214864018e-05,
      "loss": 1.2883,
      "num_input_tokens_seen": 32264490320,
      "step": 41009
    },
    {
      "epoch": 4.350732017823042,
      "grad_norm": 0.6129375410374316,
      "learning_rate": 3.550299082798796e-05,
      "loss": 1.379,
      "num_input_tokens_seen": 32265277072,
      "step": 41010
    },
    {
      "epoch": 4.350838107362614,
      "grad_norm": 0.5580000481460797,
      "learning_rate": 3.5502360161457725e-05,
      "loss": 1.33,
      "num_input_tokens_seen": 32266063712,
      "step": 41011
    },
    {
      "epoch": 4.350944196902185,
      "grad_norm": 0.5626099834916751,
      "learning_rate": 3.550172948681157e-05,
      "loss": 1.3086,
      "num_input_tokens_seen": 32266850496,
      "step": 41012
    },
    {
      "epoch": 4.351050286441756,
      "grad_norm": 0.5613473476761828,
      "learning_rate": 3.550109880404999e-05,
      "loss": 1.3924,
      "num_input_tokens_seen": 32267637312,
      "step": 41013
    },
    {
      "epoch": 4.351156375981328,
      "grad_norm": 0.5234781524945075,
      "learning_rate": 3.550046811317347e-05,
      "loss": 1.3469,
      "num_input_tokens_seen": 32268424064,
      "step": 41014
    },
    {
      "epoch": 4.351262465520899,
      "grad_norm": 0.6044466107304601,
      "learning_rate": 3.5499837414182485e-05,
      "loss": 1.3659,
      "num_input_tokens_seen": 32269210704,
      "step": 41015
    },
    {
      "epoch": 4.351368555060471,
      "grad_norm": 0.5282498305084308,
      "learning_rate": 3.549920670707754e-05,
      "loss": 1.3556,
      "num_input_tokens_seen": 32269997472,
      "step": 41016
    },
    {
      "epoch": 4.351474644600042,
      "grad_norm": 0.4985476904531088,
      "learning_rate": 3.549857599185912e-05,
      "loss": 1.2584,
      "num_input_tokens_seen": 32270784240,
      "step": 41017
    },
    {
      "epoch": 4.351580734139614,
      "grad_norm": 0.5292197791792657,
      "learning_rate": 3.549794526852771e-05,
      "loss": 1.2288,
      "num_input_tokens_seen": 32271570944,
      "step": 41018
    },
    {
      "epoch": 4.351686823679185,
      "grad_norm": 0.47310617618174855,
      "learning_rate": 3.5497314537083786e-05,
      "loss": 1.2771,
      "num_input_tokens_seen": 32272357728,
      "step": 41019
    },
    {
      "epoch": 4.351792913218756,
      "grad_norm": 0.5052690341475446,
      "learning_rate": 3.5496683797527844e-05,
      "loss": 1.1525,
      "num_input_tokens_seen": 32273144608,
      "step": 41020
    },
    {
      "epoch": 4.351899002758328,
      "grad_norm": 0.5224887055921026,
      "learning_rate": 3.549605304986038e-05,
      "loss": 1.2341,
      "num_input_tokens_seen": 32273931440,
      "step": 41021
    },
    {
      "epoch": 4.352005092297899,
      "grad_norm": 0.4755501379376115,
      "learning_rate": 3.549542229408188e-05,
      "loss": 1.2997,
      "num_input_tokens_seen": 32274718208,
      "step": 41022
    },
    {
      "epoch": 4.352111181837471,
      "grad_norm": 0.5075077420986069,
      "learning_rate": 3.549479153019282e-05,
      "loss": 1.3471,
      "num_input_tokens_seen": 32275505040,
      "step": 41023
    },
    {
      "epoch": 4.352217271377042,
      "grad_norm": 0.688457498308327,
      "learning_rate": 3.549416075819369e-05,
      "loss": 1.3092,
      "num_input_tokens_seen": 32276291792,
      "step": 41024
    },
    {
      "epoch": 4.352323360916614,
      "grad_norm": 0.5582659524627599,
      "learning_rate": 3.5493529978084985e-05,
      "loss": 1.3608,
      "num_input_tokens_seen": 32277078512,
      "step": 41025
    },
    {
      "epoch": 4.352429450456185,
      "grad_norm": 0.6322548385789911,
      "learning_rate": 3.5492899189867176e-05,
      "loss": 1.2956,
      "num_input_tokens_seen": 32277865280,
      "step": 41026
    },
    {
      "epoch": 4.352535539995756,
      "grad_norm": 0.5868480744197199,
      "learning_rate": 3.5492268393540775e-05,
      "loss": 1.2984,
      "num_input_tokens_seen": 32278651984,
      "step": 41027
    },
    {
      "epoch": 4.352641629535328,
      "grad_norm": 0.6055703940264648,
      "learning_rate": 3.549163758910626e-05,
      "loss": 1.3425,
      "num_input_tokens_seen": 32279438704,
      "step": 41028
    },
    {
      "epoch": 4.352747719074899,
      "grad_norm": 0.6445467831688069,
      "learning_rate": 3.549100677656411e-05,
      "loss": 1.4154,
      "num_input_tokens_seen": 32280225472,
      "step": 41029
    },
    {
      "epoch": 4.352853808614471,
      "grad_norm": 0.48313778011580033,
      "learning_rate": 3.549037595591481e-05,
      "loss": 1.3157,
      "num_input_tokens_seen": 32281012240,
      "step": 41030
    },
    {
      "epoch": 4.352959898154042,
      "grad_norm": 0.6253466841646081,
      "learning_rate": 3.5489745127158866e-05,
      "loss": 1.315,
      "num_input_tokens_seen": 32281798976,
      "step": 41031
    },
    {
      "epoch": 4.353065987693613,
      "grad_norm": 0.5450403303928606,
      "learning_rate": 3.548911429029674e-05,
      "loss": 1.3694,
      "num_input_tokens_seen": 32282585824,
      "step": 41032
    },
    {
      "epoch": 4.353172077233185,
      "grad_norm": 0.5797366047194281,
      "learning_rate": 3.548848344532895e-05,
      "loss": 1.4064,
      "num_input_tokens_seen": 32283372656,
      "step": 41033
    },
    {
      "epoch": 4.353278166772756,
      "grad_norm": 0.5355521911914246,
      "learning_rate": 3.5487852592255965e-05,
      "loss": 1.3899,
      "num_input_tokens_seen": 32284159312,
      "step": 41034
    },
    {
      "epoch": 4.353384256312328,
      "grad_norm": 0.5151526948192585,
      "learning_rate": 3.548722173107827e-05,
      "loss": 1.3396,
      "num_input_tokens_seen": 32284946080,
      "step": 41035
    },
    {
      "epoch": 4.353490345851899,
      "grad_norm": 0.6711089236014137,
      "learning_rate": 3.5486590861796365e-05,
      "loss": 1.2486,
      "num_input_tokens_seen": 32285732848,
      "step": 41036
    },
    {
      "epoch": 4.35359643539147,
      "grad_norm": 0.5801646588407577,
      "learning_rate": 3.548595998441073e-05,
      "loss": 1.3002,
      "num_input_tokens_seen": 32286519584,
      "step": 41037
    },
    {
      "epoch": 4.353702524931042,
      "grad_norm": 0.6394572189320267,
      "learning_rate": 3.5485329098921844e-05,
      "loss": 1.4119,
      "num_input_tokens_seen": 32287306256,
      "step": 41038
    },
    {
      "epoch": 4.353808614470613,
      "grad_norm": 0.5176013272739172,
      "learning_rate": 3.548469820533021e-05,
      "loss": 1.2416,
      "num_input_tokens_seen": 32288092992,
      "step": 41039
    },
    {
      "epoch": 4.353914704010185,
      "grad_norm": 0.5991699891330915,
      "learning_rate": 3.548406730363631e-05,
      "loss": 1.2674,
      "num_input_tokens_seen": 32288879792,
      "step": 41040
    },
    {
      "epoch": 4.354020793549756,
      "grad_norm": 0.5945063039387678,
      "learning_rate": 3.548343639384062e-05,
      "loss": 1.232,
      "num_input_tokens_seen": 32289666480,
      "step": 41041
    },
    {
      "epoch": 4.354126883089327,
      "grad_norm": 0.525026310508423,
      "learning_rate": 3.548280547594365e-05,
      "loss": 1.4328,
      "num_input_tokens_seen": 32290453184,
      "step": 41042
    },
    {
      "epoch": 4.354232972628899,
      "grad_norm": 0.6435296722898786,
      "learning_rate": 3.548217454994587e-05,
      "loss": 1.2611,
      "num_input_tokens_seen": 32291240016,
      "step": 41043
    },
    {
      "epoch": 4.35433906216847,
      "grad_norm": 0.5312948874107534,
      "learning_rate": 3.548154361584777e-05,
      "loss": 1.466,
      "num_input_tokens_seen": 32292026672,
      "step": 41044
    },
    {
      "epoch": 4.354445151708042,
      "grad_norm": 0.4487856194436589,
      "learning_rate": 3.5480912673649844e-05,
      "loss": 1.1666,
      "num_input_tokens_seen": 32292813520,
      "step": 41045
    },
    {
      "epoch": 4.354551241247613,
      "grad_norm": 0.5668548473042665,
      "learning_rate": 3.548028172335258e-05,
      "loss": 1.2711,
      "num_input_tokens_seen": 32293600288,
      "step": 41046
    },
    {
      "epoch": 4.354657330787185,
      "grad_norm": 0.5046103459700579,
      "learning_rate": 3.547965076495646e-05,
      "loss": 1.3312,
      "num_input_tokens_seen": 32294387072,
      "step": 41047
    },
    {
      "epoch": 4.354763420326756,
      "grad_norm": 0.4969036713509842,
      "learning_rate": 3.547901979846198e-05,
      "loss": 1.1733,
      "num_input_tokens_seen": 32295173856,
      "step": 41048
    },
    {
      "epoch": 4.354869509866327,
      "grad_norm": 0.5133986141772275,
      "learning_rate": 3.54783888238696e-05,
      "loss": 1.3528,
      "num_input_tokens_seen": 32295960624,
      "step": 41049
    },
    {
      "epoch": 4.354975599405899,
      "grad_norm": 0.6276818265078871,
      "learning_rate": 3.547775784117985e-05,
      "loss": 1.3756,
      "num_input_tokens_seen": 32296747280,
      "step": 41050
    },
    {
      "epoch": 4.35508168894547,
      "grad_norm": 0.4790497200944689,
      "learning_rate": 3.547712685039319e-05,
      "loss": 1.299,
      "num_input_tokens_seen": 32297533952,
      "step": 41051
    },
    {
      "epoch": 4.355187778485042,
      "grad_norm": 0.5662930972996442,
      "learning_rate": 3.5476495851510104e-05,
      "loss": 1.3467,
      "num_input_tokens_seen": 32298320672,
      "step": 41052
    },
    {
      "epoch": 4.355293868024613,
      "grad_norm": 0.5577834177613668,
      "learning_rate": 3.5475864844531095e-05,
      "loss": 1.4727,
      "num_input_tokens_seen": 32299107488,
      "step": 41053
    },
    {
      "epoch": 4.355399957564185,
      "grad_norm": 0.5863048010735535,
      "learning_rate": 3.5475233829456653e-05,
      "loss": 1.3218,
      "num_input_tokens_seen": 32299894224,
      "step": 41054
    },
    {
      "epoch": 4.355506047103756,
      "grad_norm": 0.475982673538863,
      "learning_rate": 3.547460280628725e-05,
      "loss": 1.1627,
      "num_input_tokens_seen": 32300681024,
      "step": 41055
    },
    {
      "epoch": 4.355612136643327,
      "grad_norm": 0.5573484154691896,
      "learning_rate": 3.547397177502338e-05,
      "loss": 1.3444,
      "num_input_tokens_seen": 32301467792,
      "step": 41056
    },
    {
      "epoch": 4.355718226182899,
      "grad_norm": 0.5790949751991971,
      "learning_rate": 3.547334073566554e-05,
      "loss": 1.3505,
      "num_input_tokens_seen": 32302254512,
      "step": 41057
    },
    {
      "epoch": 4.35582431572247,
      "grad_norm": 0.5156199790599492,
      "learning_rate": 3.54727096882142e-05,
      "loss": 1.317,
      "num_input_tokens_seen": 32303041264,
      "step": 41058
    },
    {
      "epoch": 4.355930405262042,
      "grad_norm": 0.5223532061294665,
      "learning_rate": 3.547207863266986e-05,
      "loss": 1.2654,
      "num_input_tokens_seen": 32303828064,
      "step": 41059
    },
    {
      "epoch": 4.356036494801613,
      "grad_norm": 0.5413778697475825,
      "learning_rate": 3.547144756903301e-05,
      "loss": 1.2514,
      "num_input_tokens_seen": 32304614816,
      "step": 41060
    },
    {
      "epoch": 4.356142584341184,
      "grad_norm": 0.5041615992987908,
      "learning_rate": 3.547081649730413e-05,
      "loss": 1.3379,
      "num_input_tokens_seen": 32305401568,
      "step": 41061
    },
    {
      "epoch": 4.3562486738807555,
      "grad_norm": 0.5570279833050017,
      "learning_rate": 3.547018541748371e-05,
      "loss": 1.1949,
      "num_input_tokens_seen": 32306188320,
      "step": 41062
    },
    {
      "epoch": 4.356354763420327,
      "grad_norm": 0.5178568058829359,
      "learning_rate": 3.546955432957224e-05,
      "loss": 1.3565,
      "num_input_tokens_seen": 32306975136,
      "step": 41063
    },
    {
      "epoch": 4.3564608529598985,
      "grad_norm": 0.5686534386884546,
      "learning_rate": 3.54689232335702e-05,
      "loss": 1.3341,
      "num_input_tokens_seen": 32307761904,
      "step": 41064
    },
    {
      "epoch": 4.3565669424994695,
      "grad_norm": 0.5321057665738043,
      "learning_rate": 3.5468292129478085e-05,
      "loss": 1.2907,
      "num_input_tokens_seen": 32308548672,
      "step": 41065
    },
    {
      "epoch": 4.3566730320390405,
      "grad_norm": 0.6488087973552061,
      "learning_rate": 3.5467661017296385e-05,
      "loss": 1.3115,
      "num_input_tokens_seen": 32309335360,
      "step": 41066
    },
    {
      "epoch": 4.3567791215786125,
      "grad_norm": 0.49858783069306273,
      "learning_rate": 3.546702989702558e-05,
      "loss": 1.2798,
      "num_input_tokens_seen": 32310122080,
      "step": 41067
    },
    {
      "epoch": 4.3568852111181835,
      "grad_norm": 0.5723624947241179,
      "learning_rate": 3.546639876866617e-05,
      "loss": 1.2505,
      "num_input_tokens_seen": 32310908880,
      "step": 41068
    },
    {
      "epoch": 4.356991300657755,
      "grad_norm": 0.6386373042373711,
      "learning_rate": 3.5465767632218614e-05,
      "loss": 1.4461,
      "num_input_tokens_seen": 32311695696,
      "step": 41069
    },
    {
      "epoch": 4.3570973901973264,
      "grad_norm": 0.5294281947184781,
      "learning_rate": 3.546513648768344e-05,
      "loss": 1.2022,
      "num_input_tokens_seen": 32312482464,
      "step": 41070
    },
    {
      "epoch": 4.3572034797368975,
      "grad_norm": 0.5433947393074513,
      "learning_rate": 3.546450533506111e-05,
      "loss": 1.2656,
      "num_input_tokens_seen": 32313269328,
      "step": 41071
    },
    {
      "epoch": 4.357309569276469,
      "grad_norm": 0.6978510719506975,
      "learning_rate": 3.546387417435211e-05,
      "loss": 1.4147,
      "num_input_tokens_seen": 32314056048,
      "step": 41072
    },
    {
      "epoch": 4.35741565881604,
      "grad_norm": 0.5195952586926266,
      "learning_rate": 3.546324300555694e-05,
      "loss": 1.2699,
      "num_input_tokens_seen": 32314842768,
      "step": 41073
    },
    {
      "epoch": 4.357521748355612,
      "grad_norm": 0.7078030068875032,
      "learning_rate": 3.546261182867609e-05,
      "loss": 1.4201,
      "num_input_tokens_seen": 32315629472,
      "step": 41074
    },
    {
      "epoch": 4.357627837895183,
      "grad_norm": 0.526122526667626,
      "learning_rate": 3.546198064371003e-05,
      "loss": 1.3768,
      "num_input_tokens_seen": 32316416224,
      "step": 41075
    },
    {
      "epoch": 4.357733927434755,
      "grad_norm": 0.6417993314091853,
      "learning_rate": 3.5461349450659264e-05,
      "loss": 1.3903,
      "num_input_tokens_seen": 32317203040,
      "step": 41076
    },
    {
      "epoch": 4.357840016974326,
      "grad_norm": 0.5749708876061016,
      "learning_rate": 3.5460718249524265e-05,
      "loss": 1.2235,
      "num_input_tokens_seen": 32317989824,
      "step": 41077
    },
    {
      "epoch": 4.357946106513897,
      "grad_norm": 0.5253133196452342,
      "learning_rate": 3.5460087040305535e-05,
      "loss": 1.3647,
      "num_input_tokens_seen": 32318776624,
      "step": 41078
    },
    {
      "epoch": 4.358052196053469,
      "grad_norm": 0.4983381705402934,
      "learning_rate": 3.545945582300356e-05,
      "loss": 1.2348,
      "num_input_tokens_seen": 32319563392,
      "step": 41079
    },
    {
      "epoch": 4.35815828559304,
      "grad_norm": 0.5223625370890698,
      "learning_rate": 3.545882459761883e-05,
      "loss": 1.4062,
      "num_input_tokens_seen": 32320350112,
      "step": 41080
    },
    {
      "epoch": 4.358264375132612,
      "grad_norm": 0.4395831965794937,
      "learning_rate": 3.545819336415182e-05,
      "loss": 1.2065,
      "num_input_tokens_seen": 32321136912,
      "step": 41081
    },
    {
      "epoch": 4.358370464672183,
      "grad_norm": 0.5121905934281132,
      "learning_rate": 3.5457562122603025e-05,
      "loss": 1.3045,
      "num_input_tokens_seen": 32321923600,
      "step": 41082
    },
    {
      "epoch": 4.358476554211755,
      "grad_norm": 0.5640771562788007,
      "learning_rate": 3.545693087297293e-05,
      "loss": 1.4134,
      "num_input_tokens_seen": 32322710256,
      "step": 41083
    },
    {
      "epoch": 4.358582643751326,
      "grad_norm": 0.4969072923615299,
      "learning_rate": 3.545629961526203e-05,
      "loss": 1.2571,
      "num_input_tokens_seen": 32323497056,
      "step": 41084
    },
    {
      "epoch": 4.358688733290897,
      "grad_norm": 0.5379846722454031,
      "learning_rate": 3.5455668349470804e-05,
      "loss": 1.2791,
      "num_input_tokens_seen": 32324283760,
      "step": 41085
    },
    {
      "epoch": 4.358794822830469,
      "grad_norm": 0.5791776923722771,
      "learning_rate": 3.545503707559975e-05,
      "loss": 1.3633,
      "num_input_tokens_seen": 32325070448,
      "step": 41086
    },
    {
      "epoch": 4.35890091237004,
      "grad_norm": 0.6814948079381599,
      "learning_rate": 3.545440579364935e-05,
      "loss": 1.2834,
      "num_input_tokens_seen": 32325857248,
      "step": 41087
    },
    {
      "epoch": 4.359007001909612,
      "grad_norm": 0.5036736782424668,
      "learning_rate": 3.5453774503620086e-05,
      "loss": 1.3055,
      "num_input_tokens_seen": 32326644192,
      "step": 41088
    },
    {
      "epoch": 4.359113091449183,
      "grad_norm": 0.6672919047095245,
      "learning_rate": 3.545314320551246e-05,
      "loss": 1.2681,
      "num_input_tokens_seen": 32327431008,
      "step": 41089
    },
    {
      "epoch": 4.359219180988754,
      "grad_norm": 0.608533567012333,
      "learning_rate": 3.545251189932695e-05,
      "loss": 1.3057,
      "num_input_tokens_seen": 32328217696,
      "step": 41090
    },
    {
      "epoch": 4.359325270528326,
      "grad_norm": 0.7084138082817332,
      "learning_rate": 3.545188058506404e-05,
      "loss": 1.3571,
      "num_input_tokens_seen": 32329004384,
      "step": 41091
    },
    {
      "epoch": 4.359431360067897,
      "grad_norm": 0.547241024747195,
      "learning_rate": 3.545124926272422e-05,
      "loss": 1.2889,
      "num_input_tokens_seen": 32329791184,
      "step": 41092
    },
    {
      "epoch": 4.359537449607469,
      "grad_norm": 0.4810933396450125,
      "learning_rate": 3.545061793230799e-05,
      "loss": 1.2246,
      "num_input_tokens_seen": 32330578064,
      "step": 41093
    },
    {
      "epoch": 4.35964353914704,
      "grad_norm": 0.5279271493525574,
      "learning_rate": 3.544998659381583e-05,
      "loss": 1.3125,
      "num_input_tokens_seen": 32331364880,
      "step": 41094
    },
    {
      "epoch": 4.359749628686611,
      "grad_norm": 0.5151731371264071,
      "learning_rate": 3.5449355247248216e-05,
      "loss": 1.2935,
      "num_input_tokens_seen": 32332151696,
      "step": 41095
    },
    {
      "epoch": 4.359855718226183,
      "grad_norm": 0.4799888336226279,
      "learning_rate": 3.544872389260566e-05,
      "loss": 1.3181,
      "num_input_tokens_seen": 32332938480,
      "step": 41096
    },
    {
      "epoch": 4.359961807765754,
      "grad_norm": 0.44466382891394635,
      "learning_rate": 3.5448092529888635e-05,
      "loss": 1.3528,
      "num_input_tokens_seen": 32333725264,
      "step": 41097
    },
    {
      "epoch": 4.360067897305326,
      "grad_norm": 0.47012883861567767,
      "learning_rate": 3.544746115909762e-05,
      "loss": 1.3145,
      "num_input_tokens_seen": 32334511984,
      "step": 41098
    },
    {
      "epoch": 4.360173986844897,
      "grad_norm": 0.47756199172796426,
      "learning_rate": 3.5446829780233124e-05,
      "loss": 1.2212,
      "num_input_tokens_seen": 32335298704,
      "step": 41099
    },
    {
      "epoch": 4.360280076384469,
      "grad_norm": 0.4844660708402998,
      "learning_rate": 3.544619839329562e-05,
      "loss": 1.3273,
      "num_input_tokens_seen": 32336085488,
      "step": 41100
    },
    {
      "epoch": 4.36038616592404,
      "grad_norm": 0.47303371457618393,
      "learning_rate": 3.544556699828559e-05,
      "loss": 1.3028,
      "num_input_tokens_seen": 32336872304,
      "step": 41101
    },
    {
      "epoch": 4.360492255463611,
      "grad_norm": 0.4596994260669374,
      "learning_rate": 3.544493559520355e-05,
      "loss": 1.2271,
      "num_input_tokens_seen": 32337659136,
      "step": 41102
    },
    {
      "epoch": 4.360598345003183,
      "grad_norm": 0.5755426342803779,
      "learning_rate": 3.5444304184049966e-05,
      "loss": 1.3249,
      "num_input_tokens_seen": 32338445824,
      "step": 41103
    },
    {
      "epoch": 4.360704434542754,
      "grad_norm": 0.41640388365629416,
      "learning_rate": 3.544367276482533e-05,
      "loss": 1.1528,
      "num_input_tokens_seen": 32339232592,
      "step": 41104
    },
    {
      "epoch": 4.360810524082326,
      "grad_norm": 0.589969982533046,
      "learning_rate": 3.5443041337530125e-05,
      "loss": 1.3532,
      "num_input_tokens_seen": 32340019328,
      "step": 41105
    },
    {
      "epoch": 4.360916613621897,
      "grad_norm": 0.49833009688014557,
      "learning_rate": 3.544240990216485e-05,
      "loss": 1.3371,
      "num_input_tokens_seen": 32340806032,
      "step": 41106
    },
    {
      "epoch": 4.361022703161468,
      "grad_norm": 0.47246908663418175,
      "learning_rate": 3.544177845872998e-05,
      "loss": 1.2648,
      "num_input_tokens_seen": 32341592800,
      "step": 41107
    },
    {
      "epoch": 4.36112879270104,
      "grad_norm": 0.5239303645331644,
      "learning_rate": 3.5441147007226015e-05,
      "loss": 1.3867,
      "num_input_tokens_seen": 32342379520,
      "step": 41108
    },
    {
      "epoch": 4.361234882240611,
      "grad_norm": 0.48171328784912565,
      "learning_rate": 3.5440515547653436e-05,
      "loss": 1.2923,
      "num_input_tokens_seen": 32343166336,
      "step": 41109
    },
    {
      "epoch": 4.361340971780183,
      "grad_norm": 0.5466346282481197,
      "learning_rate": 3.5439884080012733e-05,
      "loss": 1.3387,
      "num_input_tokens_seen": 32343953088,
      "step": 41110
    },
    {
      "epoch": 4.361447061319754,
      "grad_norm": 0.514994849356711,
      "learning_rate": 3.54392526043044e-05,
      "loss": 1.3558,
      "num_input_tokens_seen": 32344739856,
      "step": 41111
    },
    {
      "epoch": 4.361553150859326,
      "grad_norm": 0.47158310968676814,
      "learning_rate": 3.543862112052891e-05,
      "loss": 1.234,
      "num_input_tokens_seen": 32345526608,
      "step": 41112
    },
    {
      "epoch": 4.361659240398897,
      "grad_norm": 0.4832915641338224,
      "learning_rate": 3.543798962868677e-05,
      "loss": 1.284,
      "num_input_tokens_seen": 32346313504,
      "step": 41113
    },
    {
      "epoch": 4.361765329938468,
      "grad_norm": 0.5667271694693011,
      "learning_rate": 3.543735812877845e-05,
      "loss": 1.3158,
      "num_input_tokens_seen": 32347100176,
      "step": 41114
    },
    {
      "epoch": 4.36187141947804,
      "grad_norm": 0.5056562305206033,
      "learning_rate": 3.5436726620804444e-05,
      "loss": 1.3102,
      "num_input_tokens_seen": 32347886864,
      "step": 41115
    },
    {
      "epoch": 4.361977509017611,
      "grad_norm": 0.6100635731631245,
      "learning_rate": 3.543609510476525e-05,
      "loss": 1.3061,
      "num_input_tokens_seen": 32348673648,
      "step": 41116
    },
    {
      "epoch": 4.362083598557183,
      "grad_norm": 0.6236604463532763,
      "learning_rate": 3.543546358066134e-05,
      "loss": 1.3882,
      "num_input_tokens_seen": 32349460416,
      "step": 41117
    },
    {
      "epoch": 4.362189688096754,
      "grad_norm": 0.4845528016572901,
      "learning_rate": 3.543483204849321e-05,
      "loss": 1.1963,
      "num_input_tokens_seen": 32350247168,
      "step": 41118
    },
    {
      "epoch": 4.362295777636325,
      "grad_norm": 0.5063752912718948,
      "learning_rate": 3.5434200508261355e-05,
      "loss": 1.2949,
      "num_input_tokens_seen": 32351033824,
      "step": 41119
    },
    {
      "epoch": 4.362401867175897,
      "grad_norm": 0.5304554035340299,
      "learning_rate": 3.543356895996625e-05,
      "loss": 1.3493,
      "num_input_tokens_seen": 32351820560,
      "step": 41120
    },
    {
      "epoch": 4.362507956715468,
      "grad_norm": 0.48444355635059,
      "learning_rate": 3.543293740360839e-05,
      "loss": 1.2174,
      "num_input_tokens_seen": 32352607376,
      "step": 41121
    },
    {
      "epoch": 4.36261404625504,
      "grad_norm": 0.4799056865404059,
      "learning_rate": 3.543230583918827e-05,
      "loss": 1.3292,
      "num_input_tokens_seen": 32353394048,
      "step": 41122
    },
    {
      "epoch": 4.362720135794611,
      "grad_norm": 0.5253977494275588,
      "learning_rate": 3.543167426670635e-05,
      "loss": 1.2899,
      "num_input_tokens_seen": 32354180768,
      "step": 41123
    },
    {
      "epoch": 4.362826225334182,
      "grad_norm": 0.5559104254586558,
      "learning_rate": 3.5431042686163164e-05,
      "loss": 1.3562,
      "num_input_tokens_seen": 32354967488,
      "step": 41124
    },
    {
      "epoch": 4.3629323148737535,
      "grad_norm": 0.4838425217482204,
      "learning_rate": 3.5430411097559156e-05,
      "loss": 1.2497,
      "num_input_tokens_seen": 32355754176,
      "step": 41125
    },
    {
      "epoch": 4.363038404413325,
      "grad_norm": 0.531587362045257,
      "learning_rate": 3.542977950089484e-05,
      "loss": 1.2836,
      "num_input_tokens_seen": 32356540912,
      "step": 41126
    },
    {
      "epoch": 4.3631444939528965,
      "grad_norm": 0.6039112379727244,
      "learning_rate": 3.542914789617069e-05,
      "loss": 1.2953,
      "num_input_tokens_seen": 32357327744,
      "step": 41127
    },
    {
      "epoch": 4.3632505834924675,
      "grad_norm": 0.4917458830119579,
      "learning_rate": 3.542851628338721e-05,
      "loss": 1.328,
      "num_input_tokens_seen": 32358114416,
      "step": 41128
    },
    {
      "epoch": 4.3633566730320394,
      "grad_norm": 0.6352391088110232,
      "learning_rate": 3.542788466254487e-05,
      "loss": 1.2273,
      "num_input_tokens_seen": 32358901296,
      "step": 41129
    },
    {
      "epoch": 4.3634627625716105,
      "grad_norm": 0.5892449245207444,
      "learning_rate": 3.542725303364417e-05,
      "loss": 1.179,
      "num_input_tokens_seen": 32359688080,
      "step": 41130
    },
    {
      "epoch": 4.3635688521111815,
      "grad_norm": 0.6205230853150551,
      "learning_rate": 3.54266213966856e-05,
      "loss": 1.3925,
      "num_input_tokens_seen": 32360474768,
      "step": 41131
    },
    {
      "epoch": 4.363674941650753,
      "grad_norm": 0.5933721018866055,
      "learning_rate": 3.5425989751669634e-05,
      "loss": 1.336,
      "num_input_tokens_seen": 32361261584,
      "step": 41132
    },
    {
      "epoch": 4.3637810311903245,
      "grad_norm": 0.5036036194230834,
      "learning_rate": 3.542535809859677e-05,
      "loss": 1.2132,
      "num_input_tokens_seen": 32362048368,
      "step": 41133
    },
    {
      "epoch": 4.363887120729896,
      "grad_norm": 0.5350603338206849,
      "learning_rate": 3.5424726437467504e-05,
      "loss": 1.3614,
      "num_input_tokens_seen": 32362835104,
      "step": 41134
    },
    {
      "epoch": 4.363993210269467,
      "grad_norm": 0.48961928884798867,
      "learning_rate": 3.5424094768282304e-05,
      "loss": 1.3374,
      "num_input_tokens_seen": 32363621872,
      "step": 41135
    },
    {
      "epoch": 4.364099299809038,
      "grad_norm": 0.5291250520393727,
      "learning_rate": 3.542346309104168e-05,
      "loss": 1.2745,
      "num_input_tokens_seen": 32364408576,
      "step": 41136
    },
    {
      "epoch": 4.36420538934861,
      "grad_norm": 0.5099781879809573,
      "learning_rate": 3.54228314057461e-05,
      "loss": 1.3561,
      "num_input_tokens_seen": 32365195376,
      "step": 41137
    },
    {
      "epoch": 4.364311478888181,
      "grad_norm": 0.5860537333720659,
      "learning_rate": 3.542219971239607e-05,
      "loss": 1.3957,
      "num_input_tokens_seen": 32365982176,
      "step": 41138
    },
    {
      "epoch": 4.364417568427753,
      "grad_norm": 0.5020066668558534,
      "learning_rate": 3.542156801099207e-05,
      "loss": 1.3218,
      "num_input_tokens_seen": 32366769008,
      "step": 41139
    },
    {
      "epoch": 4.364523657967324,
      "grad_norm": 0.5282489444117963,
      "learning_rate": 3.5420936301534585e-05,
      "loss": 1.4248,
      "num_input_tokens_seen": 32367555840,
      "step": 41140
    },
    {
      "epoch": 4.364629747506896,
      "grad_norm": 0.5101323386082008,
      "learning_rate": 3.54203045840241e-05,
      "loss": 1.2892,
      "num_input_tokens_seen": 32368342704,
      "step": 41141
    },
    {
      "epoch": 4.364735837046467,
      "grad_norm": 0.5266718283639672,
      "learning_rate": 3.5419672858461115e-05,
      "loss": 1.2799,
      "num_input_tokens_seen": 32369129504,
      "step": 41142
    },
    {
      "epoch": 4.364841926586038,
      "grad_norm": 0.5630623068239633,
      "learning_rate": 3.541904112484612e-05,
      "loss": 1.4016,
      "num_input_tokens_seen": 32369916240,
      "step": 41143
    },
    {
      "epoch": 4.36494801612561,
      "grad_norm": 0.5263688412323575,
      "learning_rate": 3.541840938317958e-05,
      "loss": 1.2314,
      "num_input_tokens_seen": 32370703040,
      "step": 41144
    },
    {
      "epoch": 4.365054105665181,
      "grad_norm": 0.554749483280651,
      "learning_rate": 3.5417777633462015e-05,
      "loss": 1.2968,
      "num_input_tokens_seen": 32371489792,
      "step": 41145
    },
    {
      "epoch": 4.365160195204753,
      "grad_norm": 0.6674511593926973,
      "learning_rate": 3.541714587569388e-05,
      "loss": 1.3681,
      "num_input_tokens_seen": 32372276544,
      "step": 41146
    },
    {
      "epoch": 4.365266284744324,
      "grad_norm": 0.55169312950024,
      "learning_rate": 3.541651410987569e-05,
      "loss": 1.3626,
      "num_input_tokens_seen": 32373063280,
      "step": 41147
    },
    {
      "epoch": 4.365372374283895,
      "grad_norm": 0.5841435669024457,
      "learning_rate": 3.5415882336007926e-05,
      "loss": 1.2996,
      "num_input_tokens_seen": 32373850112,
      "step": 41148
    },
    {
      "epoch": 4.365478463823467,
      "grad_norm": 0.6181448685360023,
      "learning_rate": 3.5415250554091064e-05,
      "loss": 1.3719,
      "num_input_tokens_seen": 32374636800,
      "step": 41149
    },
    {
      "epoch": 4.365584553363038,
      "grad_norm": 0.5952252433668702,
      "learning_rate": 3.541461876412562e-05,
      "loss": 1.4381,
      "num_input_tokens_seen": 32375423552,
      "step": 41150
    },
    {
      "epoch": 4.36569064290261,
      "grad_norm": 0.839960940139641,
      "learning_rate": 3.541398696611205e-05,
      "loss": 1.3349,
      "num_input_tokens_seen": 32376210368,
      "step": 41151
    },
    {
      "epoch": 4.365796732442181,
      "grad_norm": 0.5820224766558896,
      "learning_rate": 3.541335516005085e-05,
      "loss": 1.2981,
      "num_input_tokens_seen": 32376997200,
      "step": 41152
    },
    {
      "epoch": 4.365902821981752,
      "grad_norm": 0.5671502299592042,
      "learning_rate": 3.541272334594253e-05,
      "loss": 1.2768,
      "num_input_tokens_seen": 32377783920,
      "step": 41153
    },
    {
      "epoch": 4.366008911521324,
      "grad_norm": 0.6216524898393693,
      "learning_rate": 3.541209152378756e-05,
      "loss": 1.3029,
      "num_input_tokens_seen": 32378570608,
      "step": 41154
    },
    {
      "epoch": 4.366115001060895,
      "grad_norm": 0.5542852165545454,
      "learning_rate": 3.541145969358642e-05,
      "loss": 1.4038,
      "num_input_tokens_seen": 32379357312,
      "step": 41155
    },
    {
      "epoch": 4.366221090600467,
      "grad_norm": 0.5209990296381279,
      "learning_rate": 3.541082785533962e-05,
      "loss": 1.2182,
      "num_input_tokens_seen": 32380144112,
      "step": 41156
    },
    {
      "epoch": 4.366327180140038,
      "grad_norm": 0.6792437717596909,
      "learning_rate": 3.5410196009047644e-05,
      "loss": 1.4454,
      "num_input_tokens_seen": 32380930880,
      "step": 41157
    },
    {
      "epoch": 4.36643326967961,
      "grad_norm": 0.4997767462443319,
      "learning_rate": 3.540956415471096e-05,
      "loss": 1.3951,
      "num_input_tokens_seen": 32381717616,
      "step": 41158
    },
    {
      "epoch": 4.366539359219181,
      "grad_norm": 0.5640335091409764,
      "learning_rate": 3.540893229233008e-05,
      "loss": 1.2788,
      "num_input_tokens_seen": 32382504432,
      "step": 41159
    },
    {
      "epoch": 4.366645448758752,
      "grad_norm": 0.491753615462839,
      "learning_rate": 3.5408300421905476e-05,
      "loss": 1.1744,
      "num_input_tokens_seen": 32383291168,
      "step": 41160
    },
    {
      "epoch": 4.366751538298324,
      "grad_norm": 0.5408398323838639,
      "learning_rate": 3.5407668543437646e-05,
      "loss": 1.3802,
      "num_input_tokens_seen": 32384077872,
      "step": 41161
    },
    {
      "epoch": 4.366857627837895,
      "grad_norm": 0.520711469126201,
      "learning_rate": 3.5407036656927075e-05,
      "loss": 1.3364,
      "num_input_tokens_seen": 32384864528,
      "step": 41162
    },
    {
      "epoch": 4.366963717377467,
      "grad_norm": 0.5344889070016506,
      "learning_rate": 3.5406404762374245e-05,
      "loss": 1.246,
      "num_input_tokens_seen": 32385651312,
      "step": 41163
    },
    {
      "epoch": 4.367069806917038,
      "grad_norm": 0.46507880273723967,
      "learning_rate": 3.5405772859779664e-05,
      "loss": 1.357,
      "num_input_tokens_seen": 32386437952,
      "step": 41164
    },
    {
      "epoch": 4.367175896456609,
      "grad_norm": 0.5305430982674809,
      "learning_rate": 3.54051409491438e-05,
      "loss": 1.4513,
      "num_input_tokens_seen": 32387224784,
      "step": 41165
    },
    {
      "epoch": 4.367281985996181,
      "grad_norm": 0.5036267038541759,
      "learning_rate": 3.540450903046714e-05,
      "loss": 1.3524,
      "num_input_tokens_seen": 32388011552,
      "step": 41166
    },
    {
      "epoch": 4.367388075535752,
      "grad_norm": 0.5038685811970635,
      "learning_rate": 3.540387710375019e-05,
      "loss": 1.3189,
      "num_input_tokens_seen": 32388798320,
      "step": 41167
    },
    {
      "epoch": 4.367494165075324,
      "grad_norm": 0.4509268379997944,
      "learning_rate": 3.540324516899343e-05,
      "loss": 1.2209,
      "num_input_tokens_seen": 32389585008,
      "step": 41168
    },
    {
      "epoch": 4.367600254614895,
      "grad_norm": 0.5706822390298081,
      "learning_rate": 3.5402613226197344e-05,
      "loss": 1.31,
      "num_input_tokens_seen": 32390371744,
      "step": 41169
    },
    {
      "epoch": 4.367706344154467,
      "grad_norm": 0.46190863744317706,
      "learning_rate": 3.540198127536243e-05,
      "loss": 1.315,
      "num_input_tokens_seen": 32391158480,
      "step": 41170
    },
    {
      "epoch": 4.367812433694038,
      "grad_norm": 0.6496392232590962,
      "learning_rate": 3.540134931648916e-05,
      "loss": 1.2918,
      "num_input_tokens_seen": 32391945328,
      "step": 41171
    },
    {
      "epoch": 4.367918523233609,
      "grad_norm": 0.6123648246146013,
      "learning_rate": 3.540071734957804e-05,
      "loss": 1.302,
      "num_input_tokens_seen": 32392732032,
      "step": 41172
    },
    {
      "epoch": 4.368024612773181,
      "grad_norm": 0.6505349434085381,
      "learning_rate": 3.540008537462954e-05,
      "loss": 1.2752,
      "num_input_tokens_seen": 32393518800,
      "step": 41173
    },
    {
      "epoch": 4.368130702312752,
      "grad_norm": 0.5878860337972387,
      "learning_rate": 3.5399453391644166e-05,
      "loss": 1.3546,
      "num_input_tokens_seen": 32394305616,
      "step": 41174
    },
    {
      "epoch": 4.368236791852324,
      "grad_norm": 0.6266546757830875,
      "learning_rate": 3.53988214006224e-05,
      "loss": 1.3223,
      "num_input_tokens_seen": 32395092336,
      "step": 41175
    },
    {
      "epoch": 4.368342881391895,
      "grad_norm": 0.7356660096652584,
      "learning_rate": 3.539818940156473e-05,
      "loss": 1.2828,
      "num_input_tokens_seen": 32395879008,
      "step": 41176
    },
    {
      "epoch": 4.368448970931466,
      "grad_norm": 0.6318754042379403,
      "learning_rate": 3.539755739447165e-05,
      "loss": 1.2373,
      "num_input_tokens_seen": 32396665776,
      "step": 41177
    },
    {
      "epoch": 4.368555060471038,
      "grad_norm": 0.6297723850537824,
      "learning_rate": 3.539692537934363e-05,
      "loss": 1.2606,
      "num_input_tokens_seen": 32397452624,
      "step": 41178
    },
    {
      "epoch": 4.368661150010609,
      "grad_norm": 0.8633294999953498,
      "learning_rate": 3.539629335618119e-05,
      "loss": 1.3067,
      "num_input_tokens_seen": 32398239344,
      "step": 41179
    },
    {
      "epoch": 4.368767239550181,
      "grad_norm": 0.6179617963439823,
      "learning_rate": 3.539566132498479e-05,
      "loss": 1.2501,
      "num_input_tokens_seen": 32399026128,
      "step": 41180
    },
    {
      "epoch": 4.368873329089752,
      "grad_norm": 0.5484039705546245,
      "learning_rate": 3.5395029285754915e-05,
      "loss": 1.3047,
      "num_input_tokens_seen": 32399812880,
      "step": 41181
    },
    {
      "epoch": 4.368979418629323,
      "grad_norm": 0.625998617778928,
      "learning_rate": 3.539439723849208e-05,
      "loss": 1.4416,
      "num_input_tokens_seen": 32400599664,
      "step": 41182
    },
    {
      "epoch": 4.369085508168895,
      "grad_norm": 0.5502067090988019,
      "learning_rate": 3.539376518319676e-05,
      "loss": 1.2597,
      "num_input_tokens_seen": 32401386448,
      "step": 41183
    },
    {
      "epoch": 4.369191597708466,
      "grad_norm": 0.6151092200910815,
      "learning_rate": 3.5393133119869435e-05,
      "loss": 1.2927,
      "num_input_tokens_seen": 32402173184,
      "step": 41184
    },
    {
      "epoch": 4.369297687248038,
      "grad_norm": 0.6603767617011325,
      "learning_rate": 3.5392501048510613e-05,
      "loss": 1.247,
      "num_input_tokens_seen": 32402960016,
      "step": 41185
    },
    {
      "epoch": 4.369403776787609,
      "grad_norm": 0.47545686582533814,
      "learning_rate": 3.539186896912077e-05,
      "loss": 1.3501,
      "num_input_tokens_seen": 32403746768,
      "step": 41186
    },
    {
      "epoch": 4.3695098663271805,
      "grad_norm": 0.5424659043870663,
      "learning_rate": 3.5391236881700386e-05,
      "loss": 1.2809,
      "num_input_tokens_seen": 32404533584,
      "step": 41187
    },
    {
      "epoch": 4.3696159558667516,
      "grad_norm": 0.5454808306607652,
      "learning_rate": 3.539060478624996e-05,
      "loss": 1.3349,
      "num_input_tokens_seen": 32405320304,
      "step": 41188
    },
    {
      "epoch": 4.369722045406323,
      "grad_norm": 0.4474573189328584,
      "learning_rate": 3.5389972682769984e-05,
      "loss": 1.2174,
      "num_input_tokens_seen": 32406107072,
      "step": 41189
    },
    {
      "epoch": 4.3698281349458945,
      "grad_norm": 0.564100128684002,
      "learning_rate": 3.538934057126094e-05,
      "loss": 1.3336,
      "num_input_tokens_seen": 32406893792,
      "step": 41190
    },
    {
      "epoch": 4.3699342244854655,
      "grad_norm": 0.6047349728546814,
      "learning_rate": 3.538870845172333e-05,
      "loss": 1.2332,
      "num_input_tokens_seen": 32407680592,
      "step": 41191
    },
    {
      "epoch": 4.3700403140250375,
      "grad_norm": 0.6658196538666274,
      "learning_rate": 3.5388076324157613e-05,
      "loss": 1.2615,
      "num_input_tokens_seen": 32408467456,
      "step": 41192
    },
    {
      "epoch": 4.3701464035646085,
      "grad_norm": 0.5416597379757042,
      "learning_rate": 3.5387444188564306e-05,
      "loss": 1.3356,
      "num_input_tokens_seen": 32409254176,
      "step": 41193
    },
    {
      "epoch": 4.3702524931041795,
      "grad_norm": 0.7569262915838965,
      "learning_rate": 3.5386812044943884e-05,
      "loss": 1.3475,
      "num_input_tokens_seen": 32410040944,
      "step": 41194
    },
    {
      "epoch": 4.370358582643751,
      "grad_norm": 0.5845979086167085,
      "learning_rate": 3.5386179893296836e-05,
      "loss": 1.4615,
      "num_input_tokens_seen": 32410827680,
      "step": 41195
    },
    {
      "epoch": 4.3704646721833225,
      "grad_norm": 0.6071855156728598,
      "learning_rate": 3.5385547733623656e-05,
      "loss": 1.316,
      "num_input_tokens_seen": 32411614560,
      "step": 41196
    },
    {
      "epoch": 4.370570761722894,
      "grad_norm": 0.6446775552413613,
      "learning_rate": 3.538491556592484e-05,
      "loss": 1.329,
      "num_input_tokens_seen": 32412401328,
      "step": 41197
    },
    {
      "epoch": 4.370676851262465,
      "grad_norm": 0.4791369727154489,
      "learning_rate": 3.5384283390200844e-05,
      "loss": 1.3211,
      "num_input_tokens_seen": 32413188096,
      "step": 41198
    },
    {
      "epoch": 4.370782940802037,
      "grad_norm": 0.623373898872135,
      "learning_rate": 3.5383651206452196e-05,
      "loss": 1.3534,
      "num_input_tokens_seen": 32413974736,
      "step": 41199
    },
    {
      "epoch": 4.370889030341608,
      "grad_norm": 0.6172527473514329,
      "learning_rate": 3.538301901467936e-05,
      "loss": 1.2735,
      "num_input_tokens_seen": 32414761504,
      "step": 41200
    },
    {
      "epoch": 4.370995119881179,
      "grad_norm": 0.5202906234786104,
      "learning_rate": 3.5382386814882826e-05,
      "loss": 1.1911,
      "num_input_tokens_seen": 32415548208,
      "step": 41201
    },
    {
      "epoch": 4.371101209420751,
      "grad_norm": 0.5071785421779512,
      "learning_rate": 3.53817546070631e-05,
      "loss": 1.2702,
      "num_input_tokens_seen": 32416334880,
      "step": 41202
    },
    {
      "epoch": 4.371207298960322,
      "grad_norm": 0.5594213081607264,
      "learning_rate": 3.538112239122066e-05,
      "loss": 1.3135,
      "num_input_tokens_seen": 32417121632,
      "step": 41203
    },
    {
      "epoch": 4.371313388499894,
      "grad_norm": 0.5008567686485574,
      "learning_rate": 3.5380490167355974e-05,
      "loss": 1.3387,
      "num_input_tokens_seen": 32417908416,
      "step": 41204
    },
    {
      "epoch": 4.371419478039465,
      "grad_norm": 0.546432416920248,
      "learning_rate": 3.537985793546956e-05,
      "loss": 1.2631,
      "num_input_tokens_seen": 32418695184,
      "step": 41205
    },
    {
      "epoch": 4.371525567579036,
      "grad_norm": 0.47037984523957505,
      "learning_rate": 3.5379225695561904e-05,
      "loss": 1.2938,
      "num_input_tokens_seen": 32419481968,
      "step": 41206
    },
    {
      "epoch": 4.371631657118608,
      "grad_norm": 0.5082714691888139,
      "learning_rate": 3.537859344763348e-05,
      "loss": 1.1939,
      "num_input_tokens_seen": 32420268784,
      "step": 41207
    },
    {
      "epoch": 4.371737746658179,
      "grad_norm": 0.5200796779862664,
      "learning_rate": 3.537796119168478e-05,
      "loss": 1.3645,
      "num_input_tokens_seen": 32421055600,
      "step": 41208
    },
    {
      "epoch": 4.371843836197751,
      "grad_norm": 0.4263432471831958,
      "learning_rate": 3.53773289277163e-05,
      "loss": 1.2807,
      "num_input_tokens_seen": 32421842352,
      "step": 41209
    },
    {
      "epoch": 4.371949925737322,
      "grad_norm": 0.6268535198590748,
      "learning_rate": 3.537669665572853e-05,
      "loss": 1.39,
      "num_input_tokens_seen": 32422629264,
      "step": 41210
    },
    {
      "epoch": 4.372056015276893,
      "grad_norm": 0.5423059568876483,
      "learning_rate": 3.537606437572195e-05,
      "loss": 1.1927,
      "num_input_tokens_seen": 32423416064,
      "step": 41211
    },
    {
      "epoch": 4.372162104816465,
      "grad_norm": 0.4906682842810302,
      "learning_rate": 3.537543208769705e-05,
      "loss": 1.3491,
      "num_input_tokens_seen": 32424202768,
      "step": 41212
    },
    {
      "epoch": 4.372268194356036,
      "grad_norm": 0.5865835755531551,
      "learning_rate": 3.537479979165432e-05,
      "loss": 1.2857,
      "num_input_tokens_seen": 32424989584,
      "step": 41213
    },
    {
      "epoch": 4.372374283895608,
      "grad_norm": 0.49491358855000456,
      "learning_rate": 3.537416748759426e-05,
      "loss": 1.3098,
      "num_input_tokens_seen": 32425776400,
      "step": 41214
    },
    {
      "epoch": 4.372480373435179,
      "grad_norm": 0.5466403558142542,
      "learning_rate": 3.537353517551733e-05,
      "loss": 1.2255,
      "num_input_tokens_seen": 32426563104,
      "step": 41215
    },
    {
      "epoch": 4.372586462974751,
      "grad_norm": 0.5704406790553077,
      "learning_rate": 3.537290285542404e-05,
      "loss": 1.3047,
      "num_input_tokens_seen": 32427349904,
      "step": 41216
    },
    {
      "epoch": 4.372692552514322,
      "grad_norm": 0.5559203374779884,
      "learning_rate": 3.537227052731489e-05,
      "loss": 1.2825,
      "num_input_tokens_seen": 32428136720,
      "step": 41217
    },
    {
      "epoch": 4.372798642053893,
      "grad_norm": 0.5119618100094916,
      "learning_rate": 3.5371638191190335e-05,
      "loss": 1.2526,
      "num_input_tokens_seen": 32428923568,
      "step": 41218
    },
    {
      "epoch": 4.372904731593465,
      "grad_norm": 0.5046678177550523,
      "learning_rate": 3.5371005847050895e-05,
      "loss": 1.3272,
      "num_input_tokens_seen": 32429710368,
      "step": 41219
    },
    {
      "epoch": 4.373010821133036,
      "grad_norm": 0.5319678946055351,
      "learning_rate": 3.537037349489704e-05,
      "loss": 1.3172,
      "num_input_tokens_seen": 32430497072,
      "step": 41220
    },
    {
      "epoch": 4.373116910672608,
      "grad_norm": 0.5276220389817833,
      "learning_rate": 3.5369741134729264e-05,
      "loss": 1.2454,
      "num_input_tokens_seen": 32431283888,
      "step": 41221
    },
    {
      "epoch": 4.373223000212179,
      "grad_norm": 0.5258875381713004,
      "learning_rate": 3.5369108766548055e-05,
      "loss": 1.3744,
      "num_input_tokens_seen": 32432070688,
      "step": 41222
    },
    {
      "epoch": 4.373329089751751,
      "grad_norm": 0.4905585505669564,
      "learning_rate": 3.5368476390353914e-05,
      "loss": 1.2232,
      "num_input_tokens_seen": 32432857488,
      "step": 41223
    },
    {
      "epoch": 4.373435179291322,
      "grad_norm": 0.5585359052636455,
      "learning_rate": 3.53678440061473e-05,
      "loss": 1.3185,
      "num_input_tokens_seen": 32433644224,
      "step": 41224
    },
    {
      "epoch": 4.373541268830893,
      "grad_norm": 0.49498954885556656,
      "learning_rate": 3.5367211613928734e-05,
      "loss": 1.3244,
      "num_input_tokens_seen": 32434430928,
      "step": 41225
    },
    {
      "epoch": 4.373647358370465,
      "grad_norm": 0.7751946087141883,
      "learning_rate": 3.536657921369869e-05,
      "loss": 1.414,
      "num_input_tokens_seen": 32435217712,
      "step": 41226
    },
    {
      "epoch": 4.373753447910036,
      "grad_norm": 0.45974552593843,
      "learning_rate": 3.5365946805457655e-05,
      "loss": 1.2785,
      "num_input_tokens_seen": 32436004576,
      "step": 41227
    },
    {
      "epoch": 4.373859537449608,
      "grad_norm": 0.6586198169946516,
      "learning_rate": 3.536531438920613e-05,
      "loss": 1.3397,
      "num_input_tokens_seen": 32436791264,
      "step": 41228
    },
    {
      "epoch": 4.373965626989179,
      "grad_norm": 0.6438917128164983,
      "learning_rate": 3.536468196494458e-05,
      "loss": 1.4184,
      "num_input_tokens_seen": 32437578128,
      "step": 41229
    },
    {
      "epoch": 4.37407171652875,
      "grad_norm": 0.5174377160179371,
      "learning_rate": 3.536404953267352e-05,
      "loss": 1.2951,
      "num_input_tokens_seen": 32438364800,
      "step": 41230
    },
    {
      "epoch": 4.374177806068322,
      "grad_norm": 0.6398367078447652,
      "learning_rate": 3.536341709239341e-05,
      "loss": 1.3508,
      "num_input_tokens_seen": 32439151760,
      "step": 41231
    },
    {
      "epoch": 4.374283895607893,
      "grad_norm": 0.5391240329227306,
      "learning_rate": 3.536278464410477e-05,
      "loss": 1.2027,
      "num_input_tokens_seen": 32439938592,
      "step": 41232
    },
    {
      "epoch": 4.374389985147465,
      "grad_norm": 0.6731538344797333,
      "learning_rate": 3.536215218780807e-05,
      "loss": 1.3353,
      "num_input_tokens_seen": 32440725360,
      "step": 41233
    },
    {
      "epoch": 4.374496074687036,
      "grad_norm": 0.6800321333032822,
      "learning_rate": 3.5361519723503806e-05,
      "loss": 1.406,
      "num_input_tokens_seen": 32441512176,
      "step": 41234
    },
    {
      "epoch": 4.374602164226607,
      "grad_norm": 0.5897855883690833,
      "learning_rate": 3.536088725119245e-05,
      "loss": 1.2678,
      "num_input_tokens_seen": 32442298928,
      "step": 41235
    },
    {
      "epoch": 4.374708253766179,
      "grad_norm": 0.5613310408118051,
      "learning_rate": 3.536025477087452e-05,
      "loss": 1.2731,
      "num_input_tokens_seen": 32443085712,
      "step": 41236
    },
    {
      "epoch": 4.37481434330575,
      "grad_norm": 0.57978579876076,
      "learning_rate": 3.5359622282550485e-05,
      "loss": 1.314,
      "num_input_tokens_seen": 32443872496,
      "step": 41237
    },
    {
      "epoch": 4.374920432845322,
      "grad_norm": 0.5258575529976314,
      "learning_rate": 3.5358989786220835e-05,
      "loss": 1.2681,
      "num_input_tokens_seen": 32444659296,
      "step": 41238
    },
    {
      "epoch": 4.375026522384893,
      "grad_norm": 0.516702935906738,
      "learning_rate": 3.5358357281886066e-05,
      "loss": 1.2395,
      "num_input_tokens_seen": 32445446128,
      "step": 41239
    },
    {
      "epoch": 4.375132611924464,
      "grad_norm": 0.4825990123945033,
      "learning_rate": 3.5357724769546666e-05,
      "loss": 1.3026,
      "num_input_tokens_seen": 32446232928,
      "step": 41240
    },
    {
      "epoch": 4.375238701464036,
      "grad_norm": 0.6616290444974221,
      "learning_rate": 3.53570922492031e-05,
      "loss": 1.4672,
      "num_input_tokens_seen": 32447019648,
      "step": 41241
    },
    {
      "epoch": 4.375344791003607,
      "grad_norm": 0.5174280170155623,
      "learning_rate": 3.53564597208559e-05,
      "loss": 1.3192,
      "num_input_tokens_seen": 32447806400,
      "step": 41242
    },
    {
      "epoch": 4.375450880543179,
      "grad_norm": 0.5660590528703279,
      "learning_rate": 3.5355827184505526e-05,
      "loss": 1.3768,
      "num_input_tokens_seen": 32448593216,
      "step": 41243
    },
    {
      "epoch": 4.37555697008275,
      "grad_norm": 0.4682653911271492,
      "learning_rate": 3.535519464015246e-05,
      "loss": 1.2999,
      "num_input_tokens_seen": 32449379952,
      "step": 41244
    },
    {
      "epoch": 4.375663059622322,
      "grad_norm": 0.6230198637336233,
      "learning_rate": 3.535456208779722e-05,
      "loss": 1.2982,
      "num_input_tokens_seen": 32450166688,
      "step": 41245
    },
    {
      "epoch": 4.375769149161893,
      "grad_norm": 0.5616083157459792,
      "learning_rate": 3.5353929527440274e-05,
      "loss": 1.3204,
      "num_input_tokens_seen": 32450953456,
      "step": 41246
    },
    {
      "epoch": 4.375875238701464,
      "grad_norm": 0.5584217252134451,
      "learning_rate": 3.5353296959082106e-05,
      "loss": 1.3149,
      "num_input_tokens_seen": 32451740224,
      "step": 41247
    },
    {
      "epoch": 4.375981328241036,
      "grad_norm": 0.7161024927989289,
      "learning_rate": 3.5352664382723224e-05,
      "loss": 1.287,
      "num_input_tokens_seen": 32452527040,
      "step": 41248
    },
    {
      "epoch": 4.376087417780607,
      "grad_norm": 0.4525697443808464,
      "learning_rate": 3.5352031798364095e-05,
      "loss": 1.3157,
      "num_input_tokens_seen": 32453313792,
      "step": 41249
    },
    {
      "epoch": 4.3761935073201785,
      "grad_norm": 0.5612419645326522,
      "learning_rate": 3.535139920600523e-05,
      "loss": 1.1948,
      "num_input_tokens_seen": 32454100640,
      "step": 41250
    },
    {
      "epoch": 4.37629959685975,
      "grad_norm": 0.6769505238239644,
      "learning_rate": 3.5350766605647105e-05,
      "loss": 1.3086,
      "num_input_tokens_seen": 32454887312,
      "step": 41251
    },
    {
      "epoch": 4.3764056863993215,
      "grad_norm": 0.5832148968389712,
      "learning_rate": 3.5350133997290205e-05,
      "loss": 1.2792,
      "num_input_tokens_seen": 32455674144,
      "step": 41252
    },
    {
      "epoch": 4.3765117759388925,
      "grad_norm": 0.6141143947745894,
      "learning_rate": 3.534950138093504e-05,
      "loss": 1.3165,
      "num_input_tokens_seen": 32456461024,
      "step": 41253
    },
    {
      "epoch": 4.3766178654784635,
      "grad_norm": 0.5049537800890878,
      "learning_rate": 3.5348868756582075e-05,
      "loss": 1.269,
      "num_input_tokens_seen": 32457247808,
      "step": 41254
    },
    {
      "epoch": 4.3767239550180355,
      "grad_norm": 0.5655568523881358,
      "learning_rate": 3.53482361242318e-05,
      "loss": 1.2625,
      "num_input_tokens_seen": 32458034528,
      "step": 41255
    },
    {
      "epoch": 4.3768300445576065,
      "grad_norm": 0.5345435767263965,
      "learning_rate": 3.534760348388473e-05,
      "loss": 1.3114,
      "num_input_tokens_seen": 32458821280,
      "step": 41256
    },
    {
      "epoch": 4.376936134097178,
      "grad_norm": 0.6204584427578971,
      "learning_rate": 3.534697083554132e-05,
      "loss": 1.3235,
      "num_input_tokens_seen": 32459607968,
      "step": 41257
    },
    {
      "epoch": 4.377042223636749,
      "grad_norm": 0.5505556652309228,
      "learning_rate": 3.534633817920208e-05,
      "loss": 1.2885,
      "num_input_tokens_seen": 32460394784,
      "step": 41258
    },
    {
      "epoch": 4.3771483131763205,
      "grad_norm": 0.5320579065016541,
      "learning_rate": 3.5345705514867496e-05,
      "loss": 1.2496,
      "num_input_tokens_seen": 32461181536,
      "step": 41259
    },
    {
      "epoch": 4.377254402715892,
      "grad_norm": 0.5226085096416627,
      "learning_rate": 3.534507284253805e-05,
      "loss": 1.3553,
      "num_input_tokens_seen": 32461968304,
      "step": 41260
    },
    {
      "epoch": 4.377360492255463,
      "grad_norm": 0.5583491496527303,
      "learning_rate": 3.534444016221424e-05,
      "loss": 1.364,
      "num_input_tokens_seen": 32462755008,
      "step": 41261
    },
    {
      "epoch": 4.377466581795035,
      "grad_norm": 0.5635240600198265,
      "learning_rate": 3.534380747389655e-05,
      "loss": 1.4009,
      "num_input_tokens_seen": 32463541744,
      "step": 41262
    },
    {
      "epoch": 4.377572671334606,
      "grad_norm": 0.6074140844936035,
      "learning_rate": 3.534317477758546e-05,
      "loss": 1.377,
      "num_input_tokens_seen": 32464328432,
      "step": 41263
    },
    {
      "epoch": 4.377678760874177,
      "grad_norm": 0.5196848367071543,
      "learning_rate": 3.534254207328147e-05,
      "loss": 1.2313,
      "num_input_tokens_seen": 32465115200,
      "step": 41264
    },
    {
      "epoch": 4.377784850413749,
      "grad_norm": 0.6228985712709397,
      "learning_rate": 3.534190936098508e-05,
      "loss": 1.328,
      "num_input_tokens_seen": 32465901984,
      "step": 41265
    },
    {
      "epoch": 4.37789093995332,
      "grad_norm": 0.5492603184950798,
      "learning_rate": 3.534127664069675e-05,
      "loss": 1.3271,
      "num_input_tokens_seen": 32466688752,
      "step": 41266
    },
    {
      "epoch": 4.377997029492892,
      "grad_norm": 0.74007001148275,
      "learning_rate": 3.5340643912416995e-05,
      "loss": 1.3281,
      "num_input_tokens_seen": 32467475520,
      "step": 41267
    },
    {
      "epoch": 4.378103119032463,
      "grad_norm": 0.5550857124679963,
      "learning_rate": 3.534001117614629e-05,
      "loss": 1.3441,
      "num_input_tokens_seen": 32468262384,
      "step": 41268
    },
    {
      "epoch": 4.378209208572034,
      "grad_norm": 0.44349416679202935,
      "learning_rate": 3.533937843188513e-05,
      "loss": 1.2341,
      "num_input_tokens_seen": 32469049168,
      "step": 41269
    },
    {
      "epoch": 4.378315298111606,
      "grad_norm": 0.6862193503069726,
      "learning_rate": 3.533874567963399e-05,
      "loss": 1.2964,
      "num_input_tokens_seen": 32469836000,
      "step": 41270
    },
    {
      "epoch": 4.378421387651177,
      "grad_norm": 0.5429775452671519,
      "learning_rate": 3.5338112919393385e-05,
      "loss": 1.3439,
      "num_input_tokens_seen": 32470622736,
      "step": 41271
    },
    {
      "epoch": 4.378527477190749,
      "grad_norm": 0.49179863756422826,
      "learning_rate": 3.533748015116379e-05,
      "loss": 1.2146,
      "num_input_tokens_seen": 32471409536,
      "step": 41272
    },
    {
      "epoch": 4.37863356673032,
      "grad_norm": 0.5137853447073754,
      "learning_rate": 3.5336847374945686e-05,
      "loss": 1.2885,
      "num_input_tokens_seen": 32472196224,
      "step": 41273
    },
    {
      "epoch": 4.378739656269892,
      "grad_norm": 0.4874529018976874,
      "learning_rate": 3.5336214590739575e-05,
      "loss": 1.2755,
      "num_input_tokens_seen": 32472982928,
      "step": 41274
    },
    {
      "epoch": 4.378845745809463,
      "grad_norm": 0.5612752967534975,
      "learning_rate": 3.533558179854594e-05,
      "loss": 1.313,
      "num_input_tokens_seen": 32473769664,
      "step": 41275
    },
    {
      "epoch": 4.378951835349034,
      "grad_norm": 0.6106743648243842,
      "learning_rate": 3.533494899836526e-05,
      "loss": 1.4075,
      "num_input_tokens_seen": 32474556416,
      "step": 41276
    },
    {
      "epoch": 4.379057924888606,
      "grad_norm": 0.51365500357083,
      "learning_rate": 3.5334316190198045e-05,
      "loss": 1.2665,
      "num_input_tokens_seen": 32475343152,
      "step": 41277
    },
    {
      "epoch": 4.379164014428177,
      "grad_norm": 0.6337659609186711,
      "learning_rate": 3.533368337404477e-05,
      "loss": 1.3854,
      "num_input_tokens_seen": 32476129920,
      "step": 41278
    },
    {
      "epoch": 4.379270103967749,
      "grad_norm": 0.5546462612256529,
      "learning_rate": 3.533305054990593e-05,
      "loss": 1.3937,
      "num_input_tokens_seen": 32476916768,
      "step": 41279
    },
    {
      "epoch": 4.37937619350732,
      "grad_norm": 0.5793953493864348,
      "learning_rate": 3.5332417717782015e-05,
      "loss": 1.3114,
      "num_input_tokens_seen": 32477703424,
      "step": 41280
    },
    {
      "epoch": 4.379482283046892,
      "grad_norm": 0.5116200310429442,
      "learning_rate": 3.5331784877673506e-05,
      "loss": 1.2191,
      "num_input_tokens_seen": 32478490256,
      "step": 41281
    },
    {
      "epoch": 4.379588372586463,
      "grad_norm": 0.6237528879432537,
      "learning_rate": 3.5331152029580905e-05,
      "loss": 1.3356,
      "num_input_tokens_seen": 32479276992,
      "step": 41282
    },
    {
      "epoch": 4.379694462126034,
      "grad_norm": 0.5379320657591933,
      "learning_rate": 3.5330519173504686e-05,
      "loss": 1.2224,
      "num_input_tokens_seen": 32480063808,
      "step": 41283
    },
    {
      "epoch": 4.379800551665606,
      "grad_norm": 0.5539641735415911,
      "learning_rate": 3.5329886309445344e-05,
      "loss": 1.2874,
      "num_input_tokens_seen": 32480850496,
      "step": 41284
    },
    {
      "epoch": 4.379906641205177,
      "grad_norm": 0.6342056184738465,
      "learning_rate": 3.532925343740337e-05,
      "loss": 1.2829,
      "num_input_tokens_seen": 32481637296,
      "step": 41285
    },
    {
      "epoch": 4.380012730744749,
      "grad_norm": 0.5439128504391382,
      "learning_rate": 3.532862055737926e-05,
      "loss": 1.4607,
      "num_input_tokens_seen": 32482424112,
      "step": 41286
    },
    {
      "epoch": 4.38011882028432,
      "grad_norm": 0.744141725857299,
      "learning_rate": 3.532798766937348e-05,
      "loss": 1.2917,
      "num_input_tokens_seen": 32483210832,
      "step": 41287
    },
    {
      "epoch": 4.380224909823891,
      "grad_norm": 0.5058407583315422,
      "learning_rate": 3.532735477338655e-05,
      "loss": 1.3462,
      "num_input_tokens_seen": 32483997696,
      "step": 41288
    },
    {
      "epoch": 4.380330999363463,
      "grad_norm": 0.5093812945241497,
      "learning_rate": 3.532672186941893e-05,
      "loss": 1.3611,
      "num_input_tokens_seen": 32484784384,
      "step": 41289
    },
    {
      "epoch": 4.380437088903034,
      "grad_norm": 0.5435670732682397,
      "learning_rate": 3.532608895747112e-05,
      "loss": 1.2663,
      "num_input_tokens_seen": 32485571296,
      "step": 41290
    },
    {
      "epoch": 4.380543178442606,
      "grad_norm": 0.5257954855819988,
      "learning_rate": 3.532545603754362e-05,
      "loss": 1.3748,
      "num_input_tokens_seen": 32486358128,
      "step": 41291
    },
    {
      "epoch": 4.380649267982177,
      "grad_norm": 0.5010761461187069,
      "learning_rate": 3.532482310963691e-05,
      "loss": 1.3737,
      "num_input_tokens_seen": 32487144880,
      "step": 41292
    },
    {
      "epoch": 4.380755357521748,
      "grad_norm": 0.5444822134751113,
      "learning_rate": 3.5324190173751485e-05,
      "loss": 1.2014,
      "num_input_tokens_seen": 32487931712,
      "step": 41293
    },
    {
      "epoch": 4.38086144706132,
      "grad_norm": 0.5218351401695298,
      "learning_rate": 3.5323557229887816e-05,
      "loss": 1.2439,
      "num_input_tokens_seen": 32488718496,
      "step": 41294
    },
    {
      "epoch": 4.380967536600891,
      "grad_norm": 0.5589915776229359,
      "learning_rate": 3.532292427804641e-05,
      "loss": 1.2985,
      "num_input_tokens_seen": 32489505328,
      "step": 41295
    },
    {
      "epoch": 4.381073626140463,
      "grad_norm": 0.5525168752710958,
      "learning_rate": 3.532229131822775e-05,
      "loss": 1.2733,
      "num_input_tokens_seen": 32490292032,
      "step": 41296
    },
    {
      "epoch": 4.381179715680034,
      "grad_norm": 0.48124347020730757,
      "learning_rate": 3.532165835043233e-05,
      "loss": 1.3547,
      "num_input_tokens_seen": 32491078816,
      "step": 41297
    },
    {
      "epoch": 4.381285805219606,
      "grad_norm": 0.45458865975310425,
      "learning_rate": 3.5321025374660634e-05,
      "loss": 1.1864,
      "num_input_tokens_seen": 32491865680,
      "step": 41298
    },
    {
      "epoch": 4.381391894759177,
      "grad_norm": 0.5627774606503154,
      "learning_rate": 3.532039239091315e-05,
      "loss": 1.4478,
      "num_input_tokens_seen": 32492652528,
      "step": 41299
    },
    {
      "epoch": 4.381497984298748,
      "grad_norm": 0.4860155127285974,
      "learning_rate": 3.531975939919038e-05,
      "loss": 1.2531,
      "num_input_tokens_seen": 32493439264,
      "step": 41300
    },
    {
      "epoch": 4.38160407383832,
      "grad_norm": 0.5061328185212859,
      "learning_rate": 3.531912639949279e-05,
      "loss": 1.3657,
      "num_input_tokens_seen": 32494225968,
      "step": 41301
    },
    {
      "epoch": 4.381710163377891,
      "grad_norm": 0.5461437819593625,
      "learning_rate": 3.531849339182089e-05,
      "loss": 1.3719,
      "num_input_tokens_seen": 32495012672,
      "step": 41302
    },
    {
      "epoch": 4.381816252917463,
      "grad_norm": 0.5088798048184885,
      "learning_rate": 3.531786037617516e-05,
      "loss": 1.3473,
      "num_input_tokens_seen": 32495799472,
      "step": 41303
    },
    {
      "epoch": 4.381922342457034,
      "grad_norm": 0.48153015965025836,
      "learning_rate": 3.531722735255608e-05,
      "loss": 1.2349,
      "num_input_tokens_seen": 32496586256,
      "step": 41304
    },
    {
      "epoch": 4.382028431996605,
      "grad_norm": 0.5420123359797421,
      "learning_rate": 3.531659432096416e-05,
      "loss": 1.2956,
      "num_input_tokens_seen": 32497373168,
      "step": 41305
    },
    {
      "epoch": 4.382134521536177,
      "grad_norm": 0.5234335222181209,
      "learning_rate": 3.531596128139988e-05,
      "loss": 1.2982,
      "num_input_tokens_seen": 32498159968,
      "step": 41306
    },
    {
      "epoch": 4.382240611075748,
      "grad_norm": 0.5017136137919603,
      "learning_rate": 3.5315328233863724e-05,
      "loss": 1.2516,
      "num_input_tokens_seen": 32498946672,
      "step": 41307
    },
    {
      "epoch": 4.38234670061532,
      "grad_norm": 0.7399802527986532,
      "learning_rate": 3.5314695178356186e-05,
      "loss": 1.311,
      "num_input_tokens_seen": 32499733376,
      "step": 41308
    },
    {
      "epoch": 4.382452790154891,
      "grad_norm": 0.604271067532993,
      "learning_rate": 3.531406211487774e-05,
      "loss": 1.2821,
      "num_input_tokens_seen": 32500520080,
      "step": 41309
    },
    {
      "epoch": 4.382558879694463,
      "grad_norm": 0.8077741634084586,
      "learning_rate": 3.531342904342891e-05,
      "loss": 1.2539,
      "num_input_tokens_seen": 32501306848,
      "step": 41310
    },
    {
      "epoch": 4.382664969234034,
      "grad_norm": 0.6198168278500059,
      "learning_rate": 3.531279596401016e-05,
      "loss": 1.3111,
      "num_input_tokens_seen": 32502093632,
      "step": 41311
    },
    {
      "epoch": 4.382771058773605,
      "grad_norm": 0.6660288262421792,
      "learning_rate": 3.5312162876621976e-05,
      "loss": 1.2802,
      "num_input_tokens_seen": 32502880432,
      "step": 41312
    },
    {
      "epoch": 4.3828771483131765,
      "grad_norm": 0.7387999401653296,
      "learning_rate": 3.5311529781264866e-05,
      "loss": 1.2398,
      "num_input_tokens_seen": 32503667232,
      "step": 41313
    },
    {
      "epoch": 4.382983237852748,
      "grad_norm": 0.5938126489411506,
      "learning_rate": 3.5310896677939296e-05,
      "loss": 1.3686,
      "num_input_tokens_seen": 32504454064,
      "step": 41314
    },
    {
      "epoch": 4.3830893273923195,
      "grad_norm": 0.7472324850524963,
      "learning_rate": 3.5310263566645775e-05,
      "loss": 1.4666,
      "num_input_tokens_seen": 32505240816,
      "step": 41315
    },
    {
      "epoch": 4.3831954169318905,
      "grad_norm": 0.9582219903615354,
      "learning_rate": 3.530963044738478e-05,
      "loss": 1.321,
      "num_input_tokens_seen": 32506027504,
      "step": 41316
    },
    {
      "epoch": 4.3833015064714616,
      "grad_norm": 0.5924702226674203,
      "learning_rate": 3.530899732015681e-05,
      "loss": 1.2152,
      "num_input_tokens_seen": 32506814384,
      "step": 41317
    },
    {
      "epoch": 4.3834075960110335,
      "grad_norm": 0.8131623953830396,
      "learning_rate": 3.5308364184962353e-05,
      "loss": 1.2728,
      "num_input_tokens_seen": 32507601104,
      "step": 41318
    },
    {
      "epoch": 4.3835136855506045,
      "grad_norm": 0.531614925330663,
      "learning_rate": 3.530773104180188e-05,
      "loss": 1.3132,
      "num_input_tokens_seen": 32508387904,
      "step": 41319
    },
    {
      "epoch": 4.383619775090176,
      "grad_norm": 0.6622883519355413,
      "learning_rate": 3.530709789067591e-05,
      "loss": 1.3334,
      "num_input_tokens_seen": 32509174592,
      "step": 41320
    },
    {
      "epoch": 4.3837258646297474,
      "grad_norm": 0.7877034093762011,
      "learning_rate": 3.530646473158491e-05,
      "loss": 1.3773,
      "num_input_tokens_seen": 32509961360,
      "step": 41321
    },
    {
      "epoch": 4.3838319541693185,
      "grad_norm": 0.522382550835087,
      "learning_rate": 3.530583156452938e-05,
      "loss": 1.215,
      "num_input_tokens_seen": 32510748192,
      "step": 41322
    },
    {
      "epoch": 4.38393804370889,
      "grad_norm": 0.6066337480455143,
      "learning_rate": 3.5305198389509805e-05,
      "loss": 1.2961,
      "num_input_tokens_seen": 32511534896,
      "step": 41323
    },
    {
      "epoch": 4.384044133248461,
      "grad_norm": 0.5672273414416812,
      "learning_rate": 3.530456520652667e-05,
      "loss": 1.3264,
      "num_input_tokens_seen": 32512321664,
      "step": 41324
    },
    {
      "epoch": 4.384150222788033,
      "grad_norm": 0.5647384358475513,
      "learning_rate": 3.530393201558047e-05,
      "loss": 1.318,
      "num_input_tokens_seen": 32513108416,
      "step": 41325
    },
    {
      "epoch": 4.384256312327604,
      "grad_norm": 0.7019080747108706,
      "learning_rate": 3.53032988166717e-05,
      "loss": 1.462,
      "num_input_tokens_seen": 32513895120,
      "step": 41326
    },
    {
      "epoch": 4.384362401867176,
      "grad_norm": 0.5415177205357984,
      "learning_rate": 3.530266560980084e-05,
      "loss": 1.1316,
      "num_input_tokens_seen": 32514681984,
      "step": 41327
    },
    {
      "epoch": 4.384468491406747,
      "grad_norm": 0.6691652571226988,
      "learning_rate": 3.530203239496838e-05,
      "loss": 1.3436,
      "num_input_tokens_seen": 32515468800,
      "step": 41328
    },
    {
      "epoch": 4.384574580946318,
      "grad_norm": 0.5023874998889905,
      "learning_rate": 3.530139917217482e-05,
      "loss": 1.3789,
      "num_input_tokens_seen": 32516255536,
      "step": 41329
    },
    {
      "epoch": 4.38468067048589,
      "grad_norm": 1.5081054547108146,
      "learning_rate": 3.530076594142063e-05,
      "loss": 1.2526,
      "num_input_tokens_seen": 32517042288,
      "step": 41330
    },
    {
      "epoch": 4.384786760025461,
      "grad_norm": 0.7924771974290482,
      "learning_rate": 3.530013270270632e-05,
      "loss": 1.1637,
      "num_input_tokens_seen": 32517829056,
      "step": 41331
    },
    {
      "epoch": 4.384892849565033,
      "grad_norm": 0.8734875747407792,
      "learning_rate": 3.529949945603236e-05,
      "loss": 1.2743,
      "num_input_tokens_seen": 32518615824,
      "step": 41332
    },
    {
      "epoch": 4.384998939104604,
      "grad_norm": 0.7079673739775031,
      "learning_rate": 3.5298866201399256e-05,
      "loss": 1.2912,
      "num_input_tokens_seen": 32519402608,
      "step": 41333
    },
    {
      "epoch": 4.385105028644175,
      "grad_norm": 0.9169624587324898,
      "learning_rate": 3.529823293880749e-05,
      "loss": 1.2995,
      "num_input_tokens_seen": 32520189392,
      "step": 41334
    },
    {
      "epoch": 4.385211118183747,
      "grad_norm": 0.5721510224334493,
      "learning_rate": 3.5297599668257546e-05,
      "loss": 1.3185,
      "num_input_tokens_seen": 32520976080,
      "step": 41335
    },
    {
      "epoch": 4.385317207723318,
      "grad_norm": 0.6964061684054937,
      "learning_rate": 3.529696638974992e-05,
      "loss": 1.3144,
      "num_input_tokens_seen": 32521762832,
      "step": 41336
    },
    {
      "epoch": 4.38542329726289,
      "grad_norm": 0.6452083550271334,
      "learning_rate": 3.529633310328511e-05,
      "loss": 1.3049,
      "num_input_tokens_seen": 32522549680,
      "step": 41337
    },
    {
      "epoch": 4.385529386802461,
      "grad_norm": 0.8337173148500244,
      "learning_rate": 3.529569980886359e-05,
      "loss": 1.3427,
      "num_input_tokens_seen": 32523336432,
      "step": 41338
    },
    {
      "epoch": 4.385635476342033,
      "grad_norm": 0.5031435662483418,
      "learning_rate": 3.529506650648585e-05,
      "loss": 1.3676,
      "num_input_tokens_seen": 32524123216,
      "step": 41339
    },
    {
      "epoch": 4.385741565881604,
      "grad_norm": 0.5824093855784773,
      "learning_rate": 3.5294433196152396e-05,
      "loss": 1.3394,
      "num_input_tokens_seen": 32524909920,
      "step": 41340
    },
    {
      "epoch": 4.385847655421175,
      "grad_norm": 0.5067196972508998,
      "learning_rate": 3.52937998778637e-05,
      "loss": 1.2045,
      "num_input_tokens_seen": 32525696608,
      "step": 41341
    },
    {
      "epoch": 4.385953744960747,
      "grad_norm": 0.5427849924260999,
      "learning_rate": 3.5293166551620256e-05,
      "loss": 1.3382,
      "num_input_tokens_seen": 32526483376,
      "step": 41342
    },
    {
      "epoch": 4.386059834500318,
      "grad_norm": 0.6048937653813768,
      "learning_rate": 3.5292533217422554e-05,
      "loss": 1.3206,
      "num_input_tokens_seen": 32527270128,
      "step": 41343
    },
    {
      "epoch": 4.38616592403989,
      "grad_norm": 0.5499691789318712,
      "learning_rate": 3.529189987527109e-05,
      "loss": 1.4277,
      "num_input_tokens_seen": 32528056912,
      "step": 41344
    },
    {
      "epoch": 4.386272013579461,
      "grad_norm": 0.5761376269068587,
      "learning_rate": 3.529126652516634e-05,
      "loss": 1.2492,
      "num_input_tokens_seen": 32528843616,
      "step": 41345
    },
    {
      "epoch": 4.386378103119032,
      "grad_norm": 0.5573548045856078,
      "learning_rate": 3.5290633167108814e-05,
      "loss": 1.3993,
      "num_input_tokens_seen": 32529630400,
      "step": 41346
    },
    {
      "epoch": 4.386484192658604,
      "grad_norm": 0.5244861406549511,
      "learning_rate": 3.5289999801098974e-05,
      "loss": 1.3433,
      "num_input_tokens_seen": 32530417088,
      "step": 41347
    },
    {
      "epoch": 4.386590282198175,
      "grad_norm": 0.535623960501498,
      "learning_rate": 3.528936642713733e-05,
      "loss": 1.3429,
      "num_input_tokens_seen": 32531203856,
      "step": 41348
    },
    {
      "epoch": 4.386696371737747,
      "grad_norm": 0.5705235286991613,
      "learning_rate": 3.528873304522437e-05,
      "loss": 1.4076,
      "num_input_tokens_seen": 32531990608,
      "step": 41349
    },
    {
      "epoch": 4.386802461277318,
      "grad_norm": 0.48432319565762133,
      "learning_rate": 3.5288099655360575e-05,
      "loss": 1.2967,
      "num_input_tokens_seen": 32532777344,
      "step": 41350
    },
    {
      "epoch": 4.386908550816889,
      "grad_norm": 0.5752356711643194,
      "learning_rate": 3.528746625754644e-05,
      "loss": 1.3068,
      "num_input_tokens_seen": 32533564144,
      "step": 41351
    },
    {
      "epoch": 4.387014640356461,
      "grad_norm": 0.5536912300765622,
      "learning_rate": 3.528683285178244e-05,
      "loss": 1.3015,
      "num_input_tokens_seen": 32534350944,
      "step": 41352
    },
    {
      "epoch": 4.387120729896032,
      "grad_norm": 0.5922817911482476,
      "learning_rate": 3.5286199438069094e-05,
      "loss": 1.3077,
      "num_input_tokens_seen": 32535137696,
      "step": 41353
    },
    {
      "epoch": 4.387226819435604,
      "grad_norm": 0.621618652342968,
      "learning_rate": 3.5285566016406866e-05,
      "loss": 1.3213,
      "num_input_tokens_seen": 32535924448,
      "step": 41354
    },
    {
      "epoch": 4.387332908975175,
      "grad_norm": 0.583694334463146,
      "learning_rate": 3.528493258679626e-05,
      "loss": 1.292,
      "num_input_tokens_seen": 32536711216,
      "step": 41355
    },
    {
      "epoch": 4.387438998514747,
      "grad_norm": 0.6553185725291382,
      "learning_rate": 3.528429914923776e-05,
      "loss": 1.3243,
      "num_input_tokens_seen": 32537497952,
      "step": 41356
    },
    {
      "epoch": 4.387545088054318,
      "grad_norm": 0.6713038887087498,
      "learning_rate": 3.528366570373185e-05,
      "loss": 1.3591,
      "num_input_tokens_seen": 32538284656,
      "step": 41357
    },
    {
      "epoch": 4.387651177593889,
      "grad_norm": 0.6808866339470894,
      "learning_rate": 3.528303225027903e-05,
      "loss": 1.4333,
      "num_input_tokens_seen": 32539071360,
      "step": 41358
    },
    {
      "epoch": 4.387757267133461,
      "grad_norm": 0.6445057964874816,
      "learning_rate": 3.5282398788879786e-05,
      "loss": 1.4471,
      "num_input_tokens_seen": 32539858112,
      "step": 41359
    },
    {
      "epoch": 4.387863356673032,
      "grad_norm": 0.72601809718551,
      "learning_rate": 3.5281765319534596e-05,
      "loss": 1.4114,
      "num_input_tokens_seen": 32540644848,
      "step": 41360
    },
    {
      "epoch": 4.387969446212604,
      "grad_norm": 0.5995101762851439,
      "learning_rate": 3.528113184224397e-05,
      "loss": 1.3492,
      "num_input_tokens_seen": 32541431632,
      "step": 41361
    },
    {
      "epoch": 4.388075535752175,
      "grad_norm": 1.155888905647046,
      "learning_rate": 3.528049835700838e-05,
      "loss": 1.4038,
      "num_input_tokens_seen": 32542218352,
      "step": 41362
    },
    {
      "epoch": 4.388181625291746,
      "grad_norm": 0.5439119912923143,
      "learning_rate": 3.527986486382832e-05,
      "loss": 1.3207,
      "num_input_tokens_seen": 32543005072,
      "step": 41363
    },
    {
      "epoch": 4.388287714831318,
      "grad_norm": 0.6159613955778114,
      "learning_rate": 3.527923136270428e-05,
      "loss": 1.2781,
      "num_input_tokens_seen": 32543791824,
      "step": 41364
    },
    {
      "epoch": 4.388393804370889,
      "grad_norm": 0.6416359796858009,
      "learning_rate": 3.527859785363677e-05,
      "loss": 1.3859,
      "num_input_tokens_seen": 32544578560,
      "step": 41365
    },
    {
      "epoch": 4.388499893910461,
      "grad_norm": 0.5693742010336772,
      "learning_rate": 3.5277964336626246e-05,
      "loss": 1.2678,
      "num_input_tokens_seen": 32545365344,
      "step": 41366
    },
    {
      "epoch": 4.388605983450032,
      "grad_norm": 0.8356436405190665,
      "learning_rate": 3.5277330811673215e-05,
      "loss": 1.4174,
      "num_input_tokens_seen": 32546152016,
      "step": 41367
    },
    {
      "epoch": 4.388712072989604,
      "grad_norm": 0.59022333531583,
      "learning_rate": 3.527669727877817e-05,
      "loss": 1.3162,
      "num_input_tokens_seen": 32546938768,
      "step": 41368
    },
    {
      "epoch": 4.388818162529175,
      "grad_norm": 0.6399473489947526,
      "learning_rate": 3.5276063737941587e-05,
      "loss": 1.3488,
      "num_input_tokens_seen": 32547725472,
      "step": 41369
    },
    {
      "epoch": 4.388924252068746,
      "grad_norm": 0.5966593159054796,
      "learning_rate": 3.527543018916397e-05,
      "loss": 1.3307,
      "num_input_tokens_seen": 32548512160,
      "step": 41370
    },
    {
      "epoch": 4.389030341608318,
      "grad_norm": 0.5628265206647793,
      "learning_rate": 3.52747966324458e-05,
      "loss": 1.3279,
      "num_input_tokens_seen": 32549298848,
      "step": 41371
    },
    {
      "epoch": 4.389136431147889,
      "grad_norm": 0.558747305017115,
      "learning_rate": 3.5274163067787566e-05,
      "loss": 1.2868,
      "num_input_tokens_seen": 32550085568,
      "step": 41372
    },
    {
      "epoch": 4.389242520687461,
      "grad_norm": 0.6030389017206649,
      "learning_rate": 3.527352949518976e-05,
      "loss": 1.3899,
      "num_input_tokens_seen": 32550872288,
      "step": 41373
    },
    {
      "epoch": 4.389348610227032,
      "grad_norm": 0.5651776829324798,
      "learning_rate": 3.527289591465288e-05,
      "loss": 1.2565,
      "num_input_tokens_seen": 32551659072,
      "step": 41374
    },
    {
      "epoch": 4.389454699766603,
      "grad_norm": 0.6893941451416336,
      "learning_rate": 3.52722623261774e-05,
      "loss": 1.3719,
      "num_input_tokens_seen": 32552445856,
      "step": 41375
    },
    {
      "epoch": 4.3895607893061745,
      "grad_norm": 0.5527040828729805,
      "learning_rate": 3.527162872976382e-05,
      "loss": 1.2764,
      "num_input_tokens_seen": 32553232656,
      "step": 41376
    },
    {
      "epoch": 4.389666878845746,
      "grad_norm": 0.6127421224735103,
      "learning_rate": 3.527099512541263e-05,
      "loss": 1.2719,
      "num_input_tokens_seen": 32554019520,
      "step": 41377
    },
    {
      "epoch": 4.3897729683853175,
      "grad_norm": 0.6646072145620666,
      "learning_rate": 3.5270361513124306e-05,
      "loss": 1.2752,
      "num_input_tokens_seen": 32554806320,
      "step": 41378
    },
    {
      "epoch": 4.3898790579248885,
      "grad_norm": 0.5300540420999671,
      "learning_rate": 3.5269727892899354e-05,
      "loss": 1.2687,
      "num_input_tokens_seen": 32555593072,
      "step": 41379
    },
    {
      "epoch": 4.38998514746446,
      "grad_norm": 0.5545639064415957,
      "learning_rate": 3.526909426473826e-05,
      "loss": 1.2456,
      "num_input_tokens_seen": 32556379808,
      "step": 41380
    },
    {
      "epoch": 4.3900912370040315,
      "grad_norm": 1.230788953645361,
      "learning_rate": 3.52684606286415e-05,
      "loss": 1.2938,
      "num_input_tokens_seen": 32557166544,
      "step": 41381
    },
    {
      "epoch": 4.3901973265436025,
      "grad_norm": 0.5755145243891601,
      "learning_rate": 3.526782698460959e-05,
      "loss": 1.3632,
      "num_input_tokens_seen": 32557953264,
      "step": 41382
    },
    {
      "epoch": 4.390303416083174,
      "grad_norm": 1.417075548778246,
      "learning_rate": 3.5267193332643e-05,
      "loss": 1.3671,
      "num_input_tokens_seen": 32558740016,
      "step": 41383
    },
    {
      "epoch": 4.3904095056227455,
      "grad_norm": 0.8572633275772096,
      "learning_rate": 3.526655967274222e-05,
      "loss": 1.3531,
      "num_input_tokens_seen": 32559526720,
      "step": 41384
    },
    {
      "epoch": 4.390515595162317,
      "grad_norm": 0.5077251085160513,
      "learning_rate": 3.5265926004907745e-05,
      "loss": 1.2883,
      "num_input_tokens_seen": 32560313520,
      "step": 41385
    },
    {
      "epoch": 4.390621684701888,
      "grad_norm": 0.8541634603003023,
      "learning_rate": 3.5265292329140063e-05,
      "loss": 1.2094,
      "num_input_tokens_seen": 32561100288,
      "step": 41386
    },
    {
      "epoch": 4.390727774241459,
      "grad_norm": 1.0621238148878749,
      "learning_rate": 3.526465864543967e-05,
      "loss": 1.3357,
      "num_input_tokens_seen": 32561886976,
      "step": 41387
    },
    {
      "epoch": 4.390833863781031,
      "grad_norm": 0.7398460247418491,
      "learning_rate": 3.5264024953807046e-05,
      "loss": 1.4042,
      "num_input_tokens_seen": 32562673664,
      "step": 41388
    },
    {
      "epoch": 4.390939953320602,
      "grad_norm": 0.9702479851361634,
      "learning_rate": 3.5263391254242686e-05,
      "loss": 1.2349,
      "num_input_tokens_seen": 32563460448,
      "step": 41389
    },
    {
      "epoch": 4.391046042860174,
      "grad_norm": 0.6168625767870228,
      "learning_rate": 3.526275754674707e-05,
      "loss": 1.3121,
      "num_input_tokens_seen": 32564247184,
      "step": 41390
    },
    {
      "epoch": 4.391152132399745,
      "grad_norm": 0.7608610121656241,
      "learning_rate": 3.526212383132071e-05,
      "loss": 1.4373,
      "num_input_tokens_seen": 32565033936,
      "step": 41391
    },
    {
      "epoch": 4.391258221939317,
      "grad_norm": 0.884524742798647,
      "learning_rate": 3.526149010796408e-05,
      "loss": 1.2867,
      "num_input_tokens_seen": 32565820752,
      "step": 41392
    },
    {
      "epoch": 4.391364311478888,
      "grad_norm": 0.6971093948006819,
      "learning_rate": 3.526085637667766e-05,
      "loss": 1.3785,
      "num_input_tokens_seen": 32566607568,
      "step": 41393
    },
    {
      "epoch": 4.391470401018459,
      "grad_norm": 0.7973440185644859,
      "learning_rate": 3.526022263746196e-05,
      "loss": 1.2662,
      "num_input_tokens_seen": 32567394272,
      "step": 41394
    },
    {
      "epoch": 4.391576490558031,
      "grad_norm": 0.6233539263881991,
      "learning_rate": 3.525958889031745e-05,
      "loss": 1.3123,
      "num_input_tokens_seen": 32568181104,
      "step": 41395
    },
    {
      "epoch": 4.391682580097602,
      "grad_norm": 0.7159341917879664,
      "learning_rate": 3.5258955135244645e-05,
      "loss": 1.4319,
      "num_input_tokens_seen": 32568967856,
      "step": 41396
    },
    {
      "epoch": 4.391788669637174,
      "grad_norm": 0.7292987884738035,
      "learning_rate": 3.5258321372244016e-05,
      "loss": 1.2588,
      "num_input_tokens_seen": 32569754608,
      "step": 41397
    },
    {
      "epoch": 4.391894759176745,
      "grad_norm": 0.6707353967973705,
      "learning_rate": 3.525768760131606e-05,
      "loss": 1.2588,
      "num_input_tokens_seen": 32570541424,
      "step": 41398
    },
    {
      "epoch": 4.392000848716316,
      "grad_norm": 0.6710122336264466,
      "learning_rate": 3.5257053822461256e-05,
      "loss": 1.363,
      "num_input_tokens_seen": 32571328160,
      "step": 41399
    },
    {
      "epoch": 4.392106938255888,
      "grad_norm": 0.6348192474065848,
      "learning_rate": 3.525642003568011e-05,
      "loss": 1.3908,
      "num_input_tokens_seen": 32572114896,
      "step": 41400
    },
    {
      "epoch": 4.392213027795459,
      "grad_norm": 0.6424944439069601,
      "learning_rate": 3.52557862409731e-05,
      "loss": 1.2448,
      "num_input_tokens_seen": 32572901696,
      "step": 41401
    },
    {
      "epoch": 4.392319117335031,
      "grad_norm": 0.5330940627898607,
      "learning_rate": 3.525515243834072e-05,
      "loss": 1.3066,
      "num_input_tokens_seen": 32573688400,
      "step": 41402
    },
    {
      "epoch": 4.392425206874602,
      "grad_norm": 0.7418719895229584,
      "learning_rate": 3.525451862778346e-05,
      "loss": 1.2863,
      "num_input_tokens_seen": 32574475216,
      "step": 41403
    },
    {
      "epoch": 4.392531296414173,
      "grad_norm": 0.6627054237595377,
      "learning_rate": 3.5253884809301805e-05,
      "loss": 1.3026,
      "num_input_tokens_seen": 32575262000,
      "step": 41404
    },
    {
      "epoch": 4.392637385953745,
      "grad_norm": 0.6592621845923383,
      "learning_rate": 3.5253250982896246e-05,
      "loss": 1.2948,
      "num_input_tokens_seen": 32576048752,
      "step": 41405
    },
    {
      "epoch": 4.392743475493316,
      "grad_norm": 0.6141342839737908,
      "learning_rate": 3.5252617148567284e-05,
      "loss": 1.3073,
      "num_input_tokens_seen": 32576835536,
      "step": 41406
    },
    {
      "epoch": 4.392849565032888,
      "grad_norm": 0.6636459776055912,
      "learning_rate": 3.525198330631539e-05,
      "loss": 1.2888,
      "num_input_tokens_seen": 32577622288,
      "step": 41407
    },
    {
      "epoch": 4.392955654572459,
      "grad_norm": 0.5500719281384775,
      "learning_rate": 3.525134945614107e-05,
      "loss": 1.2601,
      "num_input_tokens_seen": 32578409056,
      "step": 41408
    },
    {
      "epoch": 4.39306174411203,
      "grad_norm": 0.9132831483711839,
      "learning_rate": 3.525071559804481e-05,
      "loss": 1.3319,
      "num_input_tokens_seen": 32579195728,
      "step": 41409
    },
    {
      "epoch": 4.393167833651602,
      "grad_norm": 0.5029398095974124,
      "learning_rate": 3.5250081732027094e-05,
      "loss": 1.2173,
      "num_input_tokens_seen": 32579982448,
      "step": 41410
    },
    {
      "epoch": 4.393273923191173,
      "grad_norm": 0.7357255832957655,
      "learning_rate": 3.524944785808842e-05,
      "loss": 1.309,
      "num_input_tokens_seen": 32580769232,
      "step": 41411
    },
    {
      "epoch": 4.393380012730745,
      "grad_norm": 1.1636524561521824,
      "learning_rate": 3.524881397622927e-05,
      "loss": 1.3403,
      "num_input_tokens_seen": 32581556048,
      "step": 41412
    },
    {
      "epoch": 4.393486102270316,
      "grad_norm": 0.6165345133152419,
      "learning_rate": 3.524818008645014e-05,
      "loss": 1.2596,
      "num_input_tokens_seen": 32582342672,
      "step": 41413
    },
    {
      "epoch": 4.393592191809888,
      "grad_norm": 1.172769454203879,
      "learning_rate": 3.524754618875151e-05,
      "loss": 1.3385,
      "num_input_tokens_seen": 32583129344,
      "step": 41414
    },
    {
      "epoch": 4.393698281349459,
      "grad_norm": 0.7715161120448223,
      "learning_rate": 3.5246912283133884e-05,
      "loss": 1.4689,
      "num_input_tokens_seen": 32583916144,
      "step": 41415
    },
    {
      "epoch": 4.39380437088903,
      "grad_norm": 1.0123113502649839,
      "learning_rate": 3.5246278369597746e-05,
      "loss": 1.2959,
      "num_input_tokens_seen": 32584702928,
      "step": 41416
    },
    {
      "epoch": 4.393910460428602,
      "grad_norm": 0.6653517117105465,
      "learning_rate": 3.5245644448143584e-05,
      "loss": 1.25,
      "num_input_tokens_seen": 32585489648,
      "step": 41417
    },
    {
      "epoch": 4.394016549968173,
      "grad_norm": 0.6637367727894012,
      "learning_rate": 3.524501051877189e-05,
      "loss": 1.3123,
      "num_input_tokens_seen": 32586276448,
      "step": 41418
    },
    {
      "epoch": 4.394122639507745,
      "grad_norm": 0.7102026824271612,
      "learning_rate": 3.524437658148314e-05,
      "loss": 1.2318,
      "num_input_tokens_seen": 32587063280,
      "step": 41419
    },
    {
      "epoch": 4.394228729047316,
      "grad_norm": 1.2647474990625294,
      "learning_rate": 3.524374263627785e-05,
      "loss": 1.3452,
      "num_input_tokens_seen": 32587850032,
      "step": 41420
    },
    {
      "epoch": 4.394334818586888,
      "grad_norm": 0.7941144365410404,
      "learning_rate": 3.52431086831565e-05,
      "loss": 1.3661,
      "num_input_tokens_seen": 32588636784,
      "step": 41421
    },
    {
      "epoch": 4.394440908126459,
      "grad_norm": 0.6991923584836288,
      "learning_rate": 3.5242474722119564e-05,
      "loss": 1.2595,
      "num_input_tokens_seen": 32589423584,
      "step": 41422
    },
    {
      "epoch": 4.39454699766603,
      "grad_norm": 1.2144196409896564,
      "learning_rate": 3.524184075316754e-05,
      "loss": 1.4078,
      "num_input_tokens_seen": 32590210304,
      "step": 41423
    },
    {
      "epoch": 4.394653087205602,
      "grad_norm": 0.9454859493201847,
      "learning_rate": 3.524120677630093e-05,
      "loss": 1.3999,
      "num_input_tokens_seen": 32590997024,
      "step": 41424
    },
    {
      "epoch": 4.394759176745173,
      "grad_norm": 0.7696546795858554,
      "learning_rate": 3.524057279152022e-05,
      "loss": 1.2623,
      "num_input_tokens_seen": 32591783760,
      "step": 41425
    },
    {
      "epoch": 4.394865266284745,
      "grad_norm": 1.1617051803673357,
      "learning_rate": 3.5239938798825895e-05,
      "loss": 1.3037,
      "num_input_tokens_seen": 32592570560,
      "step": 41426
    },
    {
      "epoch": 4.394971355824316,
      "grad_norm": 0.8082622214585723,
      "learning_rate": 3.523930479821844e-05,
      "loss": 1.3086,
      "num_input_tokens_seen": 32593357312,
      "step": 41427
    },
    {
      "epoch": 4.395077445363887,
      "grad_norm": 0.7549086730240613,
      "learning_rate": 3.5238670789698354e-05,
      "loss": 1.3316,
      "num_input_tokens_seen": 32594144048,
      "step": 41428
    },
    {
      "epoch": 4.395183534903459,
      "grad_norm": 1.0567003664971049,
      "learning_rate": 3.5238036773266124e-05,
      "loss": 1.2606,
      "num_input_tokens_seen": 32594930896,
      "step": 41429
    },
    {
      "epoch": 4.39528962444303,
      "grad_norm": 0.8967557841136116,
      "learning_rate": 3.523740274892224e-05,
      "loss": 1.377,
      "num_input_tokens_seen": 32595717776,
      "step": 41430
    },
    {
      "epoch": 4.395395713982602,
      "grad_norm": 0.8328536918169356,
      "learning_rate": 3.523676871666719e-05,
      "loss": 1.3513,
      "num_input_tokens_seen": 32596504592,
      "step": 41431
    },
    {
      "epoch": 4.395501803522173,
      "grad_norm": 1.0316482223793446,
      "learning_rate": 3.5236134676501463e-05,
      "loss": 1.2639,
      "num_input_tokens_seen": 32597291344,
      "step": 41432
    },
    {
      "epoch": 4.395607893061744,
      "grad_norm": 0.7172809265701074,
      "learning_rate": 3.523550062842555e-05,
      "loss": 1.33,
      "num_input_tokens_seen": 32598078032,
      "step": 41433
    },
    {
      "epoch": 4.395713982601316,
      "grad_norm": 0.5741880019580428,
      "learning_rate": 3.5234866572439954e-05,
      "loss": 1.2369,
      "num_input_tokens_seen": 32598864800,
      "step": 41434
    },
    {
      "epoch": 4.395820072140887,
      "grad_norm": 1.0955393679040748,
      "learning_rate": 3.523423250854515e-05,
      "loss": 1.3388,
      "num_input_tokens_seen": 32599651472,
      "step": 41435
    },
    {
      "epoch": 4.395926161680459,
      "grad_norm": 0.6426843750171325,
      "learning_rate": 3.523359843674162e-05,
      "loss": 1.2956,
      "num_input_tokens_seen": 32600438256,
      "step": 41436
    },
    {
      "epoch": 4.39603225122003,
      "grad_norm": 0.5951834414260202,
      "learning_rate": 3.523296435702988e-05,
      "loss": 1.2546,
      "num_input_tokens_seen": 32601224960,
      "step": 41437
    },
    {
      "epoch": 4.396138340759601,
      "grad_norm": 0.5755976081477718,
      "learning_rate": 3.523233026941038e-05,
      "loss": 1.3484,
      "num_input_tokens_seen": 32602011872,
      "step": 41438
    },
    {
      "epoch": 4.396244430299173,
      "grad_norm": 0.8628144224088165,
      "learning_rate": 3.5231696173883666e-05,
      "loss": 1.4169,
      "num_input_tokens_seen": 32602798672,
      "step": 41439
    },
    {
      "epoch": 4.396350519838744,
      "grad_norm": 0.6819029147261008,
      "learning_rate": 3.523106207045018e-05,
      "loss": 1.4002,
      "num_input_tokens_seen": 32603585408,
      "step": 41440
    },
    {
      "epoch": 4.3964566093783155,
      "grad_norm": 0.6202534516303952,
      "learning_rate": 3.523042795911044e-05,
      "loss": 1.3391,
      "num_input_tokens_seen": 32604372112,
      "step": 41441
    },
    {
      "epoch": 4.3965626989178865,
      "grad_norm": 0.8332846035068165,
      "learning_rate": 3.5229793839864914e-05,
      "loss": 1.2412,
      "num_input_tokens_seen": 32605158896,
      "step": 41442
    },
    {
      "epoch": 4.3966687884574585,
      "grad_norm": 0.6786462429349183,
      "learning_rate": 3.5229159712714114e-05,
      "loss": 1.3809,
      "num_input_tokens_seen": 32605945648,
      "step": 41443
    },
    {
      "epoch": 4.3967748779970295,
      "grad_norm": 0.5608998909072263,
      "learning_rate": 3.522852557765851e-05,
      "loss": 1.3431,
      "num_input_tokens_seen": 32606732432,
      "step": 41444
    },
    {
      "epoch": 4.3968809675366005,
      "grad_norm": 0.7634985441258392,
      "learning_rate": 3.5227891434698614e-05,
      "loss": 1.2213,
      "num_input_tokens_seen": 32607519200,
      "step": 41445
    },
    {
      "epoch": 4.396987057076172,
      "grad_norm": 0.6958847510692552,
      "learning_rate": 3.522725728383489e-05,
      "loss": 1.303,
      "num_input_tokens_seen": 32608306000,
      "step": 41446
    },
    {
      "epoch": 4.3970931466157435,
      "grad_norm": 0.6401585541567272,
      "learning_rate": 3.5226623125067846e-05,
      "loss": 1.3501,
      "num_input_tokens_seen": 32609092784,
      "step": 41447
    },
    {
      "epoch": 4.397199236155315,
      "grad_norm": 0.6138732105211647,
      "learning_rate": 3.522598895839797e-05,
      "loss": 1.2386,
      "num_input_tokens_seen": 32609879520,
      "step": 41448
    },
    {
      "epoch": 4.397305325694886,
      "grad_norm": 0.5772258869141753,
      "learning_rate": 3.5225354783825754e-05,
      "loss": 1.3853,
      "num_input_tokens_seen": 32610666256,
      "step": 41449
    },
    {
      "epoch": 4.397411415234458,
      "grad_norm": 0.5959653055213971,
      "learning_rate": 3.5224720601351674e-05,
      "loss": 1.3828,
      "num_input_tokens_seen": 32611453040,
      "step": 41450
    },
    {
      "epoch": 4.397517504774029,
      "grad_norm": 0.7504890424023211,
      "learning_rate": 3.5224086410976234e-05,
      "loss": 1.2638,
      "num_input_tokens_seen": 32612239872,
      "step": 41451
    },
    {
      "epoch": 4.3976235943136,
      "grad_norm": 0.923639049840823,
      "learning_rate": 3.522345221269993e-05,
      "loss": 1.3999,
      "num_input_tokens_seen": 32613026544,
      "step": 41452
    },
    {
      "epoch": 4.397729683853172,
      "grad_norm": 0.6655202787820569,
      "learning_rate": 3.522281800652323e-05,
      "loss": 1.2443,
      "num_input_tokens_seen": 32613813328,
      "step": 41453
    },
    {
      "epoch": 4.397835773392743,
      "grad_norm": 0.654463566200707,
      "learning_rate": 3.522218379244664e-05,
      "loss": 1.278,
      "num_input_tokens_seen": 32614600160,
      "step": 41454
    },
    {
      "epoch": 4.397941862932315,
      "grad_norm": 0.7108264904532862,
      "learning_rate": 3.522154957047064e-05,
      "loss": 1.3775,
      "num_input_tokens_seen": 32615386912,
      "step": 41455
    },
    {
      "epoch": 4.398047952471886,
      "grad_norm": 0.6626664144667413,
      "learning_rate": 3.522091534059573e-05,
      "loss": 1.3493,
      "num_input_tokens_seen": 32616173712,
      "step": 41456
    },
    {
      "epoch": 4.398154042011457,
      "grad_norm": 0.5891102327544778,
      "learning_rate": 3.522028110282241e-05,
      "loss": 1.3012,
      "num_input_tokens_seen": 32616960496,
      "step": 41457
    },
    {
      "epoch": 4.398260131551029,
      "grad_norm": 0.5732903282948667,
      "learning_rate": 3.521964685715113e-05,
      "loss": 1.3138,
      "num_input_tokens_seen": 32617747232,
      "step": 41458
    },
    {
      "epoch": 4.3983662210906,
      "grad_norm": 0.5378470184066695,
      "learning_rate": 3.5219012603582426e-05,
      "loss": 1.331,
      "num_input_tokens_seen": 32618534064,
      "step": 41459
    },
    {
      "epoch": 4.398472310630172,
      "grad_norm": 0.5449137361666939,
      "learning_rate": 3.5218378342116765e-05,
      "loss": 1.3144,
      "num_input_tokens_seen": 32619320832,
      "step": 41460
    },
    {
      "epoch": 4.398578400169743,
      "grad_norm": 0.5440570463491109,
      "learning_rate": 3.521774407275464e-05,
      "loss": 1.3634,
      "num_input_tokens_seen": 32620107552,
      "step": 41461
    },
    {
      "epoch": 4.398684489709314,
      "grad_norm": 0.6096110151738324,
      "learning_rate": 3.5217109795496546e-05,
      "loss": 1.3222,
      "num_input_tokens_seen": 32620894352,
      "step": 41462
    },
    {
      "epoch": 4.398790579248886,
      "grad_norm": 0.4970441094755269,
      "learning_rate": 3.5216475510342964e-05,
      "loss": 1.2874,
      "num_input_tokens_seen": 32621681088,
      "step": 41463
    },
    {
      "epoch": 4.398896668788457,
      "grad_norm": 0.5441647568894267,
      "learning_rate": 3.521584121729439e-05,
      "loss": 1.3455,
      "num_input_tokens_seen": 32622467872,
      "step": 41464
    },
    {
      "epoch": 4.399002758328029,
      "grad_norm": 0.5688477407412678,
      "learning_rate": 3.5215206916351316e-05,
      "loss": 1.2376,
      "num_input_tokens_seen": 32623254688,
      "step": 41465
    },
    {
      "epoch": 4.3991088478676,
      "grad_norm": 0.6356337200043206,
      "learning_rate": 3.521457260751423e-05,
      "loss": 1.2433,
      "num_input_tokens_seen": 32624041392,
      "step": 41466
    },
    {
      "epoch": 4.399214937407172,
      "grad_norm": 0.6571649884139404,
      "learning_rate": 3.521393829078362e-05,
      "loss": 1.3539,
      "num_input_tokens_seen": 32624828064,
      "step": 41467
    },
    {
      "epoch": 4.399321026946743,
      "grad_norm": 0.5804303655232707,
      "learning_rate": 3.5213303966159985e-05,
      "loss": 1.3931,
      "num_input_tokens_seen": 32625614912,
      "step": 41468
    },
    {
      "epoch": 4.399427116486314,
      "grad_norm": 0.6109438363476338,
      "learning_rate": 3.5212669633643804e-05,
      "loss": 1.2904,
      "num_input_tokens_seen": 32626401728,
      "step": 41469
    },
    {
      "epoch": 4.399533206025886,
      "grad_norm": 0.5444339907171217,
      "learning_rate": 3.521203529323556e-05,
      "loss": 1.3537,
      "num_input_tokens_seen": 32627188496,
      "step": 41470
    },
    {
      "epoch": 4.399639295565457,
      "grad_norm": 0.6362789570930958,
      "learning_rate": 3.5211400944935766e-05,
      "loss": 1.3997,
      "num_input_tokens_seen": 32627975184,
      "step": 41471
    },
    {
      "epoch": 4.399745385105029,
      "grad_norm": 0.5189788905898187,
      "learning_rate": 3.5210766588744906e-05,
      "loss": 1.3315,
      "num_input_tokens_seen": 32628761968,
      "step": 41472
    },
    {
      "epoch": 4.3998514746446,
      "grad_norm": 0.5612250312764508,
      "learning_rate": 3.521013222466346e-05,
      "loss": 1.2514,
      "num_input_tokens_seen": 32629548704,
      "step": 41473
    },
    {
      "epoch": 4.399957564184171,
      "grad_norm": 0.5251322790355469,
      "learning_rate": 3.520949785269192e-05,
      "loss": 1.3631,
      "num_input_tokens_seen": 32630335504,
      "step": 41474
    },
    {
      "epoch": 4.400063653723743,
      "grad_norm": 0.5036265754731222,
      "learning_rate": 3.5208863472830786e-05,
      "loss": 1.2652,
      "num_input_tokens_seen": 32631122368,
      "step": 41475
    },
    {
      "epoch": 4.400169743263314,
      "grad_norm": 0.5696975686080441,
      "learning_rate": 3.5208229085080535e-05,
      "loss": 1.2795,
      "num_input_tokens_seen": 32631909200,
      "step": 41476
    },
    {
      "epoch": 4.400275832802886,
      "grad_norm": 0.6250492175008894,
      "learning_rate": 3.520759468944167e-05,
      "loss": 1.3154,
      "num_input_tokens_seen": 32632696000,
      "step": 41477
    },
    {
      "epoch": 4.400381922342457,
      "grad_norm": 0.6222612123579833,
      "learning_rate": 3.520696028591468e-05,
      "loss": 1.3823,
      "num_input_tokens_seen": 32633482688,
      "step": 41478
    },
    {
      "epoch": 4.400488011882029,
      "grad_norm": 0.5785804992332921,
      "learning_rate": 3.5206325874500034e-05,
      "loss": 1.2344,
      "num_input_tokens_seen": 32634269424,
      "step": 41479
    },
    {
      "epoch": 4.4005941014216,
      "grad_norm": 0.5534405206210274,
      "learning_rate": 3.5205691455198246e-05,
      "loss": 1.2928,
      "num_input_tokens_seen": 32635056160,
      "step": 41480
    },
    {
      "epoch": 4.400700190961171,
      "grad_norm": 0.5937471903251473,
      "learning_rate": 3.52050570280098e-05,
      "loss": 1.3675,
      "num_input_tokens_seen": 32635842960,
      "step": 41481
    },
    {
      "epoch": 4.400806280500743,
      "grad_norm": 0.6101973250304648,
      "learning_rate": 3.520442259293519e-05,
      "loss": 1.4241,
      "num_input_tokens_seen": 32636629664,
      "step": 41482
    },
    {
      "epoch": 4.400912370040314,
      "grad_norm": 0.5830768358622785,
      "learning_rate": 3.52037881499749e-05,
      "loss": 1.3576,
      "num_input_tokens_seen": 32637416432,
      "step": 41483
    },
    {
      "epoch": 4.401018459579886,
      "grad_norm": 0.5719862806208131,
      "learning_rate": 3.5203153699129414e-05,
      "loss": 1.2929,
      "num_input_tokens_seen": 32638203232,
      "step": 41484
    },
    {
      "epoch": 4.401124549119457,
      "grad_norm": 0.47693518866588763,
      "learning_rate": 3.520251924039924e-05,
      "loss": 1.3498,
      "num_input_tokens_seen": 32638990032,
      "step": 41485
    },
    {
      "epoch": 4.401230638659028,
      "grad_norm": 0.5014456750022392,
      "learning_rate": 3.5201884773784854e-05,
      "loss": 1.2367,
      "num_input_tokens_seen": 32639776832,
      "step": 41486
    },
    {
      "epoch": 4.4013367281986,
      "grad_norm": 0.5529307015299414,
      "learning_rate": 3.5201250299286753e-05,
      "loss": 1.4354,
      "num_input_tokens_seen": 32640563520,
      "step": 41487
    },
    {
      "epoch": 4.401442817738171,
      "grad_norm": 0.46611168760884436,
      "learning_rate": 3.5200615816905426e-05,
      "loss": 1.299,
      "num_input_tokens_seen": 32641350240,
      "step": 41488
    },
    {
      "epoch": 4.401548907277743,
      "grad_norm": 0.4882367535537011,
      "learning_rate": 3.519998132664136e-05,
      "loss": 1.3263,
      "num_input_tokens_seen": 32642136960,
      "step": 41489
    },
    {
      "epoch": 4.401654996817314,
      "grad_norm": 0.607413078716025,
      "learning_rate": 3.519934682849505e-05,
      "loss": 1.1994,
      "num_input_tokens_seen": 32642923776,
      "step": 41490
    },
    {
      "epoch": 4.401761086356885,
      "grad_norm": 0.6674663343963502,
      "learning_rate": 3.519871232246697e-05,
      "loss": 1.2709,
      "num_input_tokens_seen": 32643710592,
      "step": 41491
    },
    {
      "epoch": 4.401867175896457,
      "grad_norm": 0.5205586583779706,
      "learning_rate": 3.519807780855764e-05,
      "loss": 1.3626,
      "num_input_tokens_seen": 32644497312,
      "step": 41492
    },
    {
      "epoch": 4.401973265436028,
      "grad_norm": 0.5108297949354038,
      "learning_rate": 3.519744328676753e-05,
      "loss": 1.3312,
      "num_input_tokens_seen": 32645283984,
      "step": 41493
    },
    {
      "epoch": 4.4020793549756,
      "grad_norm": 0.656821490939625,
      "learning_rate": 3.519680875709715e-05,
      "loss": 1.3071,
      "num_input_tokens_seen": 32646070704,
      "step": 41494
    },
    {
      "epoch": 4.402185444515171,
      "grad_norm": 0.6120243723571647,
      "learning_rate": 3.519617421954695e-05,
      "loss": 1.333,
      "num_input_tokens_seen": 32646857520,
      "step": 41495
    },
    {
      "epoch": 4.402291534054743,
      "grad_norm": 0.49743658318138473,
      "learning_rate": 3.519553967411746e-05,
      "loss": 1.2045,
      "num_input_tokens_seen": 32647644288,
      "step": 41496
    },
    {
      "epoch": 4.402397623594314,
      "grad_norm": 0.6321369142522788,
      "learning_rate": 3.519490512080915e-05,
      "loss": 1.2362,
      "num_input_tokens_seen": 32648431088,
      "step": 41497
    },
    {
      "epoch": 4.402503713133885,
      "grad_norm": 0.5984679999645943,
      "learning_rate": 3.519427055962252e-05,
      "loss": 1.2638,
      "num_input_tokens_seen": 32649218064,
      "step": 41498
    },
    {
      "epoch": 4.402609802673457,
      "grad_norm": 0.6316751299083417,
      "learning_rate": 3.519363599055806e-05,
      "loss": 1.3651,
      "num_input_tokens_seen": 32650004880,
      "step": 41499
    },
    {
      "epoch": 4.402715892213028,
      "grad_norm": 0.5496469606501332,
      "learning_rate": 3.5193001413616254e-05,
      "loss": 1.2653,
      "num_input_tokens_seen": 32650791680,
      "step": 41500
    },
    {
      "epoch": 4.4028219817525995,
      "grad_norm": 0.5722485535986634,
      "learning_rate": 3.519236682879759e-05,
      "loss": 1.2952,
      "num_input_tokens_seen": 32651578400,
      "step": 41501
    },
    {
      "epoch": 4.402928071292171,
      "grad_norm": 0.5721163897561792,
      "learning_rate": 3.519173223610257e-05,
      "loss": 1.3784,
      "num_input_tokens_seen": 32652365136,
      "step": 41502
    },
    {
      "epoch": 4.403034160831742,
      "grad_norm": 0.5786701108563682,
      "learning_rate": 3.519109763553168e-05,
      "loss": 1.3165,
      "num_input_tokens_seen": 32653151904,
      "step": 41503
    },
    {
      "epoch": 4.4031402503713135,
      "grad_norm": 0.503786360018425,
      "learning_rate": 3.519046302708541e-05,
      "loss": 1.2653,
      "num_input_tokens_seen": 32653938704,
      "step": 41504
    },
    {
      "epoch": 4.4032463399108845,
      "grad_norm": 0.5378198514145893,
      "learning_rate": 3.518982841076424e-05,
      "loss": 1.3596,
      "num_input_tokens_seen": 32654725456,
      "step": 41505
    },
    {
      "epoch": 4.4033524294504565,
      "grad_norm": 0.5075804267872611,
      "learning_rate": 3.518919378656867e-05,
      "loss": 1.2268,
      "num_input_tokens_seen": 32655512224,
      "step": 41506
    },
    {
      "epoch": 4.4034585189900275,
      "grad_norm": 0.5264775413110196,
      "learning_rate": 3.51885591544992e-05,
      "loss": 1.2953,
      "num_input_tokens_seen": 32656299024,
      "step": 41507
    },
    {
      "epoch": 4.403564608529599,
      "grad_norm": 0.49445139259569226,
      "learning_rate": 3.51879245145563e-05,
      "loss": 1.3432,
      "num_input_tokens_seen": 32657085744,
      "step": 41508
    },
    {
      "epoch": 4.40367069806917,
      "grad_norm": 0.660242835772676,
      "learning_rate": 3.518728986674048e-05,
      "loss": 1.2345,
      "num_input_tokens_seen": 32657872576,
      "step": 41509
    },
    {
      "epoch": 4.4037767876087415,
      "grad_norm": 0.5859612267861823,
      "learning_rate": 3.5186655211052215e-05,
      "loss": 1.3517,
      "num_input_tokens_seen": 32658659312,
      "step": 41510
    },
    {
      "epoch": 4.403882877148313,
      "grad_norm": 0.5184789584941386,
      "learning_rate": 3.5186020547492e-05,
      "loss": 1.3446,
      "num_input_tokens_seen": 32659446144,
      "step": 41511
    },
    {
      "epoch": 4.403988966687884,
      "grad_norm": 0.7076425972534537,
      "learning_rate": 3.518538587606034e-05,
      "loss": 1.2835,
      "num_input_tokens_seen": 32660232928,
      "step": 41512
    },
    {
      "epoch": 4.404095056227456,
      "grad_norm": 0.4736358722282753,
      "learning_rate": 3.5184751196757705e-05,
      "loss": 1.2331,
      "num_input_tokens_seen": 32661019664,
      "step": 41513
    },
    {
      "epoch": 4.404201145767027,
      "grad_norm": 0.4664417737780088,
      "learning_rate": 3.5184116509584594e-05,
      "loss": 1.2999,
      "num_input_tokens_seen": 32661806464,
      "step": 41514
    },
    {
      "epoch": 4.404307235306598,
      "grad_norm": 0.5061978977327056,
      "learning_rate": 3.5183481814541496e-05,
      "loss": 1.2742,
      "num_input_tokens_seen": 32662593216,
      "step": 41515
    },
    {
      "epoch": 4.40441332484617,
      "grad_norm": 0.7110567624864401,
      "learning_rate": 3.51828471116289e-05,
      "loss": 1.2478,
      "num_input_tokens_seen": 32663380032,
      "step": 41516
    },
    {
      "epoch": 4.404519414385741,
      "grad_norm": 0.46485568338281574,
      "learning_rate": 3.51822124008473e-05,
      "loss": 1.2498,
      "num_input_tokens_seen": 32664166800,
      "step": 41517
    },
    {
      "epoch": 4.404625503925313,
      "grad_norm": 0.6789656317365764,
      "learning_rate": 3.5181577682197184e-05,
      "loss": 1.2521,
      "num_input_tokens_seen": 32664953488,
      "step": 41518
    },
    {
      "epoch": 4.404731593464884,
      "grad_norm": 0.8714178249896735,
      "learning_rate": 3.518094295567904e-05,
      "loss": 1.3261,
      "num_input_tokens_seen": 32665740256,
      "step": 41519
    },
    {
      "epoch": 4.404837683004455,
      "grad_norm": 0.5279430465903295,
      "learning_rate": 3.518030822129337e-05,
      "loss": 1.223,
      "num_input_tokens_seen": 32666526960,
      "step": 41520
    },
    {
      "epoch": 4.404943772544027,
      "grad_norm": 0.9823067409192363,
      "learning_rate": 3.517967347904065e-05,
      "loss": 1.3475,
      "num_input_tokens_seen": 32667313664,
      "step": 41521
    },
    {
      "epoch": 4.405049862083598,
      "grad_norm": 0.4983490721396674,
      "learning_rate": 3.517903872892138e-05,
      "loss": 1.3454,
      "num_input_tokens_seen": 32668100432,
      "step": 41522
    },
    {
      "epoch": 4.40515595162317,
      "grad_norm": 0.5362741828778557,
      "learning_rate": 3.517840397093605e-05,
      "loss": 1.1076,
      "num_input_tokens_seen": 32668887280,
      "step": 41523
    },
    {
      "epoch": 4.405262041162741,
      "grad_norm": 0.6502444814177053,
      "learning_rate": 3.5177769205085144e-05,
      "loss": 1.3501,
      "num_input_tokens_seen": 32669674064,
      "step": 41524
    },
    {
      "epoch": 4.405368130702313,
      "grad_norm": 0.6674393250235174,
      "learning_rate": 3.517713443136916e-05,
      "loss": 1.3541,
      "num_input_tokens_seen": 32670460784,
      "step": 41525
    },
    {
      "epoch": 4.405474220241884,
      "grad_norm": 0.8509090580647831,
      "learning_rate": 3.517649964978858e-05,
      "loss": 1.2499,
      "num_input_tokens_seen": 32671247568,
      "step": 41526
    },
    {
      "epoch": 4.405580309781455,
      "grad_norm": 0.5753310742668537,
      "learning_rate": 3.51758648603439e-05,
      "loss": 1.4385,
      "num_input_tokens_seen": 32672034256,
      "step": 41527
    },
    {
      "epoch": 4.405686399321027,
      "grad_norm": 0.5153187664910702,
      "learning_rate": 3.517523006303561e-05,
      "loss": 1.2648,
      "num_input_tokens_seen": 32672821008,
      "step": 41528
    },
    {
      "epoch": 4.405792488860598,
      "grad_norm": 0.5875841936377508,
      "learning_rate": 3.5174595257864205e-05,
      "loss": 1.3358,
      "num_input_tokens_seen": 32673607712,
      "step": 41529
    },
    {
      "epoch": 4.40589857840017,
      "grad_norm": 0.6453694149784601,
      "learning_rate": 3.517396044483017e-05,
      "loss": 1.3996,
      "num_input_tokens_seen": 32674394512,
      "step": 41530
    },
    {
      "epoch": 4.406004667939741,
      "grad_norm": 0.5142250887245186,
      "learning_rate": 3.5173325623934e-05,
      "loss": 1.2241,
      "num_input_tokens_seen": 32675181344,
      "step": 41531
    },
    {
      "epoch": 4.406110757479312,
      "grad_norm": 0.5536880435408583,
      "learning_rate": 3.517269079517618e-05,
      "loss": 1.145,
      "num_input_tokens_seen": 32675968096,
      "step": 41532
    },
    {
      "epoch": 4.406216847018884,
      "grad_norm": 0.720643162362755,
      "learning_rate": 3.51720559585572e-05,
      "loss": 1.3018,
      "num_input_tokens_seen": 32676754928,
      "step": 41533
    },
    {
      "epoch": 4.406322936558455,
      "grad_norm": 0.5572003585918497,
      "learning_rate": 3.5171421114077555e-05,
      "loss": 1.3543,
      "num_input_tokens_seen": 32677541648,
      "step": 41534
    },
    {
      "epoch": 4.406429026098027,
      "grad_norm": 0.5446225768469051,
      "learning_rate": 3.517078626173774e-05,
      "loss": 1.2978,
      "num_input_tokens_seen": 32678328384,
      "step": 41535
    },
    {
      "epoch": 4.406535115637598,
      "grad_norm": 0.5958730483000613,
      "learning_rate": 3.517015140153823e-05,
      "loss": 1.2711,
      "num_input_tokens_seen": 32679115216,
      "step": 41536
    },
    {
      "epoch": 4.40664120517717,
      "grad_norm": 0.6323117388355619,
      "learning_rate": 3.516951653347954e-05,
      "loss": 1.2037,
      "num_input_tokens_seen": 32679902000,
      "step": 41537
    },
    {
      "epoch": 4.406747294716741,
      "grad_norm": 0.6330111806850562,
      "learning_rate": 3.516888165756213e-05,
      "loss": 1.2523,
      "num_input_tokens_seen": 32680688688,
      "step": 41538
    },
    {
      "epoch": 4.406853384256312,
      "grad_norm": 1.1101579395529806,
      "learning_rate": 3.516824677378651e-05,
      "loss": 1.4145,
      "num_input_tokens_seen": 32681475488,
      "step": 41539
    },
    {
      "epoch": 4.406959473795884,
      "grad_norm": 0.42689014736797387,
      "learning_rate": 3.516761188215317e-05,
      "loss": 1.1559,
      "num_input_tokens_seen": 32682262304,
      "step": 41540
    },
    {
      "epoch": 4.407065563335455,
      "grad_norm": 0.622330579243525,
      "learning_rate": 3.51669769826626e-05,
      "loss": 1.2849,
      "num_input_tokens_seen": 32683049088,
      "step": 41541
    },
    {
      "epoch": 4.407171652875027,
      "grad_norm": 1.0092736463401473,
      "learning_rate": 3.516634207531529e-05,
      "loss": 1.2546,
      "num_input_tokens_seen": 32683835872,
      "step": 41542
    },
    {
      "epoch": 4.407277742414598,
      "grad_norm": 0.5729506613033947,
      "learning_rate": 3.5165707160111724e-05,
      "loss": 1.3365,
      "num_input_tokens_seen": 32684622640,
      "step": 41543
    },
    {
      "epoch": 4.407383831954169,
      "grad_norm": 0.623206413346674,
      "learning_rate": 3.51650722370524e-05,
      "loss": 1.3033,
      "num_input_tokens_seen": 32685409408,
      "step": 41544
    },
    {
      "epoch": 4.407489921493741,
      "grad_norm": 0.5664386695630523,
      "learning_rate": 3.5164437306137805e-05,
      "loss": 1.2954,
      "num_input_tokens_seen": 32686196160,
      "step": 41545
    },
    {
      "epoch": 4.407596011033312,
      "grad_norm": 0.5765330768930512,
      "learning_rate": 3.516380236736844e-05,
      "loss": 1.2376,
      "num_input_tokens_seen": 32686982816,
      "step": 41546
    },
    {
      "epoch": 4.407702100572884,
      "grad_norm": 0.5527289696735144,
      "learning_rate": 3.516316742074477e-05,
      "loss": 1.302,
      "num_input_tokens_seen": 32687769616,
      "step": 41547
    },
    {
      "epoch": 4.407808190112455,
      "grad_norm": 1.044842235404711,
      "learning_rate": 3.516253246626731e-05,
      "loss": 1.4248,
      "num_input_tokens_seen": 32688556416,
      "step": 41548
    },
    {
      "epoch": 4.407914279652026,
      "grad_norm": 0.4731044036982291,
      "learning_rate": 3.5161897503936544e-05,
      "loss": 1.286,
      "num_input_tokens_seen": 32689343104,
      "step": 41549
    },
    {
      "epoch": 4.408020369191598,
      "grad_norm": 0.958893720825502,
      "learning_rate": 3.516126253375297e-05,
      "loss": 1.3508,
      "num_input_tokens_seen": 32690129872,
      "step": 41550
    },
    {
      "epoch": 4.408126458731169,
      "grad_norm": 0.6553671695289143,
      "learning_rate": 3.516062755571706e-05,
      "loss": 1.3561,
      "num_input_tokens_seen": 32690916544,
      "step": 41551
    },
    {
      "epoch": 4.408232548270741,
      "grad_norm": 0.5320524884265233,
      "learning_rate": 3.515999256982932e-05,
      "loss": 1.3102,
      "num_input_tokens_seen": 32691703328,
      "step": 41552
    },
    {
      "epoch": 4.408338637810312,
      "grad_norm": 1.0251561829064646,
      "learning_rate": 3.515935757609023e-05,
      "loss": 1.3082,
      "num_input_tokens_seen": 32692490096,
      "step": 41553
    },
    {
      "epoch": 4.408444727349884,
      "grad_norm": 0.525351460177369,
      "learning_rate": 3.5158722574500286e-05,
      "loss": 1.2037,
      "num_input_tokens_seen": 32693276864,
      "step": 41554
    },
    {
      "epoch": 4.408550816889455,
      "grad_norm": 0.5004054513422822,
      "learning_rate": 3.5158087565059985e-05,
      "loss": 1.2947,
      "num_input_tokens_seen": 32694063600,
      "step": 41555
    },
    {
      "epoch": 4.408656906429026,
      "grad_norm": 0.5842510677091893,
      "learning_rate": 3.515745254776981e-05,
      "loss": 1.4103,
      "num_input_tokens_seen": 32694850304,
      "step": 41556
    },
    {
      "epoch": 4.408762995968598,
      "grad_norm": 0.6433662737767557,
      "learning_rate": 3.5156817522630254e-05,
      "loss": 1.3013,
      "num_input_tokens_seen": 32695637120,
      "step": 41557
    },
    {
      "epoch": 4.408869085508169,
      "grad_norm": 0.5622616688012239,
      "learning_rate": 3.5156182489641806e-05,
      "loss": 1.3582,
      "num_input_tokens_seen": 32696423904,
      "step": 41558
    },
    {
      "epoch": 4.408975175047741,
      "grad_norm": 0.5532452846830623,
      "learning_rate": 3.515554744880496e-05,
      "loss": 1.2947,
      "num_input_tokens_seen": 32697210688,
      "step": 41559
    },
    {
      "epoch": 4.409081264587312,
      "grad_norm": 0.6738338154607157,
      "learning_rate": 3.515491240012021e-05,
      "loss": 1.3156,
      "num_input_tokens_seen": 32697997408,
      "step": 41560
    },
    {
      "epoch": 4.409187354126883,
      "grad_norm": 0.5189147919043557,
      "learning_rate": 3.515427734358803e-05,
      "loss": 1.3858,
      "num_input_tokens_seen": 32698784112,
      "step": 41561
    },
    {
      "epoch": 4.409293443666455,
      "grad_norm": 0.8241390701244636,
      "learning_rate": 3.515364227920893e-05,
      "loss": 1.2096,
      "num_input_tokens_seen": 32699570864,
      "step": 41562
    },
    {
      "epoch": 4.409399533206026,
      "grad_norm": 0.6396643219612881,
      "learning_rate": 3.515300720698339e-05,
      "loss": 1.2113,
      "num_input_tokens_seen": 32700357712,
      "step": 41563
    },
    {
      "epoch": 4.4095056227455975,
      "grad_norm": 0.867612039179592,
      "learning_rate": 3.515237212691191e-05,
      "loss": 1.2823,
      "num_input_tokens_seen": 32701144464,
      "step": 41564
    },
    {
      "epoch": 4.409611712285169,
      "grad_norm": 0.7651442981431517,
      "learning_rate": 3.515173703899497e-05,
      "loss": 1.2429,
      "num_input_tokens_seen": 32701931360,
      "step": 41565
    },
    {
      "epoch": 4.4097178018247405,
      "grad_norm": 0.553481500800616,
      "learning_rate": 3.5151101943233067e-05,
      "loss": 1.3996,
      "num_input_tokens_seen": 32702718128,
      "step": 41566
    },
    {
      "epoch": 4.4098238913643115,
      "grad_norm": 1.010015859342929,
      "learning_rate": 3.515046683962669e-05,
      "loss": 1.3353,
      "num_input_tokens_seen": 32703504896,
      "step": 41567
    },
    {
      "epoch": 4.4099299809038826,
      "grad_norm": 0.5888673058458858,
      "learning_rate": 3.514983172817633e-05,
      "loss": 1.2754,
      "num_input_tokens_seen": 32704291600,
      "step": 41568
    },
    {
      "epoch": 4.4100360704434545,
      "grad_norm": 0.6564957831797603,
      "learning_rate": 3.514919660888247e-05,
      "loss": 1.4485,
      "num_input_tokens_seen": 32705078368,
      "step": 41569
    },
    {
      "epoch": 4.4101421599830255,
      "grad_norm": 0.6632136544829704,
      "learning_rate": 3.5148561481745616e-05,
      "loss": 1.1626,
      "num_input_tokens_seen": 32705865248,
      "step": 41570
    },
    {
      "epoch": 4.410248249522597,
      "grad_norm": 0.7153668811978198,
      "learning_rate": 3.5147926346766256e-05,
      "loss": 1.3779,
      "num_input_tokens_seen": 32706652064,
      "step": 41571
    },
    {
      "epoch": 4.4103543390621684,
      "grad_norm": 0.7359496654736882,
      "learning_rate": 3.514729120394487e-05,
      "loss": 1.3184,
      "num_input_tokens_seen": 32707438832,
      "step": 41572
    },
    {
      "epoch": 4.4104604286017395,
      "grad_norm": 0.6431850037320934,
      "learning_rate": 3.514665605328196e-05,
      "loss": 1.2145,
      "num_input_tokens_seen": 32708225664,
      "step": 41573
    },
    {
      "epoch": 4.410566518141311,
      "grad_norm": 0.9516527894186735,
      "learning_rate": 3.5146020894778006e-05,
      "loss": 1.3196,
      "num_input_tokens_seen": 32709012496,
      "step": 41574
    },
    {
      "epoch": 4.410672607680882,
      "grad_norm": 0.5017766463496669,
      "learning_rate": 3.514538572843351e-05,
      "loss": 1.2211,
      "num_input_tokens_seen": 32709799248,
      "step": 41575
    },
    {
      "epoch": 4.410778697220454,
      "grad_norm": 0.5634496868430803,
      "learning_rate": 3.5144750554248954e-05,
      "loss": 1.4123,
      "num_input_tokens_seen": 32710585984,
      "step": 41576
    },
    {
      "epoch": 4.410884786760025,
      "grad_norm": 0.6084373264106444,
      "learning_rate": 3.5144115372224836e-05,
      "loss": 1.3577,
      "num_input_tokens_seen": 32711372736,
      "step": 41577
    },
    {
      "epoch": 4.410990876299596,
      "grad_norm": 0.6937847151890564,
      "learning_rate": 3.514348018236164e-05,
      "loss": 1.2894,
      "num_input_tokens_seen": 32712159520,
      "step": 41578
    },
    {
      "epoch": 4.411096965839168,
      "grad_norm": 0.6056037156401431,
      "learning_rate": 3.5142844984659855e-05,
      "loss": 1.4062,
      "num_input_tokens_seen": 32712946256,
      "step": 41579
    },
    {
      "epoch": 4.411203055378739,
      "grad_norm": 0.6085068202609661,
      "learning_rate": 3.514220977911999e-05,
      "loss": 1.3707,
      "num_input_tokens_seen": 32713732928,
      "step": 41580
    },
    {
      "epoch": 4.411309144918311,
      "grad_norm": 0.6507243000383472,
      "learning_rate": 3.514157456574251e-05,
      "loss": 1.2724,
      "num_input_tokens_seen": 32714519680,
      "step": 41581
    },
    {
      "epoch": 4.411415234457882,
      "grad_norm": 0.8060190188378461,
      "learning_rate": 3.514093934452792e-05,
      "loss": 1.342,
      "num_input_tokens_seen": 32715306448,
      "step": 41582
    },
    {
      "epoch": 4.411521323997454,
      "grad_norm": 0.6413426650443463,
      "learning_rate": 3.514030411547672e-05,
      "loss": 1.2713,
      "num_input_tokens_seen": 32716093264,
      "step": 41583
    },
    {
      "epoch": 4.411627413537025,
      "grad_norm": 0.7401337790264586,
      "learning_rate": 3.513966887858938e-05,
      "loss": 1.3544,
      "num_input_tokens_seen": 32716880112,
      "step": 41584
    },
    {
      "epoch": 4.411733503076596,
      "grad_norm": 0.5705788652979289,
      "learning_rate": 3.5139033633866414e-05,
      "loss": 1.2324,
      "num_input_tokens_seen": 32717666960,
      "step": 41585
    },
    {
      "epoch": 4.411839592616168,
      "grad_norm": 0.5868925337493642,
      "learning_rate": 3.513839838130829e-05,
      "loss": 1.2863,
      "num_input_tokens_seen": 32718453728,
      "step": 41586
    },
    {
      "epoch": 4.411945682155739,
      "grad_norm": 0.6049313459371859,
      "learning_rate": 3.513776312091551e-05,
      "loss": 1.4308,
      "num_input_tokens_seen": 32719240368,
      "step": 41587
    },
    {
      "epoch": 4.412051771695311,
      "grad_norm": 0.7007615229547605,
      "learning_rate": 3.5137127852688566e-05,
      "loss": 1.3135,
      "num_input_tokens_seen": 32720027248,
      "step": 41588
    },
    {
      "epoch": 4.412157861234882,
      "grad_norm": 0.685186350849651,
      "learning_rate": 3.513649257662795e-05,
      "loss": 1.2708,
      "num_input_tokens_seen": 32720814080,
      "step": 41589
    },
    {
      "epoch": 4.412263950774454,
      "grad_norm": 0.7274401159170036,
      "learning_rate": 3.5135857292734145e-05,
      "loss": 1.2648,
      "num_input_tokens_seen": 32721600848,
      "step": 41590
    },
    {
      "epoch": 4.412370040314025,
      "grad_norm": 0.5673585992884053,
      "learning_rate": 3.513522200100765e-05,
      "loss": 1.3972,
      "num_input_tokens_seen": 32722387696,
      "step": 41591
    },
    {
      "epoch": 4.412476129853596,
      "grad_norm": 0.5552566006304851,
      "learning_rate": 3.513458670144895e-05,
      "loss": 1.283,
      "num_input_tokens_seen": 32723174448,
      "step": 41592
    },
    {
      "epoch": 4.412582219393168,
      "grad_norm": 0.5046418428810795,
      "learning_rate": 3.513395139405854e-05,
      "loss": 1.2561,
      "num_input_tokens_seen": 32723961168,
      "step": 41593
    },
    {
      "epoch": 4.412688308932739,
      "grad_norm": 0.5323946206994578,
      "learning_rate": 3.513331607883691e-05,
      "loss": 1.3674,
      "num_input_tokens_seen": 32724747872,
      "step": 41594
    },
    {
      "epoch": 4.412794398472311,
      "grad_norm": 0.618886665202058,
      "learning_rate": 3.513268075578455e-05,
      "loss": 1.3061,
      "num_input_tokens_seen": 32725534704,
      "step": 41595
    },
    {
      "epoch": 4.412900488011882,
      "grad_norm": 0.6652361717327193,
      "learning_rate": 3.513204542490195e-05,
      "loss": 1.2232,
      "num_input_tokens_seen": 32726321472,
      "step": 41596
    },
    {
      "epoch": 4.413006577551453,
      "grad_norm": 0.5349243380877613,
      "learning_rate": 3.513141008618961e-05,
      "loss": 1.3188,
      "num_input_tokens_seen": 32727108192,
      "step": 41597
    },
    {
      "epoch": 4.413112667091025,
      "grad_norm": 0.5465239642441645,
      "learning_rate": 3.513077473964801e-05,
      "loss": 1.2288,
      "num_input_tokens_seen": 32727894960,
      "step": 41598
    },
    {
      "epoch": 4.413218756630596,
      "grad_norm": 0.527479098549121,
      "learning_rate": 3.5130139385277636e-05,
      "loss": 1.3039,
      "num_input_tokens_seen": 32728681696,
      "step": 41599
    },
    {
      "epoch": 4.413324846170168,
      "grad_norm": 0.561877320369193,
      "learning_rate": 3.5129504023079e-05,
      "loss": 1.2609,
      "num_input_tokens_seen": 32729468512,
      "step": 41600
    },
    {
      "epoch": 4.413430935709739,
      "grad_norm": 0.5125906457047542,
      "learning_rate": 3.512886865305257e-05,
      "loss": 1.3481,
      "num_input_tokens_seen": 32730255328,
      "step": 41601
    },
    {
      "epoch": 4.41353702524931,
      "grad_norm": 0.5306519128376928,
      "learning_rate": 3.5128233275198854e-05,
      "loss": 1.3438,
      "num_input_tokens_seen": 32731042112,
      "step": 41602
    },
    {
      "epoch": 4.413643114788882,
      "grad_norm": 0.5611600526960258,
      "learning_rate": 3.5127597889518335e-05,
      "loss": 1.3723,
      "num_input_tokens_seen": 32731828880,
      "step": 41603
    },
    {
      "epoch": 4.413749204328453,
      "grad_norm": 0.6043295596901691,
      "learning_rate": 3.51269624960115e-05,
      "loss": 1.4407,
      "num_input_tokens_seen": 32732615664,
      "step": 41604
    },
    {
      "epoch": 4.413855293868025,
      "grad_norm": 0.5887979592613479,
      "learning_rate": 3.512632709467885e-05,
      "loss": 1.3052,
      "num_input_tokens_seen": 32733402368,
      "step": 41605
    },
    {
      "epoch": 4.413961383407596,
      "grad_norm": 0.6611669803194229,
      "learning_rate": 3.512569168552088e-05,
      "loss": 1.323,
      "num_input_tokens_seen": 32734189216,
      "step": 41606
    },
    {
      "epoch": 4.414067472947167,
      "grad_norm": 0.5123295395292469,
      "learning_rate": 3.512505626853806e-05,
      "loss": 1.3025,
      "num_input_tokens_seen": 32734975936,
      "step": 41607
    },
    {
      "epoch": 4.414173562486739,
      "grad_norm": 0.5276302890298687,
      "learning_rate": 3.51244208437309e-05,
      "loss": 1.2802,
      "num_input_tokens_seen": 32735762736,
      "step": 41608
    },
    {
      "epoch": 4.41427965202631,
      "grad_norm": 0.6013442154261487,
      "learning_rate": 3.512378541109989e-05,
      "loss": 1.2601,
      "num_input_tokens_seen": 32736549520,
      "step": 41609
    },
    {
      "epoch": 4.414385741565882,
      "grad_norm": 0.4866834272875065,
      "learning_rate": 3.51231499706455e-05,
      "loss": 1.2741,
      "num_input_tokens_seen": 32737336304,
      "step": 41610
    },
    {
      "epoch": 4.414491831105453,
      "grad_norm": 0.4666383603825951,
      "learning_rate": 3.512251452236825e-05,
      "loss": 1.2471,
      "num_input_tokens_seen": 32738123072,
      "step": 41611
    },
    {
      "epoch": 4.414597920645025,
      "grad_norm": 0.600657399047404,
      "learning_rate": 3.5121879066268615e-05,
      "loss": 1.3016,
      "num_input_tokens_seen": 32738909904,
      "step": 41612
    },
    {
      "epoch": 4.414704010184596,
      "grad_norm": 0.6626568800731252,
      "learning_rate": 3.512124360234708e-05,
      "loss": 1.3549,
      "num_input_tokens_seen": 32739696640,
      "step": 41613
    },
    {
      "epoch": 4.414810099724167,
      "grad_norm": 0.6896134959573708,
      "learning_rate": 3.512060813060415e-05,
      "loss": 1.4497,
      "num_input_tokens_seen": 32740483328,
      "step": 41614
    },
    {
      "epoch": 4.414916189263739,
      "grad_norm": 0.5510437361527288,
      "learning_rate": 3.5119972651040324e-05,
      "loss": 1.2612,
      "num_input_tokens_seen": 32741270160,
      "step": 41615
    },
    {
      "epoch": 4.41502227880331,
      "grad_norm": 0.522344096708681,
      "learning_rate": 3.5119337163656065e-05,
      "loss": 1.1892,
      "num_input_tokens_seen": 32742057056,
      "step": 41616
    },
    {
      "epoch": 4.415128368342882,
      "grad_norm": 0.5322455103610478,
      "learning_rate": 3.511870166845188e-05,
      "loss": 1.2831,
      "num_input_tokens_seen": 32742843776,
      "step": 41617
    },
    {
      "epoch": 4.415234457882453,
      "grad_norm": 0.7921286213858413,
      "learning_rate": 3.5118066165428264e-05,
      "loss": 1.3349,
      "num_input_tokens_seen": 32743630528,
      "step": 41618
    },
    {
      "epoch": 4.415340547422025,
      "grad_norm": 0.48484271904168175,
      "learning_rate": 3.5117430654585705e-05,
      "loss": 1.1527,
      "num_input_tokens_seen": 32744417392,
      "step": 41619
    },
    {
      "epoch": 4.415446636961596,
      "grad_norm": 0.6178134625205949,
      "learning_rate": 3.511679513592469e-05,
      "loss": 1.2078,
      "num_input_tokens_seen": 32745204192,
      "step": 41620
    },
    {
      "epoch": 4.415552726501167,
      "grad_norm": 0.6315427910916624,
      "learning_rate": 3.511615960944571e-05,
      "loss": 1.3273,
      "num_input_tokens_seen": 32745990912,
      "step": 41621
    },
    {
      "epoch": 4.415658816040739,
      "grad_norm": 0.6571273275935402,
      "learning_rate": 3.5115524075149256e-05,
      "loss": 1.3068,
      "num_input_tokens_seen": 32746777728,
      "step": 41622
    },
    {
      "epoch": 4.41576490558031,
      "grad_norm": 0.5590359897566257,
      "learning_rate": 3.511488853303583e-05,
      "loss": 1.2741,
      "num_input_tokens_seen": 32747564400,
      "step": 41623
    },
    {
      "epoch": 4.415870995119882,
      "grad_norm": 0.5490290153427224,
      "learning_rate": 3.5114252983105916e-05,
      "loss": 1.3748,
      "num_input_tokens_seen": 32748351152,
      "step": 41624
    },
    {
      "epoch": 4.415977084659453,
      "grad_norm": 0.5547674835634868,
      "learning_rate": 3.511361742536e-05,
      "loss": 1.3338,
      "num_input_tokens_seen": 32749137904,
      "step": 41625
    },
    {
      "epoch": 4.416083174199024,
      "grad_norm": 0.5573211034952754,
      "learning_rate": 3.511298185979857e-05,
      "loss": 1.3793,
      "num_input_tokens_seen": 32749924656,
      "step": 41626
    },
    {
      "epoch": 4.4161892637385955,
      "grad_norm": 0.5258413190415442,
      "learning_rate": 3.5112346286422136e-05,
      "loss": 1.2649,
      "num_input_tokens_seen": 32750711392,
      "step": 41627
    },
    {
      "epoch": 4.416295353278167,
      "grad_norm": 0.5375556975678683,
      "learning_rate": 3.5111710705231174e-05,
      "loss": 1.4114,
      "num_input_tokens_seen": 32751498112,
      "step": 41628
    },
    {
      "epoch": 4.4164014428177385,
      "grad_norm": 0.7938594635679688,
      "learning_rate": 3.5111075116226176e-05,
      "loss": 1.3985,
      "num_input_tokens_seen": 32752284816,
      "step": 41629
    },
    {
      "epoch": 4.4165075323573095,
      "grad_norm": 0.5546757931249413,
      "learning_rate": 3.511043951940763e-05,
      "loss": 1.3791,
      "num_input_tokens_seen": 32753071648,
      "step": 41630
    },
    {
      "epoch": 4.416613621896881,
      "grad_norm": 0.5447683175256386,
      "learning_rate": 3.510980391477605e-05,
      "loss": 1.2757,
      "num_input_tokens_seen": 32753858336,
      "step": 41631
    },
    {
      "epoch": 4.4167197114364525,
      "grad_norm": 0.5397649790914687,
      "learning_rate": 3.5109168302331895e-05,
      "loss": 1.2342,
      "num_input_tokens_seen": 32754645136,
      "step": 41632
    },
    {
      "epoch": 4.4168258009760235,
      "grad_norm": 0.6209540216475097,
      "learning_rate": 3.510853268207568e-05,
      "loss": 1.3094,
      "num_input_tokens_seen": 32755431872,
      "step": 41633
    },
    {
      "epoch": 4.416931890515595,
      "grad_norm": 0.5710371400640497,
      "learning_rate": 3.510789705400788e-05,
      "loss": 1.3517,
      "num_input_tokens_seen": 32756218672,
      "step": 41634
    },
    {
      "epoch": 4.4170379800551665,
      "grad_norm": 0.8848394797783448,
      "learning_rate": 3.5107261418129e-05,
      "loss": 1.4133,
      "num_input_tokens_seen": 32757005472,
      "step": 41635
    },
    {
      "epoch": 4.4171440695947375,
      "grad_norm": 0.6894705686201031,
      "learning_rate": 3.510662577443952e-05,
      "loss": 1.3636,
      "num_input_tokens_seen": 32757792320,
      "step": 41636
    },
    {
      "epoch": 4.417250159134309,
      "grad_norm": 0.6691623082761158,
      "learning_rate": 3.510599012293994e-05,
      "loss": 1.2769,
      "num_input_tokens_seen": 32758579104,
      "step": 41637
    },
    {
      "epoch": 4.41735624867388,
      "grad_norm": 0.7822596836030531,
      "learning_rate": 3.5105354463630746e-05,
      "loss": 1.4508,
      "num_input_tokens_seen": 32759365824,
      "step": 41638
    },
    {
      "epoch": 4.417462338213452,
      "grad_norm": 0.577131037355516,
      "learning_rate": 3.510471879651243e-05,
      "loss": 1.3863,
      "num_input_tokens_seen": 32760152560,
      "step": 41639
    },
    {
      "epoch": 4.417568427753023,
      "grad_norm": 0.6214847210774899,
      "learning_rate": 3.510408312158548e-05,
      "loss": 1.2146,
      "num_input_tokens_seen": 32760939280,
      "step": 41640
    },
    {
      "epoch": 4.417674517292595,
      "grad_norm": 0.5170108201751372,
      "learning_rate": 3.510344743885041e-05,
      "loss": 1.2977,
      "num_input_tokens_seen": 32761725952,
      "step": 41641
    },
    {
      "epoch": 4.417780606832166,
      "grad_norm": 0.5252518340960153,
      "learning_rate": 3.5102811748307675e-05,
      "loss": 1.3167,
      "num_input_tokens_seen": 32762512736,
      "step": 41642
    },
    {
      "epoch": 4.417886696371737,
      "grad_norm": 0.5308240474253032,
      "learning_rate": 3.5102176049957785e-05,
      "loss": 1.3608,
      "num_input_tokens_seen": 32763299440,
      "step": 41643
    },
    {
      "epoch": 4.417992785911309,
      "grad_norm": 0.5944474362770955,
      "learning_rate": 3.5101540343801226e-05,
      "loss": 1.3519,
      "num_input_tokens_seen": 32764086272,
      "step": 41644
    },
    {
      "epoch": 4.41809887545088,
      "grad_norm": 0.577345383181279,
      "learning_rate": 3.51009046298385e-05,
      "loss": 1.4046,
      "num_input_tokens_seen": 32764873008,
      "step": 41645
    },
    {
      "epoch": 4.418204964990452,
      "grad_norm": 0.5718982620769552,
      "learning_rate": 3.510026890807009e-05,
      "loss": 1.3452,
      "num_input_tokens_seen": 32765659776,
      "step": 41646
    },
    {
      "epoch": 4.418311054530023,
      "grad_norm": 0.5194307958116089,
      "learning_rate": 3.509963317849649e-05,
      "loss": 1.2539,
      "num_input_tokens_seen": 32766446688,
      "step": 41647
    },
    {
      "epoch": 4.418417144069595,
      "grad_norm": 0.573729697402408,
      "learning_rate": 3.5098997441118187e-05,
      "loss": 1.299,
      "num_input_tokens_seen": 32767233472,
      "step": 41648
    },
    {
      "epoch": 4.418523233609166,
      "grad_norm": 0.5671695603442947,
      "learning_rate": 3.509836169593567e-05,
      "loss": 1.3108,
      "num_input_tokens_seen": 32768020192,
      "step": 41649
    },
    {
      "epoch": 4.418629323148737,
      "grad_norm": 0.5670793296312857,
      "learning_rate": 3.509772594294944e-05,
      "loss": 1.3955,
      "num_input_tokens_seen": 32768806880,
      "step": 41650
    },
    {
      "epoch": 4.418735412688309,
      "grad_norm": 0.5948677972250808,
      "learning_rate": 3.5097090182159984e-05,
      "loss": 1.4178,
      "num_input_tokens_seen": 32769593664,
      "step": 41651
    },
    {
      "epoch": 4.41884150222788,
      "grad_norm": 0.5125276492206777,
      "learning_rate": 3.50964544135678e-05,
      "loss": 1.1901,
      "num_input_tokens_seen": 32770380352,
      "step": 41652
    },
    {
      "epoch": 4.418947591767452,
      "grad_norm": 0.6505476598164521,
      "learning_rate": 3.509581863717337e-05,
      "loss": 1.3124,
      "num_input_tokens_seen": 32771167072,
      "step": 41653
    },
    {
      "epoch": 4.419053681307023,
      "grad_norm": 0.7293568186518824,
      "learning_rate": 3.509518285297718e-05,
      "loss": 1.4526,
      "num_input_tokens_seen": 32771953856,
      "step": 41654
    },
    {
      "epoch": 4.419159770846594,
      "grad_norm": 0.5389758559478816,
      "learning_rate": 3.5094547060979734e-05,
      "loss": 1.3561,
      "num_input_tokens_seen": 32772740608,
      "step": 41655
    },
    {
      "epoch": 4.419265860386166,
      "grad_norm": 0.6419166794386779,
      "learning_rate": 3.5093911261181515e-05,
      "loss": 1.3763,
      "num_input_tokens_seen": 32773527360,
      "step": 41656
    },
    {
      "epoch": 4.419371949925737,
      "grad_norm": 0.4751697420564984,
      "learning_rate": 3.5093275453583016e-05,
      "loss": 1.2586,
      "num_input_tokens_seen": 32774314224,
      "step": 41657
    },
    {
      "epoch": 4.419478039465309,
      "grad_norm": 0.5605281087812088,
      "learning_rate": 3.5092639638184746e-05,
      "loss": 1.2856,
      "num_input_tokens_seen": 32775100928,
      "step": 41658
    },
    {
      "epoch": 4.41958412900488,
      "grad_norm": 0.5152339064970524,
      "learning_rate": 3.5092003814987153e-05,
      "loss": 1.275,
      "num_input_tokens_seen": 32775887728,
      "step": 41659
    },
    {
      "epoch": 4.419690218544451,
      "grad_norm": 0.5763550167937469,
      "learning_rate": 3.509136798399077e-05,
      "loss": 1.3431,
      "num_input_tokens_seen": 32776674512,
      "step": 41660
    },
    {
      "epoch": 4.419796308084023,
      "grad_norm": 0.5315030685029501,
      "learning_rate": 3.5090732145196084e-05,
      "loss": 1.2331,
      "num_input_tokens_seen": 32777461248,
      "step": 41661
    },
    {
      "epoch": 4.419902397623594,
      "grad_norm": 0.493246736962279,
      "learning_rate": 3.509009629860356e-05,
      "loss": 1.2541,
      "num_input_tokens_seen": 32778248048,
      "step": 41662
    },
    {
      "epoch": 4.420008487163166,
      "grad_norm": 0.4956397485359459,
      "learning_rate": 3.508946044421372e-05,
      "loss": 1.3918,
      "num_input_tokens_seen": 32779034848,
      "step": 41663
    },
    {
      "epoch": 4.420114576702737,
      "grad_norm": 0.49092077827873626,
      "learning_rate": 3.5088824582027035e-05,
      "loss": 1.201,
      "num_input_tokens_seen": 32779821728,
      "step": 41664
    },
    {
      "epoch": 4.420220666242309,
      "grad_norm": 0.4953175140545108,
      "learning_rate": 3.5088188712044e-05,
      "loss": 1.2092,
      "num_input_tokens_seen": 32780608432,
      "step": 41665
    },
    {
      "epoch": 4.42032675578188,
      "grad_norm": 0.4872998657615734,
      "learning_rate": 3.5087552834265106e-05,
      "loss": 1.3347,
      "num_input_tokens_seen": 32781395104,
      "step": 41666
    },
    {
      "epoch": 4.420432845321451,
      "grad_norm": 0.49512300698750594,
      "learning_rate": 3.508691694869085e-05,
      "loss": 1.3556,
      "num_input_tokens_seen": 32782181872,
      "step": 41667
    },
    {
      "epoch": 4.420538934861023,
      "grad_norm": 0.5399851073406531,
      "learning_rate": 3.508628105532172e-05,
      "loss": 1.3174,
      "num_input_tokens_seen": 32782968576,
      "step": 41668
    },
    {
      "epoch": 4.420645024400594,
      "grad_norm": 0.4580850923660448,
      "learning_rate": 3.5085645154158206e-05,
      "loss": 1.3125,
      "num_input_tokens_seen": 32783755392,
      "step": 41669
    },
    {
      "epoch": 4.420751113940166,
      "grad_norm": 0.4907092557633447,
      "learning_rate": 3.508500924520081e-05,
      "loss": 1.2667,
      "num_input_tokens_seen": 32784542224,
      "step": 41670
    },
    {
      "epoch": 4.420857203479737,
      "grad_norm": 0.5221297133882602,
      "learning_rate": 3.508437332845001e-05,
      "loss": 1.3196,
      "num_input_tokens_seen": 32785328976,
      "step": 41671
    },
    {
      "epoch": 4.420963293019308,
      "grad_norm": 0.4965614486439272,
      "learning_rate": 3.5083737403906304e-05,
      "loss": 1.2924,
      "num_input_tokens_seen": 32786115808,
      "step": 41672
    },
    {
      "epoch": 4.42106938255888,
      "grad_norm": 0.6319305463242251,
      "learning_rate": 3.5083101471570176e-05,
      "loss": 1.352,
      "num_input_tokens_seen": 32786902512,
      "step": 41673
    },
    {
      "epoch": 4.421175472098451,
      "grad_norm": 0.46814732100198314,
      "learning_rate": 3.5082465531442124e-05,
      "loss": 1.2312,
      "num_input_tokens_seen": 32787689344,
      "step": 41674
    },
    {
      "epoch": 4.421281561638023,
      "grad_norm": 0.6026778758067461,
      "learning_rate": 3.5081829583522643e-05,
      "loss": 1.2582,
      "num_input_tokens_seen": 32788476160,
      "step": 41675
    },
    {
      "epoch": 4.421387651177594,
      "grad_norm": 0.6352991883442205,
      "learning_rate": 3.5081193627812214e-05,
      "loss": 1.3524,
      "num_input_tokens_seen": 32789263040,
      "step": 41676
    },
    {
      "epoch": 4.421493740717166,
      "grad_norm": 0.5206888928411829,
      "learning_rate": 3.508055766431134e-05,
      "loss": 1.319,
      "num_input_tokens_seen": 32790049824,
      "step": 41677
    },
    {
      "epoch": 4.421599830256737,
      "grad_norm": 0.534760233606496,
      "learning_rate": 3.5079921693020504e-05,
      "loss": 1.3655,
      "num_input_tokens_seen": 32790836544,
      "step": 41678
    },
    {
      "epoch": 4.421705919796308,
      "grad_norm": 0.49530135944087794,
      "learning_rate": 3.50792857139402e-05,
      "loss": 1.3589,
      "num_input_tokens_seen": 32791623264,
      "step": 41679
    },
    {
      "epoch": 4.42181200933588,
      "grad_norm": 0.629503397462681,
      "learning_rate": 3.5078649727070924e-05,
      "loss": 1.3744,
      "num_input_tokens_seen": 32792409984,
      "step": 41680
    },
    {
      "epoch": 4.421918098875451,
      "grad_norm": 0.4852576826762487,
      "learning_rate": 3.507801373241316e-05,
      "loss": 1.2531,
      "num_input_tokens_seen": 32793196800,
      "step": 41681
    },
    {
      "epoch": 4.422024188415023,
      "grad_norm": 0.4543853414495742,
      "learning_rate": 3.50773777299674e-05,
      "loss": 1.1437,
      "num_input_tokens_seen": 32793983568,
      "step": 41682
    },
    {
      "epoch": 4.422130277954594,
      "grad_norm": 0.5579773816562372,
      "learning_rate": 3.507674171973414e-05,
      "loss": 1.3695,
      "num_input_tokens_seen": 32794770336,
      "step": 41683
    },
    {
      "epoch": 4.422236367494165,
      "grad_norm": 0.5968659871434328,
      "learning_rate": 3.5076105701713876e-05,
      "loss": 1.337,
      "num_input_tokens_seen": 32795557072,
      "step": 41684
    },
    {
      "epoch": 4.422342457033737,
      "grad_norm": 0.5002947277299958,
      "learning_rate": 3.507546967590708e-05,
      "loss": 1.2435,
      "num_input_tokens_seen": 32796343920,
      "step": 41685
    },
    {
      "epoch": 4.422448546573308,
      "grad_norm": 0.6026803397776281,
      "learning_rate": 3.507483364231426e-05,
      "loss": 1.3773,
      "num_input_tokens_seen": 32797130672,
      "step": 41686
    },
    {
      "epoch": 4.42255463611288,
      "grad_norm": 0.5578982567467909,
      "learning_rate": 3.507419760093591e-05,
      "loss": 1.3487,
      "num_input_tokens_seen": 32797917424,
      "step": 41687
    },
    {
      "epoch": 4.422660725652451,
      "grad_norm": 0.5306131640830037,
      "learning_rate": 3.507356155177252e-05,
      "loss": 1.3285,
      "num_input_tokens_seen": 32798704192,
      "step": 41688
    },
    {
      "epoch": 4.422766815192022,
      "grad_norm": 0.6726847722904372,
      "learning_rate": 3.507292549482457e-05,
      "loss": 1.3328,
      "num_input_tokens_seen": 32799490992,
      "step": 41689
    },
    {
      "epoch": 4.422872904731594,
      "grad_norm": 0.562268845652059,
      "learning_rate": 3.5072289430092556e-05,
      "loss": 1.2766,
      "num_input_tokens_seen": 32800277776,
      "step": 41690
    },
    {
      "epoch": 4.422978994271165,
      "grad_norm": 0.4689167824008177,
      "learning_rate": 3.507165335757698e-05,
      "loss": 1.2286,
      "num_input_tokens_seen": 32801064560,
      "step": 41691
    },
    {
      "epoch": 4.4230850838107365,
      "grad_norm": 0.6947733102294513,
      "learning_rate": 3.5071017277278326e-05,
      "loss": 1.3813,
      "num_input_tokens_seen": 32801851280,
      "step": 41692
    },
    {
      "epoch": 4.4231911733503075,
      "grad_norm": 0.4604583608604449,
      "learning_rate": 3.507038118919708e-05,
      "loss": 1.2367,
      "num_input_tokens_seen": 32802638064,
      "step": 41693
    },
    {
      "epoch": 4.4232972628898795,
      "grad_norm": 0.5140650795666916,
      "learning_rate": 3.506974509333374e-05,
      "loss": 1.2617,
      "num_input_tokens_seen": 32803424800,
      "step": 41694
    },
    {
      "epoch": 4.4234033524294505,
      "grad_norm": 0.5631545857548599,
      "learning_rate": 3.50691089896888e-05,
      "loss": 1.4039,
      "num_input_tokens_seen": 32804211552,
      "step": 41695
    },
    {
      "epoch": 4.4235094419690215,
      "grad_norm": 0.5294099265376899,
      "learning_rate": 3.5068472878262735e-05,
      "loss": 1.3342,
      "num_input_tokens_seen": 32804998224,
      "step": 41696
    },
    {
      "epoch": 4.423615531508593,
      "grad_norm": 0.5182804611344984,
      "learning_rate": 3.506783675905606e-05,
      "loss": 1.2911,
      "num_input_tokens_seen": 32805784992,
      "step": 41697
    },
    {
      "epoch": 4.4237216210481645,
      "grad_norm": 0.49039683072913426,
      "learning_rate": 3.5067200632069255e-05,
      "loss": 1.2483,
      "num_input_tokens_seen": 32806571696,
      "step": 41698
    },
    {
      "epoch": 4.423827710587736,
      "grad_norm": 0.49773544340934955,
      "learning_rate": 3.506656449730281e-05,
      "loss": 1.1807,
      "num_input_tokens_seen": 32807358432,
      "step": 41699
    },
    {
      "epoch": 4.423933800127307,
      "grad_norm": 0.650214457828564,
      "learning_rate": 3.506592835475723e-05,
      "loss": 1.2967,
      "num_input_tokens_seen": 32808145248,
      "step": 41700
    },
    {
      "epoch": 4.4240398896668784,
      "grad_norm": 0.5110494411572497,
      "learning_rate": 3.506529220443299e-05,
      "loss": 1.3614,
      "num_input_tokens_seen": 32808932096,
      "step": 41701
    },
    {
      "epoch": 4.42414597920645,
      "grad_norm": 0.6159774126897949,
      "learning_rate": 3.506465604633058e-05,
      "loss": 1.3156,
      "num_input_tokens_seen": 32809718944,
      "step": 41702
    },
    {
      "epoch": 4.424252068746021,
      "grad_norm": 0.5227376040768573,
      "learning_rate": 3.5064019880450505e-05,
      "loss": 1.2133,
      "num_input_tokens_seen": 32810505728,
      "step": 41703
    },
    {
      "epoch": 4.424358158285593,
      "grad_norm": 0.5029492643878131,
      "learning_rate": 3.5063383706793254e-05,
      "loss": 1.2489,
      "num_input_tokens_seen": 32811292512,
      "step": 41704
    },
    {
      "epoch": 4.424464247825164,
      "grad_norm": 0.7702338151719983,
      "learning_rate": 3.5062747525359305e-05,
      "loss": 1.3828,
      "num_input_tokens_seen": 32812079264,
      "step": 41705
    },
    {
      "epoch": 4.424570337364736,
      "grad_norm": 0.4382876076198222,
      "learning_rate": 3.506211133614917e-05,
      "loss": 1.2403,
      "num_input_tokens_seen": 32812866032,
      "step": 41706
    },
    {
      "epoch": 4.424676426904307,
      "grad_norm": 0.5244673954656294,
      "learning_rate": 3.506147513916333e-05,
      "loss": 1.288,
      "num_input_tokens_seen": 32813652784,
      "step": 41707
    },
    {
      "epoch": 4.424782516443878,
      "grad_norm": 0.6047162591062722,
      "learning_rate": 3.5060838934402274e-05,
      "loss": 1.2849,
      "num_input_tokens_seen": 32814439584,
      "step": 41708
    },
    {
      "epoch": 4.42488860598345,
      "grad_norm": 0.5156772245460488,
      "learning_rate": 3.5060202721866495e-05,
      "loss": 1.3309,
      "num_input_tokens_seen": 32815226416,
      "step": 41709
    },
    {
      "epoch": 4.424994695523021,
      "grad_norm": 0.5524960591795229,
      "learning_rate": 3.50595665015565e-05,
      "loss": 1.2755,
      "num_input_tokens_seen": 32816013184,
      "step": 41710
    },
    {
      "epoch": 4.425100785062593,
      "grad_norm": 0.493248106936646,
      "learning_rate": 3.5058930273472745e-05,
      "loss": 1.2968,
      "num_input_tokens_seen": 32816799984,
      "step": 41711
    },
    {
      "epoch": 4.425206874602164,
      "grad_norm": 0.5656159181895536,
      "learning_rate": 3.505829403761576e-05,
      "loss": 1.4684,
      "num_input_tokens_seen": 32817586688,
      "step": 41712
    },
    {
      "epoch": 4.425312964141735,
      "grad_norm": 0.7141971740474241,
      "learning_rate": 3.505765779398602e-05,
      "loss": 1.3529,
      "num_input_tokens_seen": 32818373408,
      "step": 41713
    },
    {
      "epoch": 4.425419053681307,
      "grad_norm": 0.789732682967631,
      "learning_rate": 3.5057021542584014e-05,
      "loss": 1.2951,
      "num_input_tokens_seen": 32819160240,
      "step": 41714
    },
    {
      "epoch": 4.425525143220878,
      "grad_norm": 0.6601608437143465,
      "learning_rate": 3.505638528341023e-05,
      "loss": 1.2586,
      "num_input_tokens_seen": 32819947040,
      "step": 41715
    },
    {
      "epoch": 4.42563123276045,
      "grad_norm": 0.5663243128143383,
      "learning_rate": 3.505574901646517e-05,
      "loss": 1.2924,
      "num_input_tokens_seen": 32820733824,
      "step": 41716
    },
    {
      "epoch": 4.425737322300021,
      "grad_norm": 0.5268956710042418,
      "learning_rate": 3.505511274174933e-05,
      "loss": 1.25,
      "num_input_tokens_seen": 32821520640,
      "step": 41717
    },
    {
      "epoch": 4.425843411839592,
      "grad_norm": 0.5843333280875117,
      "learning_rate": 3.5054476459263184e-05,
      "loss": 1.3458,
      "num_input_tokens_seen": 32822307344,
      "step": 41718
    },
    {
      "epoch": 4.425949501379164,
      "grad_norm": 0.5406070242881764,
      "learning_rate": 3.505384016900724e-05,
      "loss": 1.321,
      "num_input_tokens_seen": 32823094096,
      "step": 41719
    },
    {
      "epoch": 4.426055590918735,
      "grad_norm": 0.5392783226382318,
      "learning_rate": 3.5053203870981984e-05,
      "loss": 1.3922,
      "num_input_tokens_seen": 32823880800,
      "step": 41720
    },
    {
      "epoch": 4.426161680458307,
      "grad_norm": 0.5908585698645493,
      "learning_rate": 3.5052567565187905e-05,
      "loss": 1.1998,
      "num_input_tokens_seen": 32824667552,
      "step": 41721
    },
    {
      "epoch": 4.426267769997878,
      "grad_norm": 0.5584947892625153,
      "learning_rate": 3.505193125162549e-05,
      "loss": 1.276,
      "num_input_tokens_seen": 32825454320,
      "step": 41722
    },
    {
      "epoch": 4.42637385953745,
      "grad_norm": 0.4825088046272522,
      "learning_rate": 3.505129493029525e-05,
      "loss": 1.2065,
      "num_input_tokens_seen": 32826241104,
      "step": 41723
    },
    {
      "epoch": 4.426479949077021,
      "grad_norm": 0.5053646686995349,
      "learning_rate": 3.505065860119766e-05,
      "loss": 1.2829,
      "num_input_tokens_seen": 32827028000,
      "step": 41724
    },
    {
      "epoch": 4.426586038616592,
      "grad_norm": 0.5072449624516826,
      "learning_rate": 3.505002226433321e-05,
      "loss": 1.373,
      "num_input_tokens_seen": 32827814656,
      "step": 41725
    },
    {
      "epoch": 4.426692128156164,
      "grad_norm": 0.553559521525387,
      "learning_rate": 3.504938591970241e-05,
      "loss": 1.2776,
      "num_input_tokens_seen": 32828601424,
      "step": 41726
    },
    {
      "epoch": 4.426798217695735,
      "grad_norm": 0.6995442986954146,
      "learning_rate": 3.504874956730573e-05,
      "loss": 1.3785,
      "num_input_tokens_seen": 32829388144,
      "step": 41727
    },
    {
      "epoch": 4.426904307235307,
      "grad_norm": 0.6375458395179846,
      "learning_rate": 3.5048113207143665e-05,
      "loss": 1.288,
      "num_input_tokens_seen": 32830174960,
      "step": 41728
    },
    {
      "epoch": 4.427010396774878,
      "grad_norm": 0.8427238845866519,
      "learning_rate": 3.504747683921672e-05,
      "loss": 1.3458,
      "num_input_tokens_seen": 32830961824,
      "step": 41729
    },
    {
      "epoch": 4.427116486314449,
      "grad_norm": 0.6160002983183724,
      "learning_rate": 3.5046840463525384e-05,
      "loss": 1.294,
      "num_input_tokens_seen": 32831748624,
      "step": 41730
    },
    {
      "epoch": 4.427222575854021,
      "grad_norm": 0.6117045108985617,
      "learning_rate": 3.5046204080070134e-05,
      "loss": 1.3141,
      "num_input_tokens_seen": 32832535392,
      "step": 41731
    },
    {
      "epoch": 4.427328665393592,
      "grad_norm": 0.6114005947376066,
      "learning_rate": 3.504556768885148e-05,
      "loss": 1.3619,
      "num_input_tokens_seen": 32833322080,
      "step": 41732
    },
    {
      "epoch": 4.427434754933164,
      "grad_norm": 0.5715283328457159,
      "learning_rate": 3.5044931289869906e-05,
      "loss": 1.3534,
      "num_input_tokens_seen": 32834108752,
      "step": 41733
    },
    {
      "epoch": 4.427540844472735,
      "grad_norm": 0.6747374247809871,
      "learning_rate": 3.50442948831259e-05,
      "loss": 1.3108,
      "num_input_tokens_seen": 32834895504,
      "step": 41734
    },
    {
      "epoch": 4.427646934012307,
      "grad_norm": 0.5798992767360224,
      "learning_rate": 3.5043658468619965e-05,
      "loss": 1.4272,
      "num_input_tokens_seen": 32835682256,
      "step": 41735
    },
    {
      "epoch": 4.427753023551878,
      "grad_norm": 0.4701877080739127,
      "learning_rate": 3.5043022046352574e-05,
      "loss": 1.3756,
      "num_input_tokens_seen": 32836469024,
      "step": 41736
    },
    {
      "epoch": 4.427859113091449,
      "grad_norm": 0.5445645495530805,
      "learning_rate": 3.504238561632424e-05,
      "loss": 1.2764,
      "num_input_tokens_seen": 32837255840,
      "step": 41737
    },
    {
      "epoch": 4.427965202631021,
      "grad_norm": 0.699495874198393,
      "learning_rate": 3.5041749178535444e-05,
      "loss": 1.3398,
      "num_input_tokens_seen": 32838042592,
      "step": 41738
    },
    {
      "epoch": 4.428071292170592,
      "grad_norm": 0.5134742312259845,
      "learning_rate": 3.5041112732986675e-05,
      "loss": 1.4029,
      "num_input_tokens_seen": 32838829360,
      "step": 41739
    },
    {
      "epoch": 4.428177381710164,
      "grad_norm": 0.6775672103781902,
      "learning_rate": 3.504047627967843e-05,
      "loss": 1.2369,
      "num_input_tokens_seen": 32839616112,
      "step": 41740
    },
    {
      "epoch": 4.428283471249735,
      "grad_norm": 0.4968473381663729,
      "learning_rate": 3.50398398186112e-05,
      "loss": 1.3047,
      "num_input_tokens_seen": 32840402800,
      "step": 41741
    },
    {
      "epoch": 4.428389560789306,
      "grad_norm": 0.4685822523782524,
      "learning_rate": 3.503920334978548e-05,
      "loss": 1.3278,
      "num_input_tokens_seen": 32841189584,
      "step": 41742
    },
    {
      "epoch": 4.428495650328878,
      "grad_norm": 0.5958147954146276,
      "learning_rate": 3.503856687320175e-05,
      "loss": 1.2899,
      "num_input_tokens_seen": 32841976320,
      "step": 41743
    },
    {
      "epoch": 4.428601739868449,
      "grad_norm": 0.9703659489537996,
      "learning_rate": 3.5037930388860514e-05,
      "loss": 1.2737,
      "num_input_tokens_seen": 32842762992,
      "step": 41744
    },
    {
      "epoch": 4.428707829408021,
      "grad_norm": 0.630247363429276,
      "learning_rate": 3.503729389676226e-05,
      "loss": 1.3022,
      "num_input_tokens_seen": 32843549808,
      "step": 41745
    },
    {
      "epoch": 4.428813918947592,
      "grad_norm": 0.8661845649277079,
      "learning_rate": 3.503665739690748e-05,
      "loss": 1.3746,
      "num_input_tokens_seen": 32844336512,
      "step": 41746
    },
    {
      "epoch": 4.428920008487163,
      "grad_norm": 0.7423824623874222,
      "learning_rate": 3.503602088929667e-05,
      "loss": 1.3249,
      "num_input_tokens_seen": 32845123248,
      "step": 41747
    },
    {
      "epoch": 4.429026098026735,
      "grad_norm": 0.8952243590691134,
      "learning_rate": 3.503538437393031e-05,
      "loss": 1.4198,
      "num_input_tokens_seen": 32845909840,
      "step": 41748
    },
    {
      "epoch": 4.429132187566306,
      "grad_norm": 0.9121700374052548,
      "learning_rate": 3.5034747850808905e-05,
      "loss": 1.3488,
      "num_input_tokens_seen": 32846696640,
      "step": 41749
    },
    {
      "epoch": 4.429238277105878,
      "grad_norm": 0.6550101102350236,
      "learning_rate": 3.503411131993294e-05,
      "loss": 1.4049,
      "num_input_tokens_seen": 32847483408,
      "step": 41750
    },
    {
      "epoch": 4.429344366645449,
      "grad_norm": 0.6692825364903803,
      "learning_rate": 3.50334747813029e-05,
      "loss": 1.2493,
      "num_input_tokens_seen": 32848270128,
      "step": 41751
    },
    {
      "epoch": 4.4294504561850205,
      "grad_norm": 0.8508554414008263,
      "learning_rate": 3.5032838234919294e-05,
      "loss": 1.3389,
      "num_input_tokens_seen": 32849056784,
      "step": 41752
    },
    {
      "epoch": 4.429556545724592,
      "grad_norm": 0.4835336574757018,
      "learning_rate": 3.503220168078261e-05,
      "loss": 1.2936,
      "num_input_tokens_seen": 32849843504,
      "step": 41753
    },
    {
      "epoch": 4.429662635264163,
      "grad_norm": 0.9730329188115978,
      "learning_rate": 3.503156511889332e-05,
      "loss": 1.3335,
      "num_input_tokens_seen": 32850630304,
      "step": 41754
    },
    {
      "epoch": 4.4297687248037345,
      "grad_norm": 0.8278431937484728,
      "learning_rate": 3.503092854925194e-05,
      "loss": 1.3119,
      "num_input_tokens_seen": 32851416944,
      "step": 41755
    },
    {
      "epoch": 4.4298748143433055,
      "grad_norm": 0.558449871745572,
      "learning_rate": 3.503029197185896e-05,
      "loss": 1.2521,
      "num_input_tokens_seen": 32852203776,
      "step": 41756
    },
    {
      "epoch": 4.4299809038828775,
      "grad_norm": 0.7953142496015493,
      "learning_rate": 3.502965538671485e-05,
      "loss": 1.196,
      "num_input_tokens_seen": 32852990576,
      "step": 41757
    },
    {
      "epoch": 4.4300869934224485,
      "grad_norm": 0.833351043010492,
      "learning_rate": 3.5029018793820124e-05,
      "loss": 1.3631,
      "num_input_tokens_seen": 32853777280,
      "step": 41758
    },
    {
      "epoch": 4.43019308296202,
      "grad_norm": 0.6083272916768819,
      "learning_rate": 3.5028382193175265e-05,
      "loss": 1.3064,
      "num_input_tokens_seen": 32854564112,
      "step": 41759
    },
    {
      "epoch": 4.430299172501591,
      "grad_norm": 0.8573425412405321,
      "learning_rate": 3.5027745584780766e-05,
      "loss": 1.3727,
      "num_input_tokens_seen": 32855350928,
      "step": 41760
    },
    {
      "epoch": 4.4304052620411625,
      "grad_norm": 0.6949745330855871,
      "learning_rate": 3.502710896863712e-05,
      "loss": 1.3528,
      "num_input_tokens_seen": 32856137616,
      "step": 41761
    },
    {
      "epoch": 4.430511351580734,
      "grad_norm": 0.5914792486141782,
      "learning_rate": 3.502647234474482e-05,
      "loss": 1.3396,
      "num_input_tokens_seen": 32856924384,
      "step": 41762
    },
    {
      "epoch": 4.430617441120305,
      "grad_norm": 0.8738839912648549,
      "learning_rate": 3.502583571310436e-05,
      "loss": 1.244,
      "num_input_tokens_seen": 32857711168,
      "step": 41763
    },
    {
      "epoch": 4.430723530659877,
      "grad_norm": 0.7446666262565256,
      "learning_rate": 3.502519907371622e-05,
      "loss": 1.3052,
      "num_input_tokens_seen": 32858497888,
      "step": 41764
    },
    {
      "epoch": 4.430829620199448,
      "grad_norm": 0.5424812859582897,
      "learning_rate": 3.50245624265809e-05,
      "loss": 1.3781,
      "num_input_tokens_seen": 32859284592,
      "step": 41765
    },
    {
      "epoch": 4.430935709739019,
      "grad_norm": 0.982995262814739,
      "learning_rate": 3.5023925771698904e-05,
      "loss": 1.2968,
      "num_input_tokens_seen": 32860071344,
      "step": 41766
    },
    {
      "epoch": 4.431041799278591,
      "grad_norm": 0.5599108573285285,
      "learning_rate": 3.502328910907071e-05,
      "loss": 1.3029,
      "num_input_tokens_seen": 32860858096,
      "step": 41767
    },
    {
      "epoch": 4.431147888818162,
      "grad_norm": 0.5992455435832647,
      "learning_rate": 3.50226524386968e-05,
      "loss": 1.2817,
      "num_input_tokens_seen": 32861644832,
      "step": 41768
    },
    {
      "epoch": 4.431253978357734,
      "grad_norm": 0.6711043121481621,
      "learning_rate": 3.502201576057769e-05,
      "loss": 1.26,
      "num_input_tokens_seen": 32862431504,
      "step": 41769
    },
    {
      "epoch": 4.431360067897305,
      "grad_norm": 0.5389507062599065,
      "learning_rate": 3.5021379074713855e-05,
      "loss": 1.3223,
      "num_input_tokens_seen": 32863218352,
      "step": 41770
    },
    {
      "epoch": 4.431466157436876,
      "grad_norm": 0.5227659401515216,
      "learning_rate": 3.502074238110579e-05,
      "loss": 1.2297,
      "num_input_tokens_seen": 32864005152,
      "step": 41771
    },
    {
      "epoch": 4.431572246976448,
      "grad_norm": 0.5428829638265248,
      "learning_rate": 3.502010567975399e-05,
      "loss": 1.2889,
      "num_input_tokens_seen": 32864791952,
      "step": 41772
    },
    {
      "epoch": 4.431678336516019,
      "grad_norm": 0.5618551957102788,
      "learning_rate": 3.5019468970658956e-05,
      "loss": 1.2858,
      "num_input_tokens_seen": 32865578768,
      "step": 41773
    },
    {
      "epoch": 4.431784426055591,
      "grad_norm": 0.6333207331473053,
      "learning_rate": 3.501883225382115e-05,
      "loss": 1.3282,
      "num_input_tokens_seen": 32866365536,
      "step": 41774
    },
    {
      "epoch": 4.431890515595162,
      "grad_norm": 0.5439248891150581,
      "learning_rate": 3.50181955292411e-05,
      "loss": 1.3204,
      "num_input_tokens_seen": 32867152320,
      "step": 41775
    },
    {
      "epoch": 4.431996605134733,
      "grad_norm": 0.48693072784524966,
      "learning_rate": 3.501755879691928e-05,
      "loss": 1.2853,
      "num_input_tokens_seen": 32867939040,
      "step": 41776
    },
    {
      "epoch": 4.432102694674305,
      "grad_norm": 0.5482532844676261,
      "learning_rate": 3.5016922056856186e-05,
      "loss": 1.3692,
      "num_input_tokens_seen": 32868725792,
      "step": 41777
    },
    {
      "epoch": 4.432208784213876,
      "grad_norm": 0.5697088698237696,
      "learning_rate": 3.501628530905231e-05,
      "loss": 1.2788,
      "num_input_tokens_seen": 32869512624,
      "step": 41778
    },
    {
      "epoch": 4.432314873753448,
      "grad_norm": 0.48086986745651167,
      "learning_rate": 3.5015648553508135e-05,
      "loss": 1.3013,
      "num_input_tokens_seen": 32870299360,
      "step": 41779
    },
    {
      "epoch": 4.432420963293019,
      "grad_norm": 0.49717270948894754,
      "learning_rate": 3.501501179022417e-05,
      "loss": 1.2593,
      "num_input_tokens_seen": 32871086160,
      "step": 41780
    },
    {
      "epoch": 4.432527052832591,
      "grad_norm": 0.4560272425191122,
      "learning_rate": 3.501437501920089e-05,
      "loss": 1.2302,
      "num_input_tokens_seen": 32871873024,
      "step": 41781
    },
    {
      "epoch": 4.432633142372162,
      "grad_norm": 0.5254779337929358,
      "learning_rate": 3.50137382404388e-05,
      "loss": 1.226,
      "num_input_tokens_seen": 32872659744,
      "step": 41782
    },
    {
      "epoch": 4.432739231911733,
      "grad_norm": 0.526182252417862,
      "learning_rate": 3.501310145393838e-05,
      "loss": 1.2758,
      "num_input_tokens_seen": 32873446496,
      "step": 41783
    },
    {
      "epoch": 4.432845321451305,
      "grad_norm": 0.4896924743261563,
      "learning_rate": 3.501246465970014e-05,
      "loss": 1.3377,
      "num_input_tokens_seen": 32874233200,
      "step": 41784
    },
    {
      "epoch": 4.432951410990876,
      "grad_norm": 0.5346145017588562,
      "learning_rate": 3.501182785772455e-05,
      "loss": 1.3086,
      "num_input_tokens_seen": 32875019968,
      "step": 41785
    },
    {
      "epoch": 4.433057500530448,
      "grad_norm": 0.6405975540440058,
      "learning_rate": 3.501119104801212e-05,
      "loss": 1.3078,
      "num_input_tokens_seen": 32875806784,
      "step": 41786
    },
    {
      "epoch": 4.433163590070019,
      "grad_norm": 0.5055073313689364,
      "learning_rate": 3.501055423056333e-05,
      "loss": 1.3301,
      "num_input_tokens_seen": 32876593472,
      "step": 41787
    },
    {
      "epoch": 4.433269679609591,
      "grad_norm": 0.5254215719836931,
      "learning_rate": 3.500991740537868e-05,
      "loss": 1.2059,
      "num_input_tokens_seen": 32877380224,
      "step": 41788
    },
    {
      "epoch": 4.433375769149162,
      "grad_norm": 0.6117518842791371,
      "learning_rate": 3.500928057245866e-05,
      "loss": 1.2733,
      "num_input_tokens_seen": 32878166960,
      "step": 41789
    },
    {
      "epoch": 4.433481858688733,
      "grad_norm": 0.44987338030994933,
      "learning_rate": 3.500864373180376e-05,
      "loss": 1.2892,
      "num_input_tokens_seen": 32878953712,
      "step": 41790
    },
    {
      "epoch": 4.433587948228305,
      "grad_norm": 0.612910455869703,
      "learning_rate": 3.500800688341447e-05,
      "loss": 1.2609,
      "num_input_tokens_seen": 32879740480,
      "step": 41791
    },
    {
      "epoch": 4.433694037767876,
      "grad_norm": 0.5108575760316555,
      "learning_rate": 3.50073700272913e-05,
      "loss": 1.2619,
      "num_input_tokens_seen": 32880527280,
      "step": 41792
    },
    {
      "epoch": 4.433800127307448,
      "grad_norm": 0.5390526247339914,
      "learning_rate": 3.500673316343472e-05,
      "loss": 1.3312,
      "num_input_tokens_seen": 32881314048,
      "step": 41793
    },
    {
      "epoch": 4.433906216847019,
      "grad_norm": 0.7858646689081287,
      "learning_rate": 3.500609629184523e-05,
      "loss": 1.2642,
      "num_input_tokens_seen": 32882100816,
      "step": 41794
    },
    {
      "epoch": 4.43401230638659,
      "grad_norm": 0.6735580376753698,
      "learning_rate": 3.500545941252332e-05,
      "loss": 1.2849,
      "num_input_tokens_seen": 32882887488,
      "step": 41795
    },
    {
      "epoch": 4.434118395926162,
      "grad_norm": 0.5818364823145686,
      "learning_rate": 3.500482252546949e-05,
      "loss": 1.3332,
      "num_input_tokens_seen": 32883674320,
      "step": 41796
    },
    {
      "epoch": 4.434224485465733,
      "grad_norm": 1.0063902861324951,
      "learning_rate": 3.500418563068422e-05,
      "loss": 1.3432,
      "num_input_tokens_seen": 32884461104,
      "step": 41797
    },
    {
      "epoch": 4.434330575005305,
      "grad_norm": 0.6491209974439337,
      "learning_rate": 3.500354872816801e-05,
      "loss": 1.4859,
      "num_input_tokens_seen": 32885247808,
      "step": 41798
    },
    {
      "epoch": 4.434436664544876,
      "grad_norm": 0.6888848698564077,
      "learning_rate": 3.500291181792136e-05,
      "loss": 1.267,
      "num_input_tokens_seen": 32886034624,
      "step": 41799
    },
    {
      "epoch": 4.434542754084447,
      "grad_norm": 0.7207912523127243,
      "learning_rate": 3.500227489994474e-05,
      "loss": 1.2991,
      "num_input_tokens_seen": 32886821328,
      "step": 41800
    },
    {
      "epoch": 4.434648843624019,
      "grad_norm": 0.679354634494216,
      "learning_rate": 3.500163797423866e-05,
      "loss": 1.294,
      "num_input_tokens_seen": 32887608080,
      "step": 41801
    },
    {
      "epoch": 4.43475493316359,
      "grad_norm": 0.7754875628382537,
      "learning_rate": 3.500100104080361e-05,
      "loss": 1.2116,
      "num_input_tokens_seen": 32888394864,
      "step": 41802
    },
    {
      "epoch": 4.434861022703162,
      "grad_norm": 0.811960820829707,
      "learning_rate": 3.500036409964008e-05,
      "loss": 1.3643,
      "num_input_tokens_seen": 32889181680,
      "step": 41803
    },
    {
      "epoch": 4.434967112242733,
      "grad_norm": 0.5181934534759249,
      "learning_rate": 3.4999727150748565e-05,
      "loss": 1.3587,
      "num_input_tokens_seen": 32889968384,
      "step": 41804
    },
    {
      "epoch": 4.435073201782304,
      "grad_norm": 0.7551510400381004,
      "learning_rate": 3.4999090194129544e-05,
      "loss": 1.2579,
      "num_input_tokens_seen": 32890755104,
      "step": 41805
    },
    {
      "epoch": 4.435179291321876,
      "grad_norm": 0.5755326969063388,
      "learning_rate": 3.499845322978354e-05,
      "loss": 1.327,
      "num_input_tokens_seen": 32891541936,
      "step": 41806
    },
    {
      "epoch": 4.435285380861447,
      "grad_norm": 0.6640312262670818,
      "learning_rate": 3.4997816257711003e-05,
      "loss": 1.3336,
      "num_input_tokens_seen": 32892328672,
      "step": 41807
    },
    {
      "epoch": 4.435391470401019,
      "grad_norm": 0.595578483326658,
      "learning_rate": 3.499717927791245e-05,
      "loss": 1.3582,
      "num_input_tokens_seen": 32893115392,
      "step": 41808
    },
    {
      "epoch": 4.43549755994059,
      "grad_norm": 0.8426613039786242,
      "learning_rate": 3.499654229038838e-05,
      "loss": 1.2785,
      "num_input_tokens_seen": 32893902160,
      "step": 41809
    },
    {
      "epoch": 4.435603649480162,
      "grad_norm": 0.7245618241790317,
      "learning_rate": 3.4995905295139274e-05,
      "loss": 1.3203,
      "num_input_tokens_seen": 32894688896,
      "step": 41810
    },
    {
      "epoch": 4.435709739019733,
      "grad_norm": 0.740369096150793,
      "learning_rate": 3.499526829216562e-05,
      "loss": 1.3217,
      "num_input_tokens_seen": 32895475728,
      "step": 41811
    },
    {
      "epoch": 4.435815828559304,
      "grad_norm": 0.9083474832186916,
      "learning_rate": 3.4994631281467913e-05,
      "loss": 1.3413,
      "num_input_tokens_seen": 32896262432,
      "step": 41812
    },
    {
      "epoch": 4.435921918098876,
      "grad_norm": 0.7158741097438451,
      "learning_rate": 3.499399426304666e-05,
      "loss": 1.3031,
      "num_input_tokens_seen": 32897049104,
      "step": 41813
    },
    {
      "epoch": 4.436028007638447,
      "grad_norm": 0.7961738100781476,
      "learning_rate": 3.499335723690233e-05,
      "loss": 1.3033,
      "num_input_tokens_seen": 32897835840,
      "step": 41814
    },
    {
      "epoch": 4.4361340971780185,
      "grad_norm": 1.052042289098452,
      "learning_rate": 3.499272020303543e-05,
      "loss": 1.3055,
      "num_input_tokens_seen": 32898622624,
      "step": 41815
    },
    {
      "epoch": 4.43624018671759,
      "grad_norm": 0.7131994715026487,
      "learning_rate": 3.499208316144646e-05,
      "loss": 1.1792,
      "num_input_tokens_seen": 32899409328,
      "step": 41816
    },
    {
      "epoch": 4.4363462762571615,
      "grad_norm": 1.044585593088195,
      "learning_rate": 3.4991446112135884e-05,
      "loss": 1.3689,
      "num_input_tokens_seen": 32900196048,
      "step": 41817
    },
    {
      "epoch": 4.4364523657967325,
      "grad_norm": 0.7286876475105003,
      "learning_rate": 3.4990809055104225e-05,
      "loss": 1.3916,
      "num_input_tokens_seen": 32900982784,
      "step": 41818
    },
    {
      "epoch": 4.4365584553363036,
      "grad_norm": 0.7523213909635099,
      "learning_rate": 3.499017199035195e-05,
      "loss": 1.4111,
      "num_input_tokens_seen": 32901769552,
      "step": 41819
    },
    {
      "epoch": 4.4366645448758755,
      "grad_norm": 0.5783197577930981,
      "learning_rate": 3.4989534917879576e-05,
      "loss": 1.3229,
      "num_input_tokens_seen": 32902556288,
      "step": 41820
    },
    {
      "epoch": 4.4367706344154465,
      "grad_norm": 0.8742140908229453,
      "learning_rate": 3.498889783768757e-05,
      "loss": 1.3941,
      "num_input_tokens_seen": 32903342976,
      "step": 41821
    },
    {
      "epoch": 4.436876723955018,
      "grad_norm": 0.8532978194821518,
      "learning_rate": 3.4988260749776444e-05,
      "loss": 1.3782,
      "num_input_tokens_seen": 32904129696,
      "step": 41822
    },
    {
      "epoch": 4.4369828134945895,
      "grad_norm": 0.578955554899647,
      "learning_rate": 3.4987623654146686e-05,
      "loss": 1.3207,
      "num_input_tokens_seen": 32904916400,
      "step": 41823
    },
    {
      "epoch": 4.4370889030341605,
      "grad_norm": 0.9851757836297487,
      "learning_rate": 3.4986986550798784e-05,
      "loss": 1.3226,
      "num_input_tokens_seen": 32905703232,
      "step": 41824
    },
    {
      "epoch": 4.437194992573732,
      "grad_norm": 1.0950561473340634,
      "learning_rate": 3.4986349439733226e-05,
      "loss": 1.3804,
      "num_input_tokens_seen": 32906490048,
      "step": 41825
    },
    {
      "epoch": 4.437301082113303,
      "grad_norm": 0.6024566761488592,
      "learning_rate": 3.498571232095051e-05,
      "loss": 1.4068,
      "num_input_tokens_seen": 32907276768,
      "step": 41826
    },
    {
      "epoch": 4.437407171652875,
      "grad_norm": 0.9955629050910912,
      "learning_rate": 3.498507519445114e-05,
      "loss": 1.3129,
      "num_input_tokens_seen": 32908063616,
      "step": 41827
    },
    {
      "epoch": 4.437513261192446,
      "grad_norm": 1.3373880071655764,
      "learning_rate": 3.498443806023558e-05,
      "loss": 1.3312,
      "num_input_tokens_seen": 32908850320,
      "step": 41828
    },
    {
      "epoch": 4.437619350732017,
      "grad_norm": 0.7388104800991193,
      "learning_rate": 3.4983800918304355e-05,
      "loss": 1.3524,
      "num_input_tokens_seen": 32909637120,
      "step": 41829
    },
    {
      "epoch": 4.437725440271589,
      "grad_norm": 1.3775394718518057,
      "learning_rate": 3.498316376865794e-05,
      "loss": 1.4151,
      "num_input_tokens_seen": 32910423824,
      "step": 41830
    },
    {
      "epoch": 4.43783152981116,
      "grad_norm": 1.369168837906328,
      "learning_rate": 3.498252661129682e-05,
      "loss": 1.3506,
      "num_input_tokens_seen": 32911210512,
      "step": 41831
    },
    {
      "epoch": 4.437937619350732,
      "grad_norm": 0.9019588472267666,
      "learning_rate": 3.49818894462215e-05,
      "loss": 1.2572,
      "num_input_tokens_seen": 32911997360,
      "step": 41832
    },
    {
      "epoch": 4.438043708890303,
      "grad_norm": 0.5902834346450113,
      "learning_rate": 3.4981252273432466e-05,
      "loss": 1.2441,
      "num_input_tokens_seen": 32912784160,
      "step": 41833
    },
    {
      "epoch": 4.438149798429875,
      "grad_norm": 0.7285141796957514,
      "learning_rate": 3.498061509293022e-05,
      "loss": 1.1674,
      "num_input_tokens_seen": 32913570992,
      "step": 41834
    },
    {
      "epoch": 4.438255887969446,
      "grad_norm": 0.9179421792235497,
      "learning_rate": 3.4979977904715245e-05,
      "loss": 1.3245,
      "num_input_tokens_seen": 32914357712,
      "step": 41835
    },
    {
      "epoch": 4.438361977509017,
      "grad_norm": 0.6464141198490678,
      "learning_rate": 3.497934070878803e-05,
      "loss": 1.3577,
      "num_input_tokens_seen": 32915144432,
      "step": 41836
    },
    {
      "epoch": 4.438468067048589,
      "grad_norm": 0.7753773911844908,
      "learning_rate": 3.497870350514908e-05,
      "loss": 1.2669,
      "num_input_tokens_seen": 32915931152,
      "step": 41837
    },
    {
      "epoch": 4.43857415658816,
      "grad_norm": 0.7873338043200591,
      "learning_rate": 3.497806629379888e-05,
      "loss": 1.296,
      "num_input_tokens_seen": 32916717920,
      "step": 41838
    },
    {
      "epoch": 4.438680246127732,
      "grad_norm": 0.5792652088605603,
      "learning_rate": 3.497742907473792e-05,
      "loss": 1.3233,
      "num_input_tokens_seen": 32917504704,
      "step": 41839
    },
    {
      "epoch": 4.438786335667303,
      "grad_norm": 0.9010488622376392,
      "learning_rate": 3.497679184796669e-05,
      "loss": 1.4209,
      "num_input_tokens_seen": 32918291376,
      "step": 41840
    },
    {
      "epoch": 4.438892425206874,
      "grad_norm": 0.6471723329513186,
      "learning_rate": 3.49761546134857e-05,
      "loss": 1.3188,
      "num_input_tokens_seen": 32919078144,
      "step": 41841
    },
    {
      "epoch": 4.438998514746446,
      "grad_norm": 0.5887801350664486,
      "learning_rate": 3.497551737129543e-05,
      "loss": 1.3667,
      "num_input_tokens_seen": 32919864864,
      "step": 41842
    },
    {
      "epoch": 4.439104604286017,
      "grad_norm": 0.6722714245459791,
      "learning_rate": 3.497488012139636e-05,
      "loss": 1.3132,
      "num_input_tokens_seen": 32920651584,
      "step": 41843
    },
    {
      "epoch": 4.439210693825589,
      "grad_norm": 0.625585208519531,
      "learning_rate": 3.497424286378901e-05,
      "loss": 1.4235,
      "num_input_tokens_seen": 32921438336,
      "step": 41844
    },
    {
      "epoch": 4.43931678336516,
      "grad_norm": 0.517864481986287,
      "learning_rate": 3.4973605598473847e-05,
      "loss": 1.3239,
      "num_input_tokens_seen": 32922225136,
      "step": 41845
    },
    {
      "epoch": 4.439422872904732,
      "grad_norm": 0.56638605084008,
      "learning_rate": 3.497296832545138e-05,
      "loss": 1.403,
      "num_input_tokens_seen": 32923011872,
      "step": 41846
    },
    {
      "epoch": 4.439528962444303,
      "grad_norm": 0.650769245915088,
      "learning_rate": 3.4972331044722095e-05,
      "loss": 1.3286,
      "num_input_tokens_seen": 32923798704,
      "step": 41847
    },
    {
      "epoch": 4.439635051983874,
      "grad_norm": 0.5197247301480353,
      "learning_rate": 3.497169375628648e-05,
      "loss": 1.3265,
      "num_input_tokens_seen": 32924585472,
      "step": 41848
    },
    {
      "epoch": 4.439741141523446,
      "grad_norm": 0.63044318584637,
      "learning_rate": 3.497105646014504e-05,
      "loss": 1.3541,
      "num_input_tokens_seen": 32925372160,
      "step": 41849
    },
    {
      "epoch": 4.439847231063017,
      "grad_norm": 0.6093488160565658,
      "learning_rate": 3.4970419156298265e-05,
      "loss": 1.3183,
      "num_input_tokens_seen": 32926158896,
      "step": 41850
    },
    {
      "epoch": 4.439953320602589,
      "grad_norm": 0.47987307240294685,
      "learning_rate": 3.496978184474663e-05,
      "loss": 1.3925,
      "num_input_tokens_seen": 32926945664,
      "step": 41851
    },
    {
      "epoch": 4.44005941014216,
      "grad_norm": 0.5596021513072768,
      "learning_rate": 3.4969144525490645e-05,
      "loss": 1.3107,
      "num_input_tokens_seen": 32927732384,
      "step": 41852
    },
    {
      "epoch": 4.440165499681731,
      "grad_norm": 0.5416080153880827,
      "learning_rate": 3.4968507198530796e-05,
      "loss": 1.2955,
      "num_input_tokens_seen": 32928519088,
      "step": 41853
    },
    {
      "epoch": 4.440271589221303,
      "grad_norm": 0.5316364269456633,
      "learning_rate": 3.496786986386758e-05,
      "loss": 1.2779,
      "num_input_tokens_seen": 32929305856,
      "step": 41854
    },
    {
      "epoch": 4.440377678760874,
      "grad_norm": 0.6985254706848776,
      "learning_rate": 3.496723252150149e-05,
      "loss": 1.2131,
      "num_input_tokens_seen": 32930092640,
      "step": 41855
    },
    {
      "epoch": 4.440483768300446,
      "grad_norm": 0.5577089557229602,
      "learning_rate": 3.496659517143301e-05,
      "loss": 1.363,
      "num_input_tokens_seen": 32930879408,
      "step": 41856
    },
    {
      "epoch": 4.440589857840017,
      "grad_norm": 0.7903012445586526,
      "learning_rate": 3.4965957813662634e-05,
      "loss": 1.3064,
      "num_input_tokens_seen": 32931666080,
      "step": 41857
    },
    {
      "epoch": 4.440695947379588,
      "grad_norm": 0.602308144460392,
      "learning_rate": 3.4965320448190865e-05,
      "loss": 1.2942,
      "num_input_tokens_seen": 32932452800,
      "step": 41858
    },
    {
      "epoch": 4.44080203691916,
      "grad_norm": 0.5263603271467393,
      "learning_rate": 3.496468307501819e-05,
      "loss": 1.1456,
      "num_input_tokens_seen": 32933239680,
      "step": 41859
    },
    {
      "epoch": 4.440908126458731,
      "grad_norm": 0.6098467474380814,
      "learning_rate": 3.4964045694145095e-05,
      "loss": 1.2984,
      "num_input_tokens_seen": 32934026400,
      "step": 41860
    },
    {
      "epoch": 4.441014215998303,
      "grad_norm": 0.6150242202138728,
      "learning_rate": 3.4963408305572076e-05,
      "loss": 1.3986,
      "num_input_tokens_seen": 32934813056,
      "step": 41861
    },
    {
      "epoch": 4.441120305537874,
      "grad_norm": 0.6313136211311438,
      "learning_rate": 3.496277090929963e-05,
      "loss": 1.3396,
      "num_input_tokens_seen": 32935599728,
      "step": 41862
    },
    {
      "epoch": 4.441226395077446,
      "grad_norm": 0.6468337531357282,
      "learning_rate": 3.4962133505328254e-05,
      "loss": 1.3263,
      "num_input_tokens_seen": 32936386432,
      "step": 41863
    },
    {
      "epoch": 4.441332484617017,
      "grad_norm": 0.505989860186352,
      "learning_rate": 3.496149609365842e-05,
      "loss": 1.2148,
      "num_input_tokens_seen": 32937173184,
      "step": 41864
    },
    {
      "epoch": 4.441438574156588,
      "grad_norm": 0.6880328014289758,
      "learning_rate": 3.4960858674290645e-05,
      "loss": 1.3833,
      "num_input_tokens_seen": 32937959952,
      "step": 41865
    },
    {
      "epoch": 4.44154466369616,
      "grad_norm": 0.540716885258253,
      "learning_rate": 3.496022124722541e-05,
      "loss": 1.3619,
      "num_input_tokens_seen": 32938746672,
      "step": 41866
    },
    {
      "epoch": 4.441650753235731,
      "grad_norm": 0.7358547080028546,
      "learning_rate": 3.4959583812463205e-05,
      "loss": 1.3802,
      "num_input_tokens_seen": 32939533424,
      "step": 41867
    },
    {
      "epoch": 4.441756842775303,
      "grad_norm": 0.5604333586398035,
      "learning_rate": 3.4958946370004524e-05,
      "loss": 1.367,
      "num_input_tokens_seen": 32940320096,
      "step": 41868
    },
    {
      "epoch": 4.441862932314874,
      "grad_norm": 0.6062083261337566,
      "learning_rate": 3.495830891984987e-05,
      "loss": 1.2689,
      "num_input_tokens_seen": 32941106896,
      "step": 41869
    },
    {
      "epoch": 4.441969021854445,
      "grad_norm": 0.530935416061265,
      "learning_rate": 3.495767146199972e-05,
      "loss": 1.2812,
      "num_input_tokens_seen": 32941893664,
      "step": 41870
    },
    {
      "epoch": 4.442075111394017,
      "grad_norm": 0.52527913512701,
      "learning_rate": 3.495703399645457e-05,
      "loss": 1.2122,
      "num_input_tokens_seen": 32942680320,
      "step": 41871
    },
    {
      "epoch": 4.442181200933588,
      "grad_norm": 0.7186780909790367,
      "learning_rate": 3.495639652321493e-05,
      "loss": 1.4154,
      "num_input_tokens_seen": 32943467168,
      "step": 41872
    },
    {
      "epoch": 4.44228729047316,
      "grad_norm": 0.9734788786527554,
      "learning_rate": 3.4955759042281265e-05,
      "loss": 1.3374,
      "num_input_tokens_seen": 32944254000,
      "step": 41873
    },
    {
      "epoch": 4.442393380012731,
      "grad_norm": 0.7330173562922401,
      "learning_rate": 3.4955121553654085e-05,
      "loss": 1.3336,
      "num_input_tokens_seen": 32945040816,
      "step": 41874
    },
    {
      "epoch": 4.442499469552303,
      "grad_norm": 1.0876002420816187,
      "learning_rate": 3.495448405733388e-05,
      "loss": 1.2301,
      "num_input_tokens_seen": 32945827520,
      "step": 41875
    },
    {
      "epoch": 4.442605559091874,
      "grad_norm": 0.6347586863869111,
      "learning_rate": 3.4953846553321145e-05,
      "loss": 1.3972,
      "num_input_tokens_seen": 32946614128,
      "step": 41876
    },
    {
      "epoch": 4.442711648631445,
      "grad_norm": 0.7493146310032489,
      "learning_rate": 3.495320904161636e-05,
      "loss": 1.2619,
      "num_input_tokens_seen": 32947400928,
      "step": 41877
    },
    {
      "epoch": 4.4428177381710166,
      "grad_norm": 0.9072851629899161,
      "learning_rate": 3.495257152222004e-05,
      "loss": 1.3724,
      "num_input_tokens_seen": 32948187776,
      "step": 41878
    },
    {
      "epoch": 4.442923827710588,
      "grad_norm": 0.5857332511315927,
      "learning_rate": 3.495193399513266e-05,
      "loss": 1.3429,
      "num_input_tokens_seen": 32948974432,
      "step": 41879
    },
    {
      "epoch": 4.4430299172501595,
      "grad_norm": 0.6625027541421125,
      "learning_rate": 3.495129646035471e-05,
      "loss": 1.3005,
      "num_input_tokens_seen": 32949761264,
      "step": 41880
    },
    {
      "epoch": 4.4431360067897305,
      "grad_norm": 0.5579137498021516,
      "learning_rate": 3.49506589178867e-05,
      "loss": 1.2924,
      "num_input_tokens_seen": 32950548048,
      "step": 41881
    },
    {
      "epoch": 4.443242096329302,
      "grad_norm": 0.670130323444599,
      "learning_rate": 3.495002136772911e-05,
      "loss": 1.4759,
      "num_input_tokens_seen": 32951334720,
      "step": 41882
    },
    {
      "epoch": 4.4433481858688735,
      "grad_norm": 0.4887312176468717,
      "learning_rate": 3.494938380988243e-05,
      "loss": 1.317,
      "num_input_tokens_seen": 32952121344,
      "step": 41883
    },
    {
      "epoch": 4.4434542754084445,
      "grad_norm": 0.6593577567425973,
      "learning_rate": 3.494874624434717e-05,
      "loss": 1.2913,
      "num_input_tokens_seen": 32952908224,
      "step": 41884
    },
    {
      "epoch": 4.443560364948016,
      "grad_norm": 0.5831978055276725,
      "learning_rate": 3.4948108671123795e-05,
      "loss": 1.3242,
      "num_input_tokens_seen": 32953694896,
      "step": 41885
    },
    {
      "epoch": 4.4436664544875875,
      "grad_norm": 0.6336831920582664,
      "learning_rate": 3.494747109021282e-05,
      "loss": 1.3718,
      "num_input_tokens_seen": 32954481600,
      "step": 41886
    },
    {
      "epoch": 4.4437725440271585,
      "grad_norm": 0.5572301686700382,
      "learning_rate": 3.494683350161473e-05,
      "loss": 1.3354,
      "num_input_tokens_seen": 32955268304,
      "step": 41887
    },
    {
      "epoch": 4.44387863356673,
      "grad_norm": 0.5792159548524195,
      "learning_rate": 3.4946195905330024e-05,
      "loss": 1.3271,
      "num_input_tokens_seen": 32956055136,
      "step": 41888
    },
    {
      "epoch": 4.443984723106301,
      "grad_norm": 0.6262028922431764,
      "learning_rate": 3.4945558301359196e-05,
      "loss": 1.3222,
      "num_input_tokens_seen": 32956841840,
      "step": 41889
    },
    {
      "epoch": 4.444090812645873,
      "grad_norm": 0.682806069381135,
      "learning_rate": 3.494492068970272e-05,
      "loss": 1.3454,
      "num_input_tokens_seen": 32957628672,
      "step": 41890
    },
    {
      "epoch": 4.444196902185444,
      "grad_norm": 0.6830560730077715,
      "learning_rate": 3.49442830703611e-05,
      "loss": 1.3082,
      "num_input_tokens_seen": 32958415456,
      "step": 41891
    },
    {
      "epoch": 4.444302991725016,
      "grad_norm": 0.5478632929060384,
      "learning_rate": 3.494364544333484e-05,
      "loss": 1.2304,
      "num_input_tokens_seen": 32959202240,
      "step": 41892
    },
    {
      "epoch": 4.444409081264587,
      "grad_norm": 0.716941632327191,
      "learning_rate": 3.4943007808624414e-05,
      "loss": 1.2734,
      "num_input_tokens_seen": 32959989040,
      "step": 41893
    },
    {
      "epoch": 4.444515170804158,
      "grad_norm": 0.8189144515450681,
      "learning_rate": 3.494237016623033e-05,
      "loss": 1.3105,
      "num_input_tokens_seen": 32960775840,
      "step": 41894
    },
    {
      "epoch": 4.44462126034373,
      "grad_norm": 0.6714374535913776,
      "learning_rate": 3.494173251615307e-05,
      "loss": 1.3373,
      "num_input_tokens_seen": 32961562544,
      "step": 41895
    },
    {
      "epoch": 4.444727349883301,
      "grad_norm": 0.9106017018614155,
      "learning_rate": 3.494109485839313e-05,
      "loss": 1.4278,
      "num_input_tokens_seen": 32962349264,
      "step": 41896
    },
    {
      "epoch": 4.444833439422873,
      "grad_norm": 0.8097061410806939,
      "learning_rate": 3.4940457192951006e-05,
      "loss": 1.3806,
      "num_input_tokens_seen": 32963136000,
      "step": 41897
    },
    {
      "epoch": 4.444939528962444,
      "grad_norm": 0.7480937176251102,
      "learning_rate": 3.493981951982719e-05,
      "loss": 1.3585,
      "num_input_tokens_seen": 32963922720,
      "step": 41898
    },
    {
      "epoch": 4.445045618502015,
      "grad_norm": 0.7881377696350721,
      "learning_rate": 3.493918183902217e-05,
      "loss": 1.3196,
      "num_input_tokens_seen": 32964709536,
      "step": 41899
    },
    {
      "epoch": 4.445151708041587,
      "grad_norm": 0.723738010272167,
      "learning_rate": 3.493854415053644e-05,
      "loss": 1.3188,
      "num_input_tokens_seen": 32965496224,
      "step": 41900
    },
    {
      "epoch": 4.445257797581158,
      "grad_norm": 0.6588126191174529,
      "learning_rate": 3.49379064543705e-05,
      "loss": 1.3212,
      "num_input_tokens_seen": 32966282976,
      "step": 41901
    },
    {
      "epoch": 4.44536388712073,
      "grad_norm": 0.6878514883905331,
      "learning_rate": 3.493726875052484e-05,
      "loss": 1.189,
      "num_input_tokens_seen": 32967069808,
      "step": 41902
    },
    {
      "epoch": 4.445469976660301,
      "grad_norm": 0.8975262876450064,
      "learning_rate": 3.4936631038999936e-05,
      "loss": 1.4,
      "num_input_tokens_seen": 32967856560,
      "step": 41903
    },
    {
      "epoch": 4.445576066199873,
      "grad_norm": 0.6560486807728206,
      "learning_rate": 3.493599331979631e-05,
      "loss": 1.4159,
      "num_input_tokens_seen": 32968643392,
      "step": 41904
    },
    {
      "epoch": 4.445682155739444,
      "grad_norm": 0.7641583348288746,
      "learning_rate": 3.493535559291443e-05,
      "loss": 1.1856,
      "num_input_tokens_seen": 32969430256,
      "step": 41905
    },
    {
      "epoch": 4.445788245279015,
      "grad_norm": 0.7684368820589742,
      "learning_rate": 3.4934717858354806e-05,
      "loss": 1.2633,
      "num_input_tokens_seen": 32970217072,
      "step": 41906
    },
    {
      "epoch": 4.445894334818587,
      "grad_norm": 0.5244077805554187,
      "learning_rate": 3.493408011611792e-05,
      "loss": 1.2762,
      "num_input_tokens_seen": 32971003760,
      "step": 41907
    },
    {
      "epoch": 4.446000424358158,
      "grad_norm": 0.8486363201099506,
      "learning_rate": 3.493344236620427e-05,
      "loss": 1.3105,
      "num_input_tokens_seen": 32971790528,
      "step": 41908
    },
    {
      "epoch": 4.44610651389773,
      "grad_norm": 0.6780335821325238,
      "learning_rate": 3.4932804608614345e-05,
      "loss": 1.26,
      "num_input_tokens_seen": 32972577328,
      "step": 41909
    },
    {
      "epoch": 4.446212603437301,
      "grad_norm": 0.9368650341038759,
      "learning_rate": 3.493216684334864e-05,
      "loss": 1.2654,
      "num_input_tokens_seen": 32973364112,
      "step": 41910
    },
    {
      "epoch": 4.446318692976872,
      "grad_norm": 0.6361084994857223,
      "learning_rate": 3.493152907040765e-05,
      "loss": 1.3243,
      "num_input_tokens_seen": 32974150896,
      "step": 41911
    },
    {
      "epoch": 4.446424782516444,
      "grad_norm": 0.5428039739959246,
      "learning_rate": 3.493089128979187e-05,
      "loss": 1.2706,
      "num_input_tokens_seen": 32974937584,
      "step": 41912
    },
    {
      "epoch": 4.446530872056015,
      "grad_norm": 0.6691101631784542,
      "learning_rate": 3.493025350150178e-05,
      "loss": 1.3798,
      "num_input_tokens_seen": 32975724272,
      "step": 41913
    },
    {
      "epoch": 4.446636961595587,
      "grad_norm": 0.6074944951011093,
      "learning_rate": 3.4929615705537875e-05,
      "loss": 1.3074,
      "num_input_tokens_seen": 32976511072,
      "step": 41914
    },
    {
      "epoch": 4.446743051135158,
      "grad_norm": 0.5716893454372104,
      "learning_rate": 3.492897790190067e-05,
      "loss": 1.2892,
      "num_input_tokens_seen": 32977297808,
      "step": 41915
    },
    {
      "epoch": 4.446849140674729,
      "grad_norm": 0.6301948952690855,
      "learning_rate": 3.492834009059064e-05,
      "loss": 1.281,
      "num_input_tokens_seen": 32978084560,
      "step": 41916
    },
    {
      "epoch": 4.446955230214301,
      "grad_norm": 0.5408147299972322,
      "learning_rate": 3.492770227160827e-05,
      "loss": 1.2642,
      "num_input_tokens_seen": 32978871296,
      "step": 41917
    },
    {
      "epoch": 4.447061319753872,
      "grad_norm": 0.6552959842641667,
      "learning_rate": 3.492706444495407e-05,
      "loss": 1.3326,
      "num_input_tokens_seen": 32979658064,
      "step": 41918
    },
    {
      "epoch": 4.447167409293444,
      "grad_norm": 0.5414039375827688,
      "learning_rate": 3.4926426610628534e-05,
      "loss": 1.268,
      "num_input_tokens_seen": 32980444752,
      "step": 41919
    },
    {
      "epoch": 4.447273498833015,
      "grad_norm": 0.8663358328465763,
      "learning_rate": 3.492578876863213e-05,
      "loss": 1.3422,
      "num_input_tokens_seen": 32981231488,
      "step": 41920
    },
    {
      "epoch": 4.447379588372587,
      "grad_norm": 0.5600088898221416,
      "learning_rate": 3.4925150918965376e-05,
      "loss": 1.3484,
      "num_input_tokens_seen": 32982018336,
      "step": 41921
    },
    {
      "epoch": 4.447485677912158,
      "grad_norm": 0.5288174008583216,
      "learning_rate": 3.492451306162876e-05,
      "loss": 1.3009,
      "num_input_tokens_seen": 32982805104,
      "step": 41922
    },
    {
      "epoch": 4.447591767451729,
      "grad_norm": 0.5599875960074201,
      "learning_rate": 3.4923875196622765e-05,
      "loss": 1.2756,
      "num_input_tokens_seen": 32983591888,
      "step": 41923
    },
    {
      "epoch": 4.447697856991301,
      "grad_norm": 0.6930381669755875,
      "learning_rate": 3.492323732394789e-05,
      "loss": 1.3097,
      "num_input_tokens_seen": 32984378640,
      "step": 41924
    },
    {
      "epoch": 4.447803946530872,
      "grad_norm": 0.6883801520014508,
      "learning_rate": 3.492259944360463e-05,
      "loss": 1.3129,
      "num_input_tokens_seen": 32985165456,
      "step": 41925
    },
    {
      "epoch": 4.447910036070444,
      "grad_norm": 0.7557885673514225,
      "learning_rate": 3.492196155559348e-05,
      "loss": 1.3853,
      "num_input_tokens_seen": 32985952224,
      "step": 41926
    },
    {
      "epoch": 4.448016125610015,
      "grad_norm": 0.7038715895009048,
      "learning_rate": 3.492132365991493e-05,
      "loss": 1.3806,
      "num_input_tokens_seen": 32986738928,
      "step": 41927
    },
    {
      "epoch": 4.448122215149587,
      "grad_norm": 0.5223581760318955,
      "learning_rate": 3.4920685756569474e-05,
      "loss": 1.2481,
      "num_input_tokens_seen": 32987525696,
      "step": 41928
    },
    {
      "epoch": 4.448228304689158,
      "grad_norm": 0.6267497156425218,
      "learning_rate": 3.492004784555759e-05,
      "loss": 1.2472,
      "num_input_tokens_seen": 32988312400,
      "step": 41929
    },
    {
      "epoch": 4.448334394228729,
      "grad_norm": 0.5659371961184197,
      "learning_rate": 3.4919409926879797e-05,
      "loss": 1.2525,
      "num_input_tokens_seen": 32989099216,
      "step": 41930
    },
    {
      "epoch": 4.448440483768301,
      "grad_norm": 0.5767648146577612,
      "learning_rate": 3.491877200053657e-05,
      "loss": 1.2131,
      "num_input_tokens_seen": 32989886016,
      "step": 41931
    },
    {
      "epoch": 4.448546573307872,
      "grad_norm": 0.5091142212830193,
      "learning_rate": 3.491813406652841e-05,
      "loss": 1.2959,
      "num_input_tokens_seen": 32990672768,
      "step": 41932
    },
    {
      "epoch": 4.448652662847444,
      "grad_norm": 0.7248259614839823,
      "learning_rate": 3.49174961248558e-05,
      "loss": 1.3171,
      "num_input_tokens_seen": 32991459552,
      "step": 41933
    },
    {
      "epoch": 4.448758752387015,
      "grad_norm": 0.6225586061595413,
      "learning_rate": 3.491685817551924e-05,
      "loss": 1.2816,
      "num_input_tokens_seen": 32992246368,
      "step": 41934
    },
    {
      "epoch": 4.448864841926586,
      "grad_norm": 0.5394243617261633,
      "learning_rate": 3.491622021851923e-05,
      "loss": 1.3,
      "num_input_tokens_seen": 32993033184,
      "step": 41935
    },
    {
      "epoch": 4.448970931466158,
      "grad_norm": 1.0063694905157503,
      "learning_rate": 3.4915582253856254e-05,
      "loss": 1.3366,
      "num_input_tokens_seen": 32993819984,
      "step": 41936
    },
    {
      "epoch": 4.449077021005729,
      "grad_norm": 0.526622028691283,
      "learning_rate": 3.49149442815308e-05,
      "loss": 1.3476,
      "num_input_tokens_seen": 32994606720,
      "step": 41937
    },
    {
      "epoch": 4.449183110545301,
      "grad_norm": 0.5539481396815491,
      "learning_rate": 3.491430630154338e-05,
      "loss": 1.364,
      "num_input_tokens_seen": 32995393536,
      "step": 41938
    },
    {
      "epoch": 4.449289200084872,
      "grad_norm": 0.7056580975767126,
      "learning_rate": 3.491366831389447e-05,
      "loss": 1.4125,
      "num_input_tokens_seen": 32996180448,
      "step": 41939
    },
    {
      "epoch": 4.449395289624443,
      "grad_norm": 0.774260866327207,
      "learning_rate": 3.4913030318584566e-05,
      "loss": 1.365,
      "num_input_tokens_seen": 32996967232,
      "step": 41940
    },
    {
      "epoch": 4.449501379164015,
      "grad_norm": 0.4975582434587154,
      "learning_rate": 3.4912392315614166e-05,
      "loss": 1.2847,
      "num_input_tokens_seen": 32997754080,
      "step": 41941
    },
    {
      "epoch": 4.449607468703586,
      "grad_norm": 0.7472428178963176,
      "learning_rate": 3.491175430498376e-05,
      "loss": 1.3056,
      "num_input_tokens_seen": 32998540816,
      "step": 41942
    },
    {
      "epoch": 4.4497135582431575,
      "grad_norm": 0.7864062272241321,
      "learning_rate": 3.4911116286693835e-05,
      "loss": 1.3861,
      "num_input_tokens_seen": 32999327600,
      "step": 41943
    },
    {
      "epoch": 4.4498196477827285,
      "grad_norm": 0.5438283061159199,
      "learning_rate": 3.49104782607449e-05,
      "loss": 1.3813,
      "num_input_tokens_seen": 33000114336,
      "step": 41944
    },
    {
      "epoch": 4.4499257373223,
      "grad_norm": 0.8035838322498693,
      "learning_rate": 3.490984022713743e-05,
      "loss": 1.3102,
      "num_input_tokens_seen": 33000901088,
      "step": 41945
    },
    {
      "epoch": 4.4500318268618715,
      "grad_norm": 0.9029735814430427,
      "learning_rate": 3.4909202185871934e-05,
      "loss": 1.3607,
      "num_input_tokens_seen": 33001687808,
      "step": 41946
    },
    {
      "epoch": 4.4501379164014425,
      "grad_norm": 0.6515724833317904,
      "learning_rate": 3.490856413694889e-05,
      "loss": 1.2752,
      "num_input_tokens_seen": 33002474528,
      "step": 41947
    },
    {
      "epoch": 4.450244005941014,
      "grad_norm": 0.8180057158491646,
      "learning_rate": 3.49079260803688e-05,
      "loss": 1.3166,
      "num_input_tokens_seen": 33003261232,
      "step": 41948
    },
    {
      "epoch": 4.4503500954805855,
      "grad_norm": 0.7489991281604738,
      "learning_rate": 3.490728801613215e-05,
      "loss": 1.3493,
      "num_input_tokens_seen": 33004047952,
      "step": 41949
    },
    {
      "epoch": 4.450456185020157,
      "grad_norm": 0.6084369153348572,
      "learning_rate": 3.4906649944239454e-05,
      "loss": 1.4017,
      "num_input_tokens_seen": 33004834688,
      "step": 41950
    },
    {
      "epoch": 4.450562274559728,
      "grad_norm": 0.8161418383874914,
      "learning_rate": 3.4906011864691176e-05,
      "loss": 1.1987,
      "num_input_tokens_seen": 33005621424,
      "step": 41951
    },
    {
      "epoch": 4.4506683640992994,
      "grad_norm": 0.5862161003078398,
      "learning_rate": 3.490537377748783e-05,
      "loss": 1.2696,
      "num_input_tokens_seen": 33006408208,
      "step": 41952
    },
    {
      "epoch": 4.450774453638871,
      "grad_norm": 0.5357094395715429,
      "learning_rate": 3.4904735682629904e-05,
      "loss": 1.3335,
      "num_input_tokens_seen": 33007195008,
      "step": 41953
    },
    {
      "epoch": 4.450880543178442,
      "grad_norm": 0.9178910234015886,
      "learning_rate": 3.490409758011788e-05,
      "loss": 1.3997,
      "num_input_tokens_seen": 33007981776,
      "step": 41954
    },
    {
      "epoch": 4.450986632718014,
      "grad_norm": 0.5794510089440518,
      "learning_rate": 3.490345946995226e-05,
      "loss": 1.2716,
      "num_input_tokens_seen": 33008768576,
      "step": 41955
    },
    {
      "epoch": 4.451092722257585,
      "grad_norm": 0.7497134741595002,
      "learning_rate": 3.490282135213355e-05,
      "loss": 1.2703,
      "num_input_tokens_seen": 33009555312,
      "step": 41956
    },
    {
      "epoch": 4.451198811797157,
      "grad_norm": 0.6310218271208891,
      "learning_rate": 3.490218322666221e-05,
      "loss": 1.2426,
      "num_input_tokens_seen": 33010342176,
      "step": 41957
    },
    {
      "epoch": 4.451304901336728,
      "grad_norm": 0.6360116304825484,
      "learning_rate": 3.490154509353877e-05,
      "loss": 1.404,
      "num_input_tokens_seen": 33011128896,
      "step": 41958
    },
    {
      "epoch": 4.451410990876299,
      "grad_norm": 0.7954236807764499,
      "learning_rate": 3.49009069527637e-05,
      "loss": 1.2827,
      "num_input_tokens_seen": 33011915664,
      "step": 41959
    },
    {
      "epoch": 4.451517080415871,
      "grad_norm": 0.546701905803274,
      "learning_rate": 3.49002688043375e-05,
      "loss": 1.2838,
      "num_input_tokens_seen": 33012702496,
      "step": 41960
    },
    {
      "epoch": 4.451623169955442,
      "grad_norm": 0.5624859835640043,
      "learning_rate": 3.489963064826067e-05,
      "loss": 1.2838,
      "num_input_tokens_seen": 33013489296,
      "step": 41961
    },
    {
      "epoch": 4.451729259495014,
      "grad_norm": 0.7201450049234503,
      "learning_rate": 3.489899248453369e-05,
      "loss": 1.3817,
      "num_input_tokens_seen": 33014276080,
      "step": 41962
    },
    {
      "epoch": 4.451835349034585,
      "grad_norm": 0.6158026184970938,
      "learning_rate": 3.489835431315705e-05,
      "loss": 1.3078,
      "num_input_tokens_seen": 33015062880,
      "step": 41963
    },
    {
      "epoch": 4.451941438574156,
      "grad_norm": 0.6834597797189274,
      "learning_rate": 3.4897716134131265e-05,
      "loss": 1.2171,
      "num_input_tokens_seen": 33015849600,
      "step": 41964
    },
    {
      "epoch": 4.452047528113728,
      "grad_norm": 0.7411703488865289,
      "learning_rate": 3.4897077947456806e-05,
      "loss": 1.3311,
      "num_input_tokens_seen": 33016636368,
      "step": 41965
    },
    {
      "epoch": 4.452153617653299,
      "grad_norm": 0.627919885868039,
      "learning_rate": 3.489643975313418e-05,
      "loss": 1.3993,
      "num_input_tokens_seen": 33017423152,
      "step": 41966
    },
    {
      "epoch": 4.452259707192871,
      "grad_norm": 0.7328084035368916,
      "learning_rate": 3.489580155116388e-05,
      "loss": 1.2421,
      "num_input_tokens_seen": 33018210016,
      "step": 41967
    },
    {
      "epoch": 4.452365796732442,
      "grad_norm": 0.837501742648333,
      "learning_rate": 3.489516334154639e-05,
      "loss": 1.208,
      "num_input_tokens_seen": 33018996848,
      "step": 41968
    },
    {
      "epoch": 4.452471886272013,
      "grad_norm": 0.5902052330742741,
      "learning_rate": 3.489452512428221e-05,
      "loss": 1.3937,
      "num_input_tokens_seen": 33019783664,
      "step": 41969
    },
    {
      "epoch": 4.452577975811585,
      "grad_norm": 0.704243057319418,
      "learning_rate": 3.489388689937183e-05,
      "loss": 1.3169,
      "num_input_tokens_seen": 33020570432,
      "step": 41970
    },
    {
      "epoch": 4.452684065351156,
      "grad_norm": 0.5645443760060842,
      "learning_rate": 3.489324866681575e-05,
      "loss": 1.1818,
      "num_input_tokens_seen": 33021357184,
      "step": 41971
    },
    {
      "epoch": 4.452790154890728,
      "grad_norm": 0.536338364831726,
      "learning_rate": 3.4892610426614445e-05,
      "loss": 1.2668,
      "num_input_tokens_seen": 33022143936,
      "step": 41972
    },
    {
      "epoch": 4.452896244430299,
      "grad_norm": 0.4670699883537686,
      "learning_rate": 3.489197217876843e-05,
      "loss": 1.438,
      "num_input_tokens_seen": 33022930720,
      "step": 41973
    },
    {
      "epoch": 4.45300233396987,
      "grad_norm": 0.7024703671596534,
      "learning_rate": 3.489133392327819e-05,
      "loss": 1.2329,
      "num_input_tokens_seen": 33023717632,
      "step": 41974
    },
    {
      "epoch": 4.453108423509442,
      "grad_norm": 0.5160043721263045,
      "learning_rate": 3.4890695660144215e-05,
      "loss": 1.2837,
      "num_input_tokens_seen": 33024504352,
      "step": 41975
    },
    {
      "epoch": 4.453214513049013,
      "grad_norm": 0.5556768121306833,
      "learning_rate": 3.4890057389367e-05,
      "loss": 1.2516,
      "num_input_tokens_seen": 33025291136,
      "step": 41976
    },
    {
      "epoch": 4.453320602588585,
      "grad_norm": 0.5439573245998924,
      "learning_rate": 3.488941911094704e-05,
      "loss": 1.2335,
      "num_input_tokens_seen": 33026077856,
      "step": 41977
    },
    {
      "epoch": 4.453426692128156,
      "grad_norm": 0.5525953452186266,
      "learning_rate": 3.4888780824884834e-05,
      "loss": 1.3874,
      "num_input_tokens_seen": 33026864608,
      "step": 41978
    },
    {
      "epoch": 4.453532781667728,
      "grad_norm": 0.5708902975336138,
      "learning_rate": 3.488814253118086e-05,
      "loss": 1.3911,
      "num_input_tokens_seen": 33027651392,
      "step": 41979
    },
    {
      "epoch": 4.453638871207299,
      "grad_norm": 0.6885924202215915,
      "learning_rate": 3.488750422983561e-05,
      "loss": 1.3546,
      "num_input_tokens_seen": 33028438192,
      "step": 41980
    },
    {
      "epoch": 4.45374496074687,
      "grad_norm": 0.5269696869221624,
      "learning_rate": 3.48868659208496e-05,
      "loss": 1.2453,
      "num_input_tokens_seen": 33029224960,
      "step": 41981
    },
    {
      "epoch": 4.453851050286442,
      "grad_norm": 0.6161313688363562,
      "learning_rate": 3.488622760422331e-05,
      "loss": 1.3551,
      "num_input_tokens_seen": 33030011744,
      "step": 41982
    },
    {
      "epoch": 4.453957139826013,
      "grad_norm": 0.5118641443464901,
      "learning_rate": 3.4885589279957223e-05,
      "loss": 1.2571,
      "num_input_tokens_seen": 33030798496,
      "step": 41983
    },
    {
      "epoch": 4.454063229365585,
      "grad_norm": 0.545676675062222,
      "learning_rate": 3.488495094805186e-05,
      "loss": 1.3046,
      "num_input_tokens_seen": 33031585264,
      "step": 41984
    },
    {
      "epoch": 4.454169318905156,
      "grad_norm": 0.44848630801287787,
      "learning_rate": 3.4884312608507683e-05,
      "loss": 1.2473,
      "num_input_tokens_seen": 33032372048,
      "step": 41985
    },
    {
      "epoch": 4.454275408444728,
      "grad_norm": 0.48060438597261024,
      "learning_rate": 3.4883674261325204e-05,
      "loss": 1.3626,
      "num_input_tokens_seen": 33033158784,
      "step": 41986
    },
    {
      "epoch": 4.454381497984299,
      "grad_norm": 0.4373529600027673,
      "learning_rate": 3.488303590650491e-05,
      "loss": 1.232,
      "num_input_tokens_seen": 33033945552,
      "step": 41987
    },
    {
      "epoch": 4.45448758752387,
      "grad_norm": 0.4684073677560525,
      "learning_rate": 3.48823975440473e-05,
      "loss": 1.2665,
      "num_input_tokens_seen": 33034732352,
      "step": 41988
    },
    {
      "epoch": 4.454593677063442,
      "grad_norm": 0.5728579482837884,
      "learning_rate": 3.488175917395286e-05,
      "loss": 1.3314,
      "num_input_tokens_seen": 33035519120,
      "step": 41989
    },
    {
      "epoch": 4.454699766603013,
      "grad_norm": 0.6622039121677615,
      "learning_rate": 3.4881120796222085e-05,
      "loss": 1.3744,
      "num_input_tokens_seen": 33036305888,
      "step": 41990
    },
    {
      "epoch": 4.454805856142585,
      "grad_norm": 0.5192762431563404,
      "learning_rate": 3.4880482410855476e-05,
      "loss": 1.3519,
      "num_input_tokens_seen": 33037092544,
      "step": 41991
    },
    {
      "epoch": 4.454911945682156,
      "grad_norm": 0.5474120529223262,
      "learning_rate": 3.4879844017853515e-05,
      "loss": 1.3398,
      "num_input_tokens_seen": 33037879312,
      "step": 41992
    },
    {
      "epoch": 4.455018035221727,
      "grad_norm": 0.6049278856449217,
      "learning_rate": 3.48792056172167e-05,
      "loss": 1.331,
      "num_input_tokens_seen": 33038665968,
      "step": 41993
    },
    {
      "epoch": 4.455124124761299,
      "grad_norm": 0.5174374812990565,
      "learning_rate": 3.487856720894552e-05,
      "loss": 1.3118,
      "num_input_tokens_seen": 33039452720,
      "step": 41994
    },
    {
      "epoch": 4.45523021430087,
      "grad_norm": 0.5817348290817103,
      "learning_rate": 3.487792879304049e-05,
      "loss": 1.2929,
      "num_input_tokens_seen": 33040239472,
      "step": 41995
    },
    {
      "epoch": 4.455336303840442,
      "grad_norm": 0.5445483877662686,
      "learning_rate": 3.4877290369502075e-05,
      "loss": 1.3465,
      "num_input_tokens_seen": 33041026256,
      "step": 41996
    },
    {
      "epoch": 4.455442393380013,
      "grad_norm": 0.5093091437928036,
      "learning_rate": 3.487665193833078e-05,
      "loss": 1.347,
      "num_input_tokens_seen": 33041812944,
      "step": 41997
    },
    {
      "epoch": 4.455548482919584,
      "grad_norm": 0.6192451306378636,
      "learning_rate": 3.4876013499527094e-05,
      "loss": 1.3465,
      "num_input_tokens_seen": 33042599712,
      "step": 41998
    },
    {
      "epoch": 4.455654572459156,
      "grad_norm": 0.4701150031980673,
      "learning_rate": 3.487537505309152e-05,
      "loss": 1.2492,
      "num_input_tokens_seen": 33043386448,
      "step": 41999
    },
    {
      "epoch": 4.455760661998727,
      "grad_norm": 0.4828172105512052,
      "learning_rate": 3.4874736599024545e-05,
      "loss": 1.2696,
      "num_input_tokens_seen": 33044173152,
      "step": 42000
    },
    {
      "epoch": 4.455760661998727,
      "eval_loss": 1.5737537145614624,
      "eval_runtime": 63.956,
      "eval_samples_per_second": 46.907,
      "eval_steps_per_second": 0.5,
      "num_input_tokens_seen": 33044173152,
      "step": 42000
    },
    {
      "epoch": 4.455866751538299,
      "grad_norm": 0.5383782186868483,
      "learning_rate": 3.4874098137326667e-05,
      "loss": 1.294,
      "num_input_tokens_seen": 33044959984,
      "step": 42001
    },
    {
      "epoch": 4.45597284107787,
      "grad_norm": 0.4996489750110327,
      "learning_rate": 3.487345966799837e-05,
      "loss": 1.3365,
      "num_input_tokens_seen": 33045746784,
      "step": 42002
    },
    {
      "epoch": 4.4560789306174415,
      "grad_norm": 0.47438502494553464,
      "learning_rate": 3.487282119104015e-05,
      "loss": 1.3157,
      "num_input_tokens_seen": 33046533408,
      "step": 42003
    },
    {
      "epoch": 4.456185020157013,
      "grad_norm": 0.5744291999904417,
      "learning_rate": 3.4872182706452514e-05,
      "loss": 1.3589,
      "num_input_tokens_seen": 33047320192,
      "step": 42004
    },
    {
      "epoch": 4.456291109696584,
      "grad_norm": 0.48378280566515325,
      "learning_rate": 3.4871544214235944e-05,
      "loss": 1.25,
      "num_input_tokens_seen": 33048106928,
      "step": 42005
    },
    {
      "epoch": 4.4563971992361555,
      "grad_norm": 0.4933755105792634,
      "learning_rate": 3.487090571439092e-05,
      "loss": 1.2504,
      "num_input_tokens_seen": 33048893664,
      "step": 42006
    },
    {
      "epoch": 4.4565032887757265,
      "grad_norm": 0.5127655714496111,
      "learning_rate": 3.487026720691796e-05,
      "loss": 1.3108,
      "num_input_tokens_seen": 33049680448,
      "step": 42007
    },
    {
      "epoch": 4.4566093783152985,
      "grad_norm": 0.4896175269122087,
      "learning_rate": 3.486962869181755e-05,
      "loss": 1.3691,
      "num_input_tokens_seen": 33050467168,
      "step": 42008
    },
    {
      "epoch": 4.4567154678548695,
      "grad_norm": 0.546714625076604,
      "learning_rate": 3.486899016909018e-05,
      "loss": 1.2263,
      "num_input_tokens_seen": 33051253968,
      "step": 42009
    },
    {
      "epoch": 4.4568215573944405,
      "grad_norm": 0.5848381321459116,
      "learning_rate": 3.4868351638736343e-05,
      "loss": 1.3112,
      "num_input_tokens_seen": 33052040688,
      "step": 42010
    },
    {
      "epoch": 4.456927646934012,
      "grad_norm": 0.4872067371709884,
      "learning_rate": 3.486771310075653e-05,
      "loss": 1.1911,
      "num_input_tokens_seen": 33052827456,
      "step": 42011
    },
    {
      "epoch": 4.4570337364735835,
      "grad_norm": 0.5767070183221343,
      "learning_rate": 3.4867074555151234e-05,
      "loss": 1.4291,
      "num_input_tokens_seen": 33053614224,
      "step": 42012
    },
    {
      "epoch": 4.457139826013155,
      "grad_norm": 0.487643037065263,
      "learning_rate": 3.486643600192096e-05,
      "loss": 1.3757,
      "num_input_tokens_seen": 33054401008,
      "step": 42013
    },
    {
      "epoch": 4.457245915552726,
      "grad_norm": 0.48655688696380317,
      "learning_rate": 3.486579744106619e-05,
      "loss": 1.2495,
      "num_input_tokens_seen": 33055187776,
      "step": 42014
    },
    {
      "epoch": 4.457352005092298,
      "grad_norm": 0.5192983123457029,
      "learning_rate": 3.486515887258742e-05,
      "loss": 1.257,
      "num_input_tokens_seen": 33055974544,
      "step": 42015
    },
    {
      "epoch": 4.457458094631869,
      "grad_norm": 0.5388572883457664,
      "learning_rate": 3.486452029648515e-05,
      "loss": 1.4024,
      "num_input_tokens_seen": 33056761280,
      "step": 42016
    },
    {
      "epoch": 4.45756418417144,
      "grad_norm": 0.4596934919570522,
      "learning_rate": 3.4863881712759866e-05,
      "loss": 1.2039,
      "num_input_tokens_seen": 33057548016,
      "step": 42017
    },
    {
      "epoch": 4.457670273711012,
      "grad_norm": 0.4881565651989788,
      "learning_rate": 3.486324312141206e-05,
      "loss": 1.2983,
      "num_input_tokens_seen": 33058334800,
      "step": 42018
    },
    {
      "epoch": 4.457776363250583,
      "grad_norm": 0.5527355605361387,
      "learning_rate": 3.4862604522442236e-05,
      "loss": 1.341,
      "num_input_tokens_seen": 33059121568,
      "step": 42019
    },
    {
      "epoch": 4.457882452790155,
      "grad_norm": 0.5163899544489281,
      "learning_rate": 3.4861965915850874e-05,
      "loss": 1.3344,
      "num_input_tokens_seen": 33059908288,
      "step": 42020
    },
    {
      "epoch": 4.457988542329726,
      "grad_norm": 0.5051045470380557,
      "learning_rate": 3.486132730163848e-05,
      "loss": 1.304,
      "num_input_tokens_seen": 33060695024,
      "step": 42021
    },
    {
      "epoch": 4.458094631869297,
      "grad_norm": 0.6406918919523057,
      "learning_rate": 3.486068867980554e-05,
      "loss": 1.3608,
      "num_input_tokens_seen": 33061481840,
      "step": 42022
    },
    {
      "epoch": 4.458200721408869,
      "grad_norm": 0.8630081589699643,
      "learning_rate": 3.486005005035254e-05,
      "loss": 1.3231,
      "num_input_tokens_seen": 33062268528,
      "step": 42023
    },
    {
      "epoch": 4.45830681094844,
      "grad_norm": 0.599073170370904,
      "learning_rate": 3.4859411413279996e-05,
      "loss": 1.3392,
      "num_input_tokens_seen": 33063055312,
      "step": 42024
    },
    {
      "epoch": 4.458412900488012,
      "grad_norm": 0.6941426717025928,
      "learning_rate": 3.4858772768588375e-05,
      "loss": 1.2352,
      "num_input_tokens_seen": 33063842096,
      "step": 42025
    },
    {
      "epoch": 4.458518990027583,
      "grad_norm": 0.5692876213962904,
      "learning_rate": 3.485813411627819e-05,
      "loss": 1.3009,
      "num_input_tokens_seen": 33064628880,
      "step": 42026
    },
    {
      "epoch": 4.458625079567154,
      "grad_norm": 0.7203594078350993,
      "learning_rate": 3.485749545634994e-05,
      "loss": 1.3907,
      "num_input_tokens_seen": 33065415584,
      "step": 42027
    },
    {
      "epoch": 4.458731169106726,
      "grad_norm": 0.5538597250447301,
      "learning_rate": 3.4856856788804095e-05,
      "loss": 1.2395,
      "num_input_tokens_seen": 33066202448,
      "step": 42028
    },
    {
      "epoch": 4.458837258646297,
      "grad_norm": 0.6699877091628946,
      "learning_rate": 3.4856218113641155e-05,
      "loss": 1.3185,
      "num_input_tokens_seen": 33066989280,
      "step": 42029
    },
    {
      "epoch": 4.458943348185869,
      "grad_norm": 0.6116076782155966,
      "learning_rate": 3.4855579430861626e-05,
      "loss": 1.238,
      "num_input_tokens_seen": 33067776064,
      "step": 42030
    },
    {
      "epoch": 4.45904943772544,
      "grad_norm": 0.6044140570629009,
      "learning_rate": 3.4854940740466e-05,
      "loss": 1.271,
      "num_input_tokens_seen": 33068562912,
      "step": 42031
    },
    {
      "epoch": 4.459155527265012,
      "grad_norm": 0.6442415676022379,
      "learning_rate": 3.485430204245475e-05,
      "loss": 1.3932,
      "num_input_tokens_seen": 33069349632,
      "step": 42032
    },
    {
      "epoch": 4.459261616804583,
      "grad_norm": 0.5868217442819084,
      "learning_rate": 3.48536633368284e-05,
      "loss": 1.3378,
      "num_input_tokens_seen": 33070136400,
      "step": 42033
    },
    {
      "epoch": 4.459367706344154,
      "grad_norm": 0.6233813636290488,
      "learning_rate": 3.4853024623587416e-05,
      "loss": 1.2855,
      "num_input_tokens_seen": 33070923104,
      "step": 42034
    },
    {
      "epoch": 4.459473795883726,
      "grad_norm": 0.5767417370209056,
      "learning_rate": 3.485238590273231e-05,
      "loss": 1.3617,
      "num_input_tokens_seen": 33071709936,
      "step": 42035
    },
    {
      "epoch": 4.459579885423297,
      "grad_norm": 0.563186861950115,
      "learning_rate": 3.485174717426357e-05,
      "loss": 1.3076,
      "num_input_tokens_seen": 33072496672,
      "step": 42036
    },
    {
      "epoch": 4.459685974962869,
      "grad_norm": 0.6652266181218291,
      "learning_rate": 3.485110843818168e-05,
      "loss": 1.2529,
      "num_input_tokens_seen": 33073283472,
      "step": 42037
    },
    {
      "epoch": 4.45979206450244,
      "grad_norm": 0.47458970215622076,
      "learning_rate": 3.4850469694487155e-05,
      "loss": 1.1913,
      "num_input_tokens_seen": 33074070256,
      "step": 42038
    },
    {
      "epoch": 4.459898154042011,
      "grad_norm": 0.5730205162615941,
      "learning_rate": 3.484983094318047e-05,
      "loss": 1.2714,
      "num_input_tokens_seen": 33074857120,
      "step": 42039
    },
    {
      "epoch": 4.460004243581583,
      "grad_norm": 0.6082857648819234,
      "learning_rate": 3.484919218426213e-05,
      "loss": 1.4214,
      "num_input_tokens_seen": 33075643840,
      "step": 42040
    },
    {
      "epoch": 4.460110333121154,
      "grad_norm": 1.0371724715722936,
      "learning_rate": 3.484855341773261e-05,
      "loss": 1.356,
      "num_input_tokens_seen": 33076430512,
      "step": 42041
    },
    {
      "epoch": 4.460216422660726,
      "grad_norm": 0.4872374861709687,
      "learning_rate": 3.4847914643592425e-05,
      "loss": 1.2608,
      "num_input_tokens_seen": 33077217312,
      "step": 42042
    },
    {
      "epoch": 4.460322512200297,
      "grad_norm": 0.6743827147726117,
      "learning_rate": 3.4847275861842064e-05,
      "loss": 1.1896,
      "num_input_tokens_seen": 33078004064,
      "step": 42043
    },
    {
      "epoch": 4.460428601739869,
      "grad_norm": 0.9139353356991177,
      "learning_rate": 3.484663707248201e-05,
      "loss": 1.3287,
      "num_input_tokens_seen": 33078790912,
      "step": 42044
    },
    {
      "epoch": 4.46053469127944,
      "grad_norm": 0.4707601922245028,
      "learning_rate": 3.484599827551277e-05,
      "loss": 1.2319,
      "num_input_tokens_seen": 33079577680,
      "step": 42045
    },
    {
      "epoch": 4.460640780819011,
      "grad_norm": 1.0078688680901948,
      "learning_rate": 3.484535947093483e-05,
      "loss": 1.2306,
      "num_input_tokens_seen": 33080364464,
      "step": 42046
    },
    {
      "epoch": 4.460746870358583,
      "grad_norm": 0.6970896152683638,
      "learning_rate": 3.484472065874869e-05,
      "loss": 1.256,
      "num_input_tokens_seen": 33081151264,
      "step": 42047
    },
    {
      "epoch": 4.460852959898154,
      "grad_norm": 0.50079544375877,
      "learning_rate": 3.484408183895484e-05,
      "loss": 1.3735,
      "num_input_tokens_seen": 33081938016,
      "step": 42048
    },
    {
      "epoch": 4.460959049437726,
      "grad_norm": 1.1140057151042506,
      "learning_rate": 3.4843443011553757e-05,
      "loss": 1.4272,
      "num_input_tokens_seen": 33082724752,
      "step": 42049
    },
    {
      "epoch": 4.461065138977297,
      "grad_norm": 0.6862216365741801,
      "learning_rate": 3.4842804176545955e-05,
      "loss": 1.3478,
      "num_input_tokens_seen": 33083511568,
      "step": 42050
    },
    {
      "epoch": 4.461171228516868,
      "grad_norm": 0.5800092309583473,
      "learning_rate": 3.4842165333931925e-05,
      "loss": 1.3096,
      "num_input_tokens_seen": 33084298352,
      "step": 42051
    },
    {
      "epoch": 4.46127731805644,
      "grad_norm": 1.1243961875720268,
      "learning_rate": 3.4841526483712164e-05,
      "loss": 1.434,
      "num_input_tokens_seen": 33085085056,
      "step": 42052
    },
    {
      "epoch": 4.461383407596011,
      "grad_norm": 0.6014214561442559,
      "learning_rate": 3.484088762588715e-05,
      "loss": 1.3686,
      "num_input_tokens_seen": 33085871696,
      "step": 42053
    },
    {
      "epoch": 4.461489497135583,
      "grad_norm": 0.7002642672425776,
      "learning_rate": 3.4840248760457395e-05,
      "loss": 1.3894,
      "num_input_tokens_seen": 33086658352,
      "step": 42054
    },
    {
      "epoch": 4.461595586675154,
      "grad_norm": 0.6370481779242734,
      "learning_rate": 3.483960988742338e-05,
      "loss": 1.3194,
      "num_input_tokens_seen": 33087445104,
      "step": 42055
    },
    {
      "epoch": 4.461701676214725,
      "grad_norm": 0.47656192854312196,
      "learning_rate": 3.483897100678561e-05,
      "loss": 1.2914,
      "num_input_tokens_seen": 33088231888,
      "step": 42056
    },
    {
      "epoch": 4.461807765754297,
      "grad_norm": 0.4353756774268729,
      "learning_rate": 3.483833211854457e-05,
      "loss": 1.2945,
      "num_input_tokens_seen": 33089018672,
      "step": 42057
    },
    {
      "epoch": 4.461913855293868,
      "grad_norm": 0.668642470400019,
      "learning_rate": 3.4837693222700745e-05,
      "loss": 1.2942,
      "num_input_tokens_seen": 33089805392,
      "step": 42058
    },
    {
      "epoch": 4.46201994483344,
      "grad_norm": 0.6244782969375023,
      "learning_rate": 3.483705431925465e-05,
      "loss": 1.2672,
      "num_input_tokens_seen": 33090592288,
      "step": 42059
    },
    {
      "epoch": 4.462126034373011,
      "grad_norm": 0.6847324158407637,
      "learning_rate": 3.4836415408206765e-05,
      "loss": 1.3749,
      "num_input_tokens_seen": 33091378992,
      "step": 42060
    },
    {
      "epoch": 4.462232123912583,
      "grad_norm": 0.5714761132822942,
      "learning_rate": 3.483577648955759e-05,
      "loss": 1.4249,
      "num_input_tokens_seen": 33092165744,
      "step": 42061
    },
    {
      "epoch": 4.462338213452154,
      "grad_norm": 0.46426965315902285,
      "learning_rate": 3.4835137563307616e-05,
      "loss": 1.2925,
      "num_input_tokens_seen": 33092952608,
      "step": 42062
    },
    {
      "epoch": 4.462444302991725,
      "grad_norm": 0.5044759005698685,
      "learning_rate": 3.483449862945732e-05,
      "loss": 1.2491,
      "num_input_tokens_seen": 33093739408,
      "step": 42063
    },
    {
      "epoch": 4.462550392531297,
      "grad_norm": 0.511863462558861,
      "learning_rate": 3.4833859688007234e-05,
      "loss": 1.1265,
      "num_input_tokens_seen": 33094526224,
      "step": 42064
    },
    {
      "epoch": 4.462656482070868,
      "grad_norm": 0.4341751567846595,
      "learning_rate": 3.4833220738957817e-05,
      "loss": 1.2327,
      "num_input_tokens_seen": 33095313088,
      "step": 42065
    },
    {
      "epoch": 4.4627625716104395,
      "grad_norm": 0.6593629739574735,
      "learning_rate": 3.483258178230958e-05,
      "loss": 1.3915,
      "num_input_tokens_seen": 33096099904,
      "step": 42066
    },
    {
      "epoch": 4.462868661150011,
      "grad_norm": 0.5094815133363224,
      "learning_rate": 3.4831942818063014e-05,
      "loss": 1.3763,
      "num_input_tokens_seen": 33096886672,
      "step": 42067
    },
    {
      "epoch": 4.462974750689582,
      "grad_norm": 0.5412313450403125,
      "learning_rate": 3.48313038462186e-05,
      "loss": 1.2628,
      "num_input_tokens_seen": 33097673408,
      "step": 42068
    },
    {
      "epoch": 4.4630808402291535,
      "grad_norm": 0.5594425938539646,
      "learning_rate": 3.483066486677685e-05,
      "loss": 1.0983,
      "num_input_tokens_seen": 33098460160,
      "step": 42069
    },
    {
      "epoch": 4.4631869297687246,
      "grad_norm": 0.5854009972604375,
      "learning_rate": 3.483002587973826e-05,
      "loss": 1.326,
      "num_input_tokens_seen": 33099246992,
      "step": 42070
    },
    {
      "epoch": 4.4632930193082965,
      "grad_norm": 0.6727586296899871,
      "learning_rate": 3.48293868851033e-05,
      "loss": 1.3453,
      "num_input_tokens_seen": 33100033808,
      "step": 42071
    },
    {
      "epoch": 4.4633991088478675,
      "grad_norm": 0.5592264114264773,
      "learning_rate": 3.4828747882872486e-05,
      "loss": 1.2497,
      "num_input_tokens_seen": 33100820512,
      "step": 42072
    },
    {
      "epoch": 4.463505198387439,
      "grad_norm": 0.4890994018392584,
      "learning_rate": 3.4828108873046306e-05,
      "loss": 1.2086,
      "num_input_tokens_seen": 33101607360,
      "step": 42073
    },
    {
      "epoch": 4.4636112879270105,
      "grad_norm": 0.7156387410146686,
      "learning_rate": 3.482746985562524e-05,
      "loss": 1.2989,
      "num_input_tokens_seen": 33102394144,
      "step": 42074
    },
    {
      "epoch": 4.4637173774665815,
      "grad_norm": 0.49659955927021254,
      "learning_rate": 3.482683083060981e-05,
      "loss": 1.2827,
      "num_input_tokens_seen": 33103180848,
      "step": 42075
    },
    {
      "epoch": 4.463823467006153,
      "grad_norm": 0.5852345025726439,
      "learning_rate": 3.4826191798000484e-05,
      "loss": 1.3017,
      "num_input_tokens_seen": 33103967600,
      "step": 42076
    },
    {
      "epoch": 4.463929556545724,
      "grad_norm": 0.731974240748243,
      "learning_rate": 3.4825552757797765e-05,
      "loss": 1.2871,
      "num_input_tokens_seen": 33104754416,
      "step": 42077
    },
    {
      "epoch": 4.464035646085296,
      "grad_norm": 0.5970133084704768,
      "learning_rate": 3.482491371000215e-05,
      "loss": 1.3566,
      "num_input_tokens_seen": 33105541232,
      "step": 42078
    },
    {
      "epoch": 4.464141735624867,
      "grad_norm": 0.5773035739591454,
      "learning_rate": 3.482427465461413e-05,
      "loss": 1.3217,
      "num_input_tokens_seen": 33106328016,
      "step": 42079
    },
    {
      "epoch": 4.464247825164438,
      "grad_norm": 0.6591072954063913,
      "learning_rate": 3.482363559163419e-05,
      "loss": 1.3459,
      "num_input_tokens_seen": 33107114720,
      "step": 42080
    },
    {
      "epoch": 4.46435391470401,
      "grad_norm": 0.47536030872242446,
      "learning_rate": 3.4822996521062845e-05,
      "loss": 1.2818,
      "num_input_tokens_seen": 33107901552,
      "step": 42081
    },
    {
      "epoch": 4.464460004243581,
      "grad_norm": 0.6096173764004774,
      "learning_rate": 3.4822357442900575e-05,
      "loss": 1.3537,
      "num_input_tokens_seen": 33108688416,
      "step": 42082
    },
    {
      "epoch": 4.464566093783153,
      "grad_norm": 0.6075201846388184,
      "learning_rate": 3.482171835714787e-05,
      "loss": 1.3376,
      "num_input_tokens_seen": 33109475152,
      "step": 42083
    },
    {
      "epoch": 4.464672183322724,
      "grad_norm": 0.589829706207463,
      "learning_rate": 3.482107926380523e-05,
      "loss": 1.322,
      "num_input_tokens_seen": 33110261936,
      "step": 42084
    },
    {
      "epoch": 4.464778272862295,
      "grad_norm": 0.530595493335289,
      "learning_rate": 3.482044016287315e-05,
      "loss": 1.2409,
      "num_input_tokens_seen": 33111048704,
      "step": 42085
    },
    {
      "epoch": 4.464884362401867,
      "grad_norm": 0.6112535043253639,
      "learning_rate": 3.4819801054352116e-05,
      "loss": 1.3031,
      "num_input_tokens_seen": 33111835424,
      "step": 42086
    },
    {
      "epoch": 4.464990451941438,
      "grad_norm": 0.47464481877799236,
      "learning_rate": 3.481916193824264e-05,
      "loss": 1.3032,
      "num_input_tokens_seen": 33112622160,
      "step": 42087
    },
    {
      "epoch": 4.46509654148101,
      "grad_norm": 0.51743884589372,
      "learning_rate": 3.4818522814545194e-05,
      "loss": 1.3045,
      "num_input_tokens_seen": 33113408848,
      "step": 42088
    },
    {
      "epoch": 4.465202631020581,
      "grad_norm": 0.5013965385817938,
      "learning_rate": 3.481788368326029e-05,
      "loss": 1.2979,
      "num_input_tokens_seen": 33114195696,
      "step": 42089
    },
    {
      "epoch": 4.465308720560153,
      "grad_norm": 0.6383923325732824,
      "learning_rate": 3.4817244544388404e-05,
      "loss": 1.3276,
      "num_input_tokens_seen": 33114982432,
      "step": 42090
    },
    {
      "epoch": 4.465414810099724,
      "grad_norm": 0.4419855084219271,
      "learning_rate": 3.481660539793005e-05,
      "loss": 1.1862,
      "num_input_tokens_seen": 33115769328,
      "step": 42091
    },
    {
      "epoch": 4.465520899639295,
      "grad_norm": 0.6187716568641277,
      "learning_rate": 3.48159662438857e-05,
      "loss": 1.2723,
      "num_input_tokens_seen": 33116556080,
      "step": 42092
    },
    {
      "epoch": 4.465626989178867,
      "grad_norm": 0.5587739462155841,
      "learning_rate": 3.481532708225586e-05,
      "loss": 1.432,
      "num_input_tokens_seen": 33117342816,
      "step": 42093
    },
    {
      "epoch": 4.465733078718438,
      "grad_norm": 0.5276942347512754,
      "learning_rate": 3.4814687913041034e-05,
      "loss": 1.453,
      "num_input_tokens_seen": 33118129520,
      "step": 42094
    },
    {
      "epoch": 4.46583916825801,
      "grad_norm": 0.5315041791057825,
      "learning_rate": 3.48140487362417e-05,
      "loss": 1.2931,
      "num_input_tokens_seen": 33118916288,
      "step": 42095
    },
    {
      "epoch": 4.465945257797581,
      "grad_norm": 0.5102074479928003,
      "learning_rate": 3.4813409551858356e-05,
      "loss": 1.2504,
      "num_input_tokens_seen": 33119703040,
      "step": 42096
    },
    {
      "epoch": 4.466051347337152,
      "grad_norm": 0.4941791826712333,
      "learning_rate": 3.48127703598915e-05,
      "loss": 1.2513,
      "num_input_tokens_seen": 33120489776,
      "step": 42097
    },
    {
      "epoch": 4.466157436876724,
      "grad_norm": 0.5663375434087231,
      "learning_rate": 3.481213116034162e-05,
      "loss": 1.316,
      "num_input_tokens_seen": 33121276528,
      "step": 42098
    },
    {
      "epoch": 4.466263526416295,
      "grad_norm": 0.4771658990866256,
      "learning_rate": 3.481149195320921e-05,
      "loss": 1.2344,
      "num_input_tokens_seen": 33122063408,
      "step": 42099
    },
    {
      "epoch": 4.466369615955867,
      "grad_norm": 0.528924321470128,
      "learning_rate": 3.481085273849477e-05,
      "loss": 1.3444,
      "num_input_tokens_seen": 33122850128,
      "step": 42100
    },
    {
      "epoch": 4.466475705495438,
      "grad_norm": 0.5976208138193935,
      "learning_rate": 3.481021351619879e-05,
      "loss": 1.2219,
      "num_input_tokens_seen": 33123637008,
      "step": 42101
    },
    {
      "epoch": 4.46658179503501,
      "grad_norm": 0.7023740482508116,
      "learning_rate": 3.480957428632177e-05,
      "loss": 1.3546,
      "num_input_tokens_seen": 33124423792,
      "step": 42102
    },
    {
      "epoch": 4.466687884574581,
      "grad_norm": 0.8009316500464312,
      "learning_rate": 3.4808935048864186e-05,
      "loss": 1.4265,
      "num_input_tokens_seen": 33125210544,
      "step": 42103
    },
    {
      "epoch": 4.466793974114152,
      "grad_norm": 0.6947188150160342,
      "learning_rate": 3.480829580382656e-05,
      "loss": 1.3493,
      "num_input_tokens_seen": 33125997264,
      "step": 42104
    },
    {
      "epoch": 4.466900063653724,
      "grad_norm": 1.6332924357707508,
      "learning_rate": 3.480765655120937e-05,
      "loss": 1.415,
      "num_input_tokens_seen": 33126783920,
      "step": 42105
    },
    {
      "epoch": 4.467006153193295,
      "grad_norm": 0.8831494699964234,
      "learning_rate": 3.48070172910131e-05,
      "loss": 1.351,
      "num_input_tokens_seen": 33127570656,
      "step": 42106
    },
    {
      "epoch": 4.467112242732867,
      "grad_norm": 0.9879582877627139,
      "learning_rate": 3.480637802323825e-05,
      "loss": 1.335,
      "num_input_tokens_seen": 33128357408,
      "step": 42107
    },
    {
      "epoch": 4.467218332272438,
      "grad_norm": 0.9120109974951206,
      "learning_rate": 3.480573874788534e-05,
      "loss": 1.341,
      "num_input_tokens_seen": 33129144240,
      "step": 42108
    },
    {
      "epoch": 4.467324421812009,
      "grad_norm": 0.9420543682930369,
      "learning_rate": 3.4805099464954823e-05,
      "loss": 1.3267,
      "num_input_tokens_seen": 33129930960,
      "step": 42109
    },
    {
      "epoch": 4.467430511351581,
      "grad_norm": 0.8009152493596149,
      "learning_rate": 3.480446017444722e-05,
      "loss": 1.2963,
      "num_input_tokens_seen": 33130717728,
      "step": 42110
    },
    {
      "epoch": 4.467536600891152,
      "grad_norm": 0.99229055302173,
      "learning_rate": 3.480382087636302e-05,
      "loss": 1.2677,
      "num_input_tokens_seen": 33131504496,
      "step": 42111
    },
    {
      "epoch": 4.467642690430724,
      "grad_norm": 0.8113103151983797,
      "learning_rate": 3.480318157070271e-05,
      "loss": 1.3686,
      "num_input_tokens_seen": 33132291312,
      "step": 42112
    },
    {
      "epoch": 4.467748779970295,
      "grad_norm": 0.7330296837482164,
      "learning_rate": 3.4802542257466804e-05,
      "loss": 1.3993,
      "num_input_tokens_seen": 33133078080,
      "step": 42113
    },
    {
      "epoch": 4.467854869509866,
      "grad_norm": 1.2086829245216149,
      "learning_rate": 3.4801902936655764e-05,
      "loss": 1.3384,
      "num_input_tokens_seen": 33133864944,
      "step": 42114
    },
    {
      "epoch": 4.467960959049438,
      "grad_norm": 0.7965455618942737,
      "learning_rate": 3.480126360827011e-05,
      "loss": 1.4738,
      "num_input_tokens_seen": 33134651664,
      "step": 42115
    },
    {
      "epoch": 4.468067048589009,
      "grad_norm": 0.6563947417187384,
      "learning_rate": 3.4800624272310324e-05,
      "loss": 1.3355,
      "num_input_tokens_seen": 33135438464,
      "step": 42116
    },
    {
      "epoch": 4.468173138128581,
      "grad_norm": 0.8706785263714644,
      "learning_rate": 3.4799984928776894e-05,
      "loss": 1.4011,
      "num_input_tokens_seen": 33136225232,
      "step": 42117
    },
    {
      "epoch": 4.468279227668152,
      "grad_norm": 0.6618497557173483,
      "learning_rate": 3.479934557767034e-05,
      "loss": 1.3126,
      "num_input_tokens_seen": 33137011968,
      "step": 42118
    },
    {
      "epoch": 4.468385317207724,
      "grad_norm": 0.5648841074319403,
      "learning_rate": 3.479870621899113e-05,
      "loss": 1.3925,
      "num_input_tokens_seen": 33137798688,
      "step": 42119
    },
    {
      "epoch": 4.468491406747295,
      "grad_norm": 0.806443273536985,
      "learning_rate": 3.479806685273977e-05,
      "loss": 1.2706,
      "num_input_tokens_seen": 33138585392,
      "step": 42120
    },
    {
      "epoch": 4.468597496286866,
      "grad_norm": 0.6180714874744634,
      "learning_rate": 3.479742747891675e-05,
      "loss": 1.3165,
      "num_input_tokens_seen": 33139372064,
      "step": 42121
    },
    {
      "epoch": 4.468703585826438,
      "grad_norm": 0.5417579209268145,
      "learning_rate": 3.479678809752257e-05,
      "loss": 1.2981,
      "num_input_tokens_seen": 33140158864,
      "step": 42122
    },
    {
      "epoch": 4.468809675366009,
      "grad_norm": 0.6082551926579614,
      "learning_rate": 3.4796148708557706e-05,
      "loss": 1.2351,
      "num_input_tokens_seen": 33140945616,
      "step": 42123
    },
    {
      "epoch": 4.468915764905581,
      "grad_norm": 0.5398709137498039,
      "learning_rate": 3.479550931202268e-05,
      "loss": 1.1483,
      "num_input_tokens_seen": 33141732384,
      "step": 42124
    },
    {
      "epoch": 4.469021854445152,
      "grad_norm": 0.5621478607138712,
      "learning_rate": 3.479486990791796e-05,
      "loss": 1.3565,
      "num_input_tokens_seen": 33142519152,
      "step": 42125
    },
    {
      "epoch": 4.469127943984724,
      "grad_norm": 0.6050101139643603,
      "learning_rate": 3.479423049624406e-05,
      "loss": 1.3166,
      "num_input_tokens_seen": 33143305904,
      "step": 42126
    },
    {
      "epoch": 4.469234033524295,
      "grad_norm": 0.7107320897829361,
      "learning_rate": 3.479359107700146e-05,
      "loss": 1.3039,
      "num_input_tokens_seen": 33144092832,
      "step": 42127
    },
    {
      "epoch": 4.469340123063866,
      "grad_norm": 0.45664881025746606,
      "learning_rate": 3.479295165019067e-05,
      "loss": 1.2478,
      "num_input_tokens_seen": 33144879600,
      "step": 42128
    },
    {
      "epoch": 4.4694462126034376,
      "grad_norm": 0.6643266648920677,
      "learning_rate": 3.479231221581217e-05,
      "loss": 1.3164,
      "num_input_tokens_seen": 33145666432,
      "step": 42129
    },
    {
      "epoch": 4.469552302143009,
      "grad_norm": 0.6047978867157365,
      "learning_rate": 3.4791672773866456e-05,
      "loss": 1.2616,
      "num_input_tokens_seen": 33146453184,
      "step": 42130
    },
    {
      "epoch": 4.4696583916825805,
      "grad_norm": 0.5858898044463237,
      "learning_rate": 3.479103332435403e-05,
      "loss": 1.3526,
      "num_input_tokens_seen": 33147239920,
      "step": 42131
    },
    {
      "epoch": 4.4697644812221515,
      "grad_norm": 0.5836161633280905,
      "learning_rate": 3.4790393867275374e-05,
      "loss": 1.3766,
      "num_input_tokens_seen": 33148026656,
      "step": 42132
    },
    {
      "epoch": 4.469870570761723,
      "grad_norm": 0.7559950248236305,
      "learning_rate": 3.4789754402631e-05,
      "loss": 1.2613,
      "num_input_tokens_seen": 33148813536,
      "step": 42133
    },
    {
      "epoch": 4.4699766603012945,
      "grad_norm": 0.5655403702768066,
      "learning_rate": 3.4789114930421376e-05,
      "loss": 1.3046,
      "num_input_tokens_seen": 33149600224,
      "step": 42134
    },
    {
      "epoch": 4.4700827498408655,
      "grad_norm": 0.5586548491603128,
      "learning_rate": 3.478847545064702e-05,
      "loss": 1.3139,
      "num_input_tokens_seen": 33150386992,
      "step": 42135
    },
    {
      "epoch": 4.470188839380437,
      "grad_norm": 0.47176798681679144,
      "learning_rate": 3.478783596330842e-05,
      "loss": 1.1856,
      "num_input_tokens_seen": 33151173808,
      "step": 42136
    },
    {
      "epoch": 4.4702949289200085,
      "grad_norm": 0.7281803432888906,
      "learning_rate": 3.4787196468406056e-05,
      "loss": 1.4088,
      "num_input_tokens_seen": 33151960576,
      "step": 42137
    },
    {
      "epoch": 4.4704010184595795,
      "grad_norm": 0.599586402407608,
      "learning_rate": 3.4786556965940445e-05,
      "loss": 1.3647,
      "num_input_tokens_seen": 33152747296,
      "step": 42138
    },
    {
      "epoch": 4.470507107999151,
      "grad_norm": 0.5649610568445296,
      "learning_rate": 3.4785917455912063e-05,
      "loss": 1.3143,
      "num_input_tokens_seen": 33153534064,
      "step": 42139
    },
    {
      "epoch": 4.470613197538722,
      "grad_norm": 0.7511041624413375,
      "learning_rate": 3.478527793832141e-05,
      "loss": 1.3509,
      "num_input_tokens_seen": 33154320960,
      "step": 42140
    },
    {
      "epoch": 4.470719287078294,
      "grad_norm": 0.4876137487661969,
      "learning_rate": 3.478463841316899e-05,
      "loss": 1.3224,
      "num_input_tokens_seen": 33155107648,
      "step": 42141
    },
    {
      "epoch": 4.470825376617865,
      "grad_norm": 0.5465701344977827,
      "learning_rate": 3.478399888045529e-05,
      "loss": 1.2905,
      "num_input_tokens_seen": 33155894400,
      "step": 42142
    },
    {
      "epoch": 4.470931466157436,
      "grad_norm": 0.6549263037978746,
      "learning_rate": 3.478335934018079e-05,
      "loss": 1.3477,
      "num_input_tokens_seen": 33156681216,
      "step": 42143
    },
    {
      "epoch": 4.471037555697008,
      "grad_norm": 0.48887028455207654,
      "learning_rate": 3.478271979234601e-05,
      "loss": 1.2077,
      "num_input_tokens_seen": 33157467952,
      "step": 42144
    },
    {
      "epoch": 4.471143645236579,
      "grad_norm": 0.42382361911847855,
      "learning_rate": 3.478208023695142e-05,
      "loss": 1.2998,
      "num_input_tokens_seen": 33158254752,
      "step": 42145
    },
    {
      "epoch": 4.471249734776151,
      "grad_norm": 0.570384160733545,
      "learning_rate": 3.478144067399753e-05,
      "loss": 1.352,
      "num_input_tokens_seen": 33159041536,
      "step": 42146
    },
    {
      "epoch": 4.471355824315722,
      "grad_norm": 0.5910726909918222,
      "learning_rate": 3.478080110348483e-05,
      "loss": 1.3105,
      "num_input_tokens_seen": 33159828176,
      "step": 42147
    },
    {
      "epoch": 4.471461913855294,
      "grad_norm": 0.5329492854369292,
      "learning_rate": 3.4780161525413815e-05,
      "loss": 1.3614,
      "num_input_tokens_seen": 33160614928,
      "step": 42148
    },
    {
      "epoch": 4.471568003394865,
      "grad_norm": 0.51773305520569,
      "learning_rate": 3.477952193978498e-05,
      "loss": 1.3149,
      "num_input_tokens_seen": 33161401536,
      "step": 42149
    },
    {
      "epoch": 4.471674092934436,
      "grad_norm": 0.6224326255703334,
      "learning_rate": 3.477888234659881e-05,
      "loss": 1.1934,
      "num_input_tokens_seen": 33162188272,
      "step": 42150
    },
    {
      "epoch": 4.471780182474008,
      "grad_norm": 0.5145862189903099,
      "learning_rate": 3.477824274585582e-05,
      "loss": 1.3324,
      "num_input_tokens_seen": 33162974976,
      "step": 42151
    },
    {
      "epoch": 4.471886272013579,
      "grad_norm": 0.5280612153035955,
      "learning_rate": 3.477760313755647e-05,
      "loss": 1.3099,
      "num_input_tokens_seen": 33163761840,
      "step": 42152
    },
    {
      "epoch": 4.471992361553151,
      "grad_norm": 0.5285329255875885,
      "learning_rate": 3.477696352170129e-05,
      "loss": 1.2689,
      "num_input_tokens_seen": 33164548560,
      "step": 42153
    },
    {
      "epoch": 4.472098451092722,
      "grad_norm": 0.6483101141558949,
      "learning_rate": 3.477632389829075e-05,
      "loss": 1.3831,
      "num_input_tokens_seen": 33165335344,
      "step": 42154
    },
    {
      "epoch": 4.472204540632294,
      "grad_norm": 0.5339318897819607,
      "learning_rate": 3.477568426732537e-05,
      "loss": 1.2746,
      "num_input_tokens_seen": 33166122064,
      "step": 42155
    },
    {
      "epoch": 4.472310630171865,
      "grad_norm": 0.8967232279276715,
      "learning_rate": 3.477504462880562e-05,
      "loss": 1.3899,
      "num_input_tokens_seen": 33166908912,
      "step": 42156
    },
    {
      "epoch": 4.472416719711436,
      "grad_norm": 0.5871744554700871,
      "learning_rate": 3.4774404982732e-05,
      "loss": 1.3414,
      "num_input_tokens_seen": 33167695680,
      "step": 42157
    },
    {
      "epoch": 4.472522809251008,
      "grad_norm": 0.6126786222385077,
      "learning_rate": 3.4773765329105e-05,
      "loss": 1.33,
      "num_input_tokens_seen": 33168482400,
      "step": 42158
    },
    {
      "epoch": 4.472628898790579,
      "grad_norm": 0.5201463709281992,
      "learning_rate": 3.477312566792513e-05,
      "loss": 1.2932,
      "num_input_tokens_seen": 33169269152,
      "step": 42159
    },
    {
      "epoch": 4.472734988330151,
      "grad_norm": 0.5666109215309926,
      "learning_rate": 3.4772485999192874e-05,
      "loss": 1.3225,
      "num_input_tokens_seen": 33170055920,
      "step": 42160
    },
    {
      "epoch": 4.472841077869722,
      "grad_norm": 0.5124493042580591,
      "learning_rate": 3.477184632290873e-05,
      "loss": 1.3787,
      "num_input_tokens_seen": 33170842640,
      "step": 42161
    },
    {
      "epoch": 4.472947167409293,
      "grad_norm": 0.49702398455539093,
      "learning_rate": 3.4771206639073185e-05,
      "loss": 1.2475,
      "num_input_tokens_seen": 33171629504,
      "step": 42162
    },
    {
      "epoch": 4.473053256948865,
      "grad_norm": 0.606209149342721,
      "learning_rate": 3.477056694768674e-05,
      "loss": 1.391,
      "num_input_tokens_seen": 33172416288,
      "step": 42163
    },
    {
      "epoch": 4.473159346488436,
      "grad_norm": 0.558418829989307,
      "learning_rate": 3.476992724874989e-05,
      "loss": 1.2663,
      "num_input_tokens_seen": 33173203088,
      "step": 42164
    },
    {
      "epoch": 4.473265436028008,
      "grad_norm": 0.498096739916873,
      "learning_rate": 3.4769287542263124e-05,
      "loss": 1.2675,
      "num_input_tokens_seen": 33173989856,
      "step": 42165
    },
    {
      "epoch": 4.473371525567579,
      "grad_norm": 0.6210262910254534,
      "learning_rate": 3.476864782822694e-05,
      "loss": 1.2383,
      "num_input_tokens_seen": 33174776752,
      "step": 42166
    },
    {
      "epoch": 4.47347761510715,
      "grad_norm": 0.7071327694945145,
      "learning_rate": 3.476800810664183e-05,
      "loss": 1.3889,
      "num_input_tokens_seen": 33175563488,
      "step": 42167
    },
    {
      "epoch": 4.473583704646722,
      "grad_norm": 0.606480069300229,
      "learning_rate": 3.4767368377508294e-05,
      "loss": 1.2712,
      "num_input_tokens_seen": 33176350192,
      "step": 42168
    },
    {
      "epoch": 4.473689794186293,
      "grad_norm": 0.7738819810533636,
      "learning_rate": 3.476672864082682e-05,
      "loss": 1.357,
      "num_input_tokens_seen": 33177136896,
      "step": 42169
    },
    {
      "epoch": 4.473795883725865,
      "grad_norm": 0.5067087769368033,
      "learning_rate": 3.4766088896597906e-05,
      "loss": 1.2666,
      "num_input_tokens_seen": 33177923600,
      "step": 42170
    },
    {
      "epoch": 4.473901973265436,
      "grad_norm": 0.5900850570722638,
      "learning_rate": 3.476544914482204e-05,
      "loss": 1.409,
      "num_input_tokens_seen": 33178710384,
      "step": 42171
    },
    {
      "epoch": 4.474008062805007,
      "grad_norm": 0.7191066110677069,
      "learning_rate": 3.476480938549972e-05,
      "loss": 1.2533,
      "num_input_tokens_seen": 33179497088,
      "step": 42172
    },
    {
      "epoch": 4.474114152344579,
      "grad_norm": 0.6137826880732807,
      "learning_rate": 3.4764169618631445e-05,
      "loss": 1.3642,
      "num_input_tokens_seen": 33180283856,
      "step": 42173
    },
    {
      "epoch": 4.47422024188415,
      "grad_norm": 0.5984043195182701,
      "learning_rate": 3.4763529844217714e-05,
      "loss": 1.2777,
      "num_input_tokens_seen": 33181070640,
      "step": 42174
    },
    {
      "epoch": 4.474326331423722,
      "grad_norm": 0.6363512693056058,
      "learning_rate": 3.4762890062259e-05,
      "loss": 1.2391,
      "num_input_tokens_seen": 33181857456,
      "step": 42175
    },
    {
      "epoch": 4.474432420963293,
      "grad_norm": 0.5960726838431614,
      "learning_rate": 3.476225027275582e-05,
      "loss": 1.3907,
      "num_input_tokens_seen": 33182644192,
      "step": 42176
    },
    {
      "epoch": 4.474538510502865,
      "grad_norm": 0.7302560510630062,
      "learning_rate": 3.476161047570866e-05,
      "loss": 1.3836,
      "num_input_tokens_seen": 33183430992,
      "step": 42177
    },
    {
      "epoch": 4.474644600042436,
      "grad_norm": 0.5406228590361276,
      "learning_rate": 3.476097067111801e-05,
      "loss": 1.2931,
      "num_input_tokens_seen": 33184217744,
      "step": 42178
    },
    {
      "epoch": 4.474750689582007,
      "grad_norm": 0.5597177388014746,
      "learning_rate": 3.476033085898437e-05,
      "loss": 1.2646,
      "num_input_tokens_seen": 33185004576,
      "step": 42179
    },
    {
      "epoch": 4.474856779121579,
      "grad_norm": 0.5654952463205568,
      "learning_rate": 3.475969103930823e-05,
      "loss": 1.44,
      "num_input_tokens_seen": 33185791408,
      "step": 42180
    },
    {
      "epoch": 4.47496286866115,
      "grad_norm": 0.4851757992174048,
      "learning_rate": 3.475905121209009e-05,
      "loss": 1.2714,
      "num_input_tokens_seen": 33186578208,
      "step": 42181
    },
    {
      "epoch": 4.475068958200722,
      "grad_norm": 0.548499506587089,
      "learning_rate": 3.475841137733045e-05,
      "loss": 1.2561,
      "num_input_tokens_seen": 33187365088,
      "step": 42182
    },
    {
      "epoch": 4.475175047740293,
      "grad_norm": 0.5744345854416798,
      "learning_rate": 3.475777153502978e-05,
      "loss": 1.4371,
      "num_input_tokens_seen": 33188151776,
      "step": 42183
    },
    {
      "epoch": 4.475281137279865,
      "grad_norm": 0.46089251894758554,
      "learning_rate": 3.47571316851886e-05,
      "loss": 1.2132,
      "num_input_tokens_seen": 33188938624,
      "step": 42184
    },
    {
      "epoch": 4.475387226819436,
      "grad_norm": 0.597480276712868,
      "learning_rate": 3.4756491827807394e-05,
      "loss": 1.3759,
      "num_input_tokens_seen": 33189725408,
      "step": 42185
    },
    {
      "epoch": 4.475493316359007,
      "grad_norm": 0.5314286884967008,
      "learning_rate": 3.4755851962886654e-05,
      "loss": 1.3597,
      "num_input_tokens_seen": 33190512112,
      "step": 42186
    },
    {
      "epoch": 4.475599405898579,
      "grad_norm": 0.5004662101736497,
      "learning_rate": 3.475521209042688e-05,
      "loss": 1.3601,
      "num_input_tokens_seen": 33191298848,
      "step": 42187
    },
    {
      "epoch": 4.47570549543815,
      "grad_norm": 0.5692838489843323,
      "learning_rate": 3.475457221042856e-05,
      "loss": 1.312,
      "num_input_tokens_seen": 33192085632,
      "step": 42188
    },
    {
      "epoch": 4.475811584977722,
      "grad_norm": 0.4896816359277272,
      "learning_rate": 3.47539323228922e-05,
      "loss": 1.1972,
      "num_input_tokens_seen": 33192872544,
      "step": 42189
    },
    {
      "epoch": 4.475917674517293,
      "grad_norm": 0.526454207037024,
      "learning_rate": 3.4753292427818286e-05,
      "loss": 1.333,
      "num_input_tokens_seen": 33193659312,
      "step": 42190
    },
    {
      "epoch": 4.476023764056864,
      "grad_norm": 0.6897246849383534,
      "learning_rate": 3.475265252520731e-05,
      "loss": 1.3681,
      "num_input_tokens_seen": 33194446080,
      "step": 42191
    },
    {
      "epoch": 4.476129853596436,
      "grad_norm": 0.4705243602073129,
      "learning_rate": 3.475201261505977e-05,
      "loss": 1.3424,
      "num_input_tokens_seen": 33195232816,
      "step": 42192
    },
    {
      "epoch": 4.476235943136007,
      "grad_norm": 0.5048232306327163,
      "learning_rate": 3.475137269737617e-05,
      "loss": 1.2804,
      "num_input_tokens_seen": 33196019616,
      "step": 42193
    },
    {
      "epoch": 4.4763420326755785,
      "grad_norm": 0.452011014156042,
      "learning_rate": 3.475073277215699e-05,
      "loss": 1.2677,
      "num_input_tokens_seen": 33196806416,
      "step": 42194
    },
    {
      "epoch": 4.4764481222151495,
      "grad_norm": 0.41495290867028073,
      "learning_rate": 3.475009283940273e-05,
      "loss": 1.1994,
      "num_input_tokens_seen": 33197593216,
      "step": 42195
    },
    {
      "epoch": 4.476554211754721,
      "grad_norm": 0.47393611136556796,
      "learning_rate": 3.474945289911388e-05,
      "loss": 1.2881,
      "num_input_tokens_seen": 33198379952,
      "step": 42196
    },
    {
      "epoch": 4.4766603012942925,
      "grad_norm": 0.507589621290194,
      "learning_rate": 3.474881295129094e-05,
      "loss": 1.3331,
      "num_input_tokens_seen": 33199166688,
      "step": 42197
    },
    {
      "epoch": 4.4767663908338635,
      "grad_norm": 0.4853517511246563,
      "learning_rate": 3.4748172995934404e-05,
      "loss": 1.3211,
      "num_input_tokens_seen": 33199953456,
      "step": 42198
    },
    {
      "epoch": 4.476872480373435,
      "grad_norm": 0.5066507727171592,
      "learning_rate": 3.4747533033044764e-05,
      "loss": 1.2909,
      "num_input_tokens_seen": 33200740192,
      "step": 42199
    },
    {
      "epoch": 4.4769785699130065,
      "grad_norm": 0.54648821553533,
      "learning_rate": 3.474689306262252e-05,
      "loss": 1.3742,
      "num_input_tokens_seen": 33201527008,
      "step": 42200
    },
    {
      "epoch": 4.477084659452578,
      "grad_norm": 0.5313730445003952,
      "learning_rate": 3.474625308466817e-05,
      "loss": 1.2605,
      "num_input_tokens_seen": 33202313744,
      "step": 42201
    },
    {
      "epoch": 4.477190748992149,
      "grad_norm": 0.43391472358793765,
      "learning_rate": 3.4745613099182195e-05,
      "loss": 1.1948,
      "num_input_tokens_seen": 33203100544,
      "step": 42202
    },
    {
      "epoch": 4.4772968385317204,
      "grad_norm": 0.4999734020005094,
      "learning_rate": 3.474497310616509e-05,
      "loss": 1.316,
      "num_input_tokens_seen": 33203887296,
      "step": 42203
    },
    {
      "epoch": 4.477402928071292,
      "grad_norm": 0.5199758747732917,
      "learning_rate": 3.474433310561736e-05,
      "loss": 1.3269,
      "num_input_tokens_seen": 33204674080,
      "step": 42204
    },
    {
      "epoch": 4.477509017610863,
      "grad_norm": 0.5510043951697219,
      "learning_rate": 3.47436930975395e-05,
      "loss": 1.3027,
      "num_input_tokens_seen": 33205460880,
      "step": 42205
    },
    {
      "epoch": 4.477615107150435,
      "grad_norm": 0.48747846615529217,
      "learning_rate": 3.4743053081931994e-05,
      "loss": 1.3206,
      "num_input_tokens_seen": 33206247504,
      "step": 42206
    },
    {
      "epoch": 4.477721196690006,
      "grad_norm": 0.507858853623718,
      "learning_rate": 3.4742413058795345e-05,
      "loss": 1.2447,
      "num_input_tokens_seen": 33207034320,
      "step": 42207
    },
    {
      "epoch": 4.477827286229577,
      "grad_norm": 0.475659958531074,
      "learning_rate": 3.4741773028130045e-05,
      "loss": 1.2353,
      "num_input_tokens_seen": 33207821200,
      "step": 42208
    },
    {
      "epoch": 4.477933375769149,
      "grad_norm": 0.5574534605245953,
      "learning_rate": 3.474113298993659e-05,
      "loss": 1.3493,
      "num_input_tokens_seen": 33208607984,
      "step": 42209
    },
    {
      "epoch": 4.47803946530872,
      "grad_norm": 0.494639410632243,
      "learning_rate": 3.474049294421547e-05,
      "loss": 1.3071,
      "num_input_tokens_seen": 33209394752,
      "step": 42210
    },
    {
      "epoch": 4.478145554848292,
      "grad_norm": 0.5932535539211147,
      "learning_rate": 3.473985289096718e-05,
      "loss": 1.2772,
      "num_input_tokens_seen": 33210181552,
      "step": 42211
    },
    {
      "epoch": 4.478251644387863,
      "grad_norm": 0.5817258439676534,
      "learning_rate": 3.4739212830192225e-05,
      "loss": 1.349,
      "num_input_tokens_seen": 33210968288,
      "step": 42212
    },
    {
      "epoch": 4.478357733927435,
      "grad_norm": 0.48143025400612277,
      "learning_rate": 3.473857276189109e-05,
      "loss": 1.2126,
      "num_input_tokens_seen": 33211755088,
      "step": 42213
    },
    {
      "epoch": 4.478463823467006,
      "grad_norm": 0.5049107856468582,
      "learning_rate": 3.473793268606427e-05,
      "loss": 1.3739,
      "num_input_tokens_seen": 33212541808,
      "step": 42214
    },
    {
      "epoch": 4.478569913006577,
      "grad_norm": 0.5303387155097131,
      "learning_rate": 3.4737292602712265e-05,
      "loss": 1.2716,
      "num_input_tokens_seen": 33213328704,
      "step": 42215
    },
    {
      "epoch": 4.478676002546149,
      "grad_norm": 0.5251077663134253,
      "learning_rate": 3.473665251183556e-05,
      "loss": 1.3122,
      "num_input_tokens_seen": 33214115456,
      "step": 42216
    },
    {
      "epoch": 4.47878209208572,
      "grad_norm": 0.46291519420472405,
      "learning_rate": 3.473601241343466e-05,
      "loss": 1.1532,
      "num_input_tokens_seen": 33214902272,
      "step": 42217
    },
    {
      "epoch": 4.478888181625292,
      "grad_norm": 0.5274979107369068,
      "learning_rate": 3.473537230751005e-05,
      "loss": 1.2598,
      "num_input_tokens_seen": 33215689024,
      "step": 42218
    },
    {
      "epoch": 4.478994271164863,
      "grad_norm": 0.6347649464897166,
      "learning_rate": 3.4734732194062233e-05,
      "loss": 1.2882,
      "num_input_tokens_seen": 33216475824,
      "step": 42219
    },
    {
      "epoch": 4.479100360704434,
      "grad_norm": 0.5116357912101348,
      "learning_rate": 3.473409207309171e-05,
      "loss": 1.3214,
      "num_input_tokens_seen": 33217262640,
      "step": 42220
    },
    {
      "epoch": 4.479206450244006,
      "grad_norm": 0.9642689183414629,
      "learning_rate": 3.473345194459895e-05,
      "loss": 1.461,
      "num_input_tokens_seen": 33218049376,
      "step": 42221
    },
    {
      "epoch": 4.479312539783577,
      "grad_norm": 0.5175609881250663,
      "learning_rate": 3.473281180858447e-05,
      "loss": 1.4678,
      "num_input_tokens_seen": 33218836128,
      "step": 42222
    },
    {
      "epoch": 4.479418629323149,
      "grad_norm": 0.6584504344475968,
      "learning_rate": 3.473217166504876e-05,
      "loss": 1.3835,
      "num_input_tokens_seen": 33219622944,
      "step": 42223
    },
    {
      "epoch": 4.47952471886272,
      "grad_norm": 0.4760811569433148,
      "learning_rate": 3.473153151399231e-05,
      "loss": 1.2398,
      "num_input_tokens_seen": 33220409840,
      "step": 42224
    },
    {
      "epoch": 4.479630808402291,
      "grad_norm": 0.5397594812651143,
      "learning_rate": 3.4730891355415626e-05,
      "loss": 1.3953,
      "num_input_tokens_seen": 33221196624,
      "step": 42225
    },
    {
      "epoch": 4.479736897941863,
      "grad_norm": 0.6832337610518907,
      "learning_rate": 3.473025118931918e-05,
      "loss": 1.3899,
      "num_input_tokens_seen": 33221983328,
      "step": 42226
    },
    {
      "epoch": 4.479842987481434,
      "grad_norm": 0.4897840420333532,
      "learning_rate": 3.47296110157035e-05,
      "loss": 1.215,
      "num_input_tokens_seen": 33222770176,
      "step": 42227
    },
    {
      "epoch": 4.479949077021006,
      "grad_norm": 0.5798847132933724,
      "learning_rate": 3.472897083456906e-05,
      "loss": 1.3143,
      "num_input_tokens_seen": 33223556992,
      "step": 42228
    },
    {
      "epoch": 4.480055166560577,
      "grad_norm": 0.728930216412552,
      "learning_rate": 3.472833064591634e-05,
      "loss": 1.2619,
      "num_input_tokens_seen": 33224343824,
      "step": 42229
    },
    {
      "epoch": 4.480161256100149,
      "grad_norm": 0.49642774758545966,
      "learning_rate": 3.472769044974587e-05,
      "loss": 1.3113,
      "num_input_tokens_seen": 33225130592,
      "step": 42230
    },
    {
      "epoch": 4.48026734563972,
      "grad_norm": 0.7167826941356944,
      "learning_rate": 3.4727050246058116e-05,
      "loss": 1.3521,
      "num_input_tokens_seen": 33225917280,
      "step": 42231
    },
    {
      "epoch": 4.480373435179291,
      "grad_norm": 0.5996678190633559,
      "learning_rate": 3.4726410034853584e-05,
      "loss": 1.3392,
      "num_input_tokens_seen": 33226703984,
      "step": 42232
    },
    {
      "epoch": 4.480479524718863,
      "grad_norm": 0.7569895096436846,
      "learning_rate": 3.472576981613277e-05,
      "loss": 1.3177,
      "num_input_tokens_seen": 33227490768,
      "step": 42233
    },
    {
      "epoch": 4.480585614258434,
      "grad_norm": 0.5542948403887322,
      "learning_rate": 3.4725129589896164e-05,
      "loss": 1.3219,
      "num_input_tokens_seen": 33228277600,
      "step": 42234
    },
    {
      "epoch": 4.480691703798006,
      "grad_norm": 0.5182963784755582,
      "learning_rate": 3.4724489356144265e-05,
      "loss": 1.3249,
      "num_input_tokens_seen": 33229064368,
      "step": 42235
    },
    {
      "epoch": 4.480797793337577,
      "grad_norm": 0.6325548776767459,
      "learning_rate": 3.4723849114877565e-05,
      "loss": 1.3018,
      "num_input_tokens_seen": 33229851072,
      "step": 42236
    },
    {
      "epoch": 4.480903882877148,
      "grad_norm": 0.4843899805107958,
      "learning_rate": 3.4723208866096564e-05,
      "loss": 1.2469,
      "num_input_tokens_seen": 33230637856,
      "step": 42237
    },
    {
      "epoch": 4.48100997241672,
      "grad_norm": 0.4504067014504467,
      "learning_rate": 3.472256860980175e-05,
      "loss": 1.2493,
      "num_input_tokens_seen": 33231424656,
      "step": 42238
    },
    {
      "epoch": 4.481116061956291,
      "grad_norm": 0.5059172375034406,
      "learning_rate": 3.472192834599361e-05,
      "loss": 1.327,
      "num_input_tokens_seen": 33232211440,
      "step": 42239
    },
    {
      "epoch": 4.481222151495863,
      "grad_norm": 0.574879134986648,
      "learning_rate": 3.4721288074672666e-05,
      "loss": 1.268,
      "num_input_tokens_seen": 33232998240,
      "step": 42240
    },
    {
      "epoch": 4.481328241035434,
      "grad_norm": 0.46302281183584737,
      "learning_rate": 3.472064779583938e-05,
      "loss": 1.2497,
      "num_input_tokens_seen": 33233784992,
      "step": 42241
    },
    {
      "epoch": 4.481434330575006,
      "grad_norm": 0.6239626742215251,
      "learning_rate": 3.472000750949428e-05,
      "loss": 1.3532,
      "num_input_tokens_seen": 33234571792,
      "step": 42242
    },
    {
      "epoch": 4.481540420114577,
      "grad_norm": 0.5234443224746004,
      "learning_rate": 3.4719367215637825e-05,
      "loss": 1.2409,
      "num_input_tokens_seen": 33235358640,
      "step": 42243
    },
    {
      "epoch": 4.481646509654148,
      "grad_norm": 0.5846199882099933,
      "learning_rate": 3.4718726914270546e-05,
      "loss": 1.3465,
      "num_input_tokens_seen": 33236145440,
      "step": 42244
    },
    {
      "epoch": 4.48175259919372,
      "grad_norm": 0.49266407708333904,
      "learning_rate": 3.471808660539291e-05,
      "loss": 1.2753,
      "num_input_tokens_seen": 33236932208,
      "step": 42245
    },
    {
      "epoch": 4.481858688733291,
      "grad_norm": 0.5728594841011538,
      "learning_rate": 3.471744628900542e-05,
      "loss": 1.2528,
      "num_input_tokens_seen": 33237719008,
      "step": 42246
    },
    {
      "epoch": 4.481964778272863,
      "grad_norm": 0.5461600996327878,
      "learning_rate": 3.471680596510858e-05,
      "loss": 1.3457,
      "num_input_tokens_seen": 33238505808,
      "step": 42247
    },
    {
      "epoch": 4.482070867812434,
      "grad_norm": 0.7153036256307873,
      "learning_rate": 3.471616563370287e-05,
      "loss": 1.3617,
      "num_input_tokens_seen": 33239292528,
      "step": 42248
    },
    {
      "epoch": 4.482176957352005,
      "grad_norm": 0.5728630357300799,
      "learning_rate": 3.471552529478879e-05,
      "loss": 1.304,
      "num_input_tokens_seen": 33240079360,
      "step": 42249
    },
    {
      "epoch": 4.482283046891577,
      "grad_norm": 0.4784478613278604,
      "learning_rate": 3.4714884948366844e-05,
      "loss": 1.251,
      "num_input_tokens_seen": 33240866176,
      "step": 42250
    },
    {
      "epoch": 4.482389136431148,
      "grad_norm": 0.5378011544070977,
      "learning_rate": 3.4714244594437525e-05,
      "loss": 1.3871,
      "num_input_tokens_seen": 33241652864,
      "step": 42251
    },
    {
      "epoch": 4.48249522597072,
      "grad_norm": 0.5585636913414068,
      "learning_rate": 3.471360423300131e-05,
      "loss": 1.2164,
      "num_input_tokens_seen": 33242439648,
      "step": 42252
    },
    {
      "epoch": 4.482601315510291,
      "grad_norm": 0.5362547583051243,
      "learning_rate": 3.471296386405872e-05,
      "loss": 1.2932,
      "num_input_tokens_seen": 33243226416,
      "step": 42253
    },
    {
      "epoch": 4.482707405049862,
      "grad_norm": 0.6219926523120605,
      "learning_rate": 3.471232348761023e-05,
      "loss": 1.4119,
      "num_input_tokens_seen": 33244013120,
      "step": 42254
    },
    {
      "epoch": 4.482813494589434,
      "grad_norm": 0.5748084017977104,
      "learning_rate": 3.4711683103656336e-05,
      "loss": 1.3739,
      "num_input_tokens_seen": 33244799904,
      "step": 42255
    },
    {
      "epoch": 4.482919584129005,
      "grad_norm": 0.48256747424286306,
      "learning_rate": 3.471104271219754e-05,
      "loss": 1.2659,
      "num_input_tokens_seen": 33245586704,
      "step": 42256
    },
    {
      "epoch": 4.4830256736685765,
      "grad_norm": 0.4974688354494202,
      "learning_rate": 3.471040231323433e-05,
      "loss": 1.2776,
      "num_input_tokens_seen": 33246373488,
      "step": 42257
    },
    {
      "epoch": 4.4831317632081475,
      "grad_norm": 0.5941410878057161,
      "learning_rate": 3.4709761906767226e-05,
      "loss": 1.2553,
      "num_input_tokens_seen": 33247160320,
      "step": 42258
    },
    {
      "epoch": 4.4832378527477195,
      "grad_norm": 0.6433790275221991,
      "learning_rate": 3.4709121492796695e-05,
      "loss": 1.4924,
      "num_input_tokens_seen": 33247947056,
      "step": 42259
    },
    {
      "epoch": 4.4833439422872905,
      "grad_norm": 0.5568812306908556,
      "learning_rate": 3.4708481071323226e-05,
      "loss": 1.393,
      "num_input_tokens_seen": 33248733760,
      "step": 42260
    },
    {
      "epoch": 4.4834500318268615,
      "grad_norm": 0.5041904558313308,
      "learning_rate": 3.4707840642347343e-05,
      "loss": 1.3046,
      "num_input_tokens_seen": 33249520480,
      "step": 42261
    },
    {
      "epoch": 4.4835561213664334,
      "grad_norm": 0.5865231883126568,
      "learning_rate": 3.470720020586952e-05,
      "loss": 1.3577,
      "num_input_tokens_seen": 33250307120,
      "step": 42262
    },
    {
      "epoch": 4.4836622109060045,
      "grad_norm": 0.5631089730026885,
      "learning_rate": 3.470655976189026e-05,
      "loss": 1.3258,
      "num_input_tokens_seen": 33251093888,
      "step": 42263
    },
    {
      "epoch": 4.483768300445576,
      "grad_norm": 0.6087044279750234,
      "learning_rate": 3.470591931041005e-05,
      "loss": 1.3182,
      "num_input_tokens_seen": 33251880560,
      "step": 42264
    },
    {
      "epoch": 4.483874389985147,
      "grad_norm": 0.7596235510117729,
      "learning_rate": 3.4705278851429395e-05,
      "loss": 1.3364,
      "num_input_tokens_seen": 33252667408,
      "step": 42265
    },
    {
      "epoch": 4.4839804795247185,
      "grad_norm": 0.5273974938598776,
      "learning_rate": 3.470463838494878e-05,
      "loss": 1.2875,
      "num_input_tokens_seen": 33253454128,
      "step": 42266
    },
    {
      "epoch": 4.48408656906429,
      "grad_norm": 0.5800476681383532,
      "learning_rate": 3.4703997910968705e-05,
      "loss": 1.2652,
      "num_input_tokens_seen": 33254240896,
      "step": 42267
    },
    {
      "epoch": 4.484192658603861,
      "grad_norm": 0.5418882421975745,
      "learning_rate": 3.470335742948967e-05,
      "loss": 1.2636,
      "num_input_tokens_seen": 33255027600,
      "step": 42268
    },
    {
      "epoch": 4.484298748143433,
      "grad_norm": 0.520853332768249,
      "learning_rate": 3.470271694051217e-05,
      "loss": 1.3421,
      "num_input_tokens_seen": 33255814448,
      "step": 42269
    },
    {
      "epoch": 4.484404837683004,
      "grad_norm": 0.4720551558358898,
      "learning_rate": 3.470207644403668e-05,
      "loss": 1.3065,
      "num_input_tokens_seen": 33256601184,
      "step": 42270
    },
    {
      "epoch": 4.484510927222576,
      "grad_norm": 0.5468232923503776,
      "learning_rate": 3.470143594006372e-05,
      "loss": 1.3141,
      "num_input_tokens_seen": 33257387984,
      "step": 42271
    },
    {
      "epoch": 4.484617016762147,
      "grad_norm": 0.5277658159038853,
      "learning_rate": 3.470079542859378e-05,
      "loss": 1.3476,
      "num_input_tokens_seen": 33258174752,
      "step": 42272
    },
    {
      "epoch": 4.484723106301718,
      "grad_norm": 0.679999093004274,
      "learning_rate": 3.4700154909627345e-05,
      "loss": 1.3554,
      "num_input_tokens_seen": 33258961472,
      "step": 42273
    },
    {
      "epoch": 4.48482919584129,
      "grad_norm": 0.5932781462312219,
      "learning_rate": 3.469951438316491e-05,
      "loss": 1.2823,
      "num_input_tokens_seen": 33259748208,
      "step": 42274
    },
    {
      "epoch": 4.484935285380861,
      "grad_norm": 0.5541887700857593,
      "learning_rate": 3.469887384920698e-05,
      "loss": 1.3883,
      "num_input_tokens_seen": 33260534912,
      "step": 42275
    },
    {
      "epoch": 4.485041374920433,
      "grad_norm": 0.666572585064808,
      "learning_rate": 3.469823330775405e-05,
      "loss": 1.2757,
      "num_input_tokens_seen": 33261321648,
      "step": 42276
    },
    {
      "epoch": 4.485147464460004,
      "grad_norm": 0.6462209347110087,
      "learning_rate": 3.4697592758806595e-05,
      "loss": 1.4783,
      "num_input_tokens_seen": 33262108400,
      "step": 42277
    },
    {
      "epoch": 4.485253553999575,
      "grad_norm": 0.4855212176904114,
      "learning_rate": 3.4696952202365135e-05,
      "loss": 1.1868,
      "num_input_tokens_seen": 33262895248,
      "step": 42278
    },
    {
      "epoch": 4.485359643539147,
      "grad_norm": 0.6208687392132558,
      "learning_rate": 3.469631163843016e-05,
      "loss": 1.3142,
      "num_input_tokens_seen": 33263682032,
      "step": 42279
    },
    {
      "epoch": 4.485465733078718,
      "grad_norm": 0.5383029194670403,
      "learning_rate": 3.469567106700215e-05,
      "loss": 1.3519,
      "num_input_tokens_seen": 33264468864,
      "step": 42280
    },
    {
      "epoch": 4.48557182261829,
      "grad_norm": 0.5513135457768777,
      "learning_rate": 3.469503048808161e-05,
      "loss": 1.3005,
      "num_input_tokens_seen": 33265255616,
      "step": 42281
    },
    {
      "epoch": 4.485677912157861,
      "grad_norm": 0.5428946301798676,
      "learning_rate": 3.469438990166904e-05,
      "loss": 1.3136,
      "num_input_tokens_seen": 33266042432,
      "step": 42282
    },
    {
      "epoch": 4.485784001697432,
      "grad_norm": 0.5017540960160685,
      "learning_rate": 3.4693749307764926e-05,
      "loss": 1.2865,
      "num_input_tokens_seen": 33266829232,
      "step": 42283
    },
    {
      "epoch": 4.485890091237004,
      "grad_norm": 0.5434290040694584,
      "learning_rate": 3.469310870636977e-05,
      "loss": 1.2782,
      "num_input_tokens_seen": 33267616064,
      "step": 42284
    },
    {
      "epoch": 4.485996180776575,
      "grad_norm": 0.5851883927258402,
      "learning_rate": 3.4692468097484066e-05,
      "loss": 1.3512,
      "num_input_tokens_seen": 33268402736,
      "step": 42285
    },
    {
      "epoch": 4.486102270316147,
      "grad_norm": 0.6006037240463026,
      "learning_rate": 3.4691827481108296e-05,
      "loss": 1.2912,
      "num_input_tokens_seen": 33269189408,
      "step": 42286
    },
    {
      "epoch": 4.486208359855718,
      "grad_norm": 0.5230678056324212,
      "learning_rate": 3.469118685724297e-05,
      "loss": 1.2504,
      "num_input_tokens_seen": 33269976176,
      "step": 42287
    },
    {
      "epoch": 4.48631444939529,
      "grad_norm": 0.5362713730153178,
      "learning_rate": 3.469054622588859e-05,
      "loss": 1.3086,
      "num_input_tokens_seen": 33270762960,
      "step": 42288
    },
    {
      "epoch": 4.486420538934861,
      "grad_norm": 0.6442301502799355,
      "learning_rate": 3.468990558704563e-05,
      "loss": 1.2965,
      "num_input_tokens_seen": 33271549728,
      "step": 42289
    },
    {
      "epoch": 4.486526628474432,
      "grad_norm": 0.45199603084128853,
      "learning_rate": 3.46892649407146e-05,
      "loss": 1.3586,
      "num_input_tokens_seen": 33272336544,
      "step": 42290
    },
    {
      "epoch": 4.486632718014004,
      "grad_norm": 0.5229947625631743,
      "learning_rate": 3.468862428689599e-05,
      "loss": 1.3237,
      "num_input_tokens_seen": 33273123376,
      "step": 42291
    },
    {
      "epoch": 4.486738807553575,
      "grad_norm": 0.6612508562313534,
      "learning_rate": 3.4687983625590296e-05,
      "loss": 1.3307,
      "num_input_tokens_seen": 33273910048,
      "step": 42292
    },
    {
      "epoch": 4.486844897093147,
      "grad_norm": 0.5272234060256015,
      "learning_rate": 3.468734295679801e-05,
      "loss": 1.3489,
      "num_input_tokens_seen": 33274696784,
      "step": 42293
    },
    {
      "epoch": 4.486950986632718,
      "grad_norm": 0.4608495872026161,
      "learning_rate": 3.468670228051963e-05,
      "loss": 1.1979,
      "num_input_tokens_seen": 33275483504,
      "step": 42294
    },
    {
      "epoch": 4.48705707617229,
      "grad_norm": 0.7875249473351076,
      "learning_rate": 3.4686061596755657e-05,
      "loss": 1.3832,
      "num_input_tokens_seen": 33276270288,
      "step": 42295
    },
    {
      "epoch": 4.487163165711861,
      "grad_norm": 0.5111627661454473,
      "learning_rate": 3.468542090550657e-05,
      "loss": 1.3507,
      "num_input_tokens_seen": 33277057136,
      "step": 42296
    },
    {
      "epoch": 4.487269255251432,
      "grad_norm": 0.6214995072811812,
      "learning_rate": 3.468478020677288e-05,
      "loss": 1.2876,
      "num_input_tokens_seen": 33277843872,
      "step": 42297
    },
    {
      "epoch": 4.487375344791004,
      "grad_norm": 0.4718519881167223,
      "learning_rate": 3.468413950055507e-05,
      "loss": 1.2385,
      "num_input_tokens_seen": 33278630688,
      "step": 42298
    },
    {
      "epoch": 4.487481434330575,
      "grad_norm": 0.5129934578976875,
      "learning_rate": 3.468349878685365e-05,
      "loss": 1.4444,
      "num_input_tokens_seen": 33279417472,
      "step": 42299
    },
    {
      "epoch": 4.487587523870147,
      "grad_norm": 0.495728464182463,
      "learning_rate": 3.46828580656691e-05,
      "loss": 1.3245,
      "num_input_tokens_seen": 33280204224,
      "step": 42300
    },
    {
      "epoch": 4.487693613409718,
      "grad_norm": 0.4658194006866798,
      "learning_rate": 3.468221733700192e-05,
      "loss": 1.1762,
      "num_input_tokens_seen": 33280991072,
      "step": 42301
    },
    {
      "epoch": 4.487799702949289,
      "grad_norm": 0.6877533979946296,
      "learning_rate": 3.468157660085261e-05,
      "loss": 1.306,
      "num_input_tokens_seen": 33281777808,
      "step": 42302
    },
    {
      "epoch": 4.487905792488861,
      "grad_norm": 0.5194264568764795,
      "learning_rate": 3.468093585722166e-05,
      "loss": 1.2971,
      "num_input_tokens_seen": 33282564528,
      "step": 42303
    },
    {
      "epoch": 4.488011882028432,
      "grad_norm": 0.8041583709068311,
      "learning_rate": 3.468029510610957e-05,
      "loss": 1.288,
      "num_input_tokens_seen": 33283351264,
      "step": 42304
    },
    {
      "epoch": 4.488117971568004,
      "grad_norm": 0.5608410573278463,
      "learning_rate": 3.4679654347516836e-05,
      "loss": 1.2498,
      "num_input_tokens_seen": 33284138080,
      "step": 42305
    },
    {
      "epoch": 4.488224061107575,
      "grad_norm": 0.486484244564009,
      "learning_rate": 3.467901358144394e-05,
      "loss": 1.3321,
      "num_input_tokens_seen": 33284924800,
      "step": 42306
    },
    {
      "epoch": 4.488330150647146,
      "grad_norm": 0.6251721617879599,
      "learning_rate": 3.4678372807891385e-05,
      "loss": 1.336,
      "num_input_tokens_seen": 33285711584,
      "step": 42307
    },
    {
      "epoch": 4.488436240186718,
      "grad_norm": 0.5691704525262711,
      "learning_rate": 3.4677732026859675e-05,
      "loss": 1.3177,
      "num_input_tokens_seen": 33286498320,
      "step": 42308
    },
    {
      "epoch": 4.488542329726289,
      "grad_norm": 0.41473345324317723,
      "learning_rate": 3.4677091238349294e-05,
      "loss": 1.1551,
      "num_input_tokens_seen": 33287285184,
      "step": 42309
    },
    {
      "epoch": 4.488648419265861,
      "grad_norm": 0.7312348429402734,
      "learning_rate": 3.467645044236074e-05,
      "loss": 1.2616,
      "num_input_tokens_seen": 33288071856,
      "step": 42310
    },
    {
      "epoch": 4.488754508805432,
      "grad_norm": 0.5984466490441556,
      "learning_rate": 3.467580963889451e-05,
      "loss": 1.1982,
      "num_input_tokens_seen": 33288858592,
      "step": 42311
    },
    {
      "epoch": 4.488860598345003,
      "grad_norm": 0.55943690173627,
      "learning_rate": 3.46751688279511e-05,
      "loss": 1.2926,
      "num_input_tokens_seen": 33289645376,
      "step": 42312
    },
    {
      "epoch": 4.488966687884575,
      "grad_norm": 0.787727391177575,
      "learning_rate": 3.4674528009531e-05,
      "loss": 1.3205,
      "num_input_tokens_seen": 33290432160,
      "step": 42313
    },
    {
      "epoch": 4.489072777424146,
      "grad_norm": 0.4973862037016609,
      "learning_rate": 3.4673887183634715e-05,
      "loss": 1.2812,
      "num_input_tokens_seen": 33291218864,
      "step": 42314
    },
    {
      "epoch": 4.489178866963718,
      "grad_norm": 0.575878570592607,
      "learning_rate": 3.4673246350262724e-05,
      "loss": 1.2682,
      "num_input_tokens_seen": 33292005664,
      "step": 42315
    },
    {
      "epoch": 4.489284956503289,
      "grad_norm": 0.5182289760596972,
      "learning_rate": 3.467260550941553e-05,
      "loss": 1.2449,
      "num_input_tokens_seen": 33292792384,
      "step": 42316
    },
    {
      "epoch": 4.4893910460428605,
      "grad_norm": 0.5062789349200456,
      "learning_rate": 3.467196466109365e-05,
      "loss": 1.2988,
      "num_input_tokens_seen": 33293579136,
      "step": 42317
    },
    {
      "epoch": 4.489497135582432,
      "grad_norm": 0.585370012611777,
      "learning_rate": 3.467132380529754e-05,
      "loss": 1.3207,
      "num_input_tokens_seen": 33294365856,
      "step": 42318
    },
    {
      "epoch": 4.489603225122003,
      "grad_norm": 0.46785672033598336,
      "learning_rate": 3.4670682942027723e-05,
      "loss": 1.2681,
      "num_input_tokens_seen": 33295152640,
      "step": 42319
    },
    {
      "epoch": 4.4897093146615745,
      "grad_norm": 0.631766149675624,
      "learning_rate": 3.467004207128469e-05,
      "loss": 1.3399,
      "num_input_tokens_seen": 33295939312,
      "step": 42320
    },
    {
      "epoch": 4.4898154042011456,
      "grad_norm": 0.5067969439168772,
      "learning_rate": 3.4669401193068915e-05,
      "loss": 1.1945,
      "num_input_tokens_seen": 33296726096,
      "step": 42321
    },
    {
      "epoch": 4.4899214937407175,
      "grad_norm": 0.5219930123132576,
      "learning_rate": 3.466876030738093e-05,
      "loss": 1.2365,
      "num_input_tokens_seen": 33297512816,
      "step": 42322
    },
    {
      "epoch": 4.4900275832802885,
      "grad_norm": 0.6372134391534359,
      "learning_rate": 3.466811941422121e-05,
      "loss": 1.2713,
      "num_input_tokens_seen": 33298299664,
      "step": 42323
    },
    {
      "epoch": 4.49013367281986,
      "grad_norm": 0.44854089980118766,
      "learning_rate": 3.4667478513590235e-05,
      "loss": 1.2167,
      "num_input_tokens_seen": 33299086480,
      "step": 42324
    },
    {
      "epoch": 4.4902397623594315,
      "grad_norm": 0.566883148851298,
      "learning_rate": 3.4666837605488525e-05,
      "loss": 1.3166,
      "num_input_tokens_seen": 33299873232,
      "step": 42325
    },
    {
      "epoch": 4.4903458518990025,
      "grad_norm": 0.5238783690202117,
      "learning_rate": 3.466619668991657e-05,
      "loss": 1.3583,
      "num_input_tokens_seen": 33300659968,
      "step": 42326
    },
    {
      "epoch": 4.490451941438574,
      "grad_norm": 0.5214767596866932,
      "learning_rate": 3.466555576687486e-05,
      "loss": 1.2995,
      "num_input_tokens_seen": 33301446704,
      "step": 42327
    },
    {
      "epoch": 4.490558030978145,
      "grad_norm": 0.50272000432035,
      "learning_rate": 3.4664914836363895e-05,
      "loss": 1.2227,
      "num_input_tokens_seen": 33302233520,
      "step": 42328
    },
    {
      "epoch": 4.490664120517717,
      "grad_norm": 0.6545860247162247,
      "learning_rate": 3.4664273898384156e-05,
      "loss": 1.4501,
      "num_input_tokens_seen": 33303020352,
      "step": 42329
    },
    {
      "epoch": 4.490770210057288,
      "grad_norm": 0.5962813194742251,
      "learning_rate": 3.466363295293616e-05,
      "loss": 1.3609,
      "num_input_tokens_seen": 33303807104,
      "step": 42330
    },
    {
      "epoch": 4.490876299596859,
      "grad_norm": 0.627842049064636,
      "learning_rate": 3.466299200002039e-05,
      "loss": 1.3191,
      "num_input_tokens_seen": 33304593952,
      "step": 42331
    },
    {
      "epoch": 4.490982389136431,
      "grad_norm": 0.5668177224943068,
      "learning_rate": 3.466235103963734e-05,
      "loss": 1.3428,
      "num_input_tokens_seen": 33305380768,
      "step": 42332
    },
    {
      "epoch": 4.491088478676002,
      "grad_norm": 0.5838749538626459,
      "learning_rate": 3.4661710071787514e-05,
      "loss": 1.355,
      "num_input_tokens_seen": 33306167552,
      "step": 42333
    },
    {
      "epoch": 4.491194568215574,
      "grad_norm": 0.63016953615376,
      "learning_rate": 3.46610690964714e-05,
      "loss": 1.377,
      "num_input_tokens_seen": 33306954192,
      "step": 42334
    },
    {
      "epoch": 4.491300657755145,
      "grad_norm": 0.6608093050722015,
      "learning_rate": 3.466042811368949e-05,
      "loss": 1.415,
      "num_input_tokens_seen": 33307740896,
      "step": 42335
    },
    {
      "epoch": 4.491406747294716,
      "grad_norm": 0.4577020034690494,
      "learning_rate": 3.4659787123442286e-05,
      "loss": 1.3487,
      "num_input_tokens_seen": 33308527680,
      "step": 42336
    },
    {
      "epoch": 4.491512836834288,
      "grad_norm": 0.7372735764467406,
      "learning_rate": 3.465914612573029e-05,
      "loss": 1.3184,
      "num_input_tokens_seen": 33309314560,
      "step": 42337
    },
    {
      "epoch": 4.491618926373859,
      "grad_norm": 0.5928086450470165,
      "learning_rate": 3.4658505120553985e-05,
      "loss": 1.2891,
      "num_input_tokens_seen": 33310101440,
      "step": 42338
    },
    {
      "epoch": 4.491725015913431,
      "grad_norm": 0.5613498005693032,
      "learning_rate": 3.465786410791387e-05,
      "loss": 1.3142,
      "num_input_tokens_seen": 33310888224,
      "step": 42339
    },
    {
      "epoch": 4.491831105453002,
      "grad_norm": 0.6826073010645506,
      "learning_rate": 3.465722308781044e-05,
      "loss": 1.4153,
      "num_input_tokens_seen": 33311674912,
      "step": 42340
    },
    {
      "epoch": 4.491937194992573,
      "grad_norm": 0.6162641245494302,
      "learning_rate": 3.465658206024419e-05,
      "loss": 1.2612,
      "num_input_tokens_seen": 33312461712,
      "step": 42341
    },
    {
      "epoch": 4.492043284532145,
      "grad_norm": 0.6311748081929822,
      "learning_rate": 3.465594102521562e-05,
      "loss": 1.3,
      "num_input_tokens_seen": 33313248480,
      "step": 42342
    },
    {
      "epoch": 4.492149374071716,
      "grad_norm": 0.5020342434041434,
      "learning_rate": 3.465529998272522e-05,
      "loss": 1.2745,
      "num_input_tokens_seen": 33314035200,
      "step": 42343
    },
    {
      "epoch": 4.492255463611288,
      "grad_norm": 0.5805126776472036,
      "learning_rate": 3.465465893277349e-05,
      "loss": 1.4447,
      "num_input_tokens_seen": 33314822016,
      "step": 42344
    },
    {
      "epoch": 4.492361553150859,
      "grad_norm": 0.43400082045954047,
      "learning_rate": 3.4654017875360924e-05,
      "loss": 1.2948,
      "num_input_tokens_seen": 33315608768,
      "step": 42345
    },
    {
      "epoch": 4.492467642690431,
      "grad_norm": 0.5561411757808158,
      "learning_rate": 3.4653376810488006e-05,
      "loss": 1.188,
      "num_input_tokens_seen": 33316395536,
      "step": 42346
    },
    {
      "epoch": 4.492573732230002,
      "grad_norm": 0.561651484779314,
      "learning_rate": 3.465273573815525e-05,
      "loss": 1.3303,
      "num_input_tokens_seen": 33317182208,
      "step": 42347
    },
    {
      "epoch": 4.492679821769573,
      "grad_norm": 0.5824116508395855,
      "learning_rate": 3.465209465836315e-05,
      "loss": 1.2994,
      "num_input_tokens_seen": 33317968944,
      "step": 42348
    },
    {
      "epoch": 4.492785911309145,
      "grad_norm": 0.6125738209181024,
      "learning_rate": 3.465145357111218e-05,
      "loss": 1.3945,
      "num_input_tokens_seen": 33318755728,
      "step": 42349
    },
    {
      "epoch": 4.492892000848716,
      "grad_norm": 0.6050064170239464,
      "learning_rate": 3.465081247640286e-05,
      "loss": 1.3376,
      "num_input_tokens_seen": 33319542496,
      "step": 42350
    },
    {
      "epoch": 4.492998090388288,
      "grad_norm": 0.5241432543475218,
      "learning_rate": 3.465017137423567e-05,
      "loss": 1.3695,
      "num_input_tokens_seen": 33320329232,
      "step": 42351
    },
    {
      "epoch": 4.493104179927859,
      "grad_norm": 0.70755386831618,
      "learning_rate": 3.464953026461111e-05,
      "loss": 1.57,
      "num_input_tokens_seen": 33321115920,
      "step": 42352
    },
    {
      "epoch": 4.493210269467431,
      "grad_norm": 0.4874160834200184,
      "learning_rate": 3.464888914752968e-05,
      "loss": 1.3087,
      "num_input_tokens_seen": 33321902704,
      "step": 42353
    },
    {
      "epoch": 4.493316359007002,
      "grad_norm": 0.6161089602805498,
      "learning_rate": 3.464824802299187e-05,
      "loss": 1.2025,
      "num_input_tokens_seen": 33322689552,
      "step": 42354
    },
    {
      "epoch": 4.493422448546573,
      "grad_norm": 0.47629712125372653,
      "learning_rate": 3.464760689099818e-05,
      "loss": 1.262,
      "num_input_tokens_seen": 33323476288,
      "step": 42355
    },
    {
      "epoch": 4.493528538086145,
      "grad_norm": 0.5301658477377738,
      "learning_rate": 3.46469657515491e-05,
      "loss": 1.1788,
      "num_input_tokens_seen": 33324263072,
      "step": 42356
    },
    {
      "epoch": 4.493634627625716,
      "grad_norm": 0.7838075636395951,
      "learning_rate": 3.464632460464513e-05,
      "loss": 1.3411,
      "num_input_tokens_seen": 33325049968,
      "step": 42357
    },
    {
      "epoch": 4.493740717165288,
      "grad_norm": 0.4894803316515152,
      "learning_rate": 3.464568345028676e-05,
      "loss": 1.3981,
      "num_input_tokens_seen": 33325836624,
      "step": 42358
    },
    {
      "epoch": 4.493846806704859,
      "grad_norm": 0.7079842601250709,
      "learning_rate": 3.464504228847449e-05,
      "loss": 1.3841,
      "num_input_tokens_seen": 33326623424,
      "step": 42359
    },
    {
      "epoch": 4.49395289624443,
      "grad_norm": 0.575425336295426,
      "learning_rate": 3.4644401119208814e-05,
      "loss": 1.2869,
      "num_input_tokens_seen": 33327410112,
      "step": 42360
    },
    {
      "epoch": 4.494058985784002,
      "grad_norm": 0.4949817048464973,
      "learning_rate": 3.464375994249023e-05,
      "loss": 1.346,
      "num_input_tokens_seen": 33328196784,
      "step": 42361
    },
    {
      "epoch": 4.494165075323573,
      "grad_norm": 0.6062756002689312,
      "learning_rate": 3.4643118758319226e-05,
      "loss": 1.3112,
      "num_input_tokens_seen": 33328983472,
      "step": 42362
    },
    {
      "epoch": 4.494271164863145,
      "grad_norm": 0.547576554977418,
      "learning_rate": 3.464247756669631e-05,
      "loss": 1.2966,
      "num_input_tokens_seen": 33329770240,
      "step": 42363
    },
    {
      "epoch": 4.494377254402716,
      "grad_norm": 0.4569111319577681,
      "learning_rate": 3.464183636762196e-05,
      "loss": 1.2739,
      "num_input_tokens_seen": 33330557024,
      "step": 42364
    },
    {
      "epoch": 4.494483343942287,
      "grad_norm": 0.6354602053762936,
      "learning_rate": 3.464119516109669e-05,
      "loss": 1.307,
      "num_input_tokens_seen": 33331343792,
      "step": 42365
    },
    {
      "epoch": 4.494589433481859,
      "grad_norm": 0.6103622746430077,
      "learning_rate": 3.464055394712098e-05,
      "loss": 1.3049,
      "num_input_tokens_seen": 33332130576,
      "step": 42366
    },
    {
      "epoch": 4.49469552302143,
      "grad_norm": 0.566147398855877,
      "learning_rate": 3.463991272569534e-05,
      "loss": 1.2883,
      "num_input_tokens_seen": 33332917264,
      "step": 42367
    },
    {
      "epoch": 4.494801612561002,
      "grad_norm": 0.6687622792805877,
      "learning_rate": 3.4639271496820256e-05,
      "loss": 1.3689,
      "num_input_tokens_seen": 33333704032,
      "step": 42368
    },
    {
      "epoch": 4.494907702100573,
      "grad_norm": 0.5148393303536816,
      "learning_rate": 3.463863026049623e-05,
      "loss": 1.2601,
      "num_input_tokens_seen": 33334490784,
      "step": 42369
    },
    {
      "epoch": 4.495013791640145,
      "grad_norm": 0.5341107528254192,
      "learning_rate": 3.463798901672375e-05,
      "loss": 1.2775,
      "num_input_tokens_seen": 33335277568,
      "step": 42370
    },
    {
      "epoch": 4.495119881179716,
      "grad_norm": 0.6510023578677318,
      "learning_rate": 3.463734776550331e-05,
      "loss": 1.3511,
      "num_input_tokens_seen": 33336064304,
      "step": 42371
    },
    {
      "epoch": 4.495225970719287,
      "grad_norm": 0.6355653729416842,
      "learning_rate": 3.4636706506835415e-05,
      "loss": 1.451,
      "num_input_tokens_seen": 33336851056,
      "step": 42372
    },
    {
      "epoch": 4.495332060258859,
      "grad_norm": 0.4768523379624054,
      "learning_rate": 3.463606524072056e-05,
      "loss": 1.341,
      "num_input_tokens_seen": 33337637840,
      "step": 42373
    },
    {
      "epoch": 4.49543814979843,
      "grad_norm": 0.5636861280732998,
      "learning_rate": 3.463542396715923e-05,
      "loss": 1.2988,
      "num_input_tokens_seen": 33338424592,
      "step": 42374
    },
    {
      "epoch": 4.495544239338002,
      "grad_norm": 0.569099318974348,
      "learning_rate": 3.463478268615193e-05,
      "loss": 1.1909,
      "num_input_tokens_seen": 33339211376,
      "step": 42375
    },
    {
      "epoch": 4.495650328877573,
      "grad_norm": 0.517446619091391,
      "learning_rate": 3.463414139769915e-05,
      "loss": 1.3405,
      "num_input_tokens_seen": 33339998144,
      "step": 42376
    },
    {
      "epoch": 4.495756418417144,
      "grad_norm": 0.5721331300094019,
      "learning_rate": 3.46335001018014e-05,
      "loss": 1.2147,
      "num_input_tokens_seen": 33340785008,
      "step": 42377
    },
    {
      "epoch": 4.495862507956716,
      "grad_norm": 0.690039201719446,
      "learning_rate": 3.463285879845914e-05,
      "loss": 1.3864,
      "num_input_tokens_seen": 33341571696,
      "step": 42378
    },
    {
      "epoch": 4.495968597496287,
      "grad_norm": 0.5428156082328701,
      "learning_rate": 3.4632217487672914e-05,
      "loss": 1.3502,
      "num_input_tokens_seen": 33342358512,
      "step": 42379
    },
    {
      "epoch": 4.4960746870358586,
      "grad_norm": 0.7669200912534795,
      "learning_rate": 3.463157616944318e-05,
      "loss": 1.2951,
      "num_input_tokens_seen": 33343145376,
      "step": 42380
    },
    {
      "epoch": 4.49618077657543,
      "grad_norm": 0.5860480623680775,
      "learning_rate": 3.463093484377045e-05,
      "loss": 1.4189,
      "num_input_tokens_seen": 33343932096,
      "step": 42381
    },
    {
      "epoch": 4.4962868661150015,
      "grad_norm": 0.5972307489033031,
      "learning_rate": 3.463029351065521e-05,
      "loss": 1.2504,
      "num_input_tokens_seen": 33344718816,
      "step": 42382
    },
    {
      "epoch": 4.4963929556545725,
      "grad_norm": 0.7911551550416511,
      "learning_rate": 3.462965217009798e-05,
      "loss": 1.3198,
      "num_input_tokens_seen": 33345505648,
      "step": 42383
    },
    {
      "epoch": 4.496499045194144,
      "grad_norm": 0.634212986764238,
      "learning_rate": 3.4629010822099215e-05,
      "loss": 1.4168,
      "num_input_tokens_seen": 33346292480,
      "step": 42384
    },
    {
      "epoch": 4.4966051347337155,
      "grad_norm": 0.5465789643119306,
      "learning_rate": 3.4628369466659443e-05,
      "loss": 1.2435,
      "num_input_tokens_seen": 33347079264,
      "step": 42385
    },
    {
      "epoch": 4.4967112242732865,
      "grad_norm": 0.6228448034524164,
      "learning_rate": 3.4627728103779145e-05,
      "loss": 1.2276,
      "num_input_tokens_seen": 33347866080,
      "step": 42386
    },
    {
      "epoch": 4.496817313812858,
      "grad_norm": 0.5187287153913859,
      "learning_rate": 3.462708673345883e-05,
      "loss": 1.2815,
      "num_input_tokens_seen": 33348652864,
      "step": 42387
    },
    {
      "epoch": 4.4969234033524295,
      "grad_norm": 0.7005747702288668,
      "learning_rate": 3.4626445355698985e-05,
      "loss": 1.3481,
      "num_input_tokens_seen": 33349439632,
      "step": 42388
    },
    {
      "epoch": 4.4970294928920005,
      "grad_norm": 0.4957123489962374,
      "learning_rate": 3.462580397050009e-05,
      "loss": 1.3314,
      "num_input_tokens_seen": 33350226368,
      "step": 42389
    },
    {
      "epoch": 4.497135582431572,
      "grad_norm": 0.5549296688495919,
      "learning_rate": 3.4625162577862666e-05,
      "loss": 1.3527,
      "num_input_tokens_seen": 33351013216,
      "step": 42390
    },
    {
      "epoch": 4.497241671971143,
      "grad_norm": 0.5240397037991491,
      "learning_rate": 3.4624521177787206e-05,
      "loss": 1.2371,
      "num_input_tokens_seen": 33351800096,
      "step": 42391
    },
    {
      "epoch": 4.497347761510715,
      "grad_norm": 0.7791647522459895,
      "learning_rate": 3.462387977027419e-05,
      "loss": 1.2752,
      "num_input_tokens_seen": 33352586880,
      "step": 42392
    },
    {
      "epoch": 4.497453851050286,
      "grad_norm": 0.49286701241317127,
      "learning_rate": 3.462323835532413e-05,
      "loss": 1.2984,
      "num_input_tokens_seen": 33353373680,
      "step": 42393
    },
    {
      "epoch": 4.497559940589857,
      "grad_norm": 0.5704047472942361,
      "learning_rate": 3.462259693293751e-05,
      "loss": 1.362,
      "num_input_tokens_seen": 33354160416,
      "step": 42394
    },
    {
      "epoch": 4.497666030129429,
      "grad_norm": 0.7313924874073908,
      "learning_rate": 3.4621955503114814e-05,
      "loss": 1.3619,
      "num_input_tokens_seen": 33354947200,
      "step": 42395
    },
    {
      "epoch": 4.497772119669,
      "grad_norm": 0.5444656485021387,
      "learning_rate": 3.4621314065856566e-05,
      "loss": 1.4437,
      "num_input_tokens_seen": 33355733968,
      "step": 42396
    },
    {
      "epoch": 4.497878209208572,
      "grad_norm": 0.72608843019277,
      "learning_rate": 3.462067262116326e-05,
      "loss": 1.3574,
      "num_input_tokens_seen": 33356520816,
      "step": 42397
    },
    {
      "epoch": 4.497984298748143,
      "grad_norm": 0.6670726703734718,
      "learning_rate": 3.462003116903536e-05,
      "loss": 1.3019,
      "num_input_tokens_seen": 33357307632,
      "step": 42398
    },
    {
      "epoch": 4.498090388287715,
      "grad_norm": 0.6370914636843503,
      "learning_rate": 3.46193897094734e-05,
      "loss": 1.4048,
      "num_input_tokens_seen": 33358094448,
      "step": 42399
    },
    {
      "epoch": 4.498196477827286,
      "grad_norm": 0.744059463574862,
      "learning_rate": 3.461874824247785e-05,
      "loss": 1.4078,
      "num_input_tokens_seen": 33358881216,
      "step": 42400
    },
    {
      "epoch": 4.498302567366857,
      "grad_norm": 0.6396484514281353,
      "learning_rate": 3.461810676804921e-05,
      "loss": 1.2852,
      "num_input_tokens_seen": 33359668032,
      "step": 42401
    },
    {
      "epoch": 4.498408656906429,
      "grad_norm": 0.576056561591578,
      "learning_rate": 3.461746528618798e-05,
      "loss": 1.2676,
      "num_input_tokens_seen": 33360454784,
      "step": 42402
    },
    {
      "epoch": 4.498514746446,
      "grad_norm": 0.6642692310641376,
      "learning_rate": 3.461682379689466e-05,
      "loss": 1.3407,
      "num_input_tokens_seen": 33361241600,
      "step": 42403
    },
    {
      "epoch": 4.498620835985572,
      "grad_norm": 0.8052656136390771,
      "learning_rate": 3.461618230016973e-05,
      "loss": 1.4602,
      "num_input_tokens_seen": 33362028384,
      "step": 42404
    },
    {
      "epoch": 4.498726925525143,
      "grad_norm": 0.5585815500881698,
      "learning_rate": 3.461554079601371e-05,
      "loss": 1.247,
      "num_input_tokens_seen": 33362815152,
      "step": 42405
    },
    {
      "epoch": 4.498833015064714,
      "grad_norm": 0.7294027202335832,
      "learning_rate": 3.4614899284427074e-05,
      "loss": 1.3937,
      "num_input_tokens_seen": 33363601936,
      "step": 42406
    },
    {
      "epoch": 4.498939104604286,
      "grad_norm": 0.5754633293697006,
      "learning_rate": 3.461425776541033e-05,
      "loss": 1.3836,
      "num_input_tokens_seen": 33364388656,
      "step": 42407
    },
    {
      "epoch": 4.499045194143857,
      "grad_norm": 0.5096602600928414,
      "learning_rate": 3.461361623896397e-05,
      "loss": 1.3289,
      "num_input_tokens_seen": 33365175456,
      "step": 42408
    },
    {
      "epoch": 4.499151283683429,
      "grad_norm": 0.5298301661656283,
      "learning_rate": 3.4612974705088485e-05,
      "loss": 1.2474,
      "num_input_tokens_seen": 33365962224,
      "step": 42409
    },
    {
      "epoch": 4.499257373223,
      "grad_norm": 0.6409616002717413,
      "learning_rate": 3.4612333163784375e-05,
      "loss": 1.2901,
      "num_input_tokens_seen": 33366749008,
      "step": 42410
    },
    {
      "epoch": 4.499363462762572,
      "grad_norm": 0.5768495228700136,
      "learning_rate": 3.4611691615052146e-05,
      "loss": 1.3134,
      "num_input_tokens_seen": 33367535824,
      "step": 42411
    },
    {
      "epoch": 4.499469552302143,
      "grad_norm": 0.6277012524951642,
      "learning_rate": 3.461105005889228e-05,
      "loss": 1.2439,
      "num_input_tokens_seen": 33368322576,
      "step": 42412
    },
    {
      "epoch": 4.499575641841714,
      "grad_norm": 0.5643720002855167,
      "learning_rate": 3.4610408495305265e-05,
      "loss": 1.2698,
      "num_input_tokens_seen": 33369109344,
      "step": 42413
    },
    {
      "epoch": 4.499681731381286,
      "grad_norm": 0.5512445948300896,
      "learning_rate": 3.460976692429162e-05,
      "loss": 1.337,
      "num_input_tokens_seen": 33369896096,
      "step": 42414
    },
    {
      "epoch": 4.499787820920857,
      "grad_norm": 0.6507299098963115,
      "learning_rate": 3.460912534585182e-05,
      "loss": 1.3691,
      "num_input_tokens_seen": 33370682880,
      "step": 42415
    },
    {
      "epoch": 4.499893910460429,
      "grad_norm": 0.529250301230227,
      "learning_rate": 3.460848375998638e-05,
      "loss": 1.3164,
      "num_input_tokens_seen": 33371469632,
      "step": 42416
    },
    {
      "epoch": 4.5,
      "grad_norm": 0.5750533207672657,
      "learning_rate": 3.460784216669578e-05,
      "loss": 1.3734,
      "num_input_tokens_seen": 33372256368,
      "step": 42417
    },
    {
      "epoch": 4.500106089539571,
      "grad_norm": 0.4986178854017614,
      "learning_rate": 3.460720056598053e-05,
      "loss": 1.3227,
      "num_input_tokens_seen": 33373043120,
      "step": 42418
    },
    {
      "epoch": 4.500212179079143,
      "grad_norm": 0.5282758902421266,
      "learning_rate": 3.4606558957841106e-05,
      "loss": 1.3437,
      "num_input_tokens_seen": 33373829904,
      "step": 42419
    },
    {
      "epoch": 4.500318268618714,
      "grad_norm": 0.5009120244908604,
      "learning_rate": 3.4605917342278025e-05,
      "loss": 1.3101,
      "num_input_tokens_seen": 33374616672,
      "step": 42420
    },
    {
      "epoch": 4.500424358158286,
      "grad_norm": 0.593472067519956,
      "learning_rate": 3.4605275719291756e-05,
      "loss": 1.3252,
      "num_input_tokens_seen": 33375403504,
      "step": 42421
    },
    {
      "epoch": 4.500530447697857,
      "grad_norm": 0.6512906016697562,
      "learning_rate": 3.460463408888282e-05,
      "loss": 1.4041,
      "num_input_tokens_seen": 33376190272,
      "step": 42422
    },
    {
      "epoch": 4.500636537237428,
      "grad_norm": 0.6654683032321953,
      "learning_rate": 3.460399245105171e-05,
      "loss": 1.3235,
      "num_input_tokens_seen": 33376977072,
      "step": 42423
    },
    {
      "epoch": 4.500742626777,
      "grad_norm": 0.6472976790442904,
      "learning_rate": 3.460335080579892e-05,
      "loss": 1.4206,
      "num_input_tokens_seen": 33377763888,
      "step": 42424
    },
    {
      "epoch": 4.500848716316571,
      "grad_norm": 0.6339508462726933,
      "learning_rate": 3.4602709153124934e-05,
      "loss": 1.3632,
      "num_input_tokens_seen": 33378550592,
      "step": 42425
    },
    {
      "epoch": 4.500954805856143,
      "grad_norm": 0.5635276002934906,
      "learning_rate": 3.460206749303027e-05,
      "loss": 1.1762,
      "num_input_tokens_seen": 33379337424,
      "step": 42426
    },
    {
      "epoch": 4.501060895395714,
      "grad_norm": 0.6085937452196536,
      "learning_rate": 3.460142582551539e-05,
      "loss": 1.3164,
      "num_input_tokens_seen": 33380124112,
      "step": 42427
    },
    {
      "epoch": 4.501166984935285,
      "grad_norm": 0.5594349873064577,
      "learning_rate": 3.460078415058082e-05,
      "loss": 1.2519,
      "num_input_tokens_seen": 33380910832,
      "step": 42428
    },
    {
      "epoch": 4.501273074474857,
      "grad_norm": 0.458621639688984,
      "learning_rate": 3.4600142468227036e-05,
      "loss": 1.2497,
      "num_input_tokens_seen": 33381697632,
      "step": 42429
    },
    {
      "epoch": 4.501379164014428,
      "grad_norm": 0.6586170885383857,
      "learning_rate": 3.459950077845455e-05,
      "loss": 1.3078,
      "num_input_tokens_seen": 33382484432,
      "step": 42430
    },
    {
      "epoch": 4.501485253554,
      "grad_norm": 0.4805728550260933,
      "learning_rate": 3.459885908126386e-05,
      "loss": 1.2826,
      "num_input_tokens_seen": 33383271152,
      "step": 42431
    },
    {
      "epoch": 4.501591343093571,
      "grad_norm": 0.583838980085159,
      "learning_rate": 3.459821737665544e-05,
      "loss": 1.3066,
      "num_input_tokens_seen": 33384057952,
      "step": 42432
    },
    {
      "epoch": 4.501697432633143,
      "grad_norm": 0.5369471780950954,
      "learning_rate": 3.459757566462981e-05,
      "loss": 1.3626,
      "num_input_tokens_seen": 33384844656,
      "step": 42433
    },
    {
      "epoch": 4.501803522172714,
      "grad_norm": 0.5657763373044609,
      "learning_rate": 3.4596933945187455e-05,
      "loss": 1.3423,
      "num_input_tokens_seen": 33385631408,
      "step": 42434
    },
    {
      "epoch": 4.501909611712286,
      "grad_norm": 0.5931926995508399,
      "learning_rate": 3.4596292218328865e-05,
      "loss": 1.2285,
      "num_input_tokens_seen": 33386418176,
      "step": 42435
    },
    {
      "epoch": 4.502015701251857,
      "grad_norm": 0.5366432533365307,
      "learning_rate": 3.459565048405454e-05,
      "loss": 1.3787,
      "num_input_tokens_seen": 33387204864,
      "step": 42436
    },
    {
      "epoch": 4.502121790791428,
      "grad_norm": 0.603539398449798,
      "learning_rate": 3.459500874236499e-05,
      "loss": 1.3566,
      "num_input_tokens_seen": 33387991552,
      "step": 42437
    },
    {
      "epoch": 4.502227880331,
      "grad_norm": 0.5115753934677462,
      "learning_rate": 3.4594366993260686e-05,
      "loss": 1.3678,
      "num_input_tokens_seen": 33388778288,
      "step": 42438
    },
    {
      "epoch": 4.502333969870571,
      "grad_norm": 0.5462645141614159,
      "learning_rate": 3.459372523674213e-05,
      "loss": 1.1904,
      "num_input_tokens_seen": 33389565152,
      "step": 42439
    },
    {
      "epoch": 4.502440059410143,
      "grad_norm": 0.49562889945739946,
      "learning_rate": 3.459308347280985e-05,
      "loss": 1.2959,
      "num_input_tokens_seen": 33390351904,
      "step": 42440
    },
    {
      "epoch": 4.502546148949714,
      "grad_norm": 0.4777426126763419,
      "learning_rate": 3.4592441701464294e-05,
      "loss": 1.4505,
      "num_input_tokens_seen": 33391138608,
      "step": 42441
    },
    {
      "epoch": 4.502652238489285,
      "grad_norm": 0.5657121527890432,
      "learning_rate": 3.459179992270599e-05,
      "loss": 1.3396,
      "num_input_tokens_seen": 33391925344,
      "step": 42442
    },
    {
      "epoch": 4.502758328028857,
      "grad_norm": 0.5720135052788697,
      "learning_rate": 3.459115813653543e-05,
      "loss": 1.4161,
      "num_input_tokens_seen": 33392712176,
      "step": 42443
    },
    {
      "epoch": 4.502864417568428,
      "grad_norm": 0.5003889736579601,
      "learning_rate": 3.4590516342953094e-05,
      "loss": 1.335,
      "num_input_tokens_seen": 33393499024,
      "step": 42444
    },
    {
      "epoch": 4.5029705071079995,
      "grad_norm": 0.5011467403950134,
      "learning_rate": 3.458987454195949e-05,
      "loss": 1.3087,
      "num_input_tokens_seen": 33394285728,
      "step": 42445
    },
    {
      "epoch": 4.5030765966475705,
      "grad_norm": 0.5039326526041267,
      "learning_rate": 3.458923273355511e-05,
      "loss": 1.224,
      "num_input_tokens_seen": 33395072400,
      "step": 42446
    },
    {
      "epoch": 4.503182686187142,
      "grad_norm": 0.5922048519771206,
      "learning_rate": 3.458859091774046e-05,
      "loss": 1.4317,
      "num_input_tokens_seen": 33395859104,
      "step": 42447
    },
    {
      "epoch": 4.5032887757267135,
      "grad_norm": 0.5349551109341513,
      "learning_rate": 3.4587949094516024e-05,
      "loss": 1.3472,
      "num_input_tokens_seen": 33396645952,
      "step": 42448
    },
    {
      "epoch": 4.5033948652662845,
      "grad_norm": 0.48875488659306493,
      "learning_rate": 3.4587307263882306e-05,
      "loss": 1.3146,
      "num_input_tokens_seen": 33397432800,
      "step": 42449
    },
    {
      "epoch": 4.503500954805856,
      "grad_norm": 0.5854226147705014,
      "learning_rate": 3.458666542583979e-05,
      "loss": 1.3833,
      "num_input_tokens_seen": 33398219584,
      "step": 42450
    },
    {
      "epoch": 4.5036070443454275,
      "grad_norm": 0.6117506049103086,
      "learning_rate": 3.4586023580388995e-05,
      "loss": 1.3457,
      "num_input_tokens_seen": 33399006256,
      "step": 42451
    },
    {
      "epoch": 4.5037131338849985,
      "grad_norm": 0.5486658252248124,
      "learning_rate": 3.4585381727530385e-05,
      "loss": 1.3627,
      "num_input_tokens_seen": 33399793072,
      "step": 42452
    },
    {
      "epoch": 4.50381922342457,
      "grad_norm": 0.5199573816968521,
      "learning_rate": 3.458473986726448e-05,
      "loss": 1.3281,
      "num_input_tokens_seen": 33400579856,
      "step": 42453
    },
    {
      "epoch": 4.5039253129641414,
      "grad_norm": 0.49116181070527115,
      "learning_rate": 3.458409799959178e-05,
      "loss": 1.2575,
      "num_input_tokens_seen": 33401366608,
      "step": 42454
    },
    {
      "epoch": 4.504031402503713,
      "grad_norm": 0.7966289686347556,
      "learning_rate": 3.458345612451275e-05,
      "loss": 1.3219,
      "num_input_tokens_seen": 33402153328,
      "step": 42455
    },
    {
      "epoch": 4.504137492043284,
      "grad_norm": 0.5495257060530272,
      "learning_rate": 3.4582814242027923e-05,
      "loss": 1.361,
      "num_input_tokens_seen": 33402940096,
      "step": 42456
    },
    {
      "epoch": 4.504243581582856,
      "grad_norm": 0.7171362176610795,
      "learning_rate": 3.458217235213777e-05,
      "loss": 1.243,
      "num_input_tokens_seen": 33403726832,
      "step": 42457
    },
    {
      "epoch": 4.504349671122427,
      "grad_norm": 0.5976043316731491,
      "learning_rate": 3.458153045484279e-05,
      "loss": 1.3478,
      "num_input_tokens_seen": 33404513536,
      "step": 42458
    },
    {
      "epoch": 4.504455760661998,
      "grad_norm": 0.588942222574198,
      "learning_rate": 3.4580888550143495e-05,
      "loss": 1.3729,
      "num_input_tokens_seen": 33405300240,
      "step": 42459
    },
    {
      "epoch": 4.50456185020157,
      "grad_norm": 0.64325829288413,
      "learning_rate": 3.458024663804037e-05,
      "loss": 1.409,
      "num_input_tokens_seen": 33406086992,
      "step": 42460
    },
    {
      "epoch": 4.504667939741141,
      "grad_norm": 0.5171511386556854,
      "learning_rate": 3.457960471853391e-05,
      "loss": 1.3509,
      "num_input_tokens_seen": 33406873840,
      "step": 42461
    },
    {
      "epoch": 4.504774029280713,
      "grad_norm": 0.4589873437569468,
      "learning_rate": 3.457896279162462e-05,
      "loss": 1.3451,
      "num_input_tokens_seen": 33407660624,
      "step": 42462
    },
    {
      "epoch": 4.504880118820284,
      "grad_norm": 0.5983386056010398,
      "learning_rate": 3.4578320857312975e-05,
      "loss": 1.2522,
      "num_input_tokens_seen": 33408447312,
      "step": 42463
    },
    {
      "epoch": 4.504986208359856,
      "grad_norm": 0.5993667879697321,
      "learning_rate": 3.4577678915599484e-05,
      "loss": 1.361,
      "num_input_tokens_seen": 33409234032,
      "step": 42464
    },
    {
      "epoch": 4.505092297899427,
      "grad_norm": 0.6739112239654315,
      "learning_rate": 3.4577036966484654e-05,
      "loss": 1.4865,
      "num_input_tokens_seen": 33410020896,
      "step": 42465
    },
    {
      "epoch": 4.505198387438998,
      "grad_norm": 0.48647158260627565,
      "learning_rate": 3.4576395009968964e-05,
      "loss": 1.3199,
      "num_input_tokens_seen": 33410807632,
      "step": 42466
    },
    {
      "epoch": 4.50530447697857,
      "grad_norm": 0.588075664105009,
      "learning_rate": 3.457575304605292e-05,
      "loss": 1.2959,
      "num_input_tokens_seen": 33411594336,
      "step": 42467
    },
    {
      "epoch": 4.505410566518141,
      "grad_norm": 0.5418745936284908,
      "learning_rate": 3.4575111074737014e-05,
      "loss": 1.312,
      "num_input_tokens_seen": 33412381088,
      "step": 42468
    },
    {
      "epoch": 4.505516656057713,
      "grad_norm": 0.5147009588875318,
      "learning_rate": 3.457446909602174e-05,
      "loss": 1.341,
      "num_input_tokens_seen": 33413167824,
      "step": 42469
    },
    {
      "epoch": 4.505622745597284,
      "grad_norm": 0.6145598897402319,
      "learning_rate": 3.4573827109907605e-05,
      "loss": 1.2886,
      "num_input_tokens_seen": 33413954544,
      "step": 42470
    },
    {
      "epoch": 4.505728835136855,
      "grad_norm": 0.5426865029177633,
      "learning_rate": 3.4573185116395095e-05,
      "loss": 1.3642,
      "num_input_tokens_seen": 33414741200,
      "step": 42471
    },
    {
      "epoch": 4.505834924676427,
      "grad_norm": 0.6739141175098418,
      "learning_rate": 3.457254311548471e-05,
      "loss": 1.3485,
      "num_input_tokens_seen": 33415527936,
      "step": 42472
    },
    {
      "epoch": 4.505941014215998,
      "grad_norm": 0.5394338968530401,
      "learning_rate": 3.457190110717693e-05,
      "loss": 1.2272,
      "num_input_tokens_seen": 33416314720,
      "step": 42473
    },
    {
      "epoch": 4.50604710375557,
      "grad_norm": 0.6923678977391873,
      "learning_rate": 3.457125909147229e-05,
      "loss": 1.3928,
      "num_input_tokens_seen": 33417101424,
      "step": 42474
    },
    {
      "epoch": 4.506153193295141,
      "grad_norm": 0.5684696085452703,
      "learning_rate": 3.457061706837124e-05,
      "loss": 1.338,
      "num_input_tokens_seen": 33417888192,
      "step": 42475
    },
    {
      "epoch": 4.506259282834712,
      "grad_norm": 0.5788795743569521,
      "learning_rate": 3.456997503787431e-05,
      "loss": 1.2644,
      "num_input_tokens_seen": 33418674928,
      "step": 42476
    },
    {
      "epoch": 4.506365372374284,
      "grad_norm": 0.480541911930849,
      "learning_rate": 3.456933299998198e-05,
      "loss": 1.2091,
      "num_input_tokens_seen": 33419461728,
      "step": 42477
    },
    {
      "epoch": 4.506471461913855,
      "grad_norm": 0.5338228532249701,
      "learning_rate": 3.456869095469475e-05,
      "loss": 1.3051,
      "num_input_tokens_seen": 33420248544,
      "step": 42478
    },
    {
      "epoch": 4.506577551453427,
      "grad_norm": 0.7142652457465656,
      "learning_rate": 3.456804890201312e-05,
      "loss": 1.391,
      "num_input_tokens_seen": 33421035232,
      "step": 42479
    },
    {
      "epoch": 4.506683640992998,
      "grad_norm": 0.5387108982884986,
      "learning_rate": 3.456740684193758e-05,
      "loss": 1.2832,
      "num_input_tokens_seen": 33421822016,
      "step": 42480
    },
    {
      "epoch": 4.506789730532569,
      "grad_norm": 0.7036644851803443,
      "learning_rate": 3.456676477446862e-05,
      "loss": 1.2803,
      "num_input_tokens_seen": 33422608816,
      "step": 42481
    },
    {
      "epoch": 4.506895820072141,
      "grad_norm": 0.5778389494275913,
      "learning_rate": 3.456612269960676e-05,
      "loss": 1.3874,
      "num_input_tokens_seen": 33423395568,
      "step": 42482
    },
    {
      "epoch": 4.507001909611712,
      "grad_norm": 0.6342350179180644,
      "learning_rate": 3.4565480617352474e-05,
      "loss": 1.3538,
      "num_input_tokens_seen": 33424182400,
      "step": 42483
    },
    {
      "epoch": 4.507107999151284,
      "grad_norm": 0.5604625653125095,
      "learning_rate": 3.4564838527706265e-05,
      "loss": 1.3506,
      "num_input_tokens_seen": 33424969152,
      "step": 42484
    },
    {
      "epoch": 4.507214088690855,
      "grad_norm": 0.6062962629725549,
      "learning_rate": 3.4564196430668636e-05,
      "loss": 1.3525,
      "num_input_tokens_seen": 33425755840,
      "step": 42485
    },
    {
      "epoch": 4.507320178230427,
      "grad_norm": 0.5941255715373667,
      "learning_rate": 3.456355432624007e-05,
      "loss": 1.3072,
      "num_input_tokens_seen": 33426542672,
      "step": 42486
    },
    {
      "epoch": 4.507426267769998,
      "grad_norm": 0.6475969939381786,
      "learning_rate": 3.4562912214421065e-05,
      "loss": 1.2918,
      "num_input_tokens_seen": 33427329392,
      "step": 42487
    },
    {
      "epoch": 4.507532357309569,
      "grad_norm": 0.5757188235333859,
      "learning_rate": 3.456227009521213e-05,
      "loss": 1.3586,
      "num_input_tokens_seen": 33428116192,
      "step": 42488
    },
    {
      "epoch": 4.507638446849141,
      "grad_norm": 0.4833847279998625,
      "learning_rate": 3.4561627968613744e-05,
      "loss": 1.243,
      "num_input_tokens_seen": 33428902912,
      "step": 42489
    },
    {
      "epoch": 4.507744536388712,
      "grad_norm": 0.5374319003237928,
      "learning_rate": 3.4560985834626424e-05,
      "loss": 1.3998,
      "num_input_tokens_seen": 33429689584,
      "step": 42490
    },
    {
      "epoch": 4.507850625928284,
      "grad_norm": 0.502293577241741,
      "learning_rate": 3.456034369325065e-05,
      "loss": 1.3384,
      "num_input_tokens_seen": 33430476320,
      "step": 42491
    },
    {
      "epoch": 4.507956715467855,
      "grad_norm": 0.5718404133662399,
      "learning_rate": 3.4559701544486924e-05,
      "loss": 1.2891,
      "num_input_tokens_seen": 33431263120,
      "step": 42492
    },
    {
      "epoch": 4.508062805007427,
      "grad_norm": 0.5523382240940296,
      "learning_rate": 3.455905938833574e-05,
      "loss": 1.3251,
      "num_input_tokens_seen": 33432049808,
      "step": 42493
    },
    {
      "epoch": 4.508168894546998,
      "grad_norm": 0.6353315334123067,
      "learning_rate": 3.4558417224797595e-05,
      "loss": 1.3441,
      "num_input_tokens_seen": 33432836608,
      "step": 42494
    },
    {
      "epoch": 4.508274984086569,
      "grad_norm": 0.48042253096998877,
      "learning_rate": 3.4557775053872984e-05,
      "loss": 1.3781,
      "num_input_tokens_seen": 33433623360,
      "step": 42495
    },
    {
      "epoch": 4.508381073626141,
      "grad_norm": 0.5557705555751067,
      "learning_rate": 3.455713287556241e-05,
      "loss": 1.3679,
      "num_input_tokens_seen": 33434410112,
      "step": 42496
    },
    {
      "epoch": 4.508487163165712,
      "grad_norm": 0.7025069548822884,
      "learning_rate": 3.455649068986636e-05,
      "loss": 1.3411,
      "num_input_tokens_seen": 33435196832,
      "step": 42497
    },
    {
      "epoch": 4.508593252705284,
      "grad_norm": 0.5068360681414367,
      "learning_rate": 3.4555848496785335e-05,
      "loss": 1.223,
      "num_input_tokens_seen": 33435983600,
      "step": 42498
    },
    {
      "epoch": 4.508699342244855,
      "grad_norm": 0.6795656426844952,
      "learning_rate": 3.4555206296319834e-05,
      "loss": 1.2982,
      "num_input_tokens_seen": 33436770320,
      "step": 42499
    },
    {
      "epoch": 4.508805431784426,
      "grad_norm": 0.5155811312510721,
      "learning_rate": 3.4554564088470346e-05,
      "loss": 1.3494,
      "num_input_tokens_seen": 33437557040,
      "step": 42500
    },
    {
      "epoch": 4.508911521323998,
      "grad_norm": 0.48860301803129264,
      "learning_rate": 3.4553921873237374e-05,
      "loss": 1.2062,
      "num_input_tokens_seen": 33438343792,
      "step": 42501
    },
    {
      "epoch": 4.509017610863569,
      "grad_norm": 0.5927009151627677,
      "learning_rate": 3.4553279650621405e-05,
      "loss": 1.3391,
      "num_input_tokens_seen": 33439130496,
      "step": 42502
    },
    {
      "epoch": 4.509123700403141,
      "grad_norm": 0.48797768597640867,
      "learning_rate": 3.4552637420622955e-05,
      "loss": 1.3705,
      "num_input_tokens_seen": 33439917280,
      "step": 42503
    },
    {
      "epoch": 4.509229789942712,
      "grad_norm": 0.6202036241310306,
      "learning_rate": 3.455199518324249e-05,
      "loss": 1.3056,
      "num_input_tokens_seen": 33440703984,
      "step": 42504
    },
    {
      "epoch": 4.509335879482283,
      "grad_norm": 0.5537671788286334,
      "learning_rate": 3.455135293848053e-05,
      "loss": 1.3435,
      "num_input_tokens_seen": 33441490784,
      "step": 42505
    },
    {
      "epoch": 4.509441969021855,
      "grad_norm": 0.5009777440323111,
      "learning_rate": 3.455071068633757e-05,
      "loss": 1.2429,
      "num_input_tokens_seen": 33442277600,
      "step": 42506
    },
    {
      "epoch": 4.509548058561426,
      "grad_norm": 0.5155363193280724,
      "learning_rate": 3.45500684268141e-05,
      "loss": 1.3219,
      "num_input_tokens_seen": 33443064400,
      "step": 42507
    },
    {
      "epoch": 4.5096541481009975,
      "grad_norm": 0.4935952505246323,
      "learning_rate": 3.4549426159910614e-05,
      "loss": 1.368,
      "num_input_tokens_seen": 33443851232,
      "step": 42508
    },
    {
      "epoch": 4.5097602376405685,
      "grad_norm": 0.5456983248482907,
      "learning_rate": 3.4548783885627614e-05,
      "loss": 1.3908,
      "num_input_tokens_seen": 33444637968,
      "step": 42509
    },
    {
      "epoch": 4.50986632718014,
      "grad_norm": 0.4630300614416032,
      "learning_rate": 3.454814160396559e-05,
      "loss": 1.3031,
      "num_input_tokens_seen": 33445424704,
      "step": 42510
    },
    {
      "epoch": 4.5099724167197115,
      "grad_norm": 0.5925060816696808,
      "learning_rate": 3.4547499314925045e-05,
      "loss": 1.2184,
      "num_input_tokens_seen": 33446211520,
      "step": 42511
    },
    {
      "epoch": 4.5100785062592825,
      "grad_norm": 0.5231708025569276,
      "learning_rate": 3.454685701850647e-05,
      "loss": 1.3957,
      "num_input_tokens_seen": 33446998320,
      "step": 42512
    },
    {
      "epoch": 4.5101845957988544,
      "grad_norm": 0.6249618460059878,
      "learning_rate": 3.4546214714710365e-05,
      "loss": 1.2612,
      "num_input_tokens_seen": 33447785136,
      "step": 42513
    },
    {
      "epoch": 4.5102906853384255,
      "grad_norm": 0.5730759240875035,
      "learning_rate": 3.454557240353723e-05,
      "loss": 1.3676,
      "num_input_tokens_seen": 33448571936,
      "step": 42514
    },
    {
      "epoch": 4.510396774877997,
      "grad_norm": 0.6315165572622176,
      "learning_rate": 3.4544930084987556e-05,
      "loss": 1.2874,
      "num_input_tokens_seen": 33449358656,
      "step": 42515
    },
    {
      "epoch": 4.510502864417568,
      "grad_norm": 0.5077481321167422,
      "learning_rate": 3.454428775906184e-05,
      "loss": 1.2982,
      "num_input_tokens_seen": 33450145344,
      "step": 42516
    },
    {
      "epoch": 4.5106089539571395,
      "grad_norm": 0.5456060374999188,
      "learning_rate": 3.454364542576057e-05,
      "loss": 1.2756,
      "num_input_tokens_seen": 33450932048,
      "step": 42517
    },
    {
      "epoch": 4.510715043496711,
      "grad_norm": 0.9781522120829005,
      "learning_rate": 3.4543003085084256e-05,
      "loss": 1.4064,
      "num_input_tokens_seen": 33451718832,
      "step": 42518
    },
    {
      "epoch": 4.510821133036282,
      "grad_norm": 0.5107946828991485,
      "learning_rate": 3.4542360737033393e-05,
      "loss": 1.4088,
      "num_input_tokens_seen": 33452505536,
      "step": 42519
    },
    {
      "epoch": 4.510927222575854,
      "grad_norm": 0.7160721940178587,
      "learning_rate": 3.454171838160848e-05,
      "loss": 1.3314,
      "num_input_tokens_seen": 33453292272,
      "step": 42520
    },
    {
      "epoch": 4.511033312115425,
      "grad_norm": 0.6965503901978791,
      "learning_rate": 3.4541076018809994e-05,
      "loss": 1.2699,
      "num_input_tokens_seen": 33454079104,
      "step": 42521
    },
    {
      "epoch": 4.511139401654997,
      "grad_norm": 0.5304136737968038,
      "learning_rate": 3.4540433648638447e-05,
      "loss": 1.3878,
      "num_input_tokens_seen": 33454865856,
      "step": 42522
    },
    {
      "epoch": 4.511245491194568,
      "grad_norm": 0.7532838362901606,
      "learning_rate": 3.453979127109434e-05,
      "loss": 1.2821,
      "num_input_tokens_seen": 33455652656,
      "step": 42523
    },
    {
      "epoch": 4.511351580734139,
      "grad_norm": 0.688422541730255,
      "learning_rate": 3.453914888617815e-05,
      "loss": 1.3,
      "num_input_tokens_seen": 33456439440,
      "step": 42524
    },
    {
      "epoch": 4.511457670273711,
      "grad_norm": 0.548014943295657,
      "learning_rate": 3.4538506493890395e-05,
      "loss": 1.2999,
      "num_input_tokens_seen": 33457226240,
      "step": 42525
    },
    {
      "epoch": 4.511563759813282,
      "grad_norm": 0.9283097931842375,
      "learning_rate": 3.4537864094231556e-05,
      "loss": 1.4243,
      "num_input_tokens_seen": 33458013120,
      "step": 42526
    },
    {
      "epoch": 4.511669849352854,
      "grad_norm": 0.4455729224333831,
      "learning_rate": 3.4537221687202136e-05,
      "loss": 1.2485,
      "num_input_tokens_seen": 33458799904,
      "step": 42527
    },
    {
      "epoch": 4.511775938892425,
      "grad_norm": 0.5569551058737242,
      "learning_rate": 3.453657927280264e-05,
      "loss": 1.3051,
      "num_input_tokens_seen": 33459586640,
      "step": 42528
    },
    {
      "epoch": 4.511882028431996,
      "grad_norm": 0.6521866392321902,
      "learning_rate": 3.453593685103355e-05,
      "loss": 1.2804,
      "num_input_tokens_seen": 33460373376,
      "step": 42529
    },
    {
      "epoch": 4.511988117971568,
      "grad_norm": 0.6299664167986001,
      "learning_rate": 3.4535294421895366e-05,
      "loss": 1.2915,
      "num_input_tokens_seen": 33461160080,
      "step": 42530
    },
    {
      "epoch": 4.512094207511139,
      "grad_norm": 0.5607800782938456,
      "learning_rate": 3.453465198538859e-05,
      "loss": 1.3257,
      "num_input_tokens_seen": 33461946832,
      "step": 42531
    },
    {
      "epoch": 4.512200297050711,
      "grad_norm": 0.7231668648270436,
      "learning_rate": 3.453400954151371e-05,
      "loss": 1.3013,
      "num_input_tokens_seen": 33462733632,
      "step": 42532
    },
    {
      "epoch": 4.512306386590282,
      "grad_norm": 0.66855295609467,
      "learning_rate": 3.453336709027123e-05,
      "loss": 1.3352,
      "num_input_tokens_seen": 33463520304,
      "step": 42533
    },
    {
      "epoch": 4.512412476129853,
      "grad_norm": 0.5167282344464195,
      "learning_rate": 3.453272463166164e-05,
      "loss": 1.2395,
      "num_input_tokens_seen": 33464307056,
      "step": 42534
    },
    {
      "epoch": 4.512518565669425,
      "grad_norm": 0.6206138169925263,
      "learning_rate": 3.453208216568544e-05,
      "loss": 1.1637,
      "num_input_tokens_seen": 33465093792,
      "step": 42535
    },
    {
      "epoch": 4.512624655208996,
      "grad_norm": 0.598196505881279,
      "learning_rate": 3.4531439692343135e-05,
      "loss": 1.3342,
      "num_input_tokens_seen": 33465880672,
      "step": 42536
    },
    {
      "epoch": 4.512730744748568,
      "grad_norm": 0.5820735401653273,
      "learning_rate": 3.453079721163521e-05,
      "loss": 1.2422,
      "num_input_tokens_seen": 33466667408,
      "step": 42537
    },
    {
      "epoch": 4.512836834288139,
      "grad_norm": 0.6164469188469525,
      "learning_rate": 3.453015472356216e-05,
      "loss": 1.3114,
      "num_input_tokens_seen": 33467454144,
      "step": 42538
    },
    {
      "epoch": 4.51294292382771,
      "grad_norm": 0.8015658151837277,
      "learning_rate": 3.452951222812448e-05,
      "loss": 1.4221,
      "num_input_tokens_seen": 33468240960,
      "step": 42539
    },
    {
      "epoch": 4.513049013367282,
      "grad_norm": 0.5244623578747406,
      "learning_rate": 3.452886972532269e-05,
      "loss": 1.3456,
      "num_input_tokens_seen": 33469027584,
      "step": 42540
    },
    {
      "epoch": 4.513155102906853,
      "grad_norm": 0.7819362249519879,
      "learning_rate": 3.452822721515726e-05,
      "loss": 1.2843,
      "num_input_tokens_seen": 33469814368,
      "step": 42541
    },
    {
      "epoch": 4.513261192446425,
      "grad_norm": 0.5754021231060473,
      "learning_rate": 3.452758469762869e-05,
      "loss": 1.2456,
      "num_input_tokens_seen": 33470601104,
      "step": 42542
    },
    {
      "epoch": 4.513367281985996,
      "grad_norm": 0.6812596455810525,
      "learning_rate": 3.4526942172737494e-05,
      "loss": 1.2953,
      "num_input_tokens_seen": 33471388016,
      "step": 42543
    },
    {
      "epoch": 4.513473371525568,
      "grad_norm": 0.5415709493784195,
      "learning_rate": 3.4526299640484145e-05,
      "loss": 1.2841,
      "num_input_tokens_seen": 33472174784,
      "step": 42544
    },
    {
      "epoch": 4.513579461065139,
      "grad_norm": 0.5553358217872107,
      "learning_rate": 3.452565710086916e-05,
      "loss": 1.3501,
      "num_input_tokens_seen": 33472961520,
      "step": 42545
    },
    {
      "epoch": 4.51368555060471,
      "grad_norm": 0.6329564744257554,
      "learning_rate": 3.452501455389302e-05,
      "loss": 1.3629,
      "num_input_tokens_seen": 33473748352,
      "step": 42546
    },
    {
      "epoch": 4.513791640144282,
      "grad_norm": 0.47646920354389827,
      "learning_rate": 3.4524371999556224e-05,
      "loss": 1.2522,
      "num_input_tokens_seen": 33474535120,
      "step": 42547
    },
    {
      "epoch": 4.513897729683853,
      "grad_norm": 0.5621533521319977,
      "learning_rate": 3.4523729437859285e-05,
      "loss": 1.3148,
      "num_input_tokens_seen": 33475321952,
      "step": 42548
    },
    {
      "epoch": 4.514003819223425,
      "grad_norm": 0.6222433273985648,
      "learning_rate": 3.452308686880268e-05,
      "loss": 1.2756,
      "num_input_tokens_seen": 33476108688,
      "step": 42549
    },
    {
      "epoch": 4.514109908762996,
      "grad_norm": 0.5231359376243702,
      "learning_rate": 3.452244429238692e-05,
      "loss": 1.3913,
      "num_input_tokens_seen": 33476895472,
      "step": 42550
    },
    {
      "epoch": 4.514215998302568,
      "grad_norm": 0.5744056596386325,
      "learning_rate": 3.452180170861249e-05,
      "loss": 1.376,
      "num_input_tokens_seen": 33477682240,
      "step": 42551
    },
    {
      "epoch": 4.514322087842139,
      "grad_norm": 0.6002887749171307,
      "learning_rate": 3.4521159117479884e-05,
      "loss": 1.311,
      "num_input_tokens_seen": 33478469040,
      "step": 42552
    },
    {
      "epoch": 4.51442817738171,
      "grad_norm": 0.47054030043825035,
      "learning_rate": 3.452051651898961e-05,
      "loss": 1.191,
      "num_input_tokens_seen": 33479255792,
      "step": 42553
    },
    {
      "epoch": 4.514534266921282,
      "grad_norm": 0.5025922558803093,
      "learning_rate": 3.451987391314216e-05,
      "loss": 1.2218,
      "num_input_tokens_seen": 33480042544,
      "step": 42554
    },
    {
      "epoch": 4.514640356460853,
      "grad_norm": 0.560746138919722,
      "learning_rate": 3.451923129993804e-05,
      "loss": 1.3565,
      "num_input_tokens_seen": 33480829200,
      "step": 42555
    },
    {
      "epoch": 4.514746446000425,
      "grad_norm": 0.507861188630273,
      "learning_rate": 3.451858867937773e-05,
      "loss": 1.3198,
      "num_input_tokens_seen": 33481615952,
      "step": 42556
    },
    {
      "epoch": 4.514852535539996,
      "grad_norm": 0.5680964364500233,
      "learning_rate": 3.4517946051461734e-05,
      "loss": 1.2716,
      "num_input_tokens_seen": 33482402720,
      "step": 42557
    },
    {
      "epoch": 4.514958625079567,
      "grad_norm": 0.6113627662020098,
      "learning_rate": 3.451730341619055e-05,
      "loss": 1.3442,
      "num_input_tokens_seen": 33483189504,
      "step": 42558
    },
    {
      "epoch": 4.515064714619139,
      "grad_norm": 0.5694598666565461,
      "learning_rate": 3.451666077356467e-05,
      "loss": 1.2458,
      "num_input_tokens_seen": 33483976320,
      "step": 42559
    },
    {
      "epoch": 4.51517080415871,
      "grad_norm": 0.5410621777488137,
      "learning_rate": 3.4516018123584596e-05,
      "loss": 1.2921,
      "num_input_tokens_seen": 33484763072,
      "step": 42560
    },
    {
      "epoch": 4.515276893698282,
      "grad_norm": 0.5859595344917077,
      "learning_rate": 3.451537546625082e-05,
      "loss": 1.3071,
      "num_input_tokens_seen": 33485549824,
      "step": 42561
    },
    {
      "epoch": 4.515382983237853,
      "grad_norm": 0.5501240788580899,
      "learning_rate": 3.4514732801563844e-05,
      "loss": 1.331,
      "num_input_tokens_seen": 33486336512,
      "step": 42562
    },
    {
      "epoch": 4.515489072777424,
      "grad_norm": 0.5769103283822277,
      "learning_rate": 3.4514090129524167e-05,
      "loss": 1.269,
      "num_input_tokens_seen": 33487123248,
      "step": 42563
    },
    {
      "epoch": 4.515595162316996,
      "grad_norm": 0.5451456227362639,
      "learning_rate": 3.451344745013227e-05,
      "loss": 1.318,
      "num_input_tokens_seen": 33487909968,
      "step": 42564
    },
    {
      "epoch": 4.515701251856567,
      "grad_norm": 0.6072230910366611,
      "learning_rate": 3.4512804763388664e-05,
      "loss": 1.2489,
      "num_input_tokens_seen": 33488696784,
      "step": 42565
    },
    {
      "epoch": 4.515807341396139,
      "grad_norm": 0.6293032259664793,
      "learning_rate": 3.451216206929385e-05,
      "loss": 1.3538,
      "num_input_tokens_seen": 33489483488,
      "step": 42566
    },
    {
      "epoch": 4.51591343093571,
      "grad_norm": 0.489638352465771,
      "learning_rate": 3.45115193678483e-05,
      "loss": 1.2387,
      "num_input_tokens_seen": 33490270240,
      "step": 42567
    },
    {
      "epoch": 4.516019520475281,
      "grad_norm": 0.6419943670425284,
      "learning_rate": 3.451087665905254e-05,
      "loss": 1.3261,
      "num_input_tokens_seen": 33491057056,
      "step": 42568
    },
    {
      "epoch": 4.516125610014853,
      "grad_norm": 0.5606845969165831,
      "learning_rate": 3.4510233942907045e-05,
      "loss": 1.3147,
      "num_input_tokens_seen": 33491843712,
      "step": 42569
    },
    {
      "epoch": 4.516231699554424,
      "grad_norm": 0.6101208464751702,
      "learning_rate": 3.4509591219412326e-05,
      "loss": 1.3946,
      "num_input_tokens_seen": 33492630384,
      "step": 42570
    },
    {
      "epoch": 4.5163377890939955,
      "grad_norm": 0.6707292657942515,
      "learning_rate": 3.450894848856887e-05,
      "loss": 1.2121,
      "num_input_tokens_seen": 33493417088,
      "step": 42571
    },
    {
      "epoch": 4.5164438786335666,
      "grad_norm": 0.5687403862050592,
      "learning_rate": 3.450830575037719e-05,
      "loss": 1.3222,
      "num_input_tokens_seen": 33494203792,
      "step": 42572
    },
    {
      "epoch": 4.5165499681731385,
      "grad_norm": 0.5601764685517628,
      "learning_rate": 3.450766300483775e-05,
      "loss": 1.3377,
      "num_input_tokens_seen": 33494990608,
      "step": 42573
    },
    {
      "epoch": 4.5166560577127095,
      "grad_norm": 0.8734632734974657,
      "learning_rate": 3.4507020251951077e-05,
      "loss": 1.3958,
      "num_input_tokens_seen": 33495777264,
      "step": 42574
    },
    {
      "epoch": 4.516762147252281,
      "grad_norm": 0.4658526168893237,
      "learning_rate": 3.4506377491717665e-05,
      "loss": 1.3424,
      "num_input_tokens_seen": 33496564032,
      "step": 42575
    },
    {
      "epoch": 4.5168682367918525,
      "grad_norm": 0.7337040518468504,
      "learning_rate": 3.450573472413799e-05,
      "loss": 1.3233,
      "num_input_tokens_seen": 33497350768,
      "step": 42576
    },
    {
      "epoch": 4.5169743263314235,
      "grad_norm": 0.5845614641235096,
      "learning_rate": 3.450509194921256e-05,
      "loss": 1.1618,
      "num_input_tokens_seen": 33498137648,
      "step": 42577
    },
    {
      "epoch": 4.517080415870995,
      "grad_norm": 0.5564340932596744,
      "learning_rate": 3.450444916694189e-05,
      "loss": 1.3092,
      "num_input_tokens_seen": 33498924400,
      "step": 42578
    },
    {
      "epoch": 4.517186505410566,
      "grad_norm": 0.6496907145722118,
      "learning_rate": 3.4503806377326455e-05,
      "loss": 1.3197,
      "num_input_tokens_seen": 33499711136,
      "step": 42579
    },
    {
      "epoch": 4.517292594950138,
      "grad_norm": 0.5129067336176111,
      "learning_rate": 3.450316358036675e-05,
      "loss": 1.3076,
      "num_input_tokens_seen": 33500497856,
      "step": 42580
    },
    {
      "epoch": 4.517398684489709,
      "grad_norm": 0.504694988426156,
      "learning_rate": 3.450252077606329e-05,
      "loss": 1.2346,
      "num_input_tokens_seen": 33501284608,
      "step": 42581
    },
    {
      "epoch": 4.51750477402928,
      "grad_norm": 0.580548367682844,
      "learning_rate": 3.450187796441655e-05,
      "loss": 1.3247,
      "num_input_tokens_seen": 33502071344,
      "step": 42582
    },
    {
      "epoch": 4.517610863568852,
      "grad_norm": 0.4549751123790848,
      "learning_rate": 3.450123514542705e-05,
      "loss": 1.2724,
      "num_input_tokens_seen": 33502858112,
      "step": 42583
    },
    {
      "epoch": 4.517716953108423,
      "grad_norm": 0.6079421893368432,
      "learning_rate": 3.450059231909526e-05,
      "loss": 1.3292,
      "num_input_tokens_seen": 33503644944,
      "step": 42584
    },
    {
      "epoch": 4.517823042647995,
      "grad_norm": 0.6147973414905514,
      "learning_rate": 3.449994948542169e-05,
      "loss": 1.3654,
      "num_input_tokens_seen": 33504431728,
      "step": 42585
    },
    {
      "epoch": 4.517929132187566,
      "grad_norm": 0.5359208269041683,
      "learning_rate": 3.449930664440685e-05,
      "loss": 1.2883,
      "num_input_tokens_seen": 33505218464,
      "step": 42586
    },
    {
      "epoch": 4.518035221727137,
      "grad_norm": 0.6604130406738321,
      "learning_rate": 3.4498663796051214e-05,
      "loss": 1.2736,
      "num_input_tokens_seen": 33506005264,
      "step": 42587
    },
    {
      "epoch": 4.518141311266709,
      "grad_norm": 0.5380649099149094,
      "learning_rate": 3.44980209403553e-05,
      "loss": 1.378,
      "num_input_tokens_seen": 33506792080,
      "step": 42588
    },
    {
      "epoch": 4.51824740080628,
      "grad_norm": 0.6082116572286927,
      "learning_rate": 3.449737807731959e-05,
      "loss": 1.2706,
      "num_input_tokens_seen": 33507578896,
      "step": 42589
    },
    {
      "epoch": 4.518353490345852,
      "grad_norm": 0.6398062612551132,
      "learning_rate": 3.449673520694458e-05,
      "loss": 1.478,
      "num_input_tokens_seen": 33508365648,
      "step": 42590
    },
    {
      "epoch": 4.518459579885423,
      "grad_norm": 0.5101017332430232,
      "learning_rate": 3.449609232923078e-05,
      "loss": 1.3258,
      "num_input_tokens_seen": 33509152448,
      "step": 42591
    },
    {
      "epoch": 4.518565669424994,
      "grad_norm": 0.5717132376670089,
      "learning_rate": 3.449544944417867e-05,
      "loss": 1.321,
      "num_input_tokens_seen": 33509939168,
      "step": 42592
    },
    {
      "epoch": 4.518671758964566,
      "grad_norm": 0.43743688264675346,
      "learning_rate": 3.449480655178876e-05,
      "loss": 1.2162,
      "num_input_tokens_seen": 33510725952,
      "step": 42593
    },
    {
      "epoch": 4.518777848504137,
      "grad_norm": 0.5019572857717755,
      "learning_rate": 3.4494163652061546e-05,
      "loss": 1.2432,
      "num_input_tokens_seen": 33511512624,
      "step": 42594
    },
    {
      "epoch": 4.518883938043709,
      "grad_norm": 0.48788093975076285,
      "learning_rate": 3.4493520744997514e-05,
      "loss": 1.2099,
      "num_input_tokens_seen": 33512299456,
      "step": 42595
    },
    {
      "epoch": 4.51899002758328,
      "grad_norm": 0.47940192605294196,
      "learning_rate": 3.449287783059717e-05,
      "loss": 1.2538,
      "num_input_tokens_seen": 33513086352,
      "step": 42596
    },
    {
      "epoch": 4.519096117122851,
      "grad_norm": 0.5360079085851331,
      "learning_rate": 3.449223490886101e-05,
      "loss": 1.2698,
      "num_input_tokens_seen": 33513873232,
      "step": 42597
    },
    {
      "epoch": 4.519202206662423,
      "grad_norm": 0.499451916043603,
      "learning_rate": 3.449159197978953e-05,
      "loss": 1.3535,
      "num_input_tokens_seen": 33514660096,
      "step": 42598
    },
    {
      "epoch": 4.519308296201994,
      "grad_norm": 0.5357280450577323,
      "learning_rate": 3.4490949043383224e-05,
      "loss": 1.2927,
      "num_input_tokens_seen": 33515446976,
      "step": 42599
    },
    {
      "epoch": 4.519414385741566,
      "grad_norm": 0.4754735199270563,
      "learning_rate": 3.449030609964259e-05,
      "loss": 1.4043,
      "num_input_tokens_seen": 33516233664,
      "step": 42600
    },
    {
      "epoch": 4.519520475281137,
      "grad_norm": 0.45216809542216135,
      "learning_rate": 3.448966314856813e-05,
      "loss": 1.2568,
      "num_input_tokens_seen": 33517020464,
      "step": 42601
    },
    {
      "epoch": 4.519626564820709,
      "grad_norm": 0.49376996936088824,
      "learning_rate": 3.448902019016033e-05,
      "loss": 1.2848,
      "num_input_tokens_seen": 33517807216,
      "step": 42602
    },
    {
      "epoch": 4.51973265436028,
      "grad_norm": 0.5270948772715216,
      "learning_rate": 3.4488377224419696e-05,
      "loss": 1.3375,
      "num_input_tokens_seen": 33518593936,
      "step": 42603
    },
    {
      "epoch": 4.519838743899852,
      "grad_norm": 0.5789536707367189,
      "learning_rate": 3.448773425134672e-05,
      "loss": 1.3119,
      "num_input_tokens_seen": 33519380752,
      "step": 42604
    },
    {
      "epoch": 4.519944833439423,
      "grad_norm": 0.4657856601893452,
      "learning_rate": 3.4487091270941905e-05,
      "loss": 1.3101,
      "num_input_tokens_seen": 33520167504,
      "step": 42605
    },
    {
      "epoch": 4.520050922978994,
      "grad_norm": 0.7105123112512386,
      "learning_rate": 3.448644828320575e-05,
      "loss": 1.347,
      "num_input_tokens_seen": 33520954400,
      "step": 42606
    },
    {
      "epoch": 4.520157012518566,
      "grad_norm": 0.5081237284634685,
      "learning_rate": 3.4485805288138736e-05,
      "loss": 1.2497,
      "num_input_tokens_seen": 33521741168,
      "step": 42607
    },
    {
      "epoch": 4.520263102058137,
      "grad_norm": 0.724790354256694,
      "learning_rate": 3.448516228574138e-05,
      "loss": 1.3786,
      "num_input_tokens_seen": 33522527968,
      "step": 42608
    },
    {
      "epoch": 4.520369191597709,
      "grad_norm": 0.463480955276791,
      "learning_rate": 3.4484519276014167e-05,
      "loss": 1.1754,
      "num_input_tokens_seen": 33523314832,
      "step": 42609
    },
    {
      "epoch": 4.52047528113728,
      "grad_norm": 0.5223387181327808,
      "learning_rate": 3.448387625895759e-05,
      "loss": 1.3495,
      "num_input_tokens_seen": 33524101584,
      "step": 42610
    },
    {
      "epoch": 4.520581370676851,
      "grad_norm": 0.6582280110549857,
      "learning_rate": 3.4483233234572153e-05,
      "loss": 1.3144,
      "num_input_tokens_seen": 33524888416,
      "step": 42611
    },
    {
      "epoch": 4.520687460216423,
      "grad_norm": 0.5009988634900587,
      "learning_rate": 3.448259020285835e-05,
      "loss": 1.2967,
      "num_input_tokens_seen": 33525675264,
      "step": 42612
    },
    {
      "epoch": 4.520793549755994,
      "grad_norm": 0.5583799191799955,
      "learning_rate": 3.448194716381669e-05,
      "loss": 1.2557,
      "num_input_tokens_seen": 33526462032,
      "step": 42613
    },
    {
      "epoch": 4.520899639295566,
      "grad_norm": 0.6833932167346852,
      "learning_rate": 3.4481304117447646e-05,
      "loss": 1.2835,
      "num_input_tokens_seen": 33527248816,
      "step": 42614
    },
    {
      "epoch": 4.521005728835137,
      "grad_norm": 0.6479808995620426,
      "learning_rate": 3.448066106375174e-05,
      "loss": 1.3533,
      "num_input_tokens_seen": 33528035600,
      "step": 42615
    },
    {
      "epoch": 4.521111818374708,
      "grad_norm": 0.6323518846061739,
      "learning_rate": 3.448001800272945e-05,
      "loss": 1.3959,
      "num_input_tokens_seen": 33528822288,
      "step": 42616
    },
    {
      "epoch": 4.52121790791428,
      "grad_norm": 0.5509385736928486,
      "learning_rate": 3.447937493438128e-05,
      "loss": 1.3948,
      "num_input_tokens_seen": 33529609088,
      "step": 42617
    },
    {
      "epoch": 4.521323997453851,
      "grad_norm": 0.5327738252495529,
      "learning_rate": 3.447873185870773e-05,
      "loss": 1.321,
      "num_input_tokens_seen": 33530395888,
      "step": 42618
    },
    {
      "epoch": 4.521430086993423,
      "grad_norm": 0.5830467151599692,
      "learning_rate": 3.447808877570929e-05,
      "loss": 1.2576,
      "num_input_tokens_seen": 33531182752,
      "step": 42619
    },
    {
      "epoch": 4.521536176532994,
      "grad_norm": 0.5851286116464762,
      "learning_rate": 3.4477445685386466e-05,
      "loss": 1.3692,
      "num_input_tokens_seen": 33531969536,
      "step": 42620
    },
    {
      "epoch": 4.521642266072565,
      "grad_norm": 0.5624449440740205,
      "learning_rate": 3.4476802587739744e-05,
      "loss": 1.4174,
      "num_input_tokens_seen": 33532756192,
      "step": 42621
    },
    {
      "epoch": 4.521748355612137,
      "grad_norm": 0.6136107040482606,
      "learning_rate": 3.4476159482769635e-05,
      "loss": 1.3153,
      "num_input_tokens_seen": 33533542800,
      "step": 42622
    },
    {
      "epoch": 4.521854445151708,
      "grad_norm": 0.5614378702457747,
      "learning_rate": 3.447551637047662e-05,
      "loss": 1.2724,
      "num_input_tokens_seen": 33534329456,
      "step": 42623
    },
    {
      "epoch": 4.52196053469128,
      "grad_norm": 0.5303038096390961,
      "learning_rate": 3.447487325086121e-05,
      "loss": 1.3826,
      "num_input_tokens_seen": 33535116080,
      "step": 42624
    },
    {
      "epoch": 4.522066624230851,
      "grad_norm": 0.5863757039326408,
      "learning_rate": 3.447423012392389e-05,
      "loss": 1.2702,
      "num_input_tokens_seen": 33535902832,
      "step": 42625
    },
    {
      "epoch": 4.522172713770422,
      "grad_norm": 0.48531755113518493,
      "learning_rate": 3.4473586989665174e-05,
      "loss": 1.2311,
      "num_input_tokens_seen": 33536689632,
      "step": 42626
    },
    {
      "epoch": 4.522278803309994,
      "grad_norm": 0.4796735340362046,
      "learning_rate": 3.4472943848085536e-05,
      "loss": 1.22,
      "num_input_tokens_seen": 33537476400,
      "step": 42627
    },
    {
      "epoch": 4.522384892849565,
      "grad_norm": 0.5124288118671582,
      "learning_rate": 3.447230069918549e-05,
      "loss": 1.2875,
      "num_input_tokens_seen": 33538263152,
      "step": 42628
    },
    {
      "epoch": 4.522490982389137,
      "grad_norm": 0.488686560825394,
      "learning_rate": 3.4471657542965534e-05,
      "loss": 1.2687,
      "num_input_tokens_seen": 33539049952,
      "step": 42629
    },
    {
      "epoch": 4.522597071928708,
      "grad_norm": 0.5606570042240007,
      "learning_rate": 3.447101437942615e-05,
      "loss": 1.3004,
      "num_input_tokens_seen": 33539836736,
      "step": 42630
    },
    {
      "epoch": 4.5227031614682796,
      "grad_norm": 0.5520015895317865,
      "learning_rate": 3.447037120856785e-05,
      "loss": 1.3488,
      "num_input_tokens_seen": 33540623456,
      "step": 42631
    },
    {
      "epoch": 4.522809251007851,
      "grad_norm": 0.5059421069125284,
      "learning_rate": 3.4469728030391125e-05,
      "loss": 1.2883,
      "num_input_tokens_seen": 33541410240,
      "step": 42632
    },
    {
      "epoch": 4.5229153405474225,
      "grad_norm": 0.49396926003332814,
      "learning_rate": 3.446908484489647e-05,
      "loss": 1.2814,
      "num_input_tokens_seen": 33542197072,
      "step": 42633
    },
    {
      "epoch": 4.5230214300869935,
      "grad_norm": 0.4677991806348997,
      "learning_rate": 3.446844165208438e-05,
      "loss": 1.2716,
      "num_input_tokens_seen": 33542983840,
      "step": 42634
    },
    {
      "epoch": 4.523127519626565,
      "grad_norm": 0.5445232530186075,
      "learning_rate": 3.446779845195536e-05,
      "loss": 1.2914,
      "num_input_tokens_seen": 33543770592,
      "step": 42635
    },
    {
      "epoch": 4.5232336091661365,
      "grad_norm": 0.5347869317911236,
      "learning_rate": 3.4467155244509895e-05,
      "loss": 1.3645,
      "num_input_tokens_seen": 33544557360,
      "step": 42636
    },
    {
      "epoch": 4.5233396987057075,
      "grad_norm": 0.5278167238405419,
      "learning_rate": 3.446651202974851e-05,
      "loss": 1.3266,
      "num_input_tokens_seen": 33545344032,
      "step": 42637
    },
    {
      "epoch": 4.523445788245279,
      "grad_norm": 0.4637289253831946,
      "learning_rate": 3.4465868807671655e-05,
      "loss": 1.3126,
      "num_input_tokens_seen": 33546130880,
      "step": 42638
    },
    {
      "epoch": 4.5235518777848505,
      "grad_norm": 0.5329672160620686,
      "learning_rate": 3.4465225578279874e-05,
      "loss": 1.2916,
      "num_input_tokens_seen": 33546917664,
      "step": 42639
    },
    {
      "epoch": 4.5236579673244215,
      "grad_norm": 0.5043706678465265,
      "learning_rate": 3.4464582341573645e-05,
      "loss": 1.3263,
      "num_input_tokens_seen": 33547704464,
      "step": 42640
    },
    {
      "epoch": 4.523764056863993,
      "grad_norm": 0.5140577555370002,
      "learning_rate": 3.4463939097553456e-05,
      "loss": 1.2964,
      "num_input_tokens_seen": 33548491312,
      "step": 42641
    },
    {
      "epoch": 4.523870146403564,
      "grad_norm": 0.48188941897654164,
      "learning_rate": 3.4463295846219815e-05,
      "loss": 1.3511,
      "num_input_tokens_seen": 33549277984,
      "step": 42642
    },
    {
      "epoch": 4.523976235943136,
      "grad_norm": 0.4999565130794773,
      "learning_rate": 3.4462652587573216e-05,
      "loss": 1.35,
      "num_input_tokens_seen": 33550064832,
      "step": 42643
    },
    {
      "epoch": 4.524082325482707,
      "grad_norm": 0.4216017289202023,
      "learning_rate": 3.4462009321614156e-05,
      "loss": 1.2499,
      "num_input_tokens_seen": 33550851568,
      "step": 42644
    },
    {
      "epoch": 4.524188415022278,
      "grad_norm": 0.5066522559253028,
      "learning_rate": 3.446136604834314e-05,
      "loss": 1.3724,
      "num_input_tokens_seen": 33551638368,
      "step": 42645
    },
    {
      "epoch": 4.52429450456185,
      "grad_norm": 0.5251155588340891,
      "learning_rate": 3.446072276776066e-05,
      "loss": 1.382,
      "num_input_tokens_seen": 33552425152,
      "step": 42646
    },
    {
      "epoch": 4.524400594101421,
      "grad_norm": 0.49728266524103415,
      "learning_rate": 3.446007947986719e-05,
      "loss": 1.2862,
      "num_input_tokens_seen": 33553211872,
      "step": 42647
    },
    {
      "epoch": 4.524506683640993,
      "grad_norm": 0.601690797799677,
      "learning_rate": 3.445943618466326e-05,
      "loss": 1.3368,
      "num_input_tokens_seen": 33553998608,
      "step": 42648
    },
    {
      "epoch": 4.524612773180564,
      "grad_norm": 0.7964921193885639,
      "learning_rate": 3.445879288214936e-05,
      "loss": 1.4041,
      "num_input_tokens_seen": 33554785328,
      "step": 42649
    },
    {
      "epoch": 4.524718862720135,
      "grad_norm": 0.610686578738104,
      "learning_rate": 3.445814957232598e-05,
      "loss": 1.3123,
      "num_input_tokens_seen": 33555571984,
      "step": 42650
    },
    {
      "epoch": 4.524824952259707,
      "grad_norm": 0.5089656451817649,
      "learning_rate": 3.4457506255193615e-05,
      "loss": 1.3065,
      "num_input_tokens_seen": 33556358816,
      "step": 42651
    },
    {
      "epoch": 4.524931041799278,
      "grad_norm": 0.4773912725516105,
      "learning_rate": 3.445686293075278e-05,
      "loss": 1.2775,
      "num_input_tokens_seen": 33557145520,
      "step": 42652
    },
    {
      "epoch": 4.52503713133885,
      "grad_norm": 0.6446620274081303,
      "learning_rate": 3.445621959900395e-05,
      "loss": 1.3306,
      "num_input_tokens_seen": 33557932304,
      "step": 42653
    },
    {
      "epoch": 4.525143220878421,
      "grad_norm": 0.5919884643041994,
      "learning_rate": 3.4455576259947625e-05,
      "loss": 1.2705,
      "num_input_tokens_seen": 33558719040,
      "step": 42654
    },
    {
      "epoch": 4.525249310417993,
      "grad_norm": 0.5046978122258937,
      "learning_rate": 3.4454932913584314e-05,
      "loss": 1.3034,
      "num_input_tokens_seen": 33559505856,
      "step": 42655
    },
    {
      "epoch": 4.525355399957564,
      "grad_norm": 0.48046733779427825,
      "learning_rate": 3.445428955991451e-05,
      "loss": 1.2795,
      "num_input_tokens_seen": 33560292688,
      "step": 42656
    },
    {
      "epoch": 4.525461489497135,
      "grad_norm": 0.4996561633852291,
      "learning_rate": 3.44536461989387e-05,
      "loss": 1.2523,
      "num_input_tokens_seen": 33561079440,
      "step": 42657
    },
    {
      "epoch": 4.525567579036707,
      "grad_norm": 0.4657662569538601,
      "learning_rate": 3.4453002830657404e-05,
      "loss": 1.219,
      "num_input_tokens_seen": 33561866224,
      "step": 42658
    },
    {
      "epoch": 4.525673668576278,
      "grad_norm": 0.5382096014824238,
      "learning_rate": 3.445235945507109e-05,
      "loss": 1.2654,
      "num_input_tokens_seen": 33562653088,
      "step": 42659
    },
    {
      "epoch": 4.52577975811585,
      "grad_norm": 0.5782224815518725,
      "learning_rate": 3.445171607218028e-05,
      "loss": 1.3642,
      "num_input_tokens_seen": 33563439808,
      "step": 42660
    },
    {
      "epoch": 4.525885847655421,
      "grad_norm": 0.5332987561106145,
      "learning_rate": 3.4451072681985463e-05,
      "loss": 1.2681,
      "num_input_tokens_seen": 33564226576,
      "step": 42661
    },
    {
      "epoch": 4.525991937194993,
      "grad_norm": 0.5753041675140128,
      "learning_rate": 3.4450429284487126e-05,
      "loss": 1.3317,
      "num_input_tokens_seen": 33565013376,
      "step": 42662
    },
    {
      "epoch": 4.526098026734564,
      "grad_norm": 0.5940798334820214,
      "learning_rate": 3.444978587968578e-05,
      "loss": 1.2851,
      "num_input_tokens_seen": 33565800096,
      "step": 42663
    },
    {
      "epoch": 4.526204116274135,
      "grad_norm": 0.5740596670064724,
      "learning_rate": 3.444914246758191e-05,
      "loss": 1.3957,
      "num_input_tokens_seen": 33566586928,
      "step": 42664
    },
    {
      "epoch": 4.526310205813707,
      "grad_norm": 0.5252201347973566,
      "learning_rate": 3.444849904817603e-05,
      "loss": 1.3796,
      "num_input_tokens_seen": 33567373664,
      "step": 42665
    },
    {
      "epoch": 4.526416295353278,
      "grad_norm": 0.6943857542285206,
      "learning_rate": 3.444785562146862e-05,
      "loss": 1.3457,
      "num_input_tokens_seen": 33568160384,
      "step": 42666
    },
    {
      "epoch": 4.52652238489285,
      "grad_norm": 0.5379413641314901,
      "learning_rate": 3.444721218746018e-05,
      "loss": 1.3523,
      "num_input_tokens_seen": 33568947184,
      "step": 42667
    },
    {
      "epoch": 4.526628474432421,
      "grad_norm": 0.5958565601507001,
      "learning_rate": 3.444656874615122e-05,
      "loss": 1.1847,
      "num_input_tokens_seen": 33569733936,
      "step": 42668
    },
    {
      "epoch": 4.526734563971992,
      "grad_norm": 0.656770458838617,
      "learning_rate": 3.4445925297542234e-05,
      "loss": 1.4155,
      "num_input_tokens_seen": 33570520672,
      "step": 42669
    },
    {
      "epoch": 4.526840653511564,
      "grad_norm": 0.5658475654895051,
      "learning_rate": 3.44452818416337e-05,
      "loss": 1.2434,
      "num_input_tokens_seen": 33571307392,
      "step": 42670
    },
    {
      "epoch": 4.526946743051135,
      "grad_norm": 0.5599173723938657,
      "learning_rate": 3.4444638378426134e-05,
      "loss": 1.4256,
      "num_input_tokens_seen": 33572094176,
      "step": 42671
    },
    {
      "epoch": 4.527052832590707,
      "grad_norm": 0.5170407158320682,
      "learning_rate": 3.4443994907920035e-05,
      "loss": 1.3416,
      "num_input_tokens_seen": 33572880912,
      "step": 42672
    },
    {
      "epoch": 4.527158922130278,
      "grad_norm": 0.49972241529567724,
      "learning_rate": 3.4443351430115886e-05,
      "loss": 1.2626,
      "num_input_tokens_seen": 33573667776,
      "step": 42673
    },
    {
      "epoch": 4.527265011669849,
      "grad_norm": 0.6539338249379851,
      "learning_rate": 3.4442707945014196e-05,
      "loss": 1.3772,
      "num_input_tokens_seen": 33574454624,
      "step": 42674
    },
    {
      "epoch": 4.527371101209421,
      "grad_norm": 0.5244035138554963,
      "learning_rate": 3.4442064452615465e-05,
      "loss": 1.3344,
      "num_input_tokens_seen": 33575241440,
      "step": 42675
    },
    {
      "epoch": 4.527477190748992,
      "grad_norm": 0.5759458500370411,
      "learning_rate": 3.444142095292017e-05,
      "loss": 1.2738,
      "num_input_tokens_seen": 33576028224,
      "step": 42676
    },
    {
      "epoch": 4.527583280288564,
      "grad_norm": 0.6775664765194895,
      "learning_rate": 3.444077744592883e-05,
      "loss": 1.2772,
      "num_input_tokens_seen": 33576814992,
      "step": 42677
    },
    {
      "epoch": 4.527689369828135,
      "grad_norm": 0.5498917538156105,
      "learning_rate": 3.444013393164193e-05,
      "loss": 1.4562,
      "num_input_tokens_seen": 33577601744,
      "step": 42678
    },
    {
      "epoch": 4.527795459367706,
      "grad_norm": 0.8162919839708399,
      "learning_rate": 3.4439490410059973e-05,
      "loss": 1.2876,
      "num_input_tokens_seen": 33578388432,
      "step": 42679
    },
    {
      "epoch": 4.527901548907278,
      "grad_norm": 0.5019555285835148,
      "learning_rate": 3.4438846881183465e-05,
      "loss": 1.2877,
      "num_input_tokens_seen": 33579175264,
      "step": 42680
    },
    {
      "epoch": 4.528007638446849,
      "grad_norm": 0.9854258686205114,
      "learning_rate": 3.443820334501288e-05,
      "loss": 1.4851,
      "num_input_tokens_seen": 33579962112,
      "step": 42681
    },
    {
      "epoch": 4.528113727986421,
      "grad_norm": 0.5242964759341507,
      "learning_rate": 3.443755980154873e-05,
      "loss": 1.2558,
      "num_input_tokens_seen": 33580748912,
      "step": 42682
    },
    {
      "epoch": 4.528219817525992,
      "grad_norm": 0.563041762795629,
      "learning_rate": 3.443691625079151e-05,
      "loss": 1.2623,
      "num_input_tokens_seen": 33581535680,
      "step": 42683
    },
    {
      "epoch": 4.528325907065564,
      "grad_norm": 0.8396332754686995,
      "learning_rate": 3.443627269274172e-05,
      "loss": 1.2586,
      "num_input_tokens_seen": 33582322432,
      "step": 42684
    },
    {
      "epoch": 4.528431996605135,
      "grad_norm": 0.589657173106429,
      "learning_rate": 3.443562912739986e-05,
      "loss": 1.3685,
      "num_input_tokens_seen": 33583109184,
      "step": 42685
    },
    {
      "epoch": 4.528538086144706,
      "grad_norm": 0.6998786808318849,
      "learning_rate": 3.443498555476642e-05,
      "loss": 1.2985,
      "num_input_tokens_seen": 33583895984,
      "step": 42686
    },
    {
      "epoch": 4.528644175684278,
      "grad_norm": 0.6405513456285102,
      "learning_rate": 3.443434197484189e-05,
      "loss": 1.3554,
      "num_input_tokens_seen": 33584682752,
      "step": 42687
    },
    {
      "epoch": 4.528750265223849,
      "grad_norm": 0.5486869405269584,
      "learning_rate": 3.4433698387626796e-05,
      "loss": 1.276,
      "num_input_tokens_seen": 33585469552,
      "step": 42688
    },
    {
      "epoch": 4.528856354763421,
      "grad_norm": 0.5918772437748484,
      "learning_rate": 3.4433054793121606e-05,
      "loss": 1.1266,
      "num_input_tokens_seen": 33586256352,
      "step": 42689
    },
    {
      "epoch": 4.528962444302992,
      "grad_norm": 0.7137664557394348,
      "learning_rate": 3.443241119132683e-05,
      "loss": 1.5341,
      "num_input_tokens_seen": 33587043088,
      "step": 42690
    },
    {
      "epoch": 4.529068533842564,
      "grad_norm": 0.45973282041005514,
      "learning_rate": 3.443176758224296e-05,
      "loss": 1.2242,
      "num_input_tokens_seen": 33587829856,
      "step": 42691
    },
    {
      "epoch": 4.529174623382135,
      "grad_norm": 0.6913516636050515,
      "learning_rate": 3.4431123965870504e-05,
      "loss": 1.3335,
      "num_input_tokens_seen": 33588616608,
      "step": 42692
    },
    {
      "epoch": 4.529280712921706,
      "grad_norm": 0.5595653864270407,
      "learning_rate": 3.4430480342209944e-05,
      "loss": 1.3001,
      "num_input_tokens_seen": 33589403440,
      "step": 42693
    },
    {
      "epoch": 4.529386802461278,
      "grad_norm": 0.5847979826087625,
      "learning_rate": 3.4429836711261784e-05,
      "loss": 1.4098,
      "num_input_tokens_seen": 33590190192,
      "step": 42694
    },
    {
      "epoch": 4.529492892000849,
      "grad_norm": 0.6785937970143185,
      "learning_rate": 3.4429193073026525e-05,
      "loss": 1.3318,
      "num_input_tokens_seen": 33590977040,
      "step": 42695
    },
    {
      "epoch": 4.5295989815404205,
      "grad_norm": 0.5022196642341373,
      "learning_rate": 3.442854942750466e-05,
      "loss": 1.2275,
      "num_input_tokens_seen": 33591763840,
      "step": 42696
    },
    {
      "epoch": 4.5297050710799915,
      "grad_norm": 0.7862694657323818,
      "learning_rate": 3.44279057746967e-05,
      "loss": 1.4289,
      "num_input_tokens_seen": 33592550688,
      "step": 42697
    },
    {
      "epoch": 4.529811160619563,
      "grad_norm": 0.4929375466704927,
      "learning_rate": 3.442726211460313e-05,
      "loss": 1.2753,
      "num_input_tokens_seen": 33593337472,
      "step": 42698
    },
    {
      "epoch": 4.5299172501591345,
      "grad_norm": 0.6460774433537793,
      "learning_rate": 3.4426618447224434e-05,
      "loss": 1.3113,
      "num_input_tokens_seen": 33594124192,
      "step": 42699
    },
    {
      "epoch": 4.5300233396987055,
      "grad_norm": 0.5592493946567658,
      "learning_rate": 3.4425974772561134e-05,
      "loss": 1.3131,
      "num_input_tokens_seen": 33594910928,
      "step": 42700
    },
    {
      "epoch": 4.530129429238277,
      "grad_norm": 0.514158772995033,
      "learning_rate": 3.442533109061372e-05,
      "loss": 1.205,
      "num_input_tokens_seen": 33595697712,
      "step": 42701
    },
    {
      "epoch": 4.5302355187778485,
      "grad_norm": 0.5515941128379689,
      "learning_rate": 3.442468740138268e-05,
      "loss": 1.2646,
      "num_input_tokens_seen": 33596484528,
      "step": 42702
    },
    {
      "epoch": 4.5303416083174195,
      "grad_norm": 0.5439703123058418,
      "learning_rate": 3.442404370486852e-05,
      "loss": 1.2189,
      "num_input_tokens_seen": 33597271328,
      "step": 42703
    },
    {
      "epoch": 4.530447697856991,
      "grad_norm": 0.6779991849194921,
      "learning_rate": 3.442340000107174e-05,
      "loss": 1.3388,
      "num_input_tokens_seen": 33598058128,
      "step": 42704
    },
    {
      "epoch": 4.5305537873965624,
      "grad_norm": 0.6311576080304735,
      "learning_rate": 3.442275628999283e-05,
      "loss": 1.3894,
      "num_input_tokens_seen": 33598844928,
      "step": 42705
    },
    {
      "epoch": 4.530659876936134,
      "grad_norm": 0.4951328587915251,
      "learning_rate": 3.442211257163229e-05,
      "loss": 1.2599,
      "num_input_tokens_seen": 33599631712,
      "step": 42706
    },
    {
      "epoch": 4.530765966475705,
      "grad_norm": 0.5707787375039686,
      "learning_rate": 3.442146884599062e-05,
      "loss": 1.2685,
      "num_input_tokens_seen": 33600418496,
      "step": 42707
    },
    {
      "epoch": 4.530872056015276,
      "grad_norm": 0.5340759259486093,
      "learning_rate": 3.442082511306831e-05,
      "loss": 1.3075,
      "num_input_tokens_seen": 33601205280,
      "step": 42708
    },
    {
      "epoch": 4.530978145554848,
      "grad_norm": 0.4660302399376216,
      "learning_rate": 3.442018137286587e-05,
      "loss": 1.2278,
      "num_input_tokens_seen": 33601992000,
      "step": 42709
    },
    {
      "epoch": 4.531084235094419,
      "grad_norm": 0.6468058371050459,
      "learning_rate": 3.441953762538378e-05,
      "loss": 1.3613,
      "num_input_tokens_seen": 33602778784,
      "step": 42710
    },
    {
      "epoch": 4.531190324633991,
      "grad_norm": 0.45827242145780084,
      "learning_rate": 3.441889387062256e-05,
      "loss": 1.2133,
      "num_input_tokens_seen": 33603565584,
      "step": 42711
    },
    {
      "epoch": 4.531296414173562,
      "grad_norm": 0.63251592089635,
      "learning_rate": 3.441825010858269e-05,
      "loss": 1.2438,
      "num_input_tokens_seen": 33604352384,
      "step": 42712
    },
    {
      "epoch": 4.531402503713134,
      "grad_norm": 0.48282280257740146,
      "learning_rate": 3.441760633926467e-05,
      "loss": 1.2352,
      "num_input_tokens_seen": 33605139120,
      "step": 42713
    },
    {
      "epoch": 4.531508593252705,
      "grad_norm": 0.5825001123331883,
      "learning_rate": 3.4416962562669e-05,
      "loss": 1.3261,
      "num_input_tokens_seen": 33605925840,
      "step": 42714
    },
    {
      "epoch": 4.531614682792276,
      "grad_norm": 0.5887882099718741,
      "learning_rate": 3.4416318778796183e-05,
      "loss": 1.2995,
      "num_input_tokens_seen": 33606712560,
      "step": 42715
    },
    {
      "epoch": 4.531720772331848,
      "grad_norm": 0.4714944137386764,
      "learning_rate": 3.4415674987646704e-05,
      "loss": 1.3464,
      "num_input_tokens_seen": 33607499344,
      "step": 42716
    },
    {
      "epoch": 4.531826861871419,
      "grad_norm": 0.5527029048730051,
      "learning_rate": 3.4415031189221075e-05,
      "loss": 1.3591,
      "num_input_tokens_seen": 33608286112,
      "step": 42717
    },
    {
      "epoch": 4.531932951410991,
      "grad_norm": 0.6381097376695662,
      "learning_rate": 3.4414387383519786e-05,
      "loss": 1.2613,
      "num_input_tokens_seen": 33609072864,
      "step": 42718
    },
    {
      "epoch": 4.532039040950562,
      "grad_norm": 0.5512116352681646,
      "learning_rate": 3.4413743570543324e-05,
      "loss": 1.2417,
      "num_input_tokens_seen": 33609859648,
      "step": 42719
    },
    {
      "epoch": 4.532145130490134,
      "grad_norm": 0.5005919063550522,
      "learning_rate": 3.441309975029221e-05,
      "loss": 1.2924,
      "num_input_tokens_seen": 33610646480,
      "step": 42720
    },
    {
      "epoch": 4.532251220029705,
      "grad_norm": 0.5017625391887,
      "learning_rate": 3.441245592276692e-05,
      "loss": 1.3578,
      "num_input_tokens_seen": 33611433312,
      "step": 42721
    },
    {
      "epoch": 4.532357309569276,
      "grad_norm": 0.5210466084725425,
      "learning_rate": 3.4411812087967964e-05,
      "loss": 1.3341,
      "num_input_tokens_seen": 33612220144,
      "step": 42722
    },
    {
      "epoch": 4.532463399108848,
      "grad_norm": 0.460844950537996,
      "learning_rate": 3.441116824589584e-05,
      "loss": 1.169,
      "num_input_tokens_seen": 33613006912,
      "step": 42723
    },
    {
      "epoch": 4.532569488648419,
      "grad_norm": 0.5382906557776719,
      "learning_rate": 3.441052439655103e-05,
      "loss": 1.1604,
      "num_input_tokens_seen": 33613793728,
      "step": 42724
    },
    {
      "epoch": 4.532675578187991,
      "grad_norm": 0.45411320525075277,
      "learning_rate": 3.4409880539934047e-05,
      "loss": 1.2378,
      "num_input_tokens_seen": 33614580528,
      "step": 42725
    },
    {
      "epoch": 4.532781667727562,
      "grad_norm": 0.4711949161005071,
      "learning_rate": 3.4409236676045395e-05,
      "loss": 1.2391,
      "num_input_tokens_seen": 33615367328,
      "step": 42726
    },
    {
      "epoch": 4.532887757267133,
      "grad_norm": 0.5229676715991213,
      "learning_rate": 3.440859280488554e-05,
      "loss": 1.259,
      "num_input_tokens_seen": 33616154112,
      "step": 42727
    },
    {
      "epoch": 4.532993846806705,
      "grad_norm": 0.45510719342240025,
      "learning_rate": 3.4407948926455016e-05,
      "loss": 1.1755,
      "num_input_tokens_seen": 33616940880,
      "step": 42728
    },
    {
      "epoch": 4.533099936346276,
      "grad_norm": 0.49836880953446366,
      "learning_rate": 3.440730504075431e-05,
      "loss": 1.4125,
      "num_input_tokens_seen": 33617727584,
      "step": 42729
    },
    {
      "epoch": 4.533206025885848,
      "grad_norm": 0.5556050889078253,
      "learning_rate": 3.44066611477839e-05,
      "loss": 1.2532,
      "num_input_tokens_seen": 33618514384,
      "step": 42730
    },
    {
      "epoch": 4.533312115425419,
      "grad_norm": 0.4897189238277559,
      "learning_rate": 3.440601724754431e-05,
      "loss": 1.3116,
      "num_input_tokens_seen": 33619301104,
      "step": 42731
    },
    {
      "epoch": 4.53341820496499,
      "grad_norm": 0.5065939823394807,
      "learning_rate": 3.4405373340036024e-05,
      "loss": 1.3446,
      "num_input_tokens_seen": 33620087776,
      "step": 42732
    },
    {
      "epoch": 4.533524294504562,
      "grad_norm": 0.4987789785142753,
      "learning_rate": 3.440472942525954e-05,
      "loss": 1.2189,
      "num_input_tokens_seen": 33620874592,
      "step": 42733
    },
    {
      "epoch": 4.533630384044133,
      "grad_norm": 0.5373658798260078,
      "learning_rate": 3.440408550321535e-05,
      "loss": 1.363,
      "num_input_tokens_seen": 33621661328,
      "step": 42734
    },
    {
      "epoch": 4.533736473583705,
      "grad_norm": 0.4305076456159726,
      "learning_rate": 3.4403441573903964e-05,
      "loss": 1.2435,
      "num_input_tokens_seen": 33622448064,
      "step": 42735
    },
    {
      "epoch": 4.533842563123276,
      "grad_norm": 0.48416027939146994,
      "learning_rate": 3.440279763732587e-05,
      "loss": 1.2486,
      "num_input_tokens_seen": 33623234880,
      "step": 42736
    },
    {
      "epoch": 4.533948652662847,
      "grad_norm": 0.4627063291506945,
      "learning_rate": 3.440215369348158e-05,
      "loss": 1.3019,
      "num_input_tokens_seen": 33624021552,
      "step": 42737
    },
    {
      "epoch": 4.534054742202419,
      "grad_norm": 0.453973823687455,
      "learning_rate": 3.440150974237158e-05,
      "loss": 1.2926,
      "num_input_tokens_seen": 33624808224,
      "step": 42738
    },
    {
      "epoch": 4.53416083174199,
      "grad_norm": 0.5167262941012125,
      "learning_rate": 3.440086578399636e-05,
      "loss": 1.2333,
      "num_input_tokens_seen": 33625594976,
      "step": 42739
    },
    {
      "epoch": 4.534266921281562,
      "grad_norm": 0.48606929763288687,
      "learning_rate": 3.440022181835644e-05,
      "loss": 1.2266,
      "num_input_tokens_seen": 33626381808,
      "step": 42740
    },
    {
      "epoch": 4.534373010821133,
      "grad_norm": 0.49093821557797124,
      "learning_rate": 3.439957784545229e-05,
      "loss": 1.2119,
      "num_input_tokens_seen": 33627168624,
      "step": 42741
    },
    {
      "epoch": 4.534479100360705,
      "grad_norm": 0.5964101567088217,
      "learning_rate": 3.4398933865284424e-05,
      "loss": 1.3616,
      "num_input_tokens_seen": 33627955376,
      "step": 42742
    },
    {
      "epoch": 4.534585189900276,
      "grad_norm": 0.51833739661918,
      "learning_rate": 3.439828987785334e-05,
      "loss": 1.3074,
      "num_input_tokens_seen": 33628742160,
      "step": 42743
    },
    {
      "epoch": 4.534691279439847,
      "grad_norm": 0.56392007440524,
      "learning_rate": 3.439764588315954e-05,
      "loss": 1.209,
      "num_input_tokens_seen": 33629528992,
      "step": 42744
    },
    {
      "epoch": 4.534797368979419,
      "grad_norm": 0.5353429429661254,
      "learning_rate": 3.439700188120351e-05,
      "loss": 1.2973,
      "num_input_tokens_seen": 33630315760,
      "step": 42745
    },
    {
      "epoch": 4.53490345851899,
      "grad_norm": 0.5262377555584525,
      "learning_rate": 3.439635787198575e-05,
      "loss": 1.2192,
      "num_input_tokens_seen": 33631102528,
      "step": 42746
    },
    {
      "epoch": 4.535009548058562,
      "grad_norm": 0.5604593399354199,
      "learning_rate": 3.439571385550677e-05,
      "loss": 1.23,
      "num_input_tokens_seen": 33631889296,
      "step": 42747
    },
    {
      "epoch": 4.535115637598133,
      "grad_norm": 0.5163199968875538,
      "learning_rate": 3.439506983176705e-05,
      "loss": 1.2478,
      "num_input_tokens_seen": 33632676128,
      "step": 42748
    },
    {
      "epoch": 4.535221727137705,
      "grad_norm": 0.6307010167966884,
      "learning_rate": 3.439442580076709e-05,
      "loss": 1.399,
      "num_input_tokens_seen": 33633462832,
      "step": 42749
    },
    {
      "epoch": 4.535327816677276,
      "grad_norm": 0.6549711377027414,
      "learning_rate": 3.43937817625074e-05,
      "loss": 1.3798,
      "num_input_tokens_seen": 33634249584,
      "step": 42750
    },
    {
      "epoch": 4.535433906216847,
      "grad_norm": 0.5363284204146316,
      "learning_rate": 3.4393137716988476e-05,
      "loss": 1.2467,
      "num_input_tokens_seen": 33635036416,
      "step": 42751
    },
    {
      "epoch": 4.535539995756419,
      "grad_norm": 0.5837812739020433,
      "learning_rate": 3.439249366421081e-05,
      "loss": 1.2729,
      "num_input_tokens_seen": 33635823296,
      "step": 42752
    },
    {
      "epoch": 4.53564608529599,
      "grad_norm": 0.48565786045838477,
      "learning_rate": 3.439184960417489e-05,
      "loss": 1.3345,
      "num_input_tokens_seen": 33636610096,
      "step": 42753
    },
    {
      "epoch": 4.535752174835562,
      "grad_norm": 0.5953565298343771,
      "learning_rate": 3.439120553688123e-05,
      "loss": 1.3672,
      "num_input_tokens_seen": 33637396800,
      "step": 42754
    },
    {
      "epoch": 4.535858264375133,
      "grad_norm": 0.5856341234390208,
      "learning_rate": 3.439056146233033e-05,
      "loss": 1.3359,
      "num_input_tokens_seen": 33638183584,
      "step": 42755
    },
    {
      "epoch": 4.535964353914704,
      "grad_norm": 0.5640912436407883,
      "learning_rate": 3.438991738052267e-05,
      "loss": 1.3095,
      "num_input_tokens_seen": 33638970368,
      "step": 42756
    },
    {
      "epoch": 4.536070443454276,
      "grad_norm": 0.6772769115479534,
      "learning_rate": 3.438927329145876e-05,
      "loss": 1.3614,
      "num_input_tokens_seen": 33639757120,
      "step": 42757
    },
    {
      "epoch": 4.536176532993847,
      "grad_norm": 0.5457345739619394,
      "learning_rate": 3.4388629195139095e-05,
      "loss": 1.2516,
      "num_input_tokens_seen": 33640543936,
      "step": 42758
    },
    {
      "epoch": 4.5362826225334185,
      "grad_norm": 0.5326462385479414,
      "learning_rate": 3.438798509156417e-05,
      "loss": 1.3008,
      "num_input_tokens_seen": 33641330736,
      "step": 42759
    },
    {
      "epoch": 4.5363887120729895,
      "grad_norm": 0.5390962719349869,
      "learning_rate": 3.438734098073449e-05,
      "loss": 1.2499,
      "num_input_tokens_seen": 33642117584,
      "step": 42760
    },
    {
      "epoch": 4.536494801612561,
      "grad_norm": 0.4720441199567718,
      "learning_rate": 3.4386696862650544e-05,
      "loss": 1.3152,
      "num_input_tokens_seen": 33642904384,
      "step": 42761
    },
    {
      "epoch": 4.5366008911521325,
      "grad_norm": 0.6505125444568068,
      "learning_rate": 3.4386052737312834e-05,
      "loss": 1.3401,
      "num_input_tokens_seen": 33643691200,
      "step": 42762
    },
    {
      "epoch": 4.5367069806917035,
      "grad_norm": 0.460019350574265,
      "learning_rate": 3.438540860472187e-05,
      "loss": 1.2126,
      "num_input_tokens_seen": 33644477936,
      "step": 42763
    },
    {
      "epoch": 4.5368130702312754,
      "grad_norm": 0.5369306035842272,
      "learning_rate": 3.438476446487813e-05,
      "loss": 1.3771,
      "num_input_tokens_seen": 33645264752,
      "step": 42764
    },
    {
      "epoch": 4.5369191597708465,
      "grad_norm": 0.5546038536553588,
      "learning_rate": 3.4384120317782106e-05,
      "loss": 1.1436,
      "num_input_tokens_seen": 33646051616,
      "step": 42765
    },
    {
      "epoch": 4.5370252493104175,
      "grad_norm": 0.6590974486967744,
      "learning_rate": 3.4383476163434324e-05,
      "loss": 1.3567,
      "num_input_tokens_seen": 33646838320,
      "step": 42766
    },
    {
      "epoch": 4.537131338849989,
      "grad_norm": 0.6555886098741447,
      "learning_rate": 3.438283200183526e-05,
      "loss": 1.3534,
      "num_input_tokens_seen": 33647625104,
      "step": 42767
    },
    {
      "epoch": 4.5372374283895605,
      "grad_norm": 0.6556237299154276,
      "learning_rate": 3.438218783298543e-05,
      "loss": 1.3941,
      "num_input_tokens_seen": 33648411792,
      "step": 42768
    },
    {
      "epoch": 4.537343517929132,
      "grad_norm": 0.5389950495797109,
      "learning_rate": 3.438154365688531e-05,
      "loss": 1.349,
      "num_input_tokens_seen": 33649198592,
      "step": 42769
    },
    {
      "epoch": 4.537449607468703,
      "grad_norm": 0.48504914110688563,
      "learning_rate": 3.438089947353541e-05,
      "loss": 1.1817,
      "num_input_tokens_seen": 33649985376,
      "step": 42770
    },
    {
      "epoch": 4.537555697008275,
      "grad_norm": 0.7512829908627452,
      "learning_rate": 3.438025528293623e-05,
      "loss": 1.3918,
      "num_input_tokens_seen": 33650772112,
      "step": 42771
    },
    {
      "epoch": 4.537661786547846,
      "grad_norm": 0.5598893668004685,
      "learning_rate": 3.437961108508826e-05,
      "loss": 1.2959,
      "num_input_tokens_seen": 33651558880,
      "step": 42772
    },
    {
      "epoch": 4.537767876087418,
      "grad_norm": 0.5187545794637651,
      "learning_rate": 3.4378966879992e-05,
      "loss": 1.197,
      "num_input_tokens_seen": 33652345760,
      "step": 42773
    },
    {
      "epoch": 4.537873965626989,
      "grad_norm": 0.4652296228304949,
      "learning_rate": 3.437832266764796e-05,
      "loss": 1.1858,
      "num_input_tokens_seen": 33653132608,
      "step": 42774
    },
    {
      "epoch": 4.53798005516656,
      "grad_norm": 0.515268585975573,
      "learning_rate": 3.437767844805662e-05,
      "loss": 1.417,
      "num_input_tokens_seen": 33653919376,
      "step": 42775
    },
    {
      "epoch": 4.538086144706132,
      "grad_norm": 0.5024245338822435,
      "learning_rate": 3.437703422121848e-05,
      "loss": 1.2087,
      "num_input_tokens_seen": 33654706128,
      "step": 42776
    },
    {
      "epoch": 4.538192234245703,
      "grad_norm": 0.4781507248150715,
      "learning_rate": 3.4376389987134055e-05,
      "loss": 1.2182,
      "num_input_tokens_seen": 33655492960,
      "step": 42777
    },
    {
      "epoch": 4.538298323785275,
      "grad_norm": 0.4550520667135817,
      "learning_rate": 3.437574574580383e-05,
      "loss": 1.2979,
      "num_input_tokens_seen": 33656279616,
      "step": 42778
    },
    {
      "epoch": 4.538404413324846,
      "grad_norm": 0.49627965459536927,
      "learning_rate": 3.437510149722829e-05,
      "loss": 1.3774,
      "num_input_tokens_seen": 33657066432,
      "step": 42779
    },
    {
      "epoch": 4.538510502864417,
      "grad_norm": 0.5084223177050543,
      "learning_rate": 3.437445724140796e-05,
      "loss": 1.3034,
      "num_input_tokens_seen": 33657853216,
      "step": 42780
    },
    {
      "epoch": 4.538616592403989,
      "grad_norm": 0.5100012151960398,
      "learning_rate": 3.437381297834332e-05,
      "loss": 1.2394,
      "num_input_tokens_seen": 33658639984,
      "step": 42781
    },
    {
      "epoch": 4.53872268194356,
      "grad_norm": 0.5915584663800928,
      "learning_rate": 3.437316870803487e-05,
      "loss": 1.3185,
      "num_input_tokens_seen": 33659426768,
      "step": 42782
    },
    {
      "epoch": 4.538828771483132,
      "grad_norm": 0.5117986986925998,
      "learning_rate": 3.437252443048311e-05,
      "loss": 1.1915,
      "num_input_tokens_seen": 33660213536,
      "step": 42783
    },
    {
      "epoch": 4.538934861022703,
      "grad_norm": 0.4665936680938654,
      "learning_rate": 3.437188014568854e-05,
      "loss": 1.3065,
      "num_input_tokens_seen": 33661000320,
      "step": 42784
    },
    {
      "epoch": 4.539040950562274,
      "grad_norm": 0.6850265994340793,
      "learning_rate": 3.437123585365166e-05,
      "loss": 1.3243,
      "num_input_tokens_seen": 33661787120,
      "step": 42785
    },
    {
      "epoch": 4.539147040101846,
      "grad_norm": 0.4885160779480403,
      "learning_rate": 3.437059155437296e-05,
      "loss": 1.3054,
      "num_input_tokens_seen": 33662573968,
      "step": 42786
    },
    {
      "epoch": 4.539253129641417,
      "grad_norm": 0.7087132367078272,
      "learning_rate": 3.436994724785294e-05,
      "loss": 1.3702,
      "num_input_tokens_seen": 33663360656,
      "step": 42787
    },
    {
      "epoch": 4.539359219180989,
      "grad_norm": 0.6077769117236607,
      "learning_rate": 3.43693029340921e-05,
      "loss": 1.2947,
      "num_input_tokens_seen": 33664147456,
      "step": 42788
    },
    {
      "epoch": 4.53946530872056,
      "grad_norm": 0.5006456549690012,
      "learning_rate": 3.4368658613090945e-05,
      "loss": 1.2499,
      "num_input_tokens_seen": 33664934208,
      "step": 42789
    },
    {
      "epoch": 4.539571398260131,
      "grad_norm": 0.6951327286672708,
      "learning_rate": 3.4368014284849955e-05,
      "loss": 1.2854,
      "num_input_tokens_seen": 33665721008,
      "step": 42790
    },
    {
      "epoch": 4.539677487799703,
      "grad_norm": 0.5028181896031829,
      "learning_rate": 3.436736994936964e-05,
      "loss": 1.3002,
      "num_input_tokens_seen": 33666507728,
      "step": 42791
    },
    {
      "epoch": 4.539783577339274,
      "grad_norm": 0.5565950681451726,
      "learning_rate": 3.43667256066505e-05,
      "loss": 1.282,
      "num_input_tokens_seen": 33667294640,
      "step": 42792
    },
    {
      "epoch": 4.539889666878846,
      "grad_norm": 0.6791811696574367,
      "learning_rate": 3.436608125669303e-05,
      "loss": 1.3842,
      "num_input_tokens_seen": 33668081328,
      "step": 42793
    },
    {
      "epoch": 4.539995756418417,
      "grad_norm": 0.5381328387051467,
      "learning_rate": 3.436543689949772e-05,
      "loss": 1.3276,
      "num_input_tokens_seen": 33668868080,
      "step": 42794
    },
    {
      "epoch": 4.540101845957988,
      "grad_norm": 0.50520336830702,
      "learning_rate": 3.4364792535065087e-05,
      "loss": 1.2049,
      "num_input_tokens_seen": 33669654896,
      "step": 42795
    },
    {
      "epoch": 4.54020793549756,
      "grad_norm": 0.5728345100346797,
      "learning_rate": 3.4364148163395606e-05,
      "loss": 1.2776,
      "num_input_tokens_seen": 33670441760,
      "step": 42796
    },
    {
      "epoch": 4.540314025037131,
      "grad_norm": 0.4656447006799804,
      "learning_rate": 3.4363503784489795e-05,
      "loss": 1.2971,
      "num_input_tokens_seen": 33671228480,
      "step": 42797
    },
    {
      "epoch": 4.540420114576703,
      "grad_norm": 0.5465123164309724,
      "learning_rate": 3.436285939834814e-05,
      "loss": 1.3742,
      "num_input_tokens_seen": 33672015280,
      "step": 42798
    },
    {
      "epoch": 4.540526204116274,
      "grad_norm": 0.5210347759915072,
      "learning_rate": 3.436221500497114e-05,
      "loss": 1.2991,
      "num_input_tokens_seen": 33672801968,
      "step": 42799
    },
    {
      "epoch": 4.540632293655846,
      "grad_norm": 0.5264604954956748,
      "learning_rate": 3.436157060435929e-05,
      "loss": 1.3949,
      "num_input_tokens_seen": 33673588720,
      "step": 42800
    },
    {
      "epoch": 4.540738383195417,
      "grad_norm": 0.5409864762515815,
      "learning_rate": 3.436092619651311e-05,
      "loss": 1.2485,
      "num_input_tokens_seen": 33674375328,
      "step": 42801
    },
    {
      "epoch": 4.540844472734989,
      "grad_norm": 0.56650034638124,
      "learning_rate": 3.436028178143307e-05,
      "loss": 1.3743,
      "num_input_tokens_seen": 33675162080,
      "step": 42802
    },
    {
      "epoch": 4.54095056227456,
      "grad_norm": 0.5233571196427873,
      "learning_rate": 3.435963735911968e-05,
      "loss": 1.2497,
      "num_input_tokens_seen": 33675948864,
      "step": 42803
    },
    {
      "epoch": 4.541056651814131,
      "grad_norm": 0.533046664996179,
      "learning_rate": 3.4358992929573434e-05,
      "loss": 1.3386,
      "num_input_tokens_seen": 33676735648,
      "step": 42804
    },
    {
      "epoch": 4.541162741353703,
      "grad_norm": 0.7036638453573911,
      "learning_rate": 3.4358348492794835e-05,
      "loss": 1.2775,
      "num_input_tokens_seen": 33677522480,
      "step": 42805
    },
    {
      "epoch": 4.541268830893274,
      "grad_norm": 0.5585429138491604,
      "learning_rate": 3.435770404878438e-05,
      "loss": 1.2675,
      "num_input_tokens_seen": 33678309088,
      "step": 42806
    },
    {
      "epoch": 4.541374920432846,
      "grad_norm": 0.5773138912048164,
      "learning_rate": 3.435705959754256e-05,
      "loss": 1.2851,
      "num_input_tokens_seen": 33679095888,
      "step": 42807
    },
    {
      "epoch": 4.541481009972417,
      "grad_norm": 0.5844729211731322,
      "learning_rate": 3.4356415139069884e-05,
      "loss": 1.2567,
      "num_input_tokens_seen": 33679882656,
      "step": 42808
    },
    {
      "epoch": 4.541587099511988,
      "grad_norm": 0.5727257937712551,
      "learning_rate": 3.435577067336685e-05,
      "loss": 1.3027,
      "num_input_tokens_seen": 33680669520,
      "step": 42809
    },
    {
      "epoch": 4.54169318905156,
      "grad_norm": 0.5948105095541348,
      "learning_rate": 3.435512620043394e-05,
      "loss": 1.311,
      "num_input_tokens_seen": 33681456352,
      "step": 42810
    },
    {
      "epoch": 4.541799278591131,
      "grad_norm": 0.5137239812498003,
      "learning_rate": 3.435448172027167e-05,
      "loss": 1.2578,
      "num_input_tokens_seen": 33682243024,
      "step": 42811
    },
    {
      "epoch": 4.541905368130703,
      "grad_norm": 0.49815435002895786,
      "learning_rate": 3.435383723288053e-05,
      "loss": 1.318,
      "num_input_tokens_seen": 33683029776,
      "step": 42812
    },
    {
      "epoch": 4.542011457670274,
      "grad_norm": 0.5270988912037939,
      "learning_rate": 3.4353192738261015e-05,
      "loss": 1.2911,
      "num_input_tokens_seen": 33683816560,
      "step": 42813
    },
    {
      "epoch": 4.542117547209845,
      "grad_norm": 0.4905338339525409,
      "learning_rate": 3.4352548236413636e-05,
      "loss": 1.2924,
      "num_input_tokens_seen": 33684603296,
      "step": 42814
    },
    {
      "epoch": 4.542223636749417,
      "grad_norm": 0.4853565377436309,
      "learning_rate": 3.435190372733888e-05,
      "loss": 1.3009,
      "num_input_tokens_seen": 33685390080,
      "step": 42815
    },
    {
      "epoch": 4.542329726288988,
      "grad_norm": 0.5778411118659973,
      "learning_rate": 3.4351259211037234e-05,
      "loss": 1.3792,
      "num_input_tokens_seen": 33686176720,
      "step": 42816
    },
    {
      "epoch": 4.54243581582856,
      "grad_norm": 0.5962905251982568,
      "learning_rate": 3.435061468750922e-05,
      "loss": 1.4108,
      "num_input_tokens_seen": 33686963488,
      "step": 42817
    },
    {
      "epoch": 4.542541905368131,
      "grad_norm": 0.7283400043345627,
      "learning_rate": 3.434997015675533e-05,
      "loss": 1.2846,
      "num_input_tokens_seen": 33687750256,
      "step": 42818
    },
    {
      "epoch": 4.542647994907702,
      "grad_norm": 0.5015004113164582,
      "learning_rate": 3.434932561877605e-05,
      "loss": 1.2357,
      "num_input_tokens_seen": 33688537040,
      "step": 42819
    },
    {
      "epoch": 4.542754084447274,
      "grad_norm": 0.6552985231176458,
      "learning_rate": 3.4348681073571886e-05,
      "loss": 1.279,
      "num_input_tokens_seen": 33689323856,
      "step": 42820
    },
    {
      "epoch": 4.542860173986845,
      "grad_norm": 0.48053271957779126,
      "learning_rate": 3.434803652114334e-05,
      "loss": 1.3193,
      "num_input_tokens_seen": 33690110560,
      "step": 42821
    },
    {
      "epoch": 4.5429662635264165,
      "grad_norm": 0.46951192952047505,
      "learning_rate": 3.43473919614909e-05,
      "loss": 1.2653,
      "num_input_tokens_seen": 33690897408,
      "step": 42822
    },
    {
      "epoch": 4.543072353065988,
      "grad_norm": 0.5365849655801922,
      "learning_rate": 3.4346747394615075e-05,
      "loss": 1.3466,
      "num_input_tokens_seen": 33691684256,
      "step": 42823
    },
    {
      "epoch": 4.5431784426055595,
      "grad_norm": 0.4910190764892225,
      "learning_rate": 3.4346102820516356e-05,
      "loss": 1.3229,
      "num_input_tokens_seen": 33692471072,
      "step": 42824
    },
    {
      "epoch": 4.5432845321451305,
      "grad_norm": 0.4889178222036043,
      "learning_rate": 3.434545823919524e-05,
      "loss": 1.2186,
      "num_input_tokens_seen": 33693257904,
      "step": 42825
    },
    {
      "epoch": 4.5433906216847015,
      "grad_norm": 0.5573176869154337,
      "learning_rate": 3.434481365065223e-05,
      "loss": 1.3081,
      "num_input_tokens_seen": 33694044704,
      "step": 42826
    },
    {
      "epoch": 4.5434967112242735,
      "grad_norm": 0.46108886772751684,
      "learning_rate": 3.434416905488782e-05,
      "loss": 1.2897,
      "num_input_tokens_seen": 33694831472,
      "step": 42827
    },
    {
      "epoch": 4.5436028007638445,
      "grad_norm": 0.5135429489907866,
      "learning_rate": 3.4343524451902506e-05,
      "loss": 1.3693,
      "num_input_tokens_seen": 33695618240,
      "step": 42828
    },
    {
      "epoch": 4.543708890303416,
      "grad_norm": 0.4913447569657764,
      "learning_rate": 3.4342879841696804e-05,
      "loss": 1.3274,
      "num_input_tokens_seen": 33696404960,
      "step": 42829
    },
    {
      "epoch": 4.543814979842987,
      "grad_norm": 0.45557927032134027,
      "learning_rate": 3.434223522427119e-05,
      "loss": 1.2662,
      "num_input_tokens_seen": 33697191760,
      "step": 42830
    },
    {
      "epoch": 4.543921069382559,
      "grad_norm": 0.5650430826514128,
      "learning_rate": 3.434159059962617e-05,
      "loss": 1.4093,
      "num_input_tokens_seen": 33697978448,
      "step": 42831
    },
    {
      "epoch": 4.54402715892213,
      "grad_norm": 0.45292484699116947,
      "learning_rate": 3.434094596776225e-05,
      "loss": 1.2845,
      "num_input_tokens_seen": 33698765248,
      "step": 42832
    },
    {
      "epoch": 4.544133248461701,
      "grad_norm": 0.5142514250468867,
      "learning_rate": 3.434030132867991e-05,
      "loss": 1.3827,
      "num_input_tokens_seen": 33699552000,
      "step": 42833
    },
    {
      "epoch": 4.544239338001273,
      "grad_norm": 0.48967095290169155,
      "learning_rate": 3.4339656682379675e-05,
      "loss": 1.1891,
      "num_input_tokens_seen": 33700338768,
      "step": 42834
    },
    {
      "epoch": 4.544345427540844,
      "grad_norm": 0.5381928350677084,
      "learning_rate": 3.4339012028862015e-05,
      "loss": 1.3635,
      "num_input_tokens_seen": 33701125536,
      "step": 42835
    },
    {
      "epoch": 4.544451517080416,
      "grad_norm": 0.5319526924608698,
      "learning_rate": 3.4338367368127444e-05,
      "loss": 1.2713,
      "num_input_tokens_seen": 33701912384,
      "step": 42836
    },
    {
      "epoch": 4.544557606619987,
      "grad_norm": 0.6678618016417727,
      "learning_rate": 3.433772270017646e-05,
      "loss": 1.3929,
      "num_input_tokens_seen": 33702699184,
      "step": 42837
    },
    {
      "epoch": 4.544663696159558,
      "grad_norm": 0.5294400360494658,
      "learning_rate": 3.433707802500955e-05,
      "loss": 1.232,
      "num_input_tokens_seen": 33703485936,
      "step": 42838
    },
    {
      "epoch": 4.54476978569913,
      "grad_norm": 0.5989058717905498,
      "learning_rate": 3.4336433342627215e-05,
      "loss": 1.3247,
      "num_input_tokens_seen": 33704272576,
      "step": 42839
    },
    {
      "epoch": 4.544875875238701,
      "grad_norm": 0.5273093606276172,
      "learning_rate": 3.433578865302997e-05,
      "loss": 1.1894,
      "num_input_tokens_seen": 33705059424,
      "step": 42840
    },
    {
      "epoch": 4.544981964778273,
      "grad_norm": 0.47660062905309547,
      "learning_rate": 3.43351439562183e-05,
      "loss": 1.3358,
      "num_input_tokens_seen": 33705846272,
      "step": 42841
    },
    {
      "epoch": 4.545088054317844,
      "grad_norm": 0.6061920852069913,
      "learning_rate": 3.43344992521927e-05,
      "loss": 1.3488,
      "num_input_tokens_seen": 33706633008,
      "step": 42842
    },
    {
      "epoch": 4.545194143857415,
      "grad_norm": 0.4400869800148927,
      "learning_rate": 3.433385454095368e-05,
      "loss": 1.2729,
      "num_input_tokens_seen": 33707419808,
      "step": 42843
    },
    {
      "epoch": 4.545300233396987,
      "grad_norm": 0.6254102386874012,
      "learning_rate": 3.433320982250173e-05,
      "loss": 1.2422,
      "num_input_tokens_seen": 33708206576,
      "step": 42844
    },
    {
      "epoch": 4.545406322936558,
      "grad_norm": 0.5368597006214526,
      "learning_rate": 3.433256509683734e-05,
      "loss": 1.3108,
      "num_input_tokens_seen": 33708993344,
      "step": 42845
    },
    {
      "epoch": 4.54551241247613,
      "grad_norm": 0.5117704131889866,
      "learning_rate": 3.433192036396103e-05,
      "loss": 1.3004,
      "num_input_tokens_seen": 33709780176,
      "step": 42846
    },
    {
      "epoch": 4.545618502015701,
      "grad_norm": 0.5870132635500516,
      "learning_rate": 3.433127562387328e-05,
      "loss": 1.2665,
      "num_input_tokens_seen": 33710566944,
      "step": 42847
    },
    {
      "epoch": 4.545724591555272,
      "grad_norm": 0.4750266594808347,
      "learning_rate": 3.433063087657459e-05,
      "loss": 1.3261,
      "num_input_tokens_seen": 33711353744,
      "step": 42848
    },
    {
      "epoch": 4.545830681094844,
      "grad_norm": 0.5486398913598522,
      "learning_rate": 3.432998612206547e-05,
      "loss": 1.3046,
      "num_input_tokens_seen": 33712140560,
      "step": 42849
    },
    {
      "epoch": 4.545936770634415,
      "grad_norm": 0.45800051438888606,
      "learning_rate": 3.432934136034641e-05,
      "loss": 1.2292,
      "num_input_tokens_seen": 33712927440,
      "step": 42850
    },
    {
      "epoch": 4.546042860173987,
      "grad_norm": 0.590356254046399,
      "learning_rate": 3.4328696591417904e-05,
      "loss": 1.267,
      "num_input_tokens_seen": 33713714224,
      "step": 42851
    },
    {
      "epoch": 4.546148949713558,
      "grad_norm": 0.537524690632276,
      "learning_rate": 3.432805181528046e-05,
      "loss": 1.375,
      "num_input_tokens_seen": 33714501024,
      "step": 42852
    },
    {
      "epoch": 4.54625503925313,
      "grad_norm": 0.5513034804073443,
      "learning_rate": 3.4327407031934564e-05,
      "loss": 1.2986,
      "num_input_tokens_seen": 33715287824,
      "step": 42853
    },
    {
      "epoch": 4.546361128792701,
      "grad_norm": 0.60040955654757,
      "learning_rate": 3.432676224138073e-05,
      "loss": 1.3453,
      "num_input_tokens_seen": 33716074560,
      "step": 42854
    },
    {
      "epoch": 4.546467218332272,
      "grad_norm": 0.6145965963563851,
      "learning_rate": 3.4326117443619435e-05,
      "loss": 1.4678,
      "num_input_tokens_seen": 33716861280,
      "step": 42855
    },
    {
      "epoch": 4.546573307871844,
      "grad_norm": 0.5645135666133815,
      "learning_rate": 3.43254726386512e-05,
      "loss": 1.3031,
      "num_input_tokens_seen": 33717648016,
      "step": 42856
    },
    {
      "epoch": 4.546679397411415,
      "grad_norm": 0.6038540063499899,
      "learning_rate": 3.4324827826476516e-05,
      "loss": 1.2419,
      "num_input_tokens_seen": 33718434848,
      "step": 42857
    },
    {
      "epoch": 4.546785486950987,
      "grad_norm": 0.5919872565025005,
      "learning_rate": 3.432418300709587e-05,
      "loss": 1.3081,
      "num_input_tokens_seen": 33719221616,
      "step": 42858
    },
    {
      "epoch": 4.546891576490558,
      "grad_norm": 0.5243435181584454,
      "learning_rate": 3.432353818050977e-05,
      "loss": 1.2968,
      "num_input_tokens_seen": 33720008400,
      "step": 42859
    },
    {
      "epoch": 4.54699766603013,
      "grad_norm": 0.49303015399333194,
      "learning_rate": 3.432289334671872e-05,
      "loss": 1.1682,
      "num_input_tokens_seen": 33720795152,
      "step": 42860
    },
    {
      "epoch": 4.547103755569701,
      "grad_norm": 0.6398646851778871,
      "learning_rate": 3.432224850572321e-05,
      "loss": 1.3824,
      "num_input_tokens_seen": 33721581888,
      "step": 42861
    },
    {
      "epoch": 4.547209845109272,
      "grad_norm": 0.4997687596826115,
      "learning_rate": 3.432160365752374e-05,
      "loss": 1.2816,
      "num_input_tokens_seen": 33722368624,
      "step": 42862
    },
    {
      "epoch": 4.547315934648844,
      "grad_norm": 0.6369450144099174,
      "learning_rate": 3.4320958802120805e-05,
      "loss": 1.3828,
      "num_input_tokens_seen": 33723155344,
      "step": 42863
    },
    {
      "epoch": 4.547422024188415,
      "grad_norm": 0.5462232555186967,
      "learning_rate": 3.432031393951491e-05,
      "loss": 1.4271,
      "num_input_tokens_seen": 33723942080,
      "step": 42864
    },
    {
      "epoch": 4.547528113727987,
      "grad_norm": 0.6278160364882341,
      "learning_rate": 3.431966906970654e-05,
      "loss": 1.4841,
      "num_input_tokens_seen": 33724728704,
      "step": 42865
    },
    {
      "epoch": 4.547634203267558,
      "grad_norm": 0.550646710217782,
      "learning_rate": 3.4319024192696215e-05,
      "loss": 1.2137,
      "num_input_tokens_seen": 33725515616,
      "step": 42866
    },
    {
      "epoch": 4.547740292807129,
      "grad_norm": 0.6103623061010144,
      "learning_rate": 3.4318379308484415e-05,
      "loss": 1.3962,
      "num_input_tokens_seen": 33726302336,
      "step": 42867
    },
    {
      "epoch": 4.547846382346701,
      "grad_norm": 0.5650238829246736,
      "learning_rate": 3.431773441707164e-05,
      "loss": 1.2735,
      "num_input_tokens_seen": 33727089056,
      "step": 42868
    },
    {
      "epoch": 4.547952471886272,
      "grad_norm": 0.5434375925528228,
      "learning_rate": 3.431708951845841e-05,
      "loss": 1.2764,
      "num_input_tokens_seen": 33727875872,
      "step": 42869
    },
    {
      "epoch": 4.548058561425844,
      "grad_norm": 0.5315996671684264,
      "learning_rate": 3.431644461264519e-05,
      "loss": 1.3653,
      "num_input_tokens_seen": 33728662560,
      "step": 42870
    },
    {
      "epoch": 4.548164650965415,
      "grad_norm": 0.5104979072881421,
      "learning_rate": 3.431579969963251e-05,
      "loss": 1.3793,
      "num_input_tokens_seen": 33729449216,
      "step": 42871
    },
    {
      "epoch": 4.548270740504986,
      "grad_norm": 0.5075817682099886,
      "learning_rate": 3.431515477942085e-05,
      "loss": 1.2976,
      "num_input_tokens_seen": 33730236064,
      "step": 42872
    },
    {
      "epoch": 4.548376830044558,
      "grad_norm": 0.6220059826429664,
      "learning_rate": 3.43145098520107e-05,
      "loss": 1.3291,
      "num_input_tokens_seen": 33731022832,
      "step": 42873
    },
    {
      "epoch": 4.548482919584129,
      "grad_norm": 0.48694963907443484,
      "learning_rate": 3.431386491740258e-05,
      "loss": 1.3044,
      "num_input_tokens_seen": 33731809616,
      "step": 42874
    },
    {
      "epoch": 4.548589009123701,
      "grad_norm": 0.5753933677742872,
      "learning_rate": 3.431321997559698e-05,
      "loss": 1.3853,
      "num_input_tokens_seen": 33732596384,
      "step": 42875
    },
    {
      "epoch": 4.548695098663272,
      "grad_norm": 0.5849602590363586,
      "learning_rate": 3.431257502659439e-05,
      "loss": 1.254,
      "num_input_tokens_seen": 33733383248,
      "step": 42876
    },
    {
      "epoch": 4.548801188202843,
      "grad_norm": 0.47624153016401766,
      "learning_rate": 3.431193007039532e-05,
      "loss": 1.2594,
      "num_input_tokens_seen": 33734169984,
      "step": 42877
    },
    {
      "epoch": 4.548907277742415,
      "grad_norm": 0.6391504525654154,
      "learning_rate": 3.4311285107000255e-05,
      "loss": 1.2767,
      "num_input_tokens_seen": 33734956720,
      "step": 42878
    },
    {
      "epoch": 4.549013367281986,
      "grad_norm": 0.5394056566709862,
      "learning_rate": 3.43106401364097e-05,
      "loss": 1.2132,
      "num_input_tokens_seen": 33735743568,
      "step": 42879
    },
    {
      "epoch": 4.549119456821558,
      "grad_norm": 0.5300337298106157,
      "learning_rate": 3.430999515862417e-05,
      "loss": 1.3871,
      "num_input_tokens_seen": 33736530288,
      "step": 42880
    },
    {
      "epoch": 4.549225546361129,
      "grad_norm": 0.542349739145697,
      "learning_rate": 3.430935017364415e-05,
      "loss": 1.349,
      "num_input_tokens_seen": 33737317088,
      "step": 42881
    },
    {
      "epoch": 4.5493316359007006,
      "grad_norm": 0.5693208681282101,
      "learning_rate": 3.430870518147013e-05,
      "loss": 1.2951,
      "num_input_tokens_seen": 33738103872,
      "step": 42882
    },
    {
      "epoch": 4.549437725440272,
      "grad_norm": 0.6801443782246992,
      "learning_rate": 3.430806018210261e-05,
      "loss": 1.3347,
      "num_input_tokens_seen": 33738890672,
      "step": 42883
    },
    {
      "epoch": 4.549543814979843,
      "grad_norm": 0.5494915397938159,
      "learning_rate": 3.43074151755421e-05,
      "loss": 1.3564,
      "num_input_tokens_seen": 33739677392,
      "step": 42884
    },
    {
      "epoch": 4.5496499045194145,
      "grad_norm": 0.5976955094587838,
      "learning_rate": 3.4306770161789086e-05,
      "loss": 1.2809,
      "num_input_tokens_seen": 33740464160,
      "step": 42885
    },
    {
      "epoch": 4.549755994058986,
      "grad_norm": 0.6680655437404476,
      "learning_rate": 3.430612514084408e-05,
      "loss": 1.2613,
      "num_input_tokens_seen": 33741250832,
      "step": 42886
    },
    {
      "epoch": 4.5498620835985575,
      "grad_norm": 0.4657047597869871,
      "learning_rate": 3.430548011270758e-05,
      "loss": 1.2704,
      "num_input_tokens_seen": 33742037568,
      "step": 42887
    },
    {
      "epoch": 4.5499681731381285,
      "grad_norm": 0.5831476539357312,
      "learning_rate": 3.430483507738007e-05,
      "loss": 1.1781,
      "num_input_tokens_seen": 33742824432,
      "step": 42888
    },
    {
      "epoch": 4.5500742626777,
      "grad_norm": 0.5501695993988425,
      "learning_rate": 3.430419003486206e-05,
      "loss": 1.3432,
      "num_input_tokens_seen": 33743611200,
      "step": 42889
    },
    {
      "epoch": 4.5501803522172715,
      "grad_norm": 0.5397809394676508,
      "learning_rate": 3.430354498515404e-05,
      "loss": 1.3593,
      "num_input_tokens_seen": 33744398032,
      "step": 42890
    },
    {
      "epoch": 4.5502864417568425,
      "grad_norm": 0.55187755618569,
      "learning_rate": 3.430289992825651e-05,
      "loss": 1.3222,
      "num_input_tokens_seen": 33745184832,
      "step": 42891
    },
    {
      "epoch": 4.550392531296414,
      "grad_norm": 0.603588509545373,
      "learning_rate": 3.430225486416999e-05,
      "loss": 1.3257,
      "num_input_tokens_seen": 33745971632,
      "step": 42892
    },
    {
      "epoch": 4.550498620835985,
      "grad_norm": 0.46485673468895744,
      "learning_rate": 3.4301609792894947e-05,
      "loss": 1.2219,
      "num_input_tokens_seen": 33746758320,
      "step": 42893
    },
    {
      "epoch": 4.550604710375557,
      "grad_norm": 0.5173537101931724,
      "learning_rate": 3.430096471443189e-05,
      "loss": 1.3112,
      "num_input_tokens_seen": 33747545120,
      "step": 42894
    },
    {
      "epoch": 4.550710799915128,
      "grad_norm": 0.5107030577102181,
      "learning_rate": 3.430031962878132e-05,
      "loss": 1.3629,
      "num_input_tokens_seen": 33748331792,
      "step": 42895
    },
    {
      "epoch": 4.550816889454699,
      "grad_norm": 0.5952462503163412,
      "learning_rate": 3.429967453594374e-05,
      "loss": 1.3177,
      "num_input_tokens_seen": 33749118528,
      "step": 42896
    },
    {
      "epoch": 4.550922978994271,
      "grad_norm": 0.5294386656996448,
      "learning_rate": 3.429902943591965e-05,
      "loss": 1.3734,
      "num_input_tokens_seen": 33749905312,
      "step": 42897
    },
    {
      "epoch": 4.551029068533842,
      "grad_norm": 0.5696375282819642,
      "learning_rate": 3.4298384328709546e-05,
      "loss": 1.2536,
      "num_input_tokens_seen": 33750692128,
      "step": 42898
    },
    {
      "epoch": 4.551135158073414,
      "grad_norm": 0.5209518789040678,
      "learning_rate": 3.429773921431391e-05,
      "loss": 1.3375,
      "num_input_tokens_seen": 33751478880,
      "step": 42899
    },
    {
      "epoch": 4.551241247612985,
      "grad_norm": 0.4864048659026265,
      "learning_rate": 3.429709409273326e-05,
      "loss": 1.2891,
      "num_input_tokens_seen": 33752265648,
      "step": 42900
    },
    {
      "epoch": 4.551347337152556,
      "grad_norm": 0.5934091511107843,
      "learning_rate": 3.4296448963968086e-05,
      "loss": 1.399,
      "num_input_tokens_seen": 33753052512,
      "step": 42901
    },
    {
      "epoch": 4.551453426692128,
      "grad_norm": 0.5334029457302055,
      "learning_rate": 3.429580382801889e-05,
      "loss": 1.3289,
      "num_input_tokens_seen": 33753839280,
      "step": 42902
    },
    {
      "epoch": 4.551559516231699,
      "grad_norm": 0.6091472872072384,
      "learning_rate": 3.429515868488617e-05,
      "loss": 1.3929,
      "num_input_tokens_seen": 33754626016,
      "step": 42903
    },
    {
      "epoch": 4.551665605771271,
      "grad_norm": 0.7240120563336693,
      "learning_rate": 3.4294513534570425e-05,
      "loss": 1.3672,
      "num_input_tokens_seen": 33755412832,
      "step": 42904
    },
    {
      "epoch": 4.551771695310842,
      "grad_norm": 0.5268026451260652,
      "learning_rate": 3.429386837707215e-05,
      "loss": 1.3682,
      "num_input_tokens_seen": 33756199616,
      "step": 42905
    },
    {
      "epoch": 4.551877784850413,
      "grad_norm": 0.8721162482900192,
      "learning_rate": 3.429322321239185e-05,
      "loss": 1.3011,
      "num_input_tokens_seen": 33756986320,
      "step": 42906
    },
    {
      "epoch": 4.551983874389985,
      "grad_norm": 0.5927181011020629,
      "learning_rate": 3.429257804053002e-05,
      "loss": 1.2874,
      "num_input_tokens_seen": 33757773040,
      "step": 42907
    },
    {
      "epoch": 4.552089963929556,
      "grad_norm": 0.5640705060824945,
      "learning_rate": 3.4291932861487155e-05,
      "loss": 1.3522,
      "num_input_tokens_seen": 33758559888,
      "step": 42908
    },
    {
      "epoch": 4.552196053469128,
      "grad_norm": 0.8932544331411256,
      "learning_rate": 3.429128767526376e-05,
      "loss": 1.3131,
      "num_input_tokens_seen": 33759346672,
      "step": 42909
    },
    {
      "epoch": 4.552302143008699,
      "grad_norm": 0.49178172795299346,
      "learning_rate": 3.429064248186033e-05,
      "loss": 1.3394,
      "num_input_tokens_seen": 33760133376,
      "step": 42910
    },
    {
      "epoch": 4.552408232548271,
      "grad_norm": 0.8653778105150579,
      "learning_rate": 3.4289997281277365e-05,
      "loss": 1.3811,
      "num_input_tokens_seen": 33760920080,
      "step": 42911
    },
    {
      "epoch": 4.552514322087842,
      "grad_norm": 0.5473057973710033,
      "learning_rate": 3.428935207351536e-05,
      "loss": 1.3623,
      "num_input_tokens_seen": 33761706800,
      "step": 42912
    },
    {
      "epoch": 4.552620411627413,
      "grad_norm": 0.5795863108661671,
      "learning_rate": 3.4288706858574814e-05,
      "loss": 1.2339,
      "num_input_tokens_seen": 33762493520,
      "step": 42913
    },
    {
      "epoch": 4.552726501166985,
      "grad_norm": 0.6523296055198169,
      "learning_rate": 3.4288061636456235e-05,
      "loss": 1.3275,
      "num_input_tokens_seen": 33763280272,
      "step": 42914
    },
    {
      "epoch": 4.552832590706556,
      "grad_norm": 0.4641457838763361,
      "learning_rate": 3.428741640716011e-05,
      "loss": 1.2973,
      "num_input_tokens_seen": 33764066992,
      "step": 42915
    },
    {
      "epoch": 4.552938680246128,
      "grad_norm": 0.6230081127285275,
      "learning_rate": 3.4286771170686936e-05,
      "loss": 1.3212,
      "num_input_tokens_seen": 33764853792,
      "step": 42916
    },
    {
      "epoch": 4.553044769785699,
      "grad_norm": 0.5431021161365475,
      "learning_rate": 3.428612592703723e-05,
      "loss": 1.2974,
      "num_input_tokens_seen": 33765640560,
      "step": 42917
    },
    {
      "epoch": 4.553150859325271,
      "grad_norm": 0.5241143011226946,
      "learning_rate": 3.4285480676211475e-05,
      "loss": 1.3402,
      "num_input_tokens_seen": 33766427312,
      "step": 42918
    },
    {
      "epoch": 4.553256948864842,
      "grad_norm": 0.5552531991523763,
      "learning_rate": 3.428483541821017e-05,
      "loss": 1.3714,
      "num_input_tokens_seen": 33767214080,
      "step": 42919
    },
    {
      "epoch": 4.553363038404413,
      "grad_norm": 0.7300215483892974,
      "learning_rate": 3.4284190153033814e-05,
      "loss": 1.3265,
      "num_input_tokens_seen": 33768000912,
      "step": 42920
    },
    {
      "epoch": 4.553469127943985,
      "grad_norm": 0.502707457263457,
      "learning_rate": 3.4283544880682915e-05,
      "loss": 1.2821,
      "num_input_tokens_seen": 33768787728,
      "step": 42921
    },
    {
      "epoch": 4.553575217483556,
      "grad_norm": 0.7847362962530748,
      "learning_rate": 3.428289960115796e-05,
      "loss": 1.165,
      "num_input_tokens_seen": 33769574448,
      "step": 42922
    },
    {
      "epoch": 4.553681307023128,
      "grad_norm": 0.5670554561501094,
      "learning_rate": 3.428225431445945e-05,
      "loss": 1.2646,
      "num_input_tokens_seen": 33770361200,
      "step": 42923
    },
    {
      "epoch": 4.553787396562699,
      "grad_norm": 0.620436477585324,
      "learning_rate": 3.428160902058789e-05,
      "loss": 1.3246,
      "num_input_tokens_seen": 33771147872,
      "step": 42924
    },
    {
      "epoch": 4.55389348610227,
      "grad_norm": 0.6010408624602069,
      "learning_rate": 3.4280963719543773e-05,
      "loss": 1.2936,
      "num_input_tokens_seen": 33771934576,
      "step": 42925
    },
    {
      "epoch": 4.553999575641842,
      "grad_norm": 0.5623574080877316,
      "learning_rate": 3.428031841132761e-05,
      "loss": 1.3887,
      "num_input_tokens_seen": 33772721328,
      "step": 42926
    },
    {
      "epoch": 4.554105665181413,
      "grad_norm": 0.5301240759151776,
      "learning_rate": 3.427967309593988e-05,
      "loss": 1.3031,
      "num_input_tokens_seen": 33773508064,
      "step": 42927
    },
    {
      "epoch": 4.554211754720985,
      "grad_norm": 0.5367096130582243,
      "learning_rate": 3.427902777338109e-05,
      "loss": 1.2906,
      "num_input_tokens_seen": 33774294816,
      "step": 42928
    },
    {
      "epoch": 4.554317844260556,
      "grad_norm": 0.45025164640553067,
      "learning_rate": 3.427838244365174e-05,
      "loss": 1.3581,
      "num_input_tokens_seen": 33775081552,
      "step": 42929
    },
    {
      "epoch": 4.554423933800127,
      "grad_norm": 0.45846680536149104,
      "learning_rate": 3.427773710675233e-05,
      "loss": 1.3396,
      "num_input_tokens_seen": 33775868368,
      "step": 42930
    },
    {
      "epoch": 4.554530023339699,
      "grad_norm": 0.5248181794704782,
      "learning_rate": 3.427709176268335e-05,
      "loss": 1.3339,
      "num_input_tokens_seen": 33776655104,
      "step": 42931
    },
    {
      "epoch": 4.55463611287927,
      "grad_norm": 0.552745437986971,
      "learning_rate": 3.427644641144532e-05,
      "loss": 1.2861,
      "num_input_tokens_seen": 33777441888,
      "step": 42932
    },
    {
      "epoch": 4.554742202418842,
      "grad_norm": 0.5200764545161198,
      "learning_rate": 3.4275801053038714e-05,
      "loss": 1.3216,
      "num_input_tokens_seen": 33778228672,
      "step": 42933
    },
    {
      "epoch": 4.554848291958413,
      "grad_norm": 0.46782265787014476,
      "learning_rate": 3.427515568746404e-05,
      "loss": 1.1964,
      "num_input_tokens_seen": 33779015408,
      "step": 42934
    },
    {
      "epoch": 4.554954381497984,
      "grad_norm": 0.5702552764708535,
      "learning_rate": 3.4274510314721806e-05,
      "loss": 1.3023,
      "num_input_tokens_seen": 33779802144,
      "step": 42935
    },
    {
      "epoch": 4.555060471037556,
      "grad_norm": 0.4967689063234144,
      "learning_rate": 3.4273864934812495e-05,
      "loss": 1.3343,
      "num_input_tokens_seen": 33780588944,
      "step": 42936
    },
    {
      "epoch": 4.555166560577127,
      "grad_norm": 0.8254006421389865,
      "learning_rate": 3.4273219547736614e-05,
      "loss": 1.2637,
      "num_input_tokens_seen": 33781375712,
      "step": 42937
    },
    {
      "epoch": 4.555272650116699,
      "grad_norm": 0.7083236168922307,
      "learning_rate": 3.4272574153494666e-05,
      "loss": 1.2496,
      "num_input_tokens_seen": 33782162448,
      "step": 42938
    },
    {
      "epoch": 4.55537873965627,
      "grad_norm": 0.7005964577020148,
      "learning_rate": 3.427192875208714e-05,
      "loss": 1.3204,
      "num_input_tokens_seen": 33782949136,
      "step": 42939
    },
    {
      "epoch": 4.555484829195842,
      "grad_norm": 0.7282684795897497,
      "learning_rate": 3.427128334351454e-05,
      "loss": 1.2637,
      "num_input_tokens_seen": 33783735856,
      "step": 42940
    },
    {
      "epoch": 4.555590918735413,
      "grad_norm": 0.4941342699797939,
      "learning_rate": 3.427063792777737e-05,
      "loss": 1.1873,
      "num_input_tokens_seen": 33784522640,
      "step": 42941
    },
    {
      "epoch": 4.555697008274985,
      "grad_norm": 0.7702214417402031,
      "learning_rate": 3.4269992504876116e-05,
      "loss": 1.422,
      "num_input_tokens_seen": 33785309408,
      "step": 42942
    },
    {
      "epoch": 4.555803097814556,
      "grad_norm": 0.5840849522391636,
      "learning_rate": 3.426934707481129e-05,
      "loss": 1.4519,
      "num_input_tokens_seen": 33786096208,
      "step": 42943
    },
    {
      "epoch": 4.555909187354127,
      "grad_norm": 0.5321323969967011,
      "learning_rate": 3.4268701637583386e-05,
      "loss": 1.3059,
      "num_input_tokens_seen": 33786883024,
      "step": 42944
    },
    {
      "epoch": 4.556015276893699,
      "grad_norm": 0.5064526941496328,
      "learning_rate": 3.4268056193192885e-05,
      "loss": 1.255,
      "num_input_tokens_seen": 33787669808,
      "step": 42945
    },
    {
      "epoch": 4.55612136643327,
      "grad_norm": 0.6199274030341382,
      "learning_rate": 3.426741074164032e-05,
      "loss": 1.4128,
      "num_input_tokens_seen": 33788456528,
      "step": 42946
    },
    {
      "epoch": 4.5562274559728415,
      "grad_norm": 0.4944669748321391,
      "learning_rate": 3.4266765282926175e-05,
      "loss": 1.2412,
      "num_input_tokens_seen": 33789243312,
      "step": 42947
    },
    {
      "epoch": 4.5563335455124125,
      "grad_norm": 0.4589218882256563,
      "learning_rate": 3.426611981705093e-05,
      "loss": 1.2297,
      "num_input_tokens_seen": 33790030112,
      "step": 42948
    },
    {
      "epoch": 4.556439635051984,
      "grad_norm": 0.6139855883953051,
      "learning_rate": 3.42654743440151e-05,
      "loss": 1.4538,
      "num_input_tokens_seen": 33790816848,
      "step": 42949
    },
    {
      "epoch": 4.5565457245915555,
      "grad_norm": 0.594091278302481,
      "learning_rate": 3.4264828863819196e-05,
      "loss": 1.3795,
      "num_input_tokens_seen": 33791603616,
      "step": 42950
    },
    {
      "epoch": 4.5566518141311265,
      "grad_norm": 0.597440790368697,
      "learning_rate": 3.4264183376463695e-05,
      "loss": 1.3223,
      "num_input_tokens_seen": 33792390352,
      "step": 42951
    },
    {
      "epoch": 4.556757903670698,
      "grad_norm": 0.6051444812551094,
      "learning_rate": 3.426353788194911e-05,
      "loss": 1.3069,
      "num_input_tokens_seen": 33793177088,
      "step": 42952
    },
    {
      "epoch": 4.5568639932102695,
      "grad_norm": 0.506765714093406,
      "learning_rate": 3.4262892380275935e-05,
      "loss": 1.3243,
      "num_input_tokens_seen": 33793963904,
      "step": 42953
    },
    {
      "epoch": 4.5569700827498405,
      "grad_norm": 0.7479175405327678,
      "learning_rate": 3.426224687144466e-05,
      "loss": 1.2563,
      "num_input_tokens_seen": 33794750720,
      "step": 42954
    },
    {
      "epoch": 4.557076172289412,
      "grad_norm": 0.5253464940332887,
      "learning_rate": 3.42616013554558e-05,
      "loss": 1.3162,
      "num_input_tokens_seen": 33795537456,
      "step": 42955
    },
    {
      "epoch": 4.5571822618289834,
      "grad_norm": 0.7247831174834732,
      "learning_rate": 3.426095583230984e-05,
      "loss": 1.3931,
      "num_input_tokens_seen": 33796324208,
      "step": 42956
    },
    {
      "epoch": 4.557288351368555,
      "grad_norm": 0.5596424447819666,
      "learning_rate": 3.4260310302007295e-05,
      "loss": 1.3315,
      "num_input_tokens_seen": 33797110976,
      "step": 42957
    },
    {
      "epoch": 4.557394440908126,
      "grad_norm": 0.4908927520306431,
      "learning_rate": 3.425966476454865e-05,
      "loss": 1.2526,
      "num_input_tokens_seen": 33797897712,
      "step": 42958
    },
    {
      "epoch": 4.557500530447697,
      "grad_norm": 0.5705489844676365,
      "learning_rate": 3.42590192199344e-05,
      "loss": 1.2376,
      "num_input_tokens_seen": 33798684480,
      "step": 42959
    },
    {
      "epoch": 4.557606619987269,
      "grad_norm": 0.4810951083479542,
      "learning_rate": 3.425837366816506e-05,
      "loss": 1.1805,
      "num_input_tokens_seen": 33799471296,
      "step": 42960
    },
    {
      "epoch": 4.55771270952684,
      "grad_norm": 0.46135700409413427,
      "learning_rate": 3.425772810924111e-05,
      "loss": 1.2546,
      "num_input_tokens_seen": 33800258128,
      "step": 42961
    },
    {
      "epoch": 4.557818799066412,
      "grad_norm": 0.7346276126372397,
      "learning_rate": 3.4257082543163074e-05,
      "loss": 1.3427,
      "num_input_tokens_seen": 33801044752,
      "step": 42962
    },
    {
      "epoch": 4.557924888605983,
      "grad_norm": 0.6068152992397153,
      "learning_rate": 3.4256436969931436e-05,
      "loss": 1.4419,
      "num_input_tokens_seen": 33801831504,
      "step": 42963
    },
    {
      "epoch": 4.558030978145554,
      "grad_norm": 0.6324313427144922,
      "learning_rate": 3.4255791389546685e-05,
      "loss": 1.3357,
      "num_input_tokens_seen": 33802618368,
      "step": 42964
    },
    {
      "epoch": 4.558137067685126,
      "grad_norm": 0.7066494711257946,
      "learning_rate": 3.425514580200933e-05,
      "loss": 1.3432,
      "num_input_tokens_seen": 33803405120,
      "step": 42965
    },
    {
      "epoch": 4.558243157224697,
      "grad_norm": 0.5192021483758732,
      "learning_rate": 3.425450020731988e-05,
      "loss": 1.3951,
      "num_input_tokens_seen": 33804191952,
      "step": 42966
    },
    {
      "epoch": 4.558349246764269,
      "grad_norm": 0.6802068161677584,
      "learning_rate": 3.425385460547882e-05,
      "loss": 1.3989,
      "num_input_tokens_seen": 33804978752,
      "step": 42967
    },
    {
      "epoch": 4.55845533630384,
      "grad_norm": 0.6497684023028517,
      "learning_rate": 3.425320899648664e-05,
      "loss": 1.2945,
      "num_input_tokens_seen": 33805765472,
      "step": 42968
    },
    {
      "epoch": 4.558561425843412,
      "grad_norm": 0.5064694334603183,
      "learning_rate": 3.4252563380343865e-05,
      "loss": 1.3095,
      "num_input_tokens_seen": 33806552208,
      "step": 42969
    },
    {
      "epoch": 4.558667515382983,
      "grad_norm": 0.6960452852132313,
      "learning_rate": 3.425191775705098e-05,
      "loss": 1.4849,
      "num_input_tokens_seen": 33807338992,
      "step": 42970
    },
    {
      "epoch": 4.558773604922555,
      "grad_norm": 0.5097338940684959,
      "learning_rate": 3.425127212660848e-05,
      "loss": 1.3043,
      "num_input_tokens_seen": 33808125824,
      "step": 42971
    },
    {
      "epoch": 4.558879694462126,
      "grad_norm": 0.7727511911507382,
      "learning_rate": 3.4250626489016865e-05,
      "loss": 1.424,
      "num_input_tokens_seen": 33808912512,
      "step": 42972
    },
    {
      "epoch": 4.558985784001697,
      "grad_norm": 0.49631064036624517,
      "learning_rate": 3.424998084427664e-05,
      "loss": 1.3524,
      "num_input_tokens_seen": 33809699296,
      "step": 42973
    },
    {
      "epoch": 4.559091873541269,
      "grad_norm": 0.5719207763839266,
      "learning_rate": 3.424933519238831e-05,
      "loss": 1.3375,
      "num_input_tokens_seen": 33810486096,
      "step": 42974
    },
    {
      "epoch": 4.55919796308084,
      "grad_norm": 0.7772981594211648,
      "learning_rate": 3.424868953335236e-05,
      "loss": 1.3333,
      "num_input_tokens_seen": 33811272784,
      "step": 42975
    },
    {
      "epoch": 4.559304052620412,
      "grad_norm": 0.6260526818606018,
      "learning_rate": 3.424804386716929e-05,
      "loss": 1.3748,
      "num_input_tokens_seen": 33812059552,
      "step": 42976
    },
    {
      "epoch": 4.559410142159983,
      "grad_norm": 0.6186966573814577,
      "learning_rate": 3.424739819383961e-05,
      "loss": 1.4067,
      "num_input_tokens_seen": 33812846304,
      "step": 42977
    },
    {
      "epoch": 4.559516231699554,
      "grad_norm": 0.5456396610060973,
      "learning_rate": 3.424675251336381e-05,
      "loss": 1.2753,
      "num_input_tokens_seen": 33813633072,
      "step": 42978
    },
    {
      "epoch": 4.559622321239126,
      "grad_norm": 0.5657516648187112,
      "learning_rate": 3.424610682574239e-05,
      "loss": 1.2966,
      "num_input_tokens_seen": 33814419888,
      "step": 42979
    },
    {
      "epoch": 4.559728410778697,
      "grad_norm": 0.6743763076562808,
      "learning_rate": 3.424546113097584e-05,
      "loss": 1.4322,
      "num_input_tokens_seen": 33815206704,
      "step": 42980
    },
    {
      "epoch": 4.559834500318269,
      "grad_norm": 0.5511642264230703,
      "learning_rate": 3.424481542906468e-05,
      "loss": 1.2983,
      "num_input_tokens_seen": 33815993552,
      "step": 42981
    },
    {
      "epoch": 4.55994058985784,
      "grad_norm": 0.851202500942579,
      "learning_rate": 3.424416972000939e-05,
      "loss": 1.3756,
      "num_input_tokens_seen": 33816780288,
      "step": 42982
    },
    {
      "epoch": 4.560046679397411,
      "grad_norm": 0.5795938641254264,
      "learning_rate": 3.424352400381049e-05,
      "loss": 1.3353,
      "num_input_tokens_seen": 33817567136,
      "step": 42983
    },
    {
      "epoch": 4.560152768936983,
      "grad_norm": 0.571160910736445,
      "learning_rate": 3.4242878280468455e-05,
      "loss": 1.3283,
      "num_input_tokens_seen": 33818353888,
      "step": 42984
    },
    {
      "epoch": 4.560258858476554,
      "grad_norm": 0.5919115709674789,
      "learning_rate": 3.4242232549983795e-05,
      "loss": 1.2768,
      "num_input_tokens_seen": 33819140640,
      "step": 42985
    },
    {
      "epoch": 4.560364948016126,
      "grad_norm": 0.5666284163761174,
      "learning_rate": 3.4241586812357013e-05,
      "loss": 1.2855,
      "num_input_tokens_seen": 33819927360,
      "step": 42986
    },
    {
      "epoch": 4.560471037555697,
      "grad_norm": 0.5199141184167879,
      "learning_rate": 3.4240941067588606e-05,
      "loss": 1.249,
      "num_input_tokens_seen": 33820714112,
      "step": 42987
    },
    {
      "epoch": 4.560577127095268,
      "grad_norm": 0.6308339030244484,
      "learning_rate": 3.424029531567906e-05,
      "loss": 1.3174,
      "num_input_tokens_seen": 33821500928,
      "step": 42988
    },
    {
      "epoch": 4.56068321663484,
      "grad_norm": 0.5532490691322217,
      "learning_rate": 3.423964955662889e-05,
      "loss": 1.3369,
      "num_input_tokens_seen": 33822287616,
      "step": 42989
    },
    {
      "epoch": 4.560789306174411,
      "grad_norm": 0.48868580673437173,
      "learning_rate": 3.42390037904386e-05,
      "loss": 1.3532,
      "num_input_tokens_seen": 33823074336,
      "step": 42990
    },
    {
      "epoch": 4.560895395713983,
      "grad_norm": 0.5929803032252372,
      "learning_rate": 3.4238358017108676e-05,
      "loss": 1.3496,
      "num_input_tokens_seen": 33823861024,
      "step": 42991
    },
    {
      "epoch": 4.561001485253554,
      "grad_norm": 0.48870023363072124,
      "learning_rate": 3.423771223663961e-05,
      "loss": 1.2518,
      "num_input_tokens_seen": 33824647872,
      "step": 42992
    },
    {
      "epoch": 4.561107574793126,
      "grad_norm": 0.5037088370515971,
      "learning_rate": 3.4237066449031916e-05,
      "loss": 1.3124,
      "num_input_tokens_seen": 33825434592,
      "step": 42993
    },
    {
      "epoch": 4.561213664332697,
      "grad_norm": 0.5772377551868737,
      "learning_rate": 3.423642065428609e-05,
      "loss": 1.3173,
      "num_input_tokens_seen": 33826221264,
      "step": 42994
    },
    {
      "epoch": 4.561319753872268,
      "grad_norm": 0.5653269111940321,
      "learning_rate": 3.423577485240263e-05,
      "loss": 1.3043,
      "num_input_tokens_seen": 33827008016,
      "step": 42995
    },
    {
      "epoch": 4.56142584341184,
      "grad_norm": 0.5548702576824228,
      "learning_rate": 3.423512904338203e-05,
      "loss": 1.2624,
      "num_input_tokens_seen": 33827794848,
      "step": 42996
    },
    {
      "epoch": 4.561531932951411,
      "grad_norm": 0.5841651251177854,
      "learning_rate": 3.423448322722479e-05,
      "loss": 1.4331,
      "num_input_tokens_seen": 33828581536,
      "step": 42997
    },
    {
      "epoch": 4.561638022490983,
      "grad_norm": 0.5134186242173157,
      "learning_rate": 3.4233837403931424e-05,
      "loss": 1.2933,
      "num_input_tokens_seen": 33829368352,
      "step": 42998
    },
    {
      "epoch": 4.561744112030554,
      "grad_norm": 0.535460955511803,
      "learning_rate": 3.423319157350241e-05,
      "loss": 1.2419,
      "num_input_tokens_seen": 33830155168,
      "step": 42999
    },
    {
      "epoch": 4.561850201570126,
      "grad_norm": 0.6386066872062712,
      "learning_rate": 3.423254573593826e-05,
      "loss": 1.2833,
      "num_input_tokens_seen": 33830942000,
      "step": 43000
    },
    {
      "epoch": 4.561850201570126,
      "eval_loss": 1.565047264099121,
      "eval_runtime": 63.8432,
      "eval_samples_per_second": 46.99,
      "eval_steps_per_second": 0.501,
      "num_input_tokens_seen": 33830942000,
      "step": 43000
    },
    {
      "epoch": 4.561956291109697,
      "grad_norm": 0.521289385352662,
      "learning_rate": 3.423189989123947e-05,
      "loss": 1.3225,
      "num_input_tokens_seen": 33831728864,
      "step": 43001
    },
    {
      "epoch": 4.562062380649268,
      "grad_norm": 0.5462451838688476,
      "learning_rate": 3.4231254039406534e-05,
      "loss": 1.1805,
      "num_input_tokens_seen": 33832515760,
      "step": 43002
    },
    {
      "epoch": 4.56216847018884,
      "grad_norm": 0.6834866934566243,
      "learning_rate": 3.4230608180439965e-05,
      "loss": 1.3839,
      "num_input_tokens_seen": 33833302544,
      "step": 43003
    },
    {
      "epoch": 4.562274559728411,
      "grad_norm": 0.5584648815234569,
      "learning_rate": 3.422996231434025e-05,
      "loss": 1.3538,
      "num_input_tokens_seen": 33834089232,
      "step": 43004
    },
    {
      "epoch": 4.562380649267983,
      "grad_norm": 0.7672490811841541,
      "learning_rate": 3.422931644110788e-05,
      "loss": 1.2167,
      "num_input_tokens_seen": 33834875920,
      "step": 43005
    },
    {
      "epoch": 4.562486738807554,
      "grad_norm": 0.4901782522499735,
      "learning_rate": 3.422867056074338e-05,
      "loss": 1.3347,
      "num_input_tokens_seen": 33835662720,
      "step": 43006
    },
    {
      "epoch": 4.562592828347125,
      "grad_norm": 0.49780912717495746,
      "learning_rate": 3.422802467324723e-05,
      "loss": 1.2961,
      "num_input_tokens_seen": 33836449520,
      "step": 43007
    },
    {
      "epoch": 4.562698917886697,
      "grad_norm": 0.6357660031214627,
      "learning_rate": 3.422737877861992e-05,
      "loss": 1.3181,
      "num_input_tokens_seen": 33837236208,
      "step": 43008
    },
    {
      "epoch": 4.562805007426268,
      "grad_norm": 0.5261500435133362,
      "learning_rate": 3.4226732876861974e-05,
      "loss": 1.4215,
      "num_input_tokens_seen": 33838022864,
      "step": 43009
    },
    {
      "epoch": 4.5629110969658395,
      "grad_norm": 0.5613654877509006,
      "learning_rate": 3.4226086967973886e-05,
      "loss": 1.3353,
      "num_input_tokens_seen": 33838809744,
      "step": 43010
    },
    {
      "epoch": 4.5630171865054105,
      "grad_norm": 0.5836782536310104,
      "learning_rate": 3.422544105195614e-05,
      "loss": 1.1161,
      "num_input_tokens_seen": 33839596544,
      "step": 43011
    },
    {
      "epoch": 4.563123276044982,
      "grad_norm": 0.5342089249907749,
      "learning_rate": 3.4224795128809247e-05,
      "loss": 1.3045,
      "num_input_tokens_seen": 33840383312,
      "step": 43012
    },
    {
      "epoch": 4.5632293655845535,
      "grad_norm": 0.5354667368385493,
      "learning_rate": 3.42241491985337e-05,
      "loss": 1.292,
      "num_input_tokens_seen": 33841170048,
      "step": 43013
    },
    {
      "epoch": 4.5633354551241245,
      "grad_norm": 0.5299334012398862,
      "learning_rate": 3.422350326113e-05,
      "loss": 1.2645,
      "num_input_tokens_seen": 33841956832,
      "step": 43014
    },
    {
      "epoch": 4.5634415446636964,
      "grad_norm": 0.530453629023489,
      "learning_rate": 3.422285731659866e-05,
      "loss": 1.3542,
      "num_input_tokens_seen": 33842743488,
      "step": 43015
    },
    {
      "epoch": 4.5635476342032675,
      "grad_norm": 0.563319476975769,
      "learning_rate": 3.422221136494014e-05,
      "loss": 1.2678,
      "num_input_tokens_seen": 33843530304,
      "step": 43016
    },
    {
      "epoch": 4.5636537237428385,
      "grad_norm": 0.5105596288901249,
      "learning_rate": 3.422156540615499e-05,
      "loss": 1.156,
      "num_input_tokens_seen": 33844317152,
      "step": 43017
    },
    {
      "epoch": 4.56375981328241,
      "grad_norm": 0.5050175067851759,
      "learning_rate": 3.4220919440243675e-05,
      "loss": 1.2944,
      "num_input_tokens_seen": 33845103936,
      "step": 43018
    },
    {
      "epoch": 4.5638659028219815,
      "grad_norm": 0.5233549715260524,
      "learning_rate": 3.4220273467206705e-05,
      "loss": 1.2621,
      "num_input_tokens_seen": 33845890816,
      "step": 43019
    },
    {
      "epoch": 4.563971992361553,
      "grad_norm": 0.630404899123458,
      "learning_rate": 3.421962748704458e-05,
      "loss": 1.3405,
      "num_input_tokens_seen": 33846677616,
      "step": 43020
    },
    {
      "epoch": 4.564078081901124,
      "grad_norm": 0.6028685328189127,
      "learning_rate": 3.4218981499757794e-05,
      "loss": 1.1898,
      "num_input_tokens_seen": 33847464448,
      "step": 43021
    },
    {
      "epoch": 4.564184171440696,
      "grad_norm": 0.7007446820528164,
      "learning_rate": 3.4218335505346856e-05,
      "loss": 1.3469,
      "num_input_tokens_seen": 33848251248,
      "step": 43022
    },
    {
      "epoch": 4.564290260980267,
      "grad_norm": 0.6785733119701396,
      "learning_rate": 3.4217689503812255e-05,
      "loss": 1.2591,
      "num_input_tokens_seen": 33849037984,
      "step": 43023
    },
    {
      "epoch": 4.564396350519838,
      "grad_norm": 0.687992039933166,
      "learning_rate": 3.4217043495154494e-05,
      "loss": 1.314,
      "num_input_tokens_seen": 33849824720,
      "step": 43024
    },
    {
      "epoch": 4.56450244005941,
      "grad_norm": 0.5737824712123016,
      "learning_rate": 3.4216397479374066e-05,
      "loss": 1.3431,
      "num_input_tokens_seen": 33850611472,
      "step": 43025
    },
    {
      "epoch": 4.564608529598981,
      "grad_norm": 0.7329418501093805,
      "learning_rate": 3.421575145647149e-05,
      "loss": 1.3977,
      "num_input_tokens_seen": 33851398176,
      "step": 43026
    },
    {
      "epoch": 4.564714619138553,
      "grad_norm": 0.6091858419137295,
      "learning_rate": 3.421510542644724e-05,
      "loss": 1.3049,
      "num_input_tokens_seen": 33852184976,
      "step": 43027
    },
    {
      "epoch": 4.564820708678124,
      "grad_norm": 0.5603612348176404,
      "learning_rate": 3.421445938930182e-05,
      "loss": 1.3701,
      "num_input_tokens_seen": 33852971824,
      "step": 43028
    },
    {
      "epoch": 4.564926798217696,
      "grad_norm": 0.6207054866600084,
      "learning_rate": 3.421381334503576e-05,
      "loss": 1.3427,
      "num_input_tokens_seen": 33853758560,
      "step": 43029
    },
    {
      "epoch": 4.565032887757267,
      "grad_norm": 0.5135959268308309,
      "learning_rate": 3.421316729364952e-05,
      "loss": 1.2991,
      "num_input_tokens_seen": 33854545264,
      "step": 43030
    },
    {
      "epoch": 4.565138977296838,
      "grad_norm": 0.5543515926625506,
      "learning_rate": 3.421252123514361e-05,
      "loss": 1.2977,
      "num_input_tokens_seen": 33855332080,
      "step": 43031
    },
    {
      "epoch": 4.56524506683641,
      "grad_norm": 0.7513533028766557,
      "learning_rate": 3.421187516951855e-05,
      "loss": 1.3321,
      "num_input_tokens_seen": 33856118816,
      "step": 43032
    },
    {
      "epoch": 4.565351156375981,
      "grad_norm": 0.48936614044032,
      "learning_rate": 3.421122909677481e-05,
      "loss": 1.323,
      "num_input_tokens_seen": 33856905648,
      "step": 43033
    },
    {
      "epoch": 4.565457245915553,
      "grad_norm": 0.6635903113160095,
      "learning_rate": 3.4210583016912904e-05,
      "loss": 1.3185,
      "num_input_tokens_seen": 33857692448,
      "step": 43034
    },
    {
      "epoch": 4.565563335455124,
      "grad_norm": 0.5711750049223075,
      "learning_rate": 3.4209936929933333e-05,
      "loss": 1.4198,
      "num_input_tokens_seen": 33858479168,
      "step": 43035
    },
    {
      "epoch": 4.565669424994695,
      "grad_norm": 0.507881947775532,
      "learning_rate": 3.420929083583659e-05,
      "loss": 1.3759,
      "num_input_tokens_seen": 33859265904,
      "step": 43036
    },
    {
      "epoch": 4.565775514534267,
      "grad_norm": 0.6463120025930043,
      "learning_rate": 3.420864473462319e-05,
      "loss": 1.4055,
      "num_input_tokens_seen": 33860052624,
      "step": 43037
    },
    {
      "epoch": 4.565881604073838,
      "grad_norm": 0.5246965989172974,
      "learning_rate": 3.42079986262936e-05,
      "loss": 1.3139,
      "num_input_tokens_seen": 33860839328,
      "step": 43038
    },
    {
      "epoch": 4.56598769361341,
      "grad_norm": 0.5651946665834869,
      "learning_rate": 3.420735251084836e-05,
      "loss": 1.3888,
      "num_input_tokens_seen": 33861626128,
      "step": 43039
    },
    {
      "epoch": 4.566093783152981,
      "grad_norm": 0.5652154330381234,
      "learning_rate": 3.420670638828792e-05,
      "loss": 1.2951,
      "num_input_tokens_seen": 33862412944,
      "step": 43040
    },
    {
      "epoch": 4.566199872692552,
      "grad_norm": 0.5675203903957341,
      "learning_rate": 3.4206060258612835e-05,
      "loss": 1.3695,
      "num_input_tokens_seen": 33863199600,
      "step": 43041
    },
    {
      "epoch": 4.566305962232124,
      "grad_norm": 0.5227998000998701,
      "learning_rate": 3.420541412182356e-05,
      "loss": 1.2946,
      "num_input_tokens_seen": 33863986352,
      "step": 43042
    },
    {
      "epoch": 4.566412051771695,
      "grad_norm": 0.5148945747738584,
      "learning_rate": 3.4204767977920616e-05,
      "loss": 1.3217,
      "num_input_tokens_seen": 33864773072,
      "step": 43043
    },
    {
      "epoch": 4.566518141311267,
      "grad_norm": 0.6224406210683462,
      "learning_rate": 3.42041218269045e-05,
      "loss": 1.3675,
      "num_input_tokens_seen": 33865559840,
      "step": 43044
    },
    {
      "epoch": 4.566624230850838,
      "grad_norm": 0.49634158617738683,
      "learning_rate": 3.42034756687757e-05,
      "loss": 1.2943,
      "num_input_tokens_seen": 33866346576,
      "step": 43045
    },
    {
      "epoch": 4.566730320390409,
      "grad_norm": 0.5326596556866346,
      "learning_rate": 3.420282950353474e-05,
      "loss": 1.2467,
      "num_input_tokens_seen": 33867133344,
      "step": 43046
    },
    {
      "epoch": 4.566836409929981,
      "grad_norm": 0.5792702968178091,
      "learning_rate": 3.420218333118209e-05,
      "loss": 1.4139,
      "num_input_tokens_seen": 33867920144,
      "step": 43047
    },
    {
      "epoch": 4.566942499469552,
      "grad_norm": 0.5258951951591385,
      "learning_rate": 3.420153715171827e-05,
      "loss": 1.2828,
      "num_input_tokens_seen": 33868706912,
      "step": 43048
    },
    {
      "epoch": 4.567048589009124,
      "grad_norm": 0.5048801803598968,
      "learning_rate": 3.420089096514377e-05,
      "loss": 1.2706,
      "num_input_tokens_seen": 33869493680,
      "step": 43049
    },
    {
      "epoch": 4.567154678548695,
      "grad_norm": 0.714001812973591,
      "learning_rate": 3.420024477145909e-05,
      "loss": 1.3042,
      "num_input_tokens_seen": 33870280480,
      "step": 43050
    },
    {
      "epoch": 4.567260768088267,
      "grad_norm": 0.5007208115435731,
      "learning_rate": 3.419959857066472e-05,
      "loss": 1.1696,
      "num_input_tokens_seen": 33871067248,
      "step": 43051
    },
    {
      "epoch": 4.567366857627838,
      "grad_norm": 0.8285505916554311,
      "learning_rate": 3.419895236276119e-05,
      "loss": 1.3754,
      "num_input_tokens_seen": 33871854016,
      "step": 43052
    },
    {
      "epoch": 4.567472947167409,
      "grad_norm": 0.5625047611386699,
      "learning_rate": 3.419830614774897e-05,
      "loss": 1.3466,
      "num_input_tokens_seen": 33872640848,
      "step": 43053
    },
    {
      "epoch": 4.567579036706981,
      "grad_norm": 0.6504473575774675,
      "learning_rate": 3.4197659925628566e-05,
      "loss": 1.4163,
      "num_input_tokens_seen": 33873427536,
      "step": 43054
    },
    {
      "epoch": 4.567685126246552,
      "grad_norm": 0.690433413761997,
      "learning_rate": 3.4197013696400484e-05,
      "loss": 1.319,
      "num_input_tokens_seen": 33874214256,
      "step": 43055
    },
    {
      "epoch": 4.567791215786124,
      "grad_norm": 0.5035525354518763,
      "learning_rate": 3.419636746006523e-05,
      "loss": 1.1863,
      "num_input_tokens_seen": 33875001056,
      "step": 43056
    },
    {
      "epoch": 4.567897305325695,
      "grad_norm": 0.8170754803236746,
      "learning_rate": 3.4195721216623275e-05,
      "loss": 1.2383,
      "num_input_tokens_seen": 33875787856,
      "step": 43057
    },
    {
      "epoch": 4.568003394865267,
      "grad_norm": 0.5685911420173048,
      "learning_rate": 3.4195074966075143e-05,
      "loss": 1.3193,
      "num_input_tokens_seen": 33876574608,
      "step": 43058
    },
    {
      "epoch": 4.568109484404838,
      "grad_norm": 0.6373503406126746,
      "learning_rate": 3.419442870842133e-05,
      "loss": 1.2987,
      "num_input_tokens_seen": 33877361360,
      "step": 43059
    },
    {
      "epoch": 4.568215573944409,
      "grad_norm": 0.5419284376393586,
      "learning_rate": 3.419378244366233e-05,
      "loss": 1.2593,
      "num_input_tokens_seen": 33878148064,
      "step": 43060
    },
    {
      "epoch": 4.568321663483981,
      "grad_norm": 0.5798353425130371,
      "learning_rate": 3.4193136171798646e-05,
      "loss": 1.3033,
      "num_input_tokens_seen": 33878934800,
      "step": 43061
    },
    {
      "epoch": 4.568427753023552,
      "grad_norm": 0.5406742146489,
      "learning_rate": 3.419248989283077e-05,
      "loss": 1.3069,
      "num_input_tokens_seen": 33879721568,
      "step": 43062
    },
    {
      "epoch": 4.568533842563124,
      "grad_norm": 0.5684765901086545,
      "learning_rate": 3.4191843606759215e-05,
      "loss": 1.245,
      "num_input_tokens_seen": 33880508336,
      "step": 43063
    },
    {
      "epoch": 4.568639932102695,
      "grad_norm": 0.6260339616963534,
      "learning_rate": 3.419119731358447e-05,
      "loss": 1.3133,
      "num_input_tokens_seen": 33881295120,
      "step": 43064
    },
    {
      "epoch": 4.568746021642266,
      "grad_norm": 0.5792960468393122,
      "learning_rate": 3.419055101330704e-05,
      "loss": 1.2768,
      "num_input_tokens_seen": 33882081920,
      "step": 43065
    },
    {
      "epoch": 4.568852111181838,
      "grad_norm": 0.5816798664471162,
      "learning_rate": 3.4189904705927416e-05,
      "loss": 1.2914,
      "num_input_tokens_seen": 33882868736,
      "step": 43066
    },
    {
      "epoch": 4.568958200721409,
      "grad_norm": 0.5350050687861632,
      "learning_rate": 3.418925839144611e-05,
      "loss": 1.249,
      "num_input_tokens_seen": 33883655520,
      "step": 43067
    },
    {
      "epoch": 4.569064290260981,
      "grad_norm": 0.5223035926768076,
      "learning_rate": 3.4188612069863616e-05,
      "loss": 1.3852,
      "num_input_tokens_seen": 33884442192,
      "step": 43068
    },
    {
      "epoch": 4.569170379800552,
      "grad_norm": 0.5044788882934594,
      "learning_rate": 3.418796574118042e-05,
      "loss": 1.1887,
      "num_input_tokens_seen": 33885228928,
      "step": 43069
    },
    {
      "epoch": 4.569276469340123,
      "grad_norm": 0.4992757257259566,
      "learning_rate": 3.4187319405397045e-05,
      "loss": 1.2962,
      "num_input_tokens_seen": 33886015680,
      "step": 43070
    },
    {
      "epoch": 4.569382558879695,
      "grad_norm": 0.5351250663858349,
      "learning_rate": 3.4186673062513974e-05,
      "loss": 1.3622,
      "num_input_tokens_seen": 33886802432,
      "step": 43071
    },
    {
      "epoch": 4.569488648419266,
      "grad_norm": 0.6688245322688161,
      "learning_rate": 3.418602671253172e-05,
      "loss": 1.3594,
      "num_input_tokens_seen": 33887589120,
      "step": 43072
    },
    {
      "epoch": 4.5695947379588375,
      "grad_norm": 0.5916028513582116,
      "learning_rate": 3.418538035545076e-05,
      "loss": 1.3196,
      "num_input_tokens_seen": 33888375920,
      "step": 43073
    },
    {
      "epoch": 4.569700827498409,
      "grad_norm": 0.552532024891309,
      "learning_rate": 3.4184733991271615e-05,
      "loss": 1.2995,
      "num_input_tokens_seen": 33889162864,
      "step": 43074
    },
    {
      "epoch": 4.56980691703798,
      "grad_norm": 0.4453735586962971,
      "learning_rate": 3.418408761999478e-05,
      "loss": 1.2713,
      "num_input_tokens_seen": 33889949648,
      "step": 43075
    },
    {
      "epoch": 4.5699130065775515,
      "grad_norm": 0.6425205795438208,
      "learning_rate": 3.4183441241620743e-05,
      "loss": 1.3841,
      "num_input_tokens_seen": 33890736272,
      "step": 43076
    },
    {
      "epoch": 4.5700190961171225,
      "grad_norm": 0.5035372464970017,
      "learning_rate": 3.418279485615002e-05,
      "loss": 1.3076,
      "num_input_tokens_seen": 33891523104,
      "step": 43077
    },
    {
      "epoch": 4.5701251856566945,
      "grad_norm": 0.504295784098303,
      "learning_rate": 3.4182148463583094e-05,
      "loss": 1.4361,
      "num_input_tokens_seen": 33892309856,
      "step": 43078
    },
    {
      "epoch": 4.5702312751962655,
      "grad_norm": 0.5486721894143999,
      "learning_rate": 3.418150206392049e-05,
      "loss": 1.3578,
      "num_input_tokens_seen": 33893096624,
      "step": 43079
    },
    {
      "epoch": 4.570337364735837,
      "grad_norm": 0.46965860923727903,
      "learning_rate": 3.418085565716267e-05,
      "loss": 1.2214,
      "num_input_tokens_seen": 33893883376,
      "step": 43080
    },
    {
      "epoch": 4.570443454275408,
      "grad_norm": 0.5288765771769135,
      "learning_rate": 3.4180209243310166e-05,
      "loss": 1.3323,
      "num_input_tokens_seen": 33894670128,
      "step": 43081
    },
    {
      "epoch": 4.5705495438149795,
      "grad_norm": 0.4981511085771822,
      "learning_rate": 3.417956282236347e-05,
      "loss": 1.332,
      "num_input_tokens_seen": 33895456976,
      "step": 43082
    },
    {
      "epoch": 4.570655633354551,
      "grad_norm": 0.5051831594248104,
      "learning_rate": 3.4178916394323066e-05,
      "loss": 1.3203,
      "num_input_tokens_seen": 33896243680,
      "step": 43083
    },
    {
      "epoch": 4.570761722894122,
      "grad_norm": 0.5302462388013492,
      "learning_rate": 3.4178269959189474e-05,
      "loss": 1.3007,
      "num_input_tokens_seen": 33897030512,
      "step": 43084
    },
    {
      "epoch": 4.570867812433694,
      "grad_norm": 0.4691721388774812,
      "learning_rate": 3.4177623516963174e-05,
      "loss": 1.3373,
      "num_input_tokens_seen": 33897817280,
      "step": 43085
    },
    {
      "epoch": 4.570973901973265,
      "grad_norm": 0.602013570910474,
      "learning_rate": 3.417697706764468e-05,
      "loss": 1.4302,
      "num_input_tokens_seen": 33898604048,
      "step": 43086
    },
    {
      "epoch": 4.571079991512837,
      "grad_norm": 0.4612753575449118,
      "learning_rate": 3.4176330611234495e-05,
      "loss": 1.3356,
      "num_input_tokens_seen": 33899390800,
      "step": 43087
    },
    {
      "epoch": 4.571186081052408,
      "grad_norm": 0.5251004689615216,
      "learning_rate": 3.41756841477331e-05,
      "loss": 1.3687,
      "num_input_tokens_seen": 33900177488,
      "step": 43088
    },
    {
      "epoch": 4.571292170591979,
      "grad_norm": 0.6305789294885364,
      "learning_rate": 3.417503767714101e-05,
      "loss": 1.3747,
      "num_input_tokens_seen": 33900964240,
      "step": 43089
    },
    {
      "epoch": 4.571398260131551,
      "grad_norm": 0.48110969163068773,
      "learning_rate": 3.417439119945873e-05,
      "loss": 1.3372,
      "num_input_tokens_seen": 33901750944,
      "step": 43090
    },
    {
      "epoch": 4.571504349671122,
      "grad_norm": 0.4708894740542888,
      "learning_rate": 3.4173744714686734e-05,
      "loss": 1.3761,
      "num_input_tokens_seen": 33902537776,
      "step": 43091
    },
    {
      "epoch": 4.571610439210694,
      "grad_norm": 0.6635951511344415,
      "learning_rate": 3.417309822282555e-05,
      "loss": 1.3135,
      "num_input_tokens_seen": 33903324576,
      "step": 43092
    },
    {
      "epoch": 4.571716528750265,
      "grad_norm": 0.5798122614216484,
      "learning_rate": 3.417245172387566e-05,
      "loss": 1.3285,
      "num_input_tokens_seen": 33904111392,
      "step": 43093
    },
    {
      "epoch": 4.571822618289836,
      "grad_norm": 0.5584204945631357,
      "learning_rate": 3.417180521783756e-05,
      "loss": 1.2785,
      "num_input_tokens_seen": 33904898176,
      "step": 43094
    },
    {
      "epoch": 4.571928707829408,
      "grad_norm": 0.4993447067867039,
      "learning_rate": 3.417115870471177e-05,
      "loss": 1.2629,
      "num_input_tokens_seen": 33905684912,
      "step": 43095
    },
    {
      "epoch": 4.572034797368979,
      "grad_norm": 0.49321974551504333,
      "learning_rate": 3.417051218449877e-05,
      "loss": 1.3225,
      "num_input_tokens_seen": 33906471680,
      "step": 43096
    },
    {
      "epoch": 4.572140886908551,
      "grad_norm": 0.4359485497499251,
      "learning_rate": 3.416986565719907e-05,
      "loss": 1.2474,
      "num_input_tokens_seen": 33907258528,
      "step": 43097
    },
    {
      "epoch": 4.572246976448122,
      "grad_norm": 0.5337922739710426,
      "learning_rate": 3.416921912281317e-05,
      "loss": 1.3271,
      "num_input_tokens_seen": 33908045328,
      "step": 43098
    },
    {
      "epoch": 4.572353065987693,
      "grad_norm": 0.5452786418278457,
      "learning_rate": 3.416857258134156e-05,
      "loss": 1.2705,
      "num_input_tokens_seen": 33908832112,
      "step": 43099
    },
    {
      "epoch": 4.572459155527265,
      "grad_norm": 0.4285903945702365,
      "learning_rate": 3.416792603278475e-05,
      "loss": 1.2637,
      "num_input_tokens_seen": 33909618960,
      "step": 43100
    },
    {
      "epoch": 4.572565245066836,
      "grad_norm": 0.5212621897482997,
      "learning_rate": 3.416727947714324e-05,
      "loss": 1.2063,
      "num_input_tokens_seen": 33910405728,
      "step": 43101
    },
    {
      "epoch": 4.572671334606408,
      "grad_norm": 0.5274140422033553,
      "learning_rate": 3.4166632914417515e-05,
      "loss": 1.3421,
      "num_input_tokens_seen": 33911192512,
      "step": 43102
    },
    {
      "epoch": 4.572777424145979,
      "grad_norm": 0.5418283554519867,
      "learning_rate": 3.416598634460809e-05,
      "loss": 1.3043,
      "num_input_tokens_seen": 33911979248,
      "step": 43103
    },
    {
      "epoch": 4.57288351368555,
      "grad_norm": 0.4893003482780838,
      "learning_rate": 3.4165339767715464e-05,
      "loss": 1.2803,
      "num_input_tokens_seen": 33912765984,
      "step": 43104
    },
    {
      "epoch": 4.572989603225122,
      "grad_norm": 0.4648805419262037,
      "learning_rate": 3.4164693183740124e-05,
      "loss": 1.2207,
      "num_input_tokens_seen": 33913552800,
      "step": 43105
    },
    {
      "epoch": 4.573095692764693,
      "grad_norm": 0.5429755965539114,
      "learning_rate": 3.4164046592682586e-05,
      "loss": 1.311,
      "num_input_tokens_seen": 33914339520,
      "step": 43106
    },
    {
      "epoch": 4.573201782304265,
      "grad_norm": 0.6587431131858891,
      "learning_rate": 3.4163399994543345e-05,
      "loss": 1.3618,
      "num_input_tokens_seen": 33915126336,
      "step": 43107
    },
    {
      "epoch": 4.573307871843836,
      "grad_norm": 0.5234261766529386,
      "learning_rate": 3.416275338932288e-05,
      "loss": 1.348,
      "num_input_tokens_seen": 33915913008,
      "step": 43108
    },
    {
      "epoch": 4.573413961383408,
      "grad_norm": 0.5205816069200181,
      "learning_rate": 3.416210677702172e-05,
      "loss": 1.4391,
      "num_input_tokens_seen": 33916699680,
      "step": 43109
    },
    {
      "epoch": 4.573520050922979,
      "grad_norm": 0.488071941225711,
      "learning_rate": 3.416146015764036e-05,
      "loss": 1.3239,
      "num_input_tokens_seen": 33917486416,
      "step": 43110
    },
    {
      "epoch": 4.57362614046255,
      "grad_norm": 0.57925282694197,
      "learning_rate": 3.416081353117928e-05,
      "loss": 1.2858,
      "num_input_tokens_seen": 33918273184,
      "step": 43111
    },
    {
      "epoch": 4.573732230002122,
      "grad_norm": 0.5736745434225184,
      "learning_rate": 3.4160166897639e-05,
      "loss": 1.3522,
      "num_input_tokens_seen": 33919059920,
      "step": 43112
    },
    {
      "epoch": 4.573838319541693,
      "grad_norm": 0.5389754130380489,
      "learning_rate": 3.415952025702e-05,
      "loss": 1.2919,
      "num_input_tokens_seen": 33919846720,
      "step": 43113
    },
    {
      "epoch": 4.573944409081265,
      "grad_norm": 0.7422775266767108,
      "learning_rate": 3.41588736093228e-05,
      "loss": 1.3739,
      "num_input_tokens_seen": 33920633504,
      "step": 43114
    },
    {
      "epoch": 4.574050498620836,
      "grad_norm": 0.4905986906794801,
      "learning_rate": 3.4158226954547895e-05,
      "loss": 1.3363,
      "num_input_tokens_seen": 33921420256,
      "step": 43115
    },
    {
      "epoch": 4.574156588160408,
      "grad_norm": 0.6240822349223836,
      "learning_rate": 3.415758029269578e-05,
      "loss": 1.2949,
      "num_input_tokens_seen": 33922207088,
      "step": 43116
    },
    {
      "epoch": 4.574262677699979,
      "grad_norm": 0.5166323278587358,
      "learning_rate": 3.415693362376694e-05,
      "loss": 1.191,
      "num_input_tokens_seen": 33922993872,
      "step": 43117
    },
    {
      "epoch": 4.57436876723955,
      "grad_norm": 0.6354966657639319,
      "learning_rate": 3.4156286947761914e-05,
      "loss": 1.3528,
      "num_input_tokens_seen": 33923780656,
      "step": 43118
    },
    {
      "epoch": 4.574474856779122,
      "grad_norm": 0.5895847291616649,
      "learning_rate": 3.415564026468116e-05,
      "loss": 1.4177,
      "num_input_tokens_seen": 33924567424,
      "step": 43119
    },
    {
      "epoch": 4.574580946318693,
      "grad_norm": 0.49757146012508074,
      "learning_rate": 3.4154993574525204e-05,
      "loss": 1.2497,
      "num_input_tokens_seen": 33925354176,
      "step": 43120
    },
    {
      "epoch": 4.574687035858265,
      "grad_norm": 0.5664135339851698,
      "learning_rate": 3.415434687729454e-05,
      "loss": 1.2578,
      "num_input_tokens_seen": 33926140912,
      "step": 43121
    },
    {
      "epoch": 4.574793125397836,
      "grad_norm": 0.5877218143697848,
      "learning_rate": 3.415370017298966e-05,
      "loss": 1.3266,
      "num_input_tokens_seen": 33926927728,
      "step": 43122
    },
    {
      "epoch": 4.574899214937407,
      "grad_norm": 0.49272031392130083,
      "learning_rate": 3.4153053461611064e-05,
      "loss": 1.3031,
      "num_input_tokens_seen": 33927714480,
      "step": 43123
    },
    {
      "epoch": 4.575005304476979,
      "grad_norm": 0.5898334549581141,
      "learning_rate": 3.415240674315926e-05,
      "loss": 1.313,
      "num_input_tokens_seen": 33928501216,
      "step": 43124
    },
    {
      "epoch": 4.57511139401655,
      "grad_norm": 0.514416998003958,
      "learning_rate": 3.4151760017634756e-05,
      "loss": 1.2372,
      "num_input_tokens_seen": 33929287952,
      "step": 43125
    },
    {
      "epoch": 4.575217483556122,
      "grad_norm": 0.5638032340340842,
      "learning_rate": 3.4151113285038026e-05,
      "loss": 1.2684,
      "num_input_tokens_seen": 33930074624,
      "step": 43126
    },
    {
      "epoch": 4.575323573095693,
      "grad_norm": 0.5598263954858792,
      "learning_rate": 3.4150466545369595e-05,
      "loss": 1.2107,
      "num_input_tokens_seen": 33930861456,
      "step": 43127
    },
    {
      "epoch": 4.575429662635264,
      "grad_norm": 0.5520925706473425,
      "learning_rate": 3.414981979862994e-05,
      "loss": 1.3495,
      "num_input_tokens_seen": 33931648256,
      "step": 43128
    },
    {
      "epoch": 4.575535752174836,
      "grad_norm": 0.6249357349542942,
      "learning_rate": 3.4149173044819584e-05,
      "loss": 1.2754,
      "num_input_tokens_seen": 33932435040,
      "step": 43129
    },
    {
      "epoch": 4.575641841714407,
      "grad_norm": 0.6029186422228074,
      "learning_rate": 3.4148526283939015e-05,
      "loss": 1.3337,
      "num_input_tokens_seen": 33933221888,
      "step": 43130
    },
    {
      "epoch": 4.575747931253979,
      "grad_norm": 0.4373641516282118,
      "learning_rate": 3.414787951598872e-05,
      "loss": 1.1234,
      "num_input_tokens_seen": 33934008784,
      "step": 43131
    },
    {
      "epoch": 4.57585402079355,
      "grad_norm": 0.6068576248905984,
      "learning_rate": 3.4147232740969235e-05,
      "loss": 1.2585,
      "num_input_tokens_seen": 33934795520,
      "step": 43132
    },
    {
      "epoch": 4.575960110333121,
      "grad_norm": 0.6180669602554685,
      "learning_rate": 3.414658595888102e-05,
      "loss": 1.2839,
      "num_input_tokens_seen": 33935582336,
      "step": 43133
    },
    {
      "epoch": 4.576066199872693,
      "grad_norm": 0.648392927005375,
      "learning_rate": 3.4145939169724594e-05,
      "loss": 1.3847,
      "num_input_tokens_seen": 33936369152,
      "step": 43134
    },
    {
      "epoch": 4.576172289412264,
      "grad_norm": 0.6320544993696918,
      "learning_rate": 3.414529237350046e-05,
      "loss": 1.2616,
      "num_input_tokens_seen": 33937155824,
      "step": 43135
    },
    {
      "epoch": 4.5762783789518355,
      "grad_norm": 0.5151825426159228,
      "learning_rate": 3.414464557020911e-05,
      "loss": 1.3021,
      "num_input_tokens_seen": 33937942560,
      "step": 43136
    },
    {
      "epoch": 4.576384468491407,
      "grad_norm": 0.6009464069917295,
      "learning_rate": 3.414399875985104e-05,
      "loss": 1.4148,
      "num_input_tokens_seen": 33938729392,
      "step": 43137
    },
    {
      "epoch": 4.5764905580309785,
      "grad_norm": 0.4566392902748973,
      "learning_rate": 3.414335194242677e-05,
      "loss": 1.2302,
      "num_input_tokens_seen": 33939516176,
      "step": 43138
    },
    {
      "epoch": 4.5765966475705495,
      "grad_norm": 0.6047609779939612,
      "learning_rate": 3.4142705117936776e-05,
      "loss": 1.2262,
      "num_input_tokens_seen": 33940302912,
      "step": 43139
    },
    {
      "epoch": 4.576702737110121,
      "grad_norm": 0.5072728654226207,
      "learning_rate": 3.414205828638156e-05,
      "loss": 1.3619,
      "num_input_tokens_seen": 33941089600,
      "step": 43140
    },
    {
      "epoch": 4.5768088266496925,
      "grad_norm": 0.5263370117992687,
      "learning_rate": 3.414141144776164e-05,
      "loss": 1.3791,
      "num_input_tokens_seen": 33941876288,
      "step": 43141
    },
    {
      "epoch": 4.5769149161892635,
      "grad_norm": 0.6508037175351818,
      "learning_rate": 3.414076460207751e-05,
      "loss": 1.4225,
      "num_input_tokens_seen": 33942663120,
      "step": 43142
    },
    {
      "epoch": 4.577021005728835,
      "grad_norm": 0.5654749726569225,
      "learning_rate": 3.414011774932965e-05,
      "loss": 1.2495,
      "num_input_tokens_seen": 33943449936,
      "step": 43143
    },
    {
      "epoch": 4.577127095268406,
      "grad_norm": 0.4788521129582272,
      "learning_rate": 3.413947088951859e-05,
      "loss": 1.2597,
      "num_input_tokens_seen": 33944236720,
      "step": 43144
    },
    {
      "epoch": 4.577233184807978,
      "grad_norm": 0.5365651364181395,
      "learning_rate": 3.413882402264481e-05,
      "loss": 1.2534,
      "num_input_tokens_seen": 33945023600,
      "step": 43145
    },
    {
      "epoch": 4.577339274347549,
      "grad_norm": 0.5073272196605174,
      "learning_rate": 3.413817714870881e-05,
      "loss": 1.3238,
      "num_input_tokens_seen": 33945810336,
      "step": 43146
    },
    {
      "epoch": 4.57744536388712,
      "grad_norm": 0.6735610802457763,
      "learning_rate": 3.4137530267711104e-05,
      "loss": 1.3128,
      "num_input_tokens_seen": 33946597104,
      "step": 43147
    },
    {
      "epoch": 4.577551453426692,
      "grad_norm": 0.5411870595799174,
      "learning_rate": 3.4136883379652176e-05,
      "loss": 1.257,
      "num_input_tokens_seen": 33947383888,
      "step": 43148
    },
    {
      "epoch": 4.577657542966263,
      "grad_norm": 0.6530073548065491,
      "learning_rate": 3.413623648453254e-05,
      "loss": 1.3189,
      "num_input_tokens_seen": 33948170720,
      "step": 43149
    },
    {
      "epoch": 4.577763632505835,
      "grad_norm": 0.5197716143582293,
      "learning_rate": 3.413558958235268e-05,
      "loss": 1.366,
      "num_input_tokens_seen": 33948957456,
      "step": 43150
    },
    {
      "epoch": 4.577869722045406,
      "grad_norm": 0.6340904111939725,
      "learning_rate": 3.41349426731131e-05,
      "loss": 1.3538,
      "num_input_tokens_seen": 33949744192,
      "step": 43151
    },
    {
      "epoch": 4.577975811584977,
      "grad_norm": 0.5038062800450334,
      "learning_rate": 3.413429575681432e-05,
      "loss": 1.2798,
      "num_input_tokens_seen": 33950531024,
      "step": 43152
    },
    {
      "epoch": 4.578081901124549,
      "grad_norm": 0.4773618039429838,
      "learning_rate": 3.413364883345682e-05,
      "loss": 1.2594,
      "num_input_tokens_seen": 33951317744,
      "step": 43153
    },
    {
      "epoch": 4.57818799066412,
      "grad_norm": 0.51569001004351,
      "learning_rate": 3.413300190304109e-05,
      "loss": 1.3988,
      "num_input_tokens_seen": 33952104544,
      "step": 43154
    },
    {
      "epoch": 4.578294080203692,
      "grad_norm": 0.6113314208961591,
      "learning_rate": 3.413235496556766e-05,
      "loss": 1.3746,
      "num_input_tokens_seen": 33952891376,
      "step": 43155
    },
    {
      "epoch": 4.578400169743263,
      "grad_norm": 0.4840234925300749,
      "learning_rate": 3.4131708021037004e-05,
      "loss": 1.2707,
      "num_input_tokens_seen": 33953678176,
      "step": 43156
    },
    {
      "epoch": 4.578506259282834,
      "grad_norm": 0.6663522625849484,
      "learning_rate": 3.4131061069449637e-05,
      "loss": 1.3489,
      "num_input_tokens_seen": 33954464976,
      "step": 43157
    },
    {
      "epoch": 4.578612348822406,
      "grad_norm": 0.5535195163355722,
      "learning_rate": 3.413041411080605e-05,
      "loss": 1.2888,
      "num_input_tokens_seen": 33955251808,
      "step": 43158
    },
    {
      "epoch": 4.578718438361977,
      "grad_norm": 0.6061102879989068,
      "learning_rate": 3.4129767145106755e-05,
      "loss": 1.2742,
      "num_input_tokens_seen": 33956038624,
      "step": 43159
    },
    {
      "epoch": 4.578824527901549,
      "grad_norm": 0.4582485966986313,
      "learning_rate": 3.412912017235224e-05,
      "loss": 1.2972,
      "num_input_tokens_seen": 33956825504,
      "step": 43160
    },
    {
      "epoch": 4.57893061744112,
      "grad_norm": 0.5406985018444853,
      "learning_rate": 3.4128473192543006e-05,
      "loss": 1.3586,
      "num_input_tokens_seen": 33957612176,
      "step": 43161
    },
    {
      "epoch": 4.579036706980691,
      "grad_norm": 0.4663070427394613,
      "learning_rate": 3.4127826205679556e-05,
      "loss": 1.365,
      "num_input_tokens_seen": 33958398960,
      "step": 43162
    },
    {
      "epoch": 4.579142796520263,
      "grad_norm": 0.5006707545797511,
      "learning_rate": 3.4127179211762394e-05,
      "loss": 1.2996,
      "num_input_tokens_seen": 33959185760,
      "step": 43163
    },
    {
      "epoch": 4.579248886059834,
      "grad_norm": 0.7400412712095554,
      "learning_rate": 3.412653221079201e-05,
      "loss": 1.2904,
      "num_input_tokens_seen": 33959972560,
      "step": 43164
    },
    {
      "epoch": 4.579354975599406,
      "grad_norm": 0.5380427787615317,
      "learning_rate": 3.412588520276892e-05,
      "loss": 1.2494,
      "num_input_tokens_seen": 33960759328,
      "step": 43165
    },
    {
      "epoch": 4.579461065138977,
      "grad_norm": 0.5492847777312981,
      "learning_rate": 3.41252381876936e-05,
      "loss": 1.2274,
      "num_input_tokens_seen": 33961546128,
      "step": 43166
    },
    {
      "epoch": 4.579567154678549,
      "grad_norm": 0.5126172753759641,
      "learning_rate": 3.412459116556657e-05,
      "loss": 1.2978,
      "num_input_tokens_seen": 33962332880,
      "step": 43167
    },
    {
      "epoch": 4.57967324421812,
      "grad_norm": 0.6299672142415201,
      "learning_rate": 3.4123944136388324e-05,
      "loss": 1.3165,
      "num_input_tokens_seen": 33963119648,
      "step": 43168
    },
    {
      "epoch": 4.579779333757692,
      "grad_norm": 0.5406749915523472,
      "learning_rate": 3.412329710015936e-05,
      "loss": 1.3782,
      "num_input_tokens_seen": 33963906400,
      "step": 43169
    },
    {
      "epoch": 4.579885423297263,
      "grad_norm": 0.5240720422896977,
      "learning_rate": 3.412265005688018e-05,
      "loss": 1.262,
      "num_input_tokens_seen": 33964693184,
      "step": 43170
    },
    {
      "epoch": 4.579991512836834,
      "grad_norm": 0.6014681689361605,
      "learning_rate": 3.412200300655128e-05,
      "loss": 1.2964,
      "num_input_tokens_seen": 33965479888,
      "step": 43171
    },
    {
      "epoch": 4.580097602376406,
      "grad_norm": 0.5260402924375588,
      "learning_rate": 3.412135594917317e-05,
      "loss": 1.3028,
      "num_input_tokens_seen": 33966266592,
      "step": 43172
    },
    {
      "epoch": 4.580203691915977,
      "grad_norm": 0.5764723242397559,
      "learning_rate": 3.4120708884746346e-05,
      "loss": 1.3574,
      "num_input_tokens_seen": 33967053280,
      "step": 43173
    },
    {
      "epoch": 4.580309781455549,
      "grad_norm": 0.6479927945447089,
      "learning_rate": 3.41200618132713e-05,
      "loss": 1.1886,
      "num_input_tokens_seen": 33967840064,
      "step": 43174
    },
    {
      "epoch": 4.58041587099512,
      "grad_norm": 0.5810632178133299,
      "learning_rate": 3.411941473474854e-05,
      "loss": 1.2497,
      "num_input_tokens_seen": 33968626832,
      "step": 43175
    },
    {
      "epoch": 4.580521960534691,
      "grad_norm": 0.7234234106618048,
      "learning_rate": 3.4118767649178566e-05,
      "loss": 1.3248,
      "num_input_tokens_seen": 33969413600,
      "step": 43176
    },
    {
      "epoch": 4.580628050074263,
      "grad_norm": 0.6817874765367371,
      "learning_rate": 3.411812055656187e-05,
      "loss": 1.3613,
      "num_input_tokens_seen": 33970200288,
      "step": 43177
    },
    {
      "epoch": 4.580734139613834,
      "grad_norm": 0.662245060721333,
      "learning_rate": 3.411747345689896e-05,
      "loss": 1.3923,
      "num_input_tokens_seen": 33970986976,
      "step": 43178
    },
    {
      "epoch": 4.580840229153406,
      "grad_norm": 0.6717783373868216,
      "learning_rate": 3.4116826350190345e-05,
      "loss": 1.2924,
      "num_input_tokens_seen": 33971773712,
      "step": 43179
    },
    {
      "epoch": 4.580946318692977,
      "grad_norm": 0.5394847128930884,
      "learning_rate": 3.4116179236436494e-05,
      "loss": 1.3107,
      "num_input_tokens_seen": 33972560560,
      "step": 43180
    },
    {
      "epoch": 4.581052408232548,
      "grad_norm": 0.5186506127634516,
      "learning_rate": 3.4115532115637944e-05,
      "loss": 1.2872,
      "num_input_tokens_seen": 33973347344,
      "step": 43181
    },
    {
      "epoch": 4.58115849777212,
      "grad_norm": 0.477985888904844,
      "learning_rate": 3.411488498779518e-05,
      "loss": 1.2572,
      "num_input_tokens_seen": 33974134064,
      "step": 43182
    },
    {
      "epoch": 4.581264587311691,
      "grad_norm": 0.49034153297418215,
      "learning_rate": 3.411423785290868e-05,
      "loss": 1.2735,
      "num_input_tokens_seen": 33974920832,
      "step": 43183
    },
    {
      "epoch": 4.581370676851263,
      "grad_norm": 0.5242513783297506,
      "learning_rate": 3.411359071097898e-05,
      "loss": 1.3216,
      "num_input_tokens_seen": 33975707648,
      "step": 43184
    },
    {
      "epoch": 4.581476766390834,
      "grad_norm": 0.5031259243673596,
      "learning_rate": 3.4112943562006565e-05,
      "loss": 1.2451,
      "num_input_tokens_seen": 33976494448,
      "step": 43185
    },
    {
      "epoch": 4.581582855930405,
      "grad_norm": 0.5130090600434509,
      "learning_rate": 3.411229640599193e-05,
      "loss": 1.2355,
      "num_input_tokens_seen": 33977281232,
      "step": 43186
    },
    {
      "epoch": 4.581688945469977,
      "grad_norm": 0.47727455809221747,
      "learning_rate": 3.411164924293558e-05,
      "loss": 1.2705,
      "num_input_tokens_seen": 33978067952,
      "step": 43187
    },
    {
      "epoch": 4.581795035009548,
      "grad_norm": 0.7360768731629007,
      "learning_rate": 3.4111002072838015e-05,
      "loss": 1.3286,
      "num_input_tokens_seen": 33978854704,
      "step": 43188
    },
    {
      "epoch": 4.58190112454912,
      "grad_norm": 0.5044828666856271,
      "learning_rate": 3.411035489569974e-05,
      "loss": 1.3783,
      "num_input_tokens_seen": 33979641472,
      "step": 43189
    },
    {
      "epoch": 4.582007214088691,
      "grad_norm": 0.6779539240737382,
      "learning_rate": 3.4109707711521244e-05,
      "loss": 1.2741,
      "num_input_tokens_seen": 33980428272,
      "step": 43190
    },
    {
      "epoch": 4.582113303628263,
      "grad_norm": 0.5674552264932308,
      "learning_rate": 3.410906052030303e-05,
      "loss": 1.3252,
      "num_input_tokens_seen": 33981215152,
      "step": 43191
    },
    {
      "epoch": 4.582219393167834,
      "grad_norm": 0.5568127901938789,
      "learning_rate": 3.410841332204561e-05,
      "loss": 1.4101,
      "num_input_tokens_seen": 33982001872,
      "step": 43192
    },
    {
      "epoch": 4.582325482707405,
      "grad_norm": 0.6150222790611503,
      "learning_rate": 3.410776611674947e-05,
      "loss": 1.2874,
      "num_input_tokens_seen": 33982788560,
      "step": 43193
    },
    {
      "epoch": 4.582431572246977,
      "grad_norm": 0.6584753489188132,
      "learning_rate": 3.410711890441511e-05,
      "loss": 1.3049,
      "num_input_tokens_seen": 33983575312,
      "step": 43194
    },
    {
      "epoch": 4.582537661786548,
      "grad_norm": 0.5058494962742404,
      "learning_rate": 3.410647168504305e-05,
      "loss": 1.2577,
      "num_input_tokens_seen": 33984362048,
      "step": 43195
    },
    {
      "epoch": 4.58264375132612,
      "grad_norm": 0.6010000439453675,
      "learning_rate": 3.4105824458633776e-05,
      "loss": 1.3469,
      "num_input_tokens_seen": 33985148768,
      "step": 43196
    },
    {
      "epoch": 4.582749840865691,
      "grad_norm": 0.6749909051811669,
      "learning_rate": 3.410517722518777e-05,
      "loss": 1.2676,
      "num_input_tokens_seen": 33985935504,
      "step": 43197
    },
    {
      "epoch": 4.5828559304052625,
      "grad_norm": 0.5710827154727114,
      "learning_rate": 3.410452998470557e-05,
      "loss": 1.3746,
      "num_input_tokens_seen": 33986722288,
      "step": 43198
    },
    {
      "epoch": 4.5829620199448335,
      "grad_norm": 0.6264265384681961,
      "learning_rate": 3.410388273718764e-05,
      "loss": 1.2908,
      "num_input_tokens_seen": 33987509104,
      "step": 43199
    },
    {
      "epoch": 4.583068109484405,
      "grad_norm": 0.665102045945615,
      "learning_rate": 3.4103235482634506e-05,
      "loss": 1.38,
      "num_input_tokens_seen": 33988295792,
      "step": 43200
    },
    {
      "epoch": 4.5831741990239765,
      "grad_norm": 0.5537300183856185,
      "learning_rate": 3.410258822104666e-05,
      "loss": 1.3764,
      "num_input_tokens_seen": 33989082512,
      "step": 43201
    },
    {
      "epoch": 4.5832802885635475,
      "grad_norm": 0.4814347913998883,
      "learning_rate": 3.41019409524246e-05,
      "loss": 1.2249,
      "num_input_tokens_seen": 33989869232,
      "step": 43202
    },
    {
      "epoch": 4.583386378103119,
      "grad_norm": 0.8571754418466584,
      "learning_rate": 3.410129367676882e-05,
      "loss": 1.3187,
      "num_input_tokens_seen": 33990656032,
      "step": 43203
    },
    {
      "epoch": 4.5834924676426905,
      "grad_norm": 0.5572191053397639,
      "learning_rate": 3.410064639407983e-05,
      "loss": 1.4301,
      "num_input_tokens_seen": 33991442816,
      "step": 43204
    },
    {
      "epoch": 4.5835985571822615,
      "grad_norm": 0.7266229786772743,
      "learning_rate": 3.4099999104358124e-05,
      "loss": 1.3659,
      "num_input_tokens_seen": 33992229600,
      "step": 43205
    },
    {
      "epoch": 4.583704646721833,
      "grad_norm": 0.6577113107501268,
      "learning_rate": 3.409935180760422e-05,
      "loss": 1.3369,
      "num_input_tokens_seen": 33993016384,
      "step": 43206
    },
    {
      "epoch": 4.5838107362614045,
      "grad_norm": 0.5064458989937856,
      "learning_rate": 3.4098704503818596e-05,
      "loss": 1.2771,
      "num_input_tokens_seen": 33993803072,
      "step": 43207
    },
    {
      "epoch": 4.583916825800976,
      "grad_norm": 0.5783425807591552,
      "learning_rate": 3.4098057193001756e-05,
      "loss": 1.2944,
      "num_input_tokens_seen": 33994589776,
      "step": 43208
    },
    {
      "epoch": 4.584022915340547,
      "grad_norm": 0.43047169993594286,
      "learning_rate": 3.4097409875154205e-05,
      "loss": 1.2384,
      "num_input_tokens_seen": 33995376592,
      "step": 43209
    },
    {
      "epoch": 4.584129004880118,
      "grad_norm": 0.5690841395173378,
      "learning_rate": 3.409676255027645e-05,
      "loss": 1.2364,
      "num_input_tokens_seen": 33996163408,
      "step": 43210
    },
    {
      "epoch": 4.58423509441969,
      "grad_norm": 0.491848605013086,
      "learning_rate": 3.409611521836897e-05,
      "loss": 1.3089,
      "num_input_tokens_seen": 33996950224,
      "step": 43211
    },
    {
      "epoch": 4.584341183959261,
      "grad_norm": 0.4517877847060061,
      "learning_rate": 3.40954678794323e-05,
      "loss": 1.3125,
      "num_input_tokens_seen": 33997736960,
      "step": 43212
    },
    {
      "epoch": 4.584447273498833,
      "grad_norm": 0.5109187350902382,
      "learning_rate": 3.4094820533466906e-05,
      "loss": 1.3117,
      "num_input_tokens_seen": 33998523648,
      "step": 43213
    },
    {
      "epoch": 4.584553363038404,
      "grad_norm": 0.5926477471206498,
      "learning_rate": 3.40941731804733e-05,
      "loss": 1.3309,
      "num_input_tokens_seen": 33999310496,
      "step": 43214
    },
    {
      "epoch": 4.584659452577975,
      "grad_norm": 0.6279640494869854,
      "learning_rate": 3.4093525820451986e-05,
      "loss": 1.3637,
      "num_input_tokens_seen": 34000097216,
      "step": 43215
    },
    {
      "epoch": 4.584765542117547,
      "grad_norm": 0.5667104001329628,
      "learning_rate": 3.409287845340346e-05,
      "loss": 1.3432,
      "num_input_tokens_seen": 34000883920,
      "step": 43216
    },
    {
      "epoch": 4.584871631657118,
      "grad_norm": 0.5074121552975778,
      "learning_rate": 3.409223107932823e-05,
      "loss": 1.1435,
      "num_input_tokens_seen": 34001670720,
      "step": 43217
    },
    {
      "epoch": 4.58497772119669,
      "grad_norm": 0.5099483949532162,
      "learning_rate": 3.409158369822678e-05,
      "loss": 1.3117,
      "num_input_tokens_seen": 34002457536,
      "step": 43218
    },
    {
      "epoch": 4.585083810736261,
      "grad_norm": 0.5741284110191308,
      "learning_rate": 3.409093631009963e-05,
      "loss": 1.3281,
      "num_input_tokens_seen": 34003244224,
      "step": 43219
    },
    {
      "epoch": 4.585189900275833,
      "grad_norm": 0.5967107512410346,
      "learning_rate": 3.4090288914947265e-05,
      "loss": 1.3132,
      "num_input_tokens_seen": 34004030992,
      "step": 43220
    },
    {
      "epoch": 4.585295989815404,
      "grad_norm": 0.6470247756026092,
      "learning_rate": 3.4089641512770204e-05,
      "loss": 1.3473,
      "num_input_tokens_seen": 34004817760,
      "step": 43221
    },
    {
      "epoch": 4.585402079354975,
      "grad_norm": 0.5572343084730458,
      "learning_rate": 3.408899410356893e-05,
      "loss": 1.2222,
      "num_input_tokens_seen": 34005604640,
      "step": 43222
    },
    {
      "epoch": 4.585508168894547,
      "grad_norm": 0.5237585888602715,
      "learning_rate": 3.408834668734394e-05,
      "loss": 1.3201,
      "num_input_tokens_seen": 34006391456,
      "step": 43223
    },
    {
      "epoch": 4.585614258434118,
      "grad_norm": 0.5632877638444541,
      "learning_rate": 3.4087699264095745e-05,
      "loss": 1.3044,
      "num_input_tokens_seen": 34007178272,
      "step": 43224
    },
    {
      "epoch": 4.58572034797369,
      "grad_norm": 0.4957615923615876,
      "learning_rate": 3.408705183382485e-05,
      "loss": 1.3218,
      "num_input_tokens_seen": 34007965120,
      "step": 43225
    },
    {
      "epoch": 4.585826437513261,
      "grad_norm": 0.5771060506220517,
      "learning_rate": 3.408640439653174e-05,
      "loss": 1.1736,
      "num_input_tokens_seen": 34008751920,
      "step": 43226
    },
    {
      "epoch": 4.585932527052833,
      "grad_norm": 0.6654633408295849,
      "learning_rate": 3.408575695221693e-05,
      "loss": 1.2525,
      "num_input_tokens_seen": 34009538704,
      "step": 43227
    },
    {
      "epoch": 4.586038616592404,
      "grad_norm": 0.5143882056638871,
      "learning_rate": 3.408510950088091e-05,
      "loss": 1.3774,
      "num_input_tokens_seen": 34010325392,
      "step": 43228
    },
    {
      "epoch": 4.586144706131975,
      "grad_norm": 0.5010724734703056,
      "learning_rate": 3.4084462042524176e-05,
      "loss": 1.3089,
      "num_input_tokens_seen": 34011112192,
      "step": 43229
    },
    {
      "epoch": 4.586250795671547,
      "grad_norm": 0.6351170174303172,
      "learning_rate": 3.408381457714725e-05,
      "loss": 1.3919,
      "num_input_tokens_seen": 34011898976,
      "step": 43230
    },
    {
      "epoch": 4.586356885211118,
      "grad_norm": 0.4676081327124835,
      "learning_rate": 3.408316710475061e-05,
      "loss": 1.1739,
      "num_input_tokens_seen": 34012685792,
      "step": 43231
    },
    {
      "epoch": 4.58646297475069,
      "grad_norm": 0.5749515736458864,
      "learning_rate": 3.408251962533477e-05,
      "loss": 1.3363,
      "num_input_tokens_seen": 34013472544,
      "step": 43232
    },
    {
      "epoch": 4.586569064290261,
      "grad_norm": 0.49057616781761315,
      "learning_rate": 3.408187213890022e-05,
      "loss": 1.2582,
      "num_input_tokens_seen": 34014259392,
      "step": 43233
    },
    {
      "epoch": 4.586675153829832,
      "grad_norm": 0.49303884099139567,
      "learning_rate": 3.408122464544747e-05,
      "loss": 1.2888,
      "num_input_tokens_seen": 34015046160,
      "step": 43234
    },
    {
      "epoch": 4.586781243369404,
      "grad_norm": 0.517993355558861,
      "learning_rate": 3.408057714497702e-05,
      "loss": 1.2777,
      "num_input_tokens_seen": 34015832992,
      "step": 43235
    },
    {
      "epoch": 4.586887332908975,
      "grad_norm": 0.46823352115665723,
      "learning_rate": 3.407992963748936e-05,
      "loss": 1.3162,
      "num_input_tokens_seen": 34016619696,
      "step": 43236
    },
    {
      "epoch": 4.586993422448547,
      "grad_norm": 0.5105243889354848,
      "learning_rate": 3.407928212298499e-05,
      "loss": 1.3648,
      "num_input_tokens_seen": 34017406384,
      "step": 43237
    },
    {
      "epoch": 4.587099511988118,
      "grad_norm": 0.5074266977960812,
      "learning_rate": 3.407863460146443e-05,
      "loss": 1.2582,
      "num_input_tokens_seen": 34018193184,
      "step": 43238
    },
    {
      "epoch": 4.587205601527689,
      "grad_norm": 0.6128979843735336,
      "learning_rate": 3.407798707292816e-05,
      "loss": 1.2943,
      "num_input_tokens_seen": 34018979984,
      "step": 43239
    },
    {
      "epoch": 4.587311691067261,
      "grad_norm": 0.543732149672563,
      "learning_rate": 3.407733953737669e-05,
      "loss": 1.3415,
      "num_input_tokens_seen": 34019766672,
      "step": 43240
    },
    {
      "epoch": 4.587417780606832,
      "grad_norm": 0.6966993144735139,
      "learning_rate": 3.4076691994810524e-05,
      "loss": 1.2525,
      "num_input_tokens_seen": 34020553504,
      "step": 43241
    },
    {
      "epoch": 4.587523870146404,
      "grad_norm": 0.5819052511106635,
      "learning_rate": 3.407604444523015e-05,
      "loss": 1.3634,
      "num_input_tokens_seen": 34021340176,
      "step": 43242
    },
    {
      "epoch": 4.587629959685975,
      "grad_norm": 0.5714868743354425,
      "learning_rate": 3.407539688863607e-05,
      "loss": 1.3868,
      "num_input_tokens_seen": 34022126944,
      "step": 43243
    },
    {
      "epoch": 4.587736049225546,
      "grad_norm": 0.6066390524667425,
      "learning_rate": 3.4074749325028804e-05,
      "loss": 1.4023,
      "num_input_tokens_seen": 34022913728,
      "step": 43244
    },
    {
      "epoch": 4.587842138765118,
      "grad_norm": 0.4587132189346741,
      "learning_rate": 3.407410175440883e-05,
      "loss": 1.2842,
      "num_input_tokens_seen": 34023700464,
      "step": 43245
    },
    {
      "epoch": 4.587948228304689,
      "grad_norm": 0.5391219191136599,
      "learning_rate": 3.4073454176776656e-05,
      "loss": 1.3863,
      "num_input_tokens_seen": 34024487184,
      "step": 43246
    },
    {
      "epoch": 4.588054317844261,
      "grad_norm": 0.5882266188181184,
      "learning_rate": 3.407280659213278e-05,
      "loss": 1.3085,
      "num_input_tokens_seen": 34025273920,
      "step": 43247
    },
    {
      "epoch": 4.588160407383832,
      "grad_norm": 0.5311921501176138,
      "learning_rate": 3.407215900047771e-05,
      "loss": 1.3259,
      "num_input_tokens_seen": 34026060656,
      "step": 43248
    },
    {
      "epoch": 4.588266496923404,
      "grad_norm": 0.4950673252585547,
      "learning_rate": 3.407151140181194e-05,
      "loss": 1.3624,
      "num_input_tokens_seen": 34026847376,
      "step": 43249
    },
    {
      "epoch": 4.588372586462975,
      "grad_norm": 0.7296291017236041,
      "learning_rate": 3.4070863796135976e-05,
      "loss": 1.3856,
      "num_input_tokens_seen": 34027634304,
      "step": 43250
    },
    {
      "epoch": 4.588478676002546,
      "grad_norm": 0.4670686167219482,
      "learning_rate": 3.407021618345031e-05,
      "loss": 1.2812,
      "num_input_tokens_seen": 34028421024,
      "step": 43251
    },
    {
      "epoch": 4.588584765542118,
      "grad_norm": 0.5502982414597961,
      "learning_rate": 3.406956856375545e-05,
      "loss": 1.2694,
      "num_input_tokens_seen": 34029207744,
      "step": 43252
    },
    {
      "epoch": 4.588690855081689,
      "grad_norm": 0.5051471017464516,
      "learning_rate": 3.40689209370519e-05,
      "loss": 1.284,
      "num_input_tokens_seen": 34029994496,
      "step": 43253
    },
    {
      "epoch": 4.588796944621261,
      "grad_norm": 0.5024975975118103,
      "learning_rate": 3.406827330334014e-05,
      "loss": 1.2573,
      "num_input_tokens_seen": 34030781312,
      "step": 43254
    },
    {
      "epoch": 4.588903034160832,
      "grad_norm": 0.5926229727121866,
      "learning_rate": 3.406762566262069e-05,
      "loss": 1.2985,
      "num_input_tokens_seen": 34031568048,
      "step": 43255
    },
    {
      "epoch": 4.589009123700404,
      "grad_norm": 0.7742674862375674,
      "learning_rate": 3.406697801489405e-05,
      "loss": 1.34,
      "num_input_tokens_seen": 34032354768,
      "step": 43256
    },
    {
      "epoch": 4.589115213239975,
      "grad_norm": 0.7070483884515,
      "learning_rate": 3.4066330360160704e-05,
      "loss": 1.3997,
      "num_input_tokens_seen": 34033141584,
      "step": 43257
    },
    {
      "epoch": 4.589221302779546,
      "grad_norm": 0.7844016275764777,
      "learning_rate": 3.406568269842118e-05,
      "loss": 1.3235,
      "num_input_tokens_seen": 34033928384,
      "step": 43258
    },
    {
      "epoch": 4.589327392319118,
      "grad_norm": 0.534392057164188,
      "learning_rate": 3.406503502967595e-05,
      "loss": 1.324,
      "num_input_tokens_seen": 34034715152,
      "step": 43259
    },
    {
      "epoch": 4.589433481858689,
      "grad_norm": 0.691224230693314,
      "learning_rate": 3.4064387353925524e-05,
      "loss": 1.3141,
      "num_input_tokens_seen": 34035501968,
      "step": 43260
    },
    {
      "epoch": 4.5895395713982605,
      "grad_norm": 0.7488914192041392,
      "learning_rate": 3.406373967117041e-05,
      "loss": 1.3406,
      "num_input_tokens_seen": 34036288704,
      "step": 43261
    },
    {
      "epoch": 4.5896456609378316,
      "grad_norm": 0.6512801419860069,
      "learning_rate": 3.406309198141111e-05,
      "loss": 1.3884,
      "num_input_tokens_seen": 34037075488,
      "step": 43262
    },
    {
      "epoch": 4.589751750477403,
      "grad_norm": 0.7482330992082719,
      "learning_rate": 3.406244428464811e-05,
      "loss": 1.3677,
      "num_input_tokens_seen": 34037862192,
      "step": 43263
    },
    {
      "epoch": 4.5898578400169745,
      "grad_norm": 0.627417958004983,
      "learning_rate": 3.406179658088193e-05,
      "loss": 1.2855,
      "num_input_tokens_seen": 34038649024,
      "step": 43264
    },
    {
      "epoch": 4.5899639295565455,
      "grad_norm": 0.703987395848663,
      "learning_rate": 3.4061148870113046e-05,
      "loss": 1.2385,
      "num_input_tokens_seen": 34039435824,
      "step": 43265
    },
    {
      "epoch": 4.5900700190961174,
      "grad_norm": 0.4795075919759512,
      "learning_rate": 3.406050115234197e-05,
      "loss": 1.3203,
      "num_input_tokens_seen": 34040222560,
      "step": 43266
    },
    {
      "epoch": 4.5901761086356885,
      "grad_norm": 0.675958751318291,
      "learning_rate": 3.405985342756922e-05,
      "loss": 1.2587,
      "num_input_tokens_seen": 34041009360,
      "step": 43267
    },
    {
      "epoch": 4.5902821981752595,
      "grad_norm": 0.712184633316804,
      "learning_rate": 3.405920569579528e-05,
      "loss": 1.27,
      "num_input_tokens_seen": 34041796064,
      "step": 43268
    },
    {
      "epoch": 4.590388287714831,
      "grad_norm": 0.6785012112315902,
      "learning_rate": 3.405855795702064e-05,
      "loss": 1.354,
      "num_input_tokens_seen": 34042582768,
      "step": 43269
    },
    {
      "epoch": 4.5904943772544025,
      "grad_norm": 0.6068365787526949,
      "learning_rate": 3.405791021124582e-05,
      "loss": 1.3566,
      "num_input_tokens_seen": 34043369648,
      "step": 43270
    },
    {
      "epoch": 4.590600466793974,
      "grad_norm": 0.7487538716446283,
      "learning_rate": 3.4057262458471314e-05,
      "loss": 1.3257,
      "num_input_tokens_seen": 34044156272,
      "step": 43271
    },
    {
      "epoch": 4.590706556333545,
      "grad_norm": 0.5854173512268437,
      "learning_rate": 3.405661469869761e-05,
      "loss": 1.3513,
      "num_input_tokens_seen": 34044943024,
      "step": 43272
    },
    {
      "epoch": 4.590812645873116,
      "grad_norm": 0.5186270159836243,
      "learning_rate": 3.405596693192523e-05,
      "loss": 1.269,
      "num_input_tokens_seen": 34045729808,
      "step": 43273
    },
    {
      "epoch": 4.590918735412688,
      "grad_norm": 0.726400907930052,
      "learning_rate": 3.405531915815466e-05,
      "loss": 1.2792,
      "num_input_tokens_seen": 34046516592,
      "step": 43274
    },
    {
      "epoch": 4.591024824952259,
      "grad_norm": 0.6399925618054338,
      "learning_rate": 3.405467137738641e-05,
      "loss": 1.3235,
      "num_input_tokens_seen": 34047303376,
      "step": 43275
    },
    {
      "epoch": 4.591130914491831,
      "grad_norm": 0.4981605809381706,
      "learning_rate": 3.4054023589620975e-05,
      "loss": 1.3359,
      "num_input_tokens_seen": 34048090096,
      "step": 43276
    },
    {
      "epoch": 4.591237004031402,
      "grad_norm": 0.5178943246437518,
      "learning_rate": 3.405337579485885e-05,
      "loss": 1.2912,
      "num_input_tokens_seen": 34048876912,
      "step": 43277
    },
    {
      "epoch": 4.591343093570974,
      "grad_norm": 0.533589504343563,
      "learning_rate": 3.405272799310055e-05,
      "loss": 1.3166,
      "num_input_tokens_seen": 34049663712,
      "step": 43278
    },
    {
      "epoch": 4.591449183110545,
      "grad_norm": 0.5317699539404037,
      "learning_rate": 3.405208018434656e-05,
      "loss": 1.3494,
      "num_input_tokens_seen": 34050450528,
      "step": 43279
    },
    {
      "epoch": 4.591555272650116,
      "grad_norm": 0.5853663269698682,
      "learning_rate": 3.405143236859739e-05,
      "loss": 1.3575,
      "num_input_tokens_seen": 34051237328,
      "step": 43280
    },
    {
      "epoch": 4.591661362189688,
      "grad_norm": 0.461991015029655,
      "learning_rate": 3.405078454585354e-05,
      "loss": 1.3819,
      "num_input_tokens_seen": 34052024000,
      "step": 43281
    },
    {
      "epoch": 4.591767451729259,
      "grad_norm": 0.4984812079250436,
      "learning_rate": 3.4050136716115514e-05,
      "loss": 1.3096,
      "num_input_tokens_seen": 34052810816,
      "step": 43282
    },
    {
      "epoch": 4.591873541268831,
      "grad_norm": 0.4874423684659487,
      "learning_rate": 3.40494888793838e-05,
      "loss": 1.2762,
      "num_input_tokens_seen": 34053597632,
      "step": 43283
    },
    {
      "epoch": 4.591979630808402,
      "grad_norm": 0.5020669567731642,
      "learning_rate": 3.404884103565891e-05,
      "loss": 1.2544,
      "num_input_tokens_seen": 34054384416,
      "step": 43284
    },
    {
      "epoch": 4.592085720347974,
      "grad_norm": 0.5379657974648239,
      "learning_rate": 3.404819318494135e-05,
      "loss": 1.3478,
      "num_input_tokens_seen": 34055171216,
      "step": 43285
    },
    {
      "epoch": 4.592191809887545,
      "grad_norm": 0.5560952245696495,
      "learning_rate": 3.40475453272316e-05,
      "loss": 1.3848,
      "num_input_tokens_seen": 34055957920,
      "step": 43286
    },
    {
      "epoch": 4.592297899427116,
      "grad_norm": 0.5194777639711778,
      "learning_rate": 3.4046897462530174e-05,
      "loss": 1.3063,
      "num_input_tokens_seen": 34056744720,
      "step": 43287
    },
    {
      "epoch": 4.592403988966688,
      "grad_norm": 0.5747891504158485,
      "learning_rate": 3.404624959083757e-05,
      "loss": 1.3868,
      "num_input_tokens_seen": 34057531472,
      "step": 43288
    },
    {
      "epoch": 4.592510078506259,
      "grad_norm": 0.5409050681396695,
      "learning_rate": 3.4045601712154295e-05,
      "loss": 1.3571,
      "num_input_tokens_seen": 34058318256,
      "step": 43289
    },
    {
      "epoch": 4.592616168045831,
      "grad_norm": 0.5334370389202798,
      "learning_rate": 3.404495382648084e-05,
      "loss": 1.3404,
      "num_input_tokens_seen": 34059105072,
      "step": 43290
    },
    {
      "epoch": 4.592722257585402,
      "grad_norm": 0.6055756020304175,
      "learning_rate": 3.404430593381771e-05,
      "loss": 1.3224,
      "num_input_tokens_seen": 34059891888,
      "step": 43291
    },
    {
      "epoch": 4.592828347124973,
      "grad_norm": 0.47739757809322914,
      "learning_rate": 3.404365803416541e-05,
      "loss": 1.2619,
      "num_input_tokens_seen": 34060678592,
      "step": 43292
    },
    {
      "epoch": 4.592934436664545,
      "grad_norm": 0.572495376855384,
      "learning_rate": 3.4043010127524435e-05,
      "loss": 1.3135,
      "num_input_tokens_seen": 34061465392,
      "step": 43293
    },
    {
      "epoch": 4.593040526204116,
      "grad_norm": 0.7826250959405638,
      "learning_rate": 3.404236221389529e-05,
      "loss": 1.2745,
      "num_input_tokens_seen": 34062252224,
      "step": 43294
    },
    {
      "epoch": 4.593146615743688,
      "grad_norm": 0.49440897249105514,
      "learning_rate": 3.4041714293278464e-05,
      "loss": 1.2397,
      "num_input_tokens_seen": 34063038992,
      "step": 43295
    },
    {
      "epoch": 4.593252705283259,
      "grad_norm": 0.6900836500501291,
      "learning_rate": 3.404106636567447e-05,
      "loss": 1.2413,
      "num_input_tokens_seen": 34063825776,
      "step": 43296
    },
    {
      "epoch": 4.59335879482283,
      "grad_norm": 0.6322390230779052,
      "learning_rate": 3.404041843108381e-05,
      "loss": 1.3479,
      "num_input_tokens_seen": 34064612560,
      "step": 43297
    },
    {
      "epoch": 4.593464884362402,
      "grad_norm": 0.5487038451972837,
      "learning_rate": 3.403977048950697e-05,
      "loss": 1.301,
      "num_input_tokens_seen": 34065399392,
      "step": 43298
    },
    {
      "epoch": 4.593570973901973,
      "grad_norm": 0.7007114670503442,
      "learning_rate": 3.403912254094447e-05,
      "loss": 1.3174,
      "num_input_tokens_seen": 34066186160,
      "step": 43299
    },
    {
      "epoch": 4.593677063441545,
      "grad_norm": 0.6199914257286555,
      "learning_rate": 3.4038474585396794e-05,
      "loss": 1.3315,
      "num_input_tokens_seen": 34066972928,
      "step": 43300
    },
    {
      "epoch": 4.593783152981116,
      "grad_norm": 0.5886627586326195,
      "learning_rate": 3.403782662286446e-05,
      "loss": 1.2906,
      "num_input_tokens_seen": 34067759648,
      "step": 43301
    },
    {
      "epoch": 4.593889242520687,
      "grad_norm": 0.5396007526317373,
      "learning_rate": 3.4037178653347954e-05,
      "loss": 1.2623,
      "num_input_tokens_seen": 34068546432,
      "step": 43302
    },
    {
      "epoch": 4.593995332060259,
      "grad_norm": 0.5033342179321606,
      "learning_rate": 3.403653067684778e-05,
      "loss": 1.2684,
      "num_input_tokens_seen": 34069333232,
      "step": 43303
    },
    {
      "epoch": 4.59410142159983,
      "grad_norm": 0.6381855218992406,
      "learning_rate": 3.403588269336444e-05,
      "loss": 1.2701,
      "num_input_tokens_seen": 34070120080,
      "step": 43304
    },
    {
      "epoch": 4.594207511139402,
      "grad_norm": 0.4953726995086582,
      "learning_rate": 3.403523470289844e-05,
      "loss": 1.2463,
      "num_input_tokens_seen": 34070906848,
      "step": 43305
    },
    {
      "epoch": 4.594313600678973,
      "grad_norm": 0.6493162018719382,
      "learning_rate": 3.403458670545027e-05,
      "loss": 1.4209,
      "num_input_tokens_seen": 34071693616,
      "step": 43306
    },
    {
      "epoch": 4.594419690218545,
      "grad_norm": 0.47966676923441764,
      "learning_rate": 3.403393870102044e-05,
      "loss": 1.2561,
      "num_input_tokens_seen": 34072480400,
      "step": 43307
    },
    {
      "epoch": 4.594525779758116,
      "grad_norm": 0.6472018580068024,
      "learning_rate": 3.403329068960944e-05,
      "loss": 1.2906,
      "num_input_tokens_seen": 34073267168,
      "step": 43308
    },
    {
      "epoch": 4.594631869297688,
      "grad_norm": 0.5074848230280733,
      "learning_rate": 3.4032642671217786e-05,
      "loss": 1.2887,
      "num_input_tokens_seen": 34074054096,
      "step": 43309
    },
    {
      "epoch": 4.594737958837259,
      "grad_norm": 0.5840675670403731,
      "learning_rate": 3.4031994645845965e-05,
      "loss": 1.4001,
      "num_input_tokens_seen": 34074840736,
      "step": 43310
    },
    {
      "epoch": 4.59484404837683,
      "grad_norm": 0.7356113267900537,
      "learning_rate": 3.4031346613494484e-05,
      "loss": 1.3047,
      "num_input_tokens_seen": 34075627504,
      "step": 43311
    },
    {
      "epoch": 4.594950137916402,
      "grad_norm": 0.611558760653544,
      "learning_rate": 3.403069857416385e-05,
      "loss": 1.3905,
      "num_input_tokens_seen": 34076414288,
      "step": 43312
    },
    {
      "epoch": 4.595056227455973,
      "grad_norm": 0.6287963433686599,
      "learning_rate": 3.403005052785455e-05,
      "loss": 1.3298,
      "num_input_tokens_seen": 34077201040,
      "step": 43313
    },
    {
      "epoch": 4.595162316995545,
      "grad_norm": 0.5845016113279775,
      "learning_rate": 3.40294024745671e-05,
      "loss": 1.2704,
      "num_input_tokens_seen": 34077987840,
      "step": 43314
    },
    {
      "epoch": 4.595268406535116,
      "grad_norm": 0.5695497726383364,
      "learning_rate": 3.4028754414301984e-05,
      "loss": 1.2939,
      "num_input_tokens_seen": 34078774528,
      "step": 43315
    },
    {
      "epoch": 4.595374496074687,
      "grad_norm": 0.9164266285134737,
      "learning_rate": 3.402810634705971e-05,
      "loss": 1.3427,
      "num_input_tokens_seen": 34079561280,
      "step": 43316
    },
    {
      "epoch": 4.595480585614259,
      "grad_norm": 0.5371564034143429,
      "learning_rate": 3.4027458272840796e-05,
      "loss": 1.308,
      "num_input_tokens_seen": 34080348032,
      "step": 43317
    },
    {
      "epoch": 4.59558667515383,
      "grad_norm": 0.663093592227202,
      "learning_rate": 3.402681019164571e-05,
      "loss": 1.3154,
      "num_input_tokens_seen": 34081134864,
      "step": 43318
    },
    {
      "epoch": 4.595692764693402,
      "grad_norm": 0.7537914061287138,
      "learning_rate": 3.402616210347498e-05,
      "loss": 1.2355,
      "num_input_tokens_seen": 34081921520,
      "step": 43319
    },
    {
      "epoch": 4.595798854232973,
      "grad_norm": 0.5231148142704944,
      "learning_rate": 3.4025514008329085e-05,
      "loss": 1.2665,
      "num_input_tokens_seen": 34082708256,
      "step": 43320
    },
    {
      "epoch": 4.595904943772544,
      "grad_norm": 0.7055415733801003,
      "learning_rate": 3.402486590620855e-05,
      "loss": 1.3208,
      "num_input_tokens_seen": 34083495040,
      "step": 43321
    },
    {
      "epoch": 4.596011033312116,
      "grad_norm": 0.7744398701408628,
      "learning_rate": 3.402421779711386e-05,
      "loss": 1.3326,
      "num_input_tokens_seen": 34084281840,
      "step": 43322
    },
    {
      "epoch": 4.596117122851687,
      "grad_norm": 0.5557334813389424,
      "learning_rate": 3.402356968104552e-05,
      "loss": 1.3808,
      "num_input_tokens_seen": 34085068592,
      "step": 43323
    },
    {
      "epoch": 4.5962232123912585,
      "grad_norm": 0.6067159172015637,
      "learning_rate": 3.402292155800403e-05,
      "loss": 1.3228,
      "num_input_tokens_seen": 34085855296,
      "step": 43324
    },
    {
      "epoch": 4.59632930193083,
      "grad_norm": 0.6913974208511875,
      "learning_rate": 3.402227342798989e-05,
      "loss": 1.4192,
      "num_input_tokens_seen": 34086642096,
      "step": 43325
    },
    {
      "epoch": 4.596435391470401,
      "grad_norm": 0.655910497866946,
      "learning_rate": 3.40216252910036e-05,
      "loss": 1.2979,
      "num_input_tokens_seen": 34087428864,
      "step": 43326
    },
    {
      "epoch": 4.5965414810099725,
      "grad_norm": 0.5609104044605617,
      "learning_rate": 3.402097714704566e-05,
      "loss": 1.3246,
      "num_input_tokens_seen": 34088215648,
      "step": 43327
    },
    {
      "epoch": 4.5966475705495435,
      "grad_norm": 0.6474260953435137,
      "learning_rate": 3.402032899611659e-05,
      "loss": 1.3684,
      "num_input_tokens_seen": 34089002416,
      "step": 43328
    },
    {
      "epoch": 4.5967536600891155,
      "grad_norm": 0.7243271502298658,
      "learning_rate": 3.401968083821685e-05,
      "loss": 1.3816,
      "num_input_tokens_seen": 34089789184,
      "step": 43329
    },
    {
      "epoch": 4.5968597496286865,
      "grad_norm": 0.599864958349581,
      "learning_rate": 3.4019032673346986e-05,
      "loss": 1.289,
      "num_input_tokens_seen": 34090576064,
      "step": 43330
    },
    {
      "epoch": 4.5969658391682575,
      "grad_norm": 0.6574814576942245,
      "learning_rate": 3.401838450150747e-05,
      "loss": 1.3327,
      "num_input_tokens_seen": 34091362832,
      "step": 43331
    },
    {
      "epoch": 4.597071928707829,
      "grad_norm": 0.6346002891599839,
      "learning_rate": 3.401773632269881e-05,
      "loss": 1.3336,
      "num_input_tokens_seen": 34092149728,
      "step": 43332
    },
    {
      "epoch": 4.5971780182474005,
      "grad_norm": 0.6766082200372696,
      "learning_rate": 3.4017088136921504e-05,
      "loss": 1.3128,
      "num_input_tokens_seen": 34092936464,
      "step": 43333
    },
    {
      "epoch": 4.597284107786972,
      "grad_norm": 0.8292602359271001,
      "learning_rate": 3.401643994417606e-05,
      "loss": 1.3843,
      "num_input_tokens_seen": 34093723168,
      "step": 43334
    },
    {
      "epoch": 4.597390197326543,
      "grad_norm": 0.5323158294264142,
      "learning_rate": 3.401579174446298e-05,
      "loss": 1.3334,
      "num_input_tokens_seen": 34094509968,
      "step": 43335
    },
    {
      "epoch": 4.597496286866115,
      "grad_norm": 0.7800245068322632,
      "learning_rate": 3.401514353778276e-05,
      "loss": 1.276,
      "num_input_tokens_seen": 34095296720,
      "step": 43336
    },
    {
      "epoch": 4.597602376405686,
      "grad_norm": 0.5897931027774163,
      "learning_rate": 3.40144953241359e-05,
      "loss": 1.289,
      "num_input_tokens_seen": 34096083408,
      "step": 43337
    },
    {
      "epoch": 4.597708465945258,
      "grad_norm": 0.5559019969816013,
      "learning_rate": 3.40138471035229e-05,
      "loss": 1.3152,
      "num_input_tokens_seen": 34096870208,
      "step": 43338
    },
    {
      "epoch": 4.597814555484829,
      "grad_norm": 0.6364995795483832,
      "learning_rate": 3.401319887594427e-05,
      "loss": 1.3738,
      "num_input_tokens_seen": 34097656976,
      "step": 43339
    },
    {
      "epoch": 4.5979206450244,
      "grad_norm": 0.5227429968493106,
      "learning_rate": 3.401255064140049e-05,
      "loss": 1.4544,
      "num_input_tokens_seen": 34098443632,
      "step": 43340
    },
    {
      "epoch": 4.598026734563972,
      "grad_norm": 0.5301584116586322,
      "learning_rate": 3.401190239989209e-05,
      "loss": 1.3218,
      "num_input_tokens_seen": 34099230480,
      "step": 43341
    },
    {
      "epoch": 4.598132824103543,
      "grad_norm": 0.6235044339270303,
      "learning_rate": 3.401125415141955e-05,
      "loss": 1.3482,
      "num_input_tokens_seen": 34100017280,
      "step": 43342
    },
    {
      "epoch": 4.598238913643115,
      "grad_norm": 0.466493303813702,
      "learning_rate": 3.4010605895983384e-05,
      "loss": 1.2927,
      "num_input_tokens_seen": 34100804000,
      "step": 43343
    },
    {
      "epoch": 4.598345003182686,
      "grad_norm": 0.6708438867785055,
      "learning_rate": 3.400995763358408e-05,
      "loss": 1.3399,
      "num_input_tokens_seen": 34101590720,
      "step": 43344
    },
    {
      "epoch": 4.598451092722257,
      "grad_norm": 0.6025521025106816,
      "learning_rate": 3.4009309364222146e-05,
      "loss": 1.4009,
      "num_input_tokens_seen": 34102377504,
      "step": 43345
    },
    {
      "epoch": 4.598557182261829,
      "grad_norm": 0.6815404096970793,
      "learning_rate": 3.400866108789808e-05,
      "loss": 1.346,
      "num_input_tokens_seen": 34103164288,
      "step": 43346
    },
    {
      "epoch": 4.5986632718014,
      "grad_norm": 0.7715295496355363,
      "learning_rate": 3.400801280461239e-05,
      "loss": 1.3141,
      "num_input_tokens_seen": 34103951104,
      "step": 43347
    },
    {
      "epoch": 4.598769361340972,
      "grad_norm": 0.9486268852456229,
      "learning_rate": 3.400736451436557e-05,
      "loss": 1.2443,
      "num_input_tokens_seen": 34104737904,
      "step": 43348
    },
    {
      "epoch": 4.598875450880543,
      "grad_norm": 0.4747030723886644,
      "learning_rate": 3.400671621715812e-05,
      "loss": 1.2795,
      "num_input_tokens_seen": 34105524704,
      "step": 43349
    },
    {
      "epoch": 4.598981540420114,
      "grad_norm": 0.9692872595020963,
      "learning_rate": 3.4006067912990545e-05,
      "loss": 1.2617,
      "num_input_tokens_seen": 34106311520,
      "step": 43350
    },
    {
      "epoch": 4.599087629959686,
      "grad_norm": 0.6131228810705027,
      "learning_rate": 3.4005419601863343e-05,
      "loss": 1.294,
      "num_input_tokens_seen": 34107098272,
      "step": 43351
    },
    {
      "epoch": 4.599193719499257,
      "grad_norm": 0.6696192323350092,
      "learning_rate": 3.400477128377703e-05,
      "loss": 1.3706,
      "num_input_tokens_seen": 34107885024,
      "step": 43352
    },
    {
      "epoch": 4.599299809038829,
      "grad_norm": 0.9978172051602431,
      "learning_rate": 3.400412295873208e-05,
      "loss": 1.3703,
      "num_input_tokens_seen": 34108671824,
      "step": 43353
    },
    {
      "epoch": 4.5994058985784,
      "grad_norm": 0.6235575891651577,
      "learning_rate": 3.400347462672901e-05,
      "loss": 1.3938,
      "num_input_tokens_seen": 34109458672,
      "step": 43354
    },
    {
      "epoch": 4.599511988117971,
      "grad_norm": 0.5792400226492022,
      "learning_rate": 3.400282628776832e-05,
      "loss": 1.296,
      "num_input_tokens_seen": 34110245504,
      "step": 43355
    },
    {
      "epoch": 4.599618077657543,
      "grad_norm": 0.829996987736337,
      "learning_rate": 3.400217794185051e-05,
      "loss": 1.3415,
      "num_input_tokens_seen": 34111032288,
      "step": 43356
    },
    {
      "epoch": 4.599724167197114,
      "grad_norm": 0.689606858340722,
      "learning_rate": 3.400152958897608e-05,
      "loss": 1.4698,
      "num_input_tokens_seen": 34111819024,
      "step": 43357
    },
    {
      "epoch": 4.599830256736686,
      "grad_norm": 0.6581566211286204,
      "learning_rate": 3.4000881229145536e-05,
      "loss": 1.4428,
      "num_input_tokens_seen": 34112605824,
      "step": 43358
    },
    {
      "epoch": 4.599936346276257,
      "grad_norm": 0.9262194342307679,
      "learning_rate": 3.400023286235938e-05,
      "loss": 1.3335,
      "num_input_tokens_seen": 34113392512,
      "step": 43359
    },
    {
      "epoch": 4.600042435815829,
      "grad_norm": 0.4906104309466449,
      "learning_rate": 3.39995844886181e-05,
      "loss": 1.2553,
      "num_input_tokens_seen": 34114179248,
      "step": 43360
    },
    {
      "epoch": 4.6001485253554,
      "grad_norm": 0.6128030023489238,
      "learning_rate": 3.39989361079222e-05,
      "loss": 1.3149,
      "num_input_tokens_seen": 34114966048,
      "step": 43361
    },
    {
      "epoch": 4.600254614894971,
      "grad_norm": 0.7638972161634864,
      "learning_rate": 3.399828772027219e-05,
      "loss": 1.3707,
      "num_input_tokens_seen": 34115752848,
      "step": 43362
    },
    {
      "epoch": 4.600360704434543,
      "grad_norm": 0.563400148548009,
      "learning_rate": 3.399763932566857e-05,
      "loss": 1.3463,
      "num_input_tokens_seen": 34116539632,
      "step": 43363
    },
    {
      "epoch": 4.600466793974114,
      "grad_norm": 0.6604018812273083,
      "learning_rate": 3.399699092411184e-05,
      "loss": 1.3815,
      "num_input_tokens_seen": 34117326384,
      "step": 43364
    },
    {
      "epoch": 4.600572883513686,
      "grad_norm": 0.5717665559454612,
      "learning_rate": 3.3996342515602494e-05,
      "loss": 1.2785,
      "num_input_tokens_seen": 34118113200,
      "step": 43365
    },
    {
      "epoch": 4.600678973053257,
      "grad_norm": 0.4970411615472335,
      "learning_rate": 3.399569410014105e-05,
      "loss": 1.2902,
      "num_input_tokens_seen": 34118899936,
      "step": 43366
    },
    {
      "epoch": 4.600785062592829,
      "grad_norm": 0.576451017745944,
      "learning_rate": 3.399504567772799e-05,
      "loss": 1.3828,
      "num_input_tokens_seen": 34119686656,
      "step": 43367
    },
    {
      "epoch": 4.6008911521324,
      "grad_norm": 0.5061055388565793,
      "learning_rate": 3.3994397248363815e-05,
      "loss": 1.28,
      "num_input_tokens_seen": 34120473504,
      "step": 43368
    },
    {
      "epoch": 4.600997241671971,
      "grad_norm": 0.49763796910221175,
      "learning_rate": 3.399374881204904e-05,
      "loss": 1.4438,
      "num_input_tokens_seen": 34121260224,
      "step": 43369
    },
    {
      "epoch": 4.601103331211543,
      "grad_norm": 0.5834785149686214,
      "learning_rate": 3.3993100368784164e-05,
      "loss": 1.2943,
      "num_input_tokens_seen": 34122047024,
      "step": 43370
    },
    {
      "epoch": 4.601209420751114,
      "grad_norm": 0.5265913509978398,
      "learning_rate": 3.399245191856969e-05,
      "loss": 1.2534,
      "num_input_tokens_seen": 34122833792,
      "step": 43371
    },
    {
      "epoch": 4.601315510290686,
      "grad_norm": 0.5116055629425352,
      "learning_rate": 3.39918034614061e-05,
      "loss": 1.2794,
      "num_input_tokens_seen": 34123620544,
      "step": 43372
    },
    {
      "epoch": 4.601421599830257,
      "grad_norm": 0.46294620939749187,
      "learning_rate": 3.3991154997293904e-05,
      "loss": 1.2522,
      "num_input_tokens_seen": 34124407248,
      "step": 43373
    },
    {
      "epoch": 4.601527689369828,
      "grad_norm": 0.6009306747997563,
      "learning_rate": 3.399050652623362e-05,
      "loss": 1.2694,
      "num_input_tokens_seen": 34125194016,
      "step": 43374
    },
    {
      "epoch": 4.6016337789094,
      "grad_norm": 0.4827313799772849,
      "learning_rate": 3.398985804822573e-05,
      "loss": 1.3366,
      "num_input_tokens_seen": 34125980800,
      "step": 43375
    },
    {
      "epoch": 4.601739868448971,
      "grad_norm": 0.5287526786732561,
      "learning_rate": 3.3989209563270745e-05,
      "loss": 1.4151,
      "num_input_tokens_seen": 34126767568,
      "step": 43376
    },
    {
      "epoch": 4.601845957988543,
      "grad_norm": 0.5494975766035176,
      "learning_rate": 3.398856107136916e-05,
      "loss": 1.228,
      "num_input_tokens_seen": 34127554256,
      "step": 43377
    },
    {
      "epoch": 4.601952047528114,
      "grad_norm": 0.5829477732927739,
      "learning_rate": 3.398791257252148e-05,
      "loss": 1.391,
      "num_input_tokens_seen": 34128341040,
      "step": 43378
    },
    {
      "epoch": 4.602058137067685,
      "grad_norm": 0.4959284789356407,
      "learning_rate": 3.3987264066728206e-05,
      "loss": 1.2959,
      "num_input_tokens_seen": 34129127808,
      "step": 43379
    },
    {
      "epoch": 4.602164226607257,
      "grad_norm": 0.5450581593023204,
      "learning_rate": 3.398661555398983e-05,
      "loss": 1.3313,
      "num_input_tokens_seen": 34129914576,
      "step": 43380
    },
    {
      "epoch": 4.602270316146828,
      "grad_norm": 0.548102093422021,
      "learning_rate": 3.398596703430687e-05,
      "loss": 1.3758,
      "num_input_tokens_seen": 34130701296,
      "step": 43381
    },
    {
      "epoch": 4.6023764056864,
      "grad_norm": 0.5562514187752947,
      "learning_rate": 3.398531850767982e-05,
      "loss": 1.3486,
      "num_input_tokens_seen": 34131488064,
      "step": 43382
    },
    {
      "epoch": 4.602482495225971,
      "grad_norm": 0.5359374178461995,
      "learning_rate": 3.398466997410917e-05,
      "loss": 1.3616,
      "num_input_tokens_seen": 34132274768,
      "step": 43383
    },
    {
      "epoch": 4.602588584765542,
      "grad_norm": 0.6891010954946659,
      "learning_rate": 3.3984021433595437e-05,
      "loss": 1.2144,
      "num_input_tokens_seen": 34133061536,
      "step": 43384
    },
    {
      "epoch": 4.602694674305114,
      "grad_norm": 0.5307896119914156,
      "learning_rate": 3.398337288613912e-05,
      "loss": 1.2528,
      "num_input_tokens_seen": 34133848352,
      "step": 43385
    },
    {
      "epoch": 4.602800763844685,
      "grad_norm": 0.5223798830128082,
      "learning_rate": 3.3982724331740706e-05,
      "loss": 1.2389,
      "num_input_tokens_seen": 34134635200,
      "step": 43386
    },
    {
      "epoch": 4.6029068533842565,
      "grad_norm": 0.7820437807966476,
      "learning_rate": 3.398207577040071e-05,
      "loss": 1.3113,
      "num_input_tokens_seen": 34135422016,
      "step": 43387
    },
    {
      "epoch": 4.603012942923828,
      "grad_norm": 0.5203943262575325,
      "learning_rate": 3.398142720211963e-05,
      "loss": 1.4467,
      "num_input_tokens_seen": 34136208704,
      "step": 43388
    },
    {
      "epoch": 4.6031190324633995,
      "grad_norm": 0.7587193257341673,
      "learning_rate": 3.3980778626897966e-05,
      "loss": 1.2828,
      "num_input_tokens_seen": 34136995440,
      "step": 43389
    },
    {
      "epoch": 4.6032251220029705,
      "grad_norm": 0.522217492974551,
      "learning_rate": 3.398013004473623e-05,
      "loss": 1.3419,
      "num_input_tokens_seen": 34137782208,
      "step": 43390
    },
    {
      "epoch": 4.6033312115425415,
      "grad_norm": 0.5703836986662292,
      "learning_rate": 3.3979481455634896e-05,
      "loss": 1.336,
      "num_input_tokens_seen": 34138568976,
      "step": 43391
    },
    {
      "epoch": 4.6034373010821135,
      "grad_norm": 0.586342810021523,
      "learning_rate": 3.397883285959449e-05,
      "loss": 1.2908,
      "num_input_tokens_seen": 34139355600,
      "step": 43392
    },
    {
      "epoch": 4.6035433906216845,
      "grad_norm": 0.5033751506726533,
      "learning_rate": 3.397818425661551e-05,
      "loss": 1.1871,
      "num_input_tokens_seen": 34140142464,
      "step": 43393
    },
    {
      "epoch": 4.603649480161256,
      "grad_norm": 0.7290584029881421,
      "learning_rate": 3.397753564669844e-05,
      "loss": 1.4901,
      "num_input_tokens_seen": 34140929216,
      "step": 43394
    },
    {
      "epoch": 4.603755569700827,
      "grad_norm": 0.540724488773221,
      "learning_rate": 3.3976887029843804e-05,
      "loss": 1.3603,
      "num_input_tokens_seen": 34141715920,
      "step": 43395
    },
    {
      "epoch": 4.603861659240399,
      "grad_norm": 0.6345885420651987,
      "learning_rate": 3.3976238406052097e-05,
      "loss": 1.2669,
      "num_input_tokens_seen": 34142502688,
      "step": 43396
    },
    {
      "epoch": 4.60396774877997,
      "grad_norm": 0.5453561722584841,
      "learning_rate": 3.3975589775323806e-05,
      "loss": 1.3041,
      "num_input_tokens_seen": 34143289456,
      "step": 43397
    },
    {
      "epoch": 4.604073838319541,
      "grad_norm": 0.6397645172881772,
      "learning_rate": 3.397494113765945e-05,
      "loss": 1.3937,
      "num_input_tokens_seen": 34144076320,
      "step": 43398
    },
    {
      "epoch": 4.604179927859113,
      "grad_norm": 0.6970152834747101,
      "learning_rate": 3.397429249305952e-05,
      "loss": 1.305,
      "num_input_tokens_seen": 34144863088,
      "step": 43399
    },
    {
      "epoch": 4.604286017398684,
      "grad_norm": 0.5796468209979002,
      "learning_rate": 3.3973643841524516e-05,
      "loss": 1.4186,
      "num_input_tokens_seen": 34145649792,
      "step": 43400
    },
    {
      "epoch": 4.604392106938256,
      "grad_norm": 0.6511735419815071,
      "learning_rate": 3.397299518305495e-05,
      "loss": 1.3118,
      "num_input_tokens_seen": 34146436528,
      "step": 43401
    },
    {
      "epoch": 4.604498196477827,
      "grad_norm": 0.6040210588978665,
      "learning_rate": 3.397234651765132e-05,
      "loss": 1.3512,
      "num_input_tokens_seen": 34147223232,
      "step": 43402
    },
    {
      "epoch": 4.604604286017398,
      "grad_norm": 0.694576372232373,
      "learning_rate": 3.397169784531411e-05,
      "loss": 1.3517,
      "num_input_tokens_seen": 34148010016,
      "step": 43403
    },
    {
      "epoch": 4.60471037555697,
      "grad_norm": 0.6329466441974585,
      "learning_rate": 3.3971049166043846e-05,
      "loss": 1.3938,
      "num_input_tokens_seen": 34148796816,
      "step": 43404
    },
    {
      "epoch": 4.604816465096541,
      "grad_norm": 0.6511361278207444,
      "learning_rate": 3.3970400479841016e-05,
      "loss": 1.2792,
      "num_input_tokens_seen": 34149583696,
      "step": 43405
    },
    {
      "epoch": 4.604922554636113,
      "grad_norm": 0.7737560918837013,
      "learning_rate": 3.3969751786706116e-05,
      "loss": 1.3405,
      "num_input_tokens_seen": 34150370432,
      "step": 43406
    },
    {
      "epoch": 4.605028644175684,
      "grad_norm": 0.570845269695177,
      "learning_rate": 3.396910308663967e-05,
      "loss": 1.3498,
      "num_input_tokens_seen": 34151157232,
      "step": 43407
    },
    {
      "epoch": 4.605134733715255,
      "grad_norm": 0.59850288075732,
      "learning_rate": 3.396845437964215e-05,
      "loss": 1.3055,
      "num_input_tokens_seen": 34151944000,
      "step": 43408
    },
    {
      "epoch": 4.605240823254827,
      "grad_norm": 0.7257713835443793,
      "learning_rate": 3.396780566571408e-05,
      "loss": 1.3102,
      "num_input_tokens_seen": 34152730752,
      "step": 43409
    },
    {
      "epoch": 4.605346912794398,
      "grad_norm": 0.5432023886920789,
      "learning_rate": 3.396715694485595e-05,
      "loss": 1.2089,
      "num_input_tokens_seen": 34153517600,
      "step": 43410
    },
    {
      "epoch": 4.60545300233397,
      "grad_norm": 0.5075418341088451,
      "learning_rate": 3.396650821706827e-05,
      "loss": 1.2282,
      "num_input_tokens_seen": 34154304384,
      "step": 43411
    },
    {
      "epoch": 4.605559091873541,
      "grad_norm": 0.5796097499496096,
      "learning_rate": 3.396585948235152e-05,
      "loss": 1.4114,
      "num_input_tokens_seen": 34155091120,
      "step": 43412
    },
    {
      "epoch": 4.605665181413112,
      "grad_norm": 0.5901179584047808,
      "learning_rate": 3.3965210740706235e-05,
      "loss": 1.3782,
      "num_input_tokens_seen": 34155877888,
      "step": 43413
    },
    {
      "epoch": 4.605771270952684,
      "grad_norm": 0.5389508695558738,
      "learning_rate": 3.3964561992132886e-05,
      "loss": 1.2677,
      "num_input_tokens_seen": 34156664640,
      "step": 43414
    },
    {
      "epoch": 4.605877360492255,
      "grad_norm": 0.8345331137399904,
      "learning_rate": 3.396391323663199e-05,
      "loss": 1.2671,
      "num_input_tokens_seen": 34157451392,
      "step": 43415
    },
    {
      "epoch": 4.605983450031827,
      "grad_norm": 0.583917407927401,
      "learning_rate": 3.3963264474204045e-05,
      "loss": 1.3827,
      "num_input_tokens_seen": 34158238112,
      "step": 43416
    },
    {
      "epoch": 4.606089539571398,
      "grad_norm": 0.5090588746538977,
      "learning_rate": 3.3962615704849556e-05,
      "loss": 1.2741,
      "num_input_tokens_seen": 34159024768,
      "step": 43417
    },
    {
      "epoch": 4.60619562911097,
      "grad_norm": 0.8565817105187529,
      "learning_rate": 3.3961966928569014e-05,
      "loss": 1.3792,
      "num_input_tokens_seen": 34159811552,
      "step": 43418
    },
    {
      "epoch": 4.606301718650541,
      "grad_norm": 0.5306412878570707,
      "learning_rate": 3.3961318145362935e-05,
      "loss": 1.2933,
      "num_input_tokens_seen": 34160598304,
      "step": 43419
    },
    {
      "epoch": 4.606407808190112,
      "grad_norm": 0.5542079355855105,
      "learning_rate": 3.396066935523181e-05,
      "loss": 1.3094,
      "num_input_tokens_seen": 34161385072,
      "step": 43420
    },
    {
      "epoch": 4.606513897729684,
      "grad_norm": 0.793850413494216,
      "learning_rate": 3.396002055817613e-05,
      "loss": 1.4201,
      "num_input_tokens_seen": 34162171856,
      "step": 43421
    },
    {
      "epoch": 4.606619987269255,
      "grad_norm": 0.629586239177966,
      "learning_rate": 3.395937175419643e-05,
      "loss": 1.2643,
      "num_input_tokens_seen": 34162958656,
      "step": 43422
    },
    {
      "epoch": 4.606726076808827,
      "grad_norm": 0.5448821427114058,
      "learning_rate": 3.395872294329318e-05,
      "loss": 1.3663,
      "num_input_tokens_seen": 34163745408,
      "step": 43423
    },
    {
      "epoch": 4.606832166348398,
      "grad_norm": 0.5022483689107524,
      "learning_rate": 3.395807412546689e-05,
      "loss": 1.2906,
      "num_input_tokens_seen": 34164532288,
      "step": 43424
    },
    {
      "epoch": 4.60693825588797,
      "grad_norm": 0.6795875891910713,
      "learning_rate": 3.3957425300718065e-05,
      "loss": 1.3161,
      "num_input_tokens_seen": 34165319104,
      "step": 43425
    },
    {
      "epoch": 4.607044345427541,
      "grad_norm": 0.5425908443027263,
      "learning_rate": 3.39567764690472e-05,
      "loss": 1.3376,
      "num_input_tokens_seen": 34166105840,
      "step": 43426
    },
    {
      "epoch": 4.607150434967112,
      "grad_norm": 0.609422054832854,
      "learning_rate": 3.395612763045481e-05,
      "loss": 1.3586,
      "num_input_tokens_seen": 34166892544,
      "step": 43427
    },
    {
      "epoch": 4.607256524506684,
      "grad_norm": 0.5406758167078228,
      "learning_rate": 3.3955478784941384e-05,
      "loss": 1.2658,
      "num_input_tokens_seen": 34167679408,
      "step": 43428
    },
    {
      "epoch": 4.607362614046255,
      "grad_norm": 0.5487890404778032,
      "learning_rate": 3.395482993250742e-05,
      "loss": 1.3538,
      "num_input_tokens_seen": 34168466144,
      "step": 43429
    },
    {
      "epoch": 4.607468703585827,
      "grad_norm": 0.5631504658750134,
      "learning_rate": 3.3954181073153434e-05,
      "loss": 1.2747,
      "num_input_tokens_seen": 34169252800,
      "step": 43430
    },
    {
      "epoch": 4.607574793125398,
      "grad_norm": 0.4788017683220816,
      "learning_rate": 3.3953532206879924e-05,
      "loss": 1.2834,
      "num_input_tokens_seen": 34170039568,
      "step": 43431
    },
    {
      "epoch": 4.607680882664969,
      "grad_norm": 0.509421471985413,
      "learning_rate": 3.3952883333687374e-05,
      "loss": 1.2698,
      "num_input_tokens_seen": 34170826304,
      "step": 43432
    },
    {
      "epoch": 4.607786972204541,
      "grad_norm": 0.5442488094025225,
      "learning_rate": 3.395223445357631e-05,
      "loss": 1.2576,
      "num_input_tokens_seen": 34171613056,
      "step": 43433
    },
    {
      "epoch": 4.607893061744112,
      "grad_norm": 0.4771076522193658,
      "learning_rate": 3.395158556654722e-05,
      "loss": 1.1906,
      "num_input_tokens_seen": 34172399856,
      "step": 43434
    },
    {
      "epoch": 4.607999151283684,
      "grad_norm": 0.6309030826713271,
      "learning_rate": 3.39509366726006e-05,
      "loss": 1.304,
      "num_input_tokens_seen": 34173186656,
      "step": 43435
    },
    {
      "epoch": 4.608105240823255,
      "grad_norm": 0.48333536603897115,
      "learning_rate": 3.395028777173696e-05,
      "loss": 1.2713,
      "num_input_tokens_seen": 34173973392,
      "step": 43436
    },
    {
      "epoch": 4.608211330362826,
      "grad_norm": 0.5917153602687388,
      "learning_rate": 3.39496388639568e-05,
      "loss": 1.3942,
      "num_input_tokens_seen": 34174760144,
      "step": 43437
    },
    {
      "epoch": 4.608317419902398,
      "grad_norm": 0.5125405005406231,
      "learning_rate": 3.394898994926063e-05,
      "loss": 1.2738,
      "num_input_tokens_seen": 34175547008,
      "step": 43438
    },
    {
      "epoch": 4.608423509441969,
      "grad_norm": 0.5646640330903259,
      "learning_rate": 3.394834102764894e-05,
      "loss": 1.3065,
      "num_input_tokens_seen": 34176333760,
      "step": 43439
    },
    {
      "epoch": 4.608529598981541,
      "grad_norm": 0.6092901684593879,
      "learning_rate": 3.394769209912223e-05,
      "loss": 1.3072,
      "num_input_tokens_seen": 34177120496,
      "step": 43440
    },
    {
      "epoch": 4.608635688521112,
      "grad_norm": 0.5639917376572435,
      "learning_rate": 3.394704316368101e-05,
      "loss": 1.3026,
      "num_input_tokens_seen": 34177907264,
      "step": 43441
    },
    {
      "epoch": 4.608741778060683,
      "grad_norm": 0.6029844262238503,
      "learning_rate": 3.394639422132577e-05,
      "loss": 1.306,
      "num_input_tokens_seen": 34178694048,
      "step": 43442
    },
    {
      "epoch": 4.608847867600255,
      "grad_norm": 0.5185530415417122,
      "learning_rate": 3.394574527205703e-05,
      "loss": 1.3416,
      "num_input_tokens_seen": 34179480768,
      "step": 43443
    },
    {
      "epoch": 4.608953957139826,
      "grad_norm": 0.528280374830253,
      "learning_rate": 3.394509631587527e-05,
      "loss": 1.2775,
      "num_input_tokens_seen": 34180267552,
      "step": 43444
    },
    {
      "epoch": 4.609060046679398,
      "grad_norm": 0.9270236370153582,
      "learning_rate": 3.394444735278102e-05,
      "loss": 1.3077,
      "num_input_tokens_seen": 34181054384,
      "step": 43445
    },
    {
      "epoch": 4.609166136218969,
      "grad_norm": 0.6021703497199269,
      "learning_rate": 3.3943798382774744e-05,
      "loss": 1.2525,
      "num_input_tokens_seen": 34181841200,
      "step": 43446
    },
    {
      "epoch": 4.609272225758541,
      "grad_norm": 0.8898367450863298,
      "learning_rate": 3.394314940585697e-05,
      "loss": 1.3082,
      "num_input_tokens_seen": 34182628048,
      "step": 43447
    },
    {
      "epoch": 4.609378315298112,
      "grad_norm": 0.5031484095278506,
      "learning_rate": 3.394250042202819e-05,
      "loss": 1.2251,
      "num_input_tokens_seen": 34183414864,
      "step": 43448
    },
    {
      "epoch": 4.609484404837683,
      "grad_norm": 0.7737872848348276,
      "learning_rate": 3.394185143128891e-05,
      "loss": 1.3035,
      "num_input_tokens_seen": 34184201680,
      "step": 43449
    },
    {
      "epoch": 4.6095904943772545,
      "grad_norm": 0.6871298431267453,
      "learning_rate": 3.3941202433639634e-05,
      "loss": 1.3369,
      "num_input_tokens_seen": 34184988400,
      "step": 43450
    },
    {
      "epoch": 4.609696583916826,
      "grad_norm": 0.5319883459946111,
      "learning_rate": 3.394055342908086e-05,
      "loss": 1.2897,
      "num_input_tokens_seen": 34185775136,
      "step": 43451
    },
    {
      "epoch": 4.6098026734563975,
      "grad_norm": 0.6322339148287761,
      "learning_rate": 3.3939904417613075e-05,
      "loss": 1.2726,
      "num_input_tokens_seen": 34186561920,
      "step": 43452
    },
    {
      "epoch": 4.6099087629959685,
      "grad_norm": 0.4722875354501237,
      "learning_rate": 3.3939255399236815e-05,
      "loss": 1.247,
      "num_input_tokens_seen": 34187348640,
      "step": 43453
    },
    {
      "epoch": 4.61001485253554,
      "grad_norm": 0.6493482059688785,
      "learning_rate": 3.393860637395254e-05,
      "loss": 1.3735,
      "num_input_tokens_seen": 34188135360,
      "step": 43454
    },
    {
      "epoch": 4.6101209420751115,
      "grad_norm": 0.4793908864792509,
      "learning_rate": 3.393795734176079e-05,
      "loss": 1.237,
      "num_input_tokens_seen": 34188922144,
      "step": 43455
    },
    {
      "epoch": 4.6102270316146825,
      "grad_norm": 0.647809176622853,
      "learning_rate": 3.393730830266203e-05,
      "loss": 1.3425,
      "num_input_tokens_seen": 34189708944,
      "step": 43456
    },
    {
      "epoch": 4.610333121154254,
      "grad_norm": 0.6066668383969445,
      "learning_rate": 3.3936659256656795e-05,
      "loss": 1.2941,
      "num_input_tokens_seen": 34190495696,
      "step": 43457
    },
    {
      "epoch": 4.6104392106938255,
      "grad_norm": 0.6011539539909622,
      "learning_rate": 3.393601020374556e-05,
      "loss": 1.4115,
      "num_input_tokens_seen": 34191282496,
      "step": 43458
    },
    {
      "epoch": 4.610545300233397,
      "grad_norm": 0.5602410481790193,
      "learning_rate": 3.393536114392885e-05,
      "loss": 1.381,
      "num_input_tokens_seen": 34192069248,
      "step": 43459
    },
    {
      "epoch": 4.610651389772968,
      "grad_norm": 0.5466303996383526,
      "learning_rate": 3.393471207720715e-05,
      "loss": 1.3137,
      "num_input_tokens_seen": 34192856032,
      "step": 43460
    },
    {
      "epoch": 4.610757479312539,
      "grad_norm": 0.5031533788480675,
      "learning_rate": 3.393406300358097e-05,
      "loss": 1.2791,
      "num_input_tokens_seen": 34193642832,
      "step": 43461
    },
    {
      "epoch": 4.610863568852111,
      "grad_norm": 0.5263059002464768,
      "learning_rate": 3.3933413923050805e-05,
      "loss": 1.2828,
      "num_input_tokens_seen": 34194429664,
      "step": 43462
    },
    {
      "epoch": 4.610969658391682,
      "grad_norm": 0.5651403995489861,
      "learning_rate": 3.393276483561716e-05,
      "loss": 1.405,
      "num_input_tokens_seen": 34195216448,
      "step": 43463
    },
    {
      "epoch": 4.611075747931254,
      "grad_norm": 0.5476364785039951,
      "learning_rate": 3.393211574128054e-05,
      "loss": 1.2652,
      "num_input_tokens_seen": 34196003264,
      "step": 43464
    },
    {
      "epoch": 4.611181837470825,
      "grad_norm": 0.6058007721946441,
      "learning_rate": 3.3931466640041445e-05,
      "loss": 1.2918,
      "num_input_tokens_seen": 34196790000,
      "step": 43465
    },
    {
      "epoch": 4.611287927010396,
      "grad_norm": 0.6576962553980491,
      "learning_rate": 3.393081753190036e-05,
      "loss": 1.3131,
      "num_input_tokens_seen": 34197576704,
      "step": 43466
    },
    {
      "epoch": 4.611394016549968,
      "grad_norm": 0.5841724300106297,
      "learning_rate": 3.3930168416857814e-05,
      "loss": 1.3078,
      "num_input_tokens_seen": 34198363424,
      "step": 43467
    },
    {
      "epoch": 4.611500106089539,
      "grad_norm": 0.6555495000559846,
      "learning_rate": 3.39295192949143e-05,
      "loss": 1.4235,
      "num_input_tokens_seen": 34199150176,
      "step": 43468
    },
    {
      "epoch": 4.611606195629111,
      "grad_norm": 0.5500248502821848,
      "learning_rate": 3.39288701660703e-05,
      "loss": 1.402,
      "num_input_tokens_seen": 34199936944,
      "step": 43469
    },
    {
      "epoch": 4.611712285168682,
      "grad_norm": 0.5435267966902996,
      "learning_rate": 3.392822103032634e-05,
      "loss": 1.2881,
      "num_input_tokens_seen": 34200723760,
      "step": 43470
    },
    {
      "epoch": 4.611818374708253,
      "grad_norm": 0.7045925815734608,
      "learning_rate": 3.3927571887682916e-05,
      "loss": 1.3695,
      "num_input_tokens_seen": 34201510480,
      "step": 43471
    },
    {
      "epoch": 4.611924464247825,
      "grad_norm": 0.4340960732786606,
      "learning_rate": 3.392692273814052e-05,
      "loss": 1.1257,
      "num_input_tokens_seen": 34202297376,
      "step": 43472
    },
    {
      "epoch": 4.612030553787396,
      "grad_norm": 0.6589555988299833,
      "learning_rate": 3.392627358169967e-05,
      "loss": 1.3265,
      "num_input_tokens_seen": 34203084048,
      "step": 43473
    },
    {
      "epoch": 4.612136643326968,
      "grad_norm": 0.5939111602234861,
      "learning_rate": 3.392562441836085e-05,
      "loss": 1.3673,
      "num_input_tokens_seen": 34203870880,
      "step": 43474
    },
    {
      "epoch": 4.612242732866539,
      "grad_norm": 0.5355970227895945,
      "learning_rate": 3.392497524812457e-05,
      "loss": 1.2605,
      "num_input_tokens_seen": 34204657712,
      "step": 43475
    },
    {
      "epoch": 4.612348822406111,
      "grad_norm": 0.5321723092939061,
      "learning_rate": 3.392432607099133e-05,
      "loss": 1.3736,
      "num_input_tokens_seen": 34205444448,
      "step": 43476
    },
    {
      "epoch": 4.612454911945682,
      "grad_norm": 0.5197602847815798,
      "learning_rate": 3.3923676886961636e-05,
      "loss": 1.326,
      "num_input_tokens_seen": 34206231248,
      "step": 43477
    },
    {
      "epoch": 4.612561001485254,
      "grad_norm": 0.5637785973687047,
      "learning_rate": 3.392302769603598e-05,
      "loss": 1.3324,
      "num_input_tokens_seen": 34207018080,
      "step": 43478
    },
    {
      "epoch": 4.612667091024825,
      "grad_norm": 0.6485988457059824,
      "learning_rate": 3.392237849821488e-05,
      "loss": 1.2905,
      "num_input_tokens_seen": 34207804960,
      "step": 43479
    },
    {
      "epoch": 4.612773180564396,
      "grad_norm": 0.4795129792117877,
      "learning_rate": 3.3921729293498824e-05,
      "loss": 1.2419,
      "num_input_tokens_seen": 34208591760,
      "step": 43480
    },
    {
      "epoch": 4.612879270103968,
      "grad_norm": 0.4969847803187979,
      "learning_rate": 3.392108008188831e-05,
      "loss": 1.2386,
      "num_input_tokens_seen": 34209378688,
      "step": 43481
    },
    {
      "epoch": 4.612985359643539,
      "grad_norm": 0.7044728949807664,
      "learning_rate": 3.392043086338385e-05,
      "loss": 1.3393,
      "num_input_tokens_seen": 34210165360,
      "step": 43482
    },
    {
      "epoch": 4.613091449183111,
      "grad_norm": 0.5748424287171886,
      "learning_rate": 3.391978163798595e-05,
      "loss": 1.2652,
      "num_input_tokens_seen": 34210952096,
      "step": 43483
    },
    {
      "epoch": 4.613197538722682,
      "grad_norm": 0.6298407718342972,
      "learning_rate": 3.3919132405695096e-05,
      "loss": 1.315,
      "num_input_tokens_seen": 34211738848,
      "step": 43484
    },
    {
      "epoch": 4.613303628262253,
      "grad_norm": 0.5402520923803193,
      "learning_rate": 3.391848316651181e-05,
      "loss": 1.3125,
      "num_input_tokens_seen": 34212525520,
      "step": 43485
    },
    {
      "epoch": 4.613409717801825,
      "grad_norm": 0.5598096078813907,
      "learning_rate": 3.3917833920436564e-05,
      "loss": 1.4027,
      "num_input_tokens_seen": 34213312336,
      "step": 43486
    },
    {
      "epoch": 4.613515807341396,
      "grad_norm": 0.5783126194043399,
      "learning_rate": 3.391718466746989e-05,
      "loss": 1.4727,
      "num_input_tokens_seen": 34214098976,
      "step": 43487
    },
    {
      "epoch": 4.613621896880968,
      "grad_norm": 0.7415418014883005,
      "learning_rate": 3.391653540761227e-05,
      "loss": 1.3448,
      "num_input_tokens_seen": 34214885648,
      "step": 43488
    },
    {
      "epoch": 4.613727986420539,
      "grad_norm": 0.5620655864078457,
      "learning_rate": 3.3915886140864215e-05,
      "loss": 1.3335,
      "num_input_tokens_seen": 34215672352,
      "step": 43489
    },
    {
      "epoch": 4.61383407596011,
      "grad_norm": 0.895702708957938,
      "learning_rate": 3.3915236867226235e-05,
      "loss": 1.2798,
      "num_input_tokens_seen": 34216459152,
      "step": 43490
    },
    {
      "epoch": 4.613940165499682,
      "grad_norm": 0.6618288143461496,
      "learning_rate": 3.3914587586698814e-05,
      "loss": 1.3681,
      "num_input_tokens_seen": 34217245904,
      "step": 43491
    },
    {
      "epoch": 4.614046255039253,
      "grad_norm": 0.6302736636397843,
      "learning_rate": 3.3913938299282454e-05,
      "loss": 1.2129,
      "num_input_tokens_seen": 34218032800,
      "step": 43492
    },
    {
      "epoch": 4.614152344578825,
      "grad_norm": 0.5398328799457119,
      "learning_rate": 3.3913289004977676e-05,
      "loss": 1.3361,
      "num_input_tokens_seen": 34218819520,
      "step": 43493
    },
    {
      "epoch": 4.614258434118396,
      "grad_norm": 0.5047819644109379,
      "learning_rate": 3.391263970378496e-05,
      "loss": 1.301,
      "num_input_tokens_seen": 34219606224,
      "step": 43494
    },
    {
      "epoch": 4.614364523657967,
      "grad_norm": 0.566599124729726,
      "learning_rate": 3.391199039570483e-05,
      "loss": 1.2837,
      "num_input_tokens_seen": 34220393008,
      "step": 43495
    },
    {
      "epoch": 4.614470613197539,
      "grad_norm": 0.5899310572732915,
      "learning_rate": 3.391134108073777e-05,
      "loss": 1.2663,
      "num_input_tokens_seen": 34221179712,
      "step": 43496
    },
    {
      "epoch": 4.61457670273711,
      "grad_norm": 0.5223290104621027,
      "learning_rate": 3.391069175888428e-05,
      "loss": 1.2079,
      "num_input_tokens_seen": 34221966464,
      "step": 43497
    },
    {
      "epoch": 4.614682792276682,
      "grad_norm": 0.43843765802068446,
      "learning_rate": 3.391004243014487e-05,
      "loss": 1.2037,
      "num_input_tokens_seen": 34222753328,
      "step": 43498
    },
    {
      "epoch": 4.614788881816253,
      "grad_norm": 0.5702420275927303,
      "learning_rate": 3.3909393094520046e-05,
      "loss": 1.261,
      "num_input_tokens_seen": 34223540080,
      "step": 43499
    },
    {
      "epoch": 4.614894971355824,
      "grad_norm": 0.5479682366083252,
      "learning_rate": 3.3908743752010305e-05,
      "loss": 1.3063,
      "num_input_tokens_seen": 34224326864,
      "step": 43500
    },
    {
      "epoch": 4.615001060895396,
      "grad_norm": 0.6408025132195557,
      "learning_rate": 3.3908094402616144e-05,
      "loss": 1.4162,
      "num_input_tokens_seen": 34225113584,
      "step": 43501
    },
    {
      "epoch": 4.615107150434967,
      "grad_norm": 0.5231972930994506,
      "learning_rate": 3.390744504633808e-05,
      "loss": 1.2766,
      "num_input_tokens_seen": 34225900400,
      "step": 43502
    },
    {
      "epoch": 4.615213239974539,
      "grad_norm": 0.6259903303612381,
      "learning_rate": 3.390679568317659e-05,
      "loss": 1.3432,
      "num_input_tokens_seen": 34226687216,
      "step": 43503
    },
    {
      "epoch": 4.61531932951411,
      "grad_norm": 0.5092689860243355,
      "learning_rate": 3.390614631313219e-05,
      "loss": 1.2708,
      "num_input_tokens_seen": 34227473968,
      "step": 43504
    },
    {
      "epoch": 4.615425419053682,
      "grad_norm": 0.8007503689486672,
      "learning_rate": 3.390549693620539e-05,
      "loss": 1.2488,
      "num_input_tokens_seen": 34228260784,
      "step": 43505
    },
    {
      "epoch": 4.615531508593253,
      "grad_norm": 0.5538503423595537,
      "learning_rate": 3.390484755239668e-05,
      "loss": 1.2697,
      "num_input_tokens_seen": 34229047552,
      "step": 43506
    },
    {
      "epoch": 4.615637598132825,
      "grad_norm": 0.7894683223679354,
      "learning_rate": 3.390419816170656e-05,
      "loss": 1.3134,
      "num_input_tokens_seen": 34229834288,
      "step": 43507
    },
    {
      "epoch": 4.615743687672396,
      "grad_norm": 0.5055789228487244,
      "learning_rate": 3.3903548764135536e-05,
      "loss": 1.2647,
      "num_input_tokens_seen": 34230621056,
      "step": 43508
    },
    {
      "epoch": 4.615849777211967,
      "grad_norm": 0.7307821759056103,
      "learning_rate": 3.390289935968412e-05,
      "loss": 1.3706,
      "num_input_tokens_seen": 34231407824,
      "step": 43509
    },
    {
      "epoch": 4.615955866751539,
      "grad_norm": 0.7189722263253084,
      "learning_rate": 3.39022499483528e-05,
      "loss": 1.3348,
      "num_input_tokens_seen": 34232194576,
      "step": 43510
    },
    {
      "epoch": 4.61606195629111,
      "grad_norm": 0.5542863307028804,
      "learning_rate": 3.3901600530142086e-05,
      "loss": 1.2627,
      "num_input_tokens_seen": 34232981360,
      "step": 43511
    },
    {
      "epoch": 4.6161680458306815,
      "grad_norm": 0.7900142457174336,
      "learning_rate": 3.390095110505247e-05,
      "loss": 1.2076,
      "num_input_tokens_seen": 34233768208,
      "step": 43512
    },
    {
      "epoch": 4.6162741353702526,
      "grad_norm": 0.7972937595162242,
      "learning_rate": 3.3900301673084466e-05,
      "loss": 1.4207,
      "num_input_tokens_seen": 34234554896,
      "step": 43513
    },
    {
      "epoch": 4.616380224909824,
      "grad_norm": 0.7532908483437656,
      "learning_rate": 3.389965223423857e-05,
      "loss": 1.3492,
      "num_input_tokens_seen": 34235341648,
      "step": 43514
    },
    {
      "epoch": 4.6164863144493955,
      "grad_norm": 0.6952030388998582,
      "learning_rate": 3.389900278851528e-05,
      "loss": 1.1688,
      "num_input_tokens_seen": 34236128528,
      "step": 43515
    },
    {
      "epoch": 4.6165924039889665,
      "grad_norm": 0.5922672807436761,
      "learning_rate": 3.3898353335915105e-05,
      "loss": 1.4465,
      "num_input_tokens_seen": 34236915168,
      "step": 43516
    },
    {
      "epoch": 4.6166984935285384,
      "grad_norm": 0.5457698712822221,
      "learning_rate": 3.3897703876438544e-05,
      "loss": 1.2606,
      "num_input_tokens_seen": 34237701872,
      "step": 43517
    },
    {
      "epoch": 4.6168045830681095,
      "grad_norm": 0.6946942424857269,
      "learning_rate": 3.3897054410086094e-05,
      "loss": 1.4641,
      "num_input_tokens_seen": 34238488736,
      "step": 43518
    },
    {
      "epoch": 4.6169106726076805,
      "grad_norm": 0.5343004822778736,
      "learning_rate": 3.3896404936858264e-05,
      "loss": 1.1938,
      "num_input_tokens_seen": 34239275408,
      "step": 43519
    },
    {
      "epoch": 4.617016762147252,
      "grad_norm": 0.4702747927653205,
      "learning_rate": 3.3895755456755556e-05,
      "loss": 1.2995,
      "num_input_tokens_seen": 34240062128,
      "step": 43520
    },
    {
      "epoch": 4.6171228516868235,
      "grad_norm": 0.5588053694759191,
      "learning_rate": 3.3895105969778464e-05,
      "loss": 1.2887,
      "num_input_tokens_seen": 34240848912,
      "step": 43521
    },
    {
      "epoch": 4.617228941226395,
      "grad_norm": 0.5571557910515618,
      "learning_rate": 3.3894456475927496e-05,
      "loss": 1.3312,
      "num_input_tokens_seen": 34241635600,
      "step": 43522
    },
    {
      "epoch": 4.617335030765966,
      "grad_norm": 0.5238430320452748,
      "learning_rate": 3.3893806975203154e-05,
      "loss": 1.2401,
      "num_input_tokens_seen": 34242422304,
      "step": 43523
    },
    {
      "epoch": 4.617441120305537,
      "grad_norm": 0.4881741709676195,
      "learning_rate": 3.389315746760594e-05,
      "loss": 1.2633,
      "num_input_tokens_seen": 34243209120,
      "step": 43524
    },
    {
      "epoch": 4.617547209845109,
      "grad_norm": 0.8783644312949744,
      "learning_rate": 3.3892507953136354e-05,
      "loss": 1.3556,
      "num_input_tokens_seen": 34243995920,
      "step": 43525
    },
    {
      "epoch": 4.61765329938468,
      "grad_norm": 0.511243715599431,
      "learning_rate": 3.38918584317949e-05,
      "loss": 1.3025,
      "num_input_tokens_seen": 34244782688,
      "step": 43526
    },
    {
      "epoch": 4.617759388924252,
      "grad_norm": 0.5059206838741662,
      "learning_rate": 3.389120890358208e-05,
      "loss": 1.2349,
      "num_input_tokens_seen": 34245569488,
      "step": 43527
    },
    {
      "epoch": 4.617865478463823,
      "grad_norm": 0.7936574714568839,
      "learning_rate": 3.3890559368498395e-05,
      "loss": 1.4342,
      "num_input_tokens_seen": 34246356208,
      "step": 43528
    },
    {
      "epoch": 4.617971568003394,
      "grad_norm": 0.48330728164106435,
      "learning_rate": 3.388990982654434e-05,
      "loss": 1.3619,
      "num_input_tokens_seen": 34247142992,
      "step": 43529
    },
    {
      "epoch": 4.618077657542966,
      "grad_norm": 0.6311868480620005,
      "learning_rate": 3.3889260277720424e-05,
      "loss": 1.268,
      "num_input_tokens_seen": 34247929824,
      "step": 43530
    },
    {
      "epoch": 4.618183747082537,
      "grad_norm": 0.6334978013030744,
      "learning_rate": 3.388861072202716e-05,
      "loss": 1.3458,
      "num_input_tokens_seen": 34248716624,
      "step": 43531
    },
    {
      "epoch": 4.618289836622109,
      "grad_norm": 0.6128667633469691,
      "learning_rate": 3.388796115946502e-05,
      "loss": 1.2802,
      "num_input_tokens_seen": 34249503360,
      "step": 43532
    },
    {
      "epoch": 4.61839592616168,
      "grad_norm": 0.6493342571639692,
      "learning_rate": 3.3887311590034545e-05,
      "loss": 1.3277,
      "num_input_tokens_seen": 34250290128,
      "step": 43533
    },
    {
      "epoch": 4.618502015701252,
      "grad_norm": 0.5466703340629219,
      "learning_rate": 3.38866620137362e-05,
      "loss": 1.3306,
      "num_input_tokens_seen": 34251076928,
      "step": 43534
    },
    {
      "epoch": 4.618608105240823,
      "grad_norm": 0.6529375769721887,
      "learning_rate": 3.388601243057051e-05,
      "loss": 1.2877,
      "num_input_tokens_seen": 34251863712,
      "step": 43535
    },
    {
      "epoch": 4.618714194780395,
      "grad_norm": 0.5269162368194594,
      "learning_rate": 3.388536284053797e-05,
      "loss": 1.2705,
      "num_input_tokens_seen": 34252650432,
      "step": 43536
    },
    {
      "epoch": 4.618820284319966,
      "grad_norm": 0.6505148927118698,
      "learning_rate": 3.3884713243639086e-05,
      "loss": 1.3046,
      "num_input_tokens_seen": 34253437120,
      "step": 43537
    },
    {
      "epoch": 4.618926373859537,
      "grad_norm": 0.49534348507308346,
      "learning_rate": 3.3884063639874345e-05,
      "loss": 1.2814,
      "num_input_tokens_seen": 34254223872,
      "step": 43538
    },
    {
      "epoch": 4.619032463399109,
      "grad_norm": 0.4662573193594223,
      "learning_rate": 3.388341402924427e-05,
      "loss": 1.2439,
      "num_input_tokens_seen": 34255010688,
      "step": 43539
    },
    {
      "epoch": 4.61913855293868,
      "grad_norm": 0.5022356670367109,
      "learning_rate": 3.388276441174935e-05,
      "loss": 1.2699,
      "num_input_tokens_seen": 34255797376,
      "step": 43540
    },
    {
      "epoch": 4.619244642478252,
      "grad_norm": 0.5408665136974826,
      "learning_rate": 3.3882114787390095e-05,
      "loss": 1.3608,
      "num_input_tokens_seen": 34256584112,
      "step": 43541
    },
    {
      "epoch": 4.619350732017823,
      "grad_norm": 0.48772296981110236,
      "learning_rate": 3.3881465156167005e-05,
      "loss": 1.3354,
      "num_input_tokens_seen": 34257370864,
      "step": 43542
    },
    {
      "epoch": 4.619456821557394,
      "grad_norm": 0.5869423876734279,
      "learning_rate": 3.3880815518080564e-05,
      "loss": 1.3598,
      "num_input_tokens_seen": 34258157552,
      "step": 43543
    },
    {
      "epoch": 4.619562911096966,
      "grad_norm": 0.5325135207978537,
      "learning_rate": 3.38801658731313e-05,
      "loss": 1.3659,
      "num_input_tokens_seen": 34258944256,
      "step": 43544
    },
    {
      "epoch": 4.619669000636537,
      "grad_norm": 0.6217464208228866,
      "learning_rate": 3.3879516221319704e-05,
      "loss": 1.3932,
      "num_input_tokens_seen": 34259731008,
      "step": 43545
    },
    {
      "epoch": 4.619775090176109,
      "grad_norm": 0.5065177246570507,
      "learning_rate": 3.387886656264627e-05,
      "loss": 1.2796,
      "num_input_tokens_seen": 34260517776,
      "step": 43546
    },
    {
      "epoch": 4.61988117971568,
      "grad_norm": 0.6327736070747519,
      "learning_rate": 3.387821689711153e-05,
      "loss": 1.319,
      "num_input_tokens_seen": 34261304512,
      "step": 43547
    },
    {
      "epoch": 4.619987269255251,
      "grad_norm": 0.506602752904381,
      "learning_rate": 3.387756722471594e-05,
      "loss": 1.2651,
      "num_input_tokens_seen": 34262091312,
      "step": 43548
    },
    {
      "epoch": 4.620093358794823,
      "grad_norm": 0.5915965038926649,
      "learning_rate": 3.387691754546004e-05,
      "loss": 1.3534,
      "num_input_tokens_seen": 34262877984,
      "step": 43549
    },
    {
      "epoch": 4.620199448334394,
      "grad_norm": 0.6021544430807342,
      "learning_rate": 3.387626785934431e-05,
      "loss": 1.341,
      "num_input_tokens_seen": 34263664672,
      "step": 43550
    },
    {
      "epoch": 4.620305537873966,
      "grad_norm": 0.5313139982742208,
      "learning_rate": 3.3875618166369265e-05,
      "loss": 1.394,
      "num_input_tokens_seen": 34264451472,
      "step": 43551
    },
    {
      "epoch": 4.620411627413537,
      "grad_norm": 0.5805389098978545,
      "learning_rate": 3.38749684665354e-05,
      "loss": 1.3372,
      "num_input_tokens_seen": 34265238288,
      "step": 43552
    },
    {
      "epoch": 4.620517716953108,
      "grad_norm": 0.5583235328965038,
      "learning_rate": 3.387431875984323e-05,
      "loss": 1.4002,
      "num_input_tokens_seen": 34266024928,
      "step": 43553
    },
    {
      "epoch": 4.62062380649268,
      "grad_norm": 0.4773795334083801,
      "learning_rate": 3.387366904629324e-05,
      "loss": 1.265,
      "num_input_tokens_seen": 34266811648,
      "step": 43554
    },
    {
      "epoch": 4.620729896032251,
      "grad_norm": 0.5350850231393391,
      "learning_rate": 3.3873019325885936e-05,
      "loss": 1.3415,
      "num_input_tokens_seen": 34267598336,
      "step": 43555
    },
    {
      "epoch": 4.620835985571823,
      "grad_norm": 0.5361523007674537,
      "learning_rate": 3.3872369598621826e-05,
      "loss": 1.2855,
      "num_input_tokens_seen": 34268385168,
      "step": 43556
    },
    {
      "epoch": 4.620942075111394,
      "grad_norm": 0.4763634766388627,
      "learning_rate": 3.387171986450141e-05,
      "loss": 1.2789,
      "num_input_tokens_seen": 34269171952,
      "step": 43557
    },
    {
      "epoch": 4.621048164650966,
      "grad_norm": 0.49756629937511226,
      "learning_rate": 3.3871070123525186e-05,
      "loss": 1.2778,
      "num_input_tokens_seen": 34269958768,
      "step": 43558
    },
    {
      "epoch": 4.621154254190537,
      "grad_norm": 0.9512660444824593,
      "learning_rate": 3.3870420375693666e-05,
      "loss": 1.4007,
      "num_input_tokens_seen": 34270745552,
      "step": 43559
    },
    {
      "epoch": 4.621260343730108,
      "grad_norm": 0.5616504550984086,
      "learning_rate": 3.386977062100734e-05,
      "loss": 1.3471,
      "num_input_tokens_seen": 34271532336,
      "step": 43560
    },
    {
      "epoch": 4.62136643326968,
      "grad_norm": 0.6656309006269516,
      "learning_rate": 3.386912085946672e-05,
      "loss": 1.2958,
      "num_input_tokens_seen": 34272319040,
      "step": 43561
    },
    {
      "epoch": 4.621472522809251,
      "grad_norm": 0.4921551448914075,
      "learning_rate": 3.3868471091072295e-05,
      "loss": 1.2416,
      "num_input_tokens_seen": 34273105824,
      "step": 43562
    },
    {
      "epoch": 4.621578612348823,
      "grad_norm": 0.49950376963762017,
      "learning_rate": 3.386782131582459e-05,
      "loss": 1.2306,
      "num_input_tokens_seen": 34273892608,
      "step": 43563
    },
    {
      "epoch": 4.621684701888394,
      "grad_norm": 0.6210648017817814,
      "learning_rate": 3.386717153372407e-05,
      "loss": 1.367,
      "num_input_tokens_seen": 34274679328,
      "step": 43564
    },
    {
      "epoch": 4.621790791427966,
      "grad_norm": 0.6043990266561191,
      "learning_rate": 3.3866521744771286e-05,
      "loss": 1.2988,
      "num_input_tokens_seen": 34275466112,
      "step": 43565
    },
    {
      "epoch": 4.621896880967537,
      "grad_norm": 0.6280648876539042,
      "learning_rate": 3.38658719489667e-05,
      "loss": 1.2807,
      "num_input_tokens_seen": 34276252880,
      "step": 43566
    },
    {
      "epoch": 4.622002970507108,
      "grad_norm": 0.5979896089511202,
      "learning_rate": 3.386522214631083e-05,
      "loss": 1.416,
      "num_input_tokens_seen": 34277039728,
      "step": 43567
    },
    {
      "epoch": 4.62210906004668,
      "grad_norm": 0.6362719683555847,
      "learning_rate": 3.386457233680417e-05,
      "loss": 1.3245,
      "num_input_tokens_seen": 34277826400,
      "step": 43568
    },
    {
      "epoch": 4.622215149586251,
      "grad_norm": 0.6189209021746571,
      "learning_rate": 3.386392252044724e-05,
      "loss": 1.1991,
      "num_input_tokens_seen": 34278613168,
      "step": 43569
    },
    {
      "epoch": 4.622321239125823,
      "grad_norm": 0.552523093756331,
      "learning_rate": 3.3863272697240525e-05,
      "loss": 1.3842,
      "num_input_tokens_seen": 34279399872,
      "step": 43570
    },
    {
      "epoch": 4.622427328665394,
      "grad_norm": 0.5785608908561893,
      "learning_rate": 3.3862622867184535e-05,
      "loss": 1.3369,
      "num_input_tokens_seen": 34280186704,
      "step": 43571
    },
    {
      "epoch": 4.622533418204965,
      "grad_norm": 0.5596422848053679,
      "learning_rate": 3.386197303027977e-05,
      "loss": 1.3083,
      "num_input_tokens_seen": 34280973504,
      "step": 43572
    },
    {
      "epoch": 4.622639507744537,
      "grad_norm": 0.5375814690556843,
      "learning_rate": 3.386132318652673e-05,
      "loss": 1.2954,
      "num_input_tokens_seen": 34281760176,
      "step": 43573
    },
    {
      "epoch": 4.622745597284108,
      "grad_norm": 0.6295233608158413,
      "learning_rate": 3.386067333592593e-05,
      "loss": 1.4094,
      "num_input_tokens_seen": 34282546960,
      "step": 43574
    },
    {
      "epoch": 4.6228516868236795,
      "grad_norm": 0.6178199134404395,
      "learning_rate": 3.386002347847784e-05,
      "loss": 1.3144,
      "num_input_tokens_seen": 34283333696,
      "step": 43575
    },
    {
      "epoch": 4.622957776363251,
      "grad_norm": 0.6061200791295676,
      "learning_rate": 3.3859373614182996e-05,
      "loss": 1.3087,
      "num_input_tokens_seen": 34284120544,
      "step": 43576
    },
    {
      "epoch": 4.623063865902822,
      "grad_norm": 0.48500247292147114,
      "learning_rate": 3.38587237430419e-05,
      "loss": 1.3723,
      "num_input_tokens_seen": 34284907232,
      "step": 43577
    },
    {
      "epoch": 4.6231699554423935,
      "grad_norm": 0.6495970161006778,
      "learning_rate": 3.385807386505502e-05,
      "loss": 1.3522,
      "num_input_tokens_seen": 34285693968,
      "step": 43578
    },
    {
      "epoch": 4.6232760449819645,
      "grad_norm": 0.7136662611612556,
      "learning_rate": 3.3857423980222896e-05,
      "loss": 1.3753,
      "num_input_tokens_seen": 34286480720,
      "step": 43579
    },
    {
      "epoch": 4.6233821345215365,
      "grad_norm": 0.5412615048773921,
      "learning_rate": 3.385677408854601e-05,
      "loss": 1.443,
      "num_input_tokens_seen": 34287267456,
      "step": 43580
    },
    {
      "epoch": 4.6234882240611075,
      "grad_norm": 0.9931901288371199,
      "learning_rate": 3.385612419002487e-05,
      "loss": 1.395,
      "num_input_tokens_seen": 34288054160,
      "step": 43581
    },
    {
      "epoch": 4.6235943136006785,
      "grad_norm": 0.5122073738732402,
      "learning_rate": 3.3855474284659974e-05,
      "loss": 1.345,
      "num_input_tokens_seen": 34288840896,
      "step": 43582
    },
    {
      "epoch": 4.62370040314025,
      "grad_norm": 0.5753410299706923,
      "learning_rate": 3.385482437245183e-05,
      "loss": 1.1797,
      "num_input_tokens_seen": 34289627664,
      "step": 43583
    },
    {
      "epoch": 4.6238064926798215,
      "grad_norm": 0.8101451607767671,
      "learning_rate": 3.3854174453400935e-05,
      "loss": 1.359,
      "num_input_tokens_seen": 34290414432,
      "step": 43584
    },
    {
      "epoch": 4.623912582219393,
      "grad_norm": 0.5743402255322198,
      "learning_rate": 3.3853524527507795e-05,
      "loss": 1.4258,
      "num_input_tokens_seen": 34291201200,
      "step": 43585
    },
    {
      "epoch": 4.624018671758964,
      "grad_norm": 0.6543298623812485,
      "learning_rate": 3.3852874594772906e-05,
      "loss": 1.2888,
      "num_input_tokens_seen": 34291987936,
      "step": 43586
    },
    {
      "epoch": 4.624124761298536,
      "grad_norm": 0.5717400677198102,
      "learning_rate": 3.385222465519678e-05,
      "loss": 1.3467,
      "num_input_tokens_seen": 34292774720,
      "step": 43587
    },
    {
      "epoch": 4.624230850838107,
      "grad_norm": 0.5156106865370541,
      "learning_rate": 3.385157470877992e-05,
      "loss": 1.3358,
      "num_input_tokens_seen": 34293561488,
      "step": 43588
    },
    {
      "epoch": 4.624336940377678,
      "grad_norm": 0.6085209489681107,
      "learning_rate": 3.385092475552282e-05,
      "loss": 1.3777,
      "num_input_tokens_seen": 34294348192,
      "step": 43589
    },
    {
      "epoch": 4.62444302991725,
      "grad_norm": 0.49390392265731803,
      "learning_rate": 3.385027479542599e-05,
      "loss": 1.3035,
      "num_input_tokens_seen": 34295134864,
      "step": 43590
    },
    {
      "epoch": 4.624549119456821,
      "grad_norm": 0.8213176076759681,
      "learning_rate": 3.384962482848991e-05,
      "loss": 1.3902,
      "num_input_tokens_seen": 34295921536,
      "step": 43591
    },
    {
      "epoch": 4.624655208996393,
      "grad_norm": 0.47949737208748633,
      "learning_rate": 3.384897485471511e-05,
      "loss": 1.3595,
      "num_input_tokens_seen": 34296708304,
      "step": 43592
    },
    {
      "epoch": 4.624761298535964,
      "grad_norm": 0.6150265876842769,
      "learning_rate": 3.3848324874102085e-05,
      "loss": 1.3181,
      "num_input_tokens_seen": 34297495088,
      "step": 43593
    },
    {
      "epoch": 4.624867388075536,
      "grad_norm": 0.7526620252034656,
      "learning_rate": 3.3847674886651335e-05,
      "loss": 1.3129,
      "num_input_tokens_seen": 34298281888,
      "step": 43594
    },
    {
      "epoch": 4.624973477615107,
      "grad_norm": 0.5392320940889326,
      "learning_rate": 3.384702489236335e-05,
      "loss": 1.3513,
      "num_input_tokens_seen": 34299068656,
      "step": 43595
    },
    {
      "epoch": 4.625079567154678,
      "grad_norm": 0.7583444886291064,
      "learning_rate": 3.384637489123865e-05,
      "loss": 1.2058,
      "num_input_tokens_seen": 34299855472,
      "step": 43596
    },
    {
      "epoch": 4.62518565669425,
      "grad_norm": 0.8036472739651814,
      "learning_rate": 3.3845724883277744e-05,
      "loss": 1.2943,
      "num_input_tokens_seen": 34300642208,
      "step": 43597
    },
    {
      "epoch": 4.625291746233821,
      "grad_norm": 0.5995987057899588,
      "learning_rate": 3.3845074868481097e-05,
      "loss": 1.3405,
      "num_input_tokens_seen": 34301428928,
      "step": 43598
    },
    {
      "epoch": 4.625397835773393,
      "grad_norm": 0.9097517925744443,
      "learning_rate": 3.3844424846849246e-05,
      "loss": 1.3761,
      "num_input_tokens_seen": 34302215744,
      "step": 43599
    },
    {
      "epoch": 4.625503925312964,
      "grad_norm": 1.0162977089768268,
      "learning_rate": 3.384377481838269e-05,
      "loss": 1.3379,
      "num_input_tokens_seen": 34303002480,
      "step": 43600
    },
    {
      "epoch": 4.625610014852535,
      "grad_norm": 0.6185372534635645,
      "learning_rate": 3.384312478308191e-05,
      "loss": 1.4269,
      "num_input_tokens_seen": 34303789248,
      "step": 43601
    },
    {
      "epoch": 4.625716104392107,
      "grad_norm": 0.837913197722271,
      "learning_rate": 3.384247474094744e-05,
      "loss": 1.4306,
      "num_input_tokens_seen": 34304575952,
      "step": 43602
    },
    {
      "epoch": 4.625822193931678,
      "grad_norm": 0.8565846122416222,
      "learning_rate": 3.3841824691979755e-05,
      "loss": 1.2163,
      "num_input_tokens_seen": 34305362736,
      "step": 43603
    },
    {
      "epoch": 4.62592828347125,
      "grad_norm": 0.7888789443094528,
      "learning_rate": 3.384117463617937e-05,
      "loss": 1.2289,
      "num_input_tokens_seen": 34306149600,
      "step": 43604
    },
    {
      "epoch": 4.626034373010821,
      "grad_norm": 0.926713808920301,
      "learning_rate": 3.3840524573546786e-05,
      "loss": 1.2832,
      "num_input_tokens_seen": 34306936368,
      "step": 43605
    },
    {
      "epoch": 4.626140462550392,
      "grad_norm": 0.6379216367180474,
      "learning_rate": 3.3839874504082504e-05,
      "loss": 1.2809,
      "num_input_tokens_seen": 34307723200,
      "step": 43606
    },
    {
      "epoch": 4.626246552089964,
      "grad_norm": 0.8646385355533447,
      "learning_rate": 3.383922442778702e-05,
      "loss": 1.3768,
      "num_input_tokens_seen": 34308509936,
      "step": 43607
    },
    {
      "epoch": 4.626352641629535,
      "grad_norm": 0.663595395398815,
      "learning_rate": 3.3838574344660844e-05,
      "loss": 1.4236,
      "num_input_tokens_seen": 34309296704,
      "step": 43608
    },
    {
      "epoch": 4.626458731169107,
      "grad_norm": 0.5422241056426209,
      "learning_rate": 3.383792425470449e-05,
      "loss": 1.2968,
      "num_input_tokens_seen": 34310083392,
      "step": 43609
    },
    {
      "epoch": 4.626564820708678,
      "grad_norm": 0.5257898447764543,
      "learning_rate": 3.383727415791843e-05,
      "loss": 1.341,
      "num_input_tokens_seen": 34310870080,
      "step": 43610
    },
    {
      "epoch": 4.626670910248249,
      "grad_norm": 0.6483771308154739,
      "learning_rate": 3.3836624054303194e-05,
      "loss": 1.3327,
      "num_input_tokens_seen": 34311656928,
      "step": 43611
    },
    {
      "epoch": 4.626776999787821,
      "grad_norm": 0.5224188937921866,
      "learning_rate": 3.383597394385927e-05,
      "loss": 1.3759,
      "num_input_tokens_seen": 34312443728,
      "step": 43612
    },
    {
      "epoch": 4.626883089327392,
      "grad_norm": 0.5185383646798873,
      "learning_rate": 3.3835323826587165e-05,
      "loss": 1.3154,
      "num_input_tokens_seen": 34313230528,
      "step": 43613
    },
    {
      "epoch": 4.626989178866964,
      "grad_norm": 0.6533479488729738,
      "learning_rate": 3.383467370248739e-05,
      "loss": 1.3097,
      "num_input_tokens_seen": 34314017312,
      "step": 43614
    },
    {
      "epoch": 4.627095268406535,
      "grad_norm": 0.5223922944919352,
      "learning_rate": 3.383402357156042e-05,
      "loss": 1.2308,
      "num_input_tokens_seen": 34314804064,
      "step": 43615
    },
    {
      "epoch": 4.627201357946107,
      "grad_norm": 0.6401893451863857,
      "learning_rate": 3.383337343380679e-05,
      "loss": 1.2882,
      "num_input_tokens_seen": 34315590848,
      "step": 43616
    },
    {
      "epoch": 4.627307447485678,
      "grad_norm": 0.5290625285914088,
      "learning_rate": 3.3832723289226984e-05,
      "loss": 1.2559,
      "num_input_tokens_seen": 34316377552,
      "step": 43617
    },
    {
      "epoch": 4.627413537025249,
      "grad_norm": 0.5923752349389282,
      "learning_rate": 3.383207313782151e-05,
      "loss": 1.4093,
      "num_input_tokens_seen": 34317164368,
      "step": 43618
    },
    {
      "epoch": 4.627519626564821,
      "grad_norm": 0.9961756957816085,
      "learning_rate": 3.383142297959087e-05,
      "loss": 1.399,
      "num_input_tokens_seen": 34317951184,
      "step": 43619
    },
    {
      "epoch": 4.627625716104392,
      "grad_norm": 0.6315555574852121,
      "learning_rate": 3.3830772814535564e-05,
      "loss": 1.3409,
      "num_input_tokens_seen": 34318737840,
      "step": 43620
    },
    {
      "epoch": 4.627731805643964,
      "grad_norm": 1.0041617294782985,
      "learning_rate": 3.3830122642656094e-05,
      "loss": 1.3769,
      "num_input_tokens_seen": 34319524576,
      "step": 43621
    },
    {
      "epoch": 4.627837895183535,
      "grad_norm": 0.5853128619464034,
      "learning_rate": 3.382947246395297e-05,
      "loss": 1.3647,
      "num_input_tokens_seen": 34320311376,
      "step": 43622
    },
    {
      "epoch": 4.627943984723107,
      "grad_norm": 0.6648640251573807,
      "learning_rate": 3.3828822278426686e-05,
      "loss": 1.3868,
      "num_input_tokens_seen": 34321098096,
      "step": 43623
    },
    {
      "epoch": 4.628050074262678,
      "grad_norm": 0.5368325111734523,
      "learning_rate": 3.3828172086077744e-05,
      "loss": 1.3127,
      "num_input_tokens_seen": 34321884848,
      "step": 43624
    },
    {
      "epoch": 4.628156163802249,
      "grad_norm": 0.8351091672018602,
      "learning_rate": 3.382752188690665e-05,
      "loss": 1.3484,
      "num_input_tokens_seen": 34322671584,
      "step": 43625
    },
    {
      "epoch": 4.628262253341821,
      "grad_norm": 0.7207445396004009,
      "learning_rate": 3.382687168091391e-05,
      "loss": 1.3269,
      "num_input_tokens_seen": 34323458368,
      "step": 43626
    },
    {
      "epoch": 4.628368342881392,
      "grad_norm": 1.1501269670441756,
      "learning_rate": 3.3826221468100014e-05,
      "loss": 1.2865,
      "num_input_tokens_seen": 34324245136,
      "step": 43627
    },
    {
      "epoch": 4.628474432420964,
      "grad_norm": 0.753764258091758,
      "learning_rate": 3.3825571248465484e-05,
      "loss": 1.3061,
      "num_input_tokens_seen": 34325031872,
      "step": 43628
    },
    {
      "epoch": 4.628580521960535,
      "grad_norm": 0.6615033687123539,
      "learning_rate": 3.38249210220108e-05,
      "loss": 1.4216,
      "num_input_tokens_seen": 34325818608,
      "step": 43629
    },
    {
      "epoch": 4.628686611500106,
      "grad_norm": 1.0158581013392458,
      "learning_rate": 3.382427078873649e-05,
      "loss": 1.3054,
      "num_input_tokens_seen": 34326605344,
      "step": 43630
    },
    {
      "epoch": 4.628792701039678,
      "grad_norm": 0.745679018929612,
      "learning_rate": 3.3823620548643034e-05,
      "loss": 1.3186,
      "num_input_tokens_seen": 34327392000,
      "step": 43631
    },
    {
      "epoch": 4.628898790579249,
      "grad_norm": 1.3362938209073487,
      "learning_rate": 3.382297030173094e-05,
      "loss": 1.3848,
      "num_input_tokens_seen": 34328178704,
      "step": 43632
    },
    {
      "epoch": 4.629004880118821,
      "grad_norm": 0.6697934458515681,
      "learning_rate": 3.3822320048000725e-05,
      "loss": 1.2243,
      "num_input_tokens_seen": 34328965520,
      "step": 43633
    },
    {
      "epoch": 4.629110969658392,
      "grad_norm": 0.7242980540686049,
      "learning_rate": 3.382166978745287e-05,
      "loss": 1.2573,
      "num_input_tokens_seen": 34329752304,
      "step": 43634
    },
    {
      "epoch": 4.629217059197963,
      "grad_norm": 1.079816347017325,
      "learning_rate": 3.3821019520087885e-05,
      "loss": 1.3096,
      "num_input_tokens_seen": 34330539008,
      "step": 43635
    },
    {
      "epoch": 4.629323148737535,
      "grad_norm": 0.7831997218025238,
      "learning_rate": 3.382036924590628e-05,
      "loss": 1.2221,
      "num_input_tokens_seen": 34331325744,
      "step": 43636
    },
    {
      "epoch": 4.629429238277106,
      "grad_norm": 0.8852191759596861,
      "learning_rate": 3.381971896490856e-05,
      "loss": 1.3274,
      "num_input_tokens_seen": 34332112608,
      "step": 43637
    },
    {
      "epoch": 4.6295353278166775,
      "grad_norm": 0.9890946266257649,
      "learning_rate": 3.381906867709521e-05,
      "loss": 1.2289,
      "num_input_tokens_seen": 34332899392,
      "step": 43638
    },
    {
      "epoch": 4.629641417356249,
      "grad_norm": 0.6010212001817965,
      "learning_rate": 3.381841838246674e-05,
      "loss": 1.3099,
      "num_input_tokens_seen": 34333685968,
      "step": 43639
    },
    {
      "epoch": 4.62974750689582,
      "grad_norm": 0.9731972198614598,
      "learning_rate": 3.381776808102367e-05,
      "loss": 1.3694,
      "num_input_tokens_seen": 34334472688,
      "step": 43640
    },
    {
      "epoch": 4.6298535964353915,
      "grad_norm": 0.7771254556712434,
      "learning_rate": 3.381711777276647e-05,
      "loss": 1.2384,
      "num_input_tokens_seen": 34335259520,
      "step": 43641
    },
    {
      "epoch": 4.6299596859749625,
      "grad_norm": 0.6928037002558494,
      "learning_rate": 3.381646745769567e-05,
      "loss": 1.2686,
      "num_input_tokens_seen": 34336046304,
      "step": 43642
    },
    {
      "epoch": 4.6300657755145345,
      "grad_norm": 0.8193413915450857,
      "learning_rate": 3.3815817135811754e-05,
      "loss": 1.3724,
      "num_input_tokens_seen": 34336833088,
      "step": 43643
    },
    {
      "epoch": 4.6301718650541055,
      "grad_norm": 0.788626393149047,
      "learning_rate": 3.381516680711524e-05,
      "loss": 1.281,
      "num_input_tokens_seen": 34337619824,
      "step": 43644
    },
    {
      "epoch": 4.630277954593677,
      "grad_norm": 0.7334655181549034,
      "learning_rate": 3.381451647160663e-05,
      "loss": 1.3716,
      "num_input_tokens_seen": 34338406560,
      "step": 43645
    },
    {
      "epoch": 4.6303840441332484,
      "grad_norm": 0.7917568900302171,
      "learning_rate": 3.381386612928641e-05,
      "loss": 1.3625,
      "num_input_tokens_seen": 34339193344,
      "step": 43646
    },
    {
      "epoch": 4.6304901336728195,
      "grad_norm": 0.8760885249686104,
      "learning_rate": 3.3813215780155086e-05,
      "loss": 1.2878,
      "num_input_tokens_seen": 34339980112,
      "step": 43647
    },
    {
      "epoch": 4.630596223212391,
      "grad_norm": 0.6095197789951029,
      "learning_rate": 3.381256542421318e-05,
      "loss": 1.3065,
      "num_input_tokens_seen": 34340766912,
      "step": 43648
    },
    {
      "epoch": 4.630702312751962,
      "grad_norm": 1.3390042570137108,
      "learning_rate": 3.381191506146119e-05,
      "loss": 1.3276,
      "num_input_tokens_seen": 34341553680,
      "step": 43649
    },
    {
      "epoch": 4.630808402291534,
      "grad_norm": 0.6667085898301222,
      "learning_rate": 3.381126469189959e-05,
      "loss": 1.3464,
      "num_input_tokens_seen": 34342340496,
      "step": 43650
    },
    {
      "epoch": 4.630914491831105,
      "grad_norm": 0.7069591535760977,
      "learning_rate": 3.381061431552892e-05,
      "loss": 1.247,
      "num_input_tokens_seen": 34343127200,
      "step": 43651
    },
    {
      "epoch": 4.631020581370677,
      "grad_norm": 0.8218376342484036,
      "learning_rate": 3.380996393234966e-05,
      "loss": 1.2373,
      "num_input_tokens_seen": 34343913856,
      "step": 43652
    },
    {
      "epoch": 4.631126670910248,
      "grad_norm": 0.6069284029002538,
      "learning_rate": 3.3809313542362315e-05,
      "loss": 1.2829,
      "num_input_tokens_seen": 34344700704,
      "step": 43653
    },
    {
      "epoch": 4.631232760449819,
      "grad_norm": 0.6683080149107795,
      "learning_rate": 3.3808663145567395e-05,
      "loss": 1.2738,
      "num_input_tokens_seen": 34345487456,
      "step": 43654
    },
    {
      "epoch": 4.631338849989391,
      "grad_norm": 0.90258048482987,
      "learning_rate": 3.3808012741965386e-05,
      "loss": 1.356,
      "num_input_tokens_seen": 34346274272,
      "step": 43655
    },
    {
      "epoch": 4.631444939528962,
      "grad_norm": 0.5960160042101881,
      "learning_rate": 3.3807362331556824e-05,
      "loss": 1.3459,
      "num_input_tokens_seen": 34347060976,
      "step": 43656
    },
    {
      "epoch": 4.631551029068534,
      "grad_norm": 0.8692430062971288,
      "learning_rate": 3.380671191434218e-05,
      "loss": 1.3688,
      "num_input_tokens_seen": 34347847680,
      "step": 43657
    },
    {
      "epoch": 4.631657118608105,
      "grad_norm": 0.6925852954645433,
      "learning_rate": 3.3806061490321964e-05,
      "loss": 1.3052,
      "num_input_tokens_seen": 34348634560,
      "step": 43658
    },
    {
      "epoch": 4.631763208147676,
      "grad_norm": 0.5395777356842988,
      "learning_rate": 3.380541105949669e-05,
      "loss": 1.3469,
      "num_input_tokens_seen": 34349421296,
      "step": 43659
    },
    {
      "epoch": 4.631869297687248,
      "grad_norm": 0.5948270474271601,
      "learning_rate": 3.3804760621866846e-05,
      "loss": 1.2725,
      "num_input_tokens_seen": 34350208080,
      "step": 43660
    },
    {
      "epoch": 4.631975387226819,
      "grad_norm": 0.7087533397452382,
      "learning_rate": 3.380411017743294e-05,
      "loss": 1.3871,
      "num_input_tokens_seen": 34350994800,
      "step": 43661
    },
    {
      "epoch": 4.632081476766391,
      "grad_norm": 0.5118013205649595,
      "learning_rate": 3.380345972619549e-05,
      "loss": 1.1621,
      "num_input_tokens_seen": 34351781472,
      "step": 43662
    },
    {
      "epoch": 4.632187566305962,
      "grad_norm": 0.8861313138715028,
      "learning_rate": 3.380280926815498e-05,
      "loss": 1.3053,
      "num_input_tokens_seen": 34352568256,
      "step": 43663
    },
    {
      "epoch": 4.632293655845533,
      "grad_norm": 0.5825027298422464,
      "learning_rate": 3.38021588033119e-05,
      "loss": 1.2606,
      "num_input_tokens_seen": 34353354976,
      "step": 43664
    },
    {
      "epoch": 4.632399745385105,
      "grad_norm": 0.589523388893291,
      "learning_rate": 3.380150833166679e-05,
      "loss": 1.4253,
      "num_input_tokens_seen": 34354141616,
      "step": 43665
    },
    {
      "epoch": 4.632505834924676,
      "grad_norm": 0.9163751661021917,
      "learning_rate": 3.380085785322012e-05,
      "loss": 1.2737,
      "num_input_tokens_seen": 34354928384,
      "step": 43666
    },
    {
      "epoch": 4.632611924464248,
      "grad_norm": 0.62358969346637,
      "learning_rate": 3.380020736797241e-05,
      "loss": 1.3069,
      "num_input_tokens_seen": 34355715232,
      "step": 43667
    },
    {
      "epoch": 4.632718014003819,
      "grad_norm": 0.6529381578946523,
      "learning_rate": 3.3799556875924164e-05,
      "loss": 1.3554,
      "num_input_tokens_seen": 34356501904,
      "step": 43668
    },
    {
      "epoch": 4.63282410354339,
      "grad_norm": 0.9569471165614325,
      "learning_rate": 3.3798906377075875e-05,
      "loss": 1.2804,
      "num_input_tokens_seen": 34357288688,
      "step": 43669
    },
    {
      "epoch": 4.632930193082962,
      "grad_norm": 0.5335880031153304,
      "learning_rate": 3.379825587142804e-05,
      "loss": 1.3746,
      "num_input_tokens_seen": 34358075344,
      "step": 43670
    },
    {
      "epoch": 4.633036282622533,
      "grad_norm": 0.6522891788696721,
      "learning_rate": 3.3797605358981186e-05,
      "loss": 1.3141,
      "num_input_tokens_seen": 34358862016,
      "step": 43671
    },
    {
      "epoch": 4.633142372162105,
      "grad_norm": 0.6773055306087973,
      "learning_rate": 3.379695483973579e-05,
      "loss": 1.3987,
      "num_input_tokens_seen": 34359648720,
      "step": 43672
    },
    {
      "epoch": 4.633248461701676,
      "grad_norm": 0.4709519286116881,
      "learning_rate": 3.379630431369237e-05,
      "loss": 1.3871,
      "num_input_tokens_seen": 34360435392,
      "step": 43673
    },
    {
      "epoch": 4.633354551241248,
      "grad_norm": 0.6348484399185209,
      "learning_rate": 3.379565378085142e-05,
      "loss": 1.2509,
      "num_input_tokens_seen": 34361222176,
      "step": 43674
    },
    {
      "epoch": 4.633460640780819,
      "grad_norm": 0.8009805037194654,
      "learning_rate": 3.3795003241213454e-05,
      "loss": 1.4418,
      "num_input_tokens_seen": 34362009008,
      "step": 43675
    },
    {
      "epoch": 4.633566730320391,
      "grad_norm": 0.6169143073835092,
      "learning_rate": 3.379435269477896e-05,
      "loss": 1.2536,
      "num_input_tokens_seen": 34362795760,
      "step": 43676
    },
    {
      "epoch": 4.633672819859962,
      "grad_norm": 0.99952332730962,
      "learning_rate": 3.3793702141548455e-05,
      "loss": 1.2988,
      "num_input_tokens_seen": 34363582576,
      "step": 43677
    },
    {
      "epoch": 4.633778909399533,
      "grad_norm": 0.5760941420657925,
      "learning_rate": 3.3793051581522426e-05,
      "loss": 1.283,
      "num_input_tokens_seen": 34364369392,
      "step": 43678
    },
    {
      "epoch": 4.633884998939105,
      "grad_norm": 0.7506975352122431,
      "learning_rate": 3.379240101470139e-05,
      "loss": 1.2691,
      "num_input_tokens_seen": 34365156128,
      "step": 43679
    },
    {
      "epoch": 4.633991088478676,
      "grad_norm": 0.6268495355283196,
      "learning_rate": 3.379175044108585e-05,
      "loss": 1.2591,
      "num_input_tokens_seen": 34365942896,
      "step": 43680
    },
    {
      "epoch": 4.634097178018248,
      "grad_norm": 0.7242443617053865,
      "learning_rate": 3.3791099860676296e-05,
      "loss": 1.3712,
      "num_input_tokens_seen": 34366729664,
      "step": 43681
    },
    {
      "epoch": 4.634203267557819,
      "grad_norm": 0.7510846097650404,
      "learning_rate": 3.379044927347324e-05,
      "loss": 1.3719,
      "num_input_tokens_seen": 34367516480,
      "step": 43682
    },
    {
      "epoch": 4.63430935709739,
      "grad_norm": 0.6456350964240584,
      "learning_rate": 3.378979867947718e-05,
      "loss": 1.4579,
      "num_input_tokens_seen": 34368303344,
      "step": 43683
    },
    {
      "epoch": 4.634415446636962,
      "grad_norm": 0.5954011259855047,
      "learning_rate": 3.3789148078688625e-05,
      "loss": 1.2832,
      "num_input_tokens_seen": 34369090128,
      "step": 43684
    },
    {
      "epoch": 4.634521536176533,
      "grad_norm": 0.5137698118633023,
      "learning_rate": 3.378849747110807e-05,
      "loss": 1.2624,
      "num_input_tokens_seen": 34369877008,
      "step": 43685
    },
    {
      "epoch": 4.634627625716105,
      "grad_norm": 1.3775334541508772,
      "learning_rate": 3.3787846856736036e-05,
      "loss": 1.3289,
      "num_input_tokens_seen": 34370663744,
      "step": 43686
    },
    {
      "epoch": 4.634733715255676,
      "grad_norm": 0.8777982920864233,
      "learning_rate": 3.378719623557299e-05,
      "loss": 1.2788,
      "num_input_tokens_seen": 34371450544,
      "step": 43687
    },
    {
      "epoch": 4.634839804795247,
      "grad_norm": 0.7429842152704768,
      "learning_rate": 3.3786545607619466e-05,
      "loss": 1.299,
      "num_input_tokens_seen": 34372237344,
      "step": 43688
    },
    {
      "epoch": 4.634945894334819,
      "grad_norm": 0.787069012753995,
      "learning_rate": 3.378589497287596e-05,
      "loss": 1.3744,
      "num_input_tokens_seen": 34373024096,
      "step": 43689
    },
    {
      "epoch": 4.63505198387439,
      "grad_norm": 1.0012933856511852,
      "learning_rate": 3.3785244331342975e-05,
      "loss": 1.2768,
      "num_input_tokens_seen": 34373810800,
      "step": 43690
    },
    {
      "epoch": 4.635158073413962,
      "grad_norm": 0.5649640304445086,
      "learning_rate": 3.378459368302101e-05,
      "loss": 1.284,
      "num_input_tokens_seen": 34374597488,
      "step": 43691
    },
    {
      "epoch": 4.635264162953533,
      "grad_norm": 1.885871019738953,
      "learning_rate": 3.378394302791056e-05,
      "loss": 1.26,
      "num_input_tokens_seen": 34375384224,
      "step": 43692
    },
    {
      "epoch": 4.635370252493104,
      "grad_norm": 0.8230633524464113,
      "learning_rate": 3.378329236601214e-05,
      "loss": 1.2744,
      "num_input_tokens_seen": 34376170976,
      "step": 43693
    },
    {
      "epoch": 4.635476342032676,
      "grad_norm": 0.9298182268329563,
      "learning_rate": 3.378264169732625e-05,
      "loss": 1.3453,
      "num_input_tokens_seen": 34376957728,
      "step": 43694
    },
    {
      "epoch": 4.635582431572247,
      "grad_norm": 0.8251761313849504,
      "learning_rate": 3.37819910218534e-05,
      "loss": 1.3223,
      "num_input_tokens_seen": 34377744464,
      "step": 43695
    },
    {
      "epoch": 4.635688521111819,
      "grad_norm": 0.9017433506219579,
      "learning_rate": 3.378134033959407e-05,
      "loss": 1.3539,
      "num_input_tokens_seen": 34378531248,
      "step": 43696
    },
    {
      "epoch": 4.63579461065139,
      "grad_norm": 1.329911538488752,
      "learning_rate": 3.378068965054879e-05,
      "loss": 1.3186,
      "num_input_tokens_seen": 34379317984,
      "step": 43697
    },
    {
      "epoch": 4.635900700190961,
      "grad_norm": 1.1635871850688961,
      "learning_rate": 3.3780038954718044e-05,
      "loss": 1.3241,
      "num_input_tokens_seen": 34380104688,
      "step": 43698
    },
    {
      "epoch": 4.636006789730533,
      "grad_norm": 0.6251106955667799,
      "learning_rate": 3.377938825210235e-05,
      "loss": 1.3557,
      "num_input_tokens_seen": 34380891456,
      "step": 43699
    },
    {
      "epoch": 4.636112879270104,
      "grad_norm": 1.228736122642244,
      "learning_rate": 3.37787375427022e-05,
      "loss": 1.3766,
      "num_input_tokens_seen": 34381678256,
      "step": 43700
    },
    {
      "epoch": 4.6362189688096755,
      "grad_norm": 0.960577336592282,
      "learning_rate": 3.37780868265181e-05,
      "loss": 1.3212,
      "num_input_tokens_seen": 34382465040,
      "step": 43701
    },
    {
      "epoch": 4.636325058349247,
      "grad_norm": 0.6835189745044792,
      "learning_rate": 3.377743610355054e-05,
      "loss": 1.3932,
      "num_input_tokens_seen": 34383251808,
      "step": 43702
    },
    {
      "epoch": 4.6364311478888185,
      "grad_norm": 0.8782419724048908,
      "learning_rate": 3.377678537380005e-05,
      "loss": 1.3449,
      "num_input_tokens_seen": 34384038560,
      "step": 43703
    },
    {
      "epoch": 4.6365372374283895,
      "grad_norm": 0.8810991271276001,
      "learning_rate": 3.377613463726711e-05,
      "loss": 1.2557,
      "num_input_tokens_seen": 34384825408,
      "step": 43704
    },
    {
      "epoch": 4.636643326967961,
      "grad_norm": 0.6523114627887986,
      "learning_rate": 3.377548389395223e-05,
      "loss": 1.3476,
      "num_input_tokens_seen": 34385612112,
      "step": 43705
    },
    {
      "epoch": 4.6367494165075325,
      "grad_norm": 0.5748212235728258,
      "learning_rate": 3.377483314385592e-05,
      "loss": 1.368,
      "num_input_tokens_seen": 34386398816,
      "step": 43706
    },
    {
      "epoch": 4.6368555060471035,
      "grad_norm": 0.6866128196858289,
      "learning_rate": 3.377418238697867e-05,
      "loss": 1.2792,
      "num_input_tokens_seen": 34387185568,
      "step": 43707
    },
    {
      "epoch": 4.636961595586675,
      "grad_norm": 0.7817431072316887,
      "learning_rate": 3.377353162332099e-05,
      "loss": 1.3471,
      "num_input_tokens_seen": 34387972368,
      "step": 43708
    },
    {
      "epoch": 4.6370676851262465,
      "grad_norm": 0.49968327386132133,
      "learning_rate": 3.3772880852883385e-05,
      "loss": 1.2487,
      "num_input_tokens_seen": 34388759104,
      "step": 43709
    },
    {
      "epoch": 4.637173774665818,
      "grad_norm": 0.7689424293422733,
      "learning_rate": 3.377223007566635e-05,
      "loss": 1.4619,
      "num_input_tokens_seen": 34389545856,
      "step": 43710
    },
    {
      "epoch": 4.637279864205389,
      "grad_norm": 0.6034615471327158,
      "learning_rate": 3.37715792916704e-05,
      "loss": 1.3379,
      "num_input_tokens_seen": 34390332624,
      "step": 43711
    },
    {
      "epoch": 4.63738595374496,
      "grad_norm": 0.4905005322811528,
      "learning_rate": 3.3770928500896025e-05,
      "loss": 1.3623,
      "num_input_tokens_seen": 34391119344,
      "step": 43712
    },
    {
      "epoch": 4.637492043284532,
      "grad_norm": 0.7504401934271449,
      "learning_rate": 3.3770277703343736e-05,
      "loss": 1.3635,
      "num_input_tokens_seen": 34391906048,
      "step": 43713
    },
    {
      "epoch": 4.637598132824103,
      "grad_norm": 0.609840817944263,
      "learning_rate": 3.376962689901404e-05,
      "loss": 1.3929,
      "num_input_tokens_seen": 34392692864,
      "step": 43714
    },
    {
      "epoch": 4.637704222363675,
      "grad_norm": 0.4959765250540855,
      "learning_rate": 3.376897608790742e-05,
      "loss": 1.2487,
      "num_input_tokens_seen": 34393479600,
      "step": 43715
    },
    {
      "epoch": 4.637810311903246,
      "grad_norm": 0.6160076254404268,
      "learning_rate": 3.37683252700244e-05,
      "loss": 1.2854,
      "num_input_tokens_seen": 34394266464,
      "step": 43716
    },
    {
      "epoch": 4.637916401442817,
      "grad_norm": 0.6061479357697047,
      "learning_rate": 3.376767444536548e-05,
      "loss": 1.2682,
      "num_input_tokens_seen": 34395053296,
      "step": 43717
    },
    {
      "epoch": 4.638022490982389,
      "grad_norm": 0.5318402854845834,
      "learning_rate": 3.3767023613931154e-05,
      "loss": 1.2972,
      "num_input_tokens_seen": 34395840048,
      "step": 43718
    },
    {
      "epoch": 4.63812858052196,
      "grad_norm": 0.6890681795458933,
      "learning_rate": 3.376637277572193e-05,
      "loss": 1.3654,
      "num_input_tokens_seen": 34396626720,
      "step": 43719
    },
    {
      "epoch": 4.638234670061532,
      "grad_norm": 0.661987706029516,
      "learning_rate": 3.3765721930738314e-05,
      "loss": 1.2503,
      "num_input_tokens_seen": 34397413552,
      "step": 43720
    },
    {
      "epoch": 4.638340759601103,
      "grad_norm": 0.5070930476246032,
      "learning_rate": 3.3765071078980795e-05,
      "loss": 1.3787,
      "num_input_tokens_seen": 34398200256,
      "step": 43721
    },
    {
      "epoch": 4.638446849140674,
      "grad_norm": 0.6436746485007815,
      "learning_rate": 3.376442022044989e-05,
      "loss": 1.2469,
      "num_input_tokens_seen": 34398987024,
      "step": 43722
    },
    {
      "epoch": 4.638552938680246,
      "grad_norm": 0.6419856524422733,
      "learning_rate": 3.376376935514611e-05,
      "loss": 1.3677,
      "num_input_tokens_seen": 34399773856,
      "step": 43723
    },
    {
      "epoch": 4.638659028219817,
      "grad_norm": 0.6298387565902592,
      "learning_rate": 3.3763118483069935e-05,
      "loss": 1.3865,
      "num_input_tokens_seen": 34400560480,
      "step": 43724
    },
    {
      "epoch": 4.638765117759389,
      "grad_norm": 0.5390057892053304,
      "learning_rate": 3.376246760422188e-05,
      "loss": 1.3328,
      "num_input_tokens_seen": 34401347344,
      "step": 43725
    },
    {
      "epoch": 4.63887120729896,
      "grad_norm": 0.5979873688072104,
      "learning_rate": 3.376181671860245e-05,
      "loss": 1.4075,
      "num_input_tokens_seen": 34402134144,
      "step": 43726
    },
    {
      "epoch": 4.638977296838532,
      "grad_norm": 0.5478174412425197,
      "learning_rate": 3.376116582621214e-05,
      "loss": 1.3433,
      "num_input_tokens_seen": 34402920864,
      "step": 43727
    },
    {
      "epoch": 4.639083386378103,
      "grad_norm": 0.6299759951809704,
      "learning_rate": 3.376051492705146e-05,
      "loss": 1.349,
      "num_input_tokens_seen": 34403707616,
      "step": 43728
    },
    {
      "epoch": 4.639189475917674,
      "grad_norm": 0.5405677387257258,
      "learning_rate": 3.375986402112091e-05,
      "loss": 1.2872,
      "num_input_tokens_seen": 34404494400,
      "step": 43729
    },
    {
      "epoch": 4.639295565457246,
      "grad_norm": 0.5238612909974807,
      "learning_rate": 3.3759213108421e-05,
      "loss": 1.2809,
      "num_input_tokens_seen": 34405281200,
      "step": 43730
    },
    {
      "epoch": 4.639401654996817,
      "grad_norm": 0.6052189422642807,
      "learning_rate": 3.375856218895222e-05,
      "loss": 1.3032,
      "num_input_tokens_seen": 34406068000,
      "step": 43731
    },
    {
      "epoch": 4.639507744536389,
      "grad_norm": 0.5318680265209359,
      "learning_rate": 3.375791126271509e-05,
      "loss": 1.3577,
      "num_input_tokens_seen": 34406854784,
      "step": 43732
    },
    {
      "epoch": 4.63961383407596,
      "grad_norm": 0.5095791656221055,
      "learning_rate": 3.3757260329710096e-05,
      "loss": 1.3662,
      "num_input_tokens_seen": 34407641520,
      "step": 43733
    },
    {
      "epoch": 4.639719923615532,
      "grad_norm": 0.5694983692840835,
      "learning_rate": 3.375660938993775e-05,
      "loss": 1.3632,
      "num_input_tokens_seen": 34408428144,
      "step": 43734
    },
    {
      "epoch": 4.639826013155103,
      "grad_norm": 0.5027681347254847,
      "learning_rate": 3.375595844339855e-05,
      "loss": 1.3357,
      "num_input_tokens_seen": 34409214880,
      "step": 43735
    },
    {
      "epoch": 4.639932102694674,
      "grad_norm": 0.4979861498586627,
      "learning_rate": 3.3755307490093003e-05,
      "loss": 1.3507,
      "num_input_tokens_seen": 34410001632,
      "step": 43736
    },
    {
      "epoch": 4.640038192234246,
      "grad_norm": 0.42206276961661754,
      "learning_rate": 3.3754656530021614e-05,
      "loss": 1.3252,
      "num_input_tokens_seen": 34410788400,
      "step": 43737
    },
    {
      "epoch": 4.640144281773817,
      "grad_norm": 0.5510416945003783,
      "learning_rate": 3.3754005563184884e-05,
      "loss": 1.3064,
      "num_input_tokens_seen": 34411575088,
      "step": 43738
    },
    {
      "epoch": 4.640250371313389,
      "grad_norm": 0.5217181843829017,
      "learning_rate": 3.3753354589583316e-05,
      "loss": 1.3769,
      "num_input_tokens_seen": 34412361824,
      "step": 43739
    },
    {
      "epoch": 4.64035646085296,
      "grad_norm": 0.5282234185288162,
      "learning_rate": 3.37527036092174e-05,
      "loss": 1.3153,
      "num_input_tokens_seen": 34413148544,
      "step": 43740
    },
    {
      "epoch": 4.640462550392531,
      "grad_norm": 0.5241381734174109,
      "learning_rate": 3.375205262208766e-05,
      "loss": 1.304,
      "num_input_tokens_seen": 34413935296,
      "step": 43741
    },
    {
      "epoch": 4.640568639932103,
      "grad_norm": 0.5118466071200066,
      "learning_rate": 3.37514016281946e-05,
      "loss": 1.2639,
      "num_input_tokens_seen": 34414722096,
      "step": 43742
    },
    {
      "epoch": 4.640674729471674,
      "grad_norm": 0.5058810375005268,
      "learning_rate": 3.37507506275387e-05,
      "loss": 1.2471,
      "num_input_tokens_seen": 34415508800,
      "step": 43743
    },
    {
      "epoch": 4.640780819011246,
      "grad_norm": 0.5270844591099625,
      "learning_rate": 3.3750099620120476e-05,
      "loss": 1.3913,
      "num_input_tokens_seen": 34416295520,
      "step": 43744
    },
    {
      "epoch": 4.640886908550817,
      "grad_norm": 0.5601167850801396,
      "learning_rate": 3.3749448605940445e-05,
      "loss": 1.3871,
      "num_input_tokens_seen": 34417082192,
      "step": 43745
    },
    {
      "epoch": 4.640992998090388,
      "grad_norm": 0.5471836815102479,
      "learning_rate": 3.374879758499909e-05,
      "loss": 1.3516,
      "num_input_tokens_seen": 34417868928,
      "step": 43746
    },
    {
      "epoch": 4.64109908762996,
      "grad_norm": 0.5147138280829779,
      "learning_rate": 3.374814655729692e-05,
      "loss": 1.2707,
      "num_input_tokens_seen": 34418655744,
      "step": 43747
    },
    {
      "epoch": 4.641205177169531,
      "grad_norm": 0.5785354974592192,
      "learning_rate": 3.374749552283444e-05,
      "loss": 1.3456,
      "num_input_tokens_seen": 34419442448,
      "step": 43748
    },
    {
      "epoch": 4.641311266709103,
      "grad_norm": 0.49189637393098,
      "learning_rate": 3.374684448161215e-05,
      "loss": 1.2637,
      "num_input_tokens_seen": 34420229312,
      "step": 43749
    },
    {
      "epoch": 4.641417356248674,
      "grad_norm": 0.5818385851827547,
      "learning_rate": 3.3746193433630555e-05,
      "loss": 1.2435,
      "num_input_tokens_seen": 34421016080,
      "step": 43750
    },
    {
      "epoch": 4.641523445788245,
      "grad_norm": 0.49295831622777125,
      "learning_rate": 3.374554237889017e-05,
      "loss": 1.4001,
      "num_input_tokens_seen": 34421802768,
      "step": 43751
    },
    {
      "epoch": 4.641629535327817,
      "grad_norm": 0.5518260520323072,
      "learning_rate": 3.3744891317391477e-05,
      "loss": 1.3005,
      "num_input_tokens_seen": 34422589504,
      "step": 43752
    },
    {
      "epoch": 4.641735624867388,
      "grad_norm": 0.5773958994819023,
      "learning_rate": 3.3744240249134986e-05,
      "loss": 1.3329,
      "num_input_tokens_seen": 34423376304,
      "step": 43753
    },
    {
      "epoch": 4.64184171440696,
      "grad_norm": 0.475073785375673,
      "learning_rate": 3.3743589174121205e-05,
      "loss": 1.2289,
      "num_input_tokens_seen": 34424163088,
      "step": 43754
    },
    {
      "epoch": 4.641947803946531,
      "grad_norm": 0.631427627940439,
      "learning_rate": 3.374293809235064e-05,
      "loss": 1.2671,
      "num_input_tokens_seen": 34424949856,
      "step": 43755
    },
    {
      "epoch": 4.642053893486103,
      "grad_norm": 0.742679999133624,
      "learning_rate": 3.374228700382378e-05,
      "loss": 1.3374,
      "num_input_tokens_seen": 34425736608,
      "step": 43756
    },
    {
      "epoch": 4.642159983025674,
      "grad_norm": 0.49719585678357864,
      "learning_rate": 3.3741635908541144e-05,
      "loss": 1.3071,
      "num_input_tokens_seen": 34426523408,
      "step": 43757
    },
    {
      "epoch": 4.642266072565245,
      "grad_norm": 0.5663744250245143,
      "learning_rate": 3.374098480650322e-05,
      "loss": 1.2599,
      "num_input_tokens_seen": 34427310240,
      "step": 43758
    },
    {
      "epoch": 4.642372162104817,
      "grad_norm": 0.5533677320032411,
      "learning_rate": 3.374033369771052e-05,
      "loss": 1.3287,
      "num_input_tokens_seen": 34428097008,
      "step": 43759
    },
    {
      "epoch": 4.642478251644388,
      "grad_norm": 0.9513054317108789,
      "learning_rate": 3.373968258216356e-05,
      "loss": 1.35,
      "num_input_tokens_seen": 34428883744,
      "step": 43760
    },
    {
      "epoch": 4.64258434118396,
      "grad_norm": 0.5186744264484355,
      "learning_rate": 3.373903145986282e-05,
      "loss": 1.3024,
      "num_input_tokens_seen": 34429670560,
      "step": 43761
    },
    {
      "epoch": 4.642690430723531,
      "grad_norm": 0.4961210340787024,
      "learning_rate": 3.373838033080881e-05,
      "loss": 1.3097,
      "num_input_tokens_seen": 34430457360,
      "step": 43762
    },
    {
      "epoch": 4.6427965202631025,
      "grad_norm": 0.7258705208945874,
      "learning_rate": 3.373772919500204e-05,
      "loss": 1.3636,
      "num_input_tokens_seen": 34431244096,
      "step": 43763
    },
    {
      "epoch": 4.6429026098026736,
      "grad_norm": 0.5090485709825957,
      "learning_rate": 3.3737078052443014e-05,
      "loss": 1.345,
      "num_input_tokens_seen": 34432030864,
      "step": 43764
    },
    {
      "epoch": 4.643008699342245,
      "grad_norm": 0.551774170751897,
      "learning_rate": 3.3736426903132226e-05,
      "loss": 1.1906,
      "num_input_tokens_seen": 34432817680,
      "step": 43765
    },
    {
      "epoch": 4.6431147888818165,
      "grad_norm": 0.5457641222765786,
      "learning_rate": 3.3735775747070186e-05,
      "loss": 1.3055,
      "num_input_tokens_seen": 34433604336,
      "step": 43766
    },
    {
      "epoch": 4.6432208784213875,
      "grad_norm": 0.4435490466306236,
      "learning_rate": 3.373512458425739e-05,
      "loss": 1.2297,
      "num_input_tokens_seen": 34434391072,
      "step": 43767
    },
    {
      "epoch": 4.6433269679609595,
      "grad_norm": 0.5784639201721203,
      "learning_rate": 3.373447341469435e-05,
      "loss": 1.2765,
      "num_input_tokens_seen": 34435177824,
      "step": 43768
    },
    {
      "epoch": 4.6434330575005305,
      "grad_norm": 0.5085017501647782,
      "learning_rate": 3.3733822238381566e-05,
      "loss": 1.3566,
      "num_input_tokens_seen": 34435964560,
      "step": 43769
    },
    {
      "epoch": 4.6435391470401015,
      "grad_norm": 0.5416415485353547,
      "learning_rate": 3.373317105531954e-05,
      "loss": 1.297,
      "num_input_tokens_seen": 34436751328,
      "step": 43770
    },
    {
      "epoch": 4.643645236579673,
      "grad_norm": 0.5809730021222738,
      "learning_rate": 3.373251986550876e-05,
      "loss": 1.2999,
      "num_input_tokens_seen": 34437538144,
      "step": 43771
    },
    {
      "epoch": 4.6437513261192445,
      "grad_norm": 0.5695434650286471,
      "learning_rate": 3.3731868668949766e-05,
      "loss": 1.3082,
      "num_input_tokens_seen": 34438324992,
      "step": 43772
    },
    {
      "epoch": 4.643857415658816,
      "grad_norm": 0.5372618934501479,
      "learning_rate": 3.373121746564303e-05,
      "loss": 1.2963,
      "num_input_tokens_seen": 34439111696,
      "step": 43773
    },
    {
      "epoch": 4.643963505198387,
      "grad_norm": 0.4917107384106309,
      "learning_rate": 3.373056625558907e-05,
      "loss": 1.2953,
      "num_input_tokens_seen": 34439898480,
      "step": 43774
    },
    {
      "epoch": 4.644069594737958,
      "grad_norm": 0.5448870620046803,
      "learning_rate": 3.372991503878838e-05,
      "loss": 1.3203,
      "num_input_tokens_seen": 34440685168,
      "step": 43775
    },
    {
      "epoch": 4.64417568427753,
      "grad_norm": 0.6256690926376488,
      "learning_rate": 3.372926381524147e-05,
      "loss": 1.3671,
      "num_input_tokens_seen": 34441471888,
      "step": 43776
    },
    {
      "epoch": 4.644281773817101,
      "grad_norm": 0.7146870898513203,
      "learning_rate": 3.372861258494885e-05,
      "loss": 1.3249,
      "num_input_tokens_seen": 34442258592,
      "step": 43777
    },
    {
      "epoch": 4.644387863356673,
      "grad_norm": 0.524399277870542,
      "learning_rate": 3.3727961347911e-05,
      "loss": 1.2675,
      "num_input_tokens_seen": 34443045424,
      "step": 43778
    },
    {
      "epoch": 4.644493952896244,
      "grad_norm": 0.5901114703543732,
      "learning_rate": 3.372731010412844e-05,
      "loss": 1.3408,
      "num_input_tokens_seen": 34443832096,
      "step": 43779
    },
    {
      "epoch": 4.644600042435815,
      "grad_norm": 0.650694338939874,
      "learning_rate": 3.3726658853601676e-05,
      "loss": 1.2638,
      "num_input_tokens_seen": 34444618848,
      "step": 43780
    },
    {
      "epoch": 4.644706131975387,
      "grad_norm": 0.48217046264159935,
      "learning_rate": 3.3726007596331206e-05,
      "loss": 1.1939,
      "num_input_tokens_seen": 34445405632,
      "step": 43781
    },
    {
      "epoch": 4.644812221514958,
      "grad_norm": 0.6318913211059941,
      "learning_rate": 3.3725356332317534e-05,
      "loss": 1.3039,
      "num_input_tokens_seen": 34446192400,
      "step": 43782
    },
    {
      "epoch": 4.64491831105453,
      "grad_norm": 0.6560270714515427,
      "learning_rate": 3.3724705061561155e-05,
      "loss": 1.3722,
      "num_input_tokens_seen": 34446979248,
      "step": 43783
    },
    {
      "epoch": 4.645024400594101,
      "grad_norm": 0.5714201752670438,
      "learning_rate": 3.372405378406259e-05,
      "loss": 1.3299,
      "num_input_tokens_seen": 34447765968,
      "step": 43784
    },
    {
      "epoch": 4.645130490133673,
      "grad_norm": 0.6099411382529021,
      "learning_rate": 3.3723402499822326e-05,
      "loss": 1.3904,
      "num_input_tokens_seen": 34448552768,
      "step": 43785
    },
    {
      "epoch": 4.645236579673244,
      "grad_norm": 0.46111808295138546,
      "learning_rate": 3.3722751208840873e-05,
      "loss": 1.2615,
      "num_input_tokens_seen": 34449339536,
      "step": 43786
    },
    {
      "epoch": 4.645342669212815,
      "grad_norm": 0.6611948909161739,
      "learning_rate": 3.372209991111873e-05,
      "loss": 1.342,
      "num_input_tokens_seen": 34450126304,
      "step": 43787
    },
    {
      "epoch": 4.645448758752387,
      "grad_norm": 0.423705815446689,
      "learning_rate": 3.372144860665641e-05,
      "loss": 1.2342,
      "num_input_tokens_seen": 34450913168,
      "step": 43788
    },
    {
      "epoch": 4.645554848291958,
      "grad_norm": 0.5060325740513645,
      "learning_rate": 3.372079729545441e-05,
      "loss": 1.2845,
      "num_input_tokens_seen": 34451699952,
      "step": 43789
    },
    {
      "epoch": 4.64566093783153,
      "grad_norm": 0.5339130473085878,
      "learning_rate": 3.372014597751323e-05,
      "loss": 1.3565,
      "num_input_tokens_seen": 34452486704,
      "step": 43790
    },
    {
      "epoch": 4.645767027371101,
      "grad_norm": 0.7396460440127716,
      "learning_rate": 3.371949465283338e-05,
      "loss": 1.245,
      "num_input_tokens_seen": 34453273488,
      "step": 43791
    },
    {
      "epoch": 4.645873116910673,
      "grad_norm": 0.8313050566843104,
      "learning_rate": 3.3718843321415363e-05,
      "loss": 1.3513,
      "num_input_tokens_seen": 34454060208,
      "step": 43792
    },
    {
      "epoch": 4.645979206450244,
      "grad_norm": 0.6130845309184305,
      "learning_rate": 3.371819198325967e-05,
      "loss": 1.3765,
      "num_input_tokens_seen": 34454846944,
      "step": 43793
    },
    {
      "epoch": 4.646085295989815,
      "grad_norm": 0.5362520086547369,
      "learning_rate": 3.371754063836683e-05,
      "loss": 1.3109,
      "num_input_tokens_seen": 34455633744,
      "step": 43794
    },
    {
      "epoch": 4.646191385529387,
      "grad_norm": 0.5579273635278754,
      "learning_rate": 3.371688928673732e-05,
      "loss": 1.3197,
      "num_input_tokens_seen": 34456420512,
      "step": 43795
    },
    {
      "epoch": 4.646297475068958,
      "grad_norm": 0.5744898065414222,
      "learning_rate": 3.371623792837165e-05,
      "loss": 1.3088,
      "num_input_tokens_seen": 34457207312,
      "step": 43796
    },
    {
      "epoch": 4.64640356460853,
      "grad_norm": 0.5418340489958169,
      "learning_rate": 3.371558656327034e-05,
      "loss": 1.322,
      "num_input_tokens_seen": 34457994000,
      "step": 43797
    },
    {
      "epoch": 4.646509654148101,
      "grad_norm": 0.49990605755564743,
      "learning_rate": 3.371493519143387e-05,
      "loss": 1.3541,
      "num_input_tokens_seen": 34458780784,
      "step": 43798
    },
    {
      "epoch": 4.646615743687672,
      "grad_norm": 0.5032969126519681,
      "learning_rate": 3.3714283812862754e-05,
      "loss": 1.2135,
      "num_input_tokens_seen": 34459567632,
      "step": 43799
    },
    {
      "epoch": 4.646721833227244,
      "grad_norm": 0.6065502399658608,
      "learning_rate": 3.37136324275575e-05,
      "loss": 1.2959,
      "num_input_tokens_seen": 34460354480,
      "step": 43800
    },
    {
      "epoch": 4.646827922766815,
      "grad_norm": 0.4757006894893953,
      "learning_rate": 3.37129810355186e-05,
      "loss": 1.2778,
      "num_input_tokens_seen": 34461141232,
      "step": 43801
    },
    {
      "epoch": 4.646934012306387,
      "grad_norm": 0.5793114838132785,
      "learning_rate": 3.371232963674657e-05,
      "loss": 1.3125,
      "num_input_tokens_seen": 34461927968,
      "step": 43802
    },
    {
      "epoch": 4.647040101845958,
      "grad_norm": 0.4645143079701057,
      "learning_rate": 3.37116782312419e-05,
      "loss": 1.2692,
      "num_input_tokens_seen": 34462714800,
      "step": 43803
    },
    {
      "epoch": 4.647146191385529,
      "grad_norm": 0.60471565685147,
      "learning_rate": 3.371102681900511e-05,
      "loss": 1.254,
      "num_input_tokens_seen": 34463501648,
      "step": 43804
    },
    {
      "epoch": 4.647252280925101,
      "grad_norm": 0.5475085508570586,
      "learning_rate": 3.371037540003669e-05,
      "loss": 1.3287,
      "num_input_tokens_seen": 34464288480,
      "step": 43805
    },
    {
      "epoch": 4.647358370464672,
      "grad_norm": 0.533163557059559,
      "learning_rate": 3.370972397433716e-05,
      "loss": 1.2765,
      "num_input_tokens_seen": 34465075264,
      "step": 43806
    },
    {
      "epoch": 4.647464460004244,
      "grad_norm": 0.5181082258280062,
      "learning_rate": 3.370907254190699e-05,
      "loss": 1.3343,
      "num_input_tokens_seen": 34465862096,
      "step": 43807
    },
    {
      "epoch": 4.647570549543815,
      "grad_norm": 0.5963163279285861,
      "learning_rate": 3.370842110274671e-05,
      "loss": 1.341,
      "num_input_tokens_seen": 34466648832,
      "step": 43808
    },
    {
      "epoch": 4.647676639083386,
      "grad_norm": 0.5382861919357406,
      "learning_rate": 3.370776965685682e-05,
      "loss": 1.3117,
      "num_input_tokens_seen": 34467435552,
      "step": 43809
    },
    {
      "epoch": 4.647782728622958,
      "grad_norm": 0.5193171638571809,
      "learning_rate": 3.370711820423783e-05,
      "loss": 1.2862,
      "num_input_tokens_seen": 34468222288,
      "step": 43810
    },
    {
      "epoch": 4.647888818162529,
      "grad_norm": 0.5387168409647615,
      "learning_rate": 3.370646674489022e-05,
      "loss": 1.3336,
      "num_input_tokens_seen": 34469009008,
      "step": 43811
    },
    {
      "epoch": 4.647994907702101,
      "grad_norm": 0.5720473653298448,
      "learning_rate": 3.3705815278814514e-05,
      "loss": 1.3587,
      "num_input_tokens_seen": 34469795792,
      "step": 43812
    },
    {
      "epoch": 4.648100997241672,
      "grad_norm": 0.6568238021669545,
      "learning_rate": 3.3705163806011205e-05,
      "loss": 1.3396,
      "num_input_tokens_seen": 34470582592,
      "step": 43813
    },
    {
      "epoch": 4.648207086781244,
      "grad_norm": 0.5442136185653396,
      "learning_rate": 3.3704512326480815e-05,
      "loss": 1.4258,
      "num_input_tokens_seen": 34471369280,
      "step": 43814
    },
    {
      "epoch": 4.648313176320815,
      "grad_norm": 0.5164988015677539,
      "learning_rate": 3.3703860840223824e-05,
      "loss": 1.3554,
      "num_input_tokens_seen": 34472156080,
      "step": 43815
    },
    {
      "epoch": 4.648419265860386,
      "grad_norm": 0.5147493069663631,
      "learning_rate": 3.370320934724074e-05,
      "loss": 1.3956,
      "num_input_tokens_seen": 34472942800,
      "step": 43816
    },
    {
      "epoch": 4.648525355399958,
      "grad_norm": 0.5362663634852106,
      "learning_rate": 3.370255784753208e-05,
      "loss": 1.2541,
      "num_input_tokens_seen": 34473729616,
      "step": 43817
    },
    {
      "epoch": 4.648631444939529,
      "grad_norm": 0.5393912709480324,
      "learning_rate": 3.3701906341098324e-05,
      "loss": 1.3657,
      "num_input_tokens_seen": 34474516304,
      "step": 43818
    },
    {
      "epoch": 4.648737534479101,
      "grad_norm": 0.4612661900393895,
      "learning_rate": 3.370125482794e-05,
      "loss": 1.2311,
      "num_input_tokens_seen": 34475303104,
      "step": 43819
    },
    {
      "epoch": 4.648843624018672,
      "grad_norm": 0.7264996036700706,
      "learning_rate": 3.370060330805761e-05,
      "loss": 1.4345,
      "num_input_tokens_seen": 34476089776,
      "step": 43820
    },
    {
      "epoch": 4.648949713558244,
      "grad_norm": 0.5414700472190352,
      "learning_rate": 3.369995178145164e-05,
      "loss": 1.3192,
      "num_input_tokens_seen": 34476876528,
      "step": 43821
    },
    {
      "epoch": 4.649055803097815,
      "grad_norm": 0.5992258839409115,
      "learning_rate": 3.36993002481226e-05,
      "loss": 1.305,
      "num_input_tokens_seen": 34477663344,
      "step": 43822
    },
    {
      "epoch": 4.649161892637386,
      "grad_norm": 0.5139228696644464,
      "learning_rate": 3.3698648708071e-05,
      "loss": 1.2118,
      "num_input_tokens_seen": 34478450160,
      "step": 43823
    },
    {
      "epoch": 4.649267982176958,
      "grad_norm": 0.5503083733090337,
      "learning_rate": 3.369799716129734e-05,
      "loss": 1.2211,
      "num_input_tokens_seen": 34479236944,
      "step": 43824
    },
    {
      "epoch": 4.649374071716529,
      "grad_norm": 0.5461578411460208,
      "learning_rate": 3.369734560780212e-05,
      "loss": 1.3063,
      "num_input_tokens_seen": 34480023664,
      "step": 43825
    },
    {
      "epoch": 4.6494801612561005,
      "grad_norm": 0.5682347300517921,
      "learning_rate": 3.369669404758585e-05,
      "loss": 1.3991,
      "num_input_tokens_seen": 34480810400,
      "step": 43826
    },
    {
      "epoch": 4.649586250795672,
      "grad_norm": 0.6069974755447745,
      "learning_rate": 3.369604248064903e-05,
      "loss": 1.2224,
      "num_input_tokens_seen": 34481597120,
      "step": 43827
    },
    {
      "epoch": 4.649692340335243,
      "grad_norm": 0.48498137490034454,
      "learning_rate": 3.369539090699216e-05,
      "loss": 1.2962,
      "num_input_tokens_seen": 34482383872,
      "step": 43828
    },
    {
      "epoch": 4.6497984298748145,
      "grad_norm": 0.5819597635745064,
      "learning_rate": 3.3694739326615757e-05,
      "loss": 1.3888,
      "num_input_tokens_seen": 34483170752,
      "step": 43829
    },
    {
      "epoch": 4.6499045194143855,
      "grad_norm": 0.6306289332414654,
      "learning_rate": 3.36940877395203e-05,
      "loss": 1.3949,
      "num_input_tokens_seen": 34483957472,
      "step": 43830
    },
    {
      "epoch": 4.6500106089539575,
      "grad_norm": 0.5505162136110908,
      "learning_rate": 3.369343614570631e-05,
      "loss": 1.3718,
      "num_input_tokens_seen": 34484744224,
      "step": 43831
    },
    {
      "epoch": 4.6501166984935285,
      "grad_norm": 0.724620249366902,
      "learning_rate": 3.36927845451743e-05,
      "loss": 1.447,
      "num_input_tokens_seen": 34485531008,
      "step": 43832
    },
    {
      "epoch": 4.6502227880330995,
      "grad_norm": 0.5439415160373843,
      "learning_rate": 3.369213293792475e-05,
      "loss": 1.2281,
      "num_input_tokens_seen": 34486317760,
      "step": 43833
    },
    {
      "epoch": 4.650328877572671,
      "grad_norm": 0.5561902595196481,
      "learning_rate": 3.369148132395818e-05,
      "loss": 1.3184,
      "num_input_tokens_seen": 34487104560,
      "step": 43834
    },
    {
      "epoch": 4.6504349671122425,
      "grad_norm": 0.4836970721289645,
      "learning_rate": 3.3690829703275077e-05,
      "loss": 1.2284,
      "num_input_tokens_seen": 34487891408,
      "step": 43835
    },
    {
      "epoch": 4.650541056651814,
      "grad_norm": 0.5161332394392766,
      "learning_rate": 3.369017807587597e-05,
      "loss": 1.3746,
      "num_input_tokens_seen": 34488678128,
      "step": 43836
    },
    {
      "epoch": 4.650647146191385,
      "grad_norm": 0.4963497087880008,
      "learning_rate": 3.368952644176134e-05,
      "loss": 1.2525,
      "num_input_tokens_seen": 34489464912,
      "step": 43837
    },
    {
      "epoch": 4.6507532357309564,
      "grad_norm": 0.512450690443659,
      "learning_rate": 3.36888748009317e-05,
      "loss": 1.3025,
      "num_input_tokens_seen": 34490251696,
      "step": 43838
    },
    {
      "epoch": 4.650859325270528,
      "grad_norm": 0.538360811983855,
      "learning_rate": 3.368822315338755e-05,
      "loss": 1.2924,
      "num_input_tokens_seen": 34491038464,
      "step": 43839
    },
    {
      "epoch": 4.650965414810099,
      "grad_norm": 0.5565062709358067,
      "learning_rate": 3.3687571499129404e-05,
      "loss": 1.3119,
      "num_input_tokens_seen": 34491825248,
      "step": 43840
    },
    {
      "epoch": 4.651071504349671,
      "grad_norm": 0.5454067106177277,
      "learning_rate": 3.368691983815775e-05,
      "loss": 1.2892,
      "num_input_tokens_seen": 34492612064,
      "step": 43841
    },
    {
      "epoch": 4.651177593889242,
      "grad_norm": 0.5392175533749417,
      "learning_rate": 3.368626817047311e-05,
      "loss": 1.2531,
      "num_input_tokens_seen": 34493398880,
      "step": 43842
    },
    {
      "epoch": 4.651283683428814,
      "grad_norm": 0.48954049001924854,
      "learning_rate": 3.3685616496075964e-05,
      "loss": 1.2465,
      "num_input_tokens_seen": 34494185712,
      "step": 43843
    },
    {
      "epoch": 4.651389772968385,
      "grad_norm": 0.5395424926052445,
      "learning_rate": 3.3684964814966836e-05,
      "loss": 1.3686,
      "num_input_tokens_seen": 34494972464,
      "step": 43844
    },
    {
      "epoch": 4.651495862507957,
      "grad_norm": 0.4681280417814429,
      "learning_rate": 3.368431312714622e-05,
      "loss": 1.2226,
      "num_input_tokens_seen": 34495759328,
      "step": 43845
    },
    {
      "epoch": 4.651601952047528,
      "grad_norm": 0.49454922066373014,
      "learning_rate": 3.368366143261463e-05,
      "loss": 1.3727,
      "num_input_tokens_seen": 34496546096,
      "step": 43846
    },
    {
      "epoch": 4.651708041587099,
      "grad_norm": 0.538259968471152,
      "learning_rate": 3.3683009731372544e-05,
      "loss": 1.2139,
      "num_input_tokens_seen": 34497333008,
      "step": 43847
    },
    {
      "epoch": 4.651814131126671,
      "grad_norm": 0.5365656495093428,
      "learning_rate": 3.3682358023420495e-05,
      "loss": 1.1582,
      "num_input_tokens_seen": 34498119824,
      "step": 43848
    },
    {
      "epoch": 4.651920220666242,
      "grad_norm": 0.6046413427983003,
      "learning_rate": 3.3681706308758976e-05,
      "loss": 1.2956,
      "num_input_tokens_seen": 34498906592,
      "step": 43849
    },
    {
      "epoch": 4.652026310205814,
      "grad_norm": 0.5605626998718831,
      "learning_rate": 3.3681054587388475e-05,
      "loss": 1.3431,
      "num_input_tokens_seen": 34499693376,
      "step": 43850
    },
    {
      "epoch": 4.652132399745385,
      "grad_norm": 0.7200217020610818,
      "learning_rate": 3.368040285930952e-05,
      "loss": 1.327,
      "num_input_tokens_seen": 34500480176,
      "step": 43851
    },
    {
      "epoch": 4.652238489284956,
      "grad_norm": 0.6516403469289966,
      "learning_rate": 3.367975112452261e-05,
      "loss": 1.4,
      "num_input_tokens_seen": 34501266976,
      "step": 43852
    },
    {
      "epoch": 4.652344578824528,
      "grad_norm": 0.5959610101553269,
      "learning_rate": 3.3679099383028236e-05,
      "loss": 1.2849,
      "num_input_tokens_seen": 34502053712,
      "step": 43853
    },
    {
      "epoch": 4.652450668364099,
      "grad_norm": 0.8163743414823433,
      "learning_rate": 3.367844763482691e-05,
      "loss": 1.3122,
      "num_input_tokens_seen": 34502840464,
      "step": 43854
    },
    {
      "epoch": 4.652556757903671,
      "grad_norm": 0.5726705953865902,
      "learning_rate": 3.367779587991914e-05,
      "loss": 1.3366,
      "num_input_tokens_seen": 34503627312,
      "step": 43855
    },
    {
      "epoch": 4.652662847443242,
      "grad_norm": 0.6315738000302092,
      "learning_rate": 3.367714411830541e-05,
      "loss": 1.349,
      "num_input_tokens_seen": 34504414048,
      "step": 43856
    },
    {
      "epoch": 4.652768936982813,
      "grad_norm": 0.5388641787718466,
      "learning_rate": 3.367649234998624e-05,
      "loss": 1.3303,
      "num_input_tokens_seen": 34505200704,
      "step": 43857
    },
    {
      "epoch": 4.652875026522385,
      "grad_norm": 0.5385449105169482,
      "learning_rate": 3.3675840574962146e-05,
      "loss": 1.2165,
      "num_input_tokens_seen": 34505987536,
      "step": 43858
    },
    {
      "epoch": 4.652981116061956,
      "grad_norm": 0.6887593680841188,
      "learning_rate": 3.36751887932336e-05,
      "loss": 1.2599,
      "num_input_tokens_seen": 34506774288,
      "step": 43859
    },
    {
      "epoch": 4.653087205601528,
      "grad_norm": 0.5063264486753166,
      "learning_rate": 3.367453700480113e-05,
      "loss": 1.2636,
      "num_input_tokens_seen": 34507561088,
      "step": 43860
    },
    {
      "epoch": 4.653193295141099,
      "grad_norm": 0.501620224474554,
      "learning_rate": 3.3673885209665234e-05,
      "loss": 1.2757,
      "num_input_tokens_seen": 34508347680,
      "step": 43861
    },
    {
      "epoch": 4.65329938468067,
      "grad_norm": 0.5522879488810263,
      "learning_rate": 3.367323340782641e-05,
      "loss": 1.2481,
      "num_input_tokens_seen": 34509134336,
      "step": 43862
    },
    {
      "epoch": 4.653405474220242,
      "grad_norm": 0.4695054626390998,
      "learning_rate": 3.3672581599285176e-05,
      "loss": 1.2668,
      "num_input_tokens_seen": 34509921136,
      "step": 43863
    },
    {
      "epoch": 4.653511563759813,
      "grad_norm": 0.5535917716764859,
      "learning_rate": 3.367192978404201e-05,
      "loss": 1.3051,
      "num_input_tokens_seen": 34510707920,
      "step": 43864
    },
    {
      "epoch": 4.653617653299385,
      "grad_norm": 0.5715480473312611,
      "learning_rate": 3.367127796209745e-05,
      "loss": 1.2451,
      "num_input_tokens_seen": 34511494640,
      "step": 43865
    },
    {
      "epoch": 4.653723742838956,
      "grad_norm": 0.555478810551082,
      "learning_rate": 3.3670626133451966e-05,
      "loss": 1.333,
      "num_input_tokens_seen": 34512281344,
      "step": 43866
    },
    {
      "epoch": 4.653829832378527,
      "grad_norm": 0.5401743316716404,
      "learning_rate": 3.366997429810608e-05,
      "loss": 1.3678,
      "num_input_tokens_seen": 34513068096,
      "step": 43867
    },
    {
      "epoch": 4.653935921918099,
      "grad_norm": 0.6263036591152649,
      "learning_rate": 3.366932245606029e-05,
      "loss": 1.3797,
      "num_input_tokens_seen": 34513854768,
      "step": 43868
    },
    {
      "epoch": 4.65404201145767,
      "grad_norm": 0.5525799930271128,
      "learning_rate": 3.3668670607315105e-05,
      "loss": 1.3539,
      "num_input_tokens_seen": 34514641568,
      "step": 43869
    },
    {
      "epoch": 4.654148100997242,
      "grad_norm": 0.7132298426252326,
      "learning_rate": 3.3668018751871024e-05,
      "loss": 1.3046,
      "num_input_tokens_seen": 34515428432,
      "step": 43870
    },
    {
      "epoch": 4.654254190536813,
      "grad_norm": 0.5573037182584538,
      "learning_rate": 3.366736688972856e-05,
      "loss": 1.3579,
      "num_input_tokens_seen": 34516215216,
      "step": 43871
    },
    {
      "epoch": 4.654360280076385,
      "grad_norm": 0.694046194366806,
      "learning_rate": 3.36667150208882e-05,
      "loss": 1.295,
      "num_input_tokens_seen": 34517002032,
      "step": 43872
    },
    {
      "epoch": 4.654466369615956,
      "grad_norm": 0.569940032998029,
      "learning_rate": 3.366606314535046e-05,
      "loss": 1.3822,
      "num_input_tokens_seen": 34517788736,
      "step": 43873
    },
    {
      "epoch": 4.654572459155528,
      "grad_norm": 0.542573736846414,
      "learning_rate": 3.366541126311584e-05,
      "loss": 1.3537,
      "num_input_tokens_seen": 34518575440,
      "step": 43874
    },
    {
      "epoch": 4.654678548695099,
      "grad_norm": 0.5808540829827749,
      "learning_rate": 3.3664759374184846e-05,
      "loss": 1.3124,
      "num_input_tokens_seen": 34519362176,
      "step": 43875
    },
    {
      "epoch": 4.65478463823467,
      "grad_norm": 0.5299818292180232,
      "learning_rate": 3.3664107478557977e-05,
      "loss": 1.3481,
      "num_input_tokens_seen": 34520148864,
      "step": 43876
    },
    {
      "epoch": 4.654890727774242,
      "grad_norm": 0.6967229019753516,
      "learning_rate": 3.366345557623574e-05,
      "loss": 1.3337,
      "num_input_tokens_seen": 34520935632,
      "step": 43877
    },
    {
      "epoch": 4.654996817313813,
      "grad_norm": 0.507614408282997,
      "learning_rate": 3.366280366721864e-05,
      "loss": 1.224,
      "num_input_tokens_seen": 34521722352,
      "step": 43878
    },
    {
      "epoch": 4.655102906853385,
      "grad_norm": 0.5023005918547959,
      "learning_rate": 3.3662151751507184e-05,
      "loss": 1.2837,
      "num_input_tokens_seen": 34522509184,
      "step": 43879
    },
    {
      "epoch": 4.655208996392956,
      "grad_norm": 0.625742248251469,
      "learning_rate": 3.366149982910187e-05,
      "loss": 1.4298,
      "num_input_tokens_seen": 34523295920,
      "step": 43880
    },
    {
      "epoch": 4.655315085932527,
      "grad_norm": 0.6819268990057527,
      "learning_rate": 3.366084790000319e-05,
      "loss": 1.4563,
      "num_input_tokens_seen": 34524082688,
      "step": 43881
    },
    {
      "epoch": 4.655421175472099,
      "grad_norm": 0.6956853469458275,
      "learning_rate": 3.3660195964211675e-05,
      "loss": 1.4331,
      "num_input_tokens_seen": 34524869376,
      "step": 43882
    },
    {
      "epoch": 4.65552726501167,
      "grad_norm": 0.531865118527382,
      "learning_rate": 3.365954402172782e-05,
      "loss": 1.3152,
      "num_input_tokens_seen": 34525656080,
      "step": 43883
    },
    {
      "epoch": 4.655633354551242,
      "grad_norm": 0.5772500878381234,
      "learning_rate": 3.365889207255211e-05,
      "loss": 1.3181,
      "num_input_tokens_seen": 34526442816,
      "step": 43884
    },
    {
      "epoch": 4.655739444090813,
      "grad_norm": 0.4946896489165325,
      "learning_rate": 3.3658240116685055e-05,
      "loss": 1.307,
      "num_input_tokens_seen": 34527229664,
      "step": 43885
    },
    {
      "epoch": 4.655845533630384,
      "grad_norm": 0.5117959789665611,
      "learning_rate": 3.365758815412719e-05,
      "loss": 1.3534,
      "num_input_tokens_seen": 34528016496,
      "step": 43886
    },
    {
      "epoch": 4.655951623169956,
      "grad_norm": 0.5548447987567088,
      "learning_rate": 3.365693618487897e-05,
      "loss": 1.3446,
      "num_input_tokens_seen": 34528803328,
      "step": 43887
    },
    {
      "epoch": 4.656057712709527,
      "grad_norm": 0.5774910966652339,
      "learning_rate": 3.365628420894094e-05,
      "loss": 1.1459,
      "num_input_tokens_seen": 34529590128,
      "step": 43888
    },
    {
      "epoch": 4.6561638022490985,
      "grad_norm": 0.5086058218292365,
      "learning_rate": 3.365563222631359e-05,
      "loss": 1.3144,
      "num_input_tokens_seen": 34530376880,
      "step": 43889
    },
    {
      "epoch": 4.65626989178867,
      "grad_norm": 0.6506387669415811,
      "learning_rate": 3.3654980236997414e-05,
      "loss": 1.3439,
      "num_input_tokens_seen": 34531163568,
      "step": 43890
    },
    {
      "epoch": 4.656375981328241,
      "grad_norm": 0.5888064760523584,
      "learning_rate": 3.365432824099292e-05,
      "loss": 1.2996,
      "num_input_tokens_seen": 34531950240,
      "step": 43891
    },
    {
      "epoch": 4.6564820708678125,
      "grad_norm": 0.5176086533231187,
      "learning_rate": 3.3653676238300624e-05,
      "loss": 1.2175,
      "num_input_tokens_seen": 34532736976,
      "step": 43892
    },
    {
      "epoch": 4.6565881604073835,
      "grad_norm": 0.6523243082332908,
      "learning_rate": 3.365302422892102e-05,
      "loss": 1.287,
      "num_input_tokens_seen": 34533523904,
      "step": 43893
    },
    {
      "epoch": 4.6566942499469555,
      "grad_norm": 0.49684912771340256,
      "learning_rate": 3.36523722128546e-05,
      "loss": 1.3944,
      "num_input_tokens_seen": 34534310640,
      "step": 43894
    },
    {
      "epoch": 4.6568003394865265,
      "grad_norm": 0.5729989126370513,
      "learning_rate": 3.36517201901019e-05,
      "loss": 1.4001,
      "num_input_tokens_seen": 34535097488,
      "step": 43895
    },
    {
      "epoch": 4.656906429026098,
      "grad_norm": 0.5388200145159743,
      "learning_rate": 3.365106816066339e-05,
      "loss": 1.3386,
      "num_input_tokens_seen": 34535884256,
      "step": 43896
    },
    {
      "epoch": 4.6570125185656694,
      "grad_norm": 0.6257735338058747,
      "learning_rate": 3.3650416124539596e-05,
      "loss": 1.3391,
      "num_input_tokens_seen": 34536670976,
      "step": 43897
    },
    {
      "epoch": 4.6571186081052405,
      "grad_norm": 0.5216750072219188,
      "learning_rate": 3.364976408173101e-05,
      "loss": 1.2702,
      "num_input_tokens_seen": 34537457744,
      "step": 43898
    },
    {
      "epoch": 4.657224697644812,
      "grad_norm": 0.4932659194016513,
      "learning_rate": 3.364911203223814e-05,
      "loss": 1.3108,
      "num_input_tokens_seen": 34538244416,
      "step": 43899
    },
    {
      "epoch": 4.657330787184383,
      "grad_norm": 0.5574334681194802,
      "learning_rate": 3.364845997606149e-05,
      "loss": 1.2479,
      "num_input_tokens_seen": 34539031216,
      "step": 43900
    },
    {
      "epoch": 4.657436876723955,
      "grad_norm": 0.5685158038543064,
      "learning_rate": 3.364780791320157e-05,
      "loss": 1.3828,
      "num_input_tokens_seen": 34539817840,
      "step": 43901
    },
    {
      "epoch": 4.657542966263526,
      "grad_norm": 0.4868577379166678,
      "learning_rate": 3.3647155843658865e-05,
      "loss": 1.2482,
      "num_input_tokens_seen": 34540604608,
      "step": 43902
    },
    {
      "epoch": 4.657649055803098,
      "grad_norm": 0.6937934203085714,
      "learning_rate": 3.3646503767433906e-05,
      "loss": 1.3777,
      "num_input_tokens_seen": 34541391360,
      "step": 43903
    },
    {
      "epoch": 4.657755145342669,
      "grad_norm": 0.5693716288471316,
      "learning_rate": 3.364585168452717e-05,
      "loss": 1.3657,
      "num_input_tokens_seen": 34542178144,
      "step": 43904
    },
    {
      "epoch": 4.65786123488224,
      "grad_norm": 0.664403869710831,
      "learning_rate": 3.364519959493918e-05,
      "loss": 1.3435,
      "num_input_tokens_seen": 34542964944,
      "step": 43905
    },
    {
      "epoch": 4.657967324421812,
      "grad_norm": 0.7096250655669165,
      "learning_rate": 3.3644547498670436e-05,
      "loss": 1.3745,
      "num_input_tokens_seen": 34543751712,
      "step": 43906
    },
    {
      "epoch": 4.658073413961383,
      "grad_norm": 0.564113976838,
      "learning_rate": 3.364389539572144e-05,
      "loss": 1.3307,
      "num_input_tokens_seen": 34544538544,
      "step": 43907
    },
    {
      "epoch": 4.658179503500955,
      "grad_norm": 0.5334814087150542,
      "learning_rate": 3.364324328609269e-05,
      "loss": 1.29,
      "num_input_tokens_seen": 34545325312,
      "step": 43908
    },
    {
      "epoch": 4.658285593040526,
      "grad_norm": 0.5428642674245907,
      "learning_rate": 3.3642591169784696e-05,
      "loss": 1.2467,
      "num_input_tokens_seen": 34546112080,
      "step": 43909
    },
    {
      "epoch": 4.658391682580097,
      "grad_norm": 0.5707876407670363,
      "learning_rate": 3.364193904679796e-05,
      "loss": 1.2883,
      "num_input_tokens_seen": 34546898784,
      "step": 43910
    },
    {
      "epoch": 4.658497772119669,
      "grad_norm": 0.5164355439399098,
      "learning_rate": 3.364128691713299e-05,
      "loss": 1.3704,
      "num_input_tokens_seen": 34547685488,
      "step": 43911
    },
    {
      "epoch": 4.65860386165924,
      "grad_norm": 0.4947095681378349,
      "learning_rate": 3.364063478079029e-05,
      "loss": 1.2194,
      "num_input_tokens_seen": 34548472272,
      "step": 43912
    },
    {
      "epoch": 4.658709951198812,
      "grad_norm": 0.5053700436838426,
      "learning_rate": 3.363998263777035e-05,
      "loss": 1.3136,
      "num_input_tokens_seen": 34549258992,
      "step": 43913
    },
    {
      "epoch": 4.658816040738383,
      "grad_norm": 0.4674590338994651,
      "learning_rate": 3.3639330488073697e-05,
      "loss": 1.3327,
      "num_input_tokens_seen": 34550045808,
      "step": 43914
    },
    {
      "epoch": 4.658922130277954,
      "grad_norm": 0.5581456877105783,
      "learning_rate": 3.3638678331700826e-05,
      "loss": 1.3949,
      "num_input_tokens_seen": 34550832592,
      "step": 43915
    },
    {
      "epoch": 4.659028219817526,
      "grad_norm": 0.5382513497302721,
      "learning_rate": 3.363802616865222e-05,
      "loss": 1.351,
      "num_input_tokens_seen": 34551619424,
      "step": 43916
    },
    {
      "epoch": 4.659134309357097,
      "grad_norm": 0.4957916830738703,
      "learning_rate": 3.3637373998928415e-05,
      "loss": 1.3811,
      "num_input_tokens_seen": 34552406144,
      "step": 43917
    },
    {
      "epoch": 4.659240398896669,
      "grad_norm": 0.5089884123217039,
      "learning_rate": 3.36367218225299e-05,
      "loss": 1.2728,
      "num_input_tokens_seen": 34553193024,
      "step": 43918
    },
    {
      "epoch": 4.65934648843624,
      "grad_norm": 0.610699245381436,
      "learning_rate": 3.3636069639457166e-05,
      "loss": 1.4015,
      "num_input_tokens_seen": 34553979808,
      "step": 43919
    },
    {
      "epoch": 4.659452577975811,
      "grad_norm": 0.4849779531506816,
      "learning_rate": 3.363541744971075e-05,
      "loss": 1.2834,
      "num_input_tokens_seen": 34554766592,
      "step": 43920
    },
    {
      "epoch": 4.659558667515383,
      "grad_norm": 0.49194709962361993,
      "learning_rate": 3.3634765253291125e-05,
      "loss": 1.2451,
      "num_input_tokens_seen": 34555553392,
      "step": 43921
    },
    {
      "epoch": 4.659664757054954,
      "grad_norm": 0.5418015067208939,
      "learning_rate": 3.3634113050198804e-05,
      "loss": 1.3502,
      "num_input_tokens_seen": 34556340064,
      "step": 43922
    },
    {
      "epoch": 4.659770846594526,
      "grad_norm": 0.5739237924525,
      "learning_rate": 3.36334608404343e-05,
      "loss": 1.3323,
      "num_input_tokens_seen": 34557126848,
      "step": 43923
    },
    {
      "epoch": 4.659876936134097,
      "grad_norm": 0.5668880257573181,
      "learning_rate": 3.3632808623998116e-05,
      "loss": 1.3684,
      "num_input_tokens_seen": 34557913472,
      "step": 43924
    },
    {
      "epoch": 4.659983025673669,
      "grad_norm": 0.5744859913512246,
      "learning_rate": 3.3632156400890746e-05,
      "loss": 1.3541,
      "num_input_tokens_seen": 34558700208,
      "step": 43925
    },
    {
      "epoch": 4.66008911521324,
      "grad_norm": 0.4640741090635493,
      "learning_rate": 3.36315041711127e-05,
      "loss": 1.2126,
      "num_input_tokens_seen": 34559486880,
      "step": 43926
    },
    {
      "epoch": 4.660195204752811,
      "grad_norm": 0.7395605328152024,
      "learning_rate": 3.363085193466447e-05,
      "loss": 1.2577,
      "num_input_tokens_seen": 34560273632,
      "step": 43927
    },
    {
      "epoch": 4.660301294292383,
      "grad_norm": 0.5557566721565605,
      "learning_rate": 3.3630199691546585e-05,
      "loss": 1.3347,
      "num_input_tokens_seen": 34561060432,
      "step": 43928
    },
    {
      "epoch": 4.660407383831954,
      "grad_norm": 0.6854434509151136,
      "learning_rate": 3.3629547441759526e-05,
      "loss": 1.3497,
      "num_input_tokens_seen": 34561847312,
      "step": 43929
    },
    {
      "epoch": 4.660513473371526,
      "grad_norm": 0.5165681820614413,
      "learning_rate": 3.362889518530381e-05,
      "loss": 1.237,
      "num_input_tokens_seen": 34562634064,
      "step": 43930
    },
    {
      "epoch": 4.660619562911097,
      "grad_norm": 0.6069638451876211,
      "learning_rate": 3.3628242922179934e-05,
      "loss": 1.2479,
      "num_input_tokens_seen": 34563420800,
      "step": 43931
    },
    {
      "epoch": 4.660725652450669,
      "grad_norm": 0.6820324802388208,
      "learning_rate": 3.362759065238841e-05,
      "loss": 1.2739,
      "num_input_tokens_seen": 34564207616,
      "step": 43932
    },
    {
      "epoch": 4.66083174199024,
      "grad_norm": 0.4684261753786594,
      "learning_rate": 3.362693837592973e-05,
      "loss": 1.2303,
      "num_input_tokens_seen": 34564994496,
      "step": 43933
    },
    {
      "epoch": 4.660937831529811,
      "grad_norm": 0.9242834810348063,
      "learning_rate": 3.362628609280441e-05,
      "loss": 1.3335,
      "num_input_tokens_seen": 34565781184,
      "step": 43934
    },
    {
      "epoch": 4.661043921069383,
      "grad_norm": 0.6018868107237918,
      "learning_rate": 3.362563380301295e-05,
      "loss": 1.3529,
      "num_input_tokens_seen": 34566568000,
      "step": 43935
    },
    {
      "epoch": 4.661150010608954,
      "grad_norm": 0.7938538298150957,
      "learning_rate": 3.3624981506555856e-05,
      "loss": 1.3418,
      "num_input_tokens_seen": 34567354800,
      "step": 43936
    },
    {
      "epoch": 4.661256100148526,
      "grad_norm": 0.6873764616151085,
      "learning_rate": 3.3624329203433626e-05,
      "loss": 1.2961,
      "num_input_tokens_seen": 34568141632,
      "step": 43937
    },
    {
      "epoch": 4.661362189688097,
      "grad_norm": 0.63274321331264,
      "learning_rate": 3.3623676893646765e-05,
      "loss": 1.2637,
      "num_input_tokens_seen": 34568928352,
      "step": 43938
    },
    {
      "epoch": 4.661468279227668,
      "grad_norm": 0.6524863763257054,
      "learning_rate": 3.3623024577195774e-05,
      "loss": 1.4779,
      "num_input_tokens_seen": 34569715040,
      "step": 43939
    },
    {
      "epoch": 4.66157436876724,
      "grad_norm": 0.48242600510621264,
      "learning_rate": 3.3622372254081175e-05,
      "loss": 1.2926,
      "num_input_tokens_seen": 34570501728,
      "step": 43940
    },
    {
      "epoch": 4.661680458306811,
      "grad_norm": 0.5729275363582832,
      "learning_rate": 3.3621719924303456e-05,
      "loss": 1.3696,
      "num_input_tokens_seen": 34571288448,
      "step": 43941
    },
    {
      "epoch": 4.661786547846383,
      "grad_norm": 0.4421847011590987,
      "learning_rate": 3.362106758786312e-05,
      "loss": 1.1797,
      "num_input_tokens_seen": 34572075264,
      "step": 43942
    },
    {
      "epoch": 4.661892637385954,
      "grad_norm": 0.5240026267487337,
      "learning_rate": 3.362041524476068e-05,
      "loss": 1.3313,
      "num_input_tokens_seen": 34572862016,
      "step": 43943
    },
    {
      "epoch": 4.661998726925525,
      "grad_norm": 0.4769487969675547,
      "learning_rate": 3.3619762894996644e-05,
      "loss": 1.3403,
      "num_input_tokens_seen": 34573648752,
      "step": 43944
    },
    {
      "epoch": 4.662104816465097,
      "grad_norm": 0.4885936638203374,
      "learning_rate": 3.361911053857149e-05,
      "loss": 1.3419,
      "num_input_tokens_seen": 34574435520,
      "step": 43945
    },
    {
      "epoch": 4.662210906004668,
      "grad_norm": 0.5480425315801227,
      "learning_rate": 3.3618458175485754e-05,
      "loss": 1.3441,
      "num_input_tokens_seen": 34575222288,
      "step": 43946
    },
    {
      "epoch": 4.66231699554424,
      "grad_norm": 0.5042113237281032,
      "learning_rate": 3.3617805805739924e-05,
      "loss": 1.337,
      "num_input_tokens_seen": 34576008960,
      "step": 43947
    },
    {
      "epoch": 4.662423085083811,
      "grad_norm": 0.5307402086808173,
      "learning_rate": 3.3617153429334504e-05,
      "loss": 1.2481,
      "num_input_tokens_seen": 34576795696,
      "step": 43948
    },
    {
      "epoch": 4.662529174623382,
      "grad_norm": 0.5514554378350237,
      "learning_rate": 3.3616501046269997e-05,
      "loss": 1.1982,
      "num_input_tokens_seen": 34577582544,
      "step": 43949
    },
    {
      "epoch": 4.662635264162954,
      "grad_norm": 0.5105285477334126,
      "learning_rate": 3.3615848656546915e-05,
      "loss": 1.3588,
      "num_input_tokens_seen": 34578369312,
      "step": 43950
    },
    {
      "epoch": 4.662741353702525,
      "grad_norm": 0.6307357902681525,
      "learning_rate": 3.361519626016576e-05,
      "loss": 1.3268,
      "num_input_tokens_seen": 34579156032,
      "step": 43951
    },
    {
      "epoch": 4.6628474432420965,
      "grad_norm": 0.5451173413905521,
      "learning_rate": 3.361454385712703e-05,
      "loss": 1.3678,
      "num_input_tokens_seen": 34579942832,
      "step": 43952
    },
    {
      "epoch": 4.662953532781668,
      "grad_norm": 0.542659001706276,
      "learning_rate": 3.361389144743124e-05,
      "loss": 1.3064,
      "num_input_tokens_seen": 34580729664,
      "step": 43953
    },
    {
      "epoch": 4.6630596223212395,
      "grad_norm": 0.5740138178221843,
      "learning_rate": 3.3613239031078884e-05,
      "loss": 1.3182,
      "num_input_tokens_seen": 34581516384,
      "step": 43954
    },
    {
      "epoch": 4.6631657118608105,
      "grad_norm": 0.47263063516447335,
      "learning_rate": 3.361258660807047e-05,
      "loss": 1.2198,
      "num_input_tokens_seen": 34582303168,
      "step": 43955
    },
    {
      "epoch": 4.6632718014003816,
      "grad_norm": 0.5469895224452821,
      "learning_rate": 3.36119341784065e-05,
      "loss": 1.403,
      "num_input_tokens_seen": 34583089936,
      "step": 43956
    },
    {
      "epoch": 4.6633778909399535,
      "grad_norm": 0.5051549452936142,
      "learning_rate": 3.361128174208748e-05,
      "loss": 1.3565,
      "num_input_tokens_seen": 34583876688,
      "step": 43957
    },
    {
      "epoch": 4.6634839804795245,
      "grad_norm": 0.48542628562326934,
      "learning_rate": 3.3610629299113916e-05,
      "loss": 1.2338,
      "num_input_tokens_seen": 34584663488,
      "step": 43958
    },
    {
      "epoch": 4.663590070019096,
      "grad_norm": 0.5494328524639847,
      "learning_rate": 3.3609976849486306e-05,
      "loss": 1.3098,
      "num_input_tokens_seen": 34585450368,
      "step": 43959
    },
    {
      "epoch": 4.6636961595586675,
      "grad_norm": 0.5527174090621216,
      "learning_rate": 3.3609324393205165e-05,
      "loss": 1.3455,
      "num_input_tokens_seen": 34586237072,
      "step": 43960
    },
    {
      "epoch": 4.663802249098239,
      "grad_norm": 0.5265601615143723,
      "learning_rate": 3.3608671930270986e-05,
      "loss": 1.3691,
      "num_input_tokens_seen": 34587023824,
      "step": 43961
    },
    {
      "epoch": 4.66390833863781,
      "grad_norm": 0.5834392978205838,
      "learning_rate": 3.360801946068428e-05,
      "loss": 1.2252,
      "num_input_tokens_seen": 34587810688,
      "step": 43962
    },
    {
      "epoch": 4.664014428177381,
      "grad_norm": 0.5342601863162256,
      "learning_rate": 3.360736698444555e-05,
      "loss": 1.319,
      "num_input_tokens_seen": 34588597472,
      "step": 43963
    },
    {
      "epoch": 4.664120517716953,
      "grad_norm": 0.5426362873868442,
      "learning_rate": 3.360671450155529e-05,
      "loss": 1.3654,
      "num_input_tokens_seen": 34589384288,
      "step": 43964
    },
    {
      "epoch": 4.664226607256524,
      "grad_norm": 0.4546088325380593,
      "learning_rate": 3.360606201201403e-05,
      "loss": 1.3179,
      "num_input_tokens_seen": 34590171088,
      "step": 43965
    },
    {
      "epoch": 4.664332696796096,
      "grad_norm": 0.5417896824113373,
      "learning_rate": 3.360540951582225e-05,
      "loss": 1.2877,
      "num_input_tokens_seen": 34590957776,
      "step": 43966
    },
    {
      "epoch": 4.664438786335667,
      "grad_norm": 0.5127591452916219,
      "learning_rate": 3.360475701298045e-05,
      "loss": 1.3518,
      "num_input_tokens_seen": 34591744464,
      "step": 43967
    },
    {
      "epoch": 4.664544875875238,
      "grad_norm": 0.57061564419479,
      "learning_rate": 3.360410450348917e-05,
      "loss": 1.3256,
      "num_input_tokens_seen": 34592531184,
      "step": 43968
    },
    {
      "epoch": 4.66465096541481,
      "grad_norm": 0.4315614935860326,
      "learning_rate": 3.360345198734887e-05,
      "loss": 1.1961,
      "num_input_tokens_seen": 34593318000,
      "step": 43969
    },
    {
      "epoch": 4.664757054954381,
      "grad_norm": 0.6409140110665599,
      "learning_rate": 3.360279946456008e-05,
      "loss": 1.4185,
      "num_input_tokens_seen": 34594104800,
      "step": 43970
    },
    {
      "epoch": 4.664863144493953,
      "grad_norm": 0.49878677951989,
      "learning_rate": 3.360214693512331e-05,
      "loss": 1.278,
      "num_input_tokens_seen": 34594891600,
      "step": 43971
    },
    {
      "epoch": 4.664969234033524,
      "grad_norm": 0.4952375324174639,
      "learning_rate": 3.360149439903905e-05,
      "loss": 1.273,
      "num_input_tokens_seen": 34595678368,
      "step": 43972
    },
    {
      "epoch": 4.665075323573095,
      "grad_norm": 0.5391936588253962,
      "learning_rate": 3.360084185630779e-05,
      "loss": 1.2474,
      "num_input_tokens_seen": 34596465056,
      "step": 43973
    },
    {
      "epoch": 4.665181413112667,
      "grad_norm": 0.5359948341057859,
      "learning_rate": 3.3600189306930066e-05,
      "loss": 1.3644,
      "num_input_tokens_seen": 34597251840,
      "step": 43974
    },
    {
      "epoch": 4.665287502652238,
      "grad_norm": 0.5396010818633772,
      "learning_rate": 3.359953675090637e-05,
      "loss": 1.3477,
      "num_input_tokens_seen": 34598038544,
      "step": 43975
    },
    {
      "epoch": 4.66539359219181,
      "grad_norm": 0.6539275049195393,
      "learning_rate": 3.359888418823719e-05,
      "loss": 1.3427,
      "num_input_tokens_seen": 34598825232,
      "step": 43976
    },
    {
      "epoch": 4.665499681731381,
      "grad_norm": 0.5662359961291826,
      "learning_rate": 3.359823161892306e-05,
      "loss": 1.2412,
      "num_input_tokens_seen": 34599612080,
      "step": 43977
    },
    {
      "epoch": 4.665605771270952,
      "grad_norm": 0.7369925369795159,
      "learning_rate": 3.3597579042964466e-05,
      "loss": 1.3112,
      "num_input_tokens_seen": 34600398880,
      "step": 43978
    },
    {
      "epoch": 4.665711860810524,
      "grad_norm": 0.5586286963556976,
      "learning_rate": 3.3596926460361913e-05,
      "loss": 1.3398,
      "num_input_tokens_seen": 34601185616,
      "step": 43979
    },
    {
      "epoch": 4.665817950350095,
      "grad_norm": 0.5017504428642727,
      "learning_rate": 3.3596273871115905e-05,
      "loss": 1.2957,
      "num_input_tokens_seen": 34601972432,
      "step": 43980
    },
    {
      "epoch": 4.665924039889667,
      "grad_norm": 0.6435062266647601,
      "learning_rate": 3.359562127522695e-05,
      "loss": 1.4017,
      "num_input_tokens_seen": 34602759232,
      "step": 43981
    },
    {
      "epoch": 4.666030129429238,
      "grad_norm": 0.5523427920145937,
      "learning_rate": 3.3594968672695554e-05,
      "loss": 1.2753,
      "num_input_tokens_seen": 34603546080,
      "step": 43982
    },
    {
      "epoch": 4.66613621896881,
      "grad_norm": 0.6093168943770951,
      "learning_rate": 3.359431606352222e-05,
      "loss": 1.2824,
      "num_input_tokens_seen": 34604332944,
      "step": 43983
    },
    {
      "epoch": 4.666242308508381,
      "grad_norm": 0.6132721414846498,
      "learning_rate": 3.3593663447707445e-05,
      "loss": 1.3569,
      "num_input_tokens_seen": 34605119728,
      "step": 43984
    },
    {
      "epoch": 4.666348398047952,
      "grad_norm": 0.6075401303932086,
      "learning_rate": 3.359301082525174e-05,
      "loss": 1.3685,
      "num_input_tokens_seen": 34605906464,
      "step": 43985
    },
    {
      "epoch": 4.666454487587524,
      "grad_norm": 0.8305500286718296,
      "learning_rate": 3.359235819615562e-05,
      "loss": 1.244,
      "num_input_tokens_seen": 34606693264,
      "step": 43986
    },
    {
      "epoch": 4.666560577127095,
      "grad_norm": 0.4836925086845204,
      "learning_rate": 3.359170556041956e-05,
      "loss": 1.3133,
      "num_input_tokens_seen": 34607480016,
      "step": 43987
    },
    {
      "epoch": 4.666666666666667,
      "grad_norm": 0.7660580392073643,
      "learning_rate": 3.359105291804408e-05,
      "loss": 1.279,
      "num_input_tokens_seen": 34608266800,
      "step": 43988
    },
    {
      "epoch": 4.666772756206238,
      "grad_norm": 0.5570764755344935,
      "learning_rate": 3.359040026902971e-05,
      "loss": 1.3941,
      "num_input_tokens_seen": 34609053584,
      "step": 43989
    },
    {
      "epoch": 4.66687884574581,
      "grad_norm": 0.5374578151854563,
      "learning_rate": 3.3589747613376906e-05,
      "loss": 1.2337,
      "num_input_tokens_seen": 34609840400,
      "step": 43990
    },
    {
      "epoch": 4.666984935285381,
      "grad_norm": 0.7004675087354318,
      "learning_rate": 3.358909495108621e-05,
      "loss": 1.1905,
      "num_input_tokens_seen": 34610627248,
      "step": 43991
    },
    {
      "epoch": 4.667091024824952,
      "grad_norm": 0.5440496864766,
      "learning_rate": 3.358844228215812e-05,
      "loss": 1.3337,
      "num_input_tokens_seen": 34611414080,
      "step": 43992
    },
    {
      "epoch": 4.667197114364524,
      "grad_norm": 0.5815860666124028,
      "learning_rate": 3.358778960659312e-05,
      "loss": 1.4367,
      "num_input_tokens_seen": 34612200784,
      "step": 43993
    },
    {
      "epoch": 4.667303203904095,
      "grad_norm": 0.644633369866587,
      "learning_rate": 3.3587136924391735e-05,
      "loss": 1.3053,
      "num_input_tokens_seen": 34612987552,
      "step": 43994
    },
    {
      "epoch": 4.667409293443667,
      "grad_norm": 0.4557841137861235,
      "learning_rate": 3.358648423555446e-05,
      "loss": 1.2623,
      "num_input_tokens_seen": 34613774288,
      "step": 43995
    },
    {
      "epoch": 4.667515382983238,
      "grad_norm": 0.5929568640461743,
      "learning_rate": 3.3585831540081805e-05,
      "loss": 1.3678,
      "num_input_tokens_seen": 34614561056,
      "step": 43996
    },
    {
      "epoch": 4.667621472522809,
      "grad_norm": 0.4834401872647729,
      "learning_rate": 3.358517883797427e-05,
      "loss": 1.3422,
      "num_input_tokens_seen": 34615347936,
      "step": 43997
    },
    {
      "epoch": 4.667727562062381,
      "grad_norm": 0.4624757827675257,
      "learning_rate": 3.358452612923236e-05,
      "loss": 1.1998,
      "num_input_tokens_seen": 34616134752,
      "step": 43998
    },
    {
      "epoch": 4.667833651601952,
      "grad_norm": 0.597717427342726,
      "learning_rate": 3.358387341385657e-05,
      "loss": 1.273,
      "num_input_tokens_seen": 34616921472,
      "step": 43999
    },
    {
      "epoch": 4.667939741141524,
      "grad_norm": 0.7068806721915041,
      "learning_rate": 3.358322069184743e-05,
      "loss": 1.349,
      "num_input_tokens_seen": 34617708272,
      "step": 44000
    },
    {
      "epoch": 4.667939741141524,
      "eval_loss": 1.5575002431869507,
      "eval_runtime": 64.1172,
      "eval_samples_per_second": 46.789,
      "eval_steps_per_second": 0.499,
      "num_input_tokens_seen": 34617708272,
      "step": 44000
    },
    {
      "epoch": 4.668045830681095,
      "grad_norm": 0.6157937378824638,
      "learning_rate": 3.358256796320542e-05,
      "loss": 1.3746,
      "num_input_tokens_seen": 34618495072,
      "step": 44001
    },
    {
      "epoch": 4.668151920220666,
      "grad_norm": 0.66031531143887,
      "learning_rate": 3.358191522793106e-05,
      "loss": 1.268,
      "num_input_tokens_seen": 34619281920,
      "step": 44002
    },
    {
      "epoch": 4.668258009760238,
      "grad_norm": 0.6318380272626052,
      "learning_rate": 3.358126248602485e-05,
      "loss": 1.2438,
      "num_input_tokens_seen": 34620068704,
      "step": 44003
    },
    {
      "epoch": 4.668364099299809,
      "grad_norm": 0.6318469502187655,
      "learning_rate": 3.358060973748729e-05,
      "loss": 1.3632,
      "num_input_tokens_seen": 34620855472,
      "step": 44004
    },
    {
      "epoch": 4.668470188839381,
      "grad_norm": 0.543378029847325,
      "learning_rate": 3.3579956982318874e-05,
      "loss": 1.1949,
      "num_input_tokens_seen": 34621642224,
      "step": 44005
    },
    {
      "epoch": 4.668576278378952,
      "grad_norm": 1.0329923208826532,
      "learning_rate": 3.357930422052013e-05,
      "loss": 1.2991,
      "num_input_tokens_seen": 34622429024,
      "step": 44006
    },
    {
      "epoch": 4.668682367918523,
      "grad_norm": 0.64353465639933,
      "learning_rate": 3.357865145209155e-05,
      "loss": 1.3337,
      "num_input_tokens_seen": 34623215776,
      "step": 44007
    },
    {
      "epoch": 4.668788457458095,
      "grad_norm": 0.7924940333844109,
      "learning_rate": 3.357799867703364e-05,
      "loss": 1.2234,
      "num_input_tokens_seen": 34624002528,
      "step": 44008
    },
    {
      "epoch": 4.668894546997666,
      "grad_norm": 0.5705455798795863,
      "learning_rate": 3.35773458953469e-05,
      "loss": 1.3783,
      "num_input_tokens_seen": 34624789248,
      "step": 44009
    },
    {
      "epoch": 4.669000636537238,
      "grad_norm": 0.6205437522297236,
      "learning_rate": 3.357669310703184e-05,
      "loss": 1.3394,
      "num_input_tokens_seen": 34625576000,
      "step": 44010
    },
    {
      "epoch": 4.669106726076809,
      "grad_norm": 0.5631231525154428,
      "learning_rate": 3.357604031208897e-05,
      "loss": 1.2663,
      "num_input_tokens_seen": 34626362864,
      "step": 44011
    },
    {
      "epoch": 4.669212815616381,
      "grad_norm": 0.544253593115958,
      "learning_rate": 3.357538751051879e-05,
      "loss": 1.298,
      "num_input_tokens_seen": 34627149648,
      "step": 44012
    },
    {
      "epoch": 4.669318905155952,
      "grad_norm": 0.6647091170328717,
      "learning_rate": 3.357473470232179e-05,
      "loss": 1.3085,
      "num_input_tokens_seen": 34627936384,
      "step": 44013
    },
    {
      "epoch": 4.669424994695523,
      "grad_norm": 0.5785676331486443,
      "learning_rate": 3.357408188749849e-05,
      "loss": 1.3361,
      "num_input_tokens_seen": 34628723104,
      "step": 44014
    },
    {
      "epoch": 4.6695310842350946,
      "grad_norm": 0.6174095139715149,
      "learning_rate": 3.35734290660494e-05,
      "loss": 1.2509,
      "num_input_tokens_seen": 34629509872,
      "step": 44015
    },
    {
      "epoch": 4.669637173774666,
      "grad_norm": 0.5373367371994294,
      "learning_rate": 3.3572776237975003e-05,
      "loss": 1.3579,
      "num_input_tokens_seen": 34630296608,
      "step": 44016
    },
    {
      "epoch": 4.6697432633142375,
      "grad_norm": 0.6672319548756909,
      "learning_rate": 3.357212340327582e-05,
      "loss": 1.3663,
      "num_input_tokens_seen": 34631083376,
      "step": 44017
    },
    {
      "epoch": 4.6698493528538085,
      "grad_norm": 0.518886768859856,
      "learning_rate": 3.3571470561952354e-05,
      "loss": 1.3219,
      "num_input_tokens_seen": 34631870080,
      "step": 44018
    },
    {
      "epoch": 4.6699554423933805,
      "grad_norm": 0.5012238623210471,
      "learning_rate": 3.357081771400511e-05,
      "loss": 1.3396,
      "num_input_tokens_seen": 34632656768,
      "step": 44019
    },
    {
      "epoch": 4.6700615319329515,
      "grad_norm": 0.6167724963744533,
      "learning_rate": 3.357016485943458e-05,
      "loss": 1.387,
      "num_input_tokens_seen": 34633443488,
      "step": 44020
    },
    {
      "epoch": 4.6701676214725225,
      "grad_norm": 0.5201618308182508,
      "learning_rate": 3.356951199824129e-05,
      "loss": 1.3703,
      "num_input_tokens_seen": 34634230368,
      "step": 44021
    },
    {
      "epoch": 4.670273711012094,
      "grad_norm": 0.6721672187430485,
      "learning_rate": 3.3568859130425724e-05,
      "loss": 1.3025,
      "num_input_tokens_seen": 34635017232,
      "step": 44022
    },
    {
      "epoch": 4.6703798005516655,
      "grad_norm": 0.5743855964050089,
      "learning_rate": 3.35682062559884e-05,
      "loss": 1.2956,
      "num_input_tokens_seen": 34635804048,
      "step": 44023
    },
    {
      "epoch": 4.670485890091237,
      "grad_norm": 0.5132869896088448,
      "learning_rate": 3.356755337492981e-05,
      "loss": 1.288,
      "num_input_tokens_seen": 34636590880,
      "step": 44024
    },
    {
      "epoch": 4.670591979630808,
      "grad_norm": 0.5730771062392845,
      "learning_rate": 3.356690048725048e-05,
      "loss": 1.2924,
      "num_input_tokens_seen": 34637377600,
      "step": 44025
    },
    {
      "epoch": 4.670698069170379,
      "grad_norm": 0.5323283491932064,
      "learning_rate": 3.356624759295089e-05,
      "loss": 1.3626,
      "num_input_tokens_seen": 34638164352,
      "step": 44026
    },
    {
      "epoch": 4.670804158709951,
      "grad_norm": 0.6596609283000946,
      "learning_rate": 3.3565594692031555e-05,
      "loss": 1.3687,
      "num_input_tokens_seen": 34638951152,
      "step": 44027
    },
    {
      "epoch": 4.670910248249522,
      "grad_norm": 0.6179115122801965,
      "learning_rate": 3.3564941784492974e-05,
      "loss": 1.4543,
      "num_input_tokens_seen": 34639737792,
      "step": 44028
    },
    {
      "epoch": 4.671016337789094,
      "grad_norm": 0.5514981471098692,
      "learning_rate": 3.356428887033567e-05,
      "loss": 1.3802,
      "num_input_tokens_seen": 34640524576,
      "step": 44029
    },
    {
      "epoch": 4.671122427328665,
      "grad_norm": 0.5610464373698562,
      "learning_rate": 3.3563635949560133e-05,
      "loss": 1.2583,
      "num_input_tokens_seen": 34641311360,
      "step": 44030
    },
    {
      "epoch": 4.671228516868236,
      "grad_norm": 0.6032488602108141,
      "learning_rate": 3.356298302216686e-05,
      "loss": 1.2709,
      "num_input_tokens_seen": 34642098128,
      "step": 44031
    },
    {
      "epoch": 4.671334606407808,
      "grad_norm": 0.5134075008449986,
      "learning_rate": 3.356233008815638e-05,
      "loss": 1.2181,
      "num_input_tokens_seen": 34642884912,
      "step": 44032
    },
    {
      "epoch": 4.671440695947379,
      "grad_norm": 0.4716757207541787,
      "learning_rate": 3.356167714752917e-05,
      "loss": 1.3183,
      "num_input_tokens_seen": 34643671728,
      "step": 44033
    },
    {
      "epoch": 4.671546785486951,
      "grad_norm": 0.6366014920249492,
      "learning_rate": 3.356102420028575e-05,
      "loss": 1.2247,
      "num_input_tokens_seen": 34644458432,
      "step": 44034
    },
    {
      "epoch": 4.671652875026522,
      "grad_norm": 0.524200930891653,
      "learning_rate": 3.356037124642662e-05,
      "loss": 1.3259,
      "num_input_tokens_seen": 34645245104,
      "step": 44035
    },
    {
      "epoch": 4.671758964566093,
      "grad_norm": 0.6453683154891726,
      "learning_rate": 3.355971828595229e-05,
      "loss": 1.3131,
      "num_input_tokens_seen": 34646031840,
      "step": 44036
    },
    {
      "epoch": 4.671865054105665,
      "grad_norm": 0.573355911306406,
      "learning_rate": 3.355906531886326e-05,
      "loss": 1.2481,
      "num_input_tokens_seen": 34646818640,
      "step": 44037
    },
    {
      "epoch": 4.671971143645236,
      "grad_norm": 0.47928937590888765,
      "learning_rate": 3.355841234516004e-05,
      "loss": 1.244,
      "num_input_tokens_seen": 34647605344,
      "step": 44038
    },
    {
      "epoch": 4.672077233184808,
      "grad_norm": 0.49371916504562696,
      "learning_rate": 3.3557759364843125e-05,
      "loss": 1.2331,
      "num_input_tokens_seen": 34648392128,
      "step": 44039
    },
    {
      "epoch": 4.672183322724379,
      "grad_norm": 0.5915816867344476,
      "learning_rate": 3.355710637791303e-05,
      "loss": 1.3212,
      "num_input_tokens_seen": 34649178848,
      "step": 44040
    },
    {
      "epoch": 4.672289412263951,
      "grad_norm": 0.5316933902436997,
      "learning_rate": 3.3556453384370244e-05,
      "loss": 1.3063,
      "num_input_tokens_seen": 34649965616,
      "step": 44041
    },
    {
      "epoch": 4.672395501803522,
      "grad_norm": 0.50429071473078,
      "learning_rate": 3.3555800384215285e-05,
      "loss": 1.2447,
      "num_input_tokens_seen": 34650752272,
      "step": 44042
    },
    {
      "epoch": 4.672501591343094,
      "grad_norm": 0.5653452517922501,
      "learning_rate": 3.355514737744866e-05,
      "loss": 1.2413,
      "num_input_tokens_seen": 34651539088,
      "step": 44043
    },
    {
      "epoch": 4.672607680882665,
      "grad_norm": 0.6019050362529063,
      "learning_rate": 3.355449436407087e-05,
      "loss": 1.4438,
      "num_input_tokens_seen": 34652325808,
      "step": 44044
    },
    {
      "epoch": 4.672713770422236,
      "grad_norm": 0.5742027488613861,
      "learning_rate": 3.355384134408241e-05,
      "loss": 1.3945,
      "num_input_tokens_seen": 34653112480,
      "step": 44045
    },
    {
      "epoch": 4.672819859961808,
      "grad_norm": 0.6750279570281215,
      "learning_rate": 3.3553188317483795e-05,
      "loss": 1.3372,
      "num_input_tokens_seen": 34653899280,
      "step": 44046
    },
    {
      "epoch": 4.672925949501379,
      "grad_norm": 0.5410078330652316,
      "learning_rate": 3.355253528427553e-05,
      "loss": 1.328,
      "num_input_tokens_seen": 34654686096,
      "step": 44047
    },
    {
      "epoch": 4.673032039040951,
      "grad_norm": 0.5855649619748956,
      "learning_rate": 3.355188224445811e-05,
      "loss": 1.3412,
      "num_input_tokens_seen": 34655472912,
      "step": 44048
    },
    {
      "epoch": 4.673138128580522,
      "grad_norm": 0.5716144773267487,
      "learning_rate": 3.355122919803205e-05,
      "loss": 1.2695,
      "num_input_tokens_seen": 34656259712,
      "step": 44049
    },
    {
      "epoch": 4.673244218120093,
      "grad_norm": 0.5048001106430828,
      "learning_rate": 3.355057614499785e-05,
      "loss": 1.2891,
      "num_input_tokens_seen": 34657046448,
      "step": 44050
    },
    {
      "epoch": 4.673350307659665,
      "grad_norm": 0.6782645784027669,
      "learning_rate": 3.354992308535602e-05,
      "loss": 1.3847,
      "num_input_tokens_seen": 34657833216,
      "step": 44051
    },
    {
      "epoch": 4.673456397199236,
      "grad_norm": 0.554064267761185,
      "learning_rate": 3.354927001910706e-05,
      "loss": 1.3079,
      "num_input_tokens_seen": 34658620000,
      "step": 44052
    },
    {
      "epoch": 4.673562486738808,
      "grad_norm": 0.675513538899403,
      "learning_rate": 3.354861694625146e-05,
      "loss": 1.2867,
      "num_input_tokens_seen": 34659406784,
      "step": 44053
    },
    {
      "epoch": 4.673668576278379,
      "grad_norm": 0.5585181298062531,
      "learning_rate": 3.3547963866789764e-05,
      "loss": 1.4027,
      "num_input_tokens_seen": 34660193520,
      "step": 44054
    },
    {
      "epoch": 4.67377466581795,
      "grad_norm": 0.62353886786564,
      "learning_rate": 3.354731078072244e-05,
      "loss": 1.3689,
      "num_input_tokens_seen": 34660980224,
      "step": 44055
    },
    {
      "epoch": 4.673880755357522,
      "grad_norm": 0.7001761332313337,
      "learning_rate": 3.354665768805e-05,
      "loss": 1.3106,
      "num_input_tokens_seen": 34661766944,
      "step": 44056
    },
    {
      "epoch": 4.673986844897093,
      "grad_norm": 0.5161881387595724,
      "learning_rate": 3.354600458877296e-05,
      "loss": 1.3233,
      "num_input_tokens_seen": 34662553744,
      "step": 44057
    },
    {
      "epoch": 4.674092934436665,
      "grad_norm": 0.5944892703780477,
      "learning_rate": 3.354535148289182e-05,
      "loss": 1.316,
      "num_input_tokens_seen": 34663340560,
      "step": 44058
    },
    {
      "epoch": 4.674199023976236,
      "grad_norm": 0.6334138272307585,
      "learning_rate": 3.354469837040708e-05,
      "loss": 1.2363,
      "num_input_tokens_seen": 34664127328,
      "step": 44059
    },
    {
      "epoch": 4.674305113515807,
      "grad_norm": 0.5740029173379793,
      "learning_rate": 3.354404525131925e-05,
      "loss": 1.2982,
      "num_input_tokens_seen": 34664914016,
      "step": 44060
    },
    {
      "epoch": 4.674411203055379,
      "grad_norm": 0.6675243918255782,
      "learning_rate": 3.354339212562883e-05,
      "loss": 1.2734,
      "num_input_tokens_seen": 34665700816,
      "step": 44061
    },
    {
      "epoch": 4.67451729259495,
      "grad_norm": 0.515611183333221,
      "learning_rate": 3.3542738993336324e-05,
      "loss": 1.2469,
      "num_input_tokens_seen": 34666487648,
      "step": 44062
    },
    {
      "epoch": 4.674623382134522,
      "grad_norm": 0.5765730326981074,
      "learning_rate": 3.3542085854442254e-05,
      "loss": 1.3455,
      "num_input_tokens_seen": 34667274384,
      "step": 44063
    },
    {
      "epoch": 4.674729471674093,
      "grad_norm": 0.555021451467781,
      "learning_rate": 3.354143270894709e-05,
      "loss": 1.3266,
      "num_input_tokens_seen": 34668061232,
      "step": 44064
    },
    {
      "epoch": 4.674835561213664,
      "grad_norm": 0.4779533439733002,
      "learning_rate": 3.354077955685137e-05,
      "loss": 1.317,
      "num_input_tokens_seen": 34668847984,
      "step": 44065
    },
    {
      "epoch": 4.674941650753236,
      "grad_norm": 0.5769701611304985,
      "learning_rate": 3.3540126398155594e-05,
      "loss": 1.399,
      "num_input_tokens_seen": 34669634848,
      "step": 44066
    },
    {
      "epoch": 4.675047740292807,
      "grad_norm": 0.44327838512683054,
      "learning_rate": 3.353947323286024e-05,
      "loss": 1.2667,
      "num_input_tokens_seen": 34670421648,
      "step": 44067
    },
    {
      "epoch": 4.675153829832379,
      "grad_norm": 0.5067680807059424,
      "learning_rate": 3.353882006096584e-05,
      "loss": 1.2705,
      "num_input_tokens_seen": 34671208480,
      "step": 44068
    },
    {
      "epoch": 4.67525991937195,
      "grad_norm": 0.5417338440607902,
      "learning_rate": 3.35381668824729e-05,
      "loss": 1.3146,
      "num_input_tokens_seen": 34671995312,
      "step": 44069
    },
    {
      "epoch": 4.675366008911522,
      "grad_norm": 0.5078289133932975,
      "learning_rate": 3.35375136973819e-05,
      "loss": 1.3301,
      "num_input_tokens_seen": 34672782096,
      "step": 44070
    },
    {
      "epoch": 4.675472098451093,
      "grad_norm": 0.49877238734565027,
      "learning_rate": 3.3536860505693365e-05,
      "loss": 1.2808,
      "num_input_tokens_seen": 34673568864,
      "step": 44071
    },
    {
      "epoch": 4.675578187990665,
      "grad_norm": 0.548830140215747,
      "learning_rate": 3.35362073074078e-05,
      "loss": 1.2581,
      "num_input_tokens_seen": 34674355616,
      "step": 44072
    },
    {
      "epoch": 4.675684277530236,
      "grad_norm": 0.4817694031591176,
      "learning_rate": 3.353555410252569e-05,
      "loss": 1.3336,
      "num_input_tokens_seen": 34675142352,
      "step": 44073
    },
    {
      "epoch": 4.675790367069807,
      "grad_norm": 0.502907351026736,
      "learning_rate": 3.3534900891047574e-05,
      "loss": 1.317,
      "num_input_tokens_seen": 34675929184,
      "step": 44074
    },
    {
      "epoch": 4.675896456609379,
      "grad_norm": 0.5379557972766228,
      "learning_rate": 3.353424767297392e-05,
      "loss": 1.3216,
      "num_input_tokens_seen": 34676715936,
      "step": 44075
    },
    {
      "epoch": 4.67600254614895,
      "grad_norm": 0.5708704602360081,
      "learning_rate": 3.353359444830526e-05,
      "loss": 1.2635,
      "num_input_tokens_seen": 34677502688,
      "step": 44076
    },
    {
      "epoch": 4.6761086356885215,
      "grad_norm": 0.5304987099173676,
      "learning_rate": 3.353294121704209e-05,
      "loss": 1.3195,
      "num_input_tokens_seen": 34678289392,
      "step": 44077
    },
    {
      "epoch": 4.676214725228093,
      "grad_norm": 0.6588730397440821,
      "learning_rate": 3.353228797918491e-05,
      "loss": 1.4581,
      "num_input_tokens_seen": 34679076224,
      "step": 44078
    },
    {
      "epoch": 4.676320814767664,
      "grad_norm": 0.43077750623045946,
      "learning_rate": 3.353163473473422e-05,
      "loss": 1.1515,
      "num_input_tokens_seen": 34679863072,
      "step": 44079
    },
    {
      "epoch": 4.6764269043072355,
      "grad_norm": 0.51994319922657,
      "learning_rate": 3.3530981483690544e-05,
      "loss": 1.3348,
      "num_input_tokens_seen": 34680649920,
      "step": 44080
    },
    {
      "epoch": 4.6765329938468065,
      "grad_norm": 0.4911100250235103,
      "learning_rate": 3.3530328226054374e-05,
      "loss": 1.3991,
      "num_input_tokens_seen": 34681436704,
      "step": 44081
    },
    {
      "epoch": 4.6766390833863785,
      "grad_norm": 0.4987874703214334,
      "learning_rate": 3.3529674961826214e-05,
      "loss": 1.2891,
      "num_input_tokens_seen": 34682223552,
      "step": 44082
    },
    {
      "epoch": 4.6767451729259495,
      "grad_norm": 0.47862614072905396,
      "learning_rate": 3.352902169100657e-05,
      "loss": 1.2676,
      "num_input_tokens_seen": 34683010336,
      "step": 44083
    },
    {
      "epoch": 4.6768512624655205,
      "grad_norm": 0.5764708686734512,
      "learning_rate": 3.352836841359596e-05,
      "loss": 1.3099,
      "num_input_tokens_seen": 34683797104,
      "step": 44084
    },
    {
      "epoch": 4.676957352005092,
      "grad_norm": 0.4884150864760827,
      "learning_rate": 3.3527715129594864e-05,
      "loss": 1.1949,
      "num_input_tokens_seen": 34684583952,
      "step": 44085
    },
    {
      "epoch": 4.6770634415446635,
      "grad_norm": 0.514940578993781,
      "learning_rate": 3.3527061839003806e-05,
      "loss": 1.3081,
      "num_input_tokens_seen": 34685370640,
      "step": 44086
    },
    {
      "epoch": 4.677169531084235,
      "grad_norm": 0.5707515067334632,
      "learning_rate": 3.3526408541823286e-05,
      "loss": 1.2616,
      "num_input_tokens_seen": 34686157440,
      "step": 44087
    },
    {
      "epoch": 4.677275620623806,
      "grad_norm": 0.5173276036128991,
      "learning_rate": 3.35257552380538e-05,
      "loss": 1.3222,
      "num_input_tokens_seen": 34686944224,
      "step": 44088
    },
    {
      "epoch": 4.6773817101633774,
      "grad_norm": 0.563891565869766,
      "learning_rate": 3.3525101927695866e-05,
      "loss": 1.3497,
      "num_input_tokens_seen": 34687730976,
      "step": 44089
    },
    {
      "epoch": 4.677487799702949,
      "grad_norm": 0.5014098772716177,
      "learning_rate": 3.352444861074998e-05,
      "loss": 1.2112,
      "num_input_tokens_seen": 34688517824,
      "step": 44090
    },
    {
      "epoch": 4.67759388924252,
      "grad_norm": 0.875728623557575,
      "learning_rate": 3.3523795287216654e-05,
      "loss": 1.3618,
      "num_input_tokens_seen": 34689304608,
      "step": 44091
    },
    {
      "epoch": 4.677699978782092,
      "grad_norm": 0.5478539746717458,
      "learning_rate": 3.3523141957096384e-05,
      "loss": 1.271,
      "num_input_tokens_seen": 34690091312,
      "step": 44092
    },
    {
      "epoch": 4.677806068321663,
      "grad_norm": 0.6231907992810449,
      "learning_rate": 3.352248862038969e-05,
      "loss": 1.1717,
      "num_input_tokens_seen": 34690878192,
      "step": 44093
    },
    {
      "epoch": 4.677912157861235,
      "grad_norm": 0.6477344423560022,
      "learning_rate": 3.3521835277097054e-05,
      "loss": 1.3363,
      "num_input_tokens_seen": 34691664896,
      "step": 44094
    },
    {
      "epoch": 4.678018247400806,
      "grad_norm": 0.6870921110338195,
      "learning_rate": 3.3521181927219e-05,
      "loss": 1.2961,
      "num_input_tokens_seen": 34692451632,
      "step": 44095
    },
    {
      "epoch": 4.678124336940377,
      "grad_norm": 0.5527196708367308,
      "learning_rate": 3.352052857075603e-05,
      "loss": 1.3797,
      "num_input_tokens_seen": 34693238496,
      "step": 44096
    },
    {
      "epoch": 4.678230426479949,
      "grad_norm": 0.5241428862870009,
      "learning_rate": 3.351987520770864e-05,
      "loss": 1.302,
      "num_input_tokens_seen": 34694025312,
      "step": 44097
    },
    {
      "epoch": 4.67833651601952,
      "grad_norm": 0.5467574948637348,
      "learning_rate": 3.351922183807735e-05,
      "loss": 1.3119,
      "num_input_tokens_seen": 34694812016,
      "step": 44098
    },
    {
      "epoch": 4.678442605559092,
      "grad_norm": 0.5518795442817214,
      "learning_rate": 3.3518568461862645e-05,
      "loss": 1.3085,
      "num_input_tokens_seen": 34695598896,
      "step": 44099
    },
    {
      "epoch": 4.678548695098663,
      "grad_norm": 0.504228474139562,
      "learning_rate": 3.3517915079065044e-05,
      "loss": 1.2938,
      "num_input_tokens_seen": 34696385584,
      "step": 44100
    },
    {
      "epoch": 4.678654784638235,
      "grad_norm": 0.5884836166308984,
      "learning_rate": 3.351726168968505e-05,
      "loss": 1.2932,
      "num_input_tokens_seen": 34697172400,
      "step": 44101
    },
    {
      "epoch": 4.678760874177806,
      "grad_norm": 0.5468788460466483,
      "learning_rate": 3.351660829372316e-05,
      "loss": 1.3527,
      "num_input_tokens_seen": 34697959168,
      "step": 44102
    },
    {
      "epoch": 4.678866963717377,
      "grad_norm": 0.5058357778896602,
      "learning_rate": 3.351595489117989e-05,
      "loss": 1.3413,
      "num_input_tokens_seen": 34698745856,
      "step": 44103
    },
    {
      "epoch": 4.678973053256949,
      "grad_norm": 0.4720508202293007,
      "learning_rate": 3.351530148205574e-05,
      "loss": 1.2389,
      "num_input_tokens_seen": 34699532624,
      "step": 44104
    },
    {
      "epoch": 4.67907914279652,
      "grad_norm": 0.5494213954887855,
      "learning_rate": 3.351464806635121e-05,
      "loss": 1.2943,
      "num_input_tokens_seen": 34700319488,
      "step": 44105
    },
    {
      "epoch": 4.679185232336092,
      "grad_norm": 0.47081854305254617,
      "learning_rate": 3.351399464406681e-05,
      "loss": 1.2921,
      "num_input_tokens_seen": 34701106384,
      "step": 44106
    },
    {
      "epoch": 4.679291321875663,
      "grad_norm": 0.5860185263487593,
      "learning_rate": 3.3513341215203054e-05,
      "loss": 1.3667,
      "num_input_tokens_seen": 34701893024,
      "step": 44107
    },
    {
      "epoch": 4.679397411415234,
      "grad_norm": 0.49562368338191387,
      "learning_rate": 3.351268777976043e-05,
      "loss": 1.3708,
      "num_input_tokens_seen": 34702679712,
      "step": 44108
    },
    {
      "epoch": 4.679503500954806,
      "grad_norm": 0.4944506643997696,
      "learning_rate": 3.351203433773946e-05,
      "loss": 1.2583,
      "num_input_tokens_seen": 34703466384,
      "step": 44109
    },
    {
      "epoch": 4.679609590494377,
      "grad_norm": 0.5100702663440115,
      "learning_rate": 3.351138088914062e-05,
      "loss": 1.2783,
      "num_input_tokens_seen": 34704253216,
      "step": 44110
    },
    {
      "epoch": 4.679715680033949,
      "grad_norm": 0.4965798398036017,
      "learning_rate": 3.3510727433964454e-05,
      "loss": 1.2994,
      "num_input_tokens_seen": 34705039936,
      "step": 44111
    },
    {
      "epoch": 4.67982176957352,
      "grad_norm": 0.5975093863979584,
      "learning_rate": 3.351007397221144e-05,
      "loss": 1.245,
      "num_input_tokens_seen": 34705826816,
      "step": 44112
    },
    {
      "epoch": 4.679927859113091,
      "grad_norm": 0.7302974271449907,
      "learning_rate": 3.350942050388209e-05,
      "loss": 1.3155,
      "num_input_tokens_seen": 34706613632,
      "step": 44113
    },
    {
      "epoch": 4.680033948652663,
      "grad_norm": 0.4811718696005013,
      "learning_rate": 3.350876702897691e-05,
      "loss": 1.3088,
      "num_input_tokens_seen": 34707400352,
      "step": 44114
    },
    {
      "epoch": 4.680140038192234,
      "grad_norm": 0.6973321751719185,
      "learning_rate": 3.350811354749641e-05,
      "loss": 1.3764,
      "num_input_tokens_seen": 34708187184,
      "step": 44115
    },
    {
      "epoch": 4.680246127731806,
      "grad_norm": 0.5700320752405511,
      "learning_rate": 3.3507460059441074e-05,
      "loss": 1.3741,
      "num_input_tokens_seen": 34708973808,
      "step": 44116
    },
    {
      "epoch": 4.680352217271377,
      "grad_norm": 0.540273798525471,
      "learning_rate": 3.350680656481144e-05,
      "loss": 1.2951,
      "num_input_tokens_seen": 34709760576,
      "step": 44117
    },
    {
      "epoch": 4.680458306810948,
      "grad_norm": 0.8160991942508146,
      "learning_rate": 3.3506153063607986e-05,
      "loss": 1.3309,
      "num_input_tokens_seen": 34710547376,
      "step": 44118
    },
    {
      "epoch": 4.68056439635052,
      "grad_norm": 0.5175690864545802,
      "learning_rate": 3.350549955583123e-05,
      "loss": 1.363,
      "num_input_tokens_seen": 34711334048,
      "step": 44119
    },
    {
      "epoch": 4.680670485890091,
      "grad_norm": 0.7454991229959887,
      "learning_rate": 3.3504846041481674e-05,
      "loss": 1.2356,
      "num_input_tokens_seen": 34712120768,
      "step": 44120
    },
    {
      "epoch": 4.680776575429663,
      "grad_norm": 0.6243022425035021,
      "learning_rate": 3.350419252055982e-05,
      "loss": 1.2784,
      "num_input_tokens_seen": 34712907568,
      "step": 44121
    },
    {
      "epoch": 4.680882664969234,
      "grad_norm": 0.5885119622963964,
      "learning_rate": 3.350353899306617e-05,
      "loss": 1.2372,
      "num_input_tokens_seen": 34713694384,
      "step": 44122
    },
    {
      "epoch": 4.680988754508806,
      "grad_norm": 0.6888799244379273,
      "learning_rate": 3.3502885459001245e-05,
      "loss": 1.3028,
      "num_input_tokens_seen": 34714481088,
      "step": 44123
    },
    {
      "epoch": 4.681094844048377,
      "grad_norm": 0.6257408811797428,
      "learning_rate": 3.350223191836553e-05,
      "loss": 1.2805,
      "num_input_tokens_seen": 34715267952,
      "step": 44124
    },
    {
      "epoch": 4.681200933587948,
      "grad_norm": 0.49923246863685755,
      "learning_rate": 3.350157837115955e-05,
      "loss": 1.2457,
      "num_input_tokens_seen": 34716054816,
      "step": 44125
    },
    {
      "epoch": 4.68130702312752,
      "grad_norm": 0.5432199899553988,
      "learning_rate": 3.3500924817383794e-05,
      "loss": 1.2017,
      "num_input_tokens_seen": 34716841584,
      "step": 44126
    },
    {
      "epoch": 4.681413112667091,
      "grad_norm": 0.5734995892607704,
      "learning_rate": 3.350027125703877e-05,
      "loss": 1.2884,
      "num_input_tokens_seen": 34717628336,
      "step": 44127
    },
    {
      "epoch": 4.681519202206663,
      "grad_norm": 0.590194575519741,
      "learning_rate": 3.349961769012499e-05,
      "loss": 1.2537,
      "num_input_tokens_seen": 34718415168,
      "step": 44128
    },
    {
      "epoch": 4.681625291746234,
      "grad_norm": 0.5647579268463931,
      "learning_rate": 3.3498964116642956e-05,
      "loss": 1.2851,
      "num_input_tokens_seen": 34719202000,
      "step": 44129
    },
    {
      "epoch": 4.681731381285806,
      "grad_norm": 0.9123176100919379,
      "learning_rate": 3.349831053659317e-05,
      "loss": 1.3099,
      "num_input_tokens_seen": 34719988768,
      "step": 44130
    },
    {
      "epoch": 4.681837470825377,
      "grad_norm": 0.5393997240071647,
      "learning_rate": 3.349765694997614e-05,
      "loss": 1.3548,
      "num_input_tokens_seen": 34720775520,
      "step": 44131
    },
    {
      "epoch": 4.681943560364948,
      "grad_norm": 0.6717276560151211,
      "learning_rate": 3.3497003356792364e-05,
      "loss": 1.1644,
      "num_input_tokens_seen": 34721562224,
      "step": 44132
    },
    {
      "epoch": 4.68204964990452,
      "grad_norm": 0.6284220352026751,
      "learning_rate": 3.3496349757042365e-05,
      "loss": 1.4084,
      "num_input_tokens_seen": 34722348928,
      "step": 44133
    },
    {
      "epoch": 4.682155739444091,
      "grad_norm": 0.5298953381256943,
      "learning_rate": 3.349569615072663e-05,
      "loss": 1.3062,
      "num_input_tokens_seen": 34723135728,
      "step": 44134
    },
    {
      "epoch": 4.682261828983663,
      "grad_norm": 0.5552256541903472,
      "learning_rate": 3.3495042537845666e-05,
      "loss": 1.3521,
      "num_input_tokens_seen": 34723922496,
      "step": 44135
    },
    {
      "epoch": 4.682367918523234,
      "grad_norm": 0.4884930620167133,
      "learning_rate": 3.349438891839999e-05,
      "loss": 1.1855,
      "num_input_tokens_seen": 34724709280,
      "step": 44136
    },
    {
      "epoch": 4.682474008062805,
      "grad_norm": 0.493389223888421,
      "learning_rate": 3.349373529239009e-05,
      "loss": 1.2795,
      "num_input_tokens_seen": 34725496048,
      "step": 44137
    },
    {
      "epoch": 4.682580097602377,
      "grad_norm": 0.610510713007915,
      "learning_rate": 3.349308165981649e-05,
      "loss": 1.4526,
      "num_input_tokens_seen": 34726282752,
      "step": 44138
    },
    {
      "epoch": 4.682686187141948,
      "grad_norm": 0.5063745967341678,
      "learning_rate": 3.349242802067968e-05,
      "loss": 1.3299,
      "num_input_tokens_seen": 34727069488,
      "step": 44139
    },
    {
      "epoch": 4.6827922766815195,
      "grad_norm": 0.5482819499346477,
      "learning_rate": 3.349177437498017e-05,
      "loss": 1.3347,
      "num_input_tokens_seen": 34727856208,
      "step": 44140
    },
    {
      "epoch": 4.682898366221091,
      "grad_norm": 0.4993708723596944,
      "learning_rate": 3.349112072271847e-05,
      "loss": 1.228,
      "num_input_tokens_seen": 34728643040,
      "step": 44141
    },
    {
      "epoch": 4.683004455760662,
      "grad_norm": 0.5399075279946804,
      "learning_rate": 3.349046706389508e-05,
      "loss": 1.2847,
      "num_input_tokens_seen": 34729429872,
      "step": 44142
    },
    {
      "epoch": 4.6831105453002335,
      "grad_norm": 0.7488926011653257,
      "learning_rate": 3.3489813398510504e-05,
      "loss": 1.2957,
      "num_input_tokens_seen": 34730216592,
      "step": 44143
    },
    {
      "epoch": 4.6832166348398045,
      "grad_norm": 0.5246751454255193,
      "learning_rate": 3.348915972656526e-05,
      "loss": 1.3636,
      "num_input_tokens_seen": 34731003424,
      "step": 44144
    },
    {
      "epoch": 4.6833227243793765,
      "grad_norm": 0.5764511301251309,
      "learning_rate": 3.348850604805983e-05,
      "loss": 1.3258,
      "num_input_tokens_seen": 34731790288,
      "step": 44145
    },
    {
      "epoch": 4.6834288139189475,
      "grad_norm": 0.5969941396133218,
      "learning_rate": 3.348785236299473e-05,
      "loss": 1.4229,
      "num_input_tokens_seen": 34732576992,
      "step": 44146
    },
    {
      "epoch": 4.6835349034585185,
      "grad_norm": 0.5982483269328762,
      "learning_rate": 3.348719867137048e-05,
      "loss": 1.3481,
      "num_input_tokens_seen": 34733363792,
      "step": 44147
    },
    {
      "epoch": 4.6836409929980904,
      "grad_norm": 0.46644620060789277,
      "learning_rate": 3.348654497318756e-05,
      "loss": 1.2045,
      "num_input_tokens_seen": 34734150624,
      "step": 44148
    },
    {
      "epoch": 4.6837470825376615,
      "grad_norm": 0.807399145171283,
      "learning_rate": 3.348589126844649e-05,
      "loss": 1.364,
      "num_input_tokens_seen": 34734937392,
      "step": 44149
    },
    {
      "epoch": 4.683853172077233,
      "grad_norm": 0.5145874959669695,
      "learning_rate": 3.3485237557147777e-05,
      "loss": 1.359,
      "num_input_tokens_seen": 34735724240,
      "step": 44150
    },
    {
      "epoch": 4.683959261616804,
      "grad_norm": 0.6938319458853185,
      "learning_rate": 3.3484583839291915e-05,
      "loss": 1.2937,
      "num_input_tokens_seen": 34736511104,
      "step": 44151
    },
    {
      "epoch": 4.684065351156376,
      "grad_norm": 0.49739866949653627,
      "learning_rate": 3.348393011487942e-05,
      "loss": 1.1854,
      "num_input_tokens_seen": 34737297920,
      "step": 44152
    },
    {
      "epoch": 4.684171440695947,
      "grad_norm": 0.5846661437939846,
      "learning_rate": 3.348327638391079e-05,
      "loss": 1.365,
      "num_input_tokens_seen": 34738084688,
      "step": 44153
    },
    {
      "epoch": 4.684277530235518,
      "grad_norm": 0.7316684184730754,
      "learning_rate": 3.348262264638653e-05,
      "loss": 1.3522,
      "num_input_tokens_seen": 34738871536,
      "step": 44154
    },
    {
      "epoch": 4.68438361977509,
      "grad_norm": 0.5950435802551285,
      "learning_rate": 3.348196890230716e-05,
      "loss": 1.2353,
      "num_input_tokens_seen": 34739658304,
      "step": 44155
    },
    {
      "epoch": 4.684489709314661,
      "grad_norm": 0.546331653401013,
      "learning_rate": 3.348131515167316e-05,
      "loss": 1.2751,
      "num_input_tokens_seen": 34740445120,
      "step": 44156
    },
    {
      "epoch": 4.684595798854233,
      "grad_norm": 0.7546012233404991,
      "learning_rate": 3.348066139448505e-05,
      "loss": 1.3539,
      "num_input_tokens_seen": 34741231920,
      "step": 44157
    },
    {
      "epoch": 4.684701888393804,
      "grad_norm": 0.5549729020956016,
      "learning_rate": 3.3480007630743346e-05,
      "loss": 1.2865,
      "num_input_tokens_seen": 34742018560,
      "step": 44158
    },
    {
      "epoch": 4.684807977933376,
      "grad_norm": 0.7913395321467653,
      "learning_rate": 3.347935386044853e-05,
      "loss": 1.3146,
      "num_input_tokens_seen": 34742805376,
      "step": 44159
    },
    {
      "epoch": 4.684914067472947,
      "grad_norm": 0.6667044950576176,
      "learning_rate": 3.347870008360112e-05,
      "loss": 1.2519,
      "num_input_tokens_seen": 34743592144,
      "step": 44160
    },
    {
      "epoch": 4.685020157012518,
      "grad_norm": 0.7434706993105045,
      "learning_rate": 3.347804630020162e-05,
      "loss": 1.308,
      "num_input_tokens_seen": 34744378848,
      "step": 44161
    },
    {
      "epoch": 4.68512624655209,
      "grad_norm": 0.9497849117561382,
      "learning_rate": 3.347739251025053e-05,
      "loss": 1.3749,
      "num_input_tokens_seen": 34745165632,
      "step": 44162
    },
    {
      "epoch": 4.685232336091661,
      "grad_norm": 0.5415520400739382,
      "learning_rate": 3.347673871374837e-05,
      "loss": 1.3457,
      "num_input_tokens_seen": 34745952304,
      "step": 44163
    },
    {
      "epoch": 4.685338425631233,
      "grad_norm": 0.7903721268860433,
      "learning_rate": 3.3476084910695624e-05,
      "loss": 1.3735,
      "num_input_tokens_seen": 34746739168,
      "step": 44164
    },
    {
      "epoch": 4.685444515170804,
      "grad_norm": 0.6430192252956838,
      "learning_rate": 3.347543110109281e-05,
      "loss": 1.3095,
      "num_input_tokens_seen": 34747525872,
      "step": 44165
    },
    {
      "epoch": 4.685550604710375,
      "grad_norm": 0.570532760959792,
      "learning_rate": 3.347477728494044e-05,
      "loss": 1.3172,
      "num_input_tokens_seen": 34748312640,
      "step": 44166
    },
    {
      "epoch": 4.685656694249947,
      "grad_norm": 0.6720624114666067,
      "learning_rate": 3.347412346223901e-05,
      "loss": 1.2348,
      "num_input_tokens_seen": 34749099376,
      "step": 44167
    },
    {
      "epoch": 4.685762783789518,
      "grad_norm": 0.6478588824601412,
      "learning_rate": 3.347346963298902e-05,
      "loss": 1.2674,
      "num_input_tokens_seen": 34749886096,
      "step": 44168
    },
    {
      "epoch": 4.68586887332909,
      "grad_norm": 0.5522190960170191,
      "learning_rate": 3.3472815797190984e-05,
      "loss": 1.3291,
      "num_input_tokens_seen": 34750672816,
      "step": 44169
    },
    {
      "epoch": 4.685974962868661,
      "grad_norm": 0.7028175676367818,
      "learning_rate": 3.3472161954845396e-05,
      "loss": 1.3836,
      "num_input_tokens_seen": 34751459616,
      "step": 44170
    },
    {
      "epoch": 4.686081052408232,
      "grad_norm": 0.5587357513590547,
      "learning_rate": 3.347150810595278e-05,
      "loss": 1.2745,
      "num_input_tokens_seen": 34752246320,
      "step": 44171
    },
    {
      "epoch": 4.686187141947804,
      "grad_norm": 0.5382553547005138,
      "learning_rate": 3.3470854250513625e-05,
      "loss": 1.2739,
      "num_input_tokens_seen": 34753033072,
      "step": 44172
    },
    {
      "epoch": 4.686293231487375,
      "grad_norm": 0.5515018627812283,
      "learning_rate": 3.347020038852845e-05,
      "loss": 1.2628,
      "num_input_tokens_seen": 34753819856,
      "step": 44173
    },
    {
      "epoch": 4.686399321026947,
      "grad_norm": 0.6178676501014386,
      "learning_rate": 3.346954651999775e-05,
      "loss": 1.3344,
      "num_input_tokens_seen": 34754606672,
      "step": 44174
    },
    {
      "epoch": 4.686505410566518,
      "grad_norm": 0.4968067837603526,
      "learning_rate": 3.346889264492203e-05,
      "loss": 1.1866,
      "num_input_tokens_seen": 34755393376,
      "step": 44175
    },
    {
      "epoch": 4.686611500106089,
      "grad_norm": 0.5443658233731505,
      "learning_rate": 3.34682387633018e-05,
      "loss": 1.2478,
      "num_input_tokens_seen": 34756180256,
      "step": 44176
    },
    {
      "epoch": 4.686717589645661,
      "grad_norm": 0.49460452151133616,
      "learning_rate": 3.346758487513756e-05,
      "loss": 1.298,
      "num_input_tokens_seen": 34756967008,
      "step": 44177
    },
    {
      "epoch": 4.686823679185232,
      "grad_norm": 0.5200814347751789,
      "learning_rate": 3.346693098042983e-05,
      "loss": 1.3518,
      "num_input_tokens_seen": 34757753808,
      "step": 44178
    },
    {
      "epoch": 4.686929768724804,
      "grad_norm": 0.7271385986455022,
      "learning_rate": 3.34662770791791e-05,
      "loss": 1.3792,
      "num_input_tokens_seen": 34758540576,
      "step": 44179
    },
    {
      "epoch": 4.687035858264375,
      "grad_norm": 0.49339747749394797,
      "learning_rate": 3.346562317138587e-05,
      "loss": 1.3371,
      "num_input_tokens_seen": 34759327376,
      "step": 44180
    },
    {
      "epoch": 4.687141947803947,
      "grad_norm": 0.575553586678689,
      "learning_rate": 3.346496925705066e-05,
      "loss": 1.34,
      "num_input_tokens_seen": 34760114032,
      "step": 44181
    },
    {
      "epoch": 4.687248037343518,
      "grad_norm": 0.5991529335168408,
      "learning_rate": 3.3464315336173965e-05,
      "loss": 1.3548,
      "num_input_tokens_seen": 34760900816,
      "step": 44182
    },
    {
      "epoch": 4.687354126883089,
      "grad_norm": 0.4686581696913656,
      "learning_rate": 3.346366140875631e-05,
      "loss": 1.2999,
      "num_input_tokens_seen": 34761687488,
      "step": 44183
    },
    {
      "epoch": 4.687460216422661,
      "grad_norm": 0.5789316196358895,
      "learning_rate": 3.346300747479817e-05,
      "loss": 1.3001,
      "num_input_tokens_seen": 34762474192,
      "step": 44184
    },
    {
      "epoch": 4.687566305962232,
      "grad_norm": 0.59555520924246,
      "learning_rate": 3.3462353534300073e-05,
      "loss": 1.3106,
      "num_input_tokens_seen": 34763260912,
      "step": 44185
    },
    {
      "epoch": 4.687672395501804,
      "grad_norm": 0.7553804423495933,
      "learning_rate": 3.346169958726252e-05,
      "loss": 1.2815,
      "num_input_tokens_seen": 34764047680,
      "step": 44186
    },
    {
      "epoch": 4.687778485041375,
      "grad_norm": 0.5805699856034611,
      "learning_rate": 3.3461045633686016e-05,
      "loss": 1.2589,
      "num_input_tokens_seen": 34764834384,
      "step": 44187
    },
    {
      "epoch": 4.687884574580947,
      "grad_norm": 0.710655482743102,
      "learning_rate": 3.346039167357106e-05,
      "loss": 1.3147,
      "num_input_tokens_seen": 34765621200,
      "step": 44188
    },
    {
      "epoch": 4.687990664120518,
      "grad_norm": 0.7232337091853194,
      "learning_rate": 3.345973770691816e-05,
      "loss": 1.3358,
      "num_input_tokens_seen": 34766407888,
      "step": 44189
    },
    {
      "epoch": 4.688096753660089,
      "grad_norm": 0.5090185389085496,
      "learning_rate": 3.345908373372782e-05,
      "loss": 1.2498,
      "num_input_tokens_seen": 34767194736,
      "step": 44190
    },
    {
      "epoch": 4.688202843199661,
      "grad_norm": 0.6046791644763674,
      "learning_rate": 3.345842975400055e-05,
      "loss": 1.2588,
      "num_input_tokens_seen": 34767981424,
      "step": 44191
    },
    {
      "epoch": 4.688308932739232,
      "grad_norm": 0.5311089868533452,
      "learning_rate": 3.345777576773687e-05,
      "loss": 1.2838,
      "num_input_tokens_seen": 34768768144,
      "step": 44192
    },
    {
      "epoch": 4.688415022278804,
      "grad_norm": 0.5137458697269859,
      "learning_rate": 3.345712177493725e-05,
      "loss": 1.2333,
      "num_input_tokens_seen": 34769554864,
      "step": 44193
    },
    {
      "epoch": 4.688521111818375,
      "grad_norm": 0.5421163353418169,
      "learning_rate": 3.3456467775602215e-05,
      "loss": 1.2727,
      "num_input_tokens_seen": 34770341632,
      "step": 44194
    },
    {
      "epoch": 4.688627201357946,
      "grad_norm": 0.6481017030806814,
      "learning_rate": 3.345581376973228e-05,
      "loss": 1.2753,
      "num_input_tokens_seen": 34771128496,
      "step": 44195
    },
    {
      "epoch": 4.688733290897518,
      "grad_norm": 0.6101205836662101,
      "learning_rate": 3.345515975732793e-05,
      "loss": 1.2858,
      "num_input_tokens_seen": 34771915216,
      "step": 44196
    },
    {
      "epoch": 4.688839380437089,
      "grad_norm": 0.7190159961897943,
      "learning_rate": 3.3454505738389686e-05,
      "loss": 1.2895,
      "num_input_tokens_seen": 34772701936,
      "step": 44197
    },
    {
      "epoch": 4.688945469976661,
      "grad_norm": 0.6224323120660226,
      "learning_rate": 3.345385171291805e-05,
      "loss": 1.2533,
      "num_input_tokens_seen": 34773488672,
      "step": 44198
    },
    {
      "epoch": 4.689051559516232,
      "grad_norm": 0.6369919716487366,
      "learning_rate": 3.345319768091352e-05,
      "loss": 1.3634,
      "num_input_tokens_seen": 34774275424,
      "step": 44199
    },
    {
      "epoch": 4.689157649055803,
      "grad_norm": 0.5727821761933354,
      "learning_rate": 3.345254364237661e-05,
      "loss": 1.2835,
      "num_input_tokens_seen": 34775062208,
      "step": 44200
    },
    {
      "epoch": 4.689263738595375,
      "grad_norm": 0.4918552543596612,
      "learning_rate": 3.345188959730783e-05,
      "loss": 1.3525,
      "num_input_tokens_seen": 34775848960,
      "step": 44201
    },
    {
      "epoch": 4.689369828134946,
      "grad_norm": 0.5641393052297512,
      "learning_rate": 3.345123554570766e-05,
      "loss": 1.3472,
      "num_input_tokens_seen": 34776635744,
      "step": 44202
    },
    {
      "epoch": 4.6894759176745175,
      "grad_norm": 0.5916866752089582,
      "learning_rate": 3.3450581487576636e-05,
      "loss": 1.3011,
      "num_input_tokens_seen": 34777422512,
      "step": 44203
    },
    {
      "epoch": 4.689582007214089,
      "grad_norm": 0.4921194551818243,
      "learning_rate": 3.344992742291525e-05,
      "loss": 1.3897,
      "num_input_tokens_seen": 34778209312,
      "step": 44204
    },
    {
      "epoch": 4.68968809675366,
      "grad_norm": 0.696852340366897,
      "learning_rate": 3.3449273351724005e-05,
      "loss": 1.2966,
      "num_input_tokens_seen": 34778996112,
      "step": 44205
    },
    {
      "epoch": 4.6897941862932315,
      "grad_norm": 0.4886139388868409,
      "learning_rate": 3.344861927400341e-05,
      "loss": 1.2312,
      "num_input_tokens_seen": 34779782880,
      "step": 44206
    },
    {
      "epoch": 4.689900275832803,
      "grad_norm": 0.5549311656056082,
      "learning_rate": 3.3447965189753974e-05,
      "loss": 1.2443,
      "num_input_tokens_seen": 34780569696,
      "step": 44207
    },
    {
      "epoch": 4.6900063653723745,
      "grad_norm": 0.5194096826635782,
      "learning_rate": 3.344731109897619e-05,
      "loss": 1.3927,
      "num_input_tokens_seen": 34781356432,
      "step": 44208
    },
    {
      "epoch": 4.6901124549119455,
      "grad_norm": 0.4935532394116887,
      "learning_rate": 3.344665700167058e-05,
      "loss": 1.3898,
      "num_input_tokens_seen": 34782143120,
      "step": 44209
    },
    {
      "epoch": 4.690218544451517,
      "grad_norm": 0.5753514399965445,
      "learning_rate": 3.3446002897837635e-05,
      "loss": 1.3663,
      "num_input_tokens_seen": 34782929872,
      "step": 44210
    },
    {
      "epoch": 4.6903246339910885,
      "grad_norm": 0.5039470929726213,
      "learning_rate": 3.344534878747787e-05,
      "loss": 1.2787,
      "num_input_tokens_seen": 34783716720,
      "step": 44211
    },
    {
      "epoch": 4.69043072353066,
      "grad_norm": 0.47964143462928227,
      "learning_rate": 3.344469467059179e-05,
      "loss": 1.2612,
      "num_input_tokens_seen": 34784503504,
      "step": 44212
    },
    {
      "epoch": 4.690536813070231,
      "grad_norm": 0.5378206324694447,
      "learning_rate": 3.344404054717989e-05,
      "loss": 1.3666,
      "num_input_tokens_seen": 34785290304,
      "step": 44213
    },
    {
      "epoch": 4.690642902609802,
      "grad_norm": 0.5356691836250876,
      "learning_rate": 3.344338641724269e-05,
      "loss": 1.4204,
      "num_input_tokens_seen": 34786077104,
      "step": 44214
    },
    {
      "epoch": 4.690748992149374,
      "grad_norm": 0.5228010383907109,
      "learning_rate": 3.344273228078069e-05,
      "loss": 1.334,
      "num_input_tokens_seen": 34786863952,
      "step": 44215
    },
    {
      "epoch": 4.690855081688945,
      "grad_norm": 0.5811783807323407,
      "learning_rate": 3.344207813779439e-05,
      "loss": 1.3418,
      "num_input_tokens_seen": 34787650704,
      "step": 44216
    },
    {
      "epoch": 4.690961171228517,
      "grad_norm": 0.505347450221579,
      "learning_rate": 3.3441423988284295e-05,
      "loss": 1.3547,
      "num_input_tokens_seen": 34788437552,
      "step": 44217
    },
    {
      "epoch": 4.691067260768088,
      "grad_norm": 0.5331370047419242,
      "learning_rate": 3.3440769832250916e-05,
      "loss": 1.2372,
      "num_input_tokens_seen": 34789224416,
      "step": 44218
    },
    {
      "epoch": 4.691173350307659,
      "grad_norm": 0.5084367665255629,
      "learning_rate": 3.344011566969477e-05,
      "loss": 1.2815,
      "num_input_tokens_seen": 34790011232,
      "step": 44219
    },
    {
      "epoch": 4.691279439847231,
      "grad_norm": 0.5257207803171653,
      "learning_rate": 3.343946150061634e-05,
      "loss": 1.3284,
      "num_input_tokens_seen": 34790797968,
      "step": 44220
    },
    {
      "epoch": 4.691385529386802,
      "grad_norm": 0.4819327300567409,
      "learning_rate": 3.343880732501614e-05,
      "loss": 1.3093,
      "num_input_tokens_seen": 34791584736,
      "step": 44221
    },
    {
      "epoch": 4.691491618926374,
      "grad_norm": 0.5265495242673752,
      "learning_rate": 3.343815314289469e-05,
      "loss": 1.3779,
      "num_input_tokens_seen": 34792371552,
      "step": 44222
    },
    {
      "epoch": 4.691597708465945,
      "grad_norm": 0.5056505598497754,
      "learning_rate": 3.3437498954252466e-05,
      "loss": 1.2702,
      "num_input_tokens_seen": 34793158336,
      "step": 44223
    },
    {
      "epoch": 4.691703798005516,
      "grad_norm": 0.4441308426502098,
      "learning_rate": 3.343684475909e-05,
      "loss": 1.1694,
      "num_input_tokens_seen": 34793945136,
      "step": 44224
    },
    {
      "epoch": 4.691809887545088,
      "grad_norm": 0.4785635719373073,
      "learning_rate": 3.343619055740778e-05,
      "loss": 1.3439,
      "num_input_tokens_seen": 34794731808,
      "step": 44225
    },
    {
      "epoch": 4.691915977084659,
      "grad_norm": 0.43562022249203547,
      "learning_rate": 3.343553634920633e-05,
      "loss": 1.2762,
      "num_input_tokens_seen": 34795518496,
      "step": 44226
    },
    {
      "epoch": 4.692022066624231,
      "grad_norm": 0.4830149820001108,
      "learning_rate": 3.343488213448614e-05,
      "loss": 1.306,
      "num_input_tokens_seen": 34796305392,
      "step": 44227
    },
    {
      "epoch": 4.692128156163802,
      "grad_norm": 0.5724738032808566,
      "learning_rate": 3.343422791324772e-05,
      "loss": 1.3252,
      "num_input_tokens_seen": 34797092160,
      "step": 44228
    },
    {
      "epoch": 4.692234245703373,
      "grad_norm": 0.5219298089987328,
      "learning_rate": 3.3433573685491585e-05,
      "loss": 1.3362,
      "num_input_tokens_seen": 34797878832,
      "step": 44229
    },
    {
      "epoch": 4.692340335242945,
      "grad_norm": 0.5845329614110752,
      "learning_rate": 3.343291945121823e-05,
      "loss": 1.3308,
      "num_input_tokens_seen": 34798665600,
      "step": 44230
    },
    {
      "epoch": 4.692446424782516,
      "grad_norm": 0.496194657297795,
      "learning_rate": 3.343226521042815e-05,
      "loss": 1.2459,
      "num_input_tokens_seen": 34799452432,
      "step": 44231
    },
    {
      "epoch": 4.692552514322088,
      "grad_norm": 0.6072139299894038,
      "learning_rate": 3.343161096312187e-05,
      "loss": 1.3012,
      "num_input_tokens_seen": 34800239152,
      "step": 44232
    },
    {
      "epoch": 4.692658603861659,
      "grad_norm": 0.5160388558283527,
      "learning_rate": 3.3430956709299886e-05,
      "loss": 1.2849,
      "num_input_tokens_seen": 34801025968,
      "step": 44233
    },
    {
      "epoch": 4.69276469340123,
      "grad_norm": 0.5077265481223406,
      "learning_rate": 3.343030244896271e-05,
      "loss": 1.3193,
      "num_input_tokens_seen": 34801812704,
      "step": 44234
    },
    {
      "epoch": 4.692870782940802,
      "grad_norm": 0.8000724032728124,
      "learning_rate": 3.342964818211084e-05,
      "loss": 1.2421,
      "num_input_tokens_seen": 34802599424,
      "step": 44235
    },
    {
      "epoch": 4.692976872480373,
      "grad_norm": 0.49206653193352534,
      "learning_rate": 3.3428993908744795e-05,
      "loss": 1.3882,
      "num_input_tokens_seen": 34803386160,
      "step": 44236
    },
    {
      "epoch": 4.693082962019945,
      "grad_norm": 0.75005312224494,
      "learning_rate": 3.3428339628865056e-05,
      "loss": 1.4914,
      "num_input_tokens_seen": 34804172912,
      "step": 44237
    },
    {
      "epoch": 4.693189051559516,
      "grad_norm": 0.670947907214656,
      "learning_rate": 3.3427685342472155e-05,
      "loss": 1.3588,
      "num_input_tokens_seen": 34804959584,
      "step": 44238
    },
    {
      "epoch": 4.693295141099088,
      "grad_norm": 0.5204097107628791,
      "learning_rate": 3.3427031049566574e-05,
      "loss": 1.3106,
      "num_input_tokens_seen": 34805746352,
      "step": 44239
    },
    {
      "epoch": 4.693401230638659,
      "grad_norm": 1.0140752422406853,
      "learning_rate": 3.342637675014884e-05,
      "loss": 1.1978,
      "num_input_tokens_seen": 34806533216,
      "step": 44240
    },
    {
      "epoch": 4.693507320178231,
      "grad_norm": 0.5433346093647842,
      "learning_rate": 3.342572244421945e-05,
      "loss": 1.3594,
      "num_input_tokens_seen": 34807319952,
      "step": 44241
    },
    {
      "epoch": 4.693613409717802,
      "grad_norm": 0.8064247226236093,
      "learning_rate": 3.3425068131778904e-05,
      "loss": 1.298,
      "num_input_tokens_seen": 34808106640,
      "step": 44242
    },
    {
      "epoch": 4.693719499257373,
      "grad_norm": 0.4871017342749143,
      "learning_rate": 3.342441381282772e-05,
      "loss": 1.3619,
      "num_input_tokens_seen": 34808893440,
      "step": 44243
    },
    {
      "epoch": 4.693825588796945,
      "grad_norm": 0.5229075042233771,
      "learning_rate": 3.342375948736639e-05,
      "loss": 1.342,
      "num_input_tokens_seen": 34809680240,
      "step": 44244
    },
    {
      "epoch": 4.693931678336516,
      "grad_norm": 0.46070916691150443,
      "learning_rate": 3.342310515539542e-05,
      "loss": 1.2014,
      "num_input_tokens_seen": 34810466976,
      "step": 44245
    },
    {
      "epoch": 4.694037767876088,
      "grad_norm": 0.43928229692480675,
      "learning_rate": 3.342245081691533e-05,
      "loss": 1.1762,
      "num_input_tokens_seen": 34811253696,
      "step": 44246
    },
    {
      "epoch": 4.694143857415659,
      "grad_norm": 0.4472631313946653,
      "learning_rate": 3.342179647192662e-05,
      "loss": 1.14,
      "num_input_tokens_seen": 34812040480,
      "step": 44247
    },
    {
      "epoch": 4.69424994695523,
      "grad_norm": 0.4970103074212751,
      "learning_rate": 3.342114212042978e-05,
      "loss": 1.3514,
      "num_input_tokens_seen": 34812827312,
      "step": 44248
    },
    {
      "epoch": 4.694356036494802,
      "grad_norm": 0.599778982423921,
      "learning_rate": 3.342048776242535e-05,
      "loss": 1.3968,
      "num_input_tokens_seen": 34813614016,
      "step": 44249
    },
    {
      "epoch": 4.694462126034373,
      "grad_norm": 0.4640640160101327,
      "learning_rate": 3.3419833397913797e-05,
      "loss": 1.3815,
      "num_input_tokens_seen": 34814400720,
      "step": 44250
    },
    {
      "epoch": 4.694568215573945,
      "grad_norm": 0.473216694941694,
      "learning_rate": 3.3419179026895643e-05,
      "loss": 1.3521,
      "num_input_tokens_seen": 34815187520,
      "step": 44251
    },
    {
      "epoch": 4.694674305113516,
      "grad_norm": 0.4754164801745981,
      "learning_rate": 3.34185246493714e-05,
      "loss": 1.251,
      "num_input_tokens_seen": 34815974384,
      "step": 44252
    },
    {
      "epoch": 4.694780394653087,
      "grad_norm": 0.5497221394895928,
      "learning_rate": 3.341787026534157e-05,
      "loss": 1.3908,
      "num_input_tokens_seen": 34816761152,
      "step": 44253
    },
    {
      "epoch": 4.694886484192659,
      "grad_norm": 0.49540913507734624,
      "learning_rate": 3.341721587480665e-05,
      "loss": 1.2856,
      "num_input_tokens_seen": 34817547952,
      "step": 44254
    },
    {
      "epoch": 4.69499257373223,
      "grad_norm": 0.5489233259680117,
      "learning_rate": 3.341656147776716e-05,
      "loss": 1.335,
      "num_input_tokens_seen": 34818334688,
      "step": 44255
    },
    {
      "epoch": 4.695098663271802,
      "grad_norm": 0.4954835715800273,
      "learning_rate": 3.34159070742236e-05,
      "loss": 1.4021,
      "num_input_tokens_seen": 34819121440,
      "step": 44256
    },
    {
      "epoch": 4.695204752811373,
      "grad_norm": 0.4921584286169861,
      "learning_rate": 3.3415252664176464e-05,
      "loss": 1.2909,
      "num_input_tokens_seen": 34819908304,
      "step": 44257
    },
    {
      "epoch": 4.695310842350944,
      "grad_norm": 0.48094567060411997,
      "learning_rate": 3.341459824762627e-05,
      "loss": 1.2683,
      "num_input_tokens_seen": 34820695168,
      "step": 44258
    },
    {
      "epoch": 4.695416931890516,
      "grad_norm": 0.6246222177564281,
      "learning_rate": 3.341394382457352e-05,
      "loss": 1.2876,
      "num_input_tokens_seen": 34821481952,
      "step": 44259
    },
    {
      "epoch": 4.695523021430087,
      "grad_norm": 0.5758442793016875,
      "learning_rate": 3.341328939501873e-05,
      "loss": 1.2268,
      "num_input_tokens_seen": 34822268768,
      "step": 44260
    },
    {
      "epoch": 4.695629110969659,
      "grad_norm": 0.6078788796780105,
      "learning_rate": 3.3412634958962394e-05,
      "loss": 1.3849,
      "num_input_tokens_seen": 34823055536,
      "step": 44261
    },
    {
      "epoch": 4.69573520050923,
      "grad_norm": 0.7684514260969383,
      "learning_rate": 3.341198051640502e-05,
      "loss": 1.2474,
      "num_input_tokens_seen": 34823842352,
      "step": 44262
    },
    {
      "epoch": 4.695841290048802,
      "grad_norm": 0.6755979357204566,
      "learning_rate": 3.341132606734711e-05,
      "loss": 1.2646,
      "num_input_tokens_seen": 34824629184,
      "step": 44263
    },
    {
      "epoch": 4.695947379588373,
      "grad_norm": 0.963779687660868,
      "learning_rate": 3.341067161178918e-05,
      "loss": 1.3441,
      "num_input_tokens_seen": 34825415904,
      "step": 44264
    },
    {
      "epoch": 4.696053469127944,
      "grad_norm": 1.138049417908099,
      "learning_rate": 3.341001714973172e-05,
      "loss": 1.3021,
      "num_input_tokens_seen": 34826202784,
      "step": 44265
    },
    {
      "epoch": 4.6961595586675156,
      "grad_norm": 0.7092308973441157,
      "learning_rate": 3.340936268117525e-05,
      "loss": 1.3599,
      "num_input_tokens_seen": 34826989568,
      "step": 44266
    },
    {
      "epoch": 4.696265648207087,
      "grad_norm": 1.016145979745832,
      "learning_rate": 3.3408708206120276e-05,
      "loss": 1.2531,
      "num_input_tokens_seen": 34827776256,
      "step": 44267
    },
    {
      "epoch": 4.6963717377466585,
      "grad_norm": 0.583350914265621,
      "learning_rate": 3.34080537245673e-05,
      "loss": 1.2928,
      "num_input_tokens_seen": 34828563024,
      "step": 44268
    },
    {
      "epoch": 4.6964778272862295,
      "grad_norm": 0.7701708896154295,
      "learning_rate": 3.340739923651682e-05,
      "loss": 1.245,
      "num_input_tokens_seen": 34829349792,
      "step": 44269
    },
    {
      "epoch": 4.6965839168258015,
      "grad_norm": 0.83750253185787,
      "learning_rate": 3.340674474196935e-05,
      "loss": 1.2709,
      "num_input_tokens_seen": 34830136544,
      "step": 44270
    },
    {
      "epoch": 4.6966900063653725,
      "grad_norm": 0.5737192438257938,
      "learning_rate": 3.3406090240925394e-05,
      "loss": 1.3302,
      "num_input_tokens_seen": 34830923328,
      "step": 44271
    },
    {
      "epoch": 4.6967960959049435,
      "grad_norm": 0.5700474652983647,
      "learning_rate": 3.340543573338546e-05,
      "loss": 1.3493,
      "num_input_tokens_seen": 34831710128,
      "step": 44272
    },
    {
      "epoch": 4.696902185444515,
      "grad_norm": 0.6086778718081445,
      "learning_rate": 3.3404781219350055e-05,
      "loss": 1.2993,
      "num_input_tokens_seen": 34832496832,
      "step": 44273
    },
    {
      "epoch": 4.6970082749840865,
      "grad_norm": 0.5218829981923641,
      "learning_rate": 3.3404126698819676e-05,
      "loss": 1.2496,
      "num_input_tokens_seen": 34833283616,
      "step": 44274
    },
    {
      "epoch": 4.697114364523658,
      "grad_norm": 0.5477689385883593,
      "learning_rate": 3.340347217179484e-05,
      "loss": 1.3203,
      "num_input_tokens_seen": 34834070416,
      "step": 44275
    },
    {
      "epoch": 4.697220454063229,
      "grad_norm": 0.5465612252617404,
      "learning_rate": 3.3402817638276044e-05,
      "loss": 1.2532,
      "num_input_tokens_seen": 34834857200,
      "step": 44276
    },
    {
      "epoch": 4.6973265436028,
      "grad_norm": 0.6032264319371179,
      "learning_rate": 3.340216309826379e-05,
      "loss": 1.4011,
      "num_input_tokens_seen": 34835643904,
      "step": 44277
    },
    {
      "epoch": 4.697432633142372,
      "grad_norm": 0.4773896505401045,
      "learning_rate": 3.340150855175861e-05,
      "loss": 1.2731,
      "num_input_tokens_seen": 34836430576,
      "step": 44278
    },
    {
      "epoch": 4.697538722681943,
      "grad_norm": 0.530880336633304,
      "learning_rate": 3.3400853998760975e-05,
      "loss": 1.2486,
      "num_input_tokens_seen": 34837217360,
      "step": 44279
    },
    {
      "epoch": 4.697644812221515,
      "grad_norm": 0.5569688826085538,
      "learning_rate": 3.3400199439271405e-05,
      "loss": 1.4464,
      "num_input_tokens_seen": 34838004128,
      "step": 44280
    },
    {
      "epoch": 4.697750901761086,
      "grad_norm": 0.5797936181252111,
      "learning_rate": 3.3399544873290424e-05,
      "loss": 1.2814,
      "num_input_tokens_seen": 34838790880,
      "step": 44281
    },
    {
      "epoch": 4.697856991300657,
      "grad_norm": 0.55339431522131,
      "learning_rate": 3.339889030081851e-05,
      "loss": 1.3457,
      "num_input_tokens_seen": 34839577648,
      "step": 44282
    },
    {
      "epoch": 4.697963080840229,
      "grad_norm": 0.6296225048330459,
      "learning_rate": 3.339823572185617e-05,
      "loss": 1.2896,
      "num_input_tokens_seen": 34840364480,
      "step": 44283
    },
    {
      "epoch": 4.6980691703798,
      "grad_norm": 0.5249544664007517,
      "learning_rate": 3.339758113640393e-05,
      "loss": 1.3003,
      "num_input_tokens_seen": 34841151232,
      "step": 44284
    },
    {
      "epoch": 4.698175259919372,
      "grad_norm": 0.5462772606358962,
      "learning_rate": 3.3396926544462285e-05,
      "loss": 1.2614,
      "num_input_tokens_seen": 34841937984,
      "step": 44285
    },
    {
      "epoch": 4.698281349458943,
      "grad_norm": 0.48935106068138035,
      "learning_rate": 3.339627194603175e-05,
      "loss": 1.2771,
      "num_input_tokens_seen": 34842724704,
      "step": 44286
    },
    {
      "epoch": 4.698387438998514,
      "grad_norm": 0.5260713988816785,
      "learning_rate": 3.3395617341112815e-05,
      "loss": 1.3639,
      "num_input_tokens_seen": 34843511456,
      "step": 44287
    },
    {
      "epoch": 4.698493528538086,
      "grad_norm": 0.5513910657148503,
      "learning_rate": 3.339496272970599e-05,
      "loss": 1.3138,
      "num_input_tokens_seen": 34844298288,
      "step": 44288
    },
    {
      "epoch": 4.698599618077657,
      "grad_norm": 0.46641843807926436,
      "learning_rate": 3.3394308111811786e-05,
      "loss": 1.2764,
      "num_input_tokens_seen": 34845085136,
      "step": 44289
    },
    {
      "epoch": 4.698705707617229,
      "grad_norm": 0.4649629605081763,
      "learning_rate": 3.339365348743071e-05,
      "loss": 1.2396,
      "num_input_tokens_seen": 34845872000,
      "step": 44290
    },
    {
      "epoch": 4.6988117971568,
      "grad_norm": 0.5406897577010306,
      "learning_rate": 3.3392998856563265e-05,
      "loss": 1.2583,
      "num_input_tokens_seen": 34846658816,
      "step": 44291
    },
    {
      "epoch": 4.698917886696372,
      "grad_norm": 0.48074460320676293,
      "learning_rate": 3.3392344219209954e-05,
      "loss": 1.2305,
      "num_input_tokens_seen": 34847445616,
      "step": 44292
    },
    {
      "epoch": 4.699023976235943,
      "grad_norm": 0.45539437009292205,
      "learning_rate": 3.339168957537129e-05,
      "loss": 1.2985,
      "num_input_tokens_seen": 34848232416,
      "step": 44293
    },
    {
      "epoch": 4.699130065775514,
      "grad_norm": 0.4901780765830529,
      "learning_rate": 3.3391034925047764e-05,
      "loss": 1.2324,
      "num_input_tokens_seen": 34849019216,
      "step": 44294
    },
    {
      "epoch": 4.699236155315086,
      "grad_norm": 0.49007299975350277,
      "learning_rate": 3.33903802682399e-05,
      "loss": 1.2426,
      "num_input_tokens_seen": 34849805952,
      "step": 44295
    },
    {
      "epoch": 4.699342244854657,
      "grad_norm": 0.4345247897217839,
      "learning_rate": 3.33897256049482e-05,
      "loss": 1.2213,
      "num_input_tokens_seen": 34850592864,
      "step": 44296
    },
    {
      "epoch": 4.699448334394229,
      "grad_norm": 0.576849479726465,
      "learning_rate": 3.3389070935173156e-05,
      "loss": 1.3532,
      "num_input_tokens_seen": 34851379568,
      "step": 44297
    },
    {
      "epoch": 4.6995544239338,
      "grad_norm": 0.5111501677419145,
      "learning_rate": 3.3388416258915296e-05,
      "loss": 1.3323,
      "num_input_tokens_seen": 34852166288,
      "step": 44298
    },
    {
      "epoch": 4.699660513473372,
      "grad_norm": 0.4486072338608712,
      "learning_rate": 3.33877615761751e-05,
      "loss": 1.2551,
      "num_input_tokens_seen": 34852953120,
      "step": 44299
    },
    {
      "epoch": 4.699766603012943,
      "grad_norm": 0.523714319908037,
      "learning_rate": 3.33871068869531e-05,
      "loss": 1.3157,
      "num_input_tokens_seen": 34853739888,
      "step": 44300
    },
    {
      "epoch": 4.699872692552514,
      "grad_norm": 0.6011789519746821,
      "learning_rate": 3.3386452191249785e-05,
      "loss": 1.2623,
      "num_input_tokens_seen": 34854526640,
      "step": 44301
    },
    {
      "epoch": 4.699978782092086,
      "grad_norm": 0.5105733381774188,
      "learning_rate": 3.338579748906566e-05,
      "loss": 1.3468,
      "num_input_tokens_seen": 34855313488,
      "step": 44302
    },
    {
      "epoch": 4.700084871631657,
      "grad_norm": 0.5467128775861045,
      "learning_rate": 3.338514278040125e-05,
      "loss": 1.307,
      "num_input_tokens_seen": 34856100192,
      "step": 44303
    },
    {
      "epoch": 4.700190961171229,
      "grad_norm": 0.5420245391621202,
      "learning_rate": 3.3384488065257044e-05,
      "loss": 1.2096,
      "num_input_tokens_seen": 34856886944,
      "step": 44304
    },
    {
      "epoch": 4.7002970507108,
      "grad_norm": 0.5332430328291368,
      "learning_rate": 3.338383334363355e-05,
      "loss": 1.2909,
      "num_input_tokens_seen": 34857673648,
      "step": 44305
    },
    {
      "epoch": 4.700403140250371,
      "grad_norm": 0.5360590320669386,
      "learning_rate": 3.3383178615531276e-05,
      "loss": 1.381,
      "num_input_tokens_seen": 34858460416,
      "step": 44306
    },
    {
      "epoch": 4.700509229789943,
      "grad_norm": 0.6180210681596701,
      "learning_rate": 3.3382523880950725e-05,
      "loss": 1.2702,
      "num_input_tokens_seen": 34859247312,
      "step": 44307
    },
    {
      "epoch": 4.700615319329514,
      "grad_norm": 0.5653457809266332,
      "learning_rate": 3.33818691398924e-05,
      "loss": 1.3537,
      "num_input_tokens_seen": 34860034176,
      "step": 44308
    },
    {
      "epoch": 4.700721408869086,
      "grad_norm": 0.5504889738463075,
      "learning_rate": 3.338121439235682e-05,
      "loss": 1.2818,
      "num_input_tokens_seen": 34860820928,
      "step": 44309
    },
    {
      "epoch": 4.700827498408657,
      "grad_norm": 0.4660866741134429,
      "learning_rate": 3.338055963834449e-05,
      "loss": 1.3186,
      "num_input_tokens_seen": 34861607632,
      "step": 44310
    },
    {
      "epoch": 4.700933587948228,
      "grad_norm": 0.4658625151522573,
      "learning_rate": 3.337990487785589e-05,
      "loss": 1.2606,
      "num_input_tokens_seen": 34862394432,
      "step": 44311
    },
    {
      "epoch": 4.7010396774878,
      "grad_norm": 0.6852845094091288,
      "learning_rate": 3.337925011089156e-05,
      "loss": 1.4455,
      "num_input_tokens_seen": 34863181184,
      "step": 44312
    },
    {
      "epoch": 4.701145767027371,
      "grad_norm": 0.5519037296870134,
      "learning_rate": 3.337859533745199e-05,
      "loss": 1.4035,
      "num_input_tokens_seen": 34863967904,
      "step": 44313
    },
    {
      "epoch": 4.701251856566943,
      "grad_norm": 0.5542339382991059,
      "learning_rate": 3.337794055753768e-05,
      "loss": 1.3311,
      "num_input_tokens_seen": 34864754688,
      "step": 44314
    },
    {
      "epoch": 4.701357946106514,
      "grad_norm": 0.575752642526492,
      "learning_rate": 3.337728577114915e-05,
      "loss": 1.2889,
      "num_input_tokens_seen": 34865541488,
      "step": 44315
    },
    {
      "epoch": 4.701464035646085,
      "grad_norm": 0.5989766212599021,
      "learning_rate": 3.3376630978286906e-05,
      "loss": 1.3495,
      "num_input_tokens_seen": 34866328256,
      "step": 44316
    },
    {
      "epoch": 4.701570125185657,
      "grad_norm": 0.5463072329743264,
      "learning_rate": 3.337597617895143e-05,
      "loss": 1.3184,
      "num_input_tokens_seen": 34867115008,
      "step": 44317
    },
    {
      "epoch": 4.701676214725228,
      "grad_norm": 0.5576993782336992,
      "learning_rate": 3.337532137314326e-05,
      "loss": 1.3727,
      "num_input_tokens_seen": 34867901776,
      "step": 44318
    },
    {
      "epoch": 4.7017823042648,
      "grad_norm": 0.5238840208073345,
      "learning_rate": 3.3374666560862884e-05,
      "loss": 1.2797,
      "num_input_tokens_seen": 34868688592,
      "step": 44319
    },
    {
      "epoch": 4.701888393804371,
      "grad_norm": 0.6091651053000999,
      "learning_rate": 3.3374011742110806e-05,
      "loss": 1.4024,
      "num_input_tokens_seen": 34869475392,
      "step": 44320
    },
    {
      "epoch": 4.701994483343943,
      "grad_norm": 0.6039824371300209,
      "learning_rate": 3.3373356916887545e-05,
      "loss": 1.3356,
      "num_input_tokens_seen": 34870262176,
      "step": 44321
    },
    {
      "epoch": 4.702100572883514,
      "grad_norm": 0.7097923238905309,
      "learning_rate": 3.33727020851936e-05,
      "loss": 1.3877,
      "num_input_tokens_seen": 34871048960,
      "step": 44322
    },
    {
      "epoch": 4.702206662423085,
      "grad_norm": 0.6266599257689962,
      "learning_rate": 3.337204724702946e-05,
      "loss": 1.2306,
      "num_input_tokens_seen": 34871835696,
      "step": 44323
    },
    {
      "epoch": 4.702312751962657,
      "grad_norm": 0.4846136745397445,
      "learning_rate": 3.337139240239567e-05,
      "loss": 1.1758,
      "num_input_tokens_seen": 34872622480,
      "step": 44324
    },
    {
      "epoch": 4.702418841502228,
      "grad_norm": 0.6726724450995776,
      "learning_rate": 3.3370737551292705e-05,
      "loss": 1.302,
      "num_input_tokens_seen": 34873409280,
      "step": 44325
    },
    {
      "epoch": 4.7025249310418,
      "grad_norm": 0.5824022022373735,
      "learning_rate": 3.337008269372107e-05,
      "loss": 1.3246,
      "num_input_tokens_seen": 34874196016,
      "step": 44326
    },
    {
      "epoch": 4.702631020581371,
      "grad_norm": 0.5412291169091531,
      "learning_rate": 3.3369427829681294e-05,
      "loss": 1.1938,
      "num_input_tokens_seen": 34874982720,
      "step": 44327
    },
    {
      "epoch": 4.7027371101209425,
      "grad_norm": 0.6195928164237927,
      "learning_rate": 3.336877295917386e-05,
      "loss": 1.3583,
      "num_input_tokens_seen": 34875769424,
      "step": 44328
    },
    {
      "epoch": 4.702843199660514,
      "grad_norm": 0.5336925450976797,
      "learning_rate": 3.336811808219929e-05,
      "loss": 1.3625,
      "num_input_tokens_seen": 34876556160,
      "step": 44329
    },
    {
      "epoch": 4.702949289200085,
      "grad_norm": 0.5269596980712973,
      "learning_rate": 3.3367463198758084e-05,
      "loss": 1.2784,
      "num_input_tokens_seen": 34877342896,
      "step": 44330
    },
    {
      "epoch": 4.7030553787396565,
      "grad_norm": 0.5481505122907946,
      "learning_rate": 3.3366808308850746e-05,
      "loss": 1.2413,
      "num_input_tokens_seen": 34878129648,
      "step": 44331
    },
    {
      "epoch": 4.7031614682792275,
      "grad_norm": 0.5496475993536142,
      "learning_rate": 3.336615341247779e-05,
      "loss": 1.248,
      "num_input_tokens_seen": 34878916448,
      "step": 44332
    },
    {
      "epoch": 4.7032675578187995,
      "grad_norm": 0.4811537789553728,
      "learning_rate": 3.3365498509639706e-05,
      "loss": 1.3164,
      "num_input_tokens_seen": 34879703296,
      "step": 44333
    },
    {
      "epoch": 4.7033736473583705,
      "grad_norm": 0.511543705878546,
      "learning_rate": 3.3364843600337014e-05,
      "loss": 1.3145,
      "num_input_tokens_seen": 34880489952,
      "step": 44334
    },
    {
      "epoch": 4.7034797368979415,
      "grad_norm": 0.6033440044480257,
      "learning_rate": 3.336418868457022e-05,
      "loss": 1.3486,
      "num_input_tokens_seen": 34881276752,
      "step": 44335
    },
    {
      "epoch": 4.703585826437513,
      "grad_norm": 0.6146781422220366,
      "learning_rate": 3.336353376233982e-05,
      "loss": 1.3539,
      "num_input_tokens_seen": 34882063552,
      "step": 44336
    },
    {
      "epoch": 4.7036919159770845,
      "grad_norm": 0.5125416179358407,
      "learning_rate": 3.336287883364633e-05,
      "loss": 1.2445,
      "num_input_tokens_seen": 34882850336,
      "step": 44337
    },
    {
      "epoch": 4.703798005516656,
      "grad_norm": 0.5473068035265607,
      "learning_rate": 3.336222389849025e-05,
      "loss": 1.2868,
      "num_input_tokens_seen": 34883637120,
      "step": 44338
    },
    {
      "epoch": 4.703904095056227,
      "grad_norm": 0.5105370219135271,
      "learning_rate": 3.3361568956872095e-05,
      "loss": 1.3387,
      "num_input_tokens_seen": 34884423888,
      "step": 44339
    },
    {
      "epoch": 4.7040101845957984,
      "grad_norm": 0.5725196446806504,
      "learning_rate": 3.336091400879236e-05,
      "loss": 1.3717,
      "num_input_tokens_seen": 34885210720,
      "step": 44340
    },
    {
      "epoch": 4.70411627413537,
      "grad_norm": 0.623919796501606,
      "learning_rate": 3.336025905425156e-05,
      "loss": 1.2581,
      "num_input_tokens_seen": 34885997392,
      "step": 44341
    },
    {
      "epoch": 4.704222363674941,
      "grad_norm": 0.5935619423209216,
      "learning_rate": 3.335960409325019e-05,
      "loss": 1.3091,
      "num_input_tokens_seen": 34886784192,
      "step": 44342
    },
    {
      "epoch": 4.704328453214513,
      "grad_norm": 0.5182065566666904,
      "learning_rate": 3.335894912578877e-05,
      "loss": 1.2827,
      "num_input_tokens_seen": 34887570944,
      "step": 44343
    },
    {
      "epoch": 4.704434542754084,
      "grad_norm": 0.5623758953481112,
      "learning_rate": 3.3358294151867795e-05,
      "loss": 1.2982,
      "num_input_tokens_seen": 34888357760,
      "step": 44344
    },
    {
      "epoch": 4.704540632293655,
      "grad_norm": 0.5488642290833978,
      "learning_rate": 3.335763917148778e-05,
      "loss": 1.3761,
      "num_input_tokens_seen": 34889144512,
      "step": 44345
    },
    {
      "epoch": 4.704646721833227,
      "grad_norm": 0.49941732421633545,
      "learning_rate": 3.335698418464922e-05,
      "loss": 1.2739,
      "num_input_tokens_seen": 34889931264,
      "step": 44346
    },
    {
      "epoch": 4.704752811372798,
      "grad_norm": 0.5252686024806834,
      "learning_rate": 3.3356329191352634e-05,
      "loss": 1.426,
      "num_input_tokens_seen": 34890718032,
      "step": 44347
    },
    {
      "epoch": 4.70485890091237,
      "grad_norm": 0.5438486274916485,
      "learning_rate": 3.335567419159852e-05,
      "loss": 1.3623,
      "num_input_tokens_seen": 34891504880,
      "step": 44348
    },
    {
      "epoch": 4.704964990451941,
      "grad_norm": 0.4968903065583388,
      "learning_rate": 3.3355019185387384e-05,
      "loss": 1.2296,
      "num_input_tokens_seen": 34892291680,
      "step": 44349
    },
    {
      "epoch": 4.705071079991513,
      "grad_norm": 0.6211764899730468,
      "learning_rate": 3.3354364172719744e-05,
      "loss": 1.3723,
      "num_input_tokens_seen": 34893078400,
      "step": 44350
    },
    {
      "epoch": 4.705177169531084,
      "grad_norm": 0.5232418702405462,
      "learning_rate": 3.335370915359608e-05,
      "loss": 1.3181,
      "num_input_tokens_seen": 34893865200,
      "step": 44351
    },
    {
      "epoch": 4.705283259070655,
      "grad_norm": 0.5546206400621527,
      "learning_rate": 3.3353054128016926e-05,
      "loss": 1.4251,
      "num_input_tokens_seen": 34894651920,
      "step": 44352
    },
    {
      "epoch": 4.705389348610227,
      "grad_norm": 0.7555003549333716,
      "learning_rate": 3.335239909598278e-05,
      "loss": 1.3515,
      "num_input_tokens_seen": 34895438720,
      "step": 44353
    },
    {
      "epoch": 4.705495438149798,
      "grad_norm": 0.4853956365730911,
      "learning_rate": 3.335174405749413e-05,
      "loss": 1.3062,
      "num_input_tokens_seen": 34896225504,
      "step": 44354
    },
    {
      "epoch": 4.70560152768937,
      "grad_norm": 0.6673568417859631,
      "learning_rate": 3.3351089012551514e-05,
      "loss": 1.2329,
      "num_input_tokens_seen": 34897012336,
      "step": 44355
    },
    {
      "epoch": 4.705707617228941,
      "grad_norm": 0.5050891308670372,
      "learning_rate": 3.335043396115541e-05,
      "loss": 1.2788,
      "num_input_tokens_seen": 34897799200,
      "step": 44356
    },
    {
      "epoch": 4.705813706768513,
      "grad_norm": 0.49837568389623826,
      "learning_rate": 3.334977890330634e-05,
      "loss": 1.2786,
      "num_input_tokens_seen": 34898585952,
      "step": 44357
    },
    {
      "epoch": 4.705919796308084,
      "grad_norm": 0.5151232673261325,
      "learning_rate": 3.334912383900481e-05,
      "loss": 1.2038,
      "num_input_tokens_seen": 34899372784,
      "step": 44358
    },
    {
      "epoch": 4.706025885847655,
      "grad_norm": 0.5084581377074358,
      "learning_rate": 3.3348468768251314e-05,
      "loss": 1.3211,
      "num_input_tokens_seen": 34900159456,
      "step": 44359
    },
    {
      "epoch": 4.706131975387227,
      "grad_norm": 0.4831411893665197,
      "learning_rate": 3.334781369104636e-05,
      "loss": 1.2639,
      "num_input_tokens_seen": 34900946208,
      "step": 44360
    },
    {
      "epoch": 4.706238064926798,
      "grad_norm": 0.5967543140916045,
      "learning_rate": 3.334715860739048e-05,
      "loss": 1.3369,
      "num_input_tokens_seen": 34901732912,
      "step": 44361
    },
    {
      "epoch": 4.70634415446637,
      "grad_norm": 0.5689782567699857,
      "learning_rate": 3.334650351728415e-05,
      "loss": 1.402,
      "num_input_tokens_seen": 34902519680,
      "step": 44362
    },
    {
      "epoch": 4.706450244005941,
      "grad_norm": 0.49285691166181933,
      "learning_rate": 3.3345848420727885e-05,
      "loss": 1.3514,
      "num_input_tokens_seen": 34903306400,
      "step": 44363
    },
    {
      "epoch": 4.706556333545512,
      "grad_norm": 0.4592101497175389,
      "learning_rate": 3.33451933177222e-05,
      "loss": 1.2633,
      "num_input_tokens_seen": 34904093200,
      "step": 44364
    },
    {
      "epoch": 4.706662423085084,
      "grad_norm": 0.5865272750335444,
      "learning_rate": 3.334453820826759e-05,
      "loss": 1.3683,
      "num_input_tokens_seen": 34904880032,
      "step": 44365
    },
    {
      "epoch": 4.706768512624655,
      "grad_norm": 0.5205145795633778,
      "learning_rate": 3.334388309236456e-05,
      "loss": 1.3432,
      "num_input_tokens_seen": 34905666848,
      "step": 44366
    },
    {
      "epoch": 4.706874602164227,
      "grad_norm": 0.6346100822130936,
      "learning_rate": 3.334322797001364e-05,
      "loss": 1.3803,
      "num_input_tokens_seen": 34906453568,
      "step": 44367
    },
    {
      "epoch": 4.706980691703798,
      "grad_norm": 0.5155299373518949,
      "learning_rate": 3.33425728412153e-05,
      "loss": 1.308,
      "num_input_tokens_seen": 34907240432,
      "step": 44368
    },
    {
      "epoch": 4.707086781243369,
      "grad_norm": 0.46316277082314194,
      "learning_rate": 3.334191770597007e-05,
      "loss": 1.2875,
      "num_input_tokens_seen": 34908027232,
      "step": 44369
    },
    {
      "epoch": 4.707192870782941,
      "grad_norm": 0.5878025751958823,
      "learning_rate": 3.334126256427845e-05,
      "loss": 1.3159,
      "num_input_tokens_seen": 34908814096,
      "step": 44370
    },
    {
      "epoch": 4.707298960322512,
      "grad_norm": 0.5997880845219841,
      "learning_rate": 3.3340607416140954e-05,
      "loss": 1.3568,
      "num_input_tokens_seen": 34909600880,
      "step": 44371
    },
    {
      "epoch": 4.707405049862084,
      "grad_norm": 0.5182810648225308,
      "learning_rate": 3.333995226155808e-05,
      "loss": 1.2557,
      "num_input_tokens_seen": 34910387584,
      "step": 44372
    },
    {
      "epoch": 4.707511139401655,
      "grad_norm": 0.5298051966448959,
      "learning_rate": 3.333929710053033e-05,
      "loss": 1.2044,
      "num_input_tokens_seen": 34911174384,
      "step": 44373
    },
    {
      "epoch": 4.707617228941226,
      "grad_norm": 0.8978913532646774,
      "learning_rate": 3.3338641933058215e-05,
      "loss": 1.3187,
      "num_input_tokens_seen": 34911961104,
      "step": 44374
    },
    {
      "epoch": 4.707723318480798,
      "grad_norm": 0.533443025207397,
      "learning_rate": 3.333798675914225e-05,
      "loss": 1.3597,
      "num_input_tokens_seen": 34912747808,
      "step": 44375
    },
    {
      "epoch": 4.707829408020369,
      "grad_norm": 0.7893570046678755,
      "learning_rate": 3.333733157878293e-05,
      "loss": 1.2482,
      "num_input_tokens_seen": 34913534624,
      "step": 44376
    },
    {
      "epoch": 4.707935497559941,
      "grad_norm": 0.4953904661662931,
      "learning_rate": 3.3336676391980756e-05,
      "loss": 1.3007,
      "num_input_tokens_seen": 34914321408,
      "step": 44377
    },
    {
      "epoch": 4.708041587099512,
      "grad_norm": 0.5049642857168856,
      "learning_rate": 3.3336021198736255e-05,
      "loss": 1.2321,
      "num_input_tokens_seen": 34915108208,
      "step": 44378
    },
    {
      "epoch": 4.708147676639084,
      "grad_norm": 0.67986954678398,
      "learning_rate": 3.333536599904992e-05,
      "loss": 1.2981,
      "num_input_tokens_seen": 34915894928,
      "step": 44379
    },
    {
      "epoch": 4.708253766178655,
      "grad_norm": 0.5180692938905176,
      "learning_rate": 3.333471079292225e-05,
      "loss": 1.3326,
      "num_input_tokens_seen": 34916681760,
      "step": 44380
    },
    {
      "epoch": 4.708359855718226,
      "grad_norm": 0.6677109692364455,
      "learning_rate": 3.3334055580353765e-05,
      "loss": 1.2999,
      "num_input_tokens_seen": 34917468576,
      "step": 44381
    },
    {
      "epoch": 4.708465945257798,
      "grad_norm": 0.4597349383936196,
      "learning_rate": 3.333340036134497e-05,
      "loss": 1.1804,
      "num_input_tokens_seen": 34918255360,
      "step": 44382
    },
    {
      "epoch": 4.708572034797369,
      "grad_norm": 0.5987138996827808,
      "learning_rate": 3.333274513589636e-05,
      "loss": 1.2,
      "num_input_tokens_seen": 34919042176,
      "step": 44383
    },
    {
      "epoch": 4.708678124336941,
      "grad_norm": 0.5239108087526253,
      "learning_rate": 3.333208990400846e-05,
      "loss": 1.2294,
      "num_input_tokens_seen": 34919829104,
      "step": 44384
    },
    {
      "epoch": 4.708784213876512,
      "grad_norm": 0.5046061503464704,
      "learning_rate": 3.333143466568176e-05,
      "loss": 1.3668,
      "num_input_tokens_seen": 34920615872,
      "step": 44385
    },
    {
      "epoch": 4.708890303416084,
      "grad_norm": 0.5039996574275463,
      "learning_rate": 3.333077942091677e-05,
      "loss": 1.2748,
      "num_input_tokens_seen": 34921402656,
      "step": 44386
    },
    {
      "epoch": 4.708996392955655,
      "grad_norm": 0.5585307703340491,
      "learning_rate": 3.3330124169713995e-05,
      "loss": 1.2768,
      "num_input_tokens_seen": 34922189296,
      "step": 44387
    },
    {
      "epoch": 4.709102482495226,
      "grad_norm": 0.5816805598785411,
      "learning_rate": 3.332946891207395e-05,
      "loss": 1.395,
      "num_input_tokens_seen": 34922975968,
      "step": 44388
    },
    {
      "epoch": 4.709208572034798,
      "grad_norm": 0.5523219239856441,
      "learning_rate": 3.332881364799714e-05,
      "loss": 1.2885,
      "num_input_tokens_seen": 34923762704,
      "step": 44389
    },
    {
      "epoch": 4.709314661574369,
      "grad_norm": 0.7380511796045767,
      "learning_rate": 3.332815837748406e-05,
      "loss": 1.3428,
      "num_input_tokens_seen": 34924549520,
      "step": 44390
    },
    {
      "epoch": 4.7094207511139405,
      "grad_norm": 0.49575980904448375,
      "learning_rate": 3.332750310053522e-05,
      "loss": 1.2866,
      "num_input_tokens_seen": 34925336256,
      "step": 44391
    },
    {
      "epoch": 4.709526840653512,
      "grad_norm": 0.8892386551618952,
      "learning_rate": 3.332684781715114e-05,
      "loss": 1.2519,
      "num_input_tokens_seen": 34926123072,
      "step": 44392
    },
    {
      "epoch": 4.709632930193083,
      "grad_norm": 0.5994443822047671,
      "learning_rate": 3.332619252733231e-05,
      "loss": 1.3609,
      "num_input_tokens_seen": 34926909824,
      "step": 44393
    },
    {
      "epoch": 4.7097390197326545,
      "grad_norm": 0.550510657650968,
      "learning_rate": 3.332553723107924e-05,
      "loss": 1.2605,
      "num_input_tokens_seen": 34927696496,
      "step": 44394
    },
    {
      "epoch": 4.7098451092722255,
      "grad_norm": 1.0124049359756664,
      "learning_rate": 3.3324881928392445e-05,
      "loss": 1.3092,
      "num_input_tokens_seen": 34928483216,
      "step": 44395
    },
    {
      "epoch": 4.7099511988117975,
      "grad_norm": 0.5439024600336427,
      "learning_rate": 3.332422661927243e-05,
      "loss": 1.2456,
      "num_input_tokens_seen": 34929270048,
      "step": 44396
    },
    {
      "epoch": 4.7100572883513685,
      "grad_norm": 0.5112241084696549,
      "learning_rate": 3.3323571303719684e-05,
      "loss": 1.195,
      "num_input_tokens_seen": 34930056848,
      "step": 44397
    },
    {
      "epoch": 4.7101633778909395,
      "grad_norm": 0.7231556941619395,
      "learning_rate": 3.332291598173474e-05,
      "loss": 1.2777,
      "num_input_tokens_seen": 34930843648,
      "step": 44398
    },
    {
      "epoch": 4.7102694674305114,
      "grad_norm": 0.5732002172861237,
      "learning_rate": 3.332226065331808e-05,
      "loss": 1.2018,
      "num_input_tokens_seen": 34931630352,
      "step": 44399
    },
    {
      "epoch": 4.7103755569700825,
      "grad_norm": 0.6654201262545396,
      "learning_rate": 3.332160531847022e-05,
      "loss": 1.2831,
      "num_input_tokens_seen": 34932417120,
      "step": 44400
    },
    {
      "epoch": 4.710481646509654,
      "grad_norm": 0.6805488415187794,
      "learning_rate": 3.332094997719167e-05,
      "loss": 1.203,
      "num_input_tokens_seen": 34933203888,
      "step": 44401
    },
    {
      "epoch": 4.710587736049225,
      "grad_norm": 0.7784364667296731,
      "learning_rate": 3.332029462948294e-05,
      "loss": 1.4016,
      "num_input_tokens_seen": 34933990608,
      "step": 44402
    },
    {
      "epoch": 4.7106938255887965,
      "grad_norm": 0.7793291636353795,
      "learning_rate": 3.3319639275344524e-05,
      "loss": 1.3161,
      "num_input_tokens_seen": 34934777376,
      "step": 44403
    },
    {
      "epoch": 4.710799915128368,
      "grad_norm": 0.8936234437072604,
      "learning_rate": 3.3318983914776946e-05,
      "loss": 1.3902,
      "num_input_tokens_seen": 34935564128,
      "step": 44404
    },
    {
      "epoch": 4.710906004667939,
      "grad_norm": 0.546958089474028,
      "learning_rate": 3.3318328547780685e-05,
      "loss": 1.357,
      "num_input_tokens_seen": 34936350800,
      "step": 44405
    },
    {
      "epoch": 4.711012094207511,
      "grad_norm": 0.7164222656126581,
      "learning_rate": 3.331767317435628e-05,
      "loss": 1.31,
      "num_input_tokens_seen": 34937137536,
      "step": 44406
    },
    {
      "epoch": 4.711118183747082,
      "grad_norm": 0.7601659500215613,
      "learning_rate": 3.3317017794504205e-05,
      "loss": 1.3083,
      "num_input_tokens_seen": 34937924272,
      "step": 44407
    },
    {
      "epoch": 4.711224273286654,
      "grad_norm": 0.5648858117621839,
      "learning_rate": 3.3316362408224996e-05,
      "loss": 1.319,
      "num_input_tokens_seen": 34938711040,
      "step": 44408
    },
    {
      "epoch": 4.711330362826225,
      "grad_norm": 1.057598564079791,
      "learning_rate": 3.331570701551914e-05,
      "loss": 1.3943,
      "num_input_tokens_seen": 34939497872,
      "step": 44409
    },
    {
      "epoch": 4.711436452365797,
      "grad_norm": 0.7188775105829966,
      "learning_rate": 3.331505161638715e-05,
      "loss": 1.3835,
      "num_input_tokens_seen": 34940284672,
      "step": 44410
    },
    {
      "epoch": 4.711542541905368,
      "grad_norm": 0.7184749741510555,
      "learning_rate": 3.331439621082953e-05,
      "loss": 1.325,
      "num_input_tokens_seen": 34941071552,
      "step": 44411
    },
    {
      "epoch": 4.711648631444939,
      "grad_norm": 0.7526512181839725,
      "learning_rate": 3.331374079884679e-05,
      "loss": 1.2541,
      "num_input_tokens_seen": 34941858320,
      "step": 44412
    },
    {
      "epoch": 4.711754720984511,
      "grad_norm": 0.5183252875304043,
      "learning_rate": 3.331308538043944e-05,
      "loss": 1.2901,
      "num_input_tokens_seen": 34942645104,
      "step": 44413
    },
    {
      "epoch": 4.711860810524082,
      "grad_norm": 0.5939429501524177,
      "learning_rate": 3.331242995560797e-05,
      "loss": 1.3324,
      "num_input_tokens_seen": 34943431872,
      "step": 44414
    },
    {
      "epoch": 4.711966900063654,
      "grad_norm": 0.6470851549679206,
      "learning_rate": 3.331177452435291e-05,
      "loss": 1.2349,
      "num_input_tokens_seen": 34944218672,
      "step": 44415
    },
    {
      "epoch": 4.712072989603225,
      "grad_norm": 0.5931245420992753,
      "learning_rate": 3.331111908667475e-05,
      "loss": 1.3233,
      "num_input_tokens_seen": 34945005456,
      "step": 44416
    },
    {
      "epoch": 4.712179079142796,
      "grad_norm": 0.5192535546963758,
      "learning_rate": 3.3310463642574004e-05,
      "loss": 1.3222,
      "num_input_tokens_seen": 34945792176,
      "step": 44417
    },
    {
      "epoch": 4.712285168682368,
      "grad_norm": 0.5543941638165834,
      "learning_rate": 3.3309808192051174e-05,
      "loss": 1.3239,
      "num_input_tokens_seen": 34946578960,
      "step": 44418
    },
    {
      "epoch": 4.712391258221939,
      "grad_norm": 0.568239264211197,
      "learning_rate": 3.3309152735106764e-05,
      "loss": 1.3343,
      "num_input_tokens_seen": 34947365760,
      "step": 44419
    },
    {
      "epoch": 4.712497347761511,
      "grad_norm": 0.6694295252084786,
      "learning_rate": 3.330849727174128e-05,
      "loss": 1.4563,
      "num_input_tokens_seen": 34948152512,
      "step": 44420
    },
    {
      "epoch": 4.712603437301082,
      "grad_norm": 0.538723403177886,
      "learning_rate": 3.330784180195525e-05,
      "loss": 1.3255,
      "num_input_tokens_seen": 34948939280,
      "step": 44421
    },
    {
      "epoch": 4.712709526840653,
      "grad_norm": 0.7578768163211664,
      "learning_rate": 3.330718632574916e-05,
      "loss": 1.3061,
      "num_input_tokens_seen": 34949726064,
      "step": 44422
    },
    {
      "epoch": 4.712815616380225,
      "grad_norm": 0.5282972127190769,
      "learning_rate": 3.330653084312351e-05,
      "loss": 1.2808,
      "num_input_tokens_seen": 34950512832,
      "step": 44423
    },
    {
      "epoch": 4.712921705919796,
      "grad_norm": 0.49217114927468625,
      "learning_rate": 3.330587535407882e-05,
      "loss": 1.2183,
      "num_input_tokens_seen": 34951299584,
      "step": 44424
    },
    {
      "epoch": 4.713027795459368,
      "grad_norm": 0.6863660016886455,
      "learning_rate": 3.3305219858615594e-05,
      "loss": 1.4487,
      "num_input_tokens_seen": 34952086416,
      "step": 44425
    },
    {
      "epoch": 4.713133884998939,
      "grad_norm": 0.4904828090883444,
      "learning_rate": 3.330456435673434e-05,
      "loss": 1.2497,
      "num_input_tokens_seen": 34952873184,
      "step": 44426
    },
    {
      "epoch": 4.71323997453851,
      "grad_norm": 0.677637161957647,
      "learning_rate": 3.330390884843556e-05,
      "loss": 1.3876,
      "num_input_tokens_seen": 34953659872,
      "step": 44427
    },
    {
      "epoch": 4.713346064078082,
      "grad_norm": 0.69956347144996,
      "learning_rate": 3.330325333371976e-05,
      "loss": 1.335,
      "num_input_tokens_seen": 34954446640,
      "step": 44428
    },
    {
      "epoch": 4.713452153617653,
      "grad_norm": 0.6329703468870159,
      "learning_rate": 3.330259781258745e-05,
      "loss": 1.3179,
      "num_input_tokens_seen": 34955233296,
      "step": 44429
    },
    {
      "epoch": 4.713558243157225,
      "grad_norm": 0.7400282504431593,
      "learning_rate": 3.3301942285039145e-05,
      "loss": 1.3553,
      "num_input_tokens_seen": 34956020048,
      "step": 44430
    },
    {
      "epoch": 4.713664332696796,
      "grad_norm": 0.6861752638111095,
      "learning_rate": 3.330128675107534e-05,
      "loss": 1.3146,
      "num_input_tokens_seen": 34956806800,
      "step": 44431
    },
    {
      "epoch": 4.713770422236367,
      "grad_norm": 0.6871616316876883,
      "learning_rate": 3.3300631210696534e-05,
      "loss": 1.3209,
      "num_input_tokens_seen": 34957593584,
      "step": 44432
    },
    {
      "epoch": 4.713876511775939,
      "grad_norm": 0.6828456185196699,
      "learning_rate": 3.329997566390325e-05,
      "loss": 1.4278,
      "num_input_tokens_seen": 34958380336,
      "step": 44433
    },
    {
      "epoch": 4.71398260131551,
      "grad_norm": 0.632599535304749,
      "learning_rate": 3.329932011069599e-05,
      "loss": 1.4145,
      "num_input_tokens_seen": 34959167024,
      "step": 44434
    },
    {
      "epoch": 4.714088690855082,
      "grad_norm": 0.6884134656694247,
      "learning_rate": 3.329866455107526e-05,
      "loss": 1.2755,
      "num_input_tokens_seen": 34959953856,
      "step": 44435
    },
    {
      "epoch": 4.714194780394653,
      "grad_norm": 0.5809753173973179,
      "learning_rate": 3.3298008985041564e-05,
      "loss": 1.36,
      "num_input_tokens_seen": 34960740608,
      "step": 44436
    },
    {
      "epoch": 4.714300869934225,
      "grad_norm": 0.4853102907154267,
      "learning_rate": 3.329735341259541e-05,
      "loss": 1.2196,
      "num_input_tokens_seen": 34961527424,
      "step": 44437
    },
    {
      "epoch": 4.714406959473796,
      "grad_norm": 0.5601769915528517,
      "learning_rate": 3.32966978337373e-05,
      "loss": 1.3331,
      "num_input_tokens_seen": 34962314192,
      "step": 44438
    },
    {
      "epoch": 4.714513049013368,
      "grad_norm": 0.5855739338588347,
      "learning_rate": 3.329604224846775e-05,
      "loss": 1.4002,
      "num_input_tokens_seen": 34963100960,
      "step": 44439
    },
    {
      "epoch": 4.714619138552939,
      "grad_norm": 0.4832301697027687,
      "learning_rate": 3.329538665678726e-05,
      "loss": 1.3297,
      "num_input_tokens_seen": 34963887696,
      "step": 44440
    },
    {
      "epoch": 4.71472522809251,
      "grad_norm": 0.6850497162612953,
      "learning_rate": 3.3294731058696344e-05,
      "loss": 1.3495,
      "num_input_tokens_seen": 34964674496,
      "step": 44441
    },
    {
      "epoch": 4.714831317632082,
      "grad_norm": 0.6660614882479723,
      "learning_rate": 3.32940754541955e-05,
      "loss": 1.3134,
      "num_input_tokens_seen": 34965461248,
      "step": 44442
    },
    {
      "epoch": 4.714937407171653,
      "grad_norm": 0.9927490708038189,
      "learning_rate": 3.3293419843285234e-05,
      "loss": 1.3067,
      "num_input_tokens_seen": 34966248000,
      "step": 44443
    },
    {
      "epoch": 4.715043496711225,
      "grad_norm": 0.7475245467411937,
      "learning_rate": 3.329276422596606e-05,
      "loss": 1.3285,
      "num_input_tokens_seen": 34967034752,
      "step": 44444
    },
    {
      "epoch": 4.715149586250796,
      "grad_norm": 0.7193822681567499,
      "learning_rate": 3.329210860223848e-05,
      "loss": 1.2527,
      "num_input_tokens_seen": 34967821440,
      "step": 44445
    },
    {
      "epoch": 4.715255675790367,
      "grad_norm": 1.2240337774734034,
      "learning_rate": 3.3291452972103007e-05,
      "loss": 1.3139,
      "num_input_tokens_seen": 34968608160,
      "step": 44446
    },
    {
      "epoch": 4.715361765329939,
      "grad_norm": 0.6512770016372784,
      "learning_rate": 3.3290797335560134e-05,
      "loss": 1.3783,
      "num_input_tokens_seen": 34969394864,
      "step": 44447
    },
    {
      "epoch": 4.71546785486951,
      "grad_norm": 0.7907047356542403,
      "learning_rate": 3.329014169261038e-05,
      "loss": 1.3137,
      "num_input_tokens_seen": 34970181648,
      "step": 44448
    },
    {
      "epoch": 4.715573944409082,
      "grad_norm": 0.5166854648774893,
      "learning_rate": 3.328948604325425e-05,
      "loss": 1.2988,
      "num_input_tokens_seen": 34970968448,
      "step": 44449
    },
    {
      "epoch": 4.715680033948653,
      "grad_norm": 0.6721210705900504,
      "learning_rate": 3.3288830387492245e-05,
      "loss": 1.186,
      "num_input_tokens_seen": 34971755232,
      "step": 44450
    },
    {
      "epoch": 4.715786123488224,
      "grad_norm": 0.5579897634880108,
      "learning_rate": 3.328817472532487e-05,
      "loss": 1.2483,
      "num_input_tokens_seen": 34972541984,
      "step": 44451
    },
    {
      "epoch": 4.715892213027796,
      "grad_norm": 0.5898679671195158,
      "learning_rate": 3.3287519056752645e-05,
      "loss": 1.3295,
      "num_input_tokens_seen": 34973328832,
      "step": 44452
    },
    {
      "epoch": 4.715998302567367,
      "grad_norm": 0.5648141122061946,
      "learning_rate": 3.328686338177607e-05,
      "loss": 1.221,
      "num_input_tokens_seen": 34974115616,
      "step": 44453
    },
    {
      "epoch": 4.7161043921069385,
      "grad_norm": 0.5238772735025096,
      "learning_rate": 3.3286207700395646e-05,
      "loss": 1.2391,
      "num_input_tokens_seen": 34974902320,
      "step": 44454
    },
    {
      "epoch": 4.71621048164651,
      "grad_norm": 0.4784901982906386,
      "learning_rate": 3.328555201261188e-05,
      "loss": 1.3087,
      "num_input_tokens_seen": 34975689056,
      "step": 44455
    },
    {
      "epoch": 4.716316571186081,
      "grad_norm": 0.7074611755186143,
      "learning_rate": 3.328489631842529e-05,
      "loss": 1.2924,
      "num_input_tokens_seen": 34976475808,
      "step": 44456
    },
    {
      "epoch": 4.7164226607256525,
      "grad_norm": 0.6091446287509626,
      "learning_rate": 3.328424061783637e-05,
      "loss": 1.3241,
      "num_input_tokens_seen": 34977262624,
      "step": 44457
    },
    {
      "epoch": 4.716528750265224,
      "grad_norm": 0.5679305899944443,
      "learning_rate": 3.3283584910845635e-05,
      "loss": 1.3524,
      "num_input_tokens_seen": 34978049344,
      "step": 44458
    },
    {
      "epoch": 4.7166348398047955,
      "grad_norm": 0.6697701034364171,
      "learning_rate": 3.328292919745359e-05,
      "loss": 1.2917,
      "num_input_tokens_seen": 34978836112,
      "step": 44459
    },
    {
      "epoch": 4.7167409293443665,
      "grad_norm": 0.5270993504187017,
      "learning_rate": 3.328227347766073e-05,
      "loss": 1.4055,
      "num_input_tokens_seen": 34979622848,
      "step": 44460
    },
    {
      "epoch": 4.716847018883938,
      "grad_norm": 0.5462613506066621,
      "learning_rate": 3.328161775146759e-05,
      "loss": 1.2815,
      "num_input_tokens_seen": 34980409664,
      "step": 44461
    },
    {
      "epoch": 4.7169531084235095,
      "grad_norm": 0.6442081682251996,
      "learning_rate": 3.328096201887464e-05,
      "loss": 1.2467,
      "num_input_tokens_seen": 34981196512,
      "step": 44462
    },
    {
      "epoch": 4.7170591979630805,
      "grad_norm": 0.5326750810013313,
      "learning_rate": 3.328030627988242e-05,
      "loss": 1.3399,
      "num_input_tokens_seen": 34981983280,
      "step": 44463
    },
    {
      "epoch": 4.717165287502652,
      "grad_norm": 0.5292722808246277,
      "learning_rate": 3.327965053449141e-05,
      "loss": 1.3075,
      "num_input_tokens_seen": 34982770112,
      "step": 44464
    },
    {
      "epoch": 4.717271377042223,
      "grad_norm": 0.5308164939900439,
      "learning_rate": 3.3278994782702145e-05,
      "loss": 1.3522,
      "num_input_tokens_seen": 34983556768,
      "step": 44465
    },
    {
      "epoch": 4.717377466581795,
      "grad_norm": 0.62464953153435,
      "learning_rate": 3.32783390245151e-05,
      "loss": 1.2657,
      "num_input_tokens_seen": 34984343584,
      "step": 44466
    },
    {
      "epoch": 4.717483556121366,
      "grad_norm": 0.5265264829939568,
      "learning_rate": 3.3277683259930805e-05,
      "loss": 1.3639,
      "num_input_tokens_seen": 34985130368,
      "step": 44467
    },
    {
      "epoch": 4.717589645660938,
      "grad_norm": 0.5058302704833307,
      "learning_rate": 3.327702748894976e-05,
      "loss": 1.2756,
      "num_input_tokens_seen": 34985917184,
      "step": 44468
    },
    {
      "epoch": 4.717695735200509,
      "grad_norm": 0.5532380455733047,
      "learning_rate": 3.327637171157247e-05,
      "loss": 1.3005,
      "num_input_tokens_seen": 34986704016,
      "step": 44469
    },
    {
      "epoch": 4.71780182474008,
      "grad_norm": 0.5097585256047749,
      "learning_rate": 3.327571592779945e-05,
      "loss": 1.2951,
      "num_input_tokens_seen": 34987490800,
      "step": 44470
    },
    {
      "epoch": 4.717907914279652,
      "grad_norm": 0.4591522931786018,
      "learning_rate": 3.3275060137631185e-05,
      "loss": 1.3322,
      "num_input_tokens_seen": 34988277504,
      "step": 44471
    },
    {
      "epoch": 4.718014003819223,
      "grad_norm": 0.5958951834006533,
      "learning_rate": 3.3274404341068196e-05,
      "loss": 1.3497,
      "num_input_tokens_seen": 34989064224,
      "step": 44472
    },
    {
      "epoch": 4.718120093358795,
      "grad_norm": 0.5386142826744933,
      "learning_rate": 3.3273748538111e-05,
      "loss": 1.2948,
      "num_input_tokens_seen": 34989851008,
      "step": 44473
    },
    {
      "epoch": 4.718226182898366,
      "grad_norm": 0.600047062888352,
      "learning_rate": 3.327309272876009e-05,
      "loss": 1.2972,
      "num_input_tokens_seen": 34990637728,
      "step": 44474
    },
    {
      "epoch": 4.718332272437937,
      "grad_norm": 0.5181904935589644,
      "learning_rate": 3.327243691301598e-05,
      "loss": 1.2229,
      "num_input_tokens_seen": 34991424544,
      "step": 44475
    },
    {
      "epoch": 4.718438361977509,
      "grad_norm": 0.45979390615293786,
      "learning_rate": 3.327178109087917e-05,
      "loss": 1.2196,
      "num_input_tokens_seen": 34992211328,
      "step": 44476
    },
    {
      "epoch": 4.71854445151708,
      "grad_norm": 0.7220031507415867,
      "learning_rate": 3.327112526235017e-05,
      "loss": 1.3038,
      "num_input_tokens_seen": 34992998048,
      "step": 44477
    },
    {
      "epoch": 4.718650541056652,
      "grad_norm": 0.4576206438018384,
      "learning_rate": 3.327046942742949e-05,
      "loss": 1.2378,
      "num_input_tokens_seen": 34993784848,
      "step": 44478
    },
    {
      "epoch": 4.718756630596223,
      "grad_norm": 0.6794557798342522,
      "learning_rate": 3.3269813586117635e-05,
      "loss": 1.3843,
      "num_input_tokens_seen": 34994571632,
      "step": 44479
    },
    {
      "epoch": 4.718862720135794,
      "grad_norm": 0.5686478419372443,
      "learning_rate": 3.32691577384151e-05,
      "loss": 1.3362,
      "num_input_tokens_seen": 34995358320,
      "step": 44480
    },
    {
      "epoch": 4.718968809675366,
      "grad_norm": 0.5433303983605917,
      "learning_rate": 3.326850188432242e-05,
      "loss": 1.3482,
      "num_input_tokens_seen": 34996145040,
      "step": 44481
    },
    {
      "epoch": 4.719074899214937,
      "grad_norm": 0.4972791284264738,
      "learning_rate": 3.3267846023840074e-05,
      "loss": 1.3742,
      "num_input_tokens_seen": 34996931696,
      "step": 44482
    },
    {
      "epoch": 4.719180988754509,
      "grad_norm": 0.5181308966877634,
      "learning_rate": 3.326719015696857e-05,
      "loss": 1.3522,
      "num_input_tokens_seen": 34997718384,
      "step": 44483
    },
    {
      "epoch": 4.71928707829408,
      "grad_norm": 0.5256876264948741,
      "learning_rate": 3.326653428370844e-05,
      "loss": 1.3785,
      "num_input_tokens_seen": 34998505184,
      "step": 44484
    },
    {
      "epoch": 4.719393167833651,
      "grad_norm": 0.4630413587586688,
      "learning_rate": 3.326587840406018e-05,
      "loss": 1.3454,
      "num_input_tokens_seen": 34999291984,
      "step": 44485
    },
    {
      "epoch": 4.719499257373223,
      "grad_norm": 0.5094569780962592,
      "learning_rate": 3.326522251802427e-05,
      "loss": 1.1844,
      "num_input_tokens_seen": 35000078816,
      "step": 44486
    },
    {
      "epoch": 4.719605346912794,
      "grad_norm": 0.582549668605004,
      "learning_rate": 3.326456662560125e-05,
      "loss": 1.4363,
      "num_input_tokens_seen": 35000865632,
      "step": 44487
    },
    {
      "epoch": 4.719711436452366,
      "grad_norm": 0.7001673698256029,
      "learning_rate": 3.326391072679162e-05,
      "loss": 1.3251,
      "num_input_tokens_seen": 35001652416,
      "step": 44488
    },
    {
      "epoch": 4.719817525991937,
      "grad_norm": 0.5023409897408335,
      "learning_rate": 3.3263254821595875e-05,
      "loss": 1.2301,
      "num_input_tokens_seen": 35002439248,
      "step": 44489
    },
    {
      "epoch": 4.719923615531509,
      "grad_norm": 0.6563613572710703,
      "learning_rate": 3.326259891001453e-05,
      "loss": 1.2634,
      "num_input_tokens_seen": 35003226048,
      "step": 44490
    },
    {
      "epoch": 4.72002970507108,
      "grad_norm": 0.556106433550245,
      "learning_rate": 3.326194299204809e-05,
      "loss": 1.3923,
      "num_input_tokens_seen": 35004012784,
      "step": 44491
    },
    {
      "epoch": 4.720135794610651,
      "grad_norm": 0.5002794212159553,
      "learning_rate": 3.3261287067697066e-05,
      "loss": 1.2816,
      "num_input_tokens_seen": 35004799568,
      "step": 44492
    },
    {
      "epoch": 4.720241884150223,
      "grad_norm": 0.670332320358456,
      "learning_rate": 3.3260631136961964e-05,
      "loss": 1.3173,
      "num_input_tokens_seen": 35005586288,
      "step": 44493
    },
    {
      "epoch": 4.720347973689794,
      "grad_norm": 0.542252733826419,
      "learning_rate": 3.325997519984328e-05,
      "loss": 1.2481,
      "num_input_tokens_seen": 35006373040,
      "step": 44494
    },
    {
      "epoch": 4.720454063229366,
      "grad_norm": 0.6015933785355692,
      "learning_rate": 3.325931925634154e-05,
      "loss": 1.4129,
      "num_input_tokens_seen": 35007159856,
      "step": 44495
    },
    {
      "epoch": 4.720560152768937,
      "grad_norm": 0.5334932645547263,
      "learning_rate": 3.325866330645723e-05,
      "loss": 1.3629,
      "num_input_tokens_seen": 35007946576,
      "step": 44496
    },
    {
      "epoch": 4.720666242308509,
      "grad_norm": 0.4855449118050046,
      "learning_rate": 3.3258007350190876e-05,
      "loss": 1.2525,
      "num_input_tokens_seen": 35008733440,
      "step": 44497
    },
    {
      "epoch": 4.72077233184808,
      "grad_norm": 0.4741996756370386,
      "learning_rate": 3.3257351387542975e-05,
      "loss": 1.3182,
      "num_input_tokens_seen": 35009520160,
      "step": 44498
    },
    {
      "epoch": 4.720878421387651,
      "grad_norm": 0.47541302527795026,
      "learning_rate": 3.3256695418514035e-05,
      "loss": 1.3533,
      "num_input_tokens_seen": 35010306864,
      "step": 44499
    },
    {
      "epoch": 4.720984510927223,
      "grad_norm": 0.4682201327842522,
      "learning_rate": 3.325603944310455e-05,
      "loss": 1.3056,
      "num_input_tokens_seen": 35011093680,
      "step": 44500
    },
    {
      "epoch": 4.721090600466794,
      "grad_norm": 0.500116930102737,
      "learning_rate": 3.325538346131506e-05,
      "loss": 1.3424,
      "num_input_tokens_seen": 35011880448,
      "step": 44501
    },
    {
      "epoch": 4.721196690006366,
      "grad_norm": 0.5000540704662795,
      "learning_rate": 3.325472747314604e-05,
      "loss": 1.3706,
      "num_input_tokens_seen": 35012667184,
      "step": 44502
    },
    {
      "epoch": 4.721302779545937,
      "grad_norm": 0.5616151354493634,
      "learning_rate": 3.3254071478598e-05,
      "loss": 1.3672,
      "num_input_tokens_seen": 35013453904,
      "step": 44503
    },
    {
      "epoch": 4.721408869085508,
      "grad_norm": 0.5660099584311457,
      "learning_rate": 3.3253415477671474e-05,
      "loss": 1.4134,
      "num_input_tokens_seen": 35014240656,
      "step": 44504
    },
    {
      "epoch": 4.72151495862508,
      "grad_norm": 0.5501197253063624,
      "learning_rate": 3.3252759470366946e-05,
      "loss": 1.3954,
      "num_input_tokens_seen": 35015027376,
      "step": 44505
    },
    {
      "epoch": 4.721621048164651,
      "grad_norm": 0.4696572506008933,
      "learning_rate": 3.325210345668492e-05,
      "loss": 1.225,
      "num_input_tokens_seen": 35015814240,
      "step": 44506
    },
    {
      "epoch": 4.721727137704223,
      "grad_norm": 0.5845558384261087,
      "learning_rate": 3.325144743662592e-05,
      "loss": 1.4232,
      "num_input_tokens_seen": 35016601008,
      "step": 44507
    },
    {
      "epoch": 4.721833227243794,
      "grad_norm": 0.48033965130527834,
      "learning_rate": 3.325079141019044e-05,
      "loss": 1.3265,
      "num_input_tokens_seen": 35017387776,
      "step": 44508
    },
    {
      "epoch": 4.721939316783365,
      "grad_norm": 0.5919287476943046,
      "learning_rate": 3.3250135377378987e-05,
      "loss": 1.2854,
      "num_input_tokens_seen": 35018174544,
      "step": 44509
    },
    {
      "epoch": 4.722045406322937,
      "grad_norm": 0.48011974838322313,
      "learning_rate": 3.324947933819208e-05,
      "loss": 1.3341,
      "num_input_tokens_seen": 35018961248,
      "step": 44510
    },
    {
      "epoch": 4.722151495862508,
      "grad_norm": 0.5699295436602073,
      "learning_rate": 3.3248823292630214e-05,
      "loss": 1.2922,
      "num_input_tokens_seen": 35019747952,
      "step": 44511
    },
    {
      "epoch": 4.72225758540208,
      "grad_norm": 0.47365585198962057,
      "learning_rate": 3.324816724069389e-05,
      "loss": 1.2826,
      "num_input_tokens_seen": 35020534720,
      "step": 44512
    },
    {
      "epoch": 4.722363674941651,
      "grad_norm": 0.5080561706926697,
      "learning_rate": 3.324751118238364e-05,
      "loss": 1.2669,
      "num_input_tokens_seen": 35021321472,
      "step": 44513
    },
    {
      "epoch": 4.722469764481222,
      "grad_norm": 0.590718802158697,
      "learning_rate": 3.324685511769995e-05,
      "loss": 1.2625,
      "num_input_tokens_seen": 35022108224,
      "step": 44514
    },
    {
      "epoch": 4.722575854020794,
      "grad_norm": 0.5439221035546348,
      "learning_rate": 3.3246199046643324e-05,
      "loss": 1.3272,
      "num_input_tokens_seen": 35022895008,
      "step": 44515
    },
    {
      "epoch": 4.722681943560365,
      "grad_norm": 0.5498556761726386,
      "learning_rate": 3.3245542969214286e-05,
      "loss": 1.2682,
      "num_input_tokens_seen": 35023681840,
      "step": 44516
    },
    {
      "epoch": 4.7227880330999366,
      "grad_norm": 0.5504894824770378,
      "learning_rate": 3.324488688541333e-05,
      "loss": 1.3567,
      "num_input_tokens_seen": 35024468576,
      "step": 44517
    },
    {
      "epoch": 4.722894122639508,
      "grad_norm": 0.5998478134518612,
      "learning_rate": 3.3244230795240967e-05,
      "loss": 1.3208,
      "num_input_tokens_seen": 35025255424,
      "step": 44518
    },
    {
      "epoch": 4.7230002121790795,
      "grad_norm": 0.5712673153198295,
      "learning_rate": 3.324357469869771e-05,
      "loss": 1.3315,
      "num_input_tokens_seen": 35026042112,
      "step": 44519
    },
    {
      "epoch": 4.7231063017186505,
      "grad_norm": 0.5084649840619477,
      "learning_rate": 3.324291859578405e-05,
      "loss": 1.306,
      "num_input_tokens_seen": 35026828880,
      "step": 44520
    },
    {
      "epoch": 4.723212391258222,
      "grad_norm": 0.6037709400358761,
      "learning_rate": 3.324226248650052e-05,
      "loss": 1.2484,
      "num_input_tokens_seen": 35027615696,
      "step": 44521
    },
    {
      "epoch": 4.7233184807977935,
      "grad_norm": 0.48227001852282886,
      "learning_rate": 3.32416063708476e-05,
      "loss": 1.2869,
      "num_input_tokens_seen": 35028402464,
      "step": 44522
    },
    {
      "epoch": 4.7234245703373645,
      "grad_norm": 0.5224708402224967,
      "learning_rate": 3.324095024882581e-05,
      "loss": 1.3228,
      "num_input_tokens_seen": 35029189232,
      "step": 44523
    },
    {
      "epoch": 4.723530659876936,
      "grad_norm": 0.7189083962364458,
      "learning_rate": 3.3240294120435655e-05,
      "loss": 1.4478,
      "num_input_tokens_seen": 35029975904,
      "step": 44524
    },
    {
      "epoch": 4.7236367494165075,
      "grad_norm": 0.4315057010819804,
      "learning_rate": 3.323963798567764e-05,
      "loss": 1.226,
      "num_input_tokens_seen": 35030762656,
      "step": 44525
    },
    {
      "epoch": 4.723742838956079,
      "grad_norm": 0.7005309344019469,
      "learning_rate": 3.323898184455227e-05,
      "loss": 1.331,
      "num_input_tokens_seen": 35031549536,
      "step": 44526
    },
    {
      "epoch": 4.72384892849565,
      "grad_norm": 0.5533817717932422,
      "learning_rate": 3.323832569706008e-05,
      "loss": 1.339,
      "num_input_tokens_seen": 35032336208,
      "step": 44527
    },
    {
      "epoch": 4.723955018035221,
      "grad_norm": 0.7687318645878044,
      "learning_rate": 3.3237669543201535e-05,
      "loss": 1.3733,
      "num_input_tokens_seen": 35033122768,
      "step": 44528
    },
    {
      "epoch": 4.724061107574793,
      "grad_norm": 0.715561557535028,
      "learning_rate": 3.323701338297716e-05,
      "loss": 1.2778,
      "num_input_tokens_seen": 35033909568,
      "step": 44529
    },
    {
      "epoch": 4.724167197114364,
      "grad_norm": 0.6386475120147618,
      "learning_rate": 3.323635721638747e-05,
      "loss": 1.3414,
      "num_input_tokens_seen": 35034696256,
      "step": 44530
    },
    {
      "epoch": 4.724273286653936,
      "grad_norm": 0.6620740806885618,
      "learning_rate": 3.323570104343296e-05,
      "loss": 1.3253,
      "num_input_tokens_seen": 35035483056,
      "step": 44531
    },
    {
      "epoch": 4.724379376193507,
      "grad_norm": 0.5501853253975356,
      "learning_rate": 3.323504486411414e-05,
      "loss": 1.3268,
      "num_input_tokens_seen": 35036269872,
      "step": 44532
    },
    {
      "epoch": 4.724485465733078,
      "grad_norm": 0.6949542992195,
      "learning_rate": 3.323438867843153e-05,
      "loss": 1.3354,
      "num_input_tokens_seen": 35037056544,
      "step": 44533
    },
    {
      "epoch": 4.72459155527265,
      "grad_norm": 0.6829908404954004,
      "learning_rate": 3.323373248638561e-05,
      "loss": 1.395,
      "num_input_tokens_seen": 35037843328,
      "step": 44534
    },
    {
      "epoch": 4.724697644812221,
      "grad_norm": 0.5958726072536803,
      "learning_rate": 3.323307628797692e-05,
      "loss": 1.2989,
      "num_input_tokens_seen": 35038630032,
      "step": 44535
    },
    {
      "epoch": 4.724803734351793,
      "grad_norm": 0.7289005100847106,
      "learning_rate": 3.323242008320594e-05,
      "loss": 1.2976,
      "num_input_tokens_seen": 35039416896,
      "step": 44536
    },
    {
      "epoch": 4.724909823891364,
      "grad_norm": 0.5681375390861438,
      "learning_rate": 3.323176387207319e-05,
      "loss": 1.3047,
      "num_input_tokens_seen": 35040203680,
      "step": 44537
    },
    {
      "epoch": 4.725015913430935,
      "grad_norm": 0.7335770210712356,
      "learning_rate": 3.323110765457917e-05,
      "loss": 1.3267,
      "num_input_tokens_seen": 35040990448,
      "step": 44538
    },
    {
      "epoch": 4.725122002970507,
      "grad_norm": 0.5153507305983607,
      "learning_rate": 3.32304514307244e-05,
      "loss": 1.3303,
      "num_input_tokens_seen": 35041777200,
      "step": 44539
    },
    {
      "epoch": 4.725228092510078,
      "grad_norm": 0.6010607588873081,
      "learning_rate": 3.3229795200509366e-05,
      "loss": 1.4012,
      "num_input_tokens_seen": 35042563840,
      "step": 44540
    },
    {
      "epoch": 4.72533418204965,
      "grad_norm": 0.5199139110340415,
      "learning_rate": 3.3229138963934594e-05,
      "loss": 1.2247,
      "num_input_tokens_seen": 35043350608,
      "step": 44541
    },
    {
      "epoch": 4.725440271589221,
      "grad_norm": 0.6310043975865512,
      "learning_rate": 3.322848272100059e-05,
      "loss": 1.3785,
      "num_input_tokens_seen": 35044137200,
      "step": 44542
    },
    {
      "epoch": 4.725546361128792,
      "grad_norm": 0.48697267510879794,
      "learning_rate": 3.322782647170785e-05,
      "loss": 1.2489,
      "num_input_tokens_seen": 35044923936,
      "step": 44543
    },
    {
      "epoch": 4.725652450668364,
      "grad_norm": 0.503239983445911,
      "learning_rate": 3.322717021605689e-05,
      "loss": 1.2794,
      "num_input_tokens_seen": 35045710752,
      "step": 44544
    },
    {
      "epoch": 4.725758540207935,
      "grad_norm": 0.7908110502461387,
      "learning_rate": 3.3226513954048215e-05,
      "loss": 1.4798,
      "num_input_tokens_seen": 35046497536,
      "step": 44545
    },
    {
      "epoch": 4.725864629747507,
      "grad_norm": 0.530479920687351,
      "learning_rate": 3.3225857685682324e-05,
      "loss": 1.4074,
      "num_input_tokens_seen": 35047284304,
      "step": 44546
    },
    {
      "epoch": 4.725970719287078,
      "grad_norm": 0.7986157558168274,
      "learning_rate": 3.322520141095974e-05,
      "loss": 1.3138,
      "num_input_tokens_seen": 35048070928,
      "step": 44547
    },
    {
      "epoch": 4.72607680882665,
      "grad_norm": 0.603578768924947,
      "learning_rate": 3.3224545129880966e-05,
      "loss": 1.3626,
      "num_input_tokens_seen": 35048857648,
      "step": 44548
    },
    {
      "epoch": 4.726182898366221,
      "grad_norm": 0.5059006052592624,
      "learning_rate": 3.3223888842446494e-05,
      "loss": 1.2634,
      "num_input_tokens_seen": 35049644416,
      "step": 44549
    },
    {
      "epoch": 4.726288987905792,
      "grad_norm": 0.6518958403944939,
      "learning_rate": 3.322323254865685e-05,
      "loss": 1.3375,
      "num_input_tokens_seen": 35050431280,
      "step": 44550
    },
    {
      "epoch": 4.726395077445364,
      "grad_norm": 0.530127966238425,
      "learning_rate": 3.3222576248512525e-05,
      "loss": 1.256,
      "num_input_tokens_seen": 35051218032,
      "step": 44551
    },
    {
      "epoch": 4.726501166984935,
      "grad_norm": 0.6073228366991105,
      "learning_rate": 3.322191994201404e-05,
      "loss": 1.2987,
      "num_input_tokens_seen": 35052004768,
      "step": 44552
    },
    {
      "epoch": 4.726607256524507,
      "grad_norm": 0.5065561786731916,
      "learning_rate": 3.322126362916189e-05,
      "loss": 1.3262,
      "num_input_tokens_seen": 35052791552,
      "step": 44553
    },
    {
      "epoch": 4.726713346064078,
      "grad_norm": 0.6223281182651293,
      "learning_rate": 3.32206073099566e-05,
      "loss": 1.4244,
      "num_input_tokens_seen": 35053578256,
      "step": 44554
    },
    {
      "epoch": 4.72681943560365,
      "grad_norm": 0.5129721270412869,
      "learning_rate": 3.321995098439865e-05,
      "loss": 1.3574,
      "num_input_tokens_seen": 35054365088,
      "step": 44555
    },
    {
      "epoch": 4.726925525143221,
      "grad_norm": 0.48034252486848206,
      "learning_rate": 3.3219294652488574e-05,
      "loss": 1.2106,
      "num_input_tokens_seen": 35055151888,
      "step": 44556
    },
    {
      "epoch": 4.727031614682792,
      "grad_norm": 0.5356427158434269,
      "learning_rate": 3.321863831422687e-05,
      "loss": 1.2999,
      "num_input_tokens_seen": 35055938688,
      "step": 44557
    },
    {
      "epoch": 4.727137704222364,
      "grad_norm": 0.531683015245218,
      "learning_rate": 3.3217981969614045e-05,
      "loss": 1.2854,
      "num_input_tokens_seen": 35056725424,
      "step": 44558
    },
    {
      "epoch": 4.727243793761935,
      "grad_norm": 0.5471315204333808,
      "learning_rate": 3.32173256186506e-05,
      "loss": 1.3392,
      "num_input_tokens_seen": 35057512288,
      "step": 44559
    },
    {
      "epoch": 4.727349883301507,
      "grad_norm": 0.5607379051687839,
      "learning_rate": 3.321666926133704e-05,
      "loss": 1.3142,
      "num_input_tokens_seen": 35058298976,
      "step": 44560
    },
    {
      "epoch": 4.727455972841078,
      "grad_norm": 0.5437696328811137,
      "learning_rate": 3.3216012897673884e-05,
      "loss": 1.3311,
      "num_input_tokens_seen": 35059085744,
      "step": 44561
    },
    {
      "epoch": 4.727562062380649,
      "grad_norm": 0.6579070227314754,
      "learning_rate": 3.321535652766165e-05,
      "loss": 1.3714,
      "num_input_tokens_seen": 35059872496,
      "step": 44562
    },
    {
      "epoch": 4.727668151920221,
      "grad_norm": 0.5683890085112773,
      "learning_rate": 3.3214700151300805e-05,
      "loss": 1.2308,
      "num_input_tokens_seen": 35060659232,
      "step": 44563
    },
    {
      "epoch": 4.727774241459792,
      "grad_norm": 0.5432152328037505,
      "learning_rate": 3.32140437685919e-05,
      "loss": 1.373,
      "num_input_tokens_seen": 35061445904,
      "step": 44564
    },
    {
      "epoch": 4.727880330999364,
      "grad_norm": 0.6967394869610304,
      "learning_rate": 3.321338737953541e-05,
      "loss": 1.3624,
      "num_input_tokens_seen": 35062232816,
      "step": 44565
    },
    {
      "epoch": 4.727986420538935,
      "grad_norm": 0.45790674823835564,
      "learning_rate": 3.3212730984131854e-05,
      "loss": 1.2227,
      "num_input_tokens_seen": 35063019664,
      "step": 44566
    },
    {
      "epoch": 4.728092510078506,
      "grad_norm": 0.6206491642450747,
      "learning_rate": 3.3212074582381754e-05,
      "loss": 1.4581,
      "num_input_tokens_seen": 35063806480,
      "step": 44567
    },
    {
      "epoch": 4.728198599618078,
      "grad_norm": 0.5516092471536183,
      "learning_rate": 3.3211418174285595e-05,
      "loss": 1.2842,
      "num_input_tokens_seen": 35064593312,
      "step": 44568
    },
    {
      "epoch": 4.728304689157649,
      "grad_norm": 0.6525858319605837,
      "learning_rate": 3.3210761759843886e-05,
      "loss": 1.3243,
      "num_input_tokens_seen": 35065380000,
      "step": 44569
    },
    {
      "epoch": 4.728410778697221,
      "grad_norm": 0.6058719420108938,
      "learning_rate": 3.3210105339057154e-05,
      "loss": 1.4144,
      "num_input_tokens_seen": 35066166832,
      "step": 44570
    },
    {
      "epoch": 4.728516868236792,
      "grad_norm": 0.7487565472657824,
      "learning_rate": 3.3209448911925895e-05,
      "loss": 1.4126,
      "num_input_tokens_seen": 35066953584,
      "step": 44571
    },
    {
      "epoch": 4.728622957776363,
      "grad_norm": 0.5198520688194482,
      "learning_rate": 3.32087924784506e-05,
      "loss": 1.302,
      "num_input_tokens_seen": 35067740464,
      "step": 44572
    },
    {
      "epoch": 4.728729047315935,
      "grad_norm": 0.5445653762624368,
      "learning_rate": 3.320813603863181e-05,
      "loss": 1.3843,
      "num_input_tokens_seen": 35068527184,
      "step": 44573
    },
    {
      "epoch": 4.728835136855506,
      "grad_norm": 0.4950744523643725,
      "learning_rate": 3.3207479592469995e-05,
      "loss": 1.2051,
      "num_input_tokens_seen": 35069313984,
      "step": 44574
    },
    {
      "epoch": 4.728941226395078,
      "grad_norm": 0.6047396787248426,
      "learning_rate": 3.3206823139965694e-05,
      "loss": 1.3883,
      "num_input_tokens_seen": 35070100656,
      "step": 44575
    },
    {
      "epoch": 4.729047315934649,
      "grad_norm": 0.5368943539928445,
      "learning_rate": 3.3206166681119394e-05,
      "loss": 1.2932,
      "num_input_tokens_seen": 35070887376,
      "step": 44576
    },
    {
      "epoch": 4.729153405474221,
      "grad_norm": 0.5618363568898876,
      "learning_rate": 3.320551021593161e-05,
      "loss": 1.2723,
      "num_input_tokens_seen": 35071674144,
      "step": 44577
    },
    {
      "epoch": 4.729259495013792,
      "grad_norm": 0.5369957454009665,
      "learning_rate": 3.3204853744402847e-05,
      "loss": 1.3041,
      "num_input_tokens_seen": 35072461008,
      "step": 44578
    },
    {
      "epoch": 4.7293655845533635,
      "grad_norm": 0.5196996988047116,
      "learning_rate": 3.320419726653362e-05,
      "loss": 1.35,
      "num_input_tokens_seen": 35073247696,
      "step": 44579
    },
    {
      "epoch": 4.729471674092935,
      "grad_norm": 0.5514271815742094,
      "learning_rate": 3.320354078232442e-05,
      "loss": 1.4349,
      "num_input_tokens_seen": 35074034432,
      "step": 44580
    },
    {
      "epoch": 4.729577763632506,
      "grad_norm": 0.6606983174851664,
      "learning_rate": 3.320288429177577e-05,
      "loss": 1.2554,
      "num_input_tokens_seen": 35074821232,
      "step": 44581
    },
    {
      "epoch": 4.7296838531720775,
      "grad_norm": 0.6220174439507761,
      "learning_rate": 3.3202227794888175e-05,
      "loss": 1.3146,
      "num_input_tokens_seen": 35075607920,
      "step": 44582
    },
    {
      "epoch": 4.7297899427116485,
      "grad_norm": 0.7712176475816795,
      "learning_rate": 3.320157129166214e-05,
      "loss": 1.3237,
      "num_input_tokens_seen": 35076394640,
      "step": 44583
    },
    {
      "epoch": 4.7298960322512205,
      "grad_norm": 0.5154061382936397,
      "learning_rate": 3.320091478209816e-05,
      "loss": 1.299,
      "num_input_tokens_seen": 35077181456,
      "step": 44584
    },
    {
      "epoch": 4.7300021217907915,
      "grad_norm": 0.8311953860327319,
      "learning_rate": 3.3200258266196766e-05,
      "loss": 1.3387,
      "num_input_tokens_seen": 35077968208,
      "step": 44585
    },
    {
      "epoch": 4.7301082113303625,
      "grad_norm": 0.6177215063926731,
      "learning_rate": 3.319960174395844e-05,
      "loss": 1.3118,
      "num_input_tokens_seen": 35078755008,
      "step": 44586
    },
    {
      "epoch": 4.730214300869934,
      "grad_norm": 0.6884218769417669,
      "learning_rate": 3.3198945215383715e-05,
      "loss": 1.2878,
      "num_input_tokens_seen": 35079541728,
      "step": 44587
    },
    {
      "epoch": 4.7303203904095055,
      "grad_norm": 0.5053961054726496,
      "learning_rate": 3.3198288680473084e-05,
      "loss": 1.2844,
      "num_input_tokens_seen": 35080328464,
      "step": 44588
    },
    {
      "epoch": 4.730426479949077,
      "grad_norm": 0.5954494936384556,
      "learning_rate": 3.319763213922705e-05,
      "loss": 1.4084,
      "num_input_tokens_seen": 35081115232,
      "step": 44589
    },
    {
      "epoch": 4.730532569488648,
      "grad_norm": 0.4951322904153721,
      "learning_rate": 3.319697559164613e-05,
      "loss": 1.2792,
      "num_input_tokens_seen": 35081902160,
      "step": 44590
    },
    {
      "epoch": 4.7306386590282195,
      "grad_norm": 0.5486949940373697,
      "learning_rate": 3.319631903773083e-05,
      "loss": 1.237,
      "num_input_tokens_seen": 35082688912,
      "step": 44591
    },
    {
      "epoch": 4.730744748567791,
      "grad_norm": 0.6231427800786531,
      "learning_rate": 3.319566247748165e-05,
      "loss": 1.3931,
      "num_input_tokens_seen": 35083475616,
      "step": 44592
    },
    {
      "epoch": 4.730850838107362,
      "grad_norm": 0.5471825890482582,
      "learning_rate": 3.3195005910899106e-05,
      "loss": 1.2211,
      "num_input_tokens_seen": 35084262400,
      "step": 44593
    },
    {
      "epoch": 4.730956927646934,
      "grad_norm": 0.5653360744115214,
      "learning_rate": 3.31943493379837e-05,
      "loss": 1.353,
      "num_input_tokens_seen": 35085049072,
      "step": 44594
    },
    {
      "epoch": 4.731063017186505,
      "grad_norm": 0.5280169730744239,
      "learning_rate": 3.319369275873595e-05,
      "loss": 1.3458,
      "num_input_tokens_seen": 35085835776,
      "step": 44595
    },
    {
      "epoch": 4.731169106726076,
      "grad_norm": 0.7323107508148896,
      "learning_rate": 3.319303617315635e-05,
      "loss": 1.3199,
      "num_input_tokens_seen": 35086622576,
      "step": 44596
    },
    {
      "epoch": 4.731275196265648,
      "grad_norm": 0.4581957267722269,
      "learning_rate": 3.31923795812454e-05,
      "loss": 1.2934,
      "num_input_tokens_seen": 35087409248,
      "step": 44597
    },
    {
      "epoch": 4.731381285805219,
      "grad_norm": 0.5709402921196266,
      "learning_rate": 3.319172298300362e-05,
      "loss": 1.2806,
      "num_input_tokens_seen": 35088196112,
      "step": 44598
    },
    {
      "epoch": 4.731487375344791,
      "grad_norm": 0.5936884968730395,
      "learning_rate": 3.319106637843153e-05,
      "loss": 1.3551,
      "num_input_tokens_seen": 35088982816,
      "step": 44599
    },
    {
      "epoch": 4.731593464884362,
      "grad_norm": 0.5614739051228729,
      "learning_rate": 3.319040976752962e-05,
      "loss": 1.2896,
      "num_input_tokens_seen": 35089769600,
      "step": 44600
    },
    {
      "epoch": 4.731699554423933,
      "grad_norm": 0.5415969836504206,
      "learning_rate": 3.31897531502984e-05,
      "loss": 1.3097,
      "num_input_tokens_seen": 35090556352,
      "step": 44601
    },
    {
      "epoch": 4.731805643963505,
      "grad_norm": 0.5580946870595249,
      "learning_rate": 3.3189096526738375e-05,
      "loss": 1.3233,
      "num_input_tokens_seen": 35091343056,
      "step": 44602
    },
    {
      "epoch": 4.731911733503076,
      "grad_norm": 0.5822890170116228,
      "learning_rate": 3.318843989685007e-05,
      "loss": 1.3752,
      "num_input_tokens_seen": 35092129856,
      "step": 44603
    },
    {
      "epoch": 4.732017823042648,
      "grad_norm": 0.5967131812518666,
      "learning_rate": 3.3187783260633963e-05,
      "loss": 1.2779,
      "num_input_tokens_seen": 35092916640,
      "step": 44604
    },
    {
      "epoch": 4.732123912582219,
      "grad_norm": 0.5350265074287529,
      "learning_rate": 3.318712661809059e-05,
      "loss": 1.2791,
      "num_input_tokens_seen": 35093703440,
      "step": 44605
    },
    {
      "epoch": 4.732230002121791,
      "grad_norm": 0.4731034014788197,
      "learning_rate": 3.318646996922044e-05,
      "loss": 1.2555,
      "num_input_tokens_seen": 35094490160,
      "step": 44606
    },
    {
      "epoch": 4.732336091661362,
      "grad_norm": 0.5680273840570528,
      "learning_rate": 3.318581331402403e-05,
      "loss": 1.2628,
      "num_input_tokens_seen": 35095276928,
      "step": 44607
    },
    {
      "epoch": 4.732442181200934,
      "grad_norm": 0.5653788241458159,
      "learning_rate": 3.318515665250186e-05,
      "loss": 1.3136,
      "num_input_tokens_seen": 35096063680,
      "step": 44608
    },
    {
      "epoch": 4.732548270740505,
      "grad_norm": 0.5423247011581327,
      "learning_rate": 3.318449998465444e-05,
      "loss": 1.3583,
      "num_input_tokens_seen": 35096850320,
      "step": 44609
    },
    {
      "epoch": 4.732654360280076,
      "grad_norm": 0.6814705648235303,
      "learning_rate": 3.3183843310482275e-05,
      "loss": 1.2536,
      "num_input_tokens_seen": 35097637168,
      "step": 44610
    },
    {
      "epoch": 4.732760449819648,
      "grad_norm": 0.8004674599040301,
      "learning_rate": 3.3183186629985884e-05,
      "loss": 1.4375,
      "num_input_tokens_seen": 35098423856,
      "step": 44611
    },
    {
      "epoch": 4.732866539359219,
      "grad_norm": 0.5130694987976301,
      "learning_rate": 3.318252994316576e-05,
      "loss": 1.3066,
      "num_input_tokens_seen": 35099210640,
      "step": 44612
    },
    {
      "epoch": 4.732972628898791,
      "grad_norm": 0.6101654869922933,
      "learning_rate": 3.318187325002242e-05,
      "loss": 1.3389,
      "num_input_tokens_seen": 35099997472,
      "step": 44613
    },
    {
      "epoch": 4.733078718438362,
      "grad_norm": 0.698357356265799,
      "learning_rate": 3.3181216550556376e-05,
      "loss": 1.2105,
      "num_input_tokens_seen": 35100784320,
      "step": 44614
    },
    {
      "epoch": 4.733184807977933,
      "grad_norm": 0.47586824674010586,
      "learning_rate": 3.3180559844768117e-05,
      "loss": 1.2099,
      "num_input_tokens_seen": 35101571088,
      "step": 44615
    },
    {
      "epoch": 4.733290897517505,
      "grad_norm": 0.702050823006829,
      "learning_rate": 3.317990313265817e-05,
      "loss": 1.362,
      "num_input_tokens_seen": 35102357792,
      "step": 44616
    },
    {
      "epoch": 4.733396987057076,
      "grad_norm": 0.475472646003725,
      "learning_rate": 3.317924641422703e-05,
      "loss": 1.2518,
      "num_input_tokens_seen": 35103144672,
      "step": 44617
    },
    {
      "epoch": 4.733503076596648,
      "grad_norm": 0.49300575121288237,
      "learning_rate": 3.31785896894752e-05,
      "loss": 1.2822,
      "num_input_tokens_seen": 35103931536,
      "step": 44618
    },
    {
      "epoch": 4.733609166136219,
      "grad_norm": 0.5040990185957674,
      "learning_rate": 3.3177932958403205e-05,
      "loss": 1.2316,
      "num_input_tokens_seen": 35104718384,
      "step": 44619
    },
    {
      "epoch": 4.73371525567579,
      "grad_norm": 0.618542707229907,
      "learning_rate": 3.317727622101154e-05,
      "loss": 1.4004,
      "num_input_tokens_seen": 35105505168,
      "step": 44620
    },
    {
      "epoch": 4.733821345215362,
      "grad_norm": 0.5332722764493888,
      "learning_rate": 3.3176619477300717e-05,
      "loss": 1.3062,
      "num_input_tokens_seen": 35106291856,
      "step": 44621
    },
    {
      "epoch": 4.733927434754933,
      "grad_norm": 0.5020005307976062,
      "learning_rate": 3.317596272727125e-05,
      "loss": 1.2923,
      "num_input_tokens_seen": 35107078576,
      "step": 44622
    },
    {
      "epoch": 4.734033524294505,
      "grad_norm": 0.5643211277177148,
      "learning_rate": 3.3175305970923626e-05,
      "loss": 1.2061,
      "num_input_tokens_seen": 35107865360,
      "step": 44623
    },
    {
      "epoch": 4.734139613834076,
      "grad_norm": 0.5230276218712131,
      "learning_rate": 3.317464920825837e-05,
      "loss": 1.2495,
      "num_input_tokens_seen": 35108652144,
      "step": 44624
    },
    {
      "epoch": 4.734245703373647,
      "grad_norm": 0.5233225831989434,
      "learning_rate": 3.317399243927599e-05,
      "loss": 1.2495,
      "num_input_tokens_seen": 35109438928,
      "step": 44625
    },
    {
      "epoch": 4.734351792913219,
      "grad_norm": 0.5476932727807075,
      "learning_rate": 3.317333566397698e-05,
      "loss": 1.2837,
      "num_input_tokens_seen": 35110225712,
      "step": 44626
    },
    {
      "epoch": 4.73445788245279,
      "grad_norm": 0.5201566038568897,
      "learning_rate": 3.3172678882361866e-05,
      "loss": 1.3281,
      "num_input_tokens_seen": 35111012496,
      "step": 44627
    },
    {
      "epoch": 4.734563971992362,
      "grad_norm": 0.4442532599097362,
      "learning_rate": 3.317202209443114e-05,
      "loss": 1.2943,
      "num_input_tokens_seen": 35111799248,
      "step": 44628
    },
    {
      "epoch": 4.734670061531933,
      "grad_norm": 0.6045229160055582,
      "learning_rate": 3.3171365300185315e-05,
      "loss": 1.2888,
      "num_input_tokens_seen": 35112585968,
      "step": 44629
    },
    {
      "epoch": 4.734776151071505,
      "grad_norm": 0.5246130493353927,
      "learning_rate": 3.3170708499624904e-05,
      "loss": 1.2809,
      "num_input_tokens_seen": 35113372816,
      "step": 44630
    },
    {
      "epoch": 4.734882240611076,
      "grad_norm": 0.48718609617188924,
      "learning_rate": 3.3170051692750404e-05,
      "loss": 1.2807,
      "num_input_tokens_seen": 35114159632,
      "step": 44631
    },
    {
      "epoch": 4.734988330150647,
      "grad_norm": 0.7687835453595557,
      "learning_rate": 3.3169394879562324e-05,
      "loss": 1.2323,
      "num_input_tokens_seen": 35114946416,
      "step": 44632
    },
    {
      "epoch": 4.735094419690219,
      "grad_norm": 0.564847471853542,
      "learning_rate": 3.3168738060061186e-05,
      "loss": 1.2781,
      "num_input_tokens_seen": 35115733264,
      "step": 44633
    },
    {
      "epoch": 4.73520050922979,
      "grad_norm": 0.6060757936087601,
      "learning_rate": 3.3168081234247476e-05,
      "loss": 1.308,
      "num_input_tokens_seen": 35116520064,
      "step": 44634
    },
    {
      "epoch": 4.735306598769362,
      "grad_norm": 0.6207572367286255,
      "learning_rate": 3.316742440212172e-05,
      "loss": 1.2962,
      "num_input_tokens_seen": 35117306864,
      "step": 44635
    },
    {
      "epoch": 4.735412688308933,
      "grad_norm": 0.47834461042112836,
      "learning_rate": 3.3166767563684406e-05,
      "loss": 1.3383,
      "num_input_tokens_seen": 35118093472,
      "step": 44636
    },
    {
      "epoch": 4.735518777848505,
      "grad_norm": 0.5826406269883864,
      "learning_rate": 3.316611071893607e-05,
      "loss": 1.2959,
      "num_input_tokens_seen": 35118880240,
      "step": 44637
    },
    {
      "epoch": 4.735624867388076,
      "grad_norm": 0.4968955951066483,
      "learning_rate": 3.316545386787719e-05,
      "loss": 1.2825,
      "num_input_tokens_seen": 35119667120,
      "step": 44638
    },
    {
      "epoch": 4.735730956927647,
      "grad_norm": 0.5855965146955837,
      "learning_rate": 3.3164797010508294e-05,
      "loss": 1.3596,
      "num_input_tokens_seen": 35120453936,
      "step": 44639
    },
    {
      "epoch": 4.735837046467219,
      "grad_norm": 0.537829859925409,
      "learning_rate": 3.316414014682988e-05,
      "loss": 1.2752,
      "num_input_tokens_seen": 35121240704,
      "step": 44640
    },
    {
      "epoch": 4.73594313600679,
      "grad_norm": 0.607121575228654,
      "learning_rate": 3.316348327684246e-05,
      "loss": 1.2677,
      "num_input_tokens_seen": 35122027472,
      "step": 44641
    },
    {
      "epoch": 4.7360492255463615,
      "grad_norm": 0.4936199411008413,
      "learning_rate": 3.3162826400546544e-05,
      "loss": 1.268,
      "num_input_tokens_seen": 35122814176,
      "step": 44642
    },
    {
      "epoch": 4.736155315085933,
      "grad_norm": 0.5520830969649021,
      "learning_rate": 3.316216951794262e-05,
      "loss": 1.3633,
      "num_input_tokens_seen": 35123600960,
      "step": 44643
    },
    {
      "epoch": 4.736261404625504,
      "grad_norm": 0.46894027374092906,
      "learning_rate": 3.316151262903123e-05,
      "loss": 1.37,
      "num_input_tokens_seen": 35124387632,
      "step": 44644
    },
    {
      "epoch": 4.7363674941650755,
      "grad_norm": 0.4980216191115988,
      "learning_rate": 3.3160855733812845e-05,
      "loss": 1.269,
      "num_input_tokens_seen": 35125174448,
      "step": 44645
    },
    {
      "epoch": 4.7364735837046466,
      "grad_norm": 0.6420558698906405,
      "learning_rate": 3.3160198832288e-05,
      "loss": 1.3468,
      "num_input_tokens_seen": 35125961248,
      "step": 44646
    },
    {
      "epoch": 4.7365796732442185,
      "grad_norm": 0.5086302077680384,
      "learning_rate": 3.315954192445719e-05,
      "loss": 1.2676,
      "num_input_tokens_seen": 35126748112,
      "step": 44647
    },
    {
      "epoch": 4.7366857627837895,
      "grad_norm": 0.5885588081212135,
      "learning_rate": 3.315888501032093e-05,
      "loss": 1.2107,
      "num_input_tokens_seen": 35127534848,
      "step": 44648
    },
    {
      "epoch": 4.7367918523233605,
      "grad_norm": 0.47778697185667995,
      "learning_rate": 3.315822808987972e-05,
      "loss": 1.3506,
      "num_input_tokens_seen": 35128321552,
      "step": 44649
    },
    {
      "epoch": 4.7368979418629324,
      "grad_norm": 0.5223532592468723,
      "learning_rate": 3.315757116313407e-05,
      "loss": 1.4068,
      "num_input_tokens_seen": 35129108304,
      "step": 44650
    },
    {
      "epoch": 4.7370040314025035,
      "grad_norm": 0.5187728047040332,
      "learning_rate": 3.315691423008449e-05,
      "loss": 1.2014,
      "num_input_tokens_seen": 35129895088,
      "step": 44651
    },
    {
      "epoch": 4.737110120942075,
      "grad_norm": 0.6497742200935654,
      "learning_rate": 3.3156257290731484e-05,
      "loss": 1.3826,
      "num_input_tokens_seen": 35130681856,
      "step": 44652
    },
    {
      "epoch": 4.737216210481646,
      "grad_norm": 0.622423257767081,
      "learning_rate": 3.315560034507556e-05,
      "loss": 1.3254,
      "num_input_tokens_seen": 35131468576,
      "step": 44653
    },
    {
      "epoch": 4.7373223000212175,
      "grad_norm": 0.5857597786367277,
      "learning_rate": 3.3154943393117235e-05,
      "loss": 1.315,
      "num_input_tokens_seen": 35132255312,
      "step": 44654
    },
    {
      "epoch": 4.737428389560789,
      "grad_norm": 0.5237863567783678,
      "learning_rate": 3.3154286434857e-05,
      "loss": 1.3278,
      "num_input_tokens_seen": 35133042000,
      "step": 44655
    },
    {
      "epoch": 4.73753447910036,
      "grad_norm": 0.5939281546454467,
      "learning_rate": 3.315362947029538e-05,
      "loss": 1.2861,
      "num_input_tokens_seen": 35133828864,
      "step": 44656
    },
    {
      "epoch": 4.737640568639932,
      "grad_norm": 0.656371865744634,
      "learning_rate": 3.3152972499432875e-05,
      "loss": 1.2769,
      "num_input_tokens_seen": 35134615744,
      "step": 44657
    },
    {
      "epoch": 4.737746658179503,
      "grad_norm": 0.6229453433033657,
      "learning_rate": 3.315231552226998e-05,
      "loss": 1.2968,
      "num_input_tokens_seen": 35135402448,
      "step": 44658
    },
    {
      "epoch": 4.737852747719075,
      "grad_norm": 0.6425312202164606,
      "learning_rate": 3.315165853880722e-05,
      "loss": 1.2374,
      "num_input_tokens_seen": 35136189216,
      "step": 44659
    },
    {
      "epoch": 4.737958837258646,
      "grad_norm": 0.5601056465417791,
      "learning_rate": 3.31510015490451e-05,
      "loss": 1.2989,
      "num_input_tokens_seen": 35136975888,
      "step": 44660
    },
    {
      "epoch": 4.738064926798217,
      "grad_norm": 0.6345963267195069,
      "learning_rate": 3.3150344552984125e-05,
      "loss": 1.317,
      "num_input_tokens_seen": 35137762608,
      "step": 44661
    },
    {
      "epoch": 4.738171016337789,
      "grad_norm": 0.5270030694899065,
      "learning_rate": 3.31496875506248e-05,
      "loss": 1.1857,
      "num_input_tokens_seen": 35138549360,
      "step": 44662
    },
    {
      "epoch": 4.73827710587736,
      "grad_norm": 0.539342572571416,
      "learning_rate": 3.314903054196764e-05,
      "loss": 1.3268,
      "num_input_tokens_seen": 35139336096,
      "step": 44663
    },
    {
      "epoch": 4.738383195416932,
      "grad_norm": 0.4674893971862351,
      "learning_rate": 3.314837352701315e-05,
      "loss": 1.354,
      "num_input_tokens_seen": 35140122832,
      "step": 44664
    },
    {
      "epoch": 4.738489284956503,
      "grad_norm": 0.5434609701884694,
      "learning_rate": 3.314771650576183e-05,
      "loss": 1.2197,
      "num_input_tokens_seen": 35140909632,
      "step": 44665
    },
    {
      "epoch": 4.738595374496075,
      "grad_norm": 0.5287732872027374,
      "learning_rate": 3.314705947821419e-05,
      "loss": 1.3187,
      "num_input_tokens_seen": 35141696432,
      "step": 44666
    },
    {
      "epoch": 4.738701464035646,
      "grad_norm": 0.5917229748541002,
      "learning_rate": 3.3146402444370754e-05,
      "loss": 1.2471,
      "num_input_tokens_seen": 35142483248,
      "step": 44667
    },
    {
      "epoch": 4.738807553575217,
      "grad_norm": 0.546206853721866,
      "learning_rate": 3.3145745404232013e-05,
      "loss": 1.2911,
      "num_input_tokens_seen": 35143269920,
      "step": 44668
    },
    {
      "epoch": 4.738913643114789,
      "grad_norm": 0.537274644642773,
      "learning_rate": 3.314508835779847e-05,
      "loss": 1.4479,
      "num_input_tokens_seen": 35144056688,
      "step": 44669
    },
    {
      "epoch": 4.73901973265436,
      "grad_norm": 0.5991499987996696,
      "learning_rate": 3.314443130507066e-05,
      "loss": 1.404,
      "num_input_tokens_seen": 35144843440,
      "step": 44670
    },
    {
      "epoch": 4.739125822193932,
      "grad_norm": 0.7935674386487177,
      "learning_rate": 3.314377424604906e-05,
      "loss": 1.2508,
      "num_input_tokens_seen": 35145630160,
      "step": 44671
    },
    {
      "epoch": 4.739231911733503,
      "grad_norm": 0.48888675621596445,
      "learning_rate": 3.314311718073418e-05,
      "loss": 1.2783,
      "num_input_tokens_seen": 35146416992,
      "step": 44672
    },
    {
      "epoch": 4.739338001273074,
      "grad_norm": 0.5582866173078376,
      "learning_rate": 3.3142460109126555e-05,
      "loss": 1.3333,
      "num_input_tokens_seen": 35147203616,
      "step": 44673
    },
    {
      "epoch": 4.739444090812646,
      "grad_norm": 0.6911487766901274,
      "learning_rate": 3.314180303122667e-05,
      "loss": 1.3207,
      "num_input_tokens_seen": 35147990464,
      "step": 44674
    },
    {
      "epoch": 4.739550180352217,
      "grad_norm": 0.6596489714144969,
      "learning_rate": 3.3141145947035036e-05,
      "loss": 1.2968,
      "num_input_tokens_seen": 35148777152,
      "step": 44675
    },
    {
      "epoch": 4.739656269891789,
      "grad_norm": 0.5878043038931708,
      "learning_rate": 3.3140488856552174e-05,
      "loss": 1.2859,
      "num_input_tokens_seen": 35149563888,
      "step": 44676
    },
    {
      "epoch": 4.73976235943136,
      "grad_norm": 0.8087517311196725,
      "learning_rate": 3.3139831759778574e-05,
      "loss": 1.236,
      "num_input_tokens_seen": 35150350640,
      "step": 44677
    },
    {
      "epoch": 4.739868448970931,
      "grad_norm": 0.724423693188072,
      "learning_rate": 3.3139174656714746e-05,
      "loss": 1.4155,
      "num_input_tokens_seen": 35151137280,
      "step": 44678
    },
    {
      "epoch": 4.739974538510503,
      "grad_norm": 0.8332163832550998,
      "learning_rate": 3.31385175473612e-05,
      "loss": 1.3444,
      "num_input_tokens_seen": 35151924160,
      "step": 44679
    },
    {
      "epoch": 4.740080628050074,
      "grad_norm": 0.8022866999552157,
      "learning_rate": 3.3137860431718453e-05,
      "loss": 1.3891,
      "num_input_tokens_seen": 35152710992,
      "step": 44680
    },
    {
      "epoch": 4.740186717589646,
      "grad_norm": 0.4557522848820467,
      "learning_rate": 3.3137203309787006e-05,
      "loss": 1.286,
      "num_input_tokens_seen": 35153497760,
      "step": 44681
    },
    {
      "epoch": 4.740292807129217,
      "grad_norm": 0.7912728092111018,
      "learning_rate": 3.3136546181567377e-05,
      "loss": 1.366,
      "num_input_tokens_seen": 35154284352,
      "step": 44682
    },
    {
      "epoch": 4.740398896668788,
      "grad_norm": 0.5271385038770101,
      "learning_rate": 3.3135889047060045e-05,
      "loss": 1.3496,
      "num_input_tokens_seen": 35155071136,
      "step": 44683
    },
    {
      "epoch": 4.74050498620836,
      "grad_norm": 0.6593927413159801,
      "learning_rate": 3.313523190626555e-05,
      "loss": 1.3934,
      "num_input_tokens_seen": 35155857984,
      "step": 44684
    },
    {
      "epoch": 4.740611075747931,
      "grad_norm": 0.6537350467583598,
      "learning_rate": 3.313457475918438e-05,
      "loss": 1.2674,
      "num_input_tokens_seen": 35156644816,
      "step": 44685
    },
    {
      "epoch": 4.740717165287503,
      "grad_norm": 0.5331113872657909,
      "learning_rate": 3.313391760581705e-05,
      "loss": 1.2674,
      "num_input_tokens_seen": 35157431488,
      "step": 44686
    },
    {
      "epoch": 4.740823254827074,
      "grad_norm": 0.7223812699331889,
      "learning_rate": 3.313326044616407e-05,
      "loss": 1.2481,
      "num_input_tokens_seen": 35158218272,
      "step": 44687
    },
    {
      "epoch": 4.740929344366646,
      "grad_norm": 0.5503617705704194,
      "learning_rate": 3.3132603280225946e-05,
      "loss": 1.2911,
      "num_input_tokens_seen": 35159005008,
      "step": 44688
    },
    {
      "epoch": 4.741035433906217,
      "grad_norm": 0.5395926166643165,
      "learning_rate": 3.313194610800318e-05,
      "loss": 1.221,
      "num_input_tokens_seen": 35159791776,
      "step": 44689
    },
    {
      "epoch": 4.741141523445788,
      "grad_norm": 0.6092553353455592,
      "learning_rate": 3.313128892949629e-05,
      "loss": 1.2786,
      "num_input_tokens_seen": 35160578512,
      "step": 44690
    },
    {
      "epoch": 4.74124761298536,
      "grad_norm": 0.759727740528216,
      "learning_rate": 3.313063174470577e-05,
      "loss": 1.3638,
      "num_input_tokens_seen": 35161365280,
      "step": 44691
    },
    {
      "epoch": 4.741353702524931,
      "grad_norm": 0.5573552116490567,
      "learning_rate": 3.3129974553632144e-05,
      "loss": 1.2767,
      "num_input_tokens_seen": 35162152048,
      "step": 44692
    },
    {
      "epoch": 4.741459792064503,
      "grad_norm": 1.0168115088727432,
      "learning_rate": 3.31293173562759e-05,
      "loss": 1.3568,
      "num_input_tokens_seen": 35162938848,
      "step": 44693
    },
    {
      "epoch": 4.741565881604074,
      "grad_norm": 0.8642706317166265,
      "learning_rate": 3.312866015263758e-05,
      "loss": 1.3381,
      "num_input_tokens_seen": 35163725568,
      "step": 44694
    },
    {
      "epoch": 4.741671971143646,
      "grad_norm": 0.6703910351691353,
      "learning_rate": 3.312800294271765e-05,
      "loss": 1.1958,
      "num_input_tokens_seen": 35164512368,
      "step": 44695
    },
    {
      "epoch": 4.741778060683217,
      "grad_norm": 1.681180175750456,
      "learning_rate": 3.3127345726516646e-05,
      "loss": 1.4079,
      "num_input_tokens_seen": 35165299088,
      "step": 44696
    },
    {
      "epoch": 4.741884150222788,
      "grad_norm": 0.8270953322203914,
      "learning_rate": 3.312668850403507e-05,
      "loss": 1.2383,
      "num_input_tokens_seen": 35166085904,
      "step": 44697
    },
    {
      "epoch": 4.74199023976236,
      "grad_norm": 0.817631134131135,
      "learning_rate": 3.312603127527342e-05,
      "loss": 1.2999,
      "num_input_tokens_seen": 35166872672,
      "step": 44698
    },
    {
      "epoch": 4.742096329301931,
      "grad_norm": 0.9196290138589478,
      "learning_rate": 3.3125374040232224e-05,
      "loss": 1.369,
      "num_input_tokens_seen": 35167659360,
      "step": 44699
    },
    {
      "epoch": 4.742202418841503,
      "grad_norm": 0.6793860457242533,
      "learning_rate": 3.312471679891197e-05,
      "loss": 1.2413,
      "num_input_tokens_seen": 35168446144,
      "step": 44700
    },
    {
      "epoch": 4.742308508381074,
      "grad_norm": 0.530478302434373,
      "learning_rate": 3.312405955131317e-05,
      "loss": 1.2885,
      "num_input_tokens_seen": 35169232896,
      "step": 44701
    },
    {
      "epoch": 4.742414597920645,
      "grad_norm": 0.6559785043263863,
      "learning_rate": 3.312340229743633e-05,
      "loss": 1.3318,
      "num_input_tokens_seen": 35170019680,
      "step": 44702
    },
    {
      "epoch": 4.742520687460217,
      "grad_norm": 0.5645044941438434,
      "learning_rate": 3.312274503728198e-05,
      "loss": 1.2516,
      "num_input_tokens_seen": 35170806384,
      "step": 44703
    },
    {
      "epoch": 4.742626776999788,
      "grad_norm": 0.5013275230908226,
      "learning_rate": 3.31220877708506e-05,
      "loss": 1.3343,
      "num_input_tokens_seen": 35171593216,
      "step": 44704
    },
    {
      "epoch": 4.7427328665393595,
      "grad_norm": 0.4956016458190942,
      "learning_rate": 3.312143049814271e-05,
      "loss": 1.3206,
      "num_input_tokens_seen": 35172380016,
      "step": 44705
    },
    {
      "epoch": 4.742838956078931,
      "grad_norm": 0.7175521332072656,
      "learning_rate": 3.312077321915882e-05,
      "loss": 1.3833,
      "num_input_tokens_seen": 35173166720,
      "step": 44706
    },
    {
      "epoch": 4.742945045618502,
      "grad_norm": 0.5686615484302081,
      "learning_rate": 3.312011593389943e-05,
      "loss": 1.3331,
      "num_input_tokens_seen": 35173953376,
      "step": 44707
    },
    {
      "epoch": 4.7430511351580735,
      "grad_norm": 0.5431470298488398,
      "learning_rate": 3.311945864236506e-05,
      "loss": 1.3493,
      "num_input_tokens_seen": 35174740176,
      "step": 44708
    },
    {
      "epoch": 4.743157224697645,
      "grad_norm": 0.5445773751369197,
      "learning_rate": 3.3118801344556206e-05,
      "loss": 1.2547,
      "num_input_tokens_seen": 35175527072,
      "step": 44709
    },
    {
      "epoch": 4.7432633142372165,
      "grad_norm": 0.4993736846409421,
      "learning_rate": 3.311814404047337e-05,
      "loss": 1.3384,
      "num_input_tokens_seen": 35176313856,
      "step": 44710
    },
    {
      "epoch": 4.7433694037767875,
      "grad_norm": 0.4884457781191754,
      "learning_rate": 3.311748673011709e-05,
      "loss": 1.3379,
      "num_input_tokens_seen": 35177100592,
      "step": 44711
    },
    {
      "epoch": 4.7434754933163585,
      "grad_norm": 0.4678726289643835,
      "learning_rate": 3.311682941348784e-05,
      "loss": 1.2657,
      "num_input_tokens_seen": 35177887312,
      "step": 44712
    },
    {
      "epoch": 4.7435815828559305,
      "grad_norm": 0.47571854169507416,
      "learning_rate": 3.311617209058615e-05,
      "loss": 1.3188,
      "num_input_tokens_seen": 35178674096,
      "step": 44713
    },
    {
      "epoch": 4.7436876723955015,
      "grad_norm": 0.7517366479895653,
      "learning_rate": 3.311551476141252e-05,
      "loss": 1.2797,
      "num_input_tokens_seen": 35179460864,
      "step": 44714
    },
    {
      "epoch": 4.743793761935073,
      "grad_norm": 0.5289408588690794,
      "learning_rate": 3.3114857425967454e-05,
      "loss": 1.3116,
      "num_input_tokens_seen": 35180247648,
      "step": 44715
    },
    {
      "epoch": 4.743899851474644,
      "grad_norm": 0.6433284148845453,
      "learning_rate": 3.311420008425147e-05,
      "loss": 1.3487,
      "num_input_tokens_seen": 35181034384,
      "step": 44716
    },
    {
      "epoch": 4.744005941014216,
      "grad_norm": 0.6904953520808451,
      "learning_rate": 3.311354273626507e-05,
      "loss": 1.2452,
      "num_input_tokens_seen": 35181821136,
      "step": 44717
    },
    {
      "epoch": 4.744112030553787,
      "grad_norm": 0.5950333042989964,
      "learning_rate": 3.3112885382008754e-05,
      "loss": 1.382,
      "num_input_tokens_seen": 35182607904,
      "step": 44718
    },
    {
      "epoch": 4.744218120093358,
      "grad_norm": 0.7189897467860561,
      "learning_rate": 3.311222802148305e-05,
      "loss": 1.3291,
      "num_input_tokens_seen": 35183394672,
      "step": 44719
    },
    {
      "epoch": 4.74432420963293,
      "grad_norm": 0.9414025914818769,
      "learning_rate": 3.311157065468844e-05,
      "loss": 1.3458,
      "num_input_tokens_seen": 35184181424,
      "step": 44720
    },
    {
      "epoch": 4.744430299172501,
      "grad_norm": 0.5578076910689348,
      "learning_rate": 3.3110913281625455e-05,
      "loss": 1.2786,
      "num_input_tokens_seen": 35184968064,
      "step": 44721
    },
    {
      "epoch": 4.744536388712073,
      "grad_norm": 0.75158792102852,
      "learning_rate": 3.3110255902294594e-05,
      "loss": 1.2466,
      "num_input_tokens_seen": 35185754896,
      "step": 44722
    },
    {
      "epoch": 4.744642478251644,
      "grad_norm": 0.7252631642415172,
      "learning_rate": 3.3109598516696366e-05,
      "loss": 1.2774,
      "num_input_tokens_seen": 35186541696,
      "step": 44723
    },
    {
      "epoch": 4.744748567791216,
      "grad_norm": 0.4875395198543583,
      "learning_rate": 3.310894112483128e-05,
      "loss": 1.3287,
      "num_input_tokens_seen": 35187328480,
      "step": 44724
    },
    {
      "epoch": 4.744854657330787,
      "grad_norm": 0.7211078638784075,
      "learning_rate": 3.310828372669984e-05,
      "loss": 1.3898,
      "num_input_tokens_seen": 35188115264,
      "step": 44725
    },
    {
      "epoch": 4.744960746870358,
      "grad_norm": 0.6499002109204621,
      "learning_rate": 3.310762632230255e-05,
      "loss": 1.2508,
      "num_input_tokens_seen": 35188902096,
      "step": 44726
    },
    {
      "epoch": 4.74506683640993,
      "grad_norm": 0.5867040164229885,
      "learning_rate": 3.310696891163993e-05,
      "loss": 1.3695,
      "num_input_tokens_seen": 35189688880,
      "step": 44727
    },
    {
      "epoch": 4.745172925949501,
      "grad_norm": 0.6588103075086228,
      "learning_rate": 3.310631149471248e-05,
      "loss": 1.2903,
      "num_input_tokens_seen": 35190475712,
      "step": 44728
    },
    {
      "epoch": 4.745279015489073,
      "grad_norm": 0.5647462519999714,
      "learning_rate": 3.3105654071520716e-05,
      "loss": 1.2974,
      "num_input_tokens_seen": 35191262528,
      "step": 44729
    },
    {
      "epoch": 4.745385105028644,
      "grad_norm": 0.6091708233708732,
      "learning_rate": 3.3104996642065134e-05,
      "loss": 1.3222,
      "num_input_tokens_seen": 35192049232,
      "step": 44730
    },
    {
      "epoch": 4.745491194568215,
      "grad_norm": 0.7103708537101779,
      "learning_rate": 3.310433920634625e-05,
      "loss": 1.3451,
      "num_input_tokens_seen": 35192835936,
      "step": 44731
    },
    {
      "epoch": 4.745597284107787,
      "grad_norm": 0.48745065092808537,
      "learning_rate": 3.310368176436457e-05,
      "loss": 1.2853,
      "num_input_tokens_seen": 35193622768,
      "step": 44732
    },
    {
      "epoch": 4.745703373647358,
      "grad_norm": 0.6211265869198833,
      "learning_rate": 3.310302431612061e-05,
      "loss": 1.191,
      "num_input_tokens_seen": 35194409696,
      "step": 44733
    },
    {
      "epoch": 4.74580946318693,
      "grad_norm": 0.6070836714004394,
      "learning_rate": 3.310236686161487e-05,
      "loss": 1.3463,
      "num_input_tokens_seen": 35195196432,
      "step": 44734
    },
    {
      "epoch": 4.745915552726501,
      "grad_norm": 0.5243558670325058,
      "learning_rate": 3.310170940084784e-05,
      "loss": 1.3535,
      "num_input_tokens_seen": 35195983152,
      "step": 44735
    },
    {
      "epoch": 4.746021642266072,
      "grad_norm": 0.6286563320893219,
      "learning_rate": 3.3101051933820065e-05,
      "loss": 1.3336,
      "num_input_tokens_seen": 35196769840,
      "step": 44736
    },
    {
      "epoch": 4.746127731805644,
      "grad_norm": 0.47458328737541644,
      "learning_rate": 3.310039446053203e-05,
      "loss": 1.3108,
      "num_input_tokens_seen": 35197556576,
      "step": 44737
    },
    {
      "epoch": 4.746233821345215,
      "grad_norm": 0.5449087912669662,
      "learning_rate": 3.3099736980984245e-05,
      "loss": 1.3736,
      "num_input_tokens_seen": 35198343312,
      "step": 44738
    },
    {
      "epoch": 4.746339910884787,
      "grad_norm": 0.5019501993702078,
      "learning_rate": 3.309907949517722e-05,
      "loss": 1.301,
      "num_input_tokens_seen": 35199130064,
      "step": 44739
    },
    {
      "epoch": 4.746446000424358,
      "grad_norm": 0.6693170931088278,
      "learning_rate": 3.3098422003111465e-05,
      "loss": 1.3742,
      "num_input_tokens_seen": 35199916896,
      "step": 44740
    },
    {
      "epoch": 4.746552089963929,
      "grad_norm": 0.5455324896390101,
      "learning_rate": 3.3097764504787484e-05,
      "loss": 1.3585,
      "num_input_tokens_seen": 35200703632,
      "step": 44741
    },
    {
      "epoch": 4.746658179503501,
      "grad_norm": 0.5932051160250543,
      "learning_rate": 3.309710700020579e-05,
      "loss": 1.247,
      "num_input_tokens_seen": 35201490400,
      "step": 44742
    },
    {
      "epoch": 4.746764269043072,
      "grad_norm": 0.6624900628948255,
      "learning_rate": 3.3096449489366907e-05,
      "loss": 1.3062,
      "num_input_tokens_seen": 35202277088,
      "step": 44743
    },
    {
      "epoch": 4.746870358582644,
      "grad_norm": 0.6666426705208404,
      "learning_rate": 3.3095791972271306e-05,
      "loss": 1.2909,
      "num_input_tokens_seen": 35203063936,
      "step": 44744
    },
    {
      "epoch": 4.746976448122215,
      "grad_norm": 0.6415983924111129,
      "learning_rate": 3.309513444891952e-05,
      "loss": 1.2042,
      "num_input_tokens_seen": 35203850672,
      "step": 44745
    },
    {
      "epoch": 4.747082537661787,
      "grad_norm": 1.2108726890852761,
      "learning_rate": 3.309447691931206e-05,
      "loss": 1.1968,
      "num_input_tokens_seen": 35204637488,
      "step": 44746
    },
    {
      "epoch": 4.747188627201358,
      "grad_norm": 0.6121326995755565,
      "learning_rate": 3.3093819383449406e-05,
      "loss": 1.3056,
      "num_input_tokens_seen": 35205424224,
      "step": 44747
    },
    {
      "epoch": 4.74729471674093,
      "grad_norm": 0.6498573053040543,
      "learning_rate": 3.30931618413321e-05,
      "loss": 1.3157,
      "num_input_tokens_seen": 35206210976,
      "step": 44748
    },
    {
      "epoch": 4.747400806280501,
      "grad_norm": 0.525510743026022,
      "learning_rate": 3.309250429296063e-05,
      "loss": 1.283,
      "num_input_tokens_seen": 35206997792,
      "step": 44749
    },
    {
      "epoch": 4.747506895820072,
      "grad_norm": 0.5501746593860835,
      "learning_rate": 3.309184673833551e-05,
      "loss": 1.2825,
      "num_input_tokens_seen": 35207784624,
      "step": 44750
    },
    {
      "epoch": 4.747612985359644,
      "grad_norm": 0.7241347415239747,
      "learning_rate": 3.309118917745726e-05,
      "loss": 1.2928,
      "num_input_tokens_seen": 35208571488,
      "step": 44751
    },
    {
      "epoch": 4.747719074899215,
      "grad_norm": 0.6414612084845058,
      "learning_rate": 3.309053161032636e-05,
      "loss": 1.2913,
      "num_input_tokens_seen": 35209358240,
      "step": 44752
    },
    {
      "epoch": 4.747825164438787,
      "grad_norm": 0.5146969395490063,
      "learning_rate": 3.308987403694335e-05,
      "loss": 1.2262,
      "num_input_tokens_seen": 35210145088,
      "step": 44753
    },
    {
      "epoch": 4.747931253978358,
      "grad_norm": 0.6552708062961988,
      "learning_rate": 3.3089216457308716e-05,
      "loss": 1.2508,
      "num_input_tokens_seen": 35210931904,
      "step": 44754
    },
    {
      "epoch": 4.748037343517929,
      "grad_norm": 0.7054206895160583,
      "learning_rate": 3.308855887142296e-05,
      "loss": 1.3718,
      "num_input_tokens_seen": 35211718752,
      "step": 44755
    },
    {
      "epoch": 4.748143433057501,
      "grad_norm": 0.5864920731169905,
      "learning_rate": 3.308790127928662e-05,
      "loss": 1.3456,
      "num_input_tokens_seen": 35212505504,
      "step": 44756
    },
    {
      "epoch": 4.748249522597072,
      "grad_norm": 0.5677418032016083,
      "learning_rate": 3.308724368090018e-05,
      "loss": 1.3958,
      "num_input_tokens_seen": 35213292256,
      "step": 44757
    },
    {
      "epoch": 4.748355612136644,
      "grad_norm": 0.7522652242435475,
      "learning_rate": 3.308658607626416e-05,
      "loss": 1.3307,
      "num_input_tokens_seen": 35214079040,
      "step": 44758
    },
    {
      "epoch": 4.748461701676215,
      "grad_norm": 0.6720990068560785,
      "learning_rate": 3.308592846537906e-05,
      "loss": 1.4398,
      "num_input_tokens_seen": 35214865760,
      "step": 44759
    },
    {
      "epoch": 4.748567791215786,
      "grad_norm": 0.6180441246499967,
      "learning_rate": 3.3085270848245395e-05,
      "loss": 1.2962,
      "num_input_tokens_seen": 35215652528,
      "step": 44760
    },
    {
      "epoch": 4.748673880755358,
      "grad_norm": 0.7687176823028788,
      "learning_rate": 3.308461322486367e-05,
      "loss": 1.4114,
      "num_input_tokens_seen": 35216439328,
      "step": 44761
    },
    {
      "epoch": 4.748779970294929,
      "grad_norm": 0.46159623528828986,
      "learning_rate": 3.3083955595234386e-05,
      "loss": 1.2043,
      "num_input_tokens_seen": 35217226176,
      "step": 44762
    },
    {
      "epoch": 4.748886059834501,
      "grad_norm": 0.6058925322128789,
      "learning_rate": 3.308329795935807e-05,
      "loss": 1.2905,
      "num_input_tokens_seen": 35218012992,
      "step": 44763
    },
    {
      "epoch": 4.748992149374072,
      "grad_norm": 0.47771297569078797,
      "learning_rate": 3.30826403172352e-05,
      "loss": 1.2623,
      "num_input_tokens_seen": 35218799808,
      "step": 44764
    },
    {
      "epoch": 4.749098238913643,
      "grad_norm": 0.5456245386760148,
      "learning_rate": 3.3081982668866326e-05,
      "loss": 1.362,
      "num_input_tokens_seen": 35219586480,
      "step": 44765
    },
    {
      "epoch": 4.749204328453215,
      "grad_norm": 0.5944214265720971,
      "learning_rate": 3.308132501425191e-05,
      "loss": 1.2459,
      "num_input_tokens_seen": 35220373344,
      "step": 44766
    },
    {
      "epoch": 4.749310417992786,
      "grad_norm": 0.7432547685684254,
      "learning_rate": 3.30806673533925e-05,
      "loss": 1.2966,
      "num_input_tokens_seen": 35221160176,
      "step": 44767
    },
    {
      "epoch": 4.749416507532358,
      "grad_norm": 0.629785583069945,
      "learning_rate": 3.3080009686288584e-05,
      "loss": 1.3549,
      "num_input_tokens_seen": 35221946976,
      "step": 44768
    },
    {
      "epoch": 4.749522597071929,
      "grad_norm": 0.7310215858894905,
      "learning_rate": 3.307935201294067e-05,
      "loss": 1.3997,
      "num_input_tokens_seen": 35222733680,
      "step": 44769
    },
    {
      "epoch": 4.7496286866115,
      "grad_norm": 0.5989937299624144,
      "learning_rate": 3.307869433334927e-05,
      "loss": 1.3114,
      "num_input_tokens_seen": 35223520432,
      "step": 44770
    },
    {
      "epoch": 4.7497347761510715,
      "grad_norm": 0.5794078699568138,
      "learning_rate": 3.30780366475149e-05,
      "loss": 1.2192,
      "num_input_tokens_seen": 35224307152,
      "step": 44771
    },
    {
      "epoch": 4.749840865690643,
      "grad_norm": 0.6671907459136287,
      "learning_rate": 3.307737895543804e-05,
      "loss": 1.2186,
      "num_input_tokens_seen": 35225093952,
      "step": 44772
    },
    {
      "epoch": 4.7499469552302145,
      "grad_norm": 0.9495186508391382,
      "learning_rate": 3.3076721257119235e-05,
      "loss": 1.1968,
      "num_input_tokens_seen": 35225880752,
      "step": 44773
    },
    {
      "epoch": 4.7500530447697855,
      "grad_norm": 0.5415845321058093,
      "learning_rate": 3.307606355255898e-05,
      "loss": 1.3227,
      "num_input_tokens_seen": 35226667568,
      "step": 44774
    },
    {
      "epoch": 4.750159134309357,
      "grad_norm": 0.9859954430995451,
      "learning_rate": 3.3075405841757774e-05,
      "loss": 1.3367,
      "num_input_tokens_seen": 35227454352,
      "step": 44775
    },
    {
      "epoch": 4.7502652238489285,
      "grad_norm": 1.1440465156494064,
      "learning_rate": 3.307474812471613e-05,
      "loss": 1.373,
      "num_input_tokens_seen": 35228241120,
      "step": 44776
    },
    {
      "epoch": 4.7503713133885,
      "grad_norm": 0.6975171366079632,
      "learning_rate": 3.307409040143456e-05,
      "loss": 1.4188,
      "num_input_tokens_seen": 35229027904,
      "step": 44777
    },
    {
      "epoch": 4.750477402928071,
      "grad_norm": 0.7371215301260573,
      "learning_rate": 3.307343267191357e-05,
      "loss": 1.2321,
      "num_input_tokens_seen": 35229814672,
      "step": 44778
    },
    {
      "epoch": 4.750583492467642,
      "grad_norm": 0.749044009656639,
      "learning_rate": 3.307277493615367e-05,
      "loss": 1.2086,
      "num_input_tokens_seen": 35230601424,
      "step": 44779
    },
    {
      "epoch": 4.750689582007214,
      "grad_norm": 0.6440615466682044,
      "learning_rate": 3.307211719415536e-05,
      "loss": 1.344,
      "num_input_tokens_seen": 35231388080,
      "step": 44780
    },
    {
      "epoch": 4.750795671546785,
      "grad_norm": 0.7451643077302951,
      "learning_rate": 3.307145944591916e-05,
      "loss": 1.3022,
      "num_input_tokens_seen": 35232174816,
      "step": 44781
    },
    {
      "epoch": 4.750901761086357,
      "grad_norm": 1.0969611173692178,
      "learning_rate": 3.307080169144557e-05,
      "loss": 1.396,
      "num_input_tokens_seen": 35232961536,
      "step": 44782
    },
    {
      "epoch": 4.751007850625928,
      "grad_norm": 0.5837369423882864,
      "learning_rate": 3.30701439307351e-05,
      "loss": 1.391,
      "num_input_tokens_seen": 35233748336,
      "step": 44783
    },
    {
      "epoch": 4.751113940165499,
      "grad_norm": 0.7084709932979906,
      "learning_rate": 3.306948616378826e-05,
      "loss": 1.3093,
      "num_input_tokens_seen": 35234535040,
      "step": 44784
    },
    {
      "epoch": 4.751220029705071,
      "grad_norm": 0.6586904090826945,
      "learning_rate": 3.306882839060556e-05,
      "loss": 1.4152,
      "num_input_tokens_seen": 35235321776,
      "step": 44785
    },
    {
      "epoch": 4.751326119244642,
      "grad_norm": 0.6952028919918753,
      "learning_rate": 3.306817061118751e-05,
      "loss": 1.3968,
      "num_input_tokens_seen": 35236108608,
      "step": 44786
    },
    {
      "epoch": 4.751432208784214,
      "grad_norm": 0.5852845945937799,
      "learning_rate": 3.306751282553461e-05,
      "loss": 1.377,
      "num_input_tokens_seen": 35236895408,
      "step": 44787
    },
    {
      "epoch": 4.751538298323785,
      "grad_norm": 0.6264903864744145,
      "learning_rate": 3.3066855033647364e-05,
      "loss": 1.3521,
      "num_input_tokens_seen": 35237682128,
      "step": 44788
    },
    {
      "epoch": 4.751644387863356,
      "grad_norm": 0.6289800371803015,
      "learning_rate": 3.3066197235526304e-05,
      "loss": 1.2822,
      "num_input_tokens_seen": 35238468912,
      "step": 44789
    },
    {
      "epoch": 4.751750477402928,
      "grad_norm": 0.5461573325444576,
      "learning_rate": 3.306553943117191e-05,
      "loss": 1.3991,
      "num_input_tokens_seen": 35239255680,
      "step": 44790
    },
    {
      "epoch": 4.751856566942499,
      "grad_norm": 0.562965708736171,
      "learning_rate": 3.306488162058472e-05,
      "loss": 1.4838,
      "num_input_tokens_seen": 35240042448,
      "step": 44791
    },
    {
      "epoch": 4.751962656482071,
      "grad_norm": 0.5238192488147932,
      "learning_rate": 3.306422380376521e-05,
      "loss": 1.2613,
      "num_input_tokens_seen": 35240829136,
      "step": 44792
    },
    {
      "epoch": 4.752068746021642,
      "grad_norm": 0.518806498463109,
      "learning_rate": 3.3063565980713914e-05,
      "loss": 1.3222,
      "num_input_tokens_seen": 35241615824,
      "step": 44793
    },
    {
      "epoch": 4.752174835561213,
      "grad_norm": 0.5006546167882947,
      "learning_rate": 3.3062908151431324e-05,
      "loss": 1.3039,
      "num_input_tokens_seen": 35242402640,
      "step": 44794
    },
    {
      "epoch": 4.752280925100785,
      "grad_norm": 0.5729504434259953,
      "learning_rate": 3.3062250315917967e-05,
      "loss": 1.2779,
      "num_input_tokens_seen": 35243189504,
      "step": 44795
    },
    {
      "epoch": 4.752387014640356,
      "grad_norm": 0.6153245215536198,
      "learning_rate": 3.306159247417433e-05,
      "loss": 1.265,
      "num_input_tokens_seen": 35243976320,
      "step": 44796
    },
    {
      "epoch": 4.752493104179928,
      "grad_norm": 0.5653708892966969,
      "learning_rate": 3.3060934626200935e-05,
      "loss": 1.2656,
      "num_input_tokens_seen": 35244763200,
      "step": 44797
    },
    {
      "epoch": 4.752599193719499,
      "grad_norm": 0.5980512926680016,
      "learning_rate": 3.3060276771998276e-05,
      "loss": 1.3456,
      "num_input_tokens_seen": 35245550064,
      "step": 44798
    },
    {
      "epoch": 4.75270528325907,
      "grad_norm": 0.6217821048342398,
      "learning_rate": 3.3059618911566883e-05,
      "loss": 1.3774,
      "num_input_tokens_seen": 35246336816,
      "step": 44799
    },
    {
      "epoch": 4.752811372798642,
      "grad_norm": 0.5908044659307172,
      "learning_rate": 3.305896104490726e-05,
      "loss": 1.3088,
      "num_input_tokens_seen": 35247123552,
      "step": 44800
    },
    {
      "epoch": 4.752917462338213,
      "grad_norm": 0.5728355622163345,
      "learning_rate": 3.3058303172019886e-05,
      "loss": 1.3683,
      "num_input_tokens_seen": 35247910240,
      "step": 44801
    },
    {
      "epoch": 4.753023551877785,
      "grad_norm": 0.5705728854406121,
      "learning_rate": 3.305764529290531e-05,
      "loss": 1.2623,
      "num_input_tokens_seen": 35248697040,
      "step": 44802
    },
    {
      "epoch": 4.753129641417356,
      "grad_norm": 0.56161071929112,
      "learning_rate": 3.305698740756402e-05,
      "loss": 1.3357,
      "num_input_tokens_seen": 35249483808,
      "step": 44803
    },
    {
      "epoch": 4.753235730956928,
      "grad_norm": 0.5526770559599897,
      "learning_rate": 3.3056329515996523e-05,
      "loss": 1.3253,
      "num_input_tokens_seen": 35250270592,
      "step": 44804
    },
    {
      "epoch": 4.753341820496499,
      "grad_norm": 0.5471416166510061,
      "learning_rate": 3.305567161820333e-05,
      "loss": 1.3197,
      "num_input_tokens_seen": 35251057232,
      "step": 44805
    },
    {
      "epoch": 4.753447910036071,
      "grad_norm": 0.49892111188824967,
      "learning_rate": 3.3055013714184954e-05,
      "loss": 1.2368,
      "num_input_tokens_seen": 35251844016,
      "step": 44806
    },
    {
      "epoch": 4.753553999575642,
      "grad_norm": 0.5615561655867679,
      "learning_rate": 3.305435580394189e-05,
      "loss": 1.3027,
      "num_input_tokens_seen": 35252630688,
      "step": 44807
    },
    {
      "epoch": 4.753660089115213,
      "grad_norm": 0.4523858646632017,
      "learning_rate": 3.305369788747467e-05,
      "loss": 1.2787,
      "num_input_tokens_seen": 35253417456,
      "step": 44808
    },
    {
      "epoch": 4.753766178654785,
      "grad_norm": 0.6433892206457431,
      "learning_rate": 3.305303996478377e-05,
      "loss": 1.4273,
      "num_input_tokens_seen": 35254204176,
      "step": 44809
    },
    {
      "epoch": 4.753872268194356,
      "grad_norm": 0.48466553434828125,
      "learning_rate": 3.305238203586973e-05,
      "loss": 1.2384,
      "num_input_tokens_seen": 35254990992,
      "step": 44810
    },
    {
      "epoch": 4.753978357733928,
      "grad_norm": 0.6357255542511485,
      "learning_rate": 3.305172410073305e-05,
      "loss": 1.3203,
      "num_input_tokens_seen": 35255777824,
      "step": 44811
    },
    {
      "epoch": 4.754084447273499,
      "grad_norm": 0.6116044449421576,
      "learning_rate": 3.305106615937422e-05,
      "loss": 1.3788,
      "num_input_tokens_seen": 35256564560,
      "step": 44812
    },
    {
      "epoch": 4.75419053681307,
      "grad_norm": 0.6071287693112036,
      "learning_rate": 3.305040821179378e-05,
      "loss": 1.2268,
      "num_input_tokens_seen": 35257351312,
      "step": 44813
    },
    {
      "epoch": 4.754296626352642,
      "grad_norm": 0.5291275233198317,
      "learning_rate": 3.3049750257992215e-05,
      "loss": 1.2132,
      "num_input_tokens_seen": 35258138128,
      "step": 44814
    },
    {
      "epoch": 4.754402715892213,
      "grad_norm": 0.48103774854538284,
      "learning_rate": 3.304909229797003e-05,
      "loss": 1.2565,
      "num_input_tokens_seen": 35258924992,
      "step": 44815
    },
    {
      "epoch": 4.754508805431785,
      "grad_norm": 0.7607717701562707,
      "learning_rate": 3.304843433172775e-05,
      "loss": 1.3161,
      "num_input_tokens_seen": 35259711712,
      "step": 44816
    },
    {
      "epoch": 4.754614894971356,
      "grad_norm": 0.5152693559249141,
      "learning_rate": 3.3047776359265874e-05,
      "loss": 1.2255,
      "num_input_tokens_seen": 35260498496,
      "step": 44817
    },
    {
      "epoch": 4.754720984510927,
      "grad_norm": 0.8380924521208555,
      "learning_rate": 3.304711838058491e-05,
      "loss": 1.2425,
      "num_input_tokens_seen": 35261285312,
      "step": 44818
    },
    {
      "epoch": 4.754827074050499,
      "grad_norm": 0.5799070847023273,
      "learning_rate": 3.3046460395685377e-05,
      "loss": 1.2934,
      "num_input_tokens_seen": 35262072032,
      "step": 44819
    },
    {
      "epoch": 4.75493316359007,
      "grad_norm": 0.6392858379018939,
      "learning_rate": 3.3045802404567764e-05,
      "loss": 1.2727,
      "num_input_tokens_seen": 35262858832,
      "step": 44820
    },
    {
      "epoch": 4.755039253129642,
      "grad_norm": 0.5783187746193695,
      "learning_rate": 3.30451444072326e-05,
      "loss": 1.2662,
      "num_input_tokens_seen": 35263645568,
      "step": 44821
    },
    {
      "epoch": 4.755145342669213,
      "grad_norm": 0.5123228553694201,
      "learning_rate": 3.304448640368038e-05,
      "loss": 1.3569,
      "num_input_tokens_seen": 35264432288,
      "step": 44822
    },
    {
      "epoch": 4.755251432208784,
      "grad_norm": 0.5468159706149205,
      "learning_rate": 3.304382839391162e-05,
      "loss": 1.3916,
      "num_input_tokens_seen": 35265219072,
      "step": 44823
    },
    {
      "epoch": 4.755357521748356,
      "grad_norm": 0.5291069504347109,
      "learning_rate": 3.304317037792682e-05,
      "loss": 1.2514,
      "num_input_tokens_seen": 35266005856,
      "step": 44824
    },
    {
      "epoch": 4.755463611287927,
      "grad_norm": 0.5641009351388935,
      "learning_rate": 3.30425123557265e-05,
      "loss": 1.3894,
      "num_input_tokens_seen": 35266792560,
      "step": 44825
    },
    {
      "epoch": 4.755569700827499,
      "grad_norm": 0.5041880137885152,
      "learning_rate": 3.304185432731116e-05,
      "loss": 1.2329,
      "num_input_tokens_seen": 35267579280,
      "step": 44826
    },
    {
      "epoch": 4.75567579036707,
      "grad_norm": 0.4830392536124033,
      "learning_rate": 3.304119629268131e-05,
      "loss": 1.2919,
      "num_input_tokens_seen": 35268366032,
      "step": 44827
    },
    {
      "epoch": 4.755781879906642,
      "grad_norm": 0.5064380710193653,
      "learning_rate": 3.304053825183746e-05,
      "loss": 1.2676,
      "num_input_tokens_seen": 35269152880,
      "step": 44828
    },
    {
      "epoch": 4.755887969446213,
      "grad_norm": 0.5375052356251921,
      "learning_rate": 3.3039880204780116e-05,
      "loss": 1.2687,
      "num_input_tokens_seen": 35269939616,
      "step": 44829
    },
    {
      "epoch": 4.755994058985784,
      "grad_norm": 0.548889584187753,
      "learning_rate": 3.3039222151509794e-05,
      "loss": 1.3067,
      "num_input_tokens_seen": 35270726496,
      "step": 44830
    },
    {
      "epoch": 4.756100148525356,
      "grad_norm": 0.7590168660497916,
      "learning_rate": 3.3038564092027e-05,
      "loss": 1.3527,
      "num_input_tokens_seen": 35271513232,
      "step": 44831
    },
    {
      "epoch": 4.756206238064927,
      "grad_norm": 0.7041419361356382,
      "learning_rate": 3.303790602633223e-05,
      "loss": 1.3372,
      "num_input_tokens_seen": 35272299952,
      "step": 44832
    },
    {
      "epoch": 4.7563123276044985,
      "grad_norm": 0.8537320973842396,
      "learning_rate": 3.303724795442601e-05,
      "loss": 1.2828,
      "num_input_tokens_seen": 35273086720,
      "step": 44833
    },
    {
      "epoch": 4.7564184171440695,
      "grad_norm": 0.6745315192904403,
      "learning_rate": 3.303658987630883e-05,
      "loss": 1.2852,
      "num_input_tokens_seen": 35273873504,
      "step": 44834
    },
    {
      "epoch": 4.7565245066836415,
      "grad_norm": 0.5449507055934126,
      "learning_rate": 3.303593179198121e-05,
      "loss": 1.322,
      "num_input_tokens_seen": 35274660256,
      "step": 44835
    },
    {
      "epoch": 4.7566305962232125,
      "grad_norm": 0.6365827952231419,
      "learning_rate": 3.303527370144366e-05,
      "loss": 1.3733,
      "num_input_tokens_seen": 35275446976,
      "step": 44836
    },
    {
      "epoch": 4.7567366857627835,
      "grad_norm": 0.6437384482758206,
      "learning_rate": 3.30346156046967e-05,
      "loss": 1.2309,
      "num_input_tokens_seen": 35276233712,
      "step": 44837
    },
    {
      "epoch": 4.756842775302355,
      "grad_norm": 0.5702125562982427,
      "learning_rate": 3.303395750174081e-05,
      "loss": 1.2571,
      "num_input_tokens_seen": 35277020496,
      "step": 44838
    },
    {
      "epoch": 4.7569488648419265,
      "grad_norm": 0.6626142660731626,
      "learning_rate": 3.303329939257652e-05,
      "loss": 1.2459,
      "num_input_tokens_seen": 35277807312,
      "step": 44839
    },
    {
      "epoch": 4.757054954381498,
      "grad_norm": 0.5959243230335295,
      "learning_rate": 3.303264127720433e-05,
      "loss": 1.3031,
      "num_input_tokens_seen": 35278594080,
      "step": 44840
    },
    {
      "epoch": 4.757161043921069,
      "grad_norm": 0.5731853789920393,
      "learning_rate": 3.3031983155624745e-05,
      "loss": 1.3552,
      "num_input_tokens_seen": 35279380800,
      "step": 44841
    },
    {
      "epoch": 4.7572671334606405,
      "grad_norm": 0.7033761179013442,
      "learning_rate": 3.303132502783829e-05,
      "loss": 1.3393,
      "num_input_tokens_seen": 35280167568,
      "step": 44842
    },
    {
      "epoch": 4.757373223000212,
      "grad_norm": 0.5904212475276023,
      "learning_rate": 3.303066689384546e-05,
      "loss": 1.3337,
      "num_input_tokens_seen": 35280954464,
      "step": 44843
    },
    {
      "epoch": 4.757479312539783,
      "grad_norm": 0.679723898052252,
      "learning_rate": 3.3030008753646754e-05,
      "loss": 1.4002,
      "num_input_tokens_seen": 35281741184,
      "step": 44844
    },
    {
      "epoch": 4.757585402079355,
      "grad_norm": 0.6424518768845686,
      "learning_rate": 3.3029350607242706e-05,
      "loss": 1.4407,
      "num_input_tokens_seen": 35282527936,
      "step": 44845
    },
    {
      "epoch": 4.757691491618926,
      "grad_norm": 0.6024590988589521,
      "learning_rate": 3.302869245463381e-05,
      "loss": 1.3833,
      "num_input_tokens_seen": 35283314688,
      "step": 44846
    },
    {
      "epoch": 4.757797581158497,
      "grad_norm": 0.5140102743747024,
      "learning_rate": 3.302803429582057e-05,
      "loss": 1.3188,
      "num_input_tokens_seen": 35284101456,
      "step": 44847
    },
    {
      "epoch": 4.757903670698069,
      "grad_norm": 0.6128212777267265,
      "learning_rate": 3.3027376130803506e-05,
      "loss": 1.3925,
      "num_input_tokens_seen": 35284888240,
      "step": 44848
    },
    {
      "epoch": 4.75800976023764,
      "grad_norm": 0.5533058857615542,
      "learning_rate": 3.302671795958312e-05,
      "loss": 1.294,
      "num_input_tokens_seen": 35285675024,
      "step": 44849
    },
    {
      "epoch": 4.758115849777212,
      "grad_norm": 0.6239567515948167,
      "learning_rate": 3.302605978215992e-05,
      "loss": 1.3679,
      "num_input_tokens_seen": 35286461712,
      "step": 44850
    },
    {
      "epoch": 4.758221939316783,
      "grad_norm": 0.5187939472500309,
      "learning_rate": 3.302540159853442e-05,
      "loss": 1.2864,
      "num_input_tokens_seen": 35287248592,
      "step": 44851
    },
    {
      "epoch": 4.758328028856354,
      "grad_norm": 0.5599608137992736,
      "learning_rate": 3.302474340870711e-05,
      "loss": 1.2813,
      "num_input_tokens_seen": 35288035328,
      "step": 44852
    },
    {
      "epoch": 4.758434118395926,
      "grad_norm": 0.5049310209370249,
      "learning_rate": 3.3024085212678535e-05,
      "loss": 1.2053,
      "num_input_tokens_seen": 35288822128,
      "step": 44853
    },
    {
      "epoch": 4.758540207935497,
      "grad_norm": 0.5798841486979379,
      "learning_rate": 3.3023427010449175e-05,
      "loss": 1.2412,
      "num_input_tokens_seen": 35289608880,
      "step": 44854
    },
    {
      "epoch": 4.758646297475069,
      "grad_norm": 0.4878723031711252,
      "learning_rate": 3.302276880201954e-05,
      "loss": 1.2902,
      "num_input_tokens_seen": 35290395600,
      "step": 44855
    },
    {
      "epoch": 4.75875238701464,
      "grad_norm": 0.7033265577376806,
      "learning_rate": 3.302211058739015e-05,
      "loss": 1.3476,
      "num_input_tokens_seen": 35291182320,
      "step": 44856
    },
    {
      "epoch": 4.758858476554212,
      "grad_norm": 0.6350101567275328,
      "learning_rate": 3.3021452366561515e-05,
      "loss": 1.3921,
      "num_input_tokens_seen": 35291969024,
      "step": 44857
    },
    {
      "epoch": 4.758964566093783,
      "grad_norm": 0.5809717277908646,
      "learning_rate": 3.302079413953413e-05,
      "loss": 1.3271,
      "num_input_tokens_seen": 35292755776,
      "step": 44858
    },
    {
      "epoch": 4.759070655633354,
      "grad_norm": 0.6320269194770191,
      "learning_rate": 3.302013590630851e-05,
      "loss": 1.2827,
      "num_input_tokens_seen": 35293542512,
      "step": 44859
    },
    {
      "epoch": 4.759176745172926,
      "grad_norm": 0.6011950930594001,
      "learning_rate": 3.301947766688517e-05,
      "loss": 1.3945,
      "num_input_tokens_seen": 35294329200,
      "step": 44860
    },
    {
      "epoch": 4.759282834712497,
      "grad_norm": 0.617306378945807,
      "learning_rate": 3.30188194212646e-05,
      "loss": 1.2367,
      "num_input_tokens_seen": 35295115952,
      "step": 44861
    },
    {
      "epoch": 4.759388924252069,
      "grad_norm": 0.6275345911171012,
      "learning_rate": 3.301816116944733e-05,
      "loss": 1.4674,
      "num_input_tokens_seen": 35295902592,
      "step": 44862
    },
    {
      "epoch": 4.75949501379164,
      "grad_norm": 0.5116823463902229,
      "learning_rate": 3.3017502911433864e-05,
      "loss": 1.2821,
      "num_input_tokens_seen": 35296689344,
      "step": 44863
    },
    {
      "epoch": 4.759601103331212,
      "grad_norm": 0.5187535096147037,
      "learning_rate": 3.30168446472247e-05,
      "loss": 1.3565,
      "num_input_tokens_seen": 35297476000,
      "step": 44864
    },
    {
      "epoch": 4.759707192870783,
      "grad_norm": 0.5304314891785633,
      "learning_rate": 3.301618637682036e-05,
      "loss": 1.3628,
      "num_input_tokens_seen": 35298262832,
      "step": 44865
    },
    {
      "epoch": 4.759813282410354,
      "grad_norm": 0.5478930258006793,
      "learning_rate": 3.3015528100221344e-05,
      "loss": 1.2982,
      "num_input_tokens_seen": 35299049616,
      "step": 44866
    },
    {
      "epoch": 4.759919371949926,
      "grad_norm": 0.6313565571352537,
      "learning_rate": 3.301486981742816e-05,
      "loss": 1.3901,
      "num_input_tokens_seen": 35299836176,
      "step": 44867
    },
    {
      "epoch": 4.760025461489497,
      "grad_norm": 0.4724411682657879,
      "learning_rate": 3.301421152844132e-05,
      "loss": 1.2183,
      "num_input_tokens_seen": 35300622912,
      "step": 44868
    },
    {
      "epoch": 4.760131551029069,
      "grad_norm": 0.616531925488556,
      "learning_rate": 3.301355323326133e-05,
      "loss": 1.2198,
      "num_input_tokens_seen": 35301409712,
      "step": 44869
    },
    {
      "epoch": 4.76023764056864,
      "grad_norm": 0.4778915622593747,
      "learning_rate": 3.301289493188871e-05,
      "loss": 1.2902,
      "num_input_tokens_seen": 35302196384,
      "step": 44870
    },
    {
      "epoch": 4.760343730108211,
      "grad_norm": 0.521992890532418,
      "learning_rate": 3.301223662432396e-05,
      "loss": 1.3222,
      "num_input_tokens_seen": 35302983136,
      "step": 44871
    },
    {
      "epoch": 4.760449819647783,
      "grad_norm": 0.4983944780057714,
      "learning_rate": 3.301157831056758e-05,
      "loss": 1.2635,
      "num_input_tokens_seen": 35303769952,
      "step": 44872
    },
    {
      "epoch": 4.760555909187354,
      "grad_norm": 0.5400815862375026,
      "learning_rate": 3.3010919990620093e-05,
      "loss": 1.3034,
      "num_input_tokens_seen": 35304556720,
      "step": 44873
    },
    {
      "epoch": 4.760661998726926,
      "grad_norm": 0.5198888627337123,
      "learning_rate": 3.3010261664482004e-05,
      "loss": 1.2473,
      "num_input_tokens_seen": 35305343456,
      "step": 44874
    },
    {
      "epoch": 4.760768088266497,
      "grad_norm": 0.5215250846350835,
      "learning_rate": 3.300960333215381e-05,
      "loss": 1.3328,
      "num_input_tokens_seen": 35306130128,
      "step": 44875
    },
    {
      "epoch": 4.760874177806068,
      "grad_norm": 0.5105822601383253,
      "learning_rate": 3.3008944993636036e-05,
      "loss": 1.2633,
      "num_input_tokens_seen": 35306916896,
      "step": 44876
    },
    {
      "epoch": 4.76098026734564,
      "grad_norm": 0.5349440608530488,
      "learning_rate": 3.300828664892919e-05,
      "loss": 1.2792,
      "num_input_tokens_seen": 35307703680,
      "step": 44877
    },
    {
      "epoch": 4.761086356885211,
      "grad_norm": 0.6160557389363407,
      "learning_rate": 3.300762829803376e-05,
      "loss": 1.387,
      "num_input_tokens_seen": 35308490464,
      "step": 44878
    },
    {
      "epoch": 4.761192446424783,
      "grad_norm": 0.5668127829033475,
      "learning_rate": 3.3006969940950286e-05,
      "loss": 1.3221,
      "num_input_tokens_seen": 35309277216,
      "step": 44879
    },
    {
      "epoch": 4.761298535964354,
      "grad_norm": 0.5254064434342499,
      "learning_rate": 3.300631157767925e-05,
      "loss": 1.3075,
      "num_input_tokens_seen": 35310064048,
      "step": 44880
    },
    {
      "epoch": 4.761404625503925,
      "grad_norm": 0.5050782595276148,
      "learning_rate": 3.3005653208221176e-05,
      "loss": 1.3323,
      "num_input_tokens_seen": 35310850832,
      "step": 44881
    },
    {
      "epoch": 4.761510715043497,
      "grad_norm": 0.5138289586473972,
      "learning_rate": 3.3004994832576565e-05,
      "loss": 1.3422,
      "num_input_tokens_seen": 35311637568,
      "step": 44882
    },
    {
      "epoch": 4.761616804583068,
      "grad_norm": 0.49595710554335337,
      "learning_rate": 3.300433645074593e-05,
      "loss": 1.2596,
      "num_input_tokens_seen": 35312424320,
      "step": 44883
    },
    {
      "epoch": 4.76172289412264,
      "grad_norm": 0.49461226875925735,
      "learning_rate": 3.300367806272977e-05,
      "loss": 1.3124,
      "num_input_tokens_seen": 35313211008,
      "step": 44884
    },
    {
      "epoch": 4.761828983662211,
      "grad_norm": 0.5109505964056685,
      "learning_rate": 3.3003019668528615e-05,
      "loss": 1.2605,
      "num_input_tokens_seen": 35313997792,
      "step": 44885
    },
    {
      "epoch": 4.761935073201783,
      "grad_norm": 0.5405156978269378,
      "learning_rate": 3.3002361268142965e-05,
      "loss": 1.2334,
      "num_input_tokens_seen": 35314784560,
      "step": 44886
    },
    {
      "epoch": 4.762041162741354,
      "grad_norm": 0.564615530662295,
      "learning_rate": 3.3001702861573316e-05,
      "loss": 1.3758,
      "num_input_tokens_seen": 35315571376,
      "step": 44887
    },
    {
      "epoch": 4.762147252280925,
      "grad_norm": 0.5904849342190757,
      "learning_rate": 3.300104444882019e-05,
      "loss": 1.4046,
      "num_input_tokens_seen": 35316358032,
      "step": 44888
    },
    {
      "epoch": 4.762253341820497,
      "grad_norm": 0.48277087113255834,
      "learning_rate": 3.3000386029884086e-05,
      "loss": 1.292,
      "num_input_tokens_seen": 35317144784,
      "step": 44889
    },
    {
      "epoch": 4.762359431360068,
      "grad_norm": 0.6147691520512615,
      "learning_rate": 3.299972760476552e-05,
      "loss": 1.2604,
      "num_input_tokens_seen": 35317931568,
      "step": 44890
    },
    {
      "epoch": 4.76246552089964,
      "grad_norm": 0.5364387326575398,
      "learning_rate": 3.2999069173465005e-05,
      "loss": 1.3264,
      "num_input_tokens_seen": 35318718336,
      "step": 44891
    },
    {
      "epoch": 4.762571610439211,
      "grad_norm": 0.5236804267525463,
      "learning_rate": 3.2998410735983045e-05,
      "loss": 1.3051,
      "num_input_tokens_seen": 35319505040,
      "step": 44892
    },
    {
      "epoch": 4.7626776999787825,
      "grad_norm": 0.5328719847697052,
      "learning_rate": 3.2997752292320137e-05,
      "loss": 1.2423,
      "num_input_tokens_seen": 35320291840,
      "step": 44893
    },
    {
      "epoch": 4.762783789518354,
      "grad_norm": 0.557930301418909,
      "learning_rate": 3.2997093842476815e-05,
      "loss": 1.4635,
      "num_input_tokens_seen": 35321078576,
      "step": 44894
    },
    {
      "epoch": 4.762889879057925,
      "grad_norm": 0.5533347558559921,
      "learning_rate": 3.2996435386453555e-05,
      "loss": 1.2602,
      "num_input_tokens_seen": 35321865264,
      "step": 44895
    },
    {
      "epoch": 4.7629959685974965,
      "grad_norm": 0.551833295114701,
      "learning_rate": 3.29957769242509e-05,
      "loss": 1.1997,
      "num_input_tokens_seen": 35322652096,
      "step": 44896
    },
    {
      "epoch": 4.7631020581370676,
      "grad_norm": 0.5163551956195868,
      "learning_rate": 3.299511845586934e-05,
      "loss": 1.2058,
      "num_input_tokens_seen": 35323438896,
      "step": 44897
    },
    {
      "epoch": 4.7632081476766395,
      "grad_norm": 0.5350299695228204,
      "learning_rate": 3.299445998130938e-05,
      "loss": 1.2749,
      "num_input_tokens_seen": 35324225632,
      "step": 44898
    },
    {
      "epoch": 4.7633142372162105,
      "grad_norm": 0.4989762126612622,
      "learning_rate": 3.299380150057154e-05,
      "loss": 1.3785,
      "num_input_tokens_seen": 35325012384,
      "step": 44899
    },
    {
      "epoch": 4.7634203267557815,
      "grad_norm": 0.5513438886386544,
      "learning_rate": 3.299314301365633e-05,
      "loss": 1.4428,
      "num_input_tokens_seen": 35325799184,
      "step": 44900
    },
    {
      "epoch": 4.7635264162953534,
      "grad_norm": 0.5278241083563769,
      "learning_rate": 3.2992484520564246e-05,
      "loss": 1.398,
      "num_input_tokens_seen": 35326585920,
      "step": 44901
    },
    {
      "epoch": 4.7636325058349245,
      "grad_norm": 0.5247297995229078,
      "learning_rate": 3.299182602129581e-05,
      "loss": 1.3498,
      "num_input_tokens_seen": 35327372672,
      "step": 44902
    },
    {
      "epoch": 4.763738595374496,
      "grad_norm": 0.5192261847058156,
      "learning_rate": 3.299116751585152e-05,
      "loss": 1.4223,
      "num_input_tokens_seen": 35328159408,
      "step": 44903
    },
    {
      "epoch": 4.763844684914067,
      "grad_norm": 0.4470013868502481,
      "learning_rate": 3.29905090042319e-05,
      "loss": 1.2698,
      "num_input_tokens_seen": 35328946256,
      "step": 44904
    },
    {
      "epoch": 4.7639507744536385,
      "grad_norm": 0.522692171667158,
      "learning_rate": 3.298985048643744e-05,
      "loss": 1.2862,
      "num_input_tokens_seen": 35329733040,
      "step": 44905
    },
    {
      "epoch": 4.76405686399321,
      "grad_norm": 0.4774917311198069,
      "learning_rate": 3.298919196246866e-05,
      "loss": 1.2172,
      "num_input_tokens_seen": 35330519808,
      "step": 44906
    },
    {
      "epoch": 4.764162953532781,
      "grad_norm": 0.5133288212790252,
      "learning_rate": 3.2988533432326065e-05,
      "loss": 1.3489,
      "num_input_tokens_seen": 35331306544,
      "step": 44907
    },
    {
      "epoch": 4.764269043072353,
      "grad_norm": 0.534059472940917,
      "learning_rate": 3.2987874896010166e-05,
      "loss": 1.401,
      "num_input_tokens_seen": 35332093424,
      "step": 44908
    },
    {
      "epoch": 4.764375132611924,
      "grad_norm": 0.4953798760968194,
      "learning_rate": 3.298721635352148e-05,
      "loss": 1.1948,
      "num_input_tokens_seen": 35332880256,
      "step": 44909
    },
    {
      "epoch": 4.764481222151495,
      "grad_norm": 0.5049419728665617,
      "learning_rate": 3.2986557804860494e-05,
      "loss": 1.3445,
      "num_input_tokens_seen": 35333666992,
      "step": 44910
    },
    {
      "epoch": 4.764587311691067,
      "grad_norm": 0.4818553316248868,
      "learning_rate": 3.2985899250027744e-05,
      "loss": 1.2885,
      "num_input_tokens_seen": 35334453744,
      "step": 44911
    },
    {
      "epoch": 4.764693401230638,
      "grad_norm": 0.5057950198736272,
      "learning_rate": 3.298524068902371e-05,
      "loss": 1.2259,
      "num_input_tokens_seen": 35335240528,
      "step": 44912
    },
    {
      "epoch": 4.76479949077021,
      "grad_norm": 0.5610097514297001,
      "learning_rate": 3.298458212184893e-05,
      "loss": 1.3066,
      "num_input_tokens_seen": 35336027280,
      "step": 44913
    },
    {
      "epoch": 4.764905580309781,
      "grad_norm": 0.5420458395311861,
      "learning_rate": 3.29839235485039e-05,
      "loss": 1.2828,
      "num_input_tokens_seen": 35336814112,
      "step": 44914
    },
    {
      "epoch": 4.765011669849353,
      "grad_norm": 0.5180050668907804,
      "learning_rate": 3.298326496898911e-05,
      "loss": 1.3143,
      "num_input_tokens_seen": 35337600848,
      "step": 44915
    },
    {
      "epoch": 4.765117759388924,
      "grad_norm": 0.6736441753648306,
      "learning_rate": 3.298260638330511e-05,
      "loss": 1.4048,
      "num_input_tokens_seen": 35338387600,
      "step": 44916
    },
    {
      "epoch": 4.765223848928495,
      "grad_norm": 0.4824703739854357,
      "learning_rate": 3.298194779145238e-05,
      "loss": 1.2372,
      "num_input_tokens_seen": 35339174496,
      "step": 44917
    },
    {
      "epoch": 4.765329938468067,
      "grad_norm": 0.5168927238037948,
      "learning_rate": 3.2981289193431424e-05,
      "loss": 1.3232,
      "num_input_tokens_seen": 35339961216,
      "step": 44918
    },
    {
      "epoch": 4.765436028007638,
      "grad_norm": 0.6126837797385623,
      "learning_rate": 3.2980630589242775e-05,
      "loss": 1.2264,
      "num_input_tokens_seen": 35340747952,
      "step": 44919
    },
    {
      "epoch": 4.76554211754721,
      "grad_norm": 0.5585425410657718,
      "learning_rate": 3.297997197888692e-05,
      "loss": 1.2885,
      "num_input_tokens_seen": 35341534784,
      "step": 44920
    },
    {
      "epoch": 4.765648207086781,
      "grad_norm": 0.8576931544848095,
      "learning_rate": 3.297931336236438e-05,
      "loss": 1.3167,
      "num_input_tokens_seen": 35342321568,
      "step": 44921
    },
    {
      "epoch": 4.765754296626353,
      "grad_norm": 0.6714633241160826,
      "learning_rate": 3.297865473967566e-05,
      "loss": 1.3119,
      "num_input_tokens_seen": 35343108352,
      "step": 44922
    },
    {
      "epoch": 4.765860386165924,
      "grad_norm": 0.5524320501809563,
      "learning_rate": 3.297799611082127e-05,
      "loss": 1.4157,
      "num_input_tokens_seen": 35343895056,
      "step": 44923
    },
    {
      "epoch": 4.765966475705495,
      "grad_norm": 0.8556816555826029,
      "learning_rate": 3.297733747580172e-05,
      "loss": 1.2862,
      "num_input_tokens_seen": 35344681872,
      "step": 44924
    },
    {
      "epoch": 4.766072565245067,
      "grad_norm": 0.5021267711574158,
      "learning_rate": 3.2976678834617516e-05,
      "loss": 1.3187,
      "num_input_tokens_seen": 35345468528,
      "step": 44925
    },
    {
      "epoch": 4.766178654784638,
      "grad_norm": 0.6306693916818776,
      "learning_rate": 3.297602018726917e-05,
      "loss": 1.3945,
      "num_input_tokens_seen": 35346255168,
      "step": 44926
    },
    {
      "epoch": 4.76628474432421,
      "grad_norm": 0.630850202018304,
      "learning_rate": 3.2975361533757184e-05,
      "loss": 1.2962,
      "num_input_tokens_seen": 35347041920,
      "step": 44927
    },
    {
      "epoch": 4.766390833863781,
      "grad_norm": 0.5219027790199027,
      "learning_rate": 3.297470287408208e-05,
      "loss": 1.2978,
      "num_input_tokens_seen": 35347828576,
      "step": 44928
    },
    {
      "epoch": 4.766496923403352,
      "grad_norm": 0.6498706951603137,
      "learning_rate": 3.297404420824435e-05,
      "loss": 1.3024,
      "num_input_tokens_seen": 35348615328,
      "step": 44929
    },
    {
      "epoch": 4.766603012942924,
      "grad_norm": 0.7112143262766081,
      "learning_rate": 3.297338553624452e-05,
      "loss": 1.2921,
      "num_input_tokens_seen": 35349402032,
      "step": 44930
    },
    {
      "epoch": 4.766709102482495,
      "grad_norm": 0.5221044925067605,
      "learning_rate": 3.297272685808309e-05,
      "loss": 1.3016,
      "num_input_tokens_seen": 35350188720,
      "step": 44931
    },
    {
      "epoch": 4.766815192022067,
      "grad_norm": 0.6562706060411749,
      "learning_rate": 3.297206817376057e-05,
      "loss": 1.2761,
      "num_input_tokens_seen": 35350975536,
      "step": 44932
    },
    {
      "epoch": 4.766921281561638,
      "grad_norm": 0.5473079882159088,
      "learning_rate": 3.297140948327747e-05,
      "loss": 1.2702,
      "num_input_tokens_seen": 35351762336,
      "step": 44933
    },
    {
      "epoch": 4.767027371101209,
      "grad_norm": 0.6531647027998728,
      "learning_rate": 3.2970750786634303e-05,
      "loss": 1.2695,
      "num_input_tokens_seen": 35352549168,
      "step": 44934
    },
    {
      "epoch": 4.767133460640781,
      "grad_norm": 0.6419824825026624,
      "learning_rate": 3.297009208383157e-05,
      "loss": 1.373,
      "num_input_tokens_seen": 35353335984,
      "step": 44935
    },
    {
      "epoch": 4.767239550180352,
      "grad_norm": 0.5790140483193356,
      "learning_rate": 3.2969433374869786e-05,
      "loss": 1.3156,
      "num_input_tokens_seen": 35354122832,
      "step": 44936
    },
    {
      "epoch": 4.767345639719924,
      "grad_norm": 0.6137433369471039,
      "learning_rate": 3.296877465974946e-05,
      "loss": 1.3671,
      "num_input_tokens_seen": 35354909600,
      "step": 44937
    },
    {
      "epoch": 4.767451729259495,
      "grad_norm": 0.514045509857526,
      "learning_rate": 3.296811593847109e-05,
      "loss": 1.1864,
      "num_input_tokens_seen": 35355696400,
      "step": 44938
    },
    {
      "epoch": 4.767557818799066,
      "grad_norm": 0.635233128614788,
      "learning_rate": 3.29674572110352e-05,
      "loss": 1.3474,
      "num_input_tokens_seen": 35356483248,
      "step": 44939
    },
    {
      "epoch": 4.767663908338638,
      "grad_norm": 0.5213193120391831,
      "learning_rate": 3.296679847744229e-05,
      "loss": 1.303,
      "num_input_tokens_seen": 35357269984,
      "step": 44940
    },
    {
      "epoch": 4.767769997878209,
      "grad_norm": 0.6767968087907651,
      "learning_rate": 3.296613973769287e-05,
      "loss": 1.2285,
      "num_input_tokens_seen": 35358056752,
      "step": 44941
    },
    {
      "epoch": 4.767876087417781,
      "grad_norm": 0.5319608100070696,
      "learning_rate": 3.2965480991787456e-05,
      "loss": 1.2787,
      "num_input_tokens_seen": 35358843488,
      "step": 44942
    },
    {
      "epoch": 4.767982176957352,
      "grad_norm": 0.6141603151484913,
      "learning_rate": 3.296482223972655e-05,
      "loss": 1.3552,
      "num_input_tokens_seen": 35359630272,
      "step": 44943
    },
    {
      "epoch": 4.768088266496924,
      "grad_norm": 0.6214185136110926,
      "learning_rate": 3.296416348151066e-05,
      "loss": 1.1603,
      "num_input_tokens_seen": 35360417072,
      "step": 44944
    },
    {
      "epoch": 4.768194356036495,
      "grad_norm": 0.5112525466113853,
      "learning_rate": 3.2963504717140304e-05,
      "loss": 1.2836,
      "num_input_tokens_seen": 35361203808,
      "step": 44945
    },
    {
      "epoch": 4.768300445576067,
      "grad_norm": 0.6800346008585588,
      "learning_rate": 3.296284594661598e-05,
      "loss": 1.3459,
      "num_input_tokens_seen": 35361990512,
      "step": 44946
    },
    {
      "epoch": 4.768406535115638,
      "grad_norm": 0.576803236719072,
      "learning_rate": 3.2962187169938206e-05,
      "loss": 1.3159,
      "num_input_tokens_seen": 35362777312,
      "step": 44947
    },
    {
      "epoch": 4.768512624655209,
      "grad_norm": 0.811070165915716,
      "learning_rate": 3.296152838710749e-05,
      "loss": 1.2805,
      "num_input_tokens_seen": 35363564112,
      "step": 44948
    },
    {
      "epoch": 4.768618714194781,
      "grad_norm": 0.9682944612259323,
      "learning_rate": 3.296086959812433e-05,
      "loss": 1.3812,
      "num_input_tokens_seen": 35364350816,
      "step": 44949
    },
    {
      "epoch": 4.768724803734352,
      "grad_norm": 0.5935862315471281,
      "learning_rate": 3.296021080298925e-05,
      "loss": 1.3355,
      "num_input_tokens_seen": 35365137488,
      "step": 44950
    },
    {
      "epoch": 4.768830893273924,
      "grad_norm": 1.1942296067213012,
      "learning_rate": 3.295955200170275e-05,
      "loss": 1.3137,
      "num_input_tokens_seen": 35365924240,
      "step": 44951
    },
    {
      "epoch": 4.768936982813495,
      "grad_norm": 0.6246661214459678,
      "learning_rate": 3.295889319426535e-05,
      "loss": 1.2828,
      "num_input_tokens_seen": 35366710976,
      "step": 44952
    },
    {
      "epoch": 4.769043072353066,
      "grad_norm": 0.5393329256736898,
      "learning_rate": 3.295823438067754e-05,
      "loss": 1.279,
      "num_input_tokens_seen": 35367497744,
      "step": 44953
    },
    {
      "epoch": 4.769149161892638,
      "grad_norm": 0.874969094106182,
      "learning_rate": 3.295757556093985e-05,
      "loss": 1.3135,
      "num_input_tokens_seen": 35368284560,
      "step": 44954
    },
    {
      "epoch": 4.769255251432209,
      "grad_norm": 0.6952086179373531,
      "learning_rate": 3.295691673505276e-05,
      "loss": 1.3242,
      "num_input_tokens_seen": 35369071344,
      "step": 44955
    },
    {
      "epoch": 4.7693613409717805,
      "grad_norm": 0.7152593954982135,
      "learning_rate": 3.295625790301682e-05,
      "loss": 1.2265,
      "num_input_tokens_seen": 35369858208,
      "step": 44956
    },
    {
      "epoch": 4.769467430511352,
      "grad_norm": 0.744846946592983,
      "learning_rate": 3.29555990648325e-05,
      "loss": 1.4005,
      "num_input_tokens_seen": 35370644864,
      "step": 44957
    },
    {
      "epoch": 4.769573520050923,
      "grad_norm": 0.625136297194527,
      "learning_rate": 3.2954940220500336e-05,
      "loss": 1.2973,
      "num_input_tokens_seen": 35371431616,
      "step": 44958
    },
    {
      "epoch": 4.7696796095904945,
      "grad_norm": 0.8334886439107548,
      "learning_rate": 3.2954281370020826e-05,
      "loss": 1.2879,
      "num_input_tokens_seen": 35372218352,
      "step": 44959
    },
    {
      "epoch": 4.769785699130066,
      "grad_norm": 0.5243957000477656,
      "learning_rate": 3.295362251339449e-05,
      "loss": 1.2849,
      "num_input_tokens_seen": 35373005120,
      "step": 44960
    },
    {
      "epoch": 4.7698917886696375,
      "grad_norm": 0.5758942297996583,
      "learning_rate": 3.295296365062181e-05,
      "loss": 1.2126,
      "num_input_tokens_seen": 35373791920,
      "step": 44961
    },
    {
      "epoch": 4.7699978782092085,
      "grad_norm": 0.6917064504181677,
      "learning_rate": 3.2952304781703326e-05,
      "loss": 1.3307,
      "num_input_tokens_seen": 35374578672,
      "step": 44962
    },
    {
      "epoch": 4.7701039677487795,
      "grad_norm": 0.6266643363973669,
      "learning_rate": 3.295164590663953e-05,
      "loss": 1.3242,
      "num_input_tokens_seen": 35375365424,
      "step": 44963
    },
    {
      "epoch": 4.7702100572883515,
      "grad_norm": 0.5387549138360614,
      "learning_rate": 3.295098702543093e-05,
      "loss": 1.298,
      "num_input_tokens_seen": 35376152144,
      "step": 44964
    },
    {
      "epoch": 4.7703161468279225,
      "grad_norm": 0.8005658062497625,
      "learning_rate": 3.295032813807805e-05,
      "loss": 1.3018,
      "num_input_tokens_seen": 35376938960,
      "step": 44965
    },
    {
      "epoch": 4.770422236367494,
      "grad_norm": 0.5278878257182774,
      "learning_rate": 3.294966924458139e-05,
      "loss": 1.2942,
      "num_input_tokens_seen": 35377725696,
      "step": 44966
    },
    {
      "epoch": 4.770528325907065,
      "grad_norm": 0.4690793718503278,
      "learning_rate": 3.294901034494145e-05,
      "loss": 1.2267,
      "num_input_tokens_seen": 35378512464,
      "step": 44967
    },
    {
      "epoch": 4.7706344154466365,
      "grad_norm": 0.7355000742254193,
      "learning_rate": 3.294835143915875e-05,
      "loss": 1.3065,
      "num_input_tokens_seen": 35379299280,
      "step": 44968
    },
    {
      "epoch": 4.770740504986208,
      "grad_norm": 0.7496961652549733,
      "learning_rate": 3.294769252723381e-05,
      "loss": 1.2346,
      "num_input_tokens_seen": 35380086016,
      "step": 44969
    },
    {
      "epoch": 4.770846594525779,
      "grad_norm": 0.5554390999028832,
      "learning_rate": 3.2947033609167114e-05,
      "loss": 1.2787,
      "num_input_tokens_seen": 35380872656,
      "step": 44970
    },
    {
      "epoch": 4.770952684065351,
      "grad_norm": 0.8120794144461424,
      "learning_rate": 3.294637468495918e-05,
      "loss": 1.1739,
      "num_input_tokens_seen": 35381659472,
      "step": 44971
    },
    {
      "epoch": 4.771058773604922,
      "grad_norm": 0.7397045086314462,
      "learning_rate": 3.2945715754610526e-05,
      "loss": 1.3369,
      "num_input_tokens_seen": 35382446192,
      "step": 44972
    },
    {
      "epoch": 4.771164863144494,
      "grad_norm": 0.555732130941851,
      "learning_rate": 3.294505681812166e-05,
      "loss": 1.4015,
      "num_input_tokens_seen": 35383232992,
      "step": 44973
    },
    {
      "epoch": 4.771270952684065,
      "grad_norm": 0.991701933231657,
      "learning_rate": 3.2944397875493086e-05,
      "loss": 1.3532,
      "num_input_tokens_seen": 35384019760,
      "step": 44974
    },
    {
      "epoch": 4.771377042223637,
      "grad_norm": 0.8349819174144986,
      "learning_rate": 3.294373892672531e-05,
      "loss": 1.2552,
      "num_input_tokens_seen": 35384806576,
      "step": 44975
    },
    {
      "epoch": 4.771483131763208,
      "grad_norm": 0.8166516624693195,
      "learning_rate": 3.2943079971818846e-05,
      "loss": 1.3664,
      "num_input_tokens_seen": 35385593360,
      "step": 44976
    },
    {
      "epoch": 4.771589221302779,
      "grad_norm": 1.2131022131616835,
      "learning_rate": 3.294242101077421e-05,
      "loss": 1.3953,
      "num_input_tokens_seen": 35386380096,
      "step": 44977
    },
    {
      "epoch": 4.771695310842351,
      "grad_norm": 0.752038354596359,
      "learning_rate": 3.294176204359189e-05,
      "loss": 1.2514,
      "num_input_tokens_seen": 35387166896,
      "step": 44978
    },
    {
      "epoch": 4.771801400381922,
      "grad_norm": 0.76939150323142,
      "learning_rate": 3.294110307027242e-05,
      "loss": 1.2577,
      "num_input_tokens_seen": 35387953584,
      "step": 44979
    },
    {
      "epoch": 4.771907489921494,
      "grad_norm": 1.3088928461705236,
      "learning_rate": 3.29404440908163e-05,
      "loss": 1.2422,
      "num_input_tokens_seen": 35388740432,
      "step": 44980
    },
    {
      "epoch": 4.772013579461065,
      "grad_norm": 0.5843842168480766,
      "learning_rate": 3.2939785105224035e-05,
      "loss": 1.2169,
      "num_input_tokens_seen": 35389527248,
      "step": 44981
    },
    {
      "epoch": 4.772119669000636,
      "grad_norm": 0.5744087147966038,
      "learning_rate": 3.2939126113496136e-05,
      "loss": 1.2023,
      "num_input_tokens_seen": 35390314080,
      "step": 44982
    },
    {
      "epoch": 4.772225758540208,
      "grad_norm": 0.7507700833392474,
      "learning_rate": 3.293846711563311e-05,
      "loss": 1.3081,
      "num_input_tokens_seen": 35391100896,
      "step": 44983
    },
    {
      "epoch": 4.772331848079779,
      "grad_norm": 0.6979499488022572,
      "learning_rate": 3.293780811163547e-05,
      "loss": 1.2054,
      "num_input_tokens_seen": 35391887824,
      "step": 44984
    },
    {
      "epoch": 4.772437937619351,
      "grad_norm": 0.6500108645919375,
      "learning_rate": 3.293714910150373e-05,
      "loss": 1.2841,
      "num_input_tokens_seen": 35392674656,
      "step": 44985
    },
    {
      "epoch": 4.772544027158922,
      "grad_norm": 0.8438782704835296,
      "learning_rate": 3.2936490085238394e-05,
      "loss": 1.3659,
      "num_input_tokens_seen": 35393461472,
      "step": 44986
    },
    {
      "epoch": 4.772650116698493,
      "grad_norm": 1.0369148214421395,
      "learning_rate": 3.2935831062839974e-05,
      "loss": 1.3537,
      "num_input_tokens_seen": 35394248256,
      "step": 44987
    },
    {
      "epoch": 4.772756206238065,
      "grad_norm": 0.7342009364645515,
      "learning_rate": 3.293517203430897e-05,
      "loss": 1.2594,
      "num_input_tokens_seen": 35395035040,
      "step": 44988
    },
    {
      "epoch": 4.772862295777636,
      "grad_norm": 1.1923990165371436,
      "learning_rate": 3.29345129996459e-05,
      "loss": 1.329,
      "num_input_tokens_seen": 35395821792,
      "step": 44989
    },
    {
      "epoch": 4.772968385317208,
      "grad_norm": 0.9884280780344178,
      "learning_rate": 3.293385395885127e-05,
      "loss": 1.3354,
      "num_input_tokens_seen": 35396608560,
      "step": 44990
    },
    {
      "epoch": 4.773074474856779,
      "grad_norm": 0.7191985553870831,
      "learning_rate": 3.2933194911925593e-05,
      "loss": 1.3212,
      "num_input_tokens_seen": 35397395360,
      "step": 44991
    },
    {
      "epoch": 4.77318056439635,
      "grad_norm": 0.9840675512037109,
      "learning_rate": 3.293253585886937e-05,
      "loss": 1.3034,
      "num_input_tokens_seen": 35398182192,
      "step": 44992
    },
    {
      "epoch": 4.773286653935922,
      "grad_norm": 0.8860084982309925,
      "learning_rate": 3.2931876799683124e-05,
      "loss": 1.2466,
      "num_input_tokens_seen": 35398968928,
      "step": 44993
    },
    {
      "epoch": 4.773392743475493,
      "grad_norm": 0.6169484730534512,
      "learning_rate": 3.2931217734367354e-05,
      "loss": 1.2186,
      "num_input_tokens_seen": 35399755856,
      "step": 44994
    },
    {
      "epoch": 4.773498833015065,
      "grad_norm": 0.6478047692580731,
      "learning_rate": 3.2930558662922575e-05,
      "loss": 1.346,
      "num_input_tokens_seen": 35400542704,
      "step": 44995
    },
    {
      "epoch": 4.773604922554636,
      "grad_norm": 0.8751844490846271,
      "learning_rate": 3.292989958534928e-05,
      "loss": 1.341,
      "num_input_tokens_seen": 35401329440,
      "step": 44996
    },
    {
      "epoch": 4.773711012094208,
      "grad_norm": 0.6852530992766848,
      "learning_rate": 3.2929240501648005e-05,
      "loss": 1.29,
      "num_input_tokens_seen": 35402116240,
      "step": 44997
    },
    {
      "epoch": 4.773817101633779,
      "grad_norm": 0.6658134952295891,
      "learning_rate": 3.2928581411819236e-05,
      "loss": 1.3884,
      "num_input_tokens_seen": 35402903008,
      "step": 44998
    },
    {
      "epoch": 4.77392319117335,
      "grad_norm": 0.8776377009086963,
      "learning_rate": 3.29279223158635e-05,
      "loss": 1.3308,
      "num_input_tokens_seen": 35403689808,
      "step": 44999
    },
    {
      "epoch": 4.774029280712922,
      "grad_norm": 0.4743129283650284,
      "learning_rate": 3.2927263213781295e-05,
      "loss": 1.3173,
      "num_input_tokens_seen": 35404476608,
      "step": 45000
    },
    {
      "epoch": 4.774029280712922,
      "eval_loss": 1.5479655265808105,
      "eval_runtime": 64.353,
      "eval_samples_per_second": 46.618,
      "eval_steps_per_second": 0.497,
      "num_input_tokens_seen": 35404476608,
      "step": 45000
    },
    {
      "epoch": 4.774135370252493,
      "grad_norm": 0.5771621498473509,
      "learning_rate": 3.292660410557313e-05,
      "loss": 1.3251,
      "num_input_tokens_seen": 35405263328,
      "step": 45001
    },
    {
      "epoch": 4.774241459792065,
      "grad_norm": 0.6114060322142346,
      "learning_rate": 3.2925944991239524e-05,
      "loss": 1.3419,
      "num_input_tokens_seen": 35406050128,
      "step": 45002
    },
    {
      "epoch": 4.774347549331636,
      "grad_norm": 0.8274142201231498,
      "learning_rate": 3.292528587078098e-05,
      "loss": 1.3193,
      "num_input_tokens_seen": 35406836816,
      "step": 45003
    },
    {
      "epoch": 4.774453638871208,
      "grad_norm": 0.5699027864244056,
      "learning_rate": 3.2924626744198e-05,
      "loss": 1.2002,
      "num_input_tokens_seen": 35407623632,
      "step": 45004
    },
    {
      "epoch": 4.774559728410779,
      "grad_norm": 0.76834254449085,
      "learning_rate": 3.292396761149111e-05,
      "loss": 1.2888,
      "num_input_tokens_seen": 35408410432,
      "step": 45005
    },
    {
      "epoch": 4.77466581795035,
      "grad_norm": 0.6947180724509024,
      "learning_rate": 3.292330847266081e-05,
      "loss": 1.305,
      "num_input_tokens_seen": 35409197184,
      "step": 45006
    },
    {
      "epoch": 4.774771907489922,
      "grad_norm": 0.6260638066718507,
      "learning_rate": 3.29226493277076e-05,
      "loss": 1.3633,
      "num_input_tokens_seen": 35409984000,
      "step": 45007
    },
    {
      "epoch": 4.774877997029493,
      "grad_norm": 0.6548889197278247,
      "learning_rate": 3.2921990176632004e-05,
      "loss": 1.1746,
      "num_input_tokens_seen": 35410770800,
      "step": 45008
    },
    {
      "epoch": 4.774984086569065,
      "grad_norm": 0.8143547872714808,
      "learning_rate": 3.292133101943453e-05,
      "loss": 1.3869,
      "num_input_tokens_seen": 35411557600,
      "step": 45009
    },
    {
      "epoch": 4.775090176108636,
      "grad_norm": 0.66304062771878,
      "learning_rate": 3.292067185611568e-05,
      "loss": 1.1672,
      "num_input_tokens_seen": 35412344448,
      "step": 45010
    },
    {
      "epoch": 4.775196265648207,
      "grad_norm": 0.8420510603962743,
      "learning_rate": 3.292001268667597e-05,
      "loss": 1.3591,
      "num_input_tokens_seen": 35413131168,
      "step": 45011
    },
    {
      "epoch": 4.775302355187779,
      "grad_norm": 0.9066602315495049,
      "learning_rate": 3.291935351111591e-05,
      "loss": 1.4184,
      "num_input_tokens_seen": 35413917888,
      "step": 45012
    },
    {
      "epoch": 4.77540844472735,
      "grad_norm": 0.5997807197301642,
      "learning_rate": 3.291869432943599e-05,
      "loss": 1.3799,
      "num_input_tokens_seen": 35414704656,
      "step": 45013
    },
    {
      "epoch": 4.775514534266922,
      "grad_norm": 0.5853038377925708,
      "learning_rate": 3.291803514163676e-05,
      "loss": 1.3604,
      "num_input_tokens_seen": 35415491440,
      "step": 45014
    },
    {
      "epoch": 4.775620623806493,
      "grad_norm": 0.52868285782661,
      "learning_rate": 3.291737594771868e-05,
      "loss": 1.2116,
      "num_input_tokens_seen": 35416278256,
      "step": 45015
    },
    {
      "epoch": 4.775726713346064,
      "grad_norm": 0.584529577155416,
      "learning_rate": 3.29167167476823e-05,
      "loss": 1.2342,
      "num_input_tokens_seen": 35417065040,
      "step": 45016
    },
    {
      "epoch": 4.775832802885636,
      "grad_norm": 0.6083639180764365,
      "learning_rate": 3.291605754152811e-05,
      "loss": 1.287,
      "num_input_tokens_seen": 35417851760,
      "step": 45017
    },
    {
      "epoch": 4.775938892425207,
      "grad_norm": 0.5468256338523626,
      "learning_rate": 3.291539832925662e-05,
      "loss": 1.261,
      "num_input_tokens_seen": 35418638432,
      "step": 45018
    },
    {
      "epoch": 4.776044981964779,
      "grad_norm": 0.6308266617730552,
      "learning_rate": 3.2914739110868344e-05,
      "loss": 1.3568,
      "num_input_tokens_seen": 35419425248,
      "step": 45019
    },
    {
      "epoch": 4.77615107150435,
      "grad_norm": 0.6153776180526398,
      "learning_rate": 3.291407988636379e-05,
      "loss": 1.2204,
      "num_input_tokens_seen": 35420211984,
      "step": 45020
    },
    {
      "epoch": 4.776257161043921,
      "grad_norm": 0.7201385348314213,
      "learning_rate": 3.291342065574347e-05,
      "loss": 1.3317,
      "num_input_tokens_seen": 35420998720,
      "step": 45021
    },
    {
      "epoch": 4.7763632505834925,
      "grad_norm": 0.6155477442578869,
      "learning_rate": 3.291276141900789e-05,
      "loss": 1.3106,
      "num_input_tokens_seen": 35421785408,
      "step": 45022
    },
    {
      "epoch": 4.776469340123064,
      "grad_norm": 0.7331013105768851,
      "learning_rate": 3.2912102176157556e-05,
      "loss": 1.242,
      "num_input_tokens_seen": 35422572176,
      "step": 45023
    },
    {
      "epoch": 4.7765754296626355,
      "grad_norm": 0.5671416468422813,
      "learning_rate": 3.291144292719298e-05,
      "loss": 1.3321,
      "num_input_tokens_seen": 35423358880,
      "step": 45024
    },
    {
      "epoch": 4.7766815192022065,
      "grad_norm": 0.6239942515935686,
      "learning_rate": 3.2910783672114684e-05,
      "loss": 1.2718,
      "num_input_tokens_seen": 35424145712,
      "step": 45025
    },
    {
      "epoch": 4.776787608741778,
      "grad_norm": 0.5819411900760308,
      "learning_rate": 3.291012441092315e-05,
      "loss": 1.3763,
      "num_input_tokens_seen": 35424932432,
      "step": 45026
    },
    {
      "epoch": 4.7768936982813495,
      "grad_norm": 0.5225983797706247,
      "learning_rate": 3.2909465143618913e-05,
      "loss": 1.2695,
      "num_input_tokens_seen": 35425719216,
      "step": 45027
    },
    {
      "epoch": 4.7769997878209205,
      "grad_norm": 0.6274471552419417,
      "learning_rate": 3.2908805870202476e-05,
      "loss": 1.3171,
      "num_input_tokens_seen": 35426505952,
      "step": 45028
    },
    {
      "epoch": 4.777105877360492,
      "grad_norm": 0.5657730132485917,
      "learning_rate": 3.290814659067434e-05,
      "loss": 1.335,
      "num_input_tokens_seen": 35427292624,
      "step": 45029
    },
    {
      "epoch": 4.7772119669000634,
      "grad_norm": 0.5456270614962034,
      "learning_rate": 3.2907487305035024e-05,
      "loss": 1.3489,
      "num_input_tokens_seen": 35428079360,
      "step": 45030
    },
    {
      "epoch": 4.777318056439635,
      "grad_norm": 0.6128465655883396,
      "learning_rate": 3.290682801328504e-05,
      "loss": 1.3101,
      "num_input_tokens_seen": 35428866128,
      "step": 45031
    },
    {
      "epoch": 4.777424145979206,
      "grad_norm": 0.5146653432793039,
      "learning_rate": 3.2906168715424884e-05,
      "loss": 1.3164,
      "num_input_tokens_seen": 35429652896,
      "step": 45032
    },
    {
      "epoch": 4.777530235518778,
      "grad_norm": 0.4679596669744087,
      "learning_rate": 3.290550941145507e-05,
      "loss": 1.2958,
      "num_input_tokens_seen": 35430439664,
      "step": 45033
    },
    {
      "epoch": 4.777636325058349,
      "grad_norm": 0.5178444036309108,
      "learning_rate": 3.2904850101376116e-05,
      "loss": 1.2799,
      "num_input_tokens_seen": 35431226336,
      "step": 45034
    },
    {
      "epoch": 4.77774241459792,
      "grad_norm": 0.4993451983615517,
      "learning_rate": 3.2904190785188526e-05,
      "loss": 1.3526,
      "num_input_tokens_seen": 35432013120,
      "step": 45035
    },
    {
      "epoch": 4.777848504137492,
      "grad_norm": 0.4756558870894293,
      "learning_rate": 3.2903531462892805e-05,
      "loss": 1.2329,
      "num_input_tokens_seen": 35432799872,
      "step": 45036
    },
    {
      "epoch": 4.777954593677063,
      "grad_norm": 0.6396878282115193,
      "learning_rate": 3.290287213448947e-05,
      "loss": 1.3419,
      "num_input_tokens_seen": 35433586592,
      "step": 45037
    },
    {
      "epoch": 4.778060683216635,
      "grad_norm": 0.5285582929049657,
      "learning_rate": 3.290221279997903e-05,
      "loss": 1.3503,
      "num_input_tokens_seen": 35434373360,
      "step": 45038
    },
    {
      "epoch": 4.778166772756206,
      "grad_norm": 0.49538472748334295,
      "learning_rate": 3.290155345936198e-05,
      "loss": 1.2639,
      "num_input_tokens_seen": 35435160096,
      "step": 45039
    },
    {
      "epoch": 4.778272862295777,
      "grad_norm": 0.7410316840978347,
      "learning_rate": 3.290089411263886e-05,
      "loss": 1.3124,
      "num_input_tokens_seen": 35435946784,
      "step": 45040
    },
    {
      "epoch": 4.778378951835349,
      "grad_norm": 0.6011924152718862,
      "learning_rate": 3.290023475981014e-05,
      "loss": 1.4013,
      "num_input_tokens_seen": 35436733456,
      "step": 45041
    },
    {
      "epoch": 4.77848504137492,
      "grad_norm": 0.5467025109336502,
      "learning_rate": 3.2899575400876365e-05,
      "loss": 1.2781,
      "num_input_tokens_seen": 35437520144,
      "step": 45042
    },
    {
      "epoch": 4.778591130914492,
      "grad_norm": 0.5774781215397311,
      "learning_rate": 3.2898916035838027e-05,
      "loss": 1.3451,
      "num_input_tokens_seen": 35438306912,
      "step": 45043
    },
    {
      "epoch": 4.778697220454063,
      "grad_norm": 0.5320170399685447,
      "learning_rate": 3.289825666469564e-05,
      "loss": 1.3695,
      "num_input_tokens_seen": 35439093648,
      "step": 45044
    },
    {
      "epoch": 4.778803309993634,
      "grad_norm": 0.5461256097598354,
      "learning_rate": 3.2897597287449704e-05,
      "loss": 1.3393,
      "num_input_tokens_seen": 35439880480,
      "step": 45045
    },
    {
      "epoch": 4.778909399533206,
      "grad_norm": 0.5108819240769849,
      "learning_rate": 3.289693790410074e-05,
      "loss": 1.38,
      "num_input_tokens_seen": 35440667232,
      "step": 45046
    },
    {
      "epoch": 4.779015489072777,
      "grad_norm": 0.5911630609976685,
      "learning_rate": 3.289627851464926e-05,
      "loss": 1.3009,
      "num_input_tokens_seen": 35441453984,
      "step": 45047
    },
    {
      "epoch": 4.779121578612349,
      "grad_norm": 0.5027479970582385,
      "learning_rate": 3.289561911909577e-05,
      "loss": 1.2468,
      "num_input_tokens_seen": 35442240768,
      "step": 45048
    },
    {
      "epoch": 4.77922766815192,
      "grad_norm": 0.49776652977097857,
      "learning_rate": 3.2894959717440766e-05,
      "loss": 1.3238,
      "num_input_tokens_seen": 35443027504,
      "step": 45049
    },
    {
      "epoch": 4.779333757691491,
      "grad_norm": 0.5270905449035509,
      "learning_rate": 3.2894300309684774e-05,
      "loss": 1.2396,
      "num_input_tokens_seen": 35443814368,
      "step": 45050
    },
    {
      "epoch": 4.779439847231063,
      "grad_norm": 0.5650328548085354,
      "learning_rate": 3.2893640895828295e-05,
      "loss": 1.2425,
      "num_input_tokens_seen": 35444601104,
      "step": 45051
    },
    {
      "epoch": 4.779545936770634,
      "grad_norm": 0.6190816185133385,
      "learning_rate": 3.289298147587185e-05,
      "loss": 1.3153,
      "num_input_tokens_seen": 35445387792,
      "step": 45052
    },
    {
      "epoch": 4.779652026310206,
      "grad_norm": 0.5402842206671471,
      "learning_rate": 3.289232204981593e-05,
      "loss": 1.2832,
      "num_input_tokens_seen": 35446174576,
      "step": 45053
    },
    {
      "epoch": 4.779758115849777,
      "grad_norm": 0.4809161256850275,
      "learning_rate": 3.2891662617661065e-05,
      "loss": 1.3164,
      "num_input_tokens_seen": 35446961360,
      "step": 45054
    },
    {
      "epoch": 4.779864205389349,
      "grad_norm": 0.6424104774322663,
      "learning_rate": 3.2891003179407754e-05,
      "loss": 1.2323,
      "num_input_tokens_seen": 35447748080,
      "step": 45055
    },
    {
      "epoch": 4.77997029492892,
      "grad_norm": 0.5583551097264705,
      "learning_rate": 3.2890343735056496e-05,
      "loss": 1.2667,
      "num_input_tokens_seen": 35448534832,
      "step": 45056
    },
    {
      "epoch": 4.780076384468491,
      "grad_norm": 0.5426172452269461,
      "learning_rate": 3.288968428460782e-05,
      "loss": 1.2879,
      "num_input_tokens_seen": 35449321520,
      "step": 45057
    },
    {
      "epoch": 4.780182474008063,
      "grad_norm": 0.8228587430271342,
      "learning_rate": 3.2889024828062223e-05,
      "loss": 1.3724,
      "num_input_tokens_seen": 35450108224,
      "step": 45058
    },
    {
      "epoch": 4.780288563547634,
      "grad_norm": 0.7377275529077413,
      "learning_rate": 3.2888365365420225e-05,
      "loss": 1.2435,
      "num_input_tokens_seen": 35450894992,
      "step": 45059
    },
    {
      "epoch": 4.780394653087206,
      "grad_norm": 0.6390441462526104,
      "learning_rate": 3.288770589668233e-05,
      "loss": 1.3222,
      "num_input_tokens_seen": 35451681792,
      "step": 45060
    },
    {
      "epoch": 4.780500742626777,
      "grad_norm": 0.7324266547880138,
      "learning_rate": 3.288704642184904e-05,
      "loss": 1.2806,
      "num_input_tokens_seen": 35452468592,
      "step": 45061
    },
    {
      "epoch": 4.780606832166349,
      "grad_norm": 0.5947561630200138,
      "learning_rate": 3.2886386940920884e-05,
      "loss": 1.3062,
      "num_input_tokens_seen": 35453255504,
      "step": 45062
    },
    {
      "epoch": 4.78071292170592,
      "grad_norm": 0.5553613526720587,
      "learning_rate": 3.288572745389835e-05,
      "loss": 1.2396,
      "num_input_tokens_seen": 35454042192,
      "step": 45063
    },
    {
      "epoch": 4.780819011245491,
      "grad_norm": 0.7615851194492687,
      "learning_rate": 3.2885067960781955e-05,
      "loss": 1.441,
      "num_input_tokens_seen": 35454828848,
      "step": 45064
    },
    {
      "epoch": 4.780925100785063,
      "grad_norm": 0.5295320149524251,
      "learning_rate": 3.288440846157222e-05,
      "loss": 1.2843,
      "num_input_tokens_seen": 35455615584,
      "step": 45065
    },
    {
      "epoch": 4.781031190324634,
      "grad_norm": 0.5948767654655854,
      "learning_rate": 3.2883748956269646e-05,
      "loss": 1.2444,
      "num_input_tokens_seen": 35456402496,
      "step": 45066
    },
    {
      "epoch": 4.781137279864206,
      "grad_norm": 0.5552052203902911,
      "learning_rate": 3.2883089444874735e-05,
      "loss": 1.2728,
      "num_input_tokens_seen": 35457189296,
      "step": 45067
    },
    {
      "epoch": 4.781243369403777,
      "grad_norm": 0.7043170171523008,
      "learning_rate": 3.2882429927388e-05,
      "loss": 1.2562,
      "num_input_tokens_seen": 35457976096,
      "step": 45068
    },
    {
      "epoch": 4.781349458943348,
      "grad_norm": 0.6017825947487722,
      "learning_rate": 3.2881770403809966e-05,
      "loss": 1.2996,
      "num_input_tokens_seen": 35458762864,
      "step": 45069
    },
    {
      "epoch": 4.78145554848292,
      "grad_norm": 0.5921031644647935,
      "learning_rate": 3.288111087414112e-05,
      "loss": 1.2993,
      "num_input_tokens_seen": 35459549600,
      "step": 45070
    },
    {
      "epoch": 4.781561638022491,
      "grad_norm": 0.5372698005495864,
      "learning_rate": 3.288045133838199e-05,
      "loss": 1.272,
      "num_input_tokens_seen": 35460336304,
      "step": 45071
    },
    {
      "epoch": 4.781667727562063,
      "grad_norm": 0.5355428916405919,
      "learning_rate": 3.287979179653308e-05,
      "loss": 1.2567,
      "num_input_tokens_seen": 35461123072,
      "step": 45072
    },
    {
      "epoch": 4.781773817101634,
      "grad_norm": 0.7041292521496062,
      "learning_rate": 3.287913224859488e-05,
      "loss": 1.334,
      "num_input_tokens_seen": 35461909760,
      "step": 45073
    },
    {
      "epoch": 4.781879906641205,
      "grad_norm": 0.7086149907804213,
      "learning_rate": 3.287847269456794e-05,
      "loss": 1.3401,
      "num_input_tokens_seen": 35462696528,
      "step": 45074
    },
    {
      "epoch": 4.781985996180777,
      "grad_norm": 0.6112297583566885,
      "learning_rate": 3.287781313445274e-05,
      "loss": 1.2697,
      "num_input_tokens_seen": 35463483280,
      "step": 45075
    },
    {
      "epoch": 4.782092085720348,
      "grad_norm": 0.6305909347253781,
      "learning_rate": 3.2877153568249795e-05,
      "loss": 1.3772,
      "num_input_tokens_seen": 35464270064,
      "step": 45076
    },
    {
      "epoch": 4.78219817525992,
      "grad_norm": 0.6390031619730103,
      "learning_rate": 3.2876493995959625e-05,
      "loss": 1.319,
      "num_input_tokens_seen": 35465056816,
      "step": 45077
    },
    {
      "epoch": 4.782304264799491,
      "grad_norm": 0.5466147002702922,
      "learning_rate": 3.2875834417582724e-05,
      "loss": 1.315,
      "num_input_tokens_seen": 35465843696,
      "step": 45078
    },
    {
      "epoch": 4.782410354339062,
      "grad_norm": 0.5546038840741164,
      "learning_rate": 3.2875174833119607e-05,
      "loss": 1.3401,
      "num_input_tokens_seen": 35466630528,
      "step": 45079
    },
    {
      "epoch": 4.782516443878634,
      "grad_norm": 0.47129948565671703,
      "learning_rate": 3.2874515242570794e-05,
      "loss": 1.3161,
      "num_input_tokens_seen": 35467417344,
      "step": 45080
    },
    {
      "epoch": 4.782622533418205,
      "grad_norm": 0.5980834139462144,
      "learning_rate": 3.287385564593678e-05,
      "loss": 1.3419,
      "num_input_tokens_seen": 35468204112,
      "step": 45081
    },
    {
      "epoch": 4.782728622957777,
      "grad_norm": 0.5614822995237384,
      "learning_rate": 3.287319604321808e-05,
      "loss": 1.3205,
      "num_input_tokens_seen": 35468990896,
      "step": 45082
    },
    {
      "epoch": 4.782834712497348,
      "grad_norm": 0.6283503923128277,
      "learning_rate": 3.287253643441521e-05,
      "loss": 1.3285,
      "num_input_tokens_seen": 35469777664,
      "step": 45083
    },
    {
      "epoch": 4.7829408020369195,
      "grad_norm": 0.6623119188422562,
      "learning_rate": 3.287187681952868e-05,
      "loss": 1.3543,
      "num_input_tokens_seen": 35470564448,
      "step": 45084
    },
    {
      "epoch": 4.7830468915764905,
      "grad_norm": 0.5343739710767553,
      "learning_rate": 3.287121719855898e-05,
      "loss": 1.1918,
      "num_input_tokens_seen": 35471351216,
      "step": 45085
    },
    {
      "epoch": 4.783152981116062,
      "grad_norm": 0.5310480991406301,
      "learning_rate": 3.287055757150665e-05,
      "loss": 1.2908,
      "num_input_tokens_seen": 35472137936,
      "step": 45086
    },
    {
      "epoch": 4.7832590706556335,
      "grad_norm": 0.6350939292860848,
      "learning_rate": 3.2869897938372176e-05,
      "loss": 1.2324,
      "num_input_tokens_seen": 35472924592,
      "step": 45087
    },
    {
      "epoch": 4.7833651601952045,
      "grad_norm": 0.5426089262594435,
      "learning_rate": 3.2869238299156076e-05,
      "loss": 1.295,
      "num_input_tokens_seen": 35473711344,
      "step": 45088
    },
    {
      "epoch": 4.783471249734776,
      "grad_norm": 0.5375443886387412,
      "learning_rate": 3.286857865385886e-05,
      "loss": 1.1847,
      "num_input_tokens_seen": 35474498112,
      "step": 45089
    },
    {
      "epoch": 4.7835773392743475,
      "grad_norm": 0.4978089784789237,
      "learning_rate": 3.286791900248104e-05,
      "loss": 1.306,
      "num_input_tokens_seen": 35475284816,
      "step": 45090
    },
    {
      "epoch": 4.783683428813919,
      "grad_norm": 0.5347769350217147,
      "learning_rate": 3.2867259345023114e-05,
      "loss": 1.3778,
      "num_input_tokens_seen": 35476071552,
      "step": 45091
    },
    {
      "epoch": 4.78378951835349,
      "grad_norm": 0.5961103750429172,
      "learning_rate": 3.286659968148561e-05,
      "loss": 1.223,
      "num_input_tokens_seen": 35476858288,
      "step": 45092
    },
    {
      "epoch": 4.7838956078930615,
      "grad_norm": 0.4814412786324815,
      "learning_rate": 3.286594001186902e-05,
      "loss": 1.2954,
      "num_input_tokens_seen": 35477645008,
      "step": 45093
    },
    {
      "epoch": 4.784001697432633,
      "grad_norm": 0.5514539724299953,
      "learning_rate": 3.2865280336173876e-05,
      "loss": 1.3235,
      "num_input_tokens_seen": 35478431808,
      "step": 45094
    },
    {
      "epoch": 4.784107786972204,
      "grad_norm": 0.5491300688272054,
      "learning_rate": 3.2864620654400665e-05,
      "loss": 1.3396,
      "num_input_tokens_seen": 35479218672,
      "step": 45095
    },
    {
      "epoch": 4.784213876511776,
      "grad_norm": 0.5893015144494959,
      "learning_rate": 3.2863960966549906e-05,
      "loss": 1.3503,
      "num_input_tokens_seen": 35480005408,
      "step": 45096
    },
    {
      "epoch": 4.784319966051347,
      "grad_norm": 0.7580320983833562,
      "learning_rate": 3.286330127262211e-05,
      "loss": 1.2831,
      "num_input_tokens_seen": 35480792176,
      "step": 45097
    },
    {
      "epoch": 4.784426055590918,
      "grad_norm": 0.5633971664818067,
      "learning_rate": 3.2862641572617784e-05,
      "loss": 1.2872,
      "num_input_tokens_seen": 35481578992,
      "step": 45098
    },
    {
      "epoch": 4.78453214513049,
      "grad_norm": 0.8188983672267731,
      "learning_rate": 3.286198186653744e-05,
      "loss": 1.1947,
      "num_input_tokens_seen": 35482365776,
      "step": 45099
    },
    {
      "epoch": 4.784638234670061,
      "grad_norm": 0.606798340370519,
      "learning_rate": 3.286132215438159e-05,
      "loss": 1.3629,
      "num_input_tokens_seen": 35483152592,
      "step": 45100
    },
    {
      "epoch": 4.784744324209633,
      "grad_norm": 0.6580277165110318,
      "learning_rate": 3.2860662436150734e-05,
      "loss": 1.3251,
      "num_input_tokens_seen": 35483939344,
      "step": 45101
    },
    {
      "epoch": 4.784850413749204,
      "grad_norm": 0.5104354730082279,
      "learning_rate": 3.28600027118454e-05,
      "loss": 1.3101,
      "num_input_tokens_seen": 35484726064,
      "step": 45102
    },
    {
      "epoch": 4.784956503288775,
      "grad_norm": 0.607454913197627,
      "learning_rate": 3.285934298146608e-05,
      "loss": 1.2805,
      "num_input_tokens_seen": 35485512784,
      "step": 45103
    },
    {
      "epoch": 4.785062592828347,
      "grad_norm": 0.47430168254418875,
      "learning_rate": 3.2858683245013283e-05,
      "loss": 1.2305,
      "num_input_tokens_seen": 35486299488,
      "step": 45104
    },
    {
      "epoch": 4.785168682367918,
      "grad_norm": 0.5279878345786506,
      "learning_rate": 3.2858023502487536e-05,
      "loss": 1.2398,
      "num_input_tokens_seen": 35487086288,
      "step": 45105
    },
    {
      "epoch": 4.78527477190749,
      "grad_norm": 0.5321830456040724,
      "learning_rate": 3.2857363753889335e-05,
      "loss": 1.2196,
      "num_input_tokens_seen": 35487873056,
      "step": 45106
    },
    {
      "epoch": 4.785380861447061,
      "grad_norm": 0.4758819833634873,
      "learning_rate": 3.2856703999219196e-05,
      "loss": 1.3217,
      "num_input_tokens_seen": 35488659904,
      "step": 45107
    },
    {
      "epoch": 4.785486950986632,
      "grad_norm": 0.5452113107725906,
      "learning_rate": 3.2856044238477626e-05,
      "loss": 1.376,
      "num_input_tokens_seen": 35489446608,
      "step": 45108
    },
    {
      "epoch": 4.785593040526204,
      "grad_norm": 0.5158074872980205,
      "learning_rate": 3.285538447166514e-05,
      "loss": 1.2903,
      "num_input_tokens_seen": 35490233376,
      "step": 45109
    },
    {
      "epoch": 4.785699130065775,
      "grad_norm": 0.46824329040985047,
      "learning_rate": 3.2854724698782234e-05,
      "loss": 1.2341,
      "num_input_tokens_seen": 35491020144,
      "step": 45110
    },
    {
      "epoch": 4.785805219605347,
      "grad_norm": 0.5002893665053454,
      "learning_rate": 3.2854064919829435e-05,
      "loss": 1.2997,
      "num_input_tokens_seen": 35491806944,
      "step": 45111
    },
    {
      "epoch": 4.785911309144918,
      "grad_norm": 0.48617774007680964,
      "learning_rate": 3.2853405134807245e-05,
      "loss": 1.2219,
      "num_input_tokens_seen": 35492593712,
      "step": 45112
    },
    {
      "epoch": 4.78601739868449,
      "grad_norm": 0.5238361949486693,
      "learning_rate": 3.2852745343716166e-05,
      "loss": 1.4572,
      "num_input_tokens_seen": 35493380384,
      "step": 45113
    },
    {
      "epoch": 4.786123488224061,
      "grad_norm": 0.5918569933451987,
      "learning_rate": 3.285208554655672e-05,
      "loss": 1.3116,
      "num_input_tokens_seen": 35494167136,
      "step": 45114
    },
    {
      "epoch": 4.786229577763633,
      "grad_norm": 0.5078013481680174,
      "learning_rate": 3.285142574332942e-05,
      "loss": 1.2078,
      "num_input_tokens_seen": 35494953856,
      "step": 45115
    },
    {
      "epoch": 4.786335667303204,
      "grad_norm": 0.5939914803778233,
      "learning_rate": 3.2850765934034756e-05,
      "loss": 1.2852,
      "num_input_tokens_seen": 35495740608,
      "step": 45116
    },
    {
      "epoch": 4.786441756842775,
      "grad_norm": 0.563095244847444,
      "learning_rate": 3.285010611867326e-05,
      "loss": 1.3067,
      "num_input_tokens_seen": 35496527360,
      "step": 45117
    },
    {
      "epoch": 4.786547846382347,
      "grad_norm": 0.6590655797885296,
      "learning_rate": 3.284944629724542e-05,
      "loss": 1.3016,
      "num_input_tokens_seen": 35497314144,
      "step": 45118
    },
    {
      "epoch": 4.786653935921918,
      "grad_norm": 0.6333453719195374,
      "learning_rate": 3.284878646975177e-05,
      "loss": 1.3205,
      "num_input_tokens_seen": 35498100976,
      "step": 45119
    },
    {
      "epoch": 4.78676002546149,
      "grad_norm": 0.6132687107656111,
      "learning_rate": 3.284812663619281e-05,
      "loss": 1.3027,
      "num_input_tokens_seen": 35498887808,
      "step": 45120
    },
    {
      "epoch": 4.786866115001061,
      "grad_norm": 0.47487039005962844,
      "learning_rate": 3.284746679656904e-05,
      "loss": 1.2638,
      "num_input_tokens_seen": 35499674528,
      "step": 45121
    },
    {
      "epoch": 4.786972204540632,
      "grad_norm": 0.6142770488267502,
      "learning_rate": 3.2846806950880984e-05,
      "loss": 1.2856,
      "num_input_tokens_seen": 35500461328,
      "step": 45122
    },
    {
      "epoch": 4.787078294080204,
      "grad_norm": 0.7589327413489079,
      "learning_rate": 3.2846147099129146e-05,
      "loss": 1.2613,
      "num_input_tokens_seen": 35501248192,
      "step": 45123
    },
    {
      "epoch": 4.787184383619775,
      "grad_norm": 0.5983878946636535,
      "learning_rate": 3.2845487241314036e-05,
      "loss": 1.3111,
      "num_input_tokens_seen": 35502034960,
      "step": 45124
    },
    {
      "epoch": 4.787290473159347,
      "grad_norm": 0.561058824773245,
      "learning_rate": 3.284482737743615e-05,
      "loss": 1.298,
      "num_input_tokens_seen": 35502821680,
      "step": 45125
    },
    {
      "epoch": 4.787396562698918,
      "grad_norm": 0.5924557098344084,
      "learning_rate": 3.2844167507496026e-05,
      "loss": 1.3823,
      "num_input_tokens_seen": 35503608448,
      "step": 45126
    },
    {
      "epoch": 4.787502652238489,
      "grad_norm": 0.52621674152429,
      "learning_rate": 3.2843507631494156e-05,
      "loss": 1.4125,
      "num_input_tokens_seen": 35504395136,
      "step": 45127
    },
    {
      "epoch": 4.787608741778061,
      "grad_norm": 0.5081228381239524,
      "learning_rate": 3.284284774943105e-05,
      "loss": 1.2725,
      "num_input_tokens_seen": 35505181872,
      "step": 45128
    },
    {
      "epoch": 4.787714831317632,
      "grad_norm": 0.6388542044329417,
      "learning_rate": 3.284218786130723e-05,
      "loss": 1.2813,
      "num_input_tokens_seen": 35505968640,
      "step": 45129
    },
    {
      "epoch": 4.787820920857204,
      "grad_norm": 0.4776824365730798,
      "learning_rate": 3.284152796712318e-05,
      "loss": 1.37,
      "num_input_tokens_seen": 35506755408,
      "step": 45130
    },
    {
      "epoch": 4.787927010396775,
      "grad_norm": 0.49420791319459734,
      "learning_rate": 3.284086806687944e-05,
      "loss": 1.2725,
      "num_input_tokens_seen": 35507542192,
      "step": 45131
    },
    {
      "epoch": 4.788033099936346,
      "grad_norm": 0.5174752661751065,
      "learning_rate": 3.2840208160576515e-05,
      "loss": 1.3168,
      "num_input_tokens_seen": 35508328880,
      "step": 45132
    },
    {
      "epoch": 4.788139189475918,
      "grad_norm": 0.48981215352261537,
      "learning_rate": 3.283954824821489e-05,
      "loss": 1.2077,
      "num_input_tokens_seen": 35509115632,
      "step": 45133
    },
    {
      "epoch": 4.788245279015489,
      "grad_norm": 0.5159283949264045,
      "learning_rate": 3.2838888329795106e-05,
      "loss": 1.3023,
      "num_input_tokens_seen": 35509902352,
      "step": 45134
    },
    {
      "epoch": 4.788351368555061,
      "grad_norm": 0.519678238481041,
      "learning_rate": 3.2838228405317656e-05,
      "loss": 1.2815,
      "num_input_tokens_seen": 35510689104,
      "step": 45135
    },
    {
      "epoch": 4.788457458094632,
      "grad_norm": 0.5088256922277755,
      "learning_rate": 3.2837568474783046e-05,
      "loss": 1.3558,
      "num_input_tokens_seen": 35511475920,
      "step": 45136
    },
    {
      "epoch": 4.788563547634203,
      "grad_norm": 0.5429730425217449,
      "learning_rate": 3.2836908538191805e-05,
      "loss": 1.2447,
      "num_input_tokens_seen": 35512262656,
      "step": 45137
    },
    {
      "epoch": 4.788669637173775,
      "grad_norm": 0.6301602814466043,
      "learning_rate": 3.2836248595544414e-05,
      "loss": 1.3078,
      "num_input_tokens_seen": 35513049408,
      "step": 45138
    },
    {
      "epoch": 4.788775726713346,
      "grad_norm": 0.5090821390345573,
      "learning_rate": 3.283558864684141e-05,
      "loss": 1.3499,
      "num_input_tokens_seen": 35513836208,
      "step": 45139
    },
    {
      "epoch": 4.788881816252918,
      "grad_norm": 0.5407985768335883,
      "learning_rate": 3.2834928692083295e-05,
      "loss": 1.2086,
      "num_input_tokens_seen": 35514622976,
      "step": 45140
    },
    {
      "epoch": 4.788987905792489,
      "grad_norm": 0.5564564070091821,
      "learning_rate": 3.283426873127058e-05,
      "loss": 1.349,
      "num_input_tokens_seen": 35515409776,
      "step": 45141
    },
    {
      "epoch": 4.789093995332061,
      "grad_norm": 0.5565050936289659,
      "learning_rate": 3.2833608764403764e-05,
      "loss": 1.2931,
      "num_input_tokens_seen": 35516196448,
      "step": 45142
    },
    {
      "epoch": 4.789200084871632,
      "grad_norm": 0.47504670262274795,
      "learning_rate": 3.283294879148337e-05,
      "loss": 1.2594,
      "num_input_tokens_seen": 35516983296,
      "step": 45143
    },
    {
      "epoch": 4.7893061744112035,
      "grad_norm": 0.5588069415059175,
      "learning_rate": 3.283228881250989e-05,
      "loss": 1.2992,
      "num_input_tokens_seen": 35517770048,
      "step": 45144
    },
    {
      "epoch": 4.789412263950775,
      "grad_norm": 0.7005329769002213,
      "learning_rate": 3.283162882748386e-05,
      "loss": 1.3075,
      "num_input_tokens_seen": 35518556784,
      "step": 45145
    },
    {
      "epoch": 4.789518353490346,
      "grad_norm": 0.47371693710364277,
      "learning_rate": 3.283096883640578e-05,
      "loss": 1.294,
      "num_input_tokens_seen": 35519343520,
      "step": 45146
    },
    {
      "epoch": 4.7896244430299175,
      "grad_norm": 0.6871099114205934,
      "learning_rate": 3.283030883927615e-05,
      "loss": 1.2976,
      "num_input_tokens_seen": 35520130256,
      "step": 45147
    },
    {
      "epoch": 4.7897305325694886,
      "grad_norm": 0.8623073532651045,
      "learning_rate": 3.282964883609549e-05,
      "loss": 1.3476,
      "num_input_tokens_seen": 35520916928,
      "step": 45148
    },
    {
      "epoch": 4.7898366221090605,
      "grad_norm": 0.6702600527957557,
      "learning_rate": 3.282898882686431e-05,
      "loss": 1.4197,
      "num_input_tokens_seen": 35521703648,
      "step": 45149
    },
    {
      "epoch": 4.7899427116486315,
      "grad_norm": 0.7983926173132093,
      "learning_rate": 3.282832881158311e-05,
      "loss": 1.2938,
      "num_input_tokens_seen": 35522490448,
      "step": 45150
    },
    {
      "epoch": 4.7900488011882025,
      "grad_norm": 0.7390520381942,
      "learning_rate": 3.282766879025241e-05,
      "loss": 1.3768,
      "num_input_tokens_seen": 35523277152,
      "step": 45151
    },
    {
      "epoch": 4.7901548907277745,
      "grad_norm": 0.6382039940874851,
      "learning_rate": 3.282700876287272e-05,
      "loss": 1.4447,
      "num_input_tokens_seen": 35524063840,
      "step": 45152
    },
    {
      "epoch": 4.7902609802673455,
      "grad_norm": 0.7091025425233674,
      "learning_rate": 3.282634872944454e-05,
      "loss": 1.2413,
      "num_input_tokens_seen": 35524850624,
      "step": 45153
    },
    {
      "epoch": 4.790367069806917,
      "grad_norm": 0.7343814256208093,
      "learning_rate": 3.2825688689968394e-05,
      "loss": 1.4111,
      "num_input_tokens_seen": 35525637296,
      "step": 45154
    },
    {
      "epoch": 4.790473159346488,
      "grad_norm": 0.5956921996206181,
      "learning_rate": 3.2825028644444786e-05,
      "loss": 1.2215,
      "num_input_tokens_seen": 35526424080,
      "step": 45155
    },
    {
      "epoch": 4.7905792488860595,
      "grad_norm": 0.5779983817804338,
      "learning_rate": 3.282436859287422e-05,
      "loss": 1.2826,
      "num_input_tokens_seen": 35527210928,
      "step": 45156
    },
    {
      "epoch": 4.790685338425631,
      "grad_norm": 0.5327739431518785,
      "learning_rate": 3.282370853525721e-05,
      "loss": 1.3492,
      "num_input_tokens_seen": 35527997632,
      "step": 45157
    },
    {
      "epoch": 4.790791427965202,
      "grad_norm": 0.6481124455211185,
      "learning_rate": 3.282304847159428e-05,
      "loss": 1.3009,
      "num_input_tokens_seen": 35528784512,
      "step": 45158
    },
    {
      "epoch": 4.790897517504774,
      "grad_norm": 0.6172564052574621,
      "learning_rate": 3.2822388401885915e-05,
      "loss": 1.3393,
      "num_input_tokens_seen": 35529571328,
      "step": 45159
    },
    {
      "epoch": 4.791003607044345,
      "grad_norm": 0.5830934899237762,
      "learning_rate": 3.282172832613265e-05,
      "loss": 1.297,
      "num_input_tokens_seen": 35530358080,
      "step": 45160
    },
    {
      "epoch": 4.791109696583916,
      "grad_norm": 0.5895190698645314,
      "learning_rate": 3.282106824433497e-05,
      "loss": 1.3772,
      "num_input_tokens_seen": 35531144816,
      "step": 45161
    },
    {
      "epoch": 4.791215786123488,
      "grad_norm": 0.5656673388618678,
      "learning_rate": 3.2820408156493406e-05,
      "loss": 1.3503,
      "num_input_tokens_seen": 35531931664,
      "step": 45162
    },
    {
      "epoch": 4.791321875663059,
      "grad_norm": 0.5366388467136293,
      "learning_rate": 3.281974806260846e-05,
      "loss": 1.3207,
      "num_input_tokens_seen": 35532718368,
      "step": 45163
    },
    {
      "epoch": 4.791427965202631,
      "grad_norm": 0.5476761209242815,
      "learning_rate": 3.2819087962680636e-05,
      "loss": 1.3578,
      "num_input_tokens_seen": 35533505088,
      "step": 45164
    },
    {
      "epoch": 4.791534054742202,
      "grad_norm": 0.4952915572457997,
      "learning_rate": 3.281842785671045e-05,
      "loss": 1.2693,
      "num_input_tokens_seen": 35534291856,
      "step": 45165
    },
    {
      "epoch": 4.791640144281774,
      "grad_norm": 0.5603345351818948,
      "learning_rate": 3.2817767744698424e-05,
      "loss": 1.3319,
      "num_input_tokens_seen": 35535078640,
      "step": 45166
    },
    {
      "epoch": 4.791746233821345,
      "grad_norm": 0.6496125501978071,
      "learning_rate": 3.2817107626645044e-05,
      "loss": 1.4285,
      "num_input_tokens_seen": 35535865440,
      "step": 45167
    },
    {
      "epoch": 4.791852323360916,
      "grad_norm": 0.5701939763642896,
      "learning_rate": 3.2816447502550836e-05,
      "loss": 1.2275,
      "num_input_tokens_seen": 35536652288,
      "step": 45168
    },
    {
      "epoch": 4.791958412900488,
      "grad_norm": 0.5271918587709475,
      "learning_rate": 3.281578737241631e-05,
      "loss": 1.2637,
      "num_input_tokens_seen": 35537439008,
      "step": 45169
    },
    {
      "epoch": 4.792064502440059,
      "grad_norm": 0.6272058301221997,
      "learning_rate": 3.281512723624197e-05,
      "loss": 1.3037,
      "num_input_tokens_seen": 35538225760,
      "step": 45170
    },
    {
      "epoch": 4.792170591979631,
      "grad_norm": 0.5365148334160369,
      "learning_rate": 3.2814467094028327e-05,
      "loss": 1.3119,
      "num_input_tokens_seen": 35539012480,
      "step": 45171
    },
    {
      "epoch": 4.792276681519202,
      "grad_norm": 0.6029932191220184,
      "learning_rate": 3.28138069457759e-05,
      "loss": 1.3688,
      "num_input_tokens_seen": 35539799328,
      "step": 45172
    },
    {
      "epoch": 4.792382771058774,
      "grad_norm": 0.5484316542344003,
      "learning_rate": 3.281314679148518e-05,
      "loss": 1.3172,
      "num_input_tokens_seen": 35540586112,
      "step": 45173
    },
    {
      "epoch": 4.792488860598345,
      "grad_norm": 0.5578687104872558,
      "learning_rate": 3.28124866311567e-05,
      "loss": 1.3118,
      "num_input_tokens_seen": 35541372848,
      "step": 45174
    },
    {
      "epoch": 4.792594950137916,
      "grad_norm": 0.5320459793384167,
      "learning_rate": 3.281182646479096e-05,
      "loss": 1.291,
      "num_input_tokens_seen": 35542159600,
      "step": 45175
    },
    {
      "epoch": 4.792701039677488,
      "grad_norm": 0.7074731124628251,
      "learning_rate": 3.2811166292388464e-05,
      "loss": 1.3387,
      "num_input_tokens_seen": 35542946384,
      "step": 45176
    },
    {
      "epoch": 4.792807129217059,
      "grad_norm": 0.580813701641078,
      "learning_rate": 3.281050611394973e-05,
      "loss": 1.4142,
      "num_input_tokens_seen": 35543733120,
      "step": 45177
    },
    {
      "epoch": 4.792913218756631,
      "grad_norm": 0.5318449935495597,
      "learning_rate": 3.280984592947527e-05,
      "loss": 1.2611,
      "num_input_tokens_seen": 35544519904,
      "step": 45178
    },
    {
      "epoch": 4.793019308296202,
      "grad_norm": 0.5450623113544807,
      "learning_rate": 3.280918573896559e-05,
      "loss": 1.2505,
      "num_input_tokens_seen": 35545306704,
      "step": 45179
    },
    {
      "epoch": 4.793125397835773,
      "grad_norm": 0.5548642167421592,
      "learning_rate": 3.2808525542421195e-05,
      "loss": 1.3803,
      "num_input_tokens_seen": 35546093376,
      "step": 45180
    },
    {
      "epoch": 4.793231487375345,
      "grad_norm": 0.7375806587352531,
      "learning_rate": 3.28078653398426e-05,
      "loss": 1.401,
      "num_input_tokens_seen": 35546880160,
      "step": 45181
    },
    {
      "epoch": 4.793337576914916,
      "grad_norm": 0.6375889937492631,
      "learning_rate": 3.280720513123032e-05,
      "loss": 1.3249,
      "num_input_tokens_seen": 35547666912,
      "step": 45182
    },
    {
      "epoch": 4.793443666454488,
      "grad_norm": 0.5760600620234682,
      "learning_rate": 3.280654491658486e-05,
      "loss": 1.254,
      "num_input_tokens_seen": 35548453712,
      "step": 45183
    },
    {
      "epoch": 4.793549755994059,
      "grad_norm": 0.6780155325014244,
      "learning_rate": 3.280588469590674e-05,
      "loss": 1.3133,
      "num_input_tokens_seen": 35549240448,
      "step": 45184
    },
    {
      "epoch": 4.79365584553363,
      "grad_norm": 0.4619764192779219,
      "learning_rate": 3.280522446919645e-05,
      "loss": 1.2601,
      "num_input_tokens_seen": 35550027200,
      "step": 45185
    },
    {
      "epoch": 4.793761935073202,
      "grad_norm": 0.5017755024440738,
      "learning_rate": 3.280456423645451e-05,
      "loss": 1.2497,
      "num_input_tokens_seen": 35550813968,
      "step": 45186
    },
    {
      "epoch": 4.793868024612773,
      "grad_norm": 0.5916654693089537,
      "learning_rate": 3.280390399768144e-05,
      "loss": 1.233,
      "num_input_tokens_seen": 35551600752,
      "step": 45187
    },
    {
      "epoch": 4.793974114152345,
      "grad_norm": 0.6438806927029088,
      "learning_rate": 3.280324375287773e-05,
      "loss": 1.3649,
      "num_input_tokens_seen": 35552387584,
      "step": 45188
    },
    {
      "epoch": 4.794080203691916,
      "grad_norm": 0.5217159747659795,
      "learning_rate": 3.280258350204391e-05,
      "loss": 1.3457,
      "num_input_tokens_seen": 35553174336,
      "step": 45189
    },
    {
      "epoch": 4.794186293231487,
      "grad_norm": 0.5255641763049488,
      "learning_rate": 3.280192324518048e-05,
      "loss": 1.2787,
      "num_input_tokens_seen": 35553961072,
      "step": 45190
    },
    {
      "epoch": 4.794292382771059,
      "grad_norm": 0.5043650342143075,
      "learning_rate": 3.2801262982287964e-05,
      "loss": 1.2789,
      "num_input_tokens_seen": 35554747776,
      "step": 45191
    },
    {
      "epoch": 4.79439847231063,
      "grad_norm": 0.6046451593070684,
      "learning_rate": 3.280060271336684e-05,
      "loss": 1.3497,
      "num_input_tokens_seen": 35555534624,
      "step": 45192
    },
    {
      "epoch": 4.794504561850202,
      "grad_norm": 0.5036008353352407,
      "learning_rate": 3.279994243841766e-05,
      "loss": 1.2693,
      "num_input_tokens_seen": 35556321456,
      "step": 45193
    },
    {
      "epoch": 4.794610651389773,
      "grad_norm": 0.697083922317022,
      "learning_rate": 3.27992821574409e-05,
      "loss": 1.2215,
      "num_input_tokens_seen": 35557108272,
      "step": 45194
    },
    {
      "epoch": 4.794716740929345,
      "grad_norm": 0.5906249916622504,
      "learning_rate": 3.279862187043709e-05,
      "loss": 1.3488,
      "num_input_tokens_seen": 35557895120,
      "step": 45195
    },
    {
      "epoch": 4.794822830468916,
      "grad_norm": 0.49654986282546126,
      "learning_rate": 3.2797961577406734e-05,
      "loss": 1.1915,
      "num_input_tokens_seen": 35558681888,
      "step": 45196
    },
    {
      "epoch": 4.794928920008487,
      "grad_norm": 0.8117767553445007,
      "learning_rate": 3.279730127835034e-05,
      "loss": 1.4514,
      "num_input_tokens_seen": 35559468736,
      "step": 45197
    },
    {
      "epoch": 4.795035009548059,
      "grad_norm": 0.5180462911358018,
      "learning_rate": 3.279664097326842e-05,
      "loss": 1.2951,
      "num_input_tokens_seen": 35560255520,
      "step": 45198
    },
    {
      "epoch": 4.79514109908763,
      "grad_norm": 0.5624492097869757,
      "learning_rate": 3.279598066216148e-05,
      "loss": 1.3371,
      "num_input_tokens_seen": 35561042336,
      "step": 45199
    },
    {
      "epoch": 4.795247188627202,
      "grad_norm": 0.47759178666168056,
      "learning_rate": 3.2795320345030044e-05,
      "loss": 1.2899,
      "num_input_tokens_seen": 35561829168,
      "step": 45200
    },
    {
      "epoch": 4.795353278166773,
      "grad_norm": 0.7211771229177105,
      "learning_rate": 3.279466002187461e-05,
      "loss": 1.2616,
      "num_input_tokens_seen": 35562615952,
      "step": 45201
    },
    {
      "epoch": 4.795459367706345,
      "grad_norm": 0.5770919930998225,
      "learning_rate": 3.2793999692695686e-05,
      "loss": 1.2805,
      "num_input_tokens_seen": 35563402720,
      "step": 45202
    },
    {
      "epoch": 4.795565457245916,
      "grad_norm": 0.6341617379301615,
      "learning_rate": 3.279333935749379e-05,
      "loss": 1.3937,
      "num_input_tokens_seen": 35564189472,
      "step": 45203
    },
    {
      "epoch": 4.795671546785487,
      "grad_norm": 0.6420945801576207,
      "learning_rate": 3.2792679016269434e-05,
      "loss": 1.4375,
      "num_input_tokens_seen": 35564976256,
      "step": 45204
    },
    {
      "epoch": 4.795777636325059,
      "grad_norm": 0.5483221152790929,
      "learning_rate": 3.279201866902312e-05,
      "loss": 1.2512,
      "num_input_tokens_seen": 35565762960,
      "step": 45205
    },
    {
      "epoch": 4.79588372586463,
      "grad_norm": 0.6958624198883491,
      "learning_rate": 3.2791358315755374e-05,
      "loss": 1.3152,
      "num_input_tokens_seen": 35566549696,
      "step": 45206
    },
    {
      "epoch": 4.7959898154042016,
      "grad_norm": 0.5045402301757048,
      "learning_rate": 3.279069795646667e-05,
      "loss": 1.2898,
      "num_input_tokens_seen": 35567336432,
      "step": 45207
    },
    {
      "epoch": 4.796095904943773,
      "grad_norm": 0.5502266611083577,
      "learning_rate": 3.2790037591157566e-05,
      "loss": 1.3182,
      "num_input_tokens_seen": 35568123136,
      "step": 45208
    },
    {
      "epoch": 4.796201994483344,
      "grad_norm": 0.5329989561740707,
      "learning_rate": 3.278937721982854e-05,
      "loss": 1.2621,
      "num_input_tokens_seen": 35568909904,
      "step": 45209
    },
    {
      "epoch": 4.7963080840229155,
      "grad_norm": 0.48849851573959463,
      "learning_rate": 3.2788716842480115e-05,
      "loss": 1.3596,
      "num_input_tokens_seen": 35569696592,
      "step": 45210
    },
    {
      "epoch": 4.796414173562487,
      "grad_norm": 0.5379579256788753,
      "learning_rate": 3.27880564591128e-05,
      "loss": 1.3825,
      "num_input_tokens_seen": 35570483376,
      "step": 45211
    },
    {
      "epoch": 4.7965202631020585,
      "grad_norm": 0.6434890088734196,
      "learning_rate": 3.278739606972711e-05,
      "loss": 1.3794,
      "num_input_tokens_seen": 35571270144,
      "step": 45212
    },
    {
      "epoch": 4.7966263526416295,
      "grad_norm": 0.5410580847665424,
      "learning_rate": 3.278673567432353e-05,
      "loss": 1.3107,
      "num_input_tokens_seen": 35572056864,
      "step": 45213
    },
    {
      "epoch": 4.7967324421812005,
      "grad_norm": 0.5551550348463253,
      "learning_rate": 3.27860752729026e-05,
      "loss": 1.3718,
      "num_input_tokens_seen": 35572843664,
      "step": 45214
    },
    {
      "epoch": 4.7968385317207725,
      "grad_norm": 0.6043287473060869,
      "learning_rate": 3.278541486546482e-05,
      "loss": 1.3124,
      "num_input_tokens_seen": 35573630384,
      "step": 45215
    },
    {
      "epoch": 4.7969446212603435,
      "grad_norm": 0.49473700092098477,
      "learning_rate": 3.278475445201069e-05,
      "loss": 1.2993,
      "num_input_tokens_seen": 35574416992,
      "step": 45216
    },
    {
      "epoch": 4.797050710799915,
      "grad_norm": 0.5507763213998561,
      "learning_rate": 3.278409403254074e-05,
      "loss": 1.3661,
      "num_input_tokens_seen": 35575203744,
      "step": 45217
    },
    {
      "epoch": 4.797156800339486,
      "grad_norm": 0.5301992577977974,
      "learning_rate": 3.278343360705547e-05,
      "loss": 1.2737,
      "num_input_tokens_seen": 35575990528,
      "step": 45218
    },
    {
      "epoch": 4.7972628898790575,
      "grad_norm": 0.5383516828314889,
      "learning_rate": 3.278277317555539e-05,
      "loss": 1.2947,
      "num_input_tokens_seen": 35576777360,
      "step": 45219
    },
    {
      "epoch": 4.797368979418629,
      "grad_norm": 0.5045952348109564,
      "learning_rate": 3.2782112738041015e-05,
      "loss": 1.3232,
      "num_input_tokens_seen": 35577564144,
      "step": 45220
    },
    {
      "epoch": 4.7974750689582,
      "grad_norm": 0.5014954155557432,
      "learning_rate": 3.278145229451285e-05,
      "loss": 1.2703,
      "num_input_tokens_seen": 35578350944,
      "step": 45221
    },
    {
      "epoch": 4.797581158497772,
      "grad_norm": 0.4946312627921644,
      "learning_rate": 3.2780791844971396e-05,
      "loss": 1.2794,
      "num_input_tokens_seen": 35579137728,
      "step": 45222
    },
    {
      "epoch": 4.797687248037343,
      "grad_norm": 0.516661204596619,
      "learning_rate": 3.278013138941719e-05,
      "loss": 1.2118,
      "num_input_tokens_seen": 35579924464,
      "step": 45223
    },
    {
      "epoch": 4.797793337576915,
      "grad_norm": 0.5654984878055604,
      "learning_rate": 3.277947092785072e-05,
      "loss": 1.2859,
      "num_input_tokens_seen": 35580711104,
      "step": 45224
    },
    {
      "epoch": 4.797899427116486,
      "grad_norm": 0.5696283958146181,
      "learning_rate": 3.27788104602725e-05,
      "loss": 1.3967,
      "num_input_tokens_seen": 35581497856,
      "step": 45225
    },
    {
      "epoch": 4.798005516656057,
      "grad_norm": 0.5528749949297256,
      "learning_rate": 3.277814998668305e-05,
      "loss": 1.3395,
      "num_input_tokens_seen": 35582284672,
      "step": 45226
    },
    {
      "epoch": 4.798111606195629,
      "grad_norm": 0.6181145159853448,
      "learning_rate": 3.277748950708287e-05,
      "loss": 1.3154,
      "num_input_tokens_seen": 35583071344,
      "step": 45227
    },
    {
      "epoch": 4.7982176957352,
      "grad_norm": 0.5465659193566276,
      "learning_rate": 3.277682902147247e-05,
      "loss": 1.3704,
      "num_input_tokens_seen": 35583858144,
      "step": 45228
    },
    {
      "epoch": 4.798323785274772,
      "grad_norm": 0.5312609626639887,
      "learning_rate": 3.277616852985237e-05,
      "loss": 1.3542,
      "num_input_tokens_seen": 35584644832,
      "step": 45229
    },
    {
      "epoch": 4.798429874814343,
      "grad_norm": 0.4924249087045216,
      "learning_rate": 3.277550803222308e-05,
      "loss": 1.1706,
      "num_input_tokens_seen": 35585431568,
      "step": 45230
    },
    {
      "epoch": 4.798535964353915,
      "grad_norm": 0.5398646548907559,
      "learning_rate": 3.2774847528585095e-05,
      "loss": 1.3378,
      "num_input_tokens_seen": 35586218320,
      "step": 45231
    },
    {
      "epoch": 4.798642053893486,
      "grad_norm": 0.5358763066497245,
      "learning_rate": 3.277418701893894e-05,
      "loss": 1.35,
      "num_input_tokens_seen": 35587005056,
      "step": 45232
    },
    {
      "epoch": 4.798748143433057,
      "grad_norm": 0.6479324484583686,
      "learning_rate": 3.277352650328512e-05,
      "loss": 1.3146,
      "num_input_tokens_seen": 35587791760,
      "step": 45233
    },
    {
      "epoch": 4.798854232972629,
      "grad_norm": 0.49878980909581944,
      "learning_rate": 3.277286598162415e-05,
      "loss": 1.3292,
      "num_input_tokens_seen": 35588578512,
      "step": 45234
    },
    {
      "epoch": 4.7989603225122,
      "grad_norm": 0.6003949818643967,
      "learning_rate": 3.277220545395654e-05,
      "loss": 1.2846,
      "num_input_tokens_seen": 35589365296,
      "step": 45235
    },
    {
      "epoch": 4.799066412051772,
      "grad_norm": 0.5369714395075497,
      "learning_rate": 3.2771544920282795e-05,
      "loss": 1.3609,
      "num_input_tokens_seen": 35590152016,
      "step": 45236
    },
    {
      "epoch": 4.799172501591343,
      "grad_norm": 0.5210908995457731,
      "learning_rate": 3.277088438060343e-05,
      "loss": 1.248,
      "num_input_tokens_seen": 35590938800,
      "step": 45237
    },
    {
      "epoch": 4.799278591130914,
      "grad_norm": 0.5544074687083153,
      "learning_rate": 3.277022383491894e-05,
      "loss": 1.2775,
      "num_input_tokens_seen": 35591725472,
      "step": 45238
    },
    {
      "epoch": 4.799384680670486,
      "grad_norm": 0.7150042012690362,
      "learning_rate": 3.2769563283229865e-05,
      "loss": 1.377,
      "num_input_tokens_seen": 35592512080,
      "step": 45239
    },
    {
      "epoch": 4.799490770210057,
      "grad_norm": 0.8163343646372083,
      "learning_rate": 3.27689027255367e-05,
      "loss": 1.4313,
      "num_input_tokens_seen": 35593298832,
      "step": 45240
    },
    {
      "epoch": 4.799596859749629,
      "grad_norm": 0.54306377758094,
      "learning_rate": 3.2768242161839947e-05,
      "loss": 1.2464,
      "num_input_tokens_seen": 35594085712,
      "step": 45241
    },
    {
      "epoch": 4.7997029492892,
      "grad_norm": 0.5266495929073837,
      "learning_rate": 3.276758159214012e-05,
      "loss": 1.3252,
      "num_input_tokens_seen": 35594872448,
      "step": 45242
    },
    {
      "epoch": 4.799809038828771,
      "grad_norm": 0.6564993093302438,
      "learning_rate": 3.276692101643775e-05,
      "loss": 1.3954,
      "num_input_tokens_seen": 35595659216,
      "step": 45243
    },
    {
      "epoch": 4.799915128368343,
      "grad_norm": 0.5242408780300536,
      "learning_rate": 3.276626043473332e-05,
      "loss": 1.3976,
      "num_input_tokens_seen": 35596445904,
      "step": 45244
    },
    {
      "epoch": 4.800021217907914,
      "grad_norm": 0.5402816413344516,
      "learning_rate": 3.276559984702735e-05,
      "loss": 1.3274,
      "num_input_tokens_seen": 35597232720,
      "step": 45245
    },
    {
      "epoch": 4.800127307447486,
      "grad_norm": 0.6105857614268327,
      "learning_rate": 3.276493925332036e-05,
      "loss": 1.2975,
      "num_input_tokens_seen": 35598019488,
      "step": 45246
    },
    {
      "epoch": 4.800233396987057,
      "grad_norm": 0.5007750408869864,
      "learning_rate": 3.276427865361284e-05,
      "loss": 1.2243,
      "num_input_tokens_seen": 35598806272,
      "step": 45247
    },
    {
      "epoch": 4.800339486526628,
      "grad_norm": 0.7071843676808189,
      "learning_rate": 3.2763618047905326e-05,
      "loss": 1.305,
      "num_input_tokens_seen": 35599593136,
      "step": 45248
    },
    {
      "epoch": 4.8004455760662,
      "grad_norm": 0.5538186543801209,
      "learning_rate": 3.276295743619832e-05,
      "loss": 1.4383,
      "num_input_tokens_seen": 35600379904,
      "step": 45249
    },
    {
      "epoch": 4.800551665605771,
      "grad_norm": 0.7107710521435429,
      "learning_rate": 3.276229681849231e-05,
      "loss": 1.4256,
      "num_input_tokens_seen": 35601166608,
      "step": 45250
    },
    {
      "epoch": 4.800657755145343,
      "grad_norm": 0.5286242821322542,
      "learning_rate": 3.276163619478784e-05,
      "loss": 1.2707,
      "num_input_tokens_seen": 35601953328,
      "step": 45251
    },
    {
      "epoch": 4.800763844684914,
      "grad_norm": 0.573791969607809,
      "learning_rate": 3.27609755650854e-05,
      "loss": 1.2478,
      "num_input_tokens_seen": 35602740048,
      "step": 45252
    },
    {
      "epoch": 4.800869934224486,
      "grad_norm": 0.6915648280642755,
      "learning_rate": 3.27603149293855e-05,
      "loss": 1.3454,
      "num_input_tokens_seen": 35603526832,
      "step": 45253
    },
    {
      "epoch": 4.800976023764057,
      "grad_norm": 0.6871825243402719,
      "learning_rate": 3.275965428768867e-05,
      "loss": 1.3028,
      "num_input_tokens_seen": 35604313616,
      "step": 45254
    },
    {
      "epoch": 4.801082113303628,
      "grad_norm": 0.5953605371305848,
      "learning_rate": 3.275899363999539e-05,
      "loss": 1.2982,
      "num_input_tokens_seen": 35605100400,
      "step": 45255
    },
    {
      "epoch": 4.8011882028432,
      "grad_norm": 0.5911690153820459,
      "learning_rate": 3.27583329863062e-05,
      "loss": 1.2885,
      "num_input_tokens_seen": 35605887104,
      "step": 45256
    },
    {
      "epoch": 4.801294292382771,
      "grad_norm": 0.49798823276479726,
      "learning_rate": 3.27576723266216e-05,
      "loss": 1.2316,
      "num_input_tokens_seen": 35606673792,
      "step": 45257
    },
    {
      "epoch": 4.801400381922343,
      "grad_norm": 0.6755126112188629,
      "learning_rate": 3.275701166094209e-05,
      "loss": 1.2914,
      "num_input_tokens_seen": 35607460480,
      "step": 45258
    },
    {
      "epoch": 4.801506471461914,
      "grad_norm": 0.5204313825771205,
      "learning_rate": 3.2756350989268184e-05,
      "loss": 1.2817,
      "num_input_tokens_seen": 35608247232,
      "step": 45259
    },
    {
      "epoch": 4.801612561001486,
      "grad_norm": 0.5969803940695381,
      "learning_rate": 3.275569031160041e-05,
      "loss": 1.2648,
      "num_input_tokens_seen": 35609033968,
      "step": 45260
    },
    {
      "epoch": 4.801718650541057,
      "grad_norm": 0.5010844044516465,
      "learning_rate": 3.275502962793926e-05,
      "loss": 1.3221,
      "num_input_tokens_seen": 35609820768,
      "step": 45261
    },
    {
      "epoch": 4.801824740080628,
      "grad_norm": 0.6390666361361631,
      "learning_rate": 3.275436893828525e-05,
      "loss": 1.3838,
      "num_input_tokens_seen": 35610607424,
      "step": 45262
    },
    {
      "epoch": 4.8019308296202,
      "grad_norm": 0.5931587997045574,
      "learning_rate": 3.275370824263889e-05,
      "loss": 1.3085,
      "num_input_tokens_seen": 35611394352,
      "step": 45263
    },
    {
      "epoch": 4.802036919159771,
      "grad_norm": 0.7434774566975979,
      "learning_rate": 3.27530475410007e-05,
      "loss": 1.3208,
      "num_input_tokens_seen": 35612181056,
      "step": 45264
    },
    {
      "epoch": 4.802143008699343,
      "grad_norm": 0.4910886082048275,
      "learning_rate": 3.275238683337118e-05,
      "loss": 1.276,
      "num_input_tokens_seen": 35612967824,
      "step": 45265
    },
    {
      "epoch": 4.802249098238914,
      "grad_norm": 0.5922496085952137,
      "learning_rate": 3.275172611975084e-05,
      "loss": 1.2191,
      "num_input_tokens_seen": 35613754624,
      "step": 45266
    },
    {
      "epoch": 4.802355187778485,
      "grad_norm": 0.5564664183145799,
      "learning_rate": 3.275106540014019e-05,
      "loss": 1.2665,
      "num_input_tokens_seen": 35614541456,
      "step": 45267
    },
    {
      "epoch": 4.802461277318057,
      "grad_norm": 0.4889486981852027,
      "learning_rate": 3.2750404674539744e-05,
      "loss": 1.2372,
      "num_input_tokens_seen": 35615328272,
      "step": 45268
    },
    {
      "epoch": 4.802567366857628,
      "grad_norm": 0.6210295247201295,
      "learning_rate": 3.2749743942950016e-05,
      "loss": 1.244,
      "num_input_tokens_seen": 35616115088,
      "step": 45269
    },
    {
      "epoch": 4.8026734563972,
      "grad_norm": 0.5493109150389197,
      "learning_rate": 3.274908320537152e-05,
      "loss": 1.2754,
      "num_input_tokens_seen": 35616901856,
      "step": 45270
    },
    {
      "epoch": 4.802779545936771,
      "grad_norm": 0.5447822785460685,
      "learning_rate": 3.274842246180475e-05,
      "loss": 1.2691,
      "num_input_tokens_seen": 35617688672,
      "step": 45271
    },
    {
      "epoch": 4.802885635476342,
      "grad_norm": 0.5035409328818717,
      "learning_rate": 3.274776171225024e-05,
      "loss": 1.2075,
      "num_input_tokens_seen": 35618475360,
      "step": 45272
    },
    {
      "epoch": 4.8029917250159135,
      "grad_norm": 0.5859461876270372,
      "learning_rate": 3.274710095670847e-05,
      "loss": 1.4448,
      "num_input_tokens_seen": 35619262144,
      "step": 45273
    },
    {
      "epoch": 4.803097814555485,
      "grad_norm": 0.5444005668290015,
      "learning_rate": 3.274644019517997e-05,
      "loss": 1.255,
      "num_input_tokens_seen": 35620048880,
      "step": 45274
    },
    {
      "epoch": 4.8032039040950565,
      "grad_norm": 0.515368447611124,
      "learning_rate": 3.274577942766526e-05,
      "loss": 1.2883,
      "num_input_tokens_seen": 35620835648,
      "step": 45275
    },
    {
      "epoch": 4.8033099936346275,
      "grad_norm": 0.4826893755035209,
      "learning_rate": 3.274511865416483e-05,
      "loss": 1.2506,
      "num_input_tokens_seen": 35621622304,
      "step": 45276
    },
    {
      "epoch": 4.8034160831741985,
      "grad_norm": 0.5724167283592461,
      "learning_rate": 3.27444578746792e-05,
      "loss": 1.3628,
      "num_input_tokens_seen": 35622409152,
      "step": 45277
    },
    {
      "epoch": 4.8035221727137705,
      "grad_norm": 0.5806933989774175,
      "learning_rate": 3.274379708920888e-05,
      "loss": 1.3705,
      "num_input_tokens_seen": 35623195872,
      "step": 45278
    },
    {
      "epoch": 4.8036282622533415,
      "grad_norm": 0.5664852699907525,
      "learning_rate": 3.274313629775438e-05,
      "loss": 1.3851,
      "num_input_tokens_seen": 35623982704,
      "step": 45279
    },
    {
      "epoch": 4.803734351792913,
      "grad_norm": 0.4669069461629109,
      "learning_rate": 3.2742475500316224e-05,
      "loss": 1.2825,
      "num_input_tokens_seen": 35624769392,
      "step": 45280
    },
    {
      "epoch": 4.8038404413324844,
      "grad_norm": 0.6143822021396849,
      "learning_rate": 3.2741814696894904e-05,
      "loss": 1.3066,
      "num_input_tokens_seen": 35625556064,
      "step": 45281
    },
    {
      "epoch": 4.803946530872056,
      "grad_norm": 0.6825869584421187,
      "learning_rate": 3.274115388749093e-05,
      "loss": 1.3096,
      "num_input_tokens_seen": 35626342928,
      "step": 45282
    },
    {
      "epoch": 4.804052620411627,
      "grad_norm": 0.48848288891183533,
      "learning_rate": 3.2740493072104815e-05,
      "loss": 1.2792,
      "num_input_tokens_seen": 35627129680,
      "step": 45283
    },
    {
      "epoch": 4.804158709951198,
      "grad_norm": 0.6109580472039166,
      "learning_rate": 3.273983225073709e-05,
      "loss": 1.2113,
      "num_input_tokens_seen": 35627916448,
      "step": 45284
    },
    {
      "epoch": 4.80426479949077,
      "grad_norm": 0.766116309433068,
      "learning_rate": 3.273917142338824e-05,
      "loss": 1.2391,
      "num_input_tokens_seen": 35628703280,
      "step": 45285
    },
    {
      "epoch": 4.804370889030341,
      "grad_norm": 0.5388553044255243,
      "learning_rate": 3.273851059005878e-05,
      "loss": 1.3168,
      "num_input_tokens_seen": 35629490128,
      "step": 45286
    },
    {
      "epoch": 4.804476978569913,
      "grad_norm": 0.6595079488857231,
      "learning_rate": 3.273784975074924e-05,
      "loss": 1.261,
      "num_input_tokens_seen": 35630276896,
      "step": 45287
    },
    {
      "epoch": 4.804583068109484,
      "grad_norm": 0.6093243456236679,
      "learning_rate": 3.2737188905460104e-05,
      "loss": 1.2693,
      "num_input_tokens_seen": 35631063616,
      "step": 45288
    },
    {
      "epoch": 4.804689157649056,
      "grad_norm": 0.557949815115516,
      "learning_rate": 3.2736528054191905e-05,
      "loss": 1.375,
      "num_input_tokens_seen": 35631850288,
      "step": 45289
    },
    {
      "epoch": 4.804795247188627,
      "grad_norm": 0.5699379221071524,
      "learning_rate": 3.2735867196945144e-05,
      "loss": 1.2888,
      "num_input_tokens_seen": 35632637056,
      "step": 45290
    },
    {
      "epoch": 4.804901336728198,
      "grad_norm": 0.5443827725099681,
      "learning_rate": 3.2735206333720316e-05,
      "loss": 1.3912,
      "num_input_tokens_seen": 35633423744,
      "step": 45291
    },
    {
      "epoch": 4.80500742626777,
      "grad_norm": 0.5713521548597226,
      "learning_rate": 3.273454546451797e-05,
      "loss": 1.3006,
      "num_input_tokens_seen": 35634210544,
      "step": 45292
    },
    {
      "epoch": 4.805113515807341,
      "grad_norm": 0.5454037352237008,
      "learning_rate": 3.2733884589338573e-05,
      "loss": 1.3116,
      "num_input_tokens_seen": 35634997328,
      "step": 45293
    },
    {
      "epoch": 4.805219605346913,
      "grad_norm": 0.5536616984837177,
      "learning_rate": 3.2733223708182675e-05,
      "loss": 1.2798,
      "num_input_tokens_seen": 35635784160,
      "step": 45294
    },
    {
      "epoch": 4.805325694886484,
      "grad_norm": 0.4993751602623268,
      "learning_rate": 3.273256282105076e-05,
      "loss": 1.3271,
      "num_input_tokens_seen": 35636570928,
      "step": 45295
    },
    {
      "epoch": 4.805431784426055,
      "grad_norm": 0.684319575778898,
      "learning_rate": 3.273190192794335e-05,
      "loss": 1.4045,
      "num_input_tokens_seen": 35637357584,
      "step": 45296
    },
    {
      "epoch": 4.805537873965627,
      "grad_norm": 0.538664128096874,
      "learning_rate": 3.273124102886095e-05,
      "loss": 1.2797,
      "num_input_tokens_seen": 35638144384,
      "step": 45297
    },
    {
      "epoch": 4.805643963505198,
      "grad_norm": 0.5341256104014479,
      "learning_rate": 3.273058012380408e-05,
      "loss": 1.2238,
      "num_input_tokens_seen": 35638931136,
      "step": 45298
    },
    {
      "epoch": 4.80575005304477,
      "grad_norm": 0.7362272406900567,
      "learning_rate": 3.272991921277324e-05,
      "loss": 1.3355,
      "num_input_tokens_seen": 35639717776,
      "step": 45299
    },
    {
      "epoch": 4.805856142584341,
      "grad_norm": 0.5623667031408672,
      "learning_rate": 3.272925829576894e-05,
      "loss": 1.3777,
      "num_input_tokens_seen": 35640504512,
      "step": 45300
    },
    {
      "epoch": 4.805962232123912,
      "grad_norm": 0.4988882633018357,
      "learning_rate": 3.2728597372791704e-05,
      "loss": 1.3333,
      "num_input_tokens_seen": 35641291312,
      "step": 45301
    },
    {
      "epoch": 4.806068321663484,
      "grad_norm": 0.5571609669848342,
      "learning_rate": 3.2727936443842026e-05,
      "loss": 1.1685,
      "num_input_tokens_seen": 35642078096,
      "step": 45302
    },
    {
      "epoch": 4.806174411203055,
      "grad_norm": 0.706195927610103,
      "learning_rate": 3.272727550892043e-05,
      "loss": 1.3484,
      "num_input_tokens_seen": 35642864832,
      "step": 45303
    },
    {
      "epoch": 4.806280500742627,
      "grad_norm": 0.4869027263067466,
      "learning_rate": 3.272661456802743e-05,
      "loss": 1.3136,
      "num_input_tokens_seen": 35643651568,
      "step": 45304
    },
    {
      "epoch": 4.806386590282198,
      "grad_norm": 0.7285687161897927,
      "learning_rate": 3.272595362116352e-05,
      "loss": 1.38,
      "num_input_tokens_seen": 35644438336,
      "step": 45305
    },
    {
      "epoch": 4.806492679821769,
      "grad_norm": 0.8599807343887134,
      "learning_rate": 3.2725292668329224e-05,
      "loss": 1.3055,
      "num_input_tokens_seen": 35645225152,
      "step": 45306
    },
    {
      "epoch": 4.806598769361341,
      "grad_norm": 0.5262220488656226,
      "learning_rate": 3.272463170952504e-05,
      "loss": 1.2116,
      "num_input_tokens_seen": 35646011872,
      "step": 45307
    },
    {
      "epoch": 4.806704858900912,
      "grad_norm": 0.7135909649198975,
      "learning_rate": 3.2723970744751495e-05,
      "loss": 1.3039,
      "num_input_tokens_seen": 35646798688,
      "step": 45308
    },
    {
      "epoch": 4.806810948440484,
      "grad_norm": 0.8136796637370715,
      "learning_rate": 3.2723309774009095e-05,
      "loss": 1.3097,
      "num_input_tokens_seen": 35647585456,
      "step": 45309
    },
    {
      "epoch": 4.806917037980055,
      "grad_norm": 0.5156934532561464,
      "learning_rate": 3.2722648797298346e-05,
      "loss": 1.2759,
      "num_input_tokens_seen": 35648372176,
      "step": 45310
    },
    {
      "epoch": 4.807023127519627,
      "grad_norm": 0.6350864191816384,
      "learning_rate": 3.2721987814619755e-05,
      "loss": 1.2425,
      "num_input_tokens_seen": 35649159008,
      "step": 45311
    },
    {
      "epoch": 4.807129217059198,
      "grad_norm": 0.9472518361745765,
      "learning_rate": 3.2721326825973844e-05,
      "loss": 1.3277,
      "num_input_tokens_seen": 35649945744,
      "step": 45312
    },
    {
      "epoch": 4.80723530659877,
      "grad_norm": 0.5167749063180193,
      "learning_rate": 3.2720665831361114e-05,
      "loss": 1.2832,
      "num_input_tokens_seen": 35650732528,
      "step": 45313
    },
    {
      "epoch": 4.807341396138341,
      "grad_norm": 0.7408875790786994,
      "learning_rate": 3.272000483078208e-05,
      "loss": 1.3992,
      "num_input_tokens_seen": 35651519344,
      "step": 45314
    },
    {
      "epoch": 4.807447485677912,
      "grad_norm": 0.5377578451920066,
      "learning_rate": 3.271934382423726e-05,
      "loss": 1.3402,
      "num_input_tokens_seen": 35652306176,
      "step": 45315
    },
    {
      "epoch": 4.807553575217484,
      "grad_norm": 0.8458229998684548,
      "learning_rate": 3.271868281172715e-05,
      "loss": 1.2836,
      "num_input_tokens_seen": 35653092976,
      "step": 45316
    },
    {
      "epoch": 4.807659664757055,
      "grad_norm": 0.5193680998889467,
      "learning_rate": 3.271802179325227e-05,
      "loss": 1.3706,
      "num_input_tokens_seen": 35653879744,
      "step": 45317
    },
    {
      "epoch": 4.807765754296627,
      "grad_norm": 0.8571929631361991,
      "learning_rate": 3.271736076881313e-05,
      "loss": 1.3356,
      "num_input_tokens_seen": 35654666528,
      "step": 45318
    },
    {
      "epoch": 4.807871843836198,
      "grad_norm": 0.7011722042746035,
      "learning_rate": 3.271669973841024e-05,
      "loss": 1.314,
      "num_input_tokens_seen": 35655453328,
      "step": 45319
    },
    {
      "epoch": 4.807977933375769,
      "grad_norm": 0.5117332508226895,
      "learning_rate": 3.271603870204411e-05,
      "loss": 1.2386,
      "num_input_tokens_seen": 35656240064,
      "step": 45320
    },
    {
      "epoch": 4.808084022915341,
      "grad_norm": 0.9307012659003838,
      "learning_rate": 3.271537765971525e-05,
      "loss": 1.3341,
      "num_input_tokens_seen": 35657026880,
      "step": 45321
    },
    {
      "epoch": 4.808190112454912,
      "grad_norm": 0.6532066213691305,
      "learning_rate": 3.271471661142418e-05,
      "loss": 1.3429,
      "num_input_tokens_seen": 35657813760,
      "step": 45322
    },
    {
      "epoch": 4.808296201994484,
      "grad_norm": 0.5450853661818572,
      "learning_rate": 3.27140555571714e-05,
      "loss": 1.2043,
      "num_input_tokens_seen": 35658600576,
      "step": 45323
    },
    {
      "epoch": 4.808402291534055,
      "grad_norm": 0.7143157437555021,
      "learning_rate": 3.271339449695742e-05,
      "loss": 1.3775,
      "num_input_tokens_seen": 35659387344,
      "step": 45324
    },
    {
      "epoch": 4.808508381073626,
      "grad_norm": 0.6152319583374541,
      "learning_rate": 3.2712733430782756e-05,
      "loss": 1.3676,
      "num_input_tokens_seen": 35660174080,
      "step": 45325
    },
    {
      "epoch": 4.808614470613198,
      "grad_norm": 0.5397442288569546,
      "learning_rate": 3.2712072358647924e-05,
      "loss": 1.3095,
      "num_input_tokens_seen": 35660960800,
      "step": 45326
    },
    {
      "epoch": 4.808720560152769,
      "grad_norm": 0.590185875341387,
      "learning_rate": 3.271141128055342e-05,
      "loss": 1.2423,
      "num_input_tokens_seen": 35661747440,
      "step": 45327
    },
    {
      "epoch": 4.808826649692341,
      "grad_norm": 0.6521592397940041,
      "learning_rate": 3.271075019649977e-05,
      "loss": 1.3115,
      "num_input_tokens_seen": 35662534192,
      "step": 45328
    },
    {
      "epoch": 4.808932739231912,
      "grad_norm": 0.6231576551557538,
      "learning_rate": 3.271008910648747e-05,
      "loss": 1.3259,
      "num_input_tokens_seen": 35663320976,
      "step": 45329
    },
    {
      "epoch": 4.809038828771483,
      "grad_norm": 0.5844586842724175,
      "learning_rate": 3.270942801051705e-05,
      "loss": 1.3954,
      "num_input_tokens_seen": 35664107712,
      "step": 45330
    },
    {
      "epoch": 4.809144918311055,
      "grad_norm": 0.5711887462459904,
      "learning_rate": 3.270876690858901e-05,
      "loss": 1.3081,
      "num_input_tokens_seen": 35664894448,
      "step": 45331
    },
    {
      "epoch": 4.809251007850626,
      "grad_norm": 0.565675491762028,
      "learning_rate": 3.2708105800703857e-05,
      "loss": 1.2321,
      "num_input_tokens_seen": 35665681200,
      "step": 45332
    },
    {
      "epoch": 4.809357097390198,
      "grad_norm": 0.5102564911863875,
      "learning_rate": 3.270744468686211e-05,
      "loss": 1.1557,
      "num_input_tokens_seen": 35666468000,
      "step": 45333
    },
    {
      "epoch": 4.809463186929769,
      "grad_norm": 0.5343726621820883,
      "learning_rate": 3.270678356706427e-05,
      "loss": 1.2828,
      "num_input_tokens_seen": 35667254832,
      "step": 45334
    },
    {
      "epoch": 4.80956927646934,
      "grad_norm": 0.5154762660011416,
      "learning_rate": 3.2706122441310856e-05,
      "loss": 1.2681,
      "num_input_tokens_seen": 35668041600,
      "step": 45335
    },
    {
      "epoch": 4.8096753660089115,
      "grad_norm": 0.4820647326558163,
      "learning_rate": 3.270546130960237e-05,
      "loss": 1.3144,
      "num_input_tokens_seen": 35668828384,
      "step": 45336
    },
    {
      "epoch": 4.809781455548483,
      "grad_norm": 0.5924501643680439,
      "learning_rate": 3.2704800171939346e-05,
      "loss": 1.2712,
      "num_input_tokens_seen": 35669615184,
      "step": 45337
    },
    {
      "epoch": 4.8098875450880545,
      "grad_norm": 0.8124082641608282,
      "learning_rate": 3.2704139028322265e-05,
      "loss": 1.384,
      "num_input_tokens_seen": 35670401968,
      "step": 45338
    },
    {
      "epoch": 4.8099936346276255,
      "grad_norm": 0.5018603413880065,
      "learning_rate": 3.2703477878751654e-05,
      "loss": 1.2985,
      "num_input_tokens_seen": 35671188704,
      "step": 45339
    },
    {
      "epoch": 4.810099724167197,
      "grad_norm": 0.5418483702574838,
      "learning_rate": 3.270281672322802e-05,
      "loss": 1.2508,
      "num_input_tokens_seen": 35671975440,
      "step": 45340
    },
    {
      "epoch": 4.8102058137067685,
      "grad_norm": 0.46175941570744017,
      "learning_rate": 3.270215556175188e-05,
      "loss": 1.2467,
      "num_input_tokens_seen": 35672762256,
      "step": 45341
    },
    {
      "epoch": 4.81031190324634,
      "grad_norm": 0.5585040755155406,
      "learning_rate": 3.2701494394323736e-05,
      "loss": 1.3522,
      "num_input_tokens_seen": 35673548992,
      "step": 45342
    },
    {
      "epoch": 4.810417992785911,
      "grad_norm": 0.501050409350614,
      "learning_rate": 3.2700833220944106e-05,
      "loss": 1.2059,
      "num_input_tokens_seen": 35674335744,
      "step": 45343
    },
    {
      "epoch": 4.8105240823254825,
      "grad_norm": 0.5230666756144571,
      "learning_rate": 3.2700172041613495e-05,
      "loss": 1.4169,
      "num_input_tokens_seen": 35675122352,
      "step": 45344
    },
    {
      "epoch": 4.810630171865054,
      "grad_norm": 0.5532107408308223,
      "learning_rate": 3.269951085633242e-05,
      "loss": 1.3524,
      "num_input_tokens_seen": 35675909056,
      "step": 45345
    },
    {
      "epoch": 4.810736261404625,
      "grad_norm": 0.5751843456719347,
      "learning_rate": 3.269884966510139e-05,
      "loss": 1.3719,
      "num_input_tokens_seen": 35676695760,
      "step": 45346
    },
    {
      "epoch": 4.810842350944197,
      "grad_norm": 0.5725271425148254,
      "learning_rate": 3.2698188467920914e-05,
      "loss": 1.3954,
      "num_input_tokens_seen": 35677482560,
      "step": 45347
    },
    {
      "epoch": 4.810948440483768,
      "grad_norm": 0.6018272373816258,
      "learning_rate": 3.26975272647915e-05,
      "loss": 1.3149,
      "num_input_tokens_seen": 35678269424,
      "step": 45348
    },
    {
      "epoch": 4.811054530023339,
      "grad_norm": 0.64330646155657,
      "learning_rate": 3.269686605571367e-05,
      "loss": 1.3049,
      "num_input_tokens_seen": 35679056144,
      "step": 45349
    },
    {
      "epoch": 4.811160619562911,
      "grad_norm": 0.56041902273889,
      "learning_rate": 3.2696204840687916e-05,
      "loss": 1.2877,
      "num_input_tokens_seen": 35679842960,
      "step": 45350
    },
    {
      "epoch": 4.811266709102482,
      "grad_norm": 0.6464504800691256,
      "learning_rate": 3.269554361971477e-05,
      "loss": 1.3062,
      "num_input_tokens_seen": 35680629696,
      "step": 45351
    },
    {
      "epoch": 4.811372798642054,
      "grad_norm": 0.5008239913409386,
      "learning_rate": 3.269488239279473e-05,
      "loss": 1.2704,
      "num_input_tokens_seen": 35681416480,
      "step": 45352
    },
    {
      "epoch": 4.811478888181625,
      "grad_norm": 0.5931483717089866,
      "learning_rate": 3.269422115992832e-05,
      "loss": 1.2904,
      "num_input_tokens_seen": 35682203168,
      "step": 45353
    },
    {
      "epoch": 4.811584977721196,
      "grad_norm": 0.5596969532773337,
      "learning_rate": 3.269355992111603e-05,
      "loss": 1.2328,
      "num_input_tokens_seen": 35682989936,
      "step": 45354
    },
    {
      "epoch": 4.811691067260768,
      "grad_norm": 0.49951218232306854,
      "learning_rate": 3.2692898676358385e-05,
      "loss": 1.2528,
      "num_input_tokens_seen": 35683776800,
      "step": 45355
    },
    {
      "epoch": 4.811797156800339,
      "grad_norm": 0.5714480280575202,
      "learning_rate": 3.2692237425655896e-05,
      "loss": 1.2564,
      "num_input_tokens_seen": 35684563536,
      "step": 45356
    },
    {
      "epoch": 4.811903246339911,
      "grad_norm": 0.5816504038429523,
      "learning_rate": 3.269157616900907e-05,
      "loss": 1.2253,
      "num_input_tokens_seen": 35685350416,
      "step": 45357
    },
    {
      "epoch": 4.812009335879482,
      "grad_norm": 0.6289457380830654,
      "learning_rate": 3.269091490641842e-05,
      "loss": 1.3141,
      "num_input_tokens_seen": 35686137168,
      "step": 45358
    },
    {
      "epoch": 4.812115425419053,
      "grad_norm": 0.4982453188250016,
      "learning_rate": 3.269025363788446e-05,
      "loss": 1.1978,
      "num_input_tokens_seen": 35686924016,
      "step": 45359
    },
    {
      "epoch": 4.812221514958625,
      "grad_norm": 0.56433065679248,
      "learning_rate": 3.2689592363407686e-05,
      "loss": 1.2168,
      "num_input_tokens_seen": 35687710752,
      "step": 45360
    },
    {
      "epoch": 4.812327604498196,
      "grad_norm": 0.46044445416474855,
      "learning_rate": 3.268893108298864e-05,
      "loss": 1.21,
      "num_input_tokens_seen": 35688497456,
      "step": 45361
    },
    {
      "epoch": 4.812433694037768,
      "grad_norm": 0.6069550014872149,
      "learning_rate": 3.26882697966278e-05,
      "loss": 1.2858,
      "num_input_tokens_seen": 35689284192,
      "step": 45362
    },
    {
      "epoch": 4.812539783577339,
      "grad_norm": 0.48641688917979825,
      "learning_rate": 3.268760850432569e-05,
      "loss": 1.2298,
      "num_input_tokens_seen": 35690070976,
      "step": 45363
    },
    {
      "epoch": 4.812645873116911,
      "grad_norm": 0.5225703895276433,
      "learning_rate": 3.268694720608283e-05,
      "loss": 1.2849,
      "num_input_tokens_seen": 35690857728,
      "step": 45364
    },
    {
      "epoch": 4.812751962656482,
      "grad_norm": 0.5962841244246517,
      "learning_rate": 3.2686285901899715e-05,
      "loss": 1.2407,
      "num_input_tokens_seen": 35691644624,
      "step": 45365
    },
    {
      "epoch": 4.812858052196053,
      "grad_norm": 0.4811348647239284,
      "learning_rate": 3.268562459177686e-05,
      "loss": 1.2089,
      "num_input_tokens_seen": 35692431392,
      "step": 45366
    },
    {
      "epoch": 4.812964141735625,
      "grad_norm": 0.5719089775616301,
      "learning_rate": 3.2684963275714796e-05,
      "loss": 1.2934,
      "num_input_tokens_seen": 35693218208,
      "step": 45367
    },
    {
      "epoch": 4.813070231275196,
      "grad_norm": 0.5857567332063137,
      "learning_rate": 3.2684301953714e-05,
      "loss": 1.4054,
      "num_input_tokens_seen": 35694005008,
      "step": 45368
    },
    {
      "epoch": 4.813176320814768,
      "grad_norm": 0.44814433702467416,
      "learning_rate": 3.2683640625775015e-05,
      "loss": 1.2459,
      "num_input_tokens_seen": 35694791792,
      "step": 45369
    },
    {
      "epoch": 4.813282410354339,
      "grad_norm": 0.5230917952160408,
      "learning_rate": 3.2682979291898336e-05,
      "loss": 1.2854,
      "num_input_tokens_seen": 35695578560,
      "step": 45370
    },
    {
      "epoch": 4.813388499893911,
      "grad_norm": 0.5256064861177915,
      "learning_rate": 3.268231795208447e-05,
      "loss": 1.3303,
      "num_input_tokens_seen": 35696365392,
      "step": 45371
    },
    {
      "epoch": 4.813494589433482,
      "grad_norm": 0.5998186337225772,
      "learning_rate": 3.2681656606333935e-05,
      "loss": 1.3954,
      "num_input_tokens_seen": 35697152128,
      "step": 45372
    },
    {
      "epoch": 4.813600678973053,
      "grad_norm": 0.5727367902779003,
      "learning_rate": 3.268099525464724e-05,
      "loss": 1.3504,
      "num_input_tokens_seen": 35697938832,
      "step": 45373
    },
    {
      "epoch": 4.813706768512625,
      "grad_norm": 0.506678594868429,
      "learning_rate": 3.268033389702491e-05,
      "loss": 1.368,
      "num_input_tokens_seen": 35698725504,
      "step": 45374
    },
    {
      "epoch": 4.813812858052196,
      "grad_norm": 0.4777803447072222,
      "learning_rate": 3.267967253346743e-05,
      "loss": 1.3704,
      "num_input_tokens_seen": 35699512320,
      "step": 45375
    },
    {
      "epoch": 4.813918947591768,
      "grad_norm": 0.4804405662869928,
      "learning_rate": 3.2679011163975326e-05,
      "loss": 1.273,
      "num_input_tokens_seen": 35700299056,
      "step": 45376
    },
    {
      "epoch": 4.814025037131339,
      "grad_norm": 0.5805011313581225,
      "learning_rate": 3.267834978854911e-05,
      "loss": 1.3372,
      "num_input_tokens_seen": 35701085840,
      "step": 45377
    },
    {
      "epoch": 4.81413112667091,
      "grad_norm": 0.48729014475821003,
      "learning_rate": 3.267768840718929e-05,
      "loss": 1.2637,
      "num_input_tokens_seen": 35701872576,
      "step": 45378
    },
    {
      "epoch": 4.814237216210482,
      "grad_norm": 0.5009934717802834,
      "learning_rate": 3.2677027019896377e-05,
      "loss": 1.2389,
      "num_input_tokens_seen": 35702659328,
      "step": 45379
    },
    {
      "epoch": 4.814343305750053,
      "grad_norm": 0.6181754548821592,
      "learning_rate": 3.2676365626670884e-05,
      "loss": 1.3464,
      "num_input_tokens_seen": 35703446096,
      "step": 45380
    },
    {
      "epoch": 4.814449395289625,
      "grad_norm": 0.48403833834449733,
      "learning_rate": 3.267570422751332e-05,
      "loss": 1.3032,
      "num_input_tokens_seen": 35704232848,
      "step": 45381
    },
    {
      "epoch": 4.814555484829196,
      "grad_norm": 0.5945769336378415,
      "learning_rate": 3.26750428224242e-05,
      "loss": 1.4301,
      "num_input_tokens_seen": 35705019568,
      "step": 45382
    },
    {
      "epoch": 4.814661574368767,
      "grad_norm": 0.636363304172301,
      "learning_rate": 3.2674381411404026e-05,
      "loss": 1.3572,
      "num_input_tokens_seen": 35705806240,
      "step": 45383
    },
    {
      "epoch": 4.814767663908339,
      "grad_norm": 0.5755816458522387,
      "learning_rate": 3.267371999445332e-05,
      "loss": 1.2946,
      "num_input_tokens_seen": 35706593072,
      "step": 45384
    },
    {
      "epoch": 4.81487375344791,
      "grad_norm": 0.5064046356209956,
      "learning_rate": 3.2673058571572584e-05,
      "loss": 1.2683,
      "num_input_tokens_seen": 35707379856,
      "step": 45385
    },
    {
      "epoch": 4.814979842987482,
      "grad_norm": 0.6577723648113382,
      "learning_rate": 3.267239714276234e-05,
      "loss": 1.3064,
      "num_input_tokens_seen": 35708166720,
      "step": 45386
    },
    {
      "epoch": 4.815085932527053,
      "grad_norm": 0.4934551328932834,
      "learning_rate": 3.267173570802309e-05,
      "loss": 1.3126,
      "num_input_tokens_seen": 35708953424,
      "step": 45387
    },
    {
      "epoch": 4.815192022066624,
      "grad_norm": 0.7166050084946561,
      "learning_rate": 3.267107426735535e-05,
      "loss": 1.2255,
      "num_input_tokens_seen": 35709740224,
      "step": 45388
    },
    {
      "epoch": 4.815298111606196,
      "grad_norm": 0.5814720598933886,
      "learning_rate": 3.267041282075962e-05,
      "loss": 1.2801,
      "num_input_tokens_seen": 35710526976,
      "step": 45389
    },
    {
      "epoch": 4.815404201145767,
      "grad_norm": 0.5069946504028506,
      "learning_rate": 3.266975136823643e-05,
      "loss": 1.16,
      "num_input_tokens_seen": 35711313808,
      "step": 45390
    },
    {
      "epoch": 4.815510290685339,
      "grad_norm": 0.6490041348664475,
      "learning_rate": 3.266908990978627e-05,
      "loss": 1.3047,
      "num_input_tokens_seen": 35712100560,
      "step": 45391
    },
    {
      "epoch": 4.81561638022491,
      "grad_norm": 0.5359752220635962,
      "learning_rate": 3.266842844540967e-05,
      "loss": 1.323,
      "num_input_tokens_seen": 35712887392,
      "step": 45392
    },
    {
      "epoch": 4.815722469764482,
      "grad_norm": 0.5692768838556347,
      "learning_rate": 3.266776697510714e-05,
      "loss": 1.2966,
      "num_input_tokens_seen": 35713674176,
      "step": 45393
    },
    {
      "epoch": 4.815828559304053,
      "grad_norm": 0.5718057314890292,
      "learning_rate": 3.266710549887917e-05,
      "loss": 1.2482,
      "num_input_tokens_seen": 35714460880,
      "step": 45394
    },
    {
      "epoch": 4.815934648843624,
      "grad_norm": 0.5321442217741235,
      "learning_rate": 3.2666444016726295e-05,
      "loss": 1.2601,
      "num_input_tokens_seen": 35715247664,
      "step": 45395
    },
    {
      "epoch": 4.816040738383196,
      "grad_norm": 0.6116914852326695,
      "learning_rate": 3.2665782528649016e-05,
      "loss": 1.4078,
      "num_input_tokens_seen": 35716034432,
      "step": 45396
    },
    {
      "epoch": 4.816146827922767,
      "grad_norm": 0.6954624704009316,
      "learning_rate": 3.2665121034647846e-05,
      "loss": 1.3378,
      "num_input_tokens_seen": 35716821216,
      "step": 45397
    },
    {
      "epoch": 4.8162529174623385,
      "grad_norm": 0.5216572988804237,
      "learning_rate": 3.2664459534723294e-05,
      "loss": 1.2331,
      "num_input_tokens_seen": 35717608032,
      "step": 45398
    },
    {
      "epoch": 4.8163590070019096,
      "grad_norm": 0.5571087258716182,
      "learning_rate": 3.2663798028875867e-05,
      "loss": 1.3506,
      "num_input_tokens_seen": 35718394816,
      "step": 45399
    },
    {
      "epoch": 4.8164650965414815,
      "grad_norm": 0.6024459932351235,
      "learning_rate": 3.2663136517106094e-05,
      "loss": 1.3742,
      "num_input_tokens_seen": 35719181616,
      "step": 45400
    },
    {
      "epoch": 4.8165711860810525,
      "grad_norm": 0.6146098768300282,
      "learning_rate": 3.266247499941447e-05,
      "loss": 1.4035,
      "num_input_tokens_seen": 35719968368,
      "step": 45401
    },
    {
      "epoch": 4.8166772756206235,
      "grad_norm": 0.573508796043248,
      "learning_rate": 3.26618134758015e-05,
      "loss": 1.2274,
      "num_input_tokens_seen": 35720755104,
      "step": 45402
    },
    {
      "epoch": 4.8167833651601955,
      "grad_norm": 0.5445011258793908,
      "learning_rate": 3.266115194626771e-05,
      "loss": 1.2608,
      "num_input_tokens_seen": 35721541872,
      "step": 45403
    },
    {
      "epoch": 4.8168894546997665,
      "grad_norm": 0.4637418959874447,
      "learning_rate": 3.266049041081362e-05,
      "loss": 1.2165,
      "num_input_tokens_seen": 35722328720,
      "step": 45404
    },
    {
      "epoch": 4.816995544239338,
      "grad_norm": 0.4863146407606782,
      "learning_rate": 3.2659828869439705e-05,
      "loss": 1.3749,
      "num_input_tokens_seen": 35723115472,
      "step": 45405
    },
    {
      "epoch": 4.817101633778909,
      "grad_norm": 0.7176525516598437,
      "learning_rate": 3.265916732214651e-05,
      "loss": 1.3288,
      "num_input_tokens_seen": 35723902192,
      "step": 45406
    },
    {
      "epoch": 4.8172077233184805,
      "grad_norm": 0.48703276278340774,
      "learning_rate": 3.265850576893454e-05,
      "loss": 1.2782,
      "num_input_tokens_seen": 35724688944,
      "step": 45407
    },
    {
      "epoch": 4.817313812858052,
      "grad_norm": 0.5898631369324991,
      "learning_rate": 3.265784420980429e-05,
      "loss": 1.3201,
      "num_input_tokens_seen": 35725475696,
      "step": 45408
    },
    {
      "epoch": 4.817419902397623,
      "grad_norm": 0.8120057416687064,
      "learning_rate": 3.2657182644756296e-05,
      "loss": 1.358,
      "num_input_tokens_seen": 35726262448,
      "step": 45409
    },
    {
      "epoch": 4.817525991937195,
      "grad_norm": 0.5122866253223944,
      "learning_rate": 3.265652107379105e-05,
      "loss": 1.356,
      "num_input_tokens_seen": 35727049232,
      "step": 45410
    },
    {
      "epoch": 4.817632081476766,
      "grad_norm": 0.8066273892478215,
      "learning_rate": 3.265585949690907e-05,
      "loss": 1.3895,
      "num_input_tokens_seen": 35727835920,
      "step": 45411
    },
    {
      "epoch": 4.817738171016337,
      "grad_norm": 0.5231276344608411,
      "learning_rate": 3.2655197914110866e-05,
      "loss": 1.4734,
      "num_input_tokens_seen": 35728622656,
      "step": 45412
    },
    {
      "epoch": 4.817844260555909,
      "grad_norm": 0.638340192824887,
      "learning_rate": 3.265453632539695e-05,
      "loss": 1.2739,
      "num_input_tokens_seen": 35729409440,
      "step": 45413
    },
    {
      "epoch": 4.81795035009548,
      "grad_norm": 0.5400477575240838,
      "learning_rate": 3.265387473076783e-05,
      "loss": 1.2991,
      "num_input_tokens_seen": 35730196208,
      "step": 45414
    },
    {
      "epoch": 4.818056439635052,
      "grad_norm": 0.5283120305737452,
      "learning_rate": 3.265321313022403e-05,
      "loss": 1.3156,
      "num_input_tokens_seen": 35730982976,
      "step": 45415
    },
    {
      "epoch": 4.818162529174623,
      "grad_norm": 0.5091677628084369,
      "learning_rate": 3.265255152376604e-05,
      "loss": 1.3068,
      "num_input_tokens_seen": 35731769760,
      "step": 45416
    },
    {
      "epoch": 4.818268618714194,
      "grad_norm": 0.5329790304373877,
      "learning_rate": 3.265188991139438e-05,
      "loss": 1.3122,
      "num_input_tokens_seen": 35732556528,
      "step": 45417
    },
    {
      "epoch": 4.818374708253766,
      "grad_norm": 0.5565540841631396,
      "learning_rate": 3.265122829310958e-05,
      "loss": 1.3403,
      "num_input_tokens_seen": 35733343232,
      "step": 45418
    },
    {
      "epoch": 4.818480797793337,
      "grad_norm": 0.46327369668804763,
      "learning_rate": 3.2650566668912126e-05,
      "loss": 1.2664,
      "num_input_tokens_seen": 35734130000,
      "step": 45419
    },
    {
      "epoch": 4.818586887332909,
      "grad_norm": 0.5291544979205468,
      "learning_rate": 3.264990503880253e-05,
      "loss": 1.2589,
      "num_input_tokens_seen": 35734916656,
      "step": 45420
    },
    {
      "epoch": 4.81869297687248,
      "grad_norm": 0.6333211415824277,
      "learning_rate": 3.264924340278133e-05,
      "loss": 1.3266,
      "num_input_tokens_seen": 35735703472,
      "step": 45421
    },
    {
      "epoch": 4.818799066412052,
      "grad_norm": 0.575311944228804,
      "learning_rate": 3.2648581760849e-05,
      "loss": 1.1875,
      "num_input_tokens_seen": 35736490272,
      "step": 45422
    },
    {
      "epoch": 4.818905155951623,
      "grad_norm": 0.6706090863182637,
      "learning_rate": 3.264792011300608e-05,
      "loss": 1.3434,
      "num_input_tokens_seen": 35737276944,
      "step": 45423
    },
    {
      "epoch": 4.819011245491194,
      "grad_norm": 0.5554573203955087,
      "learning_rate": 3.264725845925308e-05,
      "loss": 1.3964,
      "num_input_tokens_seen": 35738063680,
      "step": 45424
    },
    {
      "epoch": 4.819117335030766,
      "grad_norm": 0.6063890193263213,
      "learning_rate": 3.264659679959049e-05,
      "loss": 1.3399,
      "num_input_tokens_seen": 35738850400,
      "step": 45425
    },
    {
      "epoch": 4.819223424570337,
      "grad_norm": 0.5474762998214162,
      "learning_rate": 3.264593513401884e-05,
      "loss": 1.4093,
      "num_input_tokens_seen": 35739637168,
      "step": 45426
    },
    {
      "epoch": 4.819329514109909,
      "grad_norm": 0.8859897176508349,
      "learning_rate": 3.264527346253864e-05,
      "loss": 1.4818,
      "num_input_tokens_seen": 35740423904,
      "step": 45427
    },
    {
      "epoch": 4.81943560364948,
      "grad_norm": 0.548087049400149,
      "learning_rate": 3.2644611785150386e-05,
      "loss": 1.2449,
      "num_input_tokens_seen": 35741210768,
      "step": 45428
    },
    {
      "epoch": 4.819541693189052,
      "grad_norm": 0.6259630033102235,
      "learning_rate": 3.264395010185461e-05,
      "loss": 1.276,
      "num_input_tokens_seen": 35741997584,
      "step": 45429
    },
    {
      "epoch": 4.819647782728623,
      "grad_norm": 0.5052612998876401,
      "learning_rate": 3.2643288412651806e-05,
      "loss": 1.3183,
      "num_input_tokens_seen": 35742784320,
      "step": 45430
    },
    {
      "epoch": 4.819753872268194,
      "grad_norm": 0.7268145254389405,
      "learning_rate": 3.26426267175425e-05,
      "loss": 1.2967,
      "num_input_tokens_seen": 35743571024,
      "step": 45431
    },
    {
      "epoch": 4.819859961807766,
      "grad_norm": 0.6933578661656195,
      "learning_rate": 3.264196501652719e-05,
      "loss": 1.2625,
      "num_input_tokens_seen": 35744357888,
      "step": 45432
    },
    {
      "epoch": 4.819966051347337,
      "grad_norm": 0.8210950755084239,
      "learning_rate": 3.2641303309606396e-05,
      "loss": 1.3433,
      "num_input_tokens_seen": 35745144624,
      "step": 45433
    },
    {
      "epoch": 4.820072140886909,
      "grad_norm": 0.5509386779505,
      "learning_rate": 3.2640641596780633e-05,
      "loss": 1.2691,
      "num_input_tokens_seen": 35745931312,
      "step": 45434
    },
    {
      "epoch": 4.82017823042648,
      "grad_norm": 0.6208366979504925,
      "learning_rate": 3.2639979878050394e-05,
      "loss": 1.2621,
      "num_input_tokens_seen": 35746718064,
      "step": 45435
    },
    {
      "epoch": 4.820284319966051,
      "grad_norm": 0.7250138213372195,
      "learning_rate": 3.2639318153416214e-05,
      "loss": 1.3736,
      "num_input_tokens_seen": 35747504848,
      "step": 45436
    },
    {
      "epoch": 4.820390409505623,
      "grad_norm": 0.5530590663279867,
      "learning_rate": 3.2638656422878586e-05,
      "loss": 1.2478,
      "num_input_tokens_seen": 35748291536,
      "step": 45437
    },
    {
      "epoch": 4.820496499045194,
      "grad_norm": 0.8241658766676317,
      "learning_rate": 3.263799468643803e-05,
      "loss": 1.1836,
      "num_input_tokens_seen": 35749078352,
      "step": 45438
    },
    {
      "epoch": 4.820602588584766,
      "grad_norm": 0.5256594079069252,
      "learning_rate": 3.263733294409506e-05,
      "loss": 1.2658,
      "num_input_tokens_seen": 35749865104,
      "step": 45439
    },
    {
      "epoch": 4.820708678124337,
      "grad_norm": 0.7766001208398825,
      "learning_rate": 3.2636671195850185e-05,
      "loss": 1.3554,
      "num_input_tokens_seen": 35750651872,
      "step": 45440
    },
    {
      "epoch": 4.820814767663908,
      "grad_norm": 0.575955752368505,
      "learning_rate": 3.2636009441703906e-05,
      "loss": 1.3398,
      "num_input_tokens_seen": 35751438688,
      "step": 45441
    },
    {
      "epoch": 4.82092085720348,
      "grad_norm": 0.6385192742559151,
      "learning_rate": 3.263534768165675e-05,
      "loss": 1.3967,
      "num_input_tokens_seen": 35752225376,
      "step": 45442
    },
    {
      "epoch": 4.821026946743051,
      "grad_norm": 0.4666770070927663,
      "learning_rate": 3.263468591570922e-05,
      "loss": 1.289,
      "num_input_tokens_seen": 35753012064,
      "step": 45443
    },
    {
      "epoch": 4.821133036282623,
      "grad_norm": 0.5719141841164825,
      "learning_rate": 3.263402414386182e-05,
      "loss": 1.262,
      "num_input_tokens_seen": 35753798800,
      "step": 45444
    },
    {
      "epoch": 4.821239125822194,
      "grad_norm": 0.5741362271265795,
      "learning_rate": 3.263336236611508e-05,
      "loss": 1.3605,
      "num_input_tokens_seen": 35754585552,
      "step": 45445
    },
    {
      "epoch": 4.821345215361765,
      "grad_norm": 0.5480821663173964,
      "learning_rate": 3.26327005824695e-05,
      "loss": 1.327,
      "num_input_tokens_seen": 35755372288,
      "step": 45446
    },
    {
      "epoch": 4.821451304901337,
      "grad_norm": 0.6366230927628976,
      "learning_rate": 3.263203879292559e-05,
      "loss": 1.2845,
      "num_input_tokens_seen": 35756159056,
      "step": 45447
    },
    {
      "epoch": 4.821557394440908,
      "grad_norm": 0.7251885460955527,
      "learning_rate": 3.263137699748386e-05,
      "loss": 1.3032,
      "num_input_tokens_seen": 35756945840,
      "step": 45448
    },
    {
      "epoch": 4.82166348398048,
      "grad_norm": 0.4801112236891936,
      "learning_rate": 3.263071519614484e-05,
      "loss": 1.3145,
      "num_input_tokens_seen": 35757732576,
      "step": 45449
    },
    {
      "epoch": 4.821769573520051,
      "grad_norm": 0.5065162689103885,
      "learning_rate": 3.263005338890902e-05,
      "loss": 1.1978,
      "num_input_tokens_seen": 35758519328,
      "step": 45450
    },
    {
      "epoch": 4.821875663059623,
      "grad_norm": 0.7390473048341868,
      "learning_rate": 3.262939157577691e-05,
      "loss": 1.2966,
      "num_input_tokens_seen": 35759306096,
      "step": 45451
    },
    {
      "epoch": 4.821981752599194,
      "grad_norm": 0.5702843291818878,
      "learning_rate": 3.262872975674904e-05,
      "loss": 1.4149,
      "num_input_tokens_seen": 35760092880,
      "step": 45452
    },
    {
      "epoch": 4.822087842138765,
      "grad_norm": 0.840285576165005,
      "learning_rate": 3.262806793182591e-05,
      "loss": 1.4127,
      "num_input_tokens_seen": 35760879696,
      "step": 45453
    },
    {
      "epoch": 4.822193931678337,
      "grad_norm": 0.5541707991820303,
      "learning_rate": 3.262740610100803e-05,
      "loss": 1.3282,
      "num_input_tokens_seen": 35761666512,
      "step": 45454
    },
    {
      "epoch": 4.822300021217908,
      "grad_norm": 0.4475946625702194,
      "learning_rate": 3.2626744264295914e-05,
      "loss": 1.1871,
      "num_input_tokens_seen": 35762453296,
      "step": 45455
    },
    {
      "epoch": 4.82240611075748,
      "grad_norm": 0.6262775177914549,
      "learning_rate": 3.262608242169008e-05,
      "loss": 1.2847,
      "num_input_tokens_seen": 35763240080,
      "step": 45456
    },
    {
      "epoch": 4.822512200297051,
      "grad_norm": 0.5678869861201029,
      "learning_rate": 3.2625420573191026e-05,
      "loss": 1.2381,
      "num_input_tokens_seen": 35764026864,
      "step": 45457
    },
    {
      "epoch": 4.8226182898366226,
      "grad_norm": 0.5140471454257272,
      "learning_rate": 3.262475871879927e-05,
      "loss": 1.2456,
      "num_input_tokens_seen": 35764813568,
      "step": 45458
    },
    {
      "epoch": 4.822724379376194,
      "grad_norm": 0.7838640968922803,
      "learning_rate": 3.262409685851533e-05,
      "loss": 1.4591,
      "num_input_tokens_seen": 35765600368,
      "step": 45459
    },
    {
      "epoch": 4.822830468915765,
      "grad_norm": 0.6177893164137315,
      "learning_rate": 3.262343499233971e-05,
      "loss": 1.2986,
      "num_input_tokens_seen": 35766387184,
      "step": 45460
    },
    {
      "epoch": 4.8229365584553365,
      "grad_norm": 0.5939839469719348,
      "learning_rate": 3.2622773120272934e-05,
      "loss": 1.3187,
      "num_input_tokens_seen": 35767174016,
      "step": 45461
    },
    {
      "epoch": 4.823042647994908,
      "grad_norm": 0.7223441930598283,
      "learning_rate": 3.262211124231549e-05,
      "loss": 1.2891,
      "num_input_tokens_seen": 35767960832,
      "step": 45462
    },
    {
      "epoch": 4.8231487375344795,
      "grad_norm": 0.57795403771633,
      "learning_rate": 3.26214493584679e-05,
      "loss": 1.3879,
      "num_input_tokens_seen": 35768747520,
      "step": 45463
    },
    {
      "epoch": 4.8232548270740505,
      "grad_norm": 0.7944926871095537,
      "learning_rate": 3.262078746873069e-05,
      "loss": 1.4276,
      "num_input_tokens_seen": 35769534256,
      "step": 45464
    },
    {
      "epoch": 4.8233609166136215,
      "grad_norm": 0.6699051449093025,
      "learning_rate": 3.262012557310434e-05,
      "loss": 1.2952,
      "num_input_tokens_seen": 35770321040,
      "step": 45465
    },
    {
      "epoch": 4.8234670061531935,
      "grad_norm": 0.66422758829919,
      "learning_rate": 3.261946367158939e-05,
      "loss": 1.2786,
      "num_input_tokens_seen": 35771107808,
      "step": 45466
    },
    {
      "epoch": 4.8235730956927645,
      "grad_norm": 0.6669312640480859,
      "learning_rate": 3.2618801764186345e-05,
      "loss": 1.3608,
      "num_input_tokens_seen": 35771894656,
      "step": 45467
    },
    {
      "epoch": 4.823679185232336,
      "grad_norm": 0.6220851313302346,
      "learning_rate": 3.2618139850895714e-05,
      "loss": 1.3103,
      "num_input_tokens_seen": 35772681424,
      "step": 45468
    },
    {
      "epoch": 4.823785274771907,
      "grad_norm": 0.7008847253234425,
      "learning_rate": 3.2617477931718e-05,
      "loss": 1.3832,
      "num_input_tokens_seen": 35773468112,
      "step": 45469
    },
    {
      "epoch": 4.8238913643114785,
      "grad_norm": 0.5623851834285515,
      "learning_rate": 3.2616816006653735e-05,
      "loss": 1.2957,
      "num_input_tokens_seen": 35774254848,
      "step": 45470
    },
    {
      "epoch": 4.82399745385105,
      "grad_norm": 0.8046697249342659,
      "learning_rate": 3.261615407570341e-05,
      "loss": 1.2782,
      "num_input_tokens_seen": 35775041584,
      "step": 45471
    },
    {
      "epoch": 4.824103543390621,
      "grad_norm": 0.4962078447013991,
      "learning_rate": 3.261549213886754e-05,
      "loss": 1.2743,
      "num_input_tokens_seen": 35775828416,
      "step": 45472
    },
    {
      "epoch": 4.824209632930193,
      "grad_norm": 0.796093478836556,
      "learning_rate": 3.261483019614665e-05,
      "loss": 1.2812,
      "num_input_tokens_seen": 35776615232,
      "step": 45473
    },
    {
      "epoch": 4.824315722469764,
      "grad_norm": 0.5458201494089987,
      "learning_rate": 3.261416824754124e-05,
      "loss": 1.2985,
      "num_input_tokens_seen": 35777402048,
      "step": 45474
    },
    {
      "epoch": 4.824421812009335,
      "grad_norm": 0.5922116125451138,
      "learning_rate": 3.261350629305183e-05,
      "loss": 1.2778,
      "num_input_tokens_seen": 35778188864,
      "step": 45475
    },
    {
      "epoch": 4.824527901548907,
      "grad_norm": 0.7601800624742037,
      "learning_rate": 3.261284433267891e-05,
      "loss": 1.3152,
      "num_input_tokens_seen": 35778975584,
      "step": 45476
    },
    {
      "epoch": 4.824633991088478,
      "grad_norm": 0.5533216206889086,
      "learning_rate": 3.261218236642302e-05,
      "loss": 1.3434,
      "num_input_tokens_seen": 35779762400,
      "step": 45477
    },
    {
      "epoch": 4.82474008062805,
      "grad_norm": 0.633786939388204,
      "learning_rate": 3.2611520394284654e-05,
      "loss": 1.3449,
      "num_input_tokens_seen": 35780549120,
      "step": 45478
    },
    {
      "epoch": 4.824846170167621,
      "grad_norm": 0.8355552533700528,
      "learning_rate": 3.2610858416264335e-05,
      "loss": 1.2927,
      "num_input_tokens_seen": 35781335952,
      "step": 45479
    },
    {
      "epoch": 4.824952259707193,
      "grad_norm": 0.6901188981130516,
      "learning_rate": 3.261019643236256e-05,
      "loss": 1.3688,
      "num_input_tokens_seen": 35782122672,
      "step": 45480
    },
    {
      "epoch": 4.825058349246764,
      "grad_norm": 0.6496418190587135,
      "learning_rate": 3.260953444257985e-05,
      "loss": 1.3361,
      "num_input_tokens_seen": 35782909488,
      "step": 45481
    },
    {
      "epoch": 4.825164438786336,
      "grad_norm": 0.48733687800986375,
      "learning_rate": 3.2608872446916716e-05,
      "loss": 1.2711,
      "num_input_tokens_seen": 35783696400,
      "step": 45482
    },
    {
      "epoch": 4.825270528325907,
      "grad_norm": 0.5218598962111636,
      "learning_rate": 3.260821044537367e-05,
      "loss": 1.18,
      "num_input_tokens_seen": 35784483120,
      "step": 45483
    },
    {
      "epoch": 4.825376617865478,
      "grad_norm": 0.4720247546970645,
      "learning_rate": 3.260754843795122e-05,
      "loss": 1.2469,
      "num_input_tokens_seen": 35785269904,
      "step": 45484
    },
    {
      "epoch": 4.82548270740505,
      "grad_norm": 0.4747302278225168,
      "learning_rate": 3.260688642464989e-05,
      "loss": 1.267,
      "num_input_tokens_seen": 35786056624,
      "step": 45485
    },
    {
      "epoch": 4.825588796944621,
      "grad_norm": 0.450755157304982,
      "learning_rate": 3.2606224405470164e-05,
      "loss": 1.2348,
      "num_input_tokens_seen": 35786843536,
      "step": 45486
    },
    {
      "epoch": 4.825694886484193,
      "grad_norm": 0.6011180500313774,
      "learning_rate": 3.260556238041259e-05,
      "loss": 1.3545,
      "num_input_tokens_seen": 35787630320,
      "step": 45487
    },
    {
      "epoch": 4.825800976023764,
      "grad_norm": 0.5086947766988079,
      "learning_rate": 3.260490034947764e-05,
      "loss": 1.3627,
      "num_input_tokens_seen": 35788417040,
      "step": 45488
    },
    {
      "epoch": 4.825907065563335,
      "grad_norm": 0.4325460182517797,
      "learning_rate": 3.260423831266586e-05,
      "loss": 1.2804,
      "num_input_tokens_seen": 35789203792,
      "step": 45489
    },
    {
      "epoch": 4.826013155102907,
      "grad_norm": 0.5357431150146096,
      "learning_rate": 3.260357626997775e-05,
      "loss": 1.2923,
      "num_input_tokens_seen": 35789990640,
      "step": 45490
    },
    {
      "epoch": 4.826119244642478,
      "grad_norm": 0.5951433467224332,
      "learning_rate": 3.260291422141381e-05,
      "loss": 1.3451,
      "num_input_tokens_seen": 35790777392,
      "step": 45491
    },
    {
      "epoch": 4.82622533418205,
      "grad_norm": 0.5120396788532501,
      "learning_rate": 3.260225216697456e-05,
      "loss": 1.3722,
      "num_input_tokens_seen": 35791564000,
      "step": 45492
    },
    {
      "epoch": 4.826331423721621,
      "grad_norm": 0.47131002788953175,
      "learning_rate": 3.260159010666052e-05,
      "loss": 1.3257,
      "num_input_tokens_seen": 35792350784,
      "step": 45493
    },
    {
      "epoch": 4.826437513261192,
      "grad_norm": 0.5630758080222494,
      "learning_rate": 3.260092804047219e-05,
      "loss": 1.2128,
      "num_input_tokens_seen": 35793137536,
      "step": 45494
    },
    {
      "epoch": 4.826543602800764,
      "grad_norm": 0.4733714120401455,
      "learning_rate": 3.260026596841009e-05,
      "loss": 1.2183,
      "num_input_tokens_seen": 35793924464,
      "step": 45495
    },
    {
      "epoch": 4.826649692340335,
      "grad_norm": 0.5722842838821947,
      "learning_rate": 3.259960389047472e-05,
      "loss": 1.37,
      "num_input_tokens_seen": 35794711264,
      "step": 45496
    },
    {
      "epoch": 4.826755781879907,
      "grad_norm": 0.5098610467906061,
      "learning_rate": 3.2598941806666606e-05,
      "loss": 1.3131,
      "num_input_tokens_seen": 35795498032,
      "step": 45497
    },
    {
      "epoch": 4.826861871419478,
      "grad_norm": 0.5282585462550984,
      "learning_rate": 3.259827971698625e-05,
      "loss": 1.3134,
      "num_input_tokens_seen": 35796284736,
      "step": 45498
    },
    {
      "epoch": 4.826967960959049,
      "grad_norm": 0.5682174195176135,
      "learning_rate": 3.259761762143416e-05,
      "loss": 1.4085,
      "num_input_tokens_seen": 35797071536,
      "step": 45499
    },
    {
      "epoch": 4.827074050498621,
      "grad_norm": 0.5331380323254854,
      "learning_rate": 3.2596955520010863e-05,
      "loss": 1.2459,
      "num_input_tokens_seen": 35797858320,
      "step": 45500
    },
    {
      "epoch": 4.827180140038192,
      "grad_norm": 0.6283797000067124,
      "learning_rate": 3.2596293412716864e-05,
      "loss": 1.281,
      "num_input_tokens_seen": 35798645072,
      "step": 45501
    },
    {
      "epoch": 4.827286229577764,
      "grad_norm": 0.5878178821825962,
      "learning_rate": 3.259563129955267e-05,
      "loss": 1.2626,
      "num_input_tokens_seen": 35799431888,
      "step": 45502
    },
    {
      "epoch": 4.827392319117335,
      "grad_norm": 0.5970893267571428,
      "learning_rate": 3.2594969180518785e-05,
      "loss": 1.3036,
      "num_input_tokens_seen": 35800218752,
      "step": 45503
    },
    {
      "epoch": 4.827498408656906,
      "grad_norm": 0.564486255519135,
      "learning_rate": 3.2594307055615736e-05,
      "loss": 1.4222,
      "num_input_tokens_seen": 35801005376,
      "step": 45504
    },
    {
      "epoch": 4.827604498196478,
      "grad_norm": 0.5283006885126317,
      "learning_rate": 3.2593644924844036e-05,
      "loss": 1.2357,
      "num_input_tokens_seen": 35801792272,
      "step": 45505
    },
    {
      "epoch": 4.827710587736049,
      "grad_norm": 0.7756501588297995,
      "learning_rate": 3.259298278820419e-05,
      "loss": 1.3722,
      "num_input_tokens_seen": 35802579024,
      "step": 45506
    },
    {
      "epoch": 4.827816677275621,
      "grad_norm": 0.5145736716533394,
      "learning_rate": 3.25923206456967e-05,
      "loss": 1.1746,
      "num_input_tokens_seen": 35803365856,
      "step": 45507
    },
    {
      "epoch": 4.827922766815192,
      "grad_norm": 0.6001738903740313,
      "learning_rate": 3.259165849732209e-05,
      "loss": 1.3141,
      "num_input_tokens_seen": 35804152624,
      "step": 45508
    },
    {
      "epoch": 4.828028856354764,
      "grad_norm": 0.7215019980288296,
      "learning_rate": 3.259099634308087e-05,
      "loss": 1.3634,
      "num_input_tokens_seen": 35804939408,
      "step": 45509
    },
    {
      "epoch": 4.828134945894335,
      "grad_norm": 0.7476610270619819,
      "learning_rate": 3.259033418297356e-05,
      "loss": 1.3597,
      "num_input_tokens_seen": 35805726224,
      "step": 45510
    },
    {
      "epoch": 4.828241035433907,
      "grad_norm": 0.773129846277117,
      "learning_rate": 3.258967201700065e-05,
      "loss": 1.3396,
      "num_input_tokens_seen": 35806513024,
      "step": 45511
    },
    {
      "epoch": 4.828347124973478,
      "grad_norm": 0.7080609669963249,
      "learning_rate": 3.258900984516267e-05,
      "loss": 1.2294,
      "num_input_tokens_seen": 35807299728,
      "step": 45512
    },
    {
      "epoch": 4.828453214513049,
      "grad_norm": 0.7007132631685087,
      "learning_rate": 3.258834766746013e-05,
      "loss": 1.2034,
      "num_input_tokens_seen": 35808086400,
      "step": 45513
    },
    {
      "epoch": 4.828559304052621,
      "grad_norm": 0.7023511958472969,
      "learning_rate": 3.258768548389353e-05,
      "loss": 1.3164,
      "num_input_tokens_seen": 35808873152,
      "step": 45514
    },
    {
      "epoch": 4.828665393592192,
      "grad_norm": 0.7816795078804153,
      "learning_rate": 3.2587023294463396e-05,
      "loss": 1.3082,
      "num_input_tokens_seen": 35809659968,
      "step": 45515
    },
    {
      "epoch": 4.828771483131764,
      "grad_norm": 0.6288555563219981,
      "learning_rate": 3.258636109917023e-05,
      "loss": 1.3499,
      "num_input_tokens_seen": 35810446800,
      "step": 45516
    },
    {
      "epoch": 4.828877572671335,
      "grad_norm": 0.60912071689582,
      "learning_rate": 3.2585698898014536e-05,
      "loss": 1.2929,
      "num_input_tokens_seen": 35811233536,
      "step": 45517
    },
    {
      "epoch": 4.828983662210906,
      "grad_norm": 0.6236815331194348,
      "learning_rate": 3.258503669099685e-05,
      "loss": 1.3005,
      "num_input_tokens_seen": 35812020272,
      "step": 45518
    },
    {
      "epoch": 4.829089751750478,
      "grad_norm": 0.5679810189115181,
      "learning_rate": 3.258437447811767e-05,
      "loss": 1.3094,
      "num_input_tokens_seen": 35812807056,
      "step": 45519
    },
    {
      "epoch": 4.829195841290049,
      "grad_norm": 0.7400645221835715,
      "learning_rate": 3.25837122593775e-05,
      "loss": 1.345,
      "num_input_tokens_seen": 35813593808,
      "step": 45520
    },
    {
      "epoch": 4.829301930829621,
      "grad_norm": 0.4951047613843015,
      "learning_rate": 3.258305003477686e-05,
      "loss": 1.3446,
      "num_input_tokens_seen": 35814380624,
      "step": 45521
    },
    {
      "epoch": 4.829408020369192,
      "grad_norm": 0.578300459797147,
      "learning_rate": 3.2582387804316276e-05,
      "loss": 1.2636,
      "num_input_tokens_seen": 35815167392,
      "step": 45522
    },
    {
      "epoch": 4.829514109908763,
      "grad_norm": 0.5560984552851045,
      "learning_rate": 3.258172556799623e-05,
      "loss": 1.3381,
      "num_input_tokens_seen": 35815954112,
      "step": 45523
    },
    {
      "epoch": 4.8296201994483345,
      "grad_norm": 0.4955818811748744,
      "learning_rate": 3.258106332581725e-05,
      "loss": 1.2984,
      "num_input_tokens_seen": 35816740864,
      "step": 45524
    },
    {
      "epoch": 4.829726288987906,
      "grad_norm": 0.5491959674676093,
      "learning_rate": 3.258040107777985e-05,
      "loss": 1.2652,
      "num_input_tokens_seen": 35817527536,
      "step": 45525
    },
    {
      "epoch": 4.8298323785274775,
      "grad_norm": 0.5406742600163873,
      "learning_rate": 3.257973882388454e-05,
      "loss": 1.1869,
      "num_input_tokens_seen": 35818314240,
      "step": 45526
    },
    {
      "epoch": 4.8299384680670485,
      "grad_norm": 0.5354961655517569,
      "learning_rate": 3.257907656413183e-05,
      "loss": 1.4265,
      "num_input_tokens_seen": 35819101008,
      "step": 45527
    },
    {
      "epoch": 4.8300445576066195,
      "grad_norm": 0.5160389895210257,
      "learning_rate": 3.257841429852223e-05,
      "loss": 1.2061,
      "num_input_tokens_seen": 35819887792,
      "step": 45528
    },
    {
      "epoch": 4.8301506471461915,
      "grad_norm": 0.49450862585573213,
      "learning_rate": 3.257775202705626e-05,
      "loss": 1.2473,
      "num_input_tokens_seen": 35820674640,
      "step": 45529
    },
    {
      "epoch": 4.8302567366857625,
      "grad_norm": 0.6552294941861319,
      "learning_rate": 3.257708974973442e-05,
      "loss": 1.2671,
      "num_input_tokens_seen": 35821461504,
      "step": 45530
    },
    {
      "epoch": 4.830362826225334,
      "grad_norm": 0.8006818351840134,
      "learning_rate": 3.257642746655722e-05,
      "loss": 1.3531,
      "num_input_tokens_seen": 35822248304,
      "step": 45531
    },
    {
      "epoch": 4.8304689157649054,
      "grad_norm": 0.5078307863045025,
      "learning_rate": 3.257576517752519e-05,
      "loss": 1.2168,
      "num_input_tokens_seen": 35823035008,
      "step": 45532
    },
    {
      "epoch": 4.830575005304477,
      "grad_norm": 0.6278193700207012,
      "learning_rate": 3.257510288263883e-05,
      "loss": 1.3173,
      "num_input_tokens_seen": 35823821696,
      "step": 45533
    },
    {
      "epoch": 4.830681094844048,
      "grad_norm": 0.8981194803132614,
      "learning_rate": 3.2574440581898645e-05,
      "loss": 1.3307,
      "num_input_tokens_seen": 35824608528,
      "step": 45534
    },
    {
      "epoch": 4.830787184383619,
      "grad_norm": 0.47175616532279147,
      "learning_rate": 3.2573778275305165e-05,
      "loss": 1.3253,
      "num_input_tokens_seen": 35825395344,
      "step": 45535
    },
    {
      "epoch": 4.830893273923191,
      "grad_norm": 1.0347279257636974,
      "learning_rate": 3.257311596285889e-05,
      "loss": 1.2722,
      "num_input_tokens_seen": 35826182064,
      "step": 45536
    },
    {
      "epoch": 4.830999363462762,
      "grad_norm": 0.7108225900063642,
      "learning_rate": 3.2572453644560324e-05,
      "loss": 1.2808,
      "num_input_tokens_seen": 35826968752,
      "step": 45537
    },
    {
      "epoch": 4.831105453002334,
      "grad_norm": 0.7454611724239605,
      "learning_rate": 3.257179132040999e-05,
      "loss": 1.3635,
      "num_input_tokens_seen": 35827755536,
      "step": 45538
    },
    {
      "epoch": 4.831211542541905,
      "grad_norm": 0.9411832126247354,
      "learning_rate": 3.257112899040841e-05,
      "loss": 1.2744,
      "num_input_tokens_seen": 35828542288,
      "step": 45539
    },
    {
      "epoch": 4.831317632081477,
      "grad_norm": 0.5452495124804694,
      "learning_rate": 3.257046665455608e-05,
      "loss": 1.3323,
      "num_input_tokens_seen": 35829329040,
      "step": 45540
    },
    {
      "epoch": 4.831423721621048,
      "grad_norm": 0.7323518331092967,
      "learning_rate": 3.25698043128535e-05,
      "loss": 1.3543,
      "num_input_tokens_seen": 35830115824,
      "step": 45541
    },
    {
      "epoch": 4.831529811160619,
      "grad_norm": 0.8512783609321007,
      "learning_rate": 3.256914196530121e-05,
      "loss": 1.4837,
      "num_input_tokens_seen": 35830902592,
      "step": 45542
    },
    {
      "epoch": 4.831635900700191,
      "grad_norm": 0.5310374230272417,
      "learning_rate": 3.256847961189971e-05,
      "loss": 1.3019,
      "num_input_tokens_seen": 35831689376,
      "step": 45543
    },
    {
      "epoch": 4.831741990239762,
      "grad_norm": 0.8430902786316608,
      "learning_rate": 3.256781725264951e-05,
      "loss": 1.2725,
      "num_input_tokens_seen": 35832476192,
      "step": 45544
    },
    {
      "epoch": 4.831848079779334,
      "grad_norm": 0.7526858525048532,
      "learning_rate": 3.256715488755112e-05,
      "loss": 1.2986,
      "num_input_tokens_seen": 35833262912,
      "step": 45545
    },
    {
      "epoch": 4.831954169318905,
      "grad_norm": 0.5841521307656229,
      "learning_rate": 3.2566492516605054e-05,
      "loss": 1.3676,
      "num_input_tokens_seen": 35834049552,
      "step": 45546
    },
    {
      "epoch": 4.832060258858476,
      "grad_norm": 0.9767498854048292,
      "learning_rate": 3.256583013981183e-05,
      "loss": 1.3772,
      "num_input_tokens_seen": 35834836352,
      "step": 45547
    },
    {
      "epoch": 4.832166348398048,
      "grad_norm": 0.8611270236185347,
      "learning_rate": 3.256516775717194e-05,
      "loss": 1.3003,
      "num_input_tokens_seen": 35835623120,
      "step": 45548
    },
    {
      "epoch": 4.832272437937619,
      "grad_norm": 0.5972062863668333,
      "learning_rate": 3.256450536868593e-05,
      "loss": 1.3759,
      "num_input_tokens_seen": 35836409856,
      "step": 45549
    },
    {
      "epoch": 4.832378527477191,
      "grad_norm": 0.7844010931985955,
      "learning_rate": 3.256384297435428e-05,
      "loss": 1.3125,
      "num_input_tokens_seen": 35837196544,
      "step": 45550
    },
    {
      "epoch": 4.832484617016762,
      "grad_norm": 1.0447825985964156,
      "learning_rate": 3.256318057417752e-05,
      "loss": 1.3196,
      "num_input_tokens_seen": 35837983280,
      "step": 45551
    },
    {
      "epoch": 4.832590706556333,
      "grad_norm": 0.6073900380486906,
      "learning_rate": 3.2562518168156146e-05,
      "loss": 1.4021,
      "num_input_tokens_seen": 35838770048,
      "step": 45552
    },
    {
      "epoch": 4.832696796095905,
      "grad_norm": 0.6826284577441657,
      "learning_rate": 3.2561855756290695e-05,
      "loss": 1.2917,
      "num_input_tokens_seen": 35839556752,
      "step": 45553
    },
    {
      "epoch": 4.832802885635476,
      "grad_norm": 0.5850574557547247,
      "learning_rate": 3.256119333858165e-05,
      "loss": 1.3396,
      "num_input_tokens_seen": 35840343488,
      "step": 45554
    },
    {
      "epoch": 4.832908975175048,
      "grad_norm": 0.4994151610610703,
      "learning_rate": 3.2560530915029543e-05,
      "loss": 1.2523,
      "num_input_tokens_seen": 35841130272,
      "step": 45555
    },
    {
      "epoch": 4.833015064714619,
      "grad_norm": 0.5569252680543052,
      "learning_rate": 3.255986848563488e-05,
      "loss": 1.2047,
      "num_input_tokens_seen": 35841917056,
      "step": 45556
    },
    {
      "epoch": 4.83312115425419,
      "grad_norm": 0.6542969788598758,
      "learning_rate": 3.255920605039817e-05,
      "loss": 1.275,
      "num_input_tokens_seen": 35842703792,
      "step": 45557
    },
    {
      "epoch": 4.833227243793762,
      "grad_norm": 0.5244837264441168,
      "learning_rate": 3.2558543609319935e-05,
      "loss": 1.2201,
      "num_input_tokens_seen": 35843490624,
      "step": 45558
    },
    {
      "epoch": 4.833333333333333,
      "grad_norm": 0.5697766304028371,
      "learning_rate": 3.2557881162400675e-05,
      "loss": 1.3337,
      "num_input_tokens_seen": 35844277344,
      "step": 45559
    },
    {
      "epoch": 4.833439422872905,
      "grad_norm": 0.5618653943217866,
      "learning_rate": 3.25572187096409e-05,
      "loss": 1.347,
      "num_input_tokens_seen": 35845064016,
      "step": 45560
    },
    {
      "epoch": 4.833545512412476,
      "grad_norm": 0.46054459933555886,
      "learning_rate": 3.255655625104114e-05,
      "loss": 1.2142,
      "num_input_tokens_seen": 35845850752,
      "step": 45561
    },
    {
      "epoch": 4.833651601952048,
      "grad_norm": 0.49984235020792706,
      "learning_rate": 3.255589378660189e-05,
      "loss": 1.3128,
      "num_input_tokens_seen": 35846637536,
      "step": 45562
    },
    {
      "epoch": 4.833757691491619,
      "grad_norm": 0.5295813700360168,
      "learning_rate": 3.2555231316323656e-05,
      "loss": 1.3262,
      "num_input_tokens_seen": 35847424256,
      "step": 45563
    },
    {
      "epoch": 4.83386378103119,
      "grad_norm": 0.4928685047013095,
      "learning_rate": 3.2554568840206974e-05,
      "loss": 1.2272,
      "num_input_tokens_seen": 35848211040,
      "step": 45564
    },
    {
      "epoch": 4.833969870570762,
      "grad_norm": 0.6022970392036054,
      "learning_rate": 3.255390635825234e-05,
      "loss": 1.343,
      "num_input_tokens_seen": 35848997904,
      "step": 45565
    },
    {
      "epoch": 4.834075960110333,
      "grad_norm": 0.4964604950681587,
      "learning_rate": 3.255324387046026e-05,
      "loss": 1.278,
      "num_input_tokens_seen": 35849784624,
      "step": 45566
    },
    {
      "epoch": 4.834182049649905,
      "grad_norm": 0.5583034112106026,
      "learning_rate": 3.255258137683126e-05,
      "loss": 1.2475,
      "num_input_tokens_seen": 35850571440,
      "step": 45567
    },
    {
      "epoch": 4.834288139189476,
      "grad_norm": 0.6365693979556032,
      "learning_rate": 3.255191887736585e-05,
      "loss": 1.3154,
      "num_input_tokens_seen": 35851358240,
      "step": 45568
    },
    {
      "epoch": 4.834394228729048,
      "grad_norm": 0.6177171928874244,
      "learning_rate": 3.255125637206454e-05,
      "loss": 1.4701,
      "num_input_tokens_seen": 35852145024,
      "step": 45569
    },
    {
      "epoch": 4.834500318268619,
      "grad_norm": 0.6309751982350625,
      "learning_rate": 3.255059386092784e-05,
      "loss": 1.3199,
      "num_input_tokens_seen": 35852931776,
      "step": 45570
    },
    {
      "epoch": 4.83460640780819,
      "grad_norm": 0.5230185711359258,
      "learning_rate": 3.254993134395626e-05,
      "loss": 1.3043,
      "num_input_tokens_seen": 35853718528,
      "step": 45571
    },
    {
      "epoch": 4.834712497347762,
      "grad_norm": 0.5833356271134107,
      "learning_rate": 3.254926882115031e-05,
      "loss": 1.2665,
      "num_input_tokens_seen": 35854505264,
      "step": 45572
    },
    {
      "epoch": 4.834818586887333,
      "grad_norm": 0.5388439777755266,
      "learning_rate": 3.254860629251052e-05,
      "loss": 1.3387,
      "num_input_tokens_seen": 35855292000,
      "step": 45573
    },
    {
      "epoch": 4.834924676426905,
      "grad_norm": 0.5868569283212354,
      "learning_rate": 3.254794375803738e-05,
      "loss": 1.3956,
      "num_input_tokens_seen": 35856078656,
      "step": 45574
    },
    {
      "epoch": 4.835030765966476,
      "grad_norm": 0.4984945088832559,
      "learning_rate": 3.2547281217731405e-05,
      "loss": 1.2379,
      "num_input_tokens_seen": 35856865440,
      "step": 45575
    },
    {
      "epoch": 4.835136855506047,
      "grad_norm": 0.7469031438887456,
      "learning_rate": 3.2546618671593125e-05,
      "loss": 1.2825,
      "num_input_tokens_seen": 35857652176,
      "step": 45576
    },
    {
      "epoch": 4.835242945045619,
      "grad_norm": 0.6830443214141869,
      "learning_rate": 3.254595611962303e-05,
      "loss": 1.3343,
      "num_input_tokens_seen": 35858438976,
      "step": 45577
    },
    {
      "epoch": 4.83534903458519,
      "grad_norm": 0.560915780316982,
      "learning_rate": 3.254529356182164e-05,
      "loss": 1.3541,
      "num_input_tokens_seen": 35859225792,
      "step": 45578
    },
    {
      "epoch": 4.835455124124762,
      "grad_norm": 0.5553303484666361,
      "learning_rate": 3.254463099818948e-05,
      "loss": 1.212,
      "num_input_tokens_seen": 35860012544,
      "step": 45579
    },
    {
      "epoch": 4.835561213664333,
      "grad_norm": 0.5833545129732961,
      "learning_rate": 3.2543968428727046e-05,
      "loss": 1.2576,
      "num_input_tokens_seen": 35860799344,
      "step": 45580
    },
    {
      "epoch": 4.835667303203904,
      "grad_norm": 0.6497513659536922,
      "learning_rate": 3.2543305853434854e-05,
      "loss": 1.3668,
      "num_input_tokens_seen": 35861586128,
      "step": 45581
    },
    {
      "epoch": 4.835773392743476,
      "grad_norm": 0.5297835780253073,
      "learning_rate": 3.254264327231341e-05,
      "loss": 1.3544,
      "num_input_tokens_seen": 35862372944,
      "step": 45582
    },
    {
      "epoch": 4.835879482283047,
      "grad_norm": 0.5683226600572204,
      "learning_rate": 3.254198068536324e-05,
      "loss": 1.2885,
      "num_input_tokens_seen": 35863159712,
      "step": 45583
    },
    {
      "epoch": 4.835985571822619,
      "grad_norm": 0.6421498049352655,
      "learning_rate": 3.2541318092584844e-05,
      "loss": 1.3491,
      "num_input_tokens_seen": 35863946544,
      "step": 45584
    },
    {
      "epoch": 4.83609166136219,
      "grad_norm": 0.4500825648939911,
      "learning_rate": 3.254065549397874e-05,
      "loss": 1.3134,
      "num_input_tokens_seen": 35864733296,
      "step": 45585
    },
    {
      "epoch": 4.836197750901761,
      "grad_norm": 0.5565464051220236,
      "learning_rate": 3.253999288954544e-05,
      "loss": 1.2573,
      "num_input_tokens_seen": 35865520048,
      "step": 45586
    },
    {
      "epoch": 4.8363038404413325,
      "grad_norm": 0.5616951356228933,
      "learning_rate": 3.2539330279285456e-05,
      "loss": 1.3405,
      "num_input_tokens_seen": 35866306768,
      "step": 45587
    },
    {
      "epoch": 4.836409929980904,
      "grad_norm": 0.5023411223780514,
      "learning_rate": 3.25386676631993e-05,
      "loss": 1.1876,
      "num_input_tokens_seen": 35867093600,
      "step": 45588
    },
    {
      "epoch": 4.8365160195204755,
      "grad_norm": 0.5467970057061078,
      "learning_rate": 3.2538005041287475e-05,
      "loss": 1.3399,
      "num_input_tokens_seen": 35867880304,
      "step": 45589
    },
    {
      "epoch": 4.8366221090600465,
      "grad_norm": 0.600417814865917,
      "learning_rate": 3.253734241355051e-05,
      "loss": 1.2251,
      "num_input_tokens_seen": 35868667104,
      "step": 45590
    },
    {
      "epoch": 4.8367281985996184,
      "grad_norm": 0.5005957843171318,
      "learning_rate": 3.25366797799889e-05,
      "loss": 1.2436,
      "num_input_tokens_seen": 35869453872,
      "step": 45591
    },
    {
      "epoch": 4.8368342881391895,
      "grad_norm": 0.5062614191568612,
      "learning_rate": 3.253601714060317e-05,
      "loss": 1.1693,
      "num_input_tokens_seen": 35870240720,
      "step": 45592
    },
    {
      "epoch": 4.8369403776787605,
      "grad_norm": 0.6461741918653601,
      "learning_rate": 3.253535449539383e-05,
      "loss": 1.2527,
      "num_input_tokens_seen": 35871027568,
      "step": 45593
    },
    {
      "epoch": 4.837046467218332,
      "grad_norm": 0.627599647454169,
      "learning_rate": 3.253469184436138e-05,
      "loss": 1.4059,
      "num_input_tokens_seen": 35871814288,
      "step": 45594
    },
    {
      "epoch": 4.8371525567579035,
      "grad_norm": 0.5791331795546278,
      "learning_rate": 3.2534029187506345e-05,
      "loss": 1.3864,
      "num_input_tokens_seen": 35872601120,
      "step": 45595
    },
    {
      "epoch": 4.837258646297475,
      "grad_norm": 0.768202837666761,
      "learning_rate": 3.253336652482923e-05,
      "loss": 1.2696,
      "num_input_tokens_seen": 35873387824,
      "step": 45596
    },
    {
      "epoch": 4.837364735837046,
      "grad_norm": 0.497369873196826,
      "learning_rate": 3.2532703856330546e-05,
      "loss": 1.3742,
      "num_input_tokens_seen": 35874174560,
      "step": 45597
    },
    {
      "epoch": 4.837470825376618,
      "grad_norm": 0.5638683770850644,
      "learning_rate": 3.2532041182010824e-05,
      "loss": 1.3121,
      "num_input_tokens_seen": 35874961344,
      "step": 45598
    },
    {
      "epoch": 4.837576914916189,
      "grad_norm": 0.7011957515772198,
      "learning_rate": 3.2531378501870557e-05,
      "loss": 1.2943,
      "num_input_tokens_seen": 35875748096,
      "step": 45599
    },
    {
      "epoch": 4.83768300445576,
      "grad_norm": 0.46846450547071844,
      "learning_rate": 3.2530715815910264e-05,
      "loss": 1.32,
      "num_input_tokens_seen": 35876534960,
      "step": 45600
    },
    {
      "epoch": 4.837789093995332,
      "grad_norm": 0.6658771607177554,
      "learning_rate": 3.253005312413045e-05,
      "loss": 1.3227,
      "num_input_tokens_seen": 35877321664,
      "step": 45601
    },
    {
      "epoch": 4.837895183534903,
      "grad_norm": 0.5549535860353683,
      "learning_rate": 3.252939042653163e-05,
      "loss": 1.3043,
      "num_input_tokens_seen": 35878108448,
      "step": 45602
    },
    {
      "epoch": 4.838001273074475,
      "grad_norm": 0.6148524055006126,
      "learning_rate": 3.2528727723114324e-05,
      "loss": 1.4065,
      "num_input_tokens_seen": 35878895264,
      "step": 45603
    },
    {
      "epoch": 4.838107362614046,
      "grad_norm": 0.45789398535518555,
      "learning_rate": 3.252806501387903e-05,
      "loss": 1.2904,
      "num_input_tokens_seen": 35879682000,
      "step": 45604
    },
    {
      "epoch": 4.838213452153617,
      "grad_norm": 0.5854912254950508,
      "learning_rate": 3.252740229882628e-05,
      "loss": 1.2674,
      "num_input_tokens_seen": 35880468848,
      "step": 45605
    },
    {
      "epoch": 4.838319541693189,
      "grad_norm": 0.5887253563570776,
      "learning_rate": 3.252673957795657e-05,
      "loss": 1.33,
      "num_input_tokens_seen": 35881255600,
      "step": 45606
    },
    {
      "epoch": 4.83842563123276,
      "grad_norm": 0.6174802612618495,
      "learning_rate": 3.252607685127041e-05,
      "loss": 1.2799,
      "num_input_tokens_seen": 35882042400,
      "step": 45607
    },
    {
      "epoch": 4.838531720772332,
      "grad_norm": 0.5288995305780375,
      "learning_rate": 3.252541411876833e-05,
      "loss": 1.3131,
      "num_input_tokens_seen": 35882829072,
      "step": 45608
    },
    {
      "epoch": 4.838637810311903,
      "grad_norm": 0.7411527171822412,
      "learning_rate": 3.2524751380450815e-05,
      "loss": 1.3637,
      "num_input_tokens_seen": 35883615744,
      "step": 45609
    },
    {
      "epoch": 4.838743899851474,
      "grad_norm": 0.6474915633196878,
      "learning_rate": 3.252408863631841e-05,
      "loss": 1.311,
      "num_input_tokens_seen": 35884402448,
      "step": 45610
    },
    {
      "epoch": 4.838849989391046,
      "grad_norm": 0.5649870772712857,
      "learning_rate": 3.252342588637159e-05,
      "loss": 1.2367,
      "num_input_tokens_seen": 35885189200,
      "step": 45611
    },
    {
      "epoch": 4.838956078930617,
      "grad_norm": 0.6670495619719594,
      "learning_rate": 3.25227631306109e-05,
      "loss": 1.29,
      "num_input_tokens_seen": 35885975968,
      "step": 45612
    },
    {
      "epoch": 4.839062168470189,
      "grad_norm": 0.602772904150491,
      "learning_rate": 3.2522100369036844e-05,
      "loss": 1.3112,
      "num_input_tokens_seen": 35886762752,
      "step": 45613
    },
    {
      "epoch": 4.83916825800976,
      "grad_norm": 0.5759883681336773,
      "learning_rate": 3.252143760164992e-05,
      "loss": 1.2677,
      "num_input_tokens_seen": 35887549568,
      "step": 45614
    },
    {
      "epoch": 4.839274347549331,
      "grad_norm": 0.7267285110857244,
      "learning_rate": 3.2520774828450655e-05,
      "loss": 1.4021,
      "num_input_tokens_seen": 35888336416,
      "step": 45615
    },
    {
      "epoch": 4.839380437088903,
      "grad_norm": 0.590374080480584,
      "learning_rate": 3.252011204943956e-05,
      "loss": 1.3327,
      "num_input_tokens_seen": 35889123152,
      "step": 45616
    },
    {
      "epoch": 4.839486526628474,
      "grad_norm": 0.49529828663544206,
      "learning_rate": 3.251944926461713e-05,
      "loss": 1.1817,
      "num_input_tokens_seen": 35889909920,
      "step": 45617
    },
    {
      "epoch": 4.839592616168046,
      "grad_norm": 0.5772642820458866,
      "learning_rate": 3.25187864739839e-05,
      "loss": 1.3743,
      "num_input_tokens_seen": 35890696608,
      "step": 45618
    },
    {
      "epoch": 4.839698705707617,
      "grad_norm": 0.6026814087207574,
      "learning_rate": 3.251812367754037e-05,
      "loss": 1.4481,
      "num_input_tokens_seen": 35891483312,
      "step": 45619
    },
    {
      "epoch": 4.839804795247189,
      "grad_norm": 0.6469335994249202,
      "learning_rate": 3.251746087528705e-05,
      "loss": 1.3485,
      "num_input_tokens_seen": 35892270080,
      "step": 45620
    },
    {
      "epoch": 4.83991088478676,
      "grad_norm": 0.4963455551155401,
      "learning_rate": 3.2516798067224466e-05,
      "loss": 1.3484,
      "num_input_tokens_seen": 35893056880,
      "step": 45621
    },
    {
      "epoch": 4.840016974326331,
      "grad_norm": 0.5888505120433414,
      "learning_rate": 3.251613525335312e-05,
      "loss": 1.3558,
      "num_input_tokens_seen": 35893843760,
      "step": 45622
    },
    {
      "epoch": 4.840123063865903,
      "grad_norm": 0.5040190058221764,
      "learning_rate": 3.2515472433673524e-05,
      "loss": 1.2413,
      "num_input_tokens_seen": 35894630528,
      "step": 45623
    },
    {
      "epoch": 4.840229153405474,
      "grad_norm": 0.541779557675779,
      "learning_rate": 3.2514809608186184e-05,
      "loss": 1.4317,
      "num_input_tokens_seen": 35895417248,
      "step": 45624
    },
    {
      "epoch": 4.840335242945046,
      "grad_norm": 0.5588349362176864,
      "learning_rate": 3.251414677689163e-05,
      "loss": 1.2223,
      "num_input_tokens_seen": 35896204016,
      "step": 45625
    },
    {
      "epoch": 4.840441332484617,
      "grad_norm": 0.5984058448977558,
      "learning_rate": 3.251348393979036e-05,
      "loss": 1.3484,
      "num_input_tokens_seen": 35896990832,
      "step": 45626
    },
    {
      "epoch": 4.840547422024189,
      "grad_norm": 0.515391801816899,
      "learning_rate": 3.2512821096882885e-05,
      "loss": 1.2884,
      "num_input_tokens_seen": 35897777664,
      "step": 45627
    },
    {
      "epoch": 4.84065351156376,
      "grad_norm": 0.5553798798133177,
      "learning_rate": 3.251215824816972e-05,
      "loss": 1.1979,
      "num_input_tokens_seen": 35898564432,
      "step": 45628
    },
    {
      "epoch": 4.840759601103331,
      "grad_norm": 0.8590759230527821,
      "learning_rate": 3.2511495393651395e-05,
      "loss": 1.2519,
      "num_input_tokens_seen": 35899351232,
      "step": 45629
    },
    {
      "epoch": 4.840865690642903,
      "grad_norm": 0.5544842213313161,
      "learning_rate": 3.2510832533328395e-05,
      "loss": 1.3564,
      "num_input_tokens_seen": 35900138080,
      "step": 45630
    },
    {
      "epoch": 4.840971780182474,
      "grad_norm": 0.6303118781548583,
      "learning_rate": 3.251016966720125e-05,
      "loss": 1.2779,
      "num_input_tokens_seen": 35900924736,
      "step": 45631
    },
    {
      "epoch": 4.841077869722046,
      "grad_norm": 0.6169345794584953,
      "learning_rate": 3.250950679527046e-05,
      "loss": 1.3381,
      "num_input_tokens_seen": 35901711440,
      "step": 45632
    },
    {
      "epoch": 4.841183959261617,
      "grad_norm": 0.49136216970707436,
      "learning_rate": 3.250884391753655e-05,
      "loss": 1.1768,
      "num_input_tokens_seen": 35902498176,
      "step": 45633
    },
    {
      "epoch": 4.841290048801188,
      "grad_norm": 0.6119860704923595,
      "learning_rate": 3.250818103400002e-05,
      "loss": 1.3944,
      "num_input_tokens_seen": 35903284944,
      "step": 45634
    },
    {
      "epoch": 4.84139613834076,
      "grad_norm": 0.7535712997936711,
      "learning_rate": 3.2507518144661385e-05,
      "loss": 1.4289,
      "num_input_tokens_seen": 35904071664,
      "step": 45635
    },
    {
      "epoch": 4.841502227880331,
      "grad_norm": 0.6758377801201814,
      "learning_rate": 3.250685524952117e-05,
      "loss": 1.3695,
      "num_input_tokens_seen": 35904858384,
      "step": 45636
    },
    {
      "epoch": 4.841608317419903,
      "grad_norm": 0.7108682774523692,
      "learning_rate": 3.2506192348579864e-05,
      "loss": 1.2885,
      "num_input_tokens_seen": 35905645264,
      "step": 45637
    },
    {
      "epoch": 4.841714406959474,
      "grad_norm": 0.5162595179868823,
      "learning_rate": 3.250552944183801e-05,
      "loss": 1.3082,
      "num_input_tokens_seen": 35906431984,
      "step": 45638
    },
    {
      "epoch": 4.841820496499045,
      "grad_norm": 0.5890422666342636,
      "learning_rate": 3.25048665292961e-05,
      "loss": 1.2941,
      "num_input_tokens_seen": 35907218736,
      "step": 45639
    },
    {
      "epoch": 4.841926586038617,
      "grad_norm": 0.5370201797935222,
      "learning_rate": 3.2504203610954634e-05,
      "loss": 1.3289,
      "num_input_tokens_seen": 35908005472,
      "step": 45640
    },
    {
      "epoch": 4.842032675578188,
      "grad_norm": 0.43384759938748235,
      "learning_rate": 3.250354068681415e-05,
      "loss": 1.1325,
      "num_input_tokens_seen": 35908792224,
      "step": 45641
    },
    {
      "epoch": 4.84213876511776,
      "grad_norm": 0.7496562117956355,
      "learning_rate": 3.2502877756875154e-05,
      "loss": 1.2885,
      "num_input_tokens_seen": 35909579008,
      "step": 45642
    },
    {
      "epoch": 4.842244854657331,
      "grad_norm": 0.6018380343531998,
      "learning_rate": 3.250221482113814e-05,
      "loss": 1.2317,
      "num_input_tokens_seen": 35910365856,
      "step": 45643
    },
    {
      "epoch": 4.842350944196902,
      "grad_norm": 0.6282704866157869,
      "learning_rate": 3.250155187960365e-05,
      "loss": 1.298,
      "num_input_tokens_seen": 35911152624,
      "step": 45644
    },
    {
      "epoch": 4.842457033736474,
      "grad_norm": 0.6214945198628528,
      "learning_rate": 3.250088893227217e-05,
      "loss": 1.2496,
      "num_input_tokens_seen": 35911939376,
      "step": 45645
    },
    {
      "epoch": 4.842563123276045,
      "grad_norm": 0.5247837232548594,
      "learning_rate": 3.250022597914423e-05,
      "loss": 1.2576,
      "num_input_tokens_seen": 35912726192,
      "step": 45646
    },
    {
      "epoch": 4.842669212815617,
      "grad_norm": 0.49331281096248764,
      "learning_rate": 3.249956302022034e-05,
      "loss": 1.2998,
      "num_input_tokens_seen": 35913512864,
      "step": 45647
    },
    {
      "epoch": 4.842775302355188,
      "grad_norm": 0.5209674221952527,
      "learning_rate": 3.2498900055500995e-05,
      "loss": 1.2629,
      "num_input_tokens_seen": 35914299552,
      "step": 45648
    },
    {
      "epoch": 4.8428813918947595,
      "grad_norm": 0.5892373479110005,
      "learning_rate": 3.249823708498673e-05,
      "loss": 1.3376,
      "num_input_tokens_seen": 35915086320,
      "step": 45649
    },
    {
      "epoch": 4.8429874814343306,
      "grad_norm": 0.5338218189421846,
      "learning_rate": 3.249757410867804e-05,
      "loss": 1.3236,
      "num_input_tokens_seen": 35915873056,
      "step": 45650
    },
    {
      "epoch": 4.843093570973902,
      "grad_norm": 0.5480721666125057,
      "learning_rate": 3.2496911126575454e-05,
      "loss": 1.3309,
      "num_input_tokens_seen": 35916659760,
      "step": 45651
    },
    {
      "epoch": 4.8431996605134735,
      "grad_norm": 0.538895397038544,
      "learning_rate": 3.249624813867947e-05,
      "loss": 1.3524,
      "num_input_tokens_seen": 35917446512,
      "step": 45652
    },
    {
      "epoch": 4.8433057500530445,
      "grad_norm": 0.5762467843275159,
      "learning_rate": 3.24955851449906e-05,
      "loss": 1.2942,
      "num_input_tokens_seen": 35918233248,
      "step": 45653
    },
    {
      "epoch": 4.8434118395926165,
      "grad_norm": 0.609005518881808,
      "learning_rate": 3.2494922145509364e-05,
      "loss": 1.2802,
      "num_input_tokens_seen": 35919020048,
      "step": 45654
    },
    {
      "epoch": 4.8435179291321875,
      "grad_norm": 0.5796632892924124,
      "learning_rate": 3.249425914023628e-05,
      "loss": 1.2879,
      "num_input_tokens_seen": 35919806784,
      "step": 45655
    },
    {
      "epoch": 4.843624018671759,
      "grad_norm": 0.550686488124877,
      "learning_rate": 3.2493596129171846e-05,
      "loss": 1.3251,
      "num_input_tokens_seen": 35920593504,
      "step": 45656
    },
    {
      "epoch": 4.84373010821133,
      "grad_norm": 0.6686831453329681,
      "learning_rate": 3.249293311231658e-05,
      "loss": 1.3132,
      "num_input_tokens_seen": 35921380336,
      "step": 45657
    },
    {
      "epoch": 4.8438361977509015,
      "grad_norm": 0.6609667336872584,
      "learning_rate": 3.249227008967099e-05,
      "loss": 1.2508,
      "num_input_tokens_seen": 35922167072,
      "step": 45658
    },
    {
      "epoch": 4.843942287290473,
      "grad_norm": 0.7943388929678522,
      "learning_rate": 3.249160706123561e-05,
      "loss": 1.3676,
      "num_input_tokens_seen": 35922953856,
      "step": 45659
    },
    {
      "epoch": 4.844048376830044,
      "grad_norm": 0.5956474468654971,
      "learning_rate": 3.249094402701092e-05,
      "loss": 1.3327,
      "num_input_tokens_seen": 35923740624,
      "step": 45660
    },
    {
      "epoch": 4.844154466369616,
      "grad_norm": 0.7427176873677853,
      "learning_rate": 3.249028098699746e-05,
      "loss": 1.3678,
      "num_input_tokens_seen": 35924527408,
      "step": 45661
    },
    {
      "epoch": 4.844260555909187,
      "grad_norm": 0.4997772958301025,
      "learning_rate": 3.2489617941195724e-05,
      "loss": 1.3375,
      "num_input_tokens_seen": 35925314160,
      "step": 45662
    },
    {
      "epoch": 4.844366645448758,
      "grad_norm": 0.5876579495174823,
      "learning_rate": 3.2488954889606234e-05,
      "loss": 1.2055,
      "num_input_tokens_seen": 35926100864,
      "step": 45663
    },
    {
      "epoch": 4.84447273498833,
      "grad_norm": 0.5796437175395313,
      "learning_rate": 3.24882918322295e-05,
      "loss": 1.2581,
      "num_input_tokens_seen": 35926887680,
      "step": 45664
    },
    {
      "epoch": 4.844578824527901,
      "grad_norm": 0.43705590237984,
      "learning_rate": 3.248762876906603e-05,
      "loss": 1.2542,
      "num_input_tokens_seen": 35927674416,
      "step": 45665
    },
    {
      "epoch": 4.844684914067473,
      "grad_norm": 0.6688932759582897,
      "learning_rate": 3.248696570011634e-05,
      "loss": 1.3166,
      "num_input_tokens_seen": 35928461168,
      "step": 45666
    },
    {
      "epoch": 4.844791003607044,
      "grad_norm": 0.4571801618860895,
      "learning_rate": 3.248630262538095e-05,
      "loss": 1.224,
      "num_input_tokens_seen": 35929247920,
      "step": 45667
    },
    {
      "epoch": 4.844897093146615,
      "grad_norm": 0.7293758686546713,
      "learning_rate": 3.248563954486036e-05,
      "loss": 1.4034,
      "num_input_tokens_seen": 35930034672,
      "step": 45668
    },
    {
      "epoch": 4.845003182686187,
      "grad_norm": 0.60886118069256,
      "learning_rate": 3.248497645855508e-05,
      "loss": 1.3142,
      "num_input_tokens_seen": 35930821440,
      "step": 45669
    },
    {
      "epoch": 4.845109272225758,
      "grad_norm": 0.6059322237077588,
      "learning_rate": 3.248431336646564e-05,
      "loss": 1.22,
      "num_input_tokens_seen": 35931608272,
      "step": 45670
    },
    {
      "epoch": 4.84521536176533,
      "grad_norm": 0.5908149066880115,
      "learning_rate": 3.2483650268592533e-05,
      "loss": 1.2817,
      "num_input_tokens_seen": 35932394992,
      "step": 45671
    },
    {
      "epoch": 4.845321451304901,
      "grad_norm": 0.4774875389071997,
      "learning_rate": 3.2482987164936293e-05,
      "loss": 1.308,
      "num_input_tokens_seen": 35933181712,
      "step": 45672
    },
    {
      "epoch": 4.845427540844472,
      "grad_norm": 0.6748314675138162,
      "learning_rate": 3.2482324055497414e-05,
      "loss": 1.3752,
      "num_input_tokens_seen": 35933968528,
      "step": 45673
    },
    {
      "epoch": 4.845533630384044,
      "grad_norm": 0.5892212648727194,
      "learning_rate": 3.248166094027641e-05,
      "loss": 1.4589,
      "num_input_tokens_seen": 35934755328,
      "step": 45674
    },
    {
      "epoch": 4.845639719923615,
      "grad_norm": 0.49036400344670156,
      "learning_rate": 3.248099781927381e-05,
      "loss": 1.2788,
      "num_input_tokens_seen": 35935542080,
      "step": 45675
    },
    {
      "epoch": 4.845745809463187,
      "grad_norm": 0.5698693554924962,
      "learning_rate": 3.24803346924901e-05,
      "loss": 1.3342,
      "num_input_tokens_seen": 35936328832,
      "step": 45676
    },
    {
      "epoch": 4.845851899002758,
      "grad_norm": 0.5337000798594934,
      "learning_rate": 3.247967155992581e-05,
      "loss": 1.2564,
      "num_input_tokens_seen": 35937115632,
      "step": 45677
    },
    {
      "epoch": 4.84595798854233,
      "grad_norm": 0.4920157434153828,
      "learning_rate": 3.247900842158146e-05,
      "loss": 1.2645,
      "num_input_tokens_seen": 35937902416,
      "step": 45678
    },
    {
      "epoch": 4.846064078081901,
      "grad_norm": 0.5278099917857062,
      "learning_rate": 3.247834527745755e-05,
      "loss": 1.279,
      "num_input_tokens_seen": 35938689248,
      "step": 45679
    },
    {
      "epoch": 4.846170167621473,
      "grad_norm": 0.480964793810352,
      "learning_rate": 3.2477682127554576e-05,
      "loss": 1.3182,
      "num_input_tokens_seen": 35939476016,
      "step": 45680
    },
    {
      "epoch": 4.846276257161044,
      "grad_norm": 0.47544106227805405,
      "learning_rate": 3.2477018971873085e-05,
      "loss": 1.3761,
      "num_input_tokens_seen": 35940262720,
      "step": 45681
    },
    {
      "epoch": 4.846382346700615,
      "grad_norm": 0.5495832748473098,
      "learning_rate": 3.2476355810413575e-05,
      "loss": 1.3268,
      "num_input_tokens_seen": 35941049488,
      "step": 45682
    },
    {
      "epoch": 4.846488436240187,
      "grad_norm": 0.5138168603517117,
      "learning_rate": 3.247569264317654e-05,
      "loss": 1.3173,
      "num_input_tokens_seen": 35941836272,
      "step": 45683
    },
    {
      "epoch": 4.846594525779758,
      "grad_norm": 0.6230023894744848,
      "learning_rate": 3.2475029470162526e-05,
      "loss": 1.3274,
      "num_input_tokens_seen": 35942623024,
      "step": 45684
    },
    {
      "epoch": 4.84670061531933,
      "grad_norm": 0.5708066001628717,
      "learning_rate": 3.2474366291372025e-05,
      "loss": 1.3735,
      "num_input_tokens_seen": 35943409728,
      "step": 45685
    },
    {
      "epoch": 4.846806704858901,
      "grad_norm": 0.7104875688170598,
      "learning_rate": 3.2473703106805544e-05,
      "loss": 1.2988,
      "num_input_tokens_seen": 35944196400,
      "step": 45686
    },
    {
      "epoch": 4.846912794398472,
      "grad_norm": 0.5295589277887393,
      "learning_rate": 3.2473039916463613e-05,
      "loss": 1.2717,
      "num_input_tokens_seen": 35944983168,
      "step": 45687
    },
    {
      "epoch": 4.847018883938044,
      "grad_norm": 0.6255252084689894,
      "learning_rate": 3.2472376720346734e-05,
      "loss": 1.2812,
      "num_input_tokens_seen": 35945770000,
      "step": 45688
    },
    {
      "epoch": 4.847124973477615,
      "grad_norm": 0.5159967763567567,
      "learning_rate": 3.247171351845542e-05,
      "loss": 1.2299,
      "num_input_tokens_seen": 35946556768,
      "step": 45689
    },
    {
      "epoch": 4.847231063017187,
      "grad_norm": 0.5554878347078975,
      "learning_rate": 3.247105031079019e-05,
      "loss": 1.3037,
      "num_input_tokens_seen": 35947343472,
      "step": 45690
    },
    {
      "epoch": 4.847337152556758,
      "grad_norm": 0.4846191198712825,
      "learning_rate": 3.247038709735155e-05,
      "loss": 1.2486,
      "num_input_tokens_seen": 35948130336,
      "step": 45691
    },
    {
      "epoch": 4.847443242096329,
      "grad_norm": 0.5399627240664787,
      "learning_rate": 3.246972387814e-05,
      "loss": 1.3482,
      "num_input_tokens_seen": 35948917056,
      "step": 45692
    },
    {
      "epoch": 4.847549331635901,
      "grad_norm": 0.6033470192444067,
      "learning_rate": 3.2469060653156085e-05,
      "loss": 1.2501,
      "num_input_tokens_seen": 35949703872,
      "step": 45693
    },
    {
      "epoch": 4.847655421175472,
      "grad_norm": 0.5072584148718364,
      "learning_rate": 3.2468397422400295e-05,
      "loss": 1.3988,
      "num_input_tokens_seen": 35950490512,
      "step": 45694
    },
    {
      "epoch": 4.847761510715044,
      "grad_norm": 0.718367180828494,
      "learning_rate": 3.246773418587314e-05,
      "loss": 1.2629,
      "num_input_tokens_seen": 35951277312,
      "step": 45695
    },
    {
      "epoch": 4.847867600254615,
      "grad_norm": 0.591911952862266,
      "learning_rate": 3.2467070943575144e-05,
      "loss": 1.2311,
      "num_input_tokens_seen": 35952063968,
      "step": 45696
    },
    {
      "epoch": 4.847973689794186,
      "grad_norm": 0.5716568028406336,
      "learning_rate": 3.2466407695506814e-05,
      "loss": 1.2693,
      "num_input_tokens_seen": 35952850704,
      "step": 45697
    },
    {
      "epoch": 4.848079779333758,
      "grad_norm": 0.6757477891338366,
      "learning_rate": 3.2465744441668664e-05,
      "loss": 1.2235,
      "num_input_tokens_seen": 35953637600,
      "step": 45698
    },
    {
      "epoch": 4.848185868873329,
      "grad_norm": 0.515900119718311,
      "learning_rate": 3.246508118206121e-05,
      "loss": 1.3196,
      "num_input_tokens_seen": 35954424352,
      "step": 45699
    },
    {
      "epoch": 4.848291958412901,
      "grad_norm": 0.515573868688125,
      "learning_rate": 3.2464417916684955e-05,
      "loss": 1.2676,
      "num_input_tokens_seen": 35955211104,
      "step": 45700
    },
    {
      "epoch": 4.848398047952472,
      "grad_norm": 0.6261010080994794,
      "learning_rate": 3.246375464554041e-05,
      "loss": 1.2844,
      "num_input_tokens_seen": 35955997792,
      "step": 45701
    },
    {
      "epoch": 4.848504137492043,
      "grad_norm": 0.5870805589550359,
      "learning_rate": 3.246309136862811e-05,
      "loss": 1.2766,
      "num_input_tokens_seen": 35956784592,
      "step": 45702
    },
    {
      "epoch": 4.848610227031615,
      "grad_norm": 0.456932562346226,
      "learning_rate": 3.2462428085948534e-05,
      "loss": 1.2239,
      "num_input_tokens_seen": 35957571296,
      "step": 45703
    },
    {
      "epoch": 4.848716316571186,
      "grad_norm": 0.4873877783308181,
      "learning_rate": 3.2461764797502224e-05,
      "loss": 1.3404,
      "num_input_tokens_seen": 35958358096,
      "step": 45704
    },
    {
      "epoch": 4.848822406110758,
      "grad_norm": 0.5658944788244259,
      "learning_rate": 3.246110150328969e-05,
      "loss": 1.2892,
      "num_input_tokens_seen": 35959144816,
      "step": 45705
    },
    {
      "epoch": 4.848928495650329,
      "grad_norm": 0.6064292130339668,
      "learning_rate": 3.246043820331142e-05,
      "loss": 1.2486,
      "num_input_tokens_seen": 35959931520,
      "step": 45706
    },
    {
      "epoch": 4.849034585189901,
      "grad_norm": 0.4777549010731274,
      "learning_rate": 3.245977489756795e-05,
      "loss": 1.2376,
      "num_input_tokens_seen": 35960718288,
      "step": 45707
    },
    {
      "epoch": 4.849140674729472,
      "grad_norm": 0.48611678647970064,
      "learning_rate": 3.2459111586059785e-05,
      "loss": 1.3214,
      "num_input_tokens_seen": 35961505120,
      "step": 45708
    },
    {
      "epoch": 4.8492467642690436,
      "grad_norm": 0.506414166511098,
      "learning_rate": 3.2458448268787426e-05,
      "loss": 1.2625,
      "num_input_tokens_seen": 35962291872,
      "step": 45709
    },
    {
      "epoch": 4.849352853808615,
      "grad_norm": 0.49706765798578867,
      "learning_rate": 3.245778494575141e-05,
      "loss": 1.2583,
      "num_input_tokens_seen": 35963078688,
      "step": 45710
    },
    {
      "epoch": 4.849458943348186,
      "grad_norm": 0.5413769689045768,
      "learning_rate": 3.245712161695224e-05,
      "loss": 1.3523,
      "num_input_tokens_seen": 35963865472,
      "step": 45711
    },
    {
      "epoch": 4.8495650328877575,
      "grad_norm": 0.5711060055846165,
      "learning_rate": 3.2456458282390405e-05,
      "loss": 1.2856,
      "num_input_tokens_seen": 35964652272,
      "step": 45712
    },
    {
      "epoch": 4.849671122427329,
      "grad_norm": 0.5870397739416576,
      "learning_rate": 3.245579494206645e-05,
      "loss": 1.3392,
      "num_input_tokens_seen": 35965438992,
      "step": 45713
    },
    {
      "epoch": 4.8497772119669005,
      "grad_norm": 0.5215902169527677,
      "learning_rate": 3.245513159598088e-05,
      "loss": 1.3488,
      "num_input_tokens_seen": 35966225744,
      "step": 45714
    },
    {
      "epoch": 4.8498833015064715,
      "grad_norm": 0.5294454831945697,
      "learning_rate": 3.245446824413419e-05,
      "loss": 1.2579,
      "num_input_tokens_seen": 35967012496,
      "step": 45715
    },
    {
      "epoch": 4.8499893910460425,
      "grad_norm": 0.5787158251549469,
      "learning_rate": 3.2453804886526924e-05,
      "loss": 1.2769,
      "num_input_tokens_seen": 35967799328,
      "step": 45716
    },
    {
      "epoch": 4.8500954805856145,
      "grad_norm": 0.5813498997131192,
      "learning_rate": 3.245314152315956e-05,
      "loss": 1.3621,
      "num_input_tokens_seen": 35968586080,
      "step": 45717
    },
    {
      "epoch": 4.8502015701251855,
      "grad_norm": 0.6840247564258581,
      "learning_rate": 3.245247815403264e-05,
      "loss": 1.3065,
      "num_input_tokens_seen": 35969372832,
      "step": 45718
    },
    {
      "epoch": 4.850307659664757,
      "grad_norm": 0.5445365582127423,
      "learning_rate": 3.245181477914666e-05,
      "loss": 1.3512,
      "num_input_tokens_seen": 35970159536,
      "step": 45719
    },
    {
      "epoch": 4.850413749204328,
      "grad_norm": 0.544763995390862,
      "learning_rate": 3.2451151398502125e-05,
      "loss": 1.2547,
      "num_input_tokens_seen": 35970946320,
      "step": 45720
    },
    {
      "epoch": 4.8505198387438995,
      "grad_norm": 0.6722366067439819,
      "learning_rate": 3.245048801209957e-05,
      "loss": 1.3079,
      "num_input_tokens_seen": 35971733104,
      "step": 45721
    },
    {
      "epoch": 4.850625928283471,
      "grad_norm": 0.5867390864653307,
      "learning_rate": 3.244982461993949e-05,
      "loss": 1.2451,
      "num_input_tokens_seen": 35972519904,
      "step": 45722
    },
    {
      "epoch": 4.850732017823042,
      "grad_norm": 0.6173336955557259,
      "learning_rate": 3.2449161222022414e-05,
      "loss": 1.4094,
      "num_input_tokens_seen": 35973306656,
      "step": 45723
    },
    {
      "epoch": 4.850838107362614,
      "grad_norm": 0.827708746730368,
      "learning_rate": 3.244849781834884e-05,
      "loss": 1.3043,
      "num_input_tokens_seen": 35974093440,
      "step": 45724
    },
    {
      "epoch": 4.850944196902185,
      "grad_norm": 0.7738913454550957,
      "learning_rate": 3.244783440891929e-05,
      "loss": 1.3515,
      "num_input_tokens_seen": 35974880304,
      "step": 45725
    },
    {
      "epoch": 4.851050286441756,
      "grad_norm": 0.6097009575001566,
      "learning_rate": 3.244717099373426e-05,
      "loss": 1.1717,
      "num_input_tokens_seen": 35975667088,
      "step": 45726
    },
    {
      "epoch": 4.851156375981328,
      "grad_norm": 1.3868976884603674,
      "learning_rate": 3.244650757279428e-05,
      "loss": 1.399,
      "num_input_tokens_seen": 35976453792,
      "step": 45727
    },
    {
      "epoch": 4.851262465520899,
      "grad_norm": 0.5754889424765168,
      "learning_rate": 3.2445844146099855e-05,
      "loss": 1.3387,
      "num_input_tokens_seen": 35977240528,
      "step": 45728
    },
    {
      "epoch": 4.851368555060471,
      "grad_norm": 0.8440462230262016,
      "learning_rate": 3.244518071365151e-05,
      "loss": 1.2174,
      "num_input_tokens_seen": 35978027360,
      "step": 45729
    },
    {
      "epoch": 4.851474644600042,
      "grad_norm": 0.926522270592374,
      "learning_rate": 3.244451727544974e-05,
      "loss": 1.3681,
      "num_input_tokens_seen": 35978814176,
      "step": 45730
    },
    {
      "epoch": 4.851580734139614,
      "grad_norm": 0.49368342756520794,
      "learning_rate": 3.2443853831495064e-05,
      "loss": 1.3155,
      "num_input_tokens_seen": 35979600992,
      "step": 45731
    },
    {
      "epoch": 4.851686823679185,
      "grad_norm": 0.7598841989752811,
      "learning_rate": 3.2443190381788e-05,
      "loss": 1.2388,
      "num_input_tokens_seen": 35980387776,
      "step": 45732
    },
    {
      "epoch": 4.851792913218756,
      "grad_norm": 1.4094189356791647,
      "learning_rate": 3.244252692632906e-05,
      "loss": 1.3228,
      "num_input_tokens_seen": 35981174496,
      "step": 45733
    },
    {
      "epoch": 4.851899002758328,
      "grad_norm": 0.6434338454903847,
      "learning_rate": 3.2441863465118745e-05,
      "loss": 1.3713,
      "num_input_tokens_seen": 35981961184,
      "step": 45734
    },
    {
      "epoch": 4.852005092297899,
      "grad_norm": 0.7998377907358587,
      "learning_rate": 3.244119999815758e-05,
      "loss": 1.3138,
      "num_input_tokens_seen": 35982747936,
      "step": 45735
    },
    {
      "epoch": 4.852111181837471,
      "grad_norm": 0.5868730655987896,
      "learning_rate": 3.2440536525446075e-05,
      "loss": 1.3189,
      "num_input_tokens_seen": 35983534720,
      "step": 45736
    },
    {
      "epoch": 4.852217271377042,
      "grad_norm": 0.5348191676021045,
      "learning_rate": 3.243987304698474e-05,
      "loss": 1.2422,
      "num_input_tokens_seen": 35984321504,
      "step": 45737
    },
    {
      "epoch": 4.852323360916614,
      "grad_norm": 0.7533979005705913,
      "learning_rate": 3.2439209562774095e-05,
      "loss": 1.3142,
      "num_input_tokens_seen": 35985108224,
      "step": 45738
    },
    {
      "epoch": 4.852429450456185,
      "grad_norm": 0.6182198934550516,
      "learning_rate": 3.2438546072814635e-05,
      "loss": 1.3622,
      "num_input_tokens_seen": 35985894992,
      "step": 45739
    },
    {
      "epoch": 4.852535539995756,
      "grad_norm": 0.7374282525623796,
      "learning_rate": 3.243788257710689e-05,
      "loss": 1.3407,
      "num_input_tokens_seen": 35986681744,
      "step": 45740
    },
    {
      "epoch": 4.852641629535328,
      "grad_norm": 0.9695560424401218,
      "learning_rate": 3.243721907565138e-05,
      "loss": 1.2611,
      "num_input_tokens_seen": 35987468592,
      "step": 45741
    },
    {
      "epoch": 4.852747719074899,
      "grad_norm": 0.5341828498674654,
      "learning_rate": 3.243655556844859e-05,
      "loss": 1.341,
      "num_input_tokens_seen": 35988255264,
      "step": 45742
    },
    {
      "epoch": 4.852853808614471,
      "grad_norm": 0.7428113233121577,
      "learning_rate": 3.243589205549905e-05,
      "loss": 1.2569,
      "num_input_tokens_seen": 35989042064,
      "step": 45743
    },
    {
      "epoch": 4.852959898154042,
      "grad_norm": 0.7467151613755129,
      "learning_rate": 3.243522853680328e-05,
      "loss": 1.3302,
      "num_input_tokens_seen": 35989828960,
      "step": 45744
    },
    {
      "epoch": 4.853065987693613,
      "grad_norm": 0.691623252289177,
      "learning_rate": 3.2434565012361775e-05,
      "loss": 1.3515,
      "num_input_tokens_seen": 35990615744,
      "step": 45745
    },
    {
      "epoch": 4.853172077233185,
      "grad_norm": 0.7328516214811863,
      "learning_rate": 3.243390148217506e-05,
      "loss": 1.3227,
      "num_input_tokens_seen": 35991402528,
      "step": 45746
    },
    {
      "epoch": 4.853278166772756,
      "grad_norm": 0.6733133470279486,
      "learning_rate": 3.243323794624365e-05,
      "loss": 1.32,
      "num_input_tokens_seen": 35992189296,
      "step": 45747
    },
    {
      "epoch": 4.853384256312328,
      "grad_norm": 0.5854021235449017,
      "learning_rate": 3.243257440456804e-05,
      "loss": 1.2923,
      "num_input_tokens_seen": 35992976128,
      "step": 45748
    },
    {
      "epoch": 4.853490345851899,
      "grad_norm": 0.7832995218702307,
      "learning_rate": 3.2431910857148754e-05,
      "loss": 1.2983,
      "num_input_tokens_seen": 35993762880,
      "step": 45749
    },
    {
      "epoch": 4.85359643539147,
      "grad_norm": 0.64730214966512,
      "learning_rate": 3.243124730398632e-05,
      "loss": 1.3489,
      "num_input_tokens_seen": 35994549728,
      "step": 45750
    },
    {
      "epoch": 4.853702524931042,
      "grad_norm": 0.5840412109693391,
      "learning_rate": 3.243058374508123e-05,
      "loss": 1.322,
      "num_input_tokens_seen": 35995336560,
      "step": 45751
    },
    {
      "epoch": 4.853808614470613,
      "grad_norm": 0.7961887987566026,
      "learning_rate": 3.242992018043399e-05,
      "loss": 1.3676,
      "num_input_tokens_seen": 35996123376,
      "step": 45752
    },
    {
      "epoch": 4.853914704010185,
      "grad_norm": 0.5534525568969629,
      "learning_rate": 3.242925661004515e-05,
      "loss": 1.2451,
      "num_input_tokens_seen": 35996910144,
      "step": 45753
    },
    {
      "epoch": 4.854020793549756,
      "grad_norm": 0.7465517855903433,
      "learning_rate": 3.2428593033915176e-05,
      "loss": 1.3419,
      "num_input_tokens_seen": 35997696960,
      "step": 45754
    },
    {
      "epoch": 4.854126883089327,
      "grad_norm": 0.523917847346654,
      "learning_rate": 3.2427929452044605e-05,
      "loss": 1.2221,
      "num_input_tokens_seen": 35998483808,
      "step": 45755
    },
    {
      "epoch": 4.854232972628899,
      "grad_norm": 0.503196135268214,
      "learning_rate": 3.242726586443396e-05,
      "loss": 1.2407,
      "num_input_tokens_seen": 35999270560,
      "step": 45756
    },
    {
      "epoch": 4.85433906216847,
      "grad_norm": 0.6240023268681375,
      "learning_rate": 3.242660227108373e-05,
      "loss": 1.3521,
      "num_input_tokens_seen": 36000057312,
      "step": 45757
    },
    {
      "epoch": 4.854445151708042,
      "grad_norm": 0.6073784385727168,
      "learning_rate": 3.242593867199446e-05,
      "loss": 1.3657,
      "num_input_tokens_seen": 36000844096,
      "step": 45758
    },
    {
      "epoch": 4.854551241247613,
      "grad_norm": 0.4894812052396512,
      "learning_rate": 3.2425275067166624e-05,
      "loss": 1.358,
      "num_input_tokens_seen": 36001630800,
      "step": 45759
    },
    {
      "epoch": 4.854657330787185,
      "grad_norm": 0.6147771670636648,
      "learning_rate": 3.242461145660075e-05,
      "loss": 1.3558,
      "num_input_tokens_seen": 36002417584,
      "step": 45760
    },
    {
      "epoch": 4.854763420326756,
      "grad_norm": 0.5298836747774442,
      "learning_rate": 3.242394784029737e-05,
      "loss": 1.2338,
      "num_input_tokens_seen": 36003204336,
      "step": 45761
    },
    {
      "epoch": 4.854869509866327,
      "grad_norm": 0.5629386859259304,
      "learning_rate": 3.242328421825697e-05,
      "loss": 1.4136,
      "num_input_tokens_seen": 36003991088,
      "step": 45762
    },
    {
      "epoch": 4.854975599405899,
      "grad_norm": 0.5175767565530928,
      "learning_rate": 3.242262059048008e-05,
      "loss": 1.301,
      "num_input_tokens_seen": 36004777776,
      "step": 45763
    },
    {
      "epoch": 4.85508168894547,
      "grad_norm": 0.507946985832197,
      "learning_rate": 3.24219569569672e-05,
      "loss": 1.3282,
      "num_input_tokens_seen": 36005564640,
      "step": 45764
    },
    {
      "epoch": 4.855187778485042,
      "grad_norm": 0.5735897225871531,
      "learning_rate": 3.242129331771886e-05,
      "loss": 1.2729,
      "num_input_tokens_seen": 36006351344,
      "step": 45765
    },
    {
      "epoch": 4.855293868024613,
      "grad_norm": 0.5484877736555664,
      "learning_rate": 3.242062967273555e-05,
      "loss": 1.2394,
      "num_input_tokens_seen": 36007138112,
      "step": 45766
    },
    {
      "epoch": 4.855399957564185,
      "grad_norm": 0.604137857725829,
      "learning_rate": 3.24199660220178e-05,
      "loss": 1.3871,
      "num_input_tokens_seen": 36007924848,
      "step": 45767
    },
    {
      "epoch": 4.855506047103756,
      "grad_norm": 0.4719164555650244,
      "learning_rate": 3.241930236556612e-05,
      "loss": 1.3486,
      "num_input_tokens_seen": 36008711600,
      "step": 45768
    },
    {
      "epoch": 4.855612136643327,
      "grad_norm": 0.5663237715117623,
      "learning_rate": 3.241863870338102e-05,
      "loss": 1.3717,
      "num_input_tokens_seen": 36009498336,
      "step": 45769
    },
    {
      "epoch": 4.855718226182899,
      "grad_norm": 0.6127032645327788,
      "learning_rate": 3.241797503546301e-05,
      "loss": 1.3485,
      "num_input_tokens_seen": 36010285104,
      "step": 45770
    },
    {
      "epoch": 4.85582431572247,
      "grad_norm": 0.6468242081536958,
      "learning_rate": 3.241731136181261e-05,
      "loss": 1.3038,
      "num_input_tokens_seen": 36011071968,
      "step": 45771
    },
    {
      "epoch": 4.855930405262042,
      "grad_norm": 0.5382040930755213,
      "learning_rate": 3.241664768243033e-05,
      "loss": 1.2921,
      "num_input_tokens_seen": 36011858768,
      "step": 45772
    },
    {
      "epoch": 4.856036494801613,
      "grad_norm": 0.5668397846420556,
      "learning_rate": 3.241598399731668e-05,
      "loss": 1.3365,
      "num_input_tokens_seen": 36012645456,
      "step": 45773
    },
    {
      "epoch": 4.856142584341184,
      "grad_norm": 0.6068725476405619,
      "learning_rate": 3.2415320306472176e-05,
      "loss": 1.2567,
      "num_input_tokens_seen": 36013432192,
      "step": 45774
    },
    {
      "epoch": 4.8562486738807555,
      "grad_norm": 0.5848920262062409,
      "learning_rate": 3.241465660989733e-05,
      "loss": 1.3876,
      "num_input_tokens_seen": 36014218864,
      "step": 45775
    },
    {
      "epoch": 4.856354763420327,
      "grad_norm": 0.5873262075375243,
      "learning_rate": 3.2413992907592655e-05,
      "loss": 1.3187,
      "num_input_tokens_seen": 36015005600,
      "step": 45776
    },
    {
      "epoch": 4.8564608529598985,
      "grad_norm": 0.513183343268133,
      "learning_rate": 3.241332919955866e-05,
      "loss": 1.3237,
      "num_input_tokens_seen": 36015792384,
      "step": 45777
    },
    {
      "epoch": 4.8565669424994695,
      "grad_norm": 0.48962035808620047,
      "learning_rate": 3.2412665485795865e-05,
      "loss": 1.3308,
      "num_input_tokens_seen": 36016579088,
      "step": 45778
    },
    {
      "epoch": 4.8566730320390405,
      "grad_norm": 0.5168657906875299,
      "learning_rate": 3.241200176630479e-05,
      "loss": 1.2858,
      "num_input_tokens_seen": 36017365856,
      "step": 45779
    },
    {
      "epoch": 4.8567791215786125,
      "grad_norm": 0.5222978430227972,
      "learning_rate": 3.241133804108592e-05,
      "loss": 1.2483,
      "num_input_tokens_seen": 36018152736,
      "step": 45780
    },
    {
      "epoch": 4.8568852111181835,
      "grad_norm": 0.46009451359885817,
      "learning_rate": 3.24106743101398e-05,
      "loss": 1.2664,
      "num_input_tokens_seen": 36018939472,
      "step": 45781
    },
    {
      "epoch": 4.856991300657755,
      "grad_norm": 0.6562565893625742,
      "learning_rate": 3.241001057346692e-05,
      "loss": 1.3235,
      "num_input_tokens_seen": 36019726272,
      "step": 45782
    },
    {
      "epoch": 4.8570973901973264,
      "grad_norm": 0.5801574829988052,
      "learning_rate": 3.24093468310678e-05,
      "loss": 1.3325,
      "num_input_tokens_seen": 36020512912,
      "step": 45783
    },
    {
      "epoch": 4.8572034797368975,
      "grad_norm": 0.5966192811452558,
      "learning_rate": 3.240868308294296e-05,
      "loss": 1.3469,
      "num_input_tokens_seen": 36021299664,
      "step": 45784
    },
    {
      "epoch": 4.857309569276469,
      "grad_norm": 0.7827541106937687,
      "learning_rate": 3.2408019329092904e-05,
      "loss": 1.2787,
      "num_input_tokens_seen": 36022086384,
      "step": 45785
    },
    {
      "epoch": 4.85741565881604,
      "grad_norm": 0.5114627863774649,
      "learning_rate": 3.240735556951814e-05,
      "loss": 1.273,
      "num_input_tokens_seen": 36022873168,
      "step": 45786
    },
    {
      "epoch": 4.857521748355612,
      "grad_norm": 0.5670258574312029,
      "learning_rate": 3.2406691804219204e-05,
      "loss": 1.3432,
      "num_input_tokens_seen": 36023659920,
      "step": 45787
    },
    {
      "epoch": 4.857627837895183,
      "grad_norm": 0.505560765157758,
      "learning_rate": 3.240602803319658e-05,
      "loss": 1.2107,
      "num_input_tokens_seen": 36024446720,
      "step": 45788
    },
    {
      "epoch": 4.857733927434755,
      "grad_norm": 0.8432098992961039,
      "learning_rate": 3.240536425645081e-05,
      "loss": 1.4338,
      "num_input_tokens_seen": 36025233328,
      "step": 45789
    },
    {
      "epoch": 4.857840016974326,
      "grad_norm": 0.5598107249020267,
      "learning_rate": 3.240470047398238e-05,
      "loss": 1.2754,
      "num_input_tokens_seen": 36026020128,
      "step": 45790
    },
    {
      "epoch": 4.857946106513897,
      "grad_norm": 0.8388357854048069,
      "learning_rate": 3.240403668579182e-05,
      "loss": 1.3291,
      "num_input_tokens_seen": 36026806768,
      "step": 45791
    },
    {
      "epoch": 4.858052196053469,
      "grad_norm": 0.5139113376213369,
      "learning_rate": 3.2403372891879634e-05,
      "loss": 1.2219,
      "num_input_tokens_seen": 36027593584,
      "step": 45792
    },
    {
      "epoch": 4.85815828559304,
      "grad_norm": 0.6391928324017553,
      "learning_rate": 3.240270909224634e-05,
      "loss": 1.3999,
      "num_input_tokens_seen": 36028380384,
      "step": 45793
    },
    {
      "epoch": 4.858264375132612,
      "grad_norm": 0.5373143978169435,
      "learning_rate": 3.2402045286892454e-05,
      "loss": 1.3521,
      "num_input_tokens_seen": 36029167104,
      "step": 45794
    },
    {
      "epoch": 4.858370464672183,
      "grad_norm": 0.4922702115860246,
      "learning_rate": 3.2401381475818474e-05,
      "loss": 1.3317,
      "num_input_tokens_seen": 36029953936,
      "step": 45795
    },
    {
      "epoch": 4.858476554211755,
      "grad_norm": 0.46890652796546967,
      "learning_rate": 3.2400717659024934e-05,
      "loss": 1.2763,
      "num_input_tokens_seen": 36030740752,
      "step": 45796
    },
    {
      "epoch": 4.858582643751326,
      "grad_norm": 0.5236142934051337,
      "learning_rate": 3.240005383651234e-05,
      "loss": 1.2955,
      "num_input_tokens_seen": 36031527600,
      "step": 45797
    },
    {
      "epoch": 4.858688733290897,
      "grad_norm": 0.47722276955820564,
      "learning_rate": 3.239939000828119e-05,
      "loss": 1.2763,
      "num_input_tokens_seen": 36032314464,
      "step": 45798
    },
    {
      "epoch": 4.858794822830469,
      "grad_norm": 0.5247392092347061,
      "learning_rate": 3.2398726174332015e-05,
      "loss": 1.2709,
      "num_input_tokens_seen": 36033101360,
      "step": 45799
    },
    {
      "epoch": 4.85890091237004,
      "grad_norm": 0.5162014586151141,
      "learning_rate": 3.239806233466531e-05,
      "loss": 1.2969,
      "num_input_tokens_seen": 36033888032,
      "step": 45800
    },
    {
      "epoch": 4.859007001909612,
      "grad_norm": 0.5275271127402948,
      "learning_rate": 3.239739848928161e-05,
      "loss": 1.2695,
      "num_input_tokens_seen": 36034674896,
      "step": 45801
    },
    {
      "epoch": 4.859113091449183,
      "grad_norm": 0.45871601435306786,
      "learning_rate": 3.239673463818142e-05,
      "loss": 1.2758,
      "num_input_tokens_seen": 36035461600,
      "step": 45802
    },
    {
      "epoch": 4.859219180988754,
      "grad_norm": 0.6895408543037939,
      "learning_rate": 3.2396070781365245e-05,
      "loss": 1.3474,
      "num_input_tokens_seen": 36036248368,
      "step": 45803
    },
    {
      "epoch": 4.859325270528326,
      "grad_norm": 0.5340113641925176,
      "learning_rate": 3.239540691883361e-05,
      "loss": 1.3826,
      "num_input_tokens_seen": 36037035072,
      "step": 45804
    },
    {
      "epoch": 4.859431360067897,
      "grad_norm": 0.7817634119803614,
      "learning_rate": 3.239474305058702e-05,
      "loss": 1.3805,
      "num_input_tokens_seen": 36037821904,
      "step": 45805
    },
    {
      "epoch": 4.859537449607469,
      "grad_norm": 0.5375471176549468,
      "learning_rate": 3.239407917662598e-05,
      "loss": 1.2845,
      "num_input_tokens_seen": 36038608672,
      "step": 45806
    },
    {
      "epoch": 4.85964353914704,
      "grad_norm": 0.6306930443989451,
      "learning_rate": 3.239341529695102e-05,
      "loss": 1.3909,
      "num_input_tokens_seen": 36039395408,
      "step": 45807
    },
    {
      "epoch": 4.859749628686611,
      "grad_norm": 0.7006319483802,
      "learning_rate": 3.239275141156265e-05,
      "loss": 1.3868,
      "num_input_tokens_seen": 36040182224,
      "step": 45808
    },
    {
      "epoch": 4.859855718226183,
      "grad_norm": 0.45344270706204093,
      "learning_rate": 3.239208752046137e-05,
      "loss": 1.2451,
      "num_input_tokens_seen": 36040968992,
      "step": 45809
    },
    {
      "epoch": 4.859961807765754,
      "grad_norm": 0.6066861633354298,
      "learning_rate": 3.239142362364771e-05,
      "loss": 1.3956,
      "num_input_tokens_seen": 36041755712,
      "step": 45810
    },
    {
      "epoch": 4.860067897305326,
      "grad_norm": 0.6152558199272801,
      "learning_rate": 3.2390759721122167e-05,
      "loss": 1.3114,
      "num_input_tokens_seen": 36042542464,
      "step": 45811
    },
    {
      "epoch": 4.860173986844897,
      "grad_norm": 0.4797824999955884,
      "learning_rate": 3.239009581288526e-05,
      "loss": 1.2542,
      "num_input_tokens_seen": 36043329232,
      "step": 45812
    },
    {
      "epoch": 4.860280076384468,
      "grad_norm": 0.48420943649209053,
      "learning_rate": 3.238943189893751e-05,
      "loss": 1.2927,
      "num_input_tokens_seen": 36044116080,
      "step": 45813
    },
    {
      "epoch": 4.86038616592404,
      "grad_norm": 0.5367925183411177,
      "learning_rate": 3.238876797927943e-05,
      "loss": 1.2814,
      "num_input_tokens_seen": 36044902912,
      "step": 45814
    },
    {
      "epoch": 4.860492255463611,
      "grad_norm": 0.4471222133766058,
      "learning_rate": 3.238810405391151e-05,
      "loss": 1.2706,
      "num_input_tokens_seen": 36045689664,
      "step": 45815
    },
    {
      "epoch": 4.860598345003183,
      "grad_norm": 0.5809475052039237,
      "learning_rate": 3.2387440122834296e-05,
      "loss": 1.2425,
      "num_input_tokens_seen": 36046476464,
      "step": 45816
    },
    {
      "epoch": 4.860704434542754,
      "grad_norm": 0.5206085486091208,
      "learning_rate": 3.2386776186048274e-05,
      "loss": 1.2982,
      "num_input_tokens_seen": 36047263264,
      "step": 45817
    },
    {
      "epoch": 4.860810524082326,
      "grad_norm": 0.7262369754300565,
      "learning_rate": 3.2386112243553974e-05,
      "loss": 1.4079,
      "num_input_tokens_seen": 36048049936,
      "step": 45818
    },
    {
      "epoch": 4.860916613621897,
      "grad_norm": 0.5394272083640352,
      "learning_rate": 3.23854482953519e-05,
      "loss": 1.2953,
      "num_input_tokens_seen": 36048836832,
      "step": 45819
    },
    {
      "epoch": 4.861022703161468,
      "grad_norm": 0.5842800543350424,
      "learning_rate": 3.238478434144257e-05,
      "loss": 1.3176,
      "num_input_tokens_seen": 36049623728,
      "step": 45820
    },
    {
      "epoch": 4.86112879270104,
      "grad_norm": 0.5466506661326315,
      "learning_rate": 3.2384120381826496e-05,
      "loss": 1.3392,
      "num_input_tokens_seen": 36050410448,
      "step": 45821
    },
    {
      "epoch": 4.861234882240611,
      "grad_norm": 0.47271697932996604,
      "learning_rate": 3.2383456416504185e-05,
      "loss": 1.1962,
      "num_input_tokens_seen": 36051197200,
      "step": 45822
    },
    {
      "epoch": 4.861340971780183,
      "grad_norm": 0.4950722388910133,
      "learning_rate": 3.2382792445476164e-05,
      "loss": 1.4255,
      "num_input_tokens_seen": 36051983952,
      "step": 45823
    },
    {
      "epoch": 4.861447061319754,
      "grad_norm": 0.5706218816475428,
      "learning_rate": 3.238212846874294e-05,
      "loss": 1.3497,
      "num_input_tokens_seen": 36052770608,
      "step": 45824
    },
    {
      "epoch": 4.861553150859326,
      "grad_norm": 0.4628850420396419,
      "learning_rate": 3.238146448630501e-05,
      "loss": 1.3811,
      "num_input_tokens_seen": 36053557424,
      "step": 45825
    },
    {
      "epoch": 4.861659240398897,
      "grad_norm": 0.5381892371173023,
      "learning_rate": 3.238080049816291e-05,
      "loss": 1.2993,
      "num_input_tokens_seen": 36054344160,
      "step": 45826
    },
    {
      "epoch": 4.861765329938468,
      "grad_norm": 0.5916247863789914,
      "learning_rate": 3.2380136504317146e-05,
      "loss": 1.2501,
      "num_input_tokens_seen": 36055130960,
      "step": 45827
    },
    {
      "epoch": 4.86187141947804,
      "grad_norm": 0.47360933641957303,
      "learning_rate": 3.237947250476822e-05,
      "loss": 1.3421,
      "num_input_tokens_seen": 36055917680,
      "step": 45828
    },
    {
      "epoch": 4.861977509017611,
      "grad_norm": 0.5129621799770243,
      "learning_rate": 3.237880849951666e-05,
      "loss": 1.2302,
      "num_input_tokens_seen": 36056704448,
      "step": 45829
    },
    {
      "epoch": 4.862083598557183,
      "grad_norm": 0.47390002862276276,
      "learning_rate": 3.2378144488562974e-05,
      "loss": 1.277,
      "num_input_tokens_seen": 36057491136,
      "step": 45830
    },
    {
      "epoch": 4.862189688096754,
      "grad_norm": 0.4989826004261526,
      "learning_rate": 3.2377480471907674e-05,
      "loss": 1.3259,
      "num_input_tokens_seen": 36058277872,
      "step": 45831
    },
    {
      "epoch": 4.862295777636325,
      "grad_norm": 0.5105397525624783,
      "learning_rate": 3.237681644955127e-05,
      "loss": 1.2532,
      "num_input_tokens_seen": 36059064704,
      "step": 45832
    },
    {
      "epoch": 4.862401867175897,
      "grad_norm": 0.4725668719853369,
      "learning_rate": 3.237615242149428e-05,
      "loss": 1.2766,
      "num_input_tokens_seen": 36059851536,
      "step": 45833
    },
    {
      "epoch": 4.862507956715468,
      "grad_norm": 0.4936993639260889,
      "learning_rate": 3.237548838773722e-05,
      "loss": 1.2771,
      "num_input_tokens_seen": 36060638352,
      "step": 45834
    },
    {
      "epoch": 4.86261404625504,
      "grad_norm": 0.5994131451297152,
      "learning_rate": 3.2374824348280594e-05,
      "loss": 1.3321,
      "num_input_tokens_seen": 36061425168,
      "step": 45835
    },
    {
      "epoch": 4.862720135794611,
      "grad_norm": 0.5354610709688068,
      "learning_rate": 3.2374160303124926e-05,
      "loss": 1.3012,
      "num_input_tokens_seen": 36062211920,
      "step": 45836
    },
    {
      "epoch": 4.862826225334182,
      "grad_norm": 0.4698979550324722,
      "learning_rate": 3.237349625227071e-05,
      "loss": 1.3603,
      "num_input_tokens_seen": 36062998752,
      "step": 45837
    },
    {
      "epoch": 4.8629323148737535,
      "grad_norm": 0.5275892159035916,
      "learning_rate": 3.2372832195718486e-05,
      "loss": 1.2803,
      "num_input_tokens_seen": 36063785552,
      "step": 45838
    },
    {
      "epoch": 4.863038404413325,
      "grad_norm": 0.5849788981065228,
      "learning_rate": 3.237216813346875e-05,
      "loss": 1.2965,
      "num_input_tokens_seen": 36064572272,
      "step": 45839
    },
    {
      "epoch": 4.8631444939528965,
      "grad_norm": 0.5403195113155426,
      "learning_rate": 3.237150406552202e-05,
      "loss": 1.1591,
      "num_input_tokens_seen": 36065359184,
      "step": 45840
    },
    {
      "epoch": 4.8632505834924675,
      "grad_norm": 0.4911317685266581,
      "learning_rate": 3.2370839991878805e-05,
      "loss": 1.186,
      "num_input_tokens_seen": 36066146016,
      "step": 45841
    },
    {
      "epoch": 4.863356673032039,
      "grad_norm": 0.5314149233341053,
      "learning_rate": 3.2370175912539625e-05,
      "loss": 1.3601,
      "num_input_tokens_seen": 36066932800,
      "step": 45842
    },
    {
      "epoch": 4.8634627625716105,
      "grad_norm": 0.6164197743293318,
      "learning_rate": 3.236951182750498e-05,
      "loss": 1.4996,
      "num_input_tokens_seen": 36067719552,
      "step": 45843
    },
    {
      "epoch": 4.8635688521111815,
      "grad_norm": 0.5235069702395168,
      "learning_rate": 3.2368847736775396e-05,
      "loss": 1.3533,
      "num_input_tokens_seen": 36068506400,
      "step": 45844
    },
    {
      "epoch": 4.863674941650753,
      "grad_norm": 0.5161209700075252,
      "learning_rate": 3.236818364035139e-05,
      "loss": 1.2953,
      "num_input_tokens_seen": 36069293168,
      "step": 45845
    },
    {
      "epoch": 4.8637810311903245,
      "grad_norm": 0.5043857704493382,
      "learning_rate": 3.236751953823346e-05,
      "loss": 1.2733,
      "num_input_tokens_seen": 36070079888,
      "step": 45846
    },
    {
      "epoch": 4.863887120729896,
      "grad_norm": 0.5682595769830978,
      "learning_rate": 3.236685543042214e-05,
      "loss": 1.2933,
      "num_input_tokens_seen": 36070866624,
      "step": 45847
    },
    {
      "epoch": 4.863993210269467,
      "grad_norm": 0.6073069343463571,
      "learning_rate": 3.236619131691792e-05,
      "loss": 1.3053,
      "num_input_tokens_seen": 36071653408,
      "step": 45848
    },
    {
      "epoch": 4.864099299809039,
      "grad_norm": 0.546839545990179,
      "learning_rate": 3.236552719772132e-05,
      "loss": 1.2751,
      "num_input_tokens_seen": 36072440208,
      "step": 45849
    },
    {
      "epoch": 4.86420538934861,
      "grad_norm": 0.600549171707123,
      "learning_rate": 3.2364863072832864e-05,
      "loss": 1.265,
      "num_input_tokens_seen": 36073227008,
      "step": 45850
    },
    {
      "epoch": 4.864311478888181,
      "grad_norm": 0.5378504861749622,
      "learning_rate": 3.2364198942253056e-05,
      "loss": 1.4061,
      "num_input_tokens_seen": 36074013712,
      "step": 45851
    },
    {
      "epoch": 4.864417568427753,
      "grad_norm": 0.612257441070507,
      "learning_rate": 3.236353480598241e-05,
      "loss": 1.4,
      "num_input_tokens_seen": 36074800528,
      "step": 45852
    },
    {
      "epoch": 4.864523657967324,
      "grad_norm": 0.5708550062369416,
      "learning_rate": 3.2362870664021436e-05,
      "loss": 1.4062,
      "num_input_tokens_seen": 36075587264,
      "step": 45853
    },
    {
      "epoch": 4.864629747506896,
      "grad_norm": 0.6235946460531181,
      "learning_rate": 3.236220651637066e-05,
      "loss": 1.3281,
      "num_input_tokens_seen": 36076374016,
      "step": 45854
    },
    {
      "epoch": 4.864735837046467,
      "grad_norm": 0.6750895446287347,
      "learning_rate": 3.236154236303058e-05,
      "loss": 1.2903,
      "num_input_tokens_seen": 36077160736,
      "step": 45855
    },
    {
      "epoch": 4.864841926586038,
      "grad_norm": 0.5370208162097113,
      "learning_rate": 3.236087820400173e-05,
      "loss": 1.3351,
      "num_input_tokens_seen": 36077947488,
      "step": 45856
    },
    {
      "epoch": 4.86494801612561,
      "grad_norm": 0.4748573057709622,
      "learning_rate": 3.2360214039284596e-05,
      "loss": 1.2081,
      "num_input_tokens_seen": 36078734288,
      "step": 45857
    },
    {
      "epoch": 4.865054105665181,
      "grad_norm": 0.4951197855499373,
      "learning_rate": 3.2359549868879704e-05,
      "loss": 1.2838,
      "num_input_tokens_seen": 36079521072,
      "step": 45858
    },
    {
      "epoch": 4.865160195204753,
      "grad_norm": 0.5600703473970093,
      "learning_rate": 3.235888569278757e-05,
      "loss": 1.2613,
      "num_input_tokens_seen": 36080307856,
      "step": 45859
    },
    {
      "epoch": 4.865266284744324,
      "grad_norm": 0.5986628697237194,
      "learning_rate": 3.2358221511008704e-05,
      "loss": 1.3747,
      "num_input_tokens_seen": 36081094624,
      "step": 45860
    },
    {
      "epoch": 4.865372374283895,
      "grad_norm": 0.5960215102249793,
      "learning_rate": 3.235755732354363e-05,
      "loss": 1.3167,
      "num_input_tokens_seen": 36081881360,
      "step": 45861
    },
    {
      "epoch": 4.865478463823467,
      "grad_norm": 0.5938317322245649,
      "learning_rate": 3.235689313039284e-05,
      "loss": 1.3039,
      "num_input_tokens_seen": 36082668176,
      "step": 45862
    },
    {
      "epoch": 4.865584553363038,
      "grad_norm": 0.5782446489679471,
      "learning_rate": 3.235622893155686e-05,
      "loss": 1.2391,
      "num_input_tokens_seen": 36083454960,
      "step": 45863
    },
    {
      "epoch": 4.86569064290261,
      "grad_norm": 0.5415234899830647,
      "learning_rate": 3.235556472703621e-05,
      "loss": 1.3217,
      "num_input_tokens_seen": 36084241712,
      "step": 45864
    },
    {
      "epoch": 4.865796732442181,
      "grad_norm": 0.5657154726133057,
      "learning_rate": 3.235490051683139e-05,
      "loss": 1.3174,
      "num_input_tokens_seen": 36085028432,
      "step": 45865
    },
    {
      "epoch": 4.865902821981752,
      "grad_norm": 0.6202113201889264,
      "learning_rate": 3.235423630094291e-05,
      "loss": 1.2811,
      "num_input_tokens_seen": 36085815200,
      "step": 45866
    },
    {
      "epoch": 4.866008911521324,
      "grad_norm": 0.4953240292957551,
      "learning_rate": 3.235357207937131e-05,
      "loss": 1.3444,
      "num_input_tokens_seen": 36086602048,
      "step": 45867
    },
    {
      "epoch": 4.866115001060895,
      "grad_norm": 0.639894713751494,
      "learning_rate": 3.2352907852117075e-05,
      "loss": 1.2942,
      "num_input_tokens_seen": 36087388880,
      "step": 45868
    },
    {
      "epoch": 4.866221090600467,
      "grad_norm": 0.46782950937610096,
      "learning_rate": 3.235224361918073e-05,
      "loss": 1.3168,
      "num_input_tokens_seen": 36088175616,
      "step": 45869
    },
    {
      "epoch": 4.866327180140038,
      "grad_norm": 0.5208584777413625,
      "learning_rate": 3.235157938056279e-05,
      "loss": 1.3466,
      "num_input_tokens_seen": 36088962368,
      "step": 45870
    },
    {
      "epoch": 4.866433269679609,
      "grad_norm": 0.5692417390816641,
      "learning_rate": 3.235091513626376e-05,
      "loss": 1.2991,
      "num_input_tokens_seen": 36089749120,
      "step": 45871
    },
    {
      "epoch": 4.866539359219181,
      "grad_norm": 0.5052345634207625,
      "learning_rate": 3.235025088628415e-05,
      "loss": 1.3618,
      "num_input_tokens_seen": 36090535936,
      "step": 45872
    },
    {
      "epoch": 4.866645448758752,
      "grad_norm": 0.6188957676299278,
      "learning_rate": 3.23495866306245e-05,
      "loss": 1.4057,
      "num_input_tokens_seen": 36091322688,
      "step": 45873
    },
    {
      "epoch": 4.866751538298324,
      "grad_norm": 0.5191545869802723,
      "learning_rate": 3.23489223692853e-05,
      "loss": 1.2884,
      "num_input_tokens_seen": 36092109424,
      "step": 45874
    },
    {
      "epoch": 4.866857627837895,
      "grad_norm": 0.5517173520706895,
      "learning_rate": 3.234825810226706e-05,
      "loss": 1.354,
      "num_input_tokens_seen": 36092896160,
      "step": 45875
    },
    {
      "epoch": 4.866963717377467,
      "grad_norm": 0.5449794935397211,
      "learning_rate": 3.234759382957031e-05,
      "loss": 1.1813,
      "num_input_tokens_seen": 36093683008,
      "step": 45876
    },
    {
      "epoch": 4.867069806917038,
      "grad_norm": 0.5408007105218066,
      "learning_rate": 3.234692955119555e-05,
      "loss": 1.2683,
      "num_input_tokens_seen": 36094469728,
      "step": 45877
    },
    {
      "epoch": 4.86717589645661,
      "grad_norm": 0.5241300858921324,
      "learning_rate": 3.2346265267143305e-05,
      "loss": 1.319,
      "num_input_tokens_seen": 36095256496,
      "step": 45878
    },
    {
      "epoch": 4.867281985996181,
      "grad_norm": 0.7390358426510502,
      "learning_rate": 3.234560097741408e-05,
      "loss": 1.4546,
      "num_input_tokens_seen": 36096043200,
      "step": 45879
    },
    {
      "epoch": 4.867388075535752,
      "grad_norm": 0.5553591077549974,
      "learning_rate": 3.234493668200838e-05,
      "loss": 1.3429,
      "num_input_tokens_seen": 36096829968,
      "step": 45880
    },
    {
      "epoch": 4.867494165075324,
      "grad_norm": 0.551762639190355,
      "learning_rate": 3.234427238092674e-05,
      "loss": 1.2174,
      "num_input_tokens_seen": 36097616784,
      "step": 45881
    },
    {
      "epoch": 4.867600254614895,
      "grad_norm": 0.525284146706569,
      "learning_rate": 3.234360807416965e-05,
      "loss": 1.2517,
      "num_input_tokens_seen": 36098403520,
      "step": 45882
    },
    {
      "epoch": 4.867706344154467,
      "grad_norm": 0.5243834927412055,
      "learning_rate": 3.234294376173765e-05,
      "loss": 1.2255,
      "num_input_tokens_seen": 36099190304,
      "step": 45883
    },
    {
      "epoch": 4.867812433694038,
      "grad_norm": 0.4911323139917824,
      "learning_rate": 3.234227944363123e-05,
      "loss": 1.3185,
      "num_input_tokens_seen": 36099977024,
      "step": 45884
    },
    {
      "epoch": 4.867918523233609,
      "grad_norm": 0.5915714694593814,
      "learning_rate": 3.234161511985091e-05,
      "loss": 1.2945,
      "num_input_tokens_seen": 36100763792,
      "step": 45885
    },
    {
      "epoch": 4.868024612773181,
      "grad_norm": 0.5113739185513302,
      "learning_rate": 3.2340950790397205e-05,
      "loss": 1.2336,
      "num_input_tokens_seen": 36101550592,
      "step": 45886
    },
    {
      "epoch": 4.868130702312752,
      "grad_norm": 0.5373334814778075,
      "learning_rate": 3.2340286455270635e-05,
      "loss": 1.2151,
      "num_input_tokens_seen": 36102337440,
      "step": 45887
    },
    {
      "epoch": 4.868236791852324,
      "grad_norm": 0.4570357889434854,
      "learning_rate": 3.233962211447171e-05,
      "loss": 1.233,
      "num_input_tokens_seen": 36103124288,
      "step": 45888
    },
    {
      "epoch": 4.868342881391895,
      "grad_norm": 0.615347412433977,
      "learning_rate": 3.233895776800093e-05,
      "loss": 1.3056,
      "num_input_tokens_seen": 36103911024,
      "step": 45889
    },
    {
      "epoch": 4.868448970931466,
      "grad_norm": 0.5194389287516308,
      "learning_rate": 3.2338293415858824e-05,
      "loss": 1.3014,
      "num_input_tokens_seen": 36104697712,
      "step": 45890
    },
    {
      "epoch": 4.868555060471038,
      "grad_norm": 0.4861035555639772,
      "learning_rate": 3.233762905804591e-05,
      "loss": 1.3136,
      "num_input_tokens_seen": 36105484400,
      "step": 45891
    },
    {
      "epoch": 4.868661150010609,
      "grad_norm": 0.46290117785621826,
      "learning_rate": 3.2336964694562674e-05,
      "loss": 1.3185,
      "num_input_tokens_seen": 36106271120,
      "step": 45892
    },
    {
      "epoch": 4.868767239550181,
      "grad_norm": 0.49802677767120407,
      "learning_rate": 3.233630032540965e-05,
      "loss": 1.3129,
      "num_input_tokens_seen": 36107057888,
      "step": 45893
    },
    {
      "epoch": 4.868873329089752,
      "grad_norm": 0.4775935638327549,
      "learning_rate": 3.233563595058736e-05,
      "loss": 1.3374,
      "num_input_tokens_seen": 36107844592,
      "step": 45894
    },
    {
      "epoch": 4.868979418629323,
      "grad_norm": 0.5110638167133921,
      "learning_rate": 3.233497157009629e-05,
      "loss": 1.4154,
      "num_input_tokens_seen": 36108631280,
      "step": 45895
    },
    {
      "epoch": 4.869085508168895,
      "grad_norm": 0.620930583042715,
      "learning_rate": 3.233430718393698e-05,
      "loss": 1.3742,
      "num_input_tokens_seen": 36109418096,
      "step": 45896
    },
    {
      "epoch": 4.869191597708466,
      "grad_norm": 0.6098105641271122,
      "learning_rate": 3.233364279210993e-05,
      "loss": 1.4176,
      "num_input_tokens_seen": 36110204880,
      "step": 45897
    },
    {
      "epoch": 4.869297687248038,
      "grad_norm": 0.5507423367569388,
      "learning_rate": 3.233297839461565e-05,
      "loss": 1.3363,
      "num_input_tokens_seen": 36110991584,
      "step": 45898
    },
    {
      "epoch": 4.869403776787609,
      "grad_norm": 0.48253222706357624,
      "learning_rate": 3.233231399145467e-05,
      "loss": 1.2827,
      "num_input_tokens_seen": 36111778288,
      "step": 45899
    },
    {
      "epoch": 4.8695098663271805,
      "grad_norm": 0.5021080300257194,
      "learning_rate": 3.2331649582627494e-05,
      "loss": 1.2731,
      "num_input_tokens_seen": 36112565056,
      "step": 45900
    },
    {
      "epoch": 4.8696159558667516,
      "grad_norm": 0.5239263243081368,
      "learning_rate": 3.233098516813463e-05,
      "loss": 1.3564,
      "num_input_tokens_seen": 36113351792,
      "step": 45901
    },
    {
      "epoch": 4.869722045406323,
      "grad_norm": 0.5963110468677616,
      "learning_rate": 3.23303207479766e-05,
      "loss": 1.4267,
      "num_input_tokens_seen": 36114138496,
      "step": 45902
    },
    {
      "epoch": 4.8698281349458945,
      "grad_norm": 0.47490272782536425,
      "learning_rate": 3.2329656322153894e-05,
      "loss": 1.2995,
      "num_input_tokens_seen": 36114925296,
      "step": 45903
    },
    {
      "epoch": 4.8699342244854655,
      "grad_norm": 0.527106919119284,
      "learning_rate": 3.232899189066706e-05,
      "loss": 1.387,
      "num_input_tokens_seen": 36115712032,
      "step": 45904
    },
    {
      "epoch": 4.8700403140250375,
      "grad_norm": 0.5497883181115807,
      "learning_rate": 3.23283274535166e-05,
      "loss": 1.3575,
      "num_input_tokens_seen": 36116498736,
      "step": 45905
    },
    {
      "epoch": 4.8701464035646085,
      "grad_norm": 0.574147527750102,
      "learning_rate": 3.232766301070301e-05,
      "loss": 1.284,
      "num_input_tokens_seen": 36117285568,
      "step": 45906
    },
    {
      "epoch": 4.87025249310418,
      "grad_norm": 0.4861327889416292,
      "learning_rate": 3.232699856222683e-05,
      "loss": 1.3001,
      "num_input_tokens_seen": 36118072272,
      "step": 45907
    },
    {
      "epoch": 4.870358582643751,
      "grad_norm": 0.5777651660118291,
      "learning_rate": 3.2326334108088555e-05,
      "loss": 1.3072,
      "num_input_tokens_seen": 36118858928,
      "step": 45908
    },
    {
      "epoch": 4.8704646721833225,
      "grad_norm": 0.5698621203458196,
      "learning_rate": 3.2325669648288704e-05,
      "loss": 1.3067,
      "num_input_tokens_seen": 36119645728,
      "step": 45909
    },
    {
      "epoch": 4.870570761722894,
      "grad_norm": 0.5308223268270381,
      "learning_rate": 3.232500518282779e-05,
      "loss": 1.2991,
      "num_input_tokens_seen": 36120432496,
      "step": 45910
    },
    {
      "epoch": 4.870676851262465,
      "grad_norm": 0.6353911189933706,
      "learning_rate": 3.2324340711706336e-05,
      "loss": 1.3151,
      "num_input_tokens_seen": 36121219328,
      "step": 45911
    },
    {
      "epoch": 4.870782940802037,
      "grad_norm": 0.5620213435629976,
      "learning_rate": 3.232367623492483e-05,
      "loss": 1.2869,
      "num_input_tokens_seen": 36122006000,
      "step": 45912
    },
    {
      "epoch": 4.870889030341608,
      "grad_norm": 0.5508858623868342,
      "learning_rate": 3.2323011752483815e-05,
      "loss": 1.3774,
      "num_input_tokens_seen": 36122792816,
      "step": 45913
    },
    {
      "epoch": 4.870995119881179,
      "grad_norm": 0.5130999256934389,
      "learning_rate": 3.232234726438379e-05,
      "loss": 1.35,
      "num_input_tokens_seen": 36123579552,
      "step": 45914
    },
    {
      "epoch": 4.871101209420751,
      "grad_norm": 0.583868471606728,
      "learning_rate": 3.232168277062526e-05,
      "loss": 1.3512,
      "num_input_tokens_seen": 36124366192,
      "step": 45915
    },
    {
      "epoch": 4.871207298960322,
      "grad_norm": 0.6190954931746285,
      "learning_rate": 3.2321018271208756e-05,
      "loss": 1.1612,
      "num_input_tokens_seen": 36125153088,
      "step": 45916
    },
    {
      "epoch": 4.871313388499894,
      "grad_norm": 0.5126803797083016,
      "learning_rate": 3.232035376613478e-05,
      "loss": 1.2571,
      "num_input_tokens_seen": 36125939904,
      "step": 45917
    },
    {
      "epoch": 4.871419478039465,
      "grad_norm": 0.48363091426609645,
      "learning_rate": 3.231968925540386e-05,
      "loss": 1.2902,
      "num_input_tokens_seen": 36126726752,
      "step": 45918
    },
    {
      "epoch": 4.871525567579036,
      "grad_norm": 0.6135002390494583,
      "learning_rate": 3.231902473901649e-05,
      "loss": 1.2327,
      "num_input_tokens_seen": 36127513520,
      "step": 45919
    },
    {
      "epoch": 4.871631657118608,
      "grad_norm": 0.5472941981267714,
      "learning_rate": 3.2318360216973184e-05,
      "loss": 1.3277,
      "num_input_tokens_seen": 36128300288,
      "step": 45920
    },
    {
      "epoch": 4.871737746658179,
      "grad_norm": 0.6717374819199128,
      "learning_rate": 3.231769568927448e-05,
      "loss": 1.3632,
      "num_input_tokens_seen": 36129087008,
      "step": 45921
    },
    {
      "epoch": 4.871843836197751,
      "grad_norm": 0.5714015962583467,
      "learning_rate": 3.231703115592088e-05,
      "loss": 1.3119,
      "num_input_tokens_seen": 36129873840,
      "step": 45922
    },
    {
      "epoch": 4.871949925737322,
      "grad_norm": 0.5156689959384166,
      "learning_rate": 3.2316366616912874e-05,
      "loss": 1.3543,
      "num_input_tokens_seen": 36130660432,
      "step": 45923
    },
    {
      "epoch": 4.872056015276893,
      "grad_norm": 0.5794629879300185,
      "learning_rate": 3.2315702072251e-05,
      "loss": 1.2727,
      "num_input_tokens_seen": 36131447088,
      "step": 45924
    },
    {
      "epoch": 4.872162104816465,
      "grad_norm": 0.616614205078223,
      "learning_rate": 3.231503752193577e-05,
      "loss": 1.3562,
      "num_input_tokens_seen": 36132233872,
      "step": 45925
    },
    {
      "epoch": 4.872268194356036,
      "grad_norm": 0.5678230375819943,
      "learning_rate": 3.2314372965967696e-05,
      "loss": 1.4157,
      "num_input_tokens_seen": 36133020640,
      "step": 45926
    },
    {
      "epoch": 4.872374283895608,
      "grad_norm": 0.8969184100362877,
      "learning_rate": 3.231370840434728e-05,
      "loss": 1.4112,
      "num_input_tokens_seen": 36133807376,
      "step": 45927
    },
    {
      "epoch": 4.872480373435179,
      "grad_norm": 0.5092729567689848,
      "learning_rate": 3.231304383707505e-05,
      "loss": 1.2692,
      "num_input_tokens_seen": 36134594064,
      "step": 45928
    },
    {
      "epoch": 4.872586462974751,
      "grad_norm": 0.5715725816926743,
      "learning_rate": 3.2312379264151516e-05,
      "loss": 1.2828,
      "num_input_tokens_seen": 36135380864,
      "step": 45929
    },
    {
      "epoch": 4.872692552514322,
      "grad_norm": 0.698483372118774,
      "learning_rate": 3.231171468557719e-05,
      "loss": 1.1931,
      "num_input_tokens_seen": 36136167712,
      "step": 45930
    },
    {
      "epoch": 4.872798642053893,
      "grad_norm": 0.4389335361795792,
      "learning_rate": 3.231105010135258e-05,
      "loss": 1.2414,
      "num_input_tokens_seen": 36136954384,
      "step": 45931
    },
    {
      "epoch": 4.872904731593465,
      "grad_norm": 0.46432056517772735,
      "learning_rate": 3.231038551147821e-05,
      "loss": 1.2682,
      "num_input_tokens_seen": 36137741216,
      "step": 45932
    },
    {
      "epoch": 4.873010821133036,
      "grad_norm": 0.6156524529733787,
      "learning_rate": 3.230972091595459e-05,
      "loss": 1.3944,
      "num_input_tokens_seen": 36138528000,
      "step": 45933
    },
    {
      "epoch": 4.873116910672608,
      "grad_norm": 0.6505519445317722,
      "learning_rate": 3.230905631478223e-05,
      "loss": 1.2775,
      "num_input_tokens_seen": 36139314816,
      "step": 45934
    },
    {
      "epoch": 4.873223000212179,
      "grad_norm": 0.501203758106506,
      "learning_rate": 3.2308391707961636e-05,
      "loss": 1.2633,
      "num_input_tokens_seen": 36140101600,
      "step": 45935
    },
    {
      "epoch": 4.873329089751751,
      "grad_norm": 0.5661869945836099,
      "learning_rate": 3.2307727095493345e-05,
      "loss": 1.3144,
      "num_input_tokens_seen": 36140888368,
      "step": 45936
    },
    {
      "epoch": 4.873435179291322,
      "grad_norm": 0.613463027970213,
      "learning_rate": 3.230706247737786e-05,
      "loss": 1.3547,
      "num_input_tokens_seen": 36141675088,
      "step": 45937
    },
    {
      "epoch": 4.873541268830893,
      "grad_norm": 0.5005477327927953,
      "learning_rate": 3.230639785361568e-05,
      "loss": 1.3843,
      "num_input_tokens_seen": 36142461872,
      "step": 45938
    },
    {
      "epoch": 4.873647358370465,
      "grad_norm": 0.646881891352855,
      "learning_rate": 3.230573322420733e-05,
      "loss": 1.379,
      "num_input_tokens_seen": 36143248656,
      "step": 45939
    },
    {
      "epoch": 4.873753447910036,
      "grad_norm": 0.5237837464241881,
      "learning_rate": 3.230506858915333e-05,
      "loss": 1.1455,
      "num_input_tokens_seen": 36144035424,
      "step": 45940
    },
    {
      "epoch": 4.873859537449608,
      "grad_norm": 0.5348573120845092,
      "learning_rate": 3.230440394845419e-05,
      "loss": 1.323,
      "num_input_tokens_seen": 36144822224,
      "step": 45941
    },
    {
      "epoch": 4.873965626989179,
      "grad_norm": 0.47909805055656923,
      "learning_rate": 3.2303739302110415e-05,
      "loss": 1.2447,
      "num_input_tokens_seen": 36145608912,
      "step": 45942
    },
    {
      "epoch": 4.87407171652875,
      "grad_norm": 0.7933374968843295,
      "learning_rate": 3.230307465012252e-05,
      "loss": 1.3143,
      "num_input_tokens_seen": 36146395664,
      "step": 45943
    },
    {
      "epoch": 4.874177806068322,
      "grad_norm": 0.5766455340888421,
      "learning_rate": 3.230240999249103e-05,
      "loss": 1.2652,
      "num_input_tokens_seen": 36147182528,
      "step": 45944
    },
    {
      "epoch": 4.874283895607893,
      "grad_norm": 0.6108365582154637,
      "learning_rate": 3.230174532921646e-05,
      "loss": 1.3352,
      "num_input_tokens_seen": 36147969280,
      "step": 45945
    },
    {
      "epoch": 4.874389985147465,
      "grad_norm": 0.6166410827143889,
      "learning_rate": 3.2301080660299296e-05,
      "loss": 1.2965,
      "num_input_tokens_seen": 36148756016,
      "step": 45946
    },
    {
      "epoch": 4.874496074687036,
      "grad_norm": 0.516354718955826,
      "learning_rate": 3.230041598574008e-05,
      "loss": 1.296,
      "num_input_tokens_seen": 36149542752,
      "step": 45947
    },
    {
      "epoch": 4.874602164226607,
      "grad_norm": 0.5296029673678887,
      "learning_rate": 3.229975130553933e-05,
      "loss": 1.3373,
      "num_input_tokens_seen": 36150329488,
      "step": 45948
    },
    {
      "epoch": 4.874708253766179,
      "grad_norm": 0.830070133261531,
      "learning_rate": 3.229908661969753e-05,
      "loss": 1.3099,
      "num_input_tokens_seen": 36151116368,
      "step": 45949
    },
    {
      "epoch": 4.87481434330575,
      "grad_norm": 0.5492915557111111,
      "learning_rate": 3.2298421928215214e-05,
      "loss": 1.2504,
      "num_input_tokens_seen": 36151903152,
      "step": 45950
    },
    {
      "epoch": 4.874920432845322,
      "grad_norm": 0.7321110466961471,
      "learning_rate": 3.229775723109289e-05,
      "loss": 1.3245,
      "num_input_tokens_seen": 36152689936,
      "step": 45951
    },
    {
      "epoch": 4.875026522384893,
      "grad_norm": 0.6816398575238082,
      "learning_rate": 3.229709252833107e-05,
      "loss": 1.2947,
      "num_input_tokens_seen": 36153476672,
      "step": 45952
    },
    {
      "epoch": 4.875132611924464,
      "grad_norm": 0.5478640553033068,
      "learning_rate": 3.2296427819930283e-05,
      "loss": 1.302,
      "num_input_tokens_seen": 36154263472,
      "step": 45953
    },
    {
      "epoch": 4.875238701464036,
      "grad_norm": 0.5076306778155458,
      "learning_rate": 3.2295763105891026e-05,
      "loss": 1.3949,
      "num_input_tokens_seen": 36155050208,
      "step": 45954
    },
    {
      "epoch": 4.875344791003607,
      "grad_norm": 0.5571812244998215,
      "learning_rate": 3.229509838621381e-05,
      "loss": 1.2953,
      "num_input_tokens_seen": 36155836944,
      "step": 45955
    },
    {
      "epoch": 4.875450880543179,
      "grad_norm": 0.5732496266322331,
      "learning_rate": 3.229443366089916e-05,
      "loss": 1.2431,
      "num_input_tokens_seen": 36156623744,
      "step": 45956
    },
    {
      "epoch": 4.87555697008275,
      "grad_norm": 0.6090823311377761,
      "learning_rate": 3.229376892994759e-05,
      "loss": 1.2582,
      "num_input_tokens_seen": 36157410512,
      "step": 45957
    },
    {
      "epoch": 4.875663059622322,
      "grad_norm": 0.5766566071473533,
      "learning_rate": 3.2293104193359606e-05,
      "loss": 1.3393,
      "num_input_tokens_seen": 36158197248,
      "step": 45958
    },
    {
      "epoch": 4.875769149161893,
      "grad_norm": 0.622225256638239,
      "learning_rate": 3.2292439451135734e-05,
      "loss": 1.2471,
      "num_input_tokens_seen": 36158983984,
      "step": 45959
    },
    {
      "epoch": 4.875875238701464,
      "grad_norm": 0.47426314093613403,
      "learning_rate": 3.2291774703276464e-05,
      "loss": 1.2861,
      "num_input_tokens_seen": 36159770704,
      "step": 45960
    },
    {
      "epoch": 4.875981328241036,
      "grad_norm": 0.6455654152352908,
      "learning_rate": 3.229110994978233e-05,
      "loss": 1.3352,
      "num_input_tokens_seen": 36160557472,
      "step": 45961
    },
    {
      "epoch": 4.876087417780607,
      "grad_norm": 0.5820321387328333,
      "learning_rate": 3.229044519065384e-05,
      "loss": 1.2813,
      "num_input_tokens_seen": 36161344288,
      "step": 45962
    },
    {
      "epoch": 4.8761935073201785,
      "grad_norm": 0.5324729001671392,
      "learning_rate": 3.2289780425891516e-05,
      "loss": 1.3885,
      "num_input_tokens_seen": 36162130976,
      "step": 45963
    },
    {
      "epoch": 4.87629959685975,
      "grad_norm": 0.6689325361344103,
      "learning_rate": 3.228911565549586e-05,
      "loss": 1.3621,
      "num_input_tokens_seen": 36162917824,
      "step": 45964
    },
    {
      "epoch": 4.8764056863993215,
      "grad_norm": 0.5437627215632367,
      "learning_rate": 3.228845087946738e-05,
      "loss": 1.2285,
      "num_input_tokens_seen": 36163704592,
      "step": 45965
    },
    {
      "epoch": 4.8765117759388925,
      "grad_norm": 0.5533131213471787,
      "learning_rate": 3.2287786097806604e-05,
      "loss": 1.2276,
      "num_input_tokens_seen": 36164491344,
      "step": 45966
    },
    {
      "epoch": 4.8766178654784635,
      "grad_norm": 0.7238232408862648,
      "learning_rate": 3.228712131051404e-05,
      "loss": 1.3705,
      "num_input_tokens_seen": 36165278064,
      "step": 45967
    },
    {
      "epoch": 4.8767239550180355,
      "grad_norm": 0.557712781968397,
      "learning_rate": 3.2286456517590205e-05,
      "loss": 1.3014,
      "num_input_tokens_seen": 36166064800,
      "step": 45968
    },
    {
      "epoch": 4.8768300445576065,
      "grad_norm": 0.8377013070064226,
      "learning_rate": 3.228579171903561e-05,
      "loss": 1.3652,
      "num_input_tokens_seen": 36166851552,
      "step": 45969
    },
    {
      "epoch": 4.876936134097178,
      "grad_norm": 0.6534893152872118,
      "learning_rate": 3.2285126914850774e-05,
      "loss": 1.3374,
      "num_input_tokens_seen": 36167638304,
      "step": 45970
    },
    {
      "epoch": 4.877042223636749,
      "grad_norm": 0.6401515357777392,
      "learning_rate": 3.2284462105036194e-05,
      "loss": 1.3871,
      "num_input_tokens_seen": 36168424992,
      "step": 45971
    },
    {
      "epoch": 4.8771483131763205,
      "grad_norm": 0.6911273639218283,
      "learning_rate": 3.22837972895924e-05,
      "loss": 1.2489,
      "num_input_tokens_seen": 36169211840,
      "step": 45972
    },
    {
      "epoch": 4.877254402715892,
      "grad_norm": 0.4751846526668405,
      "learning_rate": 3.228313246851991e-05,
      "loss": 1.2695,
      "num_input_tokens_seen": 36169998608,
      "step": 45973
    },
    {
      "epoch": 4.877360492255463,
      "grad_norm": 0.6834066325388956,
      "learning_rate": 3.228246764181922e-05,
      "loss": 1.1642,
      "num_input_tokens_seen": 36170785456,
      "step": 45974
    },
    {
      "epoch": 4.877466581795035,
      "grad_norm": 0.575605501275253,
      "learning_rate": 3.228180280949085e-05,
      "loss": 1.2479,
      "num_input_tokens_seen": 36171572240,
      "step": 45975
    },
    {
      "epoch": 4.877572671334606,
      "grad_norm": 0.6386078256229878,
      "learning_rate": 3.2281137971535325e-05,
      "loss": 1.3385,
      "num_input_tokens_seen": 36172358976,
      "step": 45976
    },
    {
      "epoch": 4.877678760874177,
      "grad_norm": 0.5276402615374529,
      "learning_rate": 3.228047312795314e-05,
      "loss": 1.287,
      "num_input_tokens_seen": 36173145680,
      "step": 45977
    },
    {
      "epoch": 4.877784850413749,
      "grad_norm": 0.5196949836130543,
      "learning_rate": 3.2279808278744825e-05,
      "loss": 1.3421,
      "num_input_tokens_seen": 36173932400,
      "step": 45978
    },
    {
      "epoch": 4.87789093995332,
      "grad_norm": 0.6020679277857881,
      "learning_rate": 3.2279143423910884e-05,
      "loss": 1.2085,
      "num_input_tokens_seen": 36174719264,
      "step": 45979
    },
    {
      "epoch": 4.877997029492892,
      "grad_norm": 0.4983070082535522,
      "learning_rate": 3.227847856345184e-05,
      "loss": 1.2744,
      "num_input_tokens_seen": 36175506032,
      "step": 45980
    },
    {
      "epoch": 4.878103119032463,
      "grad_norm": 0.5005035817139748,
      "learning_rate": 3.2277813697368195e-05,
      "loss": 1.2843,
      "num_input_tokens_seen": 36176292816,
      "step": 45981
    },
    {
      "epoch": 4.878209208572034,
      "grad_norm": 0.44988493508051564,
      "learning_rate": 3.227714882566048e-05,
      "loss": 1.3202,
      "num_input_tokens_seen": 36177079568,
      "step": 45982
    },
    {
      "epoch": 4.878315298111606,
      "grad_norm": 0.5791755589971037,
      "learning_rate": 3.227648394832919e-05,
      "loss": 1.3245,
      "num_input_tokens_seen": 36177866336,
      "step": 45983
    },
    {
      "epoch": 4.878421387651177,
      "grad_norm": 0.5201982643941889,
      "learning_rate": 3.227581906537485e-05,
      "loss": 1.2784,
      "num_input_tokens_seen": 36178653120,
      "step": 45984
    },
    {
      "epoch": 4.878527477190749,
      "grad_norm": 0.630237346884757,
      "learning_rate": 3.227515417679797e-05,
      "loss": 1.3774,
      "num_input_tokens_seen": 36179439936,
      "step": 45985
    },
    {
      "epoch": 4.87863356673032,
      "grad_norm": 0.6291311752691251,
      "learning_rate": 3.2274489282599066e-05,
      "loss": 1.3445,
      "num_input_tokens_seen": 36180226608,
      "step": 45986
    },
    {
      "epoch": 4.878739656269892,
      "grad_norm": 0.5503086127180256,
      "learning_rate": 3.227382438277864e-05,
      "loss": 1.3521,
      "num_input_tokens_seen": 36181013264,
      "step": 45987
    },
    {
      "epoch": 4.878845745809463,
      "grad_norm": 0.6622037086392497,
      "learning_rate": 3.227315947733722e-05,
      "loss": 1.2769,
      "num_input_tokens_seen": 36181800032,
      "step": 45988
    },
    {
      "epoch": 4.878951835349034,
      "grad_norm": 0.49514911981581117,
      "learning_rate": 3.227249456627532e-05,
      "loss": 1.2704,
      "num_input_tokens_seen": 36182586848,
      "step": 45989
    },
    {
      "epoch": 4.879057924888606,
      "grad_norm": 0.4527737491458032,
      "learning_rate": 3.227182964959345e-05,
      "loss": 1.2849,
      "num_input_tokens_seen": 36183373616,
      "step": 45990
    },
    {
      "epoch": 4.879164014428177,
      "grad_norm": 0.6836748679718385,
      "learning_rate": 3.2271164727292126e-05,
      "loss": 1.2419,
      "num_input_tokens_seen": 36184160320,
      "step": 45991
    },
    {
      "epoch": 4.879270103967749,
      "grad_norm": 0.5296471898610398,
      "learning_rate": 3.227049979937185e-05,
      "loss": 1.3618,
      "num_input_tokens_seen": 36184947072,
      "step": 45992
    },
    {
      "epoch": 4.87937619350732,
      "grad_norm": 0.5969763946124184,
      "learning_rate": 3.2269834865833156e-05,
      "loss": 1.3237,
      "num_input_tokens_seen": 36185733888,
      "step": 45993
    },
    {
      "epoch": 4.879482283046892,
      "grad_norm": 0.5413454631662781,
      "learning_rate": 3.226916992667654e-05,
      "loss": 1.3156,
      "num_input_tokens_seen": 36186520640,
      "step": 45994
    },
    {
      "epoch": 4.879588372586463,
      "grad_norm": 0.4922612030767961,
      "learning_rate": 3.226850498190252e-05,
      "loss": 1.2741,
      "num_input_tokens_seen": 36187307536,
      "step": 45995
    },
    {
      "epoch": 4.879694462126034,
      "grad_norm": 0.5196027833578213,
      "learning_rate": 3.2267840031511624e-05,
      "loss": 1.2682,
      "num_input_tokens_seen": 36188094240,
      "step": 45996
    },
    {
      "epoch": 4.879800551665606,
      "grad_norm": 0.455978610253966,
      "learning_rate": 3.226717507550434e-05,
      "loss": 1.2786,
      "num_input_tokens_seen": 36188880880,
      "step": 45997
    },
    {
      "epoch": 4.879906641205177,
      "grad_norm": 0.5142749064500696,
      "learning_rate": 3.22665101138812e-05,
      "loss": 1.301,
      "num_input_tokens_seen": 36189667632,
      "step": 45998
    },
    {
      "epoch": 4.880012730744749,
      "grad_norm": 0.5276034845156657,
      "learning_rate": 3.226584514664272e-05,
      "loss": 1.3287,
      "num_input_tokens_seen": 36190454368,
      "step": 45999
    },
    {
      "epoch": 4.88011882028432,
      "grad_norm": 0.5572897351903751,
      "learning_rate": 3.226518017378941e-05,
      "loss": 1.279,
      "num_input_tokens_seen": 36191241152,
      "step": 46000
    },
    {
      "epoch": 4.88011882028432,
      "eval_loss": 1.542899250984192,
      "eval_runtime": 66.1293,
      "eval_samples_per_second": 45.366,
      "eval_steps_per_second": 0.484,
      "num_input_tokens_seen": 36191241152,
      "step": 46000
    },
    {
      "epoch": 4.880224909823891,
      "grad_norm": 0.5482965064690447,
      "learning_rate": 3.2264515195321776e-05,
      "loss": 1.2983,
      "num_input_tokens_seen": 36192027840,
      "step": 46001
    },
    {
      "epoch": 4.880330999363463,
      "grad_norm": 0.7069056965414896,
      "learning_rate": 3.2263850211240345e-05,
      "loss": 1.4004,
      "num_input_tokens_seen": 36192814560,
      "step": 46002
    },
    {
      "epoch": 4.880437088903034,
      "grad_norm": 0.5659814768939382,
      "learning_rate": 3.226318522154562e-05,
      "loss": 1.2597,
      "num_input_tokens_seen": 36193601328,
      "step": 46003
    },
    {
      "epoch": 4.880543178442606,
      "grad_norm": 0.7363433152736534,
      "learning_rate": 3.226252022623811e-05,
      "loss": 1.2849,
      "num_input_tokens_seen": 36194388096,
      "step": 46004
    },
    {
      "epoch": 4.880649267982177,
      "grad_norm": 0.5834230069960223,
      "learning_rate": 3.226185522531835e-05,
      "loss": 1.2537,
      "num_input_tokens_seen": 36195174880,
      "step": 46005
    },
    {
      "epoch": 4.880755357521748,
      "grad_norm": 0.535702392588511,
      "learning_rate": 3.226119021878682e-05,
      "loss": 1.3318,
      "num_input_tokens_seen": 36195961552,
      "step": 46006
    },
    {
      "epoch": 4.88086144706132,
      "grad_norm": 0.4939176783190357,
      "learning_rate": 3.226052520664408e-05,
      "loss": 1.3439,
      "num_input_tokens_seen": 36196748384,
      "step": 46007
    },
    {
      "epoch": 4.880967536600891,
      "grad_norm": 0.6528082506043015,
      "learning_rate": 3.2259860188890614e-05,
      "loss": 1.254,
      "num_input_tokens_seen": 36197535104,
      "step": 46008
    },
    {
      "epoch": 4.881073626140463,
      "grad_norm": 0.4693218580660839,
      "learning_rate": 3.225919516552693e-05,
      "loss": 1.3239,
      "num_input_tokens_seen": 36198321888,
      "step": 46009
    },
    {
      "epoch": 4.881179715680034,
      "grad_norm": 0.5761937989149367,
      "learning_rate": 3.225853013655356e-05,
      "loss": 1.3692,
      "num_input_tokens_seen": 36199108688,
      "step": 46010
    },
    {
      "epoch": 4.881285805219605,
      "grad_norm": 0.6316531562586573,
      "learning_rate": 3.2257865101971016e-05,
      "loss": 1.3979,
      "num_input_tokens_seen": 36199895440,
      "step": 46011
    },
    {
      "epoch": 4.881391894759177,
      "grad_norm": 0.563619412837651,
      "learning_rate": 3.22572000617798e-05,
      "loss": 1.2884,
      "num_input_tokens_seen": 36200682224,
      "step": 46012
    },
    {
      "epoch": 4.881497984298748,
      "grad_norm": 0.6655015858506098,
      "learning_rate": 3.225653501598043e-05,
      "loss": 1.3382,
      "num_input_tokens_seen": 36201469056,
      "step": 46013
    },
    {
      "epoch": 4.88160407383832,
      "grad_norm": 0.5308768310555247,
      "learning_rate": 3.225586996457343e-05,
      "loss": 1.3139,
      "num_input_tokens_seen": 36202255792,
      "step": 46014
    },
    {
      "epoch": 4.881710163377891,
      "grad_norm": 0.549092458294922,
      "learning_rate": 3.22552049075593e-05,
      "loss": 1.2202,
      "num_input_tokens_seen": 36203042640,
      "step": 46015
    },
    {
      "epoch": 4.881816252917463,
      "grad_norm": 0.6394984248571977,
      "learning_rate": 3.225453984493857e-05,
      "loss": 1.3398,
      "num_input_tokens_seen": 36203829472,
      "step": 46016
    },
    {
      "epoch": 4.881922342457034,
      "grad_norm": 0.5528756120159776,
      "learning_rate": 3.225387477671174e-05,
      "loss": 1.2684,
      "num_input_tokens_seen": 36204616240,
      "step": 46017
    },
    {
      "epoch": 4.882028431996606,
      "grad_norm": 0.5236887734134047,
      "learning_rate": 3.225320970287932e-05,
      "loss": 1.3131,
      "num_input_tokens_seen": 36205403040,
      "step": 46018
    },
    {
      "epoch": 4.882134521536177,
      "grad_norm": 0.5975915798400782,
      "learning_rate": 3.225254462344185e-05,
      "loss": 1.2785,
      "num_input_tokens_seen": 36206189744,
      "step": 46019
    },
    {
      "epoch": 4.882240611075748,
      "grad_norm": 0.5335257684011039,
      "learning_rate": 3.225187953839981e-05,
      "loss": 1.2927,
      "num_input_tokens_seen": 36206976560,
      "step": 46020
    },
    {
      "epoch": 4.88234670061532,
      "grad_norm": 0.5118153425437957,
      "learning_rate": 3.225121444775373e-05,
      "loss": 1.2616,
      "num_input_tokens_seen": 36207763392,
      "step": 46021
    },
    {
      "epoch": 4.882452790154891,
      "grad_norm": 0.5684727529405201,
      "learning_rate": 3.225054935150413e-05,
      "loss": 1.3247,
      "num_input_tokens_seen": 36208550160,
      "step": 46022
    },
    {
      "epoch": 4.882558879694463,
      "grad_norm": 0.6237749276590635,
      "learning_rate": 3.224988424965152e-05,
      "loss": 1.3291,
      "num_input_tokens_seen": 36209336992,
      "step": 46023
    },
    {
      "epoch": 4.882664969234034,
      "grad_norm": 0.6110362981548882,
      "learning_rate": 3.224921914219641e-05,
      "loss": 1.2786,
      "num_input_tokens_seen": 36210123792,
      "step": 46024
    },
    {
      "epoch": 4.882771058773605,
      "grad_norm": 0.7352366638526895,
      "learning_rate": 3.224855402913932e-05,
      "loss": 1.3535,
      "num_input_tokens_seen": 36210910464,
      "step": 46025
    },
    {
      "epoch": 4.8828771483131765,
      "grad_norm": 0.44664310303598026,
      "learning_rate": 3.224788891048076e-05,
      "loss": 1.2974,
      "num_input_tokens_seen": 36211697200,
      "step": 46026
    },
    {
      "epoch": 4.882983237852748,
      "grad_norm": 0.670004204341766,
      "learning_rate": 3.224722378622123e-05,
      "loss": 1.2841,
      "num_input_tokens_seen": 36212483936,
      "step": 46027
    },
    {
      "epoch": 4.8830893273923195,
      "grad_norm": 0.676993689033666,
      "learning_rate": 3.224655865636127e-05,
      "loss": 1.2344,
      "num_input_tokens_seen": 36213270736,
      "step": 46028
    },
    {
      "epoch": 4.8831954169318905,
      "grad_norm": 0.6125539893589823,
      "learning_rate": 3.2245893520901386e-05,
      "loss": 1.3475,
      "num_input_tokens_seen": 36214057520,
      "step": 46029
    },
    {
      "epoch": 4.8833015064714616,
      "grad_norm": 0.7796142695303351,
      "learning_rate": 3.224522837984208e-05,
      "loss": 1.3099,
      "num_input_tokens_seen": 36214844256,
      "step": 46030
    },
    {
      "epoch": 4.8834075960110335,
      "grad_norm": 0.5273729056902361,
      "learning_rate": 3.224456323318388e-05,
      "loss": 1.2553,
      "num_input_tokens_seen": 36215631008,
      "step": 46031
    },
    {
      "epoch": 4.8835136855506045,
      "grad_norm": 0.5473612183134695,
      "learning_rate": 3.2243898080927296e-05,
      "loss": 1.2282,
      "num_input_tokens_seen": 36216417680,
      "step": 46032
    },
    {
      "epoch": 4.883619775090176,
      "grad_norm": 0.7314959272925743,
      "learning_rate": 3.224323292307283e-05,
      "loss": 1.3193,
      "num_input_tokens_seen": 36217204368,
      "step": 46033
    },
    {
      "epoch": 4.8837258646297474,
      "grad_norm": 0.5837490477299347,
      "learning_rate": 3.224256775962101e-05,
      "loss": 1.3404,
      "num_input_tokens_seen": 36217991120,
      "step": 46034
    },
    {
      "epoch": 4.8838319541693185,
      "grad_norm": 0.6121049570296667,
      "learning_rate": 3.224190259057235e-05,
      "loss": 1.2779,
      "num_input_tokens_seen": 36218777856,
      "step": 46035
    },
    {
      "epoch": 4.88393804370889,
      "grad_norm": 0.9273125915467456,
      "learning_rate": 3.224123741592736e-05,
      "loss": 1.2594,
      "num_input_tokens_seen": 36219564736,
      "step": 46036
    },
    {
      "epoch": 4.884044133248461,
      "grad_norm": 0.5777330414448413,
      "learning_rate": 3.224057223568655e-05,
      "loss": 1.3304,
      "num_input_tokens_seen": 36220351456,
      "step": 46037
    },
    {
      "epoch": 4.884150222788033,
      "grad_norm": 0.9626292005790695,
      "learning_rate": 3.223990704985044e-05,
      "loss": 1.3017,
      "num_input_tokens_seen": 36221138176,
      "step": 46038
    },
    {
      "epoch": 4.884256312327604,
      "grad_norm": 0.5931280401377271,
      "learning_rate": 3.2239241858419543e-05,
      "loss": 1.3345,
      "num_input_tokens_seen": 36221924992,
      "step": 46039
    },
    {
      "epoch": 4.884362401867175,
      "grad_norm": 0.5372458834024936,
      "learning_rate": 3.223857666139437e-05,
      "loss": 1.2416,
      "num_input_tokens_seen": 36222711792,
      "step": 46040
    },
    {
      "epoch": 4.884468491406747,
      "grad_norm": 0.7495786904287716,
      "learning_rate": 3.2237911458775435e-05,
      "loss": 1.2211,
      "num_input_tokens_seen": 36223498624,
      "step": 46041
    },
    {
      "epoch": 4.884574580946318,
      "grad_norm": 0.6057867547366819,
      "learning_rate": 3.2237246250563265e-05,
      "loss": 1.3498,
      "num_input_tokens_seen": 36224285440,
      "step": 46042
    },
    {
      "epoch": 4.88468067048589,
      "grad_norm": 0.6805452754612752,
      "learning_rate": 3.223658103675836e-05,
      "loss": 1.326,
      "num_input_tokens_seen": 36225072192,
      "step": 46043
    },
    {
      "epoch": 4.884786760025461,
      "grad_norm": 0.8594894935589371,
      "learning_rate": 3.223591581736123e-05,
      "loss": 1.3562,
      "num_input_tokens_seen": 36225858928,
      "step": 46044
    },
    {
      "epoch": 4.884892849565033,
      "grad_norm": 0.5872274807495814,
      "learning_rate": 3.22352505923724e-05,
      "loss": 1.3043,
      "num_input_tokens_seen": 36226645520,
      "step": 46045
    },
    {
      "epoch": 4.884998939104604,
      "grad_norm": 0.6651988131997129,
      "learning_rate": 3.223458536179239e-05,
      "loss": 1.2884,
      "num_input_tokens_seen": 36227432320,
      "step": 46046
    },
    {
      "epoch": 4.885105028644176,
      "grad_norm": 0.6891398091190561,
      "learning_rate": 3.223392012562169e-05,
      "loss": 1.305,
      "num_input_tokens_seen": 36228219104,
      "step": 46047
    },
    {
      "epoch": 4.885211118183747,
      "grad_norm": 0.5316163247516149,
      "learning_rate": 3.223325488386084e-05,
      "loss": 1.3029,
      "num_input_tokens_seen": 36229005888,
      "step": 46048
    },
    {
      "epoch": 4.885317207723318,
      "grad_norm": 0.5614508553398702,
      "learning_rate": 3.223258963651033e-05,
      "loss": 1.3492,
      "num_input_tokens_seen": 36229792608,
      "step": 46049
    },
    {
      "epoch": 4.88542329726289,
      "grad_norm": 0.7210472497673303,
      "learning_rate": 3.22319243835707e-05,
      "loss": 1.2304,
      "num_input_tokens_seen": 36230579296,
      "step": 46050
    },
    {
      "epoch": 4.885529386802461,
      "grad_norm": 0.5738225822921564,
      "learning_rate": 3.2231259125042445e-05,
      "loss": 1.225,
      "num_input_tokens_seen": 36231366096,
      "step": 46051
    },
    {
      "epoch": 4.885635476342033,
      "grad_norm": 0.6859097732758604,
      "learning_rate": 3.223059386092609e-05,
      "loss": 1.2716,
      "num_input_tokens_seen": 36232152832,
      "step": 46052
    },
    {
      "epoch": 4.885741565881604,
      "grad_norm": 0.5944252871150434,
      "learning_rate": 3.222992859122214e-05,
      "loss": 1.2199,
      "num_input_tokens_seen": 36232939648,
      "step": 46053
    },
    {
      "epoch": 4.885847655421175,
      "grad_norm": 0.5996302787262301,
      "learning_rate": 3.222926331593111e-05,
      "loss": 1.2956,
      "num_input_tokens_seen": 36233726464,
      "step": 46054
    },
    {
      "epoch": 4.885953744960747,
      "grad_norm": 0.7879155760479312,
      "learning_rate": 3.222859803505352e-05,
      "loss": 1.294,
      "num_input_tokens_seen": 36234513264,
      "step": 46055
    },
    {
      "epoch": 4.886059834500318,
      "grad_norm": 0.5175376138976164,
      "learning_rate": 3.222793274858988e-05,
      "loss": 1.3126,
      "num_input_tokens_seen": 36235299952,
      "step": 46056
    },
    {
      "epoch": 4.88616592403989,
      "grad_norm": 0.7897939862312533,
      "learning_rate": 3.2227267456540715e-05,
      "loss": 1.2903,
      "num_input_tokens_seen": 36236086736,
      "step": 46057
    },
    {
      "epoch": 4.886272013579461,
      "grad_norm": 0.44357481330481785,
      "learning_rate": 3.2226602158906525e-05,
      "loss": 1.2344,
      "num_input_tokens_seen": 36236873552,
      "step": 46058
    },
    {
      "epoch": 4.886378103119032,
      "grad_norm": 0.6747567204444748,
      "learning_rate": 3.2225936855687826e-05,
      "loss": 1.3701,
      "num_input_tokens_seen": 36237660288,
      "step": 46059
    },
    {
      "epoch": 4.886484192658604,
      "grad_norm": 0.6440229395457568,
      "learning_rate": 3.222527154688514e-05,
      "loss": 1.3068,
      "num_input_tokens_seen": 36238447008,
      "step": 46060
    },
    {
      "epoch": 4.886590282198175,
      "grad_norm": 0.7280807211670495,
      "learning_rate": 3.222460623249896e-05,
      "loss": 1.2886,
      "num_input_tokens_seen": 36239233696,
      "step": 46061
    },
    {
      "epoch": 4.886696371737747,
      "grad_norm": 0.7830009450472567,
      "learning_rate": 3.2223940912529835e-05,
      "loss": 1.3235,
      "num_input_tokens_seen": 36240020464,
      "step": 46062
    },
    {
      "epoch": 4.886802461277318,
      "grad_norm": 0.5352723814327023,
      "learning_rate": 3.222327558697826e-05,
      "loss": 1.2339,
      "num_input_tokens_seen": 36240807248,
      "step": 46063
    },
    {
      "epoch": 4.886908550816889,
      "grad_norm": 0.7780882539972975,
      "learning_rate": 3.2222610255844736e-05,
      "loss": 1.3697,
      "num_input_tokens_seen": 36241593984,
      "step": 46064
    },
    {
      "epoch": 4.887014640356461,
      "grad_norm": 0.663508680300941,
      "learning_rate": 3.22219449191298e-05,
      "loss": 1.3494,
      "num_input_tokens_seen": 36242380624,
      "step": 46065
    },
    {
      "epoch": 4.887120729896032,
      "grad_norm": 0.5790742958263019,
      "learning_rate": 3.222127957683395e-05,
      "loss": 1.2253,
      "num_input_tokens_seen": 36243167376,
      "step": 46066
    },
    {
      "epoch": 4.887226819435604,
      "grad_norm": 0.5694986215460941,
      "learning_rate": 3.222061422895772e-05,
      "loss": 1.1973,
      "num_input_tokens_seen": 36243954208,
      "step": 46067
    },
    {
      "epoch": 4.887332908975175,
      "grad_norm": 0.9033141445229089,
      "learning_rate": 3.221994887550161e-05,
      "loss": 1.3422,
      "num_input_tokens_seen": 36244740928,
      "step": 46068
    },
    {
      "epoch": 4.887438998514746,
      "grad_norm": 0.6553706965458865,
      "learning_rate": 3.221928351646612e-05,
      "loss": 1.3214,
      "num_input_tokens_seen": 36245527568,
      "step": 46069
    },
    {
      "epoch": 4.887545088054318,
      "grad_norm": 0.6985382534373913,
      "learning_rate": 3.221861815185179e-05,
      "loss": 1.3218,
      "num_input_tokens_seen": 36246314288,
      "step": 46070
    },
    {
      "epoch": 4.887651177593889,
      "grad_norm": 0.6110231975497661,
      "learning_rate": 3.2217952781659125e-05,
      "loss": 1.2349,
      "num_input_tokens_seen": 36247101104,
      "step": 46071
    },
    {
      "epoch": 4.887757267133461,
      "grad_norm": 0.5717146110983067,
      "learning_rate": 3.221728740588863e-05,
      "loss": 1.2965,
      "num_input_tokens_seen": 36247887840,
      "step": 46072
    },
    {
      "epoch": 4.887863356673032,
      "grad_norm": 0.8320204139212248,
      "learning_rate": 3.2216622024540834e-05,
      "loss": 1.3952,
      "num_input_tokens_seen": 36248674640,
      "step": 46073
    },
    {
      "epoch": 4.887969446212604,
      "grad_norm": 0.6108271665687912,
      "learning_rate": 3.221595663761624e-05,
      "loss": 1.3458,
      "num_input_tokens_seen": 36249461328,
      "step": 46074
    },
    {
      "epoch": 4.888075535752175,
      "grad_norm": 0.6949495420356062,
      "learning_rate": 3.221529124511537e-05,
      "loss": 1.3447,
      "num_input_tokens_seen": 36250248096,
      "step": 46075
    },
    {
      "epoch": 4.888181625291747,
      "grad_norm": 0.7110718010197921,
      "learning_rate": 3.2214625847038724e-05,
      "loss": 1.2407,
      "num_input_tokens_seen": 36251034816,
      "step": 46076
    },
    {
      "epoch": 4.888287714831318,
      "grad_norm": 0.5505442950555962,
      "learning_rate": 3.221396044338684e-05,
      "loss": 1.3088,
      "num_input_tokens_seen": 36251821552,
      "step": 46077
    },
    {
      "epoch": 4.888393804370889,
      "grad_norm": 0.5458002729514174,
      "learning_rate": 3.221329503416022e-05,
      "loss": 1.2712,
      "num_input_tokens_seen": 36252608288,
      "step": 46078
    },
    {
      "epoch": 4.888499893910461,
      "grad_norm": 0.6066438845219606,
      "learning_rate": 3.221262961935937e-05,
      "loss": 1.2586,
      "num_input_tokens_seen": 36253395040,
      "step": 46079
    },
    {
      "epoch": 4.888605983450032,
      "grad_norm": 0.6939982702477667,
      "learning_rate": 3.2211964198984815e-05,
      "loss": 1.4074,
      "num_input_tokens_seen": 36254181712,
      "step": 46080
    },
    {
      "epoch": 4.888712072989604,
      "grad_norm": 1.1833898942646102,
      "learning_rate": 3.2211298773037066e-05,
      "loss": 1.4207,
      "num_input_tokens_seen": 36254968416,
      "step": 46081
    },
    {
      "epoch": 4.888818162529175,
      "grad_norm": 0.6274948537706978,
      "learning_rate": 3.2210633341516633e-05,
      "loss": 1.2764,
      "num_input_tokens_seen": 36255755152,
      "step": 46082
    },
    {
      "epoch": 4.888924252068746,
      "grad_norm": 0.634252204604332,
      "learning_rate": 3.220996790442404e-05,
      "loss": 1.3805,
      "num_input_tokens_seen": 36256541888,
      "step": 46083
    },
    {
      "epoch": 4.889030341608318,
      "grad_norm": 0.6409166979769451,
      "learning_rate": 3.220930246175979e-05,
      "loss": 1.1901,
      "num_input_tokens_seen": 36257328672,
      "step": 46084
    },
    {
      "epoch": 4.889136431147889,
      "grad_norm": 0.8387221085714753,
      "learning_rate": 3.22086370135244e-05,
      "loss": 1.392,
      "num_input_tokens_seen": 36258115440,
      "step": 46085
    },
    {
      "epoch": 4.889242520687461,
      "grad_norm": 0.5203951827513201,
      "learning_rate": 3.22079715597184e-05,
      "loss": 1.3272,
      "num_input_tokens_seen": 36258902208,
      "step": 46086
    },
    {
      "epoch": 4.889348610227032,
      "grad_norm": 0.7156790814584605,
      "learning_rate": 3.2207306100342276e-05,
      "loss": 1.3036,
      "num_input_tokens_seen": 36259689040,
      "step": 46087
    },
    {
      "epoch": 4.889454699766603,
      "grad_norm": 0.6037029477104192,
      "learning_rate": 3.220664063539657e-05,
      "loss": 1.3065,
      "num_input_tokens_seen": 36260475776,
      "step": 46088
    },
    {
      "epoch": 4.8895607893061745,
      "grad_norm": 0.4985291556811364,
      "learning_rate": 3.2205975164881775e-05,
      "loss": 1.2937,
      "num_input_tokens_seen": 36261262592,
      "step": 46089
    },
    {
      "epoch": 4.889666878845746,
      "grad_norm": 0.703558485801722,
      "learning_rate": 3.220530968879841e-05,
      "loss": 1.1669,
      "num_input_tokens_seen": 36262049504,
      "step": 46090
    },
    {
      "epoch": 4.8897729683853175,
      "grad_norm": 0.8108496258592743,
      "learning_rate": 3.2204644207147e-05,
      "loss": 1.3154,
      "num_input_tokens_seen": 36262836240,
      "step": 46091
    },
    {
      "epoch": 4.8898790579248885,
      "grad_norm": 0.6066226244680628,
      "learning_rate": 3.2203978719928056e-05,
      "loss": 1.2337,
      "num_input_tokens_seen": 36263623072,
      "step": 46092
    },
    {
      "epoch": 4.88998514746446,
      "grad_norm": 1.1905456000983057,
      "learning_rate": 3.220331322714208e-05,
      "loss": 1.3627,
      "num_input_tokens_seen": 36264409792,
      "step": 46093
    },
    {
      "epoch": 4.8900912370040315,
      "grad_norm": 0.5910556297177652,
      "learning_rate": 3.2202647728789605e-05,
      "loss": 1.2828,
      "num_input_tokens_seen": 36265196496,
      "step": 46094
    },
    {
      "epoch": 4.8901973265436025,
      "grad_norm": 0.7662977185374006,
      "learning_rate": 3.2201982224871125e-05,
      "loss": 1.3718,
      "num_input_tokens_seen": 36265983264,
      "step": 46095
    },
    {
      "epoch": 4.890303416083174,
      "grad_norm": 0.8593602415802408,
      "learning_rate": 3.220131671538717e-05,
      "loss": 1.217,
      "num_input_tokens_seen": 36266770128,
      "step": 46096
    },
    {
      "epoch": 4.8904095056227455,
      "grad_norm": 0.5341165279627201,
      "learning_rate": 3.220065120033825e-05,
      "loss": 1.3307,
      "num_input_tokens_seen": 36267556912,
      "step": 46097
    },
    {
      "epoch": 4.890515595162317,
      "grad_norm": 0.8359606609886007,
      "learning_rate": 3.219998567972487e-05,
      "loss": 1.3568,
      "num_input_tokens_seen": 36268343728,
      "step": 46098
    },
    {
      "epoch": 4.890621684701888,
      "grad_norm": 0.6860220735407774,
      "learning_rate": 3.219932015354756e-05,
      "loss": 1.3796,
      "num_input_tokens_seen": 36269130512,
      "step": 46099
    },
    {
      "epoch": 4.890727774241459,
      "grad_norm": 0.639556592972809,
      "learning_rate": 3.219865462180683e-05,
      "loss": 1.2118,
      "num_input_tokens_seen": 36269917280,
      "step": 46100
    },
    {
      "epoch": 4.890833863781031,
      "grad_norm": 0.8581135070413078,
      "learning_rate": 3.219798908450318e-05,
      "loss": 1.2875,
      "num_input_tokens_seen": 36270704112,
      "step": 46101
    },
    {
      "epoch": 4.890939953320602,
      "grad_norm": 0.8062306450425956,
      "learning_rate": 3.219732354163714e-05,
      "loss": 1.2378,
      "num_input_tokens_seen": 36271490896,
      "step": 46102
    },
    {
      "epoch": 4.891046042860174,
      "grad_norm": 0.5381294527509243,
      "learning_rate": 3.219665799320922e-05,
      "loss": 1.3345,
      "num_input_tokens_seen": 36272277664,
      "step": 46103
    },
    {
      "epoch": 4.891152132399745,
      "grad_norm": 0.5389361653221771,
      "learning_rate": 3.2195992439219935e-05,
      "loss": 1.3122,
      "num_input_tokens_seen": 36273064336,
      "step": 46104
    },
    {
      "epoch": 4.891258221939317,
      "grad_norm": 0.7025006995978839,
      "learning_rate": 3.2195326879669795e-05,
      "loss": 1.2904,
      "num_input_tokens_seen": 36273851200,
      "step": 46105
    },
    {
      "epoch": 4.891364311478888,
      "grad_norm": 0.7325510973762737,
      "learning_rate": 3.2194661314559324e-05,
      "loss": 1.4127,
      "num_input_tokens_seen": 36274637984,
      "step": 46106
    },
    {
      "epoch": 4.891470401018459,
      "grad_norm": 0.5547104150560768,
      "learning_rate": 3.2193995743889024e-05,
      "loss": 1.1864,
      "num_input_tokens_seen": 36275424768,
      "step": 46107
    },
    {
      "epoch": 4.891576490558031,
      "grad_norm": 0.7754793316672082,
      "learning_rate": 3.219333016765942e-05,
      "loss": 1.3016,
      "num_input_tokens_seen": 36276211504,
      "step": 46108
    },
    {
      "epoch": 4.891682580097602,
      "grad_norm": 0.5908340475608074,
      "learning_rate": 3.2192664585871015e-05,
      "loss": 1.3302,
      "num_input_tokens_seen": 36276998288,
      "step": 46109
    },
    {
      "epoch": 4.891788669637174,
      "grad_norm": 0.601266510648542,
      "learning_rate": 3.219199899852433e-05,
      "loss": 1.3723,
      "num_input_tokens_seen": 36277785088,
      "step": 46110
    },
    {
      "epoch": 4.891894759176745,
      "grad_norm": 0.9054342622053505,
      "learning_rate": 3.219133340561988e-05,
      "loss": 1.4212,
      "num_input_tokens_seen": 36278571872,
      "step": 46111
    },
    {
      "epoch": 4.892000848716316,
      "grad_norm": 0.5057370392625039,
      "learning_rate": 3.219066780715818e-05,
      "loss": 1.2882,
      "num_input_tokens_seen": 36279358624,
      "step": 46112
    },
    {
      "epoch": 4.892106938255888,
      "grad_norm": 0.6249726680794166,
      "learning_rate": 3.219000220313975e-05,
      "loss": 1.3172,
      "num_input_tokens_seen": 36280145440,
      "step": 46113
    },
    {
      "epoch": 4.892213027795459,
      "grad_norm": 0.9283794021879732,
      "learning_rate": 3.218933659356509e-05,
      "loss": 1.3085,
      "num_input_tokens_seen": 36280932192,
      "step": 46114
    },
    {
      "epoch": 4.892319117335031,
      "grad_norm": 0.5394006259837447,
      "learning_rate": 3.2188670978434724e-05,
      "loss": 1.227,
      "num_input_tokens_seen": 36281718992,
      "step": 46115
    },
    {
      "epoch": 4.892425206874602,
      "grad_norm": 0.9177734910193319,
      "learning_rate": 3.218800535774916e-05,
      "loss": 1.2639,
      "num_input_tokens_seen": 36282505760,
      "step": 46116
    },
    {
      "epoch": 4.892531296414173,
      "grad_norm": 0.6235660330813503,
      "learning_rate": 3.2187339731508925e-05,
      "loss": 1.3071,
      "num_input_tokens_seen": 36283292544,
      "step": 46117
    },
    {
      "epoch": 4.892637385953745,
      "grad_norm": 0.5820790691058798,
      "learning_rate": 3.218667409971451e-05,
      "loss": 1.2443,
      "num_input_tokens_seen": 36284079392,
      "step": 46118
    },
    {
      "epoch": 4.892743475493316,
      "grad_norm": 0.9190230511820172,
      "learning_rate": 3.2186008462366455e-05,
      "loss": 1.3894,
      "num_input_tokens_seen": 36284866112,
      "step": 46119
    },
    {
      "epoch": 4.892849565032888,
      "grad_norm": 0.5403921989717642,
      "learning_rate": 3.218534281946526e-05,
      "loss": 1.3314,
      "num_input_tokens_seen": 36285652832,
      "step": 46120
    },
    {
      "epoch": 4.892955654572459,
      "grad_norm": 0.6593345750810725,
      "learning_rate": 3.218467717101145e-05,
      "loss": 1.2841,
      "num_input_tokens_seen": 36286439600,
      "step": 46121
    },
    {
      "epoch": 4.89306174411203,
      "grad_norm": 0.7368697188044876,
      "learning_rate": 3.218401151700552e-05,
      "loss": 1.2781,
      "num_input_tokens_seen": 36287226288,
      "step": 46122
    },
    {
      "epoch": 4.893167833651602,
      "grad_norm": 0.5166553448199472,
      "learning_rate": 3.218334585744801e-05,
      "loss": 1.211,
      "num_input_tokens_seen": 36288013120,
      "step": 46123
    },
    {
      "epoch": 4.893273923191173,
      "grad_norm": 0.6559935170449249,
      "learning_rate": 3.218268019233941e-05,
      "loss": 1.2323,
      "num_input_tokens_seen": 36288799888,
      "step": 46124
    },
    {
      "epoch": 4.893380012730745,
      "grad_norm": 0.9150613692720004,
      "learning_rate": 3.218201452168025e-05,
      "loss": 1.2443,
      "num_input_tokens_seen": 36289586704,
      "step": 46125
    },
    {
      "epoch": 4.893486102270316,
      "grad_norm": 0.48876144203729943,
      "learning_rate": 3.218134884547104e-05,
      "loss": 1.284,
      "num_input_tokens_seen": 36290373488,
      "step": 46126
    },
    {
      "epoch": 4.893592191809888,
      "grad_norm": 0.6996987452067183,
      "learning_rate": 3.218068316371229e-05,
      "loss": 1.329,
      "num_input_tokens_seen": 36291160272,
      "step": 46127
    },
    {
      "epoch": 4.893698281349459,
      "grad_norm": 0.7846340524833114,
      "learning_rate": 3.2180017476404527e-05,
      "loss": 1.4362,
      "num_input_tokens_seen": 36291947056,
      "step": 46128
    },
    {
      "epoch": 4.89380437088903,
      "grad_norm": 0.5260827807632731,
      "learning_rate": 3.217935178354825e-05,
      "loss": 1.2412,
      "num_input_tokens_seen": 36292733840,
      "step": 46129
    },
    {
      "epoch": 4.893910460428602,
      "grad_norm": 0.6383635170372541,
      "learning_rate": 3.217868608514398e-05,
      "loss": 1.2719,
      "num_input_tokens_seen": 36293520592,
      "step": 46130
    },
    {
      "epoch": 4.894016549968173,
      "grad_norm": 0.8355563050905092,
      "learning_rate": 3.217802038119224e-05,
      "loss": 1.2676,
      "num_input_tokens_seen": 36294307328,
      "step": 46131
    },
    {
      "epoch": 4.894122639507745,
      "grad_norm": 0.4960976829727274,
      "learning_rate": 3.217735467169354e-05,
      "loss": 1.2996,
      "num_input_tokens_seen": 36295094064,
      "step": 46132
    },
    {
      "epoch": 4.894228729047316,
      "grad_norm": 0.7137478521996473,
      "learning_rate": 3.2176688956648376e-05,
      "loss": 1.2695,
      "num_input_tokens_seen": 36295880880,
      "step": 46133
    },
    {
      "epoch": 4.894334818586888,
      "grad_norm": 0.7218244511720631,
      "learning_rate": 3.217602323605728e-05,
      "loss": 1.3743,
      "num_input_tokens_seen": 36296667616,
      "step": 46134
    },
    {
      "epoch": 4.894440908126459,
      "grad_norm": 0.4531738983445775,
      "learning_rate": 3.217535750992078e-05,
      "loss": 1.274,
      "num_input_tokens_seen": 36297454464,
      "step": 46135
    },
    {
      "epoch": 4.89454699766603,
      "grad_norm": 0.6056370426494828,
      "learning_rate": 3.2174691778239355e-05,
      "loss": 1.2894,
      "num_input_tokens_seen": 36298241248,
      "step": 46136
    },
    {
      "epoch": 4.894653087205602,
      "grad_norm": 0.7559840307920334,
      "learning_rate": 3.217402604101355e-05,
      "loss": 1.4287,
      "num_input_tokens_seen": 36299027920,
      "step": 46137
    },
    {
      "epoch": 4.894759176745173,
      "grad_norm": 0.5149051828792858,
      "learning_rate": 3.217336029824386e-05,
      "loss": 1.2988,
      "num_input_tokens_seen": 36299814688,
      "step": 46138
    },
    {
      "epoch": 4.894865266284745,
      "grad_norm": 0.7294722347335978,
      "learning_rate": 3.2172694549930816e-05,
      "loss": 1.3078,
      "num_input_tokens_seen": 36300601568,
      "step": 46139
    },
    {
      "epoch": 4.894971355824316,
      "grad_norm": 0.5610064866697976,
      "learning_rate": 3.2172028796074916e-05,
      "loss": 1.299,
      "num_input_tokens_seen": 36301388320,
      "step": 46140
    },
    {
      "epoch": 4.895077445363887,
      "grad_norm": 0.5862234693053859,
      "learning_rate": 3.217136303667669e-05,
      "loss": 1.3341,
      "num_input_tokens_seen": 36302175136,
      "step": 46141
    },
    {
      "epoch": 4.895183534903459,
      "grad_norm": 0.5730453306987424,
      "learning_rate": 3.217069727173664e-05,
      "loss": 1.2582,
      "num_input_tokens_seen": 36302961904,
      "step": 46142
    },
    {
      "epoch": 4.89528962444303,
      "grad_norm": 0.8693065146237399,
      "learning_rate": 3.217003150125529e-05,
      "loss": 1.355,
      "num_input_tokens_seen": 36303748624,
      "step": 46143
    },
    {
      "epoch": 4.895395713982602,
      "grad_norm": 0.5259456124370679,
      "learning_rate": 3.216936572523314e-05,
      "loss": 1.3666,
      "num_input_tokens_seen": 36304535392,
      "step": 46144
    },
    {
      "epoch": 4.895501803522173,
      "grad_norm": 0.7586066854589273,
      "learning_rate": 3.2168699943670726e-05,
      "loss": 1.2983,
      "num_input_tokens_seen": 36305322176,
      "step": 46145
    },
    {
      "epoch": 4.895607893061744,
      "grad_norm": 0.6770244571474896,
      "learning_rate": 3.216803415656855e-05,
      "loss": 1.2914,
      "num_input_tokens_seen": 36306108976,
      "step": 46146
    },
    {
      "epoch": 4.895713982601316,
      "grad_norm": 0.5215410662839816,
      "learning_rate": 3.216736836392712e-05,
      "loss": 1.4098,
      "num_input_tokens_seen": 36306895760,
      "step": 46147
    },
    {
      "epoch": 4.895820072140887,
      "grad_norm": 0.7764006073270926,
      "learning_rate": 3.216670256574696e-05,
      "loss": 1.2997,
      "num_input_tokens_seen": 36307682544,
      "step": 46148
    },
    {
      "epoch": 4.895926161680459,
      "grad_norm": 1.0796381823489536,
      "learning_rate": 3.216603676202859e-05,
      "loss": 1.3312,
      "num_input_tokens_seen": 36308469392,
      "step": 46149
    },
    {
      "epoch": 4.89603225122003,
      "grad_norm": 0.7258887942156217,
      "learning_rate": 3.216537095277251e-05,
      "loss": 1.2817,
      "num_input_tokens_seen": 36309256096,
      "step": 46150
    },
    {
      "epoch": 4.896138340759601,
      "grad_norm": 0.9003863707032956,
      "learning_rate": 3.216470513797924e-05,
      "loss": 1.334,
      "num_input_tokens_seen": 36310042848,
      "step": 46151
    },
    {
      "epoch": 4.896244430299173,
      "grad_norm": 0.687276441543425,
      "learning_rate": 3.21640393176493e-05,
      "loss": 1.2573,
      "num_input_tokens_seen": 36310829520,
      "step": 46152
    },
    {
      "epoch": 4.896350519838744,
      "grad_norm": 0.6020460231785508,
      "learning_rate": 3.2163373491783206e-05,
      "loss": 1.3455,
      "num_input_tokens_seen": 36311616352,
      "step": 46153
    },
    {
      "epoch": 4.8964566093783155,
      "grad_norm": 0.784671557449542,
      "learning_rate": 3.216270766038147e-05,
      "loss": 1.2628,
      "num_input_tokens_seen": 36312403104,
      "step": 46154
    },
    {
      "epoch": 4.8965626989178865,
      "grad_norm": 0.7456500820270201,
      "learning_rate": 3.2162041823444584e-05,
      "loss": 1.3674,
      "num_input_tokens_seen": 36313189888,
      "step": 46155
    },
    {
      "epoch": 4.8966687884574585,
      "grad_norm": 0.616246056535854,
      "learning_rate": 3.216137598097309e-05,
      "loss": 1.2687,
      "num_input_tokens_seen": 36313976608,
      "step": 46156
    },
    {
      "epoch": 4.8967748779970295,
      "grad_norm": 0.7798527302741646,
      "learning_rate": 3.21607101329675e-05,
      "loss": 1.2676,
      "num_input_tokens_seen": 36314763312,
      "step": 46157
    },
    {
      "epoch": 4.8968809675366005,
      "grad_norm": 0.5366186032870411,
      "learning_rate": 3.2160044279428327e-05,
      "loss": 1.3049,
      "num_input_tokens_seen": 36315550112,
      "step": 46158
    },
    {
      "epoch": 4.896987057076172,
      "grad_norm": 0.5947835956961661,
      "learning_rate": 3.2159378420356074e-05,
      "loss": 1.2217,
      "num_input_tokens_seen": 36316336880,
      "step": 46159
    },
    {
      "epoch": 4.8970931466157435,
      "grad_norm": 0.649489339328925,
      "learning_rate": 3.2158712555751267e-05,
      "loss": 1.3211,
      "num_input_tokens_seen": 36317123536,
      "step": 46160
    },
    {
      "epoch": 4.897199236155315,
      "grad_norm": 0.8288614984299603,
      "learning_rate": 3.215804668561441e-05,
      "loss": 1.279,
      "num_input_tokens_seen": 36317910288,
      "step": 46161
    },
    {
      "epoch": 4.897305325694886,
      "grad_norm": 0.4866662389762916,
      "learning_rate": 3.215738080994603e-05,
      "loss": 1.3089,
      "num_input_tokens_seen": 36318696992,
      "step": 46162
    },
    {
      "epoch": 4.897411415234458,
      "grad_norm": 0.5394717046425567,
      "learning_rate": 3.2156714928746644e-05,
      "loss": 1.2376,
      "num_input_tokens_seen": 36319483824,
      "step": 46163
    },
    {
      "epoch": 4.897517504774029,
      "grad_norm": 0.7009909510104153,
      "learning_rate": 3.2156049042016747e-05,
      "loss": 1.278,
      "num_input_tokens_seen": 36320270576,
      "step": 46164
    },
    {
      "epoch": 4.8976235943136,
      "grad_norm": 0.6325559756734285,
      "learning_rate": 3.215538314975687e-05,
      "loss": 1.3881,
      "num_input_tokens_seen": 36321057344,
      "step": 46165
    },
    {
      "epoch": 4.897729683853172,
      "grad_norm": 0.5253856956900521,
      "learning_rate": 3.2154717251967527e-05,
      "loss": 1.2698,
      "num_input_tokens_seen": 36321844144,
      "step": 46166
    },
    {
      "epoch": 4.897835773392743,
      "grad_norm": 0.6878809114060873,
      "learning_rate": 3.2154051348649214e-05,
      "loss": 1.3132,
      "num_input_tokens_seen": 36322630864,
      "step": 46167
    },
    {
      "epoch": 4.897941862932315,
      "grad_norm": 0.7038998375661311,
      "learning_rate": 3.2153385439802466e-05,
      "loss": 1.2656,
      "num_input_tokens_seen": 36323417728,
      "step": 46168
    },
    {
      "epoch": 4.898047952471886,
      "grad_norm": 0.5737079982716015,
      "learning_rate": 3.21527195254278e-05,
      "loss": 1.2454,
      "num_input_tokens_seen": 36324204560,
      "step": 46169
    },
    {
      "epoch": 4.898154042011457,
      "grad_norm": 0.893546771471402,
      "learning_rate": 3.215205360552572e-05,
      "loss": 1.3415,
      "num_input_tokens_seen": 36324991344,
      "step": 46170
    },
    {
      "epoch": 4.898260131551029,
      "grad_norm": 0.6227645580445887,
      "learning_rate": 3.215138768009674e-05,
      "loss": 1.3022,
      "num_input_tokens_seen": 36325778096,
      "step": 46171
    },
    {
      "epoch": 4.8983662210906,
      "grad_norm": 0.6203104797402181,
      "learning_rate": 3.215072174914138e-05,
      "loss": 1.3096,
      "num_input_tokens_seen": 36326564848,
      "step": 46172
    },
    {
      "epoch": 4.898472310630172,
      "grad_norm": 0.639188561868372,
      "learning_rate": 3.2150055812660146e-05,
      "loss": 1.2956,
      "num_input_tokens_seen": 36327351648,
      "step": 46173
    },
    {
      "epoch": 4.898578400169743,
      "grad_norm": 0.6384492977443185,
      "learning_rate": 3.214938987065356e-05,
      "loss": 1.2387,
      "num_input_tokens_seen": 36328138432,
      "step": 46174
    },
    {
      "epoch": 4.898684489709314,
      "grad_norm": 0.5198757255849533,
      "learning_rate": 3.214872392312214e-05,
      "loss": 1.2968,
      "num_input_tokens_seen": 36328925280,
      "step": 46175
    },
    {
      "epoch": 4.898790579248886,
      "grad_norm": 0.5150788154482788,
      "learning_rate": 3.2148057970066394e-05,
      "loss": 1.2421,
      "num_input_tokens_seen": 36329711936,
      "step": 46176
    },
    {
      "epoch": 4.898896668788457,
      "grad_norm": 0.6186331155431518,
      "learning_rate": 3.214739201148684e-05,
      "loss": 1.3336,
      "num_input_tokens_seen": 36330498768,
      "step": 46177
    },
    {
      "epoch": 4.899002758328029,
      "grad_norm": 0.4599504116185928,
      "learning_rate": 3.214672604738399e-05,
      "loss": 1.1684,
      "num_input_tokens_seen": 36331285552,
      "step": 46178
    },
    {
      "epoch": 4.8991088478676,
      "grad_norm": 0.5011015793327364,
      "learning_rate": 3.2146060077758354e-05,
      "loss": 1.2571,
      "num_input_tokens_seen": 36332072352,
      "step": 46179
    },
    {
      "epoch": 4.899214937407171,
      "grad_norm": 0.5702690497491975,
      "learning_rate": 3.214539410261046e-05,
      "loss": 1.2837,
      "num_input_tokens_seen": 36332859200,
      "step": 46180
    },
    {
      "epoch": 4.899321026946743,
      "grad_norm": 0.5671328295474948,
      "learning_rate": 3.2144728121940815e-05,
      "loss": 1.3248,
      "num_input_tokens_seen": 36333646000,
      "step": 46181
    },
    {
      "epoch": 4.899427116486314,
      "grad_norm": 0.6063236623467002,
      "learning_rate": 3.214406213574993e-05,
      "loss": 1.2672,
      "num_input_tokens_seen": 36334432848,
      "step": 46182
    },
    {
      "epoch": 4.899533206025886,
      "grad_norm": 0.4841609277405566,
      "learning_rate": 3.214339614403833e-05,
      "loss": 1.1437,
      "num_input_tokens_seen": 36335219568,
      "step": 46183
    },
    {
      "epoch": 4.899639295565457,
      "grad_norm": 0.5293758709149295,
      "learning_rate": 3.214273014680651e-05,
      "loss": 1.3236,
      "num_input_tokens_seen": 36336006384,
      "step": 46184
    },
    {
      "epoch": 4.899745385105029,
      "grad_norm": 35.43268530416439,
      "learning_rate": 3.214206414405501e-05,
      "loss": 3.0095,
      "num_input_tokens_seen": 36336793120,
      "step": 46185
    },
    {
      "epoch": 4.8998514746446,
      "grad_norm": 1.0966471704137386,
      "learning_rate": 3.2141398135784326e-05,
      "loss": 1.2794,
      "num_input_tokens_seen": 36337579904,
      "step": 46186
    },
    {
      "epoch": 4.899957564184171,
      "grad_norm": 1.8478536563603836,
      "learning_rate": 3.214073212199498e-05,
      "loss": 1.307,
      "num_input_tokens_seen": 36338366624,
      "step": 46187
    },
    {
      "epoch": 4.900063653723743,
      "grad_norm": 0.6493503443089932,
      "learning_rate": 3.2140066102687486e-05,
      "loss": 1.2812,
      "num_input_tokens_seen": 36339153408,
      "step": 46188
    },
    {
      "epoch": 4.900169743263314,
      "grad_norm": 1.0631100999859333,
      "learning_rate": 3.2139400077862365e-05,
      "loss": 1.3235,
      "num_input_tokens_seen": 36339940160,
      "step": 46189
    },
    {
      "epoch": 4.900275832802886,
      "grad_norm": 0.9815684546356644,
      "learning_rate": 3.213873404752011e-05,
      "loss": 1.3102,
      "num_input_tokens_seen": 36340726976,
      "step": 46190
    },
    {
      "epoch": 4.900381922342457,
      "grad_norm": 0.6674034979539679,
      "learning_rate": 3.213806801166127e-05,
      "loss": 1.348,
      "num_input_tokens_seen": 36341513776,
      "step": 46191
    },
    {
      "epoch": 4.900488011882029,
      "grad_norm": 0.6047439536627184,
      "learning_rate": 3.213740197028633e-05,
      "loss": 1.2714,
      "num_input_tokens_seen": 36342300576,
      "step": 46192
    },
    {
      "epoch": 4.9005941014216,
      "grad_norm": 1.1665664267886697,
      "learning_rate": 3.213673592339581e-05,
      "loss": 1.3018,
      "num_input_tokens_seen": 36343087360,
      "step": 46193
    },
    {
      "epoch": 4.900700190961171,
      "grad_norm": 0.7319789985245436,
      "learning_rate": 3.213606987099024e-05,
      "loss": 1.2618,
      "num_input_tokens_seen": 36343874096,
      "step": 46194
    },
    {
      "epoch": 4.900806280500743,
      "grad_norm": 0.7074855470548282,
      "learning_rate": 3.2135403813070117e-05,
      "loss": 1.1275,
      "num_input_tokens_seen": 36344660880,
      "step": 46195
    },
    {
      "epoch": 4.900912370040314,
      "grad_norm": 1.0016371484747926,
      "learning_rate": 3.2134737749635966e-05,
      "loss": 1.4118,
      "num_input_tokens_seen": 36345447680,
      "step": 46196
    },
    {
      "epoch": 4.901018459579886,
      "grad_norm": 0.6178087111239139,
      "learning_rate": 3.21340716806883e-05,
      "loss": 1.2259,
      "num_input_tokens_seen": 36346234400,
      "step": 46197
    },
    {
      "epoch": 4.901124549119457,
      "grad_norm": 0.8836529770384296,
      "learning_rate": 3.213340560622763e-05,
      "loss": 1.2825,
      "num_input_tokens_seen": 36347021216,
      "step": 46198
    },
    {
      "epoch": 4.901230638659028,
      "grad_norm": 0.5992620581015917,
      "learning_rate": 3.213273952625448e-05,
      "loss": 1.4043,
      "num_input_tokens_seen": 36347807936,
      "step": 46199
    },
    {
      "epoch": 4.9013367281986,
      "grad_norm": 0.7926840067182724,
      "learning_rate": 3.213207344076936e-05,
      "loss": 1.2971,
      "num_input_tokens_seen": 36348594640,
      "step": 46200
    },
    {
      "epoch": 4.901442817738171,
      "grad_norm": 0.7501438095083792,
      "learning_rate": 3.213140734977277e-05,
      "loss": 1.3156,
      "num_input_tokens_seen": 36349381408,
      "step": 46201
    },
    {
      "epoch": 4.901548907277743,
      "grad_norm": 0.6116215608997762,
      "learning_rate": 3.213074125326525e-05,
      "loss": 1.4694,
      "num_input_tokens_seen": 36350168128,
      "step": 46202
    },
    {
      "epoch": 4.901654996817314,
      "grad_norm": 0.9571235640017082,
      "learning_rate": 3.21300751512473e-05,
      "loss": 1.3,
      "num_input_tokens_seen": 36350954880,
      "step": 46203
    },
    {
      "epoch": 4.901761086356885,
      "grad_norm": 0.7548243111369272,
      "learning_rate": 3.2129409043719425e-05,
      "loss": 1.349,
      "num_input_tokens_seen": 36351741616,
      "step": 46204
    },
    {
      "epoch": 4.901867175896457,
      "grad_norm": 0.7113963885144338,
      "learning_rate": 3.2128742930682165e-05,
      "loss": 1.3205,
      "num_input_tokens_seen": 36352528288,
      "step": 46205
    },
    {
      "epoch": 4.901973265436028,
      "grad_norm": 0.62270699655068,
      "learning_rate": 3.212807681213602e-05,
      "loss": 1.1854,
      "num_input_tokens_seen": 36353315088,
      "step": 46206
    },
    {
      "epoch": 4.9020793549756,
      "grad_norm": 0.6213001969851853,
      "learning_rate": 3.2127410688081496e-05,
      "loss": 1.2273,
      "num_input_tokens_seen": 36354101776,
      "step": 46207
    },
    {
      "epoch": 4.902185444515171,
      "grad_norm": 0.531204412662785,
      "learning_rate": 3.212674455851913e-05,
      "loss": 1.44,
      "num_input_tokens_seen": 36354888464,
      "step": 46208
    },
    {
      "epoch": 4.902291534054742,
      "grad_norm": 0.48611960849633545,
      "learning_rate": 3.2126078423449426e-05,
      "loss": 1.2076,
      "num_input_tokens_seen": 36355675296,
      "step": 46209
    },
    {
      "epoch": 4.902397623594314,
      "grad_norm": 0.691060743874524,
      "learning_rate": 3.212541228287289e-05,
      "loss": 1.2912,
      "num_input_tokens_seen": 36356462064,
      "step": 46210
    },
    {
      "epoch": 4.902503713133885,
      "grad_norm": 0.5947612938539371,
      "learning_rate": 3.212474613679005e-05,
      "loss": 1.2791,
      "num_input_tokens_seen": 36357248896,
      "step": 46211
    },
    {
      "epoch": 4.902609802673457,
      "grad_norm": 0.5429975513376433,
      "learning_rate": 3.2124079985201404e-05,
      "loss": 1.2438,
      "num_input_tokens_seen": 36358035616,
      "step": 46212
    },
    {
      "epoch": 4.902715892213028,
      "grad_norm": 0.5676190597669876,
      "learning_rate": 3.212341382810749e-05,
      "loss": 1.2568,
      "num_input_tokens_seen": 36358822352,
      "step": 46213
    },
    {
      "epoch": 4.9028219817525995,
      "grad_norm": 0.6014161740037994,
      "learning_rate": 3.212274766550881e-05,
      "loss": 1.325,
      "num_input_tokens_seen": 36359609120,
      "step": 46214
    },
    {
      "epoch": 4.902928071292171,
      "grad_norm": 0.491873843613261,
      "learning_rate": 3.212208149740588e-05,
      "loss": 1.1748,
      "num_input_tokens_seen": 36360395920,
      "step": 46215
    },
    {
      "epoch": 4.9030341608317425,
      "grad_norm": 0.5792111731892012,
      "learning_rate": 3.21214153237992e-05,
      "loss": 1.4242,
      "num_input_tokens_seen": 36361182528,
      "step": 46216
    },
    {
      "epoch": 4.9031402503713135,
      "grad_norm": 0.5409606882365359,
      "learning_rate": 3.2120749144689314e-05,
      "loss": 1.1741,
      "num_input_tokens_seen": 36361969248,
      "step": 46217
    },
    {
      "epoch": 4.9032463399108845,
      "grad_norm": 0.5545692185848602,
      "learning_rate": 3.212008296007672e-05,
      "loss": 1.2872,
      "num_input_tokens_seen": 36362756000,
      "step": 46218
    },
    {
      "epoch": 4.9033524294504565,
      "grad_norm": 0.6086517060730017,
      "learning_rate": 3.211941676996193e-05,
      "loss": 1.3393,
      "num_input_tokens_seen": 36363542800,
      "step": 46219
    },
    {
      "epoch": 4.9034585189900275,
      "grad_norm": 0.5956833566863393,
      "learning_rate": 3.211875057434547e-05,
      "loss": 1.2356,
      "num_input_tokens_seen": 36364329600,
      "step": 46220
    },
    {
      "epoch": 4.903564608529599,
      "grad_norm": 0.5611371835439914,
      "learning_rate": 3.2118084373227846e-05,
      "loss": 1.3752,
      "num_input_tokens_seen": 36365116416,
      "step": 46221
    },
    {
      "epoch": 4.90367069806917,
      "grad_norm": 0.6178963315577942,
      "learning_rate": 3.211741816660957e-05,
      "loss": 1.2956,
      "num_input_tokens_seen": 36365903168,
      "step": 46222
    },
    {
      "epoch": 4.9037767876087415,
      "grad_norm": 0.6406243552815608,
      "learning_rate": 3.211675195449117e-05,
      "loss": 1.3595,
      "num_input_tokens_seen": 36366689968,
      "step": 46223
    },
    {
      "epoch": 4.903882877148313,
      "grad_norm": 0.5878599472684553,
      "learning_rate": 3.211608573687315e-05,
      "loss": 1.3938,
      "num_input_tokens_seen": 36367476736,
      "step": 46224
    },
    {
      "epoch": 4.903988966687884,
      "grad_norm": 0.547332756749464,
      "learning_rate": 3.211541951375602e-05,
      "loss": 1.2833,
      "num_input_tokens_seen": 36368263488,
      "step": 46225
    },
    {
      "epoch": 4.904095056227456,
      "grad_norm": 0.6080036112900922,
      "learning_rate": 3.211475328514032e-05,
      "loss": 1.3549,
      "num_input_tokens_seen": 36369050256,
      "step": 46226
    },
    {
      "epoch": 4.904201145767027,
      "grad_norm": 0.6609408638456961,
      "learning_rate": 3.2114087051026534e-05,
      "loss": 1.311,
      "num_input_tokens_seen": 36369836960,
      "step": 46227
    },
    {
      "epoch": 4.904307235306598,
      "grad_norm": 0.47841933931457814,
      "learning_rate": 3.2113420811415196e-05,
      "loss": 1.2861,
      "num_input_tokens_seen": 36370623824,
      "step": 46228
    },
    {
      "epoch": 4.90441332484617,
      "grad_norm": 0.5700003266550993,
      "learning_rate": 3.211275456630681e-05,
      "loss": 1.2332,
      "num_input_tokens_seen": 36371410592,
      "step": 46229
    },
    {
      "epoch": 4.904519414385741,
      "grad_norm": 0.5452496235935093,
      "learning_rate": 3.211208831570189e-05,
      "loss": 1.1901,
      "num_input_tokens_seen": 36372197328,
      "step": 46230
    },
    {
      "epoch": 4.904625503925313,
      "grad_norm": 0.467117608234665,
      "learning_rate": 3.211142205960097e-05,
      "loss": 1.2538,
      "num_input_tokens_seen": 36372984144,
      "step": 46231
    },
    {
      "epoch": 4.904731593464884,
      "grad_norm": 0.5438541901295626,
      "learning_rate": 3.2110755798004554e-05,
      "loss": 1.2583,
      "num_input_tokens_seen": 36373770896,
      "step": 46232
    },
    {
      "epoch": 4.904837683004455,
      "grad_norm": 0.47252812647728626,
      "learning_rate": 3.211008953091314e-05,
      "loss": 1.2394,
      "num_input_tokens_seen": 36374557664,
      "step": 46233
    },
    {
      "epoch": 4.904943772544027,
      "grad_norm": 0.5013546628686163,
      "learning_rate": 3.210942325832727e-05,
      "loss": 1.1984,
      "num_input_tokens_seen": 36375344464,
      "step": 46234
    },
    {
      "epoch": 4.905049862083598,
      "grad_norm": 0.5735075418208005,
      "learning_rate": 3.2108756980247445e-05,
      "loss": 1.3566,
      "num_input_tokens_seen": 36376131232,
      "step": 46235
    },
    {
      "epoch": 4.90515595162317,
      "grad_norm": 0.5804117691202928,
      "learning_rate": 3.2108090696674175e-05,
      "loss": 1.3586,
      "num_input_tokens_seen": 36376917984,
      "step": 46236
    },
    {
      "epoch": 4.905262041162741,
      "grad_norm": 0.535331666656634,
      "learning_rate": 3.2107424407607985e-05,
      "loss": 1.3239,
      "num_input_tokens_seen": 36377704768,
      "step": 46237
    },
    {
      "epoch": 4.905368130702312,
      "grad_norm": 0.5414883746437016,
      "learning_rate": 3.210675811304938e-05,
      "loss": 1.3044,
      "num_input_tokens_seen": 36378491488,
      "step": 46238
    },
    {
      "epoch": 4.905474220241884,
      "grad_norm": 0.4756472570438786,
      "learning_rate": 3.210609181299888e-05,
      "loss": 1.2699,
      "num_input_tokens_seen": 36379278256,
      "step": 46239
    },
    {
      "epoch": 4.905580309781455,
      "grad_norm": 0.5373329188794421,
      "learning_rate": 3.210542550745701e-05,
      "loss": 1.3239,
      "num_input_tokens_seen": 36380064992,
      "step": 46240
    },
    {
      "epoch": 4.905686399321027,
      "grad_norm": 0.4669109322926362,
      "learning_rate": 3.210475919642427e-05,
      "loss": 1.1398,
      "num_input_tokens_seen": 36380851776,
      "step": 46241
    },
    {
      "epoch": 4.905792488860598,
      "grad_norm": 0.584164189815389,
      "learning_rate": 3.210409287990119e-05,
      "loss": 1.3257,
      "num_input_tokens_seen": 36381638560,
      "step": 46242
    },
    {
      "epoch": 4.90589857840017,
      "grad_norm": 0.6225955923961078,
      "learning_rate": 3.210342655788827e-05,
      "loss": 1.3068,
      "num_input_tokens_seen": 36382425248,
      "step": 46243
    },
    {
      "epoch": 4.906004667939741,
      "grad_norm": 0.5293151158371011,
      "learning_rate": 3.210276023038602e-05,
      "loss": 1.2632,
      "num_input_tokens_seen": 36383211936,
      "step": 46244
    },
    {
      "epoch": 4.906110757479313,
      "grad_norm": 0.6247695093228364,
      "learning_rate": 3.210209389739498e-05,
      "loss": 1.256,
      "num_input_tokens_seen": 36383998672,
      "step": 46245
    },
    {
      "epoch": 4.906216847018884,
      "grad_norm": 0.4858594242496942,
      "learning_rate": 3.2101427558915644e-05,
      "loss": 1.2453,
      "num_input_tokens_seen": 36384785360,
      "step": 46246
    },
    {
      "epoch": 4.906322936558455,
      "grad_norm": 0.5074040017780297,
      "learning_rate": 3.2100761214948525e-05,
      "loss": 1.2713,
      "num_input_tokens_seen": 36385572160,
      "step": 46247
    },
    {
      "epoch": 4.906429026098027,
      "grad_norm": 0.6457061126158453,
      "learning_rate": 3.2100094865494164e-05,
      "loss": 1.3414,
      "num_input_tokens_seen": 36386358928,
      "step": 46248
    },
    {
      "epoch": 4.906535115637598,
      "grad_norm": 0.5325364433664594,
      "learning_rate": 3.209942851055305e-05,
      "loss": 1.2798,
      "num_input_tokens_seen": 36387145808,
      "step": 46249
    },
    {
      "epoch": 4.90664120517717,
      "grad_norm": 0.722896466595561,
      "learning_rate": 3.20987621501257e-05,
      "loss": 1.3217,
      "num_input_tokens_seen": 36387932544,
      "step": 46250
    },
    {
      "epoch": 4.906747294716741,
      "grad_norm": 0.8033283794059047,
      "learning_rate": 3.209809578421264e-05,
      "loss": 1.287,
      "num_input_tokens_seen": 36388719344,
      "step": 46251
    },
    {
      "epoch": 4.906853384256312,
      "grad_norm": 0.7467426570441738,
      "learning_rate": 3.2097429412814376e-05,
      "loss": 1.3324,
      "num_input_tokens_seen": 36389506080,
      "step": 46252
    },
    {
      "epoch": 4.906959473795884,
      "grad_norm": 0.9280897026768845,
      "learning_rate": 3.2096763035931435e-05,
      "loss": 1.2117,
      "num_input_tokens_seen": 36390292800,
      "step": 46253
    },
    {
      "epoch": 4.907065563335455,
      "grad_norm": 0.5145492152842914,
      "learning_rate": 3.2096096653564315e-05,
      "loss": 1.2855,
      "num_input_tokens_seen": 36391079520,
      "step": 46254
    },
    {
      "epoch": 4.907171652875027,
      "grad_norm": 0.727481034690097,
      "learning_rate": 3.209543026571354e-05,
      "loss": 1.3255,
      "num_input_tokens_seen": 36391866240,
      "step": 46255
    },
    {
      "epoch": 4.907277742414598,
      "grad_norm": 0.7281534913284345,
      "learning_rate": 3.209476387237963e-05,
      "loss": 1.3735,
      "num_input_tokens_seen": 36392652896,
      "step": 46256
    },
    {
      "epoch": 4.907383831954169,
      "grad_norm": 0.5159309329122316,
      "learning_rate": 3.20940974735631e-05,
      "loss": 1.271,
      "num_input_tokens_seen": 36393439696,
      "step": 46257
    },
    {
      "epoch": 4.907489921493741,
      "grad_norm": 0.5090268334668249,
      "learning_rate": 3.2093431069264444e-05,
      "loss": 1.3675,
      "num_input_tokens_seen": 36394226400,
      "step": 46258
    },
    {
      "epoch": 4.907596011033312,
      "grad_norm": 0.7457755995098092,
      "learning_rate": 3.20927646594842e-05,
      "loss": 1.357,
      "num_input_tokens_seen": 36395013280,
      "step": 46259
    },
    {
      "epoch": 4.907702100572884,
      "grad_norm": 0.526883750709211,
      "learning_rate": 3.209209824422288e-05,
      "loss": 1.3094,
      "num_input_tokens_seen": 36395800096,
      "step": 46260
    },
    {
      "epoch": 4.907808190112455,
      "grad_norm": 0.6248287185316819,
      "learning_rate": 3.209143182348099e-05,
      "loss": 1.3291,
      "num_input_tokens_seen": 36396586784,
      "step": 46261
    },
    {
      "epoch": 4.907914279652026,
      "grad_norm": 0.7134743883155297,
      "learning_rate": 3.209076539725904e-05,
      "loss": 1.445,
      "num_input_tokens_seen": 36397373456,
      "step": 46262
    },
    {
      "epoch": 4.908020369191598,
      "grad_norm": 0.5163928128074123,
      "learning_rate": 3.209009896555757e-05,
      "loss": 1.3373,
      "num_input_tokens_seen": 36398160112,
      "step": 46263
    },
    {
      "epoch": 4.908126458731169,
      "grad_norm": 0.6179266956581654,
      "learning_rate": 3.208943252837708e-05,
      "loss": 1.3635,
      "num_input_tokens_seen": 36398946928,
      "step": 46264
    },
    {
      "epoch": 4.908232548270741,
      "grad_norm": 0.6221985573646518,
      "learning_rate": 3.208876608571808e-05,
      "loss": 1.3333,
      "num_input_tokens_seen": 36399733600,
      "step": 46265
    },
    {
      "epoch": 4.908338637810312,
      "grad_norm": 0.4729886697979131,
      "learning_rate": 3.208809963758108e-05,
      "loss": 1.2654,
      "num_input_tokens_seen": 36400520368,
      "step": 46266
    },
    {
      "epoch": 4.908444727349884,
      "grad_norm": 0.5951144681818802,
      "learning_rate": 3.2087433183966616e-05,
      "loss": 1.2621,
      "num_input_tokens_seen": 36401307136,
      "step": 46267
    },
    {
      "epoch": 4.908550816889455,
      "grad_norm": 0.5466642081545231,
      "learning_rate": 3.208676672487519e-05,
      "loss": 1.2798,
      "num_input_tokens_seen": 36402093920,
      "step": 46268
    },
    {
      "epoch": 4.908656906429026,
      "grad_norm": 0.5271641240794707,
      "learning_rate": 3.208610026030732e-05,
      "loss": 1.335,
      "num_input_tokens_seen": 36402880720,
      "step": 46269
    },
    {
      "epoch": 4.908762995968598,
      "grad_norm": 0.4625179190383867,
      "learning_rate": 3.208543379026351e-05,
      "loss": 1.1602,
      "num_input_tokens_seen": 36403667504,
      "step": 46270
    },
    {
      "epoch": 4.908869085508169,
      "grad_norm": 0.5841253960881191,
      "learning_rate": 3.2084767314744295e-05,
      "loss": 1.2567,
      "num_input_tokens_seen": 36404454240,
      "step": 46271
    },
    {
      "epoch": 4.908975175047741,
      "grad_norm": 0.48671199574293184,
      "learning_rate": 3.2084100833750176e-05,
      "loss": 1.2446,
      "num_input_tokens_seen": 36405240992,
      "step": 46272
    },
    {
      "epoch": 4.909081264587312,
      "grad_norm": 0.6620526571599471,
      "learning_rate": 3.208343434728167e-05,
      "loss": 1.3787,
      "num_input_tokens_seen": 36406027888,
      "step": 46273
    },
    {
      "epoch": 4.909187354126884,
      "grad_norm": 0.5653387274237686,
      "learning_rate": 3.2082767855339305e-05,
      "loss": 1.3157,
      "num_input_tokens_seen": 36406814592,
      "step": 46274
    },
    {
      "epoch": 4.909293443666455,
      "grad_norm": 0.5822940262621962,
      "learning_rate": 3.208210135792357e-05,
      "loss": 1.2663,
      "num_input_tokens_seen": 36407601408,
      "step": 46275
    },
    {
      "epoch": 4.909399533206026,
      "grad_norm": 0.5430299474539599,
      "learning_rate": 3.2081434855035e-05,
      "loss": 1.3806,
      "num_input_tokens_seen": 36408388208,
      "step": 46276
    },
    {
      "epoch": 4.9095056227455975,
      "grad_norm": 0.5380475166277542,
      "learning_rate": 3.2080768346674104e-05,
      "loss": 1.2156,
      "num_input_tokens_seen": 36409174880,
      "step": 46277
    },
    {
      "epoch": 4.909611712285169,
      "grad_norm": 0.6984629658755761,
      "learning_rate": 3.2080101832841406e-05,
      "loss": 1.3237,
      "num_input_tokens_seen": 36409961584,
      "step": 46278
    },
    {
      "epoch": 4.9097178018247405,
      "grad_norm": 0.49142297172246585,
      "learning_rate": 3.2079435313537396e-05,
      "loss": 1.3549,
      "num_input_tokens_seen": 36410748272,
      "step": 46279
    },
    {
      "epoch": 4.9098238913643115,
      "grad_norm": 0.6669884795249567,
      "learning_rate": 3.2078768788762625e-05,
      "loss": 1.297,
      "num_input_tokens_seen": 36411535008,
      "step": 46280
    },
    {
      "epoch": 4.9099299809038826,
      "grad_norm": 0.6535088532520346,
      "learning_rate": 3.2078102258517585e-05,
      "loss": 1.3395,
      "num_input_tokens_seen": 36412321696,
      "step": 46281
    },
    {
      "epoch": 4.9100360704434545,
      "grad_norm": 0.5609380651327226,
      "learning_rate": 3.207743572280279e-05,
      "loss": 1.3532,
      "num_input_tokens_seen": 36413108432,
      "step": 46282
    },
    {
      "epoch": 4.9101421599830255,
      "grad_norm": 0.7790336876130793,
      "learning_rate": 3.207676918161876e-05,
      "loss": 1.2478,
      "num_input_tokens_seen": 36413895216,
      "step": 46283
    },
    {
      "epoch": 4.910248249522597,
      "grad_norm": 0.6471550982433215,
      "learning_rate": 3.2076102634966006e-05,
      "loss": 1.3633,
      "num_input_tokens_seen": 36414681904,
      "step": 46284
    },
    {
      "epoch": 4.9103543390621684,
      "grad_norm": 0.5267505226972399,
      "learning_rate": 3.207543608284505e-05,
      "loss": 1.2637,
      "num_input_tokens_seen": 36415468608,
      "step": 46285
    },
    {
      "epoch": 4.9104604286017395,
      "grad_norm": 0.6872282107316529,
      "learning_rate": 3.2074769525256415e-05,
      "loss": 1.3825,
      "num_input_tokens_seen": 36416255360,
      "step": 46286
    },
    {
      "epoch": 4.910566518141311,
      "grad_norm": 0.6213601598890371,
      "learning_rate": 3.20741029622006e-05,
      "loss": 1.2649,
      "num_input_tokens_seen": 36417042112,
      "step": 46287
    },
    {
      "epoch": 4.910672607680882,
      "grad_norm": 0.6486819445500439,
      "learning_rate": 3.207343639367813e-05,
      "loss": 1.3685,
      "num_input_tokens_seen": 36417828848,
      "step": 46288
    },
    {
      "epoch": 4.910778697220454,
      "grad_norm": 0.5421483429209131,
      "learning_rate": 3.20727698196895e-05,
      "loss": 1.3098,
      "num_input_tokens_seen": 36418615600,
      "step": 46289
    },
    {
      "epoch": 4.910884786760025,
      "grad_norm": 0.4671341000660207,
      "learning_rate": 3.207210324023525e-05,
      "loss": 1.292,
      "num_input_tokens_seen": 36419402416,
      "step": 46290
    },
    {
      "epoch": 4.910990876299596,
      "grad_norm": 0.5565998253567799,
      "learning_rate": 3.207143665531589e-05,
      "loss": 1.3413,
      "num_input_tokens_seen": 36420189168,
      "step": 46291
    },
    {
      "epoch": 4.911096965839168,
      "grad_norm": 0.5067171040711282,
      "learning_rate": 3.207077006493193e-05,
      "loss": 1.3342,
      "num_input_tokens_seen": 36420976000,
      "step": 46292
    },
    {
      "epoch": 4.911203055378739,
      "grad_norm": 0.4999919756571375,
      "learning_rate": 3.207010346908388e-05,
      "loss": 1.3279,
      "num_input_tokens_seen": 36421762800,
      "step": 46293
    },
    {
      "epoch": 4.911309144918311,
      "grad_norm": 0.4779064316371072,
      "learning_rate": 3.206943686777227e-05,
      "loss": 1.3119,
      "num_input_tokens_seen": 36422549632,
      "step": 46294
    },
    {
      "epoch": 4.911415234457882,
      "grad_norm": 0.4824911067666612,
      "learning_rate": 3.20687702609976e-05,
      "loss": 1.2228,
      "num_input_tokens_seen": 36423336480,
      "step": 46295
    },
    {
      "epoch": 4.911521323997454,
      "grad_norm": 0.5359319888279197,
      "learning_rate": 3.2068103648760404e-05,
      "loss": 1.299,
      "num_input_tokens_seen": 36424123264,
      "step": 46296
    },
    {
      "epoch": 4.911627413537025,
      "grad_norm": 0.4631178259575846,
      "learning_rate": 3.206743703106118e-05,
      "loss": 1.2425,
      "num_input_tokens_seen": 36424909968,
      "step": 46297
    },
    {
      "epoch": 4.911733503076596,
      "grad_norm": 0.5776827527427837,
      "learning_rate": 3.206677040790044e-05,
      "loss": 1.3281,
      "num_input_tokens_seen": 36425696720,
      "step": 46298
    },
    {
      "epoch": 4.911839592616168,
      "grad_norm": 0.5467383701785871,
      "learning_rate": 3.20661037792787e-05,
      "loss": 1.2874,
      "num_input_tokens_seen": 36426483488,
      "step": 46299
    },
    {
      "epoch": 4.911945682155739,
      "grad_norm": 0.5290421855176646,
      "learning_rate": 3.2065437145196505e-05,
      "loss": 1.2954,
      "num_input_tokens_seen": 36427270320,
      "step": 46300
    },
    {
      "epoch": 4.912051771695311,
      "grad_norm": 0.5676777975534147,
      "learning_rate": 3.206477050565433e-05,
      "loss": 1.265,
      "num_input_tokens_seen": 36428057216,
      "step": 46301
    },
    {
      "epoch": 4.912157861234882,
      "grad_norm": 0.5319499164103304,
      "learning_rate": 3.2064103860652714e-05,
      "loss": 1.2552,
      "num_input_tokens_seen": 36428844080,
      "step": 46302
    },
    {
      "epoch": 4.912263950774454,
      "grad_norm": 0.5197663028908781,
      "learning_rate": 3.206343721019217e-05,
      "loss": 1.2038,
      "num_input_tokens_seen": 36429630832,
      "step": 46303
    },
    {
      "epoch": 4.912370040314025,
      "grad_norm": 0.49237081786157144,
      "learning_rate": 3.2062770554273206e-05,
      "loss": 1.2724,
      "num_input_tokens_seen": 36430417536,
      "step": 46304
    },
    {
      "epoch": 4.912476129853596,
      "grad_norm": 0.5590272493524875,
      "learning_rate": 3.206210389289633e-05,
      "loss": 1.2841,
      "num_input_tokens_seen": 36431204256,
      "step": 46305
    },
    {
      "epoch": 4.912582219393168,
      "grad_norm": 0.6388471018590461,
      "learning_rate": 3.206143722606208e-05,
      "loss": 1.3195,
      "num_input_tokens_seen": 36431991088,
      "step": 46306
    },
    {
      "epoch": 4.912688308932739,
      "grad_norm": 0.4970419478747143,
      "learning_rate": 3.206077055377095e-05,
      "loss": 1.2857,
      "num_input_tokens_seen": 36432777936,
      "step": 46307
    },
    {
      "epoch": 4.912794398472311,
      "grad_norm": 0.5551492034898362,
      "learning_rate": 3.206010387602347e-05,
      "loss": 1.2361,
      "num_input_tokens_seen": 36433564688,
      "step": 46308
    },
    {
      "epoch": 4.912900488011882,
      "grad_norm": 0.6409823121774003,
      "learning_rate": 3.2059437192820153e-05,
      "loss": 1.3098,
      "num_input_tokens_seen": 36434351488,
      "step": 46309
    },
    {
      "epoch": 4.913006577551453,
      "grad_norm": 0.5469440064534825,
      "learning_rate": 3.2058770504161495e-05,
      "loss": 1.3043,
      "num_input_tokens_seen": 36435138288,
      "step": 46310
    },
    {
      "epoch": 4.913112667091025,
      "grad_norm": 0.722571880837226,
      "learning_rate": 3.205810381004803e-05,
      "loss": 1.2703,
      "num_input_tokens_seen": 36435925024,
      "step": 46311
    },
    {
      "epoch": 4.913218756630596,
      "grad_norm": 0.5898448083232989,
      "learning_rate": 3.205743711048028e-05,
      "loss": 1.2408,
      "num_input_tokens_seen": 36436711808,
      "step": 46312
    },
    {
      "epoch": 4.913324846170168,
      "grad_norm": 0.6734447388480043,
      "learning_rate": 3.205677040545874e-05,
      "loss": 1.3027,
      "num_input_tokens_seen": 36437498624,
      "step": 46313
    },
    {
      "epoch": 4.913430935709739,
      "grad_norm": 0.7916716166301122,
      "learning_rate": 3.205610369498395e-05,
      "loss": 1.2578,
      "num_input_tokens_seen": 36438285376,
      "step": 46314
    },
    {
      "epoch": 4.91353702524931,
      "grad_norm": 0.5561664996883782,
      "learning_rate": 3.20554369790564e-05,
      "loss": 1.3396,
      "num_input_tokens_seen": 36439072208,
      "step": 46315
    },
    {
      "epoch": 4.913643114788882,
      "grad_norm": 0.5933275153017414,
      "learning_rate": 3.2054770257676606e-05,
      "loss": 1.334,
      "num_input_tokens_seen": 36439858960,
      "step": 46316
    },
    {
      "epoch": 4.913749204328453,
      "grad_norm": 0.7430175582551811,
      "learning_rate": 3.2054103530845106e-05,
      "loss": 1.4161,
      "num_input_tokens_seen": 36440645776,
      "step": 46317
    },
    {
      "epoch": 4.913855293868025,
      "grad_norm": 0.4763371085301237,
      "learning_rate": 3.20534367985624e-05,
      "loss": 1.1826,
      "num_input_tokens_seen": 36441432624,
      "step": 46318
    },
    {
      "epoch": 4.913961383407596,
      "grad_norm": 0.621311056848117,
      "learning_rate": 3.2052770060829e-05,
      "loss": 1.2663,
      "num_input_tokens_seen": 36442219296,
      "step": 46319
    },
    {
      "epoch": 4.914067472947167,
      "grad_norm": 0.5525552820286723,
      "learning_rate": 3.2052103317645425e-05,
      "loss": 1.3145,
      "num_input_tokens_seen": 36443006048,
      "step": 46320
    },
    {
      "epoch": 4.914173562486739,
      "grad_norm": 0.5332757722843006,
      "learning_rate": 3.20514365690122e-05,
      "loss": 1.3208,
      "num_input_tokens_seen": 36443792816,
      "step": 46321
    },
    {
      "epoch": 4.91427965202631,
      "grad_norm": 0.5380692271407801,
      "learning_rate": 3.205076981492982e-05,
      "loss": 1.2951,
      "num_input_tokens_seen": 36444579632,
      "step": 46322
    },
    {
      "epoch": 4.914385741565882,
      "grad_norm": 0.5528013646679379,
      "learning_rate": 3.205010305539882e-05,
      "loss": 1.399,
      "num_input_tokens_seen": 36445366448,
      "step": 46323
    },
    {
      "epoch": 4.914491831105453,
      "grad_norm": 0.5677008520529554,
      "learning_rate": 3.204943629041971e-05,
      "loss": 1.2914,
      "num_input_tokens_seen": 36446153216,
      "step": 46324
    },
    {
      "epoch": 4.914597920645025,
      "grad_norm": 0.5445645807584955,
      "learning_rate": 3.2048769519993e-05,
      "loss": 1.2998,
      "num_input_tokens_seen": 36446940032,
      "step": 46325
    },
    {
      "epoch": 4.914704010184596,
      "grad_norm": 0.494867496876305,
      "learning_rate": 3.2048102744119204e-05,
      "loss": 1.2623,
      "num_input_tokens_seen": 36447726768,
      "step": 46326
    },
    {
      "epoch": 4.914810099724167,
      "grad_norm": 0.5382390652289384,
      "learning_rate": 3.204743596279884e-05,
      "loss": 1.2531,
      "num_input_tokens_seen": 36448513504,
      "step": 46327
    },
    {
      "epoch": 4.914916189263739,
      "grad_norm": 0.4657945476040575,
      "learning_rate": 3.204676917603243e-05,
      "loss": 1.311,
      "num_input_tokens_seen": 36449300272,
      "step": 46328
    },
    {
      "epoch": 4.91502227880331,
      "grad_norm": 0.5238915236840972,
      "learning_rate": 3.2046102383820475e-05,
      "loss": 1.3052,
      "num_input_tokens_seen": 36450087056,
      "step": 46329
    },
    {
      "epoch": 4.915128368342882,
      "grad_norm": 0.6048136647998941,
      "learning_rate": 3.204543558616351e-05,
      "loss": 1.3988,
      "num_input_tokens_seen": 36450873840,
      "step": 46330
    },
    {
      "epoch": 4.915234457882453,
      "grad_norm": 0.5152921932867588,
      "learning_rate": 3.204476878306203e-05,
      "loss": 1.1951,
      "num_input_tokens_seen": 36451660672,
      "step": 46331
    },
    {
      "epoch": 4.915340547422025,
      "grad_norm": 0.5123161497656714,
      "learning_rate": 3.2044101974516566e-05,
      "loss": 1.2615,
      "num_input_tokens_seen": 36452447472,
      "step": 46332
    },
    {
      "epoch": 4.915446636961596,
      "grad_norm": 0.6078840639903644,
      "learning_rate": 3.204343516052762e-05,
      "loss": 1.3272,
      "num_input_tokens_seen": 36453234224,
      "step": 46333
    },
    {
      "epoch": 4.915552726501167,
      "grad_norm": 0.48839306890257944,
      "learning_rate": 3.204276834109572e-05,
      "loss": 1.3659,
      "num_input_tokens_seen": 36454021056,
      "step": 46334
    },
    {
      "epoch": 4.915658816040739,
      "grad_norm": 0.5597957181619264,
      "learning_rate": 3.2042101516221376e-05,
      "loss": 1.2953,
      "num_input_tokens_seen": 36454807776,
      "step": 46335
    },
    {
      "epoch": 4.91576490558031,
      "grad_norm": 0.646468243254368,
      "learning_rate": 3.204143468590509e-05,
      "loss": 1.2487,
      "num_input_tokens_seen": 36455594464,
      "step": 46336
    },
    {
      "epoch": 4.915870995119882,
      "grad_norm": 0.4797485310721612,
      "learning_rate": 3.204076785014741e-05,
      "loss": 1.2374,
      "num_input_tokens_seen": 36456381232,
      "step": 46337
    },
    {
      "epoch": 4.915977084659453,
      "grad_norm": 0.6258724310958773,
      "learning_rate": 3.204010100894882e-05,
      "loss": 1.4065,
      "num_input_tokens_seen": 36457168064,
      "step": 46338
    },
    {
      "epoch": 4.916083174199024,
      "grad_norm": 0.5147197762715469,
      "learning_rate": 3.2039434162309846e-05,
      "loss": 1.3435,
      "num_input_tokens_seen": 36457954752,
      "step": 46339
    },
    {
      "epoch": 4.9161892637385955,
      "grad_norm": 0.5115437009527457,
      "learning_rate": 3.2038767310231e-05,
      "loss": 1.3123,
      "num_input_tokens_seen": 36458741520,
      "step": 46340
    },
    {
      "epoch": 4.916295353278167,
      "grad_norm": 0.5371078449165979,
      "learning_rate": 3.203810045271281e-05,
      "loss": 1.3067,
      "num_input_tokens_seen": 36459528240,
      "step": 46341
    },
    {
      "epoch": 4.9164014428177385,
      "grad_norm": 0.5431223678781352,
      "learning_rate": 3.203743358975578e-05,
      "loss": 1.4147,
      "num_input_tokens_seen": 36460315056,
      "step": 46342
    },
    {
      "epoch": 4.9165075323573095,
      "grad_norm": 0.6118888286081349,
      "learning_rate": 3.203676672136042e-05,
      "loss": 1.3728,
      "num_input_tokens_seen": 36461101888,
      "step": 46343
    },
    {
      "epoch": 4.916613621896881,
      "grad_norm": 0.47050325800508686,
      "learning_rate": 3.203609984752726e-05,
      "loss": 1.1952,
      "num_input_tokens_seen": 36461888672,
      "step": 46344
    },
    {
      "epoch": 4.9167197114364525,
      "grad_norm": 0.5023139875260275,
      "learning_rate": 3.2035432968256815e-05,
      "loss": 1.231,
      "num_input_tokens_seen": 36462675360,
      "step": 46345
    },
    {
      "epoch": 4.9168258009760235,
      "grad_norm": 0.6724698962932655,
      "learning_rate": 3.203476608354958e-05,
      "loss": 1.3403,
      "num_input_tokens_seen": 36463462112,
      "step": 46346
    },
    {
      "epoch": 4.916931890515595,
      "grad_norm": 0.5244111927449507,
      "learning_rate": 3.203409919340609e-05,
      "loss": 1.2806,
      "num_input_tokens_seen": 36464248880,
      "step": 46347
    },
    {
      "epoch": 4.9170379800551665,
      "grad_norm": 0.6038774613011425,
      "learning_rate": 3.203343229782686e-05,
      "loss": 1.2811,
      "num_input_tokens_seen": 36465035616,
      "step": 46348
    },
    {
      "epoch": 4.9171440695947375,
      "grad_norm": 0.4751454340350686,
      "learning_rate": 3.20327653968124e-05,
      "loss": 1.276,
      "num_input_tokens_seen": 36465822368,
      "step": 46349
    },
    {
      "epoch": 4.917250159134309,
      "grad_norm": 0.5184049996305808,
      "learning_rate": 3.203209849036322e-05,
      "loss": 1.3419,
      "num_input_tokens_seen": 36466609056,
      "step": 46350
    },
    {
      "epoch": 4.91735624867388,
      "grad_norm": 0.5719581485339216,
      "learning_rate": 3.2031431578479834e-05,
      "loss": 1.3621,
      "num_input_tokens_seen": 36467395792,
      "step": 46351
    },
    {
      "epoch": 4.917462338213452,
      "grad_norm": 0.5627047684424303,
      "learning_rate": 3.2030764661162775e-05,
      "loss": 1.3445,
      "num_input_tokens_seen": 36468182608,
      "step": 46352
    },
    {
      "epoch": 4.917568427753023,
      "grad_norm": 0.5187708471605894,
      "learning_rate": 3.203009773841254e-05,
      "loss": 1.3281,
      "num_input_tokens_seen": 36468969264,
      "step": 46353
    },
    {
      "epoch": 4.917674517292595,
      "grad_norm": 0.4660347871149972,
      "learning_rate": 3.202943081022966e-05,
      "loss": 1.2155,
      "num_input_tokens_seen": 36469756048,
      "step": 46354
    },
    {
      "epoch": 4.917780606832166,
      "grad_norm": 0.6117117510744567,
      "learning_rate": 3.202876387661464e-05,
      "loss": 1.3105,
      "num_input_tokens_seen": 36470542800,
      "step": 46355
    },
    {
      "epoch": 4.917886696371737,
      "grad_norm": 0.6076625691082144,
      "learning_rate": 3.202809693756799e-05,
      "loss": 1.3318,
      "num_input_tokens_seen": 36471329520,
      "step": 46356
    },
    {
      "epoch": 4.917992785911309,
      "grad_norm": 0.5778785079815093,
      "learning_rate": 3.202742999309024e-05,
      "loss": 1.2345,
      "num_input_tokens_seen": 36472116320,
      "step": 46357
    },
    {
      "epoch": 4.91809887545088,
      "grad_norm": 0.5160597748260393,
      "learning_rate": 3.20267630431819e-05,
      "loss": 1.2371,
      "num_input_tokens_seen": 36472903152,
      "step": 46358
    },
    {
      "epoch": 4.918204964990452,
      "grad_norm": 0.826594472115609,
      "learning_rate": 3.2026096087843473e-05,
      "loss": 1.2668,
      "num_input_tokens_seen": 36473689904,
      "step": 46359
    },
    {
      "epoch": 4.918311054530023,
      "grad_norm": 0.6215414107294558,
      "learning_rate": 3.202542912707549e-05,
      "loss": 1.2729,
      "num_input_tokens_seen": 36474476736,
      "step": 46360
    },
    {
      "epoch": 4.918417144069595,
      "grad_norm": 0.6529068661461472,
      "learning_rate": 3.202476216087846e-05,
      "loss": 1.2607,
      "num_input_tokens_seen": 36475263584,
      "step": 46361
    },
    {
      "epoch": 4.918523233609166,
      "grad_norm": 0.6653997177668288,
      "learning_rate": 3.202409518925291e-05,
      "loss": 1.3262,
      "num_input_tokens_seen": 36476050240,
      "step": 46362
    },
    {
      "epoch": 4.918629323148737,
      "grad_norm": 0.54139051530655,
      "learning_rate": 3.202342821219934e-05,
      "loss": 1.3592,
      "num_input_tokens_seen": 36476836896,
      "step": 46363
    },
    {
      "epoch": 4.918735412688309,
      "grad_norm": 0.5956214628383488,
      "learning_rate": 3.202276122971827e-05,
      "loss": 1.2117,
      "num_input_tokens_seen": 36477623760,
      "step": 46364
    },
    {
      "epoch": 4.91884150222788,
      "grad_norm": 0.6128820275761223,
      "learning_rate": 3.202209424181021e-05,
      "loss": 1.3536,
      "num_input_tokens_seen": 36478410384,
      "step": 46365
    },
    {
      "epoch": 4.918947591767452,
      "grad_norm": 0.5598583606606313,
      "learning_rate": 3.202142724847569e-05,
      "loss": 1.3779,
      "num_input_tokens_seen": 36479197072,
      "step": 46366
    },
    {
      "epoch": 4.919053681307023,
      "grad_norm": 0.6401643683793294,
      "learning_rate": 3.2020760249715214e-05,
      "loss": 1.3126,
      "num_input_tokens_seen": 36479983776,
      "step": 46367
    },
    {
      "epoch": 4.919159770846594,
      "grad_norm": 0.5931672275576254,
      "learning_rate": 3.20200932455293e-05,
      "loss": 1.2928,
      "num_input_tokens_seen": 36480770544,
      "step": 46368
    },
    {
      "epoch": 4.919265860386166,
      "grad_norm": 0.5190658338095697,
      "learning_rate": 3.201942623591847e-05,
      "loss": 1.2031,
      "num_input_tokens_seen": 36481557440,
      "step": 46369
    },
    {
      "epoch": 4.919371949925737,
      "grad_norm": 0.5584344300707125,
      "learning_rate": 3.201875922088322e-05,
      "loss": 1.3063,
      "num_input_tokens_seen": 36482344272,
      "step": 46370
    },
    {
      "epoch": 4.919478039465309,
      "grad_norm": 0.5393746616719222,
      "learning_rate": 3.2018092200424085e-05,
      "loss": 1.2191,
      "num_input_tokens_seen": 36483131088,
      "step": 46371
    },
    {
      "epoch": 4.91958412900488,
      "grad_norm": 0.488427235525344,
      "learning_rate": 3.201742517454158e-05,
      "loss": 1.3009,
      "num_input_tokens_seen": 36483918000,
      "step": 46372
    },
    {
      "epoch": 4.919690218544451,
      "grad_norm": 0.5522416217905415,
      "learning_rate": 3.201675814323621e-05,
      "loss": 1.2815,
      "num_input_tokens_seen": 36484704752,
      "step": 46373
    },
    {
      "epoch": 4.919796308084023,
      "grad_norm": 0.5867673681457614,
      "learning_rate": 3.20160911065085e-05,
      "loss": 1.2427,
      "num_input_tokens_seen": 36485491568,
      "step": 46374
    },
    {
      "epoch": 4.919902397623594,
      "grad_norm": 0.6167150577570009,
      "learning_rate": 3.201542406435896e-05,
      "loss": 1.4052,
      "num_input_tokens_seen": 36486278368,
      "step": 46375
    },
    {
      "epoch": 4.920008487163166,
      "grad_norm": 0.6654533308154903,
      "learning_rate": 3.20147570167881e-05,
      "loss": 1.4494,
      "num_input_tokens_seen": 36487065120,
      "step": 46376
    },
    {
      "epoch": 4.920114576702737,
      "grad_norm": 0.5127444936104146,
      "learning_rate": 3.2014089963796445e-05,
      "loss": 1.2743,
      "num_input_tokens_seen": 36487851920,
      "step": 46377
    },
    {
      "epoch": 4.920220666242308,
      "grad_norm": 0.6536170610968586,
      "learning_rate": 3.201342290538451e-05,
      "loss": 1.2939,
      "num_input_tokens_seen": 36488638720,
      "step": 46378
    },
    {
      "epoch": 4.92032675578188,
      "grad_norm": 0.6058177617251996,
      "learning_rate": 3.2012755841552796e-05,
      "loss": 1.3097,
      "num_input_tokens_seen": 36489425472,
      "step": 46379
    },
    {
      "epoch": 4.920432845321451,
      "grad_norm": 0.6219434063501778,
      "learning_rate": 3.201208877230184e-05,
      "loss": 1.3584,
      "num_input_tokens_seen": 36490212160,
      "step": 46380
    },
    {
      "epoch": 4.920538934861023,
      "grad_norm": 0.5987301141741713,
      "learning_rate": 3.201142169763215e-05,
      "loss": 1.3146,
      "num_input_tokens_seen": 36490998944,
      "step": 46381
    },
    {
      "epoch": 4.920645024400594,
      "grad_norm": 0.8070168756156575,
      "learning_rate": 3.201075461754423e-05,
      "loss": 1.2219,
      "num_input_tokens_seen": 36491785728,
      "step": 46382
    },
    {
      "epoch": 4.920751113940166,
      "grad_norm": 0.6131056047733603,
      "learning_rate": 3.201008753203861e-05,
      "loss": 1.2855,
      "num_input_tokens_seen": 36492572528,
      "step": 46383
    },
    {
      "epoch": 4.920857203479737,
      "grad_norm": 0.6820630978227611,
      "learning_rate": 3.2009420441115806e-05,
      "loss": 1.2749,
      "num_input_tokens_seen": 36493359344,
      "step": 46384
    },
    {
      "epoch": 4.920963293019309,
      "grad_norm": 0.8433964035200016,
      "learning_rate": 3.2008753344776314e-05,
      "loss": 1.3829,
      "num_input_tokens_seen": 36494146064,
      "step": 46385
    },
    {
      "epoch": 4.92106938255888,
      "grad_norm": 0.6219736159745918,
      "learning_rate": 3.2008086243020676e-05,
      "loss": 1.1823,
      "num_input_tokens_seen": 36494932976,
      "step": 46386
    },
    {
      "epoch": 4.921175472098451,
      "grad_norm": 0.657388173038591,
      "learning_rate": 3.200741913584938e-05,
      "loss": 1.1827,
      "num_input_tokens_seen": 36495719760,
      "step": 46387
    },
    {
      "epoch": 4.921281561638023,
      "grad_norm": 0.6817443461092436,
      "learning_rate": 3.200675202326297e-05,
      "loss": 1.4249,
      "num_input_tokens_seen": 36496506448,
      "step": 46388
    },
    {
      "epoch": 4.921387651177594,
      "grad_norm": 0.645648329090181,
      "learning_rate": 3.2006084905261944e-05,
      "loss": 1.3743,
      "num_input_tokens_seen": 36497293152,
      "step": 46389
    },
    {
      "epoch": 4.921493740717166,
      "grad_norm": 0.6766657820930314,
      "learning_rate": 3.200541778184682e-05,
      "loss": 1.2797,
      "num_input_tokens_seen": 36498079920,
      "step": 46390
    },
    {
      "epoch": 4.921599830256737,
      "grad_norm": 0.6953976229214964,
      "learning_rate": 3.200475065301811e-05,
      "loss": 1.3342,
      "num_input_tokens_seen": 36498866720,
      "step": 46391
    },
    {
      "epoch": 4.921705919796308,
      "grad_norm": 0.5726912374626166,
      "learning_rate": 3.200408351877635e-05,
      "loss": 1.3191,
      "num_input_tokens_seen": 36499653488,
      "step": 46392
    },
    {
      "epoch": 4.92181200933588,
      "grad_norm": 0.6616414104987499,
      "learning_rate": 3.200341637912202e-05,
      "loss": 1.2645,
      "num_input_tokens_seen": 36500440240,
      "step": 46393
    },
    {
      "epoch": 4.921918098875451,
      "grad_norm": 0.6294548104605687,
      "learning_rate": 3.200274923405566e-05,
      "loss": 1.3541,
      "num_input_tokens_seen": 36501227024,
      "step": 46394
    },
    {
      "epoch": 4.922024188415023,
      "grad_norm": 0.5196105660821664,
      "learning_rate": 3.200208208357779e-05,
      "loss": 1.3071,
      "num_input_tokens_seen": 36502013824,
      "step": 46395
    },
    {
      "epoch": 4.922130277954594,
      "grad_norm": 0.7620686426503921,
      "learning_rate": 3.200141492768891e-05,
      "loss": 1.3185,
      "num_input_tokens_seen": 36502800592,
      "step": 46396
    },
    {
      "epoch": 4.922236367494165,
      "grad_norm": 0.584452545473063,
      "learning_rate": 3.2000747766389544e-05,
      "loss": 1.2414,
      "num_input_tokens_seen": 36503587488,
      "step": 46397
    },
    {
      "epoch": 4.922342457033737,
      "grad_norm": 0.5747149560187784,
      "learning_rate": 3.20000805996802e-05,
      "loss": 1.2445,
      "num_input_tokens_seen": 36504374352,
      "step": 46398
    },
    {
      "epoch": 4.922448546573308,
      "grad_norm": 0.5646973691634432,
      "learning_rate": 3.19994134275614e-05,
      "loss": 1.2444,
      "num_input_tokens_seen": 36505161104,
      "step": 46399
    },
    {
      "epoch": 4.92255463611288,
      "grad_norm": 0.4615606238198809,
      "learning_rate": 3.1998746250033665e-05,
      "loss": 1.2544,
      "num_input_tokens_seen": 36505947808,
      "step": 46400
    },
    {
      "epoch": 4.922660725652451,
      "grad_norm": 0.4857146579373645,
      "learning_rate": 3.199807906709751e-05,
      "loss": 1.3334,
      "num_input_tokens_seen": 36506734720,
      "step": 46401
    },
    {
      "epoch": 4.922766815192022,
      "grad_norm": 0.65587535912241,
      "learning_rate": 3.199741187875343e-05,
      "loss": 1.4483,
      "num_input_tokens_seen": 36507521584,
      "step": 46402
    },
    {
      "epoch": 4.922872904731594,
      "grad_norm": 0.5459629425744498,
      "learning_rate": 3.199674468500197e-05,
      "loss": 1.2672,
      "num_input_tokens_seen": 36508308416,
      "step": 46403
    },
    {
      "epoch": 4.922978994271165,
      "grad_norm": 0.7117571146107444,
      "learning_rate": 3.199607748584361e-05,
      "loss": 1.4087,
      "num_input_tokens_seen": 36509095216,
      "step": 46404
    },
    {
      "epoch": 4.9230850838107365,
      "grad_norm": 0.5153616373270054,
      "learning_rate": 3.1995410281278896e-05,
      "loss": 1.2733,
      "num_input_tokens_seen": 36509882080,
      "step": 46405
    },
    {
      "epoch": 4.9231911733503075,
      "grad_norm": 0.5987283920519363,
      "learning_rate": 3.199474307130834e-05,
      "loss": 1.3016,
      "num_input_tokens_seen": 36510668768,
      "step": 46406
    },
    {
      "epoch": 4.923297262889879,
      "grad_norm": 0.6019426762840782,
      "learning_rate": 3.1994075855932456e-05,
      "loss": 1.2628,
      "num_input_tokens_seen": 36511455552,
      "step": 46407
    },
    {
      "epoch": 4.9234033524294505,
      "grad_norm": 0.4543223292956263,
      "learning_rate": 3.199340863515175e-05,
      "loss": 1.2434,
      "num_input_tokens_seen": 36512242352,
      "step": 46408
    },
    {
      "epoch": 4.9235094419690215,
      "grad_norm": 0.46276667175003966,
      "learning_rate": 3.199274140896674e-05,
      "loss": 1.2697,
      "num_input_tokens_seen": 36513029168,
      "step": 46409
    },
    {
      "epoch": 4.923615531508593,
      "grad_norm": 0.48044234649385514,
      "learning_rate": 3.1992074177377946e-05,
      "loss": 1.2243,
      "num_input_tokens_seen": 36513815840,
      "step": 46410
    },
    {
      "epoch": 4.9237216210481645,
      "grad_norm": 0.49632663674859856,
      "learning_rate": 3.1991406940385875e-05,
      "loss": 1.244,
      "num_input_tokens_seen": 36514602672,
      "step": 46411
    },
    {
      "epoch": 4.923827710587736,
      "grad_norm": 0.5320821251654586,
      "learning_rate": 3.199073969799106e-05,
      "loss": 1.3416,
      "num_input_tokens_seen": 36515389360,
      "step": 46412
    },
    {
      "epoch": 4.923933800127307,
      "grad_norm": 0.5677944667133452,
      "learning_rate": 3.1990072450194e-05,
      "loss": 1.3535,
      "num_input_tokens_seen": 36516176064,
      "step": 46413
    },
    {
      "epoch": 4.924039889666879,
      "grad_norm": 0.5041970459140834,
      "learning_rate": 3.198940519699523e-05,
      "loss": 1.2366,
      "num_input_tokens_seen": 36516962816,
      "step": 46414
    },
    {
      "epoch": 4.92414597920645,
      "grad_norm": 0.7041684366565347,
      "learning_rate": 3.1988737938395244e-05,
      "loss": 1.4156,
      "num_input_tokens_seen": 36517749568,
      "step": 46415
    },
    {
      "epoch": 4.924252068746021,
      "grad_norm": 0.47253608992798873,
      "learning_rate": 3.198807067439456e-05,
      "loss": 1.2907,
      "num_input_tokens_seen": 36518536288,
      "step": 46416
    },
    {
      "epoch": 4.924358158285593,
      "grad_norm": 0.6568053189131529,
      "learning_rate": 3.198740340499371e-05,
      "loss": 1.2624,
      "num_input_tokens_seen": 36519323056,
      "step": 46417
    },
    {
      "epoch": 4.924464247825164,
      "grad_norm": 0.5861872357123772,
      "learning_rate": 3.1986736130193194e-05,
      "loss": 1.3678,
      "num_input_tokens_seen": 36520109696,
      "step": 46418
    },
    {
      "epoch": 4.924570337364736,
      "grad_norm": 0.5200028254544077,
      "learning_rate": 3.198606884999353e-05,
      "loss": 1.3034,
      "num_input_tokens_seen": 36520896448,
      "step": 46419
    },
    {
      "epoch": 4.924676426904307,
      "grad_norm": 0.7835095352448547,
      "learning_rate": 3.198540156439525e-05,
      "loss": 1.371,
      "num_input_tokens_seen": 36521683264,
      "step": 46420
    },
    {
      "epoch": 4.924782516443878,
      "grad_norm": 0.5659296251181745,
      "learning_rate": 3.198473427339885e-05,
      "loss": 1.3431,
      "num_input_tokens_seen": 36522470032,
      "step": 46421
    },
    {
      "epoch": 4.92488860598345,
      "grad_norm": 0.7724053559455177,
      "learning_rate": 3.1984066977004845e-05,
      "loss": 1.3959,
      "num_input_tokens_seen": 36523256816,
      "step": 46422
    },
    {
      "epoch": 4.924994695523021,
      "grad_norm": 0.5285002031509313,
      "learning_rate": 3.1983399675213764e-05,
      "loss": 1.2873,
      "num_input_tokens_seen": 36524043648,
      "step": 46423
    },
    {
      "epoch": 4.925100785062593,
      "grad_norm": 0.7117576567997632,
      "learning_rate": 3.198273236802612e-05,
      "loss": 1.275,
      "num_input_tokens_seen": 36524830432,
      "step": 46424
    },
    {
      "epoch": 4.925206874602164,
      "grad_norm": 0.7818580246761705,
      "learning_rate": 3.198206505544242e-05,
      "loss": 1.2873,
      "num_input_tokens_seen": 36525617200,
      "step": 46425
    },
    {
      "epoch": 4.925312964141735,
      "grad_norm": 0.4992104746733551,
      "learning_rate": 3.198139773746319e-05,
      "loss": 1.3204,
      "num_input_tokens_seen": 36526403936,
      "step": 46426
    },
    {
      "epoch": 4.925419053681307,
      "grad_norm": 0.8736030007133102,
      "learning_rate": 3.198073041408894e-05,
      "loss": 1.3491,
      "num_input_tokens_seen": 36527190688,
      "step": 46427
    },
    {
      "epoch": 4.925525143220878,
      "grad_norm": 0.8288436767292273,
      "learning_rate": 3.198006308532018e-05,
      "loss": 1.4367,
      "num_input_tokens_seen": 36527977504,
      "step": 46428
    },
    {
      "epoch": 4.92563123276045,
      "grad_norm": 0.5807180885443834,
      "learning_rate": 3.197939575115744e-05,
      "loss": 1.3845,
      "num_input_tokens_seen": 36528764288,
      "step": 46429
    },
    {
      "epoch": 4.925737322300021,
      "grad_norm": 0.7924681225645508,
      "learning_rate": 3.1978728411601216e-05,
      "loss": 1.1944,
      "num_input_tokens_seen": 36529551120,
      "step": 46430
    },
    {
      "epoch": 4.925843411839592,
      "grad_norm": 0.642693297285114,
      "learning_rate": 3.1978061066652045e-05,
      "loss": 1.2253,
      "num_input_tokens_seen": 36530338016,
      "step": 46431
    },
    {
      "epoch": 4.925949501379164,
      "grad_norm": 0.5547871136091773,
      "learning_rate": 3.197739371631043e-05,
      "loss": 1.2504,
      "num_input_tokens_seen": 36531124848,
      "step": 46432
    },
    {
      "epoch": 4.926055590918735,
      "grad_norm": 0.8811282004296054,
      "learning_rate": 3.197672636057689e-05,
      "loss": 1.3709,
      "num_input_tokens_seen": 36531911568,
      "step": 46433
    },
    {
      "epoch": 4.926161680458307,
      "grad_norm": 0.5457488378397246,
      "learning_rate": 3.1976058999451944e-05,
      "loss": 1.3272,
      "num_input_tokens_seen": 36532698320,
      "step": 46434
    },
    {
      "epoch": 4.926267769997878,
      "grad_norm": 0.5698588066131047,
      "learning_rate": 3.19753916329361e-05,
      "loss": 1.38,
      "num_input_tokens_seen": 36533485024,
      "step": 46435
    },
    {
      "epoch": 4.92637385953745,
      "grad_norm": 0.5960678416728481,
      "learning_rate": 3.197472426102988e-05,
      "loss": 1.351,
      "num_input_tokens_seen": 36534271792,
      "step": 46436
    },
    {
      "epoch": 4.926479949077021,
      "grad_norm": 0.7799725405849112,
      "learning_rate": 3.1974056883733796e-05,
      "loss": 1.3326,
      "num_input_tokens_seen": 36535058496,
      "step": 46437
    },
    {
      "epoch": 4.926586038616592,
      "grad_norm": 0.5342021572770019,
      "learning_rate": 3.197338950104837e-05,
      "loss": 1.2669,
      "num_input_tokens_seen": 36535845184,
      "step": 46438
    },
    {
      "epoch": 4.926692128156164,
      "grad_norm": 0.5573694358818986,
      "learning_rate": 3.197272211297411e-05,
      "loss": 1.3907,
      "num_input_tokens_seen": 36536631936,
      "step": 46439
    },
    {
      "epoch": 4.926798217695735,
      "grad_norm": 0.5541090178976407,
      "learning_rate": 3.197205471951154e-05,
      "loss": 1.381,
      "num_input_tokens_seen": 36537418656,
      "step": 46440
    },
    {
      "epoch": 4.926904307235307,
      "grad_norm": 0.5958867194154766,
      "learning_rate": 3.197138732066117e-05,
      "loss": 1.3084,
      "num_input_tokens_seen": 36538205344,
      "step": 46441
    },
    {
      "epoch": 4.927010396774878,
      "grad_norm": 0.544730203318221,
      "learning_rate": 3.1970719916423507e-05,
      "loss": 1.2711,
      "num_input_tokens_seen": 36538992192,
      "step": 46442
    },
    {
      "epoch": 4.92711648631445,
      "grad_norm": 0.49983126894711705,
      "learning_rate": 3.197005250679909e-05,
      "loss": 1.306,
      "num_input_tokens_seen": 36539778976,
      "step": 46443
    },
    {
      "epoch": 4.927222575854021,
      "grad_norm": 0.5852012653965488,
      "learning_rate": 3.1969385091788405e-05,
      "loss": 1.3842,
      "num_input_tokens_seen": 36540565744,
      "step": 46444
    },
    {
      "epoch": 4.927328665393592,
      "grad_norm": 0.5077570038927811,
      "learning_rate": 3.196871767139199e-05,
      "loss": 1.2825,
      "num_input_tokens_seen": 36541352576,
      "step": 46445
    },
    {
      "epoch": 4.927434754933164,
      "grad_norm": 0.6871938002905364,
      "learning_rate": 3.196805024561036e-05,
      "loss": 1.4111,
      "num_input_tokens_seen": 36542139216,
      "step": 46446
    },
    {
      "epoch": 4.927540844472735,
      "grad_norm": 0.5557531702593587,
      "learning_rate": 3.196738281444401e-05,
      "loss": 1.1929,
      "num_input_tokens_seen": 36542926016,
      "step": 46447
    },
    {
      "epoch": 4.927646934012307,
      "grad_norm": 0.5787857369815651,
      "learning_rate": 3.196671537789349e-05,
      "loss": 1.2968,
      "num_input_tokens_seen": 36543712864,
      "step": 46448
    },
    {
      "epoch": 4.927753023551878,
      "grad_norm": 0.5972600129856905,
      "learning_rate": 3.196604793595929e-05,
      "loss": 1.3002,
      "num_input_tokens_seen": 36544499616,
      "step": 46449
    },
    {
      "epoch": 4.927859113091449,
      "grad_norm": 0.5613827682498934,
      "learning_rate": 3.1965380488641926e-05,
      "loss": 1.2884,
      "num_input_tokens_seen": 36545286384,
      "step": 46450
    },
    {
      "epoch": 4.927965202631021,
      "grad_norm": 0.5546762369069145,
      "learning_rate": 3.196471303594193e-05,
      "loss": 1.3597,
      "num_input_tokens_seen": 36546073104,
      "step": 46451
    },
    {
      "epoch": 4.928071292170592,
      "grad_norm": 0.5901424437513016,
      "learning_rate": 3.1964045577859806e-05,
      "loss": 1.2806,
      "num_input_tokens_seen": 36546859888,
      "step": 46452
    },
    {
      "epoch": 4.928177381710164,
      "grad_norm": 0.59477992291955,
      "learning_rate": 3.196337811439607e-05,
      "loss": 1.1941,
      "num_input_tokens_seen": 36547646672,
      "step": 46453
    },
    {
      "epoch": 4.928283471249735,
      "grad_norm": 0.5531767240952419,
      "learning_rate": 3.196271064555123e-05,
      "loss": 1.3545,
      "num_input_tokens_seen": 36548433328,
      "step": 46454
    },
    {
      "epoch": 4.928389560789306,
      "grad_norm": 0.5576071673475808,
      "learning_rate": 3.196204317132583e-05,
      "loss": 1.3245,
      "num_input_tokens_seen": 36549220064,
      "step": 46455
    },
    {
      "epoch": 4.928495650328878,
      "grad_norm": 0.6562826341204098,
      "learning_rate": 3.196137569172035e-05,
      "loss": 1.3546,
      "num_input_tokens_seen": 36550006784,
      "step": 46456
    },
    {
      "epoch": 4.928601739868449,
      "grad_norm": 0.5217848116446049,
      "learning_rate": 3.1960708206735334e-05,
      "loss": 1.3031,
      "num_input_tokens_seen": 36550793632,
      "step": 46457
    },
    {
      "epoch": 4.928707829408021,
      "grad_norm": 0.6378985406315819,
      "learning_rate": 3.1960040716371286e-05,
      "loss": 1.2965,
      "num_input_tokens_seen": 36551580368,
      "step": 46458
    },
    {
      "epoch": 4.928813918947592,
      "grad_norm": 0.6019234330781669,
      "learning_rate": 3.195937322062872e-05,
      "loss": 1.2686,
      "num_input_tokens_seen": 36552367008,
      "step": 46459
    },
    {
      "epoch": 4.928920008487163,
      "grad_norm": 0.4986539495438042,
      "learning_rate": 3.1958705719508156e-05,
      "loss": 1.3237,
      "num_input_tokens_seen": 36553153712,
      "step": 46460
    },
    {
      "epoch": 4.929026098026735,
      "grad_norm": 0.530867301625978,
      "learning_rate": 3.195803821301011e-05,
      "loss": 1.4587,
      "num_input_tokens_seen": 36553940464,
      "step": 46461
    },
    {
      "epoch": 4.929132187566306,
      "grad_norm": 0.5153434684388136,
      "learning_rate": 3.195737070113509e-05,
      "loss": 1.3284,
      "num_input_tokens_seen": 36554727248,
      "step": 46462
    },
    {
      "epoch": 4.929238277105878,
      "grad_norm": 0.5484056306064938,
      "learning_rate": 3.195670318388362e-05,
      "loss": 1.304,
      "num_input_tokens_seen": 36555514096,
      "step": 46463
    },
    {
      "epoch": 4.929344366645449,
      "grad_norm": 0.5840592426368747,
      "learning_rate": 3.1956035661256226e-05,
      "loss": 1.3066,
      "num_input_tokens_seen": 36556300880,
      "step": 46464
    },
    {
      "epoch": 4.9294504561850205,
      "grad_norm": 0.5842180577520347,
      "learning_rate": 3.1955368133253395e-05,
      "loss": 1.3385,
      "num_input_tokens_seen": 36557087552,
      "step": 46465
    },
    {
      "epoch": 4.929556545724592,
      "grad_norm": 0.6054717960368755,
      "learning_rate": 3.195470059987567e-05,
      "loss": 1.342,
      "num_input_tokens_seen": 36557874320,
      "step": 46466
    },
    {
      "epoch": 4.929662635264163,
      "grad_norm": 0.497689270614852,
      "learning_rate": 3.1954033061123554e-05,
      "loss": 1.3274,
      "num_input_tokens_seen": 36558661056,
      "step": 46467
    },
    {
      "epoch": 4.9297687248037345,
      "grad_norm": 0.6180183243378766,
      "learning_rate": 3.195336551699756e-05,
      "loss": 1.1418,
      "num_input_tokens_seen": 36559447904,
      "step": 46468
    },
    {
      "epoch": 4.9298748143433055,
      "grad_norm": 0.547639669584082,
      "learning_rate": 3.195269796749822e-05,
      "loss": 1.3413,
      "num_input_tokens_seen": 36560234720,
      "step": 46469
    },
    {
      "epoch": 4.9299809038828775,
      "grad_norm": 0.5327358574639578,
      "learning_rate": 3.195203041262603e-05,
      "loss": 1.3083,
      "num_input_tokens_seen": 36561021424,
      "step": 46470
    },
    {
      "epoch": 4.9300869934224485,
      "grad_norm": 0.5604032456998705,
      "learning_rate": 3.1951362852381516e-05,
      "loss": 1.2932,
      "num_input_tokens_seen": 36561808272,
      "step": 46471
    },
    {
      "epoch": 4.93019308296202,
      "grad_norm": 0.5828919382698003,
      "learning_rate": 3.19506952867652e-05,
      "loss": 1.3389,
      "num_input_tokens_seen": 36562594960,
      "step": 46472
    },
    {
      "epoch": 4.930299172501591,
      "grad_norm": 0.556558919481375,
      "learning_rate": 3.1950027715777573e-05,
      "loss": 1.2868,
      "num_input_tokens_seen": 36563381856,
      "step": 46473
    },
    {
      "epoch": 4.9304052620411625,
      "grad_norm": 0.5377659848854186,
      "learning_rate": 3.1949360139419184e-05,
      "loss": 1.2231,
      "num_input_tokens_seen": 36564168640,
      "step": 46474
    },
    {
      "epoch": 4.930511351580734,
      "grad_norm": 0.5475681919511632,
      "learning_rate": 3.194869255769054e-05,
      "loss": 1.2342,
      "num_input_tokens_seen": 36564955376,
      "step": 46475
    },
    {
      "epoch": 4.930617441120305,
      "grad_norm": 0.5812939332216921,
      "learning_rate": 3.194802497059213e-05,
      "loss": 1.4208,
      "num_input_tokens_seen": 36565742112,
      "step": 46476
    },
    {
      "epoch": 4.930723530659877,
      "grad_norm": 0.5679903434622442,
      "learning_rate": 3.19473573781245e-05,
      "loss": 1.4417,
      "num_input_tokens_seen": 36566528896,
      "step": 46477
    },
    {
      "epoch": 4.930829620199448,
      "grad_norm": 0.49327678345187953,
      "learning_rate": 3.194668978028816e-05,
      "loss": 1.135,
      "num_input_tokens_seen": 36567315808,
      "step": 46478
    },
    {
      "epoch": 4.930935709739019,
      "grad_norm": 0.529880510978097,
      "learning_rate": 3.194602217708361e-05,
      "loss": 1.2915,
      "num_input_tokens_seen": 36568102512,
      "step": 46479
    },
    {
      "epoch": 4.931041799278591,
      "grad_norm": 0.5682552590369164,
      "learning_rate": 3.194535456851139e-05,
      "loss": 1.352,
      "num_input_tokens_seen": 36568889296,
      "step": 46480
    },
    {
      "epoch": 4.931147888818162,
      "grad_norm": 0.4727931261172248,
      "learning_rate": 3.194468695457201e-05,
      "loss": 1.3829,
      "num_input_tokens_seen": 36569676080,
      "step": 46481
    },
    {
      "epoch": 4.931253978357734,
      "grad_norm": 0.5019437197869698,
      "learning_rate": 3.1944019335265964e-05,
      "loss": 1.2441,
      "num_input_tokens_seen": 36570462960,
      "step": 46482
    },
    {
      "epoch": 4.931360067897305,
      "grad_norm": 0.5025787061420175,
      "learning_rate": 3.194335171059379e-05,
      "loss": 1.2231,
      "num_input_tokens_seen": 36571249776,
      "step": 46483
    },
    {
      "epoch": 4.931466157436876,
      "grad_norm": 0.5428735855152756,
      "learning_rate": 3.1942684080555996e-05,
      "loss": 1.3094,
      "num_input_tokens_seen": 36572036576,
      "step": 46484
    },
    {
      "epoch": 4.931572246976448,
      "grad_norm": 0.47718456837853657,
      "learning_rate": 3.19420164451531e-05,
      "loss": 1.3208,
      "num_input_tokens_seen": 36572823264,
      "step": 46485
    },
    {
      "epoch": 4.931678336516019,
      "grad_norm": 0.6924468332565732,
      "learning_rate": 3.194134880438562e-05,
      "loss": 1.3333,
      "num_input_tokens_seen": 36573609984,
      "step": 46486
    },
    {
      "epoch": 4.931784426055591,
      "grad_norm": 0.534145968227072,
      "learning_rate": 3.1940681158254064e-05,
      "loss": 1.3058,
      "num_input_tokens_seen": 36574396736,
      "step": 46487
    },
    {
      "epoch": 4.931890515595162,
      "grad_norm": 0.6772964335391068,
      "learning_rate": 3.194001350675895e-05,
      "loss": 1.3231,
      "num_input_tokens_seen": 36575183536,
      "step": 46488
    },
    {
      "epoch": 4.931996605134733,
      "grad_norm": 0.47468743632539456,
      "learning_rate": 3.193934584990081e-05,
      "loss": 1.2283,
      "num_input_tokens_seen": 36575970448,
      "step": 46489
    },
    {
      "epoch": 4.932102694674305,
      "grad_norm": 0.5804703004693303,
      "learning_rate": 3.193867818768014e-05,
      "loss": 1.387,
      "num_input_tokens_seen": 36576757232,
      "step": 46490
    },
    {
      "epoch": 4.932208784213876,
      "grad_norm": 0.6143897491694821,
      "learning_rate": 3.193801052009746e-05,
      "loss": 1.4266,
      "num_input_tokens_seen": 36577543952,
      "step": 46491
    },
    {
      "epoch": 4.932314873753448,
      "grad_norm": 0.48720395691363716,
      "learning_rate": 3.19373428471533e-05,
      "loss": 1.3142,
      "num_input_tokens_seen": 36578330704,
      "step": 46492
    },
    {
      "epoch": 4.932420963293019,
      "grad_norm": 0.5021353436531991,
      "learning_rate": 3.193667516884815e-05,
      "loss": 1.2939,
      "num_input_tokens_seen": 36579117440,
      "step": 46493
    },
    {
      "epoch": 4.932527052832591,
      "grad_norm": 0.6047556370129832,
      "learning_rate": 3.193600748518255e-05,
      "loss": 1.3179,
      "num_input_tokens_seen": 36579904288,
      "step": 46494
    },
    {
      "epoch": 4.932633142372162,
      "grad_norm": 0.5057217079371806,
      "learning_rate": 3.1935339796157e-05,
      "loss": 1.2666,
      "num_input_tokens_seen": 36580691056,
      "step": 46495
    },
    {
      "epoch": 4.932739231911733,
      "grad_norm": 0.8527357291912633,
      "learning_rate": 3.193467210177203e-05,
      "loss": 1.397,
      "num_input_tokens_seen": 36581477776,
      "step": 46496
    },
    {
      "epoch": 4.932845321451305,
      "grad_norm": 0.5010442338797781,
      "learning_rate": 3.193400440202815e-05,
      "loss": 1.4167,
      "num_input_tokens_seen": 36582264400,
      "step": 46497
    },
    {
      "epoch": 4.932951410990876,
      "grad_norm": 0.5215402647483586,
      "learning_rate": 3.1933336696925875e-05,
      "loss": 1.3426,
      "num_input_tokens_seen": 36583051056,
      "step": 46498
    },
    {
      "epoch": 4.933057500530448,
      "grad_norm": 0.7142612379494266,
      "learning_rate": 3.1932668986465717e-05,
      "loss": 1.2269,
      "num_input_tokens_seen": 36583837744,
      "step": 46499
    },
    {
      "epoch": 4.933163590070019,
      "grad_norm": 0.5078388999294605,
      "learning_rate": 3.193200127064819e-05,
      "loss": 1.2757,
      "num_input_tokens_seen": 36584624528,
      "step": 46500
    },
    {
      "epoch": 4.933269679609591,
      "grad_norm": 0.6020450396397954,
      "learning_rate": 3.1931333549473824e-05,
      "loss": 1.2278,
      "num_input_tokens_seen": 36585411248,
      "step": 46501
    },
    {
      "epoch": 4.933375769149162,
      "grad_norm": 0.7173070659431661,
      "learning_rate": 3.193066582294312e-05,
      "loss": 1.2927,
      "num_input_tokens_seen": 36586198080,
      "step": 46502
    },
    {
      "epoch": 4.933481858688733,
      "grad_norm": 0.44743447667725655,
      "learning_rate": 3.192999809105661e-05,
      "loss": 1.2542,
      "num_input_tokens_seen": 36586984832,
      "step": 46503
    },
    {
      "epoch": 4.933587948228305,
      "grad_norm": 0.6608261078554971,
      "learning_rate": 3.1929330353814805e-05,
      "loss": 1.2521,
      "num_input_tokens_seen": 36587771616,
      "step": 46504
    },
    {
      "epoch": 4.933694037767876,
      "grad_norm": 0.4784271699657995,
      "learning_rate": 3.19286626112182e-05,
      "loss": 1.2696,
      "num_input_tokens_seen": 36588558384,
      "step": 46505
    },
    {
      "epoch": 4.933800127307448,
      "grad_norm": 0.59325221783438,
      "learning_rate": 3.1927994863267344e-05,
      "loss": 1.4316,
      "num_input_tokens_seen": 36589345152,
      "step": 46506
    },
    {
      "epoch": 4.933906216847019,
      "grad_norm": 0.6311934485920262,
      "learning_rate": 3.192732710996272e-05,
      "loss": 1.295,
      "num_input_tokens_seen": 36590131904,
      "step": 46507
    },
    {
      "epoch": 4.93401230638659,
      "grad_norm": 0.5396845749158427,
      "learning_rate": 3.192665935130487e-05,
      "loss": 1.3733,
      "num_input_tokens_seen": 36590918576,
      "step": 46508
    },
    {
      "epoch": 4.934118395926162,
      "grad_norm": 0.5784261150367035,
      "learning_rate": 3.1925991587294307e-05,
      "loss": 1.2677,
      "num_input_tokens_seen": 36591705360,
      "step": 46509
    },
    {
      "epoch": 4.934224485465733,
      "grad_norm": 0.5532227828328968,
      "learning_rate": 3.192532381793154e-05,
      "loss": 1.2414,
      "num_input_tokens_seen": 36592492128,
      "step": 46510
    },
    {
      "epoch": 4.934330575005305,
      "grad_norm": 0.48978770652059944,
      "learning_rate": 3.1924656043217074e-05,
      "loss": 1.2884,
      "num_input_tokens_seen": 36593278912,
      "step": 46511
    },
    {
      "epoch": 4.934436664544876,
      "grad_norm": 0.6021263567331395,
      "learning_rate": 3.192398826315145e-05,
      "loss": 1.2935,
      "num_input_tokens_seen": 36594065648,
      "step": 46512
    },
    {
      "epoch": 4.934542754084447,
      "grad_norm": 0.5541947255537514,
      "learning_rate": 3.192332047773516e-05,
      "loss": 1.3976,
      "num_input_tokens_seen": 36594852352,
      "step": 46513
    },
    {
      "epoch": 4.934648843624019,
      "grad_norm": 0.6764153499601814,
      "learning_rate": 3.192265268696873e-05,
      "loss": 1.4006,
      "num_input_tokens_seen": 36595639024,
      "step": 46514
    },
    {
      "epoch": 4.93475493316359,
      "grad_norm": 0.511387379776255,
      "learning_rate": 3.192198489085269e-05,
      "loss": 1.3829,
      "num_input_tokens_seen": 36596425856,
      "step": 46515
    },
    {
      "epoch": 4.934861022703162,
      "grad_norm": 0.7245838316867453,
      "learning_rate": 3.192131708938754e-05,
      "loss": 1.322,
      "num_input_tokens_seen": 36597212576,
      "step": 46516
    },
    {
      "epoch": 4.934967112242733,
      "grad_norm": 0.7112328157311556,
      "learning_rate": 3.192064928257379e-05,
      "loss": 1.3993,
      "num_input_tokens_seen": 36597999344,
      "step": 46517
    },
    {
      "epoch": 4.935073201782304,
      "grad_norm": 0.9401529413882631,
      "learning_rate": 3.191998147041197e-05,
      "loss": 1.3429,
      "num_input_tokens_seen": 36598786032,
      "step": 46518
    },
    {
      "epoch": 4.935179291321876,
      "grad_norm": 0.6305022966633211,
      "learning_rate": 3.191931365290259e-05,
      "loss": 1.3023,
      "num_input_tokens_seen": 36599572752,
      "step": 46519
    },
    {
      "epoch": 4.935285380861447,
      "grad_norm": 0.6994401994239249,
      "learning_rate": 3.191864583004618e-05,
      "loss": 1.4062,
      "num_input_tokens_seen": 36600359456,
      "step": 46520
    },
    {
      "epoch": 4.935391470401019,
      "grad_norm": 0.47994123371101216,
      "learning_rate": 3.1917978001843227e-05,
      "loss": 1.2361,
      "num_input_tokens_seen": 36601146272,
      "step": 46521
    },
    {
      "epoch": 4.93549755994059,
      "grad_norm": 0.6510110294643842,
      "learning_rate": 3.191731016829427e-05,
      "loss": 1.2625,
      "num_input_tokens_seen": 36601933184,
      "step": 46522
    },
    {
      "epoch": 4.935603649480162,
      "grad_norm": 0.6023098785834479,
      "learning_rate": 3.191664232939982e-05,
      "loss": 1.2028,
      "num_input_tokens_seen": 36602719952,
      "step": 46523
    },
    {
      "epoch": 4.935709739019733,
      "grad_norm": 0.48952425409072603,
      "learning_rate": 3.1915974485160394e-05,
      "loss": 1.2793,
      "num_input_tokens_seen": 36603506720,
      "step": 46524
    },
    {
      "epoch": 4.935815828559304,
      "grad_norm": 0.6703680691808466,
      "learning_rate": 3.19153066355765e-05,
      "loss": 1.217,
      "num_input_tokens_seen": 36604293520,
      "step": 46525
    },
    {
      "epoch": 4.935921918098876,
      "grad_norm": 0.6677440048213618,
      "learning_rate": 3.191463878064866e-05,
      "loss": 1.2465,
      "num_input_tokens_seen": 36605080336,
      "step": 46526
    },
    {
      "epoch": 4.936028007638447,
      "grad_norm": 0.5535740631386735,
      "learning_rate": 3.191397092037739e-05,
      "loss": 1.3346,
      "num_input_tokens_seen": 36605867008,
      "step": 46527
    },
    {
      "epoch": 4.9361340971780185,
      "grad_norm": 0.7313359897099748,
      "learning_rate": 3.191330305476321e-05,
      "loss": 1.3637,
      "num_input_tokens_seen": 36606653696,
      "step": 46528
    },
    {
      "epoch": 4.93624018671759,
      "grad_norm": 0.6705318483026702,
      "learning_rate": 3.191263518380663e-05,
      "loss": 1.3635,
      "num_input_tokens_seen": 36607440416,
      "step": 46529
    },
    {
      "epoch": 4.9363462762571615,
      "grad_norm": 0.5932677270489244,
      "learning_rate": 3.1911967307508175e-05,
      "loss": 1.3906,
      "num_input_tokens_seen": 36608227232,
      "step": 46530
    },
    {
      "epoch": 4.9364523657967325,
      "grad_norm": 0.6395019846917933,
      "learning_rate": 3.191129942586834e-05,
      "loss": 1.3591,
      "num_input_tokens_seen": 36609013968,
      "step": 46531
    },
    {
      "epoch": 4.9365584553363036,
      "grad_norm": 0.5759226371846237,
      "learning_rate": 3.191063153888767e-05,
      "loss": 1.3769,
      "num_input_tokens_seen": 36609800752,
      "step": 46532
    },
    {
      "epoch": 4.9366645448758755,
      "grad_norm": 0.5143436543031261,
      "learning_rate": 3.190996364656666e-05,
      "loss": 1.3415,
      "num_input_tokens_seen": 36610587536,
      "step": 46533
    },
    {
      "epoch": 4.9367706344154465,
      "grad_norm": 0.6142339261533418,
      "learning_rate": 3.190929574890583e-05,
      "loss": 1.2711,
      "num_input_tokens_seen": 36611374400,
      "step": 46534
    },
    {
      "epoch": 4.936876723955018,
      "grad_norm": 0.5864549276465364,
      "learning_rate": 3.190862784590571e-05,
      "loss": 1.1901,
      "num_input_tokens_seen": 36612161168,
      "step": 46535
    },
    {
      "epoch": 4.9369828134945895,
      "grad_norm": 0.5017112773542736,
      "learning_rate": 3.190795993756679e-05,
      "loss": 1.3514,
      "num_input_tokens_seen": 36612947856,
      "step": 46536
    },
    {
      "epoch": 4.9370889030341605,
      "grad_norm": 0.5739617664524239,
      "learning_rate": 3.190729202388961e-05,
      "loss": 1.3093,
      "num_input_tokens_seen": 36613734624,
      "step": 46537
    },
    {
      "epoch": 4.937194992573732,
      "grad_norm": 0.8304813222654727,
      "learning_rate": 3.190662410487468e-05,
      "loss": 1.4013,
      "num_input_tokens_seen": 36614521328,
      "step": 46538
    },
    {
      "epoch": 4.937301082113303,
      "grad_norm": 0.564067878663582,
      "learning_rate": 3.19059561805225e-05,
      "loss": 1.2749,
      "num_input_tokens_seen": 36615308160,
      "step": 46539
    },
    {
      "epoch": 4.937407171652875,
      "grad_norm": 0.5801305069552868,
      "learning_rate": 3.190528825083362e-05,
      "loss": 1.2984,
      "num_input_tokens_seen": 36616094896,
      "step": 46540
    },
    {
      "epoch": 4.937513261192446,
      "grad_norm": 0.483836123421359,
      "learning_rate": 3.1904620315808524e-05,
      "loss": 1.3006,
      "num_input_tokens_seen": 36616881584,
      "step": 46541
    },
    {
      "epoch": 4.937619350732017,
      "grad_norm": 0.6025354550450233,
      "learning_rate": 3.190395237544774e-05,
      "loss": 1.3153,
      "num_input_tokens_seen": 36617668400,
      "step": 46542
    },
    {
      "epoch": 4.937725440271589,
      "grad_norm": 0.5062462226071711,
      "learning_rate": 3.190328442975179e-05,
      "loss": 1.1608,
      "num_input_tokens_seen": 36618455344,
      "step": 46543
    },
    {
      "epoch": 4.93783152981116,
      "grad_norm": 0.4838274876810129,
      "learning_rate": 3.190261647872118e-05,
      "loss": 1.364,
      "num_input_tokens_seen": 36619242176,
      "step": 46544
    },
    {
      "epoch": 4.937937619350732,
      "grad_norm": 0.5470489723274607,
      "learning_rate": 3.190194852235643e-05,
      "loss": 1.2419,
      "num_input_tokens_seen": 36620028848,
      "step": 46545
    },
    {
      "epoch": 4.938043708890303,
      "grad_norm": 0.5825062891545848,
      "learning_rate": 3.190128056065805e-05,
      "loss": 1.304,
      "num_input_tokens_seen": 36620815600,
      "step": 46546
    },
    {
      "epoch": 4.938149798429874,
      "grad_norm": 0.5142361237807137,
      "learning_rate": 3.190061259362658e-05,
      "loss": 1.254,
      "num_input_tokens_seen": 36621602432,
      "step": 46547
    },
    {
      "epoch": 4.938255887969446,
      "grad_norm": 0.5312087693597056,
      "learning_rate": 3.18999446212625e-05,
      "loss": 1.2898,
      "num_input_tokens_seen": 36622389168,
      "step": 46548
    },
    {
      "epoch": 4.938361977509017,
      "grad_norm": 0.5786166536812699,
      "learning_rate": 3.189927664356636e-05,
      "loss": 1.4129,
      "num_input_tokens_seen": 36623175808,
      "step": 46549
    },
    {
      "epoch": 4.938468067048589,
      "grad_norm": 0.5468410712883535,
      "learning_rate": 3.1898608660538656e-05,
      "loss": 1.3282,
      "num_input_tokens_seen": 36623962576,
      "step": 46550
    },
    {
      "epoch": 4.93857415658816,
      "grad_norm": 0.551089690108308,
      "learning_rate": 3.18979406721799e-05,
      "loss": 1.307,
      "num_input_tokens_seen": 36624749392,
      "step": 46551
    },
    {
      "epoch": 4.938680246127732,
      "grad_norm": 0.5242500877717977,
      "learning_rate": 3.189727267849063e-05,
      "loss": 1.2971,
      "num_input_tokens_seen": 36625536176,
      "step": 46552
    },
    {
      "epoch": 4.938786335667303,
      "grad_norm": 0.49690187994108237,
      "learning_rate": 3.189660467947135e-05,
      "loss": 1.3146,
      "num_input_tokens_seen": 36626322944,
      "step": 46553
    },
    {
      "epoch": 4.938892425206874,
      "grad_norm": 0.5333298988424696,
      "learning_rate": 3.1895936675122575e-05,
      "loss": 1.3179,
      "num_input_tokens_seen": 36627109696,
      "step": 46554
    },
    {
      "epoch": 4.938998514746446,
      "grad_norm": 0.5136185264110285,
      "learning_rate": 3.1895268665444816e-05,
      "loss": 1.2712,
      "num_input_tokens_seen": 36627896448,
      "step": 46555
    },
    {
      "epoch": 4.939104604286017,
      "grad_norm": 0.5989045018134233,
      "learning_rate": 3.1894600650438604e-05,
      "loss": 1.4218,
      "num_input_tokens_seen": 36628683248,
      "step": 46556
    },
    {
      "epoch": 4.939210693825589,
      "grad_norm": 0.5445249201978708,
      "learning_rate": 3.189393263010444e-05,
      "loss": 1.2315,
      "num_input_tokens_seen": 36629470048,
      "step": 46557
    },
    {
      "epoch": 4.93931678336516,
      "grad_norm": 0.6139824858889456,
      "learning_rate": 3.189326460444285e-05,
      "loss": 1.3563,
      "num_input_tokens_seen": 36630256768,
      "step": 46558
    },
    {
      "epoch": 4.939422872904732,
      "grad_norm": 0.4883167890230076,
      "learning_rate": 3.1892596573454345e-05,
      "loss": 1.3176,
      "num_input_tokens_seen": 36631043552,
      "step": 46559
    },
    {
      "epoch": 4.939528962444303,
      "grad_norm": 0.6055334578528767,
      "learning_rate": 3.1891928537139454e-05,
      "loss": 1.2758,
      "num_input_tokens_seen": 36631830304,
      "step": 46560
    },
    {
      "epoch": 4.939635051983874,
      "grad_norm": 0.5090990487278412,
      "learning_rate": 3.1891260495498677e-05,
      "loss": 1.287,
      "num_input_tokens_seen": 36632617056,
      "step": 46561
    },
    {
      "epoch": 4.939741141523446,
      "grad_norm": 0.503412757906495,
      "learning_rate": 3.189059244853253e-05,
      "loss": 1.3127,
      "num_input_tokens_seen": 36633403792,
      "step": 46562
    },
    {
      "epoch": 4.939847231063017,
      "grad_norm": 0.5435462998340225,
      "learning_rate": 3.1889924396241545e-05,
      "loss": 1.3037,
      "num_input_tokens_seen": 36634190608,
      "step": 46563
    },
    {
      "epoch": 4.939953320602589,
      "grad_norm": 0.5302467020614684,
      "learning_rate": 3.188925633862622e-05,
      "loss": 1.398,
      "num_input_tokens_seen": 36634977360,
      "step": 46564
    },
    {
      "epoch": 4.94005941014216,
      "grad_norm": 0.5366655610136282,
      "learning_rate": 3.188858827568708e-05,
      "loss": 1.3246,
      "num_input_tokens_seen": 36635764192,
      "step": 46565
    },
    {
      "epoch": 4.940165499681731,
      "grad_norm": 0.630920092405135,
      "learning_rate": 3.188792020742465e-05,
      "loss": 1.3592,
      "num_input_tokens_seen": 36636550912,
      "step": 46566
    },
    {
      "epoch": 4.940271589221303,
      "grad_norm": 0.6020392975800368,
      "learning_rate": 3.1887252133839436e-05,
      "loss": 1.35,
      "num_input_tokens_seen": 36637337664,
      "step": 46567
    },
    {
      "epoch": 4.940377678760874,
      "grad_norm": 0.5787640082632571,
      "learning_rate": 3.188658405493195e-05,
      "loss": 1.2563,
      "num_input_tokens_seen": 36638124384,
      "step": 46568
    },
    {
      "epoch": 4.940483768300446,
      "grad_norm": 0.5489383378692104,
      "learning_rate": 3.188591597070271e-05,
      "loss": 1.2976,
      "num_input_tokens_seen": 36638911152,
      "step": 46569
    },
    {
      "epoch": 4.940589857840017,
      "grad_norm": 0.6059196157221329,
      "learning_rate": 3.188524788115225e-05,
      "loss": 1.36,
      "num_input_tokens_seen": 36639697808,
      "step": 46570
    },
    {
      "epoch": 4.940695947379588,
      "grad_norm": 0.5415255247471136,
      "learning_rate": 3.188457978628105e-05,
      "loss": 1.3472,
      "num_input_tokens_seen": 36640484688,
      "step": 46571
    },
    {
      "epoch": 4.94080203691916,
      "grad_norm": 0.6736312518349047,
      "learning_rate": 3.188391168608967e-05,
      "loss": 1.3576,
      "num_input_tokens_seen": 36641271536,
      "step": 46572
    },
    {
      "epoch": 4.940908126458731,
      "grad_norm": 0.5056865784320826,
      "learning_rate": 3.1883243580578606e-05,
      "loss": 1.3174,
      "num_input_tokens_seen": 36642058256,
      "step": 46573
    },
    {
      "epoch": 4.941014215998303,
      "grad_norm": 0.5447018330145522,
      "learning_rate": 3.1882575469748355e-05,
      "loss": 1.333,
      "num_input_tokens_seen": 36642844960,
      "step": 46574
    },
    {
      "epoch": 4.941120305537874,
      "grad_norm": 0.5288631689551963,
      "learning_rate": 3.188190735359946e-05,
      "loss": 1.3105,
      "num_input_tokens_seen": 36643631744,
      "step": 46575
    },
    {
      "epoch": 4.941226395077445,
      "grad_norm": 0.58379091043748,
      "learning_rate": 3.188123923213243e-05,
      "loss": 1.3626,
      "num_input_tokens_seen": 36644418544,
      "step": 46576
    },
    {
      "epoch": 4.941332484617017,
      "grad_norm": 0.4709575282802028,
      "learning_rate": 3.1880571105347787e-05,
      "loss": 1.287,
      "num_input_tokens_seen": 36645205232,
      "step": 46577
    },
    {
      "epoch": 4.941438574156588,
      "grad_norm": 0.45348612014940176,
      "learning_rate": 3.187990297324603e-05,
      "loss": 1.2258,
      "num_input_tokens_seen": 36645992016,
      "step": 46578
    },
    {
      "epoch": 4.94154466369616,
      "grad_norm": 0.5981495014528235,
      "learning_rate": 3.1879234835827695e-05,
      "loss": 1.1553,
      "num_input_tokens_seen": 36646778848,
      "step": 46579
    },
    {
      "epoch": 4.941650753235731,
      "grad_norm": 0.5337203949048159,
      "learning_rate": 3.1878566693093285e-05,
      "loss": 1.3291,
      "num_input_tokens_seen": 36647565664,
      "step": 46580
    },
    {
      "epoch": 4.941756842775303,
      "grad_norm": 0.6454719817154613,
      "learning_rate": 3.187789854504332e-05,
      "loss": 1.3281,
      "num_input_tokens_seen": 36648352480,
      "step": 46581
    },
    {
      "epoch": 4.941862932314874,
      "grad_norm": 0.6090504875662033,
      "learning_rate": 3.187723039167832e-05,
      "loss": 1.376,
      "num_input_tokens_seen": 36649139248,
      "step": 46582
    },
    {
      "epoch": 4.941969021854446,
      "grad_norm": 0.7846004706830617,
      "learning_rate": 3.187656223299879e-05,
      "loss": 1.3022,
      "num_input_tokens_seen": 36649925984,
      "step": 46583
    },
    {
      "epoch": 4.942075111394017,
      "grad_norm": 0.5069622097304775,
      "learning_rate": 3.187589406900526e-05,
      "loss": 1.3242,
      "num_input_tokens_seen": 36650712816,
      "step": 46584
    },
    {
      "epoch": 4.942181200933588,
      "grad_norm": 0.4745270970458143,
      "learning_rate": 3.187522589969824e-05,
      "loss": 1.2692,
      "num_input_tokens_seen": 36651499616,
      "step": 46585
    },
    {
      "epoch": 4.94228729047316,
      "grad_norm": 0.5319439635113594,
      "learning_rate": 3.187455772507825e-05,
      "loss": 1.3122,
      "num_input_tokens_seen": 36652286288,
      "step": 46586
    },
    {
      "epoch": 4.942393380012731,
      "grad_norm": 0.5145839132270668,
      "learning_rate": 3.18738895451458e-05,
      "loss": 1.3757,
      "num_input_tokens_seen": 36653072992,
      "step": 46587
    },
    {
      "epoch": 4.942499469552303,
      "grad_norm": 0.460693080252657,
      "learning_rate": 3.1873221359901415e-05,
      "loss": 1.2444,
      "num_input_tokens_seen": 36653859712,
      "step": 46588
    },
    {
      "epoch": 4.942605559091874,
      "grad_norm": 0.5960583945797892,
      "learning_rate": 3.18725531693456e-05,
      "loss": 1.362,
      "num_input_tokens_seen": 36654646496,
      "step": 46589
    },
    {
      "epoch": 4.942711648631445,
      "grad_norm": 0.686397557218301,
      "learning_rate": 3.1871884973478885e-05,
      "loss": 1.3801,
      "num_input_tokens_seen": 36655433312,
      "step": 46590
    },
    {
      "epoch": 4.9428177381710166,
      "grad_norm": 0.6166930425880592,
      "learning_rate": 3.187121677230176e-05,
      "loss": 1.2443,
      "num_input_tokens_seen": 36656220176,
      "step": 46591
    },
    {
      "epoch": 4.942923827710588,
      "grad_norm": 0.6805340554498023,
      "learning_rate": 3.187054856581479e-05,
      "loss": 1.2913,
      "num_input_tokens_seen": 36657006960,
      "step": 46592
    },
    {
      "epoch": 4.9430299172501595,
      "grad_norm": 0.5626778746485286,
      "learning_rate": 3.186988035401843e-05,
      "loss": 1.3029,
      "num_input_tokens_seen": 36657793792,
      "step": 46593
    },
    {
      "epoch": 4.9431360067897305,
      "grad_norm": 0.583252416053425,
      "learning_rate": 3.186921213691325e-05,
      "loss": 1.3142,
      "num_input_tokens_seen": 36658580528,
      "step": 46594
    },
    {
      "epoch": 4.943242096329302,
      "grad_norm": 0.5213546109794777,
      "learning_rate": 3.186854391449973e-05,
      "loss": 1.2426,
      "num_input_tokens_seen": 36659367264,
      "step": 46595
    },
    {
      "epoch": 4.9433481858688735,
      "grad_norm": 0.5497329181239913,
      "learning_rate": 3.186787568677841e-05,
      "loss": 1.2821,
      "num_input_tokens_seen": 36660154032,
      "step": 46596
    },
    {
      "epoch": 4.9434542754084445,
      "grad_norm": 0.5402683104439087,
      "learning_rate": 3.1867207453749795e-05,
      "loss": 1.238,
      "num_input_tokens_seen": 36660940736,
      "step": 46597
    },
    {
      "epoch": 4.943560364948016,
      "grad_norm": 0.6132993096721502,
      "learning_rate": 3.186653921541441e-05,
      "loss": 1.4557,
      "num_input_tokens_seen": 36661727568,
      "step": 46598
    },
    {
      "epoch": 4.9436664544875875,
      "grad_norm": 0.6166532101253704,
      "learning_rate": 3.186587097177276e-05,
      "loss": 1.2673,
      "num_input_tokens_seen": 36662514368,
      "step": 46599
    },
    {
      "epoch": 4.9437725440271585,
      "grad_norm": 0.6527368812173082,
      "learning_rate": 3.186520272282536e-05,
      "loss": 1.3498,
      "num_input_tokens_seen": 36663301184,
      "step": 46600
    },
    {
      "epoch": 4.94387863356673,
      "grad_norm": 0.79526402436271,
      "learning_rate": 3.1864534468572744e-05,
      "loss": 1.2808,
      "num_input_tokens_seen": 36664087904,
      "step": 46601
    },
    {
      "epoch": 4.943984723106301,
      "grad_norm": 0.4968211361962882,
      "learning_rate": 3.186386620901541e-05,
      "loss": 1.2414,
      "num_input_tokens_seen": 36664874704,
      "step": 46602
    },
    {
      "epoch": 4.944090812645873,
      "grad_norm": 0.8478095999579558,
      "learning_rate": 3.186319794415388e-05,
      "loss": 1.2732,
      "num_input_tokens_seen": 36665661408,
      "step": 46603
    },
    {
      "epoch": 4.944196902185444,
      "grad_norm": 0.6653712292140203,
      "learning_rate": 3.1862529673988685e-05,
      "loss": 1.307,
      "num_input_tokens_seen": 36666448144,
      "step": 46604
    },
    {
      "epoch": 4.944302991725015,
      "grad_norm": 0.5505795936748932,
      "learning_rate": 3.186186139852031e-05,
      "loss": 1.3595,
      "num_input_tokens_seen": 36667234880,
      "step": 46605
    },
    {
      "epoch": 4.944409081264587,
      "grad_norm": 0.8999042806565514,
      "learning_rate": 3.18611931177493e-05,
      "loss": 1.3365,
      "num_input_tokens_seen": 36668021728,
      "step": 46606
    },
    {
      "epoch": 4.944515170804158,
      "grad_norm": 0.5095620861742145,
      "learning_rate": 3.186052483167616e-05,
      "loss": 1.2078,
      "num_input_tokens_seen": 36668808512,
      "step": 46607
    },
    {
      "epoch": 4.94462126034373,
      "grad_norm": 0.6507229093792847,
      "learning_rate": 3.185985654030141e-05,
      "loss": 1.3149,
      "num_input_tokens_seen": 36669595280,
      "step": 46608
    },
    {
      "epoch": 4.944727349883301,
      "grad_norm": 0.9987793826849163,
      "learning_rate": 3.1859188243625556e-05,
      "loss": 1.3535,
      "num_input_tokens_seen": 36670382096,
      "step": 46609
    },
    {
      "epoch": 4.944833439422873,
      "grad_norm": 0.8679079120315352,
      "learning_rate": 3.1858519941649135e-05,
      "loss": 1.3074,
      "num_input_tokens_seen": 36671168880,
      "step": 46610
    },
    {
      "epoch": 4.944939528962444,
      "grad_norm": 1.0576090306545785,
      "learning_rate": 3.1857851634372645e-05,
      "loss": 1.2939,
      "num_input_tokens_seen": 36671955552,
      "step": 46611
    },
    {
      "epoch": 4.945045618502016,
      "grad_norm": 0.5499421757743308,
      "learning_rate": 3.185718332179661e-05,
      "loss": 1.2858,
      "num_input_tokens_seen": 36672742256,
      "step": 46612
    },
    {
      "epoch": 4.945151708041587,
      "grad_norm": 0.8314137277817697,
      "learning_rate": 3.1856515003921536e-05,
      "loss": 1.2965,
      "num_input_tokens_seen": 36673528976,
      "step": 46613
    },
    {
      "epoch": 4.945257797581158,
      "grad_norm": 0.6686416694820976,
      "learning_rate": 3.185584668074796e-05,
      "loss": 1.2525,
      "num_input_tokens_seen": 36674315712,
      "step": 46614
    },
    {
      "epoch": 4.94536388712073,
      "grad_norm": 0.6135254622051314,
      "learning_rate": 3.185517835227638e-05,
      "loss": 1.314,
      "num_input_tokens_seen": 36675102512,
      "step": 46615
    },
    {
      "epoch": 4.945469976660301,
      "grad_norm": 0.8175382911294872,
      "learning_rate": 3.185451001850732e-05,
      "loss": 1.2994,
      "num_input_tokens_seen": 36675889232,
      "step": 46616
    },
    {
      "epoch": 4.945576066199873,
      "grad_norm": 0.8260020864830924,
      "learning_rate": 3.18538416794413e-05,
      "loss": 1.3725,
      "num_input_tokens_seen": 36676675920,
      "step": 46617
    },
    {
      "epoch": 4.945682155739444,
      "grad_norm": 0.49445294108741705,
      "learning_rate": 3.185317333507883e-05,
      "loss": 1.1677,
      "num_input_tokens_seen": 36677462720,
      "step": 46618
    },
    {
      "epoch": 4.945788245279015,
      "grad_norm": 0.8829117184856147,
      "learning_rate": 3.185250498542042e-05,
      "loss": 1.2453,
      "num_input_tokens_seen": 36678249440,
      "step": 46619
    },
    {
      "epoch": 4.945894334818587,
      "grad_norm": 0.6601525722359697,
      "learning_rate": 3.185183663046661e-05,
      "loss": 1.344,
      "num_input_tokens_seen": 36679036144,
      "step": 46620
    },
    {
      "epoch": 4.946000424358158,
      "grad_norm": 0.5288774237472679,
      "learning_rate": 3.185116827021789e-05,
      "loss": 1.1858,
      "num_input_tokens_seen": 36679822976,
      "step": 46621
    },
    {
      "epoch": 4.94610651389773,
      "grad_norm": 0.8457240801128517,
      "learning_rate": 3.18504999046748e-05,
      "loss": 1.2893,
      "num_input_tokens_seen": 36680609728,
      "step": 46622
    },
    {
      "epoch": 4.946212603437301,
      "grad_norm": 0.5630049988791271,
      "learning_rate": 3.184983153383784e-05,
      "loss": 1.2257,
      "num_input_tokens_seen": 36681396448,
      "step": 46623
    },
    {
      "epoch": 4.946318692976872,
      "grad_norm": 0.6507373264783666,
      "learning_rate": 3.184916315770753e-05,
      "loss": 1.2553,
      "num_input_tokens_seen": 36682183264,
      "step": 46624
    },
    {
      "epoch": 4.946424782516444,
      "grad_norm": 0.7830970665917925,
      "learning_rate": 3.184849477628438e-05,
      "loss": 1.4017,
      "num_input_tokens_seen": 36682970064,
      "step": 46625
    },
    {
      "epoch": 4.946530872056015,
      "grad_norm": 0.6646164870323933,
      "learning_rate": 3.1847826389568926e-05,
      "loss": 1.349,
      "num_input_tokens_seen": 36683756864,
      "step": 46626
    },
    {
      "epoch": 4.946636961595587,
      "grad_norm": 0.9083909324248292,
      "learning_rate": 3.1847157997561664e-05,
      "loss": 1.3062,
      "num_input_tokens_seen": 36684543632,
      "step": 46627
    },
    {
      "epoch": 4.946743051135158,
      "grad_norm": 0.6084566224810141,
      "learning_rate": 3.184648960026312e-05,
      "loss": 1.2303,
      "num_input_tokens_seen": 36685330320,
      "step": 46628
    },
    {
      "epoch": 4.946849140674729,
      "grad_norm": 0.5865701751036788,
      "learning_rate": 3.184582119767382e-05,
      "loss": 1.2674,
      "num_input_tokens_seen": 36686117088,
      "step": 46629
    },
    {
      "epoch": 4.946955230214301,
      "grad_norm": 0.8626976340975937,
      "learning_rate": 3.184515278979426e-05,
      "loss": 1.2011,
      "num_input_tokens_seen": 36686903840,
      "step": 46630
    },
    {
      "epoch": 4.947061319753872,
      "grad_norm": 0.5894916720572688,
      "learning_rate": 3.1844484376624966e-05,
      "loss": 1.313,
      "num_input_tokens_seen": 36687690544,
      "step": 46631
    },
    {
      "epoch": 4.947167409293444,
      "grad_norm": 0.5690600522856958,
      "learning_rate": 3.1843815958166464e-05,
      "loss": 1.2859,
      "num_input_tokens_seen": 36688477312,
      "step": 46632
    },
    {
      "epoch": 4.947273498833015,
      "grad_norm": 0.7497945843332913,
      "learning_rate": 3.184314753441926e-05,
      "loss": 1.4377,
      "num_input_tokens_seen": 36689264064,
      "step": 46633
    },
    {
      "epoch": 4.947379588372587,
      "grad_norm": 0.598918057853543,
      "learning_rate": 3.184247910538386e-05,
      "loss": 1.3787,
      "num_input_tokens_seen": 36690050816,
      "step": 46634
    },
    {
      "epoch": 4.947485677912158,
      "grad_norm": 0.6475513608576131,
      "learning_rate": 3.184181067106081e-05,
      "loss": 1.3372,
      "num_input_tokens_seen": 36690837600,
      "step": 46635
    },
    {
      "epoch": 4.947591767451729,
      "grad_norm": 0.5913409876390634,
      "learning_rate": 3.184114223145059e-05,
      "loss": 1.291,
      "num_input_tokens_seen": 36691624320,
      "step": 46636
    },
    {
      "epoch": 4.947697856991301,
      "grad_norm": 0.6313522554988931,
      "learning_rate": 3.184047378655375e-05,
      "loss": 1.3756,
      "num_input_tokens_seen": 36692411136,
      "step": 46637
    },
    {
      "epoch": 4.947803946530872,
      "grad_norm": 0.716175097442507,
      "learning_rate": 3.18398053363708e-05,
      "loss": 1.3033,
      "num_input_tokens_seen": 36693197920,
      "step": 46638
    },
    {
      "epoch": 4.947910036070444,
      "grad_norm": 0.869962234103667,
      "learning_rate": 3.1839136880902234e-05,
      "loss": 1.4161,
      "num_input_tokens_seen": 36693984624,
      "step": 46639
    },
    {
      "epoch": 4.948016125610015,
      "grad_norm": 0.5285691002673506,
      "learning_rate": 3.1838468420148585e-05,
      "loss": 1.278,
      "num_input_tokens_seen": 36694771520,
      "step": 46640
    },
    {
      "epoch": 4.948122215149587,
      "grad_norm": 0.6806951202431907,
      "learning_rate": 3.183779995411038e-05,
      "loss": 1.1349,
      "num_input_tokens_seen": 36695558384,
      "step": 46641
    },
    {
      "epoch": 4.948228304689158,
      "grad_norm": 0.664000330180633,
      "learning_rate": 3.1837131482788104e-05,
      "loss": 1.204,
      "num_input_tokens_seen": 36696345120,
      "step": 46642
    },
    {
      "epoch": 4.948334394228729,
      "grad_norm": 0.6706416148205018,
      "learning_rate": 3.183646300618231e-05,
      "loss": 1.4037,
      "num_input_tokens_seen": 36697131920,
      "step": 46643
    },
    {
      "epoch": 4.948440483768301,
      "grad_norm": 0.6216514757713798,
      "learning_rate": 3.1835794524293494e-05,
      "loss": 1.2781,
      "num_input_tokens_seen": 36697918736,
      "step": 46644
    },
    {
      "epoch": 4.948546573307872,
      "grad_norm": 1.0635315385000037,
      "learning_rate": 3.183512603712217e-05,
      "loss": 1.3141,
      "num_input_tokens_seen": 36698705520,
      "step": 46645
    },
    {
      "epoch": 4.948652662847444,
      "grad_norm": 0.5849816800758955,
      "learning_rate": 3.1834457544668874e-05,
      "loss": 1.2588,
      "num_input_tokens_seen": 36699492192,
      "step": 46646
    },
    {
      "epoch": 4.948758752387015,
      "grad_norm": 0.6050262431669908,
      "learning_rate": 3.1833789046934106e-05,
      "loss": 1.2936,
      "num_input_tokens_seen": 36700278896,
      "step": 46647
    },
    {
      "epoch": 4.948864841926586,
      "grad_norm": 1.0202160218708742,
      "learning_rate": 3.183312054391838e-05,
      "loss": 1.2177,
      "num_input_tokens_seen": 36701065696,
      "step": 46648
    },
    {
      "epoch": 4.948970931466158,
      "grad_norm": 0.482000373459161,
      "learning_rate": 3.183245203562222e-05,
      "loss": 1.1684,
      "num_input_tokens_seen": 36701852560,
      "step": 46649
    },
    {
      "epoch": 4.949077021005729,
      "grad_norm": 0.5638703082930024,
      "learning_rate": 3.183178352204614e-05,
      "loss": 1.211,
      "num_input_tokens_seen": 36702639376,
      "step": 46650
    },
    {
      "epoch": 4.949183110545301,
      "grad_norm": 0.7268512422393724,
      "learning_rate": 3.183111500319067e-05,
      "loss": 1.2485,
      "num_input_tokens_seen": 36703426144,
      "step": 46651
    },
    {
      "epoch": 4.949289200084872,
      "grad_norm": 0.6107870136046322,
      "learning_rate": 3.18304464790563e-05,
      "loss": 1.2837,
      "num_input_tokens_seen": 36704212960,
      "step": 46652
    },
    {
      "epoch": 4.949395289624443,
      "grad_norm": 0.48271946185897796,
      "learning_rate": 3.182977794964358e-05,
      "loss": 1.2433,
      "num_input_tokens_seen": 36704999664,
      "step": 46653
    },
    {
      "epoch": 4.949501379164015,
      "grad_norm": 0.6430570783543785,
      "learning_rate": 3.1829109414952985e-05,
      "loss": 1.305,
      "num_input_tokens_seen": 36705786464,
      "step": 46654
    },
    {
      "epoch": 4.949607468703586,
      "grad_norm": 0.5514901720333145,
      "learning_rate": 3.1828440874985066e-05,
      "loss": 1.238,
      "num_input_tokens_seen": 36706573248,
      "step": 46655
    },
    {
      "epoch": 4.9497135582431575,
      "grad_norm": 0.5178019786621484,
      "learning_rate": 3.182777232974033e-05,
      "loss": 1.2755,
      "num_input_tokens_seen": 36707359920,
      "step": 46656
    },
    {
      "epoch": 4.9498196477827285,
      "grad_norm": 0.5529544056641008,
      "learning_rate": 3.182710377921929e-05,
      "loss": 1.3189,
      "num_input_tokens_seen": 36708146672,
      "step": 46657
    },
    {
      "epoch": 4.9499257373223,
      "grad_norm": 0.5056542129076896,
      "learning_rate": 3.182643522342246e-05,
      "loss": 1.2884,
      "num_input_tokens_seen": 36708933504,
      "step": 46658
    },
    {
      "epoch": 4.9500318268618715,
      "grad_norm": 0.4990561851767588,
      "learning_rate": 3.182576666235037e-05,
      "loss": 1.2697,
      "num_input_tokens_seen": 36709720384,
      "step": 46659
    },
    {
      "epoch": 4.9501379164014425,
      "grad_norm": 0.5788901278913219,
      "learning_rate": 3.1825098096003516e-05,
      "loss": 1.2685,
      "num_input_tokens_seen": 36710507120,
      "step": 46660
    },
    {
      "epoch": 4.950244005941014,
      "grad_norm": 0.587648584849696,
      "learning_rate": 3.182442952438244e-05,
      "loss": 1.2074,
      "num_input_tokens_seen": 36711293904,
      "step": 46661
    },
    {
      "epoch": 4.9503500954805855,
      "grad_norm": 0.5112734036038604,
      "learning_rate": 3.1823760947487635e-05,
      "loss": 1.3082,
      "num_input_tokens_seen": 36712080624,
      "step": 46662
    },
    {
      "epoch": 4.950456185020157,
      "grad_norm": 0.5636431360977127,
      "learning_rate": 3.1823092365319633e-05,
      "loss": 1.3176,
      "num_input_tokens_seen": 36712867360,
      "step": 46663
    },
    {
      "epoch": 4.950562274559728,
      "grad_norm": 0.548189922883955,
      "learning_rate": 3.1822423777878946e-05,
      "loss": 1.4196,
      "num_input_tokens_seen": 36713654096,
      "step": 46664
    },
    {
      "epoch": 4.9506683640992994,
      "grad_norm": 0.5138855254418665,
      "learning_rate": 3.182175518516608e-05,
      "loss": 1.3843,
      "num_input_tokens_seen": 36714440864,
      "step": 46665
    },
    {
      "epoch": 4.950774453638871,
      "grad_norm": 0.513759035096677,
      "learning_rate": 3.182108658718158e-05,
      "loss": 1.2598,
      "num_input_tokens_seen": 36715227632,
      "step": 46666
    },
    {
      "epoch": 4.950880543178442,
      "grad_norm": 0.4718408919856514,
      "learning_rate": 3.182041798392593e-05,
      "loss": 1.3131,
      "num_input_tokens_seen": 36716014288,
      "step": 46667
    },
    {
      "epoch": 4.950986632718014,
      "grad_norm": 0.5715218564447332,
      "learning_rate": 3.1819749375399666e-05,
      "loss": 1.3754,
      "num_input_tokens_seen": 36716800992,
      "step": 46668
    },
    {
      "epoch": 4.951092722257585,
      "grad_norm": 0.6024413379120355,
      "learning_rate": 3.18190807616033e-05,
      "loss": 1.3452,
      "num_input_tokens_seen": 36717587696,
      "step": 46669
    },
    {
      "epoch": 4.951198811797157,
      "grad_norm": 0.5544093795793498,
      "learning_rate": 3.181841214253735e-05,
      "loss": 1.3753,
      "num_input_tokens_seen": 36718374480,
      "step": 46670
    },
    {
      "epoch": 4.951304901336728,
      "grad_norm": 0.550309352553432,
      "learning_rate": 3.1817743518202326e-05,
      "loss": 1.2845,
      "num_input_tokens_seen": 36719161216,
      "step": 46671
    },
    {
      "epoch": 4.951410990876299,
      "grad_norm": 0.4996653364644357,
      "learning_rate": 3.181707488859875e-05,
      "loss": 1.341,
      "num_input_tokens_seen": 36719948032,
      "step": 46672
    },
    {
      "epoch": 4.951517080415871,
      "grad_norm": 0.5269451117245174,
      "learning_rate": 3.1816406253727146e-05,
      "loss": 1.3224,
      "num_input_tokens_seen": 36720734864,
      "step": 46673
    },
    {
      "epoch": 4.951623169955442,
      "grad_norm": 0.523763665883713,
      "learning_rate": 3.181573761358801e-05,
      "loss": 1.4316,
      "num_input_tokens_seen": 36721521568,
      "step": 46674
    },
    {
      "epoch": 4.951729259495014,
      "grad_norm": 0.48431262818690546,
      "learning_rate": 3.1815068968181887e-05,
      "loss": 1.3455,
      "num_input_tokens_seen": 36722308224,
      "step": 46675
    },
    {
      "epoch": 4.951835349034585,
      "grad_norm": 0.5279373990787072,
      "learning_rate": 3.1814400317509275e-05,
      "loss": 1.3502,
      "num_input_tokens_seen": 36723094960,
      "step": 46676
    },
    {
      "epoch": 4.951941438574156,
      "grad_norm": 0.5052285418650609,
      "learning_rate": 3.181373166157069e-05,
      "loss": 1.3249,
      "num_input_tokens_seen": 36723881696,
      "step": 46677
    },
    {
      "epoch": 4.952047528113728,
      "grad_norm": 0.5255044370834717,
      "learning_rate": 3.181306300036666e-05,
      "loss": 1.3664,
      "num_input_tokens_seen": 36724668448,
      "step": 46678
    },
    {
      "epoch": 4.952153617653299,
      "grad_norm": 0.5177569861641038,
      "learning_rate": 3.1812394333897675e-05,
      "loss": 1.3715,
      "num_input_tokens_seen": 36725455216,
      "step": 46679
    },
    {
      "epoch": 4.952259707192871,
      "grad_norm": 0.5088722445993602,
      "learning_rate": 3.1811725662164294e-05,
      "loss": 1.3003,
      "num_input_tokens_seen": 36726241968,
      "step": 46680
    },
    {
      "epoch": 4.952365796732442,
      "grad_norm": 0.5344686272330764,
      "learning_rate": 3.1811056985167e-05,
      "loss": 1.322,
      "num_input_tokens_seen": 36727028672,
      "step": 46681
    },
    {
      "epoch": 4.952471886272013,
      "grad_norm": 0.6398740467071078,
      "learning_rate": 3.1810388302906324e-05,
      "loss": 1.275,
      "num_input_tokens_seen": 36727815488,
      "step": 46682
    },
    {
      "epoch": 4.952577975811585,
      "grad_norm": 0.5100314747026394,
      "learning_rate": 3.1809719615382785e-05,
      "loss": 1.3299,
      "num_input_tokens_seen": 36728602256,
      "step": 46683
    },
    {
      "epoch": 4.952684065351156,
      "grad_norm": 0.7091878399738457,
      "learning_rate": 3.180905092259689e-05,
      "loss": 1.3554,
      "num_input_tokens_seen": 36729389088,
      "step": 46684
    },
    {
      "epoch": 4.952790154890728,
      "grad_norm": 0.4923890678668225,
      "learning_rate": 3.1808382224549155e-05,
      "loss": 1.3533,
      "num_input_tokens_seen": 36730175776,
      "step": 46685
    },
    {
      "epoch": 4.952896244430299,
      "grad_norm": 0.48409131095933394,
      "learning_rate": 3.180771352124011e-05,
      "loss": 1.2264,
      "num_input_tokens_seen": 36730962480,
      "step": 46686
    },
    {
      "epoch": 4.95300233396987,
      "grad_norm": 0.5468560650434138,
      "learning_rate": 3.180704481267026e-05,
      "loss": 1.2652,
      "num_input_tokens_seen": 36731749184,
      "step": 46687
    },
    {
      "epoch": 4.953108423509442,
      "grad_norm": 0.47177152792096444,
      "learning_rate": 3.180637609884012e-05,
      "loss": 1.2423,
      "num_input_tokens_seen": 36732535952,
      "step": 46688
    },
    {
      "epoch": 4.953214513049013,
      "grad_norm": 0.5561512076029553,
      "learning_rate": 3.180570737975022e-05,
      "loss": 1.3983,
      "num_input_tokens_seen": 36733322656,
      "step": 46689
    },
    {
      "epoch": 4.953320602588585,
      "grad_norm": 0.7002339913871913,
      "learning_rate": 3.180503865540106e-05,
      "loss": 1.3531,
      "num_input_tokens_seen": 36734109376,
      "step": 46690
    },
    {
      "epoch": 4.953426692128156,
      "grad_norm": 0.5184464727764609,
      "learning_rate": 3.180436992579317e-05,
      "loss": 1.2819,
      "num_input_tokens_seen": 36734896160,
      "step": 46691
    },
    {
      "epoch": 4.953532781667728,
      "grad_norm": 0.560501827857056,
      "learning_rate": 3.180370119092707e-05,
      "loss": 1.3653,
      "num_input_tokens_seen": 36735682976,
      "step": 46692
    },
    {
      "epoch": 4.953638871207299,
      "grad_norm": 0.5545003841772065,
      "learning_rate": 3.180303245080327e-05,
      "loss": 1.2221,
      "num_input_tokens_seen": 36736469728,
      "step": 46693
    },
    {
      "epoch": 4.95374496074687,
      "grad_norm": 0.6020929645092157,
      "learning_rate": 3.180236370542228e-05,
      "loss": 1.2917,
      "num_input_tokens_seen": 36737256512,
      "step": 46694
    },
    {
      "epoch": 4.953851050286442,
      "grad_norm": 0.6640954435660176,
      "learning_rate": 3.180169495478462e-05,
      "loss": 1.2929,
      "num_input_tokens_seen": 36738043232,
      "step": 46695
    },
    {
      "epoch": 4.953957139826013,
      "grad_norm": 0.659636838162557,
      "learning_rate": 3.1801026198890824e-05,
      "loss": 1.3905,
      "num_input_tokens_seen": 36738829856,
      "step": 46696
    },
    {
      "epoch": 4.954063229365585,
      "grad_norm": 0.5107789049993526,
      "learning_rate": 3.180035743774138e-05,
      "loss": 1.3049,
      "num_input_tokens_seen": 36739616640,
      "step": 46697
    },
    {
      "epoch": 4.954169318905156,
      "grad_norm": 0.5983253783928122,
      "learning_rate": 3.179968867133683e-05,
      "loss": 1.339,
      "num_input_tokens_seen": 36740403520,
      "step": 46698
    },
    {
      "epoch": 4.954275408444728,
      "grad_norm": 0.67732896000517,
      "learning_rate": 3.179901989967767e-05,
      "loss": 1.1971,
      "num_input_tokens_seen": 36741190336,
      "step": 46699
    },
    {
      "epoch": 4.954381497984299,
      "grad_norm": 0.5388691775176906,
      "learning_rate": 3.1798351122764425e-05,
      "loss": 1.3653,
      "num_input_tokens_seen": 36741977136,
      "step": 46700
    },
    {
      "epoch": 4.95448758752387,
      "grad_norm": 0.8130416366323657,
      "learning_rate": 3.1797682340597626e-05,
      "loss": 1.2931,
      "num_input_tokens_seen": 36742763920,
      "step": 46701
    },
    {
      "epoch": 4.954593677063442,
      "grad_norm": 0.5852257156625585,
      "learning_rate": 3.1797013553177766e-05,
      "loss": 1.3625,
      "num_input_tokens_seen": 36743550576,
      "step": 46702
    },
    {
      "epoch": 4.954699766603013,
      "grad_norm": 0.5713645396906315,
      "learning_rate": 3.1796344760505373e-05,
      "loss": 1.2874,
      "num_input_tokens_seen": 36744337360,
      "step": 46703
    },
    {
      "epoch": 4.954805856142585,
      "grad_norm": 0.7155152534190378,
      "learning_rate": 3.179567596258097e-05,
      "loss": 1.3075,
      "num_input_tokens_seen": 36745124080,
      "step": 46704
    },
    {
      "epoch": 4.954911945682156,
      "grad_norm": 0.5391345350378833,
      "learning_rate": 3.1795007159405064e-05,
      "loss": 1.2645,
      "num_input_tokens_seen": 36745910800,
      "step": 46705
    },
    {
      "epoch": 4.955018035221727,
      "grad_norm": 0.5979093675523226,
      "learning_rate": 3.1794338350978184e-05,
      "loss": 1.2988,
      "num_input_tokens_seen": 36746697568,
      "step": 46706
    },
    {
      "epoch": 4.955124124761299,
      "grad_norm": 0.6105708146779819,
      "learning_rate": 3.179366953730084e-05,
      "loss": 1.3286,
      "num_input_tokens_seen": 36747484272,
      "step": 46707
    },
    {
      "epoch": 4.95523021430087,
      "grad_norm": 0.759100421644691,
      "learning_rate": 3.1793000718373534e-05,
      "loss": 1.3229,
      "num_input_tokens_seen": 36748271152,
      "step": 46708
    },
    {
      "epoch": 4.955336303840442,
      "grad_norm": 0.49215594028844883,
      "learning_rate": 3.17923318941968e-05,
      "loss": 1.265,
      "num_input_tokens_seen": 36749057888,
      "step": 46709
    },
    {
      "epoch": 4.955442393380013,
      "grad_norm": 0.571964558123054,
      "learning_rate": 3.179166306477116e-05,
      "loss": 1.2215,
      "num_input_tokens_seen": 36749844784,
      "step": 46710
    },
    {
      "epoch": 4.955548482919584,
      "grad_norm": 0.7398659166152964,
      "learning_rate": 3.1790994230097115e-05,
      "loss": 1.2477,
      "num_input_tokens_seen": 36750631584,
      "step": 46711
    },
    {
      "epoch": 4.955654572459156,
      "grad_norm": 0.5680859248702567,
      "learning_rate": 3.179032539017519e-05,
      "loss": 1.3319,
      "num_input_tokens_seen": 36751418272,
      "step": 46712
    },
    {
      "epoch": 4.955760661998727,
      "grad_norm": 0.6344666036101755,
      "learning_rate": 3.1789656545005906e-05,
      "loss": 1.2019,
      "num_input_tokens_seen": 36752205072,
      "step": 46713
    },
    {
      "epoch": 4.955866751538299,
      "grad_norm": 0.7801113206329403,
      "learning_rate": 3.1788987694589766e-05,
      "loss": 1.3498,
      "num_input_tokens_seen": 36752991856,
      "step": 46714
    },
    {
      "epoch": 4.95597284107787,
      "grad_norm": 0.6089401787541752,
      "learning_rate": 3.178831883892731e-05,
      "loss": 1.3134,
      "num_input_tokens_seen": 36753778640,
      "step": 46715
    },
    {
      "epoch": 4.956078930617441,
      "grad_norm": 0.6924725845806641,
      "learning_rate": 3.178764997801903e-05,
      "loss": 1.3557,
      "num_input_tokens_seen": 36754565392,
      "step": 46716
    },
    {
      "epoch": 4.956185020157013,
      "grad_norm": 0.5947127247165738,
      "learning_rate": 3.1786981111865446e-05,
      "loss": 1.2592,
      "num_input_tokens_seen": 36755352096,
      "step": 46717
    },
    {
      "epoch": 4.956291109696584,
      "grad_norm": 0.5757176117030259,
      "learning_rate": 3.1786312240467094e-05,
      "loss": 1.45,
      "num_input_tokens_seen": 36756138816,
      "step": 46718
    },
    {
      "epoch": 4.9563971992361555,
      "grad_norm": 0.6028346098999887,
      "learning_rate": 3.1785643363824477e-05,
      "loss": 1.2175,
      "num_input_tokens_seen": 36756925488,
      "step": 46719
    },
    {
      "epoch": 4.9565032887757265,
      "grad_norm": 0.5203483663703921,
      "learning_rate": 3.178497448193811e-05,
      "loss": 1.2493,
      "num_input_tokens_seen": 36757712128,
      "step": 46720
    },
    {
      "epoch": 4.9566093783152985,
      "grad_norm": 0.5248960139404788,
      "learning_rate": 3.178430559480851e-05,
      "loss": 1.2238,
      "num_input_tokens_seen": 36758498880,
      "step": 46721
    },
    {
      "epoch": 4.9567154678548695,
      "grad_norm": 0.5169870168581895,
      "learning_rate": 3.17836367024362e-05,
      "loss": 1.2459,
      "num_input_tokens_seen": 36759285600,
      "step": 46722
    },
    {
      "epoch": 4.9568215573944405,
      "grad_norm": 0.5210124728358017,
      "learning_rate": 3.17829678048217e-05,
      "loss": 1.3557,
      "num_input_tokens_seen": 36760072320,
      "step": 46723
    },
    {
      "epoch": 4.956927646934012,
      "grad_norm": 0.7100389957390971,
      "learning_rate": 3.1782298901965524e-05,
      "loss": 1.3197,
      "num_input_tokens_seen": 36760859024,
      "step": 46724
    },
    {
      "epoch": 4.9570337364735835,
      "grad_norm": 0.5144201058231035,
      "learning_rate": 3.1781629993868176e-05,
      "loss": 1.2673,
      "num_input_tokens_seen": 36761645824,
      "step": 46725
    },
    {
      "epoch": 4.957139826013155,
      "grad_norm": 0.5313560617935947,
      "learning_rate": 3.178096108053019e-05,
      "loss": 1.3065,
      "num_input_tokens_seen": 36762432656,
      "step": 46726
    },
    {
      "epoch": 4.957245915552726,
      "grad_norm": 0.48686928921246797,
      "learning_rate": 3.178029216195208e-05,
      "loss": 1.3886,
      "num_input_tokens_seen": 36763219376,
      "step": 46727
    },
    {
      "epoch": 4.957352005092298,
      "grad_norm": 0.6126700035369795,
      "learning_rate": 3.177962323813435e-05,
      "loss": 1.2519,
      "num_input_tokens_seen": 36764006176,
      "step": 46728
    },
    {
      "epoch": 4.957458094631869,
      "grad_norm": 0.5248425964568925,
      "learning_rate": 3.1778954309077534e-05,
      "loss": 1.2935,
      "num_input_tokens_seen": 36764792880,
      "step": 46729
    },
    {
      "epoch": 4.95756418417144,
      "grad_norm": 0.5091857236686307,
      "learning_rate": 3.1778285374782134e-05,
      "loss": 1.3043,
      "num_input_tokens_seen": 36765579520,
      "step": 46730
    },
    {
      "epoch": 4.957670273711012,
      "grad_norm": 0.5445856660648024,
      "learning_rate": 3.177761643524868e-05,
      "loss": 1.2519,
      "num_input_tokens_seen": 36766366256,
      "step": 46731
    },
    {
      "epoch": 4.957776363250583,
      "grad_norm": 0.5836966979264783,
      "learning_rate": 3.177694749047768e-05,
      "loss": 1.213,
      "num_input_tokens_seen": 36767153184,
      "step": 46732
    },
    {
      "epoch": 4.957882452790155,
      "grad_norm": 0.5347214770294693,
      "learning_rate": 3.1776278540469656e-05,
      "loss": 1.2633,
      "num_input_tokens_seen": 36767939984,
      "step": 46733
    },
    {
      "epoch": 4.957988542329726,
      "grad_norm": 0.5930794527400965,
      "learning_rate": 3.177560958522512e-05,
      "loss": 1.3016,
      "num_input_tokens_seen": 36768726688,
      "step": 46734
    },
    {
      "epoch": 4.958094631869297,
      "grad_norm": 0.4776727006958187,
      "learning_rate": 3.1774940624744596e-05,
      "loss": 1.2385,
      "num_input_tokens_seen": 36769513472,
      "step": 46735
    },
    {
      "epoch": 4.958200721408869,
      "grad_norm": 0.597962322571065,
      "learning_rate": 3.177427165902859e-05,
      "loss": 1.3485,
      "num_input_tokens_seen": 36770300160,
      "step": 46736
    },
    {
      "epoch": 4.95830681094844,
      "grad_norm": 0.5131999215391062,
      "learning_rate": 3.177360268807762e-05,
      "loss": 1.3046,
      "num_input_tokens_seen": 36771086928,
      "step": 46737
    },
    {
      "epoch": 4.958412900488012,
      "grad_norm": 0.5297735507658687,
      "learning_rate": 3.177293371189222e-05,
      "loss": 1.3072,
      "num_input_tokens_seen": 36771873680,
      "step": 46738
    },
    {
      "epoch": 4.958518990027583,
      "grad_norm": 0.6122009541600927,
      "learning_rate": 3.1772264730472895e-05,
      "loss": 1.3334,
      "num_input_tokens_seen": 36772660496,
      "step": 46739
    },
    {
      "epoch": 4.958625079567154,
      "grad_norm": 0.7435371039625411,
      "learning_rate": 3.177159574382016e-05,
      "loss": 1.4016,
      "num_input_tokens_seen": 36773447248,
      "step": 46740
    },
    {
      "epoch": 4.958731169106726,
      "grad_norm": 0.5560839978314936,
      "learning_rate": 3.1770926751934534e-05,
      "loss": 1.3724,
      "num_input_tokens_seen": 36774234000,
      "step": 46741
    },
    {
      "epoch": 4.958837258646297,
      "grad_norm": 0.8973799138006335,
      "learning_rate": 3.177025775481654e-05,
      "loss": 1.3981,
      "num_input_tokens_seen": 36775020704,
      "step": 46742
    },
    {
      "epoch": 4.958943348185869,
      "grad_norm": 0.6449026853882371,
      "learning_rate": 3.176958875246668e-05,
      "loss": 1.3374,
      "num_input_tokens_seen": 36775807472,
      "step": 46743
    },
    {
      "epoch": 4.95904943772544,
      "grad_norm": 0.7417652694693182,
      "learning_rate": 3.176891974488548e-05,
      "loss": 1.32,
      "num_input_tokens_seen": 36776594192,
      "step": 46744
    },
    {
      "epoch": 4.959155527265011,
      "grad_norm": 0.521487729619045,
      "learning_rate": 3.1768250732073475e-05,
      "loss": 1.2633,
      "num_input_tokens_seen": 36777380976,
      "step": 46745
    },
    {
      "epoch": 4.959261616804583,
      "grad_norm": 0.5319434712447476,
      "learning_rate": 3.176758171403115e-05,
      "loss": 1.3906,
      "num_input_tokens_seen": 36778167648,
      "step": 46746
    },
    {
      "epoch": 4.959367706344154,
      "grad_norm": 0.6216377511321705,
      "learning_rate": 3.1766912690759036e-05,
      "loss": 1.3375,
      "num_input_tokens_seen": 36778954416,
      "step": 46747
    },
    {
      "epoch": 4.959473795883726,
      "grad_norm": 0.5599340050500846,
      "learning_rate": 3.176624366225765e-05,
      "loss": 1.3782,
      "num_input_tokens_seen": 36779741152,
      "step": 46748
    },
    {
      "epoch": 4.959579885423297,
      "grad_norm": 0.5171960124631123,
      "learning_rate": 3.176557462852752e-05,
      "loss": 1.3036,
      "num_input_tokens_seen": 36780527904,
      "step": 46749
    },
    {
      "epoch": 4.959685974962869,
      "grad_norm": 0.61154010004729,
      "learning_rate": 3.1764905589569136e-05,
      "loss": 1.3225,
      "num_input_tokens_seen": 36781314656,
      "step": 46750
    },
    {
      "epoch": 4.95979206450244,
      "grad_norm": 0.5013687832405032,
      "learning_rate": 3.176423654538304e-05,
      "loss": 1.3238,
      "num_input_tokens_seen": 36782101392,
      "step": 46751
    },
    {
      "epoch": 4.959898154042012,
      "grad_norm": 0.8336527969497287,
      "learning_rate": 3.1763567495969746e-05,
      "loss": 1.3418,
      "num_input_tokens_seen": 36782888176,
      "step": 46752
    },
    {
      "epoch": 4.960004243581583,
      "grad_norm": 0.5621774645930835,
      "learning_rate": 3.176289844132976e-05,
      "loss": 1.304,
      "num_input_tokens_seen": 36783675024,
      "step": 46753
    },
    {
      "epoch": 4.960110333121154,
      "grad_norm": 0.5173979911477388,
      "learning_rate": 3.1762229381463603e-05,
      "loss": 1.2299,
      "num_input_tokens_seen": 36784461808,
      "step": 46754
    },
    {
      "epoch": 4.960216422660726,
      "grad_norm": 0.564272168255613,
      "learning_rate": 3.1761560316371795e-05,
      "loss": 1.2676,
      "num_input_tokens_seen": 36785248592,
      "step": 46755
    },
    {
      "epoch": 4.960322512200297,
      "grad_norm": 0.5391979358077144,
      "learning_rate": 3.1760891246054856e-05,
      "loss": 1.2257,
      "num_input_tokens_seen": 36786035392,
      "step": 46756
    },
    {
      "epoch": 4.960428601739869,
      "grad_norm": 0.6660847233755229,
      "learning_rate": 3.176022217051329e-05,
      "loss": 1.2596,
      "num_input_tokens_seen": 36786822112,
      "step": 46757
    },
    {
      "epoch": 4.96053469127944,
      "grad_norm": 0.6172922033503531,
      "learning_rate": 3.175955308974763e-05,
      "loss": 1.2967,
      "num_input_tokens_seen": 36787608944,
      "step": 46758
    },
    {
      "epoch": 4.960640780819011,
      "grad_norm": 0.6633320855860745,
      "learning_rate": 3.175888400375838e-05,
      "loss": 1.2481,
      "num_input_tokens_seen": 36788395840,
      "step": 46759
    },
    {
      "epoch": 4.960746870358583,
      "grad_norm": 0.5062556773327949,
      "learning_rate": 3.175821491254607e-05,
      "loss": 1.2561,
      "num_input_tokens_seen": 36789182656,
      "step": 46760
    },
    {
      "epoch": 4.960852959898154,
      "grad_norm": 0.6345984118484738,
      "learning_rate": 3.175754581611121e-05,
      "loss": 1.3347,
      "num_input_tokens_seen": 36789969472,
      "step": 46761
    },
    {
      "epoch": 4.960959049437726,
      "grad_norm": 0.5894744377316132,
      "learning_rate": 3.175687671445431e-05,
      "loss": 1.3357,
      "num_input_tokens_seen": 36790756208,
      "step": 46762
    },
    {
      "epoch": 4.961065138977297,
      "grad_norm": 0.6036217556809697,
      "learning_rate": 3.175620760757589e-05,
      "loss": 1.3908,
      "num_input_tokens_seen": 36791543008,
      "step": 46763
    },
    {
      "epoch": 4.961171228516868,
      "grad_norm": 0.6111844672877856,
      "learning_rate": 3.1755538495476485e-05,
      "loss": 1.2913,
      "num_input_tokens_seen": 36792329776,
      "step": 46764
    },
    {
      "epoch": 4.96127731805644,
      "grad_norm": 0.5599495544719406,
      "learning_rate": 3.1754869378156584e-05,
      "loss": 1.2286,
      "num_input_tokens_seen": 36793116544,
      "step": 46765
    },
    {
      "epoch": 4.961383407596011,
      "grad_norm": 0.6388511582145996,
      "learning_rate": 3.175420025561673e-05,
      "loss": 1.3729,
      "num_input_tokens_seen": 36793903328,
      "step": 46766
    },
    {
      "epoch": 4.961489497135583,
      "grad_norm": 0.5734838732007161,
      "learning_rate": 3.175353112785742e-05,
      "loss": 1.334,
      "num_input_tokens_seen": 36794690000,
      "step": 46767
    },
    {
      "epoch": 4.961595586675154,
      "grad_norm": 0.5543527454193897,
      "learning_rate": 3.175286199487918e-05,
      "loss": 1.2484,
      "num_input_tokens_seen": 36795476768,
      "step": 46768
    },
    {
      "epoch": 4.961701676214725,
      "grad_norm": 0.6994939132258525,
      "learning_rate": 3.175219285668253e-05,
      "loss": 1.2904,
      "num_input_tokens_seen": 36796263600,
      "step": 46769
    },
    {
      "epoch": 4.961807765754297,
      "grad_norm": 0.5318023083618978,
      "learning_rate": 3.1751523713267985e-05,
      "loss": 1.3184,
      "num_input_tokens_seen": 36797050320,
      "step": 46770
    },
    {
      "epoch": 4.961913855293868,
      "grad_norm": 0.7694678135894836,
      "learning_rate": 3.1750854564636054e-05,
      "loss": 1.3326,
      "num_input_tokens_seen": 36797837088,
      "step": 46771
    },
    {
      "epoch": 4.96201994483344,
      "grad_norm": 0.48805016793831724,
      "learning_rate": 3.175018541078727e-05,
      "loss": 1.2502,
      "num_input_tokens_seen": 36798623856,
      "step": 46772
    },
    {
      "epoch": 4.962126034373011,
      "grad_norm": 0.5406889843029892,
      "learning_rate": 3.1749516251722134e-05,
      "loss": 1.1833,
      "num_input_tokens_seen": 36799410656,
      "step": 46773
    },
    {
      "epoch": 4.962232123912582,
      "grad_norm": 0.5307952156820007,
      "learning_rate": 3.174884708744117e-05,
      "loss": 1.2234,
      "num_input_tokens_seen": 36800197472,
      "step": 46774
    },
    {
      "epoch": 4.962338213452154,
      "grad_norm": 0.4977106220905538,
      "learning_rate": 3.174817791794489e-05,
      "loss": 1.2868,
      "num_input_tokens_seen": 36800984096,
      "step": 46775
    },
    {
      "epoch": 4.962444302991725,
      "grad_norm": 0.5638208123256362,
      "learning_rate": 3.1747508743233826e-05,
      "loss": 1.3424,
      "num_input_tokens_seen": 36801770848,
      "step": 46776
    },
    {
      "epoch": 4.962550392531297,
      "grad_norm": 0.6210534247591168,
      "learning_rate": 3.1746839563308486e-05,
      "loss": 1.3179,
      "num_input_tokens_seen": 36802557600,
      "step": 46777
    },
    {
      "epoch": 4.962656482070868,
      "grad_norm": 0.6628883555097449,
      "learning_rate": 3.174617037816938e-05,
      "loss": 1.2002,
      "num_input_tokens_seen": 36803344432,
      "step": 46778
    },
    {
      "epoch": 4.9627625716104395,
      "grad_norm": 0.5026670080982696,
      "learning_rate": 3.174550118781703e-05,
      "loss": 1.2825,
      "num_input_tokens_seen": 36804131168,
      "step": 46779
    },
    {
      "epoch": 4.962868661150011,
      "grad_norm": 0.5686623190229693,
      "learning_rate": 3.1744831992251955e-05,
      "loss": 1.3302,
      "num_input_tokens_seen": 36804917904,
      "step": 46780
    },
    {
      "epoch": 4.9629747506895825,
      "grad_norm": 0.5559361131671036,
      "learning_rate": 3.174416279147468e-05,
      "loss": 1.2623,
      "num_input_tokens_seen": 36805704720,
      "step": 46781
    },
    {
      "epoch": 4.9630808402291535,
      "grad_norm": 0.7340762486110249,
      "learning_rate": 3.174349358548571e-05,
      "loss": 1.3464,
      "num_input_tokens_seen": 36806491504,
      "step": 46782
    },
    {
      "epoch": 4.9631869297687246,
      "grad_norm": 0.5579053486990775,
      "learning_rate": 3.174282437428556e-05,
      "loss": 1.3124,
      "num_input_tokens_seen": 36807278176,
      "step": 46783
    },
    {
      "epoch": 4.9632930193082965,
      "grad_norm": 1.0466503881811517,
      "learning_rate": 3.174215515787476e-05,
      "loss": 1.3737,
      "num_input_tokens_seen": 36808064976,
      "step": 46784
    },
    {
      "epoch": 4.9633991088478675,
      "grad_norm": 0.5219046760594459,
      "learning_rate": 3.1741485936253814e-05,
      "loss": 1.3639,
      "num_input_tokens_seen": 36808851696,
      "step": 46785
    },
    {
      "epoch": 4.963505198387439,
      "grad_norm": 0.6026812634780041,
      "learning_rate": 3.1740816709423246e-05,
      "loss": 1.3038,
      "num_input_tokens_seen": 36809638480,
      "step": 46786
    },
    {
      "epoch": 4.9636112879270105,
      "grad_norm": 0.6771645174481312,
      "learning_rate": 3.1740147477383574e-05,
      "loss": 1.2541,
      "num_input_tokens_seen": 36810425264,
      "step": 46787
    },
    {
      "epoch": 4.9637173774665815,
      "grad_norm": 0.48378014439368267,
      "learning_rate": 3.173947824013532e-05,
      "loss": 1.2941,
      "num_input_tokens_seen": 36811212048,
      "step": 46788
    },
    {
      "epoch": 4.963823467006153,
      "grad_norm": 0.7256591614356495,
      "learning_rate": 3.1738808997678994e-05,
      "loss": 1.2669,
      "num_input_tokens_seen": 36811998704,
      "step": 46789
    },
    {
      "epoch": 4.963929556545724,
      "grad_norm": 0.7124383997527419,
      "learning_rate": 3.173813975001511e-05,
      "loss": 1.3197,
      "num_input_tokens_seen": 36812785504,
      "step": 46790
    },
    {
      "epoch": 4.964035646085296,
      "grad_norm": 0.6263570914835982,
      "learning_rate": 3.1737470497144186e-05,
      "loss": 1.3992,
      "num_input_tokens_seen": 36813572256,
      "step": 46791
    },
    {
      "epoch": 4.964141735624867,
      "grad_norm": 0.7957815725679362,
      "learning_rate": 3.173680123906675e-05,
      "loss": 1.3243,
      "num_input_tokens_seen": 36814359104,
      "step": 46792
    },
    {
      "epoch": 4.964247825164438,
      "grad_norm": 0.7217951213623949,
      "learning_rate": 3.1736131975783304e-05,
      "loss": 1.3184,
      "num_input_tokens_seen": 36815145936,
      "step": 46793
    },
    {
      "epoch": 4.96435391470401,
      "grad_norm": 0.5878294704387941,
      "learning_rate": 3.1735462707294375e-05,
      "loss": 1.312,
      "num_input_tokens_seen": 36815932688,
      "step": 46794
    },
    {
      "epoch": 4.964460004243581,
      "grad_norm": 0.6800420008843365,
      "learning_rate": 3.173479343360048e-05,
      "loss": 1.2598,
      "num_input_tokens_seen": 36816719328,
      "step": 46795
    },
    {
      "epoch": 4.964566093783153,
      "grad_norm": 0.6288781782703557,
      "learning_rate": 3.1734124154702135e-05,
      "loss": 1.3018,
      "num_input_tokens_seen": 36817506000,
      "step": 46796
    },
    {
      "epoch": 4.964672183322724,
      "grad_norm": 0.5128194535576974,
      "learning_rate": 3.173345487059986e-05,
      "loss": 1.2518,
      "num_input_tokens_seen": 36818292736,
      "step": 46797
    },
    {
      "epoch": 4.964778272862295,
      "grad_norm": 0.6131797427614765,
      "learning_rate": 3.173278558129417e-05,
      "loss": 1.2771,
      "num_input_tokens_seen": 36819079488,
      "step": 46798
    },
    {
      "epoch": 4.964884362401867,
      "grad_norm": 0.634722008790916,
      "learning_rate": 3.1732116286785574e-05,
      "loss": 1.3252,
      "num_input_tokens_seen": 36819866256,
      "step": 46799
    },
    {
      "epoch": 4.964990451941438,
      "grad_norm": 0.639333029078767,
      "learning_rate": 3.173144698707459e-05,
      "loss": 1.3878,
      "num_input_tokens_seen": 36820652992,
      "step": 46800
    },
    {
      "epoch": 4.96509654148101,
      "grad_norm": 0.572618206978222,
      "learning_rate": 3.173077768216175e-05,
      "loss": 1.4511,
      "num_input_tokens_seen": 36821439648,
      "step": 46801
    },
    {
      "epoch": 4.965202631020581,
      "grad_norm": 0.6770857320527348,
      "learning_rate": 3.1730108372047565e-05,
      "loss": 1.1781,
      "num_input_tokens_seen": 36822226480,
      "step": 46802
    },
    {
      "epoch": 4.965308720560153,
      "grad_norm": 0.6921755284580734,
      "learning_rate": 3.172943905673255e-05,
      "loss": 1.296,
      "num_input_tokens_seen": 36823013280,
      "step": 46803
    },
    {
      "epoch": 4.965414810099724,
      "grad_norm": 0.5697117127682205,
      "learning_rate": 3.1728769736217215e-05,
      "loss": 1.2947,
      "num_input_tokens_seen": 36823800080,
      "step": 46804
    },
    {
      "epoch": 4.965520899639295,
      "grad_norm": 0.5939812261846927,
      "learning_rate": 3.172810041050209e-05,
      "loss": 1.277,
      "num_input_tokens_seen": 36824586864,
      "step": 46805
    },
    {
      "epoch": 4.965626989178867,
      "grad_norm": 0.6031161812705672,
      "learning_rate": 3.172743107958768e-05,
      "loss": 1.2886,
      "num_input_tokens_seen": 36825373568,
      "step": 46806
    },
    {
      "epoch": 4.965733078718438,
      "grad_norm": 0.6835365564212479,
      "learning_rate": 3.172676174347451e-05,
      "loss": 1.4348,
      "num_input_tokens_seen": 36826160240,
      "step": 46807
    },
    {
      "epoch": 4.96583916825801,
      "grad_norm": 0.5809889377273659,
      "learning_rate": 3.17260924021631e-05,
      "loss": 1.3907,
      "num_input_tokens_seen": 36826947104,
      "step": 46808
    },
    {
      "epoch": 4.965945257797581,
      "grad_norm": 0.5608367766815179,
      "learning_rate": 3.172542305565396e-05,
      "loss": 1.2123,
      "num_input_tokens_seen": 36827733920,
      "step": 46809
    },
    {
      "epoch": 4.966051347337153,
      "grad_norm": 0.56239886174178,
      "learning_rate": 3.172475370394761e-05,
      "loss": 1.3649,
      "num_input_tokens_seen": 36828520624,
      "step": 46810
    },
    {
      "epoch": 4.966157436876724,
      "grad_norm": 0.510394292659413,
      "learning_rate": 3.172408434704457e-05,
      "loss": 1.2797,
      "num_input_tokens_seen": 36829307456,
      "step": 46811
    },
    {
      "epoch": 4.966263526416295,
      "grad_norm": 0.5646027502809499,
      "learning_rate": 3.1723414984945354e-05,
      "loss": 1.2159,
      "num_input_tokens_seen": 36830094272,
      "step": 46812
    },
    {
      "epoch": 4.966369615955867,
      "grad_norm": 0.52506072152193,
      "learning_rate": 3.1722745617650486e-05,
      "loss": 1.285,
      "num_input_tokens_seen": 36830881024,
      "step": 46813
    },
    {
      "epoch": 4.966475705495438,
      "grad_norm": 0.521937762706262,
      "learning_rate": 3.1722076245160466e-05,
      "loss": 1.3393,
      "num_input_tokens_seen": 36831667712,
      "step": 46814
    },
    {
      "epoch": 4.96658179503501,
      "grad_norm": 0.5659575544861211,
      "learning_rate": 3.172140686747583e-05,
      "loss": 1.2945,
      "num_input_tokens_seen": 36832454576,
      "step": 46815
    },
    {
      "epoch": 4.966687884574581,
      "grad_norm": 0.5645834226531142,
      "learning_rate": 3.172073748459709e-05,
      "loss": 1.3495,
      "num_input_tokens_seen": 36833241376,
      "step": 46816
    },
    {
      "epoch": 4.966793974114152,
      "grad_norm": 0.5143895475320587,
      "learning_rate": 3.172006809652475e-05,
      "loss": 1.3225,
      "num_input_tokens_seen": 36834028064,
      "step": 46817
    },
    {
      "epoch": 4.966900063653724,
      "grad_norm": 0.5403804443646488,
      "learning_rate": 3.171939870325935e-05,
      "loss": 1.5095,
      "num_input_tokens_seen": 36834814784,
      "step": 46818
    },
    {
      "epoch": 4.967006153193295,
      "grad_norm": 0.597220015386404,
      "learning_rate": 3.1718729304801395e-05,
      "loss": 1.2695,
      "num_input_tokens_seen": 36835601632,
      "step": 46819
    },
    {
      "epoch": 4.967112242732867,
      "grad_norm": 0.627658127376617,
      "learning_rate": 3.17180599011514e-05,
      "loss": 1.3121,
      "num_input_tokens_seen": 36836388384,
      "step": 46820
    },
    {
      "epoch": 4.967218332272438,
      "grad_norm": 0.5837989483131852,
      "learning_rate": 3.171739049230988e-05,
      "loss": 1.4275,
      "num_input_tokens_seen": 36837175184,
      "step": 46821
    },
    {
      "epoch": 4.967324421812009,
      "grad_norm": 0.709931751045303,
      "learning_rate": 3.1716721078277376e-05,
      "loss": 1.3241,
      "num_input_tokens_seen": 36837962032,
      "step": 46822
    },
    {
      "epoch": 4.967430511351581,
      "grad_norm": 0.535816385435655,
      "learning_rate": 3.1716051659054366e-05,
      "loss": 1.379,
      "num_input_tokens_seen": 36838748688,
      "step": 46823
    },
    {
      "epoch": 4.967536600891152,
      "grad_norm": 0.4732143651675349,
      "learning_rate": 3.17153822346414e-05,
      "loss": 1.3302,
      "num_input_tokens_seen": 36839535408,
      "step": 46824
    },
    {
      "epoch": 4.967642690430724,
      "grad_norm": 0.5714528835410485,
      "learning_rate": 3.1714712805038974e-05,
      "loss": 1.2687,
      "num_input_tokens_seen": 36840322176,
      "step": 46825
    },
    {
      "epoch": 4.967748779970295,
      "grad_norm": 0.6044913173529596,
      "learning_rate": 3.171404337024763e-05,
      "loss": 1.3045,
      "num_input_tokens_seen": 36841108880,
      "step": 46826
    },
    {
      "epoch": 4.967854869509866,
      "grad_norm": 0.5171377617321312,
      "learning_rate": 3.171337393026786e-05,
      "loss": 1.3333,
      "num_input_tokens_seen": 36841895584,
      "step": 46827
    },
    {
      "epoch": 4.967960959049438,
      "grad_norm": 0.7242199395112299,
      "learning_rate": 3.171270448510018e-05,
      "loss": 1.3069,
      "num_input_tokens_seen": 36842682368,
      "step": 46828
    },
    {
      "epoch": 4.968067048589009,
      "grad_norm": 0.6081375536955607,
      "learning_rate": 3.171203503474515e-05,
      "loss": 1.3804,
      "num_input_tokens_seen": 36843469040,
      "step": 46829
    },
    {
      "epoch": 4.968173138128581,
      "grad_norm": 0.6568791503327109,
      "learning_rate": 3.171136557920324e-05,
      "loss": 1.3894,
      "num_input_tokens_seen": 36844255728,
      "step": 46830
    },
    {
      "epoch": 4.968279227668152,
      "grad_norm": 0.6904647144858913,
      "learning_rate": 3.171069611847497e-05,
      "loss": 1.3312,
      "num_input_tokens_seen": 36845042528,
      "step": 46831
    },
    {
      "epoch": 4.968385317207724,
      "grad_norm": 0.5615161791304859,
      "learning_rate": 3.171002665256089e-05,
      "loss": 1.2528,
      "num_input_tokens_seen": 36845829232,
      "step": 46832
    },
    {
      "epoch": 4.968491406747295,
      "grad_norm": 0.5162597025686166,
      "learning_rate": 3.170935718146149e-05,
      "loss": 1.2176,
      "num_input_tokens_seen": 36846616048,
      "step": 46833
    },
    {
      "epoch": 4.968597496286866,
      "grad_norm": 0.4869044791847448,
      "learning_rate": 3.17086877051773e-05,
      "loss": 1.2791,
      "num_input_tokens_seen": 36847402816,
      "step": 46834
    },
    {
      "epoch": 4.968703585826438,
      "grad_norm": 0.49477223556918243,
      "learning_rate": 3.1708018223708826e-05,
      "loss": 1.2836,
      "num_input_tokens_seen": 36848189648,
      "step": 46835
    },
    {
      "epoch": 4.968809675366009,
      "grad_norm": 0.45106739912349897,
      "learning_rate": 3.17073487370566e-05,
      "loss": 1.2761,
      "num_input_tokens_seen": 36848976464,
      "step": 46836
    },
    {
      "epoch": 4.968915764905581,
      "grad_norm": 0.501532441281924,
      "learning_rate": 3.1706679245221115e-05,
      "loss": 1.3043,
      "num_input_tokens_seen": 36849763376,
      "step": 46837
    },
    {
      "epoch": 4.969021854445152,
      "grad_norm": 0.5321035634943048,
      "learning_rate": 3.170600974820293e-05,
      "loss": 1.3093,
      "num_input_tokens_seen": 36850550096,
      "step": 46838
    },
    {
      "epoch": 4.969127943984724,
      "grad_norm": 0.4834778673747727,
      "learning_rate": 3.1705340246002524e-05,
      "loss": 1.3032,
      "num_input_tokens_seen": 36851336880,
      "step": 46839
    },
    {
      "epoch": 4.969234033524295,
      "grad_norm": 0.5288911414494575,
      "learning_rate": 3.170467073862042e-05,
      "loss": 1.2775,
      "num_input_tokens_seen": 36852123664,
      "step": 46840
    },
    {
      "epoch": 4.969340123063866,
      "grad_norm": 0.4752763496101633,
      "learning_rate": 3.170400122605716e-05,
      "loss": 1.3405,
      "num_input_tokens_seen": 36852910448,
      "step": 46841
    },
    {
      "epoch": 4.9694462126034376,
      "grad_norm": 0.46378376903589547,
      "learning_rate": 3.170333170831324e-05,
      "loss": 1.2848,
      "num_input_tokens_seen": 36853697200,
      "step": 46842
    },
    {
      "epoch": 4.969552302143009,
      "grad_norm": 0.501069755956559,
      "learning_rate": 3.170266218538917e-05,
      "loss": 1.2927,
      "num_input_tokens_seen": 36854483968,
      "step": 46843
    },
    {
      "epoch": 4.9696583916825805,
      "grad_norm": 0.524249788309975,
      "learning_rate": 3.170199265728549e-05,
      "loss": 1.2692,
      "num_input_tokens_seen": 36855270736,
      "step": 46844
    },
    {
      "epoch": 4.9697644812221515,
      "grad_norm": 0.47297300402794323,
      "learning_rate": 3.1701323124002714e-05,
      "loss": 1.2716,
      "num_input_tokens_seen": 36856057488,
      "step": 46845
    },
    {
      "epoch": 4.969870570761723,
      "grad_norm": 0.5180027525567237,
      "learning_rate": 3.170065358554133e-05,
      "loss": 1.2462,
      "num_input_tokens_seen": 36856844336,
      "step": 46846
    },
    {
      "epoch": 4.9699766603012945,
      "grad_norm": 0.4697632765671047,
      "learning_rate": 3.16999840419019e-05,
      "loss": 1.2238,
      "num_input_tokens_seen": 36857631072,
      "step": 46847
    },
    {
      "epoch": 4.9700827498408655,
      "grad_norm": 0.5319701148830657,
      "learning_rate": 3.169931449308491e-05,
      "loss": 1.1876,
      "num_input_tokens_seen": 36858418016,
      "step": 46848
    },
    {
      "epoch": 4.970188839380437,
      "grad_norm": 0.5505271742728917,
      "learning_rate": 3.169864493909088e-05,
      "loss": 1.3589,
      "num_input_tokens_seen": 36859204704,
      "step": 46849
    },
    {
      "epoch": 4.9702949289200085,
      "grad_norm": 0.5494658613948187,
      "learning_rate": 3.1697975379920344e-05,
      "loss": 1.4019,
      "num_input_tokens_seen": 36859991456,
      "step": 46850
    },
    {
      "epoch": 4.9704010184595795,
      "grad_norm": 0.5771160368528061,
      "learning_rate": 3.1697305815573804e-05,
      "loss": 1.3497,
      "num_input_tokens_seen": 36860778128,
      "step": 46851
    },
    {
      "epoch": 4.970507107999151,
      "grad_norm": 0.4927146160635159,
      "learning_rate": 3.169663624605178e-05,
      "loss": 1.2993,
      "num_input_tokens_seen": 36861564832,
      "step": 46852
    },
    {
      "epoch": 4.970613197538722,
      "grad_norm": 0.588136397889892,
      "learning_rate": 3.16959666713548e-05,
      "loss": 1.36,
      "num_input_tokens_seen": 36862351552,
      "step": 46853
    },
    {
      "epoch": 4.970719287078294,
      "grad_norm": 0.7248051071034228,
      "learning_rate": 3.1695297091483366e-05,
      "loss": 1.3481,
      "num_input_tokens_seen": 36863138384,
      "step": 46854
    },
    {
      "epoch": 4.970825376617865,
      "grad_norm": 0.5659887155980023,
      "learning_rate": 3.1694627506438004e-05,
      "loss": 1.3212,
      "num_input_tokens_seen": 36863925200,
      "step": 46855
    },
    {
      "epoch": 4.970931466157436,
      "grad_norm": 0.6130517552003231,
      "learning_rate": 3.1693957916219236e-05,
      "loss": 1.284,
      "num_input_tokens_seen": 36864711952,
      "step": 46856
    },
    {
      "epoch": 4.971037555697008,
      "grad_norm": 0.5962734767937669,
      "learning_rate": 3.169328832082757e-05,
      "loss": 1.3231,
      "num_input_tokens_seen": 36865498688,
      "step": 46857
    },
    {
      "epoch": 4.971143645236579,
      "grad_norm": 0.5278160998004022,
      "learning_rate": 3.169261872026353e-05,
      "loss": 1.4131,
      "num_input_tokens_seen": 36866285504,
      "step": 46858
    },
    {
      "epoch": 4.971249734776151,
      "grad_norm": 0.6427248430131444,
      "learning_rate": 3.1691949114527624e-05,
      "loss": 1.3362,
      "num_input_tokens_seen": 36867072304,
      "step": 46859
    },
    {
      "epoch": 4.971355824315722,
      "grad_norm": 0.4662899827813561,
      "learning_rate": 3.169127950362038e-05,
      "loss": 1.2413,
      "num_input_tokens_seen": 36867859120,
      "step": 46860
    },
    {
      "epoch": 4.971461913855294,
      "grad_norm": 0.5294774267194547,
      "learning_rate": 3.1690609887542314e-05,
      "loss": 1.3439,
      "num_input_tokens_seen": 36868645824,
      "step": 46861
    },
    {
      "epoch": 4.971568003394865,
      "grad_norm": 0.5173725164752246,
      "learning_rate": 3.168994026629394e-05,
      "loss": 1.3492,
      "num_input_tokens_seen": 36869432640,
      "step": 46862
    },
    {
      "epoch": 4.971674092934436,
      "grad_norm": 0.5821005483012006,
      "learning_rate": 3.1689270639875766e-05,
      "loss": 1.3686,
      "num_input_tokens_seen": 36870219360,
      "step": 46863
    },
    {
      "epoch": 4.971780182474008,
      "grad_norm": 0.5491529957701631,
      "learning_rate": 3.1688601008288336e-05,
      "loss": 1.2853,
      "num_input_tokens_seen": 36871006160,
      "step": 46864
    },
    {
      "epoch": 4.971886272013579,
      "grad_norm": 0.47488081015610506,
      "learning_rate": 3.168793137153214e-05,
      "loss": 1.2922,
      "num_input_tokens_seen": 36871792896,
      "step": 46865
    },
    {
      "epoch": 4.971992361553151,
      "grad_norm": 0.5442435092690937,
      "learning_rate": 3.168726172960771e-05,
      "loss": 1.3057,
      "num_input_tokens_seen": 36872579664,
      "step": 46866
    },
    {
      "epoch": 4.972098451092722,
      "grad_norm": 0.5269159527929065,
      "learning_rate": 3.1686592082515565e-05,
      "loss": 1.3686,
      "num_input_tokens_seen": 36873366448,
      "step": 46867
    },
    {
      "epoch": 4.972204540632294,
      "grad_norm": 0.5312943119499806,
      "learning_rate": 3.168592243025621e-05,
      "loss": 1.3842,
      "num_input_tokens_seen": 36874153200,
      "step": 46868
    },
    {
      "epoch": 4.972310630171865,
      "grad_norm": 0.6009713758739134,
      "learning_rate": 3.168525277283018e-05,
      "loss": 1.2421,
      "num_input_tokens_seen": 36874940016,
      "step": 46869
    },
    {
      "epoch": 4.972416719711436,
      "grad_norm": 0.6545433444007903,
      "learning_rate": 3.1684583110237975e-05,
      "loss": 1.3247,
      "num_input_tokens_seen": 36875726688,
      "step": 46870
    },
    {
      "epoch": 4.972522809251008,
      "grad_norm": 0.6112414355658624,
      "learning_rate": 3.168391344248012e-05,
      "loss": 1.3035,
      "num_input_tokens_seen": 36876513456,
      "step": 46871
    },
    {
      "epoch": 4.972628898790579,
      "grad_norm": 0.6471348694547472,
      "learning_rate": 3.1683243769557133e-05,
      "loss": 1.3803,
      "num_input_tokens_seen": 36877300192,
      "step": 46872
    },
    {
      "epoch": 4.972734988330151,
      "grad_norm": 0.605199420483077,
      "learning_rate": 3.168257409146954e-05,
      "loss": 1.3064,
      "num_input_tokens_seen": 36878086928,
      "step": 46873
    },
    {
      "epoch": 4.972841077869722,
      "grad_norm": 0.5619158248448842,
      "learning_rate": 3.1681904408217835e-05,
      "loss": 1.3596,
      "num_input_tokens_seen": 36878873600,
      "step": 46874
    },
    {
      "epoch": 4.972947167409293,
      "grad_norm": 0.6183608474965396,
      "learning_rate": 3.1681234719802565e-05,
      "loss": 1.2727,
      "num_input_tokens_seen": 36879660416,
      "step": 46875
    },
    {
      "epoch": 4.973053256948865,
      "grad_norm": 0.5781550868975678,
      "learning_rate": 3.168056502622423e-05,
      "loss": 1.3151,
      "num_input_tokens_seen": 36880447168,
      "step": 46876
    },
    {
      "epoch": 4.973159346488436,
      "grad_norm": 0.5969124577237029,
      "learning_rate": 3.167989532748334e-05,
      "loss": 1.2856,
      "num_input_tokens_seen": 36881233904,
      "step": 46877
    },
    {
      "epoch": 4.973265436028008,
      "grad_norm": 0.5806485402407681,
      "learning_rate": 3.167922562358043e-05,
      "loss": 1.2678,
      "num_input_tokens_seen": 36882020688,
      "step": 46878
    },
    {
      "epoch": 4.973371525567579,
      "grad_norm": 0.8699289649442544,
      "learning_rate": 3.167855591451602e-05,
      "loss": 1.2636,
      "num_input_tokens_seen": 36882807488,
      "step": 46879
    },
    {
      "epoch": 4.97347761510715,
      "grad_norm": 0.6589959372745026,
      "learning_rate": 3.16778862002906e-05,
      "loss": 1.4032,
      "num_input_tokens_seen": 36883594240,
      "step": 46880
    },
    {
      "epoch": 4.973583704646722,
      "grad_norm": 0.8932942105864876,
      "learning_rate": 3.167721648090472e-05,
      "loss": 1.2344,
      "num_input_tokens_seen": 36884381104,
      "step": 46881
    },
    {
      "epoch": 4.973689794186293,
      "grad_norm": 0.5852150530079389,
      "learning_rate": 3.167654675635887e-05,
      "loss": 1.231,
      "num_input_tokens_seen": 36885167888,
      "step": 46882
    },
    {
      "epoch": 4.973795883725865,
      "grad_norm": 0.7836285491164374,
      "learning_rate": 3.167587702665358e-05,
      "loss": 1.321,
      "num_input_tokens_seen": 36885954624,
      "step": 46883
    },
    {
      "epoch": 4.973901973265436,
      "grad_norm": 0.6377789695878497,
      "learning_rate": 3.167520729178938e-05,
      "loss": 1.2949,
      "num_input_tokens_seen": 36886741296,
      "step": 46884
    },
    {
      "epoch": 4.974008062805007,
      "grad_norm": 0.5576511618059309,
      "learning_rate": 3.167453755176677e-05,
      "loss": 1.3445,
      "num_input_tokens_seen": 36887528112,
      "step": 46885
    },
    {
      "epoch": 4.974114152344579,
      "grad_norm": 0.7054894773970171,
      "learning_rate": 3.1673867806586275e-05,
      "loss": 1.4709,
      "num_input_tokens_seen": 36888314896,
      "step": 46886
    },
    {
      "epoch": 4.97422024188415,
      "grad_norm": 0.6965935491218878,
      "learning_rate": 3.167319805624841e-05,
      "loss": 1.1967,
      "num_input_tokens_seen": 36889101728,
      "step": 46887
    },
    {
      "epoch": 4.974326331423722,
      "grad_norm": 0.5029654889992256,
      "learning_rate": 3.1672528300753693e-05,
      "loss": 1.3216,
      "num_input_tokens_seen": 36889888528,
      "step": 46888
    },
    {
      "epoch": 4.974432420963293,
      "grad_norm": 0.7598382395362887,
      "learning_rate": 3.167185854010265e-05,
      "loss": 1.3359,
      "num_input_tokens_seen": 36890675296,
      "step": 46889
    },
    {
      "epoch": 4.974538510502865,
      "grad_norm": 0.7525291009483733,
      "learning_rate": 3.167118877429578e-05,
      "loss": 1.2903,
      "num_input_tokens_seen": 36891462144,
      "step": 46890
    },
    {
      "epoch": 4.974644600042436,
      "grad_norm": 0.6178903980410245,
      "learning_rate": 3.1670519003333616e-05,
      "loss": 1.3176,
      "num_input_tokens_seen": 36892248976,
      "step": 46891
    },
    {
      "epoch": 4.974750689582007,
      "grad_norm": 0.6479393550380286,
      "learning_rate": 3.166984922721666e-05,
      "loss": 1.3598,
      "num_input_tokens_seen": 36893035696,
      "step": 46892
    },
    {
      "epoch": 4.974856779121579,
      "grad_norm": 0.5301476006659742,
      "learning_rate": 3.166917944594545e-05,
      "loss": 1.2174,
      "num_input_tokens_seen": 36893822528,
      "step": 46893
    },
    {
      "epoch": 4.97496286866115,
      "grad_norm": 0.5460936849342829,
      "learning_rate": 3.1668509659520495e-05,
      "loss": 1.4276,
      "num_input_tokens_seen": 36894609296,
      "step": 46894
    },
    {
      "epoch": 4.975068958200722,
      "grad_norm": 0.7653225259124017,
      "learning_rate": 3.16678398679423e-05,
      "loss": 1.4364,
      "num_input_tokens_seen": 36895395952,
      "step": 46895
    },
    {
      "epoch": 4.975175047740293,
      "grad_norm": 0.4941905408899894,
      "learning_rate": 3.1667170071211414e-05,
      "loss": 1.2262,
      "num_input_tokens_seen": 36896182656,
      "step": 46896
    },
    {
      "epoch": 4.975281137279865,
      "grad_norm": 0.7071263051649749,
      "learning_rate": 3.166650026932832e-05,
      "loss": 1.2661,
      "num_input_tokens_seen": 36896969408,
      "step": 46897
    },
    {
      "epoch": 4.975387226819436,
      "grad_norm": 0.5880730691877858,
      "learning_rate": 3.1665830462293554e-05,
      "loss": 1.3964,
      "num_input_tokens_seen": 36897756208,
      "step": 46898
    },
    {
      "epoch": 4.975493316359007,
      "grad_norm": 0.472491473904387,
      "learning_rate": 3.166516065010763e-05,
      "loss": 1.2624,
      "num_input_tokens_seen": 36898542944,
      "step": 46899
    },
    {
      "epoch": 4.975599405898579,
      "grad_norm": 0.6059113652967106,
      "learning_rate": 3.166449083277107e-05,
      "loss": 1.308,
      "num_input_tokens_seen": 36899329760,
      "step": 46900
    },
    {
      "epoch": 4.97570549543815,
      "grad_norm": 0.5483024224382457,
      "learning_rate": 3.166382101028438e-05,
      "loss": 1.3177,
      "num_input_tokens_seen": 36900116480,
      "step": 46901
    },
    {
      "epoch": 4.975811584977722,
      "grad_norm": 0.5045678784642539,
      "learning_rate": 3.166315118264809e-05,
      "loss": 1.3313,
      "num_input_tokens_seen": 36900903264,
      "step": 46902
    },
    {
      "epoch": 4.975917674517293,
      "grad_norm": 0.4823071773969758,
      "learning_rate": 3.16624813498627e-05,
      "loss": 1.1804,
      "num_input_tokens_seen": 36901690128,
      "step": 46903
    },
    {
      "epoch": 4.976023764056864,
      "grad_norm": 0.5979632808651804,
      "learning_rate": 3.166181151192875e-05,
      "loss": 1.2351,
      "num_input_tokens_seen": 36902476928,
      "step": 46904
    },
    {
      "epoch": 4.976129853596436,
      "grad_norm": 0.5653142391364278,
      "learning_rate": 3.166114166884675e-05,
      "loss": 1.3536,
      "num_input_tokens_seen": 36903263664,
      "step": 46905
    },
    {
      "epoch": 4.976235943136007,
      "grad_norm": 0.6259806741841669,
      "learning_rate": 3.166047182061721e-05,
      "loss": 1.4138,
      "num_input_tokens_seen": 36904050496,
      "step": 46906
    },
    {
      "epoch": 4.9763420326755785,
      "grad_norm": 0.5668844755606421,
      "learning_rate": 3.165980196724065e-05,
      "loss": 1.2252,
      "num_input_tokens_seen": 36904837216,
      "step": 46907
    },
    {
      "epoch": 4.9764481222151495,
      "grad_norm": 0.6521560431805331,
      "learning_rate": 3.1659132108717604e-05,
      "loss": 1.3791,
      "num_input_tokens_seen": 36905624016,
      "step": 46908
    },
    {
      "epoch": 4.976554211754721,
      "grad_norm": 0.4969699217216405,
      "learning_rate": 3.165846224504857e-05,
      "loss": 1.2834,
      "num_input_tokens_seen": 36906410896,
      "step": 46909
    },
    {
      "epoch": 4.9766603012942925,
      "grad_norm": 0.8437735336614532,
      "learning_rate": 3.165779237623406e-05,
      "loss": 1.3921,
      "num_input_tokens_seen": 36907197680,
      "step": 46910
    },
    {
      "epoch": 4.9767663908338635,
      "grad_norm": 0.5774086397979892,
      "learning_rate": 3.165712250227461e-05,
      "loss": 1.3811,
      "num_input_tokens_seen": 36907984384,
      "step": 46911
    },
    {
      "epoch": 4.976872480373435,
      "grad_norm": 0.7380224910270858,
      "learning_rate": 3.165645262317074e-05,
      "loss": 1.4259,
      "num_input_tokens_seen": 36908771136,
      "step": 46912
    },
    {
      "epoch": 4.9769785699130065,
      "grad_norm": 0.528226857830809,
      "learning_rate": 3.1655782738922954e-05,
      "loss": 1.2799,
      "num_input_tokens_seen": 36909557936,
      "step": 46913
    },
    {
      "epoch": 4.9770846594525775,
      "grad_norm": 0.6001854587281181,
      "learning_rate": 3.165511284953176e-05,
      "loss": 1.2457,
      "num_input_tokens_seen": 36910344768,
      "step": 46914
    },
    {
      "epoch": 4.977190748992149,
      "grad_norm": 0.6016246228253143,
      "learning_rate": 3.165444295499771e-05,
      "loss": 1.2657,
      "num_input_tokens_seen": 36911131552,
      "step": 46915
    },
    {
      "epoch": 4.9772968385317204,
      "grad_norm": 0.481294954398186,
      "learning_rate": 3.16537730553213e-05,
      "loss": 1.3107,
      "num_input_tokens_seen": 36911918240,
      "step": 46916
    },
    {
      "epoch": 4.977402928071292,
      "grad_norm": 0.5814865280139391,
      "learning_rate": 3.1653103150503035e-05,
      "loss": 1.3199,
      "num_input_tokens_seen": 36912705024,
      "step": 46917
    },
    {
      "epoch": 4.977509017610863,
      "grad_norm": 0.5048427757467577,
      "learning_rate": 3.165243324054346e-05,
      "loss": 1.3394,
      "num_input_tokens_seen": 36913491760,
      "step": 46918
    },
    {
      "epoch": 4.977615107150435,
      "grad_norm": 1.0016750356847737,
      "learning_rate": 3.1651763325443075e-05,
      "loss": 1.3241,
      "num_input_tokens_seen": 36914278528,
      "step": 46919
    },
    {
      "epoch": 4.977721196690006,
      "grad_norm": 0.6424637548652693,
      "learning_rate": 3.16510934052024e-05,
      "loss": 1.218,
      "num_input_tokens_seen": 36915065248,
      "step": 46920
    },
    {
      "epoch": 4.977827286229578,
      "grad_norm": 0.7948093419168878,
      "learning_rate": 3.165042347982196e-05,
      "loss": 1.2715,
      "num_input_tokens_seen": 36915852048,
      "step": 46921
    },
    {
      "epoch": 4.977933375769149,
      "grad_norm": 0.8595039205304128,
      "learning_rate": 3.164975354930227e-05,
      "loss": 1.2726,
      "num_input_tokens_seen": 36916638864,
      "step": 46922
    },
    {
      "epoch": 4.97803946530872,
      "grad_norm": 0.525038301672505,
      "learning_rate": 3.1649083613643835e-05,
      "loss": 1.3078,
      "num_input_tokens_seen": 36917425600,
      "step": 46923
    },
    {
      "epoch": 4.978145554848292,
      "grad_norm": 0.8155419566517138,
      "learning_rate": 3.16484136728472e-05,
      "loss": 1.2921,
      "num_input_tokens_seen": 36918212384,
      "step": 46924
    },
    {
      "epoch": 4.978251644387863,
      "grad_norm": 0.7147668892023887,
      "learning_rate": 3.164774372691285e-05,
      "loss": 1.3547,
      "num_input_tokens_seen": 36918999120,
      "step": 46925
    },
    {
      "epoch": 4.978357733927435,
      "grad_norm": 0.5594850917956609,
      "learning_rate": 3.1647073775841316e-05,
      "loss": 1.3535,
      "num_input_tokens_seen": 36919786000,
      "step": 46926
    },
    {
      "epoch": 4.978463823467006,
      "grad_norm": 0.7661729061561214,
      "learning_rate": 3.164640381963313e-05,
      "loss": 1.3612,
      "num_input_tokens_seen": 36920572736,
      "step": 46927
    },
    {
      "epoch": 4.978569913006577,
      "grad_norm": 0.7408613937605647,
      "learning_rate": 3.164573385828879e-05,
      "loss": 1.2134,
      "num_input_tokens_seen": 36921359520,
      "step": 46928
    },
    {
      "epoch": 4.978676002546149,
      "grad_norm": 0.6761787878266642,
      "learning_rate": 3.164506389180883e-05,
      "loss": 1.238,
      "num_input_tokens_seen": 36922146288,
      "step": 46929
    },
    {
      "epoch": 4.97878209208572,
      "grad_norm": 0.8163321599763672,
      "learning_rate": 3.164439392019376e-05,
      "loss": 1.3775,
      "num_input_tokens_seen": 36922933072,
      "step": 46930
    },
    {
      "epoch": 4.978888181625292,
      "grad_norm": 0.5463335490080211,
      "learning_rate": 3.1643723943444094e-05,
      "loss": 1.2825,
      "num_input_tokens_seen": 36923719840,
      "step": 46931
    },
    {
      "epoch": 4.978994271164863,
      "grad_norm": 0.65913322398247,
      "learning_rate": 3.164305396156035e-05,
      "loss": 1.1623,
      "num_input_tokens_seen": 36924506592,
      "step": 46932
    },
    {
      "epoch": 4.979100360704434,
      "grad_norm": 0.7518032641954131,
      "learning_rate": 3.164238397454306e-05,
      "loss": 1.3634,
      "num_input_tokens_seen": 36925293264,
      "step": 46933
    },
    {
      "epoch": 4.979206450244006,
      "grad_norm": 0.5138967968687259,
      "learning_rate": 3.1641713982392717e-05,
      "loss": 1.3451,
      "num_input_tokens_seen": 36926079984,
      "step": 46934
    },
    {
      "epoch": 4.979312539783577,
      "grad_norm": 0.6141640015865868,
      "learning_rate": 3.164104398510985e-05,
      "loss": 1.2381,
      "num_input_tokens_seen": 36926866768,
      "step": 46935
    },
    {
      "epoch": 4.979418629323149,
      "grad_norm": 0.6687142120580857,
      "learning_rate": 3.164037398269499e-05,
      "loss": 1.2364,
      "num_input_tokens_seen": 36927653568,
      "step": 46936
    },
    {
      "epoch": 4.97952471886272,
      "grad_norm": 0.5487336626138214,
      "learning_rate": 3.163970397514864e-05,
      "loss": 1.2814,
      "num_input_tokens_seen": 36928440368,
      "step": 46937
    },
    {
      "epoch": 4.979630808402291,
      "grad_norm": 0.6700691563654125,
      "learning_rate": 3.1639033962471324e-05,
      "loss": 1.3248,
      "num_input_tokens_seen": 36929227104,
      "step": 46938
    },
    {
      "epoch": 4.979736897941863,
      "grad_norm": 0.6981030389662345,
      "learning_rate": 3.1638363944663554e-05,
      "loss": 1.3886,
      "num_input_tokens_seen": 36930013856,
      "step": 46939
    },
    {
      "epoch": 4.979842987481434,
      "grad_norm": 0.5244853044982413,
      "learning_rate": 3.1637693921725855e-05,
      "loss": 1.2243,
      "num_input_tokens_seen": 36930800688,
      "step": 46940
    },
    {
      "epoch": 4.979949077021006,
      "grad_norm": 0.6176840616234569,
      "learning_rate": 3.1637023893658735e-05,
      "loss": 1.3459,
      "num_input_tokens_seen": 36931587472,
      "step": 46941
    },
    {
      "epoch": 4.980055166560577,
      "grad_norm": 0.576705357975134,
      "learning_rate": 3.163635386046273e-05,
      "loss": 1.2816,
      "num_input_tokens_seen": 36932374272,
      "step": 46942
    },
    {
      "epoch": 4.980161256100148,
      "grad_norm": 0.6966706200461824,
      "learning_rate": 3.163568382213833e-05,
      "loss": 1.3271,
      "num_input_tokens_seen": 36933160992,
      "step": 46943
    },
    {
      "epoch": 4.98026734563972,
      "grad_norm": 0.507141929672103,
      "learning_rate": 3.1635013778686076e-05,
      "loss": 1.2609,
      "num_input_tokens_seen": 36933947824,
      "step": 46944
    },
    {
      "epoch": 4.980373435179291,
      "grad_norm": 0.54086183113757,
      "learning_rate": 3.1634343730106473e-05,
      "loss": 1.2818,
      "num_input_tokens_seen": 36934734576,
      "step": 46945
    },
    {
      "epoch": 4.980479524718863,
      "grad_norm": 0.6544617993072691,
      "learning_rate": 3.163367367640005e-05,
      "loss": 1.3387,
      "num_input_tokens_seen": 36935521360,
      "step": 46946
    },
    {
      "epoch": 4.980585614258434,
      "grad_norm": 0.5552731407133988,
      "learning_rate": 3.163300361756731e-05,
      "loss": 1.3401,
      "num_input_tokens_seen": 36936308160,
      "step": 46947
    },
    {
      "epoch": 4.980691703798006,
      "grad_norm": 0.6194903976746258,
      "learning_rate": 3.16323335536088e-05,
      "loss": 1.3663,
      "num_input_tokens_seen": 36937094928,
      "step": 46948
    },
    {
      "epoch": 4.980797793337577,
      "grad_norm": 0.5695758742036446,
      "learning_rate": 3.1631663484524994e-05,
      "loss": 1.2703,
      "num_input_tokens_seen": 36937881648,
      "step": 46949
    },
    {
      "epoch": 4.980903882877149,
      "grad_norm": 0.5373538548230259,
      "learning_rate": 3.1630993410316444e-05,
      "loss": 1.2263,
      "num_input_tokens_seen": 36938668560,
      "step": 46950
    },
    {
      "epoch": 4.98100997241672,
      "grad_norm": 0.5061580398918445,
      "learning_rate": 3.163032333098366e-05,
      "loss": 1.2299,
      "num_input_tokens_seen": 36939455312,
      "step": 46951
    },
    {
      "epoch": 4.981116061956291,
      "grad_norm": 0.6313193595533946,
      "learning_rate": 3.162965324652715e-05,
      "loss": 1.3412,
      "num_input_tokens_seen": 36940242096,
      "step": 46952
    },
    {
      "epoch": 4.981222151495863,
      "grad_norm": 0.8139624386040576,
      "learning_rate": 3.162898315694743e-05,
      "loss": 1.3829,
      "num_input_tokens_seen": 36941028832,
      "step": 46953
    },
    {
      "epoch": 4.981328241035434,
      "grad_norm": 0.5281340235122927,
      "learning_rate": 3.162831306224504e-05,
      "loss": 1.267,
      "num_input_tokens_seen": 36941815616,
      "step": 46954
    },
    {
      "epoch": 4.981434330575006,
      "grad_norm": 0.6786829749804848,
      "learning_rate": 3.162764296242048e-05,
      "loss": 1.2858,
      "num_input_tokens_seen": 36942602384,
      "step": 46955
    },
    {
      "epoch": 4.981540420114577,
      "grad_norm": 0.5973257804803358,
      "learning_rate": 3.162697285747427e-05,
      "loss": 1.3387,
      "num_input_tokens_seen": 36943389024,
      "step": 46956
    },
    {
      "epoch": 4.981646509654148,
      "grad_norm": 0.5755683465786202,
      "learning_rate": 3.1626302747406936e-05,
      "loss": 1.3276,
      "num_input_tokens_seen": 36944175904,
      "step": 46957
    },
    {
      "epoch": 4.98175259919372,
      "grad_norm": 0.6389880339199921,
      "learning_rate": 3.162563263221899e-05,
      "loss": 1.2165,
      "num_input_tokens_seen": 36944962672,
      "step": 46958
    },
    {
      "epoch": 4.981858688733291,
      "grad_norm": 0.8771729463617913,
      "learning_rate": 3.162496251191095e-05,
      "loss": 1.4031,
      "num_input_tokens_seen": 36945749424,
      "step": 46959
    },
    {
      "epoch": 4.981964778272863,
      "grad_norm": 0.545790671744595,
      "learning_rate": 3.1624292386483325e-05,
      "loss": 1.3699,
      "num_input_tokens_seen": 36946536224,
      "step": 46960
    },
    {
      "epoch": 4.982070867812434,
      "grad_norm": 0.835517267718301,
      "learning_rate": 3.162362225593664e-05,
      "loss": 1.3152,
      "num_input_tokens_seen": 36947323040,
      "step": 46961
    },
    {
      "epoch": 4.982176957352005,
      "grad_norm": 0.5114664079329877,
      "learning_rate": 3.162295212027142e-05,
      "loss": 1.3169,
      "num_input_tokens_seen": 36948109760,
      "step": 46962
    },
    {
      "epoch": 4.982283046891577,
      "grad_norm": 0.658315323894749,
      "learning_rate": 3.162228197948818e-05,
      "loss": 1.4396,
      "num_input_tokens_seen": 36948896576,
      "step": 46963
    },
    {
      "epoch": 4.982389136431148,
      "grad_norm": 0.7204746937074032,
      "learning_rate": 3.162161183358743e-05,
      "loss": 1.2579,
      "num_input_tokens_seen": 36949683360,
      "step": 46964
    },
    {
      "epoch": 4.98249522597072,
      "grad_norm": 0.5329507396285315,
      "learning_rate": 3.1620941682569696e-05,
      "loss": 1.3733,
      "num_input_tokens_seen": 36950470048,
      "step": 46965
    },
    {
      "epoch": 4.982601315510291,
      "grad_norm": 0.7361710766854446,
      "learning_rate": 3.162027152643548e-05,
      "loss": 1.3364,
      "num_input_tokens_seen": 36951256816,
      "step": 46966
    },
    {
      "epoch": 4.982707405049862,
      "grad_norm": 0.5165308183963156,
      "learning_rate": 3.161960136518533e-05,
      "loss": 1.2741,
      "num_input_tokens_seen": 36952043536,
      "step": 46967
    },
    {
      "epoch": 4.982813494589434,
      "grad_norm": 0.520460810142733,
      "learning_rate": 3.161893119881974e-05,
      "loss": 1.3034,
      "num_input_tokens_seen": 36952830320,
      "step": 46968
    },
    {
      "epoch": 4.982919584129005,
      "grad_norm": 0.6960774957984153,
      "learning_rate": 3.161826102733923e-05,
      "loss": 1.2836,
      "num_input_tokens_seen": 36953617104,
      "step": 46969
    },
    {
      "epoch": 4.9830256736685765,
      "grad_norm": 0.5102984708473215,
      "learning_rate": 3.161759085074433e-05,
      "loss": 1.2173,
      "num_input_tokens_seen": 36954403936,
      "step": 46970
    },
    {
      "epoch": 4.9831317632081475,
      "grad_norm": 0.5379814323369808,
      "learning_rate": 3.161692066903554e-05,
      "loss": 1.3265,
      "num_input_tokens_seen": 36955190672,
      "step": 46971
    },
    {
      "epoch": 4.983237852747719,
      "grad_norm": 0.6182501999584211,
      "learning_rate": 3.161625048221339e-05,
      "loss": 1.22,
      "num_input_tokens_seen": 36955977488,
      "step": 46972
    },
    {
      "epoch": 4.9833439422872905,
      "grad_norm": 0.49634334225810434,
      "learning_rate": 3.16155802902784e-05,
      "loss": 1.3088,
      "num_input_tokens_seen": 36956764176,
      "step": 46973
    },
    {
      "epoch": 4.9834500318268615,
      "grad_norm": 0.6724272149270559,
      "learning_rate": 3.161491009323108e-05,
      "loss": 1.3501,
      "num_input_tokens_seen": 36957550944,
      "step": 46974
    },
    {
      "epoch": 4.9835561213664334,
      "grad_norm": 0.609672384812433,
      "learning_rate": 3.161423989107196e-05,
      "loss": 1.2858,
      "num_input_tokens_seen": 36958337744,
      "step": 46975
    },
    {
      "epoch": 4.9836622109060045,
      "grad_norm": 0.5966841601870805,
      "learning_rate": 3.161356968380153e-05,
      "loss": 1.4477,
      "num_input_tokens_seen": 36959124464,
      "step": 46976
    },
    {
      "epoch": 4.983768300445576,
      "grad_norm": 0.5648916756385823,
      "learning_rate": 3.161289947142035e-05,
      "loss": 1.2245,
      "num_input_tokens_seen": 36959911280,
      "step": 46977
    },
    {
      "epoch": 4.983874389985147,
      "grad_norm": 0.5392177138156569,
      "learning_rate": 3.1612229253928905e-05,
      "loss": 1.2557,
      "num_input_tokens_seen": 36960698112,
      "step": 46978
    },
    {
      "epoch": 4.983980479524719,
      "grad_norm": 0.48230583837761204,
      "learning_rate": 3.161155903132772e-05,
      "loss": 1.216,
      "num_input_tokens_seen": 36961484896,
      "step": 46979
    },
    {
      "epoch": 4.98408656906429,
      "grad_norm": 0.5178116709405504,
      "learning_rate": 3.1610888803617325e-05,
      "loss": 1.3554,
      "num_input_tokens_seen": 36962271728,
      "step": 46980
    },
    {
      "epoch": 4.984192658603861,
      "grad_norm": 0.5447443642629864,
      "learning_rate": 3.1610218570798224e-05,
      "loss": 1.1986,
      "num_input_tokens_seen": 36963058496,
      "step": 46981
    },
    {
      "epoch": 4.984298748143433,
      "grad_norm": 0.6147264096318859,
      "learning_rate": 3.160954833287094e-05,
      "loss": 1.4193,
      "num_input_tokens_seen": 36963845248,
      "step": 46982
    },
    {
      "epoch": 4.984404837683004,
      "grad_norm": 0.5937753566350846,
      "learning_rate": 3.160887808983599e-05,
      "loss": 1.2591,
      "num_input_tokens_seen": 36964632016,
      "step": 46983
    },
    {
      "epoch": 4.984510927222576,
      "grad_norm": 0.552239925351164,
      "learning_rate": 3.1608207841693894e-05,
      "loss": 1.2361,
      "num_input_tokens_seen": 36965418864,
      "step": 46984
    },
    {
      "epoch": 4.984617016762147,
      "grad_norm": 0.5201116352423458,
      "learning_rate": 3.160753758844517e-05,
      "loss": 1.3163,
      "num_input_tokens_seen": 36966205600,
      "step": 46985
    },
    {
      "epoch": 4.984723106301718,
      "grad_norm": 0.5915627414522109,
      "learning_rate": 3.160686733009033e-05,
      "loss": 1.3023,
      "num_input_tokens_seen": 36966992416,
      "step": 46986
    },
    {
      "epoch": 4.98482919584129,
      "grad_norm": 0.6326374508303638,
      "learning_rate": 3.16061970666299e-05,
      "loss": 1.2975,
      "num_input_tokens_seen": 36967779104,
      "step": 46987
    },
    {
      "epoch": 4.984935285380861,
      "grad_norm": 0.563679591648013,
      "learning_rate": 3.1605526798064406e-05,
      "loss": 1.3605,
      "num_input_tokens_seen": 36968565920,
      "step": 46988
    },
    {
      "epoch": 4.985041374920433,
      "grad_norm": 0.768638943737796,
      "learning_rate": 3.1604856524394336e-05,
      "loss": 1.3223,
      "num_input_tokens_seen": 36969352640,
      "step": 46989
    },
    {
      "epoch": 4.985147464460004,
      "grad_norm": 0.7030569080582152,
      "learning_rate": 3.1604186245620235e-05,
      "loss": 1.2591,
      "num_input_tokens_seen": 36970139376,
      "step": 46990
    },
    {
      "epoch": 4.985253553999575,
      "grad_norm": 0.6194677072981593,
      "learning_rate": 3.160351596174262e-05,
      "loss": 1.3966,
      "num_input_tokens_seen": 36970926160,
      "step": 46991
    },
    {
      "epoch": 4.985359643539147,
      "grad_norm": 0.5963933046762246,
      "learning_rate": 3.1602845672761995e-05,
      "loss": 1.2734,
      "num_input_tokens_seen": 36971712864,
      "step": 46992
    },
    {
      "epoch": 4.985465733078718,
      "grad_norm": 0.6865437048848426,
      "learning_rate": 3.1602175378678885e-05,
      "loss": 1.3369,
      "num_input_tokens_seen": 36972499568,
      "step": 46993
    },
    {
      "epoch": 4.98557182261829,
      "grad_norm": 0.5123303634124661,
      "learning_rate": 3.1601505079493804e-05,
      "loss": 1.2683,
      "num_input_tokens_seen": 36973286272,
      "step": 46994
    },
    {
      "epoch": 4.985677912157861,
      "grad_norm": 0.8018135418483249,
      "learning_rate": 3.1600834775207274e-05,
      "loss": 1.335,
      "num_input_tokens_seen": 36974073104,
      "step": 46995
    },
    {
      "epoch": 4.985784001697432,
      "grad_norm": 0.623408957510942,
      "learning_rate": 3.160016446581982e-05,
      "loss": 1.2551,
      "num_input_tokens_seen": 36974859984,
      "step": 46996
    },
    {
      "epoch": 4.985890091237004,
      "grad_norm": 0.7289308240145934,
      "learning_rate": 3.159949415133194e-05,
      "loss": 1.4014,
      "num_input_tokens_seen": 36975646800,
      "step": 46997
    },
    {
      "epoch": 4.985996180776575,
      "grad_norm": 0.46458026977042877,
      "learning_rate": 3.1598823831744175e-05,
      "loss": 1.1991,
      "num_input_tokens_seen": 36976433696,
      "step": 46998
    },
    {
      "epoch": 4.986102270316147,
      "grad_norm": 0.5397487939440527,
      "learning_rate": 3.159815350705703e-05,
      "loss": 1.3132,
      "num_input_tokens_seen": 36977220544,
      "step": 46999
    },
    {
      "epoch": 4.986208359855718,
      "grad_norm": 0.4960251851245953,
      "learning_rate": 3.159748317727102e-05,
      "loss": 1.3044,
      "num_input_tokens_seen": 36978007296,
      "step": 47000
    },
    {
      "epoch": 4.986208359855718,
      "eval_loss": 1.530644416809082,
      "eval_runtime": 65.2019,
      "eval_samples_per_second": 46.011,
      "eval_steps_per_second": 0.491,
      "num_input_tokens_seen": 36978007296,
      "step": 47000
    },
    {
      "epoch": 4.98631444939529,
      "grad_norm": 0.5869721606888992,
      "learning_rate": 3.159681284238668e-05,
      "loss": 1.332,
      "num_input_tokens_seen": 36978794064,
      "step": 47001
    },
    {
      "epoch": 4.986420538934861,
      "grad_norm": 0.5298139492307433,
      "learning_rate": 3.159614250240451e-05,
      "loss": 1.3004,
      "num_input_tokens_seen": 36979580880,
      "step": 47002
    },
    {
      "epoch": 4.986526628474432,
      "grad_norm": 0.48414170148710567,
      "learning_rate": 3.159547215732503e-05,
      "loss": 1.2656,
      "num_input_tokens_seen": 36980367664,
      "step": 47003
    },
    {
      "epoch": 4.986632718014004,
      "grad_norm": 0.4949859195780816,
      "learning_rate": 3.159480180714877e-05,
      "loss": 1.3331,
      "num_input_tokens_seen": 36981154416,
      "step": 47004
    },
    {
      "epoch": 4.986738807553575,
      "grad_norm": 0.6531621609164396,
      "learning_rate": 3.159413145187624e-05,
      "loss": 1.3669,
      "num_input_tokens_seen": 36981941184,
      "step": 47005
    },
    {
      "epoch": 4.986844897093147,
      "grad_norm": 0.47613905405835655,
      "learning_rate": 3.159346109150795e-05,
      "loss": 1.273,
      "num_input_tokens_seen": 36982727984,
      "step": 47006
    },
    {
      "epoch": 4.986950986632718,
      "grad_norm": 0.7036340702824582,
      "learning_rate": 3.159279072604444e-05,
      "loss": 1.3498,
      "num_input_tokens_seen": 36983514768,
      "step": 47007
    },
    {
      "epoch": 4.98705707617229,
      "grad_norm": 0.7126231110139685,
      "learning_rate": 3.159212035548621e-05,
      "loss": 1.3017,
      "num_input_tokens_seen": 36984301520,
      "step": 47008
    },
    {
      "epoch": 4.987163165711861,
      "grad_norm": 0.558031308712737,
      "learning_rate": 3.159144997983378e-05,
      "loss": 1.2608,
      "num_input_tokens_seen": 36985088384,
      "step": 47009
    },
    {
      "epoch": 4.987269255251432,
      "grad_norm": 0.9500433523431022,
      "learning_rate": 3.159077959908767e-05,
      "loss": 1.3033,
      "num_input_tokens_seen": 36985875216,
      "step": 47010
    },
    {
      "epoch": 4.987375344791004,
      "grad_norm": 0.6099818459980133,
      "learning_rate": 3.1590109213248404e-05,
      "loss": 1.3084,
      "num_input_tokens_seen": 36986661984,
      "step": 47011
    },
    {
      "epoch": 4.987481434330575,
      "grad_norm": 0.7128869513402882,
      "learning_rate": 3.158943882231649e-05,
      "loss": 1.2396,
      "num_input_tokens_seen": 36987448816,
      "step": 47012
    },
    {
      "epoch": 4.987587523870147,
      "grad_norm": 0.6677720117289425,
      "learning_rate": 3.1588768426292455e-05,
      "loss": 1.4267,
      "num_input_tokens_seen": 36988235504,
      "step": 47013
    },
    {
      "epoch": 4.987693613409718,
      "grad_norm": 1.0278720720543848,
      "learning_rate": 3.1588098025176805e-05,
      "loss": 1.3785,
      "num_input_tokens_seen": 36989022256,
      "step": 47014
    },
    {
      "epoch": 4.987799702949289,
      "grad_norm": 0.7213156605169069,
      "learning_rate": 3.158742761897008e-05,
      "loss": 1.3211,
      "num_input_tokens_seen": 36989808944,
      "step": 47015
    },
    {
      "epoch": 4.987905792488861,
      "grad_norm": 0.6256845464560786,
      "learning_rate": 3.1586757207672776e-05,
      "loss": 1.2735,
      "num_input_tokens_seen": 36990595744,
      "step": 47016
    },
    {
      "epoch": 4.988011882028432,
      "grad_norm": 0.9401317557605808,
      "learning_rate": 3.1586086791285414e-05,
      "loss": 1.2236,
      "num_input_tokens_seen": 36991382512,
      "step": 47017
    },
    {
      "epoch": 4.988117971568004,
      "grad_norm": 0.8208174860031099,
      "learning_rate": 3.158541636980852e-05,
      "loss": 1.3284,
      "num_input_tokens_seen": 36992169136,
      "step": 47018
    },
    {
      "epoch": 4.988224061107575,
      "grad_norm": 0.8708451263521018,
      "learning_rate": 3.158474594324262e-05,
      "loss": 1.2115,
      "num_input_tokens_seen": 36992955872,
      "step": 47019
    },
    {
      "epoch": 4.988330150647146,
      "grad_norm": 0.8051631166035425,
      "learning_rate": 3.158407551158821e-05,
      "loss": 1.2876,
      "num_input_tokens_seen": 36993742624,
      "step": 47020
    },
    {
      "epoch": 4.988436240186718,
      "grad_norm": 0.7691552216873491,
      "learning_rate": 3.1583405074845824e-05,
      "loss": 1.3191,
      "num_input_tokens_seen": 36994529312,
      "step": 47021
    },
    {
      "epoch": 4.988542329726289,
      "grad_norm": 0.9483801711652091,
      "learning_rate": 3.1582734633015976e-05,
      "loss": 1.2812,
      "num_input_tokens_seen": 36995316208,
      "step": 47022
    },
    {
      "epoch": 4.988648419265861,
      "grad_norm": 0.7318642908578394,
      "learning_rate": 3.158206418609918e-05,
      "loss": 1.2557,
      "num_input_tokens_seen": 36996103008,
      "step": 47023
    },
    {
      "epoch": 4.988754508805432,
      "grad_norm": 0.5609635310359197,
      "learning_rate": 3.158139373409596e-05,
      "loss": 1.2638,
      "num_input_tokens_seen": 36996889744,
      "step": 47024
    },
    {
      "epoch": 4.988860598345003,
      "grad_norm": 0.7721581529498014,
      "learning_rate": 3.1580723277006835e-05,
      "loss": 1.2654,
      "num_input_tokens_seen": 36997676448,
      "step": 47025
    },
    {
      "epoch": 4.988966687884575,
      "grad_norm": 0.7303874866707768,
      "learning_rate": 3.158005281483232e-05,
      "loss": 1.3073,
      "num_input_tokens_seen": 36998463280,
      "step": 47026
    },
    {
      "epoch": 4.989072777424146,
      "grad_norm": 0.49050821268041317,
      "learning_rate": 3.1579382347572925e-05,
      "loss": 1.2316,
      "num_input_tokens_seen": 36999250112,
      "step": 47027
    },
    {
      "epoch": 4.989178866963718,
      "grad_norm": 0.7410419533801402,
      "learning_rate": 3.157871187522919e-05,
      "loss": 1.2642,
      "num_input_tokens_seen": 37000036912,
      "step": 47028
    },
    {
      "epoch": 4.989284956503289,
      "grad_norm": 0.8309090867417935,
      "learning_rate": 3.1578041397801604e-05,
      "loss": 1.3238,
      "num_input_tokens_seen": 37000823600,
      "step": 47029
    },
    {
      "epoch": 4.9893910460428605,
      "grad_norm": 0.5725841775932603,
      "learning_rate": 3.1577370915290716e-05,
      "loss": 1.2157,
      "num_input_tokens_seen": 37001610432,
      "step": 47030
    },
    {
      "epoch": 4.989497135582432,
      "grad_norm": 0.610080442049539,
      "learning_rate": 3.157670042769702e-05,
      "loss": 1.2958,
      "num_input_tokens_seen": 37002397152,
      "step": 47031
    },
    {
      "epoch": 4.989603225122003,
      "grad_norm": 0.7335417214914929,
      "learning_rate": 3.1576029935021046e-05,
      "loss": 1.3398,
      "num_input_tokens_seen": 37003183888,
      "step": 47032
    },
    {
      "epoch": 4.9897093146615745,
      "grad_norm": 0.49084404445908414,
      "learning_rate": 3.157535943726331e-05,
      "loss": 1.2824,
      "num_input_tokens_seen": 37003970624,
      "step": 47033
    },
    {
      "epoch": 4.9898154042011456,
      "grad_norm": 0.76566989510367,
      "learning_rate": 3.1574688934424326e-05,
      "loss": 1.3621,
      "num_input_tokens_seen": 37004757376,
      "step": 47034
    },
    {
      "epoch": 4.9899214937407175,
      "grad_norm": 0.6902479446504828,
      "learning_rate": 3.157401842650461e-05,
      "loss": 1.3112,
      "num_input_tokens_seen": 37005544256,
      "step": 47035
    },
    {
      "epoch": 4.9900275832802885,
      "grad_norm": 0.5433243888404382,
      "learning_rate": 3.15733479135047e-05,
      "loss": 1.3353,
      "num_input_tokens_seen": 37006331024,
      "step": 47036
    },
    {
      "epoch": 4.99013367281986,
      "grad_norm": 1.0212848828814443,
      "learning_rate": 3.157267739542509e-05,
      "loss": 1.4098,
      "num_input_tokens_seen": 37007117696,
      "step": 47037
    },
    {
      "epoch": 4.9902397623594315,
      "grad_norm": 0.5309531849190708,
      "learning_rate": 3.15720068722663e-05,
      "loss": 1.2761,
      "num_input_tokens_seen": 37007904496,
      "step": 47038
    },
    {
      "epoch": 4.9903458518990025,
      "grad_norm": 0.5249826045714299,
      "learning_rate": 3.157133634402887e-05,
      "loss": 1.2336,
      "num_input_tokens_seen": 37008691296,
      "step": 47039
    },
    {
      "epoch": 4.990451941438574,
      "grad_norm": 0.560514343633401,
      "learning_rate": 3.15706658107133e-05,
      "loss": 1.2758,
      "num_input_tokens_seen": 37009478128,
      "step": 47040
    },
    {
      "epoch": 4.990558030978145,
      "grad_norm": 0.4908204304066942,
      "learning_rate": 3.156999527232011e-05,
      "loss": 1.1899,
      "num_input_tokens_seen": 37010265056,
      "step": 47041
    },
    {
      "epoch": 4.990664120517717,
      "grad_norm": 0.5908291936064065,
      "learning_rate": 3.156932472884982e-05,
      "loss": 1.3234,
      "num_input_tokens_seen": 37011051808,
      "step": 47042
    },
    {
      "epoch": 4.990770210057288,
      "grad_norm": 0.4865071136855597,
      "learning_rate": 3.1568654180302946e-05,
      "loss": 1.2528,
      "num_input_tokens_seen": 37011838592,
      "step": 47043
    },
    {
      "epoch": 4.990876299596859,
      "grad_norm": 0.6102024039832362,
      "learning_rate": 3.156798362668002e-05,
      "loss": 1.2762,
      "num_input_tokens_seen": 37012625376,
      "step": 47044
    },
    {
      "epoch": 4.990982389136431,
      "grad_norm": 0.48734181218224676,
      "learning_rate": 3.1567313067981544e-05,
      "loss": 1.2406,
      "num_input_tokens_seen": 37013412144,
      "step": 47045
    },
    {
      "epoch": 4.991088478676002,
      "grad_norm": 0.5708727678670773,
      "learning_rate": 3.1566642504208036e-05,
      "loss": 1.2527,
      "num_input_tokens_seen": 37014198944,
      "step": 47046
    },
    {
      "epoch": 4.991194568215574,
      "grad_norm": 0.6496305549588036,
      "learning_rate": 3.156597193536002e-05,
      "loss": 1.3236,
      "num_input_tokens_seen": 37014985664,
      "step": 47047
    },
    {
      "epoch": 4.991300657755145,
      "grad_norm": 0.5163858720556701,
      "learning_rate": 3.156530136143802e-05,
      "loss": 1.3176,
      "num_input_tokens_seen": 37015772448,
      "step": 47048
    },
    {
      "epoch": 4.991406747294716,
      "grad_norm": 0.6991578165272766,
      "learning_rate": 3.156463078244254e-05,
      "loss": 1.3221,
      "num_input_tokens_seen": 37016559152,
      "step": 47049
    },
    {
      "epoch": 4.991512836834288,
      "grad_norm": 0.539364931996268,
      "learning_rate": 3.1563960198374115e-05,
      "loss": 1.3591,
      "num_input_tokens_seen": 37017345952,
      "step": 47050
    },
    {
      "epoch": 4.991618926373859,
      "grad_norm": 0.6212632418827202,
      "learning_rate": 3.156328960923325e-05,
      "loss": 1.2882,
      "num_input_tokens_seen": 37018132704,
      "step": 47051
    },
    {
      "epoch": 4.991725015913431,
      "grad_norm": 0.707291406682915,
      "learning_rate": 3.156261901502046e-05,
      "loss": 1.2411,
      "num_input_tokens_seen": 37018919536,
      "step": 47052
    },
    {
      "epoch": 4.991831105453002,
      "grad_norm": 0.4293829191055564,
      "learning_rate": 3.1561948415736284e-05,
      "loss": 1.2513,
      "num_input_tokens_seen": 37019706272,
      "step": 47053
    },
    {
      "epoch": 4.991937194992573,
      "grad_norm": 0.5531236684263974,
      "learning_rate": 3.156127781138122e-05,
      "loss": 1.2899,
      "num_input_tokens_seen": 37020492976,
      "step": 47054
    },
    {
      "epoch": 4.992043284532145,
      "grad_norm": 0.46503421785808813,
      "learning_rate": 3.1560607201955785e-05,
      "loss": 1.1589,
      "num_input_tokens_seen": 37021279744,
      "step": 47055
    },
    {
      "epoch": 4.992149374071716,
      "grad_norm": 0.5607125615054915,
      "learning_rate": 3.1559936587460515e-05,
      "loss": 1.3714,
      "num_input_tokens_seen": 37022066448,
      "step": 47056
    },
    {
      "epoch": 4.992255463611288,
      "grad_norm": 0.4735458972423224,
      "learning_rate": 3.1559265967895915e-05,
      "loss": 1.238,
      "num_input_tokens_seen": 37022853232,
      "step": 47057
    },
    {
      "epoch": 4.992361553150859,
      "grad_norm": 0.5637854708989977,
      "learning_rate": 3.155859534326251e-05,
      "loss": 1.2616,
      "num_input_tokens_seen": 37023639968,
      "step": 47058
    },
    {
      "epoch": 4.992467642690431,
      "grad_norm": 0.5284799688238306,
      "learning_rate": 3.155792471356081e-05,
      "loss": 1.2301,
      "num_input_tokens_seen": 37024426736,
      "step": 47059
    },
    {
      "epoch": 4.992573732230002,
      "grad_norm": 0.5943652918299591,
      "learning_rate": 3.155725407879134e-05,
      "loss": 1.323,
      "num_input_tokens_seen": 37025213440,
      "step": 47060
    },
    {
      "epoch": 4.992679821769573,
      "grad_norm": 0.45763964173518085,
      "learning_rate": 3.155658343895462e-05,
      "loss": 1.2483,
      "num_input_tokens_seen": 37026000240,
      "step": 47061
    },
    {
      "epoch": 4.992785911309145,
      "grad_norm": 0.5824019278083514,
      "learning_rate": 3.1555912794051165e-05,
      "loss": 1.2869,
      "num_input_tokens_seen": 37026786960,
      "step": 47062
    },
    {
      "epoch": 4.992892000848716,
      "grad_norm": 0.5103801882183141,
      "learning_rate": 3.1555242144081484e-05,
      "loss": 1.2673,
      "num_input_tokens_seen": 37027573744,
      "step": 47063
    },
    {
      "epoch": 4.992998090388288,
      "grad_norm": 0.44383390059007666,
      "learning_rate": 3.155457148904612e-05,
      "loss": 1.291,
      "num_input_tokens_seen": 37028360560,
      "step": 47064
    },
    {
      "epoch": 4.993104179927859,
      "grad_norm": 0.5295072543633763,
      "learning_rate": 3.1553900828945564e-05,
      "loss": 1.2662,
      "num_input_tokens_seen": 37029147344,
      "step": 47065
    },
    {
      "epoch": 4.993210269467431,
      "grad_norm": 0.522596892261944,
      "learning_rate": 3.155323016378034e-05,
      "loss": 1.2358,
      "num_input_tokens_seen": 37029934176,
      "step": 47066
    },
    {
      "epoch": 4.993316359007002,
      "grad_norm": 0.5091994660871358,
      "learning_rate": 3.155255949355099e-05,
      "loss": 1.3781,
      "num_input_tokens_seen": 37030720880,
      "step": 47067
    },
    {
      "epoch": 4.993422448546573,
      "grad_norm": 0.6342473452725632,
      "learning_rate": 3.1551888818258004e-05,
      "loss": 1.2893,
      "num_input_tokens_seen": 37031507696,
      "step": 47068
    },
    {
      "epoch": 4.993528538086145,
      "grad_norm": 0.48146760921934595,
      "learning_rate": 3.15512181379019e-05,
      "loss": 1.2717,
      "num_input_tokens_seen": 37032294496,
      "step": 47069
    },
    {
      "epoch": 4.993634627625716,
      "grad_norm": 0.6003143323063765,
      "learning_rate": 3.155054745248322e-05,
      "loss": 1.4212,
      "num_input_tokens_seen": 37033081280,
      "step": 47070
    },
    {
      "epoch": 4.993740717165288,
      "grad_norm": 0.6666950965969731,
      "learning_rate": 3.154987676200247e-05,
      "loss": 1.3185,
      "num_input_tokens_seen": 37033867936,
      "step": 47071
    },
    {
      "epoch": 4.993846806704859,
      "grad_norm": 0.5043934733757588,
      "learning_rate": 3.1549206066460166e-05,
      "loss": 1.3117,
      "num_input_tokens_seen": 37034654672,
      "step": 47072
    },
    {
      "epoch": 4.99395289624443,
      "grad_norm": 0.7181815525828475,
      "learning_rate": 3.154853536585683e-05,
      "loss": 1.4691,
      "num_input_tokens_seen": 37035441408,
      "step": 47073
    },
    {
      "epoch": 4.994058985784002,
      "grad_norm": 0.6012044530451722,
      "learning_rate": 3.1547864660192975e-05,
      "loss": 1.2795,
      "num_input_tokens_seen": 37036228144,
      "step": 47074
    },
    {
      "epoch": 4.994165075323573,
      "grad_norm": 0.6969728716998765,
      "learning_rate": 3.154719394946911e-05,
      "loss": 1.2185,
      "num_input_tokens_seen": 37037014880,
      "step": 47075
    },
    {
      "epoch": 4.994271164863145,
      "grad_norm": 0.5800034920965966,
      "learning_rate": 3.154652323368578e-05,
      "loss": 1.2799,
      "num_input_tokens_seen": 37037801632,
      "step": 47076
    },
    {
      "epoch": 4.994377254402716,
      "grad_norm": 0.5993066627655614,
      "learning_rate": 3.1545852512843485e-05,
      "loss": 1.2219,
      "num_input_tokens_seen": 37038588512,
      "step": 47077
    },
    {
      "epoch": 4.994483343942287,
      "grad_norm": 0.7998635490054218,
      "learning_rate": 3.154518178694275e-05,
      "loss": 1.3404,
      "num_input_tokens_seen": 37039375152,
      "step": 47078
    },
    {
      "epoch": 4.994589433481859,
      "grad_norm": 0.6151979909825798,
      "learning_rate": 3.1544511055984086e-05,
      "loss": 1.3769,
      "num_input_tokens_seen": 37040161920,
      "step": 47079
    },
    {
      "epoch": 4.99469552302143,
      "grad_norm": 0.864905865595604,
      "learning_rate": 3.154384031996802e-05,
      "loss": 1.2975,
      "num_input_tokens_seen": 37040948608,
      "step": 47080
    },
    {
      "epoch": 4.994801612561002,
      "grad_norm": 0.6909361211817254,
      "learning_rate": 3.154316957889507e-05,
      "loss": 1.3207,
      "num_input_tokens_seen": 37041735328,
      "step": 47081
    },
    {
      "epoch": 4.994907702100573,
      "grad_norm": 0.6752540747942076,
      "learning_rate": 3.154249883276574e-05,
      "loss": 1.246,
      "num_input_tokens_seen": 37042522016,
      "step": 47082
    },
    {
      "epoch": 4.995013791640144,
      "grad_norm": 0.6468641742054376,
      "learning_rate": 3.154182808158057e-05,
      "loss": 1.3358,
      "num_input_tokens_seen": 37043308784,
      "step": 47083
    },
    {
      "epoch": 4.995119881179716,
      "grad_norm": 0.4551168737480053,
      "learning_rate": 3.1541157325340054e-05,
      "loss": 1.1952,
      "num_input_tokens_seen": 37044095520,
      "step": 47084
    },
    {
      "epoch": 4.995225970719287,
      "grad_norm": 0.5312281244678191,
      "learning_rate": 3.154048656404474e-05,
      "loss": 1.2741,
      "num_input_tokens_seen": 37044882304,
      "step": 47085
    },
    {
      "epoch": 4.995332060258859,
      "grad_norm": 0.5310577323088885,
      "learning_rate": 3.153981579769511e-05,
      "loss": 1.3165,
      "num_input_tokens_seen": 37045669088,
      "step": 47086
    },
    {
      "epoch": 4.99543814979843,
      "grad_norm": 0.5500474903728724,
      "learning_rate": 3.1539145026291714e-05,
      "loss": 1.165,
      "num_input_tokens_seen": 37046455920,
      "step": 47087
    },
    {
      "epoch": 4.995544239338002,
      "grad_norm": 0.4649484999399804,
      "learning_rate": 3.1538474249835056e-05,
      "loss": 1.2266,
      "num_input_tokens_seen": 37047242848,
      "step": 47088
    },
    {
      "epoch": 4.995650328877573,
      "grad_norm": 0.5730557639758419,
      "learning_rate": 3.153780346832566e-05,
      "loss": 1.3054,
      "num_input_tokens_seen": 37048029664,
      "step": 47089
    },
    {
      "epoch": 4.995756418417144,
      "grad_norm": 0.5183348903592904,
      "learning_rate": 3.153713268176404e-05,
      "loss": 1.2784,
      "num_input_tokens_seen": 37048816400,
      "step": 47090
    },
    {
      "epoch": 4.995862507956716,
      "grad_norm": 0.5129134381511635,
      "learning_rate": 3.153646189015072e-05,
      "loss": 1.3337,
      "num_input_tokens_seen": 37049603216,
      "step": 47091
    },
    {
      "epoch": 4.995968597496287,
      "grad_norm": 0.4742942249667195,
      "learning_rate": 3.1535791093486206e-05,
      "loss": 1.2696,
      "num_input_tokens_seen": 37050389920,
      "step": 47092
    },
    {
      "epoch": 4.9960746870358586,
      "grad_norm": 0.4653743959959551,
      "learning_rate": 3.153512029177103e-05,
      "loss": 1.186,
      "num_input_tokens_seen": 37051176768,
      "step": 47093
    },
    {
      "epoch": 4.99618077657543,
      "grad_norm": 0.7701762972399779,
      "learning_rate": 3.15344494850057e-05,
      "loss": 1.3723,
      "num_input_tokens_seen": 37051963488,
      "step": 47094
    },
    {
      "epoch": 4.9962868661150015,
      "grad_norm": 0.5224025908875148,
      "learning_rate": 3.153377867319074e-05,
      "loss": 1.2662,
      "num_input_tokens_seen": 37052750208,
      "step": 47095
    },
    {
      "epoch": 4.9963929556545725,
      "grad_norm": 0.7166215954659038,
      "learning_rate": 3.153310785632667e-05,
      "loss": 1.2759,
      "num_input_tokens_seen": 37053537040,
      "step": 47096
    },
    {
      "epoch": 4.996499045194144,
      "grad_norm": 0.6947286920471135,
      "learning_rate": 3.153243703441401e-05,
      "loss": 1.373,
      "num_input_tokens_seen": 37054323808,
      "step": 47097
    },
    {
      "epoch": 4.9966051347337155,
      "grad_norm": 0.49815321412554725,
      "learning_rate": 3.1531766207453265e-05,
      "loss": 1.1956,
      "num_input_tokens_seen": 37055110576,
      "step": 47098
    },
    {
      "epoch": 4.9967112242732865,
      "grad_norm": 0.5308290708155325,
      "learning_rate": 3.1531095375444975e-05,
      "loss": 1.2565,
      "num_input_tokens_seen": 37055897408,
      "step": 47099
    },
    {
      "epoch": 4.996817313812858,
      "grad_norm": 0.5542544743497169,
      "learning_rate": 3.153042453838963e-05,
      "loss": 1.2546,
      "num_input_tokens_seen": 37056684192,
      "step": 47100
    },
    {
      "epoch": 4.9969234033524295,
      "grad_norm": 0.5504656391732329,
      "learning_rate": 3.152975369628778e-05,
      "loss": 1.2726,
      "num_input_tokens_seen": 37057470960,
      "step": 47101
    },
    {
      "epoch": 4.9970294928920005,
      "grad_norm": 0.49116924837949616,
      "learning_rate": 3.152908284913992e-05,
      "loss": 1.2281,
      "num_input_tokens_seen": 37058257712,
      "step": 47102
    },
    {
      "epoch": 4.997135582431572,
      "grad_norm": 0.5507646620091091,
      "learning_rate": 3.152841199694657e-05,
      "loss": 1.2904,
      "num_input_tokens_seen": 37059044528,
      "step": 47103
    },
    {
      "epoch": 4.997241671971143,
      "grad_norm": 0.7220330984240677,
      "learning_rate": 3.1527741139708264e-05,
      "loss": 1.4507,
      "num_input_tokens_seen": 37059831280,
      "step": 47104
    },
    {
      "epoch": 4.997347761510715,
      "grad_norm": 0.5174669058461225,
      "learning_rate": 3.152707027742551e-05,
      "loss": 1.3385,
      "num_input_tokens_seen": 37060618016,
      "step": 47105
    },
    {
      "epoch": 4.997453851050286,
      "grad_norm": 0.639650761544794,
      "learning_rate": 3.152639941009883e-05,
      "loss": 1.2136,
      "num_input_tokens_seen": 37061404816,
      "step": 47106
    },
    {
      "epoch": 4.997559940589857,
      "grad_norm": 0.6480275033826005,
      "learning_rate": 3.152572853772874e-05,
      "loss": 1.3128,
      "num_input_tokens_seen": 37062191568,
      "step": 47107
    },
    {
      "epoch": 4.997666030129429,
      "grad_norm": 0.6318246950014171,
      "learning_rate": 3.152505766031575e-05,
      "loss": 1.339,
      "num_input_tokens_seen": 37062978336,
      "step": 47108
    },
    {
      "epoch": 4.997772119669,
      "grad_norm": 0.5480727731309156,
      "learning_rate": 3.1524386777860396e-05,
      "loss": 1.3045,
      "num_input_tokens_seen": 37063765040,
      "step": 47109
    },
    {
      "epoch": 4.997878209208572,
      "grad_norm": 0.5254507228398847,
      "learning_rate": 3.152371589036318e-05,
      "loss": 1.2313,
      "num_input_tokens_seen": 37064551872,
      "step": 47110
    },
    {
      "epoch": 4.997984298748143,
      "grad_norm": 0.5534619955577036,
      "learning_rate": 3.1523044997824636e-05,
      "loss": 1.3072,
      "num_input_tokens_seen": 37065338624,
      "step": 47111
    },
    {
      "epoch": 4.998090388287714,
      "grad_norm": 0.5509826269235587,
      "learning_rate": 3.152237410024527e-05,
      "loss": 1.3028,
      "num_input_tokens_seen": 37066125344,
      "step": 47112
    },
    {
      "epoch": 4.998196477827286,
      "grad_norm": 0.5207383738322572,
      "learning_rate": 3.15217031976256e-05,
      "loss": 1.4007,
      "num_input_tokens_seen": 37066912000,
      "step": 47113
    },
    {
      "epoch": 4.998302567366857,
      "grad_norm": 0.6695934088775559,
      "learning_rate": 3.152103228996616e-05,
      "loss": 1.2599,
      "num_input_tokens_seen": 37067698832,
      "step": 47114
    },
    {
      "epoch": 4.998408656906429,
      "grad_norm": 0.46456840883521133,
      "learning_rate": 3.152036137726745e-05,
      "loss": 1.2664,
      "num_input_tokens_seen": 37068485664,
      "step": 47115
    },
    {
      "epoch": 4.998514746446,
      "grad_norm": 0.6115972450311891,
      "learning_rate": 3.151969045952999e-05,
      "loss": 1.3257,
      "num_input_tokens_seen": 37069272480,
      "step": 47116
    },
    {
      "epoch": 4.998620835985572,
      "grad_norm": 0.5441889734047284,
      "learning_rate": 3.1519019536754316e-05,
      "loss": 1.3154,
      "num_input_tokens_seen": 37070059296,
      "step": 47117
    },
    {
      "epoch": 4.998726925525143,
      "grad_norm": 0.5314997041169629,
      "learning_rate": 3.151834860894092e-05,
      "loss": 1.3647,
      "num_input_tokens_seen": 37070846080,
      "step": 47118
    },
    {
      "epoch": 4.998833015064715,
      "grad_norm": 0.5451932404436378,
      "learning_rate": 3.151767767609035e-05,
      "loss": 1.3247,
      "num_input_tokens_seen": 37071632832,
      "step": 47119
    },
    {
      "epoch": 4.998939104604286,
      "grad_norm": 0.4577675071369783,
      "learning_rate": 3.151700673820311e-05,
      "loss": 1.2355,
      "num_input_tokens_seen": 37072419600,
      "step": 47120
    },
    {
      "epoch": 4.999045194143857,
      "grad_norm": 0.5475152846166697,
      "learning_rate": 3.151633579527971e-05,
      "loss": 1.3387,
      "num_input_tokens_seen": 37073206464,
      "step": 47121
    },
    {
      "epoch": 4.999151283683429,
      "grad_norm": 0.8100711688687352,
      "learning_rate": 3.151566484732068e-05,
      "loss": 1.2719,
      "num_input_tokens_seen": 37073993232,
      "step": 47122
    },
    {
      "epoch": 4.999257373223,
      "grad_norm": 0.5245475081461434,
      "learning_rate": 3.1514993894326544e-05,
      "loss": 1.2421,
      "num_input_tokens_seen": 37074780096,
      "step": 47123
    },
    {
      "epoch": 4.999363462762572,
      "grad_norm": 0.7824616912097389,
      "learning_rate": 3.1514322936297803e-05,
      "loss": 1.2646,
      "num_input_tokens_seen": 37075566784,
      "step": 47124
    },
    {
      "epoch": 4.999469552302143,
      "grad_norm": 0.4880334411454484,
      "learning_rate": 3.1513651973234984e-05,
      "loss": 1.2408,
      "num_input_tokens_seen": 37076353552,
      "step": 47125
    },
    {
      "epoch": 4.999575641841714,
      "grad_norm": 0.5507878734238859,
      "learning_rate": 3.1512981005138606e-05,
      "loss": 1.3108,
      "num_input_tokens_seen": 37077140288,
      "step": 47126
    },
    {
      "epoch": 4.999681731381286,
      "grad_norm": 0.5977644532588755,
      "learning_rate": 3.151231003200919e-05,
      "loss": 1.3107,
      "num_input_tokens_seen": 37077926928,
      "step": 47127
    },
    {
      "epoch": 4.999787820920857,
      "grad_norm": 0.6066880775218332,
      "learning_rate": 3.151163905384725e-05,
      "loss": 1.227,
      "num_input_tokens_seen": 37078713760,
      "step": 47128
    },
    {
      "epoch": 4.999893910460429,
      "grad_norm": 0.5926426351187958,
      "learning_rate": 3.1510968070653305e-05,
      "loss": 1.3317,
      "num_input_tokens_seen": 37079500464,
      "step": 47129
    },
    {
      "epoch": 5.0,
      "grad_norm": 0.5848682612496797,
      "learning_rate": 3.151029708242788e-05,
      "loss": 1.3033,
      "num_input_tokens_seen": 37080287200,
      "step": 47130
    },
    {
      "epoch": 5.000106089539571,
      "grad_norm": 0.7687870103963104,
      "learning_rate": 3.150962608917149e-05,
      "loss": 1.1299,
      "num_input_tokens_seen": 37081073936,
      "step": 47131
    },
    {
      "epoch": 5.000212179079143,
      "grad_norm": 0.6320238973315366,
      "learning_rate": 3.1508955090884646e-05,
      "loss": 1.2,
      "num_input_tokens_seen": 37081860752,
      "step": 47132
    },
    {
      "epoch": 5.000318268618714,
      "grad_norm": 0.9213608111934161,
      "learning_rate": 3.150828408756787e-05,
      "loss": 1.1084,
      "num_input_tokens_seen": 37082647600,
      "step": 47133
    },
    {
      "epoch": 5.000424358158286,
      "grad_norm": 1.0929593093388732,
      "learning_rate": 3.1507613079221696e-05,
      "loss": 1.2084,
      "num_input_tokens_seen": 37083434288,
      "step": 47134
    },
    {
      "epoch": 5.000530447697857,
      "grad_norm": 0.7883627840821888,
      "learning_rate": 3.150694206584661e-05,
      "loss": 1.0842,
      "num_input_tokens_seen": 37084221104,
      "step": 47135
    },
    {
      "epoch": 5.000636537237428,
      "grad_norm": 0.5858265899204705,
      "learning_rate": 3.150627104744317e-05,
      "loss": 1.0756,
      "num_input_tokens_seen": 37085007856,
      "step": 47136
    },
    {
      "epoch": 5.000742626777,
      "grad_norm": 0.882423569271592,
      "learning_rate": 3.1505600024011865e-05,
      "loss": 1.1133,
      "num_input_tokens_seen": 37085794640,
      "step": 47137
    },
    {
      "epoch": 5.000848716316571,
      "grad_norm": 0.6842429604626,
      "learning_rate": 3.1504928995553216e-05,
      "loss": 1.0738,
      "num_input_tokens_seen": 37086581392,
      "step": 47138
    },
    {
      "epoch": 5.000954805856143,
      "grad_norm": 0.6927188121268935,
      "learning_rate": 3.1504257962067765e-05,
      "loss": 1.1643,
      "num_input_tokens_seen": 37087368208,
      "step": 47139
    },
    {
      "epoch": 5.001060895395714,
      "grad_norm": 0.679767282074769,
      "learning_rate": 3.150358692355601e-05,
      "loss": 1.0971,
      "num_input_tokens_seen": 37088155024,
      "step": 47140
    },
    {
      "epoch": 5.001166984935286,
      "grad_norm": 0.7553146423179953,
      "learning_rate": 3.1502915880018464e-05,
      "loss": 1.155,
      "num_input_tokens_seen": 37088941760,
      "step": 47141
    },
    {
      "epoch": 5.001273074474857,
      "grad_norm": 0.7130841055456185,
      "learning_rate": 3.1502244831455664e-05,
      "loss": 1.2007,
      "num_input_tokens_seen": 37089728448,
      "step": 47142
    },
    {
      "epoch": 5.001379164014428,
      "grad_norm": 0.6997327267146037,
      "learning_rate": 3.1501573777868116e-05,
      "loss": 1.1516,
      "num_input_tokens_seen": 37090515184,
      "step": 47143
    },
    {
      "epoch": 5.001485253554,
      "grad_norm": 0.6855857019636834,
      "learning_rate": 3.150090271925634e-05,
      "loss": 1.0949,
      "num_input_tokens_seen": 37091302016,
      "step": 47144
    },
    {
      "epoch": 5.001591343093571,
      "grad_norm": 0.6987043907587237,
      "learning_rate": 3.150023165562086e-05,
      "loss": 1.2679,
      "num_input_tokens_seen": 37092088672,
      "step": 47145
    },
    {
      "epoch": 5.001697432633143,
      "grad_norm": 0.6137609040310575,
      "learning_rate": 3.149956058696219e-05,
      "loss": 1.1436,
      "num_input_tokens_seen": 37092875392,
      "step": 47146
    },
    {
      "epoch": 5.001803522172714,
      "grad_norm": 0.6278608673286823,
      "learning_rate": 3.149888951328085e-05,
      "loss": 1.1105,
      "num_input_tokens_seen": 37093662128,
      "step": 47147
    },
    {
      "epoch": 5.001909611712285,
      "grad_norm": 0.8410444679312509,
      "learning_rate": 3.149821843457737e-05,
      "loss": 1.0815,
      "num_input_tokens_seen": 37094448896,
      "step": 47148
    },
    {
      "epoch": 5.002015701251857,
      "grad_norm": 0.8370522031328526,
      "learning_rate": 3.1497547350852244e-05,
      "loss": 1.1067,
      "num_input_tokens_seen": 37095235648,
      "step": 47149
    },
    {
      "epoch": 5.002121790791428,
      "grad_norm": 0.6986700173275922,
      "learning_rate": 3.149687626210601e-05,
      "loss": 1.1358,
      "num_input_tokens_seen": 37096022432,
      "step": 47150
    },
    {
      "epoch": 5.002227880331,
      "grad_norm": 0.5332903589654151,
      "learning_rate": 3.1496205168339184e-05,
      "loss": 1.1682,
      "num_input_tokens_seen": 37096809200,
      "step": 47151
    },
    {
      "epoch": 5.002333969870571,
      "grad_norm": 0.8581090998961107,
      "learning_rate": 3.149553406955227e-05,
      "loss": 1.1343,
      "num_input_tokens_seen": 37097595872,
      "step": 47152
    },
    {
      "epoch": 5.002440059410143,
      "grad_norm": 0.6523101343247502,
      "learning_rate": 3.1494862965745806e-05,
      "loss": 1.1032,
      "num_input_tokens_seen": 37098382672,
      "step": 47153
    },
    {
      "epoch": 5.002546148949714,
      "grad_norm": 0.7606449547235851,
      "learning_rate": 3.1494191856920305e-05,
      "loss": 1.224,
      "num_input_tokens_seen": 37099169424,
      "step": 47154
    },
    {
      "epoch": 5.002652238489285,
      "grad_norm": 0.5844319163097786,
      "learning_rate": 3.1493520743076276e-05,
      "loss": 1.2127,
      "num_input_tokens_seen": 37099956224,
      "step": 47155
    },
    {
      "epoch": 5.002758328028857,
      "grad_norm": 0.6287657352771521,
      "learning_rate": 3.1492849624214254e-05,
      "loss": 1.1565,
      "num_input_tokens_seen": 37100742976,
      "step": 47156
    },
    {
      "epoch": 5.002864417568428,
      "grad_norm": 0.6616305510117994,
      "learning_rate": 3.149217850033475e-05,
      "loss": 1.0911,
      "num_input_tokens_seen": 37101529696,
      "step": 47157
    },
    {
      "epoch": 5.0029705071079995,
      "grad_norm": 0.7141223701416679,
      "learning_rate": 3.1491507371438266e-05,
      "loss": 1.0906,
      "num_input_tokens_seen": 37102316464,
      "step": 47158
    },
    {
      "epoch": 5.0030765966475705,
      "grad_norm": 0.600650530002422,
      "learning_rate": 3.1490836237525344e-05,
      "loss": 1.1141,
      "num_input_tokens_seen": 37103103184,
      "step": 47159
    },
    {
      "epoch": 5.003182686187142,
      "grad_norm": 0.8016915651421934,
      "learning_rate": 3.149016509859649e-05,
      "loss": 1.1486,
      "num_input_tokens_seen": 37103889920,
      "step": 47160
    },
    {
      "epoch": 5.0032887757267135,
      "grad_norm": 0.8822991862806594,
      "learning_rate": 3.148949395465223e-05,
      "loss": 1.2669,
      "num_input_tokens_seen": 37104676736,
      "step": 47161
    },
    {
      "epoch": 5.0033948652662845,
      "grad_norm": 0.707095421033007,
      "learning_rate": 3.148882280569308e-05,
      "loss": 1.1354,
      "num_input_tokens_seen": 37105463456,
      "step": 47162
    },
    {
      "epoch": 5.003500954805856,
      "grad_norm": 0.6742999576086512,
      "learning_rate": 3.148815165171956e-05,
      "loss": 1.1157,
      "num_input_tokens_seen": 37106250288,
      "step": 47163
    },
    {
      "epoch": 5.0036070443454275,
      "grad_norm": 0.5979843347026665,
      "learning_rate": 3.148748049273218e-05,
      "loss": 1.2242,
      "num_input_tokens_seen": 37107037008,
      "step": 47164
    },
    {
      "epoch": 5.0037131338849985,
      "grad_norm": 0.601050693973423,
      "learning_rate": 3.148680932873148e-05,
      "loss": 1.0278,
      "num_input_tokens_seen": 37107823776,
      "step": 47165
    },
    {
      "epoch": 5.00381922342457,
      "grad_norm": 0.668293397579856,
      "learning_rate": 3.148613815971794e-05,
      "loss": 1.195,
      "num_input_tokens_seen": 37108610528,
      "step": 47166
    },
    {
      "epoch": 5.0039253129641414,
      "grad_norm": 0.633186816689445,
      "learning_rate": 3.148546698569212e-05,
      "loss": 1.1423,
      "num_input_tokens_seen": 37109397216,
      "step": 47167
    },
    {
      "epoch": 5.004031402503713,
      "grad_norm": 0.8533317942873473,
      "learning_rate": 3.148479580665452e-05,
      "loss": 1.1442,
      "num_input_tokens_seen": 37110183920,
      "step": 47168
    },
    {
      "epoch": 5.004137492043284,
      "grad_norm": 0.6032443371571949,
      "learning_rate": 3.148412462260566e-05,
      "loss": 1.1482,
      "num_input_tokens_seen": 37110970656,
      "step": 47169
    },
    {
      "epoch": 5.004243581582856,
      "grad_norm": 0.748788731229615,
      "learning_rate": 3.148345343354605e-05,
      "loss": 1.1369,
      "num_input_tokens_seen": 37111757488,
      "step": 47170
    },
    {
      "epoch": 5.004349671122427,
      "grad_norm": 0.693107616722913,
      "learning_rate": 3.1482782239476225e-05,
      "loss": 1.0899,
      "num_input_tokens_seen": 37112544240,
      "step": 47171
    },
    {
      "epoch": 5.004455760661998,
      "grad_norm": 0.590369309425064,
      "learning_rate": 3.148211104039669e-05,
      "loss": 1.0927,
      "num_input_tokens_seen": 37113331072,
      "step": 47172
    },
    {
      "epoch": 5.00456185020157,
      "grad_norm": 0.8341256307976357,
      "learning_rate": 3.148143983630798e-05,
      "loss": 1.0929,
      "num_input_tokens_seen": 37114117824,
      "step": 47173
    },
    {
      "epoch": 5.004667939741141,
      "grad_norm": 0.6552867781424759,
      "learning_rate": 3.14807686272106e-05,
      "loss": 1.0808,
      "num_input_tokens_seen": 37114904672,
      "step": 47174
    },
    {
      "epoch": 5.004774029280713,
      "grad_norm": 0.7136945524337408,
      "learning_rate": 3.148009741310507e-05,
      "loss": 1.1989,
      "num_input_tokens_seen": 37115691424,
      "step": 47175
    },
    {
      "epoch": 5.004880118820284,
      "grad_norm": 0.968340709403048,
      "learning_rate": 3.147942619399191e-05,
      "loss": 1.2202,
      "num_input_tokens_seen": 37116478160,
      "step": 47176
    },
    {
      "epoch": 5.004986208359855,
      "grad_norm": 0.5656255295113204,
      "learning_rate": 3.1478754969871646e-05,
      "loss": 1.1074,
      "num_input_tokens_seen": 37117264944,
      "step": 47177
    },
    {
      "epoch": 5.005092297899427,
      "grad_norm": 0.8131367049032733,
      "learning_rate": 3.1478083740744786e-05,
      "loss": 1.0782,
      "num_input_tokens_seen": 37118051728,
      "step": 47178
    },
    {
      "epoch": 5.005198387438998,
      "grad_norm": 0.6401937954171811,
      "learning_rate": 3.147741250661185e-05,
      "loss": 1.1112,
      "num_input_tokens_seen": 37118838496,
      "step": 47179
    },
    {
      "epoch": 5.00530447697857,
      "grad_norm": 0.7511752120023719,
      "learning_rate": 3.147674126747336e-05,
      "loss": 1.1453,
      "num_input_tokens_seen": 37119625248,
      "step": 47180
    },
    {
      "epoch": 5.005410566518141,
      "grad_norm": 0.6082714802053043,
      "learning_rate": 3.147607002332984e-05,
      "loss": 1.1678,
      "num_input_tokens_seen": 37120411952,
      "step": 47181
    },
    {
      "epoch": 5.005516656057713,
      "grad_norm": 0.7399706202192572,
      "learning_rate": 3.14753987741818e-05,
      "loss": 1.1357,
      "num_input_tokens_seen": 37121198752,
      "step": 47182
    },
    {
      "epoch": 5.005622745597284,
      "grad_norm": 1.0096457516472996,
      "learning_rate": 3.1474727520029765e-05,
      "loss": 1.1232,
      "num_input_tokens_seen": 37121985456,
      "step": 47183
    },
    {
      "epoch": 5.005728835136855,
      "grad_norm": 0.6120330479641837,
      "learning_rate": 3.147405626087424e-05,
      "loss": 0.9907,
      "num_input_tokens_seen": 37122772240,
      "step": 47184
    },
    {
      "epoch": 5.005834924676427,
      "grad_norm": 0.6414464142545189,
      "learning_rate": 3.1473384996715763e-05,
      "loss": 1.0923,
      "num_input_tokens_seen": 37123559136,
      "step": 47185
    },
    {
      "epoch": 5.005941014215998,
      "grad_norm": 0.6737602393852965,
      "learning_rate": 3.147271372755485e-05,
      "loss": 1.0601,
      "num_input_tokens_seen": 37124345904,
      "step": 47186
    },
    {
      "epoch": 5.00604710375557,
      "grad_norm": 0.634915104038296,
      "learning_rate": 3.1472042453392e-05,
      "loss": 1.1507,
      "num_input_tokens_seen": 37125132656,
      "step": 47187
    },
    {
      "epoch": 5.006153193295141,
      "grad_norm": 0.744732028721743,
      "learning_rate": 3.147137117422775e-05,
      "loss": 1.0313,
      "num_input_tokens_seen": 37125919520,
      "step": 47188
    },
    {
      "epoch": 5.006259282834712,
      "grad_norm": 0.6536767644371684,
      "learning_rate": 3.1470699890062615e-05,
      "loss": 1.1227,
      "num_input_tokens_seen": 37126706208,
      "step": 47189
    },
    {
      "epoch": 5.006365372374284,
      "grad_norm": 0.8061216408261822,
      "learning_rate": 3.147002860089712e-05,
      "loss": 1.0561,
      "num_input_tokens_seen": 37127493024,
      "step": 47190
    },
    {
      "epoch": 5.006471461913855,
      "grad_norm": 0.5921364230508405,
      "learning_rate": 3.146935730673177e-05,
      "loss": 1.1183,
      "num_input_tokens_seen": 37128279728,
      "step": 47191
    },
    {
      "epoch": 5.006577551453427,
      "grad_norm": 0.7056905440184578,
      "learning_rate": 3.146868600756709e-05,
      "loss": 1.1423,
      "num_input_tokens_seen": 37129066496,
      "step": 47192
    },
    {
      "epoch": 5.006683640992998,
      "grad_norm": 0.7175493137108558,
      "learning_rate": 3.14680147034036e-05,
      "loss": 1.1313,
      "num_input_tokens_seen": 37129853312,
      "step": 47193
    },
    {
      "epoch": 5.00678973053257,
      "grad_norm": 0.6899313174633966,
      "learning_rate": 3.146734339424182e-05,
      "loss": 1.1017,
      "num_input_tokens_seen": 37130640208,
      "step": 47194
    },
    {
      "epoch": 5.006895820072141,
      "grad_norm": 0.5676947150787496,
      "learning_rate": 3.146667208008226e-05,
      "loss": 1.1448,
      "num_input_tokens_seen": 37131426864,
      "step": 47195
    },
    {
      "epoch": 5.007001909611712,
      "grad_norm": 0.5833780600567476,
      "learning_rate": 3.1466000760925455e-05,
      "loss": 1.1071,
      "num_input_tokens_seen": 37132213600,
      "step": 47196
    },
    {
      "epoch": 5.007107999151284,
      "grad_norm": 0.7209530752640221,
      "learning_rate": 3.1465329436771914e-05,
      "loss": 1.056,
      "num_input_tokens_seen": 37133000384,
      "step": 47197
    },
    {
      "epoch": 5.007214088690855,
      "grad_norm": 0.5939221163159085,
      "learning_rate": 3.1464658107622145e-05,
      "loss": 1.052,
      "num_input_tokens_seen": 37133787152,
      "step": 47198
    },
    {
      "epoch": 5.007320178230427,
      "grad_norm": 0.6129106334919886,
      "learning_rate": 3.1463986773476685e-05,
      "loss": 1.177,
      "num_input_tokens_seen": 37134573920,
      "step": 47199
    },
    {
      "epoch": 5.007426267769998,
      "grad_norm": 0.7539323062595874,
      "learning_rate": 3.146331543433605e-05,
      "loss": 1.1906,
      "num_input_tokens_seen": 37135360688,
      "step": 47200
    },
    {
      "epoch": 5.007532357309569,
      "grad_norm": 0.510744142852694,
      "learning_rate": 3.146264409020074e-05,
      "loss": 1.0867,
      "num_input_tokens_seen": 37136147504,
      "step": 47201
    },
    {
      "epoch": 5.007638446849141,
      "grad_norm": 0.848825191349923,
      "learning_rate": 3.14619727410713e-05,
      "loss": 1.1309,
      "num_input_tokens_seen": 37136934240,
      "step": 47202
    },
    {
      "epoch": 5.007744536388712,
      "grad_norm": 0.7976592907596793,
      "learning_rate": 3.146130138694824e-05,
      "loss": 1.1326,
      "num_input_tokens_seen": 37137720992,
      "step": 47203
    },
    {
      "epoch": 5.007850625928284,
      "grad_norm": 0.8818994283100581,
      "learning_rate": 3.146063002783207e-05,
      "loss": 1.0143,
      "num_input_tokens_seen": 37138507792,
      "step": 47204
    },
    {
      "epoch": 5.007956715467855,
      "grad_norm": 1.0371866656866877,
      "learning_rate": 3.145995866372332e-05,
      "loss": 1.1836,
      "num_input_tokens_seen": 37139294544,
      "step": 47205
    },
    {
      "epoch": 5.008062805007426,
      "grad_norm": 0.7152248083452986,
      "learning_rate": 3.14592872946225e-05,
      "loss": 1.1385,
      "num_input_tokens_seen": 37140081312,
      "step": 47206
    },
    {
      "epoch": 5.008168894546998,
      "grad_norm": 1.3027143520905309,
      "learning_rate": 3.145861592053013e-05,
      "loss": 1.1161,
      "num_input_tokens_seen": 37140868096,
      "step": 47207
    },
    {
      "epoch": 5.008274984086569,
      "grad_norm": 0.7343915792918018,
      "learning_rate": 3.145794454144674e-05,
      "loss": 1.1658,
      "num_input_tokens_seen": 37141654848,
      "step": 47208
    },
    {
      "epoch": 5.008381073626141,
      "grad_norm": 0.8556056743124765,
      "learning_rate": 3.145727315737283e-05,
      "loss": 1.1691,
      "num_input_tokens_seen": 37142441632,
      "step": 47209
    },
    {
      "epoch": 5.008487163165712,
      "grad_norm": 1.0295756444846664,
      "learning_rate": 3.145660176830893e-05,
      "loss": 1.1301,
      "num_input_tokens_seen": 37143228432,
      "step": 47210
    },
    {
      "epoch": 5.008593252705284,
      "grad_norm": 0.7043929807856001,
      "learning_rate": 3.145593037425556e-05,
      "loss": 1.1639,
      "num_input_tokens_seen": 37144015200,
      "step": 47211
    },
    {
      "epoch": 5.008699342244855,
      "grad_norm": 1.0416197521951274,
      "learning_rate": 3.145525897521323e-05,
      "loss": 1.1725,
      "num_input_tokens_seen": 37144801888,
      "step": 47212
    },
    {
      "epoch": 5.008805431784426,
      "grad_norm": 0.8145641718689349,
      "learning_rate": 3.145458757118248e-05,
      "loss": 1.1745,
      "num_input_tokens_seen": 37145588640,
      "step": 47213
    },
    {
      "epoch": 5.008911521323998,
      "grad_norm": 0.8028412103155637,
      "learning_rate": 3.14539161621638e-05,
      "loss": 1.1652,
      "num_input_tokens_seen": 37146375360,
      "step": 47214
    },
    {
      "epoch": 5.009017610863569,
      "grad_norm": 0.7714797185312362,
      "learning_rate": 3.145324474815772e-05,
      "loss": 1.1571,
      "num_input_tokens_seen": 37147162016,
      "step": 47215
    },
    {
      "epoch": 5.009123700403141,
      "grad_norm": 0.6105803249889843,
      "learning_rate": 3.145257332916477e-05,
      "loss": 1.1662,
      "num_input_tokens_seen": 37147948800,
      "step": 47216
    },
    {
      "epoch": 5.009229789942712,
      "grad_norm": 0.6422605496809763,
      "learning_rate": 3.1451901905185465e-05,
      "loss": 1.1311,
      "num_input_tokens_seen": 37148735408,
      "step": 47217
    },
    {
      "epoch": 5.009335879482283,
      "grad_norm": 0.7881775316200959,
      "learning_rate": 3.145123047622031e-05,
      "loss": 1.1372,
      "num_input_tokens_seen": 37149522192,
      "step": 47218
    },
    {
      "epoch": 5.009441969021855,
      "grad_norm": 0.7164354608529969,
      "learning_rate": 3.1450559042269846e-05,
      "loss": 1.1176,
      "num_input_tokens_seen": 37150309024,
      "step": 47219
    },
    {
      "epoch": 5.009548058561426,
      "grad_norm": 1.233501586701723,
      "learning_rate": 3.144988760333457e-05,
      "loss": 1.1597,
      "num_input_tokens_seen": 37151095728,
      "step": 47220
    },
    {
      "epoch": 5.0096541481009975,
      "grad_norm": 0.758229576349197,
      "learning_rate": 3.144921615941501e-05,
      "loss": 1.1859,
      "num_input_tokens_seen": 37151882464,
      "step": 47221
    },
    {
      "epoch": 5.0097602376405685,
      "grad_norm": 0.7245574743643021,
      "learning_rate": 3.144854471051168e-05,
      "loss": 1.1097,
      "num_input_tokens_seen": 37152669312,
      "step": 47222
    },
    {
      "epoch": 5.0098663271801405,
      "grad_norm": 0.9792480428259746,
      "learning_rate": 3.144787325662512e-05,
      "loss": 1.1734,
      "num_input_tokens_seen": 37153456128,
      "step": 47223
    },
    {
      "epoch": 5.0099724167197115,
      "grad_norm": 0.6652792226681382,
      "learning_rate": 3.144720179775582e-05,
      "loss": 1.1669,
      "num_input_tokens_seen": 37154242896,
      "step": 47224
    },
    {
      "epoch": 5.0100785062592825,
      "grad_norm": 1.0705740771338992,
      "learning_rate": 3.144653033390432e-05,
      "loss": 1.1672,
      "num_input_tokens_seen": 37155029648,
      "step": 47225
    },
    {
      "epoch": 5.0101845957988544,
      "grad_norm": 0.6584691215088743,
      "learning_rate": 3.1445858865071125e-05,
      "loss": 1.177,
      "num_input_tokens_seen": 37155816480,
      "step": 47226
    },
    {
      "epoch": 5.0102906853384255,
      "grad_norm": 1.0791852783007605,
      "learning_rate": 3.1445187391256756e-05,
      "loss": 1.1968,
      "num_input_tokens_seen": 37156603200,
      "step": 47227
    },
    {
      "epoch": 5.010396774877997,
      "grad_norm": 0.7376920005672101,
      "learning_rate": 3.1444515912461744e-05,
      "loss": 1.1358,
      "num_input_tokens_seen": 37157390016,
      "step": 47228
    },
    {
      "epoch": 5.010502864417568,
      "grad_norm": 1.2674902617584165,
      "learning_rate": 3.144384442868659e-05,
      "loss": 1.1927,
      "num_input_tokens_seen": 37158176800,
      "step": 47229
    },
    {
      "epoch": 5.0106089539571395,
      "grad_norm": 0.779917360326765,
      "learning_rate": 3.144317293993183e-05,
      "loss": 1.1256,
      "num_input_tokens_seen": 37158963648,
      "step": 47230
    },
    {
      "epoch": 5.010715043496711,
      "grad_norm": 0.9199136134195068,
      "learning_rate": 3.144250144619797e-05,
      "loss": 1.1036,
      "num_input_tokens_seen": 37159750368,
      "step": 47231
    },
    {
      "epoch": 5.010821133036282,
      "grad_norm": 0.9178988661577876,
      "learning_rate": 3.144182994748553e-05,
      "loss": 1.1536,
      "num_input_tokens_seen": 37160537184,
      "step": 47232
    },
    {
      "epoch": 5.010927222575854,
      "grad_norm": 1.0181752510700026,
      "learning_rate": 3.1441158443795044e-05,
      "loss": 1.145,
      "num_input_tokens_seen": 37161323952,
      "step": 47233
    },
    {
      "epoch": 5.011033312115425,
      "grad_norm": 0.9534658844171022,
      "learning_rate": 3.144048693512701e-05,
      "loss": 1.2156,
      "num_input_tokens_seen": 37162110736,
      "step": 47234
    },
    {
      "epoch": 5.011139401654996,
      "grad_norm": 1.0084839499038605,
      "learning_rate": 3.143981542148196e-05,
      "loss": 1.0547,
      "num_input_tokens_seen": 37162897552,
      "step": 47235
    },
    {
      "epoch": 5.011245491194568,
      "grad_norm": 0.7079780574098885,
      "learning_rate": 3.1439143902860414e-05,
      "loss": 1.1178,
      "num_input_tokens_seen": 37163684208,
      "step": 47236
    },
    {
      "epoch": 5.011351580734139,
      "grad_norm": 0.8348759193650225,
      "learning_rate": 3.143847237926288e-05,
      "loss": 1.1339,
      "num_input_tokens_seen": 37164470960,
      "step": 47237
    },
    {
      "epoch": 5.011457670273711,
      "grad_norm": 0.7231553220764165,
      "learning_rate": 3.1437800850689886e-05,
      "loss": 1.1106,
      "num_input_tokens_seen": 37165257760,
      "step": 47238
    },
    {
      "epoch": 5.011563759813282,
      "grad_norm": 0.8320546969808232,
      "learning_rate": 3.143712931714195e-05,
      "loss": 1.1369,
      "num_input_tokens_seen": 37166044576,
      "step": 47239
    },
    {
      "epoch": 5.011669849352854,
      "grad_norm": 1.030663657228981,
      "learning_rate": 3.143645777861959e-05,
      "loss": 1.1366,
      "num_input_tokens_seen": 37166831344,
      "step": 47240
    },
    {
      "epoch": 5.011775938892425,
      "grad_norm": 1.0293228566995805,
      "learning_rate": 3.143578623512332e-05,
      "loss": 1.181,
      "num_input_tokens_seen": 37167618112,
      "step": 47241
    },
    {
      "epoch": 5.011882028431996,
      "grad_norm": 0.7660744221704731,
      "learning_rate": 3.143511468665367e-05,
      "loss": 1.244,
      "num_input_tokens_seen": 37168404832,
      "step": 47242
    },
    {
      "epoch": 5.011988117971568,
      "grad_norm": 0.9984087401652137,
      "learning_rate": 3.143444313321115e-05,
      "loss": 1.1608,
      "num_input_tokens_seen": 37169191664,
      "step": 47243
    },
    {
      "epoch": 5.012094207511139,
      "grad_norm": 0.880019790706808,
      "learning_rate": 3.143377157479627e-05,
      "loss": 1.092,
      "num_input_tokens_seen": 37169978544,
      "step": 47244
    },
    {
      "epoch": 5.012200297050711,
      "grad_norm": 0.8129318749546768,
      "learning_rate": 3.143310001140958e-05,
      "loss": 1.1179,
      "num_input_tokens_seen": 37170765424,
      "step": 47245
    },
    {
      "epoch": 5.012306386590282,
      "grad_norm": 1.3508880460272397,
      "learning_rate": 3.1432428443051565e-05,
      "loss": 1.2071,
      "num_input_tokens_seen": 37171552144,
      "step": 47246
    },
    {
      "epoch": 5.012412476129853,
      "grad_norm": 0.9943121127614005,
      "learning_rate": 3.143175686972276e-05,
      "loss": 1.1075,
      "num_input_tokens_seen": 37172338960,
      "step": 47247
    },
    {
      "epoch": 5.012518565669425,
      "grad_norm": 1.1259988367394396,
      "learning_rate": 3.143108529142368e-05,
      "loss": 1.1647,
      "num_input_tokens_seen": 37173125696,
      "step": 47248
    },
    {
      "epoch": 5.012624655208996,
      "grad_norm": 2.248948864513535,
      "learning_rate": 3.143041370815485e-05,
      "loss": 1.2386,
      "num_input_tokens_seen": 37173912464,
      "step": 47249
    },
    {
      "epoch": 5.012730744748568,
      "grad_norm": 0.8397622056165246,
      "learning_rate": 3.142974211991678e-05,
      "loss": 1.2234,
      "num_input_tokens_seen": 37174699200,
      "step": 47250
    },
    {
      "epoch": 5.012836834288139,
      "grad_norm": 0.8691366442583605,
      "learning_rate": 3.142907052671e-05,
      "loss": 1.1626,
      "num_input_tokens_seen": 37175485872,
      "step": 47251
    },
    {
      "epoch": 5.012942923827711,
      "grad_norm": 0.7434291474542558,
      "learning_rate": 3.142839892853502e-05,
      "loss": 1.0695,
      "num_input_tokens_seen": 37176272608,
      "step": 47252
    },
    {
      "epoch": 5.013049013367282,
      "grad_norm": 0.8362730589046327,
      "learning_rate": 3.1427727325392367e-05,
      "loss": 1.1313,
      "num_input_tokens_seen": 37177059392,
      "step": 47253
    },
    {
      "epoch": 5.013155102906853,
      "grad_norm": 0.6238468091058996,
      "learning_rate": 3.142705571728255e-05,
      "loss": 1.0871,
      "num_input_tokens_seen": 37177846176,
      "step": 47254
    },
    {
      "epoch": 5.013261192446425,
      "grad_norm": 0.7786746397063613,
      "learning_rate": 3.142638410420609e-05,
      "loss": 1.1806,
      "num_input_tokens_seen": 37178632960,
      "step": 47255
    },
    {
      "epoch": 5.013367281985996,
      "grad_norm": 0.9172508701059605,
      "learning_rate": 3.142571248616352e-05,
      "loss": 1.1351,
      "num_input_tokens_seen": 37179419680,
      "step": 47256
    },
    {
      "epoch": 5.013473371525568,
      "grad_norm": 0.5834911643878701,
      "learning_rate": 3.142504086315534e-05,
      "loss": 1.0849,
      "num_input_tokens_seen": 37180206592,
      "step": 47257
    },
    {
      "epoch": 5.013579461065139,
      "grad_norm": 0.8336492496589373,
      "learning_rate": 3.142436923518207e-05,
      "loss": 1.1538,
      "num_input_tokens_seen": 37180993360,
      "step": 47258
    },
    {
      "epoch": 5.01368555060471,
      "grad_norm": 0.6781585361591334,
      "learning_rate": 3.142369760224425e-05,
      "loss": 1.12,
      "num_input_tokens_seen": 37181780112,
      "step": 47259
    },
    {
      "epoch": 5.013791640144282,
      "grad_norm": 0.7750884578249982,
      "learning_rate": 3.142302596434238e-05,
      "loss": 1.1568,
      "num_input_tokens_seen": 37182566928,
      "step": 47260
    },
    {
      "epoch": 5.013897729683853,
      "grad_norm": 0.9141767677617422,
      "learning_rate": 3.1422354321476976e-05,
      "loss": 1.2285,
      "num_input_tokens_seen": 37183353680,
      "step": 47261
    },
    {
      "epoch": 5.014003819223425,
      "grad_norm": 0.7763783347512664,
      "learning_rate": 3.142168267364857e-05,
      "loss": 1.2318,
      "num_input_tokens_seen": 37184140480,
      "step": 47262
    },
    {
      "epoch": 5.014109908762996,
      "grad_norm": 0.8955378622731556,
      "learning_rate": 3.1421011020857684e-05,
      "loss": 1.1916,
      "num_input_tokens_seen": 37184927216,
      "step": 47263
    },
    {
      "epoch": 5.014215998302568,
      "grad_norm": 0.6128364379994908,
      "learning_rate": 3.142033936310482e-05,
      "loss": 1.1386,
      "num_input_tokens_seen": 37185714000,
      "step": 47264
    },
    {
      "epoch": 5.014322087842139,
      "grad_norm": 0.8859246181312882,
      "learning_rate": 3.141966770039051e-05,
      "loss": 1.0817,
      "num_input_tokens_seen": 37186500784,
      "step": 47265
    },
    {
      "epoch": 5.01442817738171,
      "grad_norm": 0.5562382729814143,
      "learning_rate": 3.1418996032715266e-05,
      "loss": 1.1394,
      "num_input_tokens_seen": 37187287536,
      "step": 47266
    },
    {
      "epoch": 5.014534266921282,
      "grad_norm": 0.7944710177668778,
      "learning_rate": 3.141832436007961e-05,
      "loss": 1.163,
      "num_input_tokens_seen": 37188074272,
      "step": 47267
    },
    {
      "epoch": 5.014640356460853,
      "grad_norm": 0.6886031025208011,
      "learning_rate": 3.141765268248407e-05,
      "loss": 1.0671,
      "num_input_tokens_seen": 37188861088,
      "step": 47268
    },
    {
      "epoch": 5.014746446000425,
      "grad_norm": 0.7431725978827665,
      "learning_rate": 3.141698099992915e-05,
      "loss": 1.1437,
      "num_input_tokens_seen": 37189647696,
      "step": 47269
    },
    {
      "epoch": 5.014852535539996,
      "grad_norm": 0.9361650591244762,
      "learning_rate": 3.141630931241537e-05,
      "loss": 1.1454,
      "num_input_tokens_seen": 37190434560,
      "step": 47270
    },
    {
      "epoch": 5.014958625079567,
      "grad_norm": 0.646511470217467,
      "learning_rate": 3.1415637619943264e-05,
      "loss": 1.0635,
      "num_input_tokens_seen": 37191221328,
      "step": 47271
    },
    {
      "epoch": 5.015064714619139,
      "grad_norm": 0.7412614538234541,
      "learning_rate": 3.1414965922513335e-05,
      "loss": 1.1337,
      "num_input_tokens_seen": 37192008176,
      "step": 47272
    },
    {
      "epoch": 5.01517080415871,
      "grad_norm": 0.715522347607546,
      "learning_rate": 3.141429422012611e-05,
      "loss": 1.1944,
      "num_input_tokens_seen": 37192794976,
      "step": 47273
    },
    {
      "epoch": 5.015276893698282,
      "grad_norm": 0.7894971560423114,
      "learning_rate": 3.1413622512782105e-05,
      "loss": 1.1583,
      "num_input_tokens_seen": 37193581680,
      "step": 47274
    },
    {
      "epoch": 5.015382983237853,
      "grad_norm": 0.9022641753142153,
      "learning_rate": 3.141295080048184e-05,
      "loss": 1.1146,
      "num_input_tokens_seen": 37194368384,
      "step": 47275
    },
    {
      "epoch": 5.015489072777424,
      "grad_norm": 0.6312692274955272,
      "learning_rate": 3.141227908322584e-05,
      "loss": 1.1416,
      "num_input_tokens_seen": 37195155120,
      "step": 47276
    },
    {
      "epoch": 5.015595162316996,
      "grad_norm": 0.9330084721954556,
      "learning_rate": 3.141160736101462e-05,
      "loss": 1.126,
      "num_input_tokens_seen": 37195941984,
      "step": 47277
    },
    {
      "epoch": 5.015701251856567,
      "grad_norm": 0.6590275320193822,
      "learning_rate": 3.141093563384869e-05,
      "loss": 1.1079,
      "num_input_tokens_seen": 37196728784,
      "step": 47278
    },
    {
      "epoch": 5.015807341396139,
      "grad_norm": 0.9412751461665977,
      "learning_rate": 3.141026390172858e-05,
      "loss": 1.1092,
      "num_input_tokens_seen": 37197515584,
      "step": 47279
    },
    {
      "epoch": 5.01591343093571,
      "grad_norm": 0.7070723335813721,
      "learning_rate": 3.140959216465481e-05,
      "loss": 1.1849,
      "num_input_tokens_seen": 37198302400,
      "step": 47280
    },
    {
      "epoch": 5.0160195204752815,
      "grad_norm": 0.8267966661274487,
      "learning_rate": 3.1408920422627894e-05,
      "loss": 1.1801,
      "num_input_tokens_seen": 37199089120,
      "step": 47281
    },
    {
      "epoch": 5.016125610014853,
      "grad_norm": 0.6626254791558291,
      "learning_rate": 3.140824867564835e-05,
      "loss": 1.1266,
      "num_input_tokens_seen": 37199875840,
      "step": 47282
    },
    {
      "epoch": 5.016231699554424,
      "grad_norm": 0.7041160673581596,
      "learning_rate": 3.1407576923716705e-05,
      "loss": 1.1754,
      "num_input_tokens_seen": 37200662544,
      "step": 47283
    },
    {
      "epoch": 5.0163377890939955,
      "grad_norm": 0.613307010688201,
      "learning_rate": 3.140690516683346e-05,
      "loss": 1.1615,
      "num_input_tokens_seen": 37201449392,
      "step": 47284
    },
    {
      "epoch": 5.0164438786335666,
      "grad_norm": 0.7937665998161153,
      "learning_rate": 3.1406233404999156e-05,
      "loss": 1.2076,
      "num_input_tokens_seen": 37202236176,
      "step": 47285
    },
    {
      "epoch": 5.0165499681731385,
      "grad_norm": 0.5430779962601223,
      "learning_rate": 3.140556163821431e-05,
      "loss": 1.0347,
      "num_input_tokens_seen": 37203022928,
      "step": 47286
    },
    {
      "epoch": 5.0166560577127095,
      "grad_norm": 0.7452402563627261,
      "learning_rate": 3.140488986647942e-05,
      "loss": 1.1804,
      "num_input_tokens_seen": 37203809600,
      "step": 47287
    },
    {
      "epoch": 5.0167621472522805,
      "grad_norm": 0.6180433385287946,
      "learning_rate": 3.140421808979502e-05,
      "loss": 1.0579,
      "num_input_tokens_seen": 37204596416,
      "step": 47288
    },
    {
      "epoch": 5.0168682367918525,
      "grad_norm": 0.6327896857897977,
      "learning_rate": 3.140354630816164e-05,
      "loss": 1.1159,
      "num_input_tokens_seen": 37205383200,
      "step": 47289
    },
    {
      "epoch": 5.0169743263314235,
      "grad_norm": 0.6691520016084451,
      "learning_rate": 3.140287452157978e-05,
      "loss": 1.1507,
      "num_input_tokens_seen": 37206169952,
      "step": 47290
    },
    {
      "epoch": 5.017080415870995,
      "grad_norm": 0.6220250298711734,
      "learning_rate": 3.140220273004997e-05,
      "loss": 1.2406,
      "num_input_tokens_seen": 37206956688,
      "step": 47291
    },
    {
      "epoch": 5.017186505410566,
      "grad_norm": 0.6581062879315216,
      "learning_rate": 3.1401530933572714e-05,
      "loss": 1.1114,
      "num_input_tokens_seen": 37207743536,
      "step": 47292
    },
    {
      "epoch": 5.017292594950138,
      "grad_norm": 0.7931240408753005,
      "learning_rate": 3.140085913214855e-05,
      "loss": 1.1007,
      "num_input_tokens_seen": 37208530288,
      "step": 47293
    },
    {
      "epoch": 5.017398684489709,
      "grad_norm": 0.647459953626683,
      "learning_rate": 3.1400187325777995e-05,
      "loss": 1.0692,
      "num_input_tokens_seen": 37209317040,
      "step": 47294
    },
    {
      "epoch": 5.01750477402928,
      "grad_norm": 0.6998338521291657,
      "learning_rate": 3.139951551446156e-05,
      "loss": 1.0816,
      "num_input_tokens_seen": 37210103856,
      "step": 47295
    },
    {
      "epoch": 5.017610863568852,
      "grad_norm": 0.7079348430033726,
      "learning_rate": 3.1398843698199764e-05,
      "loss": 1.2001,
      "num_input_tokens_seen": 37210890544,
      "step": 47296
    },
    {
      "epoch": 5.017716953108423,
      "grad_norm": 0.6546593951619151,
      "learning_rate": 3.1398171876993134e-05,
      "loss": 1.0891,
      "num_input_tokens_seen": 37211677360,
      "step": 47297
    },
    {
      "epoch": 5.017823042647995,
      "grad_norm": 0.7325312104356164,
      "learning_rate": 3.1397500050842176e-05,
      "loss": 1.0682,
      "num_input_tokens_seen": 37212464160,
      "step": 47298
    },
    {
      "epoch": 5.017929132187566,
      "grad_norm": 0.6716074260745131,
      "learning_rate": 3.139682821974743e-05,
      "loss": 1.1537,
      "num_input_tokens_seen": 37213250944,
      "step": 47299
    },
    {
      "epoch": 5.018035221727137,
      "grad_norm": 0.6523852493033989,
      "learning_rate": 3.13961563837094e-05,
      "loss": 1.1722,
      "num_input_tokens_seen": 37214037648,
      "step": 47300
    },
    {
      "epoch": 5.018141311266709,
      "grad_norm": 0.6731413436508707,
      "learning_rate": 3.13954845427286e-05,
      "loss": 1.0548,
      "num_input_tokens_seen": 37214824384,
      "step": 47301
    },
    {
      "epoch": 5.01824740080628,
      "grad_norm": 0.6612125395884698,
      "learning_rate": 3.139481269680556e-05,
      "loss": 1.1525,
      "num_input_tokens_seen": 37215611104,
      "step": 47302
    },
    {
      "epoch": 5.018353490345852,
      "grad_norm": 0.7609029960106151,
      "learning_rate": 3.13941408459408e-05,
      "loss": 1.1754,
      "num_input_tokens_seen": 37216397840,
      "step": 47303
    },
    {
      "epoch": 5.018459579885423,
      "grad_norm": 0.6913009231418052,
      "learning_rate": 3.1393468990134836e-05,
      "loss": 1.1576,
      "num_input_tokens_seen": 37217184528,
      "step": 47304
    },
    {
      "epoch": 5.018565669424994,
      "grad_norm": 0.6163829701382741,
      "learning_rate": 3.1392797129388186e-05,
      "loss": 1.1161,
      "num_input_tokens_seen": 37217971360,
      "step": 47305
    },
    {
      "epoch": 5.018671758964566,
      "grad_norm": 0.8244535701371166,
      "learning_rate": 3.139212526370137e-05,
      "loss": 1.2148,
      "num_input_tokens_seen": 37218758176,
      "step": 47306
    },
    {
      "epoch": 5.018777848504137,
      "grad_norm": 0.6617384465942148,
      "learning_rate": 3.13914533930749e-05,
      "loss": 1.2259,
      "num_input_tokens_seen": 37219544896,
      "step": 47307
    },
    {
      "epoch": 5.018883938043709,
      "grad_norm": 0.5290547902588874,
      "learning_rate": 3.139078151750931e-05,
      "loss": 1.0814,
      "num_input_tokens_seen": 37220331744,
      "step": 47308
    },
    {
      "epoch": 5.01899002758328,
      "grad_norm": 0.7129610183914828,
      "learning_rate": 3.1390109637005105e-05,
      "loss": 1.1009,
      "num_input_tokens_seen": 37221118544,
      "step": 47309
    },
    {
      "epoch": 5.019096117122852,
      "grad_norm": 0.7932016413824089,
      "learning_rate": 3.138943775156281e-05,
      "loss": 1.0204,
      "num_input_tokens_seen": 37221905312,
      "step": 47310
    },
    {
      "epoch": 5.019202206662423,
      "grad_norm": 0.698854527714794,
      "learning_rate": 3.1388765861182956e-05,
      "loss": 1.227,
      "num_input_tokens_seen": 37222692032,
      "step": 47311
    },
    {
      "epoch": 5.019308296201994,
      "grad_norm": 0.9326401182716604,
      "learning_rate": 3.1388093965866045e-05,
      "loss": 1.1594,
      "num_input_tokens_seen": 37223478704,
      "step": 47312
    },
    {
      "epoch": 5.019414385741566,
      "grad_norm": 0.567819187719896,
      "learning_rate": 3.13874220656126e-05,
      "loss": 1.1039,
      "num_input_tokens_seen": 37224265488,
      "step": 47313
    },
    {
      "epoch": 5.019520475281137,
      "grad_norm": 1.1802141159815756,
      "learning_rate": 3.138675016042315e-05,
      "loss": 1.188,
      "num_input_tokens_seen": 37225052320,
      "step": 47314
    },
    {
      "epoch": 5.019626564820709,
      "grad_norm": 0.5697145172413751,
      "learning_rate": 3.13860782502982e-05,
      "loss": 1.1109,
      "num_input_tokens_seen": 37225839184,
      "step": 47315
    },
    {
      "epoch": 5.01973265436028,
      "grad_norm": 0.7040806138975045,
      "learning_rate": 3.1385406335238275e-05,
      "loss": 1.2229,
      "num_input_tokens_seen": 37226626000,
      "step": 47316
    },
    {
      "epoch": 5.019838743899851,
      "grad_norm": 0.6125282068869008,
      "learning_rate": 3.13847344152439e-05,
      "loss": 1.1205,
      "num_input_tokens_seen": 37227412720,
      "step": 47317
    },
    {
      "epoch": 5.019944833439423,
      "grad_norm": 0.8101984584022498,
      "learning_rate": 3.1384062490315585e-05,
      "loss": 1.2992,
      "num_input_tokens_seen": 37228199456,
      "step": 47318
    },
    {
      "epoch": 5.020050922978994,
      "grad_norm": 0.6305956222276045,
      "learning_rate": 3.1383390560453865e-05,
      "loss": 1.0315,
      "num_input_tokens_seen": 37228986320,
      "step": 47319
    },
    {
      "epoch": 5.020157012518566,
      "grad_norm": 1.207686548615393,
      "learning_rate": 3.1382718625659236e-05,
      "loss": 1.0866,
      "num_input_tokens_seen": 37229773136,
      "step": 47320
    },
    {
      "epoch": 5.020263102058137,
      "grad_norm": 0.8294150028881907,
      "learning_rate": 3.138204668593223e-05,
      "loss": 1.1061,
      "num_input_tokens_seen": 37230559888,
      "step": 47321
    },
    {
      "epoch": 5.020369191597709,
      "grad_norm": 0.6085987586307181,
      "learning_rate": 3.1381374741273375e-05,
      "loss": 1.0168,
      "num_input_tokens_seen": 37231346672,
      "step": 47322
    },
    {
      "epoch": 5.02047528113728,
      "grad_norm": 0.7109607430408998,
      "learning_rate": 3.1380702791683174e-05,
      "loss": 1.1456,
      "num_input_tokens_seen": 37232133344,
      "step": 47323
    },
    {
      "epoch": 5.020581370676851,
      "grad_norm": 0.6037135609177942,
      "learning_rate": 3.138003083716215e-05,
      "loss": 1.1395,
      "num_input_tokens_seen": 37232920176,
      "step": 47324
    },
    {
      "epoch": 5.020687460216423,
      "grad_norm": 0.8058257403325841,
      "learning_rate": 3.137935887771083e-05,
      "loss": 1.181,
      "num_input_tokens_seen": 37233706896,
      "step": 47325
    },
    {
      "epoch": 5.020793549755994,
      "grad_norm": 0.6973552806010126,
      "learning_rate": 3.137868691332973e-05,
      "loss": 1.1917,
      "num_input_tokens_seen": 37234493664,
      "step": 47326
    },
    {
      "epoch": 5.020899639295566,
      "grad_norm": 0.6395316397631833,
      "learning_rate": 3.137801494401936e-05,
      "loss": 1.1407,
      "num_input_tokens_seen": 37235280336,
      "step": 47327
    },
    {
      "epoch": 5.021005728835137,
      "grad_norm": 0.6779633671014121,
      "learning_rate": 3.137734296978026e-05,
      "loss": 1.0518,
      "num_input_tokens_seen": 37236067248,
      "step": 47328
    },
    {
      "epoch": 5.021111818374708,
      "grad_norm": 0.6826078814781251,
      "learning_rate": 3.137667099061293e-05,
      "loss": 1.089,
      "num_input_tokens_seen": 37236853920,
      "step": 47329
    },
    {
      "epoch": 5.02121790791428,
      "grad_norm": 0.635648159336371,
      "learning_rate": 3.1375999006517895e-05,
      "loss": 1.136,
      "num_input_tokens_seen": 37237640720,
      "step": 47330
    },
    {
      "epoch": 5.021323997453851,
      "grad_norm": 0.7641134164039602,
      "learning_rate": 3.1375327017495674e-05,
      "loss": 1.1882,
      "num_input_tokens_seen": 37238427456,
      "step": 47331
    },
    {
      "epoch": 5.021430086993423,
      "grad_norm": 0.7843209407295764,
      "learning_rate": 3.13746550235468e-05,
      "loss": 1.1588,
      "num_input_tokens_seen": 37239214192,
      "step": 47332
    },
    {
      "epoch": 5.021536176532994,
      "grad_norm": 0.8215778613374564,
      "learning_rate": 3.137398302467176e-05,
      "loss": 1.1094,
      "num_input_tokens_seen": 37240000944,
      "step": 47333
    },
    {
      "epoch": 5.021642266072565,
      "grad_norm": 0.9388158278224527,
      "learning_rate": 3.13733110208711e-05,
      "loss": 1.162,
      "num_input_tokens_seen": 37240787648,
      "step": 47334
    },
    {
      "epoch": 5.021748355612137,
      "grad_norm": 0.6488982614491423,
      "learning_rate": 3.137263901214533e-05,
      "loss": 1.0685,
      "num_input_tokens_seen": 37241574384,
      "step": 47335
    },
    {
      "epoch": 5.021854445151708,
      "grad_norm": 1.154164080264736,
      "learning_rate": 3.137196699849498e-05,
      "loss": 1.1571,
      "num_input_tokens_seen": 37242361184,
      "step": 47336
    },
    {
      "epoch": 5.02196053469128,
      "grad_norm": 0.8682496033115712,
      "learning_rate": 3.137129497992056e-05,
      "loss": 1.1537,
      "num_input_tokens_seen": 37243147888,
      "step": 47337
    },
    {
      "epoch": 5.022066624230851,
      "grad_norm": 0.5903598778683914,
      "learning_rate": 3.137062295642258e-05,
      "loss": 1.0937,
      "num_input_tokens_seen": 37243934688,
      "step": 47338
    },
    {
      "epoch": 5.022172713770423,
      "grad_norm": 1.0307687277402418,
      "learning_rate": 3.136995092800158e-05,
      "loss": 1.0342,
      "num_input_tokens_seen": 37244721472,
      "step": 47339
    },
    {
      "epoch": 5.022278803309994,
      "grad_norm": 0.6333096823494943,
      "learning_rate": 3.1369278894658064e-05,
      "loss": 1.165,
      "num_input_tokens_seen": 37245508176,
      "step": 47340
    },
    {
      "epoch": 5.022384892849565,
      "grad_norm": 0.6522700466731679,
      "learning_rate": 3.136860685639255e-05,
      "loss": 1.1273,
      "num_input_tokens_seen": 37246294896,
      "step": 47341
    },
    {
      "epoch": 5.022490982389137,
      "grad_norm": 0.8370313459787688,
      "learning_rate": 3.1367934813205577e-05,
      "loss": 1.1232,
      "num_input_tokens_seen": 37247081664,
      "step": 47342
    },
    {
      "epoch": 5.022597071928708,
      "grad_norm": 0.6303581582084166,
      "learning_rate": 3.1367262765097644e-05,
      "loss": 1.0718,
      "num_input_tokens_seen": 37247868496,
      "step": 47343
    },
    {
      "epoch": 5.0227031614682796,
      "grad_norm": 0.7586647069551515,
      "learning_rate": 3.136659071206927e-05,
      "loss": 1.1441,
      "num_input_tokens_seen": 37248655216,
      "step": 47344
    },
    {
      "epoch": 5.022809251007851,
      "grad_norm": 0.8556169085579624,
      "learning_rate": 3.1365918654121e-05,
      "loss": 1.1585,
      "num_input_tokens_seen": 37249442016,
      "step": 47345
    },
    {
      "epoch": 5.022915340547422,
      "grad_norm": 0.9924792346869098,
      "learning_rate": 3.136524659125332e-05,
      "loss": 1.2155,
      "num_input_tokens_seen": 37250228768,
      "step": 47346
    },
    {
      "epoch": 5.0230214300869935,
      "grad_norm": 1.0444381941556142,
      "learning_rate": 3.136457452346676e-05,
      "loss": 1.1478,
      "num_input_tokens_seen": 37251015504,
      "step": 47347
    },
    {
      "epoch": 5.023127519626565,
      "grad_norm": 1.0441767206072725,
      "learning_rate": 3.1363902450761856e-05,
      "loss": 1.1208,
      "num_input_tokens_seen": 37251802320,
      "step": 47348
    },
    {
      "epoch": 5.0232336091661365,
      "grad_norm": 0.666645772033739,
      "learning_rate": 3.1363230373139115e-05,
      "loss": 1.1159,
      "num_input_tokens_seen": 37252589088,
      "step": 47349
    },
    {
      "epoch": 5.0233396987057075,
      "grad_norm": 1.5035385934218304,
      "learning_rate": 3.136255829059905e-05,
      "loss": 1.1104,
      "num_input_tokens_seen": 37253375904,
      "step": 47350
    },
    {
      "epoch": 5.023445788245279,
      "grad_norm": 0.8499890818096871,
      "learning_rate": 3.136188620314219e-05,
      "loss": 1.0626,
      "num_input_tokens_seen": 37254162768,
      "step": 47351
    },
    {
      "epoch": 5.0235518777848505,
      "grad_norm": 0.8171773831152954,
      "learning_rate": 3.1361214110769045e-05,
      "loss": 1.1341,
      "num_input_tokens_seen": 37254949520,
      "step": 47352
    },
    {
      "epoch": 5.0236579673244215,
      "grad_norm": 1.2596393150046277,
      "learning_rate": 3.1360542013480144e-05,
      "loss": 1.1124,
      "num_input_tokens_seen": 37255736304,
      "step": 47353
    },
    {
      "epoch": 5.023764056863993,
      "grad_norm": 0.6650653950815925,
      "learning_rate": 3.1359869911276005e-05,
      "loss": 1.0553,
      "num_input_tokens_seen": 37256523104,
      "step": 47354
    },
    {
      "epoch": 5.023870146403564,
      "grad_norm": 0.8211114308152803,
      "learning_rate": 3.135919780415714e-05,
      "loss": 1.1213,
      "num_input_tokens_seen": 37257309776,
      "step": 47355
    },
    {
      "epoch": 5.023976235943136,
      "grad_norm": 0.8211567827588885,
      "learning_rate": 3.1358525692124075e-05,
      "loss": 1.1905,
      "num_input_tokens_seen": 37258096496,
      "step": 47356
    },
    {
      "epoch": 5.024082325482707,
      "grad_norm": 0.740802211026355,
      "learning_rate": 3.1357853575177335e-05,
      "loss": 1.1237,
      "num_input_tokens_seen": 37258883248,
      "step": 47357
    },
    {
      "epoch": 5.024188415022278,
      "grad_norm": 0.8717514230266005,
      "learning_rate": 3.1357181453317424e-05,
      "loss": 1.1092,
      "num_input_tokens_seen": 37259670016,
      "step": 47358
    },
    {
      "epoch": 5.02429450456185,
      "grad_norm": 0.6359538723485386,
      "learning_rate": 3.135650932654487e-05,
      "loss": 1.1256,
      "num_input_tokens_seen": 37260456688,
      "step": 47359
    },
    {
      "epoch": 5.024400594101421,
      "grad_norm": 0.9491864772886763,
      "learning_rate": 3.135583719486019e-05,
      "loss": 1.2189,
      "num_input_tokens_seen": 37261243360,
      "step": 47360
    },
    {
      "epoch": 5.024506683640993,
      "grad_norm": 0.6319230056336652,
      "learning_rate": 3.135516505826391e-05,
      "loss": 1.1255,
      "num_input_tokens_seen": 37262030096,
      "step": 47361
    },
    {
      "epoch": 5.024612773180564,
      "grad_norm": 0.8917375567813318,
      "learning_rate": 3.135449291675655e-05,
      "loss": 1.1709,
      "num_input_tokens_seen": 37262816736,
      "step": 47362
    },
    {
      "epoch": 5.024718862720136,
      "grad_norm": 0.6004889161853165,
      "learning_rate": 3.135382077033862e-05,
      "loss": 1.0959,
      "num_input_tokens_seen": 37263603408,
      "step": 47363
    },
    {
      "epoch": 5.024824952259707,
      "grad_norm": 0.9161757095266958,
      "learning_rate": 3.135314861901064e-05,
      "loss": 1.1566,
      "num_input_tokens_seen": 37264390176,
      "step": 47364
    },
    {
      "epoch": 5.024931041799278,
      "grad_norm": 0.6556037835322641,
      "learning_rate": 3.135247646277314e-05,
      "loss": 1.0922,
      "num_input_tokens_seen": 37265177008,
      "step": 47365
    },
    {
      "epoch": 5.02503713133885,
      "grad_norm": 0.9562727997669931,
      "learning_rate": 3.135180430162663e-05,
      "loss": 1.1485,
      "num_input_tokens_seen": 37265963760,
      "step": 47366
    },
    {
      "epoch": 5.025143220878421,
      "grad_norm": 0.6158360763789162,
      "learning_rate": 3.1351132135571634e-05,
      "loss": 1.0804,
      "num_input_tokens_seen": 37266750656,
      "step": 47367
    },
    {
      "epoch": 5.025249310417993,
      "grad_norm": 0.7772253671033889,
      "learning_rate": 3.135045996460866e-05,
      "loss": 1.1525,
      "num_input_tokens_seen": 37267537376,
      "step": 47368
    },
    {
      "epoch": 5.025355399957564,
      "grad_norm": 0.6726237844379516,
      "learning_rate": 3.134978778873825e-05,
      "loss": 1.1826,
      "num_input_tokens_seen": 37268324032,
      "step": 47369
    },
    {
      "epoch": 5.025461489497135,
      "grad_norm": 0.8272033481793883,
      "learning_rate": 3.13491156079609e-05,
      "loss": 1.0575,
      "num_input_tokens_seen": 37269110864,
      "step": 47370
    },
    {
      "epoch": 5.025567579036707,
      "grad_norm": 0.6915584361154434,
      "learning_rate": 3.1348443422277146e-05,
      "loss": 1.1501,
      "num_input_tokens_seen": 37269897584,
      "step": 47371
    },
    {
      "epoch": 5.025673668576278,
      "grad_norm": 0.881974016786919,
      "learning_rate": 3.13477712316875e-05,
      "loss": 1.2285,
      "num_input_tokens_seen": 37270684288,
      "step": 47372
    },
    {
      "epoch": 5.02577975811585,
      "grad_norm": 0.7235054804692392,
      "learning_rate": 3.134709903619248e-05,
      "loss": 1.214,
      "num_input_tokens_seen": 37271471040,
      "step": 47373
    },
    {
      "epoch": 5.025885847655421,
      "grad_norm": 0.6999332818321462,
      "learning_rate": 3.134642683579261e-05,
      "loss": 1.2446,
      "num_input_tokens_seen": 37272257792,
      "step": 47374
    },
    {
      "epoch": 5.025991937194992,
      "grad_norm": 0.9637437183363855,
      "learning_rate": 3.134575463048841e-05,
      "loss": 1.1552,
      "num_input_tokens_seen": 37273044640,
      "step": 47375
    },
    {
      "epoch": 5.026098026734564,
      "grad_norm": 0.5709975121137894,
      "learning_rate": 3.134508242028039e-05,
      "loss": 1.07,
      "num_input_tokens_seen": 37273831376,
      "step": 47376
    },
    {
      "epoch": 5.026204116274135,
      "grad_norm": 0.9905431169414023,
      "learning_rate": 3.1344410205169084e-05,
      "loss": 1.1111,
      "num_input_tokens_seen": 37274618176,
      "step": 47377
    },
    {
      "epoch": 5.026310205813707,
      "grad_norm": 0.6265954719660279,
      "learning_rate": 3.1343737985154995e-05,
      "loss": 1.1444,
      "num_input_tokens_seen": 37275405056,
      "step": 47378
    },
    {
      "epoch": 5.026416295353278,
      "grad_norm": 0.9440245502929886,
      "learning_rate": 3.134306576023866e-05,
      "loss": 1.1364,
      "num_input_tokens_seen": 37276191840,
      "step": 47379
    },
    {
      "epoch": 5.02652238489285,
      "grad_norm": 0.6828956596815281,
      "learning_rate": 3.134239353042059e-05,
      "loss": 1.1886,
      "num_input_tokens_seen": 37276978608,
      "step": 47380
    },
    {
      "epoch": 5.026628474432421,
      "grad_norm": 0.7420769895800673,
      "learning_rate": 3.13417212957013e-05,
      "loss": 1.118,
      "num_input_tokens_seen": 37277765392,
      "step": 47381
    },
    {
      "epoch": 5.026734563971992,
      "grad_norm": 0.7185851340500774,
      "learning_rate": 3.134104905608132e-05,
      "loss": 1.2262,
      "num_input_tokens_seen": 37278552064,
      "step": 47382
    },
    {
      "epoch": 5.026840653511564,
      "grad_norm": 0.6429167228156876,
      "learning_rate": 3.1340376811561156e-05,
      "loss": 1.0957,
      "num_input_tokens_seen": 37279338864,
      "step": 47383
    },
    {
      "epoch": 5.026946743051135,
      "grad_norm": 0.6849933498109444,
      "learning_rate": 3.133970456214133e-05,
      "loss": 1.129,
      "num_input_tokens_seen": 37280125504,
      "step": 47384
    },
    {
      "epoch": 5.027052832590707,
      "grad_norm": 0.5672153235898179,
      "learning_rate": 3.133903230782238e-05,
      "loss": 1.0652,
      "num_input_tokens_seen": 37280912320,
      "step": 47385
    },
    {
      "epoch": 5.027158922130278,
      "grad_norm": 0.785391425524154,
      "learning_rate": 3.1338360048604806e-05,
      "loss": 1.167,
      "num_input_tokens_seen": 37281699184,
      "step": 47386
    },
    {
      "epoch": 5.027265011669849,
      "grad_norm": 0.6572121622892103,
      "learning_rate": 3.1337687784489126e-05,
      "loss": 1.2392,
      "num_input_tokens_seen": 37282485952,
      "step": 47387
    },
    {
      "epoch": 5.027371101209421,
      "grad_norm": 0.5627361260000867,
      "learning_rate": 3.1337015515475875e-05,
      "loss": 1.0755,
      "num_input_tokens_seen": 37283272736,
      "step": 47388
    },
    {
      "epoch": 5.027477190748992,
      "grad_norm": 0.9503036554107552,
      "learning_rate": 3.133634324156557e-05,
      "loss": 1.2749,
      "num_input_tokens_seen": 37284059472,
      "step": 47389
    },
    {
      "epoch": 5.027583280288564,
      "grad_norm": 0.5486623667114305,
      "learning_rate": 3.133567096275871e-05,
      "loss": 1.0601,
      "num_input_tokens_seen": 37284846256,
      "step": 47390
    },
    {
      "epoch": 5.027689369828135,
      "grad_norm": 0.8268997177649199,
      "learning_rate": 3.133499867905584e-05,
      "loss": 1.1645,
      "num_input_tokens_seen": 37285633056,
      "step": 47391
    },
    {
      "epoch": 5.027795459367707,
      "grad_norm": 0.6192397655538001,
      "learning_rate": 3.133432639045747e-05,
      "loss": 1.0735,
      "num_input_tokens_seen": 37286419872,
      "step": 47392
    },
    {
      "epoch": 5.027901548907278,
      "grad_norm": 0.8172836374016214,
      "learning_rate": 3.133365409696411e-05,
      "loss": 1.1437,
      "num_input_tokens_seen": 37287206656,
      "step": 47393
    },
    {
      "epoch": 5.028007638446849,
      "grad_norm": 0.6080205178063047,
      "learning_rate": 3.1332981798576294e-05,
      "loss": 1.1695,
      "num_input_tokens_seen": 37287993360,
      "step": 47394
    },
    {
      "epoch": 5.028113727986421,
      "grad_norm": 0.5599207628037963,
      "learning_rate": 3.133230949529453e-05,
      "loss": 1.0599,
      "num_input_tokens_seen": 37288780160,
      "step": 47395
    },
    {
      "epoch": 5.028219817525992,
      "grad_norm": 0.7861830003682374,
      "learning_rate": 3.133163718711935e-05,
      "loss": 1.2007,
      "num_input_tokens_seen": 37289566832,
      "step": 47396
    },
    {
      "epoch": 5.028325907065564,
      "grad_norm": 0.7464786197549609,
      "learning_rate": 3.133096487405127e-05,
      "loss": 1.141,
      "num_input_tokens_seen": 37290353440,
      "step": 47397
    },
    {
      "epoch": 5.028431996605135,
      "grad_norm": 0.6960195488381491,
      "learning_rate": 3.133029255609079e-05,
      "loss": 1.1564,
      "num_input_tokens_seen": 37291140192,
      "step": 47398
    },
    {
      "epoch": 5.028538086144706,
      "grad_norm": 0.6020098446733716,
      "learning_rate": 3.132962023323846e-05,
      "loss": 1.1114,
      "num_input_tokens_seen": 37291927024,
      "step": 47399
    },
    {
      "epoch": 5.028644175684278,
      "grad_norm": 0.691880155408177,
      "learning_rate": 3.132894790549478e-05,
      "loss": 1.1484,
      "num_input_tokens_seen": 37292713792,
      "step": 47400
    },
    {
      "epoch": 5.028750265223849,
      "grad_norm": 0.5348819716979877,
      "learning_rate": 3.1328275572860276e-05,
      "loss": 1.0469,
      "num_input_tokens_seen": 37293500496,
      "step": 47401
    },
    {
      "epoch": 5.028856354763421,
      "grad_norm": 0.6174615893284381,
      "learning_rate": 3.132760323533547e-05,
      "loss": 1.0802,
      "num_input_tokens_seen": 37294287296,
      "step": 47402
    },
    {
      "epoch": 5.028962444302992,
      "grad_norm": 0.6945840981333643,
      "learning_rate": 3.132693089292087e-05,
      "loss": 1.2076,
      "num_input_tokens_seen": 37295074144,
      "step": 47403
    },
    {
      "epoch": 5.029068533842563,
      "grad_norm": 0.5755101394038955,
      "learning_rate": 3.1326258545617e-05,
      "loss": 1.0684,
      "num_input_tokens_seen": 37295860896,
      "step": 47404
    },
    {
      "epoch": 5.029174623382135,
      "grad_norm": 0.707872663014941,
      "learning_rate": 3.13255861934244e-05,
      "loss": 1.114,
      "num_input_tokens_seen": 37296647648,
      "step": 47405
    },
    {
      "epoch": 5.029280712921706,
      "grad_norm": 0.5906153411173933,
      "learning_rate": 3.132491383634356e-05,
      "loss": 1.1136,
      "num_input_tokens_seen": 37297434352,
      "step": 47406
    },
    {
      "epoch": 5.029386802461278,
      "grad_norm": 0.7521182200568062,
      "learning_rate": 3.132424147437501e-05,
      "loss": 1.0757,
      "num_input_tokens_seen": 37298221088,
      "step": 47407
    },
    {
      "epoch": 5.029492892000849,
      "grad_norm": 0.7318946980094971,
      "learning_rate": 3.132356910751928e-05,
      "loss": 1.234,
      "num_input_tokens_seen": 37299007792,
      "step": 47408
    },
    {
      "epoch": 5.0295989815404205,
      "grad_norm": 0.622786138040122,
      "learning_rate": 3.132289673577688e-05,
      "loss": 1.1164,
      "num_input_tokens_seen": 37299794608,
      "step": 47409
    },
    {
      "epoch": 5.0297050710799915,
      "grad_norm": 0.7643304425922,
      "learning_rate": 3.132222435914832e-05,
      "loss": 1.233,
      "num_input_tokens_seen": 37300581376,
      "step": 47410
    },
    {
      "epoch": 5.029811160619563,
      "grad_norm": 0.5936470325889848,
      "learning_rate": 3.1321551977634146e-05,
      "loss": 1.1883,
      "num_input_tokens_seen": 37301368096,
      "step": 47411
    },
    {
      "epoch": 5.0299172501591345,
      "grad_norm": 0.7224152335990381,
      "learning_rate": 3.1320879591234855e-05,
      "loss": 1.1275,
      "num_input_tokens_seen": 37302154848,
      "step": 47412
    },
    {
      "epoch": 5.0300233396987055,
      "grad_norm": 0.523464209207075,
      "learning_rate": 3.132020719995097e-05,
      "loss": 1.1086,
      "num_input_tokens_seen": 37302941600,
      "step": 47413
    },
    {
      "epoch": 5.030129429238277,
      "grad_norm": 1.0105015696501263,
      "learning_rate": 3.1319534803783015e-05,
      "loss": 1.1259,
      "num_input_tokens_seen": 37303728304,
      "step": 47414
    },
    {
      "epoch": 5.0302355187778485,
      "grad_norm": 0.5599418698932266,
      "learning_rate": 3.131886240273152e-05,
      "loss": 1.1252,
      "num_input_tokens_seen": 37304515088,
      "step": 47415
    },
    {
      "epoch": 5.0303416083174195,
      "grad_norm": 0.6752842510666264,
      "learning_rate": 3.131818999679698e-05,
      "loss": 1.1226,
      "num_input_tokens_seen": 37305301888,
      "step": 47416
    },
    {
      "epoch": 5.030447697856991,
      "grad_norm": 1.1621839835574768,
      "learning_rate": 3.131751758597994e-05,
      "loss": 1.1322,
      "num_input_tokens_seen": 37306088624,
      "step": 47417
    },
    {
      "epoch": 5.0305537873965624,
      "grad_norm": 0.7594410360017007,
      "learning_rate": 3.13168451702809e-05,
      "loss": 1.085,
      "num_input_tokens_seen": 37306875344,
      "step": 47418
    },
    {
      "epoch": 5.030659876936134,
      "grad_norm": 0.6900336507921585,
      "learning_rate": 3.131617274970039e-05,
      "loss": 1.2104,
      "num_input_tokens_seen": 37307662176,
      "step": 47419
    },
    {
      "epoch": 5.030765966475705,
      "grad_norm": 1.0750959050688997,
      "learning_rate": 3.131550032423893e-05,
      "loss": 1.2797,
      "num_input_tokens_seen": 37308448832,
      "step": 47420
    },
    {
      "epoch": 5.030872056015277,
      "grad_norm": 0.8928856350195082,
      "learning_rate": 3.1314827893897025e-05,
      "loss": 1.1491,
      "num_input_tokens_seen": 37309235664,
      "step": 47421
    },
    {
      "epoch": 5.030978145554848,
      "grad_norm": 0.8529559109933553,
      "learning_rate": 3.1314155458675215e-05,
      "loss": 1.119,
      "num_input_tokens_seen": 37310022416,
      "step": 47422
    },
    {
      "epoch": 5.031084235094419,
      "grad_norm": 0.8359281572665942,
      "learning_rate": 3.1313483018574014e-05,
      "loss": 1.0441,
      "num_input_tokens_seen": 37310809184,
      "step": 47423
    },
    {
      "epoch": 5.031190324633991,
      "grad_norm": 0.8517392327825599,
      "learning_rate": 3.131281057359393e-05,
      "loss": 1.1772,
      "num_input_tokens_seen": 37311595968,
      "step": 47424
    },
    {
      "epoch": 5.031296414173562,
      "grad_norm": 0.6769694809330182,
      "learning_rate": 3.13121381237355e-05,
      "loss": 1.237,
      "num_input_tokens_seen": 37312382736,
      "step": 47425
    },
    {
      "epoch": 5.031402503713134,
      "grad_norm": 1.4102801844314383,
      "learning_rate": 3.131146566899923e-05,
      "loss": 1.1285,
      "num_input_tokens_seen": 37313169552,
      "step": 47426
    },
    {
      "epoch": 5.031508593252705,
      "grad_norm": 1.0047500586755034,
      "learning_rate": 3.131079320938564e-05,
      "loss": 1.265,
      "num_input_tokens_seen": 37313956304,
      "step": 47427
    },
    {
      "epoch": 5.031614682792276,
      "grad_norm": 0.760456216770821,
      "learning_rate": 3.1310120744895267e-05,
      "loss": 1.0467,
      "num_input_tokens_seen": 37314743072,
      "step": 47428
    },
    {
      "epoch": 5.031720772331848,
      "grad_norm": 1.2508282397413946,
      "learning_rate": 3.130944827552861e-05,
      "loss": 1.1573,
      "num_input_tokens_seen": 37315529760,
      "step": 47429
    },
    {
      "epoch": 5.031826861871419,
      "grad_norm": 0.7905781610455663,
      "learning_rate": 3.1308775801286194e-05,
      "loss": 1.0762,
      "num_input_tokens_seen": 37316316512,
      "step": 47430
    },
    {
      "epoch": 5.031932951410991,
      "grad_norm": 0.9645229312631904,
      "learning_rate": 3.130810332216855e-05,
      "loss": 1.1973,
      "num_input_tokens_seen": 37317103296,
      "step": 47431
    },
    {
      "epoch": 5.032039040950562,
      "grad_norm": 0.7418920881318147,
      "learning_rate": 3.1307430838176174e-05,
      "loss": 1.1193,
      "num_input_tokens_seen": 37317890176,
      "step": 47432
    },
    {
      "epoch": 5.032145130490133,
      "grad_norm": 0.6304624476569748,
      "learning_rate": 3.130675834930961e-05,
      "loss": 1.1214,
      "num_input_tokens_seen": 37318676992,
      "step": 47433
    },
    {
      "epoch": 5.032251220029705,
      "grad_norm": 0.8671394334569623,
      "learning_rate": 3.130608585556937e-05,
      "loss": 1.1459,
      "num_input_tokens_seen": 37319463744,
      "step": 47434
    },
    {
      "epoch": 5.032357309569276,
      "grad_norm": 0.6531739001845062,
      "learning_rate": 3.130541335695597e-05,
      "loss": 1.0722,
      "num_input_tokens_seen": 37320250480,
      "step": 47435
    },
    {
      "epoch": 5.032463399108848,
      "grad_norm": 1.0214538808132578,
      "learning_rate": 3.130474085346993e-05,
      "loss": 1.1366,
      "num_input_tokens_seen": 37321037344,
      "step": 47436
    },
    {
      "epoch": 5.032569488648419,
      "grad_norm": 0.7444885679670447,
      "learning_rate": 3.130406834511177e-05,
      "loss": 1.0181,
      "num_input_tokens_seen": 37321824256,
      "step": 47437
    },
    {
      "epoch": 5.032675578187991,
      "grad_norm": 1.2404226708602437,
      "learning_rate": 3.130339583188202e-05,
      "loss": 1.1094,
      "num_input_tokens_seen": 37322611024,
      "step": 47438
    },
    {
      "epoch": 5.032781667727562,
      "grad_norm": 0.7062764925395464,
      "learning_rate": 3.130272331378118e-05,
      "loss": 1.1338,
      "num_input_tokens_seen": 37323397824,
      "step": 47439
    },
    {
      "epoch": 5.032887757267133,
      "grad_norm": 0.95212146767883,
      "learning_rate": 3.130205079080979e-05,
      "loss": 1.1529,
      "num_input_tokens_seen": 37324184496,
      "step": 47440
    },
    {
      "epoch": 5.032993846806705,
      "grad_norm": 0.6719294533628596,
      "learning_rate": 3.130137826296835e-05,
      "loss": 1.088,
      "num_input_tokens_seen": 37324971296,
      "step": 47441
    },
    {
      "epoch": 5.033099936346276,
      "grad_norm": 0.6462277709558938,
      "learning_rate": 3.13007057302574e-05,
      "loss": 1.1178,
      "num_input_tokens_seen": 37325758064,
      "step": 47442
    },
    {
      "epoch": 5.033206025885848,
      "grad_norm": 0.9233580660383692,
      "learning_rate": 3.130003319267744e-05,
      "loss": 1.1581,
      "num_input_tokens_seen": 37326544864,
      "step": 47443
    },
    {
      "epoch": 5.033312115425419,
      "grad_norm": 0.6563102445639662,
      "learning_rate": 3.1299360650229e-05,
      "loss": 1.1448,
      "num_input_tokens_seen": 37327331776,
      "step": 47444
    },
    {
      "epoch": 5.03341820496499,
      "grad_norm": 0.6632116351710962,
      "learning_rate": 3.1298688102912605e-05,
      "loss": 1.117,
      "num_input_tokens_seen": 37328118640,
      "step": 47445
    },
    {
      "epoch": 5.033524294504562,
      "grad_norm": 0.9167679812553052,
      "learning_rate": 3.1298015550728766e-05,
      "loss": 1.1175,
      "num_input_tokens_seen": 37328905456,
      "step": 47446
    },
    {
      "epoch": 5.033630384044133,
      "grad_norm": 0.6209235088548546,
      "learning_rate": 3.1297342993678004e-05,
      "loss": 1.2657,
      "num_input_tokens_seen": 37329692144,
      "step": 47447
    },
    {
      "epoch": 5.033736473583705,
      "grad_norm": 0.9548102933918571,
      "learning_rate": 3.129667043176084e-05,
      "loss": 1.311,
      "num_input_tokens_seen": 37330478800,
      "step": 47448
    },
    {
      "epoch": 5.033842563123276,
      "grad_norm": 0.6349313326828057,
      "learning_rate": 3.129599786497779e-05,
      "loss": 1.1297,
      "num_input_tokens_seen": 37331265552,
      "step": 47449
    },
    {
      "epoch": 5.033948652662848,
      "grad_norm": 0.6400519893033825,
      "learning_rate": 3.129532529332939e-05,
      "loss": 1.1045,
      "num_input_tokens_seen": 37332052464,
      "step": 47450
    },
    {
      "epoch": 5.034054742202419,
      "grad_norm": 0.6944211359548408,
      "learning_rate": 3.129465271681613e-05,
      "loss": 1.1591,
      "num_input_tokens_seen": 37332839168,
      "step": 47451
    },
    {
      "epoch": 5.03416083174199,
      "grad_norm": 0.654344077210664,
      "learning_rate": 3.129398013543856e-05,
      "loss": 1.1338,
      "num_input_tokens_seen": 37333625888,
      "step": 47452
    },
    {
      "epoch": 5.034266921281562,
      "grad_norm": 0.690416557831056,
      "learning_rate": 3.129330754919718e-05,
      "loss": 1.1255,
      "num_input_tokens_seen": 37334412560,
      "step": 47453
    },
    {
      "epoch": 5.034373010821133,
      "grad_norm": 0.7172331999569261,
      "learning_rate": 3.129263495809252e-05,
      "loss": 1.0775,
      "num_input_tokens_seen": 37335199328,
      "step": 47454
    },
    {
      "epoch": 5.034479100360705,
      "grad_norm": 0.6263831753739507,
      "learning_rate": 3.12919623621251e-05,
      "loss": 1.1632,
      "num_input_tokens_seen": 37335986096,
      "step": 47455
    },
    {
      "epoch": 5.034585189900276,
      "grad_norm": 0.7731138089459323,
      "learning_rate": 3.1291289761295425e-05,
      "loss": 1.0701,
      "num_input_tokens_seen": 37336772848,
      "step": 47456
    },
    {
      "epoch": 5.034691279439847,
      "grad_norm": 0.6199986781655993,
      "learning_rate": 3.129061715560404e-05,
      "loss": 1.1592,
      "num_input_tokens_seen": 37337559568,
      "step": 47457
    },
    {
      "epoch": 5.034797368979419,
      "grad_norm": 0.6575793994767539,
      "learning_rate": 3.1289944545051445e-05,
      "loss": 1.0661,
      "num_input_tokens_seen": 37338346256,
      "step": 47458
    },
    {
      "epoch": 5.03490345851899,
      "grad_norm": 0.733514236598224,
      "learning_rate": 3.128927192963816e-05,
      "loss": 1.1592,
      "num_input_tokens_seen": 37339133008,
      "step": 47459
    },
    {
      "epoch": 5.035009548058562,
      "grad_norm": 0.8647421152450133,
      "learning_rate": 3.128859930936472e-05,
      "loss": 1.1293,
      "num_input_tokens_seen": 37339919840,
      "step": 47460
    },
    {
      "epoch": 5.035115637598133,
      "grad_norm": 0.67009344128538,
      "learning_rate": 3.128792668423163e-05,
      "loss": 1.1901,
      "num_input_tokens_seen": 37340706528,
      "step": 47461
    },
    {
      "epoch": 5.035221727137705,
      "grad_norm": 0.7121360678907598,
      "learning_rate": 3.128725405423941e-05,
      "loss": 1.1273,
      "num_input_tokens_seen": 37341493248,
      "step": 47462
    },
    {
      "epoch": 5.035327816677276,
      "grad_norm": 0.6870984581162488,
      "learning_rate": 3.128658141938859e-05,
      "loss": 1.2195,
      "num_input_tokens_seen": 37342279984,
      "step": 47463
    },
    {
      "epoch": 5.035433906216847,
      "grad_norm": 0.7672113835243692,
      "learning_rate": 3.1285908779679686e-05,
      "loss": 1.1589,
      "num_input_tokens_seen": 37343066768,
      "step": 47464
    },
    {
      "epoch": 5.035539995756419,
      "grad_norm": 0.7604553276632372,
      "learning_rate": 3.128523613511321e-05,
      "loss": 1.1479,
      "num_input_tokens_seen": 37343853584,
      "step": 47465
    },
    {
      "epoch": 5.03564608529599,
      "grad_norm": 0.5730852361626753,
      "learning_rate": 3.1284563485689696e-05,
      "loss": 1.1242,
      "num_input_tokens_seen": 37344640272,
      "step": 47466
    },
    {
      "epoch": 5.035752174835562,
      "grad_norm": 0.8028210250568998,
      "learning_rate": 3.128389083140965e-05,
      "loss": 1.1939,
      "num_input_tokens_seen": 37345427056,
      "step": 47467
    },
    {
      "epoch": 5.035858264375133,
      "grad_norm": 0.8884211786104033,
      "learning_rate": 3.12832181722736e-05,
      "loss": 1.1475,
      "num_input_tokens_seen": 37346213840,
      "step": 47468
    },
    {
      "epoch": 5.035964353914704,
      "grad_norm": 0.7797844123869756,
      "learning_rate": 3.1282545508282056e-05,
      "loss": 1.1139,
      "num_input_tokens_seen": 37347000608,
      "step": 47469
    },
    {
      "epoch": 5.036070443454276,
      "grad_norm": 1.5278679304295415,
      "learning_rate": 3.128187283943555e-05,
      "loss": 1.2415,
      "num_input_tokens_seen": 37347787392,
      "step": 47470
    },
    {
      "epoch": 5.036176532993847,
      "grad_norm": 0.5852165358020128,
      "learning_rate": 3.12812001657346e-05,
      "loss": 1.089,
      "num_input_tokens_seen": 37348574192,
      "step": 47471
    },
    {
      "epoch": 5.0362826225334185,
      "grad_norm": 0.7424022040964161,
      "learning_rate": 3.128052748717972e-05,
      "loss": 1.1168,
      "num_input_tokens_seen": 37349360992,
      "step": 47472
    },
    {
      "epoch": 5.0363887120729895,
      "grad_norm": 0.6712293284155921,
      "learning_rate": 3.127985480377144e-05,
      "loss": 1.0268,
      "num_input_tokens_seen": 37350147792,
      "step": 47473
    },
    {
      "epoch": 5.036494801612561,
      "grad_norm": 0.5819638054646514,
      "learning_rate": 3.1279182115510264e-05,
      "loss": 1.1675,
      "num_input_tokens_seen": 37350934544,
      "step": 47474
    },
    {
      "epoch": 5.0366008911521325,
      "grad_norm": 0.6396705132532824,
      "learning_rate": 3.127850942239672e-05,
      "loss": 1.1545,
      "num_input_tokens_seen": 37351721280,
      "step": 47475
    },
    {
      "epoch": 5.0367069806917035,
      "grad_norm": 0.7368595732090244,
      "learning_rate": 3.127783672443133e-05,
      "loss": 1.2332,
      "num_input_tokens_seen": 37352508048,
      "step": 47476
    },
    {
      "epoch": 5.0368130702312754,
      "grad_norm": 0.558721321827303,
      "learning_rate": 3.1277164021614615e-05,
      "loss": 1.1052,
      "num_input_tokens_seen": 37353294880,
      "step": 47477
    },
    {
      "epoch": 5.0369191597708465,
      "grad_norm": 0.7654583179655603,
      "learning_rate": 3.127649131394709e-05,
      "loss": 1.149,
      "num_input_tokens_seen": 37354081632,
      "step": 47478
    },
    {
      "epoch": 5.037025249310418,
      "grad_norm": 0.6513633711523049,
      "learning_rate": 3.127581860142927e-05,
      "loss": 1.0901,
      "num_input_tokens_seen": 37354868432,
      "step": 47479
    },
    {
      "epoch": 5.037131338849989,
      "grad_norm": 0.5719383353348411,
      "learning_rate": 3.1275145884061695e-05,
      "loss": 1.0831,
      "num_input_tokens_seen": 37355655104,
      "step": 47480
    },
    {
      "epoch": 5.0372374283895605,
      "grad_norm": 0.6614003678966749,
      "learning_rate": 3.127447316184486e-05,
      "loss": 1.1147,
      "num_input_tokens_seen": 37356441888,
      "step": 47481
    },
    {
      "epoch": 5.037343517929132,
      "grad_norm": 0.7041301193119694,
      "learning_rate": 3.12738004347793e-05,
      "loss": 1.2256,
      "num_input_tokens_seen": 37357228656,
      "step": 47482
    },
    {
      "epoch": 5.037449607468703,
      "grad_norm": 0.8600584299315488,
      "learning_rate": 3.127312770286553e-05,
      "loss": 1.1525,
      "num_input_tokens_seen": 37358015376,
      "step": 47483
    },
    {
      "epoch": 5.037555697008275,
      "grad_norm": 0.7752674874332758,
      "learning_rate": 3.127245496610407e-05,
      "loss": 1.0997,
      "num_input_tokens_seen": 37358802144,
      "step": 47484
    },
    {
      "epoch": 5.037661786547846,
      "grad_norm": 0.6534746857926069,
      "learning_rate": 3.127178222449545e-05,
      "loss": 1.2468,
      "num_input_tokens_seen": 37359588784,
      "step": 47485
    },
    {
      "epoch": 5.037767876087417,
      "grad_norm": 1.385365212149832,
      "learning_rate": 3.127110947804017e-05,
      "loss": 1.17,
      "num_input_tokens_seen": 37360375552,
      "step": 47486
    },
    {
      "epoch": 5.037873965626989,
      "grad_norm": 0.573907102698823,
      "learning_rate": 3.127043672673876e-05,
      "loss": 1.1829,
      "num_input_tokens_seen": 37361162256,
      "step": 47487
    },
    {
      "epoch": 5.03798005516656,
      "grad_norm": 1.0418179792610114,
      "learning_rate": 3.1269763970591746e-05,
      "loss": 1.0517,
      "num_input_tokens_seen": 37361949040,
      "step": 47488
    },
    {
      "epoch": 5.038086144706132,
      "grad_norm": 0.9665394946765888,
      "learning_rate": 3.126909120959965e-05,
      "loss": 1.1559,
      "num_input_tokens_seen": 37362735808,
      "step": 47489
    },
    {
      "epoch": 5.038192234245703,
      "grad_norm": 0.976314502813645,
      "learning_rate": 3.126841844376297e-05,
      "loss": 1.1859,
      "num_input_tokens_seen": 37363522656,
      "step": 47490
    },
    {
      "epoch": 5.038298323785275,
      "grad_norm": 0.8413958215026346,
      "learning_rate": 3.126774567308225e-05,
      "loss": 1.0755,
      "num_input_tokens_seen": 37364309440,
      "step": 47491
    },
    {
      "epoch": 5.038404413324846,
      "grad_norm": 0.5993783466701689,
      "learning_rate": 3.1267072897557996e-05,
      "loss": 1.0889,
      "num_input_tokens_seen": 37365096240,
      "step": 47492
    },
    {
      "epoch": 5.038510502864417,
      "grad_norm": 0.9668606137023245,
      "learning_rate": 3.126640011719073e-05,
      "loss": 1.126,
      "num_input_tokens_seen": 37365883008,
      "step": 47493
    },
    {
      "epoch": 5.038616592403989,
      "grad_norm": 0.808044594263746,
      "learning_rate": 3.126572733198098e-05,
      "loss": 1.1397,
      "num_input_tokens_seen": 37366669760,
      "step": 47494
    },
    {
      "epoch": 5.03872268194356,
      "grad_norm": 0.7240736747493327,
      "learning_rate": 3.126505454192925e-05,
      "loss": 1.0072,
      "num_input_tokens_seen": 37367456640,
      "step": 47495
    },
    {
      "epoch": 5.038828771483132,
      "grad_norm": 0.7379591025717162,
      "learning_rate": 3.126438174703607e-05,
      "loss": 1.0751,
      "num_input_tokens_seen": 37368243456,
      "step": 47496
    },
    {
      "epoch": 5.038934861022703,
      "grad_norm": 0.6139038282016869,
      "learning_rate": 3.1263708947301975e-05,
      "loss": 1.1425,
      "num_input_tokens_seen": 37369030336,
      "step": 47497
    },
    {
      "epoch": 5.039040950562274,
      "grad_norm": 0.7504097484540625,
      "learning_rate": 3.126303614272745e-05,
      "loss": 1.085,
      "num_input_tokens_seen": 37369817136,
      "step": 47498
    },
    {
      "epoch": 5.039147040101846,
      "grad_norm": 0.8340196898195834,
      "learning_rate": 3.126236333331304e-05,
      "loss": 1.1308,
      "num_input_tokens_seen": 37370603920,
      "step": 47499
    },
    {
      "epoch": 5.039253129641417,
      "grad_norm": 1.2664492581355395,
      "learning_rate": 3.126169051905927e-05,
      "loss": 1.1717,
      "num_input_tokens_seen": 37371390672,
      "step": 47500
    },
    {
      "epoch": 5.039359219180989,
      "grad_norm": 0.9190165274388534,
      "learning_rate": 3.1261017699966646e-05,
      "loss": 1.1369,
      "num_input_tokens_seen": 37372177440,
      "step": 47501
    },
    {
      "epoch": 5.03946530872056,
      "grad_norm": 1.0576049206253686,
      "learning_rate": 3.126034487603568e-05,
      "loss": 1.1679,
      "num_input_tokens_seen": 37372964208,
      "step": 47502
    },
    {
      "epoch": 5.039571398260131,
      "grad_norm": 0.6412564287021225,
      "learning_rate": 3.125967204726691e-05,
      "loss": 1.2099,
      "num_input_tokens_seen": 37373750832,
      "step": 47503
    },
    {
      "epoch": 5.039677487799703,
      "grad_norm": 1.0603942967361661,
      "learning_rate": 3.125899921366085e-05,
      "loss": 1.072,
      "num_input_tokens_seen": 37374537552,
      "step": 47504
    },
    {
      "epoch": 5.039783577339274,
      "grad_norm": 0.6416071093670699,
      "learning_rate": 3.1258326375218014e-05,
      "loss": 1.1555,
      "num_input_tokens_seen": 37375324160,
      "step": 47505
    },
    {
      "epoch": 5.039889666878846,
      "grad_norm": 0.794135948998662,
      "learning_rate": 3.1257653531938936e-05,
      "loss": 1.1843,
      "num_input_tokens_seen": 37376110944,
      "step": 47506
    },
    {
      "epoch": 5.039995756418417,
      "grad_norm": 0.7532225174935746,
      "learning_rate": 3.125698068382412e-05,
      "loss": 1.1276,
      "num_input_tokens_seen": 37376897792,
      "step": 47507
    },
    {
      "epoch": 5.040101845957989,
      "grad_norm": 1.1664712780756723,
      "learning_rate": 3.12563078308741e-05,
      "loss": 1.2247,
      "num_input_tokens_seen": 37377684512,
      "step": 47508
    },
    {
      "epoch": 5.04020793549756,
      "grad_norm": 0.858401662545445,
      "learning_rate": 3.1255634973089386e-05,
      "loss": 1.1185,
      "num_input_tokens_seen": 37378471248,
      "step": 47509
    },
    {
      "epoch": 5.040314025037131,
      "grad_norm": 0.8350852911162078,
      "learning_rate": 3.12549621104705e-05,
      "loss": 1.0952,
      "num_input_tokens_seen": 37379258112,
      "step": 47510
    },
    {
      "epoch": 5.040420114576703,
      "grad_norm": 0.8518252034271034,
      "learning_rate": 3.125428924301796e-05,
      "loss": 1.117,
      "num_input_tokens_seen": 37380044800,
      "step": 47511
    },
    {
      "epoch": 5.040526204116274,
      "grad_norm": 0.9743457008879115,
      "learning_rate": 3.125361637073229e-05,
      "loss": 1.1556,
      "num_input_tokens_seen": 37380831472,
      "step": 47512
    },
    {
      "epoch": 5.040632293655846,
      "grad_norm": 0.7044033786088986,
      "learning_rate": 3.1252943493614004e-05,
      "loss": 1.0443,
      "num_input_tokens_seen": 37381618304,
      "step": 47513
    },
    {
      "epoch": 5.040738383195417,
      "grad_norm": 0.9440121646779912,
      "learning_rate": 3.125227061166364e-05,
      "loss": 1.1878,
      "num_input_tokens_seen": 37382405136,
      "step": 47514
    },
    {
      "epoch": 5.040844472734988,
      "grad_norm": 1.1524100730469908,
      "learning_rate": 3.12515977248817e-05,
      "loss": 1.1071,
      "num_input_tokens_seen": 37383191952,
      "step": 47515
    },
    {
      "epoch": 5.04095056227456,
      "grad_norm": 0.9282762164651637,
      "learning_rate": 3.1250924833268704e-05,
      "loss": 1.0898,
      "num_input_tokens_seen": 37383978656,
      "step": 47516
    },
    {
      "epoch": 5.041056651814131,
      "grad_norm": 0.6538881170815678,
      "learning_rate": 3.1250251936825176e-05,
      "loss": 1.0659,
      "num_input_tokens_seen": 37384765408,
      "step": 47517
    },
    {
      "epoch": 5.041162741353703,
      "grad_norm": 1.2336519157650447,
      "learning_rate": 3.124957903555164e-05,
      "loss": 1.2374,
      "num_input_tokens_seen": 37385552176,
      "step": 47518
    },
    {
      "epoch": 5.041268830893274,
      "grad_norm": 0.7915828338979856,
      "learning_rate": 3.124890612944861e-05,
      "loss": 1.1083,
      "num_input_tokens_seen": 37386339008,
      "step": 47519
    },
    {
      "epoch": 5.041374920432846,
      "grad_norm": 0.7294148099702884,
      "learning_rate": 3.124823321851662e-05,
      "loss": 1.0401,
      "num_input_tokens_seen": 37387125840,
      "step": 47520
    },
    {
      "epoch": 5.041481009972417,
      "grad_norm": 0.8269876031826295,
      "learning_rate": 3.1247560302756165e-05,
      "loss": 1.0612,
      "num_input_tokens_seen": 37387912592,
      "step": 47521
    },
    {
      "epoch": 5.041587099511988,
      "grad_norm": 0.6280979104690777,
      "learning_rate": 3.124688738216778e-05,
      "loss": 1.1176,
      "num_input_tokens_seen": 37388699264,
      "step": 47522
    },
    {
      "epoch": 5.04169318905156,
      "grad_norm": 0.7428078272781248,
      "learning_rate": 3.124621445675199e-05,
      "loss": 1.1446,
      "num_input_tokens_seen": 37389485984,
      "step": 47523
    },
    {
      "epoch": 5.041799278591131,
      "grad_norm": 0.6444344658480193,
      "learning_rate": 3.12455415265093e-05,
      "loss": 1.0354,
      "num_input_tokens_seen": 37390272800,
      "step": 47524
    },
    {
      "epoch": 5.041905368130703,
      "grad_norm": 0.7433335505448692,
      "learning_rate": 3.124486859144025e-05,
      "loss": 1.1824,
      "num_input_tokens_seen": 37391059568,
      "step": 47525
    },
    {
      "epoch": 5.042011457670274,
      "grad_norm": 0.886850596481013,
      "learning_rate": 3.124419565154535e-05,
      "loss": 1.1068,
      "num_input_tokens_seen": 37391846416,
      "step": 47526
    },
    {
      "epoch": 5.042117547209845,
      "grad_norm": 0.5848658002268139,
      "learning_rate": 3.12435227068251e-05,
      "loss": 1.0604,
      "num_input_tokens_seen": 37392633232,
      "step": 47527
    },
    {
      "epoch": 5.042223636749417,
      "grad_norm": 0.603620275062215,
      "learning_rate": 3.1242849757280055e-05,
      "loss": 1.1174,
      "num_input_tokens_seen": 37393420000,
      "step": 47528
    },
    {
      "epoch": 5.042329726288988,
      "grad_norm": 0.7610928406237853,
      "learning_rate": 3.1242176802910715e-05,
      "loss": 1.2122,
      "num_input_tokens_seen": 37394206656,
      "step": 47529
    },
    {
      "epoch": 5.04243581582856,
      "grad_norm": 0.6756260767390392,
      "learning_rate": 3.12415038437176e-05,
      "loss": 1.2166,
      "num_input_tokens_seen": 37394993408,
      "step": 47530
    },
    {
      "epoch": 5.042541905368131,
      "grad_norm": 0.726339173416242,
      "learning_rate": 3.1240830879701236e-05,
      "loss": 1.1565,
      "num_input_tokens_seen": 37395780160,
      "step": 47531
    },
    {
      "epoch": 5.042647994907702,
      "grad_norm": 0.6878557040609938,
      "learning_rate": 3.124015791086215e-05,
      "loss": 1.2417,
      "num_input_tokens_seen": 37396566896,
      "step": 47532
    },
    {
      "epoch": 5.042754084447274,
      "grad_norm": 0.556635038949599,
      "learning_rate": 3.123948493720084e-05,
      "loss": 1.2014,
      "num_input_tokens_seen": 37397353616,
      "step": 47533
    },
    {
      "epoch": 5.042860173986845,
      "grad_norm": 0.734943657992146,
      "learning_rate": 3.1238811958717846e-05,
      "loss": 1.1864,
      "num_input_tokens_seen": 37398140304,
      "step": 47534
    },
    {
      "epoch": 5.0429662635264165,
      "grad_norm": 0.6718669836313999,
      "learning_rate": 3.1238138975413685e-05,
      "loss": 1.1551,
      "num_input_tokens_seen": 37398927168,
      "step": 47535
    },
    {
      "epoch": 5.043072353065988,
      "grad_norm": 0.5513794219014722,
      "learning_rate": 3.123746598728886e-05,
      "loss": 1.1126,
      "num_input_tokens_seen": 37399713824,
      "step": 47536
    },
    {
      "epoch": 5.0431784426055595,
      "grad_norm": 0.827892199706567,
      "learning_rate": 3.1236792994343913e-05,
      "loss": 1.0566,
      "num_input_tokens_seen": 37400500528,
      "step": 47537
    },
    {
      "epoch": 5.0432845321451305,
      "grad_norm": 0.6818649152512049,
      "learning_rate": 3.123611999657936e-05,
      "loss": 1.0882,
      "num_input_tokens_seen": 37401287280,
      "step": 47538
    },
    {
      "epoch": 5.0433906216847015,
      "grad_norm": 0.9667232667476616,
      "learning_rate": 3.1235446993995706e-05,
      "loss": 1.1171,
      "num_input_tokens_seen": 37402074016,
      "step": 47539
    },
    {
      "epoch": 5.0434967112242735,
      "grad_norm": 0.8233678782695671,
      "learning_rate": 3.123477398659349e-05,
      "loss": 1.246,
      "num_input_tokens_seen": 37402860736,
      "step": 47540
    },
    {
      "epoch": 5.0436028007638445,
      "grad_norm": 0.5987334136119605,
      "learning_rate": 3.123410097437322e-05,
      "loss": 1.0837,
      "num_input_tokens_seen": 37403647520,
      "step": 47541
    },
    {
      "epoch": 5.043708890303416,
      "grad_norm": 0.9660947453825348,
      "learning_rate": 3.123342795733542e-05,
      "loss": 1.1276,
      "num_input_tokens_seen": 37404434288,
      "step": 47542
    },
    {
      "epoch": 5.043814979842987,
      "grad_norm": 0.6195072530237444,
      "learning_rate": 3.123275493548061e-05,
      "loss": 1.0902,
      "num_input_tokens_seen": 37405221024,
      "step": 47543
    },
    {
      "epoch": 5.0439210693825585,
      "grad_norm": 0.685588511111222,
      "learning_rate": 3.1232081908809306e-05,
      "loss": 1.0923,
      "num_input_tokens_seen": 37406007856,
      "step": 47544
    },
    {
      "epoch": 5.04402715892213,
      "grad_norm": 0.5952526760165937,
      "learning_rate": 3.123140887732204e-05,
      "loss": 1.1192,
      "num_input_tokens_seen": 37406794592,
      "step": 47545
    },
    {
      "epoch": 5.044133248461701,
      "grad_norm": 0.6901484715078386,
      "learning_rate": 3.123073584101932e-05,
      "loss": 1.08,
      "num_input_tokens_seen": 37407581344,
      "step": 47546
    },
    {
      "epoch": 5.044239338001273,
      "grad_norm": 0.5855186609369956,
      "learning_rate": 3.123006279990166e-05,
      "loss": 1.2114,
      "num_input_tokens_seen": 37408368128,
      "step": 47547
    },
    {
      "epoch": 5.044345427540844,
      "grad_norm": 0.7367710975429294,
      "learning_rate": 3.1229389753969606e-05,
      "loss": 1.098,
      "num_input_tokens_seen": 37409154976,
      "step": 47548
    },
    {
      "epoch": 5.044451517080416,
      "grad_norm": 0.5502353304343948,
      "learning_rate": 3.122871670322366e-05,
      "loss": 1.1118,
      "num_input_tokens_seen": 37409941824,
      "step": 47549
    },
    {
      "epoch": 5.044557606619987,
      "grad_norm": 0.5795545051005694,
      "learning_rate": 3.122804364766433e-05,
      "loss": 1.2346,
      "num_input_tokens_seen": 37410728512,
      "step": 47550
    },
    {
      "epoch": 5.044663696159558,
      "grad_norm": 0.8356270074998221,
      "learning_rate": 3.122737058729217e-05,
      "loss": 1.1556,
      "num_input_tokens_seen": 37411515264,
      "step": 47551
    },
    {
      "epoch": 5.04476978569913,
      "grad_norm": 0.6725612826144819,
      "learning_rate": 3.1226697522107675e-05,
      "loss": 1.1746,
      "num_input_tokens_seen": 37412302000,
      "step": 47552
    },
    {
      "epoch": 5.044875875238701,
      "grad_norm": 0.5842019112109217,
      "learning_rate": 3.1226024452111365e-05,
      "loss": 1.1194,
      "num_input_tokens_seen": 37413088736,
      "step": 47553
    },
    {
      "epoch": 5.044981964778273,
      "grad_norm": 0.6373684739004416,
      "learning_rate": 3.1225351377303766e-05,
      "loss": 1.1259,
      "num_input_tokens_seen": 37413875504,
      "step": 47554
    },
    {
      "epoch": 5.045088054317844,
      "grad_norm": 0.7267677929936968,
      "learning_rate": 3.1224678297685405e-05,
      "loss": 1.1814,
      "num_input_tokens_seen": 37414662272,
      "step": 47555
    },
    {
      "epoch": 5.045194143857415,
      "grad_norm": 0.649783916390252,
      "learning_rate": 3.122400521325679e-05,
      "loss": 1.1304,
      "num_input_tokens_seen": 37415449072,
      "step": 47556
    },
    {
      "epoch": 5.045300233396987,
      "grad_norm": 1.2676112627376164,
      "learning_rate": 3.122333212401845e-05,
      "loss": 1.1999,
      "num_input_tokens_seen": 37416235856,
      "step": 47557
    },
    {
      "epoch": 5.045406322936558,
      "grad_norm": 0.6906794798969008,
      "learning_rate": 3.12226590299709e-05,
      "loss": 1.1332,
      "num_input_tokens_seen": 37417022624,
      "step": 47558
    },
    {
      "epoch": 5.04551241247613,
      "grad_norm": 0.7681981446092926,
      "learning_rate": 3.122198593111466e-05,
      "loss": 1.0603,
      "num_input_tokens_seen": 37417809456,
      "step": 47559
    },
    {
      "epoch": 5.045618502015701,
      "grad_norm": 0.8963078773276395,
      "learning_rate": 3.1221312827450255e-05,
      "loss": 1.1735,
      "num_input_tokens_seen": 37418596224,
      "step": 47560
    },
    {
      "epoch": 5.045724591555273,
      "grad_norm": 0.6970526900504852,
      "learning_rate": 3.12206397189782e-05,
      "loss": 1.1599,
      "num_input_tokens_seen": 37419382992,
      "step": 47561
    },
    {
      "epoch": 5.045830681094844,
      "grad_norm": 0.6433917238879219,
      "learning_rate": 3.121996660569901e-05,
      "loss": 1.2349,
      "num_input_tokens_seen": 37420169760,
      "step": 47562
    },
    {
      "epoch": 5.045936770634415,
      "grad_norm": 0.937045658282796,
      "learning_rate": 3.121929348761323e-05,
      "loss": 1.1013,
      "num_input_tokens_seen": 37420956448,
      "step": 47563
    },
    {
      "epoch": 5.046042860173987,
      "grad_norm": 0.8143538340001667,
      "learning_rate": 3.121862036472135e-05,
      "loss": 1.0643,
      "num_input_tokens_seen": 37421743216,
      "step": 47564
    },
    {
      "epoch": 5.046148949713558,
      "grad_norm": 0.8034668440940501,
      "learning_rate": 3.12179472370239e-05,
      "loss": 1.2941,
      "num_input_tokens_seen": 37422529968,
      "step": 47565
    },
    {
      "epoch": 5.04625503925313,
      "grad_norm": 0.6427285270619288,
      "learning_rate": 3.121727410452141e-05,
      "loss": 1.1141,
      "num_input_tokens_seen": 37423316752,
      "step": 47566
    },
    {
      "epoch": 5.046361128792701,
      "grad_norm": 0.7680907837178391,
      "learning_rate": 3.121660096721439e-05,
      "loss": 1.1044,
      "num_input_tokens_seen": 37424103440,
      "step": 47567
    },
    {
      "epoch": 5.046467218332272,
      "grad_norm": 0.7544305484053759,
      "learning_rate": 3.121592782510337e-05,
      "loss": 1.2007,
      "num_input_tokens_seen": 37424890160,
      "step": 47568
    },
    {
      "epoch": 5.046573307871844,
      "grad_norm": 0.8871147326083056,
      "learning_rate": 3.1215254678188855e-05,
      "loss": 1.1922,
      "num_input_tokens_seen": 37425676944,
      "step": 47569
    },
    {
      "epoch": 5.046679397411415,
      "grad_norm": 0.7834529747989368,
      "learning_rate": 3.121458152647137e-05,
      "loss": 1.1812,
      "num_input_tokens_seen": 37426463680,
      "step": 47570
    },
    {
      "epoch": 5.046785486950987,
      "grad_norm": 0.7291093520011482,
      "learning_rate": 3.121390836995144e-05,
      "loss": 1.1961,
      "num_input_tokens_seen": 37427250448,
      "step": 47571
    },
    {
      "epoch": 5.046891576490558,
      "grad_norm": 0.6265795638780364,
      "learning_rate": 3.121323520862959e-05,
      "loss": 1.1145,
      "num_input_tokens_seen": 37428037152,
      "step": 47572
    },
    {
      "epoch": 5.046997666030129,
      "grad_norm": 0.5796259183839928,
      "learning_rate": 3.121256204250633e-05,
      "loss": 1.093,
      "num_input_tokens_seen": 37428823968,
      "step": 47573
    },
    {
      "epoch": 5.047103755569701,
      "grad_norm": 0.6692869897820406,
      "learning_rate": 3.12118888715822e-05,
      "loss": 1.0634,
      "num_input_tokens_seen": 37429610736,
      "step": 47574
    },
    {
      "epoch": 5.047209845109272,
      "grad_norm": 0.5750937483356859,
      "learning_rate": 3.121121569585769e-05,
      "loss": 1.2463,
      "num_input_tokens_seen": 37430397520,
      "step": 47575
    },
    {
      "epoch": 5.047315934648844,
      "grad_norm": 0.7258802759168572,
      "learning_rate": 3.121054251533333e-05,
      "loss": 1.237,
      "num_input_tokens_seen": 37431184336,
      "step": 47576
    },
    {
      "epoch": 5.047422024188415,
      "grad_norm": 0.7358660116139286,
      "learning_rate": 3.120986933000965e-05,
      "loss": 1.1839,
      "num_input_tokens_seen": 37431971184,
      "step": 47577
    },
    {
      "epoch": 5.047528113727987,
      "grad_norm": 0.730805504021202,
      "learning_rate": 3.120919613988717e-05,
      "loss": 1.217,
      "num_input_tokens_seen": 37432757984,
      "step": 47578
    },
    {
      "epoch": 5.047634203267558,
      "grad_norm": 0.6363244597172234,
      "learning_rate": 3.12085229449664e-05,
      "loss": 1.1494,
      "num_input_tokens_seen": 37433544752,
      "step": 47579
    },
    {
      "epoch": 5.047740292807129,
      "grad_norm": 0.7114961955907197,
      "learning_rate": 3.120784974524787e-05,
      "loss": 1.0948,
      "num_input_tokens_seen": 37434331456,
      "step": 47580
    },
    {
      "epoch": 5.047846382346701,
      "grad_norm": 0.6649197775682681,
      "learning_rate": 3.1207176540732094e-05,
      "loss": 1.0598,
      "num_input_tokens_seen": 37435118224,
      "step": 47581
    },
    {
      "epoch": 5.047952471886272,
      "grad_norm": 0.6339179406424469,
      "learning_rate": 3.120650333141959e-05,
      "loss": 1.0914,
      "num_input_tokens_seen": 37435904992,
      "step": 47582
    },
    {
      "epoch": 5.048058561425844,
      "grad_norm": 0.6438291970664561,
      "learning_rate": 3.1205830117310886e-05,
      "loss": 1.1731,
      "num_input_tokens_seen": 37436691728,
      "step": 47583
    },
    {
      "epoch": 5.048164650965415,
      "grad_norm": 0.7250875111588154,
      "learning_rate": 3.1205156898406495e-05,
      "loss": 1.1959,
      "num_input_tokens_seen": 37437478384,
      "step": 47584
    },
    {
      "epoch": 5.048270740504986,
      "grad_norm": 0.7122679840355534,
      "learning_rate": 3.120448367470695e-05,
      "loss": 1.1979,
      "num_input_tokens_seen": 37438265216,
      "step": 47585
    },
    {
      "epoch": 5.048376830044558,
      "grad_norm": 0.9386327017989622,
      "learning_rate": 3.120381044621276e-05,
      "loss": 1.2304,
      "num_input_tokens_seen": 37439052000,
      "step": 47586
    },
    {
      "epoch": 5.048482919584129,
      "grad_norm": 0.710439530672581,
      "learning_rate": 3.120313721292443e-05,
      "loss": 1.1571,
      "num_input_tokens_seen": 37439838704,
      "step": 47587
    },
    {
      "epoch": 5.048589009123701,
      "grad_norm": 1.3412082219111663,
      "learning_rate": 3.120246397484252e-05,
      "loss": 1.1866,
      "num_input_tokens_seen": 37440625456,
      "step": 47588
    },
    {
      "epoch": 5.048695098663272,
      "grad_norm": 1.165866546379666,
      "learning_rate": 3.1201790731967515e-05,
      "loss": 1.147,
      "num_input_tokens_seen": 37441412160,
      "step": 47589
    },
    {
      "epoch": 5.048801188202844,
      "grad_norm": 1.5415497211412517,
      "learning_rate": 3.120111748429995e-05,
      "loss": 1.1242,
      "num_input_tokens_seen": 37442198992,
      "step": 47590
    },
    {
      "epoch": 5.048907277742415,
      "grad_norm": 1.3528764332675407,
      "learning_rate": 3.1200444231840345e-05,
      "loss": 1.1981,
      "num_input_tokens_seen": 37442985728,
      "step": 47591
    },
    {
      "epoch": 5.049013367281986,
      "grad_norm": 0.640146036762702,
      "learning_rate": 3.119977097458922e-05,
      "loss": 1.1145,
      "num_input_tokens_seen": 37443772512,
      "step": 47592
    },
    {
      "epoch": 5.049119456821558,
      "grad_norm": 0.9737291891203956,
      "learning_rate": 3.1199097712547096e-05,
      "loss": 1.1529,
      "num_input_tokens_seen": 37444559344,
      "step": 47593
    },
    {
      "epoch": 5.049225546361129,
      "grad_norm": 1.503504572061907,
      "learning_rate": 3.119842444571448e-05,
      "loss": 1.1164,
      "num_input_tokens_seen": 37445346176,
      "step": 47594
    },
    {
      "epoch": 5.0493316359007006,
      "grad_norm": 0.6678683774917037,
      "learning_rate": 3.1197751174091916e-05,
      "loss": 1.1764,
      "num_input_tokens_seen": 37446132896,
      "step": 47595
    },
    {
      "epoch": 5.049437725440272,
      "grad_norm": 0.7272407487237807,
      "learning_rate": 3.11970778976799e-05,
      "loss": 1.1202,
      "num_input_tokens_seen": 37446919728,
      "step": 47596
    },
    {
      "epoch": 5.049543814979843,
      "grad_norm": 1.077465755473905,
      "learning_rate": 3.119640461647898e-05,
      "loss": 1.0748,
      "num_input_tokens_seen": 37447706528,
      "step": 47597
    },
    {
      "epoch": 5.0496499045194145,
      "grad_norm": 0.9145225848115295,
      "learning_rate": 3.1195731330489645e-05,
      "loss": 1.2813,
      "num_input_tokens_seen": 37448493232,
      "step": 47598
    },
    {
      "epoch": 5.049755994058986,
      "grad_norm": 0.7445091684367972,
      "learning_rate": 3.1195058039712436e-05,
      "loss": 1.0825,
      "num_input_tokens_seen": 37449280096,
      "step": 47599
    },
    {
      "epoch": 5.0498620835985575,
      "grad_norm": 1.1130600887402529,
      "learning_rate": 3.119438474414787e-05,
      "loss": 1.2531,
      "num_input_tokens_seen": 37450066800,
      "step": 47600
    },
    {
      "epoch": 5.0499681731381285,
      "grad_norm": 0.8383904748975932,
      "learning_rate": 3.119371144379647e-05,
      "loss": 1.2716,
      "num_input_tokens_seen": 37450853536,
      "step": 47601
    },
    {
      "epoch": 5.0500742626776995,
      "grad_norm": 1.0379394386823795,
      "learning_rate": 3.119303813865874e-05,
      "loss": 1.1027,
      "num_input_tokens_seen": 37451640240,
      "step": 47602
    },
    {
      "epoch": 5.0501803522172715,
      "grad_norm": 0.6913123629228419,
      "learning_rate": 3.1192364828735224e-05,
      "loss": 1.1725,
      "num_input_tokens_seen": 37452426992,
      "step": 47603
    },
    {
      "epoch": 5.0502864417568425,
      "grad_norm": 0.7817779841407198,
      "learning_rate": 3.119169151402642e-05,
      "loss": 1.2007,
      "num_input_tokens_seen": 37453213760,
      "step": 47604
    },
    {
      "epoch": 5.050392531296414,
      "grad_norm": 0.8032037973121254,
      "learning_rate": 3.119101819453286e-05,
      "loss": 1.1532,
      "num_input_tokens_seen": 37454000544,
      "step": 47605
    },
    {
      "epoch": 5.050498620835985,
      "grad_norm": 0.7204002742639308,
      "learning_rate": 3.1190344870255066e-05,
      "loss": 1.0088,
      "num_input_tokens_seen": 37454787344,
      "step": 47606
    },
    {
      "epoch": 5.050604710375557,
      "grad_norm": 0.6689544477702152,
      "learning_rate": 3.118967154119355e-05,
      "loss": 1.0325,
      "num_input_tokens_seen": 37455574096,
      "step": 47607
    },
    {
      "epoch": 5.050710799915128,
      "grad_norm": 0.7704059086457518,
      "learning_rate": 3.1188998207348844e-05,
      "loss": 1.2235,
      "num_input_tokens_seen": 37456360880,
      "step": 47608
    },
    {
      "epoch": 5.050816889454699,
      "grad_norm": 0.8370383529537069,
      "learning_rate": 3.118832486872146e-05,
      "loss": 1.1632,
      "num_input_tokens_seen": 37457147568,
      "step": 47609
    },
    {
      "epoch": 5.050922978994271,
      "grad_norm": 0.7010315948757899,
      "learning_rate": 3.1187651525311916e-05,
      "loss": 1.1548,
      "num_input_tokens_seen": 37457934384,
      "step": 47610
    },
    {
      "epoch": 5.051029068533842,
      "grad_norm": 0.8522321083125748,
      "learning_rate": 3.118697817712075e-05,
      "loss": 1.1641,
      "num_input_tokens_seen": 37458721392,
      "step": 47611
    },
    {
      "epoch": 5.051135158073414,
      "grad_norm": 0.8996862923830957,
      "learning_rate": 3.1186304824148456e-05,
      "loss": 1.2153,
      "num_input_tokens_seen": 37459508144,
      "step": 47612
    },
    {
      "epoch": 5.051241247612985,
      "grad_norm": 0.590241352071615,
      "learning_rate": 3.1185631466395565e-05,
      "loss": 1.1013,
      "num_input_tokens_seen": 37460294848,
      "step": 47613
    },
    {
      "epoch": 5.051347337152556,
      "grad_norm": 1.2212857211393817,
      "learning_rate": 3.11849581038626e-05,
      "loss": 1.1101,
      "num_input_tokens_seen": 37461081712,
      "step": 47614
    },
    {
      "epoch": 5.051453426692128,
      "grad_norm": 0.7999677031097094,
      "learning_rate": 3.11842847365501e-05,
      "loss": 1.137,
      "num_input_tokens_seen": 37461868480,
      "step": 47615
    },
    {
      "epoch": 5.051559516231699,
      "grad_norm": 0.546821770583404,
      "learning_rate": 3.1183611364458546e-05,
      "loss": 1.0863,
      "num_input_tokens_seen": 37462655280,
      "step": 47616
    },
    {
      "epoch": 5.051665605771271,
      "grad_norm": 1.0429651235879769,
      "learning_rate": 3.118293798758849e-05,
      "loss": 1.21,
      "num_input_tokens_seen": 37463442064,
      "step": 47617
    },
    {
      "epoch": 5.051771695310842,
      "grad_norm": 1.126169432874441,
      "learning_rate": 3.118226460594043e-05,
      "loss": 1.2118,
      "num_input_tokens_seen": 37464228864,
      "step": 47618
    },
    {
      "epoch": 5.051877784850414,
      "grad_norm": 0.7287545089488439,
      "learning_rate": 3.11815912195149e-05,
      "loss": 1.1434,
      "num_input_tokens_seen": 37465015664,
      "step": 47619
    },
    {
      "epoch": 5.051983874389985,
      "grad_norm": 1.1021901934047331,
      "learning_rate": 3.118091782831242e-05,
      "loss": 1.112,
      "num_input_tokens_seen": 37465802464,
      "step": 47620
    },
    {
      "epoch": 5.052089963929556,
      "grad_norm": 1.1584621156400126,
      "learning_rate": 3.118024443233351e-05,
      "loss": 1.1664,
      "num_input_tokens_seen": 37466589120,
      "step": 47621
    },
    {
      "epoch": 5.052196053469128,
      "grad_norm": 0.6998511752368153,
      "learning_rate": 3.117957103157868e-05,
      "loss": 1.1741,
      "num_input_tokens_seen": 37467375808,
      "step": 47622
    },
    {
      "epoch": 5.052302143008699,
      "grad_norm": 1.1811659817869238,
      "learning_rate": 3.117889762604847e-05,
      "loss": 1.1502,
      "num_input_tokens_seen": 37468162496,
      "step": 47623
    },
    {
      "epoch": 5.052408232548271,
      "grad_norm": 1.2790517929696483,
      "learning_rate": 3.117822421574338e-05,
      "loss": 1.2309,
      "num_input_tokens_seen": 37468949232,
      "step": 47624
    },
    {
      "epoch": 5.052514322087842,
      "grad_norm": 0.831057594369101,
      "learning_rate": 3.1177550800663946e-05,
      "loss": 1.0775,
      "num_input_tokens_seen": 37469736144,
      "step": 47625
    },
    {
      "epoch": 5.052620411627413,
      "grad_norm": 1.1583282517419387,
      "learning_rate": 3.117687738081068e-05,
      "loss": 1.1481,
      "num_input_tokens_seen": 37470523008,
      "step": 47626
    },
    {
      "epoch": 5.052726501166985,
      "grad_norm": 0.8744286688924767,
      "learning_rate": 3.11762039561841e-05,
      "loss": 1.2071,
      "num_input_tokens_seen": 37471309696,
      "step": 47627
    },
    {
      "epoch": 5.052832590706556,
      "grad_norm": 0.94516603927827,
      "learning_rate": 3.117553052678474e-05,
      "loss": 1.1397,
      "num_input_tokens_seen": 37472096448,
      "step": 47628
    },
    {
      "epoch": 5.052938680246128,
      "grad_norm": 0.8998425541875172,
      "learning_rate": 3.1174857092613106e-05,
      "loss": 1.1148,
      "num_input_tokens_seen": 37472883200,
      "step": 47629
    },
    {
      "epoch": 5.053044769785699,
      "grad_norm": 0.5732933265059159,
      "learning_rate": 3.117418365366972e-05,
      "loss": 1.0793,
      "num_input_tokens_seen": 37473669904,
      "step": 47630
    },
    {
      "epoch": 5.053150859325271,
      "grad_norm": 0.7289708875992755,
      "learning_rate": 3.117351020995512e-05,
      "loss": 1.1277,
      "num_input_tokens_seen": 37474456640,
      "step": 47631
    },
    {
      "epoch": 5.053256948864842,
      "grad_norm": 0.9640362268978261,
      "learning_rate": 3.1172836761469805e-05,
      "loss": 1.0241,
      "num_input_tokens_seen": 37475243536,
      "step": 47632
    },
    {
      "epoch": 5.053363038404413,
      "grad_norm": 0.6207478895179783,
      "learning_rate": 3.1172163308214295e-05,
      "loss": 1.1111,
      "num_input_tokens_seen": 37476030272,
      "step": 47633
    },
    {
      "epoch": 5.053469127943985,
      "grad_norm": 0.8128698161214933,
      "learning_rate": 3.117148985018912e-05,
      "loss": 1.0937,
      "num_input_tokens_seen": 37476817040,
      "step": 47634
    },
    {
      "epoch": 5.053575217483556,
      "grad_norm": 0.8864542829263314,
      "learning_rate": 3.117081638739481e-05,
      "loss": 1.1864,
      "num_input_tokens_seen": 37477603776,
      "step": 47635
    },
    {
      "epoch": 5.053681307023128,
      "grad_norm": 0.7678953822274824,
      "learning_rate": 3.117014291983186e-05,
      "loss": 1.1879,
      "num_input_tokens_seen": 37478390592,
      "step": 47636
    },
    {
      "epoch": 5.053787396562699,
      "grad_norm": 0.6857049903213577,
      "learning_rate": 3.116946944750082e-05,
      "loss": 1.0789,
      "num_input_tokens_seen": 37479177376,
      "step": 47637
    },
    {
      "epoch": 5.05389348610227,
      "grad_norm": 0.6799659237209205,
      "learning_rate": 3.116879597040219e-05,
      "loss": 1.1502,
      "num_input_tokens_seen": 37479964144,
      "step": 47638
    },
    {
      "epoch": 5.053999575641842,
      "grad_norm": 0.663482798310532,
      "learning_rate": 3.116812248853648e-05,
      "loss": 1.0409,
      "num_input_tokens_seen": 37480750992,
      "step": 47639
    },
    {
      "epoch": 5.054105665181413,
      "grad_norm": 0.926962544493913,
      "learning_rate": 3.116744900190424e-05,
      "loss": 1.0906,
      "num_input_tokens_seen": 37481537776,
      "step": 47640
    },
    {
      "epoch": 5.054211754720985,
      "grad_norm": 0.613349403127152,
      "learning_rate": 3.116677551050598e-05,
      "loss": 1.1515,
      "num_input_tokens_seen": 37482324496,
      "step": 47641
    },
    {
      "epoch": 5.054317844260556,
      "grad_norm": 0.7480704351357258,
      "learning_rate": 3.1166102014342204e-05,
      "loss": 1.2746,
      "num_input_tokens_seen": 37483111328,
      "step": 47642
    },
    {
      "epoch": 5.054423933800127,
      "grad_norm": 0.5837356352502329,
      "learning_rate": 3.116542851341345e-05,
      "loss": 1.0954,
      "num_input_tokens_seen": 37483898080,
      "step": 47643
    },
    {
      "epoch": 5.054530023339699,
      "grad_norm": 0.6647196452140482,
      "learning_rate": 3.116475500772024e-05,
      "loss": 1.2375,
      "num_input_tokens_seen": 37484684784,
      "step": 47644
    },
    {
      "epoch": 5.05463611287927,
      "grad_norm": 0.739311355158788,
      "learning_rate": 3.116408149726308e-05,
      "loss": 1.0838,
      "num_input_tokens_seen": 37485471552,
      "step": 47645
    },
    {
      "epoch": 5.054742202418842,
      "grad_norm": 0.5263414312857679,
      "learning_rate": 3.1163407982042504e-05,
      "loss": 1.0748,
      "num_input_tokens_seen": 37486258320,
      "step": 47646
    },
    {
      "epoch": 5.054848291958413,
      "grad_norm": 0.7259787095429534,
      "learning_rate": 3.1162734462059026e-05,
      "loss": 1.1663,
      "num_input_tokens_seen": 37487045056,
      "step": 47647
    },
    {
      "epoch": 5.054954381497985,
      "grad_norm": 0.720037731058419,
      "learning_rate": 3.116206093731316e-05,
      "loss": 1.2475,
      "num_input_tokens_seen": 37487831728,
      "step": 47648
    },
    {
      "epoch": 5.055060471037556,
      "grad_norm": 0.5937952838814872,
      "learning_rate": 3.116138740780545e-05,
      "loss": 1.0953,
      "num_input_tokens_seen": 37488618512,
      "step": 47649
    },
    {
      "epoch": 5.055166560577127,
      "grad_norm": 0.7411151514585548,
      "learning_rate": 3.1160713873536395e-05,
      "loss": 1.1586,
      "num_input_tokens_seen": 37489405264,
      "step": 47650
    },
    {
      "epoch": 5.055272650116699,
      "grad_norm": 0.6267570809071028,
      "learning_rate": 3.1160040334506514e-05,
      "loss": 1.1937,
      "num_input_tokens_seen": 37490192016,
      "step": 47651
    },
    {
      "epoch": 5.05537873965627,
      "grad_norm": 0.6980191456487003,
      "learning_rate": 3.115936679071634e-05,
      "loss": 1.0731,
      "num_input_tokens_seen": 37490978688,
      "step": 47652
    },
    {
      "epoch": 5.055484829195842,
      "grad_norm": 0.7667990946229903,
      "learning_rate": 3.1158693242166385e-05,
      "loss": 1.2224,
      "num_input_tokens_seen": 37491765440,
      "step": 47653
    },
    {
      "epoch": 5.055590918735413,
      "grad_norm": 0.6248160686063653,
      "learning_rate": 3.1158019688857175e-05,
      "loss": 1.1802,
      "num_input_tokens_seen": 37492552208,
      "step": 47654
    },
    {
      "epoch": 5.055697008274984,
      "grad_norm": 0.6772890742060432,
      "learning_rate": 3.115734613078923e-05,
      "loss": 1.1618,
      "num_input_tokens_seen": 37493338976,
      "step": 47655
    },
    {
      "epoch": 5.055803097814556,
      "grad_norm": 0.6130551247887462,
      "learning_rate": 3.1156672567963065e-05,
      "loss": 1.1093,
      "num_input_tokens_seen": 37494125760,
      "step": 47656
    },
    {
      "epoch": 5.055909187354127,
      "grad_norm": 0.6380929119193696,
      "learning_rate": 3.11559990003792e-05,
      "loss": 1.0325,
      "num_input_tokens_seen": 37494912544,
      "step": 47657
    },
    {
      "epoch": 5.056015276893699,
      "grad_norm": 0.5775755993958837,
      "learning_rate": 3.115532542803817e-05,
      "loss": 1.072,
      "num_input_tokens_seen": 37495699264,
      "step": 47658
    },
    {
      "epoch": 5.05612136643327,
      "grad_norm": 0.6326057502088951,
      "learning_rate": 3.115465185094048e-05,
      "loss": 1.1021,
      "num_input_tokens_seen": 37496486032,
      "step": 47659
    },
    {
      "epoch": 5.0562274559728415,
      "grad_norm": 0.5851022085649383,
      "learning_rate": 3.115397826908666e-05,
      "loss": 1.1009,
      "num_input_tokens_seen": 37497272768,
      "step": 47660
    },
    {
      "epoch": 5.0563335455124125,
      "grad_norm": 0.5736302578489646,
      "learning_rate": 3.1153304682477224e-05,
      "loss": 1.0638,
      "num_input_tokens_seen": 37498059520,
      "step": 47661
    },
    {
      "epoch": 5.056439635051984,
      "grad_norm": 0.6549959705462179,
      "learning_rate": 3.115263109111269e-05,
      "loss": 1.1587,
      "num_input_tokens_seen": 37498846304,
      "step": 47662
    },
    {
      "epoch": 5.0565457245915555,
      "grad_norm": 0.6150283107330577,
      "learning_rate": 3.1151957494993584e-05,
      "loss": 1.1957,
      "num_input_tokens_seen": 37499633088,
      "step": 47663
    },
    {
      "epoch": 5.0566518141311265,
      "grad_norm": 0.5705285613601326,
      "learning_rate": 3.115128389412043e-05,
      "loss": 1.0582,
      "num_input_tokens_seen": 37500419920,
      "step": 47664
    },
    {
      "epoch": 5.056757903670698,
      "grad_norm": 0.7307232094795775,
      "learning_rate": 3.115061028849374e-05,
      "loss": 1.1922,
      "num_input_tokens_seen": 37501206608,
      "step": 47665
    },
    {
      "epoch": 5.0568639932102695,
      "grad_norm": 0.6482688307623007,
      "learning_rate": 3.114993667811404e-05,
      "loss": 1.093,
      "num_input_tokens_seen": 37501993408,
      "step": 47666
    },
    {
      "epoch": 5.0569700827498405,
      "grad_norm": 0.7455120824374271,
      "learning_rate": 3.1149263062981855e-05,
      "loss": 1.069,
      "num_input_tokens_seen": 37502780176,
      "step": 47667
    },
    {
      "epoch": 5.057076172289412,
      "grad_norm": 0.7222713819519956,
      "learning_rate": 3.114858944309769e-05,
      "loss": 1.2594,
      "num_input_tokens_seen": 37503566912,
      "step": 47668
    },
    {
      "epoch": 5.0571822618289834,
      "grad_norm": 0.7260615224160274,
      "learning_rate": 3.114791581846208e-05,
      "loss": 1.0467,
      "num_input_tokens_seen": 37504353776,
      "step": 47669
    },
    {
      "epoch": 5.057288351368555,
      "grad_norm": 0.6735317386194813,
      "learning_rate": 3.114724218907554e-05,
      "loss": 1.2123,
      "num_input_tokens_seen": 37505140608,
      "step": 47670
    },
    {
      "epoch": 5.057394440908126,
      "grad_norm": 0.7080895180178529,
      "learning_rate": 3.114656855493859e-05,
      "loss": 1.1081,
      "num_input_tokens_seen": 37505927376,
      "step": 47671
    },
    {
      "epoch": 5.057500530447697,
      "grad_norm": 0.6810981359284416,
      "learning_rate": 3.1145894916051766e-05,
      "loss": 1.2095,
      "num_input_tokens_seen": 37506714160,
      "step": 47672
    },
    {
      "epoch": 5.057606619987269,
      "grad_norm": 0.6378796078928193,
      "learning_rate": 3.114522127241556e-05,
      "loss": 1.1094,
      "num_input_tokens_seen": 37507500992,
      "step": 47673
    },
    {
      "epoch": 5.05771270952684,
      "grad_norm": 0.6303047843883597,
      "learning_rate": 3.114454762403051e-05,
      "loss": 0.9598,
      "num_input_tokens_seen": 37508287792,
      "step": 47674
    },
    {
      "epoch": 5.057818799066412,
      "grad_norm": 0.7958870026271777,
      "learning_rate": 3.1143873970897134e-05,
      "loss": 1.1329,
      "num_input_tokens_seen": 37509074528,
      "step": 47675
    },
    {
      "epoch": 5.057924888605983,
      "grad_norm": 0.6686740537979403,
      "learning_rate": 3.1143200313015954e-05,
      "loss": 1.1148,
      "num_input_tokens_seen": 37509861200,
      "step": 47676
    },
    {
      "epoch": 5.058030978145555,
      "grad_norm": 0.7690119569011549,
      "learning_rate": 3.114252665038749e-05,
      "loss": 1.1202,
      "num_input_tokens_seen": 37510647984,
      "step": 47677
    },
    {
      "epoch": 5.058137067685126,
      "grad_norm": 0.6649129056886056,
      "learning_rate": 3.1141852983012265e-05,
      "loss": 1.0778,
      "num_input_tokens_seen": 37511434704,
      "step": 47678
    },
    {
      "epoch": 5.058243157224697,
      "grad_norm": 0.6082690113933459,
      "learning_rate": 3.114117931089079e-05,
      "loss": 1.1243,
      "num_input_tokens_seen": 37512221536,
      "step": 47679
    },
    {
      "epoch": 5.058349246764269,
      "grad_norm": 0.8298169070518139,
      "learning_rate": 3.1140505634023593e-05,
      "loss": 1.0844,
      "num_input_tokens_seen": 37513008368,
      "step": 47680
    },
    {
      "epoch": 5.05845533630384,
      "grad_norm": 0.9858841815617806,
      "learning_rate": 3.11398319524112e-05,
      "loss": 1.2862,
      "num_input_tokens_seen": 37513794992,
      "step": 47681
    },
    {
      "epoch": 5.058561425843412,
      "grad_norm": 0.8368859810646646,
      "learning_rate": 3.113915826605411e-05,
      "loss": 1.1525,
      "num_input_tokens_seen": 37514581808,
      "step": 47682
    },
    {
      "epoch": 5.058667515382983,
      "grad_norm": 0.7980451035657032,
      "learning_rate": 3.113848457495287e-05,
      "loss": 1.1334,
      "num_input_tokens_seen": 37515368608,
      "step": 47683
    },
    {
      "epoch": 5.058773604922554,
      "grad_norm": 0.7722045559518005,
      "learning_rate": 3.113781087910799e-05,
      "loss": 1.1354,
      "num_input_tokens_seen": 37516155408,
      "step": 47684
    },
    {
      "epoch": 5.058879694462126,
      "grad_norm": 0.7157382890548252,
      "learning_rate": 3.1137137178519985e-05,
      "loss": 1.1911,
      "num_input_tokens_seen": 37516942112,
      "step": 47685
    },
    {
      "epoch": 5.058985784001697,
      "grad_norm": 0.6502180183745799,
      "learning_rate": 3.113646347318938e-05,
      "loss": 1.1165,
      "num_input_tokens_seen": 37517728896,
      "step": 47686
    },
    {
      "epoch": 5.059091873541269,
      "grad_norm": 0.751068102837713,
      "learning_rate": 3.11357897631167e-05,
      "loss": 1.1305,
      "num_input_tokens_seen": 37518515744,
      "step": 47687
    },
    {
      "epoch": 5.05919796308084,
      "grad_norm": 0.8518997132899516,
      "learning_rate": 3.113511604830246e-05,
      "loss": 1.19,
      "num_input_tokens_seen": 37519302592,
      "step": 47688
    },
    {
      "epoch": 5.059304052620412,
      "grad_norm": 0.8211833503182074,
      "learning_rate": 3.1134442328747174e-05,
      "loss": 1.1851,
      "num_input_tokens_seen": 37520089296,
      "step": 47689
    },
    {
      "epoch": 5.059410142159983,
      "grad_norm": 0.5968909109175053,
      "learning_rate": 3.113376860445139e-05,
      "loss": 1.1638,
      "num_input_tokens_seen": 37520876096,
      "step": 47690
    },
    {
      "epoch": 5.059516231699554,
      "grad_norm": 0.9611184142054164,
      "learning_rate": 3.113309487541559e-05,
      "loss": 1.1451,
      "num_input_tokens_seen": 37521662800,
      "step": 47691
    },
    {
      "epoch": 5.059622321239126,
      "grad_norm": 0.5875505400234172,
      "learning_rate": 3.1132421141640325e-05,
      "loss": 1.1294,
      "num_input_tokens_seen": 37522449568,
      "step": 47692
    },
    {
      "epoch": 5.059728410778697,
      "grad_norm": 0.7609295994510318,
      "learning_rate": 3.113174740312611e-05,
      "loss": 1.2631,
      "num_input_tokens_seen": 37523236256,
      "step": 47693
    },
    {
      "epoch": 5.059834500318269,
      "grad_norm": 0.9797431771068423,
      "learning_rate": 3.1131073659873445e-05,
      "loss": 1.1356,
      "num_input_tokens_seen": 37524023008,
      "step": 47694
    },
    {
      "epoch": 5.05994058985784,
      "grad_norm": 0.6737622649119922,
      "learning_rate": 3.1130399911882874e-05,
      "loss": 1.1675,
      "num_input_tokens_seen": 37524809760,
      "step": 47695
    },
    {
      "epoch": 5.060046679397411,
      "grad_norm": 0.659319379060202,
      "learning_rate": 3.112972615915491e-05,
      "loss": 1.1181,
      "num_input_tokens_seen": 37525596576,
      "step": 47696
    },
    {
      "epoch": 5.060152768936983,
      "grad_norm": 2.788071028487827,
      "learning_rate": 3.1129052401690076e-05,
      "loss": 1.1525,
      "num_input_tokens_seen": 37526383392,
      "step": 47697
    },
    {
      "epoch": 5.060258858476554,
      "grad_norm": 1.2236064999983893,
      "learning_rate": 3.112837863948889e-05,
      "loss": 1.1689,
      "num_input_tokens_seen": 37527170176,
      "step": 47698
    },
    {
      "epoch": 5.060364948016126,
      "grad_norm": 0.6543525178650513,
      "learning_rate": 3.112770487255187e-05,
      "loss": 1.0824,
      "num_input_tokens_seen": 37527957024,
      "step": 47699
    },
    {
      "epoch": 5.060471037555697,
      "grad_norm": 0.9892642457141984,
      "learning_rate": 3.112703110087954e-05,
      "loss": 1.1334,
      "num_input_tokens_seen": 37528743824,
      "step": 47700
    },
    {
      "epoch": 5.060577127095268,
      "grad_norm": 0.6744544948301673,
      "learning_rate": 3.112635732447242e-05,
      "loss": 1.103,
      "num_input_tokens_seen": 37529530640,
      "step": 47701
    },
    {
      "epoch": 5.06068321663484,
      "grad_norm": 0.7643667266086854,
      "learning_rate": 3.112568354333103e-05,
      "loss": 1.1647,
      "num_input_tokens_seen": 37530317360,
      "step": 47702
    },
    {
      "epoch": 5.060789306174411,
      "grad_norm": 0.6525246310613847,
      "learning_rate": 3.1125009757455895e-05,
      "loss": 1.1594,
      "num_input_tokens_seen": 37531104096,
      "step": 47703
    },
    {
      "epoch": 5.060895395713983,
      "grad_norm": 1.0257871246704577,
      "learning_rate": 3.112433596684753e-05,
      "loss": 1.2161,
      "num_input_tokens_seen": 37531890928,
      "step": 47704
    },
    {
      "epoch": 5.061001485253554,
      "grad_norm": 0.6741490757645314,
      "learning_rate": 3.1123662171506456e-05,
      "loss": 1.1182,
      "num_input_tokens_seen": 37532677680,
      "step": 47705
    },
    {
      "epoch": 5.061107574793126,
      "grad_norm": 0.9892256945472435,
      "learning_rate": 3.11229883714332e-05,
      "loss": 1.1848,
      "num_input_tokens_seen": 37533464400,
      "step": 47706
    },
    {
      "epoch": 5.061213664332697,
      "grad_norm": 0.830690572424033,
      "learning_rate": 3.112231456662828e-05,
      "loss": 1.1797,
      "num_input_tokens_seen": 37534251152,
      "step": 47707
    },
    {
      "epoch": 5.061319753872268,
      "grad_norm": 0.7332549803836373,
      "learning_rate": 3.1121640757092204e-05,
      "loss": 1.1692,
      "num_input_tokens_seen": 37535037888,
      "step": 47708
    },
    {
      "epoch": 5.06142584341184,
      "grad_norm": 0.7306127374821945,
      "learning_rate": 3.112096694282551e-05,
      "loss": 1.1593,
      "num_input_tokens_seen": 37535824720,
      "step": 47709
    },
    {
      "epoch": 5.061531932951411,
      "grad_norm": 0.7149299670883198,
      "learning_rate": 3.112029312382872e-05,
      "loss": 1.1023,
      "num_input_tokens_seen": 37536611488,
      "step": 47710
    },
    {
      "epoch": 5.061638022490983,
      "grad_norm": 0.7006744817662157,
      "learning_rate": 3.1119619300102335e-05,
      "loss": 1.1125,
      "num_input_tokens_seen": 37537398224,
      "step": 47711
    },
    {
      "epoch": 5.061744112030554,
      "grad_norm": 0.7013271797088061,
      "learning_rate": 3.111894547164689e-05,
      "loss": 1.1524,
      "num_input_tokens_seen": 37538185040,
      "step": 47712
    },
    {
      "epoch": 5.061850201570125,
      "grad_norm": 0.7380667329929071,
      "learning_rate": 3.1118271638462906e-05,
      "loss": 1.1918,
      "num_input_tokens_seen": 37538971808,
      "step": 47713
    },
    {
      "epoch": 5.061956291109697,
      "grad_norm": 0.5586971282801482,
      "learning_rate": 3.11175978005509e-05,
      "loss": 1.1602,
      "num_input_tokens_seen": 37539758672,
      "step": 47714
    },
    {
      "epoch": 5.062062380649268,
      "grad_norm": 0.6381980923199747,
      "learning_rate": 3.11169239579114e-05,
      "loss": 1.1776,
      "num_input_tokens_seen": 37540545424,
      "step": 47715
    },
    {
      "epoch": 5.06216847018884,
      "grad_norm": 0.6989930000500575,
      "learning_rate": 3.111625011054491e-05,
      "loss": 1.1435,
      "num_input_tokens_seen": 37541332192,
      "step": 47716
    },
    {
      "epoch": 5.062274559728411,
      "grad_norm": 0.6317515823176555,
      "learning_rate": 3.111557625845197e-05,
      "loss": 1.1851,
      "num_input_tokens_seen": 37542118816,
      "step": 47717
    },
    {
      "epoch": 5.062380649267983,
      "grad_norm": 0.667188921564571,
      "learning_rate": 3.111490240163309e-05,
      "loss": 1.0995,
      "num_input_tokens_seen": 37542905584,
      "step": 47718
    },
    {
      "epoch": 5.062486738807554,
      "grad_norm": 0.7428481112742158,
      "learning_rate": 3.1114228540088784e-05,
      "loss": 1.1563,
      "num_input_tokens_seen": 37543692304,
      "step": 47719
    },
    {
      "epoch": 5.062592828347125,
      "grad_norm": 0.6110954588253499,
      "learning_rate": 3.1113554673819596e-05,
      "loss": 1.2017,
      "num_input_tokens_seen": 37544479024,
      "step": 47720
    },
    {
      "epoch": 5.062698917886697,
      "grad_norm": 0.58646323588447,
      "learning_rate": 3.111288080282603e-05,
      "loss": 1.0247,
      "num_input_tokens_seen": 37545265808,
      "step": 47721
    },
    {
      "epoch": 5.062805007426268,
      "grad_norm": 0.8699725539864048,
      "learning_rate": 3.11122069271086e-05,
      "loss": 1.1775,
      "num_input_tokens_seen": 37546052544,
      "step": 47722
    },
    {
      "epoch": 5.0629110969658395,
      "grad_norm": 0.6290648568584699,
      "learning_rate": 3.111153304666784e-05,
      "loss": 1.1596,
      "num_input_tokens_seen": 37546839376,
      "step": 47723
    },
    {
      "epoch": 5.0630171865054105,
      "grad_norm": 0.8873574129949434,
      "learning_rate": 3.111085916150427e-05,
      "loss": 1.1475,
      "num_input_tokens_seen": 37547626112,
      "step": 47724
    },
    {
      "epoch": 5.063123276044982,
      "grad_norm": 0.6090696063188482,
      "learning_rate": 3.1110185271618406e-05,
      "loss": 1.1485,
      "num_input_tokens_seen": 37548412832,
      "step": 47725
    },
    {
      "epoch": 5.0632293655845535,
      "grad_norm": 0.6025822073857341,
      "learning_rate": 3.110951137701077e-05,
      "loss": 1.1139,
      "num_input_tokens_seen": 37549199664,
      "step": 47726
    },
    {
      "epoch": 5.0633354551241245,
      "grad_norm": 0.6879603511792654,
      "learning_rate": 3.1108837477681876e-05,
      "loss": 1.1593,
      "num_input_tokens_seen": 37549986432,
      "step": 47727
    },
    {
      "epoch": 5.0634415446636964,
      "grad_norm": 0.6263390348430765,
      "learning_rate": 3.110816357363226e-05,
      "loss": 1.1693,
      "num_input_tokens_seen": 37550773232,
      "step": 47728
    },
    {
      "epoch": 5.0635476342032675,
      "grad_norm": 0.6072178196953049,
      "learning_rate": 3.1107489664862435e-05,
      "loss": 1.233,
      "num_input_tokens_seen": 37551559920,
      "step": 47729
    },
    {
      "epoch": 5.0636537237428385,
      "grad_norm": 0.5748325960804922,
      "learning_rate": 3.110681575137291e-05,
      "loss": 1.256,
      "num_input_tokens_seen": 37552346704,
      "step": 47730
    },
    {
      "epoch": 5.06375981328241,
      "grad_norm": 0.6102745295178893,
      "learning_rate": 3.110614183316423e-05,
      "loss": 1.1525,
      "num_input_tokens_seen": 37553133440,
      "step": 47731
    },
    {
      "epoch": 5.0638659028219815,
      "grad_norm": 0.6012688020299407,
      "learning_rate": 3.11054679102369e-05,
      "loss": 1.1706,
      "num_input_tokens_seen": 37553920256,
      "step": 47732
    },
    {
      "epoch": 5.063971992361553,
      "grad_norm": 0.6172815204424118,
      "learning_rate": 3.110479398259144e-05,
      "loss": 1.2164,
      "num_input_tokens_seen": 37554707008,
      "step": 47733
    },
    {
      "epoch": 5.064078081901124,
      "grad_norm": 0.6439593565199251,
      "learning_rate": 3.110412005022838e-05,
      "loss": 1.2154,
      "num_input_tokens_seen": 37555493776,
      "step": 47734
    },
    {
      "epoch": 5.064184171440696,
      "grad_norm": 0.587462037789134,
      "learning_rate": 3.110344611314823e-05,
      "loss": 1.0635,
      "num_input_tokens_seen": 37556280496,
      "step": 47735
    },
    {
      "epoch": 5.064290260980267,
      "grad_norm": 0.6718043846656001,
      "learning_rate": 3.1102772171351506e-05,
      "loss": 1.1575,
      "num_input_tokens_seen": 37557067216,
      "step": 47736
    },
    {
      "epoch": 5.064396350519838,
      "grad_norm": 0.537819004708143,
      "learning_rate": 3.110209822483875e-05,
      "loss": 1.0757,
      "num_input_tokens_seen": 37557854000,
      "step": 47737
    },
    {
      "epoch": 5.06450244005941,
      "grad_norm": 0.6742689175768674,
      "learning_rate": 3.1101424273610465e-05,
      "loss": 1.197,
      "num_input_tokens_seen": 37558640784,
      "step": 47738
    },
    {
      "epoch": 5.064608529598981,
      "grad_norm": 0.6223432208498918,
      "learning_rate": 3.110075031766719e-05,
      "loss": 1.1462,
      "num_input_tokens_seen": 37559427504,
      "step": 47739
    },
    {
      "epoch": 5.064714619138553,
      "grad_norm": 0.6194506145948263,
      "learning_rate": 3.110007635700943e-05,
      "loss": 1.1399,
      "num_input_tokens_seen": 37560214400,
      "step": 47740
    },
    {
      "epoch": 5.064820708678124,
      "grad_norm": 0.60330073940567,
      "learning_rate": 3.109940239163771e-05,
      "loss": 1.0514,
      "num_input_tokens_seen": 37561001248,
      "step": 47741
    },
    {
      "epoch": 5.064926798217695,
      "grad_norm": 0.6819626714139105,
      "learning_rate": 3.109872842155254e-05,
      "loss": 1.1738,
      "num_input_tokens_seen": 37561787968,
      "step": 47742
    },
    {
      "epoch": 5.065032887757267,
      "grad_norm": 0.6351752619019554,
      "learning_rate": 3.1098054446754464e-05,
      "loss": 1.1554,
      "num_input_tokens_seen": 37562574672,
      "step": 47743
    },
    {
      "epoch": 5.065138977296838,
      "grad_norm": 0.6878248235826896,
      "learning_rate": 3.109738046724399e-05,
      "loss": 1.1399,
      "num_input_tokens_seen": 37563361408,
      "step": 47744
    },
    {
      "epoch": 5.06524506683641,
      "grad_norm": 0.5910260654089825,
      "learning_rate": 3.1096706483021636e-05,
      "loss": 1.1721,
      "num_input_tokens_seen": 37564148160,
      "step": 47745
    },
    {
      "epoch": 5.065351156375981,
      "grad_norm": 0.8624898568228844,
      "learning_rate": 3.109603249408793e-05,
      "loss": 1.1418,
      "num_input_tokens_seen": 37564934912,
      "step": 47746
    },
    {
      "epoch": 5.065457245915553,
      "grad_norm": 0.580909797874567,
      "learning_rate": 3.109535850044338e-05,
      "loss": 1.2106,
      "num_input_tokens_seen": 37565721600,
      "step": 47747
    },
    {
      "epoch": 5.065563335455124,
      "grad_norm": 0.5824807225834658,
      "learning_rate": 3.1094684502088526e-05,
      "loss": 1.0902,
      "num_input_tokens_seen": 37566508336,
      "step": 47748
    },
    {
      "epoch": 5.065669424994695,
      "grad_norm": 0.5848299846773827,
      "learning_rate": 3.1094010499023875e-05,
      "loss": 1.1047,
      "num_input_tokens_seen": 37567295216,
      "step": 47749
    },
    {
      "epoch": 5.065775514534267,
      "grad_norm": 0.5772016378919449,
      "learning_rate": 3.109333649124995e-05,
      "loss": 1.1452,
      "num_input_tokens_seen": 37568081936,
      "step": 47750
    },
    {
      "epoch": 5.065881604073838,
      "grad_norm": 0.9967502857616649,
      "learning_rate": 3.109266247876727e-05,
      "loss": 1.2091,
      "num_input_tokens_seen": 37568868704,
      "step": 47751
    },
    {
      "epoch": 5.06598769361341,
      "grad_norm": 1.0819177421701378,
      "learning_rate": 3.109198846157637e-05,
      "loss": 1.1106,
      "num_input_tokens_seen": 37569655408,
      "step": 47752
    },
    {
      "epoch": 5.066093783152981,
      "grad_norm": 1.1917429912207698,
      "learning_rate": 3.109131443967775e-05,
      "loss": 1.0914,
      "num_input_tokens_seen": 37570442128,
      "step": 47753
    },
    {
      "epoch": 5.066199872692552,
      "grad_norm": 0.6394686106538806,
      "learning_rate": 3.109064041307194e-05,
      "loss": 1.079,
      "num_input_tokens_seen": 37571228848,
      "step": 47754
    },
    {
      "epoch": 5.066305962232124,
      "grad_norm": 0.9231035380792578,
      "learning_rate": 3.108996638175947e-05,
      "loss": 1.0947,
      "num_input_tokens_seen": 37572015632,
      "step": 47755
    },
    {
      "epoch": 5.066412051771695,
      "grad_norm": 1.1032834701072893,
      "learning_rate": 3.108929234574084e-05,
      "loss": 1.1271,
      "num_input_tokens_seen": 37572802448,
      "step": 47756
    },
    {
      "epoch": 5.066518141311267,
      "grad_norm": 0.5491696724631749,
      "learning_rate": 3.10886183050166e-05,
      "loss": 1.1148,
      "num_input_tokens_seen": 37573589200,
      "step": 47757
    },
    {
      "epoch": 5.066624230850838,
      "grad_norm": 1.1415428323357935,
      "learning_rate": 3.108794425958725e-05,
      "loss": 1.2243,
      "num_input_tokens_seen": 37574376032,
      "step": 47758
    },
    {
      "epoch": 5.06673032039041,
      "grad_norm": 1.0848174696226884,
      "learning_rate": 3.1087270209453305e-05,
      "loss": 1.1573,
      "num_input_tokens_seen": 37575162832,
      "step": 47759
    },
    {
      "epoch": 5.066836409929981,
      "grad_norm": 0.7212796253297286,
      "learning_rate": 3.1086596154615304e-05,
      "loss": 1.1444,
      "num_input_tokens_seen": 37575949568,
      "step": 47760
    },
    {
      "epoch": 5.066942499469552,
      "grad_norm": 0.7320403864171348,
      "learning_rate": 3.108592209507376e-05,
      "loss": 1.0164,
      "num_input_tokens_seen": 37576736352,
      "step": 47761
    },
    {
      "epoch": 5.067048589009124,
      "grad_norm": 1.1422133300781712,
      "learning_rate": 3.10852480308292e-05,
      "loss": 1.1523,
      "num_input_tokens_seen": 37577523120,
      "step": 47762
    },
    {
      "epoch": 5.067154678548695,
      "grad_norm": 0.8568372000623443,
      "learning_rate": 3.108457396188212e-05,
      "loss": 1.1705,
      "num_input_tokens_seen": 37578309904,
      "step": 47763
    },
    {
      "epoch": 5.067260768088267,
      "grad_norm": 0.9574093006421145,
      "learning_rate": 3.1083899888233083e-05,
      "loss": 1.1523,
      "num_input_tokens_seen": 37579096608,
      "step": 47764
    },
    {
      "epoch": 5.067366857627838,
      "grad_norm": 0.5600537319806286,
      "learning_rate": 3.1083225809882566e-05,
      "loss": 1.0654,
      "num_input_tokens_seen": 37579883376,
      "step": 47765
    },
    {
      "epoch": 5.067472947167409,
      "grad_norm": 0.814669455740767,
      "learning_rate": 3.1082551726831124e-05,
      "loss": 1.1111,
      "num_input_tokens_seen": 37580670192,
      "step": 47766
    },
    {
      "epoch": 5.067579036706981,
      "grad_norm": 0.6948993960743296,
      "learning_rate": 3.1081877639079266e-05,
      "loss": 1.17,
      "num_input_tokens_seen": 37581456944,
      "step": 47767
    },
    {
      "epoch": 5.067685126246552,
      "grad_norm": 0.7085880740169267,
      "learning_rate": 3.10812035466275e-05,
      "loss": 1.1321,
      "num_input_tokens_seen": 37582243696,
      "step": 47768
    },
    {
      "epoch": 5.067791215786124,
      "grad_norm": 0.7626046024569982,
      "learning_rate": 3.108052944947637e-05,
      "loss": 1.1747,
      "num_input_tokens_seen": 37583030416,
      "step": 47769
    },
    {
      "epoch": 5.067897305325695,
      "grad_norm": 0.930892366084465,
      "learning_rate": 3.107985534762637e-05,
      "loss": 1.0924,
      "num_input_tokens_seen": 37583817088,
      "step": 47770
    },
    {
      "epoch": 5.068003394865266,
      "grad_norm": 0.805087605090046,
      "learning_rate": 3.1079181241078045e-05,
      "loss": 1.126,
      "num_input_tokens_seen": 37584603872,
      "step": 47771
    },
    {
      "epoch": 5.068109484404838,
      "grad_norm": 0.7520976737337159,
      "learning_rate": 3.107850712983191e-05,
      "loss": 1.1022,
      "num_input_tokens_seen": 37585390656,
      "step": 47772
    },
    {
      "epoch": 5.068215573944409,
      "grad_norm": 0.606215919863093,
      "learning_rate": 3.107783301388848e-05,
      "loss": 1.1233,
      "num_input_tokens_seen": 37586177424,
      "step": 47773
    },
    {
      "epoch": 5.068321663483981,
      "grad_norm": 0.6527172783528896,
      "learning_rate": 3.1077158893248284e-05,
      "loss": 1.1366,
      "num_input_tokens_seen": 37586964192,
      "step": 47774
    },
    {
      "epoch": 5.068427753023552,
      "grad_norm": 0.7770903630120406,
      "learning_rate": 3.107648476791183e-05,
      "loss": 1.1686,
      "num_input_tokens_seen": 37587750976,
      "step": 47775
    },
    {
      "epoch": 5.068533842563124,
      "grad_norm": 0.6877703289953432,
      "learning_rate": 3.1075810637879654e-05,
      "loss": 1.1526,
      "num_input_tokens_seen": 37588537648,
      "step": 47776
    },
    {
      "epoch": 5.068639932102695,
      "grad_norm": 0.7567586378323634,
      "learning_rate": 3.107513650315227e-05,
      "loss": 1.235,
      "num_input_tokens_seen": 37589324400,
      "step": 47777
    },
    {
      "epoch": 5.068746021642266,
      "grad_norm": 0.7013695612688365,
      "learning_rate": 3.1074462363730196e-05,
      "loss": 1.2193,
      "num_input_tokens_seen": 37590111120,
      "step": 47778
    },
    {
      "epoch": 5.068852111181838,
      "grad_norm": 0.5757047621534702,
      "learning_rate": 3.107378821961395e-05,
      "loss": 1.0885,
      "num_input_tokens_seen": 37590897920,
      "step": 47779
    },
    {
      "epoch": 5.068958200721409,
      "grad_norm": 0.6606345276866912,
      "learning_rate": 3.1073114070804064e-05,
      "loss": 1.0998,
      "num_input_tokens_seen": 37591684656,
      "step": 47780
    },
    {
      "epoch": 5.069064290260981,
      "grad_norm": 0.6432257692323876,
      "learning_rate": 3.1072439917301057e-05,
      "loss": 1.1359,
      "num_input_tokens_seen": 37592471408,
      "step": 47781
    },
    {
      "epoch": 5.069170379800552,
      "grad_norm": 0.5772469390113597,
      "learning_rate": 3.107176575910544e-05,
      "loss": 1.1908,
      "num_input_tokens_seen": 37593258176,
      "step": 47782
    },
    {
      "epoch": 5.069276469340123,
      "grad_norm": 0.5308040172150976,
      "learning_rate": 3.107109159621775e-05,
      "loss": 1.1329,
      "num_input_tokens_seen": 37594044928,
      "step": 47783
    },
    {
      "epoch": 5.069382558879695,
      "grad_norm": 0.6075653799728019,
      "learning_rate": 3.107041742863848e-05,
      "loss": 1.0721,
      "num_input_tokens_seen": 37594831792,
      "step": 47784
    },
    {
      "epoch": 5.069488648419266,
      "grad_norm": 0.6572168646308126,
      "learning_rate": 3.106974325636818e-05,
      "loss": 1.2126,
      "num_input_tokens_seen": 37595618560,
      "step": 47785
    },
    {
      "epoch": 5.0695947379588375,
      "grad_norm": 0.6068084847638984,
      "learning_rate": 3.1069069079407366e-05,
      "loss": 1.1236,
      "num_input_tokens_seen": 37596405424,
      "step": 47786
    },
    {
      "epoch": 5.069700827498409,
      "grad_norm": 0.7295340058002319,
      "learning_rate": 3.1068394897756545e-05,
      "loss": 1.1014,
      "num_input_tokens_seen": 37597192224,
      "step": 47787
    },
    {
      "epoch": 5.0698069170379805,
      "grad_norm": 0.697343832971045,
      "learning_rate": 3.106772071141625e-05,
      "loss": 1.2219,
      "num_input_tokens_seen": 37597978928,
      "step": 47788
    },
    {
      "epoch": 5.0699130065775515,
      "grad_norm": 0.6634514329554339,
      "learning_rate": 3.106704652038701e-05,
      "loss": 1.0709,
      "num_input_tokens_seen": 37598765792,
      "step": 47789
    },
    {
      "epoch": 5.0700190961171225,
      "grad_norm": 1.0542260393420457,
      "learning_rate": 3.1066372324669316e-05,
      "loss": 1.1596,
      "num_input_tokens_seen": 37599552576,
      "step": 47790
    },
    {
      "epoch": 5.0701251856566945,
      "grad_norm": 0.8131220039728344,
      "learning_rate": 3.1065698124263715e-05,
      "loss": 1.1488,
      "num_input_tokens_seen": 37600339392,
      "step": 47791
    },
    {
      "epoch": 5.0702312751962655,
      "grad_norm": 0.5891061225421521,
      "learning_rate": 3.106502391917072e-05,
      "loss": 0.9853,
      "num_input_tokens_seen": 37601126064,
      "step": 47792
    },
    {
      "epoch": 5.070337364735837,
      "grad_norm": 0.6561105828431503,
      "learning_rate": 3.106434970939086e-05,
      "loss": 1.1558,
      "num_input_tokens_seen": 37601912864,
      "step": 47793
    },
    {
      "epoch": 5.070443454275408,
      "grad_norm": 0.6672477332382163,
      "learning_rate": 3.1063675494924635e-05,
      "loss": 1.1929,
      "num_input_tokens_seen": 37602699632,
      "step": 47794
    },
    {
      "epoch": 5.0705495438149795,
      "grad_norm": 0.6481143054699832,
      "learning_rate": 3.106300127577259e-05,
      "loss": 1.2223,
      "num_input_tokens_seen": 37603486416,
      "step": 47795
    },
    {
      "epoch": 5.070655633354551,
      "grad_norm": 0.6653393342319092,
      "learning_rate": 3.106232705193524e-05,
      "loss": 1.1677,
      "num_input_tokens_seen": 37604273168,
      "step": 47796
    },
    {
      "epoch": 5.070761722894122,
      "grad_norm": 0.7465111883111919,
      "learning_rate": 3.1061652823413084e-05,
      "loss": 1.1667,
      "num_input_tokens_seen": 37605059888,
      "step": 47797
    },
    {
      "epoch": 5.070867812433694,
      "grad_norm": 0.6746308917086747,
      "learning_rate": 3.106097859020667e-05,
      "loss": 1.1526,
      "num_input_tokens_seen": 37605846576,
      "step": 47798
    },
    {
      "epoch": 5.070973901973265,
      "grad_norm": 0.6654860534206167,
      "learning_rate": 3.1060304352316506e-05,
      "loss": 1.1008,
      "num_input_tokens_seen": 37606633344,
      "step": 47799
    },
    {
      "epoch": 5.071079991512837,
      "grad_norm": 0.5589873670877874,
      "learning_rate": 3.105963010974312e-05,
      "loss": 1.0193,
      "num_input_tokens_seen": 37607420048,
      "step": 47800
    },
    {
      "epoch": 5.071186081052408,
      "grad_norm": 0.6553528836334147,
      "learning_rate": 3.1058955862487035e-05,
      "loss": 1.0799,
      "num_input_tokens_seen": 37608206880,
      "step": 47801
    },
    {
      "epoch": 5.071292170591979,
      "grad_norm": 0.6386971726779159,
      "learning_rate": 3.105828161054876e-05,
      "loss": 1.1899,
      "num_input_tokens_seen": 37608993664,
      "step": 47802
    },
    {
      "epoch": 5.071398260131551,
      "grad_norm": 0.6972808047009375,
      "learning_rate": 3.1057607353928825e-05,
      "loss": 1.0789,
      "num_input_tokens_seen": 37609780448,
      "step": 47803
    },
    {
      "epoch": 5.071504349671122,
      "grad_norm": 0.6969024169149306,
      "learning_rate": 3.105693309262775e-05,
      "loss": 1.0643,
      "num_input_tokens_seen": 37610567184,
      "step": 47804
    },
    {
      "epoch": 5.071610439210694,
      "grad_norm": 0.69075018188325,
      "learning_rate": 3.105625882664605e-05,
      "loss": 1.1382,
      "num_input_tokens_seen": 37611353920,
      "step": 47805
    },
    {
      "epoch": 5.071716528750265,
      "grad_norm": 0.864475518560269,
      "learning_rate": 3.105558455598425e-05,
      "loss": 1.1882,
      "num_input_tokens_seen": 37612140720,
      "step": 47806
    },
    {
      "epoch": 5.071822618289836,
      "grad_norm": 0.739687606920363,
      "learning_rate": 3.105491028064288e-05,
      "loss": 1.2727,
      "num_input_tokens_seen": 37612927504,
      "step": 47807
    },
    {
      "epoch": 5.071928707829408,
      "grad_norm": 0.6888534209581433,
      "learning_rate": 3.105423600062245e-05,
      "loss": 1.1545,
      "num_input_tokens_seen": 37613714288,
      "step": 47808
    },
    {
      "epoch": 5.072034797368979,
      "grad_norm": 0.5812007813848942,
      "learning_rate": 3.105356171592348e-05,
      "loss": 1.1803,
      "num_input_tokens_seen": 37614501024,
      "step": 47809
    },
    {
      "epoch": 5.072140886908551,
      "grad_norm": 0.6815684427363,
      "learning_rate": 3.10528874265465e-05,
      "loss": 1.1259,
      "num_input_tokens_seen": 37615287824,
      "step": 47810
    },
    {
      "epoch": 5.072246976448122,
      "grad_norm": 0.5839478606548522,
      "learning_rate": 3.105221313249202e-05,
      "loss": 1.0945,
      "num_input_tokens_seen": 37616074480,
      "step": 47811
    },
    {
      "epoch": 5.072353065987693,
      "grad_norm": 0.5767692188615099,
      "learning_rate": 3.1051538833760574e-05,
      "loss": 1.0616,
      "num_input_tokens_seen": 37616861216,
      "step": 47812
    },
    {
      "epoch": 5.072459155527265,
      "grad_norm": 0.6561475930361753,
      "learning_rate": 3.105086453035268e-05,
      "loss": 1.0895,
      "num_input_tokens_seen": 37617647968,
      "step": 47813
    },
    {
      "epoch": 5.072565245066836,
      "grad_norm": 0.6291790900655198,
      "learning_rate": 3.105019022226884e-05,
      "loss": 1.1303,
      "num_input_tokens_seen": 37618434832,
      "step": 47814
    },
    {
      "epoch": 5.072671334606408,
      "grad_norm": 0.5646940818519203,
      "learning_rate": 3.1049515909509605e-05,
      "loss": 1.1716,
      "num_input_tokens_seen": 37619221616,
      "step": 47815
    },
    {
      "epoch": 5.072777424145979,
      "grad_norm": 0.5990047792224606,
      "learning_rate": 3.104884159207547e-05,
      "loss": 1.1109,
      "num_input_tokens_seen": 37620008464,
      "step": 47816
    },
    {
      "epoch": 5.072883513685551,
      "grad_norm": 0.643126425481641,
      "learning_rate": 3.104816726996698e-05,
      "loss": 1.1425,
      "num_input_tokens_seen": 37620795200,
      "step": 47817
    },
    {
      "epoch": 5.072989603225122,
      "grad_norm": 0.6618839388288829,
      "learning_rate": 3.104749294318463e-05,
      "loss": 1.1783,
      "num_input_tokens_seen": 37621581920,
      "step": 47818
    },
    {
      "epoch": 5.073095692764693,
      "grad_norm": 1.131280097864303,
      "learning_rate": 3.104681861172897e-05,
      "loss": 1.1932,
      "num_input_tokens_seen": 37622368688,
      "step": 47819
    },
    {
      "epoch": 5.073201782304265,
      "grad_norm": 0.6557351374929488,
      "learning_rate": 3.10461442756005e-05,
      "loss": 1.1916,
      "num_input_tokens_seen": 37623155520,
      "step": 47820
    },
    {
      "epoch": 5.073307871843836,
      "grad_norm": 0.6635316704413627,
      "learning_rate": 3.1045469934799745e-05,
      "loss": 1.1759,
      "num_input_tokens_seen": 37623942176,
      "step": 47821
    },
    {
      "epoch": 5.073413961383408,
      "grad_norm": 0.9869052495840067,
      "learning_rate": 3.104479558932722e-05,
      "loss": 1.1628,
      "num_input_tokens_seen": 37624728960,
      "step": 47822
    },
    {
      "epoch": 5.073520050922979,
      "grad_norm": 0.56478152447808,
      "learning_rate": 3.104412123918347e-05,
      "loss": 1.1464,
      "num_input_tokens_seen": 37625515744,
      "step": 47823
    },
    {
      "epoch": 5.07362614046255,
      "grad_norm": 0.87589546083855,
      "learning_rate": 3.1043446884368995e-05,
      "loss": 1.1623,
      "num_input_tokens_seen": 37626302528,
      "step": 47824
    },
    {
      "epoch": 5.073732230002122,
      "grad_norm": 0.6111137638636565,
      "learning_rate": 3.104277252488432e-05,
      "loss": 1.0844,
      "num_input_tokens_seen": 37627089216,
      "step": 47825
    },
    {
      "epoch": 5.073838319541693,
      "grad_norm": 0.9434570142390833,
      "learning_rate": 3.1042098160729963e-05,
      "loss": 1.1837,
      "num_input_tokens_seen": 37627876016,
      "step": 47826
    },
    {
      "epoch": 5.073944409081265,
      "grad_norm": 0.6090752085689917,
      "learning_rate": 3.104142379190646e-05,
      "loss": 1.0958,
      "num_input_tokens_seen": 37628662832,
      "step": 47827
    },
    {
      "epoch": 5.074050498620836,
      "grad_norm": 0.735739677386916,
      "learning_rate": 3.1040749418414316e-05,
      "loss": 1.148,
      "num_input_tokens_seen": 37629449632,
      "step": 47828
    },
    {
      "epoch": 5.074156588160408,
      "grad_norm": 0.6225661776117181,
      "learning_rate": 3.1040075040254054e-05,
      "loss": 1.1327,
      "num_input_tokens_seen": 37630236336,
      "step": 47829
    },
    {
      "epoch": 5.074262677699979,
      "grad_norm": 0.7067679430898282,
      "learning_rate": 3.103940065742621e-05,
      "loss": 1.0974,
      "num_input_tokens_seen": 37631023056,
      "step": 47830
    },
    {
      "epoch": 5.07436876723955,
      "grad_norm": 0.6835635249354778,
      "learning_rate": 3.103872626993128e-05,
      "loss": 1.1326,
      "num_input_tokens_seen": 37631809856,
      "step": 47831
    },
    {
      "epoch": 5.074474856779122,
      "grad_norm": 0.7377378115460961,
      "learning_rate": 3.103805187776981e-05,
      "loss": 1.0814,
      "num_input_tokens_seen": 37632596656,
      "step": 47832
    },
    {
      "epoch": 5.074580946318693,
      "grad_norm": 0.549742543263341,
      "learning_rate": 3.103737748094231e-05,
      "loss": 0.989,
      "num_input_tokens_seen": 37633383472,
      "step": 47833
    },
    {
      "epoch": 5.074687035858265,
      "grad_norm": 0.6438162263970902,
      "learning_rate": 3.10367030794493e-05,
      "loss": 1.2309,
      "num_input_tokens_seen": 37634170160,
      "step": 47834
    },
    {
      "epoch": 5.074793125397836,
      "grad_norm": 0.7297223375131465,
      "learning_rate": 3.1036028673291306e-05,
      "loss": 1.2532,
      "num_input_tokens_seen": 37634956976,
      "step": 47835
    },
    {
      "epoch": 5.074899214937407,
      "grad_norm": 0.6720208904312236,
      "learning_rate": 3.1035354262468844e-05,
      "loss": 1.1887,
      "num_input_tokens_seen": 37635743744,
      "step": 47836
    },
    {
      "epoch": 5.075005304476979,
      "grad_norm": 0.80713152252582,
      "learning_rate": 3.1034679846982436e-05,
      "loss": 1.1399,
      "num_input_tokens_seen": 37636530528,
      "step": 47837
    },
    {
      "epoch": 5.07511139401655,
      "grad_norm": 0.6780682552907958,
      "learning_rate": 3.10340054268326e-05,
      "loss": 1.1717,
      "num_input_tokens_seen": 37637317296,
      "step": 47838
    },
    {
      "epoch": 5.075217483556122,
      "grad_norm": 0.982616971770607,
      "learning_rate": 3.103333100201987e-05,
      "loss": 1.1349,
      "num_input_tokens_seen": 37638104112,
      "step": 47839
    },
    {
      "epoch": 5.075323573095693,
      "grad_norm": 0.6890423790807524,
      "learning_rate": 3.1032656572544756e-05,
      "loss": 1.0832,
      "num_input_tokens_seen": 37638891024,
      "step": 47840
    },
    {
      "epoch": 5.075429662635264,
      "grad_norm": 0.9883965043150783,
      "learning_rate": 3.103198213840779e-05,
      "loss": 1.1509,
      "num_input_tokens_seen": 37639677808,
      "step": 47841
    },
    {
      "epoch": 5.075535752174836,
      "grad_norm": 0.7346429179794383,
      "learning_rate": 3.103130769960947e-05,
      "loss": 1.1804,
      "num_input_tokens_seen": 37640464544,
      "step": 47842
    },
    {
      "epoch": 5.075641841714407,
      "grad_norm": 0.7077085742427104,
      "learning_rate": 3.103063325615034e-05,
      "loss": 1.1663,
      "num_input_tokens_seen": 37641251360,
      "step": 47843
    },
    {
      "epoch": 5.075747931253979,
      "grad_norm": 0.7289511644743141,
      "learning_rate": 3.102995880803091e-05,
      "loss": 1.0333,
      "num_input_tokens_seen": 37642038112,
      "step": 47844
    },
    {
      "epoch": 5.07585402079355,
      "grad_norm": 0.8126987532233166,
      "learning_rate": 3.102928435525171e-05,
      "loss": 1.0966,
      "num_input_tokens_seen": 37642824944,
      "step": 47845
    },
    {
      "epoch": 5.0759601103331216,
      "grad_norm": 0.6559262430545839,
      "learning_rate": 3.102860989781325e-05,
      "loss": 1.1635,
      "num_input_tokens_seen": 37643611728,
      "step": 47846
    },
    {
      "epoch": 5.076066199872693,
      "grad_norm": 0.8522128706350339,
      "learning_rate": 3.102793543571606e-05,
      "loss": 1.1036,
      "num_input_tokens_seen": 37644398464,
      "step": 47847
    },
    {
      "epoch": 5.076172289412264,
      "grad_norm": 0.6809215286019195,
      "learning_rate": 3.102726096896066e-05,
      "loss": 1.1169,
      "num_input_tokens_seen": 37645185296,
      "step": 47848
    },
    {
      "epoch": 5.0762783789518355,
      "grad_norm": 0.6869241481751176,
      "learning_rate": 3.1026586497547574e-05,
      "loss": 1.0883,
      "num_input_tokens_seen": 37645972064,
      "step": 47849
    },
    {
      "epoch": 5.076384468491407,
      "grad_norm": 0.5972262950895119,
      "learning_rate": 3.102591202147732e-05,
      "loss": 1.0556,
      "num_input_tokens_seen": 37646758896,
      "step": 47850
    },
    {
      "epoch": 5.0764905580309785,
      "grad_norm": 0.5640730170963891,
      "learning_rate": 3.1025237540750404e-05,
      "loss": 1.1559,
      "num_input_tokens_seen": 37647545632,
      "step": 47851
    },
    {
      "epoch": 5.0765966475705495,
      "grad_norm": 0.8013141691575604,
      "learning_rate": 3.1024563055367366e-05,
      "loss": 1.1122,
      "num_input_tokens_seen": 37648332496,
      "step": 47852
    },
    {
      "epoch": 5.0767027371101205,
      "grad_norm": 0.687711654276292,
      "learning_rate": 3.102388856532873e-05,
      "loss": 1.2046,
      "num_input_tokens_seen": 37649119216,
      "step": 47853
    },
    {
      "epoch": 5.0768088266496925,
      "grad_norm": 0.7080307378388982,
      "learning_rate": 3.1023214070635e-05,
      "loss": 1.1325,
      "num_input_tokens_seen": 37649906064,
      "step": 47854
    },
    {
      "epoch": 5.0769149161892635,
      "grad_norm": 0.668607777857257,
      "learning_rate": 3.1022539571286714e-05,
      "loss": 1.0493,
      "num_input_tokens_seen": 37650692912,
      "step": 47855
    },
    {
      "epoch": 5.077021005728835,
      "grad_norm": 0.5806443078046613,
      "learning_rate": 3.102186506728439e-05,
      "loss": 1.181,
      "num_input_tokens_seen": 37651479648,
      "step": 47856
    },
    {
      "epoch": 5.077127095268406,
      "grad_norm": 0.7044182185758383,
      "learning_rate": 3.1021190558628535e-05,
      "loss": 1.1229,
      "num_input_tokens_seen": 37652266448,
      "step": 47857
    },
    {
      "epoch": 5.077233184807978,
      "grad_norm": 0.6747209891489712,
      "learning_rate": 3.102051604531969e-05,
      "loss": 1.1456,
      "num_input_tokens_seen": 37653053280,
      "step": 47858
    },
    {
      "epoch": 5.077339274347549,
      "grad_norm": 0.6298209108289201,
      "learning_rate": 3.101984152735836e-05,
      "loss": 1.1592,
      "num_input_tokens_seen": 37653840112,
      "step": 47859
    },
    {
      "epoch": 5.07744536388712,
      "grad_norm": 0.6560499963964477,
      "learning_rate": 3.101916700474507e-05,
      "loss": 1.0853,
      "num_input_tokens_seen": 37654626896,
      "step": 47860
    },
    {
      "epoch": 5.077551453426692,
      "grad_norm": 1.0317570056771959,
      "learning_rate": 3.101849247748035e-05,
      "loss": 1.188,
      "num_input_tokens_seen": 37655413600,
      "step": 47861
    },
    {
      "epoch": 5.077657542966263,
      "grad_norm": 0.5868013552530537,
      "learning_rate": 3.101781794556471e-05,
      "loss": 1.0695,
      "num_input_tokens_seen": 37656200432,
      "step": 47862
    },
    {
      "epoch": 5.077763632505835,
      "grad_norm": 1.317123585091992,
      "learning_rate": 3.101714340899869e-05,
      "loss": 1.2858,
      "num_input_tokens_seen": 37656987216,
      "step": 47863
    },
    {
      "epoch": 5.077869722045406,
      "grad_norm": 0.6068295233394023,
      "learning_rate": 3.101646886778279e-05,
      "loss": 1.0695,
      "num_input_tokens_seen": 37657774016,
      "step": 47864
    },
    {
      "epoch": 5.077975811584977,
      "grad_norm": 0.9835164334370716,
      "learning_rate": 3.1015794321917534e-05,
      "loss": 1.1745,
      "num_input_tokens_seen": 37658560720,
      "step": 47865
    },
    {
      "epoch": 5.078081901124549,
      "grad_norm": 0.6730115709292133,
      "learning_rate": 3.1015119771403455e-05,
      "loss": 1.1647,
      "num_input_tokens_seen": 37659347488,
      "step": 47866
    },
    {
      "epoch": 5.07818799066412,
      "grad_norm": 0.6173091563848732,
      "learning_rate": 3.101444521624107e-05,
      "loss": 1.1603,
      "num_input_tokens_seen": 37660134240,
      "step": 47867
    },
    {
      "epoch": 5.078294080203692,
      "grad_norm": 0.6671239953867076,
      "learning_rate": 3.101377065643089e-05,
      "loss": 1.1293,
      "num_input_tokens_seen": 37660921088,
      "step": 47868
    },
    {
      "epoch": 5.078400169743263,
      "grad_norm": 0.609526248062337,
      "learning_rate": 3.101309609197345e-05,
      "loss": 1.0671,
      "num_input_tokens_seen": 37661707888,
      "step": 47869
    },
    {
      "epoch": 5.078506259282834,
      "grad_norm": 0.5548188732489656,
      "learning_rate": 3.101242152286927e-05,
      "loss": 1.0571,
      "num_input_tokens_seen": 37662494720,
      "step": 47870
    },
    {
      "epoch": 5.078612348822406,
      "grad_norm": 1.0804316555603695,
      "learning_rate": 3.101174694911886e-05,
      "loss": 1.253,
      "num_input_tokens_seen": 37663281568,
      "step": 47871
    },
    {
      "epoch": 5.078718438361977,
      "grad_norm": 0.6608360583191305,
      "learning_rate": 3.1011072370722755e-05,
      "loss": 1.1266,
      "num_input_tokens_seen": 37664068272,
      "step": 47872
    },
    {
      "epoch": 5.078824527901549,
      "grad_norm": 0.7434282068037389,
      "learning_rate": 3.1010397787681466e-05,
      "loss": 1.1132,
      "num_input_tokens_seen": 37664855072,
      "step": 47873
    },
    {
      "epoch": 5.07893061744112,
      "grad_norm": 0.7263327650392088,
      "learning_rate": 3.100972319999551e-05,
      "loss": 1.1048,
      "num_input_tokens_seen": 37665641872,
      "step": 47874
    },
    {
      "epoch": 5.079036706980692,
      "grad_norm": 0.6323745142622252,
      "learning_rate": 3.100904860766543e-05,
      "loss": 1.1315,
      "num_input_tokens_seen": 37666428688,
      "step": 47875
    },
    {
      "epoch": 5.079142796520263,
      "grad_norm": 0.6923292177638617,
      "learning_rate": 3.100837401069172e-05,
      "loss": 1.1489,
      "num_input_tokens_seen": 37667215408,
      "step": 47876
    },
    {
      "epoch": 5.079248886059834,
      "grad_norm": 0.7440575021390687,
      "learning_rate": 3.100769940907492e-05,
      "loss": 1.1544,
      "num_input_tokens_seen": 37668002176,
      "step": 47877
    },
    {
      "epoch": 5.079354975599406,
      "grad_norm": 0.6736649835529426,
      "learning_rate": 3.100702480281555e-05,
      "loss": 1.116,
      "num_input_tokens_seen": 37668788992,
      "step": 47878
    },
    {
      "epoch": 5.079461065138977,
      "grad_norm": 0.7543024114421166,
      "learning_rate": 3.100635019191413e-05,
      "loss": 1.2014,
      "num_input_tokens_seen": 37669575712,
      "step": 47879
    },
    {
      "epoch": 5.079567154678549,
      "grad_norm": 0.748550683342571,
      "learning_rate": 3.100567557637117e-05,
      "loss": 1.0792,
      "num_input_tokens_seen": 37670362448,
      "step": 47880
    },
    {
      "epoch": 5.07967324421812,
      "grad_norm": 0.6008337129208661,
      "learning_rate": 3.100500095618721e-05,
      "loss": 1.0647,
      "num_input_tokens_seen": 37671149280,
      "step": 47881
    },
    {
      "epoch": 5.079779333757691,
      "grad_norm": 0.8453949765921269,
      "learning_rate": 3.1004326331362753e-05,
      "loss": 1.1705,
      "num_input_tokens_seen": 37671936016,
      "step": 47882
    },
    {
      "epoch": 5.079885423297263,
      "grad_norm": 0.6331787823287387,
      "learning_rate": 3.1003651701898326e-05,
      "loss": 1.1241,
      "num_input_tokens_seen": 37672722752,
      "step": 47883
    },
    {
      "epoch": 5.079991512836834,
      "grad_norm": 0.6082893388612762,
      "learning_rate": 3.100297706779446e-05,
      "loss": 1.2041,
      "num_input_tokens_seen": 37673509440,
      "step": 47884
    },
    {
      "epoch": 5.080097602376406,
      "grad_norm": 1.0999595208652884,
      "learning_rate": 3.1002302429051676e-05,
      "loss": 1.1691,
      "num_input_tokens_seen": 37674296192,
      "step": 47885
    },
    {
      "epoch": 5.080203691915977,
      "grad_norm": 0.8324554913828697,
      "learning_rate": 3.100162778567048e-05,
      "loss": 1.1405,
      "num_input_tokens_seen": 37675083024,
      "step": 47886
    },
    {
      "epoch": 5.080309781455549,
      "grad_norm": 0.7623976125901124,
      "learning_rate": 3.10009531376514e-05,
      "loss": 1.0766,
      "num_input_tokens_seen": 37675869760,
      "step": 47887
    },
    {
      "epoch": 5.08041587099512,
      "grad_norm": 0.6769035567012164,
      "learning_rate": 3.100027848499496e-05,
      "loss": 1.1913,
      "num_input_tokens_seen": 37676656448,
      "step": 47888
    },
    {
      "epoch": 5.080521960534691,
      "grad_norm": 0.5682880516862338,
      "learning_rate": 3.099960382770169e-05,
      "loss": 1.0784,
      "num_input_tokens_seen": 37677443296,
      "step": 47889
    },
    {
      "epoch": 5.080628050074263,
      "grad_norm": 0.7432178275032586,
      "learning_rate": 3.09989291657721e-05,
      "loss": 1.2395,
      "num_input_tokens_seen": 37678230112,
      "step": 47890
    },
    {
      "epoch": 5.080734139613834,
      "grad_norm": 0.5996343128796185,
      "learning_rate": 3.09982544992067e-05,
      "loss": 1.1895,
      "num_input_tokens_seen": 37679016864,
      "step": 47891
    },
    {
      "epoch": 5.080840229153406,
      "grad_norm": 0.7000396243312835,
      "learning_rate": 3.099757982800604e-05,
      "loss": 1.1402,
      "num_input_tokens_seen": 37679803728,
      "step": 47892
    },
    {
      "epoch": 5.080946318692977,
      "grad_norm": 0.5650132777028181,
      "learning_rate": 3.0996905152170616e-05,
      "loss": 1.0261,
      "num_input_tokens_seen": 37680590512,
      "step": 47893
    },
    {
      "epoch": 5.081052408232548,
      "grad_norm": 0.7782292485975015,
      "learning_rate": 3.099623047170097e-05,
      "loss": 1.1296,
      "num_input_tokens_seen": 37681377264,
      "step": 47894
    },
    {
      "epoch": 5.08115849777212,
      "grad_norm": 0.69473868996078,
      "learning_rate": 3.099555578659761e-05,
      "loss": 1.1387,
      "num_input_tokens_seen": 37682164080,
      "step": 47895
    },
    {
      "epoch": 5.081264587311691,
      "grad_norm": 0.6617709632174571,
      "learning_rate": 3.0994881096861055e-05,
      "loss": 1.1148,
      "num_input_tokens_seen": 37682950864,
      "step": 47896
    },
    {
      "epoch": 5.081370676851263,
      "grad_norm": 0.9714348805623126,
      "learning_rate": 3.0994206402491834e-05,
      "loss": 1.1663,
      "num_input_tokens_seen": 37683737568,
      "step": 47897
    },
    {
      "epoch": 5.081476766390834,
      "grad_norm": 0.5190580613718567,
      "learning_rate": 3.099353170349047e-05,
      "loss": 1.145,
      "num_input_tokens_seen": 37684524336,
      "step": 47898
    },
    {
      "epoch": 5.081582855930405,
      "grad_norm": 0.8773703764768971,
      "learning_rate": 3.099285699985747e-05,
      "loss": 1.1731,
      "num_input_tokens_seen": 37685311072,
      "step": 47899
    },
    {
      "epoch": 5.081688945469977,
      "grad_norm": 0.5513472141636186,
      "learning_rate": 3.099218229159338e-05,
      "loss": 1.1095,
      "num_input_tokens_seen": 37686097824,
      "step": 47900
    },
    {
      "epoch": 5.081795035009548,
      "grad_norm": 0.6626469597837942,
      "learning_rate": 3.09915075786987e-05,
      "loss": 1.1143,
      "num_input_tokens_seen": 37686884688,
      "step": 47901
    },
    {
      "epoch": 5.08190112454912,
      "grad_norm": 0.6190196371171836,
      "learning_rate": 3.0990832861173955e-05,
      "loss": 1.1763,
      "num_input_tokens_seen": 37687671392,
      "step": 47902
    },
    {
      "epoch": 5.082007214088691,
      "grad_norm": 0.8041200780686698,
      "learning_rate": 3.0990158139019674e-05,
      "loss": 1.1828,
      "num_input_tokens_seen": 37688458128,
      "step": 47903
    },
    {
      "epoch": 5.082113303628263,
      "grad_norm": 1.2910890539713527,
      "learning_rate": 3.098948341223637e-05,
      "loss": 1.1512,
      "num_input_tokens_seen": 37689244928,
      "step": 47904
    },
    {
      "epoch": 5.082219393167834,
      "grad_norm": 0.7906952942765274,
      "learning_rate": 3.098880868082458e-05,
      "loss": 1.1924,
      "num_input_tokens_seen": 37690031632,
      "step": 47905
    },
    {
      "epoch": 5.082325482707405,
      "grad_norm": 0.9489181205657136,
      "learning_rate": 3.098813394478481e-05,
      "loss": 1.1726,
      "num_input_tokens_seen": 37690818352,
      "step": 47906
    },
    {
      "epoch": 5.082431572246977,
      "grad_norm": 0.7477645378133355,
      "learning_rate": 3.098745920411759e-05,
      "loss": 1.0891,
      "num_input_tokens_seen": 37691605200,
      "step": 47907
    },
    {
      "epoch": 5.082537661786548,
      "grad_norm": 0.6593124618695188,
      "learning_rate": 3.0986784458823425e-05,
      "loss": 1.1251,
      "num_input_tokens_seen": 37692391872,
      "step": 47908
    },
    {
      "epoch": 5.08264375132612,
      "grad_norm": 0.6825885581723454,
      "learning_rate": 3.0986109708902856e-05,
      "loss": 1.2099,
      "num_input_tokens_seen": 37693178608,
      "step": 47909
    },
    {
      "epoch": 5.082749840865691,
      "grad_norm": 0.655021782141632,
      "learning_rate": 3.0985434954356395e-05,
      "loss": 1.1081,
      "num_input_tokens_seen": 37693965344,
      "step": 47910
    },
    {
      "epoch": 5.082855930405262,
      "grad_norm": 0.6384064870609256,
      "learning_rate": 3.0984760195184566e-05,
      "loss": 1.1934,
      "num_input_tokens_seen": 37694752112,
      "step": 47911
    },
    {
      "epoch": 5.0829620199448335,
      "grad_norm": 0.7659328498725795,
      "learning_rate": 3.0984085431387896e-05,
      "loss": 1.173,
      "num_input_tokens_seen": 37695539056,
      "step": 47912
    },
    {
      "epoch": 5.083068109484405,
      "grad_norm": 0.7731035716219292,
      "learning_rate": 3.0983410662966894e-05,
      "loss": 1.1692,
      "num_input_tokens_seen": 37696325840,
      "step": 47913
    },
    {
      "epoch": 5.0831741990239765,
      "grad_norm": 0.7641433735593668,
      "learning_rate": 3.098273588992208e-05,
      "loss": 1.1699,
      "num_input_tokens_seen": 37697112496,
      "step": 47914
    },
    {
      "epoch": 5.0832802885635475,
      "grad_norm": 0.9225890525316152,
      "learning_rate": 3.098206111225399e-05,
      "loss": 1.1695,
      "num_input_tokens_seen": 37697899248,
      "step": 47915
    },
    {
      "epoch": 5.083386378103119,
      "grad_norm": 0.6767810996851347,
      "learning_rate": 3.0981386329963144e-05,
      "loss": 1.2255,
      "num_input_tokens_seen": 37698685952,
      "step": 47916
    },
    {
      "epoch": 5.0834924676426905,
      "grad_norm": 0.7040314511613185,
      "learning_rate": 3.098071154305006e-05,
      "loss": 1.113,
      "num_input_tokens_seen": 37699472752,
      "step": 47917
    },
    {
      "epoch": 5.0835985571822615,
      "grad_norm": 0.6209152005732373,
      "learning_rate": 3.0980036751515254e-05,
      "loss": 1.1291,
      "num_input_tokens_seen": 37700259440,
      "step": 47918
    },
    {
      "epoch": 5.083704646721833,
      "grad_norm": 0.5930046331944019,
      "learning_rate": 3.097936195535924e-05,
      "loss": 1.0558,
      "num_input_tokens_seen": 37701046176,
      "step": 47919
    },
    {
      "epoch": 5.0838107362614045,
      "grad_norm": 0.7991087315006419,
      "learning_rate": 3.0978687154582564e-05,
      "loss": 1.1027,
      "num_input_tokens_seen": 37701832880,
      "step": 47920
    },
    {
      "epoch": 5.083916825800976,
      "grad_norm": 0.8048453672681198,
      "learning_rate": 3.0978012349185734e-05,
      "loss": 1.197,
      "num_input_tokens_seen": 37702619616,
      "step": 47921
    },
    {
      "epoch": 5.084022915340547,
      "grad_norm": 0.6460373133252616,
      "learning_rate": 3.097733753916927e-05,
      "loss": 1.1273,
      "num_input_tokens_seen": 37703406304,
      "step": 47922
    },
    {
      "epoch": 5.084129004880118,
      "grad_norm": 0.5975526660349779,
      "learning_rate": 3.097666272453369e-05,
      "loss": 1.1206,
      "num_input_tokens_seen": 37704193040,
      "step": 47923
    },
    {
      "epoch": 5.08423509441969,
      "grad_norm": 0.6022338769962444,
      "learning_rate": 3.097598790527953e-05,
      "loss": 1.1438,
      "num_input_tokens_seen": 37704979776,
      "step": 47924
    },
    {
      "epoch": 5.084341183959261,
      "grad_norm": 0.5979490822093396,
      "learning_rate": 3.097531308140729e-05,
      "loss": 1.0722,
      "num_input_tokens_seen": 37705766576,
      "step": 47925
    },
    {
      "epoch": 5.084447273498833,
      "grad_norm": 0.6538012235288923,
      "learning_rate": 3.09746382529175e-05,
      "loss": 1.1779,
      "num_input_tokens_seen": 37706553328,
      "step": 47926
    },
    {
      "epoch": 5.084553363038404,
      "grad_norm": 0.778771400089513,
      "learning_rate": 3.0973963419810695e-05,
      "loss": 1.1029,
      "num_input_tokens_seen": 37707340144,
      "step": 47927
    },
    {
      "epoch": 5.084659452577976,
      "grad_norm": 0.6599734954385787,
      "learning_rate": 3.097328858208738e-05,
      "loss": 1.1523,
      "num_input_tokens_seen": 37708126944,
      "step": 47928
    },
    {
      "epoch": 5.084765542117547,
      "grad_norm": 0.7108461624623736,
      "learning_rate": 3.097261373974809e-05,
      "loss": 1.2402,
      "num_input_tokens_seen": 37708913600,
      "step": 47929
    },
    {
      "epoch": 5.084871631657118,
      "grad_norm": 0.6137801287040994,
      "learning_rate": 3.097193889279333e-05,
      "loss": 1.1633,
      "num_input_tokens_seen": 37709700368,
      "step": 47930
    },
    {
      "epoch": 5.08497772119669,
      "grad_norm": 0.6711364346708976,
      "learning_rate": 3.0971264041223644e-05,
      "loss": 1.1354,
      "num_input_tokens_seen": 37710487232,
      "step": 47931
    },
    {
      "epoch": 5.085083810736261,
      "grad_norm": 0.6072831087835985,
      "learning_rate": 3.097058918503953e-05,
      "loss": 1.2067,
      "num_input_tokens_seen": 37711273872,
      "step": 47932
    },
    {
      "epoch": 5.085189900275833,
      "grad_norm": 0.5510400121052896,
      "learning_rate": 3.096991432424153e-05,
      "loss": 1.0365,
      "num_input_tokens_seen": 37712060768,
      "step": 47933
    },
    {
      "epoch": 5.085295989815404,
      "grad_norm": 0.6363437137170882,
      "learning_rate": 3.096923945883014e-05,
      "loss": 1.1836,
      "num_input_tokens_seen": 37712847520,
      "step": 47934
    },
    {
      "epoch": 5.085402079354975,
      "grad_norm": 0.6362998218286957,
      "learning_rate": 3.096856458880591e-05,
      "loss": 1.1506,
      "num_input_tokens_seen": 37713634272,
      "step": 47935
    },
    {
      "epoch": 5.085508168894547,
      "grad_norm": 0.6868461162859328,
      "learning_rate": 3.096788971416935e-05,
      "loss": 1.1483,
      "num_input_tokens_seen": 37714421056,
      "step": 47936
    },
    {
      "epoch": 5.085614258434118,
      "grad_norm": 0.6062907741012309,
      "learning_rate": 3.096721483492097e-05,
      "loss": 1.1497,
      "num_input_tokens_seen": 37715207744,
      "step": 47937
    },
    {
      "epoch": 5.08572034797369,
      "grad_norm": 0.7802435275914652,
      "learning_rate": 3.09665399510613e-05,
      "loss": 1.1391,
      "num_input_tokens_seen": 37715994512,
      "step": 47938
    },
    {
      "epoch": 5.085826437513261,
      "grad_norm": 0.5522405066792668,
      "learning_rate": 3.0965865062590875e-05,
      "loss": 1.1179,
      "num_input_tokens_seen": 37716781312,
      "step": 47939
    },
    {
      "epoch": 5.085932527052832,
      "grad_norm": 0.5188879885653063,
      "learning_rate": 3.09651901695102e-05,
      "loss": 1.1246,
      "num_input_tokens_seen": 37717568096,
      "step": 47940
    },
    {
      "epoch": 5.086038616592404,
      "grad_norm": 0.7000635871426543,
      "learning_rate": 3.09645152718198e-05,
      "loss": 1.1796,
      "num_input_tokens_seen": 37718354832,
      "step": 47941
    },
    {
      "epoch": 5.086144706131975,
      "grad_norm": 0.5485262271900956,
      "learning_rate": 3.0963840369520196e-05,
      "loss": 1.0765,
      "num_input_tokens_seen": 37719141584,
      "step": 47942
    },
    {
      "epoch": 5.086250795671547,
      "grad_norm": 0.6301716689271085,
      "learning_rate": 3.096316546261191e-05,
      "loss": 1.1481,
      "num_input_tokens_seen": 37719928352,
      "step": 47943
    },
    {
      "epoch": 5.086356885211118,
      "grad_norm": 0.5492016682728821,
      "learning_rate": 3.096249055109547e-05,
      "loss": 1.1583,
      "num_input_tokens_seen": 37720715120,
      "step": 47944
    },
    {
      "epoch": 5.08646297475069,
      "grad_norm": 0.6131503500762266,
      "learning_rate": 3.0961815634971385e-05,
      "loss": 1.1402,
      "num_input_tokens_seen": 37721501888,
      "step": 47945
    },
    {
      "epoch": 5.086569064290261,
      "grad_norm": 0.5761689328329261,
      "learning_rate": 3.096114071424019e-05,
      "loss": 1.1174,
      "num_input_tokens_seen": 37722288624,
      "step": 47946
    },
    {
      "epoch": 5.086675153829832,
      "grad_norm": 0.6560675256697092,
      "learning_rate": 3.09604657889024e-05,
      "loss": 1.1659,
      "num_input_tokens_seen": 37723075392,
      "step": 47947
    },
    {
      "epoch": 5.086781243369404,
      "grad_norm": 0.6691847010004587,
      "learning_rate": 3.095979085895853e-05,
      "loss": 1.2031,
      "num_input_tokens_seen": 37723862096,
      "step": 47948
    },
    {
      "epoch": 5.086887332908975,
      "grad_norm": 0.6937215028687359,
      "learning_rate": 3.0959115924409116e-05,
      "loss": 1.1054,
      "num_input_tokens_seen": 37724648960,
      "step": 47949
    },
    {
      "epoch": 5.086993422448547,
      "grad_norm": 0.5732695470121283,
      "learning_rate": 3.0958440985254665e-05,
      "loss": 1.1076,
      "num_input_tokens_seen": 37725435808,
      "step": 47950
    },
    {
      "epoch": 5.087099511988118,
      "grad_norm": 0.7315019247613808,
      "learning_rate": 3.0957766041495714e-05,
      "loss": 1.1827,
      "num_input_tokens_seen": 37726222560,
      "step": 47951
    },
    {
      "epoch": 5.087205601527689,
      "grad_norm": 0.699110604677946,
      "learning_rate": 3.0957091093132774e-05,
      "loss": 1.1364,
      "num_input_tokens_seen": 37727009296,
      "step": 47952
    },
    {
      "epoch": 5.087311691067261,
      "grad_norm": 0.6486065171165128,
      "learning_rate": 3.0956416140166366e-05,
      "loss": 1.1532,
      "num_input_tokens_seen": 37727795936,
      "step": 47953
    },
    {
      "epoch": 5.087417780606832,
      "grad_norm": 0.722628839387878,
      "learning_rate": 3.095574118259701e-05,
      "loss": 1.1655,
      "num_input_tokens_seen": 37728582736,
      "step": 47954
    },
    {
      "epoch": 5.087523870146404,
      "grad_norm": 0.6533366731871886,
      "learning_rate": 3.0955066220425245e-05,
      "loss": 1.066,
      "num_input_tokens_seen": 37729369536,
      "step": 47955
    },
    {
      "epoch": 5.087629959685975,
      "grad_norm": 0.790883680954057,
      "learning_rate": 3.095439125365157e-05,
      "loss": 1.1901,
      "num_input_tokens_seen": 37730156272,
      "step": 47956
    },
    {
      "epoch": 5.087736049225547,
      "grad_norm": 0.7120462956962513,
      "learning_rate": 3.095371628227652e-05,
      "loss": 1.101,
      "num_input_tokens_seen": 37730943040,
      "step": 47957
    },
    {
      "epoch": 5.087842138765118,
      "grad_norm": 1.1342799468246054,
      "learning_rate": 3.095304130630061e-05,
      "loss": 1.1969,
      "num_input_tokens_seen": 37731729824,
      "step": 47958
    },
    {
      "epoch": 5.087948228304689,
      "grad_norm": 0.6919103735528266,
      "learning_rate": 3.095236632572437e-05,
      "loss": 1.0728,
      "num_input_tokens_seen": 37732516544,
      "step": 47959
    },
    {
      "epoch": 5.088054317844261,
      "grad_norm": 0.6014719696126667,
      "learning_rate": 3.095169134054831e-05,
      "loss": 1.1198,
      "num_input_tokens_seen": 37733303232,
      "step": 47960
    },
    {
      "epoch": 5.088160407383832,
      "grad_norm": 1.0180583520692728,
      "learning_rate": 3.095101635077295e-05,
      "loss": 1.0788,
      "num_input_tokens_seen": 37734090112,
      "step": 47961
    },
    {
      "epoch": 5.088266496923404,
      "grad_norm": 0.5548807626961341,
      "learning_rate": 3.095034135639883e-05,
      "loss": 1.135,
      "num_input_tokens_seen": 37734876832,
      "step": 47962
    },
    {
      "epoch": 5.088372586462975,
      "grad_norm": 0.6310117486922053,
      "learning_rate": 3.094966635742646e-05,
      "loss": 1.1205,
      "num_input_tokens_seen": 37735663632,
      "step": 47963
    },
    {
      "epoch": 5.088478676002546,
      "grad_norm": 0.6414180417596175,
      "learning_rate": 3.094899135385637e-05,
      "loss": 1.1156,
      "num_input_tokens_seen": 37736450384,
      "step": 47964
    },
    {
      "epoch": 5.088584765542118,
      "grad_norm": 0.836554938113181,
      "learning_rate": 3.0948316345689054e-05,
      "loss": 1.1237,
      "num_input_tokens_seen": 37737237072,
      "step": 47965
    },
    {
      "epoch": 5.088690855081689,
      "grad_norm": 0.6699883942039239,
      "learning_rate": 3.094764133292507e-05,
      "loss": 1.1,
      "num_input_tokens_seen": 37738023856,
      "step": 47966
    },
    {
      "epoch": 5.088796944621261,
      "grad_norm": 0.8075743130003064,
      "learning_rate": 3.094696631556492e-05,
      "loss": 1.1945,
      "num_input_tokens_seen": 37738810576,
      "step": 47967
    },
    {
      "epoch": 5.088903034160832,
      "grad_norm": 0.663860529829583,
      "learning_rate": 3.094629129360912e-05,
      "loss": 1.1663,
      "num_input_tokens_seen": 37739597232,
      "step": 47968
    },
    {
      "epoch": 5.089009123700403,
      "grad_norm": 0.6157362466524434,
      "learning_rate": 3.0945616267058214e-05,
      "loss": 1.2277,
      "num_input_tokens_seen": 37740383968,
      "step": 47969
    },
    {
      "epoch": 5.089115213239975,
      "grad_norm": 0.7451597027559278,
      "learning_rate": 3.0944941235912704e-05,
      "loss": 1.0922,
      "num_input_tokens_seen": 37741170688,
      "step": 47970
    },
    {
      "epoch": 5.089221302779546,
      "grad_norm": 0.6107434897345784,
      "learning_rate": 3.094426620017312e-05,
      "loss": 1.154,
      "num_input_tokens_seen": 37741957472,
      "step": 47971
    },
    {
      "epoch": 5.089327392319118,
      "grad_norm": 0.5796204143869286,
      "learning_rate": 3.094359115983998e-05,
      "loss": 1.1122,
      "num_input_tokens_seen": 37742744096,
      "step": 47972
    },
    {
      "epoch": 5.089433481858689,
      "grad_norm": 0.7411910111426746,
      "learning_rate": 3.0942916114913804e-05,
      "loss": 1.2031,
      "num_input_tokens_seen": 37743530848,
      "step": 47973
    },
    {
      "epoch": 5.0895395713982605,
      "grad_norm": 0.7059172155615268,
      "learning_rate": 3.094224106539512e-05,
      "loss": 1.2603,
      "num_input_tokens_seen": 37744317568,
      "step": 47974
    },
    {
      "epoch": 5.0896456609378316,
      "grad_norm": 0.6355837502381084,
      "learning_rate": 3.094156601128444e-05,
      "loss": 1.1222,
      "num_input_tokens_seen": 37745104304,
      "step": 47975
    },
    {
      "epoch": 5.089751750477403,
      "grad_norm": 0.7040641142193274,
      "learning_rate": 3.09408909525823e-05,
      "loss": 1.0605,
      "num_input_tokens_seen": 37745891104,
      "step": 47976
    },
    {
      "epoch": 5.0898578400169745,
      "grad_norm": 0.6925953932307121,
      "learning_rate": 3.0940215889289205e-05,
      "loss": 1.1734,
      "num_input_tokens_seen": 37746677856,
      "step": 47977
    },
    {
      "epoch": 5.0899639295565455,
      "grad_norm": 0.6041246249681803,
      "learning_rate": 3.0939540821405695e-05,
      "loss": 1.1294,
      "num_input_tokens_seen": 37747464624,
      "step": 47978
    },
    {
      "epoch": 5.0900700190961174,
      "grad_norm": 0.6617654278246531,
      "learning_rate": 3.093886574893228e-05,
      "loss": 1.1139,
      "num_input_tokens_seen": 37748251296,
      "step": 47979
    },
    {
      "epoch": 5.0901761086356885,
      "grad_norm": 0.6360836001149432,
      "learning_rate": 3.093819067186948e-05,
      "loss": 1.1227,
      "num_input_tokens_seen": 37749038096,
      "step": 47980
    },
    {
      "epoch": 5.0902821981752595,
      "grad_norm": 0.5886563992098262,
      "learning_rate": 3.0937515590217824e-05,
      "loss": 1.1578,
      "num_input_tokens_seen": 37749824752,
      "step": 47981
    },
    {
      "epoch": 5.090388287714831,
      "grad_norm": 0.6834115605143395,
      "learning_rate": 3.0936840503977835e-05,
      "loss": 1.1179,
      "num_input_tokens_seen": 37750611552,
      "step": 47982
    },
    {
      "epoch": 5.0904943772544025,
      "grad_norm": 0.6282158674608003,
      "learning_rate": 3.093616541315002e-05,
      "loss": 1.1993,
      "num_input_tokens_seen": 37751398416,
      "step": 47983
    },
    {
      "epoch": 5.090600466793974,
      "grad_norm": 0.6225154983157076,
      "learning_rate": 3.0935490317734915e-05,
      "loss": 1.2627,
      "num_input_tokens_seen": 37752185072,
      "step": 47984
    },
    {
      "epoch": 5.090706556333545,
      "grad_norm": 0.8913078826036588,
      "learning_rate": 3.0934815217733046e-05,
      "loss": 1.1836,
      "num_input_tokens_seen": 37752971840,
      "step": 47985
    },
    {
      "epoch": 5.090812645873117,
      "grad_norm": 0.6016378352665722,
      "learning_rate": 3.093414011314491e-05,
      "loss": 1.1004,
      "num_input_tokens_seen": 37753758656,
      "step": 47986
    },
    {
      "epoch": 5.090918735412688,
      "grad_norm": 1.2297392584938864,
      "learning_rate": 3.093346500397105e-05,
      "loss": 1.1687,
      "num_input_tokens_seen": 37754545424,
      "step": 47987
    },
    {
      "epoch": 5.091024824952259,
      "grad_norm": 0.6743293566526114,
      "learning_rate": 3.093278989021199e-05,
      "loss": 1.0745,
      "num_input_tokens_seen": 37755332224,
      "step": 47988
    },
    {
      "epoch": 5.091130914491831,
      "grad_norm": 0.852051236360583,
      "learning_rate": 3.093211477186824e-05,
      "loss": 1.1563,
      "num_input_tokens_seen": 37756118848,
      "step": 47989
    },
    {
      "epoch": 5.091237004031402,
      "grad_norm": 1.09531250269114,
      "learning_rate": 3.093143964894032e-05,
      "loss": 1.2531,
      "num_input_tokens_seen": 37756905616,
      "step": 47990
    },
    {
      "epoch": 5.091343093570974,
      "grad_norm": 0.6558440837927529,
      "learning_rate": 3.093076452142876e-05,
      "loss": 1.1261,
      "num_input_tokens_seen": 37757692432,
      "step": 47991
    },
    {
      "epoch": 5.091449183110545,
      "grad_norm": 0.8048506843930132,
      "learning_rate": 3.093008938933408e-05,
      "loss": 1.1205,
      "num_input_tokens_seen": 37758479184,
      "step": 47992
    },
    {
      "epoch": 5.091555272650116,
      "grad_norm": 0.586742897502362,
      "learning_rate": 3.092941425265681e-05,
      "loss": 1.1814,
      "num_input_tokens_seen": 37759265856,
      "step": 47993
    },
    {
      "epoch": 5.091661362189688,
      "grad_norm": 0.6359361799893312,
      "learning_rate": 3.092873911139745e-05,
      "loss": 1.2019,
      "num_input_tokens_seen": 37760052656,
      "step": 47994
    },
    {
      "epoch": 5.091767451729259,
      "grad_norm": 0.6610870700567145,
      "learning_rate": 3.092806396555654e-05,
      "loss": 1.1048,
      "num_input_tokens_seen": 37760839376,
      "step": 47995
    },
    {
      "epoch": 5.091873541268831,
      "grad_norm": 0.7565765861082758,
      "learning_rate": 3.092738881513459e-05,
      "loss": 1.051,
      "num_input_tokens_seen": 37761626144,
      "step": 47996
    },
    {
      "epoch": 5.091979630808402,
      "grad_norm": 0.6621319225954196,
      "learning_rate": 3.092671366013213e-05,
      "loss": 1.0904,
      "num_input_tokens_seen": 37762412896,
      "step": 47997
    },
    {
      "epoch": 5.092085720347974,
      "grad_norm": 0.7625086887488223,
      "learning_rate": 3.092603850054969e-05,
      "loss": 1.0705,
      "num_input_tokens_seen": 37763199744,
      "step": 47998
    },
    {
      "epoch": 5.092191809887545,
      "grad_norm": 0.5840853632774258,
      "learning_rate": 3.092536333638777e-05,
      "loss": 1.0722,
      "num_input_tokens_seen": 37763986576,
      "step": 47999
    },
    {
      "epoch": 5.092297899427116,
      "grad_norm": 0.6701807624648053,
      "learning_rate": 3.09246881676469e-05,
      "loss": 1.1093,
      "num_input_tokens_seen": 37764773328,
      "step": 48000
    },
    {
      "epoch": 5.092297899427116,
      "eval_loss": 1.5660181045532227,
      "eval_runtime": 65.1302,
      "eval_samples_per_second": 46.062,
      "eval_steps_per_second": 0.491,
      "num_input_tokens_seen": 37764773328,
      "step": 48000
    },
    {
      "epoch": 5.092403988966688,
      "grad_norm": 0.7220610750032388,
      "learning_rate": 3.0924012994327616e-05,
      "loss": 1.1742,
      "num_input_tokens_seen": 37765560048,
      "step": 48001
    },
    {
      "epoch": 5.092510078506259,
      "grad_norm": 0.9438273162469639,
      "learning_rate": 3.092333781643043e-05,
      "loss": 1.151,
      "num_input_tokens_seen": 37766346800,
      "step": 48002
    },
    {
      "epoch": 5.092616168045831,
      "grad_norm": 0.7964910757941753,
      "learning_rate": 3.092266263395585e-05,
      "loss": 1.1207,
      "num_input_tokens_seen": 37767133600,
      "step": 48003
    },
    {
      "epoch": 5.092722257585402,
      "grad_norm": 0.9524721789982237,
      "learning_rate": 3.092198744690442e-05,
      "loss": 1.1982,
      "num_input_tokens_seen": 37767920320,
      "step": 48004
    },
    {
      "epoch": 5.092828347124973,
      "grad_norm": 0.6092294573044111,
      "learning_rate": 3.0921312255276646e-05,
      "loss": 1.1845,
      "num_input_tokens_seen": 37768707120,
      "step": 48005
    },
    {
      "epoch": 5.092934436664545,
      "grad_norm": 0.9504186234784527,
      "learning_rate": 3.092063705907306e-05,
      "loss": 1.19,
      "num_input_tokens_seen": 37769493936,
      "step": 48006
    },
    {
      "epoch": 5.093040526204116,
      "grad_norm": 0.6803160805552158,
      "learning_rate": 3.091996185829418e-05,
      "loss": 1.1437,
      "num_input_tokens_seen": 37770280768,
      "step": 48007
    },
    {
      "epoch": 5.093146615743688,
      "grad_norm": 0.9268287763826584,
      "learning_rate": 3.091928665294051e-05,
      "loss": 1.169,
      "num_input_tokens_seen": 37771067632,
      "step": 48008
    },
    {
      "epoch": 5.093252705283259,
      "grad_norm": 0.78034007668222,
      "learning_rate": 3.091861144301261e-05,
      "loss": 1.1528,
      "num_input_tokens_seen": 37771854288,
      "step": 48009
    },
    {
      "epoch": 5.09335879482283,
      "grad_norm": 0.7145602384237317,
      "learning_rate": 3.091793622851098e-05,
      "loss": 1.1368,
      "num_input_tokens_seen": 37772641024,
      "step": 48010
    },
    {
      "epoch": 5.093464884362402,
      "grad_norm": 1.1844239041886553,
      "learning_rate": 3.091726100943613e-05,
      "loss": 1.2161,
      "num_input_tokens_seen": 37773427696,
      "step": 48011
    },
    {
      "epoch": 5.093570973901973,
      "grad_norm": 0.8097185213630884,
      "learning_rate": 3.09165857857886e-05,
      "loss": 1.1476,
      "num_input_tokens_seen": 37774214464,
      "step": 48012
    },
    {
      "epoch": 5.093677063441545,
      "grad_norm": 0.639201884953655,
      "learning_rate": 3.091591055756892e-05,
      "loss": 1.2108,
      "num_input_tokens_seen": 37775001232,
      "step": 48013
    },
    {
      "epoch": 5.093783152981116,
      "grad_norm": 0.9847256843171167,
      "learning_rate": 3.091523532477757e-05,
      "loss": 1.1541,
      "num_input_tokens_seen": 37775787952,
      "step": 48014
    },
    {
      "epoch": 5.093889242520688,
      "grad_norm": 0.7012545262748544,
      "learning_rate": 3.091456008741512e-05,
      "loss": 1.1544,
      "num_input_tokens_seen": 37776574656,
      "step": 48015
    },
    {
      "epoch": 5.093995332060259,
      "grad_norm": 0.9314613986659315,
      "learning_rate": 3.091388484548207e-05,
      "loss": 1.1483,
      "num_input_tokens_seen": 37777361328,
      "step": 48016
    },
    {
      "epoch": 5.09410142159983,
      "grad_norm": 0.8371417926964757,
      "learning_rate": 3.0913209598978934e-05,
      "loss": 1.0678,
      "num_input_tokens_seen": 37778148144,
      "step": 48017
    },
    {
      "epoch": 5.094207511139402,
      "grad_norm": 0.66179993304498,
      "learning_rate": 3.091253434790625e-05,
      "loss": 1.1097,
      "num_input_tokens_seen": 37778934864,
      "step": 48018
    },
    {
      "epoch": 5.094313600678973,
      "grad_norm": 0.659700647294824,
      "learning_rate": 3.091185909226454e-05,
      "loss": 1.1908,
      "num_input_tokens_seen": 37779721616,
      "step": 48019
    },
    {
      "epoch": 5.094419690218545,
      "grad_norm": 0.858896788208218,
      "learning_rate": 3.0911183832054305e-05,
      "loss": 1.1112,
      "num_input_tokens_seen": 37780508416,
      "step": 48020
    },
    {
      "epoch": 5.094525779758116,
      "grad_norm": 0.5975512228084271,
      "learning_rate": 3.091050856727609e-05,
      "loss": 1.1344,
      "num_input_tokens_seen": 37781295216,
      "step": 48021
    },
    {
      "epoch": 5.094631869297687,
      "grad_norm": 0.6902901385048961,
      "learning_rate": 3.09098332979304e-05,
      "loss": 1.2077,
      "num_input_tokens_seen": 37782082000,
      "step": 48022
    },
    {
      "epoch": 5.094737958837259,
      "grad_norm": 0.850461044750051,
      "learning_rate": 3.0909158024017765e-05,
      "loss": 1.2776,
      "num_input_tokens_seen": 37782868736,
      "step": 48023
    },
    {
      "epoch": 5.09484404837683,
      "grad_norm": 0.7861856978313168,
      "learning_rate": 3.090848274553871e-05,
      "loss": 1.168,
      "num_input_tokens_seen": 37783655472,
      "step": 48024
    },
    {
      "epoch": 5.094950137916402,
      "grad_norm": 0.8013650962698184,
      "learning_rate": 3.0907807462493753e-05,
      "loss": 1.1201,
      "num_input_tokens_seen": 37784442256,
      "step": 48025
    },
    {
      "epoch": 5.095056227455973,
      "grad_norm": 1.0022472303457182,
      "learning_rate": 3.0907132174883405e-05,
      "loss": 1.2111,
      "num_input_tokens_seen": 37785228912,
      "step": 48026
    },
    {
      "epoch": 5.095162316995545,
      "grad_norm": 0.6005621142772462,
      "learning_rate": 3.090645688270821e-05,
      "loss": 1.0588,
      "num_input_tokens_seen": 37786015696,
      "step": 48027
    },
    {
      "epoch": 5.095268406535116,
      "grad_norm": 1.152608708449361,
      "learning_rate": 3.0905781585968685e-05,
      "loss": 1.0939,
      "num_input_tokens_seen": 37786802512,
      "step": 48028
    },
    {
      "epoch": 5.095374496074687,
      "grad_norm": 0.9104168496450034,
      "learning_rate": 3.090510628466533e-05,
      "loss": 1.1674,
      "num_input_tokens_seen": 37787589296,
      "step": 48029
    },
    {
      "epoch": 5.095480585614259,
      "grad_norm": 0.7811224852331459,
      "learning_rate": 3.090443097879869e-05,
      "loss": 1.0985,
      "num_input_tokens_seen": 37788376064,
      "step": 48030
    },
    {
      "epoch": 5.09558667515383,
      "grad_norm": 0.7990057488398352,
      "learning_rate": 3.090375566836928e-05,
      "loss": 1.1351,
      "num_input_tokens_seen": 37789162864,
      "step": 48031
    },
    {
      "epoch": 5.095692764693402,
      "grad_norm": 0.7230564858578792,
      "learning_rate": 3.0903080353377617e-05,
      "loss": 1.1506,
      "num_input_tokens_seen": 37789949616,
      "step": 48032
    },
    {
      "epoch": 5.095798854232973,
      "grad_norm": 0.7728902996748437,
      "learning_rate": 3.0902405033824226e-05,
      "loss": 1.1514,
      "num_input_tokens_seen": 37790736368,
      "step": 48033
    },
    {
      "epoch": 5.095904943772544,
      "grad_norm": 0.6294706017016217,
      "learning_rate": 3.090172970970963e-05,
      "loss": 1.1548,
      "num_input_tokens_seen": 37791523072,
      "step": 48034
    },
    {
      "epoch": 5.096011033312116,
      "grad_norm": 0.6472778530225486,
      "learning_rate": 3.090105438103436e-05,
      "loss": 1.216,
      "num_input_tokens_seen": 37792309728,
      "step": 48035
    },
    {
      "epoch": 5.096117122851687,
      "grad_norm": 0.6362288712909048,
      "learning_rate": 3.090037904779892e-05,
      "loss": 1.1619,
      "num_input_tokens_seen": 37793096528,
      "step": 48036
    },
    {
      "epoch": 5.0962232123912585,
      "grad_norm": 0.5444800239521728,
      "learning_rate": 3.089970371000383e-05,
      "loss": 1.0284,
      "num_input_tokens_seen": 37793883392,
      "step": 48037
    },
    {
      "epoch": 5.09632930193083,
      "grad_norm": 0.6205117545507286,
      "learning_rate": 3.089902836764964e-05,
      "loss": 1.1562,
      "num_input_tokens_seen": 37794670096,
      "step": 48038
    },
    {
      "epoch": 5.096435391470401,
      "grad_norm": 0.8080913888818567,
      "learning_rate": 3.089835302073685e-05,
      "loss": 1.0479,
      "num_input_tokens_seen": 37795456960,
      "step": 48039
    },
    {
      "epoch": 5.0965414810099725,
      "grad_norm": 0.7362278293968119,
      "learning_rate": 3.089767766926598e-05,
      "loss": 1.1676,
      "num_input_tokens_seen": 37796243680,
      "step": 48040
    },
    {
      "epoch": 5.0966475705495435,
      "grad_norm": 0.5891851554140537,
      "learning_rate": 3.089700231323756e-05,
      "loss": 1.1018,
      "num_input_tokens_seen": 37797030496,
      "step": 48041
    },
    {
      "epoch": 5.0967536600891155,
      "grad_norm": 0.6580498910435658,
      "learning_rate": 3.089632695265212e-05,
      "loss": 1.0746,
      "num_input_tokens_seen": 37797817296,
      "step": 48042
    },
    {
      "epoch": 5.0968597496286865,
      "grad_norm": 0.6442201712721921,
      "learning_rate": 3.089565158751015e-05,
      "loss": 1.1398,
      "num_input_tokens_seen": 37798603984,
      "step": 48043
    },
    {
      "epoch": 5.096965839168258,
      "grad_norm": 0.6627656621359129,
      "learning_rate": 3.089497621781221e-05,
      "loss": 1.0848,
      "num_input_tokens_seen": 37799390736,
      "step": 48044
    },
    {
      "epoch": 5.097071928707829,
      "grad_norm": 0.5845943554635682,
      "learning_rate": 3.08943008435588e-05,
      "loss": 1.0279,
      "num_input_tokens_seen": 37800177520,
      "step": 48045
    },
    {
      "epoch": 5.0971780182474005,
      "grad_norm": 0.5748351549475118,
      "learning_rate": 3.0893625464750444e-05,
      "loss": 1.1708,
      "num_input_tokens_seen": 37800964304,
      "step": 48046
    },
    {
      "epoch": 5.097284107786972,
      "grad_norm": 0.785831373998094,
      "learning_rate": 3.089295008138767e-05,
      "loss": 1.0609,
      "num_input_tokens_seen": 37801751088,
      "step": 48047
    },
    {
      "epoch": 5.097390197326543,
      "grad_norm": 0.6781288591729566,
      "learning_rate": 3.0892274693471e-05,
      "loss": 1.0772,
      "num_input_tokens_seen": 37802537824,
      "step": 48048
    },
    {
      "epoch": 5.097496286866115,
      "grad_norm": 0.6128977168758214,
      "learning_rate": 3.089159930100095e-05,
      "loss": 1.2049,
      "num_input_tokens_seen": 37803324576,
      "step": 48049
    },
    {
      "epoch": 5.097602376405686,
      "grad_norm": 0.8607905108575423,
      "learning_rate": 3.0890923903978046e-05,
      "loss": 1.1086,
      "num_input_tokens_seen": 37804111424,
      "step": 48050
    },
    {
      "epoch": 5.097708465945257,
      "grad_norm": 0.6341242537397205,
      "learning_rate": 3.089024850240281e-05,
      "loss": 1.0949,
      "num_input_tokens_seen": 37804898224,
      "step": 48051
    },
    {
      "epoch": 5.097814555484829,
      "grad_norm": 0.726979846230787,
      "learning_rate": 3.0889573096275766e-05,
      "loss": 1.0822,
      "num_input_tokens_seen": 37805684928,
      "step": 48052
    },
    {
      "epoch": 5.0979206450244,
      "grad_norm": 0.5994064521973466,
      "learning_rate": 3.0888897685597426e-05,
      "loss": 1.1387,
      "num_input_tokens_seen": 37806471728,
      "step": 48053
    },
    {
      "epoch": 5.098026734563972,
      "grad_norm": 0.5618838413484444,
      "learning_rate": 3.0888222270368316e-05,
      "loss": 1.184,
      "num_input_tokens_seen": 37807258512,
      "step": 48054
    },
    {
      "epoch": 5.098132824103543,
      "grad_norm": 0.8996221525824821,
      "learning_rate": 3.088754685058897e-05,
      "loss": 1.3453,
      "num_input_tokens_seen": 37808045264,
      "step": 48055
    },
    {
      "epoch": 5.098238913643115,
      "grad_norm": 0.6617238179233106,
      "learning_rate": 3.08868714262599e-05,
      "loss": 1.1247,
      "num_input_tokens_seen": 37808832064,
      "step": 48056
    },
    {
      "epoch": 5.098345003182686,
      "grad_norm": 0.6405943618438288,
      "learning_rate": 3.0886195997381616e-05,
      "loss": 1.1583,
      "num_input_tokens_seen": 37809618864,
      "step": 48057
    },
    {
      "epoch": 5.098451092722257,
      "grad_norm": 0.6326832643469756,
      "learning_rate": 3.088552056395467e-05,
      "loss": 1.1379,
      "num_input_tokens_seen": 37810405648,
      "step": 48058
    },
    {
      "epoch": 5.098557182261829,
      "grad_norm": 0.8477482124355684,
      "learning_rate": 3.088484512597956e-05,
      "loss": 1.1522,
      "num_input_tokens_seen": 37811192448,
      "step": 48059
    },
    {
      "epoch": 5.0986632718014,
      "grad_norm": 0.6156079436151969,
      "learning_rate": 3.0884169683456804e-05,
      "loss": 1.1258,
      "num_input_tokens_seen": 37811979312,
      "step": 48060
    },
    {
      "epoch": 5.098769361340972,
      "grad_norm": 0.6796613298300364,
      "learning_rate": 3.0883494236386947e-05,
      "loss": 1.2414,
      "num_input_tokens_seen": 37812766080,
      "step": 48061
    },
    {
      "epoch": 5.098875450880543,
      "grad_norm": 0.6694773855975997,
      "learning_rate": 3.088281878477049e-05,
      "loss": 1.2261,
      "num_input_tokens_seen": 37813552816,
      "step": 48062
    },
    {
      "epoch": 5.098981540420114,
      "grad_norm": 0.6816222411869601,
      "learning_rate": 3.088214332860797e-05,
      "loss": 1.1746,
      "num_input_tokens_seen": 37814339568,
      "step": 48063
    },
    {
      "epoch": 5.099087629959686,
      "grad_norm": 0.5627546628158849,
      "learning_rate": 3.088146786789989e-05,
      "loss": 1.1439,
      "num_input_tokens_seen": 37815126288,
      "step": 48064
    },
    {
      "epoch": 5.099193719499257,
      "grad_norm": 0.7372393453916741,
      "learning_rate": 3.08807924026468e-05,
      "loss": 1.1715,
      "num_input_tokens_seen": 37815913056,
      "step": 48065
    },
    {
      "epoch": 5.099299809038829,
      "grad_norm": 0.6443561372596469,
      "learning_rate": 3.0880116932849196e-05,
      "loss": 1.0848,
      "num_input_tokens_seen": 37816699792,
      "step": 48066
    },
    {
      "epoch": 5.0994058985784,
      "grad_norm": 0.6457210844557812,
      "learning_rate": 3.087944145850762e-05,
      "loss": 1.1795,
      "num_input_tokens_seen": 37817486592,
      "step": 48067
    },
    {
      "epoch": 5.099511988117971,
      "grad_norm": 0.644966810532106,
      "learning_rate": 3.087876597962257e-05,
      "loss": 1.2095,
      "num_input_tokens_seen": 37818273312,
      "step": 48068
    },
    {
      "epoch": 5.099618077657543,
      "grad_norm": 0.6783330641516595,
      "learning_rate": 3.087809049619459e-05,
      "loss": 1.0786,
      "num_input_tokens_seen": 37819060064,
      "step": 48069
    },
    {
      "epoch": 5.099724167197114,
      "grad_norm": 0.5879695271627373,
      "learning_rate": 3.087741500822419e-05,
      "loss": 1.1534,
      "num_input_tokens_seen": 37819846880,
      "step": 48070
    },
    {
      "epoch": 5.099830256736686,
      "grad_norm": 0.7227694310849283,
      "learning_rate": 3.0876739515711906e-05,
      "loss": 1.1427,
      "num_input_tokens_seen": 37820633728,
      "step": 48071
    },
    {
      "epoch": 5.099936346276257,
      "grad_norm": 0.6260397751538317,
      "learning_rate": 3.087606401865824e-05,
      "loss": 1.169,
      "num_input_tokens_seen": 37821420480,
      "step": 48072
    },
    {
      "epoch": 5.100042435815829,
      "grad_norm": 0.6287232488037124,
      "learning_rate": 3.087538851706373e-05,
      "loss": 1.1156,
      "num_input_tokens_seen": 37822207280,
      "step": 48073
    },
    {
      "epoch": 5.1001485253554,
      "grad_norm": 0.6253662025492899,
      "learning_rate": 3.087471301092889e-05,
      "loss": 1.0663,
      "num_input_tokens_seen": 37822994080,
      "step": 48074
    },
    {
      "epoch": 5.100254614894971,
      "grad_norm": 0.9766387183589741,
      "learning_rate": 3.087403750025424e-05,
      "loss": 1.1649,
      "num_input_tokens_seen": 37823780848,
      "step": 48075
    },
    {
      "epoch": 5.100360704434543,
      "grad_norm": 0.6188245116434984,
      "learning_rate": 3.087336198504032e-05,
      "loss": 1.1025,
      "num_input_tokens_seen": 37824567600,
      "step": 48076
    },
    {
      "epoch": 5.100466793974114,
      "grad_norm": 0.8577271149592476,
      "learning_rate": 3.087268646528762e-05,
      "loss": 1.1309,
      "num_input_tokens_seen": 37825354496,
      "step": 48077
    },
    {
      "epoch": 5.100572883513686,
      "grad_norm": 0.6987170706971182,
      "learning_rate": 3.087201094099669e-05,
      "loss": 1.1151,
      "num_input_tokens_seen": 37826141248,
      "step": 48078
    },
    {
      "epoch": 5.100678973053257,
      "grad_norm": 0.6248029080087159,
      "learning_rate": 3.087133541216805e-05,
      "loss": 1.1187,
      "num_input_tokens_seen": 37826928080,
      "step": 48079
    },
    {
      "epoch": 5.100785062592828,
      "grad_norm": 0.7031359344434557,
      "learning_rate": 3.08706598788022e-05,
      "loss": 1.1935,
      "num_input_tokens_seen": 37827714816,
      "step": 48080
    },
    {
      "epoch": 5.1008911521324,
      "grad_norm": 0.6840861985269128,
      "learning_rate": 3.086998434089968e-05,
      "loss": 1.128,
      "num_input_tokens_seen": 37828501568,
      "step": 48081
    },
    {
      "epoch": 5.100997241671971,
      "grad_norm": 0.573231974378477,
      "learning_rate": 3.0869308798461016e-05,
      "loss": 1.1694,
      "num_input_tokens_seen": 37829288272,
      "step": 48082
    },
    {
      "epoch": 5.101103331211543,
      "grad_norm": 0.8222115299747809,
      "learning_rate": 3.086863325148671e-05,
      "loss": 1.2009,
      "num_input_tokens_seen": 37830075136,
      "step": 48083
    },
    {
      "epoch": 5.101209420751114,
      "grad_norm": 0.5481873460867811,
      "learning_rate": 3.0867957699977306e-05,
      "loss": 1.0949,
      "num_input_tokens_seen": 37830861920,
      "step": 48084
    },
    {
      "epoch": 5.101315510290686,
      "grad_norm": 0.6327181106916951,
      "learning_rate": 3.086728214393332e-05,
      "loss": 1.1179,
      "num_input_tokens_seen": 37831648608,
      "step": 48085
    },
    {
      "epoch": 5.101421599830257,
      "grad_norm": 0.8002379667450668,
      "learning_rate": 3.086660658335525e-05,
      "loss": 1.0525,
      "num_input_tokens_seen": 37832435376,
      "step": 48086
    },
    {
      "epoch": 5.101527689369828,
      "grad_norm": 0.6263186498053275,
      "learning_rate": 3.086593101824366e-05,
      "loss": 1.1866,
      "num_input_tokens_seen": 37833222128,
      "step": 48087
    },
    {
      "epoch": 5.1016337789094,
      "grad_norm": 0.6764570276150595,
      "learning_rate": 3.0865255448599045e-05,
      "loss": 1.2402,
      "num_input_tokens_seen": 37834008816,
      "step": 48088
    },
    {
      "epoch": 5.101739868448971,
      "grad_norm": 0.5670220459148907,
      "learning_rate": 3.0864579874421925e-05,
      "loss": 1.1237,
      "num_input_tokens_seen": 37834795696,
      "step": 48089
    },
    {
      "epoch": 5.101845957988543,
      "grad_norm": 0.8184295745968151,
      "learning_rate": 3.086390429571284e-05,
      "loss": 1.2011,
      "num_input_tokens_seen": 37835582480,
      "step": 48090
    },
    {
      "epoch": 5.101952047528114,
      "grad_norm": 0.575693397205837,
      "learning_rate": 3.08632287124723e-05,
      "loss": 1.1297,
      "num_input_tokens_seen": 37836369264,
      "step": 48091
    },
    {
      "epoch": 5.102058137067685,
      "grad_norm": 0.9333631701875343,
      "learning_rate": 3.0862553124700824e-05,
      "loss": 1.1453,
      "num_input_tokens_seen": 37837156032,
      "step": 48092
    },
    {
      "epoch": 5.102164226607257,
      "grad_norm": 0.6294614582414236,
      "learning_rate": 3.086187753239894e-05,
      "loss": 1.2168,
      "num_input_tokens_seen": 37837942848,
      "step": 48093
    },
    {
      "epoch": 5.102270316146828,
      "grad_norm": 0.880178368804207,
      "learning_rate": 3.086120193556717e-05,
      "loss": 1.1934,
      "num_input_tokens_seen": 37838729712,
      "step": 48094
    },
    {
      "epoch": 5.1023764056864,
      "grad_norm": 0.6547991719980251,
      "learning_rate": 3.0860526334206036e-05,
      "loss": 1.0971,
      "num_input_tokens_seen": 37839516496,
      "step": 48095
    },
    {
      "epoch": 5.102482495225971,
      "grad_norm": 0.8199769811462588,
      "learning_rate": 3.0859850728316064e-05,
      "loss": 1.2188,
      "num_input_tokens_seen": 37840303168,
      "step": 48096
    },
    {
      "epoch": 5.102588584765542,
      "grad_norm": 0.549107460495673,
      "learning_rate": 3.085917511789776e-05,
      "loss": 1.1389,
      "num_input_tokens_seen": 37841089968,
      "step": 48097
    },
    {
      "epoch": 5.102694674305114,
      "grad_norm": 0.6959226087451336,
      "learning_rate": 3.0858499502951664e-05,
      "loss": 1.3015,
      "num_input_tokens_seen": 37841876704,
      "step": 48098
    },
    {
      "epoch": 5.102800763844685,
      "grad_norm": 0.8542986682763392,
      "learning_rate": 3.085782388347829e-05,
      "loss": 1.1858,
      "num_input_tokens_seen": 37842663424,
      "step": 48099
    },
    {
      "epoch": 5.1029068533842565,
      "grad_norm": 0.7123327659867222,
      "learning_rate": 3.0857148259478167e-05,
      "loss": 1.1869,
      "num_input_tokens_seen": 37843450160,
      "step": 48100
    },
    {
      "epoch": 5.103012942923828,
      "grad_norm": 0.9182079983101282,
      "learning_rate": 3.08564726309518e-05,
      "loss": 1.2021,
      "num_input_tokens_seen": 37844236768,
      "step": 48101
    },
    {
      "epoch": 5.1031190324633995,
      "grad_norm": 0.8243015463570962,
      "learning_rate": 3.085579699789974e-05,
      "loss": 1.2255,
      "num_input_tokens_seen": 37845023536,
      "step": 48102
    },
    {
      "epoch": 5.1032251220029705,
      "grad_norm": 0.5683102091116324,
      "learning_rate": 3.0855121360322476e-05,
      "loss": 1.0069,
      "num_input_tokens_seen": 37845810352,
      "step": 48103
    },
    {
      "epoch": 5.1033312115425415,
      "grad_norm": 1.070491850262872,
      "learning_rate": 3.085444571822055e-05,
      "loss": 1.1952,
      "num_input_tokens_seen": 37846597040,
      "step": 48104
    },
    {
      "epoch": 5.1034373010821135,
      "grad_norm": 0.5004213341713646,
      "learning_rate": 3.085377007159449e-05,
      "loss": 1.0241,
      "num_input_tokens_seen": 37847383872,
      "step": 48105
    },
    {
      "epoch": 5.1035433906216845,
      "grad_norm": 0.9072802533987797,
      "learning_rate": 3.0853094420444795e-05,
      "loss": 1.079,
      "num_input_tokens_seen": 37848170640,
      "step": 48106
    },
    {
      "epoch": 5.103649480161256,
      "grad_norm": 0.5777674412110995,
      "learning_rate": 3.0852418764772006e-05,
      "loss": 1.0774,
      "num_input_tokens_seen": 37848957552,
      "step": 48107
    },
    {
      "epoch": 5.103755569700827,
      "grad_norm": 0.6733588427115029,
      "learning_rate": 3.085174310457664e-05,
      "loss": 1.1143,
      "num_input_tokens_seen": 37849744352,
      "step": 48108
    },
    {
      "epoch": 5.1038616592403985,
      "grad_norm": 0.6344883443871664,
      "learning_rate": 3.085106743985922e-05,
      "loss": 1.0111,
      "num_input_tokens_seen": 37850531152,
      "step": 48109
    },
    {
      "epoch": 5.10396774877997,
      "grad_norm": 0.5600231877043962,
      "learning_rate": 3.085039177062026e-05,
      "loss": 1.1339,
      "num_input_tokens_seen": 37851317920,
      "step": 48110
    },
    {
      "epoch": 5.104073838319541,
      "grad_norm": 0.5872696116519414,
      "learning_rate": 3.084971609686029e-05,
      "loss": 1.083,
      "num_input_tokens_seen": 37852104768,
      "step": 48111
    },
    {
      "epoch": 5.104179927859113,
      "grad_norm": 0.6051850160332911,
      "learning_rate": 3.084904041857984e-05,
      "loss": 1.0531,
      "num_input_tokens_seen": 37852891568,
      "step": 48112
    },
    {
      "epoch": 5.104286017398684,
      "grad_norm": 0.5259753790740662,
      "learning_rate": 3.0848364735779414e-05,
      "loss": 1.0884,
      "num_input_tokens_seen": 37853678400,
      "step": 48113
    },
    {
      "epoch": 5.104392106938256,
      "grad_norm": 0.5844633166983866,
      "learning_rate": 3.084768904845955e-05,
      "loss": 1.2161,
      "num_input_tokens_seen": 37854465184,
      "step": 48114
    },
    {
      "epoch": 5.104498196477827,
      "grad_norm": 0.843579964458037,
      "learning_rate": 3.0847013356620766e-05,
      "loss": 1.1712,
      "num_input_tokens_seen": 37855251984,
      "step": 48115
    },
    {
      "epoch": 5.104604286017398,
      "grad_norm": 0.6587449987624963,
      "learning_rate": 3.0846337660263576e-05,
      "loss": 1.0983,
      "num_input_tokens_seen": 37856038800,
      "step": 48116
    },
    {
      "epoch": 5.10471037555697,
      "grad_norm": 0.8757144012207978,
      "learning_rate": 3.08456619593885e-05,
      "loss": 1.1328,
      "num_input_tokens_seen": 37856825584,
      "step": 48117
    },
    {
      "epoch": 5.104816465096541,
      "grad_norm": 0.7036422058132323,
      "learning_rate": 3.084498625399607e-05,
      "loss": 1.1192,
      "num_input_tokens_seen": 37857612384,
      "step": 48118
    },
    {
      "epoch": 5.104922554636113,
      "grad_norm": 0.6604646293905555,
      "learning_rate": 3.0844310544086816e-05,
      "loss": 1.1673,
      "num_input_tokens_seen": 37858399264,
      "step": 48119
    },
    {
      "epoch": 5.105028644175684,
      "grad_norm": 0.7200609442700309,
      "learning_rate": 3.084363482966125e-05,
      "loss": 1.2034,
      "num_input_tokens_seen": 37859186080,
      "step": 48120
    },
    {
      "epoch": 5.105134733715255,
      "grad_norm": 0.626356425613407,
      "learning_rate": 3.084295911071989e-05,
      "loss": 1.1613,
      "num_input_tokens_seen": 37859972816,
      "step": 48121
    },
    {
      "epoch": 5.105240823254827,
      "grad_norm": 0.630592127913512,
      "learning_rate": 3.084228338726326e-05,
      "loss": 1.2239,
      "num_input_tokens_seen": 37860759552,
      "step": 48122
    },
    {
      "epoch": 5.105346912794398,
      "grad_norm": 0.7353430599555605,
      "learning_rate": 3.084160765929189e-05,
      "loss": 1.1535,
      "num_input_tokens_seen": 37861546192,
      "step": 48123
    },
    {
      "epoch": 5.10545300233397,
      "grad_norm": 0.66254790625573,
      "learning_rate": 3.0840931926806296e-05,
      "loss": 1.0919,
      "num_input_tokens_seen": 37862332944,
      "step": 48124
    },
    {
      "epoch": 5.105559091873541,
      "grad_norm": 0.6230469168805112,
      "learning_rate": 3.0840256189807e-05,
      "loss": 1.0904,
      "num_input_tokens_seen": 37863119744,
      "step": 48125
    },
    {
      "epoch": 5.105665181413113,
      "grad_norm": 0.6927105046030217,
      "learning_rate": 3.0839580448294526e-05,
      "loss": 1.1935,
      "num_input_tokens_seen": 37863906464,
      "step": 48126
    },
    {
      "epoch": 5.105771270952684,
      "grad_norm": 0.6131725800709773,
      "learning_rate": 3.08389047022694e-05,
      "loss": 1.0422,
      "num_input_tokens_seen": 37864693168,
      "step": 48127
    },
    {
      "epoch": 5.105877360492255,
      "grad_norm": 0.7078344528429081,
      "learning_rate": 3.083822895173213e-05,
      "loss": 1.3137,
      "num_input_tokens_seen": 37865479792,
      "step": 48128
    },
    {
      "epoch": 5.105983450031827,
      "grad_norm": 0.6759292203240288,
      "learning_rate": 3.083755319668325e-05,
      "loss": 1.1146,
      "num_input_tokens_seen": 37866266576,
      "step": 48129
    },
    {
      "epoch": 5.106089539571398,
      "grad_norm": 0.7290395979485605,
      "learning_rate": 3.0836877437123285e-05,
      "loss": 1.244,
      "num_input_tokens_seen": 37867053360,
      "step": 48130
    },
    {
      "epoch": 5.10619562911097,
      "grad_norm": 0.6015915493437982,
      "learning_rate": 3.083620167305276e-05,
      "loss": 1.1467,
      "num_input_tokens_seen": 37867840112,
      "step": 48131
    },
    {
      "epoch": 5.106301718650541,
      "grad_norm": 0.8951051008499189,
      "learning_rate": 3.083552590447217e-05,
      "loss": 1.1852,
      "num_input_tokens_seen": 37868626960,
      "step": 48132
    },
    {
      "epoch": 5.106407808190112,
      "grad_norm": 0.7606102442476912,
      "learning_rate": 3.083485013138207e-05,
      "loss": 1.2144,
      "num_input_tokens_seen": 37869413696,
      "step": 48133
    },
    {
      "epoch": 5.106513897729684,
      "grad_norm": 0.8234084745900953,
      "learning_rate": 3.083417435378297e-05,
      "loss": 1.2173,
      "num_input_tokens_seen": 37870200432,
      "step": 48134
    },
    {
      "epoch": 5.106619987269255,
      "grad_norm": 0.557525782084199,
      "learning_rate": 3.083349857167538e-05,
      "loss": 1.1402,
      "num_input_tokens_seen": 37870987200,
      "step": 48135
    },
    {
      "epoch": 5.106726076808827,
      "grad_norm": 0.6842642696517165,
      "learning_rate": 3.0832822785059843e-05,
      "loss": 1.1606,
      "num_input_tokens_seen": 37871773904,
      "step": 48136
    },
    {
      "epoch": 5.106832166348398,
      "grad_norm": 0.5935660662532845,
      "learning_rate": 3.0832146993936865e-05,
      "loss": 1.0659,
      "num_input_tokens_seen": 37872560656,
      "step": 48137
    },
    {
      "epoch": 5.106938255887969,
      "grad_norm": 1.0974469232285164,
      "learning_rate": 3.083147119830698e-05,
      "loss": 1.1802,
      "num_input_tokens_seen": 37873347488,
      "step": 48138
    },
    {
      "epoch": 5.107044345427541,
      "grad_norm": 0.5641227817627105,
      "learning_rate": 3.083079539817071e-05,
      "loss": 1.126,
      "num_input_tokens_seen": 37874134288,
      "step": 48139
    },
    {
      "epoch": 5.107150434967112,
      "grad_norm": 0.953463528374285,
      "learning_rate": 3.083011959352856e-05,
      "loss": 1.204,
      "num_input_tokens_seen": 37874921088,
      "step": 48140
    },
    {
      "epoch": 5.107256524506684,
      "grad_norm": 0.6945708808970161,
      "learning_rate": 3.082944378438108e-05,
      "loss": 1.1436,
      "num_input_tokens_seen": 37875707904,
      "step": 48141
    },
    {
      "epoch": 5.107362614046255,
      "grad_norm": 0.7398807817701704,
      "learning_rate": 3.082876797072877e-05,
      "loss": 1.0842,
      "num_input_tokens_seen": 37876494752,
      "step": 48142
    },
    {
      "epoch": 5.107468703585827,
      "grad_norm": 0.7626349676876703,
      "learning_rate": 3.082809215257215e-05,
      "loss": 1.1325,
      "num_input_tokens_seen": 37877281584,
      "step": 48143
    },
    {
      "epoch": 5.107574793125398,
      "grad_norm": 0.6921202836507175,
      "learning_rate": 3.082741632991176e-05,
      "loss": 1.1976,
      "num_input_tokens_seen": 37878068336,
      "step": 48144
    },
    {
      "epoch": 5.107680882664969,
      "grad_norm": 0.8925572269098895,
      "learning_rate": 3.082674050274812e-05,
      "loss": 1.215,
      "num_input_tokens_seen": 37878855168,
      "step": 48145
    },
    {
      "epoch": 5.107786972204541,
      "grad_norm": 0.6102506360719214,
      "learning_rate": 3.0826064671081735e-05,
      "loss": 1.1258,
      "num_input_tokens_seen": 37879642016,
      "step": 48146
    },
    {
      "epoch": 5.107893061744112,
      "grad_norm": 0.7352534303995558,
      "learning_rate": 3.0825388834913144e-05,
      "loss": 1.1565,
      "num_input_tokens_seen": 37880428800,
      "step": 48147
    },
    {
      "epoch": 5.107999151283684,
      "grad_norm": 0.7411142230535754,
      "learning_rate": 3.082471299424286e-05,
      "loss": 1.1267,
      "num_input_tokens_seen": 37881215584,
      "step": 48148
    },
    {
      "epoch": 5.108105240823255,
      "grad_norm": 0.5752132668634585,
      "learning_rate": 3.0824037149071405e-05,
      "loss": 1.1487,
      "num_input_tokens_seen": 37882002304,
      "step": 48149
    },
    {
      "epoch": 5.108211330362826,
      "grad_norm": 0.632180424045444,
      "learning_rate": 3.082336129939931e-05,
      "loss": 1.1981,
      "num_input_tokens_seen": 37882789072,
      "step": 48150
    },
    {
      "epoch": 5.108317419902398,
      "grad_norm": 0.6329846803070914,
      "learning_rate": 3.08226854452271e-05,
      "loss": 1.2174,
      "num_input_tokens_seen": 37883575904,
      "step": 48151
    },
    {
      "epoch": 5.108423509441969,
      "grad_norm": 0.7030208593115761,
      "learning_rate": 3.082200958655528e-05,
      "loss": 1.1506,
      "num_input_tokens_seen": 37884362736,
      "step": 48152
    },
    {
      "epoch": 5.108529598981541,
      "grad_norm": 0.6594524930939006,
      "learning_rate": 3.0821333723384385e-05,
      "loss": 1.1789,
      "num_input_tokens_seen": 37885149488,
      "step": 48153
    },
    {
      "epoch": 5.108635688521112,
      "grad_norm": 0.6409349959937177,
      "learning_rate": 3.0820657855714923e-05,
      "loss": 1.0638,
      "num_input_tokens_seen": 37885936336,
      "step": 48154
    },
    {
      "epoch": 5.108741778060684,
      "grad_norm": 0.7858942728087362,
      "learning_rate": 3.081998198354744e-05,
      "loss": 1.1282,
      "num_input_tokens_seen": 37886723120,
      "step": 48155
    },
    {
      "epoch": 5.108847867600255,
      "grad_norm": 0.6786515174305475,
      "learning_rate": 3.081930610688245e-05,
      "loss": 1.1441,
      "num_input_tokens_seen": 37887509984,
      "step": 48156
    },
    {
      "epoch": 5.108953957139826,
      "grad_norm": 0.7086803399670125,
      "learning_rate": 3.0818630225720456e-05,
      "loss": 1.1671,
      "num_input_tokens_seen": 37888296752,
      "step": 48157
    },
    {
      "epoch": 5.109060046679398,
      "grad_norm": 0.6154855472465047,
      "learning_rate": 3.0817954340062007e-05,
      "loss": 1.1472,
      "num_input_tokens_seen": 37889083472,
      "step": 48158
    },
    {
      "epoch": 5.109166136218969,
      "grad_norm": 0.932908647809676,
      "learning_rate": 3.081727844990761e-05,
      "loss": 1.2687,
      "num_input_tokens_seen": 37889870128,
      "step": 48159
    },
    {
      "epoch": 5.109272225758541,
      "grad_norm": 0.7552633985328239,
      "learning_rate": 3.081660255525779e-05,
      "loss": 1.197,
      "num_input_tokens_seen": 37890656832,
      "step": 48160
    },
    {
      "epoch": 5.109378315298112,
      "grad_norm": 0.6937329989614263,
      "learning_rate": 3.081592665611307e-05,
      "loss": 1.1744,
      "num_input_tokens_seen": 37891443584,
      "step": 48161
    },
    {
      "epoch": 5.109484404837683,
      "grad_norm": 0.6633289578328855,
      "learning_rate": 3.0815250752473976e-05,
      "loss": 1.0941,
      "num_input_tokens_seen": 37892230448,
      "step": 48162
    },
    {
      "epoch": 5.1095904943772545,
      "grad_norm": 0.9059879921940074,
      "learning_rate": 3.081457484434102e-05,
      "loss": 1.1597,
      "num_input_tokens_seen": 37893017232,
      "step": 48163
    },
    {
      "epoch": 5.109696583916826,
      "grad_norm": 1.0076149372386867,
      "learning_rate": 3.0813898931714735e-05,
      "loss": 1.1953,
      "num_input_tokens_seen": 37893803968,
      "step": 48164
    },
    {
      "epoch": 5.1098026734563975,
      "grad_norm": 0.6514825437513754,
      "learning_rate": 3.081322301459564e-05,
      "loss": 1.129,
      "num_input_tokens_seen": 37894590672,
      "step": 48165
    },
    {
      "epoch": 5.1099087629959685,
      "grad_norm": 1.523133899791844,
      "learning_rate": 3.0812547092984253e-05,
      "loss": 1.262,
      "num_input_tokens_seen": 37895377392,
      "step": 48166
    },
    {
      "epoch": 5.11001485253554,
      "grad_norm": 0.7277887058468533,
      "learning_rate": 3.08118711668811e-05,
      "loss": 1.1906,
      "num_input_tokens_seen": 37896164096,
      "step": 48167
    },
    {
      "epoch": 5.1101209420751115,
      "grad_norm": 0.7594587933464383,
      "learning_rate": 3.081119523628671e-05,
      "loss": 1.0806,
      "num_input_tokens_seen": 37896950896,
      "step": 48168
    },
    {
      "epoch": 5.1102270316146825,
      "grad_norm": 0.8047085533409688,
      "learning_rate": 3.0810519301201593e-05,
      "loss": 1.1934,
      "num_input_tokens_seen": 37897737632,
      "step": 48169
    },
    {
      "epoch": 5.110333121154254,
      "grad_norm": 0.8174687241620058,
      "learning_rate": 3.0809843361626285e-05,
      "loss": 1.1585,
      "num_input_tokens_seen": 37898524384,
      "step": 48170
    },
    {
      "epoch": 5.1104392106938255,
      "grad_norm": 0.9064418283600142,
      "learning_rate": 3.0809167417561296e-05,
      "loss": 1.1481,
      "num_input_tokens_seen": 37899311280,
      "step": 48171
    },
    {
      "epoch": 5.110545300233397,
      "grad_norm": 0.6501969645092814,
      "learning_rate": 3.080849146900715e-05,
      "loss": 1.1606,
      "num_input_tokens_seen": 37900098112,
      "step": 48172
    },
    {
      "epoch": 5.110651389772968,
      "grad_norm": 0.5588369598486732,
      "learning_rate": 3.0807815515964375e-05,
      "loss": 1.1116,
      "num_input_tokens_seen": 37900884848,
      "step": 48173
    },
    {
      "epoch": 5.110757479312539,
      "grad_norm": 0.634175310881935,
      "learning_rate": 3.080713955843349e-05,
      "loss": 1.1176,
      "num_input_tokens_seen": 37901671568,
      "step": 48174
    },
    {
      "epoch": 5.110863568852111,
      "grad_norm": 0.6783241838080909,
      "learning_rate": 3.080646359641502e-05,
      "loss": 1.1042,
      "num_input_tokens_seen": 37902458384,
      "step": 48175
    },
    {
      "epoch": 5.110969658391682,
      "grad_norm": 0.6787499502714818,
      "learning_rate": 3.080578762990948e-05,
      "loss": 1.169,
      "num_input_tokens_seen": 37903245104,
      "step": 48176
    },
    {
      "epoch": 5.111075747931254,
      "grad_norm": 0.9111857470788272,
      "learning_rate": 3.080511165891741e-05,
      "loss": 1.1457,
      "num_input_tokens_seen": 37904031792,
      "step": 48177
    },
    {
      "epoch": 5.111181837470825,
      "grad_norm": 0.7389240319448661,
      "learning_rate": 3.08044356834393e-05,
      "loss": 1.1295,
      "num_input_tokens_seen": 37904818592,
      "step": 48178
    },
    {
      "epoch": 5.111287927010396,
      "grad_norm": 0.8698450570123937,
      "learning_rate": 3.080375970347571e-05,
      "loss": 1.1252,
      "num_input_tokens_seen": 37905605392,
      "step": 48179
    },
    {
      "epoch": 5.111394016549968,
      "grad_norm": 0.7039726106094459,
      "learning_rate": 3.0803083719027136e-05,
      "loss": 1.1424,
      "num_input_tokens_seen": 37906392112,
      "step": 48180
    },
    {
      "epoch": 5.111500106089539,
      "grad_norm": 0.6056568414036102,
      "learning_rate": 3.0802407730094114e-05,
      "loss": 1.0805,
      "num_input_tokens_seen": 37907178848,
      "step": 48181
    },
    {
      "epoch": 5.111606195629111,
      "grad_norm": 0.8819467469931429,
      "learning_rate": 3.080173173667716e-05,
      "loss": 1.2665,
      "num_input_tokens_seen": 37907965568,
      "step": 48182
    },
    {
      "epoch": 5.111712285168682,
      "grad_norm": 0.7294328602821479,
      "learning_rate": 3.08010557387768e-05,
      "loss": 1.2076,
      "num_input_tokens_seen": 37908752400,
      "step": 48183
    },
    {
      "epoch": 5.111818374708254,
      "grad_norm": 0.7015564443050721,
      "learning_rate": 3.0800379736393544e-05,
      "loss": 1.1564,
      "num_input_tokens_seen": 37909539216,
      "step": 48184
    },
    {
      "epoch": 5.111924464247825,
      "grad_norm": 1.0229742919288372,
      "learning_rate": 3.079970372952794e-05,
      "loss": 1.1539,
      "num_input_tokens_seen": 37910326016,
      "step": 48185
    },
    {
      "epoch": 5.112030553787396,
      "grad_norm": 0.5377247396157374,
      "learning_rate": 3.079902771818048e-05,
      "loss": 1.1593,
      "num_input_tokens_seen": 37911112736,
      "step": 48186
    },
    {
      "epoch": 5.112136643326968,
      "grad_norm": 0.7097002562420811,
      "learning_rate": 3.0798351702351716e-05,
      "loss": 1.1368,
      "num_input_tokens_seen": 37911899536,
      "step": 48187
    },
    {
      "epoch": 5.112242732866539,
      "grad_norm": 0.7208507431649227,
      "learning_rate": 3.079767568204215e-05,
      "loss": 1.0598,
      "num_input_tokens_seen": 37912686272,
      "step": 48188
    },
    {
      "epoch": 5.112348822406111,
      "grad_norm": 0.6917178235055915,
      "learning_rate": 3.079699965725231e-05,
      "loss": 1.0734,
      "num_input_tokens_seen": 37913473232,
      "step": 48189
    },
    {
      "epoch": 5.112454911945682,
      "grad_norm": 0.7093855543972218,
      "learning_rate": 3.079632362798272e-05,
      "loss": 1.1906,
      "num_input_tokens_seen": 37914259920,
      "step": 48190
    },
    {
      "epoch": 5.112561001485253,
      "grad_norm": 0.8225159396550369,
      "learning_rate": 3.079564759423389e-05,
      "loss": 1.1464,
      "num_input_tokens_seen": 37915046704,
      "step": 48191
    },
    {
      "epoch": 5.112667091024825,
      "grad_norm": 0.7019165143243986,
      "learning_rate": 3.0794971556006365e-05,
      "loss": 1.199,
      "num_input_tokens_seen": 37915833440,
      "step": 48192
    },
    {
      "epoch": 5.112773180564396,
      "grad_norm": 0.7357058276387899,
      "learning_rate": 3.0794295513300655e-05,
      "loss": 1.0851,
      "num_input_tokens_seen": 37916620240,
      "step": 48193
    },
    {
      "epoch": 5.112879270103968,
      "grad_norm": 0.7790130690292252,
      "learning_rate": 3.0793619466117286e-05,
      "loss": 1.098,
      "num_input_tokens_seen": 37917407008,
      "step": 48194
    },
    {
      "epoch": 5.112985359643539,
      "grad_norm": 0.647366410472882,
      "learning_rate": 3.079294341445677e-05,
      "loss": 1.1315,
      "num_input_tokens_seen": 37918193776,
      "step": 48195
    },
    {
      "epoch": 5.113091449183111,
      "grad_norm": 0.9105054285864275,
      "learning_rate": 3.0792267358319646e-05,
      "loss": 1.2262,
      "num_input_tokens_seen": 37918980464,
      "step": 48196
    },
    {
      "epoch": 5.113197538722682,
      "grad_norm": 0.6103518042314278,
      "learning_rate": 3.079159129770642e-05,
      "loss": 1.1403,
      "num_input_tokens_seen": 37919767232,
      "step": 48197
    },
    {
      "epoch": 5.113303628262253,
      "grad_norm": 0.6721643517490326,
      "learning_rate": 3.079091523261762e-05,
      "loss": 1.1545,
      "num_input_tokens_seen": 37920553968,
      "step": 48198
    },
    {
      "epoch": 5.113409717801825,
      "grad_norm": 0.6390482397171869,
      "learning_rate": 3.079023916305378e-05,
      "loss": 1.1433,
      "num_input_tokens_seen": 37921340768,
      "step": 48199
    },
    {
      "epoch": 5.113515807341396,
      "grad_norm": 0.5814035312597461,
      "learning_rate": 3.0789563089015403e-05,
      "loss": 1.1194,
      "num_input_tokens_seen": 37922127520,
      "step": 48200
    },
    {
      "epoch": 5.113621896880968,
      "grad_norm": 0.691645495370371,
      "learning_rate": 3.0788887010503036e-05,
      "loss": 1.136,
      "num_input_tokens_seen": 37922914384,
      "step": 48201
    },
    {
      "epoch": 5.113727986420539,
      "grad_norm": 0.6162389475526774,
      "learning_rate": 3.078821092751718e-05,
      "loss": 1.0804,
      "num_input_tokens_seen": 37923701120,
      "step": 48202
    },
    {
      "epoch": 5.11383407596011,
      "grad_norm": 0.6299288987710072,
      "learning_rate": 3.078753484005836e-05,
      "loss": 1.1033,
      "num_input_tokens_seen": 37924487920,
      "step": 48203
    },
    {
      "epoch": 5.113940165499682,
      "grad_norm": 0.7254052841924821,
      "learning_rate": 3.0786858748127106e-05,
      "loss": 1.1694,
      "num_input_tokens_seen": 37925274560,
      "step": 48204
    },
    {
      "epoch": 5.114046255039253,
      "grad_norm": 0.5536289318415469,
      "learning_rate": 3.078618265172394e-05,
      "loss": 1.1137,
      "num_input_tokens_seen": 37926061392,
      "step": 48205
    },
    {
      "epoch": 5.114152344578825,
      "grad_norm": 0.7228987956881859,
      "learning_rate": 3.078550655084937e-05,
      "loss": 1.1404,
      "num_input_tokens_seen": 37926848176,
      "step": 48206
    },
    {
      "epoch": 5.114258434118396,
      "grad_norm": 0.6313397726499628,
      "learning_rate": 3.078483044550395e-05,
      "loss": 1.1885,
      "num_input_tokens_seen": 37927634944,
      "step": 48207
    },
    {
      "epoch": 5.114364523657967,
      "grad_norm": 0.6228727624631436,
      "learning_rate": 3.078415433568817e-05,
      "loss": 1.1263,
      "num_input_tokens_seen": 37928421728,
      "step": 48208
    },
    {
      "epoch": 5.114470613197539,
      "grad_norm": 0.6366588879031013,
      "learning_rate": 3.078347822140256e-05,
      "loss": 1.2647,
      "num_input_tokens_seen": 37929208448,
      "step": 48209
    },
    {
      "epoch": 5.11457670273711,
      "grad_norm": 0.6458618087932424,
      "learning_rate": 3.078280210264766e-05,
      "loss": 1.1564,
      "num_input_tokens_seen": 37929995200,
      "step": 48210
    },
    {
      "epoch": 5.114682792276682,
      "grad_norm": 0.6074690123409542,
      "learning_rate": 3.078212597942397e-05,
      "loss": 1.1287,
      "num_input_tokens_seen": 37930781984,
      "step": 48211
    },
    {
      "epoch": 5.114788881816253,
      "grad_norm": 0.6620966295847434,
      "learning_rate": 3.0781449851732026e-05,
      "loss": 1.1757,
      "num_input_tokens_seen": 37931568816,
      "step": 48212
    },
    {
      "epoch": 5.114894971355825,
      "grad_norm": 0.8476716016522118,
      "learning_rate": 3.078077371957235e-05,
      "loss": 1.1595,
      "num_input_tokens_seen": 37932355648,
      "step": 48213
    },
    {
      "epoch": 5.115001060895396,
      "grad_norm": 0.5078542206017563,
      "learning_rate": 3.078009758294547e-05,
      "loss": 1.051,
      "num_input_tokens_seen": 37933142416,
      "step": 48214
    },
    {
      "epoch": 5.115107150434967,
      "grad_norm": 0.6640481580036092,
      "learning_rate": 3.077942144185189e-05,
      "loss": 1.0749,
      "num_input_tokens_seen": 37933929280,
      "step": 48215
    },
    {
      "epoch": 5.115213239974539,
      "grad_norm": 0.8355132911777119,
      "learning_rate": 3.077874529629214e-05,
      "loss": 1.1483,
      "num_input_tokens_seen": 37934716000,
      "step": 48216
    },
    {
      "epoch": 5.11531932951411,
      "grad_norm": 0.6548324450597436,
      "learning_rate": 3.077806914626675e-05,
      "loss": 1.2673,
      "num_input_tokens_seen": 37935502640,
      "step": 48217
    },
    {
      "epoch": 5.115425419053682,
      "grad_norm": 0.8997492711984387,
      "learning_rate": 3.0777392991776234e-05,
      "loss": 1.172,
      "num_input_tokens_seen": 37936289392,
      "step": 48218
    },
    {
      "epoch": 5.115531508593253,
      "grad_norm": 0.7074641888365465,
      "learning_rate": 3.077671683282112e-05,
      "loss": 1.1491,
      "num_input_tokens_seen": 37937076112,
      "step": 48219
    },
    {
      "epoch": 5.115637598132824,
      "grad_norm": 0.7064405407050008,
      "learning_rate": 3.077604066940193e-05,
      "loss": 1.2255,
      "num_input_tokens_seen": 37937862896,
      "step": 48220
    },
    {
      "epoch": 5.115743687672396,
      "grad_norm": 0.8774638336930194,
      "learning_rate": 3.077536450151918e-05,
      "loss": 1.0867,
      "num_input_tokens_seen": 37938649664,
      "step": 48221
    },
    {
      "epoch": 5.115849777211967,
      "grad_norm": 0.7471032667686166,
      "learning_rate": 3.0774688329173404e-05,
      "loss": 1.1417,
      "num_input_tokens_seen": 37939436464,
      "step": 48222
    },
    {
      "epoch": 5.115955866751539,
      "grad_norm": 0.8892736864646333,
      "learning_rate": 3.077401215236512e-05,
      "loss": 1.0781,
      "num_input_tokens_seen": 37940223280,
      "step": 48223
    },
    {
      "epoch": 5.11606195629111,
      "grad_norm": 0.8396306798082749,
      "learning_rate": 3.077333597109485e-05,
      "loss": 1.1891,
      "num_input_tokens_seen": 37941010032,
      "step": 48224
    },
    {
      "epoch": 5.1161680458306815,
      "grad_norm": 0.6931644311407654,
      "learning_rate": 3.077265978536311e-05,
      "loss": 1.0902,
      "num_input_tokens_seen": 37941796832,
      "step": 48225
    },
    {
      "epoch": 5.1162741353702526,
      "grad_norm": 0.8177807296593217,
      "learning_rate": 3.077198359517043e-05,
      "loss": 1.2004,
      "num_input_tokens_seen": 37942583600,
      "step": 48226
    },
    {
      "epoch": 5.116380224909824,
      "grad_norm": 0.7406185991230371,
      "learning_rate": 3.077130740051733e-05,
      "loss": 1.1743,
      "num_input_tokens_seen": 37943370384,
      "step": 48227
    },
    {
      "epoch": 5.1164863144493955,
      "grad_norm": 0.6529129061885215,
      "learning_rate": 3.0770631201404334e-05,
      "loss": 1.0195,
      "num_input_tokens_seen": 37944157216,
      "step": 48228
    },
    {
      "epoch": 5.1165924039889665,
      "grad_norm": 1.0764388695136458,
      "learning_rate": 3.076995499783196e-05,
      "loss": 1.1581,
      "num_input_tokens_seen": 37944943952,
      "step": 48229
    },
    {
      "epoch": 5.1166984935285384,
      "grad_norm": 0.7873117045054994,
      "learning_rate": 3.076927878980073e-05,
      "loss": 1.1681,
      "num_input_tokens_seen": 37945730784,
      "step": 48230
    },
    {
      "epoch": 5.1168045830681095,
      "grad_norm": 0.8199949443008346,
      "learning_rate": 3.076860257731118e-05,
      "loss": 1.2379,
      "num_input_tokens_seen": 37946517600,
      "step": 48231
    },
    {
      "epoch": 5.1169106726076805,
      "grad_norm": 1.068670484426521,
      "learning_rate": 3.0767926360363816e-05,
      "loss": 1.1805,
      "num_input_tokens_seen": 37947304368,
      "step": 48232
    },
    {
      "epoch": 5.117016762147252,
      "grad_norm": 0.5831847042798619,
      "learning_rate": 3.076725013895917e-05,
      "loss": 1.0978,
      "num_input_tokens_seen": 37948091104,
      "step": 48233
    },
    {
      "epoch": 5.1171228516868235,
      "grad_norm": 0.8284280796549445,
      "learning_rate": 3.0766573913097774e-05,
      "loss": 1.0519,
      "num_input_tokens_seen": 37948877920,
      "step": 48234
    },
    {
      "epoch": 5.117228941226395,
      "grad_norm": 0.776280242209078,
      "learning_rate": 3.076589768278012e-05,
      "loss": 1.1819,
      "num_input_tokens_seen": 37949664768,
      "step": 48235
    },
    {
      "epoch": 5.117335030765966,
      "grad_norm": 0.6242238673583551,
      "learning_rate": 3.076522144800676e-05,
      "loss": 1.1788,
      "num_input_tokens_seen": 37950451488,
      "step": 48236
    },
    {
      "epoch": 5.117441120305537,
      "grad_norm": 0.7551548065747071,
      "learning_rate": 3.076454520877821e-05,
      "loss": 1.1307,
      "num_input_tokens_seen": 37951238208,
      "step": 48237
    },
    {
      "epoch": 5.117547209845109,
      "grad_norm": 0.68007808740052,
      "learning_rate": 3.076386896509498e-05,
      "loss": 1.0484,
      "num_input_tokens_seen": 37952025072,
      "step": 48238
    },
    {
      "epoch": 5.11765329938468,
      "grad_norm": 0.7666654322854165,
      "learning_rate": 3.07631927169576e-05,
      "loss": 1.1369,
      "num_input_tokens_seen": 37952811808,
      "step": 48239
    },
    {
      "epoch": 5.117759388924252,
      "grad_norm": 0.7146185930963787,
      "learning_rate": 3.0762516464366595e-05,
      "loss": 1.1459,
      "num_input_tokens_seen": 37953598528,
      "step": 48240
    },
    {
      "epoch": 5.117865478463823,
      "grad_norm": 0.8078549622552038,
      "learning_rate": 3.07618402073225e-05,
      "loss": 1.2509,
      "num_input_tokens_seen": 37954385232,
      "step": 48241
    },
    {
      "epoch": 5.117971568003395,
      "grad_norm": 0.6596575806315848,
      "learning_rate": 3.0761163945825813e-05,
      "loss": 1.1443,
      "num_input_tokens_seen": 37955171952,
      "step": 48242
    },
    {
      "epoch": 5.118077657542966,
      "grad_norm": 0.7870346349273821,
      "learning_rate": 3.076048767987706e-05,
      "loss": 1.1343,
      "num_input_tokens_seen": 37955958608,
      "step": 48243
    },
    {
      "epoch": 5.118183747082537,
      "grad_norm": 0.9518998814361995,
      "learning_rate": 3.075981140947678e-05,
      "loss": 1.267,
      "num_input_tokens_seen": 37956745296,
      "step": 48244
    },
    {
      "epoch": 5.118289836622109,
      "grad_norm": 0.8128110308160958,
      "learning_rate": 3.075913513462549e-05,
      "loss": 1.1483,
      "num_input_tokens_seen": 37957532000,
      "step": 48245
    },
    {
      "epoch": 5.11839592616168,
      "grad_norm": 0.8438195263048547,
      "learning_rate": 3.0758458855323705e-05,
      "loss": 1.1403,
      "num_input_tokens_seen": 37958318784,
      "step": 48246
    },
    {
      "epoch": 5.118502015701252,
      "grad_norm": 0.61829980268657,
      "learning_rate": 3.0757782571571954e-05,
      "loss": 1.0956,
      "num_input_tokens_seen": 37959105632,
      "step": 48247
    },
    {
      "epoch": 5.118608105240823,
      "grad_norm": 0.8582696850554684,
      "learning_rate": 3.075710628337075e-05,
      "loss": 1.1412,
      "num_input_tokens_seen": 37959892352,
      "step": 48248
    },
    {
      "epoch": 5.118714194780394,
      "grad_norm": 0.7051308509618635,
      "learning_rate": 3.075642999072063e-05,
      "loss": 1.1005,
      "num_input_tokens_seen": 37960679104,
      "step": 48249
    },
    {
      "epoch": 5.118820284319966,
      "grad_norm": 0.579146193567477,
      "learning_rate": 3.075575369362211e-05,
      "loss": 1.1907,
      "num_input_tokens_seen": 37961465824,
      "step": 48250
    },
    {
      "epoch": 5.118926373859537,
      "grad_norm": 0.7222835723629957,
      "learning_rate": 3.075507739207571e-05,
      "loss": 1.1075,
      "num_input_tokens_seen": 37962252640,
      "step": 48251
    },
    {
      "epoch": 5.119032463399109,
      "grad_norm": 0.5812776845322941,
      "learning_rate": 3.0754401086081954e-05,
      "loss": 1.2079,
      "num_input_tokens_seen": 37963039376,
      "step": 48252
    },
    {
      "epoch": 5.11913855293868,
      "grad_norm": 0.6800108523834885,
      "learning_rate": 3.075372477564137e-05,
      "loss": 1.1995,
      "num_input_tokens_seen": 37963826064,
      "step": 48253
    },
    {
      "epoch": 5.119244642478252,
      "grad_norm": 0.6498972974571283,
      "learning_rate": 3.0753048460754474e-05,
      "loss": 1.1507,
      "num_input_tokens_seen": 37964612848,
      "step": 48254
    },
    {
      "epoch": 5.119350732017823,
      "grad_norm": 0.8356944777065058,
      "learning_rate": 3.075237214142179e-05,
      "loss": 1.1356,
      "num_input_tokens_seen": 37965399632,
      "step": 48255
    },
    {
      "epoch": 5.119456821557394,
      "grad_norm": 0.7089320298715716,
      "learning_rate": 3.0751695817643844e-05,
      "loss": 1.1192,
      "num_input_tokens_seen": 37966186352,
      "step": 48256
    },
    {
      "epoch": 5.119562911096966,
      "grad_norm": 0.5760852369762772,
      "learning_rate": 3.075101948942115e-05,
      "loss": 1.1362,
      "num_input_tokens_seen": 37966973120,
      "step": 48257
    },
    {
      "epoch": 5.119669000636537,
      "grad_norm": 0.721071030313585,
      "learning_rate": 3.075034315675425e-05,
      "loss": 1.0844,
      "num_input_tokens_seen": 37967759936,
      "step": 48258
    },
    {
      "epoch": 5.119775090176109,
      "grad_norm": 0.7733070155542081,
      "learning_rate": 3.0749666819643644e-05,
      "loss": 1.0977,
      "num_input_tokens_seen": 37968546704,
      "step": 48259
    },
    {
      "epoch": 5.11988117971568,
      "grad_norm": 0.6316442434974621,
      "learning_rate": 3.0748990478089864e-05,
      "loss": 1.1303,
      "num_input_tokens_seen": 37969333552,
      "step": 48260
    },
    {
      "epoch": 5.119987269255251,
      "grad_norm": 0.7556728480459234,
      "learning_rate": 3.074831413209342e-05,
      "loss": 1.1082,
      "num_input_tokens_seen": 37970120336,
      "step": 48261
    },
    {
      "epoch": 5.120093358794823,
      "grad_norm": 0.667948667807915,
      "learning_rate": 3.074763778165487e-05,
      "loss": 1.1603,
      "num_input_tokens_seen": 37970907040,
      "step": 48262
    },
    {
      "epoch": 5.120199448334394,
      "grad_norm": 0.5706445487767441,
      "learning_rate": 3.074696142677471e-05,
      "loss": 1.0731,
      "num_input_tokens_seen": 37971693840,
      "step": 48263
    },
    {
      "epoch": 5.120305537873966,
      "grad_norm": 0.7664244176264717,
      "learning_rate": 3.0746285067453455e-05,
      "loss": 1.1218,
      "num_input_tokens_seen": 37972480656,
      "step": 48264
    },
    {
      "epoch": 5.120411627413537,
      "grad_norm": 0.6644315115852772,
      "learning_rate": 3.074560870369165e-05,
      "loss": 1.1612,
      "num_input_tokens_seen": 37973267456,
      "step": 48265
    },
    {
      "epoch": 5.120517716953108,
      "grad_norm": 0.5509800842561138,
      "learning_rate": 3.07449323354898e-05,
      "loss": 1.1188,
      "num_input_tokens_seen": 37974054256,
      "step": 48266
    },
    {
      "epoch": 5.12062380649268,
      "grad_norm": 0.722938384483454,
      "learning_rate": 3.0744255962848446e-05,
      "loss": 1.1946,
      "num_input_tokens_seen": 37974840976,
      "step": 48267
    },
    {
      "epoch": 5.120729896032251,
      "grad_norm": 0.6280058943815813,
      "learning_rate": 3.074357958576809e-05,
      "loss": 1.1879,
      "num_input_tokens_seen": 37975627728,
      "step": 48268
    },
    {
      "epoch": 5.120835985571823,
      "grad_norm": 0.629640496745513,
      "learning_rate": 3.0742903204249264e-05,
      "loss": 1.1785,
      "num_input_tokens_seen": 37976414496,
      "step": 48269
    },
    {
      "epoch": 5.120942075111394,
      "grad_norm": 0.7014670879572671,
      "learning_rate": 3.07422268182925e-05,
      "loss": 1.2402,
      "num_input_tokens_seen": 37977201264,
      "step": 48270
    },
    {
      "epoch": 5.121048164650966,
      "grad_norm": 0.7270251335165764,
      "learning_rate": 3.0741550427898304e-05,
      "loss": 1.1454,
      "num_input_tokens_seen": 37977987968,
      "step": 48271
    },
    {
      "epoch": 5.121154254190537,
      "grad_norm": 0.7331030082961854,
      "learning_rate": 3.074087403306721e-05,
      "loss": 1.1055,
      "num_input_tokens_seen": 37978774752,
      "step": 48272
    },
    {
      "epoch": 5.121260343730108,
      "grad_norm": 0.6016177453241225,
      "learning_rate": 3.0740197633799734e-05,
      "loss": 1.243,
      "num_input_tokens_seen": 37979561520,
      "step": 48273
    },
    {
      "epoch": 5.12136643326968,
      "grad_norm": 0.9602576329493501,
      "learning_rate": 3.07395212300964e-05,
      "loss": 1.1748,
      "num_input_tokens_seen": 37980348304,
      "step": 48274
    },
    {
      "epoch": 5.121472522809251,
      "grad_norm": 0.7315835032649709,
      "learning_rate": 3.0738844821957734e-05,
      "loss": 1.2588,
      "num_input_tokens_seen": 37981135056,
      "step": 48275
    },
    {
      "epoch": 5.121578612348823,
      "grad_norm": 0.7038051026544255,
      "learning_rate": 3.073816840938426e-05,
      "loss": 1.1223,
      "num_input_tokens_seen": 37981921856,
      "step": 48276
    },
    {
      "epoch": 5.121684701888394,
      "grad_norm": 0.7889550489264241,
      "learning_rate": 3.07374919923765e-05,
      "loss": 1.1292,
      "num_input_tokens_seen": 37982708496,
      "step": 48277
    },
    {
      "epoch": 5.121790791427965,
      "grad_norm": 0.6138852311143057,
      "learning_rate": 3.073681557093496e-05,
      "loss": 1.1251,
      "num_input_tokens_seen": 37983495232,
      "step": 48278
    },
    {
      "epoch": 5.121896880967537,
      "grad_norm": 0.9463531574173246,
      "learning_rate": 3.073613914506019e-05,
      "loss": 1.2386,
      "num_input_tokens_seen": 37984281920,
      "step": 48279
    },
    {
      "epoch": 5.122002970507108,
      "grad_norm": 0.822771182405935,
      "learning_rate": 3.0735462714752706e-05,
      "loss": 1.1066,
      "num_input_tokens_seen": 37985068656,
      "step": 48280
    },
    {
      "epoch": 5.12210906004668,
      "grad_norm": 0.6522386184175587,
      "learning_rate": 3.073478628001301e-05,
      "loss": 1.1261,
      "num_input_tokens_seen": 37985855472,
      "step": 48281
    },
    {
      "epoch": 5.122215149586251,
      "grad_norm": 0.6246588557584599,
      "learning_rate": 3.0734109840841644e-05,
      "loss": 1.15,
      "num_input_tokens_seen": 37986642256,
      "step": 48282
    },
    {
      "epoch": 5.122321239125823,
      "grad_norm": 0.7637296706268364,
      "learning_rate": 3.073343339723913e-05,
      "loss": 1.1882,
      "num_input_tokens_seen": 37987429120,
      "step": 48283
    },
    {
      "epoch": 5.122427328665394,
      "grad_norm": 0.6447246359014976,
      "learning_rate": 3.073275694920599e-05,
      "loss": 1.1068,
      "num_input_tokens_seen": 37988215968,
      "step": 48284
    },
    {
      "epoch": 5.122533418204965,
      "grad_norm": 0.6914676555105667,
      "learning_rate": 3.073208049674274e-05,
      "loss": 1.2525,
      "num_input_tokens_seen": 37989002672,
      "step": 48285
    },
    {
      "epoch": 5.122639507744537,
      "grad_norm": 0.768215395478601,
      "learning_rate": 3.07314040398499e-05,
      "loss": 1.0642,
      "num_input_tokens_seen": 37989789504,
      "step": 48286
    },
    {
      "epoch": 5.122745597284108,
      "grad_norm": 0.6981538903932489,
      "learning_rate": 3.0730727578528e-05,
      "loss": 1.1471,
      "num_input_tokens_seen": 37990576208,
      "step": 48287
    },
    {
      "epoch": 5.1228516868236795,
      "grad_norm": 0.7233991463960605,
      "learning_rate": 3.073005111277757e-05,
      "loss": 1.2288,
      "num_input_tokens_seen": 37991362928,
      "step": 48288
    },
    {
      "epoch": 5.122957776363251,
      "grad_norm": 0.7374143001522171,
      "learning_rate": 3.072937464259912e-05,
      "loss": 1.1482,
      "num_input_tokens_seen": 37992149600,
      "step": 48289
    },
    {
      "epoch": 5.123063865902822,
      "grad_norm": 0.7521803750555044,
      "learning_rate": 3.072869816799317e-05,
      "loss": 1.1468,
      "num_input_tokens_seen": 37992936416,
      "step": 48290
    },
    {
      "epoch": 5.1231699554423935,
      "grad_norm": 0.919024187945764,
      "learning_rate": 3.072802168896027e-05,
      "loss": 1.1734,
      "num_input_tokens_seen": 37993723216,
      "step": 48291
    },
    {
      "epoch": 5.1232760449819645,
      "grad_norm": 1.0258189129750053,
      "learning_rate": 3.072734520550091e-05,
      "loss": 1.1757,
      "num_input_tokens_seen": 37994509984,
      "step": 48292
    },
    {
      "epoch": 5.1233821345215365,
      "grad_norm": 0.7597877954898228,
      "learning_rate": 3.072666871761563e-05,
      "loss": 1.1882,
      "num_input_tokens_seen": 37995296736,
      "step": 48293
    },
    {
      "epoch": 5.1234882240611075,
      "grad_norm": 0.7077478840030653,
      "learning_rate": 3.072599222530494e-05,
      "loss": 1.1899,
      "num_input_tokens_seen": 37996083520,
      "step": 48294
    },
    {
      "epoch": 5.123594313600679,
      "grad_norm": 0.6912304979904585,
      "learning_rate": 3.072531572856937e-05,
      "loss": 1.1659,
      "num_input_tokens_seen": 37996870256,
      "step": 48295
    },
    {
      "epoch": 5.12370040314025,
      "grad_norm": 0.8388218710344035,
      "learning_rate": 3.0724639227409455e-05,
      "loss": 1.2058,
      "num_input_tokens_seen": 37997657040,
      "step": 48296
    },
    {
      "epoch": 5.1238064926798215,
      "grad_norm": 0.6970608423295813,
      "learning_rate": 3.0723962721825705e-05,
      "loss": 1.0801,
      "num_input_tokens_seen": 37998443712,
      "step": 48297
    },
    {
      "epoch": 5.123912582219393,
      "grad_norm": 0.8464218568273222,
      "learning_rate": 3.072328621181863e-05,
      "loss": 1.0992,
      "num_input_tokens_seen": 37999230480,
      "step": 48298
    },
    {
      "epoch": 5.124018671758964,
      "grad_norm": 0.6431715561180936,
      "learning_rate": 3.072260969738879e-05,
      "loss": 1.113,
      "num_input_tokens_seen": 38000017184,
      "step": 48299
    },
    {
      "epoch": 5.124124761298536,
      "grad_norm": 0.6190128313413694,
      "learning_rate": 3.072193317853667e-05,
      "loss": 1.0897,
      "num_input_tokens_seen": 38000803936,
      "step": 48300
    },
    {
      "epoch": 5.124230850838107,
      "grad_norm": 0.8211589282722087,
      "learning_rate": 3.072125665526282e-05,
      "loss": 1.2579,
      "num_input_tokens_seen": 38001590704,
      "step": 48301
    },
    {
      "epoch": 5.124336940377678,
      "grad_norm": 0.7190668068949649,
      "learning_rate": 3.072058012756774e-05,
      "loss": 1.1354,
      "num_input_tokens_seen": 38002377440,
      "step": 48302
    },
    {
      "epoch": 5.12444302991725,
      "grad_norm": 0.829869773404374,
      "learning_rate": 3.0719903595451956e-05,
      "loss": 1.2866,
      "num_input_tokens_seen": 38003164192,
      "step": 48303
    },
    {
      "epoch": 5.124549119456821,
      "grad_norm": 0.7588755986004743,
      "learning_rate": 3.071922705891601e-05,
      "loss": 1.0573,
      "num_input_tokens_seen": 38003950944,
      "step": 48304
    },
    {
      "epoch": 5.124655208996393,
      "grad_norm": 0.8155894152089658,
      "learning_rate": 3.071855051796042e-05,
      "loss": 1.2004,
      "num_input_tokens_seen": 38004737712,
      "step": 48305
    },
    {
      "epoch": 5.124761298535964,
      "grad_norm": 0.7376463935939355,
      "learning_rate": 3.0717873972585685e-05,
      "loss": 1.1718,
      "num_input_tokens_seen": 38005524528,
      "step": 48306
    },
    {
      "epoch": 5.124867388075535,
      "grad_norm": 0.7372535423270208,
      "learning_rate": 3.071719742279236e-05,
      "loss": 1.1767,
      "num_input_tokens_seen": 38006311344,
      "step": 48307
    },
    {
      "epoch": 5.124973477615107,
      "grad_norm": 0.6848711426722294,
      "learning_rate": 3.071652086858094e-05,
      "loss": 1.161,
      "num_input_tokens_seen": 38007098112,
      "step": 48308
    },
    {
      "epoch": 5.125079567154678,
      "grad_norm": 0.6131889987103931,
      "learning_rate": 3.071584430995196e-05,
      "loss": 1.1961,
      "num_input_tokens_seen": 38007884768,
      "step": 48309
    },
    {
      "epoch": 5.12518565669425,
      "grad_norm": 0.8316137491183183,
      "learning_rate": 3.071516774690595e-05,
      "loss": 1.246,
      "num_input_tokens_seen": 38008671488,
      "step": 48310
    },
    {
      "epoch": 5.125291746233821,
      "grad_norm": 0.8613969591181578,
      "learning_rate": 3.0714491179443436e-05,
      "loss": 1.1694,
      "num_input_tokens_seen": 38009458240,
      "step": 48311
    },
    {
      "epoch": 5.125397835773393,
      "grad_norm": 1.0099391860043896,
      "learning_rate": 3.071381460756492e-05,
      "loss": 1.1629,
      "num_input_tokens_seen": 38010245024,
      "step": 48312
    },
    {
      "epoch": 5.125503925312964,
      "grad_norm": 0.7548652087604444,
      "learning_rate": 3.071313803127093e-05,
      "loss": 1.1034,
      "num_input_tokens_seen": 38011031840,
      "step": 48313
    },
    {
      "epoch": 5.125610014852535,
      "grad_norm": 0.9983343623900044,
      "learning_rate": 3.0712461450562006e-05,
      "loss": 1.1395,
      "num_input_tokens_seen": 38011818640,
      "step": 48314
    },
    {
      "epoch": 5.125716104392107,
      "grad_norm": 0.7500388603526799,
      "learning_rate": 3.071178486543865e-05,
      "loss": 1.2214,
      "num_input_tokens_seen": 38012605392,
      "step": 48315
    },
    {
      "epoch": 5.125822193931678,
      "grad_norm": 0.9231976438305146,
      "learning_rate": 3.07111082759014e-05,
      "loss": 1.146,
      "num_input_tokens_seen": 38013392192,
      "step": 48316
    },
    {
      "epoch": 5.12592828347125,
      "grad_norm": 0.8951987125486164,
      "learning_rate": 3.0710431681950774e-05,
      "loss": 1.124,
      "num_input_tokens_seen": 38014178992,
      "step": 48317
    },
    {
      "epoch": 5.126034373010821,
      "grad_norm": 0.6319414557212434,
      "learning_rate": 3.070975508358729e-05,
      "loss": 1.1822,
      "num_input_tokens_seen": 38014965824,
      "step": 48318
    },
    {
      "epoch": 5.126140462550392,
      "grad_norm": 0.8398347794176769,
      "learning_rate": 3.0709078480811477e-05,
      "loss": 1.1435,
      "num_input_tokens_seen": 38015752704,
      "step": 48319
    },
    {
      "epoch": 5.126246552089964,
      "grad_norm": 0.7428513797789572,
      "learning_rate": 3.070840187362386e-05,
      "loss": 1.1805,
      "num_input_tokens_seen": 38016539440,
      "step": 48320
    },
    {
      "epoch": 5.126352641629535,
      "grad_norm": 0.5659474336582854,
      "learning_rate": 3.0707725262024945e-05,
      "loss": 1.2091,
      "num_input_tokens_seen": 38017326112,
      "step": 48321
    },
    {
      "epoch": 5.126458731169107,
      "grad_norm": 0.8783126547732617,
      "learning_rate": 3.070704864601528e-05,
      "loss": 1.2291,
      "num_input_tokens_seen": 38018112848,
      "step": 48322
    },
    {
      "epoch": 5.126564820708678,
      "grad_norm": 0.5792350283589424,
      "learning_rate": 3.070637202559537e-05,
      "loss": 1.1518,
      "num_input_tokens_seen": 38018899568,
      "step": 48323
    },
    {
      "epoch": 5.12667091024825,
      "grad_norm": 0.73992257081629,
      "learning_rate": 3.070569540076574e-05,
      "loss": 1.1425,
      "num_input_tokens_seen": 38019686352,
      "step": 48324
    },
    {
      "epoch": 5.126776999787821,
      "grad_norm": 0.7450577205176432,
      "learning_rate": 3.070501877152692e-05,
      "loss": 1.225,
      "num_input_tokens_seen": 38020473168,
      "step": 48325
    },
    {
      "epoch": 5.126883089327392,
      "grad_norm": 1.1033346145571326,
      "learning_rate": 3.0704342137879425e-05,
      "loss": 1.2655,
      "num_input_tokens_seen": 38021259888,
      "step": 48326
    },
    {
      "epoch": 5.126989178866964,
      "grad_norm": 0.6468786277024838,
      "learning_rate": 3.070366549982379e-05,
      "loss": 1.1199,
      "num_input_tokens_seen": 38022046640,
      "step": 48327
    },
    {
      "epoch": 5.127095268406535,
      "grad_norm": 0.6851257796760472,
      "learning_rate": 3.070298885736052e-05,
      "loss": 1.1232,
      "num_input_tokens_seen": 38022833456,
      "step": 48328
    },
    {
      "epoch": 5.127201357946107,
      "grad_norm": 1.1020236134184678,
      "learning_rate": 3.070231221049015e-05,
      "loss": 1.217,
      "num_input_tokens_seen": 38023620208,
      "step": 48329
    },
    {
      "epoch": 5.127307447485678,
      "grad_norm": 0.6471444640733626,
      "learning_rate": 3.070163555921321e-05,
      "loss": 1.1035,
      "num_input_tokens_seen": 38024407008,
      "step": 48330
    },
    {
      "epoch": 5.127413537025249,
      "grad_norm": 0.8296070433678432,
      "learning_rate": 3.070095890353021e-05,
      "loss": 1.2095,
      "num_input_tokens_seen": 38025193776,
      "step": 48331
    },
    {
      "epoch": 5.127519626564821,
      "grad_norm": 0.7548202800949367,
      "learning_rate": 3.0700282243441666e-05,
      "loss": 1.233,
      "num_input_tokens_seen": 38025980624,
      "step": 48332
    },
    {
      "epoch": 5.127625716104392,
      "grad_norm": 0.6460691844504214,
      "learning_rate": 3.069960557894812e-05,
      "loss": 1.1122,
      "num_input_tokens_seen": 38026767568,
      "step": 48333
    },
    {
      "epoch": 5.127731805643964,
      "grad_norm": 0.7958061151940887,
      "learning_rate": 3.0698928910050086e-05,
      "loss": 1.1941,
      "num_input_tokens_seen": 38027554320,
      "step": 48334
    },
    {
      "epoch": 5.127837895183535,
      "grad_norm": 0.7907549980934102,
      "learning_rate": 3.069825223674808e-05,
      "loss": 1.1478,
      "num_input_tokens_seen": 38028341072,
      "step": 48335
    },
    {
      "epoch": 5.127943984723107,
      "grad_norm": 0.6804649337217208,
      "learning_rate": 3.0697575559042633e-05,
      "loss": 1.0997,
      "num_input_tokens_seen": 38029127776,
      "step": 48336
    },
    {
      "epoch": 5.128050074262678,
      "grad_norm": 0.8000960750283322,
      "learning_rate": 3.0696898876934276e-05,
      "loss": 1.2357,
      "num_input_tokens_seen": 38029914480,
      "step": 48337
    },
    {
      "epoch": 5.128156163802249,
      "grad_norm": 0.74935107393666,
      "learning_rate": 3.069622219042351e-05,
      "loss": 1.2181,
      "num_input_tokens_seen": 38030701216,
      "step": 48338
    },
    {
      "epoch": 5.128262253341821,
      "grad_norm": 0.6941291472309289,
      "learning_rate": 3.069554549951088e-05,
      "loss": 1.1983,
      "num_input_tokens_seen": 38031488032,
      "step": 48339
    },
    {
      "epoch": 5.128368342881392,
      "grad_norm": 0.8849723348422168,
      "learning_rate": 3.06948688041969e-05,
      "loss": 1.1052,
      "num_input_tokens_seen": 38032274752,
      "step": 48340
    },
    {
      "epoch": 5.128474432420964,
      "grad_norm": 0.605649689650055,
      "learning_rate": 3.069419210448209e-05,
      "loss": 1.0992,
      "num_input_tokens_seen": 38033061616,
      "step": 48341
    },
    {
      "epoch": 5.128580521960535,
      "grad_norm": 0.7666742402428303,
      "learning_rate": 3.0693515400366976e-05,
      "loss": 1.1373,
      "num_input_tokens_seen": 38033848416,
      "step": 48342
    },
    {
      "epoch": 5.128686611500106,
      "grad_norm": 0.6575385635113273,
      "learning_rate": 3.069283869185207e-05,
      "loss": 1.2336,
      "num_input_tokens_seen": 38034635168,
      "step": 48343
    },
    {
      "epoch": 5.128792701039678,
      "grad_norm": 0.5874621444629587,
      "learning_rate": 3.069216197893792e-05,
      "loss": 1.1257,
      "num_input_tokens_seen": 38035422048,
      "step": 48344
    },
    {
      "epoch": 5.128898790579249,
      "grad_norm": 0.5822919988008036,
      "learning_rate": 3.069148526162503e-05,
      "loss": 1.06,
      "num_input_tokens_seen": 38036208848,
      "step": 48345
    },
    {
      "epoch": 5.129004880118821,
      "grad_norm": 0.6220848484607311,
      "learning_rate": 3.069080853991392e-05,
      "loss": 1.198,
      "num_input_tokens_seen": 38036995680,
      "step": 48346
    },
    {
      "epoch": 5.129110969658392,
      "grad_norm": 0.5299071749564128,
      "learning_rate": 3.0690131813805137e-05,
      "loss": 1.0738,
      "num_input_tokens_seen": 38037782432,
      "step": 48347
    },
    {
      "epoch": 5.129217059197963,
      "grad_norm": 0.6449272432687128,
      "learning_rate": 3.068945508329917e-05,
      "loss": 1.1739,
      "num_input_tokens_seen": 38038569264,
      "step": 48348
    },
    {
      "epoch": 5.129323148737535,
      "grad_norm": 0.6792046336825215,
      "learning_rate": 3.068877834839656e-05,
      "loss": 1.1266,
      "num_input_tokens_seen": 38039356064,
      "step": 48349
    },
    {
      "epoch": 5.129429238277106,
      "grad_norm": 0.7159630936225913,
      "learning_rate": 3.068810160909784e-05,
      "loss": 1.1058,
      "num_input_tokens_seen": 38040142880,
      "step": 48350
    },
    {
      "epoch": 5.1295353278166775,
      "grad_norm": 0.754618133755635,
      "learning_rate": 3.068742486540352e-05,
      "loss": 1.0945,
      "num_input_tokens_seen": 38040929584,
      "step": 48351
    },
    {
      "epoch": 5.129641417356249,
      "grad_norm": 0.653761007375274,
      "learning_rate": 3.068674811731412e-05,
      "loss": 1.1059,
      "num_input_tokens_seen": 38041716304,
      "step": 48352
    },
    {
      "epoch": 5.1297475068958205,
      "grad_norm": 0.6520901419245165,
      "learning_rate": 3.068607136483017e-05,
      "loss": 1.222,
      "num_input_tokens_seen": 38042503088,
      "step": 48353
    },
    {
      "epoch": 5.1298535964353915,
      "grad_norm": 0.6348096161638466,
      "learning_rate": 3.068539460795219e-05,
      "loss": 1.1663,
      "num_input_tokens_seen": 38043289776,
      "step": 48354
    },
    {
      "epoch": 5.1299596859749625,
      "grad_norm": 0.7263592086164123,
      "learning_rate": 3.068471784668069e-05,
      "loss": 1.1568,
      "num_input_tokens_seen": 38044076560,
      "step": 48355
    },
    {
      "epoch": 5.1300657755145345,
      "grad_norm": 0.9364648019132589,
      "learning_rate": 3.0684041081016227e-05,
      "loss": 1.2072,
      "num_input_tokens_seen": 38044863296,
      "step": 48356
    },
    {
      "epoch": 5.1301718650541055,
      "grad_norm": 0.7892708529213179,
      "learning_rate": 3.06833643109593e-05,
      "loss": 1.1679,
      "num_input_tokens_seen": 38045649984,
      "step": 48357
    },
    {
      "epoch": 5.130277954593677,
      "grad_norm": 0.7120100266072892,
      "learning_rate": 3.0682687536510426e-05,
      "loss": 1.227,
      "num_input_tokens_seen": 38046436656,
      "step": 48358
    },
    {
      "epoch": 5.1303840441332484,
      "grad_norm": 0.7986318639865044,
      "learning_rate": 3.068201075767015e-05,
      "loss": 1.1738,
      "num_input_tokens_seen": 38047223392,
      "step": 48359
    },
    {
      "epoch": 5.1304901336728195,
      "grad_norm": 1.0179607347615378,
      "learning_rate": 3.068133397443898e-05,
      "loss": 1.3227,
      "num_input_tokens_seen": 38048010064,
      "step": 48360
    },
    {
      "epoch": 5.130596223212391,
      "grad_norm": 0.8963689687143237,
      "learning_rate": 3.0680657186817435e-05,
      "loss": 1.0247,
      "num_input_tokens_seen": 38048796864,
      "step": 48361
    },
    {
      "epoch": 5.130702312751962,
      "grad_norm": 1.1793403045300375,
      "learning_rate": 3.067998039480605e-05,
      "loss": 1.1679,
      "num_input_tokens_seen": 38049583632,
      "step": 48362
    },
    {
      "epoch": 5.130808402291534,
      "grad_norm": 0.6562254351181848,
      "learning_rate": 3.067930359840534e-05,
      "loss": 1.1687,
      "num_input_tokens_seen": 38050370384,
      "step": 48363
    },
    {
      "epoch": 5.130914491831105,
      "grad_norm": 0.8440781910014237,
      "learning_rate": 3.067862679761583e-05,
      "loss": 1.1852,
      "num_input_tokens_seen": 38051157120,
      "step": 48364
    },
    {
      "epoch": 5.131020581370677,
      "grad_norm": 1.1259986870601137,
      "learning_rate": 3.067794999243805e-05,
      "loss": 1.1946,
      "num_input_tokens_seen": 38051943824,
      "step": 48365
    },
    {
      "epoch": 5.131126670910248,
      "grad_norm": 0.710526707094542,
      "learning_rate": 3.067727318287252e-05,
      "loss": 1.1921,
      "num_input_tokens_seen": 38052730512,
      "step": 48366
    },
    {
      "epoch": 5.131232760449819,
      "grad_norm": 0.9804508392560697,
      "learning_rate": 3.067659636891975e-05,
      "loss": 1.0688,
      "num_input_tokens_seen": 38053517232,
      "step": 48367
    },
    {
      "epoch": 5.131338849989391,
      "grad_norm": 1.084206143757051,
      "learning_rate": 3.067591955058028e-05,
      "loss": 1.2604,
      "num_input_tokens_seen": 38054303952,
      "step": 48368
    },
    {
      "epoch": 5.131444939528962,
      "grad_norm": 0.720071323806636,
      "learning_rate": 3.067524272785462e-05,
      "loss": 1.1978,
      "num_input_tokens_seen": 38055090720,
      "step": 48369
    },
    {
      "epoch": 5.131551029068534,
      "grad_norm": 1.0864520205539936,
      "learning_rate": 3.06745659007433e-05,
      "loss": 1.1877,
      "num_input_tokens_seen": 38055877488,
      "step": 48370
    },
    {
      "epoch": 5.131657118608105,
      "grad_norm": 0.7815566778212645,
      "learning_rate": 3.067388906924685e-05,
      "loss": 1.1443,
      "num_input_tokens_seen": 38056664256,
      "step": 48371
    },
    {
      "epoch": 5.131763208147676,
      "grad_norm": 0.7633551564084589,
      "learning_rate": 3.067321223336577e-05,
      "loss": 1.1953,
      "num_input_tokens_seen": 38057451056,
      "step": 48372
    },
    {
      "epoch": 5.131869297687248,
      "grad_norm": 0.9354360073665737,
      "learning_rate": 3.067253539310061e-05,
      "loss": 1.1733,
      "num_input_tokens_seen": 38058237872,
      "step": 48373
    },
    {
      "epoch": 5.131975387226819,
      "grad_norm": 0.9326542375724677,
      "learning_rate": 3.067185854845188e-05,
      "loss": 1.0971,
      "num_input_tokens_seen": 38059024624,
      "step": 48374
    },
    {
      "epoch": 5.132081476766391,
      "grad_norm": 0.6185533280616792,
      "learning_rate": 3.0671181699420095e-05,
      "loss": 1.1839,
      "num_input_tokens_seen": 38059811360,
      "step": 48375
    },
    {
      "epoch": 5.132187566305962,
      "grad_norm": 0.9675586037600848,
      "learning_rate": 3.0670504846005796e-05,
      "loss": 1.1836,
      "num_input_tokens_seen": 38060598096,
      "step": 48376
    },
    {
      "epoch": 5.132293655845533,
      "grad_norm": 0.7933485979425441,
      "learning_rate": 3.06698279882095e-05,
      "loss": 1.1087,
      "num_input_tokens_seen": 38061384880,
      "step": 48377
    },
    {
      "epoch": 5.132399745385105,
      "grad_norm": 0.6834019790598886,
      "learning_rate": 3.066915112603172e-05,
      "loss": 1.2643,
      "num_input_tokens_seen": 38062171616,
      "step": 48378
    },
    {
      "epoch": 5.132505834924676,
      "grad_norm": 0.9890051775866722,
      "learning_rate": 3.066847425947299e-05,
      "loss": 1.0625,
      "num_input_tokens_seen": 38062958368,
      "step": 48379
    },
    {
      "epoch": 5.132611924464248,
      "grad_norm": 0.7063801512380019,
      "learning_rate": 3.066779738853383e-05,
      "loss": 1.1032,
      "num_input_tokens_seen": 38063745136,
      "step": 48380
    },
    {
      "epoch": 5.132718014003819,
      "grad_norm": 0.6895397394802636,
      "learning_rate": 3.066712051321476e-05,
      "loss": 1.1401,
      "num_input_tokens_seen": 38064531920,
      "step": 48381
    },
    {
      "epoch": 5.132824103543391,
      "grad_norm": 0.6329459309881382,
      "learning_rate": 3.06664436335163e-05,
      "loss": 1.1825,
      "num_input_tokens_seen": 38065318720,
      "step": 48382
    },
    {
      "epoch": 5.132930193082962,
      "grad_norm": 0.5695927978509913,
      "learning_rate": 3.066576674943899e-05,
      "loss": 1.1177,
      "num_input_tokens_seen": 38066105520,
      "step": 48383
    },
    {
      "epoch": 5.133036282622533,
      "grad_norm": 0.8397666601124801,
      "learning_rate": 3.066508986098334e-05,
      "loss": 1.2282,
      "num_input_tokens_seen": 38066892240,
      "step": 48384
    },
    {
      "epoch": 5.133142372162105,
      "grad_norm": 0.7797635535101569,
      "learning_rate": 3.066441296814987e-05,
      "loss": 1.1799,
      "num_input_tokens_seen": 38067679008,
      "step": 48385
    },
    {
      "epoch": 5.133248461701676,
      "grad_norm": 0.668218810858088,
      "learning_rate": 3.0663736070939105e-05,
      "loss": 1.2293,
      "num_input_tokens_seen": 38068465744,
      "step": 48386
    },
    {
      "epoch": 5.133354551241248,
      "grad_norm": 0.6120527445925414,
      "learning_rate": 3.0663059169351575e-05,
      "loss": 1.0654,
      "num_input_tokens_seen": 38069252496,
      "step": 48387
    },
    {
      "epoch": 5.133460640780819,
      "grad_norm": 0.7581114794078095,
      "learning_rate": 3.06623822633878e-05,
      "loss": 1.0897,
      "num_input_tokens_seen": 38070039248,
      "step": 48388
    },
    {
      "epoch": 5.13356673032039,
      "grad_norm": 0.9710320426127598,
      "learning_rate": 3.06617053530483e-05,
      "loss": 1.115,
      "num_input_tokens_seen": 38070826032,
      "step": 48389
    },
    {
      "epoch": 5.133672819859962,
      "grad_norm": 0.7761330370059472,
      "learning_rate": 3.066102843833361e-05,
      "loss": 1.0561,
      "num_input_tokens_seen": 38071612912,
      "step": 48390
    },
    {
      "epoch": 5.133778909399533,
      "grad_norm": 1.0184250952284082,
      "learning_rate": 3.066035151924423e-05,
      "loss": 1.0445,
      "num_input_tokens_seen": 38072399680,
      "step": 48391
    },
    {
      "epoch": 5.133884998939105,
      "grad_norm": 0.8092910198466788,
      "learning_rate": 3.06596745957807e-05,
      "loss": 1.1379,
      "num_input_tokens_seen": 38073186416,
      "step": 48392
    },
    {
      "epoch": 5.133991088478676,
      "grad_norm": 0.5736621716351518,
      "learning_rate": 3.065899766794354e-05,
      "loss": 1.1269,
      "num_input_tokens_seen": 38073973136,
      "step": 48393
    },
    {
      "epoch": 5.134097178018248,
      "grad_norm": 1.0010752777082053,
      "learning_rate": 3.065832073573328e-05,
      "loss": 1.2981,
      "num_input_tokens_seen": 38074759936,
      "step": 48394
    },
    {
      "epoch": 5.134203267557819,
      "grad_norm": 0.5609775557914385,
      "learning_rate": 3.065764379915042e-05,
      "loss": 1.1775,
      "num_input_tokens_seen": 38075546672,
      "step": 48395
    },
    {
      "epoch": 5.13430935709739,
      "grad_norm": 0.638996194624662,
      "learning_rate": 3.0656966858195515e-05,
      "loss": 1.0718,
      "num_input_tokens_seen": 38076333520,
      "step": 48396
    },
    {
      "epoch": 5.134415446636962,
      "grad_norm": 0.6571514104505382,
      "learning_rate": 3.065628991286906e-05,
      "loss": 1.117,
      "num_input_tokens_seen": 38077120224,
      "step": 48397
    },
    {
      "epoch": 5.134521536176533,
      "grad_norm": 0.750594543207687,
      "learning_rate": 3.06556129631716e-05,
      "loss": 1.1742,
      "num_input_tokens_seen": 38077906912,
      "step": 48398
    },
    {
      "epoch": 5.134627625716105,
      "grad_norm": 0.6750614510394404,
      "learning_rate": 3.065493600910364e-05,
      "loss": 1.1743,
      "num_input_tokens_seen": 38078693664,
      "step": 48399
    },
    {
      "epoch": 5.134733715255676,
      "grad_norm": 0.6177518116433997,
      "learning_rate": 3.065425905066572e-05,
      "loss": 1.1209,
      "num_input_tokens_seen": 38079480352,
      "step": 48400
    },
    {
      "epoch": 5.134839804795247,
      "grad_norm": 0.6504767523412588,
      "learning_rate": 3.065358208785835e-05,
      "loss": 1.1248,
      "num_input_tokens_seen": 38080267088,
      "step": 48401
    },
    {
      "epoch": 5.134945894334819,
      "grad_norm": 0.7806449742290371,
      "learning_rate": 3.065290512068205e-05,
      "loss": 1.2375,
      "num_input_tokens_seen": 38081053840,
      "step": 48402
    },
    {
      "epoch": 5.13505198387439,
      "grad_norm": 0.6692556116692648,
      "learning_rate": 3.0652228149137356e-05,
      "loss": 1.1269,
      "num_input_tokens_seen": 38081840672,
      "step": 48403
    },
    {
      "epoch": 5.135158073413962,
      "grad_norm": 1.073016497442175,
      "learning_rate": 3.0651551173224786e-05,
      "loss": 1.2382,
      "num_input_tokens_seen": 38082627408,
      "step": 48404
    },
    {
      "epoch": 5.135264162953533,
      "grad_norm": 0.6391563728224935,
      "learning_rate": 3.0650874192944866e-05,
      "loss": 1.168,
      "num_input_tokens_seen": 38083414176,
      "step": 48405
    },
    {
      "epoch": 5.135370252493104,
      "grad_norm": 0.6993361421821029,
      "learning_rate": 3.065019720829811e-05,
      "loss": 1.0233,
      "num_input_tokens_seen": 38084200880,
      "step": 48406
    },
    {
      "epoch": 5.135476342032676,
      "grad_norm": 0.590341804255488,
      "learning_rate": 3.064952021928505e-05,
      "loss": 1.1255,
      "num_input_tokens_seen": 38084987696,
      "step": 48407
    },
    {
      "epoch": 5.135582431572247,
      "grad_norm": 0.7097143285693653,
      "learning_rate": 3.0648843225906216e-05,
      "loss": 1.1607,
      "num_input_tokens_seen": 38085774384,
      "step": 48408
    },
    {
      "epoch": 5.135688521111819,
      "grad_norm": 0.7614457527927543,
      "learning_rate": 3.064816622816212e-05,
      "loss": 1.1326,
      "num_input_tokens_seen": 38086561184,
      "step": 48409
    },
    {
      "epoch": 5.13579461065139,
      "grad_norm": 0.6388686686914736,
      "learning_rate": 3.064748922605328e-05,
      "loss": 1.1471,
      "num_input_tokens_seen": 38087347888,
      "step": 48410
    },
    {
      "epoch": 5.135900700190962,
      "grad_norm": 0.624112946055572,
      "learning_rate": 3.0646812219580226e-05,
      "loss": 1.1926,
      "num_input_tokens_seen": 38088134640,
      "step": 48411
    },
    {
      "epoch": 5.136006789730533,
      "grad_norm": 0.8868261303622785,
      "learning_rate": 3.064613520874348e-05,
      "loss": 1.1705,
      "num_input_tokens_seen": 38088921360,
      "step": 48412
    },
    {
      "epoch": 5.136112879270104,
      "grad_norm": 0.6551950879336168,
      "learning_rate": 3.064545819354357e-05,
      "loss": 1.2115,
      "num_input_tokens_seen": 38089708144,
      "step": 48413
    },
    {
      "epoch": 5.1362189688096755,
      "grad_norm": 0.551094225118507,
      "learning_rate": 3.064478117398102e-05,
      "loss": 1.1602,
      "num_input_tokens_seen": 38090494928,
      "step": 48414
    },
    {
      "epoch": 5.136325058349247,
      "grad_norm": 0.8123565632506686,
      "learning_rate": 3.0644104150056336e-05,
      "loss": 1.183,
      "num_input_tokens_seen": 38091281856,
      "step": 48415
    },
    {
      "epoch": 5.1364311478888185,
      "grad_norm": 0.8702643615923731,
      "learning_rate": 3.0643427121770066e-05,
      "loss": 1.1956,
      "num_input_tokens_seen": 38092068608,
      "step": 48416
    },
    {
      "epoch": 5.1365372374283895,
      "grad_norm": 0.6279236568538964,
      "learning_rate": 3.064275008912272e-05,
      "loss": 1.122,
      "num_input_tokens_seen": 38092855376,
      "step": 48417
    },
    {
      "epoch": 5.1366433269679606,
      "grad_norm": 0.8620543569544936,
      "learning_rate": 3.064207305211481e-05,
      "loss": 1.134,
      "num_input_tokens_seen": 38093642160,
      "step": 48418
    },
    {
      "epoch": 5.1367494165075325,
      "grad_norm": 0.6935653498592028,
      "learning_rate": 3.064139601074688e-05,
      "loss": 1.0956,
      "num_input_tokens_seen": 38094428976,
      "step": 48419
    },
    {
      "epoch": 5.1368555060471035,
      "grad_norm": 0.6922623779532604,
      "learning_rate": 3.064071896501945e-05,
      "loss": 1.1029,
      "num_input_tokens_seen": 38095215696,
      "step": 48420
    },
    {
      "epoch": 5.136961595586675,
      "grad_norm": 0.7208612121231166,
      "learning_rate": 3.064004191493303e-05,
      "loss": 1.1888,
      "num_input_tokens_seen": 38096002416,
      "step": 48421
    },
    {
      "epoch": 5.1370676851262465,
      "grad_norm": 0.6187893365469936,
      "learning_rate": 3.063936486048816e-05,
      "loss": 1.1824,
      "num_input_tokens_seen": 38096789200,
      "step": 48422
    },
    {
      "epoch": 5.137173774665818,
      "grad_norm": 0.536791129729645,
      "learning_rate": 3.0638687801685344e-05,
      "loss": 1.1645,
      "num_input_tokens_seen": 38097575968,
      "step": 48423
    },
    {
      "epoch": 5.137279864205389,
      "grad_norm": 0.7255909507899378,
      "learning_rate": 3.063801073852512e-05,
      "loss": 1.1846,
      "num_input_tokens_seen": 38098362736,
      "step": 48424
    },
    {
      "epoch": 5.13738595374496,
      "grad_norm": 0.583089488356583,
      "learning_rate": 3.0637333671008004e-05,
      "loss": 1.1499,
      "num_input_tokens_seen": 38099149392,
      "step": 48425
    },
    {
      "epoch": 5.137492043284532,
      "grad_norm": 0.5811609747239371,
      "learning_rate": 3.063665659913453e-05,
      "loss": 1.1147,
      "num_input_tokens_seen": 38099936064,
      "step": 48426
    },
    {
      "epoch": 5.137598132824103,
      "grad_norm": 0.7166538383060033,
      "learning_rate": 3.06359795229052e-05,
      "loss": 1.119,
      "num_input_tokens_seen": 38100722928,
      "step": 48427
    },
    {
      "epoch": 5.137704222363675,
      "grad_norm": 0.6006444250062443,
      "learning_rate": 3.0635302442320564e-05,
      "loss": 1.1814,
      "num_input_tokens_seen": 38101509664,
      "step": 48428
    },
    {
      "epoch": 5.137810311903246,
      "grad_norm": 0.6916392810923218,
      "learning_rate": 3.063462535738112e-05,
      "loss": 1.1301,
      "num_input_tokens_seen": 38102296400,
      "step": 48429
    },
    {
      "epoch": 5.137916401442817,
      "grad_norm": 0.5749728994646944,
      "learning_rate": 3.063394826808741e-05,
      "loss": 1.1301,
      "num_input_tokens_seen": 38103083216,
      "step": 48430
    },
    {
      "epoch": 5.138022490982389,
      "grad_norm": 0.6873496686544961,
      "learning_rate": 3.0633271174439955e-05,
      "loss": 1.2045,
      "num_input_tokens_seen": 38103869872,
      "step": 48431
    },
    {
      "epoch": 5.13812858052196,
      "grad_norm": 0.601895851655344,
      "learning_rate": 3.063259407643926e-05,
      "loss": 1.1617,
      "num_input_tokens_seen": 38104656656,
      "step": 48432
    },
    {
      "epoch": 5.138234670061532,
      "grad_norm": 0.5120146128865575,
      "learning_rate": 3.0631916974085874e-05,
      "loss": 1.09,
      "num_input_tokens_seen": 38105443360,
      "step": 48433
    },
    {
      "epoch": 5.138340759601103,
      "grad_norm": 0.5773585942830157,
      "learning_rate": 3.0631239867380304e-05,
      "loss": 1.0883,
      "num_input_tokens_seen": 38106230176,
      "step": 48434
    },
    {
      "epoch": 5.138446849140674,
      "grad_norm": 0.5428630973428743,
      "learning_rate": 3.0630562756323065e-05,
      "loss": 1.1722,
      "num_input_tokens_seen": 38107016896,
      "step": 48435
    },
    {
      "epoch": 5.138552938680246,
      "grad_norm": 0.6802982651616477,
      "learning_rate": 3.0629885640914705e-05,
      "loss": 1.1674,
      "num_input_tokens_seen": 38107803680,
      "step": 48436
    },
    {
      "epoch": 5.138659028219817,
      "grad_norm": 0.5445715861370517,
      "learning_rate": 3.062920852115574e-05,
      "loss": 1.1035,
      "num_input_tokens_seen": 38108590448,
      "step": 48437
    },
    {
      "epoch": 5.138765117759389,
      "grad_norm": 0.584425442085997,
      "learning_rate": 3.062853139704667e-05,
      "loss": 1.1732,
      "num_input_tokens_seen": 38109377216,
      "step": 48438
    },
    {
      "epoch": 5.13887120729896,
      "grad_norm": 0.5990716506866957,
      "learning_rate": 3.0627854268588055e-05,
      "loss": 1.1734,
      "num_input_tokens_seen": 38110164032,
      "step": 48439
    },
    {
      "epoch": 5.138977296838532,
      "grad_norm": 0.5283903654322426,
      "learning_rate": 3.0627177135780385e-05,
      "loss": 1.0868,
      "num_input_tokens_seen": 38110950800,
      "step": 48440
    },
    {
      "epoch": 5.139083386378103,
      "grad_norm": 0.6962078663325738,
      "learning_rate": 3.0626499998624204e-05,
      "loss": 1.1268,
      "num_input_tokens_seen": 38111737568,
      "step": 48441
    },
    {
      "epoch": 5.139189475917674,
      "grad_norm": 0.654258290120767,
      "learning_rate": 3.0625822857120026e-05,
      "loss": 1.0938,
      "num_input_tokens_seen": 38112524336,
      "step": 48442
    },
    {
      "epoch": 5.139295565457246,
      "grad_norm": 0.7952181564908956,
      "learning_rate": 3.062514571126839e-05,
      "loss": 1.1091,
      "num_input_tokens_seen": 38113311024,
      "step": 48443
    },
    {
      "epoch": 5.139401654996817,
      "grad_norm": 0.605857354970504,
      "learning_rate": 3.062446856106978e-05,
      "loss": 1.0871,
      "num_input_tokens_seen": 38114097776,
      "step": 48444
    },
    {
      "epoch": 5.139507744536389,
      "grad_norm": 1.4489533374303205,
      "learning_rate": 3.0623791406524774e-05,
      "loss": 1.152,
      "num_input_tokens_seen": 38114884560,
      "step": 48445
    },
    {
      "epoch": 5.13961383407596,
      "grad_norm": 0.7729087720323966,
      "learning_rate": 3.062311424763385e-05,
      "loss": 1.1899,
      "num_input_tokens_seen": 38115671312,
      "step": 48446
    },
    {
      "epoch": 5.139719923615531,
      "grad_norm": 0.7522898455609789,
      "learning_rate": 3.062243708439755e-05,
      "loss": 1.1473,
      "num_input_tokens_seen": 38116458176,
      "step": 48447
    },
    {
      "epoch": 5.139826013155103,
      "grad_norm": 0.9256671062396759,
      "learning_rate": 3.062175991681641e-05,
      "loss": 1.1716,
      "num_input_tokens_seen": 38117244944,
      "step": 48448
    },
    {
      "epoch": 5.139932102694674,
      "grad_norm": 0.5882478629150109,
      "learning_rate": 3.062108274489092e-05,
      "loss": 1.1241,
      "num_input_tokens_seen": 38118031728,
      "step": 48449
    },
    {
      "epoch": 5.140038192234246,
      "grad_norm": 0.6888517572220045,
      "learning_rate": 3.062040556862162e-05,
      "loss": 1.1141,
      "num_input_tokens_seen": 38118818480,
      "step": 48450
    },
    {
      "epoch": 5.140144281773817,
      "grad_norm": 0.5675635561195205,
      "learning_rate": 3.061972838800905e-05,
      "loss": 1.0398,
      "num_input_tokens_seen": 38119605264,
      "step": 48451
    },
    {
      "epoch": 5.140250371313389,
      "grad_norm": 0.6344574046653466,
      "learning_rate": 3.061905120305372e-05,
      "loss": 1.2317,
      "num_input_tokens_seen": 38120391984,
      "step": 48452
    },
    {
      "epoch": 5.14035646085296,
      "grad_norm": 0.552366593005623,
      "learning_rate": 3.0618374013756134e-05,
      "loss": 1.0417,
      "num_input_tokens_seen": 38121178752,
      "step": 48453
    },
    {
      "epoch": 5.140462550392531,
      "grad_norm": 0.6430539466007574,
      "learning_rate": 3.061769682011685e-05,
      "loss": 1.1475,
      "num_input_tokens_seen": 38121965520,
      "step": 48454
    },
    {
      "epoch": 5.140568639932103,
      "grad_norm": 0.6047442400963422,
      "learning_rate": 3.061701962213637e-05,
      "loss": 1.05,
      "num_input_tokens_seen": 38122752272,
      "step": 48455
    },
    {
      "epoch": 5.140674729471674,
      "grad_norm": 0.6497085352849817,
      "learning_rate": 3.061634241981522e-05,
      "loss": 1.1262,
      "num_input_tokens_seen": 38123539056,
      "step": 48456
    },
    {
      "epoch": 5.140780819011246,
      "grad_norm": 0.5114434545033106,
      "learning_rate": 3.0615665213153934e-05,
      "loss": 1.1331,
      "num_input_tokens_seen": 38124325792,
      "step": 48457
    },
    {
      "epoch": 5.140886908550817,
      "grad_norm": 0.778953914350604,
      "learning_rate": 3.061498800215301e-05,
      "loss": 1.224,
      "num_input_tokens_seen": 38125112480,
      "step": 48458
    },
    {
      "epoch": 5.140992998090388,
      "grad_norm": 0.5835751522019912,
      "learning_rate": 3.0614310786813e-05,
      "loss": 1.19,
      "num_input_tokens_seen": 38125899264,
      "step": 48459
    },
    {
      "epoch": 5.14109908762996,
      "grad_norm": 0.7152131389705779,
      "learning_rate": 3.061363356713441e-05,
      "loss": 1.1627,
      "num_input_tokens_seen": 38126686016,
      "step": 48460
    },
    {
      "epoch": 5.141205177169531,
      "grad_norm": 0.56973605817756,
      "learning_rate": 3.061295634311778e-05,
      "loss": 1.2231,
      "num_input_tokens_seen": 38127472768,
      "step": 48461
    },
    {
      "epoch": 5.141311266709103,
      "grad_norm": 0.6465262957304609,
      "learning_rate": 3.061227911476361e-05,
      "loss": 1.159,
      "num_input_tokens_seen": 38128259456,
      "step": 48462
    },
    {
      "epoch": 5.141417356248674,
      "grad_norm": 0.6898807341141511,
      "learning_rate": 3.061160188207244e-05,
      "loss": 1.1492,
      "num_input_tokens_seen": 38129046240,
      "step": 48463
    },
    {
      "epoch": 5.141523445788245,
      "grad_norm": 0.7394111800931686,
      "learning_rate": 3.061092464504479e-05,
      "loss": 1.1765,
      "num_input_tokens_seen": 38129833056,
      "step": 48464
    },
    {
      "epoch": 5.141629535327817,
      "grad_norm": 0.6182910720746985,
      "learning_rate": 3.061024740368118e-05,
      "loss": 1.1072,
      "num_input_tokens_seen": 38130619824,
      "step": 48465
    },
    {
      "epoch": 5.141735624867388,
      "grad_norm": 0.7701230490326362,
      "learning_rate": 3.060957015798214e-05,
      "loss": 1.1319,
      "num_input_tokens_seen": 38131406608,
      "step": 48466
    },
    {
      "epoch": 5.14184171440696,
      "grad_norm": 0.6803994506556946,
      "learning_rate": 3.060889290794818e-05,
      "loss": 1.1525,
      "num_input_tokens_seen": 38132193328,
      "step": 48467
    },
    {
      "epoch": 5.141947803946531,
      "grad_norm": 0.6510633804176343,
      "learning_rate": 3.0608215653579835e-05,
      "loss": 1.0978,
      "num_input_tokens_seen": 38132980096,
      "step": 48468
    },
    {
      "epoch": 5.142053893486103,
      "grad_norm": 0.6022387995073853,
      "learning_rate": 3.060753839487763e-05,
      "loss": 1.1197,
      "num_input_tokens_seen": 38133766848,
      "step": 48469
    },
    {
      "epoch": 5.142159983025674,
      "grad_norm": 0.8671615069634477,
      "learning_rate": 3.060686113184208e-05,
      "loss": 1.1602,
      "num_input_tokens_seen": 38134553632,
      "step": 48470
    },
    {
      "epoch": 5.142266072565245,
      "grad_norm": 0.6403912355089904,
      "learning_rate": 3.0606183864473713e-05,
      "loss": 1.1166,
      "num_input_tokens_seen": 38135340384,
      "step": 48471
    },
    {
      "epoch": 5.142372162104817,
      "grad_norm": 0.8023421996413945,
      "learning_rate": 3.060550659277305e-05,
      "loss": 1.1811,
      "num_input_tokens_seen": 38136127168,
      "step": 48472
    },
    {
      "epoch": 5.142478251644388,
      "grad_norm": 0.6844539031347441,
      "learning_rate": 3.060482931674062e-05,
      "loss": 1.1626,
      "num_input_tokens_seen": 38136913952,
      "step": 48473
    },
    {
      "epoch": 5.14258434118396,
      "grad_norm": 0.5755624258825761,
      "learning_rate": 3.0604152036376944e-05,
      "loss": 1.0704,
      "num_input_tokens_seen": 38137700656,
      "step": 48474
    },
    {
      "epoch": 5.142690430723531,
      "grad_norm": 0.6551722798559271,
      "learning_rate": 3.060347475168253e-05,
      "loss": 1.0742,
      "num_input_tokens_seen": 38138487536,
      "step": 48475
    },
    {
      "epoch": 5.142796520263102,
      "grad_norm": 0.6441100672961104,
      "learning_rate": 3.060279746265793e-05,
      "loss": 1.1667,
      "num_input_tokens_seen": 38139274240,
      "step": 48476
    },
    {
      "epoch": 5.1429026098026736,
      "grad_norm": 0.7350988679066194,
      "learning_rate": 3.060212016930365e-05,
      "loss": 1.1092,
      "num_input_tokens_seen": 38140061072,
      "step": 48477
    },
    {
      "epoch": 5.143008699342245,
      "grad_norm": 0.7155272241439498,
      "learning_rate": 3.060144287162021e-05,
      "loss": 1.114,
      "num_input_tokens_seen": 38140847872,
      "step": 48478
    },
    {
      "epoch": 5.1431147888818165,
      "grad_norm": 0.6045864149048645,
      "learning_rate": 3.060076556960815e-05,
      "loss": 1.1877,
      "num_input_tokens_seen": 38141634624,
      "step": 48479
    },
    {
      "epoch": 5.1432208784213875,
      "grad_norm": 0.7185066315976112,
      "learning_rate": 3.0600088263267976e-05,
      "loss": 1.1459,
      "num_input_tokens_seen": 38142421472,
      "step": 48480
    },
    {
      "epoch": 5.1433269679609595,
      "grad_norm": 0.703848893115445,
      "learning_rate": 3.059941095260021e-05,
      "loss": 1.0988,
      "num_input_tokens_seen": 38143208224,
      "step": 48481
    },
    {
      "epoch": 5.1434330575005305,
      "grad_norm": 0.6483757028298718,
      "learning_rate": 3.059873363760539e-05,
      "loss": 1.1275,
      "num_input_tokens_seen": 38143994960,
      "step": 48482
    },
    {
      "epoch": 5.1435391470401015,
      "grad_norm": 0.8431288933083706,
      "learning_rate": 3.059805631828404e-05,
      "loss": 1.1722,
      "num_input_tokens_seen": 38144781664,
      "step": 48483
    },
    {
      "epoch": 5.143645236579673,
      "grad_norm": 0.6766410434714152,
      "learning_rate": 3.0597378994636664e-05,
      "loss": 1.1372,
      "num_input_tokens_seen": 38145568320,
      "step": 48484
    },
    {
      "epoch": 5.1437513261192445,
      "grad_norm": 0.6065618823895015,
      "learning_rate": 3.059670166666381e-05,
      "loss": 1.1492,
      "num_input_tokens_seen": 38146355184,
      "step": 48485
    },
    {
      "epoch": 5.143857415658816,
      "grad_norm": 0.605264450187652,
      "learning_rate": 3.059602433436598e-05,
      "loss": 1.1767,
      "num_input_tokens_seen": 38147141984,
      "step": 48486
    },
    {
      "epoch": 5.143963505198387,
      "grad_norm": 0.6696791440319608,
      "learning_rate": 3.0595346997743704e-05,
      "loss": 1.147,
      "num_input_tokens_seen": 38147928752,
      "step": 48487
    },
    {
      "epoch": 5.144069594737958,
      "grad_norm": 0.6240560593598231,
      "learning_rate": 3.059466965679752e-05,
      "loss": 1.1727,
      "num_input_tokens_seen": 38148715472,
      "step": 48488
    },
    {
      "epoch": 5.14417568427753,
      "grad_norm": 0.6352605707412534,
      "learning_rate": 3.059399231152793e-05,
      "loss": 1.2182,
      "num_input_tokens_seen": 38149502272,
      "step": 48489
    },
    {
      "epoch": 5.144281773817101,
      "grad_norm": 0.5602730897446193,
      "learning_rate": 3.059331496193547e-05,
      "loss": 1.142,
      "num_input_tokens_seen": 38150289056,
      "step": 48490
    },
    {
      "epoch": 5.144387863356673,
      "grad_norm": 0.667582493972152,
      "learning_rate": 3.059263760802066e-05,
      "loss": 1.1734,
      "num_input_tokens_seen": 38151075872,
      "step": 48491
    },
    {
      "epoch": 5.144493952896244,
      "grad_norm": 0.6943670820980834,
      "learning_rate": 3.0591960249784024e-05,
      "loss": 1.127,
      "num_input_tokens_seen": 38151862608,
      "step": 48492
    },
    {
      "epoch": 5.144600042435816,
      "grad_norm": 0.7524516265280099,
      "learning_rate": 3.0591282887226094e-05,
      "loss": 1.1249,
      "num_input_tokens_seen": 38152649280,
      "step": 48493
    },
    {
      "epoch": 5.144706131975387,
      "grad_norm": 0.6148912711447904,
      "learning_rate": 3.059060552034737e-05,
      "loss": 1.1331,
      "num_input_tokens_seen": 38153436144,
      "step": 48494
    },
    {
      "epoch": 5.144812221514958,
      "grad_norm": 0.8945024770370029,
      "learning_rate": 3.0589928149148394e-05,
      "loss": 1.1816,
      "num_input_tokens_seen": 38154222928,
      "step": 48495
    },
    {
      "epoch": 5.14491831105453,
      "grad_norm": 0.6120323226196058,
      "learning_rate": 3.0589250773629694e-05,
      "loss": 1.2229,
      "num_input_tokens_seen": 38155009552,
      "step": 48496
    },
    {
      "epoch": 5.145024400594101,
      "grad_norm": 0.6245178107781314,
      "learning_rate": 3.058857339379178e-05,
      "loss": 1.2534,
      "num_input_tokens_seen": 38155796384,
      "step": 48497
    },
    {
      "epoch": 5.145130490133673,
      "grad_norm": 0.6378446970574658,
      "learning_rate": 3.058789600963517e-05,
      "loss": 1.162,
      "num_input_tokens_seen": 38156583136,
      "step": 48498
    },
    {
      "epoch": 5.145236579673244,
      "grad_norm": 0.7170331033402966,
      "learning_rate": 3.0587218621160404e-05,
      "loss": 1.2281,
      "num_input_tokens_seen": 38157369888,
      "step": 48499
    },
    {
      "epoch": 5.145342669212815,
      "grad_norm": 0.6629771945672578,
      "learning_rate": 3.058654122836801e-05,
      "loss": 1.2281,
      "num_input_tokens_seen": 38158156608,
      "step": 48500
    },
    {
      "epoch": 5.145448758752387,
      "grad_norm": 0.5781502090108314,
      "learning_rate": 3.058586383125849e-05,
      "loss": 1.1214,
      "num_input_tokens_seen": 38158943424,
      "step": 48501
    },
    {
      "epoch": 5.145554848291958,
      "grad_norm": 0.5612635795328955,
      "learning_rate": 3.058518642983238e-05,
      "loss": 1.1068,
      "num_input_tokens_seen": 38159730160,
      "step": 48502
    },
    {
      "epoch": 5.14566093783153,
      "grad_norm": 0.6346622424674855,
      "learning_rate": 3.058450902409021e-05,
      "loss": 1.2254,
      "num_input_tokens_seen": 38160516912,
      "step": 48503
    },
    {
      "epoch": 5.145767027371101,
      "grad_norm": 0.6348806298464734,
      "learning_rate": 3.058383161403248e-05,
      "loss": 1.0945,
      "num_input_tokens_seen": 38161303696,
      "step": 48504
    },
    {
      "epoch": 5.145873116910673,
      "grad_norm": 0.5787569334294159,
      "learning_rate": 3.058315419965974e-05,
      "loss": 1.1504,
      "num_input_tokens_seen": 38162090464,
      "step": 48505
    },
    {
      "epoch": 5.145979206450244,
      "grad_norm": 0.5530559550569971,
      "learning_rate": 3.0582476780972504e-05,
      "loss": 1.2212,
      "num_input_tokens_seen": 38162877184,
      "step": 48506
    },
    {
      "epoch": 5.146085295989815,
      "grad_norm": 0.5755992917896983,
      "learning_rate": 3.0581799357971285e-05,
      "loss": 1.1455,
      "num_input_tokens_seen": 38163663936,
      "step": 48507
    },
    {
      "epoch": 5.146191385529387,
      "grad_norm": 0.5849247141795819,
      "learning_rate": 3.058112193065662e-05,
      "loss": 0.9937,
      "num_input_tokens_seen": 38164450800,
      "step": 48508
    },
    {
      "epoch": 5.146297475068958,
      "grad_norm": 0.5952484635883241,
      "learning_rate": 3.058044449902903e-05,
      "loss": 1.1368,
      "num_input_tokens_seen": 38165237648,
      "step": 48509
    },
    {
      "epoch": 5.14640356460853,
      "grad_norm": 0.6688890065357962,
      "learning_rate": 3.057976706308903e-05,
      "loss": 1.1113,
      "num_input_tokens_seen": 38166024400,
      "step": 48510
    },
    {
      "epoch": 5.146509654148101,
      "grad_norm": 0.6097300342057528,
      "learning_rate": 3.057908962283716e-05,
      "loss": 1.1463,
      "num_input_tokens_seen": 38166811184,
      "step": 48511
    },
    {
      "epoch": 5.146615743687672,
      "grad_norm": 0.5453568682530808,
      "learning_rate": 3.0578412178273925e-05,
      "loss": 1.1318,
      "num_input_tokens_seen": 38167597936,
      "step": 48512
    },
    {
      "epoch": 5.146721833227244,
      "grad_norm": 0.6069646615540514,
      "learning_rate": 3.0577734729399854e-05,
      "loss": 1.212,
      "num_input_tokens_seen": 38168384752,
      "step": 48513
    },
    {
      "epoch": 5.146827922766815,
      "grad_norm": 0.6019921166162348,
      "learning_rate": 3.0577057276215484e-05,
      "loss": 1.1297,
      "num_input_tokens_seen": 38169171632,
      "step": 48514
    },
    {
      "epoch": 5.146934012306387,
      "grad_norm": 0.6174746391206911,
      "learning_rate": 3.0576379818721315e-05,
      "loss": 1.1688,
      "num_input_tokens_seen": 38169958416,
      "step": 48515
    },
    {
      "epoch": 5.147040101845958,
      "grad_norm": 0.5761384088206537,
      "learning_rate": 3.057570235691789e-05,
      "loss": 1.1429,
      "num_input_tokens_seen": 38170745168,
      "step": 48516
    },
    {
      "epoch": 5.147146191385529,
      "grad_norm": 0.7709552977714451,
      "learning_rate": 3.057502489080573e-05,
      "loss": 1.1039,
      "num_input_tokens_seen": 38171531936,
      "step": 48517
    },
    {
      "epoch": 5.147252280925101,
      "grad_norm": 0.7206297219263531,
      "learning_rate": 3.057434742038534e-05,
      "loss": 1.0986,
      "num_input_tokens_seen": 38172318784,
      "step": 48518
    },
    {
      "epoch": 5.147358370464672,
      "grad_norm": 0.6362748053456722,
      "learning_rate": 3.057366994565727e-05,
      "loss": 1.1794,
      "num_input_tokens_seen": 38173105536,
      "step": 48519
    },
    {
      "epoch": 5.147464460004244,
      "grad_norm": 0.753912678131079,
      "learning_rate": 3.057299246662203e-05,
      "loss": 1.0841,
      "num_input_tokens_seen": 38173892384,
      "step": 48520
    },
    {
      "epoch": 5.147570549543815,
      "grad_norm": 0.6819762141811676,
      "learning_rate": 3.0572314983280145e-05,
      "loss": 1.0785,
      "num_input_tokens_seen": 38174679136,
      "step": 48521
    },
    {
      "epoch": 5.147676639083387,
      "grad_norm": 0.7134218185841349,
      "learning_rate": 3.0571637495632146e-05,
      "loss": 1.2514,
      "num_input_tokens_seen": 38175465952,
      "step": 48522
    },
    {
      "epoch": 5.147782728622958,
      "grad_norm": 0.6188708479125546,
      "learning_rate": 3.057096000367854e-05,
      "loss": 1.1989,
      "num_input_tokens_seen": 38176252720,
      "step": 48523
    },
    {
      "epoch": 5.147888818162529,
      "grad_norm": 0.5857941373779033,
      "learning_rate": 3.0570282507419856e-05,
      "loss": 1.1441,
      "num_input_tokens_seen": 38177039488,
      "step": 48524
    },
    {
      "epoch": 5.147994907702101,
      "grad_norm": 0.5719280752794224,
      "learning_rate": 3.056960500685663e-05,
      "loss": 1.1722,
      "num_input_tokens_seen": 38177826272,
      "step": 48525
    },
    {
      "epoch": 5.148100997241672,
      "grad_norm": 0.5945874783061492,
      "learning_rate": 3.056892750198937e-05,
      "loss": 1.1075,
      "num_input_tokens_seen": 38178613024,
      "step": 48526
    },
    {
      "epoch": 5.148207086781244,
      "grad_norm": 0.587985655321116,
      "learning_rate": 3.0568249992818604e-05,
      "loss": 1.0934,
      "num_input_tokens_seen": 38179399712,
      "step": 48527
    },
    {
      "epoch": 5.148313176320815,
      "grad_norm": 0.6345492323603992,
      "learning_rate": 3.056757247934486e-05,
      "loss": 1.1111,
      "num_input_tokens_seen": 38180186384,
      "step": 48528
    },
    {
      "epoch": 5.148419265860386,
      "grad_norm": 0.7192522179257502,
      "learning_rate": 3.056689496156867e-05,
      "loss": 1.1931,
      "num_input_tokens_seen": 38180973136,
      "step": 48529
    },
    {
      "epoch": 5.148525355399958,
      "grad_norm": 1.1614755259329426,
      "learning_rate": 3.056621743949054e-05,
      "loss": 1.2472,
      "num_input_tokens_seen": 38181759872,
      "step": 48530
    },
    {
      "epoch": 5.148631444939529,
      "grad_norm": 0.8717590617853852,
      "learning_rate": 3.0565539913110994e-05,
      "loss": 1.233,
      "num_input_tokens_seen": 38182546752,
      "step": 48531
    },
    {
      "epoch": 5.148737534479101,
      "grad_norm": 0.6160743979008287,
      "learning_rate": 3.056486238243056e-05,
      "loss": 1.1067,
      "num_input_tokens_seen": 38183333568,
      "step": 48532
    },
    {
      "epoch": 5.148843624018672,
      "grad_norm": 0.7404844883569219,
      "learning_rate": 3.056418484744978e-05,
      "loss": 1.2106,
      "num_input_tokens_seen": 38184120336,
      "step": 48533
    },
    {
      "epoch": 5.148949713558244,
      "grad_norm": 0.6349229762998386,
      "learning_rate": 3.0563507308169145e-05,
      "loss": 1.0575,
      "num_input_tokens_seen": 38184907216,
      "step": 48534
    },
    {
      "epoch": 5.149055803097815,
      "grad_norm": 0.8135680475662284,
      "learning_rate": 3.05628297645892e-05,
      "loss": 1.1685,
      "num_input_tokens_seen": 38185693904,
      "step": 48535
    },
    {
      "epoch": 5.149161892637386,
      "grad_norm": 0.5751749132963658,
      "learning_rate": 3.056215221671047e-05,
      "loss": 1.1418,
      "num_input_tokens_seen": 38186480640,
      "step": 48536
    },
    {
      "epoch": 5.149267982176958,
      "grad_norm": 0.5960073971990775,
      "learning_rate": 3.056147466453347e-05,
      "loss": 1.0838,
      "num_input_tokens_seen": 38187267520,
      "step": 48537
    },
    {
      "epoch": 5.149374071716529,
      "grad_norm": 0.7208601110657348,
      "learning_rate": 3.056079710805872e-05,
      "loss": 1.13,
      "num_input_tokens_seen": 38188054304,
      "step": 48538
    },
    {
      "epoch": 5.1494801612561005,
      "grad_norm": 0.5893545503673592,
      "learning_rate": 3.0560119547286755e-05,
      "loss": 1.111,
      "num_input_tokens_seen": 38188841072,
      "step": 48539
    },
    {
      "epoch": 5.149586250795672,
      "grad_norm": 0.6011213517684864,
      "learning_rate": 3.055944198221809e-05,
      "loss": 1.2593,
      "num_input_tokens_seen": 38189627856,
      "step": 48540
    },
    {
      "epoch": 5.149692340335243,
      "grad_norm": 0.6274481558693044,
      "learning_rate": 3.055876441285325e-05,
      "loss": 1.1977,
      "num_input_tokens_seen": 38190414576,
      "step": 48541
    },
    {
      "epoch": 5.1497984298748145,
      "grad_norm": 0.6807893513412232,
      "learning_rate": 3.055808683919276e-05,
      "loss": 1.1527,
      "num_input_tokens_seen": 38191201424,
      "step": 48542
    },
    {
      "epoch": 5.1499045194143855,
      "grad_norm": 0.5822516217691074,
      "learning_rate": 3.055740926123714e-05,
      "loss": 1.1176,
      "num_input_tokens_seen": 38191988208,
      "step": 48543
    },
    {
      "epoch": 5.1500106089539575,
      "grad_norm": 0.5813494185568567,
      "learning_rate": 3.055673167898692e-05,
      "loss": 1.1226,
      "num_input_tokens_seen": 38192774896,
      "step": 48544
    },
    {
      "epoch": 5.1501166984935285,
      "grad_norm": 0.6461057125298612,
      "learning_rate": 3.055605409244262e-05,
      "loss": 1.074,
      "num_input_tokens_seen": 38193561680,
      "step": 48545
    },
    {
      "epoch": 5.1502227880330995,
      "grad_norm": 0.5172699924088181,
      "learning_rate": 3.055537650160477e-05,
      "loss": 1.1318,
      "num_input_tokens_seen": 38194348496,
      "step": 48546
    },
    {
      "epoch": 5.150328877572671,
      "grad_norm": 1.2670748302134234,
      "learning_rate": 3.055469890647388e-05,
      "loss": 1.1744,
      "num_input_tokens_seen": 38195135248,
      "step": 48547
    },
    {
      "epoch": 5.1504349671122425,
      "grad_norm": 0.6548317725823275,
      "learning_rate": 3.055402130705049e-05,
      "loss": 1.1155,
      "num_input_tokens_seen": 38195922048,
      "step": 48548
    },
    {
      "epoch": 5.150541056651814,
      "grad_norm": 0.6118094380964378,
      "learning_rate": 3.055334370333511e-05,
      "loss": 1.1722,
      "num_input_tokens_seen": 38196708800,
      "step": 48549
    },
    {
      "epoch": 5.150647146191385,
      "grad_norm": 0.742497759335735,
      "learning_rate": 3.055266609532827e-05,
      "loss": 1.1685,
      "num_input_tokens_seen": 38197495488,
      "step": 48550
    },
    {
      "epoch": 5.150753235730957,
      "grad_norm": 0.5771953871090958,
      "learning_rate": 3.0551988483030495e-05,
      "loss": 1.1724,
      "num_input_tokens_seen": 38198282224,
      "step": 48551
    },
    {
      "epoch": 5.150859325270528,
      "grad_norm": 0.8790636915464851,
      "learning_rate": 3.055131086644231e-05,
      "loss": 1.103,
      "num_input_tokens_seen": 38199069008,
      "step": 48552
    },
    {
      "epoch": 5.150965414810099,
      "grad_norm": 0.6061557156070019,
      "learning_rate": 3.055063324556422e-05,
      "loss": 1.1205,
      "num_input_tokens_seen": 38199855728,
      "step": 48553
    },
    {
      "epoch": 5.151071504349671,
      "grad_norm": 0.6075677154176928,
      "learning_rate": 3.0549955620396774e-05,
      "loss": 1.0915,
      "num_input_tokens_seen": 38200642512,
      "step": 48554
    },
    {
      "epoch": 5.151177593889242,
      "grad_norm": 0.8738807956602497,
      "learning_rate": 3.054927799094049e-05,
      "loss": 1.1454,
      "num_input_tokens_seen": 38201429296,
      "step": 48555
    },
    {
      "epoch": 5.151283683428814,
      "grad_norm": 0.6908991000923411,
      "learning_rate": 3.0548600357195875e-05,
      "loss": 1.2053,
      "num_input_tokens_seen": 38202216096,
      "step": 48556
    },
    {
      "epoch": 5.151389772968385,
      "grad_norm": 0.9625966935412826,
      "learning_rate": 3.054792271916347e-05,
      "loss": 1.1474,
      "num_input_tokens_seen": 38203002880,
      "step": 48557
    },
    {
      "epoch": 5.151495862507956,
      "grad_norm": 0.658492243903854,
      "learning_rate": 3.054724507684379e-05,
      "loss": 1.127,
      "num_input_tokens_seen": 38203789744,
      "step": 48558
    },
    {
      "epoch": 5.151601952047528,
      "grad_norm": 0.7517169527061642,
      "learning_rate": 3.054656743023737e-05,
      "loss": 1.1613,
      "num_input_tokens_seen": 38204576416,
      "step": 48559
    },
    {
      "epoch": 5.151708041587099,
      "grad_norm": 0.7888611231299516,
      "learning_rate": 3.054588977934472e-05,
      "loss": 1.2214,
      "num_input_tokens_seen": 38205363200,
      "step": 48560
    },
    {
      "epoch": 5.151814131126671,
      "grad_norm": 0.6288276433282749,
      "learning_rate": 3.054521212416637e-05,
      "loss": 1.0457,
      "num_input_tokens_seen": 38206149952,
      "step": 48561
    },
    {
      "epoch": 5.151920220666242,
      "grad_norm": 0.7474708106845062,
      "learning_rate": 3.054453446470284e-05,
      "loss": 1.1322,
      "num_input_tokens_seen": 38206936768,
      "step": 48562
    },
    {
      "epoch": 5.152026310205814,
      "grad_norm": 0.789080675754803,
      "learning_rate": 3.0543856800954664e-05,
      "loss": 1.1489,
      "num_input_tokens_seen": 38207723536,
      "step": 48563
    },
    {
      "epoch": 5.152132399745385,
      "grad_norm": 0.6407041715841024,
      "learning_rate": 3.0543179132922345e-05,
      "loss": 1.1099,
      "num_input_tokens_seen": 38208510336,
      "step": 48564
    },
    {
      "epoch": 5.152238489284956,
      "grad_norm": 0.6810719943442066,
      "learning_rate": 3.054250146060643e-05,
      "loss": 1.1342,
      "num_input_tokens_seen": 38209297056,
      "step": 48565
    },
    {
      "epoch": 5.152344578824528,
      "grad_norm": 0.6064779634930875,
      "learning_rate": 3.054182378400744e-05,
      "loss": 1.1299,
      "num_input_tokens_seen": 38210083936,
      "step": 48566
    },
    {
      "epoch": 5.152450668364099,
      "grad_norm": 0.7599407047168195,
      "learning_rate": 3.054114610312587e-05,
      "loss": 1.2598,
      "num_input_tokens_seen": 38210870688,
      "step": 48567
    },
    {
      "epoch": 5.152556757903671,
      "grad_norm": 0.955184375306842,
      "learning_rate": 3.0540468417962285e-05,
      "loss": 1.1876,
      "num_input_tokens_seen": 38211657344,
      "step": 48568
    },
    {
      "epoch": 5.152662847443242,
      "grad_norm": 0.5929443262891112,
      "learning_rate": 3.0539790728517176e-05,
      "loss": 1.1249,
      "num_input_tokens_seen": 38212444096,
      "step": 48569
    },
    {
      "epoch": 5.152768936982813,
      "grad_norm": 0.9352138942742354,
      "learning_rate": 3.053911303479108e-05,
      "loss": 1.1316,
      "num_input_tokens_seen": 38213230864,
      "step": 48570
    },
    {
      "epoch": 5.152875026522385,
      "grad_norm": 0.9566676404835329,
      "learning_rate": 3.053843533678453e-05,
      "loss": 1.164,
      "num_input_tokens_seen": 38214017504,
      "step": 48571
    },
    {
      "epoch": 5.152981116061956,
      "grad_norm": 0.8848438667545204,
      "learning_rate": 3.0537757634498035e-05,
      "loss": 1.2136,
      "num_input_tokens_seen": 38214804224,
      "step": 48572
    },
    {
      "epoch": 5.153087205601528,
      "grad_norm": 0.9769773208695948,
      "learning_rate": 3.0537079927932114e-05,
      "loss": 1.1806,
      "num_input_tokens_seen": 38215591008,
      "step": 48573
    },
    {
      "epoch": 5.153193295141099,
      "grad_norm": 0.8528262784707232,
      "learning_rate": 3.053640221708731e-05,
      "loss": 1.2071,
      "num_input_tokens_seen": 38216377760,
      "step": 48574
    },
    {
      "epoch": 5.15329938468067,
      "grad_norm": 1.0630163647815516,
      "learning_rate": 3.053572450196413e-05,
      "loss": 1.0642,
      "num_input_tokens_seen": 38217164576,
      "step": 48575
    },
    {
      "epoch": 5.153405474220242,
      "grad_norm": 0.8561199468330755,
      "learning_rate": 3.053504678256311e-05,
      "loss": 1.1192,
      "num_input_tokens_seen": 38217951248,
      "step": 48576
    },
    {
      "epoch": 5.153511563759813,
      "grad_norm": 0.897681988319406,
      "learning_rate": 3.053436905888477e-05,
      "loss": 1.14,
      "num_input_tokens_seen": 38218737952,
      "step": 48577
    },
    {
      "epoch": 5.153617653299385,
      "grad_norm": 1.115695689553262,
      "learning_rate": 3.053369133092962e-05,
      "loss": 1.1972,
      "num_input_tokens_seen": 38219524672,
      "step": 48578
    },
    {
      "epoch": 5.153723742838956,
      "grad_norm": 1.2568093664741729,
      "learning_rate": 3.0533013598698204e-05,
      "loss": 1.2134,
      "num_input_tokens_seen": 38220311392,
      "step": 48579
    },
    {
      "epoch": 5.153829832378528,
      "grad_norm": 0.7571065565950534,
      "learning_rate": 3.0532335862191044e-05,
      "loss": 1.0841,
      "num_input_tokens_seen": 38221098176,
      "step": 48580
    },
    {
      "epoch": 5.153935921918099,
      "grad_norm": 1.113145344684294,
      "learning_rate": 3.0531658121408644e-05,
      "loss": 1.1562,
      "num_input_tokens_seen": 38221884944,
      "step": 48581
    },
    {
      "epoch": 5.15404201145767,
      "grad_norm": 1.0017958759807446,
      "learning_rate": 3.053098037635155e-05,
      "loss": 1.0634,
      "num_input_tokens_seen": 38222671776,
      "step": 48582
    },
    {
      "epoch": 5.154148100997242,
      "grad_norm": 0.6461255927266366,
      "learning_rate": 3.053030262702028e-05,
      "loss": 1.0993,
      "num_input_tokens_seen": 38223458592,
      "step": 48583
    },
    {
      "epoch": 5.154254190536813,
      "grad_norm": 1.3026424174622953,
      "learning_rate": 3.0529624873415346e-05,
      "loss": 1.2273,
      "num_input_tokens_seen": 38224245376,
      "step": 48584
    },
    {
      "epoch": 5.154360280076385,
      "grad_norm": 0.7522234036095563,
      "learning_rate": 3.0528947115537287e-05,
      "loss": 1.1084,
      "num_input_tokens_seen": 38225032224,
      "step": 48585
    },
    {
      "epoch": 5.154466369615956,
      "grad_norm": 0.6831034829710306,
      "learning_rate": 3.052826935338662e-05,
      "loss": 1.0908,
      "num_input_tokens_seen": 38225819040,
      "step": 48586
    },
    {
      "epoch": 5.154572459155527,
      "grad_norm": 0.8966695890917845,
      "learning_rate": 3.052759158696386e-05,
      "loss": 1.2127,
      "num_input_tokens_seen": 38226605840,
      "step": 48587
    },
    {
      "epoch": 5.154678548695099,
      "grad_norm": 0.8273382365495419,
      "learning_rate": 3.052691381626954e-05,
      "loss": 1.2155,
      "num_input_tokens_seen": 38227392624,
      "step": 48588
    },
    {
      "epoch": 5.15478463823467,
      "grad_norm": 0.6911336801771519,
      "learning_rate": 3.05262360413042e-05,
      "loss": 1.2513,
      "num_input_tokens_seen": 38228179424,
      "step": 48589
    },
    {
      "epoch": 5.154890727774242,
      "grad_norm": 0.753282746590301,
      "learning_rate": 3.0525558262068324e-05,
      "loss": 1.1485,
      "num_input_tokens_seen": 38228966096,
      "step": 48590
    },
    {
      "epoch": 5.154996817313813,
      "grad_norm": 0.7310804629868196,
      "learning_rate": 3.052488047856247e-05,
      "loss": 1.1918,
      "num_input_tokens_seen": 38229752832,
      "step": 48591
    },
    {
      "epoch": 5.155102906853385,
      "grad_norm": 0.5940940911404825,
      "learning_rate": 3.052420269078714e-05,
      "loss": 1.2144,
      "num_input_tokens_seen": 38230539680,
      "step": 48592
    },
    {
      "epoch": 5.155208996392956,
      "grad_norm": 0.7409001335401432,
      "learning_rate": 3.0523524898742885e-05,
      "loss": 1.1728,
      "num_input_tokens_seen": 38231326416,
      "step": 48593
    },
    {
      "epoch": 5.155315085932527,
      "grad_norm": 0.7043550311030293,
      "learning_rate": 3.0522847102430204e-05,
      "loss": 1.108,
      "num_input_tokens_seen": 38232113280,
      "step": 48594
    },
    {
      "epoch": 5.155421175472099,
      "grad_norm": 0.6081498418870956,
      "learning_rate": 3.052216930184963e-05,
      "loss": 1.16,
      "num_input_tokens_seen": 38232900096,
      "step": 48595
    },
    {
      "epoch": 5.15552726501167,
      "grad_norm": 0.6142486571719812,
      "learning_rate": 3.052149149700168e-05,
      "loss": 1.0904,
      "num_input_tokens_seen": 38233686912,
      "step": 48596
    },
    {
      "epoch": 5.155633354551242,
      "grad_norm": 0.6384814528295429,
      "learning_rate": 3.05208136878869e-05,
      "loss": 1.1043,
      "num_input_tokens_seen": 38234473824,
      "step": 48597
    },
    {
      "epoch": 5.155739444090813,
      "grad_norm": 0.5920531294796499,
      "learning_rate": 3.052013587450578e-05,
      "loss": 1.11,
      "num_input_tokens_seen": 38235260608,
      "step": 48598
    },
    {
      "epoch": 5.155845533630384,
      "grad_norm": 0.5742251915918206,
      "learning_rate": 3.0519458056858865e-05,
      "loss": 1.1439,
      "num_input_tokens_seen": 38236047296,
      "step": 48599
    },
    {
      "epoch": 5.155951623169956,
      "grad_norm": 0.737047018828677,
      "learning_rate": 3.0518780234946674e-05,
      "loss": 1.1984,
      "num_input_tokens_seen": 38236834048,
      "step": 48600
    },
    {
      "epoch": 5.156057712709527,
      "grad_norm": 0.5669303712875576,
      "learning_rate": 3.051810240876973e-05,
      "loss": 1.1641,
      "num_input_tokens_seen": 38237620848,
      "step": 48601
    },
    {
      "epoch": 5.1561638022490985,
      "grad_norm": 0.7672156373213822,
      "learning_rate": 3.051742457832857e-05,
      "loss": 1.1878,
      "num_input_tokens_seen": 38238407648,
      "step": 48602
    },
    {
      "epoch": 5.15626989178867,
      "grad_norm": 0.7911445589440258,
      "learning_rate": 3.0516746743623697e-05,
      "loss": 1.2862,
      "num_input_tokens_seen": 38239194336,
      "step": 48603
    },
    {
      "epoch": 5.156375981328241,
      "grad_norm": 0.6610380484150111,
      "learning_rate": 3.0516068904655643e-05,
      "loss": 1.1573,
      "num_input_tokens_seen": 38239981104,
      "step": 48604
    },
    {
      "epoch": 5.1564820708678125,
      "grad_norm": 1.0684009428018848,
      "learning_rate": 3.0515391061424937e-05,
      "loss": 1.2002,
      "num_input_tokens_seen": 38240767824,
      "step": 48605
    },
    {
      "epoch": 5.1565881604073835,
      "grad_norm": 0.6398692734225541,
      "learning_rate": 3.05147132139321e-05,
      "loss": 1.2389,
      "num_input_tokens_seen": 38241554672,
      "step": 48606
    },
    {
      "epoch": 5.1566942499469555,
      "grad_norm": 0.6984105400728218,
      "learning_rate": 3.051403536217765e-05,
      "loss": 1.2344,
      "num_input_tokens_seen": 38242341424,
      "step": 48607
    },
    {
      "epoch": 5.1568003394865265,
      "grad_norm": 0.9891990628523951,
      "learning_rate": 3.0513357506162116e-05,
      "loss": 1.1099,
      "num_input_tokens_seen": 38243128272,
      "step": 48608
    },
    {
      "epoch": 5.156906429026098,
      "grad_norm": 0.7202603771839279,
      "learning_rate": 3.0512679645886023e-05,
      "loss": 1.2258,
      "num_input_tokens_seen": 38243914960,
      "step": 48609
    },
    {
      "epoch": 5.1570125185656694,
      "grad_norm": 0.6562364383282402,
      "learning_rate": 3.051200178134989e-05,
      "loss": 1.1261,
      "num_input_tokens_seen": 38244701696,
      "step": 48610
    },
    {
      "epoch": 5.1571186081052405,
      "grad_norm": 0.6569950248485908,
      "learning_rate": 3.0511323912554246e-05,
      "loss": 1.0711,
      "num_input_tokens_seen": 38245488544,
      "step": 48611
    },
    {
      "epoch": 5.157224697644812,
      "grad_norm": 0.780607211830576,
      "learning_rate": 3.0510646039499614e-05,
      "loss": 1.0845,
      "num_input_tokens_seen": 38246275296,
      "step": 48612
    },
    {
      "epoch": 5.157330787184383,
      "grad_norm": 0.6848130932404884,
      "learning_rate": 3.0509968162186515e-05,
      "loss": 1.118,
      "num_input_tokens_seen": 38247062112,
      "step": 48613
    },
    {
      "epoch": 5.157436876723955,
      "grad_norm": 0.6841002883710858,
      "learning_rate": 3.050929028061547e-05,
      "loss": 1.1099,
      "num_input_tokens_seen": 38247848976,
      "step": 48614
    },
    {
      "epoch": 5.157542966263526,
      "grad_norm": 0.6899986437536996,
      "learning_rate": 3.0508612394787018e-05,
      "loss": 1.2121,
      "num_input_tokens_seen": 38248635792,
      "step": 48615
    },
    {
      "epoch": 5.157649055803097,
      "grad_norm": 0.6376687684639668,
      "learning_rate": 3.0507934504701657e-05,
      "loss": 1.1719,
      "num_input_tokens_seen": 38249422560,
      "step": 48616
    },
    {
      "epoch": 5.157755145342669,
      "grad_norm": 0.698586456719845,
      "learning_rate": 3.0507256610359936e-05,
      "loss": 1.2424,
      "num_input_tokens_seen": 38250209280,
      "step": 48617
    },
    {
      "epoch": 5.15786123488224,
      "grad_norm": 0.5957374051379739,
      "learning_rate": 3.050657871176236e-05,
      "loss": 1.1995,
      "num_input_tokens_seen": 38250995984,
      "step": 48618
    },
    {
      "epoch": 5.157967324421812,
      "grad_norm": 0.6638338439671702,
      "learning_rate": 3.050590080890947e-05,
      "loss": 1.0646,
      "num_input_tokens_seen": 38251782864,
      "step": 48619
    },
    {
      "epoch": 5.158073413961383,
      "grad_norm": 0.5746465492008601,
      "learning_rate": 3.0505222901801783e-05,
      "loss": 1.2416,
      "num_input_tokens_seen": 38252569584,
      "step": 48620
    },
    {
      "epoch": 5.158179503500955,
      "grad_norm": 0.667260638337223,
      "learning_rate": 3.0504544990439816e-05,
      "loss": 1.175,
      "num_input_tokens_seen": 38253356320,
      "step": 48621
    },
    {
      "epoch": 5.158285593040526,
      "grad_norm": 0.5757033364604593,
      "learning_rate": 3.05038670748241e-05,
      "loss": 1.1609,
      "num_input_tokens_seen": 38254143056,
      "step": 48622
    },
    {
      "epoch": 5.158391682580097,
      "grad_norm": 0.6768800035269266,
      "learning_rate": 3.050318915495516e-05,
      "loss": 1.2205,
      "num_input_tokens_seen": 38254929824,
      "step": 48623
    },
    {
      "epoch": 5.158497772119669,
      "grad_norm": 0.6206150565175005,
      "learning_rate": 3.050251123083351e-05,
      "loss": 1.1747,
      "num_input_tokens_seen": 38255716608,
      "step": 48624
    },
    {
      "epoch": 5.15860386165924,
      "grad_norm": 0.7088471356139927,
      "learning_rate": 3.0501833302459687e-05,
      "loss": 1.0781,
      "num_input_tokens_seen": 38256503296,
      "step": 48625
    },
    {
      "epoch": 5.158709951198812,
      "grad_norm": 0.7212307670700874,
      "learning_rate": 3.050115536983421e-05,
      "loss": 1.1061,
      "num_input_tokens_seen": 38257289968,
      "step": 48626
    },
    {
      "epoch": 5.158816040738383,
      "grad_norm": 0.8999395259609826,
      "learning_rate": 3.0500477432957592e-05,
      "loss": 1.1464,
      "num_input_tokens_seen": 38258076672,
      "step": 48627
    },
    {
      "epoch": 5.158922130277954,
      "grad_norm": 0.6415548298575035,
      "learning_rate": 3.049979949183037e-05,
      "loss": 1.1656,
      "num_input_tokens_seen": 38258863568,
      "step": 48628
    },
    {
      "epoch": 5.159028219817526,
      "grad_norm": 1.2318314518282345,
      "learning_rate": 3.0499121546453075e-05,
      "loss": 1.2348,
      "num_input_tokens_seen": 38259650336,
      "step": 48629
    },
    {
      "epoch": 5.159134309357097,
      "grad_norm": 0.6081144636740984,
      "learning_rate": 3.0498443596826205e-05,
      "loss": 1.0634,
      "num_input_tokens_seen": 38260437040,
      "step": 48630
    },
    {
      "epoch": 5.159240398896669,
      "grad_norm": 0.7802408427591023,
      "learning_rate": 3.049776564295031e-05,
      "loss": 1.245,
      "num_input_tokens_seen": 38261223792,
      "step": 48631
    },
    {
      "epoch": 5.15934648843624,
      "grad_norm": 0.7887195127292931,
      "learning_rate": 3.0497087684825898e-05,
      "loss": 1.1269,
      "num_input_tokens_seen": 38262010528,
      "step": 48632
    },
    {
      "epoch": 5.159452577975811,
      "grad_norm": 0.6459520045994058,
      "learning_rate": 3.0496409722453496e-05,
      "loss": 1.2119,
      "num_input_tokens_seen": 38262797312,
      "step": 48633
    },
    {
      "epoch": 5.159558667515383,
      "grad_norm": 0.7212821533203435,
      "learning_rate": 3.0495731755833633e-05,
      "loss": 1.0464,
      "num_input_tokens_seen": 38263584128,
      "step": 48634
    },
    {
      "epoch": 5.159664757054954,
      "grad_norm": 0.6684558848235869,
      "learning_rate": 3.0495053784966825e-05,
      "loss": 1.1515,
      "num_input_tokens_seen": 38264370848,
      "step": 48635
    },
    {
      "epoch": 5.159770846594526,
      "grad_norm": 0.7213627203684138,
      "learning_rate": 3.049437580985361e-05,
      "loss": 1.0907,
      "num_input_tokens_seen": 38265157648,
      "step": 48636
    },
    {
      "epoch": 5.159876936134097,
      "grad_norm": 0.8357420339346313,
      "learning_rate": 3.04936978304945e-05,
      "loss": 1.1601,
      "num_input_tokens_seen": 38265944336,
      "step": 48637
    },
    {
      "epoch": 5.159983025673669,
      "grad_norm": 0.5618934944873627,
      "learning_rate": 3.0493019846890015e-05,
      "loss": 1.2219,
      "num_input_tokens_seen": 38266731120,
      "step": 48638
    },
    {
      "epoch": 5.16008911521324,
      "grad_norm": 0.6751948414249598,
      "learning_rate": 3.049234185904069e-05,
      "loss": 1.2332,
      "num_input_tokens_seen": 38267517840,
      "step": 48639
    },
    {
      "epoch": 5.160195204752811,
      "grad_norm": 0.7035951093528443,
      "learning_rate": 3.0491663866947044e-05,
      "loss": 1.1573,
      "num_input_tokens_seen": 38268304592,
      "step": 48640
    },
    {
      "epoch": 5.160301294292383,
      "grad_norm": 0.6635045833112335,
      "learning_rate": 3.04909858706096e-05,
      "loss": 1.2406,
      "num_input_tokens_seen": 38269091440,
      "step": 48641
    },
    {
      "epoch": 5.160407383831954,
      "grad_norm": 0.6523114779353442,
      "learning_rate": 3.0490307870028883e-05,
      "loss": 1.2375,
      "num_input_tokens_seen": 38269878192,
      "step": 48642
    },
    {
      "epoch": 5.160513473371526,
      "grad_norm": 0.5739440435888012,
      "learning_rate": 3.0489629865205422e-05,
      "loss": 1.1185,
      "num_input_tokens_seen": 38270664912,
      "step": 48643
    },
    {
      "epoch": 5.160619562911097,
      "grad_norm": 0.6082677575503146,
      "learning_rate": 3.048895185613973e-05,
      "loss": 1.1942,
      "num_input_tokens_seen": 38271451632,
      "step": 48644
    },
    {
      "epoch": 5.160725652450668,
      "grad_norm": 0.7062733624828931,
      "learning_rate": 3.048827384283234e-05,
      "loss": 1.1328,
      "num_input_tokens_seen": 38272238288,
      "step": 48645
    },
    {
      "epoch": 5.16083174199024,
      "grad_norm": 0.6231359828302933,
      "learning_rate": 3.0487595825283773e-05,
      "loss": 1.0897,
      "num_input_tokens_seen": 38273025008,
      "step": 48646
    },
    {
      "epoch": 5.160937831529811,
      "grad_norm": 0.6875576490535772,
      "learning_rate": 3.0486917803494547e-05,
      "loss": 1.1085,
      "num_input_tokens_seen": 38273811744,
      "step": 48647
    },
    {
      "epoch": 5.161043921069383,
      "grad_norm": 0.7138771495954388,
      "learning_rate": 3.0486239777465203e-05,
      "loss": 1.1771,
      "num_input_tokens_seen": 38274598480,
      "step": 48648
    },
    {
      "epoch": 5.161150010608954,
      "grad_norm": 1.1722774900738175,
      "learning_rate": 3.0485561747196252e-05,
      "loss": 1.1478,
      "num_input_tokens_seen": 38275385280,
      "step": 48649
    },
    {
      "epoch": 5.161256100148526,
      "grad_norm": 0.5963624487183501,
      "learning_rate": 3.0484883712688213e-05,
      "loss": 1.2636,
      "num_input_tokens_seen": 38276171984,
      "step": 48650
    },
    {
      "epoch": 5.161362189688097,
      "grad_norm": 0.5583416246840811,
      "learning_rate": 3.0484205673941618e-05,
      "loss": 1.054,
      "num_input_tokens_seen": 38276958800,
      "step": 48651
    },
    {
      "epoch": 5.161468279227668,
      "grad_norm": 0.8249993563868925,
      "learning_rate": 3.048352763095699e-05,
      "loss": 1.1013,
      "num_input_tokens_seen": 38277745648,
      "step": 48652
    },
    {
      "epoch": 5.16157436876724,
      "grad_norm": 0.5475195417549161,
      "learning_rate": 3.0482849583734856e-05,
      "loss": 1.1449,
      "num_input_tokens_seen": 38278532352,
      "step": 48653
    },
    {
      "epoch": 5.161680458306811,
      "grad_norm": 0.6473741337630194,
      "learning_rate": 3.048217153227574e-05,
      "loss": 1.1916,
      "num_input_tokens_seen": 38279319136,
      "step": 48654
    },
    {
      "epoch": 5.161786547846383,
      "grad_norm": 0.5800338817710846,
      "learning_rate": 3.0481493476580157e-05,
      "loss": 1.1107,
      "num_input_tokens_seen": 38280105984,
      "step": 48655
    },
    {
      "epoch": 5.161892637385954,
      "grad_norm": 0.7102719860533999,
      "learning_rate": 3.0480815416648635e-05,
      "loss": 1.1973,
      "num_input_tokens_seen": 38280892784,
      "step": 48656
    },
    {
      "epoch": 5.161998726925525,
      "grad_norm": 0.7506340250181519,
      "learning_rate": 3.0480137352481703e-05,
      "loss": 1.1015,
      "num_input_tokens_seen": 38281679584,
      "step": 48657
    },
    {
      "epoch": 5.162104816465097,
      "grad_norm": 0.6796870180946382,
      "learning_rate": 3.047945928407988e-05,
      "loss": 1.0729,
      "num_input_tokens_seen": 38282466416,
      "step": 48658
    },
    {
      "epoch": 5.162210906004668,
      "grad_norm": 0.7224774653456272,
      "learning_rate": 3.047878121144369e-05,
      "loss": 1.1655,
      "num_input_tokens_seen": 38283253184,
      "step": 48659
    },
    {
      "epoch": 5.16231699554424,
      "grad_norm": 0.528177597843661,
      "learning_rate": 3.0478103134573664e-05,
      "loss": 1.0173,
      "num_input_tokens_seen": 38284039904,
      "step": 48660
    },
    {
      "epoch": 5.162423085083811,
      "grad_norm": 0.6848088092964135,
      "learning_rate": 3.0477425053470316e-05,
      "loss": 1.1229,
      "num_input_tokens_seen": 38284826688,
      "step": 48661
    },
    {
      "epoch": 5.162529174623382,
      "grad_norm": 0.5791342495526357,
      "learning_rate": 3.0476746968134178e-05,
      "loss": 1.1756,
      "num_input_tokens_seen": 38285613472,
      "step": 48662
    },
    {
      "epoch": 5.162635264162954,
      "grad_norm": 0.7841049379030038,
      "learning_rate": 3.0476068878565772e-05,
      "loss": 1.1836,
      "num_input_tokens_seen": 38286400208,
      "step": 48663
    },
    {
      "epoch": 5.162741353702525,
      "grad_norm": 0.7280456539139897,
      "learning_rate": 3.0475390784765613e-05,
      "loss": 1.1145,
      "num_input_tokens_seen": 38287186928,
      "step": 48664
    },
    {
      "epoch": 5.1628474432420965,
      "grad_norm": 0.5958782576710296,
      "learning_rate": 3.047471268673424e-05,
      "loss": 1.1643,
      "num_input_tokens_seen": 38287973648,
      "step": 48665
    },
    {
      "epoch": 5.162953532781668,
      "grad_norm": 0.6050098941889774,
      "learning_rate": 3.047403458447217e-05,
      "loss": 1.2254,
      "num_input_tokens_seen": 38288760400,
      "step": 48666
    },
    {
      "epoch": 5.1630596223212395,
      "grad_norm": 0.7075494606110244,
      "learning_rate": 3.047335647797992e-05,
      "loss": 1.1831,
      "num_input_tokens_seen": 38289547152,
      "step": 48667
    },
    {
      "epoch": 5.1631657118608105,
      "grad_norm": 0.7920034771897678,
      "learning_rate": 3.047267836725803e-05,
      "loss": 1.1819,
      "num_input_tokens_seen": 38290333968,
      "step": 48668
    },
    {
      "epoch": 5.1632718014003816,
      "grad_norm": 0.7343126637736799,
      "learning_rate": 3.047200025230701e-05,
      "loss": 1.1546,
      "num_input_tokens_seen": 38291120736,
      "step": 48669
    },
    {
      "epoch": 5.1633778909399535,
      "grad_norm": 0.7319969834540961,
      "learning_rate": 3.0471322133127383e-05,
      "loss": 1.1426,
      "num_input_tokens_seen": 38291907504,
      "step": 48670
    },
    {
      "epoch": 5.1634839804795245,
      "grad_norm": 0.5755585564111193,
      "learning_rate": 3.0470644009719686e-05,
      "loss": 1.1819,
      "num_input_tokens_seen": 38292694288,
      "step": 48671
    },
    {
      "epoch": 5.163590070019096,
      "grad_norm": 0.7084626440892428,
      "learning_rate": 3.0469965882084433e-05,
      "loss": 1.177,
      "num_input_tokens_seen": 38293481088,
      "step": 48672
    },
    {
      "epoch": 5.1636961595586675,
      "grad_norm": 0.7481688805513316,
      "learning_rate": 3.0469287750222154e-05,
      "loss": 1.0963,
      "num_input_tokens_seen": 38294267808,
      "step": 48673
    },
    {
      "epoch": 5.1638022490982385,
      "grad_norm": 0.6981867661713054,
      "learning_rate": 3.0468609614133364e-05,
      "loss": 1.1428,
      "num_input_tokens_seen": 38295054544,
      "step": 48674
    },
    {
      "epoch": 5.16390833863781,
      "grad_norm": 0.6490617851005813,
      "learning_rate": 3.04679314738186e-05,
      "loss": 1.1672,
      "num_input_tokens_seen": 38295841328,
      "step": 48675
    },
    {
      "epoch": 5.164014428177381,
      "grad_norm": 0.5981434087854233,
      "learning_rate": 3.0467253329278373e-05,
      "loss": 1.1766,
      "num_input_tokens_seen": 38296628112,
      "step": 48676
    },
    {
      "epoch": 5.164120517716953,
      "grad_norm": 0.7078003326159509,
      "learning_rate": 3.046657518051322e-05,
      "loss": 1.1125,
      "num_input_tokens_seen": 38297414864,
      "step": 48677
    },
    {
      "epoch": 5.164226607256524,
      "grad_norm": 0.87049079554913,
      "learning_rate": 3.046589702752365e-05,
      "loss": 1.2465,
      "num_input_tokens_seen": 38298201552,
      "step": 48678
    },
    {
      "epoch": 5.164332696796096,
      "grad_norm": 0.6829058323465087,
      "learning_rate": 3.0465218870310196e-05,
      "loss": 1.1417,
      "num_input_tokens_seen": 38298988304,
      "step": 48679
    },
    {
      "epoch": 5.164438786335667,
      "grad_norm": 0.9909536721111107,
      "learning_rate": 3.0464540708873392e-05,
      "loss": 1.2395,
      "num_input_tokens_seen": 38299775024,
      "step": 48680
    },
    {
      "epoch": 5.164544875875238,
      "grad_norm": 0.6365380914665868,
      "learning_rate": 3.0463862543213733e-05,
      "loss": 1.1097,
      "num_input_tokens_seen": 38300561744,
      "step": 48681
    },
    {
      "epoch": 5.16465096541481,
      "grad_norm": 0.8217993311637083,
      "learning_rate": 3.0463184373331777e-05,
      "loss": 1.2071,
      "num_input_tokens_seen": 38301348464,
      "step": 48682
    },
    {
      "epoch": 5.164757054954381,
      "grad_norm": 0.7023115220399925,
      "learning_rate": 3.046250619922803e-05,
      "loss": 1.2267,
      "num_input_tokens_seen": 38302135200,
      "step": 48683
    },
    {
      "epoch": 5.164863144493953,
      "grad_norm": 0.7258252859236917,
      "learning_rate": 3.046182802090301e-05,
      "loss": 1.2465,
      "num_input_tokens_seen": 38302922096,
      "step": 48684
    },
    {
      "epoch": 5.164969234033524,
      "grad_norm": 0.7737910041855639,
      "learning_rate": 3.0461149838357256e-05,
      "loss": 1.1588,
      "num_input_tokens_seen": 38303708800,
      "step": 48685
    },
    {
      "epoch": 5.165075323573095,
      "grad_norm": 0.6111963881896485,
      "learning_rate": 3.0460471651591287e-05,
      "loss": 1.0007,
      "num_input_tokens_seen": 38304495712,
      "step": 48686
    },
    {
      "epoch": 5.165181413112667,
      "grad_norm": 0.6596359029153771,
      "learning_rate": 3.0459793460605624e-05,
      "loss": 1.1143,
      "num_input_tokens_seen": 38305282448,
      "step": 48687
    },
    {
      "epoch": 5.165287502652238,
      "grad_norm": 0.6669223099318751,
      "learning_rate": 3.0459115265400785e-05,
      "loss": 1.1234,
      "num_input_tokens_seen": 38306069152,
      "step": 48688
    },
    {
      "epoch": 5.16539359219181,
      "grad_norm": 0.8066471129027241,
      "learning_rate": 3.0458437065977315e-05,
      "loss": 1.1403,
      "num_input_tokens_seen": 38306855888,
      "step": 48689
    },
    {
      "epoch": 5.165499681731381,
      "grad_norm": 0.6427487309540468,
      "learning_rate": 3.0457758862335712e-05,
      "loss": 1.1909,
      "num_input_tokens_seen": 38307642672,
      "step": 48690
    },
    {
      "epoch": 5.165605771270953,
      "grad_norm": 0.6562391950969196,
      "learning_rate": 3.0457080654476523e-05,
      "loss": 1.1594,
      "num_input_tokens_seen": 38308429440,
      "step": 48691
    },
    {
      "epoch": 5.165711860810524,
      "grad_norm": 0.6465526248039482,
      "learning_rate": 3.045640244240026e-05,
      "loss": 1.1182,
      "num_input_tokens_seen": 38309216272,
      "step": 48692
    },
    {
      "epoch": 5.165817950350095,
      "grad_norm": 0.6663395471707004,
      "learning_rate": 3.0455724226107445e-05,
      "loss": 1.1532,
      "num_input_tokens_seen": 38310002944,
      "step": 48693
    },
    {
      "epoch": 5.165924039889667,
      "grad_norm": 0.6972203278212579,
      "learning_rate": 3.0455046005598615e-05,
      "loss": 1.1939,
      "num_input_tokens_seen": 38310789728,
      "step": 48694
    },
    {
      "epoch": 5.166030129429238,
      "grad_norm": 0.7025740798892706,
      "learning_rate": 3.045436778087428e-05,
      "loss": 1.1922,
      "num_input_tokens_seen": 38311576368,
      "step": 48695
    },
    {
      "epoch": 5.16613621896881,
      "grad_norm": 0.6766420551327287,
      "learning_rate": 3.0453689551934965e-05,
      "loss": 1.1935,
      "num_input_tokens_seen": 38312363120,
      "step": 48696
    },
    {
      "epoch": 5.166242308508381,
      "grad_norm": 0.6258427520105956,
      "learning_rate": 3.045301131878121e-05,
      "loss": 1.1131,
      "num_input_tokens_seen": 38313149904,
      "step": 48697
    },
    {
      "epoch": 5.166348398047952,
      "grad_norm": 0.7051038500241786,
      "learning_rate": 3.045233308141352e-05,
      "loss": 1.1903,
      "num_input_tokens_seen": 38313936704,
      "step": 48698
    },
    {
      "epoch": 5.166454487587524,
      "grad_norm": 0.6960528672328429,
      "learning_rate": 3.0451654839832428e-05,
      "loss": 1.2467,
      "num_input_tokens_seen": 38314723472,
      "step": 48699
    },
    {
      "epoch": 5.166560577127095,
      "grad_norm": 0.6721087658823326,
      "learning_rate": 3.045097659403846e-05,
      "loss": 1.2255,
      "num_input_tokens_seen": 38315510256,
      "step": 48700
    },
    {
      "epoch": 5.166666666666667,
      "grad_norm": 0.6738420405419373,
      "learning_rate": 3.0450298344032135e-05,
      "loss": 1.1404,
      "num_input_tokens_seen": 38316297024,
      "step": 48701
    },
    {
      "epoch": 5.166772756206238,
      "grad_norm": 0.6994149329668173,
      "learning_rate": 3.044962008981398e-05,
      "loss": 1.202,
      "num_input_tokens_seen": 38317083744,
      "step": 48702
    },
    {
      "epoch": 5.16687884574581,
      "grad_norm": 0.7077863884316625,
      "learning_rate": 3.044894183138452e-05,
      "loss": 1.1717,
      "num_input_tokens_seen": 38317870528,
      "step": 48703
    },
    {
      "epoch": 5.166984935285381,
      "grad_norm": 0.6120248031683454,
      "learning_rate": 3.0448263568744267e-05,
      "loss": 1.1902,
      "num_input_tokens_seen": 38318657248,
      "step": 48704
    },
    {
      "epoch": 5.167091024824952,
      "grad_norm": 0.5295662272232255,
      "learning_rate": 3.0447585301893766e-05,
      "loss": 1.1433,
      "num_input_tokens_seen": 38319443952,
      "step": 48705
    },
    {
      "epoch": 5.167197114364524,
      "grad_norm": 1.0622748695840536,
      "learning_rate": 3.044690703083353e-05,
      "loss": 1.216,
      "num_input_tokens_seen": 38320230720,
      "step": 48706
    },
    {
      "epoch": 5.167303203904095,
      "grad_norm": 0.7175598161579467,
      "learning_rate": 3.0446228755564082e-05,
      "loss": 1.1088,
      "num_input_tokens_seen": 38321017488,
      "step": 48707
    },
    {
      "epoch": 5.167409293443667,
      "grad_norm": 0.7857898338953034,
      "learning_rate": 3.0445550476085956e-05,
      "loss": 1.1953,
      "num_input_tokens_seen": 38321804272,
      "step": 48708
    },
    {
      "epoch": 5.167515382983238,
      "grad_norm": 0.541494103078676,
      "learning_rate": 3.0444872192399665e-05,
      "loss": 1.1294,
      "num_input_tokens_seen": 38322590976,
      "step": 48709
    },
    {
      "epoch": 5.167621472522809,
      "grad_norm": 0.7294264268974747,
      "learning_rate": 3.0444193904505725e-05,
      "loss": 1.1651,
      "num_input_tokens_seen": 38323377696,
      "step": 48710
    },
    {
      "epoch": 5.167727562062381,
      "grad_norm": 0.5791045616514184,
      "learning_rate": 3.0443515612404684e-05,
      "loss": 1.0853,
      "num_input_tokens_seen": 38324164544,
      "step": 48711
    },
    {
      "epoch": 5.167833651601952,
      "grad_norm": 0.6250113546269522,
      "learning_rate": 3.044283731609705e-05,
      "loss": 1.1116,
      "num_input_tokens_seen": 38324951376,
      "step": 48712
    },
    {
      "epoch": 5.167939741141524,
      "grad_norm": 0.6171892002419209,
      "learning_rate": 3.044215901558335e-05,
      "loss": 1.1653,
      "num_input_tokens_seen": 38325738144,
      "step": 48713
    },
    {
      "epoch": 5.168045830681095,
      "grad_norm": 0.6901010094407637,
      "learning_rate": 3.0441480710864112e-05,
      "loss": 1.1875,
      "num_input_tokens_seen": 38326524912,
      "step": 48714
    },
    {
      "epoch": 5.168151920220666,
      "grad_norm": 0.5792773020337137,
      "learning_rate": 3.0440802401939855e-05,
      "loss": 1.1644,
      "num_input_tokens_seen": 38327311696,
      "step": 48715
    },
    {
      "epoch": 5.168258009760238,
      "grad_norm": 0.5973107509391208,
      "learning_rate": 3.0440124088811105e-05,
      "loss": 1.098,
      "num_input_tokens_seen": 38328098464,
      "step": 48716
    },
    {
      "epoch": 5.168364099299809,
      "grad_norm": 0.6252219395617783,
      "learning_rate": 3.0439445771478393e-05,
      "loss": 1.1223,
      "num_input_tokens_seen": 38328885248,
      "step": 48717
    },
    {
      "epoch": 5.168470188839381,
      "grad_norm": 0.7123881033642808,
      "learning_rate": 3.0438767449942228e-05,
      "loss": 1.2571,
      "num_input_tokens_seen": 38329672000,
      "step": 48718
    },
    {
      "epoch": 5.168576278378952,
      "grad_norm": 0.6560277459675733,
      "learning_rate": 3.0438089124203144e-05,
      "loss": 1.1348,
      "num_input_tokens_seen": 38330458768,
      "step": 48719
    },
    {
      "epoch": 5.168682367918524,
      "grad_norm": 0.5488596202674875,
      "learning_rate": 3.043741079426167e-05,
      "loss": 1.1458,
      "num_input_tokens_seen": 38331245520,
      "step": 48720
    },
    {
      "epoch": 5.168788457458095,
      "grad_norm": 0.6945802877282958,
      "learning_rate": 3.0436732460118323e-05,
      "loss": 1.1968,
      "num_input_tokens_seen": 38332032224,
      "step": 48721
    },
    {
      "epoch": 5.168894546997666,
      "grad_norm": 0.6172963275430856,
      "learning_rate": 3.0436054121773626e-05,
      "loss": 1.2217,
      "num_input_tokens_seen": 38332818976,
      "step": 48722
    },
    {
      "epoch": 5.169000636537238,
      "grad_norm": 0.5974274443402536,
      "learning_rate": 3.043537577922811e-05,
      "loss": 1.204,
      "num_input_tokens_seen": 38333605664,
      "step": 48723
    },
    {
      "epoch": 5.169106726076809,
      "grad_norm": 0.9084094686742241,
      "learning_rate": 3.043469743248229e-05,
      "loss": 1.1817,
      "num_input_tokens_seen": 38334392480,
      "step": 48724
    },
    {
      "epoch": 5.169212815616381,
      "grad_norm": 0.581384706365094,
      "learning_rate": 3.0434019081536695e-05,
      "loss": 1.2096,
      "num_input_tokens_seen": 38335179216,
      "step": 48725
    },
    {
      "epoch": 5.169318905155952,
      "grad_norm": 0.7243535277103769,
      "learning_rate": 3.0433340726391855e-05,
      "loss": 1.1323,
      "num_input_tokens_seen": 38335965936,
      "step": 48726
    },
    {
      "epoch": 5.169424994695523,
      "grad_norm": 0.6135010805515834,
      "learning_rate": 3.043266236704828e-05,
      "loss": 1.0709,
      "num_input_tokens_seen": 38336752704,
      "step": 48727
    },
    {
      "epoch": 5.1695310842350946,
      "grad_norm": 0.6009476428231841,
      "learning_rate": 3.0431984003506515e-05,
      "loss": 1.1593,
      "num_input_tokens_seen": 38337539376,
      "step": 48728
    },
    {
      "epoch": 5.169637173774666,
      "grad_norm": 0.6742829820869469,
      "learning_rate": 3.0431305635767065e-05,
      "loss": 1.1615,
      "num_input_tokens_seen": 38338326160,
      "step": 48729
    },
    {
      "epoch": 5.1697432633142375,
      "grad_norm": 0.5169876899062225,
      "learning_rate": 3.0430627263830465e-05,
      "loss": 1.1257,
      "num_input_tokens_seen": 38339112848,
      "step": 48730
    },
    {
      "epoch": 5.1698493528538085,
      "grad_norm": 0.5815436569958258,
      "learning_rate": 3.042994888769723e-05,
      "loss": 1.0859,
      "num_input_tokens_seen": 38339899552,
      "step": 48731
    },
    {
      "epoch": 5.1699554423933805,
      "grad_norm": 0.6595961719342001,
      "learning_rate": 3.0429270507367895e-05,
      "loss": 1.1181,
      "num_input_tokens_seen": 38340686320,
      "step": 48732
    },
    {
      "epoch": 5.1700615319329515,
      "grad_norm": 0.6176404739188905,
      "learning_rate": 3.0428592122842976e-05,
      "loss": 1.1497,
      "num_input_tokens_seen": 38341473136,
      "step": 48733
    },
    {
      "epoch": 5.1701676214725225,
      "grad_norm": 0.6828674684268594,
      "learning_rate": 3.0427913734123004e-05,
      "loss": 1.1137,
      "num_input_tokens_seen": 38342259824,
      "step": 48734
    },
    {
      "epoch": 5.170273711012094,
      "grad_norm": 0.6487758946263644,
      "learning_rate": 3.0427235341208495e-05,
      "loss": 1.1847,
      "num_input_tokens_seen": 38343046528,
      "step": 48735
    },
    {
      "epoch": 5.1703798005516655,
      "grad_norm": 0.5816300123041915,
      "learning_rate": 3.042655694409997e-05,
      "loss": 1.1764,
      "num_input_tokens_seen": 38343833264,
      "step": 48736
    },
    {
      "epoch": 5.170485890091237,
      "grad_norm": 0.6971873289810626,
      "learning_rate": 3.0425878542797977e-05,
      "loss": 1.186,
      "num_input_tokens_seen": 38344619936,
      "step": 48737
    },
    {
      "epoch": 5.170591979630808,
      "grad_norm": 0.5682561651737287,
      "learning_rate": 3.0425200137303016e-05,
      "loss": 1.1777,
      "num_input_tokens_seen": 38345406720,
      "step": 48738
    },
    {
      "epoch": 5.170698069170379,
      "grad_norm": 0.5858971985075617,
      "learning_rate": 3.0424521727615617e-05,
      "loss": 1.1681,
      "num_input_tokens_seen": 38346193472,
      "step": 48739
    },
    {
      "epoch": 5.170804158709951,
      "grad_norm": 0.5070807390134476,
      "learning_rate": 3.042384331373631e-05,
      "loss": 1.1319,
      "num_input_tokens_seen": 38346980192,
      "step": 48740
    },
    {
      "epoch": 5.170910248249522,
      "grad_norm": 0.6326287532504834,
      "learning_rate": 3.0423164895665624e-05,
      "loss": 1.201,
      "num_input_tokens_seen": 38347766928,
      "step": 48741
    },
    {
      "epoch": 5.171016337789094,
      "grad_norm": 0.5655715449256505,
      "learning_rate": 3.0422486473404065e-05,
      "loss": 1.0798,
      "num_input_tokens_seen": 38348553664,
      "step": 48742
    },
    {
      "epoch": 5.171122427328665,
      "grad_norm": 0.6458624700805295,
      "learning_rate": 3.042180804695217e-05,
      "loss": 1.0982,
      "num_input_tokens_seen": 38349340432,
      "step": 48743
    },
    {
      "epoch": 5.171228516868236,
      "grad_norm": 0.7766506025594142,
      "learning_rate": 3.0421129616310468e-05,
      "loss": 1.18,
      "num_input_tokens_seen": 38350127200,
      "step": 48744
    },
    {
      "epoch": 5.171334606407808,
      "grad_norm": 0.637394847477404,
      "learning_rate": 3.0420451181479466e-05,
      "loss": 1.115,
      "num_input_tokens_seen": 38350914016,
      "step": 48745
    },
    {
      "epoch": 5.171440695947379,
      "grad_norm": 0.8357271799131337,
      "learning_rate": 3.0419772742459703e-05,
      "loss": 1.1096,
      "num_input_tokens_seen": 38351700752,
      "step": 48746
    },
    {
      "epoch": 5.171546785486951,
      "grad_norm": 0.6691917950944856,
      "learning_rate": 3.04190942992517e-05,
      "loss": 1.0782,
      "num_input_tokens_seen": 38352487456,
      "step": 48747
    },
    {
      "epoch": 5.171652875026522,
      "grad_norm": 0.6820115855816824,
      "learning_rate": 3.0418415851855974e-05,
      "loss": 1.1241,
      "num_input_tokens_seen": 38353274224,
      "step": 48748
    },
    {
      "epoch": 5.171758964566094,
      "grad_norm": 0.7597151756725485,
      "learning_rate": 3.041773740027306e-05,
      "loss": 1.2039,
      "num_input_tokens_seen": 38354061088,
      "step": 48749
    },
    {
      "epoch": 5.171865054105665,
      "grad_norm": 0.7783888955024216,
      "learning_rate": 3.0417058944503474e-05,
      "loss": 1.1376,
      "num_input_tokens_seen": 38354847840,
      "step": 48750
    },
    {
      "epoch": 5.171971143645236,
      "grad_norm": 1.02436860453317,
      "learning_rate": 3.0416380484547746e-05,
      "loss": 1.127,
      "num_input_tokens_seen": 38355634592,
      "step": 48751
    },
    {
      "epoch": 5.172077233184808,
      "grad_norm": 1.0171416723698725,
      "learning_rate": 3.04157020204064e-05,
      "loss": 1.0746,
      "num_input_tokens_seen": 38356421408,
      "step": 48752
    },
    {
      "epoch": 5.172183322724379,
      "grad_norm": 0.8528643581419584,
      "learning_rate": 3.0415023552079953e-05,
      "loss": 1.1136,
      "num_input_tokens_seen": 38357208224,
      "step": 48753
    },
    {
      "epoch": 5.172289412263951,
      "grad_norm": 1.3141686878259555,
      "learning_rate": 3.041434507956894e-05,
      "loss": 1.127,
      "num_input_tokens_seen": 38357994976,
      "step": 48754
    },
    {
      "epoch": 5.172395501803522,
      "grad_norm": 0.6841430009542483,
      "learning_rate": 3.041366660287388e-05,
      "loss": 1.1238,
      "num_input_tokens_seen": 38358781760,
      "step": 48755
    },
    {
      "epoch": 5.172501591343093,
      "grad_norm": 0.9920063491876302,
      "learning_rate": 3.0412988121995295e-05,
      "loss": 1.1939,
      "num_input_tokens_seen": 38359568528,
      "step": 48756
    },
    {
      "epoch": 5.172607680882665,
      "grad_norm": 0.6970768942184966,
      "learning_rate": 3.041230963693371e-05,
      "loss": 1.0384,
      "num_input_tokens_seen": 38360355312,
      "step": 48757
    },
    {
      "epoch": 5.172713770422236,
      "grad_norm": 0.6434826211159437,
      "learning_rate": 3.0411631147689658e-05,
      "loss": 1.1982,
      "num_input_tokens_seen": 38361142000,
      "step": 48758
    },
    {
      "epoch": 5.172819859961808,
      "grad_norm": 0.7172736060734586,
      "learning_rate": 3.0410952654263647e-05,
      "loss": 1.2098,
      "num_input_tokens_seen": 38361928800,
      "step": 48759
    },
    {
      "epoch": 5.172925949501379,
      "grad_norm": 0.8596199102642956,
      "learning_rate": 3.0410274156656214e-05,
      "loss": 1.1652,
      "num_input_tokens_seen": 38362715584,
      "step": 48760
    },
    {
      "epoch": 5.173032039040951,
      "grad_norm": 0.6423734329103112,
      "learning_rate": 3.0409595654867884e-05,
      "loss": 1.0775,
      "num_input_tokens_seen": 38363502432,
      "step": 48761
    },
    {
      "epoch": 5.173138128580522,
      "grad_norm": 0.8337710591286502,
      "learning_rate": 3.0408917148899176e-05,
      "loss": 1.1335,
      "num_input_tokens_seen": 38364289200,
      "step": 48762
    },
    {
      "epoch": 5.173244218120093,
      "grad_norm": 0.871688932132143,
      "learning_rate": 3.0408238638750614e-05,
      "loss": 1.0901,
      "num_input_tokens_seen": 38365076000,
      "step": 48763
    },
    {
      "epoch": 5.173350307659665,
      "grad_norm": 0.7423317534184044,
      "learning_rate": 3.0407560124422717e-05,
      "loss": 1.1884,
      "num_input_tokens_seen": 38365862816,
      "step": 48764
    },
    {
      "epoch": 5.173456397199236,
      "grad_norm": 0.8649391715553065,
      "learning_rate": 3.0406881605916027e-05,
      "loss": 1.1321,
      "num_input_tokens_seen": 38366649504,
      "step": 48765
    },
    {
      "epoch": 5.173562486738808,
      "grad_norm": 0.7415742279695509,
      "learning_rate": 3.0406203083231055e-05,
      "loss": 1.1516,
      "num_input_tokens_seen": 38367436272,
      "step": 48766
    },
    {
      "epoch": 5.173668576278379,
      "grad_norm": 0.786291780499183,
      "learning_rate": 3.040552455636832e-05,
      "loss": 1.2016,
      "num_input_tokens_seen": 38368223136,
      "step": 48767
    },
    {
      "epoch": 5.17377466581795,
      "grad_norm": 0.9021597761458089,
      "learning_rate": 3.0404846025328365e-05,
      "loss": 1.0905,
      "num_input_tokens_seen": 38369009952,
      "step": 48768
    },
    {
      "epoch": 5.173880755357522,
      "grad_norm": 0.642433376971845,
      "learning_rate": 3.04041674901117e-05,
      "loss": 1.1406,
      "num_input_tokens_seen": 38369796736,
      "step": 48769
    },
    {
      "epoch": 5.173986844897093,
      "grad_norm": 1.027568593305207,
      "learning_rate": 3.0403488950718852e-05,
      "loss": 1.1759,
      "num_input_tokens_seen": 38370583488,
      "step": 48770
    },
    {
      "epoch": 5.174092934436665,
      "grad_norm": 0.7274109152153325,
      "learning_rate": 3.0402810407150344e-05,
      "loss": 1.1413,
      "num_input_tokens_seen": 38371370272,
      "step": 48771
    },
    {
      "epoch": 5.174199023976236,
      "grad_norm": 0.8325526293801024,
      "learning_rate": 3.0402131859406706e-05,
      "loss": 1.2025,
      "num_input_tokens_seen": 38372157024,
      "step": 48772
    },
    {
      "epoch": 5.174305113515807,
      "grad_norm": 0.8124490131913171,
      "learning_rate": 3.040145330748846e-05,
      "loss": 1.1744,
      "num_input_tokens_seen": 38372943792,
      "step": 48773
    },
    {
      "epoch": 5.174411203055379,
      "grad_norm": 0.6755116767075892,
      "learning_rate": 3.040077475139613e-05,
      "loss": 1.1713,
      "num_input_tokens_seen": 38373730512,
      "step": 48774
    },
    {
      "epoch": 5.17451729259495,
      "grad_norm": 0.6376195794483249,
      "learning_rate": 3.0400096191130233e-05,
      "loss": 1.1121,
      "num_input_tokens_seen": 38374517296,
      "step": 48775
    },
    {
      "epoch": 5.174623382134522,
      "grad_norm": 0.6703155848715882,
      "learning_rate": 3.03994176266913e-05,
      "loss": 1.1462,
      "num_input_tokens_seen": 38375304080,
      "step": 48776
    },
    {
      "epoch": 5.174729471674093,
      "grad_norm": 0.6703987890912533,
      "learning_rate": 3.039873905807986e-05,
      "loss": 1.1727,
      "num_input_tokens_seen": 38376090912,
      "step": 48777
    },
    {
      "epoch": 5.174835561213665,
      "grad_norm": 0.6306316712247713,
      "learning_rate": 3.0398060485296438e-05,
      "loss": 1.0762,
      "num_input_tokens_seen": 38376877648,
      "step": 48778
    },
    {
      "epoch": 5.174941650753236,
      "grad_norm": 0.6532864643918059,
      "learning_rate": 3.0397381908341544e-05,
      "loss": 1.1328,
      "num_input_tokens_seen": 38377664512,
      "step": 48779
    },
    {
      "epoch": 5.175047740292807,
      "grad_norm": 0.6858009736940726,
      "learning_rate": 3.0396703327215714e-05,
      "loss": 1.1663,
      "num_input_tokens_seen": 38378451280,
      "step": 48780
    },
    {
      "epoch": 5.175153829832379,
      "grad_norm": 0.7744287504651475,
      "learning_rate": 3.039602474191947e-05,
      "loss": 1.214,
      "num_input_tokens_seen": 38379238032,
      "step": 48781
    },
    {
      "epoch": 5.17525991937195,
      "grad_norm": 0.7033282457339264,
      "learning_rate": 3.039534615245334e-05,
      "loss": 1.2062,
      "num_input_tokens_seen": 38380024768,
      "step": 48782
    },
    {
      "epoch": 5.175366008911522,
      "grad_norm": 0.622437029048647,
      "learning_rate": 3.0394667558817842e-05,
      "loss": 1.0919,
      "num_input_tokens_seen": 38380811680,
      "step": 48783
    },
    {
      "epoch": 5.175472098451093,
      "grad_norm": 0.7786756576054275,
      "learning_rate": 3.0393988961013503e-05,
      "loss": 1.2581,
      "num_input_tokens_seen": 38381598432,
      "step": 48784
    },
    {
      "epoch": 5.175578187990664,
      "grad_norm": 0.7283045755791857,
      "learning_rate": 3.0393310359040844e-05,
      "loss": 1.0957,
      "num_input_tokens_seen": 38382385104,
      "step": 48785
    },
    {
      "epoch": 5.175684277530236,
      "grad_norm": 0.7267649493061451,
      "learning_rate": 3.0392631752900396e-05,
      "loss": 1.2185,
      "num_input_tokens_seen": 38383171888,
      "step": 48786
    },
    {
      "epoch": 5.175790367069807,
      "grad_norm": 0.6257910905772681,
      "learning_rate": 3.039195314259269e-05,
      "loss": 1.1542,
      "num_input_tokens_seen": 38383958672,
      "step": 48787
    },
    {
      "epoch": 5.175896456609379,
      "grad_norm": 0.6991028246660826,
      "learning_rate": 3.0391274528118223e-05,
      "loss": 1.1638,
      "num_input_tokens_seen": 38384745360,
      "step": 48788
    },
    {
      "epoch": 5.17600254614895,
      "grad_norm": 0.6354288168375516,
      "learning_rate": 3.0390595909477547e-05,
      "loss": 1.1684,
      "num_input_tokens_seen": 38385532128,
      "step": 48789
    },
    {
      "epoch": 5.1761086356885215,
      "grad_norm": 0.5951516036990706,
      "learning_rate": 3.038991728667118e-05,
      "loss": 1.0714,
      "num_input_tokens_seen": 38386318912,
      "step": 48790
    },
    {
      "epoch": 5.176214725228093,
      "grad_norm": 0.6028200381765377,
      "learning_rate": 3.0389238659699638e-05,
      "loss": 1.055,
      "num_input_tokens_seen": 38387105616,
      "step": 48791
    },
    {
      "epoch": 5.176320814767664,
      "grad_norm": 0.8615317466332282,
      "learning_rate": 3.0388560028563455e-05,
      "loss": 1.173,
      "num_input_tokens_seen": 38387892384,
      "step": 48792
    },
    {
      "epoch": 5.1764269043072355,
      "grad_norm": 0.5185833021123369,
      "learning_rate": 3.0387881393263146e-05,
      "loss": 1.0669,
      "num_input_tokens_seen": 38388679312,
      "step": 48793
    },
    {
      "epoch": 5.1765329938468065,
      "grad_norm": 0.6459439569045994,
      "learning_rate": 3.0387202753799243e-05,
      "loss": 1.1741,
      "num_input_tokens_seen": 38389466016,
      "step": 48794
    },
    {
      "epoch": 5.1766390833863785,
      "grad_norm": 0.743482281333101,
      "learning_rate": 3.0386524110172264e-05,
      "loss": 1.1783,
      "num_input_tokens_seen": 38390252688,
      "step": 48795
    },
    {
      "epoch": 5.1767451729259495,
      "grad_norm": 0.5591758530968283,
      "learning_rate": 3.038584546238274e-05,
      "loss": 1.079,
      "num_input_tokens_seen": 38391039552,
      "step": 48796
    },
    {
      "epoch": 5.1768512624655205,
      "grad_norm": 0.6406674736608208,
      "learning_rate": 3.03851668104312e-05,
      "loss": 1.1873,
      "num_input_tokens_seen": 38391826256,
      "step": 48797
    },
    {
      "epoch": 5.176957352005092,
      "grad_norm": 0.6546736532632547,
      "learning_rate": 3.0384488154318152e-05,
      "loss": 1.1419,
      "num_input_tokens_seen": 38392612976,
      "step": 48798
    },
    {
      "epoch": 5.1770634415446635,
      "grad_norm": 0.7741663394304387,
      "learning_rate": 3.038380949404413e-05,
      "loss": 1.2255,
      "num_input_tokens_seen": 38393399760,
      "step": 48799
    },
    {
      "epoch": 5.177169531084235,
      "grad_norm": 0.5650919074302216,
      "learning_rate": 3.038313082960966e-05,
      "loss": 1.1866,
      "num_input_tokens_seen": 38394186608,
      "step": 48800
    },
    {
      "epoch": 5.177275620623806,
      "grad_norm": 1.1938036318009118,
      "learning_rate": 3.0382452161015262e-05,
      "loss": 1.1729,
      "num_input_tokens_seen": 38394973392,
      "step": 48801
    },
    {
      "epoch": 5.1773817101633774,
      "grad_norm": 1.016630900241986,
      "learning_rate": 3.0381773488261467e-05,
      "loss": 1.2041,
      "num_input_tokens_seen": 38395760064,
      "step": 48802
    },
    {
      "epoch": 5.177487799702949,
      "grad_norm": 1.0895563311506795,
      "learning_rate": 3.0381094811348794e-05,
      "loss": 1.1847,
      "num_input_tokens_seen": 38396546752,
      "step": 48803
    },
    {
      "epoch": 5.17759388924252,
      "grad_norm": 1.1424238481973656,
      "learning_rate": 3.0380416130277765e-05,
      "loss": 1.159,
      "num_input_tokens_seen": 38397333536,
      "step": 48804
    },
    {
      "epoch": 5.177699978782092,
      "grad_norm": 0.6684300749402309,
      "learning_rate": 3.0379737445048913e-05,
      "loss": 1.1251,
      "num_input_tokens_seen": 38398120384,
      "step": 48805
    },
    {
      "epoch": 5.177806068321663,
      "grad_norm": 0.8371525435003004,
      "learning_rate": 3.0379058755662755e-05,
      "loss": 1.2713,
      "num_input_tokens_seen": 38398907120,
      "step": 48806
    },
    {
      "epoch": 5.177912157861235,
      "grad_norm": 1.0421829148563049,
      "learning_rate": 3.0378380062119816e-05,
      "loss": 1.1361,
      "num_input_tokens_seen": 38399693856,
      "step": 48807
    },
    {
      "epoch": 5.178018247400806,
      "grad_norm": 0.7955857187461354,
      "learning_rate": 3.037770136442063e-05,
      "loss": 1.2275,
      "num_input_tokens_seen": 38400480624,
      "step": 48808
    },
    {
      "epoch": 5.178124336940377,
      "grad_norm": 0.816549662562756,
      "learning_rate": 3.0377022662565713e-05,
      "loss": 1.1635,
      "num_input_tokens_seen": 38401267344,
      "step": 48809
    },
    {
      "epoch": 5.178230426479949,
      "grad_norm": 1.0920900975599777,
      "learning_rate": 3.037634395655558e-05,
      "loss": 1.1686,
      "num_input_tokens_seen": 38402054176,
      "step": 48810
    },
    {
      "epoch": 5.17833651601952,
      "grad_norm": 0.650885143399483,
      "learning_rate": 3.0375665246390777e-05,
      "loss": 1.0858,
      "num_input_tokens_seen": 38402841008,
      "step": 48811
    },
    {
      "epoch": 5.178442605559092,
      "grad_norm": 1.1179589691377751,
      "learning_rate": 3.037498653207182e-05,
      "loss": 1.1995,
      "num_input_tokens_seen": 38403627712,
      "step": 48812
    },
    {
      "epoch": 5.178548695098663,
      "grad_norm": 0.8145271046323631,
      "learning_rate": 3.037430781359922e-05,
      "loss": 1.1751,
      "num_input_tokens_seen": 38404414464,
      "step": 48813
    },
    {
      "epoch": 5.178654784638234,
      "grad_norm": 0.7769959900400353,
      "learning_rate": 3.037362909097352e-05,
      "loss": 1.2177,
      "num_input_tokens_seen": 38405201184,
      "step": 48814
    },
    {
      "epoch": 5.178760874177806,
      "grad_norm": 0.9578374272532839,
      "learning_rate": 3.037295036419524e-05,
      "loss": 1.1749,
      "num_input_tokens_seen": 38405987904,
      "step": 48815
    },
    {
      "epoch": 5.178866963717377,
      "grad_norm": 0.7092182734806143,
      "learning_rate": 3.0372271633264892e-05,
      "loss": 1.1611,
      "num_input_tokens_seen": 38406774656,
      "step": 48816
    },
    {
      "epoch": 5.178973053256949,
      "grad_norm": 0.7967775155083398,
      "learning_rate": 3.0371592898183014e-05,
      "loss": 1.1339,
      "num_input_tokens_seen": 38407561552,
      "step": 48817
    },
    {
      "epoch": 5.17907914279652,
      "grad_norm": 1.1106756375058344,
      "learning_rate": 3.037091415895013e-05,
      "loss": 1.1305,
      "num_input_tokens_seen": 38408348352,
      "step": 48818
    },
    {
      "epoch": 5.179185232336092,
      "grad_norm": 0.6399575657277334,
      "learning_rate": 3.0370235415566756e-05,
      "loss": 1.2505,
      "num_input_tokens_seen": 38409135072,
      "step": 48819
    },
    {
      "epoch": 5.179291321875663,
      "grad_norm": 1.1683037635985531,
      "learning_rate": 3.0369556668033426e-05,
      "loss": 1.1493,
      "num_input_tokens_seen": 38409921888,
      "step": 48820
    },
    {
      "epoch": 5.179397411415234,
      "grad_norm": 0.8768556683930275,
      "learning_rate": 3.0368877916350665e-05,
      "loss": 1.1915,
      "num_input_tokens_seen": 38410708768,
      "step": 48821
    },
    {
      "epoch": 5.179503500954806,
      "grad_norm": 0.6789698411305316,
      "learning_rate": 3.036819916051898e-05,
      "loss": 1.1915,
      "num_input_tokens_seen": 38411495552,
      "step": 48822
    },
    {
      "epoch": 5.179609590494377,
      "grad_norm": 1.0079787601361638,
      "learning_rate": 3.0367520400538918e-05,
      "loss": 1.1413,
      "num_input_tokens_seen": 38412282352,
      "step": 48823
    },
    {
      "epoch": 5.179715680033949,
      "grad_norm": 0.8674889652282327,
      "learning_rate": 3.0366841636410986e-05,
      "loss": 1.1376,
      "num_input_tokens_seen": 38413069200,
      "step": 48824
    },
    {
      "epoch": 5.17982176957352,
      "grad_norm": 0.5056422074480532,
      "learning_rate": 3.0366162868135723e-05,
      "loss": 1.0666,
      "num_input_tokens_seen": 38413855984,
      "step": 48825
    },
    {
      "epoch": 5.179927859113091,
      "grad_norm": 0.8425149670740152,
      "learning_rate": 3.0365484095713648e-05,
      "loss": 1.1872,
      "num_input_tokens_seen": 38414642768,
      "step": 48826
    },
    {
      "epoch": 5.180033948652663,
      "grad_norm": 0.7201537781334953,
      "learning_rate": 3.0364805319145272e-05,
      "loss": 1.0422,
      "num_input_tokens_seen": 38415429504,
      "step": 48827
    },
    {
      "epoch": 5.180140038192234,
      "grad_norm": 0.6261465013594542,
      "learning_rate": 3.0364126538431147e-05,
      "loss": 1.0817,
      "num_input_tokens_seen": 38416216288,
      "step": 48828
    },
    {
      "epoch": 5.180246127731806,
      "grad_norm": 0.801102611292759,
      "learning_rate": 3.036344775357178e-05,
      "loss": 1.0597,
      "num_input_tokens_seen": 38417003072,
      "step": 48829
    },
    {
      "epoch": 5.180352217271377,
      "grad_norm": 0.9328681267421737,
      "learning_rate": 3.036276896456769e-05,
      "loss": 1.1963,
      "num_input_tokens_seen": 38417789840,
      "step": 48830
    },
    {
      "epoch": 5.180458306810948,
      "grad_norm": 0.5525006133780676,
      "learning_rate": 3.0362090171419405e-05,
      "loss": 1.1431,
      "num_input_tokens_seen": 38418576576,
      "step": 48831
    },
    {
      "epoch": 5.18056439635052,
      "grad_norm": 0.8393840150418582,
      "learning_rate": 3.0361411374127467e-05,
      "loss": 1.1359,
      "num_input_tokens_seen": 38419363408,
      "step": 48832
    },
    {
      "epoch": 5.180670485890091,
      "grad_norm": 0.7644673893867375,
      "learning_rate": 3.0360732572692386e-05,
      "loss": 1.1095,
      "num_input_tokens_seen": 38420150192,
      "step": 48833
    },
    {
      "epoch": 5.180776575429663,
      "grad_norm": 0.6048550245521492,
      "learning_rate": 3.0360053767114683e-05,
      "loss": 1.1614,
      "num_input_tokens_seen": 38420936944,
      "step": 48834
    },
    {
      "epoch": 5.180882664969234,
      "grad_norm": 0.9421017021573187,
      "learning_rate": 3.0359374957394888e-05,
      "loss": 1.1976,
      "num_input_tokens_seen": 38421723664,
      "step": 48835
    },
    {
      "epoch": 5.180988754508806,
      "grad_norm": 0.7167163045114731,
      "learning_rate": 3.0358696143533528e-05,
      "loss": 1.1401,
      "num_input_tokens_seen": 38422510448,
      "step": 48836
    },
    {
      "epoch": 5.181094844048377,
      "grad_norm": 0.6825417916584455,
      "learning_rate": 3.0358017325531122e-05,
      "loss": 1.2553,
      "num_input_tokens_seen": 38423297232,
      "step": 48837
    },
    {
      "epoch": 5.181200933587948,
      "grad_norm": 0.6825193454978515,
      "learning_rate": 3.03573385033882e-05,
      "loss": 1.1213,
      "num_input_tokens_seen": 38424084096,
      "step": 48838
    },
    {
      "epoch": 5.18130702312752,
      "grad_norm": 0.6098973908553871,
      "learning_rate": 3.035665967710528e-05,
      "loss": 1.2324,
      "num_input_tokens_seen": 38424870880,
      "step": 48839
    },
    {
      "epoch": 5.181413112667091,
      "grad_norm": 0.6861184716364503,
      "learning_rate": 3.0355980846682896e-05,
      "loss": 1.1743,
      "num_input_tokens_seen": 38425657664,
      "step": 48840
    },
    {
      "epoch": 5.181519202206663,
      "grad_norm": 0.7789051547989743,
      "learning_rate": 3.0355302012121566e-05,
      "loss": 1.2002,
      "num_input_tokens_seen": 38426444496,
      "step": 48841
    },
    {
      "epoch": 5.181625291746234,
      "grad_norm": 0.6624864852486103,
      "learning_rate": 3.0354623173421816e-05,
      "loss": 1.1093,
      "num_input_tokens_seen": 38427231216,
      "step": 48842
    },
    {
      "epoch": 5.181731381285805,
      "grad_norm": 0.7424245191869976,
      "learning_rate": 3.035394433058417e-05,
      "loss": 1.2294,
      "num_input_tokens_seen": 38428017952,
      "step": 48843
    },
    {
      "epoch": 5.181837470825377,
      "grad_norm": 0.7339116236792789,
      "learning_rate": 3.0353265483609155e-05,
      "loss": 1.1794,
      "num_input_tokens_seen": 38428804736,
      "step": 48844
    },
    {
      "epoch": 5.181943560364948,
      "grad_norm": 0.5950095770996249,
      "learning_rate": 3.0352586632497286e-05,
      "loss": 1.106,
      "num_input_tokens_seen": 38429591424,
      "step": 48845
    },
    {
      "epoch": 5.18204964990452,
      "grad_norm": 0.7444708283738358,
      "learning_rate": 3.03519077772491e-05,
      "loss": 1.1476,
      "num_input_tokens_seen": 38430378224,
      "step": 48846
    },
    {
      "epoch": 5.182155739444091,
      "grad_norm": 0.7803447327390565,
      "learning_rate": 3.035122891786512e-05,
      "loss": 1.1115,
      "num_input_tokens_seen": 38431164896,
      "step": 48847
    },
    {
      "epoch": 5.182261828983663,
      "grad_norm": 0.6857811149468152,
      "learning_rate": 3.035055005434586e-05,
      "loss": 1.2271,
      "num_input_tokens_seen": 38431951600,
      "step": 48848
    },
    {
      "epoch": 5.182367918523234,
      "grad_norm": 0.7469025707471377,
      "learning_rate": 3.0349871186691858e-05,
      "loss": 1.1118,
      "num_input_tokens_seen": 38432738368,
      "step": 48849
    },
    {
      "epoch": 5.182474008062805,
      "grad_norm": 0.8322088497965641,
      "learning_rate": 3.034919231490363e-05,
      "loss": 1.1597,
      "num_input_tokens_seen": 38433525040,
      "step": 48850
    },
    {
      "epoch": 5.182580097602377,
      "grad_norm": 0.7825591800118022,
      "learning_rate": 3.03485134389817e-05,
      "loss": 1.135,
      "num_input_tokens_seen": 38434311760,
      "step": 48851
    },
    {
      "epoch": 5.182686187141948,
      "grad_norm": 0.7502933601021725,
      "learning_rate": 3.0347834558926604e-05,
      "loss": 1.1367,
      "num_input_tokens_seen": 38435098512,
      "step": 48852
    },
    {
      "epoch": 5.1827922766815195,
      "grad_norm": 0.6519632174588804,
      "learning_rate": 3.0347155674738846e-05,
      "loss": 1.1704,
      "num_input_tokens_seen": 38435885328,
      "step": 48853
    },
    {
      "epoch": 5.182898366221091,
      "grad_norm": 0.6036837133830465,
      "learning_rate": 3.0346476786418977e-05,
      "loss": 1.1415,
      "num_input_tokens_seen": 38436672208,
      "step": 48854
    },
    {
      "epoch": 5.183004455760662,
      "grad_norm": 0.6786644601625996,
      "learning_rate": 3.0345797893967502e-05,
      "loss": 1.1005,
      "num_input_tokens_seen": 38437459072,
      "step": 48855
    },
    {
      "epoch": 5.1831105453002335,
      "grad_norm": 0.6014182759214335,
      "learning_rate": 3.0345118997384946e-05,
      "loss": 1.2145,
      "num_input_tokens_seen": 38438245856,
      "step": 48856
    },
    {
      "epoch": 5.1832166348398045,
      "grad_norm": 0.7116491155285362,
      "learning_rate": 3.0344440096671843e-05,
      "loss": 1.1613,
      "num_input_tokens_seen": 38439032576,
      "step": 48857
    },
    {
      "epoch": 5.1833227243793765,
      "grad_norm": 0.5432570146084609,
      "learning_rate": 3.034376119182872e-05,
      "loss": 1.1293,
      "num_input_tokens_seen": 38439819392,
      "step": 48858
    },
    {
      "epoch": 5.1834288139189475,
      "grad_norm": 0.7239155555641046,
      "learning_rate": 3.0343082282856083e-05,
      "loss": 1.0628,
      "num_input_tokens_seen": 38440606224,
      "step": 48859
    },
    {
      "epoch": 5.183534903458519,
      "grad_norm": 0.665500920272613,
      "learning_rate": 3.034240336975448e-05,
      "loss": 1.1186,
      "num_input_tokens_seen": 38441393040,
      "step": 48860
    },
    {
      "epoch": 5.1836409929980904,
      "grad_norm": 0.6059799413979465,
      "learning_rate": 3.0341724452524418e-05,
      "loss": 1.1418,
      "num_input_tokens_seen": 38442179760,
      "step": 48861
    },
    {
      "epoch": 5.1837470825376615,
      "grad_norm": 0.5891811182186404,
      "learning_rate": 3.034104553116643e-05,
      "loss": 1.1475,
      "num_input_tokens_seen": 38442966608,
      "step": 48862
    },
    {
      "epoch": 5.183853172077233,
      "grad_norm": 0.587977802037582,
      "learning_rate": 3.0340366605681038e-05,
      "loss": 1.1811,
      "num_input_tokens_seen": 38443753392,
      "step": 48863
    },
    {
      "epoch": 5.183959261616804,
      "grad_norm": 0.8166918251187963,
      "learning_rate": 3.0339687676068767e-05,
      "loss": 1.2464,
      "num_input_tokens_seen": 38444540144,
      "step": 48864
    },
    {
      "epoch": 5.184065351156376,
      "grad_norm": 0.6037192788932813,
      "learning_rate": 3.0339008742330138e-05,
      "loss": 1.1918,
      "num_input_tokens_seen": 38445326880,
      "step": 48865
    },
    {
      "epoch": 5.184171440695947,
      "grad_norm": 0.5897718186288803,
      "learning_rate": 3.0338329804465686e-05,
      "loss": 1.0926,
      "num_input_tokens_seen": 38446113728,
      "step": 48866
    },
    {
      "epoch": 5.184277530235518,
      "grad_norm": 0.6223920822208869,
      "learning_rate": 3.0337650862475926e-05,
      "loss": 1.0739,
      "num_input_tokens_seen": 38446900368,
      "step": 48867
    },
    {
      "epoch": 5.18438361977509,
      "grad_norm": 0.5690893908981924,
      "learning_rate": 3.033697191636139e-05,
      "loss": 1.096,
      "num_input_tokens_seen": 38447687088,
      "step": 48868
    },
    {
      "epoch": 5.184489709314661,
      "grad_norm": 0.6181895726710497,
      "learning_rate": 3.03362929661226e-05,
      "loss": 1.2028,
      "num_input_tokens_seen": 38448473776,
      "step": 48869
    },
    {
      "epoch": 5.184595798854233,
      "grad_norm": 0.7123213108313114,
      "learning_rate": 3.0335614011760073e-05,
      "loss": 1.1522,
      "num_input_tokens_seen": 38449260544,
      "step": 48870
    },
    {
      "epoch": 5.184701888393804,
      "grad_norm": 0.642132416674438,
      "learning_rate": 3.033493505327434e-05,
      "loss": 1.1177,
      "num_input_tokens_seen": 38450047296,
      "step": 48871
    },
    {
      "epoch": 5.184807977933376,
      "grad_norm": 0.5733378977907734,
      "learning_rate": 3.033425609066593e-05,
      "loss": 1.0958,
      "num_input_tokens_seen": 38450834064,
      "step": 48872
    },
    {
      "epoch": 5.184914067472947,
      "grad_norm": 0.7186149807200206,
      "learning_rate": 3.0333577123935358e-05,
      "loss": 1.1674,
      "num_input_tokens_seen": 38451620816,
      "step": 48873
    },
    {
      "epoch": 5.185020157012518,
      "grad_norm": 0.5663154964562933,
      "learning_rate": 3.033289815308316e-05,
      "loss": 1.0823,
      "num_input_tokens_seen": 38452407664,
      "step": 48874
    },
    {
      "epoch": 5.18512624655209,
      "grad_norm": 0.8702066208858998,
      "learning_rate": 3.0332219178109856e-05,
      "loss": 1.1358,
      "num_input_tokens_seen": 38453194416,
      "step": 48875
    },
    {
      "epoch": 5.185232336091661,
      "grad_norm": 0.5656874591302122,
      "learning_rate": 3.0331540199015963e-05,
      "loss": 1.0775,
      "num_input_tokens_seen": 38453981200,
      "step": 48876
    },
    {
      "epoch": 5.185338425631233,
      "grad_norm": 0.6104197924971791,
      "learning_rate": 3.0330861215802014e-05,
      "loss": 1.1633,
      "num_input_tokens_seen": 38454768064,
      "step": 48877
    },
    {
      "epoch": 5.185444515170804,
      "grad_norm": 0.6431546740077118,
      "learning_rate": 3.033018222846853e-05,
      "loss": 1.0594,
      "num_input_tokens_seen": 38455554848,
      "step": 48878
    },
    {
      "epoch": 5.185550604710375,
      "grad_norm": 0.5721834867207606,
      "learning_rate": 3.0329503237016037e-05,
      "loss": 1.0992,
      "num_input_tokens_seen": 38456341552,
      "step": 48879
    },
    {
      "epoch": 5.185656694249947,
      "grad_norm": 0.6557613860392989,
      "learning_rate": 3.032882424144507e-05,
      "loss": 1.238,
      "num_input_tokens_seen": 38457128272,
      "step": 48880
    },
    {
      "epoch": 5.185762783789518,
      "grad_norm": 0.6248102170806089,
      "learning_rate": 3.032814524175614e-05,
      "loss": 1.221,
      "num_input_tokens_seen": 38457915072,
      "step": 48881
    },
    {
      "epoch": 5.18586887332909,
      "grad_norm": 0.7460876908232345,
      "learning_rate": 3.032746623794977e-05,
      "loss": 1.0849,
      "num_input_tokens_seen": 38458701872,
      "step": 48882
    },
    {
      "epoch": 5.185974962868661,
      "grad_norm": 0.6735485398558129,
      "learning_rate": 3.0326787230026495e-05,
      "loss": 1.1731,
      "num_input_tokens_seen": 38459488592,
      "step": 48883
    },
    {
      "epoch": 5.186081052408232,
      "grad_norm": 0.7202293131610485,
      "learning_rate": 3.032610821798684e-05,
      "loss": 1.179,
      "num_input_tokens_seen": 38460275344,
      "step": 48884
    },
    {
      "epoch": 5.186187141947804,
      "grad_norm": 0.8814544629242299,
      "learning_rate": 3.032542920183131e-05,
      "loss": 1.1791,
      "num_input_tokens_seen": 38461062144,
      "step": 48885
    },
    {
      "epoch": 5.186293231487375,
      "grad_norm": 0.6544723833561585,
      "learning_rate": 3.0324750181560456e-05,
      "loss": 1.1283,
      "num_input_tokens_seen": 38461848896,
      "step": 48886
    },
    {
      "epoch": 5.186399321026947,
      "grad_norm": 0.6494791347375551,
      "learning_rate": 3.0324071157174787e-05,
      "loss": 1.1275,
      "num_input_tokens_seen": 38462635712,
      "step": 48887
    },
    {
      "epoch": 5.186505410566518,
      "grad_norm": 0.8961168139819637,
      "learning_rate": 3.032339212867483e-05,
      "loss": 1.196,
      "num_input_tokens_seen": 38463422400,
      "step": 48888
    },
    {
      "epoch": 5.18661150010609,
      "grad_norm": 0.8209786188415195,
      "learning_rate": 3.032271309606112e-05,
      "loss": 1.0891,
      "num_input_tokens_seen": 38464209200,
      "step": 48889
    },
    {
      "epoch": 5.186717589645661,
      "grad_norm": 0.727277752148665,
      "learning_rate": 3.032203405933417e-05,
      "loss": 1.1466,
      "num_input_tokens_seen": 38464995920,
      "step": 48890
    },
    {
      "epoch": 5.186823679185232,
      "grad_norm": 0.794156885079093,
      "learning_rate": 3.0321355018494508e-05,
      "loss": 1.1837,
      "num_input_tokens_seen": 38465782640,
      "step": 48891
    },
    {
      "epoch": 5.186929768724804,
      "grad_norm": 0.7258533513195329,
      "learning_rate": 3.0320675973542655e-05,
      "loss": 1.1771,
      "num_input_tokens_seen": 38466569424,
      "step": 48892
    },
    {
      "epoch": 5.187035858264375,
      "grad_norm": 0.6293082788666864,
      "learning_rate": 3.031999692447915e-05,
      "loss": 1.1399,
      "num_input_tokens_seen": 38467356176,
      "step": 48893
    },
    {
      "epoch": 5.187141947803947,
      "grad_norm": 0.9494662245984771,
      "learning_rate": 3.0319317871304496e-05,
      "loss": 1.2469,
      "num_input_tokens_seen": 38468143040,
      "step": 48894
    },
    {
      "epoch": 5.187248037343518,
      "grad_norm": 0.7195237151060837,
      "learning_rate": 3.0318638814019234e-05,
      "loss": 1.2045,
      "num_input_tokens_seen": 38468929728,
      "step": 48895
    },
    {
      "epoch": 5.187354126883089,
      "grad_norm": 0.9556616307415718,
      "learning_rate": 3.0317959752623883e-05,
      "loss": 1.1964,
      "num_input_tokens_seen": 38469716384,
      "step": 48896
    },
    {
      "epoch": 5.187460216422661,
      "grad_norm": 0.764183853046945,
      "learning_rate": 3.0317280687118972e-05,
      "loss": 1.1617,
      "num_input_tokens_seen": 38470503200,
      "step": 48897
    },
    {
      "epoch": 5.187566305962232,
      "grad_norm": 0.7267974701878097,
      "learning_rate": 3.031660161750502e-05,
      "loss": 1.1121,
      "num_input_tokens_seen": 38471290000,
      "step": 48898
    },
    {
      "epoch": 5.187672395501804,
      "grad_norm": 0.7455821344558604,
      "learning_rate": 3.0315922543782547e-05,
      "loss": 1.109,
      "num_input_tokens_seen": 38472076752,
      "step": 48899
    },
    {
      "epoch": 5.187778485041375,
      "grad_norm": 0.9385811407309567,
      "learning_rate": 3.0315243465952098e-05,
      "loss": 1.1761,
      "num_input_tokens_seen": 38472863504,
      "step": 48900
    },
    {
      "epoch": 5.187884574580947,
      "grad_norm": 0.5250630135766017,
      "learning_rate": 3.031456438401418e-05,
      "loss": 1.0664,
      "num_input_tokens_seen": 38473650240,
      "step": 48901
    },
    {
      "epoch": 5.187990664120518,
      "grad_norm": 0.718092417105083,
      "learning_rate": 3.0313885297969318e-05,
      "loss": 1.1122,
      "num_input_tokens_seen": 38474437056,
      "step": 48902
    },
    {
      "epoch": 5.188096753660089,
      "grad_norm": 0.9446181742729758,
      "learning_rate": 3.0313206207818046e-05,
      "loss": 1.1494,
      "num_input_tokens_seen": 38475223696,
      "step": 48903
    },
    {
      "epoch": 5.188202843199661,
      "grad_norm": 0.6263101264873676,
      "learning_rate": 3.0312527113560886e-05,
      "loss": 1.1955,
      "num_input_tokens_seen": 38476010368,
      "step": 48904
    },
    {
      "epoch": 5.188308932739232,
      "grad_norm": 0.841973789766308,
      "learning_rate": 3.0311848015198358e-05,
      "loss": 1.1817,
      "num_input_tokens_seen": 38476797120,
      "step": 48905
    },
    {
      "epoch": 5.188415022278804,
      "grad_norm": 0.8138736942345406,
      "learning_rate": 3.0311168912730992e-05,
      "loss": 1.2209,
      "num_input_tokens_seen": 38477583840,
      "step": 48906
    },
    {
      "epoch": 5.188521111818375,
      "grad_norm": 0.5759544052809198,
      "learning_rate": 3.031048980615931e-05,
      "loss": 1.1524,
      "num_input_tokens_seen": 38478370512,
      "step": 48907
    },
    {
      "epoch": 5.188627201357946,
      "grad_norm": 0.9242251532863303,
      "learning_rate": 3.030981069548383e-05,
      "loss": 1.2415,
      "num_input_tokens_seen": 38479157280,
      "step": 48908
    },
    {
      "epoch": 5.188733290897518,
      "grad_norm": 0.6640710343665099,
      "learning_rate": 3.0309131580705093e-05,
      "loss": 1.1805,
      "num_input_tokens_seen": 38479944048,
      "step": 48909
    },
    {
      "epoch": 5.188839380437089,
      "grad_norm": 0.5599017535692022,
      "learning_rate": 3.0308452461823605e-05,
      "loss": 1.0863,
      "num_input_tokens_seen": 38480730832,
      "step": 48910
    },
    {
      "epoch": 5.188945469976661,
      "grad_norm": 0.8361089670819202,
      "learning_rate": 3.0307773338839912e-05,
      "loss": 1.1673,
      "num_input_tokens_seen": 38481517632,
      "step": 48911
    },
    {
      "epoch": 5.189051559516232,
      "grad_norm": 0.708830298981377,
      "learning_rate": 3.0307094211754524e-05,
      "loss": 1.1778,
      "num_input_tokens_seen": 38482304368,
      "step": 48912
    },
    {
      "epoch": 5.189157649055803,
      "grad_norm": 0.607367558934184,
      "learning_rate": 3.0306415080567964e-05,
      "loss": 1.1299,
      "num_input_tokens_seen": 38483091136,
      "step": 48913
    },
    {
      "epoch": 5.189263738595375,
      "grad_norm": 0.8956278173958331,
      "learning_rate": 3.0305735945280766e-05,
      "loss": 1.1301,
      "num_input_tokens_seen": 38483877920,
      "step": 48914
    },
    {
      "epoch": 5.189369828134946,
      "grad_norm": 0.7576844717272114,
      "learning_rate": 3.0305056805893457e-05,
      "loss": 1.1628,
      "num_input_tokens_seen": 38484664720,
      "step": 48915
    },
    {
      "epoch": 5.1894759176745175,
      "grad_norm": 0.7647572910657304,
      "learning_rate": 3.0304377662406546e-05,
      "loss": 1.1796,
      "num_input_tokens_seen": 38485451456,
      "step": 48916
    },
    {
      "epoch": 5.189582007214089,
      "grad_norm": 0.9693086889977411,
      "learning_rate": 3.030369851482057e-05,
      "loss": 1.21,
      "num_input_tokens_seen": 38486238288,
      "step": 48917
    },
    {
      "epoch": 5.1896880967536605,
      "grad_norm": 0.5901937025007745,
      "learning_rate": 3.030301936313606e-05,
      "loss": 1.0468,
      "num_input_tokens_seen": 38487025104,
      "step": 48918
    },
    {
      "epoch": 5.1897941862932315,
      "grad_norm": 0.8069583892942603,
      "learning_rate": 3.030234020735352e-05,
      "loss": 1.2438,
      "num_input_tokens_seen": 38487811776,
      "step": 48919
    },
    {
      "epoch": 5.189900275832803,
      "grad_norm": 0.7486291538488368,
      "learning_rate": 3.0301661047473495e-05,
      "loss": 1.1304,
      "num_input_tokens_seen": 38488598512,
      "step": 48920
    },
    {
      "epoch": 5.1900063653723745,
      "grad_norm": 0.6518220125042085,
      "learning_rate": 3.0300981883496497e-05,
      "loss": 1.1065,
      "num_input_tokens_seen": 38489385328,
      "step": 48921
    },
    {
      "epoch": 5.1901124549119455,
      "grad_norm": 0.8291703841463801,
      "learning_rate": 3.0300302715423056e-05,
      "loss": 1.1572,
      "num_input_tokens_seen": 38490172080,
      "step": 48922
    },
    {
      "epoch": 5.190218544451517,
      "grad_norm": 0.7999389544549997,
      "learning_rate": 3.02996235432537e-05,
      "loss": 1.2543,
      "num_input_tokens_seen": 38490958928,
      "step": 48923
    },
    {
      "epoch": 5.1903246339910885,
      "grad_norm": 0.6955100420006585,
      "learning_rate": 3.0298944366988953e-05,
      "loss": 1.1673,
      "num_input_tokens_seen": 38491745600,
      "step": 48924
    },
    {
      "epoch": 5.1904307235306595,
      "grad_norm": 0.9147761878063354,
      "learning_rate": 3.0298265186629333e-05,
      "loss": 1.1334,
      "num_input_tokens_seen": 38492532464,
      "step": 48925
    },
    {
      "epoch": 5.190536813070231,
      "grad_norm": 0.617362026484603,
      "learning_rate": 3.029758600217536e-05,
      "loss": 1.1809,
      "num_input_tokens_seen": 38493319328,
      "step": 48926
    },
    {
      "epoch": 5.190642902609802,
      "grad_norm": 0.5237404258308485,
      "learning_rate": 3.0296906813627578e-05,
      "loss": 1.2033,
      "num_input_tokens_seen": 38494105952,
      "step": 48927
    },
    {
      "epoch": 5.190748992149374,
      "grad_norm": 0.7071151931482981,
      "learning_rate": 3.02962276209865e-05,
      "loss": 1.1475,
      "num_input_tokens_seen": 38494892800,
      "step": 48928
    },
    {
      "epoch": 5.190855081688945,
      "grad_norm": 0.6585630520047908,
      "learning_rate": 3.0295548424252657e-05,
      "loss": 1.1434,
      "num_input_tokens_seen": 38495679552,
      "step": 48929
    },
    {
      "epoch": 5.190961171228517,
      "grad_norm": 0.5268043115623207,
      "learning_rate": 3.029486922342657e-05,
      "loss": 1.1654,
      "num_input_tokens_seen": 38496466400,
      "step": 48930
    },
    {
      "epoch": 5.191067260768088,
      "grad_norm": 0.842113975730781,
      "learning_rate": 3.0294190018508756e-05,
      "loss": 1.1679,
      "num_input_tokens_seen": 38497253248,
      "step": 48931
    },
    {
      "epoch": 5.191173350307659,
      "grad_norm": 0.6221983863161457,
      "learning_rate": 3.0293510809499753e-05,
      "loss": 1.1941,
      "num_input_tokens_seen": 38498040000,
      "step": 48932
    },
    {
      "epoch": 5.191279439847231,
      "grad_norm": 0.6342347906809113,
      "learning_rate": 3.029283159640008e-05,
      "loss": 1.2184,
      "num_input_tokens_seen": 38498826784,
      "step": 48933
    },
    {
      "epoch": 5.191385529386802,
      "grad_norm": 0.6416729034235801,
      "learning_rate": 3.029215237921026e-05,
      "loss": 1.2025,
      "num_input_tokens_seen": 38499613536,
      "step": 48934
    },
    {
      "epoch": 5.191491618926374,
      "grad_norm": 1.0037701322751262,
      "learning_rate": 3.0291473157930817e-05,
      "loss": 1.1462,
      "num_input_tokens_seen": 38500400304,
      "step": 48935
    },
    {
      "epoch": 5.191597708465945,
      "grad_norm": 0.7257722503541975,
      "learning_rate": 3.0290793932562284e-05,
      "loss": 1.2238,
      "num_input_tokens_seen": 38501187040,
      "step": 48936
    },
    {
      "epoch": 5.191703798005516,
      "grad_norm": 0.9468998886903842,
      "learning_rate": 3.0290114703105178e-05,
      "loss": 1.1938,
      "num_input_tokens_seen": 38501973888,
      "step": 48937
    },
    {
      "epoch": 5.191809887545088,
      "grad_norm": 0.6664493010189514,
      "learning_rate": 3.028943546956003e-05,
      "loss": 1.099,
      "num_input_tokens_seen": 38502760672,
      "step": 48938
    },
    {
      "epoch": 5.191915977084659,
      "grad_norm": 0.656836341391361,
      "learning_rate": 3.0288756231927352e-05,
      "loss": 1.1334,
      "num_input_tokens_seen": 38503547472,
      "step": 48939
    },
    {
      "epoch": 5.192022066624231,
      "grad_norm": 0.6898996630429147,
      "learning_rate": 3.0288076990207685e-05,
      "loss": 1.1918,
      "num_input_tokens_seen": 38504334240,
      "step": 48940
    },
    {
      "epoch": 5.192128156163802,
      "grad_norm": 0.7449524961165639,
      "learning_rate": 3.0287397744401552e-05,
      "loss": 1.2233,
      "num_input_tokens_seen": 38505120992,
      "step": 48941
    },
    {
      "epoch": 5.192234245703373,
      "grad_norm": 0.5942268308354481,
      "learning_rate": 3.0286718494509465e-05,
      "loss": 1.1638,
      "num_input_tokens_seen": 38505907808,
      "step": 48942
    },
    {
      "epoch": 5.192340335242945,
      "grad_norm": 0.6315968061088882,
      "learning_rate": 3.028603924053196e-05,
      "loss": 1.2475,
      "num_input_tokens_seen": 38506694592,
      "step": 48943
    },
    {
      "epoch": 5.192446424782516,
      "grad_norm": 0.6688888416139795,
      "learning_rate": 3.0285359982469563e-05,
      "loss": 1.1633,
      "num_input_tokens_seen": 38507481376,
      "step": 48944
    },
    {
      "epoch": 5.192552514322088,
      "grad_norm": 0.7021859246400678,
      "learning_rate": 3.028468072032279e-05,
      "loss": 1.2095,
      "num_input_tokens_seen": 38508268032,
      "step": 48945
    },
    {
      "epoch": 5.192658603861659,
      "grad_norm": 0.7507768828158243,
      "learning_rate": 3.0284001454092177e-05,
      "loss": 1.1147,
      "num_input_tokens_seen": 38509054816,
      "step": 48946
    },
    {
      "epoch": 5.192764693401231,
      "grad_norm": 0.607507031074081,
      "learning_rate": 3.028332218377824e-05,
      "loss": 1.1666,
      "num_input_tokens_seen": 38509841552,
      "step": 48947
    },
    {
      "epoch": 5.192870782940802,
      "grad_norm": 0.5156193505224783,
      "learning_rate": 3.02826429093815e-05,
      "loss": 1.0914,
      "num_input_tokens_seen": 38510628352,
      "step": 48948
    },
    {
      "epoch": 5.192976872480373,
      "grad_norm": 0.9127099738258452,
      "learning_rate": 3.0281963630902494e-05,
      "loss": 1.1896,
      "num_input_tokens_seen": 38511415072,
      "step": 48949
    },
    {
      "epoch": 5.193082962019945,
      "grad_norm": 0.637374733007653,
      "learning_rate": 3.0281284348341744e-05,
      "loss": 1.1946,
      "num_input_tokens_seen": 38512201856,
      "step": 48950
    },
    {
      "epoch": 5.193189051559516,
      "grad_norm": 0.7930569299422146,
      "learning_rate": 3.0280605061699763e-05,
      "loss": 1.2006,
      "num_input_tokens_seen": 38512988576,
      "step": 48951
    },
    {
      "epoch": 5.193295141099088,
      "grad_norm": 0.58158032476326,
      "learning_rate": 3.0279925770977093e-05,
      "loss": 1.2562,
      "num_input_tokens_seen": 38513775280,
      "step": 48952
    },
    {
      "epoch": 5.193401230638659,
      "grad_norm": 0.6964114374976675,
      "learning_rate": 3.027924647617425e-05,
      "loss": 1.0737,
      "num_input_tokens_seen": 38514562096,
      "step": 48953
    },
    {
      "epoch": 5.19350732017823,
      "grad_norm": 0.7228795165855344,
      "learning_rate": 3.027856717729176e-05,
      "loss": 1.1461,
      "num_input_tokens_seen": 38515348848,
      "step": 48954
    },
    {
      "epoch": 5.193613409717802,
      "grad_norm": 0.6352443890419702,
      "learning_rate": 3.0277887874330147e-05,
      "loss": 1.1339,
      "num_input_tokens_seen": 38516135680,
      "step": 48955
    },
    {
      "epoch": 5.193719499257373,
      "grad_norm": 0.6588133767900616,
      "learning_rate": 3.027720856728994e-05,
      "loss": 1.1645,
      "num_input_tokens_seen": 38516922480,
      "step": 48956
    },
    {
      "epoch": 5.193825588796945,
      "grad_norm": 0.6387015535765252,
      "learning_rate": 3.027652925617166e-05,
      "loss": 1.1422,
      "num_input_tokens_seen": 38517709248,
      "step": 48957
    },
    {
      "epoch": 5.193931678336516,
      "grad_norm": 0.7391673471631443,
      "learning_rate": 3.027584994097583e-05,
      "loss": 1.0559,
      "num_input_tokens_seen": 38518496080,
      "step": 48958
    },
    {
      "epoch": 5.194037767876088,
      "grad_norm": 0.6786763474180101,
      "learning_rate": 3.0275170621702982e-05,
      "loss": 1.1698,
      "num_input_tokens_seen": 38519282720,
      "step": 48959
    },
    {
      "epoch": 5.194143857415659,
      "grad_norm": 0.6399877453366212,
      "learning_rate": 3.0274491298353635e-05,
      "loss": 1.1397,
      "num_input_tokens_seen": 38520069568,
      "step": 48960
    },
    {
      "epoch": 5.19424994695523,
      "grad_norm": 0.7233498767029803,
      "learning_rate": 3.027381197092832e-05,
      "loss": 1.1559,
      "num_input_tokens_seen": 38520856352,
      "step": 48961
    },
    {
      "epoch": 5.194356036494802,
      "grad_norm": 0.6797923447942184,
      "learning_rate": 3.0273132639427548e-05,
      "loss": 1.1553,
      "num_input_tokens_seen": 38521643200,
      "step": 48962
    },
    {
      "epoch": 5.194462126034373,
      "grad_norm": 0.6335294563440697,
      "learning_rate": 3.027245330385186e-05,
      "loss": 1.1075,
      "num_input_tokens_seen": 38522429872,
      "step": 48963
    },
    {
      "epoch": 5.194568215573945,
      "grad_norm": 0.7329273253003246,
      "learning_rate": 3.0271773964201778e-05,
      "loss": 1.0639,
      "num_input_tokens_seen": 38523216592,
      "step": 48964
    },
    {
      "epoch": 5.194674305113516,
      "grad_norm": 0.5196763285264743,
      "learning_rate": 3.027109462047782e-05,
      "loss": 1.144,
      "num_input_tokens_seen": 38524003280,
      "step": 48965
    },
    {
      "epoch": 5.194780394653087,
      "grad_norm": 0.6448903155099094,
      "learning_rate": 3.0270415272680514e-05,
      "loss": 1.1863,
      "num_input_tokens_seen": 38524790112,
      "step": 48966
    },
    {
      "epoch": 5.194886484192659,
      "grad_norm": 0.6597210330647247,
      "learning_rate": 3.026973592081039e-05,
      "loss": 1.1293,
      "num_input_tokens_seen": 38525576784,
      "step": 48967
    },
    {
      "epoch": 5.19499257373223,
      "grad_norm": 0.6360190456536929,
      "learning_rate": 3.026905656486796e-05,
      "loss": 1.1965,
      "num_input_tokens_seen": 38526363504,
      "step": 48968
    },
    {
      "epoch": 5.195098663271802,
      "grad_norm": 0.6572964890201574,
      "learning_rate": 3.0268377204853767e-05,
      "loss": 1.1227,
      "num_input_tokens_seen": 38527150304,
      "step": 48969
    },
    {
      "epoch": 5.195204752811373,
      "grad_norm": 0.6643485127485298,
      "learning_rate": 3.0267697840768315e-05,
      "loss": 1.067,
      "num_input_tokens_seen": 38527937040,
      "step": 48970
    },
    {
      "epoch": 5.195310842350944,
      "grad_norm": 0.7172999612972394,
      "learning_rate": 3.0267018472612153e-05,
      "loss": 1.1977,
      "num_input_tokens_seen": 38528723824,
      "step": 48971
    },
    {
      "epoch": 5.195416931890516,
      "grad_norm": 0.8792031072235053,
      "learning_rate": 3.0266339100385793e-05,
      "loss": 1.1781,
      "num_input_tokens_seen": 38529510544,
      "step": 48972
    },
    {
      "epoch": 5.195523021430087,
      "grad_norm": 0.5754662810068927,
      "learning_rate": 3.0265659724089752e-05,
      "loss": 1.1636,
      "num_input_tokens_seen": 38530297360,
      "step": 48973
    },
    {
      "epoch": 5.195629110969659,
      "grad_norm": 0.6358138473401791,
      "learning_rate": 3.0264980343724565e-05,
      "loss": 1.2002,
      "num_input_tokens_seen": 38531084032,
      "step": 48974
    },
    {
      "epoch": 5.19573520050923,
      "grad_norm": 0.7322410773097403,
      "learning_rate": 3.0264300959290763e-05,
      "loss": 1.25,
      "num_input_tokens_seen": 38531870784,
      "step": 48975
    },
    {
      "epoch": 5.195841290048802,
      "grad_norm": 0.7261923757923081,
      "learning_rate": 3.026362157078886e-05,
      "loss": 1.2,
      "num_input_tokens_seen": 38532657584,
      "step": 48976
    },
    {
      "epoch": 5.195947379588373,
      "grad_norm": 0.592463793283562,
      "learning_rate": 3.0262942178219384e-05,
      "loss": 1.0857,
      "num_input_tokens_seen": 38533444368,
      "step": 48977
    },
    {
      "epoch": 5.196053469127944,
      "grad_norm": 0.612641795335433,
      "learning_rate": 3.0262262781582863e-05,
      "loss": 1.1172,
      "num_input_tokens_seen": 38534231168,
      "step": 48978
    },
    {
      "epoch": 5.1961595586675156,
      "grad_norm": 0.787888901175848,
      "learning_rate": 3.0261583380879822e-05,
      "loss": 1.1693,
      "num_input_tokens_seen": 38535017952,
      "step": 48979
    },
    {
      "epoch": 5.196265648207087,
      "grad_norm": 0.6134076662924348,
      "learning_rate": 3.0260903976110772e-05,
      "loss": 1.2528,
      "num_input_tokens_seen": 38535804720,
      "step": 48980
    },
    {
      "epoch": 5.1963717377466585,
      "grad_norm": 0.6005302384077688,
      "learning_rate": 3.0260224567276262e-05,
      "loss": 1.1685,
      "num_input_tokens_seen": 38536591424,
      "step": 48981
    },
    {
      "epoch": 5.1964778272862295,
      "grad_norm": 0.6209468536632501,
      "learning_rate": 3.0259545154376796e-05,
      "loss": 1.1988,
      "num_input_tokens_seen": 38537378176,
      "step": 48982
    },
    {
      "epoch": 5.196583916825801,
      "grad_norm": 0.598649917001771,
      "learning_rate": 3.025886573741291e-05,
      "loss": 1.0551,
      "num_input_tokens_seen": 38538165008,
      "step": 48983
    },
    {
      "epoch": 5.1966900063653725,
      "grad_norm": 0.9252922556054747,
      "learning_rate": 3.0258186316385135e-05,
      "loss": 1.2571,
      "num_input_tokens_seen": 38538951776,
      "step": 48984
    },
    {
      "epoch": 5.1967960959049435,
      "grad_norm": 0.9397588115376844,
      "learning_rate": 3.025750689129398e-05,
      "loss": 1.1828,
      "num_input_tokens_seen": 38539738496,
      "step": 48985
    },
    {
      "epoch": 5.196902185444515,
      "grad_norm": 0.7887068615511038,
      "learning_rate": 3.0256827462139982e-05,
      "loss": 1.2737,
      "num_input_tokens_seen": 38540525200,
      "step": 48986
    },
    {
      "epoch": 5.1970082749840865,
      "grad_norm": 0.8287067776064381,
      "learning_rate": 3.025614802892366e-05,
      "loss": 1.2315,
      "num_input_tokens_seen": 38541311888,
      "step": 48987
    },
    {
      "epoch": 5.197114364523658,
      "grad_norm": 0.7315517838253569,
      "learning_rate": 3.0255468591645535e-05,
      "loss": 1.1134,
      "num_input_tokens_seen": 38542098640,
      "step": 48988
    },
    {
      "epoch": 5.197220454063229,
      "grad_norm": 0.6723247651815976,
      "learning_rate": 3.0254789150306146e-05,
      "loss": 1.1535,
      "num_input_tokens_seen": 38542885344,
      "step": 48989
    },
    {
      "epoch": 5.1973265436028,
      "grad_norm": 0.9039483345378626,
      "learning_rate": 3.0254109704906013e-05,
      "loss": 1.2355,
      "num_input_tokens_seen": 38543672096,
      "step": 48990
    },
    {
      "epoch": 5.197432633142372,
      "grad_norm": 0.8389010437024449,
      "learning_rate": 3.0253430255445648e-05,
      "loss": 1.2113,
      "num_input_tokens_seen": 38544458768,
      "step": 48991
    },
    {
      "epoch": 5.197538722681943,
      "grad_norm": 0.7492192671129649,
      "learning_rate": 3.0252750801925596e-05,
      "loss": 1.1687,
      "num_input_tokens_seen": 38545245552,
      "step": 48992
    },
    {
      "epoch": 5.197644812221515,
      "grad_norm": 0.887509061136898,
      "learning_rate": 3.0252071344346366e-05,
      "loss": 1.1609,
      "num_input_tokens_seen": 38546032320,
      "step": 48993
    },
    {
      "epoch": 5.197750901761086,
      "grad_norm": 0.636325867504146,
      "learning_rate": 3.025139188270849e-05,
      "loss": 1.1394,
      "num_input_tokens_seen": 38546819104,
      "step": 48994
    },
    {
      "epoch": 5.197856991300657,
      "grad_norm": 1.0515063955975141,
      "learning_rate": 3.0250712417012495e-05,
      "loss": 1.1885,
      "num_input_tokens_seen": 38547605760,
      "step": 48995
    },
    {
      "epoch": 5.197963080840229,
      "grad_norm": 0.9639344265012697,
      "learning_rate": 3.0250032947258904e-05,
      "loss": 1.1262,
      "num_input_tokens_seen": 38548392512,
      "step": 48996
    },
    {
      "epoch": 5.1980691703798,
      "grad_norm": 0.7562201291235451,
      "learning_rate": 3.024935347344824e-05,
      "loss": 1.1541,
      "num_input_tokens_seen": 38549179280,
      "step": 48997
    },
    {
      "epoch": 5.198175259919372,
      "grad_norm": 1.0450865586587212,
      "learning_rate": 3.024867399558103e-05,
      "loss": 1.1904,
      "num_input_tokens_seen": 38549966016,
      "step": 48998
    },
    {
      "epoch": 5.198281349458943,
      "grad_norm": 0.6643999942328634,
      "learning_rate": 3.024799451365779e-05,
      "loss": 1.1788,
      "num_input_tokens_seen": 38550752768,
      "step": 48999
    },
    {
      "epoch": 5.198387438998514,
      "grad_norm": 0.9946844972606165,
      "learning_rate": 3.0247315027679067e-05,
      "loss": 1.0942,
      "num_input_tokens_seen": 38551539568,
      "step": 49000
    },
    {
      "epoch": 5.198387438998514,
      "eval_loss": 1.5577894449234009,
      "eval_runtime": 65.2286,
      "eval_samples_per_second": 45.992,
      "eval_steps_per_second": 0.491,
      "num_input_tokens_seen": 38551539568,
      "step": 49000
    },
    {
      "epoch": 5.198493528538086,
      "grad_norm": 0.6421602290053264,
      "learning_rate": 3.024663553764537e-05,
      "loss": 1.2306,
      "num_input_tokens_seen": 38552326288,
      "step": 49001
    },
    {
      "epoch": 5.198599618077657,
      "grad_norm": 0.5195321565524452,
      "learning_rate": 3.0245956043557224e-05,
      "loss": 1.158,
      "num_input_tokens_seen": 38553113072,
      "step": 49002
    },
    {
      "epoch": 5.198705707617229,
      "grad_norm": 0.6716154321171103,
      "learning_rate": 3.0245276545415158e-05,
      "loss": 1.2084,
      "num_input_tokens_seen": 38553899888,
      "step": 49003
    },
    {
      "epoch": 5.1988117971568,
      "grad_norm": 0.6017568948879215,
      "learning_rate": 3.0244597043219697e-05,
      "loss": 1.1907,
      "num_input_tokens_seen": 38554686656,
      "step": 49004
    },
    {
      "epoch": 5.198917886696372,
      "grad_norm": 0.5526775193255986,
      "learning_rate": 3.024391753697136e-05,
      "loss": 1.1311,
      "num_input_tokens_seen": 38555473440,
      "step": 49005
    },
    {
      "epoch": 5.199023976235943,
      "grad_norm": 0.6064150963905741,
      "learning_rate": 3.0243238026670685e-05,
      "loss": 1.1731,
      "num_input_tokens_seen": 38556260192,
      "step": 49006
    },
    {
      "epoch": 5.199130065775514,
      "grad_norm": 0.6904714470186563,
      "learning_rate": 3.0242558512318187e-05,
      "loss": 1.1856,
      "num_input_tokens_seen": 38557047008,
      "step": 49007
    },
    {
      "epoch": 5.199236155315086,
      "grad_norm": 0.5644815366539172,
      "learning_rate": 3.0241878993914392e-05,
      "loss": 1.175,
      "num_input_tokens_seen": 38557833712,
      "step": 49008
    },
    {
      "epoch": 5.199342244854657,
      "grad_norm": 0.9085307760950843,
      "learning_rate": 3.024119947145983e-05,
      "loss": 1.1253,
      "num_input_tokens_seen": 38558620384,
      "step": 49009
    },
    {
      "epoch": 5.199448334394229,
      "grad_norm": 0.7172925709569623,
      "learning_rate": 3.024051994495502e-05,
      "loss": 1.2012,
      "num_input_tokens_seen": 38559407152,
      "step": 49010
    },
    {
      "epoch": 5.1995544239338,
      "grad_norm": 0.5274633600049449,
      "learning_rate": 3.023984041440049e-05,
      "loss": 1.0776,
      "num_input_tokens_seen": 38560193936,
      "step": 49011
    },
    {
      "epoch": 5.199660513473371,
      "grad_norm": 0.582776062962435,
      "learning_rate": 3.0239160879796762e-05,
      "loss": 1.1079,
      "num_input_tokens_seen": 38560980720,
      "step": 49012
    },
    {
      "epoch": 5.199766603012943,
      "grad_norm": 0.6898023823878773,
      "learning_rate": 3.0238481341144366e-05,
      "loss": 1.1506,
      "num_input_tokens_seen": 38561767488,
      "step": 49013
    },
    {
      "epoch": 5.199872692552514,
      "grad_norm": 0.8049485620950778,
      "learning_rate": 3.0237801798443834e-05,
      "loss": 1.0939,
      "num_input_tokens_seen": 38562554304,
      "step": 49014
    },
    {
      "epoch": 5.199978782092086,
      "grad_norm": 0.7029526451675988,
      "learning_rate": 3.023712225169567e-05,
      "loss": 1.1858,
      "num_input_tokens_seen": 38563341088,
      "step": 49015
    },
    {
      "epoch": 5.200084871631657,
      "grad_norm": 0.8203264889958171,
      "learning_rate": 3.023644270090042e-05,
      "loss": 1.2479,
      "num_input_tokens_seen": 38564127872,
      "step": 49016
    },
    {
      "epoch": 5.200190961171229,
      "grad_norm": 0.5685286169676902,
      "learning_rate": 3.02357631460586e-05,
      "loss": 1.1532,
      "num_input_tokens_seen": 38564914672,
      "step": 49017
    },
    {
      "epoch": 5.2002970507108,
      "grad_norm": 0.6389706829360033,
      "learning_rate": 3.023508358717073e-05,
      "loss": 1.1042,
      "num_input_tokens_seen": 38565701472,
      "step": 49018
    },
    {
      "epoch": 5.200403140250371,
      "grad_norm": 0.7705628044069563,
      "learning_rate": 3.0234404024237344e-05,
      "loss": 1.1811,
      "num_input_tokens_seen": 38566488304,
      "step": 49019
    },
    {
      "epoch": 5.200509229789943,
      "grad_norm": 0.5776882427890006,
      "learning_rate": 3.0233724457258967e-05,
      "loss": 1.1486,
      "num_input_tokens_seen": 38567275056,
      "step": 49020
    },
    {
      "epoch": 5.200615319329514,
      "grad_norm": 0.7012170882556712,
      "learning_rate": 3.0233044886236116e-05,
      "loss": 1.1304,
      "num_input_tokens_seen": 38568061824,
      "step": 49021
    },
    {
      "epoch": 5.200721408869086,
      "grad_norm": 0.8535999428389839,
      "learning_rate": 3.0232365311169327e-05,
      "loss": 1.2262,
      "num_input_tokens_seen": 38568848464,
      "step": 49022
    },
    {
      "epoch": 5.200827498408657,
      "grad_norm": 0.6860451959782204,
      "learning_rate": 3.023168573205911e-05,
      "loss": 1.1547,
      "num_input_tokens_seen": 38569635280,
      "step": 49023
    },
    {
      "epoch": 5.200933587948228,
      "grad_norm": 0.7691630062759872,
      "learning_rate": 3.023100614890601e-05,
      "loss": 1.0956,
      "num_input_tokens_seen": 38570422048,
      "step": 49024
    },
    {
      "epoch": 5.2010396774878,
      "grad_norm": 0.6196007482384049,
      "learning_rate": 3.0230326561710538e-05,
      "loss": 1.2746,
      "num_input_tokens_seen": 38571208784,
      "step": 49025
    },
    {
      "epoch": 5.201145767027371,
      "grad_norm": 0.694945427723751,
      "learning_rate": 3.0229646970473226e-05,
      "loss": 1.1564,
      "num_input_tokens_seen": 38571995504,
      "step": 49026
    },
    {
      "epoch": 5.201251856566943,
      "grad_norm": 0.6050994961350865,
      "learning_rate": 3.0228967375194594e-05,
      "loss": 1.1229,
      "num_input_tokens_seen": 38572782304,
      "step": 49027
    },
    {
      "epoch": 5.201357946106514,
      "grad_norm": 0.672553364050336,
      "learning_rate": 3.022828777587517e-05,
      "loss": 1.1784,
      "num_input_tokens_seen": 38573569024,
      "step": 49028
    },
    {
      "epoch": 5.201464035646085,
      "grad_norm": 0.8592123097256485,
      "learning_rate": 3.0227608172515475e-05,
      "loss": 1.1188,
      "num_input_tokens_seen": 38574355808,
      "step": 49029
    },
    {
      "epoch": 5.201570125185657,
      "grad_norm": 0.6891538654417925,
      "learning_rate": 3.0226928565116046e-05,
      "loss": 1.2369,
      "num_input_tokens_seen": 38575142544,
      "step": 49030
    },
    {
      "epoch": 5.201676214725228,
      "grad_norm": 0.7013308734212899,
      "learning_rate": 3.0226248953677394e-05,
      "loss": 1.2021,
      "num_input_tokens_seen": 38575929296,
      "step": 49031
    },
    {
      "epoch": 5.2017823042648,
      "grad_norm": 0.6245754213979571,
      "learning_rate": 3.0225569338200048e-05,
      "loss": 1.2235,
      "num_input_tokens_seen": 38576716112,
      "step": 49032
    },
    {
      "epoch": 5.201888393804371,
      "grad_norm": 0.6655380550903536,
      "learning_rate": 3.0224889718684544e-05,
      "loss": 1.1834,
      "num_input_tokens_seen": 38577502880,
      "step": 49033
    },
    {
      "epoch": 5.201994483343943,
      "grad_norm": 0.7831863941528272,
      "learning_rate": 3.022421009513139e-05,
      "loss": 1.1279,
      "num_input_tokens_seen": 38578289664,
      "step": 49034
    },
    {
      "epoch": 5.202100572883514,
      "grad_norm": 0.5971715000695935,
      "learning_rate": 3.022353046754112e-05,
      "loss": 1.1453,
      "num_input_tokens_seen": 38579076464,
      "step": 49035
    },
    {
      "epoch": 5.202206662423085,
      "grad_norm": 1.0847642131952662,
      "learning_rate": 3.022285083591427e-05,
      "loss": 1.1384,
      "num_input_tokens_seen": 38579863328,
      "step": 49036
    },
    {
      "epoch": 5.202312751962657,
      "grad_norm": 0.5899614293015328,
      "learning_rate": 3.0222171200251342e-05,
      "loss": 1.1554,
      "num_input_tokens_seen": 38580650144,
      "step": 49037
    },
    {
      "epoch": 5.202418841502228,
      "grad_norm": 0.9882503356121201,
      "learning_rate": 3.022149156055288e-05,
      "loss": 1.1797,
      "num_input_tokens_seen": 38581436864,
      "step": 49038
    },
    {
      "epoch": 5.2025249310418,
      "grad_norm": 0.6173600573721479,
      "learning_rate": 3.0220811916819403e-05,
      "loss": 1.1663,
      "num_input_tokens_seen": 38582223632,
      "step": 49039
    },
    {
      "epoch": 5.202631020581371,
      "grad_norm": 0.5451265491795958,
      "learning_rate": 3.0220132269051427e-05,
      "loss": 1.115,
      "num_input_tokens_seen": 38583010368,
      "step": 49040
    },
    {
      "epoch": 5.2027371101209425,
      "grad_norm": 0.67126152576906,
      "learning_rate": 3.0219452617249493e-05,
      "loss": 1.193,
      "num_input_tokens_seen": 38583797184,
      "step": 49041
    },
    {
      "epoch": 5.202843199660514,
      "grad_norm": 0.6490853571174184,
      "learning_rate": 3.0218772961414114e-05,
      "loss": 1.1444,
      "num_input_tokens_seen": 38584583952,
      "step": 49042
    },
    {
      "epoch": 5.202949289200085,
      "grad_norm": 0.6082600927895526,
      "learning_rate": 3.0218093301545825e-05,
      "loss": 1.1154,
      "num_input_tokens_seen": 38585370672,
      "step": 49043
    },
    {
      "epoch": 5.2030553787396565,
      "grad_norm": 0.6308190532863833,
      "learning_rate": 3.0217413637645148e-05,
      "loss": 1.2016,
      "num_input_tokens_seen": 38586157328,
      "step": 49044
    },
    {
      "epoch": 5.2031614682792275,
      "grad_norm": 0.6300155363970379,
      "learning_rate": 3.02167339697126e-05,
      "loss": 1.2289,
      "num_input_tokens_seen": 38586944160,
      "step": 49045
    },
    {
      "epoch": 5.2032675578187995,
      "grad_norm": 0.5933946310006807,
      "learning_rate": 3.0216054297748718e-05,
      "loss": 1.1246,
      "num_input_tokens_seen": 38587730928,
      "step": 49046
    },
    {
      "epoch": 5.2033736473583705,
      "grad_norm": 0.6531649884190643,
      "learning_rate": 3.021537462175403e-05,
      "loss": 1.0765,
      "num_input_tokens_seen": 38588517600,
      "step": 49047
    },
    {
      "epoch": 5.2034797368979415,
      "grad_norm": 0.6841652852413731,
      "learning_rate": 3.021469494172904e-05,
      "loss": 1.1962,
      "num_input_tokens_seen": 38589304432,
      "step": 49048
    },
    {
      "epoch": 5.203585826437513,
      "grad_norm": 0.5650866420835282,
      "learning_rate": 3.0214015257674294e-05,
      "loss": 1.1572,
      "num_input_tokens_seen": 38590091152,
      "step": 49049
    },
    {
      "epoch": 5.2036919159770845,
      "grad_norm": 0.6751741388736859,
      "learning_rate": 3.0213335569590307e-05,
      "loss": 1.1553,
      "num_input_tokens_seen": 38590877968,
      "step": 49050
    },
    {
      "epoch": 5.203798005516656,
      "grad_norm": 0.6427503658187927,
      "learning_rate": 3.021265587747761e-05,
      "loss": 1.1095,
      "num_input_tokens_seen": 38591664784,
      "step": 49051
    },
    {
      "epoch": 5.203904095056227,
      "grad_norm": 0.5385997319506639,
      "learning_rate": 3.0211976181336722e-05,
      "loss": 1.0266,
      "num_input_tokens_seen": 38592451552,
      "step": 49052
    },
    {
      "epoch": 5.2040101845957984,
      "grad_norm": 0.5772851131145851,
      "learning_rate": 3.0211296481168178e-05,
      "loss": 1.0776,
      "num_input_tokens_seen": 38593238416,
      "step": 49053
    },
    {
      "epoch": 5.20411627413537,
      "grad_norm": 0.5700246790224811,
      "learning_rate": 3.021061677697249e-05,
      "loss": 1.1255,
      "num_input_tokens_seen": 38594025104,
      "step": 49054
    },
    {
      "epoch": 5.204222363674941,
      "grad_norm": 0.5392208518116488,
      "learning_rate": 3.0209937068750193e-05,
      "loss": 1.1252,
      "num_input_tokens_seen": 38594811808,
      "step": 49055
    },
    {
      "epoch": 5.204328453214513,
      "grad_norm": 0.6720464054743962,
      "learning_rate": 3.0209257356501807e-05,
      "loss": 1.1751,
      "num_input_tokens_seen": 38595598592,
      "step": 49056
    },
    {
      "epoch": 5.204434542754084,
      "grad_norm": 0.5963276235165872,
      "learning_rate": 3.020857764022786e-05,
      "loss": 1.1647,
      "num_input_tokens_seen": 38596385328,
      "step": 49057
    },
    {
      "epoch": 5.204540632293656,
      "grad_norm": 0.6483378520292024,
      "learning_rate": 3.0207897919928885e-05,
      "loss": 1.1201,
      "num_input_tokens_seen": 38597172128,
      "step": 49058
    },
    {
      "epoch": 5.204646721833227,
      "grad_norm": 0.6097986237742122,
      "learning_rate": 3.0207218195605387e-05,
      "loss": 1.1064,
      "num_input_tokens_seen": 38597958944,
      "step": 49059
    },
    {
      "epoch": 5.204752811372798,
      "grad_norm": 0.7005352141626375,
      "learning_rate": 3.0206538467257912e-05,
      "loss": 1.1841,
      "num_input_tokens_seen": 38598745760,
      "step": 49060
    },
    {
      "epoch": 5.20485890091237,
      "grad_norm": 0.6830330983067514,
      "learning_rate": 3.0205858734886978e-05,
      "loss": 1.1456,
      "num_input_tokens_seen": 38599532512,
      "step": 49061
    },
    {
      "epoch": 5.204964990451941,
      "grad_norm": 0.6548238189982649,
      "learning_rate": 3.02051789984931e-05,
      "loss": 1.1063,
      "num_input_tokens_seen": 38600319248,
      "step": 49062
    },
    {
      "epoch": 5.205071079991513,
      "grad_norm": 0.6509816164744029,
      "learning_rate": 3.0204499258076823e-05,
      "loss": 1.1475,
      "num_input_tokens_seen": 38601106000,
      "step": 49063
    },
    {
      "epoch": 5.205177169531084,
      "grad_norm": 0.6491880705615121,
      "learning_rate": 3.020381951363866e-05,
      "loss": 1.1108,
      "num_input_tokens_seen": 38601892816,
      "step": 49064
    },
    {
      "epoch": 5.205283259070655,
      "grad_norm": 0.6932555504504457,
      "learning_rate": 3.0203139765179128e-05,
      "loss": 1.1516,
      "num_input_tokens_seen": 38602679520,
      "step": 49065
    },
    {
      "epoch": 5.205389348610227,
      "grad_norm": 0.6072652342230972,
      "learning_rate": 3.0202460012698774e-05,
      "loss": 1.1568,
      "num_input_tokens_seen": 38603466288,
      "step": 49066
    },
    {
      "epoch": 5.205495438149798,
      "grad_norm": 0.6607528274738427,
      "learning_rate": 3.020178025619811e-05,
      "loss": 1.1544,
      "num_input_tokens_seen": 38604253120,
      "step": 49067
    },
    {
      "epoch": 5.20560152768937,
      "grad_norm": 0.6684028305114272,
      "learning_rate": 3.0201100495677655e-05,
      "loss": 1.0999,
      "num_input_tokens_seen": 38605039872,
      "step": 49068
    },
    {
      "epoch": 5.205707617228941,
      "grad_norm": 0.618815782967079,
      "learning_rate": 3.020042073113794e-05,
      "loss": 1.1428,
      "num_input_tokens_seen": 38605826640,
      "step": 49069
    },
    {
      "epoch": 5.205813706768513,
      "grad_norm": 0.5465533789770824,
      "learning_rate": 3.0199740962579504e-05,
      "loss": 1.1017,
      "num_input_tokens_seen": 38606613472,
      "step": 49070
    },
    {
      "epoch": 5.205919796308084,
      "grad_norm": 0.6104757474573782,
      "learning_rate": 3.0199061190002853e-05,
      "loss": 1.2446,
      "num_input_tokens_seen": 38607400128,
      "step": 49071
    },
    {
      "epoch": 5.206025885847655,
      "grad_norm": 0.7397417767663813,
      "learning_rate": 3.019838141340852e-05,
      "loss": 1.0971,
      "num_input_tokens_seen": 38608186800,
      "step": 49072
    },
    {
      "epoch": 5.206131975387227,
      "grad_norm": 0.578327622594991,
      "learning_rate": 3.0197701632797037e-05,
      "loss": 1.1329,
      "num_input_tokens_seen": 38608973520,
      "step": 49073
    },
    {
      "epoch": 5.206238064926798,
      "grad_norm": 0.735144110629169,
      "learning_rate": 3.0197021848168917e-05,
      "loss": 1.0142,
      "num_input_tokens_seen": 38609760416,
      "step": 49074
    },
    {
      "epoch": 5.20634415446637,
      "grad_norm": 0.6608458302437518,
      "learning_rate": 3.0196342059524697e-05,
      "loss": 1.1514,
      "num_input_tokens_seen": 38610547152,
      "step": 49075
    },
    {
      "epoch": 5.206450244005941,
      "grad_norm": 0.5672872615336889,
      "learning_rate": 3.0195662266864895e-05,
      "loss": 1.0434,
      "num_input_tokens_seen": 38611333952,
      "step": 49076
    },
    {
      "epoch": 5.206556333545512,
      "grad_norm": 0.6106034896681357,
      "learning_rate": 3.0194982470190024e-05,
      "loss": 1.1958,
      "num_input_tokens_seen": 38612120656,
      "step": 49077
    },
    {
      "epoch": 5.206662423085084,
      "grad_norm": 0.5963868677595786,
      "learning_rate": 3.019430266950064e-05,
      "loss": 1.1005,
      "num_input_tokens_seen": 38612907472,
      "step": 49078
    },
    {
      "epoch": 5.206768512624655,
      "grad_norm": 0.5922191325816434,
      "learning_rate": 3.019362286479725e-05,
      "loss": 1.1981,
      "num_input_tokens_seen": 38613694224,
      "step": 49079
    },
    {
      "epoch": 5.206874602164227,
      "grad_norm": 0.605298671951729,
      "learning_rate": 3.019294305608037e-05,
      "loss": 1.2067,
      "num_input_tokens_seen": 38614480960,
      "step": 49080
    },
    {
      "epoch": 5.206980691703798,
      "grad_norm": 0.6359678080552247,
      "learning_rate": 3.0192263243350544e-05,
      "loss": 1.1613,
      "num_input_tokens_seen": 38615267664,
      "step": 49081
    },
    {
      "epoch": 5.207086781243369,
      "grad_norm": 0.7136784042596561,
      "learning_rate": 3.0191583426608287e-05,
      "loss": 1.1059,
      "num_input_tokens_seen": 38616054416,
      "step": 49082
    },
    {
      "epoch": 5.207192870782941,
      "grad_norm": 0.7561542916736507,
      "learning_rate": 3.0190903605854126e-05,
      "loss": 1.1354,
      "num_input_tokens_seen": 38616841216,
      "step": 49083
    },
    {
      "epoch": 5.207298960322512,
      "grad_norm": 0.7031671421868323,
      "learning_rate": 3.019022378108859e-05,
      "loss": 1.2303,
      "num_input_tokens_seen": 38617627872,
      "step": 49084
    },
    {
      "epoch": 5.207405049862084,
      "grad_norm": 0.717856831546272,
      "learning_rate": 3.0189543952312194e-05,
      "loss": 1.1899,
      "num_input_tokens_seen": 38618414544,
      "step": 49085
    },
    {
      "epoch": 5.207511139401655,
      "grad_norm": 0.6607347246834978,
      "learning_rate": 3.018886411952548e-05,
      "loss": 1.1971,
      "num_input_tokens_seen": 38619201344,
      "step": 49086
    },
    {
      "epoch": 5.207617228941227,
      "grad_norm": 0.729281508271584,
      "learning_rate": 3.018818428272896e-05,
      "loss": 1.1405,
      "num_input_tokens_seen": 38619988208,
      "step": 49087
    },
    {
      "epoch": 5.207723318480798,
      "grad_norm": 0.6947023567007855,
      "learning_rate": 3.018750444192316e-05,
      "loss": 1.1895,
      "num_input_tokens_seen": 38620774992,
      "step": 49088
    },
    {
      "epoch": 5.207829408020369,
      "grad_norm": 0.723712158003313,
      "learning_rate": 3.0186824597108615e-05,
      "loss": 1.2074,
      "num_input_tokens_seen": 38621561776,
      "step": 49089
    },
    {
      "epoch": 5.207935497559941,
      "grad_norm": 0.6782237086041915,
      "learning_rate": 3.0186144748285845e-05,
      "loss": 1.1647,
      "num_input_tokens_seen": 38622348544,
      "step": 49090
    },
    {
      "epoch": 5.208041587099512,
      "grad_norm": 0.6873437899763412,
      "learning_rate": 3.0185464895455367e-05,
      "loss": 1.2131,
      "num_input_tokens_seen": 38623135200,
      "step": 49091
    },
    {
      "epoch": 5.208147676639084,
      "grad_norm": 0.640898863525902,
      "learning_rate": 3.0184785038617718e-05,
      "loss": 1.203,
      "num_input_tokens_seen": 38623921872,
      "step": 49092
    },
    {
      "epoch": 5.208253766178655,
      "grad_norm": 0.7825380948479734,
      "learning_rate": 3.018410517777342e-05,
      "loss": 1.1516,
      "num_input_tokens_seen": 38624708592,
      "step": 49093
    },
    {
      "epoch": 5.208359855718226,
      "grad_norm": 0.7329468725794879,
      "learning_rate": 3.0183425312922998e-05,
      "loss": 1.1921,
      "num_input_tokens_seen": 38625495392,
      "step": 49094
    },
    {
      "epoch": 5.208465945257798,
      "grad_norm": 0.7108810589186781,
      "learning_rate": 3.0182745444066975e-05,
      "loss": 1.0994,
      "num_input_tokens_seen": 38626282096,
      "step": 49095
    },
    {
      "epoch": 5.208572034797369,
      "grad_norm": 0.7203491378479596,
      "learning_rate": 3.018206557120588e-05,
      "loss": 1.1115,
      "num_input_tokens_seen": 38627069040,
      "step": 49096
    },
    {
      "epoch": 5.208678124336941,
      "grad_norm": 0.7654290085799306,
      "learning_rate": 3.0181385694340237e-05,
      "loss": 1.1886,
      "num_input_tokens_seen": 38627855824,
      "step": 49097
    },
    {
      "epoch": 5.208784213876512,
      "grad_norm": 0.8813371160561249,
      "learning_rate": 3.0180705813470565e-05,
      "loss": 1.2909,
      "num_input_tokens_seen": 38628642560,
      "step": 49098
    },
    {
      "epoch": 5.208890303416084,
      "grad_norm": 0.810404916869581,
      "learning_rate": 3.0180025928597406e-05,
      "loss": 1.176,
      "num_input_tokens_seen": 38629429296,
      "step": 49099
    },
    {
      "epoch": 5.208996392955655,
      "grad_norm": 0.8309276313585227,
      "learning_rate": 3.0179346039721268e-05,
      "loss": 1.2515,
      "num_input_tokens_seen": 38630215952,
      "step": 49100
    },
    {
      "epoch": 5.209102482495226,
      "grad_norm": 0.8064584522546094,
      "learning_rate": 3.0178666146842682e-05,
      "loss": 1.1501,
      "num_input_tokens_seen": 38631002624,
      "step": 49101
    },
    {
      "epoch": 5.209208572034798,
      "grad_norm": 0.6484535152076529,
      "learning_rate": 3.0177986249962177e-05,
      "loss": 1.1031,
      "num_input_tokens_seen": 38631789440,
      "step": 49102
    },
    {
      "epoch": 5.209314661574369,
      "grad_norm": 1.267780930286598,
      "learning_rate": 3.0177306349080282e-05,
      "loss": 1.2496,
      "num_input_tokens_seen": 38632576176,
      "step": 49103
    },
    {
      "epoch": 5.2094207511139405,
      "grad_norm": 0.5820915051508122,
      "learning_rate": 3.0176626444197508e-05,
      "loss": 1.2689,
      "num_input_tokens_seen": 38633362800,
      "step": 49104
    },
    {
      "epoch": 5.209526840653512,
      "grad_norm": 0.7139839732545994,
      "learning_rate": 3.0175946535314393e-05,
      "loss": 1.1202,
      "num_input_tokens_seen": 38634149520,
      "step": 49105
    },
    {
      "epoch": 5.209632930193083,
      "grad_norm": 0.7506215153160419,
      "learning_rate": 3.0175266622431457e-05,
      "loss": 1.1803,
      "num_input_tokens_seen": 38634936400,
      "step": 49106
    },
    {
      "epoch": 5.2097390197326545,
      "grad_norm": 0.6330555273012888,
      "learning_rate": 3.0174586705549228e-05,
      "loss": 1.1211,
      "num_input_tokens_seen": 38635723264,
      "step": 49107
    },
    {
      "epoch": 5.2098451092722255,
      "grad_norm": 0.7061676987008644,
      "learning_rate": 3.0173906784668228e-05,
      "loss": 1.0659,
      "num_input_tokens_seen": 38636510000,
      "step": 49108
    },
    {
      "epoch": 5.2099511988117975,
      "grad_norm": 0.7581701502643922,
      "learning_rate": 3.0173226859788988e-05,
      "loss": 1.1442,
      "num_input_tokens_seen": 38637296752,
      "step": 49109
    },
    {
      "epoch": 5.2100572883513685,
      "grad_norm": 0.6901384651743495,
      "learning_rate": 3.0172546930912034e-05,
      "loss": 1.0968,
      "num_input_tokens_seen": 38638083584,
      "step": 49110
    },
    {
      "epoch": 5.2101633778909395,
      "grad_norm": 0.7907645696723893,
      "learning_rate": 3.0171866998037873e-05,
      "loss": 1.2202,
      "num_input_tokens_seen": 38638870288,
      "step": 49111
    },
    {
      "epoch": 5.2102694674305114,
      "grad_norm": 0.6198058080888842,
      "learning_rate": 3.0171187061167062e-05,
      "loss": 1.2064,
      "num_input_tokens_seen": 38639657056,
      "step": 49112
    },
    {
      "epoch": 5.2103755569700825,
      "grad_norm": 0.5722110888547459,
      "learning_rate": 3.0170507120300103e-05,
      "loss": 1.1529,
      "num_input_tokens_seen": 38640443872,
      "step": 49113
    },
    {
      "epoch": 5.210481646509654,
      "grad_norm": 0.7504288296134273,
      "learning_rate": 3.016982717543752e-05,
      "loss": 1.1599,
      "num_input_tokens_seen": 38641230576,
      "step": 49114
    },
    {
      "epoch": 5.210587736049225,
      "grad_norm": 0.6895495099521652,
      "learning_rate": 3.0169147226579854e-05,
      "loss": 1.1607,
      "num_input_tokens_seen": 38642017344,
      "step": 49115
    },
    {
      "epoch": 5.210693825588797,
      "grad_norm": 0.6380350634548552,
      "learning_rate": 3.016846727372762e-05,
      "loss": 1.1908,
      "num_input_tokens_seen": 38642804048,
      "step": 49116
    },
    {
      "epoch": 5.210799915128368,
      "grad_norm": 0.7691157237048826,
      "learning_rate": 3.016778731688134e-05,
      "loss": 1.142,
      "num_input_tokens_seen": 38643590768,
      "step": 49117
    },
    {
      "epoch": 5.210906004667939,
      "grad_norm": 0.5943609403381959,
      "learning_rate": 3.016710735604156e-05,
      "loss": 1.1046,
      "num_input_tokens_seen": 38644377552,
      "step": 49118
    },
    {
      "epoch": 5.211012094207511,
      "grad_norm": 1.0421735757231874,
      "learning_rate": 3.016642739120878e-05,
      "loss": 1.2267,
      "num_input_tokens_seen": 38645164320,
      "step": 49119
    },
    {
      "epoch": 5.211118183747082,
      "grad_norm": 0.6960469414832762,
      "learning_rate": 3.016574742238354e-05,
      "loss": 1.1702,
      "num_input_tokens_seen": 38645951104,
      "step": 49120
    },
    {
      "epoch": 5.211224273286654,
      "grad_norm": 0.9453963897342933,
      "learning_rate": 3.0165067449566365e-05,
      "loss": 1.126,
      "num_input_tokens_seen": 38646737936,
      "step": 49121
    },
    {
      "epoch": 5.211330362826225,
      "grad_norm": 0.8743835410624341,
      "learning_rate": 3.016438747275777e-05,
      "loss": 1.1969,
      "num_input_tokens_seen": 38647524608,
      "step": 49122
    },
    {
      "epoch": 5.211436452365796,
      "grad_norm": 0.693857070194323,
      "learning_rate": 3.0163707491958294e-05,
      "loss": 1.1229,
      "num_input_tokens_seen": 38648311376,
      "step": 49123
    },
    {
      "epoch": 5.211542541905368,
      "grad_norm": 0.7116443505126843,
      "learning_rate": 3.0163027507168458e-05,
      "loss": 1.1624,
      "num_input_tokens_seen": 38649098128,
      "step": 49124
    },
    {
      "epoch": 5.211648631444939,
      "grad_norm": 1.7282929101133813,
      "learning_rate": 3.0162347518388785e-05,
      "loss": 1.15,
      "num_input_tokens_seen": 38649884880,
      "step": 49125
    },
    {
      "epoch": 5.211754720984511,
      "grad_norm": 0.9079823002650547,
      "learning_rate": 3.016166752561979e-05,
      "loss": 1.1203,
      "num_input_tokens_seen": 38650671616,
      "step": 49126
    },
    {
      "epoch": 5.211860810524082,
      "grad_norm": 0.719482682907832,
      "learning_rate": 3.016098752886202e-05,
      "loss": 1.1614,
      "num_input_tokens_seen": 38651458416,
      "step": 49127
    },
    {
      "epoch": 5.211966900063654,
      "grad_norm": 0.816397373205043,
      "learning_rate": 3.016030752811599e-05,
      "loss": 1.1114,
      "num_input_tokens_seen": 38652245200,
      "step": 49128
    },
    {
      "epoch": 5.212072989603225,
      "grad_norm": 1.075119501718444,
      "learning_rate": 3.0159627523382226e-05,
      "loss": 1.1828,
      "num_input_tokens_seen": 38653032016,
      "step": 49129
    },
    {
      "epoch": 5.212179079142796,
      "grad_norm": 0.6173812678109843,
      "learning_rate": 3.0158947514661256e-05,
      "loss": 1.1149,
      "num_input_tokens_seen": 38653818880,
      "step": 49130
    },
    {
      "epoch": 5.212285168682368,
      "grad_norm": 0.8882175228962946,
      "learning_rate": 3.0158267501953597e-05,
      "loss": 1.0629,
      "num_input_tokens_seen": 38654605712,
      "step": 49131
    },
    {
      "epoch": 5.212391258221939,
      "grad_norm": 1.086249153813428,
      "learning_rate": 3.015758748525978e-05,
      "loss": 1.1091,
      "num_input_tokens_seen": 38655392512,
      "step": 49132
    },
    {
      "epoch": 5.212497347761511,
      "grad_norm": 0.8975514213318908,
      "learning_rate": 3.0156907464580338e-05,
      "loss": 1.2069,
      "num_input_tokens_seen": 38656179296,
      "step": 49133
    },
    {
      "epoch": 5.212603437301082,
      "grad_norm": 0.9961172398391331,
      "learning_rate": 3.015622743991578e-05,
      "loss": 1.09,
      "num_input_tokens_seen": 38656966128,
      "step": 49134
    },
    {
      "epoch": 5.212709526840653,
      "grad_norm": 1.2219814671582798,
      "learning_rate": 3.0155547411266644e-05,
      "loss": 1.1313,
      "num_input_tokens_seen": 38657752832,
      "step": 49135
    },
    {
      "epoch": 5.212815616380225,
      "grad_norm": 1.0396446567830528,
      "learning_rate": 3.0154867378633456e-05,
      "loss": 1.1612,
      "num_input_tokens_seen": 38658539616,
      "step": 49136
    },
    {
      "epoch": 5.212921705919796,
      "grad_norm": 0.980217120641978,
      "learning_rate": 3.0154187342016733e-05,
      "loss": 1.1948,
      "num_input_tokens_seen": 38659326368,
      "step": 49137
    },
    {
      "epoch": 5.213027795459368,
      "grad_norm": 2.0250110153092367,
      "learning_rate": 3.0153507301417004e-05,
      "loss": 1.1876,
      "num_input_tokens_seen": 38660113168,
      "step": 49138
    },
    {
      "epoch": 5.213133884998939,
      "grad_norm": 1.5247855747080004,
      "learning_rate": 3.0152827256834804e-05,
      "loss": 1.2134,
      "num_input_tokens_seen": 38660899936,
      "step": 49139
    },
    {
      "epoch": 5.21323997453851,
      "grad_norm": 0.8112379099617218,
      "learning_rate": 3.0152147208270644e-05,
      "loss": 1.109,
      "num_input_tokens_seen": 38661686752,
      "step": 49140
    },
    {
      "epoch": 5.213346064078082,
      "grad_norm": 1.2014402797894803,
      "learning_rate": 3.0151467155725056e-05,
      "loss": 1.2093,
      "num_input_tokens_seen": 38662473488,
      "step": 49141
    },
    {
      "epoch": 5.213452153617653,
      "grad_norm": 1.10455845154511,
      "learning_rate": 3.015078709919857e-05,
      "loss": 1.2318,
      "num_input_tokens_seen": 38663260208,
      "step": 49142
    },
    {
      "epoch": 5.213558243157225,
      "grad_norm": 0.7807570684718339,
      "learning_rate": 3.01501070386917e-05,
      "loss": 1.1585,
      "num_input_tokens_seen": 38664047056,
      "step": 49143
    },
    {
      "epoch": 5.213664332696796,
      "grad_norm": 0.7721981386256153,
      "learning_rate": 3.014942697420498e-05,
      "loss": 1.2256,
      "num_input_tokens_seen": 38664833824,
      "step": 49144
    },
    {
      "epoch": 5.213770422236368,
      "grad_norm": 1.084040867081812,
      "learning_rate": 3.0148746905738935e-05,
      "loss": 1.1622,
      "num_input_tokens_seen": 38665620592,
      "step": 49145
    },
    {
      "epoch": 5.213876511775939,
      "grad_norm": 0.9608838565927379,
      "learning_rate": 3.014806683329409e-05,
      "loss": 1.2145,
      "num_input_tokens_seen": 38666407424,
      "step": 49146
    },
    {
      "epoch": 5.21398260131551,
      "grad_norm": 1.1052535301252633,
      "learning_rate": 3.014738675687097e-05,
      "loss": 1.1951,
      "num_input_tokens_seen": 38667194208,
      "step": 49147
    },
    {
      "epoch": 5.214088690855082,
      "grad_norm": 0.7210291695387286,
      "learning_rate": 3.01467066764701e-05,
      "loss": 1.0172,
      "num_input_tokens_seen": 38667981088,
      "step": 49148
    },
    {
      "epoch": 5.214194780394653,
      "grad_norm": 0.8771433256376732,
      "learning_rate": 3.014602659209201e-05,
      "loss": 1.0867,
      "num_input_tokens_seen": 38668767936,
      "step": 49149
    },
    {
      "epoch": 5.214300869934225,
      "grad_norm": 0.7475185068962221,
      "learning_rate": 3.0145346503737216e-05,
      "loss": 1.1677,
      "num_input_tokens_seen": 38669554784,
      "step": 49150
    },
    {
      "epoch": 5.214406959473796,
      "grad_norm": 0.843228546750217,
      "learning_rate": 3.0144666411406254e-05,
      "loss": 1.3067,
      "num_input_tokens_seen": 38670341392,
      "step": 49151
    },
    {
      "epoch": 5.214513049013367,
      "grad_norm": 0.7459732605679358,
      "learning_rate": 3.0143986315099637e-05,
      "loss": 1.1265,
      "num_input_tokens_seen": 38671128160,
      "step": 49152
    },
    {
      "epoch": 5.214619138552939,
      "grad_norm": 0.6898332599290442,
      "learning_rate": 3.0143306214817906e-05,
      "loss": 1.0559,
      "num_input_tokens_seen": 38671914992,
      "step": 49153
    },
    {
      "epoch": 5.21472522809251,
      "grad_norm": 0.877213169440606,
      "learning_rate": 3.0142626110561577e-05,
      "loss": 1.1332,
      "num_input_tokens_seen": 38672701824,
      "step": 49154
    },
    {
      "epoch": 5.214831317632082,
      "grad_norm": 0.8113110451686758,
      "learning_rate": 3.014194600233118e-05,
      "loss": 1.1604,
      "num_input_tokens_seen": 38673488560,
      "step": 49155
    },
    {
      "epoch": 5.214937407171653,
      "grad_norm": 0.7950777663288748,
      "learning_rate": 3.0141265890127236e-05,
      "loss": 1.1799,
      "num_input_tokens_seen": 38674275328,
      "step": 49156
    },
    {
      "epoch": 5.215043496711225,
      "grad_norm": 0.8544341253033341,
      "learning_rate": 3.0140585773950263e-05,
      "loss": 1.1568,
      "num_input_tokens_seen": 38675062016,
      "step": 49157
    },
    {
      "epoch": 5.215149586250796,
      "grad_norm": 0.715395787718987,
      "learning_rate": 3.0139905653800808e-05,
      "loss": 1.1441,
      "num_input_tokens_seen": 38675848816,
      "step": 49158
    },
    {
      "epoch": 5.215255675790367,
      "grad_norm": 0.6812218645689291,
      "learning_rate": 3.013922552967938e-05,
      "loss": 1.1173,
      "num_input_tokens_seen": 38676635600,
      "step": 49159
    },
    {
      "epoch": 5.215361765329939,
      "grad_norm": 0.5708631281254344,
      "learning_rate": 3.013854540158651e-05,
      "loss": 1.1297,
      "num_input_tokens_seen": 38677422336,
      "step": 49160
    },
    {
      "epoch": 5.21546785486951,
      "grad_norm": 0.7552923038321607,
      "learning_rate": 3.0137865269522725e-05,
      "loss": 1.1976,
      "num_input_tokens_seen": 38678209056,
      "step": 49161
    },
    {
      "epoch": 5.215573944409082,
      "grad_norm": 0.6677612728854374,
      "learning_rate": 3.0137185133488543e-05,
      "loss": 1.1147,
      "num_input_tokens_seen": 38678995984,
      "step": 49162
    },
    {
      "epoch": 5.215680033948653,
      "grad_norm": 0.8468291734448475,
      "learning_rate": 3.0136504993484503e-05,
      "loss": 1.1401,
      "num_input_tokens_seen": 38679782832,
      "step": 49163
    },
    {
      "epoch": 5.215786123488224,
      "grad_norm": 0.7794415226237001,
      "learning_rate": 3.0135824849511114e-05,
      "loss": 1.2008,
      "num_input_tokens_seen": 38680569680,
      "step": 49164
    },
    {
      "epoch": 5.215892213027796,
      "grad_norm": 0.6706367270589284,
      "learning_rate": 3.013514470156892e-05,
      "loss": 1.2636,
      "num_input_tokens_seen": 38681356480,
      "step": 49165
    },
    {
      "epoch": 5.215998302567367,
      "grad_norm": 0.67831256219158,
      "learning_rate": 3.0134464549658425e-05,
      "loss": 1.3032,
      "num_input_tokens_seen": 38682143216,
      "step": 49166
    },
    {
      "epoch": 5.2161043921069385,
      "grad_norm": 0.8091119629552973,
      "learning_rate": 3.0133784393780175e-05,
      "loss": 1.1238,
      "num_input_tokens_seen": 38682929952,
      "step": 49167
    },
    {
      "epoch": 5.21621048164651,
      "grad_norm": 0.9704306712049787,
      "learning_rate": 3.013310423393469e-05,
      "loss": 1.1912,
      "num_input_tokens_seen": 38683716736,
      "step": 49168
    },
    {
      "epoch": 5.216316571186081,
      "grad_norm": 0.6528950438639902,
      "learning_rate": 3.0132424070122485e-05,
      "loss": 1.0126,
      "num_input_tokens_seen": 38684503488,
      "step": 49169
    },
    {
      "epoch": 5.2164226607256525,
      "grad_norm": 0.8354601233027077,
      "learning_rate": 3.0131743902344096e-05,
      "loss": 1.129,
      "num_input_tokens_seen": 38685290240,
      "step": 49170
    },
    {
      "epoch": 5.216528750265224,
      "grad_norm": 0.6340074638577048,
      "learning_rate": 3.013106373060004e-05,
      "loss": 1.1103,
      "num_input_tokens_seen": 38686077056,
      "step": 49171
    },
    {
      "epoch": 5.2166348398047955,
      "grad_norm": 0.631607561991082,
      "learning_rate": 3.0130383554890856e-05,
      "loss": 1.1244,
      "num_input_tokens_seen": 38686863808,
      "step": 49172
    },
    {
      "epoch": 5.2167409293443665,
      "grad_norm": 0.6281366843626021,
      "learning_rate": 3.0129703375217068e-05,
      "loss": 1.0948,
      "num_input_tokens_seen": 38687650544,
      "step": 49173
    },
    {
      "epoch": 5.216847018883938,
      "grad_norm": 0.8873502151103018,
      "learning_rate": 3.012902319157918e-05,
      "loss": 1.2345,
      "num_input_tokens_seen": 38688437360,
      "step": 49174
    },
    {
      "epoch": 5.2169531084235095,
      "grad_norm": 0.6314676407605272,
      "learning_rate": 3.0128343003977743e-05,
      "loss": 1.1002,
      "num_input_tokens_seen": 38689224176,
      "step": 49175
    },
    {
      "epoch": 5.2170591979630805,
      "grad_norm": 0.7285266831802035,
      "learning_rate": 3.0127662812413276e-05,
      "loss": 1.1624,
      "num_input_tokens_seen": 38690010928,
      "step": 49176
    },
    {
      "epoch": 5.217165287502652,
      "grad_norm": 0.8567825733788644,
      "learning_rate": 3.0126982616886295e-05,
      "loss": 1.2373,
      "num_input_tokens_seen": 38690797744,
      "step": 49177
    },
    {
      "epoch": 5.217271377042223,
      "grad_norm": 0.9058263948695348,
      "learning_rate": 3.0126302417397333e-05,
      "loss": 1.0966,
      "num_input_tokens_seen": 38691584512,
      "step": 49178
    },
    {
      "epoch": 5.217377466581795,
      "grad_norm": 0.4825866993623363,
      "learning_rate": 3.0125622213946918e-05,
      "loss": 1.0143,
      "num_input_tokens_seen": 38692371296,
      "step": 49179
    },
    {
      "epoch": 5.217483556121366,
      "grad_norm": 0.7616236059812795,
      "learning_rate": 3.0124942006535572e-05,
      "loss": 1.3258,
      "num_input_tokens_seen": 38693158000,
      "step": 49180
    },
    {
      "epoch": 5.217589645660937,
      "grad_norm": 0.6202540933214102,
      "learning_rate": 3.0124261795163823e-05,
      "loss": 1.2284,
      "num_input_tokens_seen": 38693944816,
      "step": 49181
    },
    {
      "epoch": 5.217695735200509,
      "grad_norm": 0.8366657822252234,
      "learning_rate": 3.0123581579832195e-05,
      "loss": 1.1578,
      "num_input_tokens_seen": 38694731584,
      "step": 49182
    },
    {
      "epoch": 5.21780182474008,
      "grad_norm": 0.8856496513893619,
      "learning_rate": 3.0122901360541206e-05,
      "loss": 1.1861,
      "num_input_tokens_seen": 38695518416,
      "step": 49183
    },
    {
      "epoch": 5.217907914279652,
      "grad_norm": 0.7510758328607082,
      "learning_rate": 3.0122221137291395e-05,
      "loss": 1.1168,
      "num_input_tokens_seen": 38696305232,
      "step": 49184
    },
    {
      "epoch": 5.218014003819223,
      "grad_norm": 0.8085516446478146,
      "learning_rate": 3.012154091008328e-05,
      "loss": 1.1306,
      "num_input_tokens_seen": 38697091952,
      "step": 49185
    },
    {
      "epoch": 5.218120093358795,
      "grad_norm": 0.6351923758919121,
      "learning_rate": 3.0120860678917384e-05,
      "loss": 1.1,
      "num_input_tokens_seen": 38697878672,
      "step": 49186
    },
    {
      "epoch": 5.218226182898366,
      "grad_norm": 0.6904072350937357,
      "learning_rate": 3.0120180443794245e-05,
      "loss": 1.234,
      "num_input_tokens_seen": 38698665312,
      "step": 49187
    },
    {
      "epoch": 5.218332272437937,
      "grad_norm": 0.7104322279556197,
      "learning_rate": 3.011950020471438e-05,
      "loss": 1.2407,
      "num_input_tokens_seen": 38699452128,
      "step": 49188
    },
    {
      "epoch": 5.218438361977509,
      "grad_norm": 0.6998780994825508,
      "learning_rate": 3.0118819961678314e-05,
      "loss": 1.1622,
      "num_input_tokens_seen": 38700238848,
      "step": 49189
    },
    {
      "epoch": 5.21854445151708,
      "grad_norm": 0.6625513352169926,
      "learning_rate": 3.0118139714686572e-05,
      "loss": 1.1315,
      "num_input_tokens_seen": 38701025664,
      "step": 49190
    },
    {
      "epoch": 5.218650541056652,
      "grad_norm": 0.7861187136412578,
      "learning_rate": 3.0117459463739682e-05,
      "loss": 1.2029,
      "num_input_tokens_seen": 38701812496,
      "step": 49191
    },
    {
      "epoch": 5.218756630596223,
      "grad_norm": 0.6506299605384388,
      "learning_rate": 3.011677920883817e-05,
      "loss": 1.0373,
      "num_input_tokens_seen": 38702599248,
      "step": 49192
    },
    {
      "epoch": 5.218862720135794,
      "grad_norm": 0.5718618208077653,
      "learning_rate": 3.0116098949982564e-05,
      "loss": 1.073,
      "num_input_tokens_seen": 38703385968,
      "step": 49193
    },
    {
      "epoch": 5.218968809675366,
      "grad_norm": 0.6910268056176953,
      "learning_rate": 3.011541868717338e-05,
      "loss": 1.1722,
      "num_input_tokens_seen": 38704172768,
      "step": 49194
    },
    {
      "epoch": 5.219074899214937,
      "grad_norm": 0.7570299780865174,
      "learning_rate": 3.0114738420411158e-05,
      "loss": 1.0965,
      "num_input_tokens_seen": 38704959568,
      "step": 49195
    },
    {
      "epoch": 5.219180988754509,
      "grad_norm": 0.6336169419599204,
      "learning_rate": 3.0114058149696416e-05,
      "loss": 1.0538,
      "num_input_tokens_seen": 38705746288,
      "step": 49196
    },
    {
      "epoch": 5.21928707829408,
      "grad_norm": 0.7180937142674616,
      "learning_rate": 3.0113377875029676e-05,
      "loss": 1.1302,
      "num_input_tokens_seen": 38706533056,
      "step": 49197
    },
    {
      "epoch": 5.219393167833651,
      "grad_norm": 1.1425400614793984,
      "learning_rate": 3.0112697596411472e-05,
      "loss": 1.2033,
      "num_input_tokens_seen": 38707319728,
      "step": 49198
    },
    {
      "epoch": 5.219499257373223,
      "grad_norm": 0.851806507707905,
      "learning_rate": 3.011201731384232e-05,
      "loss": 1.194,
      "num_input_tokens_seen": 38708106464,
      "step": 49199
    },
    {
      "epoch": 5.219605346912794,
      "grad_norm": 0.8948704719351027,
      "learning_rate": 3.011133702732275e-05,
      "loss": 1.212,
      "num_input_tokens_seen": 38708893248,
      "step": 49200
    },
    {
      "epoch": 5.219711436452366,
      "grad_norm": 1.0430617498103514,
      "learning_rate": 3.01106567368533e-05,
      "loss": 1.1859,
      "num_input_tokens_seen": 38709680032,
      "step": 49201
    },
    {
      "epoch": 5.219817525991937,
      "grad_norm": 0.6207128507976835,
      "learning_rate": 3.0109976442434472e-05,
      "loss": 1.1595,
      "num_input_tokens_seen": 38710466800,
      "step": 49202
    },
    {
      "epoch": 5.219923615531509,
      "grad_norm": 0.8035908723856444,
      "learning_rate": 3.0109296144066812e-05,
      "loss": 1.1745,
      "num_input_tokens_seen": 38711253472,
      "step": 49203
    },
    {
      "epoch": 5.22002970507108,
      "grad_norm": 0.5617692373163321,
      "learning_rate": 3.0108615841750832e-05,
      "loss": 1.1251,
      "num_input_tokens_seen": 38712040160,
      "step": 49204
    },
    {
      "epoch": 5.220135794610651,
      "grad_norm": 0.8285891808686235,
      "learning_rate": 3.0107935535487063e-05,
      "loss": 1.2307,
      "num_input_tokens_seen": 38712826896,
      "step": 49205
    },
    {
      "epoch": 5.220241884150223,
      "grad_norm": 0.7192945264107943,
      "learning_rate": 3.0107255225276038e-05,
      "loss": 1.2173,
      "num_input_tokens_seen": 38713613648,
      "step": 49206
    },
    {
      "epoch": 5.220347973689794,
      "grad_norm": 0.8376529810694646,
      "learning_rate": 3.0106574911118274e-05,
      "loss": 1.1892,
      "num_input_tokens_seen": 38714400368,
      "step": 49207
    },
    {
      "epoch": 5.220454063229366,
      "grad_norm": 1.1455287110055046,
      "learning_rate": 3.0105894593014295e-05,
      "loss": 1.2054,
      "num_input_tokens_seen": 38715187072,
      "step": 49208
    },
    {
      "epoch": 5.220560152768937,
      "grad_norm": 0.6859582133894561,
      "learning_rate": 3.0105214270964633e-05,
      "loss": 1.1994,
      "num_input_tokens_seen": 38715973824,
      "step": 49209
    },
    {
      "epoch": 5.220666242308508,
      "grad_norm": 1.002500176670757,
      "learning_rate": 3.0104533944969814e-05,
      "loss": 1.1271,
      "num_input_tokens_seen": 38716760608,
      "step": 49210
    },
    {
      "epoch": 5.22077233184808,
      "grad_norm": 0.6520043763196004,
      "learning_rate": 3.010385361503035e-05,
      "loss": 1.1831,
      "num_input_tokens_seen": 38717547296,
      "step": 49211
    },
    {
      "epoch": 5.220878421387651,
      "grad_norm": 0.9067431644337006,
      "learning_rate": 3.0103173281146786e-05,
      "loss": 1.1361,
      "num_input_tokens_seen": 38718334032,
      "step": 49212
    },
    {
      "epoch": 5.220984510927223,
      "grad_norm": 0.7695026583871207,
      "learning_rate": 3.0102492943319638e-05,
      "loss": 1.1967,
      "num_input_tokens_seen": 38719120832,
      "step": 49213
    },
    {
      "epoch": 5.221090600466794,
      "grad_norm": 0.7805657797194087,
      "learning_rate": 3.0101812601549433e-05,
      "loss": 1.1144,
      "num_input_tokens_seen": 38719907600,
      "step": 49214
    },
    {
      "epoch": 5.221196690006366,
      "grad_norm": 0.6980399258294832,
      "learning_rate": 3.01011322558367e-05,
      "loss": 1.1526,
      "num_input_tokens_seen": 38720694416,
      "step": 49215
    },
    {
      "epoch": 5.221302779545937,
      "grad_norm": 0.732659918263636,
      "learning_rate": 3.010045190618196e-05,
      "loss": 1.2392,
      "num_input_tokens_seen": 38721481200,
      "step": 49216
    },
    {
      "epoch": 5.221408869085508,
      "grad_norm": 0.6536437046994233,
      "learning_rate": 3.0099771552585738e-05,
      "loss": 1.1671,
      "num_input_tokens_seen": 38722268000,
      "step": 49217
    },
    {
      "epoch": 5.22151495862508,
      "grad_norm": 0.6954514619526491,
      "learning_rate": 3.0099091195048567e-05,
      "loss": 1.184,
      "num_input_tokens_seen": 38723054768,
      "step": 49218
    },
    {
      "epoch": 5.221621048164651,
      "grad_norm": 0.8358148427164279,
      "learning_rate": 3.0098410833570968e-05,
      "loss": 1.2679,
      "num_input_tokens_seen": 38723841456,
      "step": 49219
    },
    {
      "epoch": 5.221727137704223,
      "grad_norm": 0.8273085939694104,
      "learning_rate": 3.0097730468153464e-05,
      "loss": 1.2094,
      "num_input_tokens_seen": 38724628256,
      "step": 49220
    },
    {
      "epoch": 5.221833227243794,
      "grad_norm": 0.6066705789653287,
      "learning_rate": 3.009705009879658e-05,
      "loss": 1.0661,
      "num_input_tokens_seen": 38725415008,
      "step": 49221
    },
    {
      "epoch": 5.221939316783365,
      "grad_norm": 0.6799998444264482,
      "learning_rate": 3.009636972550085e-05,
      "loss": 1.1398,
      "num_input_tokens_seen": 38726201712,
      "step": 49222
    },
    {
      "epoch": 5.222045406322937,
      "grad_norm": 1.146652417185059,
      "learning_rate": 3.0095689348266792e-05,
      "loss": 1.2053,
      "num_input_tokens_seen": 38726988560,
      "step": 49223
    },
    {
      "epoch": 5.222151495862508,
      "grad_norm": 0.6401217343203035,
      "learning_rate": 3.009500896709494e-05,
      "loss": 1.1989,
      "num_input_tokens_seen": 38727775440,
      "step": 49224
    },
    {
      "epoch": 5.22225758540208,
      "grad_norm": 0.7530015752974508,
      "learning_rate": 3.009432858198581e-05,
      "loss": 1.1767,
      "num_input_tokens_seen": 38728562208,
      "step": 49225
    },
    {
      "epoch": 5.222363674941651,
      "grad_norm": 0.7109314754978673,
      "learning_rate": 3.0093648192939933e-05,
      "loss": 1.2624,
      "num_input_tokens_seen": 38729348944,
      "step": 49226
    },
    {
      "epoch": 5.222469764481223,
      "grad_norm": 0.6572999087998739,
      "learning_rate": 3.0092967799957832e-05,
      "loss": 1.1088,
      "num_input_tokens_seen": 38730135728,
      "step": 49227
    },
    {
      "epoch": 5.222575854020794,
      "grad_norm": 0.7239030921451965,
      "learning_rate": 3.0092287403040043e-05,
      "loss": 1.0137,
      "num_input_tokens_seen": 38730922480,
      "step": 49228
    },
    {
      "epoch": 5.222681943560365,
      "grad_norm": 0.674788058385035,
      "learning_rate": 3.0091607002187074e-05,
      "loss": 1.1997,
      "num_input_tokens_seen": 38731709152,
      "step": 49229
    },
    {
      "epoch": 5.2227880330999366,
      "grad_norm": 0.5780898809843898,
      "learning_rate": 3.0090926597399468e-05,
      "loss": 1.0837,
      "num_input_tokens_seen": 38732495936,
      "step": 49230
    },
    {
      "epoch": 5.222894122639508,
      "grad_norm": 1.1438434242193745,
      "learning_rate": 3.0090246188677735e-05,
      "loss": 1.1863,
      "num_input_tokens_seen": 38733282704,
      "step": 49231
    },
    {
      "epoch": 5.2230002121790795,
      "grad_norm": 0.5994772786521193,
      "learning_rate": 3.0089565776022416e-05,
      "loss": 1.0791,
      "num_input_tokens_seen": 38734069536,
      "step": 49232
    },
    {
      "epoch": 5.2231063017186505,
      "grad_norm": 1.1316420274260124,
      "learning_rate": 3.0088885359434028e-05,
      "loss": 1.1615,
      "num_input_tokens_seen": 38734856288,
      "step": 49233
    },
    {
      "epoch": 5.223212391258222,
      "grad_norm": 1.0129717967028022,
      "learning_rate": 3.0088204938913097e-05,
      "loss": 1.2203,
      "num_input_tokens_seen": 38735643072,
      "step": 49234
    },
    {
      "epoch": 5.2233184807977935,
      "grad_norm": 0.8408767711934866,
      "learning_rate": 3.0087524514460153e-05,
      "loss": 1.2073,
      "num_input_tokens_seen": 38736429840,
      "step": 49235
    },
    {
      "epoch": 5.2234245703373645,
      "grad_norm": 1.1171492933275644,
      "learning_rate": 3.008684408607572e-05,
      "loss": 1.0991,
      "num_input_tokens_seen": 38737216608,
      "step": 49236
    },
    {
      "epoch": 5.223530659876936,
      "grad_norm": 0.7287312207522202,
      "learning_rate": 3.008616365376032e-05,
      "loss": 1.1371,
      "num_input_tokens_seen": 38738003312,
      "step": 49237
    },
    {
      "epoch": 5.2236367494165075,
      "grad_norm": 0.8857957704786877,
      "learning_rate": 3.008548321751449e-05,
      "loss": 1.204,
      "num_input_tokens_seen": 38738790112,
      "step": 49238
    },
    {
      "epoch": 5.223742838956079,
      "grad_norm": 0.9149728997015725,
      "learning_rate": 3.008480277733874e-05,
      "loss": 1.1471,
      "num_input_tokens_seen": 38739576944,
      "step": 49239
    },
    {
      "epoch": 5.22384892849565,
      "grad_norm": 0.8092650040803826,
      "learning_rate": 3.00841223332336e-05,
      "loss": 1.2065,
      "num_input_tokens_seen": 38740363712,
      "step": 49240
    },
    {
      "epoch": 5.223955018035221,
      "grad_norm": 0.8639785784083741,
      "learning_rate": 3.0083441885199604e-05,
      "loss": 1.153,
      "num_input_tokens_seen": 38741150368,
      "step": 49241
    },
    {
      "epoch": 5.224061107574793,
      "grad_norm": 0.751353621330214,
      "learning_rate": 3.0082761433237277e-05,
      "loss": 1.2289,
      "num_input_tokens_seen": 38741937136,
      "step": 49242
    },
    {
      "epoch": 5.224167197114364,
      "grad_norm": 0.9170528293929114,
      "learning_rate": 3.0082080977347133e-05,
      "loss": 1.122,
      "num_input_tokens_seen": 38742723984,
      "step": 49243
    },
    {
      "epoch": 5.224273286653936,
      "grad_norm": 0.730369173214983,
      "learning_rate": 3.008140051752971e-05,
      "loss": 1.121,
      "num_input_tokens_seen": 38743510816,
      "step": 49244
    },
    {
      "epoch": 5.224379376193507,
      "grad_norm": 0.7659758344352234,
      "learning_rate": 3.0080720053785538e-05,
      "loss": 1.1422,
      "num_input_tokens_seen": 38744297568,
      "step": 49245
    },
    {
      "epoch": 5.224485465733078,
      "grad_norm": 0.8964820264761459,
      "learning_rate": 3.008003958611512e-05,
      "loss": 1.1786,
      "num_input_tokens_seen": 38745084368,
      "step": 49246
    },
    {
      "epoch": 5.22459155527265,
      "grad_norm": 0.9144320298003346,
      "learning_rate": 3.0079359114519007e-05,
      "loss": 1.2683,
      "num_input_tokens_seen": 38745871088,
      "step": 49247
    },
    {
      "epoch": 5.224697644812221,
      "grad_norm": 0.8741605518948578,
      "learning_rate": 3.007867863899771e-05,
      "loss": 1.0927,
      "num_input_tokens_seen": 38746657872,
      "step": 49248
    },
    {
      "epoch": 5.224803734351793,
      "grad_norm": 0.7300670642138454,
      "learning_rate": 3.007799815955176e-05,
      "loss": 1.1299,
      "num_input_tokens_seen": 38747444576,
      "step": 49249
    },
    {
      "epoch": 5.224909823891364,
      "grad_norm": 0.6705026374979317,
      "learning_rate": 3.0077317676181683e-05,
      "loss": 1.0808,
      "num_input_tokens_seen": 38748231360,
      "step": 49250
    },
    {
      "epoch": 5.225015913430935,
      "grad_norm": 1.176160227068353,
      "learning_rate": 3.0076637188888002e-05,
      "loss": 1.1758,
      "num_input_tokens_seen": 38749018000,
      "step": 49251
    },
    {
      "epoch": 5.225122002970507,
      "grad_norm": 0.6694095417656962,
      "learning_rate": 3.0075956697671248e-05,
      "loss": 1.1131,
      "num_input_tokens_seen": 38749804768,
      "step": 49252
    },
    {
      "epoch": 5.225228092510078,
      "grad_norm": 0.7522082193261072,
      "learning_rate": 3.0075276202531945e-05,
      "loss": 1.2092,
      "num_input_tokens_seen": 38750591600,
      "step": 49253
    },
    {
      "epoch": 5.22533418204965,
      "grad_norm": 0.9441420049783524,
      "learning_rate": 3.007459570347061e-05,
      "loss": 1.1974,
      "num_input_tokens_seen": 38751378384,
      "step": 49254
    },
    {
      "epoch": 5.225440271589221,
      "grad_norm": 0.8093968033542994,
      "learning_rate": 3.007391520048778e-05,
      "loss": 1.1828,
      "num_input_tokens_seen": 38752165216,
      "step": 49255
    },
    {
      "epoch": 5.225546361128793,
      "grad_norm": 1.1945681751115889,
      "learning_rate": 3.007323469358398e-05,
      "loss": 1.1565,
      "num_input_tokens_seen": 38752951952,
      "step": 49256
    },
    {
      "epoch": 5.225652450668364,
      "grad_norm": 0.8900727803730308,
      "learning_rate": 3.0072554182759727e-05,
      "loss": 1.2184,
      "num_input_tokens_seen": 38753738672,
      "step": 49257
    },
    {
      "epoch": 5.225758540207935,
      "grad_norm": 0.7002702132881199,
      "learning_rate": 3.007187366801556e-05,
      "loss": 1.1066,
      "num_input_tokens_seen": 38754525440,
      "step": 49258
    },
    {
      "epoch": 5.225864629747507,
      "grad_norm": 0.6158495027483593,
      "learning_rate": 3.007119314935199e-05,
      "loss": 1.1894,
      "num_input_tokens_seen": 38755312208,
      "step": 49259
    },
    {
      "epoch": 5.225970719287078,
      "grad_norm": 0.6778853605930475,
      "learning_rate": 3.0070512626769547e-05,
      "loss": 1.1839,
      "num_input_tokens_seen": 38756098992,
      "step": 49260
    },
    {
      "epoch": 5.22607680882665,
      "grad_norm": 0.6520317786312662,
      "learning_rate": 3.0069832100268774e-05,
      "loss": 1.1681,
      "num_input_tokens_seen": 38756885824,
      "step": 49261
    },
    {
      "epoch": 5.226182898366221,
      "grad_norm": 0.645164740021332,
      "learning_rate": 3.006915156985018e-05,
      "loss": 1.1539,
      "num_input_tokens_seen": 38757672592,
      "step": 49262
    },
    {
      "epoch": 5.226288987905792,
      "grad_norm": 0.7484328778693383,
      "learning_rate": 3.0068471035514288e-05,
      "loss": 1.2117,
      "num_input_tokens_seen": 38758459360,
      "step": 49263
    },
    {
      "epoch": 5.226395077445364,
      "grad_norm": 0.6690072388998773,
      "learning_rate": 3.006779049726164e-05,
      "loss": 1.1845,
      "num_input_tokens_seen": 38759246096,
      "step": 49264
    },
    {
      "epoch": 5.226501166984935,
      "grad_norm": 0.9788064499479129,
      "learning_rate": 3.006710995509275e-05,
      "loss": 1.2598,
      "num_input_tokens_seen": 38760032848,
      "step": 49265
    },
    {
      "epoch": 5.226607256524507,
      "grad_norm": 0.5726447335048346,
      "learning_rate": 3.0066429409008134e-05,
      "loss": 1.1654,
      "num_input_tokens_seen": 38760819552,
      "step": 49266
    },
    {
      "epoch": 5.226713346064078,
      "grad_norm": 0.8130142328149295,
      "learning_rate": 3.006574885900834e-05,
      "loss": 1.0603,
      "num_input_tokens_seen": 38761606240,
      "step": 49267
    },
    {
      "epoch": 5.22681943560365,
      "grad_norm": 0.8451440390425959,
      "learning_rate": 3.0065068305093892e-05,
      "loss": 1.1493,
      "num_input_tokens_seen": 38762393056,
      "step": 49268
    },
    {
      "epoch": 5.226925525143221,
      "grad_norm": 0.6201775517201656,
      "learning_rate": 3.0064387747265294e-05,
      "loss": 1.1727,
      "num_input_tokens_seen": 38763179808,
      "step": 49269
    },
    {
      "epoch": 5.227031614682792,
      "grad_norm": 1.090339197781442,
      "learning_rate": 3.006370718552309e-05,
      "loss": 1.1234,
      "num_input_tokens_seen": 38763966528,
      "step": 49270
    },
    {
      "epoch": 5.227137704222364,
      "grad_norm": 0.9354417832242304,
      "learning_rate": 3.0063026619867806e-05,
      "loss": 1.2039,
      "num_input_tokens_seen": 38764753312,
      "step": 49271
    },
    {
      "epoch": 5.227243793761935,
      "grad_norm": 0.6495567204227969,
      "learning_rate": 3.0062346050299955e-05,
      "loss": 1.1714,
      "num_input_tokens_seen": 38765540080,
      "step": 49272
    },
    {
      "epoch": 5.227349883301507,
      "grad_norm": 1.3046161478777607,
      "learning_rate": 3.006166547682008e-05,
      "loss": 1.2223,
      "num_input_tokens_seen": 38766326848,
      "step": 49273
    },
    {
      "epoch": 5.227455972841078,
      "grad_norm": 0.6335279970238009,
      "learning_rate": 3.006098489942869e-05,
      "loss": 1.0612,
      "num_input_tokens_seen": 38767113696,
      "step": 49274
    },
    {
      "epoch": 5.227562062380649,
      "grad_norm": 0.5886454094417453,
      "learning_rate": 3.0060304318126325e-05,
      "loss": 1.1725,
      "num_input_tokens_seen": 38767900448,
      "step": 49275
    },
    {
      "epoch": 5.227668151920221,
      "grad_norm": 0.7412114383300131,
      "learning_rate": 3.0059623732913505e-05,
      "loss": 0.9633,
      "num_input_tokens_seen": 38768687264,
      "step": 49276
    },
    {
      "epoch": 5.227774241459792,
      "grad_norm": 1.209039073458458,
      "learning_rate": 3.0058943143790753e-05,
      "loss": 1.1557,
      "num_input_tokens_seen": 38769474112,
      "step": 49277
    },
    {
      "epoch": 5.227880330999364,
      "grad_norm": 0.8023309916357713,
      "learning_rate": 3.0058262550758602e-05,
      "loss": 1.2589,
      "num_input_tokens_seen": 38770260896,
      "step": 49278
    },
    {
      "epoch": 5.227986420538935,
      "grad_norm": 0.8714884676691438,
      "learning_rate": 3.0057581953817577e-05,
      "loss": 1.1189,
      "num_input_tokens_seen": 38771047776,
      "step": 49279
    },
    {
      "epoch": 5.228092510078506,
      "grad_norm": 0.7675618381067012,
      "learning_rate": 3.0056901352968193e-05,
      "loss": 1.0871,
      "num_input_tokens_seen": 38771834544,
      "step": 49280
    },
    {
      "epoch": 5.228198599618078,
      "grad_norm": 0.7694879375393433,
      "learning_rate": 3.005622074821099e-05,
      "loss": 1.2118,
      "num_input_tokens_seen": 38772621232,
      "step": 49281
    },
    {
      "epoch": 5.228304689157649,
      "grad_norm": 0.7602537398256789,
      "learning_rate": 3.005554013954649e-05,
      "loss": 1.1642,
      "num_input_tokens_seen": 38773407936,
      "step": 49282
    },
    {
      "epoch": 5.228410778697221,
      "grad_norm": 0.6991806650286674,
      "learning_rate": 3.005485952697521e-05,
      "loss": 1.1152,
      "num_input_tokens_seen": 38774194688,
      "step": 49283
    },
    {
      "epoch": 5.228516868236792,
      "grad_norm": 0.6779110497613335,
      "learning_rate": 3.0054178910497688e-05,
      "loss": 1.139,
      "num_input_tokens_seen": 38774981440,
      "step": 49284
    },
    {
      "epoch": 5.228622957776364,
      "grad_norm": 0.7030265700085402,
      "learning_rate": 3.0053498290114447e-05,
      "loss": 1.1859,
      "num_input_tokens_seen": 38775768208,
      "step": 49285
    },
    {
      "epoch": 5.228729047315935,
      "grad_norm": 0.6828299869047633,
      "learning_rate": 3.0052817665826e-05,
      "loss": 1.2712,
      "num_input_tokens_seen": 38776554928,
      "step": 49286
    },
    {
      "epoch": 5.228835136855506,
      "grad_norm": 0.6021508050536244,
      "learning_rate": 3.005213703763289e-05,
      "loss": 1.1456,
      "num_input_tokens_seen": 38777341632,
      "step": 49287
    },
    {
      "epoch": 5.228941226395078,
      "grad_norm": 0.8034233042198577,
      "learning_rate": 3.005145640553564e-05,
      "loss": 1.1327,
      "num_input_tokens_seen": 38778128448,
      "step": 49288
    },
    {
      "epoch": 5.229047315934649,
      "grad_norm": 0.607112521613843,
      "learning_rate": 3.0050775769534767e-05,
      "loss": 1.1888,
      "num_input_tokens_seen": 38778915152,
      "step": 49289
    },
    {
      "epoch": 5.229153405474221,
      "grad_norm": 0.7021726408849304,
      "learning_rate": 3.0050095129630805e-05,
      "loss": 1.2006,
      "num_input_tokens_seen": 38779701840,
      "step": 49290
    },
    {
      "epoch": 5.229259495013792,
      "grad_norm": 0.6058262164342132,
      "learning_rate": 3.0049414485824277e-05,
      "loss": 1.1995,
      "num_input_tokens_seen": 38780488624,
      "step": 49291
    },
    {
      "epoch": 5.229365584553363,
      "grad_norm": 0.7513413291009858,
      "learning_rate": 3.0048733838115712e-05,
      "loss": 1.1882,
      "num_input_tokens_seen": 38781275360,
      "step": 49292
    },
    {
      "epoch": 5.229471674092935,
      "grad_norm": 0.7822079518395669,
      "learning_rate": 3.0048053186505633e-05,
      "loss": 1.2455,
      "num_input_tokens_seen": 38782062080,
      "step": 49293
    },
    {
      "epoch": 5.229577763632506,
      "grad_norm": 0.6766932937566024,
      "learning_rate": 3.0047372530994566e-05,
      "loss": 1.2729,
      "num_input_tokens_seen": 38782848800,
      "step": 49294
    },
    {
      "epoch": 5.2296838531720775,
      "grad_norm": 0.6135800354407331,
      "learning_rate": 3.004669187158304e-05,
      "loss": 1.1395,
      "num_input_tokens_seen": 38783635520,
      "step": 49295
    },
    {
      "epoch": 5.2297899427116485,
      "grad_norm": 0.6750900310116235,
      "learning_rate": 3.0046011208271575e-05,
      "loss": 1.1548,
      "num_input_tokens_seen": 38784422208,
      "step": 49296
    },
    {
      "epoch": 5.2298960322512205,
      "grad_norm": 0.5425967189867581,
      "learning_rate": 3.00453305410607e-05,
      "loss": 1.1291,
      "num_input_tokens_seen": 38785208848,
      "step": 49297
    },
    {
      "epoch": 5.2300021217907915,
      "grad_norm": 0.8052257918660097,
      "learning_rate": 3.0044649869950943e-05,
      "loss": 1.1252,
      "num_input_tokens_seen": 38785995472,
      "step": 49298
    },
    {
      "epoch": 5.2301082113303625,
      "grad_norm": 0.5797387421878462,
      "learning_rate": 3.0043969194942835e-05,
      "loss": 1.1672,
      "num_input_tokens_seen": 38786782272,
      "step": 49299
    },
    {
      "epoch": 5.230214300869934,
      "grad_norm": 0.5954030085220101,
      "learning_rate": 3.0043288516036884e-05,
      "loss": 1.1371,
      "num_input_tokens_seen": 38787569152,
      "step": 49300
    },
    {
      "epoch": 5.2303203904095055,
      "grad_norm": 0.6769441893706446,
      "learning_rate": 3.0042607833233634e-05,
      "loss": 1.1815,
      "num_input_tokens_seen": 38788356016,
      "step": 49301
    },
    {
      "epoch": 5.230426479949077,
      "grad_norm": 0.6393054328116401,
      "learning_rate": 3.0041927146533605e-05,
      "loss": 1.2069,
      "num_input_tokens_seen": 38789142784,
      "step": 49302
    },
    {
      "epoch": 5.230532569488648,
      "grad_norm": 0.62472734251989,
      "learning_rate": 3.0041246455937316e-05,
      "loss": 1.2214,
      "num_input_tokens_seen": 38789929568,
      "step": 49303
    },
    {
      "epoch": 5.2306386590282195,
      "grad_norm": 0.6938918415084563,
      "learning_rate": 3.0040565761445312e-05,
      "loss": 1.1709,
      "num_input_tokens_seen": 38790716336,
      "step": 49304
    },
    {
      "epoch": 5.230744748567791,
      "grad_norm": 0.6852245962676388,
      "learning_rate": 3.00398850630581e-05,
      "loss": 1.1107,
      "num_input_tokens_seen": 38791503152,
      "step": 49305
    },
    {
      "epoch": 5.230850838107362,
      "grad_norm": 0.7028788803543851,
      "learning_rate": 3.00392043607762e-05,
      "loss": 1.2026,
      "num_input_tokens_seen": 38792289920,
      "step": 49306
    },
    {
      "epoch": 5.230956927646934,
      "grad_norm": 0.831613434417883,
      "learning_rate": 3.003852365460017e-05,
      "loss": 1.1717,
      "num_input_tokens_seen": 38793076704,
      "step": 49307
    },
    {
      "epoch": 5.231063017186505,
      "grad_norm": 0.6991716963488107,
      "learning_rate": 3.003784294453051e-05,
      "loss": 1.1459,
      "num_input_tokens_seen": 38793863520,
      "step": 49308
    },
    {
      "epoch": 5.231169106726076,
      "grad_norm": 0.8173802304116569,
      "learning_rate": 3.003716223056775e-05,
      "loss": 1.0984,
      "num_input_tokens_seen": 38794650336,
      "step": 49309
    },
    {
      "epoch": 5.231275196265648,
      "grad_norm": 0.5915077335661195,
      "learning_rate": 3.0036481512712422e-05,
      "loss": 1.101,
      "num_input_tokens_seen": 38795437104,
      "step": 49310
    },
    {
      "epoch": 5.231381285805219,
      "grad_norm": 0.5964720110598416,
      "learning_rate": 3.0035800790965053e-05,
      "loss": 1.1101,
      "num_input_tokens_seen": 38796223872,
      "step": 49311
    },
    {
      "epoch": 5.231487375344791,
      "grad_norm": 0.6426491278859736,
      "learning_rate": 3.0035120065326157e-05,
      "loss": 1.0683,
      "num_input_tokens_seen": 38797010560,
      "step": 49312
    },
    {
      "epoch": 5.231593464884362,
      "grad_norm": 0.5817848465119899,
      "learning_rate": 3.0034439335796273e-05,
      "loss": 1.1265,
      "num_input_tokens_seen": 38797797264,
      "step": 49313
    },
    {
      "epoch": 5.231699554423934,
      "grad_norm": 0.6674040137104446,
      "learning_rate": 3.0033758602375922e-05,
      "loss": 1.0598,
      "num_input_tokens_seen": 38798583984,
      "step": 49314
    },
    {
      "epoch": 5.231805643963505,
      "grad_norm": 0.7844590214759577,
      "learning_rate": 3.0033077865065624e-05,
      "loss": 1.1591,
      "num_input_tokens_seen": 38799370768,
      "step": 49315
    },
    {
      "epoch": 5.231911733503076,
      "grad_norm": 0.6969219030603457,
      "learning_rate": 3.003239712386592e-05,
      "loss": 1.1692,
      "num_input_tokens_seen": 38800157552,
      "step": 49316
    },
    {
      "epoch": 5.232017823042648,
      "grad_norm": 0.6399671006646023,
      "learning_rate": 3.0031716378777318e-05,
      "loss": 1.1078,
      "num_input_tokens_seen": 38800944320,
      "step": 49317
    },
    {
      "epoch": 5.232123912582219,
      "grad_norm": 0.6695770893934113,
      "learning_rate": 3.0031035629800357e-05,
      "loss": 1.1764,
      "num_input_tokens_seen": 38801730896,
      "step": 49318
    },
    {
      "epoch": 5.232230002121791,
      "grad_norm": 0.6020916806216544,
      "learning_rate": 3.0030354876935562e-05,
      "loss": 1.1878,
      "num_input_tokens_seen": 38802517600,
      "step": 49319
    },
    {
      "epoch": 5.232336091661362,
      "grad_norm": 0.607753470146197,
      "learning_rate": 3.0029674120183455e-05,
      "loss": 1.0843,
      "num_input_tokens_seen": 38803304384,
      "step": 49320
    },
    {
      "epoch": 5.232442181200933,
      "grad_norm": 0.6174635939526688,
      "learning_rate": 3.0028993359544562e-05,
      "loss": 1.178,
      "num_input_tokens_seen": 38804090976,
      "step": 49321
    },
    {
      "epoch": 5.232548270740505,
      "grad_norm": 0.6701962391254944,
      "learning_rate": 3.0028312595019413e-05,
      "loss": 1.1088,
      "num_input_tokens_seen": 38804877760,
      "step": 49322
    },
    {
      "epoch": 5.232654360280076,
      "grad_norm": 0.593401479579461,
      "learning_rate": 3.0027631826608525e-05,
      "loss": 1.1177,
      "num_input_tokens_seen": 38805664624,
      "step": 49323
    },
    {
      "epoch": 5.232760449819648,
      "grad_norm": 0.6858352159686014,
      "learning_rate": 3.0026951054312442e-05,
      "loss": 1.1638,
      "num_input_tokens_seen": 38806451360,
      "step": 49324
    },
    {
      "epoch": 5.232866539359219,
      "grad_norm": 0.6287598896462656,
      "learning_rate": 3.0026270278131673e-05,
      "loss": 1.1946,
      "num_input_tokens_seen": 38807238240,
      "step": 49325
    },
    {
      "epoch": 5.232972628898791,
      "grad_norm": 0.6022127825989355,
      "learning_rate": 3.0025589498066743e-05,
      "loss": 1.1005,
      "num_input_tokens_seen": 38808025104,
      "step": 49326
    },
    {
      "epoch": 5.233078718438362,
      "grad_norm": 0.660342733389532,
      "learning_rate": 3.0024908714118194e-05,
      "loss": 1.1225,
      "num_input_tokens_seen": 38808811872,
      "step": 49327
    },
    {
      "epoch": 5.233184807977933,
      "grad_norm": 0.6324171326065579,
      "learning_rate": 3.002422792628654e-05,
      "loss": 1.1935,
      "num_input_tokens_seen": 38809598656,
      "step": 49328
    },
    {
      "epoch": 5.233290897517505,
      "grad_norm": 0.6042914903080826,
      "learning_rate": 3.0023547134572312e-05,
      "loss": 1.2199,
      "num_input_tokens_seen": 38810385392,
      "step": 49329
    },
    {
      "epoch": 5.233396987057076,
      "grad_norm": 0.6958686005948066,
      "learning_rate": 3.002286633897603e-05,
      "loss": 1.2951,
      "num_input_tokens_seen": 38811171984,
      "step": 49330
    },
    {
      "epoch": 5.233503076596648,
      "grad_norm": 0.720200612526184,
      "learning_rate": 3.0022185539498233e-05,
      "loss": 1.1752,
      "num_input_tokens_seen": 38811958704,
      "step": 49331
    },
    {
      "epoch": 5.233609166136219,
      "grad_norm": 0.6260965827747115,
      "learning_rate": 3.002150473613943e-05,
      "loss": 1.1969,
      "num_input_tokens_seen": 38812745520,
      "step": 49332
    },
    {
      "epoch": 5.23371525567579,
      "grad_norm": 0.5184968158030663,
      "learning_rate": 3.0020823928900154e-05,
      "loss": 1.0895,
      "num_input_tokens_seen": 38813532336,
      "step": 49333
    },
    {
      "epoch": 5.233821345215362,
      "grad_norm": 0.9268730062315513,
      "learning_rate": 3.0020143117780936e-05,
      "loss": 1.0939,
      "num_input_tokens_seen": 38814319040,
      "step": 49334
    },
    {
      "epoch": 5.233927434754933,
      "grad_norm": 0.6741134499533173,
      "learning_rate": 3.0019462302782297e-05,
      "loss": 1.1941,
      "num_input_tokens_seen": 38815105744,
      "step": 49335
    },
    {
      "epoch": 5.234033524294505,
      "grad_norm": 0.6629611517279403,
      "learning_rate": 3.001878148390477e-05,
      "loss": 1.1511,
      "num_input_tokens_seen": 38815892496,
      "step": 49336
    },
    {
      "epoch": 5.234139613834076,
      "grad_norm": 1.0482882281064017,
      "learning_rate": 3.0018100661148866e-05,
      "loss": 1.2133,
      "num_input_tokens_seen": 38816679216,
      "step": 49337
    },
    {
      "epoch": 5.234245703373647,
      "grad_norm": 0.5988189996080546,
      "learning_rate": 3.0017419834515132e-05,
      "loss": 1.1497,
      "num_input_tokens_seen": 38817465936,
      "step": 49338
    },
    {
      "epoch": 5.234351792913219,
      "grad_norm": 0.709495878752121,
      "learning_rate": 3.001673900400408e-05,
      "loss": 1.0707,
      "num_input_tokens_seen": 38818252752,
      "step": 49339
    },
    {
      "epoch": 5.23445788245279,
      "grad_norm": 1.4248813090504102,
      "learning_rate": 3.0016058169616234e-05,
      "loss": 1.1715,
      "num_input_tokens_seen": 38819039632,
      "step": 49340
    },
    {
      "epoch": 5.234563971992362,
      "grad_norm": 0.6473159235727998,
      "learning_rate": 3.0015377331352134e-05,
      "loss": 1.151,
      "num_input_tokens_seen": 38819826432,
      "step": 49341
    },
    {
      "epoch": 5.234670061531933,
      "grad_norm": 1.0756464943850053,
      "learning_rate": 3.001469648921229e-05,
      "loss": 1.1643,
      "num_input_tokens_seen": 38820613248,
      "step": 49342
    },
    {
      "epoch": 5.234776151071505,
      "grad_norm": 0.7120241954950494,
      "learning_rate": 3.0014015643197235e-05,
      "loss": 1.1185,
      "num_input_tokens_seen": 38821399920,
      "step": 49343
    },
    {
      "epoch": 5.234882240611076,
      "grad_norm": 0.6295344453431393,
      "learning_rate": 3.0013334793307503e-05,
      "loss": 1.1614,
      "num_input_tokens_seen": 38822186784,
      "step": 49344
    },
    {
      "epoch": 5.234988330150647,
      "grad_norm": 0.6938234090758371,
      "learning_rate": 3.0012653939543612e-05,
      "loss": 1.3008,
      "num_input_tokens_seen": 38822973536,
      "step": 49345
    },
    {
      "epoch": 5.235094419690219,
      "grad_norm": 0.7863064955826233,
      "learning_rate": 3.0011973081906086e-05,
      "loss": 1.1279,
      "num_input_tokens_seen": 38823760352,
      "step": 49346
    },
    {
      "epoch": 5.23520050922979,
      "grad_norm": 0.5510833435460074,
      "learning_rate": 3.0011292220395455e-05,
      "loss": 1.1709,
      "num_input_tokens_seen": 38824547024,
      "step": 49347
    },
    {
      "epoch": 5.235306598769362,
      "grad_norm": 0.6392132380148773,
      "learning_rate": 3.0010611355012247e-05,
      "loss": 1.0217,
      "num_input_tokens_seen": 38825333760,
      "step": 49348
    },
    {
      "epoch": 5.235412688308933,
      "grad_norm": 0.6856629532489448,
      "learning_rate": 3.0009930485756977e-05,
      "loss": 1.1581,
      "num_input_tokens_seen": 38826120576,
      "step": 49349
    },
    {
      "epoch": 5.235518777848504,
      "grad_norm": 0.7204732816282976,
      "learning_rate": 3.0009249612630187e-05,
      "loss": 1.1239,
      "num_input_tokens_seen": 38826907376,
      "step": 49350
    },
    {
      "epoch": 5.235624867388076,
      "grad_norm": 0.966702071146469,
      "learning_rate": 3.0008568735632392e-05,
      "loss": 1.1767,
      "num_input_tokens_seen": 38827694144,
      "step": 49351
    },
    {
      "epoch": 5.235730956927647,
      "grad_norm": 0.5121736498480874,
      "learning_rate": 3.0007887854764128e-05,
      "loss": 1.1379,
      "num_input_tokens_seen": 38828480848,
      "step": 49352
    },
    {
      "epoch": 5.235837046467219,
      "grad_norm": 0.7861957873454107,
      "learning_rate": 3.0007206970025915e-05,
      "loss": 1.1729,
      "num_input_tokens_seen": 38829267600,
      "step": 49353
    },
    {
      "epoch": 5.23594313600679,
      "grad_norm": 0.6564537302637073,
      "learning_rate": 3.0006526081418266e-05,
      "loss": 1.2169,
      "num_input_tokens_seen": 38830054352,
      "step": 49354
    },
    {
      "epoch": 5.2360492255463615,
      "grad_norm": 0.6032122408998528,
      "learning_rate": 3.0005845188941734e-05,
      "loss": 1.1855,
      "num_input_tokens_seen": 38830841104,
      "step": 49355
    },
    {
      "epoch": 5.236155315085933,
      "grad_norm": 0.9813229244185171,
      "learning_rate": 3.0005164292596825e-05,
      "loss": 1.1837,
      "num_input_tokens_seen": 38831627824,
      "step": 49356
    },
    {
      "epoch": 5.236261404625504,
      "grad_norm": 0.6433652026788973,
      "learning_rate": 3.000448339238408e-05,
      "loss": 1.2143,
      "num_input_tokens_seen": 38832414560,
      "step": 49357
    },
    {
      "epoch": 5.2363674941650755,
      "grad_norm": 0.7861447627997549,
      "learning_rate": 3.0003802488304012e-05,
      "loss": 1.096,
      "num_input_tokens_seen": 38833201408,
      "step": 49358
    },
    {
      "epoch": 5.2364735837046466,
      "grad_norm": 0.747791210169749,
      "learning_rate": 3.000312158035715e-05,
      "loss": 1.0131,
      "num_input_tokens_seen": 38833988320,
      "step": 49359
    },
    {
      "epoch": 5.2365796732442185,
      "grad_norm": 0.5914215320525903,
      "learning_rate": 3.0002440668544025e-05,
      "loss": 1.2245,
      "num_input_tokens_seen": 38834775056,
      "step": 49360
    },
    {
      "epoch": 5.2366857627837895,
      "grad_norm": 0.6959500301470125,
      "learning_rate": 3.000175975286516e-05,
      "loss": 1.2133,
      "num_input_tokens_seen": 38835561952,
      "step": 49361
    },
    {
      "epoch": 5.2367918523233605,
      "grad_norm": 0.9003208010838876,
      "learning_rate": 3.0001078833321083e-05,
      "loss": 1.1965,
      "num_input_tokens_seen": 38836348688,
      "step": 49362
    },
    {
      "epoch": 5.2368979418629324,
      "grad_norm": 0.6935552825353961,
      "learning_rate": 3.0000397909912313e-05,
      "loss": 1.1011,
      "num_input_tokens_seen": 38837135440,
      "step": 49363
    },
    {
      "epoch": 5.2370040314025035,
      "grad_norm": 0.8693248013373636,
      "learning_rate": 2.9999716982639392e-05,
      "loss": 1.2007,
      "num_input_tokens_seen": 38837922160,
      "step": 49364
    },
    {
      "epoch": 5.237110120942075,
      "grad_norm": 0.6869351796912954,
      "learning_rate": 2.9999036051502832e-05,
      "loss": 1.0567,
      "num_input_tokens_seen": 38838708976,
      "step": 49365
    },
    {
      "epoch": 5.237216210481646,
      "grad_norm": 0.9958486401843203,
      "learning_rate": 2.9998355116503162e-05,
      "loss": 1.1848,
      "num_input_tokens_seen": 38839495680,
      "step": 49366
    },
    {
      "epoch": 5.2373223000212175,
      "grad_norm": 0.7341770667790107,
      "learning_rate": 2.9997674177640917e-05,
      "loss": 1.1178,
      "num_input_tokens_seen": 38840282448,
      "step": 49367
    },
    {
      "epoch": 5.237428389560789,
      "grad_norm": 0.7862590103058484,
      "learning_rate": 2.999699323491661e-05,
      "loss": 1.196,
      "num_input_tokens_seen": 38841069120,
      "step": 49368
    },
    {
      "epoch": 5.23753447910036,
      "grad_norm": 0.8579873320065321,
      "learning_rate": 2.999631228833077e-05,
      "loss": 1.1148,
      "num_input_tokens_seen": 38841855808,
      "step": 49369
    },
    {
      "epoch": 5.237640568639932,
      "grad_norm": 0.6221650738860285,
      "learning_rate": 2.9995631337883932e-05,
      "loss": 1.1018,
      "num_input_tokens_seen": 38842642592,
      "step": 49370
    },
    {
      "epoch": 5.237746658179503,
      "grad_norm": 0.5982278338062063,
      "learning_rate": 2.9994950383576614e-05,
      "loss": 1.0795,
      "num_input_tokens_seen": 38843429344,
      "step": 49371
    },
    {
      "epoch": 5.237852747719075,
      "grad_norm": 0.8010023100749201,
      "learning_rate": 2.9994269425409345e-05,
      "loss": 1.1909,
      "num_input_tokens_seen": 38844216048,
      "step": 49372
    },
    {
      "epoch": 5.237958837258646,
      "grad_norm": 0.6721042729331048,
      "learning_rate": 2.9993588463382656e-05,
      "loss": 1.1843,
      "num_input_tokens_seen": 38845002768,
      "step": 49373
    },
    {
      "epoch": 5.238064926798217,
      "grad_norm": 0.6745207260871064,
      "learning_rate": 2.9992907497497064e-05,
      "loss": 1.082,
      "num_input_tokens_seen": 38845789520,
      "step": 49374
    },
    {
      "epoch": 5.238171016337789,
      "grad_norm": 1.2537408991795214,
      "learning_rate": 2.99922265277531e-05,
      "loss": 1.3009,
      "num_input_tokens_seen": 38846576320,
      "step": 49375
    },
    {
      "epoch": 5.23827710587736,
      "grad_norm": 0.6637394696945568,
      "learning_rate": 2.999154555415129e-05,
      "loss": 1.1459,
      "num_input_tokens_seen": 38847363152,
      "step": 49376
    },
    {
      "epoch": 5.238383195416932,
      "grad_norm": 0.9252262708690787,
      "learning_rate": 2.9990864576692156e-05,
      "loss": 1.1357,
      "num_input_tokens_seen": 38848149904,
      "step": 49377
    },
    {
      "epoch": 5.238489284956503,
      "grad_norm": 0.7618280930602636,
      "learning_rate": 2.999018359537623e-05,
      "loss": 1.1141,
      "num_input_tokens_seen": 38848936624,
      "step": 49378
    },
    {
      "epoch": 5.238595374496074,
      "grad_norm": 0.7092616358052182,
      "learning_rate": 2.9989502610204047e-05,
      "loss": 1.2173,
      "num_input_tokens_seen": 38849723360,
      "step": 49379
    },
    {
      "epoch": 5.238701464035646,
      "grad_norm": 1.2324300266322983,
      "learning_rate": 2.9988821621176105e-05,
      "loss": 1.1428,
      "num_input_tokens_seen": 38850510160,
      "step": 49380
    },
    {
      "epoch": 5.238807553575217,
      "grad_norm": 0.6513322593874386,
      "learning_rate": 2.998814062829296e-05,
      "loss": 1.0791,
      "num_input_tokens_seen": 38851296912,
      "step": 49381
    },
    {
      "epoch": 5.238913643114789,
      "grad_norm": 0.9502912644445295,
      "learning_rate": 2.9987459631555126e-05,
      "loss": 1.1459,
      "num_input_tokens_seen": 38852083696,
      "step": 49382
    },
    {
      "epoch": 5.23901973265436,
      "grad_norm": 0.8977695436693857,
      "learning_rate": 2.9986778630963125e-05,
      "loss": 1.131,
      "num_input_tokens_seen": 38852870480,
      "step": 49383
    },
    {
      "epoch": 5.239125822193932,
      "grad_norm": 1.0111677684212044,
      "learning_rate": 2.9986097626517497e-05,
      "loss": 1.1203,
      "num_input_tokens_seen": 38853657344,
      "step": 49384
    },
    {
      "epoch": 5.239231911733503,
      "grad_norm": 0.9214560738586098,
      "learning_rate": 2.9985416618218746e-05,
      "loss": 1.1767,
      "num_input_tokens_seen": 38854444000,
      "step": 49385
    },
    {
      "epoch": 5.239338001273074,
      "grad_norm": 0.5634518054300302,
      "learning_rate": 2.9984735606067415e-05,
      "loss": 1.1523,
      "num_input_tokens_seen": 38855230720,
      "step": 49386
    },
    {
      "epoch": 5.239444090812646,
      "grad_norm": 1.6779846539152696,
      "learning_rate": 2.9984054590064033e-05,
      "loss": 1.1914,
      "num_input_tokens_seen": 38856017488,
      "step": 49387
    },
    {
      "epoch": 5.239550180352217,
      "grad_norm": 0.7132442596914912,
      "learning_rate": 2.9983373570209117e-05,
      "loss": 1.1415,
      "num_input_tokens_seen": 38856804256,
      "step": 49388
    },
    {
      "epoch": 5.239656269891789,
      "grad_norm": 0.5999948023237758,
      "learning_rate": 2.9982692546503193e-05,
      "loss": 1.2559,
      "num_input_tokens_seen": 38857591008,
      "step": 49389
    },
    {
      "epoch": 5.23976235943136,
      "grad_norm": 0.7123606830230379,
      "learning_rate": 2.9982011518946796e-05,
      "loss": 1.0496,
      "num_input_tokens_seen": 38858377696,
      "step": 49390
    },
    {
      "epoch": 5.239868448970931,
      "grad_norm": 0.6584708485061201,
      "learning_rate": 2.9981330487540444e-05,
      "loss": 1.1228,
      "num_input_tokens_seen": 38859164480,
      "step": 49391
    },
    {
      "epoch": 5.239974538510503,
      "grad_norm": 0.6395620216111894,
      "learning_rate": 2.998064945228466e-05,
      "loss": 1.1873,
      "num_input_tokens_seen": 38859951200,
      "step": 49392
    },
    {
      "epoch": 5.240080628050074,
      "grad_norm": 0.5998876366393961,
      "learning_rate": 2.997996841317998e-05,
      "loss": 1.1265,
      "num_input_tokens_seen": 38860737952,
      "step": 49393
    },
    {
      "epoch": 5.240186717589646,
      "grad_norm": 0.7351449777810274,
      "learning_rate": 2.9979287370226928e-05,
      "loss": 1.27,
      "num_input_tokens_seen": 38861524672,
      "step": 49394
    },
    {
      "epoch": 5.240292807129217,
      "grad_norm": 0.5877362395467473,
      "learning_rate": 2.9978606323426027e-05,
      "loss": 1.1612,
      "num_input_tokens_seen": 38862311472,
      "step": 49395
    },
    {
      "epoch": 5.240398896668789,
      "grad_norm": 0.5805722200732933,
      "learning_rate": 2.9977925272777814e-05,
      "loss": 1.1697,
      "num_input_tokens_seen": 38863098272,
      "step": 49396
    },
    {
      "epoch": 5.24050498620836,
      "grad_norm": 0.689896516118662,
      "learning_rate": 2.9977244218282795e-05,
      "loss": 1.2659,
      "num_input_tokens_seen": 38863885104,
      "step": 49397
    },
    {
      "epoch": 5.240611075747931,
      "grad_norm": 0.625110906140543,
      "learning_rate": 2.997656315994151e-05,
      "loss": 1.1277,
      "num_input_tokens_seen": 38864671936,
      "step": 49398
    },
    {
      "epoch": 5.240717165287503,
      "grad_norm": 0.850171872345607,
      "learning_rate": 2.9975882097754486e-05,
      "loss": 1.152,
      "num_input_tokens_seen": 38865458752,
      "step": 49399
    },
    {
      "epoch": 5.240823254827074,
      "grad_norm": 0.5644274272560424,
      "learning_rate": 2.9975201031722244e-05,
      "loss": 1.1639,
      "num_input_tokens_seen": 38866245488,
      "step": 49400
    },
    {
      "epoch": 5.240929344366646,
      "grad_norm": 0.7861409258881465,
      "learning_rate": 2.9974519961845317e-05,
      "loss": 1.1279,
      "num_input_tokens_seen": 38867032240,
      "step": 49401
    },
    {
      "epoch": 5.241035433906217,
      "grad_norm": 0.6056328582529531,
      "learning_rate": 2.997383888812422e-05,
      "loss": 1.1738,
      "num_input_tokens_seen": 38867818880,
      "step": 49402
    },
    {
      "epoch": 5.241141523445788,
      "grad_norm": 0.6668515497545104,
      "learning_rate": 2.9973157810559487e-05,
      "loss": 1.1195,
      "num_input_tokens_seen": 38868605712,
      "step": 49403
    },
    {
      "epoch": 5.24124761298536,
      "grad_norm": 0.7554216621310507,
      "learning_rate": 2.997247672915165e-05,
      "loss": 1.0983,
      "num_input_tokens_seen": 38869392480,
      "step": 49404
    },
    {
      "epoch": 5.241353702524931,
      "grad_norm": 0.6841815242955409,
      "learning_rate": 2.9971795643901222e-05,
      "loss": 1.2372,
      "num_input_tokens_seen": 38870179216,
      "step": 49405
    },
    {
      "epoch": 5.241459792064503,
      "grad_norm": 0.9503503979046188,
      "learning_rate": 2.997111455480874e-05,
      "loss": 1.1298,
      "num_input_tokens_seen": 38870965952,
      "step": 49406
    },
    {
      "epoch": 5.241565881604074,
      "grad_norm": 0.7267590270600356,
      "learning_rate": 2.9970433461874724e-05,
      "loss": 1.173,
      "num_input_tokens_seen": 38871752704,
      "step": 49407
    },
    {
      "epoch": 5.241671971143646,
      "grad_norm": 0.697412710471177,
      "learning_rate": 2.9969752365099712e-05,
      "loss": 1.1237,
      "num_input_tokens_seen": 38872539552,
      "step": 49408
    },
    {
      "epoch": 5.241778060683217,
      "grad_norm": 0.6451551859190741,
      "learning_rate": 2.996907126448421e-05,
      "loss": 1.1256,
      "num_input_tokens_seen": 38873326352,
      "step": 49409
    },
    {
      "epoch": 5.241884150222788,
      "grad_norm": 0.7971600846466455,
      "learning_rate": 2.9968390160028758e-05,
      "loss": 1.2366,
      "num_input_tokens_seen": 38874113072,
      "step": 49410
    },
    {
      "epoch": 5.24199023976236,
      "grad_norm": 0.5934254700644526,
      "learning_rate": 2.9967709051733888e-05,
      "loss": 1.1932,
      "num_input_tokens_seen": 38874899856,
      "step": 49411
    },
    {
      "epoch": 5.242096329301931,
      "grad_norm": 0.610050715217923,
      "learning_rate": 2.9967027939600106e-05,
      "loss": 1.0604,
      "num_input_tokens_seen": 38875686624,
      "step": 49412
    },
    {
      "epoch": 5.242202418841503,
      "grad_norm": 0.7144172276634326,
      "learning_rate": 2.996634682362796e-05,
      "loss": 1.2631,
      "num_input_tokens_seen": 38876473424,
      "step": 49413
    },
    {
      "epoch": 5.242308508381074,
      "grad_norm": 0.5779548061808001,
      "learning_rate": 2.9965665703817963e-05,
      "loss": 1.197,
      "num_input_tokens_seen": 38877260192,
      "step": 49414
    },
    {
      "epoch": 5.242414597920645,
      "grad_norm": 0.7036707812567806,
      "learning_rate": 2.9964984580170645e-05,
      "loss": 1.1568,
      "num_input_tokens_seen": 38878046976,
      "step": 49415
    },
    {
      "epoch": 5.242520687460217,
      "grad_norm": 1.0011258334642668,
      "learning_rate": 2.9964303452686532e-05,
      "loss": 1.1524,
      "num_input_tokens_seen": 38878833712,
      "step": 49416
    },
    {
      "epoch": 5.242626776999788,
      "grad_norm": 0.8676993967800898,
      "learning_rate": 2.996362232136616e-05,
      "loss": 1.1636,
      "num_input_tokens_seen": 38879620448,
      "step": 49417
    },
    {
      "epoch": 5.2427328665393595,
      "grad_norm": 0.8135526887783868,
      "learning_rate": 2.9962941186210032e-05,
      "loss": 1.0464,
      "num_input_tokens_seen": 38880407312,
      "step": 49418
    },
    {
      "epoch": 5.242838956078931,
      "grad_norm": 0.666055590199843,
      "learning_rate": 2.9962260047218692e-05,
      "loss": 1.1047,
      "num_input_tokens_seen": 38881194112,
      "step": 49419
    },
    {
      "epoch": 5.242945045618502,
      "grad_norm": 0.73059148527916,
      "learning_rate": 2.9961578904392668e-05,
      "loss": 1.1507,
      "num_input_tokens_seen": 38881980896,
      "step": 49420
    },
    {
      "epoch": 5.2430511351580735,
      "grad_norm": 0.5836518208387811,
      "learning_rate": 2.996089775773248e-05,
      "loss": 1.0753,
      "num_input_tokens_seen": 38882767728,
      "step": 49421
    },
    {
      "epoch": 5.243157224697645,
      "grad_norm": 0.5939678817616114,
      "learning_rate": 2.9960216607238657e-05,
      "loss": 1.1106,
      "num_input_tokens_seen": 38883554432,
      "step": 49422
    },
    {
      "epoch": 5.2432633142372165,
      "grad_norm": 0.5799307216785713,
      "learning_rate": 2.9959535452911718e-05,
      "loss": 1.1428,
      "num_input_tokens_seen": 38884341280,
      "step": 49423
    },
    {
      "epoch": 5.2433694037767875,
      "grad_norm": 0.656857011933039,
      "learning_rate": 2.99588542947522e-05,
      "loss": 1.1732,
      "num_input_tokens_seen": 38885127984,
      "step": 49424
    },
    {
      "epoch": 5.243475493316359,
      "grad_norm": 0.6933954985970758,
      "learning_rate": 2.995817313276063e-05,
      "loss": 1.098,
      "num_input_tokens_seen": 38885914864,
      "step": 49425
    },
    {
      "epoch": 5.2435815828559305,
      "grad_norm": 0.6259923759043814,
      "learning_rate": 2.9957491966937523e-05,
      "loss": 1.1275,
      "num_input_tokens_seen": 38886701584,
      "step": 49426
    },
    {
      "epoch": 5.2436876723955015,
      "grad_norm": 0.6410088863056809,
      "learning_rate": 2.9956810797283414e-05,
      "loss": 1.2186,
      "num_input_tokens_seen": 38887488288,
      "step": 49427
    },
    {
      "epoch": 5.243793761935073,
      "grad_norm": 0.5412823402357869,
      "learning_rate": 2.9956129623798822e-05,
      "loss": 1.0533,
      "num_input_tokens_seen": 38888275168,
      "step": 49428
    },
    {
      "epoch": 5.243899851474644,
      "grad_norm": 0.8263439164798396,
      "learning_rate": 2.995544844648428e-05,
      "loss": 1.1234,
      "num_input_tokens_seen": 38889061920,
      "step": 49429
    },
    {
      "epoch": 5.244005941014216,
      "grad_norm": 0.5909674831000306,
      "learning_rate": 2.995476726534032e-05,
      "loss": 1.1103,
      "num_input_tokens_seen": 38889848688,
      "step": 49430
    },
    {
      "epoch": 5.244112030553787,
      "grad_norm": 0.6381027023464441,
      "learning_rate": 2.9954086080367462e-05,
      "loss": 1.1321,
      "num_input_tokens_seen": 38890635424,
      "step": 49431
    },
    {
      "epoch": 5.244218120093358,
      "grad_norm": 0.6413565614407563,
      "learning_rate": 2.9953404891566217e-05,
      "loss": 1.1248,
      "num_input_tokens_seen": 38891422112,
      "step": 49432
    },
    {
      "epoch": 5.24432420963293,
      "grad_norm": 0.6685299322264614,
      "learning_rate": 2.995272369893714e-05,
      "loss": 1.1625,
      "num_input_tokens_seen": 38892208960,
      "step": 49433
    },
    {
      "epoch": 5.244430299172501,
      "grad_norm": 0.65250626488383,
      "learning_rate": 2.9952042502480736e-05,
      "loss": 1.1275,
      "num_input_tokens_seen": 38892995696,
      "step": 49434
    },
    {
      "epoch": 5.244536388712073,
      "grad_norm": 0.7541613133628793,
      "learning_rate": 2.995136130219754e-05,
      "loss": 1.0594,
      "num_input_tokens_seen": 38893782480,
      "step": 49435
    },
    {
      "epoch": 5.244642478251644,
      "grad_norm": 0.6430386868645475,
      "learning_rate": 2.995068009808808e-05,
      "loss": 1.2177,
      "num_input_tokens_seen": 38894569200,
      "step": 49436
    },
    {
      "epoch": 5.244748567791216,
      "grad_norm": 0.9178433341316212,
      "learning_rate": 2.9949998890152875e-05,
      "loss": 1.1568,
      "num_input_tokens_seen": 38895355984,
      "step": 49437
    },
    {
      "epoch": 5.244854657330787,
      "grad_norm": 0.7530108808808206,
      "learning_rate": 2.9949317678392463e-05,
      "loss": 1.1106,
      "num_input_tokens_seen": 38896142720,
      "step": 49438
    },
    {
      "epoch": 5.244960746870358,
      "grad_norm": 0.6656251332146801,
      "learning_rate": 2.9948636462807362e-05,
      "loss": 1.1392,
      "num_input_tokens_seen": 38896929424,
      "step": 49439
    },
    {
      "epoch": 5.24506683640993,
      "grad_norm": 1.2054911662112688,
      "learning_rate": 2.9947955243398094e-05,
      "loss": 1.2606,
      "num_input_tokens_seen": 38897716224,
      "step": 49440
    },
    {
      "epoch": 5.245172925949501,
      "grad_norm": 0.6261141038871136,
      "learning_rate": 2.9947274020165194e-05,
      "loss": 1.0771,
      "num_input_tokens_seen": 38898503072,
      "step": 49441
    },
    {
      "epoch": 5.245279015489073,
      "grad_norm": 0.7038065848517755,
      "learning_rate": 2.994659279310919e-05,
      "loss": 1.0546,
      "num_input_tokens_seen": 38899289856,
      "step": 49442
    },
    {
      "epoch": 5.245385105028644,
      "grad_norm": 0.6525433603065731,
      "learning_rate": 2.9945911562230598e-05,
      "loss": 1.1889,
      "num_input_tokens_seen": 38900076640,
      "step": 49443
    },
    {
      "epoch": 5.245491194568215,
      "grad_norm": 0.6537855597569794,
      "learning_rate": 2.994523032752996e-05,
      "loss": 1.0792,
      "num_input_tokens_seen": 38900863424,
      "step": 49444
    },
    {
      "epoch": 5.245597284107787,
      "grad_norm": 0.8168538639005983,
      "learning_rate": 2.994454908900779e-05,
      "loss": 1.2246,
      "num_input_tokens_seen": 38901650144,
      "step": 49445
    },
    {
      "epoch": 5.245703373647358,
      "grad_norm": 0.5756472352856867,
      "learning_rate": 2.994386784666461e-05,
      "loss": 1.1596,
      "num_input_tokens_seen": 38902436896,
      "step": 49446
    },
    {
      "epoch": 5.24580946318693,
      "grad_norm": 0.6688135439604341,
      "learning_rate": 2.9943186600500962e-05,
      "loss": 1.1388,
      "num_input_tokens_seen": 38903223712,
      "step": 49447
    },
    {
      "epoch": 5.245915552726501,
      "grad_norm": 0.534804864181656,
      "learning_rate": 2.994250535051736e-05,
      "loss": 1.0534,
      "num_input_tokens_seen": 38904010544,
      "step": 49448
    },
    {
      "epoch": 5.246021642266072,
      "grad_norm": 0.7039728689584045,
      "learning_rate": 2.9941824096714328e-05,
      "loss": 1.1379,
      "num_input_tokens_seen": 38904797296,
      "step": 49449
    },
    {
      "epoch": 5.246127731805644,
      "grad_norm": 0.6316076182892305,
      "learning_rate": 2.9941142839092405e-05,
      "loss": 1.1708,
      "num_input_tokens_seen": 38905584048,
      "step": 49450
    },
    {
      "epoch": 5.246233821345215,
      "grad_norm": 0.6471261247870409,
      "learning_rate": 2.994046157765212e-05,
      "loss": 1.1681,
      "num_input_tokens_seen": 38906370736,
      "step": 49451
    },
    {
      "epoch": 5.246339910884787,
      "grad_norm": 0.6640839225367687,
      "learning_rate": 2.9939780312393984e-05,
      "loss": 1.1676,
      "num_input_tokens_seen": 38907157600,
      "step": 49452
    },
    {
      "epoch": 5.246446000424358,
      "grad_norm": 0.65822284079692,
      "learning_rate": 2.993909904331853e-05,
      "loss": 1.2459,
      "num_input_tokens_seen": 38907944352,
      "step": 49453
    },
    {
      "epoch": 5.24655208996393,
      "grad_norm": 0.5826902246218385,
      "learning_rate": 2.9938417770426292e-05,
      "loss": 1.1252,
      "num_input_tokens_seen": 38908731168,
      "step": 49454
    },
    {
      "epoch": 5.246658179503501,
      "grad_norm": 0.8557837783237121,
      "learning_rate": 2.9937736493717776e-05,
      "loss": 1.2122,
      "num_input_tokens_seen": 38909517952,
      "step": 49455
    },
    {
      "epoch": 5.246764269043072,
      "grad_norm": 0.6095740796793202,
      "learning_rate": 2.9937055213193536e-05,
      "loss": 1.1251,
      "num_input_tokens_seen": 38910304736,
      "step": 49456
    },
    {
      "epoch": 5.246870358582644,
      "grad_norm": 0.7857608762521371,
      "learning_rate": 2.9936373928854083e-05,
      "loss": 1.1496,
      "num_input_tokens_seen": 38911091488,
      "step": 49457
    },
    {
      "epoch": 5.246976448122215,
      "grad_norm": 0.6934400224596486,
      "learning_rate": 2.9935692640699936e-05,
      "loss": 1.1158,
      "num_input_tokens_seen": 38911878304,
      "step": 49458
    },
    {
      "epoch": 5.247082537661787,
      "grad_norm": 0.5771165058163842,
      "learning_rate": 2.993501134873164e-05,
      "loss": 1.133,
      "num_input_tokens_seen": 38912665040,
      "step": 49459
    },
    {
      "epoch": 5.247188627201358,
      "grad_norm": 0.723855725243825,
      "learning_rate": 2.993433005294971e-05,
      "loss": 1.0997,
      "num_input_tokens_seen": 38913451792,
      "step": 49460
    },
    {
      "epoch": 5.247294716740929,
      "grad_norm": 0.7238157308524942,
      "learning_rate": 2.993364875335467e-05,
      "loss": 1.1712,
      "num_input_tokens_seen": 38914238512,
      "step": 49461
    },
    {
      "epoch": 5.247400806280501,
      "grad_norm": 0.7090011848930482,
      "learning_rate": 2.9932967449947052e-05,
      "loss": 1.1131,
      "num_input_tokens_seen": 38915025264,
      "step": 49462
    },
    {
      "epoch": 5.247506895820072,
      "grad_norm": 0.6835393335865506,
      "learning_rate": 2.9932286142727382e-05,
      "loss": 1.1618,
      "num_input_tokens_seen": 38915812064,
      "step": 49463
    },
    {
      "epoch": 5.247612985359644,
      "grad_norm": 0.6397985763668826,
      "learning_rate": 2.993160483169619e-05,
      "loss": 1.2457,
      "num_input_tokens_seen": 38916598800,
      "step": 49464
    },
    {
      "epoch": 5.247719074899215,
      "grad_norm": 0.6320812481224819,
      "learning_rate": 2.9930923516853997e-05,
      "loss": 1.1058,
      "num_input_tokens_seen": 38917385568,
      "step": 49465
    },
    {
      "epoch": 5.247825164438787,
      "grad_norm": 0.6504969993895379,
      "learning_rate": 2.9930242198201324e-05,
      "loss": 1.2044,
      "num_input_tokens_seen": 38918172304,
      "step": 49466
    },
    {
      "epoch": 5.247931253978358,
      "grad_norm": 0.6329761401888109,
      "learning_rate": 2.9929560875738717e-05,
      "loss": 1.1966,
      "num_input_tokens_seen": 38918959072,
      "step": 49467
    },
    {
      "epoch": 5.248037343517929,
      "grad_norm": 0.6114720686746137,
      "learning_rate": 2.992887954946668e-05,
      "loss": 1.1346,
      "num_input_tokens_seen": 38919745824,
      "step": 49468
    },
    {
      "epoch": 5.248143433057501,
      "grad_norm": 0.6018012655280078,
      "learning_rate": 2.992819821938575e-05,
      "loss": 1.0828,
      "num_input_tokens_seen": 38920532544,
      "step": 49469
    },
    {
      "epoch": 5.248249522597072,
      "grad_norm": 0.7007938416468672,
      "learning_rate": 2.992751688549646e-05,
      "loss": 1.2387,
      "num_input_tokens_seen": 38921319312,
      "step": 49470
    },
    {
      "epoch": 5.248355612136644,
      "grad_norm": 0.6291565606611583,
      "learning_rate": 2.9926835547799326e-05,
      "loss": 1.1598,
      "num_input_tokens_seen": 38922106128,
      "step": 49471
    },
    {
      "epoch": 5.248461701676215,
      "grad_norm": 0.5282204303361445,
      "learning_rate": 2.9926154206294877e-05,
      "loss": 1.1082,
      "num_input_tokens_seen": 38922892992,
      "step": 49472
    },
    {
      "epoch": 5.248567791215786,
      "grad_norm": 0.6954562137570682,
      "learning_rate": 2.9925472860983638e-05,
      "loss": 1.1492,
      "num_input_tokens_seen": 38923679872,
      "step": 49473
    },
    {
      "epoch": 5.248673880755358,
      "grad_norm": 0.8682642083001574,
      "learning_rate": 2.9924791511866148e-05,
      "loss": 1.1212,
      "num_input_tokens_seen": 38924466656,
      "step": 49474
    },
    {
      "epoch": 5.248779970294929,
      "grad_norm": 0.6395297241626988,
      "learning_rate": 2.9924110158942908e-05,
      "loss": 1.0482,
      "num_input_tokens_seen": 38925253488,
      "step": 49475
    },
    {
      "epoch": 5.248886059834501,
      "grad_norm": 0.7622529791067784,
      "learning_rate": 2.992342880221447e-05,
      "loss": 1.143,
      "num_input_tokens_seen": 38926040288,
      "step": 49476
    },
    {
      "epoch": 5.248992149374072,
      "grad_norm": 0.8083277575703076,
      "learning_rate": 2.9922747441681352e-05,
      "loss": 1.2159,
      "num_input_tokens_seen": 38926827040,
      "step": 49477
    },
    {
      "epoch": 5.249098238913643,
      "grad_norm": 0.664948760929146,
      "learning_rate": 2.9922066077344076e-05,
      "loss": 1.2402,
      "num_input_tokens_seen": 38927613760,
      "step": 49478
    },
    {
      "epoch": 5.249204328453215,
      "grad_norm": 1.0089204588305212,
      "learning_rate": 2.992138470920317e-05,
      "loss": 1.1957,
      "num_input_tokens_seen": 38928400480,
      "step": 49479
    },
    {
      "epoch": 5.249310417992786,
      "grad_norm": 0.560462993147639,
      "learning_rate": 2.9920703337259166e-05,
      "loss": 1.1472,
      "num_input_tokens_seen": 38929187264,
      "step": 49480
    },
    {
      "epoch": 5.249416507532358,
      "grad_norm": 0.6244143054435202,
      "learning_rate": 2.9920021961512583e-05,
      "loss": 1.1398,
      "num_input_tokens_seen": 38929973984,
      "step": 49481
    },
    {
      "epoch": 5.249522597071929,
      "grad_norm": 0.6612041027536637,
      "learning_rate": 2.991934058196396e-05,
      "loss": 1.1456,
      "num_input_tokens_seen": 38930760672,
      "step": 49482
    },
    {
      "epoch": 5.2496286866115005,
      "grad_norm": 0.5967198612551916,
      "learning_rate": 2.9918659198613807e-05,
      "loss": 1.0983,
      "num_input_tokens_seen": 38931547520,
      "step": 49483
    },
    {
      "epoch": 5.2497347761510715,
      "grad_norm": 0.6139477541086241,
      "learning_rate": 2.991797781146266e-05,
      "loss": 1.1664,
      "num_input_tokens_seen": 38932334240,
      "step": 49484
    },
    {
      "epoch": 5.249840865690643,
      "grad_norm": 0.7855429041441697,
      "learning_rate": 2.991729642051105e-05,
      "loss": 1.1395,
      "num_input_tokens_seen": 38933121024,
      "step": 49485
    },
    {
      "epoch": 5.2499469552302145,
      "grad_norm": 0.9355470600378271,
      "learning_rate": 2.9916615025759487e-05,
      "loss": 1.1029,
      "num_input_tokens_seen": 38933907728,
      "step": 49486
    },
    {
      "epoch": 5.2500530447697855,
      "grad_norm": 0.7038891144281341,
      "learning_rate": 2.9915933627208514e-05,
      "loss": 1.1872,
      "num_input_tokens_seen": 38934694592,
      "step": 49487
    },
    {
      "epoch": 5.250159134309357,
      "grad_norm": 0.8277797748694203,
      "learning_rate": 2.9915252224858652e-05,
      "loss": 1.1295,
      "num_input_tokens_seen": 38935481392,
      "step": 49488
    },
    {
      "epoch": 5.2502652238489285,
      "grad_norm": 0.5457954831980268,
      "learning_rate": 2.9914570818710423e-05,
      "loss": 1.1492,
      "num_input_tokens_seen": 38936268208,
      "step": 49489
    },
    {
      "epoch": 5.2503713133884995,
      "grad_norm": 0.6387066354222088,
      "learning_rate": 2.9913889408764363e-05,
      "loss": 1.0986,
      "num_input_tokens_seen": 38937054944,
      "step": 49490
    },
    {
      "epoch": 5.250477402928071,
      "grad_norm": 0.7056923493542798,
      "learning_rate": 2.9913207995020993e-05,
      "loss": 1.1846,
      "num_input_tokens_seen": 38937841680,
      "step": 49491
    },
    {
      "epoch": 5.250583492467642,
      "grad_norm": 0.6997450173304628,
      "learning_rate": 2.9912526577480836e-05,
      "loss": 1.1581,
      "num_input_tokens_seen": 38938628496,
      "step": 49492
    },
    {
      "epoch": 5.250689582007214,
      "grad_norm": 0.6849296944480527,
      "learning_rate": 2.9911845156144425e-05,
      "loss": 1.1685,
      "num_input_tokens_seen": 38939415264,
      "step": 49493
    },
    {
      "epoch": 5.250795671546785,
      "grad_norm": 0.5951514244869212,
      "learning_rate": 2.9911163731012288e-05,
      "loss": 1.1037,
      "num_input_tokens_seen": 38940202080,
      "step": 49494
    },
    {
      "epoch": 5.250901761086357,
      "grad_norm": 0.6516519418860528,
      "learning_rate": 2.991048230208494e-05,
      "loss": 1.1884,
      "num_input_tokens_seen": 38940988848,
      "step": 49495
    },
    {
      "epoch": 5.251007850625928,
      "grad_norm": 1.0798598262535406,
      "learning_rate": 2.990980086936292e-05,
      "loss": 1.2496,
      "num_input_tokens_seen": 38941775536,
      "step": 49496
    },
    {
      "epoch": 5.251113940165499,
      "grad_norm": 0.7373905726131179,
      "learning_rate": 2.9909119432846748e-05,
      "loss": 1.1694,
      "num_input_tokens_seen": 38942562288,
      "step": 49497
    },
    {
      "epoch": 5.251220029705071,
      "grad_norm": 1.172552354996885,
      "learning_rate": 2.9908437992536952e-05,
      "loss": 1.1999,
      "num_input_tokens_seen": 38943348944,
      "step": 49498
    },
    {
      "epoch": 5.251326119244642,
      "grad_norm": 0.6636618794910385,
      "learning_rate": 2.9907756548434062e-05,
      "loss": 1.1232,
      "num_input_tokens_seen": 38944135776,
      "step": 49499
    },
    {
      "epoch": 5.251432208784214,
      "grad_norm": 0.8522829390840208,
      "learning_rate": 2.99070751005386e-05,
      "loss": 1.2216,
      "num_input_tokens_seen": 38944922608,
      "step": 49500
    },
    {
      "epoch": 5.251538298323785,
      "grad_norm": 1.0868419012912105,
      "learning_rate": 2.9906393648851093e-05,
      "loss": 1.0931,
      "num_input_tokens_seen": 38945709392,
      "step": 49501
    },
    {
      "epoch": 5.251644387863356,
      "grad_norm": 0.6955833522314103,
      "learning_rate": 2.9905712193372076e-05,
      "loss": 1.1737,
      "num_input_tokens_seen": 38946496192,
      "step": 49502
    },
    {
      "epoch": 5.251750477402928,
      "grad_norm": 0.9691195957491064,
      "learning_rate": 2.9905030734102064e-05,
      "loss": 1.0498,
      "num_input_tokens_seen": 38947282976,
      "step": 49503
    },
    {
      "epoch": 5.251856566942499,
      "grad_norm": 0.9031718667160339,
      "learning_rate": 2.9904349271041583e-05,
      "loss": 1.1239,
      "num_input_tokens_seen": 38948069856,
      "step": 49504
    },
    {
      "epoch": 5.251962656482071,
      "grad_norm": 0.6262144610246735,
      "learning_rate": 2.9903667804191172e-05,
      "loss": 1.212,
      "num_input_tokens_seen": 38948856608,
      "step": 49505
    },
    {
      "epoch": 5.252068746021642,
      "grad_norm": 0.8958550647810083,
      "learning_rate": 2.9902986333551346e-05,
      "loss": 1.087,
      "num_input_tokens_seen": 38949643344,
      "step": 49506
    },
    {
      "epoch": 5.252174835561213,
      "grad_norm": 0.9487665837921374,
      "learning_rate": 2.9902304859122636e-05,
      "loss": 1.1381,
      "num_input_tokens_seen": 38950430112,
      "step": 49507
    },
    {
      "epoch": 5.252280925100785,
      "grad_norm": 0.8164158635525346,
      "learning_rate": 2.9901623380905575e-05,
      "loss": 1.0999,
      "num_input_tokens_seen": 38951216992,
      "step": 49508
    },
    {
      "epoch": 5.252387014640356,
      "grad_norm": 1.1731015657789685,
      "learning_rate": 2.9900941898900673e-05,
      "loss": 1.1619,
      "num_input_tokens_seen": 38952003824,
      "step": 49509
    },
    {
      "epoch": 5.252493104179928,
      "grad_norm": 0.7941526726030868,
      "learning_rate": 2.9900260413108478e-05,
      "loss": 1.2336,
      "num_input_tokens_seen": 38952790624,
      "step": 49510
    },
    {
      "epoch": 5.252599193719499,
      "grad_norm": 0.8499165238822737,
      "learning_rate": 2.9899578923529503e-05,
      "loss": 1.1026,
      "num_input_tokens_seen": 38953577360,
      "step": 49511
    },
    {
      "epoch": 5.252705283259071,
      "grad_norm": 1.148415597417168,
      "learning_rate": 2.9898897430164267e-05,
      "loss": 1.1299,
      "num_input_tokens_seen": 38954364128,
      "step": 49512
    },
    {
      "epoch": 5.252811372798642,
      "grad_norm": 0.7050397510722363,
      "learning_rate": 2.989821593301332e-05,
      "loss": 1.0767,
      "num_input_tokens_seen": 38955150928,
      "step": 49513
    },
    {
      "epoch": 5.252917462338213,
      "grad_norm": 0.9943160760412418,
      "learning_rate": 2.9897534432077174e-05,
      "loss": 1.1458,
      "num_input_tokens_seen": 38955937792,
      "step": 49514
    },
    {
      "epoch": 5.253023551877785,
      "grad_norm": 0.9459942758704071,
      "learning_rate": 2.9896852927356343e-05,
      "loss": 1.2623,
      "num_input_tokens_seen": 38956724576,
      "step": 49515
    },
    {
      "epoch": 5.253129641417356,
      "grad_norm": 0.6517711437642235,
      "learning_rate": 2.9896171418851383e-05,
      "loss": 1.1297,
      "num_input_tokens_seen": 38957511408,
      "step": 49516
    },
    {
      "epoch": 5.253235730956928,
      "grad_norm": 0.7784437929625546,
      "learning_rate": 2.98954899065628e-05,
      "loss": 1.0936,
      "num_input_tokens_seen": 38958298272,
      "step": 49517
    },
    {
      "epoch": 5.253341820496499,
      "grad_norm": 0.7064134250563955,
      "learning_rate": 2.9894808390491126e-05,
      "loss": 1.254,
      "num_input_tokens_seen": 38959084928,
      "step": 49518
    },
    {
      "epoch": 5.25344791003607,
      "grad_norm": 0.6975309428259266,
      "learning_rate": 2.989412687063689e-05,
      "loss": 1.1251,
      "num_input_tokens_seen": 38959871632,
      "step": 49519
    },
    {
      "epoch": 5.253553999575642,
      "grad_norm": 0.7437100729556337,
      "learning_rate": 2.9893445347000613e-05,
      "loss": 1.1841,
      "num_input_tokens_seen": 38960658416,
      "step": 49520
    },
    {
      "epoch": 5.253660089115213,
      "grad_norm": 0.6962786002285349,
      "learning_rate": 2.9892763819582827e-05,
      "loss": 1.2367,
      "num_input_tokens_seen": 38961445296,
      "step": 49521
    },
    {
      "epoch": 5.253766178654785,
      "grad_norm": 0.7503022725405889,
      "learning_rate": 2.9892082288384055e-05,
      "loss": 1.1932,
      "num_input_tokens_seen": 38962231984,
      "step": 49522
    },
    {
      "epoch": 5.253872268194356,
      "grad_norm": 0.6330682141635233,
      "learning_rate": 2.9891400753404825e-05,
      "loss": 1.1747,
      "num_input_tokens_seen": 38963018752,
      "step": 49523
    },
    {
      "epoch": 5.253978357733928,
      "grad_norm": 0.5501606876030168,
      "learning_rate": 2.9890719214645667e-05,
      "loss": 1.1198,
      "num_input_tokens_seen": 38963805616,
      "step": 49524
    },
    {
      "epoch": 5.254084447273499,
      "grad_norm": 0.6233568384021311,
      "learning_rate": 2.9890037672107106e-05,
      "loss": 1.1694,
      "num_input_tokens_seen": 38964592336,
      "step": 49525
    },
    {
      "epoch": 5.25419053681307,
      "grad_norm": 0.7126630957714566,
      "learning_rate": 2.988935612578966e-05,
      "loss": 1.2354,
      "num_input_tokens_seen": 38965379056,
      "step": 49526
    },
    {
      "epoch": 5.254296626352642,
      "grad_norm": 0.7053654516728314,
      "learning_rate": 2.988867457569387e-05,
      "loss": 1.1936,
      "num_input_tokens_seen": 38966165856,
      "step": 49527
    },
    {
      "epoch": 5.254402715892213,
      "grad_norm": 0.6696700050884699,
      "learning_rate": 2.9887993021820253e-05,
      "loss": 1.1318,
      "num_input_tokens_seen": 38966952656,
      "step": 49528
    },
    {
      "epoch": 5.254508805431785,
      "grad_norm": 0.6518534982088334,
      "learning_rate": 2.9887311464169336e-05,
      "loss": 1.1538,
      "num_input_tokens_seen": 38967739392,
      "step": 49529
    },
    {
      "epoch": 5.254614894971356,
      "grad_norm": 0.6713857621776341,
      "learning_rate": 2.9886629902741652e-05,
      "loss": 1.1974,
      "num_input_tokens_seen": 38968526128,
      "step": 49530
    },
    {
      "epoch": 5.254720984510927,
      "grad_norm": 0.9357614840732135,
      "learning_rate": 2.988594833753773e-05,
      "loss": 1.1738,
      "num_input_tokens_seen": 38969312800,
      "step": 49531
    },
    {
      "epoch": 5.254827074050499,
      "grad_norm": 0.7104082081943516,
      "learning_rate": 2.9885266768558072e-05,
      "loss": 1.1644,
      "num_input_tokens_seen": 38970099648,
      "step": 49532
    },
    {
      "epoch": 5.25493316359007,
      "grad_norm": 0.8408704289844374,
      "learning_rate": 2.9884585195803237e-05,
      "loss": 1.2233,
      "num_input_tokens_seen": 38970886464,
      "step": 49533
    },
    {
      "epoch": 5.255039253129642,
      "grad_norm": 0.8192408680622566,
      "learning_rate": 2.9883903619273738e-05,
      "loss": 1.193,
      "num_input_tokens_seen": 38971673232,
      "step": 49534
    },
    {
      "epoch": 5.255145342669213,
      "grad_norm": 0.6461756003704391,
      "learning_rate": 2.9883222038970094e-05,
      "loss": 1.1682,
      "num_input_tokens_seen": 38972460016,
      "step": 49535
    },
    {
      "epoch": 5.255251432208784,
      "grad_norm": 0.7209598916950586,
      "learning_rate": 2.9882540454892847e-05,
      "loss": 1.1046,
      "num_input_tokens_seen": 38973246784,
      "step": 49536
    },
    {
      "epoch": 5.255357521748356,
      "grad_norm": 1.2866954894882257,
      "learning_rate": 2.9881858867042516e-05,
      "loss": 1.3299,
      "num_input_tokens_seen": 38974033536,
      "step": 49537
    },
    {
      "epoch": 5.255463611287927,
      "grad_norm": 0.6045047046999485,
      "learning_rate": 2.988117727541962e-05,
      "loss": 1.1104,
      "num_input_tokens_seen": 38974820288,
      "step": 49538
    },
    {
      "epoch": 5.255569700827499,
      "grad_norm": 1.091830204201134,
      "learning_rate": 2.98804956800247e-05,
      "loss": 1.2282,
      "num_input_tokens_seen": 38975606960,
      "step": 49539
    },
    {
      "epoch": 5.25567579036707,
      "grad_norm": 0.6159990799754249,
      "learning_rate": 2.987981408085827e-05,
      "loss": 1.153,
      "num_input_tokens_seen": 38976393744,
      "step": 49540
    },
    {
      "epoch": 5.255781879906642,
      "grad_norm": 1.0212092519146094,
      "learning_rate": 2.987913247792087e-05,
      "loss": 1.231,
      "num_input_tokens_seen": 38977180496,
      "step": 49541
    },
    {
      "epoch": 5.255887969446213,
      "grad_norm": 0.6791732626074076,
      "learning_rate": 2.987845087121302e-05,
      "loss": 1.2484,
      "num_input_tokens_seen": 38977967216,
      "step": 49542
    },
    {
      "epoch": 5.255994058985784,
      "grad_norm": 0.6876571621487754,
      "learning_rate": 2.987776926073524e-05,
      "loss": 1.1249,
      "num_input_tokens_seen": 38978754048,
      "step": 49543
    },
    {
      "epoch": 5.256100148525356,
      "grad_norm": 0.8549225863912495,
      "learning_rate": 2.987708764648806e-05,
      "loss": 1.2146,
      "num_input_tokens_seen": 38979540768,
      "step": 49544
    },
    {
      "epoch": 5.256206238064927,
      "grad_norm": 0.8320588602691689,
      "learning_rate": 2.9876406028472014e-05,
      "loss": 1.1581,
      "num_input_tokens_seen": 38980327504,
      "step": 49545
    },
    {
      "epoch": 5.2563123276044985,
      "grad_norm": 0.6298251788036239,
      "learning_rate": 2.987572440668763e-05,
      "loss": 1.0329,
      "num_input_tokens_seen": 38981114256,
      "step": 49546
    },
    {
      "epoch": 5.2564184171440695,
      "grad_norm": 0.7384745624519264,
      "learning_rate": 2.9875042781135427e-05,
      "loss": 1.1365,
      "num_input_tokens_seen": 38981900976,
      "step": 49547
    },
    {
      "epoch": 5.2565245066836415,
      "grad_norm": 0.690611854906704,
      "learning_rate": 2.9874361151815934e-05,
      "loss": 1.0754,
      "num_input_tokens_seen": 38982687840,
      "step": 49548
    },
    {
      "epoch": 5.2566305962232125,
      "grad_norm": 0.7077408005876914,
      "learning_rate": 2.9873679518729676e-05,
      "loss": 1.1205,
      "num_input_tokens_seen": 38983474656,
      "step": 49549
    },
    {
      "epoch": 5.2567366857627835,
      "grad_norm": 0.7464413433869254,
      "learning_rate": 2.987299788187718e-05,
      "loss": 1.1807,
      "num_input_tokens_seen": 38984261440,
      "step": 49550
    },
    {
      "epoch": 5.256842775302355,
      "grad_norm": 0.7448013671142231,
      "learning_rate": 2.9872316241258974e-05,
      "loss": 1.2067,
      "num_input_tokens_seen": 38985048240,
      "step": 49551
    },
    {
      "epoch": 5.2569488648419265,
      "grad_norm": 0.7483386761043346,
      "learning_rate": 2.9871634596875587e-05,
      "loss": 1.1279,
      "num_input_tokens_seen": 38985835088,
      "step": 49552
    },
    {
      "epoch": 5.257054954381498,
      "grad_norm": 0.8165379422058253,
      "learning_rate": 2.9870952948727545e-05,
      "loss": 1.18,
      "num_input_tokens_seen": 38986621856,
      "step": 49553
    },
    {
      "epoch": 5.257161043921069,
      "grad_norm": 0.696694270078672,
      "learning_rate": 2.9870271296815373e-05,
      "loss": 1.1144,
      "num_input_tokens_seen": 38987408624,
      "step": 49554
    },
    {
      "epoch": 5.2572671334606405,
      "grad_norm": 0.9196820678532354,
      "learning_rate": 2.9869589641139596e-05,
      "loss": 1.1133,
      "num_input_tokens_seen": 38988195520,
      "step": 49555
    },
    {
      "epoch": 5.257373223000212,
      "grad_norm": 0.564146411006945,
      "learning_rate": 2.9868907981700744e-05,
      "loss": 1.1662,
      "num_input_tokens_seen": 38988982272,
      "step": 49556
    },
    {
      "epoch": 5.257479312539783,
      "grad_norm": 0.9551467428091247,
      "learning_rate": 2.9868226318499344e-05,
      "loss": 1.214,
      "num_input_tokens_seen": 38989769008,
      "step": 49557
    },
    {
      "epoch": 5.257585402079355,
      "grad_norm": 0.6754481378969983,
      "learning_rate": 2.9867544651535915e-05,
      "loss": 1.2278,
      "num_input_tokens_seen": 38990555792,
      "step": 49558
    },
    {
      "epoch": 5.257691491618926,
      "grad_norm": 0.7428821202379543,
      "learning_rate": 2.9866862980811e-05,
      "loss": 1.101,
      "num_input_tokens_seen": 38991342592,
      "step": 49559
    },
    {
      "epoch": 5.257797581158497,
      "grad_norm": 0.7656965417844589,
      "learning_rate": 2.9866181306325115e-05,
      "loss": 1.1256,
      "num_input_tokens_seen": 38992129424,
      "step": 49560
    },
    {
      "epoch": 5.257903670698069,
      "grad_norm": 0.6330592194798932,
      "learning_rate": 2.986549962807878e-05,
      "loss": 1.1107,
      "num_input_tokens_seen": 38992916160,
      "step": 49561
    },
    {
      "epoch": 5.25800976023764,
      "grad_norm": 0.7448776507313378,
      "learning_rate": 2.9864817946072538e-05,
      "loss": 1.1761,
      "num_input_tokens_seen": 38993702928,
      "step": 49562
    },
    {
      "epoch": 5.258115849777212,
      "grad_norm": 1.2003336413926078,
      "learning_rate": 2.986413626030691e-05,
      "loss": 1.201,
      "num_input_tokens_seen": 38994489744,
      "step": 49563
    },
    {
      "epoch": 5.258221939316783,
      "grad_norm": 0.7562078356401735,
      "learning_rate": 2.9863454570782405e-05,
      "loss": 1.1813,
      "num_input_tokens_seen": 38995276448,
      "step": 49564
    },
    {
      "epoch": 5.258328028856354,
      "grad_norm": 0.7448321457888438,
      "learning_rate": 2.986277287749958e-05,
      "loss": 1.1939,
      "num_input_tokens_seen": 38996063200,
      "step": 49565
    },
    {
      "epoch": 5.258434118395926,
      "grad_norm": 1.6242929011495189,
      "learning_rate": 2.9862091180458935e-05,
      "loss": 1.1568,
      "num_input_tokens_seen": 38996849952,
      "step": 49566
    },
    {
      "epoch": 5.258540207935497,
      "grad_norm": 1.221655888079276,
      "learning_rate": 2.986140947966102e-05,
      "loss": 1.1485,
      "num_input_tokens_seen": 38997636640,
      "step": 49567
    },
    {
      "epoch": 5.258646297475069,
      "grad_norm": 0.7361958093139227,
      "learning_rate": 2.9860727775106346e-05,
      "loss": 1.1685,
      "num_input_tokens_seen": 38998423552,
      "step": 49568
    },
    {
      "epoch": 5.25875238701464,
      "grad_norm": 1.0048795732647482,
      "learning_rate": 2.9860046066795437e-05,
      "loss": 1.084,
      "num_input_tokens_seen": 38999210368,
      "step": 49569
    },
    {
      "epoch": 5.258858476554212,
      "grad_norm": 1.1331610839741142,
      "learning_rate": 2.9859364354728835e-05,
      "loss": 1.2524,
      "num_input_tokens_seen": 38999997056,
      "step": 49570
    },
    {
      "epoch": 5.258964566093783,
      "grad_norm": 0.6930034913542731,
      "learning_rate": 2.985868263890706e-05,
      "loss": 1.2373,
      "num_input_tokens_seen": 39000783712,
      "step": 49571
    },
    {
      "epoch": 5.259070655633354,
      "grad_norm": 1.091278175007493,
      "learning_rate": 2.9858000919330632e-05,
      "loss": 1.1041,
      "num_input_tokens_seen": 39001570416,
      "step": 49572
    },
    {
      "epoch": 5.259176745172926,
      "grad_norm": 1.4246760407651053,
      "learning_rate": 2.985731919600008e-05,
      "loss": 1.1901,
      "num_input_tokens_seen": 39002357312,
      "step": 49573
    },
    {
      "epoch": 5.259282834712497,
      "grad_norm": 1.0620621792343836,
      "learning_rate": 2.9856637468915948e-05,
      "loss": 1.2345,
      "num_input_tokens_seen": 39003144000,
      "step": 49574
    },
    {
      "epoch": 5.259388924252069,
      "grad_norm": 1.2627866521043776,
      "learning_rate": 2.985595573807874e-05,
      "loss": 1.1831,
      "num_input_tokens_seen": 39003930800,
      "step": 49575
    },
    {
      "epoch": 5.25949501379164,
      "grad_norm": 0.6758397360849002,
      "learning_rate": 2.985527400348899e-05,
      "loss": 1.1702,
      "num_input_tokens_seen": 39004717568,
      "step": 49576
    },
    {
      "epoch": 5.259601103331212,
      "grad_norm": 1.1202185766265471,
      "learning_rate": 2.9854592265147237e-05,
      "loss": 1.2971,
      "num_input_tokens_seen": 39005504464,
      "step": 49577
    },
    {
      "epoch": 5.259707192870783,
      "grad_norm": 0.7256830798733781,
      "learning_rate": 2.9853910523053985e-05,
      "loss": 1.19,
      "num_input_tokens_seen": 39006291200,
      "step": 49578
    },
    {
      "epoch": 5.259813282410354,
      "grad_norm": 0.5785058303237663,
      "learning_rate": 2.985322877720978e-05,
      "loss": 1.2145,
      "num_input_tokens_seen": 39007077952,
      "step": 49579
    },
    {
      "epoch": 5.259919371949926,
      "grad_norm": 0.595599534939634,
      "learning_rate": 2.9852547027615142e-05,
      "loss": 1.1631,
      "num_input_tokens_seen": 39007864832,
      "step": 49580
    },
    {
      "epoch": 5.260025461489497,
      "grad_norm": 0.6349709035858309,
      "learning_rate": 2.9851865274270595e-05,
      "loss": 1.1728,
      "num_input_tokens_seen": 39008651504,
      "step": 49581
    },
    {
      "epoch": 5.260131551029069,
      "grad_norm": 0.7965421307876688,
      "learning_rate": 2.9851183517176674e-05,
      "loss": 1.0614,
      "num_input_tokens_seen": 39009438336,
      "step": 49582
    },
    {
      "epoch": 5.26023764056864,
      "grad_norm": 0.6029501610636163,
      "learning_rate": 2.9850501756333894e-05,
      "loss": 1.1791,
      "num_input_tokens_seen": 39010225136,
      "step": 49583
    },
    {
      "epoch": 5.260343730108211,
      "grad_norm": 0.9223090323756327,
      "learning_rate": 2.9849819991742796e-05,
      "loss": 1.1476,
      "num_input_tokens_seen": 39011011888,
      "step": 49584
    },
    {
      "epoch": 5.260449819647783,
      "grad_norm": 0.6010367253744685,
      "learning_rate": 2.9849138223403895e-05,
      "loss": 1.1308,
      "num_input_tokens_seen": 39011798736,
      "step": 49585
    },
    {
      "epoch": 5.260555909187354,
      "grad_norm": 0.9671135129842973,
      "learning_rate": 2.9848456451317718e-05,
      "loss": 1.1753,
      "num_input_tokens_seen": 39012585424,
      "step": 49586
    },
    {
      "epoch": 5.260661998726926,
      "grad_norm": 0.8245404902530712,
      "learning_rate": 2.9847774675484802e-05,
      "loss": 1.2071,
      "num_input_tokens_seen": 39013372128,
      "step": 49587
    },
    {
      "epoch": 5.260768088266497,
      "grad_norm": 0.5700860326719162,
      "learning_rate": 2.984709289590567e-05,
      "loss": 1.1471,
      "num_input_tokens_seen": 39014158912,
      "step": 49588
    },
    {
      "epoch": 5.260874177806068,
      "grad_norm": 1.0828910738690138,
      "learning_rate": 2.9846411112580843e-05,
      "loss": 1.1244,
      "num_input_tokens_seen": 39014945792,
      "step": 49589
    },
    {
      "epoch": 5.26098026734564,
      "grad_norm": 0.9657886301363163,
      "learning_rate": 2.9845729325510852e-05,
      "loss": 1.1332,
      "num_input_tokens_seen": 39015732544,
      "step": 49590
    },
    {
      "epoch": 5.261086356885211,
      "grad_norm": 0.772391231216955,
      "learning_rate": 2.9845047534696224e-05,
      "loss": 1.2507,
      "num_input_tokens_seen": 39016519232,
      "step": 49591
    },
    {
      "epoch": 5.261192446424783,
      "grad_norm": 1.213893533377435,
      "learning_rate": 2.9844365740137487e-05,
      "loss": 1.2174,
      "num_input_tokens_seen": 39017306064,
      "step": 49592
    },
    {
      "epoch": 5.261298535964354,
      "grad_norm": 0.7668202803284535,
      "learning_rate": 2.984368394183516e-05,
      "loss": 1.135,
      "num_input_tokens_seen": 39018092800,
      "step": 49593
    },
    {
      "epoch": 5.261404625503925,
      "grad_norm": 0.6570119852107983,
      "learning_rate": 2.9843002139789782e-05,
      "loss": 1.0639,
      "num_input_tokens_seen": 39018879552,
      "step": 49594
    },
    {
      "epoch": 5.261510715043497,
      "grad_norm": 0.881170820468345,
      "learning_rate": 2.984232033400187e-05,
      "loss": 1.182,
      "num_input_tokens_seen": 39019666320,
      "step": 49595
    },
    {
      "epoch": 5.261616804583068,
      "grad_norm": 0.9281348762781365,
      "learning_rate": 2.984163852447196e-05,
      "loss": 1.2147,
      "num_input_tokens_seen": 39020453184,
      "step": 49596
    },
    {
      "epoch": 5.26172289412264,
      "grad_norm": 0.6383477209017253,
      "learning_rate": 2.9840956711200573e-05,
      "loss": 1.1562,
      "num_input_tokens_seen": 39021240032,
      "step": 49597
    },
    {
      "epoch": 5.261828983662211,
      "grad_norm": 1.1786046676132595,
      "learning_rate": 2.9840274894188232e-05,
      "loss": 1.1922,
      "num_input_tokens_seen": 39022026688,
      "step": 49598
    },
    {
      "epoch": 5.261935073201783,
      "grad_norm": 0.7248216283023882,
      "learning_rate": 2.9839593073435472e-05,
      "loss": 1.1626,
      "num_input_tokens_seen": 39022813408,
      "step": 49599
    },
    {
      "epoch": 5.262041162741354,
      "grad_norm": 0.642057972781513,
      "learning_rate": 2.983891124894282e-05,
      "loss": 1.1956,
      "num_input_tokens_seen": 39023600112,
      "step": 49600
    },
    {
      "epoch": 5.262147252280925,
      "grad_norm": 0.7411546390335472,
      "learning_rate": 2.9838229420710793e-05,
      "loss": 1.2312,
      "num_input_tokens_seen": 39024386912,
      "step": 49601
    },
    {
      "epoch": 5.262253341820497,
      "grad_norm": 0.8584714767002438,
      "learning_rate": 2.983754758873993e-05,
      "loss": 1.1774,
      "num_input_tokens_seen": 39025173632,
      "step": 49602
    },
    {
      "epoch": 5.262359431360068,
      "grad_norm": 0.620317276575611,
      "learning_rate": 2.9836865753030752e-05,
      "loss": 1.2787,
      "num_input_tokens_seen": 39025960368,
      "step": 49603
    },
    {
      "epoch": 5.26246552089964,
      "grad_norm": 0.6296052877315342,
      "learning_rate": 2.983618391358378e-05,
      "loss": 1.1825,
      "num_input_tokens_seen": 39026747136,
      "step": 49604
    },
    {
      "epoch": 5.262571610439211,
      "grad_norm": 0.6343541085030666,
      "learning_rate": 2.9835502070399552e-05,
      "loss": 1.199,
      "num_input_tokens_seen": 39027533824,
      "step": 49605
    },
    {
      "epoch": 5.2626776999787825,
      "grad_norm": 0.57775535036304,
      "learning_rate": 2.9834820223478587e-05,
      "loss": 1.1116,
      "num_input_tokens_seen": 39028320592,
      "step": 49606
    },
    {
      "epoch": 5.262783789518354,
      "grad_norm": 0.6529004482484622,
      "learning_rate": 2.9834138372821413e-05,
      "loss": 1.2581,
      "num_input_tokens_seen": 39029107408,
      "step": 49607
    },
    {
      "epoch": 5.262889879057925,
      "grad_norm": 0.5833210600605501,
      "learning_rate": 2.9833456518428566e-05,
      "loss": 1.1579,
      "num_input_tokens_seen": 39029894064,
      "step": 49608
    },
    {
      "epoch": 5.2629959685974965,
      "grad_norm": 0.7012667928616768,
      "learning_rate": 2.9832774660300555e-05,
      "loss": 1.1973,
      "num_input_tokens_seen": 39030680848,
      "step": 49609
    },
    {
      "epoch": 5.2631020581370676,
      "grad_norm": 0.9761356151323779,
      "learning_rate": 2.983209279843793e-05,
      "loss": 1.1317,
      "num_input_tokens_seen": 39031467632,
      "step": 49610
    },
    {
      "epoch": 5.2632081476766395,
      "grad_norm": 0.8189856183646317,
      "learning_rate": 2.9831410932841198e-05,
      "loss": 1.2022,
      "num_input_tokens_seen": 39032254384,
      "step": 49611
    },
    {
      "epoch": 5.2633142372162105,
      "grad_norm": 0.55285789022004,
      "learning_rate": 2.983072906351089e-05,
      "loss": 1.1755,
      "num_input_tokens_seen": 39033041184,
      "step": 49612
    },
    {
      "epoch": 5.2634203267557815,
      "grad_norm": 0.4964746751647092,
      "learning_rate": 2.9830047190447548e-05,
      "loss": 1.078,
      "num_input_tokens_seen": 39033827968,
      "step": 49613
    },
    {
      "epoch": 5.2635264162953534,
      "grad_norm": 0.7712387716252983,
      "learning_rate": 2.982936531365168e-05,
      "loss": 1.1094,
      "num_input_tokens_seen": 39034614720,
      "step": 49614
    },
    {
      "epoch": 5.2636325058349245,
      "grad_norm": 0.6446842935367176,
      "learning_rate": 2.9828683433123817e-05,
      "loss": 1.1722,
      "num_input_tokens_seen": 39035401632,
      "step": 49615
    },
    {
      "epoch": 5.263738595374496,
      "grad_norm": 0.991303397439145,
      "learning_rate": 2.982800154886449e-05,
      "loss": 1.1198,
      "num_input_tokens_seen": 39036188480,
      "step": 49616
    },
    {
      "epoch": 5.263844684914067,
      "grad_norm": 0.6657029913603273,
      "learning_rate": 2.9827319660874235e-05,
      "loss": 1.1319,
      "num_input_tokens_seen": 39036975312,
      "step": 49617
    },
    {
      "epoch": 5.2639507744536385,
      "grad_norm": 0.6440479424268897,
      "learning_rate": 2.9826637769153558e-05,
      "loss": 1.0296,
      "num_input_tokens_seen": 39037762160,
      "step": 49618
    },
    {
      "epoch": 5.26405686399321,
      "grad_norm": 0.8576647630825588,
      "learning_rate": 2.9825955873703005e-05,
      "loss": 1.1564,
      "num_input_tokens_seen": 39038548928,
      "step": 49619
    },
    {
      "epoch": 5.264162953532781,
      "grad_norm": 0.6552916850181855,
      "learning_rate": 2.9825273974523095e-05,
      "loss": 1.148,
      "num_input_tokens_seen": 39039335712,
      "step": 49620
    },
    {
      "epoch": 5.264269043072353,
      "grad_norm": 0.9769156305568212,
      "learning_rate": 2.9824592071614342e-05,
      "loss": 1.1265,
      "num_input_tokens_seen": 39040122592,
      "step": 49621
    },
    {
      "epoch": 5.264375132611924,
      "grad_norm": 0.7221979365938844,
      "learning_rate": 2.9823910164977296e-05,
      "loss": 1.1226,
      "num_input_tokens_seen": 39040909328,
      "step": 49622
    },
    {
      "epoch": 5.264481222151496,
      "grad_norm": 0.7686059666289327,
      "learning_rate": 2.9823228254612472e-05,
      "loss": 1.208,
      "num_input_tokens_seen": 39041696080,
      "step": 49623
    },
    {
      "epoch": 5.264587311691067,
      "grad_norm": 0.7794480892968694,
      "learning_rate": 2.9822546340520398e-05,
      "loss": 1.2924,
      "num_input_tokens_seen": 39042482784,
      "step": 49624
    },
    {
      "epoch": 5.264693401230638,
      "grad_norm": 0.8285291793117363,
      "learning_rate": 2.9821864422701606e-05,
      "loss": 1.1785,
      "num_input_tokens_seen": 39043269584,
      "step": 49625
    },
    {
      "epoch": 5.26479949077021,
      "grad_norm": 0.7621284151195182,
      "learning_rate": 2.9821182501156607e-05,
      "loss": 1.1617,
      "num_input_tokens_seen": 39044056400,
      "step": 49626
    },
    {
      "epoch": 5.264905580309781,
      "grad_norm": 0.6752415498359212,
      "learning_rate": 2.982050057588595e-05,
      "loss": 1.0847,
      "num_input_tokens_seen": 39044843248,
      "step": 49627
    },
    {
      "epoch": 5.265011669849353,
      "grad_norm": 0.6431790621593589,
      "learning_rate": 2.9819818646890152e-05,
      "loss": 1.0855,
      "num_input_tokens_seen": 39045630144,
      "step": 49628
    },
    {
      "epoch": 5.265117759388924,
      "grad_norm": 0.6307325094714096,
      "learning_rate": 2.9819136714169737e-05,
      "loss": 1.1519,
      "num_input_tokens_seen": 39046416976,
      "step": 49629
    },
    {
      "epoch": 5.265223848928495,
      "grad_norm": 0.6333314525658924,
      "learning_rate": 2.9818454777725235e-05,
      "loss": 1.0431,
      "num_input_tokens_seen": 39047203824,
      "step": 49630
    },
    {
      "epoch": 5.265329938468067,
      "grad_norm": 0.6187874320588626,
      "learning_rate": 2.9817772837557174e-05,
      "loss": 1.0739,
      "num_input_tokens_seen": 39047990672,
      "step": 49631
    },
    {
      "epoch": 5.265436028007638,
      "grad_norm": 0.6900263069470055,
      "learning_rate": 2.981709089366607e-05,
      "loss": 1.0889,
      "num_input_tokens_seen": 39048777488,
      "step": 49632
    },
    {
      "epoch": 5.26554211754721,
      "grad_norm": 0.6215461792162718,
      "learning_rate": 2.981640894605247e-05,
      "loss": 1.1361,
      "num_input_tokens_seen": 39049564224,
      "step": 49633
    },
    {
      "epoch": 5.265648207086781,
      "grad_norm": 0.7111262226808504,
      "learning_rate": 2.9815726994716893e-05,
      "loss": 1.1775,
      "num_input_tokens_seen": 39050351072,
      "step": 49634
    },
    {
      "epoch": 5.265754296626353,
      "grad_norm": 0.5575722602435483,
      "learning_rate": 2.9815045039659856e-05,
      "loss": 1.0843,
      "num_input_tokens_seen": 39051137840,
      "step": 49635
    },
    {
      "epoch": 5.265860386165924,
      "grad_norm": 0.6527104496119079,
      "learning_rate": 2.9814363080881898e-05,
      "loss": 1.1248,
      "num_input_tokens_seen": 39051924528,
      "step": 49636
    },
    {
      "epoch": 5.265966475705495,
      "grad_norm": 0.7332381371798105,
      "learning_rate": 2.981368111838354e-05,
      "loss": 1.0795,
      "num_input_tokens_seen": 39052711328,
      "step": 49637
    },
    {
      "epoch": 5.266072565245067,
      "grad_norm": 0.5578595542485086,
      "learning_rate": 2.9812999152165306e-05,
      "loss": 1.2208,
      "num_input_tokens_seen": 39053498080,
      "step": 49638
    },
    {
      "epoch": 5.266178654784638,
      "grad_norm": 1.066740875918066,
      "learning_rate": 2.981231718222773e-05,
      "loss": 1.1231,
      "num_input_tokens_seen": 39054284800,
      "step": 49639
    },
    {
      "epoch": 5.26628474432421,
      "grad_norm": 0.6218278433515259,
      "learning_rate": 2.9811635208571336e-05,
      "loss": 1.1259,
      "num_input_tokens_seen": 39055071600,
      "step": 49640
    },
    {
      "epoch": 5.266390833863781,
      "grad_norm": 0.8842786252820001,
      "learning_rate": 2.9810953231196648e-05,
      "loss": 1.1687,
      "num_input_tokens_seen": 39055858384,
      "step": 49641
    },
    {
      "epoch": 5.266496923403352,
      "grad_norm": 1.032435874893687,
      "learning_rate": 2.9810271250104203e-05,
      "loss": 1.2154,
      "num_input_tokens_seen": 39056645232,
      "step": 49642
    },
    {
      "epoch": 5.266603012942924,
      "grad_norm": 0.6695574637540666,
      "learning_rate": 2.9809589265294524e-05,
      "loss": 1.1907,
      "num_input_tokens_seen": 39057431920,
      "step": 49643
    },
    {
      "epoch": 5.266709102482495,
      "grad_norm": 1.089201911283201,
      "learning_rate": 2.980890727676813e-05,
      "loss": 1.1744,
      "num_input_tokens_seen": 39058218720,
      "step": 49644
    },
    {
      "epoch": 5.266815192022067,
      "grad_norm": 0.6836370381387362,
      "learning_rate": 2.9808225284525555e-05,
      "loss": 1.1728,
      "num_input_tokens_seen": 39059005424,
      "step": 49645
    },
    {
      "epoch": 5.266921281561638,
      "grad_norm": 0.639362205694227,
      "learning_rate": 2.9807543288567323e-05,
      "loss": 1.0635,
      "num_input_tokens_seen": 39059792288,
      "step": 49646
    },
    {
      "epoch": 5.267027371101209,
      "grad_norm": 0.7804072988750749,
      "learning_rate": 2.980686128889396e-05,
      "loss": 1.1871,
      "num_input_tokens_seen": 39060578992,
      "step": 49647
    },
    {
      "epoch": 5.267133460640781,
      "grad_norm": 0.6721369799362942,
      "learning_rate": 2.9806179285506003e-05,
      "loss": 1.124,
      "num_input_tokens_seen": 39061365856,
      "step": 49648
    },
    {
      "epoch": 5.267239550180352,
      "grad_norm": 0.589341366062841,
      "learning_rate": 2.980549727840397e-05,
      "loss": 1.1473,
      "num_input_tokens_seen": 39062152624,
      "step": 49649
    },
    {
      "epoch": 5.267345639719924,
      "grad_norm": 0.7056490601138717,
      "learning_rate": 2.9804815267588388e-05,
      "loss": 1.2576,
      "num_input_tokens_seen": 39062939280,
      "step": 49650
    },
    {
      "epoch": 5.267451729259495,
      "grad_norm": 0.5818045231195659,
      "learning_rate": 2.9804133253059785e-05,
      "loss": 1.1848,
      "num_input_tokens_seen": 39063726032,
      "step": 49651
    },
    {
      "epoch": 5.267557818799067,
      "grad_norm": 0.689319201316222,
      "learning_rate": 2.980345123481869e-05,
      "loss": 1.2669,
      "num_input_tokens_seen": 39064512832,
      "step": 49652
    },
    {
      "epoch": 5.267663908338638,
      "grad_norm": 0.6185519326213933,
      "learning_rate": 2.9802769212865628e-05,
      "loss": 1.185,
      "num_input_tokens_seen": 39065299584,
      "step": 49653
    },
    {
      "epoch": 5.267769997878209,
      "grad_norm": 0.6973893438383455,
      "learning_rate": 2.9802087187201127e-05,
      "loss": 1.0785,
      "num_input_tokens_seen": 39066086320,
      "step": 49654
    },
    {
      "epoch": 5.267876087417781,
      "grad_norm": 0.5455559660096552,
      "learning_rate": 2.9801405157825714e-05,
      "loss": 1.1454,
      "num_input_tokens_seen": 39066873120,
      "step": 49655
    },
    {
      "epoch": 5.267982176957352,
      "grad_norm": 0.5683925805763609,
      "learning_rate": 2.9800723124739917e-05,
      "loss": 1.2725,
      "num_input_tokens_seen": 39067659792,
      "step": 49656
    },
    {
      "epoch": 5.268088266496924,
      "grad_norm": 0.6713597003140458,
      "learning_rate": 2.9800041087944264e-05,
      "loss": 1.1581,
      "num_input_tokens_seen": 39068446592,
      "step": 49657
    },
    {
      "epoch": 5.268194356036495,
      "grad_norm": 0.5693226478151685,
      "learning_rate": 2.9799359047439272e-05,
      "loss": 1.1182,
      "num_input_tokens_seen": 39069233424,
      "step": 49658
    },
    {
      "epoch": 5.268300445576066,
      "grad_norm": 0.6995522041391325,
      "learning_rate": 2.9798677003225485e-05,
      "loss": 1.2102,
      "num_input_tokens_seen": 39070020112,
      "step": 49659
    },
    {
      "epoch": 5.268406535115638,
      "grad_norm": 0.6293698127899527,
      "learning_rate": 2.979799495530342e-05,
      "loss": 1.181,
      "num_input_tokens_seen": 39070806896,
      "step": 49660
    },
    {
      "epoch": 5.268512624655209,
      "grad_norm": 0.6150752099169867,
      "learning_rate": 2.9797312903673603e-05,
      "loss": 1.065,
      "num_input_tokens_seen": 39071593712,
      "step": 49661
    },
    {
      "epoch": 5.268618714194781,
      "grad_norm": 0.6497575001908004,
      "learning_rate": 2.979663084833656e-05,
      "loss": 1.1346,
      "num_input_tokens_seen": 39072380464,
      "step": 49662
    },
    {
      "epoch": 5.268724803734352,
      "grad_norm": 0.5700544131424033,
      "learning_rate": 2.9795948789292827e-05,
      "loss": 1.2334,
      "num_input_tokens_seen": 39073167248,
      "step": 49663
    },
    {
      "epoch": 5.268830893273924,
      "grad_norm": 0.6694292155398949,
      "learning_rate": 2.979526672654292e-05,
      "loss": 1.1492,
      "num_input_tokens_seen": 39073954000,
      "step": 49664
    },
    {
      "epoch": 5.268936982813495,
      "grad_norm": 0.5720011904332944,
      "learning_rate": 2.9794584660087376e-05,
      "loss": 1.2154,
      "num_input_tokens_seen": 39074740768,
      "step": 49665
    },
    {
      "epoch": 5.269043072353066,
      "grad_norm": 0.7885595956874044,
      "learning_rate": 2.979390258992672e-05,
      "loss": 1.1769,
      "num_input_tokens_seen": 39075527520,
      "step": 49666
    },
    {
      "epoch": 5.269149161892638,
      "grad_norm": 0.7556152313992834,
      "learning_rate": 2.979322051606147e-05,
      "loss": 1.1045,
      "num_input_tokens_seen": 39076314352,
      "step": 49667
    },
    {
      "epoch": 5.269255251432209,
      "grad_norm": 0.6191119779264872,
      "learning_rate": 2.979253843849217e-05,
      "loss": 1.1135,
      "num_input_tokens_seen": 39077101088,
      "step": 49668
    },
    {
      "epoch": 5.2693613409717805,
      "grad_norm": 0.6658082372796681,
      "learning_rate": 2.979185635721932e-05,
      "loss": 1.1821,
      "num_input_tokens_seen": 39077887872,
      "step": 49669
    },
    {
      "epoch": 5.269467430511352,
      "grad_norm": 1.0221752865245473,
      "learning_rate": 2.9791174272243476e-05,
      "loss": 1.117,
      "num_input_tokens_seen": 39078674688,
      "step": 49670
    },
    {
      "epoch": 5.269573520050923,
      "grad_norm": 0.655410716593158,
      "learning_rate": 2.9790492183565155e-05,
      "loss": 1.1402,
      "num_input_tokens_seen": 39079461456,
      "step": 49671
    },
    {
      "epoch": 5.2696796095904945,
      "grad_norm": 1.0149509805587138,
      "learning_rate": 2.9789810091184877e-05,
      "loss": 1.2039,
      "num_input_tokens_seen": 39080248208,
      "step": 49672
    },
    {
      "epoch": 5.269785699130066,
      "grad_norm": 0.8514804517967088,
      "learning_rate": 2.9789127995103176e-05,
      "loss": 1.1307,
      "num_input_tokens_seen": 39081034976,
      "step": 49673
    },
    {
      "epoch": 5.2698917886696375,
      "grad_norm": 0.7737394719251968,
      "learning_rate": 2.978844589532058e-05,
      "loss": 1.1971,
      "num_input_tokens_seen": 39081821840,
      "step": 49674
    },
    {
      "epoch": 5.2699978782092085,
      "grad_norm": 1.3062325882790178,
      "learning_rate": 2.978776379183761e-05,
      "loss": 1.1432,
      "num_input_tokens_seen": 39082608608,
      "step": 49675
    },
    {
      "epoch": 5.2701039677487795,
      "grad_norm": 0.900065436862607,
      "learning_rate": 2.9787081684654793e-05,
      "loss": 1.0981,
      "num_input_tokens_seen": 39083395296,
      "step": 49676
    },
    {
      "epoch": 5.2702100572883515,
      "grad_norm": 0.5919009459601479,
      "learning_rate": 2.9786399573772665e-05,
      "loss": 1.1306,
      "num_input_tokens_seen": 39084182064,
      "step": 49677
    },
    {
      "epoch": 5.2703161468279225,
      "grad_norm": 1.5947781193668404,
      "learning_rate": 2.9785717459191748e-05,
      "loss": 1.1263,
      "num_input_tokens_seen": 39084968864,
      "step": 49678
    },
    {
      "epoch": 5.270422236367494,
      "grad_norm": 1.7926549265137315,
      "learning_rate": 2.978503534091257e-05,
      "loss": 1.0972,
      "num_input_tokens_seen": 39085755648,
      "step": 49679
    },
    {
      "epoch": 5.270528325907065,
      "grad_norm": 0.8030576188322216,
      "learning_rate": 2.9784353218935656e-05,
      "loss": 1.1906,
      "num_input_tokens_seen": 39086542384,
      "step": 49680
    },
    {
      "epoch": 5.270634415446637,
      "grad_norm": 1.169547829867832,
      "learning_rate": 2.9783671093261527e-05,
      "loss": 1.1404,
      "num_input_tokens_seen": 39087329056,
      "step": 49681
    },
    {
      "epoch": 5.270740504986208,
      "grad_norm": 1.1684481118496073,
      "learning_rate": 2.978298896389073e-05,
      "loss": 1.1549,
      "num_input_tokens_seen": 39088115760,
      "step": 49682
    },
    {
      "epoch": 5.270846594525779,
      "grad_norm": 0.8952169238097027,
      "learning_rate": 2.978230683082377e-05,
      "loss": 1.1504,
      "num_input_tokens_seen": 39088902528,
      "step": 49683
    },
    {
      "epoch": 5.270952684065351,
      "grad_norm": 0.9997967724252769,
      "learning_rate": 2.9781624694061184e-05,
      "loss": 1.1107,
      "num_input_tokens_seen": 39089689312,
      "step": 49684
    },
    {
      "epoch": 5.271058773604922,
      "grad_norm": 0.7654580574432758,
      "learning_rate": 2.9780942553603502e-05,
      "loss": 1.2581,
      "num_input_tokens_seen": 39090476080,
      "step": 49685
    },
    {
      "epoch": 5.271164863144494,
      "grad_norm": 0.7734663746723182,
      "learning_rate": 2.9780260409451245e-05,
      "loss": 1.1599,
      "num_input_tokens_seen": 39091262832,
      "step": 49686
    },
    {
      "epoch": 5.271270952684065,
      "grad_norm": 0.7169870616745154,
      "learning_rate": 2.9779578261604942e-05,
      "loss": 1.1807,
      "num_input_tokens_seen": 39092049584,
      "step": 49687
    },
    {
      "epoch": 5.271377042223636,
      "grad_norm": 1.1967342175449998,
      "learning_rate": 2.9778896110065124e-05,
      "loss": 1.199,
      "num_input_tokens_seen": 39092836400,
      "step": 49688
    },
    {
      "epoch": 5.271483131763208,
      "grad_norm": 0.7037065776693875,
      "learning_rate": 2.9778213954832318e-05,
      "loss": 1.1863,
      "num_input_tokens_seen": 39093623168,
      "step": 49689
    },
    {
      "epoch": 5.271589221302779,
      "grad_norm": 0.7750624182203844,
      "learning_rate": 2.9777531795907044e-05,
      "loss": 1.122,
      "num_input_tokens_seen": 39094409952,
      "step": 49690
    },
    {
      "epoch": 5.271695310842351,
      "grad_norm": 0.9665341234960462,
      "learning_rate": 2.9776849633289838e-05,
      "loss": 1.192,
      "num_input_tokens_seen": 39095196688,
      "step": 49691
    },
    {
      "epoch": 5.271801400381922,
      "grad_norm": 0.8012250441325501,
      "learning_rate": 2.9776167466981218e-05,
      "loss": 1.178,
      "num_input_tokens_seen": 39095983520,
      "step": 49692
    },
    {
      "epoch": 5.271907489921494,
      "grad_norm": 1.0098182195492058,
      "learning_rate": 2.977548529698172e-05,
      "loss": 1.2745,
      "num_input_tokens_seen": 39096770352,
      "step": 49693
    },
    {
      "epoch": 5.272013579461065,
      "grad_norm": 0.810369401137198,
      "learning_rate": 2.9774803123291866e-05,
      "loss": 1.2196,
      "num_input_tokens_seen": 39097557152,
      "step": 49694
    },
    {
      "epoch": 5.272119669000636,
      "grad_norm": 0.6680558027136447,
      "learning_rate": 2.9774120945912187e-05,
      "loss": 1.21,
      "num_input_tokens_seen": 39098343888,
      "step": 49695
    },
    {
      "epoch": 5.272225758540208,
      "grad_norm": 0.7760987059377877,
      "learning_rate": 2.9773438764843198e-05,
      "loss": 1.2239,
      "num_input_tokens_seen": 39099130544,
      "step": 49696
    },
    {
      "epoch": 5.272331848079779,
      "grad_norm": 1.176544282995081,
      "learning_rate": 2.977275658008545e-05,
      "loss": 1.1587,
      "num_input_tokens_seen": 39099917264,
      "step": 49697
    },
    {
      "epoch": 5.272437937619351,
      "grad_norm": 0.6811282359795188,
      "learning_rate": 2.9772074391639437e-05,
      "loss": 1.1334,
      "num_input_tokens_seen": 39100704048,
      "step": 49698
    },
    {
      "epoch": 5.272544027158922,
      "grad_norm": 0.710338464306746,
      "learning_rate": 2.977139219950572e-05,
      "loss": 1.1131,
      "num_input_tokens_seen": 39101490688,
      "step": 49699
    },
    {
      "epoch": 5.272650116698493,
      "grad_norm": 1.2633644050794517,
      "learning_rate": 2.977071000368481e-05,
      "loss": 1.1134,
      "num_input_tokens_seen": 39102277408,
      "step": 49700
    },
    {
      "epoch": 5.272756206238065,
      "grad_norm": 1.0068806858895814,
      "learning_rate": 2.9770027804177226e-05,
      "loss": 1.1227,
      "num_input_tokens_seen": 39103064128,
      "step": 49701
    },
    {
      "epoch": 5.272862295777636,
      "grad_norm": 1.069640224097506,
      "learning_rate": 2.9769345600983513e-05,
      "loss": 1.1692,
      "num_input_tokens_seen": 39103850800,
      "step": 49702
    },
    {
      "epoch": 5.272968385317208,
      "grad_norm": 1.3001878569699672,
      "learning_rate": 2.976866339410419e-05,
      "loss": 1.1888,
      "num_input_tokens_seen": 39104637584,
      "step": 49703
    },
    {
      "epoch": 5.273074474856779,
      "grad_norm": 0.8809744749885977,
      "learning_rate": 2.976798118353978e-05,
      "loss": 1.1416,
      "num_input_tokens_seen": 39105424256,
      "step": 49704
    },
    {
      "epoch": 5.27318056439635,
      "grad_norm": 1.111935212489175,
      "learning_rate": 2.9767298969290813e-05,
      "loss": 1.2393,
      "num_input_tokens_seen": 39106210992,
      "step": 49705
    },
    {
      "epoch": 5.273286653935922,
      "grad_norm": 0.8089067586007337,
      "learning_rate": 2.9766616751357822e-05,
      "loss": 1.1915,
      "num_input_tokens_seen": 39106997728,
      "step": 49706
    },
    {
      "epoch": 5.273392743475493,
      "grad_norm": 0.8053325521812148,
      "learning_rate": 2.9765934529741323e-05,
      "loss": 1.1951,
      "num_input_tokens_seen": 39107784448,
      "step": 49707
    },
    {
      "epoch": 5.273498833015065,
      "grad_norm": 0.5993627433486752,
      "learning_rate": 2.9765252304441856e-05,
      "loss": 1.1071,
      "num_input_tokens_seen": 39108571200,
      "step": 49708
    },
    {
      "epoch": 5.273604922554636,
      "grad_norm": 0.8557631727686323,
      "learning_rate": 2.976457007545994e-05,
      "loss": 1.1577,
      "num_input_tokens_seen": 39109358032,
      "step": 49709
    },
    {
      "epoch": 5.273711012094208,
      "grad_norm": 0.9772335683461767,
      "learning_rate": 2.9763887842796094e-05,
      "loss": 1.0399,
      "num_input_tokens_seen": 39110144832,
      "step": 49710
    },
    {
      "epoch": 5.273817101633779,
      "grad_norm": 0.7746127077974136,
      "learning_rate": 2.9763205606450874e-05,
      "loss": 1.1917,
      "num_input_tokens_seen": 39110931584,
      "step": 49711
    },
    {
      "epoch": 5.27392319117335,
      "grad_norm": 0.6855936911224978,
      "learning_rate": 2.976252336642477e-05,
      "loss": 1.1516,
      "num_input_tokens_seen": 39111718416,
      "step": 49712
    },
    {
      "epoch": 5.274029280712922,
      "grad_norm": 0.891780266581995,
      "learning_rate": 2.9761841122718336e-05,
      "loss": 1.1342,
      "num_input_tokens_seen": 39112505152,
      "step": 49713
    },
    {
      "epoch": 5.274135370252493,
      "grad_norm": 0.7626050080754144,
      "learning_rate": 2.9761158875332095e-05,
      "loss": 1.1701,
      "num_input_tokens_seen": 39113291920,
      "step": 49714
    },
    {
      "epoch": 5.274241459792065,
      "grad_norm": 0.734938897309903,
      "learning_rate": 2.9760476624266564e-05,
      "loss": 1.225,
      "num_input_tokens_seen": 39114078704,
      "step": 49715
    },
    {
      "epoch": 5.274347549331636,
      "grad_norm": 0.65500124352799,
      "learning_rate": 2.975979436952228e-05,
      "loss": 1.104,
      "num_input_tokens_seen": 39114865472,
      "step": 49716
    },
    {
      "epoch": 5.274453638871207,
      "grad_norm": 0.7363641577777749,
      "learning_rate": 2.975911211109977e-05,
      "loss": 1.1061,
      "num_input_tokens_seen": 39115652176,
      "step": 49717
    },
    {
      "epoch": 5.274559728410779,
      "grad_norm": 0.5421552813470581,
      "learning_rate": 2.9758429848999547e-05,
      "loss": 1.0703,
      "num_input_tokens_seen": 39116438992,
      "step": 49718
    },
    {
      "epoch": 5.27466581795035,
      "grad_norm": 0.6416133501028579,
      "learning_rate": 2.9757747583222157e-05,
      "loss": 1.1387,
      "num_input_tokens_seen": 39117225760,
      "step": 49719
    },
    {
      "epoch": 5.274771907489922,
      "grad_norm": 0.8577490809865816,
      "learning_rate": 2.9757065313768123e-05,
      "loss": 1.2217,
      "num_input_tokens_seen": 39118012480,
      "step": 49720
    },
    {
      "epoch": 5.274877997029493,
      "grad_norm": 0.7411661401726372,
      "learning_rate": 2.975638304063796e-05,
      "loss": 1.0725,
      "num_input_tokens_seen": 39118799296,
      "step": 49721
    },
    {
      "epoch": 5.274984086569065,
      "grad_norm": 0.8461570026312267,
      "learning_rate": 2.9755700763832205e-05,
      "loss": 1.1535,
      "num_input_tokens_seen": 39119586064,
      "step": 49722
    },
    {
      "epoch": 5.275090176108636,
      "grad_norm": 0.7446457831215811,
      "learning_rate": 2.9755018483351387e-05,
      "loss": 1.1287,
      "num_input_tokens_seen": 39120372880,
      "step": 49723
    },
    {
      "epoch": 5.275196265648207,
      "grad_norm": 0.8182574910196545,
      "learning_rate": 2.9754336199196026e-05,
      "loss": 1.2189,
      "num_input_tokens_seen": 39121159648,
      "step": 49724
    },
    {
      "epoch": 5.275302355187779,
      "grad_norm": 0.7406112735661465,
      "learning_rate": 2.975365391136666e-05,
      "loss": 1.2051,
      "num_input_tokens_seen": 39121946384,
      "step": 49725
    },
    {
      "epoch": 5.27540844472735,
      "grad_norm": 0.6899819943519419,
      "learning_rate": 2.9752971619863805e-05,
      "loss": 1.1634,
      "num_input_tokens_seen": 39122733136,
      "step": 49726
    },
    {
      "epoch": 5.275514534266922,
      "grad_norm": 0.7730612980667012,
      "learning_rate": 2.9752289324687993e-05,
      "loss": 1.1657,
      "num_input_tokens_seen": 39123519936,
      "step": 49727
    },
    {
      "epoch": 5.275620623806493,
      "grad_norm": 0.6497549429289021,
      "learning_rate": 2.9751607025839757e-05,
      "loss": 1.1144,
      "num_input_tokens_seen": 39124306608,
      "step": 49728
    },
    {
      "epoch": 5.275726713346064,
      "grad_norm": 0.7964313615345993,
      "learning_rate": 2.9750924723319607e-05,
      "loss": 1.1733,
      "num_input_tokens_seen": 39125093360,
      "step": 49729
    },
    {
      "epoch": 5.275832802885636,
      "grad_norm": 0.7146419081871016,
      "learning_rate": 2.9750242417128094e-05,
      "loss": 1.0937,
      "num_input_tokens_seen": 39125880224,
      "step": 49730
    },
    {
      "epoch": 5.275938892425207,
      "grad_norm": 0.8236025334806121,
      "learning_rate": 2.974956010726573e-05,
      "loss": 1.2344,
      "num_input_tokens_seen": 39126666960,
      "step": 49731
    },
    {
      "epoch": 5.276044981964779,
      "grad_norm": 0.7072829612444227,
      "learning_rate": 2.9748877793733036e-05,
      "loss": 1.1558,
      "num_input_tokens_seen": 39127453696,
      "step": 49732
    },
    {
      "epoch": 5.27615107150435,
      "grad_norm": 0.824330568159202,
      "learning_rate": 2.974819547653056e-05,
      "loss": 1.199,
      "num_input_tokens_seen": 39128240368,
      "step": 49733
    },
    {
      "epoch": 5.276257161043921,
      "grad_norm": 1.107003778967628,
      "learning_rate": 2.9747513155658813e-05,
      "loss": 1.2093,
      "num_input_tokens_seen": 39129027104,
      "step": 49734
    },
    {
      "epoch": 5.2763632505834925,
      "grad_norm": 0.8344087973296315,
      "learning_rate": 2.9746830831118323e-05,
      "loss": 1.1825,
      "num_input_tokens_seen": 39129813824,
      "step": 49735
    },
    {
      "epoch": 5.276469340123064,
      "grad_norm": 1.252313134028143,
      "learning_rate": 2.974614850290962e-05,
      "loss": 1.2034,
      "num_input_tokens_seen": 39130600560,
      "step": 49736
    },
    {
      "epoch": 5.2765754296626355,
      "grad_norm": 0.793817871406827,
      "learning_rate": 2.9745466171033244e-05,
      "loss": 1.1926,
      "num_input_tokens_seen": 39131387376,
      "step": 49737
    },
    {
      "epoch": 5.2766815192022065,
      "grad_norm": 0.7687414763932366,
      "learning_rate": 2.9744783835489708e-05,
      "loss": 1.1617,
      "num_input_tokens_seen": 39132174128,
      "step": 49738
    },
    {
      "epoch": 5.276787608741778,
      "grad_norm": 0.7701304154871986,
      "learning_rate": 2.9744101496279536e-05,
      "loss": 1.1649,
      "num_input_tokens_seen": 39132960896,
      "step": 49739
    },
    {
      "epoch": 5.2768936982813495,
      "grad_norm": 0.84252594017076,
      "learning_rate": 2.9743419153403266e-05,
      "loss": 1.1405,
      "num_input_tokens_seen": 39133747664,
      "step": 49740
    },
    {
      "epoch": 5.2769997878209205,
      "grad_norm": 0.7821964577788046,
      "learning_rate": 2.974273680686142e-05,
      "loss": 1.2107,
      "num_input_tokens_seen": 39134534400,
      "step": 49741
    },
    {
      "epoch": 5.277105877360492,
      "grad_norm": 0.7249771272380473,
      "learning_rate": 2.974205445665453e-05,
      "loss": 1.2197,
      "num_input_tokens_seen": 39135321200,
      "step": 49742
    },
    {
      "epoch": 5.2772119669000634,
      "grad_norm": 0.8519455319618316,
      "learning_rate": 2.9741372102783114e-05,
      "loss": 1.1771,
      "num_input_tokens_seen": 39136107984,
      "step": 49743
    },
    {
      "epoch": 5.277318056439635,
      "grad_norm": 0.7865162632371798,
      "learning_rate": 2.9740689745247706e-05,
      "loss": 1.1899,
      "num_input_tokens_seen": 39136894848,
      "step": 49744
    },
    {
      "epoch": 5.277424145979206,
      "grad_norm": 0.6451615193001089,
      "learning_rate": 2.9740007384048834e-05,
      "loss": 1.1822,
      "num_input_tokens_seen": 39137681696,
      "step": 49745
    },
    {
      "epoch": 5.277530235518778,
      "grad_norm": 0.6480289503022109,
      "learning_rate": 2.9739325019187024e-05,
      "loss": 1.1642,
      "num_input_tokens_seen": 39138468384,
      "step": 49746
    },
    {
      "epoch": 5.277636325058349,
      "grad_norm": 1.0301915433141848,
      "learning_rate": 2.9738642650662797e-05,
      "loss": 1.2558,
      "num_input_tokens_seen": 39139255104,
      "step": 49747
    },
    {
      "epoch": 5.27774241459792,
      "grad_norm": 0.5881365101938485,
      "learning_rate": 2.973796027847669e-05,
      "loss": 1.0967,
      "num_input_tokens_seen": 39140041920,
      "step": 49748
    },
    {
      "epoch": 5.277848504137492,
      "grad_norm": 0.889713619817317,
      "learning_rate": 2.973727790262923e-05,
      "loss": 1.1164,
      "num_input_tokens_seen": 39140828576,
      "step": 49749
    },
    {
      "epoch": 5.277954593677063,
      "grad_norm": 0.7381285107988771,
      "learning_rate": 2.9736595523120937e-05,
      "loss": 1.1821,
      "num_input_tokens_seen": 39141615344,
      "step": 49750
    },
    {
      "epoch": 5.278060683216635,
      "grad_norm": 0.706658245645725,
      "learning_rate": 2.9735913139952343e-05,
      "loss": 1.1315,
      "num_input_tokens_seen": 39142402128,
      "step": 49751
    },
    {
      "epoch": 5.278166772756206,
      "grad_norm": 0.7894789111197923,
      "learning_rate": 2.973523075312397e-05,
      "loss": 1.1854,
      "num_input_tokens_seen": 39143188880,
      "step": 49752
    },
    {
      "epoch": 5.278272862295777,
      "grad_norm": 0.8212860995399079,
      "learning_rate": 2.973454836263635e-05,
      "loss": 1.1281,
      "num_input_tokens_seen": 39143975600,
      "step": 49753
    },
    {
      "epoch": 5.278378951835349,
      "grad_norm": 0.718390253838489,
      "learning_rate": 2.9733865968490016e-05,
      "loss": 1.1673,
      "num_input_tokens_seen": 39144762352,
      "step": 49754
    },
    {
      "epoch": 5.27848504137492,
      "grad_norm": 0.5470398437360403,
      "learning_rate": 2.9733183570685486e-05,
      "loss": 1.0131,
      "num_input_tokens_seen": 39145549168,
      "step": 49755
    },
    {
      "epoch": 5.278591130914492,
      "grad_norm": 0.6408521262723319,
      "learning_rate": 2.9732501169223288e-05,
      "loss": 1.1662,
      "num_input_tokens_seen": 39146335824,
      "step": 49756
    },
    {
      "epoch": 5.278697220454063,
      "grad_norm": 0.816221434765241,
      "learning_rate": 2.9731818764103958e-05,
      "loss": 1.2653,
      "num_input_tokens_seen": 39147122464,
      "step": 49757
    },
    {
      "epoch": 5.278803309993634,
      "grad_norm": 0.674622992588047,
      "learning_rate": 2.973113635532801e-05,
      "loss": 1.1702,
      "num_input_tokens_seen": 39147909056,
      "step": 49758
    },
    {
      "epoch": 5.278909399533206,
      "grad_norm": 0.7738361769131685,
      "learning_rate": 2.9730453942895987e-05,
      "loss": 1.2343,
      "num_input_tokens_seen": 39148695872,
      "step": 49759
    },
    {
      "epoch": 5.279015489072777,
      "grad_norm": 1.2626673985103407,
      "learning_rate": 2.9729771526808403e-05,
      "loss": 1.1583,
      "num_input_tokens_seen": 39149482624,
      "step": 49760
    },
    {
      "epoch": 5.279121578612349,
      "grad_norm": 0.6756959631444265,
      "learning_rate": 2.9729089107065787e-05,
      "loss": 1.1885,
      "num_input_tokens_seen": 39150269312,
      "step": 49761
    },
    {
      "epoch": 5.27922766815192,
      "grad_norm": 1.0345406566141158,
      "learning_rate": 2.9728406683668675e-05,
      "loss": 1.1669,
      "num_input_tokens_seen": 39151056096,
      "step": 49762
    },
    {
      "epoch": 5.279333757691491,
      "grad_norm": 1.037668383962206,
      "learning_rate": 2.972772425661759e-05,
      "loss": 1.1268,
      "num_input_tokens_seen": 39151842944,
      "step": 49763
    },
    {
      "epoch": 5.279439847231063,
      "grad_norm": 0.7262343499548495,
      "learning_rate": 2.972704182591305e-05,
      "loss": 1.1979,
      "num_input_tokens_seen": 39152629760,
      "step": 49764
    },
    {
      "epoch": 5.279545936770634,
      "grad_norm": 1.1119952520330285,
      "learning_rate": 2.97263593915556e-05,
      "loss": 1.1419,
      "num_input_tokens_seen": 39153416512,
      "step": 49765
    },
    {
      "epoch": 5.279652026310206,
      "grad_norm": 0.7451279875694294,
      "learning_rate": 2.9725676953545755e-05,
      "loss": 1.1694,
      "num_input_tokens_seen": 39154203248,
      "step": 49766
    },
    {
      "epoch": 5.279758115849777,
      "grad_norm": 0.9459750491389392,
      "learning_rate": 2.972499451188404e-05,
      "loss": 1.2592,
      "num_input_tokens_seen": 39154990016,
      "step": 49767
    },
    {
      "epoch": 5.279864205389349,
      "grad_norm": 0.5890331532629468,
      "learning_rate": 2.9724312066570998e-05,
      "loss": 1.1177,
      "num_input_tokens_seen": 39155776848,
      "step": 49768
    },
    {
      "epoch": 5.27997029492892,
      "grad_norm": 0.7352132909389074,
      "learning_rate": 2.9723629617607145e-05,
      "loss": 1.1634,
      "num_input_tokens_seen": 39156563568,
      "step": 49769
    },
    {
      "epoch": 5.280076384468491,
      "grad_norm": 0.7199700008681952,
      "learning_rate": 2.9722947164993004e-05,
      "loss": 1.2404,
      "num_input_tokens_seen": 39157350368,
      "step": 49770
    },
    {
      "epoch": 5.280182474008063,
      "grad_norm": 0.6442615667150454,
      "learning_rate": 2.972226470872911e-05,
      "loss": 1.0991,
      "num_input_tokens_seen": 39158137040,
      "step": 49771
    },
    {
      "epoch": 5.280288563547634,
      "grad_norm": 0.7243051797296015,
      "learning_rate": 2.9721582248815983e-05,
      "loss": 1.031,
      "num_input_tokens_seen": 39158923760,
      "step": 49772
    },
    {
      "epoch": 5.280394653087206,
      "grad_norm": 0.6152621527511769,
      "learning_rate": 2.9720899785254165e-05,
      "loss": 1.1647,
      "num_input_tokens_seen": 39159710576,
      "step": 49773
    },
    {
      "epoch": 5.280500742626777,
      "grad_norm": 0.5721815564755882,
      "learning_rate": 2.9720217318044175e-05,
      "loss": 1.0829,
      "num_input_tokens_seen": 39160497280,
      "step": 49774
    },
    {
      "epoch": 5.280606832166349,
      "grad_norm": 0.5846736979996757,
      "learning_rate": 2.971953484718653e-05,
      "loss": 1.1299,
      "num_input_tokens_seen": 39161284048,
      "step": 49775
    },
    {
      "epoch": 5.28071292170592,
      "grad_norm": 0.666090464143239,
      "learning_rate": 2.971885237268177e-05,
      "loss": 1.1188,
      "num_input_tokens_seen": 39162070912,
      "step": 49776
    },
    {
      "epoch": 5.280819011245491,
      "grad_norm": 0.7194881610231793,
      "learning_rate": 2.971816989453043e-05,
      "loss": 1.1417,
      "num_input_tokens_seen": 39162857712,
      "step": 49777
    },
    {
      "epoch": 5.280925100785063,
      "grad_norm": 0.6604930237059308,
      "learning_rate": 2.9717487412733015e-05,
      "loss": 1.1507,
      "num_input_tokens_seen": 39163644528,
      "step": 49778
    },
    {
      "epoch": 5.281031190324634,
      "grad_norm": 0.7684993805089669,
      "learning_rate": 2.9716804927290065e-05,
      "loss": 1.2179,
      "num_input_tokens_seen": 39164431392,
      "step": 49779
    },
    {
      "epoch": 5.281137279864206,
      "grad_norm": 0.5671271472477607,
      "learning_rate": 2.971612243820211e-05,
      "loss": 1.1255,
      "num_input_tokens_seen": 39165218176,
      "step": 49780
    },
    {
      "epoch": 5.281243369403777,
      "grad_norm": 0.6305570359583312,
      "learning_rate": 2.971543994546967e-05,
      "loss": 1.0515,
      "num_input_tokens_seen": 39166004944,
      "step": 49781
    },
    {
      "epoch": 5.281349458943348,
      "grad_norm": 0.6770109584959225,
      "learning_rate": 2.971475744909328e-05,
      "loss": 1.1677,
      "num_input_tokens_seen": 39166791680,
      "step": 49782
    },
    {
      "epoch": 5.28145554848292,
      "grad_norm": 0.5305548376010559,
      "learning_rate": 2.971407494907346e-05,
      "loss": 1.1633,
      "num_input_tokens_seen": 39167578480,
      "step": 49783
    },
    {
      "epoch": 5.281561638022491,
      "grad_norm": 0.5390724403137153,
      "learning_rate": 2.971339244541074e-05,
      "loss": 1.0644,
      "num_input_tokens_seen": 39168365280,
      "step": 49784
    },
    {
      "epoch": 5.281667727562063,
      "grad_norm": 0.6516217221142805,
      "learning_rate": 2.9712709938105654e-05,
      "loss": 1.0809,
      "num_input_tokens_seen": 39169152000,
      "step": 49785
    },
    {
      "epoch": 5.281773817101634,
      "grad_norm": 0.5992215826899672,
      "learning_rate": 2.971202742715873e-05,
      "loss": 1.1829,
      "num_input_tokens_seen": 39169938688,
      "step": 49786
    },
    {
      "epoch": 5.281879906641205,
      "grad_norm": 0.6431101819456404,
      "learning_rate": 2.9711344912570477e-05,
      "loss": 1.1327,
      "num_input_tokens_seen": 39170725488,
      "step": 49787
    },
    {
      "epoch": 5.281985996180777,
      "grad_norm": 0.6467003073782895,
      "learning_rate": 2.9710662394341436e-05,
      "loss": 1.1361,
      "num_input_tokens_seen": 39171512208,
      "step": 49788
    },
    {
      "epoch": 5.282092085720348,
      "grad_norm": 0.5287457819601048,
      "learning_rate": 2.9709979872472143e-05,
      "loss": 1.1208,
      "num_input_tokens_seen": 39172298992,
      "step": 49789
    },
    {
      "epoch": 5.28219817525992,
      "grad_norm": 0.6195024352274998,
      "learning_rate": 2.9709297346963105e-05,
      "loss": 1.1213,
      "num_input_tokens_seen": 39173085760,
      "step": 49790
    },
    {
      "epoch": 5.282304264799491,
      "grad_norm": 0.5640796921624679,
      "learning_rate": 2.9708614817814868e-05,
      "loss": 1.1319,
      "num_input_tokens_seen": 39173872448,
      "step": 49791
    },
    {
      "epoch": 5.282410354339062,
      "grad_norm": 0.7473936222714301,
      "learning_rate": 2.970793228502795e-05,
      "loss": 1.135,
      "num_input_tokens_seen": 39174659136,
      "step": 49792
    },
    {
      "epoch": 5.282516443878634,
      "grad_norm": 0.5633337712192773,
      "learning_rate": 2.9707249748602877e-05,
      "loss": 1.1836,
      "num_input_tokens_seen": 39175445904,
      "step": 49793
    },
    {
      "epoch": 5.282622533418205,
      "grad_norm": 0.6649884132581625,
      "learning_rate": 2.970656720854018e-05,
      "loss": 1.199,
      "num_input_tokens_seen": 39176232576,
      "step": 49794
    },
    {
      "epoch": 5.282728622957777,
      "grad_norm": 0.5830884374954948,
      "learning_rate": 2.9705884664840395e-05,
      "loss": 1.1448,
      "num_input_tokens_seen": 39177019376,
      "step": 49795
    },
    {
      "epoch": 5.282834712497348,
      "grad_norm": 0.5336890846749,
      "learning_rate": 2.9705202117504026e-05,
      "loss": 1.0922,
      "num_input_tokens_seen": 39177806160,
      "step": 49796
    },
    {
      "epoch": 5.2829408020369195,
      "grad_norm": 0.661116304402631,
      "learning_rate": 2.9704519566531626e-05,
      "loss": 1.1548,
      "num_input_tokens_seen": 39178592912,
      "step": 49797
    },
    {
      "epoch": 5.2830468915764905,
      "grad_norm": 0.8670325006530493,
      "learning_rate": 2.9703837011923706e-05,
      "loss": 1.1395,
      "num_input_tokens_seen": 39179379712,
      "step": 49798
    },
    {
      "epoch": 5.283152981116062,
      "grad_norm": 0.6363955678272546,
      "learning_rate": 2.97031544536808e-05,
      "loss": 1.1682,
      "num_input_tokens_seen": 39180166576,
      "step": 49799
    },
    {
      "epoch": 5.2832590706556335,
      "grad_norm": 0.7111768162797321,
      "learning_rate": 2.9702471891803436e-05,
      "loss": 1.2014,
      "num_input_tokens_seen": 39180953328,
      "step": 49800
    },
    {
      "epoch": 5.2833651601952045,
      "grad_norm": 1.1671128761014897,
      "learning_rate": 2.9701789326292135e-05,
      "loss": 1.2083,
      "num_input_tokens_seen": 39181740048,
      "step": 49801
    },
    {
      "epoch": 5.283471249734776,
      "grad_norm": 0.5749077326538797,
      "learning_rate": 2.9701106757147433e-05,
      "loss": 1.1593,
      "num_input_tokens_seen": 39182526848,
      "step": 49802
    },
    {
      "epoch": 5.2835773392743475,
      "grad_norm": 0.6051577680474534,
      "learning_rate": 2.9700424184369857e-05,
      "loss": 1.1125,
      "num_input_tokens_seen": 39183313632,
      "step": 49803
    },
    {
      "epoch": 5.283683428813919,
      "grad_norm": 0.9764301374717899,
      "learning_rate": 2.969974160795992e-05,
      "loss": 1.1649,
      "num_input_tokens_seen": 39184100384,
      "step": 49804
    },
    {
      "epoch": 5.28378951835349,
      "grad_norm": 0.5399047365596268,
      "learning_rate": 2.9699059027918168e-05,
      "loss": 1.1452,
      "num_input_tokens_seen": 39184887136,
      "step": 49805
    },
    {
      "epoch": 5.2838956078930615,
      "grad_norm": 0.7738774439519209,
      "learning_rate": 2.9698376444245123e-05,
      "loss": 1.2428,
      "num_input_tokens_seen": 39185673872,
      "step": 49806
    },
    {
      "epoch": 5.284001697432633,
      "grad_norm": 0.5801658602517088,
      "learning_rate": 2.9697693856941304e-05,
      "loss": 1.1582,
      "num_input_tokens_seen": 39186460576,
      "step": 49807
    },
    {
      "epoch": 5.284107786972204,
      "grad_norm": 0.6031875807827088,
      "learning_rate": 2.9697011266007252e-05,
      "loss": 1.2007,
      "num_input_tokens_seen": 39187247296,
      "step": 49808
    },
    {
      "epoch": 5.284213876511776,
      "grad_norm": 0.9320156347970929,
      "learning_rate": 2.9696328671443484e-05,
      "loss": 1.1423,
      "num_input_tokens_seen": 39188034096,
      "step": 49809
    },
    {
      "epoch": 5.284319966051347,
      "grad_norm": 0.6124376242467483,
      "learning_rate": 2.969564607325053e-05,
      "loss": 1.1266,
      "num_input_tokens_seen": 39188820976,
      "step": 49810
    },
    {
      "epoch": 5.284426055590918,
      "grad_norm": 0.9887935967525503,
      "learning_rate": 2.969496347142892e-05,
      "loss": 1.1389,
      "num_input_tokens_seen": 39189607680,
      "step": 49811
    },
    {
      "epoch": 5.28453214513049,
      "grad_norm": 0.7631178297274895,
      "learning_rate": 2.9694280865979184e-05,
      "loss": 1.1977,
      "num_input_tokens_seen": 39190394368,
      "step": 49812
    },
    {
      "epoch": 5.284638234670061,
      "grad_norm": 0.986622009756192,
      "learning_rate": 2.9693598256901838e-05,
      "loss": 1.219,
      "num_input_tokens_seen": 39191181104,
      "step": 49813
    },
    {
      "epoch": 5.284744324209633,
      "grad_norm": 0.8188179681891187,
      "learning_rate": 2.9692915644197423e-05,
      "loss": 1.0867,
      "num_input_tokens_seen": 39191967888,
      "step": 49814
    },
    {
      "epoch": 5.284850413749204,
      "grad_norm": 0.658045198816272,
      "learning_rate": 2.9692233027866456e-05,
      "loss": 1.1465,
      "num_input_tokens_seen": 39192754720,
      "step": 49815
    },
    {
      "epoch": 5.284956503288775,
      "grad_norm": 0.8544221957079426,
      "learning_rate": 2.9691550407909473e-05,
      "loss": 1.2099,
      "num_input_tokens_seen": 39193541440,
      "step": 49816
    },
    {
      "epoch": 5.285062592828347,
      "grad_norm": 1.1270726291401654,
      "learning_rate": 2.9690867784326997e-05,
      "loss": 1.0726,
      "num_input_tokens_seen": 39194328272,
      "step": 49817
    },
    {
      "epoch": 5.285168682367918,
      "grad_norm": 0.8441790614672824,
      "learning_rate": 2.9690185157119548e-05,
      "loss": 1.2313,
      "num_input_tokens_seen": 39195115056,
      "step": 49818
    },
    {
      "epoch": 5.28527477190749,
      "grad_norm": 0.9456076151802969,
      "learning_rate": 2.9689502526287672e-05,
      "loss": 1.0368,
      "num_input_tokens_seen": 39195901792,
      "step": 49819
    },
    {
      "epoch": 5.285380861447061,
      "grad_norm": 1.1750794852180129,
      "learning_rate": 2.968881989183188e-05,
      "loss": 1.1259,
      "num_input_tokens_seen": 39196688608,
      "step": 49820
    },
    {
      "epoch": 5.285486950986633,
      "grad_norm": 0.6614005237766115,
      "learning_rate": 2.9688137253752706e-05,
      "loss": 1.1438,
      "num_input_tokens_seen": 39197475424,
      "step": 49821
    },
    {
      "epoch": 5.285593040526204,
      "grad_norm": 0.6024383496656913,
      "learning_rate": 2.968745461205068e-05,
      "loss": 1.0373,
      "num_input_tokens_seen": 39198262144,
      "step": 49822
    },
    {
      "epoch": 5.285699130065775,
      "grad_norm": 1.3566520220787088,
      "learning_rate": 2.968677196672633e-05,
      "loss": 1.1214,
      "num_input_tokens_seen": 39199048960,
      "step": 49823
    },
    {
      "epoch": 5.285805219605347,
      "grad_norm": 0.7097277447028199,
      "learning_rate": 2.968608931778017e-05,
      "loss": 1.1997,
      "num_input_tokens_seen": 39199835728,
      "step": 49824
    },
    {
      "epoch": 5.285911309144918,
      "grad_norm": 0.732265055830813,
      "learning_rate": 2.9685406665212746e-05,
      "loss": 1.0473,
      "num_input_tokens_seen": 39200622496,
      "step": 49825
    },
    {
      "epoch": 5.28601739868449,
      "grad_norm": 0.8875905156590415,
      "learning_rate": 2.9684724009024577e-05,
      "loss": 1.0967,
      "num_input_tokens_seen": 39201409360,
      "step": 49826
    },
    {
      "epoch": 5.286123488224061,
      "grad_norm": 0.8501877581983143,
      "learning_rate": 2.9684041349216185e-05,
      "loss": 1.2503,
      "num_input_tokens_seen": 39202196048,
      "step": 49827
    },
    {
      "epoch": 5.286229577763632,
      "grad_norm": 0.6137884067257051,
      "learning_rate": 2.968335868578811e-05,
      "loss": 1.1576,
      "num_input_tokens_seen": 39202982800,
      "step": 49828
    },
    {
      "epoch": 5.286335667303204,
      "grad_norm": 1.2160534526265927,
      "learning_rate": 2.968267601874087e-05,
      "loss": 1.1129,
      "num_input_tokens_seen": 39203769616,
      "step": 49829
    },
    {
      "epoch": 5.286441756842775,
      "grad_norm": 0.9593170281698492,
      "learning_rate": 2.968199334807498e-05,
      "loss": 1.1485,
      "num_input_tokens_seen": 39204556432,
      "step": 49830
    },
    {
      "epoch": 5.286547846382347,
      "grad_norm": 0.6027579340445444,
      "learning_rate": 2.9681310673791003e-05,
      "loss": 1.1707,
      "num_input_tokens_seen": 39205343264,
      "step": 49831
    },
    {
      "epoch": 5.286653935921918,
      "grad_norm": 0.9651510472510187,
      "learning_rate": 2.9680627995889442e-05,
      "loss": 1.02,
      "num_input_tokens_seen": 39206130032,
      "step": 49832
    },
    {
      "epoch": 5.28676002546149,
      "grad_norm": 1.2321936194717669,
      "learning_rate": 2.9679945314370827e-05,
      "loss": 1.0822,
      "num_input_tokens_seen": 39206916848,
      "step": 49833
    },
    {
      "epoch": 5.286866115001061,
      "grad_norm": 0.6755309511385884,
      "learning_rate": 2.967926262923569e-05,
      "loss": 1.1624,
      "num_input_tokens_seen": 39207703680,
      "step": 49834
    },
    {
      "epoch": 5.286972204540632,
      "grad_norm": 1.265168786126816,
      "learning_rate": 2.967857994048455e-05,
      "loss": 1.2233,
      "num_input_tokens_seen": 39208490448,
      "step": 49835
    },
    {
      "epoch": 5.287078294080204,
      "grad_norm": 0.8592808007427213,
      "learning_rate": 2.9677897248117947e-05,
      "loss": 1.2014,
      "num_input_tokens_seen": 39209277184,
      "step": 49836
    },
    {
      "epoch": 5.287184383619775,
      "grad_norm": 0.7968324097298801,
      "learning_rate": 2.96772145521364e-05,
      "loss": 1.0922,
      "num_input_tokens_seen": 39210063888,
      "step": 49837
    },
    {
      "epoch": 5.287290473159347,
      "grad_norm": 0.7967248418270437,
      "learning_rate": 2.9676531852540445e-05,
      "loss": 1.1762,
      "num_input_tokens_seen": 39210850640,
      "step": 49838
    },
    {
      "epoch": 5.287396562698918,
      "grad_norm": 0.9366941703231887,
      "learning_rate": 2.9675849149330593e-05,
      "loss": 1.1407,
      "num_input_tokens_seen": 39211637456,
      "step": 49839
    },
    {
      "epoch": 5.287502652238489,
      "grad_norm": 0.6071688223366843,
      "learning_rate": 2.967516644250739e-05,
      "loss": 1.1834,
      "num_input_tokens_seen": 39212424224,
      "step": 49840
    },
    {
      "epoch": 5.287608741778061,
      "grad_norm": 0.6965839134740784,
      "learning_rate": 2.9674483732071358e-05,
      "loss": 1.2316,
      "num_input_tokens_seen": 39213210960,
      "step": 49841
    },
    {
      "epoch": 5.287714831317632,
      "grad_norm": 0.6588834755565162,
      "learning_rate": 2.9673801018023008e-05,
      "loss": 1.1679,
      "num_input_tokens_seen": 39213997792,
      "step": 49842
    },
    {
      "epoch": 5.287820920857204,
      "grad_norm": 0.6032746941290981,
      "learning_rate": 2.967311830036289e-05,
      "loss": 1.2052,
      "num_input_tokens_seen": 39214784544,
      "step": 49843
    },
    {
      "epoch": 5.287927010396775,
      "grad_norm": 0.6352989447909957,
      "learning_rate": 2.9672435579091523e-05,
      "loss": 1.1457,
      "num_input_tokens_seen": 39215571216,
      "step": 49844
    },
    {
      "epoch": 5.288033099936346,
      "grad_norm": 0.5561060686753714,
      "learning_rate": 2.967175285420944e-05,
      "loss": 1.0986,
      "num_input_tokens_seen": 39216358000,
      "step": 49845
    },
    {
      "epoch": 5.288139189475918,
      "grad_norm": 0.6422900884107563,
      "learning_rate": 2.967107012571716e-05,
      "loss": 1.1575,
      "num_input_tokens_seen": 39217144720,
      "step": 49846
    },
    {
      "epoch": 5.288245279015489,
      "grad_norm": 0.6583506317996504,
      "learning_rate": 2.9670387393615205e-05,
      "loss": 1.1082,
      "num_input_tokens_seen": 39217931568,
      "step": 49847
    },
    {
      "epoch": 5.288351368555061,
      "grad_norm": 0.83192904373391,
      "learning_rate": 2.9669704657904123e-05,
      "loss": 1.1736,
      "num_input_tokens_seen": 39218718320,
      "step": 49848
    },
    {
      "epoch": 5.288457458094632,
      "grad_norm": 0.7015849134841861,
      "learning_rate": 2.9669021918584427e-05,
      "loss": 1.1831,
      "num_input_tokens_seen": 39219505120,
      "step": 49849
    },
    {
      "epoch": 5.288563547634204,
      "grad_norm": 0.635665225953647,
      "learning_rate": 2.9668339175656644e-05,
      "loss": 1.0737,
      "num_input_tokens_seen": 39220291984,
      "step": 49850
    },
    {
      "epoch": 5.288669637173775,
      "grad_norm": 0.6848785294959295,
      "learning_rate": 2.9667656429121315e-05,
      "loss": 1.062,
      "num_input_tokens_seen": 39221078688,
      "step": 49851
    },
    {
      "epoch": 5.288775726713346,
      "grad_norm": 0.7630151277802673,
      "learning_rate": 2.9666973678978953e-05,
      "loss": 1.039,
      "num_input_tokens_seen": 39221865488,
      "step": 49852
    },
    {
      "epoch": 5.288881816252918,
      "grad_norm": 0.6441937600584801,
      "learning_rate": 2.966629092523009e-05,
      "loss": 1.1783,
      "num_input_tokens_seen": 39222652224,
      "step": 49853
    },
    {
      "epoch": 5.288987905792489,
      "grad_norm": 1.0714926871227561,
      "learning_rate": 2.9665608167875253e-05,
      "loss": 1.1272,
      "num_input_tokens_seen": 39223438976,
      "step": 49854
    },
    {
      "epoch": 5.289093995332061,
      "grad_norm": 0.8044880246936266,
      "learning_rate": 2.9664925406914973e-05,
      "loss": 1.2363,
      "num_input_tokens_seen": 39224225648,
      "step": 49855
    },
    {
      "epoch": 5.289200084871632,
      "grad_norm": 0.6138015800159377,
      "learning_rate": 2.966424264234977e-05,
      "loss": 1.1765,
      "num_input_tokens_seen": 39225012496,
      "step": 49856
    },
    {
      "epoch": 5.289306174411203,
      "grad_norm": 0.8934853364053587,
      "learning_rate": 2.9663559874180187e-05,
      "loss": 1.2022,
      "num_input_tokens_seen": 39225799280,
      "step": 49857
    },
    {
      "epoch": 5.289412263950775,
      "grad_norm": 0.6181902011071344,
      "learning_rate": 2.9662877102406738e-05,
      "loss": 1.2123,
      "num_input_tokens_seen": 39226585984,
      "step": 49858
    },
    {
      "epoch": 5.289518353490346,
      "grad_norm": 0.6484401840902624,
      "learning_rate": 2.9662194327029947e-05,
      "loss": 1.0776,
      "num_input_tokens_seen": 39227372736,
      "step": 49859
    },
    {
      "epoch": 5.2896244430299175,
      "grad_norm": 0.7006487020059846,
      "learning_rate": 2.9661511548050358e-05,
      "loss": 1.1292,
      "num_input_tokens_seen": 39228159600,
      "step": 49860
    },
    {
      "epoch": 5.2897305325694886,
      "grad_norm": 0.5766720643747495,
      "learning_rate": 2.9660828765468484e-05,
      "loss": 1.0844,
      "num_input_tokens_seen": 39228946448,
      "step": 49861
    },
    {
      "epoch": 5.2898366221090605,
      "grad_norm": 0.6609148122194715,
      "learning_rate": 2.966014597928486e-05,
      "loss": 1.1746,
      "num_input_tokens_seen": 39229733248,
      "step": 49862
    },
    {
      "epoch": 5.2899427116486315,
      "grad_norm": 0.6286259102507987,
      "learning_rate": 2.9659463189500015e-05,
      "loss": 1.1471,
      "num_input_tokens_seen": 39230520000,
      "step": 49863
    },
    {
      "epoch": 5.2900488011882025,
      "grad_norm": 0.6774711130878981,
      "learning_rate": 2.9658780396114473e-05,
      "loss": 1.1723,
      "num_input_tokens_seen": 39231306736,
      "step": 49864
    },
    {
      "epoch": 5.2901548907277745,
      "grad_norm": 0.6669420016996013,
      "learning_rate": 2.965809759912876e-05,
      "loss": 1.135,
      "num_input_tokens_seen": 39232093616,
      "step": 49865
    },
    {
      "epoch": 5.2902609802673455,
      "grad_norm": 0.6422374817174111,
      "learning_rate": 2.9657414798543408e-05,
      "loss": 1.0633,
      "num_input_tokens_seen": 39232880384,
      "step": 49866
    },
    {
      "epoch": 5.290367069806917,
      "grad_norm": 0.9757185010166588,
      "learning_rate": 2.9656731994358938e-05,
      "loss": 1.1614,
      "num_input_tokens_seen": 39233667104,
      "step": 49867
    },
    {
      "epoch": 5.290473159346488,
      "grad_norm": 0.637089581809522,
      "learning_rate": 2.9656049186575886e-05,
      "loss": 1.1514,
      "num_input_tokens_seen": 39234453808,
      "step": 49868
    },
    {
      "epoch": 5.2905792488860595,
      "grad_norm": 0.9705462969131372,
      "learning_rate": 2.9655366375194776e-05,
      "loss": 1.192,
      "num_input_tokens_seen": 39235240544,
      "step": 49869
    },
    {
      "epoch": 5.290685338425631,
      "grad_norm": 0.7100726594190582,
      "learning_rate": 2.9654683560216135e-05,
      "loss": 1.2021,
      "num_input_tokens_seen": 39236027216,
      "step": 49870
    },
    {
      "epoch": 5.290791427965202,
      "grad_norm": 1.0284086391379248,
      "learning_rate": 2.9654000741640488e-05,
      "loss": 1.1835,
      "num_input_tokens_seen": 39236813952,
      "step": 49871
    },
    {
      "epoch": 5.290897517504774,
      "grad_norm": 0.9131901532222086,
      "learning_rate": 2.9653317919468372e-05,
      "loss": 1.1985,
      "num_input_tokens_seen": 39237600720,
      "step": 49872
    },
    {
      "epoch": 5.291003607044345,
      "grad_norm": 0.8104046618714106,
      "learning_rate": 2.96526350937003e-05,
      "loss": 1.1758,
      "num_input_tokens_seen": 39238387328,
      "step": 49873
    },
    {
      "epoch": 5.291109696583916,
      "grad_norm": 0.9235807168881774,
      "learning_rate": 2.9651952264336813e-05,
      "loss": 1.3642,
      "num_input_tokens_seen": 39239174064,
      "step": 49874
    },
    {
      "epoch": 5.291215786123488,
      "grad_norm": 0.5707672847088449,
      "learning_rate": 2.965126943137843e-05,
      "loss": 1.2053,
      "num_input_tokens_seen": 39239960864,
      "step": 49875
    },
    {
      "epoch": 5.291321875663059,
      "grad_norm": 0.6695014517497877,
      "learning_rate": 2.965058659482569e-05,
      "loss": 1.2006,
      "num_input_tokens_seen": 39240747568,
      "step": 49876
    },
    {
      "epoch": 5.291427965202631,
      "grad_norm": 0.773775375231482,
      "learning_rate": 2.9649903754679102e-05,
      "loss": 1.0816,
      "num_input_tokens_seen": 39241534224,
      "step": 49877
    },
    {
      "epoch": 5.291534054742202,
      "grad_norm": 0.7062705776397238,
      "learning_rate": 2.9649220910939217e-05,
      "loss": 1.1774,
      "num_input_tokens_seen": 39242321024,
      "step": 49878
    },
    {
      "epoch": 5.291640144281774,
      "grad_norm": 0.6097276116635693,
      "learning_rate": 2.964853806360654e-05,
      "loss": 1.1261,
      "num_input_tokens_seen": 39243107792,
      "step": 49879
    },
    {
      "epoch": 5.291746233821345,
      "grad_norm": 0.8865224513855557,
      "learning_rate": 2.964785521268162e-05,
      "loss": 1.2122,
      "num_input_tokens_seen": 39243894560,
      "step": 49880
    },
    {
      "epoch": 5.291852323360916,
      "grad_norm": 0.5642162043987635,
      "learning_rate": 2.964717235816497e-05,
      "loss": 1.1964,
      "num_input_tokens_seen": 39244681376,
      "step": 49881
    },
    {
      "epoch": 5.291958412900488,
      "grad_norm": 0.6121587649479564,
      "learning_rate": 2.9646489500057117e-05,
      "loss": 1.1975,
      "num_input_tokens_seen": 39245468096,
      "step": 49882
    },
    {
      "epoch": 5.292064502440059,
      "grad_norm": 0.7042123164575924,
      "learning_rate": 2.9645806638358598e-05,
      "loss": 1.225,
      "num_input_tokens_seen": 39246254768,
      "step": 49883
    },
    {
      "epoch": 5.292170591979631,
      "grad_norm": 0.6315035120449387,
      "learning_rate": 2.9645123773069937e-05,
      "loss": 1.2109,
      "num_input_tokens_seen": 39247041520,
      "step": 49884
    },
    {
      "epoch": 5.292276681519202,
      "grad_norm": 0.6372792952488852,
      "learning_rate": 2.9644440904191652e-05,
      "loss": 1.0127,
      "num_input_tokens_seen": 39247828320,
      "step": 49885
    },
    {
      "epoch": 5.292382771058773,
      "grad_norm": 0.6648694012646542,
      "learning_rate": 2.9643758031724288e-05,
      "loss": 1.1566,
      "num_input_tokens_seen": 39248615120,
      "step": 49886
    },
    {
      "epoch": 5.292488860598345,
      "grad_norm": 0.6415943372379079,
      "learning_rate": 2.9643075155668358e-05,
      "loss": 1.2012,
      "num_input_tokens_seen": 39249401872,
      "step": 49887
    },
    {
      "epoch": 5.292594950137916,
      "grad_norm": 0.6153147838747206,
      "learning_rate": 2.96423922760244e-05,
      "loss": 1.1854,
      "num_input_tokens_seen": 39250188640,
      "step": 49888
    },
    {
      "epoch": 5.292701039677488,
      "grad_norm": 0.8689884875409289,
      "learning_rate": 2.9641709392792938e-05,
      "loss": 1.1944,
      "num_input_tokens_seen": 39250975456,
      "step": 49889
    },
    {
      "epoch": 5.292807129217059,
      "grad_norm": 0.724102770971223,
      "learning_rate": 2.9641026505974495e-05,
      "loss": 1.1766,
      "num_input_tokens_seen": 39251762256,
      "step": 49890
    },
    {
      "epoch": 5.292913218756631,
      "grad_norm": 0.7082151689659821,
      "learning_rate": 2.964034361556961e-05,
      "loss": 1.1114,
      "num_input_tokens_seen": 39252549024,
      "step": 49891
    },
    {
      "epoch": 5.293019308296202,
      "grad_norm": 0.7630101968164045,
      "learning_rate": 2.96396607215788e-05,
      "loss": 1.1523,
      "num_input_tokens_seen": 39253335744,
      "step": 49892
    },
    {
      "epoch": 5.293125397835773,
      "grad_norm": 0.7758598701875002,
      "learning_rate": 2.9638977824002588e-05,
      "loss": 1.2409,
      "num_input_tokens_seen": 39254122528,
      "step": 49893
    },
    {
      "epoch": 5.293231487375345,
      "grad_norm": 0.6894615986844598,
      "learning_rate": 2.9638294922841526e-05,
      "loss": 1.162,
      "num_input_tokens_seen": 39254909248,
      "step": 49894
    },
    {
      "epoch": 5.293337576914916,
      "grad_norm": 0.7598727852534644,
      "learning_rate": 2.9637612018096115e-05,
      "loss": 1.2487,
      "num_input_tokens_seen": 39255695904,
      "step": 49895
    },
    {
      "epoch": 5.293443666454488,
      "grad_norm": 0.6544540125721279,
      "learning_rate": 2.963692910976689e-05,
      "loss": 1.1249,
      "num_input_tokens_seen": 39256482720,
      "step": 49896
    },
    {
      "epoch": 5.293549755994059,
      "grad_norm": 0.6030247216983248,
      "learning_rate": 2.9636246197854396e-05,
      "loss": 1.1501,
      "num_input_tokens_seen": 39257269584,
      "step": 49897
    },
    {
      "epoch": 5.29365584553363,
      "grad_norm": 0.8027272699332001,
      "learning_rate": 2.963556328235914e-05,
      "loss": 1.17,
      "num_input_tokens_seen": 39258056384,
      "step": 49898
    },
    {
      "epoch": 5.293761935073202,
      "grad_norm": 0.6538466218339556,
      "learning_rate": 2.9634880363281652e-05,
      "loss": 1.1616,
      "num_input_tokens_seen": 39258843072,
      "step": 49899
    },
    {
      "epoch": 5.293868024612773,
      "grad_norm": 0.7287509431925687,
      "learning_rate": 2.963419744062247e-05,
      "loss": 1.1203,
      "num_input_tokens_seen": 39259629920,
      "step": 49900
    },
    {
      "epoch": 5.293974114152345,
      "grad_norm": 0.548988614122353,
      "learning_rate": 2.9633514514382114e-05,
      "loss": 1.1842,
      "num_input_tokens_seen": 39260416768,
      "step": 49901
    },
    {
      "epoch": 5.294080203691916,
      "grad_norm": 0.6551561032074503,
      "learning_rate": 2.9632831584561117e-05,
      "loss": 1.1435,
      "num_input_tokens_seen": 39261203408,
      "step": 49902
    },
    {
      "epoch": 5.294186293231487,
      "grad_norm": 0.5969494977198723,
      "learning_rate": 2.9632148651159995e-05,
      "loss": 1.1426,
      "num_input_tokens_seen": 39261990032,
      "step": 49903
    },
    {
      "epoch": 5.294292382771059,
      "grad_norm": 0.9090566969887931,
      "learning_rate": 2.9631465714179292e-05,
      "loss": 1.1974,
      "num_input_tokens_seen": 39262776832,
      "step": 49904
    },
    {
      "epoch": 5.29439847231063,
      "grad_norm": 0.6896845972592702,
      "learning_rate": 2.9630782773619526e-05,
      "loss": 1.2407,
      "num_input_tokens_seen": 39263563616,
      "step": 49905
    },
    {
      "epoch": 5.294504561850202,
      "grad_norm": 0.8187104908223642,
      "learning_rate": 2.9630099829481235e-05,
      "loss": 1.1298,
      "num_input_tokens_seen": 39264350480,
      "step": 49906
    },
    {
      "epoch": 5.294610651389773,
      "grad_norm": 0.6306667471711723,
      "learning_rate": 2.9629416881764925e-05,
      "loss": 1.123,
      "num_input_tokens_seen": 39265137312,
      "step": 49907
    },
    {
      "epoch": 5.294716740929345,
      "grad_norm": 0.5616142567771255,
      "learning_rate": 2.9628733930471147e-05,
      "loss": 1.0772,
      "num_input_tokens_seen": 39265924112,
      "step": 49908
    },
    {
      "epoch": 5.294822830468916,
      "grad_norm": 0.6762506446818541,
      "learning_rate": 2.9628050975600417e-05,
      "loss": 1.1548,
      "num_input_tokens_seen": 39266710864,
      "step": 49909
    },
    {
      "epoch": 5.294928920008487,
      "grad_norm": 0.7443850852299048,
      "learning_rate": 2.9627368017153264e-05,
      "loss": 1.0846,
      "num_input_tokens_seen": 39267497648,
      "step": 49910
    },
    {
      "epoch": 5.295035009548059,
      "grad_norm": 0.6219439175498634,
      "learning_rate": 2.9626685055130215e-05,
      "loss": 1.1574,
      "num_input_tokens_seen": 39268284480,
      "step": 49911
    },
    {
      "epoch": 5.29514109908763,
      "grad_norm": 0.8137928839897178,
      "learning_rate": 2.9626002089531802e-05,
      "loss": 1.154,
      "num_input_tokens_seen": 39269071248,
      "step": 49912
    },
    {
      "epoch": 5.295247188627202,
      "grad_norm": 0.6739977045847206,
      "learning_rate": 2.9625319120358548e-05,
      "loss": 1.0824,
      "num_input_tokens_seen": 39269857984,
      "step": 49913
    },
    {
      "epoch": 5.295353278166773,
      "grad_norm": 0.7032732220568059,
      "learning_rate": 2.9624636147610984e-05,
      "loss": 1.1615,
      "num_input_tokens_seen": 39270644736,
      "step": 49914
    },
    {
      "epoch": 5.295459367706345,
      "grad_norm": 0.5625115469714255,
      "learning_rate": 2.9623953171289643e-05,
      "loss": 1.1161,
      "num_input_tokens_seen": 39271431488,
      "step": 49915
    },
    {
      "epoch": 5.295565457245916,
      "grad_norm": 0.7209288301671773,
      "learning_rate": 2.9623270191395036e-05,
      "loss": 1.1802,
      "num_input_tokens_seen": 39272218272,
      "step": 49916
    },
    {
      "epoch": 5.295671546785487,
      "grad_norm": 0.6913892280723025,
      "learning_rate": 2.962258720792771e-05,
      "loss": 1.1868,
      "num_input_tokens_seen": 39273005120,
      "step": 49917
    },
    {
      "epoch": 5.295777636325059,
      "grad_norm": 0.9920718999789986,
      "learning_rate": 2.9621904220888174e-05,
      "loss": 1.192,
      "num_input_tokens_seen": 39273791936,
      "step": 49918
    },
    {
      "epoch": 5.29588372586463,
      "grad_norm": 0.7028300837776316,
      "learning_rate": 2.962122123027698e-05,
      "loss": 1.2345,
      "num_input_tokens_seen": 39274578608,
      "step": 49919
    },
    {
      "epoch": 5.2959898154042016,
      "grad_norm": 0.6516552563014375,
      "learning_rate": 2.9620538236094635e-05,
      "loss": 1.1596,
      "num_input_tokens_seen": 39275365376,
      "step": 49920
    },
    {
      "epoch": 5.296095904943773,
      "grad_norm": 0.7229581427759448,
      "learning_rate": 2.961985523834167e-05,
      "loss": 1.1747,
      "num_input_tokens_seen": 39276152128,
      "step": 49921
    },
    {
      "epoch": 5.296201994483344,
      "grad_norm": 0.6196928194716227,
      "learning_rate": 2.9619172237018622e-05,
      "loss": 1.2013,
      "num_input_tokens_seen": 39276938928,
      "step": 49922
    },
    {
      "epoch": 5.2963080840229155,
      "grad_norm": 0.7038443690309661,
      "learning_rate": 2.9618489232126012e-05,
      "loss": 1.0386,
      "num_input_tokens_seen": 39277725712,
      "step": 49923
    },
    {
      "epoch": 5.296414173562487,
      "grad_norm": 0.817441927519246,
      "learning_rate": 2.961780622366437e-05,
      "loss": 1.0402,
      "num_input_tokens_seen": 39278512576,
      "step": 49924
    },
    {
      "epoch": 5.2965202631020585,
      "grad_norm": 0.7168214707047519,
      "learning_rate": 2.9617123211634212e-05,
      "loss": 1.1778,
      "num_input_tokens_seen": 39279299328,
      "step": 49925
    },
    {
      "epoch": 5.2966263526416295,
      "grad_norm": 0.7792525429510322,
      "learning_rate": 2.9616440196036088e-05,
      "loss": 1.2489,
      "num_input_tokens_seen": 39280086080,
      "step": 49926
    },
    {
      "epoch": 5.2967324421812005,
      "grad_norm": 0.6532323569112182,
      "learning_rate": 2.961575717687052e-05,
      "loss": 1.1331,
      "num_input_tokens_seen": 39280872816,
      "step": 49927
    },
    {
      "epoch": 5.2968385317207725,
      "grad_norm": 0.6568922863983437,
      "learning_rate": 2.961507415413801e-05,
      "loss": 1.234,
      "num_input_tokens_seen": 39281659504,
      "step": 49928
    },
    {
      "epoch": 5.2969446212603435,
      "grad_norm": 0.6364689576337565,
      "learning_rate": 2.9614391127839126e-05,
      "loss": 1.2193,
      "num_input_tokens_seen": 39282446272,
      "step": 49929
    },
    {
      "epoch": 5.297050710799915,
      "grad_norm": 0.7612005676966754,
      "learning_rate": 2.9613708097974362e-05,
      "loss": 1.2335,
      "num_input_tokens_seen": 39283232992,
      "step": 49930
    },
    {
      "epoch": 5.297156800339486,
      "grad_norm": 0.620688168473585,
      "learning_rate": 2.961302506454427e-05,
      "loss": 1.1059,
      "num_input_tokens_seen": 39284019712,
      "step": 49931
    },
    {
      "epoch": 5.2972628898790575,
      "grad_norm": 0.5953378371944771,
      "learning_rate": 2.9612342027549366e-05,
      "loss": 1.1102,
      "num_input_tokens_seen": 39284806416,
      "step": 49932
    },
    {
      "epoch": 5.297368979418629,
      "grad_norm": 0.8322849605328417,
      "learning_rate": 2.9611658986990175e-05,
      "loss": 1.0974,
      "num_input_tokens_seen": 39285593168,
      "step": 49933
    },
    {
      "epoch": 5.2974750689582,
      "grad_norm": 0.6851953721388154,
      "learning_rate": 2.961097594286723e-05,
      "loss": 1.1408,
      "num_input_tokens_seen": 39286379968,
      "step": 49934
    },
    {
      "epoch": 5.297581158497772,
      "grad_norm": 0.7777296527598568,
      "learning_rate": 2.9610292895181063e-05,
      "loss": 1.1999,
      "num_input_tokens_seen": 39287166704,
      "step": 49935
    },
    {
      "epoch": 5.297687248037343,
      "grad_norm": 0.6836149002412777,
      "learning_rate": 2.960960984393219e-05,
      "loss": 1.0893,
      "num_input_tokens_seen": 39287953488,
      "step": 49936
    },
    {
      "epoch": 5.297793337576915,
      "grad_norm": 0.592769262525071,
      "learning_rate": 2.960892678912115e-05,
      "loss": 1.0641,
      "num_input_tokens_seen": 39288740272,
      "step": 49937
    },
    {
      "epoch": 5.297899427116486,
      "grad_norm": 0.6674880943143868,
      "learning_rate": 2.960824373074847e-05,
      "loss": 1.2508,
      "num_input_tokens_seen": 39289527104,
      "step": 49938
    },
    {
      "epoch": 5.298005516656057,
      "grad_norm": 0.7403542984058822,
      "learning_rate": 2.9607560668814665e-05,
      "loss": 1.1918,
      "num_input_tokens_seen": 39290313776,
      "step": 49939
    },
    {
      "epoch": 5.298111606195629,
      "grad_norm": 0.6990218202541061,
      "learning_rate": 2.960687760332028e-05,
      "loss": 1.2539,
      "num_input_tokens_seen": 39291100704,
      "step": 49940
    },
    {
      "epoch": 5.2982176957352,
      "grad_norm": 0.7375768966993793,
      "learning_rate": 2.9606194534265836e-05,
      "loss": 1.1035,
      "num_input_tokens_seen": 39291887424,
      "step": 49941
    },
    {
      "epoch": 5.298323785274772,
      "grad_norm": 0.6146182016547959,
      "learning_rate": 2.960551146165185e-05,
      "loss": 1.1222,
      "num_input_tokens_seen": 39292674224,
      "step": 49942
    },
    {
      "epoch": 5.298429874814343,
      "grad_norm": 0.8469823190762493,
      "learning_rate": 2.960482838547887e-05,
      "loss": 1.1991,
      "num_input_tokens_seen": 39293461040,
      "step": 49943
    },
    {
      "epoch": 5.298535964353915,
      "grad_norm": 0.7013279824974679,
      "learning_rate": 2.9604145305747415e-05,
      "loss": 1.2029,
      "num_input_tokens_seen": 39294247840,
      "step": 49944
    },
    {
      "epoch": 5.298642053893486,
      "grad_norm": 0.5797812580656798,
      "learning_rate": 2.9603462222458e-05,
      "loss": 1.2255,
      "num_input_tokens_seen": 39295034640,
      "step": 49945
    },
    {
      "epoch": 5.298748143433057,
      "grad_norm": 0.8000166962841945,
      "learning_rate": 2.9602779135611174e-05,
      "loss": 1.2214,
      "num_input_tokens_seen": 39295821376,
      "step": 49946
    },
    {
      "epoch": 5.298854232972629,
      "grad_norm": 1.068428561051718,
      "learning_rate": 2.960209604520745e-05,
      "loss": 1.2396,
      "num_input_tokens_seen": 39296608096,
      "step": 49947
    },
    {
      "epoch": 5.2989603225122,
      "grad_norm": 0.5877883059453916,
      "learning_rate": 2.9601412951247372e-05,
      "loss": 1.0537,
      "num_input_tokens_seen": 39297394896,
      "step": 49948
    },
    {
      "epoch": 5.299066412051772,
      "grad_norm": 0.855508302419375,
      "learning_rate": 2.9600729853731445e-05,
      "loss": 1.1298,
      "num_input_tokens_seen": 39298181632,
      "step": 49949
    },
    {
      "epoch": 5.299172501591343,
      "grad_norm": 1.255251678593751,
      "learning_rate": 2.960004675266021e-05,
      "loss": 1.2826,
      "num_input_tokens_seen": 39298968400,
      "step": 49950
    },
    {
      "epoch": 5.299278591130914,
      "grad_norm": 0.6041249329115832,
      "learning_rate": 2.95993636480342e-05,
      "loss": 1.1452,
      "num_input_tokens_seen": 39299755168,
      "step": 49951
    },
    {
      "epoch": 5.299384680670486,
      "grad_norm": 0.9448578985593956,
      "learning_rate": 2.9598680539853935e-05,
      "loss": 1.0868,
      "num_input_tokens_seen": 39300541936,
      "step": 49952
    },
    {
      "epoch": 5.299490770210057,
      "grad_norm": 1.1416412563083254,
      "learning_rate": 2.959799742811994e-05,
      "loss": 1.1267,
      "num_input_tokens_seen": 39301328640,
      "step": 49953
    },
    {
      "epoch": 5.299596859749629,
      "grad_norm": 0.7253030326538304,
      "learning_rate": 2.959731431283275e-05,
      "loss": 1.199,
      "num_input_tokens_seen": 39302115360,
      "step": 49954
    },
    {
      "epoch": 5.2997029492892,
      "grad_norm": 1.119675193179804,
      "learning_rate": 2.9596631193992895e-05,
      "loss": 1.128,
      "num_input_tokens_seen": 39302902096,
      "step": 49955
    },
    {
      "epoch": 5.299809038828771,
      "grad_norm": 1.2720081865288273,
      "learning_rate": 2.959594807160089e-05,
      "loss": 1.0821,
      "num_input_tokens_seen": 39303689008,
      "step": 49956
    },
    {
      "epoch": 5.299915128368343,
      "grad_norm": 0.7542109948027361,
      "learning_rate": 2.9595264945657282e-05,
      "loss": 1.1665,
      "num_input_tokens_seen": 39304475760,
      "step": 49957
    },
    {
      "epoch": 5.300021217907914,
      "grad_norm": 1.0934733921268887,
      "learning_rate": 2.959458181616258e-05,
      "loss": 1.2123,
      "num_input_tokens_seen": 39305262496,
      "step": 49958
    },
    {
      "epoch": 5.300127307447486,
      "grad_norm": 0.6528303140293026,
      "learning_rate": 2.9593898683117323e-05,
      "loss": 1.0702,
      "num_input_tokens_seen": 39306049216,
      "step": 49959
    },
    {
      "epoch": 5.300233396987057,
      "grad_norm": 0.8436855238165776,
      "learning_rate": 2.9593215546522037e-05,
      "loss": 1.1515,
      "num_input_tokens_seen": 39306835936,
      "step": 49960
    },
    {
      "epoch": 5.300339486526628,
      "grad_norm": 0.6099951976489735,
      "learning_rate": 2.959253240637725e-05,
      "loss": 1.153,
      "num_input_tokens_seen": 39307622720,
      "step": 49961
    },
    {
      "epoch": 5.3004455760662,
      "grad_norm": 0.8561443719150702,
      "learning_rate": 2.959184926268348e-05,
      "loss": 1.1547,
      "num_input_tokens_seen": 39308409424,
      "step": 49962
    },
    {
      "epoch": 5.300551665605771,
      "grad_norm": 1.5840682850369656,
      "learning_rate": 2.9591166115441273e-05,
      "loss": 1.2391,
      "num_input_tokens_seen": 39309196208,
      "step": 49963
    },
    {
      "epoch": 5.300657755145343,
      "grad_norm": 0.993022662447261,
      "learning_rate": 2.9590482964651134e-05,
      "loss": 1.1316,
      "num_input_tokens_seen": 39309983072,
      "step": 49964
    },
    {
      "epoch": 5.300763844684914,
      "grad_norm": 1.4185967233112968,
      "learning_rate": 2.9589799810313618e-05,
      "loss": 1.1912,
      "num_input_tokens_seen": 39310769888,
      "step": 49965
    },
    {
      "epoch": 5.300869934224486,
      "grad_norm": 1.485149293903773,
      "learning_rate": 2.958911665242924e-05,
      "loss": 1.217,
      "num_input_tokens_seen": 39311556640,
      "step": 49966
    },
    {
      "epoch": 5.300976023764057,
      "grad_norm": 0.8801580918925853,
      "learning_rate": 2.9588433490998514e-05,
      "loss": 1.1756,
      "num_input_tokens_seen": 39312343360,
      "step": 49967
    },
    {
      "epoch": 5.301082113303628,
      "grad_norm": 0.6698394973557753,
      "learning_rate": 2.958775032602199e-05,
      "loss": 1.1773,
      "num_input_tokens_seen": 39313130096,
      "step": 49968
    },
    {
      "epoch": 5.3011882028432,
      "grad_norm": 1.047545194169433,
      "learning_rate": 2.9587067157500193e-05,
      "loss": 1.2126,
      "num_input_tokens_seen": 39313916816,
      "step": 49969
    },
    {
      "epoch": 5.301294292382771,
      "grad_norm": 1.3266825869856853,
      "learning_rate": 2.9586383985433637e-05,
      "loss": 1.2464,
      "num_input_tokens_seen": 39314703552,
      "step": 49970
    },
    {
      "epoch": 5.301400381922343,
      "grad_norm": 0.7993981812457851,
      "learning_rate": 2.9585700809822858e-05,
      "loss": 1.1496,
      "num_input_tokens_seen": 39315490352,
      "step": 49971
    },
    {
      "epoch": 5.301506471461914,
      "grad_norm": 0.6672117420016487,
      "learning_rate": 2.958501763066838e-05,
      "loss": 1.0704,
      "num_input_tokens_seen": 39316277184,
      "step": 49972
    },
    {
      "epoch": 5.301612561001486,
      "grad_norm": 1.2418357448164028,
      "learning_rate": 2.9584334447970742e-05,
      "loss": 1.1889,
      "num_input_tokens_seen": 39317063872,
      "step": 49973
    },
    {
      "epoch": 5.301718650541057,
      "grad_norm": 0.99962441356375,
      "learning_rate": 2.9583651261730465e-05,
      "loss": 1.1627,
      "num_input_tokens_seen": 39317850624,
      "step": 49974
    },
    {
      "epoch": 5.301824740080628,
      "grad_norm": 0.7982060671264675,
      "learning_rate": 2.9582968071948077e-05,
      "loss": 1.1405,
      "num_input_tokens_seen": 39318637376,
      "step": 49975
    },
    {
      "epoch": 5.3019308296202,
      "grad_norm": 1.2245129862364545,
      "learning_rate": 2.95822848786241e-05,
      "loss": 1.0759,
      "num_input_tokens_seen": 39319424128,
      "step": 49976
    },
    {
      "epoch": 5.302036919159771,
      "grad_norm": 0.7990021253898196,
      "learning_rate": 2.9581601681759073e-05,
      "loss": 1.1956,
      "num_input_tokens_seen": 39320210816,
      "step": 49977
    },
    {
      "epoch": 5.302143008699343,
      "grad_norm": 0.9093814065897105,
      "learning_rate": 2.958091848135352e-05,
      "loss": 1.2175,
      "num_input_tokens_seen": 39320997568,
      "step": 49978
    },
    {
      "epoch": 5.302249098238914,
      "grad_norm": 0.7626960214347368,
      "learning_rate": 2.9580235277407963e-05,
      "loss": 1.1355,
      "num_input_tokens_seen": 39321784304,
      "step": 49979
    },
    {
      "epoch": 5.302355187778485,
      "grad_norm": 0.7155923025158787,
      "learning_rate": 2.9579552069922938e-05,
      "loss": 1.1594,
      "num_input_tokens_seen": 39322571088,
      "step": 49980
    },
    {
      "epoch": 5.302461277318057,
      "grad_norm": 0.6509478387162925,
      "learning_rate": 2.9578868858898972e-05,
      "loss": 1.2161,
      "num_input_tokens_seen": 39323357808,
      "step": 49981
    },
    {
      "epoch": 5.302567366857628,
      "grad_norm": 0.7664380406955551,
      "learning_rate": 2.957818564433658e-05,
      "loss": 1.1475,
      "num_input_tokens_seen": 39324144528,
      "step": 49982
    },
    {
      "epoch": 5.3026734563972,
      "grad_norm": 0.6713849164436826,
      "learning_rate": 2.9577502426236315e-05,
      "loss": 1.112,
      "num_input_tokens_seen": 39324931248,
      "step": 49983
    },
    {
      "epoch": 5.302779545936771,
      "grad_norm": 0.8286228305418997,
      "learning_rate": 2.9576819204598684e-05,
      "loss": 1.2265,
      "num_input_tokens_seen": 39325718112,
      "step": 49984
    },
    {
      "epoch": 5.302885635476342,
      "grad_norm": 0.7346752880284853,
      "learning_rate": 2.9576135979424213e-05,
      "loss": 1.1503,
      "num_input_tokens_seen": 39326504848,
      "step": 49985
    },
    {
      "epoch": 5.3029917250159135,
      "grad_norm": 0.7930376459487823,
      "learning_rate": 2.957545275071345e-05,
      "loss": 1.1661,
      "num_input_tokens_seen": 39327291664,
      "step": 49986
    },
    {
      "epoch": 5.303097814555485,
      "grad_norm": 0.9473412845623191,
      "learning_rate": 2.9574769518466904e-05,
      "loss": 1.1246,
      "num_input_tokens_seen": 39328078480,
      "step": 49987
    },
    {
      "epoch": 5.3032039040950565,
      "grad_norm": 0.7151519136140163,
      "learning_rate": 2.9574086282685114e-05,
      "loss": 1.2199,
      "num_input_tokens_seen": 39328865200,
      "step": 49988
    },
    {
      "epoch": 5.3033099936346275,
      "grad_norm": 0.7777868951704132,
      "learning_rate": 2.9573403043368604e-05,
      "loss": 1.0966,
      "num_input_tokens_seen": 39329651936,
      "step": 49989
    },
    {
      "epoch": 5.303416083174199,
      "grad_norm": 0.9757086544747472,
      "learning_rate": 2.95727198005179e-05,
      "loss": 1.1419,
      "num_input_tokens_seen": 39330438688,
      "step": 49990
    },
    {
      "epoch": 5.3035221727137705,
      "grad_norm": 0.6189814372170359,
      "learning_rate": 2.9572036554133537e-05,
      "loss": 1.1871,
      "num_input_tokens_seen": 39331225520,
      "step": 49991
    },
    {
      "epoch": 5.3036282622533415,
      "grad_norm": 0.9076496928984735,
      "learning_rate": 2.9571353304216038e-05,
      "loss": 1.1212,
      "num_input_tokens_seen": 39332012256,
      "step": 49992
    },
    {
      "epoch": 5.303734351792913,
      "grad_norm": 0.8611250997373211,
      "learning_rate": 2.9570670050765926e-05,
      "loss": 1.2086,
      "num_input_tokens_seen": 39332798992,
      "step": 49993
    },
    {
      "epoch": 5.3038404413324844,
      "grad_norm": 0.6326448657442795,
      "learning_rate": 2.956998679378373e-05,
      "loss": 1.0843,
      "num_input_tokens_seen": 39333585760,
      "step": 49994
    },
    {
      "epoch": 5.303946530872056,
      "grad_norm": 0.6612708185976816,
      "learning_rate": 2.956930353327e-05,
      "loss": 1.1157,
      "num_input_tokens_seen": 39334372544,
      "step": 49995
    },
    {
      "epoch": 5.304052620411627,
      "grad_norm": 0.870131060092667,
      "learning_rate": 2.956862026922523e-05,
      "loss": 1.1585,
      "num_input_tokens_seen": 39335159280,
      "step": 49996
    },
    {
      "epoch": 5.304158709951198,
      "grad_norm": 0.6736621938792142,
      "learning_rate": 2.956793700164997e-05,
      "loss": 1.2296,
      "num_input_tokens_seen": 39335946080,
      "step": 49997
    },
    {
      "epoch": 5.30426479949077,
      "grad_norm": 0.909543883593072,
      "learning_rate": 2.9567253730544747e-05,
      "loss": 1.1722,
      "num_input_tokens_seen": 39336732896,
      "step": 49998
    },
    {
      "epoch": 5.304370889030341,
      "grad_norm": 0.6162744367138309,
      "learning_rate": 2.9566570455910077e-05,
      "loss": 1.1023,
      "num_input_tokens_seen": 39337519696,
      "step": 49999
    },
    {
      "epoch": 5.304476978569913,
      "grad_norm": 0.9042390535543293,
      "learning_rate": 2.9565887177746498e-05,
      "loss": 1.2442,
      "num_input_tokens_seen": 39338306464,
      "step": 50000
    },
    {
      "epoch": 5.304476978569913,
      "eval_loss": 1.5487903356552124,
      "eval_runtime": 64.6132,
      "eval_samples_per_second": 46.43,
      "eval_steps_per_second": 0.495,
      "num_input_tokens_seen": 39338306464,
      "step": 50000
    },
    {
      "epoch": 5.304583068109484,
      "grad_norm": 0.6444895216313872,
      "learning_rate": 2.956520389605454e-05,
      "loss": 1.1254,
      "num_input_tokens_seen": 39339093232,
      "step": 50001
    },
    {
      "epoch": 5.304689157649056,
      "grad_norm": 0.6838829536020155,
      "learning_rate": 2.9564520610834716e-05,
      "loss": 1.2008,
      "num_input_tokens_seen": 39339880000,
      "step": 50002
    },
    {
      "epoch": 5.304795247188627,
      "grad_norm": 0.9105113135977133,
      "learning_rate": 2.9563837322087572e-05,
      "loss": 1.1591,
      "num_input_tokens_seen": 39340666672,
      "step": 50003
    },
    {
      "epoch": 5.304901336728198,
      "grad_norm": 0.5545519880015439,
      "learning_rate": 2.9563154029813628e-05,
      "loss": 1.2396,
      "num_input_tokens_seen": 39341453392,
      "step": 50004
    },
    {
      "epoch": 5.30500742626777,
      "grad_norm": 0.8167724207230626,
      "learning_rate": 2.956247073401341e-05,
      "loss": 1.2084,
      "num_input_tokens_seen": 39342240208,
      "step": 50005
    },
    {
      "epoch": 5.305113515807341,
      "grad_norm": 0.8384022643127655,
      "learning_rate": 2.956178743468745e-05,
      "loss": 1.2216,
      "num_input_tokens_seen": 39343026944,
      "step": 50006
    },
    {
      "epoch": 5.305219605346913,
      "grad_norm": 0.6808226190077677,
      "learning_rate": 2.9561104131836272e-05,
      "loss": 1.0442,
      "num_input_tokens_seen": 39343813792,
      "step": 50007
    },
    {
      "epoch": 5.305325694886484,
      "grad_norm": 1.045980635042907,
      "learning_rate": 2.9560420825460404e-05,
      "loss": 1.1344,
      "num_input_tokens_seen": 39344600528,
      "step": 50008
    },
    {
      "epoch": 5.305431784426055,
      "grad_norm": 0.8166390828406503,
      "learning_rate": 2.955973751556039e-05,
      "loss": 1.2097,
      "num_input_tokens_seen": 39345387216,
      "step": 50009
    },
    {
      "epoch": 5.305537873965627,
      "grad_norm": 0.8208099848904175,
      "learning_rate": 2.9559054202136726e-05,
      "loss": 1.1947,
      "num_input_tokens_seen": 39346173936,
      "step": 50010
    },
    {
      "epoch": 5.305643963505198,
      "grad_norm": 0.6840500068347525,
      "learning_rate": 2.955837088518997e-05,
      "loss": 1.1349,
      "num_input_tokens_seen": 39346960784,
      "step": 50011
    },
    {
      "epoch": 5.30575005304477,
      "grad_norm": 0.9015849947795874,
      "learning_rate": 2.955768756472064e-05,
      "loss": 1.107,
      "num_input_tokens_seen": 39347747504,
      "step": 50012
    },
    {
      "epoch": 5.305856142584341,
      "grad_norm": 0.6921295040375154,
      "learning_rate": 2.9557004240729257e-05,
      "loss": 1.1577,
      "num_input_tokens_seen": 39348534320,
      "step": 50013
    },
    {
      "epoch": 5.305962232123912,
      "grad_norm": 0.7208344431474445,
      "learning_rate": 2.9556320913216363e-05,
      "loss": 1.0769,
      "num_input_tokens_seen": 39349321040,
      "step": 50014
    },
    {
      "epoch": 5.306068321663484,
      "grad_norm": 0.5881525567747767,
      "learning_rate": 2.9555637582182472e-05,
      "loss": 1.2668,
      "num_input_tokens_seen": 39350107760,
      "step": 50015
    },
    {
      "epoch": 5.306174411203055,
      "grad_norm": 0.6523437147532308,
      "learning_rate": 2.955495424762812e-05,
      "loss": 1.03,
      "num_input_tokens_seen": 39350894672,
      "step": 50016
    },
    {
      "epoch": 5.306280500742627,
      "grad_norm": 0.8055518297317953,
      "learning_rate": 2.9554270909553832e-05,
      "loss": 1.1524,
      "num_input_tokens_seen": 39351681408,
      "step": 50017
    },
    {
      "epoch": 5.306386590282198,
      "grad_norm": 0.6245155889804169,
      "learning_rate": 2.955358756796014e-05,
      "loss": 1.1796,
      "num_input_tokens_seen": 39352468192,
      "step": 50018
    },
    {
      "epoch": 5.30649267982177,
      "grad_norm": 0.5812590326310976,
      "learning_rate": 2.9552904222847562e-05,
      "loss": 1.1048,
      "num_input_tokens_seen": 39353254976,
      "step": 50019
    },
    {
      "epoch": 5.306598769361341,
      "grad_norm": 0.669826742456435,
      "learning_rate": 2.955222087421663e-05,
      "loss": 1.1585,
      "num_input_tokens_seen": 39354041696,
      "step": 50020
    },
    {
      "epoch": 5.306704858900912,
      "grad_norm": 0.591700529696548,
      "learning_rate": 2.9551537522067884e-05,
      "loss": 1.1894,
      "num_input_tokens_seen": 39354828352,
      "step": 50021
    },
    {
      "epoch": 5.306810948440484,
      "grad_norm": 0.5859848840102724,
      "learning_rate": 2.955085416640184e-05,
      "loss": 1.0814,
      "num_input_tokens_seen": 39355615008,
      "step": 50022
    },
    {
      "epoch": 5.306917037980055,
      "grad_norm": 0.8136886107778458,
      "learning_rate": 2.9550170807219036e-05,
      "loss": 1.1599,
      "num_input_tokens_seen": 39356401824,
      "step": 50023
    },
    {
      "epoch": 5.307023127519627,
      "grad_norm": 0.6109649055282297,
      "learning_rate": 2.9549487444519984e-05,
      "loss": 1.0712,
      "num_input_tokens_seen": 39357188528,
      "step": 50024
    },
    {
      "epoch": 5.307129217059198,
      "grad_norm": 0.738183134117106,
      "learning_rate": 2.9548804078305226e-05,
      "loss": 1.1888,
      "num_input_tokens_seen": 39357975264,
      "step": 50025
    },
    {
      "epoch": 5.307235306598769,
      "grad_norm": 0.7123559052189503,
      "learning_rate": 2.954812070857529e-05,
      "loss": 1.2823,
      "num_input_tokens_seen": 39358761952,
      "step": 50026
    },
    {
      "epoch": 5.307341396138341,
      "grad_norm": 0.8986562269831426,
      "learning_rate": 2.9547437335330697e-05,
      "loss": 1.1452,
      "num_input_tokens_seen": 39359548688,
      "step": 50027
    },
    {
      "epoch": 5.307447485677912,
      "grad_norm": 0.9123376604818363,
      "learning_rate": 2.954675395857197e-05,
      "loss": 1.33,
      "num_input_tokens_seen": 39360335424,
      "step": 50028
    },
    {
      "epoch": 5.307553575217484,
      "grad_norm": 0.6165964764561027,
      "learning_rate": 2.9546070578299655e-05,
      "loss": 1.1114,
      "num_input_tokens_seen": 39361122272,
      "step": 50029
    },
    {
      "epoch": 5.307659664757055,
      "grad_norm": 1.3465658143678525,
      "learning_rate": 2.9545387194514267e-05,
      "loss": 1.1743,
      "num_input_tokens_seen": 39361909120,
      "step": 50030
    },
    {
      "epoch": 5.307765754296627,
      "grad_norm": 0.5776195392544345,
      "learning_rate": 2.9544703807216334e-05,
      "loss": 1.1001,
      "num_input_tokens_seen": 39362695888,
      "step": 50031
    },
    {
      "epoch": 5.307871843836198,
      "grad_norm": 0.6736575353536333,
      "learning_rate": 2.9544020416406393e-05,
      "loss": 1.0531,
      "num_input_tokens_seen": 39363482720,
      "step": 50032
    },
    {
      "epoch": 5.307977933375769,
      "grad_norm": 0.6465423613487344,
      "learning_rate": 2.954333702208496e-05,
      "loss": 1.1672,
      "num_input_tokens_seen": 39364269504,
      "step": 50033
    },
    {
      "epoch": 5.308084022915341,
      "grad_norm": 0.6169908556397611,
      "learning_rate": 2.9542653624252575e-05,
      "loss": 1.0877,
      "num_input_tokens_seen": 39365056288,
      "step": 50034
    },
    {
      "epoch": 5.308190112454912,
      "grad_norm": 0.600407527378885,
      "learning_rate": 2.9541970222909758e-05,
      "loss": 1.1209,
      "num_input_tokens_seen": 39365843104,
      "step": 50035
    },
    {
      "epoch": 5.308296201994484,
      "grad_norm": 0.739713478046395,
      "learning_rate": 2.954128681805704e-05,
      "loss": 1.1027,
      "num_input_tokens_seen": 39366629904,
      "step": 50036
    },
    {
      "epoch": 5.308402291534055,
      "grad_norm": 0.5835777335209761,
      "learning_rate": 2.954060340969495e-05,
      "loss": 1.174,
      "num_input_tokens_seen": 39367416640,
      "step": 50037
    },
    {
      "epoch": 5.308508381073626,
      "grad_norm": 0.5840054733160506,
      "learning_rate": 2.9539919997824016e-05,
      "loss": 1.1879,
      "num_input_tokens_seen": 39368203392,
      "step": 50038
    },
    {
      "epoch": 5.308614470613198,
      "grad_norm": 0.8607150917186727,
      "learning_rate": 2.9539236582444756e-05,
      "loss": 1.1615,
      "num_input_tokens_seen": 39368990128,
      "step": 50039
    },
    {
      "epoch": 5.308720560152769,
      "grad_norm": 0.697785422191081,
      "learning_rate": 2.953855316355772e-05,
      "loss": 1.1322,
      "num_input_tokens_seen": 39369776960,
      "step": 50040
    },
    {
      "epoch": 5.308826649692341,
      "grad_norm": 0.700912942776478,
      "learning_rate": 2.9537869741163416e-05,
      "loss": 1.1116,
      "num_input_tokens_seen": 39370563744,
      "step": 50041
    },
    {
      "epoch": 5.308932739231912,
      "grad_norm": 0.7261656296187593,
      "learning_rate": 2.9537186315262377e-05,
      "loss": 1.1212,
      "num_input_tokens_seen": 39371350544,
      "step": 50042
    },
    {
      "epoch": 5.309038828771483,
      "grad_norm": 0.7722372562604609,
      "learning_rate": 2.953650288585514e-05,
      "loss": 1.1108,
      "num_input_tokens_seen": 39372137360,
      "step": 50043
    },
    {
      "epoch": 5.309144918311055,
      "grad_norm": 0.8336610198790035,
      "learning_rate": 2.9535819452942227e-05,
      "loss": 1.0516,
      "num_input_tokens_seen": 39372924240,
      "step": 50044
    },
    {
      "epoch": 5.309251007850626,
      "grad_norm": 0.687013953325312,
      "learning_rate": 2.9535136016524156e-05,
      "loss": 1.1518,
      "num_input_tokens_seen": 39373710944,
      "step": 50045
    },
    {
      "epoch": 5.309357097390198,
      "grad_norm": 0.8346487787279843,
      "learning_rate": 2.9534452576601472e-05,
      "loss": 1.1185,
      "num_input_tokens_seen": 39374497792,
      "step": 50046
    },
    {
      "epoch": 5.309463186929769,
      "grad_norm": 0.6010805501235197,
      "learning_rate": 2.9533769133174698e-05,
      "loss": 1.0887,
      "num_input_tokens_seen": 39375284560,
      "step": 50047
    },
    {
      "epoch": 5.3095692764693405,
      "grad_norm": 0.7597069339557803,
      "learning_rate": 2.9533085686244355e-05,
      "loss": 1.1741,
      "num_input_tokens_seen": 39376071296,
      "step": 50048
    },
    {
      "epoch": 5.3096753660089115,
      "grad_norm": 0.751145556234534,
      "learning_rate": 2.9532402235810985e-05,
      "loss": 1.1118,
      "num_input_tokens_seen": 39376858080,
      "step": 50049
    },
    {
      "epoch": 5.309781455548483,
      "grad_norm": 0.6486760409619671,
      "learning_rate": 2.9531718781875097e-05,
      "loss": 1.2273,
      "num_input_tokens_seen": 39377644800,
      "step": 50050
    },
    {
      "epoch": 5.3098875450880545,
      "grad_norm": 0.8044355440104878,
      "learning_rate": 2.953103532443724e-05,
      "loss": 1.0913,
      "num_input_tokens_seen": 39378431664,
      "step": 50051
    },
    {
      "epoch": 5.3099936346276255,
      "grad_norm": 0.683607216669159,
      "learning_rate": 2.9530351863497923e-05,
      "loss": 1.2084,
      "num_input_tokens_seen": 39379218384,
      "step": 50052
    },
    {
      "epoch": 5.310099724167197,
      "grad_norm": 0.5905677754668809,
      "learning_rate": 2.9529668399057688e-05,
      "loss": 1.1359,
      "num_input_tokens_seen": 39380005120,
      "step": 50053
    },
    {
      "epoch": 5.3102058137067685,
      "grad_norm": 0.879500573843991,
      "learning_rate": 2.9528984931117055e-05,
      "loss": 1.1972,
      "num_input_tokens_seen": 39380791872,
      "step": 50054
    },
    {
      "epoch": 5.3103119032463395,
      "grad_norm": 0.6020507271122523,
      "learning_rate": 2.952830145967656e-05,
      "loss": 1.2008,
      "num_input_tokens_seen": 39381578528,
      "step": 50055
    },
    {
      "epoch": 5.310417992785911,
      "grad_norm": 0.6168304743721355,
      "learning_rate": 2.952761798473672e-05,
      "loss": 1.1216,
      "num_input_tokens_seen": 39382365296,
      "step": 50056
    },
    {
      "epoch": 5.3105240823254825,
      "grad_norm": 0.7086026894713591,
      "learning_rate": 2.9526934506298077e-05,
      "loss": 1.2082,
      "num_input_tokens_seen": 39383152080,
      "step": 50057
    },
    {
      "epoch": 5.310630171865054,
      "grad_norm": 0.5784141849071132,
      "learning_rate": 2.9526251024361147e-05,
      "loss": 1.1608,
      "num_input_tokens_seen": 39383938800,
      "step": 50058
    },
    {
      "epoch": 5.310736261404625,
      "grad_norm": 0.6390944638952938,
      "learning_rate": 2.952556753892646e-05,
      "loss": 1.117,
      "num_input_tokens_seen": 39384725648,
      "step": 50059
    },
    {
      "epoch": 5.310842350944197,
      "grad_norm": 0.6524359463794103,
      "learning_rate": 2.9524884049994557e-05,
      "loss": 1.1682,
      "num_input_tokens_seen": 39385512464,
      "step": 50060
    },
    {
      "epoch": 5.310948440483768,
      "grad_norm": 0.6589990832769317,
      "learning_rate": 2.952420055756595e-05,
      "loss": 1.0959,
      "num_input_tokens_seen": 39386299168,
      "step": 50061
    },
    {
      "epoch": 5.311054530023339,
      "grad_norm": 0.6385929687055939,
      "learning_rate": 2.9523517061641172e-05,
      "loss": 1.0976,
      "num_input_tokens_seen": 39387085952,
      "step": 50062
    },
    {
      "epoch": 5.311160619562911,
      "grad_norm": 0.8033701041235545,
      "learning_rate": 2.9522833562220753e-05,
      "loss": 1.1536,
      "num_input_tokens_seen": 39387872720,
      "step": 50063
    },
    {
      "epoch": 5.311266709102482,
      "grad_norm": 0.7064472591058821,
      "learning_rate": 2.9522150059305225e-05,
      "loss": 1.0405,
      "num_input_tokens_seen": 39388659456,
      "step": 50064
    },
    {
      "epoch": 5.311372798642054,
      "grad_norm": 0.9997682665671329,
      "learning_rate": 2.9521466552895104e-05,
      "loss": 1.1484,
      "num_input_tokens_seen": 39389446224,
      "step": 50065
    },
    {
      "epoch": 5.311478888181625,
      "grad_norm": 0.6646020028663272,
      "learning_rate": 2.952078304299094e-05,
      "loss": 1.1882,
      "num_input_tokens_seen": 39390232976,
      "step": 50066
    },
    {
      "epoch": 5.311584977721196,
      "grad_norm": 0.7635586524303228,
      "learning_rate": 2.9520099529593238e-05,
      "loss": 1.0898,
      "num_input_tokens_seen": 39391019680,
      "step": 50067
    },
    {
      "epoch": 5.311691067260768,
      "grad_norm": 0.5855094121984271,
      "learning_rate": 2.9519416012702527e-05,
      "loss": 1.0864,
      "num_input_tokens_seen": 39391806432,
      "step": 50068
    },
    {
      "epoch": 5.311797156800339,
      "grad_norm": 0.7759479460325899,
      "learning_rate": 2.951873249231936e-05,
      "loss": 1.0489,
      "num_input_tokens_seen": 39392593280,
      "step": 50069
    },
    {
      "epoch": 5.311903246339911,
      "grad_norm": 0.7101097043658713,
      "learning_rate": 2.9518048968444247e-05,
      "loss": 1.1136,
      "num_input_tokens_seen": 39393380176,
      "step": 50070
    },
    {
      "epoch": 5.312009335879482,
      "grad_norm": 0.6834346842559045,
      "learning_rate": 2.951736544107771e-05,
      "loss": 1.1579,
      "num_input_tokens_seen": 39394166976,
      "step": 50071
    },
    {
      "epoch": 5.312115425419053,
      "grad_norm": 0.5602535787629965,
      "learning_rate": 2.951668191022029e-05,
      "loss": 1.1111,
      "num_input_tokens_seen": 39394953840,
      "step": 50072
    },
    {
      "epoch": 5.312221514958625,
      "grad_norm": 0.9326398305163836,
      "learning_rate": 2.9515998375872518e-05,
      "loss": 1.3035,
      "num_input_tokens_seen": 39395740672,
      "step": 50073
    },
    {
      "epoch": 5.312327604498196,
      "grad_norm": 0.6841836049216877,
      "learning_rate": 2.9515314838034903e-05,
      "loss": 1.1243,
      "num_input_tokens_seen": 39396527520,
      "step": 50074
    },
    {
      "epoch": 5.312433694037768,
      "grad_norm": 0.7552554462699668,
      "learning_rate": 2.951463129670799e-05,
      "loss": 1.0997,
      "num_input_tokens_seen": 39397314352,
      "step": 50075
    },
    {
      "epoch": 5.312539783577339,
      "grad_norm": 0.8109872592177868,
      "learning_rate": 2.95139477518923e-05,
      "loss": 1.1793,
      "num_input_tokens_seen": 39398101136,
      "step": 50076
    },
    {
      "epoch": 5.312645873116911,
      "grad_norm": 0.684397715047315,
      "learning_rate": 2.951326420358837e-05,
      "loss": 1.2074,
      "num_input_tokens_seen": 39398887952,
      "step": 50077
    },
    {
      "epoch": 5.312751962656482,
      "grad_norm": 0.8227857248022733,
      "learning_rate": 2.9512580651796716e-05,
      "loss": 1.1733,
      "num_input_tokens_seen": 39399674784,
      "step": 50078
    },
    {
      "epoch": 5.312858052196053,
      "grad_norm": 0.8501073037212011,
      "learning_rate": 2.9511897096517872e-05,
      "loss": 1.2482,
      "num_input_tokens_seen": 39400461472,
      "step": 50079
    },
    {
      "epoch": 5.312964141735625,
      "grad_norm": 0.5594456129899035,
      "learning_rate": 2.951121353775237e-05,
      "loss": 1.1397,
      "num_input_tokens_seen": 39401248272,
      "step": 50080
    },
    {
      "epoch": 5.313070231275196,
      "grad_norm": 0.9178597825160846,
      "learning_rate": 2.9510529975500734e-05,
      "loss": 1.1952,
      "num_input_tokens_seen": 39402034912,
      "step": 50081
    },
    {
      "epoch": 5.313176320814768,
      "grad_norm": 0.7319367814399313,
      "learning_rate": 2.9509846409763494e-05,
      "loss": 1.1891,
      "num_input_tokens_seen": 39402821632,
      "step": 50082
    },
    {
      "epoch": 5.313282410354339,
      "grad_norm": 0.544265614153731,
      "learning_rate": 2.9509162840541173e-05,
      "loss": 1.0889,
      "num_input_tokens_seen": 39403608400,
      "step": 50083
    },
    {
      "epoch": 5.31338849989391,
      "grad_norm": 0.7678132850292689,
      "learning_rate": 2.9508479267834304e-05,
      "loss": 1.2295,
      "num_input_tokens_seen": 39404395136,
      "step": 50084
    },
    {
      "epoch": 5.313494589433482,
      "grad_norm": 0.619021251673667,
      "learning_rate": 2.9507795691643413e-05,
      "loss": 1.0615,
      "num_input_tokens_seen": 39405181952,
      "step": 50085
    },
    {
      "epoch": 5.313600678973053,
      "grad_norm": 0.6606882254542498,
      "learning_rate": 2.9507112111969038e-05,
      "loss": 1.1235,
      "num_input_tokens_seen": 39405968704,
      "step": 50086
    },
    {
      "epoch": 5.313706768512625,
      "grad_norm": 0.7485754397918521,
      "learning_rate": 2.950642852881169e-05,
      "loss": 1.1849,
      "num_input_tokens_seen": 39406755360,
      "step": 50087
    },
    {
      "epoch": 5.313812858052196,
      "grad_norm": 0.7509108611383837,
      "learning_rate": 2.950574494217191e-05,
      "loss": 1.1498,
      "num_input_tokens_seen": 39407542096,
      "step": 50088
    },
    {
      "epoch": 5.313918947591768,
      "grad_norm": 0.5808852036018347,
      "learning_rate": 2.9505061352050223e-05,
      "loss": 1.213,
      "num_input_tokens_seen": 39408328832,
      "step": 50089
    },
    {
      "epoch": 5.314025037131339,
      "grad_norm": 0.6766859151085706,
      "learning_rate": 2.950437775844716e-05,
      "loss": 1.1738,
      "num_input_tokens_seen": 39409115536,
      "step": 50090
    },
    {
      "epoch": 5.31413112667091,
      "grad_norm": 0.601927512281583,
      "learning_rate": 2.950369416136324e-05,
      "loss": 1.1565,
      "num_input_tokens_seen": 39409902224,
      "step": 50091
    },
    {
      "epoch": 5.314237216210482,
      "grad_norm": 0.6502212267591377,
      "learning_rate": 2.9503010560799e-05,
      "loss": 1.1604,
      "num_input_tokens_seen": 39410689040,
      "step": 50092
    },
    {
      "epoch": 5.314343305750053,
      "grad_norm": 0.807682274946581,
      "learning_rate": 2.950232695675496e-05,
      "loss": 1.1396,
      "num_input_tokens_seen": 39411475792,
      "step": 50093
    },
    {
      "epoch": 5.314449395289625,
      "grad_norm": 0.5311955612238222,
      "learning_rate": 2.950164334923166e-05,
      "loss": 1.1317,
      "num_input_tokens_seen": 39412262608,
      "step": 50094
    },
    {
      "epoch": 5.314555484829196,
      "grad_norm": 0.7678297156512175,
      "learning_rate": 2.9500959738229623e-05,
      "loss": 1.1255,
      "num_input_tokens_seen": 39413049344,
      "step": 50095
    },
    {
      "epoch": 5.314661574368767,
      "grad_norm": 0.6333286417156071,
      "learning_rate": 2.950027612374937e-05,
      "loss": 1.107,
      "num_input_tokens_seen": 39413836096,
      "step": 50096
    },
    {
      "epoch": 5.314767663908339,
      "grad_norm": 0.6985255335289565,
      "learning_rate": 2.949959250579144e-05,
      "loss": 1.2098,
      "num_input_tokens_seen": 39414622784,
      "step": 50097
    },
    {
      "epoch": 5.31487375344791,
      "grad_norm": 0.8000533233353031,
      "learning_rate": 2.9498908884356365e-05,
      "loss": 1.1325,
      "num_input_tokens_seen": 39415409488,
      "step": 50098
    },
    {
      "epoch": 5.314979842987482,
      "grad_norm": 0.6171237991086063,
      "learning_rate": 2.949822525944465e-05,
      "loss": 1.149,
      "num_input_tokens_seen": 39416196272,
      "step": 50099
    },
    {
      "epoch": 5.315085932527053,
      "grad_norm": 0.7079228791507766,
      "learning_rate": 2.9497541631056848e-05,
      "loss": 1.164,
      "num_input_tokens_seen": 39416983120,
      "step": 50100
    },
    {
      "epoch": 5.315192022066624,
      "grad_norm": 0.6563730117015069,
      "learning_rate": 2.949685799919348e-05,
      "loss": 1.1853,
      "num_input_tokens_seen": 39417769872,
      "step": 50101
    },
    {
      "epoch": 5.315298111606196,
      "grad_norm": 0.632267208443092,
      "learning_rate": 2.949617436385506e-05,
      "loss": 1.1509,
      "num_input_tokens_seen": 39418556576,
      "step": 50102
    },
    {
      "epoch": 5.315404201145767,
      "grad_norm": 0.7369475464088157,
      "learning_rate": 2.9495490725042136e-05,
      "loss": 1.0775,
      "num_input_tokens_seen": 39419343392,
      "step": 50103
    },
    {
      "epoch": 5.315510290685339,
      "grad_norm": 0.7967395354171801,
      "learning_rate": 2.9494807082755234e-05,
      "loss": 1.2018,
      "num_input_tokens_seen": 39420130112,
      "step": 50104
    },
    {
      "epoch": 5.31561638022491,
      "grad_norm": 0.6223745116053856,
      "learning_rate": 2.9494123436994864e-05,
      "loss": 1.2296,
      "num_input_tokens_seen": 39420916912,
      "step": 50105
    },
    {
      "epoch": 5.315722469764482,
      "grad_norm": 0.8960138189457324,
      "learning_rate": 2.9493439787761577e-05,
      "loss": 1.2073,
      "num_input_tokens_seen": 39421703632,
      "step": 50106
    },
    {
      "epoch": 5.315828559304053,
      "grad_norm": 0.6395295008162201,
      "learning_rate": 2.9492756135055893e-05,
      "loss": 1.0719,
      "num_input_tokens_seen": 39422490416,
      "step": 50107
    },
    {
      "epoch": 5.315934648843624,
      "grad_norm": 1.0881324444270504,
      "learning_rate": 2.949207247887833e-05,
      "loss": 1.2457,
      "num_input_tokens_seen": 39423277152,
      "step": 50108
    },
    {
      "epoch": 5.316040738383196,
      "grad_norm": 0.6966208063172155,
      "learning_rate": 2.949138881922943e-05,
      "loss": 1.1396,
      "num_input_tokens_seen": 39424063904,
      "step": 50109
    },
    {
      "epoch": 5.316146827922767,
      "grad_norm": 0.6270310250300333,
      "learning_rate": 2.9490705156109716e-05,
      "loss": 1.1797,
      "num_input_tokens_seen": 39424850672,
      "step": 50110
    },
    {
      "epoch": 5.3162529174623385,
      "grad_norm": 0.8851607480823389,
      "learning_rate": 2.949002148951972e-05,
      "loss": 1.0839,
      "num_input_tokens_seen": 39425637536,
      "step": 50111
    },
    {
      "epoch": 5.3163590070019096,
      "grad_norm": 0.616845297727514,
      "learning_rate": 2.9489337819459965e-05,
      "loss": 1.0793,
      "num_input_tokens_seen": 39426424336,
      "step": 50112
    },
    {
      "epoch": 5.3164650965414815,
      "grad_norm": 0.7949400323748793,
      "learning_rate": 2.948865414593098e-05,
      "loss": 1.0287,
      "num_input_tokens_seen": 39427211056,
      "step": 50113
    },
    {
      "epoch": 5.3165711860810525,
      "grad_norm": 0.8674731531952291,
      "learning_rate": 2.9487970468933297e-05,
      "loss": 1.281,
      "num_input_tokens_seen": 39427997728,
      "step": 50114
    },
    {
      "epoch": 5.3166772756206235,
      "grad_norm": 0.7052153235106863,
      "learning_rate": 2.948728678846744e-05,
      "loss": 1.1812,
      "num_input_tokens_seen": 39428784464,
      "step": 50115
    },
    {
      "epoch": 5.3167833651601955,
      "grad_norm": 0.9066020800088203,
      "learning_rate": 2.948660310453394e-05,
      "loss": 1.1378,
      "num_input_tokens_seen": 39429571200,
      "step": 50116
    },
    {
      "epoch": 5.3168894546997665,
      "grad_norm": 0.5852845462651864,
      "learning_rate": 2.9485919417133322e-05,
      "loss": 1.0773,
      "num_input_tokens_seen": 39430357952,
      "step": 50117
    },
    {
      "epoch": 5.316995544239338,
      "grad_norm": 0.9560844111882136,
      "learning_rate": 2.9485235726266126e-05,
      "loss": 1.0741,
      "num_input_tokens_seen": 39431144688,
      "step": 50118
    },
    {
      "epoch": 5.317101633778909,
      "grad_norm": 0.6369501858401513,
      "learning_rate": 2.9484552031932862e-05,
      "loss": 1.1459,
      "num_input_tokens_seen": 39431931392,
      "step": 50119
    },
    {
      "epoch": 5.3172077233184805,
      "grad_norm": 0.593534291040237,
      "learning_rate": 2.9483868334134067e-05,
      "loss": 1.107,
      "num_input_tokens_seen": 39432718160,
      "step": 50120
    },
    {
      "epoch": 5.317313812858052,
      "grad_norm": 1.0257707276204808,
      "learning_rate": 2.948318463287028e-05,
      "loss": 1.1543,
      "num_input_tokens_seen": 39433504848,
      "step": 50121
    },
    {
      "epoch": 5.317419902397623,
      "grad_norm": 0.7844214678799698,
      "learning_rate": 2.9482500928142008e-05,
      "loss": 1.2644,
      "num_input_tokens_seen": 39434291600,
      "step": 50122
    },
    {
      "epoch": 5.317525991937195,
      "grad_norm": 0.6484532163128033,
      "learning_rate": 2.9481817219949804e-05,
      "loss": 1.1265,
      "num_input_tokens_seen": 39435078368,
      "step": 50123
    },
    {
      "epoch": 5.317632081476766,
      "grad_norm": 0.9345994843926583,
      "learning_rate": 2.9481133508294173e-05,
      "loss": 1.1368,
      "num_input_tokens_seen": 39435865200,
      "step": 50124
    },
    {
      "epoch": 5.317738171016337,
      "grad_norm": 0.8166691835316573,
      "learning_rate": 2.948044979317566e-05,
      "loss": 1.1785,
      "num_input_tokens_seen": 39436651952,
      "step": 50125
    },
    {
      "epoch": 5.317844260555909,
      "grad_norm": 0.5981257925108662,
      "learning_rate": 2.9479766074594782e-05,
      "loss": 1.1224,
      "num_input_tokens_seen": 39437438752,
      "step": 50126
    },
    {
      "epoch": 5.31795035009548,
      "grad_norm": 0.8924088650767316,
      "learning_rate": 2.9479082352552075e-05,
      "loss": 1.1636,
      "num_input_tokens_seen": 39438225488,
      "step": 50127
    },
    {
      "epoch": 5.318056439635052,
      "grad_norm": 0.9507179131251248,
      "learning_rate": 2.947839862704806e-05,
      "loss": 1.2277,
      "num_input_tokens_seen": 39439012288,
      "step": 50128
    },
    {
      "epoch": 5.318162529174623,
      "grad_norm": 0.7812595141987823,
      "learning_rate": 2.9477714898083276e-05,
      "loss": 1.2078,
      "num_input_tokens_seen": 39439798992,
      "step": 50129
    },
    {
      "epoch": 5.318268618714194,
      "grad_norm": 1.3049438663740964,
      "learning_rate": 2.9477031165658242e-05,
      "loss": 1.1775,
      "num_input_tokens_seen": 39440585648,
      "step": 50130
    },
    {
      "epoch": 5.318374708253766,
      "grad_norm": 1.2597801336475214,
      "learning_rate": 2.947634742977349e-05,
      "loss": 1.089,
      "num_input_tokens_seen": 39441372448,
      "step": 50131
    },
    {
      "epoch": 5.318480797793337,
      "grad_norm": 0.8019999566861028,
      "learning_rate": 2.947566369042955e-05,
      "loss": 1.1641,
      "num_input_tokens_seen": 39442159248,
      "step": 50132
    },
    {
      "epoch": 5.318586887332909,
      "grad_norm": 0.8431646101833103,
      "learning_rate": 2.9474979947626947e-05,
      "loss": 1.1184,
      "num_input_tokens_seen": 39442946144,
      "step": 50133
    },
    {
      "epoch": 5.31869297687248,
      "grad_norm": 1.1350757131312468,
      "learning_rate": 2.947429620136621e-05,
      "loss": 1.2033,
      "num_input_tokens_seen": 39443732864,
      "step": 50134
    },
    {
      "epoch": 5.318799066412052,
      "grad_norm": 0.7680163511689584,
      "learning_rate": 2.947361245164787e-05,
      "loss": 1.1477,
      "num_input_tokens_seen": 39444519632,
      "step": 50135
    },
    {
      "epoch": 5.318905155951623,
      "grad_norm": 0.7345610207729188,
      "learning_rate": 2.9472928698472445e-05,
      "loss": 1.2776,
      "num_input_tokens_seen": 39445306368,
      "step": 50136
    },
    {
      "epoch": 5.319011245491194,
      "grad_norm": 1.2241712094949084,
      "learning_rate": 2.9472244941840484e-05,
      "loss": 1.2307,
      "num_input_tokens_seen": 39446093168,
      "step": 50137
    },
    {
      "epoch": 5.319117335030766,
      "grad_norm": 1.0445998308766344,
      "learning_rate": 2.94715611817525e-05,
      "loss": 1.2391,
      "num_input_tokens_seen": 39446879952,
      "step": 50138
    },
    {
      "epoch": 5.319223424570337,
      "grad_norm": 0.7456090488273293,
      "learning_rate": 2.947087741820902e-05,
      "loss": 1.1656,
      "num_input_tokens_seen": 39447666720,
      "step": 50139
    },
    {
      "epoch": 5.319329514109909,
      "grad_norm": 1.1072470726308543,
      "learning_rate": 2.947019365121058e-05,
      "loss": 1.0712,
      "num_input_tokens_seen": 39448453504,
      "step": 50140
    },
    {
      "epoch": 5.31943560364948,
      "grad_norm": 1.1500395888117352,
      "learning_rate": 2.9469509880757707e-05,
      "loss": 1.2056,
      "num_input_tokens_seen": 39449240288,
      "step": 50141
    },
    {
      "epoch": 5.319541693189052,
      "grad_norm": 0.719591477268376,
      "learning_rate": 2.9468826106850922e-05,
      "loss": 1.0931,
      "num_input_tokens_seen": 39450027136,
      "step": 50142
    },
    {
      "epoch": 5.319647782728623,
      "grad_norm": 1.2207283732328231,
      "learning_rate": 2.9468142329490766e-05,
      "loss": 1.1837,
      "num_input_tokens_seen": 39450813888,
      "step": 50143
    },
    {
      "epoch": 5.319753872268194,
      "grad_norm": 1.5416401709286414,
      "learning_rate": 2.9467458548677762e-05,
      "loss": 1.1448,
      "num_input_tokens_seen": 39451600672,
      "step": 50144
    },
    {
      "epoch": 5.319859961807766,
      "grad_norm": 0.9521260010711105,
      "learning_rate": 2.946677476441243e-05,
      "loss": 1.0927,
      "num_input_tokens_seen": 39452387424,
      "step": 50145
    },
    {
      "epoch": 5.319966051347337,
      "grad_norm": 0.922464367143959,
      "learning_rate": 2.9466090976695316e-05,
      "loss": 1.1107,
      "num_input_tokens_seen": 39453174128,
      "step": 50146
    },
    {
      "epoch": 5.320072140886909,
      "grad_norm": 1.1086104114864586,
      "learning_rate": 2.9465407185526934e-05,
      "loss": 1.1866,
      "num_input_tokens_seen": 39453960832,
      "step": 50147
    },
    {
      "epoch": 5.32017823042648,
      "grad_norm": 1.0204674734168573,
      "learning_rate": 2.9464723390907805e-05,
      "loss": 1.1271,
      "num_input_tokens_seen": 39454747552,
      "step": 50148
    },
    {
      "epoch": 5.320284319966051,
      "grad_norm": 0.6901942184945731,
      "learning_rate": 2.9464039592838483e-05,
      "loss": 1.213,
      "num_input_tokens_seen": 39455534256,
      "step": 50149
    },
    {
      "epoch": 5.320390409505623,
      "grad_norm": 1.349708052959938,
      "learning_rate": 2.946335579131948e-05,
      "loss": 1.2615,
      "num_input_tokens_seen": 39456320960,
      "step": 50150
    },
    {
      "epoch": 5.320496499045194,
      "grad_norm": 1.2196315786982987,
      "learning_rate": 2.946267198635132e-05,
      "loss": 1.2048,
      "num_input_tokens_seen": 39457107728,
      "step": 50151
    },
    {
      "epoch": 5.320602588584766,
      "grad_norm": 0.8405871064621956,
      "learning_rate": 2.946198817793454e-05,
      "loss": 1.1106,
      "num_input_tokens_seen": 39457894544,
      "step": 50152
    },
    {
      "epoch": 5.320708678124337,
      "grad_norm": 0.8226322728717326,
      "learning_rate": 2.9461304366069665e-05,
      "loss": 1.1882,
      "num_input_tokens_seen": 39458681248,
      "step": 50153
    },
    {
      "epoch": 5.320814767663908,
      "grad_norm": 1.0890170559392647,
      "learning_rate": 2.946062055075723e-05,
      "loss": 1.2146,
      "num_input_tokens_seen": 39459467968,
      "step": 50154
    },
    {
      "epoch": 5.32092085720348,
      "grad_norm": 0.9281578650763417,
      "learning_rate": 2.9459936731997756e-05,
      "loss": 1.3117,
      "num_input_tokens_seen": 39460254752,
      "step": 50155
    },
    {
      "epoch": 5.321026946743051,
      "grad_norm": 0.6924373294959271,
      "learning_rate": 2.9459252909791773e-05,
      "loss": 1.1582,
      "num_input_tokens_seen": 39461041504,
      "step": 50156
    },
    {
      "epoch": 5.321133036282623,
      "grad_norm": 1.165629810975178,
      "learning_rate": 2.945856908413981e-05,
      "loss": 1.1569,
      "num_input_tokens_seen": 39461828144,
      "step": 50157
    },
    {
      "epoch": 5.321239125822194,
      "grad_norm": 0.9749217230699996,
      "learning_rate": 2.94578852550424e-05,
      "loss": 1.2067,
      "num_input_tokens_seen": 39462614944,
      "step": 50158
    },
    {
      "epoch": 5.321345215361766,
      "grad_norm": 0.7944885940427583,
      "learning_rate": 2.9457201422500057e-05,
      "loss": 1.1363,
      "num_input_tokens_seen": 39463401728,
      "step": 50159
    },
    {
      "epoch": 5.321451304901337,
      "grad_norm": 0.9119019836845925,
      "learning_rate": 2.9456517586513332e-05,
      "loss": 1.2161,
      "num_input_tokens_seen": 39464188496,
      "step": 50160
    },
    {
      "epoch": 5.321557394440908,
      "grad_norm": 0.7664831356517045,
      "learning_rate": 2.9455833747082735e-05,
      "loss": 1.2434,
      "num_input_tokens_seen": 39464975312,
      "step": 50161
    },
    {
      "epoch": 5.32166348398048,
      "grad_norm": 0.7801187902588271,
      "learning_rate": 2.9455149904208802e-05,
      "loss": 1.1703,
      "num_input_tokens_seen": 39465762112,
      "step": 50162
    },
    {
      "epoch": 5.321769573520051,
      "grad_norm": 0.9544794828441409,
      "learning_rate": 2.945446605789205e-05,
      "loss": 1.1746,
      "num_input_tokens_seen": 39466548848,
      "step": 50163
    },
    {
      "epoch": 5.321875663059623,
      "grad_norm": 0.8628951500700718,
      "learning_rate": 2.945378220813303e-05,
      "loss": 1.1804,
      "num_input_tokens_seen": 39467335600,
      "step": 50164
    },
    {
      "epoch": 5.321981752599194,
      "grad_norm": 0.7426010995436794,
      "learning_rate": 2.9453098354932252e-05,
      "loss": 1.2064,
      "num_input_tokens_seen": 39468122368,
      "step": 50165
    },
    {
      "epoch": 5.322087842138765,
      "grad_norm": 0.9205357875403076,
      "learning_rate": 2.945241449829025e-05,
      "loss": 1.1821,
      "num_input_tokens_seen": 39468909056,
      "step": 50166
    },
    {
      "epoch": 5.322193931678337,
      "grad_norm": 0.7825535129329676,
      "learning_rate": 2.945173063820756e-05,
      "loss": 1.2264,
      "num_input_tokens_seen": 39469695744,
      "step": 50167
    },
    {
      "epoch": 5.322300021217908,
      "grad_norm": 0.7497389865556889,
      "learning_rate": 2.9451046774684694e-05,
      "loss": 1.1117,
      "num_input_tokens_seen": 39470482560,
      "step": 50168
    },
    {
      "epoch": 5.32240611075748,
      "grad_norm": 0.9400060588285206,
      "learning_rate": 2.9450362907722195e-05,
      "loss": 1.1807,
      "num_input_tokens_seen": 39471269408,
      "step": 50169
    },
    {
      "epoch": 5.322512200297051,
      "grad_norm": 0.688530713726119,
      "learning_rate": 2.9449679037320583e-05,
      "loss": 1.1873,
      "num_input_tokens_seen": 39472056192,
      "step": 50170
    },
    {
      "epoch": 5.3226182898366226,
      "grad_norm": 0.8308217002852571,
      "learning_rate": 2.9448995163480386e-05,
      "loss": 1.1451,
      "num_input_tokens_seen": 39472842944,
      "step": 50171
    },
    {
      "epoch": 5.322724379376194,
      "grad_norm": 0.7874252848075197,
      "learning_rate": 2.9448311286202147e-05,
      "loss": 1.1666,
      "num_input_tokens_seen": 39473629744,
      "step": 50172
    },
    {
      "epoch": 5.322830468915765,
      "grad_norm": 0.703042341666061,
      "learning_rate": 2.9447627405486377e-05,
      "loss": 1.0267,
      "num_input_tokens_seen": 39474416544,
      "step": 50173
    },
    {
      "epoch": 5.3229365584553365,
      "grad_norm": 0.7628952518537269,
      "learning_rate": 2.944694352133361e-05,
      "loss": 1.2288,
      "num_input_tokens_seen": 39475203296,
      "step": 50174
    },
    {
      "epoch": 5.323042647994908,
      "grad_norm": 0.564515219127437,
      "learning_rate": 2.9446259633744377e-05,
      "loss": 1.0697,
      "num_input_tokens_seen": 39475990160,
      "step": 50175
    },
    {
      "epoch": 5.3231487375344795,
      "grad_norm": 0.7019903587772185,
      "learning_rate": 2.944557574271921e-05,
      "loss": 1.078,
      "num_input_tokens_seen": 39476776912,
      "step": 50176
    },
    {
      "epoch": 5.3232548270740505,
      "grad_norm": 0.8456545496921032,
      "learning_rate": 2.9444891848258626e-05,
      "loss": 1.221,
      "num_input_tokens_seen": 39477563600,
      "step": 50177
    },
    {
      "epoch": 5.3233609166136215,
      "grad_norm": 0.649531910913166,
      "learning_rate": 2.944420795036316e-05,
      "loss": 1.1994,
      "num_input_tokens_seen": 39478350288,
      "step": 50178
    },
    {
      "epoch": 5.3234670061531935,
      "grad_norm": 0.7937529063093197,
      "learning_rate": 2.9443524049033337e-05,
      "loss": 1.1438,
      "num_input_tokens_seen": 39479137024,
      "step": 50179
    },
    {
      "epoch": 5.3235730956927645,
      "grad_norm": 0.6257446213157053,
      "learning_rate": 2.9442840144269702e-05,
      "loss": 1.1488,
      "num_input_tokens_seen": 39479923888,
      "step": 50180
    },
    {
      "epoch": 5.323679185232336,
      "grad_norm": 0.6533260193897462,
      "learning_rate": 2.944215623607276e-05,
      "loss": 1.1885,
      "num_input_tokens_seen": 39480710576,
      "step": 50181
    },
    {
      "epoch": 5.323785274771907,
      "grad_norm": 0.7294568812857468,
      "learning_rate": 2.9441472324443054e-05,
      "loss": 1.1307,
      "num_input_tokens_seen": 39481497312,
      "step": 50182
    },
    {
      "epoch": 5.3238913643114785,
      "grad_norm": 0.6622564801133317,
      "learning_rate": 2.9440788409381108e-05,
      "loss": 1.1323,
      "num_input_tokens_seen": 39482284112,
      "step": 50183
    },
    {
      "epoch": 5.32399745385105,
      "grad_norm": 0.8099929379442937,
      "learning_rate": 2.944010449088745e-05,
      "loss": 1.2926,
      "num_input_tokens_seen": 39483070800,
      "step": 50184
    },
    {
      "epoch": 5.324103543390621,
      "grad_norm": 0.6165172373837089,
      "learning_rate": 2.9439420568962604e-05,
      "loss": 1.208,
      "num_input_tokens_seen": 39483857488,
      "step": 50185
    },
    {
      "epoch": 5.324209632930193,
      "grad_norm": 0.664545335305819,
      "learning_rate": 2.9438736643607118e-05,
      "loss": 1.1822,
      "num_input_tokens_seen": 39484644256,
      "step": 50186
    },
    {
      "epoch": 5.324315722469764,
      "grad_norm": 0.7301705612808802,
      "learning_rate": 2.9438052714821496e-05,
      "loss": 1.1055,
      "num_input_tokens_seen": 39485431024,
      "step": 50187
    },
    {
      "epoch": 5.324421812009336,
      "grad_norm": 0.5688269444700327,
      "learning_rate": 2.943736878260628e-05,
      "loss": 1.1314,
      "num_input_tokens_seen": 39486217856,
      "step": 50188
    },
    {
      "epoch": 5.324527901548907,
      "grad_norm": 0.634344392006594,
      "learning_rate": 2.943668484696199e-05,
      "loss": 1.0659,
      "num_input_tokens_seen": 39487004672,
      "step": 50189
    },
    {
      "epoch": 5.324633991088478,
      "grad_norm": 0.5879476991925378,
      "learning_rate": 2.9436000907889172e-05,
      "loss": 1.206,
      "num_input_tokens_seen": 39487791408,
      "step": 50190
    },
    {
      "epoch": 5.32474008062805,
      "grad_norm": 0.6631213356642659,
      "learning_rate": 2.9435316965388332e-05,
      "loss": 1.147,
      "num_input_tokens_seen": 39488578208,
      "step": 50191
    },
    {
      "epoch": 5.324846170167621,
      "grad_norm": 0.9697506428893603,
      "learning_rate": 2.9434633019460017e-05,
      "loss": 1.2406,
      "num_input_tokens_seen": 39489364896,
      "step": 50192
    },
    {
      "epoch": 5.324952259707193,
      "grad_norm": 0.6877395310054558,
      "learning_rate": 2.9433949070104743e-05,
      "loss": 1.1491,
      "num_input_tokens_seen": 39490151728,
      "step": 50193
    },
    {
      "epoch": 5.325058349246764,
      "grad_norm": 1.033157712231648,
      "learning_rate": 2.9433265117323044e-05,
      "loss": 1.1292,
      "num_input_tokens_seen": 39490938496,
      "step": 50194
    },
    {
      "epoch": 5.325164438786335,
      "grad_norm": 0.856863516345785,
      "learning_rate": 2.9432581161115446e-05,
      "loss": 1.1742,
      "num_input_tokens_seen": 39491725296,
      "step": 50195
    },
    {
      "epoch": 5.325270528325907,
      "grad_norm": 0.7050520933758561,
      "learning_rate": 2.9431897201482477e-05,
      "loss": 1.263,
      "num_input_tokens_seen": 39492512080,
      "step": 50196
    },
    {
      "epoch": 5.325376617865478,
      "grad_norm": 0.7549590018140073,
      "learning_rate": 2.9431213238424676e-05,
      "loss": 1.1179,
      "num_input_tokens_seen": 39493298928,
      "step": 50197
    },
    {
      "epoch": 5.32548270740505,
      "grad_norm": 0.654481535836371,
      "learning_rate": 2.9430529271942565e-05,
      "loss": 1.1892,
      "num_input_tokens_seen": 39494085664,
      "step": 50198
    },
    {
      "epoch": 5.325588796944621,
      "grad_norm": 0.7192656985929016,
      "learning_rate": 2.9429845302036662e-05,
      "loss": 1.1947,
      "num_input_tokens_seen": 39494872496,
      "step": 50199
    },
    {
      "epoch": 5.325694886484193,
      "grad_norm": 0.6820977675106882,
      "learning_rate": 2.942916132870751e-05,
      "loss": 1.1703,
      "num_input_tokens_seen": 39495659232,
      "step": 50200
    },
    {
      "epoch": 5.325800976023764,
      "grad_norm": 0.6729678074395282,
      "learning_rate": 2.942847735195563e-05,
      "loss": 1.1586,
      "num_input_tokens_seen": 39496445984,
      "step": 50201
    },
    {
      "epoch": 5.325907065563335,
      "grad_norm": 0.8130434535811717,
      "learning_rate": 2.9427793371781548e-05,
      "loss": 1.2179,
      "num_input_tokens_seen": 39497232784,
      "step": 50202
    },
    {
      "epoch": 5.326013155102907,
      "grad_norm": 0.7557185306959904,
      "learning_rate": 2.9427109388185804e-05,
      "loss": 1.2423,
      "num_input_tokens_seen": 39498019568,
      "step": 50203
    },
    {
      "epoch": 5.326119244642478,
      "grad_norm": 0.6711194452446984,
      "learning_rate": 2.942642540116892e-05,
      "loss": 1.1038,
      "num_input_tokens_seen": 39498806320,
      "step": 50204
    },
    {
      "epoch": 5.32622533418205,
      "grad_norm": 0.6896842597302767,
      "learning_rate": 2.9425741410731423e-05,
      "loss": 1.165,
      "num_input_tokens_seen": 39499593072,
      "step": 50205
    },
    {
      "epoch": 5.326331423721621,
      "grad_norm": 0.6276556543850602,
      "learning_rate": 2.942505741687384e-05,
      "loss": 1.1355,
      "num_input_tokens_seen": 39500379872,
      "step": 50206
    },
    {
      "epoch": 5.326437513261192,
      "grad_norm": 0.7496249264212573,
      "learning_rate": 2.942437341959671e-05,
      "loss": 1.2335,
      "num_input_tokens_seen": 39501166608,
      "step": 50207
    },
    {
      "epoch": 5.326543602800764,
      "grad_norm": 0.6870968145715199,
      "learning_rate": 2.942368941890054e-05,
      "loss": 1.1278,
      "num_input_tokens_seen": 39501953408,
      "step": 50208
    },
    {
      "epoch": 5.326649692340335,
      "grad_norm": 0.5865515807447268,
      "learning_rate": 2.9423005414785888e-05,
      "loss": 1.1226,
      "num_input_tokens_seen": 39502740112,
      "step": 50209
    },
    {
      "epoch": 5.326755781879907,
      "grad_norm": 0.7773268175502835,
      "learning_rate": 2.9422321407253257e-05,
      "loss": 1.1848,
      "num_input_tokens_seen": 39503526928,
      "step": 50210
    },
    {
      "epoch": 5.326861871419478,
      "grad_norm": 0.6548367091121425,
      "learning_rate": 2.942163739630318e-05,
      "loss": 1.1108,
      "num_input_tokens_seen": 39504313744,
      "step": 50211
    },
    {
      "epoch": 5.326967960959049,
      "grad_norm": 0.7086349949262619,
      "learning_rate": 2.9420953381936205e-05,
      "loss": 1.3287,
      "num_input_tokens_seen": 39505100496,
      "step": 50212
    },
    {
      "epoch": 5.327074050498621,
      "grad_norm": 0.7163814705715282,
      "learning_rate": 2.9420269364152842e-05,
      "loss": 1.1857,
      "num_input_tokens_seen": 39505887152,
      "step": 50213
    },
    {
      "epoch": 5.327180140038192,
      "grad_norm": 0.7616951948186368,
      "learning_rate": 2.9419585342953626e-05,
      "loss": 1.163,
      "num_input_tokens_seen": 39506673856,
      "step": 50214
    },
    {
      "epoch": 5.327286229577764,
      "grad_norm": 0.6393801851758422,
      "learning_rate": 2.941890131833908e-05,
      "loss": 1.1484,
      "num_input_tokens_seen": 39507460688,
      "step": 50215
    },
    {
      "epoch": 5.327392319117335,
      "grad_norm": 0.7418152229941196,
      "learning_rate": 2.9418217290309747e-05,
      "loss": 1.1889,
      "num_input_tokens_seen": 39508247504,
      "step": 50216
    },
    {
      "epoch": 5.327498408656907,
      "grad_norm": 0.6078234385082868,
      "learning_rate": 2.941753325886613e-05,
      "loss": 1.0767,
      "num_input_tokens_seen": 39509034320,
      "step": 50217
    },
    {
      "epoch": 5.327604498196478,
      "grad_norm": 0.7308769060958629,
      "learning_rate": 2.9416849224008786e-05,
      "loss": 1.1409,
      "num_input_tokens_seen": 39509821072,
      "step": 50218
    },
    {
      "epoch": 5.327710587736049,
      "grad_norm": 0.7435657755679544,
      "learning_rate": 2.9416165185738227e-05,
      "loss": 1.2498,
      "num_input_tokens_seen": 39510607760,
      "step": 50219
    },
    {
      "epoch": 5.327816677275621,
      "grad_norm": 0.7937257820637723,
      "learning_rate": 2.941548114405498e-05,
      "loss": 1.1906,
      "num_input_tokens_seen": 39511394608,
      "step": 50220
    },
    {
      "epoch": 5.327922766815192,
      "grad_norm": 0.7175579685410792,
      "learning_rate": 2.9414797098959584e-05,
      "loss": 1.1572,
      "num_input_tokens_seen": 39512181440,
      "step": 50221
    },
    {
      "epoch": 5.328028856354764,
      "grad_norm": 0.7309572709070224,
      "learning_rate": 2.9414113050452558e-05,
      "loss": 1.211,
      "num_input_tokens_seen": 39512968240,
      "step": 50222
    },
    {
      "epoch": 5.328134945894335,
      "grad_norm": 0.8921262281014668,
      "learning_rate": 2.9413428998534438e-05,
      "loss": 1.2472,
      "num_input_tokens_seen": 39513754960,
      "step": 50223
    },
    {
      "epoch": 5.328241035433906,
      "grad_norm": 0.5938325630848482,
      "learning_rate": 2.941274494320575e-05,
      "loss": 1.0894,
      "num_input_tokens_seen": 39514541824,
      "step": 50224
    },
    {
      "epoch": 5.328347124973478,
      "grad_norm": 0.6812911656918256,
      "learning_rate": 2.941206088446702e-05,
      "loss": 1.1521,
      "num_input_tokens_seen": 39515328592,
      "step": 50225
    },
    {
      "epoch": 5.328453214513049,
      "grad_norm": 0.7622792275273207,
      "learning_rate": 2.941137682231878e-05,
      "loss": 1.1366,
      "num_input_tokens_seen": 39516115344,
      "step": 50226
    },
    {
      "epoch": 5.328559304052621,
      "grad_norm": 0.6300967447976088,
      "learning_rate": 2.941069275676156e-05,
      "loss": 1.2568,
      "num_input_tokens_seen": 39516902032,
      "step": 50227
    },
    {
      "epoch": 5.328665393592192,
      "grad_norm": 0.6968357854873476,
      "learning_rate": 2.9410008687795883e-05,
      "loss": 1.1698,
      "num_input_tokens_seen": 39517688832,
      "step": 50228
    },
    {
      "epoch": 5.328771483131764,
      "grad_norm": 0.7360712770371016,
      "learning_rate": 2.9409324615422283e-05,
      "loss": 1.146,
      "num_input_tokens_seen": 39518475584,
      "step": 50229
    },
    {
      "epoch": 5.328877572671335,
      "grad_norm": 0.686951196226297,
      "learning_rate": 2.9408640539641287e-05,
      "loss": 1.1099,
      "num_input_tokens_seen": 39519262368,
      "step": 50230
    },
    {
      "epoch": 5.328983662210906,
      "grad_norm": 0.5686237713195166,
      "learning_rate": 2.940795646045342e-05,
      "loss": 1.162,
      "num_input_tokens_seen": 39520049168,
      "step": 50231
    },
    {
      "epoch": 5.329089751750478,
      "grad_norm": 1.0509070450757185,
      "learning_rate": 2.940727237785921e-05,
      "loss": 1.2063,
      "num_input_tokens_seen": 39520835872,
      "step": 50232
    },
    {
      "epoch": 5.329195841290049,
      "grad_norm": 0.6423104797223942,
      "learning_rate": 2.94065882918592e-05,
      "loss": 1.1865,
      "num_input_tokens_seen": 39521622720,
      "step": 50233
    },
    {
      "epoch": 5.329301930829621,
      "grad_norm": 0.6914670534339064,
      "learning_rate": 2.940590420245389e-05,
      "loss": 1.1317,
      "num_input_tokens_seen": 39522409424,
      "step": 50234
    },
    {
      "epoch": 5.329408020369192,
      "grad_norm": 0.8068748261573514,
      "learning_rate": 2.9405220109643843e-05,
      "loss": 1.1115,
      "num_input_tokens_seen": 39523196128,
      "step": 50235
    },
    {
      "epoch": 5.329514109908763,
      "grad_norm": 0.6018262610645044,
      "learning_rate": 2.9404536013429573e-05,
      "loss": 1.1781,
      "num_input_tokens_seen": 39523982880,
      "step": 50236
    },
    {
      "epoch": 5.3296201994483345,
      "grad_norm": 0.6774401256139844,
      "learning_rate": 2.9403851913811592e-05,
      "loss": 1.1966,
      "num_input_tokens_seen": 39524769664,
      "step": 50237
    },
    {
      "epoch": 5.329726288987906,
      "grad_norm": 0.8129174785694347,
      "learning_rate": 2.9403167810790454e-05,
      "loss": 1.1866,
      "num_input_tokens_seen": 39525556416,
      "step": 50238
    },
    {
      "epoch": 5.3298323785274775,
      "grad_norm": 0.5783874419141877,
      "learning_rate": 2.9402483704366675e-05,
      "loss": 1.1168,
      "num_input_tokens_seen": 39526343216,
      "step": 50239
    },
    {
      "epoch": 5.3299384680670485,
      "grad_norm": 0.8220885379345739,
      "learning_rate": 2.9401799594540785e-05,
      "loss": 1.1257,
      "num_input_tokens_seen": 39527129984,
      "step": 50240
    },
    {
      "epoch": 5.3300445576066195,
      "grad_norm": 0.7137009703702735,
      "learning_rate": 2.9401115481313313e-05,
      "loss": 1.113,
      "num_input_tokens_seen": 39527916800,
      "step": 50241
    },
    {
      "epoch": 5.3301506471461915,
      "grad_norm": 0.8411069080651928,
      "learning_rate": 2.940043136468479e-05,
      "loss": 1.1675,
      "num_input_tokens_seen": 39528703568,
      "step": 50242
    },
    {
      "epoch": 5.3302567366857625,
      "grad_norm": 0.6542174397166606,
      "learning_rate": 2.939974724465574e-05,
      "loss": 1.1619,
      "num_input_tokens_seen": 39529490352,
      "step": 50243
    },
    {
      "epoch": 5.330362826225334,
      "grad_norm": 0.7286104860935131,
      "learning_rate": 2.93990631212267e-05,
      "loss": 1.127,
      "num_input_tokens_seen": 39530277120,
      "step": 50244
    },
    {
      "epoch": 5.3304689157649054,
      "grad_norm": 0.6407951190750789,
      "learning_rate": 2.9398378994398184e-05,
      "loss": 1.0795,
      "num_input_tokens_seen": 39531063872,
      "step": 50245
    },
    {
      "epoch": 5.330575005304477,
      "grad_norm": 1.0962798997222747,
      "learning_rate": 2.939769486417074e-05,
      "loss": 1.1434,
      "num_input_tokens_seen": 39531850608,
      "step": 50246
    },
    {
      "epoch": 5.330681094844048,
      "grad_norm": 0.6469114466520747,
      "learning_rate": 2.9397010730544877e-05,
      "loss": 1.1618,
      "num_input_tokens_seen": 39532637376,
      "step": 50247
    },
    {
      "epoch": 5.330787184383619,
      "grad_norm": 0.7641541660791341,
      "learning_rate": 2.9396326593521136e-05,
      "loss": 1.1593,
      "num_input_tokens_seen": 39533424128,
      "step": 50248
    },
    {
      "epoch": 5.330893273923191,
      "grad_norm": 0.9733206546641103,
      "learning_rate": 2.9395642453100046e-05,
      "loss": 1.1068,
      "num_input_tokens_seen": 39534210880,
      "step": 50249
    },
    {
      "epoch": 5.330999363462762,
      "grad_norm": 0.9110312795410593,
      "learning_rate": 2.9394958309282135e-05,
      "loss": 1.2271,
      "num_input_tokens_seen": 39534997568,
      "step": 50250
    },
    {
      "epoch": 5.331105453002334,
      "grad_norm": 0.7241207801506331,
      "learning_rate": 2.939427416206792e-05,
      "loss": 1.174,
      "num_input_tokens_seen": 39535784352,
      "step": 50251
    },
    {
      "epoch": 5.331211542541905,
      "grad_norm": 0.7053380514437109,
      "learning_rate": 2.9393590011457945e-05,
      "loss": 1.076,
      "num_input_tokens_seen": 39536571136,
      "step": 50252
    },
    {
      "epoch": 5.331317632081476,
      "grad_norm": 0.6909323145610052,
      "learning_rate": 2.9392905857452735e-05,
      "loss": 1.146,
      "num_input_tokens_seen": 39537357872,
      "step": 50253
    },
    {
      "epoch": 5.331423721621048,
      "grad_norm": 0.6024561981421701,
      "learning_rate": 2.939222170005281e-05,
      "loss": 1.2098,
      "num_input_tokens_seen": 39538144576,
      "step": 50254
    },
    {
      "epoch": 5.331529811160619,
      "grad_norm": 0.7095665464811498,
      "learning_rate": 2.9391537539258707e-05,
      "loss": 1.136,
      "num_input_tokens_seen": 39538931312,
      "step": 50255
    },
    {
      "epoch": 5.331635900700191,
      "grad_norm": 0.5994771288407872,
      "learning_rate": 2.9390853375070948e-05,
      "loss": 1.1453,
      "num_input_tokens_seen": 39539718112,
      "step": 50256
    },
    {
      "epoch": 5.331741990239762,
      "grad_norm": 0.6444834575953979,
      "learning_rate": 2.9390169207490076e-05,
      "loss": 1.1107,
      "num_input_tokens_seen": 39540504816,
      "step": 50257
    },
    {
      "epoch": 5.331848079779334,
      "grad_norm": 0.8570515485284209,
      "learning_rate": 2.93894850365166e-05,
      "loss": 1.1566,
      "num_input_tokens_seen": 39541291520,
      "step": 50258
    },
    {
      "epoch": 5.331954169318905,
      "grad_norm": 0.825797985245408,
      "learning_rate": 2.9388800862151068e-05,
      "loss": 1.0833,
      "num_input_tokens_seen": 39542078256,
      "step": 50259
    },
    {
      "epoch": 5.332060258858476,
      "grad_norm": 0.8140506298982632,
      "learning_rate": 2.938811668439399e-05,
      "loss": 1.1692,
      "num_input_tokens_seen": 39542865024,
      "step": 50260
    },
    {
      "epoch": 5.332166348398048,
      "grad_norm": 0.6718726176444214,
      "learning_rate": 2.938743250324591e-05,
      "loss": 1.2097,
      "num_input_tokens_seen": 39543651744,
      "step": 50261
    },
    {
      "epoch": 5.332272437937619,
      "grad_norm": 0.8523169175909439,
      "learning_rate": 2.9386748318707353e-05,
      "loss": 1.1279,
      "num_input_tokens_seen": 39544438528,
      "step": 50262
    },
    {
      "epoch": 5.332378527477191,
      "grad_norm": 0.8164431990207518,
      "learning_rate": 2.938606413077884e-05,
      "loss": 1.1263,
      "num_input_tokens_seen": 39545225296,
      "step": 50263
    },
    {
      "epoch": 5.332484617016762,
      "grad_norm": 0.5811086578508265,
      "learning_rate": 2.9385379939460912e-05,
      "loss": 1.1336,
      "num_input_tokens_seen": 39546011984,
      "step": 50264
    },
    {
      "epoch": 5.332590706556333,
      "grad_norm": 0.7961180131962097,
      "learning_rate": 2.938469574475408e-05,
      "loss": 1.1374,
      "num_input_tokens_seen": 39546798816,
      "step": 50265
    },
    {
      "epoch": 5.332696796095905,
      "grad_norm": 0.7062784161475204,
      "learning_rate": 2.9384011546658895e-05,
      "loss": 1.1461,
      "num_input_tokens_seen": 39547585520,
      "step": 50266
    },
    {
      "epoch": 5.332802885635476,
      "grad_norm": 0.6815792234965427,
      "learning_rate": 2.9383327345175874e-05,
      "loss": 1.1586,
      "num_input_tokens_seen": 39548372304,
      "step": 50267
    },
    {
      "epoch": 5.332908975175048,
      "grad_norm": 0.9329361301624883,
      "learning_rate": 2.9382643140305542e-05,
      "loss": 1.2033,
      "num_input_tokens_seen": 39549158992,
      "step": 50268
    },
    {
      "epoch": 5.333015064714619,
      "grad_norm": 0.6980572920180275,
      "learning_rate": 2.9381958932048437e-05,
      "loss": 1.1986,
      "num_input_tokens_seen": 39549945680,
      "step": 50269
    },
    {
      "epoch": 5.33312115425419,
      "grad_norm": 0.6328974653025402,
      "learning_rate": 2.9381274720405077e-05,
      "loss": 1.1043,
      "num_input_tokens_seen": 39550732336,
      "step": 50270
    },
    {
      "epoch": 5.333227243793762,
      "grad_norm": 0.8809570073304677,
      "learning_rate": 2.9380590505375995e-05,
      "loss": 1.1502,
      "num_input_tokens_seen": 39551519136,
      "step": 50271
    },
    {
      "epoch": 5.333333333333333,
      "grad_norm": 0.5973288601329777,
      "learning_rate": 2.9379906286961728e-05,
      "loss": 1.1494,
      "num_input_tokens_seen": 39552305936,
      "step": 50272
    },
    {
      "epoch": 5.333439422872905,
      "grad_norm": 0.8377010496764017,
      "learning_rate": 2.93792220651628e-05,
      "loss": 1.1667,
      "num_input_tokens_seen": 39553092672,
      "step": 50273
    },
    {
      "epoch": 5.333545512412476,
      "grad_norm": 0.5998253181045771,
      "learning_rate": 2.9378537839979725e-05,
      "loss": 1.162,
      "num_input_tokens_seen": 39553879440,
      "step": 50274
    },
    {
      "epoch": 5.333651601952048,
      "grad_norm": 0.8530674225409177,
      "learning_rate": 2.9377853611413054e-05,
      "loss": 1.1291,
      "num_input_tokens_seen": 39554666256,
      "step": 50275
    },
    {
      "epoch": 5.333757691491619,
      "grad_norm": 0.7242262101744807,
      "learning_rate": 2.9377169379463306e-05,
      "loss": 1.1966,
      "num_input_tokens_seen": 39555453040,
      "step": 50276
    },
    {
      "epoch": 5.33386378103119,
      "grad_norm": 0.8120274201340596,
      "learning_rate": 2.9376485144131006e-05,
      "loss": 1.0833,
      "num_input_tokens_seen": 39556239872,
      "step": 50277
    },
    {
      "epoch": 5.333969870570762,
      "grad_norm": 0.6955771675917981,
      "learning_rate": 2.937580090541669e-05,
      "loss": 1.1635,
      "num_input_tokens_seen": 39557026688,
      "step": 50278
    },
    {
      "epoch": 5.334075960110333,
      "grad_norm": 0.936987854400181,
      "learning_rate": 2.9375116663320883e-05,
      "loss": 1.2146,
      "num_input_tokens_seen": 39557813520,
      "step": 50279
    },
    {
      "epoch": 5.334182049649905,
      "grad_norm": 0.9177509247075174,
      "learning_rate": 2.937443241784411e-05,
      "loss": 1.1709,
      "num_input_tokens_seen": 39558600320,
      "step": 50280
    },
    {
      "epoch": 5.334288139189476,
      "grad_norm": 0.625670051180801,
      "learning_rate": 2.937374816898691e-05,
      "loss": 1.1666,
      "num_input_tokens_seen": 39559387088,
      "step": 50281
    },
    {
      "epoch": 5.334394228729048,
      "grad_norm": 0.7755909199606809,
      "learning_rate": 2.93730639167498e-05,
      "loss": 1.288,
      "num_input_tokens_seen": 39560173776,
      "step": 50282
    },
    {
      "epoch": 5.334500318268619,
      "grad_norm": 0.7183682432234402,
      "learning_rate": 2.9372379661133315e-05,
      "loss": 1.2298,
      "num_input_tokens_seen": 39560960528,
      "step": 50283
    },
    {
      "epoch": 5.33460640780819,
      "grad_norm": 0.6895229988074504,
      "learning_rate": 2.9371695402137987e-05,
      "loss": 1.0788,
      "num_input_tokens_seen": 39561747328,
      "step": 50284
    },
    {
      "epoch": 5.334712497347762,
      "grad_norm": 0.712132883126155,
      "learning_rate": 2.9371011139764337e-05,
      "loss": 1.0321,
      "num_input_tokens_seen": 39562534096,
      "step": 50285
    },
    {
      "epoch": 5.334818586887333,
      "grad_norm": 0.5914719598217291,
      "learning_rate": 2.9370326874012905e-05,
      "loss": 1.0211,
      "num_input_tokens_seen": 39563320880,
      "step": 50286
    },
    {
      "epoch": 5.334924676426905,
      "grad_norm": 0.778212636441024,
      "learning_rate": 2.9369642604884207e-05,
      "loss": 1.1127,
      "num_input_tokens_seen": 39564107696,
      "step": 50287
    },
    {
      "epoch": 5.335030765966476,
      "grad_norm": 0.7632729036923224,
      "learning_rate": 2.9368958332378776e-05,
      "loss": 1.1866,
      "num_input_tokens_seen": 39564894368,
      "step": 50288
    },
    {
      "epoch": 5.335136855506047,
      "grad_norm": 0.5553772567776591,
      "learning_rate": 2.936827405649715e-05,
      "loss": 1.1833,
      "num_input_tokens_seen": 39565681136,
      "step": 50289
    },
    {
      "epoch": 5.335242945045619,
      "grad_norm": 0.8663985556375957,
      "learning_rate": 2.9367589777239844e-05,
      "loss": 1.2304,
      "num_input_tokens_seen": 39566467856,
      "step": 50290
    },
    {
      "epoch": 5.33534903458519,
      "grad_norm": 0.6368079294416625,
      "learning_rate": 2.936690549460739e-05,
      "loss": 1.1817,
      "num_input_tokens_seen": 39567254528,
      "step": 50291
    },
    {
      "epoch": 5.335455124124762,
      "grad_norm": 0.7110185733329393,
      "learning_rate": 2.9366221208600326e-05,
      "loss": 1.1305,
      "num_input_tokens_seen": 39568041264,
      "step": 50292
    },
    {
      "epoch": 5.335561213664333,
      "grad_norm": 0.60054645961026,
      "learning_rate": 2.9365536919219172e-05,
      "loss": 1.1621,
      "num_input_tokens_seen": 39568827984,
      "step": 50293
    },
    {
      "epoch": 5.335667303203904,
      "grad_norm": 0.8464917691642514,
      "learning_rate": 2.9364852626464456e-05,
      "loss": 1.1122,
      "num_input_tokens_seen": 39569614736,
      "step": 50294
    },
    {
      "epoch": 5.335773392743476,
      "grad_norm": 0.6825095466050237,
      "learning_rate": 2.9364168330336715e-05,
      "loss": 1.0933,
      "num_input_tokens_seen": 39570401552,
      "step": 50295
    },
    {
      "epoch": 5.335879482283047,
      "grad_norm": 0.6908321825936787,
      "learning_rate": 2.9363484030836476e-05,
      "loss": 1.1904,
      "num_input_tokens_seen": 39571188288,
      "step": 50296
    },
    {
      "epoch": 5.335985571822619,
      "grad_norm": 0.5862389200946888,
      "learning_rate": 2.9362799727964252e-05,
      "loss": 1.1535,
      "num_input_tokens_seen": 39571975104,
      "step": 50297
    },
    {
      "epoch": 5.33609166136219,
      "grad_norm": 0.7244548798725332,
      "learning_rate": 2.9362115421720593e-05,
      "loss": 1.151,
      "num_input_tokens_seen": 39572761888,
      "step": 50298
    },
    {
      "epoch": 5.336197750901761,
      "grad_norm": 0.6648347330183466,
      "learning_rate": 2.9361431112106015e-05,
      "loss": 1.1682,
      "num_input_tokens_seen": 39573548624,
      "step": 50299
    },
    {
      "epoch": 5.3363038404413325,
      "grad_norm": 0.6311579355065712,
      "learning_rate": 2.936074679912105e-05,
      "loss": 1.1564,
      "num_input_tokens_seen": 39574335344,
      "step": 50300
    },
    {
      "epoch": 5.336409929980904,
      "grad_norm": 0.6853498441078788,
      "learning_rate": 2.9360062482766238e-05,
      "loss": 1.2061,
      "num_input_tokens_seen": 39575122128,
      "step": 50301
    },
    {
      "epoch": 5.3365160195204755,
      "grad_norm": 0.5826916648344648,
      "learning_rate": 2.9359378163042084e-05,
      "loss": 1.1984,
      "num_input_tokens_seen": 39575908816,
      "step": 50302
    },
    {
      "epoch": 5.3366221090600465,
      "grad_norm": 0.7873358448251137,
      "learning_rate": 2.935869383994914e-05,
      "loss": 1.2437,
      "num_input_tokens_seen": 39576695584,
      "step": 50303
    },
    {
      "epoch": 5.3367281985996184,
      "grad_norm": 0.6213168045574703,
      "learning_rate": 2.9358009513487927e-05,
      "loss": 1.1292,
      "num_input_tokens_seen": 39577482416,
      "step": 50304
    },
    {
      "epoch": 5.3368342881391895,
      "grad_norm": 0.5558208160482419,
      "learning_rate": 2.935732518365896e-05,
      "loss": 1.1271,
      "num_input_tokens_seen": 39578269184,
      "step": 50305
    },
    {
      "epoch": 5.3369403776787605,
      "grad_norm": 0.7343224383491367,
      "learning_rate": 2.9356640850462793e-05,
      "loss": 1.2726,
      "num_input_tokens_seen": 39579055952,
      "step": 50306
    },
    {
      "epoch": 5.337046467218332,
      "grad_norm": 0.5798436368062144,
      "learning_rate": 2.9355956513899935e-05,
      "loss": 1.1284,
      "num_input_tokens_seen": 39579842656,
      "step": 50307
    },
    {
      "epoch": 5.3371525567579035,
      "grad_norm": 0.6030506855153807,
      "learning_rate": 2.935527217397092e-05,
      "loss": 1.079,
      "num_input_tokens_seen": 39580629440,
      "step": 50308
    },
    {
      "epoch": 5.337258646297475,
      "grad_norm": 0.5803085015014919,
      "learning_rate": 2.9354587830676283e-05,
      "loss": 1.1915,
      "num_input_tokens_seen": 39581416080,
      "step": 50309
    },
    {
      "epoch": 5.337364735837046,
      "grad_norm": 0.5917847664773244,
      "learning_rate": 2.935390348401655e-05,
      "loss": 1.1806,
      "num_input_tokens_seen": 39582202864,
      "step": 50310
    },
    {
      "epoch": 5.337470825376618,
      "grad_norm": 0.625834246905947,
      "learning_rate": 2.9353219133992238e-05,
      "loss": 1.1932,
      "num_input_tokens_seen": 39582989648,
      "step": 50311
    },
    {
      "epoch": 5.337576914916189,
      "grad_norm": 0.5853283159468502,
      "learning_rate": 2.9352534780603897e-05,
      "loss": 1.1459,
      "num_input_tokens_seen": 39583776400,
      "step": 50312
    },
    {
      "epoch": 5.33768300445576,
      "grad_norm": 0.6291546150789333,
      "learning_rate": 2.9351850423852047e-05,
      "loss": 1.2023,
      "num_input_tokens_seen": 39584563232,
      "step": 50313
    },
    {
      "epoch": 5.337789093995332,
      "grad_norm": 0.5308616359209125,
      "learning_rate": 2.93511660637372e-05,
      "loss": 1.1692,
      "num_input_tokens_seen": 39585349936,
      "step": 50314
    },
    {
      "epoch": 5.337895183534903,
      "grad_norm": 0.5969364882868016,
      "learning_rate": 2.9350481700259913e-05,
      "loss": 1.2093,
      "num_input_tokens_seen": 39586136672,
      "step": 50315
    },
    {
      "epoch": 5.338001273074475,
      "grad_norm": 0.5358799578089973,
      "learning_rate": 2.93497973334207e-05,
      "loss": 1.1706,
      "num_input_tokens_seen": 39586923408,
      "step": 50316
    },
    {
      "epoch": 5.338107362614046,
      "grad_norm": 0.609619855076658,
      "learning_rate": 2.9349112963220083e-05,
      "loss": 1.1841,
      "num_input_tokens_seen": 39587710176,
      "step": 50317
    },
    {
      "epoch": 5.338213452153617,
      "grad_norm": 0.5661021332685945,
      "learning_rate": 2.9348428589658607e-05,
      "loss": 1.1265,
      "num_input_tokens_seen": 39588496944,
      "step": 50318
    },
    {
      "epoch": 5.338319541693189,
      "grad_norm": 0.7548053780391233,
      "learning_rate": 2.9347744212736787e-05,
      "loss": 1.2968,
      "num_input_tokens_seen": 39589283616,
      "step": 50319
    },
    {
      "epoch": 5.33842563123276,
      "grad_norm": 0.5727947235177606,
      "learning_rate": 2.9347059832455158e-05,
      "loss": 1.134,
      "num_input_tokens_seen": 39590070400,
      "step": 50320
    },
    {
      "epoch": 5.338531720772332,
      "grad_norm": 0.6451961153211551,
      "learning_rate": 2.9346375448814257e-05,
      "loss": 1.1217,
      "num_input_tokens_seen": 39590857168,
      "step": 50321
    },
    {
      "epoch": 5.338637810311903,
      "grad_norm": 0.5979830290489679,
      "learning_rate": 2.9345691061814602e-05,
      "loss": 1.1738,
      "num_input_tokens_seen": 39591644032,
      "step": 50322
    },
    {
      "epoch": 5.338743899851474,
      "grad_norm": 0.806552227155325,
      "learning_rate": 2.9345006671456716e-05,
      "loss": 1.2054,
      "num_input_tokens_seen": 39592430768,
      "step": 50323
    },
    {
      "epoch": 5.338849989391046,
      "grad_norm": 0.5852253575738403,
      "learning_rate": 2.9344322277741144e-05,
      "loss": 1.1185,
      "num_input_tokens_seen": 39593217504,
      "step": 50324
    },
    {
      "epoch": 5.338956078930617,
      "grad_norm": 0.8300604910376718,
      "learning_rate": 2.93436378806684e-05,
      "loss": 1.2188,
      "num_input_tokens_seen": 39594004192,
      "step": 50325
    },
    {
      "epoch": 5.339062168470189,
      "grad_norm": 0.8137360449125479,
      "learning_rate": 2.9342953480239026e-05,
      "loss": 1.1302,
      "num_input_tokens_seen": 39594790960,
      "step": 50326
    },
    {
      "epoch": 5.33916825800976,
      "grad_norm": 0.657367032174976,
      "learning_rate": 2.934226907645355e-05,
      "loss": 1.1408,
      "num_input_tokens_seen": 39595577728,
      "step": 50327
    },
    {
      "epoch": 5.339274347549331,
      "grad_norm": 1.0705957016698082,
      "learning_rate": 2.9341584669312482e-05,
      "loss": 1.187,
      "num_input_tokens_seen": 39596364576,
      "step": 50328
    },
    {
      "epoch": 5.339380437088903,
      "grad_norm": 0.8565356475569675,
      "learning_rate": 2.9340900258816378e-05,
      "loss": 1.0537,
      "num_input_tokens_seen": 39597151296,
      "step": 50329
    },
    {
      "epoch": 5.339486526628474,
      "grad_norm": 0.7871474086620512,
      "learning_rate": 2.9340215844965745e-05,
      "loss": 1.2698,
      "num_input_tokens_seen": 39597938032,
      "step": 50330
    },
    {
      "epoch": 5.339592616168046,
      "grad_norm": 0.8786379075876241,
      "learning_rate": 2.9339531427761126e-05,
      "loss": 1.1437,
      "num_input_tokens_seen": 39598724752,
      "step": 50331
    },
    {
      "epoch": 5.339698705707617,
      "grad_norm": 0.677338457424533,
      "learning_rate": 2.9338847007203042e-05,
      "loss": 1.1017,
      "num_input_tokens_seen": 39599511616,
      "step": 50332
    },
    {
      "epoch": 5.339804795247189,
      "grad_norm": 0.6787846482896945,
      "learning_rate": 2.9338162583292027e-05,
      "loss": 1.1524,
      "num_input_tokens_seen": 39600298368,
      "step": 50333
    },
    {
      "epoch": 5.33991088478676,
      "grad_norm": 0.7501089637165644,
      "learning_rate": 2.9337478156028603e-05,
      "loss": 1.1979,
      "num_input_tokens_seen": 39601085120,
      "step": 50334
    },
    {
      "epoch": 5.340016974326331,
      "grad_norm": 0.5883573538628966,
      "learning_rate": 2.93367937254133e-05,
      "loss": 1.2249,
      "num_input_tokens_seen": 39601871888,
      "step": 50335
    },
    {
      "epoch": 5.340123063865903,
      "grad_norm": 0.5575211899003708,
      "learning_rate": 2.9336109291446663e-05,
      "loss": 1.1735,
      "num_input_tokens_seen": 39602658624,
      "step": 50336
    },
    {
      "epoch": 5.340229153405474,
      "grad_norm": 0.6533947789985751,
      "learning_rate": 2.9335424854129196e-05,
      "loss": 1.1981,
      "num_input_tokens_seen": 39603445424,
      "step": 50337
    },
    {
      "epoch": 5.340335242945046,
      "grad_norm": 0.5171167929742265,
      "learning_rate": 2.933474041346145e-05,
      "loss": 1.059,
      "num_input_tokens_seen": 39604232240,
      "step": 50338
    },
    {
      "epoch": 5.340441332484617,
      "grad_norm": 0.551390720334574,
      "learning_rate": 2.9334055969443934e-05,
      "loss": 1.0741,
      "num_input_tokens_seen": 39605019056,
      "step": 50339
    },
    {
      "epoch": 5.340547422024189,
      "grad_norm": 0.6287826664129854,
      "learning_rate": 2.933337152207719e-05,
      "loss": 1.2254,
      "num_input_tokens_seen": 39605805776,
      "step": 50340
    },
    {
      "epoch": 5.34065351156376,
      "grad_norm": 0.6220521728285981,
      "learning_rate": 2.933268707136175e-05,
      "loss": 1.1187,
      "num_input_tokens_seen": 39606592608,
      "step": 50341
    },
    {
      "epoch": 5.340759601103331,
      "grad_norm": 0.5921150705402933,
      "learning_rate": 2.9332002617298122e-05,
      "loss": 1.1733,
      "num_input_tokens_seen": 39607379376,
      "step": 50342
    },
    {
      "epoch": 5.340865690642903,
      "grad_norm": 0.6049934911502091,
      "learning_rate": 2.933131815988686e-05,
      "loss": 1.1167,
      "num_input_tokens_seen": 39608166160,
      "step": 50343
    },
    {
      "epoch": 5.340971780182474,
      "grad_norm": 0.696754630657187,
      "learning_rate": 2.9330633699128486e-05,
      "loss": 1.1803,
      "num_input_tokens_seen": 39608952992,
      "step": 50344
    },
    {
      "epoch": 5.341077869722046,
      "grad_norm": 0.632681131796792,
      "learning_rate": 2.9329949235023514e-05,
      "loss": 1.1802,
      "num_input_tokens_seen": 39609739728,
      "step": 50345
    },
    {
      "epoch": 5.341183959261617,
      "grad_norm": 0.6439349574340556,
      "learning_rate": 2.932926476757249e-05,
      "loss": 1.2095,
      "num_input_tokens_seen": 39610526528,
      "step": 50346
    },
    {
      "epoch": 5.341290048801188,
      "grad_norm": 0.7807596739048567,
      "learning_rate": 2.932858029677594e-05,
      "loss": 1.1857,
      "num_input_tokens_seen": 39611313264,
      "step": 50347
    },
    {
      "epoch": 5.34139613834076,
      "grad_norm": 0.5554244927087756,
      "learning_rate": 2.9327895822634387e-05,
      "loss": 1.1211,
      "num_input_tokens_seen": 39612100016,
      "step": 50348
    },
    {
      "epoch": 5.341502227880331,
      "grad_norm": 0.7228224518251712,
      "learning_rate": 2.9327211345148365e-05,
      "loss": 1.1979,
      "num_input_tokens_seen": 39612886848,
      "step": 50349
    },
    {
      "epoch": 5.341608317419903,
      "grad_norm": 0.6230896323973087,
      "learning_rate": 2.93265268643184e-05,
      "loss": 1.1232,
      "num_input_tokens_seen": 39613673616,
      "step": 50350
    },
    {
      "epoch": 5.341714406959474,
      "grad_norm": 0.8616968291717243,
      "learning_rate": 2.932584238014502e-05,
      "loss": 1.2658,
      "num_input_tokens_seen": 39614460288,
      "step": 50351
    },
    {
      "epoch": 5.341820496499045,
      "grad_norm": 0.6740368606366255,
      "learning_rate": 2.932515789262876e-05,
      "loss": 1.1823,
      "num_input_tokens_seen": 39615247088,
      "step": 50352
    },
    {
      "epoch": 5.341926586038617,
      "grad_norm": 0.6286955821530323,
      "learning_rate": 2.9324473401770136e-05,
      "loss": 1.1759,
      "num_input_tokens_seen": 39616033856,
      "step": 50353
    },
    {
      "epoch": 5.342032675578188,
      "grad_norm": 1.2995333917142793,
      "learning_rate": 2.9323788907569693e-05,
      "loss": 1.1375,
      "num_input_tokens_seen": 39616820656,
      "step": 50354
    },
    {
      "epoch": 5.34213876511776,
      "grad_norm": 0.6394006209382964,
      "learning_rate": 2.9323104410027953e-05,
      "loss": 1.1893,
      "num_input_tokens_seen": 39617607472,
      "step": 50355
    },
    {
      "epoch": 5.342244854657331,
      "grad_norm": 0.6853425394637137,
      "learning_rate": 2.9322419909145444e-05,
      "loss": 1.1207,
      "num_input_tokens_seen": 39618394192,
      "step": 50356
    },
    {
      "epoch": 5.342350944196903,
      "grad_norm": 1.2834289352923847,
      "learning_rate": 2.932173540492269e-05,
      "loss": 1.2371,
      "num_input_tokens_seen": 39619180944,
      "step": 50357
    },
    {
      "epoch": 5.342457033736474,
      "grad_norm": 0.5944760448411577,
      "learning_rate": 2.9321050897360236e-05,
      "loss": 1.2191,
      "num_input_tokens_seen": 39619967760,
      "step": 50358
    },
    {
      "epoch": 5.342563123276045,
      "grad_norm": 0.8391384314130558,
      "learning_rate": 2.9320366386458598e-05,
      "loss": 1.0842,
      "num_input_tokens_seen": 39620754544,
      "step": 50359
    },
    {
      "epoch": 5.342669212815617,
      "grad_norm": 0.9868205506472857,
      "learning_rate": 2.93196818722183e-05,
      "loss": 1.1667,
      "num_input_tokens_seen": 39621541264,
      "step": 50360
    },
    {
      "epoch": 5.342775302355188,
      "grad_norm": 0.574244766977373,
      "learning_rate": 2.9318997354639888e-05,
      "loss": 1.175,
      "num_input_tokens_seen": 39622328064,
      "step": 50361
    },
    {
      "epoch": 5.3428813918947595,
      "grad_norm": 1.0123605247431664,
      "learning_rate": 2.931831283372388e-05,
      "loss": 1.2707,
      "num_input_tokens_seen": 39623114736,
      "step": 50362
    },
    {
      "epoch": 5.3429874814343306,
      "grad_norm": 0.8957454081367413,
      "learning_rate": 2.93176283094708e-05,
      "loss": 1.1376,
      "num_input_tokens_seen": 39623901456,
      "step": 50363
    },
    {
      "epoch": 5.343093570973902,
      "grad_norm": 0.7714660102223801,
      "learning_rate": 2.931694378188119e-05,
      "loss": 1.1858,
      "num_input_tokens_seen": 39624688208,
      "step": 50364
    },
    {
      "epoch": 5.3431996605134735,
      "grad_norm": 0.9056691718138966,
      "learning_rate": 2.9316259250955574e-05,
      "loss": 1.192,
      "num_input_tokens_seen": 39625474960,
      "step": 50365
    },
    {
      "epoch": 5.3433057500530445,
      "grad_norm": 0.5904361016461017,
      "learning_rate": 2.931557471669447e-05,
      "loss": 1.242,
      "num_input_tokens_seen": 39626261664,
      "step": 50366
    },
    {
      "epoch": 5.3434118395926165,
      "grad_norm": 0.643082658781001,
      "learning_rate": 2.9314890179098424e-05,
      "loss": 1.1081,
      "num_input_tokens_seen": 39627048432,
      "step": 50367
    },
    {
      "epoch": 5.3435179291321875,
      "grad_norm": 0.6411869121370568,
      "learning_rate": 2.9314205638167956e-05,
      "loss": 1.1731,
      "num_input_tokens_seen": 39627835136,
      "step": 50368
    },
    {
      "epoch": 5.343624018671759,
      "grad_norm": 0.6268263516013254,
      "learning_rate": 2.9313521093903594e-05,
      "loss": 1.2597,
      "num_input_tokens_seen": 39628621824,
      "step": 50369
    },
    {
      "epoch": 5.34373010821133,
      "grad_norm": 0.5214579562094842,
      "learning_rate": 2.9312836546305876e-05,
      "loss": 1.1099,
      "num_input_tokens_seen": 39629408592,
      "step": 50370
    },
    {
      "epoch": 5.3438361977509015,
      "grad_norm": 0.5487462283011457,
      "learning_rate": 2.9312151995375314e-05,
      "loss": 1.123,
      "num_input_tokens_seen": 39630195360,
      "step": 50371
    },
    {
      "epoch": 5.343942287290473,
      "grad_norm": 0.7104872380388318,
      "learning_rate": 2.931146744111246e-05,
      "loss": 1.1007,
      "num_input_tokens_seen": 39630982144,
      "step": 50372
    },
    {
      "epoch": 5.344048376830044,
      "grad_norm": 0.5817987997449875,
      "learning_rate": 2.9310782883517822e-05,
      "loss": 1.1631,
      "num_input_tokens_seen": 39631768944,
      "step": 50373
    },
    {
      "epoch": 5.344154466369616,
      "grad_norm": 0.6444479334054797,
      "learning_rate": 2.931009832259194e-05,
      "loss": 1.118,
      "num_input_tokens_seen": 39632555808,
      "step": 50374
    },
    {
      "epoch": 5.344260555909187,
      "grad_norm": 0.7833566498212775,
      "learning_rate": 2.930941375833534e-05,
      "loss": 1.1584,
      "num_input_tokens_seen": 39633342528,
      "step": 50375
    },
    {
      "epoch": 5.344366645448758,
      "grad_norm": 0.5904803210904207,
      "learning_rate": 2.9308729190748556e-05,
      "loss": 1.1616,
      "num_input_tokens_seen": 39634129296,
      "step": 50376
    },
    {
      "epoch": 5.34447273498833,
      "grad_norm": 0.7194005776141347,
      "learning_rate": 2.9308044619832102e-05,
      "loss": 1.1673,
      "num_input_tokens_seen": 39634916048,
      "step": 50377
    },
    {
      "epoch": 5.344578824527901,
      "grad_norm": 0.6141265946332068,
      "learning_rate": 2.9307360045586528e-05,
      "loss": 1.2379,
      "num_input_tokens_seen": 39635702752,
      "step": 50378
    },
    {
      "epoch": 5.344684914067473,
      "grad_norm": 0.65806720322201,
      "learning_rate": 2.930667546801235e-05,
      "loss": 1.1883,
      "num_input_tokens_seen": 39636489568,
      "step": 50379
    },
    {
      "epoch": 5.344791003607044,
      "grad_norm": 0.64077525019639,
      "learning_rate": 2.9305990887110097e-05,
      "loss": 1.2255,
      "num_input_tokens_seen": 39637276384,
      "step": 50380
    },
    {
      "epoch": 5.344897093146615,
      "grad_norm": 0.5732493655623798,
      "learning_rate": 2.9305306302880298e-05,
      "loss": 1.1267,
      "num_input_tokens_seen": 39638063120,
      "step": 50381
    },
    {
      "epoch": 5.345003182686187,
      "grad_norm": 0.6330813369346205,
      "learning_rate": 2.9304621715323493e-05,
      "loss": 1.1662,
      "num_input_tokens_seen": 39638849904,
      "step": 50382
    },
    {
      "epoch": 5.345109272225758,
      "grad_norm": 0.636115233966782,
      "learning_rate": 2.9303937124440196e-05,
      "loss": 1.0549,
      "num_input_tokens_seen": 39639636832,
      "step": 50383
    },
    {
      "epoch": 5.34521536176533,
      "grad_norm": 0.5922991253598107,
      "learning_rate": 2.9303252530230946e-05,
      "loss": 1.217,
      "num_input_tokens_seen": 39640423616,
      "step": 50384
    },
    {
      "epoch": 5.345321451304901,
      "grad_norm": 0.6372558723271234,
      "learning_rate": 2.930256793269626e-05,
      "loss": 1.1096,
      "num_input_tokens_seen": 39641210400,
      "step": 50385
    },
    {
      "epoch": 5.345427540844473,
      "grad_norm": 0.6800326963728525,
      "learning_rate": 2.930188333183669e-05,
      "loss": 1.0516,
      "num_input_tokens_seen": 39641997168,
      "step": 50386
    },
    {
      "epoch": 5.345533630384044,
      "grad_norm": 0.701409857721714,
      "learning_rate": 2.930119872765274e-05,
      "loss": 1.2561,
      "num_input_tokens_seen": 39642783856,
      "step": 50387
    },
    {
      "epoch": 5.345639719923615,
      "grad_norm": 0.5521209833852475,
      "learning_rate": 2.930051412014495e-05,
      "loss": 1.0451,
      "num_input_tokens_seen": 39643570768,
      "step": 50388
    },
    {
      "epoch": 5.345745809463187,
      "grad_norm": 0.5727648395390185,
      "learning_rate": 2.929982950931386e-05,
      "loss": 1.1091,
      "num_input_tokens_seen": 39644357552,
      "step": 50389
    },
    {
      "epoch": 5.345851899002758,
      "grad_norm": 0.5685074458947815,
      "learning_rate": 2.929914489515998e-05,
      "loss": 1.1711,
      "num_input_tokens_seen": 39645144304,
      "step": 50390
    },
    {
      "epoch": 5.34595798854233,
      "grad_norm": 0.59921673173621,
      "learning_rate": 2.9298460277683842e-05,
      "loss": 1.1444,
      "num_input_tokens_seen": 39645931008,
      "step": 50391
    },
    {
      "epoch": 5.346064078081901,
      "grad_norm": 0.62455294694714,
      "learning_rate": 2.9297775656885984e-05,
      "loss": 1.3153,
      "num_input_tokens_seen": 39646717712,
      "step": 50392
    },
    {
      "epoch": 5.346170167621472,
      "grad_norm": 0.7035531567151102,
      "learning_rate": 2.9297091032766937e-05,
      "loss": 1.2381,
      "num_input_tokens_seen": 39647504496,
      "step": 50393
    },
    {
      "epoch": 5.346276257161044,
      "grad_norm": 0.5830226624786334,
      "learning_rate": 2.9296406405327216e-05,
      "loss": 1.1764,
      "num_input_tokens_seen": 39648291328,
      "step": 50394
    },
    {
      "epoch": 5.346382346700615,
      "grad_norm": 0.7266725663751605,
      "learning_rate": 2.9295721774567363e-05,
      "loss": 1.1106,
      "num_input_tokens_seen": 39649078160,
      "step": 50395
    },
    {
      "epoch": 5.346488436240187,
      "grad_norm": 0.6931839327386561,
      "learning_rate": 2.9295037140487903e-05,
      "loss": 1.2417,
      "num_input_tokens_seen": 39649864928,
      "step": 50396
    },
    {
      "epoch": 5.346594525779758,
      "grad_norm": 0.607677277160006,
      "learning_rate": 2.9294352503089355e-05,
      "loss": 1.1299,
      "num_input_tokens_seen": 39650651728,
      "step": 50397
    },
    {
      "epoch": 5.34670061531933,
      "grad_norm": 0.6180197515820104,
      "learning_rate": 2.929366786237227e-05,
      "loss": 1.1162,
      "num_input_tokens_seen": 39651438512,
      "step": 50398
    },
    {
      "epoch": 5.346806704858901,
      "grad_norm": 0.8992779901648964,
      "learning_rate": 2.929298321833716e-05,
      "loss": 1.2375,
      "num_input_tokens_seen": 39652225248,
      "step": 50399
    },
    {
      "epoch": 5.346912794398472,
      "grad_norm": 0.6774965648684117,
      "learning_rate": 2.929229857098455e-05,
      "loss": 1.1781,
      "num_input_tokens_seen": 39653012000,
      "step": 50400
    },
    {
      "epoch": 5.347018883938044,
      "grad_norm": 1.0492552236865231,
      "learning_rate": 2.9291613920314987e-05,
      "loss": 1.1762,
      "num_input_tokens_seen": 39653798672,
      "step": 50401
    },
    {
      "epoch": 5.347124973477615,
      "grad_norm": 0.8573410446991259,
      "learning_rate": 2.9290929266328992e-05,
      "loss": 1.0526,
      "num_input_tokens_seen": 39654585376,
      "step": 50402
    },
    {
      "epoch": 5.347231063017187,
      "grad_norm": 0.7324140681667427,
      "learning_rate": 2.9290244609027084e-05,
      "loss": 1.1824,
      "num_input_tokens_seen": 39655372128,
      "step": 50403
    },
    {
      "epoch": 5.347337152556758,
      "grad_norm": 1.16616506697576,
      "learning_rate": 2.9289559948409807e-05,
      "loss": 1.3089,
      "num_input_tokens_seen": 39656158816,
      "step": 50404
    },
    {
      "epoch": 5.347443242096329,
      "grad_norm": 0.597786672271622,
      "learning_rate": 2.9288875284477684e-05,
      "loss": 1.1481,
      "num_input_tokens_seen": 39656945536,
      "step": 50405
    },
    {
      "epoch": 5.347549331635901,
      "grad_norm": 0.8275801854744378,
      "learning_rate": 2.9288190617231243e-05,
      "loss": 1.1776,
      "num_input_tokens_seen": 39657732272,
      "step": 50406
    },
    {
      "epoch": 5.347655421175472,
      "grad_norm": 0.6084567472801365,
      "learning_rate": 2.928750594667102e-05,
      "loss": 1.1711,
      "num_input_tokens_seen": 39658519024,
      "step": 50407
    },
    {
      "epoch": 5.347761510715044,
      "grad_norm": 0.86916480282848,
      "learning_rate": 2.928682127279753e-05,
      "loss": 1.1917,
      "num_input_tokens_seen": 39659305808,
      "step": 50408
    },
    {
      "epoch": 5.347867600254615,
      "grad_norm": 0.6707820491681522,
      "learning_rate": 2.9286136595611314e-05,
      "loss": 1.1692,
      "num_input_tokens_seen": 39660092528,
      "step": 50409
    },
    {
      "epoch": 5.347973689794186,
      "grad_norm": 0.5799926233455318,
      "learning_rate": 2.9285451915112894e-05,
      "loss": 1.1157,
      "num_input_tokens_seen": 39660879360,
      "step": 50410
    },
    {
      "epoch": 5.348079779333758,
      "grad_norm": 0.7399541657994684,
      "learning_rate": 2.92847672313028e-05,
      "loss": 1.1545,
      "num_input_tokens_seen": 39661666160,
      "step": 50411
    },
    {
      "epoch": 5.348185868873329,
      "grad_norm": 0.6187360930070712,
      "learning_rate": 2.9284082544181572e-05,
      "loss": 1.1789,
      "num_input_tokens_seen": 39662452944,
      "step": 50412
    },
    {
      "epoch": 5.348291958412901,
      "grad_norm": 0.7615248135318191,
      "learning_rate": 2.928339785374973e-05,
      "loss": 1.2397,
      "num_input_tokens_seen": 39663239616,
      "step": 50413
    },
    {
      "epoch": 5.348398047952472,
      "grad_norm": 0.5934553465204131,
      "learning_rate": 2.9282713160007796e-05,
      "loss": 1.1636,
      "num_input_tokens_seen": 39664026368,
      "step": 50414
    },
    {
      "epoch": 5.348504137492044,
      "grad_norm": 0.640689008298685,
      "learning_rate": 2.9282028462956318e-05,
      "loss": 1.0674,
      "num_input_tokens_seen": 39664813152,
      "step": 50415
    },
    {
      "epoch": 5.348610227031615,
      "grad_norm": 0.7126700643664851,
      "learning_rate": 2.928134376259581e-05,
      "loss": 1.1566,
      "num_input_tokens_seen": 39665599856,
      "step": 50416
    },
    {
      "epoch": 5.348716316571186,
      "grad_norm": 0.6786596982054315,
      "learning_rate": 2.9280659058926795e-05,
      "loss": 1.1739,
      "num_input_tokens_seen": 39666386592,
      "step": 50417
    },
    {
      "epoch": 5.348822406110758,
      "grad_norm": 0.6087328111691147,
      "learning_rate": 2.9279974351949823e-05,
      "loss": 1.1591,
      "num_input_tokens_seen": 39667173344,
      "step": 50418
    },
    {
      "epoch": 5.348928495650329,
      "grad_norm": 0.5511096405290514,
      "learning_rate": 2.9279289641665414e-05,
      "loss": 1.152,
      "num_input_tokens_seen": 39667960208,
      "step": 50419
    },
    {
      "epoch": 5.349034585189901,
      "grad_norm": 0.8072514411676841,
      "learning_rate": 2.9278604928074087e-05,
      "loss": 1.1511,
      "num_input_tokens_seen": 39668746976,
      "step": 50420
    },
    {
      "epoch": 5.349140674729472,
      "grad_norm": 0.5904549056757268,
      "learning_rate": 2.9277920211176384e-05,
      "loss": 1.1662,
      "num_input_tokens_seen": 39669533696,
      "step": 50421
    },
    {
      "epoch": 5.349246764269043,
      "grad_norm": 0.6188764495821916,
      "learning_rate": 2.9277235490972833e-05,
      "loss": 1.0239,
      "num_input_tokens_seen": 39670320560,
      "step": 50422
    },
    {
      "epoch": 5.349352853808615,
      "grad_norm": 1.0307363907384703,
      "learning_rate": 2.9276550767463956e-05,
      "loss": 1.1228,
      "num_input_tokens_seen": 39671107312,
      "step": 50423
    },
    {
      "epoch": 5.349458943348186,
      "grad_norm": 0.6619958150291185,
      "learning_rate": 2.927586604065029e-05,
      "loss": 1.1535,
      "num_input_tokens_seen": 39671894032,
      "step": 50424
    },
    {
      "epoch": 5.3495650328877575,
      "grad_norm": 0.9293983851142901,
      "learning_rate": 2.9275181310532357e-05,
      "loss": 1.1879,
      "num_input_tokens_seen": 39672680832,
      "step": 50425
    },
    {
      "epoch": 5.349671122427329,
      "grad_norm": 0.8709865263976589,
      "learning_rate": 2.9274496577110687e-05,
      "loss": 1.1388,
      "num_input_tokens_seen": 39673467616,
      "step": 50426
    },
    {
      "epoch": 5.3497772119669005,
      "grad_norm": 0.692831650604012,
      "learning_rate": 2.9273811840385813e-05,
      "loss": 1.0921,
      "num_input_tokens_seen": 39674254400,
      "step": 50427
    },
    {
      "epoch": 5.3498833015064715,
      "grad_norm": 0.677344295402774,
      "learning_rate": 2.927312710035826e-05,
      "loss": 1.1285,
      "num_input_tokens_seen": 39675041088,
      "step": 50428
    },
    {
      "epoch": 5.3499893910460425,
      "grad_norm": 0.8753109661181051,
      "learning_rate": 2.9272442357028568e-05,
      "loss": 1.1326,
      "num_input_tokens_seen": 39675827936,
      "step": 50429
    },
    {
      "epoch": 5.3500954805856145,
      "grad_norm": 0.5703237910041967,
      "learning_rate": 2.9271757610397253e-05,
      "loss": 1.0859,
      "num_input_tokens_seen": 39676614720,
      "step": 50430
    },
    {
      "epoch": 5.3502015701251855,
      "grad_norm": 0.6100728638786933,
      "learning_rate": 2.9271072860464842e-05,
      "loss": 1.173,
      "num_input_tokens_seen": 39677401536,
      "step": 50431
    },
    {
      "epoch": 5.350307659664757,
      "grad_norm": 0.7356795496444906,
      "learning_rate": 2.927038810723188e-05,
      "loss": 1.1511,
      "num_input_tokens_seen": 39678188240,
      "step": 50432
    },
    {
      "epoch": 5.350413749204328,
      "grad_norm": 0.6884963612226828,
      "learning_rate": 2.926970335069889e-05,
      "loss": 1.1503,
      "num_input_tokens_seen": 39678974928,
      "step": 50433
    },
    {
      "epoch": 5.3505198387438995,
      "grad_norm": 0.614711112669563,
      "learning_rate": 2.9269018590866392e-05,
      "loss": 1.1915,
      "num_input_tokens_seen": 39679761664,
      "step": 50434
    },
    {
      "epoch": 5.350625928283471,
      "grad_norm": 0.6945331958375539,
      "learning_rate": 2.9268333827734927e-05,
      "loss": 1.2694,
      "num_input_tokens_seen": 39680548432,
      "step": 50435
    },
    {
      "epoch": 5.350732017823042,
      "grad_norm": 0.6182906818207738,
      "learning_rate": 2.926764906130502e-05,
      "loss": 1.1145,
      "num_input_tokens_seen": 39681335312,
      "step": 50436
    },
    {
      "epoch": 5.350838107362614,
      "grad_norm": 0.6576295522738922,
      "learning_rate": 2.9266964291577188e-05,
      "loss": 1.1136,
      "num_input_tokens_seen": 39682122144,
      "step": 50437
    },
    {
      "epoch": 5.350944196902185,
      "grad_norm": 0.6434399400178191,
      "learning_rate": 2.9266279518551982e-05,
      "loss": 1.1242,
      "num_input_tokens_seen": 39682908880,
      "step": 50438
    },
    {
      "epoch": 5.351050286441756,
      "grad_norm": 0.6785863340463969,
      "learning_rate": 2.9265594742229916e-05,
      "loss": 1.2602,
      "num_input_tokens_seen": 39683695648,
      "step": 50439
    },
    {
      "epoch": 5.351156375981328,
      "grad_norm": 0.6118884572353812,
      "learning_rate": 2.926490996261152e-05,
      "loss": 1.2768,
      "num_input_tokens_seen": 39684482352,
      "step": 50440
    },
    {
      "epoch": 5.351262465520899,
      "grad_norm": 0.7183009474020843,
      "learning_rate": 2.9264225179697337e-05,
      "loss": 1.2838,
      "num_input_tokens_seen": 39685269088,
      "step": 50441
    },
    {
      "epoch": 5.351368555060471,
      "grad_norm": 0.949165778014429,
      "learning_rate": 2.9263540393487876e-05,
      "loss": 1.0502,
      "num_input_tokens_seen": 39686055904,
      "step": 50442
    },
    {
      "epoch": 5.351474644600042,
      "grad_norm": 0.6971788682561625,
      "learning_rate": 2.926285560398368e-05,
      "loss": 1.1277,
      "num_input_tokens_seen": 39686842720,
      "step": 50443
    },
    {
      "epoch": 5.351580734139614,
      "grad_norm": 0.65938940342998,
      "learning_rate": 2.9262170811185273e-05,
      "loss": 1.1152,
      "num_input_tokens_seen": 39687629520,
      "step": 50444
    },
    {
      "epoch": 5.351686823679185,
      "grad_norm": 0.7707424233037514,
      "learning_rate": 2.9261486015093188e-05,
      "loss": 1.2451,
      "num_input_tokens_seen": 39688416224,
      "step": 50445
    },
    {
      "epoch": 5.351792913218756,
      "grad_norm": 0.7173330620970988,
      "learning_rate": 2.926080121570795e-05,
      "loss": 1.2174,
      "num_input_tokens_seen": 39689203088,
      "step": 50446
    },
    {
      "epoch": 5.351899002758328,
      "grad_norm": 0.7774351048059193,
      "learning_rate": 2.9260116413030092e-05,
      "loss": 1.1791,
      "num_input_tokens_seen": 39689989888,
      "step": 50447
    },
    {
      "epoch": 5.352005092297899,
      "grad_norm": 0.9700061582870232,
      "learning_rate": 2.9259431607060132e-05,
      "loss": 1.1929,
      "num_input_tokens_seen": 39690776624,
      "step": 50448
    },
    {
      "epoch": 5.352111181837471,
      "grad_norm": 0.9046503220118699,
      "learning_rate": 2.9258746797798612e-05,
      "loss": 1.1019,
      "num_input_tokens_seen": 39691563360,
      "step": 50449
    },
    {
      "epoch": 5.352217271377042,
      "grad_norm": 0.7422479377533109,
      "learning_rate": 2.9258061985246065e-05,
      "loss": 1.0766,
      "num_input_tokens_seen": 39692350240,
      "step": 50450
    },
    {
      "epoch": 5.352323360916614,
      "grad_norm": 0.6898310547733663,
      "learning_rate": 2.925737716940301e-05,
      "loss": 1.1646,
      "num_input_tokens_seen": 39693136944,
      "step": 50451
    },
    {
      "epoch": 5.352429450456185,
      "grad_norm": 0.7184734996218126,
      "learning_rate": 2.9256692350269972e-05,
      "loss": 1.1778,
      "num_input_tokens_seen": 39693923712,
      "step": 50452
    },
    {
      "epoch": 5.352535539995756,
      "grad_norm": 0.5666036969453606,
      "learning_rate": 2.9256007527847495e-05,
      "loss": 1.258,
      "num_input_tokens_seen": 39694710528,
      "step": 50453
    },
    {
      "epoch": 5.352641629535328,
      "grad_norm": 0.6325669138643646,
      "learning_rate": 2.925532270213609e-05,
      "loss": 1.1456,
      "num_input_tokens_seen": 39695497360,
      "step": 50454
    },
    {
      "epoch": 5.352747719074899,
      "grad_norm": 0.6203341822933044,
      "learning_rate": 2.9254637873136308e-05,
      "loss": 1.2037,
      "num_input_tokens_seen": 39696284096,
      "step": 50455
    },
    {
      "epoch": 5.352853808614471,
      "grad_norm": 0.6573905291395948,
      "learning_rate": 2.9253953040848665e-05,
      "loss": 1.1751,
      "num_input_tokens_seen": 39697070880,
      "step": 50456
    },
    {
      "epoch": 5.352959898154042,
      "grad_norm": 0.6523625425660952,
      "learning_rate": 2.9253268205273687e-05,
      "loss": 1.1385,
      "num_input_tokens_seen": 39697857584,
      "step": 50457
    },
    {
      "epoch": 5.353065987693613,
      "grad_norm": 0.6702009205596929,
      "learning_rate": 2.9252583366411913e-05,
      "loss": 1.2441,
      "num_input_tokens_seen": 39698644336,
      "step": 50458
    },
    {
      "epoch": 5.353172077233185,
      "grad_norm": 0.8186314686112843,
      "learning_rate": 2.9251898524263865e-05,
      "loss": 1.1319,
      "num_input_tokens_seen": 39699431136,
      "step": 50459
    },
    {
      "epoch": 5.353278166772756,
      "grad_norm": 0.6204386603749187,
      "learning_rate": 2.925121367883007e-05,
      "loss": 1.1283,
      "num_input_tokens_seen": 39700217968,
      "step": 50460
    },
    {
      "epoch": 5.353384256312328,
      "grad_norm": 0.6126986334433958,
      "learning_rate": 2.925052883011107e-05,
      "loss": 1.1713,
      "num_input_tokens_seen": 39701004816,
      "step": 50461
    },
    {
      "epoch": 5.353490345851899,
      "grad_norm": 0.703253673157122,
      "learning_rate": 2.9249843978107383e-05,
      "loss": 1.2783,
      "num_input_tokens_seen": 39701791552,
      "step": 50462
    },
    {
      "epoch": 5.35359643539147,
      "grad_norm": 0.6194038119199198,
      "learning_rate": 2.9249159122819536e-05,
      "loss": 1.2032,
      "num_input_tokens_seen": 39702578256,
      "step": 50463
    },
    {
      "epoch": 5.353702524931042,
      "grad_norm": 0.6843358595449266,
      "learning_rate": 2.924847426424807e-05,
      "loss": 1.0997,
      "num_input_tokens_seen": 39703364960,
      "step": 50464
    },
    {
      "epoch": 5.353808614470613,
      "grad_norm": 0.6159138754773688,
      "learning_rate": 2.924778940239351e-05,
      "loss": 1.12,
      "num_input_tokens_seen": 39704151744,
      "step": 50465
    },
    {
      "epoch": 5.353914704010185,
      "grad_norm": 0.6683444483306136,
      "learning_rate": 2.9247104537256377e-05,
      "loss": 1.1745,
      "num_input_tokens_seen": 39704938544,
      "step": 50466
    },
    {
      "epoch": 5.354020793549756,
      "grad_norm": 0.6152597701992691,
      "learning_rate": 2.924641966883721e-05,
      "loss": 1.175,
      "num_input_tokens_seen": 39705725296,
      "step": 50467
    },
    {
      "epoch": 5.354126883089327,
      "grad_norm": 0.6961146025589396,
      "learning_rate": 2.924573479713653e-05,
      "loss": 1.1571,
      "num_input_tokens_seen": 39706512032,
      "step": 50468
    },
    {
      "epoch": 5.354232972628899,
      "grad_norm": 0.8301914102558309,
      "learning_rate": 2.9245049922154872e-05,
      "loss": 1.1519,
      "num_input_tokens_seen": 39707298832,
      "step": 50469
    },
    {
      "epoch": 5.35433906216847,
      "grad_norm": 0.789775244963362,
      "learning_rate": 2.9244365043892768e-05,
      "loss": 1.2107,
      "num_input_tokens_seen": 39708085584,
      "step": 50470
    },
    {
      "epoch": 5.354445151708042,
      "grad_norm": 0.737647806697681,
      "learning_rate": 2.924368016235074e-05,
      "loss": 1.1234,
      "num_input_tokens_seen": 39708872368,
      "step": 50471
    },
    {
      "epoch": 5.354551241247613,
      "grad_norm": 0.883063651123695,
      "learning_rate": 2.9242995277529316e-05,
      "loss": 1.1993,
      "num_input_tokens_seen": 39709659232,
      "step": 50472
    },
    {
      "epoch": 5.354657330787185,
      "grad_norm": 0.7225369245325183,
      "learning_rate": 2.924231038942904e-05,
      "loss": 1.1875,
      "num_input_tokens_seen": 39710446032,
      "step": 50473
    },
    {
      "epoch": 5.354763420326756,
      "grad_norm": 0.7714620480519302,
      "learning_rate": 2.9241625498050423e-05,
      "loss": 1.1325,
      "num_input_tokens_seen": 39711232752,
      "step": 50474
    },
    {
      "epoch": 5.354869509866327,
      "grad_norm": 0.9731787518946108,
      "learning_rate": 2.9240940603394006e-05,
      "loss": 1.201,
      "num_input_tokens_seen": 39712019520,
      "step": 50475
    },
    {
      "epoch": 5.354975599405899,
      "grad_norm": 0.5320951794815241,
      "learning_rate": 2.9240255705460317e-05,
      "loss": 1.1592,
      "num_input_tokens_seen": 39712806352,
      "step": 50476
    },
    {
      "epoch": 5.35508168894547,
      "grad_norm": 0.8714000000994975,
      "learning_rate": 2.923957080424987e-05,
      "loss": 1.2278,
      "num_input_tokens_seen": 39713593136,
      "step": 50477
    },
    {
      "epoch": 5.355187778485042,
      "grad_norm": 0.8109281786326878,
      "learning_rate": 2.9238885899763223e-05,
      "loss": 1.1173,
      "num_input_tokens_seen": 39714379968,
      "step": 50478
    },
    {
      "epoch": 5.355293868024613,
      "grad_norm": 0.6539465451002385,
      "learning_rate": 2.9238200992000885e-05,
      "loss": 1.2387,
      "num_input_tokens_seen": 39715166816,
      "step": 50479
    },
    {
      "epoch": 5.355399957564185,
      "grad_norm": 0.7112466042298788,
      "learning_rate": 2.9237516080963383e-05,
      "loss": 1.1879,
      "num_input_tokens_seen": 39715953616,
      "step": 50480
    },
    {
      "epoch": 5.355506047103756,
      "grad_norm": 0.7439972573155995,
      "learning_rate": 2.9236831166651258e-05,
      "loss": 1.2146,
      "num_input_tokens_seen": 39716740336,
      "step": 50481
    },
    {
      "epoch": 5.355612136643327,
      "grad_norm": 0.6880313936431911,
      "learning_rate": 2.923614624906504e-05,
      "loss": 1.0537,
      "num_input_tokens_seen": 39717527168,
      "step": 50482
    },
    {
      "epoch": 5.355718226182899,
      "grad_norm": 0.7648037080044383,
      "learning_rate": 2.9235461328205238e-05,
      "loss": 1.1424,
      "num_input_tokens_seen": 39718313952,
      "step": 50483
    },
    {
      "epoch": 5.35582431572247,
      "grad_norm": 0.7045496428896204,
      "learning_rate": 2.9234776404072406e-05,
      "loss": 1.0733,
      "num_input_tokens_seen": 39719100736,
      "step": 50484
    },
    {
      "epoch": 5.355930405262042,
      "grad_norm": 0.6747035399131899,
      "learning_rate": 2.9234091476667063e-05,
      "loss": 1.1781,
      "num_input_tokens_seen": 39719887536,
      "step": 50485
    },
    {
      "epoch": 5.356036494801613,
      "grad_norm": 0.7220123359179593,
      "learning_rate": 2.9233406545989733e-05,
      "loss": 1.1737,
      "num_input_tokens_seen": 39720674240,
      "step": 50486
    },
    {
      "epoch": 5.356142584341184,
      "grad_norm": 0.6014835905408408,
      "learning_rate": 2.923272161204096e-05,
      "loss": 1.1235,
      "num_input_tokens_seen": 39721460976,
      "step": 50487
    },
    {
      "epoch": 5.3562486738807555,
      "grad_norm": 0.620384933283643,
      "learning_rate": 2.923203667482125e-05,
      "loss": 1.1843,
      "num_input_tokens_seen": 39722247712,
      "step": 50488
    },
    {
      "epoch": 5.356354763420327,
      "grad_norm": 0.6394310243699869,
      "learning_rate": 2.9231351734331157e-05,
      "loss": 1.1028,
      "num_input_tokens_seen": 39723034480,
      "step": 50489
    },
    {
      "epoch": 5.3564608529598985,
      "grad_norm": 0.5544793994957797,
      "learning_rate": 2.92306667905712e-05,
      "loss": 1.1545,
      "num_input_tokens_seen": 39723821200,
      "step": 50490
    },
    {
      "epoch": 5.3565669424994695,
      "grad_norm": 0.6550445919288871,
      "learning_rate": 2.92299818435419e-05,
      "loss": 1.1299,
      "num_input_tokens_seen": 39724607920,
      "step": 50491
    },
    {
      "epoch": 5.3566730320390405,
      "grad_norm": 0.5674269472643851,
      "learning_rate": 2.9229296893243803e-05,
      "loss": 1.1387,
      "num_input_tokens_seen": 39725394688,
      "step": 50492
    },
    {
      "epoch": 5.3567791215786125,
      "grad_norm": 0.6127110856909563,
      "learning_rate": 2.9228611939677423e-05,
      "loss": 1.1432,
      "num_input_tokens_seen": 39726181536,
      "step": 50493
    },
    {
      "epoch": 5.3568852111181835,
      "grad_norm": 0.6077947999671521,
      "learning_rate": 2.9227926982843296e-05,
      "loss": 1.1807,
      "num_input_tokens_seen": 39726968288,
      "step": 50494
    },
    {
      "epoch": 5.356991300657755,
      "grad_norm": 0.6086605128255856,
      "learning_rate": 2.9227242022741952e-05,
      "loss": 1.1433,
      "num_input_tokens_seen": 39727754960,
      "step": 50495
    },
    {
      "epoch": 5.3570973901973264,
      "grad_norm": 0.5689579254825801,
      "learning_rate": 2.9226557059373914e-05,
      "loss": 1.1344,
      "num_input_tokens_seen": 39728541776,
      "step": 50496
    },
    {
      "epoch": 5.3572034797368975,
      "grad_norm": 0.6643564536886634,
      "learning_rate": 2.9225872092739724e-05,
      "loss": 1.1011,
      "num_input_tokens_seen": 39729328528,
      "step": 50497
    },
    {
      "epoch": 5.357309569276469,
      "grad_norm": 0.6287860350471942,
      "learning_rate": 2.9225187122839903e-05,
      "loss": 1.198,
      "num_input_tokens_seen": 39730115280,
      "step": 50498
    },
    {
      "epoch": 5.35741565881604,
      "grad_norm": 0.5751242436578797,
      "learning_rate": 2.922450214967498e-05,
      "loss": 1.2015,
      "num_input_tokens_seen": 39730901984,
      "step": 50499
    },
    {
      "epoch": 5.357521748355612,
      "grad_norm": 0.8101219706524923,
      "learning_rate": 2.9223817173245488e-05,
      "loss": 1.1454,
      "num_input_tokens_seen": 39731688656,
      "step": 50500
    },
    {
      "epoch": 5.357627837895183,
      "grad_norm": 0.6664202094600437,
      "learning_rate": 2.9223132193551954e-05,
      "loss": 1.135,
      "num_input_tokens_seen": 39732475424,
      "step": 50501
    },
    {
      "epoch": 5.357733927434755,
      "grad_norm": 0.9592279116477619,
      "learning_rate": 2.922244721059491e-05,
      "loss": 1.268,
      "num_input_tokens_seen": 39733262208,
      "step": 50502
    },
    {
      "epoch": 5.357840016974326,
      "grad_norm": 0.6467253050276459,
      "learning_rate": 2.9221762224374875e-05,
      "loss": 1.1455,
      "num_input_tokens_seen": 39734048880,
      "step": 50503
    },
    {
      "epoch": 5.357946106513897,
      "grad_norm": 0.669067733748367,
      "learning_rate": 2.922107723489239e-05,
      "loss": 1.2339,
      "num_input_tokens_seen": 39734835680,
      "step": 50504
    },
    {
      "epoch": 5.358052196053469,
      "grad_norm": 0.6587181445090244,
      "learning_rate": 2.9220392242147987e-05,
      "loss": 1.1445,
      "num_input_tokens_seen": 39735622400,
      "step": 50505
    },
    {
      "epoch": 5.35815828559304,
      "grad_norm": 0.8127762783743796,
      "learning_rate": 2.9219707246142174e-05,
      "loss": 1.1417,
      "num_input_tokens_seen": 39736409120,
      "step": 50506
    },
    {
      "epoch": 5.358264375132612,
      "grad_norm": 0.8363975888305427,
      "learning_rate": 2.9219022246875504e-05,
      "loss": 1.2655,
      "num_input_tokens_seen": 39737195856,
      "step": 50507
    },
    {
      "epoch": 5.358370464672183,
      "grad_norm": 0.8415526072547563,
      "learning_rate": 2.9218337244348503e-05,
      "loss": 1.137,
      "num_input_tokens_seen": 39737982512,
      "step": 50508
    },
    {
      "epoch": 5.358476554211755,
      "grad_norm": 0.8996655953552092,
      "learning_rate": 2.921765223856168e-05,
      "loss": 1.1947,
      "num_input_tokens_seen": 39738769248,
      "step": 50509
    },
    {
      "epoch": 5.358582643751326,
      "grad_norm": 0.9810166796305542,
      "learning_rate": 2.921696722951559e-05,
      "loss": 1.3066,
      "num_input_tokens_seen": 39739556000,
      "step": 50510
    },
    {
      "epoch": 5.358688733290897,
      "grad_norm": 1.1663879245767297,
      "learning_rate": 2.9216282217210755e-05,
      "loss": 1.1827,
      "num_input_tokens_seen": 39740342672,
      "step": 50511
    },
    {
      "epoch": 5.358794822830469,
      "grad_norm": 1.1697921737148826,
      "learning_rate": 2.9215597201647686e-05,
      "loss": 1.1273,
      "num_input_tokens_seen": 39741129488,
      "step": 50512
    },
    {
      "epoch": 5.35890091237004,
      "grad_norm": 0.8522468988676911,
      "learning_rate": 2.9214912182826942e-05,
      "loss": 1.1734,
      "num_input_tokens_seen": 39741916208,
      "step": 50513
    },
    {
      "epoch": 5.359007001909612,
      "grad_norm": 0.6615234988699584,
      "learning_rate": 2.921422716074903e-05,
      "loss": 1.079,
      "num_input_tokens_seen": 39742702976,
      "step": 50514
    },
    {
      "epoch": 5.359113091449183,
      "grad_norm": 1.4178545901413055,
      "learning_rate": 2.921354213541449e-05,
      "loss": 1.1725,
      "num_input_tokens_seen": 39743489680,
      "step": 50515
    },
    {
      "epoch": 5.359219180988754,
      "grad_norm": 1.3055549197042398,
      "learning_rate": 2.9212857106823843e-05,
      "loss": 1.1088,
      "num_input_tokens_seen": 39744276512,
      "step": 50516
    },
    {
      "epoch": 5.359325270528326,
      "grad_norm": 0.6713996943283781,
      "learning_rate": 2.921217207497763e-05,
      "loss": 1.1261,
      "num_input_tokens_seen": 39745063280,
      "step": 50517
    },
    {
      "epoch": 5.359431360067897,
      "grad_norm": 1.252765238987804,
      "learning_rate": 2.9211487039876374e-05,
      "loss": 1.1147,
      "num_input_tokens_seen": 39745850064,
      "step": 50518
    },
    {
      "epoch": 5.359537449607469,
      "grad_norm": 1.2139522050026665,
      "learning_rate": 2.9210802001520597e-05,
      "loss": 1.1129,
      "num_input_tokens_seen": 39746636832,
      "step": 50519
    },
    {
      "epoch": 5.35964353914704,
      "grad_norm": 0.8859560816680851,
      "learning_rate": 2.921011695991084e-05,
      "loss": 1.0914,
      "num_input_tokens_seen": 39747423664,
      "step": 50520
    },
    {
      "epoch": 5.359749628686611,
      "grad_norm": 0.814851222371494,
      "learning_rate": 2.920943191504763e-05,
      "loss": 1.1466,
      "num_input_tokens_seen": 39748210384,
      "step": 50521
    },
    {
      "epoch": 5.359855718226183,
      "grad_norm": 1.7564199302497336,
      "learning_rate": 2.9208746866931496e-05,
      "loss": 1.2913,
      "num_input_tokens_seen": 39748997104,
      "step": 50522
    },
    {
      "epoch": 5.359961807765754,
      "grad_norm": 1.036033638706008,
      "learning_rate": 2.920806181556296e-05,
      "loss": 1.1121,
      "num_input_tokens_seen": 39749783808,
      "step": 50523
    },
    {
      "epoch": 5.360067897305326,
      "grad_norm": 0.7144128795619493,
      "learning_rate": 2.9207376760942563e-05,
      "loss": 1.1601,
      "num_input_tokens_seen": 39750570656,
      "step": 50524
    },
    {
      "epoch": 5.360173986844897,
      "grad_norm": 1.1517443044160356,
      "learning_rate": 2.9206691703070826e-05,
      "loss": 1.1284,
      "num_input_tokens_seen": 39751357392,
      "step": 50525
    },
    {
      "epoch": 5.360280076384469,
      "grad_norm": 0.9101642455675765,
      "learning_rate": 2.920600664194828e-05,
      "loss": 1.0934,
      "num_input_tokens_seen": 39752144160,
      "step": 50526
    },
    {
      "epoch": 5.36038616592404,
      "grad_norm": 0.9993524035155291,
      "learning_rate": 2.9205321577575457e-05,
      "loss": 1.1191,
      "num_input_tokens_seen": 39752931024,
      "step": 50527
    },
    {
      "epoch": 5.360492255463611,
      "grad_norm": 0.9266492743989916,
      "learning_rate": 2.9204636509952886e-05,
      "loss": 1.1332,
      "num_input_tokens_seen": 39753717696,
      "step": 50528
    },
    {
      "epoch": 5.360598345003183,
      "grad_norm": 1.4788338034189772,
      "learning_rate": 2.920395143908109e-05,
      "loss": 1.1723,
      "num_input_tokens_seen": 39754504432,
      "step": 50529
    },
    {
      "epoch": 5.360704434542754,
      "grad_norm": 0.7600427324277893,
      "learning_rate": 2.9203266364960607e-05,
      "loss": 1.1604,
      "num_input_tokens_seen": 39755291328,
      "step": 50530
    },
    {
      "epoch": 5.360810524082326,
      "grad_norm": 0.7495992818919018,
      "learning_rate": 2.9202581287591964e-05,
      "loss": 1.2756,
      "num_input_tokens_seen": 39756078048,
      "step": 50531
    },
    {
      "epoch": 5.360916613621897,
      "grad_norm": 0.7078726534329168,
      "learning_rate": 2.9201896206975687e-05,
      "loss": 1.1406,
      "num_input_tokens_seen": 39756864864,
      "step": 50532
    },
    {
      "epoch": 5.361022703161468,
      "grad_norm": 1.1236381559328448,
      "learning_rate": 2.9201211123112316e-05,
      "loss": 1.0995,
      "num_input_tokens_seen": 39757651632,
      "step": 50533
    },
    {
      "epoch": 5.36112879270104,
      "grad_norm": 0.7583086926793887,
      "learning_rate": 2.9200526036002363e-05,
      "loss": 1.2775,
      "num_input_tokens_seen": 39758438432,
      "step": 50534
    },
    {
      "epoch": 5.361234882240611,
      "grad_norm": 0.6307154589096716,
      "learning_rate": 2.9199840945646367e-05,
      "loss": 1.0273,
      "num_input_tokens_seen": 39759225184,
      "step": 50535
    },
    {
      "epoch": 5.361340971780183,
      "grad_norm": 0.7520804233288543,
      "learning_rate": 2.919915585204486e-05,
      "loss": 1.183,
      "num_input_tokens_seen": 39760012032,
      "step": 50536
    },
    {
      "epoch": 5.361447061319754,
      "grad_norm": 0.735016558822651,
      "learning_rate": 2.919847075519837e-05,
      "loss": 1.1676,
      "num_input_tokens_seen": 39760798848,
      "step": 50537
    },
    {
      "epoch": 5.361553150859326,
      "grad_norm": 0.7260366919327375,
      "learning_rate": 2.9197785655107424e-05,
      "loss": 1.1771,
      "num_input_tokens_seen": 39761585536,
      "step": 50538
    },
    {
      "epoch": 5.361659240398897,
      "grad_norm": 0.7310284617664736,
      "learning_rate": 2.9197100551772555e-05,
      "loss": 1.1484,
      "num_input_tokens_seen": 39762372288,
      "step": 50539
    },
    {
      "epoch": 5.361765329938468,
      "grad_norm": 0.5812785751717384,
      "learning_rate": 2.919641544519428e-05,
      "loss": 1.0517,
      "num_input_tokens_seen": 39763159136,
      "step": 50540
    },
    {
      "epoch": 5.36187141947804,
      "grad_norm": 0.7549054232403847,
      "learning_rate": 2.919573033537315e-05,
      "loss": 1.0439,
      "num_input_tokens_seen": 39763945968,
      "step": 50541
    },
    {
      "epoch": 5.361977509017611,
      "grad_norm": 0.7235255783085413,
      "learning_rate": 2.919504522230968e-05,
      "loss": 1.1665,
      "num_input_tokens_seen": 39764732784,
      "step": 50542
    },
    {
      "epoch": 5.362083598557183,
      "grad_norm": 0.614257625967459,
      "learning_rate": 2.919436010600439e-05,
      "loss": 1.1268,
      "num_input_tokens_seen": 39765519520,
      "step": 50543
    },
    {
      "epoch": 5.362189688096754,
      "grad_norm": 0.5818565252823606,
      "learning_rate": 2.9193674986457837e-05,
      "loss": 1.1492,
      "num_input_tokens_seen": 39766306336,
      "step": 50544
    },
    {
      "epoch": 5.362295777636325,
      "grad_norm": 0.7953847618343229,
      "learning_rate": 2.9192989863670527e-05,
      "loss": 1.1979,
      "num_input_tokens_seen": 39767093056,
      "step": 50545
    },
    {
      "epoch": 5.362401867175897,
      "grad_norm": 0.6651251222015199,
      "learning_rate": 2.9192304737643002e-05,
      "loss": 1.1577,
      "num_input_tokens_seen": 39767879760,
      "step": 50546
    },
    {
      "epoch": 5.362507956715468,
      "grad_norm": 0.6450551668912209,
      "learning_rate": 2.9191619608375785e-05,
      "loss": 1.085,
      "num_input_tokens_seen": 39768666576,
      "step": 50547
    },
    {
      "epoch": 5.36261404625504,
      "grad_norm": 0.7770360839525917,
      "learning_rate": 2.9190934475869407e-05,
      "loss": 1.1191,
      "num_input_tokens_seen": 39769453296,
      "step": 50548
    },
    {
      "epoch": 5.362720135794611,
      "grad_norm": 0.7661759767376946,
      "learning_rate": 2.9190249340124397e-05,
      "loss": 1.2268,
      "num_input_tokens_seen": 39770239968,
      "step": 50549
    },
    {
      "epoch": 5.362826225334182,
      "grad_norm": 0.6957501341108624,
      "learning_rate": 2.918956420114129e-05,
      "loss": 1.1291,
      "num_input_tokens_seen": 39771026688,
      "step": 50550
    },
    {
      "epoch": 5.3629323148737535,
      "grad_norm": 0.7685156111780074,
      "learning_rate": 2.9188879058920605e-05,
      "loss": 1.2097,
      "num_input_tokens_seen": 39771813472,
      "step": 50551
    },
    {
      "epoch": 5.363038404413325,
      "grad_norm": 0.7204585623695529,
      "learning_rate": 2.918819391346288e-05,
      "loss": 1.163,
      "num_input_tokens_seen": 39772600176,
      "step": 50552
    },
    {
      "epoch": 5.3631444939528965,
      "grad_norm": 0.8161792551524023,
      "learning_rate": 2.918750876476864e-05,
      "loss": 1.216,
      "num_input_tokens_seen": 39773387024,
      "step": 50553
    },
    {
      "epoch": 5.3632505834924675,
      "grad_norm": 0.6567766582473292,
      "learning_rate": 2.918682361283842e-05,
      "loss": 1.2224,
      "num_input_tokens_seen": 39774173760,
      "step": 50554
    },
    {
      "epoch": 5.3633566730320394,
      "grad_norm": 0.6027829602768523,
      "learning_rate": 2.918613845767274e-05,
      "loss": 1.2003,
      "num_input_tokens_seen": 39774960496,
      "step": 50555
    },
    {
      "epoch": 5.3634627625716105,
      "grad_norm": 0.8614583061768802,
      "learning_rate": 2.9185453299272138e-05,
      "loss": 1.1861,
      "num_input_tokens_seen": 39775747264,
      "step": 50556
    },
    {
      "epoch": 5.3635688521111815,
      "grad_norm": 0.5911778550465545,
      "learning_rate": 2.9184768137637136e-05,
      "loss": 1.1912,
      "num_input_tokens_seen": 39776533984,
      "step": 50557
    },
    {
      "epoch": 5.363674941650753,
      "grad_norm": 0.7076556138831518,
      "learning_rate": 2.9184082972768274e-05,
      "loss": 1.1641,
      "num_input_tokens_seen": 39777320672,
      "step": 50558
    },
    {
      "epoch": 5.3637810311903245,
      "grad_norm": 0.7141846182975506,
      "learning_rate": 2.9183397804666075e-05,
      "loss": 1.1672,
      "num_input_tokens_seen": 39778107488,
      "step": 50559
    },
    {
      "epoch": 5.363887120729896,
      "grad_norm": 0.6084122436066293,
      "learning_rate": 2.9182712633331065e-05,
      "loss": 1.1728,
      "num_input_tokens_seen": 39778894240,
      "step": 50560
    },
    {
      "epoch": 5.363993210269467,
      "grad_norm": 0.7072674490361265,
      "learning_rate": 2.9182027458763785e-05,
      "loss": 1.1468,
      "num_input_tokens_seen": 39779681024,
      "step": 50561
    },
    {
      "epoch": 5.364099299809038,
      "grad_norm": 0.6060494311534099,
      "learning_rate": 2.918134228096475e-05,
      "loss": 1.2277,
      "num_input_tokens_seen": 39780467776,
      "step": 50562
    },
    {
      "epoch": 5.36420538934861,
      "grad_norm": 1.0682441377891005,
      "learning_rate": 2.9180657099934494e-05,
      "loss": 1.1255,
      "num_input_tokens_seen": 39781254544,
      "step": 50563
    },
    {
      "epoch": 5.364311478888181,
      "grad_norm": 0.7012262929994401,
      "learning_rate": 2.9179971915673556e-05,
      "loss": 1.2226,
      "num_input_tokens_seen": 39782041280,
      "step": 50564
    },
    {
      "epoch": 5.364417568427753,
      "grad_norm": 0.6366521059477531,
      "learning_rate": 2.917928672818246e-05,
      "loss": 1.1311,
      "num_input_tokens_seen": 39782828000,
      "step": 50565
    },
    {
      "epoch": 5.364523657967324,
      "grad_norm": 0.7416103495562035,
      "learning_rate": 2.9178601537461726e-05,
      "loss": 1.2086,
      "num_input_tokens_seen": 39783614736,
      "step": 50566
    },
    {
      "epoch": 5.364629747506896,
      "grad_norm": 0.6249752989612971,
      "learning_rate": 2.9177916343511892e-05,
      "loss": 1.1246,
      "num_input_tokens_seen": 39784401568,
      "step": 50567
    },
    {
      "epoch": 5.364735837046467,
      "grad_norm": 0.5857653821290495,
      "learning_rate": 2.9177231146333494e-05,
      "loss": 1.2095,
      "num_input_tokens_seen": 39785188304,
      "step": 50568
    },
    {
      "epoch": 5.364841926586038,
      "grad_norm": 0.7335286586725295,
      "learning_rate": 2.9176545945927046e-05,
      "loss": 1.1368,
      "num_input_tokens_seen": 39785975008,
      "step": 50569
    },
    {
      "epoch": 5.36494801612561,
      "grad_norm": 0.6308732968128665,
      "learning_rate": 2.9175860742293092e-05,
      "loss": 1.1723,
      "num_input_tokens_seen": 39786761728,
      "step": 50570
    },
    {
      "epoch": 5.365054105665181,
      "grad_norm": 0.706466678533921,
      "learning_rate": 2.917517553543215e-05,
      "loss": 1.2389,
      "num_input_tokens_seen": 39787548528,
      "step": 50571
    },
    {
      "epoch": 5.365160195204753,
      "grad_norm": 0.664933871036328,
      "learning_rate": 2.9174490325344755e-05,
      "loss": 1.1538,
      "num_input_tokens_seen": 39788335248,
      "step": 50572
    },
    {
      "epoch": 5.365266284744324,
      "grad_norm": 0.5112406389960361,
      "learning_rate": 2.9173805112031443e-05,
      "loss": 1.1368,
      "num_input_tokens_seen": 39789122016,
      "step": 50573
    },
    {
      "epoch": 5.365372374283895,
      "grad_norm": 0.7897641915243265,
      "learning_rate": 2.9173119895492728e-05,
      "loss": 1.2132,
      "num_input_tokens_seen": 39789908704,
      "step": 50574
    },
    {
      "epoch": 5.365478463823467,
      "grad_norm": 0.5645134824008898,
      "learning_rate": 2.9172434675729155e-05,
      "loss": 1.0985,
      "num_input_tokens_seen": 39790695472,
      "step": 50575
    },
    {
      "epoch": 5.365584553363038,
      "grad_norm": 0.753532668810187,
      "learning_rate": 2.917174945274125e-05,
      "loss": 1.1964,
      "num_input_tokens_seen": 39791482240,
      "step": 50576
    },
    {
      "epoch": 5.36569064290261,
      "grad_norm": 0.5857890432962548,
      "learning_rate": 2.9171064226529533e-05,
      "loss": 1.2166,
      "num_input_tokens_seen": 39792269056,
      "step": 50577
    },
    {
      "epoch": 5.365796732442181,
      "grad_norm": 0.5963161140536628,
      "learning_rate": 2.917037899709454e-05,
      "loss": 1.0613,
      "num_input_tokens_seen": 39793055776,
      "step": 50578
    },
    {
      "epoch": 5.365902821981752,
      "grad_norm": 0.8149985418455304,
      "learning_rate": 2.9169693764436807e-05,
      "loss": 1.1925,
      "num_input_tokens_seen": 39793842496,
      "step": 50579
    },
    {
      "epoch": 5.366008911521324,
      "grad_norm": 0.6167316198884245,
      "learning_rate": 2.9169008528556846e-05,
      "loss": 1.1599,
      "num_input_tokens_seen": 39794629328,
      "step": 50580
    },
    {
      "epoch": 5.366115001060895,
      "grad_norm": 1.2341041662039083,
      "learning_rate": 2.9168323289455207e-05,
      "loss": 1.2949,
      "num_input_tokens_seen": 39795416128,
      "step": 50581
    },
    {
      "epoch": 5.366221090600467,
      "grad_norm": 0.6816106646076895,
      "learning_rate": 2.9167638047132405e-05,
      "loss": 1.1839,
      "num_input_tokens_seen": 39796202992,
      "step": 50582
    },
    {
      "epoch": 5.366327180140038,
      "grad_norm": 0.8851078249099694,
      "learning_rate": 2.9166952801588975e-05,
      "loss": 1.2927,
      "num_input_tokens_seen": 39796989696,
      "step": 50583
    },
    {
      "epoch": 5.36643326967961,
      "grad_norm": 0.6515161908745726,
      "learning_rate": 2.916626755282545e-05,
      "loss": 1.0317,
      "num_input_tokens_seen": 39797776592,
      "step": 50584
    },
    {
      "epoch": 5.366539359219181,
      "grad_norm": 0.5716502586477538,
      "learning_rate": 2.9165582300842354e-05,
      "loss": 1.2757,
      "num_input_tokens_seen": 39798563344,
      "step": 50585
    },
    {
      "epoch": 5.366645448758752,
      "grad_norm": 0.6079561501964247,
      "learning_rate": 2.9164897045640217e-05,
      "loss": 1.1183,
      "num_input_tokens_seen": 39799350192,
      "step": 50586
    },
    {
      "epoch": 5.366751538298324,
      "grad_norm": 0.6948367184563624,
      "learning_rate": 2.916421178721957e-05,
      "loss": 1.1428,
      "num_input_tokens_seen": 39800136928,
      "step": 50587
    },
    {
      "epoch": 5.366857627837895,
      "grad_norm": 0.6431987371391498,
      "learning_rate": 2.9163526525580943e-05,
      "loss": 1.0991,
      "num_input_tokens_seen": 39800923792,
      "step": 50588
    },
    {
      "epoch": 5.366963717377467,
      "grad_norm": 0.6007138752158907,
      "learning_rate": 2.916284126072486e-05,
      "loss": 1.1617,
      "num_input_tokens_seen": 39801710608,
      "step": 50589
    },
    {
      "epoch": 5.367069806917038,
      "grad_norm": 0.7111593775795838,
      "learning_rate": 2.9162155992651864e-05,
      "loss": 1.111,
      "num_input_tokens_seen": 39802497344,
      "step": 50590
    },
    {
      "epoch": 5.367175896456609,
      "grad_norm": 0.7503793796811626,
      "learning_rate": 2.916147072136247e-05,
      "loss": 1.1568,
      "num_input_tokens_seen": 39803284016,
      "step": 50591
    },
    {
      "epoch": 5.367281985996181,
      "grad_norm": 0.6664364715857658,
      "learning_rate": 2.9160785446857208e-05,
      "loss": 1.2715,
      "num_input_tokens_seen": 39804070736,
      "step": 50592
    },
    {
      "epoch": 5.367388075535752,
      "grad_norm": 0.7335613345161905,
      "learning_rate": 2.9160100169136622e-05,
      "loss": 1.1869,
      "num_input_tokens_seen": 39804857472,
      "step": 50593
    },
    {
      "epoch": 5.367494165075324,
      "grad_norm": 0.6093522032004791,
      "learning_rate": 2.9159414888201238e-05,
      "loss": 1.1774,
      "num_input_tokens_seen": 39805644208,
      "step": 50594
    },
    {
      "epoch": 5.367600254614895,
      "grad_norm": 0.6394846288287831,
      "learning_rate": 2.9158729604051567e-05,
      "loss": 1.1242,
      "num_input_tokens_seen": 39806430960,
      "step": 50595
    },
    {
      "epoch": 5.367706344154467,
      "grad_norm": 0.750320152879,
      "learning_rate": 2.915804431668816e-05,
      "loss": 1.1713,
      "num_input_tokens_seen": 39807217712,
      "step": 50596
    },
    {
      "epoch": 5.367812433694038,
      "grad_norm": 0.7297496814545987,
      "learning_rate": 2.915735902611154e-05,
      "loss": 1.2231,
      "num_input_tokens_seen": 39808004384,
      "step": 50597
    },
    {
      "epoch": 5.367918523233609,
      "grad_norm": 0.5916776606318164,
      "learning_rate": 2.9156673732322227e-05,
      "loss": 1.1998,
      "num_input_tokens_seen": 39808791104,
      "step": 50598
    },
    {
      "epoch": 5.368024612773181,
      "grad_norm": 0.7498479593422963,
      "learning_rate": 2.9155988435320763e-05,
      "loss": 1.1655,
      "num_input_tokens_seen": 39809577904,
      "step": 50599
    },
    {
      "epoch": 5.368130702312752,
      "grad_norm": 0.5717318196919077,
      "learning_rate": 2.9155303135107674e-05,
      "loss": 1.1629,
      "num_input_tokens_seen": 39810364672,
      "step": 50600
    },
    {
      "epoch": 5.368236791852324,
      "grad_norm": 0.5637189760334237,
      "learning_rate": 2.9154617831683484e-05,
      "loss": 1.1579,
      "num_input_tokens_seen": 39811151376,
      "step": 50601
    },
    {
      "epoch": 5.368342881391895,
      "grad_norm": 0.623783907751812,
      "learning_rate": 2.9153932525048734e-05,
      "loss": 1.2129,
      "num_input_tokens_seen": 39811938064,
      "step": 50602
    },
    {
      "epoch": 5.368448970931466,
      "grad_norm": 0.5902372913728898,
      "learning_rate": 2.915324721520394e-05,
      "loss": 1.1569,
      "num_input_tokens_seen": 39812724768,
      "step": 50603
    },
    {
      "epoch": 5.368555060471038,
      "grad_norm": 0.7873548551738627,
      "learning_rate": 2.9152561902149645e-05,
      "loss": 1.2925,
      "num_input_tokens_seen": 39813511472,
      "step": 50604
    },
    {
      "epoch": 5.368661150010609,
      "grad_norm": 0.6478836026353547,
      "learning_rate": 2.9151876585886373e-05,
      "loss": 1.1134,
      "num_input_tokens_seen": 39814298304,
      "step": 50605
    },
    {
      "epoch": 5.368767239550181,
      "grad_norm": 0.6354814527486436,
      "learning_rate": 2.9151191266414645e-05,
      "loss": 1.1413,
      "num_input_tokens_seen": 39815085152,
      "step": 50606
    },
    {
      "epoch": 5.368873329089752,
      "grad_norm": 0.7320331432717643,
      "learning_rate": 2.9150505943735e-05,
      "loss": 1.2403,
      "num_input_tokens_seen": 39815871920,
      "step": 50607
    },
    {
      "epoch": 5.368979418629323,
      "grad_norm": 0.7810479761957007,
      "learning_rate": 2.914982061784797e-05,
      "loss": 1.1033,
      "num_input_tokens_seen": 39816658768,
      "step": 50608
    },
    {
      "epoch": 5.369085508168895,
      "grad_norm": 0.7462622552065327,
      "learning_rate": 2.9149135288754075e-05,
      "loss": 1.1554,
      "num_input_tokens_seen": 39817445456,
      "step": 50609
    },
    {
      "epoch": 5.369191597708466,
      "grad_norm": 0.6087505857044251,
      "learning_rate": 2.9148449956453854e-05,
      "loss": 1.1746,
      "num_input_tokens_seen": 39818232176,
      "step": 50610
    },
    {
      "epoch": 5.369297687248038,
      "grad_norm": 0.6970344457314537,
      "learning_rate": 2.9147764620947836e-05,
      "loss": 1.0986,
      "num_input_tokens_seen": 39819018976,
      "step": 50611
    },
    {
      "epoch": 5.369403776787609,
      "grad_norm": 0.7708612258280988,
      "learning_rate": 2.9147079282236538e-05,
      "loss": 1.204,
      "num_input_tokens_seen": 39819805744,
      "step": 50612
    },
    {
      "epoch": 5.3695098663271805,
      "grad_norm": 0.6934361033821578,
      "learning_rate": 2.9146393940320504e-05,
      "loss": 1.1688,
      "num_input_tokens_seen": 39820592496,
      "step": 50613
    },
    {
      "epoch": 5.3696159558667516,
      "grad_norm": 0.6837878912871103,
      "learning_rate": 2.914570859520026e-05,
      "loss": 1.1404,
      "num_input_tokens_seen": 39821379328,
      "step": 50614
    },
    {
      "epoch": 5.369722045406323,
      "grad_norm": 0.7104356014800411,
      "learning_rate": 2.914502324687633e-05,
      "loss": 1.0624,
      "num_input_tokens_seen": 39822166112,
      "step": 50615
    },
    {
      "epoch": 5.3698281349458945,
      "grad_norm": 0.5733491627811982,
      "learning_rate": 2.914433789534925e-05,
      "loss": 1.1105,
      "num_input_tokens_seen": 39822952800,
      "step": 50616
    },
    {
      "epoch": 5.3699342244854655,
      "grad_norm": 0.731929180260449,
      "learning_rate": 2.9143652540619547e-05,
      "loss": 1.1491,
      "num_input_tokens_seen": 39823739664,
      "step": 50617
    },
    {
      "epoch": 5.3700403140250375,
      "grad_norm": 0.7689567834885203,
      "learning_rate": 2.9142967182687753e-05,
      "loss": 1.1678,
      "num_input_tokens_seen": 39824526368,
      "step": 50618
    },
    {
      "epoch": 5.3701464035646085,
      "grad_norm": 0.808046605870224,
      "learning_rate": 2.9142281821554395e-05,
      "loss": 1.2493,
      "num_input_tokens_seen": 39825313184,
      "step": 50619
    },
    {
      "epoch": 5.3702524931041795,
      "grad_norm": 0.6350697830011897,
      "learning_rate": 2.914159645722e-05,
      "loss": 1.3155,
      "num_input_tokens_seen": 39826099888,
      "step": 50620
    },
    {
      "epoch": 5.370358582643751,
      "grad_norm": 0.7081852394352641,
      "learning_rate": 2.9140911089685103e-05,
      "loss": 1.1784,
      "num_input_tokens_seen": 39826886704,
      "step": 50621
    },
    {
      "epoch": 5.3704646721833225,
      "grad_norm": 0.6324979184278892,
      "learning_rate": 2.914022571895023e-05,
      "loss": 1.2198,
      "num_input_tokens_seen": 39827673424,
      "step": 50622
    },
    {
      "epoch": 5.370570761722894,
      "grad_norm": 0.5938306695566741,
      "learning_rate": 2.913954034501591e-05,
      "loss": 1.1065,
      "num_input_tokens_seen": 39828460192,
      "step": 50623
    },
    {
      "epoch": 5.370676851262465,
      "grad_norm": 0.6919638548127308,
      "learning_rate": 2.913885496788268e-05,
      "loss": 1.219,
      "num_input_tokens_seen": 39829246976,
      "step": 50624
    },
    {
      "epoch": 5.370782940802037,
      "grad_norm": 0.7812915066299233,
      "learning_rate": 2.9138169587551062e-05,
      "loss": 1.2393,
      "num_input_tokens_seen": 39830033776,
      "step": 50625
    },
    {
      "epoch": 5.370889030341608,
      "grad_norm": 0.6303083626622751,
      "learning_rate": 2.9137484204021587e-05,
      "loss": 1.2891,
      "num_input_tokens_seen": 39830820592,
      "step": 50626
    },
    {
      "epoch": 5.370995119881179,
      "grad_norm": 0.723452267943392,
      "learning_rate": 2.9136798817294786e-05,
      "loss": 1.2072,
      "num_input_tokens_seen": 39831607408,
      "step": 50627
    },
    {
      "epoch": 5.371101209420751,
      "grad_norm": 0.6630282059869943,
      "learning_rate": 2.913611342737119e-05,
      "loss": 1.2803,
      "num_input_tokens_seen": 39832394128,
      "step": 50628
    },
    {
      "epoch": 5.371207298960322,
      "grad_norm": 0.6855793392349302,
      "learning_rate": 2.913542803425132e-05,
      "loss": 1.1961,
      "num_input_tokens_seen": 39833180880,
      "step": 50629
    },
    {
      "epoch": 5.371313388499894,
      "grad_norm": 0.6638596524649628,
      "learning_rate": 2.9134742637935724e-05,
      "loss": 1.1981,
      "num_input_tokens_seen": 39833967664,
      "step": 50630
    },
    {
      "epoch": 5.371419478039465,
      "grad_norm": 0.8072534100832485,
      "learning_rate": 2.9134057238424916e-05,
      "loss": 1.1671,
      "num_input_tokens_seen": 39834754464,
      "step": 50631
    },
    {
      "epoch": 5.371525567579036,
      "grad_norm": 0.6546953149200454,
      "learning_rate": 2.9133371835719425e-05,
      "loss": 1.0691,
      "num_input_tokens_seen": 39835541296,
      "step": 50632
    },
    {
      "epoch": 5.371631657118608,
      "grad_norm": 0.5747033731739712,
      "learning_rate": 2.913268642981979e-05,
      "loss": 1.1746,
      "num_input_tokens_seen": 39836328000,
      "step": 50633
    },
    {
      "epoch": 5.371737746658179,
      "grad_norm": 0.6392712963262811,
      "learning_rate": 2.9132001020726528e-05,
      "loss": 1.1732,
      "num_input_tokens_seen": 39837114752,
      "step": 50634
    },
    {
      "epoch": 5.371843836197751,
      "grad_norm": 0.6124201746159148,
      "learning_rate": 2.913131560844019e-05,
      "loss": 1.1356,
      "num_input_tokens_seen": 39837901456,
      "step": 50635
    },
    {
      "epoch": 5.371949925737322,
      "grad_norm": 0.7163236435760512,
      "learning_rate": 2.913063019296129e-05,
      "loss": 1.1995,
      "num_input_tokens_seen": 39838688208,
      "step": 50636
    },
    {
      "epoch": 5.372056015276893,
      "grad_norm": 0.5299628059201884,
      "learning_rate": 2.912994477429035e-05,
      "loss": 1.1189,
      "num_input_tokens_seen": 39839474944,
      "step": 50637
    },
    {
      "epoch": 5.372162104816465,
      "grad_norm": 0.6935001180449037,
      "learning_rate": 2.9129259352427912e-05,
      "loss": 1.2133,
      "num_input_tokens_seen": 39840261664,
      "step": 50638
    },
    {
      "epoch": 5.372268194356036,
      "grad_norm": 0.606581149070725,
      "learning_rate": 2.9128573927374514e-05,
      "loss": 1.1949,
      "num_input_tokens_seen": 39841048368,
      "step": 50639
    },
    {
      "epoch": 5.372374283895608,
      "grad_norm": 0.5107718807029965,
      "learning_rate": 2.9127888499130668e-05,
      "loss": 1.0661,
      "num_input_tokens_seen": 39841835168,
      "step": 50640
    },
    {
      "epoch": 5.372480373435179,
      "grad_norm": 0.6111244384586602,
      "learning_rate": 2.9127203067696905e-05,
      "loss": 1.1664,
      "num_input_tokens_seen": 39842621888,
      "step": 50641
    },
    {
      "epoch": 5.372586462974751,
      "grad_norm": 0.5271086453775174,
      "learning_rate": 2.9126517633073773e-05,
      "loss": 1.0852,
      "num_input_tokens_seen": 39843408672,
      "step": 50642
    },
    {
      "epoch": 5.372692552514322,
      "grad_norm": 0.784137399110271,
      "learning_rate": 2.9125832195261788e-05,
      "loss": 1.2611,
      "num_input_tokens_seen": 39844195328,
      "step": 50643
    },
    {
      "epoch": 5.372798642053893,
      "grad_norm": 0.6042659473310522,
      "learning_rate": 2.9125146754261473e-05,
      "loss": 1.1274,
      "num_input_tokens_seen": 39844982016,
      "step": 50644
    },
    {
      "epoch": 5.372904731593465,
      "grad_norm": 0.7398456735589062,
      "learning_rate": 2.912446131007337e-05,
      "loss": 1.106,
      "num_input_tokens_seen": 39845768800,
      "step": 50645
    },
    {
      "epoch": 5.373010821133036,
      "grad_norm": 0.8019032077635476,
      "learning_rate": 2.9123775862698e-05,
      "loss": 1.0659,
      "num_input_tokens_seen": 39846555568,
      "step": 50646
    },
    {
      "epoch": 5.373116910672608,
      "grad_norm": 0.4838894724373211,
      "learning_rate": 2.91230904121359e-05,
      "loss": 1.056,
      "num_input_tokens_seen": 39847342384,
      "step": 50647
    },
    {
      "epoch": 5.373223000212179,
      "grad_norm": 1.0012564682712322,
      "learning_rate": 2.91224049583876e-05,
      "loss": 1.115,
      "num_input_tokens_seen": 39848129200,
      "step": 50648
    },
    {
      "epoch": 5.373329089751751,
      "grad_norm": 0.6612032134938993,
      "learning_rate": 2.912171950145362e-05,
      "loss": 1.1379,
      "num_input_tokens_seen": 39848915936,
      "step": 50649
    },
    {
      "epoch": 5.373435179291322,
      "grad_norm": 0.876068775267743,
      "learning_rate": 2.9121034041334504e-05,
      "loss": 1.1533,
      "num_input_tokens_seen": 39849702752,
      "step": 50650
    },
    {
      "epoch": 5.373541268830893,
      "grad_norm": 0.686388747054681,
      "learning_rate": 2.912034857803077e-05,
      "loss": 1.1171,
      "num_input_tokens_seen": 39850489568,
      "step": 50651
    },
    {
      "epoch": 5.373647358370465,
      "grad_norm": 0.7316699794389325,
      "learning_rate": 2.911966311154295e-05,
      "loss": 1.1589,
      "num_input_tokens_seen": 39851276384,
      "step": 50652
    },
    {
      "epoch": 5.373753447910036,
      "grad_norm": 0.6329405008964885,
      "learning_rate": 2.9118977641871576e-05,
      "loss": 1.1719,
      "num_input_tokens_seen": 39852063152,
      "step": 50653
    },
    {
      "epoch": 5.373859537449608,
      "grad_norm": 0.6516029524817308,
      "learning_rate": 2.911829216901718e-05,
      "loss": 1.0822,
      "num_input_tokens_seen": 39852849920,
      "step": 50654
    },
    {
      "epoch": 5.373965626989179,
      "grad_norm": 0.7293059917886793,
      "learning_rate": 2.911760669298028e-05,
      "loss": 1.2366,
      "num_input_tokens_seen": 39853636656,
      "step": 50655
    },
    {
      "epoch": 5.37407171652875,
      "grad_norm": 0.6812064223054856,
      "learning_rate": 2.911692121376143e-05,
      "loss": 1.1572,
      "num_input_tokens_seen": 39854423312,
      "step": 50656
    },
    {
      "epoch": 5.374177806068322,
      "grad_norm": 0.7295516591334918,
      "learning_rate": 2.911623573136113e-05,
      "loss": 1.0893,
      "num_input_tokens_seen": 39855210096,
      "step": 50657
    },
    {
      "epoch": 5.374283895607893,
      "grad_norm": 0.7025500393166103,
      "learning_rate": 2.9115550245779928e-05,
      "loss": 1.1278,
      "num_input_tokens_seen": 39855996976,
      "step": 50658
    },
    {
      "epoch": 5.374389985147465,
      "grad_norm": 0.79221496227041,
      "learning_rate": 2.9114864757018352e-05,
      "loss": 1.0139,
      "num_input_tokens_seen": 39856783712,
      "step": 50659
    },
    {
      "epoch": 5.374496074687036,
      "grad_norm": 0.7212388503084731,
      "learning_rate": 2.9114179265076924e-05,
      "loss": 1.1689,
      "num_input_tokens_seen": 39857570352,
      "step": 50660
    },
    {
      "epoch": 5.374602164226607,
      "grad_norm": 0.8442989223051423,
      "learning_rate": 2.911349376995618e-05,
      "loss": 1.1715,
      "num_input_tokens_seen": 39858357072,
      "step": 50661
    },
    {
      "epoch": 5.374708253766179,
      "grad_norm": 0.6371369483447271,
      "learning_rate": 2.9112808271656655e-05,
      "loss": 1.2509,
      "num_input_tokens_seen": 39859143872,
      "step": 50662
    },
    {
      "epoch": 5.37481434330575,
      "grad_norm": 0.6541218394759767,
      "learning_rate": 2.9112122770178862e-05,
      "loss": 1.1892,
      "num_input_tokens_seen": 39859930688,
      "step": 50663
    },
    {
      "epoch": 5.374920432845322,
      "grad_norm": 0.6734151388068749,
      "learning_rate": 2.911143726552335e-05,
      "loss": 1.1201,
      "num_input_tokens_seen": 39860717488,
      "step": 50664
    },
    {
      "epoch": 5.375026522384893,
      "grad_norm": 0.6481698439208105,
      "learning_rate": 2.911075175769064e-05,
      "loss": 1.0579,
      "num_input_tokens_seen": 39861504224,
      "step": 50665
    },
    {
      "epoch": 5.375132611924464,
      "grad_norm": 0.7665471286128983,
      "learning_rate": 2.9110066246681254e-05,
      "loss": 1.0768,
      "num_input_tokens_seen": 39862290976,
      "step": 50666
    },
    {
      "epoch": 5.375238701464036,
      "grad_norm": 0.6352295970671686,
      "learning_rate": 2.9109380732495737e-05,
      "loss": 1.1396,
      "num_input_tokens_seen": 39863077728,
      "step": 50667
    },
    {
      "epoch": 5.375344791003607,
      "grad_norm": 0.6852371245893215,
      "learning_rate": 2.9108695215134613e-05,
      "loss": 1.1232,
      "num_input_tokens_seen": 39863864528,
      "step": 50668
    },
    {
      "epoch": 5.375450880543179,
      "grad_norm": 0.6394069151081522,
      "learning_rate": 2.9108009694598402e-05,
      "loss": 1.2166,
      "num_input_tokens_seen": 39864651344,
      "step": 50669
    },
    {
      "epoch": 5.37555697008275,
      "grad_norm": 0.6455623790685773,
      "learning_rate": 2.9107324170887644e-05,
      "loss": 1.1639,
      "num_input_tokens_seen": 39865438064,
      "step": 50670
    },
    {
      "epoch": 5.375663059622322,
      "grad_norm": 0.677485935265945,
      "learning_rate": 2.910663864400287e-05,
      "loss": 1.1378,
      "num_input_tokens_seen": 39866224896,
      "step": 50671
    },
    {
      "epoch": 5.375769149161893,
      "grad_norm": 0.8948368293154927,
      "learning_rate": 2.91059531139446e-05,
      "loss": 1.2268,
      "num_input_tokens_seen": 39867011600,
      "step": 50672
    },
    {
      "epoch": 5.375875238701464,
      "grad_norm": 0.565054332976975,
      "learning_rate": 2.910526758071338e-05,
      "loss": 1.1271,
      "num_input_tokens_seen": 39867798336,
      "step": 50673
    },
    {
      "epoch": 5.375981328241036,
      "grad_norm": 0.7516376705928164,
      "learning_rate": 2.9104582044309727e-05,
      "loss": 1.2294,
      "num_input_tokens_seen": 39868585040,
      "step": 50674
    },
    {
      "epoch": 5.376087417780607,
      "grad_norm": 0.8443842583811462,
      "learning_rate": 2.9103896504734163e-05,
      "loss": 1.1135,
      "num_input_tokens_seen": 39869371824,
      "step": 50675
    },
    {
      "epoch": 5.3761935073201785,
      "grad_norm": 0.671863726807769,
      "learning_rate": 2.9103210961987238e-05,
      "loss": 1.1802,
      "num_input_tokens_seen": 39870158592,
      "step": 50676
    },
    {
      "epoch": 5.37629959685975,
      "grad_norm": 0.625208733210869,
      "learning_rate": 2.9102525416069458e-05,
      "loss": 1.1949,
      "num_input_tokens_seen": 39870945424,
      "step": 50677
    },
    {
      "epoch": 5.3764056863993215,
      "grad_norm": 0.6955950126427398,
      "learning_rate": 2.9101839866981383e-05,
      "loss": 1.1678,
      "num_input_tokens_seen": 39871732192,
      "step": 50678
    },
    {
      "epoch": 5.3765117759388925,
      "grad_norm": 0.6748096082135454,
      "learning_rate": 2.910115431472352e-05,
      "loss": 1.244,
      "num_input_tokens_seen": 39872518944,
      "step": 50679
    },
    {
      "epoch": 5.3766178654784635,
      "grad_norm": 0.5432772398336174,
      "learning_rate": 2.9100468759296407e-05,
      "loss": 1.1648,
      "num_input_tokens_seen": 39873305760,
      "step": 50680
    },
    {
      "epoch": 5.3767239550180355,
      "grad_norm": 0.6225187417750927,
      "learning_rate": 2.909978320070057e-05,
      "loss": 1.1463,
      "num_input_tokens_seen": 39874092640,
      "step": 50681
    },
    {
      "epoch": 5.3768300445576065,
      "grad_norm": 0.6260698486237183,
      "learning_rate": 2.9099097638936545e-05,
      "loss": 1.2008,
      "num_input_tokens_seen": 39874879296,
      "step": 50682
    },
    {
      "epoch": 5.376936134097178,
      "grad_norm": 0.9297098889792589,
      "learning_rate": 2.9098412074004854e-05,
      "loss": 1.1612,
      "num_input_tokens_seen": 39875666048,
      "step": 50683
    },
    {
      "epoch": 5.377042223636749,
      "grad_norm": 0.9792294741439613,
      "learning_rate": 2.9097726505906032e-05,
      "loss": 1.1238,
      "num_input_tokens_seen": 39876452880,
      "step": 50684
    },
    {
      "epoch": 5.3771483131763205,
      "grad_norm": 0.5934987371643932,
      "learning_rate": 2.909704093464061e-05,
      "loss": 1.2101,
      "num_input_tokens_seen": 39877239568,
      "step": 50685
    },
    {
      "epoch": 5.377254402715892,
      "grad_norm": 0.5645338605854308,
      "learning_rate": 2.9096355360209104e-05,
      "loss": 1.0791,
      "num_input_tokens_seen": 39878026352,
      "step": 50686
    },
    {
      "epoch": 5.377360492255463,
      "grad_norm": 0.6199727348295585,
      "learning_rate": 2.909566978261206e-05,
      "loss": 1.1697,
      "num_input_tokens_seen": 39878813216,
      "step": 50687
    },
    {
      "epoch": 5.377466581795035,
      "grad_norm": 0.5567097279885048,
      "learning_rate": 2.9094984201850006e-05,
      "loss": 1.1419,
      "num_input_tokens_seen": 39879600064,
      "step": 50688
    },
    {
      "epoch": 5.377572671334606,
      "grad_norm": 0.8709500259211601,
      "learning_rate": 2.9094298617923466e-05,
      "loss": 1.1664,
      "num_input_tokens_seen": 39880386880,
      "step": 50689
    },
    {
      "epoch": 5.377678760874177,
      "grad_norm": 0.6257926468265725,
      "learning_rate": 2.9093613030832973e-05,
      "loss": 1.1722,
      "num_input_tokens_seen": 39881173600,
      "step": 50690
    },
    {
      "epoch": 5.377784850413749,
      "grad_norm": 0.6508104281623366,
      "learning_rate": 2.909292744057906e-05,
      "loss": 1.0049,
      "num_input_tokens_seen": 39881960320,
      "step": 50691
    },
    {
      "epoch": 5.37789093995332,
      "grad_norm": 0.7677383865206937,
      "learning_rate": 2.9092241847162243e-05,
      "loss": 1.0922,
      "num_input_tokens_seen": 39882747008,
      "step": 50692
    },
    {
      "epoch": 5.377997029492892,
      "grad_norm": 0.7063022895763292,
      "learning_rate": 2.9091556250583074e-05,
      "loss": 1.161,
      "num_input_tokens_seen": 39883533856,
      "step": 50693
    },
    {
      "epoch": 5.378103119032463,
      "grad_norm": 1.0347054011815202,
      "learning_rate": 2.9090870650842062e-05,
      "loss": 1.1703,
      "num_input_tokens_seen": 39884320608,
      "step": 50694
    },
    {
      "epoch": 5.378209208572034,
      "grad_norm": 0.5975791797540372,
      "learning_rate": 2.9090185047939744e-05,
      "loss": 1.247,
      "num_input_tokens_seen": 39885107344,
      "step": 50695
    },
    {
      "epoch": 5.378315298111606,
      "grad_norm": 0.6756510412198165,
      "learning_rate": 2.9089499441876655e-05,
      "loss": 1.1866,
      "num_input_tokens_seen": 39885894064,
      "step": 50696
    },
    {
      "epoch": 5.378421387651177,
      "grad_norm": 0.671131701024161,
      "learning_rate": 2.9088813832653324e-05,
      "loss": 1.2215,
      "num_input_tokens_seen": 39886680864,
      "step": 50697
    },
    {
      "epoch": 5.378527477190749,
      "grad_norm": 0.6736209372590285,
      "learning_rate": 2.908812822027027e-05,
      "loss": 1.0988,
      "num_input_tokens_seen": 39887467696,
      "step": 50698
    },
    {
      "epoch": 5.37863356673032,
      "grad_norm": 0.653648728114481,
      "learning_rate": 2.908744260472804e-05,
      "loss": 1.1481,
      "num_input_tokens_seen": 39888254528,
      "step": 50699
    },
    {
      "epoch": 5.378739656269892,
      "grad_norm": 0.655513162240035,
      "learning_rate": 2.9086756986027148e-05,
      "loss": 1.1112,
      "num_input_tokens_seen": 39889041280,
      "step": 50700
    },
    {
      "epoch": 5.378845745809463,
      "grad_norm": 0.5691364190448734,
      "learning_rate": 2.9086071364168128e-05,
      "loss": 1.1585,
      "num_input_tokens_seen": 39889828064,
      "step": 50701
    },
    {
      "epoch": 5.378951835349034,
      "grad_norm": 0.635377034674678,
      "learning_rate": 2.9085385739151518e-05,
      "loss": 1.1536,
      "num_input_tokens_seen": 39890614928,
      "step": 50702
    },
    {
      "epoch": 5.379057924888606,
      "grad_norm": 0.581832282608668,
      "learning_rate": 2.9084700110977836e-05,
      "loss": 1.2003,
      "num_input_tokens_seen": 39891401744,
      "step": 50703
    },
    {
      "epoch": 5.379164014428177,
      "grad_norm": 0.6886734574522294,
      "learning_rate": 2.9084014479647615e-05,
      "loss": 1.2306,
      "num_input_tokens_seen": 39892188496,
      "step": 50704
    },
    {
      "epoch": 5.379270103967749,
      "grad_norm": 0.5320627963117107,
      "learning_rate": 2.9083328845161394e-05,
      "loss": 1.1581,
      "num_input_tokens_seen": 39892975216,
      "step": 50705
    },
    {
      "epoch": 5.37937619350732,
      "grad_norm": 0.7763806138351668,
      "learning_rate": 2.9082643207519693e-05,
      "loss": 1.1537,
      "num_input_tokens_seen": 39893761984,
      "step": 50706
    },
    {
      "epoch": 5.379482283046892,
      "grad_norm": 0.713110562020254,
      "learning_rate": 2.908195756672305e-05,
      "loss": 1.2414,
      "num_input_tokens_seen": 39894548672,
      "step": 50707
    },
    {
      "epoch": 5.379588372586463,
      "grad_norm": 0.5778446857136557,
      "learning_rate": 2.9081271922771987e-05,
      "loss": 1.1115,
      "num_input_tokens_seen": 39895335456,
      "step": 50708
    },
    {
      "epoch": 5.379694462126034,
      "grad_norm": 0.6617706468617826,
      "learning_rate": 2.908058627566703e-05,
      "loss": 1.2388,
      "num_input_tokens_seen": 39896122208,
      "step": 50709
    },
    {
      "epoch": 5.379800551665606,
      "grad_norm": 0.5560692237264115,
      "learning_rate": 2.907990062540873e-05,
      "loss": 1.1508,
      "num_input_tokens_seen": 39896908928,
      "step": 50710
    },
    {
      "epoch": 5.379906641205177,
      "grad_norm": 0.6714184578436801,
      "learning_rate": 2.907921497199759e-05,
      "loss": 1.1741,
      "num_input_tokens_seen": 39897695744,
      "step": 50711
    },
    {
      "epoch": 5.380012730744749,
      "grad_norm": 0.5715327705204759,
      "learning_rate": 2.9078529315434157e-05,
      "loss": 1.0662,
      "num_input_tokens_seen": 39898482560,
      "step": 50712
    },
    {
      "epoch": 5.38011882028432,
      "grad_norm": 0.8198924403668245,
      "learning_rate": 2.9077843655718957e-05,
      "loss": 1.2157,
      "num_input_tokens_seen": 39899269248,
      "step": 50713
    },
    {
      "epoch": 5.380224909823891,
      "grad_norm": 0.6812522764130626,
      "learning_rate": 2.907715799285252e-05,
      "loss": 1.1486,
      "num_input_tokens_seen": 39900055920,
      "step": 50714
    },
    {
      "epoch": 5.380330999363463,
      "grad_norm": 0.6268406019000576,
      "learning_rate": 2.907647232683537e-05,
      "loss": 1.2143,
      "num_input_tokens_seen": 39900842672,
      "step": 50715
    },
    {
      "epoch": 5.380437088903034,
      "grad_norm": 0.668195091531807,
      "learning_rate": 2.9075786657668048e-05,
      "loss": 1.2387,
      "num_input_tokens_seen": 39901629376,
      "step": 50716
    },
    {
      "epoch": 5.380543178442606,
      "grad_norm": 0.5672986409292186,
      "learning_rate": 2.907510098535108e-05,
      "loss": 1.1491,
      "num_input_tokens_seen": 39902416096,
      "step": 50717
    },
    {
      "epoch": 5.380649267982177,
      "grad_norm": 0.5847595675339763,
      "learning_rate": 2.907441530988498e-05,
      "loss": 1.111,
      "num_input_tokens_seen": 39903202848,
      "step": 50718
    },
    {
      "epoch": 5.380755357521748,
      "grad_norm": 0.6151079214260934,
      "learning_rate": 2.9073729631270303e-05,
      "loss": 1.2233,
      "num_input_tokens_seen": 39903989616,
      "step": 50719
    },
    {
      "epoch": 5.38086144706132,
      "grad_norm": 0.7489174407410227,
      "learning_rate": 2.907304394950756e-05,
      "loss": 1.201,
      "num_input_tokens_seen": 39904776384,
      "step": 50720
    },
    {
      "epoch": 5.380967536600891,
      "grad_norm": 0.7941580495799854,
      "learning_rate": 2.9072358264597292e-05,
      "loss": 1.2368,
      "num_input_tokens_seen": 39905563104,
      "step": 50721
    },
    {
      "epoch": 5.381073626140463,
      "grad_norm": 0.6034071806765914,
      "learning_rate": 2.9071672576540028e-05,
      "loss": 1.2113,
      "num_input_tokens_seen": 39906349920,
      "step": 50722
    },
    {
      "epoch": 5.381179715680034,
      "grad_norm": 0.6147110163225051,
      "learning_rate": 2.9070986885336287e-05,
      "loss": 1.0205,
      "num_input_tokens_seen": 39907136672,
      "step": 50723
    },
    {
      "epoch": 5.381285805219606,
      "grad_norm": 0.6003140168819278,
      "learning_rate": 2.9070301190986615e-05,
      "loss": 1.1109,
      "num_input_tokens_seen": 39907923424,
      "step": 50724
    },
    {
      "epoch": 5.381391894759177,
      "grad_norm": 0.6064934715101814,
      "learning_rate": 2.906961549349153e-05,
      "loss": 1.2154,
      "num_input_tokens_seen": 39908710208,
      "step": 50725
    },
    {
      "epoch": 5.381497984298748,
      "grad_norm": 0.9766314926592597,
      "learning_rate": 2.906892979285156e-05,
      "loss": 1.1005,
      "num_input_tokens_seen": 39909497008,
      "step": 50726
    },
    {
      "epoch": 5.38160407383832,
      "grad_norm": 0.6714851601456497,
      "learning_rate": 2.9068244089067254e-05,
      "loss": 1.1791,
      "num_input_tokens_seen": 39910283744,
      "step": 50727
    },
    {
      "epoch": 5.381710163377891,
      "grad_norm": 1.2016223443337861,
      "learning_rate": 2.9067558382139122e-05,
      "loss": 1.2424,
      "num_input_tokens_seen": 39911070448,
      "step": 50728
    },
    {
      "epoch": 5.381816252917463,
      "grad_norm": 0.9448819241175077,
      "learning_rate": 2.9066872672067695e-05,
      "loss": 1.205,
      "num_input_tokens_seen": 39911857248,
      "step": 50729
    },
    {
      "epoch": 5.381922342457034,
      "grad_norm": 1.180397917789109,
      "learning_rate": 2.9066186958853515e-05,
      "loss": 1.1426,
      "num_input_tokens_seen": 39912643936,
      "step": 50730
    },
    {
      "epoch": 5.382028431996605,
      "grad_norm": 1.0871627234800862,
      "learning_rate": 2.90655012424971e-05,
      "loss": 1.2369,
      "num_input_tokens_seen": 39913430640,
      "step": 50731
    },
    {
      "epoch": 5.382134521536177,
      "grad_norm": 0.644522688458919,
      "learning_rate": 2.9064815522998983e-05,
      "loss": 1.1389,
      "num_input_tokens_seen": 39914217472,
      "step": 50732
    },
    {
      "epoch": 5.382240611075748,
      "grad_norm": 0.8448562666448765,
      "learning_rate": 2.9064129800359695e-05,
      "loss": 1.2039,
      "num_input_tokens_seen": 39915004272,
      "step": 50733
    },
    {
      "epoch": 5.38234670061532,
      "grad_norm": 0.8523565961905346,
      "learning_rate": 2.9063444074579778e-05,
      "loss": 1.1795,
      "num_input_tokens_seen": 39915791040,
      "step": 50734
    },
    {
      "epoch": 5.382452790154891,
      "grad_norm": 0.7169771671990072,
      "learning_rate": 2.906275834565974e-05,
      "loss": 1.1406,
      "num_input_tokens_seen": 39916577792,
      "step": 50735
    },
    {
      "epoch": 5.382558879694463,
      "grad_norm": 1.0859019032716724,
      "learning_rate": 2.9062072613600128e-05,
      "loss": 1.2518,
      "num_input_tokens_seen": 39917364528,
      "step": 50736
    },
    {
      "epoch": 5.382664969234034,
      "grad_norm": 0.6668629176896321,
      "learning_rate": 2.9061386878401465e-05,
      "loss": 1.1482,
      "num_input_tokens_seen": 39918151312,
      "step": 50737
    },
    {
      "epoch": 5.382771058773605,
      "grad_norm": 0.6364068407526208,
      "learning_rate": 2.9060701140064278e-05,
      "loss": 1.2676,
      "num_input_tokens_seen": 39918937952,
      "step": 50738
    },
    {
      "epoch": 5.3828771483131765,
      "grad_norm": 0.6420637678064186,
      "learning_rate": 2.90600153985891e-05,
      "loss": 1.1046,
      "num_input_tokens_seen": 39919724736,
      "step": 50739
    },
    {
      "epoch": 5.382983237852748,
      "grad_norm": 0.6692769518050394,
      "learning_rate": 2.905932965397647e-05,
      "loss": 1.0271,
      "num_input_tokens_seen": 39920511664,
      "step": 50740
    },
    {
      "epoch": 5.3830893273923195,
      "grad_norm": 0.6223396458846175,
      "learning_rate": 2.9058643906226897e-05,
      "loss": 1.0937,
      "num_input_tokens_seen": 39921298400,
      "step": 50741
    },
    {
      "epoch": 5.3831954169318905,
      "grad_norm": 0.8053003358086991,
      "learning_rate": 2.905795815534093e-05,
      "loss": 1.1688,
      "num_input_tokens_seen": 39922085216,
      "step": 50742
    },
    {
      "epoch": 5.3833015064714616,
      "grad_norm": 0.722481047501519,
      "learning_rate": 2.905727240131909e-05,
      "loss": 1.1147,
      "num_input_tokens_seen": 39922872016,
      "step": 50743
    },
    {
      "epoch": 5.3834075960110335,
      "grad_norm": 0.5965408891044565,
      "learning_rate": 2.905658664416191e-05,
      "loss": 1.1886,
      "num_input_tokens_seen": 39923658752,
      "step": 50744
    },
    {
      "epoch": 5.3835136855506045,
      "grad_norm": 0.8931420109713348,
      "learning_rate": 2.905590088386992e-05,
      "loss": 1.1872,
      "num_input_tokens_seen": 39924445520,
      "step": 50745
    },
    {
      "epoch": 5.383619775090176,
      "grad_norm": 0.7616925022847965,
      "learning_rate": 2.9055215120443647e-05,
      "loss": 1.2089,
      "num_input_tokens_seen": 39925232240,
      "step": 50746
    },
    {
      "epoch": 5.3837258646297474,
      "grad_norm": 0.7382437763366225,
      "learning_rate": 2.905452935388362e-05,
      "loss": 1.2179,
      "num_input_tokens_seen": 39926019024,
      "step": 50747
    },
    {
      "epoch": 5.3838319541693185,
      "grad_norm": 0.7001560801505904,
      "learning_rate": 2.9053843584190378e-05,
      "loss": 1.1667,
      "num_input_tokens_seen": 39926805744,
      "step": 50748
    },
    {
      "epoch": 5.38393804370889,
      "grad_norm": 0.6059147258710157,
      "learning_rate": 2.9053157811364435e-05,
      "loss": 1.1777,
      "num_input_tokens_seen": 39927592496,
      "step": 50749
    },
    {
      "epoch": 5.384044133248461,
      "grad_norm": 0.5795071652488322,
      "learning_rate": 2.9052472035406337e-05,
      "loss": 1.1668,
      "num_input_tokens_seen": 39928379200,
      "step": 50750
    },
    {
      "epoch": 5.384150222788033,
      "grad_norm": 0.5651519931882034,
      "learning_rate": 2.905178625631661e-05,
      "loss": 1.1416,
      "num_input_tokens_seen": 39929166016,
      "step": 50751
    },
    {
      "epoch": 5.384256312327604,
      "grad_norm": 0.6705201890564296,
      "learning_rate": 2.9051100474095776e-05,
      "loss": 1.2167,
      "num_input_tokens_seen": 39929952752,
      "step": 50752
    },
    {
      "epoch": 5.384362401867176,
      "grad_norm": 0.6315467662643178,
      "learning_rate": 2.9050414688744377e-05,
      "loss": 1.1238,
      "num_input_tokens_seen": 39930739504,
      "step": 50753
    },
    {
      "epoch": 5.384468491406747,
      "grad_norm": 0.7607848520481906,
      "learning_rate": 2.9049728900262928e-05,
      "loss": 1.2311,
      "num_input_tokens_seen": 39931526208,
      "step": 50754
    },
    {
      "epoch": 5.384574580946318,
      "grad_norm": 0.7812687726445071,
      "learning_rate": 2.9049043108651976e-05,
      "loss": 1.1916,
      "num_input_tokens_seen": 39932313040,
      "step": 50755
    },
    {
      "epoch": 5.38468067048589,
      "grad_norm": 0.6469890434246472,
      "learning_rate": 2.9048357313912033e-05,
      "loss": 1.1013,
      "num_input_tokens_seen": 39933099824,
      "step": 50756
    },
    {
      "epoch": 5.384786760025461,
      "grad_norm": 0.7370515720559018,
      "learning_rate": 2.904767151604365e-05,
      "loss": 1.14,
      "num_input_tokens_seen": 39933886608,
      "step": 50757
    },
    {
      "epoch": 5.384892849565033,
      "grad_norm": 0.6675358183228193,
      "learning_rate": 2.9046985715047332e-05,
      "loss": 1.1632,
      "num_input_tokens_seen": 39934673424,
      "step": 50758
    },
    {
      "epoch": 5.384998939104604,
      "grad_norm": 0.8076259617554844,
      "learning_rate": 2.904629991092363e-05,
      "loss": 1.1233,
      "num_input_tokens_seen": 39935460224,
      "step": 50759
    },
    {
      "epoch": 5.385105028644175,
      "grad_norm": 0.7794034144331705,
      "learning_rate": 2.904561410367307e-05,
      "loss": 1.1931,
      "num_input_tokens_seen": 39936247056,
      "step": 50760
    },
    {
      "epoch": 5.385211118183747,
      "grad_norm": 0.6174129210515663,
      "learning_rate": 2.904492829329617e-05,
      "loss": 1.1263,
      "num_input_tokens_seen": 39937033776,
      "step": 50761
    },
    {
      "epoch": 5.385317207723318,
      "grad_norm": 0.7087090498906929,
      "learning_rate": 2.9044242479793472e-05,
      "loss": 1.0677,
      "num_input_tokens_seen": 39937820528,
      "step": 50762
    },
    {
      "epoch": 5.38542329726289,
      "grad_norm": 0.5823719985790058,
      "learning_rate": 2.9043556663165507e-05,
      "loss": 1.1018,
      "num_input_tokens_seen": 39938607296,
      "step": 50763
    },
    {
      "epoch": 5.385529386802461,
      "grad_norm": 0.6909699633403822,
      "learning_rate": 2.9042870843412783e-05,
      "loss": 1.2059,
      "num_input_tokens_seen": 39939394048,
      "step": 50764
    },
    {
      "epoch": 5.385635476342033,
      "grad_norm": 0.7217537658999394,
      "learning_rate": 2.904218502053586e-05,
      "loss": 1.112,
      "num_input_tokens_seen": 39940180864,
      "step": 50765
    },
    {
      "epoch": 5.385741565881604,
      "grad_norm": 0.6229220659175978,
      "learning_rate": 2.9041499194535255e-05,
      "loss": 1.1621,
      "num_input_tokens_seen": 39940967712,
      "step": 50766
    },
    {
      "epoch": 5.385847655421175,
      "grad_norm": 0.5404985657210211,
      "learning_rate": 2.9040813365411494e-05,
      "loss": 1.0795,
      "num_input_tokens_seen": 39941754576,
      "step": 50767
    },
    {
      "epoch": 5.385953744960747,
      "grad_norm": 0.8647899651195918,
      "learning_rate": 2.904012753316512e-05,
      "loss": 1.2012,
      "num_input_tokens_seen": 39942541296,
      "step": 50768
    },
    {
      "epoch": 5.386059834500318,
      "grad_norm": 0.6996886167999822,
      "learning_rate": 2.9039441697796642e-05,
      "loss": 1.1239,
      "num_input_tokens_seen": 39943328000,
      "step": 50769
    },
    {
      "epoch": 5.38616592403989,
      "grad_norm": 0.6554334522114531,
      "learning_rate": 2.903875585930661e-05,
      "loss": 1.2017,
      "num_input_tokens_seen": 39944114752,
      "step": 50770
    },
    {
      "epoch": 5.386272013579461,
      "grad_norm": 0.5937830861308074,
      "learning_rate": 2.9038070017695545e-05,
      "loss": 1.2085,
      "num_input_tokens_seen": 39944901488,
      "step": 50771
    },
    {
      "epoch": 5.386378103119032,
      "grad_norm": 0.6639964460597181,
      "learning_rate": 2.9037384172963972e-05,
      "loss": 1.1729,
      "num_input_tokens_seen": 39945688288,
      "step": 50772
    },
    {
      "epoch": 5.386484192658604,
      "grad_norm": 0.6922185669590789,
      "learning_rate": 2.903669832511243e-05,
      "loss": 1.1382,
      "num_input_tokens_seen": 39946475056,
      "step": 50773
    },
    {
      "epoch": 5.386590282198175,
      "grad_norm": 0.6875817587897451,
      "learning_rate": 2.9036012474141448e-05,
      "loss": 1.1462,
      "num_input_tokens_seen": 39947261776,
      "step": 50774
    },
    {
      "epoch": 5.386696371737747,
      "grad_norm": 1.0331584247143761,
      "learning_rate": 2.903532662005155e-05,
      "loss": 1.2254,
      "num_input_tokens_seen": 39948048544,
      "step": 50775
    },
    {
      "epoch": 5.386802461277318,
      "grad_norm": 0.6287597106418409,
      "learning_rate": 2.903464076284328e-05,
      "loss": 1.126,
      "num_input_tokens_seen": 39948835264,
      "step": 50776
    },
    {
      "epoch": 5.386908550816889,
      "grad_norm": 0.6775254845340852,
      "learning_rate": 2.903395490251715e-05,
      "loss": 1.2076,
      "num_input_tokens_seen": 39949622048,
      "step": 50777
    },
    {
      "epoch": 5.387014640356461,
      "grad_norm": 0.823407894198433,
      "learning_rate": 2.9033269039073695e-05,
      "loss": 1.1269,
      "num_input_tokens_seen": 39950408800,
      "step": 50778
    },
    {
      "epoch": 5.387120729896032,
      "grad_norm": 0.6661706018705503,
      "learning_rate": 2.9032583172513456e-05,
      "loss": 1.1702,
      "num_input_tokens_seen": 39951195536,
      "step": 50779
    },
    {
      "epoch": 5.387226819435604,
      "grad_norm": 0.67330280461972,
      "learning_rate": 2.9031897302836946e-05,
      "loss": 1.1724,
      "num_input_tokens_seen": 39951982320,
      "step": 50780
    },
    {
      "epoch": 5.387332908975175,
      "grad_norm": 0.7631240522023968,
      "learning_rate": 2.9031211430044707e-05,
      "loss": 1.152,
      "num_input_tokens_seen": 39952769136,
      "step": 50781
    },
    {
      "epoch": 5.387438998514747,
      "grad_norm": 0.9014030771650037,
      "learning_rate": 2.9030525554137273e-05,
      "loss": 1.1717,
      "num_input_tokens_seen": 39953555840,
      "step": 50782
    },
    {
      "epoch": 5.387545088054318,
      "grad_norm": 0.6437814635555272,
      "learning_rate": 2.902983967511516e-05,
      "loss": 1.2408,
      "num_input_tokens_seen": 39954342576,
      "step": 50783
    },
    {
      "epoch": 5.387651177593889,
      "grad_norm": 0.6760702267299366,
      "learning_rate": 2.9029153792978907e-05,
      "loss": 1.1703,
      "num_input_tokens_seen": 39955129392,
      "step": 50784
    },
    {
      "epoch": 5.387757267133461,
      "grad_norm": 0.6774275364626208,
      "learning_rate": 2.9028467907729046e-05,
      "loss": 1.0815,
      "num_input_tokens_seen": 39955916192,
      "step": 50785
    },
    {
      "epoch": 5.387863356673032,
      "grad_norm": 0.7898348420500068,
      "learning_rate": 2.90277820193661e-05,
      "loss": 1.2298,
      "num_input_tokens_seen": 39956702912,
      "step": 50786
    },
    {
      "epoch": 5.387969446212604,
      "grad_norm": 0.6686150138817019,
      "learning_rate": 2.9027096127890595e-05,
      "loss": 1.1327,
      "num_input_tokens_seen": 39957489680,
      "step": 50787
    },
    {
      "epoch": 5.388075535752175,
      "grad_norm": 0.6681179742394824,
      "learning_rate": 2.902641023330308e-05,
      "loss": 1.176,
      "num_input_tokens_seen": 39958276496,
      "step": 50788
    },
    {
      "epoch": 5.388181625291746,
      "grad_norm": 0.7385184814685353,
      "learning_rate": 2.902572433560407e-05,
      "loss": 1.1288,
      "num_input_tokens_seen": 39959063232,
      "step": 50789
    },
    {
      "epoch": 5.388287714831318,
      "grad_norm": 0.564278495457756,
      "learning_rate": 2.9025038434794095e-05,
      "loss": 1.0814,
      "num_input_tokens_seen": 39959850048,
      "step": 50790
    },
    {
      "epoch": 5.388393804370889,
      "grad_norm": 0.7751169309010582,
      "learning_rate": 2.9024352530873693e-05,
      "loss": 1.129,
      "num_input_tokens_seen": 39960636800,
      "step": 50791
    },
    {
      "epoch": 5.388499893910461,
      "grad_norm": 0.5783300800575587,
      "learning_rate": 2.9023666623843382e-05,
      "loss": 1.0816,
      "num_input_tokens_seen": 39961423680,
      "step": 50792
    },
    {
      "epoch": 5.388605983450032,
      "grad_norm": 0.5923147142993761,
      "learning_rate": 2.9022980713703705e-05,
      "loss": 1.0942,
      "num_input_tokens_seen": 39962210528,
      "step": 50793
    },
    {
      "epoch": 5.388712072989604,
      "grad_norm": 0.6610068595234632,
      "learning_rate": 2.902229480045519e-05,
      "loss": 1.1185,
      "num_input_tokens_seen": 39962997264,
      "step": 50794
    },
    {
      "epoch": 5.388818162529175,
      "grad_norm": 0.670678827654695,
      "learning_rate": 2.9021608884098355e-05,
      "loss": 1.1084,
      "num_input_tokens_seen": 39963784128,
      "step": 50795
    },
    {
      "epoch": 5.388924252068746,
      "grad_norm": 0.6272114097309458,
      "learning_rate": 2.9020922964633747e-05,
      "loss": 1.1276,
      "num_input_tokens_seen": 39964570800,
      "step": 50796
    },
    {
      "epoch": 5.389030341608318,
      "grad_norm": 0.622448270482639,
      "learning_rate": 2.9020237042061886e-05,
      "loss": 1.148,
      "num_input_tokens_seen": 39965357552,
      "step": 50797
    },
    {
      "epoch": 5.389136431147889,
      "grad_norm": 0.7831664127198724,
      "learning_rate": 2.9019551116383298e-05,
      "loss": 1.2109,
      "num_input_tokens_seen": 39966144352,
      "step": 50798
    },
    {
      "epoch": 5.389242520687461,
      "grad_norm": 0.5547395189629817,
      "learning_rate": 2.9018865187598525e-05,
      "loss": 1.2097,
      "num_input_tokens_seen": 39966931088,
      "step": 50799
    },
    {
      "epoch": 5.389348610227032,
      "grad_norm": 0.575032980550105,
      "learning_rate": 2.9018179255708088e-05,
      "loss": 1.1021,
      "num_input_tokens_seen": 39967717792,
      "step": 50800
    },
    {
      "epoch": 5.389454699766603,
      "grad_norm": 0.6105052620231913,
      "learning_rate": 2.9017493320712517e-05,
      "loss": 1.1137,
      "num_input_tokens_seen": 39968504560,
      "step": 50801
    },
    {
      "epoch": 5.3895607893061745,
      "grad_norm": 0.7250500543294522,
      "learning_rate": 2.9016807382612354e-05,
      "loss": 1.2293,
      "num_input_tokens_seen": 39969291328,
      "step": 50802
    },
    {
      "epoch": 5.389666878845746,
      "grad_norm": 0.6841765423272207,
      "learning_rate": 2.9016121441408116e-05,
      "loss": 1.1767,
      "num_input_tokens_seen": 39970078128,
      "step": 50803
    },
    {
      "epoch": 5.3897729683853175,
      "grad_norm": 0.6048214670100602,
      "learning_rate": 2.901543549710033e-05,
      "loss": 1.1696,
      "num_input_tokens_seen": 39970864864,
      "step": 50804
    },
    {
      "epoch": 5.3898790579248885,
      "grad_norm": 0.833679937044227,
      "learning_rate": 2.9014749549689542e-05,
      "loss": 1.1122,
      "num_input_tokens_seen": 39971651680,
      "step": 50805
    },
    {
      "epoch": 5.38998514746446,
      "grad_norm": 0.6412231513347932,
      "learning_rate": 2.9014063599176273e-05,
      "loss": 1.1634,
      "num_input_tokens_seen": 39972438464,
      "step": 50806
    },
    {
      "epoch": 5.3900912370040315,
      "grad_norm": 0.7787368294370132,
      "learning_rate": 2.9013377645561048e-05,
      "loss": 1.1128,
      "num_input_tokens_seen": 39973225312,
      "step": 50807
    },
    {
      "epoch": 5.3901973265436025,
      "grad_norm": 0.9993377998941988,
      "learning_rate": 2.9012691688844408e-05,
      "loss": 1.1454,
      "num_input_tokens_seen": 39974012016,
      "step": 50808
    },
    {
      "epoch": 5.390303416083174,
      "grad_norm": 0.6796314825056393,
      "learning_rate": 2.901200572902687e-05,
      "loss": 1.0907,
      "num_input_tokens_seen": 39974798768,
      "step": 50809
    },
    {
      "epoch": 5.3904095056227455,
      "grad_norm": 0.9458875541146049,
      "learning_rate": 2.901131976610898e-05,
      "loss": 1.1553,
      "num_input_tokens_seen": 39975585472,
      "step": 50810
    },
    {
      "epoch": 5.390515595162317,
      "grad_norm": 0.7949238088645629,
      "learning_rate": 2.901063380009126e-05,
      "loss": 1.2716,
      "num_input_tokens_seen": 39976372224,
      "step": 50811
    },
    {
      "epoch": 5.390621684701888,
      "grad_norm": 0.6895171560715871,
      "learning_rate": 2.9009947830974233e-05,
      "loss": 1.1126,
      "num_input_tokens_seen": 39977158896,
      "step": 50812
    },
    {
      "epoch": 5.390727774241459,
      "grad_norm": 1.0700650081148437,
      "learning_rate": 2.900926185875844e-05,
      "loss": 1.2144,
      "num_input_tokens_seen": 39977945744,
      "step": 50813
    },
    {
      "epoch": 5.390833863781031,
      "grad_norm": 0.677063295377274,
      "learning_rate": 2.9008575883444407e-05,
      "loss": 1.1654,
      "num_input_tokens_seen": 39978732400,
      "step": 50814
    },
    {
      "epoch": 5.390939953320602,
      "grad_norm": 1.1700968057851746,
      "learning_rate": 2.9007889905032658e-05,
      "loss": 1.1835,
      "num_input_tokens_seen": 39979519184,
      "step": 50815
    },
    {
      "epoch": 5.391046042860174,
      "grad_norm": 0.8956614632357278,
      "learning_rate": 2.900720392352374e-05,
      "loss": 1.224,
      "num_input_tokens_seen": 39980305856,
      "step": 50816
    },
    {
      "epoch": 5.391152132399745,
      "grad_norm": 0.603361496050732,
      "learning_rate": 2.9006517938918164e-05,
      "loss": 1.1264,
      "num_input_tokens_seen": 39981092736,
      "step": 50817
    },
    {
      "epoch": 5.391258221939317,
      "grad_norm": 1.079341737593821,
      "learning_rate": 2.9005831951216473e-05,
      "loss": 1.1435,
      "num_input_tokens_seen": 39981879536,
      "step": 50818
    },
    {
      "epoch": 5.391364311478888,
      "grad_norm": 0.9808676250879469,
      "learning_rate": 2.9005145960419194e-05,
      "loss": 1.2022,
      "num_input_tokens_seen": 39982666336,
      "step": 50819
    },
    {
      "epoch": 5.391470401018459,
      "grad_norm": 0.6102627240894589,
      "learning_rate": 2.9004459966526854e-05,
      "loss": 1.1203,
      "num_input_tokens_seen": 39983453120,
      "step": 50820
    },
    {
      "epoch": 5.391576490558031,
      "grad_norm": 0.8289684327168197,
      "learning_rate": 2.900377396953998e-05,
      "loss": 1.1386,
      "num_input_tokens_seen": 39984239952,
      "step": 50821
    },
    {
      "epoch": 5.391682580097602,
      "grad_norm": 0.8838842167857072,
      "learning_rate": 2.9003087969459113e-05,
      "loss": 1.2458,
      "num_input_tokens_seen": 39985026752,
      "step": 50822
    },
    {
      "epoch": 5.391788669637174,
      "grad_norm": 0.8180315140010215,
      "learning_rate": 2.900240196628477e-05,
      "loss": 1.1434,
      "num_input_tokens_seen": 39985813536,
      "step": 50823
    },
    {
      "epoch": 5.391894759176745,
      "grad_norm": 0.7059331782578272,
      "learning_rate": 2.9001715960017495e-05,
      "loss": 1.1633,
      "num_input_tokens_seen": 39986600320,
      "step": 50824
    },
    {
      "epoch": 5.392000848716316,
      "grad_norm": 1.3896892949078985,
      "learning_rate": 2.900102995065781e-05,
      "loss": 1.1894,
      "num_input_tokens_seen": 39987387104,
      "step": 50825
    },
    {
      "epoch": 5.392106938255888,
      "grad_norm": 0.8687617733398266,
      "learning_rate": 2.9000343938206244e-05,
      "loss": 1.1506,
      "num_input_tokens_seen": 39988173904,
      "step": 50826
    },
    {
      "epoch": 5.392213027795459,
      "grad_norm": 0.6430044300742832,
      "learning_rate": 2.899965792266334e-05,
      "loss": 1.162,
      "num_input_tokens_seen": 39988960672,
      "step": 50827
    },
    {
      "epoch": 5.392319117335031,
      "grad_norm": 1.070353142053084,
      "learning_rate": 2.89989719040296e-05,
      "loss": 1.2352,
      "num_input_tokens_seen": 39989747440,
      "step": 50828
    },
    {
      "epoch": 5.392425206874602,
      "grad_norm": 0.9231779225225714,
      "learning_rate": 2.899828588230558e-05,
      "loss": 1.1732,
      "num_input_tokens_seen": 39990534256,
      "step": 50829
    },
    {
      "epoch": 5.392531296414173,
      "grad_norm": 0.6435850525070733,
      "learning_rate": 2.8997599857491804e-05,
      "loss": 1.1503,
      "num_input_tokens_seen": 39991320960,
      "step": 50830
    },
    {
      "epoch": 5.392637385953745,
      "grad_norm": 1.0915234499715118,
      "learning_rate": 2.89969138295888e-05,
      "loss": 1.2378,
      "num_input_tokens_seen": 39992107664,
      "step": 50831
    },
    {
      "epoch": 5.392743475493316,
      "grad_norm": 0.9933390177445999,
      "learning_rate": 2.89962277985971e-05,
      "loss": 1.2046,
      "num_input_tokens_seen": 39992894416,
      "step": 50832
    },
    {
      "epoch": 5.392849565032888,
      "grad_norm": 0.6498861967434645,
      "learning_rate": 2.8995541764517226e-05,
      "loss": 1.1226,
      "num_input_tokens_seen": 39993681168,
      "step": 50833
    },
    {
      "epoch": 5.392955654572459,
      "grad_norm": 1.0911853176397226,
      "learning_rate": 2.899485572734972e-05,
      "loss": 1.1317,
      "num_input_tokens_seen": 39994467920,
      "step": 50834
    },
    {
      "epoch": 5.39306174411203,
      "grad_norm": 0.8670046469038903,
      "learning_rate": 2.89941696870951e-05,
      "loss": 1.2277,
      "num_input_tokens_seen": 39995254736,
      "step": 50835
    },
    {
      "epoch": 5.393167833651602,
      "grad_norm": 0.8858465630139449,
      "learning_rate": 2.899348364375391e-05,
      "loss": 1.1906,
      "num_input_tokens_seen": 39996041536,
      "step": 50836
    },
    {
      "epoch": 5.393273923191173,
      "grad_norm": 0.8877306508017111,
      "learning_rate": 2.8992797597326675e-05,
      "loss": 1.2059,
      "num_input_tokens_seen": 39996828224,
      "step": 50837
    },
    {
      "epoch": 5.393380012730745,
      "grad_norm": 0.6349937484866269,
      "learning_rate": 2.8992111547813917e-05,
      "loss": 1.1374,
      "num_input_tokens_seen": 39997615008,
      "step": 50838
    },
    {
      "epoch": 5.393486102270316,
      "grad_norm": 0.74930422222209,
      "learning_rate": 2.8991425495216173e-05,
      "loss": 1.1243,
      "num_input_tokens_seen": 39998401856,
      "step": 50839
    },
    {
      "epoch": 5.393592191809888,
      "grad_norm": 0.7105090510201806,
      "learning_rate": 2.8990739439533975e-05,
      "loss": 1.1326,
      "num_input_tokens_seen": 39999188624,
      "step": 50840
    },
    {
      "epoch": 5.393698281349459,
      "grad_norm": 0.6617035691606445,
      "learning_rate": 2.899005338076785e-05,
      "loss": 1.0559,
      "num_input_tokens_seen": 39999975408,
      "step": 50841
    },
    {
      "epoch": 5.39380437088903,
      "grad_norm": 0.8619512820458455,
      "learning_rate": 2.898936731891833e-05,
      "loss": 1.2299,
      "num_input_tokens_seen": 40000762144,
      "step": 50842
    },
    {
      "epoch": 5.393910460428602,
      "grad_norm": 0.6695572492863722,
      "learning_rate": 2.8988681253985943e-05,
      "loss": 1.1931,
      "num_input_tokens_seen": 40001548880,
      "step": 50843
    },
    {
      "epoch": 5.394016549968173,
      "grad_norm": 0.7014717383080691,
      "learning_rate": 2.8987995185971217e-05,
      "loss": 1.1819,
      "num_input_tokens_seen": 40002335680,
      "step": 50844
    },
    {
      "epoch": 5.394122639507745,
      "grad_norm": 0.7733936279300827,
      "learning_rate": 2.898730911487469e-05,
      "loss": 1.1607,
      "num_input_tokens_seen": 40003122448,
      "step": 50845
    },
    {
      "epoch": 5.394228729047316,
      "grad_norm": 0.6252883054196458,
      "learning_rate": 2.8986623040696888e-05,
      "loss": 1.1815,
      "num_input_tokens_seen": 40003909200,
      "step": 50846
    },
    {
      "epoch": 5.394334818586888,
      "grad_norm": 0.8335015812000136,
      "learning_rate": 2.8985936963438332e-05,
      "loss": 1.2395,
      "num_input_tokens_seen": 40004695984,
      "step": 50847
    },
    {
      "epoch": 5.394440908126459,
      "grad_norm": 0.8425649514034652,
      "learning_rate": 2.8985250883099568e-05,
      "loss": 1.2364,
      "num_input_tokens_seen": 40005482720,
      "step": 50848
    },
    {
      "epoch": 5.39454699766603,
      "grad_norm": 0.6524998664966496,
      "learning_rate": 2.8984564799681124e-05,
      "loss": 1.155,
      "num_input_tokens_seen": 40006269552,
      "step": 50849
    },
    {
      "epoch": 5.394653087205602,
      "grad_norm": 0.6546273213710634,
      "learning_rate": 2.8983878713183515e-05,
      "loss": 1.1627,
      "num_input_tokens_seen": 40007056432,
      "step": 50850
    },
    {
      "epoch": 5.394759176745173,
      "grad_norm": 0.679295858754042,
      "learning_rate": 2.8983192623607284e-05,
      "loss": 1.1276,
      "num_input_tokens_seen": 40007843200,
      "step": 50851
    },
    {
      "epoch": 5.394865266284745,
      "grad_norm": 0.7059911113017007,
      "learning_rate": 2.898250653095296e-05,
      "loss": 1.1176,
      "num_input_tokens_seen": 40008629952,
      "step": 50852
    },
    {
      "epoch": 5.394971355824316,
      "grad_norm": 0.5897515092254048,
      "learning_rate": 2.8981820435221075e-05,
      "loss": 1.1254,
      "num_input_tokens_seen": 40009416752,
      "step": 50853
    },
    {
      "epoch": 5.395077445363887,
      "grad_norm": 0.5676643125190164,
      "learning_rate": 2.898113433641215e-05,
      "loss": 1.1615,
      "num_input_tokens_seen": 40010203488,
      "step": 50854
    },
    {
      "epoch": 5.395183534903459,
      "grad_norm": 0.8154924320864773,
      "learning_rate": 2.8980448234526726e-05,
      "loss": 1.1509,
      "num_input_tokens_seen": 40010990192,
      "step": 50855
    },
    {
      "epoch": 5.39528962444303,
      "grad_norm": 0.7863739035992133,
      "learning_rate": 2.897976212956533e-05,
      "loss": 1.1391,
      "num_input_tokens_seen": 40011776944,
      "step": 50856
    },
    {
      "epoch": 5.395395713982602,
      "grad_norm": 0.6941360430070815,
      "learning_rate": 2.897907602152849e-05,
      "loss": 1.2284,
      "num_input_tokens_seen": 40012563680,
      "step": 50857
    },
    {
      "epoch": 5.395501803522173,
      "grad_norm": 0.8639186528541142,
      "learning_rate": 2.8978389910416724e-05,
      "loss": 1.1009,
      "num_input_tokens_seen": 40013350496,
      "step": 50858
    },
    {
      "epoch": 5.395607893061744,
      "grad_norm": 0.8537028805743678,
      "learning_rate": 2.8977703796230595e-05,
      "loss": 1.1608,
      "num_input_tokens_seen": 40014137216,
      "step": 50859
    },
    {
      "epoch": 5.395713982601316,
      "grad_norm": 0.6021154486229444,
      "learning_rate": 2.8977017678970603e-05,
      "loss": 1.1057,
      "num_input_tokens_seen": 40014923904,
      "step": 50860
    },
    {
      "epoch": 5.395820072140887,
      "grad_norm": 0.7142073291606459,
      "learning_rate": 2.897633155863728e-05,
      "loss": 1.1097,
      "num_input_tokens_seen": 40015710736,
      "step": 50861
    },
    {
      "epoch": 5.395926161680459,
      "grad_norm": 0.8675459148940583,
      "learning_rate": 2.897564543523118e-05,
      "loss": 1.1961,
      "num_input_tokens_seen": 40016497392,
      "step": 50862
    },
    {
      "epoch": 5.39603225122003,
      "grad_norm": 0.6126683531806355,
      "learning_rate": 2.8974959308752814e-05,
      "loss": 1.1317,
      "num_input_tokens_seen": 40017284224,
      "step": 50863
    },
    {
      "epoch": 5.396138340759601,
      "grad_norm": 0.8367120999501741,
      "learning_rate": 2.897427317920271e-05,
      "loss": 1.077,
      "num_input_tokens_seen": 40018070960,
      "step": 50864
    },
    {
      "epoch": 5.396244430299173,
      "grad_norm": 0.7976494242905691,
      "learning_rate": 2.897358704658141e-05,
      "loss": 1.234,
      "num_input_tokens_seen": 40018857760,
      "step": 50865
    },
    {
      "epoch": 5.396350519838744,
      "grad_norm": 0.5873983403018117,
      "learning_rate": 2.8972900910889438e-05,
      "loss": 1.1818,
      "num_input_tokens_seen": 40019644496,
      "step": 50866
    },
    {
      "epoch": 5.3964566093783155,
      "grad_norm": 0.7909936602519845,
      "learning_rate": 2.8972214772127315e-05,
      "loss": 1.1922,
      "num_input_tokens_seen": 40020431216,
      "step": 50867
    },
    {
      "epoch": 5.3965626989178865,
      "grad_norm": 0.7209049330370659,
      "learning_rate": 2.8971528630295595e-05,
      "loss": 1.0977,
      "num_input_tokens_seen": 40021218032,
      "step": 50868
    },
    {
      "epoch": 5.3966687884574585,
      "grad_norm": 0.8341140102081528,
      "learning_rate": 2.8970842485394784e-05,
      "loss": 1.0625,
      "num_input_tokens_seen": 40022004848,
      "step": 50869
    },
    {
      "epoch": 5.3967748779970295,
      "grad_norm": 0.89071713110248,
      "learning_rate": 2.897015633742543e-05,
      "loss": 1.2057,
      "num_input_tokens_seen": 40022791632,
      "step": 50870
    },
    {
      "epoch": 5.3968809675366005,
      "grad_norm": 0.6101203677109951,
      "learning_rate": 2.8969470186388054e-05,
      "loss": 1.2171,
      "num_input_tokens_seen": 40023578384,
      "step": 50871
    },
    {
      "epoch": 5.396987057076172,
      "grad_norm": 0.7215338640507749,
      "learning_rate": 2.896878403228318e-05,
      "loss": 1.2226,
      "num_input_tokens_seen": 40024365120,
      "step": 50872
    },
    {
      "epoch": 5.3970931466157435,
      "grad_norm": 0.9092955065330254,
      "learning_rate": 2.8968097875111354e-05,
      "loss": 1.255,
      "num_input_tokens_seen": 40025151904,
      "step": 50873
    },
    {
      "epoch": 5.397199236155315,
      "grad_norm": 0.8150275943045563,
      "learning_rate": 2.89674117148731e-05,
      "loss": 1.1911,
      "num_input_tokens_seen": 40025938688,
      "step": 50874
    },
    {
      "epoch": 5.397305325694886,
      "grad_norm": 0.954375860125076,
      "learning_rate": 2.896672555156894e-05,
      "loss": 1.1171,
      "num_input_tokens_seen": 40026725520,
      "step": 50875
    },
    {
      "epoch": 5.397411415234458,
      "grad_norm": 0.9433645851212301,
      "learning_rate": 2.896603938519941e-05,
      "loss": 1.2074,
      "num_input_tokens_seen": 40027512224,
      "step": 50876
    },
    {
      "epoch": 5.397517504774029,
      "grad_norm": 1.1047194073700326,
      "learning_rate": 2.8965353215765045e-05,
      "loss": 1.1482,
      "num_input_tokens_seen": 40028298976,
      "step": 50877
    },
    {
      "epoch": 5.3976235943136,
      "grad_norm": 0.7875449341765001,
      "learning_rate": 2.896466704326637e-05,
      "loss": 1.1027,
      "num_input_tokens_seen": 40029085648,
      "step": 50878
    },
    {
      "epoch": 5.397729683853172,
      "grad_norm": 0.9581648292134238,
      "learning_rate": 2.896398086770392e-05,
      "loss": 1.2253,
      "num_input_tokens_seen": 40029872448,
      "step": 50879
    },
    {
      "epoch": 5.397835773392743,
      "grad_norm": 0.7646618889864086,
      "learning_rate": 2.8963294689078224e-05,
      "loss": 1.1863,
      "num_input_tokens_seen": 40030659312,
      "step": 50880
    },
    {
      "epoch": 5.397941862932315,
      "grad_norm": 0.9285558795970537,
      "learning_rate": 2.8962608507389806e-05,
      "loss": 1.1914,
      "num_input_tokens_seen": 40031446160,
      "step": 50881
    },
    {
      "epoch": 5.398047952471886,
      "grad_norm": 0.9586363422310787,
      "learning_rate": 2.89619223226392e-05,
      "loss": 1.2197,
      "num_input_tokens_seen": 40032232960,
      "step": 50882
    },
    {
      "epoch": 5.398154042011457,
      "grad_norm": 0.820529869902173,
      "learning_rate": 2.8961236134826942e-05,
      "loss": 1.2118,
      "num_input_tokens_seen": 40033019776,
      "step": 50883
    },
    {
      "epoch": 5.398260131551029,
      "grad_norm": 0.8844573128538851,
      "learning_rate": 2.8960549943953546e-05,
      "loss": 1.1332,
      "num_input_tokens_seen": 40033806560,
      "step": 50884
    },
    {
      "epoch": 5.3983662210906,
      "grad_norm": 0.962272671682564,
      "learning_rate": 2.8959863750019563e-05,
      "loss": 1.069,
      "num_input_tokens_seen": 40034593488,
      "step": 50885
    },
    {
      "epoch": 5.398472310630172,
      "grad_norm": 0.7908974199612439,
      "learning_rate": 2.8959177553025513e-05,
      "loss": 1.224,
      "num_input_tokens_seen": 40035380368,
      "step": 50886
    },
    {
      "epoch": 5.398578400169743,
      "grad_norm": 0.8209917998211388,
      "learning_rate": 2.8958491352971917e-05,
      "loss": 1.094,
      "num_input_tokens_seen": 40036167072,
      "step": 50887
    },
    {
      "epoch": 5.398684489709314,
      "grad_norm": 0.9082038764186764,
      "learning_rate": 2.8957805149859325e-05,
      "loss": 1.2477,
      "num_input_tokens_seen": 40036953808,
      "step": 50888
    },
    {
      "epoch": 5.398790579248886,
      "grad_norm": 0.8047802464484006,
      "learning_rate": 2.8957118943688257e-05,
      "loss": 1.127,
      "num_input_tokens_seen": 40037740576,
      "step": 50889
    },
    {
      "epoch": 5.398896668788457,
      "grad_norm": 0.7518203841256573,
      "learning_rate": 2.8956432734459237e-05,
      "loss": 1.1505,
      "num_input_tokens_seen": 40038527344,
      "step": 50890
    },
    {
      "epoch": 5.399002758328029,
      "grad_norm": 0.7098197784307138,
      "learning_rate": 2.8955746522172804e-05,
      "loss": 1.1194,
      "num_input_tokens_seen": 40039314080,
      "step": 50891
    },
    {
      "epoch": 5.3991088478676,
      "grad_norm": 0.8982708045314786,
      "learning_rate": 2.8955060306829497e-05,
      "loss": 1.1844,
      "num_input_tokens_seen": 40040100832,
      "step": 50892
    },
    {
      "epoch": 5.399214937407172,
      "grad_norm": 0.7358286472164166,
      "learning_rate": 2.895437408842982e-05,
      "loss": 1.1766,
      "num_input_tokens_seen": 40040887520,
      "step": 50893
    },
    {
      "epoch": 5.399321026946743,
      "grad_norm": 0.7180377366391161,
      "learning_rate": 2.8953687866974327e-05,
      "loss": 1.088,
      "num_input_tokens_seen": 40041674288,
      "step": 50894
    },
    {
      "epoch": 5.399427116486314,
      "grad_norm": 0.7366355805867798,
      "learning_rate": 2.8953001642463535e-05,
      "loss": 1.2577,
      "num_input_tokens_seen": 40042461008,
      "step": 50895
    },
    {
      "epoch": 5.399533206025886,
      "grad_norm": 0.659669537377651,
      "learning_rate": 2.8952315414897986e-05,
      "loss": 1.1265,
      "num_input_tokens_seen": 40043247760,
      "step": 50896
    },
    {
      "epoch": 5.399639295565457,
      "grad_norm": 0.751200787618188,
      "learning_rate": 2.89516291842782e-05,
      "loss": 1.0701,
      "num_input_tokens_seen": 40044034608,
      "step": 50897
    },
    {
      "epoch": 5.399745385105029,
      "grad_norm": 0.7866527612662173,
      "learning_rate": 2.895094295060471e-05,
      "loss": 1.2378,
      "num_input_tokens_seen": 40044821376,
      "step": 50898
    },
    {
      "epoch": 5.3998514746446,
      "grad_norm": 0.5994271418176883,
      "learning_rate": 2.895025671387805e-05,
      "loss": 1.2428,
      "num_input_tokens_seen": 40045608176,
      "step": 50899
    },
    {
      "epoch": 5.399957564184171,
      "grad_norm": 1.1333685568642766,
      "learning_rate": 2.8949570474098743e-05,
      "loss": 1.1575,
      "num_input_tokens_seen": 40046394848,
      "step": 50900
    },
    {
      "epoch": 5.400063653723743,
      "grad_norm": 0.63707399035162,
      "learning_rate": 2.8948884231267326e-05,
      "loss": 1.1836,
      "num_input_tokens_seen": 40047181632,
      "step": 50901
    },
    {
      "epoch": 5.400169743263314,
      "grad_norm": 0.5835791325410903,
      "learning_rate": 2.8948197985384328e-05,
      "loss": 1.1294,
      "num_input_tokens_seen": 40047968336,
      "step": 50902
    },
    {
      "epoch": 5.400275832802886,
      "grad_norm": 0.5594279243387388,
      "learning_rate": 2.894751173645028e-05,
      "loss": 1.0957,
      "num_input_tokens_seen": 40048755152,
      "step": 50903
    },
    {
      "epoch": 5.400381922342457,
      "grad_norm": 0.63705945005002,
      "learning_rate": 2.8946825484465706e-05,
      "loss": 1.1074,
      "num_input_tokens_seen": 40049541984,
      "step": 50904
    },
    {
      "epoch": 5.400488011882029,
      "grad_norm": 0.731808345112268,
      "learning_rate": 2.8946139229431146e-05,
      "loss": 1.2258,
      "num_input_tokens_seen": 40050328832,
      "step": 50905
    },
    {
      "epoch": 5.4005941014216,
      "grad_norm": 0.6371752517803081,
      "learning_rate": 2.8945452971347126e-05,
      "loss": 1.1309,
      "num_input_tokens_seen": 40051115472,
      "step": 50906
    },
    {
      "epoch": 5.400700190961171,
      "grad_norm": 0.6530396341846773,
      "learning_rate": 2.8944766710214166e-05,
      "loss": 1.1773,
      "num_input_tokens_seen": 40051902224,
      "step": 50907
    },
    {
      "epoch": 5.400806280500743,
      "grad_norm": 0.9151430672965915,
      "learning_rate": 2.8944080446032817e-05,
      "loss": 1.0872,
      "num_input_tokens_seen": 40052688976,
      "step": 50908
    },
    {
      "epoch": 5.400912370040314,
      "grad_norm": 0.8089361904746344,
      "learning_rate": 2.8943394178803595e-05,
      "loss": 1.2415,
      "num_input_tokens_seen": 40053475776,
      "step": 50909
    },
    {
      "epoch": 5.401018459579886,
      "grad_norm": 0.666532242599575,
      "learning_rate": 2.8942707908527033e-05,
      "loss": 1.2242,
      "num_input_tokens_seen": 40054262496,
      "step": 50910
    },
    {
      "epoch": 5.401124549119457,
      "grad_norm": 0.6967410954353829,
      "learning_rate": 2.8942021635203664e-05,
      "loss": 1.1501,
      "num_input_tokens_seen": 40055049264,
      "step": 50911
    },
    {
      "epoch": 5.401230638659028,
      "grad_norm": 0.5892099114450563,
      "learning_rate": 2.8941335358834008e-05,
      "loss": 1.0697,
      "num_input_tokens_seen": 40055836160,
      "step": 50912
    },
    {
      "epoch": 5.4013367281986,
      "grad_norm": 0.6576799331945075,
      "learning_rate": 2.8940649079418615e-05,
      "loss": 1.1488,
      "num_input_tokens_seen": 40056623024,
      "step": 50913
    },
    {
      "epoch": 5.401442817738171,
      "grad_norm": 0.7461292979295058,
      "learning_rate": 2.8939962796958e-05,
      "loss": 1.1035,
      "num_input_tokens_seen": 40057409872,
      "step": 50914
    },
    {
      "epoch": 5.401548907277743,
      "grad_norm": 0.5967912152679058,
      "learning_rate": 2.8939276511452697e-05,
      "loss": 1.0964,
      "num_input_tokens_seen": 40058196656,
      "step": 50915
    },
    {
      "epoch": 5.401654996817314,
      "grad_norm": 0.646061169318889,
      "learning_rate": 2.8938590222903232e-05,
      "loss": 1.2819,
      "num_input_tokens_seen": 40058983392,
      "step": 50916
    },
    {
      "epoch": 5.401761086356885,
      "grad_norm": 0.6206930555696422,
      "learning_rate": 2.893790393131015e-05,
      "loss": 1.1378,
      "num_input_tokens_seen": 40059770176,
      "step": 50917
    },
    {
      "epoch": 5.401867175896457,
      "grad_norm": 0.5604837823672391,
      "learning_rate": 2.893721763667396e-05,
      "loss": 1.1766,
      "num_input_tokens_seen": 40060556896,
      "step": 50918
    },
    {
      "epoch": 5.401973265436028,
      "grad_norm": 0.6948121836926097,
      "learning_rate": 2.893653133899521e-05,
      "loss": 1.127,
      "num_input_tokens_seen": 40061343632,
      "step": 50919
    },
    {
      "epoch": 5.4020793549756,
      "grad_norm": 0.6185248256259415,
      "learning_rate": 2.893584503827443e-05,
      "loss": 1.1658,
      "num_input_tokens_seen": 40062130352,
      "step": 50920
    },
    {
      "epoch": 5.402185444515171,
      "grad_norm": 0.7006722938512472,
      "learning_rate": 2.893515873451213e-05,
      "loss": 1.2091,
      "num_input_tokens_seen": 40062917104,
      "step": 50921
    },
    {
      "epoch": 5.402291534054743,
      "grad_norm": 0.6635626001214919,
      "learning_rate": 2.8934472427708866e-05,
      "loss": 1.2552,
      "num_input_tokens_seen": 40063703856,
      "step": 50922
    },
    {
      "epoch": 5.402397623594314,
      "grad_norm": 0.6356674706208985,
      "learning_rate": 2.893378611786516e-05,
      "loss": 1.1523,
      "num_input_tokens_seen": 40064490608,
      "step": 50923
    },
    {
      "epoch": 5.402503713133885,
      "grad_norm": 0.7206324298015465,
      "learning_rate": 2.8933099804981522e-05,
      "loss": 1.1703,
      "num_input_tokens_seen": 40065277312,
      "step": 50924
    },
    {
      "epoch": 5.402609802673457,
      "grad_norm": 0.7907225242551279,
      "learning_rate": 2.8932413489058514e-05,
      "loss": 1.1662,
      "num_input_tokens_seen": 40066064080,
      "step": 50925
    },
    {
      "epoch": 5.402715892213028,
      "grad_norm": 0.6909237008311874,
      "learning_rate": 2.893172717009665e-05,
      "loss": 1.1753,
      "num_input_tokens_seen": 40066850848,
      "step": 50926
    },
    {
      "epoch": 5.4028219817525995,
      "grad_norm": 0.9191954864993589,
      "learning_rate": 2.893104084809646e-05,
      "loss": 1.2374,
      "num_input_tokens_seen": 40067637664,
      "step": 50927
    },
    {
      "epoch": 5.402928071292171,
      "grad_norm": 0.7099876306199171,
      "learning_rate": 2.893035452305848e-05,
      "loss": 1.1788,
      "num_input_tokens_seen": 40068424432,
      "step": 50928
    },
    {
      "epoch": 5.403034160831742,
      "grad_norm": 0.6644082547941901,
      "learning_rate": 2.8929668194983238e-05,
      "loss": 1.1482,
      "num_input_tokens_seen": 40069211072,
      "step": 50929
    },
    {
      "epoch": 5.4031402503713135,
      "grad_norm": 0.9386666193195793,
      "learning_rate": 2.8928981863871256e-05,
      "loss": 1.1449,
      "num_input_tokens_seen": 40069997760,
      "step": 50930
    },
    {
      "epoch": 5.4032463399108845,
      "grad_norm": 0.6483174205504537,
      "learning_rate": 2.892829552972308e-05,
      "loss": 1.0669,
      "num_input_tokens_seen": 40070784560,
      "step": 50931
    },
    {
      "epoch": 5.4033524294504565,
      "grad_norm": 1.000435818787433,
      "learning_rate": 2.8927609192539234e-05,
      "loss": 1.1166,
      "num_input_tokens_seen": 40071571280,
      "step": 50932
    },
    {
      "epoch": 5.4034585189900275,
      "grad_norm": 0.9282707757655024,
      "learning_rate": 2.8926922852320238e-05,
      "loss": 1.1801,
      "num_input_tokens_seen": 40072358064,
      "step": 50933
    },
    {
      "epoch": 5.403564608529599,
      "grad_norm": 0.6924953101653446,
      "learning_rate": 2.892623650906664e-05,
      "loss": 1.2214,
      "num_input_tokens_seen": 40073144816,
      "step": 50934
    },
    {
      "epoch": 5.40367069806917,
      "grad_norm": 1.4936825663141686,
      "learning_rate": 2.892555016277896e-05,
      "loss": 1.1929,
      "num_input_tokens_seen": 40073931520,
      "step": 50935
    },
    {
      "epoch": 5.4037767876087415,
      "grad_norm": 0.9605962193789097,
      "learning_rate": 2.8924863813457727e-05,
      "loss": 1.106,
      "num_input_tokens_seen": 40074718256,
      "step": 50936
    },
    {
      "epoch": 5.403882877148313,
      "grad_norm": 0.9049033807308959,
      "learning_rate": 2.8924177461103473e-05,
      "loss": 1.146,
      "num_input_tokens_seen": 40075505008,
      "step": 50937
    },
    {
      "epoch": 5.403988966687884,
      "grad_norm": 0.9246662898619222,
      "learning_rate": 2.8923491105716733e-05,
      "loss": 1.1277,
      "num_input_tokens_seen": 40076291824,
      "step": 50938
    },
    {
      "epoch": 5.404095056227456,
      "grad_norm": 0.7294359792811876,
      "learning_rate": 2.8922804747298038e-05,
      "loss": 1.1322,
      "num_input_tokens_seen": 40077078624,
      "step": 50939
    },
    {
      "epoch": 5.404201145767027,
      "grad_norm": 1.0916566728147614,
      "learning_rate": 2.8922118385847907e-05,
      "loss": 1.1896,
      "num_input_tokens_seen": 40077865440,
      "step": 50940
    },
    {
      "epoch": 5.404307235306598,
      "grad_norm": 0.6744367508948133,
      "learning_rate": 2.892143202136688e-05,
      "loss": 1.1447,
      "num_input_tokens_seen": 40078652176,
      "step": 50941
    },
    {
      "epoch": 5.40441332484617,
      "grad_norm": 0.67307497733322,
      "learning_rate": 2.892074565385549e-05,
      "loss": 1.1751,
      "num_input_tokens_seen": 40079438768,
      "step": 50942
    },
    {
      "epoch": 5.404519414385741,
      "grad_norm": 0.6355566785040673,
      "learning_rate": 2.892005928331426e-05,
      "loss": 1.183,
      "num_input_tokens_seen": 40080225520,
      "step": 50943
    },
    {
      "epoch": 5.404625503925313,
      "grad_norm": 0.6367503372897125,
      "learning_rate": 2.891937290974372e-05,
      "loss": 1.1423,
      "num_input_tokens_seen": 40081012208,
      "step": 50944
    },
    {
      "epoch": 5.404731593464884,
      "grad_norm": 0.693735758865614,
      "learning_rate": 2.8918686533144414e-05,
      "loss": 1.1737,
      "num_input_tokens_seen": 40081798992,
      "step": 50945
    },
    {
      "epoch": 5.404837683004455,
      "grad_norm": 0.6092076693838159,
      "learning_rate": 2.891800015351685e-05,
      "loss": 1.1735,
      "num_input_tokens_seen": 40082585824,
      "step": 50946
    },
    {
      "epoch": 5.404943772544027,
      "grad_norm": 0.6410607629723245,
      "learning_rate": 2.8917313770861576e-05,
      "loss": 1.1373,
      "num_input_tokens_seen": 40083372544,
      "step": 50947
    },
    {
      "epoch": 5.405049862083598,
      "grad_norm": 0.7165505771808114,
      "learning_rate": 2.8916627385179113e-05,
      "loss": 1.2132,
      "num_input_tokens_seen": 40084159280,
      "step": 50948
    },
    {
      "epoch": 5.40515595162317,
      "grad_norm": 0.7626015973867356,
      "learning_rate": 2.8915940996470005e-05,
      "loss": 1.15,
      "num_input_tokens_seen": 40084946080,
      "step": 50949
    },
    {
      "epoch": 5.405262041162741,
      "grad_norm": 0.83475975388039,
      "learning_rate": 2.891525460473476e-05,
      "loss": 1.1704,
      "num_input_tokens_seen": 40085732896,
      "step": 50950
    },
    {
      "epoch": 5.405368130702313,
      "grad_norm": 0.6520191421660152,
      "learning_rate": 2.891456820997393e-05,
      "loss": 1.1574,
      "num_input_tokens_seen": 40086519632,
      "step": 50951
    },
    {
      "epoch": 5.405474220241884,
      "grad_norm": 0.9364337562307897,
      "learning_rate": 2.891388181218803e-05,
      "loss": 1.2119,
      "num_input_tokens_seen": 40087306352,
      "step": 50952
    },
    {
      "epoch": 5.405580309781455,
      "grad_norm": 0.7472273964680819,
      "learning_rate": 2.8913195411377603e-05,
      "loss": 1.1194,
      "num_input_tokens_seen": 40088093056,
      "step": 50953
    },
    {
      "epoch": 5.405686399321027,
      "grad_norm": 0.7904855876583639,
      "learning_rate": 2.891250900754317e-05,
      "loss": 1.1086,
      "num_input_tokens_seen": 40088879744,
      "step": 50954
    },
    {
      "epoch": 5.405792488860598,
      "grad_norm": 1.1903198841611722,
      "learning_rate": 2.8911822600685263e-05,
      "loss": 1.2202,
      "num_input_tokens_seen": 40089666560,
      "step": 50955
    },
    {
      "epoch": 5.40589857840017,
      "grad_norm": 0.6928672803863016,
      "learning_rate": 2.8911136190804417e-05,
      "loss": 1.2078,
      "num_input_tokens_seen": 40090453248,
      "step": 50956
    },
    {
      "epoch": 5.406004667939741,
      "grad_norm": 1.340534434432399,
      "learning_rate": 2.891044977790116e-05,
      "loss": 1.1567,
      "num_input_tokens_seen": 40091239984,
      "step": 50957
    },
    {
      "epoch": 5.406110757479312,
      "grad_norm": 0.8294062592678833,
      "learning_rate": 2.890976336197602e-05,
      "loss": 1.12,
      "num_input_tokens_seen": 40092026800,
      "step": 50958
    },
    {
      "epoch": 5.406216847018884,
      "grad_norm": 0.6589911619115287,
      "learning_rate": 2.8909076943029534e-05,
      "loss": 1.1888,
      "num_input_tokens_seen": 40092813536,
      "step": 50959
    },
    {
      "epoch": 5.406322936558455,
      "grad_norm": 1.0964918417962481,
      "learning_rate": 2.890839052106223e-05,
      "loss": 1.2271,
      "num_input_tokens_seen": 40093600384,
      "step": 50960
    },
    {
      "epoch": 5.406429026098027,
      "grad_norm": 0.9329718506019468,
      "learning_rate": 2.890770409607463e-05,
      "loss": 1.1362,
      "num_input_tokens_seen": 40094387184,
      "step": 50961
    },
    {
      "epoch": 5.406535115637598,
      "grad_norm": 0.6803743110314084,
      "learning_rate": 2.8907017668067272e-05,
      "loss": 1.1789,
      "num_input_tokens_seen": 40095173984,
      "step": 50962
    },
    {
      "epoch": 5.40664120517717,
      "grad_norm": 1.08928001218521,
      "learning_rate": 2.8906331237040686e-05,
      "loss": 1.1088,
      "num_input_tokens_seen": 40095960768,
      "step": 50963
    },
    {
      "epoch": 5.406747294716741,
      "grad_norm": 0.7173507832135847,
      "learning_rate": 2.8905644802995403e-05,
      "loss": 1.2372,
      "num_input_tokens_seen": 40096747472,
      "step": 50964
    },
    {
      "epoch": 5.406853384256312,
      "grad_norm": 0.7972066318150615,
      "learning_rate": 2.890495836593195e-05,
      "loss": 1.1675,
      "num_input_tokens_seen": 40097534192,
      "step": 50965
    },
    {
      "epoch": 5.406959473795884,
      "grad_norm": 0.8538993203037257,
      "learning_rate": 2.890427192585086e-05,
      "loss": 1.2167,
      "num_input_tokens_seen": 40098320960,
      "step": 50966
    },
    {
      "epoch": 5.407065563335455,
      "grad_norm": 0.7629591883028716,
      "learning_rate": 2.8903585482752667e-05,
      "loss": 1.0961,
      "num_input_tokens_seen": 40099107648,
      "step": 50967
    },
    {
      "epoch": 5.407171652875027,
      "grad_norm": 0.8546594184750607,
      "learning_rate": 2.8902899036637893e-05,
      "loss": 1.0955,
      "num_input_tokens_seen": 40099894384,
      "step": 50968
    },
    {
      "epoch": 5.407277742414598,
      "grad_norm": 0.7890570957383479,
      "learning_rate": 2.8902212587507075e-05,
      "loss": 1.1271,
      "num_input_tokens_seen": 40100681152,
      "step": 50969
    },
    {
      "epoch": 5.407383831954169,
      "grad_norm": 0.679423991329257,
      "learning_rate": 2.890152613536074e-05,
      "loss": 1.1616,
      "num_input_tokens_seen": 40101467920,
      "step": 50970
    },
    {
      "epoch": 5.407489921493741,
      "grad_norm": 0.6593233403767298,
      "learning_rate": 2.890083968019942e-05,
      "loss": 1.1765,
      "num_input_tokens_seen": 40102254720,
      "step": 50971
    },
    {
      "epoch": 5.407596011033312,
      "grad_norm": 0.6799029020689157,
      "learning_rate": 2.8900153222023652e-05,
      "loss": 1.0948,
      "num_input_tokens_seen": 40103041520,
      "step": 50972
    },
    {
      "epoch": 5.407702100572884,
      "grad_norm": 0.6109004318379271,
      "learning_rate": 2.889946676083395e-05,
      "loss": 1.1288,
      "num_input_tokens_seen": 40103828288,
      "step": 50973
    },
    {
      "epoch": 5.407808190112455,
      "grad_norm": 0.7274835929384947,
      "learning_rate": 2.889878029663086e-05,
      "loss": 1.1106,
      "num_input_tokens_seen": 40104615104,
      "step": 50974
    },
    {
      "epoch": 5.407914279652026,
      "grad_norm": 0.6571512463411431,
      "learning_rate": 2.8898093829414907e-05,
      "loss": 1.1463,
      "num_input_tokens_seen": 40105401904,
      "step": 50975
    },
    {
      "epoch": 5.408020369191598,
      "grad_norm": 0.7916441880263543,
      "learning_rate": 2.8897407359186616e-05,
      "loss": 1.2723,
      "num_input_tokens_seen": 40106188704,
      "step": 50976
    },
    {
      "epoch": 5.408126458731169,
      "grad_norm": 0.7955468963139157,
      "learning_rate": 2.889672088594653e-05,
      "loss": 1.2843,
      "num_input_tokens_seen": 40106975424,
      "step": 50977
    },
    {
      "epoch": 5.408232548270741,
      "grad_norm": 0.7501997102736272,
      "learning_rate": 2.889603440969518e-05,
      "loss": 1.151,
      "num_input_tokens_seen": 40107762160,
      "step": 50978
    },
    {
      "epoch": 5.408338637810312,
      "grad_norm": 0.9870723315927159,
      "learning_rate": 2.8895347930433075e-05,
      "loss": 1.1336,
      "num_input_tokens_seen": 40108549072,
      "step": 50979
    },
    {
      "epoch": 5.408444727349884,
      "grad_norm": 0.6913878067587804,
      "learning_rate": 2.8894661448160765e-05,
      "loss": 1.2036,
      "num_input_tokens_seen": 40109335856,
      "step": 50980
    },
    {
      "epoch": 5.408550816889455,
      "grad_norm": 0.742141085017609,
      "learning_rate": 2.8893974962878767e-05,
      "loss": 1.1641,
      "num_input_tokens_seen": 40110122640,
      "step": 50981
    },
    {
      "epoch": 5.408656906429026,
      "grad_norm": 0.7722976813975173,
      "learning_rate": 2.889328847458763e-05,
      "loss": 1.1511,
      "num_input_tokens_seen": 40110909472,
      "step": 50982
    },
    {
      "epoch": 5.408762995968598,
      "grad_norm": 0.8188089422316442,
      "learning_rate": 2.8892601983287875e-05,
      "loss": 1.2062,
      "num_input_tokens_seen": 40111696208,
      "step": 50983
    },
    {
      "epoch": 5.408869085508169,
      "grad_norm": 1.1104651493291413,
      "learning_rate": 2.889191548898002e-05,
      "loss": 1.0765,
      "num_input_tokens_seen": 40112482976,
      "step": 50984
    },
    {
      "epoch": 5.408975175047741,
      "grad_norm": 0.7936581552192324,
      "learning_rate": 2.8891228991664615e-05,
      "loss": 1.2391,
      "num_input_tokens_seen": 40113269680,
      "step": 50985
    },
    {
      "epoch": 5.409081264587312,
      "grad_norm": 0.8509288779787791,
      "learning_rate": 2.889054249134219e-05,
      "loss": 1.2327,
      "num_input_tokens_seen": 40114056416,
      "step": 50986
    },
    {
      "epoch": 5.409187354126883,
      "grad_norm": 1.2782320217139873,
      "learning_rate": 2.888985598801325e-05,
      "loss": 1.1463,
      "num_input_tokens_seen": 40114843296,
      "step": 50987
    },
    {
      "epoch": 5.409293443666455,
      "grad_norm": 0.7885804659309174,
      "learning_rate": 2.8889169481678357e-05,
      "loss": 1.2604,
      "num_input_tokens_seen": 40115630096,
      "step": 50988
    },
    {
      "epoch": 5.409399533206026,
      "grad_norm": 1.0583494045126878,
      "learning_rate": 2.888848297233802e-05,
      "loss": 1.0837,
      "num_input_tokens_seen": 40116416944,
      "step": 50989
    },
    {
      "epoch": 5.4095056227455975,
      "grad_norm": 0.9691052664613244,
      "learning_rate": 2.888779645999278e-05,
      "loss": 1.1145,
      "num_input_tokens_seen": 40117203728,
      "step": 50990
    },
    {
      "epoch": 5.409611712285169,
      "grad_norm": 0.5923185038312457,
      "learning_rate": 2.888710994464317e-05,
      "loss": 1.0929,
      "num_input_tokens_seen": 40117990464,
      "step": 50991
    },
    {
      "epoch": 5.4097178018247405,
      "grad_norm": 0.9096073800483611,
      "learning_rate": 2.8886423426289712e-05,
      "loss": 1.176,
      "num_input_tokens_seen": 40118777168,
      "step": 50992
    },
    {
      "epoch": 5.4098238913643115,
      "grad_norm": 1.0024390156518093,
      "learning_rate": 2.8885736904932937e-05,
      "loss": 1.269,
      "num_input_tokens_seen": 40119563904,
      "step": 50993
    },
    {
      "epoch": 5.4099299809038826,
      "grad_norm": 0.7490753984782348,
      "learning_rate": 2.888505038057338e-05,
      "loss": 1.1931,
      "num_input_tokens_seen": 40120350624,
      "step": 50994
    },
    {
      "epoch": 5.4100360704434545,
      "grad_norm": 1.4157262275664884,
      "learning_rate": 2.888436385321157e-05,
      "loss": 1.1908,
      "num_input_tokens_seen": 40121137360,
      "step": 50995
    },
    {
      "epoch": 5.4101421599830255,
      "grad_norm": 1.3897333413480866,
      "learning_rate": 2.888367732284804e-05,
      "loss": 1.2587,
      "num_input_tokens_seen": 40121924160,
      "step": 50996
    },
    {
      "epoch": 5.410248249522597,
      "grad_norm": 0.7020914319685421,
      "learning_rate": 2.8882990789483317e-05,
      "loss": 1.1165,
      "num_input_tokens_seen": 40122710912,
      "step": 50997
    },
    {
      "epoch": 5.4103543390621684,
      "grad_norm": 0.9289952359730428,
      "learning_rate": 2.888230425311793e-05,
      "loss": 1.1385,
      "num_input_tokens_seen": 40123497664,
      "step": 50998
    },
    {
      "epoch": 5.4104604286017395,
      "grad_norm": 0.8615357433959357,
      "learning_rate": 2.888161771375242e-05,
      "loss": 1.1136,
      "num_input_tokens_seen": 40124284512,
      "step": 50999
    },
    {
      "epoch": 5.410566518141311,
      "grad_norm": 0.8534400222056235,
      "learning_rate": 2.8880931171387303e-05,
      "loss": 1.1854,
      "num_input_tokens_seen": 40125071232,
      "step": 51000
    },
    {
      "epoch": 5.410566518141311,
      "eval_loss": 1.5446213483810425,
      "eval_runtime": 64.6577,
      "eval_samples_per_second": 46.398,
      "eval_steps_per_second": 0.495,
      "num_input_tokens_seen": 40125071232,
      "step": 51000
    },
    {
      "epoch": 5.410672607680882,
      "grad_norm": 0.6737765727915783,
      "learning_rate": 2.888024462602311e-05,
      "loss": 1.1338,
      "num_input_tokens_seen": 40125858000,
      "step": 51001
    },
    {
      "epoch": 5.410778697220454,
      "grad_norm": 0.9118148111922284,
      "learning_rate": 2.887955807766039e-05,
      "loss": 1.169,
      "num_input_tokens_seen": 40126644720,
      "step": 51002
    },
    {
      "epoch": 5.410884786760025,
      "grad_norm": 1.0092232504306053,
      "learning_rate": 2.8878871526299656e-05,
      "loss": 1.1731,
      "num_input_tokens_seen": 40127431424,
      "step": 51003
    },
    {
      "epoch": 5.410990876299596,
      "grad_norm": 0.8503865087521404,
      "learning_rate": 2.887818497194144e-05,
      "loss": 1.231,
      "num_input_tokens_seen": 40128218192,
      "step": 51004
    },
    {
      "epoch": 5.411096965839168,
      "grad_norm": 1.3481631897946165,
      "learning_rate": 2.8877498414586284e-05,
      "loss": 1.1956,
      "num_input_tokens_seen": 40129004944,
      "step": 51005
    },
    {
      "epoch": 5.411203055378739,
      "grad_norm": 0.8448412347541714,
      "learning_rate": 2.8876811854234707e-05,
      "loss": 1.1968,
      "num_input_tokens_seen": 40129791632,
      "step": 51006
    },
    {
      "epoch": 5.411309144918311,
      "grad_norm": 0.7231372808582657,
      "learning_rate": 2.8876125290887246e-05,
      "loss": 1.083,
      "num_input_tokens_seen": 40130578512,
      "step": 51007
    },
    {
      "epoch": 5.411415234457882,
      "grad_norm": 1.2893906818553869,
      "learning_rate": 2.887543872454443e-05,
      "loss": 1.1626,
      "num_input_tokens_seen": 40131365232,
      "step": 51008
    },
    {
      "epoch": 5.411521323997454,
      "grad_norm": 0.7845336908549244,
      "learning_rate": 2.8874752155206786e-05,
      "loss": 1.1073,
      "num_input_tokens_seen": 40132152064,
      "step": 51009
    },
    {
      "epoch": 5.411627413537025,
      "grad_norm": 0.6786290376424352,
      "learning_rate": 2.8874065582874843e-05,
      "loss": 1.1771,
      "num_input_tokens_seen": 40132938896,
      "step": 51010
    },
    {
      "epoch": 5.411733503076596,
      "grad_norm": 0.9763462457982849,
      "learning_rate": 2.8873379007549143e-05,
      "loss": 1.1777,
      "num_input_tokens_seen": 40133725568,
      "step": 51011
    },
    {
      "epoch": 5.411839592616168,
      "grad_norm": 0.6105704548354298,
      "learning_rate": 2.887269242923021e-05,
      "loss": 1.1482,
      "num_input_tokens_seen": 40134512304,
      "step": 51012
    },
    {
      "epoch": 5.411945682155739,
      "grad_norm": 0.899361244655469,
      "learning_rate": 2.8872005847918565e-05,
      "loss": 1.3234,
      "num_input_tokens_seen": 40135299008,
      "step": 51013
    },
    {
      "epoch": 5.412051771695311,
      "grad_norm": 0.8069343377679857,
      "learning_rate": 2.8871319263614754e-05,
      "loss": 1.249,
      "num_input_tokens_seen": 40136085792,
      "step": 51014
    },
    {
      "epoch": 5.412157861234882,
      "grad_norm": 0.6274312470928394,
      "learning_rate": 2.8870632676319296e-05,
      "loss": 1.088,
      "num_input_tokens_seen": 40136872544,
      "step": 51015
    },
    {
      "epoch": 5.412263950774454,
      "grad_norm": 1.3270601498212644,
      "learning_rate": 2.8869946086032735e-05,
      "loss": 1.1273,
      "num_input_tokens_seen": 40137659328,
      "step": 51016
    },
    {
      "epoch": 5.412370040314025,
      "grad_norm": 0.8023176543493624,
      "learning_rate": 2.886925949275559e-05,
      "loss": 1.1132,
      "num_input_tokens_seen": 40138446128,
      "step": 51017
    },
    {
      "epoch": 5.412476129853596,
      "grad_norm": 0.7508138053038972,
      "learning_rate": 2.886857289648839e-05,
      "loss": 1.0846,
      "num_input_tokens_seen": 40139232960,
      "step": 51018
    },
    {
      "epoch": 5.412582219393168,
      "grad_norm": 0.9263895566203549,
      "learning_rate": 2.886788629723167e-05,
      "loss": 1.0979,
      "num_input_tokens_seen": 40140019712,
      "step": 51019
    },
    {
      "epoch": 5.412688308932739,
      "grad_norm": 0.7494519995342043,
      "learning_rate": 2.886719969498597e-05,
      "loss": 1.2299,
      "num_input_tokens_seen": 40140806496,
      "step": 51020
    },
    {
      "epoch": 5.412794398472311,
      "grad_norm": 0.5861265406190321,
      "learning_rate": 2.8866513089751805e-05,
      "loss": 1.1528,
      "num_input_tokens_seen": 40141593248,
      "step": 51021
    },
    {
      "epoch": 5.412900488011882,
      "grad_norm": 0.7519269110913234,
      "learning_rate": 2.886582648152971e-05,
      "loss": 1.1577,
      "num_input_tokens_seen": 40142380064,
      "step": 51022
    },
    {
      "epoch": 5.413006577551453,
      "grad_norm": 0.5942589757143235,
      "learning_rate": 2.8865139870320223e-05,
      "loss": 1.1042,
      "num_input_tokens_seen": 40143166848,
      "step": 51023
    },
    {
      "epoch": 5.413112667091025,
      "grad_norm": 0.6655197078526451,
      "learning_rate": 2.886445325612387e-05,
      "loss": 1.0875,
      "num_input_tokens_seen": 40143953568,
      "step": 51024
    },
    {
      "epoch": 5.413218756630596,
      "grad_norm": 0.6499078259153427,
      "learning_rate": 2.886376663894118e-05,
      "loss": 1.1952,
      "num_input_tokens_seen": 40144740384,
      "step": 51025
    },
    {
      "epoch": 5.413324846170168,
      "grad_norm": 0.7793907121032969,
      "learning_rate": 2.8863080018772683e-05,
      "loss": 1.1956,
      "num_input_tokens_seen": 40145527152,
      "step": 51026
    },
    {
      "epoch": 5.413430935709739,
      "grad_norm": 0.6227438500855874,
      "learning_rate": 2.886239339561891e-05,
      "loss": 1.1121,
      "num_input_tokens_seen": 40146313984,
      "step": 51027
    },
    {
      "epoch": 5.41353702524931,
      "grad_norm": 0.70043757395166,
      "learning_rate": 2.8861706769480394e-05,
      "loss": 1.1674,
      "num_input_tokens_seen": 40147100672,
      "step": 51028
    },
    {
      "epoch": 5.413643114788882,
      "grad_norm": 0.6948230041378995,
      "learning_rate": 2.8861020140357664e-05,
      "loss": 1.0748,
      "num_input_tokens_seen": 40147887456,
      "step": 51029
    },
    {
      "epoch": 5.413749204328453,
      "grad_norm": 0.720434389847776,
      "learning_rate": 2.8860333508251247e-05,
      "loss": 1.1962,
      "num_input_tokens_seen": 40148674160,
      "step": 51030
    },
    {
      "epoch": 5.413855293868025,
      "grad_norm": 0.9380416957014869,
      "learning_rate": 2.8859646873161687e-05,
      "loss": 1.1216,
      "num_input_tokens_seen": 40149460976,
      "step": 51031
    },
    {
      "epoch": 5.413961383407596,
      "grad_norm": 0.8416418808896722,
      "learning_rate": 2.88589602350895e-05,
      "loss": 1.1426,
      "num_input_tokens_seen": 40150247744,
      "step": 51032
    },
    {
      "epoch": 5.414067472947167,
      "grad_norm": 0.8707232403081934,
      "learning_rate": 2.8858273594035218e-05,
      "loss": 1.1622,
      "num_input_tokens_seen": 40151034512,
      "step": 51033
    },
    {
      "epoch": 5.414173562486739,
      "grad_norm": 1.3026355553730522,
      "learning_rate": 2.885758694999938e-05,
      "loss": 1.1682,
      "num_input_tokens_seen": 40151821312,
      "step": 51034
    },
    {
      "epoch": 5.41427965202631,
      "grad_norm": 0.7840366425728518,
      "learning_rate": 2.8856900302982514e-05,
      "loss": 1.1388,
      "num_input_tokens_seen": 40152608080,
      "step": 51035
    },
    {
      "epoch": 5.414385741565882,
      "grad_norm": 0.8788585379741042,
      "learning_rate": 2.885621365298514e-05,
      "loss": 1.1258,
      "num_input_tokens_seen": 40153394832,
      "step": 51036
    },
    {
      "epoch": 5.414491831105453,
      "grad_norm": 1.097370338925311,
      "learning_rate": 2.885552700000781e-05,
      "loss": 1.1854,
      "num_input_tokens_seen": 40154181616,
      "step": 51037
    },
    {
      "epoch": 5.414597920645025,
      "grad_norm": 0.6861927063984715,
      "learning_rate": 2.8854840344051037e-05,
      "loss": 1.0919,
      "num_input_tokens_seen": 40154968352,
      "step": 51038
    },
    {
      "epoch": 5.414704010184596,
      "grad_norm": 0.8096355970097651,
      "learning_rate": 2.885415368511535e-05,
      "loss": 1.1129,
      "num_input_tokens_seen": 40155755200,
      "step": 51039
    },
    {
      "epoch": 5.414810099724167,
      "grad_norm": 0.775309482705863,
      "learning_rate": 2.885346702320129e-05,
      "loss": 1.1612,
      "num_input_tokens_seen": 40156541984,
      "step": 51040
    },
    {
      "epoch": 5.414916189263739,
      "grad_norm": 0.6625018209167466,
      "learning_rate": 2.8852780358309385e-05,
      "loss": 1.149,
      "num_input_tokens_seen": 40157328752,
      "step": 51041
    },
    {
      "epoch": 5.41502227880331,
      "grad_norm": 0.6643510048291175,
      "learning_rate": 2.8852093690440162e-05,
      "loss": 1.1486,
      "num_input_tokens_seen": 40158115488,
      "step": 51042
    },
    {
      "epoch": 5.415128368342882,
      "grad_norm": 0.6948863357472245,
      "learning_rate": 2.8851407019594158e-05,
      "loss": 1.2294,
      "num_input_tokens_seen": 40158902176,
      "step": 51043
    },
    {
      "epoch": 5.415234457882453,
      "grad_norm": 0.797669720279175,
      "learning_rate": 2.8850720345771893e-05,
      "loss": 1.133,
      "num_input_tokens_seen": 40159689024,
      "step": 51044
    },
    {
      "epoch": 5.415340547422025,
      "grad_norm": 0.7152564533585719,
      "learning_rate": 2.885003366897391e-05,
      "loss": 1.199,
      "num_input_tokens_seen": 40160475824,
      "step": 51045
    },
    {
      "epoch": 5.415446636961596,
      "grad_norm": 0.5868968362724323,
      "learning_rate": 2.8849346989200737e-05,
      "loss": 1.1454,
      "num_input_tokens_seen": 40161262624,
      "step": 51046
    },
    {
      "epoch": 5.415552726501167,
      "grad_norm": 1.3730706968724828,
      "learning_rate": 2.884866030645289e-05,
      "loss": 1.1512,
      "num_input_tokens_seen": 40162049360,
      "step": 51047
    },
    {
      "epoch": 5.415658816040739,
      "grad_norm": 0.770006942527953,
      "learning_rate": 2.8847973620730923e-05,
      "loss": 1.1538,
      "num_input_tokens_seen": 40162836240,
      "step": 51048
    },
    {
      "epoch": 5.41576490558031,
      "grad_norm": 0.8964465806885938,
      "learning_rate": 2.884728693203535e-05,
      "loss": 1.1795,
      "num_input_tokens_seen": 40163622912,
      "step": 51049
    },
    {
      "epoch": 5.415870995119882,
      "grad_norm": 0.743656373551831,
      "learning_rate": 2.8846600240366706e-05,
      "loss": 1.105,
      "num_input_tokens_seen": 40164409744,
      "step": 51050
    },
    {
      "epoch": 5.415977084659453,
      "grad_norm": 0.8858481215180783,
      "learning_rate": 2.8845913545725523e-05,
      "loss": 1.2132,
      "num_input_tokens_seen": 40165196512,
      "step": 51051
    },
    {
      "epoch": 5.416083174199024,
      "grad_norm": 0.9451546092591432,
      "learning_rate": 2.8845226848112332e-05,
      "loss": 1.1139,
      "num_input_tokens_seen": 40165983280,
      "step": 51052
    },
    {
      "epoch": 5.4161892637385955,
      "grad_norm": 0.891556024162282,
      "learning_rate": 2.884454014752766e-05,
      "loss": 1.1464,
      "num_input_tokens_seen": 40166769968,
      "step": 51053
    },
    {
      "epoch": 5.416295353278167,
      "grad_norm": 0.6847815734482275,
      "learning_rate": 2.884385344397204e-05,
      "loss": 1.0865,
      "num_input_tokens_seen": 40167556848,
      "step": 51054
    },
    {
      "epoch": 5.4164014428177385,
      "grad_norm": 1.026979892785009,
      "learning_rate": 2.884316673744601e-05,
      "loss": 1.2187,
      "num_input_tokens_seen": 40168343600,
      "step": 51055
    },
    {
      "epoch": 5.4165075323573095,
      "grad_norm": 0.8228195901469245,
      "learning_rate": 2.884248002795008e-05,
      "loss": 1.1418,
      "num_input_tokens_seen": 40169130384,
      "step": 51056
    },
    {
      "epoch": 5.416613621896881,
      "grad_norm": 0.9009820832581952,
      "learning_rate": 2.8841793315484804e-05,
      "loss": 1.1752,
      "num_input_tokens_seen": 40169917072,
      "step": 51057
    },
    {
      "epoch": 5.4167197114364525,
      "grad_norm": 0.7151910504564147,
      "learning_rate": 2.88411066000507e-05,
      "loss": 1.229,
      "num_input_tokens_seen": 40170703696,
      "step": 51058
    },
    {
      "epoch": 5.4168258009760235,
      "grad_norm": 0.6613867341825572,
      "learning_rate": 2.8840419881648305e-05,
      "loss": 1.0873,
      "num_input_tokens_seen": 40171490512,
      "step": 51059
    },
    {
      "epoch": 5.416931890515595,
      "grad_norm": 0.7041444239399856,
      "learning_rate": 2.8839733160278144e-05,
      "loss": 1.1102,
      "num_input_tokens_seen": 40172277296,
      "step": 51060
    },
    {
      "epoch": 5.4170379800551665,
      "grad_norm": 0.6715971270792439,
      "learning_rate": 2.8839046435940748e-05,
      "loss": 1.1891,
      "num_input_tokens_seen": 40173064080,
      "step": 51061
    },
    {
      "epoch": 5.4171440695947375,
      "grad_norm": 0.8036984123174865,
      "learning_rate": 2.8838359708636654e-05,
      "loss": 1.1427,
      "num_input_tokens_seen": 40173850864,
      "step": 51062
    },
    {
      "epoch": 5.417250159134309,
      "grad_norm": 0.7141448529617217,
      "learning_rate": 2.883767297836639e-05,
      "loss": 1.3203,
      "num_input_tokens_seen": 40174637584,
      "step": 51063
    },
    {
      "epoch": 5.41735624867388,
      "grad_norm": 0.9090121252722608,
      "learning_rate": 2.883698624513047e-05,
      "loss": 1.1362,
      "num_input_tokens_seen": 40175424384,
      "step": 51064
    },
    {
      "epoch": 5.417462338213452,
      "grad_norm": 0.692181364460309,
      "learning_rate": 2.8836299508929454e-05,
      "loss": 1.2537,
      "num_input_tokens_seen": 40176211168,
      "step": 51065
    },
    {
      "epoch": 5.417568427753023,
      "grad_norm": 0.6859518430668797,
      "learning_rate": 2.8835612769763852e-05,
      "loss": 1.17,
      "num_input_tokens_seen": 40176997952,
      "step": 51066
    },
    {
      "epoch": 5.417674517292595,
      "grad_norm": 1.0568116196784498,
      "learning_rate": 2.8834926027634198e-05,
      "loss": 1.1391,
      "num_input_tokens_seen": 40177784768,
      "step": 51067
    },
    {
      "epoch": 5.417780606832166,
      "grad_norm": 0.6724279275098757,
      "learning_rate": 2.8834239282541032e-05,
      "loss": 1.042,
      "num_input_tokens_seen": 40178571600,
      "step": 51068
    },
    {
      "epoch": 5.417886696371737,
      "grad_norm": 0.6945477307997666,
      "learning_rate": 2.883355253448488e-05,
      "loss": 1.1508,
      "num_input_tokens_seen": 40179358288,
      "step": 51069
    },
    {
      "epoch": 5.417992785911309,
      "grad_norm": 1.1787495478338035,
      "learning_rate": 2.8832865783466266e-05,
      "loss": 1.1759,
      "num_input_tokens_seen": 40180144992,
      "step": 51070
    },
    {
      "epoch": 5.41809887545088,
      "grad_norm": 0.6596162293825278,
      "learning_rate": 2.883217902948573e-05,
      "loss": 1.1744,
      "num_input_tokens_seen": 40180931712,
      "step": 51071
    },
    {
      "epoch": 5.418204964990452,
      "grad_norm": 0.7876564619221298,
      "learning_rate": 2.8831492272543796e-05,
      "loss": 1.1119,
      "num_input_tokens_seen": 40181718496,
      "step": 51072
    },
    {
      "epoch": 5.418311054530023,
      "grad_norm": 0.7085473430499324,
      "learning_rate": 2.8830805512640995e-05,
      "loss": 1.2129,
      "num_input_tokens_seen": 40182505248,
      "step": 51073
    },
    {
      "epoch": 5.418417144069595,
      "grad_norm": 0.5737445966086071,
      "learning_rate": 2.8830118749777864e-05,
      "loss": 1.1579,
      "num_input_tokens_seen": 40183292112,
      "step": 51074
    },
    {
      "epoch": 5.418523233609166,
      "grad_norm": 0.74351707996854,
      "learning_rate": 2.882943198395493e-05,
      "loss": 1.1831,
      "num_input_tokens_seen": 40184078864,
      "step": 51075
    },
    {
      "epoch": 5.418629323148737,
      "grad_norm": 0.6723115471581321,
      "learning_rate": 2.882874521517272e-05,
      "loss": 1.2598,
      "num_input_tokens_seen": 40184865568,
      "step": 51076
    },
    {
      "epoch": 5.418735412688309,
      "grad_norm": 0.6797808434754227,
      "learning_rate": 2.882805844343177e-05,
      "loss": 1.1858,
      "num_input_tokens_seen": 40185652384,
      "step": 51077
    },
    {
      "epoch": 5.41884150222788,
      "grad_norm": 0.7769339486035567,
      "learning_rate": 2.8827371668732612e-05,
      "loss": 1.2782,
      "num_input_tokens_seen": 40186439056,
      "step": 51078
    },
    {
      "epoch": 5.418947591767452,
      "grad_norm": 0.6972226894857382,
      "learning_rate": 2.8826684891075766e-05,
      "loss": 1.2713,
      "num_input_tokens_seen": 40187225776,
      "step": 51079
    },
    {
      "epoch": 5.419053681307023,
      "grad_norm": 0.7157894848920721,
      "learning_rate": 2.8825998110461776e-05,
      "loss": 1.0913,
      "num_input_tokens_seen": 40188012528,
      "step": 51080
    },
    {
      "epoch": 5.419159770846594,
      "grad_norm": 0.6232890181367974,
      "learning_rate": 2.882531132689117e-05,
      "loss": 1.227,
      "num_input_tokens_seen": 40188799152,
      "step": 51081
    },
    {
      "epoch": 5.419265860386166,
      "grad_norm": 0.9546754380107177,
      "learning_rate": 2.8824624540364463e-05,
      "loss": 1.0778,
      "num_input_tokens_seen": 40189585920,
      "step": 51082
    },
    {
      "epoch": 5.419371949925737,
      "grad_norm": 0.7663210337437903,
      "learning_rate": 2.8823937750882207e-05,
      "loss": 1.2162,
      "num_input_tokens_seen": 40190372656,
      "step": 51083
    },
    {
      "epoch": 5.419478039465309,
      "grad_norm": 0.8569582807010395,
      "learning_rate": 2.882325095844492e-05,
      "loss": 1.1417,
      "num_input_tokens_seen": 40191159456,
      "step": 51084
    },
    {
      "epoch": 5.41958412900488,
      "grad_norm": 0.8383071173046449,
      "learning_rate": 2.8822564163053147e-05,
      "loss": 1.073,
      "num_input_tokens_seen": 40191946144,
      "step": 51085
    },
    {
      "epoch": 5.419690218544451,
      "grad_norm": 0.779800835883933,
      "learning_rate": 2.88218773647074e-05,
      "loss": 1.207,
      "num_input_tokens_seen": 40192732848,
      "step": 51086
    },
    {
      "epoch": 5.419796308084023,
      "grad_norm": 1.049314556750674,
      "learning_rate": 2.8821190563408217e-05,
      "loss": 1.2337,
      "num_input_tokens_seen": 40193519520,
      "step": 51087
    },
    {
      "epoch": 5.419902397623594,
      "grad_norm": 0.9209882918153365,
      "learning_rate": 2.882050375915613e-05,
      "loss": 1.0946,
      "num_input_tokens_seen": 40194306352,
      "step": 51088
    },
    {
      "epoch": 5.420008487163166,
      "grad_norm": 0.8635474126461076,
      "learning_rate": 2.8819816951951678e-05,
      "loss": 1.1107,
      "num_input_tokens_seen": 40195093120,
      "step": 51089
    },
    {
      "epoch": 5.420114576702737,
      "grad_norm": 1.3038544567162547,
      "learning_rate": 2.8819130141795374e-05,
      "loss": 1.1025,
      "num_input_tokens_seen": 40195879984,
      "step": 51090
    },
    {
      "epoch": 5.420220666242309,
      "grad_norm": 0.7801137075914802,
      "learning_rate": 2.8818443328687767e-05,
      "loss": 1.0754,
      "num_input_tokens_seen": 40196666768,
      "step": 51091
    },
    {
      "epoch": 5.42032675578188,
      "grad_norm": 0.7523724858445301,
      "learning_rate": 2.8817756512629375e-05,
      "loss": 1.1381,
      "num_input_tokens_seen": 40197453568,
      "step": 51092
    },
    {
      "epoch": 5.420432845321451,
      "grad_norm": 0.8721422149255871,
      "learning_rate": 2.881706969362073e-05,
      "loss": 1.169,
      "num_input_tokens_seen": 40198240320,
      "step": 51093
    },
    {
      "epoch": 5.420538934861023,
      "grad_norm": 1.2040104378343846,
      "learning_rate": 2.8816382871662366e-05,
      "loss": 1.2051,
      "num_input_tokens_seen": 40199027072,
      "step": 51094
    },
    {
      "epoch": 5.420645024400594,
      "grad_norm": 0.8096615033539626,
      "learning_rate": 2.881569604675482e-05,
      "loss": 1.1226,
      "num_input_tokens_seen": 40199813872,
      "step": 51095
    },
    {
      "epoch": 5.420751113940166,
      "grad_norm": 0.784285764039362,
      "learning_rate": 2.881500921889861e-05,
      "loss": 1.2332,
      "num_input_tokens_seen": 40200600592,
      "step": 51096
    },
    {
      "epoch": 5.420857203479737,
      "grad_norm": 0.7290444717851167,
      "learning_rate": 2.8814322388094274e-05,
      "loss": 1.1544,
      "num_input_tokens_seen": 40201387408,
      "step": 51097
    },
    {
      "epoch": 5.420963293019308,
      "grad_norm": 0.6878471437854138,
      "learning_rate": 2.8813635554342342e-05,
      "loss": 1.1036,
      "num_input_tokens_seen": 40202174176,
      "step": 51098
    },
    {
      "epoch": 5.42106938255888,
      "grad_norm": 0.6929765199170603,
      "learning_rate": 2.881294871764334e-05,
      "loss": 1.1627,
      "num_input_tokens_seen": 40202960960,
      "step": 51099
    },
    {
      "epoch": 5.421175472098451,
      "grad_norm": 0.5861699308333093,
      "learning_rate": 2.881226187799781e-05,
      "loss": 1.1618,
      "num_input_tokens_seen": 40203747728,
      "step": 51100
    },
    {
      "epoch": 5.421281561638023,
      "grad_norm": 0.5821193990421463,
      "learning_rate": 2.8811575035406267e-05,
      "loss": 1.115,
      "num_input_tokens_seen": 40204534528,
      "step": 51101
    },
    {
      "epoch": 5.421387651177594,
      "grad_norm": 0.6251311106951553,
      "learning_rate": 2.881088818986926e-05,
      "loss": 1.1456,
      "num_input_tokens_seen": 40205321328,
      "step": 51102
    },
    {
      "epoch": 5.421493740717166,
      "grad_norm": 0.6057379007449424,
      "learning_rate": 2.8810201341387312e-05,
      "loss": 1.1207,
      "num_input_tokens_seen": 40206108112,
      "step": 51103
    },
    {
      "epoch": 5.421599830256737,
      "grad_norm": 0.7109926360625515,
      "learning_rate": 2.8809514489960944e-05,
      "loss": 1.2637,
      "num_input_tokens_seen": 40206894864,
      "step": 51104
    },
    {
      "epoch": 5.421705919796308,
      "grad_norm": 0.592174032934348,
      "learning_rate": 2.8808827635590696e-05,
      "loss": 1.1738,
      "num_input_tokens_seen": 40207681552,
      "step": 51105
    },
    {
      "epoch": 5.42181200933588,
      "grad_norm": 0.6177970550235881,
      "learning_rate": 2.8808140778277103e-05,
      "loss": 1.1642,
      "num_input_tokens_seen": 40208468336,
      "step": 51106
    },
    {
      "epoch": 5.421918098875451,
      "grad_norm": 0.6509659996183189,
      "learning_rate": 2.880745391802068e-05,
      "loss": 1.2045,
      "num_input_tokens_seen": 40209255184,
      "step": 51107
    },
    {
      "epoch": 5.422024188415023,
      "grad_norm": 0.6381045911652548,
      "learning_rate": 2.880676705482198e-05,
      "loss": 1.0524,
      "num_input_tokens_seen": 40210041984,
      "step": 51108
    },
    {
      "epoch": 5.422130277954594,
      "grad_norm": 0.7894079440160552,
      "learning_rate": 2.8806080188681523e-05,
      "loss": 1.1094,
      "num_input_tokens_seen": 40210828736,
      "step": 51109
    },
    {
      "epoch": 5.422236367494165,
      "grad_norm": 0.48950399936177486,
      "learning_rate": 2.8805393319599827e-05,
      "loss": 1.1578,
      "num_input_tokens_seen": 40211615552,
      "step": 51110
    },
    {
      "epoch": 5.422342457033737,
      "grad_norm": 0.6213513590232937,
      "learning_rate": 2.8804706447577446e-05,
      "loss": 1.0911,
      "num_input_tokens_seen": 40212402352,
      "step": 51111
    },
    {
      "epoch": 5.422448546573308,
      "grad_norm": 0.5537138417001394,
      "learning_rate": 2.88040195726149e-05,
      "loss": 1.1572,
      "num_input_tokens_seen": 40213189088,
      "step": 51112
    },
    {
      "epoch": 5.42255463611288,
      "grad_norm": 0.959899223279364,
      "learning_rate": 2.880333269471271e-05,
      "loss": 1.1483,
      "num_input_tokens_seen": 40213975904,
      "step": 51113
    },
    {
      "epoch": 5.422660725652451,
      "grad_norm": 0.6219587632436931,
      "learning_rate": 2.8802645813871415e-05,
      "loss": 1.2649,
      "num_input_tokens_seen": 40214762624,
      "step": 51114
    },
    {
      "epoch": 5.422766815192022,
      "grad_norm": 0.827945419111132,
      "learning_rate": 2.8801958930091556e-05,
      "loss": 1.2577,
      "num_input_tokens_seen": 40215549408,
      "step": 51115
    },
    {
      "epoch": 5.422872904731594,
      "grad_norm": 0.8979335129223327,
      "learning_rate": 2.8801272043373645e-05,
      "loss": 1.2363,
      "num_input_tokens_seen": 40216336192,
      "step": 51116
    },
    {
      "epoch": 5.422978994271165,
      "grad_norm": 0.5697487821669989,
      "learning_rate": 2.880058515371823e-05,
      "loss": 1.1305,
      "num_input_tokens_seen": 40217122992,
      "step": 51117
    },
    {
      "epoch": 5.4230850838107365,
      "grad_norm": 0.6795034331962665,
      "learning_rate": 2.8799898261125834e-05,
      "loss": 1.1684,
      "num_input_tokens_seen": 40217909712,
      "step": 51118
    },
    {
      "epoch": 5.4231911733503075,
      "grad_norm": 0.8087589603342654,
      "learning_rate": 2.8799211365596985e-05,
      "loss": 1.2529,
      "num_input_tokens_seen": 40218696480,
      "step": 51119
    },
    {
      "epoch": 5.4232972628898795,
      "grad_norm": 0.5736994480934897,
      "learning_rate": 2.879852446713222e-05,
      "loss": 1.15,
      "num_input_tokens_seen": 40219483184,
      "step": 51120
    },
    {
      "epoch": 5.4234033524294505,
      "grad_norm": 0.6363136276370805,
      "learning_rate": 2.8797837565732067e-05,
      "loss": 1.1317,
      "num_input_tokens_seen": 40220270016,
      "step": 51121
    },
    {
      "epoch": 5.4235094419690215,
      "grad_norm": 0.5837351104446731,
      "learning_rate": 2.8797150661397053e-05,
      "loss": 1.0636,
      "num_input_tokens_seen": 40221056864,
      "step": 51122
    },
    {
      "epoch": 5.423615531508593,
      "grad_norm": 0.7945622721273703,
      "learning_rate": 2.8796463754127717e-05,
      "loss": 1.2035,
      "num_input_tokens_seen": 40221843504,
      "step": 51123
    },
    {
      "epoch": 5.4237216210481645,
      "grad_norm": 0.6059706257778238,
      "learning_rate": 2.879577684392458e-05,
      "loss": 1.1907,
      "num_input_tokens_seen": 40222630288,
      "step": 51124
    },
    {
      "epoch": 5.423827710587736,
      "grad_norm": 0.885101439728353,
      "learning_rate": 2.8795089930788183e-05,
      "loss": 1.1217,
      "num_input_tokens_seen": 40223417120,
      "step": 51125
    },
    {
      "epoch": 5.423933800127307,
      "grad_norm": 0.6686613751287127,
      "learning_rate": 2.8794403014719052e-05,
      "loss": 1.1781,
      "num_input_tokens_seen": 40224203824,
      "step": 51126
    },
    {
      "epoch": 5.4240398896668784,
      "grad_norm": 0.7018207732156391,
      "learning_rate": 2.879371609571771e-05,
      "loss": 1.2435,
      "num_input_tokens_seen": 40224990544,
      "step": 51127
    },
    {
      "epoch": 5.42414597920645,
      "grad_norm": 0.715191913274828,
      "learning_rate": 2.8793029173784702e-05,
      "loss": 1.2345,
      "num_input_tokens_seen": 40225777328,
      "step": 51128
    },
    {
      "epoch": 5.424252068746021,
      "grad_norm": 0.5926860167390553,
      "learning_rate": 2.8792342248920557e-05,
      "loss": 1.1492,
      "num_input_tokens_seen": 40226564112,
      "step": 51129
    },
    {
      "epoch": 5.424358158285593,
      "grad_norm": 0.7953345653171505,
      "learning_rate": 2.8791655321125787e-05,
      "loss": 1.1484,
      "num_input_tokens_seen": 40227350816,
      "step": 51130
    },
    {
      "epoch": 5.424464247825164,
      "grad_norm": 0.745065721301275,
      "learning_rate": 2.8790968390400953e-05,
      "loss": 1.1721,
      "num_input_tokens_seen": 40228137520,
      "step": 51131
    },
    {
      "epoch": 5.424570337364736,
      "grad_norm": 0.5594528855268928,
      "learning_rate": 2.8790281456746558e-05,
      "loss": 1.1022,
      "num_input_tokens_seen": 40228924288,
      "step": 51132
    },
    {
      "epoch": 5.424676426904307,
      "grad_norm": 0.7088439228806427,
      "learning_rate": 2.878959452016315e-05,
      "loss": 1.1574,
      "num_input_tokens_seen": 40229711152,
      "step": 51133
    },
    {
      "epoch": 5.424782516443878,
      "grad_norm": 0.624176958611361,
      "learning_rate": 2.8788907580651254e-05,
      "loss": 1.1193,
      "num_input_tokens_seen": 40230497984,
      "step": 51134
    },
    {
      "epoch": 5.42488860598345,
      "grad_norm": 0.8425466516306221,
      "learning_rate": 2.8788220638211405e-05,
      "loss": 1.13,
      "num_input_tokens_seen": 40231284784,
      "step": 51135
    },
    {
      "epoch": 5.424994695523021,
      "grad_norm": 0.7471909139709105,
      "learning_rate": 2.878753369284412e-05,
      "loss": 1.1655,
      "num_input_tokens_seen": 40232071552,
      "step": 51136
    },
    {
      "epoch": 5.425100785062593,
      "grad_norm": 0.7517499786835276,
      "learning_rate": 2.878684674454995e-05,
      "loss": 1.1165,
      "num_input_tokens_seen": 40232858432,
      "step": 51137
    },
    {
      "epoch": 5.425206874602164,
      "grad_norm": 0.8391448464235393,
      "learning_rate": 2.8786159793329415e-05,
      "loss": 1.1739,
      "num_input_tokens_seen": 40233645200,
      "step": 51138
    },
    {
      "epoch": 5.425312964141735,
      "grad_norm": 0.8999848515096293,
      "learning_rate": 2.8785472839183036e-05,
      "loss": 1.2525,
      "num_input_tokens_seen": 40234431936,
      "step": 51139
    },
    {
      "epoch": 5.425419053681307,
      "grad_norm": 0.6446301303186277,
      "learning_rate": 2.8784785882111365e-05,
      "loss": 1.1866,
      "num_input_tokens_seen": 40235218752,
      "step": 51140
    },
    {
      "epoch": 5.425525143220878,
      "grad_norm": 0.7032327103340477,
      "learning_rate": 2.8784098922114922e-05,
      "loss": 1.1244,
      "num_input_tokens_seen": 40236005520,
      "step": 51141
    },
    {
      "epoch": 5.42563123276045,
      "grad_norm": 0.6018963768056487,
      "learning_rate": 2.8783411959194234e-05,
      "loss": 1.1912,
      "num_input_tokens_seen": 40236792176,
      "step": 51142
    },
    {
      "epoch": 5.425737322300021,
      "grad_norm": 0.7361616379839403,
      "learning_rate": 2.8782724993349842e-05,
      "loss": 1.1456,
      "num_input_tokens_seen": 40237578992,
      "step": 51143
    },
    {
      "epoch": 5.425843411839592,
      "grad_norm": 0.9357429104475479,
      "learning_rate": 2.8782038024582265e-05,
      "loss": 1.2331,
      "num_input_tokens_seen": 40238365792,
      "step": 51144
    },
    {
      "epoch": 5.425949501379164,
      "grad_norm": 0.9001225659806908,
      "learning_rate": 2.8781351052892042e-05,
      "loss": 1.1641,
      "num_input_tokens_seen": 40239152560,
      "step": 51145
    },
    {
      "epoch": 5.426055590918735,
      "grad_norm": 0.6420888580665456,
      "learning_rate": 2.8780664078279707e-05,
      "loss": 1.1394,
      "num_input_tokens_seen": 40239939312,
      "step": 51146
    },
    {
      "epoch": 5.426161680458307,
      "grad_norm": 1.3593218963383438,
      "learning_rate": 2.877997710074578e-05,
      "loss": 1.1988,
      "num_input_tokens_seen": 40240726000,
      "step": 51147
    },
    {
      "epoch": 5.426267769997878,
      "grad_norm": 0.9394669410699548,
      "learning_rate": 2.8779290120290798e-05,
      "loss": 1.2667,
      "num_input_tokens_seen": 40241512784,
      "step": 51148
    },
    {
      "epoch": 5.42637385953745,
      "grad_norm": 0.6354968177124671,
      "learning_rate": 2.8778603136915294e-05,
      "loss": 1.2363,
      "num_input_tokens_seen": 40242299536,
      "step": 51149
    },
    {
      "epoch": 5.426479949077021,
      "grad_norm": 1.0296265034680792,
      "learning_rate": 2.8777916150619793e-05,
      "loss": 1.1911,
      "num_input_tokens_seen": 40243086352,
      "step": 51150
    },
    {
      "epoch": 5.426586038616592,
      "grad_norm": 0.7742064134395165,
      "learning_rate": 2.8777229161404834e-05,
      "loss": 1.2588,
      "num_input_tokens_seen": 40243873088,
      "step": 51151
    },
    {
      "epoch": 5.426692128156164,
      "grad_norm": 0.724729866436644,
      "learning_rate": 2.8776542169270942e-05,
      "loss": 1.1298,
      "num_input_tokens_seen": 40244659856,
      "step": 51152
    },
    {
      "epoch": 5.426798217695735,
      "grad_norm": 1.0786836679217808,
      "learning_rate": 2.877585517421864e-05,
      "loss": 1.2304,
      "num_input_tokens_seen": 40245446624,
      "step": 51153
    },
    {
      "epoch": 5.426904307235307,
      "grad_norm": 0.7896338845966022,
      "learning_rate": 2.877516817624848e-05,
      "loss": 1.1559,
      "num_input_tokens_seen": 40246233472,
      "step": 51154
    },
    {
      "epoch": 5.427010396774878,
      "grad_norm": 0.8292469926478576,
      "learning_rate": 2.877448117536098e-05,
      "loss": 1.2076,
      "num_input_tokens_seen": 40247020256,
      "step": 51155
    },
    {
      "epoch": 5.427116486314449,
      "grad_norm": 0.7580213904609552,
      "learning_rate": 2.8773794171556663e-05,
      "loss": 1.1468,
      "num_input_tokens_seen": 40247806976,
      "step": 51156
    },
    {
      "epoch": 5.427222575854021,
      "grad_norm": 1.5577943537669816,
      "learning_rate": 2.8773107164836077e-05,
      "loss": 1.2475,
      "num_input_tokens_seen": 40248593712,
      "step": 51157
    },
    {
      "epoch": 5.427328665393592,
      "grad_norm": 1.067840663435336,
      "learning_rate": 2.8772420155199743e-05,
      "loss": 1.1834,
      "num_input_tokens_seen": 40249380384,
      "step": 51158
    },
    {
      "epoch": 5.427434754933164,
      "grad_norm": 0.7637433654010265,
      "learning_rate": 2.8771733142648183e-05,
      "loss": 1.1719,
      "num_input_tokens_seen": 40250167136,
      "step": 51159
    },
    {
      "epoch": 5.427540844472735,
      "grad_norm": 1.3246935961983306,
      "learning_rate": 2.8771046127181948e-05,
      "loss": 1.1572,
      "num_input_tokens_seen": 40250954000,
      "step": 51160
    },
    {
      "epoch": 5.427646934012307,
      "grad_norm": 0.8783168271557993,
      "learning_rate": 2.8770359108801558e-05,
      "loss": 1.177,
      "num_input_tokens_seen": 40251740720,
      "step": 51161
    },
    {
      "epoch": 5.427753023551878,
      "grad_norm": 0.8144600126317555,
      "learning_rate": 2.8769672087507543e-05,
      "loss": 1.1889,
      "num_input_tokens_seen": 40252527456,
      "step": 51162
    },
    {
      "epoch": 5.427859113091449,
      "grad_norm": 1.0245343163323184,
      "learning_rate": 2.8768985063300437e-05,
      "loss": 1.2338,
      "num_input_tokens_seen": 40253314240,
      "step": 51163
    },
    {
      "epoch": 5.427965202631021,
      "grad_norm": 0.7547598885936552,
      "learning_rate": 2.8768298036180773e-05,
      "loss": 1.1187,
      "num_input_tokens_seen": 40254101024,
      "step": 51164
    },
    {
      "epoch": 5.428071292170592,
      "grad_norm": 0.6211350992334591,
      "learning_rate": 2.8767611006149075e-05,
      "loss": 1.1229,
      "num_input_tokens_seen": 40254887792,
      "step": 51165
    },
    {
      "epoch": 5.428177381710164,
      "grad_norm": 1.383896770923757,
      "learning_rate": 2.8766923973205878e-05,
      "loss": 1.2513,
      "num_input_tokens_seen": 40255674544,
      "step": 51166
    },
    {
      "epoch": 5.428283471249735,
      "grad_norm": 1.212628570021847,
      "learning_rate": 2.876623693735172e-05,
      "loss": 1.145,
      "num_input_tokens_seen": 40256461328,
      "step": 51167
    },
    {
      "epoch": 5.428389560789306,
      "grad_norm": 0.650646003032344,
      "learning_rate": 2.8765549898587115e-05,
      "loss": 1.2498,
      "num_input_tokens_seen": 40257248112,
      "step": 51168
    },
    {
      "epoch": 5.428495650328878,
      "grad_norm": 1.3417656095446568,
      "learning_rate": 2.8764862856912606e-05,
      "loss": 1.1606,
      "num_input_tokens_seen": 40258034880,
      "step": 51169
    },
    {
      "epoch": 5.428601739868449,
      "grad_norm": 0.839500541272314,
      "learning_rate": 2.876417581232872e-05,
      "loss": 1.18,
      "num_input_tokens_seen": 40258821712,
      "step": 51170
    },
    {
      "epoch": 5.428707829408021,
      "grad_norm": 0.5955324678030266,
      "learning_rate": 2.8763488764835993e-05,
      "loss": 1.219,
      "num_input_tokens_seen": 40259608496,
      "step": 51171
    },
    {
      "epoch": 5.428813918947592,
      "grad_norm": 0.9892750086795651,
      "learning_rate": 2.8762801714434955e-05,
      "loss": 1.1031,
      "num_input_tokens_seen": 40260395248,
      "step": 51172
    },
    {
      "epoch": 5.428920008487163,
      "grad_norm": 0.6565711123596748,
      "learning_rate": 2.8762114661126127e-05,
      "loss": 1.1237,
      "num_input_tokens_seen": 40261182048,
      "step": 51173
    },
    {
      "epoch": 5.429026098026735,
      "grad_norm": 0.700557683583844,
      "learning_rate": 2.8761427604910052e-05,
      "loss": 1.2065,
      "num_input_tokens_seen": 40261968752,
      "step": 51174
    },
    {
      "epoch": 5.429132187566306,
      "grad_norm": 0.7334379798785607,
      "learning_rate": 2.876074054578726e-05,
      "loss": 1.2082,
      "num_input_tokens_seen": 40262755536,
      "step": 51175
    },
    {
      "epoch": 5.429238277105878,
      "grad_norm": 0.6526114819762135,
      "learning_rate": 2.8760053483758264e-05,
      "loss": 1.2003,
      "num_input_tokens_seen": 40263542224,
      "step": 51176
    },
    {
      "epoch": 5.429344366645449,
      "grad_norm": 0.6298755953590813,
      "learning_rate": 2.8759366418823625e-05,
      "loss": 1.1508,
      "num_input_tokens_seen": 40264329008,
      "step": 51177
    },
    {
      "epoch": 5.4294504561850205,
      "grad_norm": 0.6548611750553888,
      "learning_rate": 2.8758679350983852e-05,
      "loss": 1.1863,
      "num_input_tokens_seen": 40265115696,
      "step": 51178
    },
    {
      "epoch": 5.429556545724592,
      "grad_norm": 0.6397551239217242,
      "learning_rate": 2.8757992280239478e-05,
      "loss": 1.2983,
      "num_input_tokens_seen": 40265902448,
      "step": 51179
    },
    {
      "epoch": 5.429662635264163,
      "grad_norm": 0.9042734511444143,
      "learning_rate": 2.875730520659104e-05,
      "loss": 1.281,
      "num_input_tokens_seen": 40266689184,
      "step": 51180
    },
    {
      "epoch": 5.4297687248037345,
      "grad_norm": 0.6221660213851138,
      "learning_rate": 2.875661813003907e-05,
      "loss": 1.1818,
      "num_input_tokens_seen": 40267475920,
      "step": 51181
    },
    {
      "epoch": 5.4298748143433055,
      "grad_norm": 0.7373197624407262,
      "learning_rate": 2.875593105058409e-05,
      "loss": 1.1724,
      "num_input_tokens_seen": 40268262688,
      "step": 51182
    },
    {
      "epoch": 5.4299809038828775,
      "grad_norm": 0.7320372015835399,
      "learning_rate": 2.875524396822664e-05,
      "loss": 1.2065,
      "num_input_tokens_seen": 40269049344,
      "step": 51183
    },
    {
      "epoch": 5.4300869934224485,
      "grad_norm": 0.6888742780852313,
      "learning_rate": 2.8754556882967253e-05,
      "loss": 1.206,
      "num_input_tokens_seen": 40269836080,
      "step": 51184
    },
    {
      "epoch": 5.43019308296202,
      "grad_norm": 0.8322817136048791,
      "learning_rate": 2.8753869794806442e-05,
      "loss": 1.2541,
      "num_input_tokens_seen": 40270622800,
      "step": 51185
    },
    {
      "epoch": 5.430299172501591,
      "grad_norm": 0.6627428698822802,
      "learning_rate": 2.8753182703744763e-05,
      "loss": 1.199,
      "num_input_tokens_seen": 40271409520,
      "step": 51186
    },
    {
      "epoch": 5.4304052620411625,
      "grad_norm": 0.7853370581077374,
      "learning_rate": 2.8752495609782725e-05,
      "loss": 1.0809,
      "num_input_tokens_seen": 40272196208,
      "step": 51187
    },
    {
      "epoch": 5.430511351580734,
      "grad_norm": 1.0724741501870483,
      "learning_rate": 2.8751808512920876e-05,
      "loss": 1.2406,
      "num_input_tokens_seen": 40272983008,
      "step": 51188
    },
    {
      "epoch": 5.430617441120305,
      "grad_norm": 0.9084599832721209,
      "learning_rate": 2.8751121413159738e-05,
      "loss": 1.1642,
      "num_input_tokens_seen": 40273769792,
      "step": 51189
    },
    {
      "epoch": 5.430723530659877,
      "grad_norm": 0.8768162589638713,
      "learning_rate": 2.8750434310499837e-05,
      "loss": 1.1446,
      "num_input_tokens_seen": 40274556656,
      "step": 51190
    },
    {
      "epoch": 5.430829620199448,
      "grad_norm": 0.7011597366391475,
      "learning_rate": 2.8749747204941718e-05,
      "loss": 1.0944,
      "num_input_tokens_seen": 40275343376,
      "step": 51191
    },
    {
      "epoch": 5.430935709739019,
      "grad_norm": 0.7907528818873628,
      "learning_rate": 2.8749060096485902e-05,
      "loss": 1.1248,
      "num_input_tokens_seen": 40276130128,
      "step": 51192
    },
    {
      "epoch": 5.431041799278591,
      "grad_norm": 0.8455205450040667,
      "learning_rate": 2.8748372985132922e-05,
      "loss": 1.0946,
      "num_input_tokens_seen": 40276916896,
      "step": 51193
    },
    {
      "epoch": 5.431147888818162,
      "grad_norm": 0.7417043669077702,
      "learning_rate": 2.8747685870883306e-05,
      "loss": 1.1017,
      "num_input_tokens_seen": 40277703664,
      "step": 51194
    },
    {
      "epoch": 5.431253978357734,
      "grad_norm": 0.6542867168621935,
      "learning_rate": 2.8746998753737597e-05,
      "loss": 1.097,
      "num_input_tokens_seen": 40278490400,
      "step": 51195
    },
    {
      "epoch": 5.431360067897305,
      "grad_norm": 0.9277997395774001,
      "learning_rate": 2.8746311633696305e-05,
      "loss": 1.147,
      "num_input_tokens_seen": 40279277200,
      "step": 51196
    },
    {
      "epoch": 5.431466157436876,
      "grad_norm": 0.7889118523634256,
      "learning_rate": 2.8745624510759983e-05,
      "loss": 1.1009,
      "num_input_tokens_seen": 40280063952,
      "step": 51197
    },
    {
      "epoch": 5.431572246976448,
      "grad_norm": 0.8113939820136932,
      "learning_rate": 2.874493738492915e-05,
      "loss": 1.132,
      "num_input_tokens_seen": 40280850672,
      "step": 51198
    },
    {
      "epoch": 5.431678336516019,
      "grad_norm": 0.8508887334657425,
      "learning_rate": 2.8744250256204334e-05,
      "loss": 1.1612,
      "num_input_tokens_seen": 40281637424,
      "step": 51199
    },
    {
      "epoch": 5.431784426055591,
      "grad_norm": 0.6253833970581537,
      "learning_rate": 2.874356312458608e-05,
      "loss": 1.1391,
      "num_input_tokens_seen": 40282424176,
      "step": 51200
    },
    {
      "epoch": 5.431890515595162,
      "grad_norm": 0.7968343630444167,
      "learning_rate": 2.8742875990074908e-05,
      "loss": 1.1555,
      "num_input_tokens_seen": 40283210928,
      "step": 51201
    },
    {
      "epoch": 5.431996605134733,
      "grad_norm": 0.7076551708513383,
      "learning_rate": 2.874218885267135e-05,
      "loss": 1.2998,
      "num_input_tokens_seen": 40283997792,
      "step": 51202
    },
    {
      "epoch": 5.432102694674305,
      "grad_norm": 0.7147783804496802,
      "learning_rate": 2.8741501712375934e-05,
      "loss": 1.1483,
      "num_input_tokens_seen": 40284784576,
      "step": 51203
    },
    {
      "epoch": 5.432208784213876,
      "grad_norm": 0.7129737017769243,
      "learning_rate": 2.8740814569189196e-05,
      "loss": 1.1261,
      "num_input_tokens_seen": 40285571312,
      "step": 51204
    },
    {
      "epoch": 5.432314873753448,
      "grad_norm": 0.7237451118036451,
      "learning_rate": 2.8740127423111673e-05,
      "loss": 1.1363,
      "num_input_tokens_seen": 40286358080,
      "step": 51205
    },
    {
      "epoch": 5.432420963293019,
      "grad_norm": 0.6583705743914993,
      "learning_rate": 2.8739440274143888e-05,
      "loss": 1.1429,
      "num_input_tokens_seen": 40287144768,
      "step": 51206
    },
    {
      "epoch": 5.432527052832591,
      "grad_norm": 0.619827408050911,
      "learning_rate": 2.8738753122286365e-05,
      "loss": 1.2523,
      "num_input_tokens_seen": 40287931376,
      "step": 51207
    },
    {
      "epoch": 5.432633142372162,
      "grad_norm": 0.8875303248910822,
      "learning_rate": 2.873806596753965e-05,
      "loss": 1.208,
      "num_input_tokens_seen": 40288718032,
      "step": 51208
    },
    {
      "epoch": 5.432739231911733,
      "grad_norm": 0.7099656258972398,
      "learning_rate": 2.8737378809904264e-05,
      "loss": 1.2024,
      "num_input_tokens_seen": 40289504784,
      "step": 51209
    },
    {
      "epoch": 5.432845321451305,
      "grad_norm": 0.6818808113549497,
      "learning_rate": 2.8736691649380744e-05,
      "loss": 1.1543,
      "num_input_tokens_seen": 40290291488,
      "step": 51210
    },
    {
      "epoch": 5.432951410990876,
      "grad_norm": 0.6589181617622869,
      "learning_rate": 2.8736004485969614e-05,
      "loss": 1.1117,
      "num_input_tokens_seen": 40291078192,
      "step": 51211
    },
    {
      "epoch": 5.433057500530448,
      "grad_norm": 0.8020422872635646,
      "learning_rate": 2.873531731967142e-05,
      "loss": 1.1216,
      "num_input_tokens_seen": 40291865024,
      "step": 51212
    },
    {
      "epoch": 5.433163590070019,
      "grad_norm": 0.6513426481506586,
      "learning_rate": 2.873463015048667e-05,
      "loss": 1.1679,
      "num_input_tokens_seen": 40292651680,
      "step": 51213
    },
    {
      "epoch": 5.433269679609591,
      "grad_norm": 0.7709112440785477,
      "learning_rate": 2.8733942978415914e-05,
      "loss": 1.1621,
      "num_input_tokens_seen": 40293438416,
      "step": 51214
    },
    {
      "epoch": 5.433375769149162,
      "grad_norm": 0.9190550031439708,
      "learning_rate": 2.873325580345968e-05,
      "loss": 1.1419,
      "num_input_tokens_seen": 40294225104,
      "step": 51215
    },
    {
      "epoch": 5.433481858688733,
      "grad_norm": 0.595219420025647,
      "learning_rate": 2.8732568625618483e-05,
      "loss": 1.0484,
      "num_input_tokens_seen": 40295011888,
      "step": 51216
    },
    {
      "epoch": 5.433587948228305,
      "grad_norm": 0.694535356434831,
      "learning_rate": 2.8731881444892878e-05,
      "loss": 1.1047,
      "num_input_tokens_seen": 40295798672,
      "step": 51217
    },
    {
      "epoch": 5.433694037767876,
      "grad_norm": 1.0841768407681773,
      "learning_rate": 2.8731194261283383e-05,
      "loss": 1.0742,
      "num_input_tokens_seen": 40296585408,
      "step": 51218
    },
    {
      "epoch": 5.433800127307448,
      "grad_norm": 0.6650337938935555,
      "learning_rate": 2.8730507074790524e-05,
      "loss": 1.1256,
      "num_input_tokens_seen": 40297372256,
      "step": 51219
    },
    {
      "epoch": 5.433906216847019,
      "grad_norm": 0.6551158816056311,
      "learning_rate": 2.8729819885414845e-05,
      "loss": 1.2502,
      "num_input_tokens_seen": 40298159024,
      "step": 51220
    },
    {
      "epoch": 5.43401230638659,
      "grad_norm": 0.8246317130621605,
      "learning_rate": 2.8729132693156873e-05,
      "loss": 1.193,
      "num_input_tokens_seen": 40298945744,
      "step": 51221
    },
    {
      "epoch": 5.434118395926162,
      "grad_norm": 0.5568766962404226,
      "learning_rate": 2.8728445498017125e-05,
      "loss": 1.1854,
      "num_input_tokens_seen": 40299732528,
      "step": 51222
    },
    {
      "epoch": 5.434224485465733,
      "grad_norm": 0.6132911633452929,
      "learning_rate": 2.8727758299996154e-05,
      "loss": 1.0948,
      "num_input_tokens_seen": 40300519312,
      "step": 51223
    },
    {
      "epoch": 5.434330575005305,
      "grad_norm": 0.8398309939635585,
      "learning_rate": 2.872707109909448e-05,
      "loss": 1.1775,
      "num_input_tokens_seen": 40301306096,
      "step": 51224
    },
    {
      "epoch": 5.434436664544876,
      "grad_norm": 0.7805501608109648,
      "learning_rate": 2.872638389531263e-05,
      "loss": 1.1852,
      "num_input_tokens_seen": 40302092848,
      "step": 51225
    },
    {
      "epoch": 5.434542754084447,
      "grad_norm": 0.5717610044098816,
      "learning_rate": 2.8725696688651143e-05,
      "loss": 1.059,
      "num_input_tokens_seen": 40302879616,
      "step": 51226
    },
    {
      "epoch": 5.434648843624019,
      "grad_norm": 0.7959512865453812,
      "learning_rate": 2.8725009479110548e-05,
      "loss": 1.1245,
      "num_input_tokens_seen": 40303666384,
      "step": 51227
    },
    {
      "epoch": 5.43475493316359,
      "grad_norm": 0.6812660311352007,
      "learning_rate": 2.872432226669137e-05,
      "loss": 1.1462,
      "num_input_tokens_seen": 40304453200,
      "step": 51228
    },
    {
      "epoch": 5.434861022703162,
      "grad_norm": 0.6173466624582286,
      "learning_rate": 2.8723635051394154e-05,
      "loss": 1.1959,
      "num_input_tokens_seen": 40305240016,
      "step": 51229
    },
    {
      "epoch": 5.434967112242733,
      "grad_norm": 0.9065109889637193,
      "learning_rate": 2.872294783321941e-05,
      "loss": 1.1567,
      "num_input_tokens_seen": 40306026800,
      "step": 51230
    },
    {
      "epoch": 5.435073201782304,
      "grad_norm": 0.6588717727516126,
      "learning_rate": 2.872226061216769e-05,
      "loss": 1.1851,
      "num_input_tokens_seen": 40306813584,
      "step": 51231
    },
    {
      "epoch": 5.435179291321876,
      "grad_norm": 0.6526371938206673,
      "learning_rate": 2.872157338823952e-05,
      "loss": 1.217,
      "num_input_tokens_seen": 40307600416,
      "step": 51232
    },
    {
      "epoch": 5.435285380861447,
      "grad_norm": 0.7263598735450234,
      "learning_rate": 2.8720886161435416e-05,
      "loss": 1.2017,
      "num_input_tokens_seen": 40308387232,
      "step": 51233
    },
    {
      "epoch": 5.435391470401019,
      "grad_norm": 0.7625867772924864,
      "learning_rate": 2.8720198931755925e-05,
      "loss": 1.152,
      "num_input_tokens_seen": 40309173968,
      "step": 51234
    },
    {
      "epoch": 5.43549755994059,
      "grad_norm": 0.622439814812384,
      "learning_rate": 2.871951169920158e-05,
      "loss": 1.1101,
      "num_input_tokens_seen": 40309960624,
      "step": 51235
    },
    {
      "epoch": 5.435603649480162,
      "grad_norm": 1.0120968851780043,
      "learning_rate": 2.8718824463772893e-05,
      "loss": 1.1501,
      "num_input_tokens_seen": 40310747344,
      "step": 51236
    },
    {
      "epoch": 5.435709739019733,
      "grad_norm": 0.8186573994397967,
      "learning_rate": 2.8718137225470416e-05,
      "loss": 1.0748,
      "num_input_tokens_seen": 40311534016,
      "step": 51237
    },
    {
      "epoch": 5.435815828559304,
      "grad_norm": 0.7925166878183266,
      "learning_rate": 2.8717449984294675e-05,
      "loss": 1.2309,
      "num_input_tokens_seen": 40312320784,
      "step": 51238
    },
    {
      "epoch": 5.435921918098876,
      "grad_norm": 0.9190322763413905,
      "learning_rate": 2.8716762740246184e-05,
      "loss": 1.1606,
      "num_input_tokens_seen": 40313107568,
      "step": 51239
    },
    {
      "epoch": 5.436028007638447,
      "grad_norm": 0.9867510267806046,
      "learning_rate": 2.87160754933255e-05,
      "loss": 1.2352,
      "num_input_tokens_seen": 40313894368,
      "step": 51240
    },
    {
      "epoch": 5.4361340971780185,
      "grad_norm": 0.6981894829899408,
      "learning_rate": 2.8715388243533143e-05,
      "loss": 1.1611,
      "num_input_tokens_seen": 40314681152,
      "step": 51241
    },
    {
      "epoch": 5.43624018671759,
      "grad_norm": 0.7132774084577012,
      "learning_rate": 2.871470099086963e-05,
      "loss": 1.131,
      "num_input_tokens_seen": 40315467952,
      "step": 51242
    },
    {
      "epoch": 5.4363462762571615,
      "grad_norm": 1.1922758667146092,
      "learning_rate": 2.8714013735335514e-05,
      "loss": 1.1767,
      "num_input_tokens_seen": 40316254784,
      "step": 51243
    },
    {
      "epoch": 5.4364523657967325,
      "grad_norm": 0.6573845075955159,
      "learning_rate": 2.8713326476931323e-05,
      "loss": 1.1427,
      "num_input_tokens_seen": 40317041456,
      "step": 51244
    },
    {
      "epoch": 5.4365584553363036,
      "grad_norm": 0.5804587292899728,
      "learning_rate": 2.8712639215657574e-05,
      "loss": 1.1735,
      "num_input_tokens_seen": 40317828240,
      "step": 51245
    },
    {
      "epoch": 5.4366645448758755,
      "grad_norm": 0.6710711429583269,
      "learning_rate": 2.8711951951514805e-05,
      "loss": 1.1375,
      "num_input_tokens_seen": 40318615040,
      "step": 51246
    },
    {
      "epoch": 5.4367706344154465,
      "grad_norm": 0.7789145220238719,
      "learning_rate": 2.8711264684503546e-05,
      "loss": 1.139,
      "num_input_tokens_seen": 40319401840,
      "step": 51247
    },
    {
      "epoch": 5.436876723955018,
      "grad_norm": 0.5840770740045242,
      "learning_rate": 2.871057741462434e-05,
      "loss": 1.1307,
      "num_input_tokens_seen": 40320188640,
      "step": 51248
    },
    {
      "epoch": 5.4369828134945895,
      "grad_norm": 0.6071091740013234,
      "learning_rate": 2.870989014187771e-05,
      "loss": 1.2181,
      "num_input_tokens_seen": 40320975392,
      "step": 51249
    },
    {
      "epoch": 5.4370889030341605,
      "grad_norm": 0.7139612469284534,
      "learning_rate": 2.8709202866264175e-05,
      "loss": 1.1891,
      "num_input_tokens_seen": 40321762160,
      "step": 51250
    },
    {
      "epoch": 5.437194992573732,
      "grad_norm": 0.5731759757092952,
      "learning_rate": 2.8708515587784286e-05,
      "loss": 1.2095,
      "num_input_tokens_seen": 40322548880,
      "step": 51251
    },
    {
      "epoch": 5.437301082113303,
      "grad_norm": 0.7100760302803776,
      "learning_rate": 2.870782830643856e-05,
      "loss": 1.1819,
      "num_input_tokens_seen": 40323335632,
      "step": 51252
    },
    {
      "epoch": 5.437407171652875,
      "grad_norm": 0.7725683604443427,
      "learning_rate": 2.870714102222753e-05,
      "loss": 1.0491,
      "num_input_tokens_seen": 40324122432,
      "step": 51253
    },
    {
      "epoch": 5.437513261192446,
      "grad_norm": 0.6876539030318048,
      "learning_rate": 2.8706453735151738e-05,
      "loss": 1.1967,
      "num_input_tokens_seen": 40324909232,
      "step": 51254
    },
    {
      "epoch": 5.437619350732017,
      "grad_norm": 0.5841628076289332,
      "learning_rate": 2.8705766445211707e-05,
      "loss": 1.1862,
      "num_input_tokens_seen": 40325695984,
      "step": 51255
    },
    {
      "epoch": 5.437725440271589,
      "grad_norm": 0.745453006889164,
      "learning_rate": 2.870507915240796e-05,
      "loss": 1.1127,
      "num_input_tokens_seen": 40326482768,
      "step": 51256
    },
    {
      "epoch": 5.43783152981116,
      "grad_norm": 0.713049339665829,
      "learning_rate": 2.870439185674104e-05,
      "loss": 1.0962,
      "num_input_tokens_seen": 40327269568,
      "step": 51257
    },
    {
      "epoch": 5.437937619350732,
      "grad_norm": 0.720438935033834,
      "learning_rate": 2.8703704558211475e-05,
      "loss": 1.1581,
      "num_input_tokens_seen": 40328056336,
      "step": 51258
    },
    {
      "epoch": 5.438043708890303,
      "grad_norm": 0.8445829681405391,
      "learning_rate": 2.8703017256819796e-05,
      "loss": 1.1689,
      "num_input_tokens_seen": 40328843040,
      "step": 51259
    },
    {
      "epoch": 5.438149798429875,
      "grad_norm": 0.7681331119540484,
      "learning_rate": 2.8702329952566538e-05,
      "loss": 1.2135,
      "num_input_tokens_seen": 40329629920,
      "step": 51260
    },
    {
      "epoch": 5.438255887969446,
      "grad_norm": 1.299832872024514,
      "learning_rate": 2.8701642645452226e-05,
      "loss": 1.2468,
      "num_input_tokens_seen": 40330416608,
      "step": 51261
    },
    {
      "epoch": 5.438361977509017,
      "grad_norm": 1.0403307306989158,
      "learning_rate": 2.8700955335477386e-05,
      "loss": 1.1205,
      "num_input_tokens_seen": 40331203360,
      "step": 51262
    },
    {
      "epoch": 5.438468067048589,
      "grad_norm": 1.051143015053642,
      "learning_rate": 2.870026802264257e-05,
      "loss": 1.1894,
      "num_input_tokens_seen": 40331990144,
      "step": 51263
    },
    {
      "epoch": 5.43857415658816,
      "grad_norm": 1.0471588708233204,
      "learning_rate": 2.8699580706948288e-05,
      "loss": 1.244,
      "num_input_tokens_seen": 40332776816,
      "step": 51264
    },
    {
      "epoch": 5.438680246127732,
      "grad_norm": 0.5962822367292434,
      "learning_rate": 2.8698893388395077e-05,
      "loss": 1.1603,
      "num_input_tokens_seen": 40333563632,
      "step": 51265
    },
    {
      "epoch": 5.438786335667303,
      "grad_norm": 0.7346238902229568,
      "learning_rate": 2.869820606698347e-05,
      "loss": 1.1076,
      "num_input_tokens_seen": 40334350480,
      "step": 51266
    },
    {
      "epoch": 5.438892425206874,
      "grad_norm": 1.4250894830763536,
      "learning_rate": 2.8697518742714003e-05,
      "loss": 1.2086,
      "num_input_tokens_seen": 40335137216,
      "step": 51267
    },
    {
      "epoch": 5.438998514746446,
      "grad_norm": 0.7137048629616826,
      "learning_rate": 2.8696831415587196e-05,
      "loss": 1.1434,
      "num_input_tokens_seen": 40335924016,
      "step": 51268
    },
    {
      "epoch": 5.439104604286017,
      "grad_norm": 0.6736676559814032,
      "learning_rate": 2.8696144085603587e-05,
      "loss": 1.1906,
      "num_input_tokens_seen": 40336710784,
      "step": 51269
    },
    {
      "epoch": 5.439210693825589,
      "grad_norm": 0.7903555032115124,
      "learning_rate": 2.869545675276371e-05,
      "loss": 1.0941,
      "num_input_tokens_seen": 40337497584,
      "step": 51270
    },
    {
      "epoch": 5.43931678336516,
      "grad_norm": 1.1098339187907287,
      "learning_rate": 2.869476941706809e-05,
      "loss": 1.1086,
      "num_input_tokens_seen": 40338284368,
      "step": 51271
    },
    {
      "epoch": 5.439422872904732,
      "grad_norm": 0.648485520954178,
      "learning_rate": 2.8694082078517258e-05,
      "loss": 1.245,
      "num_input_tokens_seen": 40339071216,
      "step": 51272
    },
    {
      "epoch": 5.439528962444303,
      "grad_norm": 1.0536225364888014,
      "learning_rate": 2.869339473711175e-05,
      "loss": 1.1996,
      "num_input_tokens_seen": 40339857936,
      "step": 51273
    },
    {
      "epoch": 5.439635051983874,
      "grad_norm": 0.7208994677119406,
      "learning_rate": 2.86927073928521e-05,
      "loss": 1.1837,
      "num_input_tokens_seen": 40340644672,
      "step": 51274
    },
    {
      "epoch": 5.439741141523446,
      "grad_norm": 0.8696064416169066,
      "learning_rate": 2.8692020045738828e-05,
      "loss": 1.2682,
      "num_input_tokens_seen": 40341431456,
      "step": 51275
    },
    {
      "epoch": 5.439847231063017,
      "grad_norm": 0.7588501058606117,
      "learning_rate": 2.8691332695772472e-05,
      "loss": 1.1864,
      "num_input_tokens_seen": 40342218256,
      "step": 51276
    },
    {
      "epoch": 5.439953320602589,
      "grad_norm": 0.9619897128214908,
      "learning_rate": 2.869064534295356e-05,
      "loss": 1.1405,
      "num_input_tokens_seen": 40343004944,
      "step": 51277
    },
    {
      "epoch": 5.44005941014216,
      "grad_norm": 0.8494982980314402,
      "learning_rate": 2.8689957987282634e-05,
      "loss": 1.2205,
      "num_input_tokens_seen": 40343791728,
      "step": 51278
    },
    {
      "epoch": 5.440165499681731,
      "grad_norm": 0.6852668629846365,
      "learning_rate": 2.8689270628760205e-05,
      "loss": 1.2127,
      "num_input_tokens_seen": 40344578560,
      "step": 51279
    },
    {
      "epoch": 5.440271589221303,
      "grad_norm": 0.7051177667338521,
      "learning_rate": 2.8688583267386826e-05,
      "loss": 1.1725,
      "num_input_tokens_seen": 40345365296,
      "step": 51280
    },
    {
      "epoch": 5.440377678760874,
      "grad_norm": 0.7578008185744849,
      "learning_rate": 2.8687895903163015e-05,
      "loss": 1.1035,
      "num_input_tokens_seen": 40346152112,
      "step": 51281
    },
    {
      "epoch": 5.440483768300446,
      "grad_norm": 0.5634038892643428,
      "learning_rate": 2.8687208536089304e-05,
      "loss": 1.1651,
      "num_input_tokens_seen": 40346938880,
      "step": 51282
    },
    {
      "epoch": 5.440589857840017,
      "grad_norm": 0.6151449084944984,
      "learning_rate": 2.868652116616623e-05,
      "loss": 1.1884,
      "num_input_tokens_seen": 40347725632,
      "step": 51283
    },
    {
      "epoch": 5.440695947379588,
      "grad_norm": 0.5557307446725716,
      "learning_rate": 2.8685833793394324e-05,
      "loss": 1.0675,
      "num_input_tokens_seen": 40348512320,
      "step": 51284
    },
    {
      "epoch": 5.44080203691916,
      "grad_norm": 0.59435573983284,
      "learning_rate": 2.8685146417774102e-05,
      "loss": 1.0963,
      "num_input_tokens_seen": 40349299008,
      "step": 51285
    },
    {
      "epoch": 5.440908126458731,
      "grad_norm": 0.8720946963853593,
      "learning_rate": 2.8684459039306117e-05,
      "loss": 1.0643,
      "num_input_tokens_seen": 40350085712,
      "step": 51286
    },
    {
      "epoch": 5.441014215998303,
      "grad_norm": 0.6859511009127951,
      "learning_rate": 2.868377165799089e-05,
      "loss": 1.1992,
      "num_input_tokens_seen": 40350872400,
      "step": 51287
    },
    {
      "epoch": 5.441120305537874,
      "grad_norm": 1.0407335669483928,
      "learning_rate": 2.8683084273828943e-05,
      "loss": 1.175,
      "num_input_tokens_seen": 40351659136,
      "step": 51288
    },
    {
      "epoch": 5.441226395077446,
      "grad_norm": 1.0420163949436179,
      "learning_rate": 2.8682396886820823e-05,
      "loss": 1.1136,
      "num_input_tokens_seen": 40352445856,
      "step": 51289
    },
    {
      "epoch": 5.441332484617017,
      "grad_norm": 0.6312272927874257,
      "learning_rate": 2.8681709496967052e-05,
      "loss": 1.1499,
      "num_input_tokens_seen": 40353232624,
      "step": 51290
    },
    {
      "epoch": 5.441438574156588,
      "grad_norm": 1.4398118503907773,
      "learning_rate": 2.868102210426817e-05,
      "loss": 1.146,
      "num_input_tokens_seen": 40354019248,
      "step": 51291
    },
    {
      "epoch": 5.44154466369616,
      "grad_norm": 0.8281146123737319,
      "learning_rate": 2.8680334708724698e-05,
      "loss": 1.1146,
      "num_input_tokens_seen": 40354805952,
      "step": 51292
    },
    {
      "epoch": 5.441650753235731,
      "grad_norm": 0.60856073193082,
      "learning_rate": 2.8679647310337165e-05,
      "loss": 1.1373,
      "num_input_tokens_seen": 40355592768,
      "step": 51293
    },
    {
      "epoch": 5.441756842775303,
      "grad_norm": 0.6021511217664718,
      "learning_rate": 2.867895990910612e-05,
      "loss": 1.2007,
      "num_input_tokens_seen": 40356379520,
      "step": 51294
    },
    {
      "epoch": 5.441862932314874,
      "grad_norm": 0.9869862666563636,
      "learning_rate": 2.8678272505032078e-05,
      "loss": 1.1282,
      "num_input_tokens_seen": 40357166352,
      "step": 51295
    },
    {
      "epoch": 5.441969021854445,
      "grad_norm": 0.6919658565050293,
      "learning_rate": 2.8677585098115574e-05,
      "loss": 1.0793,
      "num_input_tokens_seen": 40357953152,
      "step": 51296
    },
    {
      "epoch": 5.442075111394017,
      "grad_norm": 0.7577327345419024,
      "learning_rate": 2.8676897688357142e-05,
      "loss": 1.1224,
      "num_input_tokens_seen": 40358739936,
      "step": 51297
    },
    {
      "epoch": 5.442181200933588,
      "grad_norm": 0.8207220109844107,
      "learning_rate": 2.8676210275757314e-05,
      "loss": 1.1457,
      "num_input_tokens_seen": 40359526736,
      "step": 51298
    },
    {
      "epoch": 5.44228729047316,
      "grad_norm": 0.843172515334083,
      "learning_rate": 2.8675522860316613e-05,
      "loss": 1.1176,
      "num_input_tokens_seen": 40360313440,
      "step": 51299
    },
    {
      "epoch": 5.442393380012731,
      "grad_norm": 0.8884099071877631,
      "learning_rate": 2.8674835442035576e-05,
      "loss": 1.1784,
      "num_input_tokens_seen": 40361100144,
      "step": 51300
    },
    {
      "epoch": 5.442499469552303,
      "grad_norm": 0.5782720348504032,
      "learning_rate": 2.8674148020914736e-05,
      "loss": 1.1002,
      "num_input_tokens_seen": 40361886864,
      "step": 51301
    },
    {
      "epoch": 5.442605559091874,
      "grad_norm": 0.7571698990066098,
      "learning_rate": 2.867346059695462e-05,
      "loss": 1.2095,
      "num_input_tokens_seen": 40362673568,
      "step": 51302
    },
    {
      "epoch": 5.442711648631445,
      "grad_norm": 0.5710391616270436,
      "learning_rate": 2.8672773170155763e-05,
      "loss": 1.1466,
      "num_input_tokens_seen": 40363460448,
      "step": 51303
    },
    {
      "epoch": 5.4428177381710166,
      "grad_norm": 0.6892293901376314,
      "learning_rate": 2.8672085740518695e-05,
      "loss": 1.157,
      "num_input_tokens_seen": 40364247360,
      "step": 51304
    },
    {
      "epoch": 5.442923827710588,
      "grad_norm": 0.577011786346174,
      "learning_rate": 2.8671398308043944e-05,
      "loss": 1.1369,
      "num_input_tokens_seen": 40365034032,
      "step": 51305
    },
    {
      "epoch": 5.4430299172501595,
      "grad_norm": 0.6592073258131239,
      "learning_rate": 2.867071087273205e-05,
      "loss": 1.2113,
      "num_input_tokens_seen": 40365820816,
      "step": 51306
    },
    {
      "epoch": 5.4431360067897305,
      "grad_norm": 0.5762958478237575,
      "learning_rate": 2.8670023434583536e-05,
      "loss": 1.1016,
      "num_input_tokens_seen": 40366607584,
      "step": 51307
    },
    {
      "epoch": 5.443242096329302,
      "grad_norm": 0.5830856298779644,
      "learning_rate": 2.8669335993598933e-05,
      "loss": 1.0099,
      "num_input_tokens_seen": 40367394336,
      "step": 51308
    },
    {
      "epoch": 5.4433481858688735,
      "grad_norm": 0.5619630582487205,
      "learning_rate": 2.8668648549778776e-05,
      "loss": 1.1103,
      "num_input_tokens_seen": 40368181168,
      "step": 51309
    },
    {
      "epoch": 5.4434542754084445,
      "grad_norm": 0.585209136051114,
      "learning_rate": 2.86679611031236e-05,
      "loss": 1.2349,
      "num_input_tokens_seen": 40368967872,
      "step": 51310
    },
    {
      "epoch": 5.443560364948016,
      "grad_norm": 0.5609865187723948,
      "learning_rate": 2.8667273653633925e-05,
      "loss": 1.1588,
      "num_input_tokens_seen": 40369754672,
      "step": 51311
    },
    {
      "epoch": 5.4436664544875875,
      "grad_norm": 0.6582649364907954,
      "learning_rate": 2.866658620131029e-05,
      "loss": 1.1118,
      "num_input_tokens_seen": 40370541472,
      "step": 51312
    },
    {
      "epoch": 5.4437725440271585,
      "grad_norm": 0.6052854547613438,
      "learning_rate": 2.866589874615323e-05,
      "loss": 1.2243,
      "num_input_tokens_seen": 40371328224,
      "step": 51313
    },
    {
      "epoch": 5.44387863356673,
      "grad_norm": 0.5894861661611163,
      "learning_rate": 2.8665211288163263e-05,
      "loss": 1.1482,
      "num_input_tokens_seen": 40372115024,
      "step": 51314
    },
    {
      "epoch": 5.443984723106301,
      "grad_norm": 0.7340624024218964,
      "learning_rate": 2.8664523827340928e-05,
      "loss": 1.0862,
      "num_input_tokens_seen": 40372901840,
      "step": 51315
    },
    {
      "epoch": 5.444090812645873,
      "grad_norm": 0.6224341824118944,
      "learning_rate": 2.866383636368676e-05,
      "loss": 1.1796,
      "num_input_tokens_seen": 40373688688,
      "step": 51316
    },
    {
      "epoch": 5.444196902185444,
      "grad_norm": 0.8529200700695031,
      "learning_rate": 2.8663148897201287e-05,
      "loss": 1.1368,
      "num_input_tokens_seen": 40374475440,
      "step": 51317
    },
    {
      "epoch": 5.444302991725016,
      "grad_norm": 0.6935483053400012,
      "learning_rate": 2.8662461427885045e-05,
      "loss": 1.2389,
      "num_input_tokens_seen": 40375262256,
      "step": 51318
    },
    {
      "epoch": 5.444409081264587,
      "grad_norm": 0.6301945024924519,
      "learning_rate": 2.8661773955738554e-05,
      "loss": 1.1421,
      "num_input_tokens_seen": 40376049008,
      "step": 51319
    },
    {
      "epoch": 5.444515170804158,
      "grad_norm": 0.7045242604997425,
      "learning_rate": 2.866108648076235e-05,
      "loss": 1.0809,
      "num_input_tokens_seen": 40376835920,
      "step": 51320
    },
    {
      "epoch": 5.44462126034373,
      "grad_norm": 0.7679037822375726,
      "learning_rate": 2.8660399002956973e-05,
      "loss": 1.1487,
      "num_input_tokens_seen": 40377622736,
      "step": 51321
    },
    {
      "epoch": 5.444727349883301,
      "grad_norm": 0.6448726496208115,
      "learning_rate": 2.8659711522322934e-05,
      "loss": 1.1568,
      "num_input_tokens_seen": 40378409584,
      "step": 51322
    },
    {
      "epoch": 5.444833439422873,
      "grad_norm": 1.2834809732610843,
      "learning_rate": 2.8659024038860794e-05,
      "loss": 1.2042,
      "num_input_tokens_seen": 40379196320,
      "step": 51323
    },
    {
      "epoch": 5.444939528962444,
      "grad_norm": 0.731420776447918,
      "learning_rate": 2.865833655257106e-05,
      "loss": 1.185,
      "num_input_tokens_seen": 40379983072,
      "step": 51324
    },
    {
      "epoch": 5.445045618502015,
      "grad_norm": 0.7518071436595734,
      "learning_rate": 2.8657649063454266e-05,
      "loss": 1.1504,
      "num_input_tokens_seen": 40380769808,
      "step": 51325
    },
    {
      "epoch": 5.445151708041587,
      "grad_norm": 0.8330458126524494,
      "learning_rate": 2.8656961571510955e-05,
      "loss": 1.15,
      "num_input_tokens_seen": 40381556576,
      "step": 51326
    },
    {
      "epoch": 5.445257797581158,
      "grad_norm": 0.966878729854103,
      "learning_rate": 2.865627407674165e-05,
      "loss": 1.1537,
      "num_input_tokens_seen": 40382343328,
      "step": 51327
    },
    {
      "epoch": 5.44536388712073,
      "grad_norm": 0.86287515873496,
      "learning_rate": 2.8655586579146877e-05,
      "loss": 1.1302,
      "num_input_tokens_seen": 40383130064,
      "step": 51328
    },
    {
      "epoch": 5.445469976660301,
      "grad_norm": 0.932042911390139,
      "learning_rate": 2.8654899078727182e-05,
      "loss": 1.1777,
      "num_input_tokens_seen": 40383916800,
      "step": 51329
    },
    {
      "epoch": 5.445576066199873,
      "grad_norm": 0.9808620932794406,
      "learning_rate": 2.8654211575483086e-05,
      "loss": 1.1677,
      "num_input_tokens_seen": 40384703632,
      "step": 51330
    },
    {
      "epoch": 5.445682155739444,
      "grad_norm": 0.5368939329093044,
      "learning_rate": 2.865352406941512e-05,
      "loss": 1.1054,
      "num_input_tokens_seen": 40385490304,
      "step": 51331
    },
    {
      "epoch": 5.445788245279015,
      "grad_norm": 1.176377684753749,
      "learning_rate": 2.8652836560523822e-05,
      "loss": 1.2098,
      "num_input_tokens_seen": 40386277136,
      "step": 51332
    },
    {
      "epoch": 5.445894334818587,
      "grad_norm": 1.5125484946533048,
      "learning_rate": 2.8652149048809718e-05,
      "loss": 1.2209,
      "num_input_tokens_seen": 40387063872,
      "step": 51333
    },
    {
      "epoch": 5.446000424358158,
      "grad_norm": 0.5879733442744054,
      "learning_rate": 2.8651461534273338e-05,
      "loss": 1.1443,
      "num_input_tokens_seen": 40387850656,
      "step": 51334
    },
    {
      "epoch": 5.44610651389773,
      "grad_norm": 1.0026086561297343,
      "learning_rate": 2.8650774016915223e-05,
      "loss": 1.2341,
      "num_input_tokens_seen": 40388637456,
      "step": 51335
    },
    {
      "epoch": 5.446212603437301,
      "grad_norm": 0.8164231732895368,
      "learning_rate": 2.8650086496735882e-05,
      "loss": 1.1997,
      "num_input_tokens_seen": 40389424208,
      "step": 51336
    },
    {
      "epoch": 5.446318692976872,
      "grad_norm": 0.6522758776778579,
      "learning_rate": 2.8649398973735874e-05,
      "loss": 1.1203,
      "num_input_tokens_seen": 40390211008,
      "step": 51337
    },
    {
      "epoch": 5.446424782516444,
      "grad_norm": 0.6297745270990845,
      "learning_rate": 2.8648711447915718e-05,
      "loss": 1.1012,
      "num_input_tokens_seen": 40390997808,
      "step": 51338
    },
    {
      "epoch": 5.446530872056015,
      "grad_norm": 0.917359519683605,
      "learning_rate": 2.8648023919275934e-05,
      "loss": 1.1738,
      "num_input_tokens_seen": 40391784672,
      "step": 51339
    },
    {
      "epoch": 5.446636961595587,
      "grad_norm": 0.5474016001983476,
      "learning_rate": 2.8647336387817075e-05,
      "loss": 1.0716,
      "num_input_tokens_seen": 40392571424,
      "step": 51340
    },
    {
      "epoch": 5.446743051135158,
      "grad_norm": 0.6873161187057722,
      "learning_rate": 2.864664885353966e-05,
      "loss": 1.0,
      "num_input_tokens_seen": 40393358256,
      "step": 51341
    },
    {
      "epoch": 5.446849140674729,
      "grad_norm": 0.8659302471187279,
      "learning_rate": 2.8645961316444214e-05,
      "loss": 1.1789,
      "num_input_tokens_seen": 40394144976,
      "step": 51342
    },
    {
      "epoch": 5.446955230214301,
      "grad_norm": 0.5992919172140991,
      "learning_rate": 2.8645273776531283e-05,
      "loss": 1.0808,
      "num_input_tokens_seen": 40394931856,
      "step": 51343
    },
    {
      "epoch": 5.447061319753872,
      "grad_norm": 0.9242806855007287,
      "learning_rate": 2.864458623380139e-05,
      "loss": 1.185,
      "num_input_tokens_seen": 40395718592,
      "step": 51344
    },
    {
      "epoch": 5.447167409293444,
      "grad_norm": 0.7454866299584734,
      "learning_rate": 2.8643898688255066e-05,
      "loss": 1.2401,
      "num_input_tokens_seen": 40396505408,
      "step": 51345
    },
    {
      "epoch": 5.447273498833015,
      "grad_norm": 0.6538511750506752,
      "learning_rate": 2.8643211139892845e-05,
      "loss": 1.166,
      "num_input_tokens_seen": 40397292128,
      "step": 51346
    },
    {
      "epoch": 5.447379588372587,
      "grad_norm": 0.6450086025735541,
      "learning_rate": 2.8642523588715263e-05,
      "loss": 1.1661,
      "num_input_tokens_seen": 40398078928,
      "step": 51347
    },
    {
      "epoch": 5.447485677912158,
      "grad_norm": 0.729048323528766,
      "learning_rate": 2.8641836034722834e-05,
      "loss": 1.2012,
      "num_input_tokens_seen": 40398865712,
      "step": 51348
    },
    {
      "epoch": 5.447591767451729,
      "grad_norm": 0.8402617380892776,
      "learning_rate": 2.864114847791611e-05,
      "loss": 1.2744,
      "num_input_tokens_seen": 40399652480,
      "step": 51349
    },
    {
      "epoch": 5.447697856991301,
      "grad_norm": 0.5965467566978767,
      "learning_rate": 2.864046091829561e-05,
      "loss": 1.0957,
      "num_input_tokens_seen": 40400439168,
      "step": 51350
    },
    {
      "epoch": 5.447803946530872,
      "grad_norm": 0.7890991001762588,
      "learning_rate": 2.863977335586187e-05,
      "loss": 1.1681,
      "num_input_tokens_seen": 40401225968,
      "step": 51351
    },
    {
      "epoch": 5.447910036070444,
      "grad_norm": 0.6403072758293797,
      "learning_rate": 2.8639085790615417e-05,
      "loss": 1.1638,
      "num_input_tokens_seen": 40402012768,
      "step": 51352
    },
    {
      "epoch": 5.448016125610015,
      "grad_norm": 0.7160828608153071,
      "learning_rate": 2.863839822255679e-05,
      "loss": 1.1831,
      "num_input_tokens_seen": 40402799488,
      "step": 51353
    },
    {
      "epoch": 5.448122215149587,
      "grad_norm": 0.654040424936828,
      "learning_rate": 2.8637710651686505e-05,
      "loss": 1.1912,
      "num_input_tokens_seen": 40403586176,
      "step": 51354
    },
    {
      "epoch": 5.448228304689158,
      "grad_norm": 0.6184726509919187,
      "learning_rate": 2.8637023078005114e-05,
      "loss": 1.128,
      "num_input_tokens_seen": 40404372944,
      "step": 51355
    },
    {
      "epoch": 5.448334394228729,
      "grad_norm": 0.6703811349803381,
      "learning_rate": 2.863633550151314e-05,
      "loss": 1.0911,
      "num_input_tokens_seen": 40405159728,
      "step": 51356
    },
    {
      "epoch": 5.448440483768301,
      "grad_norm": 0.7659103873607043,
      "learning_rate": 2.8635647922211105e-05,
      "loss": 1.1446,
      "num_input_tokens_seen": 40405946528,
      "step": 51357
    },
    {
      "epoch": 5.448546573307872,
      "grad_norm": 0.6180892955005709,
      "learning_rate": 2.8634960340099554e-05,
      "loss": 1.227,
      "num_input_tokens_seen": 40406733328,
      "step": 51358
    },
    {
      "epoch": 5.448652662847444,
      "grad_norm": 0.7755102148847102,
      "learning_rate": 2.863427275517901e-05,
      "loss": 1.1019,
      "num_input_tokens_seen": 40407520096,
      "step": 51359
    },
    {
      "epoch": 5.448758752387015,
      "grad_norm": 0.6579600846598861,
      "learning_rate": 2.8633585167450006e-05,
      "loss": 1.1561,
      "num_input_tokens_seen": 40408306864,
      "step": 51360
    },
    {
      "epoch": 5.448864841926586,
      "grad_norm": 0.7498182669650145,
      "learning_rate": 2.8632897576913077e-05,
      "loss": 1.1031,
      "num_input_tokens_seen": 40409093584,
      "step": 51361
    },
    {
      "epoch": 5.448970931466158,
      "grad_norm": 0.6384853306923196,
      "learning_rate": 2.8632209983568747e-05,
      "loss": 1.1216,
      "num_input_tokens_seen": 40409880352,
      "step": 51362
    },
    {
      "epoch": 5.449077021005729,
      "grad_norm": 0.7468427042298644,
      "learning_rate": 2.8631522387417554e-05,
      "loss": 1.2254,
      "num_input_tokens_seen": 40410667216,
      "step": 51363
    },
    {
      "epoch": 5.449183110545301,
      "grad_norm": 0.5865770960437224,
      "learning_rate": 2.8630834788460026e-05,
      "loss": 1.1457,
      "num_input_tokens_seen": 40411453984,
      "step": 51364
    },
    {
      "epoch": 5.449289200084872,
      "grad_norm": 1.1604605218382928,
      "learning_rate": 2.8630147186696694e-05,
      "loss": 1.2014,
      "num_input_tokens_seen": 40412240752,
      "step": 51365
    },
    {
      "epoch": 5.449395289624443,
      "grad_norm": 0.6523766530790729,
      "learning_rate": 2.8629459582128098e-05,
      "loss": 1.1556,
      "num_input_tokens_seen": 40413027520,
      "step": 51366
    },
    {
      "epoch": 5.449501379164015,
      "grad_norm": 0.7814468286056173,
      "learning_rate": 2.862877197475476e-05,
      "loss": 1.1408,
      "num_input_tokens_seen": 40413814208,
      "step": 51367
    },
    {
      "epoch": 5.449607468703586,
      "grad_norm": 0.6524267883566914,
      "learning_rate": 2.8628084364577208e-05,
      "loss": 1.151,
      "num_input_tokens_seen": 40414601056,
      "step": 51368
    },
    {
      "epoch": 5.4497135582431575,
      "grad_norm": 0.6584755509464028,
      "learning_rate": 2.8627396751595982e-05,
      "loss": 1.2504,
      "num_input_tokens_seen": 40415387744,
      "step": 51369
    },
    {
      "epoch": 5.4498196477827285,
      "grad_norm": 0.7358271233938344,
      "learning_rate": 2.862670913581161e-05,
      "loss": 1.2183,
      "num_input_tokens_seen": 40416174400,
      "step": 51370
    },
    {
      "epoch": 5.4499257373223,
      "grad_norm": 0.6511086741688841,
      "learning_rate": 2.862602151722462e-05,
      "loss": 1.1632,
      "num_input_tokens_seen": 40416961136,
      "step": 51371
    },
    {
      "epoch": 5.4500318268618715,
      "grad_norm": 0.6268596565969536,
      "learning_rate": 2.8625333895835556e-05,
      "loss": 1.1298,
      "num_input_tokens_seen": 40417747920,
      "step": 51372
    },
    {
      "epoch": 5.4501379164014425,
      "grad_norm": 0.891404921191831,
      "learning_rate": 2.8624646271644933e-05,
      "loss": 1.1231,
      "num_input_tokens_seen": 40418534688,
      "step": 51373
    },
    {
      "epoch": 5.450244005941014,
      "grad_norm": 0.6162530176044028,
      "learning_rate": 2.8623958644653287e-05,
      "loss": 1.097,
      "num_input_tokens_seen": 40419321488,
      "step": 51374
    },
    {
      "epoch": 5.4503500954805855,
      "grad_norm": 0.6638244542153982,
      "learning_rate": 2.8623271014861157e-05,
      "loss": 1.1671,
      "num_input_tokens_seen": 40420108192,
      "step": 51375
    },
    {
      "epoch": 5.450456185020157,
      "grad_norm": 0.8647788494791762,
      "learning_rate": 2.862258338226907e-05,
      "loss": 1.193,
      "num_input_tokens_seen": 40420895024,
      "step": 51376
    },
    {
      "epoch": 5.450562274559728,
      "grad_norm": 0.7363939847695655,
      "learning_rate": 2.862189574687756e-05,
      "loss": 1.1155,
      "num_input_tokens_seen": 40421681824,
      "step": 51377
    },
    {
      "epoch": 5.4506683640992994,
      "grad_norm": 0.5882354602500991,
      "learning_rate": 2.8621208108687146e-05,
      "loss": 1.1167,
      "num_input_tokens_seen": 40422468560,
      "step": 51378
    },
    {
      "epoch": 5.450774453638871,
      "grad_norm": 0.8219279056736228,
      "learning_rate": 2.8620520467698376e-05,
      "loss": 1.2915,
      "num_input_tokens_seen": 40423255264,
      "step": 51379
    },
    {
      "epoch": 5.450880543178442,
      "grad_norm": 0.5606920419184611,
      "learning_rate": 2.8619832823911768e-05,
      "loss": 1.1464,
      "num_input_tokens_seen": 40424041920,
      "step": 51380
    },
    {
      "epoch": 5.450986632718014,
      "grad_norm": 0.6513152098780624,
      "learning_rate": 2.8619145177327867e-05,
      "loss": 1.1508,
      "num_input_tokens_seen": 40424828720,
      "step": 51381
    },
    {
      "epoch": 5.451092722257585,
      "grad_norm": 0.63208857512174,
      "learning_rate": 2.861845752794719e-05,
      "loss": 1.1642,
      "num_input_tokens_seen": 40425615408,
      "step": 51382
    },
    {
      "epoch": 5.451198811797157,
      "grad_norm": 0.5352187874564137,
      "learning_rate": 2.861776987577028e-05,
      "loss": 1.1134,
      "num_input_tokens_seen": 40426402176,
      "step": 51383
    },
    {
      "epoch": 5.451304901336728,
      "grad_norm": 0.6352951580112126,
      "learning_rate": 2.8617082220797666e-05,
      "loss": 1.2732,
      "num_input_tokens_seen": 40427188864,
      "step": 51384
    },
    {
      "epoch": 5.451410990876299,
      "grad_norm": 0.7357747335227769,
      "learning_rate": 2.861639456302987e-05,
      "loss": 1.2918,
      "num_input_tokens_seen": 40427975648,
      "step": 51385
    },
    {
      "epoch": 5.451517080415871,
      "grad_norm": 0.6563455730368509,
      "learning_rate": 2.8615706902467433e-05,
      "loss": 1.1812,
      "num_input_tokens_seen": 40428762352,
      "step": 51386
    },
    {
      "epoch": 5.451623169955442,
      "grad_norm": 0.8016396844989164,
      "learning_rate": 2.8615019239110884e-05,
      "loss": 1.2497,
      "num_input_tokens_seen": 40429549088,
      "step": 51387
    },
    {
      "epoch": 5.451729259495014,
      "grad_norm": 0.5708090540607278,
      "learning_rate": 2.861433157296075e-05,
      "loss": 1.1276,
      "num_input_tokens_seen": 40430335888,
      "step": 51388
    },
    {
      "epoch": 5.451835349034585,
      "grad_norm": 0.8512747075615739,
      "learning_rate": 2.8613643904017574e-05,
      "loss": 1.1826,
      "num_input_tokens_seen": 40431122640,
      "step": 51389
    },
    {
      "epoch": 5.451941438574156,
      "grad_norm": 0.7215328940376972,
      "learning_rate": 2.8612956232281877e-05,
      "loss": 1.1962,
      "num_input_tokens_seen": 40431909408,
      "step": 51390
    },
    {
      "epoch": 5.452047528113728,
      "grad_norm": 0.7670751722808695,
      "learning_rate": 2.861226855775419e-05,
      "loss": 1.1579,
      "num_input_tokens_seen": 40432696192,
      "step": 51391
    },
    {
      "epoch": 5.452153617653299,
      "grad_norm": 0.6991948723974593,
      "learning_rate": 2.8611580880435052e-05,
      "loss": 1.0669,
      "num_input_tokens_seen": 40433483008,
      "step": 51392
    },
    {
      "epoch": 5.452259707192871,
      "grad_norm": 0.6785205820624081,
      "learning_rate": 2.861089320032499e-05,
      "loss": 1.1182,
      "num_input_tokens_seen": 40434269696,
      "step": 51393
    },
    {
      "epoch": 5.452365796732442,
      "grad_norm": 0.8731287100470347,
      "learning_rate": 2.8610205517424536e-05,
      "loss": 1.3256,
      "num_input_tokens_seen": 40435056336,
      "step": 51394
    },
    {
      "epoch": 5.452471886272013,
      "grad_norm": 0.9249387903795191,
      "learning_rate": 2.8609517831734222e-05,
      "loss": 1.1348,
      "num_input_tokens_seen": 40435843088,
      "step": 51395
    },
    {
      "epoch": 5.452577975811585,
      "grad_norm": 1.0037207187669237,
      "learning_rate": 2.860883014325457e-05,
      "loss": 1.2101,
      "num_input_tokens_seen": 40436629824,
      "step": 51396
    },
    {
      "epoch": 5.452684065351156,
      "grad_norm": 0.6545664717894502,
      "learning_rate": 2.860814245198613e-05,
      "loss": 1.1158,
      "num_input_tokens_seen": 40437416672,
      "step": 51397
    },
    {
      "epoch": 5.452790154890728,
      "grad_norm": 0.723010959172798,
      "learning_rate": 2.860745475792942e-05,
      "loss": 1.1754,
      "num_input_tokens_seen": 40438203376,
      "step": 51398
    },
    {
      "epoch": 5.452896244430299,
      "grad_norm": 0.8468209575861303,
      "learning_rate": 2.8606767061084972e-05,
      "loss": 1.2125,
      "num_input_tokens_seen": 40438990144,
      "step": 51399
    },
    {
      "epoch": 5.45300233396987,
      "grad_norm": 0.6709782291164276,
      "learning_rate": 2.860607936145332e-05,
      "loss": 1.1935,
      "num_input_tokens_seen": 40439776896,
      "step": 51400
    },
    {
      "epoch": 5.453108423509442,
      "grad_norm": 0.5448444290842528,
      "learning_rate": 2.8605391659035002e-05,
      "loss": 1.0092,
      "num_input_tokens_seen": 40440563696,
      "step": 51401
    },
    {
      "epoch": 5.453214513049013,
      "grad_norm": 0.6340137819077563,
      "learning_rate": 2.8604703953830543e-05,
      "loss": 1.1996,
      "num_input_tokens_seen": 40441350496,
      "step": 51402
    },
    {
      "epoch": 5.453320602588585,
      "grad_norm": 0.6057317227107689,
      "learning_rate": 2.8604016245840464e-05,
      "loss": 1.2374,
      "num_input_tokens_seen": 40442137232,
      "step": 51403
    },
    {
      "epoch": 5.453426692128156,
      "grad_norm": 0.6323266245804553,
      "learning_rate": 2.8603328535065316e-05,
      "loss": 1.2056,
      "num_input_tokens_seen": 40442923952,
      "step": 51404
    },
    {
      "epoch": 5.453532781667728,
      "grad_norm": 0.6776114778809087,
      "learning_rate": 2.8602640821505616e-05,
      "loss": 1.1871,
      "num_input_tokens_seen": 40443710752,
      "step": 51405
    },
    {
      "epoch": 5.453638871207299,
      "grad_norm": 0.8290468998167005,
      "learning_rate": 2.860195310516191e-05,
      "loss": 1.2108,
      "num_input_tokens_seen": 40444497472,
      "step": 51406
    },
    {
      "epoch": 5.45374496074687,
      "grad_norm": 0.6298989421544341,
      "learning_rate": 2.8601265386034714e-05,
      "loss": 1.1586,
      "num_input_tokens_seen": 40445284240,
      "step": 51407
    },
    {
      "epoch": 5.453851050286442,
      "grad_norm": 0.6016636863173175,
      "learning_rate": 2.8600577664124567e-05,
      "loss": 1.1951,
      "num_input_tokens_seen": 40446070976,
      "step": 51408
    },
    {
      "epoch": 5.453957139826013,
      "grad_norm": 0.6150254715974564,
      "learning_rate": 2.8599889939432e-05,
      "loss": 1.1496,
      "num_input_tokens_seen": 40446857680,
      "step": 51409
    },
    {
      "epoch": 5.454063229365585,
      "grad_norm": 0.5469046448675665,
      "learning_rate": 2.8599202211957545e-05,
      "loss": 1.2054,
      "num_input_tokens_seen": 40447644416,
      "step": 51410
    },
    {
      "epoch": 5.454169318905156,
      "grad_norm": 0.6091260047154716,
      "learning_rate": 2.8598514481701727e-05,
      "loss": 1.1501,
      "num_input_tokens_seen": 40448431232,
      "step": 51411
    },
    {
      "epoch": 5.454275408444728,
      "grad_norm": 0.8263866963008677,
      "learning_rate": 2.8597826748665087e-05,
      "loss": 1.1119,
      "num_input_tokens_seen": 40449217952,
      "step": 51412
    },
    {
      "epoch": 5.454381497984299,
      "grad_norm": 0.6993322849079457,
      "learning_rate": 2.8597139012848153e-05,
      "loss": 1.123,
      "num_input_tokens_seen": 40450004736,
      "step": 51413
    },
    {
      "epoch": 5.45448758752387,
      "grad_norm": 0.6723632043608876,
      "learning_rate": 2.8596451274251446e-05,
      "loss": 1.0971,
      "num_input_tokens_seen": 40450791456,
      "step": 51414
    },
    {
      "epoch": 5.454593677063442,
      "grad_norm": 1.0443179207380224,
      "learning_rate": 2.859576353287552e-05,
      "loss": 1.2383,
      "num_input_tokens_seen": 40451578176,
      "step": 51415
    },
    {
      "epoch": 5.454699766603013,
      "grad_norm": 0.7877847260720262,
      "learning_rate": 2.8595075788720887e-05,
      "loss": 1.1185,
      "num_input_tokens_seen": 40452364896,
      "step": 51416
    },
    {
      "epoch": 5.454805856142585,
      "grad_norm": 0.8592584476117976,
      "learning_rate": 2.8594388041788078e-05,
      "loss": 1.186,
      "num_input_tokens_seen": 40453151728,
      "step": 51417
    },
    {
      "epoch": 5.454911945682156,
      "grad_norm": 0.5810768445076419,
      "learning_rate": 2.8593700292077642e-05,
      "loss": 1.1339,
      "num_input_tokens_seen": 40453938528,
      "step": 51418
    },
    {
      "epoch": 5.455018035221727,
      "grad_norm": 0.7152220738476542,
      "learning_rate": 2.8593012539590093e-05,
      "loss": 1.1333,
      "num_input_tokens_seen": 40454725232,
      "step": 51419
    },
    {
      "epoch": 5.455124124761299,
      "grad_norm": 0.5953817074055864,
      "learning_rate": 2.8592324784325973e-05,
      "loss": 1.1096,
      "num_input_tokens_seen": 40455511952,
      "step": 51420
    },
    {
      "epoch": 5.45523021430087,
      "grad_norm": 0.811850921402031,
      "learning_rate": 2.8591637026285818e-05,
      "loss": 1.1611,
      "num_input_tokens_seen": 40456298816,
      "step": 51421
    },
    {
      "epoch": 5.455336303840442,
      "grad_norm": 0.6310202575656834,
      "learning_rate": 2.8590949265470136e-05,
      "loss": 1.0874,
      "num_input_tokens_seen": 40457085712,
      "step": 51422
    },
    {
      "epoch": 5.455442393380013,
      "grad_norm": 0.7972404857347996,
      "learning_rate": 2.8590261501879482e-05,
      "loss": 1.0335,
      "num_input_tokens_seen": 40457872512,
      "step": 51423
    },
    {
      "epoch": 5.455548482919584,
      "grad_norm": 0.6664263888243256,
      "learning_rate": 2.858957373551438e-05,
      "loss": 1.1379,
      "num_input_tokens_seen": 40458659264,
      "step": 51424
    },
    {
      "epoch": 5.455654572459156,
      "grad_norm": 0.8268785426963019,
      "learning_rate": 2.8588885966375355e-05,
      "loss": 1.2406,
      "num_input_tokens_seen": 40459445920,
      "step": 51425
    },
    {
      "epoch": 5.455760661998727,
      "grad_norm": 0.6569014499716519,
      "learning_rate": 2.8588198194462952e-05,
      "loss": 1.2362,
      "num_input_tokens_seen": 40460232656,
      "step": 51426
    },
    {
      "epoch": 5.455866751538299,
      "grad_norm": 0.6359225381735603,
      "learning_rate": 2.858751041977769e-05,
      "loss": 1.166,
      "num_input_tokens_seen": 40461019344,
      "step": 51427
    },
    {
      "epoch": 5.45597284107787,
      "grad_norm": 0.802028752381267,
      "learning_rate": 2.8586822642320106e-05,
      "loss": 1.0935,
      "num_input_tokens_seen": 40461806080,
      "step": 51428
    },
    {
      "epoch": 5.4560789306174415,
      "grad_norm": 0.5998641006382568,
      "learning_rate": 2.858613486209073e-05,
      "loss": 1.2628,
      "num_input_tokens_seen": 40462592784,
      "step": 51429
    },
    {
      "epoch": 5.456185020157013,
      "grad_norm": 0.6472475340905858,
      "learning_rate": 2.85854470790901e-05,
      "loss": 1.2163,
      "num_input_tokens_seen": 40463379504,
      "step": 51430
    },
    {
      "epoch": 5.456291109696584,
      "grad_norm": 1.1451795614056197,
      "learning_rate": 2.858475929331873e-05,
      "loss": 1.1872,
      "num_input_tokens_seen": 40464166272,
      "step": 51431
    },
    {
      "epoch": 5.4563971992361555,
      "grad_norm": 0.6720111521015364,
      "learning_rate": 2.8584071504777173e-05,
      "loss": 1.1552,
      "num_input_tokens_seen": 40464953024,
      "step": 51432
    },
    {
      "epoch": 5.4565032887757265,
      "grad_norm": 0.8801753044595393,
      "learning_rate": 2.858338371346595e-05,
      "loss": 1.152,
      "num_input_tokens_seen": 40465739872,
      "step": 51433
    },
    {
      "epoch": 5.4566093783152985,
      "grad_norm": 0.6831681650610452,
      "learning_rate": 2.858269591938559e-05,
      "loss": 1.1792,
      "num_input_tokens_seen": 40466526544,
      "step": 51434
    },
    {
      "epoch": 5.4567154678548695,
      "grad_norm": 0.6008588647240656,
      "learning_rate": 2.8582008122536625e-05,
      "loss": 1.1355,
      "num_input_tokens_seen": 40467313296,
      "step": 51435
    },
    {
      "epoch": 5.4568215573944405,
      "grad_norm": 0.5366886532956955,
      "learning_rate": 2.858132032291959e-05,
      "loss": 1.168,
      "num_input_tokens_seen": 40468100064,
      "step": 51436
    },
    {
      "epoch": 5.456927646934012,
      "grad_norm": 0.6277674178303966,
      "learning_rate": 2.8580632520535024e-05,
      "loss": 1.1517,
      "num_input_tokens_seen": 40468886912,
      "step": 51437
    },
    {
      "epoch": 5.4570337364735835,
      "grad_norm": 0.8953720709916331,
      "learning_rate": 2.8579944715383445e-05,
      "loss": 1.1616,
      "num_input_tokens_seen": 40469673664,
      "step": 51438
    },
    {
      "epoch": 5.457139826013155,
      "grad_norm": 0.5307053909912665,
      "learning_rate": 2.8579256907465386e-05,
      "loss": 1.1198,
      "num_input_tokens_seen": 40470460384,
      "step": 51439
    },
    {
      "epoch": 5.457245915552726,
      "grad_norm": 0.6718943172089517,
      "learning_rate": 2.857856909678138e-05,
      "loss": 1.2097,
      "num_input_tokens_seen": 40471247088,
      "step": 51440
    },
    {
      "epoch": 5.457352005092298,
      "grad_norm": 0.6561033384545389,
      "learning_rate": 2.8577881283331976e-05,
      "loss": 1.1306,
      "num_input_tokens_seen": 40472033824,
      "step": 51441
    },
    {
      "epoch": 5.457458094631869,
      "grad_norm": 0.6778634962588705,
      "learning_rate": 2.8577193467117673e-05,
      "loss": 1.1264,
      "num_input_tokens_seen": 40472820528,
      "step": 51442
    },
    {
      "epoch": 5.45756418417144,
      "grad_norm": 0.8558982297188512,
      "learning_rate": 2.857650564813903e-05,
      "loss": 1.1537,
      "num_input_tokens_seen": 40473607264,
      "step": 51443
    },
    {
      "epoch": 5.457670273711012,
      "grad_norm": 0.6498655088657543,
      "learning_rate": 2.8575817826396567e-05,
      "loss": 1.2434,
      "num_input_tokens_seen": 40474394064,
      "step": 51444
    },
    {
      "epoch": 5.457776363250583,
      "grad_norm": 0.6624955839566817,
      "learning_rate": 2.8575130001890814e-05,
      "loss": 1.1324,
      "num_input_tokens_seen": 40475180864,
      "step": 51445
    },
    {
      "epoch": 5.457882452790155,
      "grad_norm": 0.9105495789978124,
      "learning_rate": 2.8574442174622307e-05,
      "loss": 1.2029,
      "num_input_tokens_seen": 40475967552,
      "step": 51446
    },
    {
      "epoch": 5.457988542329726,
      "grad_norm": 1.1923118701514928,
      "learning_rate": 2.8573754344591575e-05,
      "loss": 1.1051,
      "num_input_tokens_seen": 40476754352,
      "step": 51447
    },
    {
      "epoch": 5.458094631869297,
      "grad_norm": 1.2392408246915596,
      "learning_rate": 2.8573066511799153e-05,
      "loss": 1.1996,
      "num_input_tokens_seen": 40477541120,
      "step": 51448
    },
    {
      "epoch": 5.458200721408869,
      "grad_norm": 0.555623279261026,
      "learning_rate": 2.8572378676245566e-05,
      "loss": 1.0881,
      "num_input_tokens_seen": 40478327904,
      "step": 51449
    },
    {
      "epoch": 5.45830681094844,
      "grad_norm": 1.0514334878553324,
      "learning_rate": 2.8571690837931353e-05,
      "loss": 1.1271,
      "num_input_tokens_seen": 40479114640,
      "step": 51450
    },
    {
      "epoch": 5.458412900488012,
      "grad_norm": 0.6977183778302678,
      "learning_rate": 2.8571002996857036e-05,
      "loss": 1.2532,
      "num_input_tokens_seen": 40479901280,
      "step": 51451
    },
    {
      "epoch": 5.458518990027583,
      "grad_norm": 0.6063633531613724,
      "learning_rate": 2.8570315153023164e-05,
      "loss": 1.0962,
      "num_input_tokens_seen": 40480688144,
      "step": 51452
    },
    {
      "epoch": 5.458625079567154,
      "grad_norm": 0.7498489949595103,
      "learning_rate": 2.856962730643025e-05,
      "loss": 1.1403,
      "num_input_tokens_seen": 40481474832,
      "step": 51453
    },
    {
      "epoch": 5.458731169106726,
      "grad_norm": 0.8259673404081926,
      "learning_rate": 2.8568939457078836e-05,
      "loss": 1.2551,
      "num_input_tokens_seen": 40482261632,
      "step": 51454
    },
    {
      "epoch": 5.458837258646297,
      "grad_norm": 0.5754923656634784,
      "learning_rate": 2.856825160496945e-05,
      "loss": 1.1492,
      "num_input_tokens_seen": 40483048432,
      "step": 51455
    },
    {
      "epoch": 5.458943348185869,
      "grad_norm": 0.6107374681102575,
      "learning_rate": 2.8567563750102623e-05,
      "loss": 1.1386,
      "num_input_tokens_seen": 40483835184,
      "step": 51456
    },
    {
      "epoch": 5.45904943772544,
      "grad_norm": 0.6006333203678184,
      "learning_rate": 2.8566875892478885e-05,
      "loss": 1.0899,
      "num_input_tokens_seen": 40484621936,
      "step": 51457
    },
    {
      "epoch": 5.459155527265012,
      "grad_norm": 0.5744285951225581,
      "learning_rate": 2.8566188032098772e-05,
      "loss": 1.1511,
      "num_input_tokens_seen": 40485408672,
      "step": 51458
    },
    {
      "epoch": 5.459261616804583,
      "grad_norm": 0.7271469500881479,
      "learning_rate": 2.8565500168962818e-05,
      "loss": 1.1416,
      "num_input_tokens_seen": 40486195440,
      "step": 51459
    },
    {
      "epoch": 5.459367706344154,
      "grad_norm": 0.6491630245468633,
      "learning_rate": 2.8564812303071537e-05,
      "loss": 1.1555,
      "num_input_tokens_seen": 40486982192,
      "step": 51460
    },
    {
      "epoch": 5.459473795883726,
      "grad_norm": 0.5708430225941169,
      "learning_rate": 2.8564124434425488e-05,
      "loss": 1.2284,
      "num_input_tokens_seen": 40487768960,
      "step": 51461
    },
    {
      "epoch": 5.459579885423297,
      "grad_norm": 0.939660134037394,
      "learning_rate": 2.8563436563025175e-05,
      "loss": 1.1448,
      "num_input_tokens_seen": 40488555728,
      "step": 51462
    },
    {
      "epoch": 5.459685974962869,
      "grad_norm": 0.5603006368301253,
      "learning_rate": 2.8562748688871155e-05,
      "loss": 1.1205,
      "num_input_tokens_seen": 40489342496,
      "step": 51463
    },
    {
      "epoch": 5.45979206450244,
      "grad_norm": 0.8151029824956032,
      "learning_rate": 2.8562060811963943e-05,
      "loss": 1.3298,
      "num_input_tokens_seen": 40490129232,
      "step": 51464
    },
    {
      "epoch": 5.459898154042011,
      "grad_norm": 0.6962531543120234,
      "learning_rate": 2.856137293230407e-05,
      "loss": 1.1348,
      "num_input_tokens_seen": 40490915968,
      "step": 51465
    },
    {
      "epoch": 5.460004243581583,
      "grad_norm": 0.6613833417838663,
      "learning_rate": 2.856068504989208e-05,
      "loss": 1.1659,
      "num_input_tokens_seen": 40491702768,
      "step": 51466
    },
    {
      "epoch": 5.460110333121154,
      "grad_norm": 0.5815960241086378,
      "learning_rate": 2.855999716472849e-05,
      "loss": 1.0661,
      "num_input_tokens_seen": 40492489584,
      "step": 51467
    },
    {
      "epoch": 5.460216422660726,
      "grad_norm": 0.6910365827708833,
      "learning_rate": 2.8559309276813844e-05,
      "loss": 1.2219,
      "num_input_tokens_seen": 40493276224,
      "step": 51468
    },
    {
      "epoch": 5.460322512200297,
      "grad_norm": 0.9064459911193415,
      "learning_rate": 2.8558621386148665e-05,
      "loss": 1.0995,
      "num_input_tokens_seen": 40494062992,
      "step": 51469
    },
    {
      "epoch": 5.460428601739869,
      "grad_norm": 0.6233664871036549,
      "learning_rate": 2.8557933492733496e-05,
      "loss": 1.1488,
      "num_input_tokens_seen": 40494849680,
      "step": 51470
    },
    {
      "epoch": 5.46053469127944,
      "grad_norm": 0.6740929750180106,
      "learning_rate": 2.855724559656885e-05,
      "loss": 1.1206,
      "num_input_tokens_seen": 40495636432,
      "step": 51471
    },
    {
      "epoch": 5.460640780819011,
      "grad_norm": 0.5892230906306436,
      "learning_rate": 2.8556557697655274e-05,
      "loss": 1.0895,
      "num_input_tokens_seen": 40496423200,
      "step": 51472
    },
    {
      "epoch": 5.460746870358583,
      "grad_norm": 0.896970755036721,
      "learning_rate": 2.8555869795993294e-05,
      "loss": 1.2098,
      "num_input_tokens_seen": 40497209872,
      "step": 51473
    },
    {
      "epoch": 5.460852959898154,
      "grad_norm": 0.6421889657553311,
      "learning_rate": 2.8555181891583437e-05,
      "loss": 1.0812,
      "num_input_tokens_seen": 40497996608,
      "step": 51474
    },
    {
      "epoch": 5.460959049437726,
      "grad_norm": 0.8186108289923678,
      "learning_rate": 2.8554493984426245e-05,
      "loss": 1.3324,
      "num_input_tokens_seen": 40498783360,
      "step": 51475
    },
    {
      "epoch": 5.461065138977297,
      "grad_norm": 0.9200028390552246,
      "learning_rate": 2.855380607452225e-05,
      "loss": 1.1958,
      "num_input_tokens_seen": 40499570128,
      "step": 51476
    },
    {
      "epoch": 5.461171228516868,
      "grad_norm": 0.7008545225522106,
      "learning_rate": 2.8553118161871966e-05,
      "loss": 1.0853,
      "num_input_tokens_seen": 40500356992,
      "step": 51477
    },
    {
      "epoch": 5.46127731805644,
      "grad_norm": 0.6973763706536628,
      "learning_rate": 2.855243024647595e-05,
      "loss": 1.1583,
      "num_input_tokens_seen": 40501143856,
      "step": 51478
    },
    {
      "epoch": 5.461383407596011,
      "grad_norm": 0.9587299008490863,
      "learning_rate": 2.85517423283347e-05,
      "loss": 1.1942,
      "num_input_tokens_seen": 40501930544,
      "step": 51479
    },
    {
      "epoch": 5.461489497135583,
      "grad_norm": 0.6258068263286927,
      "learning_rate": 2.8551054407448786e-05,
      "loss": 1.1639,
      "num_input_tokens_seen": 40502717424,
      "step": 51480
    },
    {
      "epoch": 5.461595586675154,
      "grad_norm": 0.6587581752786555,
      "learning_rate": 2.8550366483818718e-05,
      "loss": 1.1581,
      "num_input_tokens_seen": 40503504224,
      "step": 51481
    },
    {
      "epoch": 5.461701676214725,
      "grad_norm": 0.7338269009399091,
      "learning_rate": 2.8549678557445026e-05,
      "loss": 1.1446,
      "num_input_tokens_seen": 40504290960,
      "step": 51482
    },
    {
      "epoch": 5.461807765754297,
      "grad_norm": 0.5865058942257906,
      "learning_rate": 2.8548990628328247e-05,
      "loss": 1.2751,
      "num_input_tokens_seen": 40505077728,
      "step": 51483
    },
    {
      "epoch": 5.461913855293868,
      "grad_norm": 0.6754631304443514,
      "learning_rate": 2.8548302696468922e-05,
      "loss": 1.3714,
      "num_input_tokens_seen": 40505864464,
      "step": 51484
    },
    {
      "epoch": 5.46201994483344,
      "grad_norm": 1.0676295071792103,
      "learning_rate": 2.8547614761867558e-05,
      "loss": 1.1108,
      "num_input_tokens_seen": 40506651168,
      "step": 51485
    },
    {
      "epoch": 5.462126034373011,
      "grad_norm": 0.6932791073739463,
      "learning_rate": 2.854692682452471e-05,
      "loss": 1.1097,
      "num_input_tokens_seen": 40507437968,
      "step": 51486
    },
    {
      "epoch": 5.462232123912583,
      "grad_norm": 0.7425418344153211,
      "learning_rate": 2.8546238884440902e-05,
      "loss": 1.1201,
      "num_input_tokens_seen": 40508224784,
      "step": 51487
    },
    {
      "epoch": 5.462338213452154,
      "grad_norm": 0.8081818537208938,
      "learning_rate": 2.8545550941616654e-05,
      "loss": 1.0725,
      "num_input_tokens_seen": 40509011488,
      "step": 51488
    },
    {
      "epoch": 5.462444302991725,
      "grad_norm": 0.6607819792256117,
      "learning_rate": 2.8544862996052525e-05,
      "loss": 1.1661,
      "num_input_tokens_seen": 40509798176,
      "step": 51489
    },
    {
      "epoch": 5.462550392531297,
      "grad_norm": 0.6549929028287684,
      "learning_rate": 2.8544175047749018e-05,
      "loss": 1.1365,
      "num_input_tokens_seen": 40510584976,
      "step": 51490
    },
    {
      "epoch": 5.462656482070868,
      "grad_norm": 0.7031909225965002,
      "learning_rate": 2.854348709670668e-05,
      "loss": 1.1593,
      "num_input_tokens_seen": 40511371712,
      "step": 51491
    },
    {
      "epoch": 5.4627625716104395,
      "grad_norm": 0.6279800527537011,
      "learning_rate": 2.8542799142926037e-05,
      "loss": 1.2344,
      "num_input_tokens_seen": 40512158400,
      "step": 51492
    },
    {
      "epoch": 5.462868661150011,
      "grad_norm": 0.6714032797039603,
      "learning_rate": 2.8542111186407627e-05,
      "loss": 1.2238,
      "num_input_tokens_seen": 40512945184,
      "step": 51493
    },
    {
      "epoch": 5.462974750689582,
      "grad_norm": 0.716275487860733,
      "learning_rate": 2.8541423227151963e-05,
      "loss": 1.1462,
      "num_input_tokens_seen": 40513732000,
      "step": 51494
    },
    {
      "epoch": 5.4630808402291535,
      "grad_norm": 0.6188713022927909,
      "learning_rate": 2.8540735265159607e-05,
      "loss": 1.2564,
      "num_input_tokens_seen": 40514518688,
      "step": 51495
    },
    {
      "epoch": 5.4631869297687246,
      "grad_norm": 0.753962990563061,
      "learning_rate": 2.8540047300431073e-05,
      "loss": 1.0922,
      "num_input_tokens_seen": 40515305536,
      "step": 51496
    },
    {
      "epoch": 5.4632930193082965,
      "grad_norm": 0.5963023952643798,
      "learning_rate": 2.8539359332966887e-05,
      "loss": 1.0438,
      "num_input_tokens_seen": 40516092384,
      "step": 51497
    },
    {
      "epoch": 5.4633991088478675,
      "grad_norm": 0.6181498149831851,
      "learning_rate": 2.85386713627676e-05,
      "loss": 1.1655,
      "num_input_tokens_seen": 40516879184,
      "step": 51498
    },
    {
      "epoch": 5.463505198387439,
      "grad_norm": 0.6382025863999062,
      "learning_rate": 2.853798338983372e-05,
      "loss": 1.2229,
      "num_input_tokens_seen": 40517666016,
      "step": 51499
    },
    {
      "epoch": 5.4636112879270105,
      "grad_norm": 0.7101282541951434,
      "learning_rate": 2.8537295414165794e-05,
      "loss": 1.2514,
      "num_input_tokens_seen": 40518452784,
      "step": 51500
    },
    {
      "epoch": 5.4637173774665815,
      "grad_norm": 0.6038950294531855,
      "learning_rate": 2.853660743576435e-05,
      "loss": 1.2777,
      "num_input_tokens_seen": 40519239472,
      "step": 51501
    },
    {
      "epoch": 5.463823467006153,
      "grad_norm": 0.5781382105853052,
      "learning_rate": 2.8535919454629923e-05,
      "loss": 1.1273,
      "num_input_tokens_seen": 40520026256,
      "step": 51502
    },
    {
      "epoch": 5.463929556545724,
      "grad_norm": 0.6737426610762809,
      "learning_rate": 2.8535231470763035e-05,
      "loss": 1.1742,
      "num_input_tokens_seen": 40520813088,
      "step": 51503
    },
    {
      "epoch": 5.464035646085296,
      "grad_norm": 0.6326442299323082,
      "learning_rate": 2.8534543484164233e-05,
      "loss": 1.164,
      "num_input_tokens_seen": 40521599856,
      "step": 51504
    },
    {
      "epoch": 5.464141735624867,
      "grad_norm": 0.7226037280718046,
      "learning_rate": 2.8533855494834034e-05,
      "loss": 1.2253,
      "num_input_tokens_seen": 40522386640,
      "step": 51505
    },
    {
      "epoch": 5.464247825164438,
      "grad_norm": 0.8860374581885179,
      "learning_rate": 2.8533167502772973e-05,
      "loss": 1.2716,
      "num_input_tokens_seen": 40523173424,
      "step": 51506
    },
    {
      "epoch": 5.46435391470401,
      "grad_norm": 0.5811190460184982,
      "learning_rate": 2.8532479507981587e-05,
      "loss": 1.0702,
      "num_input_tokens_seen": 40523960224,
      "step": 51507
    },
    {
      "epoch": 5.464460004243581,
      "grad_norm": 0.8624483496344652,
      "learning_rate": 2.85317915104604e-05,
      "loss": 1.1393,
      "num_input_tokens_seen": 40524746992,
      "step": 51508
    },
    {
      "epoch": 5.464566093783153,
      "grad_norm": 0.8079829852405083,
      "learning_rate": 2.853110351020995e-05,
      "loss": 1.3035,
      "num_input_tokens_seen": 40525533696,
      "step": 51509
    },
    {
      "epoch": 5.464672183322724,
      "grad_norm": 0.8567047131331068,
      "learning_rate": 2.8530415507230774e-05,
      "loss": 1.1723,
      "num_input_tokens_seen": 40526320512,
      "step": 51510
    },
    {
      "epoch": 5.464778272862295,
      "grad_norm": 0.6093157943664707,
      "learning_rate": 2.8529727501523383e-05,
      "loss": 1.1653,
      "num_input_tokens_seen": 40527107264,
      "step": 51511
    },
    {
      "epoch": 5.464884362401867,
      "grad_norm": 0.6034282693628202,
      "learning_rate": 2.8529039493088332e-05,
      "loss": 1.16,
      "num_input_tokens_seen": 40527893952,
      "step": 51512
    },
    {
      "epoch": 5.464990451941438,
      "grad_norm": 0.6448680475228872,
      "learning_rate": 2.8528351481926147e-05,
      "loss": 1.1552,
      "num_input_tokens_seen": 40528680688,
      "step": 51513
    },
    {
      "epoch": 5.46509654148101,
      "grad_norm": 0.7182002808949567,
      "learning_rate": 2.8527663468037342e-05,
      "loss": 1.2225,
      "num_input_tokens_seen": 40529467504,
      "step": 51514
    },
    {
      "epoch": 5.465202631020581,
      "grad_norm": 0.6572411542232145,
      "learning_rate": 2.852697545142247e-05,
      "loss": 1.1715,
      "num_input_tokens_seen": 40530254272,
      "step": 51515
    },
    {
      "epoch": 5.465308720560153,
      "grad_norm": 0.7230668691488535,
      "learning_rate": 2.852628743208206e-05,
      "loss": 1.1761,
      "num_input_tokens_seen": 40531040944,
      "step": 51516
    },
    {
      "epoch": 5.465414810099724,
      "grad_norm": 0.635288922132355,
      "learning_rate": 2.852559941001663e-05,
      "loss": 1.0871,
      "num_input_tokens_seen": 40531827744,
      "step": 51517
    },
    {
      "epoch": 5.465520899639295,
      "grad_norm": 1.0411619638593477,
      "learning_rate": 2.852491138522672e-05,
      "loss": 1.2167,
      "num_input_tokens_seen": 40532614496,
      "step": 51518
    },
    {
      "epoch": 5.465626989178867,
      "grad_norm": 0.6554178359343039,
      "learning_rate": 2.852422335771287e-05,
      "loss": 1.2184,
      "num_input_tokens_seen": 40533401248,
      "step": 51519
    },
    {
      "epoch": 5.465733078718438,
      "grad_norm": 1.1665341220930148,
      "learning_rate": 2.8523535327475593e-05,
      "loss": 1.1581,
      "num_input_tokens_seen": 40534188000,
      "step": 51520
    },
    {
      "epoch": 5.46583916825801,
      "grad_norm": 0.7424946613642147,
      "learning_rate": 2.8522847294515442e-05,
      "loss": 1.2648,
      "num_input_tokens_seen": 40534974768,
      "step": 51521
    },
    {
      "epoch": 5.465945257797581,
      "grad_norm": 0.9496957049285333,
      "learning_rate": 2.8522159258832927e-05,
      "loss": 1.175,
      "num_input_tokens_seen": 40535761456,
      "step": 51522
    },
    {
      "epoch": 5.466051347337152,
      "grad_norm": 0.6798091655175093,
      "learning_rate": 2.8521471220428597e-05,
      "loss": 1.1125,
      "num_input_tokens_seen": 40536548128,
      "step": 51523
    },
    {
      "epoch": 5.466157436876724,
      "grad_norm": 0.7284033910702338,
      "learning_rate": 2.852078317930298e-05,
      "loss": 1.0986,
      "num_input_tokens_seen": 40537334880,
      "step": 51524
    },
    {
      "epoch": 5.466263526416295,
      "grad_norm": 1.0720928985349,
      "learning_rate": 2.85200951354566e-05,
      "loss": 1.1727,
      "num_input_tokens_seen": 40538121760,
      "step": 51525
    },
    {
      "epoch": 5.466369615955867,
      "grad_norm": 0.6323225076515475,
      "learning_rate": 2.8519407088889998e-05,
      "loss": 1.1399,
      "num_input_tokens_seen": 40538908480,
      "step": 51526
    },
    {
      "epoch": 5.466475705495438,
      "grad_norm": 1.0118686001817554,
      "learning_rate": 2.8518719039603697e-05,
      "loss": 1.2117,
      "num_input_tokens_seen": 40539695168,
      "step": 51527
    },
    {
      "epoch": 5.46658179503501,
      "grad_norm": 0.6342788712321356,
      "learning_rate": 2.8518030987598233e-05,
      "loss": 1.1542,
      "num_input_tokens_seen": 40540481936,
      "step": 51528
    },
    {
      "epoch": 5.466687884574581,
      "grad_norm": 0.6669845903608884,
      "learning_rate": 2.8517342932874143e-05,
      "loss": 1.1089,
      "num_input_tokens_seen": 40541268672,
      "step": 51529
    },
    {
      "epoch": 5.466793974114152,
      "grad_norm": 0.9245220986154233,
      "learning_rate": 2.8516654875431955e-05,
      "loss": 1.1699,
      "num_input_tokens_seen": 40542055344,
      "step": 51530
    },
    {
      "epoch": 5.466900063653724,
      "grad_norm": 0.6733225656139576,
      "learning_rate": 2.851596681527219e-05,
      "loss": 1.1767,
      "num_input_tokens_seen": 40542842112,
      "step": 51531
    },
    {
      "epoch": 5.467006153193295,
      "grad_norm": 0.8788893618263063,
      "learning_rate": 2.8515278752395397e-05,
      "loss": 1.2367,
      "num_input_tokens_seen": 40543628976,
      "step": 51532
    },
    {
      "epoch": 5.467112242732867,
      "grad_norm": 0.7271351417043389,
      "learning_rate": 2.8514590686802095e-05,
      "loss": 1.118,
      "num_input_tokens_seen": 40544415712,
      "step": 51533
    },
    {
      "epoch": 5.467218332272438,
      "grad_norm": 0.7218768869250823,
      "learning_rate": 2.8513902618492823e-05,
      "loss": 1.2261,
      "num_input_tokens_seen": 40545202368,
      "step": 51534
    },
    {
      "epoch": 5.467324421812009,
      "grad_norm": 0.5893257051644719,
      "learning_rate": 2.851321454746811e-05,
      "loss": 1.1968,
      "num_input_tokens_seen": 40545989056,
      "step": 51535
    },
    {
      "epoch": 5.467430511351581,
      "grad_norm": 0.8476998172006401,
      "learning_rate": 2.851252647372849e-05,
      "loss": 1.0706,
      "num_input_tokens_seen": 40546775920,
      "step": 51536
    },
    {
      "epoch": 5.467536600891152,
      "grad_norm": 0.8842566956221702,
      "learning_rate": 2.8511838397274482e-05,
      "loss": 1.1595,
      "num_input_tokens_seen": 40547562640,
      "step": 51537
    },
    {
      "epoch": 5.467642690430724,
      "grad_norm": 0.9299038466817721,
      "learning_rate": 2.8511150318106637e-05,
      "loss": 1.1667,
      "num_input_tokens_seen": 40548349392,
      "step": 51538
    },
    {
      "epoch": 5.467748779970295,
      "grad_norm": 0.8188185846839788,
      "learning_rate": 2.851046223622548e-05,
      "loss": 1.2556,
      "num_input_tokens_seen": 40549136160,
      "step": 51539
    },
    {
      "epoch": 5.467854869509866,
      "grad_norm": 0.5836032572235668,
      "learning_rate": 2.8509774151631537e-05,
      "loss": 1.0821,
      "num_input_tokens_seen": 40549922928,
      "step": 51540
    },
    {
      "epoch": 5.467960959049438,
      "grad_norm": 0.7829420394196934,
      "learning_rate": 2.8509086064325345e-05,
      "loss": 1.2222,
      "num_input_tokens_seen": 40550709648,
      "step": 51541
    },
    {
      "epoch": 5.468067048589009,
      "grad_norm": 0.8602549988399861,
      "learning_rate": 2.850839797430743e-05,
      "loss": 1.1746,
      "num_input_tokens_seen": 40551496384,
      "step": 51542
    },
    {
      "epoch": 5.468173138128581,
      "grad_norm": 0.6260464626779059,
      "learning_rate": 2.850770988157833e-05,
      "loss": 1.2019,
      "num_input_tokens_seen": 40552283184,
      "step": 51543
    },
    {
      "epoch": 5.468279227668152,
      "grad_norm": 0.6354927811997249,
      "learning_rate": 2.8507021786138577e-05,
      "loss": 1.1557,
      "num_input_tokens_seen": 40553069904,
      "step": 51544
    },
    {
      "epoch": 5.468385317207724,
      "grad_norm": 0.7374204092885228,
      "learning_rate": 2.8506333687988707e-05,
      "loss": 1.1113,
      "num_input_tokens_seen": 40553856640,
      "step": 51545
    },
    {
      "epoch": 5.468491406747295,
      "grad_norm": 0.727073144379736,
      "learning_rate": 2.8505645587129232e-05,
      "loss": 1.1742,
      "num_input_tokens_seen": 40554643488,
      "step": 51546
    },
    {
      "epoch": 5.468597496286866,
      "grad_norm": 0.6948144501201907,
      "learning_rate": 2.8504957483560703e-05,
      "loss": 1.1317,
      "num_input_tokens_seen": 40555430208,
      "step": 51547
    },
    {
      "epoch": 5.468703585826438,
      "grad_norm": 0.9606340870033423,
      "learning_rate": 2.850426937728365e-05,
      "loss": 1.1818,
      "num_input_tokens_seen": 40556216960,
      "step": 51548
    },
    {
      "epoch": 5.468809675366009,
      "grad_norm": 0.6374402762931256,
      "learning_rate": 2.850358126829859e-05,
      "loss": 1.2255,
      "num_input_tokens_seen": 40557003856,
      "step": 51549
    },
    {
      "epoch": 5.468915764905581,
      "grad_norm": 0.8757036714946184,
      "learning_rate": 2.8502893156606074e-05,
      "loss": 1.2275,
      "num_input_tokens_seen": 40557790672,
      "step": 51550
    },
    {
      "epoch": 5.469021854445152,
      "grad_norm": 0.7233377641477832,
      "learning_rate": 2.850220504220662e-05,
      "loss": 1.2056,
      "num_input_tokens_seen": 40558577520,
      "step": 51551
    },
    {
      "epoch": 5.469127943984724,
      "grad_norm": 0.6442273866449066,
      "learning_rate": 2.8501516925100767e-05,
      "loss": 1.1525,
      "num_input_tokens_seen": 40559364192,
      "step": 51552
    },
    {
      "epoch": 5.469234033524295,
      "grad_norm": 0.9468479078870955,
      "learning_rate": 2.850082880528905e-05,
      "loss": 1.1466,
      "num_input_tokens_seen": 40560150960,
      "step": 51553
    },
    {
      "epoch": 5.469340123063866,
      "grad_norm": 1.0426662750407487,
      "learning_rate": 2.8500140682771986e-05,
      "loss": 1.1935,
      "num_input_tokens_seen": 40560937728,
      "step": 51554
    },
    {
      "epoch": 5.4694462126034376,
      "grad_norm": 1.0290740239549228,
      "learning_rate": 2.8499452557550123e-05,
      "loss": 1.1887,
      "num_input_tokens_seen": 40561724448,
      "step": 51555
    },
    {
      "epoch": 5.469552302143009,
      "grad_norm": 1.1693184026311418,
      "learning_rate": 2.849876442962398e-05,
      "loss": 1.1193,
      "num_input_tokens_seen": 40562511168,
      "step": 51556
    },
    {
      "epoch": 5.4696583916825805,
      "grad_norm": 0.6388659521035146,
      "learning_rate": 2.8498076298994097e-05,
      "loss": 1.1512,
      "num_input_tokens_seen": 40563297984,
      "step": 51557
    },
    {
      "epoch": 5.4697644812221515,
      "grad_norm": 0.7946531654435969,
      "learning_rate": 2.8497388165661003e-05,
      "loss": 1.1503,
      "num_input_tokens_seen": 40564084704,
      "step": 51558
    },
    {
      "epoch": 5.469870570761723,
      "grad_norm": 0.7598880121739159,
      "learning_rate": 2.8496700029625233e-05,
      "loss": 1.2201,
      "num_input_tokens_seen": 40564871472,
      "step": 51559
    },
    {
      "epoch": 5.4699766603012945,
      "grad_norm": 0.6605024885065334,
      "learning_rate": 2.849601189088731e-05,
      "loss": 1.2023,
      "num_input_tokens_seen": 40565658208,
      "step": 51560
    },
    {
      "epoch": 5.4700827498408655,
      "grad_norm": 0.6393158328772395,
      "learning_rate": 2.8495323749447777e-05,
      "loss": 1.0597,
      "num_input_tokens_seen": 40566444928,
      "step": 51561
    },
    {
      "epoch": 5.470188839380437,
      "grad_norm": 0.8718080943165964,
      "learning_rate": 2.8494635605307158e-05,
      "loss": 1.1804,
      "num_input_tokens_seen": 40567231600,
      "step": 51562
    },
    {
      "epoch": 5.4702949289200085,
      "grad_norm": 0.6363053127225785,
      "learning_rate": 2.8493947458465985e-05,
      "loss": 1.1839,
      "num_input_tokens_seen": 40568018352,
      "step": 51563
    },
    {
      "epoch": 5.4704010184595795,
      "grad_norm": 0.7048283179309581,
      "learning_rate": 2.8493259308924796e-05,
      "loss": 1.2271,
      "num_input_tokens_seen": 40568805152,
      "step": 51564
    },
    {
      "epoch": 5.470507107999151,
      "grad_norm": 1.0989345422662062,
      "learning_rate": 2.849257115668411e-05,
      "loss": 1.1018,
      "num_input_tokens_seen": 40569591936,
      "step": 51565
    },
    {
      "epoch": 5.470613197538722,
      "grad_norm": 0.6456302867718317,
      "learning_rate": 2.849188300174448e-05,
      "loss": 1.084,
      "num_input_tokens_seen": 40570378656,
      "step": 51566
    },
    {
      "epoch": 5.470719287078294,
      "grad_norm": 0.6797402195452666,
      "learning_rate": 2.849119484410642e-05,
      "loss": 1.1527,
      "num_input_tokens_seen": 40571165392,
      "step": 51567
    },
    {
      "epoch": 5.470825376617865,
      "grad_norm": 0.8428829239162763,
      "learning_rate": 2.849050668377046e-05,
      "loss": 1.2058,
      "num_input_tokens_seen": 40571952128,
      "step": 51568
    },
    {
      "epoch": 5.470931466157436,
      "grad_norm": 1.0325952319412046,
      "learning_rate": 2.8489818520737156e-05,
      "loss": 1.181,
      "num_input_tokens_seen": 40572738848,
      "step": 51569
    },
    {
      "epoch": 5.471037555697008,
      "grad_norm": 0.6658023912573972,
      "learning_rate": 2.848913035500701e-05,
      "loss": 1.1245,
      "num_input_tokens_seen": 40573525616,
      "step": 51570
    },
    {
      "epoch": 5.471143645236579,
      "grad_norm": 0.7755597403810239,
      "learning_rate": 2.8488442186580567e-05,
      "loss": 1.1905,
      "num_input_tokens_seen": 40574312432,
      "step": 51571
    },
    {
      "epoch": 5.471249734776151,
      "grad_norm": 0.8201542602606806,
      "learning_rate": 2.848775401545836e-05,
      "loss": 1.2588,
      "num_input_tokens_seen": 40575099120,
      "step": 51572
    },
    {
      "epoch": 5.471355824315722,
      "grad_norm": 0.5282157324273753,
      "learning_rate": 2.848706584164092e-05,
      "loss": 1.0839,
      "num_input_tokens_seen": 40575885920,
      "step": 51573
    },
    {
      "epoch": 5.471461913855294,
      "grad_norm": 0.9402680766157523,
      "learning_rate": 2.8486377665128772e-05,
      "loss": 1.1864,
      "num_input_tokens_seen": 40576672640,
      "step": 51574
    },
    {
      "epoch": 5.471568003394865,
      "grad_norm": 0.8856085860600079,
      "learning_rate": 2.8485689485922463e-05,
      "loss": 1.0919,
      "num_input_tokens_seen": 40577459328,
      "step": 51575
    },
    {
      "epoch": 5.471674092934436,
      "grad_norm": 0.7663328777240811,
      "learning_rate": 2.8485001304022512e-05,
      "loss": 1.252,
      "num_input_tokens_seen": 40578246096,
      "step": 51576
    },
    {
      "epoch": 5.471780182474008,
      "grad_norm": 0.9750420577661102,
      "learning_rate": 2.848431311942945e-05,
      "loss": 1.1835,
      "num_input_tokens_seen": 40579032864,
      "step": 51577
    },
    {
      "epoch": 5.471886272013579,
      "grad_norm": 0.7730682255143692,
      "learning_rate": 2.8483624932143816e-05,
      "loss": 1.1398,
      "num_input_tokens_seen": 40579819680,
      "step": 51578
    },
    {
      "epoch": 5.471992361553151,
      "grad_norm": 0.5908497491335893,
      "learning_rate": 2.8482936742166145e-05,
      "loss": 1.168,
      "num_input_tokens_seen": 40580606416,
      "step": 51579
    },
    {
      "epoch": 5.472098451092722,
      "grad_norm": 1.1803362061108886,
      "learning_rate": 2.8482248549496952e-05,
      "loss": 1.1851,
      "num_input_tokens_seen": 40581393184,
      "step": 51580
    },
    {
      "epoch": 5.472204540632294,
      "grad_norm": 0.8916234331795647,
      "learning_rate": 2.8481560354136783e-05,
      "loss": 1.2087,
      "num_input_tokens_seen": 40582179856,
      "step": 51581
    },
    {
      "epoch": 5.472310630171865,
      "grad_norm": 0.6746208536608412,
      "learning_rate": 2.848087215608617e-05,
      "loss": 1.1487,
      "num_input_tokens_seen": 40582966624,
      "step": 51582
    },
    {
      "epoch": 5.472416719711436,
      "grad_norm": 0.9463203712685787,
      "learning_rate": 2.8480183955345634e-05,
      "loss": 1.2129,
      "num_input_tokens_seen": 40583753392,
      "step": 51583
    },
    {
      "epoch": 5.472522809251008,
      "grad_norm": 1.4531300971479066,
      "learning_rate": 2.8479495751915725e-05,
      "loss": 1.1724,
      "num_input_tokens_seen": 40584540240,
      "step": 51584
    },
    {
      "epoch": 5.472628898790579,
      "grad_norm": 0.9795436830541162,
      "learning_rate": 2.8478807545796954e-05,
      "loss": 1.2339,
      "num_input_tokens_seen": 40585327040,
      "step": 51585
    },
    {
      "epoch": 5.472734988330151,
      "grad_norm": 1.1842928877618297,
      "learning_rate": 2.8478119336989866e-05,
      "loss": 1.1414,
      "num_input_tokens_seen": 40586113808,
      "step": 51586
    },
    {
      "epoch": 5.472841077869722,
      "grad_norm": 1.3196113884367948,
      "learning_rate": 2.847743112549499e-05,
      "loss": 1.1064,
      "num_input_tokens_seen": 40586900560,
      "step": 51587
    },
    {
      "epoch": 5.472947167409293,
      "grad_norm": 1.3637301605793848,
      "learning_rate": 2.8476742911312854e-05,
      "loss": 1.158,
      "num_input_tokens_seen": 40587687328,
      "step": 51588
    },
    {
      "epoch": 5.473053256948865,
      "grad_norm": 0.6974574622108412,
      "learning_rate": 2.8476054694443998e-05,
      "loss": 1.1669,
      "num_input_tokens_seen": 40588474000,
      "step": 51589
    },
    {
      "epoch": 5.473159346488436,
      "grad_norm": 1.1767847573715016,
      "learning_rate": 2.8475366474888943e-05,
      "loss": 1.2299,
      "num_input_tokens_seen": 40589260768,
      "step": 51590
    },
    {
      "epoch": 5.473265436028008,
      "grad_norm": 1.0261591814645705,
      "learning_rate": 2.8474678252648234e-05,
      "loss": 1.1901,
      "num_input_tokens_seen": 40590047472,
      "step": 51591
    },
    {
      "epoch": 5.473371525567579,
      "grad_norm": 0.9312611990323818,
      "learning_rate": 2.8473990027722387e-05,
      "loss": 1.1717,
      "num_input_tokens_seen": 40590834208,
      "step": 51592
    },
    {
      "epoch": 5.47347761510715,
      "grad_norm": 0.913028168232206,
      "learning_rate": 2.847330180011195e-05,
      "loss": 1.0934,
      "num_input_tokens_seen": 40591620896,
      "step": 51593
    },
    {
      "epoch": 5.473583704646722,
      "grad_norm": 1.2444954597858238,
      "learning_rate": 2.8472613569817442e-05,
      "loss": 1.2369,
      "num_input_tokens_seen": 40592407664,
      "step": 51594
    },
    {
      "epoch": 5.473689794186293,
      "grad_norm": 1.1287832887804963,
      "learning_rate": 2.8471925336839405e-05,
      "loss": 1.2464,
      "num_input_tokens_seen": 40593194352,
      "step": 51595
    },
    {
      "epoch": 5.473795883725865,
      "grad_norm": 0.9037557870036231,
      "learning_rate": 2.8471237101178367e-05,
      "loss": 1.1848,
      "num_input_tokens_seen": 40593981024,
      "step": 51596
    },
    {
      "epoch": 5.473901973265436,
      "grad_norm": 1.0242707601767937,
      "learning_rate": 2.847054886283485e-05,
      "loss": 1.0482,
      "num_input_tokens_seen": 40594767792,
      "step": 51597
    },
    {
      "epoch": 5.474008062805007,
      "grad_norm": 0.8771581690885257,
      "learning_rate": 2.84698606218094e-05,
      "loss": 1.1708,
      "num_input_tokens_seen": 40595554576,
      "step": 51598
    },
    {
      "epoch": 5.474114152344579,
      "grad_norm": 0.6362863156307804,
      "learning_rate": 2.846917237810255e-05,
      "loss": 1.1827,
      "num_input_tokens_seen": 40596341392,
      "step": 51599
    },
    {
      "epoch": 5.47422024188415,
      "grad_norm": 0.7744477610001682,
      "learning_rate": 2.8468484131714812e-05,
      "loss": 1.1274,
      "num_input_tokens_seen": 40597128208,
      "step": 51600
    },
    {
      "epoch": 5.474326331423722,
      "grad_norm": 0.7805555941333389,
      "learning_rate": 2.846779588264674e-05,
      "loss": 1.1611,
      "num_input_tokens_seen": 40597914960,
      "step": 51601
    },
    {
      "epoch": 5.474432420963293,
      "grad_norm": 0.6758642354236337,
      "learning_rate": 2.846710763089886e-05,
      "loss": 1.2215,
      "num_input_tokens_seen": 40598701792,
      "step": 51602
    },
    {
      "epoch": 5.474538510502865,
      "grad_norm": 0.6839821186359173,
      "learning_rate": 2.8466419376471692e-05,
      "loss": 1.0814,
      "num_input_tokens_seen": 40599488640,
      "step": 51603
    },
    {
      "epoch": 5.474644600042436,
      "grad_norm": 0.7413963579079186,
      "learning_rate": 2.8465731119365786e-05,
      "loss": 1.1753,
      "num_input_tokens_seen": 40600275392,
      "step": 51604
    },
    {
      "epoch": 5.474750689582007,
      "grad_norm": 0.638202960093252,
      "learning_rate": 2.846504285958166e-05,
      "loss": 1.0813,
      "num_input_tokens_seen": 40601062144,
      "step": 51605
    },
    {
      "epoch": 5.474856779121579,
      "grad_norm": 0.6405026660005262,
      "learning_rate": 2.8464354597119846e-05,
      "loss": 1.2024,
      "num_input_tokens_seen": 40601848928,
      "step": 51606
    },
    {
      "epoch": 5.47496286866115,
      "grad_norm": 0.6859889649419154,
      "learning_rate": 2.8463666331980886e-05,
      "loss": 1.1448,
      "num_input_tokens_seen": 40602635696,
      "step": 51607
    },
    {
      "epoch": 5.475068958200722,
      "grad_norm": 0.6496308745079129,
      "learning_rate": 2.846297806416531e-05,
      "loss": 1.0912,
      "num_input_tokens_seen": 40603422400,
      "step": 51608
    },
    {
      "epoch": 5.475175047740293,
      "grad_norm": 0.6937746726871998,
      "learning_rate": 2.8462289793673636e-05,
      "loss": 1.1303,
      "num_input_tokens_seen": 40604209040,
      "step": 51609
    },
    {
      "epoch": 5.475281137279865,
      "grad_norm": 0.7871252966732204,
      "learning_rate": 2.8461601520506413e-05,
      "loss": 1.1359,
      "num_input_tokens_seen": 40604995840,
      "step": 51610
    },
    {
      "epoch": 5.475387226819436,
      "grad_norm": 0.590367114945461,
      "learning_rate": 2.8460913244664162e-05,
      "loss": 1.103,
      "num_input_tokens_seen": 40605782640,
      "step": 51611
    },
    {
      "epoch": 5.475493316359007,
      "grad_norm": 0.8415554682492842,
      "learning_rate": 2.8460224966147424e-05,
      "loss": 1.1854,
      "num_input_tokens_seen": 40606569376,
      "step": 51612
    },
    {
      "epoch": 5.475599405898579,
      "grad_norm": 0.6962828666296337,
      "learning_rate": 2.8459536684956723e-05,
      "loss": 1.1732,
      "num_input_tokens_seen": 40607356160,
      "step": 51613
    },
    {
      "epoch": 5.47570549543815,
      "grad_norm": 0.5656933245157694,
      "learning_rate": 2.845884840109259e-05,
      "loss": 1.1292,
      "num_input_tokens_seen": 40608143040,
      "step": 51614
    },
    {
      "epoch": 5.475811584977722,
      "grad_norm": 0.7318746580988482,
      "learning_rate": 2.8458160114555567e-05,
      "loss": 1.1665,
      "num_input_tokens_seen": 40608929840,
      "step": 51615
    },
    {
      "epoch": 5.475917674517293,
      "grad_norm": 0.7552588836867519,
      "learning_rate": 2.8457471825346177e-05,
      "loss": 1.1729,
      "num_input_tokens_seen": 40609716576,
      "step": 51616
    },
    {
      "epoch": 5.476023764056864,
      "grad_norm": 0.7976324192205478,
      "learning_rate": 2.8456783533464947e-05,
      "loss": 1.1372,
      "num_input_tokens_seen": 40610503296,
      "step": 51617
    },
    {
      "epoch": 5.476129853596436,
      "grad_norm": 0.6648135441549864,
      "learning_rate": 2.845609523891243e-05,
      "loss": 1.1772,
      "num_input_tokens_seen": 40611290080,
      "step": 51618
    },
    {
      "epoch": 5.476235943136007,
      "grad_norm": 0.8154322588172881,
      "learning_rate": 2.845540694168914e-05,
      "loss": 1.1834,
      "num_input_tokens_seen": 40612076816,
      "step": 51619
    },
    {
      "epoch": 5.4763420326755785,
      "grad_norm": 0.7008884217499464,
      "learning_rate": 2.8454718641795603e-05,
      "loss": 1.1066,
      "num_input_tokens_seen": 40612863616,
      "step": 51620
    },
    {
      "epoch": 5.4764481222151495,
      "grad_norm": 0.7348118856574968,
      "learning_rate": 2.845403033923237e-05,
      "loss": 1.096,
      "num_input_tokens_seen": 40613650384,
      "step": 51621
    },
    {
      "epoch": 5.476554211754721,
      "grad_norm": 1.189518721540726,
      "learning_rate": 2.8453342033999962e-05,
      "loss": 1.2134,
      "num_input_tokens_seen": 40614437184,
      "step": 51622
    },
    {
      "epoch": 5.4766603012942925,
      "grad_norm": 1.119552466154537,
      "learning_rate": 2.845265372609891e-05,
      "loss": 1.2334,
      "num_input_tokens_seen": 40615224048,
      "step": 51623
    },
    {
      "epoch": 5.4767663908338635,
      "grad_norm": 0.6564455191524264,
      "learning_rate": 2.845196541552975e-05,
      "loss": 1.0839,
      "num_input_tokens_seen": 40616010800,
      "step": 51624
    },
    {
      "epoch": 5.476872480373435,
      "grad_norm": 1.0082441667220456,
      "learning_rate": 2.8451277102293005e-05,
      "loss": 1.1244,
      "num_input_tokens_seen": 40616797488,
      "step": 51625
    },
    {
      "epoch": 5.4769785699130065,
      "grad_norm": 0.9843517655795041,
      "learning_rate": 2.8450588786389226e-05,
      "loss": 1.1333,
      "num_input_tokens_seen": 40617584192,
      "step": 51626
    },
    {
      "epoch": 5.477084659452578,
      "grad_norm": 0.7545409136750753,
      "learning_rate": 2.8449900467818936e-05,
      "loss": 1.1734,
      "num_input_tokens_seen": 40618370896,
      "step": 51627
    },
    {
      "epoch": 5.477190748992149,
      "grad_norm": 1.0014278837254273,
      "learning_rate": 2.8449212146582648e-05,
      "loss": 1.0823,
      "num_input_tokens_seen": 40619157696,
      "step": 51628
    },
    {
      "epoch": 5.4772968385317204,
      "grad_norm": 0.9213871862443147,
      "learning_rate": 2.8448523822680923e-05,
      "loss": 1.1324,
      "num_input_tokens_seen": 40619944448,
      "step": 51629
    },
    {
      "epoch": 5.477402928071292,
      "grad_norm": 0.7255519940874101,
      "learning_rate": 2.8447835496114276e-05,
      "loss": 1.1153,
      "num_input_tokens_seen": 40620731216,
      "step": 51630
    },
    {
      "epoch": 5.477509017610863,
      "grad_norm": 1.0696793099760113,
      "learning_rate": 2.8447147166883244e-05,
      "loss": 1.1099,
      "num_input_tokens_seen": 40621518000,
      "step": 51631
    },
    {
      "epoch": 5.477615107150435,
      "grad_norm": 0.8276178688688504,
      "learning_rate": 2.8446458834988353e-05,
      "loss": 1.1131,
      "num_input_tokens_seen": 40622304816,
      "step": 51632
    },
    {
      "epoch": 5.477721196690006,
      "grad_norm": 0.6259819234902634,
      "learning_rate": 2.8445770500430148e-05,
      "loss": 1.182,
      "num_input_tokens_seen": 40623091616,
      "step": 51633
    },
    {
      "epoch": 5.477827286229577,
      "grad_norm": 0.751256716709195,
      "learning_rate": 2.8445082163209148e-05,
      "loss": 1.1871,
      "num_input_tokens_seen": 40623878432,
      "step": 51634
    },
    {
      "epoch": 5.477933375769149,
      "grad_norm": 0.7454714299997468,
      "learning_rate": 2.8444393823325887e-05,
      "loss": 1.0819,
      "num_input_tokens_seen": 40624665232,
      "step": 51635
    },
    {
      "epoch": 5.47803946530872,
      "grad_norm": 0.5765173868216413,
      "learning_rate": 2.844370548078091e-05,
      "loss": 1.0078,
      "num_input_tokens_seen": 40625452032,
      "step": 51636
    },
    {
      "epoch": 5.478145554848292,
      "grad_norm": 0.8838678430715811,
      "learning_rate": 2.8443017135574716e-05,
      "loss": 1.176,
      "num_input_tokens_seen": 40626238864,
      "step": 51637
    },
    {
      "epoch": 5.478251644387863,
      "grad_norm": 0.6882683367077774,
      "learning_rate": 2.8442328787707878e-05,
      "loss": 1.1101,
      "num_input_tokens_seen": 40627025632,
      "step": 51638
    },
    {
      "epoch": 5.478357733927435,
      "grad_norm": 1.391325212217259,
      "learning_rate": 2.8441640437180912e-05,
      "loss": 1.2305,
      "num_input_tokens_seen": 40627812448,
      "step": 51639
    },
    {
      "epoch": 5.478463823467006,
      "grad_norm": 0.8767537090533761,
      "learning_rate": 2.844095208399433e-05,
      "loss": 1.1684,
      "num_input_tokens_seen": 40628599264,
      "step": 51640
    },
    {
      "epoch": 5.478569913006577,
      "grad_norm": 0.7912816346977094,
      "learning_rate": 2.8440263728148697e-05,
      "loss": 1.1543,
      "num_input_tokens_seen": 40629386000,
      "step": 51641
    },
    {
      "epoch": 5.478676002546149,
      "grad_norm": 1.2645983020899958,
      "learning_rate": 2.8439575369644527e-05,
      "loss": 1.2231,
      "num_input_tokens_seen": 40630172688,
      "step": 51642
    },
    {
      "epoch": 5.47878209208572,
      "grad_norm": 0.8807094599477038,
      "learning_rate": 2.843888700848235e-05,
      "loss": 1.1789,
      "num_input_tokens_seen": 40630959424,
      "step": 51643
    },
    {
      "epoch": 5.478888181625292,
      "grad_norm": 0.9138762409169043,
      "learning_rate": 2.8438198644662705e-05,
      "loss": 1.1799,
      "num_input_tokens_seen": 40631746192,
      "step": 51644
    },
    {
      "epoch": 5.478994271164863,
      "grad_norm": 1.2164674594605576,
      "learning_rate": 2.843751027818612e-05,
      "loss": 1.1489,
      "num_input_tokens_seen": 40632532832,
      "step": 51645
    },
    {
      "epoch": 5.479100360704434,
      "grad_norm": 1.0881833342494682,
      "learning_rate": 2.8436821909053122e-05,
      "loss": 1.2081,
      "num_input_tokens_seen": 40633319632,
      "step": 51646
    },
    {
      "epoch": 5.479206450244006,
      "grad_norm": 0.5721185913774175,
      "learning_rate": 2.8436133537264258e-05,
      "loss": 1.1101,
      "num_input_tokens_seen": 40634106400,
      "step": 51647
    },
    {
      "epoch": 5.479312539783577,
      "grad_norm": 0.8056726306935778,
      "learning_rate": 2.8435445162820046e-05,
      "loss": 1.1298,
      "num_input_tokens_seen": 40634893136,
      "step": 51648
    },
    {
      "epoch": 5.479418629323149,
      "grad_norm": 0.7520555920277154,
      "learning_rate": 2.8434756785721024e-05,
      "loss": 1.1143,
      "num_input_tokens_seen": 40635679952,
      "step": 51649
    },
    {
      "epoch": 5.47952471886272,
      "grad_norm": 0.6200008577309538,
      "learning_rate": 2.8434068405967725e-05,
      "loss": 1.1109,
      "num_input_tokens_seen": 40636466768,
      "step": 51650
    },
    {
      "epoch": 5.479630808402291,
      "grad_norm": 0.8271697969001917,
      "learning_rate": 2.8433380023560675e-05,
      "loss": 1.1403,
      "num_input_tokens_seen": 40637253536,
      "step": 51651
    },
    {
      "epoch": 5.479736897941863,
      "grad_norm": 0.7021979716967065,
      "learning_rate": 2.8432691638500407e-05,
      "loss": 1.1253,
      "num_input_tokens_seen": 40638040208,
      "step": 51652
    },
    {
      "epoch": 5.479842987481434,
      "grad_norm": 0.863778077617966,
      "learning_rate": 2.8432003250787465e-05,
      "loss": 1.1714,
      "num_input_tokens_seen": 40638826992,
      "step": 51653
    },
    {
      "epoch": 5.479949077021006,
      "grad_norm": 0.6924642067119173,
      "learning_rate": 2.8431314860422358e-05,
      "loss": 1.2585,
      "num_input_tokens_seen": 40639613664,
      "step": 51654
    },
    {
      "epoch": 5.480055166560577,
      "grad_norm": 0.7650589747838215,
      "learning_rate": 2.843062646740564e-05,
      "loss": 1.1831,
      "num_input_tokens_seen": 40640400400,
      "step": 51655
    },
    {
      "epoch": 5.480161256100149,
      "grad_norm": 0.7442188549835014,
      "learning_rate": 2.8429938071737837e-05,
      "loss": 1.1613,
      "num_input_tokens_seen": 40641187136,
      "step": 51656
    },
    {
      "epoch": 5.48026734563972,
      "grad_norm": 0.6871752093556477,
      "learning_rate": 2.8429249673419473e-05,
      "loss": 1.1308,
      "num_input_tokens_seen": 40641973968,
      "step": 51657
    },
    {
      "epoch": 5.480373435179291,
      "grad_norm": 0.8443914292553163,
      "learning_rate": 2.8428561272451093e-05,
      "loss": 1.1128,
      "num_input_tokens_seen": 40642760720,
      "step": 51658
    },
    {
      "epoch": 5.480479524718863,
      "grad_norm": 0.6287723589989658,
      "learning_rate": 2.8427872868833217e-05,
      "loss": 1.1757,
      "num_input_tokens_seen": 40643547408,
      "step": 51659
    },
    {
      "epoch": 5.480585614258434,
      "grad_norm": 0.7812590637664149,
      "learning_rate": 2.8427184462566374e-05,
      "loss": 1.2645,
      "num_input_tokens_seen": 40644334192,
      "step": 51660
    },
    {
      "epoch": 5.480691703798006,
      "grad_norm": 0.602766441872439,
      "learning_rate": 2.8426496053651113e-05,
      "loss": 1.1523,
      "num_input_tokens_seen": 40645121024,
      "step": 51661
    },
    {
      "epoch": 5.480797793337577,
      "grad_norm": 0.7903581198586529,
      "learning_rate": 2.8425807642087953e-05,
      "loss": 1.1831,
      "num_input_tokens_seen": 40645907776,
      "step": 51662
    },
    {
      "epoch": 5.480903882877148,
      "grad_norm": 0.5999497118163456,
      "learning_rate": 2.8425119227877428e-05,
      "loss": 1.1483,
      "num_input_tokens_seen": 40646694576,
      "step": 51663
    },
    {
      "epoch": 5.48100997241672,
      "grad_norm": 0.8543437123455124,
      "learning_rate": 2.8424430811020075e-05,
      "loss": 1.1252,
      "num_input_tokens_seen": 40647481440,
      "step": 51664
    },
    {
      "epoch": 5.481116061956291,
      "grad_norm": 0.6058692696407157,
      "learning_rate": 2.8423742391516428e-05,
      "loss": 1.1779,
      "num_input_tokens_seen": 40648268224,
      "step": 51665
    },
    {
      "epoch": 5.481222151495863,
      "grad_norm": 0.6030853748174277,
      "learning_rate": 2.8423053969366996e-05,
      "loss": 1.0725,
      "num_input_tokens_seen": 40649055008,
      "step": 51666
    },
    {
      "epoch": 5.481328241035434,
      "grad_norm": 0.6966146203836193,
      "learning_rate": 2.8422365544572344e-05,
      "loss": 1.1777,
      "num_input_tokens_seen": 40649841712,
      "step": 51667
    },
    {
      "epoch": 5.481434330575006,
      "grad_norm": 0.4893532814016751,
      "learning_rate": 2.8421677117132977e-05,
      "loss": 1.074,
      "num_input_tokens_seen": 40650628544,
      "step": 51668
    },
    {
      "epoch": 5.481540420114577,
      "grad_norm": 0.5972806295345144,
      "learning_rate": 2.842098868704945e-05,
      "loss": 1.1144,
      "num_input_tokens_seen": 40651415280,
      "step": 51669
    },
    {
      "epoch": 5.481646509654148,
      "grad_norm": 0.7394582420901753,
      "learning_rate": 2.842030025432228e-05,
      "loss": 1.246,
      "num_input_tokens_seen": 40652201984,
      "step": 51670
    },
    {
      "epoch": 5.48175259919372,
      "grad_norm": 0.7394660368173238,
      "learning_rate": 2.8419611818951997e-05,
      "loss": 1.2134,
      "num_input_tokens_seen": 40652988784,
      "step": 51671
    },
    {
      "epoch": 5.481858688733291,
      "grad_norm": 0.7268217532747383,
      "learning_rate": 2.841892338093914e-05,
      "loss": 1.264,
      "num_input_tokens_seen": 40653775536,
      "step": 51672
    },
    {
      "epoch": 5.481964778272863,
      "grad_norm": 0.7138220729106599,
      "learning_rate": 2.8418234940284242e-05,
      "loss": 1.1984,
      "num_input_tokens_seen": 40654562256,
      "step": 51673
    },
    {
      "epoch": 5.482070867812434,
      "grad_norm": 0.7697294700201649,
      "learning_rate": 2.841754649698783e-05,
      "loss": 1.1144,
      "num_input_tokens_seen": 40655349136,
      "step": 51674
    },
    {
      "epoch": 5.482176957352005,
      "grad_norm": 0.6633131720891241,
      "learning_rate": 2.841685805105044e-05,
      "loss": 1.1783,
      "num_input_tokens_seen": 40656135920,
      "step": 51675
    },
    {
      "epoch": 5.482283046891577,
      "grad_norm": 0.6201786383354687,
      "learning_rate": 2.8416169602472603e-05,
      "loss": 1.1847,
      "num_input_tokens_seen": 40656922640,
      "step": 51676
    },
    {
      "epoch": 5.482389136431148,
      "grad_norm": 0.7075469364685784,
      "learning_rate": 2.841548115125484e-05,
      "loss": 1.1708,
      "num_input_tokens_seen": 40657709424,
      "step": 51677
    },
    {
      "epoch": 5.48249522597072,
      "grad_norm": 0.6855963923097265,
      "learning_rate": 2.841479269739771e-05,
      "loss": 1.2232,
      "num_input_tokens_seen": 40658496144,
      "step": 51678
    },
    {
      "epoch": 5.482601315510291,
      "grad_norm": 0.7806606663434157,
      "learning_rate": 2.8414104240901717e-05,
      "loss": 1.2264,
      "num_input_tokens_seen": 40659282928,
      "step": 51679
    },
    {
      "epoch": 5.482707405049862,
      "grad_norm": 0.9822364779787697,
      "learning_rate": 2.8413415781767404e-05,
      "loss": 1.2376,
      "num_input_tokens_seen": 40660069664,
      "step": 51680
    },
    {
      "epoch": 5.482813494589434,
      "grad_norm": 0.9197597709047287,
      "learning_rate": 2.8412727319995312e-05,
      "loss": 1.0575,
      "num_input_tokens_seen": 40660856496,
      "step": 51681
    },
    {
      "epoch": 5.482919584129005,
      "grad_norm": 0.6716660690138234,
      "learning_rate": 2.8412038855585966e-05,
      "loss": 1.2696,
      "num_input_tokens_seen": 40661643232,
      "step": 51682
    },
    {
      "epoch": 5.4830256736685765,
      "grad_norm": 0.5761841224440731,
      "learning_rate": 2.841135038853988e-05,
      "loss": 1.1431,
      "num_input_tokens_seen": 40662430048,
      "step": 51683
    },
    {
      "epoch": 5.4831317632081475,
      "grad_norm": 0.5820926581905028,
      "learning_rate": 2.8410661918857616e-05,
      "loss": 1.1498,
      "num_input_tokens_seen": 40663216816,
      "step": 51684
    },
    {
      "epoch": 5.4832378527477195,
      "grad_norm": 0.6855423796600516,
      "learning_rate": 2.840997344653969e-05,
      "loss": 1.1441,
      "num_input_tokens_seen": 40664003696,
      "step": 51685
    },
    {
      "epoch": 5.4833439422872905,
      "grad_norm": 0.7905502916158192,
      "learning_rate": 2.840928497158663e-05,
      "loss": 1.1346,
      "num_input_tokens_seen": 40664790544,
      "step": 51686
    },
    {
      "epoch": 5.4834500318268615,
      "grad_norm": 0.5747616794355841,
      "learning_rate": 2.8408596493998983e-05,
      "loss": 1.2,
      "num_input_tokens_seen": 40665577360,
      "step": 51687
    },
    {
      "epoch": 5.4835561213664334,
      "grad_norm": 0.8050132587355284,
      "learning_rate": 2.8407908013777274e-05,
      "loss": 1.2075,
      "num_input_tokens_seen": 40666364064,
      "step": 51688
    },
    {
      "epoch": 5.4836622109060045,
      "grad_norm": 0.7365251712041484,
      "learning_rate": 2.8407219530922023e-05,
      "loss": 1.102,
      "num_input_tokens_seen": 40667150880,
      "step": 51689
    },
    {
      "epoch": 5.483768300445576,
      "grad_norm": 0.6836895184890577,
      "learning_rate": 2.840653104543378e-05,
      "loss": 1.113,
      "num_input_tokens_seen": 40667937632,
      "step": 51690
    },
    {
      "epoch": 5.483874389985147,
      "grad_norm": 0.7171728524185906,
      "learning_rate": 2.8405842557313073e-05,
      "loss": 1.1837,
      "num_input_tokens_seen": 40668724368,
      "step": 51691
    },
    {
      "epoch": 5.4839804795247185,
      "grad_norm": 0.7376029811667474,
      "learning_rate": 2.8405154066560423e-05,
      "loss": 1.1246,
      "num_input_tokens_seen": 40669511200,
      "step": 51692
    },
    {
      "epoch": 5.48408656906429,
      "grad_norm": 0.8276707590642154,
      "learning_rate": 2.8404465573176377e-05,
      "loss": 1.1425,
      "num_input_tokens_seen": 40670298016,
      "step": 51693
    },
    {
      "epoch": 5.484192658603861,
      "grad_norm": 0.5573997870892926,
      "learning_rate": 2.840377707716146e-05,
      "loss": 1.0807,
      "num_input_tokens_seen": 40671084864,
      "step": 51694
    },
    {
      "epoch": 5.484298748143433,
      "grad_norm": 0.8252133917545971,
      "learning_rate": 2.8403088578516194e-05,
      "loss": 1.1624,
      "num_input_tokens_seen": 40671871680,
      "step": 51695
    },
    {
      "epoch": 5.484404837683004,
      "grad_norm": 0.7990631642083588,
      "learning_rate": 2.8402400077241132e-05,
      "loss": 1.1641,
      "num_input_tokens_seen": 40672658400,
      "step": 51696
    },
    {
      "epoch": 5.484510927222576,
      "grad_norm": 0.7170811792608859,
      "learning_rate": 2.8401711573336788e-05,
      "loss": 1.2078,
      "num_input_tokens_seen": 40673445168,
      "step": 51697
    },
    {
      "epoch": 5.484617016762147,
      "grad_norm": 0.9592785935752454,
      "learning_rate": 2.8401023066803707e-05,
      "loss": 1.1739,
      "num_input_tokens_seen": 40674231920,
      "step": 51698
    },
    {
      "epoch": 5.484723106301718,
      "grad_norm": 0.5966585462305605,
      "learning_rate": 2.8400334557642416e-05,
      "loss": 1.15,
      "num_input_tokens_seen": 40675018704,
      "step": 51699
    },
    {
      "epoch": 5.48482919584129,
      "grad_norm": 0.7034692759836023,
      "learning_rate": 2.8399646045853435e-05,
      "loss": 1.1928,
      "num_input_tokens_seen": 40675805520,
      "step": 51700
    },
    {
      "epoch": 5.484935285380861,
      "grad_norm": 0.6557371250752966,
      "learning_rate": 2.839895753143732e-05,
      "loss": 1.1215,
      "num_input_tokens_seen": 40676592352,
      "step": 51701
    },
    {
      "epoch": 5.485041374920433,
      "grad_norm": 0.6929064392783794,
      "learning_rate": 2.8398269014394584e-05,
      "loss": 1.1371,
      "num_input_tokens_seen": 40677379168,
      "step": 51702
    },
    {
      "epoch": 5.485147464460004,
      "grad_norm": 0.6150689023268368,
      "learning_rate": 2.839758049472576e-05,
      "loss": 1.1165,
      "num_input_tokens_seen": 40678166016,
      "step": 51703
    },
    {
      "epoch": 5.485253553999575,
      "grad_norm": 0.7189503968513374,
      "learning_rate": 2.83968919724314e-05,
      "loss": 1.1778,
      "num_input_tokens_seen": 40678952736,
      "step": 51704
    },
    {
      "epoch": 5.485359643539147,
      "grad_norm": 0.718047770403343,
      "learning_rate": 2.8396203447512015e-05,
      "loss": 1.1053,
      "num_input_tokens_seen": 40679739472,
      "step": 51705
    },
    {
      "epoch": 5.485465733078718,
      "grad_norm": 0.6514033612560655,
      "learning_rate": 2.8395514919968137e-05,
      "loss": 1.1656,
      "num_input_tokens_seen": 40680526176,
      "step": 51706
    },
    {
      "epoch": 5.48557182261829,
      "grad_norm": 0.6405469810910722,
      "learning_rate": 2.839482638980031e-05,
      "loss": 1.0811,
      "num_input_tokens_seen": 40681312864,
      "step": 51707
    },
    {
      "epoch": 5.485677912157861,
      "grad_norm": 0.638122802949965,
      "learning_rate": 2.8394137857009062e-05,
      "loss": 1.2059,
      "num_input_tokens_seen": 40682099552,
      "step": 51708
    },
    {
      "epoch": 5.485784001697432,
      "grad_norm": 0.7036819279088254,
      "learning_rate": 2.8393449321594922e-05,
      "loss": 1.2549,
      "num_input_tokens_seen": 40682886352,
      "step": 51709
    },
    {
      "epoch": 5.485890091237004,
      "grad_norm": 0.5861579463934702,
      "learning_rate": 2.8392760783558427e-05,
      "loss": 1.218,
      "num_input_tokens_seen": 40683673120,
      "step": 51710
    },
    {
      "epoch": 5.485996180776575,
      "grad_norm": 0.8868553808666397,
      "learning_rate": 2.8392072242900103e-05,
      "loss": 1.2242,
      "num_input_tokens_seen": 40684459792,
      "step": 51711
    },
    {
      "epoch": 5.486102270316147,
      "grad_norm": 0.5747392678621795,
      "learning_rate": 2.8391383699620484e-05,
      "loss": 1.1392,
      "num_input_tokens_seen": 40685246528,
      "step": 51712
    },
    {
      "epoch": 5.486208359855718,
      "grad_norm": 0.7790111558096273,
      "learning_rate": 2.8390695153720104e-05,
      "loss": 1.1708,
      "num_input_tokens_seen": 40686033312,
      "step": 51713
    },
    {
      "epoch": 5.48631444939529,
      "grad_norm": 0.6785724759450533,
      "learning_rate": 2.8390006605199492e-05,
      "loss": 1.0907,
      "num_input_tokens_seen": 40686820112,
      "step": 51714
    },
    {
      "epoch": 5.486420538934861,
      "grad_norm": 1.0491654179455427,
      "learning_rate": 2.838931805405919e-05,
      "loss": 1.1695,
      "num_input_tokens_seen": 40687606960,
      "step": 51715
    },
    {
      "epoch": 5.486526628474432,
      "grad_norm": 0.6461140727491894,
      "learning_rate": 2.838862950029972e-05,
      "loss": 1.1189,
      "num_input_tokens_seen": 40688393728,
      "step": 51716
    },
    {
      "epoch": 5.486632718014004,
      "grad_norm": 0.6288123418519451,
      "learning_rate": 2.838794094392161e-05,
      "loss": 1.1379,
      "num_input_tokens_seen": 40689180576,
      "step": 51717
    },
    {
      "epoch": 5.486738807553575,
      "grad_norm": 0.7491991096177206,
      "learning_rate": 2.8387252384925406e-05,
      "loss": 1.1669,
      "num_input_tokens_seen": 40689967328,
      "step": 51718
    },
    {
      "epoch": 5.486844897093147,
      "grad_norm": 0.8567284135409682,
      "learning_rate": 2.838656382331163e-05,
      "loss": 1.1117,
      "num_input_tokens_seen": 40690754112,
      "step": 51719
    },
    {
      "epoch": 5.486950986632718,
      "grad_norm": 0.6681161794575452,
      "learning_rate": 2.8385875259080813e-05,
      "loss": 1.0794,
      "num_input_tokens_seen": 40691540848,
      "step": 51720
    },
    {
      "epoch": 5.48705707617229,
      "grad_norm": 0.8191223301398058,
      "learning_rate": 2.8385186692233494e-05,
      "loss": 1.2282,
      "num_input_tokens_seen": 40692327504,
      "step": 51721
    },
    {
      "epoch": 5.487163165711861,
      "grad_norm": 0.8190154176659404,
      "learning_rate": 2.838449812277021e-05,
      "loss": 1.2165,
      "num_input_tokens_seen": 40693114352,
      "step": 51722
    },
    {
      "epoch": 5.487269255251432,
      "grad_norm": 0.6716193513254675,
      "learning_rate": 2.838380955069147e-05,
      "loss": 1.1618,
      "num_input_tokens_seen": 40693901008,
      "step": 51723
    },
    {
      "epoch": 5.487375344791004,
      "grad_norm": 0.8225955828241334,
      "learning_rate": 2.8383120975997834e-05,
      "loss": 1.251,
      "num_input_tokens_seen": 40694687696,
      "step": 51724
    },
    {
      "epoch": 5.487481434330575,
      "grad_norm": 0.5716536694356041,
      "learning_rate": 2.8382432398689818e-05,
      "loss": 1.1178,
      "num_input_tokens_seen": 40695474512,
      "step": 51725
    },
    {
      "epoch": 5.487587523870147,
      "grad_norm": 0.5490138710586737,
      "learning_rate": 2.8381743818767946e-05,
      "loss": 1.0383,
      "num_input_tokens_seen": 40696261328,
      "step": 51726
    },
    {
      "epoch": 5.487693613409718,
      "grad_norm": 0.592562685247201,
      "learning_rate": 2.8381055236232778e-05,
      "loss": 1.1057,
      "num_input_tokens_seen": 40697048112,
      "step": 51727
    },
    {
      "epoch": 5.487799702949289,
      "grad_norm": 0.6456193572232767,
      "learning_rate": 2.838036665108482e-05,
      "loss": 1.1725,
      "num_input_tokens_seen": 40697834864,
      "step": 51728
    },
    {
      "epoch": 5.487905792488861,
      "grad_norm": 0.690299292657341,
      "learning_rate": 2.8379678063324615e-05,
      "loss": 1.0842,
      "num_input_tokens_seen": 40698621632,
      "step": 51729
    },
    {
      "epoch": 5.488011882028432,
      "grad_norm": 0.7903179169695217,
      "learning_rate": 2.8378989472952698e-05,
      "loss": 1.1407,
      "num_input_tokens_seen": 40699408416,
      "step": 51730
    },
    {
      "epoch": 5.488117971568004,
      "grad_norm": 0.552045197908691,
      "learning_rate": 2.8378300879969595e-05,
      "loss": 1.095,
      "num_input_tokens_seen": 40700195168,
      "step": 51731
    },
    {
      "epoch": 5.488224061107575,
      "grad_norm": 1.2549234754821563,
      "learning_rate": 2.837761228437584e-05,
      "loss": 1.2348,
      "num_input_tokens_seen": 40700981904,
      "step": 51732
    },
    {
      "epoch": 5.488330150647146,
      "grad_norm": 0.8938041728384628,
      "learning_rate": 2.8376923686171964e-05,
      "loss": 1.1722,
      "num_input_tokens_seen": 40701768720,
      "step": 51733
    },
    {
      "epoch": 5.488436240186718,
      "grad_norm": 0.6896697632798146,
      "learning_rate": 2.8376235085358505e-05,
      "loss": 1.2099,
      "num_input_tokens_seen": 40702555456,
      "step": 51734
    },
    {
      "epoch": 5.488542329726289,
      "grad_norm": 1.5864045600504426,
      "learning_rate": 2.8375546481935982e-05,
      "loss": 1.2029,
      "num_input_tokens_seen": 40703342176,
      "step": 51735
    },
    {
      "epoch": 5.488648419265861,
      "grad_norm": 0.9176471454656988,
      "learning_rate": 2.8374857875904947e-05,
      "loss": 1.0836,
      "num_input_tokens_seen": 40704128928,
      "step": 51736
    },
    {
      "epoch": 5.488754508805432,
      "grad_norm": 0.792145116533257,
      "learning_rate": 2.8374169267265914e-05,
      "loss": 1.0969,
      "num_input_tokens_seen": 40704915792,
      "step": 51737
    },
    {
      "epoch": 5.488860598345003,
      "grad_norm": 0.9307018117196465,
      "learning_rate": 2.837348065601942e-05,
      "loss": 1.1684,
      "num_input_tokens_seen": 40705702432,
      "step": 51738
    },
    {
      "epoch": 5.488966687884575,
      "grad_norm": 0.83904158315788,
      "learning_rate": 2.8372792042166007e-05,
      "loss": 1.0674,
      "num_input_tokens_seen": 40706489216,
      "step": 51739
    },
    {
      "epoch": 5.489072777424146,
      "grad_norm": 0.8872425872571058,
      "learning_rate": 2.8372103425706186e-05,
      "loss": 1.2216,
      "num_input_tokens_seen": 40707275984,
      "step": 51740
    },
    {
      "epoch": 5.489178866963718,
      "grad_norm": 0.8614676102374683,
      "learning_rate": 2.8371414806640517e-05,
      "loss": 1.0733,
      "num_input_tokens_seen": 40708062800,
      "step": 51741
    },
    {
      "epoch": 5.489284956503289,
      "grad_norm": 0.6534407710373835,
      "learning_rate": 2.8370726184969516e-05,
      "loss": 1.0931,
      "num_input_tokens_seen": 40708849632,
      "step": 51742
    },
    {
      "epoch": 5.4893910460428605,
      "grad_norm": 0.7465689202710838,
      "learning_rate": 2.837003756069371e-05,
      "loss": 1.1484,
      "num_input_tokens_seen": 40709636352,
      "step": 51743
    },
    {
      "epoch": 5.489497135582432,
      "grad_norm": 0.9482550968128073,
      "learning_rate": 2.836934893381364e-05,
      "loss": 1.1605,
      "num_input_tokens_seen": 40710423072,
      "step": 51744
    },
    {
      "epoch": 5.489603225122003,
      "grad_norm": 0.6061031601019417,
      "learning_rate": 2.8368660304329836e-05,
      "loss": 1.1829,
      "num_input_tokens_seen": 40711209920,
      "step": 51745
    },
    {
      "epoch": 5.4897093146615745,
      "grad_norm": 0.8631247251867912,
      "learning_rate": 2.8367971672242827e-05,
      "loss": 1.2451,
      "num_input_tokens_seen": 40711996672,
      "step": 51746
    },
    {
      "epoch": 5.4898154042011456,
      "grad_norm": 0.7366720470769342,
      "learning_rate": 2.8367283037553154e-05,
      "loss": 1.1498,
      "num_input_tokens_seen": 40712783408,
      "step": 51747
    },
    {
      "epoch": 5.4899214937407175,
      "grad_norm": 0.6847315289232052,
      "learning_rate": 2.8366594400261344e-05,
      "loss": 1.1873,
      "num_input_tokens_seen": 40713570080,
      "step": 51748
    },
    {
      "epoch": 5.4900275832802885,
      "grad_norm": 0.6171734218347785,
      "learning_rate": 2.8365905760367923e-05,
      "loss": 1.0876,
      "num_input_tokens_seen": 40714356816,
      "step": 51749
    },
    {
      "epoch": 5.49013367281986,
      "grad_norm": 0.6650340724157193,
      "learning_rate": 2.8365217117873434e-05,
      "loss": 1.1651,
      "num_input_tokens_seen": 40715143616,
      "step": 51750
    },
    {
      "epoch": 5.4902397623594315,
      "grad_norm": 0.707713122435708,
      "learning_rate": 2.83645284727784e-05,
      "loss": 1.2761,
      "num_input_tokens_seen": 40715930400,
      "step": 51751
    },
    {
      "epoch": 5.4903458518990025,
      "grad_norm": 0.6872303473314151,
      "learning_rate": 2.8363839825083353e-05,
      "loss": 1.1339,
      "num_input_tokens_seen": 40716717264,
      "step": 51752
    },
    {
      "epoch": 5.490451941438574,
      "grad_norm": 0.620288285304563,
      "learning_rate": 2.836315117478884e-05,
      "loss": 1.0861,
      "num_input_tokens_seen": 40717503984,
      "step": 51753
    },
    {
      "epoch": 5.490558030978145,
      "grad_norm": 0.6741716629285772,
      "learning_rate": 2.8362462521895377e-05,
      "loss": 1.187,
      "num_input_tokens_seen": 40718290816,
      "step": 51754
    },
    {
      "epoch": 5.490664120517717,
      "grad_norm": 0.7075711277565373,
      "learning_rate": 2.8361773866403503e-05,
      "loss": 1.1956,
      "num_input_tokens_seen": 40719077552,
      "step": 51755
    },
    {
      "epoch": 5.490770210057288,
      "grad_norm": 0.6587573855442957,
      "learning_rate": 2.8361085208313748e-05,
      "loss": 1.1879,
      "num_input_tokens_seen": 40719864288,
      "step": 51756
    },
    {
      "epoch": 5.490876299596859,
      "grad_norm": 0.6556113441208407,
      "learning_rate": 2.8360396547626637e-05,
      "loss": 1.1252,
      "num_input_tokens_seen": 40720650976,
      "step": 51757
    },
    {
      "epoch": 5.490982389136431,
      "grad_norm": 0.967557980326079,
      "learning_rate": 2.8359707884342724e-05,
      "loss": 1.123,
      "num_input_tokens_seen": 40721437680,
      "step": 51758
    },
    {
      "epoch": 5.491088478676002,
      "grad_norm": 0.5240669662857804,
      "learning_rate": 2.8359019218462522e-05,
      "loss": 1.1169,
      "num_input_tokens_seen": 40722224432,
      "step": 51759
    },
    {
      "epoch": 5.491194568215574,
      "grad_norm": 0.8972353380242137,
      "learning_rate": 2.8358330549986568e-05,
      "loss": 1.2774,
      "num_input_tokens_seen": 40723011216,
      "step": 51760
    },
    {
      "epoch": 5.491300657755145,
      "grad_norm": 0.596097137593716,
      "learning_rate": 2.8357641878915393e-05,
      "loss": 1.1953,
      "num_input_tokens_seen": 40723797968,
      "step": 51761
    },
    {
      "epoch": 5.491406747294716,
      "grad_norm": 0.5898788862987568,
      "learning_rate": 2.8356953205249535e-05,
      "loss": 1.09,
      "num_input_tokens_seen": 40724584800,
      "step": 51762
    },
    {
      "epoch": 5.491512836834288,
      "grad_norm": 0.5880913744590099,
      "learning_rate": 2.8356264528989517e-05,
      "loss": 1.2288,
      "num_input_tokens_seen": 40725371536,
      "step": 51763
    },
    {
      "epoch": 5.491618926373859,
      "grad_norm": 0.6000953228654441,
      "learning_rate": 2.8355575850135878e-05,
      "loss": 1.1781,
      "num_input_tokens_seen": 40726158288,
      "step": 51764
    },
    {
      "epoch": 5.491725015913431,
      "grad_norm": 0.6859436957561694,
      "learning_rate": 2.8354887168689152e-05,
      "loss": 1.2268,
      "num_input_tokens_seen": 40726945040,
      "step": 51765
    },
    {
      "epoch": 5.491831105453002,
      "grad_norm": 0.6394483312592573,
      "learning_rate": 2.8354198484649862e-05,
      "loss": 1.152,
      "num_input_tokens_seen": 40727731904,
      "step": 51766
    },
    {
      "epoch": 5.491937194992573,
      "grad_norm": 0.6101041621476245,
      "learning_rate": 2.8353509798018552e-05,
      "loss": 1.1778,
      "num_input_tokens_seen": 40728518592,
      "step": 51767
    },
    {
      "epoch": 5.492043284532145,
      "grad_norm": 0.6400572884982958,
      "learning_rate": 2.8352821108795746e-05,
      "loss": 1.1738,
      "num_input_tokens_seen": 40729305248,
      "step": 51768
    },
    {
      "epoch": 5.492149374071716,
      "grad_norm": 0.5353099313953814,
      "learning_rate": 2.835213241698197e-05,
      "loss": 1.1105,
      "num_input_tokens_seen": 40730092064,
      "step": 51769
    },
    {
      "epoch": 5.492255463611288,
      "grad_norm": 0.6898554260351382,
      "learning_rate": 2.8351443722577775e-05,
      "loss": 1.16,
      "num_input_tokens_seen": 40730878864,
      "step": 51770
    },
    {
      "epoch": 5.492361553150859,
      "grad_norm": 0.8216663651321768,
      "learning_rate": 2.8350755025583675e-05,
      "loss": 1.1995,
      "num_input_tokens_seen": 40731665552,
      "step": 51771
    },
    {
      "epoch": 5.492467642690431,
      "grad_norm": 0.6236758935198485,
      "learning_rate": 2.835006632600021e-05,
      "loss": 1.1523,
      "num_input_tokens_seen": 40732452336,
      "step": 51772
    },
    {
      "epoch": 5.492573732230002,
      "grad_norm": 0.6717041874800669,
      "learning_rate": 2.834937762382792e-05,
      "loss": 1.237,
      "num_input_tokens_seen": 40733239024,
      "step": 51773
    },
    {
      "epoch": 5.492679821769573,
      "grad_norm": 0.5930703805534625,
      "learning_rate": 2.834868891906732e-05,
      "loss": 1.1101,
      "num_input_tokens_seen": 40734025728,
      "step": 51774
    },
    {
      "epoch": 5.492785911309145,
      "grad_norm": 0.5571676328935745,
      "learning_rate": 2.8348000211718962e-05,
      "loss": 1.1517,
      "num_input_tokens_seen": 40734812592,
      "step": 51775
    },
    {
      "epoch": 5.492892000848716,
      "grad_norm": 0.8095909588599063,
      "learning_rate": 2.8347311501783364e-05,
      "loss": 1.2194,
      "num_input_tokens_seen": 40735599296,
      "step": 51776
    },
    {
      "epoch": 5.492998090388288,
      "grad_norm": 0.75814836429179,
      "learning_rate": 2.8346622789261056e-05,
      "loss": 1.2154,
      "num_input_tokens_seen": 40736385984,
      "step": 51777
    },
    {
      "epoch": 5.493104179927859,
      "grad_norm": 0.6347420734762076,
      "learning_rate": 2.834593407415258e-05,
      "loss": 1.0367,
      "num_input_tokens_seen": 40737172768,
      "step": 51778
    },
    {
      "epoch": 5.493210269467431,
      "grad_norm": 0.8864805745682229,
      "learning_rate": 2.8345245356458472e-05,
      "loss": 1.2788,
      "num_input_tokens_seen": 40737959488,
      "step": 51779
    },
    {
      "epoch": 5.493316359007002,
      "grad_norm": 0.593721341414896,
      "learning_rate": 2.8344556636179243e-05,
      "loss": 1.0983,
      "num_input_tokens_seen": 40738746240,
      "step": 51780
    },
    {
      "epoch": 5.493422448546573,
      "grad_norm": 0.6245129899727152,
      "learning_rate": 2.834386791331544e-05,
      "loss": 1.1368,
      "num_input_tokens_seen": 40739533056,
      "step": 51781
    },
    {
      "epoch": 5.493528538086145,
      "grad_norm": 0.8206003025848971,
      "learning_rate": 2.8343179187867604e-05,
      "loss": 1.1176,
      "num_input_tokens_seen": 40740319840,
      "step": 51782
    },
    {
      "epoch": 5.493634627625716,
      "grad_norm": 0.5974866520638674,
      "learning_rate": 2.8342490459836245e-05,
      "loss": 1.1039,
      "num_input_tokens_seen": 40741106608,
      "step": 51783
    },
    {
      "epoch": 5.493740717165288,
      "grad_norm": 0.6871457679322683,
      "learning_rate": 2.8341801729221916e-05,
      "loss": 1.1565,
      "num_input_tokens_seen": 40741893488,
      "step": 51784
    },
    {
      "epoch": 5.493846806704859,
      "grad_norm": 0.7069771862094992,
      "learning_rate": 2.8341112996025143e-05,
      "loss": 1.2859,
      "num_input_tokens_seen": 40742680224,
      "step": 51785
    },
    {
      "epoch": 5.49395289624443,
      "grad_norm": 0.5620905501059327,
      "learning_rate": 2.8340424260246444e-05,
      "loss": 1.2087,
      "num_input_tokens_seen": 40743466976,
      "step": 51786
    },
    {
      "epoch": 5.494058985784002,
      "grad_norm": 0.7253985587762144,
      "learning_rate": 2.833973552188638e-05,
      "loss": 1.1753,
      "num_input_tokens_seen": 40744253760,
      "step": 51787
    },
    {
      "epoch": 5.494165075323573,
      "grad_norm": 0.7135068829276138,
      "learning_rate": 2.8339046780945455e-05,
      "loss": 1.237,
      "num_input_tokens_seen": 40745040432,
      "step": 51788
    },
    {
      "epoch": 5.494271164863145,
      "grad_norm": 0.49151083454187267,
      "learning_rate": 2.833835803742421e-05,
      "loss": 1.117,
      "num_input_tokens_seen": 40745827184,
      "step": 51789
    },
    {
      "epoch": 5.494377254402716,
      "grad_norm": 0.584832621300737,
      "learning_rate": 2.833766929132319e-05,
      "loss": 1.114,
      "num_input_tokens_seen": 40746614016,
      "step": 51790
    },
    {
      "epoch": 5.494483343942287,
      "grad_norm": 0.6277257739894869,
      "learning_rate": 2.8336980542642915e-05,
      "loss": 1.1568,
      "num_input_tokens_seen": 40747400704,
      "step": 51791
    },
    {
      "epoch": 5.494589433481859,
      "grad_norm": 0.5982329753325512,
      "learning_rate": 2.8336291791383913e-05,
      "loss": 1.2514,
      "num_input_tokens_seen": 40748187440,
      "step": 51792
    },
    {
      "epoch": 5.49469552302143,
      "grad_norm": 0.6693116977350944,
      "learning_rate": 2.8335603037546726e-05,
      "loss": 1.2148,
      "num_input_tokens_seen": 40748974240,
      "step": 51793
    },
    {
      "epoch": 5.494801612561002,
      "grad_norm": 0.6732366036108282,
      "learning_rate": 2.8334914281131886e-05,
      "loss": 1.1678,
      "num_input_tokens_seen": 40749760928,
      "step": 51794
    },
    {
      "epoch": 5.494907702100573,
      "grad_norm": 0.6040045514301583,
      "learning_rate": 2.8334225522139913e-05,
      "loss": 1.0335,
      "num_input_tokens_seen": 40750547728,
      "step": 51795
    },
    {
      "epoch": 5.495013791640145,
      "grad_norm": 0.6680638842326581,
      "learning_rate": 2.8333536760571355e-05,
      "loss": 1.2767,
      "num_input_tokens_seen": 40751334544,
      "step": 51796
    },
    {
      "epoch": 5.495119881179716,
      "grad_norm": 0.9949952377152821,
      "learning_rate": 2.8332847996426743e-05,
      "loss": 1.2512,
      "num_input_tokens_seen": 40752121264,
      "step": 51797
    },
    {
      "epoch": 5.495225970719287,
      "grad_norm": 0.7124767854264759,
      "learning_rate": 2.8332159229706595e-05,
      "loss": 1.136,
      "num_input_tokens_seen": 40752908000,
      "step": 51798
    },
    {
      "epoch": 5.495332060258859,
      "grad_norm": 0.6784639615819944,
      "learning_rate": 2.8331470460411456e-05,
      "loss": 1.1593,
      "num_input_tokens_seen": 40753694736,
      "step": 51799
    },
    {
      "epoch": 5.49543814979843,
      "grad_norm": 0.6712554938478258,
      "learning_rate": 2.8330781688541846e-05,
      "loss": 1.1782,
      "num_input_tokens_seen": 40754481584,
      "step": 51800
    },
    {
      "epoch": 5.495544239338002,
      "grad_norm": 0.5915944173355439,
      "learning_rate": 2.8330092914098315e-05,
      "loss": 1.1225,
      "num_input_tokens_seen": 40755268384,
      "step": 51801
    },
    {
      "epoch": 5.495650328877573,
      "grad_norm": 0.7363194459558349,
      "learning_rate": 2.8329404137081387e-05,
      "loss": 1.2374,
      "num_input_tokens_seen": 40756055200,
      "step": 51802
    },
    {
      "epoch": 5.495756418417144,
      "grad_norm": 0.9152288970481222,
      "learning_rate": 2.8328715357491587e-05,
      "loss": 1.2432,
      "num_input_tokens_seen": 40756842016,
      "step": 51803
    },
    {
      "epoch": 5.495862507956716,
      "grad_norm": 0.5948594638784122,
      "learning_rate": 2.832802657532946e-05,
      "loss": 1.1759,
      "num_input_tokens_seen": 40757628896,
      "step": 51804
    },
    {
      "epoch": 5.495968597496287,
      "grad_norm": 0.8706546942661693,
      "learning_rate": 2.8327337790595532e-05,
      "loss": 1.1938,
      "num_input_tokens_seen": 40758415664,
      "step": 51805
    },
    {
      "epoch": 5.4960746870358586,
      "grad_norm": 0.7953898501548479,
      "learning_rate": 2.8326649003290325e-05,
      "loss": 1.1974,
      "num_input_tokens_seen": 40759202448,
      "step": 51806
    },
    {
      "epoch": 5.49618077657543,
      "grad_norm": 0.721354797627891,
      "learning_rate": 2.8325960213414386e-05,
      "loss": 1.196,
      "num_input_tokens_seen": 40759989216,
      "step": 51807
    },
    {
      "epoch": 5.4962868661150015,
      "grad_norm": 1.1712371707233766,
      "learning_rate": 2.8325271420968248e-05,
      "loss": 1.2307,
      "num_input_tokens_seen": 40760776000,
      "step": 51808
    },
    {
      "epoch": 5.4963929556545725,
      "grad_norm": 0.7582830372200964,
      "learning_rate": 2.8324582625952432e-05,
      "loss": 1.1699,
      "num_input_tokens_seen": 40761562848,
      "step": 51809
    },
    {
      "epoch": 5.496499045194144,
      "grad_norm": 0.6678913347903729,
      "learning_rate": 2.8323893828367474e-05,
      "loss": 1.2471,
      "num_input_tokens_seen": 40762349632,
      "step": 51810
    },
    {
      "epoch": 5.4966051347337155,
      "grad_norm": 0.6946048643952487,
      "learning_rate": 2.8323205028213916e-05,
      "loss": 1.1651,
      "num_input_tokens_seen": 40763136432,
      "step": 51811
    },
    {
      "epoch": 5.4967112242732865,
      "grad_norm": 0.6137710969156526,
      "learning_rate": 2.832251622549228e-05,
      "loss": 1.1943,
      "num_input_tokens_seen": 40763923216,
      "step": 51812
    },
    {
      "epoch": 5.496817313812858,
      "grad_norm": 0.8470731414759861,
      "learning_rate": 2.8321827420203102e-05,
      "loss": 1.2676,
      "num_input_tokens_seen": 40764710048,
      "step": 51813
    },
    {
      "epoch": 5.4969234033524295,
      "grad_norm": 0.6594887556974995,
      "learning_rate": 2.832113861234691e-05,
      "loss": 1.0857,
      "num_input_tokens_seen": 40765496880,
      "step": 51814
    },
    {
      "epoch": 5.4970294928920005,
      "grad_norm": 0.5941864322026614,
      "learning_rate": 2.8320449801924236e-05,
      "loss": 1.1033,
      "num_input_tokens_seen": 40766283792,
      "step": 51815
    },
    {
      "epoch": 5.497135582431572,
      "grad_norm": 0.6794080433492804,
      "learning_rate": 2.831976098893562e-05,
      "loss": 1.0921,
      "num_input_tokens_seen": 40767070592,
      "step": 51816
    },
    {
      "epoch": 5.497241671971143,
      "grad_norm": 0.6126075764167302,
      "learning_rate": 2.8319072173381588e-05,
      "loss": 1.1968,
      "num_input_tokens_seen": 40767857408,
      "step": 51817
    },
    {
      "epoch": 5.497347761510715,
      "grad_norm": 0.8387030597309227,
      "learning_rate": 2.8318383355262684e-05,
      "loss": 1.1748,
      "num_input_tokens_seen": 40768644144,
      "step": 51818
    },
    {
      "epoch": 5.497453851050286,
      "grad_norm": 0.8785831372633475,
      "learning_rate": 2.8317694534579425e-05,
      "loss": 1.1288,
      "num_input_tokens_seen": 40769430816,
      "step": 51819
    },
    {
      "epoch": 5.497559940589857,
      "grad_norm": 0.6774163600720323,
      "learning_rate": 2.8317005711332344e-05,
      "loss": 1.1067,
      "num_input_tokens_seen": 40770217648,
      "step": 51820
    },
    {
      "epoch": 5.497666030129429,
      "grad_norm": 0.8153386659330316,
      "learning_rate": 2.831631688552198e-05,
      "loss": 1.1921,
      "num_input_tokens_seen": 40771004416,
      "step": 51821
    },
    {
      "epoch": 5.497772119669,
      "grad_norm": 0.6737910632598527,
      "learning_rate": 2.831562805714887e-05,
      "loss": 1.1294,
      "num_input_tokens_seen": 40771791136,
      "step": 51822
    },
    {
      "epoch": 5.497878209208572,
      "grad_norm": 0.696492348473713,
      "learning_rate": 2.8314939226213534e-05,
      "loss": 1.1501,
      "num_input_tokens_seen": 40772577968,
      "step": 51823
    },
    {
      "epoch": 5.497984298748143,
      "grad_norm": 0.8480633184680592,
      "learning_rate": 2.8314250392716513e-05,
      "loss": 1.1311,
      "num_input_tokens_seen": 40773364624,
      "step": 51824
    },
    {
      "epoch": 5.498090388287715,
      "grad_norm": 0.6244348246882924,
      "learning_rate": 2.8313561556658336e-05,
      "loss": 1.1317,
      "num_input_tokens_seen": 40774151360,
      "step": 51825
    },
    {
      "epoch": 5.498196477827286,
      "grad_norm": 0.753459745000022,
      "learning_rate": 2.8312872718039528e-05,
      "loss": 1.2223,
      "num_input_tokens_seen": 40774938144,
      "step": 51826
    },
    {
      "epoch": 5.498302567366857,
      "grad_norm": 0.6440664427570116,
      "learning_rate": 2.8312183876860636e-05,
      "loss": 1.1349,
      "num_input_tokens_seen": 40775724976,
      "step": 51827
    },
    {
      "epoch": 5.498408656906429,
      "grad_norm": 0.6105717949982022,
      "learning_rate": 2.8311495033122188e-05,
      "loss": 1.2285,
      "num_input_tokens_seen": 40776511744,
      "step": 51828
    },
    {
      "epoch": 5.498514746446,
      "grad_norm": 0.5887725550674395,
      "learning_rate": 2.8310806186824707e-05,
      "loss": 1.1383,
      "num_input_tokens_seen": 40777298560,
      "step": 51829
    },
    {
      "epoch": 5.498620835985572,
      "grad_norm": 0.5177509356457857,
      "learning_rate": 2.831011733796874e-05,
      "loss": 1.1063,
      "num_input_tokens_seen": 40778085312,
      "step": 51830
    },
    {
      "epoch": 5.498726925525143,
      "grad_norm": 0.7785734812665436,
      "learning_rate": 2.830942848655481e-05,
      "loss": 1.1517,
      "num_input_tokens_seen": 40778872112,
      "step": 51831
    },
    {
      "epoch": 5.498833015064714,
      "grad_norm": 0.5613876370166659,
      "learning_rate": 2.830873963258345e-05,
      "loss": 1.1178,
      "num_input_tokens_seen": 40779658976,
      "step": 51832
    },
    {
      "epoch": 5.498939104604286,
      "grad_norm": 0.6154385600131991,
      "learning_rate": 2.830805077605519e-05,
      "loss": 1.1818,
      "num_input_tokens_seen": 40780445616,
      "step": 51833
    },
    {
      "epoch": 5.499045194143857,
      "grad_norm": 0.626047068425393,
      "learning_rate": 2.830736191697057e-05,
      "loss": 1.1259,
      "num_input_tokens_seen": 40781232384,
      "step": 51834
    },
    {
      "epoch": 5.499151283683429,
      "grad_norm": 0.7099508169766827,
      "learning_rate": 2.8306673055330114e-05,
      "loss": 1.2906,
      "num_input_tokens_seen": 40782019088,
      "step": 51835
    },
    {
      "epoch": 5.499257373223,
      "grad_norm": 0.5518548278038211,
      "learning_rate": 2.830598419113436e-05,
      "loss": 1.1847,
      "num_input_tokens_seen": 40782805872,
      "step": 51836
    },
    {
      "epoch": 5.499363462762572,
      "grad_norm": 0.6770139930881334,
      "learning_rate": 2.8305295324383842e-05,
      "loss": 1.037,
      "num_input_tokens_seen": 40783592640,
      "step": 51837
    },
    {
      "epoch": 5.499469552302143,
      "grad_norm": 0.6888194825424659,
      "learning_rate": 2.8304606455079076e-05,
      "loss": 1.1662,
      "num_input_tokens_seen": 40784379328,
      "step": 51838
    },
    {
      "epoch": 5.499575641841714,
      "grad_norm": 0.6009385721377122,
      "learning_rate": 2.8303917583220617e-05,
      "loss": 1.1097,
      "num_input_tokens_seen": 40785165984,
      "step": 51839
    },
    {
      "epoch": 5.499681731381286,
      "grad_norm": 0.8515426228998,
      "learning_rate": 2.830322870880899e-05,
      "loss": 1.1768,
      "num_input_tokens_seen": 40785952752,
      "step": 51840
    },
    {
      "epoch": 5.499787820920857,
      "grad_norm": 0.5750980111138598,
      "learning_rate": 2.8302539831844717e-05,
      "loss": 1.1739,
      "num_input_tokens_seen": 40786739456,
      "step": 51841
    },
    {
      "epoch": 5.499893910460429,
      "grad_norm": 0.6897924324601877,
      "learning_rate": 2.8301850952328346e-05,
      "loss": 1.1817,
      "num_input_tokens_seen": 40787526192,
      "step": 51842
    },
    {
      "epoch": 5.5,
      "grad_norm": 0.67941072028564,
      "learning_rate": 2.830116207026039e-05,
      "loss": 1.1372,
      "num_input_tokens_seen": 40788312976,
      "step": 51843
    },
    {
      "epoch": 5.500106089539571,
      "grad_norm": 0.7002113141244987,
      "learning_rate": 2.8300473185641403e-05,
      "loss": 1.1179,
      "num_input_tokens_seen": 40789099664,
      "step": 51844
    },
    {
      "epoch": 5.500212179079143,
      "grad_norm": 0.6318611266099401,
      "learning_rate": 2.829978429847191e-05,
      "loss": 1.1021,
      "num_input_tokens_seen": 40789886528,
      "step": 51845
    },
    {
      "epoch": 5.500318268618714,
      "grad_norm": 0.9187333038152914,
      "learning_rate": 2.829909540875243e-05,
      "loss": 1.207,
      "num_input_tokens_seen": 40790673248,
      "step": 51846
    },
    {
      "epoch": 5.500424358158286,
      "grad_norm": 0.6405697616169092,
      "learning_rate": 2.829840651648351e-05,
      "loss": 1.1851,
      "num_input_tokens_seen": 40791459984,
      "step": 51847
    },
    {
      "epoch": 5.500530447697857,
      "grad_norm": 0.7235085691953154,
      "learning_rate": 2.829771762166568e-05,
      "loss": 1.1518,
      "num_input_tokens_seen": 40792246704,
      "step": 51848
    },
    {
      "epoch": 5.500636537237428,
      "grad_norm": 0.9332583876288176,
      "learning_rate": 2.829702872429947e-05,
      "loss": 1.1587,
      "num_input_tokens_seen": 40793033520,
      "step": 51849
    },
    {
      "epoch": 5.500742626777,
      "grad_norm": 0.6326179493334615,
      "learning_rate": 2.829633982438541e-05,
      "loss": 1.1503,
      "num_input_tokens_seen": 40793820336,
      "step": 51850
    },
    {
      "epoch": 5.500848716316571,
      "grad_norm": 0.6624063590560971,
      "learning_rate": 2.8295650921924044e-05,
      "loss": 1.1899,
      "num_input_tokens_seen": 40794607104,
      "step": 51851
    },
    {
      "epoch": 5.500954805856143,
      "grad_norm": 0.7202852510520412,
      "learning_rate": 2.8294962016915884e-05,
      "loss": 1.1308,
      "num_input_tokens_seen": 40795393840,
      "step": 51852
    },
    {
      "epoch": 5.501060895395714,
      "grad_norm": 0.6893942644001156,
      "learning_rate": 2.829427310936148e-05,
      "loss": 1.1198,
      "num_input_tokens_seen": 40796180624,
      "step": 51853
    },
    {
      "epoch": 5.501166984935285,
      "grad_norm": 0.6563180883679052,
      "learning_rate": 2.829358419926136e-05,
      "loss": 1.1435,
      "num_input_tokens_seen": 40796967392,
      "step": 51854
    },
    {
      "epoch": 5.501273074474857,
      "grad_norm": 0.7348712008257966,
      "learning_rate": 2.829289528661605e-05,
      "loss": 1.2516,
      "num_input_tokens_seen": 40797754096,
      "step": 51855
    },
    {
      "epoch": 5.501379164014428,
      "grad_norm": 0.8722390706624471,
      "learning_rate": 2.8292206371426095e-05,
      "loss": 1.1869,
      "num_input_tokens_seen": 40798540928,
      "step": 51856
    },
    {
      "epoch": 5.501485253554,
      "grad_norm": 0.8958625063419513,
      "learning_rate": 2.8291517453692014e-05,
      "loss": 1.1601,
      "num_input_tokens_seen": 40799327888,
      "step": 51857
    },
    {
      "epoch": 5.501591343093571,
      "grad_norm": 0.6455881599421177,
      "learning_rate": 2.8290828533414343e-05,
      "loss": 1.0688,
      "num_input_tokens_seen": 40800114672,
      "step": 51858
    },
    {
      "epoch": 5.501697432633143,
      "grad_norm": 0.6433157152821997,
      "learning_rate": 2.829013961059362e-05,
      "loss": 1.1174,
      "num_input_tokens_seen": 40800901520,
      "step": 51859
    },
    {
      "epoch": 5.501803522172714,
      "grad_norm": 0.7148377358679935,
      "learning_rate": 2.8289450685230366e-05,
      "loss": 1.1865,
      "num_input_tokens_seen": 40801688240,
      "step": 51860
    },
    {
      "epoch": 5.501909611712286,
      "grad_norm": 0.5402806934322173,
      "learning_rate": 2.8288761757325134e-05,
      "loss": 1.2165,
      "num_input_tokens_seen": 40802475104,
      "step": 51861
    },
    {
      "epoch": 5.502015701251857,
      "grad_norm": 0.9530616668088391,
      "learning_rate": 2.8288072826878436e-05,
      "loss": 1.1959,
      "num_input_tokens_seen": 40803261888,
      "step": 51862
    },
    {
      "epoch": 5.502121790791428,
      "grad_norm": 0.6608342522774943,
      "learning_rate": 2.8287383893890806e-05,
      "loss": 1.1181,
      "num_input_tokens_seen": 40804048592,
      "step": 51863
    },
    {
      "epoch": 5.502227880331,
      "grad_norm": 0.6204982831921905,
      "learning_rate": 2.8286694958362792e-05,
      "loss": 1.1525,
      "num_input_tokens_seen": 40804835376,
      "step": 51864
    },
    {
      "epoch": 5.502333969870571,
      "grad_norm": 0.9763222831550384,
      "learning_rate": 2.8286006020294912e-05,
      "loss": 1.0952,
      "num_input_tokens_seen": 40805622192,
      "step": 51865
    },
    {
      "epoch": 5.502440059410143,
      "grad_norm": 0.5821189406810392,
      "learning_rate": 2.8285317079687703e-05,
      "loss": 1.1184,
      "num_input_tokens_seen": 40806409120,
      "step": 51866
    },
    {
      "epoch": 5.502546148949714,
      "grad_norm": 0.6242697963554165,
      "learning_rate": 2.82846281365417e-05,
      "loss": 1.0754,
      "num_input_tokens_seen": 40807195904,
      "step": 51867
    },
    {
      "epoch": 5.502652238489285,
      "grad_norm": 0.6125383467749134,
      "learning_rate": 2.8283939190857433e-05,
      "loss": 1.1707,
      "num_input_tokens_seen": 40807982704,
      "step": 51868
    },
    {
      "epoch": 5.502758328028857,
      "grad_norm": 0.7236057603894765,
      "learning_rate": 2.8283250242635428e-05,
      "loss": 1.1732,
      "num_input_tokens_seen": 40808769504,
      "step": 51869
    },
    {
      "epoch": 5.502864417568428,
      "grad_norm": 0.7468031128717406,
      "learning_rate": 2.828256129187623e-05,
      "loss": 1.1548,
      "num_input_tokens_seen": 40809556304,
      "step": 51870
    },
    {
      "epoch": 5.5029705071079995,
      "grad_norm": 1.0217279876684324,
      "learning_rate": 2.8281872338580368e-05,
      "loss": 1.1886,
      "num_input_tokens_seen": 40810343104,
      "step": 51871
    },
    {
      "epoch": 5.5030765966475705,
      "grad_norm": 0.6632944349041462,
      "learning_rate": 2.828118338274836e-05,
      "loss": 1.138,
      "num_input_tokens_seen": 40811129824,
      "step": 51872
    },
    {
      "epoch": 5.503182686187142,
      "grad_norm": 0.9548562721540184,
      "learning_rate": 2.828049442438076e-05,
      "loss": 1.2124,
      "num_input_tokens_seen": 40811916576,
      "step": 51873
    },
    {
      "epoch": 5.5032887757267135,
      "grad_norm": 0.7228386074539603,
      "learning_rate": 2.8279805463478082e-05,
      "loss": 1.188,
      "num_input_tokens_seen": 40812703296,
      "step": 51874
    },
    {
      "epoch": 5.5033948652662845,
      "grad_norm": 0.6956048667999846,
      "learning_rate": 2.827911650004087e-05,
      "loss": 1.192,
      "num_input_tokens_seen": 40813490112,
      "step": 51875
    },
    {
      "epoch": 5.503500954805856,
      "grad_norm": 0.6772655188792037,
      "learning_rate": 2.8278427534069653e-05,
      "loss": 1.1107,
      "num_input_tokens_seen": 40814276896,
      "step": 51876
    },
    {
      "epoch": 5.5036070443454275,
      "grad_norm": 0.7042082120433044,
      "learning_rate": 2.8277738565564965e-05,
      "loss": 1.0895,
      "num_input_tokens_seen": 40815063664,
      "step": 51877
    },
    {
      "epoch": 5.5037131338849985,
      "grad_norm": 0.6361828663050648,
      "learning_rate": 2.827704959452733e-05,
      "loss": 1.1771,
      "num_input_tokens_seen": 40815850464,
      "step": 51878
    },
    {
      "epoch": 5.50381922342457,
      "grad_norm": 0.6755067310303399,
      "learning_rate": 2.82763606209573e-05,
      "loss": 1.1678,
      "num_input_tokens_seen": 40816637232,
      "step": 51879
    },
    {
      "epoch": 5.5039253129641414,
      "grad_norm": 0.6693435822643042,
      "learning_rate": 2.827567164485539e-05,
      "loss": 1.193,
      "num_input_tokens_seen": 40817424000,
      "step": 51880
    },
    {
      "epoch": 5.504031402503713,
      "grad_norm": 0.5736146442420474,
      "learning_rate": 2.8274982666222127e-05,
      "loss": 1.2303,
      "num_input_tokens_seen": 40818210880,
      "step": 51881
    },
    {
      "epoch": 5.504137492043284,
      "grad_norm": 0.5942515833844904,
      "learning_rate": 2.827429368505806e-05,
      "loss": 1.1237,
      "num_input_tokens_seen": 40818997712,
      "step": 51882
    },
    {
      "epoch": 5.504243581582856,
      "grad_norm": 0.9080513482030382,
      "learning_rate": 2.827360470136372e-05,
      "loss": 1.1746,
      "num_input_tokens_seen": 40819784496,
      "step": 51883
    },
    {
      "epoch": 5.504349671122427,
      "grad_norm": 0.6317396116326982,
      "learning_rate": 2.827291571513963e-05,
      "loss": 1.1771,
      "num_input_tokens_seen": 40820571216,
      "step": 51884
    },
    {
      "epoch": 5.504455760661998,
      "grad_norm": 0.7519915616824342,
      "learning_rate": 2.827222672638633e-05,
      "loss": 1.119,
      "num_input_tokens_seen": 40821358032,
      "step": 51885
    },
    {
      "epoch": 5.50456185020157,
      "grad_norm": 0.610188148103155,
      "learning_rate": 2.8271537735104343e-05,
      "loss": 1.1727,
      "num_input_tokens_seen": 40822144816,
      "step": 51886
    },
    {
      "epoch": 5.504667939741141,
      "grad_norm": 0.6379651356730178,
      "learning_rate": 2.8270848741294214e-05,
      "loss": 1.2363,
      "num_input_tokens_seen": 40822931600,
      "step": 51887
    },
    {
      "epoch": 5.504774029280713,
      "grad_norm": 0.5771413458215514,
      "learning_rate": 2.8270159744956465e-05,
      "loss": 1.2045,
      "num_input_tokens_seen": 40823718272,
      "step": 51888
    },
    {
      "epoch": 5.504880118820284,
      "grad_norm": 0.5888550840536351,
      "learning_rate": 2.826947074609163e-05,
      "loss": 1.1862,
      "num_input_tokens_seen": 40824505024,
      "step": 51889
    },
    {
      "epoch": 5.504986208359856,
      "grad_norm": 0.5136085394218901,
      "learning_rate": 2.826878174470025e-05,
      "loss": 1.1727,
      "num_input_tokens_seen": 40825291808,
      "step": 51890
    },
    {
      "epoch": 5.505092297899427,
      "grad_norm": 0.5510084639344803,
      "learning_rate": 2.8268092740782855e-05,
      "loss": 1.0474,
      "num_input_tokens_seen": 40826078560,
      "step": 51891
    },
    {
      "epoch": 5.505198387438998,
      "grad_norm": 0.6558357204502253,
      "learning_rate": 2.826740373433996e-05,
      "loss": 1.1077,
      "num_input_tokens_seen": 40826865296,
      "step": 51892
    },
    {
      "epoch": 5.50530447697857,
      "grad_norm": 0.6385825914822298,
      "learning_rate": 2.8266714725372124e-05,
      "loss": 1.1212,
      "num_input_tokens_seen": 40827652112,
      "step": 51893
    },
    {
      "epoch": 5.505410566518141,
      "grad_norm": 0.5595920380877263,
      "learning_rate": 2.826602571387986e-05,
      "loss": 1.1619,
      "num_input_tokens_seen": 40828438896,
      "step": 51894
    },
    {
      "epoch": 5.505516656057713,
      "grad_norm": 0.7807273926102063,
      "learning_rate": 2.826533669986371e-05,
      "loss": 1.1681,
      "num_input_tokens_seen": 40829225760,
      "step": 51895
    },
    {
      "epoch": 5.505622745597284,
      "grad_norm": 0.5738314097591937,
      "learning_rate": 2.8264647683324202e-05,
      "loss": 1.1071,
      "num_input_tokens_seen": 40830012480,
      "step": 51896
    },
    {
      "epoch": 5.505728835136855,
      "grad_norm": 0.7783011893305775,
      "learning_rate": 2.8263958664261876e-05,
      "loss": 1.222,
      "num_input_tokens_seen": 40830799296,
      "step": 51897
    },
    {
      "epoch": 5.505834924676427,
      "grad_norm": 0.644293937651578,
      "learning_rate": 2.826326964267725e-05,
      "loss": 1.0919,
      "num_input_tokens_seen": 40831586096,
      "step": 51898
    },
    {
      "epoch": 5.505941014215998,
      "grad_norm": 0.6186731396605706,
      "learning_rate": 2.8262580618570866e-05,
      "loss": 1.0911,
      "num_input_tokens_seen": 40832372816,
      "step": 51899
    },
    {
      "epoch": 5.50604710375557,
      "grad_norm": 0.8882540698266846,
      "learning_rate": 2.8261891591943263e-05,
      "loss": 1.1033,
      "num_input_tokens_seen": 40833159568,
      "step": 51900
    },
    {
      "epoch": 5.506153193295141,
      "grad_norm": 0.657271919742929,
      "learning_rate": 2.8261202562794953e-05,
      "loss": 1.163,
      "num_input_tokens_seen": 40833946256,
      "step": 51901
    },
    {
      "epoch": 5.506259282834712,
      "grad_norm": 0.6384866486262638,
      "learning_rate": 2.826051353112649e-05,
      "loss": 1.1411,
      "num_input_tokens_seen": 40834733024,
      "step": 51902
    },
    {
      "epoch": 5.506365372374284,
      "grad_norm": 1.0702913212777156,
      "learning_rate": 2.8259824496938396e-05,
      "loss": 1.1824,
      "num_input_tokens_seen": 40835519792,
      "step": 51903
    },
    {
      "epoch": 5.506471461913855,
      "grad_norm": 0.8997377666009693,
      "learning_rate": 2.8259135460231206e-05,
      "loss": 1.2227,
      "num_input_tokens_seen": 40836306544,
      "step": 51904
    },
    {
      "epoch": 5.506577551453427,
      "grad_norm": 0.6208519684408155,
      "learning_rate": 2.8258446421005458e-05,
      "loss": 1.1985,
      "num_input_tokens_seen": 40837093264,
      "step": 51905
    },
    {
      "epoch": 5.506683640992998,
      "grad_norm": 0.9089115278135951,
      "learning_rate": 2.8257757379261663e-05,
      "loss": 1.1972,
      "num_input_tokens_seen": 40837879952,
      "step": 51906
    },
    {
      "epoch": 5.506789730532569,
      "grad_norm": 0.6181295793907436,
      "learning_rate": 2.8257068335000382e-05,
      "loss": 1.1118,
      "num_input_tokens_seen": 40838666640,
      "step": 51907
    },
    {
      "epoch": 5.506895820072141,
      "grad_norm": 0.6118988547305807,
      "learning_rate": 2.8256379288222136e-05,
      "loss": 1.1505,
      "num_input_tokens_seen": 40839453424,
      "step": 51908
    },
    {
      "epoch": 5.507001909611712,
      "grad_norm": 0.8330352375243869,
      "learning_rate": 2.825569023892744e-05,
      "loss": 1.1208,
      "num_input_tokens_seen": 40840240160,
      "step": 51909
    },
    {
      "epoch": 5.507107999151284,
      "grad_norm": 0.6666932389072265,
      "learning_rate": 2.825500118711685e-05,
      "loss": 1.14,
      "num_input_tokens_seen": 40841026944,
      "step": 51910
    },
    {
      "epoch": 5.507214088690855,
      "grad_norm": 0.6022192640141388,
      "learning_rate": 2.82543121327909e-05,
      "loss": 1.1226,
      "num_input_tokens_seen": 40841813760,
      "step": 51911
    },
    {
      "epoch": 5.507320178230427,
      "grad_norm": 0.8232528132069673,
      "learning_rate": 2.8253623075950096e-05,
      "loss": 1.1481,
      "num_input_tokens_seen": 40842600576,
      "step": 51912
    },
    {
      "epoch": 5.507426267769998,
      "grad_norm": 0.7824049676513475,
      "learning_rate": 2.8252934016595e-05,
      "loss": 1.0602,
      "num_input_tokens_seen": 40843387440,
      "step": 51913
    },
    {
      "epoch": 5.507532357309569,
      "grad_norm": 1.0426893324767008,
      "learning_rate": 2.8252244954726133e-05,
      "loss": 1.1861,
      "num_input_tokens_seen": 40844174160,
      "step": 51914
    },
    {
      "epoch": 5.507638446849141,
      "grad_norm": 0.6066019775809013,
      "learning_rate": 2.8251555890344018e-05,
      "loss": 1.138,
      "num_input_tokens_seen": 40844960928,
      "step": 51915
    },
    {
      "epoch": 5.507744536388712,
      "grad_norm": 0.760327627973051,
      "learning_rate": 2.82508668234492e-05,
      "loss": 1.1975,
      "num_input_tokens_seen": 40845747696,
      "step": 51916
    },
    {
      "epoch": 5.507850625928284,
      "grad_norm": 0.7199645042304106,
      "learning_rate": 2.825017775404221e-05,
      "loss": 1.2259,
      "num_input_tokens_seen": 40846534496,
      "step": 51917
    },
    {
      "epoch": 5.507956715467855,
      "grad_norm": 0.6927710193554362,
      "learning_rate": 2.8249488682123576e-05,
      "loss": 1.187,
      "num_input_tokens_seen": 40847321216,
      "step": 51918
    },
    {
      "epoch": 5.508062805007427,
      "grad_norm": 0.550008358302218,
      "learning_rate": 2.824879960769383e-05,
      "loss": 1.0914,
      "num_input_tokens_seen": 40848107872,
      "step": 51919
    },
    {
      "epoch": 5.508168894546998,
      "grad_norm": 0.705828794209771,
      "learning_rate": 2.8248110530753507e-05,
      "loss": 1.0916,
      "num_input_tokens_seen": 40848894768,
      "step": 51920
    },
    {
      "epoch": 5.508274984086569,
      "grad_norm": 0.8565554497199136,
      "learning_rate": 2.8247421451303146e-05,
      "loss": 1.137,
      "num_input_tokens_seen": 40849681568,
      "step": 51921
    },
    {
      "epoch": 5.508381073626141,
      "grad_norm": 0.5874899291338875,
      "learning_rate": 2.8246732369343264e-05,
      "loss": 1.1534,
      "num_input_tokens_seen": 40850468384,
      "step": 51922
    },
    {
      "epoch": 5.508487163165712,
      "grad_norm": 0.6599912387577916,
      "learning_rate": 2.8246043284874413e-05,
      "loss": 1.0748,
      "num_input_tokens_seen": 40851255184,
      "step": 51923
    },
    {
      "epoch": 5.508593252705284,
      "grad_norm": 1.0869271751569969,
      "learning_rate": 2.82453541978971e-05,
      "loss": 1.1933,
      "num_input_tokens_seen": 40852041936,
      "step": 51924
    },
    {
      "epoch": 5.508699342244855,
      "grad_norm": 0.6053097840777288,
      "learning_rate": 2.8244665108411888e-05,
      "loss": 1.1807,
      "num_input_tokens_seen": 40852828672,
      "step": 51925
    },
    {
      "epoch": 5.508805431784426,
      "grad_norm": 1.2219401386804682,
      "learning_rate": 2.8243976016419287e-05,
      "loss": 1.2057,
      "num_input_tokens_seen": 40853615392,
      "step": 51926
    },
    {
      "epoch": 5.508911521323998,
      "grad_norm": 0.6236669331285455,
      "learning_rate": 2.8243286921919838e-05,
      "loss": 1.1252,
      "num_input_tokens_seen": 40854402112,
      "step": 51927
    },
    {
      "epoch": 5.509017610863569,
      "grad_norm": 0.8899662980977256,
      "learning_rate": 2.824259782491407e-05,
      "loss": 1.1289,
      "num_input_tokens_seen": 40855188848,
      "step": 51928
    },
    {
      "epoch": 5.509123700403141,
      "grad_norm": 0.6391901050300988,
      "learning_rate": 2.8241908725402516e-05,
      "loss": 1.0935,
      "num_input_tokens_seen": 40855975584,
      "step": 51929
    },
    {
      "epoch": 5.509229789942712,
      "grad_norm": 0.6691797681824455,
      "learning_rate": 2.8241219623385717e-05,
      "loss": 1.0339,
      "num_input_tokens_seen": 40856762336,
      "step": 51930
    },
    {
      "epoch": 5.509335879482283,
      "grad_norm": 0.7595743023141974,
      "learning_rate": 2.8240530518864195e-05,
      "loss": 1.1901,
      "num_input_tokens_seen": 40857549136,
      "step": 51931
    },
    {
      "epoch": 5.509441969021855,
      "grad_norm": 0.5920436792689298,
      "learning_rate": 2.823984141183848e-05,
      "loss": 1.2137,
      "num_input_tokens_seen": 40858335936,
      "step": 51932
    },
    {
      "epoch": 5.509548058561426,
      "grad_norm": 0.7515231441446281,
      "learning_rate": 2.823915230230912e-05,
      "loss": 0.9632,
      "num_input_tokens_seen": 40859122736,
      "step": 51933
    },
    {
      "epoch": 5.5096541481009975,
      "grad_norm": 0.8228447002014344,
      "learning_rate": 2.8238463190276637e-05,
      "loss": 1.2507,
      "num_input_tokens_seen": 40859909584,
      "step": 51934
    },
    {
      "epoch": 5.5097602376405685,
      "grad_norm": 0.8755638899601338,
      "learning_rate": 2.823777407574156e-05,
      "loss": 1.1564,
      "num_input_tokens_seen": 40860696368,
      "step": 51935
    },
    {
      "epoch": 5.50986632718014,
      "grad_norm": 0.8805816193774412,
      "learning_rate": 2.823708495870443e-05,
      "loss": 1.1606,
      "num_input_tokens_seen": 40861483040,
      "step": 51936
    },
    {
      "epoch": 5.5099724167197115,
      "grad_norm": 0.698280638335838,
      "learning_rate": 2.8236395839165776e-05,
      "loss": 1.0512,
      "num_input_tokens_seen": 40862269824,
      "step": 51937
    },
    {
      "epoch": 5.5100785062592825,
      "grad_norm": 0.8237176725140657,
      "learning_rate": 2.823570671712612e-05,
      "loss": 1.1449,
      "num_input_tokens_seen": 40863056528,
      "step": 51938
    },
    {
      "epoch": 5.5101845957988544,
      "grad_norm": 0.729335269409689,
      "learning_rate": 2.8235017592586015e-05,
      "loss": 1.0929,
      "num_input_tokens_seen": 40863843360,
      "step": 51939
    },
    {
      "epoch": 5.5102906853384255,
      "grad_norm": 0.8040489761267325,
      "learning_rate": 2.8234328465545982e-05,
      "loss": 1.1615,
      "num_input_tokens_seen": 40864630128,
      "step": 51940
    },
    {
      "epoch": 5.510396774877997,
      "grad_norm": 0.8850201267583402,
      "learning_rate": 2.8233639336006552e-05,
      "loss": 1.1757,
      "num_input_tokens_seen": 40865416816,
      "step": 51941
    },
    {
      "epoch": 5.510502864417568,
      "grad_norm": 0.941089920195261,
      "learning_rate": 2.8232950203968267e-05,
      "loss": 1.14,
      "num_input_tokens_seen": 40866203488,
      "step": 51942
    },
    {
      "epoch": 5.5106089539571395,
      "grad_norm": 0.8109470412776668,
      "learning_rate": 2.8232261069431647e-05,
      "loss": 1.186,
      "num_input_tokens_seen": 40866990128,
      "step": 51943
    },
    {
      "epoch": 5.510715043496711,
      "grad_norm": 0.9942893970618522,
      "learning_rate": 2.8231571932397226e-05,
      "loss": 1.1487,
      "num_input_tokens_seen": 40867776848,
      "step": 51944
    },
    {
      "epoch": 5.510821133036282,
      "grad_norm": 0.7751765585814508,
      "learning_rate": 2.8230882792865555e-05,
      "loss": 1.0699,
      "num_input_tokens_seen": 40868563744,
      "step": 51945
    },
    {
      "epoch": 5.510927222575854,
      "grad_norm": 0.7388142410727362,
      "learning_rate": 2.823019365083714e-05,
      "loss": 1.1043,
      "num_input_tokens_seen": 40869350576,
      "step": 51946
    },
    {
      "epoch": 5.511033312115425,
      "grad_norm": 0.7395587921773995,
      "learning_rate": 2.822950450631253e-05,
      "loss": 1.1653,
      "num_input_tokens_seen": 40870137312,
      "step": 51947
    },
    {
      "epoch": 5.511139401654997,
      "grad_norm": 0.5905675255420915,
      "learning_rate": 2.822881535929226e-05,
      "loss": 1.0243,
      "num_input_tokens_seen": 40870924048,
      "step": 51948
    },
    {
      "epoch": 5.511245491194568,
      "grad_norm": 0.7558744089469084,
      "learning_rate": 2.8228126209776847e-05,
      "loss": 1.2435,
      "num_input_tokens_seen": 40871710832,
      "step": 51949
    },
    {
      "epoch": 5.511351580734139,
      "grad_norm": 0.6392606196473009,
      "learning_rate": 2.8227437057766835e-05,
      "loss": 1.179,
      "num_input_tokens_seen": 40872497584,
      "step": 51950
    },
    {
      "epoch": 5.511457670273711,
      "grad_norm": 0.7909506173473057,
      "learning_rate": 2.8226747903262756e-05,
      "loss": 1.0901,
      "num_input_tokens_seen": 40873284432,
      "step": 51951
    },
    {
      "epoch": 5.511563759813282,
      "grad_norm": 0.6463860832062356,
      "learning_rate": 2.822605874626514e-05,
      "loss": 1.0496,
      "num_input_tokens_seen": 40874071168,
      "step": 51952
    },
    {
      "epoch": 5.511669849352854,
      "grad_norm": 0.7495624660977471,
      "learning_rate": 2.8225369586774526e-05,
      "loss": 1.1477,
      "num_input_tokens_seen": 40874858000,
      "step": 51953
    },
    {
      "epoch": 5.511775938892425,
      "grad_norm": 0.6419403299777352,
      "learning_rate": 2.8224680424791434e-05,
      "loss": 1.1882,
      "num_input_tokens_seen": 40875644688,
      "step": 51954
    },
    {
      "epoch": 5.511882028431996,
      "grad_norm": 0.6269675262840428,
      "learning_rate": 2.82239912603164e-05,
      "loss": 1.1115,
      "num_input_tokens_seen": 40876431472,
      "step": 51955
    },
    {
      "epoch": 5.511988117971568,
      "grad_norm": 0.693996640072808,
      "learning_rate": 2.8223302093349973e-05,
      "loss": 1.1789,
      "num_input_tokens_seen": 40877218176,
      "step": 51956
    },
    {
      "epoch": 5.512094207511139,
      "grad_norm": 0.7239169663958441,
      "learning_rate": 2.8222612923892665e-05,
      "loss": 1.232,
      "num_input_tokens_seen": 40878004816,
      "step": 51957
    },
    {
      "epoch": 5.512200297050711,
      "grad_norm": 0.8471337951366555,
      "learning_rate": 2.8221923751945013e-05,
      "loss": 1.2001,
      "num_input_tokens_seen": 40878791552,
      "step": 51958
    },
    {
      "epoch": 5.512306386590282,
      "grad_norm": 0.5906588879034145,
      "learning_rate": 2.822123457750756e-05,
      "loss": 1.1605,
      "num_input_tokens_seen": 40879578400,
      "step": 51959
    },
    {
      "epoch": 5.512412476129853,
      "grad_norm": 0.6971840773775863,
      "learning_rate": 2.822054540058083e-05,
      "loss": 1.1682,
      "num_input_tokens_seen": 40880365136,
      "step": 51960
    },
    {
      "epoch": 5.512518565669425,
      "grad_norm": 0.742774513872005,
      "learning_rate": 2.821985622116535e-05,
      "loss": 1.1204,
      "num_input_tokens_seen": 40881151920,
      "step": 51961
    },
    {
      "epoch": 5.512624655208996,
      "grad_norm": 0.5616565995218263,
      "learning_rate": 2.8219167039261667e-05,
      "loss": 1.1513,
      "num_input_tokens_seen": 40881938640,
      "step": 51962
    },
    {
      "epoch": 5.512730744748568,
      "grad_norm": 0.7765790023156363,
      "learning_rate": 2.82184778548703e-05,
      "loss": 1.1219,
      "num_input_tokens_seen": 40882725520,
      "step": 51963
    },
    {
      "epoch": 5.512836834288139,
      "grad_norm": 0.7270825961444453,
      "learning_rate": 2.8217788667991795e-05,
      "loss": 1.1121,
      "num_input_tokens_seen": 40883512256,
      "step": 51964
    },
    {
      "epoch": 5.51294292382771,
      "grad_norm": 0.6585951884969315,
      "learning_rate": 2.8217099478626675e-05,
      "loss": 1.1676,
      "num_input_tokens_seen": 40884298992,
      "step": 51965
    },
    {
      "epoch": 5.513049013367282,
      "grad_norm": 0.8505662531816817,
      "learning_rate": 2.8216410286775473e-05,
      "loss": 1.2256,
      "num_input_tokens_seen": 40885085760,
      "step": 51966
    },
    {
      "epoch": 5.513155102906853,
      "grad_norm": 0.5852943615993985,
      "learning_rate": 2.8215721092438724e-05,
      "loss": 1.0656,
      "num_input_tokens_seen": 40885872592,
      "step": 51967
    },
    {
      "epoch": 5.513261192446425,
      "grad_norm": 0.6825089846520032,
      "learning_rate": 2.821503189561696e-05,
      "loss": 1.0504,
      "num_input_tokens_seen": 40886659264,
      "step": 51968
    },
    {
      "epoch": 5.513367281985996,
      "grad_norm": 0.8590918493048624,
      "learning_rate": 2.8214342696310715e-05,
      "loss": 1.1262,
      "num_input_tokens_seen": 40887446000,
      "step": 51969
    },
    {
      "epoch": 5.513473371525568,
      "grad_norm": 0.7060015126642093,
      "learning_rate": 2.8213653494520513e-05,
      "loss": 1.2464,
      "num_input_tokens_seen": 40888232784,
      "step": 51970
    },
    {
      "epoch": 5.513579461065139,
      "grad_norm": 0.7937331830571449,
      "learning_rate": 2.8212964290246902e-05,
      "loss": 1.2169,
      "num_input_tokens_seen": 40889019408,
      "step": 51971
    },
    {
      "epoch": 5.51368555060471,
      "grad_norm": 0.6405511368288556,
      "learning_rate": 2.8212275083490404e-05,
      "loss": 1.154,
      "num_input_tokens_seen": 40889806144,
      "step": 51972
    },
    {
      "epoch": 5.513791640144282,
      "grad_norm": 0.6363891319737004,
      "learning_rate": 2.8211585874251557e-05,
      "loss": 1.1134,
      "num_input_tokens_seen": 40890592960,
      "step": 51973
    },
    {
      "epoch": 5.513897729683853,
      "grad_norm": 0.8845339626390175,
      "learning_rate": 2.821089666253089e-05,
      "loss": 1.1474,
      "num_input_tokens_seen": 40891379744,
      "step": 51974
    },
    {
      "epoch": 5.514003819223425,
      "grad_norm": 0.6541018420435162,
      "learning_rate": 2.821020744832893e-05,
      "loss": 1.0459,
      "num_input_tokens_seen": 40892166544,
      "step": 51975
    },
    {
      "epoch": 5.514109908762996,
      "grad_norm": 0.7668950996327486,
      "learning_rate": 2.8209518231646226e-05,
      "loss": 1.1745,
      "num_input_tokens_seen": 40892953200,
      "step": 51976
    },
    {
      "epoch": 5.514215998302568,
      "grad_norm": 1.1056517790832545,
      "learning_rate": 2.8208829012483296e-05,
      "loss": 1.2061,
      "num_input_tokens_seen": 40893739968,
      "step": 51977
    },
    {
      "epoch": 5.514322087842139,
      "grad_norm": 0.653352876530571,
      "learning_rate": 2.820813979084067e-05,
      "loss": 1.2085,
      "num_input_tokens_seen": 40894526672,
      "step": 51978
    },
    {
      "epoch": 5.51442817738171,
      "grad_norm": 0.685427475136125,
      "learning_rate": 2.8207450566718897e-05,
      "loss": 1.1803,
      "num_input_tokens_seen": 40895313344,
      "step": 51979
    },
    {
      "epoch": 5.514534266921282,
      "grad_norm": 0.8769415879291036,
      "learning_rate": 2.82067613401185e-05,
      "loss": 1.1645,
      "num_input_tokens_seen": 40896100128,
      "step": 51980
    },
    {
      "epoch": 5.514640356460853,
      "grad_norm": 0.7587409120105659,
      "learning_rate": 2.8206072111040006e-05,
      "loss": 1.2556,
      "num_input_tokens_seen": 40896886912,
      "step": 51981
    },
    {
      "epoch": 5.514746446000425,
      "grad_norm": 0.5637664603814047,
      "learning_rate": 2.820538287948396e-05,
      "loss": 1.2056,
      "num_input_tokens_seen": 40897673568,
      "step": 51982
    },
    {
      "epoch": 5.514852535539996,
      "grad_norm": 0.8019593783956701,
      "learning_rate": 2.8204693645450885e-05,
      "loss": 1.1602,
      "num_input_tokens_seen": 40898460336,
      "step": 51983
    },
    {
      "epoch": 5.514958625079567,
      "grad_norm": 0.5978292842736724,
      "learning_rate": 2.8204004408941314e-05,
      "loss": 1.0716,
      "num_input_tokens_seen": 40899247088,
      "step": 51984
    },
    {
      "epoch": 5.515064714619139,
      "grad_norm": 0.5997360555997266,
      "learning_rate": 2.8203315169955784e-05,
      "loss": 1.1772,
      "num_input_tokens_seen": 40900033840,
      "step": 51985
    },
    {
      "epoch": 5.51517080415871,
      "grad_norm": 0.7121622494178782,
      "learning_rate": 2.820262592849483e-05,
      "loss": 1.1634,
      "num_input_tokens_seen": 40900820528,
      "step": 51986
    },
    {
      "epoch": 5.515276893698282,
      "grad_norm": 0.7145814466744458,
      "learning_rate": 2.8201936684558977e-05,
      "loss": 1.1718,
      "num_input_tokens_seen": 40901607216,
      "step": 51987
    },
    {
      "epoch": 5.515382983237853,
      "grad_norm": 0.6492711132966459,
      "learning_rate": 2.8201247438148763e-05,
      "loss": 1.1804,
      "num_input_tokens_seen": 40902394000,
      "step": 51988
    },
    {
      "epoch": 5.515489072777424,
      "grad_norm": 1.0244425992030004,
      "learning_rate": 2.8200558189264715e-05,
      "loss": 1.1763,
      "num_input_tokens_seen": 40903180784,
      "step": 51989
    },
    {
      "epoch": 5.515595162316996,
      "grad_norm": 0.5619517666496822,
      "learning_rate": 2.8199868937907375e-05,
      "loss": 1.1239,
      "num_input_tokens_seen": 40903967584,
      "step": 51990
    },
    {
      "epoch": 5.515701251856567,
      "grad_norm": 0.5803410079886222,
      "learning_rate": 2.819917968407727e-05,
      "loss": 1.1592,
      "num_input_tokens_seen": 40904754352,
      "step": 51991
    },
    {
      "epoch": 5.515807341396139,
      "grad_norm": 0.7072018038655566,
      "learning_rate": 2.8198490427774925e-05,
      "loss": 1.0516,
      "num_input_tokens_seen": 40905541184,
      "step": 51992
    },
    {
      "epoch": 5.51591343093571,
      "grad_norm": 0.7660343023186299,
      "learning_rate": 2.8197801169000887e-05,
      "loss": 1.1919,
      "num_input_tokens_seen": 40906327968,
      "step": 51993
    },
    {
      "epoch": 5.516019520475281,
      "grad_norm": 0.6075668146718842,
      "learning_rate": 2.8197111907755687e-05,
      "loss": 1.2032,
      "num_input_tokens_seen": 40907114672,
      "step": 51994
    },
    {
      "epoch": 5.516125610014853,
      "grad_norm": 0.6539046307753028,
      "learning_rate": 2.8196422644039845e-05,
      "loss": 1.1357,
      "num_input_tokens_seen": 40907901392,
      "step": 51995
    },
    {
      "epoch": 5.516231699554424,
      "grad_norm": 0.6118433246124949,
      "learning_rate": 2.81957333778539e-05,
      "loss": 1.0407,
      "num_input_tokens_seen": 40908688176,
      "step": 51996
    },
    {
      "epoch": 5.5163377890939955,
      "grad_norm": 0.5723223667915973,
      "learning_rate": 2.8195044109198394e-05,
      "loss": 1.1088,
      "num_input_tokens_seen": 40909474944,
      "step": 51997
    },
    {
      "epoch": 5.5164438786335666,
      "grad_norm": 0.8562030946499231,
      "learning_rate": 2.8194354838073846e-05,
      "loss": 1.2046,
      "num_input_tokens_seen": 40910261584,
      "step": 51998
    },
    {
      "epoch": 5.5165499681731385,
      "grad_norm": 0.6224905485212255,
      "learning_rate": 2.8193665564480793e-05,
      "loss": 1.1219,
      "num_input_tokens_seen": 40911048336,
      "step": 51999
    },
    {
      "epoch": 5.5166560577127095,
      "grad_norm": 0.570666252157899,
      "learning_rate": 2.819297628841977e-05,
      "loss": 1.2119,
      "num_input_tokens_seen": 40911835168,
      "step": 52000
    },
    {
      "epoch": 5.5166560577127095,
      "eval_loss": 1.5375289916992188,
      "eval_runtime": 64.927,
      "eval_samples_per_second": 46.206,
      "eval_steps_per_second": 0.493,
      "num_input_tokens_seen": 40911835168,
      "step": 52000
    },
    {
      "epoch": 5.516762147252281,
      "grad_norm": 0.6515525075022961,
      "learning_rate": 2.819228700989131e-05,
      "loss": 1.1455,
      "num_input_tokens_seen": 40912621920,
      "step": 52001
    },
    {
      "epoch": 5.5168682367918525,
      "grad_norm": 0.6091693181217875,
      "learning_rate": 2.8191597728895946e-05,
      "loss": 1.1505,
      "num_input_tokens_seen": 40913408688,
      "step": 52002
    },
    {
      "epoch": 5.5169743263314235,
      "grad_norm": 0.6635762451709543,
      "learning_rate": 2.8190908445434207e-05,
      "loss": 1.2425,
      "num_input_tokens_seen": 40914195408,
      "step": 52003
    },
    {
      "epoch": 5.517080415870995,
      "grad_norm": 0.7348250122147161,
      "learning_rate": 2.8190219159506626e-05,
      "loss": 1.1032,
      "num_input_tokens_seen": 40914982128,
      "step": 52004
    },
    {
      "epoch": 5.517186505410566,
      "grad_norm": 0.7305222995925363,
      "learning_rate": 2.818952987111374e-05,
      "loss": 1.2121,
      "num_input_tokens_seen": 40915768976,
      "step": 52005
    },
    {
      "epoch": 5.517292594950138,
      "grad_norm": 0.5974345369748207,
      "learning_rate": 2.818884058025607e-05,
      "loss": 1.1037,
      "num_input_tokens_seen": 40916555696,
      "step": 52006
    },
    {
      "epoch": 5.517398684489709,
      "grad_norm": 0.8126303997219452,
      "learning_rate": 2.818815128693417e-05,
      "loss": 1.2195,
      "num_input_tokens_seen": 40917342432,
      "step": 52007
    },
    {
      "epoch": 5.51750477402928,
      "grad_norm": 0.5934373609251198,
      "learning_rate": 2.8187461991148557e-05,
      "loss": 1.106,
      "num_input_tokens_seen": 40918129232,
      "step": 52008
    },
    {
      "epoch": 5.517610863568852,
      "grad_norm": 0.5884515667747533,
      "learning_rate": 2.818677269289976e-05,
      "loss": 1.146,
      "num_input_tokens_seen": 40918916000,
      "step": 52009
    },
    {
      "epoch": 5.517716953108423,
      "grad_norm": 0.7325229311014541,
      "learning_rate": 2.8186083392188328e-05,
      "loss": 1.1508,
      "num_input_tokens_seen": 40919702768,
      "step": 52010
    },
    {
      "epoch": 5.517823042647995,
      "grad_norm": 0.7655946342212873,
      "learning_rate": 2.8185394089014784e-05,
      "loss": 1.1498,
      "num_input_tokens_seen": 40920489536,
      "step": 52011
    },
    {
      "epoch": 5.517929132187566,
      "grad_norm": 0.6307113999806979,
      "learning_rate": 2.818470478337965e-05,
      "loss": 1.1394,
      "num_input_tokens_seen": 40921276336,
      "step": 52012
    },
    {
      "epoch": 5.518035221727137,
      "grad_norm": 0.713052478651056,
      "learning_rate": 2.8184015475283483e-05,
      "loss": 1.1551,
      "num_input_tokens_seen": 40922063232,
      "step": 52013
    },
    {
      "epoch": 5.518141311266709,
      "grad_norm": 0.9319337901760606,
      "learning_rate": 2.8183326164726796e-05,
      "loss": 1.1679,
      "num_input_tokens_seen": 40922849952,
      "step": 52014
    },
    {
      "epoch": 5.51824740080628,
      "grad_norm": 0.5731151768889124,
      "learning_rate": 2.818263685171012e-05,
      "loss": 1.1533,
      "num_input_tokens_seen": 40923636688,
      "step": 52015
    },
    {
      "epoch": 5.518353490345852,
      "grad_norm": 0.7285599096157155,
      "learning_rate": 2.818194753623401e-05,
      "loss": 1.1661,
      "num_input_tokens_seen": 40924423440,
      "step": 52016
    },
    {
      "epoch": 5.518459579885423,
      "grad_norm": 0.7231138671526672,
      "learning_rate": 2.8181258218298977e-05,
      "loss": 1.147,
      "num_input_tokens_seen": 40925210240,
      "step": 52017
    },
    {
      "epoch": 5.518565669424994,
      "grad_norm": 0.6011488645231351,
      "learning_rate": 2.8180568897905558e-05,
      "loss": 1.1786,
      "num_input_tokens_seen": 40925997072,
      "step": 52018
    },
    {
      "epoch": 5.518671758964566,
      "grad_norm": 0.6689018900245052,
      "learning_rate": 2.817987957505429e-05,
      "loss": 1.2078,
      "num_input_tokens_seen": 40926783872,
      "step": 52019
    },
    {
      "epoch": 5.518777848504137,
      "grad_norm": 0.6678846480250467,
      "learning_rate": 2.817919024974571e-05,
      "loss": 1.1784,
      "num_input_tokens_seen": 40927570672,
      "step": 52020
    },
    {
      "epoch": 5.518883938043709,
      "grad_norm": 0.6424243680099192,
      "learning_rate": 2.8178500921980338e-05,
      "loss": 1.2869,
      "num_input_tokens_seen": 40928357344,
      "step": 52021
    },
    {
      "epoch": 5.51899002758328,
      "grad_norm": 0.58834666079777,
      "learning_rate": 2.8177811591758718e-05,
      "loss": 1.1114,
      "num_input_tokens_seen": 40929144064,
      "step": 52022
    },
    {
      "epoch": 5.519096117122851,
      "grad_norm": 0.5830046515614895,
      "learning_rate": 2.817712225908138e-05,
      "loss": 1.1649,
      "num_input_tokens_seen": 40929930800,
      "step": 52023
    },
    {
      "epoch": 5.519202206662423,
      "grad_norm": 0.6094544656215716,
      "learning_rate": 2.817643292394885e-05,
      "loss": 1.2145,
      "num_input_tokens_seen": 40930717504,
      "step": 52024
    },
    {
      "epoch": 5.519308296201994,
      "grad_norm": 0.617525785402451,
      "learning_rate": 2.8175743586361668e-05,
      "loss": 1.1592,
      "num_input_tokens_seen": 40931504256,
      "step": 52025
    },
    {
      "epoch": 5.519414385741566,
      "grad_norm": 0.6950648130038608,
      "learning_rate": 2.817505424632037e-05,
      "loss": 1.147,
      "num_input_tokens_seen": 40932291024,
      "step": 52026
    },
    {
      "epoch": 5.519520475281137,
      "grad_norm": 0.7603316228185262,
      "learning_rate": 2.8174364903825477e-05,
      "loss": 1.1372,
      "num_input_tokens_seen": 40933077808,
      "step": 52027
    },
    {
      "epoch": 5.519626564820709,
      "grad_norm": 0.6867291375062328,
      "learning_rate": 2.8173675558877532e-05,
      "loss": 1.1284,
      "num_input_tokens_seen": 40933864624,
      "step": 52028
    },
    {
      "epoch": 5.51973265436028,
      "grad_norm": 0.892661944295176,
      "learning_rate": 2.8172986211477064e-05,
      "loss": 1.1577,
      "num_input_tokens_seen": 40934651440,
      "step": 52029
    },
    {
      "epoch": 5.519838743899852,
      "grad_norm": 0.6161155358347955,
      "learning_rate": 2.8172296861624598e-05,
      "loss": 1.1275,
      "num_input_tokens_seen": 40935438192,
      "step": 52030
    },
    {
      "epoch": 5.519944833439423,
      "grad_norm": 0.9223248360445019,
      "learning_rate": 2.817160750932068e-05,
      "loss": 1.1597,
      "num_input_tokens_seen": 40936225024,
      "step": 52031
    },
    {
      "epoch": 5.520050922978994,
      "grad_norm": 0.7510973148480029,
      "learning_rate": 2.8170918154565834e-05,
      "loss": 1.1849,
      "num_input_tokens_seen": 40937011808,
      "step": 52032
    },
    {
      "epoch": 5.520157012518566,
      "grad_norm": 0.5038880367573239,
      "learning_rate": 2.8170228797360597e-05,
      "loss": 1.1017,
      "num_input_tokens_seen": 40937798560,
      "step": 52033
    },
    {
      "epoch": 5.520263102058137,
      "grad_norm": 1.0735649042184139,
      "learning_rate": 2.8169539437705504e-05,
      "loss": 1.1745,
      "num_input_tokens_seen": 40938585344,
      "step": 52034
    },
    {
      "epoch": 5.520369191597709,
      "grad_norm": 0.758448090200554,
      "learning_rate": 2.816885007560108e-05,
      "loss": 1.284,
      "num_input_tokens_seen": 40939372016,
      "step": 52035
    },
    {
      "epoch": 5.52047528113728,
      "grad_norm": 0.6889821040225235,
      "learning_rate": 2.816816071104786e-05,
      "loss": 1.1105,
      "num_input_tokens_seen": 40940158800,
      "step": 52036
    },
    {
      "epoch": 5.520581370676851,
      "grad_norm": 0.5785200919597737,
      "learning_rate": 2.816747134404638e-05,
      "loss": 1.0973,
      "num_input_tokens_seen": 40940945584,
      "step": 52037
    },
    {
      "epoch": 5.520687460216423,
      "grad_norm": 0.9438851613399141,
      "learning_rate": 2.8166781974597167e-05,
      "loss": 1.1862,
      "num_input_tokens_seen": 40941732384,
      "step": 52038
    },
    {
      "epoch": 5.520793549755994,
      "grad_norm": 0.5752110725692006,
      "learning_rate": 2.8166092602700767e-05,
      "loss": 1.1504,
      "num_input_tokens_seen": 40942519088,
      "step": 52039
    },
    {
      "epoch": 5.520899639295566,
      "grad_norm": 0.66078210470548,
      "learning_rate": 2.8165403228357702e-05,
      "loss": 1.2336,
      "num_input_tokens_seen": 40943305840,
      "step": 52040
    },
    {
      "epoch": 5.521005728835137,
      "grad_norm": 0.5405035981661331,
      "learning_rate": 2.8164713851568497e-05,
      "loss": 1.1506,
      "num_input_tokens_seen": 40944092688,
      "step": 52041
    },
    {
      "epoch": 5.521111818374708,
      "grad_norm": 0.8194589764420513,
      "learning_rate": 2.8164024472333705e-05,
      "loss": 1.1741,
      "num_input_tokens_seen": 40944879408,
      "step": 52042
    },
    {
      "epoch": 5.52121790791428,
      "grad_norm": 0.6555959763674959,
      "learning_rate": 2.816333509065384e-05,
      "loss": 1.1955,
      "num_input_tokens_seen": 40945666192,
      "step": 52043
    },
    {
      "epoch": 5.521323997453851,
      "grad_norm": 0.6950239030488923,
      "learning_rate": 2.8162645706529446e-05,
      "loss": 1.166,
      "num_input_tokens_seen": 40946452896,
      "step": 52044
    },
    {
      "epoch": 5.521430086993423,
      "grad_norm": 0.8551245310156813,
      "learning_rate": 2.8161956319961053e-05,
      "loss": 1.2691,
      "num_input_tokens_seen": 40947239584,
      "step": 52045
    },
    {
      "epoch": 5.521536176532994,
      "grad_norm": 0.7194929546044037,
      "learning_rate": 2.8161266930949194e-05,
      "loss": 1.1746,
      "num_input_tokens_seen": 40948026320,
      "step": 52046
    },
    {
      "epoch": 5.521642266072565,
      "grad_norm": 0.6470249567538898,
      "learning_rate": 2.8160577539494393e-05,
      "loss": 1.187,
      "num_input_tokens_seen": 40948813040,
      "step": 52047
    },
    {
      "epoch": 5.521748355612137,
      "grad_norm": 0.6252371227931214,
      "learning_rate": 2.8159888145597196e-05,
      "loss": 1.2313,
      "num_input_tokens_seen": 40949599824,
      "step": 52048
    },
    {
      "epoch": 5.521854445151708,
      "grad_norm": 0.8117849439779804,
      "learning_rate": 2.8159198749258126e-05,
      "loss": 1.1959,
      "num_input_tokens_seen": 40950386560,
      "step": 52049
    },
    {
      "epoch": 5.52196053469128,
      "grad_norm": 0.6283498862837601,
      "learning_rate": 2.8158509350477723e-05,
      "loss": 1.2758,
      "num_input_tokens_seen": 40951173248,
      "step": 52050
    },
    {
      "epoch": 5.522066624230851,
      "grad_norm": 0.7472897627590439,
      "learning_rate": 2.815781994925652e-05,
      "loss": 1.2046,
      "num_input_tokens_seen": 40951960016,
      "step": 52051
    },
    {
      "epoch": 5.522172713770422,
      "grad_norm": 0.6944751007113205,
      "learning_rate": 2.815713054559504e-05,
      "loss": 1.2237,
      "num_input_tokens_seen": 40952746832,
      "step": 52052
    },
    {
      "epoch": 5.522278803309994,
      "grad_norm": 0.722304831338158,
      "learning_rate": 2.8156441139493827e-05,
      "loss": 1.1733,
      "num_input_tokens_seen": 40953533664,
      "step": 52053
    },
    {
      "epoch": 5.522384892849565,
      "grad_norm": 0.741612768762852,
      "learning_rate": 2.8155751730953413e-05,
      "loss": 1.1923,
      "num_input_tokens_seen": 40954320448,
      "step": 52054
    },
    {
      "epoch": 5.522490982389137,
      "grad_norm": 0.575331208367844,
      "learning_rate": 2.8155062319974313e-05,
      "loss": 1.1613,
      "num_input_tokens_seen": 40955107184,
      "step": 52055
    },
    {
      "epoch": 5.522597071928708,
      "grad_norm": 0.6796354910567696,
      "learning_rate": 2.8154372906557086e-05,
      "loss": 1.1716,
      "num_input_tokens_seen": 40955893872,
      "step": 52056
    },
    {
      "epoch": 5.5227031614682796,
      "grad_norm": 0.6722569771435983,
      "learning_rate": 2.8153683490702247e-05,
      "loss": 1.0636,
      "num_input_tokens_seen": 40956680624,
      "step": 52057
    },
    {
      "epoch": 5.522809251007851,
      "grad_norm": 0.6933280108794091,
      "learning_rate": 2.8152994072410333e-05,
      "loss": 1.2123,
      "num_input_tokens_seen": 40957467328,
      "step": 52058
    },
    {
      "epoch": 5.5229153405474225,
      "grad_norm": 0.7287878140469329,
      "learning_rate": 2.8152304651681883e-05,
      "loss": 1.1736,
      "num_input_tokens_seen": 40958254048,
      "step": 52059
    },
    {
      "epoch": 5.5230214300869935,
      "grad_norm": 0.6901354700518877,
      "learning_rate": 2.8151615228517418e-05,
      "loss": 1.1462,
      "num_input_tokens_seen": 40959040848,
      "step": 52060
    },
    {
      "epoch": 5.523127519626565,
      "grad_norm": 0.6047932052567058,
      "learning_rate": 2.8150925802917483e-05,
      "loss": 1.0728,
      "num_input_tokens_seen": 40959827744,
      "step": 52061
    },
    {
      "epoch": 5.5232336091661365,
      "grad_norm": 0.905191769367761,
      "learning_rate": 2.81502363748826e-05,
      "loss": 1.1855,
      "num_input_tokens_seen": 40960614496,
      "step": 52062
    },
    {
      "epoch": 5.5233396987057075,
      "grad_norm": 0.6390736398208788,
      "learning_rate": 2.8149546944413314e-05,
      "loss": 1.2245,
      "num_input_tokens_seen": 40961401216,
      "step": 52063
    },
    {
      "epoch": 5.523445788245279,
      "grad_norm": 0.564721585832208,
      "learning_rate": 2.814885751151014e-05,
      "loss": 1.1065,
      "num_input_tokens_seen": 40962187984,
      "step": 52064
    },
    {
      "epoch": 5.5235518777848505,
      "grad_norm": 0.5439208480601229,
      "learning_rate": 2.814816807617362e-05,
      "loss": 1.1404,
      "num_input_tokens_seen": 40962974736,
      "step": 52065
    },
    {
      "epoch": 5.5236579673244215,
      "grad_norm": 0.7341198931532155,
      "learning_rate": 2.81474786384043e-05,
      "loss": 1.254,
      "num_input_tokens_seen": 40963761456,
      "step": 52066
    },
    {
      "epoch": 5.523764056863993,
      "grad_norm": 0.5831214449589864,
      "learning_rate": 2.8146789198202694e-05,
      "loss": 1.1836,
      "num_input_tokens_seen": 40964548192,
      "step": 52067
    },
    {
      "epoch": 5.523870146403564,
      "grad_norm": 0.558429807808602,
      "learning_rate": 2.8146099755569342e-05,
      "loss": 1.1423,
      "num_input_tokens_seen": 40965335024,
      "step": 52068
    },
    {
      "epoch": 5.523976235943136,
      "grad_norm": 0.6168364157409303,
      "learning_rate": 2.8145410310504783e-05,
      "loss": 1.1105,
      "num_input_tokens_seen": 40966121728,
      "step": 52069
    },
    {
      "epoch": 5.524082325482707,
      "grad_norm": 0.8518974995258598,
      "learning_rate": 2.8144720863009533e-05,
      "loss": 1.2345,
      "num_input_tokens_seen": 40966908448,
      "step": 52070
    },
    {
      "epoch": 5.524188415022278,
      "grad_norm": 0.5465756047310252,
      "learning_rate": 2.8144031413084136e-05,
      "loss": 1.0972,
      "num_input_tokens_seen": 40967695200,
      "step": 52071
    },
    {
      "epoch": 5.52429450456185,
      "grad_norm": 0.632962964122014,
      "learning_rate": 2.8143341960729137e-05,
      "loss": 1.1185,
      "num_input_tokens_seen": 40968482128,
      "step": 52072
    },
    {
      "epoch": 5.524400594101421,
      "grad_norm": 0.6103268269056502,
      "learning_rate": 2.8142652505945037e-05,
      "loss": 1.0939,
      "num_input_tokens_seen": 40969268944,
      "step": 52073
    },
    {
      "epoch": 5.524506683640993,
      "grad_norm": 0.8078864969404559,
      "learning_rate": 2.81419630487324e-05,
      "loss": 1.233,
      "num_input_tokens_seen": 40970055616,
      "step": 52074
    },
    {
      "epoch": 5.524612773180564,
      "grad_norm": 0.6688826281615696,
      "learning_rate": 2.8141273589091737e-05,
      "loss": 1.1447,
      "num_input_tokens_seen": 40970842416,
      "step": 52075
    },
    {
      "epoch": 5.524718862720135,
      "grad_norm": 0.564133893986195,
      "learning_rate": 2.81405841270236e-05,
      "loss": 1.1117,
      "num_input_tokens_seen": 40971629152,
      "step": 52076
    },
    {
      "epoch": 5.524824952259707,
      "grad_norm": 0.7994935513102525,
      "learning_rate": 2.813989466252851e-05,
      "loss": 1.1939,
      "num_input_tokens_seen": 40972415952,
      "step": 52077
    },
    {
      "epoch": 5.524931041799278,
      "grad_norm": 0.6188159263682771,
      "learning_rate": 2.8139205195606992e-05,
      "loss": 1.2118,
      "num_input_tokens_seen": 40973202864,
      "step": 52078
    },
    {
      "epoch": 5.52503713133885,
      "grad_norm": 0.6701618124637462,
      "learning_rate": 2.81385157262596e-05,
      "loss": 1.1422,
      "num_input_tokens_seen": 40973989664,
      "step": 52079
    },
    {
      "epoch": 5.525143220878421,
      "grad_norm": 0.5534729015967449,
      "learning_rate": 2.8137826254486856e-05,
      "loss": 1.1689,
      "num_input_tokens_seen": 40974776416,
      "step": 52080
    },
    {
      "epoch": 5.525249310417993,
      "grad_norm": 0.8336481337967241,
      "learning_rate": 2.813713678028928e-05,
      "loss": 1.1616,
      "num_input_tokens_seen": 40975563168,
      "step": 52081
    },
    {
      "epoch": 5.525355399957564,
      "grad_norm": 0.6829875164211529,
      "learning_rate": 2.8136447303667423e-05,
      "loss": 1.1963,
      "num_input_tokens_seen": 40976349984,
      "step": 52082
    },
    {
      "epoch": 5.525461489497135,
      "grad_norm": 0.7574021812810882,
      "learning_rate": 2.8135757824621816e-05,
      "loss": 1.0252,
      "num_input_tokens_seen": 40977136816,
      "step": 52083
    },
    {
      "epoch": 5.525567579036707,
      "grad_norm": 0.6325633127402748,
      "learning_rate": 2.8135068343152983e-05,
      "loss": 1.0959,
      "num_input_tokens_seen": 40977923632,
      "step": 52084
    },
    {
      "epoch": 5.525673668576278,
      "grad_norm": 0.7788568470005433,
      "learning_rate": 2.8134378859261456e-05,
      "loss": 1.1513,
      "num_input_tokens_seen": 40978710304,
      "step": 52085
    },
    {
      "epoch": 5.52577975811585,
      "grad_norm": 0.7042212687509423,
      "learning_rate": 2.813368937294778e-05,
      "loss": 1.1793,
      "num_input_tokens_seen": 40979497104,
      "step": 52086
    },
    {
      "epoch": 5.525885847655421,
      "grad_norm": 0.7263736482829269,
      "learning_rate": 2.813299988421248e-05,
      "loss": 1.1171,
      "num_input_tokens_seen": 40980283904,
      "step": 52087
    },
    {
      "epoch": 5.525991937194993,
      "grad_norm": 0.7454439985704446,
      "learning_rate": 2.8132310393056087e-05,
      "loss": 1.1967,
      "num_input_tokens_seen": 40981070720,
      "step": 52088
    },
    {
      "epoch": 5.526098026734564,
      "grad_norm": 0.6654853770608632,
      "learning_rate": 2.813162089947914e-05,
      "loss": 1.1121,
      "num_input_tokens_seen": 40981857424,
      "step": 52089
    },
    {
      "epoch": 5.526204116274135,
      "grad_norm": 0.7753821322685651,
      "learning_rate": 2.8130931403482162e-05,
      "loss": 1.2192,
      "num_input_tokens_seen": 40982644192,
      "step": 52090
    },
    {
      "epoch": 5.526310205813707,
      "grad_norm": 0.7225506268687969,
      "learning_rate": 2.81302419050657e-05,
      "loss": 1.122,
      "num_input_tokens_seen": 40983430896,
      "step": 52091
    },
    {
      "epoch": 5.526416295353278,
      "grad_norm": 0.741518145672941,
      "learning_rate": 2.8129552404230273e-05,
      "loss": 1.1012,
      "num_input_tokens_seen": 40984217648,
      "step": 52092
    },
    {
      "epoch": 5.52652238489285,
      "grad_norm": 0.7765168127074572,
      "learning_rate": 2.812886290097642e-05,
      "loss": 1.2281,
      "num_input_tokens_seen": 40985004448,
      "step": 52093
    },
    {
      "epoch": 5.526628474432421,
      "grad_norm": 0.5794037502912263,
      "learning_rate": 2.812817339530468e-05,
      "loss": 1.1219,
      "num_input_tokens_seen": 40985791216,
      "step": 52094
    },
    {
      "epoch": 5.526734563971992,
      "grad_norm": 0.6567630910352072,
      "learning_rate": 2.8127483887215572e-05,
      "loss": 1.2086,
      "num_input_tokens_seen": 40986577936,
      "step": 52095
    },
    {
      "epoch": 5.526840653511564,
      "grad_norm": 0.5900172343830757,
      "learning_rate": 2.8126794376709643e-05,
      "loss": 1.0955,
      "num_input_tokens_seen": 40987364704,
      "step": 52096
    },
    {
      "epoch": 5.526946743051135,
      "grad_norm": 0.5942428143227048,
      "learning_rate": 2.8126104863787417e-05,
      "loss": 1.1539,
      "num_input_tokens_seen": 40988151472,
      "step": 52097
    },
    {
      "epoch": 5.527052832590707,
      "grad_norm": 0.7435109957118934,
      "learning_rate": 2.8125415348449423e-05,
      "loss": 1.129,
      "num_input_tokens_seen": 40988938288,
      "step": 52098
    },
    {
      "epoch": 5.527158922130278,
      "grad_norm": 0.7510844338568117,
      "learning_rate": 2.8124725830696203e-05,
      "loss": 1.2451,
      "num_input_tokens_seen": 40989725056,
      "step": 52099
    },
    {
      "epoch": 5.527265011669849,
      "grad_norm": 0.643374806971017,
      "learning_rate": 2.812403631052829e-05,
      "loss": 1.1579,
      "num_input_tokens_seen": 40990511856,
      "step": 52100
    },
    {
      "epoch": 5.527371101209421,
      "grad_norm": 0.7477116664776411,
      "learning_rate": 2.8123346787946207e-05,
      "loss": 1.1537,
      "num_input_tokens_seen": 40991298640,
      "step": 52101
    },
    {
      "epoch": 5.527477190748992,
      "grad_norm": 0.6593682045278503,
      "learning_rate": 2.8122657262950496e-05,
      "loss": 1.0854,
      "num_input_tokens_seen": 40992085504,
      "step": 52102
    },
    {
      "epoch": 5.527583280288564,
      "grad_norm": 0.5894641817569388,
      "learning_rate": 2.8121967735541693e-05,
      "loss": 1.2473,
      "num_input_tokens_seen": 40992872320,
      "step": 52103
    },
    {
      "epoch": 5.527689369828135,
      "grad_norm": 0.5533282013726035,
      "learning_rate": 2.8121278205720313e-05,
      "loss": 1.041,
      "num_input_tokens_seen": 40993659168,
      "step": 52104
    },
    {
      "epoch": 5.527795459367706,
      "grad_norm": 0.5290820539191419,
      "learning_rate": 2.8120588673486915e-05,
      "loss": 1.1137,
      "num_input_tokens_seen": 40994445968,
      "step": 52105
    },
    {
      "epoch": 5.527901548907278,
      "grad_norm": 0.5675251934696154,
      "learning_rate": 2.811989913884201e-05,
      "loss": 1.0872,
      "num_input_tokens_seen": 40995232640,
      "step": 52106
    },
    {
      "epoch": 5.528007638446849,
      "grad_norm": 0.6354280201008111,
      "learning_rate": 2.8119209601786133e-05,
      "loss": 1.1151,
      "num_input_tokens_seen": 40996019392,
      "step": 52107
    },
    {
      "epoch": 5.528113727986421,
      "grad_norm": 0.6433173175120902,
      "learning_rate": 2.8118520062319832e-05,
      "loss": 1.1528,
      "num_input_tokens_seen": 40996806160,
      "step": 52108
    },
    {
      "epoch": 5.528219817525992,
      "grad_norm": 0.7613975785235338,
      "learning_rate": 2.8117830520443622e-05,
      "loss": 1.2186,
      "num_input_tokens_seen": 40997592896,
      "step": 52109
    },
    {
      "epoch": 5.528325907065564,
      "grad_norm": 0.7063345555738397,
      "learning_rate": 2.8117140976158053e-05,
      "loss": 1.2236,
      "num_input_tokens_seen": 40998379760,
      "step": 52110
    },
    {
      "epoch": 5.528431996605135,
      "grad_norm": 0.5939759473770503,
      "learning_rate": 2.8116451429463648e-05,
      "loss": 1.1706,
      "num_input_tokens_seen": 40999166544,
      "step": 52111
    },
    {
      "epoch": 5.528538086144706,
      "grad_norm": 0.6585171991958977,
      "learning_rate": 2.8115761880360932e-05,
      "loss": 1.1429,
      "num_input_tokens_seen": 40999953344,
      "step": 52112
    },
    {
      "epoch": 5.528644175684278,
      "grad_norm": 0.6947562936807783,
      "learning_rate": 2.811507232885045e-05,
      "loss": 1.1786,
      "num_input_tokens_seen": 41000740144,
      "step": 52113
    },
    {
      "epoch": 5.528750265223849,
      "grad_norm": 0.6157588874112623,
      "learning_rate": 2.8114382774932734e-05,
      "loss": 1.1923,
      "num_input_tokens_seen": 41001526992,
      "step": 52114
    },
    {
      "epoch": 5.528856354763421,
      "grad_norm": 0.9170482970746179,
      "learning_rate": 2.8113693218608317e-05,
      "loss": 1.1852,
      "num_input_tokens_seen": 41002313760,
      "step": 52115
    },
    {
      "epoch": 5.528962444302992,
      "grad_norm": 0.6815799946796258,
      "learning_rate": 2.8113003659877722e-05,
      "loss": 1.1059,
      "num_input_tokens_seen": 41003100464,
      "step": 52116
    },
    {
      "epoch": 5.529068533842564,
      "grad_norm": 0.6158830871903027,
      "learning_rate": 2.8112314098741494e-05,
      "loss": 1.1166,
      "num_input_tokens_seen": 41003887200,
      "step": 52117
    },
    {
      "epoch": 5.529174623382135,
      "grad_norm": 0.6908990412388472,
      "learning_rate": 2.8111624535200152e-05,
      "loss": 1.1203,
      "num_input_tokens_seen": 41004674000,
      "step": 52118
    },
    {
      "epoch": 5.529280712921706,
      "grad_norm": 0.6589934799758899,
      "learning_rate": 2.8110934969254254e-05,
      "loss": 1.1395,
      "num_input_tokens_seen": 41005460784,
      "step": 52119
    },
    {
      "epoch": 5.529386802461278,
      "grad_norm": 0.5913461634345724,
      "learning_rate": 2.8110245400904313e-05,
      "loss": 1.1739,
      "num_input_tokens_seen": 41006247568,
      "step": 52120
    },
    {
      "epoch": 5.529492892000849,
      "grad_norm": 0.8142650605774007,
      "learning_rate": 2.8109555830150852e-05,
      "loss": 1.2115,
      "num_input_tokens_seen": 41007034352,
      "step": 52121
    },
    {
      "epoch": 5.5295989815404205,
      "grad_norm": 0.6456430095462548,
      "learning_rate": 2.8108866256994433e-05,
      "loss": 1.0938,
      "num_input_tokens_seen": 41007821184,
      "step": 52122
    },
    {
      "epoch": 5.5297050710799915,
      "grad_norm": 0.7428642718514236,
      "learning_rate": 2.8108176681435567e-05,
      "loss": 1.1232,
      "num_input_tokens_seen": 41008607936,
      "step": 52123
    },
    {
      "epoch": 5.529811160619563,
      "grad_norm": 0.6121107109442501,
      "learning_rate": 2.8107487103474788e-05,
      "loss": 1.126,
      "num_input_tokens_seen": 41009394768,
      "step": 52124
    },
    {
      "epoch": 5.5299172501591345,
      "grad_norm": 0.7867272096133667,
      "learning_rate": 2.8106797523112642e-05,
      "loss": 1.1938,
      "num_input_tokens_seen": 41010181504,
      "step": 52125
    },
    {
      "epoch": 5.5300233396987055,
      "grad_norm": 0.7188250070795696,
      "learning_rate": 2.8106107940349653e-05,
      "loss": 1.1395,
      "num_input_tokens_seen": 41010968272,
      "step": 52126
    },
    {
      "epoch": 5.530129429238277,
      "grad_norm": 0.5471064888657134,
      "learning_rate": 2.8105418355186352e-05,
      "loss": 1.1379,
      "num_input_tokens_seen": 41011755024,
      "step": 52127
    },
    {
      "epoch": 5.5302355187778485,
      "grad_norm": 0.671620127627634,
      "learning_rate": 2.810472876762328e-05,
      "loss": 1.1465,
      "num_input_tokens_seen": 41012541744,
      "step": 52128
    },
    {
      "epoch": 5.5303416083174195,
      "grad_norm": 0.5704170744109718,
      "learning_rate": 2.8104039177660963e-05,
      "loss": 1.1539,
      "num_input_tokens_seen": 41013328448,
      "step": 52129
    },
    {
      "epoch": 5.530447697856991,
      "grad_norm": 0.5919642360208284,
      "learning_rate": 2.8103349585299926e-05,
      "loss": 1.2162,
      "num_input_tokens_seen": 41014115088,
      "step": 52130
    },
    {
      "epoch": 5.5305537873965624,
      "grad_norm": 0.5892058152284807,
      "learning_rate": 2.8102659990540724e-05,
      "loss": 1.2407,
      "num_input_tokens_seen": 41014901840,
      "step": 52131
    },
    {
      "epoch": 5.530659876936134,
      "grad_norm": 0.6260746947288672,
      "learning_rate": 2.8101970393383874e-05,
      "loss": 1.1503,
      "num_input_tokens_seen": 41015688592,
      "step": 52132
    },
    {
      "epoch": 5.530765966475705,
      "grad_norm": 0.8953375380671866,
      "learning_rate": 2.8101280793829903e-05,
      "loss": 1.2113,
      "num_input_tokens_seen": 41016475328,
      "step": 52133
    },
    {
      "epoch": 5.530872056015276,
      "grad_norm": 0.6861466553383747,
      "learning_rate": 2.8100591191879365e-05,
      "loss": 1.226,
      "num_input_tokens_seen": 41017261968,
      "step": 52134
    },
    {
      "epoch": 5.530978145554848,
      "grad_norm": 0.767285011123259,
      "learning_rate": 2.8099901587532774e-05,
      "loss": 1.1137,
      "num_input_tokens_seen": 41018048832,
      "step": 52135
    },
    {
      "epoch": 5.531084235094419,
      "grad_norm": 0.6971973920076102,
      "learning_rate": 2.8099211980790675e-05,
      "loss": 1.1743,
      "num_input_tokens_seen": 41018835632,
      "step": 52136
    },
    {
      "epoch": 5.531190324633991,
      "grad_norm": 0.6986873583518143,
      "learning_rate": 2.8098522371653597e-05,
      "loss": 1.2009,
      "num_input_tokens_seen": 41019622384,
      "step": 52137
    },
    {
      "epoch": 5.531296414173562,
      "grad_norm": 0.5605576093002793,
      "learning_rate": 2.8097832760122066e-05,
      "loss": 1.127,
      "num_input_tokens_seen": 41020409200,
      "step": 52138
    },
    {
      "epoch": 5.531402503713134,
      "grad_norm": 0.8355402123631219,
      "learning_rate": 2.8097143146196626e-05,
      "loss": 1.2224,
      "num_input_tokens_seen": 41021196000,
      "step": 52139
    },
    {
      "epoch": 5.531508593252705,
      "grad_norm": 0.6851969635560669,
      "learning_rate": 2.8096453529877804e-05,
      "loss": 1.1728,
      "num_input_tokens_seen": 41021982784,
      "step": 52140
    },
    {
      "epoch": 5.531614682792276,
      "grad_norm": 0.6179308546807667,
      "learning_rate": 2.809576391116613e-05,
      "loss": 1.1321,
      "num_input_tokens_seen": 41022769584,
      "step": 52141
    },
    {
      "epoch": 5.531720772331848,
      "grad_norm": 0.6345554502712809,
      "learning_rate": 2.809507429006214e-05,
      "loss": 1.0423,
      "num_input_tokens_seen": 41023556432,
      "step": 52142
    },
    {
      "epoch": 5.531826861871419,
      "grad_norm": 0.6898892038982842,
      "learning_rate": 2.8094384666566377e-05,
      "loss": 1.1142,
      "num_input_tokens_seen": 41024343184,
      "step": 52143
    },
    {
      "epoch": 5.531932951410991,
      "grad_norm": 0.6193665870335301,
      "learning_rate": 2.809369504067935e-05,
      "loss": 1.0983,
      "num_input_tokens_seen": 41025129968,
      "step": 52144
    },
    {
      "epoch": 5.532039040950562,
      "grad_norm": 0.6718784766688497,
      "learning_rate": 2.8093005412401613e-05,
      "loss": 1.2099,
      "num_input_tokens_seen": 41025916784,
      "step": 52145
    },
    {
      "epoch": 5.532145130490134,
      "grad_norm": 0.6816943476186598,
      "learning_rate": 2.8092315781733696e-05,
      "loss": 1.1564,
      "num_input_tokens_seen": 41026703616,
      "step": 52146
    },
    {
      "epoch": 5.532251220029705,
      "grad_norm": 0.653560175326573,
      "learning_rate": 2.809162614867612e-05,
      "loss": 1.1472,
      "num_input_tokens_seen": 41027490400,
      "step": 52147
    },
    {
      "epoch": 5.532357309569276,
      "grad_norm": 0.7967323280483986,
      "learning_rate": 2.8090936513229434e-05,
      "loss": 1.099,
      "num_input_tokens_seen": 41028277200,
      "step": 52148
    },
    {
      "epoch": 5.532463399108848,
      "grad_norm": 0.6741964609400312,
      "learning_rate": 2.809024687539416e-05,
      "loss": 1.1827,
      "num_input_tokens_seen": 41029064080,
      "step": 52149
    },
    {
      "epoch": 5.532569488648419,
      "grad_norm": 0.6271969558608437,
      "learning_rate": 2.8089557235170833e-05,
      "loss": 1.2406,
      "num_input_tokens_seen": 41029850880,
      "step": 52150
    },
    {
      "epoch": 5.532675578187991,
      "grad_norm": 0.805408006438846,
      "learning_rate": 2.8088867592559985e-05,
      "loss": 1.2041,
      "num_input_tokens_seen": 41030637584,
      "step": 52151
    },
    {
      "epoch": 5.532781667727562,
      "grad_norm": 0.6536158890718587,
      "learning_rate": 2.8088177947562148e-05,
      "loss": 1.0925,
      "num_input_tokens_seen": 41031424384,
      "step": 52152
    },
    {
      "epoch": 5.532887757267133,
      "grad_norm": 0.6194933995970751,
      "learning_rate": 2.8087488300177867e-05,
      "loss": 1.0992,
      "num_input_tokens_seen": 41032211200,
      "step": 52153
    },
    {
      "epoch": 5.532993846806705,
      "grad_norm": 0.5753972525258362,
      "learning_rate": 2.8086798650407664e-05,
      "loss": 1.2077,
      "num_input_tokens_seen": 41032997936,
      "step": 52154
    },
    {
      "epoch": 5.533099936346276,
      "grad_norm": 0.7083469119573007,
      "learning_rate": 2.808610899825207e-05,
      "loss": 1.279,
      "num_input_tokens_seen": 41033784720,
      "step": 52155
    },
    {
      "epoch": 5.533206025885848,
      "grad_norm": 0.604951000509575,
      "learning_rate": 2.808541934371162e-05,
      "loss": 1.1686,
      "num_input_tokens_seen": 41034571488,
      "step": 52156
    },
    {
      "epoch": 5.533312115425419,
      "grad_norm": 0.7079721261227969,
      "learning_rate": 2.8084729686786855e-05,
      "loss": 1.251,
      "num_input_tokens_seen": 41035358160,
      "step": 52157
    },
    {
      "epoch": 5.53341820496499,
      "grad_norm": 0.6206060306703907,
      "learning_rate": 2.808404002747829e-05,
      "loss": 1.0746,
      "num_input_tokens_seen": 41036144960,
      "step": 52158
    },
    {
      "epoch": 5.533524294504562,
      "grad_norm": 0.5923843817197119,
      "learning_rate": 2.8083350365786482e-05,
      "loss": 1.2074,
      "num_input_tokens_seen": 41036931728,
      "step": 52159
    },
    {
      "epoch": 5.533630384044133,
      "grad_norm": 0.5947152952510515,
      "learning_rate": 2.8082660701711945e-05,
      "loss": 1.1068,
      "num_input_tokens_seen": 41037718496,
      "step": 52160
    },
    {
      "epoch": 5.533736473583705,
      "grad_norm": 0.6636336147724239,
      "learning_rate": 2.8081971035255216e-05,
      "loss": 1.154,
      "num_input_tokens_seen": 41038505216,
      "step": 52161
    },
    {
      "epoch": 5.533842563123276,
      "grad_norm": 0.6572060189842865,
      "learning_rate": 2.8081281366416834e-05,
      "loss": 1.1704,
      "num_input_tokens_seen": 41039291904,
      "step": 52162
    },
    {
      "epoch": 5.533948652662847,
      "grad_norm": 0.624847488176741,
      "learning_rate": 2.8080591695197327e-05,
      "loss": 1.1809,
      "num_input_tokens_seen": 41040078656,
      "step": 52163
    },
    {
      "epoch": 5.534054742202419,
      "grad_norm": 0.6810442507243514,
      "learning_rate": 2.8079902021597227e-05,
      "loss": 1.2174,
      "num_input_tokens_seen": 41040865408,
      "step": 52164
    },
    {
      "epoch": 5.53416083174199,
      "grad_norm": 0.7020511965918028,
      "learning_rate": 2.8079212345617073e-05,
      "loss": 1.1358,
      "num_input_tokens_seen": 41041652160,
      "step": 52165
    },
    {
      "epoch": 5.534266921281562,
      "grad_norm": 0.6338223546968037,
      "learning_rate": 2.8078522667257396e-05,
      "loss": 1.2237,
      "num_input_tokens_seen": 41042438880,
      "step": 52166
    },
    {
      "epoch": 5.534373010821133,
      "grad_norm": 0.6363270828439104,
      "learning_rate": 2.807783298651872e-05,
      "loss": 1.1119,
      "num_input_tokens_seen": 41043225632,
      "step": 52167
    },
    {
      "epoch": 5.534479100360705,
      "grad_norm": 0.5981050795231835,
      "learning_rate": 2.8077143303401595e-05,
      "loss": 1.1385,
      "num_input_tokens_seen": 41044012432,
      "step": 52168
    },
    {
      "epoch": 5.534585189900276,
      "grad_norm": 0.7463497204460834,
      "learning_rate": 2.807645361790654e-05,
      "loss": 1.1696,
      "num_input_tokens_seen": 41044799168,
      "step": 52169
    },
    {
      "epoch": 5.534691279439847,
      "grad_norm": 0.6678276605006331,
      "learning_rate": 2.8075763930034084e-05,
      "loss": 1.1627,
      "num_input_tokens_seen": 41045585888,
      "step": 52170
    },
    {
      "epoch": 5.534797368979419,
      "grad_norm": 0.736966914766774,
      "learning_rate": 2.8075074239784775e-05,
      "loss": 1.2645,
      "num_input_tokens_seen": 41046372560,
      "step": 52171
    },
    {
      "epoch": 5.53490345851899,
      "grad_norm": 0.7780970062660237,
      "learning_rate": 2.807438454715914e-05,
      "loss": 1.1731,
      "num_input_tokens_seen": 41047159264,
      "step": 52172
    },
    {
      "epoch": 5.535009548058562,
      "grad_norm": 0.7159945269733866,
      "learning_rate": 2.8073694852157705e-05,
      "loss": 1.1841,
      "num_input_tokens_seen": 41047945968,
      "step": 52173
    },
    {
      "epoch": 5.535115637598133,
      "grad_norm": 0.7787355431482795,
      "learning_rate": 2.807300515478101e-05,
      "loss": 1.1571,
      "num_input_tokens_seen": 41048732752,
      "step": 52174
    },
    {
      "epoch": 5.535221727137705,
      "grad_norm": 0.6826764810530628,
      "learning_rate": 2.8072315455029596e-05,
      "loss": 1.1828,
      "num_input_tokens_seen": 41049519600,
      "step": 52175
    },
    {
      "epoch": 5.535327816677276,
      "grad_norm": 0.9130866882958566,
      "learning_rate": 2.8071625752903974e-05,
      "loss": 1.0344,
      "num_input_tokens_seen": 41050306432,
      "step": 52176
    },
    {
      "epoch": 5.535433906216847,
      "grad_norm": 0.578376707349855,
      "learning_rate": 2.8070936048404695e-05,
      "loss": 1.0834,
      "num_input_tokens_seen": 41051093232,
      "step": 52177
    },
    {
      "epoch": 5.535539995756419,
      "grad_norm": 0.6255085213387497,
      "learning_rate": 2.8070246341532287e-05,
      "loss": 1.1744,
      "num_input_tokens_seen": 41051880016,
      "step": 52178
    },
    {
      "epoch": 5.53564608529599,
      "grad_norm": 0.7032806406222343,
      "learning_rate": 2.8069556632287286e-05,
      "loss": 1.1919,
      "num_input_tokens_seen": 41052666720,
      "step": 52179
    },
    {
      "epoch": 5.535752174835562,
      "grad_norm": 0.6192750446919587,
      "learning_rate": 2.8068866920670216e-05,
      "loss": 1.1659,
      "num_input_tokens_seen": 41053453456,
      "step": 52180
    },
    {
      "epoch": 5.535858264375133,
      "grad_norm": 0.6331420136838919,
      "learning_rate": 2.8068177206681616e-05,
      "loss": 1.1959,
      "num_input_tokens_seen": 41054240224,
      "step": 52181
    },
    {
      "epoch": 5.535964353914704,
      "grad_norm": 0.7694039808722134,
      "learning_rate": 2.8067487490322026e-05,
      "loss": 1.1464,
      "num_input_tokens_seen": 41055026944,
      "step": 52182
    },
    {
      "epoch": 5.536070443454276,
      "grad_norm": 0.6575467819486734,
      "learning_rate": 2.8066797771591967e-05,
      "loss": 1.1188,
      "num_input_tokens_seen": 41055813728,
      "step": 52183
    },
    {
      "epoch": 5.536176532993847,
      "grad_norm": 0.5238512000294344,
      "learning_rate": 2.8066108050491974e-05,
      "loss": 1.0623,
      "num_input_tokens_seen": 41056600496,
      "step": 52184
    },
    {
      "epoch": 5.5362826225334185,
      "grad_norm": 0.6454072533282896,
      "learning_rate": 2.8065418327022585e-05,
      "loss": 1.1566,
      "num_input_tokens_seen": 41057387248,
      "step": 52185
    },
    {
      "epoch": 5.5363887120729895,
      "grad_norm": 1.0533160904860912,
      "learning_rate": 2.806472860118433e-05,
      "loss": 1.2231,
      "num_input_tokens_seen": 41058174000,
      "step": 52186
    },
    {
      "epoch": 5.536494801612561,
      "grad_norm": 0.8753888834541941,
      "learning_rate": 2.8064038872977744e-05,
      "loss": 1.2042,
      "num_input_tokens_seen": 41058960768,
      "step": 52187
    },
    {
      "epoch": 5.5366008911521325,
      "grad_norm": 0.8257483085243932,
      "learning_rate": 2.8063349142403355e-05,
      "loss": 1.1348,
      "num_input_tokens_seen": 41059747440,
      "step": 52188
    },
    {
      "epoch": 5.5367069806917035,
      "grad_norm": 0.5874596182828985,
      "learning_rate": 2.8062659409461706e-05,
      "loss": 1.1461,
      "num_input_tokens_seen": 41060534208,
      "step": 52189
    },
    {
      "epoch": 5.5368130702312754,
      "grad_norm": 1.0955152343649142,
      "learning_rate": 2.8061969674153315e-05,
      "loss": 1.1154,
      "num_input_tokens_seen": 41061320912,
      "step": 52190
    },
    {
      "epoch": 5.5369191597708465,
      "grad_norm": 0.8679760607817578,
      "learning_rate": 2.8061279936478736e-05,
      "loss": 1.1464,
      "num_input_tokens_seen": 41062107632,
      "step": 52191
    },
    {
      "epoch": 5.5370252493104175,
      "grad_norm": 0.8290012034630079,
      "learning_rate": 2.806059019643848e-05,
      "loss": 1.2327,
      "num_input_tokens_seen": 41062894368,
      "step": 52192
    },
    {
      "epoch": 5.537131338849989,
      "grad_norm": 1.3321343761761328,
      "learning_rate": 2.8059900454033087e-05,
      "loss": 1.1778,
      "num_input_tokens_seen": 41063681152,
      "step": 52193
    },
    {
      "epoch": 5.5372374283895605,
      "grad_norm": 0.5769322811495197,
      "learning_rate": 2.8059210709263107e-05,
      "loss": 1.0673,
      "num_input_tokens_seen": 41064467888,
      "step": 52194
    },
    {
      "epoch": 5.537343517929132,
      "grad_norm": 0.8684075711830316,
      "learning_rate": 2.805852096212904e-05,
      "loss": 1.2393,
      "num_input_tokens_seen": 41065254640,
      "step": 52195
    },
    {
      "epoch": 5.537449607468703,
      "grad_norm": 0.7173847108991755,
      "learning_rate": 2.8057831212631452e-05,
      "loss": 1.2041,
      "num_input_tokens_seen": 41066041424,
      "step": 52196
    },
    {
      "epoch": 5.537555697008275,
      "grad_norm": 0.6322018721185144,
      "learning_rate": 2.8057141460770858e-05,
      "loss": 1.1542,
      "num_input_tokens_seen": 41066828224,
      "step": 52197
    },
    {
      "epoch": 5.537661786547846,
      "grad_norm": 1.0053931384049308,
      "learning_rate": 2.8056451706547794e-05,
      "loss": 1.187,
      "num_input_tokens_seen": 41067614928,
      "step": 52198
    },
    {
      "epoch": 5.537767876087418,
      "grad_norm": 0.7493294005117707,
      "learning_rate": 2.8055761949962795e-05,
      "loss": 1.1665,
      "num_input_tokens_seen": 41068401712,
      "step": 52199
    },
    {
      "epoch": 5.537873965626989,
      "grad_norm": 0.974000471401979,
      "learning_rate": 2.805507219101639e-05,
      "loss": 1.1866,
      "num_input_tokens_seen": 41069188496,
      "step": 52200
    },
    {
      "epoch": 5.53798005516656,
      "grad_norm": 0.6018246535179056,
      "learning_rate": 2.8054382429709116e-05,
      "loss": 1.1874,
      "num_input_tokens_seen": 41069975280,
      "step": 52201
    },
    {
      "epoch": 5.538086144706132,
      "grad_norm": 0.6868868545865107,
      "learning_rate": 2.805369266604151e-05,
      "loss": 1.1097,
      "num_input_tokens_seen": 41070762064,
      "step": 52202
    },
    {
      "epoch": 5.538192234245703,
      "grad_norm": 0.6422550485178709,
      "learning_rate": 2.8053002900014092e-05,
      "loss": 1.035,
      "num_input_tokens_seen": 41071548880,
      "step": 52203
    },
    {
      "epoch": 5.538298323785275,
      "grad_norm": 0.7325522826444336,
      "learning_rate": 2.8052313131627407e-05,
      "loss": 1.1023,
      "num_input_tokens_seen": 41072335696,
      "step": 52204
    },
    {
      "epoch": 5.538404413324846,
      "grad_norm": 0.7196951772211684,
      "learning_rate": 2.8051623360881986e-05,
      "loss": 1.2193,
      "num_input_tokens_seen": 41073122416,
      "step": 52205
    },
    {
      "epoch": 5.538510502864417,
      "grad_norm": 0.7834049631442627,
      "learning_rate": 2.8050933587778354e-05,
      "loss": 1.1423,
      "num_input_tokens_seen": 41073909184,
      "step": 52206
    },
    {
      "epoch": 5.538616592403989,
      "grad_norm": 0.9477832798888471,
      "learning_rate": 2.805024381231705e-05,
      "loss": 1.2023,
      "num_input_tokens_seen": 41074696016,
      "step": 52207
    },
    {
      "epoch": 5.53872268194356,
      "grad_norm": 0.7524942901612515,
      "learning_rate": 2.804955403449861e-05,
      "loss": 1.2505,
      "num_input_tokens_seen": 41075482768,
      "step": 52208
    },
    {
      "epoch": 5.538828771483132,
      "grad_norm": 1.2381611517688897,
      "learning_rate": 2.8048864254323563e-05,
      "loss": 1.1594,
      "num_input_tokens_seen": 41076269568,
      "step": 52209
    },
    {
      "epoch": 5.538934861022703,
      "grad_norm": 0.6589399019647407,
      "learning_rate": 2.8048174471792445e-05,
      "loss": 1.2502,
      "num_input_tokens_seen": 41077056384,
      "step": 52210
    },
    {
      "epoch": 5.539040950562274,
      "grad_norm": 0.6838417757793815,
      "learning_rate": 2.804748468690579e-05,
      "loss": 1.2295,
      "num_input_tokens_seen": 41077843072,
      "step": 52211
    },
    {
      "epoch": 5.539147040101846,
      "grad_norm": 0.8186908087862237,
      "learning_rate": 2.8046794899664126e-05,
      "loss": 1.16,
      "num_input_tokens_seen": 41078629856,
      "step": 52212
    },
    {
      "epoch": 5.539253129641417,
      "grad_norm": 0.5698535798759397,
      "learning_rate": 2.8046105110067984e-05,
      "loss": 1.1607,
      "num_input_tokens_seen": 41079416512,
      "step": 52213
    },
    {
      "epoch": 5.539359219180989,
      "grad_norm": 0.6351137587986005,
      "learning_rate": 2.8045415318117906e-05,
      "loss": 1.1598,
      "num_input_tokens_seen": 41080203280,
      "step": 52214
    },
    {
      "epoch": 5.53946530872056,
      "grad_norm": 0.8065030329894528,
      "learning_rate": 2.804472552381442e-05,
      "loss": 1.1361,
      "num_input_tokens_seen": 41080989984,
      "step": 52215
    },
    {
      "epoch": 5.539571398260131,
      "grad_norm": 0.7991045550578612,
      "learning_rate": 2.8044035727158053e-05,
      "loss": 1.2614,
      "num_input_tokens_seen": 41081776768,
      "step": 52216
    },
    {
      "epoch": 5.539677487799703,
      "grad_norm": 0.7031078365647061,
      "learning_rate": 2.8043345928149355e-05,
      "loss": 1.1725,
      "num_input_tokens_seen": 41082563552,
      "step": 52217
    },
    {
      "epoch": 5.539783577339274,
      "grad_norm": 0.7319045385147278,
      "learning_rate": 2.8042656126788846e-05,
      "loss": 1.2042,
      "num_input_tokens_seen": 41083350224,
      "step": 52218
    },
    {
      "epoch": 5.539889666878846,
      "grad_norm": 0.5753943174350773,
      "learning_rate": 2.8041966323077052e-05,
      "loss": 1.1604,
      "num_input_tokens_seen": 41084136992,
      "step": 52219
    },
    {
      "epoch": 5.539995756418417,
      "grad_norm": 0.7500142183892115,
      "learning_rate": 2.8041276517014525e-05,
      "loss": 1.1405,
      "num_input_tokens_seen": 41084923728,
      "step": 52220
    },
    {
      "epoch": 5.540101845957988,
      "grad_norm": 0.6348857150298477,
      "learning_rate": 2.8040586708601786e-05,
      "loss": 1.1449,
      "num_input_tokens_seen": 41085710464,
      "step": 52221
    },
    {
      "epoch": 5.54020793549756,
      "grad_norm": 0.5490947231859684,
      "learning_rate": 2.8039896897839374e-05,
      "loss": 1.0726,
      "num_input_tokens_seen": 41086497232,
      "step": 52222
    },
    {
      "epoch": 5.540314025037131,
      "grad_norm": 0.8341243541822391,
      "learning_rate": 2.8039207084727815e-05,
      "loss": 1.2109,
      "num_input_tokens_seen": 41087283968,
      "step": 52223
    },
    {
      "epoch": 5.540420114576703,
      "grad_norm": 0.6622347004160146,
      "learning_rate": 2.8038517269267643e-05,
      "loss": 1.1704,
      "num_input_tokens_seen": 41088070704,
      "step": 52224
    },
    {
      "epoch": 5.540526204116274,
      "grad_norm": 0.6751342459070817,
      "learning_rate": 2.8037827451459404e-05,
      "loss": 1.1402,
      "num_input_tokens_seen": 41088857488,
      "step": 52225
    },
    {
      "epoch": 5.540632293655846,
      "grad_norm": 0.7858506946107547,
      "learning_rate": 2.8037137631303618e-05,
      "loss": 1.1691,
      "num_input_tokens_seen": 41089644368,
      "step": 52226
    },
    {
      "epoch": 5.540738383195417,
      "grad_norm": 0.7488848336497551,
      "learning_rate": 2.8036447808800814e-05,
      "loss": 1.1589,
      "num_input_tokens_seen": 41090431152,
      "step": 52227
    },
    {
      "epoch": 5.540844472734989,
      "grad_norm": 0.7901405515698461,
      "learning_rate": 2.803575798395154e-05,
      "loss": 1.1858,
      "num_input_tokens_seen": 41091217984,
      "step": 52228
    },
    {
      "epoch": 5.54095056227456,
      "grad_norm": 0.7660985409953261,
      "learning_rate": 2.8035068156756316e-05,
      "loss": 1.2633,
      "num_input_tokens_seen": 41092004624,
      "step": 52229
    },
    {
      "epoch": 5.541056651814131,
      "grad_norm": 0.6650053930890446,
      "learning_rate": 2.8034378327215682e-05,
      "loss": 1.1682,
      "num_input_tokens_seen": 41092791360,
      "step": 52230
    },
    {
      "epoch": 5.541162741353703,
      "grad_norm": 0.6622452975697755,
      "learning_rate": 2.803368849533017e-05,
      "loss": 1.2477,
      "num_input_tokens_seen": 41093577968,
      "step": 52231
    },
    {
      "epoch": 5.541268830893274,
      "grad_norm": 0.81828289194475,
      "learning_rate": 2.8032998661100317e-05,
      "loss": 1.1987,
      "num_input_tokens_seen": 41094364736,
      "step": 52232
    },
    {
      "epoch": 5.541374920432846,
      "grad_norm": 0.639922385055343,
      "learning_rate": 2.8032308824526643e-05,
      "loss": 1.1651,
      "num_input_tokens_seen": 41095151536,
      "step": 52233
    },
    {
      "epoch": 5.541481009972417,
      "grad_norm": 0.6228776655115835,
      "learning_rate": 2.8031618985609693e-05,
      "loss": 1.1132,
      "num_input_tokens_seen": 41095938288,
      "step": 52234
    },
    {
      "epoch": 5.541587099511988,
      "grad_norm": 0.6717874045545221,
      "learning_rate": 2.803092914435e-05,
      "loss": 1.1561,
      "num_input_tokens_seen": 41096725040,
      "step": 52235
    },
    {
      "epoch": 5.54169318905156,
      "grad_norm": 0.5811938389090218,
      "learning_rate": 2.803023930074809e-05,
      "loss": 1.1795,
      "num_input_tokens_seen": 41097511712,
      "step": 52236
    },
    {
      "epoch": 5.541799278591131,
      "grad_norm": 0.7205375378517467,
      "learning_rate": 2.8029549454804506e-05,
      "loss": 1.1838,
      "num_input_tokens_seen": 41098298496,
      "step": 52237
    },
    {
      "epoch": 5.541905368130703,
      "grad_norm": 0.740418301409862,
      "learning_rate": 2.8028859606519764e-05,
      "loss": 1.1451,
      "num_input_tokens_seen": 41099085312,
      "step": 52238
    },
    {
      "epoch": 5.542011457670274,
      "grad_norm": 0.861111294108068,
      "learning_rate": 2.8028169755894417e-05,
      "loss": 1.2043,
      "num_input_tokens_seen": 41099872080,
      "step": 52239
    },
    {
      "epoch": 5.542117547209845,
      "grad_norm": 1.0421082495174976,
      "learning_rate": 2.802747990292899e-05,
      "loss": 1.172,
      "num_input_tokens_seen": 41100658864,
      "step": 52240
    },
    {
      "epoch": 5.542223636749417,
      "grad_norm": 0.8810878684231034,
      "learning_rate": 2.8026790047624007e-05,
      "loss": 1.1237,
      "num_input_tokens_seen": 41101445584,
      "step": 52241
    },
    {
      "epoch": 5.542329726288988,
      "grad_norm": 0.8411159496403621,
      "learning_rate": 2.8026100189980016e-05,
      "loss": 1.1869,
      "num_input_tokens_seen": 41102232400,
      "step": 52242
    },
    {
      "epoch": 5.54243581582856,
      "grad_norm": 0.8421213121546065,
      "learning_rate": 2.8025410329997546e-05,
      "loss": 1.1948,
      "num_input_tokens_seen": 41103019104,
      "step": 52243
    },
    {
      "epoch": 5.542541905368131,
      "grad_norm": 0.6565131814731426,
      "learning_rate": 2.8024720467677117e-05,
      "loss": 1.1981,
      "num_input_tokens_seen": 41103805824,
      "step": 52244
    },
    {
      "epoch": 5.542647994907702,
      "grad_norm": 1.0438936937917882,
      "learning_rate": 2.8024030603019286e-05,
      "loss": 1.271,
      "num_input_tokens_seen": 41104592720,
      "step": 52245
    },
    {
      "epoch": 5.542754084447274,
      "grad_norm": 0.8077535414202717,
      "learning_rate": 2.8023340736024566e-05,
      "loss": 1.1215,
      "num_input_tokens_seen": 41105379536,
      "step": 52246
    },
    {
      "epoch": 5.542860173986845,
      "grad_norm": 0.5892491032688528,
      "learning_rate": 2.8022650866693495e-05,
      "loss": 1.1135,
      "num_input_tokens_seen": 41106166368,
      "step": 52247
    },
    {
      "epoch": 5.5429662635264165,
      "grad_norm": 0.9918972701921323,
      "learning_rate": 2.8021960995026613e-05,
      "loss": 1.1267,
      "num_input_tokens_seen": 41106953184,
      "step": 52248
    },
    {
      "epoch": 5.543072353065988,
      "grad_norm": 0.6022377752315325,
      "learning_rate": 2.802127112102445e-05,
      "loss": 1.1461,
      "num_input_tokens_seen": 41107739888,
      "step": 52249
    },
    {
      "epoch": 5.5431784426055595,
      "grad_norm": 0.6143807154360155,
      "learning_rate": 2.8020581244687526e-05,
      "loss": 1.1467,
      "num_input_tokens_seen": 41108526672,
      "step": 52250
    },
    {
      "epoch": 5.5432845321451305,
      "grad_norm": 0.6659362200545645,
      "learning_rate": 2.80198913660164e-05,
      "loss": 1.1585,
      "num_input_tokens_seen": 41109313376,
      "step": 52251
    },
    {
      "epoch": 5.5433906216847015,
      "grad_norm": 0.7749098603053881,
      "learning_rate": 2.801920148501158e-05,
      "loss": 1.1152,
      "num_input_tokens_seen": 41110100192,
      "step": 52252
    },
    {
      "epoch": 5.5434967112242735,
      "grad_norm": 0.6248356106539489,
      "learning_rate": 2.8018511601673614e-05,
      "loss": 1.0975,
      "num_input_tokens_seen": 41110887056,
      "step": 52253
    },
    {
      "epoch": 5.5436028007638445,
      "grad_norm": 0.6901291140335165,
      "learning_rate": 2.8017821716003027e-05,
      "loss": 1.2376,
      "num_input_tokens_seen": 41111673728,
      "step": 52254
    },
    {
      "epoch": 5.543708890303416,
      "grad_norm": 0.5985408071367432,
      "learning_rate": 2.801713182800036e-05,
      "loss": 1.1709,
      "num_input_tokens_seen": 41112460496,
      "step": 52255
    },
    {
      "epoch": 5.543814979842987,
      "grad_norm": 0.724262938040448,
      "learning_rate": 2.8016441937666134e-05,
      "loss": 1.2645,
      "num_input_tokens_seen": 41113247328,
      "step": 52256
    },
    {
      "epoch": 5.543921069382559,
      "grad_norm": 0.8515116244414418,
      "learning_rate": 2.8015752045000898e-05,
      "loss": 1.1774,
      "num_input_tokens_seen": 41114034112,
      "step": 52257
    },
    {
      "epoch": 5.54402715892213,
      "grad_norm": 0.724324364120454,
      "learning_rate": 2.801506215000518e-05,
      "loss": 1.2514,
      "num_input_tokens_seen": 41114820864,
      "step": 52258
    },
    {
      "epoch": 5.544133248461701,
      "grad_norm": 0.6237967127785533,
      "learning_rate": 2.8014372252679504e-05,
      "loss": 1.2199,
      "num_input_tokens_seen": 41115607584,
      "step": 52259
    },
    {
      "epoch": 5.544239338001273,
      "grad_norm": 0.7245754249444124,
      "learning_rate": 2.8013682353024413e-05,
      "loss": 1.1117,
      "num_input_tokens_seen": 41116394336,
      "step": 52260
    },
    {
      "epoch": 5.544345427540844,
      "grad_norm": 0.7550392277861298,
      "learning_rate": 2.801299245104044e-05,
      "loss": 1.1822,
      "num_input_tokens_seen": 41117181120,
      "step": 52261
    },
    {
      "epoch": 5.544451517080416,
      "grad_norm": 0.5874750999804265,
      "learning_rate": 2.8012302546728107e-05,
      "loss": 1.1862,
      "num_input_tokens_seen": 41117967888,
      "step": 52262
    },
    {
      "epoch": 5.544557606619987,
      "grad_norm": 0.6733354323597613,
      "learning_rate": 2.801161264008796e-05,
      "loss": 1.1139,
      "num_input_tokens_seen": 41118754656,
      "step": 52263
    },
    {
      "epoch": 5.544663696159558,
      "grad_norm": 0.5147096841242472,
      "learning_rate": 2.801092273112052e-05,
      "loss": 1.0972,
      "num_input_tokens_seen": 41119541520,
      "step": 52264
    },
    {
      "epoch": 5.54476978569913,
      "grad_norm": 0.5513281469159658,
      "learning_rate": 2.8010232819826336e-05,
      "loss": 1.1407,
      "num_input_tokens_seen": 41120328144,
      "step": 52265
    },
    {
      "epoch": 5.544875875238701,
      "grad_norm": 0.730777899483429,
      "learning_rate": 2.8009542906205932e-05,
      "loss": 1.1696,
      "num_input_tokens_seen": 41121114848,
      "step": 52266
    },
    {
      "epoch": 5.544981964778273,
      "grad_norm": 0.6255707186273592,
      "learning_rate": 2.8008852990259836e-05,
      "loss": 1.1761,
      "num_input_tokens_seen": 41121901616,
      "step": 52267
    },
    {
      "epoch": 5.545088054317844,
      "grad_norm": 0.6967544912332246,
      "learning_rate": 2.800816307198859e-05,
      "loss": 1.2474,
      "num_input_tokens_seen": 41122688368,
      "step": 52268
    },
    {
      "epoch": 5.545194143857415,
      "grad_norm": 0.6487928934495315,
      "learning_rate": 2.8007473151392728e-05,
      "loss": 1.1826,
      "num_input_tokens_seen": 41123475088,
      "step": 52269
    },
    {
      "epoch": 5.545300233396987,
      "grad_norm": 0.6679674046022878,
      "learning_rate": 2.8006783228472773e-05,
      "loss": 1.0994,
      "num_input_tokens_seen": 41124261888,
      "step": 52270
    },
    {
      "epoch": 5.545406322936558,
      "grad_norm": 0.706817510445957,
      "learning_rate": 2.8006093303229264e-05,
      "loss": 1.191,
      "num_input_tokens_seen": 41125048640,
      "step": 52271
    },
    {
      "epoch": 5.54551241247613,
      "grad_norm": 0.7294741642489398,
      "learning_rate": 2.8005403375662744e-05,
      "loss": 1.2328,
      "num_input_tokens_seen": 41125835440,
      "step": 52272
    },
    {
      "epoch": 5.545618502015701,
      "grad_norm": 0.5332207163863991,
      "learning_rate": 2.8004713445773723e-05,
      "loss": 1.0767,
      "num_input_tokens_seen": 41126622176,
      "step": 52273
    },
    {
      "epoch": 5.545724591555272,
      "grad_norm": 0.5459209396010951,
      "learning_rate": 2.8004023513562755e-05,
      "loss": 1.0944,
      "num_input_tokens_seen": 41127408960,
      "step": 52274
    },
    {
      "epoch": 5.545830681094844,
      "grad_norm": 0.5489031621806364,
      "learning_rate": 2.8003333579030368e-05,
      "loss": 1.0707,
      "num_input_tokens_seen": 41128195792,
      "step": 52275
    },
    {
      "epoch": 5.545936770634415,
      "grad_norm": 0.5285637237578904,
      "learning_rate": 2.800264364217708e-05,
      "loss": 1.1664,
      "num_input_tokens_seen": 41128982432,
      "step": 52276
    },
    {
      "epoch": 5.546042860173987,
      "grad_norm": 0.5286548158578123,
      "learning_rate": 2.8001953703003447e-05,
      "loss": 1.1141,
      "num_input_tokens_seen": 41129769264,
      "step": 52277
    },
    {
      "epoch": 5.546148949713558,
      "grad_norm": 0.5852197792426959,
      "learning_rate": 2.8001263761509993e-05,
      "loss": 1.1308,
      "num_input_tokens_seen": 41130556096,
      "step": 52278
    },
    {
      "epoch": 5.54625503925313,
      "grad_norm": 0.5826395284940031,
      "learning_rate": 2.8000573817697246e-05,
      "loss": 1.1305,
      "num_input_tokens_seen": 41131342816,
      "step": 52279
    },
    {
      "epoch": 5.546361128792701,
      "grad_norm": 0.6022274770943224,
      "learning_rate": 2.7999883871565752e-05,
      "loss": 1.1325,
      "num_input_tokens_seen": 41132129632,
      "step": 52280
    },
    {
      "epoch": 5.546467218332272,
      "grad_norm": 0.7420437788300012,
      "learning_rate": 2.7999193923116024e-05,
      "loss": 1.2021,
      "num_input_tokens_seen": 41132916256,
      "step": 52281
    },
    {
      "epoch": 5.546573307871844,
      "grad_norm": 0.7081794164464201,
      "learning_rate": 2.7998503972348617e-05,
      "loss": 1.1549,
      "num_input_tokens_seen": 41133703088,
      "step": 52282
    },
    {
      "epoch": 5.546679397411415,
      "grad_norm": 0.6753574112852035,
      "learning_rate": 2.799781401926405e-05,
      "loss": 1.1084,
      "num_input_tokens_seen": 41134489824,
      "step": 52283
    },
    {
      "epoch": 5.546785486950987,
      "grad_norm": 0.6256278023324843,
      "learning_rate": 2.7997124063862858e-05,
      "loss": 1.2247,
      "num_input_tokens_seen": 41135276592,
      "step": 52284
    },
    {
      "epoch": 5.546891576490558,
      "grad_norm": 0.6229256957089115,
      "learning_rate": 2.799643410614558e-05,
      "loss": 1.2417,
      "num_input_tokens_seen": 41136063328,
      "step": 52285
    },
    {
      "epoch": 5.54699766603013,
      "grad_norm": 0.6743989350221953,
      "learning_rate": 2.7995744146112747e-05,
      "loss": 1.1452,
      "num_input_tokens_seen": 41136850096,
      "step": 52286
    },
    {
      "epoch": 5.547103755569701,
      "grad_norm": 0.5241797540273729,
      "learning_rate": 2.7995054183764885e-05,
      "loss": 1.1213,
      "num_input_tokens_seen": 41137636944,
      "step": 52287
    },
    {
      "epoch": 5.547209845109272,
      "grad_norm": 0.6297832295008856,
      "learning_rate": 2.7994364219102537e-05,
      "loss": 1.1665,
      "num_input_tokens_seen": 41138423840,
      "step": 52288
    },
    {
      "epoch": 5.547315934648844,
      "grad_norm": 0.7396164208492945,
      "learning_rate": 2.7993674252126233e-05,
      "loss": 1.2285,
      "num_input_tokens_seen": 41139210528,
      "step": 52289
    },
    {
      "epoch": 5.547422024188415,
      "grad_norm": 0.651821868588966,
      "learning_rate": 2.79929842828365e-05,
      "loss": 1.2559,
      "num_input_tokens_seen": 41139997328,
      "step": 52290
    },
    {
      "epoch": 5.547528113727987,
      "grad_norm": 0.7949975315516696,
      "learning_rate": 2.7992294311233884e-05,
      "loss": 1.1944,
      "num_input_tokens_seen": 41140784048,
      "step": 52291
    },
    {
      "epoch": 5.547634203267558,
      "grad_norm": 0.658983115848963,
      "learning_rate": 2.799160433731891e-05,
      "loss": 1.1309,
      "num_input_tokens_seen": 41141570800,
      "step": 52292
    },
    {
      "epoch": 5.547740292807129,
      "grad_norm": 0.6654937206808745,
      "learning_rate": 2.7990914361092102e-05,
      "loss": 1.136,
      "num_input_tokens_seen": 41142357488,
      "step": 52293
    },
    {
      "epoch": 5.547846382346701,
      "grad_norm": 0.8494231122228829,
      "learning_rate": 2.7990224382554015e-05,
      "loss": 1.2559,
      "num_input_tokens_seen": 41143144288,
      "step": 52294
    },
    {
      "epoch": 5.547952471886272,
      "grad_norm": 0.748707490997051,
      "learning_rate": 2.798953440170517e-05,
      "loss": 1.199,
      "num_input_tokens_seen": 41143931024,
      "step": 52295
    },
    {
      "epoch": 5.548058561425844,
      "grad_norm": 0.8259537031247466,
      "learning_rate": 2.798884441854609e-05,
      "loss": 1.0954,
      "num_input_tokens_seen": 41144717808,
      "step": 52296
    },
    {
      "epoch": 5.548164650965415,
      "grad_norm": 0.7059849983831092,
      "learning_rate": 2.798815443307733e-05,
      "loss": 1.1812,
      "num_input_tokens_seen": 41145504544,
      "step": 52297
    },
    {
      "epoch": 5.548270740504986,
      "grad_norm": 0.626349274291958,
      "learning_rate": 2.79874644452994e-05,
      "loss": 1.1365,
      "num_input_tokens_seen": 41146291344,
      "step": 52298
    },
    {
      "epoch": 5.548376830044558,
      "grad_norm": 0.5906100566678932,
      "learning_rate": 2.7986774455212856e-05,
      "loss": 1.1706,
      "num_input_tokens_seen": 41147078128,
      "step": 52299
    },
    {
      "epoch": 5.548482919584129,
      "grad_norm": 0.8416274161213656,
      "learning_rate": 2.798608446281822e-05,
      "loss": 1.1941,
      "num_input_tokens_seen": 41147864912,
      "step": 52300
    },
    {
      "epoch": 5.548589009123701,
      "grad_norm": 0.6307047924475702,
      "learning_rate": 2.7985394468116016e-05,
      "loss": 1.112,
      "num_input_tokens_seen": 41148651712,
      "step": 52301
    },
    {
      "epoch": 5.548695098663272,
      "grad_norm": 0.678123528268976,
      "learning_rate": 2.7984704471106794e-05,
      "loss": 1.2536,
      "num_input_tokens_seen": 41149438400,
      "step": 52302
    },
    {
      "epoch": 5.548801188202843,
      "grad_norm": 0.6222672668219623,
      "learning_rate": 2.7984014471791077e-05,
      "loss": 1.1791,
      "num_input_tokens_seen": 41150225152,
      "step": 52303
    },
    {
      "epoch": 5.548907277742415,
      "grad_norm": 0.8130722076248044,
      "learning_rate": 2.7983324470169404e-05,
      "loss": 1.1931,
      "num_input_tokens_seen": 41151011952,
      "step": 52304
    },
    {
      "epoch": 5.549013367281986,
      "grad_norm": 0.719888022049551,
      "learning_rate": 2.7982634466242298e-05,
      "loss": 1.0843,
      "num_input_tokens_seen": 41151798736,
      "step": 52305
    },
    {
      "epoch": 5.549119456821558,
      "grad_norm": 0.7488854373257924,
      "learning_rate": 2.7981944460010306e-05,
      "loss": 1.2556,
      "num_input_tokens_seen": 41152585488,
      "step": 52306
    },
    {
      "epoch": 5.549225546361129,
      "grad_norm": 0.6980377571699565,
      "learning_rate": 2.7981254451473958e-05,
      "loss": 1.1271,
      "num_input_tokens_seen": 41153372224,
      "step": 52307
    },
    {
      "epoch": 5.5493316359007006,
      "grad_norm": 0.6181448152072518,
      "learning_rate": 2.798056444063378e-05,
      "loss": 1.1647,
      "num_input_tokens_seen": 41154158976,
      "step": 52308
    },
    {
      "epoch": 5.549437725440272,
      "grad_norm": 0.7156891240821184,
      "learning_rate": 2.797987442749031e-05,
      "loss": 1.1585,
      "num_input_tokens_seen": 41154945680,
      "step": 52309
    },
    {
      "epoch": 5.549543814979843,
      "grad_norm": 0.7608178096736944,
      "learning_rate": 2.7979184412044074e-05,
      "loss": 1.2169,
      "num_input_tokens_seen": 41155732432,
      "step": 52310
    },
    {
      "epoch": 5.5496499045194145,
      "grad_norm": 0.6792570993167103,
      "learning_rate": 2.7978494394295623e-05,
      "loss": 1.1737,
      "num_input_tokens_seen": 41156519200,
      "step": 52311
    },
    {
      "epoch": 5.549755994058986,
      "grad_norm": 0.7677020097023805,
      "learning_rate": 2.7977804374245474e-05,
      "loss": 1.1536,
      "num_input_tokens_seen": 41157305984,
      "step": 52312
    },
    {
      "epoch": 5.5498620835985575,
      "grad_norm": 0.6591197489793831,
      "learning_rate": 2.797711435189416e-05,
      "loss": 1.0998,
      "num_input_tokens_seen": 41158092880,
      "step": 52313
    },
    {
      "epoch": 5.5499681731381285,
      "grad_norm": 0.7073511115161507,
      "learning_rate": 2.797642432724223e-05,
      "loss": 1.1517,
      "num_input_tokens_seen": 41158879664,
      "step": 52314
    },
    {
      "epoch": 5.5500742626777,
      "grad_norm": 0.9712265685342937,
      "learning_rate": 2.7975734300290202e-05,
      "loss": 1.2427,
      "num_input_tokens_seen": 41159666480,
      "step": 52315
    },
    {
      "epoch": 5.5501803522172715,
      "grad_norm": 0.7180232786207352,
      "learning_rate": 2.797504427103861e-05,
      "loss": 1.1953,
      "num_input_tokens_seen": 41160453280,
      "step": 52316
    },
    {
      "epoch": 5.5502864417568425,
      "grad_norm": 0.6789627401737516,
      "learning_rate": 2.7974354239487993e-05,
      "loss": 1.1799,
      "num_input_tokens_seen": 41161240000,
      "step": 52317
    },
    {
      "epoch": 5.550392531296414,
      "grad_norm": 0.7414142430517934,
      "learning_rate": 2.797366420563889e-05,
      "loss": 1.1748,
      "num_input_tokens_seen": 41162026880,
      "step": 52318
    },
    {
      "epoch": 5.550498620835985,
      "grad_norm": 0.9135092968795818,
      "learning_rate": 2.7972974169491818e-05,
      "loss": 1.1474,
      "num_input_tokens_seen": 41162813648,
      "step": 52319
    },
    {
      "epoch": 5.550604710375557,
      "grad_norm": 0.6028391311267235,
      "learning_rate": 2.7972284131047316e-05,
      "loss": 1.1063,
      "num_input_tokens_seen": 41163600544,
      "step": 52320
    },
    {
      "epoch": 5.550710799915128,
      "grad_norm": 0.8828453709069504,
      "learning_rate": 2.7971594090305932e-05,
      "loss": 1.2125,
      "num_input_tokens_seen": 41164387264,
      "step": 52321
    },
    {
      "epoch": 5.550816889454699,
      "grad_norm": 0.7564237226348841,
      "learning_rate": 2.7970904047268177e-05,
      "loss": 1.201,
      "num_input_tokens_seen": 41165174016,
      "step": 52322
    },
    {
      "epoch": 5.550922978994271,
      "grad_norm": 0.8774680934063488,
      "learning_rate": 2.7970214001934596e-05,
      "loss": 1.1811,
      "num_input_tokens_seen": 41165960848,
      "step": 52323
    },
    {
      "epoch": 5.551029068533842,
      "grad_norm": 0.6923493912173629,
      "learning_rate": 2.796952395430572e-05,
      "loss": 1.1862,
      "num_input_tokens_seen": 41166747632,
      "step": 52324
    },
    {
      "epoch": 5.551135158073414,
      "grad_norm": 0.819004353223993,
      "learning_rate": 2.7968833904382085e-05,
      "loss": 1.1778,
      "num_input_tokens_seen": 41167534400,
      "step": 52325
    },
    {
      "epoch": 5.551241247612985,
      "grad_norm": 0.6980596751630084,
      "learning_rate": 2.7968143852164224e-05,
      "loss": 1.232,
      "num_input_tokens_seen": 41168321152,
      "step": 52326
    },
    {
      "epoch": 5.551347337152556,
      "grad_norm": 0.7486997378580267,
      "learning_rate": 2.7967453797652665e-05,
      "loss": 1.2118,
      "num_input_tokens_seen": 41169107872,
      "step": 52327
    },
    {
      "epoch": 5.551453426692128,
      "grad_norm": 0.785259748206317,
      "learning_rate": 2.7966763740847952e-05,
      "loss": 1.238,
      "num_input_tokens_seen": 41169894672,
      "step": 52328
    },
    {
      "epoch": 5.551559516231699,
      "grad_norm": 0.6469801643020878,
      "learning_rate": 2.7966073681750605e-05,
      "loss": 1.19,
      "num_input_tokens_seen": 41170681520,
      "step": 52329
    },
    {
      "epoch": 5.551665605771271,
      "grad_norm": 0.7315376946835672,
      "learning_rate": 2.7965383620361162e-05,
      "loss": 1.0765,
      "num_input_tokens_seen": 41171468272,
      "step": 52330
    },
    {
      "epoch": 5.551771695310842,
      "grad_norm": 0.7291201681175352,
      "learning_rate": 2.796469355668016e-05,
      "loss": 1.2202,
      "num_input_tokens_seen": 41172255040,
      "step": 52331
    },
    {
      "epoch": 5.551877784850413,
      "grad_norm": 0.674383857009403,
      "learning_rate": 2.7964003490708128e-05,
      "loss": 1.2937,
      "num_input_tokens_seen": 41173041744,
      "step": 52332
    },
    {
      "epoch": 5.551983874389985,
      "grad_norm": 0.7533774120444313,
      "learning_rate": 2.7963313422445603e-05,
      "loss": 1.1562,
      "num_input_tokens_seen": 41173828480,
      "step": 52333
    },
    {
      "epoch": 5.552089963929556,
      "grad_norm": 0.6825623999540819,
      "learning_rate": 2.7962623351893118e-05,
      "loss": 1.1414,
      "num_input_tokens_seen": 41174615280,
      "step": 52334
    },
    {
      "epoch": 5.552196053469128,
      "grad_norm": 0.6401266597942875,
      "learning_rate": 2.7961933279051204e-05,
      "loss": 1.1713,
      "num_input_tokens_seen": 41175402048,
      "step": 52335
    },
    {
      "epoch": 5.552302143008699,
      "grad_norm": 0.6010214307746886,
      "learning_rate": 2.796124320392039e-05,
      "loss": 1.1899,
      "num_input_tokens_seen": 41176188880,
      "step": 52336
    },
    {
      "epoch": 5.552408232548271,
      "grad_norm": 0.909132340489467,
      "learning_rate": 2.7960553126501222e-05,
      "loss": 1.0939,
      "num_input_tokens_seen": 41176975712,
      "step": 52337
    },
    {
      "epoch": 5.552514322087842,
      "grad_norm": 0.5486195126889641,
      "learning_rate": 2.7959863046794222e-05,
      "loss": 1.1269,
      "num_input_tokens_seen": 41177762480,
      "step": 52338
    },
    {
      "epoch": 5.552620411627413,
      "grad_norm": 0.7202332656733634,
      "learning_rate": 2.7959172964799917e-05,
      "loss": 1.159,
      "num_input_tokens_seen": 41178549232,
      "step": 52339
    },
    {
      "epoch": 5.552726501166985,
      "grad_norm": 0.6913297243338331,
      "learning_rate": 2.7958482880518864e-05,
      "loss": 1.1694,
      "num_input_tokens_seen": 41179336016,
      "step": 52340
    },
    {
      "epoch": 5.552832590706556,
      "grad_norm": 0.7605961266298759,
      "learning_rate": 2.7957792793951574e-05,
      "loss": 1.1818,
      "num_input_tokens_seen": 41180122704,
      "step": 52341
    },
    {
      "epoch": 5.552938680246128,
      "grad_norm": 0.6239869576082002,
      "learning_rate": 2.7957102705098593e-05,
      "loss": 1.1944,
      "num_input_tokens_seen": 41180909376,
      "step": 52342
    },
    {
      "epoch": 5.553044769785699,
      "grad_norm": 0.6557055213511955,
      "learning_rate": 2.7956412613960446e-05,
      "loss": 1.1629,
      "num_input_tokens_seen": 41181696160,
      "step": 52343
    },
    {
      "epoch": 5.553150859325271,
      "grad_norm": 0.7655043949493804,
      "learning_rate": 2.7955722520537675e-05,
      "loss": 1.1959,
      "num_input_tokens_seen": 41182482880,
      "step": 52344
    },
    {
      "epoch": 5.553256948864842,
      "grad_norm": 0.7549979696431363,
      "learning_rate": 2.7955032424830808e-05,
      "loss": 1.129,
      "num_input_tokens_seen": 41183269712,
      "step": 52345
    },
    {
      "epoch": 5.553363038404413,
      "grad_norm": 0.6347826504584573,
      "learning_rate": 2.7954342326840378e-05,
      "loss": 1.1718,
      "num_input_tokens_seen": 41184056512,
      "step": 52346
    },
    {
      "epoch": 5.553469127943985,
      "grad_norm": 0.6706744323897277,
      "learning_rate": 2.7953652226566912e-05,
      "loss": 1.0703,
      "num_input_tokens_seen": 41184843232,
      "step": 52347
    },
    {
      "epoch": 5.553575217483556,
      "grad_norm": 0.7703826503473991,
      "learning_rate": 2.7952962124010957e-05,
      "loss": 1.1289,
      "num_input_tokens_seen": 41185630080,
      "step": 52348
    },
    {
      "epoch": 5.553681307023128,
      "grad_norm": 0.5441619772088275,
      "learning_rate": 2.7952272019173038e-05,
      "loss": 1.0659,
      "num_input_tokens_seen": 41186416832,
      "step": 52349
    },
    {
      "epoch": 5.553787396562699,
      "grad_norm": 0.7683703308907297,
      "learning_rate": 2.7951581912053686e-05,
      "loss": 1.2253,
      "num_input_tokens_seen": 41187203648,
      "step": 52350
    },
    {
      "epoch": 5.55389348610227,
      "grad_norm": 0.612073321464415,
      "learning_rate": 2.795089180265344e-05,
      "loss": 1.0992,
      "num_input_tokens_seen": 41187990336,
      "step": 52351
    },
    {
      "epoch": 5.553999575641842,
      "grad_norm": 0.543882991022555,
      "learning_rate": 2.7950201690972834e-05,
      "loss": 1.082,
      "num_input_tokens_seen": 41188777152,
      "step": 52352
    },
    {
      "epoch": 5.554105665181413,
      "grad_norm": 0.7096997002832163,
      "learning_rate": 2.7949511577012394e-05,
      "loss": 1.2012,
      "num_input_tokens_seen": 41189563968,
      "step": 52353
    },
    {
      "epoch": 5.554211754720985,
      "grad_norm": 0.6494953942623621,
      "learning_rate": 2.794882146077267e-05,
      "loss": 1.2057,
      "num_input_tokens_seen": 41190350720,
      "step": 52354
    },
    {
      "epoch": 5.554317844260556,
      "grad_norm": 0.5781565346267729,
      "learning_rate": 2.7948131342254175e-05,
      "loss": 1.1033,
      "num_input_tokens_seen": 41191137568,
      "step": 52355
    },
    {
      "epoch": 5.554423933800127,
      "grad_norm": 0.6815903803994997,
      "learning_rate": 2.7947441221457443e-05,
      "loss": 1.2097,
      "num_input_tokens_seen": 41191924304,
      "step": 52356
    },
    {
      "epoch": 5.554530023339699,
      "grad_norm": 0.6118625906610139,
      "learning_rate": 2.7946751098383027e-05,
      "loss": 1.1414,
      "num_input_tokens_seen": 41192711136,
      "step": 52357
    },
    {
      "epoch": 5.55463611287927,
      "grad_norm": 0.6415668671424468,
      "learning_rate": 2.7946060973031447e-05,
      "loss": 1.1813,
      "num_input_tokens_seen": 41193497824,
      "step": 52358
    },
    {
      "epoch": 5.554742202418842,
      "grad_norm": 0.6244997708283205,
      "learning_rate": 2.794537084540323e-05,
      "loss": 1.1933,
      "num_input_tokens_seen": 41194284560,
      "step": 52359
    },
    {
      "epoch": 5.554848291958413,
      "grad_norm": 0.8415741314389692,
      "learning_rate": 2.794468071549892e-05,
      "loss": 1.096,
      "num_input_tokens_seen": 41195071376,
      "step": 52360
    },
    {
      "epoch": 5.554954381497984,
      "grad_norm": 0.7724783931829583,
      "learning_rate": 2.7943990583319053e-05,
      "loss": 1.0992,
      "num_input_tokens_seen": 41195858096,
      "step": 52361
    },
    {
      "epoch": 5.555060471037556,
      "grad_norm": 0.7229072562232063,
      "learning_rate": 2.7943300448864152e-05,
      "loss": 1.1552,
      "num_input_tokens_seen": 41196644944,
      "step": 52362
    },
    {
      "epoch": 5.555166560577127,
      "grad_norm": 0.6563423756042231,
      "learning_rate": 2.7942610312134755e-05,
      "loss": 1.1515,
      "num_input_tokens_seen": 41197431680,
      "step": 52363
    },
    {
      "epoch": 5.555272650116699,
      "grad_norm": 0.8947472128014377,
      "learning_rate": 2.79419201731314e-05,
      "loss": 1.1713,
      "num_input_tokens_seen": 41198218432,
      "step": 52364
    },
    {
      "epoch": 5.55537873965627,
      "grad_norm": 0.7385940892794982,
      "learning_rate": 2.7941230031854603e-05,
      "loss": 1.2345,
      "num_input_tokens_seen": 41199005152,
      "step": 52365
    },
    {
      "epoch": 5.555484829195842,
      "grad_norm": 0.7547082383288185,
      "learning_rate": 2.7940539888304917e-05,
      "loss": 1.3226,
      "num_input_tokens_seen": 41199791920,
      "step": 52366
    },
    {
      "epoch": 5.555590918735413,
      "grad_norm": 0.7497603336574377,
      "learning_rate": 2.7939849742482865e-05,
      "loss": 1.1775,
      "num_input_tokens_seen": 41200578576,
      "step": 52367
    },
    {
      "epoch": 5.555697008274985,
      "grad_norm": 0.6265024516855604,
      "learning_rate": 2.7939159594388985e-05,
      "loss": 1.2049,
      "num_input_tokens_seen": 41201365344,
      "step": 52368
    },
    {
      "epoch": 5.555803097814556,
      "grad_norm": 0.6181679864062418,
      "learning_rate": 2.7938469444023818e-05,
      "loss": 1.1627,
      "num_input_tokens_seen": 41202152144,
      "step": 52369
    },
    {
      "epoch": 5.555909187354127,
      "grad_norm": 0.689062433565355,
      "learning_rate": 2.7937779291387873e-05,
      "loss": 1.0916,
      "num_input_tokens_seen": 41202938976,
      "step": 52370
    },
    {
      "epoch": 5.556015276893699,
      "grad_norm": 0.7105214716940377,
      "learning_rate": 2.7937089136481708e-05,
      "loss": 1.1102,
      "num_input_tokens_seen": 41203725728,
      "step": 52371
    },
    {
      "epoch": 5.55612136643327,
      "grad_norm": 0.6097389156351938,
      "learning_rate": 2.7936398979305843e-05,
      "loss": 1.2288,
      "num_input_tokens_seen": 41204512432,
      "step": 52372
    },
    {
      "epoch": 5.5562274559728415,
      "grad_norm": 1.1911545147729954,
      "learning_rate": 2.7935708819860818e-05,
      "loss": 1.1768,
      "num_input_tokens_seen": 41205299296,
      "step": 52373
    },
    {
      "epoch": 5.5563335455124125,
      "grad_norm": 0.8318813869354751,
      "learning_rate": 2.793501865814716e-05,
      "loss": 1.1974,
      "num_input_tokens_seen": 41206086080,
      "step": 52374
    },
    {
      "epoch": 5.556439635051984,
      "grad_norm": 0.6701567007140888,
      "learning_rate": 2.7934328494165413e-05,
      "loss": 1.2707,
      "num_input_tokens_seen": 41206872784,
      "step": 52375
    },
    {
      "epoch": 5.5565457245915555,
      "grad_norm": 1.0405735315957738,
      "learning_rate": 2.793363832791609e-05,
      "loss": 1.1716,
      "num_input_tokens_seen": 41207659472,
      "step": 52376
    },
    {
      "epoch": 5.5566518141311265,
      "grad_norm": 0.7137286059970241,
      "learning_rate": 2.7932948159399745e-05,
      "loss": 1.1175,
      "num_input_tokens_seen": 41208446256,
      "step": 52377
    },
    {
      "epoch": 5.556757903670698,
      "grad_norm": 0.8667402427248444,
      "learning_rate": 2.7932257988616906e-05,
      "loss": 1.1184,
      "num_input_tokens_seen": 41209232976,
      "step": 52378
    },
    {
      "epoch": 5.5568639932102695,
      "grad_norm": 0.9150993232244664,
      "learning_rate": 2.79315678155681e-05,
      "loss": 1.2047,
      "num_input_tokens_seen": 41210019712,
      "step": 52379
    },
    {
      "epoch": 5.5569700827498405,
      "grad_norm": 0.6699682020335163,
      "learning_rate": 2.7930877640253866e-05,
      "loss": 1.1545,
      "num_input_tokens_seen": 41210806560,
      "step": 52380
    },
    {
      "epoch": 5.557076172289412,
      "grad_norm": 0.7352121447383236,
      "learning_rate": 2.793018746267474e-05,
      "loss": 1.1544,
      "num_input_tokens_seen": 41211593360,
      "step": 52381
    },
    {
      "epoch": 5.5571822618289834,
      "grad_norm": 0.6309807577615056,
      "learning_rate": 2.792949728283124e-05,
      "loss": 1.0879,
      "num_input_tokens_seen": 41212380192,
      "step": 52382
    },
    {
      "epoch": 5.557288351368555,
      "grad_norm": 0.6742779852887241,
      "learning_rate": 2.792880710072392e-05,
      "loss": 1.1581,
      "num_input_tokens_seen": 41213166944,
      "step": 52383
    },
    {
      "epoch": 5.557394440908126,
      "grad_norm": 0.6030189035621405,
      "learning_rate": 2.79281169163533e-05,
      "loss": 1.1065,
      "num_input_tokens_seen": 41213953712,
      "step": 52384
    },
    {
      "epoch": 5.557500530447697,
      "grad_norm": 0.7173899805561189,
      "learning_rate": 2.7927426729719918e-05,
      "loss": 1.2137,
      "num_input_tokens_seen": 41214740432,
      "step": 52385
    },
    {
      "epoch": 5.557606619987269,
      "grad_norm": 0.6422749712844931,
      "learning_rate": 2.792673654082431e-05,
      "loss": 1.2127,
      "num_input_tokens_seen": 41215527232,
      "step": 52386
    },
    {
      "epoch": 5.55771270952684,
      "grad_norm": 0.7338678168674355,
      "learning_rate": 2.7926046349667e-05,
      "loss": 1.128,
      "num_input_tokens_seen": 41216314016,
      "step": 52387
    },
    {
      "epoch": 5.557818799066412,
      "grad_norm": 0.6626968128176538,
      "learning_rate": 2.7925356156248534e-05,
      "loss": 1.148,
      "num_input_tokens_seen": 41217100656,
      "step": 52388
    },
    {
      "epoch": 5.557924888605983,
      "grad_norm": 0.5896589105018087,
      "learning_rate": 2.7924665960569435e-05,
      "loss": 1.1842,
      "num_input_tokens_seen": 41217887392,
      "step": 52389
    },
    {
      "epoch": 5.558030978145554,
      "grad_norm": 0.8863819590173175,
      "learning_rate": 2.7923975762630235e-05,
      "loss": 1.1491,
      "num_input_tokens_seen": 41218674160,
      "step": 52390
    },
    {
      "epoch": 5.558137067685126,
      "grad_norm": 0.6868595347968225,
      "learning_rate": 2.792328556243148e-05,
      "loss": 1.1454,
      "num_input_tokens_seen": 41219460848,
      "step": 52391
    },
    {
      "epoch": 5.558243157224697,
      "grad_norm": 0.9569665948320973,
      "learning_rate": 2.792259535997369e-05,
      "loss": 1.2322,
      "num_input_tokens_seen": 41220247632,
      "step": 52392
    },
    {
      "epoch": 5.558349246764269,
      "grad_norm": 0.739360916664675,
      "learning_rate": 2.7921905155257404e-05,
      "loss": 1.1182,
      "num_input_tokens_seen": 41221034464,
      "step": 52393
    },
    {
      "epoch": 5.55845533630384,
      "grad_norm": 0.7590088377789067,
      "learning_rate": 2.7921214948283157e-05,
      "loss": 1.145,
      "num_input_tokens_seen": 41221821232,
      "step": 52394
    },
    {
      "epoch": 5.558561425843412,
      "grad_norm": 0.7968841402415838,
      "learning_rate": 2.792052473905149e-05,
      "loss": 1.1838,
      "num_input_tokens_seen": 41222608032,
      "step": 52395
    },
    {
      "epoch": 5.558667515382983,
      "grad_norm": 0.7261318340947157,
      "learning_rate": 2.791983452756291e-05,
      "loss": 1.1784,
      "num_input_tokens_seen": 41223394752,
      "step": 52396
    },
    {
      "epoch": 5.558773604922555,
      "grad_norm": 0.6652135049555226,
      "learning_rate": 2.791914431381798e-05,
      "loss": 1.1164,
      "num_input_tokens_seen": 41224181456,
      "step": 52397
    },
    {
      "epoch": 5.558879694462126,
      "grad_norm": 0.6101485482878058,
      "learning_rate": 2.7918454097817216e-05,
      "loss": 1.1011,
      "num_input_tokens_seen": 41224968176,
      "step": 52398
    },
    {
      "epoch": 5.558985784001697,
      "grad_norm": 0.8354062041479547,
      "learning_rate": 2.7917763879561155e-05,
      "loss": 1.1765,
      "num_input_tokens_seen": 41225754928,
      "step": 52399
    },
    {
      "epoch": 5.559091873541269,
      "grad_norm": 0.623182923395281,
      "learning_rate": 2.7917073659050336e-05,
      "loss": 1.155,
      "num_input_tokens_seen": 41226541696,
      "step": 52400
    },
    {
      "epoch": 5.55919796308084,
      "grad_norm": 0.6754673789314785,
      "learning_rate": 2.7916383436285288e-05,
      "loss": 1.0875,
      "num_input_tokens_seen": 41227328480,
      "step": 52401
    },
    {
      "epoch": 5.559304052620412,
      "grad_norm": 0.803941269611208,
      "learning_rate": 2.7915693211266536e-05,
      "loss": 1.2582,
      "num_input_tokens_seen": 41228115248,
      "step": 52402
    },
    {
      "epoch": 5.559410142159983,
      "grad_norm": 0.564833832153753,
      "learning_rate": 2.7915002983994633e-05,
      "loss": 1.1241,
      "num_input_tokens_seen": 41228902064,
      "step": 52403
    },
    {
      "epoch": 5.559516231699554,
      "grad_norm": 0.7272770061299292,
      "learning_rate": 2.7914312754470096e-05,
      "loss": 1.1465,
      "num_input_tokens_seen": 41229688800,
      "step": 52404
    },
    {
      "epoch": 5.559622321239126,
      "grad_norm": 0.894774774066322,
      "learning_rate": 2.791362252269346e-05,
      "loss": 1.1514,
      "num_input_tokens_seen": 41230475616,
      "step": 52405
    },
    {
      "epoch": 5.559728410778697,
      "grad_norm": 0.5670711557149104,
      "learning_rate": 2.7912932288665273e-05,
      "loss": 1.1355,
      "num_input_tokens_seen": 41231262432,
      "step": 52406
    },
    {
      "epoch": 5.559834500318269,
      "grad_norm": 0.7976402554412806,
      "learning_rate": 2.7912242052386052e-05,
      "loss": 1.2096,
      "num_input_tokens_seen": 41232049120,
      "step": 52407
    },
    {
      "epoch": 5.55994058985784,
      "grad_norm": 0.6521456272044553,
      "learning_rate": 2.791155181385633e-05,
      "loss": 1.2179,
      "num_input_tokens_seen": 41232835856,
      "step": 52408
    },
    {
      "epoch": 5.560046679397411,
      "grad_norm": 0.7204609612044234,
      "learning_rate": 2.791086157307665e-05,
      "loss": 1.2548,
      "num_input_tokens_seen": 41233622544,
      "step": 52409
    },
    {
      "epoch": 5.560152768936983,
      "grad_norm": 0.9852403354869725,
      "learning_rate": 2.7910171330047547e-05,
      "loss": 1.1359,
      "num_input_tokens_seen": 41234409440,
      "step": 52410
    },
    {
      "epoch": 5.560258858476554,
      "grad_norm": 0.616456202276349,
      "learning_rate": 2.790948108476954e-05,
      "loss": 1.0764,
      "num_input_tokens_seen": 41235196256,
      "step": 52411
    },
    {
      "epoch": 5.560364948016126,
      "grad_norm": 0.626205685805248,
      "learning_rate": 2.7908790837243183e-05,
      "loss": 1.1839,
      "num_input_tokens_seen": 41235983072,
      "step": 52412
    },
    {
      "epoch": 5.560471037555697,
      "grad_norm": 0.6908254886424621,
      "learning_rate": 2.7908100587468982e-05,
      "loss": 1.1378,
      "num_input_tokens_seen": 41236769856,
      "step": 52413
    },
    {
      "epoch": 5.560577127095268,
      "grad_norm": 0.5835409860225167,
      "learning_rate": 2.7907410335447497e-05,
      "loss": 1.1002,
      "num_input_tokens_seen": 41237556640,
      "step": 52414
    },
    {
      "epoch": 5.56068321663484,
      "grad_norm": 0.7116450902055284,
      "learning_rate": 2.790672008117925e-05,
      "loss": 1.193,
      "num_input_tokens_seen": 41238343312,
      "step": 52415
    },
    {
      "epoch": 5.560789306174411,
      "grad_norm": 0.8335493300447226,
      "learning_rate": 2.790602982466477e-05,
      "loss": 1.2224,
      "num_input_tokens_seen": 41239130032,
      "step": 52416
    },
    {
      "epoch": 5.560895395713983,
      "grad_norm": 0.68184487036266,
      "learning_rate": 2.7905339565904605e-05,
      "loss": 1.1392,
      "num_input_tokens_seen": 41239916848,
      "step": 52417
    },
    {
      "epoch": 5.561001485253554,
      "grad_norm": 0.7832480158248979,
      "learning_rate": 2.7904649304899272e-05,
      "loss": 1.0968,
      "num_input_tokens_seen": 41240703616,
      "step": 52418
    },
    {
      "epoch": 5.561107574793126,
      "grad_norm": 0.7836248988814651,
      "learning_rate": 2.790395904164931e-05,
      "loss": 1.2055,
      "num_input_tokens_seen": 41241490368,
      "step": 52419
    },
    {
      "epoch": 5.561213664332697,
      "grad_norm": 1.0987657597673621,
      "learning_rate": 2.7903268776155256e-05,
      "loss": 1.2818,
      "num_input_tokens_seen": 41242277200,
      "step": 52420
    },
    {
      "epoch": 5.561319753872268,
      "grad_norm": 0.6649195355006375,
      "learning_rate": 2.790257850841764e-05,
      "loss": 1.0754,
      "num_input_tokens_seen": 41243063904,
      "step": 52421
    },
    {
      "epoch": 5.56142584341184,
      "grad_norm": 0.7971793174710321,
      "learning_rate": 2.7901888238436995e-05,
      "loss": 1.2037,
      "num_input_tokens_seen": 41243850576,
      "step": 52422
    },
    {
      "epoch": 5.561531932951411,
      "grad_norm": 0.5576043888266998,
      "learning_rate": 2.790119796621386e-05,
      "loss": 1.0627,
      "num_input_tokens_seen": 41244637424,
      "step": 52423
    },
    {
      "epoch": 5.561638022490983,
      "grad_norm": 0.6370174389114942,
      "learning_rate": 2.7900507691748766e-05,
      "loss": 1.1032,
      "num_input_tokens_seen": 41245424128,
      "step": 52424
    },
    {
      "epoch": 5.561744112030554,
      "grad_norm": 0.6993023622589274,
      "learning_rate": 2.789981741504224e-05,
      "loss": 1.1113,
      "num_input_tokens_seen": 41246210864,
      "step": 52425
    },
    {
      "epoch": 5.561850201570126,
      "grad_norm": 1.0032144208472038,
      "learning_rate": 2.7899127136094822e-05,
      "loss": 1.1597,
      "num_input_tokens_seen": 41246997616,
      "step": 52426
    },
    {
      "epoch": 5.561956291109697,
      "grad_norm": 0.7421997472678582,
      "learning_rate": 2.789843685490704e-05,
      "loss": 1.2521,
      "num_input_tokens_seen": 41247784464,
      "step": 52427
    },
    {
      "epoch": 5.562062380649268,
      "grad_norm": 0.6330992176213905,
      "learning_rate": 2.7897746571479433e-05,
      "loss": 1.1876,
      "num_input_tokens_seen": 41248571184,
      "step": 52428
    },
    {
      "epoch": 5.56216847018884,
      "grad_norm": 0.6796302663157942,
      "learning_rate": 2.7897056285812532e-05,
      "loss": 1.0744,
      "num_input_tokens_seen": 41249357952,
      "step": 52429
    },
    {
      "epoch": 5.562274559728411,
      "grad_norm": 0.6263429970914519,
      "learning_rate": 2.789636599790687e-05,
      "loss": 1.199,
      "num_input_tokens_seen": 41250144704,
      "step": 52430
    },
    {
      "epoch": 5.562380649267983,
      "grad_norm": 0.9202056399120156,
      "learning_rate": 2.789567570776299e-05,
      "loss": 1.2098,
      "num_input_tokens_seen": 41250931472,
      "step": 52431
    },
    {
      "epoch": 5.562486738807554,
      "grad_norm": 0.6734774999494906,
      "learning_rate": 2.7894985415381415e-05,
      "loss": 1.1129,
      "num_input_tokens_seen": 41251718288,
      "step": 52432
    },
    {
      "epoch": 5.562592828347125,
      "grad_norm": 0.8674392660334482,
      "learning_rate": 2.789429512076267e-05,
      "loss": 1.1573,
      "num_input_tokens_seen": 41252504976,
      "step": 52433
    },
    {
      "epoch": 5.562698917886697,
      "grad_norm": 0.7634318240357588,
      "learning_rate": 2.7893604823907306e-05,
      "loss": 1.1656,
      "num_input_tokens_seen": 41253291728,
      "step": 52434
    },
    {
      "epoch": 5.562805007426268,
      "grad_norm": 0.594435965005351,
      "learning_rate": 2.789291452481585e-05,
      "loss": 1.1304,
      "num_input_tokens_seen": 41254078448,
      "step": 52435
    },
    {
      "epoch": 5.5629110969658395,
      "grad_norm": 0.6562685198096639,
      "learning_rate": 2.7892224223488826e-05,
      "loss": 1.1658,
      "num_input_tokens_seen": 41254865200,
      "step": 52436
    },
    {
      "epoch": 5.5630171865054105,
      "grad_norm": 0.9498250013721641,
      "learning_rate": 2.7891533919926782e-05,
      "loss": 1.189,
      "num_input_tokens_seen": 41255651920,
      "step": 52437
    },
    {
      "epoch": 5.563123276044982,
      "grad_norm": 0.6464161459515553,
      "learning_rate": 2.7890843614130252e-05,
      "loss": 1.2143,
      "num_input_tokens_seen": 41256438720,
      "step": 52438
    },
    {
      "epoch": 5.5632293655845535,
      "grad_norm": 0.9525608885724679,
      "learning_rate": 2.7890153306099754e-05,
      "loss": 1.1425,
      "num_input_tokens_seen": 41257225408,
      "step": 52439
    },
    {
      "epoch": 5.5633354551241245,
      "grad_norm": 1.1780821858456527,
      "learning_rate": 2.788946299583583e-05,
      "loss": 1.2468,
      "num_input_tokens_seen": 41258012128,
      "step": 52440
    },
    {
      "epoch": 5.5634415446636964,
      "grad_norm": 0.6526242604382059,
      "learning_rate": 2.7888772683339022e-05,
      "loss": 1.2201,
      "num_input_tokens_seen": 41258798944,
      "step": 52441
    },
    {
      "epoch": 5.5635476342032675,
      "grad_norm": 1.0127920863715425,
      "learning_rate": 2.7888082368609845e-05,
      "loss": 1.1714,
      "num_input_tokens_seen": 41259585664,
      "step": 52442
    },
    {
      "epoch": 5.5636537237428385,
      "grad_norm": 0.584845894707295,
      "learning_rate": 2.788739205164885e-05,
      "loss": 1.0799,
      "num_input_tokens_seen": 41260372496,
      "step": 52443
    },
    {
      "epoch": 5.56375981328241,
      "grad_norm": 0.7030640053514939,
      "learning_rate": 2.7886701732456553e-05,
      "loss": 1.1758,
      "num_input_tokens_seen": 41261159232,
      "step": 52444
    },
    {
      "epoch": 5.5638659028219815,
      "grad_norm": 0.5660791781825127,
      "learning_rate": 2.788601141103351e-05,
      "loss": 1.1223,
      "num_input_tokens_seen": 41261946032,
      "step": 52445
    },
    {
      "epoch": 5.563971992361553,
      "grad_norm": 0.7449401333049526,
      "learning_rate": 2.7885321087380234e-05,
      "loss": 1.1273,
      "num_input_tokens_seen": 41262732832,
      "step": 52446
    },
    {
      "epoch": 5.564078081901124,
      "grad_norm": 0.7100962827286095,
      "learning_rate": 2.7884630761497273e-05,
      "loss": 1.2712,
      "num_input_tokens_seen": 41263519680,
      "step": 52447
    },
    {
      "epoch": 5.564184171440696,
      "grad_norm": 0.8263501674899023,
      "learning_rate": 2.7883940433385148e-05,
      "loss": 1.212,
      "num_input_tokens_seen": 41264306464,
      "step": 52448
    },
    {
      "epoch": 5.564290260980267,
      "grad_norm": 0.6080640745324549,
      "learning_rate": 2.7883250103044402e-05,
      "loss": 1.1579,
      "num_input_tokens_seen": 41265093328,
      "step": 52449
    },
    {
      "epoch": 5.564396350519838,
      "grad_norm": 0.7251010245720175,
      "learning_rate": 2.7882559770475562e-05,
      "loss": 1.2029,
      "num_input_tokens_seen": 41265880128,
      "step": 52450
    },
    {
      "epoch": 5.56450244005941,
      "grad_norm": 0.6419899357080237,
      "learning_rate": 2.7881869435679165e-05,
      "loss": 1.0976,
      "num_input_tokens_seen": 41266667056,
      "step": 52451
    },
    {
      "epoch": 5.564608529598981,
      "grad_norm": 0.6356879088580022,
      "learning_rate": 2.7881179098655746e-05,
      "loss": 1.1191,
      "num_input_tokens_seen": 41267453856,
      "step": 52452
    },
    {
      "epoch": 5.564714619138553,
      "grad_norm": 0.6810686383236475,
      "learning_rate": 2.7880488759405836e-05,
      "loss": 1.1801,
      "num_input_tokens_seen": 41268240576,
      "step": 52453
    },
    {
      "epoch": 5.564820708678124,
      "grad_norm": 0.7553124379162672,
      "learning_rate": 2.787979841792997e-05,
      "loss": 1.0274,
      "num_input_tokens_seen": 41269027376,
      "step": 52454
    },
    {
      "epoch": 5.564926798217696,
      "grad_norm": 0.6864139575703654,
      "learning_rate": 2.7879108074228676e-05,
      "loss": 1.182,
      "num_input_tokens_seen": 41269814096,
      "step": 52455
    },
    {
      "epoch": 5.565032887757267,
      "grad_norm": 0.7623336419631032,
      "learning_rate": 2.7878417728302493e-05,
      "loss": 1.2176,
      "num_input_tokens_seen": 41270600752,
      "step": 52456
    },
    {
      "epoch": 5.565138977296838,
      "grad_norm": 0.7706246970967356,
      "learning_rate": 2.7877727380151957e-05,
      "loss": 1.1805,
      "num_input_tokens_seen": 41271387520,
      "step": 52457
    },
    {
      "epoch": 5.56524506683641,
      "grad_norm": 0.6382594140474851,
      "learning_rate": 2.7877037029777598e-05,
      "loss": 1.1398,
      "num_input_tokens_seen": 41272174240,
      "step": 52458
    },
    {
      "epoch": 5.565351156375981,
      "grad_norm": 0.7594782560671588,
      "learning_rate": 2.7876346677179943e-05,
      "loss": 1.1896,
      "num_input_tokens_seen": 41272960928,
      "step": 52459
    },
    {
      "epoch": 5.565457245915553,
      "grad_norm": 0.6470781257678166,
      "learning_rate": 2.7875656322359535e-05,
      "loss": 1.2026,
      "num_input_tokens_seen": 41273747696,
      "step": 52460
    },
    {
      "epoch": 5.565563335455124,
      "grad_norm": 0.6269108757287666,
      "learning_rate": 2.7874965965316908e-05,
      "loss": 1.1901,
      "num_input_tokens_seen": 41274534400,
      "step": 52461
    },
    {
      "epoch": 5.565669424994695,
      "grad_norm": 0.6553956530025105,
      "learning_rate": 2.7874275606052585e-05,
      "loss": 1.1388,
      "num_input_tokens_seen": 41275321264,
      "step": 52462
    },
    {
      "epoch": 5.565775514534267,
      "grad_norm": 0.655940094356366,
      "learning_rate": 2.7873585244567112e-05,
      "loss": 1.2062,
      "num_input_tokens_seen": 41276108112,
      "step": 52463
    },
    {
      "epoch": 5.565881604073838,
      "grad_norm": 0.5354157703282528,
      "learning_rate": 2.7872894880861016e-05,
      "loss": 1.113,
      "num_input_tokens_seen": 41276894864,
      "step": 52464
    },
    {
      "epoch": 5.56598769361341,
      "grad_norm": 0.6195901026038209,
      "learning_rate": 2.7872204514934823e-05,
      "loss": 1.18,
      "num_input_tokens_seen": 41277681552,
      "step": 52465
    },
    {
      "epoch": 5.566093783152981,
      "grad_norm": 0.5840797741002272,
      "learning_rate": 2.7871514146789086e-05,
      "loss": 1.1785,
      "num_input_tokens_seen": 41278468368,
      "step": 52466
    },
    {
      "epoch": 5.566199872692552,
      "grad_norm": 0.605720979593206,
      "learning_rate": 2.7870823776424322e-05,
      "loss": 1.0697,
      "num_input_tokens_seen": 41279255120,
      "step": 52467
    },
    {
      "epoch": 5.566305962232124,
      "grad_norm": 0.6568693968235316,
      "learning_rate": 2.7870133403841063e-05,
      "loss": 1.1035,
      "num_input_tokens_seen": 41280042000,
      "step": 52468
    },
    {
      "epoch": 5.566412051771695,
      "grad_norm": 0.5719017799699961,
      "learning_rate": 2.786944302903986e-05,
      "loss": 1.1326,
      "num_input_tokens_seen": 41280828752,
      "step": 52469
    },
    {
      "epoch": 5.566518141311267,
      "grad_norm": 0.6304082792148082,
      "learning_rate": 2.7868752652021228e-05,
      "loss": 1.1089,
      "num_input_tokens_seen": 41281615440,
      "step": 52470
    },
    {
      "epoch": 5.566624230850838,
      "grad_norm": 0.71346451049349,
      "learning_rate": 2.786806227278571e-05,
      "loss": 1.1931,
      "num_input_tokens_seen": 41282402320,
      "step": 52471
    },
    {
      "epoch": 5.566730320390409,
      "grad_norm": 0.640082867138759,
      "learning_rate": 2.7867371891333842e-05,
      "loss": 1.0727,
      "num_input_tokens_seen": 41283189088,
      "step": 52472
    },
    {
      "epoch": 5.566836409929981,
      "grad_norm": 0.7252224228523421,
      "learning_rate": 2.7866681507666148e-05,
      "loss": 1.2059,
      "num_input_tokens_seen": 41283975840,
      "step": 52473
    },
    {
      "epoch": 5.566942499469552,
      "grad_norm": 0.5692405656990316,
      "learning_rate": 2.786599112178317e-05,
      "loss": 1.18,
      "num_input_tokens_seen": 41284762608,
      "step": 52474
    },
    {
      "epoch": 5.567048589009124,
      "grad_norm": 0.665210925339975,
      "learning_rate": 2.786530073368544e-05,
      "loss": 1.2754,
      "num_input_tokens_seen": 41285549456,
      "step": 52475
    },
    {
      "epoch": 5.567154678548695,
      "grad_norm": 0.6758042603428569,
      "learning_rate": 2.786461034337348e-05,
      "loss": 1.1162,
      "num_input_tokens_seen": 41286336288,
      "step": 52476
    },
    {
      "epoch": 5.567260768088267,
      "grad_norm": 0.6448890601736508,
      "learning_rate": 2.7863919950847844e-05,
      "loss": 1.1403,
      "num_input_tokens_seen": 41287123072,
      "step": 52477
    },
    {
      "epoch": 5.567366857627838,
      "grad_norm": 0.7017753317722192,
      "learning_rate": 2.786322955610905e-05,
      "loss": 1.1603,
      "num_input_tokens_seen": 41287909744,
      "step": 52478
    },
    {
      "epoch": 5.567472947167409,
      "grad_norm": 0.6025772120724501,
      "learning_rate": 2.7862539159157636e-05,
      "loss": 1.1154,
      "num_input_tokens_seen": 41288696496,
      "step": 52479
    },
    {
      "epoch": 5.567579036706981,
      "grad_norm": 0.6043018029397282,
      "learning_rate": 2.7861848759994135e-05,
      "loss": 1.1204,
      "num_input_tokens_seen": 41289483232,
      "step": 52480
    },
    {
      "epoch": 5.567685126246552,
      "grad_norm": 0.6591482459583541,
      "learning_rate": 2.7861158358619088e-05,
      "loss": 1.0612,
      "num_input_tokens_seen": 41290269984,
      "step": 52481
    },
    {
      "epoch": 5.567791215786124,
      "grad_norm": 0.6272635444573057,
      "learning_rate": 2.786046795503301e-05,
      "loss": 1.2202,
      "num_input_tokens_seen": 41291056848,
      "step": 52482
    },
    {
      "epoch": 5.567897305325695,
      "grad_norm": 0.713664478928427,
      "learning_rate": 2.7859777549236455e-05,
      "loss": 1.1576,
      "num_input_tokens_seen": 41291843600,
      "step": 52483
    },
    {
      "epoch": 5.568003394865267,
      "grad_norm": 0.5748653236440382,
      "learning_rate": 2.785908714122995e-05,
      "loss": 1.1532,
      "num_input_tokens_seen": 41292630384,
      "step": 52484
    },
    {
      "epoch": 5.568109484404838,
      "grad_norm": 0.7739835048248768,
      "learning_rate": 2.7858396731014018e-05,
      "loss": 1.228,
      "num_input_tokens_seen": 41293417296,
      "step": 52485
    },
    {
      "epoch": 5.568215573944409,
      "grad_norm": 0.5965796179687834,
      "learning_rate": 2.7857706318589206e-05,
      "loss": 1.1378,
      "num_input_tokens_seen": 41294204016,
      "step": 52486
    },
    {
      "epoch": 5.568321663483981,
      "grad_norm": 0.5576313558368662,
      "learning_rate": 2.7857015903956037e-05,
      "loss": 1.1188,
      "num_input_tokens_seen": 41294990800,
      "step": 52487
    },
    {
      "epoch": 5.568427753023552,
      "grad_norm": 0.6140656949729453,
      "learning_rate": 2.7856325487115053e-05,
      "loss": 1.2102,
      "num_input_tokens_seen": 41295777488,
      "step": 52488
    },
    {
      "epoch": 5.568533842563124,
      "grad_norm": 0.5718538441645451,
      "learning_rate": 2.7855635068066792e-05,
      "loss": 1.1295,
      "num_input_tokens_seen": 41296564240,
      "step": 52489
    },
    {
      "epoch": 5.568639932102695,
      "grad_norm": 0.6311532101005157,
      "learning_rate": 2.785494464681177e-05,
      "loss": 1.0914,
      "num_input_tokens_seen": 41297350880,
      "step": 52490
    },
    {
      "epoch": 5.568746021642266,
      "grad_norm": 0.6766896542842654,
      "learning_rate": 2.7854254223350536e-05,
      "loss": 1.2117,
      "num_input_tokens_seen": 41298137744,
      "step": 52491
    },
    {
      "epoch": 5.568852111181838,
      "grad_norm": 0.720201697347018,
      "learning_rate": 2.7853563797683618e-05,
      "loss": 1.0946,
      "num_input_tokens_seen": 41298924512,
      "step": 52492
    },
    {
      "epoch": 5.568958200721409,
      "grad_norm": 0.6106186198815399,
      "learning_rate": 2.7852873369811544e-05,
      "loss": 1.1665,
      "num_input_tokens_seen": 41299711248,
      "step": 52493
    },
    {
      "epoch": 5.569064290260981,
      "grad_norm": 0.630552260453392,
      "learning_rate": 2.785218293973485e-05,
      "loss": 1.0674,
      "num_input_tokens_seen": 41300498112,
      "step": 52494
    },
    {
      "epoch": 5.569170379800552,
      "grad_norm": 0.7543139063302764,
      "learning_rate": 2.7851492507454085e-05,
      "loss": 1.2171,
      "num_input_tokens_seen": 41301284864,
      "step": 52495
    },
    {
      "epoch": 5.569276469340123,
      "grad_norm": 0.8127771473162169,
      "learning_rate": 2.7850802072969767e-05,
      "loss": 1.2558,
      "num_input_tokens_seen": 41302071632,
      "step": 52496
    },
    {
      "epoch": 5.569382558879695,
      "grad_norm": 0.7008019510380602,
      "learning_rate": 2.785011163628243e-05,
      "loss": 1.1007,
      "num_input_tokens_seen": 41302858464,
      "step": 52497
    },
    {
      "epoch": 5.569488648419266,
      "grad_norm": 0.7198170663644287,
      "learning_rate": 2.784942119739261e-05,
      "loss": 1.1279,
      "num_input_tokens_seen": 41303645280,
      "step": 52498
    },
    {
      "epoch": 5.5695947379588375,
      "grad_norm": 0.8459947017938988,
      "learning_rate": 2.784873075630084e-05,
      "loss": 1.0234,
      "num_input_tokens_seen": 41304432016,
      "step": 52499
    },
    {
      "epoch": 5.569700827498409,
      "grad_norm": 0.713318350461989,
      "learning_rate": 2.7848040313007657e-05,
      "loss": 1.1265,
      "num_input_tokens_seen": 41305218848,
      "step": 52500
    },
    {
      "epoch": 5.56980691703798,
      "grad_norm": 0.8802971964039095,
      "learning_rate": 2.7847349867513595e-05,
      "loss": 1.1239,
      "num_input_tokens_seen": 41306005616,
      "step": 52501
    },
    {
      "epoch": 5.5699130065775515,
      "grad_norm": 0.7166609467712458,
      "learning_rate": 2.7846659419819178e-05,
      "loss": 1.2289,
      "num_input_tokens_seen": 41306792336,
      "step": 52502
    },
    {
      "epoch": 5.5700190961171225,
      "grad_norm": 0.7466343102887233,
      "learning_rate": 2.7845968969924946e-05,
      "loss": 1.1717,
      "num_input_tokens_seen": 41307579040,
      "step": 52503
    },
    {
      "epoch": 5.5701251856566945,
      "grad_norm": 1.2166536067229496,
      "learning_rate": 2.784527851783144e-05,
      "loss": 1.1771,
      "num_input_tokens_seen": 41308365824,
      "step": 52504
    },
    {
      "epoch": 5.5702312751962655,
      "grad_norm": 0.7862681649750245,
      "learning_rate": 2.784458806353918e-05,
      "loss": 1.1737,
      "num_input_tokens_seen": 41309152688,
      "step": 52505
    },
    {
      "epoch": 5.570337364735837,
      "grad_norm": 0.6450392018993726,
      "learning_rate": 2.7843897607048708e-05,
      "loss": 1.117,
      "num_input_tokens_seen": 41309939504,
      "step": 52506
    },
    {
      "epoch": 5.570443454275408,
      "grad_norm": 0.7319030216677453,
      "learning_rate": 2.7843207148360555e-05,
      "loss": 1.1512,
      "num_input_tokens_seen": 41310726240,
      "step": 52507
    },
    {
      "epoch": 5.5705495438149795,
      "grad_norm": 0.7733559974411488,
      "learning_rate": 2.7842516687475257e-05,
      "loss": 1.1499,
      "num_input_tokens_seen": 41311512992,
      "step": 52508
    },
    {
      "epoch": 5.570655633354551,
      "grad_norm": 0.688751375802914,
      "learning_rate": 2.7841826224393342e-05,
      "loss": 1.0979,
      "num_input_tokens_seen": 41312299840,
      "step": 52509
    },
    {
      "epoch": 5.570761722894122,
      "grad_norm": 1.3346094387171388,
      "learning_rate": 2.784113575911535e-05,
      "loss": 1.1402,
      "num_input_tokens_seen": 41313086736,
      "step": 52510
    },
    {
      "epoch": 5.570867812433694,
      "grad_norm": 0.682974455297916,
      "learning_rate": 2.7840445291641807e-05,
      "loss": 1.2043,
      "num_input_tokens_seen": 41313873504,
      "step": 52511
    },
    {
      "epoch": 5.570973901973265,
      "grad_norm": 0.7050774986161044,
      "learning_rate": 2.783975482197326e-05,
      "loss": 1.1027,
      "num_input_tokens_seen": 41314660272,
      "step": 52512
    },
    {
      "epoch": 5.571079991512837,
      "grad_norm": 0.8777049478516323,
      "learning_rate": 2.7839064350110227e-05,
      "loss": 1.1994,
      "num_input_tokens_seen": 41315447088,
      "step": 52513
    },
    {
      "epoch": 5.571186081052408,
      "grad_norm": 0.7512967006107182,
      "learning_rate": 2.783837387605325e-05,
      "loss": 1.1798,
      "num_input_tokens_seen": 41316233888,
      "step": 52514
    },
    {
      "epoch": 5.571292170591979,
      "grad_norm": 0.9572312363640526,
      "learning_rate": 2.783768339980286e-05,
      "loss": 1.1881,
      "num_input_tokens_seen": 41317020704,
      "step": 52515
    },
    {
      "epoch": 5.571398260131551,
      "grad_norm": 0.9812951307262451,
      "learning_rate": 2.783699292135959e-05,
      "loss": 1.1457,
      "num_input_tokens_seen": 41317807504,
      "step": 52516
    },
    {
      "epoch": 5.571504349671122,
      "grad_norm": 0.6770391306276933,
      "learning_rate": 2.7836302440723977e-05,
      "loss": 1.1003,
      "num_input_tokens_seen": 41318594256,
      "step": 52517
    },
    {
      "epoch": 5.571610439210694,
      "grad_norm": 0.7130273880015265,
      "learning_rate": 2.7835611957896558e-05,
      "loss": 1.1404,
      "num_input_tokens_seen": 41319381040,
      "step": 52518
    },
    {
      "epoch": 5.571716528750265,
      "grad_norm": 0.7717295800412134,
      "learning_rate": 2.783492147287785e-05,
      "loss": 1.1868,
      "num_input_tokens_seen": 41320167776,
      "step": 52519
    },
    {
      "epoch": 5.571822618289836,
      "grad_norm": 0.559470946996565,
      "learning_rate": 2.783423098566841e-05,
      "loss": 1.2019,
      "num_input_tokens_seen": 41320954512,
      "step": 52520
    },
    {
      "epoch": 5.571928707829408,
      "grad_norm": 0.7088755507011338,
      "learning_rate": 2.783354049626875e-05,
      "loss": 1.1586,
      "num_input_tokens_seen": 41321741184,
      "step": 52521
    },
    {
      "epoch": 5.572034797368979,
      "grad_norm": 0.7665876341341357,
      "learning_rate": 2.7832850004679416e-05,
      "loss": 1.185,
      "num_input_tokens_seen": 41322527984,
      "step": 52522
    },
    {
      "epoch": 5.572140886908551,
      "grad_norm": 0.6222641554142468,
      "learning_rate": 2.783215951090094e-05,
      "loss": 1.248,
      "num_input_tokens_seen": 41323314688,
      "step": 52523
    },
    {
      "epoch": 5.572246976448122,
      "grad_norm": 0.6059615371097488,
      "learning_rate": 2.783146901493386e-05,
      "loss": 1.1563,
      "num_input_tokens_seen": 41324101456,
      "step": 52524
    },
    {
      "epoch": 5.572353065987693,
      "grad_norm": 0.6045319295985923,
      "learning_rate": 2.7830778516778695e-05,
      "loss": 1.1319,
      "num_input_tokens_seen": 41324888256,
      "step": 52525
    },
    {
      "epoch": 5.572459155527265,
      "grad_norm": 0.6275351858145207,
      "learning_rate": 2.783008801643599e-05,
      "loss": 1.101,
      "num_input_tokens_seen": 41325675088,
      "step": 52526
    },
    {
      "epoch": 5.572565245066836,
      "grad_norm": 0.8589010305923269,
      "learning_rate": 2.7829397513906273e-05,
      "loss": 1.1808,
      "num_input_tokens_seen": 41326461936,
      "step": 52527
    },
    {
      "epoch": 5.572671334606408,
      "grad_norm": 0.5877946565068675,
      "learning_rate": 2.782870700919008e-05,
      "loss": 1.1768,
      "num_input_tokens_seen": 41327248816,
      "step": 52528
    },
    {
      "epoch": 5.572777424145979,
      "grad_norm": 0.7509774374424005,
      "learning_rate": 2.782801650228795e-05,
      "loss": 1.1788,
      "num_input_tokens_seen": 41328035584,
      "step": 52529
    },
    {
      "epoch": 5.57288351368555,
      "grad_norm": 1.0875906764952803,
      "learning_rate": 2.782732599320041e-05,
      "loss": 1.1902,
      "num_input_tokens_seen": 41328822320,
      "step": 52530
    },
    {
      "epoch": 5.572989603225122,
      "grad_norm": 0.567966966656456,
      "learning_rate": 2.7826635481928e-05,
      "loss": 1.1476,
      "num_input_tokens_seen": 41329609168,
      "step": 52531
    },
    {
      "epoch": 5.573095692764693,
      "grad_norm": 1.174403962873883,
      "learning_rate": 2.7825944968471245e-05,
      "loss": 1.2732,
      "num_input_tokens_seen": 41330396032,
      "step": 52532
    },
    {
      "epoch": 5.573201782304265,
      "grad_norm": 1.3262851825799165,
      "learning_rate": 2.7825254452830678e-05,
      "loss": 1.1209,
      "num_input_tokens_seen": 41331182784,
      "step": 52533
    },
    {
      "epoch": 5.573307871843836,
      "grad_norm": 0.6720557526118585,
      "learning_rate": 2.7824563935006846e-05,
      "loss": 1.219,
      "num_input_tokens_seen": 41331969616,
      "step": 52534
    },
    {
      "epoch": 5.573413961383408,
      "grad_norm": 0.8124288024871703,
      "learning_rate": 2.7823873415000275e-05,
      "loss": 1.1158,
      "num_input_tokens_seen": 41332756400,
      "step": 52535
    },
    {
      "epoch": 5.573520050922979,
      "grad_norm": 0.8623953498698765,
      "learning_rate": 2.7823182892811482e-05,
      "loss": 1.1087,
      "num_input_tokens_seen": 41333543264,
      "step": 52536
    },
    {
      "epoch": 5.57362614046255,
      "grad_norm": 0.6387919671072065,
      "learning_rate": 2.7822492368441034e-05,
      "loss": 1.1113,
      "num_input_tokens_seen": 41334329968,
      "step": 52537
    },
    {
      "epoch": 5.573732230002122,
      "grad_norm": 0.7954137904835673,
      "learning_rate": 2.782180184188944e-05,
      "loss": 1.0992,
      "num_input_tokens_seen": 41335116736,
      "step": 52538
    },
    {
      "epoch": 5.573838319541693,
      "grad_norm": 0.6738713225199958,
      "learning_rate": 2.7821111313157232e-05,
      "loss": 1.1791,
      "num_input_tokens_seen": 41335903440,
      "step": 52539
    },
    {
      "epoch": 5.573944409081265,
      "grad_norm": 0.616785903483766,
      "learning_rate": 2.7820420782244966e-05,
      "loss": 1.1757,
      "num_input_tokens_seen": 41336690208,
      "step": 52540
    },
    {
      "epoch": 5.574050498620836,
      "grad_norm": 0.6503522448423116,
      "learning_rate": 2.781973024915315e-05,
      "loss": 1.1496,
      "num_input_tokens_seen": 41337477008,
      "step": 52541
    },
    {
      "epoch": 5.574156588160408,
      "grad_norm": 0.57074472735849,
      "learning_rate": 2.7819039713882328e-05,
      "loss": 1.1189,
      "num_input_tokens_seen": 41338263856,
      "step": 52542
    },
    {
      "epoch": 5.574262677699979,
      "grad_norm": 0.9524607752713008,
      "learning_rate": 2.7818349176433045e-05,
      "loss": 1.191,
      "num_input_tokens_seen": 41339050608,
      "step": 52543
    },
    {
      "epoch": 5.57436876723955,
      "grad_norm": 0.6299670521115673,
      "learning_rate": 2.7817658636805822e-05,
      "loss": 1.0968,
      "num_input_tokens_seen": 41339837440,
      "step": 52544
    },
    {
      "epoch": 5.574474856779122,
      "grad_norm": 1.9624657384261717,
      "learning_rate": 2.781696809500119e-05,
      "loss": 1.1472,
      "num_input_tokens_seen": 41340624160,
      "step": 52545
    },
    {
      "epoch": 5.574580946318693,
      "grad_norm": 1.157806338256174,
      "learning_rate": 2.7816277551019693e-05,
      "loss": 1.1835,
      "num_input_tokens_seen": 41341410880,
      "step": 52546
    },
    {
      "epoch": 5.574687035858265,
      "grad_norm": 1.047274321382683,
      "learning_rate": 2.781558700486186e-05,
      "loss": 1.1674,
      "num_input_tokens_seen": 41342197648,
      "step": 52547
    },
    {
      "epoch": 5.574793125397836,
      "grad_norm": 0.7578904730569155,
      "learning_rate": 2.7814896456528217e-05,
      "loss": 1.1265,
      "num_input_tokens_seen": 41342984416,
      "step": 52548
    },
    {
      "epoch": 5.574899214937407,
      "grad_norm": 1.226383075071585,
      "learning_rate": 2.7814205906019315e-05,
      "loss": 1.1651,
      "num_input_tokens_seen": 41343771072,
      "step": 52549
    },
    {
      "epoch": 5.575005304476979,
      "grad_norm": 0.9290024443333856,
      "learning_rate": 2.7813515353335672e-05,
      "loss": 1.1842,
      "num_input_tokens_seen": 41344557776,
      "step": 52550
    },
    {
      "epoch": 5.57511139401655,
      "grad_norm": 0.846643454953998,
      "learning_rate": 2.7812824798477822e-05,
      "loss": 1.2517,
      "num_input_tokens_seen": 41345344544,
      "step": 52551
    },
    {
      "epoch": 5.575217483556122,
      "grad_norm": 1.2036883092033313,
      "learning_rate": 2.781213424144631e-05,
      "loss": 1.1946,
      "num_input_tokens_seen": 41346131280,
      "step": 52552
    },
    {
      "epoch": 5.575323573095693,
      "grad_norm": 0.6969342677758107,
      "learning_rate": 2.781144368224166e-05,
      "loss": 1.1743,
      "num_input_tokens_seen": 41346918096,
      "step": 52553
    },
    {
      "epoch": 5.575429662635264,
      "grad_norm": 0.8993806381014535,
      "learning_rate": 2.7810753120864408e-05,
      "loss": 1.2069,
      "num_input_tokens_seen": 41347704704,
      "step": 52554
    },
    {
      "epoch": 5.575535752174836,
      "grad_norm": 0.750940888852829,
      "learning_rate": 2.781006255731509e-05,
      "loss": 1.1314,
      "num_input_tokens_seen": 41348491424,
      "step": 52555
    },
    {
      "epoch": 5.575641841714407,
      "grad_norm": 0.9424946910823446,
      "learning_rate": 2.780937199159424e-05,
      "loss": 1.2209,
      "num_input_tokens_seen": 41349278208,
      "step": 52556
    },
    {
      "epoch": 5.575747931253979,
      "grad_norm": 0.6677829732333006,
      "learning_rate": 2.780868142370239e-05,
      "loss": 1.1672,
      "num_input_tokens_seen": 41350064992,
      "step": 52557
    },
    {
      "epoch": 5.57585402079355,
      "grad_norm": 0.7217184053766309,
      "learning_rate": 2.780799085364007e-05,
      "loss": 1.2216,
      "num_input_tokens_seen": 41350851744,
      "step": 52558
    },
    {
      "epoch": 5.575960110333121,
      "grad_norm": 0.8623179716989239,
      "learning_rate": 2.7807300281407815e-05,
      "loss": 1.1027,
      "num_input_tokens_seen": 41351638528,
      "step": 52559
    },
    {
      "epoch": 5.576066199872693,
      "grad_norm": 0.6589224810759458,
      "learning_rate": 2.780660970700617e-05,
      "loss": 1.1575,
      "num_input_tokens_seen": 41352425296,
      "step": 52560
    },
    {
      "epoch": 5.576172289412264,
      "grad_norm": 0.6689489093172352,
      "learning_rate": 2.7805919130435653e-05,
      "loss": 1.2708,
      "num_input_tokens_seen": 41353212048,
      "step": 52561
    },
    {
      "epoch": 5.5762783789518355,
      "grad_norm": 0.6494983624076671,
      "learning_rate": 2.78052285516968e-05,
      "loss": 1.1501,
      "num_input_tokens_seen": 41353998816,
      "step": 52562
    },
    {
      "epoch": 5.576384468491407,
      "grad_norm": 0.6808359877678085,
      "learning_rate": 2.7804537970790155e-05,
      "loss": 1.1197,
      "num_input_tokens_seen": 41354785632,
      "step": 52563
    },
    {
      "epoch": 5.5764905580309785,
      "grad_norm": 0.6400332169723737,
      "learning_rate": 2.7803847387716248e-05,
      "loss": 1.1584,
      "num_input_tokens_seen": 41355572368,
      "step": 52564
    },
    {
      "epoch": 5.5765966475705495,
      "grad_norm": 0.6046136497922625,
      "learning_rate": 2.78031568024756e-05,
      "loss": 1.0669,
      "num_input_tokens_seen": 41356359168,
      "step": 52565
    },
    {
      "epoch": 5.576702737110121,
      "grad_norm": 0.6245104265601621,
      "learning_rate": 2.780246621506876e-05,
      "loss": 1.0546,
      "num_input_tokens_seen": 41357146000,
      "step": 52566
    },
    {
      "epoch": 5.5768088266496925,
      "grad_norm": 0.7436710735252233,
      "learning_rate": 2.780177562549626e-05,
      "loss": 1.1702,
      "num_input_tokens_seen": 41357932880,
      "step": 52567
    },
    {
      "epoch": 5.5769149161892635,
      "grad_norm": 0.6029110053404529,
      "learning_rate": 2.780108503375863e-05,
      "loss": 1.1593,
      "num_input_tokens_seen": 41358719632,
      "step": 52568
    },
    {
      "epoch": 5.577021005728835,
      "grad_norm": 0.8541620951023552,
      "learning_rate": 2.78003944398564e-05,
      "loss": 1.1605,
      "num_input_tokens_seen": 41359506416,
      "step": 52569
    },
    {
      "epoch": 5.577127095268406,
      "grad_norm": 0.7391140297448532,
      "learning_rate": 2.7799703843790108e-05,
      "loss": 1.1484,
      "num_input_tokens_seen": 41360293200,
      "step": 52570
    },
    {
      "epoch": 5.577233184807978,
      "grad_norm": 0.6718967281322044,
      "learning_rate": 2.7799013245560284e-05,
      "loss": 1.2005,
      "num_input_tokens_seen": 41361080016,
      "step": 52571
    },
    {
      "epoch": 5.577339274347549,
      "grad_norm": 0.8880513007929758,
      "learning_rate": 2.7798322645167467e-05,
      "loss": 1.0948,
      "num_input_tokens_seen": 41361866816,
      "step": 52572
    },
    {
      "epoch": 5.57744536388712,
      "grad_norm": 0.8496440824449435,
      "learning_rate": 2.779763204261219e-05,
      "loss": 1.1654,
      "num_input_tokens_seen": 41362653584,
      "step": 52573
    },
    {
      "epoch": 5.577551453426692,
      "grad_norm": 0.7357241418347905,
      "learning_rate": 2.7796941437894987e-05,
      "loss": 1.1262,
      "num_input_tokens_seen": 41363440384,
      "step": 52574
    },
    {
      "epoch": 5.577657542966263,
      "grad_norm": 0.5939134403016457,
      "learning_rate": 2.7796250831016384e-05,
      "loss": 1.1653,
      "num_input_tokens_seen": 41364227136,
      "step": 52575
    },
    {
      "epoch": 5.577763632505835,
      "grad_norm": 0.8364874553355762,
      "learning_rate": 2.779556022197692e-05,
      "loss": 1.1739,
      "num_input_tokens_seen": 41365013920,
      "step": 52576
    },
    {
      "epoch": 5.577869722045406,
      "grad_norm": 0.7685306824284096,
      "learning_rate": 2.7794869610777134e-05,
      "loss": 1.2215,
      "num_input_tokens_seen": 41365800608,
      "step": 52577
    },
    {
      "epoch": 5.577975811584977,
      "grad_norm": 0.5338612081831241,
      "learning_rate": 2.7794178997417554e-05,
      "loss": 1.0199,
      "num_input_tokens_seen": 41366587328,
      "step": 52578
    },
    {
      "epoch": 5.578081901124549,
      "grad_norm": 0.609972918198742,
      "learning_rate": 2.7793488381898714e-05,
      "loss": 1.1603,
      "num_input_tokens_seen": 41367374048,
      "step": 52579
    },
    {
      "epoch": 5.57818799066412,
      "grad_norm": 0.7767099930974043,
      "learning_rate": 2.7792797764221146e-05,
      "loss": 1.1815,
      "num_input_tokens_seen": 41368160720,
      "step": 52580
    },
    {
      "epoch": 5.578294080203692,
      "grad_norm": 0.6152214099280745,
      "learning_rate": 2.779210714438539e-05,
      "loss": 1.2753,
      "num_input_tokens_seen": 41368947360,
      "step": 52581
    },
    {
      "epoch": 5.578400169743263,
      "grad_norm": 0.5433786898803243,
      "learning_rate": 2.7791416522391968e-05,
      "loss": 1.1368,
      "num_input_tokens_seen": 41369734096,
      "step": 52582
    },
    {
      "epoch": 5.578506259282834,
      "grad_norm": 0.5767662039699953,
      "learning_rate": 2.7790725898241432e-05,
      "loss": 1.1498,
      "num_input_tokens_seen": 41370520768,
      "step": 52583
    },
    {
      "epoch": 5.578612348822406,
      "grad_norm": 0.6855550573981897,
      "learning_rate": 2.77900352719343e-05,
      "loss": 1.2273,
      "num_input_tokens_seen": 41371307456,
      "step": 52584
    },
    {
      "epoch": 5.578718438361977,
      "grad_norm": 0.6920531335459523,
      "learning_rate": 2.7789344643471105e-05,
      "loss": 1.2161,
      "num_input_tokens_seen": 41372094144,
      "step": 52585
    },
    {
      "epoch": 5.578824527901549,
      "grad_norm": 0.5756313780779811,
      "learning_rate": 2.7788654012852395e-05,
      "loss": 1.1377,
      "num_input_tokens_seen": 41372880832,
      "step": 52586
    },
    {
      "epoch": 5.57893061744112,
      "grad_norm": 0.6287258499443408,
      "learning_rate": 2.778796338007869e-05,
      "loss": 1.2249,
      "num_input_tokens_seen": 41373667616,
      "step": 52587
    },
    {
      "epoch": 5.579036706980691,
      "grad_norm": 0.832183245791755,
      "learning_rate": 2.778727274515052e-05,
      "loss": 1.1215,
      "num_input_tokens_seen": 41374454416,
      "step": 52588
    },
    {
      "epoch": 5.579142796520263,
      "grad_norm": 0.6132102679038609,
      "learning_rate": 2.7786582108068438e-05,
      "loss": 1.1637,
      "num_input_tokens_seen": 41375241168,
      "step": 52589
    },
    {
      "epoch": 5.579248886059834,
      "grad_norm": 1.2585570496499061,
      "learning_rate": 2.778589146883297e-05,
      "loss": 1.2139,
      "num_input_tokens_seen": 41376027904,
      "step": 52590
    },
    {
      "epoch": 5.579354975599406,
      "grad_norm": 0.6892422590190962,
      "learning_rate": 2.778520082744464e-05,
      "loss": 1.2426,
      "num_input_tokens_seen": 41376814544,
      "step": 52591
    },
    {
      "epoch": 5.579461065138977,
      "grad_norm": 0.6205840216932647,
      "learning_rate": 2.7784510183903994e-05,
      "loss": 1.0692,
      "num_input_tokens_seen": 41377601376,
      "step": 52592
    },
    {
      "epoch": 5.579567154678549,
      "grad_norm": 0.8005681576782447,
      "learning_rate": 2.7783819538211557e-05,
      "loss": 1.2029,
      "num_input_tokens_seen": 41378388096,
      "step": 52593
    },
    {
      "epoch": 5.57967324421812,
      "grad_norm": 0.6899151558033614,
      "learning_rate": 2.7783128890367866e-05,
      "loss": 1.2139,
      "num_input_tokens_seen": 41379174832,
      "step": 52594
    },
    {
      "epoch": 5.579779333757692,
      "grad_norm": 0.7631630002008096,
      "learning_rate": 2.7782438240373453e-05,
      "loss": 1.0798,
      "num_input_tokens_seen": 41379961552,
      "step": 52595
    },
    {
      "epoch": 5.579885423297263,
      "grad_norm": 0.9080560263093445,
      "learning_rate": 2.778174758822886e-05,
      "loss": 1.2059,
      "num_input_tokens_seen": 41380748368,
      "step": 52596
    },
    {
      "epoch": 5.579991512836834,
      "grad_norm": 0.6157832071157089,
      "learning_rate": 2.7781056933934608e-05,
      "loss": 1.2128,
      "num_input_tokens_seen": 41381535184,
      "step": 52597
    },
    {
      "epoch": 5.580097602376406,
      "grad_norm": 0.7434994196509249,
      "learning_rate": 2.778036627749124e-05,
      "loss": 1.1837,
      "num_input_tokens_seen": 41382322016,
      "step": 52598
    },
    {
      "epoch": 5.580203691915977,
      "grad_norm": 0.7006680293166321,
      "learning_rate": 2.7779675618899286e-05,
      "loss": 1.2373,
      "num_input_tokens_seen": 41383108720,
      "step": 52599
    },
    {
      "epoch": 5.580309781455549,
      "grad_norm": 0.6765680504517931,
      "learning_rate": 2.7778984958159278e-05,
      "loss": 1.2348,
      "num_input_tokens_seen": 41383895392,
      "step": 52600
    },
    {
      "epoch": 5.58041587099512,
      "grad_norm": 0.9671616792098656,
      "learning_rate": 2.777829429527175e-05,
      "loss": 1.2189,
      "num_input_tokens_seen": 41384682160,
      "step": 52601
    },
    {
      "epoch": 5.580521960534691,
      "grad_norm": 0.8756561701856426,
      "learning_rate": 2.777760363023724e-05,
      "loss": 1.1294,
      "num_input_tokens_seen": 41385468848,
      "step": 52602
    },
    {
      "epoch": 5.580628050074263,
      "grad_norm": 0.8640229271818922,
      "learning_rate": 2.7776912963056282e-05,
      "loss": 1.244,
      "num_input_tokens_seen": 41386255568,
      "step": 52603
    },
    {
      "epoch": 5.580734139613834,
      "grad_norm": 0.8765393075675725,
      "learning_rate": 2.777622229372941e-05,
      "loss": 1.1562,
      "num_input_tokens_seen": 41387042240,
      "step": 52604
    },
    {
      "epoch": 5.580840229153406,
      "grad_norm": 0.915720674987552,
      "learning_rate": 2.7775531622257146e-05,
      "loss": 1.1696,
      "num_input_tokens_seen": 41387828912,
      "step": 52605
    },
    {
      "epoch": 5.580946318692977,
      "grad_norm": 0.7491478566417276,
      "learning_rate": 2.7774840948640035e-05,
      "loss": 1.1131,
      "num_input_tokens_seen": 41388615664,
      "step": 52606
    },
    {
      "epoch": 5.581052408232548,
      "grad_norm": 1.119996919062417,
      "learning_rate": 2.7774150272878612e-05,
      "loss": 1.134,
      "num_input_tokens_seen": 41389402448,
      "step": 52607
    },
    {
      "epoch": 5.58115849777212,
      "grad_norm": 0.64025800393884,
      "learning_rate": 2.7773459594973407e-05,
      "loss": 1.06,
      "num_input_tokens_seen": 41390189296,
      "step": 52608
    },
    {
      "epoch": 5.581264587311691,
      "grad_norm": 0.7800100605565166,
      "learning_rate": 2.777276891492495e-05,
      "loss": 1.2231,
      "num_input_tokens_seen": 41390976000,
      "step": 52609
    },
    {
      "epoch": 5.581370676851263,
      "grad_norm": 0.7009301190941689,
      "learning_rate": 2.7772078232733782e-05,
      "loss": 1.2098,
      "num_input_tokens_seen": 41391762768,
      "step": 52610
    },
    {
      "epoch": 5.581476766390834,
      "grad_norm": 0.7390960156113408,
      "learning_rate": 2.777138754840043e-05,
      "loss": 1.1541,
      "num_input_tokens_seen": 41392549536,
      "step": 52611
    },
    {
      "epoch": 5.581582855930405,
      "grad_norm": 0.6366473400409042,
      "learning_rate": 2.7770696861925437e-05,
      "loss": 1.2387,
      "num_input_tokens_seen": 41393336272,
      "step": 52612
    },
    {
      "epoch": 5.581688945469977,
      "grad_norm": 0.7351942665471901,
      "learning_rate": 2.7770006173309327e-05,
      "loss": 1.1321,
      "num_input_tokens_seen": 41394123088,
      "step": 52613
    },
    {
      "epoch": 5.581795035009548,
      "grad_norm": 0.6947584750286656,
      "learning_rate": 2.7769315482552633e-05,
      "loss": 1.0902,
      "num_input_tokens_seen": 41394909872,
      "step": 52614
    },
    {
      "epoch": 5.58190112454912,
      "grad_norm": 0.6442829839356058,
      "learning_rate": 2.77686247896559e-05,
      "loss": 1.2274,
      "num_input_tokens_seen": 41395696640,
      "step": 52615
    },
    {
      "epoch": 5.582007214088691,
      "grad_norm": 0.5251062959714271,
      "learning_rate": 2.7767934094619657e-05,
      "loss": 1.0753,
      "num_input_tokens_seen": 41396483376,
      "step": 52616
    },
    {
      "epoch": 5.582113303628263,
      "grad_norm": 0.5920364375509853,
      "learning_rate": 2.7767243397444425e-05,
      "loss": 1.102,
      "num_input_tokens_seen": 41397270160,
      "step": 52617
    },
    {
      "epoch": 5.582219393167834,
      "grad_norm": 0.6786103093059048,
      "learning_rate": 2.776655269813076e-05,
      "loss": 1.2359,
      "num_input_tokens_seen": 41398056864,
      "step": 52618
    },
    {
      "epoch": 5.582325482707405,
      "grad_norm": 0.7625082306546795,
      "learning_rate": 2.7765861996679177e-05,
      "loss": 1.1468,
      "num_input_tokens_seen": 41398843568,
      "step": 52619
    },
    {
      "epoch": 5.582431572246977,
      "grad_norm": 0.6398593218360354,
      "learning_rate": 2.776517129309022e-05,
      "loss": 1.1534,
      "num_input_tokens_seen": 41399630384,
      "step": 52620
    },
    {
      "epoch": 5.582537661786548,
      "grad_norm": 0.6624624476552026,
      "learning_rate": 2.7764480587364416e-05,
      "loss": 1.1176,
      "num_input_tokens_seen": 41400417152,
      "step": 52621
    },
    {
      "epoch": 5.58264375132612,
      "grad_norm": 0.6029089459832093,
      "learning_rate": 2.7763789879502305e-05,
      "loss": 1.0413,
      "num_input_tokens_seen": 41401204000,
      "step": 52622
    },
    {
      "epoch": 5.582749840865691,
      "grad_norm": 0.5768048502571318,
      "learning_rate": 2.776309916950442e-05,
      "loss": 1.1712,
      "num_input_tokens_seen": 41401990752,
      "step": 52623
    },
    {
      "epoch": 5.5828559304052625,
      "grad_norm": 0.5868538314086236,
      "learning_rate": 2.7762408457371292e-05,
      "loss": 1.2116,
      "num_input_tokens_seen": 41402777440,
      "step": 52624
    },
    {
      "epoch": 5.5829620199448335,
      "grad_norm": 0.5515056161521046,
      "learning_rate": 2.7761717743103453e-05,
      "loss": 1.056,
      "num_input_tokens_seen": 41403564224,
      "step": 52625
    },
    {
      "epoch": 5.583068109484405,
      "grad_norm": 0.6034787073629314,
      "learning_rate": 2.7761027026701448e-05,
      "loss": 1.1208,
      "num_input_tokens_seen": 41404350960,
      "step": 52626
    },
    {
      "epoch": 5.5831741990239765,
      "grad_norm": 0.6368177602711362,
      "learning_rate": 2.7760336308165797e-05,
      "loss": 1.1119,
      "num_input_tokens_seen": 41405137776,
      "step": 52627
    },
    {
      "epoch": 5.5832802885635475,
      "grad_norm": 0.6418428110902108,
      "learning_rate": 2.7759645587497035e-05,
      "loss": 1.0869,
      "num_input_tokens_seen": 41405924592,
      "step": 52628
    },
    {
      "epoch": 5.583386378103119,
      "grad_norm": 0.7962278682859092,
      "learning_rate": 2.7758954864695702e-05,
      "loss": 1.2041,
      "num_input_tokens_seen": 41406711408,
      "step": 52629
    },
    {
      "epoch": 5.5834924676426905,
      "grad_norm": 0.7150391311940603,
      "learning_rate": 2.7758264139762337e-05,
      "loss": 1.0576,
      "num_input_tokens_seen": 41407498192,
      "step": 52630
    },
    {
      "epoch": 5.5835985571822615,
      "grad_norm": 0.7595102351720023,
      "learning_rate": 2.7757573412697453e-05,
      "loss": 1.1685,
      "num_input_tokens_seen": 41408284944,
      "step": 52631
    },
    {
      "epoch": 5.583704646721833,
      "grad_norm": 0.6909632736594462,
      "learning_rate": 2.7756882683501605e-05,
      "loss": 1.2426,
      "num_input_tokens_seen": 41409071664,
      "step": 52632
    },
    {
      "epoch": 5.5838107362614045,
      "grad_norm": 0.560653547250244,
      "learning_rate": 2.7756191952175315e-05,
      "loss": 1.1208,
      "num_input_tokens_seen": 41409858384,
      "step": 52633
    },
    {
      "epoch": 5.583916825800976,
      "grad_norm": 0.6724897462101361,
      "learning_rate": 2.7755501218719128e-05,
      "loss": 1.2133,
      "num_input_tokens_seen": 41410645040,
      "step": 52634
    },
    {
      "epoch": 5.584022915340547,
      "grad_norm": 0.6224187178949786,
      "learning_rate": 2.775481048313357e-05,
      "loss": 1.1211,
      "num_input_tokens_seen": 41411431680,
      "step": 52635
    },
    {
      "epoch": 5.584129004880118,
      "grad_norm": 0.7147244982804413,
      "learning_rate": 2.7754119745419166e-05,
      "loss": 1.2092,
      "num_input_tokens_seen": 41412218432,
      "step": 52636
    },
    {
      "epoch": 5.58423509441969,
      "grad_norm": 0.6775354073724174,
      "learning_rate": 2.7753429005576465e-05,
      "loss": 1.172,
      "num_input_tokens_seen": 41413005328,
      "step": 52637
    },
    {
      "epoch": 5.584341183959261,
      "grad_norm": 0.7090517504831567,
      "learning_rate": 2.7752738263605994e-05,
      "loss": 1.1023,
      "num_input_tokens_seen": 41413792128,
      "step": 52638
    },
    {
      "epoch": 5.584447273498833,
      "grad_norm": 0.5588075513131143,
      "learning_rate": 2.7752047519508288e-05,
      "loss": 1.1508,
      "num_input_tokens_seen": 41414578800,
      "step": 52639
    },
    {
      "epoch": 5.584553363038404,
      "grad_norm": 0.6133527599417752,
      "learning_rate": 2.7751356773283882e-05,
      "loss": 1.1612,
      "num_input_tokens_seen": 41415365536,
      "step": 52640
    },
    {
      "epoch": 5.584659452577975,
      "grad_norm": 0.7041801703992039,
      "learning_rate": 2.7750666024933308e-05,
      "loss": 1.2197,
      "num_input_tokens_seen": 41416152304,
      "step": 52641
    },
    {
      "epoch": 5.584765542117547,
      "grad_norm": 0.6574003705599372,
      "learning_rate": 2.77499752744571e-05,
      "loss": 1.2338,
      "num_input_tokens_seen": 41416939072,
      "step": 52642
    },
    {
      "epoch": 5.584871631657118,
      "grad_norm": 0.6595320301455927,
      "learning_rate": 2.774928452185579e-05,
      "loss": 1.1977,
      "num_input_tokens_seen": 41417725824,
      "step": 52643
    },
    {
      "epoch": 5.58497772119669,
      "grad_norm": 0.738872069360436,
      "learning_rate": 2.7748593767129915e-05,
      "loss": 1.1114,
      "num_input_tokens_seen": 41418512672,
      "step": 52644
    },
    {
      "epoch": 5.585083810736261,
      "grad_norm": 0.5926960553208117,
      "learning_rate": 2.7747903010280002e-05,
      "loss": 1.1196,
      "num_input_tokens_seen": 41419299408,
      "step": 52645
    },
    {
      "epoch": 5.585189900275833,
      "grad_norm": 0.7092429822205998,
      "learning_rate": 2.77472122513066e-05,
      "loss": 1.2867,
      "num_input_tokens_seen": 41420086144,
      "step": 52646
    },
    {
      "epoch": 5.585295989815404,
      "grad_norm": 0.7324885719701839,
      "learning_rate": 2.7746521490210232e-05,
      "loss": 1.1242,
      "num_input_tokens_seen": 41420872992,
      "step": 52647
    },
    {
      "epoch": 5.585402079354975,
      "grad_norm": 0.7669311863656638,
      "learning_rate": 2.7745830726991424e-05,
      "loss": 1.2163,
      "num_input_tokens_seen": 41421659728,
      "step": 52648
    },
    {
      "epoch": 5.585508168894547,
      "grad_norm": 0.6209239972563558,
      "learning_rate": 2.7745139961650725e-05,
      "loss": 1.1379,
      "num_input_tokens_seen": 41422446528,
      "step": 52649
    },
    {
      "epoch": 5.585614258434118,
      "grad_norm": 1.0291981700806232,
      "learning_rate": 2.7744449194188658e-05,
      "loss": 1.1519,
      "num_input_tokens_seen": 41423233280,
      "step": 52650
    },
    {
      "epoch": 5.58572034797369,
      "grad_norm": 0.5319405337346095,
      "learning_rate": 2.7743758424605763e-05,
      "loss": 1.1301,
      "num_input_tokens_seen": 41424020096,
      "step": 52651
    },
    {
      "epoch": 5.585826437513261,
      "grad_norm": 0.7024369340094386,
      "learning_rate": 2.7743067652902576e-05,
      "loss": 1.2887,
      "num_input_tokens_seen": 41424806848,
      "step": 52652
    },
    {
      "epoch": 5.585932527052833,
      "grad_norm": 0.6813634658197218,
      "learning_rate": 2.7742376879079624e-05,
      "loss": 1.1101,
      "num_input_tokens_seen": 41425593696,
      "step": 52653
    },
    {
      "epoch": 5.586038616592404,
      "grad_norm": 0.7137149585037621,
      "learning_rate": 2.7741686103137443e-05,
      "loss": 1.2005,
      "num_input_tokens_seen": 41426380560,
      "step": 52654
    },
    {
      "epoch": 5.586144706131975,
      "grad_norm": 0.6171760048788646,
      "learning_rate": 2.7740995325076568e-05,
      "loss": 1.1672,
      "num_input_tokens_seen": 41427167312,
      "step": 52655
    },
    {
      "epoch": 5.586250795671547,
      "grad_norm": 0.6484158941742862,
      "learning_rate": 2.7740304544897532e-05,
      "loss": 1.1369,
      "num_input_tokens_seen": 41427954064,
      "step": 52656
    },
    {
      "epoch": 5.586356885211118,
      "grad_norm": 0.5833049762733222,
      "learning_rate": 2.773961376260087e-05,
      "loss": 1.2062,
      "num_input_tokens_seen": 41428740816,
      "step": 52657
    },
    {
      "epoch": 5.58646297475069,
      "grad_norm": 0.5884970036488006,
      "learning_rate": 2.7738922978187115e-05,
      "loss": 1.1117,
      "num_input_tokens_seen": 41429527632,
      "step": 52658
    },
    {
      "epoch": 5.586569064290261,
      "grad_norm": 0.5300923933964214,
      "learning_rate": 2.77382321916568e-05,
      "loss": 1.0353,
      "num_input_tokens_seen": 41430314432,
      "step": 52659
    },
    {
      "epoch": 5.586675153829832,
      "grad_norm": 0.5789963603019384,
      "learning_rate": 2.773754140301046e-05,
      "loss": 1.186,
      "num_input_tokens_seen": 41431101168,
      "step": 52660
    },
    {
      "epoch": 5.586781243369404,
      "grad_norm": 0.6119249844277617,
      "learning_rate": 2.7736850612248627e-05,
      "loss": 1.2021,
      "num_input_tokens_seen": 41431887984,
      "step": 52661
    },
    {
      "epoch": 5.586887332908975,
      "grad_norm": 0.6270120351502396,
      "learning_rate": 2.773615981937183e-05,
      "loss": 1.1689,
      "num_input_tokens_seen": 41432674784,
      "step": 52662
    },
    {
      "epoch": 5.586993422448547,
      "grad_norm": 0.5583365517355493,
      "learning_rate": 2.773546902438062e-05,
      "loss": 1.1747,
      "num_input_tokens_seen": 41433461600,
      "step": 52663
    },
    {
      "epoch": 5.587099511988118,
      "grad_norm": 0.6368272834825895,
      "learning_rate": 2.7734778227275522e-05,
      "loss": 1.1319,
      "num_input_tokens_seen": 41434248304,
      "step": 52664
    },
    {
      "epoch": 5.587205601527689,
      "grad_norm": 0.6347299686274626,
      "learning_rate": 2.7734087428057055e-05,
      "loss": 1.2356,
      "num_input_tokens_seen": 41435035088,
      "step": 52665
    },
    {
      "epoch": 5.587311691067261,
      "grad_norm": 0.6378419376201494,
      "learning_rate": 2.7733396626725773e-05,
      "loss": 1.2081,
      "num_input_tokens_seen": 41435821824,
      "step": 52666
    },
    {
      "epoch": 5.587417780606832,
      "grad_norm": 0.6206079432966739,
      "learning_rate": 2.77327058232822e-05,
      "loss": 1.2022,
      "num_input_tokens_seen": 41436608624,
      "step": 52667
    },
    {
      "epoch": 5.587523870146404,
      "grad_norm": 0.7939532149128257,
      "learning_rate": 2.773201501772687e-05,
      "loss": 1.1644,
      "num_input_tokens_seen": 41437395440,
      "step": 52668
    },
    {
      "epoch": 5.587629959685975,
      "grad_norm": 0.8056725709844368,
      "learning_rate": 2.7731324210060328e-05,
      "loss": 1.2155,
      "num_input_tokens_seen": 41438182192,
      "step": 52669
    },
    {
      "epoch": 5.587736049225546,
      "grad_norm": 0.669406247686988,
      "learning_rate": 2.773063340028309e-05,
      "loss": 1.1232,
      "num_input_tokens_seen": 41438968896,
      "step": 52670
    },
    {
      "epoch": 5.587842138765118,
      "grad_norm": 1.087352242733035,
      "learning_rate": 2.77299425883957e-05,
      "loss": 1.2634,
      "num_input_tokens_seen": 41439755632,
      "step": 52671
    },
    {
      "epoch": 5.587948228304689,
      "grad_norm": 0.5350399235251347,
      "learning_rate": 2.7729251774398695e-05,
      "loss": 1.1106,
      "num_input_tokens_seen": 41440542352,
      "step": 52672
    },
    {
      "epoch": 5.588054317844261,
      "grad_norm": 0.795224650742982,
      "learning_rate": 2.7728560958292603e-05,
      "loss": 1.1978,
      "num_input_tokens_seen": 41441329168,
      "step": 52673
    },
    {
      "epoch": 5.588160407383832,
      "grad_norm": 0.7832962690236542,
      "learning_rate": 2.7727870140077956e-05,
      "loss": 1.1652,
      "num_input_tokens_seen": 41442115936,
      "step": 52674
    },
    {
      "epoch": 5.588266496923404,
      "grad_norm": 0.6807257043618683,
      "learning_rate": 2.7727179319755294e-05,
      "loss": 1.2184,
      "num_input_tokens_seen": 41442902640,
      "step": 52675
    },
    {
      "epoch": 5.588372586462975,
      "grad_norm": 0.6958108810023218,
      "learning_rate": 2.7726488497325143e-05,
      "loss": 1.1818,
      "num_input_tokens_seen": 41443689328,
      "step": 52676
    },
    {
      "epoch": 5.588478676002546,
      "grad_norm": 0.7957104498351147,
      "learning_rate": 2.7725797672788044e-05,
      "loss": 1.0895,
      "num_input_tokens_seen": 41444476080,
      "step": 52677
    },
    {
      "epoch": 5.588584765542118,
      "grad_norm": 0.5593475683472588,
      "learning_rate": 2.772510684614453e-05,
      "loss": 1.1385,
      "num_input_tokens_seen": 41445262928,
      "step": 52678
    },
    {
      "epoch": 5.588690855081689,
      "grad_norm": 0.9789014361596163,
      "learning_rate": 2.772441601739513e-05,
      "loss": 1.077,
      "num_input_tokens_seen": 41446049776,
      "step": 52679
    },
    {
      "epoch": 5.588796944621261,
      "grad_norm": 0.6949304246695698,
      "learning_rate": 2.7723725186540384e-05,
      "loss": 1.1266,
      "num_input_tokens_seen": 41446836496,
      "step": 52680
    },
    {
      "epoch": 5.588903034160832,
      "grad_norm": 0.5921177079502841,
      "learning_rate": 2.7723034353580827e-05,
      "loss": 1.2252,
      "num_input_tokens_seen": 41447623280,
      "step": 52681
    },
    {
      "epoch": 5.589009123700404,
      "grad_norm": 0.8563369594134391,
      "learning_rate": 2.772234351851698e-05,
      "loss": 1.2073,
      "num_input_tokens_seen": 41448410064,
      "step": 52682
    },
    {
      "epoch": 5.589115213239975,
      "grad_norm": 0.7496268064809309,
      "learning_rate": 2.772165268134939e-05,
      "loss": 1.2442,
      "num_input_tokens_seen": 41449196832,
      "step": 52683
    },
    {
      "epoch": 5.589221302779546,
      "grad_norm": 0.7052257229722807,
      "learning_rate": 2.772096184207859e-05,
      "loss": 1.1236,
      "num_input_tokens_seen": 41449983584,
      "step": 52684
    },
    {
      "epoch": 5.589327392319118,
      "grad_norm": 0.7826798400636692,
      "learning_rate": 2.772027100070511e-05,
      "loss": 1.1221,
      "num_input_tokens_seen": 41450770304,
      "step": 52685
    },
    {
      "epoch": 5.589433481858689,
      "grad_norm": 0.6763273046657634,
      "learning_rate": 2.771958015722948e-05,
      "loss": 1.1473,
      "num_input_tokens_seen": 41451556992,
      "step": 52686
    },
    {
      "epoch": 5.5895395713982605,
      "grad_norm": 0.8748908407465228,
      "learning_rate": 2.771888931165224e-05,
      "loss": 1.103,
      "num_input_tokens_seen": 41452343792,
      "step": 52687
    },
    {
      "epoch": 5.5896456609378316,
      "grad_norm": 0.6879964255393055,
      "learning_rate": 2.771819846397392e-05,
      "loss": 1.2248,
      "num_input_tokens_seen": 41453130544,
      "step": 52688
    },
    {
      "epoch": 5.589751750477403,
      "grad_norm": 0.6662315582781783,
      "learning_rate": 2.7717507614195058e-05,
      "loss": 1.1288,
      "num_input_tokens_seen": 41453917312,
      "step": 52689
    },
    {
      "epoch": 5.5898578400169745,
      "grad_norm": 0.721373154584936,
      "learning_rate": 2.771681676231619e-05,
      "loss": 1.1198,
      "num_input_tokens_seen": 41454703984,
      "step": 52690
    },
    {
      "epoch": 5.5899639295565455,
      "grad_norm": 0.9109434705063699,
      "learning_rate": 2.7716125908337843e-05,
      "loss": 1.2239,
      "num_input_tokens_seen": 41455490832,
      "step": 52691
    },
    {
      "epoch": 5.5900700190961174,
      "grad_norm": 0.7775917541151919,
      "learning_rate": 2.7715435052260552e-05,
      "loss": 1.1967,
      "num_input_tokens_seen": 41456277472,
      "step": 52692
    },
    {
      "epoch": 5.5901761086356885,
      "grad_norm": 0.689135496568436,
      "learning_rate": 2.7714744194084858e-05,
      "loss": 1.1269,
      "num_input_tokens_seen": 41457064224,
      "step": 52693
    },
    {
      "epoch": 5.5902821981752595,
      "grad_norm": 0.7240430417239898,
      "learning_rate": 2.771405333381128e-05,
      "loss": 1.1892,
      "num_input_tokens_seen": 41457850912,
      "step": 52694
    },
    {
      "epoch": 5.590388287714831,
      "grad_norm": 0.6360723100465854,
      "learning_rate": 2.771336247144037e-05,
      "loss": 1.1277,
      "num_input_tokens_seen": 41458637696,
      "step": 52695
    },
    {
      "epoch": 5.5904943772544025,
      "grad_norm": 0.760214621897877,
      "learning_rate": 2.7712671606972647e-05,
      "loss": 1.2239,
      "num_input_tokens_seen": 41459424448,
      "step": 52696
    },
    {
      "epoch": 5.590600466793974,
      "grad_norm": 0.642886874838788,
      "learning_rate": 2.771198074040865e-05,
      "loss": 1.2024,
      "num_input_tokens_seen": 41460211136,
      "step": 52697
    },
    {
      "epoch": 5.590706556333545,
      "grad_norm": 0.7342137040134314,
      "learning_rate": 2.7711289871748918e-05,
      "loss": 1.1529,
      "num_input_tokens_seen": 41460997872,
      "step": 52698
    },
    {
      "epoch": 5.590812645873116,
      "grad_norm": 0.7762506924395352,
      "learning_rate": 2.7710599000993982e-05,
      "loss": 1.2157,
      "num_input_tokens_seen": 41461784544,
      "step": 52699
    },
    {
      "epoch": 5.590918735412688,
      "grad_norm": 0.7460755987805154,
      "learning_rate": 2.7709908128144368e-05,
      "loss": 1.1833,
      "num_input_tokens_seen": 41462571312,
      "step": 52700
    },
    {
      "epoch": 5.591024824952259,
      "grad_norm": 0.7503967302681168,
      "learning_rate": 2.7709217253200627e-05,
      "loss": 1.0928,
      "num_input_tokens_seen": 41463358144,
      "step": 52701
    },
    {
      "epoch": 5.591130914491831,
      "grad_norm": 0.8266939027903522,
      "learning_rate": 2.7708526376163275e-05,
      "loss": 1.103,
      "num_input_tokens_seen": 41464145008,
      "step": 52702
    },
    {
      "epoch": 5.591237004031402,
      "grad_norm": 0.6912569133409613,
      "learning_rate": 2.7707835497032853e-05,
      "loss": 1.2796,
      "num_input_tokens_seen": 41464931760,
      "step": 52703
    },
    {
      "epoch": 5.591343093570974,
      "grad_norm": 0.8544422570324233,
      "learning_rate": 2.7707144615809898e-05,
      "loss": 1.245,
      "num_input_tokens_seen": 41465718480,
      "step": 52704
    },
    {
      "epoch": 5.591449183110545,
      "grad_norm": 0.5514947341708967,
      "learning_rate": 2.7706453732494934e-05,
      "loss": 1.0212,
      "num_input_tokens_seen": 41466505280,
      "step": 52705
    },
    {
      "epoch": 5.591555272650116,
      "grad_norm": 0.6290639455562941,
      "learning_rate": 2.7705762847088514e-05,
      "loss": 1.1017,
      "num_input_tokens_seen": 41467292112,
      "step": 52706
    },
    {
      "epoch": 5.591661362189688,
      "grad_norm": 0.7392207935435636,
      "learning_rate": 2.7705071959591155e-05,
      "loss": 1.2121,
      "num_input_tokens_seen": 41468078864,
      "step": 52707
    },
    {
      "epoch": 5.591767451729259,
      "grad_norm": 0.5984607750421465,
      "learning_rate": 2.7704381070003387e-05,
      "loss": 1.1559,
      "num_input_tokens_seen": 41468865776,
      "step": 52708
    },
    {
      "epoch": 5.591873541268831,
      "grad_norm": 0.8406659950408052,
      "learning_rate": 2.7703690178325765e-05,
      "loss": 1.2143,
      "num_input_tokens_seen": 41469652464,
      "step": 52709
    },
    {
      "epoch": 5.591979630808402,
      "grad_norm": 0.6141190307999859,
      "learning_rate": 2.7702999284558807e-05,
      "loss": 1.2099,
      "num_input_tokens_seen": 41470439232,
      "step": 52710
    },
    {
      "epoch": 5.592085720347974,
      "grad_norm": 0.7804725731265959,
      "learning_rate": 2.7702308388703046e-05,
      "loss": 1.141,
      "num_input_tokens_seen": 41471226016,
      "step": 52711
    },
    {
      "epoch": 5.592191809887545,
      "grad_norm": 0.6676183041759053,
      "learning_rate": 2.7701617490759023e-05,
      "loss": 1.1849,
      "num_input_tokens_seen": 41472012848,
      "step": 52712
    },
    {
      "epoch": 5.592297899427116,
      "grad_norm": 0.6537539050961045,
      "learning_rate": 2.770092659072727e-05,
      "loss": 1.0583,
      "num_input_tokens_seen": 41472799616,
      "step": 52713
    },
    {
      "epoch": 5.592403988966688,
      "grad_norm": 0.7525002409076194,
      "learning_rate": 2.7700235688608318e-05,
      "loss": 1.249,
      "num_input_tokens_seen": 41473586416,
      "step": 52714
    },
    {
      "epoch": 5.592510078506259,
      "grad_norm": 1.0380778739418308,
      "learning_rate": 2.769954478440271e-05,
      "loss": 1.1418,
      "num_input_tokens_seen": 41474373120,
      "step": 52715
    },
    {
      "epoch": 5.592616168045831,
      "grad_norm": 0.6574214114002352,
      "learning_rate": 2.769885387811097e-05,
      "loss": 1.1786,
      "num_input_tokens_seen": 41475159920,
      "step": 52716
    },
    {
      "epoch": 5.592722257585402,
      "grad_norm": 0.7099145183803779,
      "learning_rate": 2.7698162969733626e-05,
      "loss": 1.1902,
      "num_input_tokens_seen": 41475946688,
      "step": 52717
    },
    {
      "epoch": 5.592828347124973,
      "grad_norm": 0.6458395980762986,
      "learning_rate": 2.769747205927123e-05,
      "loss": 1.1762,
      "num_input_tokens_seen": 41476733456,
      "step": 52718
    },
    {
      "epoch": 5.592934436664545,
      "grad_norm": 0.6391298542854267,
      "learning_rate": 2.7696781146724304e-05,
      "loss": 1.1913,
      "num_input_tokens_seen": 41477520304,
      "step": 52719
    },
    {
      "epoch": 5.593040526204116,
      "grad_norm": 0.7962086184956492,
      "learning_rate": 2.7696090232093387e-05,
      "loss": 1.1853,
      "num_input_tokens_seen": 41478307072,
      "step": 52720
    },
    {
      "epoch": 5.593146615743688,
      "grad_norm": 0.622682250523036,
      "learning_rate": 2.7695399315379006e-05,
      "loss": 1.076,
      "num_input_tokens_seen": 41479093904,
      "step": 52721
    },
    {
      "epoch": 5.593252705283259,
      "grad_norm": 0.9417770614105805,
      "learning_rate": 2.7694708396581703e-05,
      "loss": 1.1967,
      "num_input_tokens_seen": 41479880752,
      "step": 52722
    },
    {
      "epoch": 5.59335879482283,
      "grad_norm": 0.8042254258069603,
      "learning_rate": 2.7694017475702007e-05,
      "loss": 1.1165,
      "num_input_tokens_seen": 41480667552,
      "step": 52723
    },
    {
      "epoch": 5.593464884362402,
      "grad_norm": 0.7175658978535177,
      "learning_rate": 2.7693326552740456e-05,
      "loss": 1.2206,
      "num_input_tokens_seen": 41481454288,
      "step": 52724
    },
    {
      "epoch": 5.593570973901973,
      "grad_norm": 0.5796674294696754,
      "learning_rate": 2.7692635627697576e-05,
      "loss": 1.0732,
      "num_input_tokens_seen": 41482241072,
      "step": 52725
    },
    {
      "epoch": 5.593677063441545,
      "grad_norm": 0.7198772968952915,
      "learning_rate": 2.7691944700573912e-05,
      "loss": 1.1993,
      "num_input_tokens_seen": 41483027808,
      "step": 52726
    },
    {
      "epoch": 5.593783152981116,
      "grad_norm": 0.6611890719438346,
      "learning_rate": 2.769125377136999e-05,
      "loss": 1.0817,
      "num_input_tokens_seen": 41483814576,
      "step": 52727
    },
    {
      "epoch": 5.593889242520687,
      "grad_norm": 0.6352978243029873,
      "learning_rate": 2.7690562840086344e-05,
      "loss": 1.0497,
      "num_input_tokens_seen": 41484601344,
      "step": 52728
    },
    {
      "epoch": 5.593995332060259,
      "grad_norm": 0.7311680619511667,
      "learning_rate": 2.7689871906723513e-05,
      "loss": 1.1939,
      "num_input_tokens_seen": 41485388064,
      "step": 52729
    },
    {
      "epoch": 5.59410142159983,
      "grad_norm": 0.6672594883388566,
      "learning_rate": 2.768918097128203e-05,
      "loss": 1.0631,
      "num_input_tokens_seen": 41486174832,
      "step": 52730
    },
    {
      "epoch": 5.594207511139402,
      "grad_norm": 0.5864597882728916,
      "learning_rate": 2.7688490033762408e-05,
      "loss": 1.1911,
      "num_input_tokens_seen": 41486961520,
      "step": 52731
    },
    {
      "epoch": 5.594313600678973,
      "grad_norm": 0.6038322437378432,
      "learning_rate": 2.7687799094165222e-05,
      "loss": 1.2704,
      "num_input_tokens_seen": 41487748272,
      "step": 52732
    },
    {
      "epoch": 5.594419690218545,
      "grad_norm": 0.735569961430872,
      "learning_rate": 2.7687108152490975e-05,
      "loss": 1.1365,
      "num_input_tokens_seen": 41488535056,
      "step": 52733
    },
    {
      "epoch": 5.594525779758116,
      "grad_norm": 0.6270412721580348,
      "learning_rate": 2.768641720874021e-05,
      "loss": 1.1623,
      "num_input_tokens_seen": 41489321728,
      "step": 52734
    },
    {
      "epoch": 5.594631869297688,
      "grad_norm": 0.6057326032440119,
      "learning_rate": 2.7685726262913463e-05,
      "loss": 1.2001,
      "num_input_tokens_seen": 41490108496,
      "step": 52735
    },
    {
      "epoch": 5.594737958837259,
      "grad_norm": 0.6949347131389709,
      "learning_rate": 2.768503531501127e-05,
      "loss": 1.2191,
      "num_input_tokens_seen": 41490895264,
      "step": 52736
    },
    {
      "epoch": 5.59484404837683,
      "grad_norm": 0.6527601876462226,
      "learning_rate": 2.768434436503415e-05,
      "loss": 1.1876,
      "num_input_tokens_seen": 41491682016,
      "step": 52737
    },
    {
      "epoch": 5.594950137916402,
      "grad_norm": 0.642953542278634,
      "learning_rate": 2.768365341298266e-05,
      "loss": 1.2235,
      "num_input_tokens_seen": 41492468688,
      "step": 52738
    },
    {
      "epoch": 5.595056227455973,
      "grad_norm": 0.7562040426148028,
      "learning_rate": 2.768296245885731e-05,
      "loss": 1.1824,
      "num_input_tokens_seen": 41493255520,
      "step": 52739
    },
    {
      "epoch": 5.595162316995545,
      "grad_norm": 0.9422444057277454,
      "learning_rate": 2.7682271502658646e-05,
      "loss": 1.2241,
      "num_input_tokens_seen": 41494042288,
      "step": 52740
    },
    {
      "epoch": 5.595268406535116,
      "grad_norm": 0.7904279587076684,
      "learning_rate": 2.768158054438721e-05,
      "loss": 1.1268,
      "num_input_tokens_seen": 41494829024,
      "step": 52741
    },
    {
      "epoch": 5.595374496074687,
      "grad_norm": 0.7321228522381138,
      "learning_rate": 2.7680889584043523e-05,
      "loss": 1.1895,
      "num_input_tokens_seen": 41495615776,
      "step": 52742
    },
    {
      "epoch": 5.595480585614259,
      "grad_norm": 0.848747999208206,
      "learning_rate": 2.7680198621628116e-05,
      "loss": 1.1132,
      "num_input_tokens_seen": 41496402464,
      "step": 52743
    },
    {
      "epoch": 5.59558667515383,
      "grad_norm": 0.7049193017190349,
      "learning_rate": 2.767950765714154e-05,
      "loss": 1.1889,
      "num_input_tokens_seen": 41497189248,
      "step": 52744
    },
    {
      "epoch": 5.595692764693402,
      "grad_norm": 0.60490068828441,
      "learning_rate": 2.7678816690584312e-05,
      "loss": 1.1351,
      "num_input_tokens_seen": 41497976032,
      "step": 52745
    },
    {
      "epoch": 5.595798854232973,
      "grad_norm": 0.9236668038832982,
      "learning_rate": 2.7678125721956976e-05,
      "loss": 1.1588,
      "num_input_tokens_seen": 41498762816,
      "step": 52746
    },
    {
      "epoch": 5.595904943772544,
      "grad_norm": 0.6610456236351617,
      "learning_rate": 2.7677434751260067e-05,
      "loss": 1.1632,
      "num_input_tokens_seen": 41499549568,
      "step": 52747
    },
    {
      "epoch": 5.596011033312116,
      "grad_norm": 0.7671087737002105,
      "learning_rate": 2.7676743778494107e-05,
      "loss": 1.2501,
      "num_input_tokens_seen": 41500336352,
      "step": 52748
    },
    {
      "epoch": 5.596117122851687,
      "grad_norm": 0.7816564268925901,
      "learning_rate": 2.7676052803659642e-05,
      "loss": 1.1134,
      "num_input_tokens_seen": 41501123136,
      "step": 52749
    },
    {
      "epoch": 5.5962232123912585,
      "grad_norm": 0.6356367404760896,
      "learning_rate": 2.7675361826757207e-05,
      "loss": 1.1286,
      "num_input_tokens_seen": 41501909952,
      "step": 52750
    },
    {
      "epoch": 5.59632930193083,
      "grad_norm": 0.6225938289036126,
      "learning_rate": 2.767467084778732e-05,
      "loss": 1.1409,
      "num_input_tokens_seen": 41502696752,
      "step": 52751
    },
    {
      "epoch": 5.596435391470401,
      "grad_norm": 0.6366545163019977,
      "learning_rate": 2.767397986675053e-05,
      "loss": 1.1725,
      "num_input_tokens_seen": 41503483424,
      "step": 52752
    },
    {
      "epoch": 5.5965414810099725,
      "grad_norm": 0.7050596098408749,
      "learning_rate": 2.7673288883647375e-05,
      "loss": 1.0848,
      "num_input_tokens_seen": 41504270240,
      "step": 52753
    },
    {
      "epoch": 5.5966475705495435,
      "grad_norm": 0.6393404425764321,
      "learning_rate": 2.767259789847837e-05,
      "loss": 1.1798,
      "num_input_tokens_seen": 41505057024,
      "step": 52754
    },
    {
      "epoch": 5.5967536600891155,
      "grad_norm": 0.6020742154081047,
      "learning_rate": 2.7671906911244067e-05,
      "loss": 1.2299,
      "num_input_tokens_seen": 41505843824,
      "step": 52755
    },
    {
      "epoch": 5.5968597496286865,
      "grad_norm": 0.7619245877018255,
      "learning_rate": 2.7671215921944993e-05,
      "loss": 1.2011,
      "num_input_tokens_seen": 41506630608,
      "step": 52756
    },
    {
      "epoch": 5.5969658391682575,
      "grad_norm": 0.7283254944703602,
      "learning_rate": 2.7670524930581676e-05,
      "loss": 1.1756,
      "num_input_tokens_seen": 41507417408,
      "step": 52757
    },
    {
      "epoch": 5.597071928707829,
      "grad_norm": 0.7523362036008199,
      "learning_rate": 2.766983393715466e-05,
      "loss": 1.1989,
      "num_input_tokens_seen": 41508204224,
      "step": 52758
    },
    {
      "epoch": 5.5971780182474005,
      "grad_norm": 0.8548878326594518,
      "learning_rate": 2.766914294166447e-05,
      "loss": 1.0831,
      "num_input_tokens_seen": 41508991008,
      "step": 52759
    },
    {
      "epoch": 5.597284107786972,
      "grad_norm": 0.7088497975375692,
      "learning_rate": 2.766845194411165e-05,
      "loss": 1.2994,
      "num_input_tokens_seen": 41509777712,
      "step": 52760
    },
    {
      "epoch": 5.597390197326543,
      "grad_norm": 0.9768086963273118,
      "learning_rate": 2.766776094449673e-05,
      "loss": 1.118,
      "num_input_tokens_seen": 41510564464,
      "step": 52761
    },
    {
      "epoch": 5.597496286866115,
      "grad_norm": 0.7156607243233423,
      "learning_rate": 2.766706994282024e-05,
      "loss": 1.184,
      "num_input_tokens_seen": 41511351296,
      "step": 52762
    },
    {
      "epoch": 5.597602376405686,
      "grad_norm": 0.637476198337968,
      "learning_rate": 2.766637893908271e-05,
      "loss": 1.1969,
      "num_input_tokens_seen": 41512138080,
      "step": 52763
    },
    {
      "epoch": 5.597708465945258,
      "grad_norm": 1.1226558779424942,
      "learning_rate": 2.766568793328469e-05,
      "loss": 1.1334,
      "num_input_tokens_seen": 41512924912,
      "step": 52764
    },
    {
      "epoch": 5.597814555484829,
      "grad_norm": 0.6883451745892611,
      "learning_rate": 2.7664996925426696e-05,
      "loss": 1.1562,
      "num_input_tokens_seen": 41513711744,
      "step": 52765
    },
    {
      "epoch": 5.5979206450244,
      "grad_norm": 0.6151734114222833,
      "learning_rate": 2.7664305915509275e-05,
      "loss": 1.1727,
      "num_input_tokens_seen": 41514498576,
      "step": 52766
    },
    {
      "epoch": 5.598026734563972,
      "grad_norm": 0.6171430335505486,
      "learning_rate": 2.7663614903532964e-05,
      "loss": 1.1385,
      "num_input_tokens_seen": 41515285440,
      "step": 52767
    },
    {
      "epoch": 5.598132824103543,
      "grad_norm": 1.0462509497656363,
      "learning_rate": 2.7662923889498275e-05,
      "loss": 1.1782,
      "num_input_tokens_seen": 41516072256,
      "step": 52768
    },
    {
      "epoch": 5.598238913643115,
      "grad_norm": 0.5346923347543863,
      "learning_rate": 2.766223287340577e-05,
      "loss": 1.092,
      "num_input_tokens_seen": 41516859152,
      "step": 52769
    },
    {
      "epoch": 5.598345003182686,
      "grad_norm": 1.0551422866048115,
      "learning_rate": 2.766154185525596e-05,
      "loss": 1.1871,
      "num_input_tokens_seen": 41517645952,
      "step": 52770
    },
    {
      "epoch": 5.598451092722257,
      "grad_norm": 0.6333325017439598,
      "learning_rate": 2.766085083504939e-05,
      "loss": 1.1298,
      "num_input_tokens_seen": 41518432688,
      "step": 52771
    },
    {
      "epoch": 5.598557182261829,
      "grad_norm": 0.7111463766741175,
      "learning_rate": 2.7660159812786597e-05,
      "loss": 1.1946,
      "num_input_tokens_seen": 41519219456,
      "step": 52772
    },
    {
      "epoch": 5.5986632718014,
      "grad_norm": 0.5975004728094071,
      "learning_rate": 2.765946878846811e-05,
      "loss": 1.3043,
      "num_input_tokens_seen": 41520006192,
      "step": 52773
    },
    {
      "epoch": 5.598769361340972,
      "grad_norm": 0.9371282452309875,
      "learning_rate": 2.7658777762094456e-05,
      "loss": 1.1441,
      "num_input_tokens_seen": 41520792960,
      "step": 52774
    },
    {
      "epoch": 5.598875450880543,
      "grad_norm": 0.6324878681351916,
      "learning_rate": 2.765808673366619e-05,
      "loss": 1.1172,
      "num_input_tokens_seen": 41521579712,
      "step": 52775
    },
    {
      "epoch": 5.598981540420114,
      "grad_norm": 0.9718840851736217,
      "learning_rate": 2.7657395703183825e-05,
      "loss": 1.1815,
      "num_input_tokens_seen": 41522366496,
      "step": 52776
    },
    {
      "epoch": 5.599087629959686,
      "grad_norm": 0.7980979354276565,
      "learning_rate": 2.7656704670647897e-05,
      "loss": 1.21,
      "num_input_tokens_seen": 41523153328,
      "step": 52777
    },
    {
      "epoch": 5.599193719499257,
      "grad_norm": 0.7211396371421357,
      "learning_rate": 2.7656013636058954e-05,
      "loss": 1.2247,
      "num_input_tokens_seen": 41523940128,
      "step": 52778
    },
    {
      "epoch": 5.599299809038829,
      "grad_norm": 0.7664620909202531,
      "learning_rate": 2.7655322599417515e-05,
      "loss": 1.1042,
      "num_input_tokens_seen": 41524726912,
      "step": 52779
    },
    {
      "epoch": 5.5994058985784,
      "grad_norm": 0.8358375374279875,
      "learning_rate": 2.765463156072412e-05,
      "loss": 1.2279,
      "num_input_tokens_seen": 41525513600,
      "step": 52780
    },
    {
      "epoch": 5.599511988117971,
      "grad_norm": 0.5970095445919327,
      "learning_rate": 2.765394051997931e-05,
      "loss": 1.1171,
      "num_input_tokens_seen": 41526300432,
      "step": 52781
    },
    {
      "epoch": 5.599618077657543,
      "grad_norm": 0.6728967366965664,
      "learning_rate": 2.7653249477183613e-05,
      "loss": 1.1343,
      "num_input_tokens_seen": 41527087200,
      "step": 52782
    },
    {
      "epoch": 5.599724167197114,
      "grad_norm": 0.6219464580758344,
      "learning_rate": 2.7652558432337555e-05,
      "loss": 1.1294,
      "num_input_tokens_seen": 41527873968,
      "step": 52783
    },
    {
      "epoch": 5.599830256736686,
      "grad_norm": 0.8675561820817264,
      "learning_rate": 2.7651867385441687e-05,
      "loss": 1.189,
      "num_input_tokens_seen": 41528660704,
      "step": 52784
    },
    {
      "epoch": 5.599936346276257,
      "grad_norm": 0.8525042005128574,
      "learning_rate": 2.7651176336496532e-05,
      "loss": 1.1669,
      "num_input_tokens_seen": 41529447456,
      "step": 52785
    },
    {
      "epoch": 5.600042435815829,
      "grad_norm": 0.8907760530922695,
      "learning_rate": 2.765048528550262e-05,
      "loss": 1.1696,
      "num_input_tokens_seen": 41530234272,
      "step": 52786
    },
    {
      "epoch": 5.6001485253554,
      "grad_norm": 0.5495875617619479,
      "learning_rate": 2.7649794232460496e-05,
      "loss": 1.1367,
      "num_input_tokens_seen": 41531021024,
      "step": 52787
    },
    {
      "epoch": 5.600254614894971,
      "grad_norm": 0.694408217722382,
      "learning_rate": 2.764910317737069e-05,
      "loss": 1.12,
      "num_input_tokens_seen": 41531807808,
      "step": 52788
    },
    {
      "epoch": 5.600360704434543,
      "grad_norm": 0.9827009782642333,
      "learning_rate": 2.7648412120233725e-05,
      "loss": 1.2123,
      "num_input_tokens_seen": 41532594576,
      "step": 52789
    },
    {
      "epoch": 5.600466793974114,
      "grad_norm": 0.64520989216114,
      "learning_rate": 2.7647721061050154e-05,
      "loss": 1.2198,
      "num_input_tokens_seen": 41533381264,
      "step": 52790
    },
    {
      "epoch": 5.600572883513686,
      "grad_norm": 1.0994417846385807,
      "learning_rate": 2.7647029999820494e-05,
      "loss": 1.2138,
      "num_input_tokens_seen": 41534167968,
      "step": 52791
    },
    {
      "epoch": 5.600678973053257,
      "grad_norm": 0.5893628065021058,
      "learning_rate": 2.7646338936545296e-05,
      "loss": 1.151,
      "num_input_tokens_seen": 41534954752,
      "step": 52792
    },
    {
      "epoch": 5.600785062592829,
      "grad_norm": 0.6713866180490796,
      "learning_rate": 2.7645647871225083e-05,
      "loss": 1.2269,
      "num_input_tokens_seen": 41535741504,
      "step": 52793
    },
    {
      "epoch": 5.6008911521324,
      "grad_norm": 0.6966616093215345,
      "learning_rate": 2.7644956803860383e-05,
      "loss": 1.175,
      "num_input_tokens_seen": 41536528256,
      "step": 52794
    },
    {
      "epoch": 5.600997241671971,
      "grad_norm": 0.6035890684386714,
      "learning_rate": 2.7644265734451745e-05,
      "loss": 1.0922,
      "num_input_tokens_seen": 41537315072,
      "step": 52795
    },
    {
      "epoch": 5.601103331211543,
      "grad_norm": 0.5893600716379344,
      "learning_rate": 2.76435746629997e-05,
      "loss": 1.0927,
      "num_input_tokens_seen": 41538101888,
      "step": 52796
    },
    {
      "epoch": 5.601209420751114,
      "grad_norm": 0.6175110159562042,
      "learning_rate": 2.764288358950477e-05,
      "loss": 1.0442,
      "num_input_tokens_seen": 41538888592,
      "step": 52797
    },
    {
      "epoch": 5.601315510290686,
      "grad_norm": 0.6839134944749158,
      "learning_rate": 2.7642192513967503e-05,
      "loss": 1.2268,
      "num_input_tokens_seen": 41539675392,
      "step": 52798
    },
    {
      "epoch": 5.601421599830257,
      "grad_norm": 0.7661313962224319,
      "learning_rate": 2.7641501436388422e-05,
      "loss": 1.1964,
      "num_input_tokens_seen": 41540462144,
      "step": 52799
    },
    {
      "epoch": 5.601527689369828,
      "grad_norm": 0.7065522345168259,
      "learning_rate": 2.764081035676807e-05,
      "loss": 1.1266,
      "num_input_tokens_seen": 41541248848,
      "step": 52800
    },
    {
      "epoch": 5.6016337789094,
      "grad_norm": 0.7520049213611509,
      "learning_rate": 2.7640119275106972e-05,
      "loss": 1.2118,
      "num_input_tokens_seen": 41542035696,
      "step": 52801
    },
    {
      "epoch": 5.601739868448971,
      "grad_norm": 0.6337593953994555,
      "learning_rate": 2.7639428191405677e-05,
      "loss": 1.1362,
      "num_input_tokens_seen": 41542822496,
      "step": 52802
    },
    {
      "epoch": 5.601845957988543,
      "grad_norm": 0.7421576366869062,
      "learning_rate": 2.7638737105664702e-05,
      "loss": 1.1585,
      "num_input_tokens_seen": 41543609232,
      "step": 52803
    },
    {
      "epoch": 5.601952047528114,
      "grad_norm": 0.7710440663840602,
      "learning_rate": 2.763804601788459e-05,
      "loss": 1.1269,
      "num_input_tokens_seen": 41544396000,
      "step": 52804
    },
    {
      "epoch": 5.602058137067685,
      "grad_norm": 0.5842683213607371,
      "learning_rate": 2.7637354928065874e-05,
      "loss": 1.0666,
      "num_input_tokens_seen": 41545182816,
      "step": 52805
    },
    {
      "epoch": 5.602164226607257,
      "grad_norm": 0.7469187863267021,
      "learning_rate": 2.7636663836209087e-05,
      "loss": 1.1471,
      "num_input_tokens_seen": 41545969600,
      "step": 52806
    },
    {
      "epoch": 5.602270316146828,
      "grad_norm": 0.7631511941769823,
      "learning_rate": 2.7635972742314763e-05,
      "loss": 1.159,
      "num_input_tokens_seen": 41546756384,
      "step": 52807
    },
    {
      "epoch": 5.6023764056864,
      "grad_norm": 0.6980298253876434,
      "learning_rate": 2.7635281646383433e-05,
      "loss": 1.1303,
      "num_input_tokens_seen": 41547543168,
      "step": 52808
    },
    {
      "epoch": 5.602482495225971,
      "grad_norm": 1.1332942482056325,
      "learning_rate": 2.763459054841564e-05,
      "loss": 1.2266,
      "num_input_tokens_seen": 41548329968,
      "step": 52809
    },
    {
      "epoch": 5.602588584765542,
      "grad_norm": 0.6292577565654757,
      "learning_rate": 2.7633899448411914e-05,
      "loss": 1.1439,
      "num_input_tokens_seen": 41549116688,
      "step": 52810
    },
    {
      "epoch": 5.602694674305114,
      "grad_norm": 0.7107750316432794,
      "learning_rate": 2.763320834637278e-05,
      "loss": 1.1854,
      "num_input_tokens_seen": 41549903424,
      "step": 52811
    },
    {
      "epoch": 5.602800763844685,
      "grad_norm": 0.8884103169962879,
      "learning_rate": 2.763251724229879e-05,
      "loss": 1.1119,
      "num_input_tokens_seen": 41550690192,
      "step": 52812
    },
    {
      "epoch": 5.6029068533842565,
      "grad_norm": 0.7187738783459918,
      "learning_rate": 2.7631826136190463e-05,
      "loss": 1.116,
      "num_input_tokens_seen": 41551477024,
      "step": 52813
    },
    {
      "epoch": 5.603012942923828,
      "grad_norm": 0.8858354094630104,
      "learning_rate": 2.7631135028048333e-05,
      "loss": 1.1669,
      "num_input_tokens_seen": 41552263744,
      "step": 52814
    },
    {
      "epoch": 5.6031190324633995,
      "grad_norm": 1.2248601310824514,
      "learning_rate": 2.7630443917872945e-05,
      "loss": 1.1932,
      "num_input_tokens_seen": 41553050448,
      "step": 52815
    },
    {
      "epoch": 5.6032251220029705,
      "grad_norm": 0.8499003118056738,
      "learning_rate": 2.7629752805664834e-05,
      "loss": 1.1702,
      "num_input_tokens_seen": 41553837312,
      "step": 52816
    },
    {
      "epoch": 5.6033312115425415,
      "grad_norm": 1.1524696899308136,
      "learning_rate": 2.7629061691424514e-05,
      "loss": 1.2236,
      "num_input_tokens_seen": 41554624064,
      "step": 52817
    },
    {
      "epoch": 5.6034373010821135,
      "grad_norm": 1.3720681426869703,
      "learning_rate": 2.7628370575152535e-05,
      "loss": 1.1746,
      "num_input_tokens_seen": 41555410784,
      "step": 52818
    },
    {
      "epoch": 5.6035433906216845,
      "grad_norm": 0.9576366847500203,
      "learning_rate": 2.762767945684944e-05,
      "loss": 1.2039,
      "num_input_tokens_seen": 41556197456,
      "step": 52819
    },
    {
      "epoch": 5.603649480161256,
      "grad_norm": 1.1477650400140538,
      "learning_rate": 2.7626988336515736e-05,
      "loss": 1.2019,
      "num_input_tokens_seen": 41556984288,
      "step": 52820
    },
    {
      "epoch": 5.603755569700827,
      "grad_norm": 1.5104687237444236,
      "learning_rate": 2.762629721415198e-05,
      "loss": 1.1495,
      "num_input_tokens_seen": 41557771040,
      "step": 52821
    },
    {
      "epoch": 5.603861659240399,
      "grad_norm": 0.9030138840272242,
      "learning_rate": 2.7625606089758697e-05,
      "loss": 1.1096,
      "num_input_tokens_seen": 41558557904,
      "step": 52822
    },
    {
      "epoch": 5.60396774877997,
      "grad_norm": 0.6935560845172751,
      "learning_rate": 2.7624914963336418e-05,
      "loss": 1.1512,
      "num_input_tokens_seen": 41559344688,
      "step": 52823
    },
    {
      "epoch": 5.604073838319541,
      "grad_norm": 1.15217528973865,
      "learning_rate": 2.7624223834885694e-05,
      "loss": 1.1894,
      "num_input_tokens_seen": 41560131456,
      "step": 52824
    },
    {
      "epoch": 5.604179927859113,
      "grad_norm": 0.8372021418865824,
      "learning_rate": 2.7623532704407034e-05,
      "loss": 1.1139,
      "num_input_tokens_seen": 41560918192,
      "step": 52825
    },
    {
      "epoch": 5.604286017398684,
      "grad_norm": 0.6120294060850693,
      "learning_rate": 2.7622841571900987e-05,
      "loss": 1.2007,
      "num_input_tokens_seen": 41561704880,
      "step": 52826
    },
    {
      "epoch": 5.604392106938256,
      "grad_norm": 0.9451910475909677,
      "learning_rate": 2.762215043736809e-05,
      "loss": 1.1248,
      "num_input_tokens_seen": 41562491632,
      "step": 52827
    },
    {
      "epoch": 5.604498196477827,
      "grad_norm": 0.8013955776499855,
      "learning_rate": 2.762145930080887e-05,
      "loss": 1.2077,
      "num_input_tokens_seen": 41563278416,
      "step": 52828
    },
    {
      "epoch": 5.604604286017398,
      "grad_norm": 0.6426381179804246,
      "learning_rate": 2.762076816222386e-05,
      "loss": 1.1622,
      "num_input_tokens_seen": 41564065184,
      "step": 52829
    },
    {
      "epoch": 5.60471037555697,
      "grad_norm": 0.839554982892468,
      "learning_rate": 2.7620077021613605e-05,
      "loss": 1.1094,
      "num_input_tokens_seen": 41564851936,
      "step": 52830
    },
    {
      "epoch": 5.604816465096541,
      "grad_norm": 1.0545623341820007,
      "learning_rate": 2.7619385878978626e-05,
      "loss": 1.2189,
      "num_input_tokens_seen": 41565638752,
      "step": 52831
    },
    {
      "epoch": 5.604922554636113,
      "grad_norm": 0.6682237379323552,
      "learning_rate": 2.7618694734319463e-05,
      "loss": 1.2464,
      "num_input_tokens_seen": 41566425472,
      "step": 52832
    },
    {
      "epoch": 5.605028644175684,
      "grad_norm": 0.9171636638885831,
      "learning_rate": 2.7618003587636653e-05,
      "loss": 1.1446,
      "num_input_tokens_seen": 41567212160,
      "step": 52833
    },
    {
      "epoch": 5.605134733715255,
      "grad_norm": 1.2792560639987403,
      "learning_rate": 2.7617312438930722e-05,
      "loss": 1.1659,
      "num_input_tokens_seen": 41567998928,
      "step": 52834
    },
    {
      "epoch": 5.605240823254827,
      "grad_norm": 0.6209611914093063,
      "learning_rate": 2.761662128820221e-05,
      "loss": 1.1654,
      "num_input_tokens_seen": 41568785712,
      "step": 52835
    },
    {
      "epoch": 5.605346912794398,
      "grad_norm": 0.7899158043937932,
      "learning_rate": 2.761593013545165e-05,
      "loss": 1.1035,
      "num_input_tokens_seen": 41569572496,
      "step": 52836
    },
    {
      "epoch": 5.60545300233397,
      "grad_norm": 1.2375531825202395,
      "learning_rate": 2.7615238980679574e-05,
      "loss": 1.194,
      "num_input_tokens_seen": 41570359264,
      "step": 52837
    },
    {
      "epoch": 5.605559091873541,
      "grad_norm": 0.7309703520146305,
      "learning_rate": 2.761454782388652e-05,
      "loss": 1.1235,
      "num_input_tokens_seen": 41571146080,
      "step": 52838
    },
    {
      "epoch": 5.605665181413112,
      "grad_norm": 0.7184810444856476,
      "learning_rate": 2.7613856665073024e-05,
      "loss": 1.0776,
      "num_input_tokens_seen": 41571932848,
      "step": 52839
    },
    {
      "epoch": 5.605771270952684,
      "grad_norm": 0.9753620284599023,
      "learning_rate": 2.7613165504239614e-05,
      "loss": 1.1648,
      "num_input_tokens_seen": 41572719648,
      "step": 52840
    },
    {
      "epoch": 5.605877360492255,
      "grad_norm": 0.6428566263903838,
      "learning_rate": 2.7612474341386823e-05,
      "loss": 1.1078,
      "num_input_tokens_seen": 41573506448,
      "step": 52841
    },
    {
      "epoch": 5.605983450031827,
      "grad_norm": 0.6551593972345507,
      "learning_rate": 2.7611783176515194e-05,
      "loss": 1.2281,
      "num_input_tokens_seen": 41574293168,
      "step": 52842
    },
    {
      "epoch": 5.606089539571398,
      "grad_norm": 0.9155301686262627,
      "learning_rate": 2.761109200962525e-05,
      "loss": 1.1469,
      "num_input_tokens_seen": 41575079984,
      "step": 52843
    },
    {
      "epoch": 5.60619562911097,
      "grad_norm": 0.9353052965231872,
      "learning_rate": 2.7610400840717533e-05,
      "loss": 1.2099,
      "num_input_tokens_seen": 41575866688,
      "step": 52844
    },
    {
      "epoch": 5.606301718650541,
      "grad_norm": 0.6371089395221882,
      "learning_rate": 2.7609709669792576e-05,
      "loss": 1.1156,
      "num_input_tokens_seen": 41576653440,
      "step": 52845
    },
    {
      "epoch": 5.606407808190112,
      "grad_norm": 1.0455630875465505,
      "learning_rate": 2.7609018496850908e-05,
      "loss": 1.2155,
      "num_input_tokens_seen": 41577440208,
      "step": 52846
    },
    {
      "epoch": 5.606513897729684,
      "grad_norm": 0.7967493101729497,
      "learning_rate": 2.7608327321893074e-05,
      "loss": 1.0283,
      "num_input_tokens_seen": 41578226928,
      "step": 52847
    },
    {
      "epoch": 5.606619987269255,
      "grad_norm": 0.7695098950594393,
      "learning_rate": 2.7607636144919597e-05,
      "loss": 1.12,
      "num_input_tokens_seen": 41579013696,
      "step": 52848
    },
    {
      "epoch": 5.606726076808827,
      "grad_norm": 1.2003683285202973,
      "learning_rate": 2.7606944965931015e-05,
      "loss": 1.2109,
      "num_input_tokens_seen": 41579800480,
      "step": 52849
    },
    {
      "epoch": 5.606832166348398,
      "grad_norm": 0.6262919244906763,
      "learning_rate": 2.7606253784927866e-05,
      "loss": 1.1383,
      "num_input_tokens_seen": 41580587280,
      "step": 52850
    },
    {
      "epoch": 5.60693825588797,
      "grad_norm": 0.7071341286629403,
      "learning_rate": 2.7605562601910674e-05,
      "loss": 1.0489,
      "num_input_tokens_seen": 41581374048,
      "step": 52851
    },
    {
      "epoch": 5.607044345427541,
      "grad_norm": 0.8949942033692372,
      "learning_rate": 2.7604871416879985e-05,
      "loss": 1.2782,
      "num_input_tokens_seen": 41582160864,
      "step": 52852
    },
    {
      "epoch": 5.607150434967112,
      "grad_norm": 0.7386156754811123,
      "learning_rate": 2.7604180229836323e-05,
      "loss": 1.2714,
      "num_input_tokens_seen": 41582947600,
      "step": 52853
    },
    {
      "epoch": 5.607256524506684,
      "grad_norm": 0.7850163311127604,
      "learning_rate": 2.760348904078023e-05,
      "loss": 1.184,
      "num_input_tokens_seen": 41583734384,
      "step": 52854
    },
    {
      "epoch": 5.607362614046255,
      "grad_norm": 0.8959122364304587,
      "learning_rate": 2.7602797849712236e-05,
      "loss": 1.1637,
      "num_input_tokens_seen": 41584521216,
      "step": 52855
    },
    {
      "epoch": 5.607468703585827,
      "grad_norm": 0.7467198381397219,
      "learning_rate": 2.760210665663288e-05,
      "loss": 1.1536,
      "num_input_tokens_seen": 41585308032,
      "step": 52856
    },
    {
      "epoch": 5.607574793125398,
      "grad_norm": 0.8100814520048251,
      "learning_rate": 2.7601415461542684e-05,
      "loss": 1.141,
      "num_input_tokens_seen": 41586094832,
      "step": 52857
    },
    {
      "epoch": 5.607680882664969,
      "grad_norm": 0.6794287519837959,
      "learning_rate": 2.7600724264442203e-05,
      "loss": 1.099,
      "num_input_tokens_seen": 41586881536,
      "step": 52858
    },
    {
      "epoch": 5.607786972204541,
      "grad_norm": 0.6921754075687147,
      "learning_rate": 2.760003306533195e-05,
      "loss": 1.1273,
      "num_input_tokens_seen": 41587668240,
      "step": 52859
    },
    {
      "epoch": 5.607893061744112,
      "grad_norm": 0.6628264493311327,
      "learning_rate": 2.7599341864212463e-05,
      "loss": 1.087,
      "num_input_tokens_seen": 41588455088,
      "step": 52860
    },
    {
      "epoch": 5.607999151283684,
      "grad_norm": 0.7816272894795112,
      "learning_rate": 2.759865066108429e-05,
      "loss": 1.1179,
      "num_input_tokens_seen": 41589241840,
      "step": 52861
    },
    {
      "epoch": 5.608105240823255,
      "grad_norm": 0.6181067811251381,
      "learning_rate": 2.759795945594796e-05,
      "loss": 1.1713,
      "num_input_tokens_seen": 41590028560,
      "step": 52862
    },
    {
      "epoch": 5.608211330362826,
      "grad_norm": 0.8808626464306427,
      "learning_rate": 2.759726824880399e-05,
      "loss": 1.0999,
      "num_input_tokens_seen": 41590815344,
      "step": 52863
    },
    {
      "epoch": 5.608317419902398,
      "grad_norm": 0.5523005634347782,
      "learning_rate": 2.7596577039652932e-05,
      "loss": 1.0582,
      "num_input_tokens_seen": 41591602096,
      "step": 52864
    },
    {
      "epoch": 5.608423509441969,
      "grad_norm": 0.714099911302119,
      "learning_rate": 2.7595885828495323e-05,
      "loss": 1.1894,
      "num_input_tokens_seen": 41592388832,
      "step": 52865
    },
    {
      "epoch": 5.608529598981541,
      "grad_norm": 0.5321747275566515,
      "learning_rate": 2.7595194615331675e-05,
      "loss": 1.0521,
      "num_input_tokens_seen": 41593175568,
      "step": 52866
    },
    {
      "epoch": 5.608635688521112,
      "grad_norm": 0.6910092743775951,
      "learning_rate": 2.7594503400162552e-05,
      "loss": 1.1125,
      "num_input_tokens_seen": 41593962352,
      "step": 52867
    },
    {
      "epoch": 5.608741778060683,
      "grad_norm": 0.5433401347902663,
      "learning_rate": 2.759381218298846e-05,
      "loss": 1.0815,
      "num_input_tokens_seen": 41594749120,
      "step": 52868
    },
    {
      "epoch": 5.608847867600255,
      "grad_norm": 0.6298984455084943,
      "learning_rate": 2.7593120963809954e-05,
      "loss": 1.2222,
      "num_input_tokens_seen": 41595535824,
      "step": 52869
    },
    {
      "epoch": 5.608953957139826,
      "grad_norm": 0.5977607959468897,
      "learning_rate": 2.759242974262756e-05,
      "loss": 1.274,
      "num_input_tokens_seen": 41596322592,
      "step": 52870
    },
    {
      "epoch": 5.609060046679398,
      "grad_norm": 0.6383423796344451,
      "learning_rate": 2.7591738519441806e-05,
      "loss": 1.2255,
      "num_input_tokens_seen": 41597109328,
      "step": 52871
    },
    {
      "epoch": 5.609166136218969,
      "grad_norm": 0.7066150563181378,
      "learning_rate": 2.759104729425324e-05,
      "loss": 1.2718,
      "num_input_tokens_seen": 41597896112,
      "step": 52872
    },
    {
      "epoch": 5.609272225758541,
      "grad_norm": 0.5830696673844563,
      "learning_rate": 2.759035606706239e-05,
      "loss": 1.1071,
      "num_input_tokens_seen": 41598682944,
      "step": 52873
    },
    {
      "epoch": 5.609378315298112,
      "grad_norm": 0.5882137321183709,
      "learning_rate": 2.758966483786978e-05,
      "loss": 1.0932,
      "num_input_tokens_seen": 41599469792,
      "step": 52874
    },
    {
      "epoch": 5.609484404837683,
      "grad_norm": 0.7683389697696575,
      "learning_rate": 2.7588973606675957e-05,
      "loss": 1.1471,
      "num_input_tokens_seen": 41600256592,
      "step": 52875
    },
    {
      "epoch": 5.6095904943772545,
      "grad_norm": 0.6324076839762691,
      "learning_rate": 2.7588282373481457e-05,
      "loss": 1.1252,
      "num_input_tokens_seen": 41601043360,
      "step": 52876
    },
    {
      "epoch": 5.609696583916826,
      "grad_norm": 0.6673775361397024,
      "learning_rate": 2.7587591138286794e-05,
      "loss": 1.1025,
      "num_input_tokens_seen": 41601830192,
      "step": 52877
    },
    {
      "epoch": 5.6098026734563975,
      "grad_norm": 0.5891310553137241,
      "learning_rate": 2.7586899901092527e-05,
      "loss": 1.0976,
      "num_input_tokens_seen": 41602617008,
      "step": 52878
    },
    {
      "epoch": 5.6099087629959685,
      "grad_norm": 0.5990137618142127,
      "learning_rate": 2.758620866189918e-05,
      "loss": 1.1043,
      "num_input_tokens_seen": 41603403664,
      "step": 52879
    },
    {
      "epoch": 5.61001485253554,
      "grad_norm": 0.9009045559855058,
      "learning_rate": 2.7585517420707284e-05,
      "loss": 1.1185,
      "num_input_tokens_seen": 41604190528,
      "step": 52880
    },
    {
      "epoch": 5.6101209420751115,
      "grad_norm": 0.6946115294339962,
      "learning_rate": 2.7584826177517382e-05,
      "loss": 1.2148,
      "num_input_tokens_seen": 41604977232,
      "step": 52881
    },
    {
      "epoch": 5.6102270316146825,
      "grad_norm": 0.6539244359173778,
      "learning_rate": 2.7584134932329997e-05,
      "loss": 1.1819,
      "num_input_tokens_seen": 41605763968,
      "step": 52882
    },
    {
      "epoch": 5.610333121154254,
      "grad_norm": 0.6490157826988362,
      "learning_rate": 2.7583443685145664e-05,
      "loss": 1.251,
      "num_input_tokens_seen": 41606550688,
      "step": 52883
    },
    {
      "epoch": 5.6104392106938255,
      "grad_norm": 0.638698769435029,
      "learning_rate": 2.7582752435964932e-05,
      "loss": 1.1429,
      "num_input_tokens_seen": 41607337424,
      "step": 52884
    },
    {
      "epoch": 5.610545300233397,
      "grad_norm": 0.5833807433847937,
      "learning_rate": 2.7582061184788323e-05,
      "loss": 1.124,
      "num_input_tokens_seen": 41608124208,
      "step": 52885
    },
    {
      "epoch": 5.610651389772968,
      "grad_norm": 0.8120286794669027,
      "learning_rate": 2.758136993161636e-05,
      "loss": 1.1282,
      "num_input_tokens_seen": 41608911008,
      "step": 52886
    },
    {
      "epoch": 5.610757479312539,
      "grad_norm": 0.5488386801806663,
      "learning_rate": 2.75806786764496e-05,
      "loss": 1.1334,
      "num_input_tokens_seen": 41609697808,
      "step": 52887
    },
    {
      "epoch": 5.610863568852111,
      "grad_norm": 0.6551887368476336,
      "learning_rate": 2.757998741928857e-05,
      "loss": 1.1548,
      "num_input_tokens_seen": 41610484576,
      "step": 52888
    },
    {
      "epoch": 5.610969658391682,
      "grad_norm": 0.6181373875077634,
      "learning_rate": 2.7579296160133796e-05,
      "loss": 1.1704,
      "num_input_tokens_seen": 41611271264,
      "step": 52889
    },
    {
      "epoch": 5.611075747931254,
      "grad_norm": 0.5605615938952991,
      "learning_rate": 2.7578604898985823e-05,
      "loss": 1.2065,
      "num_input_tokens_seen": 41612058096,
      "step": 52890
    },
    {
      "epoch": 5.611181837470825,
      "grad_norm": 0.723054947722984,
      "learning_rate": 2.7577913635845175e-05,
      "loss": 1.2376,
      "num_input_tokens_seen": 41612844832,
      "step": 52891
    },
    {
      "epoch": 5.611287927010396,
      "grad_norm": 0.5794207554435924,
      "learning_rate": 2.757722237071239e-05,
      "loss": 1.1296,
      "num_input_tokens_seen": 41613631584,
      "step": 52892
    },
    {
      "epoch": 5.611394016549968,
      "grad_norm": 0.532985893660244,
      "learning_rate": 2.7576531103588004e-05,
      "loss": 1.1882,
      "num_input_tokens_seen": 41614418288,
      "step": 52893
    },
    {
      "epoch": 5.611500106089539,
      "grad_norm": 0.6207509867383277,
      "learning_rate": 2.757583983447255e-05,
      "loss": 1.1312,
      "num_input_tokens_seen": 41615205024,
      "step": 52894
    },
    {
      "epoch": 5.611606195629111,
      "grad_norm": 0.6128089356228419,
      "learning_rate": 2.7575148563366564e-05,
      "loss": 1.1275,
      "num_input_tokens_seen": 41615991712,
      "step": 52895
    },
    {
      "epoch": 5.611712285168682,
      "grad_norm": 0.6712198723292433,
      "learning_rate": 2.7574457290270582e-05,
      "loss": 1.0783,
      "num_input_tokens_seen": 41616778464,
      "step": 52896
    },
    {
      "epoch": 5.611818374708253,
      "grad_norm": 0.5458462502057068,
      "learning_rate": 2.7573766015185133e-05,
      "loss": 1.162,
      "num_input_tokens_seen": 41617565184,
      "step": 52897
    },
    {
      "epoch": 5.611924464247825,
      "grad_norm": 0.5769907815749249,
      "learning_rate": 2.757307473811075e-05,
      "loss": 1.1977,
      "num_input_tokens_seen": 41618351936,
      "step": 52898
    },
    {
      "epoch": 5.612030553787396,
      "grad_norm": 0.5718975828775984,
      "learning_rate": 2.7572383459047975e-05,
      "loss": 1.1716,
      "num_input_tokens_seen": 41619138656,
      "step": 52899
    },
    {
      "epoch": 5.612136643326968,
      "grad_norm": 0.6441842181597838,
      "learning_rate": 2.7571692177997334e-05,
      "loss": 1.2277,
      "num_input_tokens_seen": 41619925408,
      "step": 52900
    },
    {
      "epoch": 5.612242732866539,
      "grad_norm": 0.6346347700185206,
      "learning_rate": 2.7571000894959363e-05,
      "loss": 1.2259,
      "num_input_tokens_seen": 41620712224,
      "step": 52901
    },
    {
      "epoch": 5.612348822406111,
      "grad_norm": 0.777787820269041,
      "learning_rate": 2.7570309609934602e-05,
      "loss": 1.1348,
      "num_input_tokens_seen": 41621499024,
      "step": 52902
    },
    {
      "epoch": 5.612454911945682,
      "grad_norm": 0.6148165833425552,
      "learning_rate": 2.756961832292358e-05,
      "loss": 1.109,
      "num_input_tokens_seen": 41622285776,
      "step": 52903
    },
    {
      "epoch": 5.612561001485254,
      "grad_norm": 0.7889309607411907,
      "learning_rate": 2.7568927033926834e-05,
      "loss": 1.1161,
      "num_input_tokens_seen": 41623072608,
      "step": 52904
    },
    {
      "epoch": 5.612667091024825,
      "grad_norm": 0.7439606534644586,
      "learning_rate": 2.756823574294489e-05,
      "loss": 1.1912,
      "num_input_tokens_seen": 41623859424,
      "step": 52905
    },
    {
      "epoch": 5.612773180564396,
      "grad_norm": 0.6380353571628136,
      "learning_rate": 2.7567544449978295e-05,
      "loss": 1.1919,
      "num_input_tokens_seen": 41624646160,
      "step": 52906
    },
    {
      "epoch": 5.612879270103968,
      "grad_norm": 0.7426762447127357,
      "learning_rate": 2.756685315502758e-05,
      "loss": 1.1927,
      "num_input_tokens_seen": 41625432928,
      "step": 52907
    },
    {
      "epoch": 5.612985359643539,
      "grad_norm": 0.8518112507056568,
      "learning_rate": 2.756616185809327e-05,
      "loss": 1.1547,
      "num_input_tokens_seen": 41626219792,
      "step": 52908
    },
    {
      "epoch": 5.613091449183111,
      "grad_norm": 0.6995408912650226,
      "learning_rate": 2.7565470559175905e-05,
      "loss": 1.1501,
      "num_input_tokens_seen": 41627006544,
      "step": 52909
    },
    {
      "epoch": 5.613197538722682,
      "grad_norm": 1.0776774385966994,
      "learning_rate": 2.7564779258276026e-05,
      "loss": 1.2217,
      "num_input_tokens_seen": 41627793296,
      "step": 52910
    },
    {
      "epoch": 5.613303628262253,
      "grad_norm": 0.7884174729194806,
      "learning_rate": 2.7564087955394147e-05,
      "loss": 1.1385,
      "num_input_tokens_seen": 41628580080,
      "step": 52911
    },
    {
      "epoch": 5.613409717801825,
      "grad_norm": 0.8949957735993342,
      "learning_rate": 2.756339665053083e-05,
      "loss": 1.1641,
      "num_input_tokens_seen": 41629366768,
      "step": 52912
    },
    {
      "epoch": 5.613515807341396,
      "grad_norm": 0.6663369408085916,
      "learning_rate": 2.756270534368659e-05,
      "loss": 1.1269,
      "num_input_tokens_seen": 41630153648,
      "step": 52913
    },
    {
      "epoch": 5.613621896880968,
      "grad_norm": 0.7850951706594472,
      "learning_rate": 2.7562014034861965e-05,
      "loss": 1.1196,
      "num_input_tokens_seen": 41630940368,
      "step": 52914
    },
    {
      "epoch": 5.613727986420539,
      "grad_norm": 0.652407507945072,
      "learning_rate": 2.75613227240575e-05,
      "loss": 1.1167,
      "num_input_tokens_seen": 41631727136,
      "step": 52915
    },
    {
      "epoch": 5.61383407596011,
      "grad_norm": 0.7803079887377242,
      "learning_rate": 2.7560631411273713e-05,
      "loss": 1.1345,
      "num_input_tokens_seen": 41632513936,
      "step": 52916
    },
    {
      "epoch": 5.613940165499682,
      "grad_norm": 0.6958648550719533,
      "learning_rate": 2.755994009651114e-05,
      "loss": 1.1503,
      "num_input_tokens_seen": 41633300800,
      "step": 52917
    },
    {
      "epoch": 5.614046255039253,
      "grad_norm": 0.5874733099625239,
      "learning_rate": 2.7559248779770325e-05,
      "loss": 1.1369,
      "num_input_tokens_seen": 41634087600,
      "step": 52918
    },
    {
      "epoch": 5.614152344578825,
      "grad_norm": 0.8091563925407076,
      "learning_rate": 2.7558557461051803e-05,
      "loss": 1.1327,
      "num_input_tokens_seen": 41634874320,
      "step": 52919
    },
    {
      "epoch": 5.614258434118396,
      "grad_norm": 0.7453618991180613,
      "learning_rate": 2.7557866140356093e-05,
      "loss": 1.1577,
      "num_input_tokens_seen": 41635660992,
      "step": 52920
    },
    {
      "epoch": 5.614364523657967,
      "grad_norm": 0.6023049863025742,
      "learning_rate": 2.755717481768374e-05,
      "loss": 1.2044,
      "num_input_tokens_seen": 41636447680,
      "step": 52921
    },
    {
      "epoch": 5.614470613197539,
      "grad_norm": 0.9020914796863282,
      "learning_rate": 2.7556483493035283e-05,
      "loss": 1.0991,
      "num_input_tokens_seen": 41637234464,
      "step": 52922
    },
    {
      "epoch": 5.61457670273711,
      "grad_norm": 0.7568532715657802,
      "learning_rate": 2.755579216641125e-05,
      "loss": 1.1379,
      "num_input_tokens_seen": 41638021248,
      "step": 52923
    },
    {
      "epoch": 5.614682792276682,
      "grad_norm": 0.5786970054445706,
      "learning_rate": 2.7555100837812177e-05,
      "loss": 1.098,
      "num_input_tokens_seen": 41638807936,
      "step": 52924
    },
    {
      "epoch": 5.614788881816253,
      "grad_norm": 0.9077899756815208,
      "learning_rate": 2.7554409507238592e-05,
      "loss": 1.0681,
      "num_input_tokens_seen": 41639594704,
      "step": 52925
    },
    {
      "epoch": 5.614894971355824,
      "grad_norm": 0.8346194858578946,
      "learning_rate": 2.7553718174691034e-05,
      "loss": 1.1969,
      "num_input_tokens_seen": 41640381376,
      "step": 52926
    },
    {
      "epoch": 5.615001060895396,
      "grad_norm": 0.7437091658758618,
      "learning_rate": 2.7553026840170042e-05,
      "loss": 1.116,
      "num_input_tokens_seen": 41641168208,
      "step": 52927
    },
    {
      "epoch": 5.615107150434967,
      "grad_norm": 0.8537415871150553,
      "learning_rate": 2.7552335503676148e-05,
      "loss": 1.1632,
      "num_input_tokens_seen": 41641955008,
      "step": 52928
    },
    {
      "epoch": 5.615213239974539,
      "grad_norm": 0.6647644232390219,
      "learning_rate": 2.755164416520988e-05,
      "loss": 1.2037,
      "num_input_tokens_seen": 41642741728,
      "step": 52929
    },
    {
      "epoch": 5.61531932951411,
      "grad_norm": 0.7379445059294888,
      "learning_rate": 2.7550952824771776e-05,
      "loss": 1.2393,
      "num_input_tokens_seen": 41643528416,
      "step": 52930
    },
    {
      "epoch": 5.615425419053682,
      "grad_norm": 0.7644548548247136,
      "learning_rate": 2.7550261482362373e-05,
      "loss": 1.1015,
      "num_input_tokens_seen": 41644315120,
      "step": 52931
    },
    {
      "epoch": 5.615531508593253,
      "grad_norm": 0.6090998154988043,
      "learning_rate": 2.75495701379822e-05,
      "loss": 1.139,
      "num_input_tokens_seen": 41645101920,
      "step": 52932
    },
    {
      "epoch": 5.615637598132825,
      "grad_norm": 0.7155246946567237,
      "learning_rate": 2.7548878791631795e-05,
      "loss": 1.0852,
      "num_input_tokens_seen": 41645888688,
      "step": 52933
    },
    {
      "epoch": 5.615743687672396,
      "grad_norm": 0.7156884510404263,
      "learning_rate": 2.7548187443311697e-05,
      "loss": 1.0756,
      "num_input_tokens_seen": 41646675536,
      "step": 52934
    },
    {
      "epoch": 5.615849777211967,
      "grad_norm": 0.6077303690360941,
      "learning_rate": 2.7547496093022425e-05,
      "loss": 1.1498,
      "num_input_tokens_seen": 41647462320,
      "step": 52935
    },
    {
      "epoch": 5.615955866751539,
      "grad_norm": 0.7846623233839258,
      "learning_rate": 2.7546804740764525e-05,
      "loss": 1.2596,
      "num_input_tokens_seen": 41648249024,
      "step": 52936
    },
    {
      "epoch": 5.61606195629111,
      "grad_norm": 0.5747282879717228,
      "learning_rate": 2.754611338653853e-05,
      "loss": 1.1407,
      "num_input_tokens_seen": 41649035856,
      "step": 52937
    },
    {
      "epoch": 5.6161680458306815,
      "grad_norm": 0.6375558311552887,
      "learning_rate": 2.7545422030344975e-05,
      "loss": 1.1957,
      "num_input_tokens_seen": 41649822544,
      "step": 52938
    },
    {
      "epoch": 5.6162741353702526,
      "grad_norm": 0.7089081495569015,
      "learning_rate": 2.7544730672184394e-05,
      "loss": 1.2611,
      "num_input_tokens_seen": 41650609408,
      "step": 52939
    },
    {
      "epoch": 5.616380224909824,
      "grad_norm": 0.7301203944322863,
      "learning_rate": 2.754403931205731e-05,
      "loss": 1.2369,
      "num_input_tokens_seen": 41651396304,
      "step": 52940
    },
    {
      "epoch": 5.6164863144493955,
      "grad_norm": 0.7242588045598786,
      "learning_rate": 2.7543347949964275e-05,
      "loss": 1.2623,
      "num_input_tokens_seen": 41652183008,
      "step": 52941
    },
    {
      "epoch": 5.6165924039889665,
      "grad_norm": 0.6054186754829491,
      "learning_rate": 2.7542656585905818e-05,
      "loss": 1.2282,
      "num_input_tokens_seen": 41652969792,
      "step": 52942
    },
    {
      "epoch": 5.6166984935285384,
      "grad_norm": 0.8183282636118965,
      "learning_rate": 2.7541965219882464e-05,
      "loss": 1.1614,
      "num_input_tokens_seen": 41653756576,
      "step": 52943
    },
    {
      "epoch": 5.6168045830681095,
      "grad_norm": 0.691713124513749,
      "learning_rate": 2.754127385189476e-05,
      "loss": 1.156,
      "num_input_tokens_seen": 41654543328,
      "step": 52944
    },
    {
      "epoch": 5.6169106726076805,
      "grad_norm": 0.9226383688177137,
      "learning_rate": 2.7540582481943234e-05,
      "loss": 1.143,
      "num_input_tokens_seen": 41655330112,
      "step": 52945
    },
    {
      "epoch": 5.617016762147252,
      "grad_norm": 0.7535739359600806,
      "learning_rate": 2.7539891110028417e-05,
      "loss": 1.1722,
      "num_input_tokens_seen": 41656116944,
      "step": 52946
    },
    {
      "epoch": 5.6171228516868235,
      "grad_norm": 0.7879543917853652,
      "learning_rate": 2.7539199736150845e-05,
      "loss": 1.1507,
      "num_input_tokens_seen": 41656903680,
      "step": 52947
    },
    {
      "epoch": 5.617228941226395,
      "grad_norm": 0.6783166411379369,
      "learning_rate": 2.753850836031106e-05,
      "loss": 1.1967,
      "num_input_tokens_seen": 41657690416,
      "step": 52948
    },
    {
      "epoch": 5.617335030765966,
      "grad_norm": 0.6796479344166819,
      "learning_rate": 2.7537816982509585e-05,
      "loss": 1.1954,
      "num_input_tokens_seen": 41658477200,
      "step": 52949
    },
    {
      "epoch": 5.617441120305537,
      "grad_norm": 0.6887990803773879,
      "learning_rate": 2.753712560274696e-05,
      "loss": 1.2134,
      "num_input_tokens_seen": 41659264000,
      "step": 52950
    },
    {
      "epoch": 5.617547209845109,
      "grad_norm": 0.6290515349974847,
      "learning_rate": 2.7536434221023723e-05,
      "loss": 1.1431,
      "num_input_tokens_seen": 41660050768,
      "step": 52951
    },
    {
      "epoch": 5.61765329938468,
      "grad_norm": 0.6440824506633824,
      "learning_rate": 2.7535742837340396e-05,
      "loss": 1.0878,
      "num_input_tokens_seen": 41660837568,
      "step": 52952
    },
    {
      "epoch": 5.617759388924252,
      "grad_norm": 0.6622942681153854,
      "learning_rate": 2.753505145169753e-05,
      "loss": 1.0791,
      "num_input_tokens_seen": 41661624272,
      "step": 52953
    },
    {
      "epoch": 5.617865478463823,
      "grad_norm": 0.6090177368190656,
      "learning_rate": 2.7534360064095643e-05,
      "loss": 1.2208,
      "num_input_tokens_seen": 41662410944,
      "step": 52954
    },
    {
      "epoch": 5.617971568003394,
      "grad_norm": 0.6004454430365453,
      "learning_rate": 2.753366867453528e-05,
      "loss": 1.1458,
      "num_input_tokens_seen": 41663197760,
      "step": 52955
    },
    {
      "epoch": 5.618077657542966,
      "grad_norm": 0.7041759619715016,
      "learning_rate": 2.7532977283016977e-05,
      "loss": 1.2298,
      "num_input_tokens_seen": 41663984576,
      "step": 52956
    },
    {
      "epoch": 5.618183747082537,
      "grad_norm": 0.6668540838093411,
      "learning_rate": 2.7532285889541255e-05,
      "loss": 1.2367,
      "num_input_tokens_seen": 41664771328,
      "step": 52957
    },
    {
      "epoch": 5.618289836622109,
      "grad_norm": 0.7092829368799163,
      "learning_rate": 2.7531594494108663e-05,
      "loss": 1.1212,
      "num_input_tokens_seen": 41665558048,
      "step": 52958
    },
    {
      "epoch": 5.61839592616168,
      "grad_norm": 0.5705161654729435,
      "learning_rate": 2.753090309671973e-05,
      "loss": 1.0857,
      "num_input_tokens_seen": 41666344896,
      "step": 52959
    },
    {
      "epoch": 5.618502015701252,
      "grad_norm": 0.9602735561104199,
      "learning_rate": 2.753021169737498e-05,
      "loss": 1.1995,
      "num_input_tokens_seen": 41667131664,
      "step": 52960
    },
    {
      "epoch": 5.618608105240823,
      "grad_norm": 0.5968711522717665,
      "learning_rate": 2.752952029607497e-05,
      "loss": 1.1736,
      "num_input_tokens_seen": 41667918384,
      "step": 52961
    },
    {
      "epoch": 5.618714194780395,
      "grad_norm": 0.6567598440732645,
      "learning_rate": 2.7528828892820214e-05,
      "loss": 1.1487,
      "num_input_tokens_seen": 41668705056,
      "step": 52962
    },
    {
      "epoch": 5.618820284319966,
      "grad_norm": 0.9744258020362973,
      "learning_rate": 2.752813748761125e-05,
      "loss": 1.1393,
      "num_input_tokens_seen": 41669491776,
      "step": 52963
    },
    {
      "epoch": 5.618926373859537,
      "grad_norm": 0.7124797072684362,
      "learning_rate": 2.752744608044862e-05,
      "loss": 1.2121,
      "num_input_tokens_seen": 41670278512,
      "step": 52964
    },
    {
      "epoch": 5.619032463399109,
      "grad_norm": 0.7864406826504597,
      "learning_rate": 2.7526754671332855e-05,
      "loss": 1.189,
      "num_input_tokens_seen": 41671065280,
      "step": 52965
    },
    {
      "epoch": 5.61913855293868,
      "grad_norm": 0.7068971087176413,
      "learning_rate": 2.752606326026448e-05,
      "loss": 1.2238,
      "num_input_tokens_seen": 41671852048,
      "step": 52966
    },
    {
      "epoch": 5.619244642478252,
      "grad_norm": 0.6479584828323586,
      "learning_rate": 2.7525371847244048e-05,
      "loss": 1.1072,
      "num_input_tokens_seen": 41672638848,
      "step": 52967
    },
    {
      "epoch": 5.619350732017823,
      "grad_norm": 0.6025234347403245,
      "learning_rate": 2.7524680432272077e-05,
      "loss": 1.0814,
      "num_input_tokens_seen": 41673425744,
      "step": 52968
    },
    {
      "epoch": 5.619456821557394,
      "grad_norm": 0.6451953450380954,
      "learning_rate": 2.75239890153491e-05,
      "loss": 1.1933,
      "num_input_tokens_seen": 41674212512,
      "step": 52969
    },
    {
      "epoch": 5.619562911096966,
      "grad_norm": 0.6009269186067793,
      "learning_rate": 2.7523297596475668e-05,
      "loss": 1.1387,
      "num_input_tokens_seen": 41674999280,
      "step": 52970
    },
    {
      "epoch": 5.619669000636537,
      "grad_norm": 0.5926511063177688,
      "learning_rate": 2.7522606175652305e-05,
      "loss": 1.1898,
      "num_input_tokens_seen": 41675786096,
      "step": 52971
    },
    {
      "epoch": 5.619775090176109,
      "grad_norm": 0.7058242046000472,
      "learning_rate": 2.752191475287954e-05,
      "loss": 1.1424,
      "num_input_tokens_seen": 41676572864,
      "step": 52972
    },
    {
      "epoch": 5.61988117971568,
      "grad_norm": 0.6305495759915749,
      "learning_rate": 2.7521223328157924e-05,
      "loss": 1.1722,
      "num_input_tokens_seen": 41677359648,
      "step": 52973
    },
    {
      "epoch": 5.619987269255251,
      "grad_norm": 0.8039914353301063,
      "learning_rate": 2.7520531901487977e-05,
      "loss": 1.2052,
      "num_input_tokens_seen": 41678146352,
      "step": 52974
    },
    {
      "epoch": 5.620093358794823,
      "grad_norm": 0.6509531330348147,
      "learning_rate": 2.7519840472870227e-05,
      "loss": 1.1601,
      "num_input_tokens_seen": 41678933120,
      "step": 52975
    },
    {
      "epoch": 5.620199448334394,
      "grad_norm": 0.624928522775889,
      "learning_rate": 2.751914904230523e-05,
      "loss": 1.1994,
      "num_input_tokens_seen": 41679719872,
      "step": 52976
    },
    {
      "epoch": 5.620305537873966,
      "grad_norm": 0.6061601882362468,
      "learning_rate": 2.7518457609793506e-05,
      "loss": 1.2325,
      "num_input_tokens_seen": 41680506672,
      "step": 52977
    },
    {
      "epoch": 5.620411627413537,
      "grad_norm": 0.7100499418148036,
      "learning_rate": 2.751776617533559e-05,
      "loss": 1.1783,
      "num_input_tokens_seen": 41681293440,
      "step": 52978
    },
    {
      "epoch": 5.620517716953108,
      "grad_norm": 0.6594574210202224,
      "learning_rate": 2.751707473893202e-05,
      "loss": 1.1442,
      "num_input_tokens_seen": 41682080256,
      "step": 52979
    },
    {
      "epoch": 5.62062380649268,
      "grad_norm": 0.6036268039549799,
      "learning_rate": 2.751638330058332e-05,
      "loss": 1.1634,
      "num_input_tokens_seen": 41682867056,
      "step": 52980
    },
    {
      "epoch": 5.620729896032251,
      "grad_norm": 0.6157792022203495,
      "learning_rate": 2.7515691860290043e-05,
      "loss": 1.1782,
      "num_input_tokens_seen": 41683653776,
      "step": 52981
    },
    {
      "epoch": 5.620835985571823,
      "grad_norm": 0.7168976817131548,
      "learning_rate": 2.751500041805271e-05,
      "loss": 1.2097,
      "num_input_tokens_seen": 41684440592,
      "step": 52982
    },
    {
      "epoch": 5.620942075111394,
      "grad_norm": 0.800817227942103,
      "learning_rate": 2.751430897387186e-05,
      "loss": 1.364,
      "num_input_tokens_seen": 41685227248,
      "step": 52983
    },
    {
      "epoch": 5.621048164650966,
      "grad_norm": 0.6638455654090754,
      "learning_rate": 2.7513617527748025e-05,
      "loss": 1.0714,
      "num_input_tokens_seen": 41686013936,
      "step": 52984
    },
    {
      "epoch": 5.621154254190537,
      "grad_norm": 0.6368045184570927,
      "learning_rate": 2.7512926079681738e-05,
      "loss": 1.1027,
      "num_input_tokens_seen": 41686800704,
      "step": 52985
    },
    {
      "epoch": 5.621260343730108,
      "grad_norm": 0.7346210826368532,
      "learning_rate": 2.751223462967354e-05,
      "loss": 1.1,
      "num_input_tokens_seen": 41687587424,
      "step": 52986
    },
    {
      "epoch": 5.62136643326968,
      "grad_norm": 0.6658896195656383,
      "learning_rate": 2.751154317772396e-05,
      "loss": 1.1505,
      "num_input_tokens_seen": 41688374240,
      "step": 52987
    },
    {
      "epoch": 5.621472522809251,
      "grad_norm": 0.8423660287247909,
      "learning_rate": 2.751085172383353e-05,
      "loss": 1.2705,
      "num_input_tokens_seen": 41689161040,
      "step": 52988
    },
    {
      "epoch": 5.621578612348823,
      "grad_norm": 0.7475328998692896,
      "learning_rate": 2.7510160268002783e-05,
      "loss": 1.1034,
      "num_input_tokens_seen": 41689947872,
      "step": 52989
    },
    {
      "epoch": 5.621684701888394,
      "grad_norm": 0.758975171372803,
      "learning_rate": 2.7509468810232263e-05,
      "loss": 1.1546,
      "num_input_tokens_seen": 41690734624,
      "step": 52990
    },
    {
      "epoch": 5.621790791427966,
      "grad_norm": 0.9546819925426863,
      "learning_rate": 2.7508777350522502e-05,
      "loss": 1.1767,
      "num_input_tokens_seen": 41691521376,
      "step": 52991
    },
    {
      "epoch": 5.621896880967537,
      "grad_norm": 0.5870678412442359,
      "learning_rate": 2.7508085888874024e-05,
      "loss": 1.1448,
      "num_input_tokens_seen": 41692308224,
      "step": 52992
    },
    {
      "epoch": 5.622002970507108,
      "grad_norm": 0.6297318172875015,
      "learning_rate": 2.750739442528738e-05,
      "loss": 1.2072,
      "num_input_tokens_seen": 41693094976,
      "step": 52993
    },
    {
      "epoch": 5.62210906004668,
      "grad_norm": 0.5984866664015426,
      "learning_rate": 2.7506702959763093e-05,
      "loss": 1.0985,
      "num_input_tokens_seen": 41693881728,
      "step": 52994
    },
    {
      "epoch": 5.622215149586251,
      "grad_norm": 0.5388201832678443,
      "learning_rate": 2.7506011492301692e-05,
      "loss": 1.148,
      "num_input_tokens_seen": 41694668512,
      "step": 52995
    },
    {
      "epoch": 5.622321239125823,
      "grad_norm": 0.567689354515182,
      "learning_rate": 2.7505320022903724e-05,
      "loss": 1.081,
      "num_input_tokens_seen": 41695455232,
      "step": 52996
    },
    {
      "epoch": 5.622427328665394,
      "grad_norm": 0.7134335166670748,
      "learning_rate": 2.7504628551569716e-05,
      "loss": 1.1362,
      "num_input_tokens_seen": 41696242064,
      "step": 52997
    },
    {
      "epoch": 5.622533418204965,
      "grad_norm": 0.6628986945679924,
      "learning_rate": 2.7503937078300214e-05,
      "loss": 1.1782,
      "num_input_tokens_seen": 41697028848,
      "step": 52998
    },
    {
      "epoch": 5.622639507744537,
      "grad_norm": 0.597144158639316,
      "learning_rate": 2.7503245603095733e-05,
      "loss": 1.0922,
      "num_input_tokens_seen": 41697815600,
      "step": 52999
    },
    {
      "epoch": 5.622745597284108,
      "grad_norm": 0.5410603597321733,
      "learning_rate": 2.750255412595682e-05,
      "loss": 1.1191,
      "num_input_tokens_seen": 41698602400,
      "step": 53000
    },
    {
      "epoch": 5.622745597284108,
      "eval_loss": 1.5295981168746948,
      "eval_runtime": 64.2979,
      "eval_samples_per_second": 46.658,
      "eval_steps_per_second": 0.498,
      "num_input_tokens_seen": 41698602400,
      "step": 53000
    },
    {
      "epoch": 5.6228516868236795,
      "grad_norm": 0.5890734323674882,
      "learning_rate": 2.750186264688401e-05,
      "loss": 1.1763,
      "num_input_tokens_seen": 41699389168,
      "step": 53001
    },
    {
      "epoch": 5.622957776363251,
      "grad_norm": 0.6101177530561022,
      "learning_rate": 2.7501171165877827e-05,
      "loss": 1.1106,
      "num_input_tokens_seen": 41700175968,
      "step": 53002
    },
    {
      "epoch": 5.623063865902822,
      "grad_norm": 0.6596576684406468,
      "learning_rate": 2.750047968293881e-05,
      "loss": 1.1313,
      "num_input_tokens_seen": 41700962784,
      "step": 53003
    },
    {
      "epoch": 5.6231699554423935,
      "grad_norm": 0.7230895583364813,
      "learning_rate": 2.7499788198067505e-05,
      "loss": 1.1319,
      "num_input_tokens_seen": 41701749600,
      "step": 53004
    },
    {
      "epoch": 5.6232760449819645,
      "grad_norm": 0.7768182048972312,
      "learning_rate": 2.749909671126444e-05,
      "loss": 1.1527,
      "num_input_tokens_seen": 41702536368,
      "step": 53005
    },
    {
      "epoch": 5.6233821345215365,
      "grad_norm": 0.6443203399902703,
      "learning_rate": 2.7498405222530132e-05,
      "loss": 1.214,
      "num_input_tokens_seen": 41703323056,
      "step": 53006
    },
    {
      "epoch": 5.6234882240611075,
      "grad_norm": 0.5961414655386019,
      "learning_rate": 2.7497713731865142e-05,
      "loss": 1.1488,
      "num_input_tokens_seen": 41704109824,
      "step": 53007
    },
    {
      "epoch": 5.6235943136006785,
      "grad_norm": 0.6161446611670859,
      "learning_rate": 2.7497022239269987e-05,
      "loss": 1.179,
      "num_input_tokens_seen": 41704896608,
      "step": 53008
    },
    {
      "epoch": 5.62370040314025,
      "grad_norm": 0.5937054451637409,
      "learning_rate": 2.7496330744745203e-05,
      "loss": 1.1345,
      "num_input_tokens_seen": 41705683456,
      "step": 53009
    },
    {
      "epoch": 5.6238064926798215,
      "grad_norm": 0.5684150401389276,
      "learning_rate": 2.749563924829134e-05,
      "loss": 1.2007,
      "num_input_tokens_seen": 41706470224,
      "step": 53010
    },
    {
      "epoch": 5.623912582219393,
      "grad_norm": 0.8269967026364736,
      "learning_rate": 2.7494947749908912e-05,
      "loss": 1.1929,
      "num_input_tokens_seen": 41707256928,
      "step": 53011
    },
    {
      "epoch": 5.624018671758964,
      "grad_norm": 0.6058932786409712,
      "learning_rate": 2.7494256249598456e-05,
      "loss": 1.1259,
      "num_input_tokens_seen": 41708043632,
      "step": 53012
    },
    {
      "epoch": 5.624124761298536,
      "grad_norm": 0.6876759197971994,
      "learning_rate": 2.7493564747360522e-05,
      "loss": 1.1378,
      "num_input_tokens_seen": 41708830464,
      "step": 53013
    },
    {
      "epoch": 5.624230850838107,
      "grad_norm": 0.6603821623529971,
      "learning_rate": 2.7492873243195626e-05,
      "loss": 1.1822,
      "num_input_tokens_seen": 41709617248,
      "step": 53014
    },
    {
      "epoch": 5.624336940377678,
      "grad_norm": 0.7124232559718032,
      "learning_rate": 2.7492181737104316e-05,
      "loss": 1.1815,
      "num_input_tokens_seen": 41710404032,
      "step": 53015
    },
    {
      "epoch": 5.62444302991725,
      "grad_norm": 0.6774085476978758,
      "learning_rate": 2.7491490229087113e-05,
      "loss": 1.1833,
      "num_input_tokens_seen": 41711190720,
      "step": 53016
    },
    {
      "epoch": 5.624549119456821,
      "grad_norm": 0.76139253795616,
      "learning_rate": 2.749079871914457e-05,
      "loss": 1.1855,
      "num_input_tokens_seen": 41711977456,
      "step": 53017
    },
    {
      "epoch": 5.624655208996393,
      "grad_norm": 0.7567473278213493,
      "learning_rate": 2.7490107207277204e-05,
      "loss": 1.1285,
      "num_input_tokens_seen": 41712764224,
      "step": 53018
    },
    {
      "epoch": 5.624761298535964,
      "grad_norm": 0.696811392167496,
      "learning_rate": 2.7489415693485565e-05,
      "loss": 1.0995,
      "num_input_tokens_seen": 41713551088,
      "step": 53019
    },
    {
      "epoch": 5.624867388075536,
      "grad_norm": 0.5799502851588898,
      "learning_rate": 2.748872417777017e-05,
      "loss": 1.1027,
      "num_input_tokens_seen": 41714337888,
      "step": 53020
    },
    {
      "epoch": 5.624973477615107,
      "grad_norm": 0.6680753919131257,
      "learning_rate": 2.7488032660131562e-05,
      "loss": 1.1529,
      "num_input_tokens_seen": 41715124672,
      "step": 53021
    },
    {
      "epoch": 5.625079567154678,
      "grad_norm": 0.9937778071344354,
      "learning_rate": 2.7487341140570284e-05,
      "loss": 1.1701,
      "num_input_tokens_seen": 41715911504,
      "step": 53022
    },
    {
      "epoch": 5.62518565669425,
      "grad_norm": 0.7109308471517484,
      "learning_rate": 2.7486649619086853e-05,
      "loss": 1.2074,
      "num_input_tokens_seen": 41716698288,
      "step": 53023
    },
    {
      "epoch": 5.625291746233821,
      "grad_norm": 0.9259482353012571,
      "learning_rate": 2.7485958095681813e-05,
      "loss": 1.052,
      "num_input_tokens_seen": 41717485104,
      "step": 53024
    },
    {
      "epoch": 5.625397835773393,
      "grad_norm": 0.911727423458908,
      "learning_rate": 2.7485266570355706e-05,
      "loss": 1.1105,
      "num_input_tokens_seen": 41718271888,
      "step": 53025
    },
    {
      "epoch": 5.625503925312964,
      "grad_norm": 0.791021321180294,
      "learning_rate": 2.7484575043109047e-05,
      "loss": 1.1963,
      "num_input_tokens_seen": 41719058624,
      "step": 53026
    },
    {
      "epoch": 5.625610014852535,
      "grad_norm": 0.6953718950721298,
      "learning_rate": 2.7483883513942387e-05,
      "loss": 1.0886,
      "num_input_tokens_seen": 41719845440,
      "step": 53027
    },
    {
      "epoch": 5.625716104392107,
      "grad_norm": 0.6714389563641424,
      "learning_rate": 2.7483191982856256e-05,
      "loss": 1.2244,
      "num_input_tokens_seen": 41720632096,
      "step": 53028
    },
    {
      "epoch": 5.625822193931678,
      "grad_norm": 0.7050899758151894,
      "learning_rate": 2.748250044985118e-05,
      "loss": 1.1718,
      "num_input_tokens_seen": 41721418928,
      "step": 53029
    },
    {
      "epoch": 5.62592828347125,
      "grad_norm": 0.7106096745612166,
      "learning_rate": 2.748180891492771e-05,
      "loss": 1.1129,
      "num_input_tokens_seen": 41722205632,
      "step": 53030
    },
    {
      "epoch": 5.626034373010821,
      "grad_norm": 0.7463452104449981,
      "learning_rate": 2.7481117378086363e-05,
      "loss": 1.1338,
      "num_input_tokens_seen": 41722992416,
      "step": 53031
    },
    {
      "epoch": 5.626140462550392,
      "grad_norm": 0.6886736227722746,
      "learning_rate": 2.7480425839327682e-05,
      "loss": 1.1124,
      "num_input_tokens_seen": 41723779200,
      "step": 53032
    },
    {
      "epoch": 5.626246552089964,
      "grad_norm": 0.7292484727852887,
      "learning_rate": 2.7479734298652203e-05,
      "loss": 1.1369,
      "num_input_tokens_seen": 41724565936,
      "step": 53033
    },
    {
      "epoch": 5.626352641629535,
      "grad_norm": 0.6668182651656619,
      "learning_rate": 2.7479042756060464e-05,
      "loss": 1.1499,
      "num_input_tokens_seen": 41725352720,
      "step": 53034
    },
    {
      "epoch": 5.626458731169107,
      "grad_norm": 0.6323289144838385,
      "learning_rate": 2.7478351211552984e-05,
      "loss": 1.1718,
      "num_input_tokens_seen": 41726139440,
      "step": 53035
    },
    {
      "epoch": 5.626564820708678,
      "grad_norm": 0.6243896389861254,
      "learning_rate": 2.7477659665130312e-05,
      "loss": 1.0998,
      "num_input_tokens_seen": 41726926144,
      "step": 53036
    },
    {
      "epoch": 5.626670910248249,
      "grad_norm": 0.7675248212654961,
      "learning_rate": 2.747696811679298e-05,
      "loss": 1.0999,
      "num_input_tokens_seen": 41727713008,
      "step": 53037
    },
    {
      "epoch": 5.626776999787821,
      "grad_norm": 0.8086540367727574,
      "learning_rate": 2.7476276566541508e-05,
      "loss": 1.2045,
      "num_input_tokens_seen": 41728499792,
      "step": 53038
    },
    {
      "epoch": 5.626883089327392,
      "grad_norm": 0.6400908544036773,
      "learning_rate": 2.7475585014376454e-05,
      "loss": 1.2244,
      "num_input_tokens_seen": 41729286656,
      "step": 53039
    },
    {
      "epoch": 5.626989178866964,
      "grad_norm": 0.5973597240173835,
      "learning_rate": 2.7474893460298335e-05,
      "loss": 0.9855,
      "num_input_tokens_seen": 41730073552,
      "step": 53040
    },
    {
      "epoch": 5.627095268406535,
      "grad_norm": 0.7312868089136825,
      "learning_rate": 2.7474201904307694e-05,
      "loss": 1.0948,
      "num_input_tokens_seen": 41730860320,
      "step": 53041
    },
    {
      "epoch": 5.627201357946107,
      "grad_norm": 0.803628998716051,
      "learning_rate": 2.7473510346405062e-05,
      "loss": 1.1961,
      "num_input_tokens_seen": 41731647072,
      "step": 53042
    },
    {
      "epoch": 5.627307447485678,
      "grad_norm": 0.9206625994495122,
      "learning_rate": 2.747281878659097e-05,
      "loss": 1.1887,
      "num_input_tokens_seen": 41732433888,
      "step": 53043
    },
    {
      "epoch": 5.627413537025249,
      "grad_norm": 0.9768519917556472,
      "learning_rate": 2.7472127224865958e-05,
      "loss": 1.2191,
      "num_input_tokens_seen": 41733220640,
      "step": 53044
    },
    {
      "epoch": 5.627519626564821,
      "grad_norm": 0.7955484097740305,
      "learning_rate": 2.747143566123056e-05,
      "loss": 1.1885,
      "num_input_tokens_seen": 41734007408,
      "step": 53045
    },
    {
      "epoch": 5.627625716104392,
      "grad_norm": 0.7562267089361263,
      "learning_rate": 2.747074409568531e-05,
      "loss": 1.1266,
      "num_input_tokens_seen": 41734794240,
      "step": 53046
    },
    {
      "epoch": 5.627731805643964,
      "grad_norm": 0.6606449013167512,
      "learning_rate": 2.7470052528230737e-05,
      "loss": 1.1592,
      "num_input_tokens_seen": 41735581008,
      "step": 53047
    },
    {
      "epoch": 5.627837895183535,
      "grad_norm": 0.8397045702348626,
      "learning_rate": 2.7469360958867384e-05,
      "loss": 1.1295,
      "num_input_tokens_seen": 41736367792,
      "step": 53048
    },
    {
      "epoch": 5.627943984723107,
      "grad_norm": 0.7799403522370375,
      "learning_rate": 2.746866938759578e-05,
      "loss": 1.1287,
      "num_input_tokens_seen": 41737154576,
      "step": 53049
    },
    {
      "epoch": 5.628050074262678,
      "grad_norm": 0.6363392934371711,
      "learning_rate": 2.7467977814416462e-05,
      "loss": 1.1164,
      "num_input_tokens_seen": 41737941296,
      "step": 53050
    },
    {
      "epoch": 5.628156163802249,
      "grad_norm": 0.8293854824962223,
      "learning_rate": 2.7467286239329964e-05,
      "loss": 1.1903,
      "num_input_tokens_seen": 41738728080,
      "step": 53051
    },
    {
      "epoch": 5.628262253341821,
      "grad_norm": 0.6532430253366163,
      "learning_rate": 2.7466594662336813e-05,
      "loss": 1.1502,
      "num_input_tokens_seen": 41739514944,
      "step": 53052
    },
    {
      "epoch": 5.628368342881392,
      "grad_norm": 0.7144014564901076,
      "learning_rate": 2.7465903083437555e-05,
      "loss": 1.0975,
      "num_input_tokens_seen": 41740301728,
      "step": 53053
    },
    {
      "epoch": 5.628474432420964,
      "grad_norm": 0.6938029803091617,
      "learning_rate": 2.746521150263272e-05,
      "loss": 1.045,
      "num_input_tokens_seen": 41741088432,
      "step": 53054
    },
    {
      "epoch": 5.628580521960535,
      "grad_norm": 0.7333427718890286,
      "learning_rate": 2.746451991992284e-05,
      "loss": 1.1368,
      "num_input_tokens_seen": 41741875248,
      "step": 53055
    },
    {
      "epoch": 5.628686611500106,
      "grad_norm": 0.8056562955527562,
      "learning_rate": 2.746382833530845e-05,
      "loss": 1.1681,
      "num_input_tokens_seen": 41742662048,
      "step": 53056
    },
    {
      "epoch": 5.628792701039678,
      "grad_norm": 0.7307984223035678,
      "learning_rate": 2.7463136748790085e-05,
      "loss": 1.1281,
      "num_input_tokens_seen": 41743448848,
      "step": 53057
    },
    {
      "epoch": 5.628898790579249,
      "grad_norm": 0.6066583552024104,
      "learning_rate": 2.746244516036829e-05,
      "loss": 1.1084,
      "num_input_tokens_seen": 41744235632,
      "step": 53058
    },
    {
      "epoch": 5.629004880118821,
      "grad_norm": 0.6231977685200712,
      "learning_rate": 2.746175357004358e-05,
      "loss": 1.139,
      "num_input_tokens_seen": 41745022528,
      "step": 53059
    },
    {
      "epoch": 5.629110969658392,
      "grad_norm": 1.1287903934697945,
      "learning_rate": 2.7461061977816498e-05,
      "loss": 1.1733,
      "num_input_tokens_seen": 41745809312,
      "step": 53060
    },
    {
      "epoch": 5.629217059197963,
      "grad_norm": 0.8043183720835638,
      "learning_rate": 2.746037038368759e-05,
      "loss": 1.22,
      "num_input_tokens_seen": 41746595936,
      "step": 53061
    },
    {
      "epoch": 5.629323148737535,
      "grad_norm": 0.8026101456755965,
      "learning_rate": 2.745967878765737e-05,
      "loss": 1.2123,
      "num_input_tokens_seen": 41747382720,
      "step": 53062
    },
    {
      "epoch": 5.629429238277106,
      "grad_norm": 1.1637174483315185,
      "learning_rate": 2.745898718972638e-05,
      "loss": 1.2095,
      "num_input_tokens_seen": 41748169520,
      "step": 53063
    },
    {
      "epoch": 5.6295353278166775,
      "grad_norm": 0.7459043156325635,
      "learning_rate": 2.745829558989516e-05,
      "loss": 1.2044,
      "num_input_tokens_seen": 41748956368,
      "step": 53064
    },
    {
      "epoch": 5.629641417356249,
      "grad_norm": 0.6958967115645899,
      "learning_rate": 2.745760398816425e-05,
      "loss": 1.1398,
      "num_input_tokens_seen": 41749743168,
      "step": 53065
    },
    {
      "epoch": 5.62974750689582,
      "grad_norm": 0.702348716690806,
      "learning_rate": 2.7456912384534168e-05,
      "loss": 1.1408,
      "num_input_tokens_seen": 41750529920,
      "step": 53066
    },
    {
      "epoch": 5.6298535964353915,
      "grad_norm": 1.1726776313293605,
      "learning_rate": 2.7456220779005452e-05,
      "loss": 1.1907,
      "num_input_tokens_seen": 41751316704,
      "step": 53067
    },
    {
      "epoch": 5.6299596859749625,
      "grad_norm": 1.0102293086412462,
      "learning_rate": 2.7455529171578654e-05,
      "loss": 1.1121,
      "num_input_tokens_seen": 41752103504,
      "step": 53068
    },
    {
      "epoch": 5.6300657755145345,
      "grad_norm": 0.8321564366482096,
      "learning_rate": 2.745483756225428e-05,
      "loss": 1.1639,
      "num_input_tokens_seen": 41752890336,
      "step": 53069
    },
    {
      "epoch": 5.6301718650541055,
      "grad_norm": 1.70186850056774,
      "learning_rate": 2.7454145951032888e-05,
      "loss": 1.2431,
      "num_input_tokens_seen": 41753677184,
      "step": 53070
    },
    {
      "epoch": 5.630277954593677,
      "grad_norm": 0.8830820746984196,
      "learning_rate": 2.7453454337915007e-05,
      "loss": 1.1456,
      "num_input_tokens_seen": 41754463968,
      "step": 53071
    },
    {
      "epoch": 5.6303840441332484,
      "grad_norm": 0.6860496022700757,
      "learning_rate": 2.745276272290116e-05,
      "loss": 1.0746,
      "num_input_tokens_seen": 41755250864,
      "step": 53072
    },
    {
      "epoch": 5.6304901336728195,
      "grad_norm": 1.2352107756149955,
      "learning_rate": 2.74520711059919e-05,
      "loss": 1.1395,
      "num_input_tokens_seen": 41756037616,
      "step": 53073
    },
    {
      "epoch": 5.630596223212391,
      "grad_norm": 1.1830831584121029,
      "learning_rate": 2.7451379487187746e-05,
      "loss": 1.1733,
      "num_input_tokens_seen": 41756824416,
      "step": 53074
    },
    {
      "epoch": 5.630702312751962,
      "grad_norm": 0.6435777941988607,
      "learning_rate": 2.7450687866489232e-05,
      "loss": 1.148,
      "num_input_tokens_seen": 41757611136,
      "step": 53075
    },
    {
      "epoch": 5.630808402291534,
      "grad_norm": 0.8015303067256107,
      "learning_rate": 2.744999624389691e-05,
      "loss": 1.1548,
      "num_input_tokens_seen": 41758397856,
      "step": 53076
    },
    {
      "epoch": 5.630914491831105,
      "grad_norm": 1.0433413820396653,
      "learning_rate": 2.7449304619411297e-05,
      "loss": 1.1508,
      "num_input_tokens_seen": 41759184656,
      "step": 53077
    },
    {
      "epoch": 5.631020581370677,
      "grad_norm": 0.6953062595058108,
      "learning_rate": 2.744861299303293e-05,
      "loss": 1.1434,
      "num_input_tokens_seen": 41759971456,
      "step": 53078
    },
    {
      "epoch": 5.631126670910248,
      "grad_norm": 0.6481929267627805,
      "learning_rate": 2.744792136476235e-05,
      "loss": 1.1457,
      "num_input_tokens_seen": 41760758256,
      "step": 53079
    },
    {
      "epoch": 5.631232760449819,
      "grad_norm": 0.7630335479543718,
      "learning_rate": 2.7447229734600094e-05,
      "loss": 1.1344,
      "num_input_tokens_seen": 41761545056,
      "step": 53080
    },
    {
      "epoch": 5.631338849989391,
      "grad_norm": 0.8239768198177063,
      "learning_rate": 2.744653810254668e-05,
      "loss": 1.1486,
      "num_input_tokens_seen": 41762331840,
      "step": 53081
    },
    {
      "epoch": 5.631444939528962,
      "grad_norm": 0.8510519738896889,
      "learning_rate": 2.744584646860266e-05,
      "loss": 1.1518,
      "num_input_tokens_seen": 41763118544,
      "step": 53082
    },
    {
      "epoch": 5.631551029068534,
      "grad_norm": 0.7865744419624051,
      "learning_rate": 2.7445154832768554e-05,
      "loss": 1.2055,
      "num_input_tokens_seen": 41763905248,
      "step": 53083
    },
    {
      "epoch": 5.631657118608105,
      "grad_norm": 1.2724031029414071,
      "learning_rate": 2.744446319504491e-05,
      "loss": 1.1389,
      "num_input_tokens_seen": 41764692064,
      "step": 53084
    },
    {
      "epoch": 5.631763208147676,
      "grad_norm": 0.6482780715324581,
      "learning_rate": 2.7443771555432264e-05,
      "loss": 1.1655,
      "num_input_tokens_seen": 41765478704,
      "step": 53085
    },
    {
      "epoch": 5.631869297687248,
      "grad_norm": 0.6776981653838785,
      "learning_rate": 2.744307991393113e-05,
      "loss": 1.1679,
      "num_input_tokens_seen": 41766265536,
      "step": 53086
    },
    {
      "epoch": 5.631975387226819,
      "grad_norm": 0.6803869561098096,
      "learning_rate": 2.7442388270542056e-05,
      "loss": 1.1304,
      "num_input_tokens_seen": 41767052304,
      "step": 53087
    },
    {
      "epoch": 5.632081476766391,
      "grad_norm": 0.6193858862590147,
      "learning_rate": 2.744169662526559e-05,
      "loss": 1.0352,
      "num_input_tokens_seen": 41767839184,
      "step": 53088
    },
    {
      "epoch": 5.632187566305962,
      "grad_norm": 0.6131916049156738,
      "learning_rate": 2.7441004978102237e-05,
      "loss": 1.1601,
      "num_input_tokens_seen": 41768625872,
      "step": 53089
    },
    {
      "epoch": 5.632293655845533,
      "grad_norm": 0.8028675663974185,
      "learning_rate": 2.744031332905255e-05,
      "loss": 1.1473,
      "num_input_tokens_seen": 41769412688,
      "step": 53090
    },
    {
      "epoch": 5.632399745385105,
      "grad_norm": 0.5845348636307185,
      "learning_rate": 2.7439621678117073e-05,
      "loss": 1.2062,
      "num_input_tokens_seen": 41770199536,
      "step": 53091
    },
    {
      "epoch": 5.632505834924676,
      "grad_norm": 0.8703006448577878,
      "learning_rate": 2.743893002529631e-05,
      "loss": 1.2438,
      "num_input_tokens_seen": 41770986256,
      "step": 53092
    },
    {
      "epoch": 5.632611924464248,
      "grad_norm": 0.6717000662530327,
      "learning_rate": 2.7438238370590824e-05,
      "loss": 1.13,
      "num_input_tokens_seen": 41771773072,
      "step": 53093
    },
    {
      "epoch": 5.632718014003819,
      "grad_norm": 0.7428873742177953,
      "learning_rate": 2.743754671400114e-05,
      "loss": 1.1128,
      "num_input_tokens_seen": 41772559840,
      "step": 53094
    },
    {
      "epoch": 5.63282410354339,
      "grad_norm": 0.6757775119460856,
      "learning_rate": 2.743685505552779e-05,
      "loss": 1.1958,
      "num_input_tokens_seen": 41773346640,
      "step": 53095
    },
    {
      "epoch": 5.632930193082962,
      "grad_norm": 0.5873552256385733,
      "learning_rate": 2.7436163395171304e-05,
      "loss": 1.1794,
      "num_input_tokens_seen": 41774133488,
      "step": 53096
    },
    {
      "epoch": 5.633036282622533,
      "grad_norm": 0.6891780015394348,
      "learning_rate": 2.743547173293223e-05,
      "loss": 1.2001,
      "num_input_tokens_seen": 41774920304,
      "step": 53097
    },
    {
      "epoch": 5.633142372162105,
      "grad_norm": 0.6338900851995383,
      "learning_rate": 2.743478006881109e-05,
      "loss": 1.1828,
      "num_input_tokens_seen": 41775707040,
      "step": 53098
    },
    {
      "epoch": 5.633248461701676,
      "grad_norm": 0.7034106209138467,
      "learning_rate": 2.7434088402808428e-05,
      "loss": 1.0909,
      "num_input_tokens_seen": 41776493744,
      "step": 53099
    },
    {
      "epoch": 5.633354551241248,
      "grad_norm": 0.6555930260074048,
      "learning_rate": 2.7433396734924765e-05,
      "loss": 1.0418,
      "num_input_tokens_seen": 41777280624,
      "step": 53100
    },
    {
      "epoch": 5.633460640780819,
      "grad_norm": 0.685309026177376,
      "learning_rate": 2.743270506516065e-05,
      "loss": 1.163,
      "num_input_tokens_seen": 41778067360,
      "step": 53101
    },
    {
      "epoch": 5.633566730320391,
      "grad_norm": 0.7837231222645294,
      "learning_rate": 2.7432013393516613e-05,
      "loss": 1.3308,
      "num_input_tokens_seen": 41778854064,
      "step": 53102
    },
    {
      "epoch": 5.633672819859962,
      "grad_norm": 0.7146350037449176,
      "learning_rate": 2.7431321719993188e-05,
      "loss": 1.101,
      "num_input_tokens_seen": 41779640832,
      "step": 53103
    },
    {
      "epoch": 5.633778909399533,
      "grad_norm": 0.7358933480154682,
      "learning_rate": 2.743063004459091e-05,
      "loss": 1.1809,
      "num_input_tokens_seen": 41780427632,
      "step": 53104
    },
    {
      "epoch": 5.633884998939105,
      "grad_norm": 0.8777923157328545,
      "learning_rate": 2.742993836731031e-05,
      "loss": 1.1753,
      "num_input_tokens_seen": 41781214336,
      "step": 53105
    },
    {
      "epoch": 5.633991088478676,
      "grad_norm": 0.682977761152845,
      "learning_rate": 2.7429246688151922e-05,
      "loss": 1.0937,
      "num_input_tokens_seen": 41782001216,
      "step": 53106
    },
    {
      "epoch": 5.634097178018248,
      "grad_norm": 1.0083546144396314,
      "learning_rate": 2.7428555007116287e-05,
      "loss": 1.2319,
      "num_input_tokens_seen": 41782788000,
      "step": 53107
    },
    {
      "epoch": 5.634203267557819,
      "grad_norm": 0.7350441888142555,
      "learning_rate": 2.742786332420394e-05,
      "loss": 1.179,
      "num_input_tokens_seen": 41783574784,
      "step": 53108
    },
    {
      "epoch": 5.63430935709739,
      "grad_norm": 0.8373686809373729,
      "learning_rate": 2.74271716394154e-05,
      "loss": 1.1599,
      "num_input_tokens_seen": 41784361488,
      "step": 53109
    },
    {
      "epoch": 5.634415446636962,
      "grad_norm": 0.7929640972040827,
      "learning_rate": 2.7426479952751223e-05,
      "loss": 1.1863,
      "num_input_tokens_seen": 41785148352,
      "step": 53110
    },
    {
      "epoch": 5.634521536176533,
      "grad_norm": 0.6513329377229791,
      "learning_rate": 2.7425788264211933e-05,
      "loss": 1.1723,
      "num_input_tokens_seen": 41785935200,
      "step": 53111
    },
    {
      "epoch": 5.634627625716105,
      "grad_norm": 1.076629001536999,
      "learning_rate": 2.7425096573798054e-05,
      "loss": 1.2143,
      "num_input_tokens_seen": 41786721936,
      "step": 53112
    },
    {
      "epoch": 5.634733715255676,
      "grad_norm": 0.6667638670653849,
      "learning_rate": 2.742440488151014e-05,
      "loss": 1.1866,
      "num_input_tokens_seen": 41787508752,
      "step": 53113
    },
    {
      "epoch": 5.634839804795247,
      "grad_norm": 0.8214388817064439,
      "learning_rate": 2.7423713187348714e-05,
      "loss": 1.217,
      "num_input_tokens_seen": 41788295424,
      "step": 53114
    },
    {
      "epoch": 5.634945894334819,
      "grad_norm": 0.7328289903383458,
      "learning_rate": 2.7423021491314314e-05,
      "loss": 1.1385,
      "num_input_tokens_seen": 41789082208,
      "step": 53115
    },
    {
      "epoch": 5.63505198387439,
      "grad_norm": 0.7364308219208421,
      "learning_rate": 2.742232979340748e-05,
      "loss": 1.1462,
      "num_input_tokens_seen": 41789869040,
      "step": 53116
    },
    {
      "epoch": 5.635158073413962,
      "grad_norm": 0.5668723864738935,
      "learning_rate": 2.7421638093628737e-05,
      "loss": 1.225,
      "num_input_tokens_seen": 41790655696,
      "step": 53117
    },
    {
      "epoch": 5.635264162953533,
      "grad_norm": 0.5691738083333685,
      "learning_rate": 2.7420946391978624e-05,
      "loss": 1.1528,
      "num_input_tokens_seen": 41791442400,
      "step": 53118
    },
    {
      "epoch": 5.635370252493104,
      "grad_norm": 0.6241177881905726,
      "learning_rate": 2.7420254688457676e-05,
      "loss": 1.0555,
      "num_input_tokens_seen": 41792229152,
      "step": 53119
    },
    {
      "epoch": 5.635476342032676,
      "grad_norm": 0.5641278740265451,
      "learning_rate": 2.7419562983066422e-05,
      "loss": 1.1572,
      "num_input_tokens_seen": 41793015888,
      "step": 53120
    },
    {
      "epoch": 5.635582431572247,
      "grad_norm": 0.5687568037028474,
      "learning_rate": 2.7418871275805403e-05,
      "loss": 1.1538,
      "num_input_tokens_seen": 41793802656,
      "step": 53121
    },
    {
      "epoch": 5.635688521111819,
      "grad_norm": 0.6672256287841023,
      "learning_rate": 2.7418179566675152e-05,
      "loss": 1.2366,
      "num_input_tokens_seen": 41794589376,
      "step": 53122
    },
    {
      "epoch": 5.63579461065139,
      "grad_norm": 0.6466355712742172,
      "learning_rate": 2.7417487855676204e-05,
      "loss": 1.1993,
      "num_input_tokens_seen": 41795376144,
      "step": 53123
    },
    {
      "epoch": 5.635900700190961,
      "grad_norm": 0.6492490161588028,
      "learning_rate": 2.7416796142809088e-05,
      "loss": 1.2444,
      "num_input_tokens_seen": 41796162928,
      "step": 53124
    },
    {
      "epoch": 5.636006789730533,
      "grad_norm": 0.670532214149916,
      "learning_rate": 2.7416104428074345e-05,
      "loss": 1.2445,
      "num_input_tokens_seen": 41796949728,
      "step": 53125
    },
    {
      "epoch": 5.636112879270104,
      "grad_norm": 0.6000945960806219,
      "learning_rate": 2.7415412711472505e-05,
      "loss": 1.1598,
      "num_input_tokens_seen": 41797736496,
      "step": 53126
    },
    {
      "epoch": 5.6362189688096755,
      "grad_norm": 0.7630206852371129,
      "learning_rate": 2.7414720993004105e-05,
      "loss": 1.239,
      "num_input_tokens_seen": 41798523280,
      "step": 53127
    },
    {
      "epoch": 5.636325058349247,
      "grad_norm": 0.6129486935703075,
      "learning_rate": 2.7414029272669682e-05,
      "loss": 1.2493,
      "num_input_tokens_seen": 41799310064,
      "step": 53128
    },
    {
      "epoch": 5.6364311478888185,
      "grad_norm": 0.7559544401851394,
      "learning_rate": 2.741333755046977e-05,
      "loss": 1.2498,
      "num_input_tokens_seen": 41800096848,
      "step": 53129
    },
    {
      "epoch": 5.6365372374283895,
      "grad_norm": 0.7106863735309203,
      "learning_rate": 2.74126458264049e-05,
      "loss": 1.2124,
      "num_input_tokens_seen": 41800883552,
      "step": 53130
    },
    {
      "epoch": 5.636643326967961,
      "grad_norm": 0.5578101207130888,
      "learning_rate": 2.7411954100475606e-05,
      "loss": 1.133,
      "num_input_tokens_seen": 41801670416,
      "step": 53131
    },
    {
      "epoch": 5.6367494165075325,
      "grad_norm": 0.5513672085370486,
      "learning_rate": 2.7411262372682424e-05,
      "loss": 1.0903,
      "num_input_tokens_seen": 41802457264,
      "step": 53132
    },
    {
      "epoch": 5.6368555060471035,
      "grad_norm": 0.7167763774188003,
      "learning_rate": 2.7410570643025895e-05,
      "loss": 1.1265,
      "num_input_tokens_seen": 41803244112,
      "step": 53133
    },
    {
      "epoch": 5.636961595586675,
      "grad_norm": 0.6321122876550113,
      "learning_rate": 2.7409878911506544e-05,
      "loss": 1.1761,
      "num_input_tokens_seen": 41804030864,
      "step": 53134
    },
    {
      "epoch": 5.6370676851262465,
      "grad_norm": 0.6451619941536438,
      "learning_rate": 2.7409187178124906e-05,
      "loss": 1.2073,
      "num_input_tokens_seen": 41804817696,
      "step": 53135
    },
    {
      "epoch": 5.637173774665818,
      "grad_norm": 0.6996361930214783,
      "learning_rate": 2.7408495442881527e-05,
      "loss": 1.1495,
      "num_input_tokens_seen": 41805604464,
      "step": 53136
    },
    {
      "epoch": 5.637279864205389,
      "grad_norm": 0.7733892861233348,
      "learning_rate": 2.740780370577693e-05,
      "loss": 1.2302,
      "num_input_tokens_seen": 41806391232,
      "step": 53137
    },
    {
      "epoch": 5.63738595374496,
      "grad_norm": 0.7906812221510339,
      "learning_rate": 2.7407111966811643e-05,
      "loss": 1.1435,
      "num_input_tokens_seen": 41807177968,
      "step": 53138
    },
    {
      "epoch": 5.637492043284532,
      "grad_norm": 0.6745238048773986,
      "learning_rate": 2.7406420225986222e-05,
      "loss": 1.1308,
      "num_input_tokens_seen": 41807964768,
      "step": 53139
    },
    {
      "epoch": 5.637598132824103,
      "grad_norm": 0.7260450113737152,
      "learning_rate": 2.740572848330119e-05,
      "loss": 1.2758,
      "num_input_tokens_seen": 41808751488,
      "step": 53140
    },
    {
      "epoch": 5.637704222363675,
      "grad_norm": 0.6175935059631434,
      "learning_rate": 2.7405036738757072e-05,
      "loss": 1.1558,
      "num_input_tokens_seen": 41809538272,
      "step": 53141
    },
    {
      "epoch": 5.637810311903246,
      "grad_norm": 0.6848107523548299,
      "learning_rate": 2.7404344992354424e-05,
      "loss": 1.2238,
      "num_input_tokens_seen": 41810325008,
      "step": 53142
    },
    {
      "epoch": 5.637916401442817,
      "grad_norm": 0.6191205322212049,
      "learning_rate": 2.740365324409376e-05,
      "loss": 1.1574,
      "num_input_tokens_seen": 41811111600,
      "step": 53143
    },
    {
      "epoch": 5.638022490982389,
      "grad_norm": 0.5979467888782851,
      "learning_rate": 2.740296149397563e-05,
      "loss": 1.1544,
      "num_input_tokens_seen": 41811898336,
      "step": 53144
    },
    {
      "epoch": 5.63812858052196,
      "grad_norm": 0.6727449859288572,
      "learning_rate": 2.740226974200056e-05,
      "loss": 1.1541,
      "num_input_tokens_seen": 41812685136,
      "step": 53145
    },
    {
      "epoch": 5.638234670061532,
      "grad_norm": 0.8763075383225777,
      "learning_rate": 2.740157798816908e-05,
      "loss": 1.2314,
      "num_input_tokens_seen": 41813472000,
      "step": 53146
    },
    {
      "epoch": 5.638340759601103,
      "grad_norm": 0.6767460711162496,
      "learning_rate": 2.7400886232481737e-05,
      "loss": 1.1406,
      "num_input_tokens_seen": 41814258736,
      "step": 53147
    },
    {
      "epoch": 5.638446849140674,
      "grad_norm": 0.5681506017817974,
      "learning_rate": 2.740019447493906e-05,
      "loss": 1.0767,
      "num_input_tokens_seen": 41815045520,
      "step": 53148
    },
    {
      "epoch": 5.638552938680246,
      "grad_norm": 0.618915558244707,
      "learning_rate": 2.739950271554158e-05,
      "loss": 1.2278,
      "num_input_tokens_seen": 41815832320,
      "step": 53149
    },
    {
      "epoch": 5.638659028219817,
      "grad_norm": 0.6561147348761261,
      "learning_rate": 2.739881095428984e-05,
      "loss": 1.2082,
      "num_input_tokens_seen": 41816618976,
      "step": 53150
    },
    {
      "epoch": 5.638765117759389,
      "grad_norm": 0.6642715487404355,
      "learning_rate": 2.739811919118437e-05,
      "loss": 1.1798,
      "num_input_tokens_seen": 41817405632,
      "step": 53151
    },
    {
      "epoch": 5.63887120729896,
      "grad_norm": 0.6104021213705381,
      "learning_rate": 2.7397427426225692e-05,
      "loss": 1.1492,
      "num_input_tokens_seen": 41818192416,
      "step": 53152
    },
    {
      "epoch": 5.638977296838532,
      "grad_norm": 0.709399268659958,
      "learning_rate": 2.7396735659414364e-05,
      "loss": 1.1504,
      "num_input_tokens_seen": 41818979072,
      "step": 53153
    },
    {
      "epoch": 5.639083386378103,
      "grad_norm": 0.7210946879968576,
      "learning_rate": 2.7396043890750904e-05,
      "loss": 1.1806,
      "num_input_tokens_seen": 41819765872,
      "step": 53154
    },
    {
      "epoch": 5.639189475917674,
      "grad_norm": 0.6181674369560787,
      "learning_rate": 2.739535212023585e-05,
      "loss": 1.1247,
      "num_input_tokens_seen": 41820552592,
      "step": 53155
    },
    {
      "epoch": 5.639295565457246,
      "grad_norm": 0.8216155084866406,
      "learning_rate": 2.7394660347869744e-05,
      "loss": 1.2118,
      "num_input_tokens_seen": 41821339360,
      "step": 53156
    },
    {
      "epoch": 5.639401654996817,
      "grad_norm": 0.7816101766960434,
      "learning_rate": 2.7393968573653112e-05,
      "loss": 1.2218,
      "num_input_tokens_seen": 41822126192,
      "step": 53157
    },
    {
      "epoch": 5.639507744536389,
      "grad_norm": 0.8456202103685124,
      "learning_rate": 2.7393276797586486e-05,
      "loss": 1.2288,
      "num_input_tokens_seen": 41822912880,
      "step": 53158
    },
    {
      "epoch": 5.63961383407596,
      "grad_norm": 0.7681152440411823,
      "learning_rate": 2.7392585019670407e-05,
      "loss": 1.1838,
      "num_input_tokens_seen": 41823699648,
      "step": 53159
    },
    {
      "epoch": 5.639719923615532,
      "grad_norm": 0.7158539287896571,
      "learning_rate": 2.7391893239905418e-05,
      "loss": 1.276,
      "num_input_tokens_seen": 41824486416,
      "step": 53160
    },
    {
      "epoch": 5.639826013155103,
      "grad_norm": 0.6905542779847527,
      "learning_rate": 2.7391201458292037e-05,
      "loss": 1.1401,
      "num_input_tokens_seen": 41825273168,
      "step": 53161
    },
    {
      "epoch": 5.639932102694674,
      "grad_norm": 0.8056894349703558,
      "learning_rate": 2.7390509674830806e-05,
      "loss": 1.1268,
      "num_input_tokens_seen": 41826059936,
      "step": 53162
    },
    {
      "epoch": 5.640038192234246,
      "grad_norm": 0.7344183889372807,
      "learning_rate": 2.738981788952226e-05,
      "loss": 1.1395,
      "num_input_tokens_seen": 41826846624,
      "step": 53163
    },
    {
      "epoch": 5.640144281773817,
      "grad_norm": 0.7114739137991488,
      "learning_rate": 2.738912610236693e-05,
      "loss": 1.1125,
      "num_input_tokens_seen": 41827633424,
      "step": 53164
    },
    {
      "epoch": 5.640250371313389,
      "grad_norm": 0.6679014088465999,
      "learning_rate": 2.7388434313365365e-05,
      "loss": 1.1804,
      "num_input_tokens_seen": 41828420208,
      "step": 53165
    },
    {
      "epoch": 5.64035646085296,
      "grad_norm": 0.6677006870359927,
      "learning_rate": 2.7387742522518078e-05,
      "loss": 1.1817,
      "num_input_tokens_seen": 41829206992,
      "step": 53166
    },
    {
      "epoch": 5.640462550392531,
      "grad_norm": 0.6833381995986328,
      "learning_rate": 2.7387050729825614e-05,
      "loss": 1.1411,
      "num_input_tokens_seen": 41829993792,
      "step": 53167
    },
    {
      "epoch": 5.640568639932103,
      "grad_norm": 0.6138091242485141,
      "learning_rate": 2.738635893528851e-05,
      "loss": 1.1302,
      "num_input_tokens_seen": 41830780608,
      "step": 53168
    },
    {
      "epoch": 5.640674729471674,
      "grad_norm": 0.6514682429829862,
      "learning_rate": 2.738566713890729e-05,
      "loss": 1.2339,
      "num_input_tokens_seen": 41831567344,
      "step": 53169
    },
    {
      "epoch": 5.640780819011246,
      "grad_norm": 0.765395575979455,
      "learning_rate": 2.7384975340682507e-05,
      "loss": 1.2049,
      "num_input_tokens_seen": 41832354192,
      "step": 53170
    },
    {
      "epoch": 5.640886908550817,
      "grad_norm": 0.7468192273934138,
      "learning_rate": 2.738428354061468e-05,
      "loss": 1.1938,
      "num_input_tokens_seen": 41833140944,
      "step": 53171
    },
    {
      "epoch": 5.640992998090388,
      "grad_norm": 0.7085468163364684,
      "learning_rate": 2.7383591738704344e-05,
      "loss": 1.1964,
      "num_input_tokens_seen": 41833927728,
      "step": 53172
    },
    {
      "epoch": 5.64109908762996,
      "grad_norm": 0.8018889165675247,
      "learning_rate": 2.738289993495205e-05,
      "loss": 1.164,
      "num_input_tokens_seen": 41834714464,
      "step": 53173
    },
    {
      "epoch": 5.641205177169531,
      "grad_norm": 0.6386548292509515,
      "learning_rate": 2.7382208129358318e-05,
      "loss": 1.165,
      "num_input_tokens_seen": 41835501200,
      "step": 53174
    },
    {
      "epoch": 5.641311266709103,
      "grad_norm": 0.8138131577417308,
      "learning_rate": 2.7381516321923676e-05,
      "loss": 1.1568,
      "num_input_tokens_seen": 41836288032,
      "step": 53175
    },
    {
      "epoch": 5.641417356248674,
      "grad_norm": 0.5610157304894304,
      "learning_rate": 2.738082451264868e-05,
      "loss": 1.163,
      "num_input_tokens_seen": 41837074912,
      "step": 53176
    },
    {
      "epoch": 5.641523445788245,
      "grad_norm": 0.8564468839334031,
      "learning_rate": 2.7380132701533846e-05,
      "loss": 1.1825,
      "num_input_tokens_seen": 41837861744,
      "step": 53177
    },
    {
      "epoch": 5.641629535327817,
      "grad_norm": 0.651279043946338,
      "learning_rate": 2.737944088857971e-05,
      "loss": 1.1063,
      "num_input_tokens_seen": 41838648528,
      "step": 53178
    },
    {
      "epoch": 5.641735624867388,
      "grad_norm": 0.6739509166440758,
      "learning_rate": 2.737874907378682e-05,
      "loss": 1.265,
      "num_input_tokens_seen": 41839435232,
      "step": 53179
    },
    {
      "epoch": 5.64184171440696,
      "grad_norm": 0.68437462856858,
      "learning_rate": 2.7378057257155703e-05,
      "loss": 1.0968,
      "num_input_tokens_seen": 41840222064,
      "step": 53180
    },
    {
      "epoch": 5.641947803946531,
      "grad_norm": 0.646799693758175,
      "learning_rate": 2.7377365438686885e-05,
      "loss": 1.1423,
      "num_input_tokens_seen": 41841008784,
      "step": 53181
    },
    {
      "epoch": 5.642053893486103,
      "grad_norm": 0.5541645330994074,
      "learning_rate": 2.737667361838092e-05,
      "loss": 1.2142,
      "num_input_tokens_seen": 41841795488,
      "step": 53182
    },
    {
      "epoch": 5.642159983025674,
      "grad_norm": 0.594371927997316,
      "learning_rate": 2.7375981796238324e-05,
      "loss": 1.166,
      "num_input_tokens_seen": 41842582208,
      "step": 53183
    },
    {
      "epoch": 5.642266072565245,
      "grad_norm": 0.8341940264361696,
      "learning_rate": 2.737528997225964e-05,
      "loss": 1.132,
      "num_input_tokens_seen": 41843369088,
      "step": 53184
    },
    {
      "epoch": 5.642372162104817,
      "grad_norm": 0.6990211184539565,
      "learning_rate": 2.73745981464454e-05,
      "loss": 1.2092,
      "num_input_tokens_seen": 41844155824,
      "step": 53185
    },
    {
      "epoch": 5.642478251644388,
      "grad_norm": 0.6419346385394051,
      "learning_rate": 2.7373906318796146e-05,
      "loss": 1.1788,
      "num_input_tokens_seen": 41844942544,
      "step": 53186
    },
    {
      "epoch": 5.64258434118396,
      "grad_norm": 0.9365223435972422,
      "learning_rate": 2.7373214489312403e-05,
      "loss": 1.136,
      "num_input_tokens_seen": 41845729424,
      "step": 53187
    },
    {
      "epoch": 5.642690430723531,
      "grad_norm": 0.757625909899386,
      "learning_rate": 2.737252265799471e-05,
      "loss": 1.1782,
      "num_input_tokens_seen": 41846516208,
      "step": 53188
    },
    {
      "epoch": 5.6427965202631025,
      "grad_norm": 0.7342558599260524,
      "learning_rate": 2.7371830824843598e-05,
      "loss": 1.2334,
      "num_input_tokens_seen": 41847302960,
      "step": 53189
    },
    {
      "epoch": 5.6429026098026736,
      "grad_norm": 1.144522484940834,
      "learning_rate": 2.7371138989859613e-05,
      "loss": 1.1393,
      "num_input_tokens_seen": 41848089696,
      "step": 53190
    },
    {
      "epoch": 5.643008699342245,
      "grad_norm": 0.6774593536407687,
      "learning_rate": 2.7370447153043278e-05,
      "loss": 1.149,
      "num_input_tokens_seen": 41848876496,
      "step": 53191
    },
    {
      "epoch": 5.6431147888818165,
      "grad_norm": 0.5982596144421446,
      "learning_rate": 2.7369755314395123e-05,
      "loss": 1.1534,
      "num_input_tokens_seen": 41849663200,
      "step": 53192
    },
    {
      "epoch": 5.6432208784213875,
      "grad_norm": 0.7176209658361392,
      "learning_rate": 2.7369063473915697e-05,
      "loss": 1.1425,
      "num_input_tokens_seen": 41850449920,
      "step": 53193
    },
    {
      "epoch": 5.6433269679609595,
      "grad_norm": 1.1469573019150807,
      "learning_rate": 2.7368371631605534e-05,
      "loss": 1.1918,
      "num_input_tokens_seen": 41851236704,
      "step": 53194
    },
    {
      "epoch": 5.6434330575005305,
      "grad_norm": 0.5712625841175383,
      "learning_rate": 2.736767978746515e-05,
      "loss": 1.1105,
      "num_input_tokens_seen": 41852023568,
      "step": 53195
    },
    {
      "epoch": 5.6435391470401015,
      "grad_norm": 0.7516746517218194,
      "learning_rate": 2.7366987941495104e-05,
      "loss": 1.111,
      "num_input_tokens_seen": 41852810384,
      "step": 53196
    },
    {
      "epoch": 5.643645236579673,
      "grad_norm": 0.8120565732020705,
      "learning_rate": 2.7366296093695913e-05,
      "loss": 1.24,
      "num_input_tokens_seen": 41853597120,
      "step": 53197
    },
    {
      "epoch": 5.6437513261192445,
      "grad_norm": 0.6940364569948753,
      "learning_rate": 2.7365604244068117e-05,
      "loss": 1.1317,
      "num_input_tokens_seen": 41854383920,
      "step": 53198
    },
    {
      "epoch": 5.643857415658816,
      "grad_norm": 0.872965836200815,
      "learning_rate": 2.736491239261226e-05,
      "loss": 1.1173,
      "num_input_tokens_seen": 41855170752,
      "step": 53199
    },
    {
      "epoch": 5.643963505198387,
      "grad_norm": 0.8117243980921409,
      "learning_rate": 2.7364220539328862e-05,
      "loss": 1.1079,
      "num_input_tokens_seen": 41855957584,
      "step": 53200
    },
    {
      "epoch": 5.644069594737958,
      "grad_norm": 0.582396349381725,
      "learning_rate": 2.736352868421846e-05,
      "loss": 1.1149,
      "num_input_tokens_seen": 41856744448,
      "step": 53201
    },
    {
      "epoch": 5.64417568427753,
      "grad_norm": 0.8375482538185238,
      "learning_rate": 2.7362836827281596e-05,
      "loss": 1.1476,
      "num_input_tokens_seen": 41857531184,
      "step": 53202
    },
    {
      "epoch": 5.644281773817101,
      "grad_norm": 0.751813957130535,
      "learning_rate": 2.73621449685188e-05,
      "loss": 1.1074,
      "num_input_tokens_seen": 41858317968,
      "step": 53203
    },
    {
      "epoch": 5.644387863356673,
      "grad_norm": 0.5898719118702416,
      "learning_rate": 2.7361453107930605e-05,
      "loss": 1.1308,
      "num_input_tokens_seen": 41859104768,
      "step": 53204
    },
    {
      "epoch": 5.644493952896244,
      "grad_norm": 0.9254931509275027,
      "learning_rate": 2.736076124551756e-05,
      "loss": 1.1279,
      "num_input_tokens_seen": 41859891552,
      "step": 53205
    },
    {
      "epoch": 5.644600042435815,
      "grad_norm": 0.7035371170582537,
      "learning_rate": 2.7360069381280173e-05,
      "loss": 1.2428,
      "num_input_tokens_seen": 41860678224,
      "step": 53206
    },
    {
      "epoch": 5.644706131975387,
      "grad_norm": 0.575597681274531,
      "learning_rate": 2.7359377515219e-05,
      "loss": 1.1176,
      "num_input_tokens_seen": 41861464944,
      "step": 53207
    },
    {
      "epoch": 5.644812221514958,
      "grad_norm": 0.6440348015627491,
      "learning_rate": 2.735868564733457e-05,
      "loss": 1.2148,
      "num_input_tokens_seen": 41862251776,
      "step": 53208
    },
    {
      "epoch": 5.64491831105453,
      "grad_norm": 0.6949027739609203,
      "learning_rate": 2.7357993777627415e-05,
      "loss": 1.2067,
      "num_input_tokens_seen": 41863038576,
      "step": 53209
    },
    {
      "epoch": 5.645024400594101,
      "grad_norm": 0.6468019904162836,
      "learning_rate": 2.7357301906098072e-05,
      "loss": 1.1123,
      "num_input_tokens_seen": 41863825360,
      "step": 53210
    },
    {
      "epoch": 5.645130490133673,
      "grad_norm": 0.5920917939696373,
      "learning_rate": 2.7356610032747082e-05,
      "loss": 1.114,
      "num_input_tokens_seen": 41864612144,
      "step": 53211
    },
    {
      "epoch": 5.645236579673244,
      "grad_norm": 0.7743806008902839,
      "learning_rate": 2.7355918157574968e-05,
      "loss": 1.2172,
      "num_input_tokens_seen": 41865398896,
      "step": 53212
    },
    {
      "epoch": 5.645342669212815,
      "grad_norm": 0.5802477893328352,
      "learning_rate": 2.7355226280582262e-05,
      "loss": 1.0652,
      "num_input_tokens_seen": 41866185696,
      "step": 53213
    },
    {
      "epoch": 5.645448758752387,
      "grad_norm": 0.7263042276750439,
      "learning_rate": 2.7354534401769516e-05,
      "loss": 1.1332,
      "num_input_tokens_seen": 41866972416,
      "step": 53214
    },
    {
      "epoch": 5.645554848291958,
      "grad_norm": 0.5682144779117613,
      "learning_rate": 2.735384252113725e-05,
      "loss": 1.2297,
      "num_input_tokens_seen": 41867759216,
      "step": 53215
    },
    {
      "epoch": 5.64566093783153,
      "grad_norm": 0.7645950771205372,
      "learning_rate": 2.7353150638686008e-05,
      "loss": 1.2341,
      "num_input_tokens_seen": 41868545984,
      "step": 53216
    },
    {
      "epoch": 5.645767027371101,
      "grad_norm": 0.6676433247404877,
      "learning_rate": 2.7352458754416323e-05,
      "loss": 1.1579,
      "num_input_tokens_seen": 41869332800,
      "step": 53217
    },
    {
      "epoch": 5.645873116910673,
      "grad_norm": 0.6442399324381725,
      "learning_rate": 2.7351766868328716e-05,
      "loss": 1.1344,
      "num_input_tokens_seen": 41870119552,
      "step": 53218
    },
    {
      "epoch": 5.645979206450244,
      "grad_norm": 0.6687764049000274,
      "learning_rate": 2.7351074980423742e-05,
      "loss": 1.0973,
      "num_input_tokens_seen": 41870906240,
      "step": 53219
    },
    {
      "epoch": 5.646085295989815,
      "grad_norm": 0.7091265130185699,
      "learning_rate": 2.7350383090701926e-05,
      "loss": 1.1388,
      "num_input_tokens_seen": 41871693056,
      "step": 53220
    },
    {
      "epoch": 5.646191385529387,
      "grad_norm": 0.6790413820541195,
      "learning_rate": 2.7349691199163798e-05,
      "loss": 1.1715,
      "num_input_tokens_seen": 41872479776,
      "step": 53221
    },
    {
      "epoch": 5.646297475068958,
      "grad_norm": 0.6777659187443221,
      "learning_rate": 2.7348999305809898e-05,
      "loss": 1.1227,
      "num_input_tokens_seen": 41873266576,
      "step": 53222
    },
    {
      "epoch": 5.64640356460853,
      "grad_norm": 0.6538431486481684,
      "learning_rate": 2.7348307410640763e-05,
      "loss": 1.1841,
      "num_input_tokens_seen": 41874053408,
      "step": 53223
    },
    {
      "epoch": 5.646509654148101,
      "grad_norm": 0.8075240398305007,
      "learning_rate": 2.734761551365692e-05,
      "loss": 1.1311,
      "num_input_tokens_seen": 41874840208,
      "step": 53224
    },
    {
      "epoch": 5.646615743687672,
      "grad_norm": 0.6694609515303375,
      "learning_rate": 2.7346923614858916e-05,
      "loss": 1.2784,
      "num_input_tokens_seen": 41875626992,
      "step": 53225
    },
    {
      "epoch": 5.646721833227244,
      "grad_norm": 0.7204741550958264,
      "learning_rate": 2.7346231714247272e-05,
      "loss": 1.1772,
      "num_input_tokens_seen": 41876413696,
      "step": 53226
    },
    {
      "epoch": 5.646827922766815,
      "grad_norm": 0.6281639812960916,
      "learning_rate": 2.734553981182253e-05,
      "loss": 1.1801,
      "num_input_tokens_seen": 41877200368,
      "step": 53227
    },
    {
      "epoch": 5.646934012306387,
      "grad_norm": 0.7310123935378792,
      "learning_rate": 2.734484790758523e-05,
      "loss": 1.269,
      "num_input_tokens_seen": 41877987152,
      "step": 53228
    },
    {
      "epoch": 5.647040101845958,
      "grad_norm": 1.0268831992254386,
      "learning_rate": 2.7344156001535892e-05,
      "loss": 1.1275,
      "num_input_tokens_seen": 41878773904,
      "step": 53229
    },
    {
      "epoch": 5.647146191385529,
      "grad_norm": 0.8386236820177674,
      "learning_rate": 2.7343464093675062e-05,
      "loss": 1.1684,
      "num_input_tokens_seen": 41879560672,
      "step": 53230
    },
    {
      "epoch": 5.647252280925101,
      "grad_norm": 0.7610444075744743,
      "learning_rate": 2.7342772184003273e-05,
      "loss": 1.1366,
      "num_input_tokens_seen": 41880347488,
      "step": 53231
    },
    {
      "epoch": 5.647358370464672,
      "grad_norm": 1.3607557588731036,
      "learning_rate": 2.7342080272521052e-05,
      "loss": 1.101,
      "num_input_tokens_seen": 41881134320,
      "step": 53232
    },
    {
      "epoch": 5.647464460004244,
      "grad_norm": 0.7743753632990911,
      "learning_rate": 2.7341388359228952e-05,
      "loss": 1.1914,
      "num_input_tokens_seen": 41881921136,
      "step": 53233
    },
    {
      "epoch": 5.647570549543815,
      "grad_norm": 0.8241672777217998,
      "learning_rate": 2.734069644412749e-05,
      "loss": 1.1841,
      "num_input_tokens_seen": 41882707920,
      "step": 53234
    },
    {
      "epoch": 5.647676639083386,
      "grad_norm": 0.8358313469225909,
      "learning_rate": 2.73400045272172e-05,
      "loss": 1.1215,
      "num_input_tokens_seen": 41883494656,
      "step": 53235
    },
    {
      "epoch": 5.647782728622958,
      "grad_norm": 0.8028560267660676,
      "learning_rate": 2.7339312608498634e-05,
      "loss": 1.2394,
      "num_input_tokens_seen": 41884281408,
      "step": 53236
    },
    {
      "epoch": 5.647888818162529,
      "grad_norm": 0.6061515706717304,
      "learning_rate": 2.733862068797231e-05,
      "loss": 1.1369,
      "num_input_tokens_seen": 41885068144,
      "step": 53237
    },
    {
      "epoch": 5.647994907702101,
      "grad_norm": 0.8175065650759148,
      "learning_rate": 2.733792876563877e-05,
      "loss": 1.1333,
      "num_input_tokens_seen": 41885854896,
      "step": 53238
    },
    {
      "epoch": 5.648100997241672,
      "grad_norm": 0.8344652403572873,
      "learning_rate": 2.7337236841498547e-05,
      "loss": 1.0965,
      "num_input_tokens_seen": 41886641776,
      "step": 53239
    },
    {
      "epoch": 5.648207086781244,
      "grad_norm": 0.7060511491491858,
      "learning_rate": 2.7336544915552175e-05,
      "loss": 1.2193,
      "num_input_tokens_seen": 41887428544,
      "step": 53240
    },
    {
      "epoch": 5.648313176320815,
      "grad_norm": 0.6619283202930624,
      "learning_rate": 2.7335852987800186e-05,
      "loss": 1.0981,
      "num_input_tokens_seen": 41888215264,
      "step": 53241
    },
    {
      "epoch": 5.648419265860386,
      "grad_norm": 0.8116054877668291,
      "learning_rate": 2.733516105824313e-05,
      "loss": 1.1675,
      "num_input_tokens_seen": 41889002032,
      "step": 53242
    },
    {
      "epoch": 5.648525355399958,
      "grad_norm": 0.9424168137202528,
      "learning_rate": 2.7334469126881523e-05,
      "loss": 1.224,
      "num_input_tokens_seen": 41889788720,
      "step": 53243
    },
    {
      "epoch": 5.648631444939529,
      "grad_norm": 0.9327934583265519,
      "learning_rate": 2.7333777193715903e-05,
      "loss": 1.1787,
      "num_input_tokens_seen": 41890575504,
      "step": 53244
    },
    {
      "epoch": 5.648737534479101,
      "grad_norm": 1.117271484990095,
      "learning_rate": 2.7333085258746817e-05,
      "loss": 1.2308,
      "num_input_tokens_seen": 41891362192,
      "step": 53245
    },
    {
      "epoch": 5.648843624018672,
      "grad_norm": 0.7543487563990408,
      "learning_rate": 2.733239332197478e-05,
      "loss": 1.0766,
      "num_input_tokens_seen": 41892148992,
      "step": 53246
    },
    {
      "epoch": 5.648949713558244,
      "grad_norm": 1.2195191164821193,
      "learning_rate": 2.7331701383400343e-05,
      "loss": 1.3345,
      "num_input_tokens_seen": 41892935664,
      "step": 53247
    },
    {
      "epoch": 5.649055803097815,
      "grad_norm": 0.8418190480735429,
      "learning_rate": 2.7331009443024043e-05,
      "loss": 1.1824,
      "num_input_tokens_seen": 41893722432,
      "step": 53248
    },
    {
      "epoch": 5.649161892637386,
      "grad_norm": 0.9173997991985853,
      "learning_rate": 2.7330317500846392e-05,
      "loss": 1.2163,
      "num_input_tokens_seen": 41894509264,
      "step": 53249
    },
    {
      "epoch": 5.649267982176958,
      "grad_norm": 0.9889049342270028,
      "learning_rate": 2.7329625556867955e-05,
      "loss": 1.1677,
      "num_input_tokens_seen": 41895296000,
      "step": 53250
    },
    {
      "epoch": 5.649374071716529,
      "grad_norm": 0.9403419343702109,
      "learning_rate": 2.7328933611089245e-05,
      "loss": 1.1558,
      "num_input_tokens_seen": 41896082832,
      "step": 53251
    },
    {
      "epoch": 5.6494801612561005,
      "grad_norm": 0.7698338701693219,
      "learning_rate": 2.73282416635108e-05,
      "loss": 1.1113,
      "num_input_tokens_seen": 41896869600,
      "step": 53252
    },
    {
      "epoch": 5.649586250795672,
      "grad_norm": 1.0001228004197642,
      "learning_rate": 2.7327549714133166e-05,
      "loss": 1.191,
      "num_input_tokens_seen": 41897656304,
      "step": 53253
    },
    {
      "epoch": 5.649692340335243,
      "grad_norm": 0.8570207332112677,
      "learning_rate": 2.7326857762956863e-05,
      "loss": 1.1824,
      "num_input_tokens_seen": 41898443008,
      "step": 53254
    },
    {
      "epoch": 5.6497984298748145,
      "grad_norm": 0.8220239830464432,
      "learning_rate": 2.7326165809982436e-05,
      "loss": 1.1571,
      "num_input_tokens_seen": 41899229840,
      "step": 53255
    },
    {
      "epoch": 5.6499045194143855,
      "grad_norm": 0.6412241497149918,
      "learning_rate": 2.7325473855210414e-05,
      "loss": 1.1377,
      "num_input_tokens_seen": 41900016736,
      "step": 53256
    },
    {
      "epoch": 5.6500106089539575,
      "grad_norm": 0.7675289931764216,
      "learning_rate": 2.7324781898641338e-05,
      "loss": 1.1799,
      "num_input_tokens_seen": 41900803520,
      "step": 53257
    },
    {
      "epoch": 5.6501166984935285,
      "grad_norm": 0.6509715048675935,
      "learning_rate": 2.732408994027573e-05,
      "loss": 1.2284,
      "num_input_tokens_seen": 41901590320,
      "step": 53258
    },
    {
      "epoch": 5.6502227880330995,
      "grad_norm": 0.7680058594241189,
      "learning_rate": 2.7323397980114144e-05,
      "loss": 1.1908,
      "num_input_tokens_seen": 41902377152,
      "step": 53259
    },
    {
      "epoch": 5.650328877572671,
      "grad_norm": 0.6490533575133751,
      "learning_rate": 2.73227060181571e-05,
      "loss": 1.1414,
      "num_input_tokens_seen": 41903163952,
      "step": 53260
    },
    {
      "epoch": 5.6504349671122425,
      "grad_norm": 0.6312762323706118,
      "learning_rate": 2.7322014054405138e-05,
      "loss": 1.2129,
      "num_input_tokens_seen": 41903950800,
      "step": 53261
    },
    {
      "epoch": 5.650541056651814,
      "grad_norm": 0.7319245525379403,
      "learning_rate": 2.7321322088858793e-05,
      "loss": 1.1596,
      "num_input_tokens_seen": 41904737696,
      "step": 53262
    },
    {
      "epoch": 5.650647146191385,
      "grad_norm": 0.6104410001526174,
      "learning_rate": 2.73206301215186e-05,
      "loss": 1.1765,
      "num_input_tokens_seen": 41905524512,
      "step": 53263
    },
    {
      "epoch": 5.6507532357309564,
      "grad_norm": 0.5721204222558675,
      "learning_rate": 2.7319938152385083e-05,
      "loss": 1.1525,
      "num_input_tokens_seen": 41906311216,
      "step": 53264
    },
    {
      "epoch": 5.650859325270528,
      "grad_norm": 0.6649775767992429,
      "learning_rate": 2.731924618145879e-05,
      "loss": 1.0892,
      "num_input_tokens_seen": 41907098000,
      "step": 53265
    },
    {
      "epoch": 5.650965414810099,
      "grad_norm": 0.73456209719467,
      "learning_rate": 2.731855420874026e-05,
      "loss": 1.0973,
      "num_input_tokens_seen": 41907884736,
      "step": 53266
    },
    {
      "epoch": 5.651071504349671,
      "grad_norm": 0.668480152297651,
      "learning_rate": 2.7317862234230008e-05,
      "loss": 1.2477,
      "num_input_tokens_seen": 41908671488,
      "step": 53267
    },
    {
      "epoch": 5.651177593889242,
      "grad_norm": 0.6424619043425249,
      "learning_rate": 2.7317170257928588e-05,
      "loss": 1.1984,
      "num_input_tokens_seen": 41909458240,
      "step": 53268
    },
    {
      "epoch": 5.651283683428814,
      "grad_norm": 0.5939583350219058,
      "learning_rate": 2.7316478279836523e-05,
      "loss": 1.1249,
      "num_input_tokens_seen": 41910244960,
      "step": 53269
    },
    {
      "epoch": 5.651389772968385,
      "grad_norm": 0.625696918443816,
      "learning_rate": 2.731578629995435e-05,
      "loss": 1.1177,
      "num_input_tokens_seen": 41911031760,
      "step": 53270
    },
    {
      "epoch": 5.651495862507957,
      "grad_norm": 0.8360907686544691,
      "learning_rate": 2.7315094318282607e-05,
      "loss": 1.2006,
      "num_input_tokens_seen": 41911818512,
      "step": 53271
    },
    {
      "epoch": 5.651601952047528,
      "grad_norm": 0.7205680065158973,
      "learning_rate": 2.7314402334821827e-05,
      "loss": 1.1864,
      "num_input_tokens_seen": 41912605312,
      "step": 53272
    },
    {
      "epoch": 5.651708041587099,
      "grad_norm": 0.6750451277315387,
      "learning_rate": 2.731371034957254e-05,
      "loss": 1.1505,
      "num_input_tokens_seen": 41913392080,
      "step": 53273
    },
    {
      "epoch": 5.651814131126671,
      "grad_norm": 0.743735112431907,
      "learning_rate": 2.73130183625353e-05,
      "loss": 1.1937,
      "num_input_tokens_seen": 41914178864,
      "step": 53274
    },
    {
      "epoch": 5.651920220666242,
      "grad_norm": 0.6447723641133165,
      "learning_rate": 2.731232637371061e-05,
      "loss": 1.1369,
      "num_input_tokens_seen": 41914965488,
      "step": 53275
    },
    {
      "epoch": 5.652026310205814,
      "grad_norm": 0.6718049227059099,
      "learning_rate": 2.7311634383099034e-05,
      "loss": 1.1917,
      "num_input_tokens_seen": 41915752128,
      "step": 53276
    },
    {
      "epoch": 5.652132399745385,
      "grad_norm": 0.856079530187959,
      "learning_rate": 2.7310942390701087e-05,
      "loss": 1.1962,
      "num_input_tokens_seen": 41916538912,
      "step": 53277
    },
    {
      "epoch": 5.652238489284956,
      "grad_norm": 0.842118961628316,
      "learning_rate": 2.7310250396517317e-05,
      "loss": 1.1614,
      "num_input_tokens_seen": 41917325600,
      "step": 53278
    },
    {
      "epoch": 5.652344578824528,
      "grad_norm": 0.7188437812562927,
      "learning_rate": 2.7309558400548252e-05,
      "loss": 1.167,
      "num_input_tokens_seen": 41918112416,
      "step": 53279
    },
    {
      "epoch": 5.652450668364099,
      "grad_norm": 0.6525165956466145,
      "learning_rate": 2.730886640279443e-05,
      "loss": 1.255,
      "num_input_tokens_seen": 41918899168,
      "step": 53280
    },
    {
      "epoch": 5.652556757903671,
      "grad_norm": 0.7110860420097493,
      "learning_rate": 2.7308174403256377e-05,
      "loss": 1.1662,
      "num_input_tokens_seen": 41919685904,
      "step": 53281
    },
    {
      "epoch": 5.652662847443242,
      "grad_norm": 0.5481368581386867,
      "learning_rate": 2.7307482401934643e-05,
      "loss": 1.1959,
      "num_input_tokens_seen": 41920472608,
      "step": 53282
    },
    {
      "epoch": 5.652768936982813,
      "grad_norm": 0.698743388643688,
      "learning_rate": 2.7306790398829753e-05,
      "loss": 1.1661,
      "num_input_tokens_seen": 41921259312,
      "step": 53283
    },
    {
      "epoch": 5.652875026522385,
      "grad_norm": 0.5588539046557528,
      "learning_rate": 2.730609839394223e-05,
      "loss": 1.1218,
      "num_input_tokens_seen": 41922046032,
      "step": 53284
    },
    {
      "epoch": 5.652981116061956,
      "grad_norm": 0.5714651851706166,
      "learning_rate": 2.7305406387272636e-05,
      "loss": 1.166,
      "num_input_tokens_seen": 41922832752,
      "step": 53285
    },
    {
      "epoch": 5.653087205601528,
      "grad_norm": 0.5286595156097174,
      "learning_rate": 2.7304714378821487e-05,
      "loss": 1.0658,
      "num_input_tokens_seen": 41923619616,
      "step": 53286
    },
    {
      "epoch": 5.653193295141099,
      "grad_norm": 0.639439810176974,
      "learning_rate": 2.7304022368589323e-05,
      "loss": 1.2139,
      "num_input_tokens_seen": 41924406384,
      "step": 53287
    },
    {
      "epoch": 5.65329938468067,
      "grad_norm": 0.6177683374552487,
      "learning_rate": 2.7303330356576678e-05,
      "loss": 1.2073,
      "num_input_tokens_seen": 41925193136,
      "step": 53288
    },
    {
      "epoch": 5.653405474220242,
      "grad_norm": 0.53436490278035,
      "learning_rate": 2.730263834278409e-05,
      "loss": 1.1039,
      "num_input_tokens_seen": 41925979872,
      "step": 53289
    },
    {
      "epoch": 5.653511563759813,
      "grad_norm": 0.7598811961973283,
      "learning_rate": 2.7301946327212086e-05,
      "loss": 1.2062,
      "num_input_tokens_seen": 41926766640,
      "step": 53290
    },
    {
      "epoch": 5.653617653299385,
      "grad_norm": 0.7604519692120769,
      "learning_rate": 2.7301254309861206e-05,
      "loss": 1.1767,
      "num_input_tokens_seen": 41927553328,
      "step": 53291
    },
    {
      "epoch": 5.653723742838956,
      "grad_norm": 0.6675926220589314,
      "learning_rate": 2.7300562290731984e-05,
      "loss": 1.1372,
      "num_input_tokens_seen": 41928340016,
      "step": 53292
    },
    {
      "epoch": 5.653829832378527,
      "grad_norm": 0.7244075855380836,
      "learning_rate": 2.7299870269824955e-05,
      "loss": 1.0931,
      "num_input_tokens_seen": 41929126832,
      "step": 53293
    },
    {
      "epoch": 5.653935921918099,
      "grad_norm": 0.7381082749016927,
      "learning_rate": 2.729917824714066e-05,
      "loss": 1.2328,
      "num_input_tokens_seen": 41929913536,
      "step": 53294
    },
    {
      "epoch": 5.65404201145767,
      "grad_norm": 0.6211309765283477,
      "learning_rate": 2.729848622267962e-05,
      "loss": 1.1006,
      "num_input_tokens_seen": 41930700368,
      "step": 53295
    },
    {
      "epoch": 5.654148100997242,
      "grad_norm": 0.7030641348432803,
      "learning_rate": 2.729779419644238e-05,
      "loss": 1.2451,
      "num_input_tokens_seen": 41931487136,
      "step": 53296
    },
    {
      "epoch": 5.654254190536813,
      "grad_norm": 0.5658837385719413,
      "learning_rate": 2.729710216842947e-05,
      "loss": 1.0937,
      "num_input_tokens_seen": 41932273968,
      "step": 53297
    },
    {
      "epoch": 5.654360280076385,
      "grad_norm": 0.7150484586716456,
      "learning_rate": 2.7296410138641427e-05,
      "loss": 1.099,
      "num_input_tokens_seen": 41933060832,
      "step": 53298
    },
    {
      "epoch": 5.654466369615956,
      "grad_norm": 0.741158335972433,
      "learning_rate": 2.7295718107078794e-05,
      "loss": 1.2636,
      "num_input_tokens_seen": 41933847536,
      "step": 53299
    },
    {
      "epoch": 5.654572459155528,
      "grad_norm": 0.8107680029101331,
      "learning_rate": 2.7295026073742092e-05,
      "loss": 1.1301,
      "num_input_tokens_seen": 41934634272,
      "step": 53300
    },
    {
      "epoch": 5.654678548695099,
      "grad_norm": 0.8407930346261718,
      "learning_rate": 2.729433403863185e-05,
      "loss": 1.1962,
      "num_input_tokens_seen": 41935421056,
      "step": 53301
    },
    {
      "epoch": 5.65478463823467,
      "grad_norm": 0.6371934216647427,
      "learning_rate": 2.7293642001748626e-05,
      "loss": 1.1858,
      "num_input_tokens_seen": 41936207840,
      "step": 53302
    },
    {
      "epoch": 5.654890727774242,
      "grad_norm": 0.7465509256050294,
      "learning_rate": 2.729294996309294e-05,
      "loss": 1.1584,
      "num_input_tokens_seen": 41936994608,
      "step": 53303
    },
    {
      "epoch": 5.654996817313813,
      "grad_norm": 0.736664751796842,
      "learning_rate": 2.7292257922665327e-05,
      "loss": 1.1168,
      "num_input_tokens_seen": 41937781424,
      "step": 53304
    },
    {
      "epoch": 5.655102906853385,
      "grad_norm": 0.7418305791537703,
      "learning_rate": 2.729156588046633e-05,
      "loss": 1.2893,
      "num_input_tokens_seen": 41938568176,
      "step": 53305
    },
    {
      "epoch": 5.655208996392956,
      "grad_norm": 0.7524574133585044,
      "learning_rate": 2.7290873836496477e-05,
      "loss": 1.1532,
      "num_input_tokens_seen": 41939354928,
      "step": 53306
    },
    {
      "epoch": 5.655315085932527,
      "grad_norm": 0.7567559745597402,
      "learning_rate": 2.7290181790756298e-05,
      "loss": 1.1104,
      "num_input_tokens_seen": 41940141712,
      "step": 53307
    },
    {
      "epoch": 5.655421175472099,
      "grad_norm": 0.8758617760353613,
      "learning_rate": 2.7289489743246343e-05,
      "loss": 1.0811,
      "num_input_tokens_seen": 41940928448,
      "step": 53308
    },
    {
      "epoch": 5.65552726501167,
      "grad_norm": 0.6379855341197882,
      "learning_rate": 2.728879769396713e-05,
      "loss": 1.1371,
      "num_input_tokens_seen": 41941715264,
      "step": 53309
    },
    {
      "epoch": 5.655633354551242,
      "grad_norm": 1.2669314963870284,
      "learning_rate": 2.7288105642919204e-05,
      "loss": 1.0858,
      "num_input_tokens_seen": 41942502000,
      "step": 53310
    },
    {
      "epoch": 5.655739444090813,
      "grad_norm": 1.0873228695036707,
      "learning_rate": 2.7287413590103102e-05,
      "loss": 1.1146,
      "num_input_tokens_seen": 41943288848,
      "step": 53311
    },
    {
      "epoch": 5.655845533630384,
      "grad_norm": 0.5654046285962188,
      "learning_rate": 2.728672153551935e-05,
      "loss": 1.0778,
      "num_input_tokens_seen": 41944075680,
      "step": 53312
    },
    {
      "epoch": 5.655951623169956,
      "grad_norm": 1.2831116134694351,
      "learning_rate": 2.7286029479168478e-05,
      "loss": 1.1358,
      "num_input_tokens_seen": 41944862464,
      "step": 53313
    },
    {
      "epoch": 5.656057712709527,
      "grad_norm": 1.0222593711935135,
      "learning_rate": 2.7285337421051038e-05,
      "loss": 1.1642,
      "num_input_tokens_seen": 41945649120,
      "step": 53314
    },
    {
      "epoch": 5.6561638022490985,
      "grad_norm": 0.6527613720787676,
      "learning_rate": 2.728464536116756e-05,
      "loss": 1.1839,
      "num_input_tokens_seen": 41946435904,
      "step": 53315
    },
    {
      "epoch": 5.65626989178867,
      "grad_norm": 0.9356708852763242,
      "learning_rate": 2.7283953299518568e-05,
      "loss": 1.1894,
      "num_input_tokens_seen": 41947222704,
      "step": 53316
    },
    {
      "epoch": 5.656375981328241,
      "grad_norm": 0.8578778310220362,
      "learning_rate": 2.7283261236104607e-05,
      "loss": 1.1809,
      "num_input_tokens_seen": 41948009456,
      "step": 53317
    },
    {
      "epoch": 5.6564820708678125,
      "grad_norm": 0.585400109861544,
      "learning_rate": 2.7282569170926204e-05,
      "loss": 1.1603,
      "num_input_tokens_seen": 41948796176,
      "step": 53318
    },
    {
      "epoch": 5.6565881604073835,
      "grad_norm": 0.8364412830369489,
      "learning_rate": 2.7281877103983903e-05,
      "loss": 1.1969,
      "num_input_tokens_seen": 41949582896,
      "step": 53319
    },
    {
      "epoch": 5.6566942499469555,
      "grad_norm": 0.7603052202500082,
      "learning_rate": 2.728118503527824e-05,
      "loss": 1.1228,
      "num_input_tokens_seen": 41950369728,
      "step": 53320
    },
    {
      "epoch": 5.6568003394865265,
      "grad_norm": 0.5844304861997954,
      "learning_rate": 2.7280492964809733e-05,
      "loss": 1.1905,
      "num_input_tokens_seen": 41951156592,
      "step": 53321
    },
    {
      "epoch": 5.656906429026098,
      "grad_norm": 0.6345033058754157,
      "learning_rate": 2.727980089257893e-05,
      "loss": 1.1605,
      "num_input_tokens_seen": 41951943456,
      "step": 53322
    },
    {
      "epoch": 5.6570125185656694,
      "grad_norm": 0.6260701593358498,
      "learning_rate": 2.7279108818586375e-05,
      "loss": 1.1034,
      "num_input_tokens_seen": 41952730176,
      "step": 53323
    },
    {
      "epoch": 5.6571186081052405,
      "grad_norm": 0.5867678106918286,
      "learning_rate": 2.727841674283258e-05,
      "loss": 1.1631,
      "num_input_tokens_seen": 41953516912,
      "step": 53324
    },
    {
      "epoch": 5.657224697644812,
      "grad_norm": 0.6754458398389799,
      "learning_rate": 2.7277724665318095e-05,
      "loss": 1.2079,
      "num_input_tokens_seen": 41954303632,
      "step": 53325
    },
    {
      "epoch": 5.657330787184383,
      "grad_norm": 0.9948282499845421,
      "learning_rate": 2.7277032586043455e-05,
      "loss": 1.1225,
      "num_input_tokens_seen": 41955090400,
      "step": 53326
    },
    {
      "epoch": 5.657436876723955,
      "grad_norm": 0.800754091777849,
      "learning_rate": 2.7276340505009186e-05,
      "loss": 1.2048,
      "num_input_tokens_seen": 41955877152,
      "step": 53327
    },
    {
      "epoch": 5.657542966263526,
      "grad_norm": 0.7512016452499465,
      "learning_rate": 2.7275648422215826e-05,
      "loss": 1.1498,
      "num_input_tokens_seen": 41956664032,
      "step": 53328
    },
    {
      "epoch": 5.657649055803098,
      "grad_norm": 0.7090621481785659,
      "learning_rate": 2.727495633766392e-05,
      "loss": 1.0745,
      "num_input_tokens_seen": 41957450768,
      "step": 53329
    },
    {
      "epoch": 5.657755145342669,
      "grad_norm": 0.6224520147063335,
      "learning_rate": 2.727426425135398e-05,
      "loss": 1.0567,
      "num_input_tokens_seen": 41958237616,
      "step": 53330
    },
    {
      "epoch": 5.65786123488224,
      "grad_norm": 0.7393391435678325,
      "learning_rate": 2.727357216328657e-05,
      "loss": 1.1471,
      "num_input_tokens_seen": 41959024400,
      "step": 53331
    },
    {
      "epoch": 5.657967324421812,
      "grad_norm": 0.6621160331774463,
      "learning_rate": 2.7272880073462205e-05,
      "loss": 1.1738,
      "num_input_tokens_seen": 41959811136,
      "step": 53332
    },
    {
      "epoch": 5.658073413961383,
      "grad_norm": 0.5617365949094181,
      "learning_rate": 2.7272187981881427e-05,
      "loss": 1.1261,
      "num_input_tokens_seen": 41960597888,
      "step": 53333
    },
    {
      "epoch": 5.658179503500955,
      "grad_norm": 0.5569843269234876,
      "learning_rate": 2.7271495888544762e-05,
      "loss": 1.1541,
      "num_input_tokens_seen": 41961384592,
      "step": 53334
    },
    {
      "epoch": 5.658285593040526,
      "grad_norm": 0.6169163740619289,
      "learning_rate": 2.7270803793452755e-05,
      "loss": 1.0602,
      "num_input_tokens_seen": 41962171408,
      "step": 53335
    },
    {
      "epoch": 5.658391682580097,
      "grad_norm": 0.5673719542160074,
      "learning_rate": 2.727011169660594e-05,
      "loss": 1.2256,
      "num_input_tokens_seen": 41962958080,
      "step": 53336
    },
    {
      "epoch": 5.658497772119669,
      "grad_norm": 0.6301362089740459,
      "learning_rate": 2.7269419598004846e-05,
      "loss": 1.1395,
      "num_input_tokens_seen": 41963744816,
      "step": 53337
    },
    {
      "epoch": 5.65860386165924,
      "grad_norm": 0.7409901908279354,
      "learning_rate": 2.7268727497650016e-05,
      "loss": 1.1993,
      "num_input_tokens_seen": 41964531504,
      "step": 53338
    },
    {
      "epoch": 5.658709951198812,
      "grad_norm": 0.6601440070538858,
      "learning_rate": 2.7268035395541973e-05,
      "loss": 1.1925,
      "num_input_tokens_seen": 41965318176,
      "step": 53339
    },
    {
      "epoch": 5.658816040738383,
      "grad_norm": 0.7428392906222714,
      "learning_rate": 2.7267343291681267e-05,
      "loss": 1.2067,
      "num_input_tokens_seen": 41966104896,
      "step": 53340
    },
    {
      "epoch": 5.658922130277954,
      "grad_norm": 0.6355997071488771,
      "learning_rate": 2.7266651186068416e-05,
      "loss": 1.1533,
      "num_input_tokens_seen": 41966891632,
      "step": 53341
    },
    {
      "epoch": 5.659028219817526,
      "grad_norm": 0.6487354707790381,
      "learning_rate": 2.7265959078703975e-05,
      "loss": 1.014,
      "num_input_tokens_seen": 41967678432,
      "step": 53342
    },
    {
      "epoch": 5.659134309357097,
      "grad_norm": 0.8568537241495702,
      "learning_rate": 2.7265266969588455e-05,
      "loss": 1.215,
      "num_input_tokens_seen": 41968465200,
      "step": 53343
    },
    {
      "epoch": 5.659240398896669,
      "grad_norm": 0.5958947503609086,
      "learning_rate": 2.7264574858722407e-05,
      "loss": 1.1554,
      "num_input_tokens_seen": 41969252016,
      "step": 53344
    },
    {
      "epoch": 5.65934648843624,
      "grad_norm": 0.7614129134812567,
      "learning_rate": 2.726388274610637e-05,
      "loss": 1.1333,
      "num_input_tokens_seen": 41970038864,
      "step": 53345
    },
    {
      "epoch": 5.659452577975811,
      "grad_norm": 0.7128188669536957,
      "learning_rate": 2.7263190631740858e-05,
      "loss": 1.2099,
      "num_input_tokens_seen": 41970825552,
      "step": 53346
    },
    {
      "epoch": 5.659558667515383,
      "grad_norm": 0.7115740201189058,
      "learning_rate": 2.726249851562642e-05,
      "loss": 1.1629,
      "num_input_tokens_seen": 41971612336,
      "step": 53347
    },
    {
      "epoch": 5.659664757054954,
      "grad_norm": 0.6633132018913758,
      "learning_rate": 2.72618063977636e-05,
      "loss": 1.2026,
      "num_input_tokens_seen": 41972399088,
      "step": 53348
    },
    {
      "epoch": 5.659770846594526,
      "grad_norm": 0.7551015352402116,
      "learning_rate": 2.726111427815291e-05,
      "loss": 1.171,
      "num_input_tokens_seen": 41973185824,
      "step": 53349
    },
    {
      "epoch": 5.659876936134097,
      "grad_norm": 0.577484124339436,
      "learning_rate": 2.72604221567949e-05,
      "loss": 1.089,
      "num_input_tokens_seen": 41973972624,
      "step": 53350
    },
    {
      "epoch": 5.659983025673669,
      "grad_norm": 0.7844498275619051,
      "learning_rate": 2.7259730033690113e-05,
      "loss": 1.188,
      "num_input_tokens_seen": 41974759296,
      "step": 53351
    },
    {
      "epoch": 5.66008911521324,
      "grad_norm": 0.602076738623979,
      "learning_rate": 2.725903790883907e-05,
      "loss": 1.1622,
      "num_input_tokens_seen": 41975545984,
      "step": 53352
    },
    {
      "epoch": 5.660195204752811,
      "grad_norm": 0.7286960930590207,
      "learning_rate": 2.7258345782242295e-05,
      "loss": 1.1004,
      "num_input_tokens_seen": 41976332784,
      "step": 53353
    },
    {
      "epoch": 5.660301294292383,
      "grad_norm": 0.5982560476006462,
      "learning_rate": 2.725765365390035e-05,
      "loss": 1.1493,
      "num_input_tokens_seen": 41977119616,
      "step": 53354
    },
    {
      "epoch": 5.660407383831954,
      "grad_norm": 0.6683259246495403,
      "learning_rate": 2.7256961523813757e-05,
      "loss": 1.1815,
      "num_input_tokens_seen": 41977906352,
      "step": 53355
    },
    {
      "epoch": 5.660513473371526,
      "grad_norm": 0.5905788161216529,
      "learning_rate": 2.725626939198304e-05,
      "loss": 1.1155,
      "num_input_tokens_seen": 41978693152,
      "step": 53356
    },
    {
      "epoch": 5.660619562911097,
      "grad_norm": 0.5666936700016482,
      "learning_rate": 2.7255577258408753e-05,
      "loss": 1.0742,
      "num_input_tokens_seen": 41979479904,
      "step": 53357
    },
    {
      "epoch": 5.660725652450669,
      "grad_norm": 0.7030048380391084,
      "learning_rate": 2.7254885123091422e-05,
      "loss": 1.157,
      "num_input_tokens_seen": 41980266672,
      "step": 53358
    },
    {
      "epoch": 5.66083174199024,
      "grad_norm": 0.6063392513741154,
      "learning_rate": 2.7254192986031574e-05,
      "loss": 1.0561,
      "num_input_tokens_seen": 41981053488,
      "step": 53359
    },
    {
      "epoch": 5.660937831529811,
      "grad_norm": 1.1436902615716333,
      "learning_rate": 2.7253500847229763e-05,
      "loss": 1.1894,
      "num_input_tokens_seen": 41981840192,
      "step": 53360
    },
    {
      "epoch": 5.661043921069383,
      "grad_norm": 0.7161701229004288,
      "learning_rate": 2.72528087066865e-05,
      "loss": 1.2254,
      "num_input_tokens_seen": 41982626960,
      "step": 53361
    },
    {
      "epoch": 5.661150010608954,
      "grad_norm": 0.7194461185345347,
      "learning_rate": 2.7252116564402342e-05,
      "loss": 1.2706,
      "num_input_tokens_seen": 41983413584,
      "step": 53362
    },
    {
      "epoch": 5.661256100148526,
      "grad_norm": 0.8470462732697333,
      "learning_rate": 2.7251424420377814e-05,
      "loss": 1.2688,
      "num_input_tokens_seen": 41984200352,
      "step": 53363
    },
    {
      "epoch": 5.661362189688097,
      "grad_norm": 0.6558961521369251,
      "learning_rate": 2.7250732274613446e-05,
      "loss": 1.1921,
      "num_input_tokens_seen": 41984987120,
      "step": 53364
    },
    {
      "epoch": 5.661468279227668,
      "grad_norm": 0.5894796568643557,
      "learning_rate": 2.7250040127109783e-05,
      "loss": 1.071,
      "num_input_tokens_seen": 41985773952,
      "step": 53365
    },
    {
      "epoch": 5.66157436876724,
      "grad_norm": 0.9463212415211559,
      "learning_rate": 2.7249347977867356e-05,
      "loss": 1.1817,
      "num_input_tokens_seen": 41986560656,
      "step": 53366
    },
    {
      "epoch": 5.661680458306811,
      "grad_norm": 0.7269530672431305,
      "learning_rate": 2.7248655826886695e-05,
      "loss": 1.0834,
      "num_input_tokens_seen": 41987347392,
      "step": 53367
    },
    {
      "epoch": 5.661786547846383,
      "grad_norm": 0.7978462330971474,
      "learning_rate": 2.7247963674168335e-05,
      "loss": 1.1174,
      "num_input_tokens_seen": 41988134144,
      "step": 53368
    },
    {
      "epoch": 5.661892637385954,
      "grad_norm": 0.8249794988670901,
      "learning_rate": 2.7247271519712826e-05,
      "loss": 1.112,
      "num_input_tokens_seen": 41988920928,
      "step": 53369
    },
    {
      "epoch": 5.661998726925525,
      "grad_norm": 0.7112180895160698,
      "learning_rate": 2.724657936352068e-05,
      "loss": 1.1488,
      "num_input_tokens_seen": 41989707632,
      "step": 53370
    },
    {
      "epoch": 5.662104816465097,
      "grad_norm": 0.7736720817438911,
      "learning_rate": 2.724588720559245e-05,
      "loss": 1.248,
      "num_input_tokens_seen": 41990494448,
      "step": 53371
    },
    {
      "epoch": 5.662210906004668,
      "grad_norm": 0.6716387422894099,
      "learning_rate": 2.724519504592866e-05,
      "loss": 1.1756,
      "num_input_tokens_seen": 41991281264,
      "step": 53372
    },
    {
      "epoch": 5.66231699554424,
      "grad_norm": 0.5847810585407551,
      "learning_rate": 2.7244502884529854e-05,
      "loss": 1.1201,
      "num_input_tokens_seen": 41992068000,
      "step": 53373
    },
    {
      "epoch": 5.662423085083811,
      "grad_norm": 0.6608386633749217,
      "learning_rate": 2.724381072139656e-05,
      "loss": 1.1513,
      "num_input_tokens_seen": 41992854816,
      "step": 53374
    },
    {
      "epoch": 5.662529174623382,
      "grad_norm": 0.602714504324826,
      "learning_rate": 2.7243118556529313e-05,
      "loss": 1.1447,
      "num_input_tokens_seen": 41993641504,
      "step": 53375
    },
    {
      "epoch": 5.662635264162954,
      "grad_norm": 0.7454226209642622,
      "learning_rate": 2.7242426389928656e-05,
      "loss": 1.187,
      "num_input_tokens_seen": 41994428272,
      "step": 53376
    },
    {
      "epoch": 5.662741353702525,
      "grad_norm": 0.6893804639537905,
      "learning_rate": 2.7241734221595112e-05,
      "loss": 1.1616,
      "num_input_tokens_seen": 41995214976,
      "step": 53377
    },
    {
      "epoch": 5.6628474432420965,
      "grad_norm": 0.7336269104423155,
      "learning_rate": 2.724104205152922e-05,
      "loss": 1.1989,
      "num_input_tokens_seen": 41996001792,
      "step": 53378
    },
    {
      "epoch": 5.662953532781668,
      "grad_norm": 0.5847971532589695,
      "learning_rate": 2.724034987973152e-05,
      "loss": 1.1364,
      "num_input_tokens_seen": 41996788544,
      "step": 53379
    },
    {
      "epoch": 5.6630596223212395,
      "grad_norm": 0.6267502628740245,
      "learning_rate": 2.7239657706202544e-05,
      "loss": 1.1806,
      "num_input_tokens_seen": 41997575456,
      "step": 53380
    },
    {
      "epoch": 5.6631657118608105,
      "grad_norm": 0.6902320827195374,
      "learning_rate": 2.7238965530942822e-05,
      "loss": 1.1636,
      "num_input_tokens_seen": 41998362208,
      "step": 53381
    },
    {
      "epoch": 5.6632718014003816,
      "grad_norm": 0.7536200212573876,
      "learning_rate": 2.72382733539529e-05,
      "loss": 1.2404,
      "num_input_tokens_seen": 41999149008,
      "step": 53382
    },
    {
      "epoch": 5.6633778909399535,
      "grad_norm": 0.8514425799871771,
      "learning_rate": 2.72375811752333e-05,
      "loss": 1.1403,
      "num_input_tokens_seen": 41999935776,
      "step": 53383
    },
    {
      "epoch": 5.6634839804795245,
      "grad_norm": 0.6875050816575914,
      "learning_rate": 2.7236888994784564e-05,
      "loss": 1.2192,
      "num_input_tokens_seen": 42000722496,
      "step": 53384
    },
    {
      "epoch": 5.663590070019096,
      "grad_norm": 0.910739505724747,
      "learning_rate": 2.723619681260723e-05,
      "loss": 1.1495,
      "num_input_tokens_seen": 42001509344,
      "step": 53385
    },
    {
      "epoch": 5.6636961595586675,
      "grad_norm": 0.6462139895552025,
      "learning_rate": 2.7235504628701824e-05,
      "loss": 1.1099,
      "num_input_tokens_seen": 42002296176,
      "step": 53386
    },
    {
      "epoch": 5.663802249098239,
      "grad_norm": 0.7214320987810887,
      "learning_rate": 2.7234812443068886e-05,
      "loss": 1.2413,
      "num_input_tokens_seen": 42003082912,
      "step": 53387
    },
    {
      "epoch": 5.66390833863781,
      "grad_norm": 1.20686302129864,
      "learning_rate": 2.723412025570895e-05,
      "loss": 1.1172,
      "num_input_tokens_seen": 42003869680,
      "step": 53388
    },
    {
      "epoch": 5.664014428177381,
      "grad_norm": 0.6302294582777298,
      "learning_rate": 2.7233428066622556e-05,
      "loss": 1.09,
      "num_input_tokens_seen": 42004656496,
      "step": 53389
    },
    {
      "epoch": 5.664120517716953,
      "grad_norm": 0.8408471872920051,
      "learning_rate": 2.7232735875810228e-05,
      "loss": 1.1613,
      "num_input_tokens_seen": 42005443312,
      "step": 53390
    },
    {
      "epoch": 5.664226607256524,
      "grad_norm": 0.7969218832394787,
      "learning_rate": 2.7232043683272514e-05,
      "loss": 1.1314,
      "num_input_tokens_seen": 42006230192,
      "step": 53391
    },
    {
      "epoch": 5.664332696796096,
      "grad_norm": 0.6248080112581609,
      "learning_rate": 2.7231351489009933e-05,
      "loss": 1.1103,
      "num_input_tokens_seen": 42007016944,
      "step": 53392
    },
    {
      "epoch": 5.664438786335667,
      "grad_norm": 0.6026037870388841,
      "learning_rate": 2.7230659293023036e-05,
      "loss": 1.1467,
      "num_input_tokens_seen": 42007803792,
      "step": 53393
    },
    {
      "epoch": 5.664544875875238,
      "grad_norm": 0.6758188073791047,
      "learning_rate": 2.7229967095312353e-05,
      "loss": 1.128,
      "num_input_tokens_seen": 42008590656,
      "step": 53394
    },
    {
      "epoch": 5.66465096541481,
      "grad_norm": 0.6021789043845678,
      "learning_rate": 2.722927489587841e-05,
      "loss": 1.194,
      "num_input_tokens_seen": 42009377424,
      "step": 53395
    },
    {
      "epoch": 5.664757054954381,
      "grad_norm": 0.6832895998498482,
      "learning_rate": 2.7228582694721756e-05,
      "loss": 1.1628,
      "num_input_tokens_seen": 42010164160,
      "step": 53396
    },
    {
      "epoch": 5.664863144493953,
      "grad_norm": 0.8623729656068597,
      "learning_rate": 2.722789049184291e-05,
      "loss": 1.3279,
      "num_input_tokens_seen": 42010950976,
      "step": 53397
    },
    {
      "epoch": 5.664969234033524,
      "grad_norm": 0.6202595332263889,
      "learning_rate": 2.7227198287242422e-05,
      "loss": 1.1626,
      "num_input_tokens_seen": 42011737712,
      "step": 53398
    },
    {
      "epoch": 5.665075323573095,
      "grad_norm": 0.6834553553129744,
      "learning_rate": 2.7226506080920816e-05,
      "loss": 1.1749,
      "num_input_tokens_seen": 42012524432,
      "step": 53399
    },
    {
      "epoch": 5.665181413112667,
      "grad_norm": 0.8893673955494673,
      "learning_rate": 2.7225813872878635e-05,
      "loss": 1.2216,
      "num_input_tokens_seen": 42013311216,
      "step": 53400
    },
    {
      "epoch": 5.665287502652238,
      "grad_norm": 0.5548137885886031,
      "learning_rate": 2.7225121663116414e-05,
      "loss": 1.1729,
      "num_input_tokens_seen": 42014097984,
      "step": 53401
    },
    {
      "epoch": 5.66539359219181,
      "grad_norm": 0.9193142940097921,
      "learning_rate": 2.7224429451634677e-05,
      "loss": 1.1593,
      "num_input_tokens_seen": 42014884656,
      "step": 53402
    },
    {
      "epoch": 5.665499681731381,
      "grad_norm": 0.9565061970637234,
      "learning_rate": 2.722373723843397e-05,
      "loss": 1.1941,
      "num_input_tokens_seen": 42015671360,
      "step": 53403
    },
    {
      "epoch": 5.665605771270952,
      "grad_norm": 0.6481944601020608,
      "learning_rate": 2.722304502351482e-05,
      "loss": 1.1574,
      "num_input_tokens_seen": 42016458208,
      "step": 53404
    },
    {
      "epoch": 5.665711860810524,
      "grad_norm": 1.1881468008175415,
      "learning_rate": 2.7222352806877772e-05,
      "loss": 1.1195,
      "num_input_tokens_seen": 42017244960,
      "step": 53405
    },
    {
      "epoch": 5.665817950350095,
      "grad_norm": 0.6824961995732485,
      "learning_rate": 2.722166058852336e-05,
      "loss": 1.0889,
      "num_input_tokens_seen": 42018031712,
      "step": 53406
    },
    {
      "epoch": 5.665924039889667,
      "grad_norm": 0.6090705956650374,
      "learning_rate": 2.72209683684521e-05,
      "loss": 1.0949,
      "num_input_tokens_seen": 42018818448,
      "step": 53407
    },
    {
      "epoch": 5.666030129429238,
      "grad_norm": 0.8869954998814679,
      "learning_rate": 2.7220276146664546e-05,
      "loss": 1.1836,
      "num_input_tokens_seen": 42019605200,
      "step": 53408
    },
    {
      "epoch": 5.66613621896881,
      "grad_norm": 0.7440304462126227,
      "learning_rate": 2.721958392316123e-05,
      "loss": 1.202,
      "num_input_tokens_seen": 42020392000,
      "step": 53409
    },
    {
      "epoch": 5.666242308508381,
      "grad_norm": 0.6466423281612682,
      "learning_rate": 2.7218891697942684e-05,
      "loss": 1.1121,
      "num_input_tokens_seen": 42021178816,
      "step": 53410
    },
    {
      "epoch": 5.666348398047952,
      "grad_norm": 1.0768116153624157,
      "learning_rate": 2.7218199471009442e-05,
      "loss": 1.2206,
      "num_input_tokens_seen": 42021965424,
      "step": 53411
    },
    {
      "epoch": 5.666454487587524,
      "grad_norm": 0.6502098297376989,
      "learning_rate": 2.7217507242362046e-05,
      "loss": 1.1974,
      "num_input_tokens_seen": 42022752048,
      "step": 53412
    },
    {
      "epoch": 5.666560577127095,
      "grad_norm": 0.617962930176361,
      "learning_rate": 2.721681501200101e-05,
      "loss": 1.145,
      "num_input_tokens_seen": 42023538848,
      "step": 53413
    },
    {
      "epoch": 5.666666666666667,
      "grad_norm": 0.8186901134252232,
      "learning_rate": 2.72161227799269e-05,
      "loss": 1.2044,
      "num_input_tokens_seen": 42024325632,
      "step": 53414
    },
    {
      "epoch": 5.666772756206238,
      "grad_norm": 0.7474952066156655,
      "learning_rate": 2.7215430546140236e-05,
      "loss": 1.2141,
      "num_input_tokens_seen": 42025112352,
      "step": 53415
    },
    {
      "epoch": 5.66687884574581,
      "grad_norm": 0.5695990021809437,
      "learning_rate": 2.721473831064154e-05,
      "loss": 1.1284,
      "num_input_tokens_seen": 42025899200,
      "step": 53416
    },
    {
      "epoch": 5.666984935285381,
      "grad_norm": 0.7027242417218557,
      "learning_rate": 2.721404607343137e-05,
      "loss": 1.1009,
      "num_input_tokens_seen": 42026685936,
      "step": 53417
    },
    {
      "epoch": 5.667091024824952,
      "grad_norm": 0.8516195747467027,
      "learning_rate": 2.7213353834510247e-05,
      "loss": 1.1432,
      "num_input_tokens_seen": 42027472624,
      "step": 53418
    },
    {
      "epoch": 5.667197114364524,
      "grad_norm": 0.6247734877400459,
      "learning_rate": 2.7212661593878707e-05,
      "loss": 1.107,
      "num_input_tokens_seen": 42028259360,
      "step": 53419
    },
    {
      "epoch": 5.667303203904095,
      "grad_norm": 0.6494854507361728,
      "learning_rate": 2.7211969351537292e-05,
      "loss": 1.0824,
      "num_input_tokens_seen": 42029046144,
      "step": 53420
    },
    {
      "epoch": 5.667409293443667,
      "grad_norm": 0.7046070815599187,
      "learning_rate": 2.721127710748652e-05,
      "loss": 1.1637,
      "num_input_tokens_seen": 42029832880,
      "step": 53421
    },
    {
      "epoch": 5.667515382983238,
      "grad_norm": 0.5345333631585529,
      "learning_rate": 2.7210584861726952e-05,
      "loss": 1.0738,
      "num_input_tokens_seen": 42030619648,
      "step": 53422
    },
    {
      "epoch": 5.667621472522809,
      "grad_norm": 0.6723854089580235,
      "learning_rate": 2.7209892614259108e-05,
      "loss": 1.1205,
      "num_input_tokens_seen": 42031406432,
      "step": 53423
    },
    {
      "epoch": 5.667727562062381,
      "grad_norm": 0.6585473844566877,
      "learning_rate": 2.7209200365083516e-05,
      "loss": 1.068,
      "num_input_tokens_seen": 42032193264,
      "step": 53424
    },
    {
      "epoch": 5.667833651601952,
      "grad_norm": 0.7605130560626241,
      "learning_rate": 2.720850811420072e-05,
      "loss": 1.1461,
      "num_input_tokens_seen": 42032980096,
      "step": 53425
    },
    {
      "epoch": 5.667939741141524,
      "grad_norm": 0.6911619056355607,
      "learning_rate": 2.7207815861611257e-05,
      "loss": 1.118,
      "num_input_tokens_seen": 42033766800,
      "step": 53426
    },
    {
      "epoch": 5.668045830681095,
      "grad_norm": 0.7405803174826115,
      "learning_rate": 2.7207123607315656e-05,
      "loss": 1.2462,
      "num_input_tokens_seen": 42034553472,
      "step": 53427
    },
    {
      "epoch": 5.668151920220666,
      "grad_norm": 0.593569630157385,
      "learning_rate": 2.720643135131446e-05,
      "loss": 1.1257,
      "num_input_tokens_seen": 42035340224,
      "step": 53428
    },
    {
      "epoch": 5.668258009760238,
      "grad_norm": 0.6252372830019257,
      "learning_rate": 2.7205739093608196e-05,
      "loss": 1.1601,
      "num_input_tokens_seen": 42036126912,
      "step": 53429
    },
    {
      "epoch": 5.668364099299809,
      "grad_norm": 0.5616521184544518,
      "learning_rate": 2.7205046834197397e-05,
      "loss": 1.2055,
      "num_input_tokens_seen": 42036913696,
      "step": 53430
    },
    {
      "epoch": 5.668470188839381,
      "grad_norm": 0.8618554104108507,
      "learning_rate": 2.7204354573082608e-05,
      "loss": 1.1929,
      "num_input_tokens_seen": 42037700544,
      "step": 53431
    },
    {
      "epoch": 5.668576278378952,
      "grad_norm": 0.6172157481361614,
      "learning_rate": 2.7203662310264355e-05,
      "loss": 1.1081,
      "num_input_tokens_seen": 42038487328,
      "step": 53432
    },
    {
      "epoch": 5.668682367918523,
      "grad_norm": 0.6755281390583678,
      "learning_rate": 2.7202970045743176e-05,
      "loss": 1.1157,
      "num_input_tokens_seen": 42039274112,
      "step": 53433
    },
    {
      "epoch": 5.668788457458095,
      "grad_norm": 0.5102087209615032,
      "learning_rate": 2.720227777951961e-05,
      "loss": 1.0827,
      "num_input_tokens_seen": 42040060928,
      "step": 53434
    },
    {
      "epoch": 5.668894546997666,
      "grad_norm": 0.6927514303760673,
      "learning_rate": 2.7201585511594185e-05,
      "loss": 1.099,
      "num_input_tokens_seen": 42040847728,
      "step": 53435
    },
    {
      "epoch": 5.669000636537238,
      "grad_norm": 0.6330918225765585,
      "learning_rate": 2.720089324196744e-05,
      "loss": 1.2206,
      "num_input_tokens_seen": 42041634480,
      "step": 53436
    },
    {
      "epoch": 5.669106726076809,
      "grad_norm": 0.6526234647330689,
      "learning_rate": 2.720020097063991e-05,
      "loss": 1.2345,
      "num_input_tokens_seen": 42042421200,
      "step": 53437
    },
    {
      "epoch": 5.669212815616381,
      "grad_norm": 0.516283645633999,
      "learning_rate": 2.7199508697612132e-05,
      "loss": 1.0429,
      "num_input_tokens_seen": 42043207968,
      "step": 53438
    },
    {
      "epoch": 5.669318905155952,
      "grad_norm": 0.7730717683504034,
      "learning_rate": 2.7198816422884633e-05,
      "loss": 1.2114,
      "num_input_tokens_seen": 42043994704,
      "step": 53439
    },
    {
      "epoch": 5.669424994695523,
      "grad_norm": 0.6962052682456102,
      "learning_rate": 2.719812414645796e-05,
      "loss": 1.0826,
      "num_input_tokens_seen": 42044781600,
      "step": 53440
    },
    {
      "epoch": 5.6695310842350946,
      "grad_norm": 0.7124750250187286,
      "learning_rate": 2.7197431868332634e-05,
      "loss": 1.1757,
      "num_input_tokens_seen": 42045568352,
      "step": 53441
    },
    {
      "epoch": 5.669637173774666,
      "grad_norm": 0.7851993453760648,
      "learning_rate": 2.71967395885092e-05,
      "loss": 1.1822,
      "num_input_tokens_seen": 42046355120,
      "step": 53442
    },
    {
      "epoch": 5.6697432633142375,
      "grad_norm": 0.5837617508498525,
      "learning_rate": 2.7196047306988193e-05,
      "loss": 1.1312,
      "num_input_tokens_seen": 42047141984,
      "step": 53443
    },
    {
      "epoch": 5.6698493528538085,
      "grad_norm": 0.6649242403341682,
      "learning_rate": 2.7195355023770137e-05,
      "loss": 1.191,
      "num_input_tokens_seen": 42047928736,
      "step": 53444
    },
    {
      "epoch": 5.6699554423933805,
      "grad_norm": 0.625724129041654,
      "learning_rate": 2.7194662738855576e-05,
      "loss": 1.1082,
      "num_input_tokens_seen": 42048715408,
      "step": 53445
    },
    {
      "epoch": 5.6700615319329515,
      "grad_norm": 0.5491277868679542,
      "learning_rate": 2.7193970452245048e-05,
      "loss": 1.1553,
      "num_input_tokens_seen": 42049502096,
      "step": 53446
    },
    {
      "epoch": 5.6701676214725225,
      "grad_norm": 0.6875396016708101,
      "learning_rate": 2.7193278163939086e-05,
      "loss": 1.1547,
      "num_input_tokens_seen": 42050288864,
      "step": 53447
    },
    {
      "epoch": 5.670273711012094,
      "grad_norm": 0.5926581614296461,
      "learning_rate": 2.719258587393822e-05,
      "loss": 1.193,
      "num_input_tokens_seen": 42051075536,
      "step": 53448
    },
    {
      "epoch": 5.6703798005516655,
      "grad_norm": 0.7515824503919702,
      "learning_rate": 2.7191893582242995e-05,
      "loss": 1.0934,
      "num_input_tokens_seen": 42051862320,
      "step": 53449
    },
    {
      "epoch": 5.670485890091237,
      "grad_norm": 0.6079083735270252,
      "learning_rate": 2.719120128885393e-05,
      "loss": 1.13,
      "num_input_tokens_seen": 42052649168,
      "step": 53450
    },
    {
      "epoch": 5.670591979630808,
      "grad_norm": 0.8061408224419089,
      "learning_rate": 2.7190508993771568e-05,
      "loss": 1.1539,
      "num_input_tokens_seen": 42053435904,
      "step": 53451
    },
    {
      "epoch": 5.670698069170379,
      "grad_norm": 0.5340943874104069,
      "learning_rate": 2.7189816696996455e-05,
      "loss": 1.0987,
      "num_input_tokens_seen": 42054222704,
      "step": 53452
    },
    {
      "epoch": 5.670804158709951,
      "grad_norm": 0.77178501948368,
      "learning_rate": 2.7189124398529103e-05,
      "loss": 1.15,
      "num_input_tokens_seen": 42055009440,
      "step": 53453
    },
    {
      "epoch": 5.670910248249522,
      "grad_norm": 0.8807829797902573,
      "learning_rate": 2.718843209837007e-05,
      "loss": 1.2053,
      "num_input_tokens_seen": 42055796224,
      "step": 53454
    },
    {
      "epoch": 5.671016337789094,
      "grad_norm": 0.8054281794963412,
      "learning_rate": 2.7187739796519877e-05,
      "loss": 1.1606,
      "num_input_tokens_seen": 42056582928,
      "step": 53455
    },
    {
      "epoch": 5.671122427328665,
      "grad_norm": 1.0755282963959167,
      "learning_rate": 2.718704749297906e-05,
      "loss": 1.2459,
      "num_input_tokens_seen": 42057369712,
      "step": 53456
    },
    {
      "epoch": 5.671228516868236,
      "grad_norm": 0.6740870182946839,
      "learning_rate": 2.7186355187748164e-05,
      "loss": 1.1631,
      "num_input_tokens_seen": 42058156480,
      "step": 53457
    },
    {
      "epoch": 5.671334606407808,
      "grad_norm": 0.9794331020411915,
      "learning_rate": 2.7185662880827718e-05,
      "loss": 1.1553,
      "num_input_tokens_seen": 42058943264,
      "step": 53458
    },
    {
      "epoch": 5.671440695947379,
      "grad_norm": 0.9904849586747211,
      "learning_rate": 2.718497057221825e-05,
      "loss": 1.1533,
      "num_input_tokens_seen": 42059729968,
      "step": 53459
    },
    {
      "epoch": 5.671546785486951,
      "grad_norm": 0.6374304667025393,
      "learning_rate": 2.7184278261920297e-05,
      "loss": 1.0427,
      "num_input_tokens_seen": 42060516816,
      "step": 53460
    },
    {
      "epoch": 5.671652875026522,
      "grad_norm": 0.96507289506745,
      "learning_rate": 2.718358594993441e-05,
      "loss": 1.2633,
      "num_input_tokens_seen": 42061303616,
      "step": 53461
    },
    {
      "epoch": 5.671758964566093,
      "grad_norm": 0.7644036188140498,
      "learning_rate": 2.71828936362611e-05,
      "loss": 1.1391,
      "num_input_tokens_seen": 42062090416,
      "step": 53462
    },
    {
      "epoch": 5.671865054105665,
      "grad_norm": 0.7435109798525712,
      "learning_rate": 2.7182201320900917e-05,
      "loss": 1.2369,
      "num_input_tokens_seen": 42062877088,
      "step": 53463
    },
    {
      "epoch": 5.671971143645236,
      "grad_norm": 0.8449920911423556,
      "learning_rate": 2.7181509003854395e-05,
      "loss": 1.164,
      "num_input_tokens_seen": 42063663824,
      "step": 53464
    },
    {
      "epoch": 5.672077233184808,
      "grad_norm": 1.1892170789437724,
      "learning_rate": 2.7180816685122067e-05,
      "loss": 1.1235,
      "num_input_tokens_seen": 42064450656,
      "step": 53465
    },
    {
      "epoch": 5.672183322724379,
      "grad_norm": 0.7366811043173405,
      "learning_rate": 2.718012436470447e-05,
      "loss": 1.0853,
      "num_input_tokens_seen": 42065237312,
      "step": 53466
    },
    {
      "epoch": 5.672289412263951,
      "grad_norm": 0.8737634595013425,
      "learning_rate": 2.7179432042602132e-05,
      "loss": 1.1141,
      "num_input_tokens_seen": 42066024192,
      "step": 53467
    },
    {
      "epoch": 5.672395501803522,
      "grad_norm": 1.031582367852206,
      "learning_rate": 2.7178739718815593e-05,
      "loss": 1.2657,
      "num_input_tokens_seen": 42066810864,
      "step": 53468
    },
    {
      "epoch": 5.672501591343094,
      "grad_norm": 0.8195513861706913,
      "learning_rate": 2.7178047393345395e-05,
      "loss": 1.077,
      "num_input_tokens_seen": 42067597680,
      "step": 53469
    },
    {
      "epoch": 5.672607680882665,
      "grad_norm": 0.9508085774704214,
      "learning_rate": 2.7177355066192056e-05,
      "loss": 1.1276,
      "num_input_tokens_seen": 42068384464,
      "step": 53470
    },
    {
      "epoch": 5.672713770422236,
      "grad_norm": 1.070451323696358,
      "learning_rate": 2.717666273735613e-05,
      "loss": 1.2646,
      "num_input_tokens_seen": 42069171200,
      "step": 53471
    },
    {
      "epoch": 5.672819859961808,
      "grad_norm": 0.616325493622691,
      "learning_rate": 2.7175970406838137e-05,
      "loss": 1.1309,
      "num_input_tokens_seen": 42069958032,
      "step": 53472
    },
    {
      "epoch": 5.672925949501379,
      "grad_norm": 0.884034829866882,
      "learning_rate": 2.7175278074638616e-05,
      "loss": 1.1953,
      "num_input_tokens_seen": 42070744800,
      "step": 53473
    },
    {
      "epoch": 5.673032039040951,
      "grad_norm": 0.9751565922707087,
      "learning_rate": 2.7174585740758107e-05,
      "loss": 1.2334,
      "num_input_tokens_seen": 42071531552,
      "step": 53474
    },
    {
      "epoch": 5.673138128580522,
      "grad_norm": 0.6779684948523365,
      "learning_rate": 2.7173893405197148e-05,
      "loss": 1.2303,
      "num_input_tokens_seen": 42072318352,
      "step": 53475
    },
    {
      "epoch": 5.673244218120093,
      "grad_norm": 0.6361058273298253,
      "learning_rate": 2.7173201067956256e-05,
      "loss": 1.1508,
      "num_input_tokens_seen": 42073105120,
      "step": 53476
    },
    {
      "epoch": 5.673350307659665,
      "grad_norm": 0.9319922214962728,
      "learning_rate": 2.717250872903599e-05,
      "loss": 1.2114,
      "num_input_tokens_seen": 42073891888,
      "step": 53477
    },
    {
      "epoch": 5.673456397199236,
      "grad_norm": 0.8657661668296411,
      "learning_rate": 2.717181638843686e-05,
      "loss": 1.1591,
      "num_input_tokens_seen": 42074678624,
      "step": 53478
    },
    {
      "epoch": 5.673562486738808,
      "grad_norm": 0.6998692318627536,
      "learning_rate": 2.7171124046159423e-05,
      "loss": 1.1494,
      "num_input_tokens_seen": 42075465408,
      "step": 53479
    },
    {
      "epoch": 5.673668576278379,
      "grad_norm": 1.106418544692838,
      "learning_rate": 2.7170431702204206e-05,
      "loss": 1.1305,
      "num_input_tokens_seen": 42076252112,
      "step": 53480
    },
    {
      "epoch": 5.67377466581795,
      "grad_norm": 0.6211141218071569,
      "learning_rate": 2.7169739356571738e-05,
      "loss": 1.1909,
      "num_input_tokens_seen": 42077038848,
      "step": 53481
    },
    {
      "epoch": 5.673880755357522,
      "grad_norm": 0.6366078551582212,
      "learning_rate": 2.716904700926256e-05,
      "loss": 1.228,
      "num_input_tokens_seen": 42077825520,
      "step": 53482
    },
    {
      "epoch": 5.673986844897093,
      "grad_norm": 0.7072852335927583,
      "learning_rate": 2.7168354660277212e-05,
      "loss": 1.242,
      "num_input_tokens_seen": 42078612272,
      "step": 53483
    },
    {
      "epoch": 5.674092934436665,
      "grad_norm": 0.7967846446231471,
      "learning_rate": 2.7167662309616214e-05,
      "loss": 1.1179,
      "num_input_tokens_seen": 42079399056,
      "step": 53484
    },
    {
      "epoch": 5.674199023976236,
      "grad_norm": 0.584364338252523,
      "learning_rate": 2.716696995728012e-05,
      "loss": 1.1997,
      "num_input_tokens_seen": 42080185760,
      "step": 53485
    },
    {
      "epoch": 5.674305113515807,
      "grad_norm": 0.5847793782227277,
      "learning_rate": 2.7166277603269447e-05,
      "loss": 1.1599,
      "num_input_tokens_seen": 42080972624,
      "step": 53486
    },
    {
      "epoch": 5.674411203055379,
      "grad_norm": 0.8976684739941865,
      "learning_rate": 2.716558524758474e-05,
      "loss": 1.1924,
      "num_input_tokens_seen": 42081759440,
      "step": 53487
    },
    {
      "epoch": 5.67451729259495,
      "grad_norm": 0.6363660932363294,
      "learning_rate": 2.7164892890226535e-05,
      "loss": 1.1808,
      "num_input_tokens_seen": 42082546176,
      "step": 53488
    },
    {
      "epoch": 5.674623382134522,
      "grad_norm": 0.7524073245496765,
      "learning_rate": 2.7164200531195368e-05,
      "loss": 1.1715,
      "num_input_tokens_seen": 42083332880,
      "step": 53489
    },
    {
      "epoch": 5.674729471674093,
      "grad_norm": 0.6069089663497713,
      "learning_rate": 2.7163508170491758e-05,
      "loss": 1.0715,
      "num_input_tokens_seen": 42084119792,
      "step": 53490
    },
    {
      "epoch": 5.674835561213664,
      "grad_norm": 0.5995533751444494,
      "learning_rate": 2.716281580811626e-05,
      "loss": 1.0821,
      "num_input_tokens_seen": 42084906528,
      "step": 53491
    },
    {
      "epoch": 5.674941650753236,
      "grad_norm": 0.6474780302410805,
      "learning_rate": 2.7162123444069398e-05,
      "loss": 1.1272,
      "num_input_tokens_seen": 42085693392,
      "step": 53492
    },
    {
      "epoch": 5.675047740292807,
      "grad_norm": 0.5311484231543715,
      "learning_rate": 2.7161431078351712e-05,
      "loss": 1.084,
      "num_input_tokens_seen": 42086480080,
      "step": 53493
    },
    {
      "epoch": 5.675153829832379,
      "grad_norm": 0.6503391646601436,
      "learning_rate": 2.7160738710963734e-05,
      "loss": 1.022,
      "num_input_tokens_seen": 42087266944,
      "step": 53494
    },
    {
      "epoch": 5.67525991937195,
      "grad_norm": 0.8187961346427995,
      "learning_rate": 2.7160046341906008e-05,
      "loss": 1.1138,
      "num_input_tokens_seen": 42088053728,
      "step": 53495
    },
    {
      "epoch": 5.675366008911522,
      "grad_norm": 0.8049642905910653,
      "learning_rate": 2.7159353971179054e-05,
      "loss": 1.1739,
      "num_input_tokens_seen": 42088840464,
      "step": 53496
    },
    {
      "epoch": 5.675472098451093,
      "grad_norm": 0.8604764761367448,
      "learning_rate": 2.7158661598783418e-05,
      "loss": 1.2084,
      "num_input_tokens_seen": 42089627248,
      "step": 53497
    },
    {
      "epoch": 5.675578187990665,
      "grad_norm": 0.6596967366768607,
      "learning_rate": 2.715796922471963e-05,
      "loss": 1.2145,
      "num_input_tokens_seen": 42090414064,
      "step": 53498
    },
    {
      "epoch": 5.675684277530236,
      "grad_norm": 0.6892715151680022,
      "learning_rate": 2.7157276848988227e-05,
      "loss": 1.2014,
      "num_input_tokens_seen": 42091200784,
      "step": 53499
    },
    {
      "epoch": 5.675790367069807,
      "grad_norm": 0.6896779871065005,
      "learning_rate": 2.7156584471589747e-05,
      "loss": 1.1181,
      "num_input_tokens_seen": 42091987632,
      "step": 53500
    },
    {
      "epoch": 5.675896456609379,
      "grad_norm": 0.7792626138801648,
      "learning_rate": 2.715589209252472e-05,
      "loss": 1.1965,
      "num_input_tokens_seen": 42092774400,
      "step": 53501
    },
    {
      "epoch": 5.67600254614895,
      "grad_norm": 0.6644822539276556,
      "learning_rate": 2.7155199711793683e-05,
      "loss": 1.1653,
      "num_input_tokens_seen": 42093561152,
      "step": 53502
    },
    {
      "epoch": 5.6761086356885215,
      "grad_norm": 0.6745541337901467,
      "learning_rate": 2.7154507329397172e-05,
      "loss": 1.316,
      "num_input_tokens_seen": 42094347792,
      "step": 53503
    },
    {
      "epoch": 5.676214725228093,
      "grad_norm": 0.7502948325769502,
      "learning_rate": 2.715381494533572e-05,
      "loss": 1.1232,
      "num_input_tokens_seen": 42095134544,
      "step": 53504
    },
    {
      "epoch": 5.676320814767664,
      "grad_norm": 0.7149980837621647,
      "learning_rate": 2.7153122559609856e-05,
      "loss": 1.1901,
      "num_input_tokens_seen": 42095921264,
      "step": 53505
    },
    {
      "epoch": 5.6764269043072355,
      "grad_norm": 0.7407026257074417,
      "learning_rate": 2.7152430172220135e-05,
      "loss": 1.174,
      "num_input_tokens_seen": 42096708032,
      "step": 53506
    },
    {
      "epoch": 5.6765329938468065,
      "grad_norm": 0.862366673608232,
      "learning_rate": 2.7151737783167064e-05,
      "loss": 1.1655,
      "num_input_tokens_seen": 42097494816,
      "step": 53507
    },
    {
      "epoch": 5.6766390833863785,
      "grad_norm": 0.9668361035587922,
      "learning_rate": 2.7151045392451203e-05,
      "loss": 1.228,
      "num_input_tokens_seen": 42098281600,
      "step": 53508
    },
    {
      "epoch": 5.6767451729259495,
      "grad_norm": 0.5769692746292427,
      "learning_rate": 2.715035300007308e-05,
      "loss": 1.0078,
      "num_input_tokens_seen": 42099068480,
      "step": 53509
    },
    {
      "epoch": 5.6768512624655205,
      "grad_norm": 0.8329431390946307,
      "learning_rate": 2.7149660606033218e-05,
      "loss": 1.0376,
      "num_input_tokens_seen": 42099855264,
      "step": 53510
    },
    {
      "epoch": 5.676957352005092,
      "grad_norm": 0.9825075236691098,
      "learning_rate": 2.7148968210332172e-05,
      "loss": 1.08,
      "num_input_tokens_seen": 42100642080,
      "step": 53511
    },
    {
      "epoch": 5.6770634415446635,
      "grad_norm": 0.7040420664936469,
      "learning_rate": 2.714827581297046e-05,
      "loss": 1.2265,
      "num_input_tokens_seen": 42101428832,
      "step": 53512
    },
    {
      "epoch": 5.677169531084235,
      "grad_norm": 0.9519380110134639,
      "learning_rate": 2.7147583413948617e-05,
      "loss": 1.1662,
      "num_input_tokens_seen": 42102215648,
      "step": 53513
    },
    {
      "epoch": 5.677275620623806,
      "grad_norm": 0.5891735662069029,
      "learning_rate": 2.7146891013267194e-05,
      "loss": 1.1568,
      "num_input_tokens_seen": 42103002432,
      "step": 53514
    },
    {
      "epoch": 5.6773817101633774,
      "grad_norm": 0.6448491914934078,
      "learning_rate": 2.714619861092672e-05,
      "loss": 1.1735,
      "num_input_tokens_seen": 42103789184,
      "step": 53515
    },
    {
      "epoch": 5.677487799702949,
      "grad_norm": 0.6990930686326493,
      "learning_rate": 2.714550620692772e-05,
      "loss": 1.1849,
      "num_input_tokens_seen": 42104575984,
      "step": 53516
    },
    {
      "epoch": 5.67759388924252,
      "grad_norm": 0.5436454576291646,
      "learning_rate": 2.7144813801270736e-05,
      "loss": 1.1157,
      "num_input_tokens_seen": 42105362768,
      "step": 53517
    },
    {
      "epoch": 5.677699978782092,
      "grad_norm": 0.7961441692410293,
      "learning_rate": 2.7144121393956305e-05,
      "loss": 1.1321,
      "num_input_tokens_seen": 42106149488,
      "step": 53518
    },
    {
      "epoch": 5.677806068321663,
      "grad_norm": 0.6089322692444422,
      "learning_rate": 2.7143428984984953e-05,
      "loss": 1.2018,
      "num_input_tokens_seen": 42106936256,
      "step": 53519
    },
    {
      "epoch": 5.677912157861235,
      "grad_norm": 0.5142355520199677,
      "learning_rate": 2.714273657435723e-05,
      "loss": 1.1085,
      "num_input_tokens_seen": 42107723072,
      "step": 53520
    },
    {
      "epoch": 5.678018247400806,
      "grad_norm": 0.7683030174072981,
      "learning_rate": 2.7142044162073665e-05,
      "loss": 1.2425,
      "num_input_tokens_seen": 42108509872,
      "step": 53521
    },
    {
      "epoch": 5.678124336940377,
      "grad_norm": 0.6565506080143167,
      "learning_rate": 2.714135174813478e-05,
      "loss": 1.1908,
      "num_input_tokens_seen": 42109296480,
      "step": 53522
    },
    {
      "epoch": 5.678230426479949,
      "grad_norm": 0.6007014808821404,
      "learning_rate": 2.7140659332541134e-05,
      "loss": 1.2076,
      "num_input_tokens_seen": 42110083200,
      "step": 53523
    },
    {
      "epoch": 5.67833651601952,
      "grad_norm": 0.6752956679789331,
      "learning_rate": 2.7139966915293237e-05,
      "loss": 1.1165,
      "num_input_tokens_seen": 42110870032,
      "step": 53524
    },
    {
      "epoch": 5.678442605559092,
      "grad_norm": 0.941042498763087,
      "learning_rate": 2.713927449639165e-05,
      "loss": 1.1706,
      "num_input_tokens_seen": 42111656848,
      "step": 53525
    },
    {
      "epoch": 5.678548695098663,
      "grad_norm": 0.6361715369746438,
      "learning_rate": 2.713858207583688e-05,
      "loss": 1.2174,
      "num_input_tokens_seen": 42112443680,
      "step": 53526
    },
    {
      "epoch": 5.678654784638235,
      "grad_norm": 0.8211692179489516,
      "learning_rate": 2.7137889653629484e-05,
      "loss": 1.2475,
      "num_input_tokens_seen": 42113230416,
      "step": 53527
    },
    {
      "epoch": 5.678760874177806,
      "grad_norm": 0.562696278780577,
      "learning_rate": 2.7137197229769996e-05,
      "loss": 1.1469,
      "num_input_tokens_seen": 42114017168,
      "step": 53528
    },
    {
      "epoch": 5.678866963717377,
      "grad_norm": 0.6521553459430262,
      "learning_rate": 2.7136504804258933e-05,
      "loss": 1.1277,
      "num_input_tokens_seen": 42114803920,
      "step": 53529
    },
    {
      "epoch": 5.678973053256949,
      "grad_norm": 0.6118497259691394,
      "learning_rate": 2.7135812377096847e-05,
      "loss": 1.1573,
      "num_input_tokens_seen": 42115590640,
      "step": 53530
    },
    {
      "epoch": 5.67907914279652,
      "grad_norm": 0.7678790144156924,
      "learning_rate": 2.713511994828427e-05,
      "loss": 1.1114,
      "num_input_tokens_seen": 42116377440,
      "step": 53531
    },
    {
      "epoch": 5.679185232336092,
      "grad_norm": 0.746151325721264,
      "learning_rate": 2.713442751782173e-05,
      "loss": 1.163,
      "num_input_tokens_seen": 42117164208,
      "step": 53532
    },
    {
      "epoch": 5.679291321875663,
      "grad_norm": 0.7393309899821525,
      "learning_rate": 2.7133735085709766e-05,
      "loss": 1.2021,
      "num_input_tokens_seen": 42117950928,
      "step": 53533
    },
    {
      "epoch": 5.679397411415234,
      "grad_norm": 0.9212988252431582,
      "learning_rate": 2.713304265194892e-05,
      "loss": 1.2059,
      "num_input_tokens_seen": 42118737680,
      "step": 53534
    },
    {
      "epoch": 5.679503500954806,
      "grad_norm": 0.5968592372649469,
      "learning_rate": 2.7132350216539725e-05,
      "loss": 1.232,
      "num_input_tokens_seen": 42119524448,
      "step": 53535
    },
    {
      "epoch": 5.679609590494377,
      "grad_norm": 0.6199146613374751,
      "learning_rate": 2.71316577794827e-05,
      "loss": 1.1018,
      "num_input_tokens_seen": 42120311216,
      "step": 53536
    },
    {
      "epoch": 5.679715680033949,
      "grad_norm": 0.9285452902764126,
      "learning_rate": 2.7130965340778403e-05,
      "loss": 1.1227,
      "num_input_tokens_seen": 42121097936,
      "step": 53537
    },
    {
      "epoch": 5.67982176957352,
      "grad_norm": 0.7194799092823244,
      "learning_rate": 2.713027290042735e-05,
      "loss": 1.0879,
      "num_input_tokens_seen": 42121884704,
      "step": 53538
    },
    {
      "epoch": 5.679927859113091,
      "grad_norm": 0.8523436469249367,
      "learning_rate": 2.7129580458430088e-05,
      "loss": 1.1619,
      "num_input_tokens_seen": 42122671376,
      "step": 53539
    },
    {
      "epoch": 5.680033948652663,
      "grad_norm": 0.7665752120245443,
      "learning_rate": 2.7128888014787146e-05,
      "loss": 1.1027,
      "num_input_tokens_seen": 42123458256,
      "step": 53540
    },
    {
      "epoch": 5.680140038192234,
      "grad_norm": 0.9894056673093696,
      "learning_rate": 2.712819556949907e-05,
      "loss": 1.1707,
      "num_input_tokens_seen": 42124244976,
      "step": 53541
    },
    {
      "epoch": 5.680246127731806,
      "grad_norm": 0.9081217736238403,
      "learning_rate": 2.7127503122566378e-05,
      "loss": 1.0898,
      "num_input_tokens_seen": 42125031712,
      "step": 53542
    },
    {
      "epoch": 5.680352217271377,
      "grad_norm": 0.6774872337507658,
      "learning_rate": 2.7126810673989615e-05,
      "loss": 1.1784,
      "num_input_tokens_seen": 42125818480,
      "step": 53543
    },
    {
      "epoch": 5.680458306810948,
      "grad_norm": 1.0631152794237066,
      "learning_rate": 2.7126118223769327e-05,
      "loss": 1.1336,
      "num_input_tokens_seen": 42126605296,
      "step": 53544
    },
    {
      "epoch": 5.68056439635052,
      "grad_norm": 1.2340808619943286,
      "learning_rate": 2.7125425771906022e-05,
      "loss": 1.1229,
      "num_input_tokens_seen": 42127392064,
      "step": 53545
    },
    {
      "epoch": 5.680670485890091,
      "grad_norm": 0.8020253078709592,
      "learning_rate": 2.712473331840026e-05,
      "loss": 1.1683,
      "num_input_tokens_seen": 42128178960,
      "step": 53546
    },
    {
      "epoch": 5.680776575429663,
      "grad_norm": 0.9174090828061281,
      "learning_rate": 2.7124040863252564e-05,
      "loss": 1.2292,
      "num_input_tokens_seen": 42128965664,
      "step": 53547
    },
    {
      "epoch": 5.680882664969234,
      "grad_norm": 0.7842674995980664,
      "learning_rate": 2.7123348406463467e-05,
      "loss": 1.1374,
      "num_input_tokens_seen": 42129752352,
      "step": 53548
    },
    {
      "epoch": 5.680988754508806,
      "grad_norm": 0.7151476380523116,
      "learning_rate": 2.7122655948033516e-05,
      "loss": 1.0959,
      "num_input_tokens_seen": 42130539104,
      "step": 53549
    },
    {
      "epoch": 5.681094844048377,
      "grad_norm": 0.7518396799193238,
      "learning_rate": 2.712196348796323e-05,
      "loss": 1.1275,
      "num_input_tokens_seen": 42131325888,
      "step": 53550
    },
    {
      "epoch": 5.681200933587948,
      "grad_norm": 0.6519998083823997,
      "learning_rate": 2.7121271026253157e-05,
      "loss": 1.2653,
      "num_input_tokens_seen": 42132112624,
      "step": 53551
    },
    {
      "epoch": 5.68130702312752,
      "grad_norm": 0.6775867223286244,
      "learning_rate": 2.712057856290383e-05,
      "loss": 1.093,
      "num_input_tokens_seen": 42132899360,
      "step": 53552
    },
    {
      "epoch": 5.681413112667091,
      "grad_norm": 0.7357256160857272,
      "learning_rate": 2.711988609791578e-05,
      "loss": 1.2391,
      "num_input_tokens_seen": 42133686096,
      "step": 53553
    },
    {
      "epoch": 5.681519202206663,
      "grad_norm": 0.675833195325274,
      "learning_rate": 2.7119193631289546e-05,
      "loss": 1.1438,
      "num_input_tokens_seen": 42134472912,
      "step": 53554
    },
    {
      "epoch": 5.681625291746234,
      "grad_norm": 0.9048214109900498,
      "learning_rate": 2.7118501163025667e-05,
      "loss": 1.2119,
      "num_input_tokens_seen": 42135259680,
      "step": 53555
    },
    {
      "epoch": 5.681731381285806,
      "grad_norm": 0.6109395513566642,
      "learning_rate": 2.7117808693124664e-05,
      "loss": 1.1184,
      "num_input_tokens_seen": 42136046496,
      "step": 53556
    },
    {
      "epoch": 5.681837470825377,
      "grad_norm": 0.9195500545047212,
      "learning_rate": 2.711711622158708e-05,
      "loss": 1.079,
      "num_input_tokens_seen": 42136833248,
      "step": 53557
    },
    {
      "epoch": 5.681943560364948,
      "grad_norm": 0.870165823835777,
      "learning_rate": 2.7116423748413457e-05,
      "loss": 1.1999,
      "num_input_tokens_seen": 42137619984,
      "step": 53558
    },
    {
      "epoch": 5.68204964990452,
      "grad_norm": 0.5641429702115373,
      "learning_rate": 2.7115731273604317e-05,
      "loss": 1.1309,
      "num_input_tokens_seen": 42138406720,
      "step": 53559
    },
    {
      "epoch": 5.682155739444091,
      "grad_norm": 0.8371472412744054,
      "learning_rate": 2.7115038797160207e-05,
      "loss": 1.1108,
      "num_input_tokens_seen": 42139193424,
      "step": 53560
    },
    {
      "epoch": 5.682261828983663,
      "grad_norm": 0.9300537867501643,
      "learning_rate": 2.7114346319081656e-05,
      "loss": 1.1165,
      "num_input_tokens_seen": 42139980176,
      "step": 53561
    },
    {
      "epoch": 5.682367918523234,
      "grad_norm": 0.6477614894064878,
      "learning_rate": 2.7113653839369195e-05,
      "loss": 1.1376,
      "num_input_tokens_seen": 42140766896,
      "step": 53562
    },
    {
      "epoch": 5.682474008062805,
      "grad_norm": 0.7880404516127226,
      "learning_rate": 2.7112961358023374e-05,
      "loss": 1.1952,
      "num_input_tokens_seen": 42141553728,
      "step": 53563
    },
    {
      "epoch": 5.682580097602377,
      "grad_norm": 1.0321447335105494,
      "learning_rate": 2.7112268875044717e-05,
      "loss": 1.2589,
      "num_input_tokens_seen": 42142340432,
      "step": 53564
    },
    {
      "epoch": 5.682686187141948,
      "grad_norm": 0.707278232784874,
      "learning_rate": 2.7111576390433753e-05,
      "loss": 1.2165,
      "num_input_tokens_seen": 42143127248,
      "step": 53565
    },
    {
      "epoch": 5.6827922766815195,
      "grad_norm": 0.866166765094339,
      "learning_rate": 2.711088390419103e-05,
      "loss": 1.1524,
      "num_input_tokens_seen": 42143914048,
      "step": 53566
    },
    {
      "epoch": 5.682898366221091,
      "grad_norm": 0.94284042416007,
      "learning_rate": 2.7110191416317072e-05,
      "loss": 1.1632,
      "num_input_tokens_seen": 42144700848,
      "step": 53567
    },
    {
      "epoch": 5.683004455760662,
      "grad_norm": 0.8733752529876254,
      "learning_rate": 2.7109498926812426e-05,
      "loss": 1.1597,
      "num_input_tokens_seen": 42145487616,
      "step": 53568
    },
    {
      "epoch": 5.6831105453002335,
      "grad_norm": 0.7837341976456157,
      "learning_rate": 2.710880643567762e-05,
      "loss": 1.1167,
      "num_input_tokens_seen": 42146274368,
      "step": 53569
    },
    {
      "epoch": 5.6832166348398045,
      "grad_norm": 0.9970250030900918,
      "learning_rate": 2.710811394291319e-05,
      "loss": 1.1084,
      "num_input_tokens_seen": 42147061168,
      "step": 53570
    },
    {
      "epoch": 5.6833227243793765,
      "grad_norm": 0.7426429649866667,
      "learning_rate": 2.710742144851967e-05,
      "loss": 1.1073,
      "num_input_tokens_seen": 42147847888,
      "step": 53571
    },
    {
      "epoch": 5.6834288139189475,
      "grad_norm": 0.7410368356441109,
      "learning_rate": 2.71067289524976e-05,
      "loss": 1.1315,
      "num_input_tokens_seen": 42148634608,
      "step": 53572
    },
    {
      "epoch": 5.6835349034585185,
      "grad_norm": 0.9550231894403776,
      "learning_rate": 2.7106036454847507e-05,
      "loss": 1.1874,
      "num_input_tokens_seen": 42149421360,
      "step": 53573
    },
    {
      "epoch": 5.6836409929980904,
      "grad_norm": 0.6400205612411679,
      "learning_rate": 2.7105343955569934e-05,
      "loss": 1.1702,
      "num_input_tokens_seen": 42150208160,
      "step": 53574
    },
    {
      "epoch": 5.6837470825376615,
      "grad_norm": 0.8540382778313416,
      "learning_rate": 2.7104651454665413e-05,
      "loss": 1.1432,
      "num_input_tokens_seen": 42150994944,
      "step": 53575
    },
    {
      "epoch": 5.683853172077233,
      "grad_norm": 0.9593254007082824,
      "learning_rate": 2.7103958952134478e-05,
      "loss": 1.2206,
      "num_input_tokens_seen": 42151781712,
      "step": 53576
    },
    {
      "epoch": 5.683959261616804,
      "grad_norm": 0.6265770968947895,
      "learning_rate": 2.7103266447977666e-05,
      "loss": 1.1572,
      "num_input_tokens_seen": 42152568480,
      "step": 53577
    },
    {
      "epoch": 5.684065351156376,
      "grad_norm": 0.924522936428986,
      "learning_rate": 2.7102573942195513e-05,
      "loss": 1.1306,
      "num_input_tokens_seen": 42153355280,
      "step": 53578
    },
    {
      "epoch": 5.684171440695947,
      "grad_norm": 0.6759784103526314,
      "learning_rate": 2.7101881434788544e-05,
      "loss": 1.1638,
      "num_input_tokens_seen": 42154142032,
      "step": 53579
    },
    {
      "epoch": 5.684277530235518,
      "grad_norm": 0.658221790827829,
      "learning_rate": 2.7101188925757315e-05,
      "loss": 1.1707,
      "num_input_tokens_seen": 42154928848,
      "step": 53580
    },
    {
      "epoch": 5.68438361977509,
      "grad_norm": 0.9148149406699274,
      "learning_rate": 2.7100496415102338e-05,
      "loss": 1.1138,
      "num_input_tokens_seen": 42155715728,
      "step": 53581
    },
    {
      "epoch": 5.684489709314661,
      "grad_norm": 0.6692334044400352,
      "learning_rate": 2.7099803902824167e-05,
      "loss": 1.2017,
      "num_input_tokens_seen": 42156502448,
      "step": 53582
    },
    {
      "epoch": 5.684595798854233,
      "grad_norm": 0.7006681205938159,
      "learning_rate": 2.7099111388923326e-05,
      "loss": 1.1591,
      "num_input_tokens_seen": 42157289168,
      "step": 53583
    },
    {
      "epoch": 5.684701888393804,
      "grad_norm": 0.6037573780999049,
      "learning_rate": 2.7098418873400355e-05,
      "loss": 1.1584,
      "num_input_tokens_seen": 42158075856,
      "step": 53584
    },
    {
      "epoch": 5.684807977933376,
      "grad_norm": 1.0918285786612338,
      "learning_rate": 2.7097726356255787e-05,
      "loss": 1.128,
      "num_input_tokens_seen": 42158862560,
      "step": 53585
    },
    {
      "epoch": 5.684914067472947,
      "grad_norm": 0.5406504873968296,
      "learning_rate": 2.709703383749016e-05,
      "loss": 1.017,
      "num_input_tokens_seen": 42159649440,
      "step": 53586
    },
    {
      "epoch": 5.685020157012518,
      "grad_norm": 0.7210562284433822,
      "learning_rate": 2.7096341317103994e-05,
      "loss": 1.1635,
      "num_input_tokens_seen": 42160436272,
      "step": 53587
    },
    {
      "epoch": 5.68512624655209,
      "grad_norm": 0.9748533065428702,
      "learning_rate": 2.7095648795097844e-05,
      "loss": 1.1935,
      "num_input_tokens_seen": 42161223120,
      "step": 53588
    },
    {
      "epoch": 5.685232336091661,
      "grad_norm": 0.6257980077217715,
      "learning_rate": 2.7094956271472244e-05,
      "loss": 1.2149,
      "num_input_tokens_seen": 42162009872,
      "step": 53589
    },
    {
      "epoch": 5.685338425631233,
      "grad_norm": 1.0152426137572281,
      "learning_rate": 2.709426374622772e-05,
      "loss": 1.1517,
      "num_input_tokens_seen": 42162796720,
      "step": 53590
    },
    {
      "epoch": 5.685444515170804,
      "grad_norm": 0.859822205461367,
      "learning_rate": 2.709357121936481e-05,
      "loss": 1.2675,
      "num_input_tokens_seen": 42163583440,
      "step": 53591
    },
    {
      "epoch": 5.685550604710375,
      "grad_norm": 0.7990216253162244,
      "learning_rate": 2.709287869088405e-05,
      "loss": 1.2668,
      "num_input_tokens_seen": 42164370192,
      "step": 53592
    },
    {
      "epoch": 5.685656694249947,
      "grad_norm": 0.6288541034968845,
      "learning_rate": 2.7092186160785972e-05,
      "loss": 1.2266,
      "num_input_tokens_seen": 42165156960,
      "step": 53593
    },
    {
      "epoch": 5.685762783789518,
      "grad_norm": 0.7890404919123887,
      "learning_rate": 2.709149362907112e-05,
      "loss": 1.0669,
      "num_input_tokens_seen": 42165943696,
      "step": 53594
    },
    {
      "epoch": 5.68586887332909,
      "grad_norm": 0.5758894643013461,
      "learning_rate": 2.709080109574002e-05,
      "loss": 1.0951,
      "num_input_tokens_seen": 42166730480,
      "step": 53595
    },
    {
      "epoch": 5.685974962868661,
      "grad_norm": 0.7728630892764295,
      "learning_rate": 2.7090108560793205e-05,
      "loss": 1.1094,
      "num_input_tokens_seen": 42167517264,
      "step": 53596
    },
    {
      "epoch": 5.686081052408232,
      "grad_norm": 0.9519210389686641,
      "learning_rate": 2.7089416024231223e-05,
      "loss": 1.2084,
      "num_input_tokens_seen": 42168304016,
      "step": 53597
    },
    {
      "epoch": 5.686187141947804,
      "grad_norm": 0.7882442344501889,
      "learning_rate": 2.70887234860546e-05,
      "loss": 1.1787,
      "num_input_tokens_seen": 42169090752,
      "step": 53598
    },
    {
      "epoch": 5.686293231487375,
      "grad_norm": 0.9069336084725305,
      "learning_rate": 2.708803094626387e-05,
      "loss": 1.1391,
      "num_input_tokens_seen": 42169877520,
      "step": 53599
    },
    {
      "epoch": 5.686399321026947,
      "grad_norm": 0.6261164622110386,
      "learning_rate": 2.7087338404859575e-05,
      "loss": 1.1192,
      "num_input_tokens_seen": 42170664368,
      "step": 53600
    },
    {
      "epoch": 5.686505410566518,
      "grad_norm": 0.6663531458190347,
      "learning_rate": 2.708664586184224e-05,
      "loss": 1.0969,
      "num_input_tokens_seen": 42171451136,
      "step": 53601
    },
    {
      "epoch": 5.686611500106089,
      "grad_norm": 0.7182261999430816,
      "learning_rate": 2.7085953317212408e-05,
      "loss": 1.216,
      "num_input_tokens_seen": 42172237936,
      "step": 53602
    },
    {
      "epoch": 5.686717589645661,
      "grad_norm": 0.8664058595297902,
      "learning_rate": 2.7085260770970622e-05,
      "loss": 1.2349,
      "num_input_tokens_seen": 42173024640,
      "step": 53603
    },
    {
      "epoch": 5.686823679185232,
      "grad_norm": 0.6307943026216298,
      "learning_rate": 2.70845682231174e-05,
      "loss": 1.1627,
      "num_input_tokens_seen": 42173811376,
      "step": 53604
    },
    {
      "epoch": 5.686929768724804,
      "grad_norm": 0.7850451725369868,
      "learning_rate": 2.708387567365328e-05,
      "loss": 1.1434,
      "num_input_tokens_seen": 42174598080,
      "step": 53605
    },
    {
      "epoch": 5.687035858264375,
      "grad_norm": 0.9112588255928462,
      "learning_rate": 2.708318312257881e-05,
      "loss": 1.1644,
      "num_input_tokens_seen": 42175384784,
      "step": 53606
    },
    {
      "epoch": 5.687141947803947,
      "grad_norm": 0.6407102652750775,
      "learning_rate": 2.7082490569894514e-05,
      "loss": 1.1425,
      "num_input_tokens_seen": 42176171488,
      "step": 53607
    },
    {
      "epoch": 5.687248037343518,
      "grad_norm": 0.7582614795585899,
      "learning_rate": 2.7081798015600927e-05,
      "loss": 1.1377,
      "num_input_tokens_seen": 42176958304,
      "step": 53608
    },
    {
      "epoch": 5.687354126883089,
      "grad_norm": 0.674456895085156,
      "learning_rate": 2.7081105459698598e-05,
      "loss": 1.1882,
      "num_input_tokens_seen": 42177745024,
      "step": 53609
    },
    {
      "epoch": 5.687460216422661,
      "grad_norm": 0.7538731640547636,
      "learning_rate": 2.708041290218804e-05,
      "loss": 1.2376,
      "num_input_tokens_seen": 42178531904,
      "step": 53610
    },
    {
      "epoch": 5.687566305962232,
      "grad_norm": 0.7239568910752247,
      "learning_rate": 2.7079720343069803e-05,
      "loss": 1.1865,
      "num_input_tokens_seen": 42179318704,
      "step": 53611
    },
    {
      "epoch": 5.687672395501804,
      "grad_norm": 0.7582875410544286,
      "learning_rate": 2.7079027782344424e-05,
      "loss": 1.2308,
      "num_input_tokens_seen": 42180105440,
      "step": 53612
    },
    {
      "epoch": 5.687778485041375,
      "grad_norm": 0.5938972664019782,
      "learning_rate": 2.707833522001243e-05,
      "loss": 1.1854,
      "num_input_tokens_seen": 42180892128,
      "step": 53613
    },
    {
      "epoch": 5.687884574580947,
      "grad_norm": 0.7575660389857582,
      "learning_rate": 2.7077642656074358e-05,
      "loss": 1.1865,
      "num_input_tokens_seen": 42181678896,
      "step": 53614
    },
    {
      "epoch": 5.687990664120518,
      "grad_norm": 0.7081344901629734,
      "learning_rate": 2.707695009053075e-05,
      "loss": 1.2294,
      "num_input_tokens_seen": 42182465616,
      "step": 53615
    },
    {
      "epoch": 5.688096753660089,
      "grad_norm": 0.5462379408510709,
      "learning_rate": 2.7076257523382132e-05,
      "loss": 1.0918,
      "num_input_tokens_seen": 42183252448,
      "step": 53616
    },
    {
      "epoch": 5.688202843199661,
      "grad_norm": 0.5803707970892179,
      "learning_rate": 2.7075564954629046e-05,
      "loss": 1.0965,
      "num_input_tokens_seen": 42184039248,
      "step": 53617
    },
    {
      "epoch": 5.688308932739232,
      "grad_norm": 0.5871037698691088,
      "learning_rate": 2.707487238427202e-05,
      "loss": 1.0754,
      "num_input_tokens_seen": 42184826144,
      "step": 53618
    },
    {
      "epoch": 5.688415022278804,
      "grad_norm": 0.6296693289817866,
      "learning_rate": 2.7074179812311595e-05,
      "loss": 1.1451,
      "num_input_tokens_seen": 42185613040,
      "step": 53619
    },
    {
      "epoch": 5.688521111818375,
      "grad_norm": 0.5713307182347679,
      "learning_rate": 2.7073487238748307e-05,
      "loss": 1.0588,
      "num_input_tokens_seen": 42186399776,
      "step": 53620
    },
    {
      "epoch": 5.688627201357946,
      "grad_norm": 0.7470418307898916,
      "learning_rate": 2.707279466358269e-05,
      "loss": 1.1527,
      "num_input_tokens_seen": 42187186592,
      "step": 53621
    },
    {
      "epoch": 5.688733290897518,
      "grad_norm": 0.8341405068667338,
      "learning_rate": 2.707210208681527e-05,
      "loss": 1.1816,
      "num_input_tokens_seen": 42187973344,
      "step": 53622
    },
    {
      "epoch": 5.688839380437089,
      "grad_norm": 0.7624151601133268,
      "learning_rate": 2.7071409508446598e-05,
      "loss": 1.1207,
      "num_input_tokens_seen": 42188760160,
      "step": 53623
    },
    {
      "epoch": 5.688945469976661,
      "grad_norm": 0.5399075822920179,
      "learning_rate": 2.7070716928477203e-05,
      "loss": 1.1242,
      "num_input_tokens_seen": 42189546896,
      "step": 53624
    },
    {
      "epoch": 5.689051559516232,
      "grad_norm": 0.6628896852775051,
      "learning_rate": 2.7070024346907608e-05,
      "loss": 1.1668,
      "num_input_tokens_seen": 42190333584,
      "step": 53625
    },
    {
      "epoch": 5.689157649055803,
      "grad_norm": 0.765980105983847,
      "learning_rate": 2.7069331763738363e-05,
      "loss": 1.157,
      "num_input_tokens_seen": 42191120256,
      "step": 53626
    },
    {
      "epoch": 5.689263738595375,
      "grad_norm": 0.6154418242191648,
      "learning_rate": 2.7068639178970002e-05,
      "loss": 1.1856,
      "num_input_tokens_seen": 42191906944,
      "step": 53627
    },
    {
      "epoch": 5.689369828134946,
      "grad_norm": 0.7018500284767597,
      "learning_rate": 2.7067946592603062e-05,
      "loss": 1.2222,
      "num_input_tokens_seen": 42192693680,
      "step": 53628
    },
    {
      "epoch": 5.6894759176745175,
      "grad_norm": 0.6604012404406824,
      "learning_rate": 2.7067254004638066e-05,
      "loss": 1.1195,
      "num_input_tokens_seen": 42193480480,
      "step": 53629
    },
    {
      "epoch": 5.689582007214089,
      "grad_norm": 0.7475897932962396,
      "learning_rate": 2.706656141507556e-05,
      "loss": 1.1658,
      "num_input_tokens_seen": 42194267232,
      "step": 53630
    },
    {
      "epoch": 5.68968809675366,
      "grad_norm": 0.6928695648629906,
      "learning_rate": 2.7065868823916073e-05,
      "loss": 1.2354,
      "num_input_tokens_seen": 42195054000,
      "step": 53631
    },
    {
      "epoch": 5.6897941862932315,
      "grad_norm": 0.7763300970108253,
      "learning_rate": 2.706517623116015e-05,
      "loss": 1.213,
      "num_input_tokens_seen": 42195840736,
      "step": 53632
    },
    {
      "epoch": 5.689900275832803,
      "grad_norm": 0.649293039804429,
      "learning_rate": 2.7064483636808313e-05,
      "loss": 1.0995,
      "num_input_tokens_seen": 42196627472,
      "step": 53633
    },
    {
      "epoch": 5.6900063653723745,
      "grad_norm": 0.6383699540674823,
      "learning_rate": 2.706379104086111e-05,
      "loss": 1.1718,
      "num_input_tokens_seen": 42197414384,
      "step": 53634
    },
    {
      "epoch": 5.6901124549119455,
      "grad_norm": 1.04736600976099,
      "learning_rate": 2.7063098443319057e-05,
      "loss": 1.3163,
      "num_input_tokens_seen": 42198201088,
      "step": 53635
    },
    {
      "epoch": 5.690218544451517,
      "grad_norm": 0.57168822557853,
      "learning_rate": 2.706240584418271e-05,
      "loss": 1.172,
      "num_input_tokens_seen": 42198987888,
      "step": 53636
    },
    {
      "epoch": 5.6903246339910885,
      "grad_norm": 0.6928409978094516,
      "learning_rate": 2.7061713243452598e-05,
      "loss": 1.131,
      "num_input_tokens_seen": 42199774624,
      "step": 53637
    },
    {
      "epoch": 5.69043072353066,
      "grad_norm": 0.9408335558116308,
      "learning_rate": 2.7061020641129252e-05,
      "loss": 1.1825,
      "num_input_tokens_seen": 42200561440,
      "step": 53638
    },
    {
      "epoch": 5.690536813070231,
      "grad_norm": 0.7016022285599216,
      "learning_rate": 2.7060328037213212e-05,
      "loss": 1.126,
      "num_input_tokens_seen": 42201348208,
      "step": 53639
    },
    {
      "epoch": 5.690642902609802,
      "grad_norm": 0.7515494971902617,
      "learning_rate": 2.7059635431705012e-05,
      "loss": 1.2134,
      "num_input_tokens_seen": 42202134896,
      "step": 53640
    },
    {
      "epoch": 5.690748992149374,
      "grad_norm": 0.7098131619777429,
      "learning_rate": 2.7058942824605183e-05,
      "loss": 1.1479,
      "num_input_tokens_seen": 42202921696,
      "step": 53641
    },
    {
      "epoch": 5.690855081688945,
      "grad_norm": 0.6267948051473876,
      "learning_rate": 2.705825021591426e-05,
      "loss": 1.1316,
      "num_input_tokens_seen": 42203708480,
      "step": 53642
    },
    {
      "epoch": 5.690961171228517,
      "grad_norm": 0.7238969840714472,
      "learning_rate": 2.7057557605632788e-05,
      "loss": 1.239,
      "num_input_tokens_seen": 42204495344,
      "step": 53643
    },
    {
      "epoch": 5.691067260768088,
      "grad_norm": 0.6263502303995969,
      "learning_rate": 2.70568649937613e-05,
      "loss": 1.1681,
      "num_input_tokens_seen": 42205282096,
      "step": 53644
    },
    {
      "epoch": 5.691173350307659,
      "grad_norm": 0.6861420858437024,
      "learning_rate": 2.7056172380300314e-05,
      "loss": 1.0839,
      "num_input_tokens_seen": 42206068848,
      "step": 53645
    },
    {
      "epoch": 5.691279439847231,
      "grad_norm": 0.6224766890136124,
      "learning_rate": 2.7055479765250386e-05,
      "loss": 1.1537,
      "num_input_tokens_seen": 42206855632,
      "step": 53646
    },
    {
      "epoch": 5.691385529386802,
      "grad_norm": 0.6416005053675745,
      "learning_rate": 2.7054787148612047e-05,
      "loss": 1.1067,
      "num_input_tokens_seen": 42207642480,
      "step": 53647
    },
    {
      "epoch": 5.691491618926374,
      "grad_norm": 0.7241918190794113,
      "learning_rate": 2.705409453038582e-05,
      "loss": 1.2941,
      "num_input_tokens_seen": 42208429312,
      "step": 53648
    },
    {
      "epoch": 5.691597708465945,
      "grad_norm": 0.7416093650133075,
      "learning_rate": 2.7053401910572257e-05,
      "loss": 1.27,
      "num_input_tokens_seen": 42209216112,
      "step": 53649
    },
    {
      "epoch": 5.691703798005516,
      "grad_norm": 0.5981800713916127,
      "learning_rate": 2.7052709289171885e-05,
      "loss": 1.2168,
      "num_input_tokens_seen": 42210002896,
      "step": 53650
    },
    {
      "epoch": 5.691809887545088,
      "grad_norm": 0.6328746449139643,
      "learning_rate": 2.705201666618523e-05,
      "loss": 1.1144,
      "num_input_tokens_seen": 42210789664,
      "step": 53651
    },
    {
      "epoch": 5.691915977084659,
      "grad_norm": 0.7044233525548755,
      "learning_rate": 2.7051324041612847e-05,
      "loss": 1.1992,
      "num_input_tokens_seen": 42211576384,
      "step": 53652
    },
    {
      "epoch": 5.692022066624231,
      "grad_norm": 0.5356850081697802,
      "learning_rate": 2.705063141545525e-05,
      "loss": 1.1034,
      "num_input_tokens_seen": 42212363168,
      "step": 53653
    },
    {
      "epoch": 5.692128156163802,
      "grad_norm": 0.5215697191585176,
      "learning_rate": 2.7049938787712998e-05,
      "loss": 1.0156,
      "num_input_tokens_seen": 42213149984,
      "step": 53654
    },
    {
      "epoch": 5.692234245703373,
      "grad_norm": 0.7369397371262453,
      "learning_rate": 2.704924615838661e-05,
      "loss": 1.1844,
      "num_input_tokens_seen": 42213936816,
      "step": 53655
    },
    {
      "epoch": 5.692340335242945,
      "grad_norm": 0.9336409082172621,
      "learning_rate": 2.7048553527476617e-05,
      "loss": 1.1577,
      "num_input_tokens_seen": 42214723632,
      "step": 53656
    },
    {
      "epoch": 5.692446424782516,
      "grad_norm": 0.668428951349892,
      "learning_rate": 2.7047860894983573e-05,
      "loss": 1.1675,
      "num_input_tokens_seen": 42215510448,
      "step": 53657
    },
    {
      "epoch": 5.692552514322088,
      "grad_norm": 1.0336864309840739,
      "learning_rate": 2.7047168260907994e-05,
      "loss": 1.157,
      "num_input_tokens_seen": 42216297232,
      "step": 53658
    },
    {
      "epoch": 5.692658603861659,
      "grad_norm": 0.7494831467954366,
      "learning_rate": 2.7046475625250422e-05,
      "loss": 1.0956,
      "num_input_tokens_seen": 42217084000,
      "step": 53659
    },
    {
      "epoch": 5.69276469340123,
      "grad_norm": 0.5947639269869059,
      "learning_rate": 2.7045782988011402e-05,
      "loss": 1.1473,
      "num_input_tokens_seen": 42217870864,
      "step": 53660
    },
    {
      "epoch": 5.692870782940802,
      "grad_norm": 0.613551263149633,
      "learning_rate": 2.704509034919146e-05,
      "loss": 1.1663,
      "num_input_tokens_seen": 42218657680,
      "step": 53661
    },
    {
      "epoch": 5.692976872480373,
      "grad_norm": 0.7439487592578848,
      "learning_rate": 2.7044397708791126e-05,
      "loss": 1.1926,
      "num_input_tokens_seen": 42219444560,
      "step": 53662
    },
    {
      "epoch": 5.693082962019945,
      "grad_norm": 0.6326058017772211,
      "learning_rate": 2.7043705066810944e-05,
      "loss": 1.2174,
      "num_input_tokens_seen": 42220231264,
      "step": 53663
    },
    {
      "epoch": 5.693189051559516,
      "grad_norm": 0.5779858795551573,
      "learning_rate": 2.7043012423251452e-05,
      "loss": 1.1727,
      "num_input_tokens_seen": 42221018048,
      "step": 53664
    },
    {
      "epoch": 5.693295141099088,
      "grad_norm": 0.6786341930481488,
      "learning_rate": 2.704231977811317e-05,
      "loss": 1.0809,
      "num_input_tokens_seen": 42221804816,
      "step": 53665
    },
    {
      "epoch": 5.693401230638659,
      "grad_norm": 0.6571325726902972,
      "learning_rate": 2.7041627131396653e-05,
      "loss": 1.1649,
      "num_input_tokens_seen": 42222591600,
      "step": 53666
    },
    {
      "epoch": 5.693507320178231,
      "grad_norm": 0.6536084326989188,
      "learning_rate": 2.704093448310242e-05,
      "loss": 1.1828,
      "num_input_tokens_seen": 42223378336,
      "step": 53667
    },
    {
      "epoch": 5.693613409717802,
      "grad_norm": 0.6543642545826729,
      "learning_rate": 2.704024183323101e-05,
      "loss": 1.0921,
      "num_input_tokens_seen": 42224165104,
      "step": 53668
    },
    {
      "epoch": 5.693719499257373,
      "grad_norm": 0.6092256365285117,
      "learning_rate": 2.703954918178297e-05,
      "loss": 1.1351,
      "num_input_tokens_seen": 42224951856,
      "step": 53669
    },
    {
      "epoch": 5.693825588796945,
      "grad_norm": 0.6495835931913037,
      "learning_rate": 2.7038856528758816e-05,
      "loss": 1.2774,
      "num_input_tokens_seen": 42225738592,
      "step": 53670
    },
    {
      "epoch": 5.693931678336516,
      "grad_norm": 0.6783939043797608,
      "learning_rate": 2.70381638741591e-05,
      "loss": 1.1778,
      "num_input_tokens_seen": 42226525408,
      "step": 53671
    },
    {
      "epoch": 5.694037767876088,
      "grad_norm": 0.88283414162379,
      "learning_rate": 2.7037471217984356e-05,
      "loss": 1.2857,
      "num_input_tokens_seen": 42227312096,
      "step": 53672
    },
    {
      "epoch": 5.694143857415659,
      "grad_norm": 0.5751596040557394,
      "learning_rate": 2.7036778560235104e-05,
      "loss": 1.1758,
      "num_input_tokens_seen": 42228098848,
      "step": 53673
    },
    {
      "epoch": 5.69424994695523,
      "grad_norm": 0.7545965990663807,
      "learning_rate": 2.7036085900911896e-05,
      "loss": 1.1195,
      "num_input_tokens_seen": 42228885584,
      "step": 53674
    },
    {
      "epoch": 5.694356036494802,
      "grad_norm": 0.601860091182113,
      "learning_rate": 2.7035393240015255e-05,
      "loss": 1.1464,
      "num_input_tokens_seen": 42229672384,
      "step": 53675
    },
    {
      "epoch": 5.694462126034373,
      "grad_norm": 0.6496200973212827,
      "learning_rate": 2.7034700577545723e-05,
      "loss": 1.1327,
      "num_input_tokens_seen": 42230459200,
      "step": 53676
    },
    {
      "epoch": 5.694568215573945,
      "grad_norm": 0.721450305060601,
      "learning_rate": 2.703400791350384e-05,
      "loss": 1.1728,
      "num_input_tokens_seen": 42231245936,
      "step": 53677
    },
    {
      "epoch": 5.694674305113516,
      "grad_norm": 0.5916619818578299,
      "learning_rate": 2.703331524789013e-05,
      "loss": 1.0693,
      "num_input_tokens_seen": 42232032704,
      "step": 53678
    },
    {
      "epoch": 5.694780394653087,
      "grad_norm": 0.5693364952214685,
      "learning_rate": 2.703262258070513e-05,
      "loss": 1.0953,
      "num_input_tokens_seen": 42232819552,
      "step": 53679
    },
    {
      "epoch": 5.694886484192659,
      "grad_norm": 0.8926727797591278,
      "learning_rate": 2.703192991194939e-05,
      "loss": 1.195,
      "num_input_tokens_seen": 42233606288,
      "step": 53680
    },
    {
      "epoch": 5.69499257373223,
      "grad_norm": 0.6411597238100005,
      "learning_rate": 2.7031237241623423e-05,
      "loss": 1.1456,
      "num_input_tokens_seen": 42234393120,
      "step": 53681
    },
    {
      "epoch": 5.695098663271802,
      "grad_norm": 0.5801121732545643,
      "learning_rate": 2.7030544569727772e-05,
      "loss": 1.1491,
      "num_input_tokens_seen": 42235179824,
      "step": 53682
    },
    {
      "epoch": 5.695204752811373,
      "grad_norm": 0.6639093054649887,
      "learning_rate": 2.7029851896262986e-05,
      "loss": 1.1551,
      "num_input_tokens_seen": 42235966640,
      "step": 53683
    },
    {
      "epoch": 5.695310842350944,
      "grad_norm": 0.6139851439451333,
      "learning_rate": 2.7029159221229593e-05,
      "loss": 1.0857,
      "num_input_tokens_seen": 42236753504,
      "step": 53684
    },
    {
      "epoch": 5.695416931890516,
      "grad_norm": 0.7816388697893379,
      "learning_rate": 2.702846654462812e-05,
      "loss": 1.1491,
      "num_input_tokens_seen": 42237540304,
      "step": 53685
    },
    {
      "epoch": 5.695523021430087,
      "grad_norm": 0.6869534438026725,
      "learning_rate": 2.7027773866459104e-05,
      "loss": 1.2779,
      "num_input_tokens_seen": 42238327008,
      "step": 53686
    },
    {
      "epoch": 5.695629110969659,
      "grad_norm": 0.6809228081416991,
      "learning_rate": 2.7027081186723093e-05,
      "loss": 1.1122,
      "num_input_tokens_seen": 42239113728,
      "step": 53687
    },
    {
      "epoch": 5.69573520050923,
      "grad_norm": 0.8473595636216285,
      "learning_rate": 2.7026388505420602e-05,
      "loss": 1.167,
      "num_input_tokens_seen": 42239900528,
      "step": 53688
    },
    {
      "epoch": 5.695841290048802,
      "grad_norm": 0.6328531123460224,
      "learning_rate": 2.7025695822552188e-05,
      "loss": 1.0857,
      "num_input_tokens_seen": 42240687248,
      "step": 53689
    },
    {
      "epoch": 5.695947379588373,
      "grad_norm": 0.6618669395325246,
      "learning_rate": 2.7025003138118373e-05,
      "loss": 1.1215,
      "num_input_tokens_seen": 42241474048,
      "step": 53690
    },
    {
      "epoch": 5.696053469127944,
      "grad_norm": 0.9014077258089664,
      "learning_rate": 2.7024310452119687e-05,
      "loss": 1.107,
      "num_input_tokens_seen": 42242260784,
      "step": 53691
    },
    {
      "epoch": 5.6961595586675156,
      "grad_norm": 0.7354941737259475,
      "learning_rate": 2.702361776455668e-05,
      "loss": 1.1694,
      "num_input_tokens_seen": 42243047568,
      "step": 53692
    },
    {
      "epoch": 5.696265648207087,
      "grad_norm": 0.6788971479643465,
      "learning_rate": 2.7022925075429883e-05,
      "loss": 1.2126,
      "num_input_tokens_seen": 42243834384,
      "step": 53693
    },
    {
      "epoch": 5.6963717377466585,
      "grad_norm": 0.6947480709193019,
      "learning_rate": 2.702223238473982e-05,
      "loss": 1.1991,
      "num_input_tokens_seen": 42244621168,
      "step": 53694
    },
    {
      "epoch": 5.6964778272862295,
      "grad_norm": 0.7414866040497711,
      "learning_rate": 2.7021539692487048e-05,
      "loss": 1.1768,
      "num_input_tokens_seen": 42245407920,
      "step": 53695
    },
    {
      "epoch": 5.6965839168258015,
      "grad_norm": 0.7177987151389139,
      "learning_rate": 2.702084699867208e-05,
      "loss": 1.1797,
      "num_input_tokens_seen": 42246194688,
      "step": 53696
    },
    {
      "epoch": 5.6966900063653725,
      "grad_norm": 0.7151781235052722,
      "learning_rate": 2.7020154303295458e-05,
      "loss": 1.0915,
      "num_input_tokens_seen": 42246981536,
      "step": 53697
    },
    {
      "epoch": 5.6967960959049435,
      "grad_norm": 0.6780979433009535,
      "learning_rate": 2.7019461606357725e-05,
      "loss": 1.142,
      "num_input_tokens_seen": 42247768192,
      "step": 53698
    },
    {
      "epoch": 5.696902185444515,
      "grad_norm": 0.6684382749538877,
      "learning_rate": 2.701876890785941e-05,
      "loss": 1.1662,
      "num_input_tokens_seen": 42248554880,
      "step": 53699
    },
    {
      "epoch": 5.6970082749840865,
      "grad_norm": 0.8408557576666326,
      "learning_rate": 2.7018076207801057e-05,
      "loss": 1.186,
      "num_input_tokens_seen": 42249341600,
      "step": 53700
    },
    {
      "epoch": 5.697114364523658,
      "grad_norm": 0.6152758204212618,
      "learning_rate": 2.7017383506183186e-05,
      "loss": 1.0838,
      "num_input_tokens_seen": 42250128400,
      "step": 53701
    },
    {
      "epoch": 5.697220454063229,
      "grad_norm": 1.0555582694656722,
      "learning_rate": 2.701669080300634e-05,
      "loss": 1.2162,
      "num_input_tokens_seen": 42250915184,
      "step": 53702
    },
    {
      "epoch": 5.6973265436028,
      "grad_norm": 0.6370089446837179,
      "learning_rate": 2.7015998098271056e-05,
      "loss": 1.0863,
      "num_input_tokens_seen": 42251701904,
      "step": 53703
    },
    {
      "epoch": 5.697432633142372,
      "grad_norm": 0.6217346851631499,
      "learning_rate": 2.7015305391977875e-05,
      "loss": 1.1018,
      "num_input_tokens_seen": 42252488672,
      "step": 53704
    },
    {
      "epoch": 5.697538722681943,
      "grad_norm": 0.9328596047848329,
      "learning_rate": 2.7014612684127312e-05,
      "loss": 1.041,
      "num_input_tokens_seen": 42253275456,
      "step": 53705
    },
    {
      "epoch": 5.697644812221515,
      "grad_norm": 0.616185537205329,
      "learning_rate": 2.7013919974719926e-05,
      "loss": 1.1543,
      "num_input_tokens_seen": 42254062240,
      "step": 53706
    },
    {
      "epoch": 5.697750901761086,
      "grad_norm": 0.6141507414158025,
      "learning_rate": 2.7013227263756236e-05,
      "loss": 1.0718,
      "num_input_tokens_seen": 42254849008,
      "step": 53707
    },
    {
      "epoch": 5.697856991300657,
      "grad_norm": 0.8058778480574934,
      "learning_rate": 2.7012534551236783e-05,
      "loss": 1.1568,
      "num_input_tokens_seen": 42255635856,
      "step": 53708
    },
    {
      "epoch": 5.697963080840229,
      "grad_norm": 0.7840213725903433,
      "learning_rate": 2.7011841837162106e-05,
      "loss": 1.2059,
      "num_input_tokens_seen": 42256422608,
      "step": 53709
    },
    {
      "epoch": 5.6980691703798,
      "grad_norm": 0.653787023008809,
      "learning_rate": 2.7011149121532735e-05,
      "loss": 1.0722,
      "num_input_tokens_seen": 42257209360,
      "step": 53710
    },
    {
      "epoch": 5.698175259919372,
      "grad_norm": 0.7798093347942983,
      "learning_rate": 2.7010456404349204e-05,
      "loss": 1.1166,
      "num_input_tokens_seen": 42257996128,
      "step": 53711
    },
    {
      "epoch": 5.698281349458943,
      "grad_norm": 0.5884392402074495,
      "learning_rate": 2.7009763685612055e-05,
      "loss": 1.1134,
      "num_input_tokens_seen": 42258782896,
      "step": 53712
    },
    {
      "epoch": 5.698387438998514,
      "grad_norm": 0.7131083008215453,
      "learning_rate": 2.700907096532182e-05,
      "loss": 1.2024,
      "num_input_tokens_seen": 42259569648,
      "step": 53713
    },
    {
      "epoch": 5.698493528538086,
      "grad_norm": 0.7392332691940108,
      "learning_rate": 2.700837824347903e-05,
      "loss": 1.213,
      "num_input_tokens_seen": 42260356480,
      "step": 53714
    },
    {
      "epoch": 5.698599618077657,
      "grad_norm": 0.7031030305448508,
      "learning_rate": 2.700768552008423e-05,
      "loss": 1.2329,
      "num_input_tokens_seen": 42261143216,
      "step": 53715
    },
    {
      "epoch": 5.698705707617229,
      "grad_norm": 0.6845261639723883,
      "learning_rate": 2.700699279513794e-05,
      "loss": 1.174,
      "num_input_tokens_seen": 42261929968,
      "step": 53716
    },
    {
      "epoch": 5.6988117971568,
      "grad_norm": 0.6363524834359777,
      "learning_rate": 2.7006300068640717e-05,
      "loss": 1.1821,
      "num_input_tokens_seen": 42262716784,
      "step": 53717
    },
    {
      "epoch": 5.698917886696372,
      "grad_norm": 0.6188440825202903,
      "learning_rate": 2.700560734059308e-05,
      "loss": 1.1709,
      "num_input_tokens_seen": 42263503504,
      "step": 53718
    },
    {
      "epoch": 5.699023976235943,
      "grad_norm": 0.6539671982725866,
      "learning_rate": 2.7004914610995563e-05,
      "loss": 1.0797,
      "num_input_tokens_seen": 42264290336,
      "step": 53719
    },
    {
      "epoch": 5.699130065775514,
      "grad_norm": 0.5499857091401946,
      "learning_rate": 2.7004221879848713e-05,
      "loss": 1.0811,
      "num_input_tokens_seen": 42265077120,
      "step": 53720
    },
    {
      "epoch": 5.699236155315086,
      "grad_norm": 0.8605284408300683,
      "learning_rate": 2.7003529147153054e-05,
      "loss": 1.2078,
      "num_input_tokens_seen": 42265863904,
      "step": 53721
    },
    {
      "epoch": 5.699342244854657,
      "grad_norm": 0.6224423597561632,
      "learning_rate": 2.7002836412909128e-05,
      "loss": 1.1681,
      "num_input_tokens_seen": 42266650640,
      "step": 53722
    },
    {
      "epoch": 5.699448334394229,
      "grad_norm": 0.6685531633539955,
      "learning_rate": 2.7002143677117475e-05,
      "loss": 1.1296,
      "num_input_tokens_seen": 42267437440,
      "step": 53723
    },
    {
      "epoch": 5.6995544239338,
      "grad_norm": 0.6604078795109772,
      "learning_rate": 2.7001450939778622e-05,
      "loss": 1.1754,
      "num_input_tokens_seen": 42268224096,
      "step": 53724
    },
    {
      "epoch": 5.699660513473372,
      "grad_norm": 0.678283601340249,
      "learning_rate": 2.70007582008931e-05,
      "loss": 1.1576,
      "num_input_tokens_seen": 42269010896,
      "step": 53725
    },
    {
      "epoch": 5.699766603012943,
      "grad_norm": 0.7757087045349527,
      "learning_rate": 2.7000065460461456e-05,
      "loss": 1.2194,
      "num_input_tokens_seen": 42269797664,
      "step": 53726
    },
    {
      "epoch": 5.699872692552514,
      "grad_norm": 0.6239575276698155,
      "learning_rate": 2.6999372718484216e-05,
      "loss": 1.1234,
      "num_input_tokens_seen": 42270584464,
      "step": 53727
    },
    {
      "epoch": 5.699978782092086,
      "grad_norm": 0.6449333012324484,
      "learning_rate": 2.699867997496192e-05,
      "loss": 1.2079,
      "num_input_tokens_seen": 42271371152,
      "step": 53728
    },
    {
      "epoch": 5.700084871631657,
      "grad_norm": 0.777769091973092,
      "learning_rate": 2.6997987229895105e-05,
      "loss": 1.2595,
      "num_input_tokens_seen": 42272157904,
      "step": 53729
    },
    {
      "epoch": 5.700190961171229,
      "grad_norm": 0.6124585303172784,
      "learning_rate": 2.69972944832843e-05,
      "loss": 1.1334,
      "num_input_tokens_seen": 42272944672,
      "step": 53730
    },
    {
      "epoch": 5.7002970507108,
      "grad_norm": 0.5815472509795859,
      "learning_rate": 2.6996601735130043e-05,
      "loss": 1.0739,
      "num_input_tokens_seen": 42273731408,
      "step": 53731
    },
    {
      "epoch": 5.700403140250371,
      "grad_norm": 0.6397826964466988,
      "learning_rate": 2.699590898543288e-05,
      "loss": 1.0773,
      "num_input_tokens_seen": 42274518192,
      "step": 53732
    },
    {
      "epoch": 5.700509229789943,
      "grad_norm": 0.5639301017318272,
      "learning_rate": 2.6995216234193337e-05,
      "loss": 1.0414,
      "num_input_tokens_seen": 42275305088,
      "step": 53733
    },
    {
      "epoch": 5.700615319329514,
      "grad_norm": 0.6728629533853203,
      "learning_rate": 2.699452348141194e-05,
      "loss": 1.1578,
      "num_input_tokens_seen": 42276091872,
      "step": 53734
    },
    {
      "epoch": 5.700721408869086,
      "grad_norm": 0.6324558168948164,
      "learning_rate": 2.699383072708924e-05,
      "loss": 1.0985,
      "num_input_tokens_seen": 42276878624,
      "step": 53735
    },
    {
      "epoch": 5.700827498408657,
      "grad_norm": 0.5663124899461496,
      "learning_rate": 2.6993137971225767e-05,
      "loss": 1.207,
      "num_input_tokens_seen": 42277665376,
      "step": 53736
    },
    {
      "epoch": 5.700933587948228,
      "grad_norm": 0.6893107238574782,
      "learning_rate": 2.6992445213822055e-05,
      "loss": 1.1122,
      "num_input_tokens_seen": 42278452144,
      "step": 53737
    },
    {
      "epoch": 5.7010396774878,
      "grad_norm": 0.8268893574291258,
      "learning_rate": 2.6991752454878638e-05,
      "loss": 1.1327,
      "num_input_tokens_seen": 42279238864,
      "step": 53738
    },
    {
      "epoch": 5.701145767027371,
      "grad_norm": 0.6869903901192399,
      "learning_rate": 2.6991059694396053e-05,
      "loss": 1.1635,
      "num_input_tokens_seen": 42280025664,
      "step": 53739
    },
    {
      "epoch": 5.701251856566943,
      "grad_norm": 0.933122479298609,
      "learning_rate": 2.699036693237484e-05,
      "loss": 1.1311,
      "num_input_tokens_seen": 42280812464,
      "step": 53740
    },
    {
      "epoch": 5.701357946106514,
      "grad_norm": 0.756675023238011,
      "learning_rate": 2.6989674168815525e-05,
      "loss": 1.1614,
      "num_input_tokens_seen": 42281599264,
      "step": 53741
    },
    {
      "epoch": 5.701464035646085,
      "grad_norm": 0.7181064691529164,
      "learning_rate": 2.6988981403718644e-05,
      "loss": 1.1734,
      "num_input_tokens_seen": 42282385984,
      "step": 53742
    },
    {
      "epoch": 5.701570125185657,
      "grad_norm": 0.8649832660469553,
      "learning_rate": 2.6988288637084746e-05,
      "loss": 1.1097,
      "num_input_tokens_seen": 42283172768,
      "step": 53743
    },
    {
      "epoch": 5.701676214725228,
      "grad_norm": 0.9061026529851288,
      "learning_rate": 2.698759586891435e-05,
      "loss": 1.1112,
      "num_input_tokens_seen": 42283959600,
      "step": 53744
    },
    {
      "epoch": 5.7017823042648,
      "grad_norm": 0.7566480410146907,
      "learning_rate": 2.6986903099208e-05,
      "loss": 1.0962,
      "num_input_tokens_seen": 42284746416,
      "step": 53745
    },
    {
      "epoch": 5.701888393804371,
      "grad_norm": 0.9568426997681306,
      "learning_rate": 2.6986210327966234e-05,
      "loss": 1.2488,
      "num_input_tokens_seen": 42285533104,
      "step": 53746
    },
    {
      "epoch": 5.701994483343943,
      "grad_norm": 0.70889034344383,
      "learning_rate": 2.6985517555189583e-05,
      "loss": 1.1706,
      "num_input_tokens_seen": 42286319952,
      "step": 53747
    },
    {
      "epoch": 5.702100572883514,
      "grad_norm": 0.7184051926826102,
      "learning_rate": 2.698482478087857e-05,
      "loss": 1.1991,
      "num_input_tokens_seen": 42287106656,
      "step": 53748
    },
    {
      "epoch": 5.702206662423085,
      "grad_norm": 0.772975272306316,
      "learning_rate": 2.6984132005033756e-05,
      "loss": 1.1729,
      "num_input_tokens_seen": 42287893440,
      "step": 53749
    },
    {
      "epoch": 5.702312751962657,
      "grad_norm": 0.7309623538752674,
      "learning_rate": 2.698343922765566e-05,
      "loss": 1.1252,
      "num_input_tokens_seen": 42288680272,
      "step": 53750
    },
    {
      "epoch": 5.702418841502228,
      "grad_norm": 0.867383742163301,
      "learning_rate": 2.6982746448744816e-05,
      "loss": 1.1862,
      "num_input_tokens_seen": 42289467056,
      "step": 53751
    },
    {
      "epoch": 5.7025249310418,
      "grad_norm": 0.5842045833135848,
      "learning_rate": 2.6982053668301767e-05,
      "loss": 1.1119,
      "num_input_tokens_seen": 42290253920,
      "step": 53752
    },
    {
      "epoch": 5.702631020581371,
      "grad_norm": 0.8154005566194316,
      "learning_rate": 2.6981360886327046e-05,
      "loss": 1.1577,
      "num_input_tokens_seen": 42291040624,
      "step": 53753
    },
    {
      "epoch": 5.7027371101209425,
      "grad_norm": 0.798855248652847,
      "learning_rate": 2.6980668102821184e-05,
      "loss": 1.1104,
      "num_input_tokens_seen": 42291827440,
      "step": 53754
    },
    {
      "epoch": 5.702843199660514,
      "grad_norm": 0.7527234428357628,
      "learning_rate": 2.6979975317784723e-05,
      "loss": 1.1002,
      "num_input_tokens_seen": 42292614144,
      "step": 53755
    },
    {
      "epoch": 5.702949289200085,
      "grad_norm": 1.1691724153241019,
      "learning_rate": 2.6979282531218192e-05,
      "loss": 1.1422,
      "num_input_tokens_seen": 42293400928,
      "step": 53756
    },
    {
      "epoch": 5.7030553787396565,
      "grad_norm": 1.1445802004817238,
      "learning_rate": 2.697858974312213e-05,
      "loss": 1.1541,
      "num_input_tokens_seen": 42294187728,
      "step": 53757
    },
    {
      "epoch": 5.7031614682792275,
      "grad_norm": 0.8159583622622422,
      "learning_rate": 2.6977896953497078e-05,
      "loss": 1.2213,
      "num_input_tokens_seen": 42294974448,
      "step": 53758
    },
    {
      "epoch": 5.7032675578187995,
      "grad_norm": 0.9629167874055651,
      "learning_rate": 2.6977204162343555e-05,
      "loss": 1.1754,
      "num_input_tokens_seen": 42295761264,
      "step": 53759
    },
    {
      "epoch": 5.7033736473583705,
      "grad_norm": 1.2712402260291205,
      "learning_rate": 2.6976511369662117e-05,
      "loss": 1.2116,
      "num_input_tokens_seen": 42296547984,
      "step": 53760
    },
    {
      "epoch": 5.7034797368979415,
      "grad_norm": 0.8504904227945583,
      "learning_rate": 2.6975818575453282e-05,
      "loss": 1.172,
      "num_input_tokens_seen": 42297334736,
      "step": 53761
    },
    {
      "epoch": 5.703585826437513,
      "grad_norm": 0.8382255891680178,
      "learning_rate": 2.6975125779717593e-05,
      "loss": 1.2324,
      "num_input_tokens_seen": 42298121472,
      "step": 53762
    },
    {
      "epoch": 5.7036919159770845,
      "grad_norm": 1.0696721849143969,
      "learning_rate": 2.697443298245559e-05,
      "loss": 1.2281,
      "num_input_tokens_seen": 42298908144,
      "step": 53763
    },
    {
      "epoch": 5.703798005516656,
      "grad_norm": 0.7267618717139955,
      "learning_rate": 2.69737401836678e-05,
      "loss": 1.1261,
      "num_input_tokens_seen": 42299694880,
      "step": 53764
    },
    {
      "epoch": 5.703904095056227,
      "grad_norm": 0.6808916223057431,
      "learning_rate": 2.697304738335476e-05,
      "loss": 1.1859,
      "num_input_tokens_seen": 42300481584,
      "step": 53765
    },
    {
      "epoch": 5.7040101845957984,
      "grad_norm": 0.9728857195759667,
      "learning_rate": 2.6972354581517006e-05,
      "loss": 1.2165,
      "num_input_tokens_seen": 42301268432,
      "step": 53766
    },
    {
      "epoch": 5.70411627413537,
      "grad_norm": 0.9378332272296798,
      "learning_rate": 2.697166177815508e-05,
      "loss": 1.1608,
      "num_input_tokens_seen": 42302055184,
      "step": 53767
    },
    {
      "epoch": 5.704222363674941,
      "grad_norm": 0.7882994225992589,
      "learning_rate": 2.6970968973269505e-05,
      "loss": 1.2008,
      "num_input_tokens_seen": 42302841904,
      "step": 53768
    },
    {
      "epoch": 5.704328453214513,
      "grad_norm": 0.7833846605659479,
      "learning_rate": 2.6970276166860824e-05,
      "loss": 1.1074,
      "num_input_tokens_seen": 42303628736,
      "step": 53769
    },
    {
      "epoch": 5.704434542754084,
      "grad_norm": 1.0735751132873812,
      "learning_rate": 2.6969583358929578e-05,
      "loss": 1.0643,
      "num_input_tokens_seen": 42304415552,
      "step": 53770
    },
    {
      "epoch": 5.704540632293655,
      "grad_norm": 0.7983861475383587,
      "learning_rate": 2.6968890549476288e-05,
      "loss": 1.2073,
      "num_input_tokens_seen": 42305202272,
      "step": 53771
    },
    {
      "epoch": 5.704646721833227,
      "grad_norm": 0.6440965208313413,
      "learning_rate": 2.69681977385015e-05,
      "loss": 1.0845,
      "num_input_tokens_seen": 42305989152,
      "step": 53772
    },
    {
      "epoch": 5.704752811372798,
      "grad_norm": 1.1125349294149152,
      "learning_rate": 2.6967504926005742e-05,
      "loss": 1.1642,
      "num_input_tokens_seen": 42306775952,
      "step": 53773
    },
    {
      "epoch": 5.70485890091237,
      "grad_norm": 0.7775139262060026,
      "learning_rate": 2.6966812111989563e-05,
      "loss": 1.1066,
      "num_input_tokens_seen": 42307562656,
      "step": 53774
    },
    {
      "epoch": 5.704964990451941,
      "grad_norm": 0.6509584036847605,
      "learning_rate": 2.6966119296453486e-05,
      "loss": 1.129,
      "num_input_tokens_seen": 42308349504,
      "step": 53775
    },
    {
      "epoch": 5.705071079991513,
      "grad_norm": 0.8639778000961871,
      "learning_rate": 2.6965426479398048e-05,
      "loss": 1.1296,
      "num_input_tokens_seen": 42309136256,
      "step": 53776
    },
    {
      "epoch": 5.705177169531084,
      "grad_norm": 0.8607678595710807,
      "learning_rate": 2.6964733660823782e-05,
      "loss": 1.1928,
      "num_input_tokens_seen": 42309922928,
      "step": 53777
    },
    {
      "epoch": 5.705283259070655,
      "grad_norm": 0.7382100938778489,
      "learning_rate": 2.696404084073123e-05,
      "loss": 1.1935,
      "num_input_tokens_seen": 42310709744,
      "step": 53778
    },
    {
      "epoch": 5.705389348610227,
      "grad_norm": 0.8886460571349559,
      "learning_rate": 2.6963348019120933e-05,
      "loss": 1.1726,
      "num_input_tokens_seen": 42311496432,
      "step": 53779
    },
    {
      "epoch": 5.705495438149798,
      "grad_norm": 1.3412865240092964,
      "learning_rate": 2.6962655195993407e-05,
      "loss": 1.1898,
      "num_input_tokens_seen": 42312283200,
      "step": 53780
    },
    {
      "epoch": 5.70560152768937,
      "grad_norm": 0.7662560055716756,
      "learning_rate": 2.696196237134921e-05,
      "loss": 1.1637,
      "num_input_tokens_seen": 42313070000,
      "step": 53781
    },
    {
      "epoch": 5.705707617228941,
      "grad_norm": 0.8969680885688056,
      "learning_rate": 2.6961269545188854e-05,
      "loss": 1.2682,
      "num_input_tokens_seen": 42313856768,
      "step": 53782
    },
    {
      "epoch": 5.705813706768513,
      "grad_norm": 0.7995278383441036,
      "learning_rate": 2.6960576717512894e-05,
      "loss": 1.1414,
      "num_input_tokens_seen": 42314643584,
      "step": 53783
    },
    {
      "epoch": 5.705919796308084,
      "grad_norm": 0.7362025007010661,
      "learning_rate": 2.695988388832186e-05,
      "loss": 1.2016,
      "num_input_tokens_seen": 42315430224,
      "step": 53784
    },
    {
      "epoch": 5.706025885847655,
      "grad_norm": 0.7740351784329934,
      "learning_rate": 2.6959191057616272e-05,
      "loss": 1.1644,
      "num_input_tokens_seen": 42316217056,
      "step": 53785
    },
    {
      "epoch": 5.706131975387227,
      "grad_norm": 0.6574435448314498,
      "learning_rate": 2.6958498225396694e-05,
      "loss": 1.2081,
      "num_input_tokens_seen": 42317003952,
      "step": 53786
    },
    {
      "epoch": 5.706238064926798,
      "grad_norm": 0.7582588210351962,
      "learning_rate": 2.6957805391663642e-05,
      "loss": 1.1506,
      "num_input_tokens_seen": 42317790704,
      "step": 53787
    },
    {
      "epoch": 5.70634415446637,
      "grad_norm": 0.6042801781438327,
      "learning_rate": 2.6957112556417653e-05,
      "loss": 1.0971,
      "num_input_tokens_seen": 42318577408,
      "step": 53788
    },
    {
      "epoch": 5.706450244005941,
      "grad_norm": 1.0002329456279913,
      "learning_rate": 2.6956419719659264e-05,
      "loss": 1.1734,
      "num_input_tokens_seen": 42319364144,
      "step": 53789
    },
    {
      "epoch": 5.706556333545512,
      "grad_norm": 0.685265372834744,
      "learning_rate": 2.6955726881389015e-05,
      "loss": 1.1339,
      "num_input_tokens_seen": 42320150992,
      "step": 53790
    },
    {
      "epoch": 5.706662423085084,
      "grad_norm": 0.8248175651912708,
      "learning_rate": 2.695503404160743e-05,
      "loss": 1.2239,
      "num_input_tokens_seen": 42320937744,
      "step": 53791
    },
    {
      "epoch": 5.706768512624655,
      "grad_norm": 0.9785325019206763,
      "learning_rate": 2.6954341200315058e-05,
      "loss": 1.1397,
      "num_input_tokens_seen": 42321724400,
      "step": 53792
    },
    {
      "epoch": 5.706874602164227,
      "grad_norm": 0.6519555177268439,
      "learning_rate": 2.6953648357512434e-05,
      "loss": 1.1511,
      "num_input_tokens_seen": 42322511232,
      "step": 53793
    },
    {
      "epoch": 5.706980691703798,
      "grad_norm": 0.8992889962049967,
      "learning_rate": 2.695295551320008e-05,
      "loss": 1.1373,
      "num_input_tokens_seen": 42323298000,
      "step": 53794
    },
    {
      "epoch": 5.707086781243369,
      "grad_norm": 0.7387203398481548,
      "learning_rate": 2.6952262667378542e-05,
      "loss": 1.1264,
      "num_input_tokens_seen": 42324084816,
      "step": 53795
    },
    {
      "epoch": 5.707192870782941,
      "grad_norm": 0.7202430197607875,
      "learning_rate": 2.695156982004835e-05,
      "loss": 1.1822,
      "num_input_tokens_seen": 42324871632,
      "step": 53796
    },
    {
      "epoch": 5.707298960322512,
      "grad_norm": 0.6682849250846371,
      "learning_rate": 2.695087697121004e-05,
      "loss": 1.2538,
      "num_input_tokens_seen": 42325658384,
      "step": 53797
    },
    {
      "epoch": 5.707405049862084,
      "grad_norm": 0.7959603529994691,
      "learning_rate": 2.695018412086416e-05,
      "loss": 1.208,
      "num_input_tokens_seen": 42326445184,
      "step": 53798
    },
    {
      "epoch": 5.707511139401655,
      "grad_norm": 0.7718040575219148,
      "learning_rate": 2.6949491269011222e-05,
      "loss": 1.1688,
      "num_input_tokens_seen": 42327231968,
      "step": 53799
    },
    {
      "epoch": 5.707617228941226,
      "grad_norm": 0.6059132068929215,
      "learning_rate": 2.6948798415651783e-05,
      "loss": 1.0964,
      "num_input_tokens_seen": 42328018640,
      "step": 53800
    },
    {
      "epoch": 5.707723318480798,
      "grad_norm": 0.811952636664858,
      "learning_rate": 2.694810556078637e-05,
      "loss": 1.231,
      "num_input_tokens_seen": 42328805376,
      "step": 53801
    },
    {
      "epoch": 5.707829408020369,
      "grad_norm": 0.6842950491986141,
      "learning_rate": 2.6947412704415508e-05,
      "loss": 1.1181,
      "num_input_tokens_seen": 42329592176,
      "step": 53802
    },
    {
      "epoch": 5.707935497559941,
      "grad_norm": 0.9242980697279684,
      "learning_rate": 2.6946719846539753e-05,
      "loss": 1.1935,
      "num_input_tokens_seen": 42330378864,
      "step": 53803
    },
    {
      "epoch": 5.708041587099512,
      "grad_norm": 0.5594270248920858,
      "learning_rate": 2.6946026987159634e-05,
      "loss": 1.0854,
      "num_input_tokens_seen": 42331165616,
      "step": 53804
    },
    {
      "epoch": 5.708147676639084,
      "grad_norm": 0.7675419428517238,
      "learning_rate": 2.694533412627567e-05,
      "loss": 1.2256,
      "num_input_tokens_seen": 42331952304,
      "step": 53805
    },
    {
      "epoch": 5.708253766178655,
      "grad_norm": 0.7126290704719248,
      "learning_rate": 2.6944641263888414e-05,
      "loss": 1.1307,
      "num_input_tokens_seen": 42332739040,
      "step": 53806
    },
    {
      "epoch": 5.708359855718226,
      "grad_norm": 0.7672463847005476,
      "learning_rate": 2.6943948399998396e-05,
      "loss": 1.216,
      "num_input_tokens_seen": 42333525872,
      "step": 53807
    },
    {
      "epoch": 5.708465945257798,
      "grad_norm": 0.7096103575691379,
      "learning_rate": 2.6943255534606153e-05,
      "loss": 1.239,
      "num_input_tokens_seen": 42334312608,
      "step": 53808
    },
    {
      "epoch": 5.708572034797369,
      "grad_norm": 0.9172706067849642,
      "learning_rate": 2.6942562667712225e-05,
      "loss": 1.1489,
      "num_input_tokens_seen": 42335099312,
      "step": 53809
    },
    {
      "epoch": 5.708678124336941,
      "grad_norm": 0.7165910894063048,
      "learning_rate": 2.694186979931713e-05,
      "loss": 1.1375,
      "num_input_tokens_seen": 42335886144,
      "step": 53810
    },
    {
      "epoch": 5.708784213876512,
      "grad_norm": 0.8143740434687606,
      "learning_rate": 2.694117692942142e-05,
      "loss": 1.2245,
      "num_input_tokens_seen": 42336672816,
      "step": 53811
    },
    {
      "epoch": 5.708890303416084,
      "grad_norm": 0.5843178536159541,
      "learning_rate": 2.6940484058025626e-05,
      "loss": 1.1231,
      "num_input_tokens_seen": 42337459600,
      "step": 53812
    },
    {
      "epoch": 5.708996392955655,
      "grad_norm": 0.9878134249076794,
      "learning_rate": 2.6939791185130287e-05,
      "loss": 1.1961,
      "num_input_tokens_seen": 42338246256,
      "step": 53813
    },
    {
      "epoch": 5.709102482495226,
      "grad_norm": 0.5663382334000402,
      "learning_rate": 2.6939098310735926e-05,
      "loss": 1.0955,
      "num_input_tokens_seen": 42339033136,
      "step": 53814
    },
    {
      "epoch": 5.709208572034798,
      "grad_norm": 0.9532020454987992,
      "learning_rate": 2.693840543484309e-05,
      "loss": 1.1472,
      "num_input_tokens_seen": 42339819856,
      "step": 53815
    },
    {
      "epoch": 5.709314661574369,
      "grad_norm": 0.7787946758332741,
      "learning_rate": 2.693771255745231e-05,
      "loss": 1.1366,
      "num_input_tokens_seen": 42340606560,
      "step": 53816
    },
    {
      "epoch": 5.7094207511139405,
      "grad_norm": 0.5765019405373826,
      "learning_rate": 2.6937019678564123e-05,
      "loss": 1.1389,
      "num_input_tokens_seen": 42341393296,
      "step": 53817
    },
    {
      "epoch": 5.709526840653512,
      "grad_norm": 0.9500318003059035,
      "learning_rate": 2.6936326798179068e-05,
      "loss": 1.1905,
      "num_input_tokens_seen": 42342180000,
      "step": 53818
    },
    {
      "epoch": 5.709632930193083,
      "grad_norm": 1.084093967942443,
      "learning_rate": 2.693563391629767e-05,
      "loss": 1.2452,
      "num_input_tokens_seen": 42342966704,
      "step": 53819
    },
    {
      "epoch": 5.7097390197326545,
      "grad_norm": 0.653201898046505,
      "learning_rate": 2.693494103292048e-05,
      "loss": 1.1405,
      "num_input_tokens_seen": 42343753472,
      "step": 53820
    },
    {
      "epoch": 5.7098451092722255,
      "grad_norm": 0.8121856317906481,
      "learning_rate": 2.693424814804802e-05,
      "loss": 1.1204,
      "num_input_tokens_seen": 42344540160,
      "step": 53821
    },
    {
      "epoch": 5.7099511988117975,
      "grad_norm": 0.8737650914948591,
      "learning_rate": 2.6933555261680827e-05,
      "loss": 1.1818,
      "num_input_tokens_seen": 42345326864,
      "step": 53822
    },
    {
      "epoch": 5.7100572883513685,
      "grad_norm": 0.662034937259201,
      "learning_rate": 2.6932862373819438e-05,
      "loss": 1.2179,
      "num_input_tokens_seen": 42346113552,
      "step": 53823
    },
    {
      "epoch": 5.7101633778909395,
      "grad_norm": 0.9707240725812031,
      "learning_rate": 2.69321694844644e-05,
      "loss": 1.2152,
      "num_input_tokens_seen": 42346900272,
      "step": 53824
    },
    {
      "epoch": 5.7102694674305114,
      "grad_norm": 0.7702289897498069,
      "learning_rate": 2.6931476593616216e-05,
      "loss": 1.127,
      "num_input_tokens_seen": 42347686992,
      "step": 53825
    },
    {
      "epoch": 5.7103755569700825,
      "grad_norm": 0.5291474525552499,
      "learning_rate": 2.6930783701275463e-05,
      "loss": 1.1152,
      "num_input_tokens_seen": 42348473840,
      "step": 53826
    },
    {
      "epoch": 5.710481646509654,
      "grad_norm": 0.6111608644435478,
      "learning_rate": 2.6930090807442655e-05,
      "loss": 1.1247,
      "num_input_tokens_seen": 42349260624,
      "step": 53827
    },
    {
      "epoch": 5.710587736049225,
      "grad_norm": 0.6759926162869035,
      "learning_rate": 2.6929397912118327e-05,
      "loss": 1.1353,
      "num_input_tokens_seen": 42350047328,
      "step": 53828
    },
    {
      "epoch": 5.7106938255887965,
      "grad_norm": 0.629710411205874,
      "learning_rate": 2.6928705015303014e-05,
      "loss": 1.2045,
      "num_input_tokens_seen": 42350834112,
      "step": 53829
    },
    {
      "epoch": 5.710799915128368,
      "grad_norm": 0.709511312435632,
      "learning_rate": 2.692801211699726e-05,
      "loss": 1.1843,
      "num_input_tokens_seen": 42351620896,
      "step": 53830
    },
    {
      "epoch": 5.710906004667939,
      "grad_norm": 1.073304116633967,
      "learning_rate": 2.692731921720159e-05,
      "loss": 1.1519,
      "num_input_tokens_seen": 42352407648,
      "step": 53831
    },
    {
      "epoch": 5.711012094207511,
      "grad_norm": 0.8726506603229225,
      "learning_rate": 2.692662631591655e-05,
      "loss": 1.2534,
      "num_input_tokens_seen": 42353194352,
      "step": 53832
    },
    {
      "epoch": 5.711118183747082,
      "grad_norm": 0.9530843153431948,
      "learning_rate": 2.692593341314266e-05,
      "loss": 1.1083,
      "num_input_tokens_seen": 42353981152,
      "step": 53833
    },
    {
      "epoch": 5.711224273286654,
      "grad_norm": 1.2680447875242793,
      "learning_rate": 2.692524050888047e-05,
      "loss": 1.1866,
      "num_input_tokens_seen": 42354767904,
      "step": 53834
    },
    {
      "epoch": 5.711330362826225,
      "grad_norm": 0.5763033598553786,
      "learning_rate": 2.6924547603130516e-05,
      "loss": 1.1033,
      "num_input_tokens_seen": 42355554640,
      "step": 53835
    },
    {
      "epoch": 5.711436452365797,
      "grad_norm": 0.6238191189339224,
      "learning_rate": 2.6923854695893324e-05,
      "loss": 1.2435,
      "num_input_tokens_seen": 42356341488,
      "step": 53836
    },
    {
      "epoch": 5.711542541905368,
      "grad_norm": 0.7269025943705733,
      "learning_rate": 2.6923161787169432e-05,
      "loss": 1.2032,
      "num_input_tokens_seen": 42357128176,
      "step": 53837
    },
    {
      "epoch": 5.711648631444939,
      "grad_norm": 0.832008527484442,
      "learning_rate": 2.6922468876959378e-05,
      "loss": 1.2719,
      "num_input_tokens_seen": 42357914912,
      "step": 53838
    },
    {
      "epoch": 5.711754720984511,
      "grad_norm": 0.6838162571172685,
      "learning_rate": 2.6921775965263702e-05,
      "loss": 1.2264,
      "num_input_tokens_seen": 42358701584,
      "step": 53839
    },
    {
      "epoch": 5.711860810524082,
      "grad_norm": 0.8089089494382194,
      "learning_rate": 2.6921083052082923e-05,
      "loss": 1.2243,
      "num_input_tokens_seen": 42359488432,
      "step": 53840
    },
    {
      "epoch": 5.711966900063654,
      "grad_norm": 0.6210785747050843,
      "learning_rate": 2.6920390137417594e-05,
      "loss": 1.1842,
      "num_input_tokens_seen": 42360275248,
      "step": 53841
    },
    {
      "epoch": 5.712072989603225,
      "grad_norm": 0.6940440490165095,
      "learning_rate": 2.6919697221268243e-05,
      "loss": 1.0752,
      "num_input_tokens_seen": 42361062048,
      "step": 53842
    },
    {
      "epoch": 5.712179079142796,
      "grad_norm": 0.7053278906085432,
      "learning_rate": 2.6919004303635404e-05,
      "loss": 1.1659,
      "num_input_tokens_seen": 42361848832,
      "step": 53843
    },
    {
      "epoch": 5.712285168682368,
      "grad_norm": 0.6741595396826805,
      "learning_rate": 2.691831138451962e-05,
      "loss": 1.0635,
      "num_input_tokens_seen": 42362635568,
      "step": 53844
    },
    {
      "epoch": 5.712391258221939,
      "grad_norm": 0.6881985928211932,
      "learning_rate": 2.6917618463921413e-05,
      "loss": 1.1926,
      "num_input_tokens_seen": 42363422352,
      "step": 53845
    },
    {
      "epoch": 5.712497347761511,
      "grad_norm": 0.6436382653978108,
      "learning_rate": 2.6916925541841337e-05,
      "loss": 1.1302,
      "num_input_tokens_seen": 42364209072,
      "step": 53846
    },
    {
      "epoch": 5.712603437301082,
      "grad_norm": 0.6767186970352556,
      "learning_rate": 2.691623261827991e-05,
      "loss": 1.1885,
      "num_input_tokens_seen": 42364995840,
      "step": 53847
    },
    {
      "epoch": 5.712709526840653,
      "grad_norm": 0.6366397344703605,
      "learning_rate": 2.691553969323768e-05,
      "loss": 1.1361,
      "num_input_tokens_seen": 42365782640,
      "step": 53848
    },
    {
      "epoch": 5.712815616380225,
      "grad_norm": 0.7248624668387986,
      "learning_rate": 2.6914846766715173e-05,
      "loss": 1.1402,
      "num_input_tokens_seen": 42366569360,
      "step": 53849
    },
    {
      "epoch": 5.712921705919796,
      "grad_norm": 0.632535783464303,
      "learning_rate": 2.691415383871293e-05,
      "loss": 1.1218,
      "num_input_tokens_seen": 42367356112,
      "step": 53850
    },
    {
      "epoch": 5.713027795459368,
      "grad_norm": 0.7913891542182897,
      "learning_rate": 2.691346090923148e-05,
      "loss": 1.1386,
      "num_input_tokens_seen": 42368142816,
      "step": 53851
    },
    {
      "epoch": 5.713133884998939,
      "grad_norm": 0.6552809779922386,
      "learning_rate": 2.691276797827137e-05,
      "loss": 1.2344,
      "num_input_tokens_seen": 42368929600,
      "step": 53852
    },
    {
      "epoch": 5.71323997453851,
      "grad_norm": 0.5876197936321186,
      "learning_rate": 2.691207504583313e-05,
      "loss": 1.0924,
      "num_input_tokens_seen": 42369716480,
      "step": 53853
    },
    {
      "epoch": 5.713346064078082,
      "grad_norm": 0.6720912553487494,
      "learning_rate": 2.691138211191729e-05,
      "loss": 1.1267,
      "num_input_tokens_seen": 42370503328,
      "step": 53854
    },
    {
      "epoch": 5.713452153617653,
      "grad_norm": 0.579582348481325,
      "learning_rate": 2.6910689176524397e-05,
      "loss": 1.1807,
      "num_input_tokens_seen": 42371290176,
      "step": 53855
    },
    {
      "epoch": 5.713558243157225,
      "grad_norm": 0.7499221872966516,
      "learning_rate": 2.6909996239654973e-05,
      "loss": 1.1362,
      "num_input_tokens_seen": 42372076864,
      "step": 53856
    },
    {
      "epoch": 5.713664332696796,
      "grad_norm": 0.6767333606645932,
      "learning_rate": 2.6909303301309557e-05,
      "loss": 1.1976,
      "num_input_tokens_seen": 42372863568,
      "step": 53857
    },
    {
      "epoch": 5.713770422236367,
      "grad_norm": 0.5746599137365374,
      "learning_rate": 2.6908610361488694e-05,
      "loss": 1.1173,
      "num_input_tokens_seen": 42373650320,
      "step": 53858
    },
    {
      "epoch": 5.713876511775939,
      "grad_norm": 0.6893281340419042,
      "learning_rate": 2.6907917420192906e-05,
      "loss": 1.1386,
      "num_input_tokens_seen": 42374437136,
      "step": 53859
    },
    {
      "epoch": 5.71398260131551,
      "grad_norm": 0.7139225545332676,
      "learning_rate": 2.6907224477422743e-05,
      "loss": 1.1924,
      "num_input_tokens_seen": 42375223824,
      "step": 53860
    },
    {
      "epoch": 5.714088690855082,
      "grad_norm": 0.6196581498253184,
      "learning_rate": 2.690653153317873e-05,
      "loss": 1.2859,
      "num_input_tokens_seen": 42376010528,
      "step": 53861
    },
    {
      "epoch": 5.714194780394653,
      "grad_norm": 0.5978090842644435,
      "learning_rate": 2.69058385874614e-05,
      "loss": 1.166,
      "num_input_tokens_seen": 42376797296,
      "step": 53862
    },
    {
      "epoch": 5.714300869934225,
      "grad_norm": 0.7472029518149261,
      "learning_rate": 2.69051456402713e-05,
      "loss": 1.1668,
      "num_input_tokens_seen": 42377584048,
      "step": 53863
    },
    {
      "epoch": 5.714406959473796,
      "grad_norm": 0.6372150025693885,
      "learning_rate": 2.6904452691608963e-05,
      "loss": 1.2288,
      "num_input_tokens_seen": 42378370720,
      "step": 53864
    },
    {
      "epoch": 5.714513049013368,
      "grad_norm": 0.5886297011004189,
      "learning_rate": 2.690375974147491e-05,
      "loss": 1.1645,
      "num_input_tokens_seen": 42379157584,
      "step": 53865
    },
    {
      "epoch": 5.714619138552939,
      "grad_norm": 0.6678819367275646,
      "learning_rate": 2.6903066789869696e-05,
      "loss": 1.1685,
      "num_input_tokens_seen": 42379944304,
      "step": 53866
    },
    {
      "epoch": 5.71472522809251,
      "grad_norm": 0.5972668454619542,
      "learning_rate": 2.6902373836793848e-05,
      "loss": 1.162,
      "num_input_tokens_seen": 42380731056,
      "step": 53867
    },
    {
      "epoch": 5.714831317632082,
      "grad_norm": 0.5745621954881698,
      "learning_rate": 2.6901680882247897e-05,
      "loss": 1.0997,
      "num_input_tokens_seen": 42381517936,
      "step": 53868
    },
    {
      "epoch": 5.714937407171653,
      "grad_norm": 0.7542778906852751,
      "learning_rate": 2.6900987926232384e-05,
      "loss": 1.2303,
      "num_input_tokens_seen": 42382304624,
      "step": 53869
    },
    {
      "epoch": 5.715043496711225,
      "grad_norm": 0.5998890265813792,
      "learning_rate": 2.6900294968747846e-05,
      "loss": 1.2015,
      "num_input_tokens_seen": 42383091376,
      "step": 53870
    },
    {
      "epoch": 5.715149586250796,
      "grad_norm": 0.6093225485874895,
      "learning_rate": 2.6899602009794812e-05,
      "loss": 1.0957,
      "num_input_tokens_seen": 42383878176,
      "step": 53871
    },
    {
      "epoch": 5.715255675790367,
      "grad_norm": 0.6423055466776335,
      "learning_rate": 2.689890904937382e-05,
      "loss": 1.2156,
      "num_input_tokens_seen": 42384664976,
      "step": 53872
    },
    {
      "epoch": 5.715361765329939,
      "grad_norm": 0.6483432270094343,
      "learning_rate": 2.689821608748541e-05,
      "loss": 1.1061,
      "num_input_tokens_seen": 42385451760,
      "step": 53873
    },
    {
      "epoch": 5.71546785486951,
      "grad_norm": 0.5593138371273284,
      "learning_rate": 2.6897523124130108e-05,
      "loss": 1.1179,
      "num_input_tokens_seen": 42386238624,
      "step": 53874
    },
    {
      "epoch": 5.715573944409082,
      "grad_norm": 0.5849309473387494,
      "learning_rate": 2.6896830159308468e-05,
      "loss": 1.13,
      "num_input_tokens_seen": 42387025344,
      "step": 53875
    },
    {
      "epoch": 5.715680033948653,
      "grad_norm": 0.6680138521846631,
      "learning_rate": 2.689613719302101e-05,
      "loss": 1.2047,
      "num_input_tokens_seen": 42387812176,
      "step": 53876
    },
    {
      "epoch": 5.715786123488224,
      "grad_norm": 0.6095744034364767,
      "learning_rate": 2.6895444225268264e-05,
      "loss": 1.13,
      "num_input_tokens_seen": 42388598944,
      "step": 53877
    },
    {
      "epoch": 5.715892213027796,
      "grad_norm": 0.7508893353404259,
      "learning_rate": 2.6894751256050784e-05,
      "loss": 1.2104,
      "num_input_tokens_seen": 42389385616,
      "step": 53878
    },
    {
      "epoch": 5.715998302567367,
      "grad_norm": 0.8577348722884269,
      "learning_rate": 2.6894058285369095e-05,
      "loss": 1.1213,
      "num_input_tokens_seen": 42390172400,
      "step": 53879
    },
    {
      "epoch": 5.7161043921069385,
      "grad_norm": 0.8172074839022646,
      "learning_rate": 2.6893365313223724e-05,
      "loss": 1.0851,
      "num_input_tokens_seen": 42390959200,
      "step": 53880
    },
    {
      "epoch": 5.71621048164651,
      "grad_norm": 0.7607673329624679,
      "learning_rate": 2.6892672339615222e-05,
      "loss": 1.161,
      "num_input_tokens_seen": 42391745984,
      "step": 53881
    },
    {
      "epoch": 5.716316571186081,
      "grad_norm": 0.7038574965853711,
      "learning_rate": 2.6891979364544124e-05,
      "loss": 1.0516,
      "num_input_tokens_seen": 42392532832,
      "step": 53882
    },
    {
      "epoch": 5.7164226607256525,
      "grad_norm": 0.8324777515955465,
      "learning_rate": 2.689128638801095e-05,
      "loss": 1.1427,
      "num_input_tokens_seen": 42393319616,
      "step": 53883
    },
    {
      "epoch": 5.716528750265224,
      "grad_norm": 0.6957298470816449,
      "learning_rate": 2.6890593410016253e-05,
      "loss": 1.0514,
      "num_input_tokens_seen": 42394106416,
      "step": 53884
    },
    {
      "epoch": 5.7166348398047955,
      "grad_norm": 0.9012131616137676,
      "learning_rate": 2.6889900430560554e-05,
      "loss": 1.1951,
      "num_input_tokens_seen": 42394893168,
      "step": 53885
    },
    {
      "epoch": 5.7167409293443665,
      "grad_norm": 0.7992688585557057,
      "learning_rate": 2.68892074496444e-05,
      "loss": 1.1962,
      "num_input_tokens_seen": 42395679904,
      "step": 53886
    },
    {
      "epoch": 5.716847018883938,
      "grad_norm": 0.6361833061621162,
      "learning_rate": 2.688851446726832e-05,
      "loss": 1.2,
      "num_input_tokens_seen": 42396466704,
      "step": 53887
    },
    {
      "epoch": 5.7169531084235095,
      "grad_norm": 0.7833897169371824,
      "learning_rate": 2.688782148343285e-05,
      "loss": 1.3005,
      "num_input_tokens_seen": 42397253440,
      "step": 53888
    },
    {
      "epoch": 5.7170591979630805,
      "grad_norm": 0.6462982653318449,
      "learning_rate": 2.688712849813853e-05,
      "loss": 1.0726,
      "num_input_tokens_seen": 42398040192,
      "step": 53889
    },
    {
      "epoch": 5.717165287502652,
      "grad_norm": 0.663875260311159,
      "learning_rate": 2.68864355113859e-05,
      "loss": 1.1884,
      "num_input_tokens_seen": 42398826976,
      "step": 53890
    },
    {
      "epoch": 5.717271377042223,
      "grad_norm": 0.6423072315437611,
      "learning_rate": 2.688574252317547e-05,
      "loss": 1.0853,
      "num_input_tokens_seen": 42399613744,
      "step": 53891
    },
    {
      "epoch": 5.717377466581795,
      "grad_norm": 0.7790098187022187,
      "learning_rate": 2.6885049533507807e-05,
      "loss": 1.1358,
      "num_input_tokens_seen": 42400400528,
      "step": 53892
    },
    {
      "epoch": 5.717483556121366,
      "grad_norm": 0.5487481336921342,
      "learning_rate": 2.6884356542383432e-05,
      "loss": 1.0868,
      "num_input_tokens_seen": 42401187312,
      "step": 53893
    },
    {
      "epoch": 5.717589645660938,
      "grad_norm": 0.8094952845783994,
      "learning_rate": 2.6883663549802872e-05,
      "loss": 1.1411,
      "num_input_tokens_seen": 42401974016,
      "step": 53894
    },
    {
      "epoch": 5.717695735200509,
      "grad_norm": 0.5486221791061721,
      "learning_rate": 2.6882970555766683e-05,
      "loss": 1.2301,
      "num_input_tokens_seen": 42402760800,
      "step": 53895
    },
    {
      "epoch": 5.71780182474008,
      "grad_norm": 0.559889712502933,
      "learning_rate": 2.6882277560275387e-05,
      "loss": 1.0799,
      "num_input_tokens_seen": 42403547568,
      "step": 53896
    },
    {
      "epoch": 5.717907914279652,
      "grad_norm": 0.743187803828485,
      "learning_rate": 2.688158456332952e-05,
      "loss": 1.1195,
      "num_input_tokens_seen": 42404334224,
      "step": 53897
    },
    {
      "epoch": 5.718014003819223,
      "grad_norm": 0.9764132792030615,
      "learning_rate": 2.688089156492962e-05,
      "loss": 1.2185,
      "num_input_tokens_seen": 42405120928,
      "step": 53898
    },
    {
      "epoch": 5.718120093358795,
      "grad_norm": 0.7991603371385397,
      "learning_rate": 2.6880198565076227e-05,
      "loss": 1.0918,
      "num_input_tokens_seen": 42405907728,
      "step": 53899
    },
    {
      "epoch": 5.718226182898366,
      "grad_norm": 1.2848466981675708,
      "learning_rate": 2.6879505563769862e-05,
      "loss": 1.1909,
      "num_input_tokens_seen": 42406694448,
      "step": 53900
    },
    {
      "epoch": 5.718332272437937,
      "grad_norm": 0.6925350464965074,
      "learning_rate": 2.687881256101108e-05,
      "loss": 1.1995,
      "num_input_tokens_seen": 42407481200,
      "step": 53901
    },
    {
      "epoch": 5.718438361977509,
      "grad_norm": 0.7715504651349374,
      "learning_rate": 2.6878119556800396e-05,
      "loss": 1.1843,
      "num_input_tokens_seen": 42408267984,
      "step": 53902
    },
    {
      "epoch": 5.71854445151708,
      "grad_norm": 1.1675909749007016,
      "learning_rate": 2.6877426551138368e-05,
      "loss": 1.1331,
      "num_input_tokens_seen": 42409054720,
      "step": 53903
    },
    {
      "epoch": 5.718650541056652,
      "grad_norm": 0.6493710143860921,
      "learning_rate": 2.687673354402551e-05,
      "loss": 1.1494,
      "num_input_tokens_seen": 42409841488,
      "step": 53904
    },
    {
      "epoch": 5.718756630596223,
      "grad_norm": 0.7144201428629894,
      "learning_rate": 2.687604053546237e-05,
      "loss": 1.2059,
      "num_input_tokens_seen": 42410628272,
      "step": 53905
    },
    {
      "epoch": 5.718862720135794,
      "grad_norm": 0.7322207293653099,
      "learning_rate": 2.687534752544949e-05,
      "loss": 1.0451,
      "num_input_tokens_seen": 42411415120,
      "step": 53906
    },
    {
      "epoch": 5.718968809675366,
      "grad_norm": 1.0640833477405365,
      "learning_rate": 2.687465451398739e-05,
      "loss": 1.106,
      "num_input_tokens_seen": 42412201856,
      "step": 53907
    },
    {
      "epoch": 5.719074899214937,
      "grad_norm": 0.6998021345783711,
      "learning_rate": 2.6873961501076605e-05,
      "loss": 1.2045,
      "num_input_tokens_seen": 42412988560,
      "step": 53908
    },
    {
      "epoch": 5.719180988754509,
      "grad_norm": 0.621630349536269,
      "learning_rate": 2.687326848671769e-05,
      "loss": 1.1823,
      "num_input_tokens_seen": 42413775328,
      "step": 53909
    },
    {
      "epoch": 5.71928707829408,
      "grad_norm": 1.0398358347467918,
      "learning_rate": 2.687257547091116e-05,
      "loss": 1.1558,
      "num_input_tokens_seen": 42414562096,
      "step": 53910
    },
    {
      "epoch": 5.719393167833651,
      "grad_norm": 0.7068858449594604,
      "learning_rate": 2.687188245365756e-05,
      "loss": 1.1847,
      "num_input_tokens_seen": 42415348976,
      "step": 53911
    },
    {
      "epoch": 5.719499257373223,
      "grad_norm": 0.7373716252852647,
      "learning_rate": 2.6871189434957423e-05,
      "loss": 1.1961,
      "num_input_tokens_seen": 42416135728,
      "step": 53912
    },
    {
      "epoch": 5.719605346912794,
      "grad_norm": 0.9728354372865303,
      "learning_rate": 2.687049641481129e-05,
      "loss": 1.0967,
      "num_input_tokens_seen": 42416922608,
      "step": 53913
    },
    {
      "epoch": 5.719711436452366,
      "grad_norm": 0.88256600677377,
      "learning_rate": 2.686980339321969e-05,
      "loss": 1.1817,
      "num_input_tokens_seen": 42417709312,
      "step": 53914
    },
    {
      "epoch": 5.719817525991937,
      "grad_norm": 0.6294295523102668,
      "learning_rate": 2.686911037018316e-05,
      "loss": 1.0801,
      "num_input_tokens_seen": 42418496192,
      "step": 53915
    },
    {
      "epoch": 5.719923615531509,
      "grad_norm": 1.1330547568838945,
      "learning_rate": 2.6868417345702242e-05,
      "loss": 1.0958,
      "num_input_tokens_seen": 42419282928,
      "step": 53916
    },
    {
      "epoch": 5.72002970507108,
      "grad_norm": 1.2970383266778958,
      "learning_rate": 2.6867724319777454e-05,
      "loss": 1.1377,
      "num_input_tokens_seen": 42420069728,
      "step": 53917
    },
    {
      "epoch": 5.720135794610651,
      "grad_norm": 0.7123320828721944,
      "learning_rate": 2.686703129240935e-05,
      "loss": 1.263,
      "num_input_tokens_seen": 42420856480,
      "step": 53918
    },
    {
      "epoch": 5.720241884150223,
      "grad_norm": 0.8925519349541228,
      "learning_rate": 2.6866338263598457e-05,
      "loss": 1.2602,
      "num_input_tokens_seen": 42421643152,
      "step": 53919
    },
    {
      "epoch": 5.720347973689794,
      "grad_norm": 0.9844321678534059,
      "learning_rate": 2.686564523334531e-05,
      "loss": 1.1696,
      "num_input_tokens_seen": 42422429888,
      "step": 53920
    },
    {
      "epoch": 5.720454063229366,
      "grad_norm": 0.6970943441667541,
      "learning_rate": 2.6864952201650457e-05,
      "loss": 1.2072,
      "num_input_tokens_seen": 42423216624,
      "step": 53921
    },
    {
      "epoch": 5.720560152768937,
      "grad_norm": 0.824872954089956,
      "learning_rate": 2.6864259168514417e-05,
      "loss": 1.1896,
      "num_input_tokens_seen": 42424003392,
      "step": 53922
    },
    {
      "epoch": 5.720666242308509,
      "grad_norm": 0.936369998261704,
      "learning_rate": 2.6863566133937734e-05,
      "loss": 1.2074,
      "num_input_tokens_seen": 42424790096,
      "step": 53923
    },
    {
      "epoch": 5.72077233184808,
      "grad_norm": 0.6996662908491211,
      "learning_rate": 2.6862873097920942e-05,
      "loss": 1.1799,
      "num_input_tokens_seen": 42425576784,
      "step": 53924
    },
    {
      "epoch": 5.720878421387651,
      "grad_norm": 0.7404001335097788,
      "learning_rate": 2.6862180060464577e-05,
      "loss": 1.2013,
      "num_input_tokens_seen": 42426363536,
      "step": 53925
    },
    {
      "epoch": 5.720984510927223,
      "grad_norm": 1.0296264591805768,
      "learning_rate": 2.686148702156917e-05,
      "loss": 1.1634,
      "num_input_tokens_seen": 42427150304,
      "step": 53926
    },
    {
      "epoch": 5.721090600466794,
      "grad_norm": 0.5828711904138294,
      "learning_rate": 2.6860793981235265e-05,
      "loss": 1.1022,
      "num_input_tokens_seen": 42427937104,
      "step": 53927
    },
    {
      "epoch": 5.721196690006366,
      "grad_norm": 0.7371631143877079,
      "learning_rate": 2.6860100939463385e-05,
      "loss": 1.0667,
      "num_input_tokens_seen": 42428723952,
      "step": 53928
    },
    {
      "epoch": 5.721302779545937,
      "grad_norm": 0.6247243463253823,
      "learning_rate": 2.6859407896254084e-05,
      "loss": 1.1987,
      "num_input_tokens_seen": 42429510752,
      "step": 53929
    },
    {
      "epoch": 5.721408869085508,
      "grad_norm": 0.8881535227876326,
      "learning_rate": 2.6858714851607887e-05,
      "loss": 1.1275,
      "num_input_tokens_seen": 42430297600,
      "step": 53930
    },
    {
      "epoch": 5.72151495862508,
      "grad_norm": 0.6684789547462067,
      "learning_rate": 2.6858021805525318e-05,
      "loss": 1.187,
      "num_input_tokens_seen": 42431084336,
      "step": 53931
    },
    {
      "epoch": 5.721621048164651,
      "grad_norm": 0.6137159076488846,
      "learning_rate": 2.6857328758006933e-05,
      "loss": 1.1366,
      "num_input_tokens_seen": 42431871104,
      "step": 53932
    },
    {
      "epoch": 5.721727137704223,
      "grad_norm": 0.9042564347198393,
      "learning_rate": 2.6856635709053264e-05,
      "loss": 1.1516,
      "num_input_tokens_seen": 42432657888,
      "step": 53933
    },
    {
      "epoch": 5.721833227243794,
      "grad_norm": 0.8507855185702307,
      "learning_rate": 2.685594265866483e-05,
      "loss": 1.1698,
      "num_input_tokens_seen": 42433444672,
      "step": 53934
    },
    {
      "epoch": 5.721939316783365,
      "grad_norm": 0.6426355019366855,
      "learning_rate": 2.685524960684218e-05,
      "loss": 1.0996,
      "num_input_tokens_seen": 42434231376,
      "step": 53935
    },
    {
      "epoch": 5.722045406322937,
      "grad_norm": 0.8014322742285089,
      "learning_rate": 2.685455655358586e-05,
      "loss": 1.1407,
      "num_input_tokens_seen": 42435018144,
      "step": 53936
    },
    {
      "epoch": 5.722151495862508,
      "grad_norm": 1.0047952936086897,
      "learning_rate": 2.6853863498896374e-05,
      "loss": 1.1232,
      "num_input_tokens_seen": 42435805024,
      "step": 53937
    },
    {
      "epoch": 5.72225758540208,
      "grad_norm": 0.6449134933285734,
      "learning_rate": 2.685317044277429e-05,
      "loss": 1.0726,
      "num_input_tokens_seen": 42436591808,
      "step": 53938
    },
    {
      "epoch": 5.722363674941651,
      "grad_norm": 1.103801135991675,
      "learning_rate": 2.6852477385220133e-05,
      "loss": 1.1843,
      "num_input_tokens_seen": 42437378592,
      "step": 53939
    },
    {
      "epoch": 5.722469764481222,
      "grad_norm": 0.8379154580635408,
      "learning_rate": 2.685178432623442e-05,
      "loss": 1.1715,
      "num_input_tokens_seen": 42438165280,
      "step": 53940
    },
    {
      "epoch": 5.722575854020794,
      "grad_norm": 0.6421930443472752,
      "learning_rate": 2.685109126581772e-05,
      "loss": 1.0743,
      "num_input_tokens_seen": 42438952064,
      "step": 53941
    },
    {
      "epoch": 5.722681943560365,
      "grad_norm": 0.7827863317098035,
      "learning_rate": 2.685039820397054e-05,
      "loss": 1.1773,
      "num_input_tokens_seen": 42439738800,
      "step": 53942
    },
    {
      "epoch": 5.7227880330999366,
      "grad_norm": 0.5946091855339769,
      "learning_rate": 2.6849705140693428e-05,
      "loss": 1.1766,
      "num_input_tokens_seen": 42440525600,
      "step": 53943
    },
    {
      "epoch": 5.722894122639508,
      "grad_norm": 0.5476978684705285,
      "learning_rate": 2.684901207598692e-05,
      "loss": 1.1073,
      "num_input_tokens_seen": 42441312400,
      "step": 53944
    },
    {
      "epoch": 5.7230002121790795,
      "grad_norm": 0.6533961444695757,
      "learning_rate": 2.6848319009851546e-05,
      "loss": 1.1483,
      "num_input_tokens_seen": 42442099152,
      "step": 53945
    },
    {
      "epoch": 5.7231063017186505,
      "grad_norm": 0.6553042311673166,
      "learning_rate": 2.6847625942287852e-05,
      "loss": 1.1894,
      "num_input_tokens_seen": 42442885952,
      "step": 53946
    },
    {
      "epoch": 5.723212391258222,
      "grad_norm": 0.6293756502583356,
      "learning_rate": 2.6846932873296366e-05,
      "loss": 1.0933,
      "num_input_tokens_seen": 42443672720,
      "step": 53947
    },
    {
      "epoch": 5.7233184807977935,
      "grad_norm": 0.7942348808300029,
      "learning_rate": 2.6846239802877615e-05,
      "loss": 1.1576,
      "num_input_tokens_seen": 42444459584,
      "step": 53948
    },
    {
      "epoch": 5.7234245703373645,
      "grad_norm": 0.5711520020799262,
      "learning_rate": 2.684554673103215e-05,
      "loss": 1.0846,
      "num_input_tokens_seen": 42445246192,
      "step": 53949
    },
    {
      "epoch": 5.723530659876936,
      "grad_norm": 0.7373920134000829,
      "learning_rate": 2.6844853657760504e-05,
      "loss": 1.234,
      "num_input_tokens_seen": 42446032992,
      "step": 53950
    },
    {
      "epoch": 5.7236367494165075,
      "grad_norm": 0.7430924597988595,
      "learning_rate": 2.6844160583063203e-05,
      "loss": 1.2036,
      "num_input_tokens_seen": 42446819744,
      "step": 53951
    },
    {
      "epoch": 5.723742838956079,
      "grad_norm": 0.6781505350002559,
      "learning_rate": 2.68434675069408e-05,
      "loss": 1.2439,
      "num_input_tokens_seen": 42447606384,
      "step": 53952
    },
    {
      "epoch": 5.72384892849565,
      "grad_norm": 0.8052102942094433,
      "learning_rate": 2.6842774429393814e-05,
      "loss": 1.1943,
      "num_input_tokens_seen": 42448393088,
      "step": 53953
    },
    {
      "epoch": 5.723955018035221,
      "grad_norm": 0.7877250832629651,
      "learning_rate": 2.6842081350422775e-05,
      "loss": 1.0785,
      "num_input_tokens_seen": 42449179872,
      "step": 53954
    },
    {
      "epoch": 5.724061107574793,
      "grad_norm": 0.619389859574084,
      "learning_rate": 2.6841388270028246e-05,
      "loss": 1.2005,
      "num_input_tokens_seen": 42449966592,
      "step": 53955
    },
    {
      "epoch": 5.724167197114364,
      "grad_norm": 0.8169657172151652,
      "learning_rate": 2.684069518821074e-05,
      "loss": 1.1877,
      "num_input_tokens_seen": 42450753360,
      "step": 53956
    },
    {
      "epoch": 5.724273286653936,
      "grad_norm": 0.6989766275928448,
      "learning_rate": 2.684000210497079e-05,
      "loss": 1.1194,
      "num_input_tokens_seen": 42451540128,
      "step": 53957
    },
    {
      "epoch": 5.724379376193507,
      "grad_norm": 0.6416500238056159,
      "learning_rate": 2.683930902030895e-05,
      "loss": 1.1999,
      "num_input_tokens_seen": 42452326896,
      "step": 53958
    },
    {
      "epoch": 5.724485465733078,
      "grad_norm": 0.5294666926374668,
      "learning_rate": 2.6838615934225748e-05,
      "loss": 1.113,
      "num_input_tokens_seen": 42453113712,
      "step": 53959
    },
    {
      "epoch": 5.72459155527265,
      "grad_norm": 0.6435546204834963,
      "learning_rate": 2.683792284672171e-05,
      "loss": 1.1614,
      "num_input_tokens_seen": 42453900512,
      "step": 53960
    },
    {
      "epoch": 5.724697644812221,
      "grad_norm": 0.8722624218610143,
      "learning_rate": 2.6837229757797383e-05,
      "loss": 1.2555,
      "num_input_tokens_seen": 42454687232,
      "step": 53961
    },
    {
      "epoch": 5.724803734351793,
      "grad_norm": 0.7456918991851622,
      "learning_rate": 2.6836536667453294e-05,
      "loss": 1.0908,
      "num_input_tokens_seen": 42455474000,
      "step": 53962
    },
    {
      "epoch": 5.724909823891364,
      "grad_norm": 1.0813652008422612,
      "learning_rate": 2.683584357568999e-05,
      "loss": 1.278,
      "num_input_tokens_seen": 42456260752,
      "step": 53963
    },
    {
      "epoch": 5.725015913430935,
      "grad_norm": 0.5814703957896862,
      "learning_rate": 2.6835150482508002e-05,
      "loss": 1.0811,
      "num_input_tokens_seen": 42457047504,
      "step": 53964
    },
    {
      "epoch": 5.725122002970507,
      "grad_norm": 1.0131023205342022,
      "learning_rate": 2.6834457387907853e-05,
      "loss": 1.1453,
      "num_input_tokens_seen": 42457834336,
      "step": 53965
    },
    {
      "epoch": 5.725228092510078,
      "grad_norm": 1.1713721518045586,
      "learning_rate": 2.68337642918901e-05,
      "loss": 1.1897,
      "num_input_tokens_seen": 42458621104,
      "step": 53966
    },
    {
      "epoch": 5.72533418204965,
      "grad_norm": 0.6549382653947994,
      "learning_rate": 2.683307119445526e-05,
      "loss": 1.1303,
      "num_input_tokens_seen": 42459407904,
      "step": 53967
    },
    {
      "epoch": 5.725440271589221,
      "grad_norm": 0.7337900484448759,
      "learning_rate": 2.6832378095603878e-05,
      "loss": 1.0988,
      "num_input_tokens_seen": 42460194720,
      "step": 53968
    },
    {
      "epoch": 5.725546361128792,
      "grad_norm": 0.76587152787004,
      "learning_rate": 2.6831684995336486e-05,
      "loss": 1.1733,
      "num_input_tokens_seen": 42460981504,
      "step": 53969
    },
    {
      "epoch": 5.725652450668364,
      "grad_norm": 0.7439358766583002,
      "learning_rate": 2.683099189365363e-05,
      "loss": 1.1555,
      "num_input_tokens_seen": 42461768208,
      "step": 53970
    },
    {
      "epoch": 5.725758540207935,
      "grad_norm": 0.5770871173835507,
      "learning_rate": 2.683029879055583e-05,
      "loss": 1.1057,
      "num_input_tokens_seen": 42462554912,
      "step": 53971
    },
    {
      "epoch": 5.725864629747507,
      "grad_norm": 0.7619212799924275,
      "learning_rate": 2.682960568604363e-05,
      "loss": 1.067,
      "num_input_tokens_seen": 42463341712,
      "step": 53972
    },
    {
      "epoch": 5.725970719287078,
      "grad_norm": 0.9754242844442691,
      "learning_rate": 2.6828912580117564e-05,
      "loss": 1.114,
      "num_input_tokens_seen": 42464128560,
      "step": 53973
    },
    {
      "epoch": 5.72607680882665,
      "grad_norm": 0.5418014079151041,
      "learning_rate": 2.6828219472778172e-05,
      "loss": 1.1271,
      "num_input_tokens_seen": 42464915280,
      "step": 53974
    },
    {
      "epoch": 5.726182898366221,
      "grad_norm": 1.0583819700681092,
      "learning_rate": 2.6827526364025983e-05,
      "loss": 1.1621,
      "num_input_tokens_seen": 42465702064,
      "step": 53975
    },
    {
      "epoch": 5.726288987905792,
      "grad_norm": 1.059783063486134,
      "learning_rate": 2.682683325386154e-05,
      "loss": 1.1617,
      "num_input_tokens_seen": 42466488784,
      "step": 53976
    },
    {
      "epoch": 5.726395077445364,
      "grad_norm": 0.5913436213932391,
      "learning_rate": 2.682614014228536e-05,
      "loss": 1.1191,
      "num_input_tokens_seen": 42467275680,
      "step": 53977
    },
    {
      "epoch": 5.726501166984935,
      "grad_norm": 0.9689242934430646,
      "learning_rate": 2.6825447029298007e-05,
      "loss": 1.2163,
      "num_input_tokens_seen": 42468062320,
      "step": 53978
    },
    {
      "epoch": 5.726607256524507,
      "grad_norm": 1.276801564379521,
      "learning_rate": 2.6824753914899998e-05,
      "loss": 1.1949,
      "num_input_tokens_seen": 42468849136,
      "step": 53979
    },
    {
      "epoch": 5.726713346064078,
      "grad_norm": 0.9918147320306454,
      "learning_rate": 2.6824060799091865e-05,
      "loss": 1.2372,
      "num_input_tokens_seen": 42469635920,
      "step": 53980
    },
    {
      "epoch": 5.72681943560365,
      "grad_norm": 1.0512014325674217,
      "learning_rate": 2.682336768187416e-05,
      "loss": 1.2345,
      "num_input_tokens_seen": 42470422672,
      "step": 53981
    },
    {
      "epoch": 5.726925525143221,
      "grad_norm": 1.2928305043506012,
      "learning_rate": 2.682267456324741e-05,
      "loss": 1.1812,
      "num_input_tokens_seen": 42471209440,
      "step": 53982
    },
    {
      "epoch": 5.727031614682792,
      "grad_norm": 0.8401308577366338,
      "learning_rate": 2.6821981443212148e-05,
      "loss": 1.2034,
      "num_input_tokens_seen": 42471996080,
      "step": 53983
    },
    {
      "epoch": 5.727137704222364,
      "grad_norm": 0.7659657892423491,
      "learning_rate": 2.682128832176891e-05,
      "loss": 1.1937,
      "num_input_tokens_seen": 42472782816,
      "step": 53984
    },
    {
      "epoch": 5.727243793761935,
      "grad_norm": 0.9943745963125328,
      "learning_rate": 2.6820595198918242e-05,
      "loss": 1.2058,
      "num_input_tokens_seen": 42473569536,
      "step": 53985
    },
    {
      "epoch": 5.727349883301507,
      "grad_norm": 1.2846085706480797,
      "learning_rate": 2.6819902074660665e-05,
      "loss": 1.1948,
      "num_input_tokens_seen": 42474356352,
      "step": 53986
    },
    {
      "epoch": 5.727455972841078,
      "grad_norm": 0.6476448976790671,
      "learning_rate": 2.681920894899672e-05,
      "loss": 1.153,
      "num_input_tokens_seen": 42475143104,
      "step": 53987
    },
    {
      "epoch": 5.727562062380649,
      "grad_norm": 1.0387020327532293,
      "learning_rate": 2.6818515821926943e-05,
      "loss": 1.2198,
      "num_input_tokens_seen": 42475929904,
      "step": 53988
    },
    {
      "epoch": 5.727668151920221,
      "grad_norm": 0.9261746801137108,
      "learning_rate": 2.6817822693451877e-05,
      "loss": 1.1519,
      "num_input_tokens_seen": 42476716672,
      "step": 53989
    },
    {
      "epoch": 5.727774241459792,
      "grad_norm": 0.5761106623097431,
      "learning_rate": 2.6817129563572047e-05,
      "loss": 1.1728,
      "num_input_tokens_seen": 42477503488,
      "step": 53990
    },
    {
      "epoch": 5.727880330999364,
      "grad_norm": 1.1560954774763936,
      "learning_rate": 2.681643643228799e-05,
      "loss": 1.0871,
      "num_input_tokens_seen": 42478290272,
      "step": 53991
    },
    {
      "epoch": 5.727986420538935,
      "grad_norm": 1.0485297922440464,
      "learning_rate": 2.681574329960025e-05,
      "loss": 1.1603,
      "num_input_tokens_seen": 42479076960,
      "step": 53992
    },
    {
      "epoch": 5.728092510078506,
      "grad_norm": 0.6309127534198883,
      "learning_rate": 2.6815050165509354e-05,
      "loss": 1.1472,
      "num_input_tokens_seen": 42479863680,
      "step": 53993
    },
    {
      "epoch": 5.728198599618078,
      "grad_norm": 0.9652339486766408,
      "learning_rate": 2.6814357030015837e-05,
      "loss": 1.1497,
      "num_input_tokens_seen": 42480650400,
      "step": 53994
    },
    {
      "epoch": 5.728304689157649,
      "grad_norm": 1.0300731831137566,
      "learning_rate": 2.681366389312024e-05,
      "loss": 1.2427,
      "num_input_tokens_seen": 42481437216,
      "step": 53995
    },
    {
      "epoch": 5.728410778697221,
      "grad_norm": 0.6902842122014408,
      "learning_rate": 2.68129707548231e-05,
      "loss": 1.1922,
      "num_input_tokens_seen": 42482223936,
      "step": 53996
    },
    {
      "epoch": 5.728516868236792,
      "grad_norm": 0.7686333999192905,
      "learning_rate": 2.6812277615124943e-05,
      "loss": 1.1327,
      "num_input_tokens_seen": 42483010688,
      "step": 53997
    },
    {
      "epoch": 5.728622957776363,
      "grad_norm": 0.8926961423311051,
      "learning_rate": 2.6811584474026318e-05,
      "loss": 1.1481,
      "num_input_tokens_seen": 42483797424,
      "step": 53998
    },
    {
      "epoch": 5.728729047315935,
      "grad_norm": 0.6596084938443629,
      "learning_rate": 2.6810891331527753e-05,
      "loss": 1.1065,
      "num_input_tokens_seen": 42484584256,
      "step": 53999
    },
    {
      "epoch": 5.728835136855506,
      "grad_norm": 0.6483119028118798,
      "learning_rate": 2.6810198187629782e-05,
      "loss": 1.0938,
      "num_input_tokens_seen": 42485371056,
      "step": 54000
    },
    {
      "epoch": 5.728835136855506,
      "eval_loss": 1.5179351568222046,
      "eval_runtime": 66.1456,
      "eval_samples_per_second": 45.355,
      "eval_steps_per_second": 0.484,
      "num_input_tokens_seen": 42485371056,
      "step": 54000
    },
    {
      "epoch": 5.728941226395078,
      "grad_norm": 0.9002047178882014,
      "learning_rate": 2.6809505042332943e-05,
      "loss": 1.1963,
      "num_input_tokens_seen": 42486157904,
      "step": 54001
    },
    {
      "epoch": 5.729047315934649,
      "grad_norm": 0.6545353137640458,
      "learning_rate": 2.6808811895637775e-05,
      "loss": 1.1856,
      "num_input_tokens_seen": 42486944672,
      "step": 54002
    },
    {
      "epoch": 5.729153405474221,
      "grad_norm": 0.7120634510948919,
      "learning_rate": 2.6808118747544802e-05,
      "loss": 1.0372,
      "num_input_tokens_seen": 42487731456,
      "step": 54003
    },
    {
      "epoch": 5.729259495013792,
      "grad_norm": 0.8640011960360205,
      "learning_rate": 2.6807425598054574e-05,
      "loss": 1.1698,
      "num_input_tokens_seen": 42488518256,
      "step": 54004
    },
    {
      "epoch": 5.7293655845533635,
      "grad_norm": 0.5906124116889195,
      "learning_rate": 2.6806732447167615e-05,
      "loss": 1.1891,
      "num_input_tokens_seen": 42489304944,
      "step": 54005
    },
    {
      "epoch": 5.729471674092935,
      "grad_norm": 0.694964408226528,
      "learning_rate": 2.680603929488448e-05,
      "loss": 1.1224,
      "num_input_tokens_seen": 42490091744,
      "step": 54006
    },
    {
      "epoch": 5.729577763632506,
      "grad_norm": 0.7310363987181997,
      "learning_rate": 2.680534614120568e-05,
      "loss": 1.174,
      "num_input_tokens_seen": 42490878464,
      "step": 54007
    },
    {
      "epoch": 5.7296838531720775,
      "grad_norm": 0.6905682951882489,
      "learning_rate": 2.6804652986131756e-05,
      "loss": 1.3111,
      "num_input_tokens_seen": 42491665264,
      "step": 54008
    },
    {
      "epoch": 5.7297899427116485,
      "grad_norm": 0.6900288061479872,
      "learning_rate": 2.680395982966326e-05,
      "loss": 1.1934,
      "num_input_tokens_seen": 42492452016,
      "step": 54009
    },
    {
      "epoch": 5.7298960322512205,
      "grad_norm": 0.6255012037635145,
      "learning_rate": 2.6803266671800714e-05,
      "loss": 1.1874,
      "num_input_tokens_seen": 42493238768,
      "step": 54010
    },
    {
      "epoch": 5.7300021217907915,
      "grad_norm": 0.6770911630548414,
      "learning_rate": 2.6802573512544654e-05,
      "loss": 1.1525,
      "num_input_tokens_seen": 42494025440,
      "step": 54011
    },
    {
      "epoch": 5.7301082113303625,
      "grad_norm": 0.6121483763038031,
      "learning_rate": 2.680188035189562e-05,
      "loss": 1.2083,
      "num_input_tokens_seen": 42494812192,
      "step": 54012
    },
    {
      "epoch": 5.730214300869934,
      "grad_norm": 0.5782579540304429,
      "learning_rate": 2.680118718985415e-05,
      "loss": 1.1141,
      "num_input_tokens_seen": 42495599008,
      "step": 54013
    },
    {
      "epoch": 5.7303203904095055,
      "grad_norm": 0.6644176231661153,
      "learning_rate": 2.6800494026420762e-05,
      "loss": 1.165,
      "num_input_tokens_seen": 42496385712,
      "step": 54014
    },
    {
      "epoch": 5.730426479949077,
      "grad_norm": 0.7695413660042664,
      "learning_rate": 2.6799800861596012e-05,
      "loss": 1.1779,
      "num_input_tokens_seen": 42497172400,
      "step": 54015
    },
    {
      "epoch": 5.730532569488648,
      "grad_norm": 0.6598830884002396,
      "learning_rate": 2.679910769538043e-05,
      "loss": 1.156,
      "num_input_tokens_seen": 42497959136,
      "step": 54016
    },
    {
      "epoch": 5.7306386590282195,
      "grad_norm": 0.686299296914403,
      "learning_rate": 2.6798414527774553e-05,
      "loss": 1.1117,
      "num_input_tokens_seen": 42498745888,
      "step": 54017
    },
    {
      "epoch": 5.730744748567791,
      "grad_norm": 0.6835738329342295,
      "learning_rate": 2.679772135877891e-05,
      "loss": 1.234,
      "num_input_tokens_seen": 42499532688,
      "step": 54018
    },
    {
      "epoch": 5.730850838107362,
      "grad_norm": 0.6178846579994076,
      "learning_rate": 2.6797028188394047e-05,
      "loss": 1.1693,
      "num_input_tokens_seen": 42500319408,
      "step": 54019
    },
    {
      "epoch": 5.730956927646934,
      "grad_norm": 0.7430518713894619,
      "learning_rate": 2.6796335016620483e-05,
      "loss": 1.2415,
      "num_input_tokens_seen": 42501106160,
      "step": 54020
    },
    {
      "epoch": 5.731063017186505,
      "grad_norm": 0.7280656776998062,
      "learning_rate": 2.679564184345877e-05,
      "loss": 1.1677,
      "num_input_tokens_seen": 42501892848,
      "step": 54021
    },
    {
      "epoch": 5.731169106726076,
      "grad_norm": 0.6663010547298597,
      "learning_rate": 2.679494866890944e-05,
      "loss": 1.1125,
      "num_input_tokens_seen": 42502679616,
      "step": 54022
    },
    {
      "epoch": 5.731275196265648,
      "grad_norm": 0.7942373368505322,
      "learning_rate": 2.6794255492973018e-05,
      "loss": 1.1803,
      "num_input_tokens_seen": 42503466480,
      "step": 54023
    },
    {
      "epoch": 5.731381285805219,
      "grad_norm": 0.8513680921694915,
      "learning_rate": 2.6793562315650056e-05,
      "loss": 1.2024,
      "num_input_tokens_seen": 42504253280,
      "step": 54024
    },
    {
      "epoch": 5.731487375344791,
      "grad_norm": 0.6135300227779482,
      "learning_rate": 2.6792869136941085e-05,
      "loss": 1.2828,
      "num_input_tokens_seen": 42505040032,
      "step": 54025
    },
    {
      "epoch": 5.731593464884362,
      "grad_norm": 0.8367637270334201,
      "learning_rate": 2.6792175956846628e-05,
      "loss": 1.1399,
      "num_input_tokens_seen": 42505826800,
      "step": 54026
    },
    {
      "epoch": 5.731699554423933,
      "grad_norm": 0.9136625267603776,
      "learning_rate": 2.679148277536723e-05,
      "loss": 1.0929,
      "num_input_tokens_seen": 42506613520,
      "step": 54027
    },
    {
      "epoch": 5.731805643963505,
      "grad_norm": 0.7105881341602199,
      "learning_rate": 2.6790789592503434e-05,
      "loss": 1.1912,
      "num_input_tokens_seen": 42507400336,
      "step": 54028
    },
    {
      "epoch": 5.731911733503076,
      "grad_norm": 0.7435753038386137,
      "learning_rate": 2.6790096408255768e-05,
      "loss": 1.1598,
      "num_input_tokens_seen": 42508187152,
      "step": 54029
    },
    {
      "epoch": 5.732017823042648,
      "grad_norm": 0.6687829896686647,
      "learning_rate": 2.6789403222624764e-05,
      "loss": 1.1796,
      "num_input_tokens_seen": 42508973968,
      "step": 54030
    },
    {
      "epoch": 5.732123912582219,
      "grad_norm": 0.49966781418261214,
      "learning_rate": 2.678871003561096e-05,
      "loss": 1.1062,
      "num_input_tokens_seen": 42509760768,
      "step": 54031
    },
    {
      "epoch": 5.732230002121791,
      "grad_norm": 0.6006249123149912,
      "learning_rate": 2.67880168472149e-05,
      "loss": 1.1482,
      "num_input_tokens_seen": 42510547568,
      "step": 54032
    },
    {
      "epoch": 5.732336091661362,
      "grad_norm": 0.6695193117222662,
      "learning_rate": 2.6787323657437107e-05,
      "loss": 1.1288,
      "num_input_tokens_seen": 42511334416,
      "step": 54033
    },
    {
      "epoch": 5.732442181200934,
      "grad_norm": 0.8303130173471283,
      "learning_rate": 2.6786630466278116e-05,
      "loss": 1.1497,
      "num_input_tokens_seen": 42512121216,
      "step": 54034
    },
    {
      "epoch": 5.732548270740505,
      "grad_norm": 0.742539241768886,
      "learning_rate": 2.6785937273738482e-05,
      "loss": 1.0627,
      "num_input_tokens_seen": 42512908112,
      "step": 54035
    },
    {
      "epoch": 5.732654360280076,
      "grad_norm": 0.7816254014629346,
      "learning_rate": 2.6785244079818726e-05,
      "loss": 1.1715,
      "num_input_tokens_seen": 42513694864,
      "step": 54036
    },
    {
      "epoch": 5.732760449819648,
      "grad_norm": 0.6921037584152584,
      "learning_rate": 2.6784550884519384e-05,
      "loss": 1.1389,
      "num_input_tokens_seen": 42514481616,
      "step": 54037
    },
    {
      "epoch": 5.732866539359219,
      "grad_norm": 0.677531725254085,
      "learning_rate": 2.6783857687840998e-05,
      "loss": 1.2187,
      "num_input_tokens_seen": 42515268304,
      "step": 54038
    },
    {
      "epoch": 5.732972628898791,
      "grad_norm": 1.2939194270278156,
      "learning_rate": 2.678316448978409e-05,
      "loss": 1.1299,
      "num_input_tokens_seen": 42516055152,
      "step": 54039
    },
    {
      "epoch": 5.733078718438362,
      "grad_norm": 0.7229901784524201,
      "learning_rate": 2.678247129034921e-05,
      "loss": 1.1911,
      "num_input_tokens_seen": 42516841936,
      "step": 54040
    },
    {
      "epoch": 5.733184807977933,
      "grad_norm": 0.8610683071881342,
      "learning_rate": 2.6781778089536886e-05,
      "loss": 1.2121,
      "num_input_tokens_seen": 42517628672,
      "step": 54041
    },
    {
      "epoch": 5.733290897517505,
      "grad_norm": 0.79564514088671,
      "learning_rate": 2.6781084887347663e-05,
      "loss": 1.1854,
      "num_input_tokens_seen": 42518415360,
      "step": 54042
    },
    {
      "epoch": 5.733396987057076,
      "grad_norm": 0.6063025189294188,
      "learning_rate": 2.678039168378206e-05,
      "loss": 1.1539,
      "num_input_tokens_seen": 42519202064,
      "step": 54043
    },
    {
      "epoch": 5.733503076596648,
      "grad_norm": 0.8552937222584367,
      "learning_rate": 2.6779698478840632e-05,
      "loss": 1.1391,
      "num_input_tokens_seen": 42519988816,
      "step": 54044
    },
    {
      "epoch": 5.733609166136219,
      "grad_norm": 0.7440017574641823,
      "learning_rate": 2.67790052725239e-05,
      "loss": 1.2009,
      "num_input_tokens_seen": 42520775600,
      "step": 54045
    },
    {
      "epoch": 5.73371525567579,
      "grad_norm": 0.6768672142573056,
      "learning_rate": 2.67783120648324e-05,
      "loss": 1.1757,
      "num_input_tokens_seen": 42521562304,
      "step": 54046
    },
    {
      "epoch": 5.733821345215362,
      "grad_norm": 0.8120073913826795,
      "learning_rate": 2.677761885576668e-05,
      "loss": 1.0594,
      "num_input_tokens_seen": 42522349088,
      "step": 54047
    },
    {
      "epoch": 5.733927434754933,
      "grad_norm": 0.7985763098376648,
      "learning_rate": 2.6776925645327266e-05,
      "loss": 1.2128,
      "num_input_tokens_seen": 42523135840,
      "step": 54048
    },
    {
      "epoch": 5.734033524294505,
      "grad_norm": 0.7727704074025166,
      "learning_rate": 2.67762324335147e-05,
      "loss": 1.1755,
      "num_input_tokens_seen": 42523922560,
      "step": 54049
    },
    {
      "epoch": 5.734139613834076,
      "grad_norm": 0.720638684003295,
      "learning_rate": 2.677553922032951e-05,
      "loss": 1.1879,
      "num_input_tokens_seen": 42524709360,
      "step": 54050
    },
    {
      "epoch": 5.734245703373647,
      "grad_norm": 0.7525206867628279,
      "learning_rate": 2.677484600577223e-05,
      "loss": 1.1661,
      "num_input_tokens_seen": 42525496096,
      "step": 54051
    },
    {
      "epoch": 5.734351792913219,
      "grad_norm": 0.5912953341292909,
      "learning_rate": 2.677415278984341e-05,
      "loss": 1.097,
      "num_input_tokens_seen": 42526282784,
      "step": 54052
    },
    {
      "epoch": 5.73445788245279,
      "grad_norm": 0.6051992906654836,
      "learning_rate": 2.6773459572543574e-05,
      "loss": 1.0782,
      "num_input_tokens_seen": 42527069600,
      "step": 54053
    },
    {
      "epoch": 5.734563971992362,
      "grad_norm": 1.36875098792162,
      "learning_rate": 2.6772766353873258e-05,
      "loss": 1.1354,
      "num_input_tokens_seen": 42527856352,
      "step": 54054
    },
    {
      "epoch": 5.734670061531933,
      "grad_norm": 0.6194600526342214,
      "learning_rate": 2.6772073133833005e-05,
      "loss": 1.0634,
      "num_input_tokens_seen": 42528643136,
      "step": 54055
    },
    {
      "epoch": 5.734776151071505,
      "grad_norm": 0.6357008718752934,
      "learning_rate": 2.677137991242334e-05,
      "loss": 1.2298,
      "num_input_tokens_seen": 42529429920,
      "step": 54056
    },
    {
      "epoch": 5.734882240611076,
      "grad_norm": 0.8173380258662929,
      "learning_rate": 2.6770686689644803e-05,
      "loss": 1.1767,
      "num_input_tokens_seen": 42530216752,
      "step": 54057
    },
    {
      "epoch": 5.734988330150647,
      "grad_norm": 0.8854984419585875,
      "learning_rate": 2.6769993465497937e-05,
      "loss": 1.219,
      "num_input_tokens_seen": 42531003472,
      "step": 54058
    },
    {
      "epoch": 5.735094419690219,
      "grad_norm": 0.7040589658489455,
      "learning_rate": 2.6769300239983273e-05,
      "loss": 1.2247,
      "num_input_tokens_seen": 42531790304,
      "step": 54059
    },
    {
      "epoch": 5.73520050922979,
      "grad_norm": 0.7823670928459227,
      "learning_rate": 2.6768607013101342e-05,
      "loss": 1.1938,
      "num_input_tokens_seen": 42532577120,
      "step": 54060
    },
    {
      "epoch": 5.735306598769362,
      "grad_norm": 0.8919132649049706,
      "learning_rate": 2.676791378485269e-05,
      "loss": 1.1459,
      "num_input_tokens_seen": 42533363856,
      "step": 54061
    },
    {
      "epoch": 5.735412688308933,
      "grad_norm": 0.8756929541078401,
      "learning_rate": 2.6767220555237837e-05,
      "loss": 1.212,
      "num_input_tokens_seen": 42534150608,
      "step": 54062
    },
    {
      "epoch": 5.735518777848505,
      "grad_norm": 0.6446636827861522,
      "learning_rate": 2.6766527324257323e-05,
      "loss": 1.1908,
      "num_input_tokens_seen": 42534937296,
      "step": 54063
    },
    {
      "epoch": 5.735624867388076,
      "grad_norm": 0.7690613335211162,
      "learning_rate": 2.67658340919117e-05,
      "loss": 1.2236,
      "num_input_tokens_seen": 42535724016,
      "step": 54064
    },
    {
      "epoch": 5.735730956927647,
      "grad_norm": 0.9272011258374742,
      "learning_rate": 2.6765140858201492e-05,
      "loss": 1.1328,
      "num_input_tokens_seen": 42536510768,
      "step": 54065
    },
    {
      "epoch": 5.735837046467219,
      "grad_norm": 0.6486791115744768,
      "learning_rate": 2.676444762312723e-05,
      "loss": 1.2073,
      "num_input_tokens_seen": 42537297488,
      "step": 54066
    },
    {
      "epoch": 5.73594313600679,
      "grad_norm": 0.8937629281666833,
      "learning_rate": 2.676375438668946e-05,
      "loss": 1.1892,
      "num_input_tokens_seen": 42538084240,
      "step": 54067
    },
    {
      "epoch": 5.7360492255463615,
      "grad_norm": 0.7035093444013205,
      "learning_rate": 2.6763061148888712e-05,
      "loss": 1.1826,
      "num_input_tokens_seen": 42538870960,
      "step": 54068
    },
    {
      "epoch": 5.736155315085933,
      "grad_norm": 0.642355230759324,
      "learning_rate": 2.6762367909725518e-05,
      "loss": 1.1312,
      "num_input_tokens_seen": 42539657616,
      "step": 54069
    },
    {
      "epoch": 5.736261404625504,
      "grad_norm": 0.6846324326703961,
      "learning_rate": 2.6761674669200413e-05,
      "loss": 1.2154,
      "num_input_tokens_seen": 42540444352,
      "step": 54070
    },
    {
      "epoch": 5.7363674941650755,
      "grad_norm": 0.7511906336567185,
      "learning_rate": 2.6760981427313947e-05,
      "loss": 1.1615,
      "num_input_tokens_seen": 42541231008,
      "step": 54071
    },
    {
      "epoch": 5.7364735837046466,
      "grad_norm": 0.6199578770838285,
      "learning_rate": 2.676028818406664e-05,
      "loss": 1.1359,
      "num_input_tokens_seen": 42542017792,
      "step": 54072
    },
    {
      "epoch": 5.7365796732442185,
      "grad_norm": 0.6435084368488388,
      "learning_rate": 2.6759594939459042e-05,
      "loss": 1.2964,
      "num_input_tokens_seen": 42542804480,
      "step": 54073
    },
    {
      "epoch": 5.7366857627837895,
      "grad_norm": 0.6707619563610046,
      "learning_rate": 2.6758901693491673e-05,
      "loss": 1.2304,
      "num_input_tokens_seen": 42543591232,
      "step": 54074
    },
    {
      "epoch": 5.7367918523233605,
      "grad_norm": 0.5862756407791023,
      "learning_rate": 2.6758208446165077e-05,
      "loss": 1.2616,
      "num_input_tokens_seen": 42544377904,
      "step": 54075
    },
    {
      "epoch": 5.7368979418629324,
      "grad_norm": 0.5824404088118935,
      "learning_rate": 2.6757515197479793e-05,
      "loss": 1.0871,
      "num_input_tokens_seen": 42545164768,
      "step": 54076
    },
    {
      "epoch": 5.7370040314025035,
      "grad_norm": 0.539886241969005,
      "learning_rate": 2.6756821947436352e-05,
      "loss": 1.0874,
      "num_input_tokens_seen": 42545951520,
      "step": 54077
    },
    {
      "epoch": 5.737110120942075,
      "grad_norm": 0.6288517937384933,
      "learning_rate": 2.6756128696035287e-05,
      "loss": 1.12,
      "num_input_tokens_seen": 42546738304,
      "step": 54078
    },
    {
      "epoch": 5.737216210481646,
      "grad_norm": 0.7386177452965201,
      "learning_rate": 2.6755435443277143e-05,
      "loss": 1.2447,
      "num_input_tokens_seen": 42547525088,
      "step": 54079
    },
    {
      "epoch": 5.7373223000212175,
      "grad_norm": 0.661874820338762,
      "learning_rate": 2.6754742189162442e-05,
      "loss": 1.0921,
      "num_input_tokens_seen": 42548311808,
      "step": 54080
    },
    {
      "epoch": 5.737428389560789,
      "grad_norm": 0.5757340668215255,
      "learning_rate": 2.6754048933691732e-05,
      "loss": 1.1256,
      "num_input_tokens_seen": 42549098496,
      "step": 54081
    },
    {
      "epoch": 5.73753447910036,
      "grad_norm": 0.5972250191374782,
      "learning_rate": 2.675335567686555e-05,
      "loss": 1.1785,
      "num_input_tokens_seen": 42549885184,
      "step": 54082
    },
    {
      "epoch": 5.737640568639932,
      "grad_norm": 0.6659846297208022,
      "learning_rate": 2.6752662418684417e-05,
      "loss": 1.1651,
      "num_input_tokens_seen": 42550671920,
      "step": 54083
    },
    {
      "epoch": 5.737746658179503,
      "grad_norm": 0.6362854623010962,
      "learning_rate": 2.675196915914888e-05,
      "loss": 1.142,
      "num_input_tokens_seen": 42551458704,
      "step": 54084
    },
    {
      "epoch": 5.737852747719075,
      "grad_norm": 0.6557978564416745,
      "learning_rate": 2.675127589825948e-05,
      "loss": 1.1542,
      "num_input_tokens_seen": 42552245440,
      "step": 54085
    },
    {
      "epoch": 5.737958837258646,
      "grad_norm": 0.5915399929316191,
      "learning_rate": 2.6750582636016737e-05,
      "loss": 1.1101,
      "num_input_tokens_seen": 42553032192,
      "step": 54086
    },
    {
      "epoch": 5.738064926798217,
      "grad_norm": 0.7098362641843174,
      "learning_rate": 2.67498893724212e-05,
      "loss": 1.1451,
      "num_input_tokens_seen": 42553818864,
      "step": 54087
    },
    {
      "epoch": 5.738171016337789,
      "grad_norm": 0.7030252851910691,
      "learning_rate": 2.67491961074734e-05,
      "loss": 1.205,
      "num_input_tokens_seen": 42554605584,
      "step": 54088
    },
    {
      "epoch": 5.73827710587736,
      "grad_norm": 0.7171287789808846,
      "learning_rate": 2.6748502841173866e-05,
      "loss": 1.1625,
      "num_input_tokens_seen": 42555392304,
      "step": 54089
    },
    {
      "epoch": 5.738383195416932,
      "grad_norm": 0.8109649769541223,
      "learning_rate": 2.674780957352315e-05,
      "loss": 1.1049,
      "num_input_tokens_seen": 42556179184,
      "step": 54090
    },
    {
      "epoch": 5.738489284956503,
      "grad_norm": 0.5959407506500565,
      "learning_rate": 2.674711630452177e-05,
      "loss": 1.0526,
      "num_input_tokens_seen": 42556966000,
      "step": 54091
    },
    {
      "epoch": 5.738595374496075,
      "grad_norm": 0.6231298635944681,
      "learning_rate": 2.674642303417027e-05,
      "loss": 1.1341,
      "num_input_tokens_seen": 42557752800,
      "step": 54092
    },
    {
      "epoch": 5.738701464035646,
      "grad_norm": 0.8360119558020073,
      "learning_rate": 2.674572976246919e-05,
      "loss": 1.2337,
      "num_input_tokens_seen": 42558539648,
      "step": 54093
    },
    {
      "epoch": 5.738807553575217,
      "grad_norm": 0.6594879258491176,
      "learning_rate": 2.6745036489419056e-05,
      "loss": 1.1174,
      "num_input_tokens_seen": 42559326432,
      "step": 54094
    },
    {
      "epoch": 5.738913643114789,
      "grad_norm": 0.8151249613458135,
      "learning_rate": 2.6744343215020417e-05,
      "loss": 1.1725,
      "num_input_tokens_seen": 42560113104,
      "step": 54095
    },
    {
      "epoch": 5.73901973265436,
      "grad_norm": 0.7243852413623925,
      "learning_rate": 2.6743649939273795e-05,
      "loss": 1.1118,
      "num_input_tokens_seen": 42560899920,
      "step": 54096
    },
    {
      "epoch": 5.739125822193932,
      "grad_norm": 0.6744961883862474,
      "learning_rate": 2.674295666217973e-05,
      "loss": 1.0827,
      "num_input_tokens_seen": 42561686608,
      "step": 54097
    },
    {
      "epoch": 5.739231911733503,
      "grad_norm": 0.7182995609862094,
      "learning_rate": 2.6742263383738765e-05,
      "loss": 1.1572,
      "num_input_tokens_seen": 42562473456,
      "step": 54098
    },
    {
      "epoch": 5.739338001273074,
      "grad_norm": 0.7666217963469278,
      "learning_rate": 2.674157010395143e-05,
      "loss": 1.0651,
      "num_input_tokens_seen": 42563260176,
      "step": 54099
    },
    {
      "epoch": 5.739444090812646,
      "grad_norm": 0.6971335582432264,
      "learning_rate": 2.674087682281825e-05,
      "loss": 1.1185,
      "num_input_tokens_seen": 42564047072,
      "step": 54100
    },
    {
      "epoch": 5.739550180352217,
      "grad_norm": 0.6297677323284665,
      "learning_rate": 2.6740183540339785e-05,
      "loss": 1.1374,
      "num_input_tokens_seen": 42564833824,
      "step": 54101
    },
    {
      "epoch": 5.739656269891789,
      "grad_norm": 0.6870496369102156,
      "learning_rate": 2.6739490256516552e-05,
      "loss": 1.0847,
      "num_input_tokens_seen": 42565620672,
      "step": 54102
    },
    {
      "epoch": 5.73976235943136,
      "grad_norm": 0.7895464885521661,
      "learning_rate": 2.673879697134909e-05,
      "loss": 1.1767,
      "num_input_tokens_seen": 42566407376,
      "step": 54103
    },
    {
      "epoch": 5.739868448970931,
      "grad_norm": 0.7190591514786576,
      "learning_rate": 2.673810368483794e-05,
      "loss": 1.1749,
      "num_input_tokens_seen": 42567194080,
      "step": 54104
    },
    {
      "epoch": 5.739974538510503,
      "grad_norm": 0.7578048157374869,
      "learning_rate": 2.673741039698363e-05,
      "loss": 1.2045,
      "num_input_tokens_seen": 42567980880,
      "step": 54105
    },
    {
      "epoch": 5.740080628050074,
      "grad_norm": 0.5746154921439902,
      "learning_rate": 2.6736717107786702e-05,
      "loss": 1.1789,
      "num_input_tokens_seen": 42568767568,
      "step": 54106
    },
    {
      "epoch": 5.740186717589646,
      "grad_norm": 0.6029449762573968,
      "learning_rate": 2.673602381724769e-05,
      "loss": 1.1755,
      "num_input_tokens_seen": 42569554416,
      "step": 54107
    },
    {
      "epoch": 5.740292807129217,
      "grad_norm": 0.676983699637709,
      "learning_rate": 2.673533052536713e-05,
      "loss": 1.0985,
      "num_input_tokens_seen": 42570341168,
      "step": 54108
    },
    {
      "epoch": 5.740398896668788,
      "grad_norm": 0.7022976789167366,
      "learning_rate": 2.673463723214556e-05,
      "loss": 1.1617,
      "num_input_tokens_seen": 42571127904,
      "step": 54109
    },
    {
      "epoch": 5.74050498620836,
      "grad_norm": 0.7176498188589423,
      "learning_rate": 2.6733943937583506e-05,
      "loss": 1.2217,
      "num_input_tokens_seen": 42571914672,
      "step": 54110
    },
    {
      "epoch": 5.740611075747931,
      "grad_norm": 0.6229413004579146,
      "learning_rate": 2.673325064168152e-05,
      "loss": 1.1824,
      "num_input_tokens_seen": 42572701504,
      "step": 54111
    },
    {
      "epoch": 5.740717165287503,
      "grad_norm": 0.5419619242822522,
      "learning_rate": 2.6732557344440118e-05,
      "loss": 1.0941,
      "num_input_tokens_seen": 42573488304,
      "step": 54112
    },
    {
      "epoch": 5.740823254827074,
      "grad_norm": 0.5586448320181996,
      "learning_rate": 2.6731864045859857e-05,
      "loss": 1.1423,
      "num_input_tokens_seen": 42574275120,
      "step": 54113
    },
    {
      "epoch": 5.740929344366646,
      "grad_norm": 0.8413956661041326,
      "learning_rate": 2.673117074594126e-05,
      "loss": 1.1238,
      "num_input_tokens_seen": 42575061968,
      "step": 54114
    },
    {
      "epoch": 5.741035433906217,
      "grad_norm": 0.5756648846012324,
      "learning_rate": 2.673047744468486e-05,
      "loss": 1.1949,
      "num_input_tokens_seen": 42575848720,
      "step": 54115
    },
    {
      "epoch": 5.741141523445788,
      "grad_norm": 0.6208623383606979,
      "learning_rate": 2.6729784142091202e-05,
      "loss": 1.1149,
      "num_input_tokens_seen": 42576635456,
      "step": 54116
    },
    {
      "epoch": 5.74124761298536,
      "grad_norm": 0.6960078077759683,
      "learning_rate": 2.6729090838160813e-05,
      "loss": 1.2289,
      "num_input_tokens_seen": 42577422192,
      "step": 54117
    },
    {
      "epoch": 5.741353702524931,
      "grad_norm": 0.6192931721126153,
      "learning_rate": 2.672839753289424e-05,
      "loss": 1.2192,
      "num_input_tokens_seen": 42578208992,
      "step": 54118
    },
    {
      "epoch": 5.741459792064503,
      "grad_norm": 0.5864325247782772,
      "learning_rate": 2.672770422629201e-05,
      "loss": 1.0472,
      "num_input_tokens_seen": 42578995872,
      "step": 54119
    },
    {
      "epoch": 5.741565881604074,
      "grad_norm": 0.7070549023970809,
      "learning_rate": 2.672701091835466e-05,
      "loss": 1.1887,
      "num_input_tokens_seen": 42579782624,
      "step": 54120
    },
    {
      "epoch": 5.741671971143646,
      "grad_norm": 0.6353353461901463,
      "learning_rate": 2.672631760908273e-05,
      "loss": 1.1445,
      "num_input_tokens_seen": 42580569328,
      "step": 54121
    },
    {
      "epoch": 5.741778060683217,
      "grad_norm": 0.6481553848326449,
      "learning_rate": 2.6725624298476748e-05,
      "loss": 1.1476,
      "num_input_tokens_seen": 42581356144,
      "step": 54122
    },
    {
      "epoch": 5.741884150222788,
      "grad_norm": 0.5969022593427563,
      "learning_rate": 2.6724930986537255e-05,
      "loss": 1.1385,
      "num_input_tokens_seen": 42582142880,
      "step": 54123
    },
    {
      "epoch": 5.74199023976236,
      "grad_norm": 0.707450431189078,
      "learning_rate": 2.6724237673264784e-05,
      "loss": 1.268,
      "num_input_tokens_seen": 42582929648,
      "step": 54124
    },
    {
      "epoch": 5.742096329301931,
      "grad_norm": 0.6909221058233421,
      "learning_rate": 2.672354435865988e-05,
      "loss": 1.1015,
      "num_input_tokens_seen": 42583716416,
      "step": 54125
    },
    {
      "epoch": 5.742202418841503,
      "grad_norm": 0.6247340405956878,
      "learning_rate": 2.672285104272306e-05,
      "loss": 1.107,
      "num_input_tokens_seen": 42584503184,
      "step": 54126
    },
    {
      "epoch": 5.742308508381074,
      "grad_norm": 0.6342280963936713,
      "learning_rate": 2.672215772545488e-05,
      "loss": 1.1908,
      "num_input_tokens_seen": 42585289936,
      "step": 54127
    },
    {
      "epoch": 5.742414597920645,
      "grad_norm": 0.8783249128208911,
      "learning_rate": 2.6721464406855874e-05,
      "loss": 1.1525,
      "num_input_tokens_seen": 42586076672,
      "step": 54128
    },
    {
      "epoch": 5.742520687460217,
      "grad_norm": 0.5882234842654942,
      "learning_rate": 2.6720771086926554e-05,
      "loss": 1.2067,
      "num_input_tokens_seen": 42586863408,
      "step": 54129
    },
    {
      "epoch": 5.742626776999788,
      "grad_norm": 0.6182892673302277,
      "learning_rate": 2.6720077765667483e-05,
      "loss": 1.2177,
      "num_input_tokens_seen": 42587650240,
      "step": 54130
    },
    {
      "epoch": 5.7427328665393595,
      "grad_norm": 0.7224233871988841,
      "learning_rate": 2.6719384443079187e-05,
      "loss": 1.1151,
      "num_input_tokens_seen": 42588436992,
      "step": 54131
    },
    {
      "epoch": 5.742838956078931,
      "grad_norm": 0.6706499902917729,
      "learning_rate": 2.6718691119162192e-05,
      "loss": 1.1189,
      "num_input_tokens_seen": 42589223840,
      "step": 54132
    },
    {
      "epoch": 5.742945045618502,
      "grad_norm": 0.5857379881802767,
      "learning_rate": 2.6717997793917055e-05,
      "loss": 1.0785,
      "num_input_tokens_seen": 42590010592,
      "step": 54133
    },
    {
      "epoch": 5.7430511351580735,
      "grad_norm": 0.6580165229044919,
      "learning_rate": 2.671730446734429e-05,
      "loss": 1.1811,
      "num_input_tokens_seen": 42590797376,
      "step": 54134
    },
    {
      "epoch": 5.743157224697645,
      "grad_norm": 0.5978582558419118,
      "learning_rate": 2.6716611139444447e-05,
      "loss": 1.1546,
      "num_input_tokens_seen": 42591584096,
      "step": 54135
    },
    {
      "epoch": 5.7432633142372165,
      "grad_norm": 0.5859368534289718,
      "learning_rate": 2.6715917810218055e-05,
      "loss": 1.1647,
      "num_input_tokens_seen": 42592370832,
      "step": 54136
    },
    {
      "epoch": 5.7433694037767875,
      "grad_norm": 0.6884090773892064,
      "learning_rate": 2.671522447966565e-05,
      "loss": 1.1449,
      "num_input_tokens_seen": 42593157568,
      "step": 54137
    },
    {
      "epoch": 5.7434754933163585,
      "grad_norm": 0.7401056784920412,
      "learning_rate": 2.6714531147787776e-05,
      "loss": 1.2158,
      "num_input_tokens_seen": 42593944336,
      "step": 54138
    },
    {
      "epoch": 5.7435815828559305,
      "grad_norm": 0.7719762922000406,
      "learning_rate": 2.6713837814584964e-05,
      "loss": 1.0996,
      "num_input_tokens_seen": 42594731120,
      "step": 54139
    },
    {
      "epoch": 5.7436876723955015,
      "grad_norm": 0.5567538775322288,
      "learning_rate": 2.671314448005774e-05,
      "loss": 1.1096,
      "num_input_tokens_seen": 42595517872,
      "step": 54140
    },
    {
      "epoch": 5.743793761935073,
      "grad_norm": 0.6075651625852078,
      "learning_rate": 2.6712451144206653e-05,
      "loss": 1.2053,
      "num_input_tokens_seen": 42596304592,
      "step": 54141
    },
    {
      "epoch": 5.743899851474644,
      "grad_norm": 0.6635018876093367,
      "learning_rate": 2.671175780703224e-05,
      "loss": 1.2017,
      "num_input_tokens_seen": 42597091344,
      "step": 54142
    },
    {
      "epoch": 5.744005941014216,
      "grad_norm": 0.5684416245277498,
      "learning_rate": 2.671106446853502e-05,
      "loss": 1.192,
      "num_input_tokens_seen": 42597878080,
      "step": 54143
    },
    {
      "epoch": 5.744112030553787,
      "grad_norm": 0.6010400214224734,
      "learning_rate": 2.6710371128715545e-05,
      "loss": 1.1003,
      "num_input_tokens_seen": 42598664864,
      "step": 54144
    },
    {
      "epoch": 5.744218120093358,
      "grad_norm": 0.8203767515068243,
      "learning_rate": 2.6709677787574345e-05,
      "loss": 1.1512,
      "num_input_tokens_seen": 42599451680,
      "step": 54145
    },
    {
      "epoch": 5.74432420963293,
      "grad_norm": 0.6546656356758603,
      "learning_rate": 2.6708984445111952e-05,
      "loss": 1.2212,
      "num_input_tokens_seen": 42600238544,
      "step": 54146
    },
    {
      "epoch": 5.744430299172501,
      "grad_norm": 0.5754649583013336,
      "learning_rate": 2.6708291101328907e-05,
      "loss": 1.2054,
      "num_input_tokens_seen": 42601025280,
      "step": 54147
    },
    {
      "epoch": 5.744536388712073,
      "grad_norm": 0.611937510553828,
      "learning_rate": 2.6707597756225754e-05,
      "loss": 1.1891,
      "num_input_tokens_seen": 42601812080,
      "step": 54148
    },
    {
      "epoch": 5.744642478251644,
      "grad_norm": 0.6306911863203397,
      "learning_rate": 2.6706904409803008e-05,
      "loss": 1.1419,
      "num_input_tokens_seen": 42602598800,
      "step": 54149
    },
    {
      "epoch": 5.744748567791216,
      "grad_norm": 0.6903856104286686,
      "learning_rate": 2.6706211062061225e-05,
      "loss": 1.1827,
      "num_input_tokens_seen": 42603385584,
      "step": 54150
    },
    {
      "epoch": 5.744854657330787,
      "grad_norm": 0.6669133213278481,
      "learning_rate": 2.670551771300092e-05,
      "loss": 1.1834,
      "num_input_tokens_seen": 42604172320,
      "step": 54151
    },
    {
      "epoch": 5.744960746870358,
      "grad_norm": 0.6117304652271083,
      "learning_rate": 2.6704824362622656e-05,
      "loss": 1.1382,
      "num_input_tokens_seen": 42604959152,
      "step": 54152
    },
    {
      "epoch": 5.74506683640993,
      "grad_norm": 0.7755852522786851,
      "learning_rate": 2.6704131010926947e-05,
      "loss": 1.2112,
      "num_input_tokens_seen": 42605745920,
      "step": 54153
    },
    {
      "epoch": 5.745172925949501,
      "grad_norm": 0.7552960434798458,
      "learning_rate": 2.6703437657914333e-05,
      "loss": 1.2343,
      "num_input_tokens_seen": 42606532784,
      "step": 54154
    },
    {
      "epoch": 5.745279015489073,
      "grad_norm": 0.858253844571024,
      "learning_rate": 2.6702744303585358e-05,
      "loss": 1.1876,
      "num_input_tokens_seen": 42607319616,
      "step": 54155
    },
    {
      "epoch": 5.745385105028644,
      "grad_norm": 0.7210017425684163,
      "learning_rate": 2.6702050947940548e-05,
      "loss": 1.1773,
      "num_input_tokens_seen": 42608106384,
      "step": 54156
    },
    {
      "epoch": 5.745491194568215,
      "grad_norm": 0.6996403067027722,
      "learning_rate": 2.670135759098044e-05,
      "loss": 1.0225,
      "num_input_tokens_seen": 42608893216,
      "step": 54157
    },
    {
      "epoch": 5.745597284107787,
      "grad_norm": 0.703004474349323,
      "learning_rate": 2.6700664232705573e-05,
      "loss": 1.1288,
      "num_input_tokens_seen": 42609679936,
      "step": 54158
    },
    {
      "epoch": 5.745703373647358,
      "grad_norm": 0.5730979019293858,
      "learning_rate": 2.6699970873116493e-05,
      "loss": 1.1939,
      "num_input_tokens_seen": 42610466688,
      "step": 54159
    },
    {
      "epoch": 5.74580946318693,
      "grad_norm": 1.0171202166297368,
      "learning_rate": 2.6699277512213716e-05,
      "loss": 1.2223,
      "num_input_tokens_seen": 42611253488,
      "step": 54160
    },
    {
      "epoch": 5.745915552726501,
      "grad_norm": 0.6606193980982089,
      "learning_rate": 2.669858414999779e-05,
      "loss": 1.1465,
      "num_input_tokens_seen": 42612040320,
      "step": 54161
    },
    {
      "epoch": 5.746021642266072,
      "grad_norm": 0.7458918102076737,
      "learning_rate": 2.6697890786469248e-05,
      "loss": 1.3024,
      "num_input_tokens_seen": 42612827072,
      "step": 54162
    },
    {
      "epoch": 5.746127731805644,
      "grad_norm": 0.8088666304929879,
      "learning_rate": 2.669719742162862e-05,
      "loss": 1.115,
      "num_input_tokens_seen": 42613613824,
      "step": 54163
    },
    {
      "epoch": 5.746233821345215,
      "grad_norm": 1.022943451497308,
      "learning_rate": 2.6696504055476455e-05,
      "loss": 1.1787,
      "num_input_tokens_seen": 42614400608,
      "step": 54164
    },
    {
      "epoch": 5.746339910884787,
      "grad_norm": 0.6228554376874198,
      "learning_rate": 2.6695810688013286e-05,
      "loss": 1.1735,
      "num_input_tokens_seen": 42615187376,
      "step": 54165
    },
    {
      "epoch": 5.746446000424358,
      "grad_norm": 0.9798007308294879,
      "learning_rate": 2.669511731923963e-05,
      "loss": 1.141,
      "num_input_tokens_seen": 42615974160,
      "step": 54166
    },
    {
      "epoch": 5.746552089963929,
      "grad_norm": 0.9201860745082971,
      "learning_rate": 2.669442394915605e-05,
      "loss": 1.07,
      "num_input_tokens_seen": 42616760944,
      "step": 54167
    },
    {
      "epoch": 5.746658179503501,
      "grad_norm": 1.0112964346578661,
      "learning_rate": 2.6693730577763064e-05,
      "loss": 1.1839,
      "num_input_tokens_seen": 42617547648,
      "step": 54168
    },
    {
      "epoch": 5.746764269043072,
      "grad_norm": 0.9527681208858104,
      "learning_rate": 2.669303720506121e-05,
      "loss": 1.0828,
      "num_input_tokens_seen": 42618334480,
      "step": 54169
    },
    {
      "epoch": 5.746870358582644,
      "grad_norm": 1.4011740418431222,
      "learning_rate": 2.6692343831051038e-05,
      "loss": 1.1743,
      "num_input_tokens_seen": 42619121232,
      "step": 54170
    },
    {
      "epoch": 5.746976448122215,
      "grad_norm": 1.4892446272104725,
      "learning_rate": 2.6691650455733064e-05,
      "loss": 1.1636,
      "num_input_tokens_seen": 42619907952,
      "step": 54171
    },
    {
      "epoch": 5.747082537661787,
      "grad_norm": 0.656109480457838,
      "learning_rate": 2.6690957079107827e-05,
      "loss": 1.2222,
      "num_input_tokens_seen": 42620694672,
      "step": 54172
    },
    {
      "epoch": 5.747188627201358,
      "grad_norm": 1.2556660931515444,
      "learning_rate": 2.6690263701175872e-05,
      "loss": 1.1823,
      "num_input_tokens_seen": 42621481504,
      "step": 54173
    },
    {
      "epoch": 5.74729471674093,
      "grad_norm": 1.0755197855735485,
      "learning_rate": 2.6689570321937735e-05,
      "loss": 1.1201,
      "num_input_tokens_seen": 42622268192,
      "step": 54174
    },
    {
      "epoch": 5.747400806280501,
      "grad_norm": 0.6983015012456901,
      "learning_rate": 2.668887694139394e-05,
      "loss": 1.2207,
      "num_input_tokens_seen": 42623054928,
      "step": 54175
    },
    {
      "epoch": 5.747506895820072,
      "grad_norm": 0.8910710484207776,
      "learning_rate": 2.668818355954504e-05,
      "loss": 1.1951,
      "num_input_tokens_seen": 42623841744,
      "step": 54176
    },
    {
      "epoch": 5.747612985359644,
      "grad_norm": 0.8860531257003513,
      "learning_rate": 2.668749017639155e-05,
      "loss": 1.1952,
      "num_input_tokens_seen": 42624628496,
      "step": 54177
    },
    {
      "epoch": 5.747719074899215,
      "grad_norm": 0.7548045707897001,
      "learning_rate": 2.6686796791934026e-05,
      "loss": 1.1581,
      "num_input_tokens_seen": 42625415200,
      "step": 54178
    },
    {
      "epoch": 5.747825164438787,
      "grad_norm": 0.7750274436123298,
      "learning_rate": 2.668610340617299e-05,
      "loss": 1.1324,
      "num_input_tokens_seen": 42626202000,
      "step": 54179
    },
    {
      "epoch": 5.747931253978358,
      "grad_norm": 1.1790826885506385,
      "learning_rate": 2.6685410019108986e-05,
      "loss": 1.2183,
      "num_input_tokens_seen": 42626988752,
      "step": 54180
    },
    {
      "epoch": 5.748037343517929,
      "grad_norm": 0.7339622890180715,
      "learning_rate": 2.6684716630742545e-05,
      "loss": 1.1317,
      "num_input_tokens_seen": 42627775600,
      "step": 54181
    },
    {
      "epoch": 5.748143433057501,
      "grad_norm": 1.1129783789058119,
      "learning_rate": 2.6684023241074207e-05,
      "loss": 1.1907,
      "num_input_tokens_seen": 42628562448,
      "step": 54182
    },
    {
      "epoch": 5.748249522597072,
      "grad_norm": 0.8971206940644751,
      "learning_rate": 2.66833298501045e-05,
      "loss": 1.1716,
      "num_input_tokens_seen": 42629349152,
      "step": 54183
    },
    {
      "epoch": 5.748355612136644,
      "grad_norm": 0.6585188332246434,
      "learning_rate": 2.668263645783397e-05,
      "loss": 1.1918,
      "num_input_tokens_seen": 42630135872,
      "step": 54184
    },
    {
      "epoch": 5.748461701676215,
      "grad_norm": 0.9444180121368883,
      "learning_rate": 2.668194306426315e-05,
      "loss": 1.1625,
      "num_input_tokens_seen": 42630922736,
      "step": 54185
    },
    {
      "epoch": 5.748567791215786,
      "grad_norm": 1.0035524727789074,
      "learning_rate": 2.6681249669392566e-05,
      "loss": 1.2572,
      "num_input_tokens_seen": 42631709408,
      "step": 54186
    },
    {
      "epoch": 5.748673880755358,
      "grad_norm": 0.6923468775513085,
      "learning_rate": 2.668055627322277e-05,
      "loss": 1.1519,
      "num_input_tokens_seen": 42632496192,
      "step": 54187
    },
    {
      "epoch": 5.748779970294929,
      "grad_norm": 0.8083189010322259,
      "learning_rate": 2.667986287575428e-05,
      "loss": 1.1432,
      "num_input_tokens_seen": 42633282928,
      "step": 54188
    },
    {
      "epoch": 5.748886059834501,
      "grad_norm": 1.0212947362986413,
      "learning_rate": 2.6679169476987646e-05,
      "loss": 1.1727,
      "num_input_tokens_seen": 42634069696,
      "step": 54189
    },
    {
      "epoch": 5.748992149374072,
      "grad_norm": 0.5552940203096073,
      "learning_rate": 2.6678476076923402e-05,
      "loss": 1.0784,
      "num_input_tokens_seen": 42634856560,
      "step": 54190
    },
    {
      "epoch": 5.749098238913643,
      "grad_norm": 1.3684302253826537,
      "learning_rate": 2.667778267556208e-05,
      "loss": 1.1528,
      "num_input_tokens_seen": 42635643360,
      "step": 54191
    },
    {
      "epoch": 5.749204328453215,
      "grad_norm": 1.220295750326884,
      "learning_rate": 2.667708927290421e-05,
      "loss": 1.2328,
      "num_input_tokens_seen": 42636430160,
      "step": 54192
    },
    {
      "epoch": 5.749310417992786,
      "grad_norm": 0.5938539482212226,
      "learning_rate": 2.6676395868950342e-05,
      "loss": 1.0694,
      "num_input_tokens_seen": 42637216928,
      "step": 54193
    },
    {
      "epoch": 5.749416507532358,
      "grad_norm": 1.094586293240049,
      "learning_rate": 2.6675702463700996e-05,
      "loss": 1.2417,
      "num_input_tokens_seen": 42638003696,
      "step": 54194
    },
    {
      "epoch": 5.749522597071929,
      "grad_norm": 1.153733888766792,
      "learning_rate": 2.6675009057156725e-05,
      "loss": 1.2226,
      "num_input_tokens_seen": 42638790448,
      "step": 54195
    },
    {
      "epoch": 5.7496286866115,
      "grad_norm": 0.5563651187033747,
      "learning_rate": 2.6674315649318053e-05,
      "loss": 1.1385,
      "num_input_tokens_seen": 42639577184,
      "step": 54196
    },
    {
      "epoch": 5.7497347761510715,
      "grad_norm": 0.9367711635042515,
      "learning_rate": 2.6673622240185518e-05,
      "loss": 1.134,
      "num_input_tokens_seen": 42640364000,
      "step": 54197
    },
    {
      "epoch": 5.749840865690643,
      "grad_norm": 0.7864074281134206,
      "learning_rate": 2.6672928829759665e-05,
      "loss": 1.1486,
      "num_input_tokens_seen": 42641150800,
      "step": 54198
    },
    {
      "epoch": 5.7499469552302145,
      "grad_norm": 0.8778197181109245,
      "learning_rate": 2.6672235418041013e-05,
      "loss": 1.1363,
      "num_input_tokens_seen": 42641937472,
      "step": 54199
    },
    {
      "epoch": 5.7500530447697855,
      "grad_norm": 0.7325701173823045,
      "learning_rate": 2.6671542005030104e-05,
      "loss": 1.172,
      "num_input_tokens_seen": 42642724208,
      "step": 54200
    },
    {
      "epoch": 5.750159134309357,
      "grad_norm": 1.2270958995080268,
      "learning_rate": 2.6670848590727483e-05,
      "loss": 1.1218,
      "num_input_tokens_seen": 42643510960,
      "step": 54201
    },
    {
      "epoch": 5.7502652238489285,
      "grad_norm": 1.0063136635532297,
      "learning_rate": 2.6670155175133682e-05,
      "loss": 1.1512,
      "num_input_tokens_seen": 42644297760,
      "step": 54202
    },
    {
      "epoch": 5.7503713133885,
      "grad_norm": 0.6160251406711965,
      "learning_rate": 2.6669461758249227e-05,
      "loss": 1.1584,
      "num_input_tokens_seen": 42645084544,
      "step": 54203
    },
    {
      "epoch": 5.750477402928071,
      "grad_norm": 0.8100742944831401,
      "learning_rate": 2.6668768340074662e-05,
      "loss": 1.0668,
      "num_input_tokens_seen": 42645871296,
      "step": 54204
    },
    {
      "epoch": 5.750583492467642,
      "grad_norm": 0.993839239688179,
      "learning_rate": 2.6668074920610524e-05,
      "loss": 1.1411,
      "num_input_tokens_seen": 42646658016,
      "step": 54205
    },
    {
      "epoch": 5.750689582007214,
      "grad_norm": 0.7218915507546093,
      "learning_rate": 2.6667381499857337e-05,
      "loss": 1.1077,
      "num_input_tokens_seen": 42647444816,
      "step": 54206
    },
    {
      "epoch": 5.750795671546785,
      "grad_norm": 0.6559886420994582,
      "learning_rate": 2.666668807781566e-05,
      "loss": 1.1346,
      "num_input_tokens_seen": 42648231616,
      "step": 54207
    },
    {
      "epoch": 5.750901761086357,
      "grad_norm": 0.852206348811819,
      "learning_rate": 2.666599465448601e-05,
      "loss": 1.2363,
      "num_input_tokens_seen": 42649018368,
      "step": 54208
    },
    {
      "epoch": 5.751007850625928,
      "grad_norm": 0.9450065611724742,
      "learning_rate": 2.666530122986893e-05,
      "loss": 1.1119,
      "num_input_tokens_seen": 42649805152,
      "step": 54209
    },
    {
      "epoch": 5.751113940165499,
      "grad_norm": 0.834204273741205,
      "learning_rate": 2.666460780396495e-05,
      "loss": 1.184,
      "num_input_tokens_seen": 42650591888,
      "step": 54210
    },
    {
      "epoch": 5.751220029705071,
      "grad_norm": 0.808300880540473,
      "learning_rate": 2.6663914376774613e-05,
      "loss": 1.1256,
      "num_input_tokens_seen": 42651378688,
      "step": 54211
    },
    {
      "epoch": 5.751326119244642,
      "grad_norm": 1.136026522723797,
      "learning_rate": 2.666322094829845e-05,
      "loss": 1.1275,
      "num_input_tokens_seen": 42652165408,
      "step": 54212
    },
    {
      "epoch": 5.751432208784214,
      "grad_norm": 0.7759685293440349,
      "learning_rate": 2.6662527518537e-05,
      "loss": 1.1368,
      "num_input_tokens_seen": 42652952224,
      "step": 54213
    },
    {
      "epoch": 5.751538298323785,
      "grad_norm": 1.04484048014611,
      "learning_rate": 2.66618340874908e-05,
      "loss": 1.1925,
      "num_input_tokens_seen": 42653739024,
      "step": 54214
    },
    {
      "epoch": 5.751644387863356,
      "grad_norm": 0.8473667586724917,
      "learning_rate": 2.6661140655160378e-05,
      "loss": 1.1526,
      "num_input_tokens_seen": 42654525840,
      "step": 54215
    },
    {
      "epoch": 5.751750477402928,
      "grad_norm": 0.7127576894342164,
      "learning_rate": 2.666044722154628e-05,
      "loss": 1.2097,
      "num_input_tokens_seen": 42655312592,
      "step": 54216
    },
    {
      "epoch": 5.751856566942499,
      "grad_norm": 0.5819181240686327,
      "learning_rate": 2.665975378664904e-05,
      "loss": 1.0989,
      "num_input_tokens_seen": 42656099344,
      "step": 54217
    },
    {
      "epoch": 5.751962656482071,
      "grad_norm": 0.9065372517478136,
      "learning_rate": 2.665906035046918e-05,
      "loss": 1.1015,
      "num_input_tokens_seen": 42656886144,
      "step": 54218
    },
    {
      "epoch": 5.752068746021642,
      "grad_norm": 0.506186295491709,
      "learning_rate": 2.6658366913007255e-05,
      "loss": 1.0917,
      "num_input_tokens_seen": 42657673008,
      "step": 54219
    },
    {
      "epoch": 5.752174835561213,
      "grad_norm": 0.7258510148613113,
      "learning_rate": 2.6657673474263793e-05,
      "loss": 1.1495,
      "num_input_tokens_seen": 42658459728,
      "step": 54220
    },
    {
      "epoch": 5.752280925100785,
      "grad_norm": 0.745903333974162,
      "learning_rate": 2.6656980034239326e-05,
      "loss": 1.17,
      "num_input_tokens_seen": 42659246416,
      "step": 54221
    },
    {
      "epoch": 5.752387014640356,
      "grad_norm": 0.7729256213346055,
      "learning_rate": 2.66562865929344e-05,
      "loss": 1.2807,
      "num_input_tokens_seen": 42660033120,
      "step": 54222
    },
    {
      "epoch": 5.752493104179928,
      "grad_norm": 0.77515589586369,
      "learning_rate": 2.6655593150349534e-05,
      "loss": 1.1872,
      "num_input_tokens_seen": 42660819856,
      "step": 54223
    },
    {
      "epoch": 5.752599193719499,
      "grad_norm": 0.6812501665393391,
      "learning_rate": 2.665489970648528e-05,
      "loss": 1.2108,
      "num_input_tokens_seen": 42661606544,
      "step": 54224
    },
    {
      "epoch": 5.75270528325907,
      "grad_norm": 0.646040948153078,
      "learning_rate": 2.665420626134217e-05,
      "loss": 1.0997,
      "num_input_tokens_seen": 42662393344,
      "step": 54225
    },
    {
      "epoch": 5.752811372798642,
      "grad_norm": 0.702398312891759,
      "learning_rate": 2.6653512814920726e-05,
      "loss": 1.1448,
      "num_input_tokens_seen": 42663180208,
      "step": 54226
    },
    {
      "epoch": 5.752917462338213,
      "grad_norm": 0.6436069392920244,
      "learning_rate": 2.665281936722151e-05,
      "loss": 1.2281,
      "num_input_tokens_seen": 42663966976,
      "step": 54227
    },
    {
      "epoch": 5.753023551877785,
      "grad_norm": 0.6734752879391307,
      "learning_rate": 2.665212591824504e-05,
      "loss": 1.2212,
      "num_input_tokens_seen": 42664753632,
      "step": 54228
    },
    {
      "epoch": 5.753129641417356,
      "grad_norm": 0.8085663644399975,
      "learning_rate": 2.6651432467991854e-05,
      "loss": 1.1949,
      "num_input_tokens_seen": 42665540352,
      "step": 54229
    },
    {
      "epoch": 5.753235730956928,
      "grad_norm": 0.6901513578958802,
      "learning_rate": 2.665073901646249e-05,
      "loss": 1.0572,
      "num_input_tokens_seen": 42666327168,
      "step": 54230
    },
    {
      "epoch": 5.753341820496499,
      "grad_norm": 0.5810962519360403,
      "learning_rate": 2.665004556365749e-05,
      "loss": 1.192,
      "num_input_tokens_seen": 42667114016,
      "step": 54231
    },
    {
      "epoch": 5.753447910036071,
      "grad_norm": 0.5894918664912593,
      "learning_rate": 2.664935210957737e-05,
      "loss": 1.183,
      "num_input_tokens_seen": 42667900736,
      "step": 54232
    },
    {
      "epoch": 5.753553999575642,
      "grad_norm": 0.7061781021451954,
      "learning_rate": 2.6648658654222685e-05,
      "loss": 1.1301,
      "num_input_tokens_seen": 42668687456,
      "step": 54233
    },
    {
      "epoch": 5.753660089115213,
      "grad_norm": 0.6161387146121448,
      "learning_rate": 2.6647965197593973e-05,
      "loss": 1.1882,
      "num_input_tokens_seen": 42669474240,
      "step": 54234
    },
    {
      "epoch": 5.753766178654785,
      "grad_norm": 0.7184806334590567,
      "learning_rate": 2.6647271739691747e-05,
      "loss": 1.1895,
      "num_input_tokens_seen": 42670260992,
      "step": 54235
    },
    {
      "epoch": 5.753872268194356,
      "grad_norm": 0.7804685184072003,
      "learning_rate": 2.6646578280516566e-05,
      "loss": 1.2363,
      "num_input_tokens_seen": 42671047760,
      "step": 54236
    },
    {
      "epoch": 5.753978357733928,
      "grad_norm": 0.6504415733199189,
      "learning_rate": 2.6645884820068956e-05,
      "loss": 1.1889,
      "num_input_tokens_seen": 42671834512,
      "step": 54237
    },
    {
      "epoch": 5.754084447273499,
      "grad_norm": 0.5815641696295832,
      "learning_rate": 2.6645191358349454e-05,
      "loss": 1.1419,
      "num_input_tokens_seen": 42672621280,
      "step": 54238
    },
    {
      "epoch": 5.75419053681307,
      "grad_norm": 0.7369528254150527,
      "learning_rate": 2.66444978953586e-05,
      "loss": 1.2483,
      "num_input_tokens_seen": 42673408080,
      "step": 54239
    },
    {
      "epoch": 5.754296626352642,
      "grad_norm": 0.7403314568854992,
      "learning_rate": 2.664380443109692e-05,
      "loss": 1.1443,
      "num_input_tokens_seen": 42674194864,
      "step": 54240
    },
    {
      "epoch": 5.754402715892213,
      "grad_norm": 0.7438641536670081,
      "learning_rate": 2.6643110965564966e-05,
      "loss": 1.1669,
      "num_input_tokens_seen": 42674981616,
      "step": 54241
    },
    {
      "epoch": 5.754508805431785,
      "grad_norm": 0.7729003630079604,
      "learning_rate": 2.6642417498763256e-05,
      "loss": 1.1591,
      "num_input_tokens_seen": 42675768336,
      "step": 54242
    },
    {
      "epoch": 5.754614894971356,
      "grad_norm": 0.75091371776242,
      "learning_rate": 2.6641724030692332e-05,
      "loss": 1.1233,
      "num_input_tokens_seen": 42676555136,
      "step": 54243
    },
    {
      "epoch": 5.754720984510927,
      "grad_norm": 0.6642579686457178,
      "learning_rate": 2.6641030561352742e-05,
      "loss": 1.1663,
      "num_input_tokens_seen": 42677341904,
      "step": 54244
    },
    {
      "epoch": 5.754827074050499,
      "grad_norm": 0.8677060511995267,
      "learning_rate": 2.6640337090745005e-05,
      "loss": 1.1351,
      "num_input_tokens_seen": 42678128560,
      "step": 54245
    },
    {
      "epoch": 5.75493316359007,
      "grad_norm": 0.7458410207116776,
      "learning_rate": 2.663964361886966e-05,
      "loss": 1.1736,
      "num_input_tokens_seen": 42678915344,
      "step": 54246
    },
    {
      "epoch": 5.755039253129642,
      "grad_norm": 0.6913997650423013,
      "learning_rate": 2.6638950145727255e-05,
      "loss": 1.1347,
      "num_input_tokens_seen": 42679702000,
      "step": 54247
    },
    {
      "epoch": 5.755145342669213,
      "grad_norm": 0.6680505690019091,
      "learning_rate": 2.6638256671318312e-05,
      "loss": 1.1112,
      "num_input_tokens_seen": 42680488736,
      "step": 54248
    },
    {
      "epoch": 5.755251432208784,
      "grad_norm": 0.756407111829965,
      "learning_rate": 2.6637563195643373e-05,
      "loss": 1.2242,
      "num_input_tokens_seen": 42681275520,
      "step": 54249
    },
    {
      "epoch": 5.755357521748356,
      "grad_norm": 0.7914116364654512,
      "learning_rate": 2.6636869718702974e-05,
      "loss": 1.1151,
      "num_input_tokens_seen": 42682062304,
      "step": 54250
    },
    {
      "epoch": 5.755463611287927,
      "grad_norm": 0.8729255818079849,
      "learning_rate": 2.663617624049765e-05,
      "loss": 1.2503,
      "num_input_tokens_seen": 42682849024,
      "step": 54251
    },
    {
      "epoch": 5.755569700827499,
      "grad_norm": 0.7623740666212431,
      "learning_rate": 2.6635482761027936e-05,
      "loss": 1.0679,
      "num_input_tokens_seen": 42683635760,
      "step": 54252
    },
    {
      "epoch": 5.75567579036707,
      "grad_norm": 0.7147644766693187,
      "learning_rate": 2.6634789280294364e-05,
      "loss": 1.0966,
      "num_input_tokens_seen": 42684422496,
      "step": 54253
    },
    {
      "epoch": 5.755781879906642,
      "grad_norm": 0.6112880355200034,
      "learning_rate": 2.6634095798297483e-05,
      "loss": 1.163,
      "num_input_tokens_seen": 42685209376,
      "step": 54254
    },
    {
      "epoch": 5.755887969446213,
      "grad_norm": 1.2175834828235772,
      "learning_rate": 2.6633402315037815e-05,
      "loss": 1.1754,
      "num_input_tokens_seen": 42685996160,
      "step": 54255
    },
    {
      "epoch": 5.755994058985784,
      "grad_norm": 0.8752340319033994,
      "learning_rate": 2.663270883051591e-05,
      "loss": 1.224,
      "num_input_tokens_seen": 42686782912,
      "step": 54256
    },
    {
      "epoch": 5.756100148525356,
      "grad_norm": 0.7730561012255215,
      "learning_rate": 2.6632015344732292e-05,
      "loss": 1.2938,
      "num_input_tokens_seen": 42687569616,
      "step": 54257
    },
    {
      "epoch": 5.756206238064927,
      "grad_norm": 1.1705035313430112,
      "learning_rate": 2.663132185768749e-05,
      "loss": 1.2401,
      "num_input_tokens_seen": 42688356352,
      "step": 54258
    },
    {
      "epoch": 5.7563123276044985,
      "grad_norm": 0.6997998278388876,
      "learning_rate": 2.6630628369382065e-05,
      "loss": 1.2578,
      "num_input_tokens_seen": 42689143088,
      "step": 54259
    },
    {
      "epoch": 5.7564184171440695,
      "grad_norm": 0.745547634901825,
      "learning_rate": 2.662993487981653e-05,
      "loss": 1.0275,
      "num_input_tokens_seen": 42689929856,
      "step": 54260
    },
    {
      "epoch": 5.7565245066836415,
      "grad_norm": 0.6850933477632178,
      "learning_rate": 2.6629241388991432e-05,
      "loss": 1.1992,
      "num_input_tokens_seen": 42690716656,
      "step": 54261
    },
    {
      "epoch": 5.7566305962232125,
      "grad_norm": 0.6428114929502887,
      "learning_rate": 2.6628547896907307e-05,
      "loss": 1.1015,
      "num_input_tokens_seen": 42691503600,
      "step": 54262
    },
    {
      "epoch": 5.7567366857627835,
      "grad_norm": 0.6189499941502894,
      "learning_rate": 2.6627854403564684e-05,
      "loss": 1.1512,
      "num_input_tokens_seen": 42692290368,
      "step": 54263
    },
    {
      "epoch": 5.756842775302355,
      "grad_norm": 0.8931860396718652,
      "learning_rate": 2.66271609089641e-05,
      "loss": 1.1504,
      "num_input_tokens_seen": 42693077056,
      "step": 54264
    },
    {
      "epoch": 5.7569488648419265,
      "grad_norm": 0.713643778874381,
      "learning_rate": 2.66264674131061e-05,
      "loss": 1.0955,
      "num_input_tokens_seen": 42693863808,
      "step": 54265
    },
    {
      "epoch": 5.757054954381498,
      "grad_norm": 0.7857064405758064,
      "learning_rate": 2.662577391599121e-05,
      "loss": 1.1318,
      "num_input_tokens_seen": 42694650592,
      "step": 54266
    },
    {
      "epoch": 5.757161043921069,
      "grad_norm": 0.5999485018377023,
      "learning_rate": 2.6625080417619968e-05,
      "loss": 1.0566,
      "num_input_tokens_seen": 42695437360,
      "step": 54267
    },
    {
      "epoch": 5.7572671334606405,
      "grad_norm": 0.9081882857944886,
      "learning_rate": 2.6624386917992916e-05,
      "loss": 1.1367,
      "num_input_tokens_seen": 42696224208,
      "step": 54268
    },
    {
      "epoch": 5.757373223000212,
      "grad_norm": 0.671896001820373,
      "learning_rate": 2.6623693417110585e-05,
      "loss": 1.1378,
      "num_input_tokens_seen": 42697010912,
      "step": 54269
    },
    {
      "epoch": 5.757479312539783,
      "grad_norm": 0.9261485256837008,
      "learning_rate": 2.6622999914973507e-05,
      "loss": 1.2249,
      "num_input_tokens_seen": 42697797664,
      "step": 54270
    },
    {
      "epoch": 5.757585402079355,
      "grad_norm": 0.9664116698205499,
      "learning_rate": 2.662230641158223e-05,
      "loss": 1.1492,
      "num_input_tokens_seen": 42698584416,
      "step": 54271
    },
    {
      "epoch": 5.757691491618926,
      "grad_norm": 0.607851222516601,
      "learning_rate": 2.662161290693727e-05,
      "loss": 1.2021,
      "num_input_tokens_seen": 42699371232,
      "step": 54272
    },
    {
      "epoch": 5.757797581158497,
      "grad_norm": 0.7590446042664667,
      "learning_rate": 2.662091940103919e-05,
      "loss": 1.1507,
      "num_input_tokens_seen": 42700158080,
      "step": 54273
    },
    {
      "epoch": 5.757903670698069,
      "grad_norm": 1.0820590409465922,
      "learning_rate": 2.66202258938885e-05,
      "loss": 1.0826,
      "num_input_tokens_seen": 42700944896,
      "step": 54274
    },
    {
      "epoch": 5.75800976023764,
      "grad_norm": 1.0816044459438214,
      "learning_rate": 2.661953238548575e-05,
      "loss": 1.1687,
      "num_input_tokens_seen": 42701731696,
      "step": 54275
    },
    {
      "epoch": 5.758115849777212,
      "grad_norm": 1.2789286667084725,
      "learning_rate": 2.6618838875831475e-05,
      "loss": 1.1774,
      "num_input_tokens_seen": 42702518496,
      "step": 54276
    },
    {
      "epoch": 5.758221939316783,
      "grad_norm": 0.7745711902888534,
      "learning_rate": 2.661814536492621e-05,
      "loss": 1.2563,
      "num_input_tokens_seen": 42703305264,
      "step": 54277
    },
    {
      "epoch": 5.758328028856354,
      "grad_norm": 0.8268170914562405,
      "learning_rate": 2.661745185277048e-05,
      "loss": 1.1845,
      "num_input_tokens_seen": 42704092048,
      "step": 54278
    },
    {
      "epoch": 5.758434118395926,
      "grad_norm": 0.6787627316718212,
      "learning_rate": 2.6616758339364845e-05,
      "loss": 1.1072,
      "num_input_tokens_seen": 42704878752,
      "step": 54279
    },
    {
      "epoch": 5.758540207935497,
      "grad_norm": 0.6991066172220713,
      "learning_rate": 2.6616064824709813e-05,
      "loss": 1.1242,
      "num_input_tokens_seen": 42705665488,
      "step": 54280
    },
    {
      "epoch": 5.758646297475069,
      "grad_norm": 0.736679004484489,
      "learning_rate": 2.6615371308805942e-05,
      "loss": 1.1822,
      "num_input_tokens_seen": 42706452256,
      "step": 54281
    },
    {
      "epoch": 5.75875238701464,
      "grad_norm": 0.6234837539790257,
      "learning_rate": 2.661467779165376e-05,
      "loss": 1.097,
      "num_input_tokens_seen": 42707239024,
      "step": 54282
    },
    {
      "epoch": 5.758858476554212,
      "grad_norm": 1.0625341036536342,
      "learning_rate": 2.6613984273253794e-05,
      "loss": 1.2029,
      "num_input_tokens_seen": 42708025744,
      "step": 54283
    },
    {
      "epoch": 5.758964566093783,
      "grad_norm": 0.6179926143879145,
      "learning_rate": 2.6613290753606596e-05,
      "loss": 1.0762,
      "num_input_tokens_seen": 42708812544,
      "step": 54284
    },
    {
      "epoch": 5.759070655633354,
      "grad_norm": 0.8822503784436679,
      "learning_rate": 2.6612597232712695e-05,
      "loss": 1.2843,
      "num_input_tokens_seen": 42709599248,
      "step": 54285
    },
    {
      "epoch": 5.759176745172926,
      "grad_norm": 0.7752548163347635,
      "learning_rate": 2.6611903710572622e-05,
      "loss": 1.0643,
      "num_input_tokens_seen": 42710385936,
      "step": 54286
    },
    {
      "epoch": 5.759282834712497,
      "grad_norm": 0.7554399334020144,
      "learning_rate": 2.661121018718692e-05,
      "loss": 1.1644,
      "num_input_tokens_seen": 42711172624,
      "step": 54287
    },
    {
      "epoch": 5.759388924252069,
      "grad_norm": 0.6627372423204612,
      "learning_rate": 2.6610516662556123e-05,
      "loss": 1.1818,
      "num_input_tokens_seen": 42711959408,
      "step": 54288
    },
    {
      "epoch": 5.75949501379164,
      "grad_norm": 0.9281412929737584,
      "learning_rate": 2.6609823136680757e-05,
      "loss": 1.1466,
      "num_input_tokens_seen": 42712746208,
      "step": 54289
    },
    {
      "epoch": 5.759601103331212,
      "grad_norm": 0.617114303874466,
      "learning_rate": 2.6609129609561377e-05,
      "loss": 1.1698,
      "num_input_tokens_seen": 42713532976,
      "step": 54290
    },
    {
      "epoch": 5.759707192870783,
      "grad_norm": 0.7842272741548578,
      "learning_rate": 2.6608436081198506e-05,
      "loss": 1.1785,
      "num_input_tokens_seen": 42714319632,
      "step": 54291
    },
    {
      "epoch": 5.759813282410354,
      "grad_norm": 0.6771702804557286,
      "learning_rate": 2.660774255159268e-05,
      "loss": 1.2109,
      "num_input_tokens_seen": 42715106464,
      "step": 54292
    },
    {
      "epoch": 5.759919371949926,
      "grad_norm": 0.7017467606296524,
      "learning_rate": 2.660704902074444e-05,
      "loss": 1.0916,
      "num_input_tokens_seen": 42715893248,
      "step": 54293
    },
    {
      "epoch": 5.760025461489497,
      "grad_norm": 0.8920414907213963,
      "learning_rate": 2.660635548865432e-05,
      "loss": 1.1941,
      "num_input_tokens_seen": 42716680112,
      "step": 54294
    },
    {
      "epoch": 5.760131551029069,
      "grad_norm": 0.714516071325877,
      "learning_rate": 2.6605661955322852e-05,
      "loss": 1.1781,
      "num_input_tokens_seen": 42717466864,
      "step": 54295
    },
    {
      "epoch": 5.76023764056864,
      "grad_norm": 0.8448359172217409,
      "learning_rate": 2.6604968420750582e-05,
      "loss": 1.1957,
      "num_input_tokens_seen": 42718253664,
      "step": 54296
    },
    {
      "epoch": 5.760343730108211,
      "grad_norm": 0.9351005149822293,
      "learning_rate": 2.6604274884938035e-05,
      "loss": 1.1182,
      "num_input_tokens_seen": 42719040480,
      "step": 54297
    },
    {
      "epoch": 5.760449819647783,
      "grad_norm": 0.8821095092149936,
      "learning_rate": 2.6603581347885754e-05,
      "loss": 1.2299,
      "num_input_tokens_seen": 42719827232,
      "step": 54298
    },
    {
      "epoch": 5.760555909187354,
      "grad_norm": 0.6594033936721959,
      "learning_rate": 2.6602887809594274e-05,
      "loss": 1.1298,
      "num_input_tokens_seen": 42720614080,
      "step": 54299
    },
    {
      "epoch": 5.760661998726926,
      "grad_norm": 0.7875224514526339,
      "learning_rate": 2.6602194270064124e-05,
      "loss": 1.117,
      "num_input_tokens_seen": 42721400832,
      "step": 54300
    },
    {
      "epoch": 5.760768088266497,
      "grad_norm": 0.6619260809072746,
      "learning_rate": 2.660150072929584e-05,
      "loss": 1.1173,
      "num_input_tokens_seen": 42722187584,
      "step": 54301
    },
    {
      "epoch": 5.760874177806068,
      "grad_norm": 0.6081889636120941,
      "learning_rate": 2.6600807187289973e-05,
      "loss": 1.1102,
      "num_input_tokens_seen": 42722974288,
      "step": 54302
    },
    {
      "epoch": 5.76098026734564,
      "grad_norm": 0.702189314482019,
      "learning_rate": 2.6600113644047046e-05,
      "loss": 1.1534,
      "num_input_tokens_seen": 42723761024,
      "step": 54303
    },
    {
      "epoch": 5.761086356885211,
      "grad_norm": 0.6110903611667696,
      "learning_rate": 2.65994200995676e-05,
      "loss": 1.1724,
      "num_input_tokens_seen": 42724547648,
      "step": 54304
    },
    {
      "epoch": 5.761192446424783,
      "grad_norm": 0.9151619231518365,
      "learning_rate": 2.6598726553852172e-05,
      "loss": 1.2309,
      "num_input_tokens_seen": 42725334416,
      "step": 54305
    },
    {
      "epoch": 5.761298535964354,
      "grad_norm": 0.6584461528000488,
      "learning_rate": 2.659803300690129e-05,
      "loss": 1.1002,
      "num_input_tokens_seen": 42726121200,
      "step": 54306
    },
    {
      "epoch": 5.761404625503925,
      "grad_norm": 0.6531393588342822,
      "learning_rate": 2.6597339458715494e-05,
      "loss": 1.086,
      "num_input_tokens_seen": 42726908080,
      "step": 54307
    },
    {
      "epoch": 5.761510715043497,
      "grad_norm": 0.9125303657546486,
      "learning_rate": 2.6596645909295326e-05,
      "loss": 1.1806,
      "num_input_tokens_seen": 42727694800,
      "step": 54308
    },
    {
      "epoch": 5.761616804583068,
      "grad_norm": 0.7789171287300349,
      "learning_rate": 2.6595952358641308e-05,
      "loss": 1.2696,
      "num_input_tokens_seen": 42728481552,
      "step": 54309
    },
    {
      "epoch": 5.76172289412264,
      "grad_norm": 1.0205123966925878,
      "learning_rate": 2.659525880675399e-05,
      "loss": 1.2059,
      "num_input_tokens_seen": 42729268240,
      "step": 54310
    },
    {
      "epoch": 5.761828983662211,
      "grad_norm": 0.7113975547059703,
      "learning_rate": 2.6594565253633908e-05,
      "loss": 1.1179,
      "num_input_tokens_seen": 42730054992,
      "step": 54311
    },
    {
      "epoch": 5.761935073201783,
      "grad_norm": 0.860149332517306,
      "learning_rate": 2.6593871699281585e-05,
      "loss": 1.109,
      "num_input_tokens_seen": 42730841760,
      "step": 54312
    },
    {
      "epoch": 5.762041162741354,
      "grad_norm": 0.833508916451841,
      "learning_rate": 2.6593178143697572e-05,
      "loss": 1.2037,
      "num_input_tokens_seen": 42731628512,
      "step": 54313
    },
    {
      "epoch": 5.762147252280925,
      "grad_norm": 1.098132415834763,
      "learning_rate": 2.6592484586882393e-05,
      "loss": 1.1247,
      "num_input_tokens_seen": 42732415296,
      "step": 54314
    },
    {
      "epoch": 5.762253341820497,
      "grad_norm": 0.8253320690093556,
      "learning_rate": 2.6591791028836587e-05,
      "loss": 1.2137,
      "num_input_tokens_seen": 42733202080,
      "step": 54315
    },
    {
      "epoch": 5.762359431360068,
      "grad_norm": 1.0111811982734489,
      "learning_rate": 2.65910974695607e-05,
      "loss": 1.1603,
      "num_input_tokens_seen": 42733988816,
      "step": 54316
    },
    {
      "epoch": 5.76246552089964,
      "grad_norm": 0.6627400787795975,
      "learning_rate": 2.659040390905525e-05,
      "loss": 1.1644,
      "num_input_tokens_seen": 42734775568,
      "step": 54317
    },
    {
      "epoch": 5.762571610439211,
      "grad_norm": 0.7481605500956605,
      "learning_rate": 2.6589710347320786e-05,
      "loss": 1.1101,
      "num_input_tokens_seen": 42735562304,
      "step": 54318
    },
    {
      "epoch": 5.7626776999787825,
      "grad_norm": 0.6752873446414945,
      "learning_rate": 2.6589016784357838e-05,
      "loss": 1.1543,
      "num_input_tokens_seen": 42736349104,
      "step": 54319
    },
    {
      "epoch": 5.762783789518354,
      "grad_norm": 0.7195966258552806,
      "learning_rate": 2.6588323220166954e-05,
      "loss": 1.117,
      "num_input_tokens_seen": 42737135888,
      "step": 54320
    },
    {
      "epoch": 5.762889879057925,
      "grad_norm": 0.7331014037158395,
      "learning_rate": 2.6587629654748647e-05,
      "loss": 1.2133,
      "num_input_tokens_seen": 42737922656,
      "step": 54321
    },
    {
      "epoch": 5.7629959685974965,
      "grad_norm": 0.6410941201685546,
      "learning_rate": 2.6586936088103474e-05,
      "loss": 1.197,
      "num_input_tokens_seen": 42738709472,
      "step": 54322
    },
    {
      "epoch": 5.7631020581370676,
      "grad_norm": 0.8022222983603666,
      "learning_rate": 2.6586242520231967e-05,
      "loss": 1.2631,
      "num_input_tokens_seen": 42739496224,
      "step": 54323
    },
    {
      "epoch": 5.7632081476766395,
      "grad_norm": 0.6492480081887353,
      "learning_rate": 2.6585548951134648e-05,
      "loss": 1.2273,
      "num_input_tokens_seen": 42740283008,
      "step": 54324
    },
    {
      "epoch": 5.7633142372162105,
      "grad_norm": 0.7260195724063915,
      "learning_rate": 2.6584855380812075e-05,
      "loss": 1.1349,
      "num_input_tokens_seen": 42741069728,
      "step": 54325
    },
    {
      "epoch": 5.7634203267557815,
      "grad_norm": 0.6239074788432748,
      "learning_rate": 2.6584161809264763e-05,
      "loss": 1.2594,
      "num_input_tokens_seen": 42741856400,
      "step": 54326
    },
    {
      "epoch": 5.7635264162953534,
      "grad_norm": 0.6776223641379526,
      "learning_rate": 2.658346823649326e-05,
      "loss": 1.1255,
      "num_input_tokens_seen": 42742643072,
      "step": 54327
    },
    {
      "epoch": 5.7636325058349245,
      "grad_norm": 0.735781392796788,
      "learning_rate": 2.65827746624981e-05,
      "loss": 1.1428,
      "num_input_tokens_seen": 42743429824,
      "step": 54328
    },
    {
      "epoch": 5.763738595374496,
      "grad_norm": 0.8678825543396168,
      "learning_rate": 2.6582081087279815e-05,
      "loss": 1.2174,
      "num_input_tokens_seen": 42744216544,
      "step": 54329
    },
    {
      "epoch": 5.763844684914067,
      "grad_norm": 0.732874455492837,
      "learning_rate": 2.658138751083895e-05,
      "loss": 1.1617,
      "num_input_tokens_seen": 42745003280,
      "step": 54330
    },
    {
      "epoch": 5.7639507744536385,
      "grad_norm": 0.5739877149383226,
      "learning_rate": 2.658069393317603e-05,
      "loss": 1.04,
      "num_input_tokens_seen": 42745790144,
      "step": 54331
    },
    {
      "epoch": 5.76405686399321,
      "grad_norm": 0.7457960142459753,
      "learning_rate": 2.6580000354291594e-05,
      "loss": 1.154,
      "num_input_tokens_seen": 42746576832,
      "step": 54332
    },
    {
      "epoch": 5.764162953532781,
      "grad_norm": 0.7934927993498202,
      "learning_rate": 2.657930677418619e-05,
      "loss": 1.1483,
      "num_input_tokens_seen": 42747363600,
      "step": 54333
    },
    {
      "epoch": 5.764269043072353,
      "grad_norm": 0.724397128233873,
      "learning_rate": 2.657861319286034e-05,
      "loss": 1.2446,
      "num_input_tokens_seen": 42748150304,
      "step": 54334
    },
    {
      "epoch": 5.764375132611924,
      "grad_norm": 0.6449918842170215,
      "learning_rate": 2.6577919610314578e-05,
      "loss": 1.2821,
      "num_input_tokens_seen": 42748937040,
      "step": 54335
    },
    {
      "epoch": 5.764481222151495,
      "grad_norm": 0.6596388711159381,
      "learning_rate": 2.657722602654945e-05,
      "loss": 1.2618,
      "num_input_tokens_seen": 42749723808,
      "step": 54336
    },
    {
      "epoch": 5.764587311691067,
      "grad_norm": 0.8100067594521707,
      "learning_rate": 2.6576532441565495e-05,
      "loss": 1.2217,
      "num_input_tokens_seen": 42750510544,
      "step": 54337
    },
    {
      "epoch": 5.764693401230638,
      "grad_norm": 0.7530491408313984,
      "learning_rate": 2.6575838855363233e-05,
      "loss": 1.1608,
      "num_input_tokens_seen": 42751297328,
      "step": 54338
    },
    {
      "epoch": 5.76479949077021,
      "grad_norm": 0.7242949591409542,
      "learning_rate": 2.6575145267943212e-05,
      "loss": 1.1272,
      "num_input_tokens_seen": 42752084096,
      "step": 54339
    },
    {
      "epoch": 5.764905580309781,
      "grad_norm": 0.8926946134433325,
      "learning_rate": 2.657445167930596e-05,
      "loss": 1.2771,
      "num_input_tokens_seen": 42752870848,
      "step": 54340
    },
    {
      "epoch": 5.765011669849353,
      "grad_norm": 0.5223369408539378,
      "learning_rate": 2.6573758089452024e-05,
      "loss": 1.0595,
      "num_input_tokens_seen": 42753657616,
      "step": 54341
    },
    {
      "epoch": 5.765117759388924,
      "grad_norm": 0.7433859306045053,
      "learning_rate": 2.6573064498381934e-05,
      "loss": 1.1927,
      "num_input_tokens_seen": 42754444448,
      "step": 54342
    },
    {
      "epoch": 5.765223848928495,
      "grad_norm": 0.73190598361228,
      "learning_rate": 2.6572370906096224e-05,
      "loss": 1.0595,
      "num_input_tokens_seen": 42755231232,
      "step": 54343
    },
    {
      "epoch": 5.765329938468067,
      "grad_norm": 0.6772630737738448,
      "learning_rate": 2.6571677312595428e-05,
      "loss": 1.1977,
      "num_input_tokens_seen": 42756018032,
      "step": 54344
    },
    {
      "epoch": 5.765436028007638,
      "grad_norm": 0.5891439577684767,
      "learning_rate": 2.6570983717880095e-05,
      "loss": 1.0717,
      "num_input_tokens_seen": 42756804784,
      "step": 54345
    },
    {
      "epoch": 5.76554211754721,
      "grad_norm": 0.7290793918137736,
      "learning_rate": 2.6570290121950743e-05,
      "loss": 1.2035,
      "num_input_tokens_seen": 42757591568,
      "step": 54346
    },
    {
      "epoch": 5.765648207086781,
      "grad_norm": 0.5951883578642719,
      "learning_rate": 2.6569596524807922e-05,
      "loss": 1.0796,
      "num_input_tokens_seen": 42758378304,
      "step": 54347
    },
    {
      "epoch": 5.765754296626353,
      "grad_norm": 0.5891196003655476,
      "learning_rate": 2.6568902926452153e-05,
      "loss": 1.147,
      "num_input_tokens_seen": 42759165168,
      "step": 54348
    },
    {
      "epoch": 5.765860386165924,
      "grad_norm": 0.6287746860413952,
      "learning_rate": 2.6568209326883996e-05,
      "loss": 1.1439,
      "num_input_tokens_seen": 42759951936,
      "step": 54349
    },
    {
      "epoch": 5.765966475705495,
      "grad_norm": 0.6791726604366044,
      "learning_rate": 2.6567515726103965e-05,
      "loss": 1.1164,
      "num_input_tokens_seen": 42760738752,
      "step": 54350
    },
    {
      "epoch": 5.766072565245067,
      "grad_norm": 0.6947559753691753,
      "learning_rate": 2.6566822124112605e-05,
      "loss": 1.1289,
      "num_input_tokens_seen": 42761525504,
      "step": 54351
    },
    {
      "epoch": 5.766178654784638,
      "grad_norm": 0.8697663864788366,
      "learning_rate": 2.656612852091045e-05,
      "loss": 1.1336,
      "num_input_tokens_seen": 42762312304,
      "step": 54352
    },
    {
      "epoch": 5.76628474432421,
      "grad_norm": 0.7424644370268699,
      "learning_rate": 2.656543491649804e-05,
      "loss": 1.2092,
      "num_input_tokens_seen": 42763099056,
      "step": 54353
    },
    {
      "epoch": 5.766390833863781,
      "grad_norm": 0.7780337350665177,
      "learning_rate": 2.6564741310875907e-05,
      "loss": 1.2765,
      "num_input_tokens_seen": 42763885664,
      "step": 54354
    },
    {
      "epoch": 5.766496923403352,
      "grad_norm": 0.7349085559962305,
      "learning_rate": 2.6564047704044587e-05,
      "loss": 1.1721,
      "num_input_tokens_seen": 42764672464,
      "step": 54355
    },
    {
      "epoch": 5.766603012942924,
      "grad_norm": 0.8987349492201065,
      "learning_rate": 2.6563354096004616e-05,
      "loss": 1.1715,
      "num_input_tokens_seen": 42765459200,
      "step": 54356
    },
    {
      "epoch": 5.766709102482495,
      "grad_norm": 0.6615960072593207,
      "learning_rate": 2.6562660486756536e-05,
      "loss": 1.1621,
      "num_input_tokens_seen": 42766245968,
      "step": 54357
    },
    {
      "epoch": 5.766815192022067,
      "grad_norm": 0.6918668174536325,
      "learning_rate": 2.656196687630087e-05,
      "loss": 1.1896,
      "num_input_tokens_seen": 42767032720,
      "step": 54358
    },
    {
      "epoch": 5.766921281561638,
      "grad_norm": 0.8122756156661335,
      "learning_rate": 2.656127326463817e-05,
      "loss": 1.2354,
      "num_input_tokens_seen": 42767819456,
      "step": 54359
    },
    {
      "epoch": 5.767027371101209,
      "grad_norm": 0.8620385734544602,
      "learning_rate": 2.6560579651768956e-05,
      "loss": 1.0577,
      "num_input_tokens_seen": 42768606240,
      "step": 54360
    },
    {
      "epoch": 5.767133460640781,
      "grad_norm": 0.975293053106742,
      "learning_rate": 2.6559886037693777e-05,
      "loss": 1.2307,
      "num_input_tokens_seen": 42769393120,
      "step": 54361
    },
    {
      "epoch": 5.767239550180352,
      "grad_norm": 0.6259806123358436,
      "learning_rate": 2.6559192422413165e-05,
      "loss": 1.2083,
      "num_input_tokens_seen": 42770179792,
      "step": 54362
    },
    {
      "epoch": 5.767345639719924,
      "grad_norm": 0.8688453843511145,
      "learning_rate": 2.6558498805927652e-05,
      "loss": 1.1043,
      "num_input_tokens_seen": 42770966496,
      "step": 54363
    },
    {
      "epoch": 5.767451729259495,
      "grad_norm": 0.8883742707330955,
      "learning_rate": 2.655780518823777e-05,
      "loss": 1.1285,
      "num_input_tokens_seen": 42771753344,
      "step": 54364
    },
    {
      "epoch": 5.767557818799066,
      "grad_norm": 0.735701695337056,
      "learning_rate": 2.6557111569344072e-05,
      "loss": 1.3585,
      "num_input_tokens_seen": 42772540080,
      "step": 54365
    },
    {
      "epoch": 5.767663908338638,
      "grad_norm": 0.6877993157279014,
      "learning_rate": 2.6556417949247088e-05,
      "loss": 1.1368,
      "num_input_tokens_seen": 42773326800,
      "step": 54366
    },
    {
      "epoch": 5.767769997878209,
      "grad_norm": 0.6946189075625591,
      "learning_rate": 2.6555724327947335e-05,
      "loss": 1.138,
      "num_input_tokens_seen": 42774113600,
      "step": 54367
    },
    {
      "epoch": 5.767876087417781,
      "grad_norm": 0.702371185651949,
      "learning_rate": 2.655503070544537e-05,
      "loss": 1.1438,
      "num_input_tokens_seen": 42774900400,
      "step": 54368
    },
    {
      "epoch": 5.767982176957352,
      "grad_norm": 0.6464183664212938,
      "learning_rate": 2.6554337081741727e-05,
      "loss": 1.0756,
      "num_input_tokens_seen": 42775687120,
      "step": 54369
    },
    {
      "epoch": 5.768088266496924,
      "grad_norm": 0.6684016543157038,
      "learning_rate": 2.6553643456836934e-05,
      "loss": 1.1651,
      "num_input_tokens_seen": 42776473856,
      "step": 54370
    },
    {
      "epoch": 5.768194356036495,
      "grad_norm": 0.815015004604173,
      "learning_rate": 2.6552949830731532e-05,
      "loss": 1.1738,
      "num_input_tokens_seen": 42777260608,
      "step": 54371
    },
    {
      "epoch": 5.768300445576067,
      "grad_norm": 0.5935766292558666,
      "learning_rate": 2.6552256203426058e-05,
      "loss": 1.0953,
      "num_input_tokens_seen": 42778047392,
      "step": 54372
    },
    {
      "epoch": 5.768406535115638,
      "grad_norm": 0.7851377910092193,
      "learning_rate": 2.655156257492104e-05,
      "loss": 1.2159,
      "num_input_tokens_seen": 42778834112,
      "step": 54373
    },
    {
      "epoch": 5.768512624655209,
      "grad_norm": 0.7515445698042327,
      "learning_rate": 2.6550868945217028e-05,
      "loss": 1.2078,
      "num_input_tokens_seen": 42779620896,
      "step": 54374
    },
    {
      "epoch": 5.768618714194781,
      "grad_norm": 0.8815005094824339,
      "learning_rate": 2.655017531431454e-05,
      "loss": 1.245,
      "num_input_tokens_seen": 42780407744,
      "step": 54375
    },
    {
      "epoch": 5.768724803734352,
      "grad_norm": 0.6289757294171285,
      "learning_rate": 2.6549481682214134e-05,
      "loss": 1.1637,
      "num_input_tokens_seen": 42781194432,
      "step": 54376
    },
    {
      "epoch": 5.768830893273924,
      "grad_norm": 0.6912631288636147,
      "learning_rate": 2.654878804891633e-05,
      "loss": 1.1599,
      "num_input_tokens_seen": 42781981216,
      "step": 54377
    },
    {
      "epoch": 5.768936982813495,
      "grad_norm": 0.6737445759660687,
      "learning_rate": 2.654809441442166e-05,
      "loss": 1.111,
      "num_input_tokens_seen": 42782767952,
      "step": 54378
    },
    {
      "epoch": 5.769043072353066,
      "grad_norm": 0.6841796024795227,
      "learning_rate": 2.6547400778730673e-05,
      "loss": 1.0655,
      "num_input_tokens_seen": 42783554752,
      "step": 54379
    },
    {
      "epoch": 5.769149161892638,
      "grad_norm": 0.6691521260314479,
      "learning_rate": 2.6546707141843907e-05,
      "loss": 1.154,
      "num_input_tokens_seen": 42784341552,
      "step": 54380
    },
    {
      "epoch": 5.769255251432209,
      "grad_norm": 0.5320754221576096,
      "learning_rate": 2.654601350376188e-05,
      "loss": 1.1248,
      "num_input_tokens_seen": 42785128384,
      "step": 54381
    },
    {
      "epoch": 5.7693613409717805,
      "grad_norm": 0.9071245387543385,
      "learning_rate": 2.6545319864485146e-05,
      "loss": 1.208,
      "num_input_tokens_seen": 42785915168,
      "step": 54382
    },
    {
      "epoch": 5.769467430511352,
      "grad_norm": 0.6812054177275809,
      "learning_rate": 2.654462622401423e-05,
      "loss": 1.1409,
      "num_input_tokens_seen": 42786701968,
      "step": 54383
    },
    {
      "epoch": 5.769573520050923,
      "grad_norm": 0.9759046739225069,
      "learning_rate": 2.654393258234968e-05,
      "loss": 1.2582,
      "num_input_tokens_seen": 42787488752,
      "step": 54384
    },
    {
      "epoch": 5.7696796095904945,
      "grad_norm": 0.8148651892676312,
      "learning_rate": 2.6543238939492015e-05,
      "loss": 1.1649,
      "num_input_tokens_seen": 42788275632,
      "step": 54385
    },
    {
      "epoch": 5.769785699130066,
      "grad_norm": 0.6753572746500458,
      "learning_rate": 2.6542545295441784e-05,
      "loss": 1.1456,
      "num_input_tokens_seen": 42789062400,
      "step": 54386
    },
    {
      "epoch": 5.7698917886696375,
      "grad_norm": 0.7017577819125408,
      "learning_rate": 2.6541851650199523e-05,
      "loss": 1.1844,
      "num_input_tokens_seen": 42789849008,
      "step": 54387
    },
    {
      "epoch": 5.7699978782092085,
      "grad_norm": 0.6085340163186193,
      "learning_rate": 2.654115800376576e-05,
      "loss": 1.1055,
      "num_input_tokens_seen": 42790635856,
      "step": 54388
    },
    {
      "epoch": 5.7701039677487795,
      "grad_norm": 0.7202360167312901,
      "learning_rate": 2.6540464356141033e-05,
      "loss": 1.1885,
      "num_input_tokens_seen": 42791422576,
      "step": 54389
    },
    {
      "epoch": 5.7702100572883515,
      "grad_norm": 0.6762706650398955,
      "learning_rate": 2.6539770707325885e-05,
      "loss": 1.2045,
      "num_input_tokens_seen": 42792209312,
      "step": 54390
    },
    {
      "epoch": 5.7703161468279225,
      "grad_norm": 0.6877501135081933,
      "learning_rate": 2.653907705732085e-05,
      "loss": 1.1608,
      "num_input_tokens_seen": 42792996016,
      "step": 54391
    },
    {
      "epoch": 5.770422236367494,
      "grad_norm": 0.6733081532561904,
      "learning_rate": 2.653838340612645e-05,
      "loss": 1.1748,
      "num_input_tokens_seen": 42793782752,
      "step": 54392
    },
    {
      "epoch": 5.770528325907065,
      "grad_norm": 0.8705512836933499,
      "learning_rate": 2.6537689753743244e-05,
      "loss": 1.2336,
      "num_input_tokens_seen": 42794569536,
      "step": 54393
    },
    {
      "epoch": 5.7706344154466365,
      "grad_norm": 0.5853009681255434,
      "learning_rate": 2.6536996100171752e-05,
      "loss": 1.0486,
      "num_input_tokens_seen": 42795356336,
      "step": 54394
    },
    {
      "epoch": 5.770740504986208,
      "grad_norm": 0.8487737947833051,
      "learning_rate": 2.6536302445412513e-05,
      "loss": 1.1695,
      "num_input_tokens_seen": 42796143104,
      "step": 54395
    },
    {
      "epoch": 5.770846594525779,
      "grad_norm": 0.6711690440022869,
      "learning_rate": 2.653560878946606e-05,
      "loss": 1.18,
      "num_input_tokens_seen": 42796929920,
      "step": 54396
    },
    {
      "epoch": 5.770952684065351,
      "grad_norm": 0.6765979591897021,
      "learning_rate": 2.6534915132332943e-05,
      "loss": 1.128,
      "num_input_tokens_seen": 42797716624,
      "step": 54397
    },
    {
      "epoch": 5.771058773604922,
      "grad_norm": 0.6959683150387418,
      "learning_rate": 2.6534221474013683e-05,
      "loss": 1.1886,
      "num_input_tokens_seen": 42798503296,
      "step": 54398
    },
    {
      "epoch": 5.771164863144494,
      "grad_norm": 0.8421335023882502,
      "learning_rate": 2.6533527814508823e-05,
      "loss": 1.1715,
      "num_input_tokens_seen": 42799290016,
      "step": 54399
    },
    {
      "epoch": 5.771270952684065,
      "grad_norm": 0.5903303822388591,
      "learning_rate": 2.6532834153818904e-05,
      "loss": 1.1007,
      "num_input_tokens_seen": 42800076848,
      "step": 54400
    },
    {
      "epoch": 5.771377042223637,
      "grad_norm": 0.8861650160347441,
      "learning_rate": 2.6532140491944446e-05,
      "loss": 1.3079,
      "num_input_tokens_seen": 42800863520,
      "step": 54401
    },
    {
      "epoch": 5.771483131763208,
      "grad_norm": 0.654079773323717,
      "learning_rate": 2.6531446828886e-05,
      "loss": 1.225,
      "num_input_tokens_seen": 42801650208,
      "step": 54402
    },
    {
      "epoch": 5.771589221302779,
      "grad_norm": 0.7302666325050706,
      "learning_rate": 2.6530753164644094e-05,
      "loss": 1.205,
      "num_input_tokens_seen": 42802436976,
      "step": 54403
    },
    {
      "epoch": 5.771695310842351,
      "grad_norm": 0.9939061902913673,
      "learning_rate": 2.6530059499219267e-05,
      "loss": 1.1773,
      "num_input_tokens_seen": 42803223744,
      "step": 54404
    },
    {
      "epoch": 5.771801400381922,
      "grad_norm": 0.6218019591963946,
      "learning_rate": 2.6529365832612064e-05,
      "loss": 1.2122,
      "num_input_tokens_seen": 42804010464,
      "step": 54405
    },
    {
      "epoch": 5.771907489921494,
      "grad_norm": 0.6269202731174545,
      "learning_rate": 2.6528672164823005e-05,
      "loss": 1.1215,
      "num_input_tokens_seen": 42804797152,
      "step": 54406
    },
    {
      "epoch": 5.772013579461065,
      "grad_norm": 0.7170336958675538,
      "learning_rate": 2.652797849585263e-05,
      "loss": 1.1137,
      "num_input_tokens_seen": 42805583968,
      "step": 54407
    },
    {
      "epoch": 5.772119669000636,
      "grad_norm": 0.6080128874825269,
      "learning_rate": 2.6527284825701482e-05,
      "loss": 1.2449,
      "num_input_tokens_seen": 42806370752,
      "step": 54408
    },
    {
      "epoch": 5.772225758540208,
      "grad_norm": 0.6270559480688964,
      "learning_rate": 2.652659115437009e-05,
      "loss": 1.0914,
      "num_input_tokens_seen": 42807157536,
      "step": 54409
    },
    {
      "epoch": 5.772331848079779,
      "grad_norm": 0.8618948143961513,
      "learning_rate": 2.652589748185899e-05,
      "loss": 1.187,
      "num_input_tokens_seen": 42807944320,
      "step": 54410
    },
    {
      "epoch": 5.772437937619351,
      "grad_norm": 0.6424636344305779,
      "learning_rate": 2.652520380816873e-05,
      "loss": 1.1719,
      "num_input_tokens_seen": 42808731072,
      "step": 54411
    },
    {
      "epoch": 5.772544027158922,
      "grad_norm": 0.8015949991247145,
      "learning_rate": 2.652451013329983e-05,
      "loss": 1.1789,
      "num_input_tokens_seen": 42809517888,
      "step": 54412
    },
    {
      "epoch": 5.772650116698493,
      "grad_norm": 0.671652294940296,
      "learning_rate": 2.6523816457252843e-05,
      "loss": 1.0965,
      "num_input_tokens_seen": 42810304640,
      "step": 54413
    },
    {
      "epoch": 5.772756206238065,
      "grad_norm": 0.6763792424115217,
      "learning_rate": 2.6523122780028288e-05,
      "loss": 1.1021,
      "num_input_tokens_seen": 42811091408,
      "step": 54414
    },
    {
      "epoch": 5.772862295777636,
      "grad_norm": 0.7611546959526645,
      "learning_rate": 2.6522429101626706e-05,
      "loss": 1.1603,
      "num_input_tokens_seen": 42811878224,
      "step": 54415
    },
    {
      "epoch": 5.772968385317208,
      "grad_norm": 0.6410742938710838,
      "learning_rate": 2.6521735422048643e-05,
      "loss": 1.0487,
      "num_input_tokens_seen": 42812664928,
      "step": 54416
    },
    {
      "epoch": 5.773074474856779,
      "grad_norm": 0.6794365889483308,
      "learning_rate": 2.652104174129462e-05,
      "loss": 1.1462,
      "num_input_tokens_seen": 42813451744,
      "step": 54417
    },
    {
      "epoch": 5.77318056439635,
      "grad_norm": 0.7890078544630127,
      "learning_rate": 2.6520348059365184e-05,
      "loss": 1.1464,
      "num_input_tokens_seen": 42814238528,
      "step": 54418
    },
    {
      "epoch": 5.773286653935922,
      "grad_norm": 0.752961454041444,
      "learning_rate": 2.6519654376260872e-05,
      "loss": 1.1618,
      "num_input_tokens_seen": 42815025264,
      "step": 54419
    },
    {
      "epoch": 5.773392743475493,
      "grad_norm": 0.6904138107608295,
      "learning_rate": 2.651896069198221e-05,
      "loss": 1.2375,
      "num_input_tokens_seen": 42815812048,
      "step": 54420
    },
    {
      "epoch": 5.773498833015065,
      "grad_norm": 0.6686472043397149,
      "learning_rate": 2.651826700652974e-05,
      "loss": 1.1788,
      "num_input_tokens_seen": 42816598832,
      "step": 54421
    },
    {
      "epoch": 5.773604922554636,
      "grad_norm": 0.6978275517952531,
      "learning_rate": 2.6517573319904e-05,
      "loss": 1.129,
      "num_input_tokens_seen": 42817385648,
      "step": 54422
    },
    {
      "epoch": 5.773711012094208,
      "grad_norm": 0.7216627818554606,
      "learning_rate": 2.6516879632105523e-05,
      "loss": 1.2289,
      "num_input_tokens_seen": 42818172400,
      "step": 54423
    },
    {
      "epoch": 5.773817101633779,
      "grad_norm": 0.8547170170993892,
      "learning_rate": 2.651618594313484e-05,
      "loss": 1.0939,
      "num_input_tokens_seen": 42818959216,
      "step": 54424
    },
    {
      "epoch": 5.77392319117335,
      "grad_norm": 0.8514735010133828,
      "learning_rate": 2.65154922529925e-05,
      "loss": 1.1289,
      "num_input_tokens_seen": 42819745904,
      "step": 54425
    },
    {
      "epoch": 5.774029280712922,
      "grad_norm": 0.959784827300573,
      "learning_rate": 2.651479856167904e-05,
      "loss": 1.1933,
      "num_input_tokens_seen": 42820532656,
      "step": 54426
    },
    {
      "epoch": 5.774135370252493,
      "grad_norm": 0.7009453520317684,
      "learning_rate": 2.6514104869194973e-05,
      "loss": 1.1495,
      "num_input_tokens_seen": 42821319312,
      "step": 54427
    },
    {
      "epoch": 5.774241459792065,
      "grad_norm": 0.6821192514468012,
      "learning_rate": 2.651341117554086e-05,
      "loss": 1.086,
      "num_input_tokens_seen": 42822106064,
      "step": 54428
    },
    {
      "epoch": 5.774347549331636,
      "grad_norm": 0.9100808177520556,
      "learning_rate": 2.651271748071722e-05,
      "loss": 1.2165,
      "num_input_tokens_seen": 42822892816,
      "step": 54429
    },
    {
      "epoch": 5.774453638871208,
      "grad_norm": 0.6729752178608079,
      "learning_rate": 2.65120237847246e-05,
      "loss": 1.1679,
      "num_input_tokens_seen": 42823679696,
      "step": 54430
    },
    {
      "epoch": 5.774559728410779,
      "grad_norm": 0.7674502301804978,
      "learning_rate": 2.6511330087563535e-05,
      "loss": 1.1778,
      "num_input_tokens_seen": 42824466448,
      "step": 54431
    },
    {
      "epoch": 5.77466581795035,
      "grad_norm": 0.6326236981639526,
      "learning_rate": 2.651063638923455e-05,
      "loss": 1.2049,
      "num_input_tokens_seen": 42825253152,
      "step": 54432
    },
    {
      "epoch": 5.774771907489922,
      "grad_norm": 0.7059100357718273,
      "learning_rate": 2.6509942689738197e-05,
      "loss": 1.1218,
      "num_input_tokens_seen": 42826039888,
      "step": 54433
    },
    {
      "epoch": 5.774877997029493,
      "grad_norm": 0.6555577305401918,
      "learning_rate": 2.6509248989075004e-05,
      "loss": 1.1661,
      "num_input_tokens_seen": 42826826672,
      "step": 54434
    },
    {
      "epoch": 5.774984086569065,
      "grad_norm": 1.05821021373903,
      "learning_rate": 2.65085552872455e-05,
      "loss": 1.1746,
      "num_input_tokens_seen": 42827613456,
      "step": 54435
    },
    {
      "epoch": 5.775090176108636,
      "grad_norm": 0.6111046856613255,
      "learning_rate": 2.6507861584250236e-05,
      "loss": 1.1032,
      "num_input_tokens_seen": 42828400304,
      "step": 54436
    },
    {
      "epoch": 5.775196265648207,
      "grad_norm": 0.6463145880948818,
      "learning_rate": 2.6507167880089745e-05,
      "loss": 1.1629,
      "num_input_tokens_seen": 42829187008,
      "step": 54437
    },
    {
      "epoch": 5.775302355187779,
      "grad_norm": 0.6948475209648199,
      "learning_rate": 2.650647417476455e-05,
      "loss": 1.198,
      "num_input_tokens_seen": 42829973712,
      "step": 54438
    },
    {
      "epoch": 5.77540844472735,
      "grad_norm": 0.6727188251439559,
      "learning_rate": 2.6505780468275204e-05,
      "loss": 1.0835,
      "num_input_tokens_seen": 42830760512,
      "step": 54439
    },
    {
      "epoch": 5.775514534266922,
      "grad_norm": 0.5851648916904749,
      "learning_rate": 2.6505086760622234e-05,
      "loss": 1.1256,
      "num_input_tokens_seen": 42831547312,
      "step": 54440
    },
    {
      "epoch": 5.775620623806493,
      "grad_norm": 0.7622378006722248,
      "learning_rate": 2.650439305180617e-05,
      "loss": 1.1869,
      "num_input_tokens_seen": 42832334144,
      "step": 54441
    },
    {
      "epoch": 5.775726713346064,
      "grad_norm": 0.7062621970466643,
      "learning_rate": 2.6503699341827558e-05,
      "loss": 1.2543,
      "num_input_tokens_seen": 42833120864,
      "step": 54442
    },
    {
      "epoch": 5.775832802885636,
      "grad_norm": 0.7161010414863248,
      "learning_rate": 2.6503005630686926e-05,
      "loss": 1.2789,
      "num_input_tokens_seen": 42833907632,
      "step": 54443
    },
    {
      "epoch": 5.775938892425207,
      "grad_norm": 0.5498549592326841,
      "learning_rate": 2.650231191838482e-05,
      "loss": 1.1553,
      "num_input_tokens_seen": 42834694400,
      "step": 54444
    },
    {
      "epoch": 5.776044981964779,
      "grad_norm": 0.7173831643989194,
      "learning_rate": 2.6501618204921773e-05,
      "loss": 1.1692,
      "num_input_tokens_seen": 42835481152,
      "step": 54445
    },
    {
      "epoch": 5.77615107150435,
      "grad_norm": 0.839450767626748,
      "learning_rate": 2.6500924490298325e-05,
      "loss": 1.1454,
      "num_input_tokens_seen": 42836268000,
      "step": 54446
    },
    {
      "epoch": 5.776257161043921,
      "grad_norm": 0.791726402297788,
      "learning_rate": 2.6500230774515e-05,
      "loss": 1.1554,
      "num_input_tokens_seen": 42837054784,
      "step": 54447
    },
    {
      "epoch": 5.7763632505834925,
      "grad_norm": 0.8294477165898435,
      "learning_rate": 2.6499537057572342e-05,
      "loss": 1.2188,
      "num_input_tokens_seen": 42837841552,
      "step": 54448
    },
    {
      "epoch": 5.776469340123064,
      "grad_norm": 0.6122655283099672,
      "learning_rate": 2.6498843339470885e-05,
      "loss": 1.1553,
      "num_input_tokens_seen": 42838628336,
      "step": 54449
    },
    {
      "epoch": 5.7765754296626355,
      "grad_norm": 0.6268185220103594,
      "learning_rate": 2.6498149620211165e-05,
      "loss": 1.1507,
      "num_input_tokens_seen": 42839415120,
      "step": 54450
    },
    {
      "epoch": 5.7766815192022065,
      "grad_norm": 0.555056356099619,
      "learning_rate": 2.649745589979372e-05,
      "loss": 1.0712,
      "num_input_tokens_seen": 42840201904,
      "step": 54451
    },
    {
      "epoch": 5.776787608741778,
      "grad_norm": 0.8599464139035171,
      "learning_rate": 2.6496762178219093e-05,
      "loss": 1.0867,
      "num_input_tokens_seen": 42840988640,
      "step": 54452
    },
    {
      "epoch": 5.7768936982813495,
      "grad_norm": 0.5924731883028477,
      "learning_rate": 2.6496068455487798e-05,
      "loss": 1.1726,
      "num_input_tokens_seen": 42841775408,
      "step": 54453
    },
    {
      "epoch": 5.7769997878209205,
      "grad_norm": 0.5261888841001118,
      "learning_rate": 2.649537473160039e-05,
      "loss": 1.1138,
      "num_input_tokens_seen": 42842562208,
      "step": 54454
    },
    {
      "epoch": 5.777105877360492,
      "grad_norm": 0.5755248024349331,
      "learning_rate": 2.6494681006557404e-05,
      "loss": 1.0981,
      "num_input_tokens_seen": 42843348944,
      "step": 54455
    },
    {
      "epoch": 5.7772119669000634,
      "grad_norm": 0.879569294282746,
      "learning_rate": 2.6493987280359373e-05,
      "loss": 1.1436,
      "num_input_tokens_seen": 42844135696,
      "step": 54456
    },
    {
      "epoch": 5.777318056439635,
      "grad_norm": 0.7017333933156811,
      "learning_rate": 2.6493293553006832e-05,
      "loss": 1.161,
      "num_input_tokens_seen": 42844922448,
      "step": 54457
    },
    {
      "epoch": 5.777424145979206,
      "grad_norm": 0.611828122389024,
      "learning_rate": 2.6492599824500307e-05,
      "loss": 1.1343,
      "num_input_tokens_seen": 42845709216,
      "step": 54458
    },
    {
      "epoch": 5.777530235518778,
      "grad_norm": 0.5479917359712094,
      "learning_rate": 2.6491906094840357e-05,
      "loss": 1.0803,
      "num_input_tokens_seen": 42846496016,
      "step": 54459
    },
    {
      "epoch": 5.777636325058349,
      "grad_norm": 0.7692215977520417,
      "learning_rate": 2.64912123640275e-05,
      "loss": 1.0825,
      "num_input_tokens_seen": 42847282768,
      "step": 54460
    },
    {
      "epoch": 5.77774241459792,
      "grad_norm": 0.5839483711227746,
      "learning_rate": 2.6490518632062276e-05,
      "loss": 1.0694,
      "num_input_tokens_seen": 42848069536,
      "step": 54461
    },
    {
      "epoch": 5.777848504137492,
      "grad_norm": 0.6492779379228103,
      "learning_rate": 2.6489824898945232e-05,
      "loss": 1.1641,
      "num_input_tokens_seen": 42848856240,
      "step": 54462
    },
    {
      "epoch": 5.777954593677063,
      "grad_norm": 0.6219556772071775,
      "learning_rate": 2.6489131164676888e-05,
      "loss": 1.1199,
      "num_input_tokens_seen": 42849643072,
      "step": 54463
    },
    {
      "epoch": 5.778060683216635,
      "grad_norm": 0.6442420356460339,
      "learning_rate": 2.6488437429257788e-05,
      "loss": 1.162,
      "num_input_tokens_seen": 42850429920,
      "step": 54464
    },
    {
      "epoch": 5.778166772756206,
      "grad_norm": 0.6285982700055316,
      "learning_rate": 2.6487743692688472e-05,
      "loss": 1.0862,
      "num_input_tokens_seen": 42851216752,
      "step": 54465
    },
    {
      "epoch": 5.778272862295777,
      "grad_norm": 0.8234193810412762,
      "learning_rate": 2.6487049954969468e-05,
      "loss": 1.164,
      "num_input_tokens_seen": 42852003488,
      "step": 54466
    },
    {
      "epoch": 5.778378951835349,
      "grad_norm": 0.954753803457912,
      "learning_rate": 2.648635621610131e-05,
      "loss": 1.185,
      "num_input_tokens_seen": 42852790224,
      "step": 54467
    },
    {
      "epoch": 5.77848504137492,
      "grad_norm": 0.7519405359287521,
      "learning_rate": 2.648566247608455e-05,
      "loss": 1.1585,
      "num_input_tokens_seen": 42853576960,
      "step": 54468
    },
    {
      "epoch": 5.778591130914492,
      "grad_norm": 0.7912911956742746,
      "learning_rate": 2.6484968734919708e-05,
      "loss": 1.0689,
      "num_input_tokens_seen": 42854363760,
      "step": 54469
    },
    {
      "epoch": 5.778697220454063,
      "grad_norm": 1.242558362170353,
      "learning_rate": 2.648427499260732e-05,
      "loss": 1.1944,
      "num_input_tokens_seen": 42855150624,
      "step": 54470
    },
    {
      "epoch": 5.778803309993634,
      "grad_norm": 0.669874407660714,
      "learning_rate": 2.6483581249147938e-05,
      "loss": 1.1906,
      "num_input_tokens_seen": 42855937392,
      "step": 54471
    },
    {
      "epoch": 5.778909399533206,
      "grad_norm": 1.0080820479147565,
      "learning_rate": 2.648288750454208e-05,
      "loss": 1.251,
      "num_input_tokens_seen": 42856724096,
      "step": 54472
    },
    {
      "epoch": 5.779015489072777,
      "grad_norm": 1.0768365136225606,
      "learning_rate": 2.648219375879029e-05,
      "loss": 1.217,
      "num_input_tokens_seen": 42857510832,
      "step": 54473
    },
    {
      "epoch": 5.779121578612349,
      "grad_norm": 0.7482942624592983,
      "learning_rate": 2.6481500011893112e-05,
      "loss": 1.2621,
      "num_input_tokens_seen": 42858297568,
      "step": 54474
    },
    {
      "epoch": 5.77922766815192,
      "grad_norm": 1.0273024132425241,
      "learning_rate": 2.6480806263851067e-05,
      "loss": 1.1226,
      "num_input_tokens_seen": 42859084352,
      "step": 54475
    },
    {
      "epoch": 5.779333757691491,
      "grad_norm": 0.7771627966526444,
      "learning_rate": 2.64801125146647e-05,
      "loss": 1.1162,
      "num_input_tokens_seen": 42859871088,
      "step": 54476
    },
    {
      "epoch": 5.779439847231063,
      "grad_norm": 0.6726268551551046,
      "learning_rate": 2.647941876433455e-05,
      "loss": 1.0557,
      "num_input_tokens_seen": 42860657808,
      "step": 54477
    },
    {
      "epoch": 5.779545936770634,
      "grad_norm": 0.9546496253538294,
      "learning_rate": 2.6478725012861144e-05,
      "loss": 1.2775,
      "num_input_tokens_seen": 42861444512,
      "step": 54478
    },
    {
      "epoch": 5.779652026310206,
      "grad_norm": 0.6464606771122557,
      "learning_rate": 2.647803126024503e-05,
      "loss": 1.1071,
      "num_input_tokens_seen": 42862231296,
      "step": 54479
    },
    {
      "epoch": 5.779758115849777,
      "grad_norm": 0.7422313872445502,
      "learning_rate": 2.6477337506486728e-05,
      "loss": 1.1746,
      "num_input_tokens_seen": 42863018080,
      "step": 54480
    },
    {
      "epoch": 5.779864205389349,
      "grad_norm": 0.6836752197799735,
      "learning_rate": 2.6476643751586782e-05,
      "loss": 1.1883,
      "num_input_tokens_seen": 42863804864,
      "step": 54481
    },
    {
      "epoch": 5.77997029492892,
      "grad_norm": 0.740874779901095,
      "learning_rate": 2.6475949995545733e-05,
      "loss": 1.2341,
      "num_input_tokens_seen": 42864591728,
      "step": 54482
    },
    {
      "epoch": 5.780076384468491,
      "grad_norm": 0.5825766790083304,
      "learning_rate": 2.6475256238364114e-05,
      "loss": 1.088,
      "num_input_tokens_seen": 42865378544,
      "step": 54483
    },
    {
      "epoch": 5.780182474008063,
      "grad_norm": 0.7427893130140515,
      "learning_rate": 2.647456248004246e-05,
      "loss": 1.1162,
      "num_input_tokens_seen": 42866165376,
      "step": 54484
    },
    {
      "epoch": 5.780288563547634,
      "grad_norm": 0.6127561804634721,
      "learning_rate": 2.6473868720581306e-05,
      "loss": 1.1343,
      "num_input_tokens_seen": 42866952240,
      "step": 54485
    },
    {
      "epoch": 5.780394653087206,
      "grad_norm": 0.6731581968617696,
      "learning_rate": 2.647317495998119e-05,
      "loss": 1.2105,
      "num_input_tokens_seen": 42867738960,
      "step": 54486
    },
    {
      "epoch": 5.780500742626777,
      "grad_norm": 0.7337002827572304,
      "learning_rate": 2.647248119824265e-05,
      "loss": 1.1082,
      "num_input_tokens_seen": 42868525728,
      "step": 54487
    },
    {
      "epoch": 5.780606832166349,
      "grad_norm": 0.6888997886121456,
      "learning_rate": 2.6471787435366218e-05,
      "loss": 1.0772,
      "num_input_tokens_seen": 42869312432,
      "step": 54488
    },
    {
      "epoch": 5.78071292170592,
      "grad_norm": 0.7657833881161326,
      "learning_rate": 2.6471093671352428e-05,
      "loss": 1.2191,
      "num_input_tokens_seen": 42870099168,
      "step": 54489
    },
    {
      "epoch": 5.780819011245491,
      "grad_norm": 1.0756067086408956,
      "learning_rate": 2.6470399906201824e-05,
      "loss": 1.1187,
      "num_input_tokens_seen": 42870886016,
      "step": 54490
    },
    {
      "epoch": 5.780925100785063,
      "grad_norm": 0.6204143395697588,
      "learning_rate": 2.6469706139914933e-05,
      "loss": 1.1822,
      "num_input_tokens_seen": 42871672688,
      "step": 54491
    },
    {
      "epoch": 5.781031190324634,
      "grad_norm": 0.6543933665762535,
      "learning_rate": 2.6469012372492303e-05,
      "loss": 1.1842,
      "num_input_tokens_seen": 42872459456,
      "step": 54492
    },
    {
      "epoch": 5.781137279864206,
      "grad_norm": 0.6000621626645878,
      "learning_rate": 2.6468318603934455e-05,
      "loss": 1.0353,
      "num_input_tokens_seen": 42873246224,
      "step": 54493
    },
    {
      "epoch": 5.781243369403777,
      "grad_norm": 0.6363444285740137,
      "learning_rate": 2.6467624834241943e-05,
      "loss": 1.2076,
      "num_input_tokens_seen": 42874033072,
      "step": 54494
    },
    {
      "epoch": 5.781349458943348,
      "grad_norm": 0.7356599273996098,
      "learning_rate": 2.646693106341529e-05,
      "loss": 1.1469,
      "num_input_tokens_seen": 42874819856,
      "step": 54495
    },
    {
      "epoch": 5.78145554848292,
      "grad_norm": 0.6764964119821626,
      "learning_rate": 2.6466237291455037e-05,
      "loss": 1.1625,
      "num_input_tokens_seen": 42875606656,
      "step": 54496
    },
    {
      "epoch": 5.781561638022491,
      "grad_norm": 0.6957922562677225,
      "learning_rate": 2.6465543518361718e-05,
      "loss": 1.2045,
      "num_input_tokens_seen": 42876393424,
      "step": 54497
    },
    {
      "epoch": 5.781667727562063,
      "grad_norm": 0.6318951686288526,
      "learning_rate": 2.6464849744135868e-05,
      "loss": 1.127,
      "num_input_tokens_seen": 42877180288,
      "step": 54498
    },
    {
      "epoch": 5.781773817101634,
      "grad_norm": 0.6454057874615223,
      "learning_rate": 2.6464155968778026e-05,
      "loss": 1.0549,
      "num_input_tokens_seen": 42877967024,
      "step": 54499
    },
    {
      "epoch": 5.781879906641205,
      "grad_norm": 0.7105790608055155,
      "learning_rate": 2.6463462192288728e-05,
      "loss": 1.1107,
      "num_input_tokens_seen": 42878753872,
      "step": 54500
    },
    {
      "epoch": 5.781985996180777,
      "grad_norm": 0.8210166876997578,
      "learning_rate": 2.646276841466851e-05,
      "loss": 1.087,
      "num_input_tokens_seen": 42879540608,
      "step": 54501
    },
    {
      "epoch": 5.782092085720348,
      "grad_norm": 0.859383741132299,
      "learning_rate": 2.6462074635917904e-05,
      "loss": 1.2067,
      "num_input_tokens_seen": 42880327456,
      "step": 54502
    },
    {
      "epoch": 5.78219817525992,
      "grad_norm": 0.8192544605981829,
      "learning_rate": 2.6461380856037455e-05,
      "loss": 1.1559,
      "num_input_tokens_seen": 42881114352,
      "step": 54503
    },
    {
      "epoch": 5.782304264799491,
      "grad_norm": 0.6568022393658391,
      "learning_rate": 2.646068707502769e-05,
      "loss": 1.1908,
      "num_input_tokens_seen": 42881901072,
      "step": 54504
    },
    {
      "epoch": 5.782410354339062,
      "grad_norm": 0.6585705646610038,
      "learning_rate": 2.645999329288915e-05,
      "loss": 1.1554,
      "num_input_tokens_seen": 42882687776,
      "step": 54505
    },
    {
      "epoch": 5.782516443878634,
      "grad_norm": 0.6864525433893457,
      "learning_rate": 2.645929950962237e-05,
      "loss": 1.166,
      "num_input_tokens_seen": 42883474512,
      "step": 54506
    },
    {
      "epoch": 5.782622533418205,
      "grad_norm": 0.6164579686763317,
      "learning_rate": 2.6458605725227886e-05,
      "loss": 1.0829,
      "num_input_tokens_seen": 42884261184,
      "step": 54507
    },
    {
      "epoch": 5.782728622957777,
      "grad_norm": 0.5873953360897676,
      "learning_rate": 2.6457911939706236e-05,
      "loss": 1.0807,
      "num_input_tokens_seen": 42885047984,
      "step": 54508
    },
    {
      "epoch": 5.782834712497348,
      "grad_norm": 0.6422310885712047,
      "learning_rate": 2.6457218153057956e-05,
      "loss": 1.1709,
      "num_input_tokens_seen": 42885834720,
      "step": 54509
    },
    {
      "epoch": 5.7829408020369195,
      "grad_norm": 0.709125114465452,
      "learning_rate": 2.645652436528357e-05,
      "loss": 1.204,
      "num_input_tokens_seen": 42886621552,
      "step": 54510
    },
    {
      "epoch": 5.7830468915764905,
      "grad_norm": 0.667974477533488,
      "learning_rate": 2.6455830576383634e-05,
      "loss": 1.1313,
      "num_input_tokens_seen": 42887408256,
      "step": 54511
    },
    {
      "epoch": 5.783152981116062,
      "grad_norm": 0.5764946311877721,
      "learning_rate": 2.6455136786358675e-05,
      "loss": 1.0712,
      "num_input_tokens_seen": 42888195024,
      "step": 54512
    },
    {
      "epoch": 5.7832590706556335,
      "grad_norm": 0.7959521693935211,
      "learning_rate": 2.6454442995209222e-05,
      "loss": 1.2352,
      "num_input_tokens_seen": 42888981696,
      "step": 54513
    },
    {
      "epoch": 5.7833651601952045,
      "grad_norm": 0.8987029765018585,
      "learning_rate": 2.6453749202935827e-05,
      "loss": 1.2327,
      "num_input_tokens_seen": 42889768464,
      "step": 54514
    },
    {
      "epoch": 5.783471249734776,
      "grad_norm": 0.6739662017387112,
      "learning_rate": 2.6453055409539013e-05,
      "loss": 1.116,
      "num_input_tokens_seen": 42890555248,
      "step": 54515
    },
    {
      "epoch": 5.7835773392743475,
      "grad_norm": 0.6425353098783257,
      "learning_rate": 2.645236161501932e-05,
      "loss": 1.2146,
      "num_input_tokens_seen": 42891342096,
      "step": 54516
    },
    {
      "epoch": 5.783683428813919,
      "grad_norm": 1.1517618389309139,
      "learning_rate": 2.6451667819377283e-05,
      "loss": 1.0939,
      "num_input_tokens_seen": 42892128800,
      "step": 54517
    },
    {
      "epoch": 5.78378951835349,
      "grad_norm": 1.0194988869044304,
      "learning_rate": 2.6450974022613445e-05,
      "loss": 1.2269,
      "num_input_tokens_seen": 42892915472,
      "step": 54518
    },
    {
      "epoch": 5.7838956078930615,
      "grad_norm": 0.7879784303781837,
      "learning_rate": 2.6450280224728336e-05,
      "loss": 1.1286,
      "num_input_tokens_seen": 42893702240,
      "step": 54519
    },
    {
      "epoch": 5.784001697432633,
      "grad_norm": 1.11575984388416,
      "learning_rate": 2.644958642572249e-05,
      "loss": 1.1396,
      "num_input_tokens_seen": 42894488976,
      "step": 54520
    },
    {
      "epoch": 5.784107786972204,
      "grad_norm": 0.9132331564810541,
      "learning_rate": 2.6448892625596446e-05,
      "loss": 1.2208,
      "num_input_tokens_seen": 42895275744,
      "step": 54521
    },
    {
      "epoch": 5.784213876511776,
      "grad_norm": 0.7345070266713367,
      "learning_rate": 2.644819882435074e-05,
      "loss": 1.2761,
      "num_input_tokens_seen": 42896062512,
      "step": 54522
    },
    {
      "epoch": 5.784319966051347,
      "grad_norm": 0.7634203834145158,
      "learning_rate": 2.6447505021985913e-05,
      "loss": 1.1275,
      "num_input_tokens_seen": 42896849312,
      "step": 54523
    },
    {
      "epoch": 5.784426055590918,
      "grad_norm": 0.8536257566597042,
      "learning_rate": 2.644681121850249e-05,
      "loss": 1.2046,
      "num_input_tokens_seen": 42897636048,
      "step": 54524
    },
    {
      "epoch": 5.78453214513049,
      "grad_norm": 0.5620828991549207,
      "learning_rate": 2.6446117413901017e-05,
      "loss": 1.0998,
      "num_input_tokens_seen": 42898422864,
      "step": 54525
    },
    {
      "epoch": 5.784638234670061,
      "grad_norm": 0.6981450340516292,
      "learning_rate": 2.644542360818203e-05,
      "loss": 1.1421,
      "num_input_tokens_seen": 42899209632,
      "step": 54526
    },
    {
      "epoch": 5.784744324209633,
      "grad_norm": 0.8926177425550853,
      "learning_rate": 2.6444729801346057e-05,
      "loss": 1.2106,
      "num_input_tokens_seen": 42899996416,
      "step": 54527
    },
    {
      "epoch": 5.784850413749204,
      "grad_norm": 0.7410254582987631,
      "learning_rate": 2.644403599339364e-05,
      "loss": 1.0317,
      "num_input_tokens_seen": 42900783184,
      "step": 54528
    },
    {
      "epoch": 5.784956503288775,
      "grad_norm": 0.6833585897744493,
      "learning_rate": 2.644334218432532e-05,
      "loss": 1.051,
      "num_input_tokens_seen": 42901569936,
      "step": 54529
    },
    {
      "epoch": 5.785062592828347,
      "grad_norm": 1.071685646948636,
      "learning_rate": 2.644264837414162e-05,
      "loss": 1.1665,
      "num_input_tokens_seen": 42902356704,
      "step": 54530
    },
    {
      "epoch": 5.785168682367918,
      "grad_norm": 0.8170925151728834,
      "learning_rate": 2.6441954562843086e-05,
      "loss": 1.1437,
      "num_input_tokens_seen": 42903143536,
      "step": 54531
    },
    {
      "epoch": 5.78527477190749,
      "grad_norm": 0.6723917106223791,
      "learning_rate": 2.6441260750430253e-05,
      "loss": 1.1585,
      "num_input_tokens_seen": 42903930224,
      "step": 54532
    },
    {
      "epoch": 5.785380861447061,
      "grad_norm": 0.881348209618839,
      "learning_rate": 2.6440566936903654e-05,
      "loss": 1.1851,
      "num_input_tokens_seen": 42904716976,
      "step": 54533
    },
    {
      "epoch": 5.785486950986632,
      "grad_norm": 1.1272772295327838,
      "learning_rate": 2.643987312226383e-05,
      "loss": 1.2124,
      "num_input_tokens_seen": 42905503680,
      "step": 54534
    },
    {
      "epoch": 5.785593040526204,
      "grad_norm": 0.6065202635847287,
      "learning_rate": 2.6439179306511315e-05,
      "loss": 1.1625,
      "num_input_tokens_seen": 42906290416,
      "step": 54535
    },
    {
      "epoch": 5.785699130065775,
      "grad_norm": 1.0137896792365106,
      "learning_rate": 2.6438485489646643e-05,
      "loss": 1.2487,
      "num_input_tokens_seen": 42907077152,
      "step": 54536
    },
    {
      "epoch": 5.785805219605347,
      "grad_norm": 0.6250962667260017,
      "learning_rate": 2.6437791671670352e-05,
      "loss": 1.137,
      "num_input_tokens_seen": 42907863952,
      "step": 54537
    },
    {
      "epoch": 5.785911309144918,
      "grad_norm": 0.6948829816805431,
      "learning_rate": 2.643709785258297e-05,
      "loss": 1.1453,
      "num_input_tokens_seen": 42908650672,
      "step": 54538
    },
    {
      "epoch": 5.78601739868449,
      "grad_norm": 0.79873077108399,
      "learning_rate": 2.643640403238505e-05,
      "loss": 1.189,
      "num_input_tokens_seen": 42909437440,
      "step": 54539
    },
    {
      "epoch": 5.786123488224061,
      "grad_norm": 0.5861765611607728,
      "learning_rate": 2.6435710211077113e-05,
      "loss": 1.1153,
      "num_input_tokens_seen": 42910224272,
      "step": 54540
    },
    {
      "epoch": 5.786229577763633,
      "grad_norm": 1.104950437551579,
      "learning_rate": 2.6435016388659706e-05,
      "loss": 1.2475,
      "num_input_tokens_seen": 42911011104,
      "step": 54541
    },
    {
      "epoch": 5.786335667303204,
      "grad_norm": 0.6704510186217587,
      "learning_rate": 2.6434322565133358e-05,
      "loss": 1.1675,
      "num_input_tokens_seen": 42911797824,
      "step": 54542
    },
    {
      "epoch": 5.786441756842775,
      "grad_norm": 1.1349540487491334,
      "learning_rate": 2.6433628740498612e-05,
      "loss": 1.1841,
      "num_input_tokens_seen": 42912584576,
      "step": 54543
    },
    {
      "epoch": 5.786547846382347,
      "grad_norm": 0.7119982810213252,
      "learning_rate": 2.643293491475599e-05,
      "loss": 1.0799,
      "num_input_tokens_seen": 42913371376,
      "step": 54544
    },
    {
      "epoch": 5.786653935921918,
      "grad_norm": 0.5790524664530777,
      "learning_rate": 2.643224108790605e-05,
      "loss": 1.1246,
      "num_input_tokens_seen": 42914158240,
      "step": 54545
    },
    {
      "epoch": 5.78676002546149,
      "grad_norm": 0.8872326885954468,
      "learning_rate": 2.6431547259949314e-05,
      "loss": 1.2125,
      "num_input_tokens_seen": 42914945008,
      "step": 54546
    },
    {
      "epoch": 5.786866115001061,
      "grad_norm": 0.6788985634615636,
      "learning_rate": 2.6430853430886317e-05,
      "loss": 1.1375,
      "num_input_tokens_seen": 42915731824,
      "step": 54547
    },
    {
      "epoch": 5.786972204540632,
      "grad_norm": 0.7621610053197512,
      "learning_rate": 2.6430159600717597e-05,
      "loss": 1.1027,
      "num_input_tokens_seen": 42916518624,
      "step": 54548
    },
    {
      "epoch": 5.787078294080204,
      "grad_norm": 0.7006721654831273,
      "learning_rate": 2.6429465769443695e-05,
      "loss": 1.0626,
      "num_input_tokens_seen": 42917305488,
      "step": 54549
    },
    {
      "epoch": 5.787184383619775,
      "grad_norm": 1.0890140811399802,
      "learning_rate": 2.6428771937065137e-05,
      "loss": 1.2201,
      "num_input_tokens_seen": 42918092288,
      "step": 54550
    },
    {
      "epoch": 5.787290473159347,
      "grad_norm": 0.600267014758214,
      "learning_rate": 2.6428078103582475e-05,
      "loss": 1.1874,
      "num_input_tokens_seen": 42918879008,
      "step": 54551
    },
    {
      "epoch": 5.787396562698918,
      "grad_norm": 0.878254280594279,
      "learning_rate": 2.6427384268996238e-05,
      "loss": 1.1654,
      "num_input_tokens_seen": 42919665760,
      "step": 54552
    },
    {
      "epoch": 5.787502652238489,
      "grad_norm": 0.8044460117584471,
      "learning_rate": 2.642669043330695e-05,
      "loss": 1.1618,
      "num_input_tokens_seen": 42920452512,
      "step": 54553
    },
    {
      "epoch": 5.787608741778061,
      "grad_norm": 0.7525017171320214,
      "learning_rate": 2.6425996596515164e-05,
      "loss": 1.2329,
      "num_input_tokens_seen": 42921239328,
      "step": 54554
    },
    {
      "epoch": 5.787714831317632,
      "grad_norm": 0.6554020423261285,
      "learning_rate": 2.6425302758621408e-05,
      "loss": 1.1506,
      "num_input_tokens_seen": 42922026112,
      "step": 54555
    },
    {
      "epoch": 5.787820920857204,
      "grad_norm": 0.8840580455382232,
      "learning_rate": 2.6424608919626215e-05,
      "loss": 1.1616,
      "num_input_tokens_seen": 42922812832,
      "step": 54556
    },
    {
      "epoch": 5.787927010396775,
      "grad_norm": 0.6373216086727096,
      "learning_rate": 2.6423915079530133e-05,
      "loss": 1.1223,
      "num_input_tokens_seen": 42923599664,
      "step": 54557
    },
    {
      "epoch": 5.788033099936346,
      "grad_norm": 1.4464175122611023,
      "learning_rate": 2.6423221238333684e-05,
      "loss": 1.2263,
      "num_input_tokens_seen": 42924386368,
      "step": 54558
    },
    {
      "epoch": 5.788139189475918,
      "grad_norm": 0.7648371546077708,
      "learning_rate": 2.642252739603742e-05,
      "loss": 1.1286,
      "num_input_tokens_seen": 42925173104,
      "step": 54559
    },
    {
      "epoch": 5.788245279015489,
      "grad_norm": 0.6196180141203772,
      "learning_rate": 2.6421833552641868e-05,
      "loss": 1.1276,
      "num_input_tokens_seen": 42925959760,
      "step": 54560
    },
    {
      "epoch": 5.788351368555061,
      "grad_norm": 1.0726596566802327,
      "learning_rate": 2.6421139708147557e-05,
      "loss": 1.2028,
      "num_input_tokens_seen": 42926746576,
      "step": 54561
    },
    {
      "epoch": 5.788457458094632,
      "grad_norm": 0.7536174860571337,
      "learning_rate": 2.6420445862555038e-05,
      "loss": 1.1957,
      "num_input_tokens_seen": 42927533280,
      "step": 54562
    },
    {
      "epoch": 5.788563547634203,
      "grad_norm": 0.8301832100592684,
      "learning_rate": 2.6419752015864842e-05,
      "loss": 1.2326,
      "num_input_tokens_seen": 42928320064,
      "step": 54563
    },
    {
      "epoch": 5.788669637173775,
      "grad_norm": 1.0497956960812656,
      "learning_rate": 2.6419058168077494e-05,
      "loss": 1.2347,
      "num_input_tokens_seen": 42929106832,
      "step": 54564
    },
    {
      "epoch": 5.788775726713346,
      "grad_norm": 1.0570313793744077,
      "learning_rate": 2.6418364319193544e-05,
      "loss": 1.166,
      "num_input_tokens_seen": 42929893616,
      "step": 54565
    },
    {
      "epoch": 5.788881816252918,
      "grad_norm": 0.7443427097611228,
      "learning_rate": 2.641767046921353e-05,
      "loss": 1.211,
      "num_input_tokens_seen": 42930680368,
      "step": 54566
    },
    {
      "epoch": 5.788987905792489,
      "grad_norm": 0.7792077397929245,
      "learning_rate": 2.6416976618137966e-05,
      "loss": 1.2511,
      "num_input_tokens_seen": 42931467104,
      "step": 54567
    },
    {
      "epoch": 5.789093995332061,
      "grad_norm": 0.9437734358554318,
      "learning_rate": 2.641628276596742e-05,
      "loss": 1.1818,
      "num_input_tokens_seen": 42932253824,
      "step": 54568
    },
    {
      "epoch": 5.789200084871632,
      "grad_norm": 0.7377939355635215,
      "learning_rate": 2.6415588912702404e-05,
      "loss": 1.2067,
      "num_input_tokens_seen": 42933040576,
      "step": 54569
    },
    {
      "epoch": 5.7893061744112035,
      "grad_norm": 0.5751946869156696,
      "learning_rate": 2.6414895058343463e-05,
      "loss": 1.1008,
      "num_input_tokens_seen": 42933827344,
      "step": 54570
    },
    {
      "epoch": 5.789412263950775,
      "grad_norm": 0.8953390136828161,
      "learning_rate": 2.6414201202891138e-05,
      "loss": 1.1184,
      "num_input_tokens_seen": 42934614208,
      "step": 54571
    },
    {
      "epoch": 5.789518353490346,
      "grad_norm": 0.806971972634966,
      "learning_rate": 2.6413507346345954e-05,
      "loss": 1.0685,
      "num_input_tokens_seen": 42935401072,
      "step": 54572
    },
    {
      "epoch": 5.7896244430299175,
      "grad_norm": 0.6437741110570486,
      "learning_rate": 2.6412813488708454e-05,
      "loss": 1.227,
      "num_input_tokens_seen": 42936187872,
      "step": 54573
    },
    {
      "epoch": 5.7897305325694886,
      "grad_norm": 0.7644876202390263,
      "learning_rate": 2.6412119629979175e-05,
      "loss": 1.1854,
      "num_input_tokens_seen": 42936974720,
      "step": 54574
    },
    {
      "epoch": 5.7898366221090605,
      "grad_norm": 0.7060359100729463,
      "learning_rate": 2.641142577015865e-05,
      "loss": 1.1422,
      "num_input_tokens_seen": 42937761424,
      "step": 54575
    },
    {
      "epoch": 5.7899427116486315,
      "grad_norm": 1.095729681565565,
      "learning_rate": 2.6410731909247415e-05,
      "loss": 1.1888,
      "num_input_tokens_seen": 42938548176,
      "step": 54576
    },
    {
      "epoch": 5.7900488011882025,
      "grad_norm": 0.7275191346112733,
      "learning_rate": 2.6410038047246017e-05,
      "loss": 1.0114,
      "num_input_tokens_seen": 42939334896,
      "step": 54577
    },
    {
      "epoch": 5.7901548907277745,
      "grad_norm": 0.9524887867661874,
      "learning_rate": 2.6409344184154973e-05,
      "loss": 1.1852,
      "num_input_tokens_seen": 42940121696,
      "step": 54578
    },
    {
      "epoch": 5.7902609802673455,
      "grad_norm": 0.6337908548324971,
      "learning_rate": 2.640865031997483e-05,
      "loss": 1.1553,
      "num_input_tokens_seen": 42940908496,
      "step": 54579
    },
    {
      "epoch": 5.790367069806917,
      "grad_norm": 0.610429387861402,
      "learning_rate": 2.640795645470613e-05,
      "loss": 1.2235,
      "num_input_tokens_seen": 42941695280,
      "step": 54580
    },
    {
      "epoch": 5.790473159346488,
      "grad_norm": 0.9207522159026863,
      "learning_rate": 2.640726258834939e-05,
      "loss": 1.0558,
      "num_input_tokens_seen": 42942482016,
      "step": 54581
    },
    {
      "epoch": 5.7905792488860595,
      "grad_norm": 0.7101789253917886,
      "learning_rate": 2.6406568720905172e-05,
      "loss": 1.1656,
      "num_input_tokens_seen": 42943268848,
      "step": 54582
    },
    {
      "epoch": 5.790685338425631,
      "grad_norm": 0.6672688493142958,
      "learning_rate": 2.6405874852373998e-05,
      "loss": 1.1901,
      "num_input_tokens_seen": 42944055600,
      "step": 54583
    },
    {
      "epoch": 5.790791427965202,
      "grad_norm": 0.6909799540049564,
      "learning_rate": 2.6405180982756395e-05,
      "loss": 1.1011,
      "num_input_tokens_seen": 42944842416,
      "step": 54584
    },
    {
      "epoch": 5.790897517504774,
      "grad_norm": 0.6856420910693002,
      "learning_rate": 2.6404487112052917e-05,
      "loss": 1.1023,
      "num_input_tokens_seen": 42945629232,
      "step": 54585
    },
    {
      "epoch": 5.791003607044345,
      "grad_norm": 1.3003088790428305,
      "learning_rate": 2.6403793240264084e-05,
      "loss": 1.3213,
      "num_input_tokens_seen": 42946415920,
      "step": 54586
    },
    {
      "epoch": 5.791109696583916,
      "grad_norm": 0.7420336223798577,
      "learning_rate": 2.640309936739045e-05,
      "loss": 1.1547,
      "num_input_tokens_seen": 42947202704,
      "step": 54587
    },
    {
      "epoch": 5.791215786123488,
      "grad_norm": 0.7609337912239205,
      "learning_rate": 2.6402405493432542e-05,
      "loss": 1.2286,
      "num_input_tokens_seen": 42947989392,
      "step": 54588
    },
    {
      "epoch": 5.791321875663059,
      "grad_norm": 1.0536652173935028,
      "learning_rate": 2.6401711618390896e-05,
      "loss": 1.1319,
      "num_input_tokens_seen": 42948776192,
      "step": 54589
    },
    {
      "epoch": 5.791427965202631,
      "grad_norm": 0.6281659224971382,
      "learning_rate": 2.6401017742266037e-05,
      "loss": 1.1246,
      "num_input_tokens_seen": 42949563008,
      "step": 54590
    },
    {
      "epoch": 5.791534054742202,
      "grad_norm": 0.635900874140555,
      "learning_rate": 2.6400323865058528e-05,
      "loss": 1.0908,
      "num_input_tokens_seen": 42950349712,
      "step": 54591
    },
    {
      "epoch": 5.791640144281774,
      "grad_norm": 0.6888042647407893,
      "learning_rate": 2.6399629986768887e-05,
      "loss": 1.218,
      "num_input_tokens_seen": 42951136480,
      "step": 54592
    },
    {
      "epoch": 5.791746233821345,
      "grad_norm": 0.6652024007326365,
      "learning_rate": 2.6398936107397643e-05,
      "loss": 1.1157,
      "num_input_tokens_seen": 42951923296,
      "step": 54593
    },
    {
      "epoch": 5.791852323360916,
      "grad_norm": 0.7199084059421411,
      "learning_rate": 2.6398242226945354e-05,
      "loss": 1.1295,
      "num_input_tokens_seen": 42952710160,
      "step": 54594
    },
    {
      "epoch": 5.791958412900488,
      "grad_norm": 0.66454804724648,
      "learning_rate": 2.639754834541254e-05,
      "loss": 1.2377,
      "num_input_tokens_seen": 42953496832,
      "step": 54595
    },
    {
      "epoch": 5.792064502440059,
      "grad_norm": 0.8514139321842958,
      "learning_rate": 2.6396854462799736e-05,
      "loss": 1.2529,
      "num_input_tokens_seen": 42954283632,
      "step": 54596
    },
    {
      "epoch": 5.792170591979631,
      "grad_norm": 0.6335922013909594,
      "learning_rate": 2.6396160579107492e-05,
      "loss": 1.1238,
      "num_input_tokens_seen": 42955070400,
      "step": 54597
    },
    {
      "epoch": 5.792276681519202,
      "grad_norm": 0.817160121980964,
      "learning_rate": 2.6395466694336334e-05,
      "loss": 1.1794,
      "num_input_tokens_seen": 42955857120,
      "step": 54598
    },
    {
      "epoch": 5.792382771058774,
      "grad_norm": 0.6694614841206327,
      "learning_rate": 2.6394772808486795e-05,
      "loss": 1.1204,
      "num_input_tokens_seen": 42956643904,
      "step": 54599
    },
    {
      "epoch": 5.792488860598345,
      "grad_norm": 0.6396642299321175,
      "learning_rate": 2.6394078921559424e-05,
      "loss": 1.1914,
      "num_input_tokens_seen": 42957430640,
      "step": 54600
    },
    {
      "epoch": 5.792594950137916,
      "grad_norm": 0.7107595761305527,
      "learning_rate": 2.6393385033554742e-05,
      "loss": 1.1899,
      "num_input_tokens_seen": 42958217472,
      "step": 54601
    },
    {
      "epoch": 5.792701039677488,
      "grad_norm": 0.6515551767605086,
      "learning_rate": 2.6392691144473298e-05,
      "loss": 1.1545,
      "num_input_tokens_seen": 42959004272,
      "step": 54602
    },
    {
      "epoch": 5.792807129217059,
      "grad_norm": 0.7004095104896352,
      "learning_rate": 2.6391997254315624e-05,
      "loss": 1.24,
      "num_input_tokens_seen": 42959791104,
      "step": 54603
    },
    {
      "epoch": 5.792913218756631,
      "grad_norm": 0.7489810834046109,
      "learning_rate": 2.6391303363082252e-05,
      "loss": 1.0793,
      "num_input_tokens_seen": 42960577936,
      "step": 54604
    },
    {
      "epoch": 5.793019308296202,
      "grad_norm": 0.678494747798371,
      "learning_rate": 2.6390609470773725e-05,
      "loss": 1.2257,
      "num_input_tokens_seen": 42961364624,
      "step": 54605
    },
    {
      "epoch": 5.793125397835773,
      "grad_norm": 0.5366725833756527,
      "learning_rate": 2.6389915577390577e-05,
      "loss": 1.0878,
      "num_input_tokens_seen": 42962151328,
      "step": 54606
    },
    {
      "epoch": 5.793231487375345,
      "grad_norm": 0.622886333090021,
      "learning_rate": 2.6389221682933336e-05,
      "loss": 1.199,
      "num_input_tokens_seen": 42962938224,
      "step": 54607
    },
    {
      "epoch": 5.793337576914916,
      "grad_norm": 0.6817501664005888,
      "learning_rate": 2.638852778740255e-05,
      "loss": 1.2995,
      "num_input_tokens_seen": 42963724912,
      "step": 54608
    },
    {
      "epoch": 5.793443666454488,
      "grad_norm": 0.6078998910150465,
      "learning_rate": 2.6387833890798752e-05,
      "loss": 1.2733,
      "num_input_tokens_seen": 42964511616,
      "step": 54609
    },
    {
      "epoch": 5.793549755994059,
      "grad_norm": 0.5500831061886218,
      "learning_rate": 2.638713999312247e-05,
      "loss": 1.0937,
      "num_input_tokens_seen": 42965298416,
      "step": 54610
    },
    {
      "epoch": 5.79365584553363,
      "grad_norm": 0.6572471838413824,
      "learning_rate": 2.6386446094374257e-05,
      "loss": 1.0445,
      "num_input_tokens_seen": 42966085200,
      "step": 54611
    },
    {
      "epoch": 5.793761935073202,
      "grad_norm": 0.6338959375498994,
      "learning_rate": 2.6385752194554635e-05,
      "loss": 1.222,
      "num_input_tokens_seen": 42966871952,
      "step": 54612
    },
    {
      "epoch": 5.793868024612773,
      "grad_norm": 0.7814300125499031,
      "learning_rate": 2.638505829366414e-05,
      "loss": 1.2049,
      "num_input_tokens_seen": 42967658656,
      "step": 54613
    },
    {
      "epoch": 5.793974114152345,
      "grad_norm": 0.7256579789192359,
      "learning_rate": 2.6384364391703315e-05,
      "loss": 1.2298,
      "num_input_tokens_seen": 42968445440,
      "step": 54614
    },
    {
      "epoch": 5.794080203691916,
      "grad_norm": 0.6607828465361191,
      "learning_rate": 2.6383670488672695e-05,
      "loss": 1.1578,
      "num_input_tokens_seen": 42969232128,
      "step": 54615
    },
    {
      "epoch": 5.794186293231487,
      "grad_norm": 0.6564884518168443,
      "learning_rate": 2.6382976584572815e-05,
      "loss": 1.1721,
      "num_input_tokens_seen": 42970018896,
      "step": 54616
    },
    {
      "epoch": 5.794292382771059,
      "grad_norm": 0.7148228626502702,
      "learning_rate": 2.6382282679404213e-05,
      "loss": 1.1665,
      "num_input_tokens_seen": 42970805680,
      "step": 54617
    },
    {
      "epoch": 5.79439847231063,
      "grad_norm": 0.7712929282383794,
      "learning_rate": 2.6381588773167414e-05,
      "loss": 1.2869,
      "num_input_tokens_seen": 42971592464,
      "step": 54618
    },
    {
      "epoch": 5.794504561850202,
      "grad_norm": 0.6410492604654274,
      "learning_rate": 2.6380894865862975e-05,
      "loss": 1.1193,
      "num_input_tokens_seen": 42972379264,
      "step": 54619
    },
    {
      "epoch": 5.794610651389773,
      "grad_norm": 0.6886362275880206,
      "learning_rate": 2.638020095749142e-05,
      "loss": 1.1271,
      "num_input_tokens_seen": 42973166064,
      "step": 54620
    },
    {
      "epoch": 5.794716740929345,
      "grad_norm": 0.7520268950608704,
      "learning_rate": 2.6379507048053276e-05,
      "loss": 1.1576,
      "num_input_tokens_seen": 42973952896,
      "step": 54621
    },
    {
      "epoch": 5.794822830468916,
      "grad_norm": 0.742008806419982,
      "learning_rate": 2.6378813137549102e-05,
      "loss": 1.1687,
      "num_input_tokens_seen": 42974739712,
      "step": 54622
    },
    {
      "epoch": 5.794928920008487,
      "grad_norm": 0.6691829444283215,
      "learning_rate": 2.637811922597942e-05,
      "loss": 1.1153,
      "num_input_tokens_seen": 42975526576,
      "step": 54623
    },
    {
      "epoch": 5.795035009548059,
      "grad_norm": 0.5657270351775493,
      "learning_rate": 2.6377425313344756e-05,
      "loss": 1.142,
      "num_input_tokens_seen": 42976313264,
      "step": 54624
    },
    {
      "epoch": 5.79514109908763,
      "grad_norm": 0.7480887054749764,
      "learning_rate": 2.637673139964567e-05,
      "loss": 1.158,
      "num_input_tokens_seen": 42977100016,
      "step": 54625
    },
    {
      "epoch": 5.795247188627202,
      "grad_norm": 0.6279314517322319,
      "learning_rate": 2.6376037484882683e-05,
      "loss": 1.2228,
      "num_input_tokens_seen": 42977886816,
      "step": 54626
    },
    {
      "epoch": 5.795353278166773,
      "grad_norm": 0.7697213243516451,
      "learning_rate": 2.6375343569056333e-05,
      "loss": 1.1266,
      "num_input_tokens_seen": 42978673664,
      "step": 54627
    },
    {
      "epoch": 5.795459367706345,
      "grad_norm": 0.7863363887233886,
      "learning_rate": 2.637464965216716e-05,
      "loss": 1.1807,
      "num_input_tokens_seen": 42979460384,
      "step": 54628
    },
    {
      "epoch": 5.795565457245916,
      "grad_norm": 0.614999362804189,
      "learning_rate": 2.63739557342157e-05,
      "loss": 1.1591,
      "num_input_tokens_seen": 42980247088,
      "step": 54629
    },
    {
      "epoch": 5.795671546785487,
      "grad_norm": 0.9368861249639274,
      "learning_rate": 2.6373261815202483e-05,
      "loss": 1.1721,
      "num_input_tokens_seen": 42981033776,
      "step": 54630
    },
    {
      "epoch": 5.795777636325059,
      "grad_norm": 0.6818825999600819,
      "learning_rate": 2.6372567895128053e-05,
      "loss": 1.1161,
      "num_input_tokens_seen": 42981820688,
      "step": 54631
    },
    {
      "epoch": 5.79588372586463,
      "grad_norm": 0.7312894273274682,
      "learning_rate": 2.6371873973992937e-05,
      "loss": 1.1464,
      "num_input_tokens_seen": 42982607392,
      "step": 54632
    },
    {
      "epoch": 5.7959898154042016,
      "grad_norm": 0.740966646784661,
      "learning_rate": 2.637118005179768e-05,
      "loss": 1.1833,
      "num_input_tokens_seen": 42983394192,
      "step": 54633
    },
    {
      "epoch": 5.796095904943773,
      "grad_norm": 0.6840080474663897,
      "learning_rate": 2.6370486128542816e-05,
      "loss": 1.081,
      "num_input_tokens_seen": 42984181040,
      "step": 54634
    },
    {
      "epoch": 5.796201994483344,
      "grad_norm": 0.6544380049180474,
      "learning_rate": 2.6369792204228884e-05,
      "loss": 1.1368,
      "num_input_tokens_seen": 42984967808,
      "step": 54635
    },
    {
      "epoch": 5.7963080840229155,
      "grad_norm": 0.7635139538414984,
      "learning_rate": 2.636909827885641e-05,
      "loss": 1.1956,
      "num_input_tokens_seen": 42985754576,
      "step": 54636
    },
    {
      "epoch": 5.796414173562487,
      "grad_norm": 0.8825294523919391,
      "learning_rate": 2.636840435242594e-05,
      "loss": 1.1505,
      "num_input_tokens_seen": 42986541328,
      "step": 54637
    },
    {
      "epoch": 5.7965202631020585,
      "grad_norm": 0.8703570528162969,
      "learning_rate": 2.6367710424938007e-05,
      "loss": 1.1128,
      "num_input_tokens_seen": 42987328096,
      "step": 54638
    },
    {
      "epoch": 5.7966263526416295,
      "grad_norm": 0.6405269756230754,
      "learning_rate": 2.636701649639315e-05,
      "loss": 1.0146,
      "num_input_tokens_seen": 42988114960,
      "step": 54639
    },
    {
      "epoch": 5.7967324421812005,
      "grad_norm": 0.6010455129508222,
      "learning_rate": 2.6366322566791902e-05,
      "loss": 1.1623,
      "num_input_tokens_seen": 42988901760,
      "step": 54640
    },
    {
      "epoch": 5.7968385317207725,
      "grad_norm": 0.6629963180961952,
      "learning_rate": 2.6365628636134798e-05,
      "loss": 1.233,
      "num_input_tokens_seen": 42989688512,
      "step": 54641
    },
    {
      "epoch": 5.7969446212603435,
      "grad_norm": 0.831588064014091,
      "learning_rate": 2.6364934704422372e-05,
      "loss": 1.1256,
      "num_input_tokens_seen": 42990475280,
      "step": 54642
    },
    {
      "epoch": 5.797050710799915,
      "grad_norm": 0.6527359113906132,
      "learning_rate": 2.6364240771655174e-05,
      "loss": 1.2303,
      "num_input_tokens_seen": 42991262192,
      "step": 54643
    },
    {
      "epoch": 5.797156800339486,
      "grad_norm": 0.6133204403125998,
      "learning_rate": 2.6363546837833724e-05,
      "loss": 1.1489,
      "num_input_tokens_seen": 42992048928,
      "step": 54644
    },
    {
      "epoch": 5.7972628898790575,
      "grad_norm": 0.6085461561022867,
      "learning_rate": 2.636285290295857e-05,
      "loss": 1.0537,
      "num_input_tokens_seen": 42992835728,
      "step": 54645
    },
    {
      "epoch": 5.797368979418629,
      "grad_norm": 0.7823979596677677,
      "learning_rate": 2.6362158967030243e-05,
      "loss": 1.2633,
      "num_input_tokens_seen": 42993622480,
      "step": 54646
    },
    {
      "epoch": 5.7974750689582,
      "grad_norm": 0.6036265707561015,
      "learning_rate": 2.636146503004927e-05,
      "loss": 1.1179,
      "num_input_tokens_seen": 42994409280,
      "step": 54647
    },
    {
      "epoch": 5.797581158497772,
      "grad_norm": 0.7857293440354617,
      "learning_rate": 2.6360771092016205e-05,
      "loss": 1.2371,
      "num_input_tokens_seen": 42995196000,
      "step": 54648
    },
    {
      "epoch": 5.797687248037343,
      "grad_norm": 0.7683819731266559,
      "learning_rate": 2.6360077152931577e-05,
      "loss": 1.169,
      "num_input_tokens_seen": 42995982768,
      "step": 54649
    },
    {
      "epoch": 5.797793337576915,
      "grad_norm": 0.6090244208170049,
      "learning_rate": 2.6359383212795917e-05,
      "loss": 1.1125,
      "num_input_tokens_seen": 42996769552,
      "step": 54650
    },
    {
      "epoch": 5.797899427116486,
      "grad_norm": 0.6125652277453166,
      "learning_rate": 2.635868927160977e-05,
      "loss": 1.1336,
      "num_input_tokens_seen": 42997556416,
      "step": 54651
    },
    {
      "epoch": 5.798005516656057,
      "grad_norm": 0.7554707455072078,
      "learning_rate": 2.6357995329373668e-05,
      "loss": 1.2149,
      "num_input_tokens_seen": 42998343136,
      "step": 54652
    },
    {
      "epoch": 5.798111606195629,
      "grad_norm": 0.6210725723919988,
      "learning_rate": 2.6357301386088146e-05,
      "loss": 1.149,
      "num_input_tokens_seen": 42999129920,
      "step": 54653
    },
    {
      "epoch": 5.7982176957352,
      "grad_norm": 0.9310537344437724,
      "learning_rate": 2.635660744175374e-05,
      "loss": 1.1592,
      "num_input_tokens_seen": 42999916688,
      "step": 54654
    },
    {
      "epoch": 5.798323785274772,
      "grad_norm": 0.7048210532517022,
      "learning_rate": 2.635591349637099e-05,
      "loss": 1.2076,
      "num_input_tokens_seen": 43000703456,
      "step": 54655
    },
    {
      "epoch": 5.798429874814343,
      "grad_norm": 0.79456951195089,
      "learning_rate": 2.6355219549940424e-05,
      "loss": 1.1322,
      "num_input_tokens_seen": 43001490208,
      "step": 54656
    },
    {
      "epoch": 5.798535964353915,
      "grad_norm": 0.6510818382007771,
      "learning_rate": 2.6354525602462587e-05,
      "loss": 1.2481,
      "num_input_tokens_seen": 43002276960,
      "step": 54657
    },
    {
      "epoch": 5.798642053893486,
      "grad_norm": 0.7222667242818593,
      "learning_rate": 2.6353831653938017e-05,
      "loss": 1.1953,
      "num_input_tokens_seen": 43003063648,
      "step": 54658
    },
    {
      "epoch": 5.798748143433057,
      "grad_norm": 0.6130150663029067,
      "learning_rate": 2.6353137704367237e-05,
      "loss": 1.1632,
      "num_input_tokens_seen": 43003850480,
      "step": 54659
    },
    {
      "epoch": 5.798854232972629,
      "grad_norm": 0.5612194498596597,
      "learning_rate": 2.63524437537508e-05,
      "loss": 1.126,
      "num_input_tokens_seen": 43004637312,
      "step": 54660
    },
    {
      "epoch": 5.7989603225122,
      "grad_norm": 0.6525810196529329,
      "learning_rate": 2.6351749802089228e-05,
      "loss": 1.1931,
      "num_input_tokens_seen": 43005424128,
      "step": 54661
    },
    {
      "epoch": 5.799066412051772,
      "grad_norm": 0.7391856982549354,
      "learning_rate": 2.6351055849383067e-05,
      "loss": 1.1851,
      "num_input_tokens_seen": 43006210896,
      "step": 54662
    },
    {
      "epoch": 5.799172501591343,
      "grad_norm": 0.6224217717008991,
      "learning_rate": 2.6350361895632853e-05,
      "loss": 1.0301,
      "num_input_tokens_seen": 43006997696,
      "step": 54663
    },
    {
      "epoch": 5.799278591130914,
      "grad_norm": 0.6677248262128954,
      "learning_rate": 2.6349667940839108e-05,
      "loss": 1.1425,
      "num_input_tokens_seen": 43007784432,
      "step": 54664
    },
    {
      "epoch": 5.799384680670486,
      "grad_norm": 0.5843162116040123,
      "learning_rate": 2.634897398500239e-05,
      "loss": 1.1059,
      "num_input_tokens_seen": 43008571120,
      "step": 54665
    },
    {
      "epoch": 5.799490770210057,
      "grad_norm": 0.6596546842034646,
      "learning_rate": 2.6348280028123224e-05,
      "loss": 1.2324,
      "num_input_tokens_seen": 43009357888,
      "step": 54666
    },
    {
      "epoch": 5.799596859749629,
      "grad_norm": 0.6731424232197459,
      "learning_rate": 2.6347586070202135e-05,
      "loss": 1.0948,
      "num_input_tokens_seen": 43010144640,
      "step": 54667
    },
    {
      "epoch": 5.7997029492892,
      "grad_norm": 0.7014519904437065,
      "learning_rate": 2.6346892111239687e-05,
      "loss": 1.1782,
      "num_input_tokens_seen": 43010931424,
      "step": 54668
    },
    {
      "epoch": 5.799809038828771,
      "grad_norm": 0.5903489882832716,
      "learning_rate": 2.634619815123639e-05,
      "loss": 1.1391,
      "num_input_tokens_seen": 43011718192,
      "step": 54669
    },
    {
      "epoch": 5.799915128368343,
      "grad_norm": 0.6594360038259319,
      "learning_rate": 2.6345504190192793e-05,
      "loss": 1.1446,
      "num_input_tokens_seen": 43012505056,
      "step": 54670
    },
    {
      "epoch": 5.800021217907914,
      "grad_norm": 0.6408004095330914,
      "learning_rate": 2.6344810228109428e-05,
      "loss": 1.1213,
      "num_input_tokens_seen": 43013291872,
      "step": 54671
    },
    {
      "epoch": 5.800127307447486,
      "grad_norm": 0.8163502153082633,
      "learning_rate": 2.634411626498684e-05,
      "loss": 1.1635,
      "num_input_tokens_seen": 43014078672,
      "step": 54672
    },
    {
      "epoch": 5.800233396987057,
      "grad_norm": 0.5993315318789397,
      "learning_rate": 2.634342230082555e-05,
      "loss": 1.1742,
      "num_input_tokens_seen": 43014865408,
      "step": 54673
    },
    {
      "epoch": 5.800339486526628,
      "grad_norm": 0.6935325251481357,
      "learning_rate": 2.6342728335626103e-05,
      "loss": 1.1312,
      "num_input_tokens_seen": 43015652224,
      "step": 54674
    },
    {
      "epoch": 5.8004455760662,
      "grad_norm": 0.7640719965019009,
      "learning_rate": 2.6342034369389045e-05,
      "loss": 1.2474,
      "num_input_tokens_seen": 43016439056,
      "step": 54675
    },
    {
      "epoch": 5.800551665605771,
      "grad_norm": 0.6708261538617866,
      "learning_rate": 2.634134040211489e-05,
      "loss": 1.3044,
      "num_input_tokens_seen": 43017225776,
      "step": 54676
    },
    {
      "epoch": 5.800657755145343,
      "grad_norm": 0.6253576404219522,
      "learning_rate": 2.6340646433804196e-05,
      "loss": 1.1832,
      "num_input_tokens_seen": 43018012512,
      "step": 54677
    },
    {
      "epoch": 5.800763844684914,
      "grad_norm": 0.616371549349629,
      "learning_rate": 2.633995246445748e-05,
      "loss": 1.2528,
      "num_input_tokens_seen": 43018799280,
      "step": 54678
    },
    {
      "epoch": 5.800869934224486,
      "grad_norm": 0.6435549636529129,
      "learning_rate": 2.6339258494075296e-05,
      "loss": 1.1385,
      "num_input_tokens_seen": 43019586000,
      "step": 54679
    },
    {
      "epoch": 5.800976023764057,
      "grad_norm": 0.5499683845326958,
      "learning_rate": 2.633856452265817e-05,
      "loss": 1.1081,
      "num_input_tokens_seen": 43020372752,
      "step": 54680
    },
    {
      "epoch": 5.801082113303628,
      "grad_norm": 0.7277381205506558,
      "learning_rate": 2.6337870550206638e-05,
      "loss": 1.1691,
      "num_input_tokens_seen": 43021159552,
      "step": 54681
    },
    {
      "epoch": 5.8011882028432,
      "grad_norm": 0.799954795672162,
      "learning_rate": 2.633717657672124e-05,
      "loss": 1.1763,
      "num_input_tokens_seen": 43021946272,
      "step": 54682
    },
    {
      "epoch": 5.801294292382771,
      "grad_norm": 0.6262963016536783,
      "learning_rate": 2.633648260220251e-05,
      "loss": 1.1863,
      "num_input_tokens_seen": 43022732992,
      "step": 54683
    },
    {
      "epoch": 5.801400381922343,
      "grad_norm": 0.7348823836152676,
      "learning_rate": 2.6335788626650993e-05,
      "loss": 1.1776,
      "num_input_tokens_seen": 43023519696,
      "step": 54684
    },
    {
      "epoch": 5.801506471461914,
      "grad_norm": 0.6503591426133235,
      "learning_rate": 2.633509465006721e-05,
      "loss": 1.1374,
      "num_input_tokens_seen": 43024306544,
      "step": 54685
    },
    {
      "epoch": 5.801612561001486,
      "grad_norm": 0.6291445741397057,
      "learning_rate": 2.6334400672451708e-05,
      "loss": 1.14,
      "num_input_tokens_seen": 43025093328,
      "step": 54686
    },
    {
      "epoch": 5.801718650541057,
      "grad_norm": 0.7201885847598899,
      "learning_rate": 2.6333706693805017e-05,
      "loss": 1.2009,
      "num_input_tokens_seen": 43025879936,
      "step": 54687
    },
    {
      "epoch": 5.801824740080628,
      "grad_norm": 0.7480834678480893,
      "learning_rate": 2.633301271412768e-05,
      "loss": 1.1719,
      "num_input_tokens_seen": 43026666784,
      "step": 54688
    },
    {
      "epoch": 5.8019308296202,
      "grad_norm": 0.6808885994952804,
      "learning_rate": 2.6332318733420236e-05,
      "loss": 1.195,
      "num_input_tokens_seen": 43027453504,
      "step": 54689
    },
    {
      "epoch": 5.802036919159771,
      "grad_norm": 0.7691347852890715,
      "learning_rate": 2.6331624751683203e-05,
      "loss": 1.2082,
      "num_input_tokens_seen": 43028240224,
      "step": 54690
    },
    {
      "epoch": 5.802143008699343,
      "grad_norm": 0.5861745112248096,
      "learning_rate": 2.633093076891714e-05,
      "loss": 1.0897,
      "num_input_tokens_seen": 43029027104,
      "step": 54691
    },
    {
      "epoch": 5.802249098238914,
      "grad_norm": 0.794267816264643,
      "learning_rate": 2.633023678512257e-05,
      "loss": 1.1915,
      "num_input_tokens_seen": 43029813920,
      "step": 54692
    },
    {
      "epoch": 5.802355187778485,
      "grad_norm": 0.7068242173631452,
      "learning_rate": 2.6329542800300023e-05,
      "loss": 1.0952,
      "num_input_tokens_seen": 43030600640,
      "step": 54693
    },
    {
      "epoch": 5.802461277318057,
      "grad_norm": 1.3367575006444155,
      "learning_rate": 2.632884881445006e-05,
      "loss": 1.1095,
      "num_input_tokens_seen": 43031387472,
      "step": 54694
    },
    {
      "epoch": 5.802567366857628,
      "grad_norm": 0.5922418971912137,
      "learning_rate": 2.6328154827573193e-05,
      "loss": 1.1541,
      "num_input_tokens_seen": 43032174224,
      "step": 54695
    },
    {
      "epoch": 5.8026734563972,
      "grad_norm": 0.8310724231272865,
      "learning_rate": 2.632746083966996e-05,
      "loss": 1.1349,
      "num_input_tokens_seen": 43032961024,
      "step": 54696
    },
    {
      "epoch": 5.802779545936771,
      "grad_norm": 0.5668873457207696,
      "learning_rate": 2.6326766850740912e-05,
      "loss": 1.1999,
      "num_input_tokens_seen": 43033747792,
      "step": 54697
    },
    {
      "epoch": 5.802885635476342,
      "grad_norm": 0.6420333297216958,
      "learning_rate": 2.6326072860786582e-05,
      "loss": 1.1762,
      "num_input_tokens_seen": 43034534528,
      "step": 54698
    },
    {
      "epoch": 5.8029917250159135,
      "grad_norm": 0.6575644506558885,
      "learning_rate": 2.632537886980749e-05,
      "loss": 1.1556,
      "num_input_tokens_seen": 43035321216,
      "step": 54699
    },
    {
      "epoch": 5.803097814555485,
      "grad_norm": 0.5876213263704977,
      "learning_rate": 2.6324684877804196e-05,
      "loss": 1.1553,
      "num_input_tokens_seen": 43036107936,
      "step": 54700
    },
    {
      "epoch": 5.8032039040950565,
      "grad_norm": 0.568357395339536,
      "learning_rate": 2.6323990884777217e-05,
      "loss": 1.1739,
      "num_input_tokens_seen": 43036894720,
      "step": 54701
    },
    {
      "epoch": 5.8033099936346275,
      "grad_norm": 0.6485118036726817,
      "learning_rate": 2.6323296890727096e-05,
      "loss": 1.156,
      "num_input_tokens_seen": 43037681472,
      "step": 54702
    },
    {
      "epoch": 5.8034160831741985,
      "grad_norm": 0.6155405102681298,
      "learning_rate": 2.6322602895654373e-05,
      "loss": 1.1238,
      "num_input_tokens_seen": 43038468256,
      "step": 54703
    },
    {
      "epoch": 5.8035221727137705,
      "grad_norm": 0.6566154211364366,
      "learning_rate": 2.6321908899559583e-05,
      "loss": 1.1311,
      "num_input_tokens_seen": 43039255024,
      "step": 54704
    },
    {
      "epoch": 5.8036282622533415,
      "grad_norm": 0.636384469595719,
      "learning_rate": 2.6321214902443257e-05,
      "loss": 1.1979,
      "num_input_tokens_seen": 43040041744,
      "step": 54705
    },
    {
      "epoch": 5.803734351792913,
      "grad_norm": 0.8186365765690691,
      "learning_rate": 2.632052090430594e-05,
      "loss": 1.1535,
      "num_input_tokens_seen": 43040828544,
      "step": 54706
    },
    {
      "epoch": 5.8038404413324844,
      "grad_norm": 0.9442977228119583,
      "learning_rate": 2.6319826905148155e-05,
      "loss": 1.076,
      "num_input_tokens_seen": 43041615216,
      "step": 54707
    },
    {
      "epoch": 5.803946530872056,
      "grad_norm": 0.588134904387697,
      "learning_rate": 2.6319132904970456e-05,
      "loss": 1.1853,
      "num_input_tokens_seen": 43042402000,
      "step": 54708
    },
    {
      "epoch": 5.804052620411627,
      "grad_norm": 0.8163735128294511,
      "learning_rate": 2.6318438903773363e-05,
      "loss": 1.1942,
      "num_input_tokens_seen": 43043188720,
      "step": 54709
    },
    {
      "epoch": 5.804158709951198,
      "grad_norm": 0.593474630950127,
      "learning_rate": 2.6317744901557418e-05,
      "loss": 1.2053,
      "num_input_tokens_seen": 43043975424,
      "step": 54710
    },
    {
      "epoch": 5.80426479949077,
      "grad_norm": 0.6076856052269141,
      "learning_rate": 2.6317050898323163e-05,
      "loss": 1.1419,
      "num_input_tokens_seen": 43044762192,
      "step": 54711
    },
    {
      "epoch": 5.804370889030341,
      "grad_norm": 0.5821580605101521,
      "learning_rate": 2.631635689407113e-05,
      "loss": 1.1165,
      "num_input_tokens_seen": 43045548960,
      "step": 54712
    },
    {
      "epoch": 5.804476978569913,
      "grad_norm": 0.6646384124959196,
      "learning_rate": 2.6315662888801852e-05,
      "loss": 1.1717,
      "num_input_tokens_seen": 43046335712,
      "step": 54713
    },
    {
      "epoch": 5.804583068109484,
      "grad_norm": 0.6327440196695211,
      "learning_rate": 2.6314968882515873e-05,
      "loss": 1.1873,
      "num_input_tokens_seen": 43047122448,
      "step": 54714
    },
    {
      "epoch": 5.804689157649056,
      "grad_norm": 0.6160647174469822,
      "learning_rate": 2.631427487521372e-05,
      "loss": 1.2371,
      "num_input_tokens_seen": 43047909152,
      "step": 54715
    },
    {
      "epoch": 5.804795247188627,
      "grad_norm": 0.645106826354597,
      "learning_rate": 2.631358086689593e-05,
      "loss": 1.1994,
      "num_input_tokens_seen": 43048695920,
      "step": 54716
    },
    {
      "epoch": 5.804901336728198,
      "grad_norm": 0.8213969511217315,
      "learning_rate": 2.6312886857563053e-05,
      "loss": 1.1452,
      "num_input_tokens_seen": 43049482704,
      "step": 54717
    },
    {
      "epoch": 5.80500742626777,
      "grad_norm": 0.7527648855962719,
      "learning_rate": 2.631219284721561e-05,
      "loss": 1.1372,
      "num_input_tokens_seen": 43050269424,
      "step": 54718
    },
    {
      "epoch": 5.805113515807341,
      "grad_norm": 0.6157391385468138,
      "learning_rate": 2.6311498835854143e-05,
      "loss": 1.0766,
      "num_input_tokens_seen": 43051056240,
      "step": 54719
    },
    {
      "epoch": 5.805219605346913,
      "grad_norm": 0.6915185544755906,
      "learning_rate": 2.631080482347919e-05,
      "loss": 1.1781,
      "num_input_tokens_seen": 43051842976,
      "step": 54720
    },
    {
      "epoch": 5.805325694886484,
      "grad_norm": 0.6757150412272441,
      "learning_rate": 2.631011081009128e-05,
      "loss": 1.1671,
      "num_input_tokens_seen": 43052629760,
      "step": 54721
    },
    {
      "epoch": 5.805431784426055,
      "grad_norm": 0.7836457053700122,
      "learning_rate": 2.630941679569096e-05,
      "loss": 1.2238,
      "num_input_tokens_seen": 43053416480,
      "step": 54722
    },
    {
      "epoch": 5.805537873965627,
      "grad_norm": 0.6969307856071953,
      "learning_rate": 2.6308722780278766e-05,
      "loss": 1.2189,
      "num_input_tokens_seen": 43054203184,
      "step": 54723
    },
    {
      "epoch": 5.805643963505198,
      "grad_norm": 0.6805395881227869,
      "learning_rate": 2.630802876385522e-05,
      "loss": 1.1117,
      "num_input_tokens_seen": 43054990064,
      "step": 54724
    },
    {
      "epoch": 5.80575005304477,
      "grad_norm": 0.7097528750661638,
      "learning_rate": 2.6307334746420874e-05,
      "loss": 1.1518,
      "num_input_tokens_seen": 43055776848,
      "step": 54725
    },
    {
      "epoch": 5.805856142584341,
      "grad_norm": 0.621525022866119,
      "learning_rate": 2.6306640727976255e-05,
      "loss": 1.1136,
      "num_input_tokens_seen": 43056563600,
      "step": 54726
    },
    {
      "epoch": 5.805962232123912,
      "grad_norm": 0.6003306571070162,
      "learning_rate": 2.63059467085219e-05,
      "loss": 1.1492,
      "num_input_tokens_seen": 43057350304,
      "step": 54727
    },
    {
      "epoch": 5.806068321663484,
      "grad_norm": 0.7019170075464403,
      "learning_rate": 2.630525268805835e-05,
      "loss": 1.1724,
      "num_input_tokens_seen": 43058137056,
      "step": 54728
    },
    {
      "epoch": 5.806174411203055,
      "grad_norm": 0.6679855812339127,
      "learning_rate": 2.6304558666586138e-05,
      "loss": 1.1383,
      "num_input_tokens_seen": 43058923840,
      "step": 54729
    },
    {
      "epoch": 5.806280500742627,
      "grad_norm": 0.6953028123062762,
      "learning_rate": 2.6303864644105804e-05,
      "loss": 1.1872,
      "num_input_tokens_seen": 43059710592,
      "step": 54730
    },
    {
      "epoch": 5.806386590282198,
      "grad_norm": 0.6448915757897625,
      "learning_rate": 2.630317062061788e-05,
      "loss": 1.0385,
      "num_input_tokens_seen": 43060497408,
      "step": 54731
    },
    {
      "epoch": 5.806492679821769,
      "grad_norm": 0.8315338751397746,
      "learning_rate": 2.6302476596122905e-05,
      "loss": 1.2155,
      "num_input_tokens_seen": 43061284080,
      "step": 54732
    },
    {
      "epoch": 5.806598769361341,
      "grad_norm": 0.7247750891630815,
      "learning_rate": 2.6301782570621414e-05,
      "loss": 1.2021,
      "num_input_tokens_seen": 43062070832,
      "step": 54733
    },
    {
      "epoch": 5.806704858900912,
      "grad_norm": 1.0936382741088904,
      "learning_rate": 2.6301088544113943e-05,
      "loss": 1.2254,
      "num_input_tokens_seen": 43062857504,
      "step": 54734
    },
    {
      "epoch": 5.806810948440484,
      "grad_norm": 0.8498527706908462,
      "learning_rate": 2.630039451660103e-05,
      "loss": 1.2435,
      "num_input_tokens_seen": 43063644192,
      "step": 54735
    },
    {
      "epoch": 5.806917037980055,
      "grad_norm": 0.713238440764352,
      "learning_rate": 2.6299700488083205e-05,
      "loss": 1.1176,
      "num_input_tokens_seen": 43064430944,
      "step": 54736
    },
    {
      "epoch": 5.807023127519627,
      "grad_norm": 1.4597756096953676,
      "learning_rate": 2.6299006458561022e-05,
      "loss": 1.1609,
      "num_input_tokens_seen": 43065217792,
      "step": 54737
    },
    {
      "epoch": 5.807129217059198,
      "grad_norm": 1.0299168874963178,
      "learning_rate": 2.6298312428035e-05,
      "loss": 1.2327,
      "num_input_tokens_seen": 43066004528,
      "step": 54738
    },
    {
      "epoch": 5.80723530659877,
      "grad_norm": 0.8478693658478264,
      "learning_rate": 2.629761839650567e-05,
      "loss": 1.2268,
      "num_input_tokens_seen": 43066791296,
      "step": 54739
    },
    {
      "epoch": 5.807341396138341,
      "grad_norm": 1.5358526310006944,
      "learning_rate": 2.629692436397359e-05,
      "loss": 1.1992,
      "num_input_tokens_seen": 43067578080,
      "step": 54740
    },
    {
      "epoch": 5.807447485677912,
      "grad_norm": 0.685592430642062,
      "learning_rate": 2.6296230330439282e-05,
      "loss": 1.2013,
      "num_input_tokens_seen": 43068364768,
      "step": 54741
    },
    {
      "epoch": 5.807553575217484,
      "grad_norm": 0.6792732565005021,
      "learning_rate": 2.6295536295903277e-05,
      "loss": 1.1917,
      "num_input_tokens_seen": 43069151568,
      "step": 54742
    },
    {
      "epoch": 5.807659664757055,
      "grad_norm": 1.1093103326303988,
      "learning_rate": 2.6294842260366133e-05,
      "loss": 1.186,
      "num_input_tokens_seen": 43069938304,
      "step": 54743
    },
    {
      "epoch": 5.807765754296627,
      "grad_norm": 0.6252271161919946,
      "learning_rate": 2.629414822382837e-05,
      "loss": 1.1737,
      "num_input_tokens_seen": 43070725040,
      "step": 54744
    },
    {
      "epoch": 5.807871843836198,
      "grad_norm": 0.7642950656572798,
      "learning_rate": 2.6293454186290517e-05,
      "loss": 1.1581,
      "num_input_tokens_seen": 43071511840,
      "step": 54745
    },
    {
      "epoch": 5.807977933375769,
      "grad_norm": 1.042189808286978,
      "learning_rate": 2.629276014775313e-05,
      "loss": 1.1808,
      "num_input_tokens_seen": 43072298640,
      "step": 54746
    },
    {
      "epoch": 5.808084022915341,
      "grad_norm": 0.6771737462042533,
      "learning_rate": 2.629206610821673e-05,
      "loss": 1.1376,
      "num_input_tokens_seen": 43073085488,
      "step": 54747
    },
    {
      "epoch": 5.808190112454912,
      "grad_norm": 0.9140249023321847,
      "learning_rate": 2.6291372067681863e-05,
      "loss": 1.1154,
      "num_input_tokens_seen": 43073872224,
      "step": 54748
    },
    {
      "epoch": 5.808296201994484,
      "grad_norm": 1.118232742490558,
      "learning_rate": 2.6290678026149068e-05,
      "loss": 1.1741,
      "num_input_tokens_seen": 43074659088,
      "step": 54749
    },
    {
      "epoch": 5.808402291534055,
      "grad_norm": 0.6494063765909023,
      "learning_rate": 2.628998398361886e-05,
      "loss": 1.0972,
      "num_input_tokens_seen": 43075445888,
      "step": 54750
    },
    {
      "epoch": 5.808508381073626,
      "grad_norm": 0.703520883257589,
      "learning_rate": 2.6289289940091804e-05,
      "loss": 1.1891,
      "num_input_tokens_seen": 43076232704,
      "step": 54751
    },
    {
      "epoch": 5.808614470613198,
      "grad_norm": 0.8620262756771855,
      "learning_rate": 2.628859589556842e-05,
      "loss": 1.1691,
      "num_input_tokens_seen": 43077019440,
      "step": 54752
    },
    {
      "epoch": 5.808720560152769,
      "grad_norm": 0.7998823880544416,
      "learning_rate": 2.628790185004924e-05,
      "loss": 1.1486,
      "num_input_tokens_seen": 43077806208,
      "step": 54753
    },
    {
      "epoch": 5.808826649692341,
      "grad_norm": 0.598239061453573,
      "learning_rate": 2.6287207803534814e-05,
      "loss": 1.1219,
      "num_input_tokens_seen": 43078593040,
      "step": 54754
    },
    {
      "epoch": 5.808932739231912,
      "grad_norm": 0.9278135917706618,
      "learning_rate": 2.6286513756025666e-05,
      "loss": 1.1973,
      "num_input_tokens_seen": 43079379840,
      "step": 54755
    },
    {
      "epoch": 5.809038828771483,
      "grad_norm": 0.8337001725617122,
      "learning_rate": 2.6285819707522342e-05,
      "loss": 1.1252,
      "num_input_tokens_seen": 43080166544,
      "step": 54756
    },
    {
      "epoch": 5.809144918311055,
      "grad_norm": 0.6126124579376243,
      "learning_rate": 2.6285125658025374e-05,
      "loss": 1.0658,
      "num_input_tokens_seen": 43080953360,
      "step": 54757
    },
    {
      "epoch": 5.809251007850626,
      "grad_norm": 0.7503302057133814,
      "learning_rate": 2.62844316075353e-05,
      "loss": 1.1124,
      "num_input_tokens_seen": 43081740096,
      "step": 54758
    },
    {
      "epoch": 5.809357097390198,
      "grad_norm": 0.6993496897819383,
      "learning_rate": 2.6283737556052646e-05,
      "loss": 1.2016,
      "num_input_tokens_seen": 43082526912,
      "step": 54759
    },
    {
      "epoch": 5.809463186929769,
      "grad_norm": 0.7459579385189502,
      "learning_rate": 2.6283043503577963e-05,
      "loss": 1.1219,
      "num_input_tokens_seen": 43083313776,
      "step": 54760
    },
    {
      "epoch": 5.80956927646934,
      "grad_norm": 0.662491775517393,
      "learning_rate": 2.628234945011179e-05,
      "loss": 1.0834,
      "num_input_tokens_seen": 43084100560,
      "step": 54761
    },
    {
      "epoch": 5.8096753660089115,
      "grad_norm": 0.6128789885413897,
      "learning_rate": 2.6281655395654642e-05,
      "loss": 1.0642,
      "num_input_tokens_seen": 43084887376,
      "step": 54762
    },
    {
      "epoch": 5.809781455548483,
      "grad_norm": 1.0182010127207504,
      "learning_rate": 2.628096134020707e-05,
      "loss": 1.1841,
      "num_input_tokens_seen": 43085674096,
      "step": 54763
    },
    {
      "epoch": 5.8098875450880545,
      "grad_norm": 0.5540164383665973,
      "learning_rate": 2.628026728376961e-05,
      "loss": 1.1472,
      "num_input_tokens_seen": 43086460768,
      "step": 54764
    },
    {
      "epoch": 5.8099936346276255,
      "grad_norm": 0.6727400819991882,
      "learning_rate": 2.62795732263428e-05,
      "loss": 1.0831,
      "num_input_tokens_seen": 43087247616,
      "step": 54765
    },
    {
      "epoch": 5.810099724167197,
      "grad_norm": 0.653519257538169,
      "learning_rate": 2.6278879167927178e-05,
      "loss": 1.1196,
      "num_input_tokens_seen": 43088034368,
      "step": 54766
    },
    {
      "epoch": 5.8102058137067685,
      "grad_norm": 0.7716527611257641,
      "learning_rate": 2.6278185108523268e-05,
      "loss": 1.168,
      "num_input_tokens_seen": 43088821120,
      "step": 54767
    },
    {
      "epoch": 5.81031190324634,
      "grad_norm": 0.6440692037089084,
      "learning_rate": 2.627749104813162e-05,
      "loss": 1.083,
      "num_input_tokens_seen": 43089607920,
      "step": 54768
    },
    {
      "epoch": 5.810417992785911,
      "grad_norm": 0.9706219600447132,
      "learning_rate": 2.627679698675276e-05,
      "loss": 1.2513,
      "num_input_tokens_seen": 43090394656,
      "step": 54769
    },
    {
      "epoch": 5.8105240823254825,
      "grad_norm": 0.6407844984062473,
      "learning_rate": 2.6276102924387224e-05,
      "loss": 1.1039,
      "num_input_tokens_seen": 43091181488,
      "step": 54770
    },
    {
      "epoch": 5.810630171865054,
      "grad_norm": 0.8253721216916339,
      "learning_rate": 2.6275408861035562e-05,
      "loss": 1.2645,
      "num_input_tokens_seen": 43091968128,
      "step": 54771
    },
    {
      "epoch": 5.810736261404625,
      "grad_norm": 0.6250772169542298,
      "learning_rate": 2.62747147966983e-05,
      "loss": 1.1937,
      "num_input_tokens_seen": 43092754752,
      "step": 54772
    },
    {
      "epoch": 5.810842350944197,
      "grad_norm": 0.7231296117550874,
      "learning_rate": 2.627402073137597e-05,
      "loss": 1.1643,
      "num_input_tokens_seen": 43093541472,
      "step": 54773
    },
    {
      "epoch": 5.810948440483768,
      "grad_norm": 0.6773740241481446,
      "learning_rate": 2.627332666506912e-05,
      "loss": 1.1709,
      "num_input_tokens_seen": 43094328288,
      "step": 54774
    },
    {
      "epoch": 5.811054530023339,
      "grad_norm": 0.7384188617393002,
      "learning_rate": 2.627263259777828e-05,
      "loss": 1.208,
      "num_input_tokens_seen": 43095115104,
      "step": 54775
    },
    {
      "epoch": 5.811160619562911,
      "grad_norm": 0.6469166042584972,
      "learning_rate": 2.6271938529503974e-05,
      "loss": 1.0928,
      "num_input_tokens_seen": 43095901968,
      "step": 54776
    },
    {
      "epoch": 5.811266709102482,
      "grad_norm": 0.756475811774596,
      "learning_rate": 2.627124446024677e-05,
      "loss": 1.1352,
      "num_input_tokens_seen": 43096688736,
      "step": 54777
    },
    {
      "epoch": 5.811372798642054,
      "grad_norm": 0.6328810911244831,
      "learning_rate": 2.6270550390007175e-05,
      "loss": 1.1463,
      "num_input_tokens_seen": 43097475552,
      "step": 54778
    },
    {
      "epoch": 5.811478888181625,
      "grad_norm": 0.6734676086449405,
      "learning_rate": 2.626985631878574e-05,
      "loss": 1.125,
      "num_input_tokens_seen": 43098262336,
      "step": 54779
    },
    {
      "epoch": 5.811584977721196,
      "grad_norm": 0.5725538394164859,
      "learning_rate": 2.6269162246582995e-05,
      "loss": 1.0525,
      "num_input_tokens_seen": 43099049088,
      "step": 54780
    },
    {
      "epoch": 5.811691067260768,
      "grad_norm": 0.782968650551863,
      "learning_rate": 2.6268468173399486e-05,
      "loss": 1.2409,
      "num_input_tokens_seen": 43099835872,
      "step": 54781
    },
    {
      "epoch": 5.811797156800339,
      "grad_norm": 0.6320043391058063,
      "learning_rate": 2.6267774099235732e-05,
      "loss": 1.1008,
      "num_input_tokens_seen": 43100622624,
      "step": 54782
    },
    {
      "epoch": 5.811903246339911,
      "grad_norm": 0.9182953640818551,
      "learning_rate": 2.6267080024092283e-05,
      "loss": 1.2468,
      "num_input_tokens_seen": 43101409392,
      "step": 54783
    },
    {
      "epoch": 5.812009335879482,
      "grad_norm": 0.5675088806244368,
      "learning_rate": 2.6266385947969675e-05,
      "loss": 1.0983,
      "num_input_tokens_seen": 43102196192,
      "step": 54784
    },
    {
      "epoch": 5.812115425419053,
      "grad_norm": 0.6718257208579708,
      "learning_rate": 2.6265691870868438e-05,
      "loss": 1.1836,
      "num_input_tokens_seen": 43102982992,
      "step": 54785
    },
    {
      "epoch": 5.812221514958625,
      "grad_norm": 0.5570739359806528,
      "learning_rate": 2.626499779278911e-05,
      "loss": 1.177,
      "num_input_tokens_seen": 43103769776,
      "step": 54786
    },
    {
      "epoch": 5.812327604498196,
      "grad_norm": 0.7327843972943049,
      "learning_rate": 2.6264303713732235e-05,
      "loss": 1.2404,
      "num_input_tokens_seen": 43104556496,
      "step": 54787
    },
    {
      "epoch": 5.812433694037768,
      "grad_norm": 1.0407341994745811,
      "learning_rate": 2.6263609633698333e-05,
      "loss": 1.1454,
      "num_input_tokens_seen": 43105343232,
      "step": 54788
    },
    {
      "epoch": 5.812539783577339,
      "grad_norm": 0.6947237600183575,
      "learning_rate": 2.626291555268796e-05,
      "loss": 1.1299,
      "num_input_tokens_seen": 43106130000,
      "step": 54789
    },
    {
      "epoch": 5.812645873116911,
      "grad_norm": 0.7675007668473232,
      "learning_rate": 2.6262221470701638e-05,
      "loss": 1.1802,
      "num_input_tokens_seen": 43106916784,
      "step": 54790
    },
    {
      "epoch": 5.812751962656482,
      "grad_norm": 0.6017023714783271,
      "learning_rate": 2.626152738773991e-05,
      "loss": 1.197,
      "num_input_tokens_seen": 43107703424,
      "step": 54791
    },
    {
      "epoch": 5.812858052196053,
      "grad_norm": 0.7346294694054738,
      "learning_rate": 2.6260833303803313e-05,
      "loss": 1.2863,
      "num_input_tokens_seen": 43108490096,
      "step": 54792
    },
    {
      "epoch": 5.812964141735625,
      "grad_norm": 0.993647103069628,
      "learning_rate": 2.626013921889237e-05,
      "loss": 1.179,
      "num_input_tokens_seen": 43109276832,
      "step": 54793
    },
    {
      "epoch": 5.813070231275196,
      "grad_norm": 0.7220985774959204,
      "learning_rate": 2.6259445133007643e-05,
      "loss": 1.2414,
      "num_input_tokens_seen": 43110063616,
      "step": 54794
    },
    {
      "epoch": 5.813176320814768,
      "grad_norm": 0.6098650270301554,
      "learning_rate": 2.6258751046149648e-05,
      "loss": 1.1477,
      "num_input_tokens_seen": 43110850256,
      "step": 54795
    },
    {
      "epoch": 5.813282410354339,
      "grad_norm": 0.6213402286303709,
      "learning_rate": 2.6258056958318922e-05,
      "loss": 1.1529,
      "num_input_tokens_seen": 43111637024,
      "step": 54796
    },
    {
      "epoch": 5.813388499893911,
      "grad_norm": 0.6817588151354702,
      "learning_rate": 2.625736286951601e-05,
      "loss": 1.1232,
      "num_input_tokens_seen": 43112423792,
      "step": 54797
    },
    {
      "epoch": 5.813494589433482,
      "grad_norm": 0.649520936369276,
      "learning_rate": 2.625666877974145e-05,
      "loss": 1.1273,
      "num_input_tokens_seen": 43113210496,
      "step": 54798
    },
    {
      "epoch": 5.813600678973053,
      "grad_norm": 0.6477345584759642,
      "learning_rate": 2.6255974688995766e-05,
      "loss": 1.1573,
      "num_input_tokens_seen": 43113997344,
      "step": 54799
    },
    {
      "epoch": 5.813706768512625,
      "grad_norm": 0.6037636683867686,
      "learning_rate": 2.6255280597279507e-05,
      "loss": 1.0357,
      "num_input_tokens_seen": 43114784096,
      "step": 54800
    },
    {
      "epoch": 5.813812858052196,
      "grad_norm": 0.7165453969508908,
      "learning_rate": 2.6254586504593203e-05,
      "loss": 1.2796,
      "num_input_tokens_seen": 43115570880,
      "step": 54801
    },
    {
      "epoch": 5.813918947591768,
      "grad_norm": 0.5651124012033774,
      "learning_rate": 2.6253892410937385e-05,
      "loss": 1.1701,
      "num_input_tokens_seen": 43116357648,
      "step": 54802
    },
    {
      "epoch": 5.814025037131339,
      "grad_norm": 0.6156508460430977,
      "learning_rate": 2.6253198316312605e-05,
      "loss": 1.184,
      "num_input_tokens_seen": 43117144448,
      "step": 54803
    },
    {
      "epoch": 5.81413112667091,
      "grad_norm": 0.6800638450621957,
      "learning_rate": 2.625250422071939e-05,
      "loss": 1.1627,
      "num_input_tokens_seen": 43117931152,
      "step": 54804
    },
    {
      "epoch": 5.814237216210482,
      "grad_norm": 0.6445448813977538,
      "learning_rate": 2.6251810124158265e-05,
      "loss": 1.1724,
      "num_input_tokens_seen": 43118717952,
      "step": 54805
    },
    {
      "epoch": 5.814343305750053,
      "grad_norm": 0.6894071591237892,
      "learning_rate": 2.625111602662979e-05,
      "loss": 1.1819,
      "num_input_tokens_seen": 43119504704,
      "step": 54806
    },
    {
      "epoch": 5.814449395289625,
      "grad_norm": 0.5818257643340586,
      "learning_rate": 2.6250421928134478e-05,
      "loss": 1.2083,
      "num_input_tokens_seen": 43120291584,
      "step": 54807
    },
    {
      "epoch": 5.814555484829196,
      "grad_norm": 0.6849597734930339,
      "learning_rate": 2.624972782867289e-05,
      "loss": 1.1377,
      "num_input_tokens_seen": 43121078368,
      "step": 54808
    },
    {
      "epoch": 5.814661574368767,
      "grad_norm": 0.8090186437893474,
      "learning_rate": 2.6249033728245544e-05,
      "loss": 1.1506,
      "num_input_tokens_seen": 43121865104,
      "step": 54809
    },
    {
      "epoch": 5.814767663908339,
      "grad_norm": 0.6296061272496327,
      "learning_rate": 2.6248339626852974e-05,
      "loss": 1.1379,
      "num_input_tokens_seen": 43122651904,
      "step": 54810
    },
    {
      "epoch": 5.81487375344791,
      "grad_norm": 0.5432964171262261,
      "learning_rate": 2.624764552449573e-05,
      "loss": 1.0937,
      "num_input_tokens_seen": 43123438656,
      "step": 54811
    },
    {
      "epoch": 5.814979842987482,
      "grad_norm": 0.656740540881203,
      "learning_rate": 2.6246951421174343e-05,
      "loss": 1.1329,
      "num_input_tokens_seen": 43124225408,
      "step": 54812
    },
    {
      "epoch": 5.815085932527053,
      "grad_norm": 0.5987691629345276,
      "learning_rate": 2.6246257316889346e-05,
      "loss": 1.0875,
      "num_input_tokens_seen": 43125012176,
      "step": 54813
    },
    {
      "epoch": 5.815192022066624,
      "grad_norm": 0.6383846937077957,
      "learning_rate": 2.624556321164128e-05,
      "loss": 1.1564,
      "num_input_tokens_seen": 43125798944,
      "step": 54814
    },
    {
      "epoch": 5.815298111606196,
      "grad_norm": 0.6021458757612048,
      "learning_rate": 2.624486910543068e-05,
      "loss": 1.1575,
      "num_input_tokens_seen": 43126585648,
      "step": 54815
    },
    {
      "epoch": 5.815404201145767,
      "grad_norm": 0.6309169518551063,
      "learning_rate": 2.6244174998258077e-05,
      "loss": 1.0976,
      "num_input_tokens_seen": 43127372512,
      "step": 54816
    },
    {
      "epoch": 5.815510290685339,
      "grad_norm": 0.596700204117748,
      "learning_rate": 2.6243480890124016e-05,
      "loss": 1.1267,
      "num_input_tokens_seen": 43128159360,
      "step": 54817
    },
    {
      "epoch": 5.81561638022491,
      "grad_norm": 0.6007619139836942,
      "learning_rate": 2.6242786781029027e-05,
      "loss": 1.1661,
      "num_input_tokens_seen": 43128946224,
      "step": 54818
    },
    {
      "epoch": 5.815722469764482,
      "grad_norm": 0.744190004832966,
      "learning_rate": 2.624209267097365e-05,
      "loss": 1.1851,
      "num_input_tokens_seen": 43129733008,
      "step": 54819
    },
    {
      "epoch": 5.815828559304053,
      "grad_norm": 0.6326780417182485,
      "learning_rate": 2.6241398559958425e-05,
      "loss": 1.1958,
      "num_input_tokens_seen": 43130519792,
      "step": 54820
    },
    {
      "epoch": 5.815934648843624,
      "grad_norm": 0.5485731741219743,
      "learning_rate": 2.6240704447983876e-05,
      "loss": 1.1228,
      "num_input_tokens_seen": 43131306640,
      "step": 54821
    },
    {
      "epoch": 5.816040738383196,
      "grad_norm": 0.5793891317453223,
      "learning_rate": 2.6240010335050547e-05,
      "loss": 1.0504,
      "num_input_tokens_seen": 43132093456,
      "step": 54822
    },
    {
      "epoch": 5.816146827922767,
      "grad_norm": 0.6121062855524714,
      "learning_rate": 2.6239316221158983e-05,
      "loss": 1.1751,
      "num_input_tokens_seen": 43132880224,
      "step": 54823
    },
    {
      "epoch": 5.8162529174623385,
      "grad_norm": 0.6732468853429808,
      "learning_rate": 2.6238622106309703e-05,
      "loss": 1.1899,
      "num_input_tokens_seen": 43133666976,
      "step": 54824
    },
    {
      "epoch": 5.8163590070019096,
      "grad_norm": 0.6271762975052462,
      "learning_rate": 2.6237927990503248e-05,
      "loss": 1.1847,
      "num_input_tokens_seen": 43134453792,
      "step": 54825
    },
    {
      "epoch": 5.8164650965414815,
      "grad_norm": 0.7650738599173867,
      "learning_rate": 2.6237233873740168e-05,
      "loss": 1.206,
      "num_input_tokens_seen": 43135240496,
      "step": 54826
    },
    {
      "epoch": 5.8165711860810525,
      "grad_norm": 0.5650406571537657,
      "learning_rate": 2.623653975602099e-05,
      "loss": 1.0918,
      "num_input_tokens_seen": 43136027184,
      "step": 54827
    },
    {
      "epoch": 5.8166772756206235,
      "grad_norm": 0.7073780520506617,
      "learning_rate": 2.6235845637346245e-05,
      "loss": 1.2174,
      "num_input_tokens_seen": 43136813872,
      "step": 54828
    },
    {
      "epoch": 5.8167833651601955,
      "grad_norm": 0.713565886076536,
      "learning_rate": 2.6235151517716483e-05,
      "loss": 1.1482,
      "num_input_tokens_seen": 43137600688,
      "step": 54829
    },
    {
      "epoch": 5.8168894546997665,
      "grad_norm": 0.6965723781352133,
      "learning_rate": 2.6234457397132227e-05,
      "loss": 1.2479,
      "num_input_tokens_seen": 43138387376,
      "step": 54830
    },
    {
      "epoch": 5.816995544239338,
      "grad_norm": 0.7260806443045372,
      "learning_rate": 2.6233763275594016e-05,
      "loss": 1.1436,
      "num_input_tokens_seen": 43139174096,
      "step": 54831
    },
    {
      "epoch": 5.817101633778909,
      "grad_norm": 0.5967100057794684,
      "learning_rate": 2.623306915310239e-05,
      "loss": 1.1455,
      "num_input_tokens_seen": 43139960832,
      "step": 54832
    },
    {
      "epoch": 5.8172077233184805,
      "grad_norm": 0.8630417007754465,
      "learning_rate": 2.6232375029657884e-05,
      "loss": 1.2776,
      "num_input_tokens_seen": 43140747632,
      "step": 54833
    },
    {
      "epoch": 5.817313812858052,
      "grad_norm": 0.6448209442378412,
      "learning_rate": 2.623168090526104e-05,
      "loss": 1.1314,
      "num_input_tokens_seen": 43141534288,
      "step": 54834
    },
    {
      "epoch": 5.817419902397623,
      "grad_norm": 0.6309432039985361,
      "learning_rate": 2.6230986779912388e-05,
      "loss": 1.2174,
      "num_input_tokens_seen": 43142321136,
      "step": 54835
    },
    {
      "epoch": 5.817525991937195,
      "grad_norm": 0.8002602783022604,
      "learning_rate": 2.623029265361246e-05,
      "loss": 1.1929,
      "num_input_tokens_seen": 43143107904,
      "step": 54836
    },
    {
      "epoch": 5.817632081476766,
      "grad_norm": 0.7882554751668791,
      "learning_rate": 2.6229598526361803e-05,
      "loss": 1.1171,
      "num_input_tokens_seen": 43143894624,
      "step": 54837
    },
    {
      "epoch": 5.817738171016337,
      "grad_norm": 0.692815658198734,
      "learning_rate": 2.622890439816095e-05,
      "loss": 1.1103,
      "num_input_tokens_seen": 43144681376,
      "step": 54838
    },
    {
      "epoch": 5.817844260555909,
      "grad_norm": 0.7133401473972916,
      "learning_rate": 2.622821026901043e-05,
      "loss": 1.0972,
      "num_input_tokens_seen": 43145468176,
      "step": 54839
    },
    {
      "epoch": 5.81795035009548,
      "grad_norm": 0.6859112667889904,
      "learning_rate": 2.622751613891079e-05,
      "loss": 1.1377,
      "num_input_tokens_seen": 43146254912,
      "step": 54840
    },
    {
      "epoch": 5.818056439635052,
      "grad_norm": 0.6253868372369341,
      "learning_rate": 2.622682200786256e-05,
      "loss": 1.2183,
      "num_input_tokens_seen": 43147041664,
      "step": 54841
    },
    {
      "epoch": 5.818162529174623,
      "grad_norm": 0.6077230706674371,
      "learning_rate": 2.6226127875866274e-05,
      "loss": 1.158,
      "num_input_tokens_seen": 43147828432,
      "step": 54842
    },
    {
      "epoch": 5.818268618714194,
      "grad_norm": 0.5827146211456464,
      "learning_rate": 2.622543374292248e-05,
      "loss": 1.1327,
      "num_input_tokens_seen": 43148615168,
      "step": 54843
    },
    {
      "epoch": 5.818374708253766,
      "grad_norm": 0.921830189603607,
      "learning_rate": 2.6224739609031702e-05,
      "loss": 1.2589,
      "num_input_tokens_seen": 43149401952,
      "step": 54844
    },
    {
      "epoch": 5.818480797793337,
      "grad_norm": 0.588363063339459,
      "learning_rate": 2.6224045474194477e-05,
      "loss": 1.1332,
      "num_input_tokens_seen": 43150188608,
      "step": 54845
    },
    {
      "epoch": 5.818586887332909,
      "grad_norm": 0.7614964950272175,
      "learning_rate": 2.622335133841135e-05,
      "loss": 1.1226,
      "num_input_tokens_seen": 43150975488,
      "step": 54846
    },
    {
      "epoch": 5.81869297687248,
      "grad_norm": 0.5813022714828886,
      "learning_rate": 2.6222657201682856e-05,
      "loss": 1.0329,
      "num_input_tokens_seen": 43151762256,
      "step": 54847
    },
    {
      "epoch": 5.818799066412052,
      "grad_norm": 0.6183846053269137,
      "learning_rate": 2.622196306400952e-05,
      "loss": 1.1431,
      "num_input_tokens_seen": 43152549008,
      "step": 54848
    },
    {
      "epoch": 5.818905155951623,
      "grad_norm": 0.6560051531483523,
      "learning_rate": 2.6221268925391896e-05,
      "loss": 1.1178,
      "num_input_tokens_seen": 43153335792,
      "step": 54849
    },
    {
      "epoch": 5.819011245491194,
      "grad_norm": 0.5640550688009665,
      "learning_rate": 2.6220574785830504e-05,
      "loss": 1.1433,
      "num_input_tokens_seen": 43154122528,
      "step": 54850
    },
    {
      "epoch": 5.819117335030766,
      "grad_norm": 0.6330559187828734,
      "learning_rate": 2.621988064532589e-05,
      "loss": 1.158,
      "num_input_tokens_seen": 43154909296,
      "step": 54851
    },
    {
      "epoch": 5.819223424570337,
      "grad_norm": 0.6145150113709754,
      "learning_rate": 2.6219186503878595e-05,
      "loss": 1.1654,
      "num_input_tokens_seen": 43155695952,
      "step": 54852
    },
    {
      "epoch": 5.819329514109909,
      "grad_norm": 0.6495272024680461,
      "learning_rate": 2.621849236148914e-05,
      "loss": 1.1394,
      "num_input_tokens_seen": 43156482688,
      "step": 54853
    },
    {
      "epoch": 5.81943560364948,
      "grad_norm": 0.6874520767498876,
      "learning_rate": 2.6217798218158075e-05,
      "loss": 1.2637,
      "num_input_tokens_seen": 43157269408,
      "step": 54854
    },
    {
      "epoch": 5.819541693189052,
      "grad_norm": 0.6130366796335989,
      "learning_rate": 2.621710407388593e-05,
      "loss": 1.1535,
      "num_input_tokens_seen": 43158056240,
      "step": 54855
    },
    {
      "epoch": 5.819647782728623,
      "grad_norm": 0.6254903103973262,
      "learning_rate": 2.6216409928673235e-05,
      "loss": 1.1439,
      "num_input_tokens_seen": 43158843008,
      "step": 54856
    },
    {
      "epoch": 5.819753872268194,
      "grad_norm": 0.6389490729105174,
      "learning_rate": 2.6215715782520538e-05,
      "loss": 1.0855,
      "num_input_tokens_seen": 43159629776,
      "step": 54857
    },
    {
      "epoch": 5.819859961807766,
      "grad_norm": 0.5679607444391354,
      "learning_rate": 2.621502163542838e-05,
      "loss": 1.0912,
      "num_input_tokens_seen": 43160416544,
      "step": 54858
    },
    {
      "epoch": 5.819966051347337,
      "grad_norm": 0.6649421669795995,
      "learning_rate": 2.6214327487397277e-05,
      "loss": 1.1993,
      "num_input_tokens_seen": 43161203232,
      "step": 54859
    },
    {
      "epoch": 5.820072140886909,
      "grad_norm": 0.687700524897792,
      "learning_rate": 2.6213633338427785e-05,
      "loss": 1.1659,
      "num_input_tokens_seen": 43161989968,
      "step": 54860
    },
    {
      "epoch": 5.82017823042648,
      "grad_norm": 0.7196188971933412,
      "learning_rate": 2.6212939188520434e-05,
      "loss": 1.1534,
      "num_input_tokens_seen": 43162776736,
      "step": 54861
    },
    {
      "epoch": 5.820284319966051,
      "grad_norm": 0.8141172351029345,
      "learning_rate": 2.6212245037675754e-05,
      "loss": 1.1404,
      "num_input_tokens_seen": 43163563568,
      "step": 54862
    },
    {
      "epoch": 5.820390409505623,
      "grad_norm": 0.7214534829359082,
      "learning_rate": 2.621155088589429e-05,
      "loss": 1.141,
      "num_input_tokens_seen": 43164350336,
      "step": 54863
    },
    {
      "epoch": 5.820496499045194,
      "grad_norm": 0.7345363397044473,
      "learning_rate": 2.6210856733176574e-05,
      "loss": 1.0771,
      "num_input_tokens_seen": 43165137200,
      "step": 54864
    },
    {
      "epoch": 5.820602588584766,
      "grad_norm": 0.9966356904176715,
      "learning_rate": 2.621016257952314e-05,
      "loss": 1.152,
      "num_input_tokens_seen": 43165923984,
      "step": 54865
    },
    {
      "epoch": 5.820708678124337,
      "grad_norm": 0.5565176504570848,
      "learning_rate": 2.6209468424934535e-05,
      "loss": 1.0615,
      "num_input_tokens_seen": 43166710752,
      "step": 54866
    },
    {
      "epoch": 5.820814767663908,
      "grad_norm": 1.0185604247442699,
      "learning_rate": 2.6208774269411278e-05,
      "loss": 1.1682,
      "num_input_tokens_seen": 43167497632,
      "step": 54867
    },
    {
      "epoch": 5.82092085720348,
      "grad_norm": 0.7241992556881961,
      "learning_rate": 2.6208080112953927e-05,
      "loss": 1.1927,
      "num_input_tokens_seen": 43168284320,
      "step": 54868
    },
    {
      "epoch": 5.821026946743051,
      "grad_norm": 0.7720107648572708,
      "learning_rate": 2.6207385955563002e-05,
      "loss": 1.1701,
      "num_input_tokens_seen": 43169071072,
      "step": 54869
    },
    {
      "epoch": 5.821133036282623,
      "grad_norm": 0.7631370490348495,
      "learning_rate": 2.620669179723904e-05,
      "loss": 1.163,
      "num_input_tokens_seen": 43169857952,
      "step": 54870
    },
    {
      "epoch": 5.821239125822194,
      "grad_norm": 0.8266771153776015,
      "learning_rate": 2.6205997637982588e-05,
      "loss": 1.0945,
      "num_input_tokens_seen": 43170644624,
      "step": 54871
    },
    {
      "epoch": 5.821345215361765,
      "grad_norm": 0.8061737428575724,
      "learning_rate": 2.6205303477794175e-05,
      "loss": 1.1029,
      "num_input_tokens_seen": 43171431312,
      "step": 54872
    },
    {
      "epoch": 5.821451304901337,
      "grad_norm": 0.7885204459097936,
      "learning_rate": 2.6204609316674337e-05,
      "loss": 1.1623,
      "num_input_tokens_seen": 43172218048,
      "step": 54873
    },
    {
      "epoch": 5.821557394440908,
      "grad_norm": 0.6551754837869227,
      "learning_rate": 2.6203915154623614e-05,
      "loss": 1.1628,
      "num_input_tokens_seen": 43173004848,
      "step": 54874
    },
    {
      "epoch": 5.82166348398048,
      "grad_norm": 0.7041890017290439,
      "learning_rate": 2.620322099164254e-05,
      "loss": 1.1617,
      "num_input_tokens_seen": 43173791616,
      "step": 54875
    },
    {
      "epoch": 5.821769573520051,
      "grad_norm": 0.7152157987936226,
      "learning_rate": 2.6202526827731655e-05,
      "loss": 1.107,
      "num_input_tokens_seen": 43174578368,
      "step": 54876
    },
    {
      "epoch": 5.821875663059623,
      "grad_norm": 0.7290597359121537,
      "learning_rate": 2.620183266289149e-05,
      "loss": 1.0707,
      "num_input_tokens_seen": 43175365200,
      "step": 54877
    },
    {
      "epoch": 5.821981752599194,
      "grad_norm": 0.9762477625040691,
      "learning_rate": 2.6201138497122586e-05,
      "loss": 1.1399,
      "num_input_tokens_seen": 43176151952,
      "step": 54878
    },
    {
      "epoch": 5.822087842138765,
      "grad_norm": 0.9069688690178713,
      "learning_rate": 2.6200444330425474e-05,
      "loss": 1.1546,
      "num_input_tokens_seen": 43176938672,
      "step": 54879
    },
    {
      "epoch": 5.822193931678337,
      "grad_norm": 0.7206064228681183,
      "learning_rate": 2.6199750162800697e-05,
      "loss": 1.1817,
      "num_input_tokens_seen": 43177725424,
      "step": 54880
    },
    {
      "epoch": 5.822300021217908,
      "grad_norm": 0.708581928173034,
      "learning_rate": 2.619905599424879e-05,
      "loss": 1.1732,
      "num_input_tokens_seen": 43178512208,
      "step": 54881
    },
    {
      "epoch": 5.82240611075748,
      "grad_norm": 1.1327893274686651,
      "learning_rate": 2.619836182477028e-05,
      "loss": 1.1086,
      "num_input_tokens_seen": 43179298992,
      "step": 54882
    },
    {
      "epoch": 5.822512200297051,
      "grad_norm": 0.7791615689358001,
      "learning_rate": 2.619766765436572e-05,
      "loss": 1.1921,
      "num_input_tokens_seen": 43180085696,
      "step": 54883
    },
    {
      "epoch": 5.8226182898366226,
      "grad_norm": 0.7185493577900465,
      "learning_rate": 2.6196973483035635e-05,
      "loss": 1.2393,
      "num_input_tokens_seen": 43180872368,
      "step": 54884
    },
    {
      "epoch": 5.822724379376194,
      "grad_norm": 0.8531366341084308,
      "learning_rate": 2.6196279310780557e-05,
      "loss": 1.1177,
      "num_input_tokens_seen": 43181659200,
      "step": 54885
    },
    {
      "epoch": 5.822830468915765,
      "grad_norm": 0.7120392630990168,
      "learning_rate": 2.6195585137601037e-05,
      "loss": 1.0447,
      "num_input_tokens_seen": 43182445936,
      "step": 54886
    },
    {
      "epoch": 5.8229365584553365,
      "grad_norm": 0.7260692250236724,
      "learning_rate": 2.6194890963497604e-05,
      "loss": 1.1309,
      "num_input_tokens_seen": 43183232704,
      "step": 54887
    },
    {
      "epoch": 5.823042647994908,
      "grad_norm": 0.8549516509141724,
      "learning_rate": 2.6194196788470786e-05,
      "loss": 1.2328,
      "num_input_tokens_seen": 43184019504,
      "step": 54888
    },
    {
      "epoch": 5.8231487375344795,
      "grad_norm": 0.5932124192163901,
      "learning_rate": 2.6193502612521137e-05,
      "loss": 1.1557,
      "num_input_tokens_seen": 43184806144,
      "step": 54889
    },
    {
      "epoch": 5.8232548270740505,
      "grad_norm": 0.6591252539912743,
      "learning_rate": 2.6192808435649187e-05,
      "loss": 1.0533,
      "num_input_tokens_seen": 43185592960,
      "step": 54890
    },
    {
      "epoch": 5.8233609166136215,
      "grad_norm": 0.6374028665276885,
      "learning_rate": 2.619211425785546e-05,
      "loss": 1.1264,
      "num_input_tokens_seen": 43186379712,
      "step": 54891
    },
    {
      "epoch": 5.8234670061531935,
      "grad_norm": 0.7201175869197288,
      "learning_rate": 2.6191420079140503e-05,
      "loss": 1.1141,
      "num_input_tokens_seen": 43187166544,
      "step": 54892
    },
    {
      "epoch": 5.8235730956927645,
      "grad_norm": 0.6590309968024,
      "learning_rate": 2.6190725899504854e-05,
      "loss": 1.1097,
      "num_input_tokens_seen": 43187953360,
      "step": 54893
    },
    {
      "epoch": 5.823679185232336,
      "grad_norm": 0.7139628327143842,
      "learning_rate": 2.619003171894905e-05,
      "loss": 1.1593,
      "num_input_tokens_seen": 43188740208,
      "step": 54894
    },
    {
      "epoch": 5.823785274771907,
      "grad_norm": 0.7036802126999164,
      "learning_rate": 2.6189337537473625e-05,
      "loss": 1.1545,
      "num_input_tokens_seen": 43189526976,
      "step": 54895
    },
    {
      "epoch": 5.8238913643114785,
      "grad_norm": 0.6320729282439452,
      "learning_rate": 2.6188643355079108e-05,
      "loss": 1.2441,
      "num_input_tokens_seen": 43190313712,
      "step": 54896
    },
    {
      "epoch": 5.82399745385105,
      "grad_norm": 0.7271865058379665,
      "learning_rate": 2.6187949171766045e-05,
      "loss": 1.1352,
      "num_input_tokens_seen": 43191100496,
      "step": 54897
    },
    {
      "epoch": 5.824103543390621,
      "grad_norm": 0.6674309487738962,
      "learning_rate": 2.6187254987534974e-05,
      "loss": 1.1544,
      "num_input_tokens_seen": 43191887232,
      "step": 54898
    },
    {
      "epoch": 5.824209632930193,
      "grad_norm": 0.5336896116975618,
      "learning_rate": 2.6186560802386418e-05,
      "loss": 1.0623,
      "num_input_tokens_seen": 43192674016,
      "step": 54899
    },
    {
      "epoch": 5.824315722469764,
      "grad_norm": 0.7449060648420126,
      "learning_rate": 2.6185866616320932e-05,
      "loss": 1.1301,
      "num_input_tokens_seen": 43193460752,
      "step": 54900
    },
    {
      "epoch": 5.824421812009335,
      "grad_norm": 0.6042968090801162,
      "learning_rate": 2.6185172429339044e-05,
      "loss": 1.196,
      "num_input_tokens_seen": 43194247648,
      "step": 54901
    },
    {
      "epoch": 5.824527901548907,
      "grad_norm": 0.6140714084416817,
      "learning_rate": 2.618447824144128e-05,
      "loss": 1.0832,
      "num_input_tokens_seen": 43195034512,
      "step": 54902
    },
    {
      "epoch": 5.824633991088478,
      "grad_norm": 0.7189907615010797,
      "learning_rate": 2.618378405262819e-05,
      "loss": 1.1086,
      "num_input_tokens_seen": 43195821360,
      "step": 54903
    },
    {
      "epoch": 5.82474008062805,
      "grad_norm": 0.6572758766615464,
      "learning_rate": 2.618308986290031e-05,
      "loss": 1.1277,
      "num_input_tokens_seen": 43196608096,
      "step": 54904
    },
    {
      "epoch": 5.824846170167621,
      "grad_norm": 0.7388901600848878,
      "learning_rate": 2.618239567225817e-05,
      "loss": 1.2408,
      "num_input_tokens_seen": 43197394752,
      "step": 54905
    },
    {
      "epoch": 5.824952259707193,
      "grad_norm": 0.6331160192024455,
      "learning_rate": 2.6181701480702307e-05,
      "loss": 1.1936,
      "num_input_tokens_seen": 43198181488,
      "step": 54906
    },
    {
      "epoch": 5.825058349246764,
      "grad_norm": 0.6610306813974942,
      "learning_rate": 2.618100728823327e-05,
      "loss": 1.127,
      "num_input_tokens_seen": 43198968288,
      "step": 54907
    },
    {
      "epoch": 5.825164438786336,
      "grad_norm": 0.6377726328269031,
      "learning_rate": 2.6180313094851572e-05,
      "loss": 1.1132,
      "num_input_tokens_seen": 43199755104,
      "step": 54908
    },
    {
      "epoch": 5.825270528325907,
      "grad_norm": 0.8051403213041319,
      "learning_rate": 2.6179618900557767e-05,
      "loss": 1.2445,
      "num_input_tokens_seen": 43200541888,
      "step": 54909
    },
    {
      "epoch": 5.825376617865478,
      "grad_norm": 0.653948470430266,
      "learning_rate": 2.6178924705352386e-05,
      "loss": 1.1693,
      "num_input_tokens_seen": 43201328672,
      "step": 54910
    },
    {
      "epoch": 5.82548270740505,
      "grad_norm": 0.87449619101855,
      "learning_rate": 2.6178230509235972e-05,
      "loss": 1.1462,
      "num_input_tokens_seen": 43202115536,
      "step": 54911
    },
    {
      "epoch": 5.825588796944621,
      "grad_norm": 0.7381655392957678,
      "learning_rate": 2.6177536312209056e-05,
      "loss": 1.1202,
      "num_input_tokens_seen": 43202902352,
      "step": 54912
    },
    {
      "epoch": 5.825694886484193,
      "grad_norm": 0.7640617414446439,
      "learning_rate": 2.6176842114272166e-05,
      "loss": 1.1582,
      "num_input_tokens_seen": 43203689168,
      "step": 54913
    },
    {
      "epoch": 5.825800976023764,
      "grad_norm": 0.7552564844726517,
      "learning_rate": 2.6176147915425857e-05,
      "loss": 1.0795,
      "num_input_tokens_seen": 43204475968,
      "step": 54914
    },
    {
      "epoch": 5.825907065563335,
      "grad_norm": 0.7036020170235443,
      "learning_rate": 2.617545371567065e-05,
      "loss": 1.1577,
      "num_input_tokens_seen": 43205262864,
      "step": 54915
    },
    {
      "epoch": 5.826013155102907,
      "grad_norm": 0.6639504983910474,
      "learning_rate": 2.6174759515007084e-05,
      "loss": 1.1253,
      "num_input_tokens_seen": 43206049632,
      "step": 54916
    },
    {
      "epoch": 5.826119244642478,
      "grad_norm": 0.7781054617662312,
      "learning_rate": 2.6174065313435708e-05,
      "loss": 1.1982,
      "num_input_tokens_seen": 43206836304,
      "step": 54917
    },
    {
      "epoch": 5.82622533418205,
      "grad_norm": 0.6481424376586807,
      "learning_rate": 2.6173371110957047e-05,
      "loss": 1.2112,
      "num_input_tokens_seen": 43207623088,
      "step": 54918
    },
    {
      "epoch": 5.826331423721621,
      "grad_norm": 0.6284913226941019,
      "learning_rate": 2.617267690757162e-05,
      "loss": 1.1829,
      "num_input_tokens_seen": 43208409872,
      "step": 54919
    },
    {
      "epoch": 5.826437513261192,
      "grad_norm": 0.5940754647151418,
      "learning_rate": 2.617198270328e-05,
      "loss": 1.1875,
      "num_input_tokens_seen": 43209196752,
      "step": 54920
    },
    {
      "epoch": 5.826543602800764,
      "grad_norm": 0.6268848729587031,
      "learning_rate": 2.6171288498082707e-05,
      "loss": 1.1687,
      "num_input_tokens_seen": 43209983456,
      "step": 54921
    },
    {
      "epoch": 5.826649692340335,
      "grad_norm": 0.6051216694379028,
      "learning_rate": 2.617059429198027e-05,
      "loss": 1.1322,
      "num_input_tokens_seen": 43210770240,
      "step": 54922
    },
    {
      "epoch": 5.826755781879907,
      "grad_norm": 0.6592021148057294,
      "learning_rate": 2.6169900084973236e-05,
      "loss": 1.1075,
      "num_input_tokens_seen": 43211556928,
      "step": 54923
    },
    {
      "epoch": 5.826861871419478,
      "grad_norm": 0.7457817010217168,
      "learning_rate": 2.6169205877062143e-05,
      "loss": 1.1351,
      "num_input_tokens_seen": 43212343664,
      "step": 54924
    },
    {
      "epoch": 5.826967960959049,
      "grad_norm": 0.7257485140489196,
      "learning_rate": 2.616851166824751e-05,
      "loss": 1.2705,
      "num_input_tokens_seen": 43213130384,
      "step": 54925
    },
    {
      "epoch": 5.827074050498621,
      "grad_norm": 0.6293140186862204,
      "learning_rate": 2.6167817458529892e-05,
      "loss": 1.1102,
      "num_input_tokens_seen": 43213917072,
      "step": 54926
    },
    {
      "epoch": 5.827180140038192,
      "grad_norm": 0.6136848838527025,
      "learning_rate": 2.6167123247909825e-05,
      "loss": 1.1141,
      "num_input_tokens_seen": 43214703792,
      "step": 54927
    },
    {
      "epoch": 5.827286229577764,
      "grad_norm": 0.6080412358629592,
      "learning_rate": 2.616642903638783e-05,
      "loss": 1.2109,
      "num_input_tokens_seen": 43215490544,
      "step": 54928
    },
    {
      "epoch": 5.827392319117335,
      "grad_norm": 0.6080420999003281,
      "learning_rate": 2.6165734823964454e-05,
      "loss": 1.2338,
      "num_input_tokens_seen": 43216277280,
      "step": 54929
    },
    {
      "epoch": 5.827498408656906,
      "grad_norm": 0.5845201247944352,
      "learning_rate": 2.6165040610640235e-05,
      "loss": 1.0596,
      "num_input_tokens_seen": 43217064176,
      "step": 54930
    },
    {
      "epoch": 5.827604498196478,
      "grad_norm": 0.9158085536918603,
      "learning_rate": 2.6164346396415707e-05,
      "loss": 1.2306,
      "num_input_tokens_seen": 43217850912,
      "step": 54931
    },
    {
      "epoch": 5.827710587736049,
      "grad_norm": 0.6835410696393152,
      "learning_rate": 2.6163652181291404e-05,
      "loss": 1.2054,
      "num_input_tokens_seen": 43218637648,
      "step": 54932
    },
    {
      "epoch": 5.827816677275621,
      "grad_norm": 0.7241364645126807,
      "learning_rate": 2.616295796526787e-05,
      "loss": 1.1405,
      "num_input_tokens_seen": 43219424416,
      "step": 54933
    },
    {
      "epoch": 5.827922766815192,
      "grad_norm": 0.7110558644285777,
      "learning_rate": 2.6162263748345627e-05,
      "loss": 1.1805,
      "num_input_tokens_seen": 43220211264,
      "step": 54934
    },
    {
      "epoch": 5.828028856354764,
      "grad_norm": 0.6196359168678899,
      "learning_rate": 2.6161569530525225e-05,
      "loss": 1.0198,
      "num_input_tokens_seen": 43220998096,
      "step": 54935
    },
    {
      "epoch": 5.828134945894335,
      "grad_norm": 0.8068574023121381,
      "learning_rate": 2.6160875311807197e-05,
      "loss": 1.0978,
      "num_input_tokens_seen": 43221784960,
      "step": 54936
    },
    {
      "epoch": 5.828241035433907,
      "grad_norm": 0.6582730205273085,
      "learning_rate": 2.616018109219208e-05,
      "loss": 1.1946,
      "num_input_tokens_seen": 43222571696,
      "step": 54937
    },
    {
      "epoch": 5.828347124973478,
      "grad_norm": 0.7168984777252586,
      "learning_rate": 2.615948687168041e-05,
      "loss": 1.2011,
      "num_input_tokens_seen": 43223358496,
      "step": 54938
    },
    {
      "epoch": 5.828453214513049,
      "grad_norm": 0.7457260690567841,
      "learning_rate": 2.615879265027272e-05,
      "loss": 1.1184,
      "num_input_tokens_seen": 43224145264,
      "step": 54939
    },
    {
      "epoch": 5.828559304052621,
      "grad_norm": 0.7536248490089591,
      "learning_rate": 2.6158098427969547e-05,
      "loss": 1.0517,
      "num_input_tokens_seen": 43224932064,
      "step": 54940
    },
    {
      "epoch": 5.828665393592192,
      "grad_norm": 0.7371010784012293,
      "learning_rate": 2.6157404204771434e-05,
      "loss": 1.2528,
      "num_input_tokens_seen": 43225718752,
      "step": 54941
    },
    {
      "epoch": 5.828771483131764,
      "grad_norm": 0.6168848083575281,
      "learning_rate": 2.6156709980678905e-05,
      "loss": 1.186,
      "num_input_tokens_seen": 43226505536,
      "step": 54942
    },
    {
      "epoch": 5.828877572671335,
      "grad_norm": 0.6544725463028502,
      "learning_rate": 2.6156015755692515e-05,
      "loss": 1.1598,
      "num_input_tokens_seen": 43227292224,
      "step": 54943
    },
    {
      "epoch": 5.828983662210906,
      "grad_norm": 0.6881440067154649,
      "learning_rate": 2.6155321529812787e-05,
      "loss": 1.1254,
      "num_input_tokens_seen": 43228078944,
      "step": 54944
    },
    {
      "epoch": 5.829089751750478,
      "grad_norm": 0.63059933824732,
      "learning_rate": 2.615462730304026e-05,
      "loss": 1.1191,
      "num_input_tokens_seen": 43228865728,
      "step": 54945
    },
    {
      "epoch": 5.829195841290049,
      "grad_norm": 0.951760433256263,
      "learning_rate": 2.615393307537547e-05,
      "loss": 1.1764,
      "num_input_tokens_seen": 43229652464,
      "step": 54946
    },
    {
      "epoch": 5.829301930829621,
      "grad_norm": 0.5325747382601762,
      "learning_rate": 2.615323884681895e-05,
      "loss": 1.0051,
      "num_input_tokens_seen": 43230439248,
      "step": 54947
    },
    {
      "epoch": 5.829408020369192,
      "grad_norm": 0.6461082893674147,
      "learning_rate": 2.6152544617371244e-05,
      "loss": 1.095,
      "num_input_tokens_seen": 43231225952,
      "step": 54948
    },
    {
      "epoch": 5.829514109908763,
      "grad_norm": 0.9181249753730142,
      "learning_rate": 2.615185038703289e-05,
      "loss": 1.0969,
      "num_input_tokens_seen": 43232012608,
      "step": 54949
    },
    {
      "epoch": 5.8296201994483345,
      "grad_norm": 0.5967282184136897,
      "learning_rate": 2.6151156155804417e-05,
      "loss": 1.1186,
      "num_input_tokens_seen": 43232799424,
      "step": 54950
    },
    {
      "epoch": 5.829726288987906,
      "grad_norm": 0.7311203476509031,
      "learning_rate": 2.615046192368636e-05,
      "loss": 1.0654,
      "num_input_tokens_seen": 43233586288,
      "step": 54951
    },
    {
      "epoch": 5.8298323785274775,
      "grad_norm": 0.915356345764683,
      "learning_rate": 2.6149767690679262e-05,
      "loss": 1.1732,
      "num_input_tokens_seen": 43234373072,
      "step": 54952
    },
    {
      "epoch": 5.8299384680670485,
      "grad_norm": 0.6958020007832778,
      "learning_rate": 2.6149073456783658e-05,
      "loss": 1.139,
      "num_input_tokens_seen": 43235159808,
      "step": 54953
    },
    {
      "epoch": 5.8300445576066195,
      "grad_norm": 0.6529922461652945,
      "learning_rate": 2.6148379222000086e-05,
      "loss": 1.1373,
      "num_input_tokens_seen": 43235946528,
      "step": 54954
    },
    {
      "epoch": 5.8301506471461915,
      "grad_norm": 0.9629728525089917,
      "learning_rate": 2.614768498632908e-05,
      "loss": 1.1903,
      "num_input_tokens_seen": 43236733312,
      "step": 54955
    },
    {
      "epoch": 5.8302567366857625,
      "grad_norm": 0.8544598283875348,
      "learning_rate": 2.614699074977117e-05,
      "loss": 1.2637,
      "num_input_tokens_seen": 43237520016,
      "step": 54956
    },
    {
      "epoch": 5.830362826225334,
      "grad_norm": 0.7714861413669264,
      "learning_rate": 2.6146296512326906e-05,
      "loss": 1.0794,
      "num_input_tokens_seen": 43238306720,
      "step": 54957
    },
    {
      "epoch": 5.8304689157649054,
      "grad_norm": 0.7400133599125664,
      "learning_rate": 2.6145602273996816e-05,
      "loss": 1.1851,
      "num_input_tokens_seen": 43239093584,
      "step": 54958
    },
    {
      "epoch": 5.830575005304477,
      "grad_norm": 0.7176056995438002,
      "learning_rate": 2.6144908034781436e-05,
      "loss": 1.0939,
      "num_input_tokens_seen": 43239880416,
      "step": 54959
    },
    {
      "epoch": 5.830681094844048,
      "grad_norm": 0.7121704497104125,
      "learning_rate": 2.6144213794681312e-05,
      "loss": 1.1864,
      "num_input_tokens_seen": 43240667072,
      "step": 54960
    },
    {
      "epoch": 5.830787184383619,
      "grad_norm": 0.78494067771367,
      "learning_rate": 2.6143519553696967e-05,
      "loss": 1.2948,
      "num_input_tokens_seen": 43241453824,
      "step": 54961
    },
    {
      "epoch": 5.830893273923191,
      "grad_norm": 0.7219177766254714,
      "learning_rate": 2.614282531182894e-05,
      "loss": 1.2619,
      "num_input_tokens_seen": 43242240544,
      "step": 54962
    },
    {
      "epoch": 5.830999363462762,
      "grad_norm": 0.7948647163326739,
      "learning_rate": 2.614213106907778e-05,
      "loss": 1.1048,
      "num_input_tokens_seen": 43243027280,
      "step": 54963
    },
    {
      "epoch": 5.831105453002334,
      "grad_norm": 0.6702472835783504,
      "learning_rate": 2.614143682544401e-05,
      "loss": 1.1143,
      "num_input_tokens_seen": 43243813984,
      "step": 54964
    },
    {
      "epoch": 5.831211542541905,
      "grad_norm": 0.6267929095674049,
      "learning_rate": 2.614074258092817e-05,
      "loss": 1.2225,
      "num_input_tokens_seen": 43244600640,
      "step": 54965
    },
    {
      "epoch": 5.831317632081477,
      "grad_norm": 0.7268988841861861,
      "learning_rate": 2.61400483355308e-05,
      "loss": 1.2004,
      "num_input_tokens_seen": 43245387424,
      "step": 54966
    },
    {
      "epoch": 5.831423721621048,
      "grad_norm": 0.8324779617333884,
      "learning_rate": 2.6139354089252427e-05,
      "loss": 1.2306,
      "num_input_tokens_seen": 43246174176,
      "step": 54967
    },
    {
      "epoch": 5.831529811160619,
      "grad_norm": 0.5592458512673157,
      "learning_rate": 2.61386598420936e-05,
      "loss": 1.1622,
      "num_input_tokens_seen": 43246960912,
      "step": 54968
    },
    {
      "epoch": 5.831635900700191,
      "grad_norm": 0.5634330472986611,
      "learning_rate": 2.6137965594054852e-05,
      "loss": 1.0397,
      "num_input_tokens_seen": 43247747776,
      "step": 54969
    },
    {
      "epoch": 5.831741990239762,
      "grad_norm": 1.2041505499760001,
      "learning_rate": 2.6137271345136716e-05,
      "loss": 1.1194,
      "num_input_tokens_seen": 43248534560,
      "step": 54970
    },
    {
      "epoch": 5.831848079779334,
      "grad_norm": 0.5833896919882049,
      "learning_rate": 2.613657709533973e-05,
      "loss": 1.0798,
      "num_input_tokens_seen": 43249321328,
      "step": 54971
    },
    {
      "epoch": 5.831954169318905,
      "grad_norm": 0.7649397603301523,
      "learning_rate": 2.6135882844664432e-05,
      "loss": 1.1542,
      "num_input_tokens_seen": 43250108128,
      "step": 54972
    },
    {
      "epoch": 5.832060258858476,
      "grad_norm": 0.7093464094426102,
      "learning_rate": 2.613518859311136e-05,
      "loss": 1.1499,
      "num_input_tokens_seen": 43250894880,
      "step": 54973
    },
    {
      "epoch": 5.832166348398048,
      "grad_norm": 0.6597993850976134,
      "learning_rate": 2.6134494340681038e-05,
      "loss": 1.2097,
      "num_input_tokens_seen": 43251681648,
      "step": 54974
    },
    {
      "epoch": 5.832272437937619,
      "grad_norm": 0.6449810782598917,
      "learning_rate": 2.613380008737402e-05,
      "loss": 1.124,
      "num_input_tokens_seen": 43252468336,
      "step": 54975
    },
    {
      "epoch": 5.832378527477191,
      "grad_norm": 0.8538561343678885,
      "learning_rate": 2.6133105833190836e-05,
      "loss": 1.0951,
      "num_input_tokens_seen": 43253255152,
      "step": 54976
    },
    {
      "epoch": 5.832484617016762,
      "grad_norm": 0.6342543245370081,
      "learning_rate": 2.613241157813201e-05,
      "loss": 1.1495,
      "num_input_tokens_seen": 43254041968,
      "step": 54977
    },
    {
      "epoch": 5.832590706556333,
      "grad_norm": 0.5298653733868296,
      "learning_rate": 2.61317173221981e-05,
      "loss": 1.0288,
      "num_input_tokens_seen": 43254828736,
      "step": 54978
    },
    {
      "epoch": 5.832696796095905,
      "grad_norm": 0.7664716672037647,
      "learning_rate": 2.6131023065389626e-05,
      "loss": 1.0899,
      "num_input_tokens_seen": 43255615488,
      "step": 54979
    },
    {
      "epoch": 5.832802885635476,
      "grad_norm": 0.7125743437961334,
      "learning_rate": 2.613032880770713e-05,
      "loss": 1.1821,
      "num_input_tokens_seen": 43256402208,
      "step": 54980
    },
    {
      "epoch": 5.832908975175048,
      "grad_norm": 0.6310629502965059,
      "learning_rate": 2.612963454915116e-05,
      "loss": 1.1659,
      "num_input_tokens_seen": 43257188960,
      "step": 54981
    },
    {
      "epoch": 5.833015064714619,
      "grad_norm": 0.7651594918425064,
      "learning_rate": 2.6128940289722232e-05,
      "loss": 1.1732,
      "num_input_tokens_seen": 43257975792,
      "step": 54982
    },
    {
      "epoch": 5.83312115425419,
      "grad_norm": 0.6057918016298909,
      "learning_rate": 2.6128246029420894e-05,
      "loss": 1.1675,
      "num_input_tokens_seen": 43258762464,
      "step": 54983
    },
    {
      "epoch": 5.833227243793762,
      "grad_norm": 0.6515467948076409,
      "learning_rate": 2.612755176824768e-05,
      "loss": 1.1557,
      "num_input_tokens_seen": 43259549216,
      "step": 54984
    },
    {
      "epoch": 5.833333333333333,
      "grad_norm": 0.6580963777397368,
      "learning_rate": 2.612685750620313e-05,
      "loss": 1.1025,
      "num_input_tokens_seen": 43260336000,
      "step": 54985
    },
    {
      "epoch": 5.833439422872905,
      "grad_norm": 0.6059334342293887,
      "learning_rate": 2.6126163243287777e-05,
      "loss": 1.1397,
      "num_input_tokens_seen": 43261122704,
      "step": 54986
    },
    {
      "epoch": 5.833545512412476,
      "grad_norm": 0.6709447027153124,
      "learning_rate": 2.6125468979502156e-05,
      "loss": 1.0625,
      "num_input_tokens_seen": 43261909584,
      "step": 54987
    },
    {
      "epoch": 5.833651601952048,
      "grad_norm": 0.6789034801754914,
      "learning_rate": 2.61247747148468e-05,
      "loss": 1.219,
      "num_input_tokens_seen": 43262696368,
      "step": 54988
    },
    {
      "epoch": 5.833757691491619,
      "grad_norm": 0.7590867372767011,
      "learning_rate": 2.6124080449322262e-05,
      "loss": 1.112,
      "num_input_tokens_seen": 43263483216,
      "step": 54989
    },
    {
      "epoch": 5.83386378103119,
      "grad_norm": 0.8614343382686565,
      "learning_rate": 2.6123386182929067e-05,
      "loss": 1.1269,
      "num_input_tokens_seen": 43264270048,
      "step": 54990
    },
    {
      "epoch": 5.833969870570762,
      "grad_norm": 0.7265564392875571,
      "learning_rate": 2.612269191566774e-05,
      "loss": 1.2012,
      "num_input_tokens_seen": 43265056800,
      "step": 54991
    },
    {
      "epoch": 5.834075960110333,
      "grad_norm": 0.694380144335615,
      "learning_rate": 2.6121997647538843e-05,
      "loss": 1.1526,
      "num_input_tokens_seen": 43265843696,
      "step": 54992
    },
    {
      "epoch": 5.834182049649905,
      "grad_norm": 0.7189700948199081,
      "learning_rate": 2.6121303378542895e-05,
      "loss": 1.0803,
      "num_input_tokens_seen": 43266630560,
      "step": 54993
    },
    {
      "epoch": 5.834288139189476,
      "grad_norm": 0.639631988440051,
      "learning_rate": 2.6120609108680432e-05,
      "loss": 1.2674,
      "num_input_tokens_seen": 43267417360,
      "step": 54994
    },
    {
      "epoch": 5.834394228729048,
      "grad_norm": 0.5701084414621421,
      "learning_rate": 2.6119914837951997e-05,
      "loss": 1.1492,
      "num_input_tokens_seen": 43268204128,
      "step": 54995
    },
    {
      "epoch": 5.834500318268619,
      "grad_norm": 0.6990226844931876,
      "learning_rate": 2.6119220566358128e-05,
      "loss": 1.0556,
      "num_input_tokens_seen": 43268990928,
      "step": 54996
    },
    {
      "epoch": 5.83460640780819,
      "grad_norm": 0.5882745591470746,
      "learning_rate": 2.6118526293899354e-05,
      "loss": 1.1985,
      "num_input_tokens_seen": 43269777632,
      "step": 54997
    },
    {
      "epoch": 5.834712497347762,
      "grad_norm": 0.6033055978892888,
      "learning_rate": 2.6117832020576223e-05,
      "loss": 1.1592,
      "num_input_tokens_seen": 43270564368,
      "step": 54998
    },
    {
      "epoch": 5.834818586887333,
      "grad_norm": 0.5991172369195227,
      "learning_rate": 2.6117137746389254e-05,
      "loss": 1.1485,
      "num_input_tokens_seen": 43271351072,
      "step": 54999
    },
    {
      "epoch": 5.834924676426905,
      "grad_norm": 0.779677694551195,
      "learning_rate": 2.6116443471339002e-05,
      "loss": 1.1231,
      "num_input_tokens_seen": 43272137824,
      "step": 55000
    },
    {
      "epoch": 5.834924676426905,
      "eval_loss": 1.5118852853775024,
      "eval_runtime": 64.5165,
      "eval_samples_per_second": 46.5,
      "eval_steps_per_second": 0.496,
      "num_input_tokens_seen": 43272137824,
      "step": 55000
    },
    {
      "epoch": 5.835030765966476,
      "grad_norm": 0.6553772537884907,
      "learning_rate": 2.6115749195425994e-05,
      "loss": 1.1982,
      "num_input_tokens_seen": 43272924528,
      "step": 55001
    },
    {
      "epoch": 5.835136855506047,
      "grad_norm": 0.5981696116092158,
      "learning_rate": 2.611505491865076e-05,
      "loss": 1.1245,
      "num_input_tokens_seen": 43273711248,
      "step": 55002
    },
    {
      "epoch": 5.835242945045619,
      "grad_norm": 0.6805109890223994,
      "learning_rate": 2.6114360641013852e-05,
      "loss": 1.1071,
      "num_input_tokens_seen": 43274498016,
      "step": 55003
    },
    {
      "epoch": 5.83534903458519,
      "grad_norm": 0.6436512420839255,
      "learning_rate": 2.6113666362515797e-05,
      "loss": 1.258,
      "num_input_tokens_seen": 43275284752,
      "step": 55004
    },
    {
      "epoch": 5.835455124124762,
      "grad_norm": 0.6372560127762387,
      "learning_rate": 2.6112972083157133e-05,
      "loss": 1.1045,
      "num_input_tokens_seen": 43276071472,
      "step": 55005
    },
    {
      "epoch": 5.835561213664333,
      "grad_norm": 0.7607533754339427,
      "learning_rate": 2.6112277802938402e-05,
      "loss": 1.0964,
      "num_input_tokens_seen": 43276858256,
      "step": 55006
    },
    {
      "epoch": 5.835667303203904,
      "grad_norm": 0.5750355813205775,
      "learning_rate": 2.6111583521860132e-05,
      "loss": 1.1064,
      "num_input_tokens_seen": 43277645024,
      "step": 55007
    },
    {
      "epoch": 5.835773392743476,
      "grad_norm": 0.6410402121362134,
      "learning_rate": 2.611088923992286e-05,
      "loss": 1.1596,
      "num_input_tokens_seen": 43278431744,
      "step": 55008
    },
    {
      "epoch": 5.835879482283047,
      "grad_norm": 0.6554778786531084,
      "learning_rate": 2.6110194957127125e-05,
      "loss": 1.271,
      "num_input_tokens_seen": 43279218544,
      "step": 55009
    },
    {
      "epoch": 5.835985571822619,
      "grad_norm": 0.5738923598733471,
      "learning_rate": 2.610950067347347e-05,
      "loss": 1.044,
      "num_input_tokens_seen": 43280005344,
      "step": 55010
    },
    {
      "epoch": 5.83609166136219,
      "grad_norm": 0.6249241129174351,
      "learning_rate": 2.6108806388962415e-05,
      "loss": 1.0892,
      "num_input_tokens_seen": 43280792144,
      "step": 55011
    },
    {
      "epoch": 5.836197750901761,
      "grad_norm": 0.8112875385020244,
      "learning_rate": 2.610811210359452e-05,
      "loss": 1.2294,
      "num_input_tokens_seen": 43281578928,
      "step": 55012
    },
    {
      "epoch": 5.8363038404413325,
      "grad_norm": 0.7176616793986872,
      "learning_rate": 2.6107417817370294e-05,
      "loss": 1.1539,
      "num_input_tokens_seen": 43282365712,
      "step": 55013
    },
    {
      "epoch": 5.836409929980904,
      "grad_norm": 0.5685007223699706,
      "learning_rate": 2.6106723530290294e-05,
      "loss": 1.0083,
      "num_input_tokens_seen": 43283152496,
      "step": 55014
    },
    {
      "epoch": 5.8365160195204755,
      "grad_norm": 1.1659534432694731,
      "learning_rate": 2.6106029242355052e-05,
      "loss": 1.1334,
      "num_input_tokens_seen": 43283939216,
      "step": 55015
    },
    {
      "epoch": 5.8366221090600465,
      "grad_norm": 0.6988452620512119,
      "learning_rate": 2.610533495356511e-05,
      "loss": 1.2192,
      "num_input_tokens_seen": 43284726000,
      "step": 55016
    },
    {
      "epoch": 5.8367281985996184,
      "grad_norm": 0.6624781465416044,
      "learning_rate": 2.6104640663920982e-05,
      "loss": 1.1969,
      "num_input_tokens_seen": 43285512784,
      "step": 55017
    },
    {
      "epoch": 5.8368342881391895,
      "grad_norm": 0.7145351924023307,
      "learning_rate": 2.610394637342323e-05,
      "loss": 1.1867,
      "num_input_tokens_seen": 43286299520,
      "step": 55018
    },
    {
      "epoch": 5.8369403776787605,
      "grad_norm": 0.5573445356513708,
      "learning_rate": 2.6103252082072383e-05,
      "loss": 1.0996,
      "num_input_tokens_seen": 43287086352,
      "step": 55019
    },
    {
      "epoch": 5.837046467218332,
      "grad_norm": 0.5769188595220892,
      "learning_rate": 2.610255778986897e-05,
      "loss": 1.177,
      "num_input_tokens_seen": 43287873120,
      "step": 55020
    },
    {
      "epoch": 5.8371525567579035,
      "grad_norm": 0.6368214355154791,
      "learning_rate": 2.6101863496813535e-05,
      "loss": 1.1919,
      "num_input_tokens_seen": 43288659840,
      "step": 55021
    },
    {
      "epoch": 5.837258646297475,
      "grad_norm": 0.8250383698387453,
      "learning_rate": 2.6101169202906606e-05,
      "loss": 1.1045,
      "num_input_tokens_seen": 43289446720,
      "step": 55022
    },
    {
      "epoch": 5.837364735837046,
      "grad_norm": 0.7648180380330815,
      "learning_rate": 2.6100474908148737e-05,
      "loss": 1.2077,
      "num_input_tokens_seen": 43290233488,
      "step": 55023
    },
    {
      "epoch": 5.837470825376618,
      "grad_norm": 0.5707543655400616,
      "learning_rate": 2.6099780612540447e-05,
      "loss": 1.1595,
      "num_input_tokens_seen": 43291020320,
      "step": 55024
    },
    {
      "epoch": 5.837576914916189,
      "grad_norm": 0.6321289658394618,
      "learning_rate": 2.6099086316082278e-05,
      "loss": 1.1396,
      "num_input_tokens_seen": 43291806992,
      "step": 55025
    },
    {
      "epoch": 5.83768300445576,
      "grad_norm": 0.9268549744971631,
      "learning_rate": 2.609839201877477e-05,
      "loss": 1.1811,
      "num_input_tokens_seen": 43292593776,
      "step": 55026
    },
    {
      "epoch": 5.837789093995332,
      "grad_norm": 0.6996992278857314,
      "learning_rate": 2.6097697720618458e-05,
      "loss": 1.1167,
      "num_input_tokens_seen": 43293380640,
      "step": 55027
    },
    {
      "epoch": 5.837895183534903,
      "grad_norm": 1.1113891422722626,
      "learning_rate": 2.609700342161387e-05,
      "loss": 1.1017,
      "num_input_tokens_seen": 43294167440,
      "step": 55028
    },
    {
      "epoch": 5.838001273074475,
      "grad_norm": 0.5003136403186524,
      "learning_rate": 2.609630912176156e-05,
      "loss": 1.1247,
      "num_input_tokens_seen": 43294954160,
      "step": 55029
    },
    {
      "epoch": 5.838107362614046,
      "grad_norm": 0.7019013696765385,
      "learning_rate": 2.609561482106205e-05,
      "loss": 1.1153,
      "num_input_tokens_seen": 43295740976,
      "step": 55030
    },
    {
      "epoch": 5.838213452153617,
      "grad_norm": 0.709364974516117,
      "learning_rate": 2.6094920519515875e-05,
      "loss": 1.1453,
      "num_input_tokens_seen": 43296527744,
      "step": 55031
    },
    {
      "epoch": 5.838319541693189,
      "grad_norm": 0.6100060150027926,
      "learning_rate": 2.6094226217123587e-05,
      "loss": 1.1095,
      "num_input_tokens_seen": 43297314544,
      "step": 55032
    },
    {
      "epoch": 5.83842563123276,
      "grad_norm": 1.0147364555779341,
      "learning_rate": 2.6093531913885712e-05,
      "loss": 1.1816,
      "num_input_tokens_seen": 43298101344,
      "step": 55033
    },
    {
      "epoch": 5.838531720772332,
      "grad_norm": 0.8327267621947294,
      "learning_rate": 2.609283760980278e-05,
      "loss": 1.1749,
      "num_input_tokens_seen": 43298888112,
      "step": 55034
    },
    {
      "epoch": 5.838637810311903,
      "grad_norm": 0.6756422265350014,
      "learning_rate": 2.6092143304875338e-05,
      "loss": 1.1821,
      "num_input_tokens_seen": 43299674912,
      "step": 55035
    },
    {
      "epoch": 5.838743899851474,
      "grad_norm": 0.8932346823209898,
      "learning_rate": 2.609144899910393e-05,
      "loss": 1.1802,
      "num_input_tokens_seen": 43300461664,
      "step": 55036
    },
    {
      "epoch": 5.838849989391046,
      "grad_norm": 0.6104754085090087,
      "learning_rate": 2.6090754692489067e-05,
      "loss": 1.1272,
      "num_input_tokens_seen": 43301248416,
      "step": 55037
    },
    {
      "epoch": 5.838956078930617,
      "grad_norm": 0.7420514564447572,
      "learning_rate": 2.609006038503131e-05,
      "loss": 1.1901,
      "num_input_tokens_seen": 43302035200,
      "step": 55038
    },
    {
      "epoch": 5.839062168470189,
      "grad_norm": 0.7731598607614819,
      "learning_rate": 2.608936607673118e-05,
      "loss": 1.1841,
      "num_input_tokens_seen": 43302821920,
      "step": 55039
    },
    {
      "epoch": 5.83916825800976,
      "grad_norm": 0.6215976942940519,
      "learning_rate": 2.6088671767589223e-05,
      "loss": 1.1323,
      "num_input_tokens_seen": 43303608640,
      "step": 55040
    },
    {
      "epoch": 5.839274347549331,
      "grad_norm": 0.7041990005089055,
      "learning_rate": 2.6087977457605977e-05,
      "loss": 1.2092,
      "num_input_tokens_seen": 43304395408,
      "step": 55041
    },
    {
      "epoch": 5.839380437088903,
      "grad_norm": 0.864406111729641,
      "learning_rate": 2.6087283146781967e-05,
      "loss": 1.2123,
      "num_input_tokens_seen": 43305182192,
      "step": 55042
    },
    {
      "epoch": 5.839486526628474,
      "grad_norm": 0.730148811897608,
      "learning_rate": 2.608658883511774e-05,
      "loss": 1.1116,
      "num_input_tokens_seen": 43305968992,
      "step": 55043
    },
    {
      "epoch": 5.839592616168046,
      "grad_norm": 0.8465614650226275,
      "learning_rate": 2.6085894522613834e-05,
      "loss": 1.1925,
      "num_input_tokens_seen": 43306755776,
      "step": 55044
    },
    {
      "epoch": 5.839698705707617,
      "grad_norm": 0.5730213289855939,
      "learning_rate": 2.608520020927077e-05,
      "loss": 1.0615,
      "num_input_tokens_seen": 43307542544,
      "step": 55045
    },
    {
      "epoch": 5.839804795247189,
      "grad_norm": 0.6683867735430602,
      "learning_rate": 2.6084505895089102e-05,
      "loss": 1.1388,
      "num_input_tokens_seen": 43308329312,
      "step": 55046
    },
    {
      "epoch": 5.83991088478676,
      "grad_norm": 0.7898346105102055,
      "learning_rate": 2.608381158006936e-05,
      "loss": 1.085,
      "num_input_tokens_seen": 43309116000,
      "step": 55047
    },
    {
      "epoch": 5.840016974326331,
      "grad_norm": 0.7118056195896055,
      "learning_rate": 2.6083117264212074e-05,
      "loss": 1.1467,
      "num_input_tokens_seen": 43309902784,
      "step": 55048
    },
    {
      "epoch": 5.840123063865903,
      "grad_norm": 0.7035900873939602,
      "learning_rate": 2.6082422947517794e-05,
      "loss": 1.1391,
      "num_input_tokens_seen": 43310689536,
      "step": 55049
    },
    {
      "epoch": 5.840229153405474,
      "grad_norm": 0.8006106150566973,
      "learning_rate": 2.608172862998705e-05,
      "loss": 1.1465,
      "num_input_tokens_seen": 43311476224,
      "step": 55050
    },
    {
      "epoch": 5.840335242945046,
      "grad_norm": 0.8512132039940729,
      "learning_rate": 2.6081034311620368e-05,
      "loss": 1.1428,
      "num_input_tokens_seen": 43312263040,
      "step": 55051
    },
    {
      "epoch": 5.840441332484617,
      "grad_norm": 0.6035598013227611,
      "learning_rate": 2.60803399924183e-05,
      "loss": 1.0955,
      "num_input_tokens_seen": 43313049808,
      "step": 55052
    },
    {
      "epoch": 5.840547422024189,
      "grad_norm": 0.946060552991534,
      "learning_rate": 2.607964567238138e-05,
      "loss": 1.1146,
      "num_input_tokens_seen": 43313836640,
      "step": 55053
    },
    {
      "epoch": 5.84065351156376,
      "grad_norm": 0.7756251241008837,
      "learning_rate": 2.607895135151014e-05,
      "loss": 1.0879,
      "num_input_tokens_seen": 43314623488,
      "step": 55054
    },
    {
      "epoch": 5.840759601103331,
      "grad_norm": 0.6169937553052826,
      "learning_rate": 2.607825702980512e-05,
      "loss": 1.1507,
      "num_input_tokens_seen": 43315410336,
      "step": 55055
    },
    {
      "epoch": 5.840865690642903,
      "grad_norm": 0.758631575122566,
      "learning_rate": 2.6077562707266845e-05,
      "loss": 1.1498,
      "num_input_tokens_seen": 43316197072,
      "step": 55056
    },
    {
      "epoch": 5.840971780182474,
      "grad_norm": 0.6074646852257259,
      "learning_rate": 2.607686838389587e-05,
      "loss": 1.1422,
      "num_input_tokens_seen": 43316983776,
      "step": 55057
    },
    {
      "epoch": 5.841077869722046,
      "grad_norm": 0.6815648715781796,
      "learning_rate": 2.607617405969272e-05,
      "loss": 1.1657,
      "num_input_tokens_seen": 43317770480,
      "step": 55058
    },
    {
      "epoch": 5.841183959261617,
      "grad_norm": 0.6322282473622173,
      "learning_rate": 2.6075479734657937e-05,
      "loss": 1.1777,
      "num_input_tokens_seen": 43318557184,
      "step": 55059
    },
    {
      "epoch": 5.841290048801188,
      "grad_norm": 0.5405819149914923,
      "learning_rate": 2.607478540879205e-05,
      "loss": 1.138,
      "num_input_tokens_seen": 43319343936,
      "step": 55060
    },
    {
      "epoch": 5.84139613834076,
      "grad_norm": 0.6489170165996906,
      "learning_rate": 2.607409108209561e-05,
      "loss": 1.1442,
      "num_input_tokens_seen": 43320130720,
      "step": 55061
    },
    {
      "epoch": 5.841502227880331,
      "grad_norm": 0.554893115987978,
      "learning_rate": 2.607339675456913e-05,
      "loss": 1.152,
      "num_input_tokens_seen": 43320917392,
      "step": 55062
    },
    {
      "epoch": 5.841608317419903,
      "grad_norm": 0.6778854824275725,
      "learning_rate": 2.6072702426213163e-05,
      "loss": 1.1692,
      "num_input_tokens_seen": 43321704160,
      "step": 55063
    },
    {
      "epoch": 5.841714406959474,
      "grad_norm": 0.5632512718277011,
      "learning_rate": 2.607200809702825e-05,
      "loss": 1.0509,
      "num_input_tokens_seen": 43322490960,
      "step": 55064
    },
    {
      "epoch": 5.841820496499045,
      "grad_norm": 0.5788957248462512,
      "learning_rate": 2.607131376701492e-05,
      "loss": 1.1871,
      "num_input_tokens_seen": 43323277696,
      "step": 55065
    },
    {
      "epoch": 5.841926586038617,
      "grad_norm": 0.6622970730687513,
      "learning_rate": 2.6070619436173703e-05,
      "loss": 1.1971,
      "num_input_tokens_seen": 43324064448,
      "step": 55066
    },
    {
      "epoch": 5.842032675578188,
      "grad_norm": 0.7842904734536856,
      "learning_rate": 2.6069925104505154e-05,
      "loss": 1.1496,
      "num_input_tokens_seen": 43324851168,
      "step": 55067
    },
    {
      "epoch": 5.84213876511776,
      "grad_norm": 0.619960461321591,
      "learning_rate": 2.606923077200979e-05,
      "loss": 1.1865,
      "num_input_tokens_seen": 43325637904,
      "step": 55068
    },
    {
      "epoch": 5.842244854657331,
      "grad_norm": 0.8235086287147568,
      "learning_rate": 2.6068536438688156e-05,
      "loss": 1.1729,
      "num_input_tokens_seen": 43326424656,
      "step": 55069
    },
    {
      "epoch": 5.842350944196902,
      "grad_norm": 0.6220468565035778,
      "learning_rate": 2.6067842104540796e-05,
      "loss": 1.1953,
      "num_input_tokens_seen": 43327211376,
      "step": 55070
    },
    {
      "epoch": 5.842457033736474,
      "grad_norm": 0.7179510977857635,
      "learning_rate": 2.606714776956823e-05,
      "loss": 1.2218,
      "num_input_tokens_seen": 43327998208,
      "step": 55071
    },
    {
      "epoch": 5.842563123276045,
      "grad_norm": 0.7068333528617149,
      "learning_rate": 2.6066453433771003e-05,
      "loss": 1.2541,
      "num_input_tokens_seen": 43328785040,
      "step": 55072
    },
    {
      "epoch": 5.842669212815617,
      "grad_norm": 0.6348956968980564,
      "learning_rate": 2.6065759097149663e-05,
      "loss": 1.1385,
      "num_input_tokens_seen": 43329571696,
      "step": 55073
    },
    {
      "epoch": 5.842775302355188,
      "grad_norm": 0.6806842187821924,
      "learning_rate": 2.606506475970472e-05,
      "loss": 1.0847,
      "num_input_tokens_seen": 43330358464,
      "step": 55074
    },
    {
      "epoch": 5.8428813918947595,
      "grad_norm": 0.6705838309140645,
      "learning_rate": 2.606437042143674e-05,
      "loss": 1.163,
      "num_input_tokens_seen": 43331145152,
      "step": 55075
    },
    {
      "epoch": 5.8429874814343306,
      "grad_norm": 0.6391779585262676,
      "learning_rate": 2.6063676082346243e-05,
      "loss": 1.1899,
      "num_input_tokens_seen": 43331931968,
      "step": 55076
    },
    {
      "epoch": 5.843093570973902,
      "grad_norm": 0.7257376836968014,
      "learning_rate": 2.6062981742433762e-05,
      "loss": 1.141,
      "num_input_tokens_seen": 43332718720,
      "step": 55077
    },
    {
      "epoch": 5.8431996605134735,
      "grad_norm": 0.6468253515972544,
      "learning_rate": 2.6062287401699846e-05,
      "loss": 1.2459,
      "num_input_tokens_seen": 43333505424,
      "step": 55078
    },
    {
      "epoch": 5.8433057500530445,
      "grad_norm": 0.5918467614576169,
      "learning_rate": 2.6061593060145023e-05,
      "loss": 1.1691,
      "num_input_tokens_seen": 43334292176,
      "step": 55079
    },
    {
      "epoch": 5.8434118395926165,
      "grad_norm": 0.6470376270793547,
      "learning_rate": 2.6060898717769832e-05,
      "loss": 1.0685,
      "num_input_tokens_seen": 43335079024,
      "step": 55080
    },
    {
      "epoch": 5.8435179291321875,
      "grad_norm": 0.678518244784397,
      "learning_rate": 2.606020437457481e-05,
      "loss": 1.1298,
      "num_input_tokens_seen": 43335865792,
      "step": 55081
    },
    {
      "epoch": 5.843624018671759,
      "grad_norm": 0.8540546768017633,
      "learning_rate": 2.6059510030560492e-05,
      "loss": 1.1684,
      "num_input_tokens_seen": 43336652496,
      "step": 55082
    },
    {
      "epoch": 5.84373010821133,
      "grad_norm": 0.6146478828565769,
      "learning_rate": 2.6058815685727418e-05,
      "loss": 1.0482,
      "num_input_tokens_seen": 43337439312,
      "step": 55083
    },
    {
      "epoch": 5.8438361977509015,
      "grad_norm": 1.14500497077362,
      "learning_rate": 2.6058121340076123e-05,
      "loss": 1.1424,
      "num_input_tokens_seen": 43338226112,
      "step": 55084
    },
    {
      "epoch": 5.843942287290473,
      "grad_norm": 0.5945591357277703,
      "learning_rate": 2.6057426993607137e-05,
      "loss": 1.0721,
      "num_input_tokens_seen": 43339012944,
      "step": 55085
    },
    {
      "epoch": 5.844048376830044,
      "grad_norm": 0.7020586264082956,
      "learning_rate": 2.6056732646321008e-05,
      "loss": 1.2623,
      "num_input_tokens_seen": 43339799664,
      "step": 55086
    },
    {
      "epoch": 5.844154466369616,
      "grad_norm": 0.86580825461984,
      "learning_rate": 2.6056038298218268e-05,
      "loss": 1.0504,
      "num_input_tokens_seen": 43340586432,
      "step": 55087
    },
    {
      "epoch": 5.844260555909187,
      "grad_norm": 0.8045660321205109,
      "learning_rate": 2.6055343949299442e-05,
      "loss": 1.2074,
      "num_input_tokens_seen": 43341373152,
      "step": 55088
    },
    {
      "epoch": 5.844366645448758,
      "grad_norm": 0.6708960588177246,
      "learning_rate": 2.605464959956509e-05,
      "loss": 1.1852,
      "num_input_tokens_seen": 43342159904,
      "step": 55089
    },
    {
      "epoch": 5.84447273498833,
      "grad_norm": 0.8668686332014913,
      "learning_rate": 2.605395524901573e-05,
      "loss": 1.1468,
      "num_input_tokens_seen": 43342946640,
      "step": 55090
    },
    {
      "epoch": 5.844578824527901,
      "grad_norm": 0.6806787888933706,
      "learning_rate": 2.6053260897651905e-05,
      "loss": 1.1939,
      "num_input_tokens_seen": 43343733328,
      "step": 55091
    },
    {
      "epoch": 5.844684914067473,
      "grad_norm": 0.7435090885011594,
      "learning_rate": 2.6052566545474157e-05,
      "loss": 1.1577,
      "num_input_tokens_seen": 43344520016,
      "step": 55092
    },
    {
      "epoch": 5.844791003607044,
      "grad_norm": 0.7355887401423352,
      "learning_rate": 2.6051872192483006e-05,
      "loss": 1.189,
      "num_input_tokens_seen": 43345306880,
      "step": 55093
    },
    {
      "epoch": 5.844897093146615,
      "grad_norm": 0.7882536710325022,
      "learning_rate": 2.6051177838679003e-05,
      "loss": 1.1275,
      "num_input_tokens_seen": 43346093664,
      "step": 55094
    },
    {
      "epoch": 5.845003182686187,
      "grad_norm": 0.7217693161624249,
      "learning_rate": 2.605048348406268e-05,
      "loss": 1.1419,
      "num_input_tokens_seen": 43346880448,
      "step": 55095
    },
    {
      "epoch": 5.845109272225758,
      "grad_norm": 0.7777706906607541,
      "learning_rate": 2.6049789128634583e-05,
      "loss": 1.201,
      "num_input_tokens_seen": 43347667216,
      "step": 55096
    },
    {
      "epoch": 5.84521536176533,
      "grad_norm": 0.7523972138383862,
      "learning_rate": 2.6049094772395228e-05,
      "loss": 1.1956,
      "num_input_tokens_seen": 43348453968,
      "step": 55097
    },
    {
      "epoch": 5.845321451304901,
      "grad_norm": 0.5843691438009854,
      "learning_rate": 2.604840041534517e-05,
      "loss": 1.0612,
      "num_input_tokens_seen": 43349240800,
      "step": 55098
    },
    {
      "epoch": 5.845427540844472,
      "grad_norm": 0.5983466793217482,
      "learning_rate": 2.6047706057484932e-05,
      "loss": 1.1798,
      "num_input_tokens_seen": 43350027488,
      "step": 55099
    },
    {
      "epoch": 5.845533630384044,
      "grad_norm": 0.5918773688604714,
      "learning_rate": 2.604701169881506e-05,
      "loss": 1.1796,
      "num_input_tokens_seen": 43350814304,
      "step": 55100
    },
    {
      "epoch": 5.845639719923615,
      "grad_norm": 0.6923717716301693,
      "learning_rate": 2.6046317339336094e-05,
      "loss": 1.2474,
      "num_input_tokens_seen": 43351601040,
      "step": 55101
    },
    {
      "epoch": 5.845745809463187,
      "grad_norm": 0.861893588750638,
      "learning_rate": 2.6045622979048555e-05,
      "loss": 1.2523,
      "num_input_tokens_seen": 43352387808,
      "step": 55102
    },
    {
      "epoch": 5.845851899002758,
      "grad_norm": 0.7472924637565763,
      "learning_rate": 2.6044928617953e-05,
      "loss": 1.2363,
      "num_input_tokens_seen": 43353174480,
      "step": 55103
    },
    {
      "epoch": 5.84595798854233,
      "grad_norm": 0.7442723855450728,
      "learning_rate": 2.6044234256049956e-05,
      "loss": 1.16,
      "num_input_tokens_seen": 43353961408,
      "step": 55104
    },
    {
      "epoch": 5.846064078081901,
      "grad_norm": 0.8625412623048831,
      "learning_rate": 2.6043539893339946e-05,
      "loss": 1.0698,
      "num_input_tokens_seen": 43354748224,
      "step": 55105
    },
    {
      "epoch": 5.846170167621473,
      "grad_norm": 0.6750537687126179,
      "learning_rate": 2.6042845529823524e-05,
      "loss": 1.1298,
      "num_input_tokens_seen": 43355535008,
      "step": 55106
    },
    {
      "epoch": 5.846276257161044,
      "grad_norm": 0.8663149637013299,
      "learning_rate": 2.6042151165501228e-05,
      "loss": 1.1497,
      "num_input_tokens_seen": 43356321760,
      "step": 55107
    },
    {
      "epoch": 5.846382346700615,
      "grad_norm": 0.919919467386301,
      "learning_rate": 2.6041456800373576e-05,
      "loss": 1.1723,
      "num_input_tokens_seen": 43357108528,
      "step": 55108
    },
    {
      "epoch": 5.846488436240187,
      "grad_norm": 0.6932547142250771,
      "learning_rate": 2.6040762434441124e-05,
      "loss": 1.1706,
      "num_input_tokens_seen": 43357895280,
      "step": 55109
    },
    {
      "epoch": 5.846594525779758,
      "grad_norm": 0.655433837858694,
      "learning_rate": 2.6040068067704398e-05,
      "loss": 1.1311,
      "num_input_tokens_seen": 43358681968,
      "step": 55110
    },
    {
      "epoch": 5.84670061531933,
      "grad_norm": 0.7876902209630453,
      "learning_rate": 2.603937370016394e-05,
      "loss": 1.1807,
      "num_input_tokens_seen": 43359468704,
      "step": 55111
    },
    {
      "epoch": 5.846806704858901,
      "grad_norm": 1.0742516805174418,
      "learning_rate": 2.6038679331820286e-05,
      "loss": 1.2467,
      "num_input_tokens_seen": 43360255488,
      "step": 55112
    },
    {
      "epoch": 5.846912794398472,
      "grad_norm": 0.7779746655953914,
      "learning_rate": 2.603798496267397e-05,
      "loss": 1.0762,
      "num_input_tokens_seen": 43361042224,
      "step": 55113
    },
    {
      "epoch": 5.847018883938044,
      "grad_norm": 0.7781840531006986,
      "learning_rate": 2.6037290592725533e-05,
      "loss": 1.2557,
      "num_input_tokens_seen": 43361829040,
      "step": 55114
    },
    {
      "epoch": 5.847124973477615,
      "grad_norm": 0.6629293951889484,
      "learning_rate": 2.6036596221975507e-05,
      "loss": 1.1206,
      "num_input_tokens_seen": 43362615808,
      "step": 55115
    },
    {
      "epoch": 5.847231063017187,
      "grad_norm": 0.6514993482130921,
      "learning_rate": 2.6035901850424425e-05,
      "loss": 1.1839,
      "num_input_tokens_seen": 43363402512,
      "step": 55116
    },
    {
      "epoch": 5.847337152556758,
      "grad_norm": 0.5911564252734096,
      "learning_rate": 2.6035207478072833e-05,
      "loss": 1.0981,
      "num_input_tokens_seen": 43364189360,
      "step": 55117
    },
    {
      "epoch": 5.847443242096329,
      "grad_norm": 0.5830766709161329,
      "learning_rate": 2.603451310492126e-05,
      "loss": 1.1992,
      "num_input_tokens_seen": 43364976080,
      "step": 55118
    },
    {
      "epoch": 5.847549331635901,
      "grad_norm": 0.5855290601982149,
      "learning_rate": 2.603381873097025e-05,
      "loss": 1.092,
      "num_input_tokens_seen": 43365762944,
      "step": 55119
    },
    {
      "epoch": 5.847655421175472,
      "grad_norm": 1.0025723626880152,
      "learning_rate": 2.6033124356220328e-05,
      "loss": 1.1541,
      "num_input_tokens_seen": 43366549680,
      "step": 55120
    },
    {
      "epoch": 5.847761510715044,
      "grad_norm": 0.5763904996872161,
      "learning_rate": 2.6032429980672047e-05,
      "loss": 1.208,
      "num_input_tokens_seen": 43367336448,
      "step": 55121
    },
    {
      "epoch": 5.847867600254615,
      "grad_norm": 0.787020736499057,
      "learning_rate": 2.6031735604325928e-05,
      "loss": 1.2177,
      "num_input_tokens_seen": 43368123232,
      "step": 55122
    },
    {
      "epoch": 5.847973689794186,
      "grad_norm": 0.9605607504742165,
      "learning_rate": 2.6031041227182518e-05,
      "loss": 1.1963,
      "num_input_tokens_seen": 43368910000,
      "step": 55123
    },
    {
      "epoch": 5.848079779333758,
      "grad_norm": 0.582296733511366,
      "learning_rate": 2.6030346849242348e-05,
      "loss": 1.1986,
      "num_input_tokens_seen": 43369696688,
      "step": 55124
    },
    {
      "epoch": 5.848185868873329,
      "grad_norm": 0.9621086299376113,
      "learning_rate": 2.602965247050595e-05,
      "loss": 1.0421,
      "num_input_tokens_seen": 43370483488,
      "step": 55125
    },
    {
      "epoch": 5.848291958412901,
      "grad_norm": 0.8248012241761318,
      "learning_rate": 2.6028958090973876e-05,
      "loss": 1.2316,
      "num_input_tokens_seen": 43371270192,
      "step": 55126
    },
    {
      "epoch": 5.848398047952472,
      "grad_norm": 0.7258724704990318,
      "learning_rate": 2.602826371064665e-05,
      "loss": 1.0613,
      "num_input_tokens_seen": 43372057024,
      "step": 55127
    },
    {
      "epoch": 5.848504137492043,
      "grad_norm": 1.3140049260972697,
      "learning_rate": 2.602756932952481e-05,
      "loss": 1.1705,
      "num_input_tokens_seen": 43372843728,
      "step": 55128
    },
    {
      "epoch": 5.848610227031615,
      "grad_norm": 0.885533285046063,
      "learning_rate": 2.60268749476089e-05,
      "loss": 1.1815,
      "num_input_tokens_seen": 43373630544,
      "step": 55129
    },
    {
      "epoch": 5.848716316571186,
      "grad_norm": 1.094352456467742,
      "learning_rate": 2.602618056489945e-05,
      "loss": 1.1184,
      "num_input_tokens_seen": 43374417376,
      "step": 55130
    },
    {
      "epoch": 5.848822406110758,
      "grad_norm": 1.3122328372691288,
      "learning_rate": 2.602548618139699e-05,
      "loss": 1.2099,
      "num_input_tokens_seen": 43375204112,
      "step": 55131
    },
    {
      "epoch": 5.848928495650329,
      "grad_norm": 0.8644598176105723,
      "learning_rate": 2.602479179710207e-05,
      "loss": 1.1538,
      "num_input_tokens_seen": 43375990848,
      "step": 55132
    },
    {
      "epoch": 5.849034585189901,
      "grad_norm": 0.9350996288620606,
      "learning_rate": 2.6024097412015225e-05,
      "loss": 1.1481,
      "num_input_tokens_seen": 43376777600,
      "step": 55133
    },
    {
      "epoch": 5.849140674729472,
      "grad_norm": 0.9988289747731335,
      "learning_rate": 2.6023403026136977e-05,
      "loss": 1.1931,
      "num_input_tokens_seen": 43377564352,
      "step": 55134
    },
    {
      "epoch": 5.8492467642690436,
      "grad_norm": 0.8116937510684019,
      "learning_rate": 2.602270863946788e-05,
      "loss": 1.0706,
      "num_input_tokens_seen": 43378351168,
      "step": 55135
    },
    {
      "epoch": 5.849352853808615,
      "grad_norm": 0.8470904555748329,
      "learning_rate": 2.6022014252008464e-05,
      "loss": 1.2136,
      "num_input_tokens_seen": 43379138000,
      "step": 55136
    },
    {
      "epoch": 5.849458943348186,
      "grad_norm": 1.0849215201657096,
      "learning_rate": 2.6021319863759262e-05,
      "loss": 1.2055,
      "num_input_tokens_seen": 43379924656,
      "step": 55137
    },
    {
      "epoch": 5.8495650328877575,
      "grad_norm": 0.8039478628553808,
      "learning_rate": 2.6020625474720823e-05,
      "loss": 1.0767,
      "num_input_tokens_seen": 43380711440,
      "step": 55138
    },
    {
      "epoch": 5.849671122427329,
      "grad_norm": 0.7460901067284349,
      "learning_rate": 2.6019931084893667e-05,
      "loss": 1.1667,
      "num_input_tokens_seen": 43381498272,
      "step": 55139
    },
    {
      "epoch": 5.8497772119669005,
      "grad_norm": 1.1943710629029076,
      "learning_rate": 2.6019236694278336e-05,
      "loss": 1.2195,
      "num_input_tokens_seen": 43382285024,
      "step": 55140
    },
    {
      "epoch": 5.8498833015064715,
      "grad_norm": 0.9229582777951891,
      "learning_rate": 2.6018542302875377e-05,
      "loss": 1.2505,
      "num_input_tokens_seen": 43383071664,
      "step": 55141
    },
    {
      "epoch": 5.8499893910460425,
      "grad_norm": 0.5874985863224076,
      "learning_rate": 2.6017847910685307e-05,
      "loss": 1.1754,
      "num_input_tokens_seen": 43383858448,
      "step": 55142
    },
    {
      "epoch": 5.8500954805856145,
      "grad_norm": 0.8907719065921489,
      "learning_rate": 2.6017153517708682e-05,
      "loss": 1.1173,
      "num_input_tokens_seen": 43384645232,
      "step": 55143
    },
    {
      "epoch": 5.8502015701251855,
      "grad_norm": 1.0902211716402235,
      "learning_rate": 2.6016459123946028e-05,
      "loss": 1.1065,
      "num_input_tokens_seen": 43385432048,
      "step": 55144
    },
    {
      "epoch": 5.850307659664757,
      "grad_norm": 0.6626025000695412,
      "learning_rate": 2.6015764729397883e-05,
      "loss": 1.0832,
      "num_input_tokens_seen": 43386218816,
      "step": 55145
    },
    {
      "epoch": 5.850413749204328,
      "grad_norm": 0.8119353334677082,
      "learning_rate": 2.601507033406479e-05,
      "loss": 1.1348,
      "num_input_tokens_seen": 43387005600,
      "step": 55146
    },
    {
      "epoch": 5.8505198387438995,
      "grad_norm": 1.3259772456023255,
      "learning_rate": 2.6014375937947278e-05,
      "loss": 1.0875,
      "num_input_tokens_seen": 43387792384,
      "step": 55147
    },
    {
      "epoch": 5.850625928283471,
      "grad_norm": 1.058393746546284,
      "learning_rate": 2.6013681541045886e-05,
      "loss": 1.1391,
      "num_input_tokens_seen": 43388579216,
      "step": 55148
    },
    {
      "epoch": 5.850732017823042,
      "grad_norm": 1.1943070817328159,
      "learning_rate": 2.601298714336115e-05,
      "loss": 1.1433,
      "num_input_tokens_seen": 43389366048,
      "step": 55149
    },
    {
      "epoch": 5.850838107362614,
      "grad_norm": 0.9641253894631291,
      "learning_rate": 2.6012292744893608e-05,
      "loss": 1.077,
      "num_input_tokens_seen": 43390152880,
      "step": 55150
    },
    {
      "epoch": 5.850944196902185,
      "grad_norm": 0.8015603913077733,
      "learning_rate": 2.6011598345643796e-05,
      "loss": 1.1786,
      "num_input_tokens_seen": 43390939664,
      "step": 55151
    },
    {
      "epoch": 5.851050286441756,
      "grad_norm": 0.8127152807951806,
      "learning_rate": 2.6010903945612248e-05,
      "loss": 1.1153,
      "num_input_tokens_seen": 43391726432,
      "step": 55152
    },
    {
      "epoch": 5.851156375981328,
      "grad_norm": 0.9171550894530736,
      "learning_rate": 2.6010209544799508e-05,
      "loss": 1.1541,
      "num_input_tokens_seen": 43392513264,
      "step": 55153
    },
    {
      "epoch": 5.851262465520899,
      "grad_norm": 0.6661325674193148,
      "learning_rate": 2.60095151432061e-05,
      "loss": 1.1288,
      "num_input_tokens_seen": 43393300064,
      "step": 55154
    },
    {
      "epoch": 5.851368555060471,
      "grad_norm": 0.7302278720364285,
      "learning_rate": 2.6008820740832575e-05,
      "loss": 1.1373,
      "num_input_tokens_seen": 43394086944,
      "step": 55155
    },
    {
      "epoch": 5.851474644600042,
      "grad_norm": 0.7506680821304051,
      "learning_rate": 2.6008126337679463e-05,
      "loss": 1.1258,
      "num_input_tokens_seen": 43394873680,
      "step": 55156
    },
    {
      "epoch": 5.851580734139614,
      "grad_norm": 0.9796416461629321,
      "learning_rate": 2.600743193374729e-05,
      "loss": 1.0638,
      "num_input_tokens_seen": 43395660480,
      "step": 55157
    },
    {
      "epoch": 5.851686823679185,
      "grad_norm": 0.8458844255111887,
      "learning_rate": 2.6006737529036613e-05,
      "loss": 1.2293,
      "num_input_tokens_seen": 43396447264,
      "step": 55158
    },
    {
      "epoch": 5.851792913218756,
      "grad_norm": 0.8092976972569201,
      "learning_rate": 2.6006043123547957e-05,
      "loss": 1.1651,
      "num_input_tokens_seen": 43397234048,
      "step": 55159
    },
    {
      "epoch": 5.851899002758328,
      "grad_norm": 1.021117354614431,
      "learning_rate": 2.6005348717281856e-05,
      "loss": 1.2308,
      "num_input_tokens_seen": 43398020752,
      "step": 55160
    },
    {
      "epoch": 5.852005092297899,
      "grad_norm": 0.6895758994516467,
      "learning_rate": 2.6004654310238864e-05,
      "loss": 1.0874,
      "num_input_tokens_seen": 43398807664,
      "step": 55161
    },
    {
      "epoch": 5.852111181837471,
      "grad_norm": 0.7759611352628607,
      "learning_rate": 2.6003959902419495e-05,
      "loss": 1.1396,
      "num_input_tokens_seen": 43399594416,
      "step": 55162
    },
    {
      "epoch": 5.852217271377042,
      "grad_norm": 0.8829052889184879,
      "learning_rate": 2.600326549382429e-05,
      "loss": 1.1186,
      "num_input_tokens_seen": 43400381216,
      "step": 55163
    },
    {
      "epoch": 5.852323360916614,
      "grad_norm": 0.6803493129469181,
      "learning_rate": 2.6002571084453804e-05,
      "loss": 1.0822,
      "num_input_tokens_seen": 43401167968,
      "step": 55164
    },
    {
      "epoch": 5.852429450456185,
      "grad_norm": 0.655993818633056,
      "learning_rate": 2.6001876674308557e-05,
      "loss": 1.1655,
      "num_input_tokens_seen": 43401954784,
      "step": 55165
    },
    {
      "epoch": 5.852535539995756,
      "grad_norm": 0.9562832737597868,
      "learning_rate": 2.6001182263389078e-05,
      "loss": 1.1222,
      "num_input_tokens_seen": 43402741632,
      "step": 55166
    },
    {
      "epoch": 5.852641629535328,
      "grad_norm": 0.8449419398071927,
      "learning_rate": 2.6000487851695925e-05,
      "loss": 1.2016,
      "num_input_tokens_seen": 43403528384,
      "step": 55167
    },
    {
      "epoch": 5.852747719074899,
      "grad_norm": 1.4178947055660094,
      "learning_rate": 2.5999793439229625e-05,
      "loss": 1.1607,
      "num_input_tokens_seen": 43404315056,
      "step": 55168
    },
    {
      "epoch": 5.852853808614471,
      "grad_norm": 1.1185760061754773,
      "learning_rate": 2.599909902599071e-05,
      "loss": 1.1441,
      "num_input_tokens_seen": 43405101744,
      "step": 55169
    },
    {
      "epoch": 5.852959898154042,
      "grad_norm": 0.6300609481361762,
      "learning_rate": 2.599840461197972e-05,
      "loss": 1.1653,
      "num_input_tokens_seen": 43405888512,
      "step": 55170
    },
    {
      "epoch": 5.853065987693613,
      "grad_norm": 0.7562336629063808,
      "learning_rate": 2.5997710197197196e-05,
      "loss": 1.1173,
      "num_input_tokens_seen": 43406675344,
      "step": 55171
    },
    {
      "epoch": 5.853172077233185,
      "grad_norm": 1.126284697483781,
      "learning_rate": 2.599701578164367e-05,
      "loss": 1.1811,
      "num_input_tokens_seen": 43407462032,
      "step": 55172
    },
    {
      "epoch": 5.853278166772756,
      "grad_norm": 0.7196573913329637,
      "learning_rate": 2.5996321365319677e-05,
      "loss": 1.1882,
      "num_input_tokens_seen": 43408248960,
      "step": 55173
    },
    {
      "epoch": 5.853384256312328,
      "grad_norm": 0.7579893219313373,
      "learning_rate": 2.5995626948225754e-05,
      "loss": 1.1973,
      "num_input_tokens_seen": 43409035728,
      "step": 55174
    },
    {
      "epoch": 5.853490345851899,
      "grad_norm": 0.7396490366323036,
      "learning_rate": 2.599493253036244e-05,
      "loss": 1.1453,
      "num_input_tokens_seen": 43409822544,
      "step": 55175
    },
    {
      "epoch": 5.85359643539147,
      "grad_norm": 0.705363005588444,
      "learning_rate": 2.599423811173028e-05,
      "loss": 1.2344,
      "num_input_tokens_seen": 43410609248,
      "step": 55176
    },
    {
      "epoch": 5.853702524931042,
      "grad_norm": 0.9363914606110001,
      "learning_rate": 2.599354369232979e-05,
      "loss": 1.2317,
      "num_input_tokens_seen": 43411395984,
      "step": 55177
    },
    {
      "epoch": 5.853808614470613,
      "grad_norm": 0.6342302406190681,
      "learning_rate": 2.599284927216153e-05,
      "loss": 1.2023,
      "num_input_tokens_seen": 43412182656,
      "step": 55178
    },
    {
      "epoch": 5.853914704010185,
      "grad_norm": 0.9044045054373512,
      "learning_rate": 2.5992154851226024e-05,
      "loss": 1.124,
      "num_input_tokens_seen": 43412969456,
      "step": 55179
    },
    {
      "epoch": 5.854020793549756,
      "grad_norm": 0.6773797954515073,
      "learning_rate": 2.59914604295238e-05,
      "loss": 1.1679,
      "num_input_tokens_seen": 43413756240,
      "step": 55180
    },
    {
      "epoch": 5.854126883089327,
      "grad_norm": 0.7497891596331245,
      "learning_rate": 2.599076600705541e-05,
      "loss": 1.2481,
      "num_input_tokens_seen": 43414543072,
      "step": 55181
    },
    {
      "epoch": 5.854232972628899,
      "grad_norm": 0.611779881009565,
      "learning_rate": 2.599007158382139e-05,
      "loss": 1.1571,
      "num_input_tokens_seen": 43415329808,
      "step": 55182
    },
    {
      "epoch": 5.85433906216847,
      "grad_norm": 0.7679819648278445,
      "learning_rate": 2.5989377159822265e-05,
      "loss": 1.0706,
      "num_input_tokens_seen": 43416116704,
      "step": 55183
    },
    {
      "epoch": 5.854445151708042,
      "grad_norm": 0.6890984964198839,
      "learning_rate": 2.5988682735058585e-05,
      "loss": 1.1893,
      "num_input_tokens_seen": 43416903520,
      "step": 55184
    },
    {
      "epoch": 5.854551241247613,
      "grad_norm": 0.7024859212149587,
      "learning_rate": 2.598798830953087e-05,
      "loss": 1.2556,
      "num_input_tokens_seen": 43417690272,
      "step": 55185
    },
    {
      "epoch": 5.854657330787185,
      "grad_norm": 0.7318485573635474,
      "learning_rate": 2.598729388323967e-05,
      "loss": 1.1691,
      "num_input_tokens_seen": 43418477008,
      "step": 55186
    },
    {
      "epoch": 5.854763420326756,
      "grad_norm": 0.6915658014378427,
      "learning_rate": 2.598659945618552e-05,
      "loss": 1.1365,
      "num_input_tokens_seen": 43419263744,
      "step": 55187
    },
    {
      "epoch": 5.854869509866327,
      "grad_norm": 0.5838699258712091,
      "learning_rate": 2.5985905028368958e-05,
      "loss": 1.126,
      "num_input_tokens_seen": 43420050576,
      "step": 55188
    },
    {
      "epoch": 5.854975599405899,
      "grad_norm": 0.734956447497815,
      "learning_rate": 2.5985210599790515e-05,
      "loss": 1.1514,
      "num_input_tokens_seen": 43420837248,
      "step": 55189
    },
    {
      "epoch": 5.85508168894547,
      "grad_norm": 0.6839714835071179,
      "learning_rate": 2.5984516170450736e-05,
      "loss": 1.1975,
      "num_input_tokens_seen": 43421624000,
      "step": 55190
    },
    {
      "epoch": 5.855187778485042,
      "grad_norm": 0.7228291620646699,
      "learning_rate": 2.5983821740350138e-05,
      "loss": 1.104,
      "num_input_tokens_seen": 43422410832,
      "step": 55191
    },
    {
      "epoch": 5.855293868024613,
      "grad_norm": 0.7010437864906955,
      "learning_rate": 2.598312730948928e-05,
      "loss": 1.1214,
      "num_input_tokens_seen": 43423197504,
      "step": 55192
    },
    {
      "epoch": 5.855399957564185,
      "grad_norm": 0.7099717893452298,
      "learning_rate": 2.5982432877868695e-05,
      "loss": 1.0303,
      "num_input_tokens_seen": 43423984304,
      "step": 55193
    },
    {
      "epoch": 5.855506047103756,
      "grad_norm": 0.5685581502595015,
      "learning_rate": 2.59817384454889e-05,
      "loss": 1.1033,
      "num_input_tokens_seen": 43424771072,
      "step": 55194
    },
    {
      "epoch": 5.855612136643327,
      "grad_norm": 0.6660055832120044,
      "learning_rate": 2.598104401235046e-05,
      "loss": 1.104,
      "num_input_tokens_seen": 43425557840,
      "step": 55195
    },
    {
      "epoch": 5.855718226182899,
      "grad_norm": 0.6097478851942124,
      "learning_rate": 2.5980349578453894e-05,
      "loss": 1.1635,
      "num_input_tokens_seen": 43426344592,
      "step": 55196
    },
    {
      "epoch": 5.85582431572247,
      "grad_norm": 0.668389166878234,
      "learning_rate": 2.597965514379974e-05,
      "loss": 1.0847,
      "num_input_tokens_seen": 43427131312,
      "step": 55197
    },
    {
      "epoch": 5.855930405262042,
      "grad_norm": 0.7306135527284785,
      "learning_rate": 2.5978960708388538e-05,
      "loss": 1.1833,
      "num_input_tokens_seen": 43427918032,
      "step": 55198
    },
    {
      "epoch": 5.856036494801613,
      "grad_norm": 0.8077156992336342,
      "learning_rate": 2.597826627222083e-05,
      "loss": 1.1322,
      "num_input_tokens_seen": 43428704768,
      "step": 55199
    },
    {
      "epoch": 5.856142584341184,
      "grad_norm": 0.6827347427455793,
      "learning_rate": 2.5977571835297137e-05,
      "loss": 1.1289,
      "num_input_tokens_seen": 43429491488,
      "step": 55200
    },
    {
      "epoch": 5.8562486738807555,
      "grad_norm": 0.6788936956395348,
      "learning_rate": 2.597687739761801e-05,
      "loss": 1.0688,
      "num_input_tokens_seen": 43430278224,
      "step": 55201
    },
    {
      "epoch": 5.856354763420327,
      "grad_norm": 0.696206772232394,
      "learning_rate": 2.597618295918398e-05,
      "loss": 1.2128,
      "num_input_tokens_seen": 43431065024,
      "step": 55202
    },
    {
      "epoch": 5.8564608529598985,
      "grad_norm": 1.0388631598079119,
      "learning_rate": 2.597548851999559e-05,
      "loss": 1.1606,
      "num_input_tokens_seen": 43431851824,
      "step": 55203
    },
    {
      "epoch": 5.8565669424994695,
      "grad_norm": 0.7596790038801419,
      "learning_rate": 2.597479408005336e-05,
      "loss": 1.1156,
      "num_input_tokens_seen": 43432638576,
      "step": 55204
    },
    {
      "epoch": 5.8566730320390405,
      "grad_norm": 0.6291184640768889,
      "learning_rate": 2.5974099639357846e-05,
      "loss": 1.106,
      "num_input_tokens_seen": 43433425392,
      "step": 55205
    },
    {
      "epoch": 5.8567791215786125,
      "grad_norm": 0.8076261445492968,
      "learning_rate": 2.5973405197909568e-05,
      "loss": 1.1054,
      "num_input_tokens_seen": 43434212160,
      "step": 55206
    },
    {
      "epoch": 5.8568852111181835,
      "grad_norm": 0.6639530184174898,
      "learning_rate": 2.5972710755709077e-05,
      "loss": 1.142,
      "num_input_tokens_seen": 43434998944,
      "step": 55207
    },
    {
      "epoch": 5.856991300657755,
      "grad_norm": 0.6502341298128189,
      "learning_rate": 2.597201631275691e-05,
      "loss": 1.1519,
      "num_input_tokens_seen": 43435785632,
      "step": 55208
    },
    {
      "epoch": 5.8570973901973264,
      "grad_norm": 0.6330063051684736,
      "learning_rate": 2.597132186905359e-05,
      "loss": 1.1017,
      "num_input_tokens_seen": 43436572416,
      "step": 55209
    },
    {
      "epoch": 5.8572034797368975,
      "grad_norm": 0.6506182807551727,
      "learning_rate": 2.5970627424599658e-05,
      "loss": 1.1115,
      "num_input_tokens_seen": 43437359184,
      "step": 55210
    },
    {
      "epoch": 5.857309569276469,
      "grad_norm": 0.7822261526247705,
      "learning_rate": 2.596993297939566e-05,
      "loss": 1.1597,
      "num_input_tokens_seen": 43438145856,
      "step": 55211
    },
    {
      "epoch": 5.85741565881604,
      "grad_norm": 0.6867143435032903,
      "learning_rate": 2.5969238533442125e-05,
      "loss": 1.1477,
      "num_input_tokens_seen": 43438932656,
      "step": 55212
    },
    {
      "epoch": 5.857521748355612,
      "grad_norm": 0.8055299019353499,
      "learning_rate": 2.5968544086739586e-05,
      "loss": 1.221,
      "num_input_tokens_seen": 43439719344,
      "step": 55213
    },
    {
      "epoch": 5.857627837895183,
      "grad_norm": 0.8020392683736093,
      "learning_rate": 2.596784963928859e-05,
      "loss": 1.2722,
      "num_input_tokens_seen": 43440506016,
      "step": 55214
    },
    {
      "epoch": 5.857733927434755,
      "grad_norm": 0.7192153815761362,
      "learning_rate": 2.5967155191089672e-05,
      "loss": 1.0949,
      "num_input_tokens_seen": 43441292832,
      "step": 55215
    },
    {
      "epoch": 5.857840016974326,
      "grad_norm": 0.7171482900960361,
      "learning_rate": 2.5966460742143357e-05,
      "loss": 1.0647,
      "num_input_tokens_seen": 43442079616,
      "step": 55216
    },
    {
      "epoch": 5.857946106513897,
      "grad_norm": 0.7275407935102159,
      "learning_rate": 2.596576629245019e-05,
      "loss": 1.1887,
      "num_input_tokens_seen": 43442866304,
      "step": 55217
    },
    {
      "epoch": 5.858052196053469,
      "grad_norm": 0.6842389660434488,
      "learning_rate": 2.5965071842010706e-05,
      "loss": 1.1117,
      "num_input_tokens_seen": 43443653008,
      "step": 55218
    },
    {
      "epoch": 5.85815828559304,
      "grad_norm": 0.7722614567519732,
      "learning_rate": 2.596437739082545e-05,
      "loss": 1.1813,
      "num_input_tokens_seen": 43444439776,
      "step": 55219
    },
    {
      "epoch": 5.858264375132612,
      "grad_norm": 0.7910044018840844,
      "learning_rate": 2.5963682938894945e-05,
      "loss": 1.0913,
      "num_input_tokens_seen": 43445226656,
      "step": 55220
    },
    {
      "epoch": 5.858370464672183,
      "grad_norm": 0.6661675750551064,
      "learning_rate": 2.596298848621974e-05,
      "loss": 1.2388,
      "num_input_tokens_seen": 43446013408,
      "step": 55221
    },
    {
      "epoch": 5.858476554211755,
      "grad_norm": 0.856495334348536,
      "learning_rate": 2.596229403280036e-05,
      "loss": 1.1882,
      "num_input_tokens_seen": 43446800240,
      "step": 55222
    },
    {
      "epoch": 5.858582643751326,
      "grad_norm": 0.590177381306285,
      "learning_rate": 2.5961599578637347e-05,
      "loss": 1.1773,
      "num_input_tokens_seen": 43447587040,
      "step": 55223
    },
    {
      "epoch": 5.858688733290897,
      "grad_norm": 0.6803533365041103,
      "learning_rate": 2.5960905123731244e-05,
      "loss": 1.1845,
      "num_input_tokens_seen": 43448373760,
      "step": 55224
    },
    {
      "epoch": 5.858794822830469,
      "grad_norm": 0.6002255332439037,
      "learning_rate": 2.596021066808258e-05,
      "loss": 1.1614,
      "num_input_tokens_seen": 43449160528,
      "step": 55225
    },
    {
      "epoch": 5.85890091237004,
      "grad_norm": 0.7024149944217755,
      "learning_rate": 2.5959516211691892e-05,
      "loss": 1.165,
      "num_input_tokens_seen": 43449947312,
      "step": 55226
    },
    {
      "epoch": 5.859007001909612,
      "grad_norm": 0.542788857305826,
      "learning_rate": 2.5958821754559715e-05,
      "loss": 1.131,
      "num_input_tokens_seen": 43450734176,
      "step": 55227
    },
    {
      "epoch": 5.859113091449183,
      "grad_norm": 0.7142278258542278,
      "learning_rate": 2.595812729668659e-05,
      "loss": 1.1967,
      "num_input_tokens_seen": 43451520912,
      "step": 55228
    },
    {
      "epoch": 5.859219180988754,
      "grad_norm": 0.567673771534339,
      "learning_rate": 2.5957432838073054e-05,
      "loss": 1.052,
      "num_input_tokens_seen": 43452307680,
      "step": 55229
    },
    {
      "epoch": 5.859325270528326,
      "grad_norm": 0.6423098805358405,
      "learning_rate": 2.5956738378719648e-05,
      "loss": 1.0302,
      "num_input_tokens_seen": 43453094496,
      "step": 55230
    },
    {
      "epoch": 5.859431360067897,
      "grad_norm": 0.6247213058677681,
      "learning_rate": 2.5956043918626894e-05,
      "loss": 1.1071,
      "num_input_tokens_seen": 43453881200,
      "step": 55231
    },
    {
      "epoch": 5.859537449607469,
      "grad_norm": 0.7488748040188182,
      "learning_rate": 2.5955349457795337e-05,
      "loss": 1.1631,
      "num_input_tokens_seen": 43454667968,
      "step": 55232
    },
    {
      "epoch": 5.85964353914704,
      "grad_norm": 0.6382445228389801,
      "learning_rate": 2.595465499622552e-05,
      "loss": 1.1456,
      "num_input_tokens_seen": 43455454688,
      "step": 55233
    },
    {
      "epoch": 5.859749628686611,
      "grad_norm": 0.6772341460941503,
      "learning_rate": 2.5953960533917965e-05,
      "loss": 1.1765,
      "num_input_tokens_seen": 43456241408,
      "step": 55234
    },
    {
      "epoch": 5.859855718226183,
      "grad_norm": 0.657958845850838,
      "learning_rate": 2.5953266070873227e-05,
      "loss": 1.1186,
      "num_input_tokens_seen": 43457028240,
      "step": 55235
    },
    {
      "epoch": 5.859961807765754,
      "grad_norm": 0.589332091766138,
      "learning_rate": 2.595257160709183e-05,
      "loss": 1.1545,
      "num_input_tokens_seen": 43457815024,
      "step": 55236
    },
    {
      "epoch": 5.860067897305326,
      "grad_norm": 0.7853952516332507,
      "learning_rate": 2.595187714257431e-05,
      "loss": 1.217,
      "num_input_tokens_seen": 43458601744,
      "step": 55237
    },
    {
      "epoch": 5.860173986844897,
      "grad_norm": 0.6143260685799142,
      "learning_rate": 2.5951182677321213e-05,
      "loss": 1.166,
      "num_input_tokens_seen": 43459388480,
      "step": 55238
    },
    {
      "epoch": 5.860280076384468,
      "grad_norm": 0.7084612969344357,
      "learning_rate": 2.595048821133307e-05,
      "loss": 1.0278,
      "num_input_tokens_seen": 43460175312,
      "step": 55239
    },
    {
      "epoch": 5.86038616592404,
      "grad_norm": 0.7521960139064405,
      "learning_rate": 2.5949793744610405e-05,
      "loss": 1.2629,
      "num_input_tokens_seen": 43460961984,
      "step": 55240
    },
    {
      "epoch": 5.860492255463611,
      "grad_norm": 0.6004875156051764,
      "learning_rate": 2.594909927715378e-05,
      "loss": 1.1509,
      "num_input_tokens_seen": 43461748624,
      "step": 55241
    },
    {
      "epoch": 5.860598345003183,
      "grad_norm": 0.7770660675371099,
      "learning_rate": 2.5948404808963717e-05,
      "loss": 1.1825,
      "num_input_tokens_seen": 43462535424,
      "step": 55242
    },
    {
      "epoch": 5.860704434542754,
      "grad_norm": 0.6472150190539834,
      "learning_rate": 2.594771034004075e-05,
      "loss": 1.165,
      "num_input_tokens_seen": 43463322144,
      "step": 55243
    },
    {
      "epoch": 5.860810524082326,
      "grad_norm": 0.6252339032728708,
      "learning_rate": 2.5947015870385427e-05,
      "loss": 1.1189,
      "num_input_tokens_seen": 43464108880,
      "step": 55244
    },
    {
      "epoch": 5.860916613621897,
      "grad_norm": 0.6491569330812358,
      "learning_rate": 2.594632139999827e-05,
      "loss": 1.153,
      "num_input_tokens_seen": 43464895680,
      "step": 55245
    },
    {
      "epoch": 5.861022703161468,
      "grad_norm": 0.623286580856411,
      "learning_rate": 2.594562692887983e-05,
      "loss": 1.1215,
      "num_input_tokens_seen": 43465682432,
      "step": 55246
    },
    {
      "epoch": 5.86112879270104,
      "grad_norm": 0.6616170423689178,
      "learning_rate": 2.5944932457030634e-05,
      "loss": 1.1002,
      "num_input_tokens_seen": 43466469152,
      "step": 55247
    },
    {
      "epoch": 5.861234882240611,
      "grad_norm": 0.8070143823470151,
      "learning_rate": 2.5944237984451218e-05,
      "loss": 1.1723,
      "num_input_tokens_seen": 43467255968,
      "step": 55248
    },
    {
      "epoch": 5.861340971780183,
      "grad_norm": 0.7221099569929393,
      "learning_rate": 2.594354351114213e-05,
      "loss": 1.0691,
      "num_input_tokens_seen": 43468042784,
      "step": 55249
    },
    {
      "epoch": 5.861447061319754,
      "grad_norm": 0.7815385343382815,
      "learning_rate": 2.59428490371039e-05,
      "loss": 1.1314,
      "num_input_tokens_seen": 43468829552,
      "step": 55250
    },
    {
      "epoch": 5.861553150859326,
      "grad_norm": 0.6392568037852596,
      "learning_rate": 2.5942154562337057e-05,
      "loss": 1.1714,
      "num_input_tokens_seen": 43469616416,
      "step": 55251
    },
    {
      "epoch": 5.861659240398897,
      "grad_norm": 0.7358934629151186,
      "learning_rate": 2.5941460086842144e-05,
      "loss": 1.2895,
      "num_input_tokens_seen": 43470403072,
      "step": 55252
    },
    {
      "epoch": 5.861765329938468,
      "grad_norm": 0.8198406882689377,
      "learning_rate": 2.5940765610619704e-05,
      "loss": 1.1901,
      "num_input_tokens_seen": 43471189824,
      "step": 55253
    },
    {
      "epoch": 5.86187141947804,
      "grad_norm": 0.5942030386394838,
      "learning_rate": 2.594007113367027e-05,
      "loss": 1.1509,
      "num_input_tokens_seen": 43471976704,
      "step": 55254
    },
    {
      "epoch": 5.861977509017611,
      "grad_norm": 0.6724509690332615,
      "learning_rate": 2.5939376655994368e-05,
      "loss": 1.1588,
      "num_input_tokens_seen": 43472763344,
      "step": 55255
    },
    {
      "epoch": 5.862083598557183,
      "grad_norm": 0.9767035900855385,
      "learning_rate": 2.593868217759255e-05,
      "loss": 1.1107,
      "num_input_tokens_seen": 43473550192,
      "step": 55256
    },
    {
      "epoch": 5.862189688096754,
      "grad_norm": 0.7924133386147145,
      "learning_rate": 2.5937987698465343e-05,
      "loss": 1.1359,
      "num_input_tokens_seen": 43474336944,
      "step": 55257
    },
    {
      "epoch": 5.862295777636325,
      "grad_norm": 0.663536021898022,
      "learning_rate": 2.593729321861329e-05,
      "loss": 1.1457,
      "num_input_tokens_seen": 43475123760,
      "step": 55258
    },
    {
      "epoch": 5.862401867175897,
      "grad_norm": 1.2762547936668502,
      "learning_rate": 2.593659873803692e-05,
      "loss": 1.2527,
      "num_input_tokens_seen": 43475910432,
      "step": 55259
    },
    {
      "epoch": 5.862507956715468,
      "grad_norm": 0.6413024147597006,
      "learning_rate": 2.5935904256736775e-05,
      "loss": 1.1595,
      "num_input_tokens_seen": 43476697264,
      "step": 55260
    },
    {
      "epoch": 5.86261404625504,
      "grad_norm": 0.7195726135569982,
      "learning_rate": 2.5935209774713393e-05,
      "loss": 1.0881,
      "num_input_tokens_seen": 43477484144,
      "step": 55261
    },
    {
      "epoch": 5.862720135794611,
      "grad_norm": 0.6088810923499476,
      "learning_rate": 2.593451529196731e-05,
      "loss": 1.1332,
      "num_input_tokens_seen": 43478270880,
      "step": 55262
    },
    {
      "epoch": 5.862826225334182,
      "grad_norm": 0.8629555160958745,
      "learning_rate": 2.5933820808499054e-05,
      "loss": 1.107,
      "num_input_tokens_seen": 43479057680,
      "step": 55263
    },
    {
      "epoch": 5.8629323148737535,
      "grad_norm": 0.9380794860001275,
      "learning_rate": 2.5933126324309175e-05,
      "loss": 1.1995,
      "num_input_tokens_seen": 43479844336,
      "step": 55264
    },
    {
      "epoch": 5.863038404413325,
      "grad_norm": 0.5996896253773703,
      "learning_rate": 2.5932431839398203e-05,
      "loss": 1.2513,
      "num_input_tokens_seen": 43480631136,
      "step": 55265
    },
    {
      "epoch": 5.8631444939528965,
      "grad_norm": 0.8975182025140694,
      "learning_rate": 2.593173735376667e-05,
      "loss": 1.0952,
      "num_input_tokens_seen": 43481417888,
      "step": 55266
    },
    {
      "epoch": 5.8632505834924675,
      "grad_norm": 0.9152655787571848,
      "learning_rate": 2.5931042867415123e-05,
      "loss": 1.1339,
      "num_input_tokens_seen": 43482204544,
      "step": 55267
    },
    {
      "epoch": 5.863356673032039,
      "grad_norm": 0.7428737875159821,
      "learning_rate": 2.5930348380344095e-05,
      "loss": 1.1454,
      "num_input_tokens_seen": 43482991328,
      "step": 55268
    },
    {
      "epoch": 5.8634627625716105,
      "grad_norm": 1.1868690415585716,
      "learning_rate": 2.5929653892554112e-05,
      "loss": 1.1639,
      "num_input_tokens_seen": 43483778128,
      "step": 55269
    },
    {
      "epoch": 5.8635688521111815,
      "grad_norm": 0.6394943673534341,
      "learning_rate": 2.5928959404045727e-05,
      "loss": 1.1285,
      "num_input_tokens_seen": 43484564864,
      "step": 55270
    },
    {
      "epoch": 5.863674941650753,
      "grad_norm": 0.7388267795886865,
      "learning_rate": 2.5928264914819468e-05,
      "loss": 1.1815,
      "num_input_tokens_seen": 43485351600,
      "step": 55271
    },
    {
      "epoch": 5.8637810311903245,
      "grad_norm": 0.893388821878467,
      "learning_rate": 2.592757042487587e-05,
      "loss": 1.2084,
      "num_input_tokens_seen": 43486138384,
      "step": 55272
    },
    {
      "epoch": 5.863887120729896,
      "grad_norm": 0.7846613105032301,
      "learning_rate": 2.592687593421548e-05,
      "loss": 1.198,
      "num_input_tokens_seen": 43486925136,
      "step": 55273
    },
    {
      "epoch": 5.863993210269467,
      "grad_norm": 0.7604377197482326,
      "learning_rate": 2.5926181442838814e-05,
      "loss": 1.1236,
      "num_input_tokens_seen": 43487711904,
      "step": 55274
    },
    {
      "epoch": 5.864099299809039,
      "grad_norm": 1.0380678359485604,
      "learning_rate": 2.5925486950746436e-05,
      "loss": 1.1836,
      "num_input_tokens_seen": 43488498704,
      "step": 55275
    },
    {
      "epoch": 5.86420538934861,
      "grad_norm": 0.7267575822879359,
      "learning_rate": 2.5924792457938867e-05,
      "loss": 1.087,
      "num_input_tokens_seen": 43489285488,
      "step": 55276
    },
    {
      "epoch": 5.864311478888181,
      "grad_norm": 0.9288107286039998,
      "learning_rate": 2.592409796441664e-05,
      "loss": 1.1624,
      "num_input_tokens_seen": 43490072224,
      "step": 55277
    },
    {
      "epoch": 5.864417568427753,
      "grad_norm": 1.2521706305428009,
      "learning_rate": 2.5923403470180303e-05,
      "loss": 1.2988,
      "num_input_tokens_seen": 43490858880,
      "step": 55278
    },
    {
      "epoch": 5.864523657967324,
      "grad_norm": 0.8380902526390107,
      "learning_rate": 2.592270897523038e-05,
      "loss": 1.1258,
      "num_input_tokens_seen": 43491645616,
      "step": 55279
    },
    {
      "epoch": 5.864629747506896,
      "grad_norm": 0.6100157922243561,
      "learning_rate": 2.5922014479567414e-05,
      "loss": 1.2131,
      "num_input_tokens_seen": 43492432336,
      "step": 55280
    },
    {
      "epoch": 5.864735837046467,
      "grad_norm": 0.8390260009722369,
      "learning_rate": 2.592131998319195e-05,
      "loss": 1.1358,
      "num_input_tokens_seen": 43493219088,
      "step": 55281
    },
    {
      "epoch": 5.864841926586038,
      "grad_norm": 0.6530867034410299,
      "learning_rate": 2.5920625486104516e-05,
      "loss": 1.1797,
      "num_input_tokens_seen": 43494005888,
      "step": 55282
    },
    {
      "epoch": 5.86494801612561,
      "grad_norm": 0.77497805650975,
      "learning_rate": 2.591993098830564e-05,
      "loss": 1.1712,
      "num_input_tokens_seen": 43494792688,
      "step": 55283
    },
    {
      "epoch": 5.865054105665181,
      "grad_norm": 0.6271136233509477,
      "learning_rate": 2.591923648979588e-05,
      "loss": 1.1235,
      "num_input_tokens_seen": 43495579392,
      "step": 55284
    },
    {
      "epoch": 5.865160195204753,
      "grad_norm": 0.5550327291589466,
      "learning_rate": 2.5918541990575756e-05,
      "loss": 1.1467,
      "num_input_tokens_seen": 43496366144,
      "step": 55285
    },
    {
      "epoch": 5.865266284744324,
      "grad_norm": 0.6945571407775938,
      "learning_rate": 2.591784749064581e-05,
      "loss": 1.1677,
      "num_input_tokens_seen": 43497152880,
      "step": 55286
    },
    {
      "epoch": 5.865372374283895,
      "grad_norm": 0.6363106412744876,
      "learning_rate": 2.591715299000658e-05,
      "loss": 1.1689,
      "num_input_tokens_seen": 43497939744,
      "step": 55287
    },
    {
      "epoch": 5.865478463823467,
      "grad_norm": 0.6958701396527642,
      "learning_rate": 2.5916458488658596e-05,
      "loss": 1.2209,
      "num_input_tokens_seen": 43498726560,
      "step": 55288
    },
    {
      "epoch": 5.865584553363038,
      "grad_norm": 0.7355613661009881,
      "learning_rate": 2.5915763986602404e-05,
      "loss": 1.2458,
      "num_input_tokens_seen": 43499513248,
      "step": 55289
    },
    {
      "epoch": 5.86569064290261,
      "grad_norm": 0.6821387322911562,
      "learning_rate": 2.591506948383854e-05,
      "loss": 1.1118,
      "num_input_tokens_seen": 43500300080,
      "step": 55290
    },
    {
      "epoch": 5.865796732442181,
      "grad_norm": 0.7057401283665425,
      "learning_rate": 2.591437498036753e-05,
      "loss": 1.1693,
      "num_input_tokens_seen": 43501086896,
      "step": 55291
    },
    {
      "epoch": 5.865902821981752,
      "grad_norm": 0.7664050630088568,
      "learning_rate": 2.5913680476189923e-05,
      "loss": 1.1674,
      "num_input_tokens_seen": 43501873680,
      "step": 55292
    },
    {
      "epoch": 5.866008911521324,
      "grad_norm": 0.6729107888561391,
      "learning_rate": 2.5912985971306246e-05,
      "loss": 1.1323,
      "num_input_tokens_seen": 43502660512,
      "step": 55293
    },
    {
      "epoch": 5.866115001060895,
      "grad_norm": 0.6211612924852694,
      "learning_rate": 2.5912291465717042e-05,
      "loss": 1.0697,
      "num_input_tokens_seen": 43503447408,
      "step": 55294
    },
    {
      "epoch": 5.866221090600467,
      "grad_norm": 0.8111808628944305,
      "learning_rate": 2.5911596959422846e-05,
      "loss": 1.1,
      "num_input_tokens_seen": 43504234128,
      "step": 55295
    },
    {
      "epoch": 5.866327180140038,
      "grad_norm": 0.698260592530865,
      "learning_rate": 2.5910902452424195e-05,
      "loss": 1.251,
      "num_input_tokens_seen": 43505020896,
      "step": 55296
    },
    {
      "epoch": 5.866433269679609,
      "grad_norm": 0.8124137578425892,
      "learning_rate": 2.5910207944721627e-05,
      "loss": 1.1377,
      "num_input_tokens_seen": 43505807680,
      "step": 55297
    },
    {
      "epoch": 5.866539359219181,
      "grad_norm": 0.9850685784548932,
      "learning_rate": 2.5909513436315676e-05,
      "loss": 1.1001,
      "num_input_tokens_seen": 43506594384,
      "step": 55298
    },
    {
      "epoch": 5.866645448758752,
      "grad_norm": 0.7224648197258877,
      "learning_rate": 2.5908818927206873e-05,
      "loss": 1.2227,
      "num_input_tokens_seen": 43507381200,
      "step": 55299
    },
    {
      "epoch": 5.866751538298324,
      "grad_norm": 0.766795231683667,
      "learning_rate": 2.5908124417395762e-05,
      "loss": 1.1942,
      "num_input_tokens_seen": 43508167936,
      "step": 55300
    },
    {
      "epoch": 5.866857627837895,
      "grad_norm": 0.7710743492557363,
      "learning_rate": 2.590742990688289e-05,
      "loss": 1.1334,
      "num_input_tokens_seen": 43508954608,
      "step": 55301
    },
    {
      "epoch": 5.866963717377467,
      "grad_norm": 0.6131173844248757,
      "learning_rate": 2.590673539566878e-05,
      "loss": 1.1192,
      "num_input_tokens_seen": 43509741392,
      "step": 55302
    },
    {
      "epoch": 5.867069806917038,
      "grad_norm": 0.8382574279544216,
      "learning_rate": 2.5906040883753962e-05,
      "loss": 1.215,
      "num_input_tokens_seen": 43510528160,
      "step": 55303
    },
    {
      "epoch": 5.86717589645661,
      "grad_norm": 0.7255461700948294,
      "learning_rate": 2.5905346371138995e-05,
      "loss": 1.125,
      "num_input_tokens_seen": 43511314976,
      "step": 55304
    },
    {
      "epoch": 5.867281985996181,
      "grad_norm": 0.6300939497834778,
      "learning_rate": 2.5904651857824397e-05,
      "loss": 1.1058,
      "num_input_tokens_seen": 43512101792,
      "step": 55305
    },
    {
      "epoch": 5.867388075535752,
      "grad_norm": 0.683037230687933,
      "learning_rate": 2.5903957343810708e-05,
      "loss": 1.0818,
      "num_input_tokens_seen": 43512888560,
      "step": 55306
    },
    {
      "epoch": 5.867494165075324,
      "grad_norm": 0.6531100829537226,
      "learning_rate": 2.5903262829098474e-05,
      "loss": 1.1653,
      "num_input_tokens_seen": 43513675360,
      "step": 55307
    },
    {
      "epoch": 5.867600254614895,
      "grad_norm": 0.7007422629403696,
      "learning_rate": 2.590256831368822e-05,
      "loss": 1.1265,
      "num_input_tokens_seen": 43514462240,
      "step": 55308
    },
    {
      "epoch": 5.867706344154467,
      "grad_norm": 0.7177398343147942,
      "learning_rate": 2.5901873797580483e-05,
      "loss": 1.0725,
      "num_input_tokens_seen": 43515249040,
      "step": 55309
    },
    {
      "epoch": 5.867812433694038,
      "grad_norm": 0.8417958739632311,
      "learning_rate": 2.590117928077581e-05,
      "loss": 1.1758,
      "num_input_tokens_seen": 43516035792,
      "step": 55310
    },
    {
      "epoch": 5.867918523233609,
      "grad_norm": 1.0233004084820425,
      "learning_rate": 2.5900484763274735e-05,
      "loss": 1.1521,
      "num_input_tokens_seen": 43516822432,
      "step": 55311
    },
    {
      "epoch": 5.868024612773181,
      "grad_norm": 0.7485703843040178,
      "learning_rate": 2.5899790245077787e-05,
      "loss": 1.1634,
      "num_input_tokens_seen": 43517609184,
      "step": 55312
    },
    {
      "epoch": 5.868130702312752,
      "grad_norm": 1.0339333108753268,
      "learning_rate": 2.5899095726185514e-05,
      "loss": 1.2378,
      "num_input_tokens_seen": 43518395904,
      "step": 55313
    },
    {
      "epoch": 5.868236791852324,
      "grad_norm": 0.6536447079145327,
      "learning_rate": 2.589840120659844e-05,
      "loss": 1.1425,
      "num_input_tokens_seen": 43519182720,
      "step": 55314
    },
    {
      "epoch": 5.868342881391895,
      "grad_norm": 0.8473947666212113,
      "learning_rate": 2.5897706686317106e-05,
      "loss": 1.1798,
      "num_input_tokens_seen": 43519969504,
      "step": 55315
    },
    {
      "epoch": 5.868448970931466,
      "grad_norm": 0.7608118928159878,
      "learning_rate": 2.5897012165342053e-05,
      "loss": 1.1131,
      "num_input_tokens_seen": 43520756272,
      "step": 55316
    },
    {
      "epoch": 5.868555060471038,
      "grad_norm": 0.5732613161473104,
      "learning_rate": 2.5896317643673816e-05,
      "loss": 1.0661,
      "num_input_tokens_seen": 43521543152,
      "step": 55317
    },
    {
      "epoch": 5.868661150010609,
      "grad_norm": 0.6442484008471535,
      "learning_rate": 2.5895623121312936e-05,
      "loss": 1.238,
      "num_input_tokens_seen": 43522329856,
      "step": 55318
    },
    {
      "epoch": 5.868767239550181,
      "grad_norm": 0.6297617462865044,
      "learning_rate": 2.5894928598259938e-05,
      "loss": 1.2401,
      "num_input_tokens_seen": 43523116640,
      "step": 55319
    },
    {
      "epoch": 5.868873329089752,
      "grad_norm": 0.6541445808134821,
      "learning_rate": 2.5894234074515365e-05,
      "loss": 1.1652,
      "num_input_tokens_seen": 43523903360,
      "step": 55320
    },
    {
      "epoch": 5.868979418629323,
      "grad_norm": 0.7058661362199286,
      "learning_rate": 2.589353955007976e-05,
      "loss": 1.2182,
      "num_input_tokens_seen": 43524690144,
      "step": 55321
    },
    {
      "epoch": 5.869085508168895,
      "grad_norm": 0.8152268021487563,
      "learning_rate": 2.589284502495365e-05,
      "loss": 1.1891,
      "num_input_tokens_seen": 43525476944,
      "step": 55322
    },
    {
      "epoch": 5.869191597708466,
      "grad_norm": 0.695157009277485,
      "learning_rate": 2.5892150499137575e-05,
      "loss": 1.1481,
      "num_input_tokens_seen": 43526263808,
      "step": 55323
    },
    {
      "epoch": 5.869297687248038,
      "grad_norm": 0.6993910757274641,
      "learning_rate": 2.589145597263207e-05,
      "loss": 1.1601,
      "num_input_tokens_seen": 43527050544,
      "step": 55324
    },
    {
      "epoch": 5.869403776787609,
      "grad_norm": 0.7127713361448311,
      "learning_rate": 2.5890761445437682e-05,
      "loss": 1.0567,
      "num_input_tokens_seen": 43527837360,
      "step": 55325
    },
    {
      "epoch": 5.8695098663271805,
      "grad_norm": 0.7825788532173452,
      "learning_rate": 2.5890066917554933e-05,
      "loss": 1.1694,
      "num_input_tokens_seen": 43528624176,
      "step": 55326
    },
    {
      "epoch": 5.8696159558667516,
      "grad_norm": 0.8422506095777506,
      "learning_rate": 2.5889372388984367e-05,
      "loss": 1.0925,
      "num_input_tokens_seen": 43529410960,
      "step": 55327
    },
    {
      "epoch": 5.869722045406323,
      "grad_norm": 0.6551647928993374,
      "learning_rate": 2.5888677859726528e-05,
      "loss": 1.121,
      "num_input_tokens_seen": 43530197744,
      "step": 55328
    },
    {
      "epoch": 5.8698281349458945,
      "grad_norm": 0.6034902506114712,
      "learning_rate": 2.5887983329781934e-05,
      "loss": 1.1147,
      "num_input_tokens_seen": 43530984528,
      "step": 55329
    },
    {
      "epoch": 5.8699342244854655,
      "grad_norm": 0.6544056742331148,
      "learning_rate": 2.588728879915114e-05,
      "loss": 1.0992,
      "num_input_tokens_seen": 43531771360,
      "step": 55330
    },
    {
      "epoch": 5.8700403140250375,
      "grad_norm": 0.6685338149246386,
      "learning_rate": 2.5886594267834668e-05,
      "loss": 1.1474,
      "num_input_tokens_seen": 43532558064,
      "step": 55331
    },
    {
      "epoch": 5.8701464035646085,
      "grad_norm": 0.6076987872515469,
      "learning_rate": 2.588589973583307e-05,
      "loss": 1.217,
      "num_input_tokens_seen": 43533344736,
      "step": 55332
    },
    {
      "epoch": 5.87025249310418,
      "grad_norm": 0.6865086708679241,
      "learning_rate": 2.5885205203146867e-05,
      "loss": 1.0664,
      "num_input_tokens_seen": 43534131472,
      "step": 55333
    },
    {
      "epoch": 5.870358582643751,
      "grad_norm": 0.7580876045257768,
      "learning_rate": 2.588451066977661e-05,
      "loss": 1.2378,
      "num_input_tokens_seen": 43534918256,
      "step": 55334
    },
    {
      "epoch": 5.8704646721833225,
      "grad_norm": 0.5777200562583055,
      "learning_rate": 2.5883816135722828e-05,
      "loss": 1.0926,
      "num_input_tokens_seen": 43535704960,
      "step": 55335
    },
    {
      "epoch": 5.870570761722894,
      "grad_norm": 0.6031215103397194,
      "learning_rate": 2.5883121600986055e-05,
      "loss": 1.1736,
      "num_input_tokens_seen": 43536491712,
      "step": 55336
    },
    {
      "epoch": 5.870676851262465,
      "grad_norm": 0.6902392012821218,
      "learning_rate": 2.5882427065566827e-05,
      "loss": 1.1549,
      "num_input_tokens_seen": 43537278512,
      "step": 55337
    },
    {
      "epoch": 5.870782940802037,
      "grad_norm": 0.685702750515861,
      "learning_rate": 2.5881732529465697e-05,
      "loss": 1.1288,
      "num_input_tokens_seen": 43538065296,
      "step": 55338
    },
    {
      "epoch": 5.870889030341608,
      "grad_norm": 0.7053184277676318,
      "learning_rate": 2.588103799268319e-05,
      "loss": 1.1342,
      "num_input_tokens_seen": 43538852048,
      "step": 55339
    },
    {
      "epoch": 5.870995119881179,
      "grad_norm": 0.8366586567963897,
      "learning_rate": 2.588034345521983e-05,
      "loss": 1.1561,
      "num_input_tokens_seen": 43539638784,
      "step": 55340
    },
    {
      "epoch": 5.871101209420751,
      "grad_norm": 0.6080016542332993,
      "learning_rate": 2.587964891707618e-05,
      "loss": 1.1672,
      "num_input_tokens_seen": 43540425472,
      "step": 55341
    },
    {
      "epoch": 5.871207298960322,
      "grad_norm": 0.6082015761617099,
      "learning_rate": 2.5878954378252756e-05,
      "loss": 1.173,
      "num_input_tokens_seen": 43541212080,
      "step": 55342
    },
    {
      "epoch": 5.871313388499894,
      "grad_norm": 0.6764970370534032,
      "learning_rate": 2.58782598387501e-05,
      "loss": 1.1836,
      "num_input_tokens_seen": 43541998784,
      "step": 55343
    },
    {
      "epoch": 5.871419478039465,
      "grad_norm": 0.671813182519076,
      "learning_rate": 2.5877565298568755e-05,
      "loss": 1.2356,
      "num_input_tokens_seen": 43542785600,
      "step": 55344
    },
    {
      "epoch": 5.871525567579036,
      "grad_norm": 0.5726368632220754,
      "learning_rate": 2.5876870757709255e-05,
      "loss": 1.1637,
      "num_input_tokens_seen": 43543572352,
      "step": 55345
    },
    {
      "epoch": 5.871631657118608,
      "grad_norm": 0.6304397647739237,
      "learning_rate": 2.5876176216172128e-05,
      "loss": 1.0663,
      "num_input_tokens_seen": 43544359088,
      "step": 55346
    },
    {
      "epoch": 5.871737746658179,
      "grad_norm": 0.8162472660283435,
      "learning_rate": 2.587548167395792e-05,
      "loss": 1.0728,
      "num_input_tokens_seen": 43545145872,
      "step": 55347
    },
    {
      "epoch": 5.871843836197751,
      "grad_norm": 0.6103422404210961,
      "learning_rate": 2.5874787131067164e-05,
      "loss": 1.1981,
      "num_input_tokens_seen": 43545932592,
      "step": 55348
    },
    {
      "epoch": 5.871949925737322,
      "grad_norm": 0.6748000669777178,
      "learning_rate": 2.5874092587500397e-05,
      "loss": 1.1589,
      "num_input_tokens_seen": 43546719392,
      "step": 55349
    },
    {
      "epoch": 5.872056015276893,
      "grad_norm": 0.895747243619455,
      "learning_rate": 2.5873398043258162e-05,
      "loss": 1.1506,
      "num_input_tokens_seen": 43547506160,
      "step": 55350
    },
    {
      "epoch": 5.872162104816465,
      "grad_norm": 0.7420333430922373,
      "learning_rate": 2.5872703498340995e-05,
      "loss": 1.1799,
      "num_input_tokens_seen": 43548292864,
      "step": 55351
    },
    {
      "epoch": 5.872268194356036,
      "grad_norm": 0.6144788048088395,
      "learning_rate": 2.5872008952749423e-05,
      "loss": 1.1392,
      "num_input_tokens_seen": 43549079568,
      "step": 55352
    },
    {
      "epoch": 5.872374283895608,
      "grad_norm": 0.601452566204832,
      "learning_rate": 2.587131440648399e-05,
      "loss": 1.15,
      "num_input_tokens_seen": 43549866320,
      "step": 55353
    },
    {
      "epoch": 5.872480373435179,
      "grad_norm": 0.6437129935881445,
      "learning_rate": 2.5870619859545224e-05,
      "loss": 1.0641,
      "num_input_tokens_seen": 43550653088,
      "step": 55354
    },
    {
      "epoch": 5.872586462974751,
      "grad_norm": 0.6201166802149395,
      "learning_rate": 2.5869925311933675e-05,
      "loss": 1.2537,
      "num_input_tokens_seen": 43551439856,
      "step": 55355
    },
    {
      "epoch": 5.872692552514322,
      "grad_norm": 0.5652481129481616,
      "learning_rate": 2.586923076364987e-05,
      "loss": 1.1698,
      "num_input_tokens_seen": 43552226592,
      "step": 55356
    },
    {
      "epoch": 5.872798642053893,
      "grad_norm": 0.6106007376904097,
      "learning_rate": 2.5868536214694354e-05,
      "loss": 1.1529,
      "num_input_tokens_seen": 43553013360,
      "step": 55357
    },
    {
      "epoch": 5.872904731593465,
      "grad_norm": 0.6355807694261782,
      "learning_rate": 2.586784166506765e-05,
      "loss": 1.0886,
      "num_input_tokens_seen": 43553800112,
      "step": 55358
    },
    {
      "epoch": 5.873010821133036,
      "grad_norm": 0.7455966788941044,
      "learning_rate": 2.5867147114770312e-05,
      "loss": 1.1612,
      "num_input_tokens_seen": 43554586800,
      "step": 55359
    },
    {
      "epoch": 5.873116910672608,
      "grad_norm": 0.5816048301741713,
      "learning_rate": 2.5866452563802862e-05,
      "loss": 1.1799,
      "num_input_tokens_seen": 43555373648,
      "step": 55360
    },
    {
      "epoch": 5.873223000212179,
      "grad_norm": 0.6971369657730102,
      "learning_rate": 2.5865758012165847e-05,
      "loss": 1.07,
      "num_input_tokens_seen": 43556160400,
      "step": 55361
    },
    {
      "epoch": 5.873329089751751,
      "grad_norm": 0.7294839007989419,
      "learning_rate": 2.58650634598598e-05,
      "loss": 1.1794,
      "num_input_tokens_seen": 43556947152,
      "step": 55362
    },
    {
      "epoch": 5.873435179291322,
      "grad_norm": 0.601155733115907,
      "learning_rate": 2.586436890688525e-05,
      "loss": 1.1238,
      "num_input_tokens_seen": 43557733936,
      "step": 55363
    },
    {
      "epoch": 5.873541268830893,
      "grad_norm": 0.661982279529832,
      "learning_rate": 2.586367435324275e-05,
      "loss": 1.1463,
      "num_input_tokens_seen": 43558520672,
      "step": 55364
    },
    {
      "epoch": 5.873647358370465,
      "grad_norm": 0.607601084817123,
      "learning_rate": 2.5862979798932828e-05,
      "loss": 1.1199,
      "num_input_tokens_seen": 43559307424,
      "step": 55365
    },
    {
      "epoch": 5.873753447910036,
      "grad_norm": 0.5494575552565002,
      "learning_rate": 2.5862285243956013e-05,
      "loss": 1.1629,
      "num_input_tokens_seen": 43560094208,
      "step": 55366
    },
    {
      "epoch": 5.873859537449608,
      "grad_norm": 0.5763743517613327,
      "learning_rate": 2.5861590688312853e-05,
      "loss": 1.0917,
      "num_input_tokens_seen": 43560880864,
      "step": 55367
    },
    {
      "epoch": 5.873965626989179,
      "grad_norm": 0.7556248221425031,
      "learning_rate": 2.5860896132003885e-05,
      "loss": 1.2127,
      "num_input_tokens_seen": 43561667616,
      "step": 55368
    },
    {
      "epoch": 5.87407171652875,
      "grad_norm": 0.6476878503481445,
      "learning_rate": 2.5860201575029634e-05,
      "loss": 1.2215,
      "num_input_tokens_seen": 43562454384,
      "step": 55369
    },
    {
      "epoch": 5.874177806068322,
      "grad_norm": 0.6167779894711737,
      "learning_rate": 2.5859507017390648e-05,
      "loss": 1.2184,
      "num_input_tokens_seen": 43563241088,
      "step": 55370
    },
    {
      "epoch": 5.874283895607893,
      "grad_norm": 0.5833751532817111,
      "learning_rate": 2.5858812459087466e-05,
      "loss": 1.1566,
      "num_input_tokens_seen": 43564027968,
      "step": 55371
    },
    {
      "epoch": 5.874389985147465,
      "grad_norm": 0.7814928037084173,
      "learning_rate": 2.585811790012061e-05,
      "loss": 1.1731,
      "num_input_tokens_seen": 43564814752,
      "step": 55372
    },
    {
      "epoch": 5.874496074687036,
      "grad_norm": 0.6798361030270693,
      "learning_rate": 2.5857423340490633e-05,
      "loss": 1.2084,
      "num_input_tokens_seen": 43565601520,
      "step": 55373
    },
    {
      "epoch": 5.874602164226607,
      "grad_norm": 0.5901911033700187,
      "learning_rate": 2.5856728780198062e-05,
      "loss": 1.1677,
      "num_input_tokens_seen": 43566388272,
      "step": 55374
    },
    {
      "epoch": 5.874708253766179,
      "grad_norm": 1.0167453301652019,
      "learning_rate": 2.585603421924343e-05,
      "loss": 1.1692,
      "num_input_tokens_seen": 43567175040,
      "step": 55375
    },
    {
      "epoch": 5.87481434330575,
      "grad_norm": 0.6875424839962767,
      "learning_rate": 2.5855339657627286e-05,
      "loss": 1.0578,
      "num_input_tokens_seen": 43567961824,
      "step": 55376
    },
    {
      "epoch": 5.874920432845322,
      "grad_norm": 1.1447908295459237,
      "learning_rate": 2.5854645095350154e-05,
      "loss": 1.12,
      "num_input_tokens_seen": 43568748688,
      "step": 55377
    },
    {
      "epoch": 5.875026522384893,
      "grad_norm": 0.704728838004573,
      "learning_rate": 2.585395053241259e-05,
      "loss": 1.0991,
      "num_input_tokens_seen": 43569535568,
      "step": 55378
    },
    {
      "epoch": 5.875132611924464,
      "grad_norm": 0.7411921905151553,
      "learning_rate": 2.585325596881511e-05,
      "loss": 1.1199,
      "num_input_tokens_seen": 43570322352,
      "step": 55379
    },
    {
      "epoch": 5.875238701464036,
      "grad_norm": 0.8349171684807892,
      "learning_rate": 2.5852561404558257e-05,
      "loss": 1.2671,
      "num_input_tokens_seen": 43571109088,
      "step": 55380
    },
    {
      "epoch": 5.875344791003607,
      "grad_norm": 0.6093337642226215,
      "learning_rate": 2.5851866839642574e-05,
      "loss": 1.0989,
      "num_input_tokens_seen": 43571895840,
      "step": 55381
    },
    {
      "epoch": 5.875450880543179,
      "grad_norm": 0.8091210040586846,
      "learning_rate": 2.585117227406859e-05,
      "loss": 1.165,
      "num_input_tokens_seen": 43572682640,
      "step": 55382
    },
    {
      "epoch": 5.87555697008275,
      "grad_norm": 0.701641769097384,
      "learning_rate": 2.5850477707836845e-05,
      "loss": 1.1029,
      "num_input_tokens_seen": 43573469328,
      "step": 55383
    },
    {
      "epoch": 5.875663059622322,
      "grad_norm": 0.7879196695223167,
      "learning_rate": 2.584978314094788e-05,
      "loss": 1.2181,
      "num_input_tokens_seen": 43574256080,
      "step": 55384
    },
    {
      "epoch": 5.875769149161893,
      "grad_norm": 0.952856239931383,
      "learning_rate": 2.584908857340223e-05,
      "loss": 1.0965,
      "num_input_tokens_seen": 43575042864,
      "step": 55385
    },
    {
      "epoch": 5.875875238701464,
      "grad_norm": 0.6483002070932935,
      "learning_rate": 2.5848394005200415e-05,
      "loss": 1.0934,
      "num_input_tokens_seen": 43575829616,
      "step": 55386
    },
    {
      "epoch": 5.875981328241036,
      "grad_norm": 0.7052913990449174,
      "learning_rate": 2.5847699436343e-05,
      "loss": 1.1773,
      "num_input_tokens_seen": 43576616368,
      "step": 55387
    },
    {
      "epoch": 5.876087417780607,
      "grad_norm": 0.9136730501943511,
      "learning_rate": 2.5847004866830505e-05,
      "loss": 1.2163,
      "num_input_tokens_seen": 43577403120,
      "step": 55388
    },
    {
      "epoch": 5.8761935073201785,
      "grad_norm": 0.6763171751300135,
      "learning_rate": 2.5846310296663462e-05,
      "loss": 1.2287,
      "num_input_tokens_seen": 43578189888,
      "step": 55389
    },
    {
      "epoch": 5.87629959685975,
      "grad_norm": 0.6540100141767028,
      "learning_rate": 2.5845615725842427e-05,
      "loss": 1.1782,
      "num_input_tokens_seen": 43578976640,
      "step": 55390
    },
    {
      "epoch": 5.8764056863993215,
      "grad_norm": 0.8455359961483486,
      "learning_rate": 2.5844921154367914e-05,
      "loss": 1.1563,
      "num_input_tokens_seen": 43579763456,
      "step": 55391
    },
    {
      "epoch": 5.8765117759388925,
      "grad_norm": 0.9925337673483069,
      "learning_rate": 2.5844226582240477e-05,
      "loss": 1.2427,
      "num_input_tokens_seen": 43580550128,
      "step": 55392
    },
    {
      "epoch": 5.8766178654784635,
      "grad_norm": 0.6444526980789393,
      "learning_rate": 2.5843532009460648e-05,
      "loss": 1.1894,
      "num_input_tokens_seen": 43581336880,
      "step": 55393
    },
    {
      "epoch": 5.8767239550180355,
      "grad_norm": 0.6327830971808301,
      "learning_rate": 2.5842837436028953e-05,
      "loss": 1.0744,
      "num_input_tokens_seen": 43582123664,
      "step": 55394
    },
    {
      "epoch": 5.8768300445576065,
      "grad_norm": 1.0561148192666614,
      "learning_rate": 2.584214286194594e-05,
      "loss": 1.0937,
      "num_input_tokens_seen": 43582910528,
      "step": 55395
    },
    {
      "epoch": 5.876936134097178,
      "grad_norm": 0.7202781108800396,
      "learning_rate": 2.584144828721215e-05,
      "loss": 1.1177,
      "num_input_tokens_seen": 43583697280,
      "step": 55396
    },
    {
      "epoch": 5.877042223636749,
      "grad_norm": 0.7386331133463937,
      "learning_rate": 2.5840753711828115e-05,
      "loss": 1.2628,
      "num_input_tokens_seen": 43584483952,
      "step": 55397
    },
    {
      "epoch": 5.8771483131763205,
      "grad_norm": 0.6675663123675081,
      "learning_rate": 2.584005913579436e-05,
      "loss": 1.1636,
      "num_input_tokens_seen": 43585270752,
      "step": 55398
    },
    {
      "epoch": 5.877254402715892,
      "grad_norm": 0.6620145135215766,
      "learning_rate": 2.583936455911144e-05,
      "loss": 1.1737,
      "num_input_tokens_seen": 43586057424,
      "step": 55399
    },
    {
      "epoch": 5.877360492255463,
      "grad_norm": 0.7004523239846394,
      "learning_rate": 2.5838669981779883e-05,
      "loss": 1.1096,
      "num_input_tokens_seen": 43586844112,
      "step": 55400
    },
    {
      "epoch": 5.877466581795035,
      "grad_norm": 0.7667149002591588,
      "learning_rate": 2.5837975403800224e-05,
      "loss": 1.1109,
      "num_input_tokens_seen": 43587630848,
      "step": 55401
    },
    {
      "epoch": 5.877572671334606,
      "grad_norm": 0.665492069306766,
      "learning_rate": 2.5837280825173005e-05,
      "loss": 1.1356,
      "num_input_tokens_seen": 43588417632,
      "step": 55402
    },
    {
      "epoch": 5.877678760874177,
      "grad_norm": 0.6853151171184977,
      "learning_rate": 2.5836586245898755e-05,
      "loss": 1.1743,
      "num_input_tokens_seen": 43589204416,
      "step": 55403
    },
    {
      "epoch": 5.877784850413749,
      "grad_norm": 0.8320333384831251,
      "learning_rate": 2.5835891665978018e-05,
      "loss": 1.101,
      "num_input_tokens_seen": 43589991296,
      "step": 55404
    },
    {
      "epoch": 5.87789093995332,
      "grad_norm": 0.6988014278162007,
      "learning_rate": 2.5835197085411334e-05,
      "loss": 1.0923,
      "num_input_tokens_seen": 43590778112,
      "step": 55405
    },
    {
      "epoch": 5.877997029492892,
      "grad_norm": 0.810716415225868,
      "learning_rate": 2.5834502504199225e-05,
      "loss": 1.1181,
      "num_input_tokens_seen": 43591564880,
      "step": 55406
    },
    {
      "epoch": 5.878103119032463,
      "grad_norm": 0.6378026176794404,
      "learning_rate": 2.5833807922342246e-05,
      "loss": 1.1312,
      "num_input_tokens_seen": 43592351632,
      "step": 55407
    },
    {
      "epoch": 5.878209208572034,
      "grad_norm": 0.6645754968402071,
      "learning_rate": 2.583311333984092e-05,
      "loss": 1.0786,
      "num_input_tokens_seen": 43593138368,
      "step": 55408
    },
    {
      "epoch": 5.878315298111606,
      "grad_norm": 0.5448466532765572,
      "learning_rate": 2.5832418756695785e-05,
      "loss": 1.0716,
      "num_input_tokens_seen": 43593925088,
      "step": 55409
    },
    {
      "epoch": 5.878421387651177,
      "grad_norm": 0.6062355511528396,
      "learning_rate": 2.583172417290739e-05,
      "loss": 1.0499,
      "num_input_tokens_seen": 43594711872,
      "step": 55410
    },
    {
      "epoch": 5.878527477190749,
      "grad_norm": 0.6821477395826151,
      "learning_rate": 2.583102958847626e-05,
      "loss": 1.1318,
      "num_input_tokens_seen": 43595498752,
      "step": 55411
    },
    {
      "epoch": 5.87863356673032,
      "grad_norm": 0.6256407425216844,
      "learning_rate": 2.583033500340293e-05,
      "loss": 1.2162,
      "num_input_tokens_seen": 43596285472,
      "step": 55412
    },
    {
      "epoch": 5.878739656269892,
      "grad_norm": 0.6661635418189885,
      "learning_rate": 2.5829640417687945e-05,
      "loss": 1.1484,
      "num_input_tokens_seen": 43597072288,
      "step": 55413
    },
    {
      "epoch": 5.878845745809463,
      "grad_norm": 0.7953319130406845,
      "learning_rate": 2.5828945831331842e-05,
      "loss": 1.1689,
      "num_input_tokens_seen": 43597859104,
      "step": 55414
    },
    {
      "epoch": 5.878951835349034,
      "grad_norm": 0.641381590720654,
      "learning_rate": 2.5828251244335145e-05,
      "loss": 1.083,
      "num_input_tokens_seen": 43598645904,
      "step": 55415
    },
    {
      "epoch": 5.879057924888606,
      "grad_norm": 0.7283375453483821,
      "learning_rate": 2.5827556656698403e-05,
      "loss": 1.2039,
      "num_input_tokens_seen": 43599432672,
      "step": 55416
    },
    {
      "epoch": 5.879164014428177,
      "grad_norm": 0.5771064823097855,
      "learning_rate": 2.5826862068422154e-05,
      "loss": 1.1199,
      "num_input_tokens_seen": 43600219440,
      "step": 55417
    },
    {
      "epoch": 5.879270103967749,
      "grad_norm": 0.6029557898000907,
      "learning_rate": 2.5826167479506923e-05,
      "loss": 1.0705,
      "num_input_tokens_seen": 43601006160,
      "step": 55418
    },
    {
      "epoch": 5.87937619350732,
      "grad_norm": 0.6251796628779865,
      "learning_rate": 2.582547288995326e-05,
      "loss": 1.1339,
      "num_input_tokens_seen": 43601792976,
      "step": 55419
    },
    {
      "epoch": 5.879482283046892,
      "grad_norm": 0.6546270797522226,
      "learning_rate": 2.5824778299761694e-05,
      "loss": 1.0953,
      "num_input_tokens_seen": 43602579760,
      "step": 55420
    },
    {
      "epoch": 5.879588372586463,
      "grad_norm": 0.6276878820883386,
      "learning_rate": 2.5824083708932762e-05,
      "loss": 1.1444,
      "num_input_tokens_seen": 43603366576,
      "step": 55421
    },
    {
      "epoch": 5.879694462126034,
      "grad_norm": 0.6514576477293068,
      "learning_rate": 2.5823389117467008e-05,
      "loss": 1.169,
      "num_input_tokens_seen": 43604153392,
      "step": 55422
    },
    {
      "epoch": 5.879800551665606,
      "grad_norm": 0.7692014607106407,
      "learning_rate": 2.5822694525364955e-05,
      "loss": 1.2271,
      "num_input_tokens_seen": 43604940240,
      "step": 55423
    },
    {
      "epoch": 5.879906641205177,
      "grad_norm": 0.6161854067344501,
      "learning_rate": 2.582199993262715e-05,
      "loss": 1.1144,
      "num_input_tokens_seen": 43605727072,
      "step": 55424
    },
    {
      "epoch": 5.880012730744749,
      "grad_norm": 0.8309519722088138,
      "learning_rate": 2.582130533925413e-05,
      "loss": 1.1749,
      "num_input_tokens_seen": 43606513856,
      "step": 55425
    },
    {
      "epoch": 5.88011882028432,
      "grad_norm": 0.7468248795426452,
      "learning_rate": 2.5820610745246427e-05,
      "loss": 1.143,
      "num_input_tokens_seen": 43607300608,
      "step": 55426
    },
    {
      "epoch": 5.880224909823891,
      "grad_norm": 0.7205345309465025,
      "learning_rate": 2.5819916150604583e-05,
      "loss": 1.1449,
      "num_input_tokens_seen": 43608087440,
      "step": 55427
    },
    {
      "epoch": 5.880330999363463,
      "grad_norm": 0.6891620895607674,
      "learning_rate": 2.581922155532913e-05,
      "loss": 1.1239,
      "num_input_tokens_seen": 43608874304,
      "step": 55428
    },
    {
      "epoch": 5.880437088903034,
      "grad_norm": 0.7799091263125432,
      "learning_rate": 2.5818526959420607e-05,
      "loss": 1.1638,
      "num_input_tokens_seen": 43609660976,
      "step": 55429
    },
    {
      "epoch": 5.880543178442606,
      "grad_norm": 0.6983610679725206,
      "learning_rate": 2.5817832362879553e-05,
      "loss": 1.0972,
      "num_input_tokens_seen": 43610447760,
      "step": 55430
    },
    {
      "epoch": 5.880649267982177,
      "grad_norm": 0.7259248928316221,
      "learning_rate": 2.58171377657065e-05,
      "loss": 1.1585,
      "num_input_tokens_seen": 43611234560,
      "step": 55431
    },
    {
      "epoch": 5.880755357521748,
      "grad_norm": 0.7198173428274993,
      "learning_rate": 2.581644316790198e-05,
      "loss": 1.1037,
      "num_input_tokens_seen": 43612021328,
      "step": 55432
    },
    {
      "epoch": 5.88086144706132,
      "grad_norm": 0.8509113282134789,
      "learning_rate": 2.5815748569466548e-05,
      "loss": 1.2438,
      "num_input_tokens_seen": 43612808192,
      "step": 55433
    },
    {
      "epoch": 5.880967536600891,
      "grad_norm": 0.6351054392515261,
      "learning_rate": 2.5815053970400722e-05,
      "loss": 1.1876,
      "num_input_tokens_seen": 43613595008,
      "step": 55434
    },
    {
      "epoch": 5.881073626140463,
      "grad_norm": 1.0258324258922162,
      "learning_rate": 2.581435937070505e-05,
      "loss": 1.2177,
      "num_input_tokens_seen": 43614381632,
      "step": 55435
    },
    {
      "epoch": 5.881179715680034,
      "grad_norm": 0.5998698574475921,
      "learning_rate": 2.5813664770380065e-05,
      "loss": 1.086,
      "num_input_tokens_seen": 43615168480,
      "step": 55436
    },
    {
      "epoch": 5.881285805219605,
      "grad_norm": 0.6738001568426952,
      "learning_rate": 2.5812970169426298e-05,
      "loss": 1.2136,
      "num_input_tokens_seen": 43615955168,
      "step": 55437
    },
    {
      "epoch": 5.881391894759177,
      "grad_norm": 0.7290238110029693,
      "learning_rate": 2.5812275567844303e-05,
      "loss": 1.1869,
      "num_input_tokens_seen": 43616741952,
      "step": 55438
    },
    {
      "epoch": 5.881497984298748,
      "grad_norm": 0.9976254848224803,
      "learning_rate": 2.5811580965634596e-05,
      "loss": 1.1586,
      "num_input_tokens_seen": 43617528720,
      "step": 55439
    },
    {
      "epoch": 5.88160407383832,
      "grad_norm": 0.9126100457473998,
      "learning_rate": 2.5810886362797722e-05,
      "loss": 1.228,
      "num_input_tokens_seen": 43618315440,
      "step": 55440
    },
    {
      "epoch": 5.881710163377891,
      "grad_norm": 0.9006161354395729,
      "learning_rate": 2.5810191759334223e-05,
      "loss": 1.088,
      "num_input_tokens_seen": 43619102240,
      "step": 55441
    },
    {
      "epoch": 5.881816252917463,
      "grad_norm": 1.1147892508637711,
      "learning_rate": 2.5809497155244628e-05,
      "loss": 1.1482,
      "num_input_tokens_seen": 43619889104,
      "step": 55442
    },
    {
      "epoch": 5.881922342457034,
      "grad_norm": 0.726185608523951,
      "learning_rate": 2.5808802550529482e-05,
      "loss": 1.1212,
      "num_input_tokens_seen": 43620675824,
      "step": 55443
    },
    {
      "epoch": 5.882028431996606,
      "grad_norm": 1.2289109169461356,
      "learning_rate": 2.5808107945189314e-05,
      "loss": 1.2301,
      "num_input_tokens_seen": 43621462608,
      "step": 55444
    },
    {
      "epoch": 5.882134521536177,
      "grad_norm": 0.6512764848077995,
      "learning_rate": 2.5807413339224666e-05,
      "loss": 1.1771,
      "num_input_tokens_seen": 43622249456,
      "step": 55445
    },
    {
      "epoch": 5.882240611075748,
      "grad_norm": 0.6972391308183838,
      "learning_rate": 2.5806718732636066e-05,
      "loss": 1.1238,
      "num_input_tokens_seen": 43623036160,
      "step": 55446
    },
    {
      "epoch": 5.88234670061532,
      "grad_norm": 0.7031264117735847,
      "learning_rate": 2.5806024125424067e-05,
      "loss": 1.1249,
      "num_input_tokens_seen": 43623822928,
      "step": 55447
    },
    {
      "epoch": 5.882452790154891,
      "grad_norm": 0.8740558917463285,
      "learning_rate": 2.5805329517589194e-05,
      "loss": 1.1893,
      "num_input_tokens_seen": 43624609696,
      "step": 55448
    },
    {
      "epoch": 5.882558879694463,
      "grad_norm": 0.6862019853126258,
      "learning_rate": 2.5804634909131982e-05,
      "loss": 1.1862,
      "num_input_tokens_seen": 43625396400,
      "step": 55449
    },
    {
      "epoch": 5.882664969234034,
      "grad_norm": 0.6382220855691739,
      "learning_rate": 2.5803940300052976e-05,
      "loss": 1.1756,
      "num_input_tokens_seen": 43626183152,
      "step": 55450
    },
    {
      "epoch": 5.882771058773605,
      "grad_norm": 0.700559820560714,
      "learning_rate": 2.5803245690352706e-05,
      "loss": 1.1656,
      "num_input_tokens_seen": 43626969808,
      "step": 55451
    },
    {
      "epoch": 5.8828771483131765,
      "grad_norm": 0.6606934679398957,
      "learning_rate": 2.580255108003171e-05,
      "loss": 1.2183,
      "num_input_tokens_seen": 43627756608,
      "step": 55452
    },
    {
      "epoch": 5.882983237852748,
      "grad_norm": 0.6145553914501641,
      "learning_rate": 2.580185646909053e-05,
      "loss": 1.0957,
      "num_input_tokens_seen": 43628543376,
      "step": 55453
    },
    {
      "epoch": 5.8830893273923195,
      "grad_norm": 0.707531463596443,
      "learning_rate": 2.5801161857529698e-05,
      "loss": 1.1772,
      "num_input_tokens_seen": 43629330176,
      "step": 55454
    },
    {
      "epoch": 5.8831954169318905,
      "grad_norm": 0.6964052097075958,
      "learning_rate": 2.5800467245349745e-05,
      "loss": 1.145,
      "num_input_tokens_seen": 43630116928,
      "step": 55455
    },
    {
      "epoch": 5.8833015064714616,
      "grad_norm": 0.7094905727061293,
      "learning_rate": 2.579977263255122e-05,
      "loss": 1.2348,
      "num_input_tokens_seen": 43630903616,
      "step": 55456
    },
    {
      "epoch": 5.8834075960110335,
      "grad_norm": 0.6479068455227389,
      "learning_rate": 2.579907801913466e-05,
      "loss": 1.135,
      "num_input_tokens_seen": 43631690352,
      "step": 55457
    },
    {
      "epoch": 5.8835136855506045,
      "grad_norm": 0.6834444959437606,
      "learning_rate": 2.5798383405100585e-05,
      "loss": 1.1275,
      "num_input_tokens_seen": 43632477168,
      "step": 55458
    },
    {
      "epoch": 5.883619775090176,
      "grad_norm": 0.5441334626430792,
      "learning_rate": 2.5797688790449546e-05,
      "loss": 1.0167,
      "num_input_tokens_seen": 43633263920,
      "step": 55459
    },
    {
      "epoch": 5.8837258646297474,
      "grad_norm": 0.6094616982868657,
      "learning_rate": 2.579699417518208e-05,
      "loss": 1.1043,
      "num_input_tokens_seen": 43634050688,
      "step": 55460
    },
    {
      "epoch": 5.8838319541693185,
      "grad_norm": 0.5946170628018987,
      "learning_rate": 2.579629955929872e-05,
      "loss": 1.1128,
      "num_input_tokens_seen": 43634837584,
      "step": 55461
    },
    {
      "epoch": 5.88393804370889,
      "grad_norm": 0.6783066514884695,
      "learning_rate": 2.5795604942800005e-05,
      "loss": 1.1071,
      "num_input_tokens_seen": 43635624320,
      "step": 55462
    },
    {
      "epoch": 5.884044133248461,
      "grad_norm": 0.7453231523143906,
      "learning_rate": 2.5794910325686462e-05,
      "loss": 1.1747,
      "num_input_tokens_seen": 43636411072,
      "step": 55463
    },
    {
      "epoch": 5.884150222788033,
      "grad_norm": 0.9636027222616069,
      "learning_rate": 2.579421570795864e-05,
      "loss": 1.1668,
      "num_input_tokens_seen": 43637197856,
      "step": 55464
    },
    {
      "epoch": 5.884256312327604,
      "grad_norm": 0.6577860534437998,
      "learning_rate": 2.5793521089617072e-05,
      "loss": 1.135,
      "num_input_tokens_seen": 43637984608,
      "step": 55465
    },
    {
      "epoch": 5.884362401867175,
      "grad_norm": 0.695696400162507,
      "learning_rate": 2.579282647066229e-05,
      "loss": 1.116,
      "num_input_tokens_seen": 43638771360,
      "step": 55466
    },
    {
      "epoch": 5.884468491406747,
      "grad_norm": 0.6105826056843165,
      "learning_rate": 2.579213185109484e-05,
      "loss": 1.1589,
      "num_input_tokens_seen": 43639558144,
      "step": 55467
    },
    {
      "epoch": 5.884574580946318,
      "grad_norm": 0.6449658052321277,
      "learning_rate": 2.5791437230915255e-05,
      "loss": 1.1702,
      "num_input_tokens_seen": 43640344896,
      "step": 55468
    },
    {
      "epoch": 5.88468067048589,
      "grad_norm": 0.6159068807073367,
      "learning_rate": 2.5790742610124068e-05,
      "loss": 1.1659,
      "num_input_tokens_seen": 43641131776,
      "step": 55469
    },
    {
      "epoch": 5.884786760025461,
      "grad_norm": 0.603483092803958,
      "learning_rate": 2.5790047988721817e-05,
      "loss": 1.0958,
      "num_input_tokens_seen": 43641918592,
      "step": 55470
    },
    {
      "epoch": 5.884892849565033,
      "grad_norm": 0.6065961236573636,
      "learning_rate": 2.5789353366709046e-05,
      "loss": 1.0693,
      "num_input_tokens_seen": 43642705360,
      "step": 55471
    },
    {
      "epoch": 5.884998939104604,
      "grad_norm": 0.5927339617115585,
      "learning_rate": 2.5788658744086275e-05,
      "loss": 1.1582,
      "num_input_tokens_seen": 43643492000,
      "step": 55472
    },
    {
      "epoch": 5.885105028644176,
      "grad_norm": 0.9544876174323963,
      "learning_rate": 2.5787964120854064e-05,
      "loss": 1.2144,
      "num_input_tokens_seen": 43644278880,
      "step": 55473
    },
    {
      "epoch": 5.885211118183747,
      "grad_norm": 0.6880386467900669,
      "learning_rate": 2.5787269497012928e-05,
      "loss": 1.1969,
      "num_input_tokens_seen": 43645065648,
      "step": 55474
    },
    {
      "epoch": 5.885317207723318,
      "grad_norm": 1.076317312930883,
      "learning_rate": 2.578657487256341e-05,
      "loss": 1.2347,
      "num_input_tokens_seen": 43645852256,
      "step": 55475
    },
    {
      "epoch": 5.88542329726289,
      "grad_norm": 0.7014743598127788,
      "learning_rate": 2.578588024750606e-05,
      "loss": 1.142,
      "num_input_tokens_seen": 43646638960,
      "step": 55476
    },
    {
      "epoch": 5.885529386802461,
      "grad_norm": 0.5584985487400346,
      "learning_rate": 2.5785185621841406e-05,
      "loss": 1.1188,
      "num_input_tokens_seen": 43647425744,
      "step": 55477
    },
    {
      "epoch": 5.885635476342033,
      "grad_norm": 0.7052219189698661,
      "learning_rate": 2.5784490995569976e-05,
      "loss": 1.0583,
      "num_input_tokens_seen": 43648212656,
      "step": 55478
    },
    {
      "epoch": 5.885741565881604,
      "grad_norm": 0.6103282526280094,
      "learning_rate": 2.578379636869232e-05,
      "loss": 1.1056,
      "num_input_tokens_seen": 43648999488,
      "step": 55479
    },
    {
      "epoch": 5.885847655421175,
      "grad_norm": 0.6042651775107942,
      "learning_rate": 2.5783101741208964e-05,
      "loss": 1.0888,
      "num_input_tokens_seen": 43649786416,
      "step": 55480
    },
    {
      "epoch": 5.885953744960747,
      "grad_norm": 0.8271820792472305,
      "learning_rate": 2.5782407113120455e-05,
      "loss": 1.1513,
      "num_input_tokens_seen": 43650573216,
      "step": 55481
    },
    {
      "epoch": 5.886059834500318,
      "grad_norm": 0.6929507449536431,
      "learning_rate": 2.578171248442732e-05,
      "loss": 1.1087,
      "num_input_tokens_seen": 43651360016,
      "step": 55482
    },
    {
      "epoch": 5.88616592403989,
      "grad_norm": 0.6636869755442861,
      "learning_rate": 2.57810178551301e-05,
      "loss": 1.2441,
      "num_input_tokens_seen": 43652146736,
      "step": 55483
    },
    {
      "epoch": 5.886272013579461,
      "grad_norm": 0.7610037019863443,
      "learning_rate": 2.5780323225229334e-05,
      "loss": 1.1657,
      "num_input_tokens_seen": 43652933520,
      "step": 55484
    },
    {
      "epoch": 5.886378103119032,
      "grad_norm": 0.7461698316000243,
      "learning_rate": 2.5779628594725562e-05,
      "loss": 1.1816,
      "num_input_tokens_seen": 43653720320,
      "step": 55485
    },
    {
      "epoch": 5.886484192658604,
      "grad_norm": 0.5898568244953873,
      "learning_rate": 2.5778933963619313e-05,
      "loss": 1.1,
      "num_input_tokens_seen": 43654507072,
      "step": 55486
    },
    {
      "epoch": 5.886590282198175,
      "grad_norm": 0.5711668159453864,
      "learning_rate": 2.5778239331911124e-05,
      "loss": 1.1137,
      "num_input_tokens_seen": 43655293824,
      "step": 55487
    },
    {
      "epoch": 5.886696371737747,
      "grad_norm": 0.7189818300446039,
      "learning_rate": 2.5777544699601542e-05,
      "loss": 1.1248,
      "num_input_tokens_seen": 43656080624,
      "step": 55488
    },
    {
      "epoch": 5.886802461277318,
      "grad_norm": 0.6167470047959098,
      "learning_rate": 2.5776850066691082e-05,
      "loss": 1.1776,
      "num_input_tokens_seen": 43656867360,
      "step": 55489
    },
    {
      "epoch": 5.886908550816889,
      "grad_norm": 0.5777767390348834,
      "learning_rate": 2.57761554331803e-05,
      "loss": 1.1604,
      "num_input_tokens_seen": 43657654112,
      "step": 55490
    },
    {
      "epoch": 5.887014640356461,
      "grad_norm": 0.9323406550262238,
      "learning_rate": 2.5775460799069735e-05,
      "loss": 1.1951,
      "num_input_tokens_seen": 43658440912,
      "step": 55491
    },
    {
      "epoch": 5.887120729896032,
      "grad_norm": 0.6148106377050725,
      "learning_rate": 2.577476616435991e-05,
      "loss": 1.1582,
      "num_input_tokens_seen": 43659227600,
      "step": 55492
    },
    {
      "epoch": 5.887226819435604,
      "grad_norm": 0.5837121664916957,
      "learning_rate": 2.5774071529051373e-05,
      "loss": 1.1744,
      "num_input_tokens_seen": 43660014288,
      "step": 55493
    },
    {
      "epoch": 5.887332908975175,
      "grad_norm": 0.6952680323034841,
      "learning_rate": 2.5773376893144656e-05,
      "loss": 1.1142,
      "num_input_tokens_seen": 43660801072,
      "step": 55494
    },
    {
      "epoch": 5.887438998514746,
      "grad_norm": 0.8047983927776856,
      "learning_rate": 2.577268225664029e-05,
      "loss": 1.1988,
      "num_input_tokens_seen": 43661587888,
      "step": 55495
    },
    {
      "epoch": 5.887545088054318,
      "grad_norm": 0.5969345075230197,
      "learning_rate": 2.5771987619538825e-05,
      "loss": 1.2597,
      "num_input_tokens_seen": 43662374704,
      "step": 55496
    },
    {
      "epoch": 5.887651177593889,
      "grad_norm": 0.7990362395097373,
      "learning_rate": 2.577129298184079e-05,
      "loss": 1.0849,
      "num_input_tokens_seen": 43663161472,
      "step": 55497
    },
    {
      "epoch": 5.887757267133461,
      "grad_norm": 0.5851459417059574,
      "learning_rate": 2.577059834354672e-05,
      "loss": 1.0772,
      "num_input_tokens_seen": 43663948304,
      "step": 55498
    },
    {
      "epoch": 5.887863356673032,
      "grad_norm": 0.7349486885496344,
      "learning_rate": 2.5769903704657155e-05,
      "loss": 1.1997,
      "num_input_tokens_seen": 43664735056,
      "step": 55499
    },
    {
      "epoch": 5.887969446212604,
      "grad_norm": 0.6246210490368931,
      "learning_rate": 2.5769209065172634e-05,
      "loss": 1.1068,
      "num_input_tokens_seen": 43665521792,
      "step": 55500
    },
    {
      "epoch": 5.888075535752175,
      "grad_norm": 0.7138671465459081,
      "learning_rate": 2.576851442509368e-05,
      "loss": 1.192,
      "num_input_tokens_seen": 43666308656,
      "step": 55501
    },
    {
      "epoch": 5.888181625291747,
      "grad_norm": 0.6201774824282689,
      "learning_rate": 2.5767819784420854e-05,
      "loss": 1.2376,
      "num_input_tokens_seen": 43667095408,
      "step": 55502
    },
    {
      "epoch": 5.888287714831318,
      "grad_norm": 0.6107086574744223,
      "learning_rate": 2.5767125143154675e-05,
      "loss": 1.0718,
      "num_input_tokens_seen": 43667882144,
      "step": 55503
    },
    {
      "epoch": 5.888393804370889,
      "grad_norm": 0.7660600032813062,
      "learning_rate": 2.576643050129568e-05,
      "loss": 1.2488,
      "num_input_tokens_seen": 43668668816,
      "step": 55504
    },
    {
      "epoch": 5.888499893910461,
      "grad_norm": 0.6637922712239663,
      "learning_rate": 2.5765735858844414e-05,
      "loss": 1.2744,
      "num_input_tokens_seen": 43669455536,
      "step": 55505
    },
    {
      "epoch": 5.888605983450032,
      "grad_norm": 0.7749990354102116,
      "learning_rate": 2.5765041215801407e-05,
      "loss": 1.123,
      "num_input_tokens_seen": 43670242288,
      "step": 55506
    },
    {
      "epoch": 5.888712072989604,
      "grad_norm": 0.712555445229256,
      "learning_rate": 2.5764346572167197e-05,
      "loss": 1.106,
      "num_input_tokens_seen": 43671028992,
      "step": 55507
    },
    {
      "epoch": 5.888818162529175,
      "grad_norm": 0.683953073386802,
      "learning_rate": 2.576365192794233e-05,
      "loss": 1.1478,
      "num_input_tokens_seen": 43671815888,
      "step": 55508
    },
    {
      "epoch": 5.888924252068746,
      "grad_norm": 0.7743984724969681,
      "learning_rate": 2.5762957283127325e-05,
      "loss": 1.0766,
      "num_input_tokens_seen": 43672602640,
      "step": 55509
    },
    {
      "epoch": 5.889030341608318,
      "grad_norm": 0.799807897683234,
      "learning_rate": 2.576226263772274e-05,
      "loss": 1.1559,
      "num_input_tokens_seen": 43673389520,
      "step": 55510
    },
    {
      "epoch": 5.889136431147889,
      "grad_norm": 0.870177260129138,
      "learning_rate": 2.5761567991729096e-05,
      "loss": 1.1487,
      "num_input_tokens_seen": 43674176304,
      "step": 55511
    },
    {
      "epoch": 5.889242520687461,
      "grad_norm": 0.6732567427413656,
      "learning_rate": 2.576087334514693e-05,
      "loss": 1.1114,
      "num_input_tokens_seen": 43674963056,
      "step": 55512
    },
    {
      "epoch": 5.889348610227032,
      "grad_norm": 0.8159739531670991,
      "learning_rate": 2.576017869797679e-05,
      "loss": 1.1413,
      "num_input_tokens_seen": 43675749936,
      "step": 55513
    },
    {
      "epoch": 5.889454699766603,
      "grad_norm": 0.7888575276054706,
      "learning_rate": 2.5759484050219207e-05,
      "loss": 1.0745,
      "num_input_tokens_seen": 43676536672,
      "step": 55514
    },
    {
      "epoch": 5.8895607893061745,
      "grad_norm": 0.6410736873969994,
      "learning_rate": 2.5758789401874712e-05,
      "loss": 1.1256,
      "num_input_tokens_seen": 43677323408,
      "step": 55515
    },
    {
      "epoch": 5.889666878845746,
      "grad_norm": 0.8419816194890339,
      "learning_rate": 2.5758094752943847e-05,
      "loss": 1.1726,
      "num_input_tokens_seen": 43678110080,
      "step": 55516
    },
    {
      "epoch": 5.8897729683853175,
      "grad_norm": 0.6931277082225381,
      "learning_rate": 2.5757400103427153e-05,
      "loss": 1.1826,
      "num_input_tokens_seen": 43678896880,
      "step": 55517
    },
    {
      "epoch": 5.8898790579248885,
      "grad_norm": 0.6364551621350715,
      "learning_rate": 2.575670545332516e-05,
      "loss": 1.1205,
      "num_input_tokens_seen": 43679683648,
      "step": 55518
    },
    {
      "epoch": 5.88998514746446,
      "grad_norm": 0.6677029532251416,
      "learning_rate": 2.57560108026384e-05,
      "loss": 1.1559,
      "num_input_tokens_seen": 43680470448,
      "step": 55519
    },
    {
      "epoch": 5.8900912370040315,
      "grad_norm": 0.7168641372567705,
      "learning_rate": 2.575531615136743e-05,
      "loss": 1.1781,
      "num_input_tokens_seen": 43681257344,
      "step": 55520
    },
    {
      "epoch": 5.8901973265436025,
      "grad_norm": 0.6349007273144478,
      "learning_rate": 2.5754621499512764e-05,
      "loss": 1.1538,
      "num_input_tokens_seen": 43682044176,
      "step": 55521
    },
    {
      "epoch": 5.890303416083174,
      "grad_norm": 0.7905959524853692,
      "learning_rate": 2.5753926847074955e-05,
      "loss": 1.1123,
      "num_input_tokens_seen": 43682830896,
      "step": 55522
    },
    {
      "epoch": 5.8904095056227455,
      "grad_norm": 0.6379447051180993,
      "learning_rate": 2.5753232194054527e-05,
      "loss": 1.2031,
      "num_input_tokens_seen": 43683617760,
      "step": 55523
    },
    {
      "epoch": 5.890515595162317,
      "grad_norm": 0.5940576171763905,
      "learning_rate": 2.575253754045203e-05,
      "loss": 1.1558,
      "num_input_tokens_seen": 43684404464,
      "step": 55524
    },
    {
      "epoch": 5.890621684701888,
      "grad_norm": 0.7324333517695766,
      "learning_rate": 2.575184288626799e-05,
      "loss": 1.1285,
      "num_input_tokens_seen": 43685191184,
      "step": 55525
    },
    {
      "epoch": 5.890727774241459,
      "grad_norm": 0.6110121622438082,
      "learning_rate": 2.5751148231502947e-05,
      "loss": 1.1506,
      "num_input_tokens_seen": 43685977936,
      "step": 55526
    },
    {
      "epoch": 5.890833863781031,
      "grad_norm": 0.9114695736214319,
      "learning_rate": 2.5750453576157447e-05,
      "loss": 1.2293,
      "num_input_tokens_seen": 43686764640,
      "step": 55527
    },
    {
      "epoch": 5.890939953320602,
      "grad_norm": 0.7686550123973501,
      "learning_rate": 2.574975892023201e-05,
      "loss": 1.1628,
      "num_input_tokens_seen": 43687551424,
      "step": 55528
    },
    {
      "epoch": 5.891046042860174,
      "grad_norm": 0.6422938539108262,
      "learning_rate": 2.574906426372718e-05,
      "loss": 1.1522,
      "num_input_tokens_seen": 43688338192,
      "step": 55529
    },
    {
      "epoch": 5.891152132399745,
      "grad_norm": 0.9662669340710616,
      "learning_rate": 2.5748369606643504e-05,
      "loss": 1.1664,
      "num_input_tokens_seen": 43689124976,
      "step": 55530
    },
    {
      "epoch": 5.891258221939317,
      "grad_norm": 0.6617547423522935,
      "learning_rate": 2.5747674948981504e-05,
      "loss": 1.163,
      "num_input_tokens_seen": 43689911728,
      "step": 55531
    },
    {
      "epoch": 5.891364311478888,
      "grad_norm": 0.7777324658792268,
      "learning_rate": 2.574698029074172e-05,
      "loss": 1.1531,
      "num_input_tokens_seen": 43690698512,
      "step": 55532
    },
    {
      "epoch": 5.891470401018459,
      "grad_norm": 0.6574437100719557,
      "learning_rate": 2.57462856319247e-05,
      "loss": 1.115,
      "num_input_tokens_seen": 43691485344,
      "step": 55533
    },
    {
      "epoch": 5.891576490558031,
      "grad_norm": 0.7693355761995475,
      "learning_rate": 2.5745590972530964e-05,
      "loss": 1.1837,
      "num_input_tokens_seen": 43692272048,
      "step": 55534
    },
    {
      "epoch": 5.891682580097602,
      "grad_norm": 0.7751171086568878,
      "learning_rate": 2.5744896312561057e-05,
      "loss": 1.1581,
      "num_input_tokens_seen": 43693058784,
      "step": 55535
    },
    {
      "epoch": 5.891788669637174,
      "grad_norm": 1.3489931034122915,
      "learning_rate": 2.574420165201552e-05,
      "loss": 1.1996,
      "num_input_tokens_seen": 43693845520,
      "step": 55536
    },
    {
      "epoch": 5.891894759176745,
      "grad_norm": 0.6254328579182429,
      "learning_rate": 2.5743506990894885e-05,
      "loss": 1.1444,
      "num_input_tokens_seen": 43694632272,
      "step": 55537
    },
    {
      "epoch": 5.892000848716316,
      "grad_norm": 0.9783784702448736,
      "learning_rate": 2.5742812329199683e-05,
      "loss": 1.1235,
      "num_input_tokens_seen": 43695419104,
      "step": 55538
    },
    {
      "epoch": 5.892106938255888,
      "grad_norm": 0.5899772999307301,
      "learning_rate": 2.574211766693047e-05,
      "loss": 1.104,
      "num_input_tokens_seen": 43696205856,
      "step": 55539
    },
    {
      "epoch": 5.892213027795459,
      "grad_norm": 0.6656830620719334,
      "learning_rate": 2.5741423004087768e-05,
      "loss": 1.1861,
      "num_input_tokens_seen": 43696992624,
      "step": 55540
    },
    {
      "epoch": 5.892319117335031,
      "grad_norm": 0.594689471049261,
      "learning_rate": 2.5740728340672103e-05,
      "loss": 1.1754,
      "num_input_tokens_seen": 43697779392,
      "step": 55541
    },
    {
      "epoch": 5.892425206874602,
      "grad_norm": 0.5905949875856401,
      "learning_rate": 2.5740033676684038e-05,
      "loss": 1.034,
      "num_input_tokens_seen": 43698566208,
      "step": 55542
    },
    {
      "epoch": 5.892531296414173,
      "grad_norm": 0.9259427817980728,
      "learning_rate": 2.5739339012124097e-05,
      "loss": 1.2191,
      "num_input_tokens_seen": 43699353056,
      "step": 55543
    },
    {
      "epoch": 5.892637385953745,
      "grad_norm": 0.6157063327642617,
      "learning_rate": 2.5738644346992808e-05,
      "loss": 1.1974,
      "num_input_tokens_seen": 43700139840,
      "step": 55544
    },
    {
      "epoch": 5.892743475493316,
      "grad_norm": 0.854452406480606,
      "learning_rate": 2.5737949681290724e-05,
      "loss": 1.166,
      "num_input_tokens_seen": 43700926592,
      "step": 55545
    },
    {
      "epoch": 5.892849565032888,
      "grad_norm": 0.7964211343968295,
      "learning_rate": 2.5737255015018374e-05,
      "loss": 1.1852,
      "num_input_tokens_seen": 43701713408,
      "step": 55546
    },
    {
      "epoch": 5.892955654572459,
      "grad_norm": 0.7400243428471209,
      "learning_rate": 2.5736560348176285e-05,
      "loss": 1.1665,
      "num_input_tokens_seen": 43702500096,
      "step": 55547
    },
    {
      "epoch": 5.89306174411203,
      "grad_norm": 0.6563044108847187,
      "learning_rate": 2.5735865680765014e-05,
      "loss": 1.1351,
      "num_input_tokens_seen": 43703286864,
      "step": 55548
    },
    {
      "epoch": 5.893167833651602,
      "grad_norm": 1.086130709247981,
      "learning_rate": 2.573517101278508e-05,
      "loss": 1.1657,
      "num_input_tokens_seen": 43704073648,
      "step": 55549
    },
    {
      "epoch": 5.893273923191173,
      "grad_norm": 0.6891348100612784,
      "learning_rate": 2.5734476344237036e-05,
      "loss": 1.1171,
      "num_input_tokens_seen": 43704860432,
      "step": 55550
    },
    {
      "epoch": 5.893380012730745,
      "grad_norm": 0.9569799005914109,
      "learning_rate": 2.5733781675121406e-05,
      "loss": 1.172,
      "num_input_tokens_seen": 43705647248,
      "step": 55551
    },
    {
      "epoch": 5.893486102270316,
      "grad_norm": 0.6745956232660959,
      "learning_rate": 2.5733087005438728e-05,
      "loss": 1.2676,
      "num_input_tokens_seen": 43706433984,
      "step": 55552
    },
    {
      "epoch": 5.893592191809888,
      "grad_norm": 0.7348880477621567,
      "learning_rate": 2.5732392335189547e-05,
      "loss": 1.1579,
      "num_input_tokens_seen": 43707220816,
      "step": 55553
    },
    {
      "epoch": 5.893698281349459,
      "grad_norm": 0.6773857887742573,
      "learning_rate": 2.5731697664374393e-05,
      "loss": 1.1871,
      "num_input_tokens_seen": 43708007632,
      "step": 55554
    },
    {
      "epoch": 5.89380437088903,
      "grad_norm": 0.7395668736674766,
      "learning_rate": 2.5731002992993804e-05,
      "loss": 1.2895,
      "num_input_tokens_seen": 43708794448,
      "step": 55555
    },
    {
      "epoch": 5.893910460428602,
      "grad_norm": 0.6288104279649053,
      "learning_rate": 2.5730308321048318e-05,
      "loss": 1.2074,
      "num_input_tokens_seen": 43709581280,
      "step": 55556
    },
    {
      "epoch": 5.894016549968173,
      "grad_norm": 0.7129230133110803,
      "learning_rate": 2.5729613648538475e-05,
      "loss": 1.1011,
      "num_input_tokens_seen": 43710368112,
      "step": 55557
    },
    {
      "epoch": 5.894122639507745,
      "grad_norm": 0.8133923649104915,
      "learning_rate": 2.57289189754648e-05,
      "loss": 1.2151,
      "num_input_tokens_seen": 43711154912,
      "step": 55558
    },
    {
      "epoch": 5.894228729047316,
      "grad_norm": 0.6867020075559558,
      "learning_rate": 2.5728224301827842e-05,
      "loss": 1.1321,
      "num_input_tokens_seen": 43711941712,
      "step": 55559
    },
    {
      "epoch": 5.894334818586888,
      "grad_norm": 1.1184545192819817,
      "learning_rate": 2.5727529627628134e-05,
      "loss": 1.187,
      "num_input_tokens_seen": 43712728496,
      "step": 55560
    },
    {
      "epoch": 5.894440908126459,
      "grad_norm": 0.6909485996204411,
      "learning_rate": 2.572683495286621e-05,
      "loss": 1.2409,
      "num_input_tokens_seen": 43713515248,
      "step": 55561
    },
    {
      "epoch": 5.89454699766603,
      "grad_norm": 0.7207827495879214,
      "learning_rate": 2.572614027754261e-05,
      "loss": 1.1207,
      "num_input_tokens_seen": 43714302032,
      "step": 55562
    },
    {
      "epoch": 5.894653087205602,
      "grad_norm": 1.0876717119021604,
      "learning_rate": 2.5725445601657873e-05,
      "loss": 1.1706,
      "num_input_tokens_seen": 43715088864,
      "step": 55563
    },
    {
      "epoch": 5.894759176745173,
      "grad_norm": 0.7561829688681673,
      "learning_rate": 2.5724750925212528e-05,
      "loss": 1.1156,
      "num_input_tokens_seen": 43715875664,
      "step": 55564
    },
    {
      "epoch": 5.894865266284745,
      "grad_norm": 0.6319653894392694,
      "learning_rate": 2.5724056248207125e-05,
      "loss": 1.121,
      "num_input_tokens_seen": 43716662464,
      "step": 55565
    },
    {
      "epoch": 5.894971355824316,
      "grad_norm": 1.221110777208296,
      "learning_rate": 2.5723361570642178e-05,
      "loss": 1.1433,
      "num_input_tokens_seen": 43717449184,
      "step": 55566
    },
    {
      "epoch": 5.895077445363887,
      "grad_norm": 1.030525319402366,
      "learning_rate": 2.5722666892518248e-05,
      "loss": 1.1316,
      "num_input_tokens_seen": 43718235968,
      "step": 55567
    },
    {
      "epoch": 5.895183534903459,
      "grad_norm": 0.5970368351558523,
      "learning_rate": 2.5721972213835865e-05,
      "loss": 1.1832,
      "num_input_tokens_seen": 43719022656,
      "step": 55568
    },
    {
      "epoch": 5.89528962444303,
      "grad_norm": 0.9927883884306663,
      "learning_rate": 2.5721277534595555e-05,
      "loss": 1.1659,
      "num_input_tokens_seen": 43719809504,
      "step": 55569
    },
    {
      "epoch": 5.895395713982602,
      "grad_norm": 1.0847696334280297,
      "learning_rate": 2.5720582854797874e-05,
      "loss": 1.117,
      "num_input_tokens_seen": 43720596192,
      "step": 55570
    },
    {
      "epoch": 5.895501803522173,
      "grad_norm": 0.7288487690251377,
      "learning_rate": 2.571988817444334e-05,
      "loss": 1.235,
      "num_input_tokens_seen": 43721382896,
      "step": 55571
    },
    {
      "epoch": 5.895607893061744,
      "grad_norm": 0.9047785729891211,
      "learning_rate": 2.5719193493532502e-05,
      "loss": 1.2321,
      "num_input_tokens_seen": 43722169696,
      "step": 55572
    },
    {
      "epoch": 5.895713982601316,
      "grad_norm": 1.109419627454964,
      "learning_rate": 2.5718498812065888e-05,
      "loss": 1.0996,
      "num_input_tokens_seen": 43722956592,
      "step": 55573
    },
    {
      "epoch": 5.895820072140887,
      "grad_norm": 0.6157605190965071,
      "learning_rate": 2.5717804130044044e-05,
      "loss": 1.1174,
      "num_input_tokens_seen": 43723743360,
      "step": 55574
    },
    {
      "epoch": 5.895926161680459,
      "grad_norm": 0.7728657020446476,
      "learning_rate": 2.5717109447467492e-05,
      "loss": 1.0538,
      "num_input_tokens_seen": 43724530128,
      "step": 55575
    },
    {
      "epoch": 5.89603225122003,
      "grad_norm": 0.6499922869588798,
      "learning_rate": 2.5716414764336787e-05,
      "loss": 0.9926,
      "num_input_tokens_seen": 43725316944,
      "step": 55576
    },
    {
      "epoch": 5.896138340759601,
      "grad_norm": 0.6343015987883733,
      "learning_rate": 2.571572008065246e-05,
      "loss": 1.1637,
      "num_input_tokens_seen": 43726103680,
      "step": 55577
    },
    {
      "epoch": 5.896244430299173,
      "grad_norm": 0.8793383312085697,
      "learning_rate": 2.5715025396415036e-05,
      "loss": 1.14,
      "num_input_tokens_seen": 43726890432,
      "step": 55578
    },
    {
      "epoch": 5.896350519838744,
      "grad_norm": 0.586955396313388,
      "learning_rate": 2.571433071162507e-05,
      "loss": 1.2474,
      "num_input_tokens_seen": 43727677104,
      "step": 55579
    },
    {
      "epoch": 5.8964566093783155,
      "grad_norm": 0.6703612797531369,
      "learning_rate": 2.571363602628309e-05,
      "loss": 1.1445,
      "num_input_tokens_seen": 43728463856,
      "step": 55580
    },
    {
      "epoch": 5.8965626989178865,
      "grad_norm": 0.6321391728487816,
      "learning_rate": 2.5712941340389624e-05,
      "loss": 1.1332,
      "num_input_tokens_seen": 43729250656,
      "step": 55581
    },
    {
      "epoch": 5.8966687884574585,
      "grad_norm": 0.6108466954322127,
      "learning_rate": 2.5712246653945228e-05,
      "loss": 1.1758,
      "num_input_tokens_seen": 43730037536,
      "step": 55582
    },
    {
      "epoch": 5.8967748779970295,
      "grad_norm": 0.545719243720591,
      "learning_rate": 2.571155196695042e-05,
      "loss": 1.1297,
      "num_input_tokens_seen": 43730824288,
      "step": 55583
    },
    {
      "epoch": 5.8968809675366005,
      "grad_norm": 0.6512852556390702,
      "learning_rate": 2.5710857279405755e-05,
      "loss": 1.141,
      "num_input_tokens_seen": 43731611024,
      "step": 55584
    },
    {
      "epoch": 5.896987057076172,
      "grad_norm": 0.62145064372461,
      "learning_rate": 2.5710162591311748e-05,
      "loss": 1.1066,
      "num_input_tokens_seen": 43732397824,
      "step": 55585
    },
    {
      "epoch": 5.8970931466157435,
      "grad_norm": 0.6271176018189228,
      "learning_rate": 2.570946790266896e-05,
      "loss": 1.1595,
      "num_input_tokens_seen": 43733184512,
      "step": 55586
    },
    {
      "epoch": 5.897199236155315,
      "grad_norm": 0.6709209584506932,
      "learning_rate": 2.570877321347791e-05,
      "loss": 1.1765,
      "num_input_tokens_seen": 43733971216,
      "step": 55587
    },
    {
      "epoch": 5.897305325694886,
      "grad_norm": 0.6085465316798866,
      "learning_rate": 2.5708078523739142e-05,
      "loss": 1.0281,
      "num_input_tokens_seen": 43734758032,
      "step": 55588
    },
    {
      "epoch": 5.897411415234458,
      "grad_norm": 0.6043818366897591,
      "learning_rate": 2.5707383833453197e-05,
      "loss": 1.1485,
      "num_input_tokens_seen": 43735544800,
      "step": 55589
    },
    {
      "epoch": 5.897517504774029,
      "grad_norm": 0.7170023141265596,
      "learning_rate": 2.5706689142620598e-05,
      "loss": 1.2222,
      "num_input_tokens_seen": 43736331584,
      "step": 55590
    },
    {
      "epoch": 5.8976235943136,
      "grad_norm": 0.7245491706962116,
      "learning_rate": 2.5705994451241893e-05,
      "loss": 1.2413,
      "num_input_tokens_seen": 43737118352,
      "step": 55591
    },
    {
      "epoch": 5.897729683853172,
      "grad_norm": 0.5956450633789233,
      "learning_rate": 2.5705299759317613e-05,
      "loss": 1.1657,
      "num_input_tokens_seen": 43737905168,
      "step": 55592
    },
    {
      "epoch": 5.897835773392743,
      "grad_norm": 0.5600353811541068,
      "learning_rate": 2.570460506684831e-05,
      "loss": 1.2112,
      "num_input_tokens_seen": 43738691968,
      "step": 55593
    },
    {
      "epoch": 5.897941862932315,
      "grad_norm": 0.7045678773037118,
      "learning_rate": 2.57039103738345e-05,
      "loss": 1.149,
      "num_input_tokens_seen": 43739478816,
      "step": 55594
    },
    {
      "epoch": 5.898047952471886,
      "grad_norm": 0.6111361912965408,
      "learning_rate": 2.5703215680276726e-05,
      "loss": 1.1347,
      "num_input_tokens_seen": 43740265664,
      "step": 55595
    },
    {
      "epoch": 5.898154042011457,
      "grad_norm": 0.7078684109382136,
      "learning_rate": 2.5702520986175532e-05,
      "loss": 1.214,
      "num_input_tokens_seen": 43741052448,
      "step": 55596
    },
    {
      "epoch": 5.898260131551029,
      "grad_norm": 0.6205398339589684,
      "learning_rate": 2.5701826291531457e-05,
      "loss": 1.1397,
      "num_input_tokens_seen": 43741839296,
      "step": 55597
    },
    {
      "epoch": 5.8983662210906,
      "grad_norm": 0.5705756964550363,
      "learning_rate": 2.5701131596345017e-05,
      "loss": 1.1333,
      "num_input_tokens_seen": 43742626080,
      "step": 55598
    },
    {
      "epoch": 5.898472310630172,
      "grad_norm": 0.5673147943765994,
      "learning_rate": 2.5700436900616774e-05,
      "loss": 1.2268,
      "num_input_tokens_seen": 43743412896,
      "step": 55599
    },
    {
      "epoch": 5.898578400169743,
      "grad_norm": 0.757584791271981,
      "learning_rate": 2.5699742204347253e-05,
      "loss": 1.2179,
      "num_input_tokens_seen": 43744199600,
      "step": 55600
    },
    {
      "epoch": 5.898684489709314,
      "grad_norm": 0.6058819150678851,
      "learning_rate": 2.5699047507536983e-05,
      "loss": 1.1068,
      "num_input_tokens_seen": 43744986320,
      "step": 55601
    },
    {
      "epoch": 5.898790579248886,
      "grad_norm": 0.6396879454587566,
      "learning_rate": 2.5698352810186523e-05,
      "loss": 1.0874,
      "num_input_tokens_seen": 43745773008,
      "step": 55602
    },
    {
      "epoch": 5.898896668788457,
      "grad_norm": 0.6864378096031662,
      "learning_rate": 2.5697658112296387e-05,
      "loss": 1.1589,
      "num_input_tokens_seen": 43746559728,
      "step": 55603
    },
    {
      "epoch": 5.899002758328029,
      "grad_norm": 0.6060496082597552,
      "learning_rate": 2.569696341386712e-05,
      "loss": 1.1331,
      "num_input_tokens_seen": 43747346400,
      "step": 55604
    },
    {
      "epoch": 5.8991088478676,
      "grad_norm": 0.7888927675222684,
      "learning_rate": 2.5696268714899262e-05,
      "loss": 1.1432,
      "num_input_tokens_seen": 43748133120,
      "step": 55605
    },
    {
      "epoch": 5.899214937407171,
      "grad_norm": 0.6164476297472294,
      "learning_rate": 2.5695574015393354e-05,
      "loss": 1.1449,
      "num_input_tokens_seen": 43748919888,
      "step": 55606
    },
    {
      "epoch": 5.899321026946743,
      "grad_norm": 0.7036124424979803,
      "learning_rate": 2.569487931534992e-05,
      "loss": 1.1529,
      "num_input_tokens_seen": 43749706576,
      "step": 55607
    },
    {
      "epoch": 5.899427116486314,
      "grad_norm": 0.8707938110811134,
      "learning_rate": 2.5694184614769508e-05,
      "loss": 1.1605,
      "num_input_tokens_seen": 43750493312,
      "step": 55608
    },
    {
      "epoch": 5.899533206025886,
      "grad_norm": 0.6983718128001976,
      "learning_rate": 2.5693489913652645e-05,
      "loss": 1.0464,
      "num_input_tokens_seen": 43751280112,
      "step": 55609
    },
    {
      "epoch": 5.899639295565457,
      "grad_norm": 0.9068298503142093,
      "learning_rate": 2.5692795211999877e-05,
      "loss": 1.0868,
      "num_input_tokens_seen": 43752066816,
      "step": 55610
    },
    {
      "epoch": 5.899745385105029,
      "grad_norm": 0.830681200818152,
      "learning_rate": 2.569210050981174e-05,
      "loss": 1.1721,
      "num_input_tokens_seen": 43752853616,
      "step": 55611
    },
    {
      "epoch": 5.8998514746446,
      "grad_norm": 0.7616082381498244,
      "learning_rate": 2.5691405807088757e-05,
      "loss": 1.1442,
      "num_input_tokens_seen": 43753640384,
      "step": 55612
    },
    {
      "epoch": 5.899957564184171,
      "grad_norm": 1.070867384834737,
      "learning_rate": 2.569071110383149e-05,
      "loss": 1.209,
      "num_input_tokens_seen": 43754427056,
      "step": 55613
    },
    {
      "epoch": 5.900063653723743,
      "grad_norm": 0.6142399691796485,
      "learning_rate": 2.5690016400040458e-05,
      "loss": 1.1192,
      "num_input_tokens_seen": 43755213936,
      "step": 55614
    },
    {
      "epoch": 5.900169743263314,
      "grad_norm": 0.6234486170654003,
      "learning_rate": 2.5689321695716195e-05,
      "loss": 1.1525,
      "num_input_tokens_seen": 43756000608,
      "step": 55615
    },
    {
      "epoch": 5.900275832802886,
      "grad_norm": 0.6788868910180611,
      "learning_rate": 2.5688626990859248e-05,
      "loss": 1.2294,
      "num_input_tokens_seen": 43756787392,
      "step": 55616
    },
    {
      "epoch": 5.900381922342457,
      "grad_norm": 0.8172124208763065,
      "learning_rate": 2.5687932285470157e-05,
      "loss": 1.1702,
      "num_input_tokens_seen": 43757574240,
      "step": 55617
    },
    {
      "epoch": 5.900488011882029,
      "grad_norm": 0.7857773411288758,
      "learning_rate": 2.5687237579549438e-05,
      "loss": 1.2145,
      "num_input_tokens_seen": 43758360912,
      "step": 55618
    },
    {
      "epoch": 5.9005941014216,
      "grad_norm": 1.1124615387298842,
      "learning_rate": 2.5686542873097652e-05,
      "loss": 1.1973,
      "num_input_tokens_seen": 43759147696,
      "step": 55619
    },
    {
      "epoch": 5.900700190961171,
      "grad_norm": 0.732396986054214,
      "learning_rate": 2.568584816611533e-05,
      "loss": 1.1061,
      "num_input_tokens_seen": 43759934416,
      "step": 55620
    },
    {
      "epoch": 5.900806280500743,
      "grad_norm": 0.5917806990002631,
      "learning_rate": 2.5685153458602995e-05,
      "loss": 1.1503,
      "num_input_tokens_seen": 43760721200,
      "step": 55621
    },
    {
      "epoch": 5.900912370040314,
      "grad_norm": 0.6534946374487759,
      "learning_rate": 2.5684458750561197e-05,
      "loss": 1.066,
      "num_input_tokens_seen": 43761507984,
      "step": 55622
    },
    {
      "epoch": 5.901018459579886,
      "grad_norm": 0.586303037176801,
      "learning_rate": 2.568376404199047e-05,
      "loss": 1.184,
      "num_input_tokens_seen": 43762294704,
      "step": 55623
    },
    {
      "epoch": 5.901124549119457,
      "grad_norm": 0.7531537220541318,
      "learning_rate": 2.5683069332891348e-05,
      "loss": 1.1608,
      "num_input_tokens_seen": 43763081472,
      "step": 55624
    },
    {
      "epoch": 5.901230638659028,
      "grad_norm": 0.6261413360973789,
      "learning_rate": 2.568237462326437e-05,
      "loss": 1.091,
      "num_input_tokens_seen": 43763868288,
      "step": 55625
    },
    {
      "epoch": 5.9013367281986,
      "grad_norm": 0.6574988374505639,
      "learning_rate": 2.5681679913110073e-05,
      "loss": 1.1407,
      "num_input_tokens_seen": 43764655040,
      "step": 55626
    },
    {
      "epoch": 5.901442817738171,
      "grad_norm": 0.7109895985370196,
      "learning_rate": 2.5680985202428998e-05,
      "loss": 1.1204,
      "num_input_tokens_seen": 43765441808,
      "step": 55627
    },
    {
      "epoch": 5.901548907277743,
      "grad_norm": 0.7502290879717702,
      "learning_rate": 2.5680290491221675e-05,
      "loss": 1.1645,
      "num_input_tokens_seen": 43766228528,
      "step": 55628
    },
    {
      "epoch": 5.901654996817314,
      "grad_norm": 0.7331431844692764,
      "learning_rate": 2.567959577948864e-05,
      "loss": 1.1111,
      "num_input_tokens_seen": 43767015408,
      "step": 55629
    },
    {
      "epoch": 5.901761086356885,
      "grad_norm": 0.8298056486950928,
      "learning_rate": 2.5678901067230437e-05,
      "loss": 1.0945,
      "num_input_tokens_seen": 43767802192,
      "step": 55630
    },
    {
      "epoch": 5.901867175896457,
      "grad_norm": 0.5610991849175762,
      "learning_rate": 2.5678206354447605e-05,
      "loss": 1.1338,
      "num_input_tokens_seen": 43768589008,
      "step": 55631
    },
    {
      "epoch": 5.901973265436028,
      "grad_norm": 0.6693168987475532,
      "learning_rate": 2.567751164114066e-05,
      "loss": 1.1201,
      "num_input_tokens_seen": 43769375840,
      "step": 55632
    },
    {
      "epoch": 5.9020793549756,
      "grad_norm": 0.5889109676208811,
      "learning_rate": 2.567681692731016e-05,
      "loss": 1.089,
      "num_input_tokens_seen": 43770162560,
      "step": 55633
    },
    {
      "epoch": 5.902185444515171,
      "grad_norm": 0.8076111806801315,
      "learning_rate": 2.5676122212956643e-05,
      "loss": 1.1776,
      "num_input_tokens_seen": 43770949376,
      "step": 55634
    },
    {
      "epoch": 5.902291534054742,
      "grad_norm": 0.618574176758261,
      "learning_rate": 2.567542749808063e-05,
      "loss": 1.1694,
      "num_input_tokens_seen": 43771736096,
      "step": 55635
    },
    {
      "epoch": 5.902397623594314,
      "grad_norm": 0.6217997097555801,
      "learning_rate": 2.567473278268267e-05,
      "loss": 1.1494,
      "num_input_tokens_seen": 43772522832,
      "step": 55636
    },
    {
      "epoch": 5.902503713133885,
      "grad_norm": 0.6317200657567908,
      "learning_rate": 2.5674038066763302e-05,
      "loss": 1.1928,
      "num_input_tokens_seen": 43773309584,
      "step": 55637
    },
    {
      "epoch": 5.902609802673457,
      "grad_norm": 0.5861510061472206,
      "learning_rate": 2.5673343350323047e-05,
      "loss": 1.0521,
      "num_input_tokens_seen": 43774096384,
      "step": 55638
    },
    {
      "epoch": 5.902715892213028,
      "grad_norm": 0.6364069887135734,
      "learning_rate": 2.5672648633362463e-05,
      "loss": 1.1013,
      "num_input_tokens_seen": 43774883264,
      "step": 55639
    },
    {
      "epoch": 5.9028219817525995,
      "grad_norm": 0.6057375152866239,
      "learning_rate": 2.5671953915882068e-05,
      "loss": 1.1582,
      "num_input_tokens_seen": 43775670016,
      "step": 55640
    },
    {
      "epoch": 5.902928071292171,
      "grad_norm": 0.6213833750453011,
      "learning_rate": 2.5671259197882408e-05,
      "loss": 1.1768,
      "num_input_tokens_seen": 43776456832,
      "step": 55641
    },
    {
      "epoch": 5.9030341608317425,
      "grad_norm": 0.5670103234315023,
      "learning_rate": 2.5670564479364018e-05,
      "loss": 1.0528,
      "num_input_tokens_seen": 43777243568,
      "step": 55642
    },
    {
      "epoch": 5.9031402503713135,
      "grad_norm": 0.5644254862236611,
      "learning_rate": 2.5669869760327438e-05,
      "loss": 1.1018,
      "num_input_tokens_seen": 43778030432,
      "step": 55643
    },
    {
      "epoch": 5.9032463399108845,
      "grad_norm": 0.7523406814511294,
      "learning_rate": 2.5669175040773198e-05,
      "loss": 1.1146,
      "num_input_tokens_seen": 43778817216,
      "step": 55644
    },
    {
      "epoch": 5.9033524294504565,
      "grad_norm": 0.6452900090544959,
      "learning_rate": 2.5668480320701844e-05,
      "loss": 1.1814,
      "num_input_tokens_seen": 43779603984,
      "step": 55645
    },
    {
      "epoch": 5.9034585189900275,
      "grad_norm": 0.6570590556770592,
      "learning_rate": 2.566778560011391e-05,
      "loss": 1.1531,
      "num_input_tokens_seen": 43780390800,
      "step": 55646
    },
    {
      "epoch": 5.903564608529599,
      "grad_norm": 0.668619485440774,
      "learning_rate": 2.566709087900992e-05,
      "loss": 1.0771,
      "num_input_tokens_seen": 43781177600,
      "step": 55647
    },
    {
      "epoch": 5.90367069806917,
      "grad_norm": 0.6092149967680753,
      "learning_rate": 2.5666396157390432e-05,
      "loss": 1.2054,
      "num_input_tokens_seen": 43781964352,
      "step": 55648
    },
    {
      "epoch": 5.9037767876087415,
      "grad_norm": 0.6606094966986313,
      "learning_rate": 2.5665701435255974e-05,
      "loss": 1.1683,
      "num_input_tokens_seen": 43782751008,
      "step": 55649
    },
    {
      "epoch": 5.903882877148313,
      "grad_norm": 0.7550845412837448,
      "learning_rate": 2.566500671260707e-05,
      "loss": 1.1911,
      "num_input_tokens_seen": 43783537856,
      "step": 55650
    },
    {
      "epoch": 5.903988966687884,
      "grad_norm": 0.5789102882559516,
      "learning_rate": 2.566431198944428e-05,
      "loss": 1.0508,
      "num_input_tokens_seen": 43784324608,
      "step": 55651
    },
    {
      "epoch": 5.904095056227456,
      "grad_norm": 0.9597700510509702,
      "learning_rate": 2.566361726576812e-05,
      "loss": 1.1506,
      "num_input_tokens_seen": 43785111376,
      "step": 55652
    },
    {
      "epoch": 5.904201145767027,
      "grad_norm": 0.6878606709835041,
      "learning_rate": 2.5662922541579143e-05,
      "loss": 1.1201,
      "num_input_tokens_seen": 43785898144,
      "step": 55653
    },
    {
      "epoch": 5.904307235306598,
      "grad_norm": 0.7472153427621493,
      "learning_rate": 2.5662227816877877e-05,
      "loss": 1.2351,
      "num_input_tokens_seen": 43786684864,
      "step": 55654
    },
    {
      "epoch": 5.90441332484617,
      "grad_norm": 0.681295049471962,
      "learning_rate": 2.5661533091664857e-05,
      "loss": 1.2558,
      "num_input_tokens_seen": 43787471632,
      "step": 55655
    },
    {
      "epoch": 5.904519414385741,
      "grad_norm": 0.7178967932343503,
      "learning_rate": 2.5660838365940626e-05,
      "loss": 1.2438,
      "num_input_tokens_seen": 43788258304,
      "step": 55656
    },
    {
      "epoch": 5.904625503925313,
      "grad_norm": 0.6001309113127494,
      "learning_rate": 2.5660143639705726e-05,
      "loss": 1.0871,
      "num_input_tokens_seen": 43789045072,
      "step": 55657
    },
    {
      "epoch": 5.904731593464884,
      "grad_norm": 0.626653696511386,
      "learning_rate": 2.565944891296067e-05,
      "loss": 1.2091,
      "num_input_tokens_seen": 43789831920,
      "step": 55658
    },
    {
      "epoch": 5.904837683004455,
      "grad_norm": 0.6130368417122078,
      "learning_rate": 2.5658754185706024e-05,
      "loss": 1.1349,
      "num_input_tokens_seen": 43790618752,
      "step": 55659
    },
    {
      "epoch": 5.904943772544027,
      "grad_norm": 1.259578303346819,
      "learning_rate": 2.5658059457942314e-05,
      "loss": 1.1592,
      "num_input_tokens_seen": 43791405520,
      "step": 55660
    },
    {
      "epoch": 5.905049862083598,
      "grad_norm": 0.8680010491580106,
      "learning_rate": 2.5657364729670062e-05,
      "loss": 1.1803,
      "num_input_tokens_seen": 43792192288,
      "step": 55661
    },
    {
      "epoch": 5.90515595162317,
      "grad_norm": 0.8776386422759299,
      "learning_rate": 2.565667000088983e-05,
      "loss": 1.1674,
      "num_input_tokens_seen": 43792979008,
      "step": 55662
    },
    {
      "epoch": 5.905262041162741,
      "grad_norm": 0.9063407068922861,
      "learning_rate": 2.565597527160214e-05,
      "loss": 1.0861,
      "num_input_tokens_seen": 43793765808,
      "step": 55663
    },
    {
      "epoch": 5.905368130702312,
      "grad_norm": 1.1548804228199314,
      "learning_rate": 2.5655280541807525e-05,
      "loss": 1.1281,
      "num_input_tokens_seen": 43794552512,
      "step": 55664
    },
    {
      "epoch": 5.905474220241884,
      "grad_norm": 0.7574093063606365,
      "learning_rate": 2.5654585811506538e-05,
      "loss": 1.2441,
      "num_input_tokens_seen": 43795339280,
      "step": 55665
    },
    {
      "epoch": 5.905580309781455,
      "grad_norm": 0.9346710174316735,
      "learning_rate": 2.5653891080699706e-05,
      "loss": 1.1567,
      "num_input_tokens_seen": 43796126096,
      "step": 55666
    },
    {
      "epoch": 5.905686399321027,
      "grad_norm": 1.0462601570934438,
      "learning_rate": 2.5653196349387554e-05,
      "loss": 1.1323,
      "num_input_tokens_seen": 43796912896,
      "step": 55667
    },
    {
      "epoch": 5.905792488860598,
      "grad_norm": 0.6375014677221661,
      "learning_rate": 2.565250161757064e-05,
      "loss": 1.1459,
      "num_input_tokens_seen": 43797699616,
      "step": 55668
    },
    {
      "epoch": 5.90589857840017,
      "grad_norm": 0.6730510465510547,
      "learning_rate": 2.5651806885249485e-05,
      "loss": 1.1909,
      "num_input_tokens_seen": 43798486352,
      "step": 55669
    },
    {
      "epoch": 5.906004667939741,
      "grad_norm": 1.04744313330345,
      "learning_rate": 2.5651112152424645e-05,
      "loss": 1.1463,
      "num_input_tokens_seen": 43799273120,
      "step": 55670
    },
    {
      "epoch": 5.906110757479313,
      "grad_norm": 0.8498717631080306,
      "learning_rate": 2.565041741909664e-05,
      "loss": 1.1655,
      "num_input_tokens_seen": 43800059888,
      "step": 55671
    },
    {
      "epoch": 5.906216847018884,
      "grad_norm": 0.9152754769792247,
      "learning_rate": 2.5649722685266e-05,
      "loss": 1.1709,
      "num_input_tokens_seen": 43800846704,
      "step": 55672
    },
    {
      "epoch": 5.906322936558455,
      "grad_norm": 1.0962730815302728,
      "learning_rate": 2.564902795093329e-05,
      "loss": 1.2646,
      "num_input_tokens_seen": 43801633440,
      "step": 55673
    },
    {
      "epoch": 5.906429026098027,
      "grad_norm": 0.6499313698969842,
      "learning_rate": 2.5648333216099023e-05,
      "loss": 1.0801,
      "num_input_tokens_seen": 43802420272,
      "step": 55674
    },
    {
      "epoch": 5.906535115637598,
      "grad_norm": 0.7927423186834596,
      "learning_rate": 2.5647638480763743e-05,
      "loss": 1.0991,
      "num_input_tokens_seen": 43803206912,
      "step": 55675
    },
    {
      "epoch": 5.90664120517717,
      "grad_norm": 0.9358827604062844,
      "learning_rate": 2.564694374492799e-05,
      "loss": 1.1659,
      "num_input_tokens_seen": 43803993616,
      "step": 55676
    },
    {
      "epoch": 5.906747294716741,
      "grad_norm": 0.6759688929679569,
      "learning_rate": 2.5646249008592295e-05,
      "loss": 1.1876,
      "num_input_tokens_seen": 43804780480,
      "step": 55677
    },
    {
      "epoch": 5.906853384256312,
      "grad_norm": 0.685608208021038,
      "learning_rate": 2.5645554271757194e-05,
      "loss": 1.0642,
      "num_input_tokens_seen": 43805567216,
      "step": 55678
    },
    {
      "epoch": 5.906959473795884,
      "grad_norm": 0.901957534155656,
      "learning_rate": 2.564485953442323e-05,
      "loss": 1.1396,
      "num_input_tokens_seen": 43806353984,
      "step": 55679
    },
    {
      "epoch": 5.907065563335455,
      "grad_norm": 0.7954780048386862,
      "learning_rate": 2.5644164796590935e-05,
      "loss": 1.1565,
      "num_input_tokens_seen": 43807140800,
      "step": 55680
    },
    {
      "epoch": 5.907171652875027,
      "grad_norm": 0.6952166809127166,
      "learning_rate": 2.5643470058260855e-05,
      "loss": 1.1871,
      "num_input_tokens_seen": 43807927488,
      "step": 55681
    },
    {
      "epoch": 5.907277742414598,
      "grad_norm": 0.697425506790506,
      "learning_rate": 2.5642775319433515e-05,
      "loss": 1.1777,
      "num_input_tokens_seen": 43808714336,
      "step": 55682
    },
    {
      "epoch": 5.907383831954169,
      "grad_norm": 0.6090240221125558,
      "learning_rate": 2.5642080580109462e-05,
      "loss": 1.1087,
      "num_input_tokens_seen": 43809501136,
      "step": 55683
    },
    {
      "epoch": 5.907489921493741,
      "grad_norm": 0.5966099193080263,
      "learning_rate": 2.5641385840289224e-05,
      "loss": 1.1908,
      "num_input_tokens_seen": 43810287872,
      "step": 55684
    },
    {
      "epoch": 5.907596011033312,
      "grad_norm": 0.7500520853846332,
      "learning_rate": 2.5640691099973346e-05,
      "loss": 1.206,
      "num_input_tokens_seen": 43811074656,
      "step": 55685
    },
    {
      "epoch": 5.907702100572884,
      "grad_norm": 0.702630659850801,
      "learning_rate": 2.563999635916236e-05,
      "loss": 1.1038,
      "num_input_tokens_seen": 43811861456,
      "step": 55686
    },
    {
      "epoch": 5.907808190112455,
      "grad_norm": 0.7295721162166448,
      "learning_rate": 2.56393016178568e-05,
      "loss": 1.167,
      "num_input_tokens_seen": 43812648128,
      "step": 55687
    },
    {
      "epoch": 5.907914279652026,
      "grad_norm": 0.6354001738826887,
      "learning_rate": 2.5638606876057207e-05,
      "loss": 1.1669,
      "num_input_tokens_seen": 43813434912,
      "step": 55688
    },
    {
      "epoch": 5.908020369191598,
      "grad_norm": 0.8249135687304695,
      "learning_rate": 2.563791213376412e-05,
      "loss": 1.2393,
      "num_input_tokens_seen": 43814221728,
      "step": 55689
    },
    {
      "epoch": 5.908126458731169,
      "grad_norm": 0.763646568542701,
      "learning_rate": 2.5637217390978068e-05,
      "loss": 1.017,
      "num_input_tokens_seen": 43815008560,
      "step": 55690
    },
    {
      "epoch": 5.908232548270741,
      "grad_norm": 0.6878964663402128,
      "learning_rate": 2.56365226476996e-05,
      "loss": 1.1305,
      "num_input_tokens_seen": 43815795360,
      "step": 55691
    },
    {
      "epoch": 5.908338637810312,
      "grad_norm": 0.7322046807945085,
      "learning_rate": 2.5635827903929245e-05,
      "loss": 1.2564,
      "num_input_tokens_seen": 43816582128,
      "step": 55692
    },
    {
      "epoch": 5.908444727349884,
      "grad_norm": 0.7585019997712726,
      "learning_rate": 2.5635133159667535e-05,
      "loss": 1.1425,
      "num_input_tokens_seen": 43817368864,
      "step": 55693
    },
    {
      "epoch": 5.908550816889455,
      "grad_norm": 0.6935552682393806,
      "learning_rate": 2.5634438414915017e-05,
      "loss": 1.1779,
      "num_input_tokens_seen": 43818155600,
      "step": 55694
    },
    {
      "epoch": 5.908656906429026,
      "grad_norm": 0.6577854977305935,
      "learning_rate": 2.5633743669672223e-05,
      "loss": 1.0936,
      "num_input_tokens_seen": 43818942368,
      "step": 55695
    },
    {
      "epoch": 5.908762995968598,
      "grad_norm": 0.7265265541365062,
      "learning_rate": 2.563304892393969e-05,
      "loss": 1.1717,
      "num_input_tokens_seen": 43819729232,
      "step": 55696
    },
    {
      "epoch": 5.908869085508169,
      "grad_norm": 0.6565987302329162,
      "learning_rate": 2.563235417771796e-05,
      "loss": 1.1472,
      "num_input_tokens_seen": 43820515984,
      "step": 55697
    },
    {
      "epoch": 5.908975175047741,
      "grad_norm": 0.8754277722127076,
      "learning_rate": 2.5631659431007553e-05,
      "loss": 1.056,
      "num_input_tokens_seen": 43821302720,
      "step": 55698
    },
    {
      "epoch": 5.909081264587312,
      "grad_norm": 0.7587553763017759,
      "learning_rate": 2.5630964683809028e-05,
      "loss": 1.0736,
      "num_input_tokens_seen": 43822089488,
      "step": 55699
    },
    {
      "epoch": 5.909187354126884,
      "grad_norm": 0.7512556322590331,
      "learning_rate": 2.5630269936122913e-05,
      "loss": 1.258,
      "num_input_tokens_seen": 43822876192,
      "step": 55700
    },
    {
      "epoch": 5.909293443666455,
      "grad_norm": 0.7852056092512535,
      "learning_rate": 2.562957518794974e-05,
      "loss": 1.1551,
      "num_input_tokens_seen": 43823662944,
      "step": 55701
    },
    {
      "epoch": 5.909399533206026,
      "grad_norm": 0.6373172876840209,
      "learning_rate": 2.5628880439290053e-05,
      "loss": 1.0218,
      "num_input_tokens_seen": 43824449792,
      "step": 55702
    },
    {
      "epoch": 5.9095056227455975,
      "grad_norm": 0.7410337970138734,
      "learning_rate": 2.5628185690144385e-05,
      "loss": 1.1065,
      "num_input_tokens_seen": 43825236512,
      "step": 55703
    },
    {
      "epoch": 5.909611712285169,
      "grad_norm": 0.7021563856997494,
      "learning_rate": 2.5627490940513266e-05,
      "loss": 1.0807,
      "num_input_tokens_seen": 43826023312,
      "step": 55704
    },
    {
      "epoch": 5.9097178018247405,
      "grad_norm": 0.5878561306074387,
      "learning_rate": 2.562679619039725e-05,
      "loss": 1.1345,
      "num_input_tokens_seen": 43826810048,
      "step": 55705
    },
    {
      "epoch": 5.9098238913643115,
      "grad_norm": 0.6800661539823024,
      "learning_rate": 2.562610143979686e-05,
      "loss": 1.2379,
      "num_input_tokens_seen": 43827596816,
      "step": 55706
    },
    {
      "epoch": 5.9099299809038826,
      "grad_norm": 0.8215060201872437,
      "learning_rate": 2.562540668871264e-05,
      "loss": 1.1295,
      "num_input_tokens_seen": 43828383536,
      "step": 55707
    },
    {
      "epoch": 5.9100360704434545,
      "grad_norm": 0.6429425895694082,
      "learning_rate": 2.5624711937145122e-05,
      "loss": 1.1903,
      "num_input_tokens_seen": 43829170208,
      "step": 55708
    },
    {
      "epoch": 5.9101421599830255,
      "grad_norm": 0.6823858960170397,
      "learning_rate": 2.5624017185094846e-05,
      "loss": 1.1119,
      "num_input_tokens_seen": 43829956960,
      "step": 55709
    },
    {
      "epoch": 5.910248249522597,
      "grad_norm": 0.6004746746563072,
      "learning_rate": 2.562332243256234e-05,
      "loss": 1.0628,
      "num_input_tokens_seen": 43830743744,
      "step": 55710
    },
    {
      "epoch": 5.9103543390621684,
      "grad_norm": 0.6871253491952742,
      "learning_rate": 2.5622627679548162e-05,
      "loss": 1.1782,
      "num_input_tokens_seen": 43831530448,
      "step": 55711
    },
    {
      "epoch": 5.9104604286017395,
      "grad_norm": 0.5346570489969242,
      "learning_rate": 2.5621932926052827e-05,
      "loss": 1.0898,
      "num_input_tokens_seen": 43832317216,
      "step": 55712
    },
    {
      "epoch": 5.910566518141311,
      "grad_norm": 0.7104602225000699,
      "learning_rate": 2.5621238172076883e-05,
      "loss": 1.1831,
      "num_input_tokens_seen": 43833103968,
      "step": 55713
    },
    {
      "epoch": 5.910672607680882,
      "grad_norm": 0.6840682878223892,
      "learning_rate": 2.5620543417620868e-05,
      "loss": 1.1648,
      "num_input_tokens_seen": 43833890752,
      "step": 55714
    },
    {
      "epoch": 5.910778697220454,
      "grad_norm": 0.5444216889547822,
      "learning_rate": 2.5619848662685303e-05,
      "loss": 1.0205,
      "num_input_tokens_seen": 43834677616,
      "step": 55715
    },
    {
      "epoch": 5.910884786760025,
      "grad_norm": 0.7509734890773984,
      "learning_rate": 2.5619153907270747e-05,
      "loss": 1.158,
      "num_input_tokens_seen": 43835464320,
      "step": 55716
    },
    {
      "epoch": 5.910990876299596,
      "grad_norm": 0.6348234916245358,
      "learning_rate": 2.5618459151377727e-05,
      "loss": 1.1926,
      "num_input_tokens_seen": 43836251152,
      "step": 55717
    },
    {
      "epoch": 5.911096965839168,
      "grad_norm": 0.7391874759846883,
      "learning_rate": 2.5617764395006777e-05,
      "loss": 1.1246,
      "num_input_tokens_seen": 43837037936,
      "step": 55718
    },
    {
      "epoch": 5.911203055378739,
      "grad_norm": 0.6873339935532694,
      "learning_rate": 2.5617069638158442e-05,
      "loss": 1.154,
      "num_input_tokens_seen": 43837824720,
      "step": 55719
    },
    {
      "epoch": 5.911309144918311,
      "grad_norm": 0.6804419705564836,
      "learning_rate": 2.5616374880833248e-05,
      "loss": 1.2085,
      "num_input_tokens_seen": 43838611456,
      "step": 55720
    },
    {
      "epoch": 5.911415234457882,
      "grad_norm": 0.74915656469728,
      "learning_rate": 2.5615680123031737e-05,
      "loss": 1.2265,
      "num_input_tokens_seen": 43839398160,
      "step": 55721
    },
    {
      "epoch": 5.911521323997454,
      "grad_norm": 0.7944032579617226,
      "learning_rate": 2.561498536475445e-05,
      "loss": 1.2047,
      "num_input_tokens_seen": 43840184864,
      "step": 55722
    },
    {
      "epoch": 5.911627413537025,
      "grad_norm": 0.7268695531097066,
      "learning_rate": 2.561429060600192e-05,
      "loss": 1.089,
      "num_input_tokens_seen": 43840971632,
      "step": 55723
    },
    {
      "epoch": 5.911733503076596,
      "grad_norm": 0.6845057701555621,
      "learning_rate": 2.5613595846774685e-05,
      "loss": 1.1462,
      "num_input_tokens_seen": 43841758416,
      "step": 55724
    },
    {
      "epoch": 5.911839592616168,
      "grad_norm": 0.6957848585143299,
      "learning_rate": 2.5612901087073275e-05,
      "loss": 1.0864,
      "num_input_tokens_seen": 43842545264,
      "step": 55725
    },
    {
      "epoch": 5.911945682155739,
      "grad_norm": 0.6717210974987399,
      "learning_rate": 2.5612206326898242e-05,
      "loss": 1.247,
      "num_input_tokens_seen": 43843331984,
      "step": 55726
    },
    {
      "epoch": 5.912051771695311,
      "grad_norm": 0.5523055630007803,
      "learning_rate": 2.5611511566250108e-05,
      "loss": 1.0718,
      "num_input_tokens_seen": 43844118800,
      "step": 55727
    },
    {
      "epoch": 5.912157861234882,
      "grad_norm": 0.7940674148744917,
      "learning_rate": 2.561081680512941e-05,
      "loss": 1.0177,
      "num_input_tokens_seen": 43844905664,
      "step": 55728
    },
    {
      "epoch": 5.912263950774454,
      "grad_norm": 0.6151190436823388,
      "learning_rate": 2.5610122043536705e-05,
      "loss": 1.1751,
      "num_input_tokens_seen": 43845692400,
      "step": 55729
    },
    {
      "epoch": 5.912370040314025,
      "grad_norm": 0.6849897211341667,
      "learning_rate": 2.5609427281472504e-05,
      "loss": 1.0803,
      "num_input_tokens_seen": 43846479184,
      "step": 55730
    },
    {
      "epoch": 5.912476129853596,
      "grad_norm": 0.6832775577887117,
      "learning_rate": 2.5608732518937363e-05,
      "loss": 1.042,
      "num_input_tokens_seen": 43847265856,
      "step": 55731
    },
    {
      "epoch": 5.912582219393168,
      "grad_norm": 0.6486936976716061,
      "learning_rate": 2.5608037755931807e-05,
      "loss": 1.1213,
      "num_input_tokens_seen": 43848052560,
      "step": 55732
    },
    {
      "epoch": 5.912688308932739,
      "grad_norm": 0.8495041515045316,
      "learning_rate": 2.5607342992456378e-05,
      "loss": 1.2076,
      "num_input_tokens_seen": 43848839264,
      "step": 55733
    },
    {
      "epoch": 5.912794398472311,
      "grad_norm": 0.6514744696660738,
      "learning_rate": 2.5606648228511614e-05,
      "loss": 1.0569,
      "num_input_tokens_seen": 43849626144,
      "step": 55734
    },
    {
      "epoch": 5.912900488011882,
      "grad_norm": 0.6541859980683672,
      "learning_rate": 2.5605953464098052e-05,
      "loss": 1.2438,
      "num_input_tokens_seen": 43850412864,
      "step": 55735
    },
    {
      "epoch": 5.913006577551453,
      "grad_norm": 0.6587934670638435,
      "learning_rate": 2.5605258699216217e-05,
      "loss": 1.1298,
      "num_input_tokens_seen": 43851199696,
      "step": 55736
    },
    {
      "epoch": 5.913112667091025,
      "grad_norm": 0.5736670451085684,
      "learning_rate": 2.5604563933866666e-05,
      "loss": 1.2119,
      "num_input_tokens_seen": 43851986496,
      "step": 55737
    },
    {
      "epoch": 5.913218756630596,
      "grad_norm": 0.8904671085984518,
      "learning_rate": 2.560386916804992e-05,
      "loss": 1.1713,
      "num_input_tokens_seen": 43852773264,
      "step": 55738
    },
    {
      "epoch": 5.913324846170168,
      "grad_norm": 0.7212362925563063,
      "learning_rate": 2.560317440176653e-05,
      "loss": 1.1485,
      "num_input_tokens_seen": 43853560096,
      "step": 55739
    },
    {
      "epoch": 5.913430935709739,
      "grad_norm": 0.6487230232428544,
      "learning_rate": 2.560247963501702e-05,
      "loss": 1.1095,
      "num_input_tokens_seen": 43854346816,
      "step": 55740
    },
    {
      "epoch": 5.91353702524931,
      "grad_norm": 0.7304482463024616,
      "learning_rate": 2.560178486780192e-05,
      "loss": 1.1398,
      "num_input_tokens_seen": 43855133616,
      "step": 55741
    },
    {
      "epoch": 5.913643114788882,
      "grad_norm": 0.7450832586144975,
      "learning_rate": 2.5601090100121795e-05,
      "loss": 1.1765,
      "num_input_tokens_seen": 43855920400,
      "step": 55742
    },
    {
      "epoch": 5.913749204328453,
      "grad_norm": 0.6678268785108079,
      "learning_rate": 2.5600395331977155e-05,
      "loss": 1.0925,
      "num_input_tokens_seen": 43856707264,
      "step": 55743
    },
    {
      "epoch": 5.913855293868025,
      "grad_norm": 0.713967212813086,
      "learning_rate": 2.559970056336855e-05,
      "loss": 1.0944,
      "num_input_tokens_seen": 43857493920,
      "step": 55744
    },
    {
      "epoch": 5.913961383407596,
      "grad_norm": 0.636303089961267,
      "learning_rate": 2.5599005794296517e-05,
      "loss": 1.2145,
      "num_input_tokens_seen": 43858280592,
      "step": 55745
    },
    {
      "epoch": 5.914067472947167,
      "grad_norm": 0.6671219377775709,
      "learning_rate": 2.559831102476159e-05,
      "loss": 1.1804,
      "num_input_tokens_seen": 43859067408,
      "step": 55746
    },
    {
      "epoch": 5.914173562486739,
      "grad_norm": 0.7389332913156939,
      "learning_rate": 2.55976162547643e-05,
      "loss": 1.1527,
      "num_input_tokens_seen": 43859854128,
      "step": 55747
    },
    {
      "epoch": 5.91427965202631,
      "grad_norm": 0.6428902361710441,
      "learning_rate": 2.5596921484305192e-05,
      "loss": 1.0608,
      "num_input_tokens_seen": 43860640944,
      "step": 55748
    },
    {
      "epoch": 5.914385741565882,
      "grad_norm": 0.9374231746845426,
      "learning_rate": 2.5596226713384808e-05,
      "loss": 1.1058,
      "num_input_tokens_seen": 43861427728,
      "step": 55749
    },
    {
      "epoch": 5.914491831105453,
      "grad_norm": 0.631043455965019,
      "learning_rate": 2.5595531942003664e-05,
      "loss": 1.1861,
      "num_input_tokens_seen": 43862214528,
      "step": 55750
    },
    {
      "epoch": 5.914597920645025,
      "grad_norm": 0.6731979476525961,
      "learning_rate": 2.559483717016232e-05,
      "loss": 1.1514,
      "num_input_tokens_seen": 43863001328,
      "step": 55751
    },
    {
      "epoch": 5.914704010184596,
      "grad_norm": 0.8138048740023237,
      "learning_rate": 2.5594142397861304e-05,
      "loss": 1.1706,
      "num_input_tokens_seen": 43863788128,
      "step": 55752
    },
    {
      "epoch": 5.914810099724167,
      "grad_norm": 0.6871524056010395,
      "learning_rate": 2.5593447625101147e-05,
      "loss": 1.2036,
      "num_input_tokens_seen": 43864574832,
      "step": 55753
    },
    {
      "epoch": 5.914916189263739,
      "grad_norm": 0.6350774508974802,
      "learning_rate": 2.559275285188239e-05,
      "loss": 1.1364,
      "num_input_tokens_seen": 43865361504,
      "step": 55754
    },
    {
      "epoch": 5.91502227880331,
      "grad_norm": 0.6938791079103171,
      "learning_rate": 2.5592058078205573e-05,
      "loss": 1.1296,
      "num_input_tokens_seen": 43866148272,
      "step": 55755
    },
    {
      "epoch": 5.915128368342882,
      "grad_norm": 1.0577646063731785,
      "learning_rate": 2.5591363304071237e-05,
      "loss": 1.2361,
      "num_input_tokens_seen": 43866935040,
      "step": 55756
    },
    {
      "epoch": 5.915234457882453,
      "grad_norm": 0.8107495482211878,
      "learning_rate": 2.5590668529479907e-05,
      "loss": 1.0827,
      "num_input_tokens_seen": 43867721808,
      "step": 55757
    },
    {
      "epoch": 5.915340547422025,
      "grad_norm": 1.0085537435836913,
      "learning_rate": 2.5589973754432124e-05,
      "loss": 1.1433,
      "num_input_tokens_seen": 43868508592,
      "step": 55758
    },
    {
      "epoch": 5.915446636961596,
      "grad_norm": 0.6934369485037409,
      "learning_rate": 2.5589278978928427e-05,
      "loss": 1.224,
      "num_input_tokens_seen": 43869295376,
      "step": 55759
    },
    {
      "epoch": 5.915552726501167,
      "grad_norm": 0.5885274548390961,
      "learning_rate": 2.5588584202969356e-05,
      "loss": 1.1097,
      "num_input_tokens_seen": 43870082096,
      "step": 55760
    },
    {
      "epoch": 5.915658816040739,
      "grad_norm": 0.8451982187612567,
      "learning_rate": 2.5587889426555444e-05,
      "loss": 1.1899,
      "num_input_tokens_seen": 43870868816,
      "step": 55761
    },
    {
      "epoch": 5.91576490558031,
      "grad_norm": 1.1643335496664604,
      "learning_rate": 2.5587194649687228e-05,
      "loss": 1.2265,
      "num_input_tokens_seen": 43871655616,
      "step": 55762
    },
    {
      "epoch": 5.915870995119882,
      "grad_norm": 0.6104798288018621,
      "learning_rate": 2.5586499872365243e-05,
      "loss": 1.1307,
      "num_input_tokens_seen": 43872442320,
      "step": 55763
    },
    {
      "epoch": 5.915977084659453,
      "grad_norm": 1.055916445154527,
      "learning_rate": 2.5585805094590028e-05,
      "loss": 1.0831,
      "num_input_tokens_seen": 43873229008,
      "step": 55764
    },
    {
      "epoch": 5.916083174199024,
      "grad_norm": 0.8591250656745305,
      "learning_rate": 2.5585110316362128e-05,
      "loss": 1.1353,
      "num_input_tokens_seen": 43874015664,
      "step": 55765
    },
    {
      "epoch": 5.9161892637385955,
      "grad_norm": 0.73714598719499,
      "learning_rate": 2.5584415537682067e-05,
      "loss": 1.1265,
      "num_input_tokens_seen": 43874802416,
      "step": 55766
    },
    {
      "epoch": 5.916295353278167,
      "grad_norm": 0.9859909067647251,
      "learning_rate": 2.558372075855038e-05,
      "loss": 1.1648,
      "num_input_tokens_seen": 43875589136,
      "step": 55767
    },
    {
      "epoch": 5.9164014428177385,
      "grad_norm": 0.8255830815080745,
      "learning_rate": 2.5583025978967616e-05,
      "loss": 1.2006,
      "num_input_tokens_seen": 43876375904,
      "step": 55768
    },
    {
      "epoch": 5.9165075323573095,
      "grad_norm": 0.6582112556309974,
      "learning_rate": 2.5582331198934306e-05,
      "loss": 1.1599,
      "num_input_tokens_seen": 43877162752,
      "step": 55769
    },
    {
      "epoch": 5.916613621896881,
      "grad_norm": 0.7669928191926001,
      "learning_rate": 2.5581636418450987e-05,
      "loss": 1.2086,
      "num_input_tokens_seen": 43877949584,
      "step": 55770
    },
    {
      "epoch": 5.9167197114364525,
      "grad_norm": 0.758078947799801,
      "learning_rate": 2.5580941637518202e-05,
      "loss": 1.1697,
      "num_input_tokens_seen": 43878736384,
      "step": 55771
    },
    {
      "epoch": 5.9168258009760235,
      "grad_norm": 0.6374335753243139,
      "learning_rate": 2.558024685613647e-05,
      "loss": 1.2009,
      "num_input_tokens_seen": 43879523104,
      "step": 55772
    },
    {
      "epoch": 5.916931890515595,
      "grad_norm": 0.715385815914869,
      "learning_rate": 2.5579552074306352e-05,
      "loss": 1.1623,
      "num_input_tokens_seen": 43880309872,
      "step": 55773
    },
    {
      "epoch": 5.9170379800551665,
      "grad_norm": 0.6412720684473673,
      "learning_rate": 2.557885729202837e-05,
      "loss": 1.0791,
      "num_input_tokens_seen": 43881096640,
      "step": 55774
    },
    {
      "epoch": 5.9171440695947375,
      "grad_norm": 0.6214410236405233,
      "learning_rate": 2.557816250930306e-05,
      "loss": 1.1183,
      "num_input_tokens_seen": 43881883472,
      "step": 55775
    },
    {
      "epoch": 5.917250159134309,
      "grad_norm": 0.6518975868868162,
      "learning_rate": 2.5577467726130964e-05,
      "loss": 1.0846,
      "num_input_tokens_seen": 43882670320,
      "step": 55776
    },
    {
      "epoch": 5.91735624867388,
      "grad_norm": 0.5922346127790136,
      "learning_rate": 2.557677294251262e-05,
      "loss": 1.1796,
      "num_input_tokens_seen": 43883457088,
      "step": 55777
    },
    {
      "epoch": 5.917462338213452,
      "grad_norm": 0.6158523315918595,
      "learning_rate": 2.557607815844857e-05,
      "loss": 1.0989,
      "num_input_tokens_seen": 43884243920,
      "step": 55778
    },
    {
      "epoch": 5.917568427753023,
      "grad_norm": 0.7005288616516889,
      "learning_rate": 2.5575383373939333e-05,
      "loss": 1.1383,
      "num_input_tokens_seen": 43885030672,
      "step": 55779
    },
    {
      "epoch": 5.917674517292595,
      "grad_norm": 0.6192893526886121,
      "learning_rate": 2.5574688588985462e-05,
      "loss": 1.1582,
      "num_input_tokens_seen": 43885817472,
      "step": 55780
    },
    {
      "epoch": 5.917780606832166,
      "grad_norm": 0.6451105880187008,
      "learning_rate": 2.5573993803587482e-05,
      "loss": 1.1053,
      "num_input_tokens_seen": 43886604272,
      "step": 55781
    },
    {
      "epoch": 5.917886696371737,
      "grad_norm": 0.63946159614562,
      "learning_rate": 2.5573299017745945e-05,
      "loss": 1.104,
      "num_input_tokens_seen": 43887391024,
      "step": 55782
    },
    {
      "epoch": 5.917992785911309,
      "grad_norm": 0.5951863810574499,
      "learning_rate": 2.557260423146138e-05,
      "loss": 1.2816,
      "num_input_tokens_seen": 43888177680,
      "step": 55783
    },
    {
      "epoch": 5.91809887545088,
      "grad_norm": 0.6058174844712803,
      "learning_rate": 2.557190944473431e-05,
      "loss": 1.1693,
      "num_input_tokens_seen": 43888964464,
      "step": 55784
    },
    {
      "epoch": 5.918204964990452,
      "grad_norm": 0.6373065850582341,
      "learning_rate": 2.5571214657565296e-05,
      "loss": 1.1673,
      "num_input_tokens_seen": 43889751248,
      "step": 55785
    },
    {
      "epoch": 5.918311054530023,
      "grad_norm": 0.8692790435102239,
      "learning_rate": 2.5570519869954862e-05,
      "loss": 1.1816,
      "num_input_tokens_seen": 43890538032,
      "step": 55786
    },
    {
      "epoch": 5.918417144069595,
      "grad_norm": 0.5620292462269655,
      "learning_rate": 2.5569825081903548e-05,
      "loss": 1.1012,
      "num_input_tokens_seen": 43891324800,
      "step": 55787
    },
    {
      "epoch": 5.918523233609166,
      "grad_norm": 0.7101175253846039,
      "learning_rate": 2.5569130293411892e-05,
      "loss": 1.1617,
      "num_input_tokens_seen": 43892111488,
      "step": 55788
    },
    {
      "epoch": 5.918629323148737,
      "grad_norm": 0.7453595449102502,
      "learning_rate": 2.5568435504480426e-05,
      "loss": 1.1646,
      "num_input_tokens_seen": 43892898240,
      "step": 55789
    },
    {
      "epoch": 5.918735412688309,
      "grad_norm": 0.5202672584831239,
      "learning_rate": 2.5567740715109685e-05,
      "loss": 1.1214,
      "num_input_tokens_seen": 43893684960,
      "step": 55790
    },
    {
      "epoch": 5.91884150222788,
      "grad_norm": 0.6312593512238327,
      "learning_rate": 2.5567045925300215e-05,
      "loss": 1.1673,
      "num_input_tokens_seen": 43894471744,
      "step": 55791
    },
    {
      "epoch": 5.918947591767452,
      "grad_norm": 0.5879918129307433,
      "learning_rate": 2.556635113505255e-05,
      "loss": 1.1084,
      "num_input_tokens_seen": 43895258448,
      "step": 55792
    },
    {
      "epoch": 5.919053681307023,
      "grad_norm": 0.5696968754357478,
      "learning_rate": 2.5565656344367223e-05,
      "loss": 1.0647,
      "num_input_tokens_seen": 43896045376,
      "step": 55793
    },
    {
      "epoch": 5.919159770846594,
      "grad_norm": 0.5859083039548251,
      "learning_rate": 2.5564961553244777e-05,
      "loss": 1.2078,
      "num_input_tokens_seen": 43896832096,
      "step": 55794
    },
    {
      "epoch": 5.919265860386166,
      "grad_norm": 0.6109377127581407,
      "learning_rate": 2.5564266761685747e-05,
      "loss": 1.0913,
      "num_input_tokens_seen": 43897618896,
      "step": 55795
    },
    {
      "epoch": 5.919371949925737,
      "grad_norm": 0.7229261443431703,
      "learning_rate": 2.5563571969690658e-05,
      "loss": 1.1961,
      "num_input_tokens_seen": 43898405632,
      "step": 55796
    },
    {
      "epoch": 5.919478039465309,
      "grad_norm": 0.5993806541987552,
      "learning_rate": 2.5562877177260065e-05,
      "loss": 1.1472,
      "num_input_tokens_seen": 43899192384,
      "step": 55797
    },
    {
      "epoch": 5.91958412900488,
      "grad_norm": 0.5809856649086071,
      "learning_rate": 2.556218238439449e-05,
      "loss": 1.1817,
      "num_input_tokens_seen": 43899979168,
      "step": 55798
    },
    {
      "epoch": 5.919690218544451,
      "grad_norm": 1.0430561797290563,
      "learning_rate": 2.5561487591094485e-05,
      "loss": 1.1853,
      "num_input_tokens_seen": 43900765920,
      "step": 55799
    },
    {
      "epoch": 5.919796308084023,
      "grad_norm": 0.5632141224856018,
      "learning_rate": 2.5560792797360576e-05,
      "loss": 1.132,
      "num_input_tokens_seen": 43901552688,
      "step": 55800
    },
    {
      "epoch": 5.919902397623594,
      "grad_norm": 0.6203133836949,
      "learning_rate": 2.55600980031933e-05,
      "loss": 1.2159,
      "num_input_tokens_seen": 43902339520,
      "step": 55801
    },
    {
      "epoch": 5.920008487163166,
      "grad_norm": 0.8195266178748434,
      "learning_rate": 2.5559403208593203e-05,
      "loss": 1.2247,
      "num_input_tokens_seen": 43903126304,
      "step": 55802
    },
    {
      "epoch": 5.920114576702737,
      "grad_norm": 0.5806608397734941,
      "learning_rate": 2.5558708413560816e-05,
      "loss": 1.1608,
      "num_input_tokens_seen": 43903913056,
      "step": 55803
    },
    {
      "epoch": 5.920220666242308,
      "grad_norm": 0.6516056715733447,
      "learning_rate": 2.5558013618096666e-05,
      "loss": 1.0366,
      "num_input_tokens_seen": 43904699888,
      "step": 55804
    },
    {
      "epoch": 5.92032675578188,
      "grad_norm": 0.785474814111859,
      "learning_rate": 2.555731882220131e-05,
      "loss": 1.2039,
      "num_input_tokens_seen": 43905486640,
      "step": 55805
    },
    {
      "epoch": 5.920432845321451,
      "grad_norm": 0.7806302786077985,
      "learning_rate": 2.555662402587527e-05,
      "loss": 1.2002,
      "num_input_tokens_seen": 43906273456,
      "step": 55806
    },
    {
      "epoch": 5.920538934861023,
      "grad_norm": 0.6347130785333547,
      "learning_rate": 2.5555929229119085e-05,
      "loss": 1.1355,
      "num_input_tokens_seen": 43907060192,
      "step": 55807
    },
    {
      "epoch": 5.920645024400594,
      "grad_norm": 0.7101280298933338,
      "learning_rate": 2.5555234431933296e-05,
      "loss": 1.177,
      "num_input_tokens_seen": 43907846992,
      "step": 55808
    },
    {
      "epoch": 5.920751113940166,
      "grad_norm": 0.7523697461943442,
      "learning_rate": 2.555453963431844e-05,
      "loss": 1.1797,
      "num_input_tokens_seen": 43908633888,
      "step": 55809
    },
    {
      "epoch": 5.920857203479737,
      "grad_norm": 0.6523073775212925,
      "learning_rate": 2.555384483627505e-05,
      "loss": 1.1251,
      "num_input_tokens_seen": 43909420656,
      "step": 55810
    },
    {
      "epoch": 5.920963293019309,
      "grad_norm": 0.6626582522486932,
      "learning_rate": 2.5553150037803664e-05,
      "loss": 1.2074,
      "num_input_tokens_seen": 43910207360,
      "step": 55811
    },
    {
      "epoch": 5.92106938255888,
      "grad_norm": 0.6718845664688843,
      "learning_rate": 2.555245523890482e-05,
      "loss": 1.1827,
      "num_input_tokens_seen": 43910994192,
      "step": 55812
    },
    {
      "epoch": 5.921175472098451,
      "grad_norm": 0.6119814157204361,
      "learning_rate": 2.5551760439579053e-05,
      "loss": 1.152,
      "num_input_tokens_seen": 43911780976,
      "step": 55813
    },
    {
      "epoch": 5.921281561638023,
      "grad_norm": 0.5740075843318271,
      "learning_rate": 2.555106563982691e-05,
      "loss": 0.9919,
      "num_input_tokens_seen": 43912567776,
      "step": 55814
    },
    {
      "epoch": 5.921387651177594,
      "grad_norm": 0.6735011804383821,
      "learning_rate": 2.5550370839648907e-05,
      "loss": 1.1605,
      "num_input_tokens_seen": 43913354592,
      "step": 55815
    },
    {
      "epoch": 5.921493740717166,
      "grad_norm": 0.5411668663443894,
      "learning_rate": 2.5549676039045605e-05,
      "loss": 1.1006,
      "num_input_tokens_seen": 43914141408,
      "step": 55816
    },
    {
      "epoch": 5.921599830256737,
      "grad_norm": 0.6855926456465209,
      "learning_rate": 2.554898123801753e-05,
      "loss": 1.1534,
      "num_input_tokens_seen": 43914928176,
      "step": 55817
    },
    {
      "epoch": 5.921705919796308,
      "grad_norm": 0.6736381809897856,
      "learning_rate": 2.5548286436565205e-05,
      "loss": 1.1905,
      "num_input_tokens_seen": 43915714864,
      "step": 55818
    },
    {
      "epoch": 5.92181200933588,
      "grad_norm": 0.7666161259836604,
      "learning_rate": 2.5547591634689195e-05,
      "loss": 1.116,
      "num_input_tokens_seen": 43916501600,
      "step": 55819
    },
    {
      "epoch": 5.921918098875451,
      "grad_norm": 0.6748585994005039,
      "learning_rate": 2.5546896832390014e-05,
      "loss": 1.1231,
      "num_input_tokens_seen": 43917288352,
      "step": 55820
    },
    {
      "epoch": 5.922024188415023,
      "grad_norm": 0.6686737210599891,
      "learning_rate": 2.5546202029668208e-05,
      "loss": 1.1599,
      "num_input_tokens_seen": 43918075104,
      "step": 55821
    },
    {
      "epoch": 5.922130277954594,
      "grad_norm": 0.7471652039640483,
      "learning_rate": 2.554550722652432e-05,
      "loss": 1.1282,
      "num_input_tokens_seen": 43918861792,
      "step": 55822
    },
    {
      "epoch": 5.922236367494165,
      "grad_norm": 0.6811307665484198,
      "learning_rate": 2.5544812422958868e-05,
      "loss": 1.1649,
      "num_input_tokens_seen": 43919648544,
      "step": 55823
    },
    {
      "epoch": 5.922342457033737,
      "grad_norm": 0.7392062500862052,
      "learning_rate": 2.55441176189724e-05,
      "loss": 1.1243,
      "num_input_tokens_seen": 43920435328,
      "step": 55824
    },
    {
      "epoch": 5.922448546573308,
      "grad_norm": 0.6654213664492381,
      "learning_rate": 2.5543422814565467e-05,
      "loss": 1.1331,
      "num_input_tokens_seen": 43921222128,
      "step": 55825
    },
    {
      "epoch": 5.92255463611288,
      "grad_norm": 0.5948635216471573,
      "learning_rate": 2.5542728009738587e-05,
      "loss": 1.1057,
      "num_input_tokens_seen": 43922008896,
      "step": 55826
    },
    {
      "epoch": 5.922660725652451,
      "grad_norm": 0.5328870675749178,
      "learning_rate": 2.55420332044923e-05,
      "loss": 1.1179,
      "num_input_tokens_seen": 43922795808,
      "step": 55827
    },
    {
      "epoch": 5.922766815192022,
      "grad_norm": 0.5944216365797494,
      "learning_rate": 2.5541338398827153e-05,
      "loss": 1.1394,
      "num_input_tokens_seen": 43923582592,
      "step": 55828
    },
    {
      "epoch": 5.922872904731594,
      "grad_norm": 0.7065270218838648,
      "learning_rate": 2.5540643592743667e-05,
      "loss": 1.1987,
      "num_input_tokens_seen": 43924369344,
      "step": 55829
    },
    {
      "epoch": 5.922978994271165,
      "grad_norm": 0.7112039679346518,
      "learning_rate": 2.553994878624239e-05,
      "loss": 1.1645,
      "num_input_tokens_seen": 43925156080,
      "step": 55830
    },
    {
      "epoch": 5.9230850838107365,
      "grad_norm": 0.8101844791338829,
      "learning_rate": 2.5539253979323864e-05,
      "loss": 1.0999,
      "num_input_tokens_seen": 43925942896,
      "step": 55831
    },
    {
      "epoch": 5.9231911733503075,
      "grad_norm": 0.847648188773659,
      "learning_rate": 2.5538559171988614e-05,
      "loss": 1.1295,
      "num_input_tokens_seen": 43926729616,
      "step": 55832
    },
    {
      "epoch": 5.923297262889879,
      "grad_norm": 0.7834466523845492,
      "learning_rate": 2.5537864364237174e-05,
      "loss": 1.203,
      "num_input_tokens_seen": 43927516384,
      "step": 55833
    },
    {
      "epoch": 5.9234033524294505,
      "grad_norm": 0.6474232066486136,
      "learning_rate": 2.5537169556070095e-05,
      "loss": 1.2578,
      "num_input_tokens_seen": 43928303168,
      "step": 55834
    },
    {
      "epoch": 5.9235094419690215,
      "grad_norm": 0.603462434255924,
      "learning_rate": 2.5536474747487908e-05,
      "loss": 1.164,
      "num_input_tokens_seen": 43929089968,
      "step": 55835
    },
    {
      "epoch": 5.923615531508593,
      "grad_norm": 0.6358482396186053,
      "learning_rate": 2.5535779938491143e-05,
      "loss": 1.1477,
      "num_input_tokens_seen": 43929876688,
      "step": 55836
    },
    {
      "epoch": 5.9237216210481645,
      "grad_norm": 0.8503455726684249,
      "learning_rate": 2.5535085129080348e-05,
      "loss": 1.1645,
      "num_input_tokens_seen": 43930663440,
      "step": 55837
    },
    {
      "epoch": 5.923827710587736,
      "grad_norm": 0.6146989220577204,
      "learning_rate": 2.553439031925606e-05,
      "loss": 1.1557,
      "num_input_tokens_seen": 43931450224,
      "step": 55838
    },
    {
      "epoch": 5.923933800127307,
      "grad_norm": 1.0407101792618076,
      "learning_rate": 2.5533695509018797e-05,
      "loss": 1.1501,
      "num_input_tokens_seen": 43932236992,
      "step": 55839
    },
    {
      "epoch": 5.924039889666879,
      "grad_norm": 0.693801846792297,
      "learning_rate": 2.5533000698369118e-05,
      "loss": 1.157,
      "num_input_tokens_seen": 43933023696,
      "step": 55840
    },
    {
      "epoch": 5.92414597920645,
      "grad_norm": 0.7104755531329195,
      "learning_rate": 2.553230588730755e-05,
      "loss": 1.1973,
      "num_input_tokens_seen": 43933810384,
      "step": 55841
    },
    {
      "epoch": 5.924252068746021,
      "grad_norm": 0.6585184162792939,
      "learning_rate": 2.5531611075834634e-05,
      "loss": 1.1119,
      "num_input_tokens_seen": 43934597120,
      "step": 55842
    },
    {
      "epoch": 5.924358158285593,
      "grad_norm": 0.6429237500815446,
      "learning_rate": 2.5530916263950906e-05,
      "loss": 1.1602,
      "num_input_tokens_seen": 43935383872,
      "step": 55843
    },
    {
      "epoch": 5.924464247825164,
      "grad_norm": 0.6304808378619304,
      "learning_rate": 2.5530221451656893e-05,
      "loss": 1.1613,
      "num_input_tokens_seen": 43936170656,
      "step": 55844
    },
    {
      "epoch": 5.924570337364736,
      "grad_norm": 0.6822702302439484,
      "learning_rate": 2.552952663895315e-05,
      "loss": 1.0551,
      "num_input_tokens_seen": 43936957408,
      "step": 55845
    },
    {
      "epoch": 5.924676426904307,
      "grad_norm": 0.8600552893377499,
      "learning_rate": 2.5528831825840203e-05,
      "loss": 1.2055,
      "num_input_tokens_seen": 43937744080,
      "step": 55846
    },
    {
      "epoch": 5.924782516443878,
      "grad_norm": 0.6966895130744838,
      "learning_rate": 2.5528137012318588e-05,
      "loss": 1.1805,
      "num_input_tokens_seen": 43938530880,
      "step": 55847
    },
    {
      "epoch": 5.92488860598345,
      "grad_norm": 0.7833271095680249,
      "learning_rate": 2.552744219838884e-05,
      "loss": 1.1371,
      "num_input_tokens_seen": 43939317680,
      "step": 55848
    },
    {
      "epoch": 5.924994695523021,
      "grad_norm": 0.6309311217116962,
      "learning_rate": 2.5526747384051507e-05,
      "loss": 1.1127,
      "num_input_tokens_seen": 43940104464,
      "step": 55849
    },
    {
      "epoch": 5.925100785062593,
      "grad_norm": 0.7025473576950737,
      "learning_rate": 2.5526052569307112e-05,
      "loss": 1.1574,
      "num_input_tokens_seen": 43940891280,
      "step": 55850
    },
    {
      "epoch": 5.925206874602164,
      "grad_norm": 0.6500660373924734,
      "learning_rate": 2.552535775415621e-05,
      "loss": 1.0989,
      "num_input_tokens_seen": 43941678032,
      "step": 55851
    },
    {
      "epoch": 5.925312964141735,
      "grad_norm": 0.8002210630342292,
      "learning_rate": 2.552466293859932e-05,
      "loss": 1.1511,
      "num_input_tokens_seen": 43942464800,
      "step": 55852
    },
    {
      "epoch": 5.925419053681307,
      "grad_norm": 0.631679448584803,
      "learning_rate": 2.552396812263698e-05,
      "loss": 1.1775,
      "num_input_tokens_seen": 43943251568,
      "step": 55853
    },
    {
      "epoch": 5.925525143220878,
      "grad_norm": 0.7014191969047574,
      "learning_rate": 2.5523273306269746e-05,
      "loss": 1.1432,
      "num_input_tokens_seen": 43944038352,
      "step": 55854
    },
    {
      "epoch": 5.92563123276045,
      "grad_norm": 0.6146206053517569,
      "learning_rate": 2.5522578489498133e-05,
      "loss": 1.1427,
      "num_input_tokens_seen": 43944825088,
      "step": 55855
    },
    {
      "epoch": 5.925737322300021,
      "grad_norm": 0.7592991711735777,
      "learning_rate": 2.552188367232269e-05,
      "loss": 1.1748,
      "num_input_tokens_seen": 43945611856,
      "step": 55856
    },
    {
      "epoch": 5.925843411839592,
      "grad_norm": 0.7424701585351684,
      "learning_rate": 2.552118885474395e-05,
      "loss": 1.3105,
      "num_input_tokens_seen": 43946398608,
      "step": 55857
    },
    {
      "epoch": 5.925949501379164,
      "grad_norm": 0.6214852050036401,
      "learning_rate": 2.5520494036762444e-05,
      "loss": 1.0895,
      "num_input_tokens_seen": 43947185456,
      "step": 55858
    },
    {
      "epoch": 5.926055590918735,
      "grad_norm": 0.6938437708739492,
      "learning_rate": 2.551979921837872e-05,
      "loss": 1.1578,
      "num_input_tokens_seen": 43947972128,
      "step": 55859
    },
    {
      "epoch": 5.926161680458307,
      "grad_norm": 0.6485148112461968,
      "learning_rate": 2.5519104399593314e-05,
      "loss": 1.1049,
      "num_input_tokens_seen": 43948758896,
      "step": 55860
    },
    {
      "epoch": 5.926267769997878,
      "grad_norm": 0.5665670602581439,
      "learning_rate": 2.5518409580406756e-05,
      "loss": 1.133,
      "num_input_tokens_seen": 43949545600,
      "step": 55861
    },
    {
      "epoch": 5.92637385953745,
      "grad_norm": 0.6887249556401953,
      "learning_rate": 2.551771476081959e-05,
      "loss": 1.2439,
      "num_input_tokens_seen": 43950332368,
      "step": 55862
    },
    {
      "epoch": 5.926479949077021,
      "grad_norm": 0.6172642788652803,
      "learning_rate": 2.5517019940832344e-05,
      "loss": 1.1048,
      "num_input_tokens_seen": 43951119168,
      "step": 55863
    },
    {
      "epoch": 5.926586038616592,
      "grad_norm": 0.9225058255045,
      "learning_rate": 2.551632512044556e-05,
      "loss": 1.1508,
      "num_input_tokens_seen": 43951905904,
      "step": 55864
    },
    {
      "epoch": 5.926692128156164,
      "grad_norm": 0.721518347537248,
      "learning_rate": 2.551563029965978e-05,
      "loss": 1.1523,
      "num_input_tokens_seen": 43952692784,
      "step": 55865
    },
    {
      "epoch": 5.926798217695735,
      "grad_norm": 0.6427892123034596,
      "learning_rate": 2.5514935478475537e-05,
      "loss": 1.2515,
      "num_input_tokens_seen": 43953479456,
      "step": 55866
    },
    {
      "epoch": 5.926904307235307,
      "grad_norm": 0.8183178345739208,
      "learning_rate": 2.5514240656893356e-05,
      "loss": 1.1475,
      "num_input_tokens_seen": 43954266144,
      "step": 55867
    },
    {
      "epoch": 5.927010396774878,
      "grad_norm": 0.7397685174814512,
      "learning_rate": 2.55135458349138e-05,
      "loss": 1.1727,
      "num_input_tokens_seen": 43955052944,
      "step": 55868
    },
    {
      "epoch": 5.92711648631445,
      "grad_norm": 0.935108272177025,
      "learning_rate": 2.5512851012537382e-05,
      "loss": 1.1598,
      "num_input_tokens_seen": 43955839760,
      "step": 55869
    },
    {
      "epoch": 5.927222575854021,
      "grad_norm": 0.8323569047611238,
      "learning_rate": 2.5512156189764643e-05,
      "loss": 1.1525,
      "num_input_tokens_seen": 43956626480,
      "step": 55870
    },
    {
      "epoch": 5.927328665393592,
      "grad_norm": 0.764697152852375,
      "learning_rate": 2.551146136659613e-05,
      "loss": 1.2117,
      "num_input_tokens_seen": 43957413152,
      "step": 55871
    },
    {
      "epoch": 5.927434754933164,
      "grad_norm": 0.7797309831466089,
      "learning_rate": 2.551076654303238e-05,
      "loss": 1.1653,
      "num_input_tokens_seen": 43958199920,
      "step": 55872
    },
    {
      "epoch": 5.927540844472735,
      "grad_norm": 0.7639198525736498,
      "learning_rate": 2.5510071719073915e-05,
      "loss": 1.1274,
      "num_input_tokens_seen": 43958986688,
      "step": 55873
    },
    {
      "epoch": 5.927646934012307,
      "grad_norm": 0.9021415048203397,
      "learning_rate": 2.5509376894721286e-05,
      "loss": 1.1351,
      "num_input_tokens_seen": 43959773488,
      "step": 55874
    },
    {
      "epoch": 5.927753023551878,
      "grad_norm": 1.2152663931425505,
      "learning_rate": 2.550868206997503e-05,
      "loss": 1.2134,
      "num_input_tokens_seen": 43960560256,
      "step": 55875
    },
    {
      "epoch": 5.927859113091449,
      "grad_norm": 0.9695061274119459,
      "learning_rate": 2.5507987244835675e-05,
      "loss": 1.1343,
      "num_input_tokens_seen": 43961347056,
      "step": 55876
    },
    {
      "epoch": 5.927965202631021,
      "grad_norm": 0.6528717926884509,
      "learning_rate": 2.5507292419303762e-05,
      "loss": 1.1755,
      "num_input_tokens_seen": 43962133792,
      "step": 55877
    },
    {
      "epoch": 5.928071292170592,
      "grad_norm": 0.7402823658529143,
      "learning_rate": 2.5506597593379833e-05,
      "loss": 1.1528,
      "num_input_tokens_seen": 43962920576,
      "step": 55878
    },
    {
      "epoch": 5.928177381710164,
      "grad_norm": 0.7979396494639163,
      "learning_rate": 2.550590276706441e-05,
      "loss": 1.1549,
      "num_input_tokens_seen": 43963707424,
      "step": 55879
    },
    {
      "epoch": 5.928283471249735,
      "grad_norm": 0.6366683107097733,
      "learning_rate": 2.550520794035805e-05,
      "loss": 1.1739,
      "num_input_tokens_seen": 43964494240,
      "step": 55880
    },
    {
      "epoch": 5.928389560789306,
      "grad_norm": 0.9036592417966036,
      "learning_rate": 2.550451311326128e-05,
      "loss": 1.1786,
      "num_input_tokens_seen": 43965280960,
      "step": 55881
    },
    {
      "epoch": 5.928495650328878,
      "grad_norm": 0.9225954575018259,
      "learning_rate": 2.550381828577463e-05,
      "loss": 1.1383,
      "num_input_tokens_seen": 43966067712,
      "step": 55882
    },
    {
      "epoch": 5.928601739868449,
      "grad_norm": 0.6713423786032807,
      "learning_rate": 2.5503123457898648e-05,
      "loss": 1.1616,
      "num_input_tokens_seen": 43966854416,
      "step": 55883
    },
    {
      "epoch": 5.928707829408021,
      "grad_norm": 0.8076373112637132,
      "learning_rate": 2.5502428629633862e-05,
      "loss": 1.0889,
      "num_input_tokens_seen": 43967641232,
      "step": 55884
    },
    {
      "epoch": 5.928813918947592,
      "grad_norm": 0.8185466474141291,
      "learning_rate": 2.550173380098082e-05,
      "loss": 1.1401,
      "num_input_tokens_seen": 43968428064,
      "step": 55885
    },
    {
      "epoch": 5.928920008487163,
      "grad_norm": 0.8089917030256715,
      "learning_rate": 2.5501038971940057e-05,
      "loss": 1.1056,
      "num_input_tokens_seen": 43969214832,
      "step": 55886
    },
    {
      "epoch": 5.929026098026735,
      "grad_norm": 0.8434974186366897,
      "learning_rate": 2.5500344142512095e-05,
      "loss": 1.108,
      "num_input_tokens_seen": 43970001696,
      "step": 55887
    },
    {
      "epoch": 5.929132187566306,
      "grad_norm": 0.6601843724673568,
      "learning_rate": 2.549964931269749e-05,
      "loss": 1.1079,
      "num_input_tokens_seen": 43970788432,
      "step": 55888
    },
    {
      "epoch": 5.929238277105878,
      "grad_norm": 0.8305747108819206,
      "learning_rate": 2.549895448249677e-05,
      "loss": 1.1202,
      "num_input_tokens_seen": 43971575184,
      "step": 55889
    },
    {
      "epoch": 5.929344366645449,
      "grad_norm": 0.6246926914670456,
      "learning_rate": 2.5498259651910465e-05,
      "loss": 1.1825,
      "num_input_tokens_seen": 43972361952,
      "step": 55890
    },
    {
      "epoch": 5.9294504561850205,
      "grad_norm": 0.8068894290668718,
      "learning_rate": 2.5497564820939128e-05,
      "loss": 1.085,
      "num_input_tokens_seen": 43973148688,
      "step": 55891
    },
    {
      "epoch": 5.929556545724592,
      "grad_norm": 0.8640660803017197,
      "learning_rate": 2.549686998958328e-05,
      "loss": 1.1644,
      "num_input_tokens_seen": 43973935472,
      "step": 55892
    },
    {
      "epoch": 5.929662635264163,
      "grad_norm": 0.7029953790459539,
      "learning_rate": 2.549617515784347e-05,
      "loss": 1.0489,
      "num_input_tokens_seen": 43974722256,
      "step": 55893
    },
    {
      "epoch": 5.9297687248037345,
      "grad_norm": 0.6633214671352714,
      "learning_rate": 2.5495480325720234e-05,
      "loss": 1.1524,
      "num_input_tokens_seen": 43975509040,
      "step": 55894
    },
    {
      "epoch": 5.9298748143433055,
      "grad_norm": 0.7050316645107996,
      "learning_rate": 2.5494785493214103e-05,
      "loss": 1.2038,
      "num_input_tokens_seen": 43976295712,
      "step": 55895
    },
    {
      "epoch": 5.9299809038828775,
      "grad_norm": 0.8307433035975492,
      "learning_rate": 2.5494090660325608e-05,
      "loss": 1.1489,
      "num_input_tokens_seen": 43977082576,
      "step": 55896
    },
    {
      "epoch": 5.9300869934224485,
      "grad_norm": 0.8477045011764005,
      "learning_rate": 2.5493395827055304e-05,
      "loss": 1.1933,
      "num_input_tokens_seen": 43977869328,
      "step": 55897
    },
    {
      "epoch": 5.93019308296202,
      "grad_norm": 0.896021848371887,
      "learning_rate": 2.5492700993403717e-05,
      "loss": 1.1518,
      "num_input_tokens_seen": 43978656080,
      "step": 55898
    },
    {
      "epoch": 5.930299172501591,
      "grad_norm": 0.7543091690143275,
      "learning_rate": 2.5492006159371386e-05,
      "loss": 1.1505,
      "num_input_tokens_seen": 43979442848,
      "step": 55899
    },
    {
      "epoch": 5.9304052620411625,
      "grad_norm": 0.9588127113321725,
      "learning_rate": 2.5491311324958845e-05,
      "loss": 1.2581,
      "num_input_tokens_seen": 43980229536,
      "step": 55900
    },
    {
      "epoch": 5.930511351580734,
      "grad_norm": 1.2415479485163041,
      "learning_rate": 2.5490616490166623e-05,
      "loss": 1.2189,
      "num_input_tokens_seen": 43981016320,
      "step": 55901
    },
    {
      "epoch": 5.930617441120305,
      "grad_norm": 0.788868695803475,
      "learning_rate": 2.548992165499528e-05,
      "loss": 1.1778,
      "num_input_tokens_seen": 43981803168,
      "step": 55902
    },
    {
      "epoch": 5.930723530659877,
      "grad_norm": 0.7941969034194467,
      "learning_rate": 2.548922681944534e-05,
      "loss": 1.1493,
      "num_input_tokens_seen": 43982589936,
      "step": 55903
    },
    {
      "epoch": 5.930829620199448,
      "grad_norm": 0.8541881910991808,
      "learning_rate": 2.5488531983517334e-05,
      "loss": 1.1635,
      "num_input_tokens_seen": 43983376672,
      "step": 55904
    },
    {
      "epoch": 5.930935709739019,
      "grad_norm": 0.7951220858425451,
      "learning_rate": 2.5487837147211807e-05,
      "loss": 1.1043,
      "num_input_tokens_seen": 43984163376,
      "step": 55905
    },
    {
      "epoch": 5.931041799278591,
      "grad_norm": 0.6902112672714699,
      "learning_rate": 2.54871423105293e-05,
      "loss": 1.1467,
      "num_input_tokens_seen": 43984950128,
      "step": 55906
    },
    {
      "epoch": 5.931147888818162,
      "grad_norm": 0.64439886551658,
      "learning_rate": 2.5486447473470332e-05,
      "loss": 1.1155,
      "num_input_tokens_seen": 43985736800,
      "step": 55907
    },
    {
      "epoch": 5.931253978357734,
      "grad_norm": 0.6543322441676562,
      "learning_rate": 2.548575263603546e-05,
      "loss": 1.1285,
      "num_input_tokens_seen": 43986523600,
      "step": 55908
    },
    {
      "epoch": 5.931360067897305,
      "grad_norm": 0.6128685203339478,
      "learning_rate": 2.5485057798225208e-05,
      "loss": 1.0389,
      "num_input_tokens_seen": 43987310416,
      "step": 55909
    },
    {
      "epoch": 5.931466157436876,
      "grad_norm": 0.7882375984367628,
      "learning_rate": 2.548436296004012e-05,
      "loss": 1.1165,
      "num_input_tokens_seen": 43988097280,
      "step": 55910
    },
    {
      "epoch": 5.931572246976448,
      "grad_norm": 0.5903766754586286,
      "learning_rate": 2.548366812148073e-05,
      "loss": 1.1622,
      "num_input_tokens_seen": 43988884064,
      "step": 55911
    },
    {
      "epoch": 5.931678336516019,
      "grad_norm": 0.7402297071565577,
      "learning_rate": 2.5482973282547578e-05,
      "loss": 1.1067,
      "num_input_tokens_seen": 43989670800,
      "step": 55912
    },
    {
      "epoch": 5.931784426055591,
      "grad_norm": 0.7646903818651462,
      "learning_rate": 2.5482278443241192e-05,
      "loss": 1.1203,
      "num_input_tokens_seen": 43990457504,
      "step": 55913
    },
    {
      "epoch": 5.931890515595162,
      "grad_norm": 0.7010287925711632,
      "learning_rate": 2.548158360356212e-05,
      "loss": 1.1131,
      "num_input_tokens_seen": 43991244368,
      "step": 55914
    },
    {
      "epoch": 5.931996605134733,
      "grad_norm": 0.6482554091479962,
      "learning_rate": 2.5480888763510897e-05,
      "loss": 1.1926,
      "num_input_tokens_seen": 43992031120,
      "step": 55915
    },
    {
      "epoch": 5.932102694674305,
      "grad_norm": 0.6119591291894706,
      "learning_rate": 2.5480193923088047e-05,
      "loss": 1.1517,
      "num_input_tokens_seen": 43992817952,
      "step": 55916
    },
    {
      "epoch": 5.932208784213876,
      "grad_norm": 0.7633680066267121,
      "learning_rate": 2.547949908229413e-05,
      "loss": 1.0893,
      "num_input_tokens_seen": 43993604752,
      "step": 55917
    },
    {
      "epoch": 5.932314873753448,
      "grad_norm": 0.6873241321295747,
      "learning_rate": 2.547880424112966e-05,
      "loss": 1.1477,
      "num_input_tokens_seen": 43994391488,
      "step": 55918
    },
    {
      "epoch": 5.932420963293019,
      "grad_norm": 0.7782103841142491,
      "learning_rate": 2.5478109399595186e-05,
      "loss": 1.1097,
      "num_input_tokens_seen": 43995178240,
      "step": 55919
    },
    {
      "epoch": 5.932527052832591,
      "grad_norm": 0.610152703253771,
      "learning_rate": 2.5477414557691242e-05,
      "loss": 1.1585,
      "num_input_tokens_seen": 43995964976,
      "step": 55920
    },
    {
      "epoch": 5.932633142372162,
      "grad_norm": 0.664847812519183,
      "learning_rate": 2.5476719715418374e-05,
      "loss": 1.2396,
      "num_input_tokens_seen": 43996751664,
      "step": 55921
    },
    {
      "epoch": 5.932739231911733,
      "grad_norm": 0.6879187546518895,
      "learning_rate": 2.5476024872777105e-05,
      "loss": 1.1189,
      "num_input_tokens_seen": 43997538464,
      "step": 55922
    },
    {
      "epoch": 5.932845321451305,
      "grad_norm": 0.6478427963826439,
      "learning_rate": 2.547533002976798e-05,
      "loss": 1.2821,
      "num_input_tokens_seen": 43998325152,
      "step": 55923
    },
    {
      "epoch": 5.932951410990876,
      "grad_norm": 0.7461142693728339,
      "learning_rate": 2.547463518639154e-05,
      "loss": 1.1518,
      "num_input_tokens_seen": 43999111888,
      "step": 55924
    },
    {
      "epoch": 5.933057500530448,
      "grad_norm": 0.6461982512938935,
      "learning_rate": 2.54739403426483e-05,
      "loss": 1.0909,
      "num_input_tokens_seen": 43999898624,
      "step": 55925
    },
    {
      "epoch": 5.933163590070019,
      "grad_norm": 0.6671346977627934,
      "learning_rate": 2.5473245498538824e-05,
      "loss": 1.1057,
      "num_input_tokens_seen": 44000685472,
      "step": 55926
    },
    {
      "epoch": 5.933269679609591,
      "grad_norm": 0.6267075000444193,
      "learning_rate": 2.5472550654063633e-05,
      "loss": 1.0627,
      "num_input_tokens_seen": 44001472304,
      "step": 55927
    },
    {
      "epoch": 5.933375769149162,
      "grad_norm": 0.6473286871965707,
      "learning_rate": 2.5471855809223273e-05,
      "loss": 1.1146,
      "num_input_tokens_seen": 44002259056,
      "step": 55928
    },
    {
      "epoch": 5.933481858688733,
      "grad_norm": 0.7543717328502741,
      "learning_rate": 2.5471160964018275e-05,
      "loss": 1.1646,
      "num_input_tokens_seen": 44003045792,
      "step": 55929
    },
    {
      "epoch": 5.933587948228305,
      "grad_norm": 0.695150175589439,
      "learning_rate": 2.5470466118449175e-05,
      "loss": 1.0906,
      "num_input_tokens_seen": 44003832480,
      "step": 55930
    },
    {
      "epoch": 5.933694037767876,
      "grad_norm": 0.7468132308346519,
      "learning_rate": 2.546977127251652e-05,
      "loss": 1.1819,
      "num_input_tokens_seen": 44004619280,
      "step": 55931
    },
    {
      "epoch": 5.933800127307448,
      "grad_norm": 0.7436168863846326,
      "learning_rate": 2.5469076426220834e-05,
      "loss": 1.1508,
      "num_input_tokens_seen": 44005405984,
      "step": 55932
    },
    {
      "epoch": 5.933906216847019,
      "grad_norm": 0.6907800254672881,
      "learning_rate": 2.5468381579562656e-05,
      "loss": 1.161,
      "num_input_tokens_seen": 44006192688,
      "step": 55933
    },
    {
      "epoch": 5.93401230638659,
      "grad_norm": 0.8924720171644424,
      "learning_rate": 2.5467686732542535e-05,
      "loss": 1.1959,
      "num_input_tokens_seen": 44006979360,
      "step": 55934
    },
    {
      "epoch": 5.934118395926162,
      "grad_norm": 0.6529702631821549,
      "learning_rate": 2.5466991885160994e-05,
      "loss": 1.1057,
      "num_input_tokens_seen": 44007766080,
      "step": 55935
    },
    {
      "epoch": 5.934224485465733,
      "grad_norm": 0.6205302465617831,
      "learning_rate": 2.5466297037418574e-05,
      "loss": 1.084,
      "num_input_tokens_seen": 44008552832,
      "step": 55936
    },
    {
      "epoch": 5.934330575005305,
      "grad_norm": 1.0982834328163036,
      "learning_rate": 2.546560218931582e-05,
      "loss": 1.2072,
      "num_input_tokens_seen": 44009339616,
      "step": 55937
    },
    {
      "epoch": 5.934436664544876,
      "grad_norm": 0.5175907106464441,
      "learning_rate": 2.546490734085326e-05,
      "loss": 1.0611,
      "num_input_tokens_seen": 44010126416,
      "step": 55938
    },
    {
      "epoch": 5.934542754084447,
      "grad_norm": 0.7758083929520839,
      "learning_rate": 2.546421249203143e-05,
      "loss": 1.1489,
      "num_input_tokens_seen": 44010913120,
      "step": 55939
    },
    {
      "epoch": 5.934648843624019,
      "grad_norm": 0.777087468750688,
      "learning_rate": 2.546351764285087e-05,
      "loss": 1.1731,
      "num_input_tokens_seen": 44011699936,
      "step": 55940
    },
    {
      "epoch": 5.93475493316359,
      "grad_norm": 0.5930651846618984,
      "learning_rate": 2.5462822793312125e-05,
      "loss": 1.0749,
      "num_input_tokens_seen": 44012486784,
      "step": 55941
    },
    {
      "epoch": 5.934861022703162,
      "grad_norm": 0.6061065848187852,
      "learning_rate": 2.5462127943415714e-05,
      "loss": 1.0724,
      "num_input_tokens_seen": 44013273536,
      "step": 55942
    },
    {
      "epoch": 5.934967112242733,
      "grad_norm": 0.7264489078314957,
      "learning_rate": 2.546143309316219e-05,
      "loss": 1.213,
      "num_input_tokens_seen": 44014060288,
      "step": 55943
    },
    {
      "epoch": 5.935073201782304,
      "grad_norm": 0.7898073814618325,
      "learning_rate": 2.5460738242552078e-05,
      "loss": 1.0905,
      "num_input_tokens_seen": 44014847088,
      "step": 55944
    },
    {
      "epoch": 5.935179291321876,
      "grad_norm": 0.6883044358007481,
      "learning_rate": 2.5460043391585925e-05,
      "loss": 1.06,
      "num_input_tokens_seen": 44015633936,
      "step": 55945
    },
    {
      "epoch": 5.935285380861447,
      "grad_norm": 0.7869373181572337,
      "learning_rate": 2.5459348540264265e-05,
      "loss": 1.1238,
      "num_input_tokens_seen": 44016420768,
      "step": 55946
    },
    {
      "epoch": 5.935391470401019,
      "grad_norm": 0.9333214319543525,
      "learning_rate": 2.545865368858763e-05,
      "loss": 1.0261,
      "num_input_tokens_seen": 44017207472,
      "step": 55947
    },
    {
      "epoch": 5.93549755994059,
      "grad_norm": 0.8266759067054087,
      "learning_rate": 2.5457958836556567e-05,
      "loss": 1.089,
      "num_input_tokens_seen": 44017994272,
      "step": 55948
    },
    {
      "epoch": 5.935603649480162,
      "grad_norm": 0.8146261959702229,
      "learning_rate": 2.5457263984171603e-05,
      "loss": 1.1413,
      "num_input_tokens_seen": 44018781072,
      "step": 55949
    },
    {
      "epoch": 5.935709739019733,
      "grad_norm": 0.966918805599552,
      "learning_rate": 2.5456569131433277e-05,
      "loss": 1.1334,
      "num_input_tokens_seen": 44019567888,
      "step": 55950
    },
    {
      "epoch": 5.935815828559304,
      "grad_norm": 0.7301034161662822,
      "learning_rate": 2.5455874278342135e-05,
      "loss": 1.0849,
      "num_input_tokens_seen": 44020354672,
      "step": 55951
    },
    {
      "epoch": 5.935921918098876,
      "grad_norm": 0.7186091644885813,
      "learning_rate": 2.54551794248987e-05,
      "loss": 1.1759,
      "num_input_tokens_seen": 44021141424,
      "step": 55952
    },
    {
      "epoch": 5.936028007638447,
      "grad_norm": 0.988561692232185,
      "learning_rate": 2.5454484571103516e-05,
      "loss": 1.2016,
      "num_input_tokens_seen": 44021928192,
      "step": 55953
    },
    {
      "epoch": 5.9361340971780185,
      "grad_norm": 0.6989159620889466,
      "learning_rate": 2.5453789716957127e-05,
      "loss": 1.2142,
      "num_input_tokens_seen": 44022714912,
      "step": 55954
    },
    {
      "epoch": 5.93624018671759,
      "grad_norm": 0.6918450547232149,
      "learning_rate": 2.545309486246006e-05,
      "loss": 1.1578,
      "num_input_tokens_seen": 44023501584,
      "step": 55955
    },
    {
      "epoch": 5.9363462762571615,
      "grad_norm": 0.7148602194256648,
      "learning_rate": 2.545240000761284e-05,
      "loss": 1.0955,
      "num_input_tokens_seen": 44024288304,
      "step": 55956
    },
    {
      "epoch": 5.9364523657967325,
      "grad_norm": 0.656370335794424,
      "learning_rate": 2.545170515241604e-05,
      "loss": 1.0835,
      "num_input_tokens_seen": 44025075040,
      "step": 55957
    },
    {
      "epoch": 5.9365584553363036,
      "grad_norm": 0.652756730840436,
      "learning_rate": 2.5451010296870165e-05,
      "loss": 1.1049,
      "num_input_tokens_seen": 44025861904,
      "step": 55958
    },
    {
      "epoch": 5.9366645448758755,
      "grad_norm": 0.5957608728194617,
      "learning_rate": 2.5450315440975758e-05,
      "loss": 1.1416,
      "num_input_tokens_seen": 44026648736,
      "step": 55959
    },
    {
      "epoch": 5.9367706344154465,
      "grad_norm": 0.9014228506120524,
      "learning_rate": 2.5449620584733368e-05,
      "loss": 1.2224,
      "num_input_tokens_seen": 44027435376,
      "step": 55960
    },
    {
      "epoch": 5.936876723955018,
      "grad_norm": 0.5969013634947458,
      "learning_rate": 2.544892572814352e-05,
      "loss": 1.0324,
      "num_input_tokens_seen": 44028222128,
      "step": 55961
    },
    {
      "epoch": 5.9369828134945895,
      "grad_norm": 0.8050186192065977,
      "learning_rate": 2.5448230871206756e-05,
      "loss": 1.1361,
      "num_input_tokens_seen": 44029008880,
      "step": 55962
    },
    {
      "epoch": 5.9370889030341605,
      "grad_norm": 0.6441962614632925,
      "learning_rate": 2.5447536013923617e-05,
      "loss": 1.0589,
      "num_input_tokens_seen": 44029795648,
      "step": 55963
    },
    {
      "epoch": 5.937194992573732,
      "grad_norm": 0.5700876103144042,
      "learning_rate": 2.5446841156294632e-05,
      "loss": 1.1432,
      "num_input_tokens_seen": 44030582496,
      "step": 55964
    },
    {
      "epoch": 5.937301082113303,
      "grad_norm": 0.6373433646313027,
      "learning_rate": 2.5446146298320335e-05,
      "loss": 1.1302,
      "num_input_tokens_seen": 44031369184,
      "step": 55965
    },
    {
      "epoch": 5.937407171652875,
      "grad_norm": 0.7477214817247069,
      "learning_rate": 2.5445451440001278e-05,
      "loss": 1.1959,
      "num_input_tokens_seen": 44032155840,
      "step": 55966
    },
    {
      "epoch": 5.937513261192446,
      "grad_norm": 0.6925298766807195,
      "learning_rate": 2.5444756581337987e-05,
      "loss": 1.1094,
      "num_input_tokens_seen": 44032942672,
      "step": 55967
    },
    {
      "epoch": 5.937619350732017,
      "grad_norm": 0.6963720300935886,
      "learning_rate": 2.5444061722330998e-05,
      "loss": 1.1657,
      "num_input_tokens_seen": 44033729456,
      "step": 55968
    },
    {
      "epoch": 5.937725440271589,
      "grad_norm": 0.6155182013007465,
      "learning_rate": 2.5443366862980854e-05,
      "loss": 1.1734,
      "num_input_tokens_seen": 44034516192,
      "step": 55969
    },
    {
      "epoch": 5.93783152981116,
      "grad_norm": 0.6777285209594824,
      "learning_rate": 2.5442672003288093e-05,
      "loss": 1.1341,
      "num_input_tokens_seen": 44035303024,
      "step": 55970
    },
    {
      "epoch": 5.937937619350732,
      "grad_norm": 0.6950822995246745,
      "learning_rate": 2.5441977143253243e-05,
      "loss": 1.1694,
      "num_input_tokens_seen": 44036089728,
      "step": 55971
    },
    {
      "epoch": 5.938043708890303,
      "grad_norm": 0.770152320342055,
      "learning_rate": 2.5441282282876848e-05,
      "loss": 1.1215,
      "num_input_tokens_seen": 44036876448,
      "step": 55972
    },
    {
      "epoch": 5.938149798429874,
      "grad_norm": 0.6395096767996522,
      "learning_rate": 2.5440587422159438e-05,
      "loss": 1.1082,
      "num_input_tokens_seen": 44037663232,
      "step": 55973
    },
    {
      "epoch": 5.938255887969446,
      "grad_norm": 1.0004170106883548,
      "learning_rate": 2.5439892561101565e-05,
      "loss": 1.1651,
      "num_input_tokens_seen": 44038450032,
      "step": 55974
    },
    {
      "epoch": 5.938361977509017,
      "grad_norm": 0.5980060510668319,
      "learning_rate": 2.5439197699703747e-05,
      "loss": 1.0974,
      "num_input_tokens_seen": 44039236864,
      "step": 55975
    },
    {
      "epoch": 5.938468067048589,
      "grad_norm": 0.5727758841893472,
      "learning_rate": 2.5438502837966533e-05,
      "loss": 1.0301,
      "num_input_tokens_seen": 44040023712,
      "step": 55976
    },
    {
      "epoch": 5.93857415658816,
      "grad_norm": 0.8010478138660577,
      "learning_rate": 2.5437807975890455e-05,
      "loss": 1.291,
      "num_input_tokens_seen": 44040810368,
      "step": 55977
    },
    {
      "epoch": 5.938680246127732,
      "grad_norm": 0.6761859792561828,
      "learning_rate": 2.543711311347606e-05,
      "loss": 1.1254,
      "num_input_tokens_seen": 44041597168,
      "step": 55978
    },
    {
      "epoch": 5.938786335667303,
      "grad_norm": 0.6219426357128984,
      "learning_rate": 2.5436418250723865e-05,
      "loss": 1.0677,
      "num_input_tokens_seen": 44042384016,
      "step": 55979
    },
    {
      "epoch": 5.938892425206874,
      "grad_norm": 0.9938269476703092,
      "learning_rate": 2.5435723387634424e-05,
      "loss": 1.207,
      "num_input_tokens_seen": 44043170752,
      "step": 55980
    },
    {
      "epoch": 5.938998514746446,
      "grad_norm": 0.5810369144313237,
      "learning_rate": 2.543502852420827e-05,
      "loss": 1.1928,
      "num_input_tokens_seen": 44043957616,
      "step": 55981
    },
    {
      "epoch": 5.939104604286017,
      "grad_norm": 0.7548092106470878,
      "learning_rate": 2.5434333660445936e-05,
      "loss": 1.162,
      "num_input_tokens_seen": 44044744448,
      "step": 55982
    },
    {
      "epoch": 5.939210693825589,
      "grad_norm": 0.8115750305385642,
      "learning_rate": 2.5433638796347963e-05,
      "loss": 1.1692,
      "num_input_tokens_seen": 44045531264,
      "step": 55983
    },
    {
      "epoch": 5.93931678336516,
      "grad_norm": 0.6825968360331583,
      "learning_rate": 2.5432943931914894e-05,
      "loss": 1.1518,
      "num_input_tokens_seen": 44046318032,
      "step": 55984
    },
    {
      "epoch": 5.939422872904732,
      "grad_norm": 0.6743777906108974,
      "learning_rate": 2.5432249067147247e-05,
      "loss": 1.0701,
      "num_input_tokens_seen": 44047104896,
      "step": 55985
    },
    {
      "epoch": 5.939528962444303,
      "grad_norm": 0.9685474774531384,
      "learning_rate": 2.5431554202045577e-05,
      "loss": 1.1043,
      "num_input_tokens_seen": 44047891584,
      "step": 55986
    },
    {
      "epoch": 5.939635051983874,
      "grad_norm": 0.722572637819431,
      "learning_rate": 2.5430859336610407e-05,
      "loss": 1.1558,
      "num_input_tokens_seen": 44048678384,
      "step": 55987
    },
    {
      "epoch": 5.939741141523446,
      "grad_norm": 0.635692036310866,
      "learning_rate": 2.5430164470842292e-05,
      "loss": 1.1118,
      "num_input_tokens_seen": 44049465248,
      "step": 55988
    },
    {
      "epoch": 5.939847231063017,
      "grad_norm": 0.8512287565777384,
      "learning_rate": 2.5429469604741757e-05,
      "loss": 1.162,
      "num_input_tokens_seen": 44050252032,
      "step": 55989
    },
    {
      "epoch": 5.939953320602589,
      "grad_norm": 0.5787673984245181,
      "learning_rate": 2.542877473830933e-05,
      "loss": 1.0854,
      "num_input_tokens_seen": 44051038928,
      "step": 55990
    },
    {
      "epoch": 5.94005941014216,
      "grad_norm": 0.7155870657198188,
      "learning_rate": 2.542807987154557e-05,
      "loss": 1.0982,
      "num_input_tokens_seen": 44051825664,
      "step": 55991
    },
    {
      "epoch": 5.940165499681731,
      "grad_norm": 0.5763797750598336,
      "learning_rate": 2.5427385004450998e-05,
      "loss": 1.1372,
      "num_input_tokens_seen": 44052612432,
      "step": 55992
    },
    {
      "epoch": 5.940271589221303,
      "grad_norm": 0.6415877711100095,
      "learning_rate": 2.5426690137026154e-05,
      "loss": 1.0694,
      "num_input_tokens_seen": 44053399136,
      "step": 55993
    },
    {
      "epoch": 5.940377678760874,
      "grad_norm": 0.6918768925438439,
      "learning_rate": 2.542599526927158e-05,
      "loss": 1.1865,
      "num_input_tokens_seen": 44054185968,
      "step": 55994
    },
    {
      "epoch": 5.940483768300446,
      "grad_norm": 0.6363322571025294,
      "learning_rate": 2.5425300401187813e-05,
      "loss": 1.1044,
      "num_input_tokens_seen": 44054972688,
      "step": 55995
    },
    {
      "epoch": 5.940589857840017,
      "grad_norm": 0.6482157023133414,
      "learning_rate": 2.5424605532775376e-05,
      "loss": 1.1483,
      "num_input_tokens_seen": 44055759392,
      "step": 55996
    },
    {
      "epoch": 5.940695947379588,
      "grad_norm": 0.6904607701169563,
      "learning_rate": 2.5423910664034823e-05,
      "loss": 1.178,
      "num_input_tokens_seen": 44056546128,
      "step": 55997
    },
    {
      "epoch": 5.94080203691916,
      "grad_norm": 0.730778670237224,
      "learning_rate": 2.542321579496668e-05,
      "loss": 1.1456,
      "num_input_tokens_seen": 44057332848,
      "step": 55998
    },
    {
      "epoch": 5.940908126458731,
      "grad_norm": 0.9185844411490897,
      "learning_rate": 2.5422520925571493e-05,
      "loss": 1.1637,
      "num_input_tokens_seen": 44058119616,
      "step": 55999
    },
    {
      "epoch": 5.941014215998303,
      "grad_norm": 0.709414487871937,
      "learning_rate": 2.542182605584979e-05,
      "loss": 1.1517,
      "num_input_tokens_seen": 44058906352,
      "step": 56000
    },
    {
      "epoch": 5.941014215998303,
      "eval_loss": 1.5029090642929077,
      "eval_runtime": 64.5982,
      "eval_samples_per_second": 46.441,
      "eval_steps_per_second": 0.495,
      "num_input_tokens_seen": 44058906352,
      "step": 56000
    },
    {
      "epoch": 5.941120305537874,
      "grad_norm": 0.7353523083688639,
      "learning_rate": 2.5421131185802116e-05,
      "loss": 1.1185,
      "num_input_tokens_seen": 44059693088,
      "step": 56001
    },
    {
      "epoch": 5.941226395077445,
      "grad_norm": 0.8257674272625053,
      "learning_rate": 2.5420436315429e-05,
      "loss": 1.2325,
      "num_input_tokens_seen": 44060479792,
      "step": 56002
    },
    {
      "epoch": 5.941332484617017,
      "grad_norm": 0.6510244116109384,
      "learning_rate": 2.541974144473099e-05,
      "loss": 1.1451,
      "num_input_tokens_seen": 44061266592,
      "step": 56003
    },
    {
      "epoch": 5.941438574156588,
      "grad_norm": 0.6572032286820285,
      "learning_rate": 2.5419046573708606e-05,
      "loss": 1.1754,
      "num_input_tokens_seen": 44062053408,
      "step": 56004
    },
    {
      "epoch": 5.94154466369616,
      "grad_norm": 0.730479192443778,
      "learning_rate": 2.5418351702362403e-05,
      "loss": 1.1684,
      "num_input_tokens_seen": 44062840192,
      "step": 56005
    },
    {
      "epoch": 5.941650753235731,
      "grad_norm": 0.7047319608841451,
      "learning_rate": 2.541765683069291e-05,
      "loss": 1.1487,
      "num_input_tokens_seen": 44063626976,
      "step": 56006
    },
    {
      "epoch": 5.941756842775303,
      "grad_norm": 0.689242382328577,
      "learning_rate": 2.541696195870066e-05,
      "loss": 1.1254,
      "num_input_tokens_seen": 44064413744,
      "step": 56007
    },
    {
      "epoch": 5.941862932314874,
      "grad_norm": 0.6730793857540233,
      "learning_rate": 2.5416267086386196e-05,
      "loss": 1.1606,
      "num_input_tokens_seen": 44065200432,
      "step": 56008
    },
    {
      "epoch": 5.941969021854446,
      "grad_norm": 0.8854097400118276,
      "learning_rate": 2.5415572213750056e-05,
      "loss": 1.1221,
      "num_input_tokens_seen": 44065987152,
      "step": 56009
    },
    {
      "epoch": 5.942075111394017,
      "grad_norm": 0.9748300101893035,
      "learning_rate": 2.5414877340792763e-05,
      "loss": 1.1533,
      "num_input_tokens_seen": 44066773984,
      "step": 56010
    },
    {
      "epoch": 5.942181200933588,
      "grad_norm": 0.8885165659548308,
      "learning_rate": 2.541418246751488e-05,
      "loss": 1.0778,
      "num_input_tokens_seen": 44067560784,
      "step": 56011
    },
    {
      "epoch": 5.94228729047316,
      "grad_norm": 1.091194575487038,
      "learning_rate": 2.541348759391692e-05,
      "loss": 1.1959,
      "num_input_tokens_seen": 44068347600,
      "step": 56012
    },
    {
      "epoch": 5.942393380012731,
      "grad_norm": 0.801556675052119,
      "learning_rate": 2.5412792719999428e-05,
      "loss": 1.1839,
      "num_input_tokens_seen": 44069134304,
      "step": 56013
    },
    {
      "epoch": 5.942499469552303,
      "grad_norm": 0.7577219010727583,
      "learning_rate": 2.541209784576294e-05,
      "loss": 1.0928,
      "num_input_tokens_seen": 44069921040,
      "step": 56014
    },
    {
      "epoch": 5.942605559091874,
      "grad_norm": 1.0707925312141597,
      "learning_rate": 2.5411402971208005e-05,
      "loss": 1.1564,
      "num_input_tokens_seen": 44070707808,
      "step": 56015
    },
    {
      "epoch": 5.942711648631445,
      "grad_norm": 0.8543668412722515,
      "learning_rate": 2.541070809633514e-05,
      "loss": 1.1675,
      "num_input_tokens_seen": 44071494480,
      "step": 56016
    },
    {
      "epoch": 5.9428177381710166,
      "grad_norm": 0.7517876612546822,
      "learning_rate": 2.5410013221144895e-05,
      "loss": 1.0405,
      "num_input_tokens_seen": 44072281216,
      "step": 56017
    },
    {
      "epoch": 5.942923827710588,
      "grad_norm": 1.1424106390494593,
      "learning_rate": 2.5409318345637805e-05,
      "loss": 1.1197,
      "num_input_tokens_seen": 44073067904,
      "step": 56018
    },
    {
      "epoch": 5.9430299172501595,
      "grad_norm": 0.7618070489112266,
      "learning_rate": 2.540862346981441e-05,
      "loss": 1.1993,
      "num_input_tokens_seen": 44073854656,
      "step": 56019
    },
    {
      "epoch": 5.9431360067897305,
      "grad_norm": 0.7294785011613637,
      "learning_rate": 2.5407928593675233e-05,
      "loss": 1.1686,
      "num_input_tokens_seen": 44074641408,
      "step": 56020
    },
    {
      "epoch": 5.943242096329302,
      "grad_norm": 1.1136391082715678,
      "learning_rate": 2.5407233717220828e-05,
      "loss": 1.1505,
      "num_input_tokens_seen": 44075428144,
      "step": 56021
    },
    {
      "epoch": 5.9433481858688735,
      "grad_norm": 1.241024545947772,
      "learning_rate": 2.540653884045172e-05,
      "loss": 1.2084,
      "num_input_tokens_seen": 44076214896,
      "step": 56022
    },
    {
      "epoch": 5.9434542754084445,
      "grad_norm": 0.7625444506222306,
      "learning_rate": 2.5405843963368458e-05,
      "loss": 1.1525,
      "num_input_tokens_seen": 44077001712,
      "step": 56023
    },
    {
      "epoch": 5.943560364948016,
      "grad_norm": 1.0921414326403185,
      "learning_rate": 2.540514908597157e-05,
      "loss": 1.173,
      "num_input_tokens_seen": 44077788496,
      "step": 56024
    },
    {
      "epoch": 5.9436664544875875,
      "grad_norm": 0.8585132317962866,
      "learning_rate": 2.5404454208261584e-05,
      "loss": 1.1858,
      "num_input_tokens_seen": 44078575264,
      "step": 56025
    },
    {
      "epoch": 5.9437725440271585,
      "grad_norm": 0.6776587063012144,
      "learning_rate": 2.5403759330239064e-05,
      "loss": 1.1908,
      "num_input_tokens_seen": 44079361904,
      "step": 56026
    },
    {
      "epoch": 5.94387863356673,
      "grad_norm": 0.9947549504352522,
      "learning_rate": 2.5403064451904524e-05,
      "loss": 1.2,
      "num_input_tokens_seen": 44080148656,
      "step": 56027
    },
    {
      "epoch": 5.943984723106301,
      "grad_norm": 0.8629285954881862,
      "learning_rate": 2.54023695732585e-05,
      "loss": 1.2331,
      "num_input_tokens_seen": 44080935408,
      "step": 56028
    },
    {
      "epoch": 5.944090812645873,
      "grad_norm": 0.7350357289607693,
      "learning_rate": 2.5401674694301546e-05,
      "loss": 1.0792,
      "num_input_tokens_seen": 44081722208,
      "step": 56029
    },
    {
      "epoch": 5.944196902185444,
      "grad_norm": 0.7593058592572648,
      "learning_rate": 2.5400979815034183e-05,
      "loss": 1.1421,
      "num_input_tokens_seen": 44082508944,
      "step": 56030
    },
    {
      "epoch": 5.944302991725015,
      "grad_norm": 0.7607350960564145,
      "learning_rate": 2.5400284935456957e-05,
      "loss": 1.1782,
      "num_input_tokens_seen": 44083295712,
      "step": 56031
    },
    {
      "epoch": 5.944409081264587,
      "grad_norm": 0.6111186465260134,
      "learning_rate": 2.5399590055570405e-05,
      "loss": 1.0842,
      "num_input_tokens_seen": 44084082496,
      "step": 56032
    },
    {
      "epoch": 5.944515170804158,
      "grad_norm": 0.682149112988182,
      "learning_rate": 2.539889517537506e-05,
      "loss": 1.1942,
      "num_input_tokens_seen": 44084869280,
      "step": 56033
    },
    {
      "epoch": 5.94462126034373,
      "grad_norm": 0.9867132334617853,
      "learning_rate": 2.539820029487146e-05,
      "loss": 1.2129,
      "num_input_tokens_seen": 44085656064,
      "step": 56034
    },
    {
      "epoch": 5.944727349883301,
      "grad_norm": 0.7081040940713269,
      "learning_rate": 2.5397505414060146e-05,
      "loss": 1.1296,
      "num_input_tokens_seen": 44086442864,
      "step": 56035
    },
    {
      "epoch": 5.944833439422873,
      "grad_norm": 0.787555354174917,
      "learning_rate": 2.5396810532941646e-05,
      "loss": 1.1419,
      "num_input_tokens_seen": 44087229712,
      "step": 56036
    },
    {
      "epoch": 5.944939528962444,
      "grad_norm": 0.8050153082768206,
      "learning_rate": 2.5396115651516506e-05,
      "loss": 1.1836,
      "num_input_tokens_seen": 44088016464,
      "step": 56037
    },
    {
      "epoch": 5.945045618502016,
      "grad_norm": 0.6104056277027435,
      "learning_rate": 2.5395420769785262e-05,
      "loss": 1.161,
      "num_input_tokens_seen": 44088803280,
      "step": 56038
    },
    {
      "epoch": 5.945151708041587,
      "grad_norm": 0.8114947212244851,
      "learning_rate": 2.539472588774844e-05,
      "loss": 1.1411,
      "num_input_tokens_seen": 44089590064,
      "step": 56039
    },
    {
      "epoch": 5.945257797581158,
      "grad_norm": 1.0380493141914,
      "learning_rate": 2.5394031005406587e-05,
      "loss": 1.2062,
      "num_input_tokens_seen": 44090376800,
      "step": 56040
    },
    {
      "epoch": 5.94536388712073,
      "grad_norm": 0.5969486315641844,
      "learning_rate": 2.5393336122760246e-05,
      "loss": 1.1202,
      "num_input_tokens_seen": 44091163536,
      "step": 56041
    },
    {
      "epoch": 5.945469976660301,
      "grad_norm": 1.4012024944057049,
      "learning_rate": 2.539264123980994e-05,
      "loss": 1.1745,
      "num_input_tokens_seen": 44091950272,
      "step": 56042
    },
    {
      "epoch": 5.945576066199873,
      "grad_norm": 1.104878352033227,
      "learning_rate": 2.539194635655621e-05,
      "loss": 1.0625,
      "num_input_tokens_seen": 44092737120,
      "step": 56043
    },
    {
      "epoch": 5.945682155739444,
      "grad_norm": 0.8518714139554965,
      "learning_rate": 2.5391251472999604e-05,
      "loss": 1.1409,
      "num_input_tokens_seen": 44093523808,
      "step": 56044
    },
    {
      "epoch": 5.945788245279015,
      "grad_norm": 1.0912633230184583,
      "learning_rate": 2.5390556589140648e-05,
      "loss": 1.3062,
      "num_input_tokens_seen": 44094310528,
      "step": 56045
    },
    {
      "epoch": 5.945894334818587,
      "grad_norm": 0.7530892207864751,
      "learning_rate": 2.538986170497988e-05,
      "loss": 1.1492,
      "num_input_tokens_seen": 44095097280,
      "step": 56046
    },
    {
      "epoch": 5.946000424358158,
      "grad_norm": 0.6841958970055427,
      "learning_rate": 2.5389166820517836e-05,
      "loss": 1.0707,
      "num_input_tokens_seen": 44095884032,
      "step": 56047
    },
    {
      "epoch": 5.94610651389773,
      "grad_norm": 0.882780519197705,
      "learning_rate": 2.5388471935755054e-05,
      "loss": 1.1607,
      "num_input_tokens_seen": 44096670704,
      "step": 56048
    },
    {
      "epoch": 5.946212603437301,
      "grad_norm": 0.6813418547138337,
      "learning_rate": 2.538777705069208e-05,
      "loss": 1.177,
      "num_input_tokens_seen": 44097457552,
      "step": 56049
    },
    {
      "epoch": 5.946318692976872,
      "grad_norm": 0.6805642045204097,
      "learning_rate": 2.5387082165329434e-05,
      "loss": 1.1037,
      "num_input_tokens_seen": 44098244256,
      "step": 56050
    },
    {
      "epoch": 5.946424782516444,
      "grad_norm": 0.5641807482917056,
      "learning_rate": 2.5386387279667666e-05,
      "loss": 1.1491,
      "num_input_tokens_seen": 44099030960,
      "step": 56051
    },
    {
      "epoch": 5.946530872056015,
      "grad_norm": 0.6735562656927131,
      "learning_rate": 2.5385692393707312e-05,
      "loss": 1.1169,
      "num_input_tokens_seen": 44099817792,
      "step": 56052
    },
    {
      "epoch": 5.946636961595587,
      "grad_norm": 0.5564659837119136,
      "learning_rate": 2.5384997507448904e-05,
      "loss": 1.1,
      "num_input_tokens_seen": 44100604512,
      "step": 56053
    },
    {
      "epoch": 5.946743051135158,
      "grad_norm": 0.6280363050425875,
      "learning_rate": 2.538430262089298e-05,
      "loss": 1.0949,
      "num_input_tokens_seen": 44101391328,
      "step": 56054
    },
    {
      "epoch": 5.946849140674729,
      "grad_norm": 1.1153848600317338,
      "learning_rate": 2.538360773404008e-05,
      "loss": 1.1791,
      "num_input_tokens_seen": 44102178064,
      "step": 56055
    },
    {
      "epoch": 5.946955230214301,
      "grad_norm": 0.5895884596607118,
      "learning_rate": 2.5382912846890737e-05,
      "loss": 1.1092,
      "num_input_tokens_seen": 44102964784,
      "step": 56056
    },
    {
      "epoch": 5.947061319753872,
      "grad_norm": 0.7303912993514812,
      "learning_rate": 2.5382217959445494e-05,
      "loss": 1.2846,
      "num_input_tokens_seen": 44103751584,
      "step": 56057
    },
    {
      "epoch": 5.947167409293444,
      "grad_norm": 0.7199418166766139,
      "learning_rate": 2.5381523071704883e-05,
      "loss": 1.107,
      "num_input_tokens_seen": 44104538336,
      "step": 56058
    },
    {
      "epoch": 5.947273498833015,
      "grad_norm": 0.6648519717587427,
      "learning_rate": 2.538082818366944e-05,
      "loss": 1.1101,
      "num_input_tokens_seen": 44105325088,
      "step": 56059
    },
    {
      "epoch": 5.947379588372587,
      "grad_norm": 1.1146169770916126,
      "learning_rate": 2.538013329533971e-05,
      "loss": 1.0653,
      "num_input_tokens_seen": 44106111904,
      "step": 56060
    },
    {
      "epoch": 5.947485677912158,
      "grad_norm": 0.9037490405684337,
      "learning_rate": 2.5379438406716216e-05,
      "loss": 1.1622,
      "num_input_tokens_seen": 44106898624,
      "step": 56061
    },
    {
      "epoch": 5.947591767451729,
      "grad_norm": 0.6643464026084261,
      "learning_rate": 2.5378743517799503e-05,
      "loss": 1.2074,
      "num_input_tokens_seen": 44107685360,
      "step": 56062
    },
    {
      "epoch": 5.947697856991301,
      "grad_norm": 0.9934287639675955,
      "learning_rate": 2.537804862859011e-05,
      "loss": 1.1798,
      "num_input_tokens_seen": 44108472144,
      "step": 56063
    },
    {
      "epoch": 5.947803946530872,
      "grad_norm": 0.8510441675133725,
      "learning_rate": 2.5377353739088576e-05,
      "loss": 1.1542,
      "num_input_tokens_seen": 44109258992,
      "step": 56064
    },
    {
      "epoch": 5.947910036070444,
      "grad_norm": 0.6802701274119243,
      "learning_rate": 2.5376658849295432e-05,
      "loss": 1.1506,
      "num_input_tokens_seen": 44110045792,
      "step": 56065
    },
    {
      "epoch": 5.948016125610015,
      "grad_norm": 0.7643879056586717,
      "learning_rate": 2.5375963959211217e-05,
      "loss": 1.1322,
      "num_input_tokens_seen": 44110832544,
      "step": 56066
    },
    {
      "epoch": 5.948122215149587,
      "grad_norm": 1.1272161023517482,
      "learning_rate": 2.5375269068836473e-05,
      "loss": 1.129,
      "num_input_tokens_seen": 44111619312,
      "step": 56067
    },
    {
      "epoch": 5.948228304689158,
      "grad_norm": 0.8238102792593031,
      "learning_rate": 2.5374574178171722e-05,
      "loss": 1.2559,
      "num_input_tokens_seen": 44112406032,
      "step": 56068
    },
    {
      "epoch": 5.948334394228729,
      "grad_norm": 0.87997390729844,
      "learning_rate": 2.5373879287217516e-05,
      "loss": 1.1431,
      "num_input_tokens_seen": 44113192752,
      "step": 56069
    },
    {
      "epoch": 5.948440483768301,
      "grad_norm": 1.4437609864593135,
      "learning_rate": 2.5373184395974394e-05,
      "loss": 1.2162,
      "num_input_tokens_seen": 44113979520,
      "step": 56070
    },
    {
      "epoch": 5.948546573307872,
      "grad_norm": 0.6886663395638469,
      "learning_rate": 2.537248950444287e-05,
      "loss": 1.1194,
      "num_input_tokens_seen": 44114766352,
      "step": 56071
    },
    {
      "epoch": 5.948652662847444,
      "grad_norm": 0.7349180343680775,
      "learning_rate": 2.537179461262351e-05,
      "loss": 1.1119,
      "num_input_tokens_seen": 44115553248,
      "step": 56072
    },
    {
      "epoch": 5.948758752387015,
      "grad_norm": 0.633680515814243,
      "learning_rate": 2.537109972051684e-05,
      "loss": 1.1346,
      "num_input_tokens_seen": 44116340016,
      "step": 56073
    },
    {
      "epoch": 5.948864841926586,
      "grad_norm": 1.142132164221412,
      "learning_rate": 2.5370404828123385e-05,
      "loss": 1.1608,
      "num_input_tokens_seen": 44117126736,
      "step": 56074
    },
    {
      "epoch": 5.948970931466158,
      "grad_norm": 0.6439826467396249,
      "learning_rate": 2.53697099354437e-05,
      "loss": 1.0301,
      "num_input_tokens_seen": 44117913488,
      "step": 56075
    },
    {
      "epoch": 5.949077021005729,
      "grad_norm": 0.8652052267343998,
      "learning_rate": 2.5369015042478304e-05,
      "loss": 1.0643,
      "num_input_tokens_seen": 44118700192,
      "step": 56076
    },
    {
      "epoch": 5.949183110545301,
      "grad_norm": 0.9634014065310428,
      "learning_rate": 2.5368320149227754e-05,
      "loss": 1.1784,
      "num_input_tokens_seen": 44119486848,
      "step": 56077
    },
    {
      "epoch": 5.949289200084872,
      "grad_norm": 0.6598801892047095,
      "learning_rate": 2.5367625255692575e-05,
      "loss": 1.1133,
      "num_input_tokens_seen": 44120273600,
      "step": 56078
    },
    {
      "epoch": 5.949395289624443,
      "grad_norm": 0.7300563888877311,
      "learning_rate": 2.5366930361873303e-05,
      "loss": 1.1704,
      "num_input_tokens_seen": 44121060400,
      "step": 56079
    },
    {
      "epoch": 5.949501379164015,
      "grad_norm": 0.7269326004151703,
      "learning_rate": 2.5366235467770476e-05,
      "loss": 1.0043,
      "num_input_tokens_seen": 44121847232,
      "step": 56080
    },
    {
      "epoch": 5.949607468703586,
      "grad_norm": 0.9133682105694264,
      "learning_rate": 2.5365540573384645e-05,
      "loss": 1.1411,
      "num_input_tokens_seen": 44122633936,
      "step": 56081
    },
    {
      "epoch": 5.9497135582431575,
      "grad_norm": 0.6010219382499529,
      "learning_rate": 2.536484567871632e-05,
      "loss": 1.1793,
      "num_input_tokens_seen": 44123420656,
      "step": 56082
    },
    {
      "epoch": 5.9498196477827285,
      "grad_norm": 0.8144678624269073,
      "learning_rate": 2.536415078376606e-05,
      "loss": 1.1576,
      "num_input_tokens_seen": 44124207440,
      "step": 56083
    },
    {
      "epoch": 5.9499257373223,
      "grad_norm": 0.7615003678914817,
      "learning_rate": 2.53634558885344e-05,
      "loss": 1.1352,
      "num_input_tokens_seen": 44124994224,
      "step": 56084
    },
    {
      "epoch": 5.9500318268618715,
      "grad_norm": 0.806391440817256,
      "learning_rate": 2.5362760993021862e-05,
      "loss": 1.1098,
      "num_input_tokens_seen": 44125781024,
      "step": 56085
    },
    {
      "epoch": 5.9501379164014425,
      "grad_norm": 0.7149272046012674,
      "learning_rate": 2.5362066097228997e-05,
      "loss": 1.2195,
      "num_input_tokens_seen": 44126567728,
      "step": 56086
    },
    {
      "epoch": 5.950244005941014,
      "grad_norm": 1.3334891999364822,
      "learning_rate": 2.5361371201156344e-05,
      "loss": 1.2309,
      "num_input_tokens_seen": 44127354432,
      "step": 56087
    },
    {
      "epoch": 5.9503500954805855,
      "grad_norm": 0.8257668623431734,
      "learning_rate": 2.536067630480442e-05,
      "loss": 1.1678,
      "num_input_tokens_seen": 44128141264,
      "step": 56088
    },
    {
      "epoch": 5.950456185020157,
      "grad_norm": 0.7534701776427072,
      "learning_rate": 2.535998140817379e-05,
      "loss": 1.2506,
      "num_input_tokens_seen": 44128928080,
      "step": 56089
    },
    {
      "epoch": 5.950562274559728,
      "grad_norm": 0.7852967618950685,
      "learning_rate": 2.535928651126497e-05,
      "loss": 1.1394,
      "num_input_tokens_seen": 44129714928,
      "step": 56090
    },
    {
      "epoch": 5.9506683640992994,
      "grad_norm": 0.8956155635814227,
      "learning_rate": 2.5358591614078504e-05,
      "loss": 1.1521,
      "num_input_tokens_seen": 44130501712,
      "step": 56091
    },
    {
      "epoch": 5.950774453638871,
      "grad_norm": 0.5920086119195926,
      "learning_rate": 2.535789671661493e-05,
      "loss": 1.1583,
      "num_input_tokens_seen": 44131288432,
      "step": 56092
    },
    {
      "epoch": 5.950880543178442,
      "grad_norm": 0.7375189137856095,
      "learning_rate": 2.535720181887478e-05,
      "loss": 1.0624,
      "num_input_tokens_seen": 44132075184,
      "step": 56093
    },
    {
      "epoch": 5.950986632718014,
      "grad_norm": 0.7222735025564709,
      "learning_rate": 2.5356506920858604e-05,
      "loss": 1.1428,
      "num_input_tokens_seen": 44132861936,
      "step": 56094
    },
    {
      "epoch": 5.951092722257585,
      "grad_norm": 0.6641482832905713,
      "learning_rate": 2.5355812022566928e-05,
      "loss": 1.1278,
      "num_input_tokens_seen": 44133648640,
      "step": 56095
    },
    {
      "epoch": 5.951198811797157,
      "grad_norm": 0.65614339360557,
      "learning_rate": 2.5355117124000284e-05,
      "loss": 1.1913,
      "num_input_tokens_seen": 44134435456,
      "step": 56096
    },
    {
      "epoch": 5.951304901336728,
      "grad_norm": 0.6454160704999897,
      "learning_rate": 2.535442222515922e-05,
      "loss": 1.0512,
      "num_input_tokens_seen": 44135222240,
      "step": 56097
    },
    {
      "epoch": 5.951410990876299,
      "grad_norm": 0.6261363656874768,
      "learning_rate": 2.5353727326044267e-05,
      "loss": 1.1581,
      "num_input_tokens_seen": 44136008976,
      "step": 56098
    },
    {
      "epoch": 5.951517080415871,
      "grad_norm": 0.6277119731647063,
      "learning_rate": 2.5353032426655964e-05,
      "loss": 1.1584,
      "num_input_tokens_seen": 44136795744,
      "step": 56099
    },
    {
      "epoch": 5.951623169955442,
      "grad_norm": 0.6631671470273213,
      "learning_rate": 2.5352337526994852e-05,
      "loss": 1.1453,
      "num_input_tokens_seen": 44137582480,
      "step": 56100
    },
    {
      "epoch": 5.951729259495014,
      "grad_norm": 0.6938762162968206,
      "learning_rate": 2.535164262706146e-05,
      "loss": 1.1246,
      "num_input_tokens_seen": 44138369280,
      "step": 56101
    },
    {
      "epoch": 5.951835349034585,
      "grad_norm": 0.6217155890454279,
      "learning_rate": 2.5350947726856326e-05,
      "loss": 1.1614,
      "num_input_tokens_seen": 44139156016,
      "step": 56102
    },
    {
      "epoch": 5.951941438574156,
      "grad_norm": 0.7571219420659253,
      "learning_rate": 2.535025282638e-05,
      "loss": 1.2562,
      "num_input_tokens_seen": 44139942816,
      "step": 56103
    },
    {
      "epoch": 5.952047528113728,
      "grad_norm": 0.6141725667805451,
      "learning_rate": 2.5349557925633005e-05,
      "loss": 1.0739,
      "num_input_tokens_seen": 44140729568,
      "step": 56104
    },
    {
      "epoch": 5.952153617653299,
      "grad_norm": 0.7400203566168557,
      "learning_rate": 2.5348863024615878e-05,
      "loss": 1.1531,
      "num_input_tokens_seen": 44141516224,
      "step": 56105
    },
    {
      "epoch": 5.952259707192871,
      "grad_norm": 0.7530779845722884,
      "learning_rate": 2.5348168123329157e-05,
      "loss": 1.2191,
      "num_input_tokens_seen": 44142302944,
      "step": 56106
    },
    {
      "epoch": 5.952365796732442,
      "grad_norm": 0.6464727947858416,
      "learning_rate": 2.534747322177339e-05,
      "loss": 1.1187,
      "num_input_tokens_seen": 44143089712,
      "step": 56107
    },
    {
      "epoch": 5.952471886272013,
      "grad_norm": 0.711775709545136,
      "learning_rate": 2.5346778319949094e-05,
      "loss": 1.0824,
      "num_input_tokens_seen": 44143876448,
      "step": 56108
    },
    {
      "epoch": 5.952577975811585,
      "grad_norm": 0.6079825118590805,
      "learning_rate": 2.534608341785683e-05,
      "loss": 1.1816,
      "num_input_tokens_seen": 44144663184,
      "step": 56109
    },
    {
      "epoch": 5.952684065351156,
      "grad_norm": 0.8467447182521718,
      "learning_rate": 2.534538851549712e-05,
      "loss": 1.1431,
      "num_input_tokens_seen": 44145449920,
      "step": 56110
    },
    {
      "epoch": 5.952790154890728,
      "grad_norm": 0.6859275367784171,
      "learning_rate": 2.53446936128705e-05,
      "loss": 1.1246,
      "num_input_tokens_seen": 44146236800,
      "step": 56111
    },
    {
      "epoch": 5.952896244430299,
      "grad_norm": 0.7409040443566539,
      "learning_rate": 2.534399870997752e-05,
      "loss": 1.0124,
      "num_input_tokens_seen": 44147023616,
      "step": 56112
    },
    {
      "epoch": 5.95300233396987,
      "grad_norm": 0.704596854643339,
      "learning_rate": 2.5343303806818696e-05,
      "loss": 1.1235,
      "num_input_tokens_seen": 44147810352,
      "step": 56113
    },
    {
      "epoch": 5.953108423509442,
      "grad_norm": 0.6873848478981447,
      "learning_rate": 2.5342608903394583e-05,
      "loss": 1.0589,
      "num_input_tokens_seen": 44148597184,
      "step": 56114
    },
    {
      "epoch": 5.953214513049013,
      "grad_norm": 0.6263897922738841,
      "learning_rate": 2.5341913999705714e-05,
      "loss": 1.1064,
      "num_input_tokens_seen": 44149383952,
      "step": 56115
    },
    {
      "epoch": 5.953320602588585,
      "grad_norm": 0.6035159472127581,
      "learning_rate": 2.5341219095752622e-05,
      "loss": 1.0773,
      "num_input_tokens_seen": 44150170688,
      "step": 56116
    },
    {
      "epoch": 5.953426692128156,
      "grad_norm": 0.6360431526067116,
      "learning_rate": 2.534052419153584e-05,
      "loss": 1.2293,
      "num_input_tokens_seen": 44150957344,
      "step": 56117
    },
    {
      "epoch": 5.953532781667728,
      "grad_norm": 0.7424312212972161,
      "learning_rate": 2.5339829287055922e-05,
      "loss": 1.2543,
      "num_input_tokens_seen": 44151744112,
      "step": 56118
    },
    {
      "epoch": 5.953638871207299,
      "grad_norm": 0.665052962549843,
      "learning_rate": 2.5339134382313385e-05,
      "loss": 1.1736,
      "num_input_tokens_seen": 44152530880,
      "step": 56119
    },
    {
      "epoch": 5.95374496074687,
      "grad_norm": 0.6517203759278131,
      "learning_rate": 2.533843947730878e-05,
      "loss": 1.0764,
      "num_input_tokens_seen": 44153317616,
      "step": 56120
    },
    {
      "epoch": 5.953851050286442,
      "grad_norm": 0.8010465497486808,
      "learning_rate": 2.5337744572042637e-05,
      "loss": 1.1068,
      "num_input_tokens_seen": 44154104464,
      "step": 56121
    },
    {
      "epoch": 5.953957139826013,
      "grad_norm": 0.6749943596846222,
      "learning_rate": 2.533704966651549e-05,
      "loss": 1.09,
      "num_input_tokens_seen": 44154891232,
      "step": 56122
    },
    {
      "epoch": 5.954063229365585,
      "grad_norm": 0.7466134009275225,
      "learning_rate": 2.5336354760727887e-05,
      "loss": 1.1723,
      "num_input_tokens_seen": 44155677968,
      "step": 56123
    },
    {
      "epoch": 5.954169318905156,
      "grad_norm": 0.643940768933406,
      "learning_rate": 2.533565985468036e-05,
      "loss": 1.1324,
      "num_input_tokens_seen": 44156464720,
      "step": 56124
    },
    {
      "epoch": 5.954275408444728,
      "grad_norm": 0.7006950849314743,
      "learning_rate": 2.533496494837344e-05,
      "loss": 1.1696,
      "num_input_tokens_seen": 44157251472,
      "step": 56125
    },
    {
      "epoch": 5.954381497984299,
      "grad_norm": 0.6570114848390965,
      "learning_rate": 2.5334270041807673e-05,
      "loss": 1.0356,
      "num_input_tokens_seen": 44158038240,
      "step": 56126
    },
    {
      "epoch": 5.95448758752387,
      "grad_norm": 0.5904650016837919,
      "learning_rate": 2.5333575134983596e-05,
      "loss": 1.085,
      "num_input_tokens_seen": 44158825056,
      "step": 56127
    },
    {
      "epoch": 5.954593677063442,
      "grad_norm": 0.6782418784402119,
      "learning_rate": 2.5332880227901727e-05,
      "loss": 1.1893,
      "num_input_tokens_seen": 44159611792,
      "step": 56128
    },
    {
      "epoch": 5.954699766603013,
      "grad_norm": 0.8297394690747207,
      "learning_rate": 2.5332185320562634e-05,
      "loss": 1.2567,
      "num_input_tokens_seen": 44160398496,
      "step": 56129
    },
    {
      "epoch": 5.954805856142585,
      "grad_norm": 0.6983034224479955,
      "learning_rate": 2.533149041296683e-05,
      "loss": 1.2065,
      "num_input_tokens_seen": 44161185248,
      "step": 56130
    },
    {
      "epoch": 5.954911945682156,
      "grad_norm": 0.6180126698817291,
      "learning_rate": 2.533079550511486e-05,
      "loss": 1.0799,
      "num_input_tokens_seen": 44161972032,
      "step": 56131
    },
    {
      "epoch": 5.955018035221727,
      "grad_norm": 0.7880433324427614,
      "learning_rate": 2.5330100597007263e-05,
      "loss": 1.1793,
      "num_input_tokens_seen": 44162758784,
      "step": 56132
    },
    {
      "epoch": 5.955124124761299,
      "grad_norm": 0.6071200298338172,
      "learning_rate": 2.532940568864457e-05,
      "loss": 1.0927,
      "num_input_tokens_seen": 44163545472,
      "step": 56133
    },
    {
      "epoch": 5.95523021430087,
      "grad_norm": 0.676900689055077,
      "learning_rate": 2.5328710780027326e-05,
      "loss": 1.1768,
      "num_input_tokens_seen": 44164332256,
      "step": 56134
    },
    {
      "epoch": 5.955336303840442,
      "grad_norm": 0.5961113506491403,
      "learning_rate": 2.532801587115607e-05,
      "loss": 1.1117,
      "num_input_tokens_seen": 44165119136,
      "step": 56135
    },
    {
      "epoch": 5.955442393380013,
      "grad_norm": 0.6620515749657311,
      "learning_rate": 2.532732096203132e-05,
      "loss": 1.1411,
      "num_input_tokens_seen": 44165906048,
      "step": 56136
    },
    {
      "epoch": 5.955548482919584,
      "grad_norm": 0.7057850178823292,
      "learning_rate": 2.5326626052653635e-05,
      "loss": 1.1348,
      "num_input_tokens_seen": 44166692752,
      "step": 56137
    },
    {
      "epoch": 5.955654572459156,
      "grad_norm": 0.7670441212757226,
      "learning_rate": 2.532593114302354e-05,
      "loss": 1.2092,
      "num_input_tokens_seen": 44167479520,
      "step": 56138
    },
    {
      "epoch": 5.955760661998727,
      "grad_norm": 0.730548170717441,
      "learning_rate": 2.5325236233141568e-05,
      "loss": 1.1826,
      "num_input_tokens_seen": 44168266272,
      "step": 56139
    },
    {
      "epoch": 5.955866751538299,
      "grad_norm": 0.6076843582569702,
      "learning_rate": 2.5324541323008273e-05,
      "loss": 1.1844,
      "num_input_tokens_seen": 44169052976,
      "step": 56140
    },
    {
      "epoch": 5.95597284107787,
      "grad_norm": 0.6635640209133663,
      "learning_rate": 2.532384641262418e-05,
      "loss": 1.2085,
      "num_input_tokens_seen": 44169839712,
      "step": 56141
    },
    {
      "epoch": 5.956078930617441,
      "grad_norm": 0.5890237288535148,
      "learning_rate": 2.532315150198983e-05,
      "loss": 1.1108,
      "num_input_tokens_seen": 44170626544,
      "step": 56142
    },
    {
      "epoch": 5.956185020157013,
      "grad_norm": 0.5422725175701331,
      "learning_rate": 2.5322456591105754e-05,
      "loss": 1.0297,
      "num_input_tokens_seen": 44171413344,
      "step": 56143
    },
    {
      "epoch": 5.956291109696584,
      "grad_norm": 0.795161631622174,
      "learning_rate": 2.5321761679972495e-05,
      "loss": 1.2031,
      "num_input_tokens_seen": 44172200064,
      "step": 56144
    },
    {
      "epoch": 5.9563971992361555,
      "grad_norm": 0.6172308980175825,
      "learning_rate": 2.5321066768590586e-05,
      "loss": 1.1224,
      "num_input_tokens_seen": 44172986832,
      "step": 56145
    },
    {
      "epoch": 5.9565032887757265,
      "grad_norm": 1.1429041343470896,
      "learning_rate": 2.5320371856960566e-05,
      "loss": 1.1045,
      "num_input_tokens_seen": 44173773520,
      "step": 56146
    },
    {
      "epoch": 5.9566093783152985,
      "grad_norm": 0.6500189326673464,
      "learning_rate": 2.5319676945082976e-05,
      "loss": 1.1567,
      "num_input_tokens_seen": 44174560400,
      "step": 56147
    },
    {
      "epoch": 5.9567154678548695,
      "grad_norm": 0.6156506406211348,
      "learning_rate": 2.5318982032958337e-05,
      "loss": 1.1347,
      "num_input_tokens_seen": 44175347152,
      "step": 56148
    },
    {
      "epoch": 5.9568215573944405,
      "grad_norm": 0.6410676443829473,
      "learning_rate": 2.5318287120587214e-05,
      "loss": 1.0482,
      "num_input_tokens_seen": 44176133872,
      "step": 56149
    },
    {
      "epoch": 5.956927646934012,
      "grad_norm": 0.7210031581762721,
      "learning_rate": 2.5317592207970113e-05,
      "loss": 1.1316,
      "num_input_tokens_seen": 44176920608,
      "step": 56150
    },
    {
      "epoch": 5.9570337364735835,
      "grad_norm": 0.7141396462467483,
      "learning_rate": 2.53168972951076e-05,
      "loss": 1.0916,
      "num_input_tokens_seen": 44177707488,
      "step": 56151
    },
    {
      "epoch": 5.957139826013155,
      "grad_norm": 0.8473371588208484,
      "learning_rate": 2.5316202382000193e-05,
      "loss": 1.2198,
      "num_input_tokens_seen": 44178494256,
      "step": 56152
    },
    {
      "epoch": 5.957245915552726,
      "grad_norm": 1.0042982097948034,
      "learning_rate": 2.531550746864843e-05,
      "loss": 1.1232,
      "num_input_tokens_seen": 44179280992,
      "step": 56153
    },
    {
      "epoch": 5.957352005092298,
      "grad_norm": 0.777538780181254,
      "learning_rate": 2.5314812555052857e-05,
      "loss": 1.2323,
      "num_input_tokens_seen": 44180067712,
      "step": 56154
    },
    {
      "epoch": 5.957458094631869,
      "grad_norm": 0.7594035872241228,
      "learning_rate": 2.531411764121401e-05,
      "loss": 1.1372,
      "num_input_tokens_seen": 44180854480,
      "step": 56155
    },
    {
      "epoch": 5.95756418417144,
      "grad_norm": 1.1820549431391374,
      "learning_rate": 2.531342272713241e-05,
      "loss": 1.2192,
      "num_input_tokens_seen": 44181641216,
      "step": 56156
    },
    {
      "epoch": 5.957670273711012,
      "grad_norm": 0.6787529992723843,
      "learning_rate": 2.5312727812808608e-05,
      "loss": 1.2216,
      "num_input_tokens_seen": 44182427968,
      "step": 56157
    },
    {
      "epoch": 5.957776363250583,
      "grad_norm": 0.6675809477498659,
      "learning_rate": 2.5312032898243148e-05,
      "loss": 1.1413,
      "num_input_tokens_seen": 44183214784,
      "step": 56158
    },
    {
      "epoch": 5.957882452790155,
      "grad_norm": 0.7217177913039085,
      "learning_rate": 2.5311337983436555e-05,
      "loss": 1.0881,
      "num_input_tokens_seen": 44184001568,
      "step": 56159
    },
    {
      "epoch": 5.957988542329726,
      "grad_norm": 0.70852517161807,
      "learning_rate": 2.531064306838936e-05,
      "loss": 1.1839,
      "num_input_tokens_seen": 44184788432,
      "step": 56160
    },
    {
      "epoch": 5.958094631869297,
      "grad_norm": 0.7280296911687189,
      "learning_rate": 2.530994815310212e-05,
      "loss": 1.1494,
      "num_input_tokens_seen": 44185575232,
      "step": 56161
    },
    {
      "epoch": 5.958200721408869,
      "grad_norm": 0.6636910353644095,
      "learning_rate": 2.530925323757536e-05,
      "loss": 1.1895,
      "num_input_tokens_seen": 44186361968,
      "step": 56162
    },
    {
      "epoch": 5.95830681094844,
      "grad_norm": 0.9049800073779259,
      "learning_rate": 2.5308558321809618e-05,
      "loss": 1.1479,
      "num_input_tokens_seen": 44187148688,
      "step": 56163
    },
    {
      "epoch": 5.958412900488012,
      "grad_norm": 0.8055844144517047,
      "learning_rate": 2.5307863405805432e-05,
      "loss": 1.1695,
      "num_input_tokens_seen": 44187935456,
      "step": 56164
    },
    {
      "epoch": 5.958518990027583,
      "grad_norm": 0.7414431782320192,
      "learning_rate": 2.5307168489563332e-05,
      "loss": 1.2285,
      "num_input_tokens_seen": 44188722224,
      "step": 56165
    },
    {
      "epoch": 5.958625079567154,
      "grad_norm": 1.2762692356700556,
      "learning_rate": 2.5306473573083866e-05,
      "loss": 1.1748,
      "num_input_tokens_seen": 44189508912,
      "step": 56166
    },
    {
      "epoch": 5.958731169106726,
      "grad_norm": 0.8159536896421374,
      "learning_rate": 2.530577865636757e-05,
      "loss": 1.108,
      "num_input_tokens_seen": 44190295680,
      "step": 56167
    },
    {
      "epoch": 5.958837258646297,
      "grad_norm": 0.9292630056344012,
      "learning_rate": 2.5305083739414965e-05,
      "loss": 1.214,
      "num_input_tokens_seen": 44191082384,
      "step": 56168
    },
    {
      "epoch": 5.958943348185869,
      "grad_norm": 0.8307004341306934,
      "learning_rate": 2.530438882222661e-05,
      "loss": 1.124,
      "num_input_tokens_seen": 44191869152,
      "step": 56169
    },
    {
      "epoch": 5.95904943772544,
      "grad_norm": 0.8571799397490362,
      "learning_rate": 2.5303693904803034e-05,
      "loss": 1.2527,
      "num_input_tokens_seen": 44192655952,
      "step": 56170
    },
    {
      "epoch": 5.959155527265011,
      "grad_norm": 0.6482469122136703,
      "learning_rate": 2.530299898714476e-05,
      "loss": 1.1736,
      "num_input_tokens_seen": 44193442768,
      "step": 56171
    },
    {
      "epoch": 5.959261616804583,
      "grad_norm": 1.002313893957329,
      "learning_rate": 2.5302304069252347e-05,
      "loss": 1.1314,
      "num_input_tokens_seen": 44194229600,
      "step": 56172
    },
    {
      "epoch": 5.959367706344154,
      "grad_norm": 0.9732557546763008,
      "learning_rate": 2.5301609151126327e-05,
      "loss": 1.1633,
      "num_input_tokens_seen": 44195016320,
      "step": 56173
    },
    {
      "epoch": 5.959473795883726,
      "grad_norm": 0.7853297792893639,
      "learning_rate": 2.530091423276722e-05,
      "loss": 1.1198,
      "num_input_tokens_seen": 44195803072,
      "step": 56174
    },
    {
      "epoch": 5.959579885423297,
      "grad_norm": 1.2617321495540534,
      "learning_rate": 2.5300219314175583e-05,
      "loss": 1.1406,
      "num_input_tokens_seen": 44196589792,
      "step": 56175
    },
    {
      "epoch": 5.959685974962869,
      "grad_norm": 0.9983061486432554,
      "learning_rate": 2.5299524395351947e-05,
      "loss": 1.142,
      "num_input_tokens_seen": 44197376528,
      "step": 56176
    },
    {
      "epoch": 5.95979206450244,
      "grad_norm": 0.7804309778680403,
      "learning_rate": 2.5298829476296843e-05,
      "loss": 1.2159,
      "num_input_tokens_seen": 44198163360,
      "step": 56177
    },
    {
      "epoch": 5.959898154042012,
      "grad_norm": 0.8503486222907563,
      "learning_rate": 2.529813455701081e-05,
      "loss": 1.1589,
      "num_input_tokens_seen": 44198950160,
      "step": 56178
    },
    {
      "epoch": 5.960004243581583,
      "grad_norm": 0.715382871808995,
      "learning_rate": 2.529743963749439e-05,
      "loss": 1.1224,
      "num_input_tokens_seen": 44199736912,
      "step": 56179
    },
    {
      "epoch": 5.960110333121154,
      "grad_norm": 0.9696152146853306,
      "learning_rate": 2.529674471774812e-05,
      "loss": 1.1891,
      "num_input_tokens_seen": 44200523600,
      "step": 56180
    },
    {
      "epoch": 5.960216422660726,
      "grad_norm": 0.9189094781935614,
      "learning_rate": 2.5296049797772537e-05,
      "loss": 1.2077,
      "num_input_tokens_seen": 44201310336,
      "step": 56181
    },
    {
      "epoch": 5.960322512200297,
      "grad_norm": 0.8704553150201637,
      "learning_rate": 2.5295354877568166e-05,
      "loss": 1.1139,
      "num_input_tokens_seen": 44202097088,
      "step": 56182
    },
    {
      "epoch": 5.960428601739869,
      "grad_norm": 0.8437347708774755,
      "learning_rate": 2.5294659957135556e-05,
      "loss": 1.158,
      "num_input_tokens_seen": 44202884032,
      "step": 56183
    },
    {
      "epoch": 5.96053469127944,
      "grad_norm": 0.605164934649054,
      "learning_rate": 2.5293965036475248e-05,
      "loss": 1.0801,
      "num_input_tokens_seen": 44203670848,
      "step": 56184
    },
    {
      "epoch": 5.960640780819011,
      "grad_norm": 0.8398003722120935,
      "learning_rate": 2.5293270115587764e-05,
      "loss": 1.1135,
      "num_input_tokens_seen": 44204457616,
      "step": 56185
    },
    {
      "epoch": 5.960746870358583,
      "grad_norm": 0.6739276399898305,
      "learning_rate": 2.5292575194473656e-05,
      "loss": 1.0698,
      "num_input_tokens_seen": 44205244416,
      "step": 56186
    },
    {
      "epoch": 5.960852959898154,
      "grad_norm": 0.6976921610820266,
      "learning_rate": 2.5291880273133454e-05,
      "loss": 1.1631,
      "num_input_tokens_seen": 44206031152,
      "step": 56187
    },
    {
      "epoch": 5.960959049437726,
      "grad_norm": 0.6510360493612616,
      "learning_rate": 2.529118535156769e-05,
      "loss": 1.1451,
      "num_input_tokens_seen": 44206817888,
      "step": 56188
    },
    {
      "epoch": 5.961065138977297,
      "grad_norm": 0.700175372848337,
      "learning_rate": 2.5290490429776915e-05,
      "loss": 1.1855,
      "num_input_tokens_seen": 44207604592,
      "step": 56189
    },
    {
      "epoch": 5.961171228516868,
      "grad_norm": 0.7410816610253318,
      "learning_rate": 2.5289795507761655e-05,
      "loss": 1.2184,
      "num_input_tokens_seen": 44208391360,
      "step": 56190
    },
    {
      "epoch": 5.96127731805644,
      "grad_norm": 0.7788958785090071,
      "learning_rate": 2.528910058552244e-05,
      "loss": 1.1095,
      "num_input_tokens_seen": 44209178176,
      "step": 56191
    },
    {
      "epoch": 5.961383407596011,
      "grad_norm": 0.7610778992546198,
      "learning_rate": 2.5288405663059828e-05,
      "loss": 1.0713,
      "num_input_tokens_seen": 44209965024,
      "step": 56192
    },
    {
      "epoch": 5.961489497135583,
      "grad_norm": 0.7511081223187696,
      "learning_rate": 2.5287710740374337e-05,
      "loss": 1.171,
      "num_input_tokens_seen": 44210751808,
      "step": 56193
    },
    {
      "epoch": 5.961595586675154,
      "grad_norm": 0.7806985110682467,
      "learning_rate": 2.5287015817466518e-05,
      "loss": 1.2121,
      "num_input_tokens_seen": 44211538608,
      "step": 56194
    },
    {
      "epoch": 5.961701676214725,
      "grad_norm": 0.6199801489759836,
      "learning_rate": 2.52863208943369e-05,
      "loss": 1.2325,
      "num_input_tokens_seen": 44212325376,
      "step": 56195
    },
    {
      "epoch": 5.961807765754297,
      "grad_norm": 0.7209178627622665,
      "learning_rate": 2.5285625970986016e-05,
      "loss": 1.1555,
      "num_input_tokens_seen": 44213112160,
      "step": 56196
    },
    {
      "epoch": 5.961913855293868,
      "grad_norm": 0.7222979528223975,
      "learning_rate": 2.5284931047414418e-05,
      "loss": 1.1634,
      "num_input_tokens_seen": 44213899008,
      "step": 56197
    },
    {
      "epoch": 5.96201994483344,
      "grad_norm": 0.6226086943786509,
      "learning_rate": 2.528423612362263e-05,
      "loss": 1.08,
      "num_input_tokens_seen": 44214685776,
      "step": 56198
    },
    {
      "epoch": 5.962126034373011,
      "grad_norm": 0.7891214674917781,
      "learning_rate": 2.528354119961119e-05,
      "loss": 1.1839,
      "num_input_tokens_seen": 44215472592,
      "step": 56199
    },
    {
      "epoch": 5.962232123912582,
      "grad_norm": 0.6050814107784258,
      "learning_rate": 2.5282846275380634e-05,
      "loss": 1.0527,
      "num_input_tokens_seen": 44216259376,
      "step": 56200
    },
    {
      "epoch": 5.962338213452154,
      "grad_norm": 0.6952505674169647,
      "learning_rate": 2.528215135093151e-05,
      "loss": 1.1433,
      "num_input_tokens_seen": 44217046080,
      "step": 56201
    },
    {
      "epoch": 5.962444302991725,
      "grad_norm": 0.674306509394204,
      "learning_rate": 2.5281456426264345e-05,
      "loss": 1.0916,
      "num_input_tokens_seen": 44217832880,
      "step": 56202
    },
    {
      "epoch": 5.962550392531297,
      "grad_norm": 0.7612343568943534,
      "learning_rate": 2.5280761501379673e-05,
      "loss": 1.2302,
      "num_input_tokens_seen": 44218619552,
      "step": 56203
    },
    {
      "epoch": 5.962656482070868,
      "grad_norm": 0.7184249232730233,
      "learning_rate": 2.5280066576278045e-05,
      "loss": 1.0956,
      "num_input_tokens_seen": 44219406464,
      "step": 56204
    },
    {
      "epoch": 5.9627625716104395,
      "grad_norm": 0.7707473951209564,
      "learning_rate": 2.5279371650959983e-05,
      "loss": 1.1859,
      "num_input_tokens_seen": 44220193248,
      "step": 56205
    },
    {
      "epoch": 5.962868661150011,
      "grad_norm": 0.7645298736051017,
      "learning_rate": 2.5278676725426036e-05,
      "loss": 1.1614,
      "num_input_tokens_seen": 44220979968,
      "step": 56206
    },
    {
      "epoch": 5.9629747506895825,
      "grad_norm": 0.760837320125075,
      "learning_rate": 2.5277981799676744e-05,
      "loss": 1.0962,
      "num_input_tokens_seen": 44221766800,
      "step": 56207
    },
    {
      "epoch": 5.9630808402291535,
      "grad_norm": 0.5717815404824933,
      "learning_rate": 2.527728687371262e-05,
      "loss": 1.1862,
      "num_input_tokens_seen": 44222553488,
      "step": 56208
    },
    {
      "epoch": 5.9631869297687246,
      "grad_norm": 0.6697904417645445,
      "learning_rate": 2.5276591947534223e-05,
      "loss": 1.0717,
      "num_input_tokens_seen": 44223340240,
      "step": 56209
    },
    {
      "epoch": 5.9632930193082965,
      "grad_norm": 0.6774721292342794,
      "learning_rate": 2.5275897021142086e-05,
      "loss": 1.1492,
      "num_input_tokens_seen": 44224127056,
      "step": 56210
    },
    {
      "epoch": 5.9633991088478675,
      "grad_norm": 0.8835787047865801,
      "learning_rate": 2.5275202094536744e-05,
      "loss": 1.164,
      "num_input_tokens_seen": 44224913920,
      "step": 56211
    },
    {
      "epoch": 5.963505198387439,
      "grad_norm": 0.7724287998437174,
      "learning_rate": 2.527450716771873e-05,
      "loss": 1.1962,
      "num_input_tokens_seen": 44225700656,
      "step": 56212
    },
    {
      "epoch": 5.9636112879270105,
      "grad_norm": 0.9470484241176196,
      "learning_rate": 2.5273812240688587e-05,
      "loss": 1.1786,
      "num_input_tokens_seen": 44226487424,
      "step": 56213
    },
    {
      "epoch": 5.9637173774665815,
      "grad_norm": 0.6094989807899571,
      "learning_rate": 2.527311731344685e-05,
      "loss": 1.1473,
      "num_input_tokens_seen": 44227274224,
      "step": 56214
    },
    {
      "epoch": 5.963823467006153,
      "grad_norm": 0.7861397103529415,
      "learning_rate": 2.527242238599406e-05,
      "loss": 1.2072,
      "num_input_tokens_seen": 44228060944,
      "step": 56215
    },
    {
      "epoch": 5.963929556545724,
      "grad_norm": 0.6682061609523275,
      "learning_rate": 2.5271727458330745e-05,
      "loss": 1.1879,
      "num_input_tokens_seen": 44228847696,
      "step": 56216
    },
    {
      "epoch": 5.964035646085296,
      "grad_norm": 0.8625875392155702,
      "learning_rate": 2.5271032530457446e-05,
      "loss": 1.0915,
      "num_input_tokens_seen": 44229634528,
      "step": 56217
    },
    {
      "epoch": 5.964141735624867,
      "grad_norm": 0.642710916576752,
      "learning_rate": 2.5270337602374706e-05,
      "loss": 1.0173,
      "num_input_tokens_seen": 44230421328,
      "step": 56218
    },
    {
      "epoch": 5.964247825164438,
      "grad_norm": 0.8173639193597789,
      "learning_rate": 2.5269642674083054e-05,
      "loss": 1.1238,
      "num_input_tokens_seen": 44231208080,
      "step": 56219
    },
    {
      "epoch": 5.96435391470401,
      "grad_norm": 0.7123888314087624,
      "learning_rate": 2.526894774558303e-05,
      "loss": 1.1778,
      "num_input_tokens_seen": 44231994896,
      "step": 56220
    },
    {
      "epoch": 5.964460004243581,
      "grad_norm": 0.6060656358850263,
      "learning_rate": 2.526825281687517e-05,
      "loss": 1.1459,
      "num_input_tokens_seen": 44232781744,
      "step": 56221
    },
    {
      "epoch": 5.964566093783153,
      "grad_norm": 0.8150328104809365,
      "learning_rate": 2.5267557887960008e-05,
      "loss": 1.124,
      "num_input_tokens_seen": 44233568496,
      "step": 56222
    },
    {
      "epoch": 5.964672183322724,
      "grad_norm": 0.6546005333621944,
      "learning_rate": 2.5266862958838094e-05,
      "loss": 1.166,
      "num_input_tokens_seen": 44234355392,
      "step": 56223
    },
    {
      "epoch": 5.964778272862295,
      "grad_norm": 0.978261701229825,
      "learning_rate": 2.5266168029509958e-05,
      "loss": 1.2167,
      "num_input_tokens_seen": 44235142080,
      "step": 56224
    },
    {
      "epoch": 5.964884362401867,
      "grad_norm": 0.6661878681997396,
      "learning_rate": 2.5265473099976122e-05,
      "loss": 1.1823,
      "num_input_tokens_seen": 44235928832,
      "step": 56225
    },
    {
      "epoch": 5.964990451941438,
      "grad_norm": 0.6145471905066164,
      "learning_rate": 2.5264778170237148e-05,
      "loss": 1.2492,
      "num_input_tokens_seen": 44236715616,
      "step": 56226
    },
    {
      "epoch": 5.96509654148101,
      "grad_norm": 0.6276343701644448,
      "learning_rate": 2.5264083240293558e-05,
      "loss": 1.113,
      "num_input_tokens_seen": 44237502416,
      "step": 56227
    },
    {
      "epoch": 5.965202631020581,
      "grad_norm": 0.7458857267022596,
      "learning_rate": 2.526338831014589e-05,
      "loss": 1.05,
      "num_input_tokens_seen": 44238289280,
      "step": 56228
    },
    {
      "epoch": 5.965308720560153,
      "grad_norm": 0.6306406922759916,
      "learning_rate": 2.526269337979468e-05,
      "loss": 1.1582,
      "num_input_tokens_seen": 44239076080,
      "step": 56229
    },
    {
      "epoch": 5.965414810099724,
      "grad_norm": 0.5966137420467134,
      "learning_rate": 2.5261998449240482e-05,
      "loss": 1.162,
      "num_input_tokens_seen": 44239862912,
      "step": 56230
    },
    {
      "epoch": 5.965520899639295,
      "grad_norm": 0.8597298234195807,
      "learning_rate": 2.52613035184838e-05,
      "loss": 1.1869,
      "num_input_tokens_seen": 44240649680,
      "step": 56231
    },
    {
      "epoch": 5.965626989178867,
      "grad_norm": 0.6581828523296354,
      "learning_rate": 2.526060858752521e-05,
      "loss": 1.2749,
      "num_input_tokens_seen": 44241436448,
      "step": 56232
    },
    {
      "epoch": 5.965733078718438,
      "grad_norm": 0.7141412234440784,
      "learning_rate": 2.525991365636522e-05,
      "loss": 1.1477,
      "num_input_tokens_seen": 44242223232,
      "step": 56233
    },
    {
      "epoch": 5.96583916825801,
      "grad_norm": 0.7006281142284497,
      "learning_rate": 2.525921872500437e-05,
      "loss": 1.1591,
      "num_input_tokens_seen": 44243010000,
      "step": 56234
    },
    {
      "epoch": 5.965945257797581,
      "grad_norm": 0.6627364798188871,
      "learning_rate": 2.525852379344321e-05,
      "loss": 1.1018,
      "num_input_tokens_seen": 44243796784,
      "step": 56235
    },
    {
      "epoch": 5.966051347337153,
      "grad_norm": 0.8055166922291389,
      "learning_rate": 2.525782886168227e-05,
      "loss": 1.1602,
      "num_input_tokens_seen": 44244583520,
      "step": 56236
    },
    {
      "epoch": 5.966157436876724,
      "grad_norm": 0.6465626251871489,
      "learning_rate": 2.525713392972209e-05,
      "loss": 1.2204,
      "num_input_tokens_seen": 44245370208,
      "step": 56237
    },
    {
      "epoch": 5.966263526416295,
      "grad_norm": 0.5664431474898938,
      "learning_rate": 2.5256438997563202e-05,
      "loss": 1.1426,
      "num_input_tokens_seen": 44246156960,
      "step": 56238
    },
    {
      "epoch": 5.966369615955867,
      "grad_norm": 0.7062444329715144,
      "learning_rate": 2.5255744065206144e-05,
      "loss": 1.1533,
      "num_input_tokens_seen": 44246943616,
      "step": 56239
    },
    {
      "epoch": 5.966475705495438,
      "grad_norm": 0.7288763570685783,
      "learning_rate": 2.5255049132651453e-05,
      "loss": 1.0472,
      "num_input_tokens_seen": 44247730384,
      "step": 56240
    },
    {
      "epoch": 5.96658179503501,
      "grad_norm": 0.8029873677347248,
      "learning_rate": 2.5254354199899678e-05,
      "loss": 1.2202,
      "num_input_tokens_seen": 44248517056,
      "step": 56241
    },
    {
      "epoch": 5.966687884574581,
      "grad_norm": 0.6928080983654169,
      "learning_rate": 2.525365926695133e-05,
      "loss": 1.1977,
      "num_input_tokens_seen": 44249303744,
      "step": 56242
    },
    {
      "epoch": 5.966793974114152,
      "grad_norm": 0.591923684226302,
      "learning_rate": 2.5252964333806972e-05,
      "loss": 1.148,
      "num_input_tokens_seen": 44250090544,
      "step": 56243
    },
    {
      "epoch": 5.966900063653724,
      "grad_norm": 0.6424959602049974,
      "learning_rate": 2.5252269400467132e-05,
      "loss": 1.1474,
      "num_input_tokens_seen": 44250877344,
      "step": 56244
    },
    {
      "epoch": 5.967006153193295,
      "grad_norm": 0.8863293058117586,
      "learning_rate": 2.5251574466932336e-05,
      "loss": 1.1814,
      "num_input_tokens_seen": 44251664064,
      "step": 56245
    },
    {
      "epoch": 5.967112242732867,
      "grad_norm": 0.6714964881058864,
      "learning_rate": 2.5250879533203136e-05,
      "loss": 1.2376,
      "num_input_tokens_seen": 44252450848,
      "step": 56246
    },
    {
      "epoch": 5.967218332272438,
      "grad_norm": 0.6155916586782287,
      "learning_rate": 2.525018459928007e-05,
      "loss": 1.1253,
      "num_input_tokens_seen": 44253237584,
      "step": 56247
    },
    {
      "epoch": 5.967324421812009,
      "grad_norm": 0.8343144849476197,
      "learning_rate": 2.5249489665163656e-05,
      "loss": 1.0964,
      "num_input_tokens_seen": 44254024416,
      "step": 56248
    },
    {
      "epoch": 5.967430511351581,
      "grad_norm": 0.7085653796649412,
      "learning_rate": 2.5248794730854452e-05,
      "loss": 1.1914,
      "num_input_tokens_seen": 44254811200,
      "step": 56249
    },
    {
      "epoch": 5.967536600891152,
      "grad_norm": 0.677979398642744,
      "learning_rate": 2.5248099796352988e-05,
      "loss": 1.1775,
      "num_input_tokens_seen": 44255597936,
      "step": 56250
    },
    {
      "epoch": 5.967642690430724,
      "grad_norm": 0.7658399561358665,
      "learning_rate": 2.524740486165979e-05,
      "loss": 1.2161,
      "num_input_tokens_seen": 44256384672,
      "step": 56251
    },
    {
      "epoch": 5.967748779970295,
      "grad_norm": 0.7628162686073061,
      "learning_rate": 2.5246709926775415e-05,
      "loss": 1.1059,
      "num_input_tokens_seen": 44257171472,
      "step": 56252
    },
    {
      "epoch": 5.967854869509866,
      "grad_norm": 0.5626595851602201,
      "learning_rate": 2.5246014991700384e-05,
      "loss": 1.1166,
      "num_input_tokens_seen": 44257958240,
      "step": 56253
    },
    {
      "epoch": 5.967960959049438,
      "grad_norm": 0.7375414661314691,
      "learning_rate": 2.524532005643524e-05,
      "loss": 1.2249,
      "num_input_tokens_seen": 44258744912,
      "step": 56254
    },
    {
      "epoch": 5.968067048589009,
      "grad_norm": 0.6706002695356929,
      "learning_rate": 2.5244625120980524e-05,
      "loss": 1.1288,
      "num_input_tokens_seen": 44259531648,
      "step": 56255
    },
    {
      "epoch": 5.968173138128581,
      "grad_norm": 1.058695687572667,
      "learning_rate": 2.5243930185336768e-05,
      "loss": 1.2589,
      "num_input_tokens_seen": 44260318400,
      "step": 56256
    },
    {
      "epoch": 5.968279227668152,
      "grad_norm": 0.8526533096913419,
      "learning_rate": 2.5243235249504503e-05,
      "loss": 1.1773,
      "num_input_tokens_seen": 44261105200,
      "step": 56257
    },
    {
      "epoch": 5.968385317207724,
      "grad_norm": 0.8301875366635125,
      "learning_rate": 2.5242540313484282e-05,
      "loss": 1.0846,
      "num_input_tokens_seen": 44261892128,
      "step": 56258
    },
    {
      "epoch": 5.968491406747295,
      "grad_norm": 0.9180511731332296,
      "learning_rate": 2.5241845377276636e-05,
      "loss": 1.1419,
      "num_input_tokens_seen": 44262678912,
      "step": 56259
    },
    {
      "epoch": 5.968597496286866,
      "grad_norm": 0.6403611316358895,
      "learning_rate": 2.5241150440882087e-05,
      "loss": 1.2528,
      "num_input_tokens_seen": 44263465712,
      "step": 56260
    },
    {
      "epoch": 5.968703585826438,
      "grad_norm": 0.8882632381801696,
      "learning_rate": 2.524045550430119e-05,
      "loss": 1.1229,
      "num_input_tokens_seen": 44264252384,
      "step": 56261
    },
    {
      "epoch": 5.968809675366009,
      "grad_norm": 0.7207749044289632,
      "learning_rate": 2.5239760567534476e-05,
      "loss": 1.1256,
      "num_input_tokens_seen": 44265039168,
      "step": 56262
    },
    {
      "epoch": 5.968915764905581,
      "grad_norm": 0.5379918390433286,
      "learning_rate": 2.523906563058248e-05,
      "loss": 1.1118,
      "num_input_tokens_seen": 44265825968,
      "step": 56263
    },
    {
      "epoch": 5.969021854445152,
      "grad_norm": 0.6056581816728501,
      "learning_rate": 2.5238370693445745e-05,
      "loss": 1.1112,
      "num_input_tokens_seen": 44266612736,
      "step": 56264
    },
    {
      "epoch": 5.969127943984724,
      "grad_norm": 0.7467097333710537,
      "learning_rate": 2.52376757561248e-05,
      "loss": 1.1486,
      "num_input_tokens_seen": 44267399520,
      "step": 56265
    },
    {
      "epoch": 5.969234033524295,
      "grad_norm": 0.5809391075486587,
      "learning_rate": 2.5236980818620187e-05,
      "loss": 1.1259,
      "num_input_tokens_seen": 44268186400,
      "step": 56266
    },
    {
      "epoch": 5.969340123063866,
      "grad_norm": 0.5945457634310796,
      "learning_rate": 2.523628588093245e-05,
      "loss": 1.1628,
      "num_input_tokens_seen": 44268973152,
      "step": 56267
    },
    {
      "epoch": 5.9694462126034376,
      "grad_norm": 0.9665729828115756,
      "learning_rate": 2.5235590943062105e-05,
      "loss": 1.1092,
      "num_input_tokens_seen": 44269760000,
      "step": 56268
    },
    {
      "epoch": 5.969552302143009,
      "grad_norm": 0.6557252139761715,
      "learning_rate": 2.5234896005009712e-05,
      "loss": 1.0862,
      "num_input_tokens_seen": 44270546800,
      "step": 56269
    },
    {
      "epoch": 5.9696583916825805,
      "grad_norm": 0.7531247762557243,
      "learning_rate": 2.5234201066775797e-05,
      "loss": 1.1406,
      "num_input_tokens_seen": 44271333456,
      "step": 56270
    },
    {
      "epoch": 5.9697644812221515,
      "grad_norm": 0.9405154566297623,
      "learning_rate": 2.523350612836089e-05,
      "loss": 1.1175,
      "num_input_tokens_seen": 44272120256,
      "step": 56271
    },
    {
      "epoch": 5.969870570761723,
      "grad_norm": 0.585381085467085,
      "learning_rate": 2.5232811189765548e-05,
      "loss": 1.1161,
      "num_input_tokens_seen": 44272907072,
      "step": 56272
    },
    {
      "epoch": 5.9699766603012945,
      "grad_norm": 0.811165874963197,
      "learning_rate": 2.523211625099029e-05,
      "loss": 1.1586,
      "num_input_tokens_seen": 44273693792,
      "step": 56273
    },
    {
      "epoch": 5.9700827498408655,
      "grad_norm": 0.8035544488498417,
      "learning_rate": 2.5231421312035656e-05,
      "loss": 1.074,
      "num_input_tokens_seen": 44274480512,
      "step": 56274
    },
    {
      "epoch": 5.970188839380437,
      "grad_norm": 0.595976204263367,
      "learning_rate": 2.5230726372902196e-05,
      "loss": 1.1106,
      "num_input_tokens_seen": 44275267328,
      "step": 56275
    },
    {
      "epoch": 5.9702949289200085,
      "grad_norm": 0.6487502502193206,
      "learning_rate": 2.5230031433590435e-05,
      "loss": 1.1539,
      "num_input_tokens_seen": 44276054080,
      "step": 56276
    },
    {
      "epoch": 5.9704010184595795,
      "grad_norm": 1.1906658723205326,
      "learning_rate": 2.5229336494100902e-05,
      "loss": 1.2699,
      "num_input_tokens_seen": 44276840720,
      "step": 56277
    },
    {
      "epoch": 5.970507107999151,
      "grad_norm": 0.616588236933888,
      "learning_rate": 2.5228641554434157e-05,
      "loss": 1.1762,
      "num_input_tokens_seen": 44277627536,
      "step": 56278
    },
    {
      "epoch": 5.970613197538722,
      "grad_norm": 0.8324914605560416,
      "learning_rate": 2.522794661459072e-05,
      "loss": 1.2154,
      "num_input_tokens_seen": 44278414240,
      "step": 56279
    },
    {
      "epoch": 5.970719287078294,
      "grad_norm": 0.9595566641210191,
      "learning_rate": 2.5227251674571128e-05,
      "loss": 1.2176,
      "num_input_tokens_seen": 44279201072,
      "step": 56280
    },
    {
      "epoch": 5.970825376617865,
      "grad_norm": 0.7572049868278712,
      "learning_rate": 2.5226556734375932e-05,
      "loss": 1.1237,
      "num_input_tokens_seen": 44279987856,
      "step": 56281
    },
    {
      "epoch": 5.970931466157436,
      "grad_norm": 0.9599086613887604,
      "learning_rate": 2.522586179400565e-05,
      "loss": 1.2437,
      "num_input_tokens_seen": 44280774544,
      "step": 56282
    },
    {
      "epoch": 5.971037555697008,
      "grad_norm": 0.8142827693181689,
      "learning_rate": 2.5225166853460837e-05,
      "loss": 1.1556,
      "num_input_tokens_seen": 44281561312,
      "step": 56283
    },
    {
      "epoch": 5.971143645236579,
      "grad_norm": 0.6304405735820017,
      "learning_rate": 2.5224471912742016e-05,
      "loss": 1.2402,
      "num_input_tokens_seen": 44282348000,
      "step": 56284
    },
    {
      "epoch": 5.971249734776151,
      "grad_norm": 0.5909101089546742,
      "learning_rate": 2.522377697184973e-05,
      "loss": 1.1614,
      "num_input_tokens_seen": 44283134688,
      "step": 56285
    },
    {
      "epoch": 5.971355824315722,
      "grad_norm": 0.8467040557976904,
      "learning_rate": 2.5223082030784518e-05,
      "loss": 1.2096,
      "num_input_tokens_seen": 44283921456,
      "step": 56286
    },
    {
      "epoch": 5.971461913855294,
      "grad_norm": 0.7363961944707159,
      "learning_rate": 2.5222387089546916e-05,
      "loss": 1.1786,
      "num_input_tokens_seen": 44284708224,
      "step": 56287
    },
    {
      "epoch": 5.971568003394865,
      "grad_norm": 0.72463925184674,
      "learning_rate": 2.5221692148137454e-05,
      "loss": 1.1643,
      "num_input_tokens_seen": 44285495024,
      "step": 56288
    },
    {
      "epoch": 5.971674092934436,
      "grad_norm": 0.5241399679930301,
      "learning_rate": 2.522099720655668e-05,
      "loss": 1.0536,
      "num_input_tokens_seen": 44286281824,
      "step": 56289
    },
    {
      "epoch": 5.971780182474008,
      "grad_norm": 0.9074449890439374,
      "learning_rate": 2.522030226480513e-05,
      "loss": 1.2336,
      "num_input_tokens_seen": 44287068464,
      "step": 56290
    },
    {
      "epoch": 5.971886272013579,
      "grad_norm": 0.6238729368654814,
      "learning_rate": 2.5219607322883326e-05,
      "loss": 1.0785,
      "num_input_tokens_seen": 44287855200,
      "step": 56291
    },
    {
      "epoch": 5.971992361553151,
      "grad_norm": 0.5899912987191079,
      "learning_rate": 2.521891238079182e-05,
      "loss": 1.1436,
      "num_input_tokens_seen": 44288642016,
      "step": 56292
    },
    {
      "epoch": 5.972098451092722,
      "grad_norm": 0.5467902005398019,
      "learning_rate": 2.521821743853115e-05,
      "loss": 1.0799,
      "num_input_tokens_seen": 44289428768,
      "step": 56293
    },
    {
      "epoch": 5.972204540632294,
      "grad_norm": 0.6670523296369352,
      "learning_rate": 2.521752249610184e-05,
      "loss": 1.1322,
      "num_input_tokens_seen": 44290215456,
      "step": 56294
    },
    {
      "epoch": 5.972310630171865,
      "grad_norm": 0.6247831031055545,
      "learning_rate": 2.521682755350444e-05,
      "loss": 1.1031,
      "num_input_tokens_seen": 44291002272,
      "step": 56295
    },
    {
      "epoch": 5.972416719711436,
      "grad_norm": 0.6070190714603031,
      "learning_rate": 2.5216132610739478e-05,
      "loss": 1.1788,
      "num_input_tokens_seen": 44291789008,
      "step": 56296
    },
    {
      "epoch": 5.972522809251008,
      "grad_norm": 0.6207096151762952,
      "learning_rate": 2.52154376678075e-05,
      "loss": 1.0781,
      "num_input_tokens_seen": 44292575888,
      "step": 56297
    },
    {
      "epoch": 5.972628898790579,
      "grad_norm": 0.6624586638436024,
      "learning_rate": 2.5214742724709032e-05,
      "loss": 1.1376,
      "num_input_tokens_seen": 44293362656,
      "step": 56298
    },
    {
      "epoch": 5.972734988330151,
      "grad_norm": 0.8244059997723109,
      "learning_rate": 2.5214047781444623e-05,
      "loss": 1.1799,
      "num_input_tokens_seen": 44294149360,
      "step": 56299
    },
    {
      "epoch": 5.972841077869722,
      "grad_norm": 0.81042594445766,
      "learning_rate": 2.5213352838014798e-05,
      "loss": 1.2226,
      "num_input_tokens_seen": 44294936144,
      "step": 56300
    },
    {
      "epoch": 5.972947167409293,
      "grad_norm": 0.6927556136206442,
      "learning_rate": 2.521265789442011e-05,
      "loss": 1.1657,
      "num_input_tokens_seen": 44295722880,
      "step": 56301
    },
    {
      "epoch": 5.973053256948865,
      "grad_norm": 0.5854344965582795,
      "learning_rate": 2.5211962950661084e-05,
      "loss": 1.1176,
      "num_input_tokens_seen": 44296509584,
      "step": 56302
    },
    {
      "epoch": 5.973159346488436,
      "grad_norm": 0.7886140984867813,
      "learning_rate": 2.5211268006738248e-05,
      "loss": 1.1674,
      "num_input_tokens_seen": 44297296336,
      "step": 56303
    },
    {
      "epoch": 5.973265436028008,
      "grad_norm": 0.6553746041645978,
      "learning_rate": 2.521057306265216e-05,
      "loss": 1.1932,
      "num_input_tokens_seen": 44298083104,
      "step": 56304
    },
    {
      "epoch": 5.973371525567579,
      "grad_norm": 0.6306464104472361,
      "learning_rate": 2.520987811840335e-05,
      "loss": 1.0909,
      "num_input_tokens_seen": 44298870000,
      "step": 56305
    },
    {
      "epoch": 5.97347761510715,
      "grad_norm": 0.5904235163013197,
      "learning_rate": 2.5209183173992347e-05,
      "loss": 1.1195,
      "num_input_tokens_seen": 44299656720,
      "step": 56306
    },
    {
      "epoch": 5.973583704646722,
      "grad_norm": 0.5900172887074496,
      "learning_rate": 2.5208488229419692e-05,
      "loss": 1.1342,
      "num_input_tokens_seen": 44300443504,
      "step": 56307
    },
    {
      "epoch": 5.973689794186293,
      "grad_norm": 0.6322521049217865,
      "learning_rate": 2.520779328468592e-05,
      "loss": 1.1784,
      "num_input_tokens_seen": 44301230224,
      "step": 56308
    },
    {
      "epoch": 5.973795883725865,
      "grad_norm": 0.8032301893775711,
      "learning_rate": 2.5207098339791586e-05,
      "loss": 1.2129,
      "num_input_tokens_seen": 44302017088,
      "step": 56309
    },
    {
      "epoch": 5.973901973265436,
      "grad_norm": 0.6385911588320996,
      "learning_rate": 2.5206403394737206e-05,
      "loss": 1.2038,
      "num_input_tokens_seen": 44302803856,
      "step": 56310
    },
    {
      "epoch": 5.974008062805007,
      "grad_norm": 0.7903388721252981,
      "learning_rate": 2.5205708449523313e-05,
      "loss": 1.1278,
      "num_input_tokens_seen": 44303590640,
      "step": 56311
    },
    {
      "epoch": 5.974114152344579,
      "grad_norm": 0.5733186574852213,
      "learning_rate": 2.5205013504150465e-05,
      "loss": 1.1572,
      "num_input_tokens_seen": 44304377472,
      "step": 56312
    },
    {
      "epoch": 5.97422024188415,
      "grad_norm": 0.7048916659666179,
      "learning_rate": 2.520431855861919e-05,
      "loss": 1.1897,
      "num_input_tokens_seen": 44305164288,
      "step": 56313
    },
    {
      "epoch": 5.974326331423722,
      "grad_norm": 0.5736426067795416,
      "learning_rate": 2.5203623612930015e-05,
      "loss": 1.2176,
      "num_input_tokens_seen": 44305950976,
      "step": 56314
    },
    {
      "epoch": 5.974432420963293,
      "grad_norm": 0.6194121689069667,
      "learning_rate": 2.5202928667083493e-05,
      "loss": 1.1555,
      "num_input_tokens_seen": 44306737664,
      "step": 56315
    },
    {
      "epoch": 5.974538510502865,
      "grad_norm": 0.684589364559518,
      "learning_rate": 2.5202233721080155e-05,
      "loss": 1.1885,
      "num_input_tokens_seen": 44307524480,
      "step": 56316
    },
    {
      "epoch": 5.974644600042436,
      "grad_norm": 0.6449451640557943,
      "learning_rate": 2.520153877492053e-05,
      "loss": 1.1313,
      "num_input_tokens_seen": 44308311264,
      "step": 56317
    },
    {
      "epoch": 5.974750689582007,
      "grad_norm": 0.641561458736688,
      "learning_rate": 2.5200843828605165e-05,
      "loss": 1.2498,
      "num_input_tokens_seen": 44309098000,
      "step": 56318
    },
    {
      "epoch": 5.974856779121579,
      "grad_norm": 0.6144737372804469,
      "learning_rate": 2.5200148882134593e-05,
      "loss": 1.0916,
      "num_input_tokens_seen": 44309884736,
      "step": 56319
    },
    {
      "epoch": 5.97496286866115,
      "grad_norm": 0.6697818315994455,
      "learning_rate": 2.5199453935509353e-05,
      "loss": 1.1294,
      "num_input_tokens_seen": 44310671360,
      "step": 56320
    },
    {
      "epoch": 5.975068958200722,
      "grad_norm": 0.6107615735995728,
      "learning_rate": 2.519875898872998e-05,
      "loss": 1.1622,
      "num_input_tokens_seen": 44311458128,
      "step": 56321
    },
    {
      "epoch": 5.975175047740293,
      "grad_norm": 0.6704943737274197,
      "learning_rate": 2.5198064041797014e-05,
      "loss": 1.2026,
      "num_input_tokens_seen": 44312244784,
      "step": 56322
    },
    {
      "epoch": 5.975281137279865,
      "grad_norm": 0.6978374790809857,
      "learning_rate": 2.5197369094710988e-05,
      "loss": 1.2987,
      "num_input_tokens_seen": 44313031488,
      "step": 56323
    },
    {
      "epoch": 5.975387226819436,
      "grad_norm": 0.5731335878301632,
      "learning_rate": 2.519667414747244e-05,
      "loss": 1.1057,
      "num_input_tokens_seen": 44313818224,
      "step": 56324
    },
    {
      "epoch": 5.975493316359007,
      "grad_norm": 0.5577354149286984,
      "learning_rate": 2.5195979200081904e-05,
      "loss": 1.118,
      "num_input_tokens_seen": 44314605040,
      "step": 56325
    },
    {
      "epoch": 5.975599405898579,
      "grad_norm": 0.7643968161430199,
      "learning_rate": 2.519528425253993e-05,
      "loss": 1.1324,
      "num_input_tokens_seen": 44315391792,
      "step": 56326
    },
    {
      "epoch": 5.97570549543815,
      "grad_norm": 0.7450309277218636,
      "learning_rate": 2.5194589304847043e-05,
      "loss": 1.1907,
      "num_input_tokens_seen": 44316178624,
      "step": 56327
    },
    {
      "epoch": 5.975811584977722,
      "grad_norm": 0.6554146630575761,
      "learning_rate": 2.5193894357003777e-05,
      "loss": 1.087,
      "num_input_tokens_seen": 44316965344,
      "step": 56328
    },
    {
      "epoch": 5.975917674517293,
      "grad_norm": 0.8661699715387106,
      "learning_rate": 2.5193199409010687e-05,
      "loss": 1.1976,
      "num_input_tokens_seen": 44317752144,
      "step": 56329
    },
    {
      "epoch": 5.976023764056864,
      "grad_norm": 0.6785458916477383,
      "learning_rate": 2.5192504460868293e-05,
      "loss": 1.0939,
      "num_input_tokens_seen": 44318538928,
      "step": 56330
    },
    {
      "epoch": 5.976129853596436,
      "grad_norm": 0.7213594342232013,
      "learning_rate": 2.519180951257713e-05,
      "loss": 1.1143,
      "num_input_tokens_seen": 44319325648,
      "step": 56331
    },
    {
      "epoch": 5.976235943136007,
      "grad_norm": 0.641264674147951,
      "learning_rate": 2.519111456413775e-05,
      "loss": 1.2314,
      "num_input_tokens_seen": 44320112352,
      "step": 56332
    },
    {
      "epoch": 5.9763420326755785,
      "grad_norm": 0.8568880253240158,
      "learning_rate": 2.519041961555068e-05,
      "loss": 1.2096,
      "num_input_tokens_seen": 44320899088,
      "step": 56333
    },
    {
      "epoch": 5.9764481222151495,
      "grad_norm": 0.7167195200387443,
      "learning_rate": 2.5189724666816455e-05,
      "loss": 1.2321,
      "num_input_tokens_seen": 44321685872,
      "step": 56334
    },
    {
      "epoch": 5.976554211754721,
      "grad_norm": 0.6665442444496418,
      "learning_rate": 2.5189029717935624e-05,
      "loss": 1.2201,
      "num_input_tokens_seen": 44322472608,
      "step": 56335
    },
    {
      "epoch": 5.9766603012942925,
      "grad_norm": 0.7642269174261961,
      "learning_rate": 2.5188334768908717e-05,
      "loss": 1.2314,
      "num_input_tokens_seen": 44323259312,
      "step": 56336
    },
    {
      "epoch": 5.9767663908338635,
      "grad_norm": 0.8164940066535035,
      "learning_rate": 2.5187639819736263e-05,
      "loss": 1.0943,
      "num_input_tokens_seen": 44324046080,
      "step": 56337
    },
    {
      "epoch": 5.976872480373435,
      "grad_norm": 0.7886780365695504,
      "learning_rate": 2.518694487041881e-05,
      "loss": 1.1009,
      "num_input_tokens_seen": 44324832768,
      "step": 56338
    },
    {
      "epoch": 5.9769785699130065,
      "grad_norm": 0.6436086989035439,
      "learning_rate": 2.518624992095689e-05,
      "loss": 1.159,
      "num_input_tokens_seen": 44325619600,
      "step": 56339
    },
    {
      "epoch": 5.9770846594525775,
      "grad_norm": 1.1480149308902285,
      "learning_rate": 2.5185554971351044e-05,
      "loss": 1.1968,
      "num_input_tokens_seen": 44326406352,
      "step": 56340
    },
    {
      "epoch": 5.977190748992149,
      "grad_norm": 0.7299294738676508,
      "learning_rate": 2.5184860021601807e-05,
      "loss": 1.1548,
      "num_input_tokens_seen": 44327193104,
      "step": 56341
    },
    {
      "epoch": 5.9772968385317204,
      "grad_norm": 0.7478765288274191,
      "learning_rate": 2.5184165071709714e-05,
      "loss": 1.1435,
      "num_input_tokens_seen": 44327979920,
      "step": 56342
    },
    {
      "epoch": 5.977402928071292,
      "grad_norm": 0.7707561903654306,
      "learning_rate": 2.5183470121675305e-05,
      "loss": 1.1678,
      "num_input_tokens_seen": 44328766736,
      "step": 56343
    },
    {
      "epoch": 5.977509017610863,
      "grad_norm": 0.9509466891995823,
      "learning_rate": 2.5182775171499117e-05,
      "loss": 1.1097,
      "num_input_tokens_seen": 44329553392,
      "step": 56344
    },
    {
      "epoch": 5.977615107150435,
      "grad_norm": 0.677517721996411,
      "learning_rate": 2.518208022118168e-05,
      "loss": 1.1989,
      "num_input_tokens_seen": 44330340208,
      "step": 56345
    },
    {
      "epoch": 5.977721196690006,
      "grad_norm": 1.0481510161132075,
      "learning_rate": 2.5181385270723536e-05,
      "loss": 1.0265,
      "num_input_tokens_seen": 44331127008,
      "step": 56346
    },
    {
      "epoch": 5.977827286229578,
      "grad_norm": 0.7006150856286164,
      "learning_rate": 2.5180690320125227e-05,
      "loss": 1.1257,
      "num_input_tokens_seen": 44331913680,
      "step": 56347
    },
    {
      "epoch": 5.977933375769149,
      "grad_norm": 0.6024913545084217,
      "learning_rate": 2.517999536938729e-05,
      "loss": 1.118,
      "num_input_tokens_seen": 44332700416,
      "step": 56348
    },
    {
      "epoch": 5.97803946530872,
      "grad_norm": 0.7879057604353896,
      "learning_rate": 2.517930041851025e-05,
      "loss": 1.1617,
      "num_input_tokens_seen": 44333487248,
      "step": 56349
    },
    {
      "epoch": 5.978145554848292,
      "grad_norm": 0.8518304459256633,
      "learning_rate": 2.5178605467494655e-05,
      "loss": 1.1571,
      "num_input_tokens_seen": 44334274064,
      "step": 56350
    },
    {
      "epoch": 5.978251644387863,
      "grad_norm": 0.6792347363053,
      "learning_rate": 2.5177910516341035e-05,
      "loss": 1.1153,
      "num_input_tokens_seen": 44335060784,
      "step": 56351
    },
    {
      "epoch": 5.978357733927435,
      "grad_norm": 0.8200000531336846,
      "learning_rate": 2.5177215565049937e-05,
      "loss": 1.1083,
      "num_input_tokens_seen": 44335847664,
      "step": 56352
    },
    {
      "epoch": 5.978463823467006,
      "grad_norm": 0.7346642976980506,
      "learning_rate": 2.5176520613621895e-05,
      "loss": 1.1627,
      "num_input_tokens_seen": 44336634464,
      "step": 56353
    },
    {
      "epoch": 5.978569913006577,
      "grad_norm": 0.5689776471865279,
      "learning_rate": 2.5175825662057434e-05,
      "loss": 1.1008,
      "num_input_tokens_seen": 44337421264,
      "step": 56354
    },
    {
      "epoch": 5.978676002546149,
      "grad_norm": 0.686214204794555,
      "learning_rate": 2.5175130710357108e-05,
      "loss": 1.1368,
      "num_input_tokens_seen": 44338208048,
      "step": 56355
    },
    {
      "epoch": 5.97878209208572,
      "grad_norm": 0.6773627095419504,
      "learning_rate": 2.5174435758521443e-05,
      "loss": 1.0483,
      "num_input_tokens_seen": 44338994752,
      "step": 56356
    },
    {
      "epoch": 5.978888181625292,
      "grad_norm": 0.5407831756683871,
      "learning_rate": 2.5173740806550978e-05,
      "loss": 1.1088,
      "num_input_tokens_seen": 44339781488,
      "step": 56357
    },
    {
      "epoch": 5.978994271164863,
      "grad_norm": 0.6574430521962499,
      "learning_rate": 2.5173045854446255e-05,
      "loss": 1.1547,
      "num_input_tokens_seen": 44340568176,
      "step": 56358
    },
    {
      "epoch": 5.979100360704434,
      "grad_norm": 0.6711897535136818,
      "learning_rate": 2.5172350902207802e-05,
      "loss": 1.2067,
      "num_input_tokens_seen": 44341354944,
      "step": 56359
    },
    {
      "epoch": 5.979206450244006,
      "grad_norm": 0.7643509950238611,
      "learning_rate": 2.517165594983616e-05,
      "loss": 1.1837,
      "num_input_tokens_seen": 44342141696,
      "step": 56360
    },
    {
      "epoch": 5.979312539783577,
      "grad_norm": 0.7358809815731784,
      "learning_rate": 2.517096099733187e-05,
      "loss": 1.192,
      "num_input_tokens_seen": 44342928432,
      "step": 56361
    },
    {
      "epoch": 5.979418629323149,
      "grad_norm": 0.6858479033642826,
      "learning_rate": 2.5170266044695474e-05,
      "loss": 1.1026,
      "num_input_tokens_seen": 44343715200,
      "step": 56362
    },
    {
      "epoch": 5.97952471886272,
      "grad_norm": 0.6754715949132868,
      "learning_rate": 2.516957109192749e-05,
      "loss": 1.1824,
      "num_input_tokens_seen": 44344501920,
      "step": 56363
    },
    {
      "epoch": 5.979630808402291,
      "grad_norm": 0.7716224523364392,
      "learning_rate": 2.5168876139028468e-05,
      "loss": 1.1216,
      "num_input_tokens_seen": 44345288704,
      "step": 56364
    },
    {
      "epoch": 5.979736897941863,
      "grad_norm": 0.66172605891954,
      "learning_rate": 2.516818118599895e-05,
      "loss": 1.1862,
      "num_input_tokens_seen": 44346075536,
      "step": 56365
    },
    {
      "epoch": 5.979842987481434,
      "grad_norm": 0.7525892660702903,
      "learning_rate": 2.516748623283946e-05,
      "loss": 1.1286,
      "num_input_tokens_seen": 44346862288,
      "step": 56366
    },
    {
      "epoch": 5.979949077021006,
      "grad_norm": 0.6344547782307213,
      "learning_rate": 2.516679127955055e-05,
      "loss": 1.0665,
      "num_input_tokens_seen": 44347649056,
      "step": 56367
    },
    {
      "epoch": 5.980055166560577,
      "grad_norm": 0.7933851251930703,
      "learning_rate": 2.516609632613274e-05,
      "loss": 1.0707,
      "num_input_tokens_seen": 44348435840,
      "step": 56368
    },
    {
      "epoch": 5.980161256100148,
      "grad_norm": 0.6405798775252936,
      "learning_rate": 2.516540137258658e-05,
      "loss": 1.1497,
      "num_input_tokens_seen": 44349222624,
      "step": 56369
    },
    {
      "epoch": 5.98026734563972,
      "grad_norm": 0.7082310199026586,
      "learning_rate": 2.5164706418912605e-05,
      "loss": 1.166,
      "num_input_tokens_seen": 44350009312,
      "step": 56370
    },
    {
      "epoch": 5.980373435179291,
      "grad_norm": 0.5574670175791501,
      "learning_rate": 2.5164011465111336e-05,
      "loss": 1.1586,
      "num_input_tokens_seen": 44350796032,
      "step": 56371
    },
    {
      "epoch": 5.980479524718863,
      "grad_norm": 0.6560148959191783,
      "learning_rate": 2.5163316511183337e-05,
      "loss": 1.1777,
      "num_input_tokens_seen": 44351582752,
      "step": 56372
    },
    {
      "epoch": 5.980585614258434,
      "grad_norm": 0.7786206243876869,
      "learning_rate": 2.5162621557129134e-05,
      "loss": 1.1255,
      "num_input_tokens_seen": 44352369568,
      "step": 56373
    },
    {
      "epoch": 5.980691703798006,
      "grad_norm": 0.6005407973186478,
      "learning_rate": 2.5161926602949255e-05,
      "loss": 1.1259,
      "num_input_tokens_seen": 44353156464,
      "step": 56374
    },
    {
      "epoch": 5.980797793337577,
      "grad_norm": 0.9390875506253266,
      "learning_rate": 2.5161231648644245e-05,
      "loss": 1.1391,
      "num_input_tokens_seen": 44353943168,
      "step": 56375
    },
    {
      "epoch": 5.980903882877149,
      "grad_norm": 0.7584070152704153,
      "learning_rate": 2.5160536694214643e-05,
      "loss": 1.1812,
      "num_input_tokens_seen": 44354730032,
      "step": 56376
    },
    {
      "epoch": 5.98100997241672,
      "grad_norm": 0.6557870115669014,
      "learning_rate": 2.5159841739660972e-05,
      "loss": 1.1673,
      "num_input_tokens_seen": 44355516768,
      "step": 56377
    },
    {
      "epoch": 5.981116061956291,
      "grad_norm": 1.2317511412589597,
      "learning_rate": 2.5159146784983796e-05,
      "loss": 1.1027,
      "num_input_tokens_seen": 44356303536,
      "step": 56378
    },
    {
      "epoch": 5.981222151495863,
      "grad_norm": 0.7189431354261953,
      "learning_rate": 2.5158451830183628e-05,
      "loss": 1.1686,
      "num_input_tokens_seen": 44357090256,
      "step": 56379
    },
    {
      "epoch": 5.981328241035434,
      "grad_norm": 0.7283178391224019,
      "learning_rate": 2.5157756875261006e-05,
      "loss": 1.2459,
      "num_input_tokens_seen": 44357877120,
      "step": 56380
    },
    {
      "epoch": 5.981434330575006,
      "grad_norm": 1.0373733112835686,
      "learning_rate": 2.5157061920216486e-05,
      "loss": 1.1501,
      "num_input_tokens_seen": 44358663936,
      "step": 56381
    },
    {
      "epoch": 5.981540420114577,
      "grad_norm": 0.7553090102269173,
      "learning_rate": 2.5156366965050592e-05,
      "loss": 1.2071,
      "num_input_tokens_seen": 44359450656,
      "step": 56382
    },
    {
      "epoch": 5.981646509654148,
      "grad_norm": 0.6721243270226839,
      "learning_rate": 2.5155672009763854e-05,
      "loss": 1.1726,
      "num_input_tokens_seen": 44360237392,
      "step": 56383
    },
    {
      "epoch": 5.98175259919372,
      "grad_norm": 0.7857966143791358,
      "learning_rate": 2.5154977054356828e-05,
      "loss": 1.119,
      "num_input_tokens_seen": 44361024176,
      "step": 56384
    },
    {
      "epoch": 5.981858688733291,
      "grad_norm": 0.9017535241952764,
      "learning_rate": 2.515428209883003e-05,
      "loss": 1.2714,
      "num_input_tokens_seen": 44361810848,
      "step": 56385
    },
    {
      "epoch": 5.981964778272863,
      "grad_norm": 0.5903500273011126,
      "learning_rate": 2.5153587143184008e-05,
      "loss": 1.204,
      "num_input_tokens_seen": 44362597568,
      "step": 56386
    },
    {
      "epoch": 5.982070867812434,
      "grad_norm": 1.0940539315487376,
      "learning_rate": 2.5152892187419307e-05,
      "loss": 1.2199,
      "num_input_tokens_seen": 44363384288,
      "step": 56387
    },
    {
      "epoch": 5.982176957352005,
      "grad_norm": 0.7273849140358281,
      "learning_rate": 2.5152197231536444e-05,
      "loss": 1.2009,
      "num_input_tokens_seen": 44364170928,
      "step": 56388
    },
    {
      "epoch": 5.982283046891577,
      "grad_norm": 0.6279625092750362,
      "learning_rate": 2.5151502275535976e-05,
      "loss": 1.1238,
      "num_input_tokens_seen": 44364957600,
      "step": 56389
    },
    {
      "epoch": 5.982389136431148,
      "grad_norm": 0.7000673569742544,
      "learning_rate": 2.5150807319418434e-05,
      "loss": 1.1425,
      "num_input_tokens_seen": 44365744368,
      "step": 56390
    },
    {
      "epoch": 5.98249522597072,
      "grad_norm": 0.846447558096622,
      "learning_rate": 2.515011236318434e-05,
      "loss": 1.1873,
      "num_input_tokens_seen": 44366531024,
      "step": 56391
    },
    {
      "epoch": 5.982601315510291,
      "grad_norm": 0.594312243460025,
      "learning_rate": 2.5149417406834258e-05,
      "loss": 1.128,
      "num_input_tokens_seen": 44367317856,
      "step": 56392
    },
    {
      "epoch": 5.982707405049862,
      "grad_norm": 0.715804193878624,
      "learning_rate": 2.51487224503687e-05,
      "loss": 1.1537,
      "num_input_tokens_seen": 44368104608,
      "step": 56393
    },
    {
      "epoch": 5.982813494589434,
      "grad_norm": 0.6752641373020438,
      "learning_rate": 2.5148027493788212e-05,
      "loss": 1.1214,
      "num_input_tokens_seen": 44368891328,
      "step": 56394
    },
    {
      "epoch": 5.982919584129005,
      "grad_norm": 0.6302938093981727,
      "learning_rate": 2.5147332537093343e-05,
      "loss": 1.1424,
      "num_input_tokens_seen": 44369678080,
      "step": 56395
    },
    {
      "epoch": 5.9830256736685765,
      "grad_norm": 0.862914190548268,
      "learning_rate": 2.5146637580284615e-05,
      "loss": 1.129,
      "num_input_tokens_seen": 44370464816,
      "step": 56396
    },
    {
      "epoch": 5.9831317632081475,
      "grad_norm": 0.63507353451961,
      "learning_rate": 2.514594262336257e-05,
      "loss": 1.0874,
      "num_input_tokens_seen": 44371251600,
      "step": 56397
    },
    {
      "epoch": 5.983237852747719,
      "grad_norm": 0.6506044217142254,
      "learning_rate": 2.514524766632774e-05,
      "loss": 1.1495,
      "num_input_tokens_seen": 44372038400,
      "step": 56398
    },
    {
      "epoch": 5.9833439422872905,
      "grad_norm": 0.8488447643594845,
      "learning_rate": 2.514455270918068e-05,
      "loss": 1.2482,
      "num_input_tokens_seen": 44372825120,
      "step": 56399
    },
    {
      "epoch": 5.9834500318268615,
      "grad_norm": 0.9499860482082919,
      "learning_rate": 2.5143857751921902e-05,
      "loss": 1.1303,
      "num_input_tokens_seen": 44373611888,
      "step": 56400
    },
    {
      "epoch": 5.9835561213664334,
      "grad_norm": 0.7990756662977596,
      "learning_rate": 2.5143162794551954e-05,
      "loss": 1.1248,
      "num_input_tokens_seen": 44374398784,
      "step": 56401
    },
    {
      "epoch": 5.9836622109060045,
      "grad_norm": 0.8978927479763045,
      "learning_rate": 2.5142467837071387e-05,
      "loss": 1.0539,
      "num_input_tokens_seen": 44375185584,
      "step": 56402
    },
    {
      "epoch": 5.983768300445576,
      "grad_norm": 0.6406518322683773,
      "learning_rate": 2.5141772879480713e-05,
      "loss": 1.1541,
      "num_input_tokens_seen": 44375972368,
      "step": 56403
    },
    {
      "epoch": 5.983874389985147,
      "grad_norm": 0.6584997624236594,
      "learning_rate": 2.514107792178048e-05,
      "loss": 1.1109,
      "num_input_tokens_seen": 44376759120,
      "step": 56404
    },
    {
      "epoch": 5.983980479524719,
      "grad_norm": 0.8054664443829475,
      "learning_rate": 2.5140382963971238e-05,
      "loss": 1.0913,
      "num_input_tokens_seen": 44377545904,
      "step": 56405
    },
    {
      "epoch": 5.98408656906429,
      "grad_norm": 0.6407197882824942,
      "learning_rate": 2.5139688006053504e-05,
      "loss": 1.1347,
      "num_input_tokens_seen": 44378332592,
      "step": 56406
    },
    {
      "epoch": 5.984192658603861,
      "grad_norm": 0.5965964011607906,
      "learning_rate": 2.513899304802782e-05,
      "loss": 1.1155,
      "num_input_tokens_seen": 44379119296,
      "step": 56407
    },
    {
      "epoch": 5.984298748143433,
      "grad_norm": 0.7633817630638704,
      "learning_rate": 2.5138298089894737e-05,
      "loss": 1.1188,
      "num_input_tokens_seen": 44379906016,
      "step": 56408
    },
    {
      "epoch": 5.984404837683004,
      "grad_norm": 0.6188833809382187,
      "learning_rate": 2.5137603131654768e-05,
      "loss": 1.1722,
      "num_input_tokens_seen": 44380692848,
      "step": 56409
    },
    {
      "epoch": 5.984510927222576,
      "grad_norm": 0.645925853775453,
      "learning_rate": 2.5136908173308472e-05,
      "loss": 1.0757,
      "num_input_tokens_seen": 44381479568,
      "step": 56410
    },
    {
      "epoch": 5.984617016762147,
      "grad_norm": 0.6294503391938971,
      "learning_rate": 2.5136213214856376e-05,
      "loss": 1.1355,
      "num_input_tokens_seen": 44382266336,
      "step": 56411
    },
    {
      "epoch": 5.984723106301718,
      "grad_norm": 0.6489001617038699,
      "learning_rate": 2.5135518256299016e-05,
      "loss": 1.1781,
      "num_input_tokens_seen": 44383053104,
      "step": 56412
    },
    {
      "epoch": 5.98482919584129,
      "grad_norm": 0.6175889499996345,
      "learning_rate": 2.5134823297636934e-05,
      "loss": 1.1298,
      "num_input_tokens_seen": 44383839920,
      "step": 56413
    },
    {
      "epoch": 5.984935285380861,
      "grad_norm": 0.6142462224597786,
      "learning_rate": 2.513412833887066e-05,
      "loss": 1.2411,
      "num_input_tokens_seen": 44384626720,
      "step": 56414
    },
    {
      "epoch": 5.985041374920433,
      "grad_norm": 0.5848905133993474,
      "learning_rate": 2.513343338000074e-05,
      "loss": 1.1805,
      "num_input_tokens_seen": 44385413472,
      "step": 56415
    },
    {
      "epoch": 5.985147464460004,
      "grad_norm": 0.5947568561946761,
      "learning_rate": 2.5132738421027713e-05,
      "loss": 1.0815,
      "num_input_tokens_seen": 44386200240,
      "step": 56416
    },
    {
      "epoch": 5.985253553999575,
      "grad_norm": 0.540946842856616,
      "learning_rate": 2.5132043461952098e-05,
      "loss": 1.178,
      "num_input_tokens_seen": 44386986944,
      "step": 56417
    },
    {
      "epoch": 5.985359643539147,
      "grad_norm": 0.6404714830816162,
      "learning_rate": 2.513134850277445e-05,
      "loss": 1.2149,
      "num_input_tokens_seen": 44387773696,
      "step": 56418
    },
    {
      "epoch": 5.985465733078718,
      "grad_norm": 0.5960211508046246,
      "learning_rate": 2.5130653543495297e-05,
      "loss": 1.1766,
      "num_input_tokens_seen": 44388560384,
      "step": 56419
    },
    {
      "epoch": 5.98557182261829,
      "grad_norm": 0.5901630801177407,
      "learning_rate": 2.5129958584115177e-05,
      "loss": 1.1742,
      "num_input_tokens_seen": 44389347104,
      "step": 56420
    },
    {
      "epoch": 5.985677912157861,
      "grad_norm": 0.5746191294795315,
      "learning_rate": 2.5129263624634637e-05,
      "loss": 1.0387,
      "num_input_tokens_seen": 44390133888,
      "step": 56421
    },
    {
      "epoch": 5.985784001697432,
      "grad_norm": 0.6773643795419355,
      "learning_rate": 2.5128568665054198e-05,
      "loss": 1.1281,
      "num_input_tokens_seen": 44390920672,
      "step": 56422
    },
    {
      "epoch": 5.985890091237004,
      "grad_norm": 0.6755153843802294,
      "learning_rate": 2.5127873705374405e-05,
      "loss": 1.0925,
      "num_input_tokens_seen": 44391707568,
      "step": 56423
    },
    {
      "epoch": 5.985996180776575,
      "grad_norm": 0.6381255707757951,
      "learning_rate": 2.5127178745595797e-05,
      "loss": 1.1175,
      "num_input_tokens_seen": 44392494320,
      "step": 56424
    },
    {
      "epoch": 5.986102270316147,
      "grad_norm": 0.8432642640029637,
      "learning_rate": 2.5126483785718913e-05,
      "loss": 1.0994,
      "num_input_tokens_seen": 44393281120,
      "step": 56425
    },
    {
      "epoch": 5.986208359855718,
      "grad_norm": 0.5492172154434063,
      "learning_rate": 2.5125788825744278e-05,
      "loss": 1.1651,
      "num_input_tokens_seen": 44394067872,
      "step": 56426
    },
    {
      "epoch": 5.98631444939529,
      "grad_norm": 0.6430446102074201,
      "learning_rate": 2.5125093865672445e-05,
      "loss": 1.1564,
      "num_input_tokens_seen": 44394854624,
      "step": 56427
    },
    {
      "epoch": 5.986420538934861,
      "grad_norm": 0.6396529709339542,
      "learning_rate": 2.5124398905503937e-05,
      "loss": 1.143,
      "num_input_tokens_seen": 44395641504,
      "step": 56428
    },
    {
      "epoch": 5.986526628474432,
      "grad_norm": 0.6197055782726218,
      "learning_rate": 2.5123703945239302e-05,
      "loss": 1.1539,
      "num_input_tokens_seen": 44396428240,
      "step": 56429
    },
    {
      "epoch": 5.986632718014004,
      "grad_norm": 0.8109094745696361,
      "learning_rate": 2.512300898487907e-05,
      "loss": 1.1857,
      "num_input_tokens_seen": 44397214944,
      "step": 56430
    },
    {
      "epoch": 5.986738807553575,
      "grad_norm": 0.6043704069247524,
      "learning_rate": 2.5122314024423775e-05,
      "loss": 1.18,
      "num_input_tokens_seen": 44398001696,
      "step": 56431
    },
    {
      "epoch": 5.986844897093147,
      "grad_norm": 0.6270795655429915,
      "learning_rate": 2.512161906387397e-05,
      "loss": 1.1973,
      "num_input_tokens_seen": 44398788384,
      "step": 56432
    },
    {
      "epoch": 5.986950986632718,
      "grad_norm": 0.6612105321653787,
      "learning_rate": 2.5120924103230176e-05,
      "loss": 1.1234,
      "num_input_tokens_seen": 44399575184,
      "step": 56433
    },
    {
      "epoch": 5.98705707617229,
      "grad_norm": 0.5704584008263972,
      "learning_rate": 2.512022914249293e-05,
      "loss": 1.0675,
      "num_input_tokens_seen": 44400361968,
      "step": 56434
    },
    {
      "epoch": 5.987163165711861,
      "grad_norm": 0.6002646873658797,
      "learning_rate": 2.5119534181662786e-05,
      "loss": 1.1702,
      "num_input_tokens_seen": 44401148768,
      "step": 56435
    },
    {
      "epoch": 5.987269255251432,
      "grad_norm": 0.6743013491510753,
      "learning_rate": 2.5118839220740263e-05,
      "loss": 1.1612,
      "num_input_tokens_seen": 44401935440,
      "step": 56436
    },
    {
      "epoch": 5.987375344791004,
      "grad_norm": 0.6462769150218061,
      "learning_rate": 2.5118144259725902e-05,
      "loss": 1.1902,
      "num_input_tokens_seen": 44402722144,
      "step": 56437
    },
    {
      "epoch": 5.987481434330575,
      "grad_norm": 0.567025580223299,
      "learning_rate": 2.5117449298620244e-05,
      "loss": 1.1801,
      "num_input_tokens_seen": 44403508912,
      "step": 56438
    },
    {
      "epoch": 5.987587523870147,
      "grad_norm": 0.6339874659228248,
      "learning_rate": 2.5116754337423832e-05,
      "loss": 1.1817,
      "num_input_tokens_seen": 44404295536,
      "step": 56439
    },
    {
      "epoch": 5.987693613409718,
      "grad_norm": 0.7169762436761993,
      "learning_rate": 2.5116059376137184e-05,
      "loss": 1.1915,
      "num_input_tokens_seen": 44405082144,
      "step": 56440
    },
    {
      "epoch": 5.987799702949289,
      "grad_norm": 0.6313626925563377,
      "learning_rate": 2.511536441476085e-05,
      "loss": 1.1549,
      "num_input_tokens_seen": 44405868784,
      "step": 56441
    },
    {
      "epoch": 5.987905792488861,
      "grad_norm": 0.5613771594852244,
      "learning_rate": 2.5114669453295374e-05,
      "loss": 1.1445,
      "num_input_tokens_seen": 44406655536,
      "step": 56442
    },
    {
      "epoch": 5.988011882028432,
      "grad_norm": 0.7560014789447382,
      "learning_rate": 2.5113974491741277e-05,
      "loss": 1.2452,
      "num_input_tokens_seen": 44407442208,
      "step": 56443
    },
    {
      "epoch": 5.988117971568004,
      "grad_norm": 0.5706653249788879,
      "learning_rate": 2.511327953009911e-05,
      "loss": 1.13,
      "num_input_tokens_seen": 44408228944,
      "step": 56444
    },
    {
      "epoch": 5.988224061107575,
      "grad_norm": 0.7276025037194713,
      "learning_rate": 2.51125845683694e-05,
      "loss": 1.1088,
      "num_input_tokens_seen": 44409015664,
      "step": 56445
    },
    {
      "epoch": 5.988330150647146,
      "grad_norm": 0.6023700518715902,
      "learning_rate": 2.511188960655269e-05,
      "loss": 1.1765,
      "num_input_tokens_seen": 44409802400,
      "step": 56446
    },
    {
      "epoch": 5.988436240186718,
      "grad_norm": 0.6128212662517419,
      "learning_rate": 2.5111194644649517e-05,
      "loss": 1.2267,
      "num_input_tokens_seen": 44410589040,
      "step": 56447
    },
    {
      "epoch": 5.988542329726289,
      "grad_norm": 0.5096972064402773,
      "learning_rate": 2.5110499682660417e-05,
      "loss": 1.11,
      "num_input_tokens_seen": 44411375840,
      "step": 56448
    },
    {
      "epoch": 5.988648419265861,
      "grad_norm": 0.5148760427689967,
      "learning_rate": 2.5109804720585916e-05,
      "loss": 1.1541,
      "num_input_tokens_seen": 44412162656,
      "step": 56449
    },
    {
      "epoch": 5.988754508805432,
      "grad_norm": 0.6099336781407747,
      "learning_rate": 2.510910975842657e-05,
      "loss": 1.0725,
      "num_input_tokens_seen": 44412949408,
      "step": 56450
    },
    {
      "epoch": 5.988860598345003,
      "grad_norm": 0.6573397412535054,
      "learning_rate": 2.5108414796182907e-05,
      "loss": 1.063,
      "num_input_tokens_seen": 44413736240,
      "step": 56451
    },
    {
      "epoch": 5.988966687884575,
      "grad_norm": 0.7001747966216789,
      "learning_rate": 2.5107719833855458e-05,
      "loss": 1.152,
      "num_input_tokens_seen": 44414523056,
      "step": 56452
    },
    {
      "epoch": 5.989072777424146,
      "grad_norm": 0.9015097894641712,
      "learning_rate": 2.5107024871444773e-05,
      "loss": 1.1628,
      "num_input_tokens_seen": 44415309856,
      "step": 56453
    },
    {
      "epoch": 5.989178866963718,
      "grad_norm": 0.6481079915258763,
      "learning_rate": 2.5106329908951377e-05,
      "loss": 1.1464,
      "num_input_tokens_seen": 44416096640,
      "step": 56454
    },
    {
      "epoch": 5.989284956503289,
      "grad_norm": 0.7714999550225137,
      "learning_rate": 2.5105634946375816e-05,
      "loss": 1.1129,
      "num_input_tokens_seen": 44416883424,
      "step": 56455
    },
    {
      "epoch": 5.9893910460428605,
      "grad_norm": 0.8456453284002274,
      "learning_rate": 2.5104939983718624e-05,
      "loss": 1.202,
      "num_input_tokens_seen": 44417670080,
      "step": 56456
    },
    {
      "epoch": 5.989497135582432,
      "grad_norm": 0.8415435221253863,
      "learning_rate": 2.510424502098033e-05,
      "loss": 1.1552,
      "num_input_tokens_seen": 44418456864,
      "step": 56457
    },
    {
      "epoch": 5.989603225122003,
      "grad_norm": 0.6514462974898062,
      "learning_rate": 2.510355005816149e-05,
      "loss": 1.0667,
      "num_input_tokens_seen": 44419243600,
      "step": 56458
    },
    {
      "epoch": 5.9897093146615745,
      "grad_norm": 0.8261033095847325,
      "learning_rate": 2.5102855095262628e-05,
      "loss": 1.1411,
      "num_input_tokens_seen": 44420030352,
      "step": 56459
    },
    {
      "epoch": 5.9898154042011456,
      "grad_norm": 0.6359007433015306,
      "learning_rate": 2.5102160132284275e-05,
      "loss": 1.1163,
      "num_input_tokens_seen": 44420817200,
      "step": 56460
    },
    {
      "epoch": 5.9899214937407175,
      "grad_norm": 0.8269290148318634,
      "learning_rate": 2.510146516922698e-05,
      "loss": 1.1303,
      "num_input_tokens_seen": 44421603936,
      "step": 56461
    },
    {
      "epoch": 5.9900275832802885,
      "grad_norm": 0.7919012565756565,
      "learning_rate": 2.5100770206091278e-05,
      "loss": 1.231,
      "num_input_tokens_seen": 44422390704,
      "step": 56462
    },
    {
      "epoch": 5.99013367281986,
      "grad_norm": 0.6092108176981204,
      "learning_rate": 2.5100075242877697e-05,
      "loss": 1.1402,
      "num_input_tokens_seen": 44423177504,
      "step": 56463
    },
    {
      "epoch": 5.9902397623594315,
      "grad_norm": 0.8847775039748352,
      "learning_rate": 2.5099380279586786e-05,
      "loss": 1.1841,
      "num_input_tokens_seen": 44423964240,
      "step": 56464
    },
    {
      "epoch": 5.9903458518990025,
      "grad_norm": 0.6473312799564783,
      "learning_rate": 2.509868531621908e-05,
      "loss": 1.1437,
      "num_input_tokens_seen": 44424751008,
      "step": 56465
    },
    {
      "epoch": 5.990451941438574,
      "grad_norm": 0.7034059182060123,
      "learning_rate": 2.5097990352775103e-05,
      "loss": 1.2026,
      "num_input_tokens_seen": 44425537696,
      "step": 56466
    },
    {
      "epoch": 5.990558030978145,
      "grad_norm": 0.7061983044700699,
      "learning_rate": 2.509729538925541e-05,
      "loss": 1.0999,
      "num_input_tokens_seen": 44426324432,
      "step": 56467
    },
    {
      "epoch": 5.990664120517717,
      "grad_norm": 0.6544991320261021,
      "learning_rate": 2.5096600425660527e-05,
      "loss": 1.1144,
      "num_input_tokens_seen": 44427111280,
      "step": 56468
    },
    {
      "epoch": 5.990770210057288,
      "grad_norm": 0.7835215469493113,
      "learning_rate": 2.5095905461990992e-05,
      "loss": 1.1876,
      "num_input_tokens_seen": 44427898080,
      "step": 56469
    },
    {
      "epoch": 5.990876299596859,
      "grad_norm": 0.9606721779566543,
      "learning_rate": 2.5095210498247345e-05,
      "loss": 1.113,
      "num_input_tokens_seen": 44428684864,
      "step": 56470
    },
    {
      "epoch": 5.990982389136431,
      "grad_norm": 0.6872348829852528,
      "learning_rate": 2.5094515534430125e-05,
      "loss": 1.1087,
      "num_input_tokens_seen": 44429471568,
      "step": 56471
    },
    {
      "epoch": 5.991088478676002,
      "grad_norm": 0.7598613280908963,
      "learning_rate": 2.5093820570539867e-05,
      "loss": 1.1534,
      "num_input_tokens_seen": 44430258448,
      "step": 56472
    },
    {
      "epoch": 5.991194568215574,
      "grad_norm": 0.614673780023505,
      "learning_rate": 2.5093125606577106e-05,
      "loss": 1.0869,
      "num_input_tokens_seen": 44431045184,
      "step": 56473
    },
    {
      "epoch": 5.991300657755145,
      "grad_norm": 0.7181358705316008,
      "learning_rate": 2.5092430642542374e-05,
      "loss": 1.0715,
      "num_input_tokens_seen": 44431831984,
      "step": 56474
    },
    {
      "epoch": 5.991406747294716,
      "grad_norm": 0.9391322416790809,
      "learning_rate": 2.5091735678436224e-05,
      "loss": 1.1803,
      "num_input_tokens_seen": 44432618768,
      "step": 56475
    },
    {
      "epoch": 5.991512836834288,
      "grad_norm": 0.6454075790283034,
      "learning_rate": 2.5091040714259178e-05,
      "loss": 1.1026,
      "num_input_tokens_seen": 44433405520,
      "step": 56476
    },
    {
      "epoch": 5.991618926373859,
      "grad_norm": 0.7620858860364638,
      "learning_rate": 2.5090345750011773e-05,
      "loss": 1.1388,
      "num_input_tokens_seen": 44434192304,
      "step": 56477
    },
    {
      "epoch": 5.991725015913431,
      "grad_norm": 0.7497190324006169,
      "learning_rate": 2.5089650785694563e-05,
      "loss": 1.2233,
      "num_input_tokens_seen": 44434979056,
      "step": 56478
    },
    {
      "epoch": 5.991831105453002,
      "grad_norm": 0.7828986364010908,
      "learning_rate": 2.508895582130807e-05,
      "loss": 1.1379,
      "num_input_tokens_seen": 44435765952,
      "step": 56479
    },
    {
      "epoch": 5.991937194992573,
      "grad_norm": 0.9039008852938326,
      "learning_rate": 2.508826085685283e-05,
      "loss": 1.1533,
      "num_input_tokens_seen": 44436552688,
      "step": 56480
    },
    {
      "epoch": 5.992043284532145,
      "grad_norm": 0.6533841291047919,
      "learning_rate": 2.508756589232939e-05,
      "loss": 1.1612,
      "num_input_tokens_seen": 44437339408,
      "step": 56481
    },
    {
      "epoch": 5.992149374071716,
      "grad_norm": 0.7403778498703817,
      "learning_rate": 2.508687092773828e-05,
      "loss": 1.0784,
      "num_input_tokens_seen": 44438126176,
      "step": 56482
    },
    {
      "epoch": 5.992255463611288,
      "grad_norm": 1.0463904955946632,
      "learning_rate": 2.5086175963080034e-05,
      "loss": 1.1284,
      "num_input_tokens_seen": 44438913040,
      "step": 56483
    },
    {
      "epoch": 5.992361553150859,
      "grad_norm": 0.6848524391319228,
      "learning_rate": 2.5085480998355198e-05,
      "loss": 1.0934,
      "num_input_tokens_seen": 44439699872,
      "step": 56484
    },
    {
      "epoch": 5.992467642690431,
      "grad_norm": 0.788884896274208,
      "learning_rate": 2.5084786033564306e-05,
      "loss": 1.1202,
      "num_input_tokens_seen": 44440486608,
      "step": 56485
    },
    {
      "epoch": 5.992573732230002,
      "grad_norm": 0.9607667246686803,
      "learning_rate": 2.508409106870789e-05,
      "loss": 1.1523,
      "num_input_tokens_seen": 44441273344,
      "step": 56486
    },
    {
      "epoch": 5.992679821769573,
      "grad_norm": 0.5682935090896818,
      "learning_rate": 2.5083396103786493e-05,
      "loss": 1.0136,
      "num_input_tokens_seen": 44442060240,
      "step": 56487
    },
    {
      "epoch": 5.992785911309145,
      "grad_norm": 0.8313573695428091,
      "learning_rate": 2.5082701138800645e-05,
      "loss": 1.0994,
      "num_input_tokens_seen": 44442847152,
      "step": 56488
    },
    {
      "epoch": 5.992892000848716,
      "grad_norm": 0.7903017808003252,
      "learning_rate": 2.5082006173750894e-05,
      "loss": 1.2028,
      "num_input_tokens_seen": 44443633968,
      "step": 56489
    },
    {
      "epoch": 5.992998090388288,
      "grad_norm": 0.6122018664199566,
      "learning_rate": 2.508131120863777e-05,
      "loss": 1.2029,
      "num_input_tokens_seen": 44444420656,
      "step": 56490
    },
    {
      "epoch": 5.993104179927859,
      "grad_norm": 0.712342977959184,
      "learning_rate": 2.508061624346181e-05,
      "loss": 1.1955,
      "num_input_tokens_seen": 44445207456,
      "step": 56491
    },
    {
      "epoch": 5.993210269467431,
      "grad_norm": 0.7512007428892719,
      "learning_rate": 2.507992127822355e-05,
      "loss": 1.1347,
      "num_input_tokens_seen": 44445994160,
      "step": 56492
    },
    {
      "epoch": 5.993316359007002,
      "grad_norm": 0.6774128902902835,
      "learning_rate": 2.507922631292354e-05,
      "loss": 1.1816,
      "num_input_tokens_seen": 44446780848,
      "step": 56493
    },
    {
      "epoch": 5.993422448546573,
      "grad_norm": 0.7319320749442247,
      "learning_rate": 2.5078531347562296e-05,
      "loss": 1.2487,
      "num_input_tokens_seen": 44447567648,
      "step": 56494
    },
    {
      "epoch": 5.993528538086145,
      "grad_norm": 0.7478338929146264,
      "learning_rate": 2.5077836382140362e-05,
      "loss": 1.1515,
      "num_input_tokens_seen": 44448354464,
      "step": 56495
    },
    {
      "epoch": 5.993634627625716,
      "grad_norm": 0.6885073371690804,
      "learning_rate": 2.5077141416658288e-05,
      "loss": 1.1528,
      "num_input_tokens_seen": 44449141232,
      "step": 56496
    },
    {
      "epoch": 5.993740717165288,
      "grad_norm": 0.6400318499160415,
      "learning_rate": 2.5076446451116597e-05,
      "loss": 1.1469,
      "num_input_tokens_seen": 44449927920,
      "step": 56497
    },
    {
      "epoch": 5.993846806704859,
      "grad_norm": 0.6193923359892944,
      "learning_rate": 2.507575148551583e-05,
      "loss": 1.1385,
      "num_input_tokens_seen": 44450714768,
      "step": 56498
    },
    {
      "epoch": 5.99395289624443,
      "grad_norm": 0.6345410384826725,
      "learning_rate": 2.5075056519856527e-05,
      "loss": 1.0799,
      "num_input_tokens_seen": 44451501712,
      "step": 56499
    },
    {
      "epoch": 5.994058985784002,
      "grad_norm": 0.5946461109885449,
      "learning_rate": 2.507436155413922e-05,
      "loss": 1.1419,
      "num_input_tokens_seen": 44452288592,
      "step": 56500
    },
    {
      "epoch": 5.994165075323573,
      "grad_norm": 0.625432631575169,
      "learning_rate": 2.5073666588364454e-05,
      "loss": 1.123,
      "num_input_tokens_seen": 44453075296,
      "step": 56501
    },
    {
      "epoch": 5.994271164863145,
      "grad_norm": 0.6453752859081832,
      "learning_rate": 2.5072971622532752e-05,
      "loss": 1.164,
      "num_input_tokens_seen": 44453862112,
      "step": 56502
    },
    {
      "epoch": 5.994377254402716,
      "grad_norm": 0.7178948074860646,
      "learning_rate": 2.5072276656644662e-05,
      "loss": 1.1917,
      "num_input_tokens_seen": 44454648912,
      "step": 56503
    },
    {
      "epoch": 5.994483343942287,
      "grad_norm": 0.7123519011015962,
      "learning_rate": 2.5071581690700725e-05,
      "loss": 1.1972,
      "num_input_tokens_seen": 44455435664,
      "step": 56504
    },
    {
      "epoch": 5.994589433481859,
      "grad_norm": 0.5893309412069757,
      "learning_rate": 2.507088672470147e-05,
      "loss": 1.1303,
      "num_input_tokens_seen": 44456222464,
      "step": 56505
    },
    {
      "epoch": 5.99469552302143,
      "grad_norm": 0.620483659410001,
      "learning_rate": 2.5070191758647425e-05,
      "loss": 1.2231,
      "num_input_tokens_seen": 44457009232,
      "step": 56506
    },
    {
      "epoch": 5.994801612561002,
      "grad_norm": 0.7117000567863905,
      "learning_rate": 2.506949679253915e-05,
      "loss": 1.2268,
      "num_input_tokens_seen": 44457796032,
      "step": 56507
    },
    {
      "epoch": 5.994907702100573,
      "grad_norm": 0.6901807893048255,
      "learning_rate": 2.506880182637717e-05,
      "loss": 1.1126,
      "num_input_tokens_seen": 44458582720,
      "step": 56508
    },
    {
      "epoch": 5.995013791640144,
      "grad_norm": 0.6577810526752234,
      "learning_rate": 2.506810686016201e-05,
      "loss": 1.1551,
      "num_input_tokens_seen": 44459369488,
      "step": 56509
    },
    {
      "epoch": 5.995119881179716,
      "grad_norm": 0.5826520633725036,
      "learning_rate": 2.5067411893894232e-05,
      "loss": 1.0763,
      "num_input_tokens_seen": 44460156208,
      "step": 56510
    },
    {
      "epoch": 5.995225970719287,
      "grad_norm": 0.8025364699833977,
      "learning_rate": 2.5066716927574358e-05,
      "loss": 1.1082,
      "num_input_tokens_seen": 44460943008,
      "step": 56511
    },
    {
      "epoch": 5.995332060258859,
      "grad_norm": 0.6197182506768016,
      "learning_rate": 2.5066021961202917e-05,
      "loss": 1.2017,
      "num_input_tokens_seen": 44461729744,
      "step": 56512
    },
    {
      "epoch": 5.99543814979843,
      "grad_norm": 0.8051588094361193,
      "learning_rate": 2.506532699478047e-05,
      "loss": 1.0577,
      "num_input_tokens_seen": 44462516608,
      "step": 56513
    },
    {
      "epoch": 5.995544239338002,
      "grad_norm": 0.6862929699516622,
      "learning_rate": 2.5064632028307527e-05,
      "loss": 1.2803,
      "num_input_tokens_seen": 44463303264,
      "step": 56514
    },
    {
      "epoch": 5.995650328877573,
      "grad_norm": 0.7940369682649124,
      "learning_rate": 2.5063937061784647e-05,
      "loss": 1.0547,
      "num_input_tokens_seen": 44464090032,
      "step": 56515
    },
    {
      "epoch": 5.995756418417144,
      "grad_norm": 0.915749022064086,
      "learning_rate": 2.5063242095212357e-05,
      "loss": 1.1586,
      "num_input_tokens_seen": 44464876864,
      "step": 56516
    },
    {
      "epoch": 5.995862507956716,
      "grad_norm": 0.6354603572432252,
      "learning_rate": 2.506254712859119e-05,
      "loss": 1.2119,
      "num_input_tokens_seen": 44465663600,
      "step": 56517
    },
    {
      "epoch": 5.995968597496287,
      "grad_norm": 0.8371282972461634,
      "learning_rate": 2.5061852161921695e-05,
      "loss": 1.1994,
      "num_input_tokens_seen": 44466450352,
      "step": 56518
    },
    {
      "epoch": 5.9960746870358586,
      "grad_norm": 0.6153992021244867,
      "learning_rate": 2.5061157195204403e-05,
      "loss": 1.1353,
      "num_input_tokens_seen": 44467237152,
      "step": 56519
    },
    {
      "epoch": 5.99618077657543,
      "grad_norm": 0.6113085879241503,
      "learning_rate": 2.5060462228439847e-05,
      "loss": 1.0843,
      "num_input_tokens_seen": 44468023968,
      "step": 56520
    },
    {
      "epoch": 5.9962868661150015,
      "grad_norm": 0.6221144730247518,
      "learning_rate": 2.505976726162857e-05,
      "loss": 1.1319,
      "num_input_tokens_seen": 44468810752,
      "step": 56521
    },
    {
      "epoch": 5.9963929556545725,
      "grad_norm": 0.6066776020749934,
      "learning_rate": 2.5059072294771103e-05,
      "loss": 1.0687,
      "num_input_tokens_seen": 44469597568,
      "step": 56522
    },
    {
      "epoch": 5.996499045194144,
      "grad_norm": 0.7860291314519073,
      "learning_rate": 2.505837732786799e-05,
      "loss": 1.108,
      "num_input_tokens_seen": 44470384432,
      "step": 56523
    },
    {
      "epoch": 5.9966051347337155,
      "grad_norm": 0.7615861432240159,
      "learning_rate": 2.505768236091976e-05,
      "loss": 1.1776,
      "num_input_tokens_seen": 44471171136,
      "step": 56524
    },
    {
      "epoch": 5.9967112242732865,
      "grad_norm": 0.8423413474823437,
      "learning_rate": 2.5056987393926962e-05,
      "loss": 1.1686,
      "num_input_tokens_seen": 44471957968,
      "step": 56525
    },
    {
      "epoch": 5.996817313812858,
      "grad_norm": 0.9290548970620551,
      "learning_rate": 2.5056292426890115e-05,
      "loss": 1.1507,
      "num_input_tokens_seen": 44472744720,
      "step": 56526
    },
    {
      "epoch": 5.9969234033524295,
      "grad_norm": 0.6788315291705144,
      "learning_rate": 2.5055597459809775e-05,
      "loss": 1.1711,
      "num_input_tokens_seen": 44473531440,
      "step": 56527
    },
    {
      "epoch": 5.9970294928920005,
      "grad_norm": 0.7534579165591855,
      "learning_rate": 2.5054902492686477e-05,
      "loss": 1.1819,
      "num_input_tokens_seen": 44474318240,
      "step": 56528
    },
    {
      "epoch": 5.997135582431572,
      "grad_norm": 0.63276093930072,
      "learning_rate": 2.505420752552074e-05,
      "loss": 1.1425,
      "num_input_tokens_seen": 44475105024,
      "step": 56529
    },
    {
      "epoch": 5.997241671971143,
      "grad_norm": 0.6441266021954963,
      "learning_rate": 2.505351255831312e-05,
      "loss": 1.1531,
      "num_input_tokens_seen": 44475891744,
      "step": 56530
    },
    {
      "epoch": 5.997347761510715,
      "grad_norm": 0.6635906808184852,
      "learning_rate": 2.5052817591064142e-05,
      "loss": 1.1671,
      "num_input_tokens_seen": 44476678512,
      "step": 56531
    },
    {
      "epoch": 5.997453851050286,
      "grad_norm": 0.6977127999753573,
      "learning_rate": 2.5052122623774348e-05,
      "loss": 1.122,
      "num_input_tokens_seen": 44477465280,
      "step": 56532
    },
    {
      "epoch": 5.997559940589857,
      "grad_norm": 0.6820451028076411,
      "learning_rate": 2.5051427656444282e-05,
      "loss": 1.1981,
      "num_input_tokens_seen": 44478252000,
      "step": 56533
    },
    {
      "epoch": 5.997666030129429,
      "grad_norm": 0.6066683784182717,
      "learning_rate": 2.505073268907447e-05,
      "loss": 1.2334,
      "num_input_tokens_seen": 44479038896,
      "step": 56534
    },
    {
      "epoch": 5.997772119669,
      "grad_norm": 0.7082401894895386,
      "learning_rate": 2.5050037721665454e-05,
      "loss": 1.1497,
      "num_input_tokens_seen": 44479825696,
      "step": 56535
    },
    {
      "epoch": 5.997878209208572,
      "grad_norm": 0.730984524811588,
      "learning_rate": 2.5049342754217763e-05,
      "loss": 1.1978,
      "num_input_tokens_seen": 44480612496,
      "step": 56536
    },
    {
      "epoch": 5.997984298748143,
      "grad_norm": 0.5763177314430897,
      "learning_rate": 2.5048647786731955e-05,
      "loss": 1.1324,
      "num_input_tokens_seen": 44481399248,
      "step": 56537
    },
    {
      "epoch": 5.998090388287714,
      "grad_norm": 0.6485268871497607,
      "learning_rate": 2.5047952819208542e-05,
      "loss": 1.1128,
      "num_input_tokens_seen": 44482186000,
      "step": 56538
    },
    {
      "epoch": 5.998196477827286,
      "grad_norm": 0.5986343409701324,
      "learning_rate": 2.5047257851648076e-05,
      "loss": 1.0919,
      "num_input_tokens_seen": 44482972816,
      "step": 56539
    },
    {
      "epoch": 5.998302567366857,
      "grad_norm": 0.5539680863297466,
      "learning_rate": 2.504656288405109e-05,
      "loss": 1.187,
      "num_input_tokens_seen": 44483759504,
      "step": 56540
    },
    {
      "epoch": 5.998408656906429,
      "grad_norm": 0.6526599275018701,
      "learning_rate": 2.5045867916418125e-05,
      "loss": 1.1991,
      "num_input_tokens_seen": 44484546320,
      "step": 56541
    },
    {
      "epoch": 5.998514746446,
      "grad_norm": 0.678965998821241,
      "learning_rate": 2.5045172948749717e-05,
      "loss": 1.2107,
      "num_input_tokens_seen": 44485333056,
      "step": 56542
    },
    {
      "epoch": 5.998620835985572,
      "grad_norm": 0.6550314291599241,
      "learning_rate": 2.5044477981046395e-05,
      "loss": 1.185,
      "num_input_tokens_seen": 44486119984,
      "step": 56543
    },
    {
      "epoch": 5.998726925525143,
      "grad_norm": 0.7115564983404515,
      "learning_rate": 2.5043783013308703e-05,
      "loss": 1.1978,
      "num_input_tokens_seen": 44486906624,
      "step": 56544
    },
    {
      "epoch": 5.998833015064715,
      "grad_norm": 0.7742897204021002,
      "learning_rate": 2.5043088045537177e-05,
      "loss": 1.1829,
      "num_input_tokens_seen": 44487693280,
      "step": 56545
    },
    {
      "epoch": 5.998939104604286,
      "grad_norm": 0.5613974674588883,
      "learning_rate": 2.5042393077732353e-05,
      "loss": 1.1024,
      "num_input_tokens_seen": 44488480032,
      "step": 56546
    },
    {
      "epoch": 5.999045194143857,
      "grad_norm": 0.6612931267646958,
      "learning_rate": 2.504169810989477e-05,
      "loss": 1.1182,
      "num_input_tokens_seen": 44489266880,
      "step": 56547
    },
    {
      "epoch": 5.999151283683429,
      "grad_norm": 0.9020137206834774,
      "learning_rate": 2.5041003142024967e-05,
      "loss": 1.1773,
      "num_input_tokens_seen": 44490053648,
      "step": 56548
    },
    {
      "epoch": 5.999257373223,
      "grad_norm": 0.6044613336746577,
      "learning_rate": 2.5040308174123465e-05,
      "loss": 1.1939,
      "num_input_tokens_seen": 44490840464,
      "step": 56549
    },
    {
      "epoch": 5.999363462762572,
      "grad_norm": 0.8365678483218297,
      "learning_rate": 2.5039613206190827e-05,
      "loss": 1.2047,
      "num_input_tokens_seen": 44491627232,
      "step": 56550
    },
    {
      "epoch": 5.999469552302143,
      "grad_norm": 0.6468405228886135,
      "learning_rate": 2.5038918238227577e-05,
      "loss": 1.1874,
      "num_input_tokens_seen": 44492413984,
      "step": 56551
    },
    {
      "epoch": 5.999575641841714,
      "grad_norm": 0.6551795107541598,
      "learning_rate": 2.5038223270234247e-05,
      "loss": 1.2497,
      "num_input_tokens_seen": 44493200784,
      "step": 56552
    },
    {
      "epoch": 5.999681731381286,
      "grad_norm": 0.6916167846124011,
      "learning_rate": 2.5037528302211383e-05,
      "loss": 1.103,
      "num_input_tokens_seen": 44493987552,
      "step": 56553
    },
    {
      "epoch": 5.999787820920857,
      "grad_norm": 0.6850348195879151,
      "learning_rate": 2.5036833334159516e-05,
      "loss": 1.02,
      "num_input_tokens_seen": 44494774336,
      "step": 56554
    },
    {
      "epoch": 5.999893910460429,
      "grad_norm": 0.5852550559705773,
      "learning_rate": 2.5036138366079183e-05,
      "loss": 1.1438,
      "num_input_tokens_seen": 44495561088,
      "step": 56555
    },
    {
      "epoch": 6.0,
      "grad_norm": 0.8678235049028059,
      "learning_rate": 2.5035443397970927e-05,
      "loss": 1.1523,
      "num_input_tokens_seen": 44496347936,
      "step": 56556
    },
    {
      "epoch": 6.000106089539571,
      "grad_norm": 0.9875192965662211,
      "learning_rate": 2.5034748429835276e-05,
      "loss": 0.9673,
      "num_input_tokens_seen": 44497134688,
      "step": 56557
    },
    {
      "epoch": 6.000212179079143,
      "grad_norm": 0.8380819598042293,
      "learning_rate": 2.503405346167278e-05,
      "loss": 0.948,
      "num_input_tokens_seen": 44497921456,
      "step": 56558
    },
    {
      "epoch": 6.000318268618714,
      "grad_norm": 0.9153293800172013,
      "learning_rate": 2.5033358493483965e-05,
      "loss": 1.0228,
      "num_input_tokens_seen": 44498708192,
      "step": 56559
    },
    {
      "epoch": 6.000424358158286,
      "grad_norm": 0.9311107906133543,
      "learning_rate": 2.5032663525269366e-05,
      "loss": 0.9777,
      "num_input_tokens_seen": 44499494960,
      "step": 56560
    },
    {
      "epoch": 6.000530447697857,
      "grad_norm": 0.913294416787752,
      "learning_rate": 2.503196855702954e-05,
      "loss": 0.9157,
      "num_input_tokens_seen": 44500281632,
      "step": 56561
    },
    {
      "epoch": 6.000636537237428,
      "grad_norm": 0.8712697599185294,
      "learning_rate": 2.5031273588764997e-05,
      "loss": 0.9701,
      "num_input_tokens_seen": 44501068416,
      "step": 56562
    },
    {
      "epoch": 6.000742626777,
      "grad_norm": 0.7576497759742574,
      "learning_rate": 2.5030578620476293e-05,
      "loss": 0.9619,
      "num_input_tokens_seen": 44501855216,
      "step": 56563
    },
    {
      "epoch": 6.000848716316571,
      "grad_norm": 0.8187527745151704,
      "learning_rate": 2.5029883652163954e-05,
      "loss": 1.0027,
      "num_input_tokens_seen": 44502642016,
      "step": 56564
    },
    {
      "epoch": 6.000954805856143,
      "grad_norm": 0.7245775368624467,
      "learning_rate": 2.5029188683828524e-05,
      "loss": 1.0218,
      "num_input_tokens_seen": 44503428688,
      "step": 56565
    },
    {
      "epoch": 6.001060895395714,
      "grad_norm": 0.7507179251512985,
      "learning_rate": 2.5028493715470536e-05,
      "loss": 0.9915,
      "num_input_tokens_seen": 44504215424,
      "step": 56566
    },
    {
      "epoch": 6.001166984935286,
      "grad_norm": 0.7266097279185246,
      "learning_rate": 2.5027798747090536e-05,
      "loss": 0.9281,
      "num_input_tokens_seen": 44505002208,
      "step": 56567
    },
    {
      "epoch": 6.001273074474857,
      "grad_norm": 0.9611453303000457,
      "learning_rate": 2.5027103778689048e-05,
      "loss": 0.9736,
      "num_input_tokens_seen": 44505788992,
      "step": 56568
    },
    {
      "epoch": 6.001379164014428,
      "grad_norm": 0.8256153852502469,
      "learning_rate": 2.502640881026661e-05,
      "loss": 0.9447,
      "num_input_tokens_seen": 44506575760,
      "step": 56569
    },
    {
      "epoch": 6.001485253554,
      "grad_norm": 0.6939804760953239,
      "learning_rate": 2.502571384182377e-05,
      "loss": 0.9557,
      "num_input_tokens_seen": 44507362624,
      "step": 56570
    },
    {
      "epoch": 6.001591343093571,
      "grad_norm": 0.7392611625073061,
      "learning_rate": 2.5025018873361067e-05,
      "loss": 0.8811,
      "num_input_tokens_seen": 44508149392,
      "step": 56571
    },
    {
      "epoch": 6.001697432633143,
      "grad_norm": 0.8646704796458764,
      "learning_rate": 2.5024323904879016e-05,
      "loss": 0.9367,
      "num_input_tokens_seen": 44508936208,
      "step": 56572
    },
    {
      "epoch": 6.001803522172714,
      "grad_norm": 0.7864284010586637,
      "learning_rate": 2.502362893637818e-05,
      "loss": 1.0378,
      "num_input_tokens_seen": 44509722896,
      "step": 56573
    },
    {
      "epoch": 6.001909611712285,
      "grad_norm": 0.790518187184451,
      "learning_rate": 2.5022933967859074e-05,
      "loss": 0.9541,
      "num_input_tokens_seen": 44510509616,
      "step": 56574
    },
    {
      "epoch": 6.002015701251857,
      "grad_norm": 0.872500410702672,
      "learning_rate": 2.502223899932225e-05,
      "loss": 0.9407,
      "num_input_tokens_seen": 44511296416,
      "step": 56575
    },
    {
      "epoch": 6.002121790791428,
      "grad_norm": 0.6579710270796109,
      "learning_rate": 2.502154403076824e-05,
      "loss": 0.9045,
      "num_input_tokens_seen": 44512083232,
      "step": 56576
    },
    {
      "epoch": 6.002227880331,
      "grad_norm": 0.7013300537480354,
      "learning_rate": 2.5020849062197582e-05,
      "loss": 0.9958,
      "num_input_tokens_seen": 44512870000,
      "step": 56577
    },
    {
      "epoch": 6.002333969870571,
      "grad_norm": 0.9522573328059122,
      "learning_rate": 2.502015409361081e-05,
      "loss": 0.9791,
      "num_input_tokens_seen": 44513656720,
      "step": 56578
    },
    {
      "epoch": 6.002440059410143,
      "grad_norm": 0.9078634820525803,
      "learning_rate": 2.501945912500847e-05,
      "loss": 1.0627,
      "num_input_tokens_seen": 44514443456,
      "step": 56579
    },
    {
      "epoch": 6.002546148949714,
      "grad_norm": 0.977006715375714,
      "learning_rate": 2.5018764156391084e-05,
      "loss": 0.9905,
      "num_input_tokens_seen": 44515230160,
      "step": 56580
    },
    {
      "epoch": 6.002652238489285,
      "grad_norm": 0.8382919261563525,
      "learning_rate": 2.5018069187759204e-05,
      "loss": 0.9759,
      "num_input_tokens_seen": 44516016944,
      "step": 56581
    },
    {
      "epoch": 6.002758328028857,
      "grad_norm": 1.1667080979179694,
      "learning_rate": 2.501737421911336e-05,
      "loss": 0.9478,
      "num_input_tokens_seen": 44516803664,
      "step": 56582
    },
    {
      "epoch": 6.002864417568428,
      "grad_norm": 0.7128344826003078,
      "learning_rate": 2.5016679250454083e-05,
      "loss": 0.9923,
      "num_input_tokens_seen": 44517590480,
      "step": 56583
    },
    {
      "epoch": 6.0029705071079995,
      "grad_norm": 1.0688978994593776,
      "learning_rate": 2.5015984281781917e-05,
      "loss": 1.0519,
      "num_input_tokens_seen": 44518377248,
      "step": 56584
    },
    {
      "epoch": 6.0030765966475705,
      "grad_norm": 0.7453242315601154,
      "learning_rate": 2.5015289313097405e-05,
      "loss": 1.0281,
      "num_input_tokens_seen": 44519164016,
      "step": 56585
    },
    {
      "epoch": 6.003182686187142,
      "grad_norm": 0.9283228449399064,
      "learning_rate": 2.5014594344401075e-05,
      "loss": 1.0565,
      "num_input_tokens_seen": 44519950816,
      "step": 56586
    },
    {
      "epoch": 6.0032887757267135,
      "grad_norm": 0.7638559124263485,
      "learning_rate": 2.5013899375693473e-05,
      "loss": 0.9951,
      "num_input_tokens_seen": 44520737584,
      "step": 56587
    },
    {
      "epoch": 6.0033948652662845,
      "grad_norm": 0.9714619220033637,
      "learning_rate": 2.5013204406975127e-05,
      "loss": 1.0339,
      "num_input_tokens_seen": 44521524256,
      "step": 56588
    },
    {
      "epoch": 6.003500954805856,
      "grad_norm": 0.7242633661663643,
      "learning_rate": 2.5012509438246573e-05,
      "loss": 0.9872,
      "num_input_tokens_seen": 44522311024,
      "step": 56589
    },
    {
      "epoch": 6.0036070443454275,
      "grad_norm": 0.8182777934796579,
      "learning_rate": 2.5011814469508355e-05,
      "loss": 0.9507,
      "num_input_tokens_seen": 44523097824,
      "step": 56590
    },
    {
      "epoch": 6.0037131338849985,
      "grad_norm": 0.6453881000725479,
      "learning_rate": 2.501111950076101e-05,
      "loss": 0.9546,
      "num_input_tokens_seen": 44523884656,
      "step": 56591
    },
    {
      "epoch": 6.00381922342457,
      "grad_norm": 0.9642245696723609,
      "learning_rate": 2.5010424532005063e-05,
      "loss": 0.9499,
      "num_input_tokens_seen": 44524671440,
      "step": 56592
    },
    {
      "epoch": 6.0039253129641414,
      "grad_norm": 0.8595652612072006,
      "learning_rate": 2.500972956324107e-05,
      "loss": 1.0117,
      "num_input_tokens_seen": 44525458272,
      "step": 56593
    },
    {
      "epoch": 6.004031402503713,
      "grad_norm": 0.920590082220138,
      "learning_rate": 2.5009034594469556e-05,
      "loss": 0.9632,
      "num_input_tokens_seen": 44526245056,
      "step": 56594
    },
    {
      "epoch": 6.004137492043284,
      "grad_norm": 1.0713055313002855,
      "learning_rate": 2.5008339625691054e-05,
      "loss": 0.9562,
      "num_input_tokens_seen": 44527031872,
      "step": 56595
    },
    {
      "epoch": 6.004243581582856,
      "grad_norm": 0.7505277908324745,
      "learning_rate": 2.5007644656906114e-05,
      "loss": 0.9645,
      "num_input_tokens_seen": 44527818672,
      "step": 56596
    },
    {
      "epoch": 6.004349671122427,
      "grad_norm": 1.43972789310347,
      "learning_rate": 2.5006949688115265e-05,
      "loss": 0.9897,
      "num_input_tokens_seen": 44528605408,
      "step": 56597
    },
    {
      "epoch": 6.004455760661998,
      "grad_norm": 0.9594013169161687,
      "learning_rate": 2.5006254719319043e-05,
      "loss": 1.0243,
      "num_input_tokens_seen": 44529392192,
      "step": 56598
    },
    {
      "epoch": 6.00456185020157,
      "grad_norm": 0.9119036944005405,
      "learning_rate": 2.5005559750517993e-05,
      "loss": 0.9074,
      "num_input_tokens_seen": 44530178944,
      "step": 56599
    },
    {
      "epoch": 6.004667939741141,
      "grad_norm": 1.4988833557331682,
      "learning_rate": 2.500486478171264e-05,
      "loss": 0.9538,
      "num_input_tokens_seen": 44530965616,
      "step": 56600
    },
    {
      "epoch": 6.004774029280713,
      "grad_norm": 0.8935692587967631,
      "learning_rate": 2.500416981290353e-05,
      "loss": 1.0277,
      "num_input_tokens_seen": 44531752448,
      "step": 56601
    },
    {
      "epoch": 6.004880118820284,
      "grad_norm": 0.9829637541952273,
      "learning_rate": 2.5003474844091203e-05,
      "loss": 0.9287,
      "num_input_tokens_seen": 44532539264,
      "step": 56602
    },
    {
      "epoch": 6.004986208359855,
      "grad_norm": 1.3764544526021887,
      "learning_rate": 2.5002779875276176e-05,
      "loss": 1.0647,
      "num_input_tokens_seen": 44533325952,
      "step": 56603
    },
    {
      "epoch": 6.005092297899427,
      "grad_norm": 0.7271478515053985,
      "learning_rate": 2.5002084906459016e-05,
      "loss": 0.9794,
      "num_input_tokens_seen": 44534112688,
      "step": 56604
    },
    {
      "epoch": 6.005198387438998,
      "grad_norm": 1.4065543388559638,
      "learning_rate": 2.5001389937640242e-05,
      "loss": 1.0051,
      "num_input_tokens_seen": 44534899472,
      "step": 56605
    },
    {
      "epoch": 6.00530447697857,
      "grad_norm": 1.1900797698908936,
      "learning_rate": 2.5000694968820388e-05,
      "loss": 0.9676,
      "num_input_tokens_seen": 44535686304,
      "step": 56606
    },
    {
      "epoch": 6.005410566518141,
      "grad_norm": 0.9791519905492855,
      "learning_rate": 2.5e-05,
      "loss": 0.9911,
      "num_input_tokens_seen": 44536472992,
      "step": 56607
    },
    {
      "epoch": 6.005516656057713,
      "grad_norm": 0.9535541608433149,
      "learning_rate": 2.4999305031179618e-05,
      "loss": 0.9834,
      "num_input_tokens_seen": 44537259872,
      "step": 56608
    },
    {
      "epoch": 6.005622745597284,
      "grad_norm": 0.6516446854008517,
      "learning_rate": 2.4998610062359764e-05,
      "loss": 0.9752,
      "num_input_tokens_seen": 44538046672,
      "step": 56609
    },
    {
      "epoch": 6.005728835136855,
      "grad_norm": 0.9063517832366113,
      "learning_rate": 2.4997915093540987e-05,
      "loss": 1.0332,
      "num_input_tokens_seen": 44538833520,
      "step": 56610
    },
    {
      "epoch": 6.005834924676427,
      "grad_norm": 0.8353974363012792,
      "learning_rate": 2.4997220124723826e-05,
      "loss": 0.9414,
      "num_input_tokens_seen": 44539620304,
      "step": 56611
    },
    {
      "epoch": 6.005941014215998,
      "grad_norm": 0.7507728740451601,
      "learning_rate": 2.4996525155908806e-05,
      "loss": 0.881,
      "num_input_tokens_seen": 44540407120,
      "step": 56612
    },
    {
      "epoch": 6.00604710375557,
      "grad_norm": 1.039352633290837,
      "learning_rate": 2.4995830187096474e-05,
      "loss": 1.014,
      "num_input_tokens_seen": 44541193920,
      "step": 56613
    },
    {
      "epoch": 6.006153193295141,
      "grad_norm": 0.7250600575199053,
      "learning_rate": 2.499513521828737e-05,
      "loss": 1.0622,
      "num_input_tokens_seen": 44541980784,
      "step": 56614
    },
    {
      "epoch": 6.006259282834712,
      "grad_norm": 0.9231596829512358,
      "learning_rate": 2.4994440249482017e-05,
      "loss": 0.9914,
      "num_input_tokens_seen": 44542767504,
      "step": 56615
    },
    {
      "epoch": 6.006365372374284,
      "grad_norm": 0.6712153072966174,
      "learning_rate": 2.4993745280680963e-05,
      "loss": 0.9854,
      "num_input_tokens_seen": 44543554272,
      "step": 56616
    },
    {
      "epoch": 6.006471461913855,
      "grad_norm": 1.0958007701566446,
      "learning_rate": 2.4993050311884737e-05,
      "loss": 0.9676,
      "num_input_tokens_seen": 44544341056,
      "step": 56617
    },
    {
      "epoch": 6.006577551453427,
      "grad_norm": 0.7481384922390651,
      "learning_rate": 2.4992355343093892e-05,
      "loss": 0.9625,
      "num_input_tokens_seen": 44545127824,
      "step": 56618
    },
    {
      "epoch": 6.006683640992998,
      "grad_norm": 0.9264191537584636,
      "learning_rate": 2.4991660374308952e-05,
      "loss": 0.965,
      "num_input_tokens_seen": 44545914576,
      "step": 56619
    },
    {
      "epoch": 6.00678973053257,
      "grad_norm": 0.8421463310694104,
      "learning_rate": 2.499096540553045e-05,
      "loss": 0.9084,
      "num_input_tokens_seen": 44546701264,
      "step": 56620
    },
    {
      "epoch": 6.006895820072141,
      "grad_norm": 0.7264032335685694,
      "learning_rate": 2.4990270436758937e-05,
      "loss": 1.0188,
      "num_input_tokens_seen": 44547488000,
      "step": 56621
    },
    {
      "epoch": 6.007001909611712,
      "grad_norm": 0.9373003060626782,
      "learning_rate": 2.498957546799494e-05,
      "loss": 1.0037,
      "num_input_tokens_seen": 44548274816,
      "step": 56622
    },
    {
      "epoch": 6.007107999151284,
      "grad_norm": 0.9037627524473302,
      "learning_rate": 2.4988880499239e-05,
      "loss": 1.0122,
      "num_input_tokens_seen": 44549061600,
      "step": 56623
    },
    {
      "epoch": 6.007214088690855,
      "grad_norm": 0.7108651479791299,
      "learning_rate": 2.498818553049165e-05,
      "loss": 0.9533,
      "num_input_tokens_seen": 44549848304,
      "step": 56624
    },
    {
      "epoch": 6.007320178230427,
      "grad_norm": 0.9625715982087213,
      "learning_rate": 2.4987490561753433e-05,
      "loss": 0.9112,
      "num_input_tokens_seen": 44550635168,
      "step": 56625
    },
    {
      "epoch": 6.007426267769998,
      "grad_norm": 0.899489346512321,
      "learning_rate": 2.4986795593024882e-05,
      "loss": 0.9873,
      "num_input_tokens_seen": 44551421840,
      "step": 56626
    },
    {
      "epoch": 6.007532357309569,
      "grad_norm": 0.7637353232957615,
      "learning_rate": 2.4986100624306533e-05,
      "loss": 0.9249,
      "num_input_tokens_seen": 44552208672,
      "step": 56627
    },
    {
      "epoch": 6.007638446849141,
      "grad_norm": 1.1199396680363567,
      "learning_rate": 2.4985405655598927e-05,
      "loss": 1.0368,
      "num_input_tokens_seen": 44552995344,
      "step": 56628
    },
    {
      "epoch": 6.007744536388712,
      "grad_norm": 0.7261107897487574,
      "learning_rate": 2.4984710686902597e-05,
      "loss": 0.9222,
      "num_input_tokens_seen": 44553782048,
      "step": 56629
    },
    {
      "epoch": 6.007850625928284,
      "grad_norm": 0.6503898895518729,
      "learning_rate": 2.498401571821809e-05,
      "loss": 1.0102,
      "num_input_tokens_seen": 44554568800,
      "step": 56630
    },
    {
      "epoch": 6.007956715467855,
      "grad_norm": 0.7699968344661796,
      "learning_rate": 2.4983320749545926e-05,
      "loss": 0.9717,
      "num_input_tokens_seen": 44555355568,
      "step": 56631
    },
    {
      "epoch": 6.008062805007426,
      "grad_norm": 0.6692367735798234,
      "learning_rate": 2.4982625780886652e-05,
      "loss": 0.8608,
      "num_input_tokens_seen": 44556142352,
      "step": 56632
    },
    {
      "epoch": 6.008168894546998,
      "grad_norm": 0.7233822428166078,
      "learning_rate": 2.498193081224081e-05,
      "loss": 1.0414,
      "num_input_tokens_seen": 44556929136,
      "step": 56633
    },
    {
      "epoch": 6.008274984086569,
      "grad_norm": 0.7432912240085617,
      "learning_rate": 2.498123584360892e-05,
      "loss": 0.984,
      "num_input_tokens_seen": 44557715904,
      "step": 56634
    },
    {
      "epoch": 6.008381073626141,
      "grad_norm": 0.7956870626591483,
      "learning_rate": 2.498054087499154e-05,
      "loss": 0.9731,
      "num_input_tokens_seen": 44558502736,
      "step": 56635
    },
    {
      "epoch": 6.008487163165712,
      "grad_norm": 0.7264083533962226,
      "learning_rate": 2.49798459063892e-05,
      "loss": 0.9204,
      "num_input_tokens_seen": 44559289664,
      "step": 56636
    },
    {
      "epoch": 6.008593252705284,
      "grad_norm": 0.761030336860098,
      "learning_rate": 2.4979150937802427e-05,
      "loss": 1.0025,
      "num_input_tokens_seen": 44560076416,
      "step": 56637
    },
    {
      "epoch": 6.008699342244855,
      "grad_norm": 1.0509438900600268,
      "learning_rate": 2.4978455969231766e-05,
      "loss": 1.0458,
      "num_input_tokens_seen": 44560863104,
      "step": 56638
    },
    {
      "epoch": 6.008805431784426,
      "grad_norm": 0.9315792880032657,
      "learning_rate": 2.4977761000677762e-05,
      "loss": 1.0192,
      "num_input_tokens_seen": 44561649872,
      "step": 56639
    },
    {
      "epoch": 6.008911521323998,
      "grad_norm": 0.9426906093417807,
      "learning_rate": 2.4977066032140935e-05,
      "loss": 0.9853,
      "num_input_tokens_seen": 44562436656,
      "step": 56640
    },
    {
      "epoch": 6.009017610863569,
      "grad_norm": 0.829650130266472,
      "learning_rate": 2.4976371063621835e-05,
      "loss": 1.0285,
      "num_input_tokens_seen": 44563223376,
      "step": 56641
    },
    {
      "epoch": 6.009123700403141,
      "grad_norm": 0.8564600540434616,
      "learning_rate": 2.4975676095120993e-05,
      "loss": 1.0952,
      "num_input_tokens_seen": 44564010128,
      "step": 56642
    },
    {
      "epoch": 6.009229789942712,
      "grad_norm": 0.7954336662352832,
      "learning_rate": 2.4974981126638946e-05,
      "loss": 0.981,
      "num_input_tokens_seen": 44564796880,
      "step": 56643
    },
    {
      "epoch": 6.009335879482283,
      "grad_norm": 0.8205129192507444,
      "learning_rate": 2.4974286158176234e-05,
      "loss": 0.9922,
      "num_input_tokens_seen": 44565583584,
      "step": 56644
    },
    {
      "epoch": 6.009441969021855,
      "grad_norm": 0.8993127927836592,
      "learning_rate": 2.4973591189733398e-05,
      "loss": 1.0518,
      "num_input_tokens_seen": 44566370352,
      "step": 56645
    },
    {
      "epoch": 6.009548058561426,
      "grad_norm": 0.8505686890268809,
      "learning_rate": 2.497289622131096e-05,
      "loss": 0.9621,
      "num_input_tokens_seen": 44567157136,
      "step": 56646
    },
    {
      "epoch": 6.0096541481009975,
      "grad_norm": 0.9554782128993137,
      "learning_rate": 2.4972201252909476e-05,
      "loss": 1.0571,
      "num_input_tokens_seen": 44567943808,
      "step": 56647
    },
    {
      "epoch": 6.0097602376405685,
      "grad_norm": 0.8637773537683064,
      "learning_rate": 2.497150628452947e-05,
      "loss": 0.9842,
      "num_input_tokens_seen": 44568730528,
      "step": 56648
    },
    {
      "epoch": 6.0098663271801405,
      "grad_norm": 0.9701374683680494,
      "learning_rate": 2.497081131617148e-05,
      "loss": 0.8965,
      "num_input_tokens_seen": 44569517312,
      "step": 56649
    },
    {
      "epoch": 6.0099724167197115,
      "grad_norm": 1.0762886704518602,
      "learning_rate": 2.4970116347836056e-05,
      "loss": 1.0888,
      "num_input_tokens_seen": 44570304080,
      "step": 56650
    },
    {
      "epoch": 6.0100785062592825,
      "grad_norm": 0.9055655045249945,
      "learning_rate": 2.4969421379523716e-05,
      "loss": 1.0205,
      "num_input_tokens_seen": 44571090848,
      "step": 56651
    },
    {
      "epoch": 6.0101845957988544,
      "grad_norm": 0.6661150118518531,
      "learning_rate": 2.496872641123501e-05,
      "loss": 0.9735,
      "num_input_tokens_seen": 44571877520,
      "step": 56652
    },
    {
      "epoch": 6.0102906853384255,
      "grad_norm": 0.8398745613072957,
      "learning_rate": 2.4968031442970473e-05,
      "loss": 1.0486,
      "num_input_tokens_seen": 44572664256,
      "step": 56653
    },
    {
      "epoch": 6.010396774877997,
      "grad_norm": 0.7029358259763181,
      "learning_rate": 2.4967336474730636e-05,
      "loss": 0.9306,
      "num_input_tokens_seen": 44573451056,
      "step": 56654
    },
    {
      "epoch": 6.010502864417568,
      "grad_norm": 0.6821186092875404,
      "learning_rate": 2.4966641506516034e-05,
      "loss": 1.0327,
      "num_input_tokens_seen": 44574237840,
      "step": 56655
    },
    {
      "epoch": 6.0106089539571395,
      "grad_norm": 0.8249449335709285,
      "learning_rate": 2.496594653832722e-05,
      "loss": 0.9973,
      "num_input_tokens_seen": 44575024608,
      "step": 56656
    },
    {
      "epoch": 6.010715043496711,
      "grad_norm": 0.8829677836064241,
      "learning_rate": 2.4965251570164723e-05,
      "loss": 1.0017,
      "num_input_tokens_seen": 44575811392,
      "step": 56657
    },
    {
      "epoch": 6.010821133036282,
      "grad_norm": 0.8174040154033375,
      "learning_rate": 2.4964556602029075e-05,
      "loss": 0.9726,
      "num_input_tokens_seen": 44576598272,
      "step": 56658
    },
    {
      "epoch": 6.010927222575854,
      "grad_norm": 0.8518545831382197,
      "learning_rate": 2.496386163392082e-05,
      "loss": 0.9649,
      "num_input_tokens_seen": 44577385120,
      "step": 56659
    },
    {
      "epoch": 6.011033312115425,
      "grad_norm": 1.111892469223056,
      "learning_rate": 2.496316666584049e-05,
      "loss": 1.0583,
      "num_input_tokens_seen": 44578171888,
      "step": 56660
    },
    {
      "epoch": 6.011139401654996,
      "grad_norm": 0.7592178380124875,
      "learning_rate": 2.496247169778862e-05,
      "loss": 1.0007,
      "num_input_tokens_seen": 44578958736,
      "step": 56661
    },
    {
      "epoch": 6.011245491194568,
      "grad_norm": 0.7504618369200043,
      "learning_rate": 2.4961776729765755e-05,
      "loss": 0.961,
      "num_input_tokens_seen": 44579745520,
      "step": 56662
    },
    {
      "epoch": 6.011351580734139,
      "grad_norm": 0.6841888614781609,
      "learning_rate": 2.496108176177243e-05,
      "loss": 0.9515,
      "num_input_tokens_seen": 44580532240,
      "step": 56663
    },
    {
      "epoch": 6.011457670273711,
      "grad_norm": 1.165100148395793,
      "learning_rate": 2.4960386793809172e-05,
      "loss": 0.9443,
      "num_input_tokens_seen": 44581318832,
      "step": 56664
    },
    {
      "epoch": 6.011563759813282,
      "grad_norm": 0.7826786464782516,
      "learning_rate": 2.4959691825876534e-05,
      "loss": 0.9937,
      "num_input_tokens_seen": 44582105568,
      "step": 56665
    },
    {
      "epoch": 6.011669849352854,
      "grad_norm": 1.0378370666827512,
      "learning_rate": 2.4958996857975043e-05,
      "loss": 1.0154,
      "num_input_tokens_seen": 44582892416,
      "step": 56666
    },
    {
      "epoch": 6.011775938892425,
      "grad_norm": 0.937882932923575,
      "learning_rate": 2.495830189010523e-05,
      "loss": 1.0333,
      "num_input_tokens_seen": 44583679216,
      "step": 56667
    },
    {
      "epoch": 6.011882028431996,
      "grad_norm": 0.7361851002585107,
      "learning_rate": 2.495760692226765e-05,
      "loss": 1.0054,
      "num_input_tokens_seen": 44584465888,
      "step": 56668
    },
    {
      "epoch": 6.011988117971568,
      "grad_norm": 1.023764558808379,
      "learning_rate": 2.495691195446283e-05,
      "loss": 0.9164,
      "num_input_tokens_seen": 44585252656,
      "step": 56669
    },
    {
      "epoch": 6.012094207511139,
      "grad_norm": 1.388767714234519,
      "learning_rate": 2.49562169866913e-05,
      "loss": 1.0131,
      "num_input_tokens_seen": 44586039408,
      "step": 56670
    },
    {
      "epoch": 6.012200297050711,
      "grad_norm": 0.8167123838018572,
      "learning_rate": 2.4955522018953608e-05,
      "loss": 0.9203,
      "num_input_tokens_seen": 44586826208,
      "step": 56671
    },
    {
      "epoch": 6.012306386590282,
      "grad_norm": 1.877325258167237,
      "learning_rate": 2.4954827051250285e-05,
      "loss": 0.9765,
      "num_input_tokens_seen": 44587612976,
      "step": 56672
    },
    {
      "epoch": 6.012412476129853,
      "grad_norm": 1.621333613271642,
      "learning_rate": 2.4954132083581874e-05,
      "loss": 0.991,
      "num_input_tokens_seen": 44588399712,
      "step": 56673
    },
    {
      "epoch": 6.012518565669425,
      "grad_norm": 0.8942124688138713,
      "learning_rate": 2.495343711594891e-05,
      "loss": 0.9832,
      "num_input_tokens_seen": 44589186528,
      "step": 56674
    },
    {
      "epoch": 6.012624655208996,
      "grad_norm": 1.0674850965194862,
      "learning_rate": 2.495274214835192e-05,
      "loss": 0.9711,
      "num_input_tokens_seen": 44589973232,
      "step": 56675
    },
    {
      "epoch": 6.012730744748568,
      "grad_norm": 1.433599991575953,
      "learning_rate": 2.495204718079146e-05,
      "loss": 0.9862,
      "num_input_tokens_seen": 44590760096,
      "step": 56676
    },
    {
      "epoch": 6.012836834288139,
      "grad_norm": 1.2329406893280925,
      "learning_rate": 2.4951352213268054e-05,
      "loss": 0.9362,
      "num_input_tokens_seen": 44591546928,
      "step": 56677
    },
    {
      "epoch": 6.012942923827711,
      "grad_norm": 0.8555879252571689,
      "learning_rate": 2.4950657245782233e-05,
      "loss": 0.9406,
      "num_input_tokens_seen": 44592333792,
      "step": 56678
    },
    {
      "epoch": 6.013049013367282,
      "grad_norm": 1.370199746173724,
      "learning_rate": 2.494996227833455e-05,
      "loss": 0.9222,
      "num_input_tokens_seen": 44593120624,
      "step": 56679
    },
    {
      "epoch": 6.013155102906853,
      "grad_norm": 1.1446473206767507,
      "learning_rate": 2.4949267310925535e-05,
      "loss": 0.9917,
      "num_input_tokens_seen": 44593907392,
      "step": 56680
    },
    {
      "epoch": 6.013261192446425,
      "grad_norm": 0.9879137339310567,
      "learning_rate": 2.494857234355572e-05,
      "loss": 0.9754,
      "num_input_tokens_seen": 44594694096,
      "step": 56681
    },
    {
      "epoch": 6.013367281985996,
      "grad_norm": 1.004177403732596,
      "learning_rate": 2.4947877376225654e-05,
      "loss": 1.0078,
      "num_input_tokens_seen": 44595480784,
      "step": 56682
    },
    {
      "epoch": 6.013473371525568,
      "grad_norm": 0.9357504381369022,
      "learning_rate": 2.4947182408935867e-05,
      "loss": 1.0194,
      "num_input_tokens_seen": 44596267472,
      "step": 56683
    },
    {
      "epoch": 6.013579461065139,
      "grad_norm": 0.7308217093819429,
      "learning_rate": 2.4946487441686886e-05,
      "loss": 0.8924,
      "num_input_tokens_seen": 44597054256,
      "step": 56684
    },
    {
      "epoch": 6.01368555060471,
      "grad_norm": 1.0756046504741559,
      "learning_rate": 2.4945792474479267e-05,
      "loss": 1.0068,
      "num_input_tokens_seen": 44597841024,
      "step": 56685
    },
    {
      "epoch": 6.013791640144282,
      "grad_norm": 0.910560166258676,
      "learning_rate": 2.494509750731353e-05,
      "loss": 0.9287,
      "num_input_tokens_seen": 44598627840,
      "step": 56686
    },
    {
      "epoch": 6.013897729683853,
      "grad_norm": 1.2350641286669046,
      "learning_rate": 2.4944402540190227e-05,
      "loss": 1.0135,
      "num_input_tokens_seen": 44599414576,
      "step": 56687
    },
    {
      "epoch": 6.014003819223425,
      "grad_norm": 1.2968383379548374,
      "learning_rate": 2.4943707573109887e-05,
      "loss": 1.0713,
      "num_input_tokens_seen": 44600201312,
      "step": 56688
    },
    {
      "epoch": 6.014109908762996,
      "grad_norm": 0.9311880640776395,
      "learning_rate": 2.4943012606073044e-05,
      "loss": 0.8726,
      "num_input_tokens_seen": 44600988064,
      "step": 56689
    },
    {
      "epoch": 6.014215998302568,
      "grad_norm": 1.0293983796037243,
      "learning_rate": 2.4942317639080243e-05,
      "loss": 1.0171,
      "num_input_tokens_seen": 44601774912,
      "step": 56690
    },
    {
      "epoch": 6.014322087842139,
      "grad_norm": 1.0584377654870194,
      "learning_rate": 2.494162267213202e-05,
      "loss": 0.964,
      "num_input_tokens_seen": 44602561696,
      "step": 56691
    },
    {
      "epoch": 6.01442817738171,
      "grad_norm": 0.8187550189988855,
      "learning_rate": 2.49409277052289e-05,
      "loss": 1.0322,
      "num_input_tokens_seen": 44603348448,
      "step": 56692
    },
    {
      "epoch": 6.014534266921282,
      "grad_norm": 0.8304349876287911,
      "learning_rate": 2.4940232738371437e-05,
      "loss": 0.8655,
      "num_input_tokens_seen": 44604135264,
      "step": 56693
    },
    {
      "epoch": 6.014640356460853,
      "grad_norm": 0.8100853519276975,
      "learning_rate": 2.4939537771560162e-05,
      "loss": 0.9448,
      "num_input_tokens_seen": 44604921968,
      "step": 56694
    },
    {
      "epoch": 6.014746446000425,
      "grad_norm": 0.8636155086369038,
      "learning_rate": 2.4938842804795603e-05,
      "loss": 0.9842,
      "num_input_tokens_seen": 44605708752,
      "step": 56695
    },
    {
      "epoch": 6.014852535539996,
      "grad_norm": 0.8762242223546937,
      "learning_rate": 2.493814783807831e-05,
      "loss": 0.9925,
      "num_input_tokens_seen": 44606495520,
      "step": 56696
    },
    {
      "epoch": 6.014958625079567,
      "grad_norm": 0.6315379781821595,
      "learning_rate": 2.4937452871408816e-05,
      "loss": 0.9142,
      "num_input_tokens_seen": 44607282368,
      "step": 56697
    },
    {
      "epoch": 6.015064714619139,
      "grad_norm": 0.8471532022768408,
      "learning_rate": 2.4936757904787645e-05,
      "loss": 0.9807,
      "num_input_tokens_seen": 44608069152,
      "step": 56698
    },
    {
      "epoch": 6.01517080415871,
      "grad_norm": 0.7404635540396105,
      "learning_rate": 2.493606293821536e-05,
      "loss": 0.9327,
      "num_input_tokens_seen": 44608855968,
      "step": 56699
    },
    {
      "epoch": 6.015276893698282,
      "grad_norm": 0.6687639255976249,
      "learning_rate": 2.493536797169248e-05,
      "loss": 0.9791,
      "num_input_tokens_seen": 44609642768,
      "step": 56700
    },
    {
      "epoch": 6.015382983237853,
      "grad_norm": 0.7920530220792874,
      "learning_rate": 2.493467300521954e-05,
      "loss": 0.9685,
      "num_input_tokens_seen": 44610429600,
      "step": 56701
    },
    {
      "epoch": 6.015489072777424,
      "grad_norm": 0.6551398822007412,
      "learning_rate": 2.4933978038797086e-05,
      "loss": 1.0082,
      "num_input_tokens_seen": 44611216416,
      "step": 56702
    },
    {
      "epoch": 6.015595162316996,
      "grad_norm": 0.8631203311704173,
      "learning_rate": 2.493328307242565e-05,
      "loss": 1.0226,
      "num_input_tokens_seen": 44612003184,
      "step": 56703
    },
    {
      "epoch": 6.015701251856567,
      "grad_norm": 0.7278648559190893,
      "learning_rate": 2.4932588106105774e-05,
      "loss": 1.0141,
      "num_input_tokens_seen": 44612789920,
      "step": 56704
    },
    {
      "epoch": 6.015807341396139,
      "grad_norm": 0.6562621745243922,
      "learning_rate": 2.4931893139837996e-05,
      "loss": 0.9321,
      "num_input_tokens_seen": 44613576576,
      "step": 56705
    },
    {
      "epoch": 6.01591343093571,
      "grad_norm": 0.6918716692049521,
      "learning_rate": 2.493119817362284e-05,
      "loss": 0.9424,
      "num_input_tokens_seen": 44614363408,
      "step": 56706
    },
    {
      "epoch": 6.0160195204752815,
      "grad_norm": 0.7094880834334983,
      "learning_rate": 2.4930503207460855e-05,
      "loss": 1.0275,
      "num_input_tokens_seen": 44615150128,
      "step": 56707
    },
    {
      "epoch": 6.016125610014853,
      "grad_norm": 0.7177836744349226,
      "learning_rate": 2.4929808241352577e-05,
      "loss": 0.945,
      "num_input_tokens_seen": 44615936864,
      "step": 56708
    },
    {
      "epoch": 6.016231699554424,
      "grad_norm": 0.8739140383729214,
      "learning_rate": 2.492911327529854e-05,
      "loss": 0.9764,
      "num_input_tokens_seen": 44616723664,
      "step": 56709
    },
    {
      "epoch": 6.0163377890939955,
      "grad_norm": 0.7437827280987659,
      "learning_rate": 2.492841830929928e-05,
      "loss": 1.0694,
      "num_input_tokens_seen": 44617510384,
      "step": 56710
    },
    {
      "epoch": 6.0164438786335666,
      "grad_norm": 0.7552293689914026,
      "learning_rate": 2.492772334335534e-05,
      "loss": 1.0882,
      "num_input_tokens_seen": 44618297104,
      "step": 56711
    },
    {
      "epoch": 6.0165499681731385,
      "grad_norm": 0.8111126919983264,
      "learning_rate": 2.492702837746725e-05,
      "loss": 1.0132,
      "num_input_tokens_seen": 44619083776,
      "step": 56712
    },
    {
      "epoch": 6.0166560577127095,
      "grad_norm": 0.7477142133438832,
      "learning_rate": 2.4926333411635555e-05,
      "loss": 1.0352,
      "num_input_tokens_seen": 44619870560,
      "step": 56713
    },
    {
      "epoch": 6.0167621472522805,
      "grad_norm": 0.8484843877413568,
      "learning_rate": 2.4925638445860784e-05,
      "loss": 1.0672,
      "num_input_tokens_seen": 44620657232,
      "step": 56714
    },
    {
      "epoch": 6.0168682367918525,
      "grad_norm": 0.7155582908023168,
      "learning_rate": 2.4924943480143476e-05,
      "loss": 0.9482,
      "num_input_tokens_seen": 44621443936,
      "step": 56715
    },
    {
      "epoch": 6.0169743263314235,
      "grad_norm": 0.7652146767848422,
      "learning_rate": 2.4924248514484176e-05,
      "loss": 0.9813,
      "num_input_tokens_seen": 44622230736,
      "step": 56716
    },
    {
      "epoch": 6.017080415870995,
      "grad_norm": 0.7277482697188908,
      "learning_rate": 2.492355354888341e-05,
      "loss": 0.958,
      "num_input_tokens_seen": 44623017568,
      "step": 56717
    },
    {
      "epoch": 6.017186505410566,
      "grad_norm": 0.7726535933884159,
      "learning_rate": 2.4922858583341714e-05,
      "loss": 0.9946,
      "num_input_tokens_seen": 44623804352,
      "step": 56718
    },
    {
      "epoch": 6.017292594950138,
      "grad_norm": 0.7155207488211721,
      "learning_rate": 2.492216361785964e-05,
      "loss": 0.9278,
      "num_input_tokens_seen": 44624591008,
      "step": 56719
    },
    {
      "epoch": 6.017398684489709,
      "grad_norm": 0.7305421854573645,
      "learning_rate": 2.4921468652437706e-05,
      "loss": 1.0283,
      "num_input_tokens_seen": 44625377776,
      "step": 56720
    },
    {
      "epoch": 6.01750477402928,
      "grad_norm": 0.6046801701523863,
      "learning_rate": 2.4920773687076467e-05,
      "loss": 0.936,
      "num_input_tokens_seen": 44626164544,
      "step": 56721
    },
    {
      "epoch": 6.017610863568852,
      "grad_norm": 0.847648883158904,
      "learning_rate": 2.492007872177645e-05,
      "loss": 1.0714,
      "num_input_tokens_seen": 44626951280,
      "step": 56722
    },
    {
      "epoch": 6.017716953108423,
      "grad_norm": 0.6878745223671241,
      "learning_rate": 2.491938375653819e-05,
      "loss": 0.9584,
      "num_input_tokens_seen": 44627738080,
      "step": 56723
    },
    {
      "epoch": 6.017823042647995,
      "grad_norm": 0.8115010350529711,
      "learning_rate": 2.4918688791362235e-05,
      "loss": 0.9751,
      "num_input_tokens_seen": 44628524768,
      "step": 56724
    },
    {
      "epoch": 6.017929132187566,
      "grad_norm": 0.6650373231022162,
      "learning_rate": 2.4917993826249115e-05,
      "loss": 0.9691,
      "num_input_tokens_seen": 44629311472,
      "step": 56725
    },
    {
      "epoch": 6.018035221727137,
      "grad_norm": 0.6881137029548468,
      "learning_rate": 2.491729886119936e-05,
      "loss": 0.9166,
      "num_input_tokens_seen": 44630098272,
      "step": 56726
    },
    {
      "epoch": 6.018141311266709,
      "grad_norm": 0.9110747710267634,
      "learning_rate": 2.4916603896213516e-05,
      "loss": 1.0177,
      "num_input_tokens_seen": 44630885072,
      "step": 56727
    },
    {
      "epoch": 6.01824740080628,
      "grad_norm": 0.7251245677366517,
      "learning_rate": 2.4915908931292124e-05,
      "loss": 1.0254,
      "num_input_tokens_seen": 44631671824,
      "step": 56728
    },
    {
      "epoch": 6.018353490345852,
      "grad_norm": 0.7709663053909653,
      "learning_rate": 2.4915213966435706e-05,
      "loss": 0.9143,
      "num_input_tokens_seen": 44632458576,
      "step": 56729
    },
    {
      "epoch": 6.018459579885423,
      "grad_norm": 0.905374014056539,
      "learning_rate": 2.491451900164481e-05,
      "loss": 0.972,
      "num_input_tokens_seen": 44633245328,
      "step": 56730
    },
    {
      "epoch": 6.018565669424994,
      "grad_norm": 0.7877376183408095,
      "learning_rate": 2.491382403691998e-05,
      "loss": 0.9002,
      "num_input_tokens_seen": 44634032016,
      "step": 56731
    },
    {
      "epoch": 6.018671758964566,
      "grad_norm": 0.8323908330510544,
      "learning_rate": 2.4913129072261732e-05,
      "loss": 0.9614,
      "num_input_tokens_seen": 44634818864,
      "step": 56732
    },
    {
      "epoch": 6.018777848504137,
      "grad_norm": 0.8488143148607683,
      "learning_rate": 2.4912434107670622e-05,
      "loss": 0.9909,
      "num_input_tokens_seen": 44635605680,
      "step": 56733
    },
    {
      "epoch": 6.018883938043709,
      "grad_norm": 0.936103032319419,
      "learning_rate": 2.491173914314718e-05,
      "loss": 0.964,
      "num_input_tokens_seen": 44636392368,
      "step": 56734
    },
    {
      "epoch": 6.01899002758328,
      "grad_norm": 0.895516156921338,
      "learning_rate": 2.491104417869194e-05,
      "loss": 0.941,
      "num_input_tokens_seen": 44637179104,
      "step": 56735
    },
    {
      "epoch": 6.019096117122852,
      "grad_norm": 0.820916442980999,
      "learning_rate": 2.4910349214305446e-05,
      "loss": 0.9957,
      "num_input_tokens_seen": 44637965808,
      "step": 56736
    },
    {
      "epoch": 6.019202206662423,
      "grad_norm": 0.8907037176085321,
      "learning_rate": 2.490965424998823e-05,
      "loss": 0.9693,
      "num_input_tokens_seen": 44638752528,
      "step": 56737
    },
    {
      "epoch": 6.019308296201994,
      "grad_norm": 0.7293723559511714,
      "learning_rate": 2.490895928574083e-05,
      "loss": 0.9631,
      "num_input_tokens_seen": 44639539248,
      "step": 56738
    },
    {
      "epoch": 6.019414385741566,
      "grad_norm": 0.9713752154880779,
      "learning_rate": 2.490826432156379e-05,
      "loss": 0.9551,
      "num_input_tokens_seen": 44640326016,
      "step": 56739
    },
    {
      "epoch": 6.019520475281137,
      "grad_norm": 0.6788242594993458,
      "learning_rate": 2.490756935745763e-05,
      "loss": 0.9906,
      "num_input_tokens_seen": 44641112768,
      "step": 56740
    },
    {
      "epoch": 6.019626564820709,
      "grad_norm": 0.9042633093931249,
      "learning_rate": 2.4906874393422907e-05,
      "loss": 1.0136,
      "num_input_tokens_seen": 44641899504,
      "step": 56741
    },
    {
      "epoch": 6.01973265436028,
      "grad_norm": 1.3184899216052142,
      "learning_rate": 2.4906179429460146e-05,
      "loss": 0.953,
      "num_input_tokens_seen": 44642686368,
      "step": 56742
    },
    {
      "epoch": 6.019838743899851,
      "grad_norm": 0.9481803954562233,
      "learning_rate": 2.4905484465569884e-05,
      "loss": 1.0148,
      "num_input_tokens_seen": 44643473136,
      "step": 56743
    },
    {
      "epoch": 6.019944833439423,
      "grad_norm": 0.683763547619582,
      "learning_rate": 2.490478950175266e-05,
      "loss": 1.0075,
      "num_input_tokens_seen": 44644259792,
      "step": 56744
    },
    {
      "epoch": 6.020050922978994,
      "grad_norm": 0.6547810319469827,
      "learning_rate": 2.4904094538009017e-05,
      "loss": 0.9485,
      "num_input_tokens_seen": 44645046560,
      "step": 56745
    },
    {
      "epoch": 6.020157012518566,
      "grad_norm": 0.6438569844319204,
      "learning_rate": 2.4903399574339482e-05,
      "loss": 1.0005,
      "num_input_tokens_seen": 44645833408,
      "step": 56746
    },
    {
      "epoch": 6.020263102058137,
      "grad_norm": 1.0264604807028626,
      "learning_rate": 2.49027046107446e-05,
      "loss": 1.0513,
      "num_input_tokens_seen": 44646620192,
      "step": 56747
    },
    {
      "epoch": 6.020369191597709,
      "grad_norm": 0.8100013898033577,
      "learning_rate": 2.490200964722491e-05,
      "loss": 0.979,
      "num_input_tokens_seen": 44647406928,
      "step": 56748
    },
    {
      "epoch": 6.02047528113728,
      "grad_norm": 1.2640954364633943,
      "learning_rate": 2.4901314683780933e-05,
      "loss": 1.0491,
      "num_input_tokens_seen": 44648193664,
      "step": 56749
    },
    {
      "epoch": 6.020581370676851,
      "grad_norm": 0.8993000815371975,
      "learning_rate": 2.4900619720413213e-05,
      "loss": 0.981,
      "num_input_tokens_seen": 44648980416,
      "step": 56750
    },
    {
      "epoch": 6.020687460216423,
      "grad_norm": 1.6454563192995937,
      "learning_rate": 2.48999247571223e-05,
      "loss": 0.9936,
      "num_input_tokens_seen": 44649767216,
      "step": 56751
    },
    {
      "epoch": 6.020793549755994,
      "grad_norm": 1.6551412491545627,
      "learning_rate": 2.4899229793908728e-05,
      "loss": 1.0079,
      "num_input_tokens_seen": 44650553920,
      "step": 56752
    },
    {
      "epoch": 6.020899639295566,
      "grad_norm": 0.8843923393016679,
      "learning_rate": 2.489853483077302e-05,
      "loss": 0.9619,
      "num_input_tokens_seen": 44651340672,
      "step": 56753
    },
    {
      "epoch": 6.021005728835137,
      "grad_norm": 1.1472296924649543,
      "learning_rate": 2.4897839867715724e-05,
      "loss": 0.9433,
      "num_input_tokens_seen": 44652127488,
      "step": 56754
    },
    {
      "epoch": 6.021111818374708,
      "grad_norm": 1.1858384345174109,
      "learning_rate": 2.4897144904737378e-05,
      "loss": 0.9812,
      "num_input_tokens_seen": 44652914288,
      "step": 56755
    },
    {
      "epoch": 6.02121790791428,
      "grad_norm": 0.8203473609207288,
      "learning_rate": 2.489644994183851e-05,
      "loss": 0.9523,
      "num_input_tokens_seen": 44653701072,
      "step": 56756
    },
    {
      "epoch": 6.021323997453851,
      "grad_norm": 0.9818398602950289,
      "learning_rate": 2.4895754979019668e-05,
      "loss": 0.9211,
      "num_input_tokens_seen": 44654487856,
      "step": 56757
    },
    {
      "epoch": 6.021430086993423,
      "grad_norm": 0.8249906638581139,
      "learning_rate": 2.4895060016281375e-05,
      "loss": 0.9534,
      "num_input_tokens_seen": 44655274560,
      "step": 56758
    },
    {
      "epoch": 6.021536176532994,
      "grad_norm": 0.9122948509663074,
      "learning_rate": 2.4894365053624183e-05,
      "loss": 1.0759,
      "num_input_tokens_seen": 44656061248,
      "step": 56759
    },
    {
      "epoch": 6.021642266072565,
      "grad_norm": 0.7626266604314443,
      "learning_rate": 2.4893670091048625e-05,
      "loss": 1.0089,
      "num_input_tokens_seen": 44656847920,
      "step": 56760
    },
    {
      "epoch": 6.021748355612137,
      "grad_norm": 0.8508343338849584,
      "learning_rate": 2.4892975128555226e-05,
      "loss": 0.9455,
      "num_input_tokens_seen": 44657634720,
      "step": 56761
    },
    {
      "epoch": 6.021854445151708,
      "grad_norm": 0.8188310507974401,
      "learning_rate": 2.489228016614454e-05,
      "loss": 0.9717,
      "num_input_tokens_seen": 44658421536,
      "step": 56762
    },
    {
      "epoch": 6.02196053469128,
      "grad_norm": 0.8049411209483157,
      "learning_rate": 2.4891585203817096e-05,
      "loss": 0.9697,
      "num_input_tokens_seen": 44659208384,
      "step": 56763
    },
    {
      "epoch": 6.022066624230851,
      "grad_norm": 0.6660092344156282,
      "learning_rate": 2.489089024157343e-05,
      "loss": 0.9436,
      "num_input_tokens_seen": 44659995104,
      "step": 56764
    },
    {
      "epoch": 6.022172713770423,
      "grad_norm": 0.9573209669386616,
      "learning_rate": 2.4890195279414083e-05,
      "loss": 0.9274,
      "num_input_tokens_seen": 44660781824,
      "step": 56765
    },
    {
      "epoch": 6.022278803309994,
      "grad_norm": 0.8146237375408328,
      "learning_rate": 2.4889500317339592e-05,
      "loss": 1.001,
      "num_input_tokens_seen": 44661568624,
      "step": 56766
    },
    {
      "epoch": 6.022384892849565,
      "grad_norm": 0.7570588833166971,
      "learning_rate": 2.4888805355350482e-05,
      "loss": 0.977,
      "num_input_tokens_seen": 44662355392,
      "step": 56767
    },
    {
      "epoch": 6.022490982389137,
      "grad_norm": 1.086072165487291,
      "learning_rate": 2.4888110393447313e-05,
      "loss": 1.0666,
      "num_input_tokens_seen": 44663142064,
      "step": 56768
    },
    {
      "epoch": 6.022597071928708,
      "grad_norm": 0.9016758848805582,
      "learning_rate": 2.4887415431630605e-05,
      "loss": 1.0164,
      "num_input_tokens_seen": 44663928800,
      "step": 56769
    },
    {
      "epoch": 6.0227031614682796,
      "grad_norm": 0.7558255087580046,
      "learning_rate": 2.488672046990089e-05,
      "loss": 1.0074,
      "num_input_tokens_seen": 44664715504,
      "step": 56770
    },
    {
      "epoch": 6.022809251007851,
      "grad_norm": 1.1301796889523126,
      "learning_rate": 2.4886025508258722e-05,
      "loss": 0.9653,
      "num_input_tokens_seen": 44665502272,
      "step": 56771
    },
    {
      "epoch": 6.022915340547422,
      "grad_norm": 0.8136254904750209,
      "learning_rate": 2.488533054670463e-05,
      "loss": 0.9827,
      "num_input_tokens_seen": 44666288960,
      "step": 56772
    },
    {
      "epoch": 6.0230214300869935,
      "grad_norm": 1.2580517696425417,
      "learning_rate": 2.488463558523915e-05,
      "loss": 1.0202,
      "num_input_tokens_seen": 44667075728,
      "step": 56773
    },
    {
      "epoch": 6.023127519626565,
      "grad_norm": 0.9760528241776696,
      "learning_rate": 2.4883940623862822e-05,
      "loss": 0.9889,
      "num_input_tokens_seen": 44667862496,
      "step": 56774
    },
    {
      "epoch": 6.0232336091661365,
      "grad_norm": 0.8631205685053063,
      "learning_rate": 2.4883245662576177e-05,
      "loss": 0.9809,
      "num_input_tokens_seen": 44668649232,
      "step": 56775
    },
    {
      "epoch": 6.0233396987057075,
      "grad_norm": 1.2887648920585286,
      "learning_rate": 2.4882550701379758e-05,
      "loss": 1.0382,
      "num_input_tokens_seen": 44669435952,
      "step": 56776
    },
    {
      "epoch": 6.023445788245279,
      "grad_norm": 0.8312953373349891,
      "learning_rate": 2.4881855740274104e-05,
      "loss": 0.974,
      "num_input_tokens_seen": 44670222752,
      "step": 56777
    },
    {
      "epoch": 6.0235518777848505,
      "grad_norm": 0.9254726257107034,
      "learning_rate": 2.4881160779259743e-05,
      "loss": 1.103,
      "num_input_tokens_seen": 44671009552,
      "step": 56778
    },
    {
      "epoch": 6.0236579673244215,
      "grad_norm": 0.8602011484091403,
      "learning_rate": 2.4880465818337224e-05,
      "loss": 1.0432,
      "num_input_tokens_seen": 44671796208,
      "step": 56779
    },
    {
      "epoch": 6.023764056863993,
      "grad_norm": 1.139178342726652,
      "learning_rate": 2.4879770857507072e-05,
      "loss": 1.0245,
      "num_input_tokens_seen": 44672582992,
      "step": 56780
    },
    {
      "epoch": 6.023870146403564,
      "grad_norm": 0.9585475786487241,
      "learning_rate": 2.487907589676983e-05,
      "loss": 0.9686,
      "num_input_tokens_seen": 44673369744,
      "step": 56781
    },
    {
      "epoch": 6.023976235943136,
      "grad_norm": 0.8054472856657912,
      "learning_rate": 2.4878380936126035e-05,
      "loss": 0.9971,
      "num_input_tokens_seen": 44674156528,
      "step": 56782
    },
    {
      "epoch": 6.024082325482707,
      "grad_norm": 0.9569098015021049,
      "learning_rate": 2.4877685975576228e-05,
      "loss": 0.9775,
      "num_input_tokens_seen": 44674943312,
      "step": 56783
    },
    {
      "epoch": 6.024188415022278,
      "grad_norm": 0.7913388941965895,
      "learning_rate": 2.4876991015120935e-05,
      "loss": 0.9586,
      "num_input_tokens_seen": 44675730048,
      "step": 56784
    },
    {
      "epoch": 6.02429450456185,
      "grad_norm": 0.9825873244452363,
      "learning_rate": 2.4876296054760707e-05,
      "loss": 0.98,
      "num_input_tokens_seen": 44676516768,
      "step": 56785
    },
    {
      "epoch": 6.024400594101421,
      "grad_norm": 0.915114407562241,
      "learning_rate": 2.4875601094496072e-05,
      "loss": 0.9431,
      "num_input_tokens_seen": 44677303552,
      "step": 56786
    },
    {
      "epoch": 6.024506683640993,
      "grad_norm": 0.7839282570111156,
      "learning_rate": 2.487490613432756e-05,
      "loss": 0.9223,
      "num_input_tokens_seen": 44678090304,
      "step": 56787
    },
    {
      "epoch": 6.024612773180564,
      "grad_norm": 0.8757110586541675,
      "learning_rate": 2.4874211174255728e-05,
      "loss": 0.9475,
      "num_input_tokens_seen": 44678877072,
      "step": 56788
    },
    {
      "epoch": 6.024718862720136,
      "grad_norm": 0.966722107534292,
      "learning_rate": 2.4873516214281093e-05,
      "loss": 0.9774,
      "num_input_tokens_seen": 44679663920,
      "step": 56789
    },
    {
      "epoch": 6.024824952259707,
      "grad_norm": 0.896398389925745,
      "learning_rate": 2.4872821254404205e-05,
      "loss": 0.9013,
      "num_input_tokens_seen": 44680450656,
      "step": 56790
    },
    {
      "epoch": 6.024931041799278,
      "grad_norm": 1.4358112246657253,
      "learning_rate": 2.48721262946256e-05,
      "loss": 1.0416,
      "num_input_tokens_seen": 44681237376,
      "step": 56791
    },
    {
      "epoch": 6.02503713133885,
      "grad_norm": 1.2896609584051548,
      "learning_rate": 2.4871431334945805e-05,
      "loss": 1.0888,
      "num_input_tokens_seen": 44682024032,
      "step": 56792
    },
    {
      "epoch": 6.025143220878421,
      "grad_norm": 0.6841660447720072,
      "learning_rate": 2.4870736375365372e-05,
      "loss": 0.9008,
      "num_input_tokens_seen": 44682810864,
      "step": 56793
    },
    {
      "epoch": 6.025249310417993,
      "grad_norm": 1.135680330600395,
      "learning_rate": 2.4870041415884828e-05,
      "loss": 0.8834,
      "num_input_tokens_seen": 44683597696,
      "step": 56794
    },
    {
      "epoch": 6.025355399957564,
      "grad_norm": 1.0413217374104045,
      "learning_rate": 2.486934645650471e-05,
      "loss": 0.9145,
      "num_input_tokens_seen": 44684384480,
      "step": 56795
    },
    {
      "epoch": 6.025461489497135,
      "grad_norm": 0.8646922919648516,
      "learning_rate": 2.4868651497225556e-05,
      "loss": 1.0116,
      "num_input_tokens_seen": 44685171216,
      "step": 56796
    },
    {
      "epoch": 6.025567579036707,
      "grad_norm": 1.0218227016061816,
      "learning_rate": 2.486795653804791e-05,
      "loss": 0.9848,
      "num_input_tokens_seen": 44685957904,
      "step": 56797
    },
    {
      "epoch": 6.025673668576278,
      "grad_norm": 1.1753137672504426,
      "learning_rate": 2.4867261578972296e-05,
      "loss": 0.9817,
      "num_input_tokens_seen": 44686744672,
      "step": 56798
    },
    {
      "epoch": 6.02577975811585,
      "grad_norm": 0.9466061417632221,
      "learning_rate": 2.486656661999926e-05,
      "loss": 1.0048,
      "num_input_tokens_seen": 44687531408,
      "step": 56799
    },
    {
      "epoch": 6.025885847655421,
      "grad_norm": 0.9769260175408301,
      "learning_rate": 2.4865871661129343e-05,
      "loss": 1.0336,
      "num_input_tokens_seen": 44688318128,
      "step": 56800
    },
    {
      "epoch": 6.025991937194992,
      "grad_norm": 1.4050650296908695,
      "learning_rate": 2.4865176702363072e-05,
      "loss": 0.9727,
      "num_input_tokens_seen": 44689104944,
      "step": 56801
    },
    {
      "epoch": 6.026098026734564,
      "grad_norm": 0.7426898391695815,
      "learning_rate": 2.486448174370099e-05,
      "loss": 0.9316,
      "num_input_tokens_seen": 44689891696,
      "step": 56802
    },
    {
      "epoch": 6.026204116274135,
      "grad_norm": 1.250884720943758,
      "learning_rate": 2.4863786785143634e-05,
      "loss": 0.874,
      "num_input_tokens_seen": 44690678544,
      "step": 56803
    },
    {
      "epoch": 6.026310205813707,
      "grad_norm": 1.022389120617145,
      "learning_rate": 2.4863091826691534e-05,
      "loss": 0.9895,
      "num_input_tokens_seen": 44691465248,
      "step": 56804
    },
    {
      "epoch": 6.026416295353278,
      "grad_norm": 0.7980326100747807,
      "learning_rate": 2.4862396868345235e-05,
      "loss": 0.9256,
      "num_input_tokens_seen": 44692252048,
      "step": 56805
    },
    {
      "epoch": 6.02652238489285,
      "grad_norm": 1.1716118350167697,
      "learning_rate": 2.486170191010527e-05,
      "loss": 0.9514,
      "num_input_tokens_seen": 44693038912,
      "step": 56806
    },
    {
      "epoch": 6.026628474432421,
      "grad_norm": 1.1797723849130584,
      "learning_rate": 2.4861006951972182e-05,
      "loss": 1.0179,
      "num_input_tokens_seen": 44693825792,
      "step": 56807
    },
    {
      "epoch": 6.026734563971992,
      "grad_norm": 0.923919183148271,
      "learning_rate": 2.4860311993946506e-05,
      "loss": 0.9769,
      "num_input_tokens_seen": 44694612480,
      "step": 56808
    },
    {
      "epoch": 6.026840653511564,
      "grad_norm": 1.124134646514275,
      "learning_rate": 2.4859617036028768e-05,
      "loss": 0.9625,
      "num_input_tokens_seen": 44695399264,
      "step": 56809
    },
    {
      "epoch": 6.026946743051135,
      "grad_norm": 2.0316630053835087,
      "learning_rate": 2.4858922078219522e-05,
      "loss": 0.9938,
      "num_input_tokens_seen": 44696186064,
      "step": 56810
    },
    {
      "epoch": 6.027052832590707,
      "grad_norm": 0.7411297896816433,
      "learning_rate": 2.4858227120519296e-05,
      "loss": 0.9968,
      "num_input_tokens_seen": 44696972896,
      "step": 56811
    },
    {
      "epoch": 6.027158922130278,
      "grad_norm": 1.1826139074745148,
      "learning_rate": 2.4857532162928622e-05,
      "loss": 0.9506,
      "num_input_tokens_seen": 44697759728,
      "step": 56812
    },
    {
      "epoch": 6.027265011669849,
      "grad_norm": 1.1411358453913647,
      "learning_rate": 2.4856837205448048e-05,
      "loss": 1.0012,
      "num_input_tokens_seen": 44698546416,
      "step": 56813
    },
    {
      "epoch": 6.027371101209421,
      "grad_norm": 0.7587904652176488,
      "learning_rate": 2.4856142248078107e-05,
      "loss": 0.961,
      "num_input_tokens_seen": 44699333216,
      "step": 56814
    },
    {
      "epoch": 6.027477190748992,
      "grad_norm": 1.2011496815748626,
      "learning_rate": 2.4855447290819328e-05,
      "loss": 1.1104,
      "num_input_tokens_seen": 44700120000,
      "step": 56815
    },
    {
      "epoch": 6.027583280288564,
      "grad_norm": 0.9473649250933341,
      "learning_rate": 2.485475233367226e-05,
      "loss": 1.1136,
      "num_input_tokens_seen": 44700906736,
      "step": 56816
    },
    {
      "epoch": 6.027689369828135,
      "grad_norm": 0.9449464338487774,
      "learning_rate": 2.4854057376637437e-05,
      "loss": 0.9853,
      "num_input_tokens_seen": 44701693456,
      "step": 56817
    },
    {
      "epoch": 6.027795459367707,
      "grad_norm": 0.7838513339847201,
      "learning_rate": 2.485336241971539e-05,
      "loss": 0.8733,
      "num_input_tokens_seen": 44702480272,
      "step": 56818
    },
    {
      "epoch": 6.027901548907278,
      "grad_norm": 0.7179309366751453,
      "learning_rate": 2.4852667462906663e-05,
      "loss": 0.9701,
      "num_input_tokens_seen": 44703267120,
      "step": 56819
    },
    {
      "epoch": 6.028007638446849,
      "grad_norm": 0.8482853170304154,
      "learning_rate": 2.4851972506211794e-05,
      "loss": 0.9422,
      "num_input_tokens_seen": 44704053920,
      "step": 56820
    },
    {
      "epoch": 6.028113727986421,
      "grad_norm": 0.7810407222294184,
      "learning_rate": 2.4851277549631305e-05,
      "loss": 1.0315,
      "num_input_tokens_seen": 44704840688,
      "step": 56821
    },
    {
      "epoch": 6.028219817525992,
      "grad_norm": 1.0962486977133725,
      "learning_rate": 2.485058259316575e-05,
      "loss": 1.114,
      "num_input_tokens_seen": 44705627424,
      "step": 56822
    },
    {
      "epoch": 6.028325907065564,
      "grad_norm": 0.7604099165998114,
      "learning_rate": 2.4849887636815662e-05,
      "loss": 0.875,
      "num_input_tokens_seen": 44706414224,
      "step": 56823
    },
    {
      "epoch": 6.028431996605135,
      "grad_norm": 0.7815291922050784,
      "learning_rate": 2.484919268058158e-05,
      "loss": 0.986,
      "num_input_tokens_seen": 44707200976,
      "step": 56824
    },
    {
      "epoch": 6.028538086144706,
      "grad_norm": 0.8102361605793907,
      "learning_rate": 2.4848497724464033e-05,
      "loss": 1.0153,
      "num_input_tokens_seen": 44707987728,
      "step": 56825
    },
    {
      "epoch": 6.028644175684278,
      "grad_norm": 0.7985674298979809,
      "learning_rate": 2.484780276846356e-05,
      "loss": 0.9297,
      "num_input_tokens_seen": 44708774432,
      "step": 56826
    },
    {
      "epoch": 6.028750265223849,
      "grad_norm": 0.8161151117363384,
      "learning_rate": 2.4847107812580706e-05,
      "loss": 1.0001,
      "num_input_tokens_seen": 44709561104,
      "step": 56827
    },
    {
      "epoch": 6.028856354763421,
      "grad_norm": 0.808231843814354,
      "learning_rate": 2.4846412856816e-05,
      "loss": 0.97,
      "num_input_tokens_seen": 44710347920,
      "step": 56828
    },
    {
      "epoch": 6.028962444302992,
      "grad_norm": 0.7188884963069041,
      "learning_rate": 2.484571790116998e-05,
      "loss": 0.9559,
      "num_input_tokens_seen": 44711134752,
      "step": 56829
    },
    {
      "epoch": 6.029068533842563,
      "grad_norm": 0.9697423041292662,
      "learning_rate": 2.484502294564319e-05,
      "loss": 1.0212,
      "num_input_tokens_seen": 44711921488,
      "step": 56830
    },
    {
      "epoch": 6.029174623382135,
      "grad_norm": 0.9367921541084803,
      "learning_rate": 2.4844327990236158e-05,
      "loss": 1.0,
      "num_input_tokens_seen": 44712708208,
      "step": 56831
    },
    {
      "epoch": 6.029280712921706,
      "grad_norm": 1.0592312467566092,
      "learning_rate": 2.484363303494942e-05,
      "loss": 0.9719,
      "num_input_tokens_seen": 44713495056,
      "step": 56832
    },
    {
      "epoch": 6.029386802461278,
      "grad_norm": 0.7849717592405169,
      "learning_rate": 2.4842938079783527e-05,
      "loss": 0.9641,
      "num_input_tokens_seen": 44714281808,
      "step": 56833
    },
    {
      "epoch": 6.029492892000849,
      "grad_norm": 0.657606522675343,
      "learning_rate": 2.4842243124739003e-05,
      "loss": 0.9681,
      "num_input_tokens_seen": 44715068640,
      "step": 56834
    },
    {
      "epoch": 6.0295989815404205,
      "grad_norm": 1.0434268294457358,
      "learning_rate": 2.4841548169816385e-05,
      "loss": 1.0109,
      "num_input_tokens_seen": 44715855424,
      "step": 56835
    },
    {
      "epoch": 6.0297050710799915,
      "grad_norm": 0.8765910251788054,
      "learning_rate": 2.484085321501622e-05,
      "loss": 1.044,
      "num_input_tokens_seen": 44716642160,
      "step": 56836
    },
    {
      "epoch": 6.029811160619563,
      "grad_norm": 0.8614707440363323,
      "learning_rate": 2.4840158260339037e-05,
      "loss": 1.1038,
      "num_input_tokens_seen": 44717428880,
      "step": 56837
    },
    {
      "epoch": 6.0299172501591345,
      "grad_norm": 0.8745858719973891,
      "learning_rate": 2.4839463305785372e-05,
      "loss": 1.062,
      "num_input_tokens_seen": 44718215536,
      "step": 56838
    },
    {
      "epoch": 6.0300233396987055,
      "grad_norm": 0.9322815523827356,
      "learning_rate": 2.4838768351355768e-05,
      "loss": 0.9984,
      "num_input_tokens_seen": 44719002368,
      "step": 56839
    },
    {
      "epoch": 6.030129429238277,
      "grad_norm": 0.7490925945242497,
      "learning_rate": 2.4838073397050754e-05,
      "loss": 0.9394,
      "num_input_tokens_seen": 44719789136,
      "step": 56840
    },
    {
      "epoch": 6.0302355187778485,
      "grad_norm": 0.6774521722672991,
      "learning_rate": 2.483737844287088e-05,
      "loss": 0.9539,
      "num_input_tokens_seen": 44720575888,
      "step": 56841
    },
    {
      "epoch": 6.0303416083174195,
      "grad_norm": 0.6568657807854736,
      "learning_rate": 2.4836683488816672e-05,
      "loss": 0.9927,
      "num_input_tokens_seen": 44721362640,
      "step": 56842
    },
    {
      "epoch": 6.030447697856991,
      "grad_norm": 0.7030713493762667,
      "learning_rate": 2.4835988534888666e-05,
      "loss": 0.9888,
      "num_input_tokens_seen": 44722149424,
      "step": 56843
    },
    {
      "epoch": 6.0305537873965624,
      "grad_norm": 0.6723838628340368,
      "learning_rate": 2.483529358108741e-05,
      "loss": 1.014,
      "num_input_tokens_seen": 44722936176,
      "step": 56844
    },
    {
      "epoch": 6.030659876936134,
      "grad_norm": 0.5924501198337648,
      "learning_rate": 2.483459862741342e-05,
      "loss": 1.0088,
      "num_input_tokens_seen": 44723722944,
      "step": 56845
    },
    {
      "epoch": 6.030765966475705,
      "grad_norm": 0.887701935793374,
      "learning_rate": 2.483390367386726e-05,
      "loss": 0.8861,
      "num_input_tokens_seen": 44724509904,
      "step": 56846
    },
    {
      "epoch": 6.030872056015277,
      "grad_norm": 0.69475521031753,
      "learning_rate": 2.4833208720449453e-05,
      "loss": 0.9948,
      "num_input_tokens_seen": 44725296704,
      "step": 56847
    },
    {
      "epoch": 6.030978145554848,
      "grad_norm": 0.7992979649027887,
      "learning_rate": 2.483251376716054e-05,
      "loss": 0.9603,
      "num_input_tokens_seen": 44726083488,
      "step": 56848
    },
    {
      "epoch": 6.031084235094419,
      "grad_norm": 0.7042149526451347,
      "learning_rate": 2.4831818814001055e-05,
      "loss": 0.938,
      "num_input_tokens_seen": 44726870208,
      "step": 56849
    },
    {
      "epoch": 6.031190324633991,
      "grad_norm": 1.1530723110406014,
      "learning_rate": 2.4831123860971528e-05,
      "loss": 1.0608,
      "num_input_tokens_seen": 44727656992,
      "step": 56850
    },
    {
      "epoch": 6.031296414173562,
      "grad_norm": 0.769771018937497,
      "learning_rate": 2.483042890807251e-05,
      "loss": 0.947,
      "num_input_tokens_seen": 44728443712,
      "step": 56851
    },
    {
      "epoch": 6.031402503713134,
      "grad_norm": 0.9890673455380521,
      "learning_rate": 2.4829733955304535e-05,
      "loss": 0.9638,
      "num_input_tokens_seen": 44729230480,
      "step": 56852
    },
    {
      "epoch": 6.031508593252705,
      "grad_norm": 1.020486104850477,
      "learning_rate": 2.482903900266813e-05,
      "loss": 1.0342,
      "num_input_tokens_seen": 44730017264,
      "step": 56853
    },
    {
      "epoch": 6.031614682792276,
      "grad_norm": 1.0132122759384319,
      "learning_rate": 2.482834405016384e-05,
      "loss": 0.9205,
      "num_input_tokens_seen": 44730804064,
      "step": 56854
    },
    {
      "epoch": 6.031720772331848,
      "grad_norm": 1.03560472585317,
      "learning_rate": 2.4827649097792203e-05,
      "loss": 1.0033,
      "num_input_tokens_seen": 44731590848,
      "step": 56855
    },
    {
      "epoch": 6.031826861871419,
      "grad_norm": 0.8706169263348139,
      "learning_rate": 2.4826954145553747e-05,
      "loss": 0.954,
      "num_input_tokens_seen": 44732377536,
      "step": 56856
    },
    {
      "epoch": 6.031932951410991,
      "grad_norm": 1.2232856064478315,
      "learning_rate": 2.4826259193449024e-05,
      "loss": 1.0776,
      "num_input_tokens_seen": 44733164384,
      "step": 56857
    },
    {
      "epoch": 6.032039040950562,
      "grad_norm": 0.752746731324908,
      "learning_rate": 2.4825564241478563e-05,
      "loss": 1.0684,
      "num_input_tokens_seen": 44733951072,
      "step": 56858
    },
    {
      "epoch": 6.032145130490133,
      "grad_norm": 0.7212594899425641,
      "learning_rate": 2.4824869289642895e-05,
      "loss": 1.0158,
      "num_input_tokens_seen": 44734737872,
      "step": 56859
    },
    {
      "epoch": 6.032251220029705,
      "grad_norm": 1.1204523373395765,
      "learning_rate": 2.4824174337942565e-05,
      "loss": 1.0308,
      "num_input_tokens_seen": 44735524624,
      "step": 56860
    },
    {
      "epoch": 6.032357309569276,
      "grad_norm": 0.678958272678447,
      "learning_rate": 2.4823479386378107e-05,
      "loss": 0.9438,
      "num_input_tokens_seen": 44736311472,
      "step": 56861
    },
    {
      "epoch": 6.032463399108848,
      "grad_norm": 0.9871596016159481,
      "learning_rate": 2.482278443495006e-05,
      "loss": 0.9933,
      "num_input_tokens_seen": 44737098240,
      "step": 56862
    },
    {
      "epoch": 6.032569488648419,
      "grad_norm": 1.1025731182510028,
      "learning_rate": 2.4822089483658965e-05,
      "loss": 1.0275,
      "num_input_tokens_seen": 44737884992,
      "step": 56863
    },
    {
      "epoch": 6.032675578187991,
      "grad_norm": 0.9979136268198213,
      "learning_rate": 2.4821394532505344e-05,
      "loss": 0.9837,
      "num_input_tokens_seen": 44738671744,
      "step": 56864
    },
    {
      "epoch": 6.032781667727562,
      "grad_norm": 0.7548615549128647,
      "learning_rate": 2.482069958148975e-05,
      "loss": 0.9026,
      "num_input_tokens_seen": 44739458608,
      "step": 56865
    },
    {
      "epoch": 6.032887757267133,
      "grad_norm": 1.1378459081032126,
      "learning_rate": 2.4820004630612716e-05,
      "loss": 1.0477,
      "num_input_tokens_seen": 44740245296,
      "step": 56866
    },
    {
      "epoch": 6.032993846806705,
      "grad_norm": 0.7293219447127938,
      "learning_rate": 2.4819309679874772e-05,
      "loss": 0.9552,
      "num_input_tokens_seen": 44741032016,
      "step": 56867
    },
    {
      "epoch": 6.033099936346276,
      "grad_norm": 0.9398638977312762,
      "learning_rate": 2.4818614729276467e-05,
      "loss": 0.981,
      "num_input_tokens_seen": 44741818704,
      "step": 56868
    },
    {
      "epoch": 6.033206025885848,
      "grad_norm": 0.7604736356129453,
      "learning_rate": 2.4817919778818328e-05,
      "loss": 1.0571,
      "num_input_tokens_seen": 44742605456,
      "step": 56869
    },
    {
      "epoch": 6.033312115425419,
      "grad_norm": 0.8739070867607139,
      "learning_rate": 2.481722482850089e-05,
      "loss": 0.9873,
      "num_input_tokens_seen": 44743392256,
      "step": 56870
    },
    {
      "epoch": 6.03341820496499,
      "grad_norm": 0.9878460392317632,
      "learning_rate": 2.48165298783247e-05,
      "loss": 1.0199,
      "num_input_tokens_seen": 44744179024,
      "step": 56871
    },
    {
      "epoch": 6.033524294504562,
      "grad_norm": 0.7928460471644306,
      "learning_rate": 2.4815834928290292e-05,
      "loss": 1.0434,
      "num_input_tokens_seen": 44744965856,
      "step": 56872
    },
    {
      "epoch": 6.033630384044133,
      "grad_norm": 0.8921319959514242,
      "learning_rate": 2.48151399783982e-05,
      "loss": 0.9679,
      "num_input_tokens_seen": 44745752592,
      "step": 56873
    },
    {
      "epoch": 6.033736473583705,
      "grad_norm": 0.68232537989669,
      "learning_rate": 2.4814445028648962e-05,
      "loss": 0.9603,
      "num_input_tokens_seen": 44746539456,
      "step": 56874
    },
    {
      "epoch": 6.033842563123276,
      "grad_norm": 0.816617247673572,
      "learning_rate": 2.4813750079043115e-05,
      "loss": 1.033,
      "num_input_tokens_seen": 44747326224,
      "step": 56875
    },
    {
      "epoch": 6.033948652662848,
      "grad_norm": 0.7585560937458852,
      "learning_rate": 2.4813055129581196e-05,
      "loss": 0.9551,
      "num_input_tokens_seen": 44748112992,
      "step": 56876
    },
    {
      "epoch": 6.034054742202419,
      "grad_norm": 0.8193732610952424,
      "learning_rate": 2.481236018026374e-05,
      "loss": 0.9856,
      "num_input_tokens_seen": 44748899696,
      "step": 56877
    },
    {
      "epoch": 6.03416083174199,
      "grad_norm": 0.8482148260898222,
      "learning_rate": 2.481166523109129e-05,
      "loss": 0.9937,
      "num_input_tokens_seen": 44749686432,
      "step": 56878
    },
    {
      "epoch": 6.034266921281562,
      "grad_norm": 0.7583935463891781,
      "learning_rate": 2.4810970282064382e-05,
      "loss": 0.9438,
      "num_input_tokens_seen": 44750473216,
      "step": 56879
    },
    {
      "epoch": 6.034373010821133,
      "grad_norm": 0.7729374187890418,
      "learning_rate": 2.4810275333183547e-05,
      "loss": 0.9516,
      "num_input_tokens_seen": 44751260080,
      "step": 56880
    },
    {
      "epoch": 6.034479100360705,
      "grad_norm": 0.7694871187661781,
      "learning_rate": 2.4809580384449324e-05,
      "loss": 0.9723,
      "num_input_tokens_seen": 44752046736,
      "step": 56881
    },
    {
      "epoch": 6.034585189900276,
      "grad_norm": 0.8557558527707844,
      "learning_rate": 2.4808885435862255e-05,
      "loss": 0.9843,
      "num_input_tokens_seen": 44752833536,
      "step": 56882
    },
    {
      "epoch": 6.034691279439847,
      "grad_norm": 0.8139327232893905,
      "learning_rate": 2.4808190487422873e-05,
      "loss": 0.9392,
      "num_input_tokens_seen": 44753620400,
      "step": 56883
    },
    {
      "epoch": 6.034797368979419,
      "grad_norm": 0.8285986523301003,
      "learning_rate": 2.4807495539131713e-05,
      "loss": 1.0277,
      "num_input_tokens_seen": 44754407120,
      "step": 56884
    },
    {
      "epoch": 6.03490345851899,
      "grad_norm": 0.9311433513256162,
      "learning_rate": 2.4806800590989322e-05,
      "loss": 0.9396,
      "num_input_tokens_seen": 44755193840,
      "step": 56885
    },
    {
      "epoch": 6.035009548058562,
      "grad_norm": 1.2630350566210173,
      "learning_rate": 2.480610564299623e-05,
      "loss": 0.9849,
      "num_input_tokens_seen": 44755980464,
      "step": 56886
    },
    {
      "epoch": 6.035115637598133,
      "grad_norm": 0.816860350786145,
      "learning_rate": 2.4805410695152962e-05,
      "loss": 0.9273,
      "num_input_tokens_seen": 44756767280,
      "step": 56887
    },
    {
      "epoch": 6.035221727137705,
      "grad_norm": 0.9163376250004507,
      "learning_rate": 2.4804715747460075e-05,
      "loss": 0.9177,
      "num_input_tokens_seen": 44757554048,
      "step": 56888
    },
    {
      "epoch": 6.035327816677276,
      "grad_norm": 1.4136695642656636,
      "learning_rate": 2.48040207999181e-05,
      "loss": 1.057,
      "num_input_tokens_seen": 44758340768,
      "step": 56889
    },
    {
      "epoch": 6.035433906216847,
      "grad_norm": 0.7410482065608982,
      "learning_rate": 2.4803325852527564e-05,
      "loss": 0.9826,
      "num_input_tokens_seen": 44759127568,
      "step": 56890
    },
    {
      "epoch": 6.035539995756419,
      "grad_norm": 1.066738337710541,
      "learning_rate": 2.480263090528902e-05,
      "loss": 0.9453,
      "num_input_tokens_seen": 44759914336,
      "step": 56891
    },
    {
      "epoch": 6.03564608529599,
      "grad_norm": 0.839183071958477,
      "learning_rate": 2.480193595820299e-05,
      "loss": 1.005,
      "num_input_tokens_seen": 44760701152,
      "step": 56892
    },
    {
      "epoch": 6.035752174835562,
      "grad_norm": 0.817434555533503,
      "learning_rate": 2.4801241011270025e-05,
      "loss": 0.9416,
      "num_input_tokens_seen": 44761487968,
      "step": 56893
    },
    {
      "epoch": 6.035858264375133,
      "grad_norm": 1.4904573989040768,
      "learning_rate": 2.4800546064490653e-05,
      "loss": 1.0511,
      "num_input_tokens_seen": 44762274784,
      "step": 56894
    },
    {
      "epoch": 6.035964353914704,
      "grad_norm": 0.8883841745497192,
      "learning_rate": 2.479985111786541e-05,
      "loss": 0.9425,
      "num_input_tokens_seen": 44763061600,
      "step": 56895
    },
    {
      "epoch": 6.036070443454276,
      "grad_norm": 0.8609391835780827,
      "learning_rate": 2.479915617139484e-05,
      "loss": 1.0122,
      "num_input_tokens_seen": 44763848352,
      "step": 56896
    },
    {
      "epoch": 6.036176532993847,
      "grad_norm": 0.9152245793340493,
      "learning_rate": 2.4798461225079476e-05,
      "loss": 0.9713,
      "num_input_tokens_seen": 44764635136,
      "step": 56897
    },
    {
      "epoch": 6.0362826225334185,
      "grad_norm": 0.9863717507228488,
      "learning_rate": 2.479776627891985e-05,
      "loss": 1.01,
      "num_input_tokens_seen": 44765421888,
      "step": 56898
    },
    {
      "epoch": 6.0363887120729895,
      "grad_norm": 0.8147788781674669,
      "learning_rate": 2.479707133291651e-05,
      "loss": 0.9208,
      "num_input_tokens_seen": 44766208656,
      "step": 56899
    },
    {
      "epoch": 6.036494801612561,
      "grad_norm": 0.8832001980785567,
      "learning_rate": 2.4796376387069987e-05,
      "loss": 0.9954,
      "num_input_tokens_seen": 44766995456,
      "step": 56900
    },
    {
      "epoch": 6.0366008911521325,
      "grad_norm": 0.8938202727540191,
      "learning_rate": 2.4795681441380817e-05,
      "loss": 0.9186,
      "num_input_tokens_seen": 44767782240,
      "step": 56901
    },
    {
      "epoch": 6.0367069806917035,
      "grad_norm": 0.8816412947398394,
      "learning_rate": 2.479498649584954e-05,
      "loss": 0.9953,
      "num_input_tokens_seen": 44768569152,
      "step": 56902
    },
    {
      "epoch": 6.0368130702312754,
      "grad_norm": 0.8453420374146802,
      "learning_rate": 2.4794291550476693e-05,
      "loss": 0.9077,
      "num_input_tokens_seen": 44769355984,
      "step": 56903
    },
    {
      "epoch": 6.0369191597708465,
      "grad_norm": 0.8008260972910678,
      "learning_rate": 2.4793596605262803e-05,
      "loss": 1.0264,
      "num_input_tokens_seen": 44770142560,
      "step": 56904
    },
    {
      "epoch": 6.037025249310418,
      "grad_norm": 0.800694670762317,
      "learning_rate": 2.4792901660208423e-05,
      "loss": 0.9464,
      "num_input_tokens_seen": 44770929392,
      "step": 56905
    },
    {
      "epoch": 6.037131338849989,
      "grad_norm": 0.8701745023485974,
      "learning_rate": 2.4792206715314082e-05,
      "loss": 0.9764,
      "num_input_tokens_seen": 44771716096,
      "step": 56906
    },
    {
      "epoch": 6.0372374283895605,
      "grad_norm": 0.6384884988136966,
      "learning_rate": 2.479151177058031e-05,
      "loss": 0.917,
      "num_input_tokens_seen": 44772502976,
      "step": 56907
    },
    {
      "epoch": 6.037343517929132,
      "grad_norm": 1.2770854801822118,
      "learning_rate": 2.4790816826007662e-05,
      "loss": 1.0104,
      "num_input_tokens_seen": 44773289664,
      "step": 56908
    },
    {
      "epoch": 6.037449607468703,
      "grad_norm": 0.9042696646206584,
      "learning_rate": 2.4790121881596658e-05,
      "loss": 0.9792,
      "num_input_tokens_seen": 44774076368,
      "step": 56909
    },
    {
      "epoch": 6.037555697008275,
      "grad_norm": 1.4478998663511673,
      "learning_rate": 2.4789426937347843e-05,
      "loss": 1.0195,
      "num_input_tokens_seen": 44774863184,
      "step": 56910
    },
    {
      "epoch": 6.037661786547846,
      "grad_norm": 1.0618106782319374,
      "learning_rate": 2.4788731993261754e-05,
      "loss": 0.9572,
      "num_input_tokens_seen": 44775650000,
      "step": 56911
    },
    {
      "epoch": 6.037767876087417,
      "grad_norm": 0.7356700700700491,
      "learning_rate": 2.4788037049338926e-05,
      "loss": 1.0291,
      "num_input_tokens_seen": 44776436752,
      "step": 56912
    },
    {
      "epoch": 6.037873965626989,
      "grad_norm": 0.9841227494365038,
      "learning_rate": 2.4787342105579896e-05,
      "loss": 1.0151,
      "num_input_tokens_seen": 44777223552,
      "step": 56913
    },
    {
      "epoch": 6.03798005516656,
      "grad_norm": 0.798275256753131,
      "learning_rate": 2.4786647161985205e-05,
      "loss": 0.9514,
      "num_input_tokens_seen": 44778010432,
      "step": 56914
    },
    {
      "epoch": 6.038086144706132,
      "grad_norm": 0.7857791932919395,
      "learning_rate": 2.478595221855538e-05,
      "loss": 0.8833,
      "num_input_tokens_seen": 44778797248,
      "step": 56915
    },
    {
      "epoch": 6.038192234245703,
      "grad_norm": 1.2135787761395596,
      "learning_rate": 2.4785257275290973e-05,
      "loss": 0.9859,
      "num_input_tokens_seen": 44779584048,
      "step": 56916
    },
    {
      "epoch": 6.038298323785275,
      "grad_norm": 1.0147397565929617,
      "learning_rate": 2.478456233219251e-05,
      "loss": 0.9469,
      "num_input_tokens_seen": 44780370800,
      "step": 56917
    },
    {
      "epoch": 6.038404413324846,
      "grad_norm": 1.7678772591225154,
      "learning_rate": 2.4783867389260525e-05,
      "loss": 0.946,
      "num_input_tokens_seen": 44781157632,
      "step": 56918
    },
    {
      "epoch": 6.038510502864417,
      "grad_norm": 1.6526481754699323,
      "learning_rate": 2.478317244649557e-05,
      "loss": 0.9907,
      "num_input_tokens_seen": 44781944464,
      "step": 56919
    },
    {
      "epoch": 6.038616592403989,
      "grad_norm": 0.916128736800778,
      "learning_rate": 2.478247750389817e-05,
      "loss": 0.9224,
      "num_input_tokens_seen": 44782731200,
      "step": 56920
    },
    {
      "epoch": 6.03872268194356,
      "grad_norm": 1.3470706960859529,
      "learning_rate": 2.4781782561468862e-05,
      "loss": 1.0573,
      "num_input_tokens_seen": 44783517968,
      "step": 56921
    },
    {
      "epoch": 6.038828771483132,
      "grad_norm": 1.5034902096421319,
      "learning_rate": 2.478108761920819e-05,
      "loss": 0.9836,
      "num_input_tokens_seen": 44784304672,
      "step": 56922
    },
    {
      "epoch": 6.038934861022703,
      "grad_norm": 1.0862252421374157,
      "learning_rate": 2.4780392677116687e-05,
      "loss": 0.9697,
      "num_input_tokens_seen": 44785091408,
      "step": 56923
    },
    {
      "epoch": 6.039040950562274,
      "grad_norm": 1.149606732691532,
      "learning_rate": 2.4779697735194885e-05,
      "loss": 0.9904,
      "num_input_tokens_seen": 44785878128,
      "step": 56924
    },
    {
      "epoch": 6.039147040101846,
      "grad_norm": 1.2153222920288977,
      "learning_rate": 2.477900279344333e-05,
      "loss": 1.0273,
      "num_input_tokens_seen": 44786664912,
      "step": 56925
    },
    {
      "epoch": 6.039253129641417,
      "grad_norm": 0.8948262576586125,
      "learning_rate": 2.477830785186255e-05,
      "loss": 0.9072,
      "num_input_tokens_seen": 44787451760,
      "step": 56926
    },
    {
      "epoch": 6.039359219180989,
      "grad_norm": 0.7935735606987605,
      "learning_rate": 2.4777612910453097e-05,
      "loss": 0.9388,
      "num_input_tokens_seen": 44788238672,
      "step": 56927
    },
    {
      "epoch": 6.03946530872056,
      "grad_norm": 0.8764032699018192,
      "learning_rate": 2.4776917969215495e-05,
      "loss": 0.9528,
      "num_input_tokens_seen": 44789025376,
      "step": 56928
    },
    {
      "epoch": 6.039571398260131,
      "grad_norm": 0.8068642757535792,
      "learning_rate": 2.4776223028150274e-05,
      "loss": 0.9384,
      "num_input_tokens_seen": 44789812144,
      "step": 56929
    },
    {
      "epoch": 6.039677487799703,
      "grad_norm": 0.7764575726557291,
      "learning_rate": 2.4775528087257994e-05,
      "loss": 1.1067,
      "num_input_tokens_seen": 44790598944,
      "step": 56930
    },
    {
      "epoch": 6.039783577339274,
      "grad_norm": 1.042138476370072,
      "learning_rate": 2.4774833146539176e-05,
      "loss": 1.0414,
      "num_input_tokens_seen": 44791385632,
      "step": 56931
    },
    {
      "epoch": 6.039889666878846,
      "grad_norm": 0.7367490294347497,
      "learning_rate": 2.477413820599436e-05,
      "loss": 1.0173,
      "num_input_tokens_seen": 44792172384,
      "step": 56932
    },
    {
      "epoch": 6.039995756418417,
      "grad_norm": 0.7060599423649083,
      "learning_rate": 2.477344326562408e-05,
      "loss": 0.9335,
      "num_input_tokens_seen": 44792959248,
      "step": 56933
    },
    {
      "epoch": 6.040101845957989,
      "grad_norm": 0.762619330563417,
      "learning_rate": 2.477274832542888e-05,
      "loss": 0.9963,
      "num_input_tokens_seen": 44793746016,
      "step": 56934
    },
    {
      "epoch": 6.04020793549756,
      "grad_norm": 0.7162219317763698,
      "learning_rate": 2.477205338540929e-05,
      "loss": 0.9229,
      "num_input_tokens_seen": 44794532848,
      "step": 56935
    },
    {
      "epoch": 6.040314025037131,
      "grad_norm": 0.8017230521851618,
      "learning_rate": 2.4771358445565852e-05,
      "loss": 0.9213,
      "num_input_tokens_seen": 44795319632,
      "step": 56936
    },
    {
      "epoch": 6.040420114576703,
      "grad_norm": 0.6953677141185011,
      "learning_rate": 2.4770663505899107e-05,
      "loss": 1.0052,
      "num_input_tokens_seen": 44796106336,
      "step": 56937
    },
    {
      "epoch": 6.040526204116274,
      "grad_norm": 1.2821828957610755,
      "learning_rate": 2.4769968566409577e-05,
      "loss": 0.9941,
      "num_input_tokens_seen": 44796893120,
      "step": 56938
    },
    {
      "epoch": 6.040632293655846,
      "grad_norm": 0.6858382142716273,
      "learning_rate": 2.4769273627097817e-05,
      "loss": 0.9597,
      "num_input_tokens_seen": 44797679920,
      "step": 56939
    },
    {
      "epoch": 6.040738383195417,
      "grad_norm": 0.7860710972306808,
      "learning_rate": 2.4768578687964343e-05,
      "loss": 0.9685,
      "num_input_tokens_seen": 44798466688,
      "step": 56940
    },
    {
      "epoch": 6.040844472734988,
      "grad_norm": 1.0150538438233183,
      "learning_rate": 2.476788374900971e-05,
      "loss": 0.923,
      "num_input_tokens_seen": 44799253520,
      "step": 56941
    },
    {
      "epoch": 6.04095056227456,
      "grad_norm": 0.788941862234756,
      "learning_rate": 2.4767188810234454e-05,
      "loss": 0.9937,
      "num_input_tokens_seen": 44800040304,
      "step": 56942
    },
    {
      "epoch": 6.041056651814131,
      "grad_norm": 0.7986600576589197,
      "learning_rate": 2.4766493871639107e-05,
      "loss": 1.0052,
      "num_input_tokens_seen": 44800827056,
      "step": 56943
    },
    {
      "epoch": 6.041162741353703,
      "grad_norm": 0.9942393034730439,
      "learning_rate": 2.476579893322421e-05,
      "loss": 1.0232,
      "num_input_tokens_seen": 44801613856,
      "step": 56944
    },
    {
      "epoch": 6.041268830893274,
      "grad_norm": 0.8868553384052927,
      "learning_rate": 2.4765103994990287e-05,
      "loss": 0.9587,
      "num_input_tokens_seen": 44802400592,
      "step": 56945
    },
    {
      "epoch": 6.041374920432846,
      "grad_norm": 0.7688607558566589,
      "learning_rate": 2.4764409056937894e-05,
      "loss": 0.9806,
      "num_input_tokens_seen": 44803187376,
      "step": 56946
    },
    {
      "epoch": 6.041481009972417,
      "grad_norm": 0.7026466045244605,
      "learning_rate": 2.4763714119067553e-05,
      "loss": 1.0251,
      "num_input_tokens_seen": 44803974176,
      "step": 56947
    },
    {
      "epoch": 6.041587099511988,
      "grad_norm": 0.7747710725484288,
      "learning_rate": 2.476301918137981e-05,
      "loss": 1.029,
      "num_input_tokens_seen": 44804760864,
      "step": 56948
    },
    {
      "epoch": 6.04169318905156,
      "grad_norm": 0.8393292201352223,
      "learning_rate": 2.4762324243875203e-05,
      "loss": 0.9802,
      "num_input_tokens_seen": 44805547600,
      "step": 56949
    },
    {
      "epoch": 6.041799278591131,
      "grad_norm": 0.7949489316137598,
      "learning_rate": 2.4761629306554254e-05,
      "loss": 1.0063,
      "num_input_tokens_seen": 44806334384,
      "step": 56950
    },
    {
      "epoch": 6.041905368130703,
      "grad_norm": 0.7914308325695656,
      "learning_rate": 2.4760934369417518e-05,
      "loss": 0.9914,
      "num_input_tokens_seen": 44807121088,
      "step": 56951
    },
    {
      "epoch": 6.042011457670274,
      "grad_norm": 0.6758056424294646,
      "learning_rate": 2.4760239432465526e-05,
      "loss": 0.9452,
      "num_input_tokens_seen": 44807907792,
      "step": 56952
    },
    {
      "epoch": 6.042117547209845,
      "grad_norm": 0.6991043009987734,
      "learning_rate": 2.4759544495698808e-05,
      "loss": 0.993,
      "num_input_tokens_seen": 44808694544,
      "step": 56953
    },
    {
      "epoch": 6.042223636749417,
      "grad_norm": 0.6906892341949872,
      "learning_rate": 2.4758849559117915e-05,
      "loss": 0.9446,
      "num_input_tokens_seen": 44809481312,
      "step": 56954
    },
    {
      "epoch": 6.042329726288988,
      "grad_norm": 0.8738673860019474,
      "learning_rate": 2.4758154622723373e-05,
      "loss": 0.8886,
      "num_input_tokens_seen": 44810268192,
      "step": 56955
    },
    {
      "epoch": 6.04243581582856,
      "grad_norm": 0.714011169401637,
      "learning_rate": 2.4757459686515717e-05,
      "loss": 0.924,
      "num_input_tokens_seen": 44811054896,
      "step": 56956
    },
    {
      "epoch": 6.042541905368131,
      "grad_norm": 0.886671155678861,
      "learning_rate": 2.4756764750495496e-05,
      "loss": 1.0039,
      "num_input_tokens_seen": 44811841696,
      "step": 56957
    },
    {
      "epoch": 6.042647994907702,
      "grad_norm": 0.7354288441404792,
      "learning_rate": 2.4756069814663238e-05,
      "loss": 1.0135,
      "num_input_tokens_seen": 44812628464,
      "step": 56958
    },
    {
      "epoch": 6.042754084447274,
      "grad_norm": 0.8981229794097177,
      "learning_rate": 2.475537487901948e-05,
      "loss": 1.1159,
      "num_input_tokens_seen": 44813415184,
      "step": 56959
    },
    {
      "epoch": 6.042860173986845,
      "grad_norm": 0.8562771696463924,
      "learning_rate": 2.475467994356476e-05,
      "loss": 0.9605,
      "num_input_tokens_seen": 44814201968,
      "step": 56960
    },
    {
      "epoch": 6.0429662635264165,
      "grad_norm": 0.8526376854163911,
      "learning_rate": 2.475398500829962e-05,
      "loss": 1.0126,
      "num_input_tokens_seen": 44814988592,
      "step": 56961
    },
    {
      "epoch": 6.043072353065988,
      "grad_norm": 0.7653176711945132,
      "learning_rate": 2.4753290073224587e-05,
      "loss": 0.9267,
      "num_input_tokens_seen": 44815775312,
      "step": 56962
    },
    {
      "epoch": 6.0431784426055595,
      "grad_norm": 1.1021368229271078,
      "learning_rate": 2.4752595138340213e-05,
      "loss": 1.0423,
      "num_input_tokens_seen": 44816562016,
      "step": 56963
    },
    {
      "epoch": 6.0432845321451305,
      "grad_norm": 0.835452380819488,
      "learning_rate": 2.4751900203647015e-05,
      "loss": 1.0527,
      "num_input_tokens_seen": 44817348784,
      "step": 56964
    },
    {
      "epoch": 6.0433906216847015,
      "grad_norm": 0.9396527203943645,
      "learning_rate": 2.4751205269145554e-05,
      "loss": 0.9422,
      "num_input_tokens_seen": 44818135504,
      "step": 56965
    },
    {
      "epoch": 6.0434967112242735,
      "grad_norm": 0.9499191849665388,
      "learning_rate": 2.475051033483635e-05,
      "loss": 1.0372,
      "num_input_tokens_seen": 44818922256,
      "step": 56966
    },
    {
      "epoch": 6.0436028007638445,
      "grad_norm": 0.6952030068772004,
      "learning_rate": 2.4749815400719936e-05,
      "loss": 0.9667,
      "num_input_tokens_seen": 44819709008,
      "step": 56967
    },
    {
      "epoch": 6.043708890303416,
      "grad_norm": 0.8070665549858925,
      "learning_rate": 2.4749120466796867e-05,
      "loss": 0.9126,
      "num_input_tokens_seen": 44820495856,
      "step": 56968
    },
    {
      "epoch": 6.043814979842987,
      "grad_norm": 0.7100374316147152,
      "learning_rate": 2.4748425533067666e-05,
      "loss": 0.9369,
      "num_input_tokens_seen": 44821282544,
      "step": 56969
    },
    {
      "epoch": 6.0439210693825585,
      "grad_norm": 0.8361533504411125,
      "learning_rate": 2.4747730599532877e-05,
      "loss": 1.0079,
      "num_input_tokens_seen": 44822069216,
      "step": 56970
    },
    {
      "epoch": 6.04402715892213,
      "grad_norm": 0.9327860861335802,
      "learning_rate": 2.4747035666193034e-05,
      "loss": 0.9317,
      "num_input_tokens_seen": 44822856016,
      "step": 56971
    },
    {
      "epoch": 6.044133248461701,
      "grad_norm": 1.0953685220253,
      "learning_rate": 2.4746340733048672e-05,
      "loss": 0.9912,
      "num_input_tokens_seen": 44823642880,
      "step": 56972
    },
    {
      "epoch": 6.044239338001273,
      "grad_norm": 0.9271181339145356,
      "learning_rate": 2.474564580010033e-05,
      "loss": 0.9681,
      "num_input_tokens_seen": 44824429616,
      "step": 56973
    },
    {
      "epoch": 6.044345427540844,
      "grad_norm": 0.8205806654194557,
      "learning_rate": 2.474495086734855e-05,
      "loss": 0.9603,
      "num_input_tokens_seen": 44825216320,
      "step": 56974
    },
    {
      "epoch": 6.044451517080416,
      "grad_norm": 1.0416258702518382,
      "learning_rate": 2.4744255934793865e-05,
      "loss": 0.9483,
      "num_input_tokens_seen": 44826003088,
      "step": 56975
    },
    {
      "epoch": 6.044557606619987,
      "grad_norm": 0.9732198601508285,
      "learning_rate": 2.4743561002436803e-05,
      "loss": 1.0507,
      "num_input_tokens_seen": 44826789824,
      "step": 56976
    },
    {
      "epoch": 6.044663696159558,
      "grad_norm": 1.0909374208085194,
      "learning_rate": 2.4742866070277917e-05,
      "loss": 0.974,
      "num_input_tokens_seen": 44827576592,
      "step": 56977
    },
    {
      "epoch": 6.04476978569913,
      "grad_norm": 0.6632511723781541,
      "learning_rate": 2.4742171138317735e-05,
      "loss": 0.9901,
      "num_input_tokens_seen": 44828363392,
      "step": 56978
    },
    {
      "epoch": 6.044875875238701,
      "grad_norm": 1.05293564274243,
      "learning_rate": 2.4741476206556795e-05,
      "loss": 0.9565,
      "num_input_tokens_seen": 44829150112,
      "step": 56979
    },
    {
      "epoch": 6.044981964778273,
      "grad_norm": 1.1455185429157995,
      "learning_rate": 2.4740781274995633e-05,
      "loss": 1.0694,
      "num_input_tokens_seen": 44829936816,
      "step": 56980
    },
    {
      "epoch": 6.045088054317844,
      "grad_norm": 0.7952287029810918,
      "learning_rate": 2.4740086343634784e-05,
      "loss": 1.0071,
      "num_input_tokens_seen": 44830723632,
      "step": 56981
    },
    {
      "epoch": 6.045194143857415,
      "grad_norm": 0.7087758285678722,
      "learning_rate": 2.47393914124748e-05,
      "loss": 0.9588,
      "num_input_tokens_seen": 44831510432,
      "step": 56982
    },
    {
      "epoch": 6.045300233396987,
      "grad_norm": 1.0204674270497356,
      "learning_rate": 2.47386964815162e-05,
      "loss": 1.0066,
      "num_input_tokens_seen": 44832297136,
      "step": 56983
    },
    {
      "epoch": 6.045406322936558,
      "grad_norm": 0.7120470206672803,
      "learning_rate": 2.4738001550759527e-05,
      "loss": 0.9679,
      "num_input_tokens_seen": 44833083840,
      "step": 56984
    },
    {
      "epoch": 6.04551241247613,
      "grad_norm": 1.3924835297679967,
      "learning_rate": 2.473730662020532e-05,
      "loss": 1.0655,
      "num_input_tokens_seen": 44833870608,
      "step": 56985
    },
    {
      "epoch": 6.045618502015701,
      "grad_norm": 0.7890876653078508,
      "learning_rate": 2.473661168985412e-05,
      "loss": 0.9958,
      "num_input_tokens_seen": 44834657344,
      "step": 56986
    },
    {
      "epoch": 6.045724591555273,
      "grad_norm": 0.7491430805217578,
      "learning_rate": 2.4735916759706444e-05,
      "loss": 0.9888,
      "num_input_tokens_seen": 44835444192,
      "step": 56987
    },
    {
      "epoch": 6.045830681094844,
      "grad_norm": 0.9751527993575166,
      "learning_rate": 2.4735221829762858e-05,
      "loss": 0.8545,
      "num_input_tokens_seen": 44836230960,
      "step": 56988
    },
    {
      "epoch": 6.045936770634415,
      "grad_norm": 0.8013628021952802,
      "learning_rate": 2.4734526900023884e-05,
      "loss": 0.9628,
      "num_input_tokens_seen": 44837017776,
      "step": 56989
    },
    {
      "epoch": 6.046042860173987,
      "grad_norm": 0.742902491574074,
      "learning_rate": 2.473383197049005e-05,
      "loss": 1.0002,
      "num_input_tokens_seen": 44837804592,
      "step": 56990
    },
    {
      "epoch": 6.046148949713558,
      "grad_norm": 0.8476464902816884,
      "learning_rate": 2.473313704116191e-05,
      "loss": 0.988,
      "num_input_tokens_seen": 44838591328,
      "step": 56991
    },
    {
      "epoch": 6.04625503925313,
      "grad_norm": 0.7713308319393435,
      "learning_rate": 2.4732442112039994e-05,
      "loss": 0.9832,
      "num_input_tokens_seen": 44839378112,
      "step": 56992
    },
    {
      "epoch": 6.046361128792701,
      "grad_norm": 0.9395142573631171,
      "learning_rate": 2.4731747183124834e-05,
      "loss": 0.9247,
      "num_input_tokens_seen": 44840164784,
      "step": 56993
    },
    {
      "epoch": 6.046467218332272,
      "grad_norm": 0.7494018765781216,
      "learning_rate": 2.4731052254416977e-05,
      "loss": 0.9558,
      "num_input_tokens_seen": 44840951600,
      "step": 56994
    },
    {
      "epoch": 6.046573307871844,
      "grad_norm": 1.0091217420308896,
      "learning_rate": 2.4730357325916952e-05,
      "loss": 1.0316,
      "num_input_tokens_seen": 44841738288,
      "step": 56995
    },
    {
      "epoch": 6.046679397411415,
      "grad_norm": 0.7490013954985377,
      "learning_rate": 2.47296623976253e-05,
      "loss": 0.9129,
      "num_input_tokens_seen": 44842525072,
      "step": 56996
    },
    {
      "epoch": 6.046785486950987,
      "grad_norm": 0.7076659894430773,
      "learning_rate": 2.472896746954256e-05,
      "loss": 0.9772,
      "num_input_tokens_seen": 44843311856,
      "step": 56997
    },
    {
      "epoch": 6.046891576490558,
      "grad_norm": 0.8469586361644623,
      "learning_rate": 2.472827254166926e-05,
      "loss": 0.9045,
      "num_input_tokens_seen": 44844098656,
      "step": 56998
    },
    {
      "epoch": 6.046997666030129,
      "grad_norm": 0.7234470270274741,
      "learning_rate": 2.4727577614005948e-05,
      "loss": 0.9952,
      "num_input_tokens_seen": 44844885376,
      "step": 56999
    },
    {
      "epoch": 6.047103755569701,
      "grad_norm": 1.0056639858113459,
      "learning_rate": 2.4726882686553153e-05,
      "loss": 1.0662,
      "num_input_tokens_seen": 44845672080,
      "step": 57000
    },
    {
      "epoch": 6.047103755569701,
      "eval_loss": 1.5555492639541626,
      "eval_runtime": 65.4423,
      "eval_samples_per_second": 45.842,
      "eval_steps_per_second": 0.489,
      "num_input_tokens_seen": 44845672080,
      "step": 57000
    },
    {
      "epoch": 6.047209845109272,
      "grad_norm": 0.9642153395081433,
      "learning_rate": 2.4726187759311415e-05,
      "loss": 0.9851,
      "num_input_tokens_seen": 44846458832,
      "step": 57001
    },
    {
      "epoch": 6.047315934648844,
      "grad_norm": 1.3774765449058832,
      "learning_rate": 2.4725492832281276e-05,
      "loss": 1.1107,
      "num_input_tokens_seen": 44847245600,
      "step": 57002
    },
    {
      "epoch": 6.047422024188415,
      "grad_norm": 1.1113798129135537,
      "learning_rate": 2.4724797905463265e-05,
      "loss": 0.9892,
      "num_input_tokens_seen": 44848032336,
      "step": 57003
    },
    {
      "epoch": 6.047528113727987,
      "grad_norm": 0.9458627979353169,
      "learning_rate": 2.472410297885792e-05,
      "loss": 1.0172,
      "num_input_tokens_seen": 44848819040,
      "step": 57004
    },
    {
      "epoch": 6.047634203267558,
      "grad_norm": 0.8149426655240466,
      "learning_rate": 2.4723408052465783e-05,
      "loss": 1.0078,
      "num_input_tokens_seen": 44849605824,
      "step": 57005
    },
    {
      "epoch": 6.047740292807129,
      "grad_norm": 0.7603667298474011,
      "learning_rate": 2.4722713126287386e-05,
      "loss": 0.9431,
      "num_input_tokens_seen": 44850392624,
      "step": 57006
    },
    {
      "epoch": 6.047846382346701,
      "grad_norm": 0.7915433945375202,
      "learning_rate": 2.4722018200323266e-05,
      "loss": 0.9876,
      "num_input_tokens_seen": 44851179360,
      "step": 57007
    },
    {
      "epoch": 6.047952471886272,
      "grad_norm": 0.8900491256282657,
      "learning_rate": 2.472132327457397e-05,
      "loss": 0.9497,
      "num_input_tokens_seen": 44851966080,
      "step": 57008
    },
    {
      "epoch": 6.048058561425844,
      "grad_norm": 0.8434614517257023,
      "learning_rate": 2.472062834904002e-05,
      "loss": 1.0375,
      "num_input_tokens_seen": 44852752848,
      "step": 57009
    },
    {
      "epoch": 6.048164650965415,
      "grad_norm": 0.775559423768823,
      "learning_rate": 2.471993342372196e-05,
      "loss": 1.0489,
      "num_input_tokens_seen": 44853539536,
      "step": 57010
    },
    {
      "epoch": 6.048270740504986,
      "grad_norm": 0.7759130142927458,
      "learning_rate": 2.471923849862033e-05,
      "loss": 1.0127,
      "num_input_tokens_seen": 44854326320,
      "step": 57011
    },
    {
      "epoch": 6.048376830044558,
      "grad_norm": 0.8741878212201832,
      "learning_rate": 2.471854357373566e-05,
      "loss": 1.0042,
      "num_input_tokens_seen": 44855113024,
      "step": 57012
    },
    {
      "epoch": 6.048482919584129,
      "grad_norm": 0.7590115503436821,
      "learning_rate": 2.4717848649068497e-05,
      "loss": 1.0337,
      "num_input_tokens_seen": 44855899776,
      "step": 57013
    },
    {
      "epoch": 6.048589009123701,
      "grad_norm": 0.742952227054646,
      "learning_rate": 2.4717153724619376e-05,
      "loss": 1.0304,
      "num_input_tokens_seen": 44856686496,
      "step": 57014
    },
    {
      "epoch": 6.048695098663272,
      "grad_norm": 0.7756190156624219,
      "learning_rate": 2.471645880038882e-05,
      "loss": 0.9377,
      "num_input_tokens_seen": 44857473216,
      "step": 57015
    },
    {
      "epoch": 6.048801188202844,
      "grad_norm": 0.73166340995537,
      "learning_rate": 2.471576387637738e-05,
      "loss": 0.9887,
      "num_input_tokens_seen": 44858259920,
      "step": 57016
    },
    {
      "epoch": 6.048907277742415,
      "grad_norm": 0.7071589496289706,
      "learning_rate": 2.4715068952585594e-05,
      "loss": 0.8794,
      "num_input_tokens_seen": 44859046736,
      "step": 57017
    },
    {
      "epoch": 6.049013367281986,
      "grad_norm": 0.9661798885044627,
      "learning_rate": 2.471437402901399e-05,
      "loss": 0.9115,
      "num_input_tokens_seen": 44859833488,
      "step": 57018
    },
    {
      "epoch": 6.049119456821558,
      "grad_norm": 0.9158161851258886,
      "learning_rate": 2.471367910566311e-05,
      "loss": 0.9681,
      "num_input_tokens_seen": 44860620288,
      "step": 57019
    },
    {
      "epoch": 6.049225546361129,
      "grad_norm": 0.8806929517813255,
      "learning_rate": 2.4712984182533494e-05,
      "loss": 1.1078,
      "num_input_tokens_seen": 44861407136,
      "step": 57020
    },
    {
      "epoch": 6.0493316359007006,
      "grad_norm": 1.0787223782445086,
      "learning_rate": 2.471228925962567e-05,
      "loss": 1.0607,
      "num_input_tokens_seen": 44862193920,
      "step": 57021
    },
    {
      "epoch": 6.049437725440272,
      "grad_norm": 0.7406034834457439,
      "learning_rate": 2.471159433694018e-05,
      "loss": 0.9281,
      "num_input_tokens_seen": 44862980736,
      "step": 57022
    },
    {
      "epoch": 6.049543814979843,
      "grad_norm": 0.9156225629133233,
      "learning_rate": 2.4710899414477566e-05,
      "loss": 0.9604,
      "num_input_tokens_seen": 44863767440,
      "step": 57023
    },
    {
      "epoch": 6.0496499045194145,
      "grad_norm": 0.8435443865951793,
      "learning_rate": 2.4710204492238358e-05,
      "loss": 1.0139,
      "num_input_tokens_seen": 44864554160,
      "step": 57024
    },
    {
      "epoch": 6.049755994058986,
      "grad_norm": 0.884929278695414,
      "learning_rate": 2.4709509570223098e-05,
      "loss": 0.8999,
      "num_input_tokens_seen": 44865341024,
      "step": 57025
    },
    {
      "epoch": 6.0498620835985575,
      "grad_norm": 0.7668743050335309,
      "learning_rate": 2.4708814648432318e-05,
      "loss": 0.9801,
      "num_input_tokens_seen": 44866127824,
      "step": 57026
    },
    {
      "epoch": 6.0499681731381285,
      "grad_norm": 1.1375027320104776,
      "learning_rate": 2.4708119726866555e-05,
      "loss": 0.9807,
      "num_input_tokens_seen": 44866914528,
      "step": 57027
    },
    {
      "epoch": 6.0500742626776995,
      "grad_norm": 0.6152726788337215,
      "learning_rate": 2.4707424805526353e-05,
      "loss": 0.8943,
      "num_input_tokens_seen": 44867701392,
      "step": 57028
    },
    {
      "epoch": 6.0501803522172715,
      "grad_norm": 0.7411441110226251,
      "learning_rate": 2.4706729884412238e-05,
      "loss": 0.9544,
      "num_input_tokens_seen": 44868488128,
      "step": 57029
    },
    {
      "epoch": 6.0502864417568425,
      "grad_norm": 0.8498239233830901,
      "learning_rate": 2.470603496352476e-05,
      "loss": 0.9022,
      "num_input_tokens_seen": 44869274880,
      "step": 57030
    },
    {
      "epoch": 6.050392531296414,
      "grad_norm": 0.9901060930225195,
      "learning_rate": 2.470534004286445e-05,
      "loss": 0.9141,
      "num_input_tokens_seen": 44870061776,
      "step": 57031
    },
    {
      "epoch": 6.050498620835985,
      "grad_norm": 0.743276686677919,
      "learning_rate": 2.470464512243184e-05,
      "loss": 0.9583,
      "num_input_tokens_seen": 44870848576,
      "step": 57032
    },
    {
      "epoch": 6.050604710375557,
      "grad_norm": 0.8454523789004262,
      "learning_rate": 2.4703950202227475e-05,
      "loss": 0.9692,
      "num_input_tokens_seen": 44871635328,
      "step": 57033
    },
    {
      "epoch": 6.050710799915128,
      "grad_norm": 0.729709310367351,
      "learning_rate": 2.470325528225189e-05,
      "loss": 1.0038,
      "num_input_tokens_seen": 44872422096,
      "step": 57034
    },
    {
      "epoch": 6.050816889454699,
      "grad_norm": 0.7976924408892745,
      "learning_rate": 2.4702560362505616e-05,
      "loss": 0.9599,
      "num_input_tokens_seen": 44873208816,
      "step": 57035
    },
    {
      "epoch": 6.050922978994271,
      "grad_norm": 1.1307980013271448,
      "learning_rate": 2.4701865442989188e-05,
      "loss": 1.0464,
      "num_input_tokens_seen": 44873995568,
      "step": 57036
    },
    {
      "epoch": 6.051029068533842,
      "grad_norm": 0.7215196921057129,
      "learning_rate": 2.470117052370316e-05,
      "loss": 0.9265,
      "num_input_tokens_seen": 44874782368,
      "step": 57037
    },
    {
      "epoch": 6.051135158073414,
      "grad_norm": 0.9063257565232034,
      "learning_rate": 2.4700475604648056e-05,
      "loss": 0.9641,
      "num_input_tokens_seen": 44875569056,
      "step": 57038
    },
    {
      "epoch": 6.051241247612985,
      "grad_norm": 0.7749706007582837,
      "learning_rate": 2.4699780685824412e-05,
      "loss": 1.0164,
      "num_input_tokens_seen": 44876355872,
      "step": 57039
    },
    {
      "epoch": 6.051347337152556,
      "grad_norm": 0.9746315180708788,
      "learning_rate": 2.469908576723278e-05,
      "loss": 1.0654,
      "num_input_tokens_seen": 44877142560,
      "step": 57040
    },
    {
      "epoch": 6.051453426692128,
      "grad_norm": 0.6890155123225499,
      "learning_rate": 2.469839084887368e-05,
      "loss": 0.9483,
      "num_input_tokens_seen": 44877929296,
      "step": 57041
    },
    {
      "epoch": 6.051559516231699,
      "grad_norm": 0.9233487122097511,
      "learning_rate": 2.4697695930747648e-05,
      "loss": 0.9641,
      "num_input_tokens_seen": 44878716048,
      "step": 57042
    },
    {
      "epoch": 6.051665605771271,
      "grad_norm": 0.920459100524618,
      "learning_rate": 2.4697001012855236e-05,
      "loss": 1.0667,
      "num_input_tokens_seen": 44879502800,
      "step": 57043
    },
    {
      "epoch": 6.051771695310842,
      "grad_norm": 1.0228643080759747,
      "learning_rate": 2.4696306095196975e-05,
      "loss": 1.0202,
      "num_input_tokens_seen": 44880289568,
      "step": 57044
    },
    {
      "epoch": 6.051877784850414,
      "grad_norm": 0.980940719101002,
      "learning_rate": 2.469561117777339e-05,
      "loss": 0.9554,
      "num_input_tokens_seen": 44881076352,
      "step": 57045
    },
    {
      "epoch": 6.051983874389985,
      "grad_norm": 1.0649527513238775,
      "learning_rate": 2.4694916260585034e-05,
      "loss": 0.942,
      "num_input_tokens_seen": 44881863200,
      "step": 57046
    },
    {
      "epoch": 6.052089963929556,
      "grad_norm": 0.8307530065677767,
      "learning_rate": 2.469422134363244e-05,
      "loss": 0.9746,
      "num_input_tokens_seen": 44882649936,
      "step": 57047
    },
    {
      "epoch": 6.052196053469128,
      "grad_norm": 0.7974867368295894,
      "learning_rate": 2.4693526426916136e-05,
      "loss": 0.8981,
      "num_input_tokens_seen": 44883436752,
      "step": 57048
    },
    {
      "epoch": 6.052302143008699,
      "grad_norm": 0.8452565627129487,
      "learning_rate": 2.469283151043667e-05,
      "loss": 0.9906,
      "num_input_tokens_seen": 44884223472,
      "step": 57049
    },
    {
      "epoch": 6.052408232548271,
      "grad_norm": 0.9242653752170779,
      "learning_rate": 2.469213659419457e-05,
      "loss": 0.9718,
      "num_input_tokens_seen": 44885010256,
      "step": 57050
    },
    {
      "epoch": 6.052514322087842,
      "grad_norm": 0.8713292851598506,
      "learning_rate": 2.4691441678190384e-05,
      "loss": 1.0422,
      "num_input_tokens_seen": 44885797056,
      "step": 57051
    },
    {
      "epoch": 6.052620411627413,
      "grad_norm": 0.7388890808010109,
      "learning_rate": 2.4690746762424642e-05,
      "loss": 1.0092,
      "num_input_tokens_seen": 44886583872,
      "step": 57052
    },
    {
      "epoch": 6.052726501166985,
      "grad_norm": 0.7594290673543057,
      "learning_rate": 2.4690051846897878e-05,
      "loss": 0.9494,
      "num_input_tokens_seen": 44887370576,
      "step": 57053
    },
    {
      "epoch": 6.052832590706556,
      "grad_norm": 0.7920149687160067,
      "learning_rate": 2.4689356931610635e-05,
      "loss": 1.0933,
      "num_input_tokens_seen": 44888157344,
      "step": 57054
    },
    {
      "epoch": 6.052938680246128,
      "grad_norm": 0.8369216385256066,
      "learning_rate": 2.468866201656345e-05,
      "loss": 1.0017,
      "num_input_tokens_seen": 44888944144,
      "step": 57055
    },
    {
      "epoch": 6.053044769785699,
      "grad_norm": 0.6574463774538637,
      "learning_rate": 2.4687967101756854e-05,
      "loss": 0.8925,
      "num_input_tokens_seen": 44889730976,
      "step": 57056
    },
    {
      "epoch": 6.053150859325271,
      "grad_norm": 0.9160375798094329,
      "learning_rate": 2.468727218719139e-05,
      "loss": 1.0298,
      "num_input_tokens_seen": 44890517744,
      "step": 57057
    },
    {
      "epoch": 6.053256948864842,
      "grad_norm": 0.6715281585048658,
      "learning_rate": 2.4686577272867594e-05,
      "loss": 1.0074,
      "num_input_tokens_seen": 44891304400,
      "step": 57058
    },
    {
      "epoch": 6.053363038404413,
      "grad_norm": 0.7231016389677694,
      "learning_rate": 2.4685882358786e-05,
      "loss": 0.963,
      "num_input_tokens_seen": 44892091168,
      "step": 57059
    },
    {
      "epoch": 6.053469127943985,
      "grad_norm": 0.7157973943472913,
      "learning_rate": 2.468518744494715e-05,
      "loss": 0.9751,
      "num_input_tokens_seen": 44892877936,
      "step": 57060
    },
    {
      "epoch": 6.053575217483556,
      "grad_norm": 0.7239277379918901,
      "learning_rate": 2.4684492531351576e-05,
      "loss": 0.9431,
      "num_input_tokens_seen": 44893664720,
      "step": 57061
    },
    {
      "epoch": 6.053681307023128,
      "grad_norm": 0.7384907138253721,
      "learning_rate": 2.4683797617999813e-05,
      "loss": 1.0005,
      "num_input_tokens_seen": 44894451600,
      "step": 57062
    },
    {
      "epoch": 6.053787396562699,
      "grad_norm": 0.6731447425127749,
      "learning_rate": 2.468310270489241e-05,
      "loss": 0.9659,
      "num_input_tokens_seen": 44895238352,
      "step": 57063
    },
    {
      "epoch": 6.05389348610227,
      "grad_norm": 0.7580206467161481,
      "learning_rate": 2.4682407792029892e-05,
      "loss": 0.9401,
      "num_input_tokens_seen": 44896025088,
      "step": 57064
    },
    {
      "epoch": 6.053999575641842,
      "grad_norm": 0.6788975792690801,
      "learning_rate": 2.4681712879412795e-05,
      "loss": 1.0069,
      "num_input_tokens_seen": 44896811856,
      "step": 57065
    },
    {
      "epoch": 6.054105665181413,
      "grad_norm": 0.7873966190597445,
      "learning_rate": 2.4681017967041666e-05,
      "loss": 0.984,
      "num_input_tokens_seen": 44897598560,
      "step": 57066
    },
    {
      "epoch": 6.054211754720985,
      "grad_norm": 0.7731882369832539,
      "learning_rate": 2.4680323054917033e-05,
      "loss": 1.0438,
      "num_input_tokens_seen": 44898385312,
      "step": 57067
    },
    {
      "epoch": 6.054317844260556,
      "grad_norm": 0.6852293841798808,
      "learning_rate": 2.467962814303944e-05,
      "loss": 0.9188,
      "num_input_tokens_seen": 44899172096,
      "step": 57068
    },
    {
      "epoch": 6.054423933800127,
      "grad_norm": 0.7626168525427554,
      "learning_rate": 2.4678933231409424e-05,
      "loss": 0.9943,
      "num_input_tokens_seen": 44899958816,
      "step": 57069
    },
    {
      "epoch": 6.054530023339699,
      "grad_norm": 0.7894571261592149,
      "learning_rate": 2.467823832002751e-05,
      "loss": 0.9635,
      "num_input_tokens_seen": 44900745536,
      "step": 57070
    },
    {
      "epoch": 6.05463611287927,
      "grad_norm": 0.7068927338446723,
      "learning_rate": 2.4677543408894252e-05,
      "loss": 1.024,
      "num_input_tokens_seen": 44901532288,
      "step": 57071
    },
    {
      "epoch": 6.054742202418842,
      "grad_norm": 0.8040622867049569,
      "learning_rate": 2.467684849801018e-05,
      "loss": 1.0381,
      "num_input_tokens_seen": 44902318976,
      "step": 57072
    },
    {
      "epoch": 6.054848291958413,
      "grad_norm": 0.7361892742304348,
      "learning_rate": 2.467615358737582e-05,
      "loss": 0.9441,
      "num_input_tokens_seen": 44903105776,
      "step": 57073
    },
    {
      "epoch": 6.054954381497985,
      "grad_norm": 0.8587915407065744,
      "learning_rate": 2.467545867699173e-05,
      "loss": 1.0037,
      "num_input_tokens_seen": 44903892464,
      "step": 57074
    },
    {
      "epoch": 6.055060471037556,
      "grad_norm": 0.8043532096235678,
      "learning_rate": 2.4674763766858435e-05,
      "loss": 1.0331,
      "num_input_tokens_seen": 44904679216,
      "step": 57075
    },
    {
      "epoch": 6.055166560577127,
      "grad_norm": 0.8326973543590197,
      "learning_rate": 2.4674068856976464e-05,
      "loss": 0.9829,
      "num_input_tokens_seen": 44905466000,
      "step": 57076
    },
    {
      "epoch": 6.055272650116699,
      "grad_norm": 0.6795592311885584,
      "learning_rate": 2.4673373947346374e-05,
      "loss": 1.0208,
      "num_input_tokens_seen": 44906252736,
      "step": 57077
    },
    {
      "epoch": 6.05537873965627,
      "grad_norm": 0.6572904884542937,
      "learning_rate": 2.4672679037968687e-05,
      "loss": 0.9349,
      "num_input_tokens_seen": 44907039504,
      "step": 57078
    },
    {
      "epoch": 6.055484829195842,
      "grad_norm": 0.7850327944193084,
      "learning_rate": 2.467198412884394e-05,
      "loss": 1.0794,
      "num_input_tokens_seen": 44907826304,
      "step": 57079
    },
    {
      "epoch": 6.055590918735413,
      "grad_norm": 0.8498701759414338,
      "learning_rate": 2.467128921997268e-05,
      "loss": 1.0448,
      "num_input_tokens_seen": 44908613008,
      "step": 57080
    },
    {
      "epoch": 6.055697008274984,
      "grad_norm": 0.6981139985718643,
      "learning_rate": 2.4670594311355434e-05,
      "loss": 0.9023,
      "num_input_tokens_seen": 44909399792,
      "step": 57081
    },
    {
      "epoch": 6.055803097814556,
      "grad_norm": 0.8523745481715396,
      "learning_rate": 2.466989940299274e-05,
      "loss": 1.0549,
      "num_input_tokens_seen": 44910186528,
      "step": 57082
    },
    {
      "epoch": 6.055909187354127,
      "grad_norm": 0.7208295900982774,
      "learning_rate": 2.4669204494885144e-05,
      "loss": 1.0573,
      "num_input_tokens_seen": 44910973232,
      "step": 57083
    },
    {
      "epoch": 6.056015276893699,
      "grad_norm": 0.5734814570282308,
      "learning_rate": 2.4668509587033173e-05,
      "loss": 0.9177,
      "num_input_tokens_seen": 44911760032,
      "step": 57084
    },
    {
      "epoch": 6.05612136643327,
      "grad_norm": 0.9343999305369488,
      "learning_rate": 2.4667814679437375e-05,
      "loss": 1.0243,
      "num_input_tokens_seen": 44912546656,
      "step": 57085
    },
    {
      "epoch": 6.0562274559728415,
      "grad_norm": 0.964117428133548,
      "learning_rate": 2.4667119772098275e-05,
      "loss": 0.9655,
      "num_input_tokens_seen": 44913333456,
      "step": 57086
    },
    {
      "epoch": 6.0563335455124125,
      "grad_norm": 1.131620127096284,
      "learning_rate": 2.466642486501641e-05,
      "loss": 1.009,
      "num_input_tokens_seen": 44914120176,
      "step": 57087
    },
    {
      "epoch": 6.056439635051984,
      "grad_norm": 1.1872296102491977,
      "learning_rate": 2.4665729958192333e-05,
      "loss": 0.9426,
      "num_input_tokens_seen": 44914906944,
      "step": 57088
    },
    {
      "epoch": 6.0565457245915555,
      "grad_norm": 0.726258794788813,
      "learning_rate": 2.4665035051626564e-05,
      "loss": 0.9668,
      "num_input_tokens_seen": 44915693712,
      "step": 57089
    },
    {
      "epoch": 6.0566518141311265,
      "grad_norm": 0.8679071250059188,
      "learning_rate": 2.4664340145319645e-05,
      "loss": 1.0161,
      "num_input_tokens_seen": 44916480352,
      "step": 57090
    },
    {
      "epoch": 6.056757903670698,
      "grad_norm": 1.4504058659970664,
      "learning_rate": 2.4663645239272115e-05,
      "loss": 1.0314,
      "num_input_tokens_seen": 44917267216,
      "step": 57091
    },
    {
      "epoch": 6.0568639932102695,
      "grad_norm": 0.8069878566693206,
      "learning_rate": 2.4662950333484512e-05,
      "loss": 1.0023,
      "num_input_tokens_seen": 44918053920,
      "step": 57092
    },
    {
      "epoch": 6.0569700827498405,
      "grad_norm": 1.1525821337456388,
      "learning_rate": 2.466225542795737e-05,
      "loss": 0.9678,
      "num_input_tokens_seen": 44918840688,
      "step": 57093
    },
    {
      "epoch": 6.057076172289412,
      "grad_norm": 1.1480434893494367,
      "learning_rate": 2.4661560522691226e-05,
      "loss": 1.0466,
      "num_input_tokens_seen": 44919627456,
      "step": 57094
    },
    {
      "epoch": 6.0571822618289834,
      "grad_norm": 1.08302333578983,
      "learning_rate": 2.4660865617686624e-05,
      "loss": 1.0165,
      "num_input_tokens_seen": 44920414288,
      "step": 57095
    },
    {
      "epoch": 6.057288351368555,
      "grad_norm": 1.0529337516530923,
      "learning_rate": 2.4660170712944087e-05,
      "loss": 1.0088,
      "num_input_tokens_seen": 44921200976,
      "step": 57096
    },
    {
      "epoch": 6.057394440908126,
      "grad_norm": 1.094467711072103,
      "learning_rate": 2.4659475808464164e-05,
      "loss": 1.0189,
      "num_input_tokens_seen": 44921987680,
      "step": 57097
    },
    {
      "epoch": 6.057500530447697,
      "grad_norm": 1.2013470121570957,
      "learning_rate": 2.4658780904247384e-05,
      "loss": 0.9786,
      "num_input_tokens_seen": 44922774480,
      "step": 57098
    },
    {
      "epoch": 6.057606619987269,
      "grad_norm": 0.7963009019855465,
      "learning_rate": 2.4658086000294292e-05,
      "loss": 0.9176,
      "num_input_tokens_seen": 44923561280,
      "step": 57099
    },
    {
      "epoch": 6.05771270952684,
      "grad_norm": 1.017837016621767,
      "learning_rate": 2.4657391096605423e-05,
      "loss": 0.9687,
      "num_input_tokens_seen": 44924348000,
      "step": 57100
    },
    {
      "epoch": 6.057818799066412,
      "grad_norm": 0.9611251675499743,
      "learning_rate": 2.4656696193181306e-05,
      "loss": 1.0085,
      "num_input_tokens_seen": 44925134720,
      "step": 57101
    },
    {
      "epoch": 6.057924888605983,
      "grad_norm": 0.9711797698648876,
      "learning_rate": 2.465600129002249e-05,
      "loss": 0.8857,
      "num_input_tokens_seen": 44925921504,
      "step": 57102
    },
    {
      "epoch": 6.058030978145555,
      "grad_norm": 1.0072782420147424,
      "learning_rate": 2.4655306387129508e-05,
      "loss": 1.0095,
      "num_input_tokens_seen": 44926708240,
      "step": 57103
    },
    {
      "epoch": 6.058137067685126,
      "grad_norm": 0.8752984769687219,
      "learning_rate": 2.4654611484502886e-05,
      "loss": 0.9807,
      "num_input_tokens_seen": 44927495024,
      "step": 57104
    },
    {
      "epoch": 6.058243157224697,
      "grad_norm": 0.7808928936291638,
      "learning_rate": 2.4653916582143178e-05,
      "loss": 0.9515,
      "num_input_tokens_seen": 44928281776,
      "step": 57105
    },
    {
      "epoch": 6.058349246764269,
      "grad_norm": 0.7862585875532628,
      "learning_rate": 2.4653221680050912e-05,
      "loss": 1.0139,
      "num_input_tokens_seen": 44929068560,
      "step": 57106
    },
    {
      "epoch": 6.05845533630384,
      "grad_norm": 0.8624252872965195,
      "learning_rate": 2.465252677822662e-05,
      "loss": 0.9801,
      "num_input_tokens_seen": 44929855296,
      "step": 57107
    },
    {
      "epoch": 6.058561425843412,
      "grad_norm": 0.7350693274622722,
      "learning_rate": 2.465183187667085e-05,
      "loss": 0.9254,
      "num_input_tokens_seen": 44930642080,
      "step": 57108
    },
    {
      "epoch": 6.058667515382983,
      "grad_norm": 0.8152300851457543,
      "learning_rate": 2.4651136975384138e-05,
      "loss": 0.9779,
      "num_input_tokens_seen": 44931428928,
      "step": 57109
    },
    {
      "epoch": 6.058773604922554,
      "grad_norm": 0.8446830781871233,
      "learning_rate": 2.4650442074367008e-05,
      "loss": 0.9964,
      "num_input_tokens_seen": 44932215728,
      "step": 57110
    },
    {
      "epoch": 6.058879694462126,
      "grad_norm": 1.010620086654398,
      "learning_rate": 2.4649747173620013e-05,
      "loss": 1.0266,
      "num_input_tokens_seen": 44933002432,
      "step": 57111
    },
    {
      "epoch": 6.058985784001697,
      "grad_norm": 1.2463772460585754,
      "learning_rate": 2.4649052273143683e-05,
      "loss": 0.8995,
      "num_input_tokens_seen": 44933789264,
      "step": 57112
    },
    {
      "epoch": 6.059091873541269,
      "grad_norm": 0.943009298723744,
      "learning_rate": 2.464835737293855e-05,
      "loss": 1.041,
      "num_input_tokens_seen": 44934575968,
      "step": 57113
    },
    {
      "epoch": 6.05919796308084,
      "grad_norm": 1.1421373508514776,
      "learning_rate": 2.464766247300516e-05,
      "loss": 0.9962,
      "num_input_tokens_seen": 44935362720,
      "step": 57114
    },
    {
      "epoch": 6.059304052620412,
      "grad_norm": 0.8220693484232334,
      "learning_rate": 2.464696757334404e-05,
      "loss": 0.9234,
      "num_input_tokens_seen": 44936149552,
      "step": 57115
    },
    {
      "epoch": 6.059410142159983,
      "grad_norm": 0.8164736250491332,
      "learning_rate": 2.4646272673955742e-05,
      "loss": 1.0412,
      "num_input_tokens_seen": 44936936384,
      "step": 57116
    },
    {
      "epoch": 6.059516231699554,
      "grad_norm": 1.1419043875172517,
      "learning_rate": 2.464557777484079e-05,
      "loss": 0.986,
      "num_input_tokens_seen": 44937723152,
      "step": 57117
    },
    {
      "epoch": 6.059622321239126,
      "grad_norm": 0.7724739450417427,
      "learning_rate": 2.4644882875999725e-05,
      "loss": 0.9733,
      "num_input_tokens_seen": 44938509920,
      "step": 57118
    },
    {
      "epoch": 6.059728410778697,
      "grad_norm": 1.0669011259981747,
      "learning_rate": 2.4644187977433085e-05,
      "loss": 1.0419,
      "num_input_tokens_seen": 44939296688,
      "step": 57119
    },
    {
      "epoch": 6.059834500318269,
      "grad_norm": 0.8069185049865789,
      "learning_rate": 2.464349307914141e-05,
      "loss": 0.9605,
      "num_input_tokens_seen": 44940083392,
      "step": 57120
    },
    {
      "epoch": 6.05994058985784,
      "grad_norm": 0.8657895294861032,
      "learning_rate": 2.4642798181125224e-05,
      "loss": 0.9191,
      "num_input_tokens_seen": 44940870224,
      "step": 57121
    },
    {
      "epoch": 6.060046679397411,
      "grad_norm": 0.8396429770091002,
      "learning_rate": 2.4642103283385078e-05,
      "loss": 0.9596,
      "num_input_tokens_seen": 44941656960,
      "step": 57122
    },
    {
      "epoch": 6.060152768936983,
      "grad_norm": 0.8848366470841765,
      "learning_rate": 2.464140838592151e-05,
      "loss": 1.0552,
      "num_input_tokens_seen": 44942443760,
      "step": 57123
    },
    {
      "epoch": 6.060258858476554,
      "grad_norm": 0.9819172243465807,
      "learning_rate": 2.464071348873504e-05,
      "loss": 1.0183,
      "num_input_tokens_seen": 44943230464,
      "step": 57124
    },
    {
      "epoch": 6.060364948016126,
      "grad_norm": 0.7324777221091996,
      "learning_rate": 2.4640018591826224e-05,
      "loss": 0.9748,
      "num_input_tokens_seen": 44944017136,
      "step": 57125
    },
    {
      "epoch": 6.060471037555697,
      "grad_norm": 0.8551423115857764,
      "learning_rate": 2.463932369519559e-05,
      "loss": 0.9639,
      "num_input_tokens_seen": 44944803952,
      "step": 57126
    },
    {
      "epoch": 6.060577127095268,
      "grad_norm": 0.7564665740303526,
      "learning_rate": 2.463862879884367e-05,
      "loss": 1.0072,
      "num_input_tokens_seen": 44945590576,
      "step": 57127
    },
    {
      "epoch": 6.06068321663484,
      "grad_norm": 0.7191609393799635,
      "learning_rate": 2.4637933902771012e-05,
      "loss": 1.0111,
      "num_input_tokens_seen": 44946377376,
      "step": 57128
    },
    {
      "epoch": 6.060789306174411,
      "grad_norm": 0.7236093105198091,
      "learning_rate": 2.463723900697815e-05,
      "loss": 1.0166,
      "num_input_tokens_seen": 44947164048,
      "step": 57129
    },
    {
      "epoch": 6.060895395713983,
      "grad_norm": 0.9817181400787841,
      "learning_rate": 2.4636544111465613e-05,
      "loss": 1.0073,
      "num_input_tokens_seen": 44947950848,
      "step": 57130
    },
    {
      "epoch": 6.061001485253554,
      "grad_norm": 0.7468369132900381,
      "learning_rate": 2.4635849216233938e-05,
      "loss": 0.9793,
      "num_input_tokens_seen": 44948737584,
      "step": 57131
    },
    {
      "epoch": 6.061107574793126,
      "grad_norm": 0.7472129756330798,
      "learning_rate": 2.4635154321283678e-05,
      "loss": 0.9851,
      "num_input_tokens_seen": 44949524480,
      "step": 57132
    },
    {
      "epoch": 6.061213664332697,
      "grad_norm": 0.7253463173257372,
      "learning_rate": 2.4634459426615365e-05,
      "loss": 0.9997,
      "num_input_tokens_seen": 44950311328,
      "step": 57133
    },
    {
      "epoch": 6.061319753872268,
      "grad_norm": 0.7118715510227349,
      "learning_rate": 2.463376453222952e-05,
      "loss": 0.9286,
      "num_input_tokens_seen": 44951098064,
      "step": 57134
    },
    {
      "epoch": 6.06142584341184,
      "grad_norm": 0.9301205293477539,
      "learning_rate": 2.46330696381267e-05,
      "loss": 0.9917,
      "num_input_tokens_seen": 44951884864,
      "step": 57135
    },
    {
      "epoch": 6.061531932951411,
      "grad_norm": 0.7998851707145216,
      "learning_rate": 2.4632374744307424e-05,
      "loss": 1.0151,
      "num_input_tokens_seen": 44952671648,
      "step": 57136
    },
    {
      "epoch": 6.061638022490983,
      "grad_norm": 1.1679619003144852,
      "learning_rate": 2.4631679850772248e-05,
      "loss": 0.9936,
      "num_input_tokens_seen": 44953458528,
      "step": 57137
    },
    {
      "epoch": 6.061744112030554,
      "grad_norm": 0.7230653284308812,
      "learning_rate": 2.4630984957521698e-05,
      "loss": 1.0155,
      "num_input_tokens_seen": 44954245344,
      "step": 57138
    },
    {
      "epoch": 6.061850201570125,
      "grad_norm": 0.8297663121386749,
      "learning_rate": 2.46302900645563e-05,
      "loss": 1.007,
      "num_input_tokens_seen": 44955032016,
      "step": 57139
    },
    {
      "epoch": 6.061956291109697,
      "grad_norm": 0.828441055243346,
      "learning_rate": 2.4629595171876614e-05,
      "loss": 1.0083,
      "num_input_tokens_seen": 44955818784,
      "step": 57140
    },
    {
      "epoch": 6.062062380649268,
      "grad_norm": 0.7667463037786512,
      "learning_rate": 2.4628900279483167e-05,
      "loss": 1.0388,
      "num_input_tokens_seen": 44956605552,
      "step": 57141
    },
    {
      "epoch": 6.06216847018884,
      "grad_norm": 0.791406551581423,
      "learning_rate": 2.4628205387376488e-05,
      "loss": 0.9783,
      "num_input_tokens_seen": 44957392480,
      "step": 57142
    },
    {
      "epoch": 6.062274559728411,
      "grad_norm": 0.6661468756042628,
      "learning_rate": 2.4627510495557125e-05,
      "loss": 0.9459,
      "num_input_tokens_seen": 44958179232,
      "step": 57143
    },
    {
      "epoch": 6.062380649267983,
      "grad_norm": 0.6743340635373551,
      "learning_rate": 2.4626815604025616e-05,
      "loss": 0.9595,
      "num_input_tokens_seen": 44958965920,
      "step": 57144
    },
    {
      "epoch": 6.062486738807554,
      "grad_norm": 0.6809848780040064,
      "learning_rate": 2.4626120712782483e-05,
      "loss": 1.0031,
      "num_input_tokens_seen": 44959752720,
      "step": 57145
    },
    {
      "epoch": 6.062592828347125,
      "grad_norm": 0.81206792964654,
      "learning_rate": 2.462542582182828e-05,
      "loss": 0.9909,
      "num_input_tokens_seen": 44960539568,
      "step": 57146
    },
    {
      "epoch": 6.062698917886697,
      "grad_norm": 0.7210036614918544,
      "learning_rate": 2.4624730931163536e-05,
      "loss": 0.9734,
      "num_input_tokens_seen": 44961326368,
      "step": 57147
    },
    {
      "epoch": 6.062805007426268,
      "grad_norm": 0.7565794559101922,
      "learning_rate": 2.4624036040788785e-05,
      "loss": 0.954,
      "num_input_tokens_seen": 44962113184,
      "step": 57148
    },
    {
      "epoch": 6.0629110969658395,
      "grad_norm": 0.7443037756491641,
      "learning_rate": 2.462334115070457e-05,
      "loss": 1.0501,
      "num_input_tokens_seen": 44962899952,
      "step": 57149
    },
    {
      "epoch": 6.0630171865054105,
      "grad_norm": 0.9789938707623262,
      "learning_rate": 2.4622646260911426e-05,
      "loss": 1.0429,
      "num_input_tokens_seen": 44963686672,
      "step": 57150
    },
    {
      "epoch": 6.063123276044982,
      "grad_norm": 0.7146666716113369,
      "learning_rate": 2.462195137140989e-05,
      "loss": 0.9312,
      "num_input_tokens_seen": 44964473360,
      "step": 57151
    },
    {
      "epoch": 6.0632293655845535,
      "grad_norm": 0.8326880156322297,
      "learning_rate": 2.46212564822005e-05,
      "loss": 1.0146,
      "num_input_tokens_seen": 44965260192,
      "step": 57152
    },
    {
      "epoch": 6.0633354551241245,
      "grad_norm": 0.6946335301387069,
      "learning_rate": 2.4620561593283787e-05,
      "loss": 0.9649,
      "num_input_tokens_seen": 44966046912,
      "step": 57153
    },
    {
      "epoch": 6.0634415446636964,
      "grad_norm": 0.7906989119822461,
      "learning_rate": 2.46198667046603e-05,
      "loss": 0.9865,
      "num_input_tokens_seen": 44966833680,
      "step": 57154
    },
    {
      "epoch": 6.0635476342032675,
      "grad_norm": 0.7367756287292548,
      "learning_rate": 2.4619171816330565e-05,
      "loss": 1.0569,
      "num_input_tokens_seen": 44967620384,
      "step": 57155
    },
    {
      "epoch": 6.0636537237428385,
      "grad_norm": 0.7581387638576688,
      "learning_rate": 2.461847692829512e-05,
      "loss": 0.9559,
      "num_input_tokens_seen": 44968407168,
      "step": 57156
    },
    {
      "epoch": 6.06375981328241,
      "grad_norm": 0.6832165368620351,
      "learning_rate": 2.461778204055451e-05,
      "loss": 1.0373,
      "num_input_tokens_seen": 44969193904,
      "step": 57157
    },
    {
      "epoch": 6.0638659028219815,
      "grad_norm": 0.7686592063367444,
      "learning_rate": 2.4617087153109265e-05,
      "loss": 1.0682,
      "num_input_tokens_seen": 44969980560,
      "step": 57158
    },
    {
      "epoch": 6.063971992361553,
      "grad_norm": 0.7035052806528947,
      "learning_rate": 2.4616392265959924e-05,
      "loss": 1.0041,
      "num_input_tokens_seen": 44970767408,
      "step": 57159
    },
    {
      "epoch": 6.064078081901124,
      "grad_norm": 0.8144851470156051,
      "learning_rate": 2.4615697379107025e-05,
      "loss": 0.9989,
      "num_input_tokens_seen": 44971554224,
      "step": 57160
    },
    {
      "epoch": 6.064184171440696,
      "grad_norm": 0.7255362678711952,
      "learning_rate": 2.4615002492551105e-05,
      "loss": 1.0133,
      "num_input_tokens_seen": 44972341024,
      "step": 57161
    },
    {
      "epoch": 6.064290260980267,
      "grad_norm": 0.7786339684571018,
      "learning_rate": 2.461430760629269e-05,
      "loss": 1.0194,
      "num_input_tokens_seen": 44973127744,
      "step": 57162
    },
    {
      "epoch": 6.064396350519838,
      "grad_norm": 0.806916769951165,
      "learning_rate": 2.4613612720332336e-05,
      "loss": 1.0398,
      "num_input_tokens_seen": 44973914560,
      "step": 57163
    },
    {
      "epoch": 6.06450244005941,
      "grad_norm": 0.7507424353003965,
      "learning_rate": 2.4612917834670575e-05,
      "loss": 0.9215,
      "num_input_tokens_seen": 44974701424,
      "step": 57164
    },
    {
      "epoch": 6.064608529598981,
      "grad_norm": 0.7184170109549741,
      "learning_rate": 2.461222294930793e-05,
      "loss": 1.0167,
      "num_input_tokens_seen": 44975488208,
      "step": 57165
    },
    {
      "epoch": 6.064714619138553,
      "grad_norm": 0.6858771998622438,
      "learning_rate": 2.461152806424495e-05,
      "loss": 0.9836,
      "num_input_tokens_seen": 44976274912,
      "step": 57166
    },
    {
      "epoch": 6.064820708678124,
      "grad_norm": 0.834081894284642,
      "learning_rate": 2.4610833179482174e-05,
      "loss": 1.0104,
      "num_input_tokens_seen": 44977061712,
      "step": 57167
    },
    {
      "epoch": 6.064926798217695,
      "grad_norm": 0.7325969647879051,
      "learning_rate": 2.4610138295020126e-05,
      "loss": 1.0204,
      "num_input_tokens_seen": 44977848368,
      "step": 57168
    },
    {
      "epoch": 6.065032887757267,
      "grad_norm": 0.7085039303500255,
      "learning_rate": 2.460944341085936e-05,
      "loss": 0.9202,
      "num_input_tokens_seen": 44978635248,
      "step": 57169
    },
    {
      "epoch": 6.065138977296838,
      "grad_norm": 0.7776211017256585,
      "learning_rate": 2.46087485270004e-05,
      "loss": 1.0109,
      "num_input_tokens_seen": 44979421984,
      "step": 57170
    },
    {
      "epoch": 6.06524506683641,
      "grad_norm": 0.6852398383377662,
      "learning_rate": 2.460805364344379e-05,
      "loss": 0.9622,
      "num_input_tokens_seen": 44980208752,
      "step": 57171
    },
    {
      "epoch": 6.065351156375981,
      "grad_norm": 0.6741139721751953,
      "learning_rate": 2.4607358760190067e-05,
      "loss": 0.966,
      "num_input_tokens_seen": 44980995648,
      "step": 57172
    },
    {
      "epoch": 6.065457245915553,
      "grad_norm": 0.7962754838441485,
      "learning_rate": 2.4606663877239756e-05,
      "loss": 0.9872,
      "num_input_tokens_seen": 44981782320,
      "step": 57173
    },
    {
      "epoch": 6.065563335455124,
      "grad_norm": 0.7645381829464288,
      "learning_rate": 2.4605968994593416e-05,
      "loss": 0.9402,
      "num_input_tokens_seen": 44982569200,
      "step": 57174
    },
    {
      "epoch": 6.065669424994695,
      "grad_norm": 0.6164227453999056,
      "learning_rate": 2.4605274112251566e-05,
      "loss": 0.9484,
      "num_input_tokens_seen": 44983355920,
      "step": 57175
    },
    {
      "epoch": 6.065775514534267,
      "grad_norm": 0.88717722356892,
      "learning_rate": 2.4604579230214747e-05,
      "loss": 1.0013,
      "num_input_tokens_seen": 44984142768,
      "step": 57176
    },
    {
      "epoch": 6.065881604073838,
      "grad_norm": 0.7318651756410671,
      "learning_rate": 2.46038843484835e-05,
      "loss": 0.9564,
      "num_input_tokens_seen": 44984929520,
      "step": 57177
    },
    {
      "epoch": 6.06598769361341,
      "grad_norm": 0.6900317968167129,
      "learning_rate": 2.4603189467058363e-05,
      "loss": 0.9656,
      "num_input_tokens_seen": 44985716176,
      "step": 57178
    },
    {
      "epoch": 6.066093783152981,
      "grad_norm": 0.8773398003850479,
      "learning_rate": 2.460249458593986e-05,
      "loss": 1.0733,
      "num_input_tokens_seen": 44986502880,
      "step": 57179
    },
    {
      "epoch": 6.066199872692552,
      "grad_norm": 0.6731481696097468,
      "learning_rate": 2.4601799705128545e-05,
      "loss": 0.9636,
      "num_input_tokens_seen": 44987289728,
      "step": 57180
    },
    {
      "epoch": 6.066305962232124,
      "grad_norm": 0.8339827766322452,
      "learning_rate": 2.460110482462495e-05,
      "loss": 0.9552,
      "num_input_tokens_seen": 44988076544,
      "step": 57181
    },
    {
      "epoch": 6.066412051771695,
      "grad_norm": 0.8260489496508403,
      "learning_rate": 2.4600409944429597e-05,
      "loss": 0.9625,
      "num_input_tokens_seen": 44988863264,
      "step": 57182
    },
    {
      "epoch": 6.066518141311267,
      "grad_norm": 0.8604280128874121,
      "learning_rate": 2.4599715064543045e-05,
      "loss": 1.0525,
      "num_input_tokens_seen": 44989649936,
      "step": 57183
    },
    {
      "epoch": 6.066624230850838,
      "grad_norm": 0.6792115165660731,
      "learning_rate": 2.4599020184965823e-05,
      "loss": 0.9642,
      "num_input_tokens_seen": 44990436784,
      "step": 57184
    },
    {
      "epoch": 6.06673032039041,
      "grad_norm": 0.9059704499237453,
      "learning_rate": 2.459832530569846e-05,
      "loss": 1.0258,
      "num_input_tokens_seen": 44991223600,
      "step": 57185
    },
    {
      "epoch": 6.066836409929981,
      "grad_norm": 1.0952555048506345,
      "learning_rate": 2.4597630426741506e-05,
      "loss": 1.0045,
      "num_input_tokens_seen": 44992010352,
      "step": 57186
    },
    {
      "epoch": 6.066942499469552,
      "grad_norm": 1.5570907715612874,
      "learning_rate": 2.4596935548095485e-05,
      "loss": 0.9659,
      "num_input_tokens_seen": 44992797168,
      "step": 57187
    },
    {
      "epoch": 6.067048589009124,
      "grad_norm": 1.874736096800171,
      "learning_rate": 2.4596240669760945e-05,
      "loss": 1.022,
      "num_input_tokens_seen": 44993583984,
      "step": 57188
    },
    {
      "epoch": 6.067154678548695,
      "grad_norm": 1.0184986116757908,
      "learning_rate": 2.4595545791738418e-05,
      "loss": 1.0069,
      "num_input_tokens_seen": 44994370832,
      "step": 57189
    },
    {
      "epoch": 6.067260768088267,
      "grad_norm": 0.9990363662555485,
      "learning_rate": 2.4594850914028436e-05,
      "loss": 0.9264,
      "num_input_tokens_seen": 44995157744,
      "step": 57190
    },
    {
      "epoch": 6.067366857627838,
      "grad_norm": 1.884260139200624,
      "learning_rate": 2.4594156036631548e-05,
      "loss": 0.9834,
      "num_input_tokens_seen": 44995944512,
      "step": 57191
    },
    {
      "epoch": 6.067472947167409,
      "grad_norm": 1.3369062405286345,
      "learning_rate": 2.4593461159548282e-05,
      "loss": 0.9706,
      "num_input_tokens_seen": 44996731296,
      "step": 57192
    },
    {
      "epoch": 6.067579036706981,
      "grad_norm": 0.8658701429677986,
      "learning_rate": 2.4592766282779174e-05,
      "loss": 0.9754,
      "num_input_tokens_seen": 44997518048,
      "step": 57193
    },
    {
      "epoch": 6.067685126246552,
      "grad_norm": 1.774525189603227,
      "learning_rate": 2.459207140632477e-05,
      "loss": 0.9601,
      "num_input_tokens_seen": 44998304784,
      "step": 57194
    },
    {
      "epoch": 6.067791215786124,
      "grad_norm": 1.3560960254865948,
      "learning_rate": 2.45913765301856e-05,
      "loss": 0.9642,
      "num_input_tokens_seen": 44999091552,
      "step": 57195
    },
    {
      "epoch": 6.067897305325695,
      "grad_norm": 0.8674279241564034,
      "learning_rate": 2.4590681654362198e-05,
      "loss": 1.0017,
      "num_input_tokens_seen": 44999878336,
      "step": 57196
    },
    {
      "epoch": 6.068003394865266,
      "grad_norm": 1.1386324442804039,
      "learning_rate": 2.4589986778855108e-05,
      "loss": 1.0663,
      "num_input_tokens_seen": 45000665040,
      "step": 57197
    },
    {
      "epoch": 6.068109484404838,
      "grad_norm": 1.2020393772915707,
      "learning_rate": 2.458929190366487e-05,
      "loss": 1.0574,
      "num_input_tokens_seen": 45001451808,
      "step": 57198
    },
    {
      "epoch": 6.068215573944409,
      "grad_norm": 0.9921660880700663,
      "learning_rate": 2.4588597028792004e-05,
      "loss": 1.0214,
      "num_input_tokens_seen": 45002238560,
      "step": 57199
    },
    {
      "epoch": 6.068321663483981,
      "grad_norm": 0.7629143302571594,
      "learning_rate": 2.4587902154237064e-05,
      "loss": 0.9493,
      "num_input_tokens_seen": 45003025392,
      "step": 57200
    },
    {
      "epoch": 6.068427753023552,
      "grad_norm": 1.0783848658207562,
      "learning_rate": 2.4587207280000578e-05,
      "loss": 1.0002,
      "num_input_tokens_seen": 45003812080,
      "step": 57201
    },
    {
      "epoch": 6.068533842563124,
      "grad_norm": 1.0189883008790128,
      "learning_rate": 2.458651240608309e-05,
      "loss": 1.0271,
      "num_input_tokens_seen": 45004598816,
      "step": 57202
    },
    {
      "epoch": 6.068639932102695,
      "grad_norm": 0.7801166863017042,
      "learning_rate": 2.4585817532485132e-05,
      "loss": 0.9305,
      "num_input_tokens_seen": 45005385632,
      "step": 57203
    },
    {
      "epoch": 6.068746021642266,
      "grad_norm": 1.3701514279929128,
      "learning_rate": 2.458512265920724e-05,
      "loss": 1.0053,
      "num_input_tokens_seen": 45006172400,
      "step": 57204
    },
    {
      "epoch": 6.068852111181838,
      "grad_norm": 0.662535949831364,
      "learning_rate": 2.4584427786249956e-05,
      "loss": 0.8795,
      "num_input_tokens_seen": 45006959232,
      "step": 57205
    },
    {
      "epoch": 6.068958200721409,
      "grad_norm": 0.9934280704393474,
      "learning_rate": 2.4583732913613817e-05,
      "loss": 0.8787,
      "num_input_tokens_seen": 45007746032,
      "step": 57206
    },
    {
      "epoch": 6.069064290260981,
      "grad_norm": 1.541505302822466,
      "learning_rate": 2.4583038041299347e-05,
      "loss": 1.0073,
      "num_input_tokens_seen": 45008532736,
      "step": 57207
    },
    {
      "epoch": 6.069170379800552,
      "grad_norm": 0.7877172039188681,
      "learning_rate": 2.45823431693071e-05,
      "loss": 1.0264,
      "num_input_tokens_seen": 45009319472,
      "step": 57208
    },
    {
      "epoch": 6.069276469340123,
      "grad_norm": 0.6874047118225688,
      "learning_rate": 2.4581648297637606e-05,
      "loss": 0.96,
      "num_input_tokens_seen": 45010106208,
      "step": 57209
    },
    {
      "epoch": 6.069382558879695,
      "grad_norm": 1.0839205532037812,
      "learning_rate": 2.45809534262914e-05,
      "loss": 1.0592,
      "num_input_tokens_seen": 45010893008,
      "step": 57210
    },
    {
      "epoch": 6.069488648419266,
      "grad_norm": 1.0208947049507822,
      "learning_rate": 2.4580258555269024e-05,
      "loss": 1.0197,
      "num_input_tokens_seen": 45011679888,
      "step": 57211
    },
    {
      "epoch": 6.0695947379588375,
      "grad_norm": 1.0687482238009836,
      "learning_rate": 2.457956368457101e-05,
      "loss": 1.0386,
      "num_input_tokens_seen": 45012466544,
      "step": 57212
    },
    {
      "epoch": 6.069700827498409,
      "grad_norm": 1.0296761050072472,
      "learning_rate": 2.4578868814197893e-05,
      "loss": 0.9979,
      "num_input_tokens_seen": 45013253376,
      "step": 57213
    },
    {
      "epoch": 6.0698069170379805,
      "grad_norm": 0.9941744092672186,
      "learning_rate": 2.4578173944150222e-05,
      "loss": 0.9849,
      "num_input_tokens_seen": 45014040112,
      "step": 57214
    },
    {
      "epoch": 6.0699130065775515,
      "grad_norm": 0.9234338849999735,
      "learning_rate": 2.457747907442852e-05,
      "loss": 0.9469,
      "num_input_tokens_seen": 45014826864,
      "step": 57215
    },
    {
      "epoch": 6.0700190961171225,
      "grad_norm": 1.0907842476305745,
      "learning_rate": 2.4576784205033325e-05,
      "loss": 0.999,
      "num_input_tokens_seen": 45015613536,
      "step": 57216
    },
    {
      "epoch": 6.0701251856566945,
      "grad_norm": 0.8748311532651029,
      "learning_rate": 2.457608933596519e-05,
      "loss": 0.9935,
      "num_input_tokens_seen": 45016400272,
      "step": 57217
    },
    {
      "epoch": 6.0702312751962655,
      "grad_norm": 1.0586165773704572,
      "learning_rate": 2.457539446722463e-05,
      "loss": 1.096,
      "num_input_tokens_seen": 45017186976,
      "step": 57218
    },
    {
      "epoch": 6.070337364735837,
      "grad_norm": 0.7673656356141193,
      "learning_rate": 2.45746995988122e-05,
      "loss": 0.9692,
      "num_input_tokens_seen": 45017973728,
      "step": 57219
    },
    {
      "epoch": 6.070443454275408,
      "grad_norm": 0.8996225840886125,
      "learning_rate": 2.4574004730728432e-05,
      "loss": 0.997,
      "num_input_tokens_seen": 45018760416,
      "step": 57220
    },
    {
      "epoch": 6.0705495438149795,
      "grad_norm": 0.6766095969041783,
      "learning_rate": 2.4573309862973852e-05,
      "loss": 0.9299,
      "num_input_tokens_seen": 45019547232,
      "step": 57221
    },
    {
      "epoch": 6.070655633354551,
      "grad_norm": 0.716388054490664,
      "learning_rate": 2.4572614995549008e-05,
      "loss": 1.0159,
      "num_input_tokens_seen": 45020334048,
      "step": 57222
    },
    {
      "epoch": 6.070761722894122,
      "grad_norm": 0.9431990030301786,
      "learning_rate": 2.457192012845444e-05,
      "loss": 0.9815,
      "num_input_tokens_seen": 45021120784,
      "step": 57223
    },
    {
      "epoch": 6.070867812433694,
      "grad_norm": 0.7189915452319369,
      "learning_rate": 2.457122526169067e-05,
      "loss": 0.9608,
      "num_input_tokens_seen": 45021907472,
      "step": 57224
    },
    {
      "epoch": 6.070973901973265,
      "grad_norm": 0.9803246613591977,
      "learning_rate": 2.4570530395258255e-05,
      "loss": 0.9949,
      "num_input_tokens_seen": 45022694240,
      "step": 57225
    },
    {
      "epoch": 6.071079991512837,
      "grad_norm": 0.8767681101297772,
      "learning_rate": 2.456983552915771e-05,
      "loss": 1.0342,
      "num_input_tokens_seen": 45023480928,
      "step": 57226
    },
    {
      "epoch": 6.071186081052408,
      "grad_norm": 1.2406453713028924,
      "learning_rate": 2.4569140663389592e-05,
      "loss": 0.8967,
      "num_input_tokens_seen": 45024267728,
      "step": 57227
    },
    {
      "epoch": 6.071292170591979,
      "grad_norm": 1.122407893351888,
      "learning_rate": 2.456844579795442e-05,
      "loss": 1.0632,
      "num_input_tokens_seen": 45025054432,
      "step": 57228
    },
    {
      "epoch": 6.071398260131551,
      "grad_norm": 0.7435201003130637,
      "learning_rate": 2.4567750932852755e-05,
      "loss": 1.0839,
      "num_input_tokens_seen": 45025841168,
      "step": 57229
    },
    {
      "epoch": 6.071504349671122,
      "grad_norm": 1.0557212488115981,
      "learning_rate": 2.456705606808511e-05,
      "loss": 0.9388,
      "num_input_tokens_seen": 45026628000,
      "step": 57230
    },
    {
      "epoch": 6.071610439210694,
      "grad_norm": 0.8208388453636163,
      "learning_rate": 2.4566361203652032e-05,
      "loss": 1.0105,
      "num_input_tokens_seen": 45027414752,
      "step": 57231
    },
    {
      "epoch": 6.071716528750265,
      "grad_norm": 0.9053610389424394,
      "learning_rate": 2.4565666339554063e-05,
      "loss": 1.0302,
      "num_input_tokens_seen": 45028201632,
      "step": 57232
    },
    {
      "epoch": 6.071822618289836,
      "grad_norm": 0.7492524736135411,
      "learning_rate": 2.4564971475791735e-05,
      "loss": 0.9616,
      "num_input_tokens_seen": 45028988352,
      "step": 57233
    },
    {
      "epoch": 6.071928707829408,
      "grad_norm": 0.7232232568592664,
      "learning_rate": 2.4564276612365575e-05,
      "loss": 0.9857,
      "num_input_tokens_seen": 45029775088,
      "step": 57234
    },
    {
      "epoch": 6.072034797368979,
      "grad_norm": 0.8046401766833235,
      "learning_rate": 2.4563581749276134e-05,
      "loss": 1.0197,
      "num_input_tokens_seen": 45030561824,
      "step": 57235
    },
    {
      "epoch": 6.072140886908551,
      "grad_norm": 0.7648234386535459,
      "learning_rate": 2.4562886886523947e-05,
      "loss": 0.9673,
      "num_input_tokens_seen": 45031348592,
      "step": 57236
    },
    {
      "epoch": 6.072246976448122,
      "grad_norm": 0.8202915613740945,
      "learning_rate": 2.4562192024109544e-05,
      "loss": 0.9906,
      "num_input_tokens_seen": 45032135344,
      "step": 57237
    },
    {
      "epoch": 6.072353065987693,
      "grad_norm": 0.8041736713423729,
      "learning_rate": 2.456149716203347e-05,
      "loss": 1.0624,
      "num_input_tokens_seen": 45032922096,
      "step": 57238
    },
    {
      "epoch": 6.072459155527265,
      "grad_norm": 0.7872176818618033,
      "learning_rate": 2.4560802300296252e-05,
      "loss": 0.903,
      "num_input_tokens_seen": 45033708976,
      "step": 57239
    },
    {
      "epoch": 6.072565245066836,
      "grad_norm": 0.7115416040851053,
      "learning_rate": 2.4560107438898437e-05,
      "loss": 0.9926,
      "num_input_tokens_seen": 45034495728,
      "step": 57240
    },
    {
      "epoch": 6.072671334606408,
      "grad_norm": 0.7619159423758926,
      "learning_rate": 2.4559412577840564e-05,
      "loss": 0.985,
      "num_input_tokens_seen": 45035282432,
      "step": 57241
    },
    {
      "epoch": 6.072777424145979,
      "grad_norm": 0.7347613324534269,
      "learning_rate": 2.4558717717123154e-05,
      "loss": 1.0279,
      "num_input_tokens_seen": 45036069168,
      "step": 57242
    },
    {
      "epoch": 6.072883513685551,
      "grad_norm": 0.7262568501545639,
      "learning_rate": 2.455802285674676e-05,
      "loss": 0.9396,
      "num_input_tokens_seen": 45036856080,
      "step": 57243
    },
    {
      "epoch": 6.072989603225122,
      "grad_norm": 0.8420332779705554,
      "learning_rate": 2.4557327996711912e-05,
      "loss": 0.939,
      "num_input_tokens_seen": 45037642896,
      "step": 57244
    },
    {
      "epoch": 6.073095692764693,
      "grad_norm": 0.8144399059930094,
      "learning_rate": 2.4556633137019145e-05,
      "loss": 1.0036,
      "num_input_tokens_seen": 45038429632,
      "step": 57245
    },
    {
      "epoch": 6.073201782304265,
      "grad_norm": 0.8328995979048696,
      "learning_rate": 2.4555938277669e-05,
      "loss": 1.0077,
      "num_input_tokens_seen": 45039216480,
      "step": 57246
    },
    {
      "epoch": 6.073307871843836,
      "grad_norm": 0.9423355072875461,
      "learning_rate": 2.4555243418662015e-05,
      "loss": 1.0619,
      "num_input_tokens_seen": 45040003296,
      "step": 57247
    },
    {
      "epoch": 6.073413961383408,
      "grad_norm": 0.7391748564461635,
      "learning_rate": 2.455454855999872e-05,
      "loss": 0.9854,
      "num_input_tokens_seen": 45040790016,
      "step": 57248
    },
    {
      "epoch": 6.073520050922979,
      "grad_norm": 0.8453936722423601,
      "learning_rate": 2.4553853701679664e-05,
      "loss": 1.0266,
      "num_input_tokens_seen": 45041576768,
      "step": 57249
    },
    {
      "epoch": 6.07362614046255,
      "grad_norm": 0.7560214592929311,
      "learning_rate": 2.4553158843705377e-05,
      "loss": 1.0145,
      "num_input_tokens_seen": 45042363520,
      "step": 57250
    },
    {
      "epoch": 6.073732230002122,
      "grad_norm": 0.8901208009080541,
      "learning_rate": 2.455246398607639e-05,
      "loss": 0.9963,
      "num_input_tokens_seen": 45043150272,
      "step": 57251
    },
    {
      "epoch": 6.073838319541693,
      "grad_norm": 0.841343556780806,
      "learning_rate": 2.4551769128793246e-05,
      "loss": 1.091,
      "num_input_tokens_seen": 45043936912,
      "step": 57252
    },
    {
      "epoch": 6.073944409081265,
      "grad_norm": 0.7908755133318226,
      "learning_rate": 2.4551074271856487e-05,
      "loss": 0.972,
      "num_input_tokens_seen": 45044723696,
      "step": 57253
    },
    {
      "epoch": 6.074050498620836,
      "grad_norm": 0.9323555060522625,
      "learning_rate": 2.4550379415266638e-05,
      "loss": 1.0087,
      "num_input_tokens_seen": 45045510480,
      "step": 57254
    },
    {
      "epoch": 6.074156588160408,
      "grad_norm": 1.4785541512029623,
      "learning_rate": 2.4549684559024248e-05,
      "loss": 1.025,
      "num_input_tokens_seen": 45046297248,
      "step": 57255
    },
    {
      "epoch": 6.074262677699979,
      "grad_norm": 0.7314415698438722,
      "learning_rate": 2.454898970312984e-05,
      "loss": 1.0171,
      "num_input_tokens_seen": 45047084080,
      "step": 57256
    },
    {
      "epoch": 6.07436876723955,
      "grad_norm": 0.992729909510389,
      "learning_rate": 2.454829484758397e-05,
      "loss": 1.0496,
      "num_input_tokens_seen": 45047870912,
      "step": 57257
    },
    {
      "epoch": 6.074474856779122,
      "grad_norm": 0.8721983221924792,
      "learning_rate": 2.454759999238716e-05,
      "loss": 0.968,
      "num_input_tokens_seen": 45048657696,
      "step": 57258
    },
    {
      "epoch": 6.074580946318693,
      "grad_norm": 0.9229868063409681,
      "learning_rate": 2.454690513753995e-05,
      "loss": 0.9496,
      "num_input_tokens_seen": 45049444480,
      "step": 57259
    },
    {
      "epoch": 6.074687035858265,
      "grad_norm": 0.720980570089107,
      "learning_rate": 2.454621028304288e-05,
      "loss": 0.9911,
      "num_input_tokens_seen": 45050231232,
      "step": 57260
    },
    {
      "epoch": 6.074793125397836,
      "grad_norm": 0.7779198448922164,
      "learning_rate": 2.4545515428896486e-05,
      "loss": 0.9817,
      "num_input_tokens_seen": 45051018048,
      "step": 57261
    },
    {
      "epoch": 6.074899214937407,
      "grad_norm": 0.6989311887226171,
      "learning_rate": 2.45448205751013e-05,
      "loss": 0.9631,
      "num_input_tokens_seen": 45051804656,
      "step": 57262
    },
    {
      "epoch": 6.075005304476979,
      "grad_norm": 0.9855427345701354,
      "learning_rate": 2.454412572165787e-05,
      "loss": 1.0096,
      "num_input_tokens_seen": 45052591424,
      "step": 57263
    },
    {
      "epoch": 6.07511139401655,
      "grad_norm": 0.6789278050017632,
      "learning_rate": 2.454343086856673e-05,
      "loss": 0.9557,
      "num_input_tokens_seen": 45053378208,
      "step": 57264
    },
    {
      "epoch": 6.075217483556122,
      "grad_norm": 0.7461172852212979,
      "learning_rate": 2.45427360158284e-05,
      "loss": 1.0039,
      "num_input_tokens_seen": 45054165024,
      "step": 57265
    },
    {
      "epoch": 6.075323573095693,
      "grad_norm": 1.3250566853107966,
      "learning_rate": 2.454204116344344e-05,
      "loss": 0.9359,
      "num_input_tokens_seen": 45054951760,
      "step": 57266
    },
    {
      "epoch": 6.075429662635264,
      "grad_norm": 0.6457917976513738,
      "learning_rate": 2.4541346311412375e-05,
      "loss": 0.9567,
      "num_input_tokens_seen": 45055738592,
      "step": 57267
    },
    {
      "epoch": 6.075535752174836,
      "grad_norm": 0.8495238184714077,
      "learning_rate": 2.4540651459735738e-05,
      "loss": 0.9745,
      "num_input_tokens_seen": 45056525312,
      "step": 57268
    },
    {
      "epoch": 6.075641841714407,
      "grad_norm": 0.8514952843191805,
      "learning_rate": 2.453995660841408e-05,
      "loss": 1.0688,
      "num_input_tokens_seen": 45057311920,
      "step": 57269
    },
    {
      "epoch": 6.075747931253979,
      "grad_norm": 0.7302767969495184,
      "learning_rate": 2.4539261757447928e-05,
      "loss": 0.9787,
      "num_input_tokens_seen": 45058098640,
      "step": 57270
    },
    {
      "epoch": 6.07585402079355,
      "grad_norm": 0.8725457151510283,
      "learning_rate": 2.4538566906837816e-05,
      "loss": 1.0415,
      "num_input_tokens_seen": 45058885408,
      "step": 57271
    },
    {
      "epoch": 6.0759601103331216,
      "grad_norm": 0.7586904587435179,
      "learning_rate": 2.4537872056584292e-05,
      "loss": 1.0558,
      "num_input_tokens_seen": 45059672128,
      "step": 57272
    },
    {
      "epoch": 6.076066199872693,
      "grad_norm": 1.0829425216962631,
      "learning_rate": 2.4537177206687884e-05,
      "loss": 0.9915,
      "num_input_tokens_seen": 45060458848,
      "step": 57273
    },
    {
      "epoch": 6.076172289412264,
      "grad_norm": 1.0919153861709323,
      "learning_rate": 2.4536482357149134e-05,
      "loss": 1.0536,
      "num_input_tokens_seen": 45061245536,
      "step": 57274
    },
    {
      "epoch": 6.0762783789518355,
      "grad_norm": 0.8940798114175239,
      "learning_rate": 2.4535787507968577e-05,
      "loss": 0.9551,
      "num_input_tokens_seen": 45062032304,
      "step": 57275
    },
    {
      "epoch": 6.076384468491407,
      "grad_norm": 0.8671556526729842,
      "learning_rate": 2.4535092659146745e-05,
      "loss": 0.9496,
      "num_input_tokens_seen": 45062819056,
      "step": 57276
    },
    {
      "epoch": 6.0764905580309785,
      "grad_norm": 0.7086930149972918,
      "learning_rate": 2.4534397810684184e-05,
      "loss": 0.9513,
      "num_input_tokens_seen": 45063605840,
      "step": 57277
    },
    {
      "epoch": 6.0765966475705495,
      "grad_norm": 0.9960922108506409,
      "learning_rate": 2.453370296258143e-05,
      "loss": 0.9861,
      "num_input_tokens_seen": 45064392592,
      "step": 57278
    },
    {
      "epoch": 6.0767027371101205,
      "grad_norm": 0.862421778425343,
      "learning_rate": 2.4533008114839008e-05,
      "loss": 1.0176,
      "num_input_tokens_seen": 45065179408,
      "step": 57279
    },
    {
      "epoch": 6.0768088266496925,
      "grad_norm": 0.6546423032519494,
      "learning_rate": 2.453231326745747e-05,
      "loss": 0.9076,
      "num_input_tokens_seen": 45065966224,
      "step": 57280
    },
    {
      "epoch": 6.0769149161892635,
      "grad_norm": 0.8937380262717556,
      "learning_rate": 2.4531618420437346e-05,
      "loss": 0.9943,
      "num_input_tokens_seen": 45066752912,
      "step": 57281
    },
    {
      "epoch": 6.077021005728835,
      "grad_norm": 0.8135315336591648,
      "learning_rate": 2.453092357377917e-05,
      "loss": 0.9618,
      "num_input_tokens_seen": 45067539712,
      "step": 57282
    },
    {
      "epoch": 6.077127095268406,
      "grad_norm": 0.8562256705323207,
      "learning_rate": 2.4530228727483487e-05,
      "loss": 1.0029,
      "num_input_tokens_seen": 45068326400,
      "step": 57283
    },
    {
      "epoch": 6.077233184807978,
      "grad_norm": 0.9128585884247371,
      "learning_rate": 2.4529533881550827e-05,
      "loss": 0.9949,
      "num_input_tokens_seen": 45069113120,
      "step": 57284
    },
    {
      "epoch": 6.077339274347549,
      "grad_norm": 0.7308733278137467,
      "learning_rate": 2.452883903598173e-05,
      "loss": 0.9976,
      "num_input_tokens_seen": 45069899856,
      "step": 57285
    },
    {
      "epoch": 6.07744536388712,
      "grad_norm": 0.8072192434733167,
      "learning_rate": 2.4528144190776733e-05,
      "loss": 0.9549,
      "num_input_tokens_seen": 45070686592,
      "step": 57286
    },
    {
      "epoch": 6.077551453426692,
      "grad_norm": 0.6119461447353548,
      "learning_rate": 2.4527449345936373e-05,
      "loss": 0.9434,
      "num_input_tokens_seen": 45071473344,
      "step": 57287
    },
    {
      "epoch": 6.077657542966263,
      "grad_norm": 0.8839287175710956,
      "learning_rate": 2.452675450146118e-05,
      "loss": 0.9489,
      "num_input_tokens_seen": 45072260096,
      "step": 57288
    },
    {
      "epoch": 6.077763632505835,
      "grad_norm": 0.8362670083281175,
      "learning_rate": 2.4526059657351706e-05,
      "loss": 1.0779,
      "num_input_tokens_seen": 45073046816,
      "step": 57289
    },
    {
      "epoch": 6.077869722045406,
      "grad_norm": 0.7829120822995144,
      "learning_rate": 2.452536481360847e-05,
      "loss": 1.0442,
      "num_input_tokens_seen": 45073833584,
      "step": 57290
    },
    {
      "epoch": 6.077975811584977,
      "grad_norm": 0.8167473653938406,
      "learning_rate": 2.4524669970232027e-05,
      "loss": 1.0588,
      "num_input_tokens_seen": 45074620336,
      "step": 57291
    },
    {
      "epoch": 6.078081901124549,
      "grad_norm": 0.6281413750404491,
      "learning_rate": 2.45239751272229e-05,
      "loss": 0.9632,
      "num_input_tokens_seen": 45075407136,
      "step": 57292
    },
    {
      "epoch": 6.07818799066412,
      "grad_norm": 0.8649530075574998,
      "learning_rate": 2.452328028458163e-05,
      "loss": 0.9396,
      "num_input_tokens_seen": 45076193968,
      "step": 57293
    },
    {
      "epoch": 6.078294080203692,
      "grad_norm": 0.7428801767674736,
      "learning_rate": 2.452258544230876e-05,
      "loss": 1.0162,
      "num_input_tokens_seen": 45076980720,
      "step": 57294
    },
    {
      "epoch": 6.078400169743263,
      "grad_norm": 0.9494752009718359,
      "learning_rate": 2.452189060040482e-05,
      "loss": 0.9616,
      "num_input_tokens_seen": 45077767456,
      "step": 57295
    },
    {
      "epoch": 6.078506259282834,
      "grad_norm": 1.3254215008381114,
      "learning_rate": 2.4521195758870348e-05,
      "loss": 0.9697,
      "num_input_tokens_seen": 45078554192,
      "step": 57296
    },
    {
      "epoch": 6.078612348822406,
      "grad_norm": 0.8121535084866066,
      "learning_rate": 2.4520500917705883e-05,
      "loss": 0.9241,
      "num_input_tokens_seen": 45079340976,
      "step": 57297
    },
    {
      "epoch": 6.078718438361977,
      "grad_norm": 0.8084573555935265,
      "learning_rate": 2.4519806076911962e-05,
      "loss": 0.8744,
      "num_input_tokens_seen": 45080127808,
      "step": 57298
    },
    {
      "epoch": 6.078824527901549,
      "grad_norm": 1.0689827939211558,
      "learning_rate": 2.4519111236489116e-05,
      "loss": 0.9623,
      "num_input_tokens_seen": 45080914592,
      "step": 57299
    },
    {
      "epoch": 6.07893061744112,
      "grad_norm": 0.8517203648070798,
      "learning_rate": 2.451841639643789e-05,
      "loss": 0.9753,
      "num_input_tokens_seen": 45081701360,
      "step": 57300
    },
    {
      "epoch": 6.079036706980692,
      "grad_norm": 0.9476319214996108,
      "learning_rate": 2.451772155675882e-05,
      "loss": 1.0139,
      "num_input_tokens_seen": 45082488224,
      "step": 57301
    },
    {
      "epoch": 6.079142796520263,
      "grad_norm": 0.6920794748073132,
      "learning_rate": 2.4517026717452434e-05,
      "loss": 0.9277,
      "num_input_tokens_seen": 45083275056,
      "step": 57302
    },
    {
      "epoch": 6.079248886059834,
      "grad_norm": 0.9586378637874643,
      "learning_rate": 2.451633187851928e-05,
      "loss": 1.0516,
      "num_input_tokens_seen": 45084061664,
      "step": 57303
    },
    {
      "epoch": 6.079354975599406,
      "grad_norm": 0.8180264762919097,
      "learning_rate": 2.4515637039959888e-05,
      "loss": 1.0351,
      "num_input_tokens_seen": 45084848496,
      "step": 57304
    },
    {
      "epoch": 6.079461065138977,
      "grad_norm": 0.79762215634822,
      "learning_rate": 2.45149422017748e-05,
      "loss": 0.9737,
      "num_input_tokens_seen": 45085635232,
      "step": 57305
    },
    {
      "epoch": 6.079567154678549,
      "grad_norm": 1.0470111593078815,
      "learning_rate": 2.451424736396455e-05,
      "loss": 1.0288,
      "num_input_tokens_seen": 45086422000,
      "step": 57306
    },
    {
      "epoch": 6.07967324421812,
      "grad_norm": 1.2161831605217237,
      "learning_rate": 2.4513552526529674e-05,
      "loss": 1.035,
      "num_input_tokens_seen": 45087208848,
      "step": 57307
    },
    {
      "epoch": 6.079779333757691,
      "grad_norm": 1.0496187207564602,
      "learning_rate": 2.4512857689470714e-05,
      "loss": 1.0123,
      "num_input_tokens_seen": 45087995680,
      "step": 57308
    },
    {
      "epoch": 6.079885423297263,
      "grad_norm": 0.8556281760770583,
      "learning_rate": 2.4512162852788202e-05,
      "loss": 1.0234,
      "num_input_tokens_seen": 45088782400,
      "step": 57309
    },
    {
      "epoch": 6.079991512836834,
      "grad_norm": 0.8568760385489971,
      "learning_rate": 2.451146801648267e-05,
      "loss": 0.99,
      "num_input_tokens_seen": 45089569104,
      "step": 57310
    },
    {
      "epoch": 6.080097602376406,
      "grad_norm": 1.048183200653036,
      "learning_rate": 2.451077318055467e-05,
      "loss": 0.9986,
      "num_input_tokens_seen": 45090355920,
      "step": 57311
    },
    {
      "epoch": 6.080203691915977,
      "grad_norm": 0.9034742584599038,
      "learning_rate": 2.4510078345004726e-05,
      "loss": 0.9666,
      "num_input_tokens_seen": 45091142672,
      "step": 57312
    },
    {
      "epoch": 6.080309781455549,
      "grad_norm": 1.4340464642223523,
      "learning_rate": 2.450938350983338e-05,
      "loss": 0.9554,
      "num_input_tokens_seen": 45091929392,
      "step": 57313
    },
    {
      "epoch": 6.08041587099512,
      "grad_norm": 1.0782064890345822,
      "learning_rate": 2.4508688675041168e-05,
      "loss": 1.0029,
      "num_input_tokens_seen": 45092716208,
      "step": 57314
    },
    {
      "epoch": 6.080521960534691,
      "grad_norm": 1.1124292509447962,
      "learning_rate": 2.450799384062863e-05,
      "loss": 0.8854,
      "num_input_tokens_seen": 45093502880,
      "step": 57315
    },
    {
      "epoch": 6.080628050074263,
      "grad_norm": 0.9109012992782133,
      "learning_rate": 2.450729900659629e-05,
      "loss": 0.9658,
      "num_input_tokens_seen": 45094289712,
      "step": 57316
    },
    {
      "epoch": 6.080734139613834,
      "grad_norm": 0.7814997399170868,
      "learning_rate": 2.4506604172944705e-05,
      "loss": 0.9427,
      "num_input_tokens_seen": 45095076432,
      "step": 57317
    },
    {
      "epoch": 6.080840229153406,
      "grad_norm": 0.8657511565668015,
      "learning_rate": 2.4505909339674398e-05,
      "loss": 0.9926,
      "num_input_tokens_seen": 45095863216,
      "step": 57318
    },
    {
      "epoch": 6.080946318692977,
      "grad_norm": 0.9996925960536924,
      "learning_rate": 2.450521450678591e-05,
      "loss": 0.9801,
      "num_input_tokens_seen": 45096650080,
      "step": 57319
    },
    {
      "epoch": 6.081052408232548,
      "grad_norm": 0.6706848696824819,
      "learning_rate": 2.4504519674279776e-05,
      "loss": 0.9466,
      "num_input_tokens_seen": 45097436768,
      "step": 57320
    },
    {
      "epoch": 6.08115849777212,
      "grad_norm": 0.7753927332934827,
      "learning_rate": 2.4503824842156527e-05,
      "loss": 0.9373,
      "num_input_tokens_seen": 45098223536,
      "step": 57321
    },
    {
      "epoch": 6.081264587311691,
      "grad_norm": 0.8237466161196033,
      "learning_rate": 2.450313001041672e-05,
      "loss": 1.0104,
      "num_input_tokens_seen": 45099010320,
      "step": 57322
    },
    {
      "epoch": 6.081370676851263,
      "grad_norm": 0.7350902781386681,
      "learning_rate": 2.4502435179060875e-05,
      "loss": 0.9818,
      "num_input_tokens_seen": 45099797056,
      "step": 57323
    },
    {
      "epoch": 6.081476766390834,
      "grad_norm": 0.8157155239355497,
      "learning_rate": 2.4501740348089537e-05,
      "loss": 0.9806,
      "num_input_tokens_seen": 45100583904,
      "step": 57324
    },
    {
      "epoch": 6.081582855930405,
      "grad_norm": 1.0001194732493,
      "learning_rate": 2.4501045517503234e-05,
      "loss": 1.0461,
      "num_input_tokens_seen": 45101370576,
      "step": 57325
    },
    {
      "epoch": 6.081688945469977,
      "grad_norm": 0.7464779568270479,
      "learning_rate": 2.4500350687302513e-05,
      "loss": 0.9744,
      "num_input_tokens_seen": 45102157296,
      "step": 57326
    },
    {
      "epoch": 6.081795035009548,
      "grad_norm": 0.8688503554719295,
      "learning_rate": 2.4499655857487904e-05,
      "loss": 0.9748,
      "num_input_tokens_seen": 45102944000,
      "step": 57327
    },
    {
      "epoch": 6.08190112454912,
      "grad_norm": 1.322853652335329,
      "learning_rate": 2.4498961028059945e-05,
      "loss": 1.0229,
      "num_input_tokens_seen": 45103730752,
      "step": 57328
    },
    {
      "epoch": 6.082007214088691,
      "grad_norm": 0.8513615469038743,
      "learning_rate": 2.449826619901918e-05,
      "loss": 1.0404,
      "num_input_tokens_seen": 45104517600,
      "step": 57329
    },
    {
      "epoch": 6.082113303628263,
      "grad_norm": 0.8369468915325303,
      "learning_rate": 2.4497571370366137e-05,
      "loss": 1.0754,
      "num_input_tokens_seen": 45105304416,
      "step": 57330
    },
    {
      "epoch": 6.082219393167834,
      "grad_norm": 0.8705870442970518,
      "learning_rate": 2.449687654210135e-05,
      "loss": 1.0669,
      "num_input_tokens_seen": 45106091104,
      "step": 57331
    },
    {
      "epoch": 6.082325482707405,
      "grad_norm": 0.7545542532934955,
      "learning_rate": 2.4496181714225373e-05,
      "loss": 1.0849,
      "num_input_tokens_seen": 45106877920,
      "step": 57332
    },
    {
      "epoch": 6.082431572246977,
      "grad_norm": 0.7982923608605769,
      "learning_rate": 2.449548688673873e-05,
      "loss": 0.9945,
      "num_input_tokens_seen": 45107664784,
      "step": 57333
    },
    {
      "epoch": 6.082537661786548,
      "grad_norm": 0.7590282646584982,
      "learning_rate": 2.449479205964195e-05,
      "loss": 0.9908,
      "num_input_tokens_seen": 45108451568,
      "step": 57334
    },
    {
      "epoch": 6.08264375132612,
      "grad_norm": 0.879029761301467,
      "learning_rate": 2.449409723293559e-05,
      "loss": 0.9444,
      "num_input_tokens_seen": 45109238288,
      "step": 57335
    },
    {
      "epoch": 6.082749840865691,
      "grad_norm": 0.7030828906131131,
      "learning_rate": 2.4493402406620176e-05,
      "loss": 0.9346,
      "num_input_tokens_seen": 45110025040,
      "step": 57336
    },
    {
      "epoch": 6.082855930405262,
      "grad_norm": 1.0405379402717914,
      "learning_rate": 2.449270758069624e-05,
      "loss": 0.9963,
      "num_input_tokens_seen": 45110811856,
      "step": 57337
    },
    {
      "epoch": 6.0829620199448335,
      "grad_norm": 0.8251054319982757,
      "learning_rate": 2.4492012755164328e-05,
      "loss": 1.0036,
      "num_input_tokens_seen": 45111598624,
      "step": 57338
    },
    {
      "epoch": 6.083068109484405,
      "grad_norm": 1.05132688592922,
      "learning_rate": 2.4491317930024975e-05,
      "loss": 1.0601,
      "num_input_tokens_seen": 45112385456,
      "step": 57339
    },
    {
      "epoch": 6.0831741990239765,
      "grad_norm": 1.34903747074551,
      "learning_rate": 2.4490623105278713e-05,
      "loss": 0.9401,
      "num_input_tokens_seen": 45113172240,
      "step": 57340
    },
    {
      "epoch": 6.0832802885635475,
      "grad_norm": 0.7299427549602218,
      "learning_rate": 2.4489928280926087e-05,
      "loss": 0.9394,
      "num_input_tokens_seen": 45113959056,
      "step": 57341
    },
    {
      "epoch": 6.083386378103119,
      "grad_norm": 1.3957285413035154,
      "learning_rate": 2.4489233456967624e-05,
      "loss": 0.9319,
      "num_input_tokens_seen": 45114745728,
      "step": 57342
    },
    {
      "epoch": 6.0834924676426905,
      "grad_norm": 1.501652294700887,
      "learning_rate": 2.448853863340387e-05,
      "loss": 0.9196,
      "num_input_tokens_seen": 45115532560,
      "step": 57343
    },
    {
      "epoch": 6.0835985571822615,
      "grad_norm": 0.7791860978909928,
      "learning_rate": 2.448784381023536e-05,
      "loss": 0.9629,
      "num_input_tokens_seen": 45116319360,
      "step": 57344
    },
    {
      "epoch": 6.083704646721833,
      "grad_norm": 0.8115649341571405,
      "learning_rate": 2.4487148987462624e-05,
      "loss": 1.008,
      "num_input_tokens_seen": 45117106208,
      "step": 57345
    },
    {
      "epoch": 6.0838107362614045,
      "grad_norm": 1.1158119936612139,
      "learning_rate": 2.4486454165086207e-05,
      "loss": 1.0088,
      "num_input_tokens_seen": 45117893040,
      "step": 57346
    },
    {
      "epoch": 6.083916825800976,
      "grad_norm": 0.8257241804014307,
      "learning_rate": 2.4485759343106646e-05,
      "loss": 1.0091,
      "num_input_tokens_seen": 45118679808,
      "step": 57347
    },
    {
      "epoch": 6.084022915340547,
      "grad_norm": 0.8156917787160269,
      "learning_rate": 2.448506452152447e-05,
      "loss": 1.0219,
      "num_input_tokens_seen": 45119466512,
      "step": 57348
    },
    {
      "epoch": 6.084129004880118,
      "grad_norm": 1.4968498609265386,
      "learning_rate": 2.4484369700340225e-05,
      "loss": 0.9546,
      "num_input_tokens_seen": 45120253232,
      "step": 57349
    },
    {
      "epoch": 6.08423509441969,
      "grad_norm": 1.561998264861636,
      "learning_rate": 2.4483674879554445e-05,
      "loss": 0.9908,
      "num_input_tokens_seen": 45121040096,
      "step": 57350
    },
    {
      "epoch": 6.084341183959261,
      "grad_norm": 1.027096350229622,
      "learning_rate": 2.4482980059167658e-05,
      "loss": 1.0565,
      "num_input_tokens_seen": 45121826784,
      "step": 57351
    },
    {
      "epoch": 6.084447273498833,
      "grad_norm": 1.2658496863883018,
      "learning_rate": 2.448228523918042e-05,
      "loss": 1.014,
      "num_input_tokens_seen": 45122613536,
      "step": 57352
    },
    {
      "epoch": 6.084553363038404,
      "grad_norm": 1.8424451391319798,
      "learning_rate": 2.448159041959325e-05,
      "loss": 0.978,
      "num_input_tokens_seen": 45123400432,
      "step": 57353
    },
    {
      "epoch": 6.084659452577976,
      "grad_norm": 1.2999078337841974,
      "learning_rate": 2.4480895600406688e-05,
      "loss": 1.0143,
      "num_input_tokens_seen": 45124187088,
      "step": 57354
    },
    {
      "epoch": 6.084765542117547,
      "grad_norm": 0.8625094002350165,
      "learning_rate": 2.4480200781621285e-05,
      "loss": 1.0324,
      "num_input_tokens_seen": 45124973792,
      "step": 57355
    },
    {
      "epoch": 6.084871631657118,
      "grad_norm": 1.1151206114225771,
      "learning_rate": 2.4479505963237562e-05,
      "loss": 1.0749,
      "num_input_tokens_seen": 45125760576,
      "step": 57356
    },
    {
      "epoch": 6.08497772119669,
      "grad_norm": 1.508179081753474,
      "learning_rate": 2.4478811145256057e-05,
      "loss": 0.975,
      "num_input_tokens_seen": 45126547440,
      "step": 57357
    },
    {
      "epoch": 6.085083810736261,
      "grad_norm": 0.9403827784212397,
      "learning_rate": 2.447811632767732e-05,
      "loss": 1.0005,
      "num_input_tokens_seen": 45127334240,
      "step": 57358
    },
    {
      "epoch": 6.085189900275833,
      "grad_norm": 1.37339670480626,
      "learning_rate": 2.4477421510501873e-05,
      "loss": 1.0265,
      "num_input_tokens_seen": 45128121040,
      "step": 57359
    },
    {
      "epoch": 6.085295989815404,
      "grad_norm": 1.325697705914343,
      "learning_rate": 2.4476726693730263e-05,
      "loss": 1.0087,
      "num_input_tokens_seen": 45128907840,
      "step": 57360
    },
    {
      "epoch": 6.085402079354975,
      "grad_norm": 0.9980225649539545,
      "learning_rate": 2.4476031877363024e-05,
      "loss": 1.0128,
      "num_input_tokens_seen": 45129694656,
      "step": 57361
    },
    {
      "epoch": 6.085508168894547,
      "grad_norm": 0.8807790760480211,
      "learning_rate": 2.4475337061400687e-05,
      "loss": 1.0117,
      "num_input_tokens_seen": 45130481472,
      "step": 57362
    },
    {
      "epoch": 6.085614258434118,
      "grad_norm": 1.2615985047107907,
      "learning_rate": 2.4474642245843797e-05,
      "loss": 1.008,
      "num_input_tokens_seen": 45131268272,
      "step": 57363
    },
    {
      "epoch": 6.08572034797369,
      "grad_norm": 0.9827467118190243,
      "learning_rate": 2.447394743069289e-05,
      "loss": 0.912,
      "num_input_tokens_seen": 45132055072,
      "step": 57364
    },
    {
      "epoch": 6.085826437513261,
      "grad_norm": 0.8761125720165907,
      "learning_rate": 2.44732526159485e-05,
      "loss": 0.993,
      "num_input_tokens_seen": 45132841856,
      "step": 57365
    },
    {
      "epoch": 6.085932527052832,
      "grad_norm": 0.9410766705168989,
      "learning_rate": 2.4472557801611164e-05,
      "loss": 0.9832,
      "num_input_tokens_seen": 45133628688,
      "step": 57366
    },
    {
      "epoch": 6.086038616592404,
      "grad_norm": 0.922343031179271,
      "learning_rate": 2.447186298768142e-05,
      "loss": 0.9495,
      "num_input_tokens_seen": 45134415536,
      "step": 57367
    },
    {
      "epoch": 6.086144706131975,
      "grad_norm": 0.9077169020705171,
      "learning_rate": 2.4471168174159802e-05,
      "loss": 0.9674,
      "num_input_tokens_seen": 45135202320,
      "step": 57368
    },
    {
      "epoch": 6.086250795671547,
      "grad_norm": 0.9180824433418033,
      "learning_rate": 2.4470473361046857e-05,
      "loss": 0.9975,
      "num_input_tokens_seen": 45135989088,
      "step": 57369
    },
    {
      "epoch": 6.086356885211118,
      "grad_norm": 0.7545049527304607,
      "learning_rate": 2.446977854834311e-05,
      "loss": 0.9307,
      "num_input_tokens_seen": 45136775856,
      "step": 57370
    },
    {
      "epoch": 6.08646297475069,
      "grad_norm": 0.7671238468372297,
      "learning_rate": 2.44690837360491e-05,
      "loss": 0.9823,
      "num_input_tokens_seen": 45137562624,
      "step": 57371
    },
    {
      "epoch": 6.086569064290261,
      "grad_norm": 0.7547636579280816,
      "learning_rate": 2.4468388924165368e-05,
      "loss": 0.9421,
      "num_input_tokens_seen": 45138349424,
      "step": 57372
    },
    {
      "epoch": 6.086675153829832,
      "grad_norm": 0.7633555195019477,
      "learning_rate": 2.4467694112692455e-05,
      "loss": 1.0105,
      "num_input_tokens_seen": 45139136144,
      "step": 57373
    },
    {
      "epoch": 6.086781243369404,
      "grad_norm": 0.6634969353379185,
      "learning_rate": 2.4466999301630884e-05,
      "loss": 0.9901,
      "num_input_tokens_seen": 45139923024,
      "step": 57374
    },
    {
      "epoch": 6.086887332908975,
      "grad_norm": 0.9000572504227835,
      "learning_rate": 2.4466304490981205e-05,
      "loss": 0.9748,
      "num_input_tokens_seen": 45140709744,
      "step": 57375
    },
    {
      "epoch": 6.086993422448547,
      "grad_norm": 0.9151438463324774,
      "learning_rate": 2.4465609680743947e-05,
      "loss": 1.0926,
      "num_input_tokens_seen": 45141496448,
      "step": 57376
    },
    {
      "epoch": 6.087099511988118,
      "grad_norm": 0.9261678361525295,
      "learning_rate": 2.4464914870919654e-05,
      "loss": 0.9662,
      "num_input_tokens_seen": 45142283232,
      "step": 57377
    },
    {
      "epoch": 6.087205601527689,
      "grad_norm": 0.8968446508053053,
      "learning_rate": 2.4464220061508863e-05,
      "loss": 1.0318,
      "num_input_tokens_seen": 45143069968,
      "step": 57378
    },
    {
      "epoch": 6.087311691067261,
      "grad_norm": 0.8904764439954651,
      "learning_rate": 2.4463525252512098e-05,
      "loss": 0.9752,
      "num_input_tokens_seen": 45143856768,
      "step": 57379
    },
    {
      "epoch": 6.087417780606832,
      "grad_norm": 1.0277626042025527,
      "learning_rate": 2.446283044392991e-05,
      "loss": 0.999,
      "num_input_tokens_seen": 45144643632,
      "step": 57380
    },
    {
      "epoch": 6.087523870146404,
      "grad_norm": 0.9990202582063761,
      "learning_rate": 2.446213563576283e-05,
      "loss": 1.0215,
      "num_input_tokens_seen": 45145430544,
      "step": 57381
    },
    {
      "epoch": 6.087629959685975,
      "grad_norm": 1.4532978777404029,
      "learning_rate": 2.4461440828011395e-05,
      "loss": 0.992,
      "num_input_tokens_seen": 45146217360,
      "step": 57382
    },
    {
      "epoch": 6.087736049225547,
      "grad_norm": 1.100746554254371,
      "learning_rate": 2.4460746020676146e-05,
      "loss": 0.8759,
      "num_input_tokens_seen": 45147004112,
      "step": 57383
    },
    {
      "epoch": 6.087842138765118,
      "grad_norm": 0.8230769203156398,
      "learning_rate": 2.4460051213757617e-05,
      "loss": 1.0745,
      "num_input_tokens_seen": 45147790816,
      "step": 57384
    },
    {
      "epoch": 6.087948228304689,
      "grad_norm": 0.9724006255021559,
      "learning_rate": 2.4459356407256336e-05,
      "loss": 0.964,
      "num_input_tokens_seen": 45148577632,
      "step": 57385
    },
    {
      "epoch": 6.088054317844261,
      "grad_norm": 1.0736309450930166,
      "learning_rate": 2.4458661601172856e-05,
      "loss": 0.9434,
      "num_input_tokens_seen": 45149364384,
      "step": 57386
    },
    {
      "epoch": 6.088160407383832,
      "grad_norm": 0.8055954865600491,
      "learning_rate": 2.4457966795507705e-05,
      "loss": 0.9317,
      "num_input_tokens_seen": 45150151248,
      "step": 57387
    },
    {
      "epoch": 6.088266496923404,
      "grad_norm": 1.0526432983613867,
      "learning_rate": 2.445727199026142e-05,
      "loss": 0.8549,
      "num_input_tokens_seen": 45150938032,
      "step": 57388
    },
    {
      "epoch": 6.088372586462975,
      "grad_norm": 1.0512407190080995,
      "learning_rate": 2.445657718543454e-05,
      "loss": 0.9518,
      "num_input_tokens_seen": 45151724816,
      "step": 57389
    },
    {
      "epoch": 6.088478676002546,
      "grad_norm": 1.0790599280650293,
      "learning_rate": 2.44558823810276e-05,
      "loss": 0.9801,
      "num_input_tokens_seen": 45152511616,
      "step": 57390
    },
    {
      "epoch": 6.088584765542118,
      "grad_norm": 1.8403061909663232,
      "learning_rate": 2.4455187577041138e-05,
      "loss": 1.0601,
      "num_input_tokens_seen": 45153298352,
      "step": 57391
    },
    {
      "epoch": 6.088690855081689,
      "grad_norm": 1.9091086428185482,
      "learning_rate": 2.4454492773475697e-05,
      "loss": 0.9546,
      "num_input_tokens_seen": 45154085072,
      "step": 57392
    },
    {
      "epoch": 6.088796944621261,
      "grad_norm": 1.3173582992164523,
      "learning_rate": 2.4453797970331798e-05,
      "loss": 1.0144,
      "num_input_tokens_seen": 45154871840,
      "step": 57393
    },
    {
      "epoch": 6.088903034160832,
      "grad_norm": 1.0183924350619489,
      "learning_rate": 2.4453103167609995e-05,
      "loss": 1.0154,
      "num_input_tokens_seen": 45155658512,
      "step": 57394
    },
    {
      "epoch": 6.089009123700403,
      "grad_norm": 1.2667767014186173,
      "learning_rate": 2.445240836531082e-05,
      "loss": 0.98,
      "num_input_tokens_seen": 45156445168,
      "step": 57395
    },
    {
      "epoch": 6.089115213239975,
      "grad_norm": 1.2272920915380372,
      "learning_rate": 2.44517135634348e-05,
      "loss": 0.9752,
      "num_input_tokens_seen": 45157231952,
      "step": 57396
    },
    {
      "epoch": 6.089221302779546,
      "grad_norm": 1.1294153272372014,
      "learning_rate": 2.4451018761982484e-05,
      "loss": 0.9643,
      "num_input_tokens_seen": 45158018720,
      "step": 57397
    },
    {
      "epoch": 6.089327392319118,
      "grad_norm": 1.2263381962121807,
      "learning_rate": 2.4450323960954408e-05,
      "loss": 1.026,
      "num_input_tokens_seen": 45158805488,
      "step": 57398
    },
    {
      "epoch": 6.089433481858689,
      "grad_norm": 1.5374515773003914,
      "learning_rate": 2.44496291603511e-05,
      "loss": 1.0435,
      "num_input_tokens_seen": 45159592256,
      "step": 57399
    },
    {
      "epoch": 6.0895395713982605,
      "grad_norm": 0.9479757167768015,
      "learning_rate": 2.4448934360173102e-05,
      "loss": 1.0034,
      "num_input_tokens_seen": 45160378976,
      "step": 57400
    },
    {
      "epoch": 6.0896456609378316,
      "grad_norm": 1.0254622498865458,
      "learning_rate": 2.4448239560420956e-05,
      "loss": 0.9713,
      "num_input_tokens_seen": 45161165808,
      "step": 57401
    },
    {
      "epoch": 6.089751750477403,
      "grad_norm": 1.1955383453731896,
      "learning_rate": 2.444754476109519e-05,
      "loss": 0.9645,
      "num_input_tokens_seen": 45161952608,
      "step": 57402
    },
    {
      "epoch": 6.0898578400169745,
      "grad_norm": 1.0465768355512768,
      "learning_rate": 2.4446849962196348e-05,
      "loss": 0.9764,
      "num_input_tokens_seen": 45162739392,
      "step": 57403
    },
    {
      "epoch": 6.0899639295565455,
      "grad_norm": 1.3484738272084604,
      "learning_rate": 2.4446155163724967e-05,
      "loss": 1.0181,
      "num_input_tokens_seen": 45163526144,
      "step": 57404
    },
    {
      "epoch": 6.0900700190961174,
      "grad_norm": 1.0042121713588947,
      "learning_rate": 2.444546036568157e-05,
      "loss": 1.0342,
      "num_input_tokens_seen": 45164312864,
      "step": 57405
    },
    {
      "epoch": 6.0901761086356885,
      "grad_norm": 1.1783361952443592,
      "learning_rate": 2.4444765568066716e-05,
      "loss": 0.9445,
      "num_input_tokens_seen": 45165099648,
      "step": 57406
    },
    {
      "epoch": 6.0902821981752595,
      "grad_norm": 0.8327772266080815,
      "learning_rate": 2.444407077088092e-05,
      "loss": 1.0357,
      "num_input_tokens_seen": 45165886368,
      "step": 57407
    },
    {
      "epoch": 6.090388287714831,
      "grad_norm": 1.3052682835449196,
      "learning_rate": 2.444337597412474e-05,
      "loss": 1.0498,
      "num_input_tokens_seen": 45166673088,
      "step": 57408
    },
    {
      "epoch": 6.0904943772544025,
      "grad_norm": 1.0896911232886328,
      "learning_rate": 2.44426811777987e-05,
      "loss": 1.0183,
      "num_input_tokens_seen": 45167459888,
      "step": 57409
    },
    {
      "epoch": 6.090600466793974,
      "grad_norm": 0.8205272622582631,
      "learning_rate": 2.444198638190334e-05,
      "loss": 0.9759,
      "num_input_tokens_seen": 45168246704,
      "step": 57410
    },
    {
      "epoch": 6.090706556333545,
      "grad_norm": 1.3193358559038526,
      "learning_rate": 2.4441291586439197e-05,
      "loss": 1.0601,
      "num_input_tokens_seen": 45169033472,
      "step": 57411
    },
    {
      "epoch": 6.090812645873117,
      "grad_norm": 0.8350707100420485,
      "learning_rate": 2.4440596791406806e-05,
      "loss": 1.0958,
      "num_input_tokens_seen": 45169820208,
      "step": 57412
    },
    {
      "epoch": 6.090918735412688,
      "grad_norm": 1.1856034985204602,
      "learning_rate": 2.44399019968067e-05,
      "loss": 1.0772,
      "num_input_tokens_seen": 45170606912,
      "step": 57413
    },
    {
      "epoch": 6.091024824952259,
      "grad_norm": 0.6794151792828025,
      "learning_rate": 2.443920720263943e-05,
      "loss": 0.9764,
      "num_input_tokens_seen": 45171393648,
      "step": 57414
    },
    {
      "epoch": 6.091130914491831,
      "grad_norm": 0.8016988917777923,
      "learning_rate": 2.4438512408905524e-05,
      "loss": 1.0496,
      "num_input_tokens_seen": 45172180304,
      "step": 57415
    },
    {
      "epoch": 6.091237004031402,
      "grad_norm": 0.7879435906714638,
      "learning_rate": 2.4437817615605506e-05,
      "loss": 1.0274,
      "num_input_tokens_seen": 45172967008,
      "step": 57416
    },
    {
      "epoch": 6.091343093570974,
      "grad_norm": 0.8117940129624243,
      "learning_rate": 2.4437122822739934e-05,
      "loss": 1.0296,
      "num_input_tokens_seen": 45173753792,
      "step": 57417
    },
    {
      "epoch": 6.091449183110545,
      "grad_norm": 0.6880666651879951,
      "learning_rate": 2.443642803030934e-05,
      "loss": 0.9634,
      "num_input_tokens_seen": 45174540624,
      "step": 57418
    },
    {
      "epoch": 6.091555272650116,
      "grad_norm": 1.187256088167144,
      "learning_rate": 2.443573323831426e-05,
      "loss": 0.9531,
      "num_input_tokens_seen": 45175327408,
      "step": 57419
    },
    {
      "epoch": 6.091661362189688,
      "grad_norm": 0.7391522403775965,
      "learning_rate": 2.4435038446755222e-05,
      "loss": 0.9205,
      "num_input_tokens_seen": 45176114192,
      "step": 57420
    },
    {
      "epoch": 6.091767451729259,
      "grad_norm": 0.9556674919855942,
      "learning_rate": 2.4434343655632776e-05,
      "loss": 1.1215,
      "num_input_tokens_seen": 45176900880,
      "step": 57421
    },
    {
      "epoch": 6.091873541268831,
      "grad_norm": 0.8473576206373733,
      "learning_rate": 2.4433648864947454e-05,
      "loss": 0.9887,
      "num_input_tokens_seen": 45177687680,
      "step": 57422
    },
    {
      "epoch": 6.091979630808402,
      "grad_norm": 1.0389348760365824,
      "learning_rate": 2.4432954074699784e-05,
      "loss": 1.084,
      "num_input_tokens_seen": 45178474288,
      "step": 57423
    },
    {
      "epoch": 6.092085720347974,
      "grad_norm": 0.7575397818655207,
      "learning_rate": 2.4432259284890317e-05,
      "loss": 0.9382,
      "num_input_tokens_seen": 45179261168,
      "step": 57424
    },
    {
      "epoch": 6.092191809887545,
      "grad_norm": 1.141696686620858,
      "learning_rate": 2.443156449551958e-05,
      "loss": 0.8892,
      "num_input_tokens_seen": 45180047888,
      "step": 57425
    },
    {
      "epoch": 6.092297899427116,
      "grad_norm": 0.7174203316505967,
      "learning_rate": 2.443086970658811e-05,
      "loss": 1.0438,
      "num_input_tokens_seen": 45180834640,
      "step": 57426
    },
    {
      "epoch": 6.092403988966688,
      "grad_norm": 0.7763693507998928,
      "learning_rate": 2.4430174918096454e-05,
      "loss": 0.8729,
      "num_input_tokens_seen": 45181621408,
      "step": 57427
    },
    {
      "epoch": 6.092510078506259,
      "grad_norm": 1.039489987428783,
      "learning_rate": 2.4429480130045133e-05,
      "loss": 0.9759,
      "num_input_tokens_seen": 45182408208,
      "step": 57428
    },
    {
      "epoch": 6.092616168045831,
      "grad_norm": 0.6723746030199411,
      "learning_rate": 2.4428785342434703e-05,
      "loss": 0.9751,
      "num_input_tokens_seen": 45183195008,
      "step": 57429
    },
    {
      "epoch": 6.092722257585402,
      "grad_norm": 0.7285670351223035,
      "learning_rate": 2.442809055526569e-05,
      "loss": 1.0268,
      "num_input_tokens_seen": 45183981744,
      "step": 57430
    },
    {
      "epoch": 6.092828347124973,
      "grad_norm": 0.9644036515052539,
      "learning_rate": 2.4427395768538623e-05,
      "loss": 0.9992,
      "num_input_tokens_seen": 45184768432,
      "step": 57431
    },
    {
      "epoch": 6.092934436664545,
      "grad_norm": 0.9346498431085384,
      "learning_rate": 2.4426700982254057e-05,
      "loss": 1.0126,
      "num_input_tokens_seen": 45185555168,
      "step": 57432
    },
    {
      "epoch": 6.093040526204116,
      "grad_norm": 1.0158866027688562,
      "learning_rate": 2.4426006196412517e-05,
      "loss": 0.9941,
      "num_input_tokens_seen": 45186341984,
      "step": 57433
    },
    {
      "epoch": 6.093146615743688,
      "grad_norm": 0.8578850798304428,
      "learning_rate": 2.442531141101454e-05,
      "loss": 0.9627,
      "num_input_tokens_seen": 45187128736,
      "step": 57434
    },
    {
      "epoch": 6.093252705283259,
      "grad_norm": 0.7325511529828396,
      "learning_rate": 2.442461662606067e-05,
      "loss": 1.0199,
      "num_input_tokens_seen": 45187915440,
      "step": 57435
    },
    {
      "epoch": 6.09335879482283,
      "grad_norm": 0.6857739386377275,
      "learning_rate": 2.442392184155144e-05,
      "loss": 1.0013,
      "num_input_tokens_seen": 45188702128,
      "step": 57436
    },
    {
      "epoch": 6.093464884362402,
      "grad_norm": 0.9032060448833452,
      "learning_rate": 2.4423227057487378e-05,
      "loss": 1.0352,
      "num_input_tokens_seen": 45189488864,
      "step": 57437
    },
    {
      "epoch": 6.093570973901973,
      "grad_norm": 0.749734298632205,
      "learning_rate": 2.4422532273869038e-05,
      "loss": 1.0048,
      "num_input_tokens_seen": 45190275520,
      "step": 57438
    },
    {
      "epoch": 6.093677063441545,
      "grad_norm": 0.932047977725275,
      "learning_rate": 2.4421837490696945e-05,
      "loss": 0.9461,
      "num_input_tokens_seen": 45191062224,
      "step": 57439
    },
    {
      "epoch": 6.093783152981116,
      "grad_norm": 0.7543139452268206,
      "learning_rate": 2.4421142707971632e-05,
      "loss": 0.9441,
      "num_input_tokens_seen": 45191849056,
      "step": 57440
    },
    {
      "epoch": 6.093889242520688,
      "grad_norm": 0.731544196683424,
      "learning_rate": 2.4420447925693654e-05,
      "loss": 0.9663,
      "num_input_tokens_seen": 45192635792,
      "step": 57441
    },
    {
      "epoch": 6.093995332060259,
      "grad_norm": 1.4731743187160313,
      "learning_rate": 2.4419753143863533e-05,
      "loss": 1.013,
      "num_input_tokens_seen": 45193422592,
      "step": 57442
    },
    {
      "epoch": 6.09410142159983,
      "grad_norm": 0.8793335245542451,
      "learning_rate": 2.4419058362481807e-05,
      "loss": 1.0579,
      "num_input_tokens_seen": 45194209248,
      "step": 57443
    },
    {
      "epoch": 6.094207511139402,
      "grad_norm": 0.8687292319709893,
      "learning_rate": 2.441836358154902e-05,
      "loss": 1.0012,
      "num_input_tokens_seen": 45194996000,
      "step": 57444
    },
    {
      "epoch": 6.094313600678973,
      "grad_norm": 0.9344501662631003,
      "learning_rate": 2.4417668801065697e-05,
      "loss": 0.9901,
      "num_input_tokens_seen": 45195782720,
      "step": 57445
    },
    {
      "epoch": 6.094419690218545,
      "grad_norm": 1.5276104884628934,
      "learning_rate": 2.441697402103239e-05,
      "loss": 1.0412,
      "num_input_tokens_seen": 45196569520,
      "step": 57446
    },
    {
      "epoch": 6.094525779758116,
      "grad_norm": 0.8287159726144162,
      "learning_rate": 2.4416279241449626e-05,
      "loss": 0.9853,
      "num_input_tokens_seen": 45197356304,
      "step": 57447
    },
    {
      "epoch": 6.094631869297687,
      "grad_norm": 1.0108747880507198,
      "learning_rate": 2.441558446231794e-05,
      "loss": 1.09,
      "num_input_tokens_seen": 45198143072,
      "step": 57448
    },
    {
      "epoch": 6.094737958837259,
      "grad_norm": 0.9105976710302446,
      "learning_rate": 2.441488968363788e-05,
      "loss": 0.9882,
      "num_input_tokens_seen": 45198929856,
      "step": 57449
    },
    {
      "epoch": 6.09484404837683,
      "grad_norm": 0.8394489670690306,
      "learning_rate": 2.4414194905409975e-05,
      "loss": 1.0132,
      "num_input_tokens_seen": 45199716624,
      "step": 57450
    },
    {
      "epoch": 6.094950137916402,
      "grad_norm": 0.6713342361523017,
      "learning_rate": 2.441350012763476e-05,
      "loss": 0.9145,
      "num_input_tokens_seen": 45200503440,
      "step": 57451
    },
    {
      "epoch": 6.095056227455973,
      "grad_norm": 0.8739614010768028,
      "learning_rate": 2.4412805350312777e-05,
      "loss": 0.9449,
      "num_input_tokens_seen": 45201290128,
      "step": 57452
    },
    {
      "epoch": 6.095162316995545,
      "grad_norm": 1.0069489435395442,
      "learning_rate": 2.441211057344456e-05,
      "loss": 1.0523,
      "num_input_tokens_seen": 45202076944,
      "step": 57453
    },
    {
      "epoch": 6.095268406535116,
      "grad_norm": 0.9079504526454558,
      "learning_rate": 2.4411415797030647e-05,
      "loss": 0.9747,
      "num_input_tokens_seen": 45202863792,
      "step": 57454
    },
    {
      "epoch": 6.095374496074687,
      "grad_norm": 0.8801125902747114,
      "learning_rate": 2.4410721021071575e-05,
      "loss": 1.0409,
      "num_input_tokens_seen": 45203650576,
      "step": 57455
    },
    {
      "epoch": 6.095480585614259,
      "grad_norm": 0.9343959145449762,
      "learning_rate": 2.441002624556788e-05,
      "loss": 1.0038,
      "num_input_tokens_seen": 45204437312,
      "step": 57456
    },
    {
      "epoch": 6.09558667515383,
      "grad_norm": 0.9123439647371431,
      "learning_rate": 2.44093314705201e-05,
      "loss": 1.0468,
      "num_input_tokens_seen": 45205224048,
      "step": 57457
    },
    {
      "epoch": 6.095692764693402,
      "grad_norm": 0.7623439180910623,
      "learning_rate": 2.4408636695928772e-05,
      "loss": 0.9425,
      "num_input_tokens_seen": 45206010832,
      "step": 57458
    },
    {
      "epoch": 6.095798854232973,
      "grad_norm": 0.8571343188760423,
      "learning_rate": 2.4407941921794433e-05,
      "loss": 0.9934,
      "num_input_tokens_seen": 45206797600,
      "step": 57459
    },
    {
      "epoch": 6.095904943772544,
      "grad_norm": 0.8496888624424843,
      "learning_rate": 2.4407247148117613e-05,
      "loss": 1.0125,
      "num_input_tokens_seen": 45207584416,
      "step": 57460
    },
    {
      "epoch": 6.096011033312116,
      "grad_norm": 0.8094576625756256,
      "learning_rate": 2.4406552374898863e-05,
      "loss": 0.8809,
      "num_input_tokens_seen": 45208371248,
      "step": 57461
    },
    {
      "epoch": 6.096117122851687,
      "grad_norm": 0.8436765092055234,
      "learning_rate": 2.4405857602138702e-05,
      "loss": 1.0872,
      "num_input_tokens_seen": 45209157984,
      "step": 57462
    },
    {
      "epoch": 6.0962232123912585,
      "grad_norm": 0.7902436829021082,
      "learning_rate": 2.4405162829837685e-05,
      "loss": 0.9709,
      "num_input_tokens_seen": 45209944688,
      "step": 57463
    },
    {
      "epoch": 6.09632930193083,
      "grad_norm": 1.0071900263758273,
      "learning_rate": 2.440446805799634e-05,
      "loss": 0.9734,
      "num_input_tokens_seen": 45210731344,
      "step": 57464
    },
    {
      "epoch": 6.096435391470401,
      "grad_norm": 0.8801479455469801,
      "learning_rate": 2.44037732866152e-05,
      "loss": 0.9804,
      "num_input_tokens_seen": 45211518096,
      "step": 57465
    },
    {
      "epoch": 6.0965414810099725,
      "grad_norm": 0.9055506546352544,
      "learning_rate": 2.440307851569481e-05,
      "loss": 0.9313,
      "num_input_tokens_seen": 45212304912,
      "step": 57466
    },
    {
      "epoch": 6.0966475705495435,
      "grad_norm": 1.1511999661320318,
      "learning_rate": 2.4402383745235707e-05,
      "loss": 1.0398,
      "num_input_tokens_seen": 45213091664,
      "step": 57467
    },
    {
      "epoch": 6.0967536600891155,
      "grad_norm": 0.8019086801734346,
      "learning_rate": 2.4401688975238415e-05,
      "loss": 0.948,
      "num_input_tokens_seen": 45213878480,
      "step": 57468
    },
    {
      "epoch": 6.0968597496286865,
      "grad_norm": 0.9256937489412421,
      "learning_rate": 2.440099420570349e-05,
      "loss": 0.9204,
      "num_input_tokens_seen": 45214665280,
      "step": 57469
    },
    {
      "epoch": 6.096965839168258,
      "grad_norm": 1.2005577120712487,
      "learning_rate": 2.4400299436631455e-05,
      "loss": 0.9715,
      "num_input_tokens_seen": 45215452048,
      "step": 57470
    },
    {
      "epoch": 6.097071928707829,
      "grad_norm": 0.8098662809056885,
      "learning_rate": 2.4399604668022848e-05,
      "loss": 0.9469,
      "num_input_tokens_seen": 45216238848,
      "step": 57471
    },
    {
      "epoch": 6.0971780182474005,
      "grad_norm": 1.0670841150364003,
      "learning_rate": 2.4398909899878214e-05,
      "loss": 0.9556,
      "num_input_tokens_seen": 45217025648,
      "step": 57472
    },
    {
      "epoch": 6.097284107786972,
      "grad_norm": 0.8513200050886561,
      "learning_rate": 2.4398215132198083e-05,
      "loss": 0.9551,
      "num_input_tokens_seen": 45217812464,
      "step": 57473
    },
    {
      "epoch": 6.097390197326543,
      "grad_norm": 1.0273024605063714,
      "learning_rate": 2.439752036498299e-05,
      "loss": 1.0586,
      "num_input_tokens_seen": 45218599216,
      "step": 57474
    },
    {
      "epoch": 6.097496286866115,
      "grad_norm": 0.9575011544130868,
      "learning_rate": 2.439682559823348e-05,
      "loss": 0.9941,
      "num_input_tokens_seen": 45219385968,
      "step": 57475
    },
    {
      "epoch": 6.097602376405686,
      "grad_norm": 0.8368891013998472,
      "learning_rate": 2.4396130831950086e-05,
      "loss": 0.9089,
      "num_input_tokens_seen": 45220172736,
      "step": 57476
    },
    {
      "epoch": 6.097708465945257,
      "grad_norm": 0.9626803791895128,
      "learning_rate": 2.439543606613334e-05,
      "loss": 0.9922,
      "num_input_tokens_seen": 45220959584,
      "step": 57477
    },
    {
      "epoch": 6.097814555484829,
      "grad_norm": 1.0280018099322608,
      "learning_rate": 2.4394741300783786e-05,
      "loss": 0.9744,
      "num_input_tokens_seen": 45221746272,
      "step": 57478
    },
    {
      "epoch": 6.0979206450244,
      "grad_norm": 1.0205523227836515,
      "learning_rate": 2.4394046535901953e-05,
      "loss": 1.0523,
      "num_input_tokens_seen": 45222533104,
      "step": 57479
    },
    {
      "epoch": 6.098026734563972,
      "grad_norm": 0.8908679612129035,
      "learning_rate": 2.439335177148839e-05,
      "loss": 0.9377,
      "num_input_tokens_seen": 45223319904,
      "step": 57480
    },
    {
      "epoch": 6.098132824103543,
      "grad_norm": 0.9079643439082088,
      "learning_rate": 2.4392657007543628e-05,
      "loss": 1.0279,
      "num_input_tokens_seen": 45224106688,
      "step": 57481
    },
    {
      "epoch": 6.098238913643115,
      "grad_norm": 1.0062283912096714,
      "learning_rate": 2.43919622440682e-05,
      "loss": 0.929,
      "num_input_tokens_seen": 45224893520,
      "step": 57482
    },
    {
      "epoch": 6.098345003182686,
      "grad_norm": 0.8774680803887961,
      "learning_rate": 2.4391267481062643e-05,
      "loss": 0.9868,
      "num_input_tokens_seen": 45225680256,
      "step": 57483
    },
    {
      "epoch": 6.098451092722257,
      "grad_norm": 0.7781711765756941,
      "learning_rate": 2.4390572718527502e-05,
      "loss": 1.0895,
      "num_input_tokens_seen": 45226466992,
      "step": 57484
    },
    {
      "epoch": 6.098557182261829,
      "grad_norm": 0.9209109918531733,
      "learning_rate": 2.4389877956463304e-05,
      "loss": 0.8751,
      "num_input_tokens_seen": 45227253760,
      "step": 57485
    },
    {
      "epoch": 6.0986632718014,
      "grad_norm": 1.1884729091254456,
      "learning_rate": 2.4389183194870592e-05,
      "loss": 1.1538,
      "num_input_tokens_seen": 45228040560,
      "step": 57486
    },
    {
      "epoch": 6.098769361340972,
      "grad_norm": 1.0682241357181534,
      "learning_rate": 2.4388488433749905e-05,
      "loss": 1.026,
      "num_input_tokens_seen": 45228827280,
      "step": 57487
    },
    {
      "epoch": 6.098875450880543,
      "grad_norm": 0.7507721125457729,
      "learning_rate": 2.4387793673101767e-05,
      "loss": 0.9721,
      "num_input_tokens_seen": 45229614128,
      "step": 57488
    },
    {
      "epoch": 6.098981540420114,
      "grad_norm": 0.8995498091370668,
      "learning_rate": 2.438709891292673e-05,
      "loss": 1.0408,
      "num_input_tokens_seen": 45230400768,
      "step": 57489
    },
    {
      "epoch": 6.099087629959686,
      "grad_norm": 0.7260153805752165,
      "learning_rate": 2.4386404153225328e-05,
      "loss": 0.9836,
      "num_input_tokens_seen": 45231187440,
      "step": 57490
    },
    {
      "epoch": 6.099193719499257,
      "grad_norm": 0.9651753480864501,
      "learning_rate": 2.4385709393998088e-05,
      "loss": 0.9684,
      "num_input_tokens_seen": 45231974256,
      "step": 57491
    },
    {
      "epoch": 6.099299809038829,
      "grad_norm": 0.7505338877042772,
      "learning_rate": 2.438501463524556e-05,
      "loss": 0.9794,
      "num_input_tokens_seen": 45232760912,
      "step": 57492
    },
    {
      "epoch": 6.0994058985784,
      "grad_norm": 0.8703533114860892,
      "learning_rate": 2.4384319876968272e-05,
      "loss": 1.0189,
      "num_input_tokens_seen": 45233547584,
      "step": 57493
    },
    {
      "epoch": 6.099511988117971,
      "grad_norm": 0.8880663125372258,
      "learning_rate": 2.438362511916676e-05,
      "loss": 0.9847,
      "num_input_tokens_seen": 45234334352,
      "step": 57494
    },
    {
      "epoch": 6.099618077657543,
      "grad_norm": 0.7146742538826997,
      "learning_rate": 2.438293036184157e-05,
      "loss": 0.9311,
      "num_input_tokens_seen": 45235121152,
      "step": 57495
    },
    {
      "epoch": 6.099724167197114,
      "grad_norm": 0.8190076225665647,
      "learning_rate": 2.438223560499323e-05,
      "loss": 1.0011,
      "num_input_tokens_seen": 45235907856,
      "step": 57496
    },
    {
      "epoch": 6.099830256736686,
      "grad_norm": 0.6593308332944304,
      "learning_rate": 2.4381540848622282e-05,
      "loss": 0.9451,
      "num_input_tokens_seen": 45236694544,
      "step": 57497
    },
    {
      "epoch": 6.099936346276257,
      "grad_norm": 0.7224708093512876,
      "learning_rate": 2.4380846092729262e-05,
      "loss": 0.9686,
      "num_input_tokens_seen": 45237481328,
      "step": 57498
    },
    {
      "epoch": 6.100042435815829,
      "grad_norm": 1.0107568417010706,
      "learning_rate": 2.43801513373147e-05,
      "loss": 0.9982,
      "num_input_tokens_seen": 45238268128,
      "step": 57499
    },
    {
      "epoch": 6.1001485253554,
      "grad_norm": 0.7290995283305397,
      "learning_rate": 2.4379456582379145e-05,
      "loss": 0.9584,
      "num_input_tokens_seen": 45239054944,
      "step": 57500
    },
    {
      "epoch": 6.100254614894971,
      "grad_norm": 0.7357986609569064,
      "learning_rate": 2.437876182792313e-05,
      "loss": 0.9075,
      "num_input_tokens_seen": 45239841728,
      "step": 57501
    },
    {
      "epoch": 6.100360704434543,
      "grad_norm": 1.224540534785007,
      "learning_rate": 2.4378067073947182e-05,
      "loss": 1.0859,
      "num_input_tokens_seen": 45240628416,
      "step": 57502
    },
    {
      "epoch": 6.100466793974114,
      "grad_norm": 0.7378873246743597,
      "learning_rate": 2.437737232045185e-05,
      "loss": 0.9823,
      "num_input_tokens_seen": 45241415216,
      "step": 57503
    },
    {
      "epoch": 6.100572883513686,
      "grad_norm": 0.6662607137689228,
      "learning_rate": 2.4376677567437668e-05,
      "loss": 0.8783,
      "num_input_tokens_seen": 45242201904,
      "step": 57504
    },
    {
      "epoch": 6.100678973053257,
      "grad_norm": 0.8521220146440314,
      "learning_rate": 2.4375982814905166e-05,
      "loss": 0.9254,
      "num_input_tokens_seen": 45242988704,
      "step": 57505
    },
    {
      "epoch": 6.100785062592828,
      "grad_norm": 0.7957084916763002,
      "learning_rate": 2.437528806285489e-05,
      "loss": 1.0079,
      "num_input_tokens_seen": 45243775440,
      "step": 57506
    },
    {
      "epoch": 6.1008911521324,
      "grad_norm": 0.8155149198320852,
      "learning_rate": 2.4374593311287376e-05,
      "loss": 0.9863,
      "num_input_tokens_seen": 45244562176,
      "step": 57507
    },
    {
      "epoch": 6.100997241671971,
      "grad_norm": 0.8565483633297131,
      "learning_rate": 2.4373898560203148e-05,
      "loss": 0.9548,
      "num_input_tokens_seen": 45245348880,
      "step": 57508
    },
    {
      "epoch": 6.101103331211543,
      "grad_norm": 0.7717336727947559,
      "learning_rate": 2.437320380960276e-05,
      "loss": 1.026,
      "num_input_tokens_seen": 45246135648,
      "step": 57509
    },
    {
      "epoch": 6.101209420751114,
      "grad_norm": 0.7549579676163776,
      "learning_rate": 2.4372509059486736e-05,
      "loss": 0.9962,
      "num_input_tokens_seen": 45246922512,
      "step": 57510
    },
    {
      "epoch": 6.101315510290686,
      "grad_norm": 0.7373548609583445,
      "learning_rate": 2.437181430985562e-05,
      "loss": 0.9865,
      "num_input_tokens_seen": 45247709248,
      "step": 57511
    },
    {
      "epoch": 6.101421599830257,
      "grad_norm": 0.6718208323532683,
      "learning_rate": 2.437111956070995e-05,
      "loss": 0.9897,
      "num_input_tokens_seen": 45248495920,
      "step": 57512
    },
    {
      "epoch": 6.101527689369828,
      "grad_norm": 0.690999290546257,
      "learning_rate": 2.437042481205026e-05,
      "loss": 0.9707,
      "num_input_tokens_seen": 45249282672,
      "step": 57513
    },
    {
      "epoch": 6.1016337789094,
      "grad_norm": 0.8214395115821841,
      "learning_rate": 2.4369730063877093e-05,
      "loss": 0.9981,
      "num_input_tokens_seen": 45250069472,
      "step": 57514
    },
    {
      "epoch": 6.101739868448971,
      "grad_norm": 0.9343716510516149,
      "learning_rate": 2.4369035316190968e-05,
      "loss": 0.9326,
      "num_input_tokens_seen": 45250856256,
      "step": 57515
    },
    {
      "epoch": 6.101845957988543,
      "grad_norm": 0.684510369840612,
      "learning_rate": 2.4368340568992446e-05,
      "loss": 0.9818,
      "num_input_tokens_seen": 45251643056,
      "step": 57516
    },
    {
      "epoch": 6.101952047528114,
      "grad_norm": 0.8091200825323612,
      "learning_rate": 2.436764582228204e-05,
      "loss": 0.9501,
      "num_input_tokens_seen": 45252429856,
      "step": 57517
    },
    {
      "epoch": 6.102058137067685,
      "grad_norm": 0.6523522323676445,
      "learning_rate": 2.436695107606031e-05,
      "loss": 0.9573,
      "num_input_tokens_seen": 45253216672,
      "step": 57518
    },
    {
      "epoch": 6.102164226607257,
      "grad_norm": 0.7188055947826694,
      "learning_rate": 2.436625633032778e-05,
      "loss": 0.9559,
      "num_input_tokens_seen": 45254003472,
      "step": 57519
    },
    {
      "epoch": 6.102270316146828,
      "grad_norm": 0.6692184235149392,
      "learning_rate": 2.4365561585084982e-05,
      "loss": 0.9549,
      "num_input_tokens_seen": 45254790272,
      "step": 57520
    },
    {
      "epoch": 6.1023764056864,
      "grad_norm": 0.6949474592045569,
      "learning_rate": 2.4364866840332464e-05,
      "loss": 0.9361,
      "num_input_tokens_seen": 45255577104,
      "step": 57521
    },
    {
      "epoch": 6.102482495225971,
      "grad_norm": 0.7777894644722686,
      "learning_rate": 2.436417209607076e-05,
      "loss": 1.0552,
      "num_input_tokens_seen": 45256363872,
      "step": 57522
    },
    {
      "epoch": 6.102588584765542,
      "grad_norm": 0.7504927662557057,
      "learning_rate": 2.43634773523004e-05,
      "loss": 0.9445,
      "num_input_tokens_seen": 45257150688,
      "step": 57523
    },
    {
      "epoch": 6.102694674305114,
      "grad_norm": 0.710544246459884,
      "learning_rate": 2.436278260902193e-05,
      "loss": 0.9303,
      "num_input_tokens_seen": 45257937392,
      "step": 57524
    },
    {
      "epoch": 6.102800763844685,
      "grad_norm": 0.6704503492329479,
      "learning_rate": 2.4362087866235885e-05,
      "loss": 0.9801,
      "num_input_tokens_seen": 45258724128,
      "step": 57525
    },
    {
      "epoch": 6.1029068533842565,
      "grad_norm": 0.9317968688553279,
      "learning_rate": 2.4361393123942795e-05,
      "loss": 1.055,
      "num_input_tokens_seen": 45259510848,
      "step": 57526
    },
    {
      "epoch": 6.103012942923828,
      "grad_norm": 0.7517123842181025,
      "learning_rate": 2.43606983821432e-05,
      "loss": 0.9985,
      "num_input_tokens_seen": 45260297600,
      "step": 57527
    },
    {
      "epoch": 6.1031190324633995,
      "grad_norm": 1.1510282898237407,
      "learning_rate": 2.436000364083765e-05,
      "loss": 0.9825,
      "num_input_tokens_seen": 45261084400,
      "step": 57528
    },
    {
      "epoch": 6.1032251220029705,
      "grad_norm": 0.8682390103698552,
      "learning_rate": 2.4359308900026657e-05,
      "loss": 0.9786,
      "num_input_tokens_seen": 45261871184,
      "step": 57529
    },
    {
      "epoch": 6.1033312115425415,
      "grad_norm": 0.8293242240554579,
      "learning_rate": 2.435861415971078e-05,
      "loss": 0.9953,
      "num_input_tokens_seen": 45262657968,
      "step": 57530
    },
    {
      "epoch": 6.1034373010821135,
      "grad_norm": 0.7229613007602633,
      "learning_rate": 2.4357919419890537e-05,
      "loss": 1.0709,
      "num_input_tokens_seen": 45263444656,
      "step": 57531
    },
    {
      "epoch": 6.1035433906216845,
      "grad_norm": 0.7877911001905434,
      "learning_rate": 2.4357224680566484e-05,
      "loss": 0.946,
      "num_input_tokens_seen": 45264231424,
      "step": 57532
    },
    {
      "epoch": 6.103649480161256,
      "grad_norm": 0.7544318372446317,
      "learning_rate": 2.4356529941739148e-05,
      "loss": 0.9736,
      "num_input_tokens_seen": 45265018160,
      "step": 57533
    },
    {
      "epoch": 6.103755569700827,
      "grad_norm": 0.6984473785025745,
      "learning_rate": 2.435583520340906e-05,
      "loss": 0.9641,
      "num_input_tokens_seen": 45265804864,
      "step": 57534
    },
    {
      "epoch": 6.1038616592403985,
      "grad_norm": 0.7539178508267598,
      "learning_rate": 2.435514046557677e-05,
      "loss": 0.9636,
      "num_input_tokens_seen": 45266591616,
      "step": 57535
    },
    {
      "epoch": 6.10396774877997,
      "grad_norm": 0.9862928414115768,
      "learning_rate": 2.4354445728242812e-05,
      "loss": 1.0788,
      "num_input_tokens_seen": 45267378432,
      "step": 57536
    },
    {
      "epoch": 6.104073838319541,
      "grad_norm": 1.0027980490242971,
      "learning_rate": 2.435375099140771e-05,
      "loss": 0.8655,
      "num_input_tokens_seen": 45268165216,
      "step": 57537
    },
    {
      "epoch": 6.104179927859113,
      "grad_norm": 0.8089449300039966,
      "learning_rate": 2.4353056255072017e-05,
      "loss": 0.9848,
      "num_input_tokens_seen": 45268952016,
      "step": 57538
    },
    {
      "epoch": 6.104286017398684,
      "grad_norm": 0.8026841939453947,
      "learning_rate": 2.4352361519236263e-05,
      "loss": 0.9862,
      "num_input_tokens_seen": 45269738752,
      "step": 57539
    },
    {
      "epoch": 6.104392106938256,
      "grad_norm": 1.0151724870995158,
      "learning_rate": 2.4351666783900983e-05,
      "loss": 1.0382,
      "num_input_tokens_seen": 45270525568,
      "step": 57540
    },
    {
      "epoch": 6.104498196477827,
      "grad_norm": 0.7651546289384783,
      "learning_rate": 2.4350972049066716e-05,
      "loss": 0.9586,
      "num_input_tokens_seen": 45271312336,
      "step": 57541
    },
    {
      "epoch": 6.104604286017398,
      "grad_norm": 1.4297461710812536,
      "learning_rate": 2.4350277314734e-05,
      "loss": 1.0236,
      "num_input_tokens_seen": 45272099120,
      "step": 57542
    },
    {
      "epoch": 6.10471037555697,
      "grad_norm": 1.0169464726596094,
      "learning_rate": 2.434958258090337e-05,
      "loss": 1.0162,
      "num_input_tokens_seen": 45272885824,
      "step": 57543
    },
    {
      "epoch": 6.104816465096541,
      "grad_norm": 0.8156033268639612,
      "learning_rate": 2.4348887847575364e-05,
      "loss": 0.9783,
      "num_input_tokens_seen": 45273672560,
      "step": 57544
    },
    {
      "epoch": 6.104922554636113,
      "grad_norm": 1.0705987726224835,
      "learning_rate": 2.4348193114750517e-05,
      "loss": 0.9665,
      "num_input_tokens_seen": 45274459312,
      "step": 57545
    },
    {
      "epoch": 6.105028644175684,
      "grad_norm": 0.7638109439761905,
      "learning_rate": 2.4347498382429367e-05,
      "loss": 1.0944,
      "num_input_tokens_seen": 45275246064,
      "step": 57546
    },
    {
      "epoch": 6.105134733715255,
      "grad_norm": 0.7922827339487535,
      "learning_rate": 2.434680365061245e-05,
      "loss": 0.982,
      "num_input_tokens_seen": 45276032768,
      "step": 57547
    },
    {
      "epoch": 6.105240823254827,
      "grad_norm": 0.7345678601249588,
      "learning_rate": 2.4346108919300303e-05,
      "loss": 0.9832,
      "num_input_tokens_seen": 45276819552,
      "step": 57548
    },
    {
      "epoch": 6.105346912794398,
      "grad_norm": 0.9066034673781013,
      "learning_rate": 2.4345414188493468e-05,
      "loss": 0.9781,
      "num_input_tokens_seen": 45277606304,
      "step": 57549
    },
    {
      "epoch": 6.10545300233397,
      "grad_norm": 1.1495351600666182,
      "learning_rate": 2.434471945819248e-05,
      "loss": 0.9834,
      "num_input_tokens_seen": 45278393088,
      "step": 57550
    },
    {
      "epoch": 6.105559091873541,
      "grad_norm": 0.844125560349221,
      "learning_rate": 2.4344024728397867e-05,
      "loss": 0.955,
      "num_input_tokens_seen": 45279179904,
      "step": 57551
    },
    {
      "epoch": 6.105665181413113,
      "grad_norm": 1.262541923908192,
      "learning_rate": 2.4343329999110175e-05,
      "loss": 1.0777,
      "num_input_tokens_seen": 45279966592,
      "step": 57552
    },
    {
      "epoch": 6.105771270952684,
      "grad_norm": 1.447432458306575,
      "learning_rate": 2.434263527032994e-05,
      "loss": 0.9713,
      "num_input_tokens_seen": 45280753344,
      "step": 57553
    },
    {
      "epoch": 6.105877360492255,
      "grad_norm": 1.0581750479210812,
      "learning_rate": 2.4341940542057695e-05,
      "loss": 1.0194,
      "num_input_tokens_seen": 45281540192,
      "step": 57554
    },
    {
      "epoch": 6.105983450031827,
      "grad_norm": 1.1085973352725504,
      "learning_rate": 2.4341245814293982e-05,
      "loss": 0.9366,
      "num_input_tokens_seen": 45282327024,
      "step": 57555
    },
    {
      "epoch": 6.106089539571398,
      "grad_norm": 1.0649109304902293,
      "learning_rate": 2.4340551087039335e-05,
      "loss": 0.9553,
      "num_input_tokens_seen": 45283113824,
      "step": 57556
    },
    {
      "epoch": 6.10619562911097,
      "grad_norm": 1.1080653053097416,
      "learning_rate": 2.4339856360294284e-05,
      "loss": 0.9757,
      "num_input_tokens_seen": 45283900720,
      "step": 57557
    },
    {
      "epoch": 6.106301718650541,
      "grad_norm": 0.9858497276739001,
      "learning_rate": 2.433916163405938e-05,
      "loss": 1.0554,
      "num_input_tokens_seen": 45284687456,
      "step": 57558
    },
    {
      "epoch": 6.106407808190112,
      "grad_norm": 0.9236461240655682,
      "learning_rate": 2.433846690833515e-05,
      "loss": 0.9582,
      "num_input_tokens_seen": 45285474192,
      "step": 57559
    },
    {
      "epoch": 6.106513897729684,
      "grad_norm": 1.432046143788302,
      "learning_rate": 2.433777218312213e-05,
      "loss": 1.0701,
      "num_input_tokens_seen": 45286260912,
      "step": 57560
    },
    {
      "epoch": 6.106619987269255,
      "grad_norm": 0.8640134281465521,
      "learning_rate": 2.4337077458420867e-05,
      "loss": 1.066,
      "num_input_tokens_seen": 45287047776,
      "step": 57561
    },
    {
      "epoch": 6.106726076808827,
      "grad_norm": 0.7557964265586034,
      "learning_rate": 2.4336382734231886e-05,
      "loss": 0.9915,
      "num_input_tokens_seen": 45287834608,
      "step": 57562
    },
    {
      "epoch": 6.106832166348398,
      "grad_norm": 1.0290840376511476,
      "learning_rate": 2.4335688010555727e-05,
      "loss": 1.1302,
      "num_input_tokens_seen": 45288621440,
      "step": 57563
    },
    {
      "epoch": 6.106938255887969,
      "grad_norm": 0.7632665163693136,
      "learning_rate": 2.4334993287392933e-05,
      "loss": 1.0127,
      "num_input_tokens_seen": 45289408224,
      "step": 57564
    },
    {
      "epoch": 6.107044345427541,
      "grad_norm": 0.8681933729573712,
      "learning_rate": 2.4334298564744035e-05,
      "loss": 1.0175,
      "num_input_tokens_seen": 45290195040,
      "step": 57565
    },
    {
      "epoch": 6.107150434967112,
      "grad_norm": 0.6864062344458143,
      "learning_rate": 2.4333603842609574e-05,
      "loss": 0.9093,
      "num_input_tokens_seen": 45290981824,
      "step": 57566
    },
    {
      "epoch": 6.107256524506684,
      "grad_norm": 0.9737975111488693,
      "learning_rate": 2.433290912099008e-05,
      "loss": 1.042,
      "num_input_tokens_seen": 45291768672,
      "step": 57567
    },
    {
      "epoch": 6.107362614046255,
      "grad_norm": 0.7329797765879587,
      "learning_rate": 2.4332214399886096e-05,
      "loss": 0.8916,
      "num_input_tokens_seen": 45292555456,
      "step": 57568
    },
    {
      "epoch": 6.107468703585827,
      "grad_norm": 0.7798625427147464,
      "learning_rate": 2.433151967929816e-05,
      "loss": 0.9817,
      "num_input_tokens_seen": 45293342192,
      "step": 57569
    },
    {
      "epoch": 6.107574793125398,
      "grad_norm": 1.0809985596820881,
      "learning_rate": 2.4330824959226808e-05,
      "loss": 0.9803,
      "num_input_tokens_seen": 45294128928,
      "step": 57570
    },
    {
      "epoch": 6.107680882664969,
      "grad_norm": 0.782385251801812,
      "learning_rate": 2.4330130239672565e-05,
      "loss": 0.8737,
      "num_input_tokens_seen": 45294915760,
      "step": 57571
    },
    {
      "epoch": 6.107786972204541,
      "grad_norm": 1.1477173383696437,
      "learning_rate": 2.4329435520635988e-05,
      "loss": 0.9828,
      "num_input_tokens_seen": 45295702560,
      "step": 57572
    },
    {
      "epoch": 6.107893061744112,
      "grad_norm": 0.9785786080558,
      "learning_rate": 2.43287408021176e-05,
      "loss": 0.9276,
      "num_input_tokens_seen": 45296489344,
      "step": 57573
    },
    {
      "epoch": 6.107999151283684,
      "grad_norm": 0.7853188952925491,
      "learning_rate": 2.4328046084117938e-05,
      "loss": 1.0488,
      "num_input_tokens_seen": 45297276032,
      "step": 57574
    },
    {
      "epoch": 6.108105240823255,
      "grad_norm": 0.9749739733133861,
      "learning_rate": 2.4327351366637547e-05,
      "loss": 1.0952,
      "num_input_tokens_seen": 45298062768,
      "step": 57575
    },
    {
      "epoch": 6.108211330362826,
      "grad_norm": 0.946686533562225,
      "learning_rate": 2.4326656649676956e-05,
      "loss": 0.9846,
      "num_input_tokens_seen": 45298849472,
      "step": 57576
    },
    {
      "epoch": 6.108317419902398,
      "grad_norm": 0.7322697953053702,
      "learning_rate": 2.4325961933236704e-05,
      "loss": 0.9283,
      "num_input_tokens_seen": 45299636240,
      "step": 57577
    },
    {
      "epoch": 6.108423509441969,
      "grad_norm": 0.9215193748463218,
      "learning_rate": 2.4325267217317333e-05,
      "loss": 1.0476,
      "num_input_tokens_seen": 45300422944,
      "step": 57578
    },
    {
      "epoch": 6.108529598981541,
      "grad_norm": 0.7979455482671257,
      "learning_rate": 2.4324572501919376e-05,
      "loss": 0.9654,
      "num_input_tokens_seen": 45301209696,
      "step": 57579
    },
    {
      "epoch": 6.108635688521112,
      "grad_norm": 0.7478543829019558,
      "learning_rate": 2.4323877787043363e-05,
      "loss": 1.0378,
      "num_input_tokens_seen": 45301996416,
      "step": 57580
    },
    {
      "epoch": 6.108741778060684,
      "grad_norm": 0.8160754528179145,
      "learning_rate": 2.432318307268984e-05,
      "loss": 1.0195,
      "num_input_tokens_seen": 45302783232,
      "step": 57581
    },
    {
      "epoch": 6.108847867600255,
      "grad_norm": 0.9409340685688472,
      "learning_rate": 2.4322488358859342e-05,
      "loss": 1.0156,
      "num_input_tokens_seen": 45303570048,
      "step": 57582
    },
    {
      "epoch": 6.108953957139826,
      "grad_norm": 0.6694649548684779,
      "learning_rate": 2.4321793645552407e-05,
      "loss": 0.8967,
      "num_input_tokens_seen": 45304356864,
      "step": 57583
    },
    {
      "epoch": 6.109060046679398,
      "grad_norm": 0.9296383583162088,
      "learning_rate": 2.432109893276957e-05,
      "loss": 1.0355,
      "num_input_tokens_seen": 45305143664,
      "step": 57584
    },
    {
      "epoch": 6.109166136218969,
      "grad_norm": 1.2775030170490047,
      "learning_rate": 2.4320404220511363e-05,
      "loss": 1.017,
      "num_input_tokens_seen": 45305930432,
      "step": 57585
    },
    {
      "epoch": 6.109272225758541,
      "grad_norm": 1.041349900253907,
      "learning_rate": 2.4319709508778334e-05,
      "loss": 0.9625,
      "num_input_tokens_seen": 45306717152,
      "step": 57586
    },
    {
      "epoch": 6.109378315298112,
      "grad_norm": 0.9408682660908384,
      "learning_rate": 2.4319014797571014e-05,
      "loss": 0.944,
      "num_input_tokens_seen": 45307504064,
      "step": 57587
    },
    {
      "epoch": 6.109484404837683,
      "grad_norm": 0.6685324936854657,
      "learning_rate": 2.4318320086889933e-05,
      "loss": 0.9483,
      "num_input_tokens_seen": 45308290816,
      "step": 57588
    },
    {
      "epoch": 6.1095904943772545,
      "grad_norm": 0.9537747125295272,
      "learning_rate": 2.431762537673564e-05,
      "loss": 1.0546,
      "num_input_tokens_seen": 45309077584,
      "step": 57589
    },
    {
      "epoch": 6.109696583916826,
      "grad_norm": 0.7458280217251573,
      "learning_rate": 2.4316930667108665e-05,
      "loss": 0.9132,
      "num_input_tokens_seen": 45309864480,
      "step": 57590
    },
    {
      "epoch": 6.1098026734563975,
      "grad_norm": 0.9106557751032255,
      "learning_rate": 2.431623595800954e-05,
      "loss": 0.9673,
      "num_input_tokens_seen": 45310651232,
      "step": 57591
    },
    {
      "epoch": 6.1099087629959685,
      "grad_norm": 0.715672350893123,
      "learning_rate": 2.4315541249438813e-05,
      "loss": 0.9805,
      "num_input_tokens_seen": 45311437920,
      "step": 57592
    },
    {
      "epoch": 6.11001485253554,
      "grad_norm": 0.8833305231202893,
      "learning_rate": 2.4314846541397018e-05,
      "loss": 1.1098,
      "num_input_tokens_seen": 45312224736,
      "step": 57593
    },
    {
      "epoch": 6.1101209420751115,
      "grad_norm": 1.0707035934868563,
      "learning_rate": 2.4314151833884683e-05,
      "loss": 0.9483,
      "num_input_tokens_seen": 45313011440,
      "step": 57594
    },
    {
      "epoch": 6.1102270316146825,
      "grad_norm": 0.9391997441973806,
      "learning_rate": 2.4313457126902357e-05,
      "loss": 0.999,
      "num_input_tokens_seen": 45313798192,
      "step": 57595
    },
    {
      "epoch": 6.110333121154254,
      "grad_norm": 0.8208843346696167,
      "learning_rate": 2.431276242045057e-05,
      "loss": 0.9511,
      "num_input_tokens_seen": 45314584992,
      "step": 57596
    },
    {
      "epoch": 6.1104392106938255,
      "grad_norm": 1.4267294440934903,
      "learning_rate": 2.4312067714529856e-05,
      "loss": 1.0189,
      "num_input_tokens_seen": 45315371712,
      "step": 57597
    },
    {
      "epoch": 6.110545300233397,
      "grad_norm": 0.7589250359461074,
      "learning_rate": 2.431137300914076e-05,
      "loss": 0.9907,
      "num_input_tokens_seen": 45316158416,
      "step": 57598
    },
    {
      "epoch": 6.110651389772968,
      "grad_norm": 0.8075902551541764,
      "learning_rate": 2.431067830428381e-05,
      "loss": 1.0409,
      "num_input_tokens_seen": 45316945184,
      "step": 57599
    },
    {
      "epoch": 6.110757479312539,
      "grad_norm": 1.0523157899100963,
      "learning_rate": 2.4309983599959555e-05,
      "loss": 1.0127,
      "num_input_tokens_seen": 45317732016,
      "step": 57600
    },
    {
      "epoch": 6.110863568852111,
      "grad_norm": 1.077874473467988,
      "learning_rate": 2.4309288896168524e-05,
      "loss": 1.0435,
      "num_input_tokens_seen": 45318518784,
      "step": 57601
    },
    {
      "epoch": 6.110969658391682,
      "grad_norm": 0.8698541238935645,
      "learning_rate": 2.4308594192911245e-05,
      "loss": 0.914,
      "num_input_tokens_seen": 45319305584,
      "step": 57602
    },
    {
      "epoch": 6.111075747931254,
      "grad_norm": 0.8008228383649342,
      "learning_rate": 2.4307899490188272e-05,
      "loss": 1.0246,
      "num_input_tokens_seen": 45320092320,
      "step": 57603
    },
    {
      "epoch": 6.111181837470825,
      "grad_norm": 0.684874756953468,
      "learning_rate": 2.4307204788000136e-05,
      "loss": 1.0136,
      "num_input_tokens_seen": 45320879120,
      "step": 57604
    },
    {
      "epoch": 6.111287927010396,
      "grad_norm": 0.7303744703212793,
      "learning_rate": 2.430651008634736e-05,
      "loss": 0.9654,
      "num_input_tokens_seen": 45321665984,
      "step": 57605
    },
    {
      "epoch": 6.111394016549968,
      "grad_norm": 0.6681648856062979,
      "learning_rate": 2.4305815385230494e-05,
      "loss": 0.9165,
      "num_input_tokens_seen": 45322452736,
      "step": 57606
    },
    {
      "epoch": 6.111500106089539,
      "grad_norm": 0.6199044028704948,
      "learning_rate": 2.430512068465008e-05,
      "loss": 0.9366,
      "num_input_tokens_seen": 45323239536,
      "step": 57607
    },
    {
      "epoch": 6.111606195629111,
      "grad_norm": 0.7580006827997475,
      "learning_rate": 2.4304425984606652e-05,
      "loss": 1.0125,
      "num_input_tokens_seen": 45324026304,
      "step": 57608
    },
    {
      "epoch": 6.111712285168682,
      "grad_norm": 0.7008568547692481,
      "learning_rate": 2.4303731285100733e-05,
      "loss": 0.8656,
      "num_input_tokens_seen": 45324813072,
      "step": 57609
    },
    {
      "epoch": 6.111818374708254,
      "grad_norm": 0.6533051817580338,
      "learning_rate": 2.430303658613288e-05,
      "loss": 0.9327,
      "num_input_tokens_seen": 45325599872,
      "step": 57610
    },
    {
      "epoch": 6.111924464247825,
      "grad_norm": 0.9351285255627744,
      "learning_rate": 2.430234188770362e-05,
      "loss": 1.0041,
      "num_input_tokens_seen": 45326386672,
      "step": 57611
    },
    {
      "epoch": 6.112030553787396,
      "grad_norm": 0.9516181443490734,
      "learning_rate": 2.430164718981348e-05,
      "loss": 1.0756,
      "num_input_tokens_seen": 45327173456,
      "step": 57612
    },
    {
      "epoch": 6.112136643326968,
      "grad_norm": 1.2956941080412927,
      "learning_rate": 2.4300952492463016e-05,
      "loss": 1.1275,
      "num_input_tokens_seen": 45327960224,
      "step": 57613
    },
    {
      "epoch": 6.112242732866539,
      "grad_norm": 0.7281269166184118,
      "learning_rate": 2.4300257795652753e-05,
      "loss": 0.9859,
      "num_input_tokens_seen": 45328746992,
      "step": 57614
    },
    {
      "epoch": 6.112348822406111,
      "grad_norm": 0.8449644596022052,
      "learning_rate": 2.429956309938323e-05,
      "loss": 1.0402,
      "num_input_tokens_seen": 45329533744,
      "step": 57615
    },
    {
      "epoch": 6.112454911945682,
      "grad_norm": 0.7006730658289962,
      "learning_rate": 2.4298868403654982e-05,
      "loss": 0.8761,
      "num_input_tokens_seen": 45330320576,
      "step": 57616
    },
    {
      "epoch": 6.112561001485253,
      "grad_norm": 0.770865979759968,
      "learning_rate": 2.429817370846855e-05,
      "loss": 0.9518,
      "num_input_tokens_seen": 45331107424,
      "step": 57617
    },
    {
      "epoch": 6.112667091024825,
      "grad_norm": 1.5474181522889348,
      "learning_rate": 2.4297479013824464e-05,
      "loss": 0.935,
      "num_input_tokens_seen": 45331894176,
      "step": 57618
    },
    {
      "epoch": 6.112773180564396,
      "grad_norm": 0.7473788808890064,
      "learning_rate": 2.4296784319723273e-05,
      "loss": 0.9421,
      "num_input_tokens_seen": 45332680880,
      "step": 57619
    },
    {
      "epoch": 6.112879270103968,
      "grad_norm": 1.4845196083110421,
      "learning_rate": 2.42960896261655e-05,
      "loss": 0.9882,
      "num_input_tokens_seen": 45333467680,
      "step": 57620
    },
    {
      "epoch": 6.112985359643539,
      "grad_norm": 2.2033134541168327,
      "learning_rate": 2.4295394933151693e-05,
      "loss": 1.0446,
      "num_input_tokens_seen": 45334254400,
      "step": 57621
    },
    {
      "epoch": 6.113091449183111,
      "grad_norm": 0.8520087865529665,
      "learning_rate": 2.4294700240682382e-05,
      "loss": 0.9778,
      "num_input_tokens_seen": 45335041184,
      "step": 57622
    },
    {
      "epoch": 6.113197538722682,
      "grad_norm": 1.051768940463728,
      "learning_rate": 2.4294005548758106e-05,
      "loss": 0.9892,
      "num_input_tokens_seen": 45335827904,
      "step": 57623
    },
    {
      "epoch": 6.113303628262253,
      "grad_norm": 1.1678057412702125,
      "learning_rate": 2.4293310857379405e-05,
      "loss": 0.9824,
      "num_input_tokens_seen": 45336614688,
      "step": 57624
    },
    {
      "epoch": 6.113409717801825,
      "grad_norm": 0.6455446674550583,
      "learning_rate": 2.4292616166546812e-05,
      "loss": 0.9592,
      "num_input_tokens_seen": 45337401392,
      "step": 57625
    },
    {
      "epoch": 6.113515807341396,
      "grad_norm": 0.76983149284765,
      "learning_rate": 2.4291921476260857e-05,
      "loss": 1.0256,
      "num_input_tokens_seen": 45338188176,
      "step": 57626
    },
    {
      "epoch": 6.113621896880968,
      "grad_norm": 1.0802148984083066,
      "learning_rate": 2.4291226786522092e-05,
      "loss": 0.9997,
      "num_input_tokens_seen": 45338975040,
      "step": 57627
    },
    {
      "epoch": 6.113727986420539,
      "grad_norm": 1.1048273063402856,
      "learning_rate": 2.4290532097331046e-05,
      "loss": 1.0386,
      "num_input_tokens_seen": 45339761792,
      "step": 57628
    },
    {
      "epoch": 6.11383407596011,
      "grad_norm": 0.8036668787098155,
      "learning_rate": 2.4289837408688247e-05,
      "loss": 0.9897,
      "num_input_tokens_seen": 45340548416,
      "step": 57629
    },
    {
      "epoch": 6.113940165499682,
      "grad_norm": 0.880100824163679,
      "learning_rate": 2.428914272059425e-05,
      "loss": 0.9367,
      "num_input_tokens_seen": 45341335216,
      "step": 57630
    },
    {
      "epoch": 6.114046255039253,
      "grad_norm": 1.0010547762645285,
      "learning_rate": 2.4288448033049586e-05,
      "loss": 1.0196,
      "num_input_tokens_seen": 45342121952,
      "step": 57631
    },
    {
      "epoch": 6.114152344578825,
      "grad_norm": 0.8230170342577604,
      "learning_rate": 2.4287753346054778e-05,
      "loss": 0.9909,
      "num_input_tokens_seen": 45342908736,
      "step": 57632
    },
    {
      "epoch": 6.114258434118396,
      "grad_norm": 0.9400930238774211,
      "learning_rate": 2.428705865961038e-05,
      "loss": 1.0077,
      "num_input_tokens_seen": 45343695504,
      "step": 57633
    },
    {
      "epoch": 6.114364523657967,
      "grad_norm": 1.4367959751536905,
      "learning_rate": 2.4286363973716917e-05,
      "loss": 1.0116,
      "num_input_tokens_seen": 45344482304,
      "step": 57634
    },
    {
      "epoch": 6.114470613197539,
      "grad_norm": 0.8553980979533365,
      "learning_rate": 2.4285669288374934e-05,
      "loss": 0.9932,
      "num_input_tokens_seen": 45345269136,
      "step": 57635
    },
    {
      "epoch": 6.11457670273711,
      "grad_norm": 0.7536866223075647,
      "learning_rate": 2.4284974603584966e-05,
      "loss": 0.9722,
      "num_input_tokens_seen": 45346055952,
      "step": 57636
    },
    {
      "epoch": 6.114682792276682,
      "grad_norm": 1.0334124677950487,
      "learning_rate": 2.4284279919347548e-05,
      "loss": 1.0006,
      "num_input_tokens_seen": 45346842720,
      "step": 57637
    },
    {
      "epoch": 6.114788881816253,
      "grad_norm": 1.2161578815245344,
      "learning_rate": 2.4283585235663216e-05,
      "loss": 1.0245,
      "num_input_tokens_seen": 45347629520,
      "step": 57638
    },
    {
      "epoch": 6.114894971355825,
      "grad_norm": 0.9098679817547934,
      "learning_rate": 2.4282890552532514e-05,
      "loss": 0.9885,
      "num_input_tokens_seen": 45348416352,
      "step": 57639
    },
    {
      "epoch": 6.115001060895396,
      "grad_norm": 0.9769713017735905,
      "learning_rate": 2.4282195869955965e-05,
      "loss": 0.9346,
      "num_input_tokens_seen": 45349203008,
      "step": 57640
    },
    {
      "epoch": 6.115107150434967,
      "grad_norm": 1.2659517676673486,
      "learning_rate": 2.4281501187934118e-05,
      "loss": 1.056,
      "num_input_tokens_seen": 45349989792,
      "step": 57641
    },
    {
      "epoch": 6.115213239974539,
      "grad_norm": 0.8972435637118986,
      "learning_rate": 2.4280806506467507e-05,
      "loss": 1.0073,
      "num_input_tokens_seen": 45350776528,
      "step": 57642
    },
    {
      "epoch": 6.11531932951411,
      "grad_norm": 0.7871786548023717,
      "learning_rate": 2.4280111825556662e-05,
      "loss": 0.9508,
      "num_input_tokens_seen": 45351563360,
      "step": 57643
    },
    {
      "epoch": 6.115425419053682,
      "grad_norm": 0.7704419319573104,
      "learning_rate": 2.427941714520213e-05,
      "loss": 0.8892,
      "num_input_tokens_seen": 45352350160,
      "step": 57644
    },
    {
      "epoch": 6.115531508593253,
      "grad_norm": 0.8893341346387356,
      "learning_rate": 2.4278722465404447e-05,
      "loss": 1.0346,
      "num_input_tokens_seen": 45353136800,
      "step": 57645
    },
    {
      "epoch": 6.115637598132824,
      "grad_norm": 0.9529819049135629,
      "learning_rate": 2.4278027786164137e-05,
      "loss": 0.9181,
      "num_input_tokens_seen": 45353923616,
      "step": 57646
    },
    {
      "epoch": 6.115743687672396,
      "grad_norm": 1.0670336217388239,
      "learning_rate": 2.4277333107481755e-05,
      "loss": 0.9633,
      "num_input_tokens_seen": 45354710432,
      "step": 57647
    },
    {
      "epoch": 6.115849777211967,
      "grad_norm": 0.9803793521493471,
      "learning_rate": 2.4276638429357824e-05,
      "loss": 1.0549,
      "num_input_tokens_seen": 45355497136,
      "step": 57648
    },
    {
      "epoch": 6.115955866751539,
      "grad_norm": 0.8436214647762815,
      "learning_rate": 2.4275943751792885e-05,
      "loss": 0.9361,
      "num_input_tokens_seen": 45356283952,
      "step": 57649
    },
    {
      "epoch": 6.11606195629111,
      "grad_norm": 1.003642154181489,
      "learning_rate": 2.4275249074787475e-05,
      "loss": 0.9999,
      "num_input_tokens_seen": 45357070752,
      "step": 57650
    },
    {
      "epoch": 6.1161680458306815,
      "grad_norm": 0.907785786261216,
      "learning_rate": 2.427455439834213e-05,
      "loss": 0.9927,
      "num_input_tokens_seen": 45357857552,
      "step": 57651
    },
    {
      "epoch": 6.1162741353702526,
      "grad_norm": 0.7280455313604174,
      "learning_rate": 2.4273859722457395e-05,
      "loss": 0.9243,
      "num_input_tokens_seen": 45358644304,
      "step": 57652
    },
    {
      "epoch": 6.116380224909824,
      "grad_norm": 0.889119647199723,
      "learning_rate": 2.4273165047133796e-05,
      "loss": 1.0651,
      "num_input_tokens_seen": 45359431088,
      "step": 57653
    },
    {
      "epoch": 6.1164863144493955,
      "grad_norm": 1.018332406296851,
      "learning_rate": 2.4272470372371872e-05,
      "loss": 1.1036,
      "num_input_tokens_seen": 45360217808,
      "step": 57654
    },
    {
      "epoch": 6.1165924039889665,
      "grad_norm": 1.0717531963912366,
      "learning_rate": 2.4271775698172164e-05,
      "loss": 1.0045,
      "num_input_tokens_seen": 45361004560,
      "step": 57655
    },
    {
      "epoch": 6.1166984935285384,
      "grad_norm": 0.8381257650691999,
      "learning_rate": 2.4271081024535207e-05,
      "loss": 0.9808,
      "num_input_tokens_seen": 45361791376,
      "step": 57656
    },
    {
      "epoch": 6.1168045830681095,
      "grad_norm": 1.4188224434204135,
      "learning_rate": 2.427038635146153e-05,
      "loss": 0.9952,
      "num_input_tokens_seen": 45362578224,
      "step": 57657
    },
    {
      "epoch": 6.1169106726076805,
      "grad_norm": 1.2609447388569734,
      "learning_rate": 2.4269691678951688e-05,
      "loss": 0.9998,
      "num_input_tokens_seen": 45363365024,
      "step": 57658
    },
    {
      "epoch": 6.117016762147252,
      "grad_norm": 0.9497928194879479,
      "learning_rate": 2.4268997007006202e-05,
      "loss": 1.032,
      "num_input_tokens_seen": 45364151840,
      "step": 57659
    },
    {
      "epoch": 6.1171228516868235,
      "grad_norm": 1.5977711936694363,
      "learning_rate": 2.426830233562561e-05,
      "loss": 1.02,
      "num_input_tokens_seen": 45364938544,
      "step": 57660
    },
    {
      "epoch": 6.117228941226395,
      "grad_norm": 1.3204599354232296,
      "learning_rate": 2.4267607664810458e-05,
      "loss": 0.8928,
      "num_input_tokens_seen": 45365725312,
      "step": 57661
    },
    {
      "epoch": 6.117335030765966,
      "grad_norm": 1.0500461914510328,
      "learning_rate": 2.4266912994561278e-05,
      "loss": 1.0083,
      "num_input_tokens_seen": 45366512080,
      "step": 57662
    },
    {
      "epoch": 6.117441120305537,
      "grad_norm": 1.4421144110384003,
      "learning_rate": 2.4266218324878597e-05,
      "loss": 0.9718,
      "num_input_tokens_seen": 45367298816,
      "step": 57663
    },
    {
      "epoch": 6.117547209845109,
      "grad_norm": 1.4267085581233978,
      "learning_rate": 2.426552365576297e-05,
      "loss": 0.9928,
      "num_input_tokens_seen": 45368085520,
      "step": 57664
    },
    {
      "epoch": 6.11765329938468,
      "grad_norm": 1.1496460012616803,
      "learning_rate": 2.4264828987214923e-05,
      "loss": 0.9696,
      "num_input_tokens_seen": 45368872304,
      "step": 57665
    },
    {
      "epoch": 6.117759388924252,
      "grad_norm": 1.1228495161554457,
      "learning_rate": 2.426413431923499e-05,
      "loss": 1.0842,
      "num_input_tokens_seen": 45369659040,
      "step": 57666
    },
    {
      "epoch": 6.117865478463823,
      "grad_norm": 1.3995104774934912,
      "learning_rate": 2.426343965182372e-05,
      "loss": 0.9988,
      "num_input_tokens_seen": 45370445792,
      "step": 57667
    },
    {
      "epoch": 6.117971568003395,
      "grad_norm": 1.506371842430237,
      "learning_rate": 2.4262744984981632e-05,
      "loss": 1.0223,
      "num_input_tokens_seen": 45371232608,
      "step": 57668
    },
    {
      "epoch": 6.118077657542966,
      "grad_norm": 1.1341959447123815,
      "learning_rate": 2.426205031870928e-05,
      "loss": 0.964,
      "num_input_tokens_seen": 45372019360,
      "step": 57669
    },
    {
      "epoch": 6.118183747082537,
      "grad_norm": 0.8982524139537172,
      "learning_rate": 2.4261355653007198e-05,
      "loss": 0.9645,
      "num_input_tokens_seen": 45372806176,
      "step": 57670
    },
    {
      "epoch": 6.118289836622109,
      "grad_norm": 1.3160601250376462,
      "learning_rate": 2.426066098787591e-05,
      "loss": 0.8775,
      "num_input_tokens_seen": 45373592976,
      "step": 57671
    },
    {
      "epoch": 6.11839592616168,
      "grad_norm": 1.0934288304099073,
      "learning_rate": 2.4259966323315968e-05,
      "loss": 0.8659,
      "num_input_tokens_seen": 45374379808,
      "step": 57672
    },
    {
      "epoch": 6.118502015701252,
      "grad_norm": 1.0251973920316821,
      "learning_rate": 2.42592716593279e-05,
      "loss": 0.9225,
      "num_input_tokens_seen": 45375166592,
      "step": 57673
    },
    {
      "epoch": 6.118608105240823,
      "grad_norm": 1.3090098537725923,
      "learning_rate": 2.425857699591224e-05,
      "loss": 0.9765,
      "num_input_tokens_seen": 45375953280,
      "step": 57674
    },
    {
      "epoch": 6.118714194780394,
      "grad_norm": 1.3047333967443142,
      "learning_rate": 2.4257882333069538e-05,
      "loss": 0.9447,
      "num_input_tokens_seen": 45376739968,
      "step": 57675
    },
    {
      "epoch": 6.118820284319966,
      "grad_norm": 0.8033211573187866,
      "learning_rate": 2.425718767080032e-05,
      "loss": 0.9352,
      "num_input_tokens_seen": 45377526720,
      "step": 57676
    },
    {
      "epoch": 6.118926373859537,
      "grad_norm": 1.110880920383497,
      "learning_rate": 2.425649300910512e-05,
      "loss": 0.9722,
      "num_input_tokens_seen": 45378313488,
      "step": 57677
    },
    {
      "epoch": 6.119032463399109,
      "grad_norm": 1.347562571352955,
      "learning_rate": 2.4255798347984486e-05,
      "loss": 1.0851,
      "num_input_tokens_seen": 45379100304,
      "step": 57678
    },
    {
      "epoch": 6.11913855293868,
      "grad_norm": 0.9866460921627315,
      "learning_rate": 2.4255103687438952e-05,
      "loss": 0.9955,
      "num_input_tokens_seen": 45379887136,
      "step": 57679
    },
    {
      "epoch": 6.119244642478252,
      "grad_norm": 1.084335567788784,
      "learning_rate": 2.4254409027469045e-05,
      "loss": 1.0155,
      "num_input_tokens_seen": 45380673904,
      "step": 57680
    },
    {
      "epoch": 6.119350732017823,
      "grad_norm": 1.0121877048309518,
      "learning_rate": 2.4253714368075314e-05,
      "loss": 1.0499,
      "num_input_tokens_seen": 45381460704,
      "step": 57681
    },
    {
      "epoch": 6.119456821557394,
      "grad_norm": 0.8912294480441914,
      "learning_rate": 2.425301970925829e-05,
      "loss": 0.9979,
      "num_input_tokens_seen": 45382247472,
      "step": 57682
    },
    {
      "epoch": 6.119562911096966,
      "grad_norm": 0.8910191519030333,
      "learning_rate": 2.4252325051018505e-05,
      "loss": 1.0328,
      "num_input_tokens_seen": 45383034192,
      "step": 57683
    },
    {
      "epoch": 6.119669000636537,
      "grad_norm": 0.6606807457437842,
      "learning_rate": 2.425163039335651e-05,
      "loss": 0.9329,
      "num_input_tokens_seen": 45383821008,
      "step": 57684
    },
    {
      "epoch": 6.119775090176109,
      "grad_norm": 0.8052558485148622,
      "learning_rate": 2.4250935736272826e-05,
      "loss": 0.9241,
      "num_input_tokens_seen": 45384607696,
      "step": 57685
    },
    {
      "epoch": 6.11988117971568,
      "grad_norm": 0.7973980902995254,
      "learning_rate": 2.4250241079768e-05,
      "loss": 0.9994,
      "num_input_tokens_seen": 45385394496,
      "step": 57686
    },
    {
      "epoch": 6.119987269255251,
      "grad_norm": 0.955764415604554,
      "learning_rate": 2.4249546423842566e-05,
      "loss": 0.9622,
      "num_input_tokens_seen": 45386181280,
      "step": 57687
    },
    {
      "epoch": 6.120093358794823,
      "grad_norm": 0.7797471668466893,
      "learning_rate": 2.424885176849706e-05,
      "loss": 1.009,
      "num_input_tokens_seen": 45386967984,
      "step": 57688
    },
    {
      "epoch": 6.120199448334394,
      "grad_norm": 0.7697846752518197,
      "learning_rate": 2.4248157113732017e-05,
      "loss": 0.9927,
      "num_input_tokens_seen": 45387754672,
      "step": 57689
    },
    {
      "epoch": 6.120305537873966,
      "grad_norm": 0.9102338664008854,
      "learning_rate": 2.4247462459547982e-05,
      "loss": 0.9643,
      "num_input_tokens_seen": 45388541472,
      "step": 57690
    },
    {
      "epoch": 6.120411627413537,
      "grad_norm": 0.6894461256192399,
      "learning_rate": 2.424676780594548e-05,
      "loss": 0.9846,
      "num_input_tokens_seen": 45389328336,
      "step": 57691
    },
    {
      "epoch": 6.120517716953108,
      "grad_norm": 0.8282142118890681,
      "learning_rate": 2.4246073152925057e-05,
      "loss": 0.9252,
      "num_input_tokens_seen": 45390115056,
      "step": 57692
    },
    {
      "epoch": 6.12062380649268,
      "grad_norm": 0.7683060207538089,
      "learning_rate": 2.4245378500487245e-05,
      "loss": 0.8883,
      "num_input_tokens_seen": 45390901824,
      "step": 57693
    },
    {
      "epoch": 6.120729896032251,
      "grad_norm": 1.1313343482225635,
      "learning_rate": 2.424468384863258e-05,
      "loss": 1.0374,
      "num_input_tokens_seen": 45391688624,
      "step": 57694
    },
    {
      "epoch": 6.120835985571823,
      "grad_norm": 0.8568647489951959,
      "learning_rate": 2.4243989197361604e-05,
      "loss": 1.0045,
      "num_input_tokens_seen": 45392475328,
      "step": 57695
    },
    {
      "epoch": 6.120942075111394,
      "grad_norm": 0.9258052860088725,
      "learning_rate": 2.4243294546674857e-05,
      "loss": 1.0673,
      "num_input_tokens_seen": 45393262064,
      "step": 57696
    },
    {
      "epoch": 6.121048164650966,
      "grad_norm": 1.0210202187668616,
      "learning_rate": 2.424259989657286e-05,
      "loss": 1.0165,
      "num_input_tokens_seen": 45394048832,
      "step": 57697
    },
    {
      "epoch": 6.121154254190537,
      "grad_norm": 1.1486183775189045,
      "learning_rate": 2.4241905247056163e-05,
      "loss": 1.0221,
      "num_input_tokens_seen": 45394835552,
      "step": 57698
    },
    {
      "epoch": 6.121260343730108,
      "grad_norm": 0.9998093746608331,
      "learning_rate": 2.4241210598125304e-05,
      "loss": 0.9267,
      "num_input_tokens_seen": 45395622272,
      "step": 57699
    },
    {
      "epoch": 6.12136643326968,
      "grad_norm": 1.1182325161927138,
      "learning_rate": 2.4240515949780806e-05,
      "loss": 1.0711,
      "num_input_tokens_seen": 45396409040,
      "step": 57700
    },
    {
      "epoch": 6.121472522809251,
      "grad_norm": 1.0472730084607211,
      "learning_rate": 2.423982130202321e-05,
      "loss": 0.9429,
      "num_input_tokens_seen": 45397195888,
      "step": 57701
    },
    {
      "epoch": 6.121578612348823,
      "grad_norm": 1.5895308061810236,
      "learning_rate": 2.423912665485307e-05,
      "loss": 1.0645,
      "num_input_tokens_seen": 45397982608,
      "step": 57702
    },
    {
      "epoch": 6.121684701888394,
      "grad_norm": 1.0616052387330874,
      "learning_rate": 2.423843200827091e-05,
      "loss": 0.9375,
      "num_input_tokens_seen": 45398769456,
      "step": 57703
    },
    {
      "epoch": 6.121790791427965,
      "grad_norm": 1.1010637572487794,
      "learning_rate": 2.423773736227726e-05,
      "loss": 0.9619,
      "num_input_tokens_seen": 45399556208,
      "step": 57704
    },
    {
      "epoch": 6.121896880967537,
      "grad_norm": 1.628832303785151,
      "learning_rate": 2.4237042716872674e-05,
      "loss": 1.0148,
      "num_input_tokens_seen": 45400342944,
      "step": 57705
    },
    {
      "epoch": 6.122002970507108,
      "grad_norm": 1.5278877060929894,
      "learning_rate": 2.423634807205767e-05,
      "loss": 1.1239,
      "num_input_tokens_seen": 45401129664,
      "step": 57706
    },
    {
      "epoch": 6.12210906004668,
      "grad_norm": 1.1418857603907586,
      "learning_rate": 2.4235653427832798e-05,
      "loss": 0.996,
      "num_input_tokens_seen": 45401916480,
      "step": 57707
    },
    {
      "epoch": 6.122215149586251,
      "grad_norm": 1.025783180641515,
      "learning_rate": 2.4234958784198596e-05,
      "loss": 0.8969,
      "num_input_tokens_seen": 45402703264,
      "step": 57708
    },
    {
      "epoch": 6.122321239125823,
      "grad_norm": 1.187488212946689,
      "learning_rate": 2.423426414115559e-05,
      "loss": 0.9936,
      "num_input_tokens_seen": 45403490016,
      "step": 57709
    },
    {
      "epoch": 6.122427328665394,
      "grad_norm": 1.1006403489748136,
      "learning_rate": 2.4233569498704322e-05,
      "loss": 1.0388,
      "num_input_tokens_seen": 45404276800,
      "step": 57710
    },
    {
      "epoch": 6.122533418204965,
      "grad_norm": 0.9537902347468149,
      "learning_rate": 2.423287485684533e-05,
      "loss": 0.9666,
      "num_input_tokens_seen": 45405063568,
      "step": 57711
    },
    {
      "epoch": 6.122639507744537,
      "grad_norm": 0.8376302524486858,
      "learning_rate": 2.423218021557915e-05,
      "loss": 0.9552,
      "num_input_tokens_seen": 45405850336,
      "step": 57712
    },
    {
      "epoch": 6.122745597284108,
      "grad_norm": 1.035906603966392,
      "learning_rate": 2.423148557490632e-05,
      "loss": 1.0442,
      "num_input_tokens_seen": 45406637120,
      "step": 57713
    },
    {
      "epoch": 6.1228516868236795,
      "grad_norm": 0.7227864114682071,
      "learning_rate": 2.4230790934827375e-05,
      "loss": 0.93,
      "num_input_tokens_seen": 45407424000,
      "step": 57714
    },
    {
      "epoch": 6.122957776363251,
      "grad_norm": 0.761909458725727,
      "learning_rate": 2.4230096295342844e-05,
      "loss": 0.9997,
      "num_input_tokens_seen": 45408210768,
      "step": 57715
    },
    {
      "epoch": 6.123063865902822,
      "grad_norm": 0.790535188208792,
      "learning_rate": 2.4229401656453283e-05,
      "loss": 1.087,
      "num_input_tokens_seen": 45408997472,
      "step": 57716
    },
    {
      "epoch": 6.1231699554423935,
      "grad_norm": 0.6934128548754588,
      "learning_rate": 2.4228707018159214e-05,
      "loss": 0.9196,
      "num_input_tokens_seen": 45409784288,
      "step": 57717
    },
    {
      "epoch": 6.1232760449819645,
      "grad_norm": 0.8044531000865888,
      "learning_rate": 2.4228012380461174e-05,
      "loss": 0.9899,
      "num_input_tokens_seen": 45410571040,
      "step": 57718
    },
    {
      "epoch": 6.1233821345215365,
      "grad_norm": 0.740407364015216,
      "learning_rate": 2.422731774335971e-05,
      "loss": 0.8884,
      "num_input_tokens_seen": 45411357920,
      "step": 57719
    },
    {
      "epoch": 6.1234882240611075,
      "grad_norm": 0.6497056718943903,
      "learning_rate": 2.4226623106855347e-05,
      "loss": 0.9219,
      "num_input_tokens_seen": 45412144752,
      "step": 57720
    },
    {
      "epoch": 6.123594313600679,
      "grad_norm": 0.7592473263109772,
      "learning_rate": 2.422592847094863e-05,
      "loss": 1.0481,
      "num_input_tokens_seen": 45412931600,
      "step": 57721
    },
    {
      "epoch": 6.12370040314025,
      "grad_norm": 0.6878418221761871,
      "learning_rate": 2.422523383564009e-05,
      "loss": 1.0062,
      "num_input_tokens_seen": 45413718384,
      "step": 57722
    },
    {
      "epoch": 6.1238064926798215,
      "grad_norm": 0.7004895761004024,
      "learning_rate": 2.4224539200930267e-05,
      "loss": 1.0218,
      "num_input_tokens_seen": 45414505168,
      "step": 57723
    },
    {
      "epoch": 6.123912582219393,
      "grad_norm": 0.779021443296564,
      "learning_rate": 2.4223844566819697e-05,
      "loss": 1.009,
      "num_input_tokens_seen": 45415291952,
      "step": 57724
    },
    {
      "epoch": 6.124018671758964,
      "grad_norm": 0.7762235688751141,
      "learning_rate": 2.4223149933308924e-05,
      "loss": 1.0357,
      "num_input_tokens_seen": 45416078768,
      "step": 57725
    },
    {
      "epoch": 6.124124761298536,
      "grad_norm": 0.7477887011845981,
      "learning_rate": 2.4222455300398467e-05,
      "loss": 0.9851,
      "num_input_tokens_seen": 45416865568,
      "step": 57726
    },
    {
      "epoch": 6.124230850838107,
      "grad_norm": 0.9250705185415296,
      "learning_rate": 2.422176066808888e-05,
      "loss": 0.9523,
      "num_input_tokens_seen": 45417652288,
      "step": 57727
    },
    {
      "epoch": 6.124336940377678,
      "grad_norm": 1.1190943698271776,
      "learning_rate": 2.4221066036380697e-05,
      "loss": 1.0581,
      "num_input_tokens_seen": 45418439024,
      "step": 57728
    },
    {
      "epoch": 6.12444302991725,
      "grad_norm": 0.7196080932960862,
      "learning_rate": 2.4220371405274443e-05,
      "loss": 1.0024,
      "num_input_tokens_seen": 45419225680,
      "step": 57729
    },
    {
      "epoch": 6.124549119456821,
      "grad_norm": 0.8141339961866974,
      "learning_rate": 2.4219676774770668e-05,
      "loss": 0.9526,
      "num_input_tokens_seen": 45420012528,
      "step": 57730
    },
    {
      "epoch": 6.124655208996393,
      "grad_norm": 0.6729807514335978,
      "learning_rate": 2.4218982144869902e-05,
      "loss": 0.9711,
      "num_input_tokens_seen": 45420799344,
      "step": 57731
    },
    {
      "epoch": 6.124761298535964,
      "grad_norm": 0.8712841788147855,
      "learning_rate": 2.4218287515572684e-05,
      "loss": 0.9736,
      "num_input_tokens_seen": 45421586144,
      "step": 57732
    },
    {
      "epoch": 6.124867388075535,
      "grad_norm": 1.2316866955982704,
      "learning_rate": 2.4217592886879554e-05,
      "loss": 1.0096,
      "num_input_tokens_seen": 45422372928,
      "step": 57733
    },
    {
      "epoch": 6.124973477615107,
      "grad_norm": 0.6903850597975734,
      "learning_rate": 2.4216898258791042e-05,
      "loss": 1.0095,
      "num_input_tokens_seen": 45423159808,
      "step": 57734
    },
    {
      "epoch": 6.125079567154678,
      "grad_norm": 0.9701929785082988,
      "learning_rate": 2.4216203631307684e-05,
      "loss": 0.9915,
      "num_input_tokens_seen": 45423946672,
      "step": 57735
    },
    {
      "epoch": 6.12518565669425,
      "grad_norm": 0.708149881715296,
      "learning_rate": 2.421550900443003e-05,
      "loss": 0.9516,
      "num_input_tokens_seen": 45424733472,
      "step": 57736
    },
    {
      "epoch": 6.125291746233821,
      "grad_norm": 0.6899277515984134,
      "learning_rate": 2.4214814378158597e-05,
      "loss": 1.0129,
      "num_input_tokens_seen": 45425520176,
      "step": 57737
    },
    {
      "epoch": 6.125397835773393,
      "grad_norm": 0.7981036098938145,
      "learning_rate": 2.421411975249394e-05,
      "loss": 0.9052,
      "num_input_tokens_seen": 45426307008,
      "step": 57738
    },
    {
      "epoch": 6.125503925312964,
      "grad_norm": 0.758254063084033,
      "learning_rate": 2.421342512743659e-05,
      "loss": 0.9361,
      "num_input_tokens_seen": 45427093856,
      "step": 57739
    },
    {
      "epoch": 6.125610014852535,
      "grad_norm": 1.1153575919239338,
      "learning_rate": 2.4212730502987075e-05,
      "loss": 1.0116,
      "num_input_tokens_seen": 45427880576,
      "step": 57740
    },
    {
      "epoch": 6.125716104392107,
      "grad_norm": 0.7276025338455689,
      "learning_rate": 2.4212035879145945e-05,
      "loss": 1.0412,
      "num_input_tokens_seen": 45428667328,
      "step": 57741
    },
    {
      "epoch": 6.125822193931678,
      "grad_norm": 0.8398424710755434,
      "learning_rate": 2.421134125591373e-05,
      "loss": 0.9308,
      "num_input_tokens_seen": 45429454096,
      "step": 57742
    },
    {
      "epoch": 6.12592828347125,
      "grad_norm": 0.8843022442197291,
      "learning_rate": 2.4210646633290963e-05,
      "loss": 0.9388,
      "num_input_tokens_seen": 45430240832,
      "step": 57743
    },
    {
      "epoch": 6.126034373010821,
      "grad_norm": 0.6142521028645809,
      "learning_rate": 2.4209952011278185e-05,
      "loss": 0.9942,
      "num_input_tokens_seen": 45431027600,
      "step": 57744
    },
    {
      "epoch": 6.126140462550392,
      "grad_norm": 0.7740011186541261,
      "learning_rate": 2.4209257389875938e-05,
      "loss": 0.9612,
      "num_input_tokens_seen": 45431814336,
      "step": 57745
    },
    {
      "epoch": 6.126246552089964,
      "grad_norm": 0.9451346522908445,
      "learning_rate": 2.4208562769084747e-05,
      "loss": 1.0566,
      "num_input_tokens_seen": 45432601072,
      "step": 57746
    },
    {
      "epoch": 6.126352641629535,
      "grad_norm": 0.8614514859300151,
      "learning_rate": 2.4207868148905165e-05,
      "loss": 1.0455,
      "num_input_tokens_seen": 45433387776,
      "step": 57747
    },
    {
      "epoch": 6.126458731169107,
      "grad_norm": 0.8906772886084638,
      "learning_rate": 2.4207173529337713e-05,
      "loss": 1.0657,
      "num_input_tokens_seen": 45434174464,
      "step": 57748
    },
    {
      "epoch": 6.126564820708678,
      "grad_norm": 0.8012620934608068,
      "learning_rate": 2.4206478910382934e-05,
      "loss": 1.0186,
      "num_input_tokens_seen": 45434961168,
      "step": 57749
    },
    {
      "epoch": 6.12667091024825,
      "grad_norm": 0.8387913948920857,
      "learning_rate": 2.4205784292041365e-05,
      "loss": 1.0025,
      "num_input_tokens_seen": 45435747968,
      "step": 57750
    },
    {
      "epoch": 6.126776999787821,
      "grad_norm": 0.8194564165880159,
      "learning_rate": 2.4205089674313544e-05,
      "loss": 1.0382,
      "num_input_tokens_seen": 45436534784,
      "step": 57751
    },
    {
      "epoch": 6.126883089327392,
      "grad_norm": 0.8779709199310683,
      "learning_rate": 2.42043950572e-05,
      "loss": 0.9785,
      "num_input_tokens_seen": 45437321568,
      "step": 57752
    },
    {
      "epoch": 6.126989178866964,
      "grad_norm": 0.7518502759073558,
      "learning_rate": 2.4203700440701285e-05,
      "loss": 0.9644,
      "num_input_tokens_seen": 45438108256,
      "step": 57753
    },
    {
      "epoch": 6.127095268406535,
      "grad_norm": 1.055622899318539,
      "learning_rate": 2.420300582481792e-05,
      "loss": 1.0119,
      "num_input_tokens_seen": 45438894976,
      "step": 57754
    },
    {
      "epoch": 6.127201357946107,
      "grad_norm": 0.6964638189877868,
      "learning_rate": 2.4202311209550456e-05,
      "loss": 0.9806,
      "num_input_tokens_seen": 45439681776,
      "step": 57755
    },
    {
      "epoch": 6.127307447485678,
      "grad_norm": 0.8578489509200998,
      "learning_rate": 2.420161659489942e-05,
      "loss": 1.0142,
      "num_input_tokens_seen": 45440468608,
      "step": 57756
    },
    {
      "epoch": 6.127413537025249,
      "grad_norm": 0.7461864208722937,
      "learning_rate": 2.4200921980865347e-05,
      "loss": 0.9419,
      "num_input_tokens_seen": 45441255360,
      "step": 57757
    },
    {
      "epoch": 6.127519626564821,
      "grad_norm": 0.7696058252093316,
      "learning_rate": 2.4200227367448784e-05,
      "loss": 1.0155,
      "num_input_tokens_seen": 45442042144,
      "step": 57758
    },
    {
      "epoch": 6.127625716104392,
      "grad_norm": 0.8279002653477598,
      "learning_rate": 2.4199532754650257e-05,
      "loss": 1.0151,
      "num_input_tokens_seen": 45442828880,
      "step": 57759
    },
    {
      "epoch": 6.127731805643964,
      "grad_norm": 0.8579055459884969,
      "learning_rate": 2.4198838142470305e-05,
      "loss": 0.9594,
      "num_input_tokens_seen": 45443615632,
      "step": 57760
    },
    {
      "epoch": 6.127837895183535,
      "grad_norm": 0.682325675256102,
      "learning_rate": 2.4198143530909476e-05,
      "loss": 0.8893,
      "num_input_tokens_seen": 45444402416,
      "step": 57761
    },
    {
      "epoch": 6.127943984723107,
      "grad_norm": 0.8745196276307173,
      "learning_rate": 2.4197448919968296e-05,
      "loss": 1.043,
      "num_input_tokens_seen": 45445189184,
      "step": 57762
    },
    {
      "epoch": 6.128050074262678,
      "grad_norm": 1.2364162855478258,
      "learning_rate": 2.41967543096473e-05,
      "loss": 1.0713,
      "num_input_tokens_seen": 45445976000,
      "step": 57763
    },
    {
      "epoch": 6.128156163802249,
      "grad_norm": 0.7847009397994545,
      "learning_rate": 2.4196059699947033e-05,
      "loss": 0.9992,
      "num_input_tokens_seen": 45446762736,
      "step": 57764
    },
    {
      "epoch": 6.128262253341821,
      "grad_norm": 1.2199061382001517,
      "learning_rate": 2.4195365090868024e-05,
      "loss": 1.0672,
      "num_input_tokens_seen": 45447549488,
      "step": 57765
    },
    {
      "epoch": 6.128368342881392,
      "grad_norm": 0.6273968576158977,
      "learning_rate": 2.4194670482410812e-05,
      "loss": 0.9594,
      "num_input_tokens_seen": 45448336288,
      "step": 57766
    },
    {
      "epoch": 6.128474432420964,
      "grad_norm": 0.6627051267347903,
      "learning_rate": 2.419397587457594e-05,
      "loss": 0.9874,
      "num_input_tokens_seen": 45449123072,
      "step": 57767
    },
    {
      "epoch": 6.128580521960535,
      "grad_norm": 0.6792534371484202,
      "learning_rate": 2.4193281267363936e-05,
      "loss": 0.9475,
      "num_input_tokens_seen": 45449909968,
      "step": 57768
    },
    {
      "epoch": 6.128686611500106,
      "grad_norm": 1.141444416598418,
      "learning_rate": 2.419258666077534e-05,
      "loss": 1.0217,
      "num_input_tokens_seen": 45450696736,
      "step": 57769
    },
    {
      "epoch": 6.128792701039678,
      "grad_norm": 0.8178247040987197,
      "learning_rate": 2.4191892054810695e-05,
      "loss": 1.0,
      "num_input_tokens_seen": 45451483568,
      "step": 57770
    },
    {
      "epoch": 6.128898790579249,
      "grad_norm": 0.6979466614840373,
      "learning_rate": 2.4191197449470524e-05,
      "loss": 1.0508,
      "num_input_tokens_seen": 45452270336,
      "step": 57771
    },
    {
      "epoch": 6.129004880118821,
      "grad_norm": 0.7732545521241996,
      "learning_rate": 2.4190502844755378e-05,
      "loss": 0.9651,
      "num_input_tokens_seen": 45453057088,
      "step": 57772
    },
    {
      "epoch": 6.129110969658392,
      "grad_norm": 0.8272155550654623,
      "learning_rate": 2.4189808240665786e-05,
      "loss": 1.0261,
      "num_input_tokens_seen": 45453843808,
      "step": 57773
    },
    {
      "epoch": 6.129217059197963,
      "grad_norm": 0.6314414375675504,
      "learning_rate": 2.418911363720228e-05,
      "loss": 0.9461,
      "num_input_tokens_seen": 45454630592,
      "step": 57774
    },
    {
      "epoch": 6.129323148737535,
      "grad_norm": 0.7024871948327263,
      "learning_rate": 2.4188419034365413e-05,
      "loss": 0.9066,
      "num_input_tokens_seen": 45455417376,
      "step": 57775
    },
    {
      "epoch": 6.129429238277106,
      "grad_norm": 0.800090358566913,
      "learning_rate": 2.4187724432155713e-05,
      "loss": 1.1055,
      "num_input_tokens_seen": 45456204144,
      "step": 57776
    },
    {
      "epoch": 6.1295353278166775,
      "grad_norm": 0.7601105232937104,
      "learning_rate": 2.4187029830573708e-05,
      "loss": 1.0425,
      "num_input_tokens_seen": 45456990896,
      "step": 57777
    },
    {
      "epoch": 6.129641417356249,
      "grad_norm": 0.7455692071130693,
      "learning_rate": 2.4186335229619944e-05,
      "loss": 0.9593,
      "num_input_tokens_seen": 45457777696,
      "step": 57778
    },
    {
      "epoch": 6.1297475068958205,
      "grad_norm": 0.7694204181312364,
      "learning_rate": 2.4185640629294963e-05,
      "loss": 1.0297,
      "num_input_tokens_seen": 45458564480,
      "step": 57779
    },
    {
      "epoch": 6.1298535964353915,
      "grad_norm": 0.6401201396838182,
      "learning_rate": 2.4184946029599284e-05,
      "loss": 0.9752,
      "num_input_tokens_seen": 45459351248,
      "step": 57780
    },
    {
      "epoch": 6.1299596859749625,
      "grad_norm": 0.893620730125193,
      "learning_rate": 2.4184251430533465e-05,
      "loss": 1.0141,
      "num_input_tokens_seen": 45460137968,
      "step": 57781
    },
    {
      "epoch": 6.1300657755145345,
      "grad_norm": 0.7311526950304167,
      "learning_rate": 2.4183556832098028e-05,
      "loss": 1.0226,
      "num_input_tokens_seen": 45460924640,
      "step": 57782
    },
    {
      "epoch": 6.1301718650541055,
      "grad_norm": 0.9004864352850788,
      "learning_rate": 2.418286223429351e-05,
      "loss": 1.0599,
      "num_input_tokens_seen": 45461711408,
      "step": 57783
    },
    {
      "epoch": 6.130277954593677,
      "grad_norm": 0.8015170766872745,
      "learning_rate": 2.418216763712046e-05,
      "loss": 0.9957,
      "num_input_tokens_seen": 45462498208,
      "step": 57784
    },
    {
      "epoch": 6.1303840441332484,
      "grad_norm": 0.9783598943710696,
      "learning_rate": 2.4181473040579405e-05,
      "loss": 0.9665,
      "num_input_tokens_seen": 45463284992,
      "step": 57785
    },
    {
      "epoch": 6.1304901336728195,
      "grad_norm": 0.8135347154243151,
      "learning_rate": 2.4180778444670875e-05,
      "loss": 0.9414,
      "num_input_tokens_seen": 45464071904,
      "step": 57786
    },
    {
      "epoch": 6.130596223212391,
      "grad_norm": 1.0600159130046283,
      "learning_rate": 2.4180083849395426e-05,
      "loss": 0.9697,
      "num_input_tokens_seen": 45464858592,
      "step": 57787
    },
    {
      "epoch": 6.130702312751962,
      "grad_norm": 0.8485732707575014,
      "learning_rate": 2.417938925475358e-05,
      "loss": 1.0482,
      "num_input_tokens_seen": 45465645440,
      "step": 57788
    },
    {
      "epoch": 6.130808402291534,
      "grad_norm": 0.7231874233468666,
      "learning_rate": 2.417869466074588e-05,
      "loss": 1.0094,
      "num_input_tokens_seen": 45466432288,
      "step": 57789
    },
    {
      "epoch": 6.130914491831105,
      "grad_norm": 0.7648262226687794,
      "learning_rate": 2.417800006737286e-05,
      "loss": 0.9583,
      "num_input_tokens_seen": 45467219104,
      "step": 57790
    },
    {
      "epoch": 6.131020581370677,
      "grad_norm": 1.3769100110180013,
      "learning_rate": 2.4177305474635054e-05,
      "loss": 0.9941,
      "num_input_tokens_seen": 45468005840,
      "step": 57791
    },
    {
      "epoch": 6.131126670910248,
      "grad_norm": 0.8666456897952325,
      "learning_rate": 2.4176610882533005e-05,
      "loss": 0.9877,
      "num_input_tokens_seen": 45468792576,
      "step": 57792
    },
    {
      "epoch": 6.131232760449819,
      "grad_norm": 0.8798434460216034,
      "learning_rate": 2.417591629106725e-05,
      "loss": 1.0086,
      "num_input_tokens_seen": 45469579328,
      "step": 57793
    },
    {
      "epoch": 6.131338849989391,
      "grad_norm": 0.8817044231654871,
      "learning_rate": 2.4175221700238315e-05,
      "loss": 1.0348,
      "num_input_tokens_seen": 45470366112,
      "step": 57794
    },
    {
      "epoch": 6.131444939528962,
      "grad_norm": 0.814709345628918,
      "learning_rate": 2.417452711004675e-05,
      "loss": 1.0455,
      "num_input_tokens_seen": 45471152912,
      "step": 57795
    },
    {
      "epoch": 6.131551029068534,
      "grad_norm": 0.8539598976661991,
      "learning_rate": 2.4173832520493086e-05,
      "loss": 1.0395,
      "num_input_tokens_seen": 45471939696,
      "step": 57796
    },
    {
      "epoch": 6.131657118608105,
      "grad_norm": 0.7546744291424657,
      "learning_rate": 2.417313793157785e-05,
      "loss": 0.9916,
      "num_input_tokens_seen": 45472726416,
      "step": 57797
    },
    {
      "epoch": 6.131763208147676,
      "grad_norm": 0.8143794238703737,
      "learning_rate": 2.4172443343301596e-05,
      "loss": 0.9869,
      "num_input_tokens_seen": 45473513168,
      "step": 57798
    },
    {
      "epoch": 6.131869297687248,
      "grad_norm": 0.745675044684631,
      "learning_rate": 2.4171748755664854e-05,
      "loss": 1.0039,
      "num_input_tokens_seen": 45474299952,
      "step": 57799
    },
    {
      "epoch": 6.131975387226819,
      "grad_norm": 0.7842602410475856,
      "learning_rate": 2.4171054168668167e-05,
      "loss": 1.0268,
      "num_input_tokens_seen": 45475086688,
      "step": 57800
    },
    {
      "epoch": 6.132081476766391,
      "grad_norm": 0.7859003956178521,
      "learning_rate": 2.4170359582312054e-05,
      "loss": 0.998,
      "num_input_tokens_seen": 45475873536,
      "step": 57801
    },
    {
      "epoch": 6.132187566305962,
      "grad_norm": 0.8236632529203208,
      "learning_rate": 2.4169664996597073e-05,
      "loss": 1.042,
      "num_input_tokens_seen": 45476660368,
      "step": 57802
    },
    {
      "epoch": 6.132293655845533,
      "grad_norm": 0.8430917764775888,
      "learning_rate": 2.4168970411523744e-05,
      "loss": 0.9668,
      "num_input_tokens_seen": 45477447088,
      "step": 57803
    },
    {
      "epoch": 6.132399745385105,
      "grad_norm": 0.8643795870716632,
      "learning_rate": 2.416827582709261e-05,
      "loss": 1.0303,
      "num_input_tokens_seen": 45478233904,
      "step": 57804
    },
    {
      "epoch": 6.132505834924676,
      "grad_norm": 0.8705564819349894,
      "learning_rate": 2.4167581243304214e-05,
      "loss": 0.9923,
      "num_input_tokens_seen": 45479020752,
      "step": 57805
    },
    {
      "epoch": 6.132611924464248,
      "grad_norm": 0.870062216744413,
      "learning_rate": 2.4166886660159084e-05,
      "loss": 0.9517,
      "num_input_tokens_seen": 45479807552,
      "step": 57806
    },
    {
      "epoch": 6.132718014003819,
      "grad_norm": 0.8274496846495387,
      "learning_rate": 2.4166192077657753e-05,
      "loss": 0.9544,
      "num_input_tokens_seen": 45480594320,
      "step": 57807
    },
    {
      "epoch": 6.132824103543391,
      "grad_norm": 0.8379875613614789,
      "learning_rate": 2.4165497495800774e-05,
      "loss": 0.9879,
      "num_input_tokens_seen": 45481381120,
      "step": 57808
    },
    {
      "epoch": 6.132930193082962,
      "grad_norm": 1.1851059022019768,
      "learning_rate": 2.4164802914588665e-05,
      "loss": 0.9473,
      "num_input_tokens_seen": 45482167840,
      "step": 57809
    },
    {
      "epoch": 6.133036282622533,
      "grad_norm": 1.0402210306288513,
      "learning_rate": 2.4164108334021978e-05,
      "loss": 0.9981,
      "num_input_tokens_seen": 45482954576,
      "step": 57810
    },
    {
      "epoch": 6.133142372162105,
      "grad_norm": 0.7570260168953971,
      "learning_rate": 2.4163413754101244e-05,
      "loss": 0.9386,
      "num_input_tokens_seen": 45483741392,
      "step": 57811
    },
    {
      "epoch": 6.133248461701676,
      "grad_norm": 0.8424732398557825,
      "learning_rate": 2.4162719174826994e-05,
      "loss": 1.0343,
      "num_input_tokens_seen": 45484528144,
      "step": 57812
    },
    {
      "epoch": 6.133354551241248,
      "grad_norm": 0.8507257015817838,
      "learning_rate": 2.4162024596199775e-05,
      "loss": 0.9952,
      "num_input_tokens_seen": 45485314896,
      "step": 57813
    },
    {
      "epoch": 6.133460640780819,
      "grad_norm": 0.7763058215997856,
      "learning_rate": 2.416133001822012e-05,
      "loss": 1.0047,
      "num_input_tokens_seen": 45486101696,
      "step": 57814
    },
    {
      "epoch": 6.13356673032039,
      "grad_norm": 1.1508089155195553,
      "learning_rate": 2.416063544088856e-05,
      "loss": 1.0252,
      "num_input_tokens_seen": 45486888496,
      "step": 57815
    },
    {
      "epoch": 6.133672819859962,
      "grad_norm": 0.9099462916395785,
      "learning_rate": 2.415994086420564e-05,
      "loss": 0.9566,
      "num_input_tokens_seen": 45487675232,
      "step": 57816
    },
    {
      "epoch": 6.133778909399533,
      "grad_norm": 1.2893314249512682,
      "learning_rate": 2.4159246288171894e-05,
      "loss": 1.0237,
      "num_input_tokens_seen": 45488461968,
      "step": 57817
    },
    {
      "epoch": 6.133884998939105,
      "grad_norm": 1.151638802743497,
      "learning_rate": 2.415855171278785e-05,
      "loss": 1.0584,
      "num_input_tokens_seen": 45489248656,
      "step": 57818
    },
    {
      "epoch": 6.133991088478676,
      "grad_norm": 1.0549164027407467,
      "learning_rate": 2.415785713805406e-05,
      "loss": 0.9513,
      "num_input_tokens_seen": 45490035392,
      "step": 57819
    },
    {
      "epoch": 6.134097178018248,
      "grad_norm": 0.834086372091485,
      "learning_rate": 2.4157162563971053e-05,
      "loss": 0.964,
      "num_input_tokens_seen": 45490822144,
      "step": 57820
    },
    {
      "epoch": 6.134203267557819,
      "grad_norm": 0.8188770735443817,
      "learning_rate": 2.415646799053936e-05,
      "loss": 0.9691,
      "num_input_tokens_seen": 45491608992,
      "step": 57821
    },
    {
      "epoch": 6.13430935709739,
      "grad_norm": 0.835452484580231,
      "learning_rate": 2.4155773417759532e-05,
      "loss": 1.0451,
      "num_input_tokens_seen": 45492395744,
      "step": 57822
    },
    {
      "epoch": 6.134415446636962,
      "grad_norm": 0.6639678108486075,
      "learning_rate": 2.4155078845632092e-05,
      "loss": 0.9363,
      "num_input_tokens_seen": 45493182544,
      "step": 57823
    },
    {
      "epoch": 6.134521536176533,
      "grad_norm": 1.113895586627575,
      "learning_rate": 2.4154384274157582e-05,
      "loss": 0.997,
      "num_input_tokens_seen": 45493969248,
      "step": 57824
    },
    {
      "epoch": 6.134627625716105,
      "grad_norm": 0.9123124051602463,
      "learning_rate": 2.415368970333654e-05,
      "loss": 0.9978,
      "num_input_tokens_seen": 45494756112,
      "step": 57825
    },
    {
      "epoch": 6.134733715255676,
      "grad_norm": 0.9894579844880839,
      "learning_rate": 2.41529951331695e-05,
      "loss": 1.0309,
      "num_input_tokens_seen": 45495542944,
      "step": 57826
    },
    {
      "epoch": 6.134839804795247,
      "grad_norm": 1.2464721468575755,
      "learning_rate": 2.4152300563657003e-05,
      "loss": 1.0009,
      "num_input_tokens_seen": 45496329664,
      "step": 57827
    },
    {
      "epoch": 6.134945894334819,
      "grad_norm": 0.711752721602805,
      "learning_rate": 2.4151605994799588e-05,
      "loss": 1.0179,
      "num_input_tokens_seen": 45497116432,
      "step": 57828
    },
    {
      "epoch": 6.13505198387439,
      "grad_norm": 1.1476438832105753,
      "learning_rate": 2.415091142659778e-05,
      "loss": 0.9424,
      "num_input_tokens_seen": 45497903232,
      "step": 57829
    },
    {
      "epoch": 6.135158073413962,
      "grad_norm": 0.9345490148551473,
      "learning_rate": 2.4150216859052123e-05,
      "loss": 1.0101,
      "num_input_tokens_seen": 45498690016,
      "step": 57830
    },
    {
      "epoch": 6.135264162953533,
      "grad_norm": 0.7986092378613855,
      "learning_rate": 2.414952229216316e-05,
      "loss": 0.9832,
      "num_input_tokens_seen": 45499476752,
      "step": 57831
    },
    {
      "epoch": 6.135370252493104,
      "grad_norm": 0.7995099083760102,
      "learning_rate": 2.4148827725931412e-05,
      "loss": 1.0,
      "num_input_tokens_seen": 45500263440,
      "step": 57832
    },
    {
      "epoch": 6.135476342032676,
      "grad_norm": 0.6735091692400895,
      "learning_rate": 2.4148133160357432e-05,
      "loss": 0.9758,
      "num_input_tokens_seen": 45501050112,
      "step": 57833
    },
    {
      "epoch": 6.135582431572247,
      "grad_norm": 0.810150591911479,
      "learning_rate": 2.414743859544175e-05,
      "loss": 0.9732,
      "num_input_tokens_seen": 45501836896,
      "step": 57834
    },
    {
      "epoch": 6.135688521111819,
      "grad_norm": 0.8236421811419594,
      "learning_rate": 2.4146744031184894e-05,
      "loss": 0.9739,
      "num_input_tokens_seen": 45502623648,
      "step": 57835
    },
    {
      "epoch": 6.13579461065139,
      "grad_norm": 1.1319389533282118,
      "learning_rate": 2.4146049467587418e-05,
      "loss": 0.91,
      "num_input_tokens_seen": 45503410384,
      "step": 57836
    },
    {
      "epoch": 6.135900700190962,
      "grad_norm": 0.8106025502917398,
      "learning_rate": 2.4145354904649848e-05,
      "loss": 1.0015,
      "num_input_tokens_seen": 45504197056,
      "step": 57837
    },
    {
      "epoch": 6.136006789730533,
      "grad_norm": 0.8380254283542325,
      "learning_rate": 2.414466034237272e-05,
      "loss": 0.982,
      "num_input_tokens_seen": 45504983744,
      "step": 57838
    },
    {
      "epoch": 6.136112879270104,
      "grad_norm": 0.7719684311929501,
      "learning_rate": 2.4143965780756575e-05,
      "loss": 0.9171,
      "num_input_tokens_seen": 45505770480,
      "step": 57839
    },
    {
      "epoch": 6.1362189688096755,
      "grad_norm": 0.7298832230517276,
      "learning_rate": 2.4143271219801943e-05,
      "loss": 0.9095,
      "num_input_tokens_seen": 45506557344,
      "step": 57840
    },
    {
      "epoch": 6.136325058349247,
      "grad_norm": 0.9421196273922616,
      "learning_rate": 2.4142576659509373e-05,
      "loss": 1.0017,
      "num_input_tokens_seen": 45507344144,
      "step": 57841
    },
    {
      "epoch": 6.1364311478888185,
      "grad_norm": 0.9127736870079033,
      "learning_rate": 2.4141882099879395e-05,
      "loss": 1.0638,
      "num_input_tokens_seen": 45508130848,
      "step": 57842
    },
    {
      "epoch": 6.1365372374283895,
      "grad_norm": 1.2032700271512364,
      "learning_rate": 2.414118754091254e-05,
      "loss": 0.9812,
      "num_input_tokens_seen": 45508917616,
      "step": 57843
    },
    {
      "epoch": 6.1366433269679606,
      "grad_norm": 0.7513203167996152,
      "learning_rate": 2.4140492982609354e-05,
      "loss": 0.9986,
      "num_input_tokens_seen": 45509704416,
      "step": 57844
    },
    {
      "epoch": 6.1367494165075325,
      "grad_norm": 0.925161384920818,
      "learning_rate": 2.413979842497037e-05,
      "loss": 0.9769,
      "num_input_tokens_seen": 45510491200,
      "step": 57845
    },
    {
      "epoch": 6.1368555060471035,
      "grad_norm": 0.852248239271654,
      "learning_rate": 2.4139103867996117e-05,
      "loss": 1.0711,
      "num_input_tokens_seen": 45511277952,
      "step": 57846
    },
    {
      "epoch": 6.136961595586675,
      "grad_norm": 0.7754788499344508,
      "learning_rate": 2.413840931168715e-05,
      "loss": 0.959,
      "num_input_tokens_seen": 45512064720,
      "step": 57847
    },
    {
      "epoch": 6.1370676851262465,
      "grad_norm": 0.9194536943931124,
      "learning_rate": 2.4137714756043993e-05,
      "loss": 0.9807,
      "num_input_tokens_seen": 45512851504,
      "step": 57848
    },
    {
      "epoch": 6.137173774665818,
      "grad_norm": 0.7476196902795276,
      "learning_rate": 2.4137020201067178e-05,
      "loss": 0.9023,
      "num_input_tokens_seen": 45513638176,
      "step": 57849
    },
    {
      "epoch": 6.137279864205389,
      "grad_norm": 0.8419770319220778,
      "learning_rate": 2.4136325646757255e-05,
      "loss": 0.9437,
      "num_input_tokens_seen": 45514424896,
      "step": 57850
    },
    {
      "epoch": 6.13738595374496,
      "grad_norm": 0.9285877285952688,
      "learning_rate": 2.4135631093114753e-05,
      "loss": 0.9245,
      "num_input_tokens_seen": 45515211648,
      "step": 57851
    },
    {
      "epoch": 6.137492043284532,
      "grad_norm": 0.7256009358213559,
      "learning_rate": 2.4134936540140205e-05,
      "loss": 0.9994,
      "num_input_tokens_seen": 45515998336,
      "step": 57852
    },
    {
      "epoch": 6.137598132824103,
      "grad_norm": 0.7180887173444155,
      "learning_rate": 2.413424198783416e-05,
      "loss": 0.9817,
      "num_input_tokens_seen": 45516785072,
      "step": 57853
    },
    {
      "epoch": 6.137704222363675,
      "grad_norm": 0.7938355168607567,
      "learning_rate": 2.4133547436197143e-05,
      "loss": 0.9943,
      "num_input_tokens_seen": 45517571808,
      "step": 57854
    },
    {
      "epoch": 6.137810311903246,
      "grad_norm": 1.1725606849168908,
      "learning_rate": 2.4132852885229694e-05,
      "loss": 1.0895,
      "num_input_tokens_seen": 45518358432,
      "step": 57855
    },
    {
      "epoch": 6.137916401442817,
      "grad_norm": 0.7247290299016569,
      "learning_rate": 2.4132158334932353e-05,
      "loss": 1.0502,
      "num_input_tokens_seen": 45519145168,
      "step": 57856
    },
    {
      "epoch": 6.138022490982389,
      "grad_norm": 1.578170978323643,
      "learning_rate": 2.413146378530565e-05,
      "loss": 1.0817,
      "num_input_tokens_seen": 45519931952,
      "step": 57857
    },
    {
      "epoch": 6.13812858052196,
      "grad_norm": 0.770568366199658,
      "learning_rate": 2.4130769236350136e-05,
      "loss": 0.9548,
      "num_input_tokens_seen": 45520718624,
      "step": 57858
    },
    {
      "epoch": 6.138234670061532,
      "grad_norm": 0.8897859841975063,
      "learning_rate": 2.413007468806633e-05,
      "loss": 1.0514,
      "num_input_tokens_seen": 45521505328,
      "step": 57859
    },
    {
      "epoch": 6.138340759601103,
      "grad_norm": 0.7350271490137685,
      "learning_rate": 2.412938014045478e-05,
      "loss": 0.9619,
      "num_input_tokens_seen": 45522292096,
      "step": 57860
    },
    {
      "epoch": 6.138446849140674,
      "grad_norm": 0.8421872878624125,
      "learning_rate": 2.412868559351602e-05,
      "loss": 0.9458,
      "num_input_tokens_seen": 45523078784,
      "step": 57861
    },
    {
      "epoch": 6.138552938680246,
      "grad_norm": 0.730034702828022,
      "learning_rate": 2.4127991047250587e-05,
      "loss": 1.0351,
      "num_input_tokens_seen": 45523865504,
      "step": 57862
    },
    {
      "epoch": 6.138659028219817,
      "grad_norm": 0.723561623167623,
      "learning_rate": 2.412729650165901e-05,
      "loss": 1.0327,
      "num_input_tokens_seen": 45524652272,
      "step": 57863
    },
    {
      "epoch": 6.138765117759389,
      "grad_norm": 0.8509679595217896,
      "learning_rate": 2.412660195674184e-05,
      "loss": 0.9923,
      "num_input_tokens_seen": 45525439024,
      "step": 57864
    },
    {
      "epoch": 6.13887120729896,
      "grad_norm": 0.8837833820527605,
      "learning_rate": 2.412590741249961e-05,
      "loss": 1.0587,
      "num_input_tokens_seen": 45526225776,
      "step": 57865
    },
    {
      "epoch": 6.138977296838532,
      "grad_norm": 0.7722580467011854,
      "learning_rate": 2.412521286893284e-05,
      "loss": 0.9904,
      "num_input_tokens_seen": 45527012528,
      "step": 57866
    },
    {
      "epoch": 6.139083386378103,
      "grad_norm": 0.7602808564071835,
      "learning_rate": 2.412451832604209e-05,
      "loss": 0.963,
      "num_input_tokens_seen": 45527799344,
      "step": 57867
    },
    {
      "epoch": 6.139189475917674,
      "grad_norm": 0.9421311838444304,
      "learning_rate": 2.4123823783827885e-05,
      "loss": 0.9594,
      "num_input_tokens_seen": 45528586128,
      "step": 57868
    },
    {
      "epoch": 6.139295565457246,
      "grad_norm": 0.8855378100969689,
      "learning_rate": 2.4123129242290758e-05,
      "loss": 0.9938,
      "num_input_tokens_seen": 45529372848,
      "step": 57869
    },
    {
      "epoch": 6.139401654996817,
      "grad_norm": 0.9737861057185841,
      "learning_rate": 2.4122434701431258e-05,
      "loss": 1.04,
      "num_input_tokens_seen": 45530159648,
      "step": 57870
    },
    {
      "epoch": 6.139507744536389,
      "grad_norm": 0.9206657138028035,
      "learning_rate": 2.4121740161249912e-05,
      "loss": 1.0078,
      "num_input_tokens_seen": 45530946352,
      "step": 57871
    },
    {
      "epoch": 6.13961383407596,
      "grad_norm": 0.8017326547406618,
      "learning_rate": 2.4121045621747253e-05,
      "loss": 1.0317,
      "num_input_tokens_seen": 45531733056,
      "step": 57872
    },
    {
      "epoch": 6.139719923615531,
      "grad_norm": 1.1764794744305356,
      "learning_rate": 2.4120351082923834e-05,
      "loss": 1.0254,
      "num_input_tokens_seen": 45532519872,
      "step": 57873
    },
    {
      "epoch": 6.139826013155103,
      "grad_norm": 1.1300999023256628,
      "learning_rate": 2.4119656544780175e-05,
      "loss": 0.9854,
      "num_input_tokens_seen": 45533306640,
      "step": 57874
    },
    {
      "epoch": 6.139932102694674,
      "grad_norm": 0.7789497217125205,
      "learning_rate": 2.4118962007316823e-05,
      "loss": 0.9951,
      "num_input_tokens_seen": 45534093440,
      "step": 57875
    },
    {
      "epoch": 6.140038192234246,
      "grad_norm": 1.024258032168485,
      "learning_rate": 2.4118267470534316e-05,
      "loss": 1.0499,
      "num_input_tokens_seen": 45534880144,
      "step": 57876
    },
    {
      "epoch": 6.140144281773817,
      "grad_norm": 0.7361204080821234,
      "learning_rate": 2.4117572934433176e-05,
      "loss": 1.112,
      "num_input_tokens_seen": 45535666832,
      "step": 57877
    },
    {
      "epoch": 6.140250371313389,
      "grad_norm": 0.6677254695169312,
      "learning_rate": 2.4116878399013958e-05,
      "loss": 1.0084,
      "num_input_tokens_seen": 45536453632,
      "step": 57878
    },
    {
      "epoch": 6.14035646085296,
      "grad_norm": 0.7836578730248015,
      "learning_rate": 2.4116183864277188e-05,
      "loss": 0.9401,
      "num_input_tokens_seen": 45537240368,
      "step": 57879
    },
    {
      "epoch": 6.140462550392531,
      "grad_norm": 0.9721664148002442,
      "learning_rate": 2.4115489330223397e-05,
      "loss": 1.037,
      "num_input_tokens_seen": 45538027216,
      "step": 57880
    },
    {
      "epoch": 6.140568639932103,
      "grad_norm": 0.8358889050539313,
      "learning_rate": 2.4114794796853142e-05,
      "loss": 1.0183,
      "num_input_tokens_seen": 45538813936,
      "step": 57881
    },
    {
      "epoch": 6.140674729471674,
      "grad_norm": 1.8625415937809693,
      "learning_rate": 2.4114100264166944e-05,
      "loss": 1.0299,
      "num_input_tokens_seen": 45539600800,
      "step": 57882
    },
    {
      "epoch": 6.140780819011246,
      "grad_norm": 1.7601577360830187,
      "learning_rate": 2.411340573216534e-05,
      "loss": 0.9296,
      "num_input_tokens_seen": 45540387584,
      "step": 57883
    },
    {
      "epoch": 6.140886908550817,
      "grad_norm": 1.0322242002541344,
      "learning_rate": 2.4112711200848873e-05,
      "loss": 1.045,
      "num_input_tokens_seen": 45541174320,
      "step": 57884
    },
    {
      "epoch": 6.140992998090388,
      "grad_norm": 1.1831770432871456,
      "learning_rate": 2.4112016670218078e-05,
      "loss": 0.9531,
      "num_input_tokens_seen": 45541961120,
      "step": 57885
    },
    {
      "epoch": 6.14109908762996,
      "grad_norm": 1.4799544383364174,
      "learning_rate": 2.4111322140273485e-05,
      "loss": 1.0686,
      "num_input_tokens_seen": 45542747888,
      "step": 57886
    },
    {
      "epoch": 6.141205177169531,
      "grad_norm": 1.0624477921553643,
      "learning_rate": 2.411062761101564e-05,
      "loss": 0.9713,
      "num_input_tokens_seen": 45543534704,
      "step": 57887
    },
    {
      "epoch": 6.141311266709103,
      "grad_norm": 1.047141211593881,
      "learning_rate": 2.4109933082445076e-05,
      "loss": 1.0296,
      "num_input_tokens_seen": 45544321440,
      "step": 57888
    },
    {
      "epoch": 6.141417356248674,
      "grad_norm": 0.9742375900171771,
      "learning_rate": 2.4109238554562327e-05,
      "loss": 1.005,
      "num_input_tokens_seen": 45545108192,
      "step": 57889
    },
    {
      "epoch": 6.141523445788245,
      "grad_norm": 0.9361273060958204,
      "learning_rate": 2.4108544027367934e-05,
      "loss": 1.0048,
      "num_input_tokens_seen": 45545894912,
      "step": 57890
    },
    {
      "epoch": 6.141629535327817,
      "grad_norm": 1.144362607018689,
      "learning_rate": 2.410784950086243e-05,
      "loss": 1.0014,
      "num_input_tokens_seen": 45546681648,
      "step": 57891
    },
    {
      "epoch": 6.141735624867388,
      "grad_norm": 1.0446079213563122,
      "learning_rate": 2.4107154975046354e-05,
      "loss": 1.0604,
      "num_input_tokens_seen": 45547468384,
      "step": 57892
    },
    {
      "epoch": 6.14184171440696,
      "grad_norm": 0.9561987807160828,
      "learning_rate": 2.410646044992024e-05,
      "loss": 1.0639,
      "num_input_tokens_seen": 45548255120,
      "step": 57893
    },
    {
      "epoch": 6.141947803946531,
      "grad_norm": 0.6806313225101323,
      "learning_rate": 2.4105765925484637e-05,
      "loss": 0.975,
      "num_input_tokens_seen": 45549041904,
      "step": 57894
    },
    {
      "epoch": 6.142053893486103,
      "grad_norm": 0.8805801191361934,
      "learning_rate": 2.4105071401740058e-05,
      "loss": 1.0743,
      "num_input_tokens_seen": 45549828688,
      "step": 57895
    },
    {
      "epoch": 6.142159983025674,
      "grad_norm": 0.7969569913040461,
      "learning_rate": 2.4104376878687067e-05,
      "loss": 1.0134,
      "num_input_tokens_seen": 45550615504,
      "step": 57896
    },
    {
      "epoch": 6.142266072565245,
      "grad_norm": 0.8365990145504653,
      "learning_rate": 2.4103682356326187e-05,
      "loss": 0.9801,
      "num_input_tokens_seen": 45551402272,
      "step": 57897
    },
    {
      "epoch": 6.142372162104817,
      "grad_norm": 1.1050145474197577,
      "learning_rate": 2.4102987834657942e-05,
      "loss": 0.9493,
      "num_input_tokens_seen": 45552189120,
      "step": 57898
    },
    {
      "epoch": 6.142478251644388,
      "grad_norm": 0.6647607804979584,
      "learning_rate": 2.4102293313682896e-05,
      "loss": 0.9735,
      "num_input_tokens_seen": 45552975968,
      "step": 57899
    },
    {
      "epoch": 6.14258434118396,
      "grad_norm": 1.0387394846423215,
      "learning_rate": 2.4101598793401563e-05,
      "loss": 1.0061,
      "num_input_tokens_seen": 45553762800,
      "step": 57900
    },
    {
      "epoch": 6.142690430723531,
      "grad_norm": 1.1267613213448504,
      "learning_rate": 2.410090427381449e-05,
      "loss": 1.0643,
      "num_input_tokens_seen": 45554549488,
      "step": 57901
    },
    {
      "epoch": 6.142796520263102,
      "grad_norm": 0.7831650819212386,
      "learning_rate": 2.4100209754922212e-05,
      "loss": 0.9977,
      "num_input_tokens_seen": 45555336224,
      "step": 57902
    },
    {
      "epoch": 6.1429026098026736,
      "grad_norm": 1.0292004636460237,
      "learning_rate": 2.4099515236725268e-05,
      "loss": 1.0255,
      "num_input_tokens_seen": 45556122960,
      "step": 57903
    },
    {
      "epoch": 6.143008699342245,
      "grad_norm": 0.785291027335582,
      "learning_rate": 2.4098820719224185e-05,
      "loss": 0.9804,
      "num_input_tokens_seen": 45556909712,
      "step": 57904
    },
    {
      "epoch": 6.1431147888818165,
      "grad_norm": 0.8024021077899447,
      "learning_rate": 2.4098126202419516e-05,
      "loss": 0.9959,
      "num_input_tokens_seen": 45557696400,
      "step": 57905
    },
    {
      "epoch": 6.1432208784213875,
      "grad_norm": 1.0860996040831583,
      "learning_rate": 2.4097431686311785e-05,
      "loss": 1.0682,
      "num_input_tokens_seen": 45558483120,
      "step": 57906
    },
    {
      "epoch": 6.1433269679609595,
      "grad_norm": 0.7695190482013903,
      "learning_rate": 2.409673717090153e-05,
      "loss": 0.9369,
      "num_input_tokens_seen": 45559269840,
      "step": 57907
    },
    {
      "epoch": 6.1434330575005305,
      "grad_norm": 0.9062126097372539,
      "learning_rate": 2.4096042656189295e-05,
      "loss": 0.9612,
      "num_input_tokens_seen": 45560056640,
      "step": 57908
    },
    {
      "epoch": 6.1435391470401015,
      "grad_norm": 0.8204461121228392,
      "learning_rate": 2.409534814217561e-05,
      "loss": 0.9929,
      "num_input_tokens_seen": 45560843440,
      "step": 57909
    },
    {
      "epoch": 6.143645236579673,
      "grad_norm": 0.8796394428382939,
      "learning_rate": 2.4094653628861004e-05,
      "loss": 1.0479,
      "num_input_tokens_seen": 45561630144,
      "step": 57910
    },
    {
      "epoch": 6.1437513261192445,
      "grad_norm": 1.148316853682891,
      "learning_rate": 2.4093959116246034e-05,
      "loss": 1.0526,
      "num_input_tokens_seen": 45562416880,
      "step": 57911
    },
    {
      "epoch": 6.143857415658816,
      "grad_norm": 0.7606192853003795,
      "learning_rate": 2.409326460433122e-05,
      "loss": 0.9574,
      "num_input_tokens_seen": 45563203584,
      "step": 57912
    },
    {
      "epoch": 6.143963505198387,
      "grad_norm": 0.709163744544585,
      "learning_rate": 2.409257009311711e-05,
      "loss": 0.99,
      "num_input_tokens_seen": 45563990320,
      "step": 57913
    },
    {
      "epoch": 6.144069594737958,
      "grad_norm": 1.0900842769574601,
      "learning_rate": 2.4091875582604234e-05,
      "loss": 1.0408,
      "num_input_tokens_seen": 45564777056,
      "step": 57914
    },
    {
      "epoch": 6.14417568427753,
      "grad_norm": 0.6083070321201853,
      "learning_rate": 2.4091181072793126e-05,
      "loss": 0.929,
      "num_input_tokens_seen": 45565563840,
      "step": 57915
    },
    {
      "epoch": 6.144281773817101,
      "grad_norm": 1.4560283201289639,
      "learning_rate": 2.409048656368433e-05,
      "loss": 1.0265,
      "num_input_tokens_seen": 45566350560,
      "step": 57916
    },
    {
      "epoch": 6.144387863356673,
      "grad_norm": 0.8541651082381188,
      "learning_rate": 2.4089792055278382e-05,
      "loss": 0.9773,
      "num_input_tokens_seen": 45567137248,
      "step": 57917
    },
    {
      "epoch": 6.144493952896244,
      "grad_norm": 0.7397427407433539,
      "learning_rate": 2.4089097547575807e-05,
      "loss": 0.94,
      "num_input_tokens_seen": 45567924000,
      "step": 57918
    },
    {
      "epoch": 6.144600042435816,
      "grad_norm": 0.9392390282438853,
      "learning_rate": 2.408840304057716e-05,
      "loss": 1.0316,
      "num_input_tokens_seen": 45568710768,
      "step": 57919
    },
    {
      "epoch": 6.144706131975387,
      "grad_norm": 0.9936191986648447,
      "learning_rate": 2.4087708534282967e-05,
      "loss": 0.9451,
      "num_input_tokens_seen": 45569497552,
      "step": 57920
    },
    {
      "epoch": 6.144812221514958,
      "grad_norm": 0.8920154372069212,
      "learning_rate": 2.408701402869376e-05,
      "loss": 0.95,
      "num_input_tokens_seen": 45570284272,
      "step": 57921
    },
    {
      "epoch": 6.14491831105453,
      "grad_norm": 1.18294571388394,
      "learning_rate": 2.4086319523810086e-05,
      "loss": 0.9512,
      "num_input_tokens_seen": 45571071040,
      "step": 57922
    },
    {
      "epoch": 6.145024400594101,
      "grad_norm": 1.105530234266891,
      "learning_rate": 2.4085625019632476e-05,
      "loss": 0.9893,
      "num_input_tokens_seen": 45571857744,
      "step": 57923
    },
    {
      "epoch": 6.145130490133673,
      "grad_norm": 1.0218933728617698,
      "learning_rate": 2.4084930516161467e-05,
      "loss": 1.0261,
      "num_input_tokens_seen": 45572644432,
      "step": 57924
    },
    {
      "epoch": 6.145236579673244,
      "grad_norm": 0.7781617418497108,
      "learning_rate": 2.4084236013397602e-05,
      "loss": 1.031,
      "num_input_tokens_seen": 45573431184,
      "step": 57925
    },
    {
      "epoch": 6.145342669212815,
      "grad_norm": 0.7091930480556607,
      "learning_rate": 2.408354151134141e-05,
      "loss": 0.9716,
      "num_input_tokens_seen": 45574217872,
      "step": 57926
    },
    {
      "epoch": 6.145448758752387,
      "grad_norm": 0.904749617139634,
      "learning_rate": 2.4082847009993425e-05,
      "loss": 1.0286,
      "num_input_tokens_seen": 45575004656,
      "step": 57927
    },
    {
      "epoch": 6.145554848291958,
      "grad_norm": 0.6836810096303657,
      "learning_rate": 2.4082152509354196e-05,
      "loss": 0.8726,
      "num_input_tokens_seen": 45575791440,
      "step": 57928
    },
    {
      "epoch": 6.14566093783153,
      "grad_norm": 0.7506848149722563,
      "learning_rate": 2.4081458009424246e-05,
      "loss": 1.0639,
      "num_input_tokens_seen": 45576578224,
      "step": 57929
    },
    {
      "epoch": 6.145767027371101,
      "grad_norm": 0.8468000920444123,
      "learning_rate": 2.4080763510204123e-05,
      "loss": 1.0845,
      "num_input_tokens_seen": 45577364912,
      "step": 57930
    },
    {
      "epoch": 6.145873116910673,
      "grad_norm": 0.6939439596531577,
      "learning_rate": 2.4080069011694362e-05,
      "loss": 0.9302,
      "num_input_tokens_seen": 45578151712,
      "step": 57931
    },
    {
      "epoch": 6.145979206450244,
      "grad_norm": 1.0413636641970927,
      "learning_rate": 2.407937451389549e-05,
      "loss": 0.9881,
      "num_input_tokens_seen": 45578938528,
      "step": 57932
    },
    {
      "epoch": 6.146085295989815,
      "grad_norm": 0.7241811122492549,
      "learning_rate": 2.4078680016808057e-05,
      "loss": 1.004,
      "num_input_tokens_seen": 45579725312,
      "step": 57933
    },
    {
      "epoch": 6.146191385529387,
      "grad_norm": 0.7219113774774348,
      "learning_rate": 2.407798552043259e-05,
      "loss": 0.9953,
      "num_input_tokens_seen": 45580511984,
      "step": 57934
    },
    {
      "epoch": 6.146297475068958,
      "grad_norm": 0.7685629571322355,
      "learning_rate": 2.4077291024769625e-05,
      "loss": 0.9948,
      "num_input_tokens_seen": 45581298800,
      "step": 57935
    },
    {
      "epoch": 6.14640356460853,
      "grad_norm": 0.7907303689340035,
      "learning_rate": 2.4076596529819706e-05,
      "loss": 1.0264,
      "num_input_tokens_seen": 45582085584,
      "step": 57936
    },
    {
      "epoch": 6.146509654148101,
      "grad_norm": 0.9846109585119347,
      "learning_rate": 2.4075902035583366e-05,
      "loss": 1.0071,
      "num_input_tokens_seen": 45582872288,
      "step": 57937
    },
    {
      "epoch": 6.146615743687672,
      "grad_norm": 0.8349057129122546,
      "learning_rate": 2.407520754206114e-05,
      "loss": 0.954,
      "num_input_tokens_seen": 45583659168,
      "step": 57938
    },
    {
      "epoch": 6.146721833227244,
      "grad_norm": 0.767540726893154,
      "learning_rate": 2.407451304925357e-05,
      "loss": 1.0791,
      "num_input_tokens_seen": 45584446000,
      "step": 57939
    },
    {
      "epoch": 6.146827922766815,
      "grad_norm": 1.016860471085778,
      "learning_rate": 2.407381855716119e-05,
      "loss": 1.0636,
      "num_input_tokens_seen": 45585232688,
      "step": 57940
    },
    {
      "epoch": 6.146934012306387,
      "grad_norm": 0.8304152121222099,
      "learning_rate": 2.4073124065784526e-05,
      "loss": 0.9637,
      "num_input_tokens_seen": 45586019504,
      "step": 57941
    },
    {
      "epoch": 6.147040101845958,
      "grad_norm": 0.8938234861945203,
      "learning_rate": 2.4072429575124136e-05,
      "loss": 1.0498,
      "num_input_tokens_seen": 45586806240,
      "step": 57942
    },
    {
      "epoch": 6.147146191385529,
      "grad_norm": 1.1293570940011943,
      "learning_rate": 2.4071735085180534e-05,
      "loss": 0.9936,
      "num_input_tokens_seen": 45587592960,
      "step": 57943
    },
    {
      "epoch": 6.147252280925101,
      "grad_norm": 0.9061607277712735,
      "learning_rate": 2.407104059595428e-05,
      "loss": 1.0236,
      "num_input_tokens_seen": 45588379664,
      "step": 57944
    },
    {
      "epoch": 6.147358370464672,
      "grad_norm": 0.682779917291771,
      "learning_rate": 2.4070346107445894e-05,
      "loss": 1.0003,
      "num_input_tokens_seen": 45589166416,
      "step": 57945
    },
    {
      "epoch": 6.147464460004244,
      "grad_norm": 0.9167575478523214,
      "learning_rate": 2.4069651619655914e-05,
      "loss": 1.0288,
      "num_input_tokens_seen": 45589953056,
      "step": 57946
    },
    {
      "epoch": 6.147570549543815,
      "grad_norm": 0.9605393432913891,
      "learning_rate": 2.4068957132584883e-05,
      "loss": 1.0214,
      "num_input_tokens_seen": 45590739792,
      "step": 57947
    },
    {
      "epoch": 6.147676639083387,
      "grad_norm": 0.8486985269888366,
      "learning_rate": 2.4068262646233335e-05,
      "loss": 1.0149,
      "num_input_tokens_seen": 45591526464,
      "step": 57948
    },
    {
      "epoch": 6.147782728622958,
      "grad_norm": 0.7904295963754316,
      "learning_rate": 2.4067568160601803e-05,
      "loss": 1.0604,
      "num_input_tokens_seen": 45592313200,
      "step": 57949
    },
    {
      "epoch": 6.147888818162529,
      "grad_norm": 1.1530587228184446,
      "learning_rate": 2.406687367569083e-05,
      "loss": 1.0719,
      "num_input_tokens_seen": 45593099856,
      "step": 57950
    },
    {
      "epoch": 6.147994907702101,
      "grad_norm": 0.656331745721574,
      "learning_rate": 2.4066179191500952e-05,
      "loss": 0.9425,
      "num_input_tokens_seen": 45593886624,
      "step": 57951
    },
    {
      "epoch": 6.148100997241672,
      "grad_norm": 0.7385748265775364,
      "learning_rate": 2.4065484708032694e-05,
      "loss": 1.0283,
      "num_input_tokens_seen": 45594673424,
      "step": 57952
    },
    {
      "epoch": 6.148207086781244,
      "grad_norm": 1.2799105077631983,
      "learning_rate": 2.4064790225286613e-05,
      "loss": 0.978,
      "num_input_tokens_seen": 45595460096,
      "step": 57953
    },
    {
      "epoch": 6.148313176320815,
      "grad_norm": 0.9373012402382951,
      "learning_rate": 2.406409574326323e-05,
      "loss": 1.0182,
      "num_input_tokens_seen": 45596246880,
      "step": 57954
    },
    {
      "epoch": 6.148419265860386,
      "grad_norm": 0.646762721693288,
      "learning_rate": 2.4063401261963082e-05,
      "loss": 0.9972,
      "num_input_tokens_seen": 45597033728,
      "step": 57955
    },
    {
      "epoch": 6.148525355399958,
      "grad_norm": 1.144910146777943,
      "learning_rate": 2.4062706781386717e-05,
      "loss": 0.9957,
      "num_input_tokens_seen": 45597820464,
      "step": 57956
    },
    {
      "epoch": 6.148631444939529,
      "grad_norm": 0.8654161256775046,
      "learning_rate": 2.4062012301534663e-05,
      "loss": 1.0061,
      "num_input_tokens_seen": 45598607264,
      "step": 57957
    },
    {
      "epoch": 6.148737534479101,
      "grad_norm": 0.8175898058453465,
      "learning_rate": 2.4061317822407456e-05,
      "loss": 1.0399,
      "num_input_tokens_seen": 45599393968,
      "step": 57958
    },
    {
      "epoch": 6.148843624018672,
      "grad_norm": 0.873142349143216,
      "learning_rate": 2.4060623344005637e-05,
      "loss": 0.9671,
      "num_input_tokens_seen": 45600180704,
      "step": 57959
    },
    {
      "epoch": 6.148949713558244,
      "grad_norm": 1.6225762702769777,
      "learning_rate": 2.4059928866329737e-05,
      "loss": 0.9173,
      "num_input_tokens_seen": 45600967456,
      "step": 57960
    },
    {
      "epoch": 6.149055803097815,
      "grad_norm": 0.743927299187888,
      "learning_rate": 2.4059234389380302e-05,
      "loss": 0.9771,
      "num_input_tokens_seen": 45601754224,
      "step": 57961
    },
    {
      "epoch": 6.149161892637386,
      "grad_norm": 0.7179740723545157,
      "learning_rate": 2.4058539913157862e-05,
      "loss": 0.9774,
      "num_input_tokens_seen": 45602541072,
      "step": 57962
    },
    {
      "epoch": 6.149267982176958,
      "grad_norm": 1.71779680696763,
      "learning_rate": 2.405784543766295e-05,
      "loss": 1.0256,
      "num_input_tokens_seen": 45603327824,
      "step": 57963
    },
    {
      "epoch": 6.149374071716529,
      "grad_norm": 0.9460830812568211,
      "learning_rate": 2.405715096289611e-05,
      "loss": 0.9018,
      "num_input_tokens_seen": 45604114672,
      "step": 57964
    },
    {
      "epoch": 6.1494801612561005,
      "grad_norm": 1.0185059337742504,
      "learning_rate": 2.405645648885788e-05,
      "loss": 0.9737,
      "num_input_tokens_seen": 45604901520,
      "step": 57965
    },
    {
      "epoch": 6.149586250795672,
      "grad_norm": 1.719361117940864,
      "learning_rate": 2.4055762015548784e-05,
      "loss": 1.0032,
      "num_input_tokens_seen": 45605688224,
      "step": 57966
    },
    {
      "epoch": 6.149692340335243,
      "grad_norm": 0.7699620039417,
      "learning_rate": 2.4055067542969376e-05,
      "loss": 1.0124,
      "num_input_tokens_seen": 45606474928,
      "step": 57967
    },
    {
      "epoch": 6.1497984298748145,
      "grad_norm": 0.8521972739996314,
      "learning_rate": 2.4054373071120184e-05,
      "loss": 1.02,
      "num_input_tokens_seen": 45607261696,
      "step": 57968
    },
    {
      "epoch": 6.1499045194143855,
      "grad_norm": 0.6936879690272595,
      "learning_rate": 2.4053678600001737e-05,
      "loss": 0.9744,
      "num_input_tokens_seen": 45608048432,
      "step": 57969
    },
    {
      "epoch": 6.1500106089539575,
      "grad_norm": 0.7823437852654856,
      "learning_rate": 2.4052984129614585e-05,
      "loss": 1.011,
      "num_input_tokens_seen": 45608835280,
      "step": 57970
    },
    {
      "epoch": 6.1501166984935285,
      "grad_norm": 0.788858981056841,
      "learning_rate": 2.4052289659959263e-05,
      "loss": 0.975,
      "num_input_tokens_seen": 45609622048,
      "step": 57971
    },
    {
      "epoch": 6.1502227880330995,
      "grad_norm": 0.9994947296359779,
      "learning_rate": 2.4051595191036296e-05,
      "loss": 1.0419,
      "num_input_tokens_seen": 45610408816,
      "step": 57972
    },
    {
      "epoch": 6.150328877572671,
      "grad_norm": 0.9014068671251159,
      "learning_rate": 2.4050900722846232e-05,
      "loss": 0.9723,
      "num_input_tokens_seen": 45611195584,
      "step": 57973
    },
    {
      "epoch": 6.1504349671122425,
      "grad_norm": 1.0111559058382633,
      "learning_rate": 2.4050206255389604e-05,
      "loss": 0.9635,
      "num_input_tokens_seen": 45611982368,
      "step": 57974
    },
    {
      "epoch": 6.150541056651814,
      "grad_norm": 1.1441842514952272,
      "learning_rate": 2.4049511788666947e-05,
      "loss": 1.0291,
      "num_input_tokens_seen": 45612769136,
      "step": 57975
    },
    {
      "epoch": 6.150647146191385,
      "grad_norm": 0.8909978894415898,
      "learning_rate": 2.4048817322678803e-05,
      "loss": 0.9441,
      "num_input_tokens_seen": 45613555984,
      "step": 57976
    },
    {
      "epoch": 6.150753235730957,
      "grad_norm": 0.9742358695379931,
      "learning_rate": 2.4048122857425697e-05,
      "loss": 1.0438,
      "num_input_tokens_seen": 45614342736,
      "step": 57977
    },
    {
      "epoch": 6.150859325270528,
      "grad_norm": 1.2062239619256778,
      "learning_rate": 2.4047428392908182e-05,
      "loss": 0.8693,
      "num_input_tokens_seen": 45615129552,
      "step": 57978
    },
    {
      "epoch": 6.150965414810099,
      "grad_norm": 1.036974560881822,
      "learning_rate": 2.4046733929126782e-05,
      "loss": 0.9751,
      "num_input_tokens_seen": 45615916320,
      "step": 57979
    },
    {
      "epoch": 6.151071504349671,
      "grad_norm": 1.2829782376096115,
      "learning_rate": 2.4046039466082037e-05,
      "loss": 1.0435,
      "num_input_tokens_seen": 45616703120,
      "step": 57980
    },
    {
      "epoch": 6.151177593889242,
      "grad_norm": 1.1343470333137,
      "learning_rate": 2.4045345003774492e-05,
      "loss": 0.9954,
      "num_input_tokens_seen": 45617489808,
      "step": 57981
    },
    {
      "epoch": 6.151283683428814,
      "grad_norm": 1.1387429124662964,
      "learning_rate": 2.4044650542204672e-05,
      "loss": 0.9853,
      "num_input_tokens_seen": 45618276544,
      "step": 57982
    },
    {
      "epoch": 6.151389772968385,
      "grad_norm": 0.9223997679055669,
      "learning_rate": 2.4043956081373115e-05,
      "loss": 1.0104,
      "num_input_tokens_seen": 45619063296,
      "step": 57983
    },
    {
      "epoch": 6.151495862507956,
      "grad_norm": 0.9794641485817033,
      "learning_rate": 2.4043261621280365e-05,
      "loss": 1.0387,
      "num_input_tokens_seen": 45619850064,
      "step": 57984
    },
    {
      "epoch": 6.151601952047528,
      "grad_norm": 0.9527181852292375,
      "learning_rate": 2.4042567161926955e-05,
      "loss": 1.0206,
      "num_input_tokens_seen": 45620636784,
      "step": 57985
    },
    {
      "epoch": 6.151708041587099,
      "grad_norm": 0.8157455979846217,
      "learning_rate": 2.4041872703313416e-05,
      "loss": 0.9739,
      "num_input_tokens_seen": 45621423520,
      "step": 57986
    },
    {
      "epoch": 6.151814131126671,
      "grad_norm": 0.8805716949044361,
      "learning_rate": 2.404117824544028e-05,
      "loss": 1.0021,
      "num_input_tokens_seen": 45622210320,
      "step": 57987
    },
    {
      "epoch": 6.151920220666242,
      "grad_norm": 1.0601937964394081,
      "learning_rate": 2.404048378830811e-05,
      "loss": 1.006,
      "num_input_tokens_seen": 45622996992,
      "step": 57988
    },
    {
      "epoch": 6.152026310205814,
      "grad_norm": 0.9345347057379902,
      "learning_rate": 2.4039789331917422e-05,
      "loss": 1.0022,
      "num_input_tokens_seen": 45623783728,
      "step": 57989
    },
    {
      "epoch": 6.152132399745385,
      "grad_norm": 0.8685132718481305,
      "learning_rate": 2.4039094876268756e-05,
      "loss": 1.025,
      "num_input_tokens_seen": 45624570512,
      "step": 57990
    },
    {
      "epoch": 6.152238489284956,
      "grad_norm": 0.6896236298887543,
      "learning_rate": 2.403840042136265e-05,
      "loss": 0.9723,
      "num_input_tokens_seen": 45625357328,
      "step": 57991
    },
    {
      "epoch": 6.152344578824528,
      "grad_norm": 0.7211958832731724,
      "learning_rate": 2.4037705967199644e-05,
      "loss": 1.0143,
      "num_input_tokens_seen": 45626144064,
      "step": 57992
    },
    {
      "epoch": 6.152450668364099,
      "grad_norm": 0.7590042204068258,
      "learning_rate": 2.4037011513780262e-05,
      "loss": 1.032,
      "num_input_tokens_seen": 45626930784,
      "step": 57993
    },
    {
      "epoch": 6.152556757903671,
      "grad_norm": 0.8720481140295584,
      "learning_rate": 2.4036317061105054e-05,
      "loss": 1.01,
      "num_input_tokens_seen": 45627717536,
      "step": 57994
    },
    {
      "epoch": 6.152662847443242,
      "grad_norm": 0.7430182612330479,
      "learning_rate": 2.4035622609174553e-05,
      "loss": 0.9818,
      "num_input_tokens_seen": 45628504320,
      "step": 57995
    },
    {
      "epoch": 6.152768936982813,
      "grad_norm": 0.8110027743092232,
      "learning_rate": 2.403492815798929e-05,
      "loss": 1.0606,
      "num_input_tokens_seen": 45629291104,
      "step": 57996
    },
    {
      "epoch": 6.152875026522385,
      "grad_norm": 0.8895647647586649,
      "learning_rate": 2.403423370754981e-05,
      "loss": 1.032,
      "num_input_tokens_seen": 45630077824,
      "step": 57997
    },
    {
      "epoch": 6.152981116061956,
      "grad_norm": 0.912479651253559,
      "learning_rate": 2.4033539257856642e-05,
      "loss": 0.9864,
      "num_input_tokens_seen": 45630864576,
      "step": 57998
    },
    {
      "epoch": 6.153087205601528,
      "grad_norm": 0.7642193742183369,
      "learning_rate": 2.403284480891033e-05,
      "loss": 0.8925,
      "num_input_tokens_seen": 45631651360,
      "step": 57999
    },
    {
      "epoch": 6.153193295141099,
      "grad_norm": 0.7245988335885009,
      "learning_rate": 2.403215036071141e-05,
      "loss": 0.9651,
      "num_input_tokens_seen": 45632438128,
      "step": 58000
    },
    {
      "epoch": 6.153193295141099,
      "eval_loss": 1.5518642663955688,
      "eval_runtime": 65.4373,
      "eval_samples_per_second": 45.845,
      "eval_steps_per_second": 0.489,
      "num_input_tokens_seen": 45632438128,
      "step": 58000
    },
    {
      "epoch": 6.15329938468067,
      "grad_norm": 0.8123708992446649,
      "learning_rate": 2.403145591326041e-05,
      "loss": 0.9921,
      "num_input_tokens_seen": 45633224816,
      "step": 58001
    },
    {
      "epoch": 6.153405474220242,
      "grad_norm": 0.8747027068192981,
      "learning_rate": 2.4030761466557877e-05,
      "loss": 1.0024,
      "num_input_tokens_seen": 45634011600,
      "step": 58002
    },
    {
      "epoch": 6.153511563759813,
      "grad_norm": 0.8692776093041141,
      "learning_rate": 2.4030067020604343e-05,
      "loss": 1.0744,
      "num_input_tokens_seen": 45634798352,
      "step": 58003
    },
    {
      "epoch": 6.153617653299385,
      "grad_norm": 0.8773573100408482,
      "learning_rate": 2.4029372575400337e-05,
      "loss": 0.9941,
      "num_input_tokens_seen": 45635585040,
      "step": 58004
    },
    {
      "epoch": 6.153723742838956,
      "grad_norm": 1.070454816369244,
      "learning_rate": 2.4028678130946414e-05,
      "loss": 0.9392,
      "num_input_tokens_seen": 45636371904,
      "step": 58005
    },
    {
      "epoch": 6.153829832378528,
      "grad_norm": 1.0237064902990067,
      "learning_rate": 2.4027983687243097e-05,
      "loss": 1.0024,
      "num_input_tokens_seen": 45637158688,
      "step": 58006
    },
    {
      "epoch": 6.153935921918099,
      "grad_norm": 0.9364840843884928,
      "learning_rate": 2.402728924429092e-05,
      "loss": 1.0187,
      "num_input_tokens_seen": 45637945520,
      "step": 58007
    },
    {
      "epoch": 6.15404201145767,
      "grad_norm": 1.2243455116770072,
      "learning_rate": 2.402659480209043e-05,
      "loss": 1.1156,
      "num_input_tokens_seen": 45638732304,
      "step": 58008
    },
    {
      "epoch": 6.154148100997242,
      "grad_norm": 0.8827116328347067,
      "learning_rate": 2.4025900360642163e-05,
      "loss": 0.9562,
      "num_input_tokens_seen": 45639519152,
      "step": 58009
    },
    {
      "epoch": 6.154254190536813,
      "grad_norm": 1.21579946209213,
      "learning_rate": 2.4025205919946643e-05,
      "loss": 1.0413,
      "num_input_tokens_seen": 45640305808,
      "step": 58010
    },
    {
      "epoch": 6.154360280076385,
      "grad_norm": 0.7972779653333263,
      "learning_rate": 2.402451148000442e-05,
      "loss": 0.976,
      "num_input_tokens_seen": 45641092576,
      "step": 58011
    },
    {
      "epoch": 6.154466369615956,
      "grad_norm": 0.9837174028510981,
      "learning_rate": 2.4023817040816026e-05,
      "loss": 0.9269,
      "num_input_tokens_seen": 45641879264,
      "step": 58012
    },
    {
      "epoch": 6.154572459155527,
      "grad_norm": 1.2164041202479372,
      "learning_rate": 2.4023122602381992e-05,
      "loss": 0.901,
      "num_input_tokens_seen": 45642666064,
      "step": 58013
    },
    {
      "epoch": 6.154678548695099,
      "grad_norm": 0.7049129709348793,
      "learning_rate": 2.402242816470287e-05,
      "loss": 1.0148,
      "num_input_tokens_seen": 45643452832,
      "step": 58014
    },
    {
      "epoch": 6.15478463823467,
      "grad_norm": 0.7590337186670455,
      "learning_rate": 2.4021733727779176e-05,
      "loss": 1.016,
      "num_input_tokens_seen": 45644239504,
      "step": 58015
    },
    {
      "epoch": 6.154890727774242,
      "grad_norm": 1.3509633322548111,
      "learning_rate": 2.4021039291611464e-05,
      "loss": 0.9615,
      "num_input_tokens_seen": 45645026336,
      "step": 58016
    },
    {
      "epoch": 6.154996817313813,
      "grad_norm": 1.078507534292526,
      "learning_rate": 2.4020344856200268e-05,
      "loss": 0.9763,
      "num_input_tokens_seen": 45645813136,
      "step": 58017
    },
    {
      "epoch": 6.155102906853385,
      "grad_norm": 0.6498252888603636,
      "learning_rate": 2.4019650421546112e-05,
      "loss": 0.9293,
      "num_input_tokens_seen": 45646599968,
      "step": 58018
    },
    {
      "epoch": 6.155208996392956,
      "grad_norm": 0.7914160474769315,
      "learning_rate": 2.4018955987649543e-05,
      "loss": 0.9849,
      "num_input_tokens_seen": 45647386688,
      "step": 58019
    },
    {
      "epoch": 6.155315085932527,
      "grad_norm": 1.5241848982126074,
      "learning_rate": 2.40182615545111e-05,
      "loss": 0.9677,
      "num_input_tokens_seen": 45648173504,
      "step": 58020
    },
    {
      "epoch": 6.155421175472099,
      "grad_norm": 0.9685263595243897,
      "learning_rate": 2.4017567122131314e-05,
      "loss": 0.9807,
      "num_input_tokens_seen": 45648960288,
      "step": 58021
    },
    {
      "epoch": 6.15552726501167,
      "grad_norm": 0.757299630289577,
      "learning_rate": 2.4016872690510726e-05,
      "loss": 0.9896,
      "num_input_tokens_seen": 45649747024,
      "step": 58022
    },
    {
      "epoch": 6.155633354551242,
      "grad_norm": 0.9889557961537722,
      "learning_rate": 2.4016178259649865e-05,
      "loss": 0.9184,
      "num_input_tokens_seen": 45650533792,
      "step": 58023
    },
    {
      "epoch": 6.155739444090813,
      "grad_norm": 0.9066458970653622,
      "learning_rate": 2.4015483829549273e-05,
      "loss": 1.015,
      "num_input_tokens_seen": 45651320512,
      "step": 58024
    },
    {
      "epoch": 6.155845533630384,
      "grad_norm": 0.8047648921079306,
      "learning_rate": 2.401478940020949e-05,
      "loss": 0.9629,
      "num_input_tokens_seen": 45652107392,
      "step": 58025
    },
    {
      "epoch": 6.155951623169956,
      "grad_norm": 1.1971132316252795,
      "learning_rate": 2.4014094971631048e-05,
      "loss": 0.966,
      "num_input_tokens_seen": 45652894112,
      "step": 58026
    },
    {
      "epoch": 6.156057712709527,
      "grad_norm": 0.7721465423922182,
      "learning_rate": 2.401340054381448e-05,
      "loss": 1.0706,
      "num_input_tokens_seen": 45653680880,
      "step": 58027
    },
    {
      "epoch": 6.1561638022490985,
      "grad_norm": 0.765048638082647,
      "learning_rate": 2.4012706116760332e-05,
      "loss": 1.044,
      "num_input_tokens_seen": 45654467712,
      "step": 58028
    },
    {
      "epoch": 6.15626989178867,
      "grad_norm": 1.1197592185785454,
      "learning_rate": 2.401201169046914e-05,
      "loss": 0.8985,
      "num_input_tokens_seen": 45655254544,
      "step": 58029
    },
    {
      "epoch": 6.156375981328241,
      "grad_norm": 0.832721890760261,
      "learning_rate": 2.4011317264941425e-05,
      "loss": 0.9864,
      "num_input_tokens_seen": 45656041280,
      "step": 58030
    },
    {
      "epoch": 6.1564820708678125,
      "grad_norm": 0.9433800650726097,
      "learning_rate": 2.401062284017774e-05,
      "loss": 1.0153,
      "num_input_tokens_seen": 45656828064,
      "step": 58031
    },
    {
      "epoch": 6.1565881604073835,
      "grad_norm": 1.2581944647883874,
      "learning_rate": 2.4009928416178616e-05,
      "loss": 0.9195,
      "num_input_tokens_seen": 45657614704,
      "step": 58032
    },
    {
      "epoch": 6.1566942499469555,
      "grad_norm": 0.8225468216515399,
      "learning_rate": 2.4009233992944595e-05,
      "loss": 1.0177,
      "num_input_tokens_seen": 45658401440,
      "step": 58033
    },
    {
      "epoch": 6.1568003394865265,
      "grad_norm": 0.716097603290317,
      "learning_rate": 2.4008539570476204e-05,
      "loss": 1.0169,
      "num_input_tokens_seen": 45659188240,
      "step": 58034
    },
    {
      "epoch": 6.156906429026098,
      "grad_norm": 1.1235494885412207,
      "learning_rate": 2.4007845148773982e-05,
      "loss": 1.0593,
      "num_input_tokens_seen": 45659974912,
      "step": 58035
    },
    {
      "epoch": 6.1570125185656694,
      "grad_norm": 0.764288478427209,
      "learning_rate": 2.4007150727838477e-05,
      "loss": 0.9143,
      "num_input_tokens_seen": 45660761744,
      "step": 58036
    },
    {
      "epoch": 6.1571186081052405,
      "grad_norm": 0.8948762045711816,
      "learning_rate": 2.400645630767021e-05,
      "loss": 1.0339,
      "num_input_tokens_seen": 45661548480,
      "step": 58037
    },
    {
      "epoch": 6.157224697644812,
      "grad_norm": 0.8822416389589501,
      "learning_rate": 2.4005761888269723e-05,
      "loss": 1.0336,
      "num_input_tokens_seen": 45662335232,
      "step": 58038
    },
    {
      "epoch": 6.157330787184383,
      "grad_norm": 0.7848605164971963,
      "learning_rate": 2.400506746963756e-05,
      "loss": 1.0253,
      "num_input_tokens_seen": 45663122096,
      "step": 58039
    },
    {
      "epoch": 6.157436876723955,
      "grad_norm": 0.8373185227593568,
      "learning_rate": 2.400437305177425e-05,
      "loss": 0.986,
      "num_input_tokens_seen": 45663908928,
      "step": 58040
    },
    {
      "epoch": 6.157542966263526,
      "grad_norm": 0.9866880540984536,
      "learning_rate": 2.400367863468033e-05,
      "loss": 1.0766,
      "num_input_tokens_seen": 45664695680,
      "step": 58041
    },
    {
      "epoch": 6.157649055803097,
      "grad_norm": 0.7006077699173479,
      "learning_rate": 2.400298421835634e-05,
      "loss": 0.9651,
      "num_input_tokens_seen": 45665482448,
      "step": 58042
    },
    {
      "epoch": 6.157755145342669,
      "grad_norm": 0.7182505054600862,
      "learning_rate": 2.4002289802802813e-05,
      "loss": 0.9692,
      "num_input_tokens_seen": 45666269168,
      "step": 58043
    },
    {
      "epoch": 6.15786123488224,
      "grad_norm": 0.7028397002330131,
      "learning_rate": 2.4001595388020284e-05,
      "loss": 0.9592,
      "num_input_tokens_seen": 45667056000,
      "step": 58044
    },
    {
      "epoch": 6.157967324421812,
      "grad_norm": 0.7875921435466868,
      "learning_rate": 2.4000900974009297e-05,
      "loss": 1.0548,
      "num_input_tokens_seen": 45667842736,
      "step": 58045
    },
    {
      "epoch": 6.158073413961383,
      "grad_norm": 0.80884123374552,
      "learning_rate": 2.400020656077038e-05,
      "loss": 1.0274,
      "num_input_tokens_seen": 45668629472,
      "step": 58046
    },
    {
      "epoch": 6.158179503500955,
      "grad_norm": 0.6519832698650554,
      "learning_rate": 2.399951214830408e-05,
      "loss": 0.9519,
      "num_input_tokens_seen": 45669416240,
      "step": 58047
    },
    {
      "epoch": 6.158285593040526,
      "grad_norm": 0.6329575521687841,
      "learning_rate": 2.3998817736610925e-05,
      "loss": 0.9647,
      "num_input_tokens_seen": 45670202992,
      "step": 58048
    },
    {
      "epoch": 6.158391682580097,
      "grad_norm": 0.7722221094767636,
      "learning_rate": 2.3998123325691452e-05,
      "loss": 0.9494,
      "num_input_tokens_seen": 45670989808,
      "step": 58049
    },
    {
      "epoch": 6.158497772119669,
      "grad_norm": 0.8688644863041376,
      "learning_rate": 2.39974289155462e-05,
      "loss": 0.9679,
      "num_input_tokens_seen": 45671776464,
      "step": 58050
    },
    {
      "epoch": 6.15860386165924,
      "grad_norm": 0.7949745846717156,
      "learning_rate": 2.399673450617571e-05,
      "loss": 1.0702,
      "num_input_tokens_seen": 45672563184,
      "step": 58051
    },
    {
      "epoch": 6.158709951198812,
      "grad_norm": 0.9906586599693792,
      "learning_rate": 2.399604009758051e-05,
      "loss": 1.0032,
      "num_input_tokens_seen": 45673350016,
      "step": 58052
    },
    {
      "epoch": 6.158816040738383,
      "grad_norm": 1.059040246832473,
      "learning_rate": 2.3995345689761145e-05,
      "loss": 1.0199,
      "num_input_tokens_seen": 45674136896,
      "step": 58053
    },
    {
      "epoch": 6.158922130277954,
      "grad_norm": 0.7875301075484898,
      "learning_rate": 2.3994651282718146e-05,
      "loss": 1.0146,
      "num_input_tokens_seen": 45674923632,
      "step": 58054
    },
    {
      "epoch": 6.159028219817526,
      "grad_norm": 1.7464355705214532,
      "learning_rate": 2.3993956876452045e-05,
      "loss": 0.981,
      "num_input_tokens_seen": 45675710480,
      "step": 58055
    },
    {
      "epoch": 6.159134309357097,
      "grad_norm": 1.015371326618867,
      "learning_rate": 2.3993262470963392e-05,
      "loss": 1.0303,
      "num_input_tokens_seen": 45676497120,
      "step": 58056
    },
    {
      "epoch": 6.159240398896669,
      "grad_norm": 0.8032533519803771,
      "learning_rate": 2.3992568066252715e-05,
      "loss": 0.9645,
      "num_input_tokens_seen": 45677283888,
      "step": 58057
    },
    {
      "epoch": 6.15934648843624,
      "grad_norm": 0.8644065447435102,
      "learning_rate": 2.3991873662320546e-05,
      "loss": 0.9571,
      "num_input_tokens_seen": 45678070688,
      "step": 58058
    },
    {
      "epoch": 6.159452577975811,
      "grad_norm": 1.7062882254071918,
      "learning_rate": 2.3991179259167434e-05,
      "loss": 0.9954,
      "num_input_tokens_seen": 45678857440,
      "step": 58059
    },
    {
      "epoch": 6.159558667515383,
      "grad_norm": 1.2119483205151786,
      "learning_rate": 2.399048485679391e-05,
      "loss": 1.0403,
      "num_input_tokens_seen": 45679644144,
      "step": 58060
    },
    {
      "epoch": 6.159664757054954,
      "grad_norm": 0.9095140278288494,
      "learning_rate": 2.3989790455200505e-05,
      "loss": 0.9847,
      "num_input_tokens_seen": 45680430960,
      "step": 58061
    },
    {
      "epoch": 6.159770846594526,
      "grad_norm": 1.7068523296489522,
      "learning_rate": 2.398909605438776e-05,
      "loss": 1.0414,
      "num_input_tokens_seen": 45681217648,
      "step": 58062
    },
    {
      "epoch": 6.159876936134097,
      "grad_norm": 1.4621450122762334,
      "learning_rate": 2.3988401654356213e-05,
      "loss": 1.0644,
      "num_input_tokens_seen": 45682004496,
      "step": 58063
    },
    {
      "epoch": 6.159983025673669,
      "grad_norm": 1.0819785415352394,
      "learning_rate": 2.39877072551064e-05,
      "loss": 1.0058,
      "num_input_tokens_seen": 45682791216,
      "step": 58064
    },
    {
      "epoch": 6.16008911521324,
      "grad_norm": 1.0174491162260917,
      "learning_rate": 2.398701285663886e-05,
      "loss": 0.9864,
      "num_input_tokens_seen": 45683577984,
      "step": 58065
    },
    {
      "epoch": 6.160195204752811,
      "grad_norm": 1.0201337925118126,
      "learning_rate": 2.398631845895412e-05,
      "loss": 1.0297,
      "num_input_tokens_seen": 45684364640,
      "step": 58066
    },
    {
      "epoch": 6.160301294292383,
      "grad_norm": 0.9931079034304151,
      "learning_rate": 2.398562406205273e-05,
      "loss": 0.9589,
      "num_input_tokens_seen": 45685151360,
      "step": 58067
    },
    {
      "epoch": 6.160407383831954,
      "grad_norm": 0.8498219462953859,
      "learning_rate": 2.398492966593522e-05,
      "loss": 1.0016,
      "num_input_tokens_seen": 45685938096,
      "step": 58068
    },
    {
      "epoch": 6.160513473371526,
      "grad_norm": 1.7787942679310715,
      "learning_rate": 2.398423527060212e-05,
      "loss": 0.9716,
      "num_input_tokens_seen": 45686724864,
      "step": 58069
    },
    {
      "epoch": 6.160619562911097,
      "grad_norm": 1.3343771858852915,
      "learning_rate": 2.398354087605398e-05,
      "loss": 0.9385,
      "num_input_tokens_seen": 45687511616,
      "step": 58070
    },
    {
      "epoch": 6.160725652450668,
      "grad_norm": 1.3585210852567893,
      "learning_rate": 2.398284648229133e-05,
      "loss": 0.9807,
      "num_input_tokens_seen": 45688298448,
      "step": 58071
    },
    {
      "epoch": 6.16083174199024,
      "grad_norm": 1.2992373033741869,
      "learning_rate": 2.39821520893147e-05,
      "loss": 1.0138,
      "num_input_tokens_seen": 45689085248,
      "step": 58072
    },
    {
      "epoch": 6.160937831529811,
      "grad_norm": 2.580625807457347,
      "learning_rate": 2.3981457697124636e-05,
      "loss": 0.9578,
      "num_input_tokens_seen": 45689872048,
      "step": 58073
    },
    {
      "epoch": 6.161043921069383,
      "grad_norm": 1.7862296480448272,
      "learning_rate": 2.3980763305721677e-05,
      "loss": 0.9225,
      "num_input_tokens_seen": 45690658896,
      "step": 58074
    },
    {
      "epoch": 6.161150010608954,
      "grad_norm": 0.8593758645746663,
      "learning_rate": 2.3980068915106343e-05,
      "loss": 0.9567,
      "num_input_tokens_seen": 45691445680,
      "step": 58075
    },
    {
      "epoch": 6.161256100148526,
      "grad_norm": 0.7841163103857313,
      "learning_rate": 2.397937452527919e-05,
      "loss": 0.9677,
      "num_input_tokens_seen": 45692232448,
      "step": 58076
    },
    {
      "epoch": 6.161362189688097,
      "grad_norm": 1.5407703156857544,
      "learning_rate": 2.3978680136240747e-05,
      "loss": 0.969,
      "num_input_tokens_seen": 45693019184,
      "step": 58077
    },
    {
      "epoch": 6.161468279227668,
      "grad_norm": 0.9315539196955401,
      "learning_rate": 2.3977985747991545e-05,
      "loss": 0.9607,
      "num_input_tokens_seen": 45693805936,
      "step": 58078
    },
    {
      "epoch": 6.16157436876724,
      "grad_norm": 0.8808240406226655,
      "learning_rate": 2.3977291360532127e-05,
      "loss": 0.9421,
      "num_input_tokens_seen": 45694592688,
      "step": 58079
    },
    {
      "epoch": 6.161680458306811,
      "grad_norm": 0.883277998291195,
      "learning_rate": 2.397659697386303e-05,
      "loss": 0.9894,
      "num_input_tokens_seen": 45695379456,
      "step": 58080
    },
    {
      "epoch": 6.161786547846383,
      "grad_norm": 1.0981672457714182,
      "learning_rate": 2.3975902587984787e-05,
      "loss": 1.1377,
      "num_input_tokens_seen": 45696166144,
      "step": 58081
    },
    {
      "epoch": 6.161892637385954,
      "grad_norm": 0.7949241156481327,
      "learning_rate": 2.3975208202897932e-05,
      "loss": 1.0046,
      "num_input_tokens_seen": 45696952864,
      "step": 58082
    },
    {
      "epoch": 6.161998726925525,
      "grad_norm": 1.002760400016808,
      "learning_rate": 2.3974513818603013e-05,
      "loss": 1.0109,
      "num_input_tokens_seen": 45697739552,
      "step": 58083
    },
    {
      "epoch": 6.162104816465097,
      "grad_norm": 0.7804274184373471,
      "learning_rate": 2.3973819435100553e-05,
      "loss": 1.0298,
      "num_input_tokens_seen": 45698526352,
      "step": 58084
    },
    {
      "epoch": 6.162210906004668,
      "grad_norm": 0.7273281994412247,
      "learning_rate": 2.3973125052391103e-05,
      "loss": 1.0252,
      "num_input_tokens_seen": 45699313072,
      "step": 58085
    },
    {
      "epoch": 6.16231699554424,
      "grad_norm": 0.854536722272534,
      "learning_rate": 2.397243067047519e-05,
      "loss": 0.9464,
      "num_input_tokens_seen": 45700099888,
      "step": 58086
    },
    {
      "epoch": 6.162423085083811,
      "grad_norm": 0.6979345128762847,
      "learning_rate": 2.397173628935335e-05,
      "loss": 0.9918,
      "num_input_tokens_seen": 45700886592,
      "step": 58087
    },
    {
      "epoch": 6.162529174623382,
      "grad_norm": 0.9716861912981282,
      "learning_rate": 2.3971041909026123e-05,
      "loss": 0.9755,
      "num_input_tokens_seen": 45701673376,
      "step": 58088
    },
    {
      "epoch": 6.162635264162954,
      "grad_norm": 0.6265690688430673,
      "learning_rate": 2.397034752949405e-05,
      "loss": 1.0389,
      "num_input_tokens_seen": 45702460128,
      "step": 58089
    },
    {
      "epoch": 6.162741353702525,
      "grad_norm": 1.1274772268455504,
      "learning_rate": 2.3969653150757655e-05,
      "loss": 1.0316,
      "num_input_tokens_seen": 45703246800,
      "step": 58090
    },
    {
      "epoch": 6.1628474432420965,
      "grad_norm": 0.8040744187549981,
      "learning_rate": 2.3968958772817485e-05,
      "loss": 1.0125,
      "num_input_tokens_seen": 45704033616,
      "step": 58091
    },
    {
      "epoch": 6.162953532781668,
      "grad_norm": 0.837317588351676,
      "learning_rate": 2.3968264395674074e-05,
      "loss": 1.0472,
      "num_input_tokens_seen": 45704820336,
      "step": 58092
    },
    {
      "epoch": 6.1630596223212395,
      "grad_norm": 0.7640059098006953,
      "learning_rate": 2.3967570019327952e-05,
      "loss": 1.0103,
      "num_input_tokens_seen": 45705607136,
      "step": 58093
    },
    {
      "epoch": 6.1631657118608105,
      "grad_norm": 0.8620394346853959,
      "learning_rate": 2.3966875643779667e-05,
      "loss": 0.9522,
      "num_input_tokens_seen": 45706393856,
      "step": 58094
    },
    {
      "epoch": 6.1632718014003816,
      "grad_norm": 0.8626128057827077,
      "learning_rate": 2.3966181269029752e-05,
      "loss": 1.0461,
      "num_input_tokens_seen": 45707180608,
      "step": 58095
    },
    {
      "epoch": 6.1633778909399535,
      "grad_norm": 0.8327948163621931,
      "learning_rate": 2.3965486895078738e-05,
      "loss": 0.9711,
      "num_input_tokens_seen": 45707967360,
      "step": 58096
    },
    {
      "epoch": 6.1634839804795245,
      "grad_norm": 0.8826303968500743,
      "learning_rate": 2.3964792521927166e-05,
      "loss": 0.9909,
      "num_input_tokens_seen": 45708754176,
      "step": 58097
    },
    {
      "epoch": 6.163590070019096,
      "grad_norm": 0.7315451931252208,
      "learning_rate": 2.3964098149575577e-05,
      "loss": 0.8438,
      "num_input_tokens_seen": 45709541072,
      "step": 58098
    },
    {
      "epoch": 6.1636961595586675,
      "grad_norm": 0.745593933627829,
      "learning_rate": 2.3963403778024495e-05,
      "loss": 0.9643,
      "num_input_tokens_seen": 45710327776,
      "step": 58099
    },
    {
      "epoch": 6.1638022490982385,
      "grad_norm": 0.7943174979621452,
      "learning_rate": 2.396270940727447e-05,
      "loss": 1.0297,
      "num_input_tokens_seen": 45711114512,
      "step": 58100
    },
    {
      "epoch": 6.16390833863781,
      "grad_norm": 1.0425760236794275,
      "learning_rate": 2.3962015037326028e-05,
      "loss": 1.0,
      "num_input_tokens_seen": 45711901344,
      "step": 58101
    },
    {
      "epoch": 6.164014428177381,
      "grad_norm": 0.865324546458606,
      "learning_rate": 2.3961320668179713e-05,
      "loss": 1.012,
      "num_input_tokens_seen": 45712688144,
      "step": 58102
    },
    {
      "epoch": 6.164120517716953,
      "grad_norm": 1.113108290580634,
      "learning_rate": 2.396062629983606e-05,
      "loss": 1.0533,
      "num_input_tokens_seen": 45713474832,
      "step": 58103
    },
    {
      "epoch": 6.164226607256524,
      "grad_norm": 0.889233720557647,
      "learning_rate": 2.3959931932295598e-05,
      "loss": 0.9748,
      "num_input_tokens_seen": 45714261504,
      "step": 58104
    },
    {
      "epoch": 6.164332696796096,
      "grad_norm": 0.7414001101795283,
      "learning_rate": 2.3959237565558878e-05,
      "loss": 0.9571,
      "num_input_tokens_seen": 45715048352,
      "step": 58105
    },
    {
      "epoch": 6.164438786335667,
      "grad_norm": 0.9474790249312517,
      "learning_rate": 2.3958543199626427e-05,
      "loss": 0.941,
      "num_input_tokens_seen": 45715835056,
      "step": 58106
    },
    {
      "epoch": 6.164544875875238,
      "grad_norm": 0.7980229701422062,
      "learning_rate": 2.3957848834498778e-05,
      "loss": 0.9781,
      "num_input_tokens_seen": 45716621824,
      "step": 58107
    },
    {
      "epoch": 6.16465096541481,
      "grad_norm": 0.8957000590096857,
      "learning_rate": 2.395715447017648e-05,
      "loss": 1.0715,
      "num_input_tokens_seen": 45717408592,
      "step": 58108
    },
    {
      "epoch": 6.164757054954381,
      "grad_norm": 1.0630885448590697,
      "learning_rate": 2.395646010666006e-05,
      "loss": 1.0079,
      "num_input_tokens_seen": 45718195376,
      "step": 58109
    },
    {
      "epoch": 6.164863144493953,
      "grad_norm": 0.9648936614981263,
      "learning_rate": 2.3955765743950054e-05,
      "loss": 0.9712,
      "num_input_tokens_seen": 45718982176,
      "step": 58110
    },
    {
      "epoch": 6.164969234033524,
      "grad_norm": 0.7983815765945806,
      "learning_rate": 2.3955071382047005e-05,
      "loss": 0.985,
      "num_input_tokens_seen": 45719768992,
      "step": 58111
    },
    {
      "epoch": 6.165075323573095,
      "grad_norm": 0.7313705786475487,
      "learning_rate": 2.3954377020951447e-05,
      "loss": 0.9276,
      "num_input_tokens_seen": 45720555744,
      "step": 58112
    },
    {
      "epoch": 6.165181413112667,
      "grad_norm": 0.8753902058822219,
      "learning_rate": 2.3953682660663908e-05,
      "loss": 1.0258,
      "num_input_tokens_seen": 45721342480,
      "step": 58113
    },
    {
      "epoch": 6.165287502652238,
      "grad_norm": 0.6746273589695571,
      "learning_rate": 2.3952988301184943e-05,
      "loss": 0.9699,
      "num_input_tokens_seen": 45722129216,
      "step": 58114
    },
    {
      "epoch": 6.16539359219181,
      "grad_norm": 0.691664799197275,
      "learning_rate": 2.3952293942515074e-05,
      "loss": 1.0664,
      "num_input_tokens_seen": 45722915968,
      "step": 58115
    },
    {
      "epoch": 6.165499681731381,
      "grad_norm": 0.7289883915333566,
      "learning_rate": 2.395159958465484e-05,
      "loss": 0.9806,
      "num_input_tokens_seen": 45723702704,
      "step": 58116
    },
    {
      "epoch": 6.165605771270953,
      "grad_norm": 0.723438747483564,
      "learning_rate": 2.3950905227604778e-05,
      "loss": 1.0667,
      "num_input_tokens_seen": 45724489536,
      "step": 58117
    },
    {
      "epoch": 6.165711860810524,
      "grad_norm": 0.8101657928525792,
      "learning_rate": 2.3950210871365426e-05,
      "loss": 0.9881,
      "num_input_tokens_seen": 45725276304,
      "step": 58118
    },
    {
      "epoch": 6.165817950350095,
      "grad_norm": 0.7452722833984415,
      "learning_rate": 2.394951651593732e-05,
      "loss": 1.0223,
      "num_input_tokens_seen": 45726063088,
      "step": 58119
    },
    {
      "epoch": 6.165924039889667,
      "grad_norm": 0.9253012214607341,
      "learning_rate": 2.3948822161321003e-05,
      "loss": 1.0301,
      "num_input_tokens_seen": 45726849840,
      "step": 58120
    },
    {
      "epoch": 6.166030129429238,
      "grad_norm": 0.838575461310267,
      "learning_rate": 2.3948127807516996e-05,
      "loss": 0.9597,
      "num_input_tokens_seen": 45727636560,
      "step": 58121
    },
    {
      "epoch": 6.16613621896881,
      "grad_norm": 0.9430660229887488,
      "learning_rate": 2.3947433454525853e-05,
      "loss": 1.0365,
      "num_input_tokens_seen": 45728423296,
      "step": 58122
    },
    {
      "epoch": 6.166242308508381,
      "grad_norm": 0.747855049597046,
      "learning_rate": 2.39467391023481e-05,
      "loss": 0.99,
      "num_input_tokens_seen": 45729209984,
      "step": 58123
    },
    {
      "epoch": 6.166348398047952,
      "grad_norm": 1.006621061269382,
      "learning_rate": 2.394604475098427e-05,
      "loss": 1.0229,
      "num_input_tokens_seen": 45729996752,
      "step": 58124
    },
    {
      "epoch": 6.166454487587524,
      "grad_norm": 1.1011831140463215,
      "learning_rate": 2.3945350400434917e-05,
      "loss": 1.0316,
      "num_input_tokens_seen": 45730783488,
      "step": 58125
    },
    {
      "epoch": 6.166560577127095,
      "grad_norm": 1.053946107974132,
      "learning_rate": 2.394465605070056e-05,
      "loss": 1.0807,
      "num_input_tokens_seen": 45731570224,
      "step": 58126
    },
    {
      "epoch": 6.166666666666667,
      "grad_norm": 0.7661872109987119,
      "learning_rate": 2.3943961701781738e-05,
      "loss": 1.0792,
      "num_input_tokens_seen": 45732356960,
      "step": 58127
    },
    {
      "epoch": 6.166772756206238,
      "grad_norm": 0.7274546869538708,
      "learning_rate": 2.3943267353678998e-05,
      "loss": 0.9065,
      "num_input_tokens_seen": 45733143680,
      "step": 58128
    },
    {
      "epoch": 6.16687884574581,
      "grad_norm": 0.7970719290881461,
      "learning_rate": 2.394257300639287e-05,
      "loss": 1.0182,
      "num_input_tokens_seen": 45733930432,
      "step": 58129
    },
    {
      "epoch": 6.166984935285381,
      "grad_norm": 0.720926549753488,
      "learning_rate": 2.3941878659923883e-05,
      "loss": 1.064,
      "num_input_tokens_seen": 45734717216,
      "step": 58130
    },
    {
      "epoch": 6.167091024824952,
      "grad_norm": 0.841147407528473,
      "learning_rate": 2.3941184314272588e-05,
      "loss": 1.0203,
      "num_input_tokens_seen": 45735503952,
      "step": 58131
    },
    {
      "epoch": 6.167197114364524,
      "grad_norm": 0.7362713155009016,
      "learning_rate": 2.3940489969439514e-05,
      "loss": 0.9529,
      "num_input_tokens_seen": 45736290688,
      "step": 58132
    },
    {
      "epoch": 6.167303203904095,
      "grad_norm": 0.7852561577532363,
      "learning_rate": 2.3939795625425195e-05,
      "loss": 0.9756,
      "num_input_tokens_seen": 45737077408,
      "step": 58133
    },
    {
      "epoch": 6.167409293443667,
      "grad_norm": 0.7452529774665039,
      "learning_rate": 2.3939101282230174e-05,
      "loss": 1.0533,
      "num_input_tokens_seen": 45737864128,
      "step": 58134
    },
    {
      "epoch": 6.167515382983238,
      "grad_norm": 0.7906887410947082,
      "learning_rate": 2.393840693985498e-05,
      "loss": 1.0122,
      "num_input_tokens_seen": 45738650912,
      "step": 58135
    },
    {
      "epoch": 6.167621472522809,
      "grad_norm": 0.7241009488851133,
      "learning_rate": 2.393771259830016e-05,
      "loss": 0.9824,
      "num_input_tokens_seen": 45739437648,
      "step": 58136
    },
    {
      "epoch": 6.167727562062381,
      "grad_norm": 0.867727045415509,
      "learning_rate": 2.3937018257566243e-05,
      "loss": 1.0278,
      "num_input_tokens_seen": 45740224400,
      "step": 58137
    },
    {
      "epoch": 6.167833651601952,
      "grad_norm": 0.7278927784233531,
      "learning_rate": 2.3936323917653763e-05,
      "loss": 1.0338,
      "num_input_tokens_seen": 45741011216,
      "step": 58138
    },
    {
      "epoch": 6.167939741141524,
      "grad_norm": 1.044841174165707,
      "learning_rate": 2.3935629578563264e-05,
      "loss": 0.9461,
      "num_input_tokens_seen": 45741797952,
      "step": 58139
    },
    {
      "epoch": 6.168045830681095,
      "grad_norm": 0.7644010426256099,
      "learning_rate": 2.393493524029528e-05,
      "loss": 0.9893,
      "num_input_tokens_seen": 45742584656,
      "step": 58140
    },
    {
      "epoch": 6.168151920220666,
      "grad_norm": 0.6844742980521017,
      "learning_rate": 2.3934240902850343e-05,
      "loss": 1.0314,
      "num_input_tokens_seen": 45743371360,
      "step": 58141
    },
    {
      "epoch": 6.168258009760238,
      "grad_norm": 0.7472283577646394,
      "learning_rate": 2.3933546566229e-05,
      "loss": 1.0628,
      "num_input_tokens_seen": 45744158176,
      "step": 58142
    },
    {
      "epoch": 6.168364099299809,
      "grad_norm": 0.8104382621713779,
      "learning_rate": 2.393285223043178e-05,
      "loss": 1.021,
      "num_input_tokens_seen": 45744944912,
      "step": 58143
    },
    {
      "epoch": 6.168470188839381,
      "grad_norm": 0.7955208054100696,
      "learning_rate": 2.3932157895459213e-05,
      "loss": 1.0101,
      "num_input_tokens_seen": 45745731696,
      "step": 58144
    },
    {
      "epoch": 6.168576278378952,
      "grad_norm": 0.8584829431416606,
      "learning_rate": 2.393146356131185e-05,
      "loss": 0.9946,
      "num_input_tokens_seen": 45746518448,
      "step": 58145
    },
    {
      "epoch": 6.168682367918524,
      "grad_norm": 0.7145072603342,
      "learning_rate": 2.3930769227990217e-05,
      "loss": 0.9784,
      "num_input_tokens_seen": 45747305168,
      "step": 58146
    },
    {
      "epoch": 6.168788457458095,
      "grad_norm": 0.8106388882459554,
      "learning_rate": 2.3930074895494852e-05,
      "loss": 0.9772,
      "num_input_tokens_seen": 45748091920,
      "step": 58147
    },
    {
      "epoch": 6.168894546997666,
      "grad_norm": 0.7033125046496149,
      "learning_rate": 2.39293805638263e-05,
      "loss": 0.9828,
      "num_input_tokens_seen": 45748878688,
      "step": 58148
    },
    {
      "epoch": 6.169000636537238,
      "grad_norm": 0.7824981968214877,
      "learning_rate": 2.3928686232985084e-05,
      "loss": 1.03,
      "num_input_tokens_seen": 45749665408,
      "step": 58149
    },
    {
      "epoch": 6.169106726076809,
      "grad_norm": 0.6752400814017137,
      "learning_rate": 2.3927991902971756e-05,
      "loss": 1.0526,
      "num_input_tokens_seen": 45750452176,
      "step": 58150
    },
    {
      "epoch": 6.169212815616381,
      "grad_norm": 0.7484375068745577,
      "learning_rate": 2.3927297573786843e-05,
      "loss": 1.0742,
      "num_input_tokens_seen": 45751238944,
      "step": 58151
    },
    {
      "epoch": 6.169318905155952,
      "grad_norm": 0.6490282989244341,
      "learning_rate": 2.3926603245430877e-05,
      "loss": 1.0423,
      "num_input_tokens_seen": 45752025632,
      "step": 58152
    },
    {
      "epoch": 6.169424994695523,
      "grad_norm": 0.7594212151683952,
      "learning_rate": 2.3925908917904403e-05,
      "loss": 1.0626,
      "num_input_tokens_seen": 45752812320,
      "step": 58153
    },
    {
      "epoch": 6.1695310842350946,
      "grad_norm": 0.7468453060654622,
      "learning_rate": 2.3925214591207958e-05,
      "loss": 1.0421,
      "num_input_tokens_seen": 45753599008,
      "step": 58154
    },
    {
      "epoch": 6.169637173774666,
      "grad_norm": 0.8158740534794802,
      "learning_rate": 2.3924520265342072e-05,
      "loss": 0.9843,
      "num_input_tokens_seen": 45754385824,
      "step": 58155
    },
    {
      "epoch": 6.1697432633142375,
      "grad_norm": 0.8868099908453874,
      "learning_rate": 2.392382594030729e-05,
      "loss": 1.0885,
      "num_input_tokens_seen": 45755172432,
      "step": 58156
    },
    {
      "epoch": 6.1698493528538085,
      "grad_norm": 0.9265127516429328,
      "learning_rate": 2.3923131616104142e-05,
      "loss": 0.9822,
      "num_input_tokens_seen": 45755959184,
      "step": 58157
    },
    {
      "epoch": 6.1699554423933805,
      "grad_norm": 1.0963422113281098,
      "learning_rate": 2.392243729273316e-05,
      "loss": 1.0241,
      "num_input_tokens_seen": 45756745920,
      "step": 58158
    },
    {
      "epoch": 6.1700615319329515,
      "grad_norm": 0.7221361876973151,
      "learning_rate": 2.3921742970194892e-05,
      "loss": 1.0744,
      "num_input_tokens_seen": 45757532704,
      "step": 58159
    },
    {
      "epoch": 6.1701676214725225,
      "grad_norm": 0.7991399044872138,
      "learning_rate": 2.3921048648489873e-05,
      "loss": 0.8173,
      "num_input_tokens_seen": 45758319488,
      "step": 58160
    },
    {
      "epoch": 6.170273711012094,
      "grad_norm": 1.3822094919889916,
      "learning_rate": 2.392035432761863e-05,
      "loss": 0.9954,
      "num_input_tokens_seen": 45759106272,
      "step": 58161
    },
    {
      "epoch": 6.1703798005516655,
      "grad_norm": 0.8082107883553498,
      "learning_rate": 2.3919660007581705e-05,
      "loss": 0.9895,
      "num_input_tokens_seen": 45759893136,
      "step": 58162
    },
    {
      "epoch": 6.170485890091237,
      "grad_norm": 1.060228994843851,
      "learning_rate": 2.391896568837964e-05,
      "loss": 0.9684,
      "num_input_tokens_seen": 45760679872,
      "step": 58163
    },
    {
      "epoch": 6.170591979630808,
      "grad_norm": 1.033623314300738,
      "learning_rate": 2.391827137001296e-05,
      "loss": 0.9972,
      "num_input_tokens_seen": 45761466800,
      "step": 58164
    },
    {
      "epoch": 6.170698069170379,
      "grad_norm": 0.6407046568749037,
      "learning_rate": 2.391757705248222e-05,
      "loss": 1.0284,
      "num_input_tokens_seen": 45762253648,
      "step": 58165
    },
    {
      "epoch": 6.170804158709951,
      "grad_norm": 0.8972198603168167,
      "learning_rate": 2.3916882735787928e-05,
      "loss": 1.0375,
      "num_input_tokens_seen": 45763040336,
      "step": 58166
    },
    {
      "epoch": 6.170910248249522,
      "grad_norm": 0.956616131660179,
      "learning_rate": 2.3916188419930648e-05,
      "loss": 0.9586,
      "num_input_tokens_seen": 45763827056,
      "step": 58167
    },
    {
      "epoch": 6.171016337789094,
      "grad_norm": 0.7157712226775953,
      "learning_rate": 2.3915494104910907e-05,
      "loss": 0.9951,
      "num_input_tokens_seen": 45764613792,
      "step": 58168
    },
    {
      "epoch": 6.171122427328665,
      "grad_norm": 1.1740376762222713,
      "learning_rate": 2.3914799790729235e-05,
      "loss": 0.9829,
      "num_input_tokens_seen": 45765400544,
      "step": 58169
    },
    {
      "epoch": 6.171228516868236,
      "grad_norm": 0.8744208894407651,
      "learning_rate": 2.391410547738618e-05,
      "loss": 1.0694,
      "num_input_tokens_seen": 45766187312,
      "step": 58170
    },
    {
      "epoch": 6.171334606407808,
      "grad_norm": 0.850545814816113,
      "learning_rate": 2.391341116488227e-05,
      "loss": 1.0194,
      "num_input_tokens_seen": 45766974080,
      "step": 58171
    },
    {
      "epoch": 6.171440695947379,
      "grad_norm": 1.1145520775044846,
      "learning_rate": 2.3912716853218035e-05,
      "loss": 1.0082,
      "num_input_tokens_seen": 45767760816,
      "step": 58172
    },
    {
      "epoch": 6.171546785486951,
      "grad_norm": 0.7744210761022551,
      "learning_rate": 2.3912022542394032e-05,
      "loss": 0.9654,
      "num_input_tokens_seen": 45768547520,
      "step": 58173
    },
    {
      "epoch": 6.171652875026522,
      "grad_norm": 1.0509361166178983,
      "learning_rate": 2.3911328232410783e-05,
      "loss": 1.0594,
      "num_input_tokens_seen": 45769334304,
      "step": 58174
    },
    {
      "epoch": 6.171758964566094,
      "grad_norm": 0.7111091161017102,
      "learning_rate": 2.3910633923268828e-05,
      "loss": 1.0625,
      "num_input_tokens_seen": 45770121056,
      "step": 58175
    },
    {
      "epoch": 6.171865054105665,
      "grad_norm": 0.7239700298140174,
      "learning_rate": 2.39099396149687e-05,
      "loss": 0.9534,
      "num_input_tokens_seen": 45770907728,
      "step": 58176
    },
    {
      "epoch": 6.171971143645236,
      "grad_norm": 0.7293528881318272,
      "learning_rate": 2.3909245307510932e-05,
      "loss": 0.9492,
      "num_input_tokens_seen": 45771694528,
      "step": 58177
    },
    {
      "epoch": 6.172077233184808,
      "grad_norm": 0.8346701049476855,
      "learning_rate": 2.390855100089608e-05,
      "loss": 0.9518,
      "num_input_tokens_seen": 45772481360,
      "step": 58178
    },
    {
      "epoch": 6.172183322724379,
      "grad_norm": 0.7970542934377376,
      "learning_rate": 2.3907856695124657e-05,
      "loss": 1.0069,
      "num_input_tokens_seen": 45773268160,
      "step": 58179
    },
    {
      "epoch": 6.172289412263951,
      "grad_norm": 0.8428160896331791,
      "learning_rate": 2.3907162390197223e-05,
      "loss": 1.0014,
      "num_input_tokens_seen": 45774054832,
      "step": 58180
    },
    {
      "epoch": 6.172395501803522,
      "grad_norm": 0.8137799122171054,
      "learning_rate": 2.3906468086114294e-05,
      "loss": 0.9791,
      "num_input_tokens_seen": 45774841552,
      "step": 58181
    },
    {
      "epoch": 6.172501591343093,
      "grad_norm": 0.8292207557844027,
      "learning_rate": 2.3905773782876416e-05,
      "loss": 0.9649,
      "num_input_tokens_seen": 45775628384,
      "step": 58182
    },
    {
      "epoch": 6.172607680882665,
      "grad_norm": 0.7238214357257248,
      "learning_rate": 2.3905079480484124e-05,
      "loss": 0.9597,
      "num_input_tokens_seen": 45776415120,
      "step": 58183
    },
    {
      "epoch": 6.172713770422236,
      "grad_norm": 0.8293030727411113,
      "learning_rate": 2.3904385178937956e-05,
      "loss": 1.0046,
      "num_input_tokens_seen": 45777201872,
      "step": 58184
    },
    {
      "epoch": 6.172819859961808,
      "grad_norm": 0.6979911038229236,
      "learning_rate": 2.3903690878238443e-05,
      "loss": 0.9325,
      "num_input_tokens_seen": 45777988688,
      "step": 58185
    },
    {
      "epoch": 6.172925949501379,
      "grad_norm": 0.6629591343203054,
      "learning_rate": 2.390299657838613e-05,
      "loss": 0.8851,
      "num_input_tokens_seen": 45778775520,
      "step": 58186
    },
    {
      "epoch": 6.173032039040951,
      "grad_norm": 0.6893239349370047,
      "learning_rate": 2.3902302279381544e-05,
      "loss": 1.0403,
      "num_input_tokens_seen": 45779562208,
      "step": 58187
    },
    {
      "epoch": 6.173138128580522,
      "grad_norm": 0.761836468177033,
      "learning_rate": 2.390160798122523e-05,
      "loss": 1.0562,
      "num_input_tokens_seen": 45780348944,
      "step": 58188
    },
    {
      "epoch": 6.173244218120093,
      "grad_norm": 1.2398819874859668,
      "learning_rate": 2.3900913683917725e-05,
      "loss": 1.0347,
      "num_input_tokens_seen": 45781135776,
      "step": 58189
    },
    {
      "epoch": 6.173350307659665,
      "grad_norm": 0.9992283008303091,
      "learning_rate": 2.3900219387459552e-05,
      "loss": 1.0109,
      "num_input_tokens_seen": 45781922656,
      "step": 58190
    },
    {
      "epoch": 6.173456397199236,
      "grad_norm": 0.7568759576843833,
      "learning_rate": 2.3899525091851266e-05,
      "loss": 0.9901,
      "num_input_tokens_seen": 45782709376,
      "step": 58191
    },
    {
      "epoch": 6.173562486738808,
      "grad_norm": 0.6957039936721962,
      "learning_rate": 2.389883079709339e-05,
      "loss": 1.0235,
      "num_input_tokens_seen": 45783496192,
      "step": 58192
    },
    {
      "epoch": 6.173668576278379,
      "grad_norm": 1.214595071953028,
      "learning_rate": 2.3898136503186467e-05,
      "loss": 1.0008,
      "num_input_tokens_seen": 45784282976,
      "step": 58193
    },
    {
      "epoch": 6.17377466581795,
      "grad_norm": 0.8363382990968214,
      "learning_rate": 2.3897442210131033e-05,
      "loss": 1.0814,
      "num_input_tokens_seen": 45785069744,
      "step": 58194
    },
    {
      "epoch": 6.173880755357522,
      "grad_norm": 0.807086786631297,
      "learning_rate": 2.3896747917927623e-05,
      "loss": 1.0048,
      "num_input_tokens_seen": 45785856448,
      "step": 58195
    },
    {
      "epoch": 6.173986844897093,
      "grad_norm": 0.7576071356438794,
      "learning_rate": 2.389605362657677e-05,
      "loss": 0.9919,
      "num_input_tokens_seen": 45786643184,
      "step": 58196
    },
    {
      "epoch": 6.174092934436665,
      "grad_norm": 0.9400953303962865,
      "learning_rate": 2.3895359336079017e-05,
      "loss": 1.0339,
      "num_input_tokens_seen": 45787429936,
      "step": 58197
    },
    {
      "epoch": 6.174199023976236,
      "grad_norm": 0.7893186257751746,
      "learning_rate": 2.38946650464349e-05,
      "loss": 1.076,
      "num_input_tokens_seen": 45788216688,
      "step": 58198
    },
    {
      "epoch": 6.174305113515807,
      "grad_norm": 0.8707036886920541,
      "learning_rate": 2.3893970757644947e-05,
      "loss": 1.0205,
      "num_input_tokens_seen": 45789003424,
      "step": 58199
    },
    {
      "epoch": 6.174411203055379,
      "grad_norm": 0.8182118639240538,
      "learning_rate": 2.3893276469709708e-05,
      "loss": 0.9857,
      "num_input_tokens_seen": 45789790192,
      "step": 58200
    },
    {
      "epoch": 6.17451729259495,
      "grad_norm": 0.8268162459360978,
      "learning_rate": 2.3892582182629712e-05,
      "loss": 1.0195,
      "num_input_tokens_seen": 45790577024,
      "step": 58201
    },
    {
      "epoch": 6.174623382134522,
      "grad_norm": 0.7255638300495861,
      "learning_rate": 2.389188789640549e-05,
      "loss": 0.8906,
      "num_input_tokens_seen": 45791363824,
      "step": 58202
    },
    {
      "epoch": 6.174729471674093,
      "grad_norm": 1.2111488807907769,
      "learning_rate": 2.389119361103759e-05,
      "loss": 1.0262,
      "num_input_tokens_seen": 45792150624,
      "step": 58203
    },
    {
      "epoch": 6.174835561213665,
      "grad_norm": 0.8128860768378697,
      "learning_rate": 2.3890499326526537e-05,
      "loss": 0.953,
      "num_input_tokens_seen": 45792937440,
      "step": 58204
    },
    {
      "epoch": 6.174941650753236,
      "grad_norm": 0.7220992862335033,
      "learning_rate": 2.3889805042872877e-05,
      "loss": 0.9696,
      "num_input_tokens_seen": 45793724352,
      "step": 58205
    },
    {
      "epoch": 6.175047740292807,
      "grad_norm": 0.7109046154466881,
      "learning_rate": 2.388911076007715e-05,
      "loss": 1.018,
      "num_input_tokens_seen": 45794511264,
      "step": 58206
    },
    {
      "epoch": 6.175153829832379,
      "grad_norm": 0.8331375642487158,
      "learning_rate": 2.3888416478139874e-05,
      "loss": 0.9422,
      "num_input_tokens_seen": 45795297984,
      "step": 58207
    },
    {
      "epoch": 6.17525991937195,
      "grad_norm": 0.863262596175655,
      "learning_rate": 2.3887722197061604e-05,
      "loss": 0.9698,
      "num_input_tokens_seen": 45796084784,
      "step": 58208
    },
    {
      "epoch": 6.175366008911522,
      "grad_norm": 0.6375895247049401,
      "learning_rate": 2.3887027916842873e-05,
      "loss": 0.9469,
      "num_input_tokens_seen": 45796871568,
      "step": 58209
    },
    {
      "epoch": 6.175472098451093,
      "grad_norm": 0.9569479846004231,
      "learning_rate": 2.3886333637484205e-05,
      "loss": 0.9602,
      "num_input_tokens_seen": 45797658384,
      "step": 58210
    },
    {
      "epoch": 6.175578187990664,
      "grad_norm": 0.9260084435200865,
      "learning_rate": 2.388563935898615e-05,
      "loss": 1.0049,
      "num_input_tokens_seen": 45798445088,
      "step": 58211
    },
    {
      "epoch": 6.175684277530236,
      "grad_norm": 0.7356124009829185,
      "learning_rate": 2.3884945081349243e-05,
      "loss": 0.9306,
      "num_input_tokens_seen": 45799231792,
      "step": 58212
    },
    {
      "epoch": 6.175790367069807,
      "grad_norm": 0.946083315402509,
      "learning_rate": 2.3884250804574012e-05,
      "loss": 1.019,
      "num_input_tokens_seen": 45800018528,
      "step": 58213
    },
    {
      "epoch": 6.175896456609379,
      "grad_norm": 0.8217016067221332,
      "learning_rate": 2.3883556528661007e-05,
      "loss": 1.0081,
      "num_input_tokens_seen": 45800805360,
      "step": 58214
    },
    {
      "epoch": 6.17600254614895,
      "grad_norm": 1.186517963435989,
      "learning_rate": 2.3882862253610752e-05,
      "loss": 1.0201,
      "num_input_tokens_seen": 45801592128,
      "step": 58215
    },
    {
      "epoch": 6.1761086356885215,
      "grad_norm": 1.246463774695633,
      "learning_rate": 2.3882167979423783e-05,
      "loss": 1.0226,
      "num_input_tokens_seen": 45802378832,
      "step": 58216
    },
    {
      "epoch": 6.176214725228093,
      "grad_norm": 0.7241518093875878,
      "learning_rate": 2.388147370610065e-05,
      "loss": 0.9759,
      "num_input_tokens_seen": 45803165680,
      "step": 58217
    },
    {
      "epoch": 6.176320814767664,
      "grad_norm": 0.7006231395875411,
      "learning_rate": 2.388077943364188e-05,
      "loss": 0.8951,
      "num_input_tokens_seen": 45803952480,
      "step": 58218
    },
    {
      "epoch": 6.1764269043072355,
      "grad_norm": 1.4294517455813658,
      "learning_rate": 2.3880085162048005e-05,
      "loss": 1.0776,
      "num_input_tokens_seen": 45804739200,
      "step": 58219
    },
    {
      "epoch": 6.1765329938468065,
      "grad_norm": 0.7820195126836874,
      "learning_rate": 2.3879390891319577e-05,
      "loss": 1.0093,
      "num_input_tokens_seen": 45805525936,
      "step": 58220
    },
    {
      "epoch": 6.1766390833863785,
      "grad_norm": 0.9642873904321805,
      "learning_rate": 2.387869662145711e-05,
      "loss": 0.904,
      "num_input_tokens_seen": 45806312784,
      "step": 58221
    },
    {
      "epoch": 6.1767451729259495,
      "grad_norm": 1.0967320286396371,
      "learning_rate": 2.3878002352461166e-05,
      "loss": 1.0179,
      "num_input_tokens_seen": 45807099584,
      "step": 58222
    },
    {
      "epoch": 6.1768512624655205,
      "grad_norm": 0.9401093598994049,
      "learning_rate": 2.3877308084332265e-05,
      "loss": 0.9087,
      "num_input_tokens_seen": 45807886336,
      "step": 58223
    },
    {
      "epoch": 6.176957352005092,
      "grad_norm": 1.8824721301233465,
      "learning_rate": 2.3876613817070942e-05,
      "loss": 0.9612,
      "num_input_tokens_seen": 45808673024,
      "step": 58224
    },
    {
      "epoch": 6.1770634415446635,
      "grad_norm": 1.6321996369198035,
      "learning_rate": 2.3875919550677744e-05,
      "loss": 0.9743,
      "num_input_tokens_seen": 45809459904,
      "step": 58225
    },
    {
      "epoch": 6.177169531084235,
      "grad_norm": 1.3671664277207733,
      "learning_rate": 2.38752252851532e-05,
      "loss": 0.9591,
      "num_input_tokens_seen": 45810246624,
      "step": 58226
    },
    {
      "epoch": 6.177275620623806,
      "grad_norm": 1.2133505604329056,
      "learning_rate": 2.3874531020497846e-05,
      "loss": 1.0135,
      "num_input_tokens_seen": 45811033392,
      "step": 58227
    },
    {
      "epoch": 6.1773817101633774,
      "grad_norm": 1.5835371992586875,
      "learning_rate": 2.3873836756712232e-05,
      "loss": 0.9902,
      "num_input_tokens_seen": 45811820048,
      "step": 58228
    },
    {
      "epoch": 6.177487799702949,
      "grad_norm": 1.7160673361763095,
      "learning_rate": 2.3873142493796876e-05,
      "loss": 1.0542,
      "num_input_tokens_seen": 45812606704,
      "step": 58229
    },
    {
      "epoch": 6.17759388924252,
      "grad_norm": 1.1830736667870856,
      "learning_rate": 2.3872448231752324e-05,
      "loss": 1.0229,
      "num_input_tokens_seen": 45813393392,
      "step": 58230
    },
    {
      "epoch": 6.177699978782092,
      "grad_norm": 1.080672281075393,
      "learning_rate": 2.3871753970579112e-05,
      "loss": 0.9891,
      "num_input_tokens_seen": 45814180208,
      "step": 58231
    },
    {
      "epoch": 6.177806068321663,
      "grad_norm": 1.3453892313380373,
      "learning_rate": 2.3871059710277774e-05,
      "loss": 1.0976,
      "num_input_tokens_seen": 45814966880,
      "step": 58232
    },
    {
      "epoch": 6.177912157861235,
      "grad_norm": 1.2802191695434213,
      "learning_rate": 2.3870365450848843e-05,
      "loss": 1.035,
      "num_input_tokens_seen": 45815753648,
      "step": 58233
    },
    {
      "epoch": 6.178018247400806,
      "grad_norm": 0.9634505582087722,
      "learning_rate": 2.386967119229287e-05,
      "loss": 1.0368,
      "num_input_tokens_seen": 45816540384,
      "step": 58234
    },
    {
      "epoch": 6.178124336940377,
      "grad_norm": 0.9555088651438692,
      "learning_rate": 2.386897693461038e-05,
      "loss": 1.0203,
      "num_input_tokens_seen": 45817327088,
      "step": 58235
    },
    {
      "epoch": 6.178230426479949,
      "grad_norm": 1.1736702981208886,
      "learning_rate": 2.3868282677801904e-05,
      "loss": 1.0528,
      "num_input_tokens_seen": 45818113760,
      "step": 58236
    },
    {
      "epoch": 6.17833651601952,
      "grad_norm": 1.0162111134291236,
      "learning_rate": 2.3867588421867994e-05,
      "loss": 1.0077,
      "num_input_tokens_seen": 45818900544,
      "step": 58237
    },
    {
      "epoch": 6.178442605559092,
      "grad_norm": 0.7530456886695219,
      "learning_rate": 2.3866894166809173e-05,
      "loss": 0.928,
      "num_input_tokens_seen": 45819687280,
      "step": 58238
    },
    {
      "epoch": 6.178548695098663,
      "grad_norm": 0.8638033836205763,
      "learning_rate": 2.3866199912625985e-05,
      "loss": 1.0495,
      "num_input_tokens_seen": 45820474016,
      "step": 58239
    },
    {
      "epoch": 6.178654784638234,
      "grad_norm": 0.7702297817009027,
      "learning_rate": 2.3865505659318968e-05,
      "loss": 1.0239,
      "num_input_tokens_seen": 45821260704,
      "step": 58240
    },
    {
      "epoch": 6.178760874177806,
      "grad_norm": 0.8901791180579214,
      "learning_rate": 2.386481140688865e-05,
      "loss": 1.0428,
      "num_input_tokens_seen": 45822047424,
      "step": 58241
    },
    {
      "epoch": 6.178866963717377,
      "grad_norm": 0.6454184216443175,
      "learning_rate": 2.3864117155335574e-05,
      "loss": 0.9257,
      "num_input_tokens_seen": 45822834192,
      "step": 58242
    },
    {
      "epoch": 6.178973053256949,
      "grad_norm": 0.7020466490284558,
      "learning_rate": 2.3863422904660278e-05,
      "loss": 1.0229,
      "num_input_tokens_seen": 45823621008,
      "step": 58243
    },
    {
      "epoch": 6.17907914279652,
      "grad_norm": 0.7980069091567593,
      "learning_rate": 2.3862728654863287e-05,
      "loss": 1.0498,
      "num_input_tokens_seen": 45824407712,
      "step": 58244
    },
    {
      "epoch": 6.179185232336092,
      "grad_norm": 0.7035267996649203,
      "learning_rate": 2.3862034405945154e-05,
      "loss": 0.9944,
      "num_input_tokens_seen": 45825194512,
      "step": 58245
    },
    {
      "epoch": 6.179291321875663,
      "grad_norm": 0.6362587660965603,
      "learning_rate": 2.3861340157906407e-05,
      "loss": 0.9212,
      "num_input_tokens_seen": 45825981360,
      "step": 58246
    },
    {
      "epoch": 6.179397411415234,
      "grad_norm": 0.7856237633733331,
      "learning_rate": 2.3860645910747575e-05,
      "loss": 1.0444,
      "num_input_tokens_seen": 45826768128,
      "step": 58247
    },
    {
      "epoch": 6.179503500954806,
      "grad_norm": 0.7081605123928739,
      "learning_rate": 2.385995166446921e-05,
      "loss": 0.9124,
      "num_input_tokens_seen": 45827554816,
      "step": 58248
    },
    {
      "epoch": 6.179609590494377,
      "grad_norm": 0.647858750162153,
      "learning_rate": 2.3859257419071844e-05,
      "loss": 0.9835,
      "num_input_tokens_seen": 45828341568,
      "step": 58249
    },
    {
      "epoch": 6.179715680033949,
      "grad_norm": 1.012575785610917,
      "learning_rate": 2.3858563174556002e-05,
      "loss": 1.0303,
      "num_input_tokens_seen": 45829128304,
      "step": 58250
    },
    {
      "epoch": 6.17982176957352,
      "grad_norm": 0.8001818732607915,
      "learning_rate": 2.3857868930922233e-05,
      "loss": 0.9954,
      "num_input_tokens_seen": 45829915008,
      "step": 58251
    },
    {
      "epoch": 6.179927859113091,
      "grad_norm": 1.049005184947426,
      "learning_rate": 2.3857174688171062e-05,
      "loss": 1.0378,
      "num_input_tokens_seen": 45830701808,
      "step": 58252
    },
    {
      "epoch": 6.180033948652663,
      "grad_norm": 0.9158559988488465,
      "learning_rate": 2.3856480446303045e-05,
      "loss": 1.0343,
      "num_input_tokens_seen": 45831488560,
      "step": 58253
    },
    {
      "epoch": 6.180140038192234,
      "grad_norm": 0.8574757126882153,
      "learning_rate": 2.3855786205318704e-05,
      "loss": 1.1242,
      "num_input_tokens_seen": 45832275328,
      "step": 58254
    },
    {
      "epoch": 6.180246127731806,
      "grad_norm": 1.16714151126037,
      "learning_rate": 2.3855091965218567e-05,
      "loss": 0.9477,
      "num_input_tokens_seen": 45833062208,
      "step": 58255
    },
    {
      "epoch": 6.180352217271377,
      "grad_norm": 0.8631432852195744,
      "learning_rate": 2.3854397726003193e-05,
      "loss": 1.0128,
      "num_input_tokens_seen": 45833848944,
      "step": 58256
    },
    {
      "epoch": 6.180458306810948,
      "grad_norm": 0.9345056999322809,
      "learning_rate": 2.3853703487673104e-05,
      "loss": 1.0242,
      "num_input_tokens_seen": 45834635760,
      "step": 58257
    },
    {
      "epoch": 6.18056439635052,
      "grad_norm": 0.8147137410167056,
      "learning_rate": 2.3853009250228835e-05,
      "loss": 0.9714,
      "num_input_tokens_seen": 45835422512,
      "step": 58258
    },
    {
      "epoch": 6.180670485890091,
      "grad_norm": 0.7412179048381298,
      "learning_rate": 2.3852315013670932e-05,
      "loss": 0.9828,
      "num_input_tokens_seen": 45836209184,
      "step": 58259
    },
    {
      "epoch": 6.180776575429663,
      "grad_norm": 0.666087797713358,
      "learning_rate": 2.3851620777999927e-05,
      "loss": 0.8632,
      "num_input_tokens_seen": 45836995888,
      "step": 58260
    },
    {
      "epoch": 6.180882664969234,
      "grad_norm": 0.8587390927769913,
      "learning_rate": 2.3850926543216347e-05,
      "loss": 0.9773,
      "num_input_tokens_seen": 45837782608,
      "step": 58261
    },
    {
      "epoch": 6.180988754508806,
      "grad_norm": 1.018340693458646,
      "learning_rate": 2.3850232309320747e-05,
      "loss": 0.9528,
      "num_input_tokens_seen": 45838569376,
      "step": 58262
    },
    {
      "epoch": 6.181094844048377,
      "grad_norm": 0.6347107415351828,
      "learning_rate": 2.384953807631365e-05,
      "loss": 0.9647,
      "num_input_tokens_seen": 45839356144,
      "step": 58263
    },
    {
      "epoch": 6.181200933587948,
      "grad_norm": 0.8338926370686609,
      "learning_rate": 2.3848843844195596e-05,
      "loss": 0.9986,
      "num_input_tokens_seen": 45840142928,
      "step": 58264
    },
    {
      "epoch": 6.18130702312752,
      "grad_norm": 0.7281072809189378,
      "learning_rate": 2.3848149612967122e-05,
      "loss": 1.012,
      "num_input_tokens_seen": 45840929696,
      "step": 58265
    },
    {
      "epoch": 6.181413112667091,
      "grad_norm": 0.8766376366285612,
      "learning_rate": 2.3847455382628765e-05,
      "loss": 0.9759,
      "num_input_tokens_seen": 45841716432,
      "step": 58266
    },
    {
      "epoch": 6.181519202206663,
      "grad_norm": 0.8909115254641037,
      "learning_rate": 2.3846761153181057e-05,
      "loss": 1.0417,
      "num_input_tokens_seen": 45842503168,
      "step": 58267
    },
    {
      "epoch": 6.181625291746234,
      "grad_norm": 0.729248742914375,
      "learning_rate": 2.3846066924624545e-05,
      "loss": 0.9576,
      "num_input_tokens_seen": 45843290064,
      "step": 58268
    },
    {
      "epoch": 6.181731381285805,
      "grad_norm": 0.7506679601864723,
      "learning_rate": 2.384537269695975e-05,
      "loss": 0.95,
      "num_input_tokens_seen": 45844076800,
      "step": 58269
    },
    {
      "epoch": 6.181837470825377,
      "grad_norm": 0.8523289349734795,
      "learning_rate": 2.3844678470187222e-05,
      "loss": 0.993,
      "num_input_tokens_seen": 45844863536,
      "step": 58270
    },
    {
      "epoch": 6.181943560364948,
      "grad_norm": 0.8554434841423424,
      "learning_rate": 2.3843984244307497e-05,
      "loss": 0.997,
      "num_input_tokens_seen": 45845650352,
      "step": 58271
    },
    {
      "epoch": 6.18204964990452,
      "grad_norm": 0.9315033942162965,
      "learning_rate": 2.3843290019321094e-05,
      "loss": 1.0149,
      "num_input_tokens_seen": 45846437040,
      "step": 58272
    },
    {
      "epoch": 6.182155739444091,
      "grad_norm": 0.9683303864660564,
      "learning_rate": 2.3842595795228565e-05,
      "loss": 0.9036,
      "num_input_tokens_seen": 45847223872,
      "step": 58273
    },
    {
      "epoch": 6.182261828983663,
      "grad_norm": 0.6519185505067234,
      "learning_rate": 2.3841901572030452e-05,
      "loss": 1.0249,
      "num_input_tokens_seen": 45848010640,
      "step": 58274
    },
    {
      "epoch": 6.182367918523234,
      "grad_norm": 0.6317098022352162,
      "learning_rate": 2.3841207349727284e-05,
      "loss": 0.9479,
      "num_input_tokens_seen": 45848797520,
      "step": 58275
    },
    {
      "epoch": 6.182474008062805,
      "grad_norm": 1.1299265453382863,
      "learning_rate": 2.384051312831959e-05,
      "loss": 1.0813,
      "num_input_tokens_seen": 45849584304,
      "step": 58276
    },
    {
      "epoch": 6.182580097602377,
      "grad_norm": 1.458742533944148,
      "learning_rate": 2.383981890780792e-05,
      "loss": 0.9753,
      "num_input_tokens_seen": 45850371024,
      "step": 58277
    },
    {
      "epoch": 6.182686187141948,
      "grad_norm": 0.9831974587099288,
      "learning_rate": 2.3839124688192805e-05,
      "loss": 0.9733,
      "num_input_tokens_seen": 45851157776,
      "step": 58278
    },
    {
      "epoch": 6.1827922766815195,
      "grad_norm": 1.2513769691059675,
      "learning_rate": 2.383843046947477e-05,
      "loss": 1.0508,
      "num_input_tokens_seen": 45851944512,
      "step": 58279
    },
    {
      "epoch": 6.182898366221091,
      "grad_norm": 1.4847811146574432,
      "learning_rate": 2.3837736251654372e-05,
      "loss": 0.9502,
      "num_input_tokens_seen": 45852731248,
      "step": 58280
    },
    {
      "epoch": 6.183004455760662,
      "grad_norm": 1.0265073907061495,
      "learning_rate": 2.383704203473214e-05,
      "loss": 1.1195,
      "num_input_tokens_seen": 45853517968,
      "step": 58281
    },
    {
      "epoch": 6.1831105453002335,
      "grad_norm": 0.9825766361002414,
      "learning_rate": 2.3836347818708595e-05,
      "loss": 0.9749,
      "num_input_tokens_seen": 45854304688,
      "step": 58282
    },
    {
      "epoch": 6.1832166348398045,
      "grad_norm": 1.195467675646001,
      "learning_rate": 2.3835653603584295e-05,
      "loss": 0.9447,
      "num_input_tokens_seen": 45855091488,
      "step": 58283
    },
    {
      "epoch": 6.1833227243793765,
      "grad_norm": 1.0007453718196886,
      "learning_rate": 2.3834959389359768e-05,
      "loss": 0.9959,
      "num_input_tokens_seen": 45855878224,
      "step": 58284
    },
    {
      "epoch": 6.1834288139189475,
      "grad_norm": 0.9255547259800788,
      "learning_rate": 2.3834265176035545e-05,
      "loss": 1.0367,
      "num_input_tokens_seen": 45856665008,
      "step": 58285
    },
    {
      "epoch": 6.183534903458519,
      "grad_norm": 1.1596730611992574,
      "learning_rate": 2.383357096361217e-05,
      "loss": 0.9621,
      "num_input_tokens_seen": 45857451744,
      "step": 58286
    },
    {
      "epoch": 6.1836409929980904,
      "grad_norm": 0.9879448281352513,
      "learning_rate": 2.3832876752090184e-05,
      "loss": 0.9483,
      "num_input_tokens_seen": 45858238544,
      "step": 58287
    },
    {
      "epoch": 6.1837470825376615,
      "grad_norm": 0.7383772403502049,
      "learning_rate": 2.3832182541470104e-05,
      "loss": 0.9583,
      "num_input_tokens_seen": 45859025360,
      "step": 58288
    },
    {
      "epoch": 6.183853172077233,
      "grad_norm": 0.7873057570793007,
      "learning_rate": 2.383148833175249e-05,
      "loss": 0.962,
      "num_input_tokens_seen": 45859812144,
      "step": 58289
    },
    {
      "epoch": 6.183959261616804,
      "grad_norm": 0.8404372082831504,
      "learning_rate": 2.3830794122937856e-05,
      "loss": 0.9848,
      "num_input_tokens_seen": 45860598896,
      "step": 58290
    },
    {
      "epoch": 6.184065351156376,
      "grad_norm": 0.9558226037596804,
      "learning_rate": 2.3830099915026763e-05,
      "loss": 1.0837,
      "num_input_tokens_seen": 45861385680,
      "step": 58291
    },
    {
      "epoch": 6.184171440695947,
      "grad_norm": 0.7959681176972484,
      "learning_rate": 2.3829405708019733e-05,
      "loss": 1.0086,
      "num_input_tokens_seen": 45862172368,
      "step": 58292
    },
    {
      "epoch": 6.184277530235518,
      "grad_norm": 0.8686469739508407,
      "learning_rate": 2.3828711501917292e-05,
      "loss": 1.0121,
      "num_input_tokens_seen": 45862959152,
      "step": 58293
    },
    {
      "epoch": 6.18438361977509,
      "grad_norm": 0.6960162691016875,
      "learning_rate": 2.3828017296719998e-05,
      "loss": 0.9822,
      "num_input_tokens_seen": 45863745984,
      "step": 58294
    },
    {
      "epoch": 6.184489709314661,
      "grad_norm": 0.7533229630125616,
      "learning_rate": 2.382732309242838e-05,
      "loss": 0.9824,
      "num_input_tokens_seen": 45864532784,
      "step": 58295
    },
    {
      "epoch": 6.184595798854233,
      "grad_norm": 1.2262195262919462,
      "learning_rate": 2.3826628889042962e-05,
      "loss": 1.0339,
      "num_input_tokens_seen": 45865319536,
      "step": 58296
    },
    {
      "epoch": 6.184701888393804,
      "grad_norm": 0.8464469763516809,
      "learning_rate": 2.3825934686564298e-05,
      "loss": 1.0636,
      "num_input_tokens_seen": 45866106352,
      "step": 58297
    },
    {
      "epoch": 6.184807977933376,
      "grad_norm": 0.9191530386906537,
      "learning_rate": 2.382524048499292e-05,
      "loss": 1.014,
      "num_input_tokens_seen": 45866893136,
      "step": 58298
    },
    {
      "epoch": 6.184914067472947,
      "grad_norm": 0.8283282599778936,
      "learning_rate": 2.382454628432935e-05,
      "loss": 0.9492,
      "num_input_tokens_seen": 45867679920,
      "step": 58299
    },
    {
      "epoch": 6.185020157012518,
      "grad_norm": 0.7512178596627316,
      "learning_rate": 2.382385208457415e-05,
      "loss": 1.0592,
      "num_input_tokens_seen": 45868466592,
      "step": 58300
    },
    {
      "epoch": 6.18512624655209,
      "grad_norm": 0.8966887287236993,
      "learning_rate": 2.3823157885727836e-05,
      "loss": 1.032,
      "num_input_tokens_seen": 45869253312,
      "step": 58301
    },
    {
      "epoch": 6.185232336091661,
      "grad_norm": 0.6656884965188159,
      "learning_rate": 2.382246368779095e-05,
      "loss": 0.9981,
      "num_input_tokens_seen": 45870040176,
      "step": 58302
    },
    {
      "epoch": 6.185338425631233,
      "grad_norm": 0.7654515999569786,
      "learning_rate": 2.382176949076403e-05,
      "loss": 1.0171,
      "num_input_tokens_seen": 45870827072,
      "step": 58303
    },
    {
      "epoch": 6.185444515170804,
      "grad_norm": 0.9314069987024266,
      "learning_rate": 2.3821075294647617e-05,
      "loss": 1.0059,
      "num_input_tokens_seen": 45871613856,
      "step": 58304
    },
    {
      "epoch": 6.185550604710375,
      "grad_norm": 0.6397071172837245,
      "learning_rate": 2.3820381099442235e-05,
      "loss": 1.0206,
      "num_input_tokens_seen": 45872400736,
      "step": 58305
    },
    {
      "epoch": 6.185656694249947,
      "grad_norm": 0.9917715969519065,
      "learning_rate": 2.3819686905148433e-05,
      "loss": 1.0241,
      "num_input_tokens_seen": 45873187440,
      "step": 58306
    },
    {
      "epoch": 6.185762783789518,
      "grad_norm": 0.7116143959402037,
      "learning_rate": 2.3818992711766737e-05,
      "loss": 1.0051,
      "num_input_tokens_seen": 45873974160,
      "step": 58307
    },
    {
      "epoch": 6.18586887332909,
      "grad_norm": 1.0541357416460024,
      "learning_rate": 2.3818298519297695e-05,
      "loss": 1.0769,
      "num_input_tokens_seen": 45874760912,
      "step": 58308
    },
    {
      "epoch": 6.185974962868661,
      "grad_norm": 0.6908891935989804,
      "learning_rate": 2.381760432774184e-05,
      "loss": 1.0134,
      "num_input_tokens_seen": 45875547664,
      "step": 58309
    },
    {
      "epoch": 6.186081052408232,
      "grad_norm": 0.7952863241081235,
      "learning_rate": 2.3816910137099692e-05,
      "loss": 0.9968,
      "num_input_tokens_seen": 45876334416,
      "step": 58310
    },
    {
      "epoch": 6.186187141947804,
      "grad_norm": 0.677063051091291,
      "learning_rate": 2.381621594737181e-05,
      "loss": 1.0062,
      "num_input_tokens_seen": 45877121216,
      "step": 58311
    },
    {
      "epoch": 6.186293231487375,
      "grad_norm": 0.8123937188399009,
      "learning_rate": 2.3815521758558726e-05,
      "loss": 1.0199,
      "num_input_tokens_seen": 45877907952,
      "step": 58312
    },
    {
      "epoch": 6.186399321026947,
      "grad_norm": 0.9328195990577823,
      "learning_rate": 2.3814827570660962e-05,
      "loss": 1.0377,
      "num_input_tokens_seen": 45878694784,
      "step": 58313
    },
    {
      "epoch": 6.186505410566518,
      "grad_norm": 0.7946550016066797,
      "learning_rate": 2.3814133383679074e-05,
      "loss": 0.9531,
      "num_input_tokens_seen": 45879481568,
      "step": 58314
    },
    {
      "epoch": 6.18661150010609,
      "grad_norm": 0.7161321395007304,
      "learning_rate": 2.3813439197613584e-05,
      "loss": 1.0018,
      "num_input_tokens_seen": 45880268384,
      "step": 58315
    },
    {
      "epoch": 6.186717589645661,
      "grad_norm": 0.8437069982507253,
      "learning_rate": 2.381274501246503e-05,
      "loss": 1.0295,
      "num_input_tokens_seen": 45881055152,
      "step": 58316
    },
    {
      "epoch": 6.186823679185232,
      "grad_norm": 0.77922736883744,
      "learning_rate": 2.3812050828233957e-05,
      "loss": 1.0636,
      "num_input_tokens_seen": 45881841840,
      "step": 58317
    },
    {
      "epoch": 6.186929768724804,
      "grad_norm": 0.7259790516393958,
      "learning_rate": 2.3811356644920898e-05,
      "loss": 0.9421,
      "num_input_tokens_seen": 45882628656,
      "step": 58318
    },
    {
      "epoch": 6.187035858264375,
      "grad_norm": 0.6930850192849277,
      "learning_rate": 2.381066246252638e-05,
      "loss": 1.0405,
      "num_input_tokens_seen": 45883415456,
      "step": 58319
    },
    {
      "epoch": 6.187141947803947,
      "grad_norm": 0.6845340581738467,
      "learning_rate": 2.3809968281050956e-05,
      "loss": 0.9929,
      "num_input_tokens_seen": 45884202128,
      "step": 58320
    },
    {
      "epoch": 6.187248037343518,
      "grad_norm": 0.6057694204799573,
      "learning_rate": 2.380927410049515e-05,
      "loss": 0.9971,
      "num_input_tokens_seen": 45884988912,
      "step": 58321
    },
    {
      "epoch": 6.187354126883089,
      "grad_norm": 0.7092977270425965,
      "learning_rate": 2.38085799208595e-05,
      "loss": 0.9838,
      "num_input_tokens_seen": 45885775664,
      "step": 58322
    },
    {
      "epoch": 6.187460216422661,
      "grad_norm": 0.7659101854765618,
      "learning_rate": 2.3807885742144548e-05,
      "loss": 1.0045,
      "num_input_tokens_seen": 45886562464,
      "step": 58323
    },
    {
      "epoch": 6.187566305962232,
      "grad_norm": 0.8497976274561984,
      "learning_rate": 2.380719156435082e-05,
      "loss": 0.9863,
      "num_input_tokens_seen": 45887349312,
      "step": 58324
    },
    {
      "epoch": 6.187672395501804,
      "grad_norm": 0.9620940096131443,
      "learning_rate": 2.3806497387478866e-05,
      "loss": 0.9601,
      "num_input_tokens_seen": 45888136064,
      "step": 58325
    },
    {
      "epoch": 6.187778485041375,
      "grad_norm": 1.10257266107114,
      "learning_rate": 2.3805803211529216e-05,
      "loss": 1.0732,
      "num_input_tokens_seen": 45888922768,
      "step": 58326
    },
    {
      "epoch": 6.187884574580947,
      "grad_norm": 0.9120045014493041,
      "learning_rate": 2.3805109036502402e-05,
      "loss": 0.9917,
      "num_input_tokens_seen": 45889709536,
      "step": 58327
    },
    {
      "epoch": 6.187990664120518,
      "grad_norm": 0.6750450929814059,
      "learning_rate": 2.380441486239897e-05,
      "loss": 0.9575,
      "num_input_tokens_seen": 45890496240,
      "step": 58328
    },
    {
      "epoch": 6.188096753660089,
      "grad_norm": 0.6995586098182975,
      "learning_rate": 2.3803720689219446e-05,
      "loss": 0.9588,
      "num_input_tokens_seen": 45891282880,
      "step": 58329
    },
    {
      "epoch": 6.188202843199661,
      "grad_norm": 0.8072393088307002,
      "learning_rate": 2.380302651696437e-05,
      "loss": 0.9371,
      "num_input_tokens_seen": 45892069776,
      "step": 58330
    },
    {
      "epoch": 6.188308932739232,
      "grad_norm": 0.7607513698483026,
      "learning_rate": 2.3802332345634286e-05,
      "loss": 0.9785,
      "num_input_tokens_seen": 45892856496,
      "step": 58331
    },
    {
      "epoch": 6.188415022278804,
      "grad_norm": 0.6545112363734529,
      "learning_rate": 2.3801638175229727e-05,
      "loss": 0.9976,
      "num_input_tokens_seen": 45893643248,
      "step": 58332
    },
    {
      "epoch": 6.188521111818375,
      "grad_norm": 0.731296386749927,
      "learning_rate": 2.3800944005751216e-05,
      "loss": 0.9896,
      "num_input_tokens_seen": 45894430048,
      "step": 58333
    },
    {
      "epoch": 6.188627201357946,
      "grad_norm": 0.6997475767504803,
      "learning_rate": 2.380024983719931e-05,
      "loss": 0.9843,
      "num_input_tokens_seen": 45895216768,
      "step": 58334
    },
    {
      "epoch": 6.188733290897518,
      "grad_norm": 0.8027682879220615,
      "learning_rate": 2.3799555669574532e-05,
      "loss": 1.0079,
      "num_input_tokens_seen": 45896003536,
      "step": 58335
    },
    {
      "epoch": 6.188839380437089,
      "grad_norm": 0.9109400813679289,
      "learning_rate": 2.3798861502877416e-05,
      "loss": 0.9517,
      "num_input_tokens_seen": 45896790368,
      "step": 58336
    },
    {
      "epoch": 6.188945469976661,
      "grad_norm": 0.7816113510715881,
      "learning_rate": 2.3798167337108517e-05,
      "loss": 1.0419,
      "num_input_tokens_seen": 45897577136,
      "step": 58337
    },
    {
      "epoch": 6.189051559516232,
      "grad_norm": 0.7649773499304642,
      "learning_rate": 2.3797473172268355e-05,
      "loss": 1.0649,
      "num_input_tokens_seen": 45898363904,
      "step": 58338
    },
    {
      "epoch": 6.189157649055803,
      "grad_norm": 0.7311394904878408,
      "learning_rate": 2.3796779008357462e-05,
      "loss": 1.0444,
      "num_input_tokens_seen": 45899150768,
      "step": 58339
    },
    {
      "epoch": 6.189263738595375,
      "grad_norm": 0.9954196388865498,
      "learning_rate": 2.379608484537639e-05,
      "loss": 1.0994,
      "num_input_tokens_seen": 45899937520,
      "step": 58340
    },
    {
      "epoch": 6.189369828134946,
      "grad_norm": 0.8239255013195959,
      "learning_rate": 2.3795390683325665e-05,
      "loss": 1.0661,
      "num_input_tokens_seen": 45900724304,
      "step": 58341
    },
    {
      "epoch": 6.1894759176745175,
      "grad_norm": 1.08336387358113,
      "learning_rate": 2.379469652220583e-05,
      "loss": 1.0149,
      "num_input_tokens_seen": 45901511056,
      "step": 58342
    },
    {
      "epoch": 6.189582007214089,
      "grad_norm": 0.8514818557313761,
      "learning_rate": 2.379400236201742e-05,
      "loss": 0.9928,
      "num_input_tokens_seen": 45902297824,
      "step": 58343
    },
    {
      "epoch": 6.1896880967536605,
      "grad_norm": 0.843406144455199,
      "learning_rate": 2.3793308202760965e-05,
      "loss": 0.9545,
      "num_input_tokens_seen": 45903084640,
      "step": 58344
    },
    {
      "epoch": 6.1897941862932315,
      "grad_norm": 0.9271861990589216,
      "learning_rate": 2.379261404443701e-05,
      "loss": 1.0013,
      "num_input_tokens_seen": 45903871440,
      "step": 58345
    },
    {
      "epoch": 6.189900275832803,
      "grad_norm": 0.8078380453462339,
      "learning_rate": 2.3791919887046086e-05,
      "loss": 1.0483,
      "num_input_tokens_seen": 45904658176,
      "step": 58346
    },
    {
      "epoch": 6.1900063653723745,
      "grad_norm": 1.0328289936502522,
      "learning_rate": 2.3791225730588724e-05,
      "loss": 1.0701,
      "num_input_tokens_seen": 45905444960,
      "step": 58347
    },
    {
      "epoch": 6.1901124549119455,
      "grad_norm": 1.0187711950378826,
      "learning_rate": 2.3790531575065478e-05,
      "loss": 0.9514,
      "num_input_tokens_seen": 45906231824,
      "step": 58348
    },
    {
      "epoch": 6.190218544451517,
      "grad_norm": 0.6651029874881521,
      "learning_rate": 2.378983742047687e-05,
      "loss": 1.0032,
      "num_input_tokens_seen": 45907018528,
      "step": 58349
    },
    {
      "epoch": 6.1903246339910885,
      "grad_norm": 0.8577282651994882,
      "learning_rate": 2.3789143266823435e-05,
      "loss": 1.0382,
      "num_input_tokens_seen": 45907805296,
      "step": 58350
    },
    {
      "epoch": 6.1904307235306595,
      "grad_norm": 0.8580756313238447,
      "learning_rate": 2.378844911410572e-05,
      "loss": 1.0001,
      "num_input_tokens_seen": 45908592064,
      "step": 58351
    },
    {
      "epoch": 6.190536813070231,
      "grad_norm": 0.9715536496202135,
      "learning_rate": 2.378775496232426e-05,
      "loss": 0.9724,
      "num_input_tokens_seen": 45909378800,
      "step": 58352
    },
    {
      "epoch": 6.190642902609802,
      "grad_norm": 0.790149839840293,
      "learning_rate": 2.3787060811479575e-05,
      "loss": 1.0145,
      "num_input_tokens_seen": 45910165440,
      "step": 58353
    },
    {
      "epoch": 6.190748992149374,
      "grad_norm": 0.7745444531441871,
      "learning_rate": 2.3786366661572224e-05,
      "loss": 0.9864,
      "num_input_tokens_seen": 45910952192,
      "step": 58354
    },
    {
      "epoch": 6.190855081688945,
      "grad_norm": 1.1719926188801626,
      "learning_rate": 2.378567251260273e-05,
      "loss": 1.0412,
      "num_input_tokens_seen": 45911738992,
      "step": 58355
    },
    {
      "epoch": 6.190961171228517,
      "grad_norm": 0.7788221887431788,
      "learning_rate": 2.378497836457163e-05,
      "loss": 0.9652,
      "num_input_tokens_seen": 45912525728,
      "step": 58356
    },
    {
      "epoch": 6.191067260768088,
      "grad_norm": 1.1687052597299352,
      "learning_rate": 2.3784284217479468e-05,
      "loss": 1.0371,
      "num_input_tokens_seen": 45913312368,
      "step": 58357
    },
    {
      "epoch": 6.191173350307659,
      "grad_norm": 0.8410123633412285,
      "learning_rate": 2.3783590071326774e-05,
      "loss": 1.1074,
      "num_input_tokens_seen": 45914099104,
      "step": 58358
    },
    {
      "epoch": 6.191279439847231,
      "grad_norm": 0.8787829928918277,
      "learning_rate": 2.3782895926114086e-05,
      "loss": 0.9914,
      "num_input_tokens_seen": 45914885904,
      "step": 58359
    },
    {
      "epoch": 6.191385529386802,
      "grad_norm": 0.9284702877256704,
      "learning_rate": 2.378220178184194e-05,
      "loss": 0.9418,
      "num_input_tokens_seen": 45915672672,
      "step": 58360
    },
    {
      "epoch": 6.191491618926374,
      "grad_norm": 0.6954543918658097,
      "learning_rate": 2.378150763851087e-05,
      "loss": 1.0517,
      "num_input_tokens_seen": 45916459408,
      "step": 58361
    },
    {
      "epoch": 6.191597708465945,
      "grad_norm": 0.7762474073980465,
      "learning_rate": 2.3780813496121417e-05,
      "loss": 1.016,
      "num_input_tokens_seen": 45917246192,
      "step": 58362
    },
    {
      "epoch": 6.191703798005516,
      "grad_norm": 1.123525210959122,
      "learning_rate": 2.378011935467412e-05,
      "loss": 1.0051,
      "num_input_tokens_seen": 45918032896,
      "step": 58363
    },
    {
      "epoch": 6.191809887545088,
      "grad_norm": 1.0251463776254384,
      "learning_rate": 2.3779425214169502e-05,
      "loss": 0.9769,
      "num_input_tokens_seen": 45918819664,
      "step": 58364
    },
    {
      "epoch": 6.191915977084659,
      "grad_norm": 0.7285458331448188,
      "learning_rate": 2.3778731074608117e-05,
      "loss": 0.9955,
      "num_input_tokens_seen": 45919606496,
      "step": 58365
    },
    {
      "epoch": 6.192022066624231,
      "grad_norm": 1.2321411761701744,
      "learning_rate": 2.377803693599049e-05,
      "loss": 1.0661,
      "num_input_tokens_seen": 45920393312,
      "step": 58366
    },
    {
      "epoch": 6.192128156163802,
      "grad_norm": 0.9009849760565678,
      "learning_rate": 2.377734279831715e-05,
      "loss": 1.0384,
      "num_input_tokens_seen": 45921180240,
      "step": 58367
    },
    {
      "epoch": 6.192234245703373,
      "grad_norm": 0.7980520135853992,
      "learning_rate": 2.377664866158865e-05,
      "loss": 0.9432,
      "num_input_tokens_seen": 45921966976,
      "step": 58368
    },
    {
      "epoch": 6.192340335242945,
      "grad_norm": 0.9136532602038488,
      "learning_rate": 2.3775954525805526e-05,
      "loss": 1.0112,
      "num_input_tokens_seen": 45922753696,
      "step": 58369
    },
    {
      "epoch": 6.192446424782516,
      "grad_norm": 0.935493244740794,
      "learning_rate": 2.3775260390968307e-05,
      "loss": 0.9118,
      "num_input_tokens_seen": 45923540512,
      "step": 58370
    },
    {
      "epoch": 6.192552514322088,
      "grad_norm": 0.7286472416382062,
      "learning_rate": 2.3774566257077523e-05,
      "loss": 0.9618,
      "num_input_tokens_seen": 45924327264,
      "step": 58371
    },
    {
      "epoch": 6.192658603861659,
      "grad_norm": 0.7447940234881332,
      "learning_rate": 2.377387212413373e-05,
      "loss": 1.0084,
      "num_input_tokens_seen": 45925113984,
      "step": 58372
    },
    {
      "epoch": 6.192764693401231,
      "grad_norm": 0.8488538662967365,
      "learning_rate": 2.3773177992137445e-05,
      "loss": 0.9729,
      "num_input_tokens_seen": 45925900704,
      "step": 58373
    },
    {
      "epoch": 6.192870782940802,
      "grad_norm": 0.9690605117382662,
      "learning_rate": 2.377248386108921e-05,
      "loss": 1.0007,
      "num_input_tokens_seen": 45926687472,
      "step": 58374
    },
    {
      "epoch": 6.192976872480373,
      "grad_norm": 0.7710541330347721,
      "learning_rate": 2.377178973098957e-05,
      "loss": 0.9711,
      "num_input_tokens_seen": 45927474272,
      "step": 58375
    },
    {
      "epoch": 6.193082962019945,
      "grad_norm": 1.1156846974038004,
      "learning_rate": 2.377109560183905e-05,
      "loss": 0.9358,
      "num_input_tokens_seen": 45928261008,
      "step": 58376
    },
    {
      "epoch": 6.193189051559516,
      "grad_norm": 1.0797737564932361,
      "learning_rate": 2.3770401473638196e-05,
      "loss": 0.9738,
      "num_input_tokens_seen": 45929047744,
      "step": 58377
    },
    {
      "epoch": 6.193295141099088,
      "grad_norm": 1.0811301010315768,
      "learning_rate": 2.376970734638754e-05,
      "loss": 1.0028,
      "num_input_tokens_seen": 45929834592,
      "step": 58378
    },
    {
      "epoch": 6.193401230638659,
      "grad_norm": 0.9898552794675358,
      "learning_rate": 2.376901322008761e-05,
      "loss": 0.9899,
      "num_input_tokens_seen": 45930621456,
      "step": 58379
    },
    {
      "epoch": 6.19350732017823,
      "grad_norm": 0.8856797846254177,
      "learning_rate": 2.3768319094738957e-05,
      "loss": 0.9937,
      "num_input_tokens_seen": 45931408256,
      "step": 58380
    },
    {
      "epoch": 6.193613409717802,
      "grad_norm": 1.1431759215882609,
      "learning_rate": 2.3767624970342115e-05,
      "loss": 1.1005,
      "num_input_tokens_seen": 45932195056,
      "step": 58381
    },
    {
      "epoch": 6.193719499257373,
      "grad_norm": 0.666835547624048,
      "learning_rate": 2.3766930846897605e-05,
      "loss": 0.9294,
      "num_input_tokens_seen": 45932981808,
      "step": 58382
    },
    {
      "epoch": 6.193825588796945,
      "grad_norm": 0.7857335714138901,
      "learning_rate": 2.3766236724405986e-05,
      "loss": 1.0526,
      "num_input_tokens_seen": 45933768672,
      "step": 58383
    },
    {
      "epoch": 6.193931678336516,
      "grad_norm": 0.9329130576646405,
      "learning_rate": 2.376554260286778e-05,
      "loss": 1.0703,
      "num_input_tokens_seen": 45934555424,
      "step": 58384
    },
    {
      "epoch": 6.194037767876088,
      "grad_norm": 0.8677672373785024,
      "learning_rate": 2.376484848228352e-05,
      "loss": 1.0766,
      "num_input_tokens_seen": 45935342176,
      "step": 58385
    },
    {
      "epoch": 6.194143857415659,
      "grad_norm": 0.9182202484935724,
      "learning_rate": 2.3764154362653754e-05,
      "loss": 0.9723,
      "num_input_tokens_seen": 45936128880,
      "step": 58386
    },
    {
      "epoch": 6.19424994695523,
      "grad_norm": 0.9218481190252125,
      "learning_rate": 2.3763460243979012e-05,
      "loss": 1.0931,
      "num_input_tokens_seen": 45936915648,
      "step": 58387
    },
    {
      "epoch": 6.194356036494802,
      "grad_norm": 0.7443877317488967,
      "learning_rate": 2.376276612625983e-05,
      "loss": 1.0105,
      "num_input_tokens_seen": 45937702448,
      "step": 58388
    },
    {
      "epoch": 6.194462126034373,
      "grad_norm": 0.7746396101628367,
      "learning_rate": 2.376207200949675e-05,
      "loss": 1.0636,
      "num_input_tokens_seen": 45938489296,
      "step": 58389
    },
    {
      "epoch": 6.194568215573945,
      "grad_norm": 0.7873129644186415,
      "learning_rate": 2.3761377893690307e-05,
      "loss": 0.9923,
      "num_input_tokens_seen": 45939276000,
      "step": 58390
    },
    {
      "epoch": 6.194674305113516,
      "grad_norm": 0.7143371898555316,
      "learning_rate": 2.3760683778841026e-05,
      "loss": 0.9641,
      "num_input_tokens_seen": 45940062768,
      "step": 58391
    },
    {
      "epoch": 6.194780394653087,
      "grad_norm": 0.6890832211175529,
      "learning_rate": 2.3759989664949455e-05,
      "loss": 0.975,
      "num_input_tokens_seen": 45940849536,
      "step": 58392
    },
    {
      "epoch": 6.194886484192659,
      "grad_norm": 0.7370711922708653,
      "learning_rate": 2.375929555201613e-05,
      "loss": 0.9806,
      "num_input_tokens_seen": 45941636384,
      "step": 58393
    },
    {
      "epoch": 6.19499257373223,
      "grad_norm": 0.7238773844342795,
      "learning_rate": 2.3758601440041584e-05,
      "loss": 1.0186,
      "num_input_tokens_seen": 45942423104,
      "step": 58394
    },
    {
      "epoch": 6.195098663271802,
      "grad_norm": 0.8032805244538095,
      "learning_rate": 2.3757907329026354e-05,
      "loss": 1.0216,
      "num_input_tokens_seen": 45943209792,
      "step": 58395
    },
    {
      "epoch": 6.195204752811373,
      "grad_norm": 0.8114706184598369,
      "learning_rate": 2.3757213218970976e-05,
      "loss": 0.9664,
      "num_input_tokens_seen": 45943996464,
      "step": 58396
    },
    {
      "epoch": 6.195310842350944,
      "grad_norm": 0.8417350168357729,
      "learning_rate": 2.375651910987599e-05,
      "loss": 1.0124,
      "num_input_tokens_seen": 45944783280,
      "step": 58397
    },
    {
      "epoch": 6.195416931890516,
      "grad_norm": 0.7162198967321874,
      "learning_rate": 2.375582500174193e-05,
      "loss": 0.9812,
      "num_input_tokens_seen": 45945570000,
      "step": 58398
    },
    {
      "epoch": 6.195523021430087,
      "grad_norm": 0.7444641789081488,
      "learning_rate": 2.375513089456933e-05,
      "loss": 1.0056,
      "num_input_tokens_seen": 45946356704,
      "step": 58399
    },
    {
      "epoch": 6.195629110969659,
      "grad_norm": 1.4117714659912235,
      "learning_rate": 2.3754436788358724e-05,
      "loss": 0.9876,
      "num_input_tokens_seen": 45947143520,
      "step": 58400
    },
    {
      "epoch": 6.19573520050923,
      "grad_norm": 0.8220629069199231,
      "learning_rate": 2.375374268311066e-05,
      "loss": 0.9828,
      "num_input_tokens_seen": 45947930304,
      "step": 58401
    },
    {
      "epoch": 6.195841290048802,
      "grad_norm": 1.3926103667028131,
      "learning_rate": 2.3753048578825662e-05,
      "loss": 0.9771,
      "num_input_tokens_seen": 45948717088,
      "step": 58402
    },
    {
      "epoch": 6.195947379588373,
      "grad_norm": 1.0544310674513548,
      "learning_rate": 2.3752354475504273e-05,
      "loss": 1.1019,
      "num_input_tokens_seen": 45949503776,
      "step": 58403
    },
    {
      "epoch": 6.196053469127944,
      "grad_norm": 0.7781486303291664,
      "learning_rate": 2.3751660373147035e-05,
      "loss": 0.969,
      "num_input_tokens_seen": 45950290512,
      "step": 58404
    },
    {
      "epoch": 6.1961595586675156,
      "grad_norm": 1.002903944553907,
      "learning_rate": 2.3750966271754462e-05,
      "loss": 0.9475,
      "num_input_tokens_seen": 45951077248,
      "step": 58405
    },
    {
      "epoch": 6.196265648207087,
      "grad_norm": 0.8115496463080939,
      "learning_rate": 2.3750272171327117e-05,
      "loss": 1.0315,
      "num_input_tokens_seen": 45951863968,
      "step": 58406
    },
    {
      "epoch": 6.1963717377466585,
      "grad_norm": 0.7373197060861751,
      "learning_rate": 2.3749578071865525e-05,
      "loss": 0.9628,
      "num_input_tokens_seen": 45952650784,
      "step": 58407
    },
    {
      "epoch": 6.1964778272862295,
      "grad_norm": 0.8808719938101296,
      "learning_rate": 2.3748883973370218e-05,
      "loss": 1.039,
      "num_input_tokens_seen": 45953437552,
      "step": 58408
    },
    {
      "epoch": 6.196583916825801,
      "grad_norm": 0.7556854065860946,
      "learning_rate": 2.3748189875841738e-05,
      "loss": 1.0453,
      "num_input_tokens_seen": 45954224208,
      "step": 58409
    },
    {
      "epoch": 6.1966900063653725,
      "grad_norm": 1.4672330893949643,
      "learning_rate": 2.3747495779280617e-05,
      "loss": 1.0803,
      "num_input_tokens_seen": 45955010912,
      "step": 58410
    },
    {
      "epoch": 6.1967960959049435,
      "grad_norm": 0.9158481801247006,
      "learning_rate": 2.37468016836874e-05,
      "loss": 0.9982,
      "num_input_tokens_seen": 45955797792,
      "step": 58411
    },
    {
      "epoch": 6.196902185444515,
      "grad_norm": 0.7810222456269297,
      "learning_rate": 2.3746107589062618e-05,
      "loss": 0.956,
      "num_input_tokens_seen": 45956584608,
      "step": 58412
    },
    {
      "epoch": 6.1970082749840865,
      "grad_norm": 1.2568447068496096,
      "learning_rate": 2.3745413495406803e-05,
      "loss": 1.0414,
      "num_input_tokens_seen": 45957371328,
      "step": 58413
    },
    {
      "epoch": 6.197114364523658,
      "grad_norm": 1.135977621915146,
      "learning_rate": 2.37447194027205e-05,
      "loss": 1.0623,
      "num_input_tokens_seen": 45958158096,
      "step": 58414
    },
    {
      "epoch": 6.197220454063229,
      "grad_norm": 0.7161876708013201,
      "learning_rate": 2.374402531100424e-05,
      "loss": 0.9826,
      "num_input_tokens_seen": 45958944976,
      "step": 58415
    },
    {
      "epoch": 6.1973265436028,
      "grad_norm": 0.9677795871046513,
      "learning_rate": 2.3743331220258556e-05,
      "loss": 1.0764,
      "num_input_tokens_seen": 45959731712,
      "step": 58416
    },
    {
      "epoch": 6.197432633142372,
      "grad_norm": 1.4422414831143497,
      "learning_rate": 2.3742637130483992e-05,
      "loss": 0.9692,
      "num_input_tokens_seen": 45960518400,
      "step": 58417
    },
    {
      "epoch": 6.197538722681943,
      "grad_norm": 1.215682198320008,
      "learning_rate": 2.3741943041681083e-05,
      "loss": 1.0839,
      "num_input_tokens_seen": 45961305072,
      "step": 58418
    },
    {
      "epoch": 6.197644812221515,
      "grad_norm": 1.1365594872527671,
      "learning_rate": 2.3741248953850358e-05,
      "loss": 1.0313,
      "num_input_tokens_seen": 45962091856,
      "step": 58419
    },
    {
      "epoch": 6.197750901761086,
      "grad_norm": 0.912736895485679,
      "learning_rate": 2.3740554866992366e-05,
      "loss": 0.9449,
      "num_input_tokens_seen": 45962878672,
      "step": 58420
    },
    {
      "epoch": 6.197856991300657,
      "grad_norm": 0.7313563770035353,
      "learning_rate": 2.3739860781107634e-05,
      "loss": 1.0064,
      "num_input_tokens_seen": 45963665456,
      "step": 58421
    },
    {
      "epoch": 6.197963080840229,
      "grad_norm": 0.8545171991398154,
      "learning_rate": 2.3739166696196693e-05,
      "loss": 1.0118,
      "num_input_tokens_seen": 45964452288,
      "step": 58422
    },
    {
      "epoch": 6.1980691703798,
      "grad_norm": 1.109431742788398,
      "learning_rate": 2.3738472612260097e-05,
      "loss": 1.0023,
      "num_input_tokens_seen": 45965238992,
      "step": 58423
    },
    {
      "epoch": 6.198175259919372,
      "grad_norm": 0.7531581251636109,
      "learning_rate": 2.373777852929837e-05,
      "loss": 0.9475,
      "num_input_tokens_seen": 45966025744,
      "step": 58424
    },
    {
      "epoch": 6.198281349458943,
      "grad_norm": 1.3682647308928493,
      "learning_rate": 2.3737084447312048e-05,
      "loss": 0.9948,
      "num_input_tokens_seen": 45966812480,
      "step": 58425
    },
    {
      "epoch": 6.198387438998514,
      "grad_norm": 0.7437092039068955,
      "learning_rate": 2.3736390366301673e-05,
      "loss": 1.0437,
      "num_input_tokens_seen": 45967599248,
      "step": 58426
    },
    {
      "epoch": 6.198493528538086,
      "grad_norm": 0.7397579248527083,
      "learning_rate": 2.373569628626777e-05,
      "loss": 0.9815,
      "num_input_tokens_seen": 45968386128,
      "step": 58427
    },
    {
      "epoch": 6.198599618077657,
      "grad_norm": 0.8000199335045615,
      "learning_rate": 2.3735002207210894e-05,
      "loss": 1.0079,
      "num_input_tokens_seen": 45969172848,
      "step": 58428
    },
    {
      "epoch": 6.198705707617229,
      "grad_norm": 0.7437835688312172,
      "learning_rate": 2.3734308129131568e-05,
      "loss": 1.0259,
      "num_input_tokens_seen": 45969959584,
      "step": 58429
    },
    {
      "epoch": 6.1988117971568,
      "grad_norm": 0.7718943880913697,
      "learning_rate": 2.3733614052030328e-05,
      "loss": 0.9574,
      "num_input_tokens_seen": 45970746304,
      "step": 58430
    },
    {
      "epoch": 6.198917886696372,
      "grad_norm": 0.9545105549746967,
      "learning_rate": 2.3732919975907722e-05,
      "loss": 1.0915,
      "num_input_tokens_seen": 45971533040,
      "step": 58431
    },
    {
      "epoch": 6.199023976235943,
      "grad_norm": 0.7505391422918435,
      "learning_rate": 2.3732225900764273e-05,
      "loss": 0.9546,
      "num_input_tokens_seen": 45972319840,
      "step": 58432
    },
    {
      "epoch": 6.199130065775514,
      "grad_norm": 0.8054561883875522,
      "learning_rate": 2.373153182660052e-05,
      "loss": 0.9627,
      "num_input_tokens_seen": 45973106624,
      "step": 58433
    },
    {
      "epoch": 6.199236155315086,
      "grad_norm": 0.7697929055283528,
      "learning_rate": 2.3730837753417007e-05,
      "loss": 1.0017,
      "num_input_tokens_seen": 45973893408,
      "step": 58434
    },
    {
      "epoch": 6.199342244854657,
      "grad_norm": 0.7800808357913895,
      "learning_rate": 2.3730143681214267e-05,
      "loss": 0.9727,
      "num_input_tokens_seen": 45974680192,
      "step": 58435
    },
    {
      "epoch": 6.199448334394229,
      "grad_norm": 0.6619226521765142,
      "learning_rate": 2.3729449609992828e-05,
      "loss": 1.0129,
      "num_input_tokens_seen": 45975466928,
      "step": 58436
    },
    {
      "epoch": 6.1995544239338,
      "grad_norm": 0.7476811382893516,
      "learning_rate": 2.3728755539753235e-05,
      "loss": 1.0015,
      "num_input_tokens_seen": 45976253680,
      "step": 58437
    },
    {
      "epoch": 6.199660513473371,
      "grad_norm": 0.7488072955358714,
      "learning_rate": 2.372806147049603e-05,
      "loss": 1.0603,
      "num_input_tokens_seen": 45977040384,
      "step": 58438
    },
    {
      "epoch": 6.199766603012943,
      "grad_norm": 0.7502260740913893,
      "learning_rate": 2.372736740222173e-05,
      "loss": 1.0036,
      "num_input_tokens_seen": 45977826976,
      "step": 58439
    },
    {
      "epoch": 6.199872692552514,
      "grad_norm": 0.6686166613030501,
      "learning_rate": 2.3726673334930892e-05,
      "loss": 0.9407,
      "num_input_tokens_seen": 45978613744,
      "step": 58440
    },
    {
      "epoch": 6.199978782092086,
      "grad_norm": 0.9193859296085406,
      "learning_rate": 2.372597926862404e-05,
      "loss": 1.0945,
      "num_input_tokens_seen": 45979400464,
      "step": 58441
    },
    {
      "epoch": 6.200084871631657,
      "grad_norm": 0.8076917774797041,
      "learning_rate": 2.372528520330171e-05,
      "loss": 0.9763,
      "num_input_tokens_seen": 45980187200,
      "step": 58442
    },
    {
      "epoch": 6.200190961171229,
      "grad_norm": 0.786632886587288,
      "learning_rate": 2.3724591138964447e-05,
      "loss": 0.8879,
      "num_input_tokens_seen": 45980973984,
      "step": 58443
    },
    {
      "epoch": 6.2002970507108,
      "grad_norm": 0.845512131233494,
      "learning_rate": 2.372389707561278e-05,
      "loss": 0.989,
      "num_input_tokens_seen": 45981760800,
      "step": 58444
    },
    {
      "epoch": 6.200403140250371,
      "grad_norm": 0.6543795094892628,
      "learning_rate": 2.372320301324725e-05,
      "loss": 0.9783,
      "num_input_tokens_seen": 45982547616,
      "step": 58445
    },
    {
      "epoch": 6.200509229789943,
      "grad_norm": 0.8453069430636972,
      "learning_rate": 2.3722508951868393e-05,
      "loss": 0.9495,
      "num_input_tokens_seen": 45983334384,
      "step": 58446
    },
    {
      "epoch": 6.200615319329514,
      "grad_norm": 0.9402700993216931,
      "learning_rate": 2.3721814891476738e-05,
      "loss": 0.9597,
      "num_input_tokens_seen": 45984121136,
      "step": 58447
    },
    {
      "epoch": 6.200721408869086,
      "grad_norm": 0.6347081191464427,
      "learning_rate": 2.372112083207283e-05,
      "loss": 0.9974,
      "num_input_tokens_seen": 45984907920,
      "step": 58448
    },
    {
      "epoch": 6.200827498408657,
      "grad_norm": 0.7625664427392775,
      "learning_rate": 2.3720426773657206e-05,
      "loss": 0.9809,
      "num_input_tokens_seen": 45985694704,
      "step": 58449
    },
    {
      "epoch": 6.200933587948228,
      "grad_norm": 0.9086387754370929,
      "learning_rate": 2.3719732716230393e-05,
      "loss": 1.0199,
      "num_input_tokens_seen": 45986481424,
      "step": 58450
    },
    {
      "epoch": 6.2010396774878,
      "grad_norm": 0.7969811160101378,
      "learning_rate": 2.3719038659792935e-05,
      "loss": 1.0676,
      "num_input_tokens_seen": 45987268144,
      "step": 58451
    },
    {
      "epoch": 6.201145767027371,
      "grad_norm": 0.7125487987673265,
      "learning_rate": 2.371834460434537e-05,
      "loss": 0.9811,
      "num_input_tokens_seen": 45988054960,
      "step": 58452
    },
    {
      "epoch": 6.201251856566943,
      "grad_norm": 0.6815596314186335,
      "learning_rate": 2.3717650549888224e-05,
      "loss": 0.9679,
      "num_input_tokens_seen": 45988841712,
      "step": 58453
    },
    {
      "epoch": 6.201357946106514,
      "grad_norm": 0.7451704154919754,
      "learning_rate": 2.3716956496422046e-05,
      "loss": 1.0895,
      "num_input_tokens_seen": 45989628416,
      "step": 58454
    },
    {
      "epoch": 6.201464035646085,
      "grad_norm": 0.8324118517956088,
      "learning_rate": 2.3716262443947364e-05,
      "loss": 1.04,
      "num_input_tokens_seen": 45990415120,
      "step": 58455
    },
    {
      "epoch": 6.201570125185657,
      "grad_norm": 0.8112282622342251,
      "learning_rate": 2.3715568392464716e-05,
      "loss": 1.0076,
      "num_input_tokens_seen": 45991201968,
      "step": 58456
    },
    {
      "epoch": 6.201676214725228,
      "grad_norm": 0.7832249620032603,
      "learning_rate": 2.371487434197464e-05,
      "loss": 1.013,
      "num_input_tokens_seen": 45991988816,
      "step": 58457
    },
    {
      "epoch": 6.2017823042648,
      "grad_norm": 0.7276288131956545,
      "learning_rate": 2.3714180292477667e-05,
      "loss": 0.8971,
      "num_input_tokens_seen": 45992775568,
      "step": 58458
    },
    {
      "epoch": 6.201888393804371,
      "grad_norm": 1.2340238487437503,
      "learning_rate": 2.3713486243974343e-05,
      "loss": 0.9303,
      "num_input_tokens_seen": 45993562416,
      "step": 58459
    },
    {
      "epoch": 6.201994483343943,
      "grad_norm": 0.9310243457840331,
      "learning_rate": 2.37127921964652e-05,
      "loss": 1.0257,
      "num_input_tokens_seen": 45994349136,
      "step": 58460
    },
    {
      "epoch": 6.202100572883514,
      "grad_norm": 0.8490566410063878,
      "learning_rate": 2.371209814995077e-05,
      "loss": 0.9605,
      "num_input_tokens_seen": 45995135936,
      "step": 58461
    },
    {
      "epoch": 6.202206662423085,
      "grad_norm": 0.7110992121068895,
      "learning_rate": 2.3711404104431585e-05,
      "loss": 0.9469,
      "num_input_tokens_seen": 45995922736,
      "step": 58462
    },
    {
      "epoch": 6.202312751962657,
      "grad_norm": 1.0751151383039947,
      "learning_rate": 2.3710710059908198e-05,
      "loss": 0.9602,
      "num_input_tokens_seen": 45996709472,
      "step": 58463
    },
    {
      "epoch": 6.202418841502228,
      "grad_norm": 0.7785919103640578,
      "learning_rate": 2.3710016016381138e-05,
      "loss": 0.9746,
      "num_input_tokens_seen": 45997496224,
      "step": 58464
    },
    {
      "epoch": 6.2025249310418,
      "grad_norm": 0.8624703138651731,
      "learning_rate": 2.3709321973850935e-05,
      "loss": 0.9592,
      "num_input_tokens_seen": 45998282960,
      "step": 58465
    },
    {
      "epoch": 6.202631020581371,
      "grad_norm": 0.8343998373540876,
      "learning_rate": 2.3708627932318132e-05,
      "loss": 1.0162,
      "num_input_tokens_seen": 45999069584,
      "step": 58466
    },
    {
      "epoch": 6.2027371101209425,
      "grad_norm": 0.6054843274211106,
      "learning_rate": 2.3707933891783267e-05,
      "loss": 0.9145,
      "num_input_tokens_seen": 45999856352,
      "step": 58467
    },
    {
      "epoch": 6.202843199660514,
      "grad_norm": 0.6293521333515583,
      "learning_rate": 2.3707239852246868e-05,
      "loss": 0.9922,
      "num_input_tokens_seen": 46000643152,
      "step": 58468
    },
    {
      "epoch": 6.202949289200085,
      "grad_norm": 0.7403701590091006,
      "learning_rate": 2.370654581370948e-05,
      "loss": 0.9967,
      "num_input_tokens_seen": 46001430000,
      "step": 58469
    },
    {
      "epoch": 6.2030553787396565,
      "grad_norm": 0.8984793525141431,
      "learning_rate": 2.3705851776171637e-05,
      "loss": 1.0668,
      "num_input_tokens_seen": 46002216720,
      "step": 58470
    },
    {
      "epoch": 6.2031614682792275,
      "grad_norm": 0.9136699880457895,
      "learning_rate": 2.370515773963387e-05,
      "loss": 0.9814,
      "num_input_tokens_seen": 46003003488,
      "step": 58471
    },
    {
      "epoch": 6.2032675578187995,
      "grad_norm": 0.7170994016200997,
      "learning_rate": 2.370446370409672e-05,
      "loss": 1.03,
      "num_input_tokens_seen": 46003790352,
      "step": 58472
    },
    {
      "epoch": 6.2033736473583705,
      "grad_norm": 0.7998221880835908,
      "learning_rate": 2.3703769669560724e-05,
      "loss": 0.962,
      "num_input_tokens_seen": 46004577168,
      "step": 58473
    },
    {
      "epoch": 6.2034797368979415,
      "grad_norm": 0.7913146614106946,
      "learning_rate": 2.3703075636026413e-05,
      "loss": 1.0472,
      "num_input_tokens_seen": 46005364048,
      "step": 58474
    },
    {
      "epoch": 6.203585826437513,
      "grad_norm": 0.8829778067154858,
      "learning_rate": 2.370238160349433e-05,
      "loss": 0.8764,
      "num_input_tokens_seen": 46006150784,
      "step": 58475
    },
    {
      "epoch": 6.2036919159770845,
      "grad_norm": 0.7711557004452259,
      "learning_rate": 2.370168757196501e-05,
      "loss": 0.899,
      "num_input_tokens_seen": 46006937568,
      "step": 58476
    },
    {
      "epoch": 6.203798005516656,
      "grad_norm": 1.2820014970479436,
      "learning_rate": 2.370099354143898e-05,
      "loss": 0.9864,
      "num_input_tokens_seen": 46007724256,
      "step": 58477
    },
    {
      "epoch": 6.203904095056227,
      "grad_norm": 0.6785388674482138,
      "learning_rate": 2.3700299511916794e-05,
      "loss": 1.0409,
      "num_input_tokens_seen": 46008511040,
      "step": 58478
    },
    {
      "epoch": 6.2040101845957984,
      "grad_norm": 0.8849298741988505,
      "learning_rate": 2.369960548339897e-05,
      "loss": 0.9544,
      "num_input_tokens_seen": 46009297728,
      "step": 58479
    },
    {
      "epoch": 6.20411627413537,
      "grad_norm": 0.9904796380714871,
      "learning_rate": 2.369891145588606e-05,
      "loss": 1.0476,
      "num_input_tokens_seen": 46010084432,
      "step": 58480
    },
    {
      "epoch": 6.204222363674941,
      "grad_norm": 1.2122353832190482,
      "learning_rate": 2.3698217429378588e-05,
      "loss": 1.0711,
      "num_input_tokens_seen": 46010871200,
      "step": 58481
    },
    {
      "epoch": 6.204328453214513,
      "grad_norm": 0.8461231876967437,
      "learning_rate": 2.3697523403877094e-05,
      "loss": 0.9545,
      "num_input_tokens_seen": 46011658032,
      "step": 58482
    },
    {
      "epoch": 6.204434542754084,
      "grad_norm": 1.3119716709364764,
      "learning_rate": 2.3696829379382123e-05,
      "loss": 0.9507,
      "num_input_tokens_seen": 46012444848,
      "step": 58483
    },
    {
      "epoch": 6.204540632293656,
      "grad_norm": 1.0901801553909496,
      "learning_rate": 2.36961353558942e-05,
      "loss": 1.0452,
      "num_input_tokens_seen": 46013231616,
      "step": 58484
    },
    {
      "epoch": 6.204646721833227,
      "grad_norm": 0.7630867809271448,
      "learning_rate": 2.369544133341386e-05,
      "loss": 0.9684,
      "num_input_tokens_seen": 46014018368,
      "step": 58485
    },
    {
      "epoch": 6.204752811372798,
      "grad_norm": 1.0876501463332282,
      "learning_rate": 2.3694747311941652e-05,
      "loss": 1.0309,
      "num_input_tokens_seen": 46014805120,
      "step": 58486
    },
    {
      "epoch": 6.20485890091237,
      "grad_norm": 0.8566253027130365,
      "learning_rate": 2.3694053291478103e-05,
      "loss": 0.9864,
      "num_input_tokens_seen": 46015591840,
      "step": 58487
    },
    {
      "epoch": 6.204964990451941,
      "grad_norm": 0.8855968694327118,
      "learning_rate": 2.369335927202375e-05,
      "loss": 1.0138,
      "num_input_tokens_seen": 46016378624,
      "step": 58488
    },
    {
      "epoch": 6.205071079991513,
      "grad_norm": 0.8213190951765567,
      "learning_rate": 2.3692665253579132e-05,
      "loss": 1.0599,
      "num_input_tokens_seen": 46017165328,
      "step": 58489
    },
    {
      "epoch": 6.205177169531084,
      "grad_norm": 0.9949655752325758,
      "learning_rate": 2.3691971236144786e-05,
      "loss": 1.0106,
      "num_input_tokens_seen": 46017952128,
      "step": 58490
    },
    {
      "epoch": 6.205283259070655,
      "grad_norm": 0.7395664666355231,
      "learning_rate": 2.3691277219721243e-05,
      "loss": 0.9408,
      "num_input_tokens_seen": 46018738976,
      "step": 58491
    },
    {
      "epoch": 6.205389348610227,
      "grad_norm": 1.1140202555058962,
      "learning_rate": 2.3690583204309043e-05,
      "loss": 0.9766,
      "num_input_tokens_seen": 46019525728,
      "step": 58492
    },
    {
      "epoch": 6.205495438149798,
      "grad_norm": 0.8944945587483268,
      "learning_rate": 2.3689889189908722e-05,
      "loss": 0.9737,
      "num_input_tokens_seen": 46020312416,
      "step": 58493
    },
    {
      "epoch": 6.20560152768937,
      "grad_norm": 0.8324337519988964,
      "learning_rate": 2.3689195176520816e-05,
      "loss": 0.9576,
      "num_input_tokens_seen": 46021099168,
      "step": 58494
    },
    {
      "epoch": 6.205707617228941,
      "grad_norm": 0.6459118679359456,
      "learning_rate": 2.3688501164145862e-05,
      "loss": 1.0243,
      "num_input_tokens_seen": 46021886048,
      "step": 58495
    },
    {
      "epoch": 6.205813706768513,
      "grad_norm": 1.0638763146331938,
      "learning_rate": 2.3687807152784394e-05,
      "loss": 0.9845,
      "num_input_tokens_seen": 46022672768,
      "step": 58496
    },
    {
      "epoch": 6.205919796308084,
      "grad_norm": 0.8691655530653734,
      "learning_rate": 2.3687113142436953e-05,
      "loss": 1.1215,
      "num_input_tokens_seen": 46023459504,
      "step": 58497
    },
    {
      "epoch": 6.206025885847655,
      "grad_norm": 0.7957117738694468,
      "learning_rate": 2.3686419133104075e-05,
      "loss": 1.0423,
      "num_input_tokens_seen": 46024246208,
      "step": 58498
    },
    {
      "epoch": 6.206131975387227,
      "grad_norm": 0.7619110554721285,
      "learning_rate": 2.3685725124786284e-05,
      "loss": 0.9269,
      "num_input_tokens_seen": 46025032944,
      "step": 58499
    },
    {
      "epoch": 6.206238064926798,
      "grad_norm": 0.8295091727828267,
      "learning_rate": 2.3685031117484136e-05,
      "loss": 1.0,
      "num_input_tokens_seen": 46025819728,
      "step": 58500
    },
    {
      "epoch": 6.20634415446637,
      "grad_norm": 1.0684759539939515,
      "learning_rate": 2.3684337111198154e-05,
      "loss": 1.0187,
      "num_input_tokens_seen": 46026606480,
      "step": 58501
    },
    {
      "epoch": 6.206450244005941,
      "grad_norm": 1.0958943833075199,
      "learning_rate": 2.3683643105928875e-05,
      "loss": 1.067,
      "num_input_tokens_seen": 46027393136,
      "step": 58502
    },
    {
      "epoch": 6.206556333545512,
      "grad_norm": 0.8252581847726587,
      "learning_rate": 2.368294910167684e-05,
      "loss": 1.0771,
      "num_input_tokens_seen": 46028179872,
      "step": 58503
    },
    {
      "epoch": 6.206662423085084,
      "grad_norm": 0.7561384173875637,
      "learning_rate": 2.3682255098442585e-05,
      "loss": 0.9678,
      "num_input_tokens_seen": 46028966688,
      "step": 58504
    },
    {
      "epoch": 6.206768512624655,
      "grad_norm": 1.0171747920241347,
      "learning_rate": 2.368156109622664e-05,
      "loss": 1.0209,
      "num_input_tokens_seen": 46029753440,
      "step": 58505
    },
    {
      "epoch": 6.206874602164227,
      "grad_norm": 0.9666854403956361,
      "learning_rate": 2.3680867095029553e-05,
      "loss": 0.9894,
      "num_input_tokens_seen": 46030540304,
      "step": 58506
    },
    {
      "epoch": 6.206980691703798,
      "grad_norm": 0.9589653062010989,
      "learning_rate": 2.3680173094851847e-05,
      "loss": 1.0294,
      "num_input_tokens_seen": 46031327120,
      "step": 58507
    },
    {
      "epoch": 6.207086781243369,
      "grad_norm": 1.2808686480516294,
      "learning_rate": 2.3679479095694064e-05,
      "loss": 1.0738,
      "num_input_tokens_seen": 46032113920,
      "step": 58508
    },
    {
      "epoch": 6.207192870782941,
      "grad_norm": 1.088607419469453,
      "learning_rate": 2.3678785097556745e-05,
      "loss": 0.9736,
      "num_input_tokens_seen": 46032900688,
      "step": 58509
    },
    {
      "epoch": 6.207298960322512,
      "grad_norm": 0.9188736634767514,
      "learning_rate": 2.3678091100440426e-05,
      "loss": 1.0521,
      "num_input_tokens_seen": 46033687456,
      "step": 58510
    },
    {
      "epoch": 6.207405049862084,
      "grad_norm": 0.7917655226376339,
      "learning_rate": 2.367739710434563e-05,
      "loss": 1.0025,
      "num_input_tokens_seen": 46034474160,
      "step": 58511
    },
    {
      "epoch": 6.207511139401655,
      "grad_norm": 0.982352979511813,
      "learning_rate": 2.3676703109272906e-05,
      "loss": 0.9996,
      "num_input_tokens_seen": 46035260960,
      "step": 58512
    },
    {
      "epoch": 6.207617228941227,
      "grad_norm": 0.8049303323239886,
      "learning_rate": 2.3676009115222786e-05,
      "loss": 1.0795,
      "num_input_tokens_seen": 46036047728,
      "step": 58513
    },
    {
      "epoch": 6.207723318480798,
      "grad_norm": 0.8314245946590103,
      "learning_rate": 2.3675315122195813e-05,
      "loss": 0.9872,
      "num_input_tokens_seen": 46036834448,
      "step": 58514
    },
    {
      "epoch": 6.207829408020369,
      "grad_norm": 0.8405184975869514,
      "learning_rate": 2.3674621130192514e-05,
      "loss": 1.0382,
      "num_input_tokens_seen": 46037621216,
      "step": 58515
    },
    {
      "epoch": 6.207935497559941,
      "grad_norm": 1.132329824225935,
      "learning_rate": 2.3673927139213427e-05,
      "loss": 1.0483,
      "num_input_tokens_seen": 46038408016,
      "step": 58516
    },
    {
      "epoch": 6.208041587099512,
      "grad_norm": 0.8800587173051614,
      "learning_rate": 2.367323314925909e-05,
      "loss": 1.0346,
      "num_input_tokens_seen": 46039194832,
      "step": 58517
    },
    {
      "epoch": 6.208147676639084,
      "grad_norm": 0.7072132279342636,
      "learning_rate": 2.3672539160330046e-05,
      "loss": 1.0421,
      "num_input_tokens_seen": 46039981552,
      "step": 58518
    },
    {
      "epoch": 6.208253766178655,
      "grad_norm": 0.7559570428659546,
      "learning_rate": 2.3671845172426817e-05,
      "loss": 1.0154,
      "num_input_tokens_seen": 46040768448,
      "step": 58519
    },
    {
      "epoch": 6.208359855718226,
      "grad_norm": 0.9043683943192323,
      "learning_rate": 2.367115118554995e-05,
      "loss": 0.9873,
      "num_input_tokens_seen": 46041555168,
      "step": 58520
    },
    {
      "epoch": 6.208465945257798,
      "grad_norm": 0.7468977403246183,
      "learning_rate": 2.367045719969998e-05,
      "loss": 1.007,
      "num_input_tokens_seen": 46042342032,
      "step": 58521
    },
    {
      "epoch": 6.208572034797369,
      "grad_norm": 0.9070026992706379,
      "learning_rate": 2.366976321487744e-05,
      "loss": 1.0469,
      "num_input_tokens_seen": 46043128784,
      "step": 58522
    },
    {
      "epoch": 6.208678124336941,
      "grad_norm": 0.7278986011698332,
      "learning_rate": 2.3669069231082865e-05,
      "loss": 1.0838,
      "num_input_tokens_seen": 46043915632,
      "step": 58523
    },
    {
      "epoch": 6.208784213876512,
      "grad_norm": 0.8387322327822999,
      "learning_rate": 2.3668375248316802e-05,
      "loss": 0.9968,
      "num_input_tokens_seen": 46044702464,
      "step": 58524
    },
    {
      "epoch": 6.208890303416084,
      "grad_norm": 0.7238881398017564,
      "learning_rate": 2.3667681266579773e-05,
      "loss": 0.9729,
      "num_input_tokens_seen": 46045489184,
      "step": 58525
    },
    {
      "epoch": 6.208996392955655,
      "grad_norm": 0.7036259679601576,
      "learning_rate": 2.3666987285872322e-05,
      "loss": 1.0291,
      "num_input_tokens_seen": 46046276016,
      "step": 58526
    },
    {
      "epoch": 6.209102482495226,
      "grad_norm": 0.6570761862014536,
      "learning_rate": 2.3666293306194985e-05,
      "loss": 1.0362,
      "num_input_tokens_seen": 46047062688,
      "step": 58527
    },
    {
      "epoch": 6.209208572034798,
      "grad_norm": 0.9305531387043849,
      "learning_rate": 2.3665599327548298e-05,
      "loss": 0.981,
      "num_input_tokens_seen": 46047849456,
      "step": 58528
    },
    {
      "epoch": 6.209314661574369,
      "grad_norm": 0.7232308678187959,
      "learning_rate": 2.3664905349932795e-05,
      "loss": 0.947,
      "num_input_tokens_seen": 46048636288,
      "step": 58529
    },
    {
      "epoch": 6.2094207511139405,
      "grad_norm": 1.0237225670672707,
      "learning_rate": 2.3664211373349012e-05,
      "loss": 0.9936,
      "num_input_tokens_seen": 46049423120,
      "step": 58530
    },
    {
      "epoch": 6.209526840653512,
      "grad_norm": 0.7189648106146961,
      "learning_rate": 2.366351739779749e-05,
      "loss": 1.0049,
      "num_input_tokens_seen": 46050209808,
      "step": 58531
    },
    {
      "epoch": 6.209632930193083,
      "grad_norm": 0.846930192866971,
      "learning_rate": 2.3662823423278765e-05,
      "loss": 1.0286,
      "num_input_tokens_seen": 46050996576,
      "step": 58532
    },
    {
      "epoch": 6.2097390197326545,
      "grad_norm": 1.0328222497079182,
      "learning_rate": 2.3662129449793365e-05,
      "loss": 1.0316,
      "num_input_tokens_seen": 46051783312,
      "step": 58533
    },
    {
      "epoch": 6.2098451092722255,
      "grad_norm": 0.8108473064637917,
      "learning_rate": 2.366143547734184e-05,
      "loss": 1.0409,
      "num_input_tokens_seen": 46052570048,
      "step": 58534
    },
    {
      "epoch": 6.2099511988117975,
      "grad_norm": 0.7340562449223729,
      "learning_rate": 2.3660741505924716e-05,
      "loss": 0.9431,
      "num_input_tokens_seen": 46053356784,
      "step": 58535
    },
    {
      "epoch": 6.2100572883513685,
      "grad_norm": 0.8927183718496122,
      "learning_rate": 2.3660047535542526e-05,
      "loss": 0.953,
      "num_input_tokens_seen": 46054143600,
      "step": 58536
    },
    {
      "epoch": 6.2101633778909395,
      "grad_norm": 0.8290373376688469,
      "learning_rate": 2.3659353566195817e-05,
      "loss": 1.0444,
      "num_input_tokens_seen": 46054930352,
      "step": 58537
    },
    {
      "epoch": 6.2102694674305114,
      "grad_norm": 0.6981784250013474,
      "learning_rate": 2.365865959788512e-05,
      "loss": 0.964,
      "num_input_tokens_seen": 46055717120,
      "step": 58538
    },
    {
      "epoch": 6.2103755569700825,
      "grad_norm": 0.869961519827924,
      "learning_rate": 2.3657965630610968e-05,
      "loss": 1.0196,
      "num_input_tokens_seen": 46056503920,
      "step": 58539
    },
    {
      "epoch": 6.210481646509654,
      "grad_norm": 0.8624197384554677,
      "learning_rate": 2.3657271664373903e-05,
      "loss": 1.0576,
      "num_input_tokens_seen": 46057290720,
      "step": 58540
    },
    {
      "epoch": 6.210587736049225,
      "grad_norm": 0.7376976743210325,
      "learning_rate": 2.3656577699174463e-05,
      "loss": 1.0219,
      "num_input_tokens_seen": 46058077504,
      "step": 58541
    },
    {
      "epoch": 6.210693825588797,
      "grad_norm": 1.0954862229829574,
      "learning_rate": 2.365588373501317e-05,
      "loss": 0.9911,
      "num_input_tokens_seen": 46058864272,
      "step": 58542
    },
    {
      "epoch": 6.210799915128368,
      "grad_norm": 0.7670351831303424,
      "learning_rate": 2.365518977189058e-05,
      "loss": 0.9384,
      "num_input_tokens_seen": 46059651104,
      "step": 58543
    },
    {
      "epoch": 6.210906004667939,
      "grad_norm": 1.0816611938499772,
      "learning_rate": 2.365449580980722e-05,
      "loss": 1.0392,
      "num_input_tokens_seen": 46060437888,
      "step": 58544
    },
    {
      "epoch": 6.211012094207511,
      "grad_norm": 0.6927899682227886,
      "learning_rate": 2.365380184876362e-05,
      "loss": 0.9674,
      "num_input_tokens_seen": 46061224592,
      "step": 58545
    },
    {
      "epoch": 6.211118183747082,
      "grad_norm": 0.8686276053854693,
      "learning_rate": 2.3653107888760326e-05,
      "loss": 0.9923,
      "num_input_tokens_seen": 46062011376,
      "step": 58546
    },
    {
      "epoch": 6.211224273286654,
      "grad_norm": 0.8824823129422346,
      "learning_rate": 2.3652413929797868e-05,
      "loss": 0.9861,
      "num_input_tokens_seen": 46062798208,
      "step": 58547
    },
    {
      "epoch": 6.211330362826225,
      "grad_norm": 0.7446745277921576,
      "learning_rate": 2.365171997187679e-05,
      "loss": 0.9996,
      "num_input_tokens_seen": 46063585008,
      "step": 58548
    },
    {
      "epoch": 6.211436452365796,
      "grad_norm": 0.7864420018243796,
      "learning_rate": 2.3651026014997622e-05,
      "loss": 0.9967,
      "num_input_tokens_seen": 46064371840,
      "step": 58549
    },
    {
      "epoch": 6.211542541905368,
      "grad_norm": 0.7121545808803367,
      "learning_rate": 2.3650332059160895e-05,
      "loss": 1.0652,
      "num_input_tokens_seen": 46065158720,
      "step": 58550
    },
    {
      "epoch": 6.211648631444939,
      "grad_norm": 0.7315099109547271,
      "learning_rate": 2.364963810436716e-05,
      "loss": 1.0384,
      "num_input_tokens_seen": 46065945408,
      "step": 58551
    },
    {
      "epoch": 6.211754720984511,
      "grad_norm": 0.8877611215471398,
      "learning_rate": 2.3648944150616946e-05,
      "loss": 1.032,
      "num_input_tokens_seen": 46066732240,
      "step": 58552
    },
    {
      "epoch": 6.211860810524082,
      "grad_norm": 1.053329881772611,
      "learning_rate": 2.3648250197910778e-05,
      "loss": 1.0501,
      "num_input_tokens_seen": 46067519088,
      "step": 58553
    },
    {
      "epoch": 6.211966900063654,
      "grad_norm": 0.8213786374657578,
      "learning_rate": 2.3647556246249212e-05,
      "loss": 1.0577,
      "num_input_tokens_seen": 46068305872,
      "step": 58554
    },
    {
      "epoch": 6.212072989603225,
      "grad_norm": 1.0242416589869097,
      "learning_rate": 2.3646862295632772e-05,
      "loss": 1.0501,
      "num_input_tokens_seen": 46069092624,
      "step": 58555
    },
    {
      "epoch": 6.212179079142796,
      "grad_norm": 0.8996117184573046,
      "learning_rate": 2.3646168346061992e-05,
      "loss": 1.0412,
      "num_input_tokens_seen": 46069879328,
      "step": 58556
    },
    {
      "epoch": 6.212285168682368,
      "grad_norm": 0.6665176298546427,
      "learning_rate": 2.364547439753742e-05,
      "loss": 0.8734,
      "num_input_tokens_seen": 46070666160,
      "step": 58557
    },
    {
      "epoch": 6.212391258221939,
      "grad_norm": 0.7471810185669324,
      "learning_rate": 2.3644780450059575e-05,
      "loss": 1.0503,
      "num_input_tokens_seen": 46071452912,
      "step": 58558
    },
    {
      "epoch": 6.212497347761511,
      "grad_norm": 0.8832595395591298,
      "learning_rate": 2.3644086503629014e-05,
      "loss": 0.9526,
      "num_input_tokens_seen": 46072239680,
      "step": 58559
    },
    {
      "epoch": 6.212603437301082,
      "grad_norm": 0.731379740991712,
      "learning_rate": 2.3643392558246262e-05,
      "loss": 1.0411,
      "num_input_tokens_seen": 46073026448,
      "step": 58560
    },
    {
      "epoch": 6.212709526840653,
      "grad_norm": 1.3438873087353749,
      "learning_rate": 2.3642698613911856e-05,
      "loss": 1.0247,
      "num_input_tokens_seen": 46073813216,
      "step": 58561
    },
    {
      "epoch": 6.212815616380225,
      "grad_norm": 0.7023306936221969,
      "learning_rate": 2.3642004670626334e-05,
      "loss": 1.0267,
      "num_input_tokens_seen": 46074599968,
      "step": 58562
    },
    {
      "epoch": 6.212921705919796,
      "grad_norm": 0.992386107117704,
      "learning_rate": 2.364131072839023e-05,
      "loss": 1.0334,
      "num_input_tokens_seen": 46075386608,
      "step": 58563
    },
    {
      "epoch": 6.213027795459368,
      "grad_norm": 0.9045807354967818,
      "learning_rate": 2.3640616787204082e-05,
      "loss": 0.9749,
      "num_input_tokens_seen": 46076173344,
      "step": 58564
    },
    {
      "epoch": 6.213133884998939,
      "grad_norm": 0.758470361945849,
      "learning_rate": 2.3639922847068425e-05,
      "loss": 0.998,
      "num_input_tokens_seen": 46076960128,
      "step": 58565
    },
    {
      "epoch": 6.21323997453851,
      "grad_norm": 0.9765757864973852,
      "learning_rate": 2.363922890798379e-05,
      "loss": 0.995,
      "num_input_tokens_seen": 46077746912,
      "step": 58566
    },
    {
      "epoch": 6.213346064078082,
      "grad_norm": 0.8273932677062658,
      "learning_rate": 2.3638534969950727e-05,
      "loss": 1.0354,
      "num_input_tokens_seen": 46078533648,
      "step": 58567
    },
    {
      "epoch": 6.213452153617653,
      "grad_norm": 0.6465438086670086,
      "learning_rate": 2.363784103296976e-05,
      "loss": 0.902,
      "num_input_tokens_seen": 46079320432,
      "step": 58568
    },
    {
      "epoch": 6.213558243157225,
      "grad_norm": 0.8130484889157913,
      "learning_rate": 2.363714709704143e-05,
      "loss": 0.9706,
      "num_input_tokens_seen": 46080107328,
      "step": 58569
    },
    {
      "epoch": 6.213664332696796,
      "grad_norm": 1.174938620577431,
      "learning_rate": 2.363645316216628e-05,
      "loss": 1.032,
      "num_input_tokens_seen": 46080894048,
      "step": 58570
    },
    {
      "epoch": 6.213770422236368,
      "grad_norm": 0.8349377556160574,
      "learning_rate": 2.3635759228344825e-05,
      "loss": 1.1059,
      "num_input_tokens_seen": 46081680736,
      "step": 58571
    },
    {
      "epoch": 6.213876511775939,
      "grad_norm": 1.3598375122826285,
      "learning_rate": 2.3635065295577627e-05,
      "loss": 1.0002,
      "num_input_tokens_seen": 46082467552,
      "step": 58572
    },
    {
      "epoch": 6.21398260131551,
      "grad_norm": 1.2442466121507527,
      "learning_rate": 2.3634371363865208e-05,
      "loss": 1.1025,
      "num_input_tokens_seen": 46083254416,
      "step": 58573
    },
    {
      "epoch": 6.214088690855082,
      "grad_norm": 0.771640914731733,
      "learning_rate": 2.36336774332081e-05,
      "loss": 0.9914,
      "num_input_tokens_seen": 46084041184,
      "step": 58574
    },
    {
      "epoch": 6.214194780394653,
      "grad_norm": 0.8413508159951117,
      "learning_rate": 2.3632983503606853e-05,
      "loss": 1.0679,
      "num_input_tokens_seen": 46084827936,
      "step": 58575
    },
    {
      "epoch": 6.214300869934225,
      "grad_norm": 1.5023218789724977,
      "learning_rate": 2.3632289575062e-05,
      "loss": 0.9407,
      "num_input_tokens_seen": 46085614800,
      "step": 58576
    },
    {
      "epoch": 6.214406959473796,
      "grad_norm": 1.2646154019536835,
      "learning_rate": 2.363159564757406e-05,
      "loss": 0.9916,
      "num_input_tokens_seen": 46086401568,
      "step": 58577
    },
    {
      "epoch": 6.214513049013367,
      "grad_norm": 1.0015232252959714,
      "learning_rate": 2.3630901721143594e-05,
      "loss": 0.9972,
      "num_input_tokens_seen": 46087188384,
      "step": 58578
    },
    {
      "epoch": 6.214619138552939,
      "grad_norm": 1.9734029408531806,
      "learning_rate": 2.3630207795771125e-05,
      "loss": 0.9694,
      "num_input_tokens_seen": 46087975152,
      "step": 58579
    },
    {
      "epoch": 6.21472522809251,
      "grad_norm": 0.881568180215739,
      "learning_rate": 2.3629513871457187e-05,
      "loss": 1.0109,
      "num_input_tokens_seen": 46088761952,
      "step": 58580
    },
    {
      "epoch": 6.214831317632082,
      "grad_norm": 0.9793977660830702,
      "learning_rate": 2.3628819948202324e-05,
      "loss": 0.9692,
      "num_input_tokens_seen": 46089548688,
      "step": 58581
    },
    {
      "epoch": 6.214937407171653,
      "grad_norm": 0.7251830296437706,
      "learning_rate": 2.3628126026007065e-05,
      "loss": 1.0378,
      "num_input_tokens_seen": 46090335504,
      "step": 58582
    },
    {
      "epoch": 6.215043496711225,
      "grad_norm": 0.68040805110141,
      "learning_rate": 2.3627432104871957e-05,
      "loss": 1.0607,
      "num_input_tokens_seen": 46091122224,
      "step": 58583
    },
    {
      "epoch": 6.215149586250796,
      "grad_norm": 0.9072181825595375,
      "learning_rate": 2.3626738184797526e-05,
      "loss": 1.0546,
      "num_input_tokens_seen": 46091909104,
      "step": 58584
    },
    {
      "epoch": 6.215255675790367,
      "grad_norm": 0.8930852397950254,
      "learning_rate": 2.3626044265784306e-05,
      "loss": 0.9964,
      "num_input_tokens_seen": 46092695936,
      "step": 58585
    },
    {
      "epoch": 6.215361765329939,
      "grad_norm": 1.4703469207534368,
      "learning_rate": 2.3625350347832846e-05,
      "loss": 0.9968,
      "num_input_tokens_seen": 46093482704,
      "step": 58586
    },
    {
      "epoch": 6.21546785486951,
      "grad_norm": 0.7548286411376223,
      "learning_rate": 2.3624656430943672e-05,
      "loss": 1.036,
      "num_input_tokens_seen": 46094269440,
      "step": 58587
    },
    {
      "epoch": 6.215573944409082,
      "grad_norm": 0.7833704264768653,
      "learning_rate": 2.362396251511732e-05,
      "loss": 0.9159,
      "num_input_tokens_seen": 46095056240,
      "step": 58588
    },
    {
      "epoch": 6.215680033948653,
      "grad_norm": 0.7346493051291809,
      "learning_rate": 2.3623268600354338e-05,
      "loss": 0.9821,
      "num_input_tokens_seen": 46095843040,
      "step": 58589
    },
    {
      "epoch": 6.215786123488224,
      "grad_norm": 0.7568208063601413,
      "learning_rate": 2.3622574686655247e-05,
      "loss": 0.8946,
      "num_input_tokens_seen": 46096629760,
      "step": 58590
    },
    {
      "epoch": 6.215892213027796,
      "grad_norm": 0.715244028285085,
      "learning_rate": 2.3621880774020588e-05,
      "loss": 1.0001,
      "num_input_tokens_seen": 46097416544,
      "step": 58591
    },
    {
      "epoch": 6.215998302567367,
      "grad_norm": 0.9261293782955189,
      "learning_rate": 2.3621186862450907e-05,
      "loss": 1.0139,
      "num_input_tokens_seen": 46098203296,
      "step": 58592
    },
    {
      "epoch": 6.2161043921069385,
      "grad_norm": 0.8694226752148763,
      "learning_rate": 2.3620492951946726e-05,
      "loss": 1.0334,
      "num_input_tokens_seen": 46098990016,
      "step": 58593
    },
    {
      "epoch": 6.21621048164651,
      "grad_norm": 0.7280053624642072,
      "learning_rate": 2.3619799042508587e-05,
      "loss": 1.0371,
      "num_input_tokens_seen": 46099776768,
      "step": 58594
    },
    {
      "epoch": 6.216316571186081,
      "grad_norm": 0.7613758310911661,
      "learning_rate": 2.361910513413703e-05,
      "loss": 1.0214,
      "num_input_tokens_seen": 46100563488,
      "step": 58595
    },
    {
      "epoch": 6.2164226607256525,
      "grad_norm": 0.7657340999337993,
      "learning_rate": 2.361841122683259e-05,
      "loss": 0.9559,
      "num_input_tokens_seen": 46101350256,
      "step": 58596
    },
    {
      "epoch": 6.216528750265224,
      "grad_norm": 0.7618847567970348,
      "learning_rate": 2.3617717320595793e-05,
      "loss": 1.091,
      "num_input_tokens_seen": 46102137056,
      "step": 58597
    },
    {
      "epoch": 6.2166348398047955,
      "grad_norm": 0.6840366719840755,
      "learning_rate": 2.361702341542719e-05,
      "loss": 1.0425,
      "num_input_tokens_seen": 46102923856,
      "step": 58598
    },
    {
      "epoch": 6.2167409293443665,
      "grad_norm": 0.7014336745546458,
      "learning_rate": 2.361632951132731e-05,
      "loss": 0.9231,
      "num_input_tokens_seen": 46103710592,
      "step": 58599
    },
    {
      "epoch": 6.216847018883938,
      "grad_norm": 0.8818247153619435,
      "learning_rate": 2.361563560829669e-05,
      "loss": 1.0636,
      "num_input_tokens_seen": 46104497408,
      "step": 58600
    },
    {
      "epoch": 6.2169531084235095,
      "grad_norm": 0.8907484843927553,
      "learning_rate": 2.3614941706335867e-05,
      "loss": 0.992,
      "num_input_tokens_seen": 46105284176,
      "step": 58601
    },
    {
      "epoch": 6.2170591979630805,
      "grad_norm": 0.9562297568330971,
      "learning_rate": 2.361424780544537e-05,
      "loss": 1.0312,
      "num_input_tokens_seen": 46106070992,
      "step": 58602
    },
    {
      "epoch": 6.217165287502652,
      "grad_norm": 0.7662113445280719,
      "learning_rate": 2.3613553905625752e-05,
      "loss": 0.9994,
      "num_input_tokens_seen": 46106857856,
      "step": 58603
    },
    {
      "epoch": 6.217271377042223,
      "grad_norm": 0.7177039599355891,
      "learning_rate": 2.361286000687753e-05,
      "loss": 0.9783,
      "num_input_tokens_seen": 46107644624,
      "step": 58604
    },
    {
      "epoch": 6.217377466581795,
      "grad_norm": 0.8087614556081302,
      "learning_rate": 2.3612166109201254e-05,
      "loss": 1.015,
      "num_input_tokens_seen": 46108431392,
      "step": 58605
    },
    {
      "epoch": 6.217483556121366,
      "grad_norm": 0.9313208428569926,
      "learning_rate": 2.3611472212597456e-05,
      "loss": 1.0111,
      "num_input_tokens_seen": 46109218144,
      "step": 58606
    },
    {
      "epoch": 6.217589645660937,
      "grad_norm": 0.8808462575725606,
      "learning_rate": 2.361077831706667e-05,
      "loss": 1.0363,
      "num_input_tokens_seen": 46110004896,
      "step": 58607
    },
    {
      "epoch": 6.217695735200509,
      "grad_norm": 1.0875230908562685,
      "learning_rate": 2.361008442260943e-05,
      "loss": 1.1453,
      "num_input_tokens_seen": 46110791648,
      "step": 58608
    },
    {
      "epoch": 6.21780182474008,
      "grad_norm": 0.7859940064572213,
      "learning_rate": 2.360939052922628e-05,
      "loss": 0.9306,
      "num_input_tokens_seen": 46111578368,
      "step": 58609
    },
    {
      "epoch": 6.217907914279652,
      "grad_norm": 0.9389365383498399,
      "learning_rate": 2.3608696636917753e-05,
      "loss": 0.9599,
      "num_input_tokens_seen": 46112365104,
      "step": 58610
    },
    {
      "epoch": 6.218014003819223,
      "grad_norm": 0.7412276896819132,
      "learning_rate": 2.3608002745684378e-05,
      "loss": 0.9957,
      "num_input_tokens_seen": 46113151856,
      "step": 58611
    },
    {
      "epoch": 6.218120093358795,
      "grad_norm": 0.8001417275629396,
      "learning_rate": 2.3607308855526708e-05,
      "loss": 1.013,
      "num_input_tokens_seen": 46113938688,
      "step": 58612
    },
    {
      "epoch": 6.218226182898366,
      "grad_norm": 1.1931282779612418,
      "learning_rate": 2.3606614966445264e-05,
      "loss": 0.9817,
      "num_input_tokens_seen": 46114725424,
      "step": 58613
    },
    {
      "epoch": 6.218332272437937,
      "grad_norm": 0.8977896661432408,
      "learning_rate": 2.360592107844058e-05,
      "loss": 1.0099,
      "num_input_tokens_seen": 46115512144,
      "step": 58614
    },
    {
      "epoch": 6.218438361977509,
      "grad_norm": 0.8644811453901706,
      "learning_rate": 2.360522719151321e-05,
      "loss": 1.0448,
      "num_input_tokens_seen": 46116298880,
      "step": 58615
    },
    {
      "epoch": 6.21854445151708,
      "grad_norm": 1.1442205414763484,
      "learning_rate": 2.360453330566367e-05,
      "loss": 0.9952,
      "num_input_tokens_seen": 46117085648,
      "step": 58616
    },
    {
      "epoch": 6.218650541056652,
      "grad_norm": 0.6270864267842202,
      "learning_rate": 2.3603839420892514e-05,
      "loss": 0.9269,
      "num_input_tokens_seen": 46117872432,
      "step": 58617
    },
    {
      "epoch": 6.218756630596223,
      "grad_norm": 0.893496109858582,
      "learning_rate": 2.360314553720027e-05,
      "loss": 0.993,
      "num_input_tokens_seen": 46118659184,
      "step": 58618
    },
    {
      "epoch": 6.218862720135794,
      "grad_norm": 1.0545237401478647,
      "learning_rate": 2.3602451654587467e-05,
      "loss": 1.0651,
      "num_input_tokens_seen": 46119445968,
      "step": 58619
    },
    {
      "epoch": 6.218968809675366,
      "grad_norm": 0.8735659605821687,
      "learning_rate": 2.3601757773054652e-05,
      "loss": 1.081,
      "num_input_tokens_seen": 46120232704,
      "step": 58620
    },
    {
      "epoch": 6.219074899214937,
      "grad_norm": 0.9847906806108835,
      "learning_rate": 2.3601063892602363e-05,
      "loss": 0.9471,
      "num_input_tokens_seen": 46121019552,
      "step": 58621
    },
    {
      "epoch": 6.219180988754509,
      "grad_norm": 1.0814428147541497,
      "learning_rate": 2.3600370013231122e-05,
      "loss": 1.0353,
      "num_input_tokens_seen": 46121806224,
      "step": 58622
    },
    {
      "epoch": 6.21928707829408,
      "grad_norm": 0.7582998486792366,
      "learning_rate": 2.3599676134941478e-05,
      "loss": 0.9789,
      "num_input_tokens_seen": 46122593008,
      "step": 58623
    },
    {
      "epoch": 6.219393167833651,
      "grad_norm": 1.0677970325454649,
      "learning_rate": 2.3598982257733965e-05,
      "loss": 1.096,
      "num_input_tokens_seen": 46123379728,
      "step": 58624
    },
    {
      "epoch": 6.219499257373223,
      "grad_norm": 1.0262957054733437,
      "learning_rate": 2.3598288381609113e-05,
      "loss": 0.9765,
      "num_input_tokens_seen": 46124166480,
      "step": 58625
    },
    {
      "epoch": 6.219605346912794,
      "grad_norm": 0.7716250700363779,
      "learning_rate": 2.3597594506567467e-05,
      "loss": 1.042,
      "num_input_tokens_seen": 46124953296,
      "step": 58626
    },
    {
      "epoch": 6.219711436452366,
      "grad_norm": 0.8401788947064754,
      "learning_rate": 2.359690063260956e-05,
      "loss": 1.0297,
      "num_input_tokens_seen": 46125740112,
      "step": 58627
    },
    {
      "epoch": 6.219817525991937,
      "grad_norm": 1.277653218406241,
      "learning_rate": 2.3596206759735918e-05,
      "loss": 1.0114,
      "num_input_tokens_seen": 46126526960,
      "step": 58628
    },
    {
      "epoch": 6.219923615531509,
      "grad_norm": 1.572826139015264,
      "learning_rate": 2.3595512887947092e-05,
      "loss": 1.0721,
      "num_input_tokens_seen": 46127313744,
      "step": 58629
    },
    {
      "epoch": 6.22002970507108,
      "grad_norm": 0.7529308037212629,
      "learning_rate": 2.3594819017243617e-05,
      "loss": 1.004,
      "num_input_tokens_seen": 46128100432,
      "step": 58630
    },
    {
      "epoch": 6.220135794610651,
      "grad_norm": 1.026619171907725,
      "learning_rate": 2.3594125147626015e-05,
      "loss": 1.0569,
      "num_input_tokens_seen": 46128887168,
      "step": 58631
    },
    {
      "epoch": 6.220241884150223,
      "grad_norm": 1.8405295548035712,
      "learning_rate": 2.3593431279094837e-05,
      "loss": 1.0161,
      "num_input_tokens_seen": 46129673936,
      "step": 58632
    },
    {
      "epoch": 6.220347973689794,
      "grad_norm": 1.023309174158781,
      "learning_rate": 2.3592737411650613e-05,
      "loss": 1.0063,
      "num_input_tokens_seen": 46130460704,
      "step": 58633
    },
    {
      "epoch": 6.220454063229366,
      "grad_norm": 0.933416517195585,
      "learning_rate": 2.3592043545293883e-05,
      "loss": 1.0728,
      "num_input_tokens_seen": 46131247456,
      "step": 58634
    },
    {
      "epoch": 6.220560152768937,
      "grad_norm": 1.1834320120936588,
      "learning_rate": 2.359134968002518e-05,
      "loss": 0.9498,
      "num_input_tokens_seen": 46132034272,
      "step": 58635
    },
    {
      "epoch": 6.220666242308508,
      "grad_norm": 0.8354699089361945,
      "learning_rate": 2.3590655815845036e-05,
      "loss": 0.9547,
      "num_input_tokens_seen": 46132821024,
      "step": 58636
    },
    {
      "epoch": 6.22077233184808,
      "grad_norm": 0.7623746243235278,
      "learning_rate": 2.3589961952754e-05,
      "loss": 0.9496,
      "num_input_tokens_seen": 46133607824,
      "step": 58637
    },
    {
      "epoch": 6.220878421387651,
      "grad_norm": 1.1811176065671678,
      "learning_rate": 2.358926809075259e-05,
      "loss": 0.9607,
      "num_input_tokens_seen": 46134394624,
      "step": 58638
    },
    {
      "epoch": 6.220984510927223,
      "grad_norm": 1.3665750383255335,
      "learning_rate": 2.3588574229841355e-05,
      "loss": 0.9567,
      "num_input_tokens_seen": 46135181520,
      "step": 58639
    },
    {
      "epoch": 6.221090600466794,
      "grad_norm": 0.7399521630890566,
      "learning_rate": 2.3587880370020834e-05,
      "loss": 1.0314,
      "num_input_tokens_seen": 46135968368,
      "step": 58640
    },
    {
      "epoch": 6.221196690006366,
      "grad_norm": 0.9195445436556657,
      "learning_rate": 2.3587186511291555e-05,
      "loss": 0.9943,
      "num_input_tokens_seen": 46136755168,
      "step": 58641
    },
    {
      "epoch": 6.221302779545937,
      "grad_norm": 1.158462137769925,
      "learning_rate": 2.3586492653654055e-05,
      "loss": 1.0358,
      "num_input_tokens_seen": 46137541920,
      "step": 58642
    },
    {
      "epoch": 6.221408869085508,
      "grad_norm": 0.7360608796082144,
      "learning_rate": 2.3585798797108874e-05,
      "loss": 0.9317,
      "num_input_tokens_seen": 46138328736,
      "step": 58643
    },
    {
      "epoch": 6.22151495862508,
      "grad_norm": 0.911051706803339,
      "learning_rate": 2.3585104941656546e-05,
      "loss": 1.0131,
      "num_input_tokens_seen": 46139115568,
      "step": 58644
    },
    {
      "epoch": 6.221621048164651,
      "grad_norm": 0.7172591837147307,
      "learning_rate": 2.35844110872976e-05,
      "loss": 0.9512,
      "num_input_tokens_seen": 46139902304,
      "step": 58645
    },
    {
      "epoch": 6.221727137704223,
      "grad_norm": 1.0795198168501883,
      "learning_rate": 2.3583717234032593e-05,
      "loss": 1.0469,
      "num_input_tokens_seen": 46140689040,
      "step": 58646
    },
    {
      "epoch": 6.221833227243794,
      "grad_norm": 0.7815537191131446,
      "learning_rate": 2.3583023381862043e-05,
      "loss": 1.0112,
      "num_input_tokens_seen": 46141475808,
      "step": 58647
    },
    {
      "epoch": 6.221939316783365,
      "grad_norm": 0.9156180525111399,
      "learning_rate": 2.3582329530786483e-05,
      "loss": 0.9744,
      "num_input_tokens_seen": 46142262608,
      "step": 58648
    },
    {
      "epoch": 6.222045406322937,
      "grad_norm": 0.7207203554175154,
      "learning_rate": 2.3581635680806465e-05,
      "loss": 1.0227,
      "num_input_tokens_seen": 46143049360,
      "step": 58649
    },
    {
      "epoch": 6.222151495862508,
      "grad_norm": 0.8943028007213591,
      "learning_rate": 2.3580941831922515e-05,
      "loss": 1.0811,
      "num_input_tokens_seen": 46143836112,
      "step": 58650
    },
    {
      "epoch": 6.22225758540208,
      "grad_norm": 0.8501063724530299,
      "learning_rate": 2.3580247984135174e-05,
      "loss": 0.9893,
      "num_input_tokens_seen": 46144622944,
      "step": 58651
    },
    {
      "epoch": 6.222363674941651,
      "grad_norm": 0.9634054246153779,
      "learning_rate": 2.357955413744497e-05,
      "loss": 1.1201,
      "num_input_tokens_seen": 46145409744,
      "step": 58652
    },
    {
      "epoch": 6.222469764481223,
      "grad_norm": 1.0896539295263494,
      "learning_rate": 2.3578860291852445e-05,
      "loss": 0.9513,
      "num_input_tokens_seen": 46146196432,
      "step": 58653
    },
    {
      "epoch": 6.222575854020794,
      "grad_norm": 0.8976624170694156,
      "learning_rate": 2.357816644735813e-05,
      "loss": 1.0274,
      "num_input_tokens_seen": 46146983200,
      "step": 58654
    },
    {
      "epoch": 6.222681943560365,
      "grad_norm": 0.7045873822706353,
      "learning_rate": 2.357747260396258e-05,
      "loss": 1.0266,
      "num_input_tokens_seen": 46147769984,
      "step": 58655
    },
    {
      "epoch": 6.2227880330999366,
      "grad_norm": 0.746814890264351,
      "learning_rate": 2.3576778761666315e-05,
      "loss": 0.989,
      "num_input_tokens_seen": 46148556784,
      "step": 58656
    },
    {
      "epoch": 6.222894122639508,
      "grad_norm": 1.1263123705923361,
      "learning_rate": 2.357608492046987e-05,
      "loss": 1.0165,
      "num_input_tokens_seen": 46149343456,
      "step": 58657
    },
    {
      "epoch": 6.2230002121790795,
      "grad_norm": 0.7201412901280606,
      "learning_rate": 2.3575391080373784e-05,
      "loss": 1.0396,
      "num_input_tokens_seen": 46150130240,
      "step": 58658
    },
    {
      "epoch": 6.2231063017186505,
      "grad_norm": 1.6959198766809593,
      "learning_rate": 2.3574697241378598e-05,
      "loss": 1.0533,
      "num_input_tokens_seen": 46150916912,
      "step": 58659
    },
    {
      "epoch": 6.223212391258222,
      "grad_norm": 0.8710982406084891,
      "learning_rate": 2.357400340348484e-05,
      "loss": 0.968,
      "num_input_tokens_seen": 46151703696,
      "step": 58660
    },
    {
      "epoch": 6.2233184807977935,
      "grad_norm": 0.6534515513370276,
      "learning_rate": 2.3573309566693053e-05,
      "loss": 0.9667,
      "num_input_tokens_seen": 46152490384,
      "step": 58661
    },
    {
      "epoch": 6.2234245703373645,
      "grad_norm": 0.8804004824107461,
      "learning_rate": 2.357261573100377e-05,
      "loss": 1.0224,
      "num_input_tokens_seen": 46153277072,
      "step": 58662
    },
    {
      "epoch": 6.223530659876936,
      "grad_norm": 0.8800413311791825,
      "learning_rate": 2.3571921896417527e-05,
      "loss": 1.0377,
      "num_input_tokens_seen": 46154063760,
      "step": 58663
    },
    {
      "epoch": 6.2236367494165075,
      "grad_norm": 0.7580969486408246,
      "learning_rate": 2.3571228062934862e-05,
      "loss": 0.9701,
      "num_input_tokens_seen": 46154850448,
      "step": 58664
    },
    {
      "epoch": 6.223742838956079,
      "grad_norm": 0.6024741722581622,
      "learning_rate": 2.357053423055631e-05,
      "loss": 1.0013,
      "num_input_tokens_seen": 46155637200,
      "step": 58665
    },
    {
      "epoch": 6.22384892849565,
      "grad_norm": 1.1317470846214404,
      "learning_rate": 2.3569840399282402e-05,
      "loss": 0.9985,
      "num_input_tokens_seen": 46156423920,
      "step": 58666
    },
    {
      "epoch": 6.223955018035221,
      "grad_norm": 0.952824445729348,
      "learning_rate": 2.3569146569113685e-05,
      "loss": 1.0156,
      "num_input_tokens_seen": 46157210704,
      "step": 58667
    },
    {
      "epoch": 6.224061107574793,
      "grad_norm": 0.8439943345498682,
      "learning_rate": 2.3568452740050692e-05,
      "loss": 1.0503,
      "num_input_tokens_seen": 46157997488,
      "step": 58668
    },
    {
      "epoch": 6.224167197114364,
      "grad_norm": 0.9637101263912627,
      "learning_rate": 2.3567758912093948e-05,
      "loss": 0.8796,
      "num_input_tokens_seen": 46158784432,
      "step": 58669
    },
    {
      "epoch": 6.224273286653936,
      "grad_norm": 0.9120219981027958,
      "learning_rate": 2.3567065085244004e-05,
      "loss": 1.0469,
      "num_input_tokens_seen": 46159571168,
      "step": 58670
    },
    {
      "epoch": 6.224379376193507,
      "grad_norm": 0.78491186950248,
      "learning_rate": 2.3566371259501387e-05,
      "loss": 1.0702,
      "num_input_tokens_seen": 46160358000,
      "step": 58671
    },
    {
      "epoch": 6.224485465733078,
      "grad_norm": 1.0904381334510829,
      "learning_rate": 2.356567743486664e-05,
      "loss": 0.9877,
      "num_input_tokens_seen": 46161144784,
      "step": 58672
    },
    {
      "epoch": 6.22459155527265,
      "grad_norm": 0.9821495120142776,
      "learning_rate": 2.3564983611340296e-05,
      "loss": 1.051,
      "num_input_tokens_seen": 46161931584,
      "step": 58673
    },
    {
      "epoch": 6.224697644812221,
      "grad_norm": 1.311856790741978,
      "learning_rate": 2.3564289788922886e-05,
      "loss": 1.0868,
      "num_input_tokens_seen": 46162718352,
      "step": 58674
    },
    {
      "epoch": 6.224803734351793,
      "grad_norm": 0.993512500748703,
      "learning_rate": 2.3563595967614954e-05,
      "loss": 1.0407,
      "num_input_tokens_seen": 46163505104,
      "step": 58675
    },
    {
      "epoch": 6.224909823891364,
      "grad_norm": 0.7351708086563298,
      "learning_rate": 2.3562902147417035e-05,
      "loss": 0.9995,
      "num_input_tokens_seen": 46164291920,
      "step": 58676
    },
    {
      "epoch": 6.225015913430935,
      "grad_norm": 1.0531242353697159,
      "learning_rate": 2.3562208328329653e-05,
      "loss": 1.0132,
      "num_input_tokens_seen": 46165078656,
      "step": 58677
    },
    {
      "epoch": 6.225122002970507,
      "grad_norm": 0.9295916416682817,
      "learning_rate": 2.3561514510353363e-05,
      "loss": 0.977,
      "num_input_tokens_seen": 46165865504,
      "step": 58678
    },
    {
      "epoch": 6.225228092510078,
      "grad_norm": 0.799313453544807,
      "learning_rate": 2.3560820693488694e-05,
      "loss": 0.9166,
      "num_input_tokens_seen": 46166652272,
      "step": 58679
    },
    {
      "epoch": 6.22533418204965,
      "grad_norm": 1.0822103476313445,
      "learning_rate": 2.3560126877736173e-05,
      "loss": 0.9991,
      "num_input_tokens_seen": 46167439056,
      "step": 58680
    },
    {
      "epoch": 6.225440271589221,
      "grad_norm": 0.9095224713855907,
      "learning_rate": 2.3559433063096352e-05,
      "loss": 0.9157,
      "num_input_tokens_seen": 46168225888,
      "step": 58681
    },
    {
      "epoch": 6.225546361128793,
      "grad_norm": 0.714648659081661,
      "learning_rate": 2.3558739249569756e-05,
      "loss": 0.9658,
      "num_input_tokens_seen": 46169012704,
      "step": 58682
    },
    {
      "epoch": 6.225652450668364,
      "grad_norm": 0.6491735264042293,
      "learning_rate": 2.3558045437156916e-05,
      "loss": 0.9141,
      "num_input_tokens_seen": 46169799472,
      "step": 58683
    },
    {
      "epoch": 6.225758540207935,
      "grad_norm": 1.2568062511596967,
      "learning_rate": 2.3557351625858386e-05,
      "loss": 1.0105,
      "num_input_tokens_seen": 46170586224,
      "step": 58684
    },
    {
      "epoch": 6.225864629747507,
      "grad_norm": 1.0693888892323418,
      "learning_rate": 2.3556657815674686e-05,
      "loss": 1.0712,
      "num_input_tokens_seen": 46171372992,
      "step": 58685
    },
    {
      "epoch": 6.225970719287078,
      "grad_norm": 0.7285647379760376,
      "learning_rate": 2.3555964006606363e-05,
      "loss": 0.9246,
      "num_input_tokens_seen": 46172159824,
      "step": 58686
    },
    {
      "epoch": 6.22607680882665,
      "grad_norm": 0.9226985396116762,
      "learning_rate": 2.3555270198653952e-05,
      "loss": 1.0048,
      "num_input_tokens_seen": 46172946640,
      "step": 58687
    },
    {
      "epoch": 6.226182898366221,
      "grad_norm": 1.1837063966264623,
      "learning_rate": 2.3554576391817977e-05,
      "loss": 0.9818,
      "num_input_tokens_seen": 46173733376,
      "step": 58688
    },
    {
      "epoch": 6.226288987905792,
      "grad_norm": 0.8335336042224547,
      "learning_rate": 2.355388258609899e-05,
      "loss": 1.0083,
      "num_input_tokens_seen": 46174520112,
      "step": 58689
    },
    {
      "epoch": 6.226395077445364,
      "grad_norm": 0.7901163639397594,
      "learning_rate": 2.3553188781497514e-05,
      "loss": 1.0431,
      "num_input_tokens_seen": 46175306896,
      "step": 58690
    },
    {
      "epoch": 6.226501166984935,
      "grad_norm": 0.9065040655054599,
      "learning_rate": 2.3552494978014093e-05,
      "loss": 0.9667,
      "num_input_tokens_seen": 46176093632,
      "step": 58691
    },
    {
      "epoch": 6.226607256524507,
      "grad_norm": 0.7106389854937628,
      "learning_rate": 2.3551801175649263e-05,
      "loss": 0.965,
      "num_input_tokens_seen": 46176880528,
      "step": 58692
    },
    {
      "epoch": 6.226713346064078,
      "grad_norm": 0.7732614072258216,
      "learning_rate": 2.355110737440356e-05,
      "loss": 0.9041,
      "num_input_tokens_seen": 46177667296,
      "step": 58693
    },
    {
      "epoch": 6.22681943560365,
      "grad_norm": 1.2801480975628947,
      "learning_rate": 2.3550413574277516e-05,
      "loss": 1.0361,
      "num_input_tokens_seen": 46178454160,
      "step": 58694
    },
    {
      "epoch": 6.226925525143221,
      "grad_norm": 0.7914991935653092,
      "learning_rate": 2.3549719775271673e-05,
      "loss": 0.9908,
      "num_input_tokens_seen": 46179240880,
      "step": 58695
    },
    {
      "epoch": 6.227031614682792,
      "grad_norm": 1.3094347144112288,
      "learning_rate": 2.3549025977386564e-05,
      "loss": 1.0424,
      "num_input_tokens_seen": 46180027664,
      "step": 58696
    },
    {
      "epoch": 6.227137704222364,
      "grad_norm": 0.8124914642479658,
      "learning_rate": 2.354833218062272e-05,
      "loss": 1.0007,
      "num_input_tokens_seen": 46180814336,
      "step": 58697
    },
    {
      "epoch": 6.227243793761935,
      "grad_norm": 0.7483435559298087,
      "learning_rate": 2.3547638384980685e-05,
      "loss": 0.9491,
      "num_input_tokens_seen": 46181601184,
      "step": 58698
    },
    {
      "epoch": 6.227349883301507,
      "grad_norm": 0.9626510960119263,
      "learning_rate": 2.3546944590460996e-05,
      "loss": 0.9981,
      "num_input_tokens_seen": 46182387872,
      "step": 58699
    },
    {
      "epoch": 6.227455972841078,
      "grad_norm": 0.7879698489506414,
      "learning_rate": 2.354625079706418e-05,
      "loss": 1.0185,
      "num_input_tokens_seen": 46183174608,
      "step": 58700
    },
    {
      "epoch": 6.227562062380649,
      "grad_norm": 0.8280967366668585,
      "learning_rate": 2.354555700479078e-05,
      "loss": 1.0231,
      "num_input_tokens_seen": 46183961360,
      "step": 58701
    },
    {
      "epoch": 6.227668151920221,
      "grad_norm": 0.8330448906413764,
      "learning_rate": 2.354486321364133e-05,
      "loss": 1.0297,
      "num_input_tokens_seen": 46184748048,
      "step": 58702
    },
    {
      "epoch": 6.227774241459792,
      "grad_norm": 0.8126187620875068,
      "learning_rate": 2.354416942361637e-05,
      "loss": 1.0089,
      "num_input_tokens_seen": 46185534880,
      "step": 58703
    },
    {
      "epoch": 6.227880330999364,
      "grad_norm": 0.666696450827452,
      "learning_rate": 2.3543475634716432e-05,
      "loss": 1.0472,
      "num_input_tokens_seen": 46186321696,
      "step": 58704
    },
    {
      "epoch": 6.227986420538935,
      "grad_norm": 0.9158090263033275,
      "learning_rate": 2.3542781846942053e-05,
      "loss": 1.0622,
      "num_input_tokens_seen": 46187108368,
      "step": 58705
    },
    {
      "epoch": 6.228092510078506,
      "grad_norm": 1.6155114883164792,
      "learning_rate": 2.354208806029377e-05,
      "loss": 0.9749,
      "num_input_tokens_seen": 46187895200,
      "step": 58706
    },
    {
      "epoch": 6.228198599618078,
      "grad_norm": 1.0183376505403356,
      "learning_rate": 2.3541394274772123e-05,
      "loss": 1.0581,
      "num_input_tokens_seen": 46188681904,
      "step": 58707
    },
    {
      "epoch": 6.228304689157649,
      "grad_norm": 0.7991050259070166,
      "learning_rate": 2.3540700490377636e-05,
      "loss": 1.0334,
      "num_input_tokens_seen": 46189468672,
      "step": 58708
    },
    {
      "epoch": 6.228410778697221,
      "grad_norm": 1.8903136346951446,
      "learning_rate": 2.3540006707110858e-05,
      "loss": 1.0593,
      "num_input_tokens_seen": 46190255408,
      "step": 58709
    },
    {
      "epoch": 6.228516868236792,
      "grad_norm": 1.570618003567112,
      "learning_rate": 2.3539312924972318e-05,
      "loss": 1.0199,
      "num_input_tokens_seen": 46191042240,
      "step": 58710
    },
    {
      "epoch": 6.228622957776364,
      "grad_norm": 1.0932434666509216,
      "learning_rate": 2.353861914396255e-05,
      "loss": 1.0591,
      "num_input_tokens_seen": 46191829008,
      "step": 58711
    },
    {
      "epoch": 6.228729047315935,
      "grad_norm": 1.139728578675474,
      "learning_rate": 2.3537925364082102e-05,
      "loss": 1.0973,
      "num_input_tokens_seen": 46192615696,
      "step": 58712
    },
    {
      "epoch": 6.228835136855506,
      "grad_norm": 1.1636355651811288,
      "learning_rate": 2.3537231585331497e-05,
      "loss": 1.0008,
      "num_input_tokens_seen": 46193402528,
      "step": 58713
    },
    {
      "epoch": 6.228941226395078,
      "grad_norm": 1.1361570175082727,
      "learning_rate": 2.3536537807711274e-05,
      "loss": 0.9903,
      "num_input_tokens_seen": 46194189360,
      "step": 58714
    },
    {
      "epoch": 6.229047315934649,
      "grad_norm": 0.9982094999699651,
      "learning_rate": 2.353584403122198e-05,
      "loss": 1.0292,
      "num_input_tokens_seen": 46194976128,
      "step": 58715
    },
    {
      "epoch": 6.229153405474221,
      "grad_norm": 1.1764871734956044,
      "learning_rate": 2.353515025586414e-05,
      "loss": 1.0035,
      "num_input_tokens_seen": 46195762960,
      "step": 58716
    },
    {
      "epoch": 6.229259495013792,
      "grad_norm": 1.2543784090067658,
      "learning_rate": 2.3534456481638288e-05,
      "loss": 0.9536,
      "num_input_tokens_seen": 46196549744,
      "step": 58717
    },
    {
      "epoch": 6.229365584553363,
      "grad_norm": 1.1430509684684784,
      "learning_rate": 2.3533762708544972e-05,
      "loss": 1.016,
      "num_input_tokens_seen": 46197336384,
      "step": 58718
    },
    {
      "epoch": 6.229471674092935,
      "grad_norm": 0.7834830728119181,
      "learning_rate": 2.3533068936584712e-05,
      "loss": 1.0576,
      "num_input_tokens_seen": 46198123088,
      "step": 58719
    },
    {
      "epoch": 6.229577763632506,
      "grad_norm": 1.6635290254862354,
      "learning_rate": 2.353237516575806e-05,
      "loss": 1.1352,
      "num_input_tokens_seen": 46198909840,
      "step": 58720
    },
    {
      "epoch": 6.2296838531720775,
      "grad_norm": 1.1673742477295377,
      "learning_rate": 2.3531681396065547e-05,
      "loss": 1.0591,
      "num_input_tokens_seen": 46199696608,
      "step": 58721
    },
    {
      "epoch": 6.2297899427116485,
      "grad_norm": 0.8335123869155726,
      "learning_rate": 2.3530987627507703e-05,
      "loss": 0.9902,
      "num_input_tokens_seen": 46200483408,
      "step": 58722
    },
    {
      "epoch": 6.2298960322512205,
      "grad_norm": 0.998138609682845,
      "learning_rate": 2.3530293860085073e-05,
      "loss": 0.997,
      "num_input_tokens_seen": 46201270192,
      "step": 58723
    },
    {
      "epoch": 6.2300021217907915,
      "grad_norm": 1.0750588217066654,
      "learning_rate": 2.3529600093798188e-05,
      "loss": 1.0504,
      "num_input_tokens_seen": 46202056928,
      "step": 58724
    },
    {
      "epoch": 6.2301082113303625,
      "grad_norm": 1.3511985550641237,
      "learning_rate": 2.3528906328647578e-05,
      "loss": 0.9912,
      "num_input_tokens_seen": 46202843664,
      "step": 58725
    },
    {
      "epoch": 6.230214300869934,
      "grad_norm": 0.822380086002434,
      "learning_rate": 2.3528212564633795e-05,
      "loss": 1.0597,
      "num_input_tokens_seen": 46203630384,
      "step": 58726
    },
    {
      "epoch": 6.2303203904095055,
      "grad_norm": 0.9223798502324349,
      "learning_rate": 2.3527518801757363e-05,
      "loss": 1.0119,
      "num_input_tokens_seen": 46204417184,
      "step": 58727
    },
    {
      "epoch": 6.230426479949077,
      "grad_norm": 1.0791085155954387,
      "learning_rate": 2.352682504001882e-05,
      "loss": 0.9751,
      "num_input_tokens_seen": 46205203920,
      "step": 58728
    },
    {
      "epoch": 6.230532569488648,
      "grad_norm": 0.7870463151214615,
      "learning_rate": 2.3526131279418703e-05,
      "loss": 0.9409,
      "num_input_tokens_seen": 46205990656,
      "step": 58729
    },
    {
      "epoch": 6.2306386590282195,
      "grad_norm": 0.7550405649687344,
      "learning_rate": 2.3525437519957552e-05,
      "loss": 1.0146,
      "num_input_tokens_seen": 46206777456,
      "step": 58730
    },
    {
      "epoch": 6.230744748567791,
      "grad_norm": 0.7725105037356365,
      "learning_rate": 2.352474376163589e-05,
      "loss": 1.0158,
      "num_input_tokens_seen": 46207564272,
      "step": 58731
    },
    {
      "epoch": 6.230850838107362,
      "grad_norm": 1.056977390196151,
      "learning_rate": 2.3524050004454276e-05,
      "loss": 0.996,
      "num_input_tokens_seen": 46208350976,
      "step": 58732
    },
    {
      "epoch": 6.230956927646934,
      "grad_norm": 0.8373843435147968,
      "learning_rate": 2.3523356248413227e-05,
      "loss": 1.0503,
      "num_input_tokens_seen": 46209137808,
      "step": 58733
    },
    {
      "epoch": 6.231063017186505,
      "grad_norm": 0.7929406969556742,
      "learning_rate": 2.352266249351328e-05,
      "loss": 1.1004,
      "num_input_tokens_seen": 46209924480,
      "step": 58734
    },
    {
      "epoch": 6.231169106726076,
      "grad_norm": 1.024904051500674,
      "learning_rate": 2.3521968739754986e-05,
      "loss": 1.0992,
      "num_input_tokens_seen": 46210711216,
      "step": 58735
    },
    {
      "epoch": 6.231275196265648,
      "grad_norm": 0.840109697026439,
      "learning_rate": 2.352127498713886e-05,
      "loss": 0.985,
      "num_input_tokens_seen": 46211498000,
      "step": 58736
    },
    {
      "epoch": 6.231381285805219,
      "grad_norm": 1.0070177497524215,
      "learning_rate": 2.3520581235665458e-05,
      "loss": 0.9791,
      "num_input_tokens_seen": 46212284832,
      "step": 58737
    },
    {
      "epoch": 6.231487375344791,
      "grad_norm": 0.7136293295611601,
      "learning_rate": 2.3519887485335306e-05,
      "loss": 1.0744,
      "num_input_tokens_seen": 46213071584,
      "step": 58738
    },
    {
      "epoch": 6.231593464884362,
      "grad_norm": 0.9533158866217523,
      "learning_rate": 2.3519193736148936e-05,
      "loss": 0.9131,
      "num_input_tokens_seen": 46213858304,
      "step": 58739
    },
    {
      "epoch": 6.231699554423934,
      "grad_norm": 1.2772041912804462,
      "learning_rate": 2.3518499988106897e-05,
      "loss": 0.9842,
      "num_input_tokens_seen": 46214644992,
      "step": 58740
    },
    {
      "epoch": 6.231805643963505,
      "grad_norm": 0.7559498245235606,
      "learning_rate": 2.3517806241209718e-05,
      "loss": 0.8978,
      "num_input_tokens_seen": 46215431824,
      "step": 58741
    },
    {
      "epoch": 6.231911733503076,
      "grad_norm": 0.8458326673437101,
      "learning_rate": 2.3517112495457928e-05,
      "loss": 0.9529,
      "num_input_tokens_seen": 46216218544,
      "step": 58742
    },
    {
      "epoch": 6.232017823042648,
      "grad_norm": 0.9547819104433815,
      "learning_rate": 2.3516418750852075e-05,
      "loss": 0.9964,
      "num_input_tokens_seen": 46217005392,
      "step": 58743
    },
    {
      "epoch": 6.232123912582219,
      "grad_norm": 0.7570264638007314,
      "learning_rate": 2.3515725007392688e-05,
      "loss": 0.9898,
      "num_input_tokens_seen": 46217792144,
      "step": 58744
    },
    {
      "epoch": 6.232230002121791,
      "grad_norm": 0.8597153269791485,
      "learning_rate": 2.3515031265080305e-05,
      "loss": 0.9274,
      "num_input_tokens_seen": 46218578960,
      "step": 58745
    },
    {
      "epoch": 6.232336091661362,
      "grad_norm": 0.7777264864777831,
      "learning_rate": 2.3514337523915462e-05,
      "loss": 0.9528,
      "num_input_tokens_seen": 46219365760,
      "step": 58746
    },
    {
      "epoch": 6.232442181200933,
      "grad_norm": 0.6933361649657278,
      "learning_rate": 2.3513643783898702e-05,
      "loss": 0.9883,
      "num_input_tokens_seen": 46220152544,
      "step": 58747
    },
    {
      "epoch": 6.232548270740505,
      "grad_norm": 0.8728862020219019,
      "learning_rate": 2.3512950045030538e-05,
      "loss": 1.0284,
      "num_input_tokens_seen": 46220939232,
      "step": 58748
    },
    {
      "epoch": 6.232654360280076,
      "grad_norm": 0.7709998994266368,
      "learning_rate": 2.3512256307311527e-05,
      "loss": 0.9408,
      "num_input_tokens_seen": 46221726032,
      "step": 58749
    },
    {
      "epoch": 6.232760449819648,
      "grad_norm": 0.9133646111950616,
      "learning_rate": 2.351156257074221e-05,
      "loss": 0.9264,
      "num_input_tokens_seen": 46222512800,
      "step": 58750
    },
    {
      "epoch": 6.232866539359219,
      "grad_norm": 0.8681150717894933,
      "learning_rate": 2.3510868835323114e-05,
      "loss": 1.0429,
      "num_input_tokens_seen": 46223299600,
      "step": 58751
    },
    {
      "epoch": 6.232972628898791,
      "grad_norm": 0.7608300486724029,
      "learning_rate": 2.3510175101054767e-05,
      "loss": 1.0012,
      "num_input_tokens_seen": 46224086384,
      "step": 58752
    },
    {
      "epoch": 6.233078718438362,
      "grad_norm": 0.8965797196785433,
      "learning_rate": 2.350948136793772e-05,
      "loss": 1.0412,
      "num_input_tokens_seen": 46224873056,
      "step": 58753
    },
    {
      "epoch": 6.233184807977933,
      "grad_norm": 0.8138154882998985,
      "learning_rate": 2.35087876359725e-05,
      "loss": 1.0538,
      "num_input_tokens_seen": 46225659808,
      "step": 58754
    },
    {
      "epoch": 6.233290897517505,
      "grad_norm": 0.9354778011654273,
      "learning_rate": 2.350809390515964e-05,
      "loss": 0.9935,
      "num_input_tokens_seen": 46226446672,
      "step": 58755
    },
    {
      "epoch": 6.233396987057076,
      "grad_norm": 1.2184984214139007,
      "learning_rate": 2.3507400175499692e-05,
      "loss": 1.1022,
      "num_input_tokens_seen": 46227233408,
      "step": 58756
    },
    {
      "epoch": 6.233503076596648,
      "grad_norm": 0.8573948178120945,
      "learning_rate": 2.350670644699317e-05,
      "loss": 1.0432,
      "num_input_tokens_seen": 46228020064,
      "step": 58757
    },
    {
      "epoch": 6.233609166136219,
      "grad_norm": 0.9080243761441676,
      "learning_rate": 2.350601271964063e-05,
      "loss": 0.9496,
      "num_input_tokens_seen": 46228806848,
      "step": 58758
    },
    {
      "epoch": 6.23371525567579,
      "grad_norm": 0.7779413194926796,
      "learning_rate": 2.3505318993442598e-05,
      "loss": 0.9724,
      "num_input_tokens_seen": 46229593472,
      "step": 58759
    },
    {
      "epoch": 6.233821345215362,
      "grad_norm": 0.6210666022710133,
      "learning_rate": 2.3504625268399608e-05,
      "loss": 0.9543,
      "num_input_tokens_seen": 46230380336,
      "step": 58760
    },
    {
      "epoch": 6.233927434754933,
      "grad_norm": 0.8750791455812311,
      "learning_rate": 2.3503931544512205e-05,
      "loss": 0.9466,
      "num_input_tokens_seen": 46231167152,
      "step": 58761
    },
    {
      "epoch": 6.234033524294505,
      "grad_norm": 0.8894670137116475,
      "learning_rate": 2.3503237821780917e-05,
      "loss": 0.9887,
      "num_input_tokens_seen": 46231953904,
      "step": 58762
    },
    {
      "epoch": 6.234139613834076,
      "grad_norm": 0.6296774280887932,
      "learning_rate": 2.350254410020628e-05,
      "loss": 0.9345,
      "num_input_tokens_seen": 46232740704,
      "step": 58763
    },
    {
      "epoch": 6.234245703373647,
      "grad_norm": 1.0647962277042793,
      "learning_rate": 2.3501850379788834e-05,
      "loss": 1.003,
      "num_input_tokens_seen": 46233527424,
      "step": 58764
    },
    {
      "epoch": 6.234351792913219,
      "grad_norm": 1.3031439404428693,
      "learning_rate": 2.350115666052912e-05,
      "loss": 0.9307,
      "num_input_tokens_seen": 46234314176,
      "step": 58765
    },
    {
      "epoch": 6.23445788245279,
      "grad_norm": 1.0944336603019458,
      "learning_rate": 2.350046294242766e-05,
      "loss": 1.034,
      "num_input_tokens_seen": 46235101024,
      "step": 58766
    },
    {
      "epoch": 6.234563971992362,
      "grad_norm": 1.0177191342069547,
      "learning_rate": 2.3499769225485002e-05,
      "loss": 0.9486,
      "num_input_tokens_seen": 46235887840,
      "step": 58767
    },
    {
      "epoch": 6.234670061531933,
      "grad_norm": 0.7879684590749043,
      "learning_rate": 2.3499075509701678e-05,
      "loss": 1.0171,
      "num_input_tokens_seen": 46236674624,
      "step": 58768
    },
    {
      "epoch": 6.234776151071505,
      "grad_norm": 1.0231144242729218,
      "learning_rate": 2.3498381795078223e-05,
      "loss": 1.0606,
      "num_input_tokens_seen": 46237461264,
      "step": 58769
    },
    {
      "epoch": 6.234882240611076,
      "grad_norm": 0.9244829546057118,
      "learning_rate": 2.3497688081615176e-05,
      "loss": 0.9383,
      "num_input_tokens_seen": 46238248016,
      "step": 58770
    },
    {
      "epoch": 6.234988330150647,
      "grad_norm": 0.7673380200280046,
      "learning_rate": 2.3496994369313076e-05,
      "loss": 0.929,
      "num_input_tokens_seen": 46239034832,
      "step": 58771
    },
    {
      "epoch": 6.235094419690219,
      "grad_norm": 0.8259760599099198,
      "learning_rate": 2.3496300658172444e-05,
      "loss": 0.9577,
      "num_input_tokens_seen": 46239821616,
      "step": 58772
    },
    {
      "epoch": 6.23520050922979,
      "grad_norm": 0.9419413483395227,
      "learning_rate": 2.3495606948193837e-05,
      "loss": 0.9836,
      "num_input_tokens_seen": 46240608384,
      "step": 58773
    },
    {
      "epoch": 6.235306598769362,
      "grad_norm": 1.139860232180375,
      "learning_rate": 2.3494913239377775e-05,
      "loss": 0.9524,
      "num_input_tokens_seen": 46241395136,
      "step": 58774
    },
    {
      "epoch": 6.235412688308933,
      "grad_norm": 0.7510620911657948,
      "learning_rate": 2.3494219531724805e-05,
      "loss": 0.9745,
      "num_input_tokens_seen": 46242181888,
      "step": 58775
    },
    {
      "epoch": 6.235518777848504,
      "grad_norm": 0.9865206537744661,
      "learning_rate": 2.3493525825235455e-05,
      "loss": 0.9554,
      "num_input_tokens_seen": 46242968704,
      "step": 58776
    },
    {
      "epoch": 6.235624867388076,
      "grad_norm": 0.792348184189919,
      "learning_rate": 2.349283211991026e-05,
      "loss": 1.087,
      "num_input_tokens_seen": 46243755392,
      "step": 58777
    },
    {
      "epoch": 6.235730956927647,
      "grad_norm": 0.739519713559252,
      "learning_rate": 2.3492138415749767e-05,
      "loss": 1.01,
      "num_input_tokens_seen": 46244542160,
      "step": 58778
    },
    {
      "epoch": 6.235837046467219,
      "grad_norm": 0.774514820344792,
      "learning_rate": 2.3491444712754502e-05,
      "loss": 0.959,
      "num_input_tokens_seen": 46245328960,
      "step": 58779
    },
    {
      "epoch": 6.23594313600679,
      "grad_norm": 0.8235046521128238,
      "learning_rate": 2.3490751010925e-05,
      "loss": 0.9611,
      "num_input_tokens_seen": 46246115728,
      "step": 58780
    },
    {
      "epoch": 6.2360492255463615,
      "grad_norm": 0.7462716745841896,
      "learning_rate": 2.349005731026181e-05,
      "loss": 1.0512,
      "num_input_tokens_seen": 46246902416,
      "step": 58781
    },
    {
      "epoch": 6.236155315085933,
      "grad_norm": 0.896445549969871,
      "learning_rate": 2.3489363610765454e-05,
      "loss": 0.9613,
      "num_input_tokens_seen": 46247689248,
      "step": 58782
    },
    {
      "epoch": 6.236261404625504,
      "grad_norm": 0.7298056441631787,
      "learning_rate": 2.3488669912436474e-05,
      "loss": 0.9577,
      "num_input_tokens_seen": 46248476032,
      "step": 58783
    },
    {
      "epoch": 6.2363674941650755,
      "grad_norm": 0.7186928942735064,
      "learning_rate": 2.3487976215275406e-05,
      "loss": 1.0114,
      "num_input_tokens_seen": 46249262896,
      "step": 58784
    },
    {
      "epoch": 6.2364735837046466,
      "grad_norm": 0.8576296905439632,
      "learning_rate": 2.348728251928279e-05,
      "loss": 0.9982,
      "num_input_tokens_seen": 46250049584,
      "step": 58785
    },
    {
      "epoch": 6.2365796732442185,
      "grad_norm": 1.0222200035550104,
      "learning_rate": 2.3486588824459147e-05,
      "loss": 1.0493,
      "num_input_tokens_seen": 46250836320,
      "step": 58786
    },
    {
      "epoch": 6.2366857627837895,
      "grad_norm": 0.6822368171199041,
      "learning_rate": 2.3485895130805033e-05,
      "loss": 0.903,
      "num_input_tokens_seen": 46251623184,
      "step": 58787
    },
    {
      "epoch": 6.2367918523233605,
      "grad_norm": 0.812335456700912,
      "learning_rate": 2.3485201438320966e-05,
      "loss": 1.0044,
      "num_input_tokens_seen": 46252409792,
      "step": 58788
    },
    {
      "epoch": 6.2368979418629324,
      "grad_norm": 0.8888339040157085,
      "learning_rate": 2.3484507747007502e-05,
      "loss": 1.0058,
      "num_input_tokens_seen": 46253196528,
      "step": 58789
    },
    {
      "epoch": 6.2370040314025035,
      "grad_norm": 0.848491935864726,
      "learning_rate": 2.3483814056865163e-05,
      "loss": 1.075,
      "num_input_tokens_seen": 46253983296,
      "step": 58790
    },
    {
      "epoch": 6.237110120942075,
      "grad_norm": 0.7697709628821527,
      "learning_rate": 2.3483120367894483e-05,
      "loss": 1.0571,
      "num_input_tokens_seen": 46254770112,
      "step": 58791
    },
    {
      "epoch": 6.237216210481646,
      "grad_norm": 0.8100639184195418,
      "learning_rate": 2.3482426680096006e-05,
      "loss": 0.9812,
      "num_input_tokens_seen": 46255556784,
      "step": 58792
    },
    {
      "epoch": 6.2373223000212175,
      "grad_norm": 0.6816998265111354,
      "learning_rate": 2.3481732993470266e-05,
      "loss": 0.9702,
      "num_input_tokens_seen": 46256343472,
      "step": 58793
    },
    {
      "epoch": 6.237428389560789,
      "grad_norm": 0.936473393739432,
      "learning_rate": 2.3481039308017793e-05,
      "loss": 0.9955,
      "num_input_tokens_seen": 46257130304,
      "step": 58794
    },
    {
      "epoch": 6.23753447910036,
      "grad_norm": 0.885737464152616,
      "learning_rate": 2.3480345623739137e-05,
      "loss": 0.9944,
      "num_input_tokens_seen": 46257917072,
      "step": 58795
    },
    {
      "epoch": 6.237640568639932,
      "grad_norm": 1.1594912585984158,
      "learning_rate": 2.347965194063482e-05,
      "loss": 1.0472,
      "num_input_tokens_seen": 46258703744,
      "step": 58796
    },
    {
      "epoch": 6.237746658179503,
      "grad_norm": 1.2930433659869531,
      "learning_rate": 2.3478958258705382e-05,
      "loss": 0.9827,
      "num_input_tokens_seen": 46259490496,
      "step": 58797
    },
    {
      "epoch": 6.237852747719075,
      "grad_norm": 0.8106209437617968,
      "learning_rate": 2.3478264577951363e-05,
      "loss": 1.0779,
      "num_input_tokens_seen": 46260277280,
      "step": 58798
    },
    {
      "epoch": 6.237958837258646,
      "grad_norm": 0.758239178825992,
      "learning_rate": 2.34775708983733e-05,
      "loss": 1.0088,
      "num_input_tokens_seen": 46261064064,
      "step": 58799
    },
    {
      "epoch": 6.238064926798217,
      "grad_norm": 1.0664898499129374,
      "learning_rate": 2.3476877219971715e-05,
      "loss": 0.993,
      "num_input_tokens_seen": 46261850944,
      "step": 58800
    },
    {
      "epoch": 6.238171016337789,
      "grad_norm": 0.6846359519690016,
      "learning_rate": 2.3476183542747167e-05,
      "loss": 0.9933,
      "num_input_tokens_seen": 46262637712,
      "step": 58801
    },
    {
      "epoch": 6.23827710587736,
      "grad_norm": 0.8891644139483035,
      "learning_rate": 2.3475489866700174e-05,
      "loss": 0.9997,
      "num_input_tokens_seen": 46263424496,
      "step": 58802
    },
    {
      "epoch": 6.238383195416932,
      "grad_norm": 0.8855710100930076,
      "learning_rate": 2.3474796191831275e-05,
      "loss": 0.9947,
      "num_input_tokens_seen": 46264211280,
      "step": 58803
    },
    {
      "epoch": 6.238489284956503,
      "grad_norm": 0.7283122448227619,
      "learning_rate": 2.3474102518141013e-05,
      "loss": 0.9987,
      "num_input_tokens_seen": 46264997968,
      "step": 58804
    },
    {
      "epoch": 6.238595374496074,
      "grad_norm": 0.7377559842013836,
      "learning_rate": 2.347340884562991e-05,
      "loss": 1.0779,
      "num_input_tokens_seen": 46265784624,
      "step": 58805
    },
    {
      "epoch": 6.238701464035646,
      "grad_norm": 0.8695605890987751,
      "learning_rate": 2.3472715174298527e-05,
      "loss": 1.0482,
      "num_input_tokens_seen": 46266571376,
      "step": 58806
    },
    {
      "epoch": 6.238807553575217,
      "grad_norm": 0.9559500166079576,
      "learning_rate": 2.347202150414738e-05,
      "loss": 1.0599,
      "num_input_tokens_seen": 46267358208,
      "step": 58807
    },
    {
      "epoch": 6.238913643114789,
      "grad_norm": 1.0014645824230357,
      "learning_rate": 2.3471327835177e-05,
      "loss": 1.0943,
      "num_input_tokens_seen": 46268144880,
      "step": 58808
    },
    {
      "epoch": 6.23901973265436,
      "grad_norm": 1.000603186848897,
      "learning_rate": 2.3470634167387946e-05,
      "loss": 1.0712,
      "num_input_tokens_seen": 46268931616,
      "step": 58809
    },
    {
      "epoch": 6.239125822193932,
      "grad_norm": 1.1774257662514798,
      "learning_rate": 2.346994050078074e-05,
      "loss": 1.0068,
      "num_input_tokens_seen": 46269718368,
      "step": 58810
    },
    {
      "epoch": 6.239231911733503,
      "grad_norm": 0.730554817060381,
      "learning_rate": 2.3469246835355908e-05,
      "loss": 0.899,
      "num_input_tokens_seen": 46270505104,
      "step": 58811
    },
    {
      "epoch": 6.239338001273074,
      "grad_norm": 0.7745410110189966,
      "learning_rate": 2.3468553171114004e-05,
      "loss": 0.906,
      "num_input_tokens_seen": 46271291984,
      "step": 58812
    },
    {
      "epoch": 6.239444090812646,
      "grad_norm": 0.9149470619765283,
      "learning_rate": 2.3467859508055563e-05,
      "loss": 0.9625,
      "num_input_tokens_seen": 46272078752,
      "step": 58813
    },
    {
      "epoch": 6.239550180352217,
      "grad_norm": 1.0757727265285817,
      "learning_rate": 2.3467165846181105e-05,
      "loss": 0.9614,
      "num_input_tokens_seen": 46272865552,
      "step": 58814
    },
    {
      "epoch": 6.239656269891789,
      "grad_norm": 0.8494701272569408,
      "learning_rate": 2.3466472185491182e-05,
      "loss": 0.9931,
      "num_input_tokens_seen": 46273652272,
      "step": 58815
    },
    {
      "epoch": 6.23976235943136,
      "grad_norm": 1.0116532383009755,
      "learning_rate": 2.3465778525986323e-05,
      "loss": 0.9481,
      "num_input_tokens_seen": 46274439120,
      "step": 58816
    },
    {
      "epoch": 6.239868448970931,
      "grad_norm": 1.1044387849989776,
      "learning_rate": 2.3465084867667066e-05,
      "loss": 1.0267,
      "num_input_tokens_seen": 46275225936,
      "step": 58817
    },
    {
      "epoch": 6.239974538510503,
      "grad_norm": 0.7803024337728104,
      "learning_rate": 2.3464391210533946e-05,
      "loss": 1.0215,
      "num_input_tokens_seen": 46276012752,
      "step": 58818
    },
    {
      "epoch": 6.240080628050074,
      "grad_norm": 1.2166729767133888,
      "learning_rate": 2.34636975545875e-05,
      "loss": 1.0004,
      "num_input_tokens_seen": 46276799472,
      "step": 58819
    },
    {
      "epoch": 6.240186717589646,
      "grad_norm": 0.8898538519438315,
      "learning_rate": 2.346300389982826e-05,
      "loss": 0.9897,
      "num_input_tokens_seen": 46277586112,
      "step": 58820
    },
    {
      "epoch": 6.240292807129217,
      "grad_norm": 0.846946117008967,
      "learning_rate": 2.346231024625677e-05,
      "loss": 0.9935,
      "num_input_tokens_seen": 46278372832,
      "step": 58821
    },
    {
      "epoch": 6.240398896668789,
      "grad_norm": 1.1175258281043368,
      "learning_rate": 2.3461616593873552e-05,
      "loss": 1.0451,
      "num_input_tokens_seen": 46279159536,
      "step": 58822
    },
    {
      "epoch": 6.24050498620836,
      "grad_norm": 1.0649121679611737,
      "learning_rate": 2.3460922942679163e-05,
      "loss": 1.052,
      "num_input_tokens_seen": 46279946240,
      "step": 58823
    },
    {
      "epoch": 6.240611075747931,
      "grad_norm": 0.7650661056921376,
      "learning_rate": 2.3460229292674128e-05,
      "loss": 1.0042,
      "num_input_tokens_seen": 46280733072,
      "step": 58824
    },
    {
      "epoch": 6.240717165287503,
      "grad_norm": 1.1427548834708874,
      "learning_rate": 2.3459535643858973e-05,
      "loss": 1.0474,
      "num_input_tokens_seen": 46281519840,
      "step": 58825
    },
    {
      "epoch": 6.240823254827074,
      "grad_norm": 0.827855135126571,
      "learning_rate": 2.3458841996234252e-05,
      "loss": 1.0242,
      "num_input_tokens_seen": 46282306640,
      "step": 58826
    },
    {
      "epoch": 6.240929344366646,
      "grad_norm": 0.6671249558788735,
      "learning_rate": 2.345814834980049e-05,
      "loss": 1.0226,
      "num_input_tokens_seen": 46283093376,
      "step": 58827
    },
    {
      "epoch": 6.241035433906217,
      "grad_norm": 1.018342438837282,
      "learning_rate": 2.3457454704558222e-05,
      "loss": 0.9971,
      "num_input_tokens_seen": 46283880208,
      "step": 58828
    },
    {
      "epoch": 6.241141523445788,
      "grad_norm": 1.0801343777229546,
      "learning_rate": 2.3456761060507994e-05,
      "loss": 0.9741,
      "num_input_tokens_seen": 46284666976,
      "step": 58829
    },
    {
      "epoch": 6.24124761298536,
      "grad_norm": 0.7533722300819549,
      "learning_rate": 2.3456067417650334e-05,
      "loss": 0.9925,
      "num_input_tokens_seen": 46285453712,
      "step": 58830
    },
    {
      "epoch": 6.241353702524931,
      "grad_norm": 1.6750420474706462,
      "learning_rate": 2.3455373775985777e-05,
      "loss": 1.0503,
      "num_input_tokens_seen": 46286240496,
      "step": 58831
    },
    {
      "epoch": 6.241459792064503,
      "grad_norm": 0.8698564832917174,
      "learning_rate": 2.3454680135514863e-05,
      "loss": 0.983,
      "num_input_tokens_seen": 46287027296,
      "step": 58832
    },
    {
      "epoch": 6.241565881604074,
      "grad_norm": 0.6601092847274544,
      "learning_rate": 2.345398649623813e-05,
      "loss": 0.9733,
      "num_input_tokens_seen": 46287814032,
      "step": 58833
    },
    {
      "epoch": 6.241671971143646,
      "grad_norm": 0.7931968948870461,
      "learning_rate": 2.3453292858156102e-05,
      "loss": 0.93,
      "num_input_tokens_seen": 46288600784,
      "step": 58834
    },
    {
      "epoch": 6.241778060683217,
      "grad_norm": 1.1716617308017219,
      "learning_rate": 2.3452599221269333e-05,
      "loss": 0.969,
      "num_input_tokens_seen": 46289387568,
      "step": 58835
    },
    {
      "epoch": 6.241884150222788,
      "grad_norm": 0.8964791430236165,
      "learning_rate": 2.345190558557835e-05,
      "loss": 1.0457,
      "num_input_tokens_seen": 46290174272,
      "step": 58836
    },
    {
      "epoch": 6.24199023976236,
      "grad_norm": 0.9368439686517676,
      "learning_rate": 2.345121195108368e-05,
      "loss": 1.0487,
      "num_input_tokens_seen": 46290961040,
      "step": 58837
    },
    {
      "epoch": 6.242096329301931,
      "grad_norm": 1.0631089111191065,
      "learning_rate": 2.345051831778588e-05,
      "loss": 1.0438,
      "num_input_tokens_seen": 46291747728,
      "step": 58838
    },
    {
      "epoch": 6.242202418841503,
      "grad_norm": 0.7528046782700214,
      "learning_rate": 2.3449824685685462e-05,
      "loss": 1.0504,
      "num_input_tokens_seen": 46292534560,
      "step": 58839
    },
    {
      "epoch": 6.242308508381074,
      "grad_norm": 0.8152363244345482,
      "learning_rate": 2.3449131054782984e-05,
      "loss": 0.9529,
      "num_input_tokens_seen": 46293321296,
      "step": 58840
    },
    {
      "epoch": 6.242414597920645,
      "grad_norm": 0.9842902048631376,
      "learning_rate": 2.3448437425078967e-05,
      "loss": 1.0074,
      "num_input_tokens_seen": 46294108016,
      "step": 58841
    },
    {
      "epoch": 6.242520687460217,
      "grad_norm": 0.8798173951803709,
      "learning_rate": 2.344774379657395e-05,
      "loss": 1.01,
      "num_input_tokens_seen": 46294894736,
      "step": 58842
    },
    {
      "epoch": 6.242626776999788,
      "grad_norm": 0.6558719316271558,
      "learning_rate": 2.3447050169268467e-05,
      "loss": 0.8389,
      "num_input_tokens_seen": 46295681504,
      "step": 58843
    },
    {
      "epoch": 6.2427328665393595,
      "grad_norm": 1.4785068168233317,
      "learning_rate": 2.344635654316307e-05,
      "loss": 0.9953,
      "num_input_tokens_seen": 46296468304,
      "step": 58844
    },
    {
      "epoch": 6.242838956078931,
      "grad_norm": 1.0231613593861042,
      "learning_rate": 2.3445662918258275e-05,
      "loss": 0.9385,
      "num_input_tokens_seen": 46297255152,
      "step": 58845
    },
    {
      "epoch": 6.242945045618502,
      "grad_norm": 1.043821942302186,
      "learning_rate": 2.344496929455463e-05,
      "loss": 0.9926,
      "num_input_tokens_seen": 46298041904,
      "step": 58846
    },
    {
      "epoch": 6.2430511351580735,
      "grad_norm": 1.3463200913921314,
      "learning_rate": 2.3444275672052664e-05,
      "loss": 1.0904,
      "num_input_tokens_seen": 46298828688,
      "step": 58847
    },
    {
      "epoch": 6.243157224697645,
      "grad_norm": 1.301122541792227,
      "learning_rate": 2.344358205075292e-05,
      "loss": 0.9754,
      "num_input_tokens_seen": 46299615520,
      "step": 58848
    },
    {
      "epoch": 6.2432633142372165,
      "grad_norm": 0.7163491928668226,
      "learning_rate": 2.3442888430655927e-05,
      "loss": 0.971,
      "num_input_tokens_seen": 46300402240,
      "step": 58849
    },
    {
      "epoch": 6.2433694037767875,
      "grad_norm": 1.1559004400280577,
      "learning_rate": 2.344219481176223e-05,
      "loss": 0.9399,
      "num_input_tokens_seen": 46301189056,
      "step": 58850
    },
    {
      "epoch": 6.243475493316359,
      "grad_norm": 1.6070098153838763,
      "learning_rate": 2.3441501194072353e-05,
      "loss": 0.9937,
      "num_input_tokens_seen": 46301975792,
      "step": 58851
    },
    {
      "epoch": 6.2435815828559305,
      "grad_norm": 0.9323261128629721,
      "learning_rate": 2.3440807577586837e-05,
      "loss": 1.0274,
      "num_input_tokens_seen": 46302762544,
      "step": 58852
    },
    {
      "epoch": 6.2436876723955015,
      "grad_norm": 0.8680681228372911,
      "learning_rate": 2.3440113962306222e-05,
      "loss": 1.0198,
      "num_input_tokens_seen": 46303549232,
      "step": 58853
    },
    {
      "epoch": 6.243793761935073,
      "grad_norm": 1.1459446822165393,
      "learning_rate": 2.3439420348231046e-05,
      "loss": 0.9727,
      "num_input_tokens_seen": 46304336016,
      "step": 58854
    },
    {
      "epoch": 6.243899851474644,
      "grad_norm": 1.3457930566986676,
      "learning_rate": 2.3438726735361832e-05,
      "loss": 0.9429,
      "num_input_tokens_seen": 46305122784,
      "step": 58855
    },
    {
      "epoch": 6.244005941014216,
      "grad_norm": 0.9220965132428619,
      "learning_rate": 2.3438033123699128e-05,
      "loss": 1.0047,
      "num_input_tokens_seen": 46305909504,
      "step": 58856
    },
    {
      "epoch": 6.244112030553787,
      "grad_norm": 0.9224706499429278,
      "learning_rate": 2.343733951324347e-05,
      "loss": 1.0004,
      "num_input_tokens_seen": 46306696176,
      "step": 58857
    },
    {
      "epoch": 6.244218120093358,
      "grad_norm": 1.0118278983349964,
      "learning_rate": 2.343664590399538e-05,
      "loss": 0.9516,
      "num_input_tokens_seen": 46307482912,
      "step": 58858
    },
    {
      "epoch": 6.24432420963293,
      "grad_norm": 0.8763536537775721,
      "learning_rate": 2.343595229595541e-05,
      "loss": 0.9136,
      "num_input_tokens_seen": 46308269696,
      "step": 58859
    },
    {
      "epoch": 6.244430299172501,
      "grad_norm": 1.3001615597970515,
      "learning_rate": 2.343525868912409e-05,
      "loss": 1.0426,
      "num_input_tokens_seen": 46309056352,
      "step": 58860
    },
    {
      "epoch": 6.244536388712073,
      "grad_norm": 0.7849071230642864,
      "learning_rate": 2.3434565083501957e-05,
      "loss": 1.0065,
      "num_input_tokens_seen": 46309843104,
      "step": 58861
    },
    {
      "epoch": 6.244642478251644,
      "grad_norm": 1.2555407631410753,
      "learning_rate": 2.343387147908955e-05,
      "loss": 0.9961,
      "num_input_tokens_seen": 46310629920,
      "step": 58862
    },
    {
      "epoch": 6.244748567791216,
      "grad_norm": 1.4592852080660177,
      "learning_rate": 2.3433177875887394e-05,
      "loss": 1.019,
      "num_input_tokens_seen": 46311416768,
      "step": 58863
    },
    {
      "epoch": 6.244854657330787,
      "grad_norm": 0.7441873884985455,
      "learning_rate": 2.3432484273896034e-05,
      "loss": 0.9675,
      "num_input_tokens_seen": 46312203520,
      "step": 58864
    },
    {
      "epoch": 6.244960746870358,
      "grad_norm": 1.0248226578825295,
      "learning_rate": 2.3431790673116006e-05,
      "loss": 1.0592,
      "num_input_tokens_seen": 46312990240,
      "step": 58865
    },
    {
      "epoch": 6.24506683640993,
      "grad_norm": 0.9828721903047586,
      "learning_rate": 2.3431097073547842e-05,
      "loss": 0.9218,
      "num_input_tokens_seen": 46313777104,
      "step": 58866
    },
    {
      "epoch": 6.245172925949501,
      "grad_norm": 0.8025986175051958,
      "learning_rate": 2.3430403475192084e-05,
      "loss": 1.0269,
      "num_input_tokens_seen": 46314563840,
      "step": 58867
    },
    {
      "epoch": 6.245279015489073,
      "grad_norm": 0.7998079832431437,
      "learning_rate": 2.3429709878049263e-05,
      "loss": 0.9556,
      "num_input_tokens_seen": 46315350704,
      "step": 58868
    },
    {
      "epoch": 6.245385105028644,
      "grad_norm": 0.9082655628896074,
      "learning_rate": 2.342901628211991e-05,
      "loss": 1.0329,
      "num_input_tokens_seen": 46316137456,
      "step": 58869
    },
    {
      "epoch": 6.245491194568215,
      "grad_norm": 0.6979283345239276,
      "learning_rate": 2.3428322687404575e-05,
      "loss": 1.0674,
      "num_input_tokens_seen": 46316924208,
      "step": 58870
    },
    {
      "epoch": 6.245597284107787,
      "grad_norm": 0.8969055777340652,
      "learning_rate": 2.3427629093903785e-05,
      "loss": 1.0351,
      "num_input_tokens_seen": 46317710928,
      "step": 58871
    },
    {
      "epoch": 6.245703373647358,
      "grad_norm": 0.8334654308055335,
      "learning_rate": 2.342693550161807e-05,
      "loss": 0.9997,
      "num_input_tokens_seen": 46318497616,
      "step": 58872
    },
    {
      "epoch": 6.24580946318693,
      "grad_norm": 0.9250349381030004,
      "learning_rate": 2.3426241910547982e-05,
      "loss": 1.0422,
      "num_input_tokens_seen": 46319284352,
      "step": 58873
    },
    {
      "epoch": 6.245915552726501,
      "grad_norm": 0.828221131082241,
      "learning_rate": 2.3425548320694046e-05,
      "loss": 1.0724,
      "num_input_tokens_seen": 46320071088,
      "step": 58874
    },
    {
      "epoch": 6.246021642266072,
      "grad_norm": 0.7888006766212072,
      "learning_rate": 2.3424854732056794e-05,
      "loss": 0.9954,
      "num_input_tokens_seen": 46320857888,
      "step": 58875
    },
    {
      "epoch": 6.246127731805644,
      "grad_norm": 0.7568448630313074,
      "learning_rate": 2.3424161144636776e-05,
      "loss": 0.9294,
      "num_input_tokens_seen": 46321644736,
      "step": 58876
    },
    {
      "epoch": 6.246233821345215,
      "grad_norm": 0.8277367772860569,
      "learning_rate": 2.342346755843451e-05,
      "loss": 1.0052,
      "num_input_tokens_seen": 46322431488,
      "step": 58877
    },
    {
      "epoch": 6.246339910884787,
      "grad_norm": 0.9501334846472994,
      "learning_rate": 2.3422773973450553e-05,
      "loss": 1.0284,
      "num_input_tokens_seen": 46323218320,
      "step": 58878
    },
    {
      "epoch": 6.246446000424358,
      "grad_norm": 0.8858012233783661,
      "learning_rate": 2.3422080389685428e-05,
      "loss": 1.0227,
      "num_input_tokens_seen": 46324005056,
      "step": 58879
    },
    {
      "epoch": 6.24655208996393,
      "grad_norm": 0.7516361097973654,
      "learning_rate": 2.3421386807139665e-05,
      "loss": 1.0499,
      "num_input_tokens_seen": 46324791792,
      "step": 58880
    },
    {
      "epoch": 6.246658179503501,
      "grad_norm": 1.1234799604227221,
      "learning_rate": 2.3420693225813815e-05,
      "loss": 1.0203,
      "num_input_tokens_seen": 46325578480,
      "step": 58881
    },
    {
      "epoch": 6.246764269043072,
      "grad_norm": 0.7012274269082565,
      "learning_rate": 2.3419999645708408e-05,
      "loss": 0.9551,
      "num_input_tokens_seen": 46326365344,
      "step": 58882
    },
    {
      "epoch": 6.246870358582644,
      "grad_norm": 0.8223445939972474,
      "learning_rate": 2.3419306066823972e-05,
      "loss": 1.0165,
      "num_input_tokens_seen": 46327152160,
      "step": 58883
    },
    {
      "epoch": 6.246976448122215,
      "grad_norm": 0.9353455060720802,
      "learning_rate": 2.341861248916106e-05,
      "loss": 1.0438,
      "num_input_tokens_seen": 46327938896,
      "step": 58884
    },
    {
      "epoch": 6.247082537661787,
      "grad_norm": 1.0564816663745782,
      "learning_rate": 2.341791891272019e-05,
      "loss": 1.0589,
      "num_input_tokens_seen": 46328725744,
      "step": 58885
    },
    {
      "epoch": 6.247188627201358,
      "grad_norm": 1.0913028884825087,
      "learning_rate": 2.3417225337501906e-05,
      "loss": 0.9756,
      "num_input_tokens_seen": 46329512464,
      "step": 58886
    },
    {
      "epoch": 6.247294716740929,
      "grad_norm": 0.833509956837839,
      "learning_rate": 2.3416531763506747e-05,
      "loss": 0.9223,
      "num_input_tokens_seen": 46330299136,
      "step": 58887
    },
    {
      "epoch": 6.247400806280501,
      "grad_norm": 0.6368120390800158,
      "learning_rate": 2.3415838190735246e-05,
      "loss": 0.9861,
      "num_input_tokens_seen": 46331085808,
      "step": 58888
    },
    {
      "epoch": 6.247506895820072,
      "grad_norm": 0.8577719762035797,
      "learning_rate": 2.3415144619187934e-05,
      "loss": 1.0163,
      "num_input_tokens_seen": 46331872560,
      "step": 58889
    },
    {
      "epoch": 6.247612985359644,
      "grad_norm": 0.9679227448330507,
      "learning_rate": 2.3414451048865355e-05,
      "loss": 0.9956,
      "num_input_tokens_seen": 46332659248,
      "step": 58890
    },
    {
      "epoch": 6.247719074899215,
      "grad_norm": 0.9447203078864679,
      "learning_rate": 2.341375747976804e-05,
      "loss": 1.0482,
      "num_input_tokens_seen": 46333446000,
      "step": 58891
    },
    {
      "epoch": 6.247825164438787,
      "grad_norm": 0.8935579633163836,
      "learning_rate": 2.3413063911896528e-05,
      "loss": 0.9748,
      "num_input_tokens_seen": 46334232768,
      "step": 58892
    },
    {
      "epoch": 6.247931253978358,
      "grad_norm": 0.852295786180635,
      "learning_rate": 2.3412370345251355e-05,
      "loss": 1.0169,
      "num_input_tokens_seen": 46335019584,
      "step": 58893
    },
    {
      "epoch": 6.248037343517929,
      "grad_norm": 0.6752580339166983,
      "learning_rate": 2.3411676779833052e-05,
      "loss": 0.9878,
      "num_input_tokens_seen": 46335806432,
      "step": 58894
    },
    {
      "epoch": 6.248143433057501,
      "grad_norm": 0.6963838443582019,
      "learning_rate": 2.3410983215642164e-05,
      "loss": 0.9718,
      "num_input_tokens_seen": 46336593120,
      "step": 58895
    },
    {
      "epoch": 6.248249522597072,
      "grad_norm": 0.7558786614068939,
      "learning_rate": 2.341028965267922e-05,
      "loss": 1.0044,
      "num_input_tokens_seen": 46337379888,
      "step": 58896
    },
    {
      "epoch": 6.248355612136644,
      "grad_norm": 0.7034559336962193,
      "learning_rate": 2.340959609094475e-05,
      "loss": 1.0305,
      "num_input_tokens_seen": 46338166656,
      "step": 58897
    },
    {
      "epoch": 6.248461701676215,
      "grad_norm": 0.6714716508635832,
      "learning_rate": 2.3408902530439307e-05,
      "loss": 0.9772,
      "num_input_tokens_seen": 46338953456,
      "step": 58898
    },
    {
      "epoch": 6.248567791215786,
      "grad_norm": 0.7372688134393546,
      "learning_rate": 2.3408208971163416e-05,
      "loss": 0.9882,
      "num_input_tokens_seen": 46339740304,
      "step": 58899
    },
    {
      "epoch": 6.248673880755358,
      "grad_norm": 0.6726589567286265,
      "learning_rate": 2.340751541311761e-05,
      "loss": 0.926,
      "num_input_tokens_seen": 46340527168,
      "step": 58900
    },
    {
      "epoch": 6.248779970294929,
      "grad_norm": 0.7946505936076693,
      "learning_rate": 2.3406821856302437e-05,
      "loss": 1.0013,
      "num_input_tokens_seen": 46341313872,
      "step": 58901
    },
    {
      "epoch": 6.248886059834501,
      "grad_norm": 0.8372108350486313,
      "learning_rate": 2.340612830071842e-05,
      "loss": 1.0675,
      "num_input_tokens_seen": 46342100544,
      "step": 58902
    },
    {
      "epoch": 6.248992149374072,
      "grad_norm": 0.7261524418802792,
      "learning_rate": 2.3405434746366094e-05,
      "loss": 1.0329,
      "num_input_tokens_seen": 46342887440,
      "step": 58903
    },
    {
      "epoch": 6.249098238913643,
      "grad_norm": 0.6673900662975579,
      "learning_rate": 2.3404741193246012e-05,
      "loss": 0.9997,
      "num_input_tokens_seen": 46343674192,
      "step": 58904
    },
    {
      "epoch": 6.249204328453215,
      "grad_norm": 0.9918488147474102,
      "learning_rate": 2.3404047641358694e-05,
      "loss": 1.062,
      "num_input_tokens_seen": 46344461008,
      "step": 58905
    },
    {
      "epoch": 6.249310417992786,
      "grad_norm": 0.7384248089571039,
      "learning_rate": 2.3403354090704684e-05,
      "loss": 1.0041,
      "num_input_tokens_seen": 46345247792,
      "step": 58906
    },
    {
      "epoch": 6.249416507532358,
      "grad_norm": 0.7815410740382395,
      "learning_rate": 2.3402660541284512e-05,
      "loss": 1.013,
      "num_input_tokens_seen": 46346034592,
      "step": 58907
    },
    {
      "epoch": 6.249522597071929,
      "grad_norm": 1.3704214189200854,
      "learning_rate": 2.3401966993098715e-05,
      "loss": 1.0701,
      "num_input_tokens_seen": 46346821328,
      "step": 58908
    },
    {
      "epoch": 6.2496286866115005,
      "grad_norm": 0.7634037349607297,
      "learning_rate": 2.3401273446147837e-05,
      "loss": 1.0031,
      "num_input_tokens_seen": 46347608160,
      "step": 58909
    },
    {
      "epoch": 6.2497347761510715,
      "grad_norm": 1.2225192938404055,
      "learning_rate": 2.3400579900432408e-05,
      "loss": 1.0602,
      "num_input_tokens_seen": 46348394896,
      "step": 58910
    },
    {
      "epoch": 6.249840865690643,
      "grad_norm": 0.8229035177573859,
      "learning_rate": 2.3399886355952956e-05,
      "loss": 1.0019,
      "num_input_tokens_seen": 46349181696,
      "step": 58911
    },
    {
      "epoch": 6.2499469552302145,
      "grad_norm": 0.7807689520049564,
      "learning_rate": 2.339919281271003e-05,
      "loss": 0.9798,
      "num_input_tokens_seen": 46349968432,
      "step": 58912
    },
    {
      "epoch": 6.2500530447697855,
      "grad_norm": 0.7265251691681518,
      "learning_rate": 2.3398499270704165e-05,
      "loss": 1.1051,
      "num_input_tokens_seen": 46350755232,
      "step": 58913
    },
    {
      "epoch": 6.250159134309357,
      "grad_norm": 0.8446442859623765,
      "learning_rate": 2.3397805729935886e-05,
      "loss": 0.974,
      "num_input_tokens_seen": 46351541968,
      "step": 58914
    },
    {
      "epoch": 6.2502652238489285,
      "grad_norm": 0.8098917194849398,
      "learning_rate": 2.339711219040574e-05,
      "loss": 1.0436,
      "num_input_tokens_seen": 46352328752,
      "step": 58915
    },
    {
      "epoch": 6.2503713133884995,
      "grad_norm": 0.8284067612275984,
      "learning_rate": 2.339641865211426e-05,
      "loss": 1.0321,
      "num_input_tokens_seen": 46353115600,
      "step": 58916
    },
    {
      "epoch": 6.250477402928071,
      "grad_norm": 0.8477701532182433,
      "learning_rate": 2.3395725115061974e-05,
      "loss": 1.0168,
      "num_input_tokens_seen": 46353902384,
      "step": 58917
    },
    {
      "epoch": 6.250583492467642,
      "grad_norm": 0.8136527643370789,
      "learning_rate": 2.3395031579249427e-05,
      "loss": 1.0285,
      "num_input_tokens_seen": 46354689056,
      "step": 58918
    },
    {
      "epoch": 6.250689582007214,
      "grad_norm": 0.7994078986450294,
      "learning_rate": 2.3394338044677154e-05,
      "loss": 0.9667,
      "num_input_tokens_seen": 46355475792,
      "step": 58919
    },
    {
      "epoch": 6.250795671546785,
      "grad_norm": 0.6907428467092759,
      "learning_rate": 2.339364451134569e-05,
      "loss": 1.03,
      "num_input_tokens_seen": 46356262544,
      "step": 58920
    },
    {
      "epoch": 6.250901761086357,
      "grad_norm": 0.7586156264363797,
      "learning_rate": 2.3392950979255567e-05,
      "loss": 0.9281,
      "num_input_tokens_seen": 46357049200,
      "step": 58921
    },
    {
      "epoch": 6.251007850625928,
      "grad_norm": 0.8523131899950691,
      "learning_rate": 2.339225744840733e-05,
      "loss": 1.0093,
      "num_input_tokens_seen": 46357835936,
      "step": 58922
    },
    {
      "epoch": 6.251113940165499,
      "grad_norm": 0.7313139341939874,
      "learning_rate": 2.3391563918801504e-05,
      "loss": 0.979,
      "num_input_tokens_seen": 46358622768,
      "step": 58923
    },
    {
      "epoch": 6.251220029705071,
      "grad_norm": 1.146925030550147,
      "learning_rate": 2.3390870390438635e-05,
      "loss": 1.0235,
      "num_input_tokens_seen": 46359409520,
      "step": 58924
    },
    {
      "epoch": 6.251326119244642,
      "grad_norm": 0.6769294595166776,
      "learning_rate": 2.3390176863319246e-05,
      "loss": 1.0394,
      "num_input_tokens_seen": 46360196304,
      "step": 58925
    },
    {
      "epoch": 6.251432208784214,
      "grad_norm": 0.6855684543496514,
      "learning_rate": 2.338948333744389e-05,
      "loss": 0.9811,
      "num_input_tokens_seen": 46360983104,
      "step": 58926
    },
    {
      "epoch": 6.251538298323785,
      "grad_norm": 1.1941502375465256,
      "learning_rate": 2.3388789812813093e-05,
      "loss": 1.0506,
      "num_input_tokens_seen": 46361769888,
      "step": 58927
    },
    {
      "epoch": 6.251644387863356,
      "grad_norm": 0.8067813883408019,
      "learning_rate": 2.3388096289427387e-05,
      "loss": 1.0577,
      "num_input_tokens_seen": 46362556608,
      "step": 58928
    },
    {
      "epoch": 6.251750477402928,
      "grad_norm": 0.6351434493092996,
      "learning_rate": 2.3387402767287314e-05,
      "loss": 0.9763,
      "num_input_tokens_seen": 46363343408,
      "step": 58929
    },
    {
      "epoch": 6.251856566942499,
      "grad_norm": 1.2863776059709897,
      "learning_rate": 2.3386709246393413e-05,
      "loss": 1.0434,
      "num_input_tokens_seen": 46364130080,
      "step": 58930
    },
    {
      "epoch": 6.251962656482071,
      "grad_norm": 0.8614933002680164,
      "learning_rate": 2.338601572674621e-05,
      "loss": 1.1235,
      "num_input_tokens_seen": 46364916832,
      "step": 58931
    },
    {
      "epoch": 6.252068746021642,
      "grad_norm": 0.8405173949534265,
      "learning_rate": 2.338532220834625e-05,
      "loss": 0.9999,
      "num_input_tokens_seen": 46365703536,
      "step": 58932
    },
    {
      "epoch": 6.252174835561213,
      "grad_norm": 0.9075740027709965,
      "learning_rate": 2.338462869119407e-05,
      "loss": 0.9957,
      "num_input_tokens_seen": 46366490288,
      "step": 58933
    },
    {
      "epoch": 6.252280925100785,
      "grad_norm": 0.8273322720879938,
      "learning_rate": 2.3383935175290193e-05,
      "loss": 1.0116,
      "num_input_tokens_seen": 46367277040,
      "step": 58934
    },
    {
      "epoch": 6.252387014640356,
      "grad_norm": 0.8070418933300411,
      "learning_rate": 2.338324166063517e-05,
      "loss": 0.9831,
      "num_input_tokens_seen": 46368063872,
      "step": 58935
    },
    {
      "epoch": 6.252493104179928,
      "grad_norm": 0.8435615376648401,
      "learning_rate": 2.338254814722953e-05,
      "loss": 0.9879,
      "num_input_tokens_seen": 46368850688,
      "step": 58936
    },
    {
      "epoch": 6.252599193719499,
      "grad_norm": 0.8243404950149754,
      "learning_rate": 2.3381854635073802e-05,
      "loss": 0.9974,
      "num_input_tokens_seen": 46369637472,
      "step": 58937
    },
    {
      "epoch": 6.252705283259071,
      "grad_norm": 0.8725735468718829,
      "learning_rate": 2.3381161124168524e-05,
      "loss": 1.0636,
      "num_input_tokens_seen": 46370424288,
      "step": 58938
    },
    {
      "epoch": 6.252811372798642,
      "grad_norm": 0.8250671777808329,
      "learning_rate": 2.3380467614514252e-05,
      "loss": 1.0786,
      "num_input_tokens_seen": 46371211040,
      "step": 58939
    },
    {
      "epoch": 6.252917462338213,
      "grad_norm": 0.729289720729706,
      "learning_rate": 2.3379774106111502e-05,
      "loss": 1.0775,
      "num_input_tokens_seen": 46371997824,
      "step": 58940
    },
    {
      "epoch": 6.253023551877785,
      "grad_norm": 0.7726674697993997,
      "learning_rate": 2.3379080598960812e-05,
      "loss": 0.9689,
      "num_input_tokens_seen": 46372784528,
      "step": 58941
    },
    {
      "epoch": 6.253129641417356,
      "grad_norm": 0.9097870627623056,
      "learning_rate": 2.3378387093062725e-05,
      "loss": 1.0338,
      "num_input_tokens_seen": 46373571360,
      "step": 58942
    },
    {
      "epoch": 6.253235730956928,
      "grad_norm": 0.7484584101463237,
      "learning_rate": 2.3377693588417775e-05,
      "loss": 1.0624,
      "num_input_tokens_seen": 46374358144,
      "step": 58943
    },
    {
      "epoch": 6.253341820496499,
      "grad_norm": 0.9196587927027239,
      "learning_rate": 2.3377000085026492e-05,
      "loss": 1.0354,
      "num_input_tokens_seen": 46375144912,
      "step": 58944
    },
    {
      "epoch": 6.25344791003607,
      "grad_norm": 0.747972057200662,
      "learning_rate": 2.3376306582889417e-05,
      "loss": 0.9445,
      "num_input_tokens_seen": 46375931808,
      "step": 58945
    },
    {
      "epoch": 6.253553999575642,
      "grad_norm": 0.8030345072514631,
      "learning_rate": 2.337561308200708e-05,
      "loss": 1.0802,
      "num_input_tokens_seen": 46376718560,
      "step": 58946
    },
    {
      "epoch": 6.253660089115213,
      "grad_norm": 0.6935018460467698,
      "learning_rate": 2.337491958238003e-05,
      "loss": 1.0136,
      "num_input_tokens_seen": 46377505376,
      "step": 58947
    },
    {
      "epoch": 6.253766178654785,
      "grad_norm": 0.7839017304047025,
      "learning_rate": 2.3374226084008794e-05,
      "loss": 1.0516,
      "num_input_tokens_seen": 46378292096,
      "step": 58948
    },
    {
      "epoch": 6.253872268194356,
      "grad_norm": 0.7135193393820224,
      "learning_rate": 2.33735325868939e-05,
      "loss": 0.9615,
      "num_input_tokens_seen": 46379078848,
      "step": 58949
    },
    {
      "epoch": 6.253978357733928,
      "grad_norm": 0.7589540744339315,
      "learning_rate": 2.33728390910359e-05,
      "loss": 0.9865,
      "num_input_tokens_seen": 46379865664,
      "step": 58950
    },
    {
      "epoch": 6.254084447273499,
      "grad_norm": 0.7563722846640394,
      "learning_rate": 2.337214559643532e-05,
      "loss": 0.9766,
      "num_input_tokens_seen": 46380652496,
      "step": 58951
    },
    {
      "epoch": 6.25419053681307,
      "grad_norm": 0.757330777554245,
      "learning_rate": 2.3371452103092695e-05,
      "loss": 1.0336,
      "num_input_tokens_seen": 46381439328,
      "step": 58952
    },
    {
      "epoch": 6.254296626352642,
      "grad_norm": 0.6360952350482472,
      "learning_rate": 2.337075861100857e-05,
      "loss": 0.9514,
      "num_input_tokens_seen": 46382226096,
      "step": 58953
    },
    {
      "epoch": 6.254402715892213,
      "grad_norm": 0.6766328383272868,
      "learning_rate": 2.337006512018347e-05,
      "loss": 0.9684,
      "num_input_tokens_seen": 46383012832,
      "step": 58954
    },
    {
      "epoch": 6.254508805431785,
      "grad_norm": 0.8003930879893052,
      "learning_rate": 2.3369371630617938e-05,
      "loss": 0.9984,
      "num_input_tokens_seen": 46383799584,
      "step": 58955
    },
    {
      "epoch": 6.254614894971356,
      "grad_norm": 0.7238560053828093,
      "learning_rate": 2.3368678142312504e-05,
      "loss": 1.014,
      "num_input_tokens_seen": 46384586336,
      "step": 58956
    },
    {
      "epoch": 6.254720984510927,
      "grad_norm": 0.8269545495060057,
      "learning_rate": 2.3367984655267717e-05,
      "loss": 1.07,
      "num_input_tokens_seen": 46385373072,
      "step": 58957
    },
    {
      "epoch": 6.254827074050499,
      "grad_norm": 0.9047923807550114,
      "learning_rate": 2.3367291169484094e-05,
      "loss": 0.9492,
      "num_input_tokens_seen": 46386159872,
      "step": 58958
    },
    {
      "epoch": 6.25493316359007,
      "grad_norm": 0.8647328501592185,
      "learning_rate": 2.3366597684962184e-05,
      "loss": 1.0443,
      "num_input_tokens_seen": 46386946592,
      "step": 58959
    },
    {
      "epoch": 6.255039253129642,
      "grad_norm": 1.0783118367927715,
      "learning_rate": 2.336590420170252e-05,
      "loss": 1.0405,
      "num_input_tokens_seen": 46387733264,
      "step": 58960
    },
    {
      "epoch": 6.255145342669213,
      "grad_norm": 0.6983854924603355,
      "learning_rate": 2.3365210719705635e-05,
      "loss": 0.9199,
      "num_input_tokens_seen": 46388520032,
      "step": 58961
    },
    {
      "epoch": 6.255251432208784,
      "grad_norm": 0.8045904183522337,
      "learning_rate": 2.336451723897207e-05,
      "loss": 0.9671,
      "num_input_tokens_seen": 46389306816,
      "step": 58962
    },
    {
      "epoch": 6.255357521748356,
      "grad_norm": 1.0215488649158366,
      "learning_rate": 2.3363823759502353e-05,
      "loss": 0.9727,
      "num_input_tokens_seen": 46390093536,
      "step": 58963
    },
    {
      "epoch": 6.255463611287927,
      "grad_norm": 0.7565300630765932,
      "learning_rate": 2.3363130281297028e-05,
      "loss": 0.9632,
      "num_input_tokens_seen": 46390880432,
      "step": 58964
    },
    {
      "epoch": 6.255569700827499,
      "grad_norm": 0.7432519366467596,
      "learning_rate": 2.3362436804356632e-05,
      "loss": 0.996,
      "num_input_tokens_seen": 46391667216,
      "step": 58965
    },
    {
      "epoch": 6.25567579036707,
      "grad_norm": 0.7979416130106545,
      "learning_rate": 2.3361743328681694e-05,
      "loss": 1.0174,
      "num_input_tokens_seen": 46392453888,
      "step": 58966
    },
    {
      "epoch": 6.255781879906642,
      "grad_norm": 0.7307753291399663,
      "learning_rate": 2.336104985427275e-05,
      "loss": 0.9995,
      "num_input_tokens_seen": 46393240640,
      "step": 58967
    },
    {
      "epoch": 6.255887969446213,
      "grad_norm": 0.8434365467634212,
      "learning_rate": 2.3360356381130342e-05,
      "loss": 1.0404,
      "num_input_tokens_seen": 46394027376,
      "step": 58968
    },
    {
      "epoch": 6.255994058985784,
      "grad_norm": 0.8345849276971667,
      "learning_rate": 2.3359662909255e-05,
      "loss": 1.0261,
      "num_input_tokens_seen": 46394814224,
      "step": 58969
    },
    {
      "epoch": 6.256100148525356,
      "grad_norm": 0.8524318820268924,
      "learning_rate": 2.3358969438647267e-05,
      "loss": 0.9798,
      "num_input_tokens_seen": 46395600896,
      "step": 58970
    },
    {
      "epoch": 6.256206238064927,
      "grad_norm": 0.6642856853567511,
      "learning_rate": 2.335827596930767e-05,
      "loss": 0.9805,
      "num_input_tokens_seen": 46396387744,
      "step": 58971
    },
    {
      "epoch": 6.2563123276044985,
      "grad_norm": 0.6367192362986958,
      "learning_rate": 2.335758250123675e-05,
      "loss": 0.9465,
      "num_input_tokens_seen": 46397174480,
      "step": 58972
    },
    {
      "epoch": 6.2564184171440695,
      "grad_norm": 0.6891278461788167,
      "learning_rate": 2.3356889034435044e-05,
      "loss": 1.0212,
      "num_input_tokens_seen": 46397961248,
      "step": 58973
    },
    {
      "epoch": 6.2565245066836415,
      "grad_norm": 0.6140190648163367,
      "learning_rate": 2.3356195568903084e-05,
      "loss": 0.9751,
      "num_input_tokens_seen": 46398747920,
      "step": 58974
    },
    {
      "epoch": 6.2566305962232125,
      "grad_norm": 0.6783725461453455,
      "learning_rate": 2.3355502104641406e-05,
      "loss": 1.004,
      "num_input_tokens_seen": 46399534640,
      "step": 58975
    },
    {
      "epoch": 6.2567366857627835,
      "grad_norm": 0.7624803791867416,
      "learning_rate": 2.3354808641650548e-05,
      "loss": 0.9683,
      "num_input_tokens_seen": 46400321440,
      "step": 58976
    },
    {
      "epoch": 6.256842775302355,
      "grad_norm": 0.6927444879261065,
      "learning_rate": 2.3354115179931053e-05,
      "loss": 0.9876,
      "num_input_tokens_seen": 46401108288,
      "step": 58977
    },
    {
      "epoch": 6.2569488648419265,
      "grad_norm": 0.7413037610314127,
      "learning_rate": 2.335342171948344e-05,
      "loss": 1.0018,
      "num_input_tokens_seen": 46401894960,
      "step": 58978
    },
    {
      "epoch": 6.257054954381498,
      "grad_norm": 0.9774024751991355,
      "learning_rate": 2.335272826030826e-05,
      "loss": 1.0243,
      "num_input_tokens_seen": 46402681712,
      "step": 58979
    },
    {
      "epoch": 6.257161043921069,
      "grad_norm": 0.7346920140496125,
      "learning_rate": 2.3352034802406036e-05,
      "loss": 0.9963,
      "num_input_tokens_seen": 46403468464,
      "step": 58980
    },
    {
      "epoch": 6.2572671334606405,
      "grad_norm": 0.9307939866493251,
      "learning_rate": 2.3351341345777318e-05,
      "loss": 0.9711,
      "num_input_tokens_seen": 46404255248,
      "step": 58981
    },
    {
      "epoch": 6.257373223000212,
      "grad_norm": 0.706690934428861,
      "learning_rate": 2.3350647890422635e-05,
      "loss": 1.0854,
      "num_input_tokens_seen": 46405041984,
      "step": 58982
    },
    {
      "epoch": 6.257479312539783,
      "grad_norm": 0.6286794095208124,
      "learning_rate": 2.334995443634252e-05,
      "loss": 0.9131,
      "num_input_tokens_seen": 46405828832,
      "step": 58983
    },
    {
      "epoch": 6.257585402079355,
      "grad_norm": 1.0477398984548958,
      "learning_rate": 2.334926098353751e-05,
      "loss": 1.0223,
      "num_input_tokens_seen": 46406615664,
      "step": 58984
    },
    {
      "epoch": 6.257691491618926,
      "grad_norm": 0.8928099679323868,
      "learning_rate": 2.3348567532008152e-05,
      "loss": 0.9513,
      "num_input_tokens_seen": 46407402432,
      "step": 58985
    },
    {
      "epoch": 6.257797581158497,
      "grad_norm": 0.759921292164277,
      "learning_rate": 2.3347874081754966e-05,
      "loss": 1.0242,
      "num_input_tokens_seen": 46408189120,
      "step": 58986
    },
    {
      "epoch": 6.257903670698069,
      "grad_norm": 0.7309310385874899,
      "learning_rate": 2.3347180632778495e-05,
      "loss": 0.9689,
      "num_input_tokens_seen": 46408975904,
      "step": 58987
    },
    {
      "epoch": 6.25800976023764,
      "grad_norm": 1.2940786942961413,
      "learning_rate": 2.3346487185079276e-05,
      "loss": 0.9897,
      "num_input_tokens_seen": 46409762688,
      "step": 58988
    },
    {
      "epoch": 6.258115849777212,
      "grad_norm": 0.9923123959223067,
      "learning_rate": 2.3345793738657836e-05,
      "loss": 1.047,
      "num_input_tokens_seen": 46410549456,
      "step": 58989
    },
    {
      "epoch": 6.258221939316783,
      "grad_norm": 1.1371991504899108,
      "learning_rate": 2.3345100293514725e-05,
      "loss": 0.98,
      "num_input_tokens_seen": 46411336160,
      "step": 58990
    },
    {
      "epoch": 6.258328028856354,
      "grad_norm": 0.8250123295298499,
      "learning_rate": 2.3344406849650475e-05,
      "loss": 1.1211,
      "num_input_tokens_seen": 46412122896,
      "step": 58991
    },
    {
      "epoch": 6.258434118395926,
      "grad_norm": 0.9068944260601707,
      "learning_rate": 2.334371340706561e-05,
      "loss": 0.9688,
      "num_input_tokens_seen": 46412909648,
      "step": 58992
    },
    {
      "epoch": 6.258540207935497,
      "grad_norm": 0.7814935696992945,
      "learning_rate": 2.3343019965760683e-05,
      "loss": 0.9447,
      "num_input_tokens_seen": 46413696400,
      "step": 58993
    },
    {
      "epoch": 6.258646297475069,
      "grad_norm": 0.9422143295026645,
      "learning_rate": 2.334232652573621e-05,
      "loss": 1.015,
      "num_input_tokens_seen": 46414483168,
      "step": 58994
    },
    {
      "epoch": 6.25875238701464,
      "grad_norm": 0.9819541218684564,
      "learning_rate": 2.3341633086992747e-05,
      "loss": 1.118,
      "num_input_tokens_seen": 46415269936,
      "step": 58995
    },
    {
      "epoch": 6.258858476554212,
      "grad_norm": 0.748833186690812,
      "learning_rate": 2.3340939649530823e-05,
      "loss": 0.9695,
      "num_input_tokens_seen": 46416056656,
      "step": 58996
    },
    {
      "epoch": 6.258964566093783,
      "grad_norm": 1.0105201675034157,
      "learning_rate": 2.3340246213350967e-05,
      "loss": 0.9413,
      "num_input_tokens_seen": 46416843472,
      "step": 58997
    },
    {
      "epoch": 6.259070655633354,
      "grad_norm": 1.0986114973892542,
      "learning_rate": 2.3339552778453726e-05,
      "loss": 0.9885,
      "num_input_tokens_seen": 46417630128,
      "step": 58998
    },
    {
      "epoch": 6.259176745172926,
      "grad_norm": 0.853942748312426,
      "learning_rate": 2.3338859344839624e-05,
      "loss": 1.0261,
      "num_input_tokens_seen": 46418416896,
      "step": 58999
    },
    {
      "epoch": 6.259282834712497,
      "grad_norm": 0.8865989905625035,
      "learning_rate": 2.3338165912509204e-05,
      "loss": 0.9377,
      "num_input_tokens_seen": 46419203776,
      "step": 59000
    },
    {
      "epoch": 6.259282834712497,
      "eval_loss": 1.542393684387207,
      "eval_runtime": 64.4961,
      "eval_samples_per_second": 46.514,
      "eval_steps_per_second": 0.496,
      "num_input_tokens_seen": 46419203776,
      "step": 59000
    },
    {
      "epoch": 6.259388924252069,
      "grad_norm": 1.0602433672636962,
      "learning_rate": 2.3337472481463005e-05,
      "loss": 1.0668,
      "num_input_tokens_seen": 46419990592,
      "step": 59001
    },
    {
      "epoch": 6.25949501379164,
      "grad_norm": 0.9878809501611387,
      "learning_rate": 2.333677905170156e-05,
      "loss": 0.9968,
      "num_input_tokens_seen": 46420777312,
      "step": 59002
    },
    {
      "epoch": 6.259601103331212,
      "grad_norm": 0.8748051065100354,
      "learning_rate": 2.333608562322539e-05,
      "loss": 0.9162,
      "num_input_tokens_seen": 46421564080,
      "step": 59003
    },
    {
      "epoch": 6.259707192870783,
      "grad_norm": 0.8039248063327186,
      "learning_rate": 2.3335392196035054e-05,
      "loss": 0.9832,
      "num_input_tokens_seen": 46422350832,
      "step": 59004
    },
    {
      "epoch": 6.259813282410354,
      "grad_norm": 0.8466831467409713,
      "learning_rate": 2.333469877013108e-05,
      "loss": 0.878,
      "num_input_tokens_seen": 46423137600,
      "step": 59005
    },
    {
      "epoch": 6.259919371949926,
      "grad_norm": 0.6589381625879271,
      "learning_rate": 2.3334005345513996e-05,
      "loss": 1.0682,
      "num_input_tokens_seen": 46423924304,
      "step": 59006
    },
    {
      "epoch": 6.260025461489497,
      "grad_norm": 1.1655467968037603,
      "learning_rate": 2.333331192218435e-05,
      "loss": 0.9707,
      "num_input_tokens_seen": 46424711152,
      "step": 59007
    },
    {
      "epoch": 6.260131551029069,
      "grad_norm": 0.6801482781381993,
      "learning_rate": 2.3332618500142666e-05,
      "loss": 0.9572,
      "num_input_tokens_seen": 46425497920,
      "step": 59008
    },
    {
      "epoch": 6.26023764056864,
      "grad_norm": 0.7353273255824964,
      "learning_rate": 2.3331925079389485e-05,
      "loss": 1.0041,
      "num_input_tokens_seen": 46426284720,
      "step": 59009
    },
    {
      "epoch": 6.260343730108211,
      "grad_norm": 0.7106216892167718,
      "learning_rate": 2.3331231659925347e-05,
      "loss": 0.9745,
      "num_input_tokens_seen": 46427071520,
      "step": 59010
    },
    {
      "epoch": 6.260449819647783,
      "grad_norm": 0.809535030746643,
      "learning_rate": 2.3330538241750783e-05,
      "loss": 1.0145,
      "num_input_tokens_seen": 46427858304,
      "step": 59011
    },
    {
      "epoch": 6.260555909187354,
      "grad_norm": 0.7350935509609715,
      "learning_rate": 2.332984482486633e-05,
      "loss": 1.0195,
      "num_input_tokens_seen": 46428645088,
      "step": 59012
    },
    {
      "epoch": 6.260661998726926,
      "grad_norm": 0.7448104966931537,
      "learning_rate": 2.3329151409272526e-05,
      "loss": 0.9654,
      "num_input_tokens_seen": 46429431872,
      "step": 59013
    },
    {
      "epoch": 6.260768088266497,
      "grad_norm": 0.7883198676090423,
      "learning_rate": 2.33284579949699e-05,
      "loss": 1.062,
      "num_input_tokens_seen": 46430218656,
      "step": 59014
    },
    {
      "epoch": 6.260874177806068,
      "grad_norm": 0.8245088886522799,
      "learning_rate": 2.3327764581958996e-05,
      "loss": 0.9875,
      "num_input_tokens_seen": 46431005376,
      "step": 59015
    },
    {
      "epoch": 6.26098026734564,
      "grad_norm": 0.730094247696205,
      "learning_rate": 2.332707117024035e-05,
      "loss": 0.9652,
      "num_input_tokens_seen": 46431792256,
      "step": 59016
    },
    {
      "epoch": 6.261086356885211,
      "grad_norm": 0.8463676188172519,
      "learning_rate": 2.3326377759814484e-05,
      "loss": 1.0124,
      "num_input_tokens_seen": 46432578960,
      "step": 59017
    },
    {
      "epoch": 6.261192446424783,
      "grad_norm": 0.6746770850005053,
      "learning_rate": 2.3325684350681952e-05,
      "loss": 0.9314,
      "num_input_tokens_seen": 46433365744,
      "step": 59018
    },
    {
      "epoch": 6.261298535964354,
      "grad_norm": 0.8159192586238042,
      "learning_rate": 2.3324990942843284e-05,
      "loss": 0.9914,
      "num_input_tokens_seen": 46434152496,
      "step": 59019
    },
    {
      "epoch": 6.261404625503925,
      "grad_norm": 0.8022621441077293,
      "learning_rate": 2.3324297536299007e-05,
      "loss": 1.0756,
      "num_input_tokens_seen": 46434939264,
      "step": 59020
    },
    {
      "epoch": 6.261510715043497,
      "grad_norm": 0.8208876144278672,
      "learning_rate": 2.332360413104967e-05,
      "loss": 0.9998,
      "num_input_tokens_seen": 46435725952,
      "step": 59021
    },
    {
      "epoch": 6.261616804583068,
      "grad_norm": 0.6656875711447335,
      "learning_rate": 2.33229107270958e-05,
      "loss": 0.9834,
      "num_input_tokens_seen": 46436512784,
      "step": 59022
    },
    {
      "epoch": 6.26172289412264,
      "grad_norm": 0.8775490468000614,
      "learning_rate": 2.332221732443793e-05,
      "loss": 1.0376,
      "num_input_tokens_seen": 46437299568,
      "step": 59023
    },
    {
      "epoch": 6.261828983662211,
      "grad_norm": 0.6442926411138361,
      "learning_rate": 2.332152392307661e-05,
      "loss": 1.0217,
      "num_input_tokens_seen": 46438086368,
      "step": 59024
    },
    {
      "epoch": 6.261935073201783,
      "grad_norm": 0.7882342576500758,
      "learning_rate": 2.3320830523012366e-05,
      "loss": 1.0141,
      "num_input_tokens_seen": 46438873120,
      "step": 59025
    },
    {
      "epoch": 6.262041162741354,
      "grad_norm": 0.980462183186453,
      "learning_rate": 2.332013712424573e-05,
      "loss": 1.0884,
      "num_input_tokens_seen": 46439659936,
      "step": 59026
    },
    {
      "epoch": 6.262147252280925,
      "grad_norm": 0.676312283090209,
      "learning_rate": 2.3319443726777247e-05,
      "loss": 0.9109,
      "num_input_tokens_seen": 46440446624,
      "step": 59027
    },
    {
      "epoch": 6.262253341820497,
      "grad_norm": 1.1124471644435219,
      "learning_rate": 2.3318750330607443e-05,
      "loss": 1.0645,
      "num_input_tokens_seen": 46441233392,
      "step": 59028
    },
    {
      "epoch": 6.262359431360068,
      "grad_norm": 0.8433324780023259,
      "learning_rate": 2.3318056935736862e-05,
      "loss": 0.9989,
      "num_input_tokens_seen": 46442020096,
      "step": 59029
    },
    {
      "epoch": 6.26246552089964,
      "grad_norm": 0.6982222770117796,
      "learning_rate": 2.331736354216604e-05,
      "loss": 0.9518,
      "num_input_tokens_seen": 46442806816,
      "step": 59030
    },
    {
      "epoch": 6.262571610439211,
      "grad_norm": 0.8425331967775622,
      "learning_rate": 2.3316670149895505e-05,
      "loss": 1.0676,
      "num_input_tokens_seen": 46443593552,
      "step": 59031
    },
    {
      "epoch": 6.2626776999787825,
      "grad_norm": 0.7784675759726623,
      "learning_rate": 2.3315976758925803e-05,
      "loss": 1.0409,
      "num_input_tokens_seen": 46444380224,
      "step": 59032
    },
    {
      "epoch": 6.262783789518354,
      "grad_norm": 1.187903786585712,
      "learning_rate": 2.3315283369257454e-05,
      "loss": 1.1124,
      "num_input_tokens_seen": 46445166944,
      "step": 59033
    },
    {
      "epoch": 6.262889879057925,
      "grad_norm": 0.8263184642998774,
      "learning_rate": 2.3314589980891016e-05,
      "loss": 1.0024,
      "num_input_tokens_seen": 46445953680,
      "step": 59034
    },
    {
      "epoch": 6.2629959685974965,
      "grad_norm": 1.6579513824520569,
      "learning_rate": 2.3313896593827006e-05,
      "loss": 0.9659,
      "num_input_tokens_seen": 46446740528,
      "step": 59035
    },
    {
      "epoch": 6.2631020581370676,
      "grad_norm": 0.9360470456551883,
      "learning_rate": 2.3313203208065977e-05,
      "loss": 1.0514,
      "num_input_tokens_seen": 46447527264,
      "step": 59036
    },
    {
      "epoch": 6.2632081476766395,
      "grad_norm": 0.8460133882289578,
      "learning_rate": 2.331250982360845e-05,
      "loss": 1.0332,
      "num_input_tokens_seen": 46448314064,
      "step": 59037
    },
    {
      "epoch": 6.2633142372162105,
      "grad_norm": 1.2671421680586072,
      "learning_rate": 2.331181644045496e-05,
      "loss": 1.0906,
      "num_input_tokens_seen": 46449100864,
      "step": 59038
    },
    {
      "epoch": 6.2634203267557815,
      "grad_norm": 0.7932523336097046,
      "learning_rate": 2.331112305860606e-05,
      "loss": 1.0141,
      "num_input_tokens_seen": 46449887536,
      "step": 59039
    },
    {
      "epoch": 6.2635264162953534,
      "grad_norm": 0.7847928574007044,
      "learning_rate": 2.331042967806227e-05,
      "loss": 0.9922,
      "num_input_tokens_seen": 46450674272,
      "step": 59040
    },
    {
      "epoch": 6.2636325058349245,
      "grad_norm": 1.1579575915600877,
      "learning_rate": 2.3309736298824127e-05,
      "loss": 1.0212,
      "num_input_tokens_seen": 46451461024,
      "step": 59041
    },
    {
      "epoch": 6.263738595374496,
      "grad_norm": 0.706063318814545,
      "learning_rate": 2.3309042920892175e-05,
      "loss": 0.9406,
      "num_input_tokens_seen": 46452247776,
      "step": 59042
    },
    {
      "epoch": 6.263844684914067,
      "grad_norm": 1.2184111509040332,
      "learning_rate": 2.3308349544266945e-05,
      "loss": 0.9721,
      "num_input_tokens_seen": 46453034544,
      "step": 59043
    },
    {
      "epoch": 6.2639507744536385,
      "grad_norm": 1.0272101828648201,
      "learning_rate": 2.3307656168948965e-05,
      "loss": 1.0046,
      "num_input_tokens_seen": 46453821248,
      "step": 59044
    },
    {
      "epoch": 6.26405686399321,
      "grad_norm": 0.8823473945156691,
      "learning_rate": 2.3306962794938786e-05,
      "loss": 0.932,
      "num_input_tokens_seen": 46454608080,
      "step": 59045
    },
    {
      "epoch": 6.264162953532781,
      "grad_norm": 0.8086918709579939,
      "learning_rate": 2.3306269422236938e-05,
      "loss": 1.0171,
      "num_input_tokens_seen": 46455394848,
      "step": 59046
    },
    {
      "epoch": 6.264269043072353,
      "grad_norm": 0.6833405620157709,
      "learning_rate": 2.330557605084395e-05,
      "loss": 0.9922,
      "num_input_tokens_seen": 46456181552,
      "step": 59047
    },
    {
      "epoch": 6.264375132611924,
      "grad_norm": 0.9160365065810936,
      "learning_rate": 2.3304882680760365e-05,
      "loss": 0.9762,
      "num_input_tokens_seen": 46456968336,
      "step": 59048
    },
    {
      "epoch": 6.264481222151496,
      "grad_norm": 0.6466709720664768,
      "learning_rate": 2.3304189311986717e-05,
      "loss": 0.9418,
      "num_input_tokens_seen": 46457755056,
      "step": 59049
    },
    {
      "epoch": 6.264587311691067,
      "grad_norm": 0.8615089798941846,
      "learning_rate": 2.330349594452354e-05,
      "loss": 1.0153,
      "num_input_tokens_seen": 46458541888,
      "step": 59050
    },
    {
      "epoch": 6.264693401230638,
      "grad_norm": 0.7403736247178738,
      "learning_rate": 2.3302802578371378e-05,
      "loss": 0.9961,
      "num_input_tokens_seen": 46459328672,
      "step": 59051
    },
    {
      "epoch": 6.26479949077021,
      "grad_norm": 0.8726945638274556,
      "learning_rate": 2.330210921353075e-05,
      "loss": 0.9779,
      "num_input_tokens_seen": 46460115472,
      "step": 59052
    },
    {
      "epoch": 6.264905580309781,
      "grad_norm": 1.7372110097341253,
      "learning_rate": 2.3301415850002212e-05,
      "loss": 0.9475,
      "num_input_tokens_seen": 46460902176,
      "step": 59053
    },
    {
      "epoch": 6.265011669849353,
      "grad_norm": 1.069850423726662,
      "learning_rate": 2.3300722487786287e-05,
      "loss": 1.0718,
      "num_input_tokens_seen": 46461688880,
      "step": 59054
    },
    {
      "epoch": 6.265117759388924,
      "grad_norm": 0.8866918708847336,
      "learning_rate": 2.330002912688351e-05,
      "loss": 1.0147,
      "num_input_tokens_seen": 46462475648,
      "step": 59055
    },
    {
      "epoch": 6.265223848928495,
      "grad_norm": 1.2727494157702446,
      "learning_rate": 2.3299335767294426e-05,
      "loss": 0.9959,
      "num_input_tokens_seen": 46463262448,
      "step": 59056
    },
    {
      "epoch": 6.265329938468067,
      "grad_norm": 0.8394557713458548,
      "learning_rate": 2.3298642409019565e-05,
      "loss": 0.9873,
      "num_input_tokens_seen": 46464049216,
      "step": 59057
    },
    {
      "epoch": 6.265436028007638,
      "grad_norm": 0.8879917317943724,
      "learning_rate": 2.3297949052059455e-05,
      "loss": 0.9823,
      "num_input_tokens_seen": 46464836064,
      "step": 59058
    },
    {
      "epoch": 6.26554211754721,
      "grad_norm": 0.8075461010767322,
      "learning_rate": 2.3297255696414648e-05,
      "loss": 0.9561,
      "num_input_tokens_seen": 46465622928,
      "step": 59059
    },
    {
      "epoch": 6.265648207086781,
      "grad_norm": 0.9442315858825743,
      "learning_rate": 2.3296562342085673e-05,
      "loss": 1.0162,
      "num_input_tokens_seen": 46466409632,
      "step": 59060
    },
    {
      "epoch": 6.265754296626353,
      "grad_norm": 0.9054692573217473,
      "learning_rate": 2.329586898907306e-05,
      "loss": 1.0266,
      "num_input_tokens_seen": 46467196480,
      "step": 59061
    },
    {
      "epoch": 6.265860386165924,
      "grad_norm": 0.9605564763170445,
      "learning_rate": 2.329517563737735e-05,
      "loss": 0.9531,
      "num_input_tokens_seen": 46467983312,
      "step": 59062
    },
    {
      "epoch": 6.265966475705495,
      "grad_norm": 0.8950774086872804,
      "learning_rate": 2.3294482286999082e-05,
      "loss": 0.9645,
      "num_input_tokens_seen": 46468770096,
      "step": 59063
    },
    {
      "epoch": 6.266072565245067,
      "grad_norm": 0.7598216045102917,
      "learning_rate": 2.329378893793878e-05,
      "loss": 1.0197,
      "num_input_tokens_seen": 46469556960,
      "step": 59064
    },
    {
      "epoch": 6.266178654784638,
      "grad_norm": 1.2111397224576295,
      "learning_rate": 2.3293095590196998e-05,
      "loss": 1.074,
      "num_input_tokens_seen": 46470343680,
      "step": 59065
    },
    {
      "epoch": 6.26628474432421,
      "grad_norm": 0.8594672206980879,
      "learning_rate": 2.3292402243774252e-05,
      "loss": 0.9951,
      "num_input_tokens_seen": 46471130432,
      "step": 59066
    },
    {
      "epoch": 6.266390833863781,
      "grad_norm": 0.7708618340972685,
      "learning_rate": 2.3291708898671096e-05,
      "loss": 1.0336,
      "num_input_tokens_seen": 46471917168,
      "step": 59067
    },
    {
      "epoch": 6.266496923403352,
      "grad_norm": 0.987028048307136,
      "learning_rate": 2.3291015554888054e-05,
      "loss": 0.9191,
      "num_input_tokens_seen": 46472703968,
      "step": 59068
    },
    {
      "epoch": 6.266603012942924,
      "grad_norm": 0.7633644585974229,
      "learning_rate": 2.329032221242566e-05,
      "loss": 1.0407,
      "num_input_tokens_seen": 46473490608,
      "step": 59069
    },
    {
      "epoch": 6.266709102482495,
      "grad_norm": 0.767429136972107,
      "learning_rate": 2.328962887128446e-05,
      "loss": 1.0548,
      "num_input_tokens_seen": 46474277344,
      "step": 59070
    },
    {
      "epoch": 6.266815192022067,
      "grad_norm": 0.637393136264789,
      "learning_rate": 2.328893553146499e-05,
      "loss": 0.9602,
      "num_input_tokens_seen": 46475064064,
      "step": 59071
    },
    {
      "epoch": 6.266921281561638,
      "grad_norm": 0.697727524435783,
      "learning_rate": 2.328824219296777e-05,
      "loss": 0.9591,
      "num_input_tokens_seen": 46475850880,
      "step": 59072
    },
    {
      "epoch": 6.267027371101209,
      "grad_norm": 0.7414325994829855,
      "learning_rate": 2.328754885579335e-05,
      "loss": 1.0087,
      "num_input_tokens_seen": 46476637600,
      "step": 59073
    },
    {
      "epoch": 6.267133460640781,
      "grad_norm": 0.70200234705935,
      "learning_rate": 2.3286855519942266e-05,
      "loss": 0.9378,
      "num_input_tokens_seen": 46477424368,
      "step": 59074
    },
    {
      "epoch": 6.267239550180352,
      "grad_norm": 0.7117611763223062,
      "learning_rate": 2.328616218541504e-05,
      "loss": 1.0389,
      "num_input_tokens_seen": 46478211088,
      "step": 59075
    },
    {
      "epoch": 6.267345639719924,
      "grad_norm": 0.791383253721149,
      "learning_rate": 2.3285468852212227e-05,
      "loss": 1.0602,
      "num_input_tokens_seen": 46478997888,
      "step": 59076
    },
    {
      "epoch": 6.267451729259495,
      "grad_norm": 0.685148790695372,
      "learning_rate": 2.3284775520334355e-05,
      "loss": 1.0033,
      "num_input_tokens_seen": 46479784720,
      "step": 59077
    },
    {
      "epoch": 6.267557818799067,
      "grad_norm": 0.8646177108054167,
      "learning_rate": 2.3284082189781947e-05,
      "loss": 1.0626,
      "num_input_tokens_seen": 46480571504,
      "step": 59078
    },
    {
      "epoch": 6.267663908338638,
      "grad_norm": 0.7753764550965657,
      "learning_rate": 2.328338886055556e-05,
      "loss": 0.9675,
      "num_input_tokens_seen": 46481358288,
      "step": 59079
    },
    {
      "epoch": 6.267769997878209,
      "grad_norm": 0.8203801396716732,
      "learning_rate": 2.328269553265572e-05,
      "loss": 0.9905,
      "num_input_tokens_seen": 46482145088,
      "step": 59080
    },
    {
      "epoch": 6.267876087417781,
      "grad_norm": 0.9818183405248666,
      "learning_rate": 2.3282002206082954e-05,
      "loss": 0.9845,
      "num_input_tokens_seen": 46482931824,
      "step": 59081
    },
    {
      "epoch": 6.267982176957352,
      "grad_norm": 0.7585371260943066,
      "learning_rate": 2.3281308880837814e-05,
      "loss": 0.9883,
      "num_input_tokens_seen": 46483718608,
      "step": 59082
    },
    {
      "epoch": 6.268088266496924,
      "grad_norm": 0.8596144110093836,
      "learning_rate": 2.3280615556920822e-05,
      "loss": 0.9964,
      "num_input_tokens_seen": 46484505344,
      "step": 59083
    },
    {
      "epoch": 6.268194356036495,
      "grad_norm": 0.7075982080114708,
      "learning_rate": 2.3279922234332523e-05,
      "loss": 1.0153,
      "num_input_tokens_seen": 46485292112,
      "step": 59084
    },
    {
      "epoch": 6.268300445576066,
      "grad_norm": 0.79314544963842,
      "learning_rate": 2.327922891307345e-05,
      "loss": 0.9124,
      "num_input_tokens_seen": 46486078896,
      "step": 59085
    },
    {
      "epoch": 6.268406535115638,
      "grad_norm": 0.7363812614145719,
      "learning_rate": 2.3278535593144135e-05,
      "loss": 0.983,
      "num_input_tokens_seen": 46486865616,
      "step": 59086
    },
    {
      "epoch": 6.268512624655209,
      "grad_norm": 0.7727347562725041,
      "learning_rate": 2.3277842274545124e-05,
      "loss": 0.9042,
      "num_input_tokens_seen": 46487652496,
      "step": 59087
    },
    {
      "epoch": 6.268618714194781,
      "grad_norm": 0.7541142955797023,
      "learning_rate": 2.3277148957276944e-05,
      "loss": 0.9467,
      "num_input_tokens_seen": 46488439360,
      "step": 59088
    },
    {
      "epoch": 6.268724803734352,
      "grad_norm": 0.7632958900534725,
      "learning_rate": 2.3276455641340124e-05,
      "loss": 0.9608,
      "num_input_tokens_seen": 46489226112,
      "step": 59089
    },
    {
      "epoch": 6.268830893273924,
      "grad_norm": 0.7927074964057576,
      "learning_rate": 2.327576232673522e-05,
      "loss": 1.0202,
      "num_input_tokens_seen": 46490012928,
      "step": 59090
    },
    {
      "epoch": 6.268936982813495,
      "grad_norm": 0.9526390238841473,
      "learning_rate": 2.3275069013462754e-05,
      "loss": 1.014,
      "num_input_tokens_seen": 46490799648,
      "step": 59091
    },
    {
      "epoch": 6.269043072353066,
      "grad_norm": 0.8658325420063535,
      "learning_rate": 2.3274375701523255e-05,
      "loss": 0.9487,
      "num_input_tokens_seen": 46491586416,
      "step": 59092
    },
    {
      "epoch": 6.269149161892638,
      "grad_norm": 0.8716821431073837,
      "learning_rate": 2.3273682390917277e-05,
      "loss": 1.041,
      "num_input_tokens_seen": 46492373248,
      "step": 59093
    },
    {
      "epoch": 6.269255251432209,
      "grad_norm": 1.1322706327323386,
      "learning_rate": 2.3272989081645345e-05,
      "loss": 1.0312,
      "num_input_tokens_seen": 46493159936,
      "step": 59094
    },
    {
      "epoch": 6.2693613409717805,
      "grad_norm": 0.8443881309589139,
      "learning_rate": 2.3272295773707992e-05,
      "loss": 1.0007,
      "num_input_tokens_seen": 46493946784,
      "step": 59095
    },
    {
      "epoch": 6.269467430511352,
      "grad_norm": 0.8460418079369572,
      "learning_rate": 2.3271602467105763e-05,
      "loss": 1.0286,
      "num_input_tokens_seen": 46494733536,
      "step": 59096
    },
    {
      "epoch": 6.269573520050923,
      "grad_norm": 1.0082032957500975,
      "learning_rate": 2.3270909161839193e-05,
      "loss": 1.0865,
      "num_input_tokens_seen": 46495520336,
      "step": 59097
    },
    {
      "epoch": 6.2696796095904945,
      "grad_norm": 0.6446738480351275,
      "learning_rate": 2.3270215857908803e-05,
      "loss": 0.9242,
      "num_input_tokens_seen": 46496307168,
      "step": 59098
    },
    {
      "epoch": 6.269785699130066,
      "grad_norm": 0.855741939320144,
      "learning_rate": 2.3269522555315147e-05,
      "loss": 1.0555,
      "num_input_tokens_seen": 46497093952,
      "step": 59099
    },
    {
      "epoch": 6.2698917886696375,
      "grad_norm": 0.9370565930526388,
      "learning_rate": 2.3268829254058746e-05,
      "loss": 1.021,
      "num_input_tokens_seen": 46497880640,
      "step": 59100
    },
    {
      "epoch": 6.2699978782092085,
      "grad_norm": 0.7209008529384532,
      "learning_rate": 2.326813595414015e-05,
      "loss": 0.9839,
      "num_input_tokens_seen": 46498667360,
      "step": 59101
    },
    {
      "epoch": 6.2701039677487795,
      "grad_norm": 0.7565162208197446,
      "learning_rate": 2.3267442655559888e-05,
      "loss": 0.9506,
      "num_input_tokens_seen": 46499454096,
      "step": 59102
    },
    {
      "epoch": 6.2702100572883515,
      "grad_norm": 0.6293633163680756,
      "learning_rate": 2.3266749358318487e-05,
      "loss": 0.8898,
      "num_input_tokens_seen": 46500240928,
      "step": 59103
    },
    {
      "epoch": 6.2703161468279225,
      "grad_norm": 0.8445978218878017,
      "learning_rate": 2.32660560624165e-05,
      "loss": 0.8471,
      "num_input_tokens_seen": 46501027712,
      "step": 59104
    },
    {
      "epoch": 6.270422236367494,
      "grad_norm": 1.2448085001163949,
      "learning_rate": 2.3265362767854454e-05,
      "loss": 1.0387,
      "num_input_tokens_seen": 46501814480,
      "step": 59105
    },
    {
      "epoch": 6.270528325907065,
      "grad_norm": 0.8786062740598348,
      "learning_rate": 2.326466947463288e-05,
      "loss": 1.073,
      "num_input_tokens_seen": 46502601152,
      "step": 59106
    },
    {
      "epoch": 6.270634415446637,
      "grad_norm": 1.6853810497695672,
      "learning_rate": 2.326397618275232e-05,
      "loss": 0.9826,
      "num_input_tokens_seen": 46503387904,
      "step": 59107
    },
    {
      "epoch": 6.270740504986208,
      "grad_norm": 1.5508576364062874,
      "learning_rate": 2.3263282892213307e-05,
      "loss": 0.9865,
      "num_input_tokens_seen": 46504174768,
      "step": 59108
    },
    {
      "epoch": 6.270846594525779,
      "grad_norm": 0.8121859615988953,
      "learning_rate": 2.326258960301638e-05,
      "loss": 0.9587,
      "num_input_tokens_seen": 46504961536,
      "step": 59109
    },
    {
      "epoch": 6.270952684065351,
      "grad_norm": 1.0264297793989663,
      "learning_rate": 2.3261896315162075e-05,
      "loss": 1.0012,
      "num_input_tokens_seen": 46505748352,
      "step": 59110
    },
    {
      "epoch": 6.271058773604922,
      "grad_norm": 1.0222191418511377,
      "learning_rate": 2.3261203028650925e-05,
      "loss": 1.0613,
      "num_input_tokens_seen": 46506535168,
      "step": 59111
    },
    {
      "epoch": 6.271164863144494,
      "grad_norm": 0.9108218249604001,
      "learning_rate": 2.3260509743483457e-05,
      "loss": 0.9779,
      "num_input_tokens_seen": 46507321904,
      "step": 59112
    },
    {
      "epoch": 6.271270952684065,
      "grad_norm": 0.7559940981033286,
      "learning_rate": 2.3259816459660228e-05,
      "loss": 0.9974,
      "num_input_tokens_seen": 46508108560,
      "step": 59113
    },
    {
      "epoch": 6.271377042223636,
      "grad_norm": 1.2185829563498263,
      "learning_rate": 2.325912317718175e-05,
      "loss": 0.9744,
      "num_input_tokens_seen": 46508895328,
      "step": 59114
    },
    {
      "epoch": 6.271483131763208,
      "grad_norm": 0.8253477995971856,
      "learning_rate": 2.3258429896048582e-05,
      "loss": 0.9586,
      "num_input_tokens_seen": 46509682064,
      "step": 59115
    },
    {
      "epoch": 6.271589221302779,
      "grad_norm": 0.9891826557756113,
      "learning_rate": 2.3257736616261248e-05,
      "loss": 0.9909,
      "num_input_tokens_seen": 46510468816,
      "step": 59116
    },
    {
      "epoch": 6.271695310842351,
      "grad_norm": 0.7714532411279575,
      "learning_rate": 2.3257043337820275e-05,
      "loss": 0.9021,
      "num_input_tokens_seen": 46511255600,
      "step": 59117
    },
    {
      "epoch": 6.271801400381922,
      "grad_norm": 0.9289221452952857,
      "learning_rate": 2.3256350060726214e-05,
      "loss": 1.0444,
      "num_input_tokens_seen": 46512042352,
      "step": 59118
    },
    {
      "epoch": 6.271907489921494,
      "grad_norm": 0.7808428394498681,
      "learning_rate": 2.3255656784979596e-05,
      "loss": 1.0083,
      "num_input_tokens_seen": 46512829184,
      "step": 59119
    },
    {
      "epoch": 6.272013579461065,
      "grad_norm": 0.8405719618572066,
      "learning_rate": 2.325496351058095e-05,
      "loss": 1.0467,
      "num_input_tokens_seen": 46513615824,
      "step": 59120
    },
    {
      "epoch": 6.272119669000636,
      "grad_norm": 0.7452563812883629,
      "learning_rate": 2.325427023753082e-05,
      "loss": 0.9695,
      "num_input_tokens_seen": 46514402544,
      "step": 59121
    },
    {
      "epoch": 6.272225758540208,
      "grad_norm": 1.0443221271714562,
      "learning_rate": 2.325357696582974e-05,
      "loss": 1.0104,
      "num_input_tokens_seen": 46515189360,
      "step": 59122
    },
    {
      "epoch": 6.272331848079779,
      "grad_norm": 0.7212329496504657,
      "learning_rate": 2.325288369547824e-05,
      "loss": 1.0074,
      "num_input_tokens_seen": 46515976192,
      "step": 59123
    },
    {
      "epoch": 6.272437937619351,
      "grad_norm": 0.7375356576084735,
      "learning_rate": 2.3252190426476864e-05,
      "loss": 1.0256,
      "num_input_tokens_seen": 46516762896,
      "step": 59124
    },
    {
      "epoch": 6.272544027158922,
      "grad_norm": 0.7287179777445199,
      "learning_rate": 2.3251497158826143e-05,
      "loss": 1.0285,
      "num_input_tokens_seen": 46517549664,
      "step": 59125
    },
    {
      "epoch": 6.272650116698493,
      "grad_norm": 0.7939083192415086,
      "learning_rate": 2.325080389252661e-05,
      "loss": 0.9492,
      "num_input_tokens_seen": 46518336448,
      "step": 59126
    },
    {
      "epoch": 6.272756206238065,
      "grad_norm": 1.1114852027735607,
      "learning_rate": 2.325011062757881e-05,
      "loss": 0.978,
      "num_input_tokens_seen": 46519123296,
      "step": 59127
    },
    {
      "epoch": 6.272862295777636,
      "grad_norm": 0.6944569647463688,
      "learning_rate": 2.3249417363983262e-05,
      "loss": 0.9991,
      "num_input_tokens_seen": 46519910064,
      "step": 59128
    },
    {
      "epoch": 6.272968385317208,
      "grad_norm": 0.6932062597153208,
      "learning_rate": 2.3248724101740524e-05,
      "loss": 0.9565,
      "num_input_tokens_seen": 46520696896,
      "step": 59129
    },
    {
      "epoch": 6.273074474856779,
      "grad_norm": 0.7076495279370298,
      "learning_rate": 2.3248030840851115e-05,
      "loss": 0.9429,
      "num_input_tokens_seen": 46521483648,
      "step": 59130
    },
    {
      "epoch": 6.27318056439635,
      "grad_norm": 0.7354437271529463,
      "learning_rate": 2.3247337581315582e-05,
      "loss": 1.0528,
      "num_input_tokens_seen": 46522270384,
      "step": 59131
    },
    {
      "epoch": 6.273286653935922,
      "grad_norm": 0.8711922188662462,
      "learning_rate": 2.3246644323134456e-05,
      "loss": 1.0071,
      "num_input_tokens_seen": 46523057216,
      "step": 59132
    },
    {
      "epoch": 6.273392743475493,
      "grad_norm": 0.7576152172920942,
      "learning_rate": 2.3245951066308263e-05,
      "loss": 1.0528,
      "num_input_tokens_seen": 46523843968,
      "step": 59133
    },
    {
      "epoch": 6.273498833015065,
      "grad_norm": 0.744025382914191,
      "learning_rate": 2.3245257810837557e-05,
      "loss": 1.0207,
      "num_input_tokens_seen": 46524630768,
      "step": 59134
    },
    {
      "epoch": 6.273604922554636,
      "grad_norm": 0.8865122871210088,
      "learning_rate": 2.3244564556722856e-05,
      "loss": 1.0093,
      "num_input_tokens_seen": 46525417504,
      "step": 59135
    },
    {
      "epoch": 6.273711012094208,
      "grad_norm": 0.6698242319591102,
      "learning_rate": 2.3243871303964712e-05,
      "loss": 1.0084,
      "num_input_tokens_seen": 46526204320,
      "step": 59136
    },
    {
      "epoch": 6.273817101633779,
      "grad_norm": 0.812259620261533,
      "learning_rate": 2.324317805256365e-05,
      "loss": 0.9318,
      "num_input_tokens_seen": 46526991104,
      "step": 59137
    },
    {
      "epoch": 6.27392319117335,
      "grad_norm": 0.7643269426122062,
      "learning_rate": 2.3242484802520207e-05,
      "loss": 1.1443,
      "num_input_tokens_seen": 46527777824,
      "step": 59138
    },
    {
      "epoch": 6.274029280712922,
      "grad_norm": 0.7151149091705404,
      "learning_rate": 2.3241791553834922e-05,
      "loss": 1.0426,
      "num_input_tokens_seen": 46528564576,
      "step": 59139
    },
    {
      "epoch": 6.274135370252493,
      "grad_norm": 0.7291008730620827,
      "learning_rate": 2.324109830650833e-05,
      "loss": 0.9854,
      "num_input_tokens_seen": 46529351248,
      "step": 59140
    },
    {
      "epoch": 6.274241459792065,
      "grad_norm": 0.7032031460907848,
      "learning_rate": 2.324040506054096e-05,
      "loss": 1.0369,
      "num_input_tokens_seen": 46530138000,
      "step": 59141
    },
    {
      "epoch": 6.274347549331636,
      "grad_norm": 0.8637414156046764,
      "learning_rate": 2.3239711815933357e-05,
      "loss": 1.0075,
      "num_input_tokens_seen": 46530924720,
      "step": 59142
    },
    {
      "epoch": 6.274453638871207,
      "grad_norm": 0.7603643902533715,
      "learning_rate": 2.3239018572686055e-05,
      "loss": 1.0057,
      "num_input_tokens_seen": 46531711584,
      "step": 59143
    },
    {
      "epoch": 6.274559728410779,
      "grad_norm": 0.7090853008922728,
      "learning_rate": 2.3238325330799582e-05,
      "loss": 1.0404,
      "num_input_tokens_seen": 46532498352,
      "step": 59144
    },
    {
      "epoch": 6.27466581795035,
      "grad_norm": 1.1214280088005664,
      "learning_rate": 2.3237632090274485e-05,
      "loss": 1.025,
      "num_input_tokens_seen": 46533285168,
      "step": 59145
    },
    {
      "epoch": 6.274771907489922,
      "grad_norm": 0.7843001275346025,
      "learning_rate": 2.3236938851111294e-05,
      "loss": 1.0665,
      "num_input_tokens_seen": 46534071840,
      "step": 59146
    },
    {
      "epoch": 6.274877997029493,
      "grad_norm": 0.9620427161906056,
      "learning_rate": 2.3236245613310542e-05,
      "loss": 0.93,
      "num_input_tokens_seen": 46534858592,
      "step": 59147
    },
    {
      "epoch": 6.274984086569065,
      "grad_norm": 0.7413409947537,
      "learning_rate": 2.3235552376872772e-05,
      "loss": 0.9784,
      "num_input_tokens_seen": 46535645344,
      "step": 59148
    },
    {
      "epoch": 6.275090176108636,
      "grad_norm": 0.9065513884196047,
      "learning_rate": 2.323485914179851e-05,
      "loss": 1.0455,
      "num_input_tokens_seen": 46536432080,
      "step": 59149
    },
    {
      "epoch": 6.275196265648207,
      "grad_norm": 0.8468617525273121,
      "learning_rate": 2.3234165908088298e-05,
      "loss": 0.9865,
      "num_input_tokens_seen": 46537218816,
      "step": 59150
    },
    {
      "epoch": 6.275302355187779,
      "grad_norm": 0.8004584214677958,
      "learning_rate": 2.3233472675742672e-05,
      "loss": 1.0391,
      "num_input_tokens_seen": 46538005552,
      "step": 59151
    },
    {
      "epoch": 6.27540844472735,
      "grad_norm": 0.8858439741751185,
      "learning_rate": 2.3232779444762165e-05,
      "loss": 1.018,
      "num_input_tokens_seen": 46538792320,
      "step": 59152
    },
    {
      "epoch": 6.275514534266922,
      "grad_norm": 0.8875500109779706,
      "learning_rate": 2.323208621514732e-05,
      "loss": 1.0821,
      "num_input_tokens_seen": 46539579088,
      "step": 59153
    },
    {
      "epoch": 6.275620623806493,
      "grad_norm": 0.9145594331355589,
      "learning_rate": 2.3231392986898664e-05,
      "loss": 1.059,
      "num_input_tokens_seen": 46540365728,
      "step": 59154
    },
    {
      "epoch": 6.275726713346064,
      "grad_norm": 0.8676087682916347,
      "learning_rate": 2.323069976001673e-05,
      "loss": 0.9586,
      "num_input_tokens_seen": 46541152416,
      "step": 59155
    },
    {
      "epoch": 6.275832802885636,
      "grad_norm": 0.6758746352660453,
      "learning_rate": 2.3230006534502065e-05,
      "loss": 0.954,
      "num_input_tokens_seen": 46541939248,
      "step": 59156
    },
    {
      "epoch": 6.275938892425207,
      "grad_norm": 0.6718282511677973,
      "learning_rate": 2.32293133103552e-05,
      "loss": 0.9817,
      "num_input_tokens_seen": 46542726080,
      "step": 59157
    },
    {
      "epoch": 6.276044981964779,
      "grad_norm": 0.86765267458994,
      "learning_rate": 2.3228620087576662e-05,
      "loss": 1.0187,
      "num_input_tokens_seen": 46543512880,
      "step": 59158
    },
    {
      "epoch": 6.27615107150435,
      "grad_norm": 0.9208796088978428,
      "learning_rate": 2.3227926866167004e-05,
      "loss": 1.0757,
      "num_input_tokens_seen": 46544299632,
      "step": 59159
    },
    {
      "epoch": 6.276257161043921,
      "grad_norm": 1.4287680656455877,
      "learning_rate": 2.322723364612675e-05,
      "loss": 1.0493,
      "num_input_tokens_seen": 46545086464,
      "step": 59160
    },
    {
      "epoch": 6.2763632505834925,
      "grad_norm": 1.219092942193161,
      "learning_rate": 2.3226540427456432e-05,
      "loss": 1.0284,
      "num_input_tokens_seen": 46545873312,
      "step": 59161
    },
    {
      "epoch": 6.276469340123064,
      "grad_norm": 1.1916031485232936,
      "learning_rate": 2.3225847210156598e-05,
      "loss": 1.0893,
      "num_input_tokens_seen": 46546660096,
      "step": 59162
    },
    {
      "epoch": 6.2765754296626355,
      "grad_norm": 0.8930345693307226,
      "learning_rate": 2.3225153994227775e-05,
      "loss": 1.0255,
      "num_input_tokens_seen": 46547446832,
      "step": 59163
    },
    {
      "epoch": 6.2766815192022065,
      "grad_norm": 0.8908049911594798,
      "learning_rate": 2.32244607796705e-05,
      "loss": 0.9577,
      "num_input_tokens_seen": 46548233648,
      "step": 59164
    },
    {
      "epoch": 6.276787608741778,
      "grad_norm": 0.8974748312489713,
      "learning_rate": 2.322376756648531e-05,
      "loss": 0.9602,
      "num_input_tokens_seen": 46549020368,
      "step": 59165
    },
    {
      "epoch": 6.2768936982813495,
      "grad_norm": 0.8486452242992059,
      "learning_rate": 2.3223074354672743e-05,
      "loss": 0.996,
      "num_input_tokens_seen": 46549807088,
      "step": 59166
    },
    {
      "epoch": 6.2769997878209205,
      "grad_norm": 1.0137463266313806,
      "learning_rate": 2.3222381144233324e-05,
      "loss": 1.0665,
      "num_input_tokens_seen": 46550593920,
      "step": 59167
    },
    {
      "epoch": 6.277105877360492,
      "grad_norm": 0.941525408910749,
      "learning_rate": 2.3221687935167606e-05,
      "loss": 1.0646,
      "num_input_tokens_seen": 46551380640,
      "step": 59168
    },
    {
      "epoch": 6.2772119669000634,
      "grad_norm": 0.7892115909745393,
      "learning_rate": 2.3220994727476107e-05,
      "loss": 0.9526,
      "num_input_tokens_seen": 46552167392,
      "step": 59169
    },
    {
      "epoch": 6.277318056439635,
      "grad_norm": 0.8341197412264258,
      "learning_rate": 2.3220301521159377e-05,
      "loss": 0.9808,
      "num_input_tokens_seen": 46552954144,
      "step": 59170
    },
    {
      "epoch": 6.277424145979206,
      "grad_norm": 0.7743946321376957,
      "learning_rate": 2.3219608316217947e-05,
      "loss": 1.0017,
      "num_input_tokens_seen": 46553741008,
      "step": 59171
    },
    {
      "epoch": 6.277530235518778,
      "grad_norm": 0.8966452783228072,
      "learning_rate": 2.3218915112652346e-05,
      "loss": 0.9671,
      "num_input_tokens_seen": 46554527808,
      "step": 59172
    },
    {
      "epoch": 6.277636325058349,
      "grad_norm": 0.89339410080002,
      "learning_rate": 2.3218221910463116e-05,
      "loss": 1.0117,
      "num_input_tokens_seen": 46555314576,
      "step": 59173
    },
    {
      "epoch": 6.27774241459792,
      "grad_norm": 0.7100362910426818,
      "learning_rate": 2.32175287096508e-05,
      "loss": 0.966,
      "num_input_tokens_seen": 46556101392,
      "step": 59174
    },
    {
      "epoch": 6.277848504137492,
      "grad_norm": 1.154756069417432,
      "learning_rate": 2.3216835510215913e-05,
      "loss": 0.9961,
      "num_input_tokens_seen": 46556888256,
      "step": 59175
    },
    {
      "epoch": 6.277954593677063,
      "grad_norm": 0.6329066057791792,
      "learning_rate": 2.321614231215901e-05,
      "loss": 0.9434,
      "num_input_tokens_seen": 46557675040,
      "step": 59176
    },
    {
      "epoch": 6.278060683216635,
      "grad_norm": 0.7644821305123121,
      "learning_rate": 2.3215449115480622e-05,
      "loss": 1.014,
      "num_input_tokens_seen": 46558461856,
      "step": 59177
    },
    {
      "epoch": 6.278166772756206,
      "grad_norm": 0.765428275606094,
      "learning_rate": 2.3214755920181276e-05,
      "loss": 1.0019,
      "num_input_tokens_seen": 46559248560,
      "step": 59178
    },
    {
      "epoch": 6.278272862295777,
      "grad_norm": 0.7770302398688129,
      "learning_rate": 2.321406272626152e-05,
      "loss": 1.054,
      "num_input_tokens_seen": 46560035248,
      "step": 59179
    },
    {
      "epoch": 6.278378951835349,
      "grad_norm": 0.93359836918964,
      "learning_rate": 2.3213369533721886e-05,
      "loss": 1.0175,
      "num_input_tokens_seen": 46560822000,
      "step": 59180
    },
    {
      "epoch": 6.27848504137492,
      "grad_norm": 0.7671577100605151,
      "learning_rate": 2.32126763425629e-05,
      "loss": 1.0109,
      "num_input_tokens_seen": 46561608768,
      "step": 59181
    },
    {
      "epoch": 6.278591130914492,
      "grad_norm": 0.8700785965024976,
      "learning_rate": 2.321198315278511e-05,
      "loss": 0.9481,
      "num_input_tokens_seen": 46562395584,
      "step": 59182
    },
    {
      "epoch": 6.278697220454063,
      "grad_norm": 0.7971478247330974,
      "learning_rate": 2.321128996438905e-05,
      "loss": 1.0073,
      "num_input_tokens_seen": 46563182336,
      "step": 59183
    },
    {
      "epoch": 6.278803309993634,
      "grad_norm": 1.127525416251909,
      "learning_rate": 2.3210596777375245e-05,
      "loss": 1.025,
      "num_input_tokens_seen": 46563969200,
      "step": 59184
    },
    {
      "epoch": 6.278909399533206,
      "grad_norm": 0.780692218551373,
      "learning_rate": 2.320990359174424e-05,
      "loss": 1.0425,
      "num_input_tokens_seen": 46564756000,
      "step": 59185
    },
    {
      "epoch": 6.279015489072777,
      "grad_norm": 0.917284389344537,
      "learning_rate": 2.320921040749657e-05,
      "loss": 0.9874,
      "num_input_tokens_seen": 46565542768,
      "step": 59186
    },
    {
      "epoch": 6.279121578612349,
      "grad_norm": 1.0261979607628464,
      "learning_rate": 2.320851722463277e-05,
      "loss": 0.9627,
      "num_input_tokens_seen": 46566329520,
      "step": 59187
    },
    {
      "epoch": 6.27922766815192,
      "grad_norm": 0.743862791125523,
      "learning_rate": 2.3207824043153378e-05,
      "loss": 0.8898,
      "num_input_tokens_seen": 46567116272,
      "step": 59188
    },
    {
      "epoch": 6.279333757691491,
      "grad_norm": 1.0413259650958204,
      "learning_rate": 2.3207130863058925e-05,
      "loss": 0.9808,
      "num_input_tokens_seen": 46567902976,
      "step": 59189
    },
    {
      "epoch": 6.279439847231063,
      "grad_norm": 1.0111297312701693,
      "learning_rate": 2.3206437684349946e-05,
      "loss": 1.02,
      "num_input_tokens_seen": 46568689728,
      "step": 59190
    },
    {
      "epoch": 6.279545936770634,
      "grad_norm": 0.794589419387163,
      "learning_rate": 2.3205744507026984e-05,
      "loss": 0.9978,
      "num_input_tokens_seen": 46569476528,
      "step": 59191
    },
    {
      "epoch": 6.279652026310206,
      "grad_norm": 0.8255967698430801,
      "learning_rate": 2.3205051331090564e-05,
      "loss": 0.9909,
      "num_input_tokens_seen": 46570263248,
      "step": 59192
    },
    {
      "epoch": 6.279758115849777,
      "grad_norm": 0.9194941320160764,
      "learning_rate": 2.3204358156541232e-05,
      "loss": 0.9303,
      "num_input_tokens_seen": 46571050128,
      "step": 59193
    },
    {
      "epoch": 6.279864205389349,
      "grad_norm": 0.867120713422143,
      "learning_rate": 2.3203664983379523e-05,
      "loss": 1.0043,
      "num_input_tokens_seen": 46571836816,
      "step": 59194
    },
    {
      "epoch": 6.27997029492892,
      "grad_norm": 0.7518687567658182,
      "learning_rate": 2.3202971811605962e-05,
      "loss": 1.0722,
      "num_input_tokens_seen": 46572623632,
      "step": 59195
    },
    {
      "epoch": 6.280076384468491,
      "grad_norm": 0.8919931138650062,
      "learning_rate": 2.3202278641221095e-05,
      "loss": 1.0379,
      "num_input_tokens_seen": 46573410528,
      "step": 59196
    },
    {
      "epoch": 6.280182474008063,
      "grad_norm": 0.9367660550078318,
      "learning_rate": 2.3201585472225456e-05,
      "loss": 0.9994,
      "num_input_tokens_seen": 46574197376,
      "step": 59197
    },
    {
      "epoch": 6.280288563547634,
      "grad_norm": 1.1204910240307075,
      "learning_rate": 2.320089230461957e-05,
      "loss": 1.0529,
      "num_input_tokens_seen": 46574984208,
      "step": 59198
    },
    {
      "epoch": 6.280394653087206,
      "grad_norm": 0.7758456337141724,
      "learning_rate": 2.3200199138403993e-05,
      "loss": 1.0898,
      "num_input_tokens_seen": 46575770976,
      "step": 59199
    },
    {
      "epoch": 6.280500742626777,
      "grad_norm": 0.7221540578792341,
      "learning_rate": 2.3199505973579247e-05,
      "loss": 0.9986,
      "num_input_tokens_seen": 46576557712,
      "step": 59200
    },
    {
      "epoch": 6.280606832166349,
      "grad_norm": 0.9096814143793495,
      "learning_rate": 2.3198812810145864e-05,
      "loss": 1.095,
      "num_input_tokens_seen": 46577344432,
      "step": 59201
    },
    {
      "epoch": 6.28071292170592,
      "grad_norm": 1.145369263846329,
      "learning_rate": 2.3198119648104393e-05,
      "loss": 0.99,
      "num_input_tokens_seen": 46578131248,
      "step": 59202
    },
    {
      "epoch": 6.280819011245491,
      "grad_norm": 0.7260646529740626,
      "learning_rate": 2.3197426487455352e-05,
      "loss": 1.0058,
      "num_input_tokens_seen": 46578918032,
      "step": 59203
    },
    {
      "epoch": 6.280925100785063,
      "grad_norm": 1.23573400348912,
      "learning_rate": 2.3196733328199295e-05,
      "loss": 1.0395,
      "num_input_tokens_seen": 46579704800,
      "step": 59204
    },
    {
      "epoch": 6.281031190324634,
      "grad_norm": 0.7763249701820186,
      "learning_rate": 2.3196040170336753e-05,
      "loss": 1.1006,
      "num_input_tokens_seen": 46580491568,
      "step": 59205
    },
    {
      "epoch": 6.281137279864206,
      "grad_norm": 0.759506445161971,
      "learning_rate": 2.319534701386825e-05,
      "loss": 0.9808,
      "num_input_tokens_seen": 46581278256,
      "step": 59206
    },
    {
      "epoch": 6.281243369403777,
      "grad_norm": 0.7226244665264381,
      "learning_rate": 2.3194653858794333e-05,
      "loss": 0.9999,
      "num_input_tokens_seen": 46582065088,
      "step": 59207
    },
    {
      "epoch": 6.281349458943348,
      "grad_norm": 0.7470249150525649,
      "learning_rate": 2.3193960705115537e-05,
      "loss": 0.9452,
      "num_input_tokens_seen": 46582851936,
      "step": 59208
    },
    {
      "epoch": 6.28145554848292,
      "grad_norm": 0.8795095491999615,
      "learning_rate": 2.3193267552832387e-05,
      "loss": 1.0112,
      "num_input_tokens_seen": 46583638704,
      "step": 59209
    },
    {
      "epoch": 6.281561638022491,
      "grad_norm": 0.7586299401855507,
      "learning_rate": 2.3192574401945436e-05,
      "loss": 1.041,
      "num_input_tokens_seen": 46584425456,
      "step": 59210
    },
    {
      "epoch": 6.281667727562063,
      "grad_norm": 1.5653948711888026,
      "learning_rate": 2.3191881252455207e-05,
      "loss": 0.9979,
      "num_input_tokens_seen": 46585212400,
      "step": 59211
    },
    {
      "epoch": 6.281773817101634,
      "grad_norm": 0.746724204574649,
      "learning_rate": 2.3191188104362238e-05,
      "loss": 1.0297,
      "num_input_tokens_seen": 46585999120,
      "step": 59212
    },
    {
      "epoch": 6.281879906641205,
      "grad_norm": 0.9462187751877552,
      "learning_rate": 2.319049495766707e-05,
      "loss": 0.9779,
      "num_input_tokens_seen": 46586785904,
      "step": 59213
    },
    {
      "epoch": 6.281985996180777,
      "grad_norm": 1.2358436367552965,
      "learning_rate": 2.3189801812370234e-05,
      "loss": 1.0572,
      "num_input_tokens_seen": 46587572544,
      "step": 59214
    },
    {
      "epoch": 6.282092085720348,
      "grad_norm": 0.7290899423397595,
      "learning_rate": 2.3189108668472256e-05,
      "loss": 1.0408,
      "num_input_tokens_seen": 46588359248,
      "step": 59215
    },
    {
      "epoch": 6.28219817525992,
      "grad_norm": 0.9017425847289425,
      "learning_rate": 2.318841552597369e-05,
      "loss": 1.0106,
      "num_input_tokens_seen": 46589145888,
      "step": 59216
    },
    {
      "epoch": 6.282304264799491,
      "grad_norm": 0.7515614838111545,
      "learning_rate": 2.318772238487506e-05,
      "loss": 1.022,
      "num_input_tokens_seen": 46589932640,
      "step": 59217
    },
    {
      "epoch": 6.282410354339062,
      "grad_norm": 0.9750078299789658,
      "learning_rate": 2.318702924517691e-05,
      "loss": 0.9361,
      "num_input_tokens_seen": 46590719456,
      "step": 59218
    },
    {
      "epoch": 6.282516443878634,
      "grad_norm": 0.6985454895741325,
      "learning_rate": 2.318633610687977e-05,
      "loss": 1.0394,
      "num_input_tokens_seen": 46591506208,
      "step": 59219
    },
    {
      "epoch": 6.282622533418205,
      "grad_norm": 0.9603794696856313,
      "learning_rate": 2.318564296998417e-05,
      "loss": 0.9993,
      "num_input_tokens_seen": 46592293024,
      "step": 59220
    },
    {
      "epoch": 6.282728622957777,
      "grad_norm": 1.3110642194620619,
      "learning_rate": 2.318494983449066e-05,
      "loss": 1.0011,
      "num_input_tokens_seen": 46593079792,
      "step": 59221
    },
    {
      "epoch": 6.282834712497348,
      "grad_norm": 0.733386359695887,
      "learning_rate": 2.3184256700399764e-05,
      "loss": 0.9653,
      "num_input_tokens_seen": 46593866496,
      "step": 59222
    },
    {
      "epoch": 6.2829408020369195,
      "grad_norm": 1.24255330683288,
      "learning_rate": 2.318356356771202e-05,
      "loss": 0.9706,
      "num_input_tokens_seen": 46594653280,
      "step": 59223
    },
    {
      "epoch": 6.2830468915764905,
      "grad_norm": 0.7068823579651893,
      "learning_rate": 2.3182870436427952e-05,
      "loss": 0.9873,
      "num_input_tokens_seen": 46595440000,
      "step": 59224
    },
    {
      "epoch": 6.283152981116062,
      "grad_norm": 0.7753086928086166,
      "learning_rate": 2.3182177306548125e-05,
      "loss": 0.9671,
      "num_input_tokens_seen": 46596226800,
      "step": 59225
    },
    {
      "epoch": 6.2832590706556335,
      "grad_norm": 0.7808319589182116,
      "learning_rate": 2.3181484178073056e-05,
      "loss": 0.9195,
      "num_input_tokens_seen": 46597013536,
      "step": 59226
    },
    {
      "epoch": 6.2833651601952045,
      "grad_norm": 0.7504445238003434,
      "learning_rate": 2.3180791051003278e-05,
      "loss": 1.0231,
      "num_input_tokens_seen": 46597800384,
      "step": 59227
    },
    {
      "epoch": 6.283471249734776,
      "grad_norm": 0.8157300172876628,
      "learning_rate": 2.3180097925339338e-05,
      "loss": 1.0017,
      "num_input_tokens_seen": 46598587152,
      "step": 59228
    },
    {
      "epoch": 6.2835773392743475,
      "grad_norm": 0.7699477945934855,
      "learning_rate": 2.3179404801081764e-05,
      "loss": 1.0564,
      "num_input_tokens_seen": 46599373984,
      "step": 59229
    },
    {
      "epoch": 6.283683428813919,
      "grad_norm": 0.8161816477539121,
      "learning_rate": 2.3178711678231084e-05,
      "loss": 1.0133,
      "num_input_tokens_seen": 46600160720,
      "step": 59230
    },
    {
      "epoch": 6.28378951835349,
      "grad_norm": 0.8562679923676474,
      "learning_rate": 2.3178018556787855e-05,
      "loss": 0.9539,
      "num_input_tokens_seen": 46600947392,
      "step": 59231
    },
    {
      "epoch": 6.2838956078930615,
      "grad_norm": 0.7909908815880552,
      "learning_rate": 2.3177325436752594e-05,
      "loss": 1.0224,
      "num_input_tokens_seen": 46601734128,
      "step": 59232
    },
    {
      "epoch": 6.284001697432633,
      "grad_norm": 0.8168871676344573,
      "learning_rate": 2.3176632318125838e-05,
      "loss": 1.0202,
      "num_input_tokens_seen": 46602520832,
      "step": 59233
    },
    {
      "epoch": 6.284107786972204,
      "grad_norm": 0.7219845295533734,
      "learning_rate": 2.317593920090813e-05,
      "loss": 0.9296,
      "num_input_tokens_seen": 46603307632,
      "step": 59234
    },
    {
      "epoch": 6.284213876511776,
      "grad_norm": 1.004248657205582,
      "learning_rate": 2.3175246085100008e-05,
      "loss": 1.0613,
      "num_input_tokens_seen": 46604094336,
      "step": 59235
    },
    {
      "epoch": 6.284319966051347,
      "grad_norm": 0.6563393349787087,
      "learning_rate": 2.3174552970701992e-05,
      "loss": 0.9873,
      "num_input_tokens_seen": 46604881056,
      "step": 59236
    },
    {
      "epoch": 6.284426055590918,
      "grad_norm": 0.7207038914518976,
      "learning_rate": 2.317385985771464e-05,
      "loss": 1.0246,
      "num_input_tokens_seen": 46605667744,
      "step": 59237
    },
    {
      "epoch": 6.28453214513049,
      "grad_norm": 0.7952864020582195,
      "learning_rate": 2.3173166746138463e-05,
      "loss": 0.9607,
      "num_input_tokens_seen": 46606454544,
      "step": 59238
    },
    {
      "epoch": 6.284638234670061,
      "grad_norm": 2.1653320828588956,
      "learning_rate": 2.317247363597402e-05,
      "loss": 1.0003,
      "num_input_tokens_seen": 46607241312,
      "step": 59239
    },
    {
      "epoch": 6.284744324209633,
      "grad_norm": 1.0320442657998758,
      "learning_rate": 2.317178052722183e-05,
      "loss": 1.0653,
      "num_input_tokens_seen": 46608028096,
      "step": 59240
    },
    {
      "epoch": 6.284850413749204,
      "grad_norm": 0.9275260055396656,
      "learning_rate": 2.317108741988243e-05,
      "loss": 1.0127,
      "num_input_tokens_seen": 46608814864,
      "step": 59241
    },
    {
      "epoch": 6.284956503288775,
      "grad_norm": 0.9374062350419867,
      "learning_rate": 2.317039431395637e-05,
      "loss": 1.0909,
      "num_input_tokens_seen": 46609601632,
      "step": 59242
    },
    {
      "epoch": 6.285062592828347,
      "grad_norm": 0.9658978293497849,
      "learning_rate": 2.3169701209444172e-05,
      "loss": 1.0334,
      "num_input_tokens_seen": 46610388384,
      "step": 59243
    },
    {
      "epoch": 6.285168682367918,
      "grad_norm": 0.9487587564270026,
      "learning_rate": 2.3169008106346372e-05,
      "loss": 1.0113,
      "num_input_tokens_seen": 46611175168,
      "step": 59244
    },
    {
      "epoch": 6.28527477190749,
      "grad_norm": 0.8592854398505027,
      "learning_rate": 2.3168315004663513e-05,
      "loss": 1.0667,
      "num_input_tokens_seen": 46611961920,
      "step": 59245
    },
    {
      "epoch": 6.285380861447061,
      "grad_norm": 0.99014783792626,
      "learning_rate": 2.3167621904396125e-05,
      "loss": 1.0137,
      "num_input_tokens_seen": 46612748784,
      "step": 59246
    },
    {
      "epoch": 6.285486950986633,
      "grad_norm": 0.7422562610793407,
      "learning_rate": 2.316692880554474e-05,
      "loss": 0.9445,
      "num_input_tokens_seen": 46613535536,
      "step": 59247
    },
    {
      "epoch": 6.285593040526204,
      "grad_norm": 0.7862684302214105,
      "learning_rate": 2.3166235708109906e-05,
      "loss": 1.0226,
      "num_input_tokens_seen": 46614322272,
      "step": 59248
    },
    {
      "epoch": 6.285699130065775,
      "grad_norm": 0.7448768934395894,
      "learning_rate": 2.316554261209215e-05,
      "loss": 1.0111,
      "num_input_tokens_seen": 46615109040,
      "step": 59249
    },
    {
      "epoch": 6.285805219605347,
      "grad_norm": 1.0477825695186427,
      "learning_rate": 2.3164849517492004e-05,
      "loss": 1.004,
      "num_input_tokens_seen": 46615895696,
      "step": 59250
    },
    {
      "epoch": 6.285911309144918,
      "grad_norm": 0.9018417702288267,
      "learning_rate": 2.3164156424310012e-05,
      "loss": 1.0273,
      "num_input_tokens_seen": 46616682448,
      "step": 59251
    },
    {
      "epoch": 6.28601739868449,
      "grad_norm": 0.8705994192706379,
      "learning_rate": 2.316346333254671e-05,
      "loss": 1.005,
      "num_input_tokens_seen": 46617469168,
      "step": 59252
    },
    {
      "epoch": 6.286123488224061,
      "grad_norm": 1.1583311230005269,
      "learning_rate": 2.3162770242202623e-05,
      "loss": 1.0239,
      "num_input_tokens_seen": 46618255968,
      "step": 59253
    },
    {
      "epoch": 6.286229577763632,
      "grad_norm": 0.8357138393624339,
      "learning_rate": 2.3162077153278293e-05,
      "loss": 1.0316,
      "num_input_tokens_seen": 46619042704,
      "step": 59254
    },
    {
      "epoch": 6.286335667303204,
      "grad_norm": 1.0828296759701206,
      "learning_rate": 2.3161384065774258e-05,
      "loss": 0.9447,
      "num_input_tokens_seen": 46619829472,
      "step": 59255
    },
    {
      "epoch": 6.286441756842775,
      "grad_norm": 0.9763892171478341,
      "learning_rate": 2.3160690979691052e-05,
      "loss": 1.0506,
      "num_input_tokens_seen": 46620616256,
      "step": 59256
    },
    {
      "epoch": 6.286547846382347,
      "grad_norm": 0.9098766871373736,
      "learning_rate": 2.3159997895029212e-05,
      "loss": 1.0193,
      "num_input_tokens_seen": 46621403056,
      "step": 59257
    },
    {
      "epoch": 6.286653935921918,
      "grad_norm": 1.0161389159058372,
      "learning_rate": 2.3159304811789266e-05,
      "loss": 0.9118,
      "num_input_tokens_seen": 46622189904,
      "step": 59258
    },
    {
      "epoch": 6.28676002546149,
      "grad_norm": 0.7592456062712205,
      "learning_rate": 2.3158611729971763e-05,
      "loss": 0.9511,
      "num_input_tokens_seen": 46622976720,
      "step": 59259
    },
    {
      "epoch": 6.286866115001061,
      "grad_norm": 0.8924303001792931,
      "learning_rate": 2.3157918649577228e-05,
      "loss": 0.9879,
      "num_input_tokens_seen": 46623763408,
      "step": 59260
    },
    {
      "epoch": 6.286972204540632,
      "grad_norm": 0.7521791516960591,
      "learning_rate": 2.3157225570606195e-05,
      "loss": 1.0231,
      "num_input_tokens_seen": 46624550112,
      "step": 59261
    },
    {
      "epoch": 6.287078294080204,
      "grad_norm": 0.9719379893570627,
      "learning_rate": 2.315653249305921e-05,
      "loss": 1.0475,
      "num_input_tokens_seen": 46625336848,
      "step": 59262
    },
    {
      "epoch": 6.287184383619775,
      "grad_norm": 0.7725530079885862,
      "learning_rate": 2.31558394169368e-05,
      "loss": 1.0033,
      "num_input_tokens_seen": 46626123696,
      "step": 59263
    },
    {
      "epoch": 6.287290473159347,
      "grad_norm": 0.9912550362551605,
      "learning_rate": 2.31551463422395e-05,
      "loss": 0.9894,
      "num_input_tokens_seen": 46626910448,
      "step": 59264
    },
    {
      "epoch": 6.287396562698918,
      "grad_norm": 1.0449134436576757,
      "learning_rate": 2.3154453268967853e-05,
      "loss": 0.9938,
      "num_input_tokens_seen": 46627697152,
      "step": 59265
    },
    {
      "epoch": 6.287502652238489,
      "grad_norm": 0.9965381505509341,
      "learning_rate": 2.315376019712239e-05,
      "loss": 1.0005,
      "num_input_tokens_seen": 46628483776,
      "step": 59266
    },
    {
      "epoch": 6.287608741778061,
      "grad_norm": 0.7891296741029658,
      "learning_rate": 2.3153067126703644e-05,
      "loss": 1.0288,
      "num_input_tokens_seen": 46629270448,
      "step": 59267
    },
    {
      "epoch": 6.287714831317632,
      "grad_norm": 1.2230926822881152,
      "learning_rate": 2.3152374057712157e-05,
      "loss": 1.0344,
      "num_input_tokens_seen": 46630057040,
      "step": 59268
    },
    {
      "epoch": 6.287820920857204,
      "grad_norm": 0.9632247083457717,
      "learning_rate": 2.315168099014846e-05,
      "loss": 1.0625,
      "num_input_tokens_seen": 46630843680,
      "step": 59269
    },
    {
      "epoch": 6.287927010396775,
      "grad_norm": 0.7996405049100062,
      "learning_rate": 2.3150987924013084e-05,
      "loss": 0.987,
      "num_input_tokens_seen": 46631630400,
      "step": 59270
    },
    {
      "epoch": 6.288033099936346,
      "grad_norm": 1.034242307623753,
      "learning_rate": 2.3150294859306578e-05,
      "loss": 1.0125,
      "num_input_tokens_seen": 46632417200,
      "step": 59271
    },
    {
      "epoch": 6.288139189475918,
      "grad_norm": 0.7676330231841229,
      "learning_rate": 2.3149601796029467e-05,
      "loss": 0.9952,
      "num_input_tokens_seen": 46633204000,
      "step": 59272
    },
    {
      "epoch": 6.288245279015489,
      "grad_norm": 0.8644281031726021,
      "learning_rate": 2.314890873418229e-05,
      "loss": 1.0285,
      "num_input_tokens_seen": 46633990736,
      "step": 59273
    },
    {
      "epoch": 6.288351368555061,
      "grad_norm": 0.902789123525436,
      "learning_rate": 2.3148215673765582e-05,
      "loss": 1.078,
      "num_input_tokens_seen": 46634777536,
      "step": 59274
    },
    {
      "epoch": 6.288457458094632,
      "grad_norm": 0.8554801202912649,
      "learning_rate": 2.3147522614779876e-05,
      "loss": 1.1427,
      "num_input_tokens_seen": 46635564320,
      "step": 59275
    },
    {
      "epoch": 6.288563547634204,
      "grad_norm": 1.181615061538548,
      "learning_rate": 2.3146829557225716e-05,
      "loss": 1.0506,
      "num_input_tokens_seen": 46636351120,
      "step": 59276
    },
    {
      "epoch": 6.288669637173775,
      "grad_norm": 0.9591956128422595,
      "learning_rate": 2.3146136501103628e-05,
      "loss": 1.0529,
      "num_input_tokens_seen": 46637137824,
      "step": 59277
    },
    {
      "epoch": 6.288775726713346,
      "grad_norm": 0.9836727362371589,
      "learning_rate": 2.314544344641415e-05,
      "loss": 1.0137,
      "num_input_tokens_seen": 46637924592,
      "step": 59278
    },
    {
      "epoch": 6.288881816252918,
      "grad_norm": 1.0914657058442097,
      "learning_rate": 2.3144750393157822e-05,
      "loss": 0.9918,
      "num_input_tokens_seen": 46638711376,
      "step": 59279
    },
    {
      "epoch": 6.288987905792489,
      "grad_norm": 0.9296575788390502,
      "learning_rate": 2.3144057341335175e-05,
      "loss": 0.9809,
      "num_input_tokens_seen": 46639498144,
      "step": 59280
    },
    {
      "epoch": 6.289093995332061,
      "grad_norm": 1.0151852231784935,
      "learning_rate": 2.3143364290946745e-05,
      "loss": 1.0689,
      "num_input_tokens_seen": 46640284928,
      "step": 59281
    },
    {
      "epoch": 6.289200084871632,
      "grad_norm": 1.015337838062159,
      "learning_rate": 2.3142671241993073e-05,
      "loss": 1.0175,
      "num_input_tokens_seen": 46641071632,
      "step": 59282
    },
    {
      "epoch": 6.289306174411203,
      "grad_norm": 1.0112906688195469,
      "learning_rate": 2.3141978194474688e-05,
      "loss": 1.0047,
      "num_input_tokens_seen": 46641858368,
      "step": 59283
    },
    {
      "epoch": 6.289412263950775,
      "grad_norm": 0.7558113372650747,
      "learning_rate": 2.3141285148392123e-05,
      "loss": 0.9434,
      "num_input_tokens_seen": 46642645152,
      "step": 59284
    },
    {
      "epoch": 6.289518353490346,
      "grad_norm": 0.8846421680613984,
      "learning_rate": 2.314059210374592e-05,
      "loss": 0.9309,
      "num_input_tokens_seen": 46643431936,
      "step": 59285
    },
    {
      "epoch": 6.2896244430299175,
      "grad_norm": 0.841474863830429,
      "learning_rate": 2.3139899060536617e-05,
      "loss": 1.079,
      "num_input_tokens_seen": 46644218704,
      "step": 59286
    },
    {
      "epoch": 6.2897305325694886,
      "grad_norm": 1.5087341638889566,
      "learning_rate": 2.313920601876474e-05,
      "loss": 1.1028,
      "num_input_tokens_seen": 46645005472,
      "step": 59287
    },
    {
      "epoch": 6.2898366221090605,
      "grad_norm": 1.0981421152353708,
      "learning_rate": 2.313851297843084e-05,
      "loss": 0.9575,
      "num_input_tokens_seen": 46645792160,
      "step": 59288
    },
    {
      "epoch": 6.2899427116486315,
      "grad_norm": 0.9111808319378076,
      "learning_rate": 2.313781993953543e-05,
      "loss": 1.0279,
      "num_input_tokens_seen": 46646578912,
      "step": 59289
    },
    {
      "epoch": 6.2900488011882025,
      "grad_norm": 1.3299781930690038,
      "learning_rate": 2.3137126902079064e-05,
      "loss": 0.9149,
      "num_input_tokens_seen": 46647365648,
      "step": 59290
    },
    {
      "epoch": 6.2901548907277745,
      "grad_norm": 1.2796759888217883,
      "learning_rate": 2.3136433866062272e-05,
      "loss": 1.0419,
      "num_input_tokens_seen": 46648152384,
      "step": 59291
    },
    {
      "epoch": 6.2902609802673455,
      "grad_norm": 0.7930954751116187,
      "learning_rate": 2.3135740831485585e-05,
      "loss": 0.9561,
      "num_input_tokens_seen": 46648939152,
      "step": 59292
    },
    {
      "epoch": 6.290367069806917,
      "grad_norm": 1.1746468224049498,
      "learning_rate": 2.3135047798349552e-05,
      "loss": 0.8949,
      "num_input_tokens_seen": 46649725888,
      "step": 59293
    },
    {
      "epoch": 6.290473159346488,
      "grad_norm": 1.569019802071516,
      "learning_rate": 2.3134354766654695e-05,
      "loss": 1.0098,
      "num_input_tokens_seen": 46650512640,
      "step": 59294
    },
    {
      "epoch": 6.2905792488860595,
      "grad_norm": 1.0858873588612596,
      "learning_rate": 2.313366173640155e-05,
      "loss": 0.9288,
      "num_input_tokens_seen": 46651299488,
      "step": 59295
    },
    {
      "epoch": 6.290685338425631,
      "grad_norm": 1.536257910733584,
      "learning_rate": 2.313296870759066e-05,
      "loss": 1.0192,
      "num_input_tokens_seen": 46652086256,
      "step": 59296
    },
    {
      "epoch": 6.290791427965202,
      "grad_norm": 1.6770733812885927,
      "learning_rate": 2.3132275680222558e-05,
      "loss": 1.0431,
      "num_input_tokens_seen": 46652872960,
      "step": 59297
    },
    {
      "epoch": 6.290897517504774,
      "grad_norm": 1.3086936570208276,
      "learning_rate": 2.3131582654297774e-05,
      "loss": 0.9833,
      "num_input_tokens_seen": 46653659744,
      "step": 59298
    },
    {
      "epoch": 6.291003607044345,
      "grad_norm": 0.9141650543043252,
      "learning_rate": 2.3130889629816853e-05,
      "loss": 0.953,
      "num_input_tokens_seen": 46654446576,
      "step": 59299
    },
    {
      "epoch": 6.291109696583916,
      "grad_norm": 1.0400941711420704,
      "learning_rate": 2.3130196606780326e-05,
      "loss": 0.9633,
      "num_input_tokens_seen": 46655233376,
      "step": 59300
    },
    {
      "epoch": 6.291215786123488,
      "grad_norm": 1.1373117316445418,
      "learning_rate": 2.3129503585188718e-05,
      "loss": 0.9924,
      "num_input_tokens_seen": 46656020112,
      "step": 59301
    },
    {
      "epoch": 6.291321875663059,
      "grad_norm": 0.8048096083530673,
      "learning_rate": 2.3128810565042586e-05,
      "loss": 0.9257,
      "num_input_tokens_seen": 46656806848,
      "step": 59302
    },
    {
      "epoch": 6.291427965202631,
      "grad_norm": 0.7177219649743687,
      "learning_rate": 2.3128117546342454e-05,
      "loss": 0.9796,
      "num_input_tokens_seen": 46657593504,
      "step": 59303
    },
    {
      "epoch": 6.291534054742202,
      "grad_norm": 1.4739986896578374,
      "learning_rate": 2.3127424529088848e-05,
      "loss": 0.9847,
      "num_input_tokens_seen": 46658380176,
      "step": 59304
    },
    {
      "epoch": 6.291640144281774,
      "grad_norm": 1.065160982468397,
      "learning_rate": 2.3126731513282323e-05,
      "loss": 1.0355,
      "num_input_tokens_seen": 46659166976,
      "step": 59305
    },
    {
      "epoch": 6.291746233821345,
      "grad_norm": 0.8884662130976214,
      "learning_rate": 2.31260384989234e-05,
      "loss": 1.0257,
      "num_input_tokens_seen": 46659953744,
      "step": 59306
    },
    {
      "epoch": 6.291852323360916,
      "grad_norm": 1.0748376275231755,
      "learning_rate": 2.312534548601262e-05,
      "loss": 0.9857,
      "num_input_tokens_seen": 46660740464,
      "step": 59307
    },
    {
      "epoch": 6.291958412900488,
      "grad_norm": 0.9012218875450538,
      "learning_rate": 2.3124652474550525e-05,
      "loss": 1.0405,
      "num_input_tokens_seen": 46661527248,
      "step": 59308
    },
    {
      "epoch": 6.292064502440059,
      "grad_norm": 0.8283181419821024,
      "learning_rate": 2.312395946453763e-05,
      "loss": 1.0183,
      "num_input_tokens_seen": 46662314064,
      "step": 59309
    },
    {
      "epoch": 6.292170591979631,
      "grad_norm": 0.9630113200321782,
      "learning_rate": 2.3123266455974495e-05,
      "loss": 0.9727,
      "num_input_tokens_seen": 46663100896,
      "step": 59310
    },
    {
      "epoch": 6.292276681519202,
      "grad_norm": 0.678913988545083,
      "learning_rate": 2.3122573448861645e-05,
      "loss": 0.913,
      "num_input_tokens_seen": 46663887696,
      "step": 59311
    },
    {
      "epoch": 6.292382771058773,
      "grad_norm": 0.8996006948905756,
      "learning_rate": 2.312188044319961e-05,
      "loss": 1.0237,
      "num_input_tokens_seen": 46664674512,
      "step": 59312
    },
    {
      "epoch": 6.292488860598345,
      "grad_norm": 0.8841839220352121,
      "learning_rate": 2.3121187438988932e-05,
      "loss": 1.0157,
      "num_input_tokens_seen": 46665461168,
      "step": 59313
    },
    {
      "epoch": 6.292594950137916,
      "grad_norm": 1.105231392777519,
      "learning_rate": 2.3120494436230147e-05,
      "loss": 0.9856,
      "num_input_tokens_seen": 46666247920,
      "step": 59314
    },
    {
      "epoch": 6.292701039677488,
      "grad_norm": 0.8843994840955263,
      "learning_rate": 2.3119801434923786e-05,
      "loss": 0.9254,
      "num_input_tokens_seen": 46667034736,
      "step": 59315
    },
    {
      "epoch": 6.292807129217059,
      "grad_norm": 0.8688190575951249,
      "learning_rate": 2.3119108435070388e-05,
      "loss": 0.9818,
      "num_input_tokens_seen": 46667821568,
      "step": 59316
    },
    {
      "epoch": 6.292913218756631,
      "grad_norm": 0.7368171814186109,
      "learning_rate": 2.3118415436670492e-05,
      "loss": 1.0499,
      "num_input_tokens_seen": 46668608400,
      "step": 59317
    },
    {
      "epoch": 6.293019308296202,
      "grad_norm": 0.8562093450065242,
      "learning_rate": 2.311772243972462e-05,
      "loss": 0.9814,
      "num_input_tokens_seen": 46669395184,
      "step": 59318
    },
    {
      "epoch": 6.293125397835773,
      "grad_norm": 0.6946721555588041,
      "learning_rate": 2.3117029444233316e-05,
      "loss": 1.0025,
      "num_input_tokens_seen": 46670181920,
      "step": 59319
    },
    {
      "epoch": 6.293231487375345,
      "grad_norm": 0.7414781280144539,
      "learning_rate": 2.3116336450197123e-05,
      "loss": 1.0043,
      "num_input_tokens_seen": 46670968704,
      "step": 59320
    },
    {
      "epoch": 6.293337576914916,
      "grad_norm": 0.7421795071431236,
      "learning_rate": 2.3115643457616574e-05,
      "loss": 1.0544,
      "num_input_tokens_seen": 46671755472,
      "step": 59321
    },
    {
      "epoch": 6.293443666454488,
      "grad_norm": 0.7096182906350159,
      "learning_rate": 2.3114950466492192e-05,
      "loss": 1.0311,
      "num_input_tokens_seen": 46672542208,
      "step": 59322
    },
    {
      "epoch": 6.293549755994059,
      "grad_norm": 0.7595500965747927,
      "learning_rate": 2.311425747682453e-05,
      "loss": 1.0802,
      "num_input_tokens_seen": 46673328960,
      "step": 59323
    },
    {
      "epoch": 6.29365584553363,
      "grad_norm": 0.923415743093943,
      "learning_rate": 2.311356448861411e-05,
      "loss": 0.9793,
      "num_input_tokens_seen": 46674115728,
      "step": 59324
    },
    {
      "epoch": 6.293761935073202,
      "grad_norm": 0.6752001642412576,
      "learning_rate": 2.3112871501861466e-05,
      "loss": 1.0464,
      "num_input_tokens_seen": 46674902544,
      "step": 59325
    },
    {
      "epoch": 6.293868024612773,
      "grad_norm": 0.6845961060677753,
      "learning_rate": 2.3112178516567148e-05,
      "loss": 1.0162,
      "num_input_tokens_seen": 46675689312,
      "step": 59326
    },
    {
      "epoch": 6.293974114152345,
      "grad_norm": 1.0272676944762156,
      "learning_rate": 2.3111485532731678e-05,
      "loss": 1.0484,
      "num_input_tokens_seen": 46676476192,
      "step": 59327
    },
    {
      "epoch": 6.294080203691916,
      "grad_norm": 0.8340484669270469,
      "learning_rate": 2.31107925503556e-05,
      "loss": 0.9833,
      "num_input_tokens_seen": 46677263072,
      "step": 59328
    },
    {
      "epoch": 6.294186293231487,
      "grad_norm": 0.6986461442148643,
      "learning_rate": 2.311009956943945e-05,
      "loss": 1.0001,
      "num_input_tokens_seen": 46678049872,
      "step": 59329
    },
    {
      "epoch": 6.294292382771059,
      "grad_norm": 0.8963424111960522,
      "learning_rate": 2.310940658998375e-05,
      "loss": 0.9941,
      "num_input_tokens_seen": 46678836624,
      "step": 59330
    },
    {
      "epoch": 6.29439847231063,
      "grad_norm": 1.6487444921662393,
      "learning_rate": 2.310871361198905e-05,
      "loss": 1.0634,
      "num_input_tokens_seen": 46679623344,
      "step": 59331
    },
    {
      "epoch": 6.294504561850202,
      "grad_norm": 0.8180928932628904,
      "learning_rate": 2.310802063545588e-05,
      "loss": 0.9989,
      "num_input_tokens_seen": 46680410112,
      "step": 59332
    },
    {
      "epoch": 6.294610651389773,
      "grad_norm": 1.2265067295071068,
      "learning_rate": 2.3107327660384774e-05,
      "loss": 1.0665,
      "num_input_tokens_seen": 46681196784,
      "step": 59333
    },
    {
      "epoch": 6.294716740929345,
      "grad_norm": 1.4185032058183897,
      "learning_rate": 2.310663468677628e-05,
      "loss": 0.9927,
      "num_input_tokens_seen": 46681983616,
      "step": 59334
    },
    {
      "epoch": 6.294822830468916,
      "grad_norm": 0.9330976053271416,
      "learning_rate": 2.3105941714630914e-05,
      "loss": 0.995,
      "num_input_tokens_seen": 46682770368,
      "step": 59335
    },
    {
      "epoch": 6.294928920008487,
      "grad_norm": 1.2830899093044188,
      "learning_rate": 2.310524874394922e-05,
      "loss": 1.119,
      "num_input_tokens_seen": 46683557120,
      "step": 59336
    },
    {
      "epoch": 6.295035009548059,
      "grad_norm": 1.2904480843657247,
      "learning_rate": 2.3104555774731735e-05,
      "loss": 0.9247,
      "num_input_tokens_seen": 46684343872,
      "step": 59337
    },
    {
      "epoch": 6.29514109908763,
      "grad_norm": 1.0960159250468415,
      "learning_rate": 2.3103862806979e-05,
      "loss": 0.9488,
      "num_input_tokens_seen": 46685130608,
      "step": 59338
    },
    {
      "epoch": 6.295247188627202,
      "grad_norm": 1.1080948933241295,
      "learning_rate": 2.310316984069153e-05,
      "loss": 0.9657,
      "num_input_tokens_seen": 46685917392,
      "step": 59339
    },
    {
      "epoch": 6.295353278166773,
      "grad_norm": 0.9447304405063398,
      "learning_rate": 2.3102476875869888e-05,
      "loss": 1.0328,
      "num_input_tokens_seen": 46686704272,
      "step": 59340
    },
    {
      "epoch": 6.295459367706345,
      "grad_norm": 1.308842029178154,
      "learning_rate": 2.310178391251459e-05,
      "loss": 1.0854,
      "num_input_tokens_seen": 46687491104,
      "step": 59341
    },
    {
      "epoch": 6.295565457245916,
      "grad_norm": 0.9042940116754776,
      "learning_rate": 2.3101090950626182e-05,
      "loss": 1.0394,
      "num_input_tokens_seen": 46688277840,
      "step": 59342
    },
    {
      "epoch": 6.295671546785487,
      "grad_norm": 0.9648921341489771,
      "learning_rate": 2.3100397990205193e-05,
      "loss": 1.0847,
      "num_input_tokens_seen": 46689064624,
      "step": 59343
    },
    {
      "epoch": 6.295777636325059,
      "grad_norm": 0.8955703498425291,
      "learning_rate": 2.3099705031252157e-05,
      "loss": 0.9752,
      "num_input_tokens_seen": 46689851408,
      "step": 59344
    },
    {
      "epoch": 6.29588372586463,
      "grad_norm": 0.7573392541383793,
      "learning_rate": 2.309901207376762e-05,
      "loss": 0.956,
      "num_input_tokens_seen": 46690638224,
      "step": 59345
    },
    {
      "epoch": 6.2959898154042016,
      "grad_norm": 0.7441438611243573,
      "learning_rate": 2.309831911775211e-05,
      "loss": 0.9799,
      "num_input_tokens_seen": 46691424976,
      "step": 59346
    },
    {
      "epoch": 6.296095904943773,
      "grad_norm": 0.8115129012945435,
      "learning_rate": 2.3097626163206158e-05,
      "loss": 0.9529,
      "num_input_tokens_seen": 46692211744,
      "step": 59347
    },
    {
      "epoch": 6.296201994483344,
      "grad_norm": 0.7862087017680808,
      "learning_rate": 2.3096933210130307e-05,
      "loss": 1.0212,
      "num_input_tokens_seen": 46692998448,
      "step": 59348
    },
    {
      "epoch": 6.2963080840229155,
      "grad_norm": 0.7305749565298714,
      "learning_rate": 2.309624025852509e-05,
      "loss": 0.933,
      "num_input_tokens_seen": 46693785264,
      "step": 59349
    },
    {
      "epoch": 6.296414173562487,
      "grad_norm": 0.7701445834180835,
      "learning_rate": 2.309554730839104e-05,
      "loss": 0.9857,
      "num_input_tokens_seen": 46694571984,
      "step": 59350
    },
    {
      "epoch": 6.2965202631020585,
      "grad_norm": 0.8670295557469383,
      "learning_rate": 2.30948543597287e-05,
      "loss": 1.0066,
      "num_input_tokens_seen": 46695358784,
      "step": 59351
    },
    {
      "epoch": 6.2966263526416295,
      "grad_norm": 0.7617662124629934,
      "learning_rate": 2.3094161412538605e-05,
      "loss": 0.9224,
      "num_input_tokens_seen": 46696145520,
      "step": 59352
    },
    {
      "epoch": 6.2967324421812005,
      "grad_norm": 0.7823631462805898,
      "learning_rate": 2.3093468466821274e-05,
      "loss": 0.9496,
      "num_input_tokens_seen": 46696932336,
      "step": 59353
    },
    {
      "epoch": 6.2968385317207725,
      "grad_norm": 0.8651598604922199,
      "learning_rate": 2.3092775522577263e-05,
      "loss": 0.984,
      "num_input_tokens_seen": 46697719008,
      "step": 59354
    },
    {
      "epoch": 6.2969446212603435,
      "grad_norm": 0.6985051434997468,
      "learning_rate": 2.30920825798071e-05,
      "loss": 1.0181,
      "num_input_tokens_seen": 46698505728,
      "step": 59355
    },
    {
      "epoch": 6.297050710799915,
      "grad_norm": 0.8812635278874731,
      "learning_rate": 2.3091389638511312e-05,
      "loss": 1.0014,
      "num_input_tokens_seen": 46699292448,
      "step": 59356
    },
    {
      "epoch": 6.297156800339486,
      "grad_norm": 0.7847286714794104,
      "learning_rate": 2.309069669869045e-05,
      "loss": 0.9845,
      "num_input_tokens_seen": 46700079232,
      "step": 59357
    },
    {
      "epoch": 6.2972628898790575,
      "grad_norm": 0.6994205768495695,
      "learning_rate": 2.3090003760345033e-05,
      "loss": 0.9685,
      "num_input_tokens_seen": 46700866064,
      "step": 59358
    },
    {
      "epoch": 6.297368979418629,
      "grad_norm": 0.6997521484234042,
      "learning_rate": 2.3089310823475613e-05,
      "loss": 1.0035,
      "num_input_tokens_seen": 46701652816,
      "step": 59359
    },
    {
      "epoch": 6.2974750689582,
      "grad_norm": 0.7764122462480012,
      "learning_rate": 2.3088617888082716e-05,
      "loss": 1.0328,
      "num_input_tokens_seen": 46702439568,
      "step": 59360
    },
    {
      "epoch": 6.297581158497772,
      "grad_norm": 0.6985943089828589,
      "learning_rate": 2.3087924954166872e-05,
      "loss": 1.0281,
      "num_input_tokens_seen": 46703226320,
      "step": 59361
    },
    {
      "epoch": 6.297687248037343,
      "grad_norm": 0.7276461284565783,
      "learning_rate": 2.3087232021728634e-05,
      "loss": 1.0259,
      "num_input_tokens_seen": 46704013024,
      "step": 59362
    },
    {
      "epoch": 6.297793337576915,
      "grad_norm": 1.0445415224009271,
      "learning_rate": 2.3086539090768525e-05,
      "loss": 1.0498,
      "num_input_tokens_seen": 46704799760,
      "step": 59363
    },
    {
      "epoch": 6.297899427116486,
      "grad_norm": 0.8452564815127773,
      "learning_rate": 2.3085846161287075e-05,
      "loss": 0.9467,
      "num_input_tokens_seen": 46705586496,
      "step": 59364
    },
    {
      "epoch": 6.298005516656057,
      "grad_norm": 0.7418909647978117,
      "learning_rate": 2.3085153233284836e-05,
      "loss": 0.9628,
      "num_input_tokens_seen": 46706373264,
      "step": 59365
    },
    {
      "epoch": 6.298111606195629,
      "grad_norm": 0.7686518866446738,
      "learning_rate": 2.308446030676233e-05,
      "loss": 0.9871,
      "num_input_tokens_seen": 46707159984,
      "step": 59366
    },
    {
      "epoch": 6.2982176957352,
      "grad_norm": 0.963807264102737,
      "learning_rate": 2.308376738172009e-05,
      "loss": 1.0511,
      "num_input_tokens_seen": 46707946736,
      "step": 59367
    },
    {
      "epoch": 6.298323785274772,
      "grad_norm": 0.684592812300721,
      "learning_rate": 2.308307445815867e-05,
      "loss": 0.9766,
      "num_input_tokens_seen": 46708733520,
      "step": 59368
    },
    {
      "epoch": 6.298429874814343,
      "grad_norm": 0.9855870263257269,
      "learning_rate": 2.308238153607859e-05,
      "loss": 1.0211,
      "num_input_tokens_seen": 46709520304,
      "step": 59369
    },
    {
      "epoch": 6.298535964353915,
      "grad_norm": 0.8137540260875877,
      "learning_rate": 2.3081688615480384e-05,
      "loss": 0.9759,
      "num_input_tokens_seen": 46710307024,
      "step": 59370
    },
    {
      "epoch": 6.298642053893486,
      "grad_norm": 0.6801871938728314,
      "learning_rate": 2.3080995696364598e-05,
      "loss": 1.0121,
      "num_input_tokens_seen": 46711093824,
      "step": 59371
    },
    {
      "epoch": 6.298748143433057,
      "grad_norm": 1.0129282800465886,
      "learning_rate": 2.3080302778731767e-05,
      "loss": 0.9658,
      "num_input_tokens_seen": 46711880544,
      "step": 59372
    },
    {
      "epoch": 6.298854232972629,
      "grad_norm": 0.6993011562047606,
      "learning_rate": 2.3079609862582412e-05,
      "loss": 1.0093,
      "num_input_tokens_seen": 46712667280,
      "step": 59373
    },
    {
      "epoch": 6.2989603225122,
      "grad_norm": 0.8732225806605425,
      "learning_rate": 2.3078916947917083e-05,
      "loss": 0.98,
      "num_input_tokens_seen": 46713454016,
      "step": 59374
    },
    {
      "epoch": 6.299066412051772,
      "grad_norm": 1.08852211719617,
      "learning_rate": 2.3078224034736307e-05,
      "loss": 1.0525,
      "num_input_tokens_seen": 46714240752,
      "step": 59375
    },
    {
      "epoch": 6.299172501591343,
      "grad_norm": 1.3435499515542593,
      "learning_rate": 2.3077531123040628e-05,
      "loss": 1.0223,
      "num_input_tokens_seen": 46715027504,
      "step": 59376
    },
    {
      "epoch": 6.299278591130914,
      "grad_norm": 1.2125955619645448,
      "learning_rate": 2.3076838212830577e-05,
      "loss": 1.0287,
      "num_input_tokens_seen": 46715814352,
      "step": 59377
    },
    {
      "epoch": 6.299384680670486,
      "grad_norm": 0.8077121535859547,
      "learning_rate": 2.3076145304106682e-05,
      "loss": 0.9857,
      "num_input_tokens_seen": 46716601104,
      "step": 59378
    },
    {
      "epoch": 6.299490770210057,
      "grad_norm": 0.8074486276606303,
      "learning_rate": 2.307545239686949e-05,
      "loss": 1.0056,
      "num_input_tokens_seen": 46717387936,
      "step": 59379
    },
    {
      "epoch": 6.299596859749629,
      "grad_norm": 0.6970516200768356,
      "learning_rate": 2.307475949111953e-05,
      "loss": 0.9499,
      "num_input_tokens_seen": 46718174784,
      "step": 59380
    },
    {
      "epoch": 6.2997029492892,
      "grad_norm": 0.800460105507314,
      "learning_rate": 2.3074066586857342e-05,
      "loss": 0.9546,
      "num_input_tokens_seen": 46718961584,
      "step": 59381
    },
    {
      "epoch": 6.299809038828771,
      "grad_norm": 0.6989514121983207,
      "learning_rate": 2.307337368408346e-05,
      "loss": 0.9914,
      "num_input_tokens_seen": 46719748400,
      "step": 59382
    },
    {
      "epoch": 6.299915128368343,
      "grad_norm": 0.798249976032649,
      "learning_rate": 2.3072680782798416e-05,
      "loss": 0.9476,
      "num_input_tokens_seen": 46720535216,
      "step": 59383
    },
    {
      "epoch": 6.300021217907914,
      "grad_norm": 0.6744214175004655,
      "learning_rate": 2.3071987883002747e-05,
      "loss": 0.9659,
      "num_input_tokens_seen": 46721322080,
      "step": 59384
    },
    {
      "epoch": 6.300127307447486,
      "grad_norm": 0.7326430465497011,
      "learning_rate": 2.3071294984696988e-05,
      "loss": 0.9645,
      "num_input_tokens_seen": 46722108864,
      "step": 59385
    },
    {
      "epoch": 6.300233396987057,
      "grad_norm": 0.8912757976991142,
      "learning_rate": 2.3070602087881682e-05,
      "loss": 1.0291,
      "num_input_tokens_seen": 46722895616,
      "step": 59386
    },
    {
      "epoch": 6.300339486526628,
      "grad_norm": 0.7400100691728856,
      "learning_rate": 2.306990919255735e-05,
      "loss": 0.9613,
      "num_input_tokens_seen": 46723682352,
      "step": 59387
    },
    {
      "epoch": 6.3004455760662,
      "grad_norm": 0.7118191295104542,
      "learning_rate": 2.3069216298724542e-05,
      "loss": 0.986,
      "num_input_tokens_seen": 46724469152,
      "step": 59388
    },
    {
      "epoch": 6.300551665605771,
      "grad_norm": 0.8052940517453243,
      "learning_rate": 2.3068523406383786e-05,
      "loss": 1.0626,
      "num_input_tokens_seen": 46725255920,
      "step": 59389
    },
    {
      "epoch": 6.300657755145343,
      "grad_norm": 0.7438989007592339,
      "learning_rate": 2.3067830515535614e-05,
      "loss": 1.0258,
      "num_input_tokens_seen": 46726042560,
      "step": 59390
    },
    {
      "epoch": 6.300763844684914,
      "grad_norm": 0.7869879275223373,
      "learning_rate": 2.3067137626180568e-05,
      "loss": 1.0745,
      "num_input_tokens_seen": 46726829312,
      "step": 59391
    },
    {
      "epoch": 6.300869934224486,
      "grad_norm": 1.012669421655257,
      "learning_rate": 2.3066444738319183e-05,
      "loss": 0.9792,
      "num_input_tokens_seen": 46727616112,
      "step": 59392
    },
    {
      "epoch": 6.300976023764057,
      "grad_norm": 0.7762818895688003,
      "learning_rate": 2.306575185195199e-05,
      "loss": 0.9701,
      "num_input_tokens_seen": 46728402864,
      "step": 59393
    },
    {
      "epoch": 6.301082113303628,
      "grad_norm": 0.7700288984817651,
      "learning_rate": 2.306505896707953e-05,
      "loss": 0.9697,
      "num_input_tokens_seen": 46729189616,
      "step": 59394
    },
    {
      "epoch": 6.3011882028432,
      "grad_norm": 0.8661345301348221,
      "learning_rate": 2.306436608370233e-05,
      "loss": 1.0484,
      "num_input_tokens_seen": 46729976304,
      "step": 59395
    },
    {
      "epoch": 6.301294292382771,
      "grad_norm": 1.1338551853023002,
      "learning_rate": 2.306367320182094e-05,
      "loss": 1.0494,
      "num_input_tokens_seen": 46730762944,
      "step": 59396
    },
    {
      "epoch": 6.301400381922343,
      "grad_norm": 1.2046917494205993,
      "learning_rate": 2.3062980321435882e-05,
      "loss": 0.9874,
      "num_input_tokens_seen": 46731549712,
      "step": 59397
    },
    {
      "epoch": 6.301506471461914,
      "grad_norm": 0.9488807153022939,
      "learning_rate": 2.3062287442547693e-05,
      "loss": 0.9717,
      "num_input_tokens_seen": 46732336416,
      "step": 59398
    },
    {
      "epoch": 6.301612561001486,
      "grad_norm": 0.6709806330337722,
      "learning_rate": 2.306159456515692e-05,
      "loss": 1.0115,
      "num_input_tokens_seen": 46733123200,
      "step": 59399
    },
    {
      "epoch": 6.301718650541057,
      "grad_norm": 0.8389069787372009,
      "learning_rate": 2.3060901689264086e-05,
      "loss": 0.9953,
      "num_input_tokens_seen": 46733909888,
      "step": 59400
    },
    {
      "epoch": 6.301824740080628,
      "grad_norm": 0.7790607629250454,
      "learning_rate": 2.3060208814869726e-05,
      "loss": 0.9798,
      "num_input_tokens_seen": 46734696688,
      "step": 59401
    },
    {
      "epoch": 6.3019308296202,
      "grad_norm": 0.7625882237008255,
      "learning_rate": 2.3059515941974383e-05,
      "loss": 1.0248,
      "num_input_tokens_seen": 46735483520,
      "step": 59402
    },
    {
      "epoch": 6.302036919159771,
      "grad_norm": 0.9931159229552398,
      "learning_rate": 2.3058823070578593e-05,
      "loss": 0.9675,
      "num_input_tokens_seen": 46736270336,
      "step": 59403
    },
    {
      "epoch": 6.302143008699343,
      "grad_norm": 0.7309794800764643,
      "learning_rate": 2.305813020068288e-05,
      "loss": 0.9484,
      "num_input_tokens_seen": 46737057104,
      "step": 59404
    },
    {
      "epoch": 6.302249098238914,
      "grad_norm": 0.6662336424487342,
      "learning_rate": 2.305743733228779e-05,
      "loss": 1.0554,
      "num_input_tokens_seen": 46737843744,
      "step": 59405
    },
    {
      "epoch": 6.302355187778485,
      "grad_norm": 1.0206361688747938,
      "learning_rate": 2.3056744465393856e-05,
      "loss": 1.0213,
      "num_input_tokens_seen": 46738630384,
      "step": 59406
    },
    {
      "epoch": 6.302461277318057,
      "grad_norm": 0.7769955658650616,
      "learning_rate": 2.305605160000161e-05,
      "loss": 0.9531,
      "num_input_tokens_seen": 46739417264,
      "step": 59407
    },
    {
      "epoch": 6.302567366857628,
      "grad_norm": 0.8641733147632835,
      "learning_rate": 2.3055358736111596e-05,
      "loss": 1.028,
      "num_input_tokens_seen": 46740204096,
      "step": 59408
    },
    {
      "epoch": 6.3026734563972,
      "grad_norm": 0.9546878894423528,
      "learning_rate": 2.3054665873724333e-05,
      "loss": 0.9768,
      "num_input_tokens_seen": 46740990896,
      "step": 59409
    },
    {
      "epoch": 6.302779545936771,
      "grad_norm": 0.9455999367488928,
      "learning_rate": 2.305397301284038e-05,
      "loss": 0.9876,
      "num_input_tokens_seen": 46741777616,
      "step": 59410
    },
    {
      "epoch": 6.302885635476342,
      "grad_norm": 0.9032534689710864,
      "learning_rate": 2.3053280153460256e-05,
      "loss": 1.0116,
      "num_input_tokens_seen": 46742564304,
      "step": 59411
    },
    {
      "epoch": 6.3029917250159135,
      "grad_norm": 0.7566987811353912,
      "learning_rate": 2.3052587295584495e-05,
      "loss": 0.9872,
      "num_input_tokens_seen": 46743351040,
      "step": 59412
    },
    {
      "epoch": 6.303097814555485,
      "grad_norm": 0.7556621352822277,
      "learning_rate": 2.3051894439213643e-05,
      "loss": 0.9508,
      "num_input_tokens_seen": 46744137872,
      "step": 59413
    },
    {
      "epoch": 6.3032039040950565,
      "grad_norm": 0.7077589461708154,
      "learning_rate": 2.3051201584348216e-05,
      "loss": 1.0025,
      "num_input_tokens_seen": 46744924608,
      "step": 59414
    },
    {
      "epoch": 6.3033099936346275,
      "grad_norm": 0.6648577906427855,
      "learning_rate": 2.305050873098878e-05,
      "loss": 0.9557,
      "num_input_tokens_seen": 46745711344,
      "step": 59415
    },
    {
      "epoch": 6.303416083174199,
      "grad_norm": 0.7267852959327841,
      "learning_rate": 2.304981587913584e-05,
      "loss": 1.0058,
      "num_input_tokens_seen": 46746498080,
      "step": 59416
    },
    {
      "epoch": 6.3035221727137705,
      "grad_norm": 0.6516922522437236,
      "learning_rate": 2.3049123028789958e-05,
      "loss": 1.0152,
      "num_input_tokens_seen": 46747284912,
      "step": 59417
    },
    {
      "epoch": 6.3036282622533415,
      "grad_norm": 0.7344091917585709,
      "learning_rate": 2.304843017995165e-05,
      "loss": 1.0055,
      "num_input_tokens_seen": 46748071616,
      "step": 59418
    },
    {
      "epoch": 6.303734351792913,
      "grad_norm": 0.6650157902917636,
      "learning_rate": 2.304773733262146e-05,
      "loss": 1.1142,
      "num_input_tokens_seen": 46748858448,
      "step": 59419
    },
    {
      "epoch": 6.3038404413324844,
      "grad_norm": 0.8162616995274942,
      "learning_rate": 2.3047044486799923e-05,
      "loss": 1.0703,
      "num_input_tokens_seen": 46749645184,
      "step": 59420
    },
    {
      "epoch": 6.303946530872056,
      "grad_norm": 0.627761111808505,
      "learning_rate": 2.3046351642487575e-05,
      "loss": 1.0295,
      "num_input_tokens_seen": 46750431904,
      "step": 59421
    },
    {
      "epoch": 6.304052620411627,
      "grad_norm": 1.0643373837442223,
      "learning_rate": 2.3045658799684938e-05,
      "loss": 1.0336,
      "num_input_tokens_seen": 46751218688,
      "step": 59422
    },
    {
      "epoch": 6.304158709951198,
      "grad_norm": 0.8877454545235447,
      "learning_rate": 2.3044965958392567e-05,
      "loss": 1.0023,
      "num_input_tokens_seen": 46752005504,
      "step": 59423
    },
    {
      "epoch": 6.30426479949077,
      "grad_norm": 0.7469665856691272,
      "learning_rate": 2.304427311861099e-05,
      "loss": 0.9805,
      "num_input_tokens_seen": 46752792304,
      "step": 59424
    },
    {
      "epoch": 6.304370889030341,
      "grad_norm": 0.6727825523040467,
      "learning_rate": 2.3043580280340735e-05,
      "loss": 0.9631,
      "num_input_tokens_seen": 46753579056,
      "step": 59425
    },
    {
      "epoch": 6.304476978569913,
      "grad_norm": 0.8075550578504099,
      "learning_rate": 2.304288744358235e-05,
      "loss": 1.0512,
      "num_input_tokens_seen": 46754365840,
      "step": 59426
    },
    {
      "epoch": 6.304583068109484,
      "grad_norm": 0.8097379213724729,
      "learning_rate": 2.3042194608336364e-05,
      "loss": 1.0142,
      "num_input_tokens_seen": 46755152576,
      "step": 59427
    },
    {
      "epoch": 6.304689157649056,
      "grad_norm": 0.8032855447817587,
      "learning_rate": 2.3041501774603305e-05,
      "loss": 1.0211,
      "num_input_tokens_seen": 46755939392,
      "step": 59428
    },
    {
      "epoch": 6.304795247188627,
      "grad_norm": 0.7372634235652571,
      "learning_rate": 2.3040808942383724e-05,
      "loss": 1.047,
      "num_input_tokens_seen": 46756726160,
      "step": 59429
    },
    {
      "epoch": 6.304901336728198,
      "grad_norm": 0.6678940137199034,
      "learning_rate": 2.3040116111678143e-05,
      "loss": 1.0064,
      "num_input_tokens_seen": 46757512960,
      "step": 59430
    },
    {
      "epoch": 6.30500742626777,
      "grad_norm": 0.7741522829280234,
      "learning_rate": 2.3039423282487105e-05,
      "loss": 0.982,
      "num_input_tokens_seen": 46758299872,
      "step": 59431
    },
    {
      "epoch": 6.305113515807341,
      "grad_norm": 0.6933217416019697,
      "learning_rate": 2.3038730454811148e-05,
      "loss": 0.8824,
      "num_input_tokens_seen": 46759086704,
      "step": 59432
    },
    {
      "epoch": 6.305219605346913,
      "grad_norm": 0.7438172676973481,
      "learning_rate": 2.3038037628650794e-05,
      "loss": 0.952,
      "num_input_tokens_seen": 46759873472,
      "step": 59433
    },
    {
      "epoch": 6.305325694886484,
      "grad_norm": 0.6782593999684372,
      "learning_rate": 2.303734480400659e-05,
      "loss": 1.0304,
      "num_input_tokens_seen": 46760660208,
      "step": 59434
    },
    {
      "epoch": 6.305431784426055,
      "grad_norm": 0.7688494158154024,
      "learning_rate": 2.3036651980879073e-05,
      "loss": 0.9476,
      "num_input_tokens_seen": 46761447040,
      "step": 59435
    },
    {
      "epoch": 6.305537873965627,
      "grad_norm": 0.8979730411826302,
      "learning_rate": 2.3035959159268766e-05,
      "loss": 0.9241,
      "num_input_tokens_seen": 46762233776,
      "step": 59436
    },
    {
      "epoch": 6.305643963505198,
      "grad_norm": 0.75909271580551,
      "learning_rate": 2.3035266339176217e-05,
      "loss": 1.0039,
      "num_input_tokens_seen": 46763020512,
      "step": 59437
    },
    {
      "epoch": 6.30575005304477,
      "grad_norm": 0.7781024882866153,
      "learning_rate": 2.303457352060196e-05,
      "loss": 1.0338,
      "num_input_tokens_seen": 46763807280,
      "step": 59438
    },
    {
      "epoch": 6.305856142584341,
      "grad_norm": 1.258057065097771,
      "learning_rate": 2.3033880703546516e-05,
      "loss": 1.0125,
      "num_input_tokens_seen": 46764594080,
      "step": 59439
    },
    {
      "epoch": 6.305962232123912,
      "grad_norm": 0.9727628545402326,
      "learning_rate": 2.3033187888010442e-05,
      "loss": 0.9925,
      "num_input_tokens_seen": 46765380832,
      "step": 59440
    },
    {
      "epoch": 6.306068321663484,
      "grad_norm": 0.6912226939777926,
      "learning_rate": 2.303249507399426e-05,
      "loss": 0.9978,
      "num_input_tokens_seen": 46766167552,
      "step": 59441
    },
    {
      "epoch": 6.306174411203055,
      "grad_norm": 1.1258085635352917,
      "learning_rate": 2.3031802261498503e-05,
      "loss": 0.9516,
      "num_input_tokens_seen": 46766954352,
      "step": 59442
    },
    {
      "epoch": 6.306280500742627,
      "grad_norm": 0.9048138665308278,
      "learning_rate": 2.3031109450523718e-05,
      "loss": 1.0012,
      "num_input_tokens_seen": 46767741088,
      "step": 59443
    },
    {
      "epoch": 6.306386590282198,
      "grad_norm": 0.6689800079296786,
      "learning_rate": 2.3030416641070428e-05,
      "loss": 1.0223,
      "num_input_tokens_seen": 46768527856,
      "step": 59444
    },
    {
      "epoch": 6.30649267982177,
      "grad_norm": 0.6172336742305803,
      "learning_rate": 2.3029723833139178e-05,
      "loss": 0.872,
      "num_input_tokens_seen": 46769314624,
      "step": 59445
    },
    {
      "epoch": 6.306598769361341,
      "grad_norm": 0.6690804123746936,
      "learning_rate": 2.30290310267305e-05,
      "loss": 0.9363,
      "num_input_tokens_seen": 46770101360,
      "step": 59446
    },
    {
      "epoch": 6.306704858900912,
      "grad_norm": 1.2903674340822247,
      "learning_rate": 2.3028338221844924e-05,
      "loss": 1.0358,
      "num_input_tokens_seen": 46770888160,
      "step": 59447
    },
    {
      "epoch": 6.306810948440484,
      "grad_norm": 0.6830393994587556,
      "learning_rate": 2.3027645418482997e-05,
      "loss": 0.9968,
      "num_input_tokens_seen": 46771674896,
      "step": 59448
    },
    {
      "epoch": 6.306917037980055,
      "grad_norm": 0.9342637886495003,
      "learning_rate": 2.3026952616645248e-05,
      "loss": 0.9479,
      "num_input_tokens_seen": 46772461792,
      "step": 59449
    },
    {
      "epoch": 6.307023127519627,
      "grad_norm": 0.8035175666689495,
      "learning_rate": 2.3026259816332205e-05,
      "loss": 0.9423,
      "num_input_tokens_seen": 46773248560,
      "step": 59450
    },
    {
      "epoch": 6.307129217059198,
      "grad_norm": 1.0155139097930284,
      "learning_rate": 2.3025567017544416e-05,
      "loss": 0.9362,
      "num_input_tokens_seen": 46774035312,
      "step": 59451
    },
    {
      "epoch": 6.307235306598769,
      "grad_norm": 0.9124227344183589,
      "learning_rate": 2.302487422028241e-05,
      "loss": 0.9593,
      "num_input_tokens_seen": 46774822112,
      "step": 59452
    },
    {
      "epoch": 6.307341396138341,
      "grad_norm": 0.9374255701902972,
      "learning_rate": 2.302418142454672e-05,
      "loss": 1.0322,
      "num_input_tokens_seen": 46775608816,
      "step": 59453
    },
    {
      "epoch": 6.307447485677912,
      "grad_norm": 0.8140625049819997,
      "learning_rate": 2.302348863033789e-05,
      "loss": 0.9812,
      "num_input_tokens_seen": 46776395456,
      "step": 59454
    },
    {
      "epoch": 6.307553575217484,
      "grad_norm": 0.699400345000953,
      "learning_rate": 2.302279583765645e-05,
      "loss": 0.9011,
      "num_input_tokens_seen": 46777182256,
      "step": 59455
    },
    {
      "epoch": 6.307659664757055,
      "grad_norm": 0.8897013863506582,
      "learning_rate": 2.302210304650293e-05,
      "loss": 1.0097,
      "num_input_tokens_seen": 46777968976,
      "step": 59456
    },
    {
      "epoch": 6.307765754296627,
      "grad_norm": 0.726534231480299,
      "learning_rate": 2.3021410256877873e-05,
      "loss": 0.9817,
      "num_input_tokens_seen": 46778755744,
      "step": 59457
    },
    {
      "epoch": 6.307871843836198,
      "grad_norm": 0.7277314164955103,
      "learning_rate": 2.3020717468781817e-05,
      "loss": 1.0076,
      "num_input_tokens_seen": 46779542448,
      "step": 59458
    },
    {
      "epoch": 6.307977933375769,
      "grad_norm": 0.7229695176227816,
      "learning_rate": 2.3020024682215283e-05,
      "loss": 1.0482,
      "num_input_tokens_seen": 46780329248,
      "step": 59459
    },
    {
      "epoch": 6.308084022915341,
      "grad_norm": 1.2308576332373475,
      "learning_rate": 2.3019331897178822e-05,
      "loss": 1.0058,
      "num_input_tokens_seen": 46781115936,
      "step": 59460
    },
    {
      "epoch": 6.308190112454912,
      "grad_norm": 0.764263256590492,
      "learning_rate": 2.3018639113672957e-05,
      "loss": 0.9518,
      "num_input_tokens_seen": 46781902768,
      "step": 59461
    },
    {
      "epoch": 6.308296201994484,
      "grad_norm": 0.8313412973960249,
      "learning_rate": 2.3017946331698235e-05,
      "loss": 0.9768,
      "num_input_tokens_seen": 46782689600,
      "step": 59462
    },
    {
      "epoch": 6.308402291534055,
      "grad_norm": 0.8743163062949383,
      "learning_rate": 2.301725355125519e-05,
      "loss": 1.0297,
      "num_input_tokens_seen": 46783476416,
      "step": 59463
    },
    {
      "epoch": 6.308508381073626,
      "grad_norm": 0.9713488284551898,
      "learning_rate": 2.3016560772344346e-05,
      "loss": 0.9863,
      "num_input_tokens_seen": 46784263248,
      "step": 59464
    },
    {
      "epoch": 6.308614470613198,
      "grad_norm": 0.9654133555305807,
      "learning_rate": 2.301586799496625e-05,
      "loss": 1.0533,
      "num_input_tokens_seen": 46785050048,
      "step": 59465
    },
    {
      "epoch": 6.308720560152769,
      "grad_norm": 0.9985764790062452,
      "learning_rate": 2.301517521912143e-05,
      "loss": 1.0308,
      "num_input_tokens_seen": 46785836816,
      "step": 59466
    },
    {
      "epoch": 6.308826649692341,
      "grad_norm": 0.7457457317939695,
      "learning_rate": 2.3014482444810427e-05,
      "loss": 1.0063,
      "num_input_tokens_seen": 46786623616,
      "step": 59467
    },
    {
      "epoch": 6.308932739231912,
      "grad_norm": 0.8209784441797887,
      "learning_rate": 2.301378967203377e-05,
      "loss": 0.9139,
      "num_input_tokens_seen": 46787410496,
      "step": 59468
    },
    {
      "epoch": 6.309038828771483,
      "grad_norm": 1.1429330110853557,
      "learning_rate": 2.3013096900792005e-05,
      "loss": 1.0082,
      "num_input_tokens_seen": 46788197360,
      "step": 59469
    },
    {
      "epoch": 6.309144918311055,
      "grad_norm": 0.9407735616152688,
      "learning_rate": 2.301240413108565e-05,
      "loss": 1.0697,
      "num_input_tokens_seen": 46788984128,
      "step": 59470
    },
    {
      "epoch": 6.309251007850626,
      "grad_norm": 1.1649822647053847,
      "learning_rate": 2.3011711362915263e-05,
      "loss": 1.0056,
      "num_input_tokens_seen": 46789770848,
      "step": 59471
    },
    {
      "epoch": 6.309357097390198,
      "grad_norm": 0.7541961313742626,
      "learning_rate": 2.3011018596281362e-05,
      "loss": 1.0191,
      "num_input_tokens_seen": 46790557632,
      "step": 59472
    },
    {
      "epoch": 6.309463186929769,
      "grad_norm": 0.8485912604263626,
      "learning_rate": 2.301032583118448e-05,
      "loss": 0.96,
      "num_input_tokens_seen": 46791344464,
      "step": 59473
    },
    {
      "epoch": 6.3095692764693405,
      "grad_norm": 0.8325748430407082,
      "learning_rate": 2.300963306762517e-05,
      "loss": 0.9566,
      "num_input_tokens_seen": 46792131232,
      "step": 59474
    },
    {
      "epoch": 6.3096753660089115,
      "grad_norm": 1.007652930506488,
      "learning_rate": 2.3008940305603953e-05,
      "loss": 1.0325,
      "num_input_tokens_seen": 46792917920,
      "step": 59475
    },
    {
      "epoch": 6.309781455548483,
      "grad_norm": 1.079941635650761,
      "learning_rate": 2.3008247545121368e-05,
      "loss": 1.045,
      "num_input_tokens_seen": 46793704688,
      "step": 59476
    },
    {
      "epoch": 6.3098875450880545,
      "grad_norm": 1.1998151636894552,
      "learning_rate": 2.300755478617795e-05,
      "loss": 1.038,
      "num_input_tokens_seen": 46794491408,
      "step": 59477
    },
    {
      "epoch": 6.3099936346276255,
      "grad_norm": 0.9068704621820084,
      "learning_rate": 2.3006862028774235e-05,
      "loss": 0.9895,
      "num_input_tokens_seen": 46795278128,
      "step": 59478
    },
    {
      "epoch": 6.310099724167197,
      "grad_norm": 1.0206864754286666,
      "learning_rate": 2.300616927291076e-05,
      "loss": 1.039,
      "num_input_tokens_seen": 46796064896,
      "step": 59479
    },
    {
      "epoch": 6.3102058137067685,
      "grad_norm": 1.0926638106015494,
      "learning_rate": 2.3005476518588064e-05,
      "loss": 1.018,
      "num_input_tokens_seen": 46796851696,
      "step": 59480
    },
    {
      "epoch": 6.3103119032463395,
      "grad_norm": 0.9631829427422923,
      "learning_rate": 2.300478376580667e-05,
      "loss": 1.005,
      "num_input_tokens_seen": 46797638448,
      "step": 59481
    },
    {
      "epoch": 6.310417992785911,
      "grad_norm": 0.9353865072464379,
      "learning_rate": 2.300409101456712e-05,
      "loss": 0.9898,
      "num_input_tokens_seen": 46798425232,
      "step": 59482
    },
    {
      "epoch": 6.3105240823254825,
      "grad_norm": 0.9264756208073958,
      "learning_rate": 2.300339826486996e-05,
      "loss": 0.9938,
      "num_input_tokens_seen": 46799211984,
      "step": 59483
    },
    {
      "epoch": 6.310630171865054,
      "grad_norm": 0.8768726859828457,
      "learning_rate": 2.30027055167157e-05,
      "loss": 1.0722,
      "num_input_tokens_seen": 46799998752,
      "step": 59484
    },
    {
      "epoch": 6.310736261404625,
      "grad_norm": 0.752544488199723,
      "learning_rate": 2.3002012770104904e-05,
      "loss": 0.9204,
      "num_input_tokens_seen": 46800785536,
      "step": 59485
    },
    {
      "epoch": 6.310842350944197,
      "grad_norm": 0.8620438467711337,
      "learning_rate": 2.3001320025038088e-05,
      "loss": 1.0472,
      "num_input_tokens_seen": 46801572304,
      "step": 59486
    },
    {
      "epoch": 6.310948440483768,
      "grad_norm": 0.7817370649688725,
      "learning_rate": 2.3000627281515793e-05,
      "loss": 0.8579,
      "num_input_tokens_seen": 46802359072,
      "step": 59487
    },
    {
      "epoch": 6.311054530023339,
      "grad_norm": 0.7028001252226367,
      "learning_rate": 2.2999934539538557e-05,
      "loss": 0.9338,
      "num_input_tokens_seen": 46803145728,
      "step": 59488
    },
    {
      "epoch": 6.311160619562911,
      "grad_norm": 0.6690828375931125,
      "learning_rate": 2.2999241799106912e-05,
      "loss": 0.9612,
      "num_input_tokens_seen": 46803932496,
      "step": 59489
    },
    {
      "epoch": 6.311266709102482,
      "grad_norm": 0.8040856157657822,
      "learning_rate": 2.299854906022139e-05,
      "loss": 0.9455,
      "num_input_tokens_seen": 46804719344,
      "step": 59490
    },
    {
      "epoch": 6.311372798642054,
      "grad_norm": 0.8317244457165294,
      "learning_rate": 2.2997856322882537e-05,
      "loss": 0.8924,
      "num_input_tokens_seen": 46805506224,
      "step": 59491
    },
    {
      "epoch": 6.311478888181625,
      "grad_norm": 0.7975968779104392,
      "learning_rate": 2.299716358709088e-05,
      "loss": 0.9523,
      "num_input_tokens_seen": 46806293024,
      "step": 59492
    },
    {
      "epoch": 6.311584977721196,
      "grad_norm": 0.6411624211429928,
      "learning_rate": 2.299647085284695e-05,
      "loss": 1.0412,
      "num_input_tokens_seen": 46807079776,
      "step": 59493
    },
    {
      "epoch": 6.311691067260768,
      "grad_norm": 0.7855733876487646,
      "learning_rate": 2.29957781201513e-05,
      "loss": 0.9422,
      "num_input_tokens_seen": 46807866576,
      "step": 59494
    },
    {
      "epoch": 6.311797156800339,
      "grad_norm": 0.6760680351639521,
      "learning_rate": 2.2995085389004443e-05,
      "loss": 1.0454,
      "num_input_tokens_seen": 46808653344,
      "step": 59495
    },
    {
      "epoch": 6.311903246339911,
      "grad_norm": 0.781612161264759,
      "learning_rate": 2.2994392659406933e-05,
      "loss": 1.0826,
      "num_input_tokens_seen": 46809440016,
      "step": 59496
    },
    {
      "epoch": 6.312009335879482,
      "grad_norm": 0.7703130793862258,
      "learning_rate": 2.2993699931359296e-05,
      "loss": 1.0306,
      "num_input_tokens_seen": 46810226800,
      "step": 59497
    },
    {
      "epoch": 6.312115425419053,
      "grad_norm": 0.6400197365078483,
      "learning_rate": 2.2993007204862065e-05,
      "loss": 0.992,
      "num_input_tokens_seen": 46811013600,
      "step": 59498
    },
    {
      "epoch": 6.312221514958625,
      "grad_norm": 0.8059899198767367,
      "learning_rate": 2.299231447991578e-05,
      "loss": 1.0213,
      "num_input_tokens_seen": 46811800304,
      "step": 59499
    },
    {
      "epoch": 6.312327604498196,
      "grad_norm": 0.9570684285047538,
      "learning_rate": 2.2991621756520978e-05,
      "loss": 0.9695,
      "num_input_tokens_seen": 46812587056,
      "step": 59500
    },
    {
      "epoch": 6.312433694037768,
      "grad_norm": 0.7650217622816623,
      "learning_rate": 2.299092903467819e-05,
      "loss": 0.9717,
      "num_input_tokens_seen": 46813373856,
      "step": 59501
    },
    {
      "epoch": 6.312539783577339,
      "grad_norm": 0.8115269242910066,
      "learning_rate": 2.2990236314387955e-05,
      "loss": 0.9824,
      "num_input_tokens_seen": 46814160688,
      "step": 59502
    },
    {
      "epoch": 6.312645873116911,
      "grad_norm": 0.8767474060967554,
      "learning_rate": 2.2989543595650806e-05,
      "loss": 1.0111,
      "num_input_tokens_seen": 46814947456,
      "step": 59503
    },
    {
      "epoch": 6.312751962656482,
      "grad_norm": 0.7103362578580483,
      "learning_rate": 2.2988850878467274e-05,
      "loss": 1.0883,
      "num_input_tokens_seen": 46815734240,
      "step": 59504
    },
    {
      "epoch": 6.312858052196053,
      "grad_norm": 0.7726887350411841,
      "learning_rate": 2.2988158162837903e-05,
      "loss": 1.0452,
      "num_input_tokens_seen": 46816521008,
      "step": 59505
    },
    {
      "epoch": 6.312964141735625,
      "grad_norm": 0.7206252650869994,
      "learning_rate": 2.2987465448763226e-05,
      "loss": 1.0668,
      "num_input_tokens_seen": 46817307776,
      "step": 59506
    },
    {
      "epoch": 6.313070231275196,
      "grad_norm": 0.694357416079433,
      "learning_rate": 2.2986772736243774e-05,
      "loss": 1.0245,
      "num_input_tokens_seen": 46818094560,
      "step": 59507
    },
    {
      "epoch": 6.313176320814768,
      "grad_norm": 0.713796994790498,
      "learning_rate": 2.2986080025280087e-05,
      "loss": 1.0868,
      "num_input_tokens_seen": 46818881344,
      "step": 59508
    },
    {
      "epoch": 6.313282410354339,
      "grad_norm": 0.7369566661189852,
      "learning_rate": 2.2985387315872687e-05,
      "loss": 0.9486,
      "num_input_tokens_seen": 46819668112,
      "step": 59509
    },
    {
      "epoch": 6.31338849989391,
      "grad_norm": 0.6439577240450044,
      "learning_rate": 2.2984694608022134e-05,
      "loss": 0.9749,
      "num_input_tokens_seen": 46820454960,
      "step": 59510
    },
    {
      "epoch": 6.313494589433482,
      "grad_norm": 0.683717297866199,
      "learning_rate": 2.298400190172894e-05,
      "loss": 0.9741,
      "num_input_tokens_seen": 46821241744,
      "step": 59511
    },
    {
      "epoch": 6.313600678973053,
      "grad_norm": 0.7372509110111293,
      "learning_rate": 2.2983309196993662e-05,
      "loss": 1.0312,
      "num_input_tokens_seen": 46822028480,
      "step": 59512
    },
    {
      "epoch": 6.313706768512625,
      "grad_norm": 0.6020410499562318,
      "learning_rate": 2.2982616493816816e-05,
      "loss": 0.9482,
      "num_input_tokens_seen": 46822815424,
      "step": 59513
    },
    {
      "epoch": 6.313812858052196,
      "grad_norm": 0.6070046403861101,
      "learning_rate": 2.2981923792198945e-05,
      "loss": 1.0095,
      "num_input_tokens_seen": 46823602096,
      "step": 59514
    },
    {
      "epoch": 6.313918947591768,
      "grad_norm": 0.790980304587292,
      "learning_rate": 2.2981231092140587e-05,
      "loss": 1.0379,
      "num_input_tokens_seen": 46824388768,
      "step": 59515
    },
    {
      "epoch": 6.314025037131339,
      "grad_norm": 0.7043917981439273,
      "learning_rate": 2.298053839364227e-05,
      "loss": 1.0075,
      "num_input_tokens_seen": 46825175568,
      "step": 59516
    },
    {
      "epoch": 6.31413112667091,
      "grad_norm": 0.8834362687327297,
      "learning_rate": 2.2979845696704538e-05,
      "loss": 1.0043,
      "num_input_tokens_seen": 46825962288,
      "step": 59517
    },
    {
      "epoch": 6.314237216210482,
      "grad_norm": 1.1247606009889317,
      "learning_rate": 2.2979153001327924e-05,
      "loss": 1.063,
      "num_input_tokens_seen": 46826749008,
      "step": 59518
    },
    {
      "epoch": 6.314343305750053,
      "grad_norm": 0.9639885791036599,
      "learning_rate": 2.2978460307512954e-05,
      "loss": 1.0558,
      "num_input_tokens_seen": 46827535728,
      "step": 59519
    },
    {
      "epoch": 6.314449395289625,
      "grad_norm": 0.9420650632004064,
      "learning_rate": 2.2977767615260178e-05,
      "loss": 0.9961,
      "num_input_tokens_seen": 46828322544,
      "step": 59520
    },
    {
      "epoch": 6.314555484829196,
      "grad_norm": 0.7568330896310697,
      "learning_rate": 2.2977074924570123e-05,
      "loss": 1.0484,
      "num_input_tokens_seen": 46829109232,
      "step": 59521
    },
    {
      "epoch": 6.314661574368767,
      "grad_norm": 0.7796699544380051,
      "learning_rate": 2.297638223544332e-05,
      "loss": 1.0183,
      "num_input_tokens_seen": 46829895984,
      "step": 59522
    },
    {
      "epoch": 6.314767663908339,
      "grad_norm": 0.8491972253106764,
      "learning_rate": 2.2975689547880315e-05,
      "loss": 1.0381,
      "num_input_tokens_seen": 46830682656,
      "step": 59523
    },
    {
      "epoch": 6.31487375344791,
      "grad_norm": 0.967468656147849,
      "learning_rate": 2.2974996861881633e-05,
      "loss": 1.0202,
      "num_input_tokens_seen": 46831469472,
      "step": 59524
    },
    {
      "epoch": 6.314979842987482,
      "grad_norm": 0.6874799978074667,
      "learning_rate": 2.2974304177447814e-05,
      "loss": 0.9742,
      "num_input_tokens_seen": 46832256336,
      "step": 59525
    },
    {
      "epoch": 6.315085932527053,
      "grad_norm": 0.7110370433712916,
      "learning_rate": 2.2973611494579397e-05,
      "loss": 1.0665,
      "num_input_tokens_seen": 46833043072,
      "step": 59526
    },
    {
      "epoch": 6.315192022066624,
      "grad_norm": 0.8350441704747374,
      "learning_rate": 2.2972918813276913e-05,
      "loss": 1.0207,
      "num_input_tokens_seen": 46833829856,
      "step": 59527
    },
    {
      "epoch": 6.315298111606196,
      "grad_norm": 0.7457799013725033,
      "learning_rate": 2.2972226133540895e-05,
      "loss": 0.9587,
      "num_input_tokens_seen": 46834616656,
      "step": 59528
    },
    {
      "epoch": 6.315404201145767,
      "grad_norm": 0.7560531849880293,
      "learning_rate": 2.2971533455371884e-05,
      "loss": 0.9574,
      "num_input_tokens_seen": 46835403408,
      "step": 59529
    },
    {
      "epoch": 6.315510290685339,
      "grad_norm": 0.8537664089773016,
      "learning_rate": 2.2970840778770413e-05,
      "loss": 1.0039,
      "num_input_tokens_seen": 46836190080,
      "step": 59530
    },
    {
      "epoch": 6.31561638022491,
      "grad_norm": 0.7109883578719047,
      "learning_rate": 2.297014810373701e-05,
      "loss": 1.05,
      "num_input_tokens_seen": 46836976912,
      "step": 59531
    },
    {
      "epoch": 6.315722469764482,
      "grad_norm": 0.8415131131932152,
      "learning_rate": 2.2969455430272223e-05,
      "loss": 0.9609,
      "num_input_tokens_seen": 46837763712,
      "step": 59532
    },
    {
      "epoch": 6.315828559304053,
      "grad_norm": 0.7365193843230661,
      "learning_rate": 2.296876275837658e-05,
      "loss": 0.9135,
      "num_input_tokens_seen": 46838550576,
      "step": 59533
    },
    {
      "epoch": 6.315934648843624,
      "grad_norm": 0.6079678642129541,
      "learning_rate": 2.296807008805062e-05,
      "loss": 0.9775,
      "num_input_tokens_seen": 46839337392,
      "step": 59534
    },
    {
      "epoch": 6.316040738383196,
      "grad_norm": 0.7171619636578177,
      "learning_rate": 2.2967377419294875e-05,
      "loss": 1.049,
      "num_input_tokens_seen": 46840124192,
      "step": 59535
    },
    {
      "epoch": 6.316146827922767,
      "grad_norm": 0.7408942022363137,
      "learning_rate": 2.2966684752109876e-05,
      "loss": 1.1052,
      "num_input_tokens_seen": 46840910960,
      "step": 59536
    },
    {
      "epoch": 6.3162529174623385,
      "grad_norm": 0.6986230690797752,
      "learning_rate": 2.296599208649617e-05,
      "loss": 0.9342,
      "num_input_tokens_seen": 46841697840,
      "step": 59537
    },
    {
      "epoch": 6.3163590070019096,
      "grad_norm": 0.7219103594002121,
      "learning_rate": 2.2965299422454283e-05,
      "loss": 0.9921,
      "num_input_tokens_seen": 46842484720,
      "step": 59538
    },
    {
      "epoch": 6.3164650965414815,
      "grad_norm": 0.7026148967457974,
      "learning_rate": 2.296460675998475e-05,
      "loss": 1.0157,
      "num_input_tokens_seen": 46843271424,
      "step": 59539
    },
    {
      "epoch": 6.3165711860810525,
      "grad_norm": 0.722567100190371,
      "learning_rate": 2.2963914099088114e-05,
      "loss": 1.0443,
      "num_input_tokens_seen": 46844058208,
      "step": 59540
    },
    {
      "epoch": 6.3166772756206235,
      "grad_norm": 0.8229004576719233,
      "learning_rate": 2.2963221439764905e-05,
      "loss": 1.0835,
      "num_input_tokens_seen": 46844845040,
      "step": 59541
    },
    {
      "epoch": 6.3167833651601955,
      "grad_norm": 0.874624600452556,
      "learning_rate": 2.2962528782015653e-05,
      "loss": 0.995,
      "num_input_tokens_seen": 46845631792,
      "step": 59542
    },
    {
      "epoch": 6.3168894546997665,
      "grad_norm": 0.7014539926629365,
      "learning_rate": 2.2961836125840906e-05,
      "loss": 1.0253,
      "num_input_tokens_seen": 46846418576,
      "step": 59543
    },
    {
      "epoch": 6.316995544239338,
      "grad_norm": 0.8176760478642312,
      "learning_rate": 2.296114347124119e-05,
      "loss": 1.0275,
      "num_input_tokens_seen": 46847205392,
      "step": 59544
    },
    {
      "epoch": 6.317101633778909,
      "grad_norm": 0.8096879109883526,
      "learning_rate": 2.2960450818217037e-05,
      "loss": 1.0595,
      "num_input_tokens_seen": 46847992112,
      "step": 59545
    },
    {
      "epoch": 6.3172077233184805,
      "grad_norm": 0.7498042563257348,
      "learning_rate": 2.2959758166768995e-05,
      "loss": 1.0819,
      "num_input_tokens_seen": 46848778912,
      "step": 59546
    },
    {
      "epoch": 6.317313812858052,
      "grad_norm": 0.9006337122357061,
      "learning_rate": 2.2959065516897586e-05,
      "loss": 1.0538,
      "num_input_tokens_seen": 46849565520,
      "step": 59547
    },
    {
      "epoch": 6.317419902397623,
      "grad_norm": 0.7568692518558597,
      "learning_rate": 2.2958372868603357e-05,
      "loss": 1.0605,
      "num_input_tokens_seen": 46850352320,
      "step": 59548
    },
    {
      "epoch": 6.317525991937195,
      "grad_norm": 0.915221092785377,
      "learning_rate": 2.2957680221886834e-05,
      "loss": 1.0663,
      "num_input_tokens_seen": 46851139056,
      "step": 59549
    },
    {
      "epoch": 6.317632081476766,
      "grad_norm": 0.8016536230872466,
      "learning_rate": 2.2956987576748557e-05,
      "loss": 0.9973,
      "num_input_tokens_seen": 46851925840,
      "step": 59550
    },
    {
      "epoch": 6.317738171016337,
      "grad_norm": 0.7292112874595168,
      "learning_rate": 2.295629493318906e-05,
      "loss": 1.0411,
      "num_input_tokens_seen": 46852712608,
      "step": 59551
    },
    {
      "epoch": 6.317844260555909,
      "grad_norm": 0.8028221958780044,
      "learning_rate": 2.295560229120888e-05,
      "loss": 1.0144,
      "num_input_tokens_seen": 46853499360,
      "step": 59552
    },
    {
      "epoch": 6.31795035009548,
      "grad_norm": 0.7464214356676859,
      "learning_rate": 2.2954909650808547e-05,
      "loss": 0.9563,
      "num_input_tokens_seen": 46854286192,
      "step": 59553
    },
    {
      "epoch": 6.318056439635052,
      "grad_norm": 0.8445932215347216,
      "learning_rate": 2.29542170119886e-05,
      "loss": 1.0189,
      "num_input_tokens_seen": 46855072912,
      "step": 59554
    },
    {
      "epoch": 6.318162529174623,
      "grad_norm": 0.7397822377332841,
      "learning_rate": 2.295352437474958e-05,
      "loss": 1.0435,
      "num_input_tokens_seen": 46855859648,
      "step": 59555
    },
    {
      "epoch": 6.318268618714194,
      "grad_norm": 0.6670081806254918,
      "learning_rate": 2.2952831739092008e-05,
      "loss": 0.9355,
      "num_input_tokens_seen": 46856646400,
      "step": 59556
    },
    {
      "epoch": 6.318374708253766,
      "grad_norm": 0.7684261208543285,
      "learning_rate": 2.2952139105016436e-05,
      "loss": 0.9975,
      "num_input_tokens_seen": 46857433200,
      "step": 59557
    },
    {
      "epoch": 6.318480797793337,
      "grad_norm": 0.8133756816027945,
      "learning_rate": 2.2951446472523385e-05,
      "loss": 0.9612,
      "num_input_tokens_seen": 46858219984,
      "step": 59558
    },
    {
      "epoch": 6.318586887332909,
      "grad_norm": 0.8928339848429901,
      "learning_rate": 2.2950753841613395e-05,
      "loss": 1.0758,
      "num_input_tokens_seen": 46859006832,
      "step": 59559
    },
    {
      "epoch": 6.31869297687248,
      "grad_norm": 0.8190446658818219,
      "learning_rate": 2.2950061212287008e-05,
      "loss": 1.0341,
      "num_input_tokens_seen": 46859793616,
      "step": 59560
    },
    {
      "epoch": 6.318799066412052,
      "grad_norm": 0.903627699879786,
      "learning_rate": 2.2949368584544752e-05,
      "loss": 0.9929,
      "num_input_tokens_seen": 46860580400,
      "step": 59561
    },
    {
      "epoch": 6.318905155951623,
      "grad_norm": 0.8225778513977339,
      "learning_rate": 2.294867595838716e-05,
      "loss": 1.0193,
      "num_input_tokens_seen": 46861367120,
      "step": 59562
    },
    {
      "epoch": 6.319011245491194,
      "grad_norm": 0.6764305885449583,
      "learning_rate": 2.2947983333814774e-05,
      "loss": 0.9543,
      "num_input_tokens_seen": 46862153984,
      "step": 59563
    },
    {
      "epoch": 6.319117335030766,
      "grad_norm": 1.0523470969783237,
      "learning_rate": 2.2947290710828124e-05,
      "loss": 0.9595,
      "num_input_tokens_seen": 46862940832,
      "step": 59564
    },
    {
      "epoch": 6.319223424570337,
      "grad_norm": 0.8943648193894722,
      "learning_rate": 2.294659808942775e-05,
      "loss": 0.9471,
      "num_input_tokens_seen": 46863727648,
      "step": 59565
    },
    {
      "epoch": 6.319329514109909,
      "grad_norm": 0.796967901514091,
      "learning_rate": 2.2945905469614186e-05,
      "loss": 0.9837,
      "num_input_tokens_seen": 46864514448,
      "step": 59566
    },
    {
      "epoch": 6.31943560364948,
      "grad_norm": 0.8944293437097146,
      "learning_rate": 2.2945212851387958e-05,
      "loss": 1.0591,
      "num_input_tokens_seen": 46865301168,
      "step": 59567
    },
    {
      "epoch": 6.319541693189052,
      "grad_norm": 0.915637831536582,
      "learning_rate": 2.2944520234749616e-05,
      "loss": 1.042,
      "num_input_tokens_seen": 46866087856,
      "step": 59568
    },
    {
      "epoch": 6.319647782728623,
      "grad_norm": 0.6652060706051297,
      "learning_rate": 2.294382761969969e-05,
      "loss": 0.9732,
      "num_input_tokens_seen": 46866874624,
      "step": 59569
    },
    {
      "epoch": 6.319753872268194,
      "grad_norm": 0.8204196693984612,
      "learning_rate": 2.294313500623871e-05,
      "loss": 0.9032,
      "num_input_tokens_seen": 46867661456,
      "step": 59570
    },
    {
      "epoch": 6.319859961807766,
      "grad_norm": 0.8448940525670068,
      "learning_rate": 2.2942442394367218e-05,
      "loss": 1.1044,
      "num_input_tokens_seen": 46868448064,
      "step": 59571
    },
    {
      "epoch": 6.319966051347337,
      "grad_norm": 0.8988281408266535,
      "learning_rate": 2.2941749784085746e-05,
      "loss": 0.8679,
      "num_input_tokens_seen": 46869235008,
      "step": 59572
    },
    {
      "epoch": 6.320072140886909,
      "grad_norm": 0.9448317376638186,
      "learning_rate": 2.2941057175394823e-05,
      "loss": 1.0246,
      "num_input_tokens_seen": 46870021744,
      "step": 59573
    },
    {
      "epoch": 6.32017823042648,
      "grad_norm": 0.7648607686683742,
      "learning_rate": 2.2940364568294997e-05,
      "loss": 0.9437,
      "num_input_tokens_seen": 46870808560,
      "step": 59574
    },
    {
      "epoch": 6.320284319966051,
      "grad_norm": 0.73904533211337,
      "learning_rate": 2.2939671962786797e-05,
      "loss": 0.9745,
      "num_input_tokens_seen": 46871595328,
      "step": 59575
    },
    {
      "epoch": 6.320390409505623,
      "grad_norm": 0.7199638084624087,
      "learning_rate": 2.293897935887075e-05,
      "loss": 0.9561,
      "num_input_tokens_seen": 46872382160,
      "step": 59576
    },
    {
      "epoch": 6.320496499045194,
      "grad_norm": 0.7924035997870896,
      "learning_rate": 2.2938286756547408e-05,
      "loss": 0.9425,
      "num_input_tokens_seen": 46873168928,
      "step": 59577
    },
    {
      "epoch": 6.320602588584766,
      "grad_norm": 0.7802632930804545,
      "learning_rate": 2.29375941558173e-05,
      "loss": 0.9617,
      "num_input_tokens_seen": 46873955776,
      "step": 59578
    },
    {
      "epoch": 6.320708678124337,
      "grad_norm": 0.7240006768313926,
      "learning_rate": 2.293690155668095e-05,
      "loss": 0.9112,
      "num_input_tokens_seen": 46874742672,
      "step": 59579
    },
    {
      "epoch": 6.320814767663908,
      "grad_norm": 0.797299341864854,
      "learning_rate": 2.2936208959138904e-05,
      "loss": 1.0379,
      "num_input_tokens_seen": 46875529328,
      "step": 59580
    },
    {
      "epoch": 6.32092085720348,
      "grad_norm": 0.6756125531160213,
      "learning_rate": 2.2935516363191693e-05,
      "loss": 0.9831,
      "num_input_tokens_seen": 46876316128,
      "step": 59581
    },
    {
      "epoch": 6.321026946743051,
      "grad_norm": 0.7222071372622555,
      "learning_rate": 2.2934823768839862e-05,
      "loss": 1.0278,
      "num_input_tokens_seen": 46877102896,
      "step": 59582
    },
    {
      "epoch": 6.321133036282623,
      "grad_norm": 0.738093780515653,
      "learning_rate": 2.2934131176083936e-05,
      "loss": 1.0594,
      "num_input_tokens_seen": 46877889696,
      "step": 59583
    },
    {
      "epoch": 6.321239125822194,
      "grad_norm": 0.7129269221384642,
      "learning_rate": 2.2933438584924447e-05,
      "loss": 1.0146,
      "num_input_tokens_seen": 46878676480,
      "step": 59584
    },
    {
      "epoch": 6.321345215361766,
      "grad_norm": 0.7179862786993949,
      "learning_rate": 2.2932745995361943e-05,
      "loss": 0.9738,
      "num_input_tokens_seen": 46879463264,
      "step": 59585
    },
    {
      "epoch": 6.321451304901337,
      "grad_norm": 0.750016559789496,
      "learning_rate": 2.2932053407396954e-05,
      "loss": 1.0642,
      "num_input_tokens_seen": 46880250112,
      "step": 59586
    },
    {
      "epoch": 6.321557394440908,
      "grad_norm": 0.9290673272517189,
      "learning_rate": 2.2931360821030004e-05,
      "loss": 1.0053,
      "num_input_tokens_seen": 46881036880,
      "step": 59587
    },
    {
      "epoch": 6.32166348398048,
      "grad_norm": 0.8708293561672552,
      "learning_rate": 2.2930668236261643e-05,
      "loss": 0.999,
      "num_input_tokens_seen": 46881823664,
      "step": 59588
    },
    {
      "epoch": 6.321769573520051,
      "grad_norm": 0.7942954067400194,
      "learning_rate": 2.29299756530924e-05,
      "loss": 0.9988,
      "num_input_tokens_seen": 46882610464,
      "step": 59589
    },
    {
      "epoch": 6.321875663059623,
      "grad_norm": 0.733564744622531,
      "learning_rate": 2.2929283071522813e-05,
      "loss": 0.9836,
      "num_input_tokens_seen": 46883397264,
      "step": 59590
    },
    {
      "epoch": 6.321981752599194,
      "grad_norm": 0.7241710467899632,
      "learning_rate": 2.2928590491553415e-05,
      "loss": 0.9704,
      "num_input_tokens_seen": 46884184016,
      "step": 59591
    },
    {
      "epoch": 6.322087842138765,
      "grad_norm": 0.726406987691927,
      "learning_rate": 2.2927897913184743e-05,
      "loss": 0.9152,
      "num_input_tokens_seen": 46884970752,
      "step": 59592
    },
    {
      "epoch": 6.322193931678337,
      "grad_norm": 0.7781030556021523,
      "learning_rate": 2.2927205336417322e-05,
      "loss": 0.9393,
      "num_input_tokens_seen": 46885757552,
      "step": 59593
    },
    {
      "epoch": 6.322300021217908,
      "grad_norm": 0.8466706838899039,
      "learning_rate": 2.2926512761251706e-05,
      "loss": 0.9901,
      "num_input_tokens_seen": 46886544336,
      "step": 59594
    },
    {
      "epoch": 6.32240611075748,
      "grad_norm": 0.8471054888233921,
      "learning_rate": 2.2925820187688418e-05,
      "loss": 0.9502,
      "num_input_tokens_seen": 46887331136,
      "step": 59595
    },
    {
      "epoch": 6.322512200297051,
      "grad_norm": 0.7019171604808,
      "learning_rate": 2.292512761572799e-05,
      "loss": 0.9538,
      "num_input_tokens_seen": 46888117984,
      "step": 59596
    },
    {
      "epoch": 6.3226182898366226,
      "grad_norm": 0.8690219996130393,
      "learning_rate": 2.2924435045370967e-05,
      "loss": 0.9079,
      "num_input_tokens_seen": 46888904752,
      "step": 59597
    },
    {
      "epoch": 6.322724379376194,
      "grad_norm": 0.7790703830930322,
      "learning_rate": 2.2923742476617877e-05,
      "loss": 1.1031,
      "num_input_tokens_seen": 46889691536,
      "step": 59598
    },
    {
      "epoch": 6.322830468915765,
      "grad_norm": 0.8251997576645833,
      "learning_rate": 2.292304990946926e-05,
      "loss": 0.9734,
      "num_input_tokens_seen": 46890478336,
      "step": 59599
    },
    {
      "epoch": 6.3229365584553365,
      "grad_norm": 1.035483548805665,
      "learning_rate": 2.292235734392565e-05,
      "loss": 1.0722,
      "num_input_tokens_seen": 46891265168,
      "step": 59600
    },
    {
      "epoch": 6.323042647994908,
      "grad_norm": 0.6852934921804225,
      "learning_rate": 2.2921664779987578e-05,
      "loss": 1.0529,
      "num_input_tokens_seen": 46892051968,
      "step": 59601
    },
    {
      "epoch": 6.3231487375344795,
      "grad_norm": 0.8729898824013659,
      "learning_rate": 2.2920972217655585e-05,
      "loss": 1.0732,
      "num_input_tokens_seen": 46892838768,
      "step": 59602
    },
    {
      "epoch": 6.3232548270740505,
      "grad_norm": 0.8201713023324281,
      "learning_rate": 2.2920279656930206e-05,
      "loss": 0.9644,
      "num_input_tokens_seen": 46893625536,
      "step": 59603
    },
    {
      "epoch": 6.3233609166136215,
      "grad_norm": 0.743630725239434,
      "learning_rate": 2.291958709781196e-05,
      "loss": 1.0192,
      "num_input_tokens_seen": 46894412320,
      "step": 59604
    },
    {
      "epoch": 6.3234670061531935,
      "grad_norm": 0.8795996959010566,
      "learning_rate": 2.2918894540301404e-05,
      "loss": 1.1004,
      "num_input_tokens_seen": 46895199104,
      "step": 59605
    },
    {
      "epoch": 6.3235730956927645,
      "grad_norm": 0.7160472759680161,
      "learning_rate": 2.2918201984399072e-05,
      "loss": 0.9516,
      "num_input_tokens_seen": 46895985968,
      "step": 59606
    },
    {
      "epoch": 6.323679185232336,
      "grad_norm": 0.789420980592598,
      "learning_rate": 2.291750943010549e-05,
      "loss": 1.0786,
      "num_input_tokens_seen": 46896772736,
      "step": 59607
    },
    {
      "epoch": 6.323785274771907,
      "grad_norm": 0.9561720026917446,
      "learning_rate": 2.291681687742119e-05,
      "loss": 0.9546,
      "num_input_tokens_seen": 46897559536,
      "step": 59608
    },
    {
      "epoch": 6.3238913643114785,
      "grad_norm": 0.9108893333198578,
      "learning_rate": 2.291612432634672e-05,
      "loss": 0.9896,
      "num_input_tokens_seen": 46898346352,
      "step": 59609
    },
    {
      "epoch": 6.32399745385105,
      "grad_norm": 0.7245030295617654,
      "learning_rate": 2.2915431776882606e-05,
      "loss": 1.002,
      "num_input_tokens_seen": 46899133120,
      "step": 59610
    },
    {
      "epoch": 6.324103543390621,
      "grad_norm": 1.0134928359300992,
      "learning_rate": 2.291473922902938e-05,
      "loss": 0.9859,
      "num_input_tokens_seen": 46899919888,
      "step": 59611
    },
    {
      "epoch": 6.324209632930193,
      "grad_norm": 0.9259859739694998,
      "learning_rate": 2.2914046682787587e-05,
      "loss": 0.9772,
      "num_input_tokens_seen": 46900706720,
      "step": 59612
    },
    {
      "epoch": 6.324315722469764,
      "grad_norm": 1.014750991518787,
      "learning_rate": 2.2913354138157763e-05,
      "loss": 1.0256,
      "num_input_tokens_seen": 46901493424,
      "step": 59613
    },
    {
      "epoch": 6.324421812009336,
      "grad_norm": 1.237501890432733,
      "learning_rate": 2.2912661595140428e-05,
      "loss": 1.0606,
      "num_input_tokens_seen": 46902280224,
      "step": 59614
    },
    {
      "epoch": 6.324527901548907,
      "grad_norm": 0.8619808435335619,
      "learning_rate": 2.291196905373613e-05,
      "loss": 1.0166,
      "num_input_tokens_seen": 46903066992,
      "step": 59615
    },
    {
      "epoch": 6.324633991088478,
      "grad_norm": 1.147826008287809,
      "learning_rate": 2.2911276513945402e-05,
      "loss": 0.9804,
      "num_input_tokens_seen": 46903853744,
      "step": 59616
    },
    {
      "epoch": 6.32474008062805,
      "grad_norm": 0.7831705589173432,
      "learning_rate": 2.2910583975768776e-05,
      "loss": 1.0256,
      "num_input_tokens_seen": 46904640480,
      "step": 59617
    },
    {
      "epoch": 6.324846170167621,
      "grad_norm": 0.8618298975520722,
      "learning_rate": 2.2909891439206794e-05,
      "loss": 0.9186,
      "num_input_tokens_seen": 46905427296,
      "step": 59618
    },
    {
      "epoch": 6.324952259707193,
      "grad_norm": 0.9947911781182663,
      "learning_rate": 2.290919890425998e-05,
      "loss": 1.0013,
      "num_input_tokens_seen": 46906214112,
      "step": 59619
    },
    {
      "epoch": 6.325058349246764,
      "grad_norm": 1.1551493758449993,
      "learning_rate": 2.2908506370928883e-05,
      "loss": 1.0111,
      "num_input_tokens_seen": 46907001008,
      "step": 59620
    },
    {
      "epoch": 6.325164438786335,
      "grad_norm": 0.8637483798919181,
      "learning_rate": 2.290781383921403e-05,
      "loss": 1.0885,
      "num_input_tokens_seen": 46907787808,
      "step": 59621
    },
    {
      "epoch": 6.325270528325907,
      "grad_norm": 0.7620636689230043,
      "learning_rate": 2.290712130911595e-05,
      "loss": 1.0379,
      "num_input_tokens_seen": 46908574624,
      "step": 59622
    },
    {
      "epoch": 6.325376617865478,
      "grad_norm": 0.9973940855540211,
      "learning_rate": 2.290642878063519e-05,
      "loss": 1.0137,
      "num_input_tokens_seen": 46909361392,
      "step": 59623
    },
    {
      "epoch": 6.32548270740505,
      "grad_norm": 0.7539135020331711,
      "learning_rate": 2.2905736253772282e-05,
      "loss": 0.9777,
      "num_input_tokens_seen": 46910148224,
      "step": 59624
    },
    {
      "epoch": 6.325588796944621,
      "grad_norm": 0.7433923749428869,
      "learning_rate": 2.2905043728527755e-05,
      "loss": 1.0448,
      "num_input_tokens_seen": 46910934976,
      "step": 59625
    },
    {
      "epoch": 6.325694886484193,
      "grad_norm": 0.8387456404111758,
      "learning_rate": 2.2904351204902152e-05,
      "loss": 0.975,
      "num_input_tokens_seen": 46911721824,
      "step": 59626
    },
    {
      "epoch": 6.325800976023764,
      "grad_norm": 0.925890152016909,
      "learning_rate": 2.2903658682896008e-05,
      "loss": 1.0603,
      "num_input_tokens_seen": 46912508512,
      "step": 59627
    },
    {
      "epoch": 6.325907065563335,
      "grad_norm": 0.7253857111059461,
      "learning_rate": 2.290296616250985e-05,
      "loss": 1.0115,
      "num_input_tokens_seen": 46913295264,
      "step": 59628
    },
    {
      "epoch": 6.326013155102907,
      "grad_norm": 0.7797862453203538,
      "learning_rate": 2.2902273643744222e-05,
      "loss": 1.0285,
      "num_input_tokens_seen": 46914082048,
      "step": 59629
    },
    {
      "epoch": 6.326119244642478,
      "grad_norm": 0.7393878234124283,
      "learning_rate": 2.2901581126599654e-05,
      "loss": 1.055,
      "num_input_tokens_seen": 46914868832,
      "step": 59630
    },
    {
      "epoch": 6.32622533418205,
      "grad_norm": 0.7499979907171258,
      "learning_rate": 2.2900888611076677e-05,
      "loss": 1.017,
      "num_input_tokens_seen": 46915655536,
      "step": 59631
    },
    {
      "epoch": 6.326331423721621,
      "grad_norm": 0.7364267711346626,
      "learning_rate": 2.290019609717584e-05,
      "loss": 1.0354,
      "num_input_tokens_seen": 46916442368,
      "step": 59632
    },
    {
      "epoch": 6.326437513261192,
      "grad_norm": 0.8327276398435022,
      "learning_rate": 2.2899503584897668e-05,
      "loss": 0.9477,
      "num_input_tokens_seen": 46917229104,
      "step": 59633
    },
    {
      "epoch": 6.326543602800764,
      "grad_norm": 0.8943970173577366,
      "learning_rate": 2.289881107424269e-05,
      "loss": 0.9975,
      "num_input_tokens_seen": 46918015872,
      "step": 59634
    },
    {
      "epoch": 6.326649692340335,
      "grad_norm": 0.7647988580487292,
      "learning_rate": 2.2898118565211458e-05,
      "loss": 0.9393,
      "num_input_tokens_seen": 46918802624,
      "step": 59635
    },
    {
      "epoch": 6.326755781879907,
      "grad_norm": 0.8271830906198747,
      "learning_rate": 2.2897426057804493e-05,
      "loss": 0.9766,
      "num_input_tokens_seen": 46919589456,
      "step": 59636
    },
    {
      "epoch": 6.326861871419478,
      "grad_norm": 0.7436655250646217,
      "learning_rate": 2.289673355202234e-05,
      "loss": 0.954,
      "num_input_tokens_seen": 46920376288,
      "step": 59637
    },
    {
      "epoch": 6.326967960959049,
      "grad_norm": 0.7201066547279247,
      "learning_rate": 2.2896041047865528e-05,
      "loss": 0.989,
      "num_input_tokens_seen": 46921163136,
      "step": 59638
    },
    {
      "epoch": 6.327074050498621,
      "grad_norm": 0.834749445001283,
      "learning_rate": 2.2895348545334593e-05,
      "loss": 1.0241,
      "num_input_tokens_seen": 46921949904,
      "step": 59639
    },
    {
      "epoch": 6.327180140038192,
      "grad_norm": 0.7570739558284337,
      "learning_rate": 2.2894656044430072e-05,
      "loss": 0.9992,
      "num_input_tokens_seen": 46922736784,
      "step": 59640
    },
    {
      "epoch": 6.327286229577764,
      "grad_norm": 0.8181284565661544,
      "learning_rate": 2.28939635451525e-05,
      "loss": 1.0563,
      "num_input_tokens_seen": 46923523472,
      "step": 59641
    },
    {
      "epoch": 6.327392319117335,
      "grad_norm": 0.6522693864032256,
      "learning_rate": 2.2893271047502404e-05,
      "loss": 0.949,
      "num_input_tokens_seen": 46924310240,
      "step": 59642
    },
    {
      "epoch": 6.327498408656907,
      "grad_norm": 0.88471251922713,
      "learning_rate": 2.2892578551480334e-05,
      "loss": 0.9634,
      "num_input_tokens_seen": 46925096976,
      "step": 59643
    },
    {
      "epoch": 6.327604498196478,
      "grad_norm": 0.8127412767550191,
      "learning_rate": 2.2891886057086817e-05,
      "loss": 1.0021,
      "num_input_tokens_seen": 46925883728,
      "step": 59644
    },
    {
      "epoch": 6.327710587736049,
      "grad_norm": 0.9773897379543083,
      "learning_rate": 2.2891193564322382e-05,
      "loss": 0.9702,
      "num_input_tokens_seen": 46926670528,
      "step": 59645
    },
    {
      "epoch": 6.327816677275621,
      "grad_norm": 0.8518913030001519,
      "learning_rate": 2.289050107318758e-05,
      "loss": 1.0848,
      "num_input_tokens_seen": 46927457184,
      "step": 59646
    },
    {
      "epoch": 6.327922766815192,
      "grad_norm": 0.882308559401871,
      "learning_rate": 2.2889808583682934e-05,
      "loss": 1.103,
      "num_input_tokens_seen": 46928243808,
      "step": 59647
    },
    {
      "epoch": 6.328028856354764,
      "grad_norm": 0.9463683899487428,
      "learning_rate": 2.2889116095808975e-05,
      "loss": 0.995,
      "num_input_tokens_seen": 46929030608,
      "step": 59648
    },
    {
      "epoch": 6.328134945894335,
      "grad_norm": 0.6741993550007567,
      "learning_rate": 2.2888423609566253e-05,
      "loss": 1.0352,
      "num_input_tokens_seen": 46929817424,
      "step": 59649
    },
    {
      "epoch": 6.328241035433906,
      "grad_norm": 0.9655495574657559,
      "learning_rate": 2.2887731124955292e-05,
      "loss": 1.0139,
      "num_input_tokens_seen": 46930604192,
      "step": 59650
    },
    {
      "epoch": 6.328347124973478,
      "grad_norm": 0.9051326563610911,
      "learning_rate": 2.2887038641976632e-05,
      "loss": 1.0531,
      "num_input_tokens_seen": 46931390944,
      "step": 59651
    },
    {
      "epoch": 6.328453214513049,
      "grad_norm": 0.7196833891637499,
      "learning_rate": 2.288634616063081e-05,
      "loss": 1.0299,
      "num_input_tokens_seen": 46932177728,
      "step": 59652
    },
    {
      "epoch": 6.328559304052621,
      "grad_norm": 0.7353011841956818,
      "learning_rate": 2.288565368091835e-05,
      "loss": 1.077,
      "num_input_tokens_seen": 46932964464,
      "step": 59653
    },
    {
      "epoch": 6.328665393592192,
      "grad_norm": 0.7175882131454383,
      "learning_rate": 2.28849612028398e-05,
      "loss": 1.0446,
      "num_input_tokens_seen": 46933751280,
      "step": 59654
    },
    {
      "epoch": 6.328771483131764,
      "grad_norm": 0.7096270438252964,
      "learning_rate": 2.288426872639569e-05,
      "loss": 0.9889,
      "num_input_tokens_seen": 46934538032,
      "step": 59655
    },
    {
      "epoch": 6.328877572671335,
      "grad_norm": 0.6288631439839143,
      "learning_rate": 2.2883576251586546e-05,
      "loss": 0.986,
      "num_input_tokens_seen": 46935324864,
      "step": 59656
    },
    {
      "epoch": 6.328983662210906,
      "grad_norm": 0.7737079714360426,
      "learning_rate": 2.2882883778412922e-05,
      "loss": 1.0067,
      "num_input_tokens_seen": 46936111520,
      "step": 59657
    },
    {
      "epoch": 6.329089751750478,
      "grad_norm": 0.73356211207155,
      "learning_rate": 2.2882191306875346e-05,
      "loss": 0.9628,
      "num_input_tokens_seen": 46936898304,
      "step": 59658
    },
    {
      "epoch": 6.329195841290049,
      "grad_norm": 0.7765472888892396,
      "learning_rate": 2.2881498836974342e-05,
      "loss": 1.0429,
      "num_input_tokens_seen": 46937685008,
      "step": 59659
    },
    {
      "epoch": 6.329301930829621,
      "grad_norm": 0.7004858133110229,
      "learning_rate": 2.2880806368710456e-05,
      "loss": 1.0206,
      "num_input_tokens_seen": 46938471712,
      "step": 59660
    },
    {
      "epoch": 6.329408020369192,
      "grad_norm": 0.6808889187760166,
      "learning_rate": 2.2880113902084224e-05,
      "loss": 0.9769,
      "num_input_tokens_seen": 46939258576,
      "step": 59661
    },
    {
      "epoch": 6.329514109908763,
      "grad_norm": 0.8221611615893083,
      "learning_rate": 2.287942143709617e-05,
      "loss": 1.0072,
      "num_input_tokens_seen": 46940045424,
      "step": 59662
    },
    {
      "epoch": 6.3296201994483345,
      "grad_norm": 0.8034420645775172,
      "learning_rate": 2.2878728973746845e-05,
      "loss": 1.0201,
      "num_input_tokens_seen": 46940832128,
      "step": 59663
    },
    {
      "epoch": 6.329726288987906,
      "grad_norm": 0.6970445419616919,
      "learning_rate": 2.2878036512036775e-05,
      "loss": 0.9485,
      "num_input_tokens_seen": 46941618880,
      "step": 59664
    },
    {
      "epoch": 6.3298323785274775,
      "grad_norm": 0.8421984752900252,
      "learning_rate": 2.2877344051966494e-05,
      "loss": 1.0364,
      "num_input_tokens_seen": 46942405552,
      "step": 59665
    },
    {
      "epoch": 6.3299384680670485,
      "grad_norm": 0.8935225186505497,
      "learning_rate": 2.287665159353654e-05,
      "loss": 1.0241,
      "num_input_tokens_seen": 46943192320,
      "step": 59666
    },
    {
      "epoch": 6.3300445576066195,
      "grad_norm": 0.7131431793368803,
      "learning_rate": 2.2875959136747442e-05,
      "loss": 0.9489,
      "num_input_tokens_seen": 46943979104,
      "step": 59667
    },
    {
      "epoch": 6.3301506471461915,
      "grad_norm": 0.8112635593807284,
      "learning_rate": 2.2875266681599747e-05,
      "loss": 1.0071,
      "num_input_tokens_seen": 46944765888,
      "step": 59668
    },
    {
      "epoch": 6.3302567366857625,
      "grad_norm": 0.678703203501613,
      "learning_rate": 2.2874574228093984e-05,
      "loss": 1.0254,
      "num_input_tokens_seen": 46945552656,
      "step": 59669
    },
    {
      "epoch": 6.330362826225334,
      "grad_norm": 0.8679281175544674,
      "learning_rate": 2.2873881776230682e-05,
      "loss": 1.0343,
      "num_input_tokens_seen": 46946339376,
      "step": 59670
    },
    {
      "epoch": 6.3304689157649054,
      "grad_norm": 0.9175917972455558,
      "learning_rate": 2.2873189326010387e-05,
      "loss": 1.021,
      "num_input_tokens_seen": 46947126160,
      "step": 59671
    },
    {
      "epoch": 6.330575005304477,
      "grad_norm": 0.9367939583164253,
      "learning_rate": 2.287249687743363e-05,
      "loss": 0.9818,
      "num_input_tokens_seen": 46947912960,
      "step": 59672
    },
    {
      "epoch": 6.330681094844048,
      "grad_norm": 0.7401259498022293,
      "learning_rate": 2.2871804430500936e-05,
      "loss": 1.0593,
      "num_input_tokens_seen": 46948699808,
      "step": 59673
    },
    {
      "epoch": 6.330787184383619,
      "grad_norm": 0.8746016903487047,
      "learning_rate": 2.287111198521286e-05,
      "loss": 1.0145,
      "num_input_tokens_seen": 46949486480,
      "step": 59674
    },
    {
      "epoch": 6.330893273923191,
      "grad_norm": 0.7692160269650706,
      "learning_rate": 2.287041954156992e-05,
      "loss": 0.9717,
      "num_input_tokens_seen": 46950273216,
      "step": 59675
    },
    {
      "epoch": 6.330999363462762,
      "grad_norm": 0.5911859546890643,
      "learning_rate": 2.2869727099572656e-05,
      "loss": 0.9531,
      "num_input_tokens_seen": 46951060048,
      "step": 59676
    },
    {
      "epoch": 6.331105453002334,
      "grad_norm": 0.8678844188749598,
      "learning_rate": 2.286903465922161e-05,
      "loss": 1.0121,
      "num_input_tokens_seen": 46951846784,
      "step": 59677
    },
    {
      "epoch": 6.331211542541905,
      "grad_norm": 0.750351313129371,
      "learning_rate": 2.286834222051731e-05,
      "loss": 0.9381,
      "num_input_tokens_seen": 46952633648,
      "step": 59678
    },
    {
      "epoch": 6.331317632081476,
      "grad_norm": 0.7387374961467469,
      "learning_rate": 2.2867649783460287e-05,
      "loss": 0.9664,
      "num_input_tokens_seen": 46953420464,
      "step": 59679
    },
    {
      "epoch": 6.331423721621048,
      "grad_norm": 0.6985733547077058,
      "learning_rate": 2.286695734805109e-05,
      "loss": 0.9396,
      "num_input_tokens_seen": 46954207312,
      "step": 59680
    },
    {
      "epoch": 6.331529811160619,
      "grad_norm": 0.7165091617336704,
      "learning_rate": 2.2866264914290243e-05,
      "loss": 1.0114,
      "num_input_tokens_seen": 46954994112,
      "step": 59681
    },
    {
      "epoch": 6.331635900700191,
      "grad_norm": 0.7634799407451097,
      "learning_rate": 2.2865572482178276e-05,
      "loss": 1.0387,
      "num_input_tokens_seen": 46955780976,
      "step": 59682
    },
    {
      "epoch": 6.331741990239762,
      "grad_norm": 0.9016349670837286,
      "learning_rate": 2.2864880051715743e-05,
      "loss": 1.0346,
      "num_input_tokens_seen": 46956567648,
      "step": 59683
    },
    {
      "epoch": 6.331848079779334,
      "grad_norm": 0.757721256455072,
      "learning_rate": 2.286418762290316e-05,
      "loss": 0.9876,
      "num_input_tokens_seen": 46957354416,
      "step": 59684
    },
    {
      "epoch": 6.331954169318905,
      "grad_norm": 0.7619415592085337,
      "learning_rate": 2.2863495195741076e-05,
      "loss": 0.9962,
      "num_input_tokens_seen": 46958141168,
      "step": 59685
    },
    {
      "epoch": 6.332060258858476,
      "grad_norm": 0.9095298814883694,
      "learning_rate": 2.286280277023002e-05,
      "loss": 0.9656,
      "num_input_tokens_seen": 46958927936,
      "step": 59686
    },
    {
      "epoch": 6.332166348398048,
      "grad_norm": 0.8820170802238285,
      "learning_rate": 2.2862110346370522e-05,
      "loss": 1.0047,
      "num_input_tokens_seen": 46959714704,
      "step": 59687
    },
    {
      "epoch": 6.332272437937619,
      "grad_norm": 0.823719121673778,
      "learning_rate": 2.2861417924163125e-05,
      "loss": 1.0467,
      "num_input_tokens_seen": 46960501424,
      "step": 59688
    },
    {
      "epoch": 6.332378527477191,
      "grad_norm": 0.9018051592267889,
      "learning_rate": 2.2860725503608366e-05,
      "loss": 1.0798,
      "num_input_tokens_seen": 46961288224,
      "step": 59689
    },
    {
      "epoch": 6.332484617016762,
      "grad_norm": 0.8988675921582354,
      "learning_rate": 2.2860033084706766e-05,
      "loss": 0.9665,
      "num_input_tokens_seen": 46962075008,
      "step": 59690
    },
    {
      "epoch": 6.332590706556333,
      "grad_norm": 0.8539800808383708,
      "learning_rate": 2.285934066745888e-05,
      "loss": 0.9869,
      "num_input_tokens_seen": 46962861728,
      "step": 59691
    },
    {
      "epoch": 6.332696796095905,
      "grad_norm": 1.1465990959541583,
      "learning_rate": 2.285864825186523e-05,
      "loss": 1.041,
      "num_input_tokens_seen": 46963648336,
      "step": 59692
    },
    {
      "epoch": 6.332802885635476,
      "grad_norm": 0.6262289294989908,
      "learning_rate": 2.2857955837926344e-05,
      "loss": 0.9489,
      "num_input_tokens_seen": 46964435136,
      "step": 59693
    },
    {
      "epoch": 6.332908975175048,
      "grad_norm": 0.7922234159375217,
      "learning_rate": 2.2857263425642778e-05,
      "loss": 1.0348,
      "num_input_tokens_seen": 46965221904,
      "step": 59694
    },
    {
      "epoch": 6.333015064714619,
      "grad_norm": 0.8919105665444793,
      "learning_rate": 2.2856571015015056e-05,
      "loss": 1.0235,
      "num_input_tokens_seen": 46966008656,
      "step": 59695
    },
    {
      "epoch": 6.33312115425419,
      "grad_norm": 0.7742373335973974,
      "learning_rate": 2.2855878606043704e-05,
      "loss": 1.031,
      "num_input_tokens_seen": 46966795376,
      "step": 59696
    },
    {
      "epoch": 6.333227243793762,
      "grad_norm": 0.6502771967979785,
      "learning_rate": 2.2855186198729277e-05,
      "loss": 1.0477,
      "num_input_tokens_seen": 46967582160,
      "step": 59697
    },
    {
      "epoch": 6.333333333333333,
      "grad_norm": 0.8921192709894233,
      "learning_rate": 2.2854493793072294e-05,
      "loss": 1.0896,
      "num_input_tokens_seen": 46968368944,
      "step": 59698
    },
    {
      "epoch": 6.333439422872905,
      "grad_norm": 0.7137374807843838,
      "learning_rate": 2.2853801389073286e-05,
      "loss": 1.0139,
      "num_input_tokens_seen": 46969155808,
      "step": 59699
    },
    {
      "epoch": 6.333545512412476,
      "grad_norm": 0.9856807964359598,
      "learning_rate": 2.2853108986732802e-05,
      "loss": 1.025,
      "num_input_tokens_seen": 46969942512,
      "step": 59700
    },
    {
      "epoch": 6.333651601952048,
      "grad_norm": 0.7481871570123321,
      "learning_rate": 2.2852416586051378e-05,
      "loss": 0.9985,
      "num_input_tokens_seen": 46970729280,
      "step": 59701
    },
    {
      "epoch": 6.333757691491619,
      "grad_norm": 0.7500153542055634,
      "learning_rate": 2.2851724187029546e-05,
      "loss": 1.0218,
      "num_input_tokens_seen": 46971516128,
      "step": 59702
    },
    {
      "epoch": 6.33386378103119,
      "grad_norm": 0.7602480480494396,
      "learning_rate": 2.285103178966783e-05,
      "loss": 1.0455,
      "num_input_tokens_seen": 46972302896,
      "step": 59703
    },
    {
      "epoch": 6.333969870570762,
      "grad_norm": 1.240092730132222,
      "learning_rate": 2.285033939396678e-05,
      "loss": 1.0568,
      "num_input_tokens_seen": 46973089712,
      "step": 59704
    },
    {
      "epoch": 6.334075960110333,
      "grad_norm": 0.9453210695454006,
      "learning_rate": 2.2849646999926922e-05,
      "loss": 1.0116,
      "num_input_tokens_seen": 46973876384,
      "step": 59705
    },
    {
      "epoch": 6.334182049649905,
      "grad_norm": 1.0207727661349657,
      "learning_rate": 2.2848954607548796e-05,
      "loss": 1.0542,
      "num_input_tokens_seen": 46974663152,
      "step": 59706
    },
    {
      "epoch": 6.334288139189476,
      "grad_norm": 0.8072479428733682,
      "learning_rate": 2.2848262216832932e-05,
      "loss": 1.0632,
      "num_input_tokens_seen": 46975449984,
      "step": 59707
    },
    {
      "epoch": 6.334394228729048,
      "grad_norm": 0.7053576641788813,
      "learning_rate": 2.2847569827779868e-05,
      "loss": 0.9728,
      "num_input_tokens_seen": 46976236624,
      "step": 59708
    },
    {
      "epoch": 6.334500318268619,
      "grad_norm": 0.8150479573460453,
      "learning_rate": 2.284687744039014e-05,
      "loss": 1.0319,
      "num_input_tokens_seen": 46977023392,
      "step": 59709
    },
    {
      "epoch": 6.33460640780819,
      "grad_norm": 0.7042995893730312,
      "learning_rate": 2.2846185054664288e-05,
      "loss": 1.0293,
      "num_input_tokens_seen": 46977810192,
      "step": 59710
    },
    {
      "epoch": 6.334712497347762,
      "grad_norm": 0.7092633597163525,
      "learning_rate": 2.284549267060283e-05,
      "loss": 0.9616,
      "num_input_tokens_seen": 46978597040,
      "step": 59711
    },
    {
      "epoch": 6.334818586887333,
      "grad_norm": 0.8601618579375857,
      "learning_rate": 2.284480028820632e-05,
      "loss": 0.973,
      "num_input_tokens_seen": 46979383728,
      "step": 59712
    },
    {
      "epoch": 6.334924676426905,
      "grad_norm": 0.6668205586458272,
      "learning_rate": 2.2844107907475283e-05,
      "loss": 0.9641,
      "num_input_tokens_seen": 46980170464,
      "step": 59713
    },
    {
      "epoch": 6.335030765966476,
      "grad_norm": 0.9578183271254164,
      "learning_rate": 2.2843415528410252e-05,
      "loss": 1.0802,
      "num_input_tokens_seen": 46980957152,
      "step": 59714
    },
    {
      "epoch": 6.335136855506047,
      "grad_norm": 0.9310244515849773,
      "learning_rate": 2.2842723151011772e-05,
      "loss": 0.9987,
      "num_input_tokens_seen": 46981743968,
      "step": 59715
    },
    {
      "epoch": 6.335242945045619,
      "grad_norm": 0.8666174258958689,
      "learning_rate": 2.284203077528037e-05,
      "loss": 0.9749,
      "num_input_tokens_seen": 46982530768,
      "step": 59716
    },
    {
      "epoch": 6.33534903458519,
      "grad_norm": 0.7281528969155727,
      "learning_rate": 2.284133840121658e-05,
      "loss": 0.9996,
      "num_input_tokens_seen": 46983317488,
      "step": 59717
    },
    {
      "epoch": 6.335455124124762,
      "grad_norm": 0.735360833329443,
      "learning_rate": 2.284064602882095e-05,
      "loss": 1.0665,
      "num_input_tokens_seen": 46984104272,
      "step": 59718
    },
    {
      "epoch": 6.335561213664333,
      "grad_norm": 0.7133102224121863,
      "learning_rate": 2.2839953658093998e-05,
      "loss": 1.0047,
      "num_input_tokens_seen": 46984891072,
      "step": 59719
    },
    {
      "epoch": 6.335667303203904,
      "grad_norm": 0.7302862880436032,
      "learning_rate": 2.283926128903626e-05,
      "loss": 0.9329,
      "num_input_tokens_seen": 46985677808,
      "step": 59720
    },
    {
      "epoch": 6.335773392743476,
      "grad_norm": 0.7001922919945819,
      "learning_rate": 2.283856892164829e-05,
      "loss": 1.0445,
      "num_input_tokens_seen": 46986464496,
      "step": 59721
    },
    {
      "epoch": 6.335879482283047,
      "grad_norm": 0.8644910859610719,
      "learning_rate": 2.28378765559306e-05,
      "loss": 1.0891,
      "num_input_tokens_seen": 46987251216,
      "step": 59722
    },
    {
      "epoch": 6.335985571822619,
      "grad_norm": 0.8273408316414397,
      "learning_rate": 2.2837184191883745e-05,
      "loss": 0.9478,
      "num_input_tokens_seen": 46988037952,
      "step": 59723
    },
    {
      "epoch": 6.33609166136219,
      "grad_norm": 0.7627650233120119,
      "learning_rate": 2.2836491829508248e-05,
      "loss": 1.0693,
      "num_input_tokens_seen": 46988824672,
      "step": 59724
    },
    {
      "epoch": 6.336197750901761,
      "grad_norm": 0.8283075681194195,
      "learning_rate": 2.283579946880464e-05,
      "loss": 1.0592,
      "num_input_tokens_seen": 46989611392,
      "step": 59725
    },
    {
      "epoch": 6.3363038404413325,
      "grad_norm": 0.7347978996869745,
      "learning_rate": 2.283510710977347e-05,
      "loss": 1.0635,
      "num_input_tokens_seen": 46990398176,
      "step": 59726
    },
    {
      "epoch": 6.336409929980904,
      "grad_norm": 0.9892550062189512,
      "learning_rate": 2.283441475241527e-05,
      "loss": 1.0162,
      "num_input_tokens_seen": 46991184944,
      "step": 59727
    },
    {
      "epoch": 6.3365160195204755,
      "grad_norm": 0.7386555798696989,
      "learning_rate": 2.2833722396730556e-05,
      "loss": 1.03,
      "num_input_tokens_seen": 46991971568,
      "step": 59728
    },
    {
      "epoch": 6.3366221090600465,
      "grad_norm": 0.871523450081254,
      "learning_rate": 2.283303004271989e-05,
      "loss": 1.0993,
      "num_input_tokens_seen": 46992758256,
      "step": 59729
    },
    {
      "epoch": 6.3367281985996184,
      "grad_norm": 0.6836207159790008,
      "learning_rate": 2.283233769038379e-05,
      "loss": 0.9511,
      "num_input_tokens_seen": 46993545088,
      "step": 59730
    },
    {
      "epoch": 6.3368342881391895,
      "grad_norm": 0.8578216806774247,
      "learning_rate": 2.2831645339722797e-05,
      "loss": 0.9717,
      "num_input_tokens_seen": 46994331872,
      "step": 59731
    },
    {
      "epoch": 6.3369403776787605,
      "grad_norm": 0.7235839607415379,
      "learning_rate": 2.2830952990737444e-05,
      "loss": 1.1007,
      "num_input_tokens_seen": 46995118656,
      "step": 59732
    },
    {
      "epoch": 6.337046467218332,
      "grad_norm": 0.913310135284939,
      "learning_rate": 2.283026064342827e-05,
      "loss": 1.0408,
      "num_input_tokens_seen": 46995905376,
      "step": 59733
    },
    {
      "epoch": 6.3371525567579035,
      "grad_norm": 0.773104709802231,
      "learning_rate": 2.28295682977958e-05,
      "loss": 1.0007,
      "num_input_tokens_seen": 46996692160,
      "step": 59734
    },
    {
      "epoch": 6.337258646297475,
      "grad_norm": 0.7151254544590588,
      "learning_rate": 2.2828875953840582e-05,
      "loss": 0.882,
      "num_input_tokens_seen": 46997478960,
      "step": 59735
    },
    {
      "epoch": 6.337364735837046,
      "grad_norm": 0.7706797141984809,
      "learning_rate": 2.2828183611563144e-05,
      "loss": 0.9759,
      "num_input_tokens_seen": 46998265696,
      "step": 59736
    },
    {
      "epoch": 6.337470825376618,
      "grad_norm": 0.9311109227918484,
      "learning_rate": 2.282749127096402e-05,
      "loss": 1.0432,
      "num_input_tokens_seen": 46999052448,
      "step": 59737
    },
    {
      "epoch": 6.337576914916189,
      "grad_norm": 0.7698208170696248,
      "learning_rate": 2.282679893204375e-05,
      "loss": 1.0366,
      "num_input_tokens_seen": 46999839248,
      "step": 59738
    },
    {
      "epoch": 6.33768300445576,
      "grad_norm": 0.6956200030062798,
      "learning_rate": 2.282610659480286e-05,
      "loss": 0.9305,
      "num_input_tokens_seen": 47000626080,
      "step": 59739
    },
    {
      "epoch": 6.337789093995332,
      "grad_norm": 0.8064118806433539,
      "learning_rate": 2.2825414259241896e-05,
      "loss": 0.9413,
      "num_input_tokens_seen": 47001412896,
      "step": 59740
    },
    {
      "epoch": 6.337895183534903,
      "grad_norm": 0.7381567662708239,
      "learning_rate": 2.282472192536139e-05,
      "loss": 0.907,
      "num_input_tokens_seen": 47002199856,
      "step": 59741
    },
    {
      "epoch": 6.338001273074475,
      "grad_norm": 0.8436583819713191,
      "learning_rate": 2.282402959316187e-05,
      "loss": 1.0377,
      "num_input_tokens_seen": 47002986720,
      "step": 59742
    },
    {
      "epoch": 6.338107362614046,
      "grad_norm": 1.0224047999650971,
      "learning_rate": 2.282333726264388e-05,
      "loss": 1.0589,
      "num_input_tokens_seen": 47003773440,
      "step": 59743
    },
    {
      "epoch": 6.338213452153617,
      "grad_norm": 0.9424260797608656,
      "learning_rate": 2.282264493380795e-05,
      "loss": 0.9789,
      "num_input_tokens_seen": 47004560144,
      "step": 59744
    },
    {
      "epoch": 6.338319541693189,
      "grad_norm": 0.6398029200068283,
      "learning_rate": 2.282195260665461e-05,
      "loss": 0.9761,
      "num_input_tokens_seen": 47005346928,
      "step": 59745
    },
    {
      "epoch": 6.33842563123276,
      "grad_norm": 0.9482006872775299,
      "learning_rate": 2.2821260281184413e-05,
      "loss": 1.086,
      "num_input_tokens_seen": 47006133696,
      "step": 59746
    },
    {
      "epoch": 6.338531720772332,
      "grad_norm": 0.8962494827406703,
      "learning_rate": 2.2820567957397877e-05,
      "loss": 1.029,
      "num_input_tokens_seen": 47006920384,
      "step": 59747
    },
    {
      "epoch": 6.338637810311903,
      "grad_norm": 0.6840344848166986,
      "learning_rate": 2.2819875635295537e-05,
      "loss": 1.0164,
      "num_input_tokens_seen": 47007707216,
      "step": 59748
    },
    {
      "epoch": 6.338743899851474,
      "grad_norm": 0.8010022777885136,
      "learning_rate": 2.2819183314877935e-05,
      "loss": 1.0042,
      "num_input_tokens_seen": 47008494032,
      "step": 59749
    },
    {
      "epoch": 6.338849989391046,
      "grad_norm": 0.8356960952379475,
      "learning_rate": 2.281849099614561e-05,
      "loss": 0.9853,
      "num_input_tokens_seen": 47009280848,
      "step": 59750
    },
    {
      "epoch": 6.338956078930617,
      "grad_norm": 0.6776793949144924,
      "learning_rate": 2.2817798679099085e-05,
      "loss": 0.8946,
      "num_input_tokens_seen": 47010067616,
      "step": 59751
    },
    {
      "epoch": 6.339062168470189,
      "grad_norm": 0.6923701336330697,
      "learning_rate": 2.2817106363738904e-05,
      "loss": 0.9075,
      "num_input_tokens_seen": 47010854400,
      "step": 59752
    },
    {
      "epoch": 6.33916825800976,
      "grad_norm": 1.1901856287933927,
      "learning_rate": 2.2816414050065596e-05,
      "loss": 0.9978,
      "num_input_tokens_seen": 47011641184,
      "step": 59753
    },
    {
      "epoch": 6.339274347549331,
      "grad_norm": 0.8487487796548848,
      "learning_rate": 2.2815721738079706e-05,
      "loss": 0.9494,
      "num_input_tokens_seen": 47012427968,
      "step": 59754
    },
    {
      "epoch": 6.339380437088903,
      "grad_norm": 0.8315394798434194,
      "learning_rate": 2.281502942778176e-05,
      "loss": 0.9891,
      "num_input_tokens_seen": 47013214784,
      "step": 59755
    },
    {
      "epoch": 6.339486526628474,
      "grad_norm": 0.723163803670169,
      "learning_rate": 2.2814337119172288e-05,
      "loss": 1.0395,
      "num_input_tokens_seen": 47014001616,
      "step": 59756
    },
    {
      "epoch": 6.339592616168046,
      "grad_norm": 0.6997127026956785,
      "learning_rate": 2.2813644812251838e-05,
      "loss": 1.0808,
      "num_input_tokens_seen": 47014788288,
      "step": 59757
    },
    {
      "epoch": 6.339698705707617,
      "grad_norm": 0.7015169183501314,
      "learning_rate": 2.281295250702094e-05,
      "loss": 1.0182,
      "num_input_tokens_seen": 47015575120,
      "step": 59758
    },
    {
      "epoch": 6.339804795247189,
      "grad_norm": 0.9034484998095949,
      "learning_rate": 2.2812260203480125e-05,
      "loss": 0.9556,
      "num_input_tokens_seen": 47016361744,
      "step": 59759
    },
    {
      "epoch": 6.33991088478676,
      "grad_norm": 0.752405580070798,
      "learning_rate": 2.2811567901629936e-05,
      "loss": 1.0158,
      "num_input_tokens_seen": 47017148624,
      "step": 59760
    },
    {
      "epoch": 6.340016974326331,
      "grad_norm": 0.8139334090175167,
      "learning_rate": 2.28108756014709e-05,
      "loss": 1.0164,
      "num_input_tokens_seen": 47017935456,
      "step": 59761
    },
    {
      "epoch": 6.340123063865903,
      "grad_norm": 1.4592449286695455,
      "learning_rate": 2.281018330300355e-05,
      "loss": 0.8987,
      "num_input_tokens_seen": 47018722304,
      "step": 59762
    },
    {
      "epoch": 6.340229153405474,
      "grad_norm": 0.800574287240834,
      "learning_rate": 2.2809491006228434e-05,
      "loss": 1.0514,
      "num_input_tokens_seen": 47019509008,
      "step": 59763
    },
    {
      "epoch": 6.340335242945046,
      "grad_norm": 0.9518196373953284,
      "learning_rate": 2.280879871114608e-05,
      "loss": 1.0385,
      "num_input_tokens_seen": 47020295792,
      "step": 59764
    },
    {
      "epoch": 6.340441332484617,
      "grad_norm": 0.8779884550449457,
      "learning_rate": 2.2808106417757015e-05,
      "loss": 1.0048,
      "num_input_tokens_seen": 47021082512,
      "step": 59765
    },
    {
      "epoch": 6.340547422024189,
      "grad_norm": 0.97200987307231,
      "learning_rate": 2.2807414126061785e-05,
      "loss": 0.998,
      "num_input_tokens_seen": 47021869280,
      "step": 59766
    },
    {
      "epoch": 6.34065351156376,
      "grad_norm": 0.7807111742446611,
      "learning_rate": 2.280672183606092e-05,
      "loss": 0.9303,
      "num_input_tokens_seen": 47022656048,
      "step": 59767
    },
    {
      "epoch": 6.340759601103331,
      "grad_norm": 0.7645783248359685,
      "learning_rate": 2.2806029547754954e-05,
      "loss": 0.9725,
      "num_input_tokens_seen": 47023442832,
      "step": 59768
    },
    {
      "epoch": 6.340865690642903,
      "grad_norm": 1.1073954903771688,
      "learning_rate": 2.2805337261144426e-05,
      "loss": 1.0141,
      "num_input_tokens_seen": 47024229616,
      "step": 59769
    },
    {
      "epoch": 6.340971780182474,
      "grad_norm": 0.8186957614060841,
      "learning_rate": 2.280464497622987e-05,
      "loss": 1.0273,
      "num_input_tokens_seen": 47025016304,
      "step": 59770
    },
    {
      "epoch": 6.341077869722046,
      "grad_norm": 1.1834928300049288,
      "learning_rate": 2.280395269301182e-05,
      "loss": 1.0586,
      "num_input_tokens_seen": 47025802960,
      "step": 59771
    },
    {
      "epoch": 6.341183959261617,
      "grad_norm": 0.8912548322871242,
      "learning_rate": 2.280326041149081e-05,
      "loss": 1.0851,
      "num_input_tokens_seen": 47026589712,
      "step": 59772
    },
    {
      "epoch": 6.341290048801188,
      "grad_norm": 0.8314500389687512,
      "learning_rate": 2.2802568131667372e-05,
      "loss": 1.0636,
      "num_input_tokens_seen": 47027376400,
      "step": 59773
    },
    {
      "epoch": 6.34139613834076,
      "grad_norm": 1.073876645039867,
      "learning_rate": 2.280187585354205e-05,
      "loss": 1.0871,
      "num_input_tokens_seen": 47028163216,
      "step": 59774
    },
    {
      "epoch": 6.341502227880331,
      "grad_norm": 0.6973560866142912,
      "learning_rate": 2.2801183577115376e-05,
      "loss": 0.9277,
      "num_input_tokens_seen": 47028949952,
      "step": 59775
    },
    {
      "epoch": 6.341608317419903,
      "grad_norm": 0.6700325754109303,
      "learning_rate": 2.2800491302387877e-05,
      "loss": 0.9999,
      "num_input_tokens_seen": 47029736736,
      "step": 59776
    },
    {
      "epoch": 6.341714406959474,
      "grad_norm": 0.8536157464424681,
      "learning_rate": 2.27997990293601e-05,
      "loss": 1.016,
      "num_input_tokens_seen": 47030523504,
      "step": 59777
    },
    {
      "epoch": 6.341820496499045,
      "grad_norm": 0.8534037602120862,
      "learning_rate": 2.279910675803257e-05,
      "loss": 0.9856,
      "num_input_tokens_seen": 47031310240,
      "step": 59778
    },
    {
      "epoch": 6.341926586038617,
      "grad_norm": 1.1880673010922445,
      "learning_rate": 2.279841448840582e-05,
      "loss": 1.003,
      "num_input_tokens_seen": 47032096960,
      "step": 59779
    },
    {
      "epoch": 6.342032675578188,
      "grad_norm": 0.7101446605615641,
      "learning_rate": 2.27977222204804e-05,
      "loss": 0.984,
      "num_input_tokens_seen": 47032883696,
      "step": 59780
    },
    {
      "epoch": 6.34213876511776,
      "grad_norm": 0.9078630884834427,
      "learning_rate": 2.2797029954256834e-05,
      "loss": 1.0643,
      "num_input_tokens_seen": 47033670512,
      "step": 59781
    },
    {
      "epoch": 6.342244854657331,
      "grad_norm": 0.6703699078473234,
      "learning_rate": 2.2796337689735654e-05,
      "loss": 0.9708,
      "num_input_tokens_seen": 47034457312,
      "step": 59782
    },
    {
      "epoch": 6.342350944196903,
      "grad_norm": 0.8086987432065081,
      "learning_rate": 2.2795645426917405e-05,
      "loss": 0.9656,
      "num_input_tokens_seen": 47035244240,
      "step": 59783
    },
    {
      "epoch": 6.342457033736474,
      "grad_norm": 0.76674713171806,
      "learning_rate": 2.2794953165802616e-05,
      "loss": 0.9769,
      "num_input_tokens_seen": 47036031024,
      "step": 59784
    },
    {
      "epoch": 6.342563123276045,
      "grad_norm": 0.6776453885310856,
      "learning_rate": 2.2794260906391814e-05,
      "loss": 0.9975,
      "num_input_tokens_seen": 47036817664,
      "step": 59785
    },
    {
      "epoch": 6.342669212815617,
      "grad_norm": 0.7422698620549246,
      "learning_rate": 2.279356864868555e-05,
      "loss": 1.0784,
      "num_input_tokens_seen": 47037604384,
      "step": 59786
    },
    {
      "epoch": 6.342775302355188,
      "grad_norm": 0.8907213036661009,
      "learning_rate": 2.2792876392684347e-05,
      "loss": 1.0321,
      "num_input_tokens_seen": 47038391184,
      "step": 59787
    },
    {
      "epoch": 6.3428813918947595,
      "grad_norm": 0.732107943290292,
      "learning_rate": 2.279218413838875e-05,
      "loss": 0.9774,
      "num_input_tokens_seen": 47039178016,
      "step": 59788
    },
    {
      "epoch": 6.3429874814343306,
      "grad_norm": 0.689968519890235,
      "learning_rate": 2.2791491885799286e-05,
      "loss": 1.0457,
      "num_input_tokens_seen": 47039964784,
      "step": 59789
    },
    {
      "epoch": 6.343093570973902,
      "grad_norm": 1.2089503401820916,
      "learning_rate": 2.279079963491649e-05,
      "loss": 1.0615,
      "num_input_tokens_seen": 47040751520,
      "step": 59790
    },
    {
      "epoch": 6.3431996605134735,
      "grad_norm": 0.7888030482975034,
      "learning_rate": 2.2790107385740905e-05,
      "loss": 1.0338,
      "num_input_tokens_seen": 47041538304,
      "step": 59791
    },
    {
      "epoch": 6.3433057500530445,
      "grad_norm": 0.8753412747859917,
      "learning_rate": 2.2789415138273057e-05,
      "loss": 1.0181,
      "num_input_tokens_seen": 47042325040,
      "step": 59792
    },
    {
      "epoch": 6.3434118395926165,
      "grad_norm": 1.2190069113158681,
      "learning_rate": 2.278872289251348e-05,
      "loss": 1.0504,
      "num_input_tokens_seen": 47043111856,
      "step": 59793
    },
    {
      "epoch": 6.3435179291321875,
      "grad_norm": 0.9923229098032913,
      "learning_rate": 2.2788030648462707e-05,
      "loss": 1.0392,
      "num_input_tokens_seen": 47043898592,
      "step": 59794
    },
    {
      "epoch": 6.343624018671759,
      "grad_norm": 1.2765656937911591,
      "learning_rate": 2.2787338406121292e-05,
      "loss": 0.9438,
      "num_input_tokens_seen": 47044685376,
      "step": 59795
    },
    {
      "epoch": 6.34373010821133,
      "grad_norm": 1.6181849167314275,
      "learning_rate": 2.2786646165489755e-05,
      "loss": 0.9716,
      "num_input_tokens_seen": 47045472208,
      "step": 59796
    },
    {
      "epoch": 6.3438361977509015,
      "grad_norm": 0.9969692396389672,
      "learning_rate": 2.278595392656863e-05,
      "loss": 1.0465,
      "num_input_tokens_seen": 47046258992,
      "step": 59797
    },
    {
      "epoch": 6.343942287290473,
      "grad_norm": 0.8858518340339243,
      "learning_rate": 2.2785261689358455e-05,
      "loss": 1.0508,
      "num_input_tokens_seen": 47047045712,
      "step": 59798
    },
    {
      "epoch": 6.344048376830044,
      "grad_norm": 1.413993005666299,
      "learning_rate": 2.278456945385977e-05,
      "loss": 0.9732,
      "num_input_tokens_seen": 47047832448,
      "step": 59799
    },
    {
      "epoch": 6.344154466369616,
      "grad_norm": 1.0724188335430755,
      "learning_rate": 2.2783877220073096e-05,
      "loss": 1.0813,
      "num_input_tokens_seen": 47048619232,
      "step": 59800
    },
    {
      "epoch": 6.344260555909187,
      "grad_norm": 0.9240369419270783,
      "learning_rate": 2.2783184987998984e-05,
      "loss": 1.0412,
      "num_input_tokens_seen": 47049406032,
      "step": 59801
    },
    {
      "epoch": 6.344366645448758,
      "grad_norm": 1.0505818171174386,
      "learning_rate": 2.2782492757637963e-05,
      "loss": 1.017,
      "num_input_tokens_seen": 47050192848,
      "step": 59802
    },
    {
      "epoch": 6.34447273498833,
      "grad_norm": 1.2727760234866832,
      "learning_rate": 2.2781800528990557e-05,
      "loss": 0.986,
      "num_input_tokens_seen": 47050979664,
      "step": 59803
    },
    {
      "epoch": 6.344578824527901,
      "grad_norm": 0.7208729826114741,
      "learning_rate": 2.278110830205732e-05,
      "loss": 1.0157,
      "num_input_tokens_seen": 47051766496,
      "step": 59804
    },
    {
      "epoch": 6.344684914067473,
      "grad_norm": 0.9034907295480622,
      "learning_rate": 2.2780416076838777e-05,
      "loss": 1.0236,
      "num_input_tokens_seen": 47052553280,
      "step": 59805
    },
    {
      "epoch": 6.344791003607044,
      "grad_norm": 0.777165521570741,
      "learning_rate": 2.2779723853335456e-05,
      "loss": 0.8955,
      "num_input_tokens_seen": 47053339984,
      "step": 59806
    },
    {
      "epoch": 6.344897093146615,
      "grad_norm": 1.2534952721940151,
      "learning_rate": 2.2779031631547902e-05,
      "loss": 1.0369,
      "num_input_tokens_seen": 47054126784,
      "step": 59807
    },
    {
      "epoch": 6.345003182686187,
      "grad_norm": 0.9611996856139581,
      "learning_rate": 2.2778339411476644e-05,
      "loss": 0.9286,
      "num_input_tokens_seen": 47054913536,
      "step": 59808
    },
    {
      "epoch": 6.345109272225758,
      "grad_norm": 0.9839469815883909,
      "learning_rate": 2.277764719312223e-05,
      "loss": 0.9895,
      "num_input_tokens_seen": 47055700352,
      "step": 59809
    },
    {
      "epoch": 6.34521536176533,
      "grad_norm": 0.7734836685569085,
      "learning_rate": 2.277695497648518e-05,
      "loss": 1.0203,
      "num_input_tokens_seen": 47056487104,
      "step": 59810
    },
    {
      "epoch": 6.345321451304901,
      "grad_norm": 0.8091042221742656,
      "learning_rate": 2.2776262761566032e-05,
      "loss": 1.0099,
      "num_input_tokens_seen": 47057273920,
      "step": 59811
    },
    {
      "epoch": 6.345427540844473,
      "grad_norm": 0.9571595930826139,
      "learning_rate": 2.2775570548365326e-05,
      "loss": 1.0806,
      "num_input_tokens_seen": 47058060704,
      "step": 59812
    },
    {
      "epoch": 6.345533630384044,
      "grad_norm": 1.0555656133291038,
      "learning_rate": 2.277487833688359e-05,
      "loss": 1.0164,
      "num_input_tokens_seen": 47058847408,
      "step": 59813
    },
    {
      "epoch": 6.345639719923615,
      "grad_norm": 0.9669668325888503,
      "learning_rate": 2.2774186127121364e-05,
      "loss": 1.0154,
      "num_input_tokens_seen": 47059634224,
      "step": 59814
    },
    {
      "epoch": 6.345745809463187,
      "grad_norm": 0.7217024848268029,
      "learning_rate": 2.2773493919079183e-05,
      "loss": 0.9592,
      "num_input_tokens_seen": 47060421040,
      "step": 59815
    },
    {
      "epoch": 6.345851899002758,
      "grad_norm": 1.0848087346876438,
      "learning_rate": 2.2772801712757584e-05,
      "loss": 0.9602,
      "num_input_tokens_seen": 47061207920,
      "step": 59816
    },
    {
      "epoch": 6.34595798854233,
      "grad_norm": 0.7245027673504607,
      "learning_rate": 2.277210950815709e-05,
      "loss": 1.0736,
      "num_input_tokens_seen": 47061994608,
      "step": 59817
    },
    {
      "epoch": 6.346064078081901,
      "grad_norm": 0.8589577410414596,
      "learning_rate": 2.277141730527825e-05,
      "loss": 1.0275,
      "num_input_tokens_seen": 47062781344,
      "step": 59818
    },
    {
      "epoch": 6.346170167621472,
      "grad_norm": 1.0049533093029788,
      "learning_rate": 2.2770725104121597e-05,
      "loss": 1.0024,
      "num_input_tokens_seen": 47063568128,
      "step": 59819
    },
    {
      "epoch": 6.346276257161044,
      "grad_norm": 1.3992454637065599,
      "learning_rate": 2.2770032904687652e-05,
      "loss": 1.0458,
      "num_input_tokens_seen": 47064354832,
      "step": 59820
    },
    {
      "epoch": 6.346382346700615,
      "grad_norm": 0.8245639255305198,
      "learning_rate": 2.276934070697697e-05,
      "loss": 0.9671,
      "num_input_tokens_seen": 47065141616,
      "step": 59821
    },
    {
      "epoch": 6.346488436240187,
      "grad_norm": 0.9777093386835614,
      "learning_rate": 2.276864851099007e-05,
      "loss": 1.0126,
      "num_input_tokens_seen": 47065928208,
      "step": 59822
    },
    {
      "epoch": 6.346594525779758,
      "grad_norm": 1.6527880259753547,
      "learning_rate": 2.2767956316727492e-05,
      "loss": 1.0304,
      "num_input_tokens_seen": 47066715024,
      "step": 59823
    },
    {
      "epoch": 6.34670061531933,
      "grad_norm": 0.7800721497232559,
      "learning_rate": 2.2767264124189778e-05,
      "loss": 1.0108,
      "num_input_tokens_seen": 47067501744,
      "step": 59824
    },
    {
      "epoch": 6.346806704858901,
      "grad_norm": 0.8798505844354583,
      "learning_rate": 2.2766571933377447e-05,
      "loss": 1.0003,
      "num_input_tokens_seen": 47068288512,
      "step": 59825
    },
    {
      "epoch": 6.346912794398472,
      "grad_norm": 1.0452509530039629,
      "learning_rate": 2.2765879744291053e-05,
      "loss": 1.0137,
      "num_input_tokens_seen": 47069075232,
      "step": 59826
    },
    {
      "epoch": 6.347018883938044,
      "grad_norm": 0.8935334054769554,
      "learning_rate": 2.2765187556931123e-05,
      "loss": 1.0141,
      "num_input_tokens_seen": 47069861920,
      "step": 59827
    },
    {
      "epoch": 6.347124973477615,
      "grad_norm": 0.7951879716460177,
      "learning_rate": 2.276449537129818e-05,
      "loss": 0.9523,
      "num_input_tokens_seen": 47070648784,
      "step": 59828
    },
    {
      "epoch": 6.347231063017187,
      "grad_norm": 0.8748340768794617,
      "learning_rate": 2.276380318739278e-05,
      "loss": 0.9828,
      "num_input_tokens_seen": 47071435568,
      "step": 59829
    },
    {
      "epoch": 6.347337152556758,
      "grad_norm": 0.7638872989055866,
      "learning_rate": 2.2763111005215442e-05,
      "loss": 0.9899,
      "num_input_tokens_seen": 47072222304,
      "step": 59830
    },
    {
      "epoch": 6.347443242096329,
      "grad_norm": 1.0226614737619357,
      "learning_rate": 2.2762418824766704e-05,
      "loss": 1.0165,
      "num_input_tokens_seen": 47073009072,
      "step": 59831
    },
    {
      "epoch": 6.347549331635901,
      "grad_norm": 0.9133272954688312,
      "learning_rate": 2.2761726646047106e-05,
      "loss": 0.9991,
      "num_input_tokens_seen": 47073795824,
      "step": 59832
    },
    {
      "epoch": 6.347655421175472,
      "grad_norm": 0.831831479117283,
      "learning_rate": 2.2761034469057184e-05,
      "loss": 0.9762,
      "num_input_tokens_seen": 47074582688,
      "step": 59833
    },
    {
      "epoch": 6.347761510715044,
      "grad_norm": 0.7869693217860895,
      "learning_rate": 2.2760342293797458e-05,
      "loss": 0.9845,
      "num_input_tokens_seen": 47075369520,
      "step": 59834
    },
    {
      "epoch": 6.347867600254615,
      "grad_norm": 0.9672515885412455,
      "learning_rate": 2.2759650120268485e-05,
      "loss": 1.0057,
      "num_input_tokens_seen": 47076156304,
      "step": 59835
    },
    {
      "epoch": 6.347973689794186,
      "grad_norm": 1.0350313483941742,
      "learning_rate": 2.275895794847079e-05,
      "loss": 0.9721,
      "num_input_tokens_seen": 47076943056,
      "step": 59836
    },
    {
      "epoch": 6.348079779333758,
      "grad_norm": 0.8476210317322025,
      "learning_rate": 2.2758265778404894e-05,
      "loss": 1.0049,
      "num_input_tokens_seen": 47077729888,
      "step": 59837
    },
    {
      "epoch": 6.348185868873329,
      "grad_norm": 1.42978545918387,
      "learning_rate": 2.2757573610071353e-05,
      "loss": 0.9529,
      "num_input_tokens_seen": 47078516672,
      "step": 59838
    },
    {
      "epoch": 6.348291958412901,
      "grad_norm": 0.7020819097702082,
      "learning_rate": 2.2756881443470693e-05,
      "loss": 0.9593,
      "num_input_tokens_seen": 47079303520,
      "step": 59839
    },
    {
      "epoch": 6.348398047952472,
      "grad_norm": 0.9916081903045609,
      "learning_rate": 2.2756189278603445e-05,
      "loss": 0.9539,
      "num_input_tokens_seen": 47080090400,
      "step": 59840
    },
    {
      "epoch": 6.348504137492044,
      "grad_norm": 0.8084032280539579,
      "learning_rate": 2.2755497115470155e-05,
      "loss": 1.0492,
      "num_input_tokens_seen": 47080877056,
      "step": 59841
    },
    {
      "epoch": 6.348610227031615,
      "grad_norm": 0.7488617744173418,
      "learning_rate": 2.275480495407134e-05,
      "loss": 0.9314,
      "num_input_tokens_seen": 47081663888,
      "step": 59842
    },
    {
      "epoch": 6.348716316571186,
      "grad_norm": 0.8206988714021508,
      "learning_rate": 2.2754112794407555e-05,
      "loss": 0.9383,
      "num_input_tokens_seen": 47082450704,
      "step": 59843
    },
    {
      "epoch": 6.348822406110758,
      "grad_norm": 0.7700540066760619,
      "learning_rate": 2.2753420636479326e-05,
      "loss": 0.9963,
      "num_input_tokens_seen": 47083237488,
      "step": 59844
    },
    {
      "epoch": 6.348928495650329,
      "grad_norm": 0.7470397689393579,
      "learning_rate": 2.275272848028718e-05,
      "loss": 1.0286,
      "num_input_tokens_seen": 47084024256,
      "step": 59845
    },
    {
      "epoch": 6.349034585189901,
      "grad_norm": 0.8305640110129213,
      "learning_rate": 2.2752036325831667e-05,
      "loss": 1.0361,
      "num_input_tokens_seen": 47084811024,
      "step": 59846
    },
    {
      "epoch": 6.349140674729472,
      "grad_norm": 0.7934732514003664,
      "learning_rate": 2.2751344173113315e-05,
      "loss": 0.9432,
      "num_input_tokens_seen": 47085597760,
      "step": 59847
    },
    {
      "epoch": 6.349246764269043,
      "grad_norm": 0.7500020073413118,
      "learning_rate": 2.275065202213265e-05,
      "loss": 0.9443,
      "num_input_tokens_seen": 47086384512,
      "step": 59848
    },
    {
      "epoch": 6.349352853808615,
      "grad_norm": 0.9428928999297062,
      "learning_rate": 2.2749959872890222e-05,
      "loss": 0.9275,
      "num_input_tokens_seen": 47087171376,
      "step": 59849
    },
    {
      "epoch": 6.349458943348186,
      "grad_norm": 0.6851008635897429,
      "learning_rate": 2.274926772538656e-05,
      "loss": 1.0131,
      "num_input_tokens_seen": 47087958064,
      "step": 59850
    },
    {
      "epoch": 6.3495650328877575,
      "grad_norm": 0.8895166206568743,
      "learning_rate": 2.2748575579622192e-05,
      "loss": 0.9785,
      "num_input_tokens_seen": 47088744864,
      "step": 59851
    },
    {
      "epoch": 6.349671122427329,
      "grad_norm": 0.6970306257719807,
      "learning_rate": 2.2747883435597664e-05,
      "loss": 1.0332,
      "num_input_tokens_seen": 47089531552,
      "step": 59852
    },
    {
      "epoch": 6.3497772119669005,
      "grad_norm": 0.7766628727424811,
      "learning_rate": 2.2747191293313507e-05,
      "loss": 1.0853,
      "num_input_tokens_seen": 47090318352,
      "step": 59853
    },
    {
      "epoch": 6.3498833015064715,
      "grad_norm": 0.7272304372589627,
      "learning_rate": 2.2746499152770246e-05,
      "loss": 0.9971,
      "num_input_tokens_seen": 47091105152,
      "step": 59854
    },
    {
      "epoch": 6.3499893910460425,
      "grad_norm": 0.694193626955358,
      "learning_rate": 2.2745807013968428e-05,
      "loss": 1.0339,
      "num_input_tokens_seen": 47091891872,
      "step": 59855
    },
    {
      "epoch": 6.3500954805856145,
      "grad_norm": 0.7100235859367159,
      "learning_rate": 2.2745114876908584e-05,
      "loss": 1.0189,
      "num_input_tokens_seen": 47092678640,
      "step": 59856
    },
    {
      "epoch": 6.3502015701251855,
      "grad_norm": 0.7223337944294022,
      "learning_rate": 2.2744422741591252e-05,
      "loss": 0.9449,
      "num_input_tokens_seen": 47093465504,
      "step": 59857
    },
    {
      "epoch": 6.350307659664757,
      "grad_norm": 0.6896132491455894,
      "learning_rate": 2.2743730608016962e-05,
      "loss": 1.0676,
      "num_input_tokens_seen": 47094252240,
      "step": 59858
    },
    {
      "epoch": 6.350413749204328,
      "grad_norm": 0.9175517239138892,
      "learning_rate": 2.2743038476186252e-05,
      "loss": 1.0322,
      "num_input_tokens_seen": 47095039008,
      "step": 59859
    },
    {
      "epoch": 6.3505198387438995,
      "grad_norm": 0.7467323323104242,
      "learning_rate": 2.2742346346099654e-05,
      "loss": 1.0221,
      "num_input_tokens_seen": 47095825728,
      "step": 59860
    },
    {
      "epoch": 6.350625928283471,
      "grad_norm": 0.71733350228927,
      "learning_rate": 2.2741654217757707e-05,
      "loss": 0.9873,
      "num_input_tokens_seen": 47096612512,
      "step": 59861
    },
    {
      "epoch": 6.350732017823042,
      "grad_norm": 0.7529579176234223,
      "learning_rate": 2.274096209116094e-05,
      "loss": 0.9915,
      "num_input_tokens_seen": 47097399328,
      "step": 59862
    },
    {
      "epoch": 6.350838107362614,
      "grad_norm": 0.7589963490196519,
      "learning_rate": 2.2740269966309892e-05,
      "loss": 1.0429,
      "num_input_tokens_seen": 47098186128,
      "step": 59863
    },
    {
      "epoch": 6.350944196902185,
      "grad_norm": 0.7337846740500169,
      "learning_rate": 2.2739577843205102e-05,
      "loss": 0.9984,
      "num_input_tokens_seen": 47098972880,
      "step": 59864
    },
    {
      "epoch": 6.351050286441756,
      "grad_norm": 0.7131540145873706,
      "learning_rate": 2.273888572184709e-05,
      "loss": 1.0123,
      "num_input_tokens_seen": 47099759744,
      "step": 59865
    },
    {
      "epoch": 6.351156375981328,
      "grad_norm": 0.7826299542839776,
      "learning_rate": 2.273819360223641e-05,
      "loss": 0.9791,
      "num_input_tokens_seen": 47100546592,
      "step": 59866
    },
    {
      "epoch": 6.351262465520899,
      "grad_norm": 0.8427849954028808,
      "learning_rate": 2.2737501484373585e-05,
      "loss": 1.0118,
      "num_input_tokens_seen": 47101333424,
      "step": 59867
    },
    {
      "epoch": 6.351368555060471,
      "grad_norm": 0.642001092316,
      "learning_rate": 2.2736809368259148e-05,
      "loss": 0.9746,
      "num_input_tokens_seen": 47102120176,
      "step": 59868
    },
    {
      "epoch": 6.351474644600042,
      "grad_norm": 0.8147272702302856,
      "learning_rate": 2.2736117253893647e-05,
      "loss": 1.0334,
      "num_input_tokens_seen": 47102906976,
      "step": 59869
    },
    {
      "epoch": 6.351580734139614,
      "grad_norm": 0.6533932130776909,
      "learning_rate": 2.2735425141277605e-05,
      "loss": 0.9758,
      "num_input_tokens_seen": 47103693664,
      "step": 59870
    },
    {
      "epoch": 6.351686823679185,
      "grad_norm": 0.8117007689310046,
      "learning_rate": 2.2734733030411554e-05,
      "loss": 1.0017,
      "num_input_tokens_seen": 47104480480,
      "step": 59871
    },
    {
      "epoch": 6.351792913218756,
      "grad_norm": 0.8453275973926878,
      "learning_rate": 2.273404092129604e-05,
      "loss": 1.047,
      "num_input_tokens_seen": 47105267264,
      "step": 59872
    },
    {
      "epoch": 6.351899002758328,
      "grad_norm": 0.785845150105653,
      "learning_rate": 2.2733348813931587e-05,
      "loss": 0.9976,
      "num_input_tokens_seen": 47106054064,
      "step": 59873
    },
    {
      "epoch": 6.352005092297899,
      "grad_norm": 0.8828049715820989,
      "learning_rate": 2.2732656708318745e-05,
      "loss": 0.9213,
      "num_input_tokens_seen": 47106840848,
      "step": 59874
    },
    {
      "epoch": 6.352111181837471,
      "grad_norm": 0.8643109923572644,
      "learning_rate": 2.2731964604458036e-05,
      "loss": 1.0511,
      "num_input_tokens_seen": 47107627696,
      "step": 59875
    },
    {
      "epoch": 6.352217271377042,
      "grad_norm": 1.1032821594190452,
      "learning_rate": 2.2731272502349993e-05,
      "loss": 1.0763,
      "num_input_tokens_seen": 47108414464,
      "step": 59876
    },
    {
      "epoch": 6.352323360916614,
      "grad_norm": 0.8319765042623346,
      "learning_rate": 2.273058040199516e-05,
      "loss": 1.0939,
      "num_input_tokens_seen": 47109201168,
      "step": 59877
    },
    {
      "epoch": 6.352429450456185,
      "grad_norm": 0.927066834766116,
      "learning_rate": 2.272988830339407e-05,
      "loss": 0.9616,
      "num_input_tokens_seen": 47109987936,
      "step": 59878
    },
    {
      "epoch": 6.352535539995756,
      "grad_norm": 1.3044887023904195,
      "learning_rate": 2.272919620654725e-05,
      "loss": 1.0632,
      "num_input_tokens_seen": 47110774672,
      "step": 59879
    },
    {
      "epoch": 6.352641629535328,
      "grad_norm": 0.8538437336171724,
      "learning_rate": 2.2728504111455247e-05,
      "loss": 1.049,
      "num_input_tokens_seen": 47111561408,
      "step": 59880
    },
    {
      "epoch": 6.352747719074899,
      "grad_norm": 0.9390136519632203,
      "learning_rate": 2.272781201811859e-05,
      "loss": 1.002,
      "num_input_tokens_seen": 47112348128,
      "step": 59881
    },
    {
      "epoch": 6.352853808614471,
      "grad_norm": 1.1259167284044294,
      "learning_rate": 2.2727119926537804e-05,
      "loss": 0.9174,
      "num_input_tokens_seen": 47113134912,
      "step": 59882
    },
    {
      "epoch": 6.352959898154042,
      "grad_norm": 1.2064886209901233,
      "learning_rate": 2.272642783671344e-05,
      "loss": 1.0088,
      "num_input_tokens_seen": 47113921680,
      "step": 59883
    },
    {
      "epoch": 6.353065987693613,
      "grad_norm": 0.9956173093445613,
      "learning_rate": 2.2725735748646026e-05,
      "loss": 0.9256,
      "num_input_tokens_seen": 47114708368,
      "step": 59884
    },
    {
      "epoch": 6.353172077233185,
      "grad_norm": 1.0880214185847532,
      "learning_rate": 2.2725043662336093e-05,
      "loss": 0.9582,
      "num_input_tokens_seen": 47115495120,
      "step": 59885
    },
    {
      "epoch": 6.353278166772756,
      "grad_norm": 0.991678575311439,
      "learning_rate": 2.2724351577784184e-05,
      "loss": 1.0764,
      "num_input_tokens_seen": 47116281872,
      "step": 59886
    },
    {
      "epoch": 6.353384256312328,
      "grad_norm": 1.0078033685409558,
      "learning_rate": 2.272365949499083e-05,
      "loss": 1.0078,
      "num_input_tokens_seen": 47117068528,
      "step": 59887
    },
    {
      "epoch": 6.353490345851899,
      "grad_norm": 1.402932740111945,
      "learning_rate": 2.2722967413956557e-05,
      "loss": 1.0656,
      "num_input_tokens_seen": 47117855296,
      "step": 59888
    },
    {
      "epoch": 6.35359643539147,
      "grad_norm": 0.9076039423784732,
      "learning_rate": 2.2722275334681904e-05,
      "loss": 1.0259,
      "num_input_tokens_seen": 47118641984,
      "step": 59889
    },
    {
      "epoch": 6.353702524931042,
      "grad_norm": 0.7460580042549596,
      "learning_rate": 2.272158325716742e-05,
      "loss": 1.0139,
      "num_input_tokens_seen": 47119428752,
      "step": 59890
    },
    {
      "epoch": 6.353808614470613,
      "grad_norm": 0.8768726944763985,
      "learning_rate": 2.272089118141363e-05,
      "loss": 1.0367,
      "num_input_tokens_seen": 47120215488,
      "step": 59891
    },
    {
      "epoch": 6.353914704010185,
      "grad_norm": 1.3033988100534042,
      "learning_rate": 2.2720199107421064e-05,
      "loss": 1.0551,
      "num_input_tokens_seen": 47121002288,
      "step": 59892
    },
    {
      "epoch": 6.354020793549756,
      "grad_norm": 1.058503881274847,
      "learning_rate": 2.2719507035190266e-05,
      "loss": 1.0108,
      "num_input_tokens_seen": 47121789088,
      "step": 59893
    },
    {
      "epoch": 6.354126883089327,
      "grad_norm": 1.390605063323322,
      "learning_rate": 2.271881496472176e-05,
      "loss": 1.0693,
      "num_input_tokens_seen": 47122575824,
      "step": 59894
    },
    {
      "epoch": 6.354232972628899,
      "grad_norm": 1.230395171354855,
      "learning_rate": 2.2718122896016096e-05,
      "loss": 0.8916,
      "num_input_tokens_seen": 47123362672,
      "step": 59895
    },
    {
      "epoch": 6.35433906216847,
      "grad_norm": 1.0708400494717405,
      "learning_rate": 2.2717430829073795e-05,
      "loss": 0.9836,
      "num_input_tokens_seen": 47124149456,
      "step": 59896
    },
    {
      "epoch": 6.354445151708042,
      "grad_norm": 0.8862457652335903,
      "learning_rate": 2.2716738763895392e-05,
      "loss": 0.9816,
      "num_input_tokens_seen": 47124936336,
      "step": 59897
    },
    {
      "epoch": 6.354551241247613,
      "grad_norm": 1.5369495628042573,
      "learning_rate": 2.2716046700481434e-05,
      "loss": 0.9782,
      "num_input_tokens_seen": 47125723088,
      "step": 59898
    },
    {
      "epoch": 6.354657330787185,
      "grad_norm": 1.455425595688556,
      "learning_rate": 2.2715354638832446e-05,
      "loss": 1.0658,
      "num_input_tokens_seen": 47126509856,
      "step": 59899
    },
    {
      "epoch": 6.354763420326756,
      "grad_norm": 0.7611738213027803,
      "learning_rate": 2.2714662578948958e-05,
      "loss": 0.9473,
      "num_input_tokens_seen": 47127296608,
      "step": 59900
    },
    {
      "epoch": 6.354869509866327,
      "grad_norm": 0.8802632861355252,
      "learning_rate": 2.271397052083152e-05,
      "loss": 1.0456,
      "num_input_tokens_seen": 47128083440,
      "step": 59901
    },
    {
      "epoch": 6.354975599405899,
      "grad_norm": 1.121176315958903,
      "learning_rate": 2.271327846448066e-05,
      "loss": 0.9942,
      "num_input_tokens_seen": 47128870160,
      "step": 59902
    },
    {
      "epoch": 6.35508168894547,
      "grad_norm": 0.6936132494339948,
      "learning_rate": 2.27125864098969e-05,
      "loss": 1.0347,
      "num_input_tokens_seen": 47129656880,
      "step": 59903
    },
    {
      "epoch": 6.355187778485042,
      "grad_norm": 1.2526020490640057,
      "learning_rate": 2.2711894357080795e-05,
      "loss": 0.9899,
      "num_input_tokens_seen": 47130443568,
      "step": 59904
    },
    {
      "epoch": 6.355293868024613,
      "grad_norm": 0.7769721856501609,
      "learning_rate": 2.271120230603287e-05,
      "loss": 0.9948,
      "num_input_tokens_seen": 47131230320,
      "step": 59905
    },
    {
      "epoch": 6.355399957564185,
      "grad_norm": 1.0750175305658267,
      "learning_rate": 2.271051025675366e-05,
      "loss": 1.0354,
      "num_input_tokens_seen": 47132017040,
      "step": 59906
    },
    {
      "epoch": 6.355506047103756,
      "grad_norm": 0.901902589265005,
      "learning_rate": 2.27098182092437e-05,
      "loss": 0.9883,
      "num_input_tokens_seen": 47132803824,
      "step": 59907
    },
    {
      "epoch": 6.355612136643327,
      "grad_norm": 1.24601137524838,
      "learning_rate": 2.270912616350353e-05,
      "loss": 1.0467,
      "num_input_tokens_seen": 47133590656,
      "step": 59908
    },
    {
      "epoch": 6.355718226182899,
      "grad_norm": 1.3543051879344143,
      "learning_rate": 2.270843411953367e-05,
      "loss": 1.0229,
      "num_input_tokens_seen": 47134377408,
      "step": 59909
    },
    {
      "epoch": 6.35582431572247,
      "grad_norm": 0.8388694111085314,
      "learning_rate": 2.2707742077334675e-05,
      "loss": 1.045,
      "num_input_tokens_seen": 47135164112,
      "step": 59910
    },
    {
      "epoch": 6.355930405262042,
      "grad_norm": 1.3149551675990736,
      "learning_rate": 2.270705003690706e-05,
      "loss": 0.9866,
      "num_input_tokens_seen": 47135950800,
      "step": 59911
    },
    {
      "epoch": 6.356036494801613,
      "grad_norm": 1.048172018223173,
      "learning_rate": 2.2706357998251377e-05,
      "loss": 1.077,
      "num_input_tokens_seen": 47136737520,
      "step": 59912
    },
    {
      "epoch": 6.356142584341184,
      "grad_norm": 0.7155694309515219,
      "learning_rate": 2.2705665961368154e-05,
      "loss": 0.9571,
      "num_input_tokens_seen": 47137524352,
      "step": 59913
    },
    {
      "epoch": 6.3562486738807555,
      "grad_norm": 1.1527914342464376,
      "learning_rate": 2.2704973926257917e-05,
      "loss": 1.0537,
      "num_input_tokens_seen": 47138311168,
      "step": 59914
    },
    {
      "epoch": 6.356354763420327,
      "grad_norm": 1.104773632682509,
      "learning_rate": 2.2704281892921215e-05,
      "loss": 1.0045,
      "num_input_tokens_seen": 47139097952,
      "step": 59915
    },
    {
      "epoch": 6.3564608529598985,
      "grad_norm": 0.9443353923127338,
      "learning_rate": 2.2703589861358575e-05,
      "loss": 1.0583,
      "num_input_tokens_seen": 47139884592,
      "step": 59916
    },
    {
      "epoch": 6.3565669424994695,
      "grad_norm": 0.9691913609884638,
      "learning_rate": 2.270289783157053e-05,
      "loss": 1.0446,
      "num_input_tokens_seen": 47140671344,
      "step": 59917
    },
    {
      "epoch": 6.3566730320390405,
      "grad_norm": 1.0321654140588743,
      "learning_rate": 2.2702205803557624e-05,
      "loss": 0.996,
      "num_input_tokens_seen": 47141458128,
      "step": 59918
    },
    {
      "epoch": 6.3567791215786125,
      "grad_norm": 0.7651587331391295,
      "learning_rate": 2.270151377732039e-05,
      "loss": 0.9804,
      "num_input_tokens_seen": 47142244832,
      "step": 59919
    },
    {
      "epoch": 6.3568852111181835,
      "grad_norm": 0.8589340464131464,
      "learning_rate": 2.270082175285935e-05,
      "loss": 0.9916,
      "num_input_tokens_seen": 47143031616,
      "step": 59920
    },
    {
      "epoch": 6.356991300657755,
      "grad_norm": 0.9100703405120253,
      "learning_rate": 2.2700129730175048e-05,
      "loss": 1.0986,
      "num_input_tokens_seen": 47143818288,
      "step": 59921
    },
    {
      "epoch": 6.3570973901973264,
      "grad_norm": 0.8318803860654973,
      "learning_rate": 2.2699437709268022e-05,
      "loss": 1.0395,
      "num_input_tokens_seen": 47144604992,
      "step": 59922
    },
    {
      "epoch": 6.3572034797368975,
      "grad_norm": 0.8608727275734699,
      "learning_rate": 2.26987456901388e-05,
      "loss": 1.0822,
      "num_input_tokens_seen": 47145391728,
      "step": 59923
    },
    {
      "epoch": 6.357309569276469,
      "grad_norm": 0.7718812634684686,
      "learning_rate": 2.269805367278792e-05,
      "loss": 1.0334,
      "num_input_tokens_seen": 47146178496,
      "step": 59924
    },
    {
      "epoch": 6.35741565881604,
      "grad_norm": 0.9762139115349224,
      "learning_rate": 2.269736165721592e-05,
      "loss": 1.0449,
      "num_input_tokens_seen": 47146965248,
      "step": 59925
    },
    {
      "epoch": 6.357521748355612,
      "grad_norm": 0.8625586390074904,
      "learning_rate": 2.2696669643423328e-05,
      "loss": 1.0193,
      "num_input_tokens_seen": 47147752064,
      "step": 59926
    },
    {
      "epoch": 6.357627837895183,
      "grad_norm": 1.0310582003309867,
      "learning_rate": 2.2695977631410683e-05,
      "loss": 1.0439,
      "num_input_tokens_seen": 47148538768,
      "step": 59927
    },
    {
      "epoch": 6.357733927434755,
      "grad_norm": 0.898043358722723,
      "learning_rate": 2.2695285621178515e-05,
      "loss": 0.8945,
      "num_input_tokens_seen": 47149325616,
      "step": 59928
    },
    {
      "epoch": 6.357840016974326,
      "grad_norm": 0.8811322968242317,
      "learning_rate": 2.269459361272737e-05,
      "loss": 0.9811,
      "num_input_tokens_seen": 47150112416,
      "step": 59929
    },
    {
      "epoch": 6.357946106513897,
      "grad_norm": 0.6968902079730789,
      "learning_rate": 2.269390160605777e-05,
      "loss": 0.9499,
      "num_input_tokens_seen": 47150899152,
      "step": 59930
    },
    {
      "epoch": 6.358052196053469,
      "grad_norm": 0.7521941573440322,
      "learning_rate": 2.2693209601170256e-05,
      "loss": 0.9399,
      "num_input_tokens_seen": 47151685904,
      "step": 59931
    },
    {
      "epoch": 6.35815828559304,
      "grad_norm": 0.6954246156488109,
      "learning_rate": 2.2692517598065366e-05,
      "loss": 0.9808,
      "num_input_tokens_seen": 47152472656,
      "step": 59932
    },
    {
      "epoch": 6.358264375132612,
      "grad_norm": 0.7559125862701299,
      "learning_rate": 2.269182559674363e-05,
      "loss": 1.0053,
      "num_input_tokens_seen": 47153259488,
      "step": 59933
    },
    {
      "epoch": 6.358370464672183,
      "grad_norm": 0.8089318494048219,
      "learning_rate": 2.2691133597205578e-05,
      "loss": 1.0581,
      "num_input_tokens_seen": 47154046192,
      "step": 59934
    },
    {
      "epoch": 6.358476554211755,
      "grad_norm": 0.7267013580857968,
      "learning_rate": 2.2690441599451753e-05,
      "loss": 1.0525,
      "num_input_tokens_seen": 47154832928,
      "step": 59935
    },
    {
      "epoch": 6.358582643751326,
      "grad_norm": 0.7719428987306892,
      "learning_rate": 2.2689749603482692e-05,
      "loss": 0.997,
      "num_input_tokens_seen": 47155619760,
      "step": 59936
    },
    {
      "epoch": 6.358688733290897,
      "grad_norm": 0.6898716116164676,
      "learning_rate": 2.2689057609298915e-05,
      "loss": 0.9464,
      "num_input_tokens_seen": 47156406528,
      "step": 59937
    },
    {
      "epoch": 6.358794822830469,
      "grad_norm": 0.7583971225114815,
      "learning_rate": 2.2688365616900972e-05,
      "loss": 1.0426,
      "num_input_tokens_seen": 47157193344,
      "step": 59938
    },
    {
      "epoch": 6.35890091237004,
      "grad_norm": 0.8066458292482287,
      "learning_rate": 2.2687673626289398e-05,
      "loss": 1.0741,
      "num_input_tokens_seen": 47157980096,
      "step": 59939
    },
    {
      "epoch": 6.359007001909612,
      "grad_norm": 0.8131759221982922,
      "learning_rate": 2.268698163746471e-05,
      "loss": 1.0126,
      "num_input_tokens_seen": 47158766848,
      "step": 59940
    },
    {
      "epoch": 6.359113091449183,
      "grad_norm": 0.8683397554660108,
      "learning_rate": 2.2686289650427462e-05,
      "loss": 1.0685,
      "num_input_tokens_seen": 47159553600,
      "step": 59941
    },
    {
      "epoch": 6.359219180988754,
      "grad_norm": 0.9104304132237293,
      "learning_rate": 2.2685597665178182e-05,
      "loss": 1.0072,
      "num_input_tokens_seen": 47160340304,
      "step": 59942
    },
    {
      "epoch": 6.359325270528326,
      "grad_norm": 0.7522848484574338,
      "learning_rate": 2.26849056817174e-05,
      "loss": 0.9673,
      "num_input_tokens_seen": 47161127104,
      "step": 59943
    },
    {
      "epoch": 6.359431360067897,
      "grad_norm": 0.7954600096382699,
      "learning_rate": 2.2684213700045657e-05,
      "loss": 1.0386,
      "num_input_tokens_seen": 47161913808,
      "step": 59944
    },
    {
      "epoch": 6.359537449607469,
      "grad_norm": 0.6859190732805976,
      "learning_rate": 2.2683521720163483e-05,
      "loss": 0.9866,
      "num_input_tokens_seen": 47162700576,
      "step": 59945
    },
    {
      "epoch": 6.35964353914704,
      "grad_norm": 0.7381736683523663,
      "learning_rate": 2.268282974207142e-05,
      "loss": 0.973,
      "num_input_tokens_seen": 47163487312,
      "step": 59946
    },
    {
      "epoch": 6.359749628686611,
      "grad_norm": 0.8407162837020665,
      "learning_rate": 2.2682137765769998e-05,
      "loss": 1.0293,
      "num_input_tokens_seen": 47164274064,
      "step": 59947
    },
    {
      "epoch": 6.359855718226183,
      "grad_norm": 0.7491741418022729,
      "learning_rate": 2.2681445791259747e-05,
      "loss": 0.9631,
      "num_input_tokens_seen": 47165060848,
      "step": 59948
    },
    {
      "epoch": 6.359961807765754,
      "grad_norm": 0.9170701746188299,
      "learning_rate": 2.268075381854121e-05,
      "loss": 0.9791,
      "num_input_tokens_seen": 47165847568,
      "step": 59949
    },
    {
      "epoch": 6.360067897305326,
      "grad_norm": 0.7775523171111078,
      "learning_rate": 2.2680061847614923e-05,
      "loss": 0.9549,
      "num_input_tokens_seen": 47166634416,
      "step": 59950
    },
    {
      "epoch": 6.360173986844897,
      "grad_norm": 0.9810390750028418,
      "learning_rate": 2.2679369878481407e-05,
      "loss": 1.0471,
      "num_input_tokens_seen": 47167421216,
      "step": 59951
    },
    {
      "epoch": 6.360280076384469,
      "grad_norm": 1.0535426923042572,
      "learning_rate": 2.2678677911141213e-05,
      "loss": 1.0445,
      "num_input_tokens_seen": 47168207936,
      "step": 59952
    },
    {
      "epoch": 6.36038616592404,
      "grad_norm": 1.1741649549338053,
      "learning_rate": 2.2677985945594868e-05,
      "loss": 1.0177,
      "num_input_tokens_seen": 47168994608,
      "step": 59953
    },
    {
      "epoch": 6.360492255463611,
      "grad_norm": 0.7492190040553711,
      "learning_rate": 2.26772939818429e-05,
      "loss": 0.9915,
      "num_input_tokens_seen": 47169781328,
      "step": 59954
    },
    {
      "epoch": 6.360598345003183,
      "grad_norm": 0.7751054204692508,
      "learning_rate": 2.267660201988586e-05,
      "loss": 1.004,
      "num_input_tokens_seen": 47170568096,
      "step": 59955
    },
    {
      "epoch": 6.360704434542754,
      "grad_norm": 0.9708979404142171,
      "learning_rate": 2.2675910059724274e-05,
      "loss": 1.104,
      "num_input_tokens_seen": 47171354832,
      "step": 59956
    },
    {
      "epoch": 6.360810524082326,
      "grad_norm": 0.7994456457405286,
      "learning_rate": 2.2675218101358668e-05,
      "loss": 0.9893,
      "num_input_tokens_seen": 47172141520,
      "step": 59957
    },
    {
      "epoch": 6.360916613621897,
      "grad_norm": 0.7758543101886635,
      "learning_rate": 2.2674526144789592e-05,
      "loss": 0.9995,
      "num_input_tokens_seen": 47172928272,
      "step": 59958
    },
    {
      "epoch": 6.361022703161468,
      "grad_norm": 0.7315971262390192,
      "learning_rate": 2.2673834190017567e-05,
      "loss": 0.9474,
      "num_input_tokens_seen": 47173714976,
      "step": 59959
    },
    {
      "epoch": 6.36112879270104,
      "grad_norm": 0.7008302975231763,
      "learning_rate": 2.2673142237043142e-05,
      "loss": 0.9508,
      "num_input_tokens_seen": 47174501760,
      "step": 59960
    },
    {
      "epoch": 6.361234882240611,
      "grad_norm": 1.0688155365023517,
      "learning_rate": 2.2672450285866844e-05,
      "loss": 1.0244,
      "num_input_tokens_seen": 47175288416,
      "step": 59961
    },
    {
      "epoch": 6.361340971780183,
      "grad_norm": 0.7389631674744991,
      "learning_rate": 2.2671758336489206e-05,
      "loss": 0.9626,
      "num_input_tokens_seen": 47176075184,
      "step": 59962
    },
    {
      "epoch": 6.361447061319754,
      "grad_norm": 0.7622843705980645,
      "learning_rate": 2.2671066388910764e-05,
      "loss": 1.0299,
      "num_input_tokens_seen": 47176861968,
      "step": 59963
    },
    {
      "epoch": 6.361553150859326,
      "grad_norm": 0.9405758249850521,
      "learning_rate": 2.2670374443132057e-05,
      "loss": 0.9935,
      "num_input_tokens_seen": 47177648752,
      "step": 59964
    },
    {
      "epoch": 6.361659240398897,
      "grad_norm": 0.846278377369873,
      "learning_rate": 2.266968249915361e-05,
      "loss": 0.9731,
      "num_input_tokens_seen": 47178435504,
      "step": 59965
    },
    {
      "epoch": 6.361765329938468,
      "grad_norm": 0.7325838377715133,
      "learning_rate": 2.2668990556975973e-05,
      "loss": 1.0608,
      "num_input_tokens_seen": 47179222192,
      "step": 59966
    },
    {
      "epoch": 6.36187141947804,
      "grad_norm": 0.7154637876270883,
      "learning_rate": 2.2668298616599666e-05,
      "loss": 1.011,
      "num_input_tokens_seen": 47180008912,
      "step": 59967
    },
    {
      "epoch": 6.361977509017611,
      "grad_norm": 0.7247126970092983,
      "learning_rate": 2.266760667802523e-05,
      "loss": 0.974,
      "num_input_tokens_seen": 47180795776,
      "step": 59968
    },
    {
      "epoch": 6.362083598557183,
      "grad_norm": 0.7590400824187542,
      "learning_rate": 2.26669147412532e-05,
      "loss": 0.9935,
      "num_input_tokens_seen": 47181582560,
      "step": 59969
    },
    {
      "epoch": 6.362189688096754,
      "grad_norm": 0.8443763439440087,
      "learning_rate": 2.266622280628411e-05,
      "loss": 0.9624,
      "num_input_tokens_seen": 47182369360,
      "step": 59970
    },
    {
      "epoch": 6.362295777636325,
      "grad_norm": 1.0806235414286154,
      "learning_rate": 2.2665530873118486e-05,
      "loss": 1.0543,
      "num_input_tokens_seen": 47183156112,
      "step": 59971
    },
    {
      "epoch": 6.362401867175897,
      "grad_norm": 0.7530002942002665,
      "learning_rate": 2.2664838941756883e-05,
      "loss": 0.957,
      "num_input_tokens_seen": 47183942912,
      "step": 59972
    },
    {
      "epoch": 6.362507956715468,
      "grad_norm": 1.0185104159921214,
      "learning_rate": 2.266414701219982e-05,
      "loss": 1.011,
      "num_input_tokens_seen": 47184729776,
      "step": 59973
    },
    {
      "epoch": 6.36261404625504,
      "grad_norm": 1.1869965760401002,
      "learning_rate": 2.266345508444783e-05,
      "loss": 1.0659,
      "num_input_tokens_seen": 47185516544,
      "step": 59974
    },
    {
      "epoch": 6.362720135794611,
      "grad_norm": 1.4258096277514656,
      "learning_rate": 2.2662763158501465e-05,
      "loss": 1.0362,
      "num_input_tokens_seen": 47186303280,
      "step": 59975
    },
    {
      "epoch": 6.362826225334182,
      "grad_norm": 0.7994192658475607,
      "learning_rate": 2.2662071234361238e-05,
      "loss": 0.8971,
      "num_input_tokens_seen": 47187090144,
      "step": 59976
    },
    {
      "epoch": 6.3629323148737535,
      "grad_norm": 1.4059104406669978,
      "learning_rate": 2.26613793120277e-05,
      "loss": 0.9692,
      "num_input_tokens_seen": 47187876832,
      "step": 59977
    },
    {
      "epoch": 6.363038404413325,
      "grad_norm": 1.752297096775206,
      "learning_rate": 2.266068739150138e-05,
      "loss": 1.0207,
      "num_input_tokens_seen": 47188663552,
      "step": 59978
    },
    {
      "epoch": 6.3631444939528965,
      "grad_norm": 0.8486240137537582,
      "learning_rate": 2.2659995472782803e-05,
      "loss": 0.9545,
      "num_input_tokens_seen": 47189450432,
      "step": 59979
    },
    {
      "epoch": 6.3632505834924675,
      "grad_norm": 0.8980567712853255,
      "learning_rate": 2.265930355587252e-05,
      "loss": 1.0555,
      "num_input_tokens_seen": 47190237104,
      "step": 59980
    },
    {
      "epoch": 6.3633566730320394,
      "grad_norm": 1.4234944980885542,
      "learning_rate": 2.265861164077106e-05,
      "loss": 0.9953,
      "num_input_tokens_seen": 47191023904,
      "step": 59981
    },
    {
      "epoch": 6.3634627625716105,
      "grad_norm": 1.4407306722413487,
      "learning_rate": 2.265791972747895e-05,
      "loss": 0.9506,
      "num_input_tokens_seen": 47191810640,
      "step": 59982
    },
    {
      "epoch": 6.3635688521111815,
      "grad_norm": 0.9824295158683889,
      "learning_rate": 2.2657227815996736e-05,
      "loss": 1.0448,
      "num_input_tokens_seen": 47192597440,
      "step": 59983
    },
    {
      "epoch": 6.363674941650753,
      "grad_norm": 1.3532770428039365,
      "learning_rate": 2.265653590632495e-05,
      "loss": 1.1254,
      "num_input_tokens_seen": 47193384048,
      "step": 59984
    },
    {
      "epoch": 6.3637810311903245,
      "grad_norm": 1.0851921223304943,
      "learning_rate": 2.265584399846411e-05,
      "loss": 1.0487,
      "num_input_tokens_seen": 47194170736,
      "step": 59985
    },
    {
      "epoch": 6.363887120729896,
      "grad_norm": 1.2508034050172576,
      "learning_rate": 2.2655152092414772e-05,
      "loss": 1.0182,
      "num_input_tokens_seen": 47194957440,
      "step": 59986
    },
    {
      "epoch": 6.363993210269467,
      "grad_norm": 1.09263817279727,
      "learning_rate": 2.265446018817747e-05,
      "loss": 1.0457,
      "num_input_tokens_seen": 47195744112,
      "step": 59987
    },
    {
      "epoch": 6.364099299809038,
      "grad_norm": 0.9980580084742845,
      "learning_rate": 2.265376828575273e-05,
      "loss": 0.955,
      "num_input_tokens_seen": 47196530912,
      "step": 59988
    },
    {
      "epoch": 6.36420538934861,
      "grad_norm": 0.7324567392712822,
      "learning_rate": 2.2653076385141086e-05,
      "loss": 0.9987,
      "num_input_tokens_seen": 47197317696,
      "step": 59989
    },
    {
      "epoch": 6.364311478888181,
      "grad_norm": 0.7741200364255768,
      "learning_rate": 2.265238448634308e-05,
      "loss": 0.9567,
      "num_input_tokens_seen": 47198104528,
      "step": 59990
    },
    {
      "epoch": 6.364417568427753,
      "grad_norm": 0.7166834633954736,
      "learning_rate": 2.265169258935924e-05,
      "loss": 0.9382,
      "num_input_tokens_seen": 47198891296,
      "step": 59991
    },
    {
      "epoch": 6.364523657967324,
      "grad_norm": 0.7780446940194273,
      "learning_rate": 2.26510006941901e-05,
      "loss": 0.9842,
      "num_input_tokens_seen": 47199678064,
      "step": 59992
    },
    {
      "epoch": 6.364629747506896,
      "grad_norm": 0.7143331651249181,
      "learning_rate": 2.2650308800836205e-05,
      "loss": 1.0093,
      "num_input_tokens_seen": 47200464848,
      "step": 59993
    },
    {
      "epoch": 6.364735837046467,
      "grad_norm": 0.714501349333994,
      "learning_rate": 2.2649616909298083e-05,
      "loss": 1.0441,
      "num_input_tokens_seen": 47201251600,
      "step": 59994
    },
    {
      "epoch": 6.364841926586038,
      "grad_norm": 0.7628689805331086,
      "learning_rate": 2.2648925019576257e-05,
      "loss": 0.998,
      "num_input_tokens_seen": 47202038432,
      "step": 59995
    },
    {
      "epoch": 6.36494801612561,
      "grad_norm": 0.6964671266648312,
      "learning_rate": 2.2648233131671283e-05,
      "loss": 1.0398,
      "num_input_tokens_seen": 47202825200,
      "step": 59996
    },
    {
      "epoch": 6.365054105665181,
      "grad_norm": 0.7788273309120703,
      "learning_rate": 2.264754124558368e-05,
      "loss": 0.9531,
      "num_input_tokens_seen": 47203611936,
      "step": 59997
    },
    {
      "epoch": 6.365160195204753,
      "grad_norm": 0.6880982079680382,
      "learning_rate": 2.264684936131399e-05,
      "loss": 0.9478,
      "num_input_tokens_seen": 47204398736,
      "step": 59998
    },
    {
      "epoch": 6.365266284744324,
      "grad_norm": 0.7567393612099949,
      "learning_rate": 2.2646157478862747e-05,
      "loss": 0.9376,
      "num_input_tokens_seen": 47205185552,
      "step": 59999
    },
    {
      "epoch": 6.365372374283895,
      "grad_norm": 0.8242794749915899,
      "learning_rate": 2.264546559823048e-05,
      "loss": 0.9741,
      "num_input_tokens_seen": 47205972336,
      "step": 60000
    },
    {
      "epoch": 6.365372374283895,
      "eval_loss": 1.5305894613265991,
      "eval_runtime": 64.4486,
      "eval_samples_per_second": 46.549,
      "eval_steps_per_second": 0.497,
      "num_input_tokens_seen": 47205972336,
      "step": 60000
    },
    {
      "epoch": 6.365478463823467,
      "grad_norm": 0.8856914550537885,
      "learning_rate": 2.2644773719417733e-05,
      "loss": 1.0107,
      "num_input_tokens_seen": 47206759120,
      "step": 60001
    },
    {
      "epoch": 6.365584553363038,
      "grad_norm": 0.7422024419898977,
      "learning_rate": 2.2644081842425037e-05,
      "loss": 1.0124,
      "num_input_tokens_seen": 47207545872,
      "step": 60002
    },
    {
      "epoch": 6.36569064290261,
      "grad_norm": 0.8640165900201797,
      "learning_rate": 2.264338996725292e-05,
      "loss": 0.992,
      "num_input_tokens_seen": 47208332752,
      "step": 60003
    },
    {
      "epoch": 6.365796732442181,
      "grad_norm": 1.193279036929619,
      "learning_rate": 2.2642698093901927e-05,
      "loss": 1.0087,
      "num_input_tokens_seen": 47209119456,
      "step": 60004
    },
    {
      "epoch": 6.365902821981752,
      "grad_norm": 0.7411064149658549,
      "learning_rate": 2.2642006222372587e-05,
      "loss": 0.9585,
      "num_input_tokens_seen": 47209906240,
      "step": 60005
    },
    {
      "epoch": 6.366008911521324,
      "grad_norm": 0.8563098193143824,
      "learning_rate": 2.2641314352665428e-05,
      "loss": 0.9774,
      "num_input_tokens_seen": 47210693008,
      "step": 60006
    },
    {
      "epoch": 6.366115001060895,
      "grad_norm": 0.9842389508465911,
      "learning_rate": 2.2640622484781003e-05,
      "loss": 1.0213,
      "num_input_tokens_seen": 47211479776,
      "step": 60007
    },
    {
      "epoch": 6.366221090600467,
      "grad_norm": 0.7634647476922543,
      "learning_rate": 2.2639930618719833e-05,
      "loss": 1.1096,
      "num_input_tokens_seen": 47212266448,
      "step": 60008
    },
    {
      "epoch": 6.366327180140038,
      "grad_norm": 1.0026628637033972,
      "learning_rate": 2.2639238754482447e-05,
      "loss": 1.0169,
      "num_input_tokens_seen": 47213053296,
      "step": 60009
    },
    {
      "epoch": 6.36643326967961,
      "grad_norm": 0.99104106762204,
      "learning_rate": 2.2638546892069397e-05,
      "loss": 0.9831,
      "num_input_tokens_seen": 47213839984,
      "step": 60010
    },
    {
      "epoch": 6.366539359219181,
      "grad_norm": 0.8714664418398113,
      "learning_rate": 2.263785503148121e-05,
      "loss": 0.9676,
      "num_input_tokens_seen": 47214626768,
      "step": 60011
    },
    {
      "epoch": 6.366645448758752,
      "grad_norm": 0.8566310556676211,
      "learning_rate": 2.263716317271841e-05,
      "loss": 1.0275,
      "num_input_tokens_seen": 47215413472,
      "step": 60012
    },
    {
      "epoch": 6.366751538298324,
      "grad_norm": 0.7456511033921355,
      "learning_rate": 2.263647131578155e-05,
      "loss": 1.0029,
      "num_input_tokens_seen": 47216200208,
      "step": 60013
    },
    {
      "epoch": 6.366857627837895,
      "grad_norm": 0.7500740743335607,
      "learning_rate": 2.2635779460671147e-05,
      "loss": 0.9042,
      "num_input_tokens_seen": 47216987024,
      "step": 60014
    },
    {
      "epoch": 6.366963717377467,
      "grad_norm": 0.9399814726398493,
      "learning_rate": 2.263508760738775e-05,
      "loss": 0.9475,
      "num_input_tokens_seen": 47217773712,
      "step": 60015
    },
    {
      "epoch": 6.367069806917038,
      "grad_norm": 0.9126148580701406,
      "learning_rate": 2.263439575593189e-05,
      "loss": 1.0639,
      "num_input_tokens_seen": 47218560400,
      "step": 60016
    },
    {
      "epoch": 6.367175896456609,
      "grad_norm": 0.7838395910433,
      "learning_rate": 2.263370390630409e-05,
      "loss": 1.007,
      "num_input_tokens_seen": 47219347040,
      "step": 60017
    },
    {
      "epoch": 6.367281985996181,
      "grad_norm": 1.211312433826866,
      "learning_rate": 2.2633012058504906e-05,
      "loss": 0.98,
      "num_input_tokens_seen": 47220133856,
      "step": 60018
    },
    {
      "epoch": 6.367388075535752,
      "grad_norm": 1.0773095222339297,
      "learning_rate": 2.2632320212534856e-05,
      "loss": 0.8926,
      "num_input_tokens_seen": 47220920656,
      "step": 60019
    },
    {
      "epoch": 6.367494165075324,
      "grad_norm": 0.7013759090409353,
      "learning_rate": 2.2631628368394475e-05,
      "loss": 0.9279,
      "num_input_tokens_seen": 47221707408,
      "step": 60020
    },
    {
      "epoch": 6.367600254614895,
      "grad_norm": 1.472658962815127,
      "learning_rate": 2.2630936526084305e-05,
      "loss": 1.0264,
      "num_input_tokens_seen": 47222494144,
      "step": 60021
    },
    {
      "epoch": 6.367706344154467,
      "grad_norm": 0.963530108294912,
      "learning_rate": 2.2630244685604882e-05,
      "loss": 0.9724,
      "num_input_tokens_seen": 47223280880,
      "step": 60022
    },
    {
      "epoch": 6.367812433694038,
      "grad_norm": 0.884494194310452,
      "learning_rate": 2.262955284695673e-05,
      "loss": 1.0016,
      "num_input_tokens_seen": 47224067696,
      "step": 60023
    },
    {
      "epoch": 6.367918523233609,
      "grad_norm": 0.8623254739282257,
      "learning_rate": 2.2628861010140397e-05,
      "loss": 0.98,
      "num_input_tokens_seen": 47224854480,
      "step": 60024
    },
    {
      "epoch": 6.368024612773181,
      "grad_norm": 0.7832388985167612,
      "learning_rate": 2.2628169175156408e-05,
      "loss": 0.9573,
      "num_input_tokens_seen": 47225641232,
      "step": 60025
    },
    {
      "epoch": 6.368130702312752,
      "grad_norm": 0.6698787864894481,
      "learning_rate": 2.2627477342005294e-05,
      "loss": 0.9369,
      "num_input_tokens_seen": 47226427984,
      "step": 60026
    },
    {
      "epoch": 6.368236791852324,
      "grad_norm": 0.7897459339800752,
      "learning_rate": 2.2626785510687603e-05,
      "loss": 0.9381,
      "num_input_tokens_seen": 47227214832,
      "step": 60027
    },
    {
      "epoch": 6.368342881391895,
      "grad_norm": 0.6301794522835635,
      "learning_rate": 2.2626093681203863e-05,
      "loss": 0.9445,
      "num_input_tokens_seen": 47228001584,
      "step": 60028
    },
    {
      "epoch": 6.368448970931466,
      "grad_norm": 0.7494154870427617,
      "learning_rate": 2.26254018535546e-05,
      "loss": 0.9476,
      "num_input_tokens_seen": 47228788400,
      "step": 60029
    },
    {
      "epoch": 6.368555060471038,
      "grad_norm": 0.8414140564117681,
      "learning_rate": 2.2624710027740364e-05,
      "loss": 1.0675,
      "num_input_tokens_seen": 47229575152,
      "step": 60030
    },
    {
      "epoch": 6.368661150010609,
      "grad_norm": 0.7182859975163588,
      "learning_rate": 2.2624018203761678e-05,
      "loss": 0.9982,
      "num_input_tokens_seen": 47230361888,
      "step": 60031
    },
    {
      "epoch": 6.368767239550181,
      "grad_norm": 0.7657953390551208,
      "learning_rate": 2.2623326381619085e-05,
      "loss": 1.0435,
      "num_input_tokens_seen": 47231148656,
      "step": 60032
    },
    {
      "epoch": 6.368873329089752,
      "grad_norm": 0.835907682506604,
      "learning_rate": 2.2622634561313117e-05,
      "loss": 1.0656,
      "num_input_tokens_seen": 47231935472,
      "step": 60033
    },
    {
      "epoch": 6.368979418629323,
      "grad_norm": 0.7394852567446631,
      "learning_rate": 2.2621942742844303e-05,
      "loss": 1.094,
      "num_input_tokens_seen": 47232722288,
      "step": 60034
    },
    {
      "epoch": 6.369085508168895,
      "grad_norm": 0.7839825086947956,
      "learning_rate": 2.2621250926213184e-05,
      "loss": 0.9857,
      "num_input_tokens_seen": 47233509200,
      "step": 60035
    },
    {
      "epoch": 6.369191597708466,
      "grad_norm": 0.8047686479867,
      "learning_rate": 2.2620559111420296e-05,
      "loss": 1.0044,
      "num_input_tokens_seen": 47234296016,
      "step": 60036
    },
    {
      "epoch": 6.369297687248038,
      "grad_norm": 0.9460613806578113,
      "learning_rate": 2.261986729846616e-05,
      "loss": 0.9594,
      "num_input_tokens_seen": 47235082752,
      "step": 60037
    },
    {
      "epoch": 6.369403776787609,
      "grad_norm": 0.712701664619737,
      "learning_rate": 2.261917548735133e-05,
      "loss": 1.1035,
      "num_input_tokens_seen": 47235869488,
      "step": 60038
    },
    {
      "epoch": 6.3695098663271805,
      "grad_norm": 0.6874814120751426,
      "learning_rate": 2.261848367807633e-05,
      "loss": 0.9574,
      "num_input_tokens_seen": 47236656256,
      "step": 60039
    },
    {
      "epoch": 6.3696159558667516,
      "grad_norm": 0.7517688017384144,
      "learning_rate": 2.261779187064169e-05,
      "loss": 1.0345,
      "num_input_tokens_seen": 47237442976,
      "step": 60040
    },
    {
      "epoch": 6.369722045406323,
      "grad_norm": 0.795829751663163,
      "learning_rate": 2.2617100065047957e-05,
      "loss": 0.9816,
      "num_input_tokens_seen": 47238229808,
      "step": 60041
    },
    {
      "epoch": 6.3698281349458945,
      "grad_norm": 0.8566138375638892,
      "learning_rate": 2.261640826129566e-05,
      "loss": 1.0274,
      "num_input_tokens_seen": 47239016656,
      "step": 60042
    },
    {
      "epoch": 6.3699342244854655,
      "grad_norm": 0.8004647096573637,
      "learning_rate": 2.2615716459385325e-05,
      "loss": 1.0666,
      "num_input_tokens_seen": 47239803440,
      "step": 60043
    },
    {
      "epoch": 6.3700403140250375,
      "grad_norm": 0.8589907704521454,
      "learning_rate": 2.26150246593175e-05,
      "loss": 0.9782,
      "num_input_tokens_seen": 47240590144,
      "step": 60044
    },
    {
      "epoch": 6.3701464035646085,
      "grad_norm": 0.835580839252385,
      "learning_rate": 2.2614332861092717e-05,
      "loss": 1.0986,
      "num_input_tokens_seen": 47241376912,
      "step": 60045
    },
    {
      "epoch": 6.3702524931041795,
      "grad_norm": 0.7294186957271841,
      "learning_rate": 2.2613641064711496e-05,
      "loss": 0.9298,
      "num_input_tokens_seen": 47242163648,
      "step": 60046
    },
    {
      "epoch": 6.370358582643751,
      "grad_norm": 0.6782865744782984,
      "learning_rate": 2.2612949270174395e-05,
      "loss": 0.9657,
      "num_input_tokens_seen": 47242950464,
      "step": 60047
    },
    {
      "epoch": 6.3704646721833225,
      "grad_norm": 0.7515371257260361,
      "learning_rate": 2.2612257477481928e-05,
      "loss": 1.0004,
      "num_input_tokens_seen": 47243737184,
      "step": 60048
    },
    {
      "epoch": 6.370570761722894,
      "grad_norm": 0.7782660270552845,
      "learning_rate": 2.2611565686634644e-05,
      "loss": 1.0374,
      "num_input_tokens_seen": 47244523920,
      "step": 60049
    },
    {
      "epoch": 6.370676851262465,
      "grad_norm": 0.7973576167300801,
      "learning_rate": 2.2610873897633073e-05,
      "loss": 1.0354,
      "num_input_tokens_seen": 47245310672,
      "step": 60050
    },
    {
      "epoch": 6.370782940802037,
      "grad_norm": 0.6384447972589278,
      "learning_rate": 2.261018211047774e-05,
      "loss": 0.9566,
      "num_input_tokens_seen": 47246097376,
      "step": 60051
    },
    {
      "epoch": 6.370889030341608,
      "grad_norm": 0.744293839116936,
      "learning_rate": 2.26094903251692e-05,
      "loss": 1.0405,
      "num_input_tokens_seen": 47246884048,
      "step": 60052
    },
    {
      "epoch": 6.370995119881179,
      "grad_norm": 0.8313968738952567,
      "learning_rate": 2.2608798541707972e-05,
      "loss": 1.0365,
      "num_input_tokens_seen": 47247670848,
      "step": 60053
    },
    {
      "epoch": 6.371101209420751,
      "grad_norm": 0.7521927526141756,
      "learning_rate": 2.2608106760094588e-05,
      "loss": 1.02,
      "num_input_tokens_seen": 47248457616,
      "step": 60054
    },
    {
      "epoch": 6.371207298960322,
      "grad_norm": 0.7432995262651023,
      "learning_rate": 2.2607414980329595e-05,
      "loss": 0.9739,
      "num_input_tokens_seen": 47249244304,
      "step": 60055
    },
    {
      "epoch": 6.371313388499894,
      "grad_norm": 0.9358188014539905,
      "learning_rate": 2.260672320241352e-05,
      "loss": 1.0452,
      "num_input_tokens_seen": 47250030976,
      "step": 60056
    },
    {
      "epoch": 6.371419478039465,
      "grad_norm": 0.7018663409554692,
      "learning_rate": 2.2606031426346897e-05,
      "loss": 0.9789,
      "num_input_tokens_seen": 47250817744,
      "step": 60057
    },
    {
      "epoch": 6.371525567579036,
      "grad_norm": 0.8175164313413934,
      "learning_rate": 2.2605339652130268e-05,
      "loss": 1.0022,
      "num_input_tokens_seen": 47251604448,
      "step": 60058
    },
    {
      "epoch": 6.371631657118608,
      "grad_norm": 0.8126169347264038,
      "learning_rate": 2.260464787976416e-05,
      "loss": 1.079,
      "num_input_tokens_seen": 47252391152,
      "step": 60059
    },
    {
      "epoch": 6.371737746658179,
      "grad_norm": 0.87176251780669,
      "learning_rate": 2.2603956109249105e-05,
      "loss": 1.0581,
      "num_input_tokens_seen": 47253177872,
      "step": 60060
    },
    {
      "epoch": 6.371843836197751,
      "grad_norm": 0.853396579172032,
      "learning_rate": 2.260326434058565e-05,
      "loss": 1.021,
      "num_input_tokens_seen": 47253964576,
      "step": 60061
    },
    {
      "epoch": 6.371949925737322,
      "grad_norm": 1.0312854781893859,
      "learning_rate": 2.260257257377431e-05,
      "loss": 0.9527,
      "num_input_tokens_seen": 47254751328,
      "step": 60062
    },
    {
      "epoch": 6.372056015276893,
      "grad_norm": 1.1436506861508287,
      "learning_rate": 2.2601880808815644e-05,
      "loss": 1.0343,
      "num_input_tokens_seen": 47255538128,
      "step": 60063
    },
    {
      "epoch": 6.372162104816465,
      "grad_norm": 0.8075472544183045,
      "learning_rate": 2.2601189045710173e-05,
      "loss": 1.0943,
      "num_input_tokens_seen": 47256324816,
      "step": 60064
    },
    {
      "epoch": 6.372268194356036,
      "grad_norm": 0.6903414212969878,
      "learning_rate": 2.2600497284458424e-05,
      "loss": 1.0041,
      "num_input_tokens_seen": 47257111504,
      "step": 60065
    },
    {
      "epoch": 6.372374283895608,
      "grad_norm": 0.7539575399834904,
      "learning_rate": 2.259980552506095e-05,
      "loss": 1.0109,
      "num_input_tokens_seen": 47257898320,
      "step": 60066
    },
    {
      "epoch": 6.372480373435179,
      "grad_norm": 0.7304166713885593,
      "learning_rate": 2.2599113767518272e-05,
      "loss": 1.0372,
      "num_input_tokens_seen": 47258685056,
      "step": 60067
    },
    {
      "epoch": 6.372586462974751,
      "grad_norm": 0.7247798697827511,
      "learning_rate": 2.2598422011830926e-05,
      "loss": 1.0048,
      "num_input_tokens_seen": 47259471856,
      "step": 60068
    },
    {
      "epoch": 6.372692552514322,
      "grad_norm": 0.7113760640645659,
      "learning_rate": 2.259773025799945e-05,
      "loss": 1.0289,
      "num_input_tokens_seen": 47260258656,
      "step": 60069
    },
    {
      "epoch": 6.372798642053893,
      "grad_norm": 0.7556616199804048,
      "learning_rate": 2.2597038506024382e-05,
      "loss": 1.027,
      "num_input_tokens_seen": 47261045424,
      "step": 60070
    },
    {
      "epoch": 6.372904731593465,
      "grad_norm": 0.6998820772553297,
      "learning_rate": 2.2596346755906244e-05,
      "loss": 0.9739,
      "num_input_tokens_seen": 47261832208,
      "step": 60071
    },
    {
      "epoch": 6.373010821133036,
      "grad_norm": 0.720236646571434,
      "learning_rate": 2.2595655007645585e-05,
      "loss": 0.9725,
      "num_input_tokens_seen": 47262618992,
      "step": 60072
    },
    {
      "epoch": 6.373116910672608,
      "grad_norm": 0.98756777011828,
      "learning_rate": 2.2594963261242937e-05,
      "loss": 0.9864,
      "num_input_tokens_seen": 47263405696,
      "step": 60073
    },
    {
      "epoch": 6.373223000212179,
      "grad_norm": 1.0838706758023582,
      "learning_rate": 2.259427151669882e-05,
      "loss": 0.9545,
      "num_input_tokens_seen": 47264192448,
      "step": 60074
    },
    {
      "epoch": 6.373329089751751,
      "grad_norm": 0.7496910464997455,
      "learning_rate": 2.2593579774013787e-05,
      "loss": 0.9834,
      "num_input_tokens_seen": 47264979312,
      "step": 60075
    },
    {
      "epoch": 6.373435179291322,
      "grad_norm": 0.7798585144250595,
      "learning_rate": 2.2592888033188363e-05,
      "loss": 0.9363,
      "num_input_tokens_seen": 47265766016,
      "step": 60076
    },
    {
      "epoch": 6.373541268830893,
      "grad_norm": 0.6705350350420161,
      "learning_rate": 2.2592196294223084e-05,
      "loss": 0.9481,
      "num_input_tokens_seen": 47266552864,
      "step": 60077
    },
    {
      "epoch": 6.373647358370465,
      "grad_norm": 0.8761943832543896,
      "learning_rate": 2.2591504557118485e-05,
      "loss": 1.0515,
      "num_input_tokens_seen": 47267339680,
      "step": 60078
    },
    {
      "epoch": 6.373753447910036,
      "grad_norm": 0.681830811376485,
      "learning_rate": 2.25908128218751e-05,
      "loss": 1.0314,
      "num_input_tokens_seen": 47268126336,
      "step": 60079
    },
    {
      "epoch": 6.373859537449608,
      "grad_norm": 0.8263098373667549,
      "learning_rate": 2.259012108849346e-05,
      "loss": 0.9835,
      "num_input_tokens_seen": 47268913120,
      "step": 60080
    },
    {
      "epoch": 6.373965626989179,
      "grad_norm": 0.7657456964228434,
      "learning_rate": 2.2589429356974108e-05,
      "loss": 1.0176,
      "num_input_tokens_seen": 47269699920,
      "step": 60081
    },
    {
      "epoch": 6.37407171652875,
      "grad_norm": 0.8426182388600773,
      "learning_rate": 2.2588737627317575e-05,
      "loss": 1.1013,
      "num_input_tokens_seen": 47270486672,
      "step": 60082
    },
    {
      "epoch": 6.374177806068322,
      "grad_norm": 1.0886304982838808,
      "learning_rate": 2.258804589952439e-05,
      "loss": 0.9936,
      "num_input_tokens_seen": 47271273488,
      "step": 60083
    },
    {
      "epoch": 6.374283895607893,
      "grad_norm": 0.7633519978161185,
      "learning_rate": 2.25873541735951e-05,
      "loss": 1.0166,
      "num_input_tokens_seen": 47272060304,
      "step": 60084
    },
    {
      "epoch": 6.374389985147465,
      "grad_norm": 1.25867771377289,
      "learning_rate": 2.2586662449530232e-05,
      "loss": 0.945,
      "num_input_tokens_seen": 47272847104,
      "step": 60085
    },
    {
      "epoch": 6.374496074687036,
      "grad_norm": 0.844757558383753,
      "learning_rate": 2.2585970727330314e-05,
      "loss": 0.969,
      "num_input_tokens_seen": 47273633904,
      "step": 60086
    },
    {
      "epoch": 6.374602164226607,
      "grad_norm": 0.7453433308015794,
      "learning_rate": 2.2585279006995894e-05,
      "loss": 0.921,
      "num_input_tokens_seen": 47274420704,
      "step": 60087
    },
    {
      "epoch": 6.374708253766179,
      "grad_norm": 0.926799985596411,
      "learning_rate": 2.2584587288527498e-05,
      "loss": 1.0654,
      "num_input_tokens_seen": 47275207408,
      "step": 60088
    },
    {
      "epoch": 6.37481434330575,
      "grad_norm": 1.0190478147567217,
      "learning_rate": 2.2583895571925657e-05,
      "loss": 1.0228,
      "num_input_tokens_seen": 47275994096,
      "step": 60089
    },
    {
      "epoch": 6.374920432845322,
      "grad_norm": 0.7962261133625416,
      "learning_rate": 2.2583203857190914e-05,
      "loss": 0.9191,
      "num_input_tokens_seen": 47276780864,
      "step": 60090
    },
    {
      "epoch": 6.375026522384893,
      "grad_norm": 0.707307915801122,
      "learning_rate": 2.25825121443238e-05,
      "loss": 1.0354,
      "num_input_tokens_seen": 47277567712,
      "step": 60091
    },
    {
      "epoch": 6.375132611924464,
      "grad_norm": 0.9819740085930462,
      "learning_rate": 2.258182043332485e-05,
      "loss": 0.9809,
      "num_input_tokens_seen": 47278354528,
      "step": 60092
    },
    {
      "epoch": 6.375238701464036,
      "grad_norm": 0.8755064028895816,
      "learning_rate": 2.25811287241946e-05,
      "loss": 0.9755,
      "num_input_tokens_seen": 47279141296,
      "step": 60093
    },
    {
      "epoch": 6.375344791003607,
      "grad_norm": 0.8509731006914628,
      "learning_rate": 2.258043701693358e-05,
      "loss": 1.064,
      "num_input_tokens_seen": 47279928080,
      "step": 60094
    },
    {
      "epoch": 6.375450880543179,
      "grad_norm": 0.7389728150358315,
      "learning_rate": 2.2579745311542326e-05,
      "loss": 0.9332,
      "num_input_tokens_seen": 47280714928,
      "step": 60095
    },
    {
      "epoch": 6.37555697008275,
      "grad_norm": 0.8199423574912423,
      "learning_rate": 2.2579053608021378e-05,
      "loss": 1.0507,
      "num_input_tokens_seen": 47281501584,
      "step": 60096
    },
    {
      "epoch": 6.375663059622322,
      "grad_norm": 0.7342714068970244,
      "learning_rate": 2.2578361906371265e-05,
      "loss": 1.0316,
      "num_input_tokens_seen": 47282288368,
      "step": 60097
    },
    {
      "epoch": 6.375769149161893,
      "grad_norm": 0.6925503838907406,
      "learning_rate": 2.257767020659252e-05,
      "loss": 0.9794,
      "num_input_tokens_seen": 47283075168,
      "step": 60098
    },
    {
      "epoch": 6.375875238701464,
      "grad_norm": 0.9921034534370512,
      "learning_rate": 2.2576978508685685e-05,
      "loss": 1.0641,
      "num_input_tokens_seen": 47283861936,
      "step": 60099
    },
    {
      "epoch": 6.375981328241036,
      "grad_norm": 0.7408037888703841,
      "learning_rate": 2.257628681265128e-05,
      "loss": 0.9727,
      "num_input_tokens_seen": 47284648720,
      "step": 60100
    },
    {
      "epoch": 6.376087417780607,
      "grad_norm": 1.0661530092683662,
      "learning_rate": 2.257559511848986e-05,
      "loss": 1.0571,
      "num_input_tokens_seen": 47285435488,
      "step": 60101
    },
    {
      "epoch": 6.3761935073201785,
      "grad_norm": 1.0026149811859146,
      "learning_rate": 2.257490342620195e-05,
      "loss": 1.0583,
      "num_input_tokens_seen": 47286222208,
      "step": 60102
    },
    {
      "epoch": 6.37629959685975,
      "grad_norm": 0.8194478754938498,
      "learning_rate": 2.2574211735788077e-05,
      "loss": 0.9257,
      "num_input_tokens_seen": 47287008896,
      "step": 60103
    },
    {
      "epoch": 6.3764056863993215,
      "grad_norm": 0.9110049732401155,
      "learning_rate": 2.2573520047248783e-05,
      "loss": 1.0137,
      "num_input_tokens_seen": 47287795664,
      "step": 60104
    },
    {
      "epoch": 6.3765117759388925,
      "grad_norm": 0.8618473222635807,
      "learning_rate": 2.2572828360584604e-05,
      "loss": 0.9955,
      "num_input_tokens_seen": 47288582400,
      "step": 60105
    },
    {
      "epoch": 6.3766178654784635,
      "grad_norm": 0.7482598307117554,
      "learning_rate": 2.2572136675796067e-05,
      "loss": 0.9933,
      "num_input_tokens_seen": 47289369136,
      "step": 60106
    },
    {
      "epoch": 6.3767239550180355,
      "grad_norm": 1.0041518907020923,
      "learning_rate": 2.257144499288372e-05,
      "loss": 1.0338,
      "num_input_tokens_seen": 47290155984,
      "step": 60107
    },
    {
      "epoch": 6.3768300445576065,
      "grad_norm": 0.9139399817619867,
      "learning_rate": 2.2570753311848084e-05,
      "loss": 0.9875,
      "num_input_tokens_seen": 47290942816,
      "step": 60108
    },
    {
      "epoch": 6.376936134097178,
      "grad_norm": 0.9484123807459628,
      "learning_rate": 2.2570061632689697e-05,
      "loss": 1.0686,
      "num_input_tokens_seen": 47291729616,
      "step": 60109
    },
    {
      "epoch": 6.377042223636749,
      "grad_norm": 0.7311477400535275,
      "learning_rate": 2.2569369955409098e-05,
      "loss": 1.0371,
      "num_input_tokens_seen": 47292516336,
      "step": 60110
    },
    {
      "epoch": 6.3771483131763205,
      "grad_norm": 0.6798284203807684,
      "learning_rate": 2.2568678280006818e-05,
      "loss": 0.9091,
      "num_input_tokens_seen": 47293303184,
      "step": 60111
    },
    {
      "epoch": 6.377254402715892,
      "grad_norm": 1.0320136355490641,
      "learning_rate": 2.256798660648339e-05,
      "loss": 0.9504,
      "num_input_tokens_seen": 47294090016,
      "step": 60112
    },
    {
      "epoch": 6.377360492255463,
      "grad_norm": 0.7751308280660281,
      "learning_rate": 2.2567294934839354e-05,
      "loss": 1.03,
      "num_input_tokens_seen": 47294876912,
      "step": 60113
    },
    {
      "epoch": 6.377466581795035,
      "grad_norm": 0.7255257304675351,
      "learning_rate": 2.256660326507524e-05,
      "loss": 0.9933,
      "num_input_tokens_seen": 47295663728,
      "step": 60114
    },
    {
      "epoch": 6.377572671334606,
      "grad_norm": 1.0057365102409364,
      "learning_rate": 2.256591159719158e-05,
      "loss": 1.0182,
      "num_input_tokens_seen": 47296450464,
      "step": 60115
    },
    {
      "epoch": 6.377678760874177,
      "grad_norm": 0.9149174444368228,
      "learning_rate": 2.2565219931188917e-05,
      "loss": 1.0909,
      "num_input_tokens_seen": 47297237168,
      "step": 60116
    },
    {
      "epoch": 6.377784850413749,
      "grad_norm": 0.8264611113441618,
      "learning_rate": 2.2564528267067774e-05,
      "loss": 0.9415,
      "num_input_tokens_seen": 47298023872,
      "step": 60117
    },
    {
      "epoch": 6.37789093995332,
      "grad_norm": 0.7442730682878008,
      "learning_rate": 2.25638366048287e-05,
      "loss": 1.0672,
      "num_input_tokens_seen": 47298810608,
      "step": 60118
    },
    {
      "epoch": 6.377997029492892,
      "grad_norm": 0.8986119261647143,
      "learning_rate": 2.256314494447222e-05,
      "loss": 1.0925,
      "num_input_tokens_seen": 47299597440,
      "step": 60119
    },
    {
      "epoch": 6.378103119032463,
      "grad_norm": 0.7244319970695176,
      "learning_rate": 2.2562453285998863e-05,
      "loss": 1.0354,
      "num_input_tokens_seen": 47300384192,
      "step": 60120
    },
    {
      "epoch": 6.378209208572034,
      "grad_norm": 0.7667206185486715,
      "learning_rate": 2.2561761629409178e-05,
      "loss": 0.9466,
      "num_input_tokens_seen": 47301170928,
      "step": 60121
    },
    {
      "epoch": 6.378315298111606,
      "grad_norm": 1.2783869516563837,
      "learning_rate": 2.2561069974703694e-05,
      "loss": 1.0129,
      "num_input_tokens_seen": 47301957808,
      "step": 60122
    },
    {
      "epoch": 6.378421387651177,
      "grad_norm": 0.8276217603352891,
      "learning_rate": 2.2560378321882937e-05,
      "loss": 0.9803,
      "num_input_tokens_seen": 47302744576,
      "step": 60123
    },
    {
      "epoch": 6.378527477190749,
      "grad_norm": 0.8559762229851285,
      "learning_rate": 2.255968667094745e-05,
      "loss": 1.081,
      "num_input_tokens_seen": 47303531360,
      "step": 60124
    },
    {
      "epoch": 6.37863356673032,
      "grad_norm": 1.0416543314078872,
      "learning_rate": 2.255899502189777e-05,
      "loss": 0.9882,
      "num_input_tokens_seen": 47304318144,
      "step": 60125
    },
    {
      "epoch": 6.378739656269892,
      "grad_norm": 0.7653332806697883,
      "learning_rate": 2.255830337473442e-05,
      "loss": 1.0061,
      "num_input_tokens_seen": 47305104912,
      "step": 60126
    },
    {
      "epoch": 6.378845745809463,
      "grad_norm": 0.7595978069132601,
      "learning_rate": 2.2557611729457946e-05,
      "loss": 1.0064,
      "num_input_tokens_seen": 47305891664,
      "step": 60127
    },
    {
      "epoch": 6.378951835349034,
      "grad_norm": 0.8573915876505189,
      "learning_rate": 2.2556920086068877e-05,
      "loss": 1.0557,
      "num_input_tokens_seen": 47306678384,
      "step": 60128
    },
    {
      "epoch": 6.379057924888606,
      "grad_norm": 0.9728111587593483,
      "learning_rate": 2.2556228444567745e-05,
      "loss": 0.9745,
      "num_input_tokens_seen": 47307465104,
      "step": 60129
    },
    {
      "epoch": 6.379164014428177,
      "grad_norm": 1.0676072814051583,
      "learning_rate": 2.2555536804955094e-05,
      "loss": 0.9132,
      "num_input_tokens_seen": 47308251872,
      "step": 60130
    },
    {
      "epoch": 6.379270103967749,
      "grad_norm": 0.693693634896468,
      "learning_rate": 2.255484516723145e-05,
      "loss": 0.9847,
      "num_input_tokens_seen": 47309038656,
      "step": 60131
    },
    {
      "epoch": 6.37937619350732,
      "grad_norm": 1.1303078143129364,
      "learning_rate": 2.2554153531397344e-05,
      "loss": 1.0841,
      "num_input_tokens_seen": 47309825424,
      "step": 60132
    },
    {
      "epoch": 6.379482283046892,
      "grad_norm": 0.9435529898190914,
      "learning_rate": 2.2553461897453326e-05,
      "loss": 0.9345,
      "num_input_tokens_seen": 47310612256,
      "step": 60133
    },
    {
      "epoch": 6.379588372586463,
      "grad_norm": 0.6971699191084813,
      "learning_rate": 2.2552770265399915e-05,
      "loss": 0.9743,
      "num_input_tokens_seen": 47311399040,
      "step": 60134
    },
    {
      "epoch": 6.379694462126034,
      "grad_norm": 0.8079275437649275,
      "learning_rate": 2.255207863523765e-05,
      "loss": 1.0298,
      "num_input_tokens_seen": 47312185840,
      "step": 60135
    },
    {
      "epoch": 6.379800551665606,
      "grad_norm": 0.8471575882580088,
      "learning_rate": 2.2551387006967076e-05,
      "loss": 1.0125,
      "num_input_tokens_seen": 47312972512,
      "step": 60136
    },
    {
      "epoch": 6.379906641205177,
      "grad_norm": 0.7359668362366998,
      "learning_rate": 2.255069538058871e-05,
      "loss": 0.9845,
      "num_input_tokens_seen": 47313759168,
      "step": 60137
    },
    {
      "epoch": 6.380012730744749,
      "grad_norm": 0.9664763127561986,
      "learning_rate": 2.2550003756103097e-05,
      "loss": 1.0157,
      "num_input_tokens_seen": 47314545952,
      "step": 60138
    },
    {
      "epoch": 6.38011882028432,
      "grad_norm": 0.8694492438751508,
      "learning_rate": 2.254931213351077e-05,
      "loss": 1.0274,
      "num_input_tokens_seen": 47315332672,
      "step": 60139
    },
    {
      "epoch": 6.380224909823891,
      "grad_norm": 0.773286222274194,
      "learning_rate": 2.2548620512812257e-05,
      "loss": 1.0076,
      "num_input_tokens_seen": 47316119504,
      "step": 60140
    },
    {
      "epoch": 6.380330999363463,
      "grad_norm": 0.9176622154050869,
      "learning_rate": 2.254792889400811e-05,
      "loss": 0.921,
      "num_input_tokens_seen": 47316906336,
      "step": 60141
    },
    {
      "epoch": 6.380437088903034,
      "grad_norm": 0.8115683379392898,
      "learning_rate": 2.2547237277098844e-05,
      "loss": 0.9504,
      "num_input_tokens_seen": 47317693088,
      "step": 60142
    },
    {
      "epoch": 6.380543178442606,
      "grad_norm": 0.6882179130717705,
      "learning_rate": 2.2546545662085e-05,
      "loss": 0.9717,
      "num_input_tokens_seen": 47318479824,
      "step": 60143
    },
    {
      "epoch": 6.380649267982177,
      "grad_norm": 0.8223623257113895,
      "learning_rate": 2.2545854048967115e-05,
      "loss": 1.0006,
      "num_input_tokens_seen": 47319266608,
      "step": 60144
    },
    {
      "epoch": 6.380755357521748,
      "grad_norm": 0.8408775169251381,
      "learning_rate": 2.2545162437745724e-05,
      "loss": 1.0502,
      "num_input_tokens_seen": 47320053408,
      "step": 60145
    },
    {
      "epoch": 6.38086144706132,
      "grad_norm": 0.7072769507444853,
      "learning_rate": 2.2544470828421352e-05,
      "loss": 0.9415,
      "num_input_tokens_seen": 47320840208,
      "step": 60146
    },
    {
      "epoch": 6.380967536600891,
      "grad_norm": 0.7463484708189444,
      "learning_rate": 2.254377922099455e-05,
      "loss": 0.9634,
      "num_input_tokens_seen": 47321626944,
      "step": 60147
    },
    {
      "epoch": 6.381073626140463,
      "grad_norm": 0.6579288891617652,
      "learning_rate": 2.254308761546584e-05,
      "loss": 0.9167,
      "num_input_tokens_seen": 47322413728,
      "step": 60148
    },
    {
      "epoch": 6.381179715680034,
      "grad_norm": 0.8013981734159485,
      "learning_rate": 2.2542396011835756e-05,
      "loss": 1.119,
      "num_input_tokens_seen": 47323200352,
      "step": 60149
    },
    {
      "epoch": 6.381285805219606,
      "grad_norm": 0.7479336404384165,
      "learning_rate": 2.254170441010484e-05,
      "loss": 0.9676,
      "num_input_tokens_seen": 47323987120,
      "step": 60150
    },
    {
      "epoch": 6.381391894759177,
      "grad_norm": 0.6403512734582787,
      "learning_rate": 2.254101281027362e-05,
      "loss": 0.9613,
      "num_input_tokens_seen": 47324773904,
      "step": 60151
    },
    {
      "epoch": 6.381497984298748,
      "grad_norm": 0.7996158075521695,
      "learning_rate": 2.2540321212342638e-05,
      "loss": 1.005,
      "num_input_tokens_seen": 47325560704,
      "step": 60152
    },
    {
      "epoch": 6.38160407383832,
      "grad_norm": 0.6735860150029432,
      "learning_rate": 2.2539629616312424e-05,
      "loss": 0.9487,
      "num_input_tokens_seen": 47326347552,
      "step": 60153
    },
    {
      "epoch": 6.381710163377891,
      "grad_norm": 0.946822301178582,
      "learning_rate": 2.2538938022183508e-05,
      "loss": 1.0511,
      "num_input_tokens_seen": 47327134304,
      "step": 60154
    },
    {
      "epoch": 6.381816252917463,
      "grad_norm": 0.9502296135835374,
      "learning_rate": 2.253824642995643e-05,
      "loss": 1.0426,
      "num_input_tokens_seen": 47327921024,
      "step": 60155
    },
    {
      "epoch": 6.381922342457034,
      "grad_norm": 0.8100468592996862,
      "learning_rate": 2.2537554839631726e-05,
      "loss": 0.9469,
      "num_input_tokens_seen": 47328707808,
      "step": 60156
    },
    {
      "epoch": 6.382028431996605,
      "grad_norm": 0.7997848269021385,
      "learning_rate": 2.2536863251209918e-05,
      "loss": 1.0467,
      "num_input_tokens_seen": 47329494560,
      "step": 60157
    },
    {
      "epoch": 6.382134521536177,
      "grad_norm": 0.8331876803609846,
      "learning_rate": 2.253617166469156e-05,
      "loss": 0.9612,
      "num_input_tokens_seen": 47330281280,
      "step": 60158
    },
    {
      "epoch": 6.382240611075748,
      "grad_norm": 0.9838387216466886,
      "learning_rate": 2.2535480080077173e-05,
      "loss": 1.0268,
      "num_input_tokens_seen": 47331068096,
      "step": 60159
    },
    {
      "epoch": 6.38234670061532,
      "grad_norm": 0.7341912354128737,
      "learning_rate": 2.253478849736729e-05,
      "loss": 1.0101,
      "num_input_tokens_seen": 47331854864,
      "step": 60160
    },
    {
      "epoch": 6.382452790154891,
      "grad_norm": 0.7915062757403336,
      "learning_rate": 2.2534096916562454e-05,
      "loss": 0.9501,
      "num_input_tokens_seen": 47332641696,
      "step": 60161
    },
    {
      "epoch": 6.382558879694463,
      "grad_norm": 0.9038245883496605,
      "learning_rate": 2.25334053376632e-05,
      "loss": 1.0181,
      "num_input_tokens_seen": 47333428544,
      "step": 60162
    },
    {
      "epoch": 6.382664969234034,
      "grad_norm": 0.9734387416225316,
      "learning_rate": 2.2532713760670048e-05,
      "loss": 0.935,
      "num_input_tokens_seen": 47334215280,
      "step": 60163
    },
    {
      "epoch": 6.382771058773605,
      "grad_norm": 1.0077167304693841,
      "learning_rate": 2.253202218558355e-05,
      "loss": 1.0675,
      "num_input_tokens_seen": 47335002048,
      "step": 60164
    },
    {
      "epoch": 6.3828771483131765,
      "grad_norm": 0.8311258616033517,
      "learning_rate": 2.253133061240423e-05,
      "loss": 0.9527,
      "num_input_tokens_seen": 47335788832,
      "step": 60165
    },
    {
      "epoch": 6.382983237852748,
      "grad_norm": 1.0116237005928144,
      "learning_rate": 2.2530639041132625e-05,
      "loss": 0.98,
      "num_input_tokens_seen": 47336575552,
      "step": 60166
    },
    {
      "epoch": 6.3830893273923195,
      "grad_norm": 0.9634565207074599,
      "learning_rate": 2.2529947471769272e-05,
      "loss": 0.9615,
      "num_input_tokens_seen": 47337362320,
      "step": 60167
    },
    {
      "epoch": 6.3831954169318905,
      "grad_norm": 0.9347536670699138,
      "learning_rate": 2.25292559043147e-05,
      "loss": 1.0179,
      "num_input_tokens_seen": 47338149008,
      "step": 60168
    },
    {
      "epoch": 6.3833015064714616,
      "grad_norm": 0.8182796996635311,
      "learning_rate": 2.252856433876945e-05,
      "loss": 0.9951,
      "num_input_tokens_seen": 47338935856,
      "step": 60169
    },
    {
      "epoch": 6.3834075960110335,
      "grad_norm": 1.0051415395210042,
      "learning_rate": 2.252787277513405e-05,
      "loss": 0.9935,
      "num_input_tokens_seen": 47339722576,
      "step": 60170
    },
    {
      "epoch": 6.3835136855506045,
      "grad_norm": 0.6625730998697341,
      "learning_rate": 2.2527181213409038e-05,
      "loss": 0.9459,
      "num_input_tokens_seen": 47340509376,
      "step": 60171
    },
    {
      "epoch": 6.383619775090176,
      "grad_norm": 0.7213089084062527,
      "learning_rate": 2.252648965359495e-05,
      "loss": 1.0381,
      "num_input_tokens_seen": 47341296080,
      "step": 60172
    },
    {
      "epoch": 6.3837258646297474,
      "grad_norm": 0.8226827416590734,
      "learning_rate": 2.252579809569232e-05,
      "loss": 0.978,
      "num_input_tokens_seen": 47342082832,
      "step": 60173
    },
    {
      "epoch": 6.3838319541693185,
      "grad_norm": 1.107296387615462,
      "learning_rate": 2.2525106539701674e-05,
      "loss": 1.0645,
      "num_input_tokens_seen": 47342869616,
      "step": 60174
    },
    {
      "epoch": 6.38393804370889,
      "grad_norm": 0.7865255823794124,
      "learning_rate": 2.2524414985623545e-05,
      "loss": 0.983,
      "num_input_tokens_seen": 47343656352,
      "step": 60175
    },
    {
      "epoch": 6.384044133248461,
      "grad_norm": 0.8746510378233542,
      "learning_rate": 2.2523723433458488e-05,
      "loss": 0.9548,
      "num_input_tokens_seen": 47344443232,
      "step": 60176
    },
    {
      "epoch": 6.384150222788033,
      "grad_norm": 0.7343816783432306,
      "learning_rate": 2.2523031883207027e-05,
      "loss": 1.0162,
      "num_input_tokens_seen": 47345229984,
      "step": 60177
    },
    {
      "epoch": 6.384256312327604,
      "grad_norm": 0.7885161653581756,
      "learning_rate": 2.2522340334869687e-05,
      "loss": 1.03,
      "num_input_tokens_seen": 47346016640,
      "step": 60178
    },
    {
      "epoch": 6.384362401867176,
      "grad_norm": 0.6570451136812102,
      "learning_rate": 2.2521648788447018e-05,
      "loss": 1.0,
      "num_input_tokens_seen": 47346803424,
      "step": 60179
    },
    {
      "epoch": 6.384468491406747,
      "grad_norm": 0.6642727047473753,
      "learning_rate": 2.252095724393954e-05,
      "loss": 1.0314,
      "num_input_tokens_seen": 47347590240,
      "step": 60180
    },
    {
      "epoch": 6.384574580946318,
      "grad_norm": 1.1620553705119616,
      "learning_rate": 2.2520265701347793e-05,
      "loss": 1.0851,
      "num_input_tokens_seen": 47348377008,
      "step": 60181
    },
    {
      "epoch": 6.38468067048589,
      "grad_norm": 0.6629073161126456,
      "learning_rate": 2.2519574160672317e-05,
      "loss": 1.0055,
      "num_input_tokens_seen": 47349163840,
      "step": 60182
    },
    {
      "epoch": 6.384786760025461,
      "grad_norm": 0.7760737845199375,
      "learning_rate": 2.251888262191364e-05,
      "loss": 1.0201,
      "num_input_tokens_seen": 47349950624,
      "step": 60183
    },
    {
      "epoch": 6.384892849565033,
      "grad_norm": 1.0028209940506299,
      "learning_rate": 2.2518191085072292e-05,
      "loss": 1.0013,
      "num_input_tokens_seen": 47350737376,
      "step": 60184
    },
    {
      "epoch": 6.384998939104604,
      "grad_norm": 0.7757298249964916,
      "learning_rate": 2.2517499550148817e-05,
      "loss": 0.9984,
      "num_input_tokens_seen": 47351524096,
      "step": 60185
    },
    {
      "epoch": 6.385105028644175,
      "grad_norm": 1.1003626376900892,
      "learning_rate": 2.2516808017143746e-05,
      "loss": 0.9718,
      "num_input_tokens_seen": 47352310976,
      "step": 60186
    },
    {
      "epoch": 6.385211118183747,
      "grad_norm": 0.7857186638439233,
      "learning_rate": 2.2516116486057615e-05,
      "loss": 0.9242,
      "num_input_tokens_seen": 47353097808,
      "step": 60187
    },
    {
      "epoch": 6.385317207723318,
      "grad_norm": 0.8114992308857096,
      "learning_rate": 2.2515424956890956e-05,
      "loss": 1.0493,
      "num_input_tokens_seen": 47353884560,
      "step": 60188
    },
    {
      "epoch": 6.38542329726289,
      "grad_norm": 0.7610558522380392,
      "learning_rate": 2.2514733429644296e-05,
      "loss": 0.9324,
      "num_input_tokens_seen": 47354671344,
      "step": 60189
    },
    {
      "epoch": 6.385529386802461,
      "grad_norm": 1.4313766288211034,
      "learning_rate": 2.2514041904318182e-05,
      "loss": 1.0177,
      "num_input_tokens_seen": 47355458112,
      "step": 60190
    },
    {
      "epoch": 6.385635476342033,
      "grad_norm": 1.043656241453599,
      "learning_rate": 2.251335038091315e-05,
      "loss": 0.9978,
      "num_input_tokens_seen": 47356244976,
      "step": 60191
    },
    {
      "epoch": 6.385741565881604,
      "grad_norm": 0.8610320977706941,
      "learning_rate": 2.251265885942972e-05,
      "loss": 1.0479,
      "num_input_tokens_seen": 47357031696,
      "step": 60192
    },
    {
      "epoch": 6.385847655421175,
      "grad_norm": 1.4113757228597124,
      "learning_rate": 2.2511967339868437e-05,
      "loss": 0.9475,
      "num_input_tokens_seen": 47357818448,
      "step": 60193
    },
    {
      "epoch": 6.385953744960747,
      "grad_norm": 0.820597632736796,
      "learning_rate": 2.251127582222983e-05,
      "loss": 0.9958,
      "num_input_tokens_seen": 47358605168,
      "step": 60194
    },
    {
      "epoch": 6.386059834500318,
      "grad_norm": 0.7446698964739193,
      "learning_rate": 2.2510584306514438e-05,
      "loss": 0.998,
      "num_input_tokens_seen": 47359391968,
      "step": 60195
    },
    {
      "epoch": 6.38616592403989,
      "grad_norm": 0.7249761787396583,
      "learning_rate": 2.2509892792722795e-05,
      "loss": 1.0076,
      "num_input_tokens_seen": 47360178640,
      "step": 60196
    },
    {
      "epoch": 6.386272013579461,
      "grad_norm": 0.6849309429514349,
      "learning_rate": 2.2509201280855435e-05,
      "loss": 0.9176,
      "num_input_tokens_seen": 47360965392,
      "step": 60197
    },
    {
      "epoch": 6.386378103119032,
      "grad_norm": 0.6506694505438058,
      "learning_rate": 2.2508509770912882e-05,
      "loss": 0.9424,
      "num_input_tokens_seen": 47361752240,
      "step": 60198
    },
    {
      "epoch": 6.386484192658604,
      "grad_norm": 1.0668040789021722,
      "learning_rate": 2.250781826289569e-05,
      "loss": 1.0296,
      "num_input_tokens_seen": 47362539024,
      "step": 60199
    },
    {
      "epoch": 6.386590282198175,
      "grad_norm": 0.7176436503418723,
      "learning_rate": 2.250712675680438e-05,
      "loss": 1.0019,
      "num_input_tokens_seen": 47363325856,
      "step": 60200
    },
    {
      "epoch": 6.386696371737747,
      "grad_norm": 0.8320550929470228,
      "learning_rate": 2.2506435252639483e-05,
      "loss": 1.0869,
      "num_input_tokens_seen": 47364112704,
      "step": 60201
    },
    {
      "epoch": 6.386802461277318,
      "grad_norm": 1.4603672100495553,
      "learning_rate": 2.2505743750401546e-05,
      "loss": 1.0118,
      "num_input_tokens_seen": 47364899408,
      "step": 60202
    },
    {
      "epoch": 6.386908550816889,
      "grad_norm": 0.8704147130909965,
      "learning_rate": 2.2505052250091097e-05,
      "loss": 1.07,
      "num_input_tokens_seen": 47365686160,
      "step": 60203
    },
    {
      "epoch": 6.387014640356461,
      "grad_norm": 0.940259343920542,
      "learning_rate": 2.250436075170867e-05,
      "loss": 1.0238,
      "num_input_tokens_seen": 47366472912,
      "step": 60204
    },
    {
      "epoch": 6.387120729896032,
      "grad_norm": 1.1711044918619165,
      "learning_rate": 2.25036692552548e-05,
      "loss": 0.9589,
      "num_input_tokens_seen": 47367259776,
      "step": 60205
    },
    {
      "epoch": 6.387226819435604,
      "grad_norm": 1.2331412338575103,
      "learning_rate": 2.250297776073002e-05,
      "loss": 0.9847,
      "num_input_tokens_seen": 47368046528,
      "step": 60206
    },
    {
      "epoch": 6.387332908975175,
      "grad_norm": 0.9162017598331434,
      "learning_rate": 2.2502286268134864e-05,
      "loss": 1.0429,
      "num_input_tokens_seen": 47368833280,
      "step": 60207
    },
    {
      "epoch": 6.387438998514747,
      "grad_norm": 0.8634507779538448,
      "learning_rate": 2.2501594777469874e-05,
      "loss": 1.0388,
      "num_input_tokens_seen": 47369620112,
      "step": 60208
    },
    {
      "epoch": 6.387545088054318,
      "grad_norm": 1.2800377681420478,
      "learning_rate": 2.250090328873557e-05,
      "loss": 1.0421,
      "num_input_tokens_seen": 47370406928,
      "step": 60209
    },
    {
      "epoch": 6.387651177593889,
      "grad_norm": 0.9493898886097736,
      "learning_rate": 2.25002118019325e-05,
      "loss": 0.9253,
      "num_input_tokens_seen": 47371193712,
      "step": 60210
    },
    {
      "epoch": 6.387757267133461,
      "grad_norm": 0.7225468556498169,
      "learning_rate": 2.249952031706119e-05,
      "loss": 0.9696,
      "num_input_tokens_seen": 47371980544,
      "step": 60211
    },
    {
      "epoch": 6.387863356673032,
      "grad_norm": 0.9448018220971761,
      "learning_rate": 2.2498828834122175e-05,
      "loss": 1.06,
      "num_input_tokens_seen": 47372767312,
      "step": 60212
    },
    {
      "epoch": 6.387969446212604,
      "grad_norm": 0.9707377088599392,
      "learning_rate": 2.2498137353116e-05,
      "loss": 0.9653,
      "num_input_tokens_seen": 47373554160,
      "step": 60213
    },
    {
      "epoch": 6.388075535752175,
      "grad_norm": 0.7685406882296745,
      "learning_rate": 2.2497445874043187e-05,
      "loss": 1.0048,
      "num_input_tokens_seen": 47374340848,
      "step": 60214
    },
    {
      "epoch": 6.388181625291746,
      "grad_norm": 0.8008928846015257,
      "learning_rate": 2.2496754396904273e-05,
      "loss": 0.9933,
      "num_input_tokens_seen": 47375127648,
      "step": 60215
    },
    {
      "epoch": 6.388287714831318,
      "grad_norm": 1.2049081472716898,
      "learning_rate": 2.2496062921699795e-05,
      "loss": 1.0834,
      "num_input_tokens_seen": 47375914320,
      "step": 60216
    },
    {
      "epoch": 6.388393804370889,
      "grad_norm": 0.7398991698198045,
      "learning_rate": 2.249537144843029e-05,
      "loss": 1.0907,
      "num_input_tokens_seen": 47376701008,
      "step": 60217
    },
    {
      "epoch": 6.388499893910461,
      "grad_norm": 0.8515468405116129,
      "learning_rate": 2.249467997709628e-05,
      "loss": 0.9947,
      "num_input_tokens_seen": 47377487760,
      "step": 60218
    },
    {
      "epoch": 6.388605983450032,
      "grad_norm": 0.9386888859312013,
      "learning_rate": 2.2493988507698313e-05,
      "loss": 0.9221,
      "num_input_tokens_seen": 47378274464,
      "step": 60219
    },
    {
      "epoch": 6.388712072989604,
      "grad_norm": 0.8624367687406362,
      "learning_rate": 2.2493297040236913e-05,
      "loss": 1.0245,
      "num_input_tokens_seen": 47379061184,
      "step": 60220
    },
    {
      "epoch": 6.388818162529175,
      "grad_norm": 0.8075618025659921,
      "learning_rate": 2.2492605574712626e-05,
      "loss": 0.9771,
      "num_input_tokens_seen": 47379847952,
      "step": 60221
    },
    {
      "epoch": 6.388924252068746,
      "grad_norm": 1.3230106421410859,
      "learning_rate": 2.2491914111125978e-05,
      "loss": 1.0336,
      "num_input_tokens_seen": 47380634704,
      "step": 60222
    },
    {
      "epoch": 6.389030341608318,
      "grad_norm": 0.9959621587311543,
      "learning_rate": 2.2491222649477504e-05,
      "loss": 1.0565,
      "num_input_tokens_seen": 47381421472,
      "step": 60223
    },
    {
      "epoch": 6.389136431147889,
      "grad_norm": 0.7947445563029942,
      "learning_rate": 2.2490531189767743e-05,
      "loss": 0.9607,
      "num_input_tokens_seen": 47382208304,
      "step": 60224
    },
    {
      "epoch": 6.389242520687461,
      "grad_norm": 1.1833502993940777,
      "learning_rate": 2.2489839731997223e-05,
      "loss": 1.0015,
      "num_input_tokens_seen": 47382995008,
      "step": 60225
    },
    {
      "epoch": 6.389348610227032,
      "grad_norm": 0.9797306621211221,
      "learning_rate": 2.248914827616648e-05,
      "loss": 1.0819,
      "num_input_tokens_seen": 47383781776,
      "step": 60226
    },
    {
      "epoch": 6.389454699766603,
      "grad_norm": 0.8693513565537215,
      "learning_rate": 2.248845682227605e-05,
      "loss": 0.9268,
      "num_input_tokens_seen": 47384568560,
      "step": 60227
    },
    {
      "epoch": 6.3895607893061745,
      "grad_norm": 0.8607462791620882,
      "learning_rate": 2.248776537032647e-05,
      "loss": 0.9949,
      "num_input_tokens_seen": 47385355232,
      "step": 60228
    },
    {
      "epoch": 6.389666878845746,
      "grad_norm": 0.8956117836708525,
      "learning_rate": 2.2487073920318265e-05,
      "loss": 1.0708,
      "num_input_tokens_seen": 47386142000,
      "step": 60229
    },
    {
      "epoch": 6.3897729683853175,
      "grad_norm": 0.7558906557362043,
      "learning_rate": 2.248638247225198e-05,
      "loss": 1.0267,
      "num_input_tokens_seen": 47386928752,
      "step": 60230
    },
    {
      "epoch": 6.3898790579248885,
      "grad_norm": 0.7260012376902366,
      "learning_rate": 2.2485691026128147e-05,
      "loss": 0.9351,
      "num_input_tokens_seen": 47387715520,
      "step": 60231
    },
    {
      "epoch": 6.38998514746446,
      "grad_norm": 0.8196218655645389,
      "learning_rate": 2.248499958194729e-05,
      "loss": 1.0103,
      "num_input_tokens_seen": 47388502224,
      "step": 60232
    },
    {
      "epoch": 6.3900912370040315,
      "grad_norm": 0.9481906192491689,
      "learning_rate": 2.2484308139709963e-05,
      "loss": 0.9549,
      "num_input_tokens_seen": 47389288896,
      "step": 60233
    },
    {
      "epoch": 6.3901973265436025,
      "grad_norm": 0.7341673221557844,
      "learning_rate": 2.2483616699416683e-05,
      "loss": 0.9181,
      "num_input_tokens_seen": 47390075712,
      "step": 60234
    },
    {
      "epoch": 6.390303416083174,
      "grad_norm": 0.7752368196129454,
      "learning_rate": 2.2482925261067985e-05,
      "loss": 0.946,
      "num_input_tokens_seen": 47390862448,
      "step": 60235
    },
    {
      "epoch": 6.3904095056227455,
      "grad_norm": 0.8188795819502255,
      "learning_rate": 2.2482233824664416e-05,
      "loss": 0.9957,
      "num_input_tokens_seen": 47391649216,
      "step": 60236
    },
    {
      "epoch": 6.390515595162317,
      "grad_norm": 0.8003514786835156,
      "learning_rate": 2.2481542390206496e-05,
      "loss": 0.9453,
      "num_input_tokens_seen": 47392436016,
      "step": 60237
    },
    {
      "epoch": 6.390621684701888,
      "grad_norm": 1.0655756264975855,
      "learning_rate": 2.2480850957694773e-05,
      "loss": 1.0436,
      "num_input_tokens_seen": 47393222768,
      "step": 60238
    },
    {
      "epoch": 6.390727774241459,
      "grad_norm": 0.9292113931471165,
      "learning_rate": 2.2480159527129775e-05,
      "loss": 0.9628,
      "num_input_tokens_seen": 47394009584,
      "step": 60239
    },
    {
      "epoch": 6.390833863781031,
      "grad_norm": 0.6713063182963968,
      "learning_rate": 2.247946809851203e-05,
      "loss": 0.9664,
      "num_input_tokens_seen": 47394796400,
      "step": 60240
    },
    {
      "epoch": 6.390939953320602,
      "grad_norm": 0.6825778200482129,
      "learning_rate": 2.2478776671842085e-05,
      "loss": 1.0044,
      "num_input_tokens_seen": 47395583184,
      "step": 60241
    },
    {
      "epoch": 6.391046042860174,
      "grad_norm": 0.8199795316951142,
      "learning_rate": 2.2478085247120463e-05,
      "loss": 0.9643,
      "num_input_tokens_seen": 47396369904,
      "step": 60242
    },
    {
      "epoch": 6.391152132399745,
      "grad_norm": 0.6035765877603656,
      "learning_rate": 2.2477393824347697e-05,
      "loss": 0.9981,
      "num_input_tokens_seen": 47397156640,
      "step": 60243
    },
    {
      "epoch": 6.391258221939317,
      "grad_norm": 0.9796328200329508,
      "learning_rate": 2.2476702403524334e-05,
      "loss": 1.0329,
      "num_input_tokens_seen": 47397943376,
      "step": 60244
    },
    {
      "epoch": 6.391364311478888,
      "grad_norm": 0.7645466224069224,
      "learning_rate": 2.2476010984650906e-05,
      "loss": 0.9571,
      "num_input_tokens_seen": 47398730128,
      "step": 60245
    },
    {
      "epoch": 6.391470401018459,
      "grad_norm": 0.9143308991991775,
      "learning_rate": 2.2475319567727933e-05,
      "loss": 0.9711,
      "num_input_tokens_seen": 47399516880,
      "step": 60246
    },
    {
      "epoch": 6.391576490558031,
      "grad_norm": 0.6805773175322152,
      "learning_rate": 2.2474628152755965e-05,
      "loss": 0.9771,
      "num_input_tokens_seen": 47400303648,
      "step": 60247
    },
    {
      "epoch": 6.391682580097602,
      "grad_norm": 0.7099908931464958,
      "learning_rate": 2.247393673973553e-05,
      "loss": 0.8991,
      "num_input_tokens_seen": 47401090416,
      "step": 60248
    },
    {
      "epoch": 6.391788669637174,
      "grad_norm": 0.9476268178649506,
      "learning_rate": 2.2473245328667157e-05,
      "loss": 1.0499,
      "num_input_tokens_seen": 47401877184,
      "step": 60249
    },
    {
      "epoch": 6.391894759176745,
      "grad_norm": 0.7664602295699444,
      "learning_rate": 2.2472553919551392e-05,
      "loss": 1.0349,
      "num_input_tokens_seen": 47402663952,
      "step": 60250
    },
    {
      "epoch": 6.392000848716316,
      "grad_norm": 0.7976732722784425,
      "learning_rate": 2.2471862512388763e-05,
      "loss": 0.9943,
      "num_input_tokens_seen": 47403450752,
      "step": 60251
    },
    {
      "epoch": 6.392106938255888,
      "grad_norm": 0.8466783117325977,
      "learning_rate": 2.24711711071798e-05,
      "loss": 0.9495,
      "num_input_tokens_seen": 47404237472,
      "step": 60252
    },
    {
      "epoch": 6.392213027795459,
      "grad_norm": 0.7643024080911512,
      "learning_rate": 2.2470479703925044e-05,
      "loss": 0.9739,
      "num_input_tokens_seen": 47405024368,
      "step": 60253
    },
    {
      "epoch": 6.392319117335031,
      "grad_norm": 0.7818711273638114,
      "learning_rate": 2.246978830262502e-05,
      "loss": 1.0387,
      "num_input_tokens_seen": 47405811120,
      "step": 60254
    },
    {
      "epoch": 6.392425206874602,
      "grad_norm": 0.6575115671005484,
      "learning_rate": 2.2469096903280282e-05,
      "loss": 0.9487,
      "num_input_tokens_seen": 47406597872,
      "step": 60255
    },
    {
      "epoch": 6.392531296414173,
      "grad_norm": 0.6585553088945483,
      "learning_rate": 2.246840550589135e-05,
      "loss": 0.9564,
      "num_input_tokens_seen": 47407384592,
      "step": 60256
    },
    {
      "epoch": 6.392637385953745,
      "grad_norm": 0.9123044682498981,
      "learning_rate": 2.246771411045875e-05,
      "loss": 0.9673,
      "num_input_tokens_seen": 47408171424,
      "step": 60257
    },
    {
      "epoch": 6.392743475493316,
      "grad_norm": 0.8122609282196237,
      "learning_rate": 2.2467022716983036e-05,
      "loss": 1.0387,
      "num_input_tokens_seen": 47408958240,
      "step": 60258
    },
    {
      "epoch": 6.392849565032888,
      "grad_norm": 1.0938851551696196,
      "learning_rate": 2.246633132546473e-05,
      "loss": 1.0255,
      "num_input_tokens_seen": 47409744944,
      "step": 60259
    },
    {
      "epoch": 6.392955654572459,
      "grad_norm": 0.8743827370847588,
      "learning_rate": 2.2465639935904363e-05,
      "loss": 0.9704,
      "num_input_tokens_seen": 47410531760,
      "step": 60260
    },
    {
      "epoch": 6.39306174411203,
      "grad_norm": 0.6624099300779148,
      "learning_rate": 2.2464948548302482e-05,
      "loss": 0.9621,
      "num_input_tokens_seen": 47411318576,
      "step": 60261
    },
    {
      "epoch": 6.393167833651602,
      "grad_norm": 0.8533870075521431,
      "learning_rate": 2.2464257162659616e-05,
      "loss": 1.0171,
      "num_input_tokens_seen": 47412105376,
      "step": 60262
    },
    {
      "epoch": 6.393273923191173,
      "grad_norm": 1.0161404698765224,
      "learning_rate": 2.246356577897629e-05,
      "loss": 0.9549,
      "num_input_tokens_seen": 47412892160,
      "step": 60263
    },
    {
      "epoch": 6.393380012730745,
      "grad_norm": 0.6280743606336405,
      "learning_rate": 2.2462874397253052e-05,
      "loss": 1.0272,
      "num_input_tokens_seen": 47413678928,
      "step": 60264
    },
    {
      "epoch": 6.393486102270316,
      "grad_norm": 0.9134949704115991,
      "learning_rate": 2.246218301749043e-05,
      "loss": 1.0434,
      "num_input_tokens_seen": 47414465536,
      "step": 60265
    },
    {
      "epoch": 6.393592191809888,
      "grad_norm": 0.6758448189603501,
      "learning_rate": 2.2461491639688952e-05,
      "loss": 0.9511,
      "num_input_tokens_seen": 47415252240,
      "step": 60266
    },
    {
      "epoch": 6.393698281349459,
      "grad_norm": 0.9164513772187244,
      "learning_rate": 2.2460800263849167e-05,
      "loss": 0.9842,
      "num_input_tokens_seen": 47416039024,
      "step": 60267
    },
    {
      "epoch": 6.39380437088903,
      "grad_norm": 1.012577982427798,
      "learning_rate": 2.2460108889971592e-05,
      "loss": 1.0687,
      "num_input_tokens_seen": 47416825792,
      "step": 60268
    },
    {
      "epoch": 6.393910460428602,
      "grad_norm": 0.8916293686877022,
      "learning_rate": 2.2459417518056776e-05,
      "loss": 0.9772,
      "num_input_tokens_seen": 47417612576,
      "step": 60269
    },
    {
      "epoch": 6.394016549968173,
      "grad_norm": 0.8251667255195394,
      "learning_rate": 2.245872614810524e-05,
      "loss": 1.0651,
      "num_input_tokens_seen": 47418399440,
      "step": 60270
    },
    {
      "epoch": 6.394122639507745,
      "grad_norm": 1.0094212411566175,
      "learning_rate": 2.2458034780117535e-05,
      "loss": 1.0387,
      "num_input_tokens_seen": 47419186176,
      "step": 60271
    },
    {
      "epoch": 6.394228729047316,
      "grad_norm": 0.831222562793835,
      "learning_rate": 2.2457343414094188e-05,
      "loss": 0.9946,
      "num_input_tokens_seen": 47419972960,
      "step": 60272
    },
    {
      "epoch": 6.394334818586888,
      "grad_norm": 0.804714580514804,
      "learning_rate": 2.2456652050035724e-05,
      "loss": 1.0714,
      "num_input_tokens_seen": 47420759696,
      "step": 60273
    },
    {
      "epoch": 6.394440908126459,
      "grad_norm": 0.8084977609760668,
      "learning_rate": 2.2455960687942688e-05,
      "loss": 0.9345,
      "num_input_tokens_seen": 47421546608,
      "step": 60274
    },
    {
      "epoch": 6.39454699766603,
      "grad_norm": 0.6640998903431007,
      "learning_rate": 2.2455269327815608e-05,
      "loss": 0.9067,
      "num_input_tokens_seen": 47422333472,
      "step": 60275
    },
    {
      "epoch": 6.394653087205602,
      "grad_norm": 0.940511124322387,
      "learning_rate": 2.2454577969655028e-05,
      "loss": 1.1079,
      "num_input_tokens_seen": 47423120208,
      "step": 60276
    },
    {
      "epoch": 6.394759176745173,
      "grad_norm": 0.8829052324135745,
      "learning_rate": 2.245388661346147e-05,
      "loss": 0.9835,
      "num_input_tokens_seen": 47423907056,
      "step": 60277
    },
    {
      "epoch": 6.394865266284745,
      "grad_norm": 0.7151691888043614,
      "learning_rate": 2.2453195259235474e-05,
      "loss": 0.9907,
      "num_input_tokens_seen": 47424693872,
      "step": 60278
    },
    {
      "epoch": 6.394971355824316,
      "grad_norm": 0.6926265432889176,
      "learning_rate": 2.2452503906977578e-05,
      "loss": 1.0292,
      "num_input_tokens_seen": 47425480672,
      "step": 60279
    },
    {
      "epoch": 6.395077445363887,
      "grad_norm": 0.7992083059879015,
      "learning_rate": 2.2451812556688312e-05,
      "loss": 1.0444,
      "num_input_tokens_seen": 47426267504,
      "step": 60280
    },
    {
      "epoch": 6.395183534903459,
      "grad_norm": 0.9148277850251858,
      "learning_rate": 2.2451121208368204e-05,
      "loss": 1.0368,
      "num_input_tokens_seen": 47427054240,
      "step": 60281
    },
    {
      "epoch": 6.39528962444303,
      "grad_norm": 0.7208993787813992,
      "learning_rate": 2.24504298620178e-05,
      "loss": 1.002,
      "num_input_tokens_seen": 47427840976,
      "step": 60282
    },
    {
      "epoch": 6.395395713982602,
      "grad_norm": 0.7069639445156264,
      "learning_rate": 2.244973851763763e-05,
      "loss": 0.9497,
      "num_input_tokens_seen": 47428627744,
      "step": 60283
    },
    {
      "epoch": 6.395501803522173,
      "grad_norm": 0.6779269091134128,
      "learning_rate": 2.2449047175228223e-05,
      "loss": 0.9288,
      "num_input_tokens_seen": 47429414544,
      "step": 60284
    },
    {
      "epoch": 6.395607893061744,
      "grad_norm": 0.6965237564808948,
      "learning_rate": 2.2448355834790123e-05,
      "loss": 0.9941,
      "num_input_tokens_seen": 47430201136,
      "step": 60285
    },
    {
      "epoch": 6.395713982601316,
      "grad_norm": 0.7380884098689854,
      "learning_rate": 2.2447664496323855e-05,
      "loss": 0.9143,
      "num_input_tokens_seen": 47430987920,
      "step": 60286
    },
    {
      "epoch": 6.395820072140887,
      "grad_norm": 0.7784295363500078,
      "learning_rate": 2.2446973159829954e-05,
      "loss": 0.9835,
      "num_input_tokens_seen": 47431774784,
      "step": 60287
    },
    {
      "epoch": 6.395926161680459,
      "grad_norm": 1.0611448361519273,
      "learning_rate": 2.244628182530896e-05,
      "loss": 1.0048,
      "num_input_tokens_seen": 47432561616,
      "step": 60288
    },
    {
      "epoch": 6.39603225122003,
      "grad_norm": 0.7519227169932876,
      "learning_rate": 2.2445590492761407e-05,
      "loss": 1.059,
      "num_input_tokens_seen": 47433348384,
      "step": 60289
    },
    {
      "epoch": 6.396138340759601,
      "grad_norm": 1.1717215943766648,
      "learning_rate": 2.2444899162187825e-05,
      "loss": 1.0127,
      "num_input_tokens_seen": 47434135264,
      "step": 60290
    },
    {
      "epoch": 6.396244430299173,
      "grad_norm": 0.9422400577115996,
      "learning_rate": 2.2444207833588752e-05,
      "loss": 1.013,
      "num_input_tokens_seen": 47434921984,
      "step": 60291
    },
    {
      "epoch": 6.396350519838744,
      "grad_norm": 0.7899643791641267,
      "learning_rate": 2.2443516506964716e-05,
      "loss": 1.0775,
      "num_input_tokens_seen": 47435708816,
      "step": 60292
    },
    {
      "epoch": 6.3964566093783155,
      "grad_norm": 0.9961475760919966,
      "learning_rate": 2.2442825182316256e-05,
      "loss": 1.0183,
      "num_input_tokens_seen": 47436495568,
      "step": 60293
    },
    {
      "epoch": 6.3965626989178865,
      "grad_norm": 0.8502262137039918,
      "learning_rate": 2.244213385964391e-05,
      "loss": 1.0324,
      "num_input_tokens_seen": 47437282400,
      "step": 60294
    },
    {
      "epoch": 6.3966687884574585,
      "grad_norm": 0.8460535057019032,
      "learning_rate": 2.2441442538948202e-05,
      "loss": 0.9888,
      "num_input_tokens_seen": 47438069248,
      "step": 60295
    },
    {
      "epoch": 6.3967748779970295,
      "grad_norm": 0.7414680298206398,
      "learning_rate": 2.2440751220229677e-05,
      "loss": 1.0208,
      "num_input_tokens_seen": 47438856064,
      "step": 60296
    },
    {
      "epoch": 6.3968809675366005,
      "grad_norm": 0.813333192057563,
      "learning_rate": 2.2440059903488866e-05,
      "loss": 0.9935,
      "num_input_tokens_seen": 47439642752,
      "step": 60297
    },
    {
      "epoch": 6.396987057076172,
      "grad_norm": 0.7717040461416144,
      "learning_rate": 2.2439368588726296e-05,
      "loss": 1.0693,
      "num_input_tokens_seen": 47440429568,
      "step": 60298
    },
    {
      "epoch": 6.3970931466157435,
      "grad_norm": 0.7264142975770914,
      "learning_rate": 2.243867727594251e-05,
      "loss": 1.0728,
      "num_input_tokens_seen": 47441216352,
      "step": 60299
    },
    {
      "epoch": 6.397199236155315,
      "grad_norm": 0.7372745004820219,
      "learning_rate": 2.2437985965138038e-05,
      "loss": 0.9592,
      "num_input_tokens_seen": 47442003136,
      "step": 60300
    },
    {
      "epoch": 6.397305325694886,
      "grad_norm": 0.731021675006281,
      "learning_rate": 2.2437294656313413e-05,
      "loss": 0.9671,
      "num_input_tokens_seen": 47442789984,
      "step": 60301
    },
    {
      "epoch": 6.397411415234458,
      "grad_norm": 0.7976121661946445,
      "learning_rate": 2.2436603349469175e-05,
      "loss": 0.9914,
      "num_input_tokens_seen": 47443576768,
      "step": 60302
    },
    {
      "epoch": 6.397517504774029,
      "grad_norm": 0.7042163778122358,
      "learning_rate": 2.2435912044605855e-05,
      "loss": 0.9055,
      "num_input_tokens_seen": 47444363424,
      "step": 60303
    },
    {
      "epoch": 6.3976235943136,
      "grad_norm": 0.6915514060460429,
      "learning_rate": 2.2435220741723983e-05,
      "loss": 1.1019,
      "num_input_tokens_seen": 47445150128,
      "step": 60304
    },
    {
      "epoch": 6.397729683853172,
      "grad_norm": 0.6399109211824889,
      "learning_rate": 2.24345294408241e-05,
      "loss": 0.945,
      "num_input_tokens_seen": 47445936912,
      "step": 60305
    },
    {
      "epoch": 6.397835773392743,
      "grad_norm": 0.7424144998149613,
      "learning_rate": 2.2433838141906736e-05,
      "loss": 0.9434,
      "num_input_tokens_seen": 47446723744,
      "step": 60306
    },
    {
      "epoch": 6.397941862932315,
      "grad_norm": 0.7572213623549614,
      "learning_rate": 2.243314684497243e-05,
      "loss": 0.9868,
      "num_input_tokens_seen": 47447510560,
      "step": 60307
    },
    {
      "epoch": 6.398047952471886,
      "grad_norm": 0.7468480417402014,
      "learning_rate": 2.243245555002171e-05,
      "loss": 0.975,
      "num_input_tokens_seen": 47448297488,
      "step": 60308
    },
    {
      "epoch": 6.398154042011457,
      "grad_norm": 0.6867056135274845,
      "learning_rate": 2.2431764257055112e-05,
      "loss": 1.0611,
      "num_input_tokens_seen": 47449084192,
      "step": 60309
    },
    {
      "epoch": 6.398260131551029,
      "grad_norm": 0.8100244757987282,
      "learning_rate": 2.2431072966073175e-05,
      "loss": 0.9984,
      "num_input_tokens_seen": 47449870992,
      "step": 60310
    },
    {
      "epoch": 6.3983662210906,
      "grad_norm": 0.6684934717048507,
      "learning_rate": 2.243038167707643e-05,
      "loss": 0.9841,
      "num_input_tokens_seen": 47450657792,
      "step": 60311
    },
    {
      "epoch": 6.398472310630172,
      "grad_norm": 0.8732635980461826,
      "learning_rate": 2.2429690390065403e-05,
      "loss": 1.07,
      "num_input_tokens_seen": 47451444576,
      "step": 60312
    },
    {
      "epoch": 6.398578400169743,
      "grad_norm": 0.7203010279456816,
      "learning_rate": 2.242899910504064e-05,
      "loss": 1.0091,
      "num_input_tokens_seen": 47452231408,
      "step": 60313
    },
    {
      "epoch": 6.398684489709314,
      "grad_norm": 0.7148288994372946,
      "learning_rate": 2.2428307822002676e-05,
      "loss": 0.9699,
      "num_input_tokens_seen": 47453018208,
      "step": 60314
    },
    {
      "epoch": 6.398790579248886,
      "grad_norm": 0.7664328703512318,
      "learning_rate": 2.242761654095203e-05,
      "loss": 0.9129,
      "num_input_tokens_seen": 47453805024,
      "step": 60315
    },
    {
      "epoch": 6.398896668788457,
      "grad_norm": 0.7270116032660124,
      "learning_rate": 2.2426925261889257e-05,
      "loss": 0.9213,
      "num_input_tokens_seen": 47454591920,
      "step": 60316
    },
    {
      "epoch": 6.399002758328029,
      "grad_norm": 0.708407112709939,
      "learning_rate": 2.2426233984814876e-05,
      "loss": 0.9518,
      "num_input_tokens_seen": 47455378624,
      "step": 60317
    },
    {
      "epoch": 6.3991088478676,
      "grad_norm": 0.6550973555191286,
      "learning_rate": 2.242554270972942e-05,
      "loss": 0.9341,
      "num_input_tokens_seen": 47456165456,
      "step": 60318
    },
    {
      "epoch": 6.399214937407172,
      "grad_norm": 0.8466433816629104,
      "learning_rate": 2.242485143663344e-05,
      "loss": 1.0021,
      "num_input_tokens_seen": 47456952240,
      "step": 60319
    },
    {
      "epoch": 6.399321026946743,
      "grad_norm": 261.5021358316082,
      "learning_rate": 2.2424160165527455e-05,
      "loss": 1.5235,
      "num_input_tokens_seen": 47457738992,
      "step": 60320
    },
    {
      "epoch": 6.399427116486314,
      "grad_norm": 0.7281425082284217,
      "learning_rate": 2.2423468896412e-05,
      "loss": 0.9357,
      "num_input_tokens_seen": 47458525904,
      "step": 60321
    },
    {
      "epoch": 6.399533206025886,
      "grad_norm": 0.8785721198164117,
      "learning_rate": 2.2422777629287616e-05,
      "loss": 0.992,
      "num_input_tokens_seen": 47459312720,
      "step": 60322
    },
    {
      "epoch": 6.399639295565457,
      "grad_norm": 11.383524806957796,
      "learning_rate": 2.242208636415483e-05,
      "loss": 0.9886,
      "num_input_tokens_seen": 47460099536,
      "step": 60323
    },
    {
      "epoch": 6.399745385105029,
      "grad_norm": 0.7101414714688734,
      "learning_rate": 2.2421395101014186e-05,
      "loss": 0.9206,
      "num_input_tokens_seen": 47460886384,
      "step": 60324
    },
    {
      "epoch": 6.3998514746446,
      "grad_norm": 0.9485020738578257,
      "learning_rate": 2.242070383986621e-05,
      "loss": 1.0005,
      "num_input_tokens_seen": 47461673168,
      "step": 60325
    },
    {
      "epoch": 6.399957564184171,
      "grad_norm": 0.7089089979677298,
      "learning_rate": 2.2420012580711435e-05,
      "loss": 1.0516,
      "num_input_tokens_seen": 47462459888,
      "step": 60326
    },
    {
      "epoch": 6.400063653723743,
      "grad_norm": 0.7238069355301221,
      "learning_rate": 2.2419321323550402e-05,
      "loss": 0.9824,
      "num_input_tokens_seen": 47463246672,
      "step": 60327
    },
    {
      "epoch": 6.400169743263314,
      "grad_norm": 0.7303067182070627,
      "learning_rate": 2.2418630068383644e-05,
      "loss": 1.0403,
      "num_input_tokens_seen": 47464033472,
      "step": 60328
    },
    {
      "epoch": 6.400275832802886,
      "grad_norm": 0.93119778581515,
      "learning_rate": 2.2417938815211686e-05,
      "loss": 0.9401,
      "num_input_tokens_seen": 47464820160,
      "step": 60329
    },
    {
      "epoch": 6.400381922342457,
      "grad_norm": 0.8927981821160039,
      "learning_rate": 2.2417247564035077e-05,
      "loss": 1.0021,
      "num_input_tokens_seen": 47465606976,
      "step": 60330
    },
    {
      "epoch": 6.400488011882029,
      "grad_norm": 0.7114260344837025,
      "learning_rate": 2.2416556314854338e-05,
      "loss": 1.0277,
      "num_input_tokens_seen": 47466393744,
      "step": 60331
    },
    {
      "epoch": 6.4005941014216,
      "grad_norm": 0.8153390551833268,
      "learning_rate": 2.241586506767001e-05,
      "loss": 1.0641,
      "num_input_tokens_seen": 47467180512,
      "step": 60332
    },
    {
      "epoch": 6.400700190961171,
      "grad_norm": 1.251197793378546,
      "learning_rate": 2.2415173822482627e-05,
      "loss": 0.9177,
      "num_input_tokens_seen": 47467967376,
      "step": 60333
    },
    {
      "epoch": 6.400806280500743,
      "grad_norm": 0.8088598377112274,
      "learning_rate": 2.241448257929272e-05,
      "loss": 0.9333,
      "num_input_tokens_seen": 47468754144,
      "step": 60334
    },
    {
      "epoch": 6.400912370040314,
      "grad_norm": 0.9812768063345019,
      "learning_rate": 2.241379133810082e-05,
      "loss": 0.9386,
      "num_input_tokens_seen": 47469540992,
      "step": 60335
    },
    {
      "epoch": 6.401018459579886,
      "grad_norm": 1.5592595596874965,
      "learning_rate": 2.2413100098907475e-05,
      "loss": 1.0847,
      "num_input_tokens_seen": 47470327632,
      "step": 60336
    },
    {
      "epoch": 6.401124549119457,
      "grad_norm": 1.0133167570643096,
      "learning_rate": 2.241240886171321e-05,
      "loss": 1.0625,
      "num_input_tokens_seen": 47471114432,
      "step": 60337
    },
    {
      "epoch": 6.401230638659028,
      "grad_norm": 0.8909229322991662,
      "learning_rate": 2.2411717626518552e-05,
      "loss": 0.9922,
      "num_input_tokens_seen": 47471901232,
      "step": 60338
    },
    {
      "epoch": 6.4013367281986,
      "grad_norm": 1.3198145621489457,
      "learning_rate": 2.241102639332405e-05,
      "loss": 0.9591,
      "num_input_tokens_seen": 47472688032,
      "step": 60339
    },
    {
      "epoch": 6.401442817738171,
      "grad_norm": 1.077961035255039,
      "learning_rate": 2.2410335162130224e-05,
      "loss": 1.0412,
      "num_input_tokens_seen": 47473474848,
      "step": 60340
    },
    {
      "epoch": 6.401548907277743,
      "grad_norm": 0.8430103128170708,
      "learning_rate": 2.240964393293762e-05,
      "loss": 1.0484,
      "num_input_tokens_seen": 47474261616,
      "step": 60341
    },
    {
      "epoch": 6.401654996817314,
      "grad_norm": 1.6400980789373838,
      "learning_rate": 2.2408952705746768e-05,
      "loss": 1.0385,
      "num_input_tokens_seen": 47475048384,
      "step": 60342
    },
    {
      "epoch": 6.401761086356885,
      "grad_norm": 1.3275518611355561,
      "learning_rate": 2.2408261480558197e-05,
      "loss": 1.0271,
      "num_input_tokens_seen": 47475835248,
      "step": 60343
    },
    {
      "epoch": 6.401867175896457,
      "grad_norm": 1.0215653037451708,
      "learning_rate": 2.240757025737245e-05,
      "loss": 1.0492,
      "num_input_tokens_seen": 47476622000,
      "step": 60344
    },
    {
      "epoch": 6.401973265436028,
      "grad_norm": 0.7929213006790798,
      "learning_rate": 2.2406879036190055e-05,
      "loss": 1.0445,
      "num_input_tokens_seen": 47477408768,
      "step": 60345
    },
    {
      "epoch": 6.4020793549756,
      "grad_norm": 1.2977853714631962,
      "learning_rate": 2.2406187817011545e-05,
      "loss": 0.9273,
      "num_input_tokens_seen": 47478195616,
      "step": 60346
    },
    {
      "epoch": 6.402185444515171,
      "grad_norm": 0.9983886725676194,
      "learning_rate": 2.240549659983746e-05,
      "loss": 1.0128,
      "num_input_tokens_seen": 47478982400,
      "step": 60347
    },
    {
      "epoch": 6.402291534054743,
      "grad_norm": 0.6956858095209735,
      "learning_rate": 2.240480538466833e-05,
      "loss": 0.9761,
      "num_input_tokens_seen": 47479769200,
      "step": 60348
    },
    {
      "epoch": 6.402397623594314,
      "grad_norm": 1.1329563578707174,
      "learning_rate": 2.240411417150469e-05,
      "loss": 1.0374,
      "num_input_tokens_seen": 47480555952,
      "step": 60349
    },
    {
      "epoch": 6.402503713133885,
      "grad_norm": 1.4740445851448578,
      "learning_rate": 2.2403422960347077e-05,
      "loss": 1.1286,
      "num_input_tokens_seen": 47481342736,
      "step": 60350
    },
    {
      "epoch": 6.402609802673457,
      "grad_norm": 0.8605638548668209,
      "learning_rate": 2.240273175119602e-05,
      "loss": 0.9442,
      "num_input_tokens_seen": 47482129632,
      "step": 60351
    },
    {
      "epoch": 6.402715892213028,
      "grad_norm": 0.9409163977978546,
      "learning_rate": 2.2402040544052057e-05,
      "loss": 1.0499,
      "num_input_tokens_seen": 47482916336,
      "step": 60352
    },
    {
      "epoch": 6.4028219817525995,
      "grad_norm": 0.9508381044944524,
      "learning_rate": 2.240134933891572e-05,
      "loss": 0.9878,
      "num_input_tokens_seen": 47483703088,
      "step": 60353
    },
    {
      "epoch": 6.402928071292171,
      "grad_norm": 1.016340255707947,
      "learning_rate": 2.2400658135787546e-05,
      "loss": 1.0292,
      "num_input_tokens_seen": 47484489840,
      "step": 60354
    },
    {
      "epoch": 6.403034160831742,
      "grad_norm": 1.0140059789263658,
      "learning_rate": 2.2399966934668063e-05,
      "loss": 1.0227,
      "num_input_tokens_seen": 47485276544,
      "step": 60355
    },
    {
      "epoch": 6.4031402503713135,
      "grad_norm": 1.0874127715578905,
      "learning_rate": 2.2399275735557813e-05,
      "loss": 0.8956,
      "num_input_tokens_seen": 47486063264,
      "step": 60356
    },
    {
      "epoch": 6.4032463399108845,
      "grad_norm": 0.706843685538307,
      "learning_rate": 2.2398584538457322e-05,
      "loss": 0.9477,
      "num_input_tokens_seen": 47486850112,
      "step": 60357
    },
    {
      "epoch": 6.4033524294504565,
      "grad_norm": 0.9731767295259959,
      "learning_rate": 2.239789334336713e-05,
      "loss": 0.9593,
      "num_input_tokens_seen": 47487636864,
      "step": 60358
    },
    {
      "epoch": 6.4034585189900275,
      "grad_norm": 0.6910857105857271,
      "learning_rate": 2.2397202150287774e-05,
      "loss": 0.9415,
      "num_input_tokens_seen": 47488423648,
      "step": 60359
    },
    {
      "epoch": 6.403564608529599,
      "grad_norm": 0.6174185829952101,
      "learning_rate": 2.2396510959219777e-05,
      "loss": 0.8893,
      "num_input_tokens_seen": 47489210416,
      "step": 60360
    },
    {
      "epoch": 6.40367069806917,
      "grad_norm": 1.1993004508255978,
      "learning_rate": 2.2395819770163686e-05,
      "loss": 0.9496,
      "num_input_tokens_seen": 47489997200,
      "step": 60361
    },
    {
      "epoch": 6.4037767876087415,
      "grad_norm": 0.7939645776597427,
      "learning_rate": 2.2395128583120027e-05,
      "loss": 0.9932,
      "num_input_tokens_seen": 47490783952,
      "step": 60362
    },
    {
      "epoch": 6.403882877148313,
      "grad_norm": 0.7194069903838317,
      "learning_rate": 2.2394437398089335e-05,
      "loss": 1.004,
      "num_input_tokens_seen": 47491570720,
      "step": 60363
    },
    {
      "epoch": 6.403988966687884,
      "grad_norm": 0.9965184095997652,
      "learning_rate": 2.239374621507215e-05,
      "loss": 0.978,
      "num_input_tokens_seen": 47492357488,
      "step": 60364
    },
    {
      "epoch": 6.404095056227456,
      "grad_norm": 0.9685501661819703,
      "learning_rate": 2.2393055034068984e-05,
      "loss": 1.0427,
      "num_input_tokens_seen": 47493144288,
      "step": 60365
    },
    {
      "epoch": 6.404201145767027,
      "grad_norm": 0.9592893687628538,
      "learning_rate": 2.2392363855080405e-05,
      "loss": 0.9867,
      "num_input_tokens_seen": 47493931024,
      "step": 60366
    },
    {
      "epoch": 6.404307235306598,
      "grad_norm": 0.9529083264332993,
      "learning_rate": 2.2391672678106925e-05,
      "loss": 0.9894,
      "num_input_tokens_seen": 47494717712,
      "step": 60367
    },
    {
      "epoch": 6.40441332484617,
      "grad_norm": 0.9126869647637753,
      "learning_rate": 2.2390981503149088e-05,
      "loss": 1.0373,
      "num_input_tokens_seen": 47495504528,
      "step": 60368
    },
    {
      "epoch": 6.404519414385741,
      "grad_norm": 1.1440216209736542,
      "learning_rate": 2.2390290330207427e-05,
      "loss": 0.9541,
      "num_input_tokens_seen": 47496291376,
      "step": 60369
    },
    {
      "epoch": 6.404625503925313,
      "grad_norm": 0.7867326314528306,
      "learning_rate": 2.2389599159282466e-05,
      "loss": 1.0441,
      "num_input_tokens_seen": 47497078112,
      "step": 60370
    },
    {
      "epoch": 6.404731593464884,
      "grad_norm": 0.7232002060564744,
      "learning_rate": 2.2388907990374748e-05,
      "loss": 0.9883,
      "num_input_tokens_seen": 47497864800,
      "step": 60371
    },
    {
      "epoch": 6.404837683004455,
      "grad_norm": 0.8034038169309093,
      "learning_rate": 2.2388216823484812e-05,
      "loss": 1.047,
      "num_input_tokens_seen": 47498651472,
      "step": 60372
    },
    {
      "epoch": 6.404943772544027,
      "grad_norm": 1.1282042030331707,
      "learning_rate": 2.2387525658613176e-05,
      "loss": 0.8905,
      "num_input_tokens_seen": 47499438256,
      "step": 60373
    },
    {
      "epoch": 6.405049862083598,
      "grad_norm": 1.032007499492226,
      "learning_rate": 2.2386834495760388e-05,
      "loss": 0.9461,
      "num_input_tokens_seen": 47500225120,
      "step": 60374
    },
    {
      "epoch": 6.40515595162317,
      "grad_norm": 0.8284305365096887,
      "learning_rate": 2.2386143334926978e-05,
      "loss": 1.0205,
      "num_input_tokens_seen": 47501011904,
      "step": 60375
    },
    {
      "epoch": 6.405262041162741,
      "grad_norm": 0.9549915713491424,
      "learning_rate": 2.2385452176113474e-05,
      "loss": 0.9836,
      "num_input_tokens_seen": 47501798704,
      "step": 60376
    },
    {
      "epoch": 6.405368130702313,
      "grad_norm": 0.7786015109833914,
      "learning_rate": 2.2384761019320425e-05,
      "loss": 0.9324,
      "num_input_tokens_seen": 47502585504,
      "step": 60377
    },
    {
      "epoch": 6.405474220241884,
      "grad_norm": 0.7390137265613123,
      "learning_rate": 2.238406986454835e-05,
      "loss": 1.0277,
      "num_input_tokens_seen": 47503372288,
      "step": 60378
    },
    {
      "epoch": 6.405580309781455,
      "grad_norm": 0.9062675035248112,
      "learning_rate": 2.238337871179779e-05,
      "loss": 1.0527,
      "num_input_tokens_seen": 47504159056,
      "step": 60379
    },
    {
      "epoch": 6.405686399321027,
      "grad_norm": 0.8536735672374138,
      "learning_rate": 2.238268756106928e-05,
      "loss": 0.9622,
      "num_input_tokens_seen": 47504945824,
      "step": 60380
    },
    {
      "epoch": 6.405792488860598,
      "grad_norm": 0.815791314155258,
      "learning_rate": 2.238199641236335e-05,
      "loss": 0.9862,
      "num_input_tokens_seen": 47505732544,
      "step": 60381
    },
    {
      "epoch": 6.40589857840017,
      "grad_norm": 1.027112646433891,
      "learning_rate": 2.238130526568054e-05,
      "loss": 1.0465,
      "num_input_tokens_seen": 47506519328,
      "step": 60382
    },
    {
      "epoch": 6.406004667939741,
      "grad_norm": 0.7441215183590817,
      "learning_rate": 2.2380614121021376e-05,
      "loss": 0.9753,
      "num_input_tokens_seen": 47507306176,
      "step": 60383
    },
    {
      "epoch": 6.406110757479312,
      "grad_norm": 0.9140541972876738,
      "learning_rate": 2.2379922978386398e-05,
      "loss": 1.0422,
      "num_input_tokens_seen": 47508092960,
      "step": 60384
    },
    {
      "epoch": 6.406216847018884,
      "grad_norm": 0.7744247057492799,
      "learning_rate": 2.2379231837776136e-05,
      "loss": 1.0704,
      "num_input_tokens_seen": 47508879648,
      "step": 60385
    },
    {
      "epoch": 6.406322936558455,
      "grad_norm": 0.9625485855136584,
      "learning_rate": 2.2378540699191134e-05,
      "loss": 1.0101,
      "num_input_tokens_seen": 47509666352,
      "step": 60386
    },
    {
      "epoch": 6.406429026098027,
      "grad_norm": 0.6926145699696915,
      "learning_rate": 2.237784956263191e-05,
      "loss": 0.9522,
      "num_input_tokens_seen": 47510453104,
      "step": 60387
    },
    {
      "epoch": 6.406535115637598,
      "grad_norm": 0.7140922952232137,
      "learning_rate": 2.2377158428099015e-05,
      "loss": 1.0055,
      "num_input_tokens_seen": 47511239888,
      "step": 60388
    },
    {
      "epoch": 6.40664120517717,
      "grad_norm": 0.9588971042374574,
      "learning_rate": 2.2376467295592972e-05,
      "loss": 0.9925,
      "num_input_tokens_seen": 47512026672,
      "step": 60389
    },
    {
      "epoch": 6.406747294716741,
      "grad_norm": 0.8571508560437462,
      "learning_rate": 2.2375776165114316e-05,
      "loss": 1.0253,
      "num_input_tokens_seen": 47512813456,
      "step": 60390
    },
    {
      "epoch": 6.406853384256312,
      "grad_norm": 0.8699297419321478,
      "learning_rate": 2.2375085036663585e-05,
      "loss": 1.0936,
      "num_input_tokens_seen": 47513600160,
      "step": 60391
    },
    {
      "epoch": 6.406959473795884,
      "grad_norm": 0.7586645933480395,
      "learning_rate": 2.237439391024131e-05,
      "loss": 1.0847,
      "num_input_tokens_seen": 47514386912,
      "step": 60392
    },
    {
      "epoch": 6.407065563335455,
      "grad_norm": 0.787633083037079,
      "learning_rate": 2.2373702785848028e-05,
      "loss": 1.0385,
      "num_input_tokens_seen": 47515173712,
      "step": 60393
    },
    {
      "epoch": 6.407171652875027,
      "grad_norm": 0.8053229397606854,
      "learning_rate": 2.2373011663484273e-05,
      "loss": 1.0021,
      "num_input_tokens_seen": 47515960432,
      "step": 60394
    },
    {
      "epoch": 6.407277742414598,
      "grad_norm": 0.9182959460730792,
      "learning_rate": 2.237232054315057e-05,
      "loss": 1.0014,
      "num_input_tokens_seen": 47516747232,
      "step": 60395
    },
    {
      "epoch": 6.407383831954169,
      "grad_norm": 1.265804711520795,
      "learning_rate": 2.2371629424847468e-05,
      "loss": 1.0921,
      "num_input_tokens_seen": 47517533936,
      "step": 60396
    },
    {
      "epoch": 6.407489921493741,
      "grad_norm": 0.7369965575048399,
      "learning_rate": 2.2370938308575495e-05,
      "loss": 1.0065,
      "num_input_tokens_seen": 47518320736,
      "step": 60397
    },
    {
      "epoch": 6.407596011033312,
      "grad_norm": 1.0230024189207647,
      "learning_rate": 2.2370247194335176e-05,
      "loss": 0.9974,
      "num_input_tokens_seen": 47519107472,
      "step": 60398
    },
    {
      "epoch": 6.407702100572884,
      "grad_norm": 0.8628634420342155,
      "learning_rate": 2.2369556082127057e-05,
      "loss": 1.0548,
      "num_input_tokens_seen": 47519894112,
      "step": 60399
    },
    {
      "epoch": 6.407808190112455,
      "grad_norm": 0.683177704946012,
      "learning_rate": 2.2368864971951672e-05,
      "loss": 0.9595,
      "num_input_tokens_seen": 47520680832,
      "step": 60400
    },
    {
      "epoch": 6.407914279652026,
      "grad_norm": 0.7344070022461624,
      "learning_rate": 2.2368173863809543e-05,
      "loss": 0.999,
      "num_input_tokens_seen": 47521467552,
      "step": 60401
    },
    {
      "epoch": 6.408020369191598,
      "grad_norm": 1.0198361090278316,
      "learning_rate": 2.2367482757701217e-05,
      "loss": 0.9551,
      "num_input_tokens_seen": 47522254368,
      "step": 60402
    },
    {
      "epoch": 6.408126458731169,
      "grad_norm": 0.7215563998348951,
      "learning_rate": 2.2366791653627227e-05,
      "loss": 0.969,
      "num_input_tokens_seen": 47523041120,
      "step": 60403
    },
    {
      "epoch": 6.408232548270741,
      "grad_norm": 0.7555460606062467,
      "learning_rate": 2.236610055158809e-05,
      "loss": 0.9923,
      "num_input_tokens_seen": 47523827968,
      "step": 60404
    },
    {
      "epoch": 6.408338637810312,
      "grad_norm": 0.9225481676035705,
      "learning_rate": 2.2365409451584366e-05,
      "loss": 1.0088,
      "num_input_tokens_seen": 47524614704,
      "step": 60405
    },
    {
      "epoch": 6.408444727349884,
      "grad_norm": 0.9166015987884018,
      "learning_rate": 2.2364718353616573e-05,
      "loss": 0.9257,
      "num_input_tokens_seen": 47525401504,
      "step": 60406
    },
    {
      "epoch": 6.408550816889455,
      "grad_norm": 0.7481439140278172,
      "learning_rate": 2.2364027257685243e-05,
      "loss": 0.8999,
      "num_input_tokens_seen": 47526188320,
      "step": 60407
    },
    {
      "epoch": 6.408656906429026,
      "grad_norm": 0.7546852585310203,
      "learning_rate": 2.2363336163790922e-05,
      "loss": 0.9496,
      "num_input_tokens_seen": 47526975168,
      "step": 60408
    },
    {
      "epoch": 6.408762995968598,
      "grad_norm": 0.8068600006563409,
      "learning_rate": 2.236264507193413e-05,
      "loss": 1.0094,
      "num_input_tokens_seen": 47527761968,
      "step": 60409
    },
    {
      "epoch": 6.408869085508169,
      "grad_norm": 0.8165999891720318,
      "learning_rate": 2.2361953982115416e-05,
      "loss": 1.0003,
      "num_input_tokens_seen": 47528548672,
      "step": 60410
    },
    {
      "epoch": 6.408975175047741,
      "grad_norm": 0.7311954107219574,
      "learning_rate": 2.2361262894335304e-05,
      "loss": 1.0167,
      "num_input_tokens_seen": 47529335536,
      "step": 60411
    },
    {
      "epoch": 6.409081264587312,
      "grad_norm": 1.0089144995071386,
      "learning_rate": 2.2360571808594326e-05,
      "loss": 1.0564,
      "num_input_tokens_seen": 47530122304,
      "step": 60412
    },
    {
      "epoch": 6.409187354126883,
      "grad_norm": 0.7236339836978224,
      "learning_rate": 2.235988072489303e-05,
      "loss": 0.9533,
      "num_input_tokens_seen": 47530909024,
      "step": 60413
    },
    {
      "epoch": 6.409293443666455,
      "grad_norm": 0.9606370893080419,
      "learning_rate": 2.2359189643231935e-05,
      "loss": 1.0224,
      "num_input_tokens_seen": 47531695840,
      "step": 60414
    },
    {
      "epoch": 6.409399533206026,
      "grad_norm": 0.8093576944598949,
      "learning_rate": 2.235849856361158e-05,
      "loss": 0.9626,
      "num_input_tokens_seen": 47532482560,
      "step": 60415
    },
    {
      "epoch": 6.4095056227455975,
      "grad_norm": 1.1067741624892458,
      "learning_rate": 2.2357807486032503e-05,
      "loss": 1.0341,
      "num_input_tokens_seen": 47533269328,
      "step": 60416
    },
    {
      "epoch": 6.409611712285169,
      "grad_norm": 0.9288533466539038,
      "learning_rate": 2.2357116410495236e-05,
      "loss": 1.0259,
      "num_input_tokens_seen": 47534056064,
      "step": 60417
    },
    {
      "epoch": 6.4097178018247405,
      "grad_norm": 0.7431956974079864,
      "learning_rate": 2.2356425337000305e-05,
      "loss": 0.9673,
      "num_input_tokens_seen": 47534842768,
      "step": 60418
    },
    {
      "epoch": 6.4098238913643115,
      "grad_norm": 0.8925312131233762,
      "learning_rate": 2.2355734265548258e-05,
      "loss": 0.9461,
      "num_input_tokens_seen": 47535629456,
      "step": 60419
    },
    {
      "epoch": 6.4099299809038826,
      "grad_norm": 0.9425630177168054,
      "learning_rate": 2.235504319613962e-05,
      "loss": 0.9861,
      "num_input_tokens_seen": 47536416160,
      "step": 60420
    },
    {
      "epoch": 6.4100360704434545,
      "grad_norm": 1.0261677454042142,
      "learning_rate": 2.2354352128774923e-05,
      "loss": 1.0569,
      "num_input_tokens_seen": 47537202960,
      "step": 60421
    },
    {
      "epoch": 6.4101421599830255,
      "grad_norm": 0.7929353361966125,
      "learning_rate": 2.235366106345471e-05,
      "loss": 0.9838,
      "num_input_tokens_seen": 47537989728,
      "step": 60422
    },
    {
      "epoch": 6.410248249522597,
      "grad_norm": 1.205410560611331,
      "learning_rate": 2.235297000017951e-05,
      "loss": 0.9958,
      "num_input_tokens_seen": 47538776368,
      "step": 60423
    },
    {
      "epoch": 6.4103543390621684,
      "grad_norm": 1.4431040152841859,
      "learning_rate": 2.2352278938949848e-05,
      "loss": 1.0953,
      "num_input_tokens_seen": 47539563104,
      "step": 60424
    },
    {
      "epoch": 6.4104604286017395,
      "grad_norm": 0.8729296878451661,
      "learning_rate": 2.2351587879766277e-05,
      "loss": 1.0786,
      "num_input_tokens_seen": 47540349776,
      "step": 60425
    },
    {
      "epoch": 6.410566518141311,
      "grad_norm": 0.8714296683832553,
      "learning_rate": 2.235089682262932e-05,
      "loss": 1.0271,
      "num_input_tokens_seen": 47541136448,
      "step": 60426
    },
    {
      "epoch": 6.410672607680882,
      "grad_norm": 1.1136530303693921,
      "learning_rate": 2.235020576753951e-05,
      "loss": 1.0265,
      "num_input_tokens_seen": 47541923232,
      "step": 60427
    },
    {
      "epoch": 6.410778697220454,
      "grad_norm": 0.7804762427873366,
      "learning_rate": 2.2349514714497385e-05,
      "loss": 0.9776,
      "num_input_tokens_seen": 47542710064,
      "step": 60428
    },
    {
      "epoch": 6.410884786760025,
      "grad_norm": 0.8682943321720615,
      "learning_rate": 2.2348823663503474e-05,
      "loss": 0.959,
      "num_input_tokens_seen": 47543496752,
      "step": 60429
    },
    {
      "epoch": 6.410990876299596,
      "grad_norm": 0.9690580892248447,
      "learning_rate": 2.234813261455832e-05,
      "loss": 0.9394,
      "num_input_tokens_seen": 47544283696,
      "step": 60430
    },
    {
      "epoch": 6.411096965839168,
      "grad_norm": 0.8156342408111209,
      "learning_rate": 2.2347441567662448e-05,
      "loss": 0.9883,
      "num_input_tokens_seen": 47545070512,
      "step": 60431
    },
    {
      "epoch": 6.411203055378739,
      "grad_norm": 0.984390025923916,
      "learning_rate": 2.2346750522816393e-05,
      "loss": 1.0482,
      "num_input_tokens_seen": 47545857328,
      "step": 60432
    },
    {
      "epoch": 6.411309144918311,
      "grad_norm": 0.8482943774816737,
      "learning_rate": 2.2346059480020694e-05,
      "loss": 0.9931,
      "num_input_tokens_seen": 47546644064,
      "step": 60433
    },
    {
      "epoch": 6.411415234457882,
      "grad_norm": 0.8937305756633149,
      "learning_rate": 2.2345368439275884e-05,
      "loss": 1.0124,
      "num_input_tokens_seen": 47547430784,
      "step": 60434
    },
    {
      "epoch": 6.411521323997454,
      "grad_norm": 0.7861516869633386,
      "learning_rate": 2.234467740058249e-05,
      "loss": 1.0862,
      "num_input_tokens_seen": 47548217568,
      "step": 60435
    },
    {
      "epoch": 6.411627413537025,
      "grad_norm": 0.8267948551455931,
      "learning_rate": 2.2343986363941055e-05,
      "loss": 1.0537,
      "num_input_tokens_seen": 47549004384,
      "step": 60436
    },
    {
      "epoch": 6.411733503076596,
      "grad_norm": 0.7196668754618833,
      "learning_rate": 2.2343295329352112e-05,
      "loss": 0.9891,
      "num_input_tokens_seen": 47549791184,
      "step": 60437
    },
    {
      "epoch": 6.411839592616168,
      "grad_norm": 0.6887367382254111,
      "learning_rate": 2.2342604296816187e-05,
      "loss": 1.0418,
      "num_input_tokens_seen": 47550577936,
      "step": 60438
    },
    {
      "epoch": 6.411945682155739,
      "grad_norm": 0.7811100202282922,
      "learning_rate": 2.2341913266333826e-05,
      "loss": 0.9643,
      "num_input_tokens_seen": 47551364720,
      "step": 60439
    },
    {
      "epoch": 6.412051771695311,
      "grad_norm": 0.7542347525673609,
      "learning_rate": 2.234122223790555e-05,
      "loss": 1.0557,
      "num_input_tokens_seen": 47552151520,
      "step": 60440
    },
    {
      "epoch": 6.412157861234882,
      "grad_norm": 0.7091541044626722,
      "learning_rate": 2.23405312115319e-05,
      "loss": 1.0215,
      "num_input_tokens_seen": 47552938304,
      "step": 60441
    },
    {
      "epoch": 6.412263950774454,
      "grad_norm": 0.8697680373239864,
      "learning_rate": 2.2339840187213413e-05,
      "loss": 1.054,
      "num_input_tokens_seen": 47553725088,
      "step": 60442
    },
    {
      "epoch": 6.412370040314025,
      "grad_norm": 0.8368473191487987,
      "learning_rate": 2.2339149164950615e-05,
      "loss": 1.0347,
      "num_input_tokens_seen": 47554511872,
      "step": 60443
    },
    {
      "epoch": 6.412476129853596,
      "grad_norm": 0.7294262371866626,
      "learning_rate": 2.2338458144744048e-05,
      "loss": 0.9946,
      "num_input_tokens_seen": 47555298592,
      "step": 60444
    },
    {
      "epoch": 6.412582219393168,
      "grad_norm": 0.7530325651741795,
      "learning_rate": 2.2337767126594245e-05,
      "loss": 1.0425,
      "num_input_tokens_seen": 47556085376,
      "step": 60445
    },
    {
      "epoch": 6.412688308932739,
      "grad_norm": 0.820209480394935,
      "learning_rate": 2.2337076110501727e-05,
      "loss": 1.0456,
      "num_input_tokens_seen": 47556872128,
      "step": 60446
    },
    {
      "epoch": 6.412794398472311,
      "grad_norm": 0.8483942127337125,
      "learning_rate": 2.233638509646705e-05,
      "loss": 0.9933,
      "num_input_tokens_seen": 47557658880,
      "step": 60447
    },
    {
      "epoch": 6.412900488011882,
      "grad_norm": 0.6958575290055058,
      "learning_rate": 2.2335694084490734e-05,
      "loss": 1.0111,
      "num_input_tokens_seen": 47558445568,
      "step": 60448
    },
    {
      "epoch": 6.413006577551453,
      "grad_norm": 1.1020208931888364,
      "learning_rate": 2.233500307457331e-05,
      "loss": 0.9443,
      "num_input_tokens_seen": 47559232352,
      "step": 60449
    },
    {
      "epoch": 6.413112667091025,
      "grad_norm": 0.6937902787562601,
      "learning_rate": 2.2334312066715324e-05,
      "loss": 1.0242,
      "num_input_tokens_seen": 47560019152,
      "step": 60450
    },
    {
      "epoch": 6.413218756630596,
      "grad_norm": 1.1320409826404072,
      "learning_rate": 2.23336210609173e-05,
      "loss": 0.9582,
      "num_input_tokens_seen": 47560805888,
      "step": 60451
    },
    {
      "epoch": 6.413324846170168,
      "grad_norm": 0.9323229517863577,
      "learning_rate": 2.2332930057179775e-05,
      "loss": 0.9977,
      "num_input_tokens_seen": 47561592688,
      "step": 60452
    },
    {
      "epoch": 6.413430935709739,
      "grad_norm": 0.9096032325941441,
      "learning_rate": 2.2332239055503283e-05,
      "loss": 1.0712,
      "num_input_tokens_seen": 47562379536,
      "step": 60453
    },
    {
      "epoch": 6.41353702524931,
      "grad_norm": 1.0180714148539511,
      "learning_rate": 2.233154805588836e-05,
      "loss": 1.0816,
      "num_input_tokens_seen": 47563166272,
      "step": 60454
    },
    {
      "epoch": 6.413643114788882,
      "grad_norm": 1.1887945330515715,
      "learning_rate": 2.2330857058335538e-05,
      "loss": 0.9822,
      "num_input_tokens_seen": 47563952976,
      "step": 60455
    },
    {
      "epoch": 6.413749204328453,
      "grad_norm": 0.9792864532602968,
      "learning_rate": 2.233016606284535e-05,
      "loss": 1.0394,
      "num_input_tokens_seen": 47564739712,
      "step": 60456
    },
    {
      "epoch": 6.413855293868025,
      "grad_norm": 1.1019330992928495,
      "learning_rate": 2.2329475069418333e-05,
      "loss": 1.0374,
      "num_input_tokens_seen": 47565526544,
      "step": 60457
    },
    {
      "epoch": 6.413961383407596,
      "grad_norm": 1.2124836119651874,
      "learning_rate": 2.232878407805502e-05,
      "loss": 1.0211,
      "num_input_tokens_seen": 47566313296,
      "step": 60458
    },
    {
      "epoch": 6.414067472947167,
      "grad_norm": 0.9995586984520918,
      "learning_rate": 2.2328093088755942e-05,
      "loss": 1.0206,
      "num_input_tokens_seen": 47567100080,
      "step": 60459
    },
    {
      "epoch": 6.414173562486739,
      "grad_norm": 0.9984700114753023,
      "learning_rate": 2.2327402101521626e-05,
      "loss": 1.0108,
      "num_input_tokens_seen": 47567886832,
      "step": 60460
    },
    {
      "epoch": 6.41427965202631,
      "grad_norm": 1.2058848158792876,
      "learning_rate": 2.232671111635263e-05,
      "loss": 1.0422,
      "num_input_tokens_seen": 47568673600,
      "step": 60461
    },
    {
      "epoch": 6.414385741565882,
      "grad_norm": 0.719934083245261,
      "learning_rate": 2.2326020133249464e-05,
      "loss": 1.0042,
      "num_input_tokens_seen": 47569460400,
      "step": 60462
    },
    {
      "epoch": 6.414491831105453,
      "grad_norm": 0.8263945956004437,
      "learning_rate": 2.232532915221268e-05,
      "loss": 1.008,
      "num_input_tokens_seen": 47570247136,
      "step": 60463
    },
    {
      "epoch": 6.414597920645025,
      "grad_norm": 1.249641688465325,
      "learning_rate": 2.2324638173242795e-05,
      "loss": 1.0137,
      "num_input_tokens_seen": 47571034032,
      "step": 60464
    },
    {
      "epoch": 6.414704010184596,
      "grad_norm": 0.7175520713957839,
      "learning_rate": 2.2323947196340357e-05,
      "loss": 1.0191,
      "num_input_tokens_seen": 47571820784,
      "step": 60465
    },
    {
      "epoch": 6.414810099724167,
      "grad_norm": 0.6824218315253351,
      "learning_rate": 2.2323256221505895e-05,
      "loss": 0.9438,
      "num_input_tokens_seen": 47572607568,
      "step": 60466
    },
    {
      "epoch": 6.414916189263739,
      "grad_norm": 1.0197100633619263,
      "learning_rate": 2.2322565248739935e-05,
      "loss": 1.0361,
      "num_input_tokens_seen": 47573394320,
      "step": 60467
    },
    {
      "epoch": 6.41502227880331,
      "grad_norm": 0.7601042463420136,
      "learning_rate": 2.2321874278043023e-05,
      "loss": 1.0272,
      "num_input_tokens_seen": 47574181088,
      "step": 60468
    },
    {
      "epoch": 6.415128368342882,
      "grad_norm": 0.7020071714638378,
      "learning_rate": 2.232118330941569e-05,
      "loss": 0.9605,
      "num_input_tokens_seen": 47574967808,
      "step": 60469
    },
    {
      "epoch": 6.415234457882453,
      "grad_norm": 0.8461041376678949,
      "learning_rate": 2.232049234285846e-05,
      "loss": 0.951,
      "num_input_tokens_seen": 47575754624,
      "step": 60470
    },
    {
      "epoch": 6.415340547422025,
      "grad_norm": 0.9107734108017979,
      "learning_rate": 2.2319801378371886e-05,
      "loss": 1.0071,
      "num_input_tokens_seen": 47576541376,
      "step": 60471
    },
    {
      "epoch": 6.415446636961596,
      "grad_norm": 0.6575593895808673,
      "learning_rate": 2.2319110415956486e-05,
      "loss": 0.9826,
      "num_input_tokens_seen": 47577328096,
      "step": 60472
    },
    {
      "epoch": 6.415552726501167,
      "grad_norm": 0.7883849465084245,
      "learning_rate": 2.2318419455612793e-05,
      "loss": 0.9168,
      "num_input_tokens_seen": 47578114944,
      "step": 60473
    },
    {
      "epoch": 6.415658816040739,
      "grad_norm": 0.7245617739880119,
      "learning_rate": 2.2317728497341353e-05,
      "loss": 0.9725,
      "num_input_tokens_seen": 47578901744,
      "step": 60474
    },
    {
      "epoch": 6.41576490558031,
      "grad_norm": 0.7424739597979454,
      "learning_rate": 2.2317037541142693e-05,
      "loss": 0.9182,
      "num_input_tokens_seen": 47579688576,
      "step": 60475
    },
    {
      "epoch": 6.415870995119882,
      "grad_norm": 0.6756571666394615,
      "learning_rate": 2.2316346587017344e-05,
      "loss": 1.0046,
      "num_input_tokens_seen": 47580475280,
      "step": 60476
    },
    {
      "epoch": 6.415977084659453,
      "grad_norm": 0.772527908181396,
      "learning_rate": 2.231565563496585e-05,
      "loss": 1.0256,
      "num_input_tokens_seen": 47581262032,
      "step": 60477
    },
    {
      "epoch": 6.416083174199024,
      "grad_norm": 0.6599683660621815,
      "learning_rate": 2.2314964684988738e-05,
      "loss": 0.9583,
      "num_input_tokens_seen": 47582048848,
      "step": 60478
    },
    {
      "epoch": 6.4161892637385955,
      "grad_norm": 0.7367739065286343,
      "learning_rate": 2.2314273737086536e-05,
      "loss": 1.0007,
      "num_input_tokens_seen": 47582835680,
      "step": 60479
    },
    {
      "epoch": 6.416295353278167,
      "grad_norm": 0.6857093041602391,
      "learning_rate": 2.231358279125979e-05,
      "loss": 1.0003,
      "num_input_tokens_seen": 47583622400,
      "step": 60480
    },
    {
      "epoch": 6.4164014428177385,
      "grad_norm": 0.678492203419251,
      "learning_rate": 2.231289184750902e-05,
      "loss": 0.9633,
      "num_input_tokens_seen": 47584409232,
      "step": 60481
    },
    {
      "epoch": 6.4165075323573095,
      "grad_norm": 0.7583639696863734,
      "learning_rate": 2.231220090583478e-05,
      "loss": 1.015,
      "num_input_tokens_seen": 47585195904,
      "step": 60482
    },
    {
      "epoch": 6.416613621896881,
      "grad_norm": 0.7196058876221834,
      "learning_rate": 2.2311509966237587e-05,
      "loss": 1.0298,
      "num_input_tokens_seen": 47585982704,
      "step": 60483
    },
    {
      "epoch": 6.4167197114364525,
      "grad_norm": 1.0104295887301313,
      "learning_rate": 2.2310819028717976e-05,
      "loss": 0.9602,
      "num_input_tokens_seen": 47586769520,
      "step": 60484
    },
    {
      "epoch": 6.4168258009760235,
      "grad_norm": 0.8515443445919322,
      "learning_rate": 2.2310128093276493e-05,
      "loss": 0.9926,
      "num_input_tokens_seen": 47587556240,
      "step": 60485
    },
    {
      "epoch": 6.416931890515595,
      "grad_norm": 0.9878634391666211,
      "learning_rate": 2.2309437159913662e-05,
      "loss": 1.005,
      "num_input_tokens_seen": 47588342960,
      "step": 60486
    },
    {
      "epoch": 6.4170379800551665,
      "grad_norm": 0.88404611145632,
      "learning_rate": 2.2308746228630016e-05,
      "loss": 0.9709,
      "num_input_tokens_seen": 47589129680,
      "step": 60487
    },
    {
      "epoch": 6.4171440695947375,
      "grad_norm": 0.8241791973444507,
      "learning_rate": 2.2308055299426094e-05,
      "loss": 1.0168,
      "num_input_tokens_seen": 47589916272,
      "step": 60488
    },
    {
      "epoch": 6.417250159134309,
      "grad_norm": 0.9382821111922541,
      "learning_rate": 2.230736437230243e-05,
      "loss": 1.0757,
      "num_input_tokens_seen": 47590703088,
      "step": 60489
    },
    {
      "epoch": 6.41735624867388,
      "grad_norm": 0.8285400682057171,
      "learning_rate": 2.230667344725955e-05,
      "loss": 1.0337,
      "num_input_tokens_seen": 47591489840,
      "step": 60490
    },
    {
      "epoch": 6.417462338213452,
      "grad_norm": 0.878717813483664,
      "learning_rate": 2.2305982524297996e-05,
      "loss": 1.0469,
      "num_input_tokens_seen": 47592276592,
      "step": 60491
    },
    {
      "epoch": 6.417568427753023,
      "grad_norm": 0.8450110591233263,
      "learning_rate": 2.2305291603418306e-05,
      "loss": 0.9985,
      "num_input_tokens_seen": 47593063344,
      "step": 60492
    },
    {
      "epoch": 6.417674517292595,
      "grad_norm": 0.7131663991055804,
      "learning_rate": 2.2304600684620997e-05,
      "loss": 1.0149,
      "num_input_tokens_seen": 47593850080,
      "step": 60493
    },
    {
      "epoch": 6.417780606832166,
      "grad_norm": 1.2941578380685714,
      "learning_rate": 2.2303909767906622e-05,
      "loss": 1.0701,
      "num_input_tokens_seen": 47594636848,
      "step": 60494
    },
    {
      "epoch": 6.417886696371737,
      "grad_norm": 0.961846790715948,
      "learning_rate": 2.2303218853275698e-05,
      "loss": 1.0109,
      "num_input_tokens_seen": 47595423568,
      "step": 60495
    },
    {
      "epoch": 6.417992785911309,
      "grad_norm": 1.0539301274810247,
      "learning_rate": 2.2302527940728773e-05,
      "loss": 1.0622,
      "num_input_tokens_seen": 47596210464,
      "step": 60496
    },
    {
      "epoch": 6.41809887545088,
      "grad_norm": 0.8067150147374365,
      "learning_rate": 2.230183703026638e-05,
      "loss": 0.9431,
      "num_input_tokens_seen": 47596997344,
      "step": 60497
    },
    {
      "epoch": 6.418204964990452,
      "grad_norm": 1.0045241185884908,
      "learning_rate": 2.230114612188904e-05,
      "loss": 0.9294,
      "num_input_tokens_seen": 47597784144,
      "step": 60498
    },
    {
      "epoch": 6.418311054530023,
      "grad_norm": 1.0888530778832408,
      "learning_rate": 2.23004552155973e-05,
      "loss": 1.0145,
      "num_input_tokens_seen": 47598570944,
      "step": 60499
    },
    {
      "epoch": 6.418417144069595,
      "grad_norm": 0.9260769476866165,
      "learning_rate": 2.2299764311391684e-05,
      "loss": 1.0142,
      "num_input_tokens_seen": 47599357712,
      "step": 60500
    },
    {
      "epoch": 6.418523233609166,
      "grad_norm": 0.7766370487991385,
      "learning_rate": 2.2299073409272735e-05,
      "loss": 1.0409,
      "num_input_tokens_seen": 47600144512,
      "step": 60501
    },
    {
      "epoch": 6.418629323148737,
      "grad_norm": 0.8790473648759302,
      "learning_rate": 2.2298382509240982e-05,
      "loss": 1.0075,
      "num_input_tokens_seen": 47600931328,
      "step": 60502
    },
    {
      "epoch": 6.418735412688309,
      "grad_norm": 0.8149745034909806,
      "learning_rate": 2.229769161129696e-05,
      "loss": 0.9383,
      "num_input_tokens_seen": 47601718112,
      "step": 60503
    },
    {
      "epoch": 6.41884150222788,
      "grad_norm": 0.747000188194283,
      "learning_rate": 2.22970007154412e-05,
      "loss": 1.0011,
      "num_input_tokens_seen": 47602504848,
      "step": 60504
    },
    {
      "epoch": 6.418947591767452,
      "grad_norm": 0.7627480455771396,
      "learning_rate": 2.229630982167424e-05,
      "loss": 0.9993,
      "num_input_tokens_seen": 47603291632,
      "step": 60505
    },
    {
      "epoch": 6.419053681307023,
      "grad_norm": 0.8149579193212417,
      "learning_rate": 2.229561892999662e-05,
      "loss": 0.9942,
      "num_input_tokens_seen": 47604078496,
      "step": 60506
    },
    {
      "epoch": 6.419159770846594,
      "grad_norm": 0.818213631384581,
      "learning_rate": 2.229492804040885e-05,
      "loss": 0.9527,
      "num_input_tokens_seen": 47604865280,
      "step": 60507
    },
    {
      "epoch": 6.419265860386166,
      "grad_norm": 0.9475648038688957,
      "learning_rate": 2.2294237152911496e-05,
      "loss": 1.0209,
      "num_input_tokens_seen": 47605652000,
      "step": 60508
    },
    {
      "epoch": 6.419371949925737,
      "grad_norm": 0.8037071992041338,
      "learning_rate": 2.2293546267505068e-05,
      "loss": 0.9646,
      "num_input_tokens_seen": 47606438720,
      "step": 60509
    },
    {
      "epoch": 6.419478039465309,
      "grad_norm": 0.9334642285146998,
      "learning_rate": 2.2292855384190108e-05,
      "loss": 1.0512,
      "num_input_tokens_seen": 47607225440,
      "step": 60510
    },
    {
      "epoch": 6.41958412900488,
      "grad_norm": 0.7407885404285799,
      "learning_rate": 2.2292164502967152e-05,
      "loss": 0.9327,
      "num_input_tokens_seen": 47608012208,
      "step": 60511
    },
    {
      "epoch": 6.419690218544451,
      "grad_norm": 0.836907443592484,
      "learning_rate": 2.2291473623836728e-05,
      "loss": 1.0097,
      "num_input_tokens_seen": 47608798944,
      "step": 60512
    },
    {
      "epoch": 6.419796308084023,
      "grad_norm": 1.2687339043495915,
      "learning_rate": 2.2290782746799382e-05,
      "loss": 1.1003,
      "num_input_tokens_seen": 47609585648,
      "step": 60513
    },
    {
      "epoch": 6.419902397623594,
      "grad_norm": 0.8938923564374646,
      "learning_rate": 2.2290091871855638e-05,
      "loss": 1.0627,
      "num_input_tokens_seen": 47610372448,
      "step": 60514
    },
    {
      "epoch": 6.420008487163166,
      "grad_norm": 0.9846539231497886,
      "learning_rate": 2.228940099900602e-05,
      "loss": 0.9955,
      "num_input_tokens_seen": 47611159216,
      "step": 60515
    },
    {
      "epoch": 6.420114576702737,
      "grad_norm": 0.7127384933904811,
      "learning_rate": 2.2288710128251088e-05,
      "loss": 0.9135,
      "num_input_tokens_seen": 47611945920,
      "step": 60516
    },
    {
      "epoch": 6.420220666242309,
      "grad_norm": 0.7163157003059573,
      "learning_rate": 2.2288019259591356e-05,
      "loss": 0.95,
      "num_input_tokens_seen": 47612732768,
      "step": 60517
    },
    {
      "epoch": 6.42032675578188,
      "grad_norm": 0.6944281937940944,
      "learning_rate": 2.2287328393027356e-05,
      "loss": 0.9792,
      "num_input_tokens_seen": 47613519696,
      "step": 60518
    },
    {
      "epoch": 6.420432845321451,
      "grad_norm": 0.6920251680719238,
      "learning_rate": 2.228663752855964e-05,
      "loss": 0.9801,
      "num_input_tokens_seen": 47614306416,
      "step": 60519
    },
    {
      "epoch": 6.420538934861023,
      "grad_norm": 0.6997007182435762,
      "learning_rate": 2.2285946666188725e-05,
      "loss": 0.9519,
      "num_input_tokens_seen": 47615093184,
      "step": 60520
    },
    {
      "epoch": 6.420645024400594,
      "grad_norm": 0.7298496316924739,
      "learning_rate": 2.228525580591515e-05,
      "loss": 0.9678,
      "num_input_tokens_seen": 47615880064,
      "step": 60521
    },
    {
      "epoch": 6.420751113940166,
      "grad_norm": 0.8793195484930194,
      "learning_rate": 2.2284564947739454e-05,
      "loss": 1.0746,
      "num_input_tokens_seen": 47616666800,
      "step": 60522
    },
    {
      "epoch": 6.420857203479737,
      "grad_norm": 0.7441235556014995,
      "learning_rate": 2.2283874091662166e-05,
      "loss": 1.1337,
      "num_input_tokens_seen": 47617453568,
      "step": 60523
    },
    {
      "epoch": 6.420963293019308,
      "grad_norm": 0.7846216492446598,
      "learning_rate": 2.2283183237683812e-05,
      "loss": 0.9235,
      "num_input_tokens_seen": 47618240256,
      "step": 60524
    },
    {
      "epoch": 6.42106938255888,
      "grad_norm": 1.018367818353673,
      "learning_rate": 2.2282492385804944e-05,
      "loss": 1.0886,
      "num_input_tokens_seen": 47619027088,
      "step": 60525
    },
    {
      "epoch": 6.421175472098451,
      "grad_norm": 0.8243023231981398,
      "learning_rate": 2.2281801536026088e-05,
      "loss": 1.0872,
      "num_input_tokens_seen": 47619813760,
      "step": 60526
    },
    {
      "epoch": 6.421281561638023,
      "grad_norm": 1.1537515288826716,
      "learning_rate": 2.2281110688347765e-05,
      "loss": 1.0155,
      "num_input_tokens_seen": 47620600624,
      "step": 60527
    },
    {
      "epoch": 6.421387651177594,
      "grad_norm": 0.7835218805283632,
      "learning_rate": 2.2280419842770528e-05,
      "loss": 0.966,
      "num_input_tokens_seen": 47621387360,
      "step": 60528
    },
    {
      "epoch": 6.421493740717166,
      "grad_norm": 1.1647617788266784,
      "learning_rate": 2.2279728999294898e-05,
      "loss": 1.0139,
      "num_input_tokens_seen": 47622174064,
      "step": 60529
    },
    {
      "epoch": 6.421599830256737,
      "grad_norm": 0.7707948638379906,
      "learning_rate": 2.2279038157921418e-05,
      "loss": 1.0012,
      "num_input_tokens_seen": 47622960864,
      "step": 60530
    },
    {
      "epoch": 6.421705919796308,
      "grad_norm": 1.1989336615876385,
      "learning_rate": 2.2278347318650615e-05,
      "loss": 1.1061,
      "num_input_tokens_seen": 47623747600,
      "step": 60531
    },
    {
      "epoch": 6.42181200933588,
      "grad_norm": 0.8632761498929653,
      "learning_rate": 2.2277656481483022e-05,
      "loss": 0.9699,
      "num_input_tokens_seen": 47624534432,
      "step": 60532
    },
    {
      "epoch": 6.421918098875451,
      "grad_norm": 0.8884463907492071,
      "learning_rate": 2.2276965646419185e-05,
      "loss": 0.9641,
      "num_input_tokens_seen": 47625321232,
      "step": 60533
    },
    {
      "epoch": 6.422024188415023,
      "grad_norm": 1.1451355343052785,
      "learning_rate": 2.2276274813459625e-05,
      "loss": 1.1008,
      "num_input_tokens_seen": 47626107984,
      "step": 60534
    },
    {
      "epoch": 6.422130277954594,
      "grad_norm": 0.7555361616001491,
      "learning_rate": 2.2275583982604874e-05,
      "loss": 0.9589,
      "num_input_tokens_seen": 47626894752,
      "step": 60535
    },
    {
      "epoch": 6.422236367494165,
      "grad_norm": 0.7433733261424221,
      "learning_rate": 2.227489315385548e-05,
      "loss": 0.9942,
      "num_input_tokens_seen": 47627681536,
      "step": 60536
    },
    {
      "epoch": 6.422342457033737,
      "grad_norm": 0.9153053615196615,
      "learning_rate": 2.2274202327211968e-05,
      "loss": 1.0097,
      "num_input_tokens_seen": 47628468320,
      "step": 60537
    },
    {
      "epoch": 6.422448546573308,
      "grad_norm": 0.7706914476982133,
      "learning_rate": 2.2273511502674867e-05,
      "loss": 0.9361,
      "num_input_tokens_seen": 47629255136,
      "step": 60538
    },
    {
      "epoch": 6.42255463611288,
      "grad_norm": 0.7672665322644184,
      "learning_rate": 2.227282068024472e-05,
      "loss": 0.9675,
      "num_input_tokens_seen": 47630041952,
      "step": 60539
    },
    {
      "epoch": 6.422660725652451,
      "grad_norm": 0.866516087308549,
      "learning_rate": 2.2272129859922057e-05,
      "loss": 0.9528,
      "num_input_tokens_seen": 47630828752,
      "step": 60540
    },
    {
      "epoch": 6.422766815192022,
      "grad_norm": 0.710064678371838,
      "learning_rate": 2.227143904170741e-05,
      "loss": 1.0342,
      "num_input_tokens_seen": 47631615568,
      "step": 60541
    },
    {
      "epoch": 6.422872904731594,
      "grad_norm": 0.8097079413640468,
      "learning_rate": 2.2270748225601318e-05,
      "loss": 1.035,
      "num_input_tokens_seen": 47632402304,
      "step": 60542
    },
    {
      "epoch": 6.422978994271165,
      "grad_norm": 0.842913351450308,
      "learning_rate": 2.227005741160431e-05,
      "loss": 1.0,
      "num_input_tokens_seen": 47633189056,
      "step": 60543
    },
    {
      "epoch": 6.4230850838107365,
      "grad_norm": 1.2054459951444518,
      "learning_rate": 2.226936659971692e-05,
      "loss": 0.9709,
      "num_input_tokens_seen": 47633975920,
      "step": 60544
    },
    {
      "epoch": 6.4231911733503075,
      "grad_norm": 0.8614978831408847,
      "learning_rate": 2.2268675789939685e-05,
      "loss": 1.0635,
      "num_input_tokens_seen": 47634762688,
      "step": 60545
    },
    {
      "epoch": 6.4232972628898795,
      "grad_norm": 1.1413651421800322,
      "learning_rate": 2.2267984982273132e-05,
      "loss": 0.9973,
      "num_input_tokens_seen": 47635549504,
      "step": 60546
    },
    {
      "epoch": 6.4234033524294505,
      "grad_norm": 1.0094096262386092,
      "learning_rate": 2.2267294176717808e-05,
      "loss": 1.0531,
      "num_input_tokens_seen": 47636336272,
      "step": 60547
    },
    {
      "epoch": 6.4235094419690215,
      "grad_norm": 0.8428562538831689,
      "learning_rate": 2.226660337327424e-05,
      "loss": 1.0321,
      "num_input_tokens_seen": 47637122960,
      "step": 60548
    },
    {
      "epoch": 6.423615531508593,
      "grad_norm": 0.7971400367870954,
      "learning_rate": 2.226591257194295e-05,
      "loss": 1.0089,
      "num_input_tokens_seen": 47637909664,
      "step": 60549
    },
    {
      "epoch": 6.4237216210481645,
      "grad_norm": 0.9162472116126054,
      "learning_rate": 2.2265221772724494e-05,
      "loss": 1.0733,
      "num_input_tokens_seen": 47638696432,
      "step": 60550
    },
    {
      "epoch": 6.423827710587736,
      "grad_norm": 0.7172499960080878,
      "learning_rate": 2.226453097561939e-05,
      "loss": 1.0245,
      "num_input_tokens_seen": 47639483184,
      "step": 60551
    },
    {
      "epoch": 6.423933800127307,
      "grad_norm": 0.8146709091133004,
      "learning_rate": 2.2263840180628175e-05,
      "loss": 1.054,
      "num_input_tokens_seen": 47640269888,
      "step": 60552
    },
    {
      "epoch": 6.4240398896668784,
      "grad_norm": 0.6596767413165834,
      "learning_rate": 2.2263149387751383e-05,
      "loss": 1.0041,
      "num_input_tokens_seen": 47641056656,
      "step": 60553
    },
    {
      "epoch": 6.42414597920645,
      "grad_norm": 0.7396880355089733,
      "learning_rate": 2.2262458596989554e-05,
      "loss": 0.9806,
      "num_input_tokens_seen": 47641843344,
      "step": 60554
    },
    {
      "epoch": 6.424252068746021,
      "grad_norm": 0.7778527224395659,
      "learning_rate": 2.2261767808343204e-05,
      "loss": 1.0029,
      "num_input_tokens_seen": 47642630160,
      "step": 60555
    },
    {
      "epoch": 6.424358158285593,
      "grad_norm": 0.7159385634353391,
      "learning_rate": 2.2261077021812884e-05,
      "loss": 1.0168,
      "num_input_tokens_seen": 47643416848,
      "step": 60556
    },
    {
      "epoch": 6.424464247825164,
      "grad_norm": 1.0168447652886499,
      "learning_rate": 2.226038623739913e-05,
      "loss": 1.0115,
      "num_input_tokens_seen": 47644203616,
      "step": 60557
    },
    {
      "epoch": 6.424570337364736,
      "grad_norm": 0.7311031614522782,
      "learning_rate": 2.225969545510247e-05,
      "loss": 0.939,
      "num_input_tokens_seen": 47644990464,
      "step": 60558
    },
    {
      "epoch": 6.424676426904307,
      "grad_norm": 1.072595121235926,
      "learning_rate": 2.225900467492343e-05,
      "loss": 0.9414,
      "num_input_tokens_seen": 47645777216,
      "step": 60559
    },
    {
      "epoch": 6.424782516443878,
      "grad_norm": 0.7300721905391497,
      "learning_rate": 2.225831389686256e-05,
      "loss": 0.9584,
      "num_input_tokens_seen": 47646563872,
      "step": 60560
    },
    {
      "epoch": 6.42488860598345,
      "grad_norm": 0.9992177598375588,
      "learning_rate": 2.225762312092038e-05,
      "loss": 1.053,
      "num_input_tokens_seen": 47647350656,
      "step": 60561
    },
    {
      "epoch": 6.424994695523021,
      "grad_norm": 0.766547863572376,
      "learning_rate": 2.2256932347097423e-05,
      "loss": 1.0207,
      "num_input_tokens_seen": 47648137376,
      "step": 60562
    },
    {
      "epoch": 6.425100785062593,
      "grad_norm": 0.965160636429111,
      "learning_rate": 2.2256241575394236e-05,
      "loss": 1.0656,
      "num_input_tokens_seen": 47648924144,
      "step": 60563
    },
    {
      "epoch": 6.425206874602164,
      "grad_norm": 0.7891005646835686,
      "learning_rate": 2.2255550805811344e-05,
      "loss": 1.0727,
      "num_input_tokens_seen": 47649710928,
      "step": 60564
    },
    {
      "epoch": 6.425312964141735,
      "grad_norm": 0.8181225713630862,
      "learning_rate": 2.2254860038349278e-05,
      "loss": 0.9677,
      "num_input_tokens_seen": 47650497712,
      "step": 60565
    },
    {
      "epoch": 6.425419053681307,
      "grad_norm": 0.8584596552794983,
      "learning_rate": 2.2254169273008578e-05,
      "loss": 0.9652,
      "num_input_tokens_seen": 47651284432,
      "step": 60566
    },
    {
      "epoch": 6.425525143220878,
      "grad_norm": 0.7103301088497022,
      "learning_rate": 2.225347850978977e-05,
      "loss": 1.0882,
      "num_input_tokens_seen": 47652071216,
      "step": 60567
    },
    {
      "epoch": 6.42563123276045,
      "grad_norm": 1.0383035459617849,
      "learning_rate": 2.22527877486934e-05,
      "loss": 0.9753,
      "num_input_tokens_seen": 47652857952,
      "step": 60568
    },
    {
      "epoch": 6.425737322300021,
      "grad_norm": 0.8896431514189318,
      "learning_rate": 2.2252096989719997e-05,
      "loss": 1.0279,
      "num_input_tokens_seen": 47653644672,
      "step": 60569
    },
    {
      "epoch": 6.425843411839592,
      "grad_norm": 0.8566024890706099,
      "learning_rate": 2.2251406232870084e-05,
      "loss": 1.0015,
      "num_input_tokens_seen": 47654431360,
      "step": 60570
    },
    {
      "epoch": 6.425949501379164,
      "grad_norm": 0.8428250432096596,
      "learning_rate": 2.225071547814421e-05,
      "loss": 0.9858,
      "num_input_tokens_seen": 47655218128,
      "step": 60571
    },
    {
      "epoch": 6.426055590918735,
      "grad_norm": 0.8165454073228581,
      "learning_rate": 2.2250024725542904e-05,
      "loss": 0.9789,
      "num_input_tokens_seen": 47656005072,
      "step": 60572
    },
    {
      "epoch": 6.426161680458307,
      "grad_norm": 0.7524579167101682,
      "learning_rate": 2.224933397506669e-05,
      "loss": 1.0038,
      "num_input_tokens_seen": 47656791776,
      "step": 60573
    },
    {
      "epoch": 6.426267769997878,
      "grad_norm": 0.6721792604015243,
      "learning_rate": 2.224864322671612e-05,
      "loss": 1.0075,
      "num_input_tokens_seen": 47657578448,
      "step": 60574
    },
    {
      "epoch": 6.42637385953745,
      "grad_norm": 0.6503790755841053,
      "learning_rate": 2.2247952480491714e-05,
      "loss": 0.9752,
      "num_input_tokens_seen": 47658365264,
      "step": 60575
    },
    {
      "epoch": 6.426479949077021,
      "grad_norm": 0.6951343221483038,
      "learning_rate": 2.2247261736394005e-05,
      "loss": 1.0345,
      "num_input_tokens_seen": 47659151920,
      "step": 60576
    },
    {
      "epoch": 6.426586038616592,
      "grad_norm": 0.8225127755379941,
      "learning_rate": 2.2246570994423537e-05,
      "loss": 0.9844,
      "num_input_tokens_seen": 47659938720,
      "step": 60577
    },
    {
      "epoch": 6.426692128156164,
      "grad_norm": 0.7459197003477638,
      "learning_rate": 2.2245880254580836e-05,
      "loss": 1.0413,
      "num_input_tokens_seen": 47660725424,
      "step": 60578
    },
    {
      "epoch": 6.426798217695735,
      "grad_norm": 0.8393046038080333,
      "learning_rate": 2.2245189516866435e-05,
      "loss": 0.9802,
      "num_input_tokens_seen": 47661512288,
      "step": 60579
    },
    {
      "epoch": 6.426904307235307,
      "grad_norm": 0.9910388703992032,
      "learning_rate": 2.2244498781280874e-05,
      "loss": 1.0748,
      "num_input_tokens_seen": 47662299040,
      "step": 60580
    },
    {
      "epoch": 6.427010396774878,
      "grad_norm": 0.9470957834462151,
      "learning_rate": 2.2243808047824687e-05,
      "loss": 1.0485,
      "num_input_tokens_seen": 47663085872,
      "step": 60581
    },
    {
      "epoch": 6.427116486314449,
      "grad_norm": 0.7561491327521636,
      "learning_rate": 2.2243117316498398e-05,
      "loss": 1.0041,
      "num_input_tokens_seen": 47663872704,
      "step": 60582
    },
    {
      "epoch": 6.427222575854021,
      "grad_norm": 0.850497416842649,
      "learning_rate": 2.224242658730255e-05,
      "loss": 0.9806,
      "num_input_tokens_seen": 47664659456,
      "step": 60583
    },
    {
      "epoch": 6.427328665393592,
      "grad_norm": 0.6895999566174777,
      "learning_rate": 2.2241735860237672e-05,
      "loss": 1.0311,
      "num_input_tokens_seen": 47665446224,
      "step": 60584
    },
    {
      "epoch": 6.427434754933164,
      "grad_norm": 0.8181631987562896,
      "learning_rate": 2.2241045135304303e-05,
      "loss": 0.9799,
      "num_input_tokens_seen": 47666233040,
      "step": 60585
    },
    {
      "epoch": 6.427540844472735,
      "grad_norm": 0.9350797960512381,
      "learning_rate": 2.2240354412502974e-05,
      "loss": 0.9412,
      "num_input_tokens_seen": 47667019680,
      "step": 60586
    },
    {
      "epoch": 6.427646934012307,
      "grad_norm": 0.8448890652078875,
      "learning_rate": 2.2239663691834213e-05,
      "loss": 1.0741,
      "num_input_tokens_seen": 47667806368,
      "step": 60587
    },
    {
      "epoch": 6.427753023551878,
      "grad_norm": 0.9031712427079942,
      "learning_rate": 2.223897297329856e-05,
      "loss": 0.9986,
      "num_input_tokens_seen": 47668593184,
      "step": 60588
    },
    {
      "epoch": 6.427859113091449,
      "grad_norm": 0.8968293036648749,
      "learning_rate": 2.223828225689655e-05,
      "loss": 0.9909,
      "num_input_tokens_seen": 47669380096,
      "step": 60589
    },
    {
      "epoch": 6.427965202631021,
      "grad_norm": 0.7031267174664335,
      "learning_rate": 2.223759154262871e-05,
      "loss": 1.0015,
      "num_input_tokens_seen": 47670166848,
      "step": 60590
    },
    {
      "epoch": 6.428071292170592,
      "grad_norm": 0.7589853618799318,
      "learning_rate": 2.2236900830495585e-05,
      "loss": 0.9853,
      "num_input_tokens_seen": 47670953760,
      "step": 60591
    },
    {
      "epoch": 6.428177381710164,
      "grad_norm": 0.6971328915195869,
      "learning_rate": 2.22362101204977e-05,
      "loss": 0.9923,
      "num_input_tokens_seen": 47671740528,
      "step": 60592
    },
    {
      "epoch": 6.428283471249735,
      "grad_norm": 0.7233192657819332,
      "learning_rate": 2.2235519412635586e-05,
      "loss": 1.0931,
      "num_input_tokens_seen": 47672527232,
      "step": 60593
    },
    {
      "epoch": 6.428389560789306,
      "grad_norm": 0.9354392214442265,
      "learning_rate": 2.2234828706909787e-05,
      "loss": 0.9724,
      "num_input_tokens_seen": 47673313984,
      "step": 60594
    },
    {
      "epoch": 6.428495650328878,
      "grad_norm": 0.7130568119926614,
      "learning_rate": 2.2234138003320832e-05,
      "loss": 1.0097,
      "num_input_tokens_seen": 47674100704,
      "step": 60595
    },
    {
      "epoch": 6.428601739868449,
      "grad_norm": 0.9019285237380636,
      "learning_rate": 2.223344730186925e-05,
      "loss": 1.0104,
      "num_input_tokens_seen": 47674887536,
      "step": 60596
    },
    {
      "epoch": 6.428707829408021,
      "grad_norm": 0.6960782774692776,
      "learning_rate": 2.223275660255558e-05,
      "loss": 0.9442,
      "num_input_tokens_seen": 47675674304,
      "step": 60597
    },
    {
      "epoch": 6.428813918947592,
      "grad_norm": 0.7320570128076003,
      "learning_rate": 2.223206590538035e-05,
      "loss": 1.004,
      "num_input_tokens_seen": 47676461008,
      "step": 60598
    },
    {
      "epoch": 6.428920008487163,
      "grad_norm": 0.8384561733948506,
      "learning_rate": 2.2231375210344105e-05,
      "loss": 1.0173,
      "num_input_tokens_seen": 47677247776,
      "step": 60599
    },
    {
      "epoch": 6.429026098026735,
      "grad_norm": 1.137051062178214,
      "learning_rate": 2.223068451744737e-05,
      "loss": 1.0452,
      "num_input_tokens_seen": 47678034528,
      "step": 60600
    },
    {
      "epoch": 6.429132187566306,
      "grad_norm": 1.1211963625652617,
      "learning_rate": 2.2229993826690675e-05,
      "loss": 1.0723,
      "num_input_tokens_seen": 47678821264,
      "step": 60601
    },
    {
      "epoch": 6.429238277105878,
      "grad_norm": 0.78820694251565,
      "learning_rate": 2.222930313807457e-05,
      "loss": 1.0326,
      "num_input_tokens_seen": 47679608016,
      "step": 60602
    },
    {
      "epoch": 6.429344366645449,
      "grad_norm": 1.2689741730735404,
      "learning_rate": 2.2228612451599572e-05,
      "loss": 1.0311,
      "num_input_tokens_seen": 47680394816,
      "step": 60603
    },
    {
      "epoch": 6.4294504561850205,
      "grad_norm": 1.1920681159031714,
      "learning_rate": 2.222792176726622e-05,
      "loss": 1.0297,
      "num_input_tokens_seen": 47681181568,
      "step": 60604
    },
    {
      "epoch": 6.429556545724592,
      "grad_norm": 0.845306626499784,
      "learning_rate": 2.2227231085075055e-05,
      "loss": 1.0637,
      "num_input_tokens_seen": 47681968320,
      "step": 60605
    },
    {
      "epoch": 6.429662635264163,
      "grad_norm": 0.986820425743069,
      "learning_rate": 2.22265404050266e-05,
      "loss": 1.0258,
      "num_input_tokens_seen": 47682755072,
      "step": 60606
    },
    {
      "epoch": 6.4297687248037345,
      "grad_norm": 1.586553628577533,
      "learning_rate": 2.222584972712139e-05,
      "loss": 1.0194,
      "num_input_tokens_seen": 47683541792,
      "step": 60607
    },
    {
      "epoch": 6.4298748143433055,
      "grad_norm": 0.9525194720922794,
      "learning_rate": 2.2225159051359968e-05,
      "loss": 0.9527,
      "num_input_tokens_seen": 47684328512,
      "step": 60608
    },
    {
      "epoch": 6.4299809038828775,
      "grad_norm": 0.753126617484683,
      "learning_rate": 2.222446837774286e-05,
      "loss": 0.9967,
      "num_input_tokens_seen": 47685115328,
      "step": 60609
    },
    {
      "epoch": 6.4300869934224485,
      "grad_norm": 0.9196218796234245,
      "learning_rate": 2.22237777062706e-05,
      "loss": 1.0804,
      "num_input_tokens_seen": 47685902144,
      "step": 60610
    },
    {
      "epoch": 6.43019308296202,
      "grad_norm": 1.1943023430633084,
      "learning_rate": 2.2223087036943723e-05,
      "loss": 1.0091,
      "num_input_tokens_seen": 47686688944,
      "step": 60611
    },
    {
      "epoch": 6.430299172501591,
      "grad_norm": 1.0385974085306067,
      "learning_rate": 2.2222396369762765e-05,
      "loss": 1.0312,
      "num_input_tokens_seen": 47687475680,
      "step": 60612
    },
    {
      "epoch": 6.4304052620411625,
      "grad_norm": 0.9203863380734593,
      "learning_rate": 2.2221705704728252e-05,
      "loss": 1.0584,
      "num_input_tokens_seen": 47688262368,
      "step": 60613
    },
    {
      "epoch": 6.430511351580734,
      "grad_norm": 1.0419477185620871,
      "learning_rate": 2.2221015041840728e-05,
      "loss": 1.0228,
      "num_input_tokens_seen": 47689049104,
      "step": 60614
    },
    {
      "epoch": 6.430617441120305,
      "grad_norm": 0.6975790471093106,
      "learning_rate": 2.222032438110072e-05,
      "loss": 1.0532,
      "num_input_tokens_seen": 47689835872,
      "step": 60615
    },
    {
      "epoch": 6.430723530659877,
      "grad_norm": 0.7441692806897932,
      "learning_rate": 2.2219633722508767e-05,
      "loss": 1.0118,
      "num_input_tokens_seen": 47690622640,
      "step": 60616
    },
    {
      "epoch": 6.430829620199448,
      "grad_norm": 0.8365150721987302,
      "learning_rate": 2.2218943066065398e-05,
      "loss": 1.0316,
      "num_input_tokens_seen": 47691409488,
      "step": 60617
    },
    {
      "epoch": 6.430935709739019,
      "grad_norm": 0.8837728296830532,
      "learning_rate": 2.2218252411771145e-05,
      "loss": 1.0188,
      "num_input_tokens_seen": 47692196224,
      "step": 60618
    },
    {
      "epoch": 6.431041799278591,
      "grad_norm": 0.8029335633392538,
      "learning_rate": 2.221756175962655e-05,
      "loss": 0.9687,
      "num_input_tokens_seen": 47692982960,
      "step": 60619
    },
    {
      "epoch": 6.431147888818162,
      "grad_norm": 0.9256944764427284,
      "learning_rate": 2.2216871109632143e-05,
      "loss": 1.0088,
      "num_input_tokens_seen": 47693769728,
      "step": 60620
    },
    {
      "epoch": 6.431253978357734,
      "grad_norm": 0.7661706819084858,
      "learning_rate": 2.2216180461788446e-05,
      "loss": 1.0551,
      "num_input_tokens_seen": 47694556528,
      "step": 60621
    },
    {
      "epoch": 6.431360067897305,
      "grad_norm": 0.842274662074885,
      "learning_rate": 2.2215489816096015e-05,
      "loss": 0.999,
      "num_input_tokens_seen": 47695343344,
      "step": 60622
    },
    {
      "epoch": 6.431466157436876,
      "grad_norm": 0.7690049067440758,
      "learning_rate": 2.2214799172555367e-05,
      "loss": 0.9197,
      "num_input_tokens_seen": 47696130176,
      "step": 60623
    },
    {
      "epoch": 6.431572246976448,
      "grad_norm": 0.6175279215298561,
      "learning_rate": 2.2214108531167036e-05,
      "loss": 1.0222,
      "num_input_tokens_seen": 47696917056,
      "step": 60624
    },
    {
      "epoch": 6.431678336516019,
      "grad_norm": 0.8413013809357253,
      "learning_rate": 2.2213417891931565e-05,
      "loss": 1.0608,
      "num_input_tokens_seen": 47697703808,
      "step": 60625
    },
    {
      "epoch": 6.431784426055591,
      "grad_norm": 0.7219264141009972,
      "learning_rate": 2.2212727254849485e-05,
      "loss": 0.9427,
      "num_input_tokens_seen": 47698490608,
      "step": 60626
    },
    {
      "epoch": 6.431890515595162,
      "grad_norm": 0.6421199233504233,
      "learning_rate": 2.221203661992132e-05,
      "loss": 1.0228,
      "num_input_tokens_seen": 47699277360,
      "step": 60627
    },
    {
      "epoch": 6.431996605134733,
      "grad_norm": 0.8064781954977845,
      "learning_rate": 2.2211345987147618e-05,
      "loss": 0.9807,
      "num_input_tokens_seen": 47700064080,
      "step": 60628
    },
    {
      "epoch": 6.432102694674305,
      "grad_norm": 0.8289932946931827,
      "learning_rate": 2.2210655356528904e-05,
      "loss": 0.9856,
      "num_input_tokens_seen": 47700850880,
      "step": 60629
    },
    {
      "epoch": 6.432208784213876,
      "grad_norm": 0.6705844211404782,
      "learning_rate": 2.2209964728065714e-05,
      "loss": 0.9663,
      "num_input_tokens_seen": 47701637712,
      "step": 60630
    },
    {
      "epoch": 6.432314873753448,
      "grad_norm": 0.8082663972560131,
      "learning_rate": 2.220927410175858e-05,
      "loss": 0.9671,
      "num_input_tokens_seen": 47702424480,
      "step": 60631
    },
    {
      "epoch": 6.432420963293019,
      "grad_norm": 0.9163759374215098,
      "learning_rate": 2.2208583477608035e-05,
      "loss": 1.0265,
      "num_input_tokens_seen": 47703211200,
      "step": 60632
    },
    {
      "epoch": 6.432527052832591,
      "grad_norm": 0.857459548156307,
      "learning_rate": 2.220789285561462e-05,
      "loss": 1.0024,
      "num_input_tokens_seen": 47703997968,
      "step": 60633
    },
    {
      "epoch": 6.432633142372162,
      "grad_norm": 1.3129464770500352,
      "learning_rate": 2.2207202235778867e-05,
      "loss": 1.028,
      "num_input_tokens_seen": 47704784640,
      "step": 60634
    },
    {
      "epoch": 6.432739231911733,
      "grad_norm": 1.018346757127339,
      "learning_rate": 2.2206511618101295e-05,
      "loss": 1.1097,
      "num_input_tokens_seen": 47705571424,
      "step": 60635
    },
    {
      "epoch": 6.432845321451305,
      "grad_norm": 0.9545711816290079,
      "learning_rate": 2.2205821002582455e-05,
      "loss": 0.9983,
      "num_input_tokens_seen": 47706358224,
      "step": 60636
    },
    {
      "epoch": 6.432951410990876,
      "grad_norm": 0.8961199749661457,
      "learning_rate": 2.220513038922288e-05,
      "loss": 0.9986,
      "num_input_tokens_seen": 47707145152,
      "step": 60637
    },
    {
      "epoch": 6.433057500530448,
      "grad_norm": 0.7454808159096136,
      "learning_rate": 2.2204439778023083e-05,
      "loss": 0.9528,
      "num_input_tokens_seen": 47707932048,
      "step": 60638
    },
    {
      "epoch": 6.433163590070019,
      "grad_norm": 0.7955019304275465,
      "learning_rate": 2.2203749168983625e-05,
      "loss": 1.039,
      "num_input_tokens_seen": 47708718800,
      "step": 60639
    },
    {
      "epoch": 6.433269679609591,
      "grad_norm": 0.9029804940958209,
      "learning_rate": 2.220305856210503e-05,
      "loss": 1.0183,
      "num_input_tokens_seen": 47709505472,
      "step": 60640
    },
    {
      "epoch": 6.433375769149162,
      "grad_norm": 0.8648521900196123,
      "learning_rate": 2.2202367957387817e-05,
      "loss": 1.0569,
      "num_input_tokens_seen": 47710292064,
      "step": 60641
    },
    {
      "epoch": 6.433481858688733,
      "grad_norm": 1.0604483141612493,
      "learning_rate": 2.2201677354832542e-05,
      "loss": 1.023,
      "num_input_tokens_seen": 47711078896,
      "step": 60642
    },
    {
      "epoch": 6.433587948228305,
      "grad_norm": 0.8014339344368187,
      "learning_rate": 2.220098675443973e-05,
      "loss": 0.9935,
      "num_input_tokens_seen": 47711865760,
      "step": 60643
    },
    {
      "epoch": 6.433694037767876,
      "grad_norm": 1.0615897050253091,
      "learning_rate": 2.22002961562099e-05,
      "loss": 1.1417,
      "num_input_tokens_seen": 47712652560,
      "step": 60644
    },
    {
      "epoch": 6.433800127307448,
      "grad_norm": 0.7491566601317441,
      "learning_rate": 2.2199605560143613e-05,
      "loss": 0.9036,
      "num_input_tokens_seen": 47713439344,
      "step": 60645
    },
    {
      "epoch": 6.433906216847019,
      "grad_norm": 0.7486240156314681,
      "learning_rate": 2.2198914966241386e-05,
      "loss": 0.9579,
      "num_input_tokens_seen": 47714226080,
      "step": 60646
    },
    {
      "epoch": 6.43401230638659,
      "grad_norm": 0.8901633624792223,
      "learning_rate": 2.219822437450375e-05,
      "loss": 1.004,
      "num_input_tokens_seen": 47715012880,
      "step": 60647
    },
    {
      "epoch": 6.434118395926162,
      "grad_norm": 0.7682388774818935,
      "learning_rate": 2.2197533784931245e-05,
      "loss": 0.9118,
      "num_input_tokens_seen": 47715799632,
      "step": 60648
    },
    {
      "epoch": 6.434224485465733,
      "grad_norm": 0.9122542121879289,
      "learning_rate": 2.2196843197524402e-05,
      "loss": 0.9769,
      "num_input_tokens_seen": 47716586416,
      "step": 60649
    },
    {
      "epoch": 6.434330575005305,
      "grad_norm": 0.9830016186377386,
      "learning_rate": 2.2196152612283758e-05,
      "loss": 0.9787,
      "num_input_tokens_seen": 47717373264,
      "step": 60650
    },
    {
      "epoch": 6.434436664544876,
      "grad_norm": 0.9225704525439372,
      "learning_rate": 2.2195462029209844e-05,
      "loss": 1.0785,
      "num_input_tokens_seen": 47718160032,
      "step": 60651
    },
    {
      "epoch": 6.434542754084447,
      "grad_norm": 0.8474818038786406,
      "learning_rate": 2.21947714483032e-05,
      "loss": 1.0308,
      "num_input_tokens_seen": 47718946752,
      "step": 60652
    },
    {
      "epoch": 6.434648843624019,
      "grad_norm": 1.1587019433473118,
      "learning_rate": 2.2194080869564346e-05,
      "loss": 1.0793,
      "num_input_tokens_seen": 47719733568,
      "step": 60653
    },
    {
      "epoch": 6.43475493316359,
      "grad_norm": 0.6785791450240792,
      "learning_rate": 2.2193390292993832e-05,
      "loss": 1.005,
      "num_input_tokens_seen": 47720520272,
      "step": 60654
    },
    {
      "epoch": 6.434861022703162,
      "grad_norm": 0.8092137789134098,
      "learning_rate": 2.2192699718592184e-05,
      "loss": 1.026,
      "num_input_tokens_seen": 47721307056,
      "step": 60655
    },
    {
      "epoch": 6.434967112242733,
      "grad_norm": 1.0507953850615737,
      "learning_rate": 2.219200914635993e-05,
      "loss": 0.9954,
      "num_input_tokens_seen": 47722093664,
      "step": 60656
    },
    {
      "epoch": 6.435073201782304,
      "grad_norm": 0.770056196706154,
      "learning_rate": 2.2191318576297614e-05,
      "loss": 1.0332,
      "num_input_tokens_seen": 47722880400,
      "step": 60657
    },
    {
      "epoch": 6.435179291321876,
      "grad_norm": 0.7566672182870909,
      "learning_rate": 2.2190628008405762e-05,
      "loss": 0.9901,
      "num_input_tokens_seen": 47723667120,
      "step": 60658
    },
    {
      "epoch": 6.435285380861447,
      "grad_norm": 1.0975032240233948,
      "learning_rate": 2.2189937442684907e-05,
      "loss": 1.0621,
      "num_input_tokens_seen": 47724453952,
      "step": 60659
    },
    {
      "epoch": 6.435391470401019,
      "grad_norm": 0.9164744186729696,
      "learning_rate": 2.218924687913559e-05,
      "loss": 1.0905,
      "num_input_tokens_seen": 47725240688,
      "step": 60660
    },
    {
      "epoch": 6.43549755994059,
      "grad_norm": 0.8057817424977612,
      "learning_rate": 2.2188556317758345e-05,
      "loss": 1.1324,
      "num_input_tokens_seen": 47726027424,
      "step": 60661
    },
    {
      "epoch": 6.435603649480162,
      "grad_norm": 0.9574551489826223,
      "learning_rate": 2.218786575855369e-05,
      "loss": 0.9851,
      "num_input_tokens_seen": 47726814144,
      "step": 60662
    },
    {
      "epoch": 6.435709739019733,
      "grad_norm": 0.9878476181710989,
      "learning_rate": 2.2187175201522177e-05,
      "loss": 0.9755,
      "num_input_tokens_seen": 47727600912,
      "step": 60663
    },
    {
      "epoch": 6.435815828559304,
      "grad_norm": 0.7831749612458315,
      "learning_rate": 2.2186484646664334e-05,
      "loss": 1.0349,
      "num_input_tokens_seen": 47728387648,
      "step": 60664
    },
    {
      "epoch": 6.435921918098876,
      "grad_norm": 1.0313377660793552,
      "learning_rate": 2.2185794093980688e-05,
      "loss": 0.9566,
      "num_input_tokens_seen": 47729174416,
      "step": 60665
    },
    {
      "epoch": 6.436028007638447,
      "grad_norm": 0.8514140175066791,
      "learning_rate": 2.218510354347178e-05,
      "loss": 0.982,
      "num_input_tokens_seen": 47729961152,
      "step": 60666
    },
    {
      "epoch": 6.4361340971780185,
      "grad_norm": 0.833584047224854,
      "learning_rate": 2.2184412995138146e-05,
      "loss": 0.9692,
      "num_input_tokens_seen": 47730747952,
      "step": 60667
    },
    {
      "epoch": 6.43624018671759,
      "grad_norm": 1.0776294628320318,
      "learning_rate": 2.2183722448980306e-05,
      "loss": 0.959,
      "num_input_tokens_seen": 47731534736,
      "step": 60668
    },
    {
      "epoch": 6.4363462762571615,
      "grad_norm": 0.763462369665312,
      "learning_rate": 2.218303190499881e-05,
      "loss": 1.013,
      "num_input_tokens_seen": 47732321488,
      "step": 60669
    },
    {
      "epoch": 6.4364523657967325,
      "grad_norm": 1.2941650304001329,
      "learning_rate": 2.2182341363194177e-05,
      "loss": 0.9915,
      "num_input_tokens_seen": 47733108272,
      "step": 60670
    },
    {
      "epoch": 6.4365584553363036,
      "grad_norm": 0.8426348307809746,
      "learning_rate": 2.2181650823566954e-05,
      "loss": 0.9456,
      "num_input_tokens_seen": 47733895008,
      "step": 60671
    },
    {
      "epoch": 6.4366645448758755,
      "grad_norm": 0.7697162551237611,
      "learning_rate": 2.218096028611767e-05,
      "loss": 1.0115,
      "num_input_tokens_seen": 47734681744,
      "step": 60672
    },
    {
      "epoch": 6.4367706344154465,
      "grad_norm": 0.735040175209134,
      "learning_rate": 2.218026975084685e-05,
      "loss": 0.9522,
      "num_input_tokens_seen": 47735468560,
      "step": 60673
    },
    {
      "epoch": 6.436876723955018,
      "grad_norm": 0.9943878748280139,
      "learning_rate": 2.2179579217755043e-05,
      "loss": 0.9608,
      "num_input_tokens_seen": 47736255392,
      "step": 60674
    },
    {
      "epoch": 6.4369828134945895,
      "grad_norm": 0.9185594662700762,
      "learning_rate": 2.217888868684277e-05,
      "loss": 1.0953,
      "num_input_tokens_seen": 47737042128,
      "step": 60675
    },
    {
      "epoch": 6.4370889030341605,
      "grad_norm": 0.9102827373590191,
      "learning_rate": 2.2178198158110567e-05,
      "loss": 1.0558,
      "num_input_tokens_seen": 47737828816,
      "step": 60676
    },
    {
      "epoch": 6.437194992573732,
      "grad_norm": 0.68572318205322,
      "learning_rate": 2.2177507631558975e-05,
      "loss": 0.9472,
      "num_input_tokens_seen": 47738615600,
      "step": 60677
    },
    {
      "epoch": 6.437301082113303,
      "grad_norm": 1.142961947014957,
      "learning_rate": 2.217681710718852e-05,
      "loss": 0.9625,
      "num_input_tokens_seen": 47739402400,
      "step": 60678
    },
    {
      "epoch": 6.437407171652875,
      "grad_norm": 1.0922854870213698,
      "learning_rate": 2.2176126584999734e-05,
      "loss": 1.008,
      "num_input_tokens_seen": 47740189152,
      "step": 60679
    },
    {
      "epoch": 6.437513261192446,
      "grad_norm": 0.9510862063458598,
      "learning_rate": 2.217543606499316e-05,
      "loss": 1.0514,
      "num_input_tokens_seen": 47740975872,
      "step": 60680
    },
    {
      "epoch": 6.437619350732017,
      "grad_norm": 0.8027103214640786,
      "learning_rate": 2.2174745547169328e-05,
      "loss": 1.0061,
      "num_input_tokens_seen": 47741762640,
      "step": 60681
    },
    {
      "epoch": 6.437725440271589,
      "grad_norm": 0.6351352376482851,
      "learning_rate": 2.217405503152876e-05,
      "loss": 1.0341,
      "num_input_tokens_seen": 47742549488,
      "step": 60682
    },
    {
      "epoch": 6.43783152981116,
      "grad_norm": 0.7797412701776159,
      "learning_rate": 2.2173364518072007e-05,
      "loss": 1.0823,
      "num_input_tokens_seen": 47743336208,
      "step": 60683
    },
    {
      "epoch": 6.437937619350732,
      "grad_norm": 0.8108902842636742,
      "learning_rate": 2.2172674006799595e-05,
      "loss": 0.9634,
      "num_input_tokens_seen": 47744123024,
      "step": 60684
    },
    {
      "epoch": 6.438043708890303,
      "grad_norm": 0.8297988533250868,
      "learning_rate": 2.217198349771205e-05,
      "loss": 1.0492,
      "num_input_tokens_seen": 47744909840,
      "step": 60685
    },
    {
      "epoch": 6.438149798429875,
      "grad_norm": 0.7005989363235008,
      "learning_rate": 2.2171292990809923e-05,
      "loss": 1.0367,
      "num_input_tokens_seen": 47745696640,
      "step": 60686
    },
    {
      "epoch": 6.438255887969446,
      "grad_norm": 0.7116878029815649,
      "learning_rate": 2.217060248609373e-05,
      "loss": 0.9643,
      "num_input_tokens_seen": 47746483408,
      "step": 60687
    },
    {
      "epoch": 6.438361977509017,
      "grad_norm": 0.8927678408373777,
      "learning_rate": 2.216991198356402e-05,
      "loss": 1.0807,
      "num_input_tokens_seen": 47747270176,
      "step": 60688
    },
    {
      "epoch": 6.438468067048589,
      "grad_norm": 0.7441074495652492,
      "learning_rate": 2.2169221483221314e-05,
      "loss": 1.0254,
      "num_input_tokens_seen": 47748056928,
      "step": 60689
    },
    {
      "epoch": 6.43857415658816,
      "grad_norm": 0.8264562903758197,
      "learning_rate": 2.216853098506615e-05,
      "loss": 0.9928,
      "num_input_tokens_seen": 47748843712,
      "step": 60690
    },
    {
      "epoch": 6.438680246127732,
      "grad_norm": 0.8150400876935356,
      "learning_rate": 2.216784048909906e-05,
      "loss": 1.0151,
      "num_input_tokens_seen": 47749630464,
      "step": 60691
    },
    {
      "epoch": 6.438786335667303,
      "grad_norm": 0.9156486722969129,
      "learning_rate": 2.2167149995320587e-05,
      "loss": 1.0332,
      "num_input_tokens_seen": 47750417136,
      "step": 60692
    },
    {
      "epoch": 6.438892425206874,
      "grad_norm": 0.7584792286595904,
      "learning_rate": 2.2166459503731252e-05,
      "loss": 0.9896,
      "num_input_tokens_seen": 47751203936,
      "step": 60693
    },
    {
      "epoch": 6.438998514746446,
      "grad_norm": 1.0893594199536158,
      "learning_rate": 2.2165769014331597e-05,
      "loss": 1.0557,
      "num_input_tokens_seen": 47751990768,
      "step": 60694
    },
    {
      "epoch": 6.439104604286017,
      "grad_norm": 0.7987796997705309,
      "learning_rate": 2.2165078527122154e-05,
      "loss": 1.0545,
      "num_input_tokens_seen": 47752777632,
      "step": 60695
    },
    {
      "epoch": 6.439210693825589,
      "grad_norm": 0.8154272459114056,
      "learning_rate": 2.2164388042103448e-05,
      "loss": 1.0408,
      "num_input_tokens_seen": 47753564480,
      "step": 60696
    },
    {
      "epoch": 6.43931678336516,
      "grad_norm": 1.3107712660420876,
      "learning_rate": 2.2163697559276025e-05,
      "loss": 1.0634,
      "num_input_tokens_seen": 47754351232,
      "step": 60697
    },
    {
      "epoch": 6.439422872904732,
      "grad_norm": 0.9662454029553854,
      "learning_rate": 2.2163007078640416e-05,
      "loss": 0.9665,
      "num_input_tokens_seen": 47755138032,
      "step": 60698
    },
    {
      "epoch": 6.439528962444303,
      "grad_norm": 1.1125334743021176,
      "learning_rate": 2.2162316600197145e-05,
      "loss": 1.0584,
      "num_input_tokens_seen": 47755924688,
      "step": 60699
    },
    {
      "epoch": 6.439635051983874,
      "grad_norm": 0.704867110389854,
      "learning_rate": 2.2161626123946757e-05,
      "loss": 0.9566,
      "num_input_tokens_seen": 47756711440,
      "step": 60700
    },
    {
      "epoch": 6.439741141523446,
      "grad_norm": 0.7360202867999027,
      "learning_rate": 2.216093564988978e-05,
      "loss": 0.9774,
      "num_input_tokens_seen": 47757498096,
      "step": 60701
    },
    {
      "epoch": 6.439847231063017,
      "grad_norm": 0.7620935702121228,
      "learning_rate": 2.2160245178026747e-05,
      "loss": 0.9517,
      "num_input_tokens_seen": 47758284944,
      "step": 60702
    },
    {
      "epoch": 6.439953320602589,
      "grad_norm": 0.983501868907026,
      "learning_rate": 2.2159554708358195e-05,
      "loss": 1.0377,
      "num_input_tokens_seen": 47759071680,
      "step": 60703
    },
    {
      "epoch": 6.44005941014216,
      "grad_norm": 0.9916969373664941,
      "learning_rate": 2.215886424088465e-05,
      "loss": 0.9597,
      "num_input_tokens_seen": 47759858448,
      "step": 60704
    },
    {
      "epoch": 6.440165499681731,
      "grad_norm": 0.8582745459012723,
      "learning_rate": 2.2158173775606664e-05,
      "loss": 1.1138,
      "num_input_tokens_seen": 47760645216,
      "step": 60705
    },
    {
      "epoch": 6.440271589221303,
      "grad_norm": 0.8371128014289709,
      "learning_rate": 2.2157483312524752e-05,
      "loss": 1.03,
      "num_input_tokens_seen": 47761432032,
      "step": 60706
    },
    {
      "epoch": 6.440377678760874,
      "grad_norm": 0.6900760707795515,
      "learning_rate": 2.215679285163945e-05,
      "loss": 0.9755,
      "num_input_tokens_seen": 47762218816,
      "step": 60707
    },
    {
      "epoch": 6.440483768300446,
      "grad_norm": 0.7203271928525955,
      "learning_rate": 2.2156102392951298e-05,
      "loss": 1.0649,
      "num_input_tokens_seen": 47763005568,
      "step": 60708
    },
    {
      "epoch": 6.440589857840017,
      "grad_norm": 0.7652504375967061,
      "learning_rate": 2.2155411936460827e-05,
      "loss": 1.0268,
      "num_input_tokens_seen": 47763792320,
      "step": 60709
    },
    {
      "epoch": 6.440695947379588,
      "grad_norm": 0.734946155944523,
      "learning_rate": 2.2154721482168566e-05,
      "loss": 0.9924,
      "num_input_tokens_seen": 47764579120,
      "step": 60710
    },
    {
      "epoch": 6.44080203691916,
      "grad_norm": 1.0017439091166627,
      "learning_rate": 2.2154031030075057e-05,
      "loss": 0.9956,
      "num_input_tokens_seen": 47765365856,
      "step": 60711
    },
    {
      "epoch": 6.440908126458731,
      "grad_norm": 0.704190406351893,
      "learning_rate": 2.215334058018083e-05,
      "loss": 0.9665,
      "num_input_tokens_seen": 47766152704,
      "step": 60712
    },
    {
      "epoch": 6.441014215998303,
      "grad_norm": 0.7467908509594666,
      "learning_rate": 2.2152650132486414e-05,
      "loss": 1.0209,
      "num_input_tokens_seen": 47766939392,
      "step": 60713
    },
    {
      "epoch": 6.441120305537874,
      "grad_norm": 0.7223379490037303,
      "learning_rate": 2.215195968699235e-05,
      "loss": 1.0008,
      "num_input_tokens_seen": 47767726192,
      "step": 60714
    },
    {
      "epoch": 6.441226395077446,
      "grad_norm": 0.8163901876865357,
      "learning_rate": 2.215126924369917e-05,
      "loss": 1.0291,
      "num_input_tokens_seen": 47768513024,
      "step": 60715
    },
    {
      "epoch": 6.441332484617017,
      "grad_norm": 0.6850151257297206,
      "learning_rate": 2.2150578802607398e-05,
      "loss": 1.0501,
      "num_input_tokens_seen": 47769299760,
      "step": 60716
    },
    {
      "epoch": 6.441438574156588,
      "grad_norm": 1.2628344276079178,
      "learning_rate": 2.214988836371758e-05,
      "loss": 1.0325,
      "num_input_tokens_seen": 47770086624,
      "step": 60717
    },
    {
      "epoch": 6.44154466369616,
      "grad_norm": 0.7106860854907231,
      "learning_rate": 2.2149197927030242e-05,
      "loss": 1.0245,
      "num_input_tokens_seen": 47770873392,
      "step": 60718
    },
    {
      "epoch": 6.441650753235731,
      "grad_norm": 0.9516590121537836,
      "learning_rate": 2.2148507492545924e-05,
      "loss": 0.9767,
      "num_input_tokens_seen": 47771660112,
      "step": 60719
    },
    {
      "epoch": 6.441756842775303,
      "grad_norm": 0.8705414938413324,
      "learning_rate": 2.2147817060265152e-05,
      "loss": 0.9145,
      "num_input_tokens_seen": 47772446960,
      "step": 60720
    },
    {
      "epoch": 6.441862932314874,
      "grad_norm": 0.9645059485775588,
      "learning_rate": 2.2147126630188465e-05,
      "loss": 1.0749,
      "num_input_tokens_seen": 47773233632,
      "step": 60721
    },
    {
      "epoch": 6.441969021854445,
      "grad_norm": 0.9647909690379398,
      "learning_rate": 2.2146436202316395e-05,
      "loss": 0.9908,
      "num_input_tokens_seen": 47774020352,
      "step": 60722
    },
    {
      "epoch": 6.442075111394017,
      "grad_norm": 0.8233218228873829,
      "learning_rate": 2.2145745776649477e-05,
      "loss": 0.9317,
      "num_input_tokens_seen": 47774807072,
      "step": 60723
    },
    {
      "epoch": 6.442181200933588,
      "grad_norm": 0.8956998036381077,
      "learning_rate": 2.214505535318824e-05,
      "loss": 1.0487,
      "num_input_tokens_seen": 47775593824,
      "step": 60724
    },
    {
      "epoch": 6.44228729047316,
      "grad_norm": 1.356148751774484,
      "learning_rate": 2.214436493193322e-05,
      "loss": 0.9546,
      "num_input_tokens_seen": 47776380640,
      "step": 60725
    },
    {
      "epoch": 6.442393380012731,
      "grad_norm": 0.6685811148506691,
      "learning_rate": 2.2143674512884953e-05,
      "loss": 0.9949,
      "num_input_tokens_seen": 47777167472,
      "step": 60726
    },
    {
      "epoch": 6.442499469552303,
      "grad_norm": 0.9301536896512695,
      "learning_rate": 2.2142984096043966e-05,
      "loss": 1.1148,
      "num_input_tokens_seen": 47777954192,
      "step": 60727
    },
    {
      "epoch": 6.442605559091874,
      "grad_norm": 0.9015542286023022,
      "learning_rate": 2.2142293681410807e-05,
      "loss": 0.9738,
      "num_input_tokens_seen": 47778740944,
      "step": 60728
    },
    {
      "epoch": 6.442711648631445,
      "grad_norm": 0.804803540655322,
      "learning_rate": 2.2141603268985995e-05,
      "loss": 0.9845,
      "num_input_tokens_seen": 47779527744,
      "step": 60729
    },
    {
      "epoch": 6.4428177381710166,
      "grad_norm": 0.7382640956842308,
      "learning_rate": 2.2140912858770062e-05,
      "loss": 0.9673,
      "num_input_tokens_seen": 47780314544,
      "step": 60730
    },
    {
      "epoch": 6.442923827710588,
      "grad_norm": 0.7810564195416625,
      "learning_rate": 2.2140222450763554e-05,
      "loss": 1.023,
      "num_input_tokens_seen": 47781101312,
      "step": 60731
    },
    {
      "epoch": 6.4430299172501595,
      "grad_norm": 0.7693089274603431,
      "learning_rate": 2.2139532044967e-05,
      "loss": 0.9649,
      "num_input_tokens_seen": 47781888160,
      "step": 60732
    },
    {
      "epoch": 6.4431360067897305,
      "grad_norm": 0.9395505263737474,
      "learning_rate": 2.2138841641380925e-05,
      "loss": 1.0822,
      "num_input_tokens_seen": 47782674944,
      "step": 60733
    },
    {
      "epoch": 6.443242096329302,
      "grad_norm": 0.7336154683256156,
      "learning_rate": 2.213815124000587e-05,
      "loss": 1.0022,
      "num_input_tokens_seen": 47783461648,
      "step": 60734
    },
    {
      "epoch": 6.4433481858688735,
      "grad_norm": 0.8216839863647462,
      "learning_rate": 2.213746084084237e-05,
      "loss": 0.972,
      "num_input_tokens_seen": 47784248432,
      "step": 60735
    },
    {
      "epoch": 6.4434542754084445,
      "grad_norm": 0.859109899330985,
      "learning_rate": 2.213677044389096e-05,
      "loss": 1.0548,
      "num_input_tokens_seen": 47785035216,
      "step": 60736
    },
    {
      "epoch": 6.443560364948016,
      "grad_norm": 0.6682446764631601,
      "learning_rate": 2.2136080049152165e-05,
      "loss": 1.0101,
      "num_input_tokens_seen": 47785821968,
      "step": 60737
    },
    {
      "epoch": 6.4436664544875875,
      "grad_norm": 0.8433296993385859,
      "learning_rate": 2.2135389656626522e-05,
      "loss": 1.0542,
      "num_input_tokens_seen": 47786608784,
      "step": 60738
    },
    {
      "epoch": 6.4437725440271585,
      "grad_norm": 0.8054765107853721,
      "learning_rate": 2.2134699266314572e-05,
      "loss": 0.9266,
      "num_input_tokens_seen": 47787395520,
      "step": 60739
    },
    {
      "epoch": 6.44387863356673,
      "grad_norm": 0.8933774373832524,
      "learning_rate": 2.213400887821684e-05,
      "loss": 1.0551,
      "num_input_tokens_seen": 47788182384,
      "step": 60740
    },
    {
      "epoch": 6.443984723106301,
      "grad_norm": 0.7259009703674688,
      "learning_rate": 2.2133318492333858e-05,
      "loss": 0.9155,
      "num_input_tokens_seen": 47788969136,
      "step": 60741
    },
    {
      "epoch": 6.444090812645873,
      "grad_norm": 0.7291177935732693,
      "learning_rate": 2.2132628108666167e-05,
      "loss": 0.9813,
      "num_input_tokens_seen": 47789755968,
      "step": 60742
    },
    {
      "epoch": 6.444196902185444,
      "grad_norm": 0.8028041842501579,
      "learning_rate": 2.21319377272143e-05,
      "loss": 1.0613,
      "num_input_tokens_seen": 47790542672,
      "step": 60743
    },
    {
      "epoch": 6.444302991725016,
      "grad_norm": 0.8285134613423879,
      "learning_rate": 2.2131247347978778e-05,
      "loss": 0.9753,
      "num_input_tokens_seen": 47791329344,
      "step": 60744
    },
    {
      "epoch": 6.444409081264587,
      "grad_norm": 0.7358144015544398,
      "learning_rate": 2.213055697096015e-05,
      "loss": 1.0758,
      "num_input_tokens_seen": 47792116096,
      "step": 60745
    },
    {
      "epoch": 6.444515170804158,
      "grad_norm": 1.051288991751074,
      "learning_rate": 2.2129866596158936e-05,
      "loss": 1.0171,
      "num_input_tokens_seen": 47792902880,
      "step": 60746
    },
    {
      "epoch": 6.44462126034373,
      "grad_norm": 0.6827766354090992,
      "learning_rate": 2.2129176223575684e-05,
      "loss": 1.0104,
      "num_input_tokens_seen": 47793689664,
      "step": 60747
    },
    {
      "epoch": 6.444727349883301,
      "grad_norm": 0.8173207980739543,
      "learning_rate": 2.2128485853210917e-05,
      "loss": 0.9578,
      "num_input_tokens_seen": 47794476352,
      "step": 60748
    },
    {
      "epoch": 6.444833439422873,
      "grad_norm": 0.8087803509380419,
      "learning_rate": 2.2127795485065176e-05,
      "loss": 0.9682,
      "num_input_tokens_seen": 47795263248,
      "step": 60749
    },
    {
      "epoch": 6.444939528962444,
      "grad_norm": 0.7837750014668492,
      "learning_rate": 2.212710511913899e-05,
      "loss": 1.0677,
      "num_input_tokens_seen": 47796049888,
      "step": 60750
    },
    {
      "epoch": 6.445045618502015,
      "grad_norm": 0.8271839153326014,
      "learning_rate": 2.212641475543289e-05,
      "loss": 0.9391,
      "num_input_tokens_seen": 47796836704,
      "step": 60751
    },
    {
      "epoch": 6.445151708041587,
      "grad_norm": 0.7562213736165417,
      "learning_rate": 2.2125724393947417e-05,
      "loss": 1.0307,
      "num_input_tokens_seen": 47797623424,
      "step": 60752
    },
    {
      "epoch": 6.445257797581158,
      "grad_norm": 0.8121373702608391,
      "learning_rate": 2.2125034034683098e-05,
      "loss": 1.0054,
      "num_input_tokens_seen": 47798410144,
      "step": 60753
    },
    {
      "epoch": 6.44536388712073,
      "grad_norm": 0.8943251009767771,
      "learning_rate": 2.2124343677640465e-05,
      "loss": 0.9571,
      "num_input_tokens_seen": 47799196944,
      "step": 60754
    },
    {
      "epoch": 6.445469976660301,
      "grad_norm": 0.6874856457475893,
      "learning_rate": 2.212365332282006e-05,
      "loss": 1.0444,
      "num_input_tokens_seen": 47799983712,
      "step": 60755
    },
    {
      "epoch": 6.445576066199873,
      "grad_norm": 1.1081098489392756,
      "learning_rate": 2.21229629702224e-05,
      "loss": 1.0298,
      "num_input_tokens_seen": 47800770480,
      "step": 60756
    },
    {
      "epoch": 6.445682155739444,
      "grad_norm": 0.9538692417172954,
      "learning_rate": 2.2122272619848045e-05,
      "loss": 1.1075,
      "num_input_tokens_seen": 47801557296,
      "step": 60757
    },
    {
      "epoch": 6.445788245279015,
      "grad_norm": 1.0023923832527535,
      "learning_rate": 2.212158227169751e-05,
      "loss": 0.9591,
      "num_input_tokens_seen": 47802344000,
      "step": 60758
    },
    {
      "epoch": 6.445894334818587,
      "grad_norm": 1.0601218727727002,
      "learning_rate": 2.2120891925771323e-05,
      "loss": 0.9605,
      "num_input_tokens_seen": 47803130736,
      "step": 60759
    },
    {
      "epoch": 6.446000424358158,
      "grad_norm": 1.4226398151036224,
      "learning_rate": 2.212020158207003e-05,
      "loss": 1.0265,
      "num_input_tokens_seen": 47803917504,
      "step": 60760
    },
    {
      "epoch": 6.44610651389773,
      "grad_norm": 0.8618362610195821,
      "learning_rate": 2.2119511240594166e-05,
      "loss": 0.946,
      "num_input_tokens_seen": 47804704336,
      "step": 60761
    },
    {
      "epoch": 6.446212603437301,
      "grad_norm": 1.1715525661670096,
      "learning_rate": 2.2118820901344253e-05,
      "loss": 1.0163,
      "num_input_tokens_seen": 47805491168,
      "step": 60762
    },
    {
      "epoch": 6.446318692976872,
      "grad_norm": 0.948568253504657,
      "learning_rate": 2.2118130564320837e-05,
      "loss": 0.9761,
      "num_input_tokens_seen": 47806277904,
      "step": 60763
    },
    {
      "epoch": 6.446424782516444,
      "grad_norm": 0.8674598678736793,
      "learning_rate": 2.211744022952444e-05,
      "loss": 0.9703,
      "num_input_tokens_seen": 47807064640,
      "step": 60764
    },
    {
      "epoch": 6.446530872056015,
      "grad_norm": 0.7554180331367452,
      "learning_rate": 2.21167498969556e-05,
      "loss": 0.9894,
      "num_input_tokens_seen": 47807851488,
      "step": 60765
    },
    {
      "epoch": 6.446636961595587,
      "grad_norm": 0.8360434281005579,
      "learning_rate": 2.2116059566614854e-05,
      "loss": 1.0735,
      "num_input_tokens_seen": 47808638176,
      "step": 60766
    },
    {
      "epoch": 6.446743051135158,
      "grad_norm": 0.6820155365685647,
      "learning_rate": 2.2115369238502733e-05,
      "loss": 1.0059,
      "num_input_tokens_seen": 47809424928,
      "step": 60767
    },
    {
      "epoch": 6.446849140674729,
      "grad_norm": 0.6387490598025437,
      "learning_rate": 2.211467891261977e-05,
      "loss": 0.9519,
      "num_input_tokens_seen": 47810211792,
      "step": 60768
    },
    {
      "epoch": 6.446955230214301,
      "grad_norm": 0.7770726364919619,
      "learning_rate": 2.2113988588966497e-05,
      "loss": 1.0538,
      "num_input_tokens_seen": 47810998560,
      "step": 60769
    },
    {
      "epoch": 6.447061319753872,
      "grad_norm": 0.7652509605709571,
      "learning_rate": 2.211329826754345e-05,
      "loss": 0.9685,
      "num_input_tokens_seen": 47811785376,
      "step": 60770
    },
    {
      "epoch": 6.447167409293444,
      "grad_norm": 0.6689790507173946,
      "learning_rate": 2.2112607948351157e-05,
      "loss": 0.9805,
      "num_input_tokens_seen": 47812572240,
      "step": 60771
    },
    {
      "epoch": 6.447273498833015,
      "grad_norm": 0.8229505755517388,
      "learning_rate": 2.211191763139016e-05,
      "loss": 1.0085,
      "num_input_tokens_seen": 47813359104,
      "step": 60772
    },
    {
      "epoch": 6.447379588372587,
      "grad_norm": 0.7167997752466267,
      "learning_rate": 2.2111227316660984e-05,
      "loss": 0.9564,
      "num_input_tokens_seen": 47814145872,
      "step": 60773
    },
    {
      "epoch": 6.447485677912158,
      "grad_norm": 0.7101614933057329,
      "learning_rate": 2.2110537004164172e-05,
      "loss": 0.9433,
      "num_input_tokens_seen": 47814932736,
      "step": 60774
    },
    {
      "epoch": 6.447591767451729,
      "grad_norm": 0.865871546059089,
      "learning_rate": 2.2109846693900255e-05,
      "loss": 0.9475,
      "num_input_tokens_seen": 47815719504,
      "step": 60775
    },
    {
      "epoch": 6.447697856991301,
      "grad_norm": 0.7683021469787458,
      "learning_rate": 2.2109156385869757e-05,
      "loss": 0.9923,
      "num_input_tokens_seen": 47816506256,
      "step": 60776
    },
    {
      "epoch": 6.447803946530872,
      "grad_norm": 0.7295705789812573,
      "learning_rate": 2.210846608007322e-05,
      "loss": 1.0299,
      "num_input_tokens_seen": 47817293008,
      "step": 60777
    },
    {
      "epoch": 6.447910036070444,
      "grad_norm": 0.8867046415338345,
      "learning_rate": 2.2107775776511176e-05,
      "loss": 0.9767,
      "num_input_tokens_seen": 47818079792,
      "step": 60778
    },
    {
      "epoch": 6.448016125610015,
      "grad_norm": 0.6642966763355378,
      "learning_rate": 2.2107085475184158e-05,
      "loss": 0.9864,
      "num_input_tokens_seen": 47818866608,
      "step": 60779
    },
    {
      "epoch": 6.448122215149587,
      "grad_norm": 0.672042283252336,
      "learning_rate": 2.21063951760927e-05,
      "loss": 0.9711,
      "num_input_tokens_seen": 47819653344,
      "step": 60780
    },
    {
      "epoch": 6.448228304689158,
      "grad_norm": 0.9880209226599135,
      "learning_rate": 2.2105704879237338e-05,
      "loss": 1.0272,
      "num_input_tokens_seen": 47820440064,
      "step": 60781
    },
    {
      "epoch": 6.448334394228729,
      "grad_norm": 0.6983386835573527,
      "learning_rate": 2.2105014584618594e-05,
      "loss": 0.9544,
      "num_input_tokens_seen": 47821226816,
      "step": 60782
    },
    {
      "epoch": 6.448440483768301,
      "grad_norm": 0.8599277068778349,
      "learning_rate": 2.2104324292237016e-05,
      "loss": 1.0934,
      "num_input_tokens_seen": 47822013568,
      "step": 60783
    },
    {
      "epoch": 6.448546573307872,
      "grad_norm": 0.6898213311334112,
      "learning_rate": 2.2103634002093133e-05,
      "loss": 1.0792,
      "num_input_tokens_seen": 47822800272,
      "step": 60784
    },
    {
      "epoch": 6.448652662847444,
      "grad_norm": 0.7950177336273656,
      "learning_rate": 2.210294371418747e-05,
      "loss": 0.9471,
      "num_input_tokens_seen": 47823587104,
      "step": 60785
    },
    {
      "epoch": 6.448758752387015,
      "grad_norm": 0.6735668006234861,
      "learning_rate": 2.2102253428520573e-05,
      "loss": 0.9882,
      "num_input_tokens_seen": 47824373840,
      "step": 60786
    },
    {
      "epoch": 6.448864841926586,
      "grad_norm": 0.953515027854056,
      "learning_rate": 2.2101563145092967e-05,
      "loss": 0.9697,
      "num_input_tokens_seen": 47825160592,
      "step": 60787
    },
    {
      "epoch": 6.448970931466158,
      "grad_norm": 0.7361806923274623,
      "learning_rate": 2.2100872863905183e-05,
      "loss": 0.9823,
      "num_input_tokens_seen": 47825947360,
      "step": 60788
    },
    {
      "epoch": 6.449077021005729,
      "grad_norm": 1.058867786211255,
      "learning_rate": 2.2100182584957768e-05,
      "loss": 0.9643,
      "num_input_tokens_seen": 47826734112,
      "step": 60789
    },
    {
      "epoch": 6.449183110545301,
      "grad_norm": 0.9049341691015339,
      "learning_rate": 2.209949230825124e-05,
      "loss": 1.0436,
      "num_input_tokens_seen": 47827520768,
      "step": 60790
    },
    {
      "epoch": 6.449289200084872,
      "grad_norm": 0.8620174229144549,
      "learning_rate": 2.2098802033786147e-05,
      "loss": 1.0484,
      "num_input_tokens_seen": 47828307520,
      "step": 60791
    },
    {
      "epoch": 6.449395289624443,
      "grad_norm": 1.0874344099574775,
      "learning_rate": 2.2098111761563008e-05,
      "loss": 0.9793,
      "num_input_tokens_seen": 47829094320,
      "step": 60792
    },
    {
      "epoch": 6.449501379164015,
      "grad_norm": 0.8495362025236823,
      "learning_rate": 2.209742149158236e-05,
      "loss": 0.9535,
      "num_input_tokens_seen": 47829881136,
      "step": 60793
    },
    {
      "epoch": 6.449607468703586,
      "grad_norm": 0.7462341899138097,
      "learning_rate": 2.209673122384475e-05,
      "loss": 1.0289,
      "num_input_tokens_seen": 47830667920,
      "step": 60794
    },
    {
      "epoch": 6.4497135582431575,
      "grad_norm": 1.2766310790328794,
      "learning_rate": 2.2096040958350697e-05,
      "loss": 1.0815,
      "num_input_tokens_seen": 47831454640,
      "step": 60795
    },
    {
      "epoch": 6.4498196477827285,
      "grad_norm": 1.338659790966449,
      "learning_rate": 2.2095350695100734e-05,
      "loss": 1.1119,
      "num_input_tokens_seen": 47832241392,
      "step": 60796
    },
    {
      "epoch": 6.4499257373223,
      "grad_norm": 1.0422974705749546,
      "learning_rate": 2.2094660434095405e-05,
      "loss": 1.0557,
      "num_input_tokens_seen": 47833028080,
      "step": 60797
    },
    {
      "epoch": 6.4500318268618715,
      "grad_norm": 1.299564364737933,
      "learning_rate": 2.209397017533523e-05,
      "loss": 0.9958,
      "num_input_tokens_seen": 47833814912,
      "step": 60798
    },
    {
      "epoch": 6.4501379164014425,
      "grad_norm": 0.9077472257505839,
      "learning_rate": 2.209327991882075e-05,
      "loss": 1.0206,
      "num_input_tokens_seen": 47834601744,
      "step": 60799
    },
    {
      "epoch": 6.450244005941014,
      "grad_norm": 0.9229921478670255,
      "learning_rate": 2.209258966455251e-05,
      "loss": 1.0004,
      "num_input_tokens_seen": 47835388480,
      "step": 60800
    },
    {
      "epoch": 6.4503500954805855,
      "grad_norm": 1.1618865830344083,
      "learning_rate": 2.2091899412531024e-05,
      "loss": 1.0101,
      "num_input_tokens_seen": 47836175264,
      "step": 60801
    },
    {
      "epoch": 6.450456185020157,
      "grad_norm": 0.8290184917884509,
      "learning_rate": 2.2091209162756826e-05,
      "loss": 0.8973,
      "num_input_tokens_seen": 47836962096,
      "step": 60802
    },
    {
      "epoch": 6.450562274559728,
      "grad_norm": 0.9965042769117758,
      "learning_rate": 2.2090518915230464e-05,
      "loss": 1.0296,
      "num_input_tokens_seen": 47837748736,
      "step": 60803
    },
    {
      "epoch": 6.4506683640992994,
      "grad_norm": 0.801876219917896,
      "learning_rate": 2.208982866995246e-05,
      "loss": 1.0494,
      "num_input_tokens_seen": 47838535472,
      "step": 60804
    },
    {
      "epoch": 6.450774453638871,
      "grad_norm": 0.9285197805957298,
      "learning_rate": 2.2089138426923354e-05,
      "loss": 1.037,
      "num_input_tokens_seen": 47839322288,
      "step": 60805
    },
    {
      "epoch": 6.450880543178442,
      "grad_norm": 0.7895067886210957,
      "learning_rate": 2.2088448186143677e-05,
      "loss": 1.0129,
      "num_input_tokens_seen": 47840109024,
      "step": 60806
    },
    {
      "epoch": 6.450986632718014,
      "grad_norm": 0.6952737928342102,
      "learning_rate": 2.2087757947613954e-05,
      "loss": 1.0086,
      "num_input_tokens_seen": 47840895728,
      "step": 60807
    },
    {
      "epoch": 6.451092722257585,
      "grad_norm": 0.8234554225928635,
      "learning_rate": 2.2087067711334732e-05,
      "loss": 1.0412,
      "num_input_tokens_seen": 47841682528,
      "step": 60808
    },
    {
      "epoch": 6.451198811797157,
      "grad_norm": 0.8372486339921178,
      "learning_rate": 2.208637747730654e-05,
      "loss": 0.9855,
      "num_input_tokens_seen": 47842469248,
      "step": 60809
    },
    {
      "epoch": 6.451304901336728,
      "grad_norm": 0.6867946297868238,
      "learning_rate": 2.2085687245529907e-05,
      "loss": 0.906,
      "num_input_tokens_seen": 47843256016,
      "step": 60810
    },
    {
      "epoch": 6.451410990876299,
      "grad_norm": 0.8726848726226285,
      "learning_rate": 2.2084997016005373e-05,
      "loss": 1.0479,
      "num_input_tokens_seen": 47844042848,
      "step": 60811
    },
    {
      "epoch": 6.451517080415871,
      "grad_norm": 0.7248258833165742,
      "learning_rate": 2.2084306788733466e-05,
      "loss": 1.0248,
      "num_input_tokens_seen": 47844829536,
      "step": 60812
    },
    {
      "epoch": 6.451623169955442,
      "grad_norm": 0.7698281855301481,
      "learning_rate": 2.2083616563714718e-05,
      "loss": 0.9775,
      "num_input_tokens_seen": 47845616256,
      "step": 60813
    },
    {
      "epoch": 6.451729259495014,
      "grad_norm": 0.7431052359572298,
      "learning_rate": 2.2082926340949673e-05,
      "loss": 1.0424,
      "num_input_tokens_seen": 47846402960,
      "step": 60814
    },
    {
      "epoch": 6.451835349034585,
      "grad_norm": 0.7122225809669349,
      "learning_rate": 2.2082236120438854e-05,
      "loss": 0.9608,
      "num_input_tokens_seen": 47847189664,
      "step": 60815
    },
    {
      "epoch": 6.451941438574156,
      "grad_norm": 0.684881328289339,
      "learning_rate": 2.208154590218279e-05,
      "loss": 0.9866,
      "num_input_tokens_seen": 47847976528,
      "step": 60816
    },
    {
      "epoch": 6.452047528113728,
      "grad_norm": 0.736058674426914,
      "learning_rate": 2.2080855686182032e-05,
      "loss": 0.9689,
      "num_input_tokens_seen": 47848763264,
      "step": 60817
    },
    {
      "epoch": 6.452153617653299,
      "grad_norm": 0.7160655593362137,
      "learning_rate": 2.20801654724371e-05,
      "loss": 1.0202,
      "num_input_tokens_seen": 47849550080,
      "step": 60818
    },
    {
      "epoch": 6.452259707192871,
      "grad_norm": 0.6591987413792457,
      "learning_rate": 2.2079475260948522e-05,
      "loss": 0.9593,
      "num_input_tokens_seen": 47850336816,
      "step": 60819
    },
    {
      "epoch": 6.452365796732442,
      "grad_norm": 1.087804409701858,
      "learning_rate": 2.207878505171685e-05,
      "loss": 1.0564,
      "num_input_tokens_seen": 47851123584,
      "step": 60820
    },
    {
      "epoch": 6.452471886272013,
      "grad_norm": 0.8821632635129388,
      "learning_rate": 2.20780948447426e-05,
      "loss": 1.0094,
      "num_input_tokens_seen": 47851910336,
      "step": 60821
    },
    {
      "epoch": 6.452577975811585,
      "grad_norm": 0.6945738831693254,
      "learning_rate": 2.207740464002632e-05,
      "loss": 0.9966,
      "num_input_tokens_seen": 47852697024,
      "step": 60822
    },
    {
      "epoch": 6.452684065351156,
      "grad_norm": 0.8315205826209351,
      "learning_rate": 2.2076714437568533e-05,
      "loss": 1.0709,
      "num_input_tokens_seen": 47853483904,
      "step": 60823
    },
    {
      "epoch": 6.452790154890728,
      "grad_norm": 0.7184742993048832,
      "learning_rate": 2.207602423736977e-05,
      "loss": 1.0916,
      "num_input_tokens_seen": 47854270544,
      "step": 60824
    },
    {
      "epoch": 6.452896244430299,
      "grad_norm": 0.7473198268728488,
      "learning_rate": 2.2075334039430578e-05,
      "loss": 1.023,
      "num_input_tokens_seen": 47855057264,
      "step": 60825
    },
    {
      "epoch": 6.45300233396987,
      "grad_norm": 0.7881348547974107,
      "learning_rate": 2.207464384375148e-05,
      "loss": 1.0561,
      "num_input_tokens_seen": 47855844064,
      "step": 60826
    },
    {
      "epoch": 6.453108423509442,
      "grad_norm": 0.7593501241253007,
      "learning_rate": 2.2073953650333005e-05,
      "loss": 1.1066,
      "num_input_tokens_seen": 47856630800,
      "step": 60827
    },
    {
      "epoch": 6.453214513049013,
      "grad_norm": 0.6890996872430108,
      "learning_rate": 2.20732634591757e-05,
      "loss": 0.9856,
      "num_input_tokens_seen": 47857417552,
      "step": 60828
    },
    {
      "epoch": 6.453320602588585,
      "grad_norm": 0.7230374478746676,
      "learning_rate": 2.207257327028009e-05,
      "loss": 1.0269,
      "num_input_tokens_seen": 47858204384,
      "step": 60829
    },
    {
      "epoch": 6.453426692128156,
      "grad_norm": 0.6350043365201382,
      "learning_rate": 2.2071883083646704e-05,
      "loss": 0.9815,
      "num_input_tokens_seen": 47858991168,
      "step": 60830
    },
    {
      "epoch": 6.453532781667728,
      "grad_norm": 0.7475943755281265,
      "learning_rate": 2.2071192899276087e-05,
      "loss": 0.8975,
      "num_input_tokens_seen": 47859777968,
      "step": 60831
    },
    {
      "epoch": 6.453638871207299,
      "grad_norm": 0.7505834540009569,
      "learning_rate": 2.2070502717168767e-05,
      "loss": 0.9735,
      "num_input_tokens_seen": 47860564752,
      "step": 60832
    },
    {
      "epoch": 6.45374496074687,
      "grad_norm": 0.6817937383901242,
      "learning_rate": 2.206981253732527e-05,
      "loss": 1.009,
      "num_input_tokens_seen": 47861351456,
      "step": 60833
    },
    {
      "epoch": 6.453851050286442,
      "grad_norm": 0.7044954943160185,
      "learning_rate": 2.206912235974614e-05,
      "loss": 1.1265,
      "num_input_tokens_seen": 47862138096,
      "step": 60834
    },
    {
      "epoch": 6.453957139826013,
      "grad_norm": 0.782198407259798,
      "learning_rate": 2.206843218443191e-05,
      "loss": 1.034,
      "num_input_tokens_seen": 47862924848,
      "step": 60835
    },
    {
      "epoch": 6.454063229365585,
      "grad_norm": 0.6960076382141337,
      "learning_rate": 2.2067742011383103e-05,
      "loss": 1.0341,
      "num_input_tokens_seen": 47863711648,
      "step": 60836
    },
    {
      "epoch": 6.454169318905156,
      "grad_norm": 0.6815160017446895,
      "learning_rate": 2.206705184060026e-05,
      "loss": 1.0084,
      "num_input_tokens_seen": 47864498352,
      "step": 60837
    },
    {
      "epoch": 6.454275408444728,
      "grad_norm": 0.7766010897339098,
      "learning_rate": 2.2066361672083912e-05,
      "loss": 0.9559,
      "num_input_tokens_seen": 47865285184,
      "step": 60838
    },
    {
      "epoch": 6.454381497984299,
      "grad_norm": 0.7903831534076301,
      "learning_rate": 2.20656715058346e-05,
      "loss": 1.1007,
      "num_input_tokens_seen": 47866071856,
      "step": 60839
    },
    {
      "epoch": 6.45448758752387,
      "grad_norm": 0.6877276531815171,
      "learning_rate": 2.206498134185285e-05,
      "loss": 0.9111,
      "num_input_tokens_seen": 47866858560,
      "step": 60840
    },
    {
      "epoch": 6.454593677063442,
      "grad_norm": 0.6763486622402519,
      "learning_rate": 2.2064291180139185e-05,
      "loss": 1.0101,
      "num_input_tokens_seen": 47867645312,
      "step": 60841
    },
    {
      "epoch": 6.454699766603013,
      "grad_norm": 0.6818568241983631,
      "learning_rate": 2.2063601020694153e-05,
      "loss": 0.9658,
      "num_input_tokens_seen": 47868432112,
      "step": 60842
    },
    {
      "epoch": 6.454805856142585,
      "grad_norm": 0.744954663388047,
      "learning_rate": 2.206291086351829e-05,
      "loss": 0.9891,
      "num_input_tokens_seen": 47869218928,
      "step": 60843
    },
    {
      "epoch": 6.454911945682156,
      "grad_norm": 0.7040952608247557,
      "learning_rate": 2.2062220708612126e-05,
      "loss": 1.0561,
      "num_input_tokens_seen": 47870005664,
      "step": 60844
    },
    {
      "epoch": 6.455018035221727,
      "grad_norm": 0.7502219403061702,
      "learning_rate": 2.2061530555976185e-05,
      "loss": 1.1237,
      "num_input_tokens_seen": 47870792320,
      "step": 60845
    },
    {
      "epoch": 6.455124124761299,
      "grad_norm": 0.7418432841955901,
      "learning_rate": 2.206084040561101e-05,
      "loss": 1.0228,
      "num_input_tokens_seen": 47871579040,
      "step": 60846
    },
    {
      "epoch": 6.45523021430087,
      "grad_norm": 0.828429924974003,
      "learning_rate": 2.2060150257517134e-05,
      "loss": 1.0024,
      "num_input_tokens_seen": 47872365776,
      "step": 60847
    },
    {
      "epoch": 6.455336303840442,
      "grad_norm": 0.641823984600983,
      "learning_rate": 2.2059460111695082e-05,
      "loss": 1.0053,
      "num_input_tokens_seen": 47873152576,
      "step": 60848
    },
    {
      "epoch": 6.455442393380013,
      "grad_norm": 1.0355915435014293,
      "learning_rate": 2.20587699681454e-05,
      "loss": 1.0617,
      "num_input_tokens_seen": 47873939328,
      "step": 60849
    },
    {
      "epoch": 6.455548482919584,
      "grad_norm": 0.85131662521927,
      "learning_rate": 2.205807982686861e-05,
      "loss": 1.0162,
      "num_input_tokens_seen": 47874726144,
      "step": 60850
    },
    {
      "epoch": 6.455654572459156,
      "grad_norm": 0.7206836505942309,
      "learning_rate": 2.2057389687865244e-05,
      "loss": 1.0544,
      "num_input_tokens_seen": 47875512896,
      "step": 60851
    },
    {
      "epoch": 6.455760661998727,
      "grad_norm": 0.8165943862017441,
      "learning_rate": 2.205669955113585e-05,
      "loss": 1.0785,
      "num_input_tokens_seen": 47876299632,
      "step": 60852
    },
    {
      "epoch": 6.455866751538299,
      "grad_norm": 0.8325185836328158,
      "learning_rate": 2.2056009416680953e-05,
      "loss": 1.0008,
      "num_input_tokens_seen": 47877086416,
      "step": 60853
    },
    {
      "epoch": 6.45597284107787,
      "grad_norm": 0.6294834195001798,
      "learning_rate": 2.2055319284501078e-05,
      "loss": 0.9832,
      "num_input_tokens_seen": 47877873072,
      "step": 60854
    },
    {
      "epoch": 6.4560789306174415,
      "grad_norm": 0.7191574781152349,
      "learning_rate": 2.205462915459677e-05,
      "loss": 1.0029,
      "num_input_tokens_seen": 47878659776,
      "step": 60855
    },
    {
      "epoch": 6.456185020157013,
      "grad_norm": 0.8903578207895316,
      "learning_rate": 2.205393902696856e-05,
      "loss": 1.0038,
      "num_input_tokens_seen": 47879446608,
      "step": 60856
    },
    {
      "epoch": 6.456291109696584,
      "grad_norm": 0.6312402005623107,
      "learning_rate": 2.2053248901616976e-05,
      "loss": 1.0518,
      "num_input_tokens_seen": 47880233392,
      "step": 60857
    },
    {
      "epoch": 6.4563971992361555,
      "grad_norm": 0.8245467469630872,
      "learning_rate": 2.2052558778542552e-05,
      "loss": 1.0711,
      "num_input_tokens_seen": 47881020144,
      "step": 60858
    },
    {
      "epoch": 6.4565032887757265,
      "grad_norm": 0.8650807847970462,
      "learning_rate": 2.2051868657745828e-05,
      "loss": 0.9807,
      "num_input_tokens_seen": 47881806944,
      "step": 60859
    },
    {
      "epoch": 6.4566093783152985,
      "grad_norm": 0.767223222443478,
      "learning_rate": 2.2051178539227334e-05,
      "loss": 1.0132,
      "num_input_tokens_seen": 47882593776,
      "step": 60860
    },
    {
      "epoch": 6.4567154678548695,
      "grad_norm": 0.6597278892409533,
      "learning_rate": 2.2050488422987602e-05,
      "loss": 1.0374,
      "num_input_tokens_seen": 47883380544,
      "step": 60861
    },
    {
      "epoch": 6.4568215573944405,
      "grad_norm": 0.92757917282201,
      "learning_rate": 2.2049798309027165e-05,
      "loss": 0.9832,
      "num_input_tokens_seen": 47884167296,
      "step": 60862
    },
    {
      "epoch": 6.456927646934012,
      "grad_norm": 0.8091647126435161,
      "learning_rate": 2.204910819734656e-05,
      "loss": 1.0024,
      "num_input_tokens_seen": 47884953984,
      "step": 60863
    },
    {
      "epoch": 6.4570337364735835,
      "grad_norm": 0.716094022358557,
      "learning_rate": 2.204841808794632e-05,
      "loss": 1.1126,
      "num_input_tokens_seen": 47885740784,
      "step": 60864
    },
    {
      "epoch": 6.457139826013155,
      "grad_norm": 0.8293298733163502,
      "learning_rate": 2.2047727980826964e-05,
      "loss": 1.0299,
      "num_input_tokens_seen": 47886527488,
      "step": 60865
    },
    {
      "epoch": 6.457245915552726,
      "grad_norm": 0.5983719777300164,
      "learning_rate": 2.204703787598905e-05,
      "loss": 0.9543,
      "num_input_tokens_seen": 47887314336,
      "step": 60866
    },
    {
      "epoch": 6.457352005092298,
      "grad_norm": 0.9454103102791223,
      "learning_rate": 2.2046347773433094e-05,
      "loss": 1.0125,
      "num_input_tokens_seen": 47888101136,
      "step": 60867
    },
    {
      "epoch": 6.457458094631869,
      "grad_norm": 0.7042828985192172,
      "learning_rate": 2.204565767315963e-05,
      "loss": 1.0376,
      "num_input_tokens_seen": 47888887952,
      "step": 60868
    },
    {
      "epoch": 6.45756418417144,
      "grad_norm": 0.6417043077822938,
      "learning_rate": 2.20449675751692e-05,
      "loss": 0.948,
      "num_input_tokens_seen": 47889674800,
      "step": 60869
    },
    {
      "epoch": 6.457670273711012,
      "grad_norm": 0.7522738245598802,
      "learning_rate": 2.2044277479462334e-05,
      "loss": 0.9183,
      "num_input_tokens_seen": 47890461536,
      "step": 60870
    },
    {
      "epoch": 6.457776363250583,
      "grad_norm": 0.6855053263859557,
      "learning_rate": 2.2043587386039556e-05,
      "loss": 1.0686,
      "num_input_tokens_seen": 47891248352,
      "step": 60871
    },
    {
      "epoch": 6.457882452790155,
      "grad_norm": 0.7603643535983723,
      "learning_rate": 2.2042897294901412e-05,
      "loss": 0.9441,
      "num_input_tokens_seen": 47892035168,
      "step": 60872
    },
    {
      "epoch": 6.457988542329726,
      "grad_norm": 0.6788826265389704,
      "learning_rate": 2.204220720604843e-05,
      "loss": 1.0239,
      "num_input_tokens_seen": 47892822016,
      "step": 60873
    },
    {
      "epoch": 6.458094631869297,
      "grad_norm": 0.7018391841139827,
      "learning_rate": 2.204151711948114e-05,
      "loss": 1.0975,
      "num_input_tokens_seen": 47893608736,
      "step": 60874
    },
    {
      "epoch": 6.458200721408869,
      "grad_norm": 0.6231987038406169,
      "learning_rate": 2.2040827035200085e-05,
      "loss": 0.9099,
      "num_input_tokens_seen": 47894395472,
      "step": 60875
    },
    {
      "epoch": 6.45830681094844,
      "grad_norm": 0.7288274382508196,
      "learning_rate": 2.2040136953205784e-05,
      "loss": 1.0869,
      "num_input_tokens_seen": 47895182272,
      "step": 60876
    },
    {
      "epoch": 6.458412900488012,
      "grad_norm": 0.7859040293579234,
      "learning_rate": 2.2039446873498787e-05,
      "loss": 1.0007,
      "num_input_tokens_seen": 47895969024,
      "step": 60877
    },
    {
      "epoch": 6.458518990027583,
      "grad_norm": 0.7136076813076173,
      "learning_rate": 2.2038756796079615e-05,
      "loss": 0.9316,
      "num_input_tokens_seen": 47896755888,
      "step": 60878
    },
    {
      "epoch": 6.458625079567154,
      "grad_norm": 0.6564622602235364,
      "learning_rate": 2.2038066720948802e-05,
      "loss": 0.967,
      "num_input_tokens_seen": 47897542592,
      "step": 60879
    },
    {
      "epoch": 6.458731169106726,
      "grad_norm": 0.700725273124533,
      "learning_rate": 2.2037376648106888e-05,
      "loss": 0.999,
      "num_input_tokens_seen": 47898329424,
      "step": 60880
    },
    {
      "epoch": 6.458837258646297,
      "grad_norm": 0.6979646806197043,
      "learning_rate": 2.2036686577554403e-05,
      "loss": 1.0307,
      "num_input_tokens_seen": 47899116160,
      "step": 60881
    },
    {
      "epoch": 6.458943348185869,
      "grad_norm": 0.7585361915653464,
      "learning_rate": 2.2035996509291874e-05,
      "loss": 0.9437,
      "num_input_tokens_seen": 47899902896,
      "step": 60882
    },
    {
      "epoch": 6.45904943772544,
      "grad_norm": 0.8493220859516746,
      "learning_rate": 2.2035306443319845e-05,
      "loss": 1.0771,
      "num_input_tokens_seen": 47900689520,
      "step": 60883
    },
    {
      "epoch": 6.459155527265012,
      "grad_norm": 0.639909730943265,
      "learning_rate": 2.2034616379638843e-05,
      "loss": 1.0055,
      "num_input_tokens_seen": 47901476288,
      "step": 60884
    },
    {
      "epoch": 6.459261616804583,
      "grad_norm": 0.8731304644112571,
      "learning_rate": 2.20339263182494e-05,
      "loss": 0.9924,
      "num_input_tokens_seen": 47902263040,
      "step": 60885
    },
    {
      "epoch": 6.459367706344154,
      "grad_norm": 0.6197831159013928,
      "learning_rate": 2.2033236259152057e-05,
      "loss": 0.9117,
      "num_input_tokens_seen": 47903049856,
      "step": 60886
    },
    {
      "epoch": 6.459473795883726,
      "grad_norm": 0.823014529930471,
      "learning_rate": 2.203254620234734e-05,
      "loss": 1.0598,
      "num_input_tokens_seen": 47903836608,
      "step": 60887
    },
    {
      "epoch": 6.459579885423297,
      "grad_norm": 0.6186997457242427,
      "learning_rate": 2.2031856147835782e-05,
      "loss": 0.9429,
      "num_input_tokens_seen": 47904623408,
      "step": 60888
    },
    {
      "epoch": 6.459685974962869,
      "grad_norm": 0.6643321090288595,
      "learning_rate": 2.203116609561792e-05,
      "loss": 0.9595,
      "num_input_tokens_seen": 47905410288,
      "step": 60889
    },
    {
      "epoch": 6.45979206450244,
      "grad_norm": 0.9092574357596328,
      "learning_rate": 2.2030476045694286e-05,
      "loss": 1.0431,
      "num_input_tokens_seen": 47906197120,
      "step": 60890
    },
    {
      "epoch": 6.459898154042011,
      "grad_norm": 0.8993341152125318,
      "learning_rate": 2.202978599806541e-05,
      "loss": 1.0392,
      "num_input_tokens_seen": 47906983856,
      "step": 60891
    },
    {
      "epoch": 6.460004243581583,
      "grad_norm": 0.7121566653054326,
      "learning_rate": 2.2029095952731833e-05,
      "loss": 1.0745,
      "num_input_tokens_seen": 47907770560,
      "step": 60892
    },
    {
      "epoch": 6.460110333121154,
      "grad_norm": 0.8062564831789922,
      "learning_rate": 2.2028405909694077e-05,
      "loss": 0.9785,
      "num_input_tokens_seen": 47908557328,
      "step": 60893
    },
    {
      "epoch": 6.460216422660726,
      "grad_norm": 0.9099157989682477,
      "learning_rate": 2.2027715868952686e-05,
      "loss": 1.061,
      "num_input_tokens_seen": 47909344096,
      "step": 60894
    },
    {
      "epoch": 6.460322512200297,
      "grad_norm": 0.9698138640969693,
      "learning_rate": 2.202702583050819e-05,
      "loss": 0.9563,
      "num_input_tokens_seen": 47910130992,
      "step": 60895
    },
    {
      "epoch": 6.460428601739869,
      "grad_norm": 0.8624346929806875,
      "learning_rate": 2.202633579436112e-05,
      "loss": 0.977,
      "num_input_tokens_seen": 47910917712,
      "step": 60896
    },
    {
      "epoch": 6.46053469127944,
      "grad_norm": 0.7373560355170476,
      "learning_rate": 2.202564576051201e-05,
      "loss": 0.9715,
      "num_input_tokens_seen": 47911704416,
      "step": 60897
    },
    {
      "epoch": 6.460640780819011,
      "grad_norm": 0.9359531114213314,
      "learning_rate": 2.2024955728961396e-05,
      "loss": 1.0596,
      "num_input_tokens_seen": 47912491200,
      "step": 60898
    },
    {
      "epoch": 6.460746870358583,
      "grad_norm": 0.762160549992694,
      "learning_rate": 2.2024265699709804e-05,
      "loss": 1.0292,
      "num_input_tokens_seen": 47913277952,
      "step": 60899
    },
    {
      "epoch": 6.460852959898154,
      "grad_norm": 0.9851349802048319,
      "learning_rate": 2.2023575672757777e-05,
      "loss": 1.0234,
      "num_input_tokens_seen": 47914064800,
      "step": 60900
    },
    {
      "epoch": 6.460959049437726,
      "grad_norm": 0.7219623757552988,
      "learning_rate": 2.202288564810584e-05,
      "loss": 1.0213,
      "num_input_tokens_seen": 47914851600,
      "step": 60901
    },
    {
      "epoch": 6.461065138977297,
      "grad_norm": 0.7411563646047737,
      "learning_rate": 2.202219562575453e-05,
      "loss": 0.9363,
      "num_input_tokens_seen": 47915638480,
      "step": 60902
    },
    {
      "epoch": 6.461171228516868,
      "grad_norm": 0.896112396142197,
      "learning_rate": 2.2021505605704383e-05,
      "loss": 1.0188,
      "num_input_tokens_seen": 47916425232,
      "step": 60903
    },
    {
      "epoch": 6.46127731805644,
      "grad_norm": 0.8920687961899683,
      "learning_rate": 2.202081558795593e-05,
      "loss": 1.0667,
      "num_input_tokens_seen": 47917212000,
      "step": 60904
    },
    {
      "epoch": 6.461383407596011,
      "grad_norm": 0.7910771659765687,
      "learning_rate": 2.2020125572509696e-05,
      "loss": 0.9811,
      "num_input_tokens_seen": 47917998624,
      "step": 60905
    },
    {
      "epoch": 6.461489497135583,
      "grad_norm": 0.6769961891411042,
      "learning_rate": 2.2019435559366227e-05,
      "loss": 1.0121,
      "num_input_tokens_seen": 47918785248,
      "step": 60906
    },
    {
      "epoch": 6.461595586675154,
      "grad_norm": 1.2792927356039288,
      "learning_rate": 2.2018745548526044e-05,
      "loss": 1.0621,
      "num_input_tokens_seen": 47919572016,
      "step": 60907
    },
    {
      "epoch": 6.461701676214725,
      "grad_norm": 0.7712976808727644,
      "learning_rate": 2.2018055539989696e-05,
      "loss": 1.0179,
      "num_input_tokens_seen": 47920358832,
      "step": 60908
    },
    {
      "epoch": 6.461807765754297,
      "grad_norm": 0.9260050584627055,
      "learning_rate": 2.2017365533757705e-05,
      "loss": 1.0145,
      "num_input_tokens_seen": 47921145728,
      "step": 60909
    },
    {
      "epoch": 6.461913855293868,
      "grad_norm": 0.8392138018693214,
      "learning_rate": 2.2016675529830605e-05,
      "loss": 0.9882,
      "num_input_tokens_seen": 47921932496,
      "step": 60910
    },
    {
      "epoch": 6.46201994483344,
      "grad_norm": 0.8420582842332401,
      "learning_rate": 2.2015985528208932e-05,
      "loss": 0.9956,
      "num_input_tokens_seen": 47922719312,
      "step": 60911
    },
    {
      "epoch": 6.462126034373011,
      "grad_norm": 0.7380172391822852,
      "learning_rate": 2.201529552889322e-05,
      "loss": 0.9308,
      "num_input_tokens_seen": 47923506096,
      "step": 60912
    },
    {
      "epoch": 6.462232123912583,
      "grad_norm": 0.7895457427934064,
      "learning_rate": 2.2014605531883993e-05,
      "loss": 0.9958,
      "num_input_tokens_seen": 47924292816,
      "step": 60913
    },
    {
      "epoch": 6.462338213452154,
      "grad_norm": 0.9146005511476889,
      "learning_rate": 2.2013915537181794e-05,
      "loss": 0.9444,
      "num_input_tokens_seen": 47925079536,
      "step": 60914
    },
    {
      "epoch": 6.462444302991725,
      "grad_norm": 0.9770276786180537,
      "learning_rate": 2.201322554478716e-05,
      "loss": 0.9874,
      "num_input_tokens_seen": 47925866224,
      "step": 60915
    },
    {
      "epoch": 6.462550392531297,
      "grad_norm": 0.9267992068982479,
      "learning_rate": 2.2012535554700605e-05,
      "loss": 1.0188,
      "num_input_tokens_seen": 47926652992,
      "step": 60916
    },
    {
      "epoch": 6.462656482070868,
      "grad_norm": 1.1625439634887549,
      "learning_rate": 2.2011845566922683e-05,
      "loss": 1.0573,
      "num_input_tokens_seen": 47927439712,
      "step": 60917
    },
    {
      "epoch": 6.4627625716104395,
      "grad_norm": 0.6692243397761407,
      "learning_rate": 2.2011155581453922e-05,
      "loss": 0.9469,
      "num_input_tokens_seen": 47928226544,
      "step": 60918
    },
    {
      "epoch": 6.462868661150011,
      "grad_norm": 0.7618835979100773,
      "learning_rate": 2.2010465598294844e-05,
      "loss": 0.9719,
      "num_input_tokens_seen": 47929013312,
      "step": 60919
    },
    {
      "epoch": 6.462974750689582,
      "grad_norm": 0.8629564621167676,
      "learning_rate": 2.2009775617445997e-05,
      "loss": 1.0381,
      "num_input_tokens_seen": 47929800096,
      "step": 60920
    },
    {
      "epoch": 6.4630808402291535,
      "grad_norm": 0.7425298510061001,
      "learning_rate": 2.2009085638907907e-05,
      "loss": 1.0181,
      "num_input_tokens_seen": 47930586960,
      "step": 60921
    },
    {
      "epoch": 6.4631869297687246,
      "grad_norm": 0.9017469263546172,
      "learning_rate": 2.2008395662681102e-05,
      "loss": 1.0986,
      "num_input_tokens_seen": 47931373648,
      "step": 60922
    },
    {
      "epoch": 6.4632930193082965,
      "grad_norm": 0.7890065563608287,
      "learning_rate": 2.2007705688766128e-05,
      "loss": 0.9982,
      "num_input_tokens_seen": 47932160448,
      "step": 60923
    },
    {
      "epoch": 6.4633991088478675,
      "grad_norm": 0.7780188998881812,
      "learning_rate": 2.2007015717163503e-05,
      "loss": 1.0409,
      "num_input_tokens_seen": 47932947168,
      "step": 60924
    },
    {
      "epoch": 6.463505198387439,
      "grad_norm": 0.7537701044707308,
      "learning_rate": 2.2006325747873776e-05,
      "loss": 1.0065,
      "num_input_tokens_seen": 47933733968,
      "step": 60925
    },
    {
      "epoch": 6.4636112879270105,
      "grad_norm": 0.776784373195636,
      "learning_rate": 2.2005635780897473e-05,
      "loss": 1.0712,
      "num_input_tokens_seen": 47934520640,
      "step": 60926
    },
    {
      "epoch": 6.4637173774665815,
      "grad_norm": 0.7496207311577725,
      "learning_rate": 2.200494581623512e-05,
      "loss": 0.9289,
      "num_input_tokens_seen": 47935307424,
      "step": 60927
    },
    {
      "epoch": 6.463823467006153,
      "grad_norm": 0.7215284553335825,
      "learning_rate": 2.2004255853887266e-05,
      "loss": 0.972,
      "num_input_tokens_seen": 47936094192,
      "step": 60928
    },
    {
      "epoch": 6.463929556545724,
      "grad_norm": 0.7686755001725429,
      "learning_rate": 2.200356589385443e-05,
      "loss": 0.9386,
      "num_input_tokens_seen": 47936881088,
      "step": 60929
    },
    {
      "epoch": 6.464035646085296,
      "grad_norm": 0.7427910143546332,
      "learning_rate": 2.2002875936137148e-05,
      "loss": 1.027,
      "num_input_tokens_seen": 47937667936,
      "step": 60930
    },
    {
      "epoch": 6.464141735624867,
      "grad_norm": 0.985862294657873,
      "learning_rate": 2.2002185980735963e-05,
      "loss": 1.0357,
      "num_input_tokens_seen": 47938454736,
      "step": 60931
    },
    {
      "epoch": 6.464247825164438,
      "grad_norm": 0.7748306639005947,
      "learning_rate": 2.2001496027651396e-05,
      "loss": 1.0332,
      "num_input_tokens_seen": 47939241440,
      "step": 60932
    },
    {
      "epoch": 6.46435391470401,
      "grad_norm": 0.7958766405743055,
      "learning_rate": 2.2000806076883982e-05,
      "loss": 1.0061,
      "num_input_tokens_seen": 47940028304,
      "step": 60933
    },
    {
      "epoch": 6.464460004243581,
      "grad_norm": 0.6685211990357488,
      "learning_rate": 2.200011612843426e-05,
      "loss": 0.9792,
      "num_input_tokens_seen": 47940815072,
      "step": 60934
    },
    {
      "epoch": 6.464566093783153,
      "grad_norm": 1.1059642851290186,
      "learning_rate": 2.1999426182302764e-05,
      "loss": 0.9797,
      "num_input_tokens_seen": 47941601824,
      "step": 60935
    },
    {
      "epoch": 6.464672183322724,
      "grad_norm": 0.8098359332053552,
      "learning_rate": 2.199873623849001e-05,
      "loss": 1.0433,
      "num_input_tokens_seen": 47942388608,
      "step": 60936
    },
    {
      "epoch": 6.464778272862295,
      "grad_norm": 0.8703783539548621,
      "learning_rate": 2.199804629699655e-05,
      "loss": 1.0507,
      "num_input_tokens_seen": 47943175296,
      "step": 60937
    },
    {
      "epoch": 6.464884362401867,
      "grad_norm": 0.7610410729166127,
      "learning_rate": 2.199735635782292e-05,
      "loss": 0.9457,
      "num_input_tokens_seen": 47943962000,
      "step": 60938
    },
    {
      "epoch": 6.464990451941438,
      "grad_norm": 0.9797926638631327,
      "learning_rate": 2.199666642096964e-05,
      "loss": 1.1793,
      "num_input_tokens_seen": 47944748688,
      "step": 60939
    },
    {
      "epoch": 6.46509654148101,
      "grad_norm": 0.7161745436859033,
      "learning_rate": 2.1995976486437247e-05,
      "loss": 0.9721,
      "num_input_tokens_seen": 47945535568,
      "step": 60940
    },
    {
      "epoch": 6.465202631020581,
      "grad_norm": 0.9677775734170251,
      "learning_rate": 2.199528655422628e-05,
      "loss": 1.012,
      "num_input_tokens_seen": 47946322368,
      "step": 60941
    },
    {
      "epoch": 6.465308720560153,
      "grad_norm": 0.9796812438906028,
      "learning_rate": 2.1994596624337266e-05,
      "loss": 1.0116,
      "num_input_tokens_seen": 47947109120,
      "step": 60942
    },
    {
      "epoch": 6.465414810099724,
      "grad_norm": 0.7349661331462181,
      "learning_rate": 2.199390669677073e-05,
      "loss": 0.9364,
      "num_input_tokens_seen": 47947895968,
      "step": 60943
    },
    {
      "epoch": 6.465520899639295,
      "grad_norm": 1.088450850555228,
      "learning_rate": 2.199321677152723e-05,
      "loss": 1.0965,
      "num_input_tokens_seen": 47948682800,
      "step": 60944
    },
    {
      "epoch": 6.465626989178867,
      "grad_norm": 0.8349597095267964,
      "learning_rate": 2.1992526848607274e-05,
      "loss": 1.0024,
      "num_input_tokens_seen": 47949469616,
      "step": 60945
    },
    {
      "epoch": 6.465733078718438,
      "grad_norm": 0.8555209632144412,
      "learning_rate": 2.1991836928011408e-05,
      "loss": 0.95,
      "num_input_tokens_seen": 47950256336,
      "step": 60946
    },
    {
      "epoch": 6.46583916825801,
      "grad_norm": 0.9600576498787915,
      "learning_rate": 2.1991147009740166e-05,
      "loss": 1.038,
      "num_input_tokens_seen": 47951043040,
      "step": 60947
    },
    {
      "epoch": 6.465945257797581,
      "grad_norm": 0.7255975428488529,
      "learning_rate": 2.1990457093794067e-05,
      "loss": 0.9818,
      "num_input_tokens_seen": 47951829824,
      "step": 60948
    },
    {
      "epoch": 6.466051347337152,
      "grad_norm": 0.7480136146610251,
      "learning_rate": 2.1989767180173663e-05,
      "loss": 0.9531,
      "num_input_tokens_seen": 47952616688,
      "step": 60949
    },
    {
      "epoch": 6.466157436876724,
      "grad_norm": 0.8259955340516205,
      "learning_rate": 2.1989077268879475e-05,
      "loss": 1.0218,
      "num_input_tokens_seen": 47953403424,
      "step": 60950
    },
    {
      "epoch": 6.466263526416295,
      "grad_norm": 0.6435126932432096,
      "learning_rate": 2.198838735991204e-05,
      "loss": 0.9859,
      "num_input_tokens_seen": 47954190224,
      "step": 60951
    },
    {
      "epoch": 6.466369615955867,
      "grad_norm": 0.7339461265225607,
      "learning_rate": 2.1987697453271895e-05,
      "loss": 0.9348,
      "num_input_tokens_seen": 47954976992,
      "step": 60952
    },
    {
      "epoch": 6.466475705495438,
      "grad_norm": 0.9411199432999336,
      "learning_rate": 2.1987007548959567e-05,
      "loss": 1.0116,
      "num_input_tokens_seen": 47955763792,
      "step": 60953
    },
    {
      "epoch": 6.46658179503501,
      "grad_norm": 0.7681409206114473,
      "learning_rate": 2.1986317646975586e-05,
      "loss": 0.9758,
      "num_input_tokens_seen": 47956550528,
      "step": 60954
    },
    {
      "epoch": 6.466687884574581,
      "grad_norm": 0.827189534250698,
      "learning_rate": 2.19856277473205e-05,
      "loss": 1.0562,
      "num_input_tokens_seen": 47957337264,
      "step": 60955
    },
    {
      "epoch": 6.466793974114152,
      "grad_norm": 0.8974275586052362,
      "learning_rate": 2.1984937849994823e-05,
      "loss": 0.963,
      "num_input_tokens_seen": 47958124048,
      "step": 60956
    },
    {
      "epoch": 6.466900063653724,
      "grad_norm": 0.7758151728240507,
      "learning_rate": 2.1984247954999098e-05,
      "loss": 0.9173,
      "num_input_tokens_seen": 47958910896,
      "step": 60957
    },
    {
      "epoch": 6.467006153193295,
      "grad_norm": 0.8310425818400708,
      "learning_rate": 2.1983558062333865e-05,
      "loss": 0.9633,
      "num_input_tokens_seen": 47959697712,
      "step": 60958
    },
    {
      "epoch": 6.467112242732867,
      "grad_norm": 0.8413703106958914,
      "learning_rate": 2.198286817199965e-05,
      "loss": 1.0797,
      "num_input_tokens_seen": 47960484496,
      "step": 60959
    },
    {
      "epoch": 6.467218332272438,
      "grad_norm": 0.7502807983535474,
      "learning_rate": 2.1982178283996975e-05,
      "loss": 0.9664,
      "num_input_tokens_seen": 47961271232,
      "step": 60960
    },
    {
      "epoch": 6.467324421812009,
      "grad_norm": 0.7667241983116974,
      "learning_rate": 2.1981488398326395e-05,
      "loss": 0.9656,
      "num_input_tokens_seen": 47962057968,
      "step": 60961
    },
    {
      "epoch": 6.467430511351581,
      "grad_norm": 0.6118370805911567,
      "learning_rate": 2.1980798514988425e-05,
      "loss": 0.9603,
      "num_input_tokens_seen": 47962844832,
      "step": 60962
    },
    {
      "epoch": 6.467536600891152,
      "grad_norm": 0.8016509820053193,
      "learning_rate": 2.198010863398361e-05,
      "loss": 1.0068,
      "num_input_tokens_seen": 47963631616,
      "step": 60963
    },
    {
      "epoch": 6.467642690430724,
      "grad_norm": 0.7105399790031068,
      "learning_rate": 2.1979418755312477e-05,
      "loss": 1.0058,
      "num_input_tokens_seen": 47964418368,
      "step": 60964
    },
    {
      "epoch": 6.467748779970295,
      "grad_norm": 0.7406324833860097,
      "learning_rate": 2.1978728878975556e-05,
      "loss": 1.0105,
      "num_input_tokens_seen": 47965205200,
      "step": 60965
    },
    {
      "epoch": 6.467854869509866,
      "grad_norm": 0.7651664799001664,
      "learning_rate": 2.197803900497339e-05,
      "loss": 0.9929,
      "num_input_tokens_seen": 47965992000,
      "step": 60966
    },
    {
      "epoch": 6.467960959049438,
      "grad_norm": 0.7801340185235526,
      "learning_rate": 2.197734913330651e-05,
      "loss": 0.9563,
      "num_input_tokens_seen": 47966778800,
      "step": 60967
    },
    {
      "epoch": 6.468067048589009,
      "grad_norm": 0.6779367975022867,
      "learning_rate": 2.1976659263975437e-05,
      "loss": 0.9743,
      "num_input_tokens_seen": 47967565648,
      "step": 60968
    },
    {
      "epoch": 6.468173138128581,
      "grad_norm": 0.8652490855269613,
      "learning_rate": 2.1975969396980723e-05,
      "loss": 1.1359,
      "num_input_tokens_seen": 47968352432,
      "step": 60969
    },
    {
      "epoch": 6.468279227668152,
      "grad_norm": 0.8154963729440566,
      "learning_rate": 2.1975279532322886e-05,
      "loss": 1.1045,
      "num_input_tokens_seen": 47969139152,
      "step": 60970
    },
    {
      "epoch": 6.468385317207724,
      "grad_norm": 0.860160676704076,
      "learning_rate": 2.197458967000246e-05,
      "loss": 1.0059,
      "num_input_tokens_seen": 47969925936,
      "step": 60971
    },
    {
      "epoch": 6.468491406747295,
      "grad_norm": 0.8193035638191768,
      "learning_rate": 2.1973899810019986e-05,
      "loss": 0.9426,
      "num_input_tokens_seen": 47970712848,
      "step": 60972
    },
    {
      "epoch": 6.468597496286866,
      "grad_norm": 0.8648670328744787,
      "learning_rate": 2.1973209952376e-05,
      "loss": 1.0134,
      "num_input_tokens_seen": 47971499648,
      "step": 60973
    },
    {
      "epoch": 6.468703585826438,
      "grad_norm": 0.7540793724162339,
      "learning_rate": 2.1972520097071017e-05,
      "loss": 1.0099,
      "num_input_tokens_seen": 47972286480,
      "step": 60974
    },
    {
      "epoch": 6.468809675366009,
      "grad_norm": 0.9256602255409585,
      "learning_rate": 2.197183024410559e-05,
      "loss": 1.001,
      "num_input_tokens_seen": 47973073200,
      "step": 60975
    },
    {
      "epoch": 6.468915764905581,
      "grad_norm": 0.7236942525095552,
      "learning_rate": 2.197114039348024e-05,
      "loss": 1.0073,
      "num_input_tokens_seen": 47973859936,
      "step": 60976
    },
    {
      "epoch": 6.469021854445152,
      "grad_norm": 0.6626947306870394,
      "learning_rate": 2.1970450545195503e-05,
      "loss": 0.9168,
      "num_input_tokens_seen": 47974646736,
      "step": 60977
    },
    {
      "epoch": 6.469127943984724,
      "grad_norm": 0.8788138044745739,
      "learning_rate": 2.1969760699251913e-05,
      "loss": 1.0347,
      "num_input_tokens_seen": 47975433488,
      "step": 60978
    },
    {
      "epoch": 6.469234033524295,
      "grad_norm": 0.7813802017503337,
      "learning_rate": 2.1969070855650004e-05,
      "loss": 0.9822,
      "num_input_tokens_seen": 47976220320,
      "step": 60979
    },
    {
      "epoch": 6.469340123063866,
      "grad_norm": 0.695210481390868,
      "learning_rate": 2.196838101439031e-05,
      "loss": 1.0585,
      "num_input_tokens_seen": 47977006944,
      "step": 60980
    },
    {
      "epoch": 6.4694462126034376,
      "grad_norm": 0.7850264509299625,
      "learning_rate": 2.1967691175473367e-05,
      "loss": 1.0429,
      "num_input_tokens_seen": 47977793712,
      "step": 60981
    },
    {
      "epoch": 6.469552302143009,
      "grad_norm": 1.1041926817083403,
      "learning_rate": 2.196700133889969e-05,
      "loss": 0.9874,
      "num_input_tokens_seen": 47978580496,
      "step": 60982
    },
    {
      "epoch": 6.4696583916825805,
      "grad_norm": 0.8071527773347303,
      "learning_rate": 2.1966311504669833e-05,
      "loss": 0.9375,
      "num_input_tokens_seen": 47979367312,
      "step": 60983
    },
    {
      "epoch": 6.4697644812221515,
      "grad_norm": 1.0324153253223076,
      "learning_rate": 2.1965621672784327e-05,
      "loss": 1.0276,
      "num_input_tokens_seen": 47980154064,
      "step": 60984
    },
    {
      "epoch": 6.469870570761723,
      "grad_norm": 0.7348580218243473,
      "learning_rate": 2.196493184324369e-05,
      "loss": 1.033,
      "num_input_tokens_seen": 47980940880,
      "step": 60985
    },
    {
      "epoch": 6.4699766603012945,
      "grad_norm": 0.6818663862092065,
      "learning_rate": 2.1964242016048466e-05,
      "loss": 1.0095,
      "num_input_tokens_seen": 47981727728,
      "step": 60986
    },
    {
      "epoch": 6.4700827498408655,
      "grad_norm": 0.8248005024297965,
      "learning_rate": 2.1963552191199195e-05,
      "loss": 0.9696,
      "num_input_tokens_seen": 47982514432,
      "step": 60987
    },
    {
      "epoch": 6.470188839380437,
      "grad_norm": 0.7630200316245919,
      "learning_rate": 2.1962862368696388e-05,
      "loss": 0.9587,
      "num_input_tokens_seen": 47983301216,
      "step": 60988
    },
    {
      "epoch": 6.4702949289200085,
      "grad_norm": 0.6535628314547463,
      "learning_rate": 2.19621725485406e-05,
      "loss": 0.9283,
      "num_input_tokens_seen": 47984087952,
      "step": 60989
    },
    {
      "epoch": 6.4704010184595795,
      "grad_norm": 0.8193791051042718,
      "learning_rate": 2.196148273073236e-05,
      "loss": 1.0187,
      "num_input_tokens_seen": 47984874720,
      "step": 60990
    },
    {
      "epoch": 6.470507107999151,
      "grad_norm": 0.6841679693523779,
      "learning_rate": 2.1960792915272188e-05,
      "loss": 0.9597,
      "num_input_tokens_seen": 47985661584,
      "step": 60991
    },
    {
      "epoch": 6.470613197538722,
      "grad_norm": 0.853770554582324,
      "learning_rate": 2.1960103102160635e-05,
      "loss": 0.9488,
      "num_input_tokens_seen": 47986448336,
      "step": 60992
    },
    {
      "epoch": 6.470719287078294,
      "grad_norm": 0.8602485445306061,
      "learning_rate": 2.195941329139822e-05,
      "loss": 0.9923,
      "num_input_tokens_seen": 47987235120,
      "step": 60993
    },
    {
      "epoch": 6.470825376617865,
      "grad_norm": 0.8426905773497146,
      "learning_rate": 2.1958723482985478e-05,
      "loss": 1.0505,
      "num_input_tokens_seen": 47988021904,
      "step": 60994
    },
    {
      "epoch": 6.470931466157436,
      "grad_norm": 0.8690880907729853,
      "learning_rate": 2.195803367692295e-05,
      "loss": 1.0949,
      "num_input_tokens_seen": 47988808672,
      "step": 60995
    },
    {
      "epoch": 6.471037555697008,
      "grad_norm": 0.745128326538431,
      "learning_rate": 2.1957343873211163e-05,
      "loss": 0.9695,
      "num_input_tokens_seen": 47989595488,
      "step": 60996
    },
    {
      "epoch": 6.471143645236579,
      "grad_norm": 0.9469687731238999,
      "learning_rate": 2.195665407185065e-05,
      "loss": 1.0043,
      "num_input_tokens_seen": 47990382208,
      "step": 60997
    },
    {
      "epoch": 6.471249734776151,
      "grad_norm": 1.3264526821348792,
      "learning_rate": 2.195596427284195e-05,
      "loss": 1.0292,
      "num_input_tokens_seen": 47991168912,
      "step": 60998
    },
    {
      "epoch": 6.471355824315722,
      "grad_norm": 0.7256156454555365,
      "learning_rate": 2.1955274476185587e-05,
      "loss": 1.0099,
      "num_input_tokens_seen": 47991955744,
      "step": 60999
    },
    {
      "epoch": 6.471461913855294,
      "grad_norm": 1.068307510556358,
      "learning_rate": 2.19545846818821e-05,
      "loss": 1.031,
      "num_input_tokens_seen": 47992742384,
      "step": 61000
    },
    {
      "epoch": 6.471461913855294,
      "eval_loss": 1.5204439163208008,
      "eval_runtime": 65.1029,
      "eval_samples_per_second": 46.081,
      "eval_steps_per_second": 0.492,
      "num_input_tokens_seen": 47992742384,
      "step": 61000
    },
    {
      "epoch": 6.471568003394865,
      "grad_norm": 1.0457058216035706,
      "learning_rate": 2.1953894889932025e-05,
      "loss": 1.0022,
      "num_input_tokens_seen": 47993529200,
      "step": 61001
    },
    {
      "epoch": 6.471674092934436,
      "grad_norm": 0.8508124878147332,
      "learning_rate": 2.1953205100335883e-05,
      "loss": 0.9844,
      "num_input_tokens_seen": 47994315936,
      "step": 61002
    },
    {
      "epoch": 6.471780182474008,
      "grad_norm": 1.1189287942956494,
      "learning_rate": 2.1952515313094217e-05,
      "loss": 1.0696,
      "num_input_tokens_seen": 47995102672,
      "step": 61003
    },
    {
      "epoch": 6.471886272013579,
      "grad_norm": 1.1310381787954276,
      "learning_rate": 2.195182552820756e-05,
      "loss": 0.997,
      "num_input_tokens_seen": 47995889472,
      "step": 61004
    },
    {
      "epoch": 6.471992361553151,
      "grad_norm": 0.917137222731633,
      "learning_rate": 2.195113574567644e-05,
      "loss": 1.0321,
      "num_input_tokens_seen": 47996676176,
      "step": 61005
    },
    {
      "epoch": 6.472098451092722,
      "grad_norm": 1.2167204101044518,
      "learning_rate": 2.1950445965501397e-05,
      "loss": 1.0496,
      "num_input_tokens_seen": 47997462944,
      "step": 61006
    },
    {
      "epoch": 6.472204540632294,
      "grad_norm": 1.0811081245297822,
      "learning_rate": 2.194975618768296e-05,
      "loss": 1.0482,
      "num_input_tokens_seen": 47998249696,
      "step": 61007
    },
    {
      "epoch": 6.472310630171865,
      "grad_norm": 0.82528607417627,
      "learning_rate": 2.1949066412221655e-05,
      "loss": 1.0038,
      "num_input_tokens_seen": 47999036464,
      "step": 61008
    },
    {
      "epoch": 6.472416719711436,
      "grad_norm": 1.1573342085861666,
      "learning_rate": 2.194837663911803e-05,
      "loss": 0.9773,
      "num_input_tokens_seen": 47999823248,
      "step": 61009
    },
    {
      "epoch": 6.472522809251008,
      "grad_norm": 0.8728890097872717,
      "learning_rate": 2.19476868683726e-05,
      "loss": 0.9576,
      "num_input_tokens_seen": 48000610032,
      "step": 61010
    },
    {
      "epoch": 6.472628898790579,
      "grad_norm": 0.9297056154414475,
      "learning_rate": 2.1946997099985917e-05,
      "loss": 1.0283,
      "num_input_tokens_seen": 48001396768,
      "step": 61011
    },
    {
      "epoch": 6.472734988330151,
      "grad_norm": 0.8983602197251676,
      "learning_rate": 2.1946307333958504e-05,
      "loss": 0.9854,
      "num_input_tokens_seen": 48002183584,
      "step": 61012
    },
    {
      "epoch": 6.472841077869722,
      "grad_norm": 0.8119183117295451,
      "learning_rate": 2.1945617570290887e-05,
      "loss": 1.0074,
      "num_input_tokens_seen": 48002970288,
      "step": 61013
    },
    {
      "epoch": 6.472947167409293,
      "grad_norm": 0.7592296574591517,
      "learning_rate": 2.194492780898362e-05,
      "loss": 1.0003,
      "num_input_tokens_seen": 48003757104,
      "step": 61014
    },
    {
      "epoch": 6.473053256948865,
      "grad_norm": 0.7586771500271221,
      "learning_rate": 2.1944238050037217e-05,
      "loss": 1.0064,
      "num_input_tokens_seen": 48004543920,
      "step": 61015
    },
    {
      "epoch": 6.473159346488436,
      "grad_norm": 0.8336529361225697,
      "learning_rate": 2.1943548293452212e-05,
      "loss": 0.9704,
      "num_input_tokens_seen": 48005330688,
      "step": 61016
    },
    {
      "epoch": 6.473265436028008,
      "grad_norm": 0.7688961862347053,
      "learning_rate": 2.194285853922915e-05,
      "loss": 0.9758,
      "num_input_tokens_seen": 48006117456,
      "step": 61017
    },
    {
      "epoch": 6.473371525567579,
      "grad_norm": 0.7242246815987964,
      "learning_rate": 2.1942168787368557e-05,
      "loss": 0.9763,
      "num_input_tokens_seen": 48006904224,
      "step": 61018
    },
    {
      "epoch": 6.47347761510715,
      "grad_norm": 0.838590087763409,
      "learning_rate": 2.1941479037870964e-05,
      "loss": 1.0552,
      "num_input_tokens_seen": 48007690912,
      "step": 61019
    },
    {
      "epoch": 6.473583704646722,
      "grad_norm": 0.7197047115795812,
      "learning_rate": 2.194078929073691e-05,
      "loss": 0.9734,
      "num_input_tokens_seen": 48008477632,
      "step": 61020
    },
    {
      "epoch": 6.473689794186293,
      "grad_norm": 0.7574516363921519,
      "learning_rate": 2.194009954596692e-05,
      "loss": 1.0196,
      "num_input_tokens_seen": 48009264384,
      "step": 61021
    },
    {
      "epoch": 6.473795883725865,
      "grad_norm": 0.8437429897161445,
      "learning_rate": 2.193940980356153e-05,
      "loss": 1.0905,
      "num_input_tokens_seen": 48010051200,
      "step": 61022
    },
    {
      "epoch": 6.473901973265436,
      "grad_norm": 0.7508628110186382,
      "learning_rate": 2.193872006352128e-05,
      "loss": 0.9305,
      "num_input_tokens_seen": 48010838048,
      "step": 61023
    },
    {
      "epoch": 6.474008062805007,
      "grad_norm": 0.6803185336601604,
      "learning_rate": 2.193803032584669e-05,
      "loss": 1.053,
      "num_input_tokens_seen": 48011624800,
      "step": 61024
    },
    {
      "epoch": 6.474114152344579,
      "grad_norm": 0.7015320305597518,
      "learning_rate": 2.1937340590538306e-05,
      "loss": 1.011,
      "num_input_tokens_seen": 48012411600,
      "step": 61025
    },
    {
      "epoch": 6.47422024188415,
      "grad_norm": 0.7187666246248451,
      "learning_rate": 2.1936650857596654e-05,
      "loss": 0.9253,
      "num_input_tokens_seen": 48013198384,
      "step": 61026
    },
    {
      "epoch": 6.474326331423722,
      "grad_norm": 0.6842386289121402,
      "learning_rate": 2.1935961127022265e-05,
      "loss": 0.9963,
      "num_input_tokens_seen": 48013985104,
      "step": 61027
    },
    {
      "epoch": 6.474432420963293,
      "grad_norm": 0.8439849887745203,
      "learning_rate": 2.193527139881568e-05,
      "loss": 0.9789,
      "num_input_tokens_seen": 48014771984,
      "step": 61028
    },
    {
      "epoch": 6.474538510502865,
      "grad_norm": 0.7734213898180733,
      "learning_rate": 2.1934581672977427e-05,
      "loss": 0.9978,
      "num_input_tokens_seen": 48015558768,
      "step": 61029
    },
    {
      "epoch": 6.474644600042436,
      "grad_norm": 0.6379626415983991,
      "learning_rate": 2.1933891949508036e-05,
      "loss": 1.0208,
      "num_input_tokens_seen": 48016345520,
      "step": 61030
    },
    {
      "epoch": 6.474750689582007,
      "grad_norm": 0.8952498118975938,
      "learning_rate": 2.1933202228408036e-05,
      "loss": 1.0266,
      "num_input_tokens_seen": 48017132336,
      "step": 61031
    },
    {
      "epoch": 6.474856779121579,
      "grad_norm": 0.662250179822477,
      "learning_rate": 2.1932512509677976e-05,
      "loss": 1.0139,
      "num_input_tokens_seen": 48017919040,
      "step": 61032
    },
    {
      "epoch": 6.47496286866115,
      "grad_norm": 0.6401101054064608,
      "learning_rate": 2.1931822793318383e-05,
      "loss": 0.9435,
      "num_input_tokens_seen": 48018705920,
      "step": 61033
    },
    {
      "epoch": 6.475068958200722,
      "grad_norm": 0.9224758952612893,
      "learning_rate": 2.1931133079329783e-05,
      "loss": 1.0518,
      "num_input_tokens_seen": 48019492640,
      "step": 61034
    },
    {
      "epoch": 6.475175047740293,
      "grad_norm": 0.9647790745280492,
      "learning_rate": 2.1930443367712717e-05,
      "loss": 0.9914,
      "num_input_tokens_seen": 48020279392,
      "step": 61035
    },
    {
      "epoch": 6.475281137279865,
      "grad_norm": 0.8024560191609357,
      "learning_rate": 2.1929753658467715e-05,
      "loss": 1.0291,
      "num_input_tokens_seen": 48021066176,
      "step": 61036
    },
    {
      "epoch": 6.475387226819436,
      "grad_norm": 0.7888428467887336,
      "learning_rate": 2.19290639515953e-05,
      "loss": 1.0621,
      "num_input_tokens_seen": 48021852880,
      "step": 61037
    },
    {
      "epoch": 6.475493316359007,
      "grad_norm": 0.8072108142965048,
      "learning_rate": 2.1928374247096025e-05,
      "loss": 0.9971,
      "num_input_tokens_seen": 48022639648,
      "step": 61038
    },
    {
      "epoch": 6.475599405898579,
      "grad_norm": 0.689998701988349,
      "learning_rate": 2.192768454497041e-05,
      "loss": 1.0327,
      "num_input_tokens_seen": 48023426480,
      "step": 61039
    },
    {
      "epoch": 6.47570549543815,
      "grad_norm": 0.7695421021920312,
      "learning_rate": 2.1926994845218988e-05,
      "loss": 1.0212,
      "num_input_tokens_seen": 48024213184,
      "step": 61040
    },
    {
      "epoch": 6.475811584977722,
      "grad_norm": 0.8330442729397857,
      "learning_rate": 2.1926305147842297e-05,
      "loss": 0.9482,
      "num_input_tokens_seen": 48024999984,
      "step": 61041
    },
    {
      "epoch": 6.475917674517293,
      "grad_norm": 0.8636686427504776,
      "learning_rate": 2.1925615452840866e-05,
      "loss": 1.0151,
      "num_input_tokens_seen": 48025786720,
      "step": 61042
    },
    {
      "epoch": 6.476023764056864,
      "grad_norm": 0.9395589081474782,
      "learning_rate": 2.1924925760215227e-05,
      "loss": 1.0431,
      "num_input_tokens_seen": 48026573376,
      "step": 61043
    },
    {
      "epoch": 6.476129853596436,
      "grad_norm": 1.169797251071877,
      "learning_rate": 2.192423606996592e-05,
      "loss": 1.1512,
      "num_input_tokens_seen": 48027360032,
      "step": 61044
    },
    {
      "epoch": 6.476235943136007,
      "grad_norm": 0.7638470477210763,
      "learning_rate": 2.192354638209347e-05,
      "loss": 1.1217,
      "num_input_tokens_seen": 48028146896,
      "step": 61045
    },
    {
      "epoch": 6.4763420326755785,
      "grad_norm": 0.9494141776722135,
      "learning_rate": 2.1922856696598408e-05,
      "loss": 0.9662,
      "num_input_tokens_seen": 48028933696,
      "step": 61046
    },
    {
      "epoch": 6.4764481222151495,
      "grad_norm": 0.8067277498066138,
      "learning_rate": 2.192216701348128e-05,
      "loss": 1.1154,
      "num_input_tokens_seen": 48029720464,
      "step": 61047
    },
    {
      "epoch": 6.476554211754721,
      "grad_norm": 0.8410426345518158,
      "learning_rate": 2.1921477332742603e-05,
      "loss": 0.9756,
      "num_input_tokens_seen": 48030507200,
      "step": 61048
    },
    {
      "epoch": 6.4766603012942925,
      "grad_norm": 0.7975362604580047,
      "learning_rate": 2.1920787654382923e-05,
      "loss": 1.0234,
      "num_input_tokens_seen": 48031293952,
      "step": 61049
    },
    {
      "epoch": 6.4767663908338635,
      "grad_norm": 0.7782383973477848,
      "learning_rate": 2.192009797840277e-05,
      "loss": 1.0758,
      "num_input_tokens_seen": 48032080688,
      "step": 61050
    },
    {
      "epoch": 6.476872480373435,
      "grad_norm": 1.0410418817799214,
      "learning_rate": 2.1919408304802672e-05,
      "loss": 1.0337,
      "num_input_tokens_seen": 48032867392,
      "step": 61051
    },
    {
      "epoch": 6.4769785699130065,
      "grad_norm": 0.7829873167508126,
      "learning_rate": 2.1918718633583165e-05,
      "loss": 0.9826,
      "num_input_tokens_seen": 48033654144,
      "step": 61052
    },
    {
      "epoch": 6.477084659452578,
      "grad_norm": 0.6866823839977668,
      "learning_rate": 2.1918028964744786e-05,
      "loss": 0.9933,
      "num_input_tokens_seen": 48034440912,
      "step": 61053
    },
    {
      "epoch": 6.477190748992149,
      "grad_norm": 1.2184053125242194,
      "learning_rate": 2.1917339298288058e-05,
      "loss": 1.011,
      "num_input_tokens_seen": 48035227632,
      "step": 61054
    },
    {
      "epoch": 6.4772968385317204,
      "grad_norm": 0.9177726996196646,
      "learning_rate": 2.1916649634213524e-05,
      "loss": 0.9697,
      "num_input_tokens_seen": 48036014464,
      "step": 61055
    },
    {
      "epoch": 6.477402928071292,
      "grad_norm": 0.7974102402418524,
      "learning_rate": 2.191595997252171e-05,
      "loss": 1.009,
      "num_input_tokens_seen": 48036801184,
      "step": 61056
    },
    {
      "epoch": 6.477509017610863,
      "grad_norm": 0.7983969445387823,
      "learning_rate": 2.1915270313213148e-05,
      "loss": 1.0536,
      "num_input_tokens_seen": 48037588016,
      "step": 61057
    },
    {
      "epoch": 6.477615107150435,
      "grad_norm": 0.8118786458395153,
      "learning_rate": 2.1914580656288382e-05,
      "loss": 0.9336,
      "num_input_tokens_seen": 48038374704,
      "step": 61058
    },
    {
      "epoch": 6.477721196690006,
      "grad_norm": 0.902548720591788,
      "learning_rate": 2.191389100174794e-05,
      "loss": 1.0125,
      "num_input_tokens_seen": 48039161456,
      "step": 61059
    },
    {
      "epoch": 6.477827286229577,
      "grad_norm": 0.8204501786579679,
      "learning_rate": 2.1913201349592342e-05,
      "loss": 1.111,
      "num_input_tokens_seen": 48039948064,
      "step": 61060
    },
    {
      "epoch": 6.477933375769149,
      "grad_norm": 0.817369783010049,
      "learning_rate": 2.1912511699822135e-05,
      "loss": 0.9854,
      "num_input_tokens_seen": 48040734880,
      "step": 61061
    },
    {
      "epoch": 6.47803946530872,
      "grad_norm": 0.7469429434458172,
      "learning_rate": 2.1911822052437854e-05,
      "loss": 0.9788,
      "num_input_tokens_seen": 48041521648,
      "step": 61062
    },
    {
      "epoch": 6.478145554848292,
      "grad_norm": 0.7943709385925651,
      "learning_rate": 2.1911132407440017e-05,
      "loss": 1.0718,
      "num_input_tokens_seen": 48042308464,
      "step": 61063
    },
    {
      "epoch": 6.478251644387863,
      "grad_norm": 0.7663959474292562,
      "learning_rate": 2.1910442764829177e-05,
      "loss": 0.9466,
      "num_input_tokens_seen": 48043095264,
      "step": 61064
    },
    {
      "epoch": 6.478357733927435,
      "grad_norm": 1.2773864057904396,
      "learning_rate": 2.1909753124605844e-05,
      "loss": 1.0197,
      "num_input_tokens_seen": 48043882064,
      "step": 61065
    },
    {
      "epoch": 6.478463823467006,
      "grad_norm": 0.912282237843898,
      "learning_rate": 2.190906348677057e-05,
      "loss": 1.1104,
      "num_input_tokens_seen": 48044668752,
      "step": 61066
    },
    {
      "epoch": 6.478569913006577,
      "grad_norm": 1.1920863934432817,
      "learning_rate": 2.1908373851323885e-05,
      "loss": 0.9256,
      "num_input_tokens_seen": 48045455504,
      "step": 61067
    },
    {
      "epoch": 6.478676002546149,
      "grad_norm": 0.99127486560444,
      "learning_rate": 2.190768421826631e-05,
      "loss": 0.9913,
      "num_input_tokens_seen": 48046242288,
      "step": 61068
    },
    {
      "epoch": 6.47878209208572,
      "grad_norm": 0.7921885681581675,
      "learning_rate": 2.190699458759839e-05,
      "loss": 0.949,
      "num_input_tokens_seen": 48047029104,
      "step": 61069
    },
    {
      "epoch": 6.478888181625292,
      "grad_norm": 1.0251100309567633,
      "learning_rate": 2.1906304959320658e-05,
      "loss": 1.035,
      "num_input_tokens_seen": 48047815888,
      "step": 61070
    },
    {
      "epoch": 6.478994271164863,
      "grad_norm": 0.9216792716050813,
      "learning_rate": 2.1905615333433632e-05,
      "loss": 1.0009,
      "num_input_tokens_seen": 48048602560,
      "step": 61071
    },
    {
      "epoch": 6.479100360704434,
      "grad_norm": 0.8859171420669865,
      "learning_rate": 2.1904925709937862e-05,
      "loss": 1.0891,
      "num_input_tokens_seen": 48049389296,
      "step": 61072
    },
    {
      "epoch": 6.479206450244006,
      "grad_norm": 0.9359564011146969,
      "learning_rate": 2.190423608883388e-05,
      "loss": 0.8973,
      "num_input_tokens_seen": 48050176128,
      "step": 61073
    },
    {
      "epoch": 6.479312539783577,
      "grad_norm": 0.9186595404312372,
      "learning_rate": 2.1903546470122202e-05,
      "loss": 0.8959,
      "num_input_tokens_seen": 48050963008,
      "step": 61074
    },
    {
      "epoch": 6.479418629323149,
      "grad_norm": 0.9647699288681524,
      "learning_rate": 2.190285685380338e-05,
      "loss": 1.0801,
      "num_input_tokens_seen": 48051749680,
      "step": 61075
    },
    {
      "epoch": 6.47952471886272,
      "grad_norm": 0.7409896263321252,
      "learning_rate": 2.190216723987794e-05,
      "loss": 1.0719,
      "num_input_tokens_seen": 48052536432,
      "step": 61076
    },
    {
      "epoch": 6.479630808402291,
      "grad_norm": 0.7962927933271111,
      "learning_rate": 2.190147762834641e-05,
      "loss": 0.963,
      "num_input_tokens_seen": 48053323248,
      "step": 61077
    },
    {
      "epoch": 6.479736897941863,
      "grad_norm": 0.6452917056755244,
      "learning_rate": 2.1900788019209328e-05,
      "loss": 0.947,
      "num_input_tokens_seen": 48054110064,
      "step": 61078
    },
    {
      "epoch": 6.479842987481434,
      "grad_norm": 0.8140780184795693,
      "learning_rate": 2.190009841246723e-05,
      "loss": 1.0451,
      "num_input_tokens_seen": 48054896752,
      "step": 61079
    },
    {
      "epoch": 6.479949077021006,
      "grad_norm": 0.7886383759960973,
      "learning_rate": 2.1899408808120638e-05,
      "loss": 1.0086,
      "num_input_tokens_seen": 48055683488,
      "step": 61080
    },
    {
      "epoch": 6.480055166560577,
      "grad_norm": 0.8650637199030576,
      "learning_rate": 2.18987192061701e-05,
      "loss": 0.9992,
      "num_input_tokens_seen": 48056470240,
      "step": 61081
    },
    {
      "epoch": 6.480161256100149,
      "grad_norm": 0.6989737229342539,
      "learning_rate": 2.1898029606616132e-05,
      "loss": 1.1033,
      "num_input_tokens_seen": 48057257024,
      "step": 61082
    },
    {
      "epoch": 6.48026734563972,
      "grad_norm": 0.6699437930321587,
      "learning_rate": 2.1897340009459282e-05,
      "loss": 1.0078,
      "num_input_tokens_seen": 48058043760,
      "step": 61083
    },
    {
      "epoch": 6.480373435179291,
      "grad_norm": 0.6881885573198749,
      "learning_rate": 2.189665041470008e-05,
      "loss": 1.0571,
      "num_input_tokens_seen": 48058830544,
      "step": 61084
    },
    {
      "epoch": 6.480479524718863,
      "grad_norm": 0.7786156546732587,
      "learning_rate": 2.1895960822339046e-05,
      "loss": 1.0185,
      "num_input_tokens_seen": 48059617312,
      "step": 61085
    },
    {
      "epoch": 6.480585614258434,
      "grad_norm": 0.7853717781727695,
      "learning_rate": 2.189527123237673e-05,
      "loss": 1.0805,
      "num_input_tokens_seen": 48060403968,
      "step": 61086
    },
    {
      "epoch": 6.480691703798006,
      "grad_norm": 0.8283909384529461,
      "learning_rate": 2.1894581644813657e-05,
      "loss": 0.9364,
      "num_input_tokens_seen": 48061190832,
      "step": 61087
    },
    {
      "epoch": 6.480797793337577,
      "grad_norm": 0.7939384652309263,
      "learning_rate": 2.189389205965035e-05,
      "loss": 0.9409,
      "num_input_tokens_seen": 48061977568,
      "step": 61088
    },
    {
      "epoch": 6.480903882877148,
      "grad_norm": 0.9937681278895228,
      "learning_rate": 2.189320247688736e-05,
      "loss": 0.9986,
      "num_input_tokens_seen": 48062764400,
      "step": 61089
    },
    {
      "epoch": 6.48100997241672,
      "grad_norm": 0.7331370456251973,
      "learning_rate": 2.1892512896525215e-05,
      "loss": 1.0469,
      "num_input_tokens_seen": 48063551056,
      "step": 61090
    },
    {
      "epoch": 6.481116061956291,
      "grad_norm": 0.7107787763582044,
      "learning_rate": 2.189182331856444e-05,
      "loss": 0.9868,
      "num_input_tokens_seen": 48064337824,
      "step": 61091
    },
    {
      "epoch": 6.481222151495863,
      "grad_norm": 0.6705952806419204,
      "learning_rate": 2.1891133743005576e-05,
      "loss": 1.0024,
      "num_input_tokens_seen": 48065124560,
      "step": 61092
    },
    {
      "epoch": 6.481328241035434,
      "grad_norm": 0.8117161247701852,
      "learning_rate": 2.1890444169849154e-05,
      "loss": 1.0083,
      "num_input_tokens_seen": 48065911392,
      "step": 61093
    },
    {
      "epoch": 6.481434330575006,
      "grad_norm": 0.7263638808745042,
      "learning_rate": 2.1889754599095696e-05,
      "loss": 0.9788,
      "num_input_tokens_seen": 48066698176,
      "step": 61094
    },
    {
      "epoch": 6.481540420114577,
      "grad_norm": 0.8238768960371576,
      "learning_rate": 2.1889065030745752e-05,
      "loss": 1.0844,
      "num_input_tokens_seen": 48067484896,
      "step": 61095
    },
    {
      "epoch": 6.481646509654148,
      "grad_norm": 0.7243279611407907,
      "learning_rate": 2.188837546479985e-05,
      "loss": 0.9849,
      "num_input_tokens_seen": 48068271664,
      "step": 61096
    },
    {
      "epoch": 6.48175259919372,
      "grad_norm": 0.7943264944450102,
      "learning_rate": 2.1887685901258512e-05,
      "loss": 0.9432,
      "num_input_tokens_seen": 48069058528,
      "step": 61097
    },
    {
      "epoch": 6.481858688733291,
      "grad_norm": 0.8226914850315044,
      "learning_rate": 2.1886996340122283e-05,
      "loss": 1.0181,
      "num_input_tokens_seen": 48069845312,
      "step": 61098
    },
    {
      "epoch": 6.481964778272863,
      "grad_norm": 1.1890589865102397,
      "learning_rate": 2.1886306781391693e-05,
      "loss": 1.0353,
      "num_input_tokens_seen": 48070632016,
      "step": 61099
    },
    {
      "epoch": 6.482070867812434,
      "grad_norm": 0.7005318496813022,
      "learning_rate": 2.188561722506727e-05,
      "loss": 0.971,
      "num_input_tokens_seen": 48071418800,
      "step": 61100
    },
    {
      "epoch": 6.482176957352005,
      "grad_norm": 0.8981437170418316,
      "learning_rate": 2.188492767114956e-05,
      "loss": 1.038,
      "num_input_tokens_seen": 48072205536,
      "step": 61101
    },
    {
      "epoch": 6.482283046891577,
      "grad_norm": 0.8672581381190263,
      "learning_rate": 2.188423811963907e-05,
      "loss": 0.9325,
      "num_input_tokens_seen": 48072992352,
      "step": 61102
    },
    {
      "epoch": 6.482389136431148,
      "grad_norm": 0.752893225813725,
      "learning_rate": 2.1883548570536365e-05,
      "loss": 1.0585,
      "num_input_tokens_seen": 48073779040,
      "step": 61103
    },
    {
      "epoch": 6.48249522597072,
      "grad_norm": 0.6867641592885709,
      "learning_rate": 2.188285902384196e-05,
      "loss": 0.9052,
      "num_input_tokens_seen": 48074565792,
      "step": 61104
    },
    {
      "epoch": 6.482601315510291,
      "grad_norm": 1.1393578603192862,
      "learning_rate": 2.188216947955638e-05,
      "loss": 1.0183,
      "num_input_tokens_seen": 48075352544,
      "step": 61105
    },
    {
      "epoch": 6.482707405049862,
      "grad_norm": 0.8264873956308709,
      "learning_rate": 2.1881479937680177e-05,
      "loss": 1.0616,
      "num_input_tokens_seen": 48076139360,
      "step": 61106
    },
    {
      "epoch": 6.482813494589434,
      "grad_norm": 0.6957090738764099,
      "learning_rate": 2.1880790398213873e-05,
      "loss": 1.0111,
      "num_input_tokens_seen": 48076926144,
      "step": 61107
    },
    {
      "epoch": 6.482919584129005,
      "grad_norm": 0.7106332843017482,
      "learning_rate": 2.1880100861158002e-05,
      "loss": 1.0416,
      "num_input_tokens_seen": 48077712896,
      "step": 61108
    },
    {
      "epoch": 6.4830256736685765,
      "grad_norm": 1.139828044440544,
      "learning_rate": 2.1879411326513098e-05,
      "loss": 0.9402,
      "num_input_tokens_seen": 48078499680,
      "step": 61109
    },
    {
      "epoch": 6.4831317632081475,
      "grad_norm": 0.955597468115097,
      "learning_rate": 2.1878721794279693e-05,
      "loss": 1.08,
      "num_input_tokens_seen": 48079286464,
      "step": 61110
    },
    {
      "epoch": 6.4832378527477195,
      "grad_norm": 0.7806034684686942,
      "learning_rate": 2.1878032264458317e-05,
      "loss": 1.0829,
      "num_input_tokens_seen": 48080073152,
      "step": 61111
    },
    {
      "epoch": 6.4833439422872905,
      "grad_norm": 0.8042414605573406,
      "learning_rate": 2.187734273704951e-05,
      "loss": 0.9674,
      "num_input_tokens_seen": 48080860000,
      "step": 61112
    },
    {
      "epoch": 6.4834500318268615,
      "grad_norm": 0.8527430459767709,
      "learning_rate": 2.18766532120538e-05,
      "loss": 1.0365,
      "num_input_tokens_seen": 48081646816,
      "step": 61113
    },
    {
      "epoch": 6.4835561213664334,
      "grad_norm": 0.8464773030029211,
      "learning_rate": 2.187596368947172e-05,
      "loss": 1.0034,
      "num_input_tokens_seen": 48082433552,
      "step": 61114
    },
    {
      "epoch": 6.4836622109060045,
      "grad_norm": 0.7300067996179886,
      "learning_rate": 2.1875274169303806e-05,
      "loss": 1.0146,
      "num_input_tokens_seen": 48083220272,
      "step": 61115
    },
    {
      "epoch": 6.483768300445576,
      "grad_norm": 0.7771428666094133,
      "learning_rate": 2.1874584651550583e-05,
      "loss": 0.9867,
      "num_input_tokens_seen": 48084006992,
      "step": 61116
    },
    {
      "epoch": 6.483874389985147,
      "grad_norm": 0.8784050760562425,
      "learning_rate": 2.1873895136212595e-05,
      "loss": 0.9213,
      "num_input_tokens_seen": 48084793808,
      "step": 61117
    },
    {
      "epoch": 6.4839804795247185,
      "grad_norm": 0.8158921035429322,
      "learning_rate": 2.1873205623290373e-05,
      "loss": 1.0467,
      "num_input_tokens_seen": 48085580624,
      "step": 61118
    },
    {
      "epoch": 6.48408656906429,
      "grad_norm": 0.931826308940863,
      "learning_rate": 2.1872516112784434e-05,
      "loss": 1.0274,
      "num_input_tokens_seen": 48086367456,
      "step": 61119
    },
    {
      "epoch": 6.484192658603861,
      "grad_norm": 0.802651299854847,
      "learning_rate": 2.187182660469533e-05,
      "loss": 0.9957,
      "num_input_tokens_seen": 48087154224,
      "step": 61120
    },
    {
      "epoch": 6.484298748143433,
      "grad_norm": 0.6965077036036322,
      "learning_rate": 2.1871137099023585e-05,
      "loss": 0.986,
      "num_input_tokens_seen": 48087940976,
      "step": 61121
    },
    {
      "epoch": 6.484404837683004,
      "grad_norm": 1.2554323898728212,
      "learning_rate": 2.1870447595769733e-05,
      "loss": 1.0288,
      "num_input_tokens_seen": 48088727712,
      "step": 61122
    },
    {
      "epoch": 6.484510927222576,
      "grad_norm": 0.7733047722030549,
      "learning_rate": 2.186975809493431e-05,
      "loss": 1.1078,
      "num_input_tokens_seen": 48089514480,
      "step": 61123
    },
    {
      "epoch": 6.484617016762147,
      "grad_norm": 0.6827429948451307,
      "learning_rate": 2.1869068596517847e-05,
      "loss": 0.9722,
      "num_input_tokens_seen": 48090301216,
      "step": 61124
    },
    {
      "epoch": 6.484723106301718,
      "grad_norm": 0.7029483185319161,
      "learning_rate": 2.186837910052087e-05,
      "loss": 0.9577,
      "num_input_tokens_seen": 48091087984,
      "step": 61125
    },
    {
      "epoch": 6.48482919584129,
      "grad_norm": 0.7453308329449362,
      "learning_rate": 2.1867689606943912e-05,
      "loss": 0.9769,
      "num_input_tokens_seen": 48091874784,
      "step": 61126
    },
    {
      "epoch": 6.484935285380861,
      "grad_norm": 0.7908428028988208,
      "learning_rate": 2.1867000115787523e-05,
      "loss": 1.03,
      "num_input_tokens_seen": 48092661552,
      "step": 61127
    },
    {
      "epoch": 6.485041374920433,
      "grad_norm": 0.6456979319155778,
      "learning_rate": 2.186631062705222e-05,
      "loss": 0.8853,
      "num_input_tokens_seen": 48093448336,
      "step": 61128
    },
    {
      "epoch": 6.485147464460004,
      "grad_norm": 0.7527322733838328,
      "learning_rate": 2.186562114073854e-05,
      "loss": 1.0782,
      "num_input_tokens_seen": 48094235056,
      "step": 61129
    },
    {
      "epoch": 6.485253553999575,
      "grad_norm": 0.757870110787432,
      "learning_rate": 2.186493165684702e-05,
      "loss": 1.0335,
      "num_input_tokens_seen": 48095021792,
      "step": 61130
    },
    {
      "epoch": 6.485359643539147,
      "grad_norm": 0.6876966411195912,
      "learning_rate": 2.186424217537819e-05,
      "loss": 0.9865,
      "num_input_tokens_seen": 48095808640,
      "step": 61131
    },
    {
      "epoch": 6.485465733078718,
      "grad_norm": 0.7197134163311376,
      "learning_rate": 2.1863552696332576e-05,
      "loss": 0.9544,
      "num_input_tokens_seen": 48096595360,
      "step": 61132
    },
    {
      "epoch": 6.48557182261829,
      "grad_norm": 1.0014695936691433,
      "learning_rate": 2.1862863219710723e-05,
      "loss": 1.0936,
      "num_input_tokens_seen": 48097382128,
      "step": 61133
    },
    {
      "epoch": 6.485677912157861,
      "grad_norm": 0.8906167532048399,
      "learning_rate": 2.1862173745513153e-05,
      "loss": 0.9769,
      "num_input_tokens_seen": 48098168784,
      "step": 61134
    },
    {
      "epoch": 6.485784001697432,
      "grad_norm": 0.7161703936353788,
      "learning_rate": 2.1861484273740398e-05,
      "loss": 0.9393,
      "num_input_tokens_seen": 48098955584,
      "step": 61135
    },
    {
      "epoch": 6.485890091237004,
      "grad_norm": 0.6889668076119398,
      "learning_rate": 2.1860794804393003e-05,
      "loss": 1.0074,
      "num_input_tokens_seen": 48099742368,
      "step": 61136
    },
    {
      "epoch": 6.485996180776575,
      "grad_norm": 0.7078666134012493,
      "learning_rate": 2.186010533747149e-05,
      "loss": 0.8963,
      "num_input_tokens_seen": 48100529232,
      "step": 61137
    },
    {
      "epoch": 6.486102270316147,
      "grad_norm": 0.9226741468509831,
      "learning_rate": 2.1859415872976398e-05,
      "loss": 1.0749,
      "num_input_tokens_seen": 48101316032,
      "step": 61138
    },
    {
      "epoch": 6.486208359855718,
      "grad_norm": 0.7172377706364893,
      "learning_rate": 2.185872641090826e-05,
      "loss": 1.0563,
      "num_input_tokens_seen": 48102102688,
      "step": 61139
    },
    {
      "epoch": 6.48631444939529,
      "grad_norm": 0.716871500389121,
      "learning_rate": 2.18580369512676e-05,
      "loss": 0.9826,
      "num_input_tokens_seen": 48102889408,
      "step": 61140
    },
    {
      "epoch": 6.486420538934861,
      "grad_norm": 1.4169250787687018,
      "learning_rate": 2.1857347494054962e-05,
      "loss": 0.9836,
      "num_input_tokens_seen": 48103676240,
      "step": 61141
    },
    {
      "epoch": 6.486526628474432,
      "grad_norm": 0.7818842316619833,
      "learning_rate": 2.1856658039270872e-05,
      "loss": 1.1289,
      "num_input_tokens_seen": 48104463024,
      "step": 61142
    },
    {
      "epoch": 6.486632718014004,
      "grad_norm": 0.7816647337844934,
      "learning_rate": 2.185596858691586e-05,
      "loss": 1.022,
      "num_input_tokens_seen": 48105249824,
      "step": 61143
    },
    {
      "epoch": 6.486738807553575,
      "grad_norm": 1.3381238503490136,
      "learning_rate": 2.185527913699047e-05,
      "loss": 0.9675,
      "num_input_tokens_seen": 48106036512,
      "step": 61144
    },
    {
      "epoch": 6.486844897093147,
      "grad_norm": 0.8887812839189733,
      "learning_rate": 2.1854589689495226e-05,
      "loss": 0.9706,
      "num_input_tokens_seen": 48106823216,
      "step": 61145
    },
    {
      "epoch": 6.486950986632718,
      "grad_norm": 0.7487629995283527,
      "learning_rate": 2.185390024443066e-05,
      "loss": 1.015,
      "num_input_tokens_seen": 48107609920,
      "step": 61146
    },
    {
      "epoch": 6.48705707617229,
      "grad_norm": 0.8581903640130393,
      "learning_rate": 2.185321080179731e-05,
      "loss": 1.0138,
      "num_input_tokens_seen": 48108396656,
      "step": 61147
    },
    {
      "epoch": 6.487163165711861,
      "grad_norm": 0.9854200719085208,
      "learning_rate": 2.1852521361595708e-05,
      "loss": 1.0153,
      "num_input_tokens_seen": 48109183296,
      "step": 61148
    },
    {
      "epoch": 6.487269255251432,
      "grad_norm": 0.8242299501561787,
      "learning_rate": 2.185183192382638e-05,
      "loss": 1.0339,
      "num_input_tokens_seen": 48109970080,
      "step": 61149
    },
    {
      "epoch": 6.487375344791004,
      "grad_norm": 1.1773487863805714,
      "learning_rate": 2.1851142488489867e-05,
      "loss": 1.1275,
      "num_input_tokens_seen": 48110756784,
      "step": 61150
    },
    {
      "epoch": 6.487481434330575,
      "grad_norm": 1.1169753604473707,
      "learning_rate": 2.1850453055586695e-05,
      "loss": 0.9583,
      "num_input_tokens_seen": 48111543584,
      "step": 61151
    },
    {
      "epoch": 6.487587523870147,
      "grad_norm": 0.7438242163366632,
      "learning_rate": 2.1849763625117404e-05,
      "loss": 0.9834,
      "num_input_tokens_seen": 48112330288,
      "step": 61152
    },
    {
      "epoch": 6.487693613409718,
      "grad_norm": 1.1990037265228908,
      "learning_rate": 2.1849074197082526e-05,
      "loss": 1.1088,
      "num_input_tokens_seen": 48113117056,
      "step": 61153
    },
    {
      "epoch": 6.487799702949289,
      "grad_norm": 0.7601289701342964,
      "learning_rate": 2.1848384771482584e-05,
      "loss": 1.0058,
      "num_input_tokens_seen": 48113903840,
      "step": 61154
    },
    {
      "epoch": 6.487905792488861,
      "grad_norm": 0.8918759826865406,
      "learning_rate": 2.1847695348318122e-05,
      "loss": 0.9954,
      "num_input_tokens_seen": 48114690592,
      "step": 61155
    },
    {
      "epoch": 6.488011882028432,
      "grad_norm": 0.7514099382196914,
      "learning_rate": 2.1847005927589673e-05,
      "loss": 0.9489,
      "num_input_tokens_seen": 48115477360,
      "step": 61156
    },
    {
      "epoch": 6.488117971568004,
      "grad_norm": 0.8723858716637785,
      "learning_rate": 2.184631650929776e-05,
      "loss": 1.0492,
      "num_input_tokens_seen": 48116264144,
      "step": 61157
    },
    {
      "epoch": 6.488224061107575,
      "grad_norm": 0.8049368796659664,
      "learning_rate": 2.184562709344292e-05,
      "loss": 1.0248,
      "num_input_tokens_seen": 48117050944,
      "step": 61158
    },
    {
      "epoch": 6.488330150647146,
      "grad_norm": 0.8577277627322393,
      "learning_rate": 2.184493768002569e-05,
      "loss": 1.0829,
      "num_input_tokens_seen": 48117837680,
      "step": 61159
    },
    {
      "epoch": 6.488436240186718,
      "grad_norm": 0.7290179312032495,
      "learning_rate": 2.1844248269046593e-05,
      "loss": 1.011,
      "num_input_tokens_seen": 48118624464,
      "step": 61160
    },
    {
      "epoch": 6.488542329726289,
      "grad_norm": 0.8063557358684097,
      "learning_rate": 2.184355886050618e-05,
      "loss": 1.0316,
      "num_input_tokens_seen": 48119411184,
      "step": 61161
    },
    {
      "epoch": 6.488648419265861,
      "grad_norm": 0.8053734162222751,
      "learning_rate": 2.1842869454404966e-05,
      "loss": 1.0029,
      "num_input_tokens_seen": 48120197840,
      "step": 61162
    },
    {
      "epoch": 6.488754508805432,
      "grad_norm": 0.7414754643625109,
      "learning_rate": 2.1842180050743485e-05,
      "loss": 1.0696,
      "num_input_tokens_seen": 48120984544,
      "step": 61163
    },
    {
      "epoch": 6.488860598345003,
      "grad_norm": 0.7833693452619772,
      "learning_rate": 2.1841490649522283e-05,
      "loss": 1.0194,
      "num_input_tokens_seen": 48121771312,
      "step": 61164
    },
    {
      "epoch": 6.488966687884575,
      "grad_norm": 0.720023745762228,
      "learning_rate": 2.184080125074188e-05,
      "loss": 1.0367,
      "num_input_tokens_seen": 48122558048,
      "step": 61165
    },
    {
      "epoch": 6.489072777424146,
      "grad_norm": 0.8916877053820126,
      "learning_rate": 2.184011185440281e-05,
      "loss": 1.0514,
      "num_input_tokens_seen": 48123344752,
      "step": 61166
    },
    {
      "epoch": 6.489178866963718,
      "grad_norm": 0.6537859501210521,
      "learning_rate": 2.1839422460505616e-05,
      "loss": 1.0127,
      "num_input_tokens_seen": 48124131552,
      "step": 61167
    },
    {
      "epoch": 6.489284956503289,
      "grad_norm": 0.7759689235084856,
      "learning_rate": 2.1838733069050815e-05,
      "loss": 1.0129,
      "num_input_tokens_seen": 48124918320,
      "step": 61168
    },
    {
      "epoch": 6.4893910460428605,
      "grad_norm": 1.235837904671316,
      "learning_rate": 2.1838043680038956e-05,
      "loss": 1.0813,
      "num_input_tokens_seen": 48125704944,
      "step": 61169
    },
    {
      "epoch": 6.489497135582432,
      "grad_norm": 0.8567570236332378,
      "learning_rate": 2.1837354293470563e-05,
      "loss": 0.9898,
      "num_input_tokens_seen": 48126491728,
      "step": 61170
    },
    {
      "epoch": 6.489603225122003,
      "grad_norm": 0.6584361651469562,
      "learning_rate": 2.1836664909346165e-05,
      "loss": 1.0032,
      "num_input_tokens_seen": 48127278528,
      "step": 61171
    },
    {
      "epoch": 6.4897093146615745,
      "grad_norm": 1.0103367953772964,
      "learning_rate": 2.1835975527666304e-05,
      "loss": 1.0618,
      "num_input_tokens_seen": 48128065264,
      "step": 61172
    },
    {
      "epoch": 6.4898154042011456,
      "grad_norm": 1.5561047946886875,
      "learning_rate": 2.183528614843151e-05,
      "loss": 1.0174,
      "num_input_tokens_seen": 48128852176,
      "step": 61173
    },
    {
      "epoch": 6.4899214937407175,
      "grad_norm": 0.817312902896309,
      "learning_rate": 2.1834596771642304e-05,
      "loss": 1.077,
      "num_input_tokens_seen": 48129638896,
      "step": 61174
    },
    {
      "epoch": 6.4900275832802885,
      "grad_norm": 0.8225932310093441,
      "learning_rate": 2.183390739729924e-05,
      "loss": 0.9218,
      "num_input_tokens_seen": 48130425616,
      "step": 61175
    },
    {
      "epoch": 6.49013367281986,
      "grad_norm": 0.9955627454465559,
      "learning_rate": 2.1833218025402835e-05,
      "loss": 1.0157,
      "num_input_tokens_seen": 48131212384,
      "step": 61176
    },
    {
      "epoch": 6.4902397623594315,
      "grad_norm": 1.2156842158728551,
      "learning_rate": 2.1832528655953625e-05,
      "loss": 1.1024,
      "num_input_tokens_seen": 48131999136,
      "step": 61177
    },
    {
      "epoch": 6.4903458518990025,
      "grad_norm": 0.7676229395039056,
      "learning_rate": 2.1831839288952147e-05,
      "loss": 1.0285,
      "num_input_tokens_seen": 48132785872,
      "step": 61178
    },
    {
      "epoch": 6.490451941438574,
      "grad_norm": 1.103151767558681,
      "learning_rate": 2.183114992439893e-05,
      "loss": 1.1013,
      "num_input_tokens_seen": 48133572576,
      "step": 61179
    },
    {
      "epoch": 6.490558030978145,
      "grad_norm": 1.0561007867872911,
      "learning_rate": 2.1830460562294502e-05,
      "loss": 1.0178,
      "num_input_tokens_seen": 48134359280,
      "step": 61180
    },
    {
      "epoch": 6.490664120517717,
      "grad_norm": 0.8743022777701975,
      "learning_rate": 2.182977120263941e-05,
      "loss": 1.0076,
      "num_input_tokens_seen": 48135146032,
      "step": 61181
    },
    {
      "epoch": 6.490770210057288,
      "grad_norm": 0.955085557512979,
      "learning_rate": 2.1829081845434175e-05,
      "loss": 0.9843,
      "num_input_tokens_seen": 48135932848,
      "step": 61182
    },
    {
      "epoch": 6.490876299596859,
      "grad_norm": 1.3177127126415162,
      "learning_rate": 2.1828392490679326e-05,
      "loss": 1.0439,
      "num_input_tokens_seen": 48136719536,
      "step": 61183
    },
    {
      "epoch": 6.490982389136431,
      "grad_norm": 1.0832033457478136,
      "learning_rate": 2.1827703138375408e-05,
      "loss": 1.0908,
      "num_input_tokens_seen": 48137506240,
      "step": 61184
    },
    {
      "epoch": 6.491088478676002,
      "grad_norm": 0.8655437351494285,
      "learning_rate": 2.1827013788522942e-05,
      "loss": 0.9616,
      "num_input_tokens_seen": 48138293024,
      "step": 61185
    },
    {
      "epoch": 6.491194568215574,
      "grad_norm": 0.9351486863920375,
      "learning_rate": 2.1826324441122474e-05,
      "loss": 1.0217,
      "num_input_tokens_seen": 48139079792,
      "step": 61186
    },
    {
      "epoch": 6.491300657755145,
      "grad_norm": 0.7676002912331942,
      "learning_rate": 2.182563509617453e-05,
      "loss": 0.9829,
      "num_input_tokens_seen": 48139866512,
      "step": 61187
    },
    {
      "epoch": 6.491406747294716,
      "grad_norm": 0.7939157931584957,
      "learning_rate": 2.1824945753679635e-05,
      "loss": 1.0164,
      "num_input_tokens_seen": 48140653328,
      "step": 61188
    },
    {
      "epoch": 6.491512836834288,
      "grad_norm": 0.5937349311969593,
      "learning_rate": 2.1824256413638335e-05,
      "loss": 0.9221,
      "num_input_tokens_seen": 48141440064,
      "step": 61189
    },
    {
      "epoch": 6.491618926373859,
      "grad_norm": 0.83830093381014,
      "learning_rate": 2.1823567076051153e-05,
      "loss": 1.0547,
      "num_input_tokens_seen": 48142226784,
      "step": 61190
    },
    {
      "epoch": 6.491725015913431,
      "grad_norm": 0.7341539757220894,
      "learning_rate": 2.1822877740918623e-05,
      "loss": 0.9367,
      "num_input_tokens_seen": 48143013632,
      "step": 61191
    },
    {
      "epoch": 6.491831105453002,
      "grad_norm": 0.7435453189825983,
      "learning_rate": 2.1822188408241288e-05,
      "loss": 0.9113,
      "num_input_tokens_seen": 48143800400,
      "step": 61192
    },
    {
      "epoch": 6.491937194992573,
      "grad_norm": 0.6995899497714834,
      "learning_rate": 2.1821499078019668e-05,
      "loss": 0.9402,
      "num_input_tokens_seen": 48144587200,
      "step": 61193
    },
    {
      "epoch": 6.492043284532145,
      "grad_norm": 0.65831717265969,
      "learning_rate": 2.1820809750254294e-05,
      "loss": 1.0028,
      "num_input_tokens_seen": 48145374096,
      "step": 61194
    },
    {
      "epoch": 6.492149374071716,
      "grad_norm": 0.7587260008374986,
      "learning_rate": 2.1820120424945716e-05,
      "loss": 1.0088,
      "num_input_tokens_seen": 48146160880,
      "step": 61195
    },
    {
      "epoch": 6.492255463611288,
      "grad_norm": 0.7652842169097335,
      "learning_rate": 2.181943110209445e-05,
      "loss": 1.0245,
      "num_input_tokens_seen": 48146947680,
      "step": 61196
    },
    {
      "epoch": 6.492361553150859,
      "grad_norm": 0.7666213134400431,
      "learning_rate": 2.1818741781701032e-05,
      "loss": 0.9432,
      "num_input_tokens_seen": 48147734464,
      "step": 61197
    },
    {
      "epoch": 6.492467642690431,
      "grad_norm": 0.8844955752295698,
      "learning_rate": 2.1818052463766004e-05,
      "loss": 1.0645,
      "num_input_tokens_seen": 48148521200,
      "step": 61198
    },
    {
      "epoch": 6.492573732230002,
      "grad_norm": 0.9912295750227318,
      "learning_rate": 2.1817363148289886e-05,
      "loss": 0.9721,
      "num_input_tokens_seen": 48149308080,
      "step": 61199
    },
    {
      "epoch": 6.492679821769573,
      "grad_norm": 0.6640898749020153,
      "learning_rate": 2.1816673835273216e-05,
      "loss": 0.87,
      "num_input_tokens_seen": 48150094912,
      "step": 61200
    },
    {
      "epoch": 6.492785911309145,
      "grad_norm": 0.8679933218312977,
      "learning_rate": 2.1815984524716533e-05,
      "loss": 1.0343,
      "num_input_tokens_seen": 48150881728,
      "step": 61201
    },
    {
      "epoch": 6.492892000848716,
      "grad_norm": 0.7545088406331599,
      "learning_rate": 2.1815295216620356e-05,
      "loss": 0.9364,
      "num_input_tokens_seen": 48151668512,
      "step": 61202
    },
    {
      "epoch": 6.492998090388288,
      "grad_norm": 0.7382591795670772,
      "learning_rate": 2.181460591098523e-05,
      "loss": 0.9077,
      "num_input_tokens_seen": 48152455232,
      "step": 61203
    },
    {
      "epoch": 6.493104179927859,
      "grad_norm": 0.8898274622822976,
      "learning_rate": 2.181391660781168e-05,
      "loss": 0.9728,
      "num_input_tokens_seen": 48153242000,
      "step": 61204
    },
    {
      "epoch": 6.493210269467431,
      "grad_norm": 0.8179796260126322,
      "learning_rate": 2.1813227307100242e-05,
      "loss": 0.9304,
      "num_input_tokens_seen": 48154028832,
      "step": 61205
    },
    {
      "epoch": 6.493316359007002,
      "grad_norm": 0.9450293289341986,
      "learning_rate": 2.1812538008851453e-05,
      "loss": 1.0699,
      "num_input_tokens_seen": 48154815552,
      "step": 61206
    },
    {
      "epoch": 6.493422448546573,
      "grad_norm": 0.7598451230352284,
      "learning_rate": 2.181184871306584e-05,
      "loss": 0.9853,
      "num_input_tokens_seen": 48155602336,
      "step": 61207
    },
    {
      "epoch": 6.493528538086145,
      "grad_norm": 0.6686728574597463,
      "learning_rate": 2.181115941974393e-05,
      "loss": 0.9874,
      "num_input_tokens_seen": 48156389056,
      "step": 61208
    },
    {
      "epoch": 6.493634627625716,
      "grad_norm": 1.134489134469289,
      "learning_rate": 2.1810470128886273e-05,
      "loss": 0.9427,
      "num_input_tokens_seen": 48157175808,
      "step": 61209
    },
    {
      "epoch": 6.493740717165288,
      "grad_norm": 0.8736981181500697,
      "learning_rate": 2.1809780840493386e-05,
      "loss": 1.0296,
      "num_input_tokens_seen": 48157962640,
      "step": 61210
    },
    {
      "epoch": 6.493846806704859,
      "grad_norm": 0.8696943243379981,
      "learning_rate": 2.1809091554565803e-05,
      "loss": 1.0781,
      "num_input_tokens_seen": 48158749408,
      "step": 61211
    },
    {
      "epoch": 6.49395289624443,
      "grad_norm": 0.9033413818403803,
      "learning_rate": 2.1808402271104067e-05,
      "loss": 0.9971,
      "num_input_tokens_seen": 48159536144,
      "step": 61212
    },
    {
      "epoch": 6.494058985784002,
      "grad_norm": 1.1048246749566082,
      "learning_rate": 2.1807712990108702e-05,
      "loss": 1.0123,
      "num_input_tokens_seen": 48160322880,
      "step": 61213
    },
    {
      "epoch": 6.494165075323573,
      "grad_norm": 0.9205482070580056,
      "learning_rate": 2.180702371158024e-05,
      "loss": 1.0125,
      "num_input_tokens_seen": 48161109632,
      "step": 61214
    },
    {
      "epoch": 6.494271164863145,
      "grad_norm": 0.8293889820200351,
      "learning_rate": 2.180633443551922e-05,
      "loss": 0.9786,
      "num_input_tokens_seen": 48161896384,
      "step": 61215
    },
    {
      "epoch": 6.494377254402716,
      "grad_norm": 0.820859333933655,
      "learning_rate": 2.1805645161926163e-05,
      "loss": 0.9636,
      "num_input_tokens_seen": 48162683168,
      "step": 61216
    },
    {
      "epoch": 6.494483343942287,
      "grad_norm": 0.8891288506837024,
      "learning_rate": 2.1804955890801622e-05,
      "loss": 1.0328,
      "num_input_tokens_seen": 48163469952,
      "step": 61217
    },
    {
      "epoch": 6.494589433481859,
      "grad_norm": 0.7207921897247838,
      "learning_rate": 2.180426662214611e-05,
      "loss": 0.926,
      "num_input_tokens_seen": 48164256736,
      "step": 61218
    },
    {
      "epoch": 6.49469552302143,
      "grad_norm": 0.8084530454841532,
      "learning_rate": 2.1803577355960164e-05,
      "loss": 1.0388,
      "num_input_tokens_seen": 48165043520,
      "step": 61219
    },
    {
      "epoch": 6.494801612561002,
      "grad_norm": 0.7574703385973109,
      "learning_rate": 2.180288809224433e-05,
      "loss": 1.0189,
      "num_input_tokens_seen": 48165830320,
      "step": 61220
    },
    {
      "epoch": 6.494907702100573,
      "grad_norm": 0.8728155264961724,
      "learning_rate": 2.180219883099911e-05,
      "loss": 0.9922,
      "num_input_tokens_seen": 48166617024,
      "step": 61221
    },
    {
      "epoch": 6.495013791640145,
      "grad_norm": 0.7717826434017911,
      "learning_rate": 2.1801509572225074e-05,
      "loss": 1.091,
      "num_input_tokens_seen": 48167403696,
      "step": 61222
    },
    {
      "epoch": 6.495119881179716,
      "grad_norm": 0.7457221932015318,
      "learning_rate": 2.180082031592273e-05,
      "loss": 0.9461,
      "num_input_tokens_seen": 48168190464,
      "step": 61223
    },
    {
      "epoch": 6.495225970719287,
      "grad_norm": 0.9194967875985132,
      "learning_rate": 2.1800131062092627e-05,
      "loss": 1.0023,
      "num_input_tokens_seen": 48168977296,
      "step": 61224
    },
    {
      "epoch": 6.495332060258859,
      "grad_norm": 0.9134588119864809,
      "learning_rate": 2.1799441810735287e-05,
      "loss": 1.0359,
      "num_input_tokens_seen": 48169764048,
      "step": 61225
    },
    {
      "epoch": 6.49543814979843,
      "grad_norm": 0.7382683373707571,
      "learning_rate": 2.179875256185124e-05,
      "loss": 1.0175,
      "num_input_tokens_seen": 48170550848,
      "step": 61226
    },
    {
      "epoch": 6.495544239338002,
      "grad_norm": 0.7715311289460008,
      "learning_rate": 2.1798063315441025e-05,
      "loss": 1.0404,
      "num_input_tokens_seen": 48171337664,
      "step": 61227
    },
    {
      "epoch": 6.495650328877573,
      "grad_norm": 0.7523278668541975,
      "learning_rate": 2.179737407150517e-05,
      "loss": 0.9799,
      "num_input_tokens_seen": 48172124432,
      "step": 61228
    },
    {
      "epoch": 6.495756418417144,
      "grad_norm": 0.7054002459552273,
      "learning_rate": 2.179668483004421e-05,
      "loss": 0.9849,
      "num_input_tokens_seen": 48172911232,
      "step": 61229
    },
    {
      "epoch": 6.495862507956716,
      "grad_norm": 0.8492625652789514,
      "learning_rate": 2.179599559105869e-05,
      "loss": 0.9889,
      "num_input_tokens_seen": 48173698016,
      "step": 61230
    },
    {
      "epoch": 6.495968597496287,
      "grad_norm": 0.6776852006584915,
      "learning_rate": 2.179530635454912e-05,
      "loss": 1.0058,
      "num_input_tokens_seen": 48174484832,
      "step": 61231
    },
    {
      "epoch": 6.4960746870358586,
      "grad_norm": 0.8088710203958139,
      "learning_rate": 2.1794617120516044e-05,
      "loss": 1.0035,
      "num_input_tokens_seen": 48175271568,
      "step": 61232
    },
    {
      "epoch": 6.49618077657543,
      "grad_norm": 1.0673748801171163,
      "learning_rate": 2.1793927888959996e-05,
      "loss": 1.0328,
      "num_input_tokens_seen": 48176058448,
      "step": 61233
    },
    {
      "epoch": 6.4962868661150015,
      "grad_norm": 0.8674365054133755,
      "learning_rate": 2.1793238659881503e-05,
      "loss": 0.9858,
      "num_input_tokens_seen": 48176845280,
      "step": 61234
    },
    {
      "epoch": 6.4963929556545725,
      "grad_norm": 0.7122257650157706,
      "learning_rate": 2.1792549433281102e-05,
      "loss": 0.946,
      "num_input_tokens_seen": 48177632096,
      "step": 61235
    },
    {
      "epoch": 6.496499045194144,
      "grad_norm": 0.7276717040848468,
      "learning_rate": 2.1791860209159327e-05,
      "loss": 1.0253,
      "num_input_tokens_seen": 48178418880,
      "step": 61236
    },
    {
      "epoch": 6.4966051347337155,
      "grad_norm": 0.6852122319592563,
      "learning_rate": 2.179117098751671e-05,
      "loss": 0.9137,
      "num_input_tokens_seen": 48179205648,
      "step": 61237
    },
    {
      "epoch": 6.4967112242732865,
      "grad_norm": 0.7804540400732816,
      "learning_rate": 2.1790481768353777e-05,
      "loss": 1.0339,
      "num_input_tokens_seen": 48179992352,
      "step": 61238
    },
    {
      "epoch": 6.496817313812858,
      "grad_norm": 0.9689236223898031,
      "learning_rate": 2.178979255167107e-05,
      "loss": 1.0066,
      "num_input_tokens_seen": 48180779008,
      "step": 61239
    },
    {
      "epoch": 6.4969234033524295,
      "grad_norm": 0.7308237993464396,
      "learning_rate": 2.178910333746911e-05,
      "loss": 0.9526,
      "num_input_tokens_seen": 48181565776,
      "step": 61240
    },
    {
      "epoch": 6.4970294928920005,
      "grad_norm": 0.7263122713479273,
      "learning_rate": 2.1788414125748442e-05,
      "loss": 0.9257,
      "num_input_tokens_seen": 48182352544,
      "step": 61241
    },
    {
      "epoch": 6.497135582431572,
      "grad_norm": 0.656464371529373,
      "learning_rate": 2.17877249165096e-05,
      "loss": 0.9976,
      "num_input_tokens_seen": 48183139392,
      "step": 61242
    },
    {
      "epoch": 6.497241671971143,
      "grad_norm": 0.7938803985987544,
      "learning_rate": 2.1787035709753097e-05,
      "loss": 1.0155,
      "num_input_tokens_seen": 48183926128,
      "step": 61243
    },
    {
      "epoch": 6.497347761510715,
      "grad_norm": 0.6874474738355982,
      "learning_rate": 2.1786346505479486e-05,
      "loss": 0.9632,
      "num_input_tokens_seen": 48184712880,
      "step": 61244
    },
    {
      "epoch": 6.497453851050286,
      "grad_norm": 0.9671396064786557,
      "learning_rate": 2.178565730368929e-05,
      "loss": 0.9684,
      "num_input_tokens_seen": 48185499632,
      "step": 61245
    },
    {
      "epoch": 6.497559940589857,
      "grad_norm": 0.6874132168315029,
      "learning_rate": 2.1784968104383043e-05,
      "loss": 0.923,
      "num_input_tokens_seen": 48186286464,
      "step": 61246
    },
    {
      "epoch": 6.497666030129429,
      "grad_norm": 1.2371425814830914,
      "learning_rate": 2.1784278907561282e-05,
      "loss": 0.9967,
      "num_input_tokens_seen": 48187073216,
      "step": 61247
    },
    {
      "epoch": 6.497772119669,
      "grad_norm": 0.6930087938216913,
      "learning_rate": 2.1783589713224533e-05,
      "loss": 1.0101,
      "num_input_tokens_seen": 48187859968,
      "step": 61248
    },
    {
      "epoch": 6.497878209208572,
      "grad_norm": 0.8069919884218313,
      "learning_rate": 2.1782900521373327e-05,
      "loss": 1.0877,
      "num_input_tokens_seen": 48188646720,
      "step": 61249
    },
    {
      "epoch": 6.497984298748143,
      "grad_norm": 0.8908262348759759,
      "learning_rate": 2.178221133200821e-05,
      "loss": 0.9337,
      "num_input_tokens_seen": 48189433520,
      "step": 61250
    },
    {
      "epoch": 6.498090388287715,
      "grad_norm": 0.8593876081811287,
      "learning_rate": 2.1781522145129705e-05,
      "loss": 1.0095,
      "num_input_tokens_seen": 48190220304,
      "step": 61251
    },
    {
      "epoch": 6.498196477827286,
      "grad_norm": 0.8004205005592201,
      "learning_rate": 2.1780832960738336e-05,
      "loss": 0.9717,
      "num_input_tokens_seen": 48191007056,
      "step": 61252
    },
    {
      "epoch": 6.498302567366857,
      "grad_norm": 0.9110360023020422,
      "learning_rate": 2.1780143778834655e-05,
      "loss": 1.0043,
      "num_input_tokens_seen": 48191793792,
      "step": 61253
    },
    {
      "epoch": 6.498408656906429,
      "grad_norm": 0.9895103638152688,
      "learning_rate": 2.1779454599419173e-05,
      "loss": 1.0508,
      "num_input_tokens_seen": 48192580544,
      "step": 61254
    },
    {
      "epoch": 6.498514746446,
      "grad_norm": 0.84816403681841,
      "learning_rate": 2.1778765422492445e-05,
      "loss": 1.0864,
      "num_input_tokens_seen": 48193367328,
      "step": 61255
    },
    {
      "epoch": 6.498620835985572,
      "grad_norm": 0.8190469261250399,
      "learning_rate": 2.177807624805499e-05,
      "loss": 1.0312,
      "num_input_tokens_seen": 48194153984,
      "step": 61256
    },
    {
      "epoch": 6.498726925525143,
      "grad_norm": 0.5942729769192421,
      "learning_rate": 2.177738707610734e-05,
      "loss": 0.9776,
      "num_input_tokens_seen": 48194940832,
      "step": 61257
    },
    {
      "epoch": 6.498833015064714,
      "grad_norm": 1.0332797230871622,
      "learning_rate": 2.1776697906650033e-05,
      "loss": 0.997,
      "num_input_tokens_seen": 48195727664,
      "step": 61258
    },
    {
      "epoch": 6.498939104604286,
      "grad_norm": 0.755007414357287,
      "learning_rate": 2.17760087396836e-05,
      "loss": 0.9894,
      "num_input_tokens_seen": 48196514304,
      "step": 61259
    },
    {
      "epoch": 6.499045194143857,
      "grad_norm": 1.0128678090341887,
      "learning_rate": 2.177531957520857e-05,
      "loss": 1.0517,
      "num_input_tokens_seen": 48197301120,
      "step": 61260
    },
    {
      "epoch": 6.499151283683429,
      "grad_norm": 1.0443786216527777,
      "learning_rate": 2.1774630413225483e-05,
      "loss": 1.0546,
      "num_input_tokens_seen": 48198087920,
      "step": 61261
    },
    {
      "epoch": 6.499257373223,
      "grad_norm": 0.9198299639204309,
      "learning_rate": 2.1773941253734863e-05,
      "loss": 1.0165,
      "num_input_tokens_seen": 48198874688,
      "step": 61262
    },
    {
      "epoch": 6.499363462762572,
      "grad_norm": 1.2118750410612291,
      "learning_rate": 2.1773252096737247e-05,
      "loss": 1.0427,
      "num_input_tokens_seen": 48199661440,
      "step": 61263
    },
    {
      "epoch": 6.499469552302143,
      "grad_norm": 0.8477048588205949,
      "learning_rate": 2.1772562942233167e-05,
      "loss": 0.927,
      "num_input_tokens_seen": 48200448128,
      "step": 61264
    },
    {
      "epoch": 6.499575641841714,
      "grad_norm": 1.0193394920855978,
      "learning_rate": 2.177187379022316e-05,
      "loss": 0.9558,
      "num_input_tokens_seen": 48201234944,
      "step": 61265
    },
    {
      "epoch": 6.499681731381286,
      "grad_norm": 0.919105449352369,
      "learning_rate": 2.1771184640707748e-05,
      "loss": 1.0113,
      "num_input_tokens_seen": 48202021712,
      "step": 61266
    },
    {
      "epoch": 6.499787820920857,
      "grad_norm": 0.7549583235453614,
      "learning_rate": 2.1770495493687472e-05,
      "loss": 1.0325,
      "num_input_tokens_seen": 48202808544,
      "step": 61267
    },
    {
      "epoch": 6.499893910460429,
      "grad_norm": 0.7567998282411843,
      "learning_rate": 2.1769806349162867e-05,
      "loss": 1.0171,
      "num_input_tokens_seen": 48203595392,
      "step": 61268
    },
    {
      "epoch": 6.5,
      "grad_norm": 0.7953889983689201,
      "learning_rate": 2.176911720713445e-05,
      "loss": 0.9827,
      "num_input_tokens_seen": 48204382192,
      "step": 61269
    },
    {
      "epoch": 6.500106089539571,
      "grad_norm": 0.9144652543412318,
      "learning_rate": 2.1768428067602777e-05,
      "loss": 1.0018,
      "num_input_tokens_seen": 48205168880,
      "step": 61270
    },
    {
      "epoch": 6.500212179079143,
      "grad_norm": 0.7611949533385922,
      "learning_rate": 2.176773893056836e-05,
      "loss": 1.1022,
      "num_input_tokens_seen": 48205955536,
      "step": 61271
    },
    {
      "epoch": 6.500318268618714,
      "grad_norm": 0.6975013651829965,
      "learning_rate": 2.1767049796031742e-05,
      "loss": 0.9498,
      "num_input_tokens_seen": 48206742384,
      "step": 61272
    },
    {
      "epoch": 6.500424358158286,
      "grad_norm": 0.9460737407791817,
      "learning_rate": 2.176636066399345e-05,
      "loss": 1.0578,
      "num_input_tokens_seen": 48207529200,
      "step": 61273
    },
    {
      "epoch": 6.500530447697857,
      "grad_norm": 0.9596720102683381,
      "learning_rate": 2.176567153445402e-05,
      "loss": 0.9928,
      "num_input_tokens_seen": 48208316080,
      "step": 61274
    },
    {
      "epoch": 6.500636537237428,
      "grad_norm": 0.8344484176084269,
      "learning_rate": 2.1764982407413988e-05,
      "loss": 0.9645,
      "num_input_tokens_seen": 48209102864,
      "step": 61275
    },
    {
      "epoch": 6.500742626777,
      "grad_norm": 0.9129573225539708,
      "learning_rate": 2.1764293282873885e-05,
      "loss": 1.1091,
      "num_input_tokens_seen": 48209889568,
      "step": 61276
    },
    {
      "epoch": 6.500848716316571,
      "grad_norm": 0.732113070647754,
      "learning_rate": 2.1763604160834234e-05,
      "loss": 0.9194,
      "num_input_tokens_seen": 48210676400,
      "step": 61277
    },
    {
      "epoch": 6.500954805856143,
      "grad_norm": 0.9552315463017238,
      "learning_rate": 2.176291504129558e-05,
      "loss": 1.1032,
      "num_input_tokens_seen": 48211463168,
      "step": 61278
    },
    {
      "epoch": 6.501060895395714,
      "grad_norm": 0.8618702381127032,
      "learning_rate": 2.176222592425845e-05,
      "loss": 1.0967,
      "num_input_tokens_seen": 48212249904,
      "step": 61279
    },
    {
      "epoch": 6.501166984935285,
      "grad_norm": 0.9754807342460156,
      "learning_rate": 2.1761536809723372e-05,
      "loss": 1.0366,
      "num_input_tokens_seen": 48213036656,
      "step": 61280
    },
    {
      "epoch": 6.501273074474857,
      "grad_norm": 0.8143192842610254,
      "learning_rate": 2.1760847697690886e-05,
      "loss": 0.9762,
      "num_input_tokens_seen": 48213823360,
      "step": 61281
    },
    {
      "epoch": 6.501379164014428,
      "grad_norm": 0.7814729602219715,
      "learning_rate": 2.1760158588161526e-05,
      "loss": 0.8459,
      "num_input_tokens_seen": 48214610128,
      "step": 61282
    },
    {
      "epoch": 6.501485253554,
      "grad_norm": 0.8422640697927836,
      "learning_rate": 2.175946948113581e-05,
      "loss": 1.0533,
      "num_input_tokens_seen": 48215396944,
      "step": 61283
    },
    {
      "epoch": 6.501591343093571,
      "grad_norm": 0.7180411818319244,
      "learning_rate": 2.1758780376614292e-05,
      "loss": 0.8841,
      "num_input_tokens_seen": 48216183744,
      "step": 61284
    },
    {
      "epoch": 6.501697432633143,
      "grad_norm": 0.8851046604948335,
      "learning_rate": 2.175809127459749e-05,
      "loss": 1.0033,
      "num_input_tokens_seen": 48216970512,
      "step": 61285
    },
    {
      "epoch": 6.501803522172714,
      "grad_norm": 0.7032872219985633,
      "learning_rate": 2.1757402175085933e-05,
      "loss": 0.9943,
      "num_input_tokens_seen": 48217757264,
      "step": 61286
    },
    {
      "epoch": 6.501909611712286,
      "grad_norm": 0.9672665644698338,
      "learning_rate": 2.175671307808017e-05,
      "loss": 0.9987,
      "num_input_tokens_seen": 48218543920,
      "step": 61287
    },
    {
      "epoch": 6.502015701251857,
      "grad_norm": 0.7105807744036807,
      "learning_rate": 2.1756023983580716e-05,
      "loss": 1.0449,
      "num_input_tokens_seen": 48219330720,
      "step": 61288
    },
    {
      "epoch": 6.502121790791428,
      "grad_norm": 0.6731448544340948,
      "learning_rate": 2.1755334891588118e-05,
      "loss": 1.0258,
      "num_input_tokens_seen": 48220117504,
      "step": 61289
    },
    {
      "epoch": 6.502227880331,
      "grad_norm": 0.8023724796958582,
      "learning_rate": 2.17546458021029e-05,
      "loss": 1.0233,
      "num_input_tokens_seen": 48220904176,
      "step": 61290
    },
    {
      "epoch": 6.502333969870571,
      "grad_norm": 0.9061028758223458,
      "learning_rate": 2.1753956715125596e-05,
      "loss": 1.0173,
      "num_input_tokens_seen": 48221691008,
      "step": 61291
    },
    {
      "epoch": 6.502440059410143,
      "grad_norm": 0.746844781766764,
      "learning_rate": 2.175326763065674e-05,
      "loss": 1.0372,
      "num_input_tokens_seen": 48222477776,
      "step": 61292
    },
    {
      "epoch": 6.502546148949714,
      "grad_norm": 0.7407326427975575,
      "learning_rate": 2.1752578548696863e-05,
      "loss": 0.9834,
      "num_input_tokens_seen": 48223264480,
      "step": 61293
    },
    {
      "epoch": 6.502652238489285,
      "grad_norm": 0.8596002688170336,
      "learning_rate": 2.1751889469246496e-05,
      "loss": 0.945,
      "num_input_tokens_seen": 48224051200,
      "step": 61294
    },
    {
      "epoch": 6.502758328028857,
      "grad_norm": 0.6508570599762479,
      "learning_rate": 2.1751200392306175e-05,
      "loss": 1.0066,
      "num_input_tokens_seen": 48224838000,
      "step": 61295
    },
    {
      "epoch": 6.502864417568428,
      "grad_norm": 0.7832694640479119,
      "learning_rate": 2.1750511317876433e-05,
      "loss": 0.9687,
      "num_input_tokens_seen": 48225624800,
      "step": 61296
    },
    {
      "epoch": 6.5029705071079995,
      "grad_norm": 0.7918038904604179,
      "learning_rate": 2.1749822245957795e-05,
      "loss": 0.977,
      "num_input_tokens_seen": 48226411536,
      "step": 61297
    },
    {
      "epoch": 6.5030765966475705,
      "grad_norm": 0.6787372031233398,
      "learning_rate": 2.1749133176550806e-05,
      "loss": 1.0396,
      "num_input_tokens_seen": 48227198176,
      "step": 61298
    },
    {
      "epoch": 6.503182686187142,
      "grad_norm": 0.8839711332268471,
      "learning_rate": 2.174844410965599e-05,
      "loss": 1.0335,
      "num_input_tokens_seen": 48227984976,
      "step": 61299
    },
    {
      "epoch": 6.5032887757267135,
      "grad_norm": 0.8139232606071328,
      "learning_rate": 2.1747755045273876e-05,
      "loss": 0.9893,
      "num_input_tokens_seen": 48228771760,
      "step": 61300
    },
    {
      "epoch": 6.5033948652662845,
      "grad_norm": 1.015312028565868,
      "learning_rate": 2.1747065983405006e-05,
      "loss": 0.9852,
      "num_input_tokens_seen": 48229558560,
      "step": 61301
    },
    {
      "epoch": 6.503500954805856,
      "grad_norm": 0.5755558481797614,
      "learning_rate": 2.174637692404991e-05,
      "loss": 0.9481,
      "num_input_tokens_seen": 48230345312,
      "step": 61302
    },
    {
      "epoch": 6.5036070443454275,
      "grad_norm": 1.106908417636248,
      "learning_rate": 2.1745687867209115e-05,
      "loss": 1.0284,
      "num_input_tokens_seen": 48231132128,
      "step": 61303
    },
    {
      "epoch": 6.5037131338849985,
      "grad_norm": 0.6500891251949592,
      "learning_rate": 2.1744998812883154e-05,
      "loss": 0.9716,
      "num_input_tokens_seen": 48231918848,
      "step": 61304
    },
    {
      "epoch": 6.50381922342457,
      "grad_norm": 0.727239044581072,
      "learning_rate": 2.1744309761072563e-05,
      "loss": 0.9612,
      "num_input_tokens_seen": 48232705632,
      "step": 61305
    },
    {
      "epoch": 6.5039253129641414,
      "grad_norm": 0.7632428487352216,
      "learning_rate": 2.174362071177788e-05,
      "loss": 0.9533,
      "num_input_tokens_seen": 48233492448,
      "step": 61306
    },
    {
      "epoch": 6.504031402503713,
      "grad_norm": 0.769630553384965,
      "learning_rate": 2.1742931664999627e-05,
      "loss": 1.0816,
      "num_input_tokens_seen": 48234279216,
      "step": 61307
    },
    {
      "epoch": 6.504137492043284,
      "grad_norm": 0.747167157825685,
      "learning_rate": 2.174224262073834e-05,
      "loss": 1.0389,
      "num_input_tokens_seen": 48235066064,
      "step": 61308
    },
    {
      "epoch": 6.504243581582856,
      "grad_norm": 0.6950525684223091,
      "learning_rate": 2.1741553578994555e-05,
      "loss": 0.9174,
      "num_input_tokens_seen": 48235852896,
      "step": 61309
    },
    {
      "epoch": 6.504349671122427,
      "grad_norm": 1.2351787279858395,
      "learning_rate": 2.1740864539768803e-05,
      "loss": 0.9951,
      "num_input_tokens_seen": 48236639728,
      "step": 61310
    },
    {
      "epoch": 6.504455760661998,
      "grad_norm": 0.883623614651924,
      "learning_rate": 2.174017550306161e-05,
      "loss": 0.9616,
      "num_input_tokens_seen": 48237426448,
      "step": 61311
    },
    {
      "epoch": 6.50456185020157,
      "grad_norm": 1.1609246508032622,
      "learning_rate": 2.173948646887352e-05,
      "loss": 0.9643,
      "num_input_tokens_seen": 48238213248,
      "step": 61312
    },
    {
      "epoch": 6.504667939741141,
      "grad_norm": 0.7694895609496943,
      "learning_rate": 2.1738797437205056e-05,
      "loss": 1.0463,
      "num_input_tokens_seen": 48239000000,
      "step": 61313
    },
    {
      "epoch": 6.504774029280713,
      "grad_norm": 0.9301862483520157,
      "learning_rate": 2.173810840805675e-05,
      "loss": 0.9833,
      "num_input_tokens_seen": 48239786784,
      "step": 61314
    },
    {
      "epoch": 6.504880118820284,
      "grad_norm": 1.087929215471607,
      "learning_rate": 2.1737419381429143e-05,
      "loss": 1.0545,
      "num_input_tokens_seen": 48240573632,
      "step": 61315
    },
    {
      "epoch": 6.504986208359856,
      "grad_norm": 0.6869428140884789,
      "learning_rate": 2.1736730357322753e-05,
      "loss": 0.9936,
      "num_input_tokens_seen": 48241360448,
      "step": 61316
    },
    {
      "epoch": 6.505092297899427,
      "grad_norm": 0.9481939876270465,
      "learning_rate": 2.1736041335738133e-05,
      "loss": 1.0048,
      "num_input_tokens_seen": 48242147136,
      "step": 61317
    },
    {
      "epoch": 6.505198387438998,
      "grad_norm": 0.946214226983603,
      "learning_rate": 2.1735352316675797e-05,
      "loss": 0.9473,
      "num_input_tokens_seen": 48242934048,
      "step": 61318
    },
    {
      "epoch": 6.50530447697857,
      "grad_norm": 0.8976894922331049,
      "learning_rate": 2.1734663300136292e-05,
      "loss": 0.9874,
      "num_input_tokens_seen": 48243720784,
      "step": 61319
    },
    {
      "epoch": 6.505410566518141,
      "grad_norm": 0.824077082986971,
      "learning_rate": 2.173397428612014e-05,
      "loss": 0.9892,
      "num_input_tokens_seen": 48244507600,
      "step": 61320
    },
    {
      "epoch": 6.505516656057713,
      "grad_norm": 0.9536994597334045,
      "learning_rate": 2.1733285274627878e-05,
      "loss": 0.9689,
      "num_input_tokens_seen": 48245294368,
      "step": 61321
    },
    {
      "epoch": 6.505622745597284,
      "grad_norm": 0.7193198455773782,
      "learning_rate": 2.1732596265660037e-05,
      "loss": 0.989,
      "num_input_tokens_seen": 48246081120,
      "step": 61322
    },
    {
      "epoch": 6.505728835136855,
      "grad_norm": 0.8667426389351914,
      "learning_rate": 2.173190725921715e-05,
      "loss": 0.9957,
      "num_input_tokens_seen": 48246867920,
      "step": 61323
    },
    {
      "epoch": 6.505834924676427,
      "grad_norm": 0.8524049599590527,
      "learning_rate": 2.1731218255299747e-05,
      "loss": 0.9498,
      "num_input_tokens_seen": 48247654640,
      "step": 61324
    },
    {
      "epoch": 6.505941014215998,
      "grad_norm": 0.8295465177852177,
      "learning_rate": 2.173052925390837e-05,
      "loss": 0.9165,
      "num_input_tokens_seen": 48248441456,
      "step": 61325
    },
    {
      "epoch": 6.50604710375557,
      "grad_norm": 0.7108571825862656,
      "learning_rate": 2.172984025504353e-05,
      "loss": 0.9684,
      "num_input_tokens_seen": 48249228304,
      "step": 61326
    },
    {
      "epoch": 6.506153193295141,
      "grad_norm": 1.0097170522229013,
      "learning_rate": 2.1729151258705788e-05,
      "loss": 0.9696,
      "num_input_tokens_seen": 48250015200,
      "step": 61327
    },
    {
      "epoch": 6.506259282834712,
      "grad_norm": 0.745287138124057,
      "learning_rate": 2.1728462264895656e-05,
      "loss": 1.0388,
      "num_input_tokens_seen": 48250801888,
      "step": 61328
    },
    {
      "epoch": 6.506365372374284,
      "grad_norm": 0.6556975082625788,
      "learning_rate": 2.1727773273613673e-05,
      "loss": 1.0399,
      "num_input_tokens_seen": 48251588704,
      "step": 61329
    },
    {
      "epoch": 6.506471461913855,
      "grad_norm": 0.8561580634062008,
      "learning_rate": 2.172708428486037e-05,
      "loss": 0.9846,
      "num_input_tokens_seen": 48252375536,
      "step": 61330
    },
    {
      "epoch": 6.506577551453427,
      "grad_norm": 0.8288385027723462,
      "learning_rate": 2.172639529863628e-05,
      "loss": 0.9687,
      "num_input_tokens_seen": 48253162256,
      "step": 61331
    },
    {
      "epoch": 6.506683640992998,
      "grad_norm": 0.7886494481278629,
      "learning_rate": 2.1725706314941935e-05,
      "loss": 1.048,
      "num_input_tokens_seen": 48253949072,
      "step": 61332
    },
    {
      "epoch": 6.506789730532569,
      "grad_norm": 0.6947601801015352,
      "learning_rate": 2.172501733377787e-05,
      "loss": 0.9877,
      "num_input_tokens_seen": 48254735840,
      "step": 61333
    },
    {
      "epoch": 6.506895820072141,
      "grad_norm": 0.9979894235447301,
      "learning_rate": 2.172432835514462e-05,
      "loss": 1.0788,
      "num_input_tokens_seen": 48255522528,
      "step": 61334
    },
    {
      "epoch": 6.507001909611712,
      "grad_norm": 0.6381806378710333,
      "learning_rate": 2.17236393790427e-05,
      "loss": 0.965,
      "num_input_tokens_seen": 48256309264,
      "step": 61335
    },
    {
      "epoch": 6.507107999151284,
      "grad_norm": 1.1236905555909422,
      "learning_rate": 2.1722950405472668e-05,
      "loss": 0.9894,
      "num_input_tokens_seen": 48257096080,
      "step": 61336
    },
    {
      "epoch": 6.507214088690855,
      "grad_norm": 0.8609298304543999,
      "learning_rate": 2.172226143443504e-05,
      "loss": 1.0755,
      "num_input_tokens_seen": 48257882800,
      "step": 61337
    },
    {
      "epoch": 6.507320178230427,
      "grad_norm": 1.2382392310987087,
      "learning_rate": 2.172157246593035e-05,
      "loss": 1.0717,
      "num_input_tokens_seen": 48258669568,
      "step": 61338
    },
    {
      "epoch": 6.507426267769998,
      "grad_norm": 0.7984006123904622,
      "learning_rate": 2.172088349995913e-05,
      "loss": 1.0158,
      "num_input_tokens_seen": 48259456288,
      "step": 61339
    },
    {
      "epoch": 6.507532357309569,
      "grad_norm": 0.7526438046397345,
      "learning_rate": 2.1720194536521924e-05,
      "loss": 1.0368,
      "num_input_tokens_seen": 48260243104,
      "step": 61340
    },
    {
      "epoch": 6.507638446849141,
      "grad_norm": 0.9607475816594614,
      "learning_rate": 2.171950557561925e-05,
      "loss": 0.9784,
      "num_input_tokens_seen": 48261029824,
      "step": 61341
    },
    {
      "epoch": 6.507744536388712,
      "grad_norm": 0.9307658045723081,
      "learning_rate": 2.1718816617251645e-05,
      "loss": 1.0118,
      "num_input_tokens_seen": 48261816624,
      "step": 61342
    },
    {
      "epoch": 6.507850625928284,
      "grad_norm": 0.9061168086258289,
      "learning_rate": 2.171812766141964e-05,
      "loss": 1.0359,
      "num_input_tokens_seen": 48262603328,
      "step": 61343
    },
    {
      "epoch": 6.507956715467855,
      "grad_norm": 0.7390190852259844,
      "learning_rate": 2.1717438708123776e-05,
      "loss": 0.9372,
      "num_input_tokens_seen": 48263390128,
      "step": 61344
    },
    {
      "epoch": 6.508062805007427,
      "grad_norm": 0.8910687502628347,
      "learning_rate": 2.1716749757364575e-05,
      "loss": 0.9916,
      "num_input_tokens_seen": 48264176848,
      "step": 61345
    },
    {
      "epoch": 6.508168894546998,
      "grad_norm": 0.7787223076170177,
      "learning_rate": 2.1716060809142573e-05,
      "loss": 0.9407,
      "num_input_tokens_seen": 48264963664,
      "step": 61346
    },
    {
      "epoch": 6.508274984086569,
      "grad_norm": 0.7473245545537415,
      "learning_rate": 2.1715371863458305e-05,
      "loss": 1.0092,
      "num_input_tokens_seen": 48265750496,
      "step": 61347
    },
    {
      "epoch": 6.508381073626141,
      "grad_norm": 1.155521094870644,
      "learning_rate": 2.17146829203123e-05,
      "loss": 0.9874,
      "num_input_tokens_seen": 48266537232,
      "step": 61348
    },
    {
      "epoch": 6.508487163165712,
      "grad_norm": 0.7758222270910045,
      "learning_rate": 2.171399397970509e-05,
      "loss": 0.9706,
      "num_input_tokens_seen": 48267324064,
      "step": 61349
    },
    {
      "epoch": 6.508593252705284,
      "grad_norm": 0.6454991848377789,
      "learning_rate": 2.1713305041637214e-05,
      "loss": 0.96,
      "num_input_tokens_seen": 48268110752,
      "step": 61350
    },
    {
      "epoch": 6.508699342244855,
      "grad_norm": 1.0814270101441021,
      "learning_rate": 2.17126161061092e-05,
      "loss": 0.9947,
      "num_input_tokens_seen": 48268897504,
      "step": 61351
    },
    {
      "epoch": 6.508805431784426,
      "grad_norm": 0.8153724840834292,
      "learning_rate": 2.1711927173121573e-05,
      "loss": 1.0365,
      "num_input_tokens_seen": 48269684384,
      "step": 61352
    },
    {
      "epoch": 6.508911521323998,
      "grad_norm": 0.9915873539868674,
      "learning_rate": 2.1711238242674875e-05,
      "loss": 0.9822,
      "num_input_tokens_seen": 48270471120,
      "step": 61353
    },
    {
      "epoch": 6.509017610863569,
      "grad_norm": 0.840792927694188,
      "learning_rate": 2.1710549314769636e-05,
      "loss": 1.0291,
      "num_input_tokens_seen": 48271257856,
      "step": 61354
    },
    {
      "epoch": 6.509123700403141,
      "grad_norm": 0.982307050391854,
      "learning_rate": 2.1709860389406387e-05,
      "loss": 1.0182,
      "num_input_tokens_seen": 48272044656,
      "step": 61355
    },
    {
      "epoch": 6.509229789942712,
      "grad_norm": 0.9892739380394514,
      "learning_rate": 2.1709171466585666e-05,
      "loss": 0.9974,
      "num_input_tokens_seen": 48272831376,
      "step": 61356
    },
    {
      "epoch": 6.509335879482283,
      "grad_norm": 1.0908084250204348,
      "learning_rate": 2.1708482546307992e-05,
      "loss": 1.0785,
      "num_input_tokens_seen": 48273618000,
      "step": 61357
    },
    {
      "epoch": 6.509441969021855,
      "grad_norm": 1.2878294075851284,
      "learning_rate": 2.1707793628573914e-05,
      "loss": 1.0084,
      "num_input_tokens_seen": 48274404736,
      "step": 61358
    },
    {
      "epoch": 6.509548058561426,
      "grad_norm": 0.7628279011591791,
      "learning_rate": 2.1707104713383954e-05,
      "loss": 0.9811,
      "num_input_tokens_seen": 48275191600,
      "step": 61359
    },
    {
      "epoch": 6.5096541481009975,
      "grad_norm": 1.0191665997143637,
      "learning_rate": 2.1706415800738643e-05,
      "loss": 0.9916,
      "num_input_tokens_seen": 48275978272,
      "step": 61360
    },
    {
      "epoch": 6.5097602376405685,
      "grad_norm": 0.7253721900865997,
      "learning_rate": 2.1705726890638524e-05,
      "loss": 0.9193,
      "num_input_tokens_seen": 48276765088,
      "step": 61361
    },
    {
      "epoch": 6.50986632718014,
      "grad_norm": 0.8355976115883872,
      "learning_rate": 2.170503798308412e-05,
      "loss": 0.9572,
      "num_input_tokens_seen": 48277551904,
      "step": 61362
    },
    {
      "epoch": 6.5099724167197115,
      "grad_norm": 0.881876562674537,
      "learning_rate": 2.1704349078075966e-05,
      "loss": 1.0927,
      "num_input_tokens_seen": 48278338592,
      "step": 61363
    },
    {
      "epoch": 6.5100785062592825,
      "grad_norm": 1.04052580621622,
      "learning_rate": 2.1703660175614593e-05,
      "loss": 0.9623,
      "num_input_tokens_seen": 48279125360,
      "step": 61364
    },
    {
      "epoch": 6.5101845957988544,
      "grad_norm": 0.8953084067321992,
      "learning_rate": 2.1702971275700537e-05,
      "loss": 0.9962,
      "num_input_tokens_seen": 48279912112,
      "step": 61365
    },
    {
      "epoch": 6.5102906853384255,
      "grad_norm": 0.7973094819931554,
      "learning_rate": 2.1702282378334325e-05,
      "loss": 1.0467,
      "num_input_tokens_seen": 48280698768,
      "step": 61366
    },
    {
      "epoch": 6.510396774877997,
      "grad_norm": 1.3344002280517082,
      "learning_rate": 2.1701593483516493e-05,
      "loss": 1.074,
      "num_input_tokens_seen": 48281485520,
      "step": 61367
    },
    {
      "epoch": 6.510502864417568,
      "grad_norm": 0.9454622078797401,
      "learning_rate": 2.170090459124758e-05,
      "loss": 1.0166,
      "num_input_tokens_seen": 48282272288,
      "step": 61368
    },
    {
      "epoch": 6.5106089539571395,
      "grad_norm": 0.7905931761080102,
      "learning_rate": 2.17002157015281e-05,
      "loss": 1.0043,
      "num_input_tokens_seen": 48283059104,
      "step": 61369
    },
    {
      "epoch": 6.510715043496711,
      "grad_norm": 0.969812712149395,
      "learning_rate": 2.16995268143586e-05,
      "loss": 0.9868,
      "num_input_tokens_seen": 48283845920,
      "step": 61370
    },
    {
      "epoch": 6.510821133036282,
      "grad_norm": 0.9526074357047734,
      "learning_rate": 2.1698837929739613e-05,
      "loss": 1.0311,
      "num_input_tokens_seen": 48284632656,
      "step": 61371
    },
    {
      "epoch": 6.510927222575854,
      "grad_norm": 0.8399836191590871,
      "learning_rate": 2.1698149047671664e-05,
      "loss": 0.9419,
      "num_input_tokens_seen": 48285419360,
      "step": 61372
    },
    {
      "epoch": 6.511033312115425,
      "grad_norm": 0.8103787837121714,
      "learning_rate": 2.169746016815529e-05,
      "loss": 1.0453,
      "num_input_tokens_seen": 48286206080,
      "step": 61373
    },
    {
      "epoch": 6.511139401654997,
      "grad_norm": 0.7485310376998511,
      "learning_rate": 2.1696771291191014e-05,
      "loss": 1.0382,
      "num_input_tokens_seen": 48286992848,
      "step": 61374
    },
    {
      "epoch": 6.511245491194568,
      "grad_norm": 0.7455810787087755,
      "learning_rate": 2.169608241677939e-05,
      "loss": 0.9914,
      "num_input_tokens_seen": 48287779536,
      "step": 61375
    },
    {
      "epoch": 6.511351580734139,
      "grad_norm": 0.8278955822674724,
      "learning_rate": 2.1695393544920927e-05,
      "loss": 1.0401,
      "num_input_tokens_seen": 48288566144,
      "step": 61376
    },
    {
      "epoch": 6.511457670273711,
      "grad_norm": 0.9348436848932657,
      "learning_rate": 2.1694704675616167e-05,
      "loss": 0.9771,
      "num_input_tokens_seen": 48289352912,
      "step": 61377
    },
    {
      "epoch": 6.511563759813282,
      "grad_norm": 1.0826815503937572,
      "learning_rate": 2.1694015808865646e-05,
      "loss": 0.9939,
      "num_input_tokens_seen": 48290139600,
      "step": 61378
    },
    {
      "epoch": 6.511669849352854,
      "grad_norm": 0.8265871353128882,
      "learning_rate": 2.1693326944669895e-05,
      "loss": 1.0285,
      "num_input_tokens_seen": 48290926320,
      "step": 61379
    },
    {
      "epoch": 6.511775938892425,
      "grad_norm": 0.7162870153932264,
      "learning_rate": 2.1692638083029436e-05,
      "loss": 1.0252,
      "num_input_tokens_seen": 48291713120,
      "step": 61380
    },
    {
      "epoch": 6.511882028431996,
      "grad_norm": 1.194707273995374,
      "learning_rate": 2.1691949223944817e-05,
      "loss": 1.134,
      "num_input_tokens_seen": 48292499856,
      "step": 61381
    },
    {
      "epoch": 6.511988117971568,
      "grad_norm": 0.8605234532609565,
      "learning_rate": 2.169126036741656e-05,
      "loss": 1.0001,
      "num_input_tokens_seen": 48293286608,
      "step": 61382
    },
    {
      "epoch": 6.512094207511139,
      "grad_norm": 0.8359506902863275,
      "learning_rate": 2.1690571513445195e-05,
      "loss": 1.0893,
      "num_input_tokens_seen": 48294073376,
      "step": 61383
    },
    {
      "epoch": 6.512200297050711,
      "grad_norm": 0.8678322287134818,
      "learning_rate": 2.1689882662031263e-05,
      "loss": 0.9575,
      "num_input_tokens_seen": 48294860176,
      "step": 61384
    },
    {
      "epoch": 6.512306386590282,
      "grad_norm": 0.7779193065825422,
      "learning_rate": 2.1689193813175295e-05,
      "loss": 1.0048,
      "num_input_tokens_seen": 48295646928,
      "step": 61385
    },
    {
      "epoch": 6.512412476129853,
      "grad_norm": 0.8433765126423617,
      "learning_rate": 2.1688504966877815e-05,
      "loss": 0.9848,
      "num_input_tokens_seen": 48296433760,
      "step": 61386
    },
    {
      "epoch": 6.512518565669425,
      "grad_norm": 0.704342455776841,
      "learning_rate": 2.168781612313937e-05,
      "loss": 0.9527,
      "num_input_tokens_seen": 48297220560,
      "step": 61387
    },
    {
      "epoch": 6.512624655208996,
      "grad_norm": 0.8612715538478076,
      "learning_rate": 2.1687127281960478e-05,
      "loss": 0.9803,
      "num_input_tokens_seen": 48298007232,
      "step": 61388
    },
    {
      "epoch": 6.512730744748568,
      "grad_norm": 0.9060900594836293,
      "learning_rate": 2.1686438443341676e-05,
      "loss": 0.9654,
      "num_input_tokens_seen": 48298794032,
      "step": 61389
    },
    {
      "epoch": 6.512836834288139,
      "grad_norm": 0.749208836359881,
      "learning_rate": 2.16857496072835e-05,
      "loss": 1.0604,
      "num_input_tokens_seen": 48299580720,
      "step": 61390
    },
    {
      "epoch": 6.51294292382771,
      "grad_norm": 0.7986120909473078,
      "learning_rate": 2.1685060773786472e-05,
      "loss": 0.9577,
      "num_input_tokens_seen": 48300367456,
      "step": 61391
    },
    {
      "epoch": 6.513049013367282,
      "grad_norm": 0.9191691632347491,
      "learning_rate": 2.168437194285114e-05,
      "loss": 1.0162,
      "num_input_tokens_seen": 48301154288,
      "step": 61392
    },
    {
      "epoch": 6.513155102906853,
      "grad_norm": 0.8632923053991342,
      "learning_rate": 2.1683683114478025e-05,
      "loss": 0.9477,
      "num_input_tokens_seen": 48301941088,
      "step": 61393
    },
    {
      "epoch": 6.513261192446425,
      "grad_norm": 0.7505031053325182,
      "learning_rate": 2.1682994288667662e-05,
      "loss": 1.0229,
      "num_input_tokens_seen": 48302727808,
      "step": 61394
    },
    {
      "epoch": 6.513367281985996,
      "grad_norm": 0.9204394769120806,
      "learning_rate": 2.1682305465420587e-05,
      "loss": 1.0637,
      "num_input_tokens_seen": 48303514496,
      "step": 61395
    },
    {
      "epoch": 6.513473371525568,
      "grad_norm": 0.7479277456415824,
      "learning_rate": 2.168161664473733e-05,
      "loss": 1.0063,
      "num_input_tokens_seen": 48304301280,
      "step": 61396
    },
    {
      "epoch": 6.513579461065139,
      "grad_norm": 0.7198787923170715,
      "learning_rate": 2.1680927826618415e-05,
      "loss": 1.024,
      "num_input_tokens_seen": 48305088000,
      "step": 61397
    },
    {
      "epoch": 6.51368555060471,
      "grad_norm": 0.8431564988704118,
      "learning_rate": 2.1680239011064384e-05,
      "loss": 1.0206,
      "num_input_tokens_seen": 48305874864,
      "step": 61398
    },
    {
      "epoch": 6.513791640144282,
      "grad_norm": 0.7393704200074482,
      "learning_rate": 2.1679550198075773e-05,
      "loss": 1.0298,
      "num_input_tokens_seen": 48306661712,
      "step": 61399
    },
    {
      "epoch": 6.513897729683853,
      "grad_norm": 0.8152175871359707,
      "learning_rate": 2.16788613876531e-05,
      "loss": 1.049,
      "num_input_tokens_seen": 48307448544,
      "step": 61400
    },
    {
      "epoch": 6.514003819223425,
      "grad_norm": 0.9463866823336946,
      "learning_rate": 2.167817257979691e-05,
      "loss": 1.0462,
      "num_input_tokens_seen": 48308235184,
      "step": 61401
    },
    {
      "epoch": 6.514109908762996,
      "grad_norm": 0.6906733839816221,
      "learning_rate": 2.1677483774507734e-05,
      "loss": 0.9613,
      "num_input_tokens_seen": 48309022000,
      "step": 61402
    },
    {
      "epoch": 6.514215998302568,
      "grad_norm": 0.7667900429772513,
      "learning_rate": 2.167679497178609e-05,
      "loss": 1.0663,
      "num_input_tokens_seen": 48309808736,
      "step": 61403
    },
    {
      "epoch": 6.514322087842139,
      "grad_norm": 0.7841845196455819,
      "learning_rate": 2.167610617163253e-05,
      "loss": 1.0555,
      "num_input_tokens_seen": 48310595408,
      "step": 61404
    },
    {
      "epoch": 6.51442817738171,
      "grad_norm": 1.5380913597355972,
      "learning_rate": 2.167541737404758e-05,
      "loss": 1.0882,
      "num_input_tokens_seen": 48311382224,
      "step": 61405
    },
    {
      "epoch": 6.514534266921282,
      "grad_norm": 0.8495833185850532,
      "learning_rate": 2.167472857903176e-05,
      "loss": 0.9759,
      "num_input_tokens_seen": 48312169008,
      "step": 61406
    },
    {
      "epoch": 6.514640356460853,
      "grad_norm": 0.7300066070321899,
      "learning_rate": 2.167403978658562e-05,
      "loss": 0.9345,
      "num_input_tokens_seen": 48312955712,
      "step": 61407
    },
    {
      "epoch": 6.514746446000425,
      "grad_norm": 0.7161107511910784,
      "learning_rate": 2.1673350996709678e-05,
      "loss": 0.9895,
      "num_input_tokens_seen": 48313742544,
      "step": 61408
    },
    {
      "epoch": 6.514852535539996,
      "grad_norm": 1.0470770043317823,
      "learning_rate": 2.167266220940448e-05,
      "loss": 1.0544,
      "num_input_tokens_seen": 48314529328,
      "step": 61409
    },
    {
      "epoch": 6.514958625079567,
      "grad_norm": 0.9433896263303213,
      "learning_rate": 2.1671973424670554e-05,
      "loss": 1.0241,
      "num_input_tokens_seen": 48315316096,
      "step": 61410
    },
    {
      "epoch": 6.515064714619139,
      "grad_norm": 1.206066661089458,
      "learning_rate": 2.1671284642508412e-05,
      "loss": 0.9278,
      "num_input_tokens_seen": 48316102864,
      "step": 61411
    },
    {
      "epoch": 6.51517080415871,
      "grad_norm": 1.2109529492852766,
      "learning_rate": 2.1670595862918615e-05,
      "loss": 0.9343,
      "num_input_tokens_seen": 48316889632,
      "step": 61412
    },
    {
      "epoch": 6.515276893698282,
      "grad_norm": 1.1058750101889006,
      "learning_rate": 2.1669907085901684e-05,
      "loss": 0.9871,
      "num_input_tokens_seen": 48317676384,
      "step": 61413
    },
    {
      "epoch": 6.515382983237853,
      "grad_norm": 0.841275823624533,
      "learning_rate": 2.166921831145815e-05,
      "loss": 1.0017,
      "num_input_tokens_seen": 48318463072,
      "step": 61414
    },
    {
      "epoch": 6.515489072777424,
      "grad_norm": 1.2559626073926116,
      "learning_rate": 2.1668529539588546e-05,
      "loss": 1.0029,
      "num_input_tokens_seen": 48319249968,
      "step": 61415
    },
    {
      "epoch": 6.515595162316996,
      "grad_norm": 1.3329844757409037,
      "learning_rate": 2.1667840770293408e-05,
      "loss": 1.0448,
      "num_input_tokens_seen": 48320036704,
      "step": 61416
    },
    {
      "epoch": 6.515701251856567,
      "grad_norm": 0.8955013693530242,
      "learning_rate": 2.1667152003573263e-05,
      "loss": 1.0279,
      "num_input_tokens_seen": 48320823488,
      "step": 61417
    },
    {
      "epoch": 6.515807341396139,
      "grad_norm": 1.1528212923461147,
      "learning_rate": 2.166646323942864e-05,
      "loss": 0.948,
      "num_input_tokens_seen": 48321610224,
      "step": 61418
    },
    {
      "epoch": 6.51591343093571,
      "grad_norm": 0.9009040650986825,
      "learning_rate": 2.1665774477860086e-05,
      "loss": 0.9927,
      "num_input_tokens_seen": 48322396992,
      "step": 61419
    },
    {
      "epoch": 6.516019520475281,
      "grad_norm": 0.9058026633825617,
      "learning_rate": 2.166508571886812e-05,
      "loss": 0.957,
      "num_input_tokens_seen": 48323183744,
      "step": 61420
    },
    {
      "epoch": 6.516125610014853,
      "grad_norm": 0.8690218505532782,
      "learning_rate": 2.1664396962453273e-05,
      "loss": 0.9557,
      "num_input_tokens_seen": 48323970432,
      "step": 61421
    },
    {
      "epoch": 6.516231699554424,
      "grad_norm": 0.824930608795983,
      "learning_rate": 2.1663708208616086e-05,
      "loss": 1.0165,
      "num_input_tokens_seen": 48324757200,
      "step": 61422
    },
    {
      "epoch": 6.5163377890939955,
      "grad_norm": 0.8347421832117681,
      "learning_rate": 2.166301945735709e-05,
      "loss": 1.0073,
      "num_input_tokens_seen": 48325543856,
      "step": 61423
    },
    {
      "epoch": 6.5164438786335666,
      "grad_norm": 0.7489558420384178,
      "learning_rate": 2.166233070867681e-05,
      "loss": 0.9127,
      "num_input_tokens_seen": 48326330640,
      "step": 61424
    },
    {
      "epoch": 6.5165499681731385,
      "grad_norm": 0.6372309646486911,
      "learning_rate": 2.1661641962575788e-05,
      "loss": 0.9395,
      "num_input_tokens_seen": 48327117520,
      "step": 61425
    },
    {
      "epoch": 6.5166560577127095,
      "grad_norm": 0.9260425523872915,
      "learning_rate": 2.166095321905455e-05,
      "loss": 1.0884,
      "num_input_tokens_seen": 48327904224,
      "step": 61426
    },
    {
      "epoch": 6.516762147252281,
      "grad_norm": 0.7927385451128247,
      "learning_rate": 2.1660264478113624e-05,
      "loss": 1.0224,
      "num_input_tokens_seen": 48328690880,
      "step": 61427
    },
    {
      "epoch": 6.5168682367918525,
      "grad_norm": 0.7239875227210577,
      "learning_rate": 2.165957573975355e-05,
      "loss": 0.9391,
      "num_input_tokens_seen": 48329477664,
      "step": 61428
    },
    {
      "epoch": 6.5169743263314235,
      "grad_norm": 0.7425757789447773,
      "learning_rate": 2.165888700397486e-05,
      "loss": 0.9467,
      "num_input_tokens_seen": 48330264544,
      "step": 61429
    },
    {
      "epoch": 6.517080415870995,
      "grad_norm": 0.6442057188324145,
      "learning_rate": 2.1658198270778083e-05,
      "loss": 0.9953,
      "num_input_tokens_seen": 48331051344,
      "step": 61430
    },
    {
      "epoch": 6.517186505410566,
      "grad_norm": 0.843817905455131,
      "learning_rate": 2.1657509540163754e-05,
      "loss": 1.0144,
      "num_input_tokens_seen": 48331838032,
      "step": 61431
    },
    {
      "epoch": 6.517292594950138,
      "grad_norm": 0.7476255935007625,
      "learning_rate": 2.16568208121324e-05,
      "loss": 1.092,
      "num_input_tokens_seen": 48332624752,
      "step": 61432
    },
    {
      "epoch": 6.517398684489709,
      "grad_norm": 1.2747548526622006,
      "learning_rate": 2.165613208668456e-05,
      "loss": 1.0218,
      "num_input_tokens_seen": 48333411520,
      "step": 61433
    },
    {
      "epoch": 6.51750477402928,
      "grad_norm": 0.6713298203967396,
      "learning_rate": 2.1655443363820763e-05,
      "loss": 1.0441,
      "num_input_tokens_seen": 48334198320,
      "step": 61434
    },
    {
      "epoch": 6.517610863568852,
      "grad_norm": 0.9327712014658948,
      "learning_rate": 2.1654754643541537e-05,
      "loss": 0.9209,
      "num_input_tokens_seen": 48334985088,
      "step": 61435
    },
    {
      "epoch": 6.517716953108423,
      "grad_norm": 0.7427147663015063,
      "learning_rate": 2.1654065925847422e-05,
      "loss": 1.0347,
      "num_input_tokens_seen": 48335771904,
      "step": 61436
    },
    {
      "epoch": 6.517823042647995,
      "grad_norm": 0.7151720994603149,
      "learning_rate": 2.1653377210738947e-05,
      "loss": 0.9633,
      "num_input_tokens_seen": 48336558640,
      "step": 61437
    },
    {
      "epoch": 6.517929132187566,
      "grad_norm": 0.9763532556020416,
      "learning_rate": 2.1652688498216642e-05,
      "loss": 1.0446,
      "num_input_tokens_seen": 48337345392,
      "step": 61438
    },
    {
      "epoch": 6.518035221727137,
      "grad_norm": 0.8131019379628261,
      "learning_rate": 2.1651999788281044e-05,
      "loss": 1.0067,
      "num_input_tokens_seen": 48338132144,
      "step": 61439
    },
    {
      "epoch": 6.518141311266709,
      "grad_norm": 0.9007349225973158,
      "learning_rate": 2.165131108093268e-05,
      "loss": 1.0369,
      "num_input_tokens_seen": 48338918864,
      "step": 61440
    },
    {
      "epoch": 6.51824740080628,
      "grad_norm": 0.8123271338837413,
      "learning_rate": 2.1650622376172085e-05,
      "loss": 0.9759,
      "num_input_tokens_seen": 48339705616,
      "step": 61441
    },
    {
      "epoch": 6.518353490345852,
      "grad_norm": 0.9811424151084633,
      "learning_rate": 2.164993367399979e-05,
      "loss": 1.1083,
      "num_input_tokens_seen": 48340492352,
      "step": 61442
    },
    {
      "epoch": 6.518459579885423,
      "grad_norm": 0.9685135549381719,
      "learning_rate": 2.164924497441633e-05,
      "loss": 1.0486,
      "num_input_tokens_seen": 48341279120,
      "step": 61443
    },
    {
      "epoch": 6.518565669424994,
      "grad_norm": 0.8872117699783992,
      "learning_rate": 2.1648556277422234e-05,
      "loss": 0.9704,
      "num_input_tokens_seen": 48342065872,
      "step": 61444
    },
    {
      "epoch": 6.518671758964566,
      "grad_norm": 0.8247504867966302,
      "learning_rate": 2.1647867583018032e-05,
      "loss": 1.0605,
      "num_input_tokens_seen": 48342852592,
      "step": 61445
    },
    {
      "epoch": 6.518777848504137,
      "grad_norm": 0.7645668791815794,
      "learning_rate": 2.164717889120426e-05,
      "loss": 1.0575,
      "num_input_tokens_seen": 48343639392,
      "step": 61446
    },
    {
      "epoch": 6.518883938043709,
      "grad_norm": 0.7161863237793418,
      "learning_rate": 2.1646490201981457e-05,
      "loss": 1.0483,
      "num_input_tokens_seen": 48344426224,
      "step": 61447
    },
    {
      "epoch": 6.51899002758328,
      "grad_norm": 0.7652176677958593,
      "learning_rate": 2.1645801515350144e-05,
      "loss": 1.0907,
      "num_input_tokens_seen": 48345213040,
      "step": 61448
    },
    {
      "epoch": 6.519096117122851,
      "grad_norm": 0.7688296418846936,
      "learning_rate": 2.1645112831310854e-05,
      "loss": 1.0477,
      "num_input_tokens_seen": 48345999792,
      "step": 61449
    },
    {
      "epoch": 6.519202206662423,
      "grad_norm": 0.8465936425055304,
      "learning_rate": 2.1644424149864124e-05,
      "loss": 1.0471,
      "num_input_tokens_seen": 48346786576,
      "step": 61450
    },
    {
      "epoch": 6.519308296201994,
      "grad_norm": 0.7334289086999161,
      "learning_rate": 2.164373547101049e-05,
      "loss": 1.0211,
      "num_input_tokens_seen": 48347573360,
      "step": 61451
    },
    {
      "epoch": 6.519414385741566,
      "grad_norm": 1.0380765033129868,
      "learning_rate": 2.164304679475047e-05,
      "loss": 1.022,
      "num_input_tokens_seen": 48348360096,
      "step": 61452
    },
    {
      "epoch": 6.519520475281137,
      "grad_norm": 0.8581351699008694,
      "learning_rate": 2.1642358121084613e-05,
      "loss": 0.9692,
      "num_input_tokens_seen": 48349146832,
      "step": 61453
    },
    {
      "epoch": 6.519626564820709,
      "grad_norm": 0.8771921542341946,
      "learning_rate": 2.164166945001344e-05,
      "loss": 1.0006,
      "num_input_tokens_seen": 48349933712,
      "step": 61454
    },
    {
      "epoch": 6.51973265436028,
      "grad_norm": 0.8022879305291637,
      "learning_rate": 2.1640980781537484e-05,
      "loss": 1.1379,
      "num_input_tokens_seen": 48350720416,
      "step": 61455
    },
    {
      "epoch": 6.519838743899852,
      "grad_norm": 0.870474459422893,
      "learning_rate": 2.1640292115657282e-05,
      "loss": 1.0532,
      "num_input_tokens_seen": 48351507216,
      "step": 61456
    },
    {
      "epoch": 6.519944833439423,
      "grad_norm": 0.7635222510459322,
      "learning_rate": 2.1639603452373365e-05,
      "loss": 1.0129,
      "num_input_tokens_seen": 48352293984,
      "step": 61457
    },
    {
      "epoch": 6.520050922978994,
      "grad_norm": 0.7114591028115823,
      "learning_rate": 2.163891479168626e-05,
      "loss": 0.9756,
      "num_input_tokens_seen": 48353080736,
      "step": 61458
    },
    {
      "epoch": 6.520157012518566,
      "grad_norm": 0.8901868380094186,
      "learning_rate": 2.1638226133596506e-05,
      "loss": 1.0765,
      "num_input_tokens_seen": 48353867504,
      "step": 61459
    },
    {
      "epoch": 6.520263102058137,
      "grad_norm": 0.9656495306977634,
      "learning_rate": 2.163753747810463e-05,
      "loss": 1.041,
      "num_input_tokens_seen": 48354654304,
      "step": 61460
    },
    {
      "epoch": 6.520369191597709,
      "grad_norm": 0.6926854890611551,
      "learning_rate": 2.1636848825211163e-05,
      "loss": 0.8974,
      "num_input_tokens_seen": 48355441088,
      "step": 61461
    },
    {
      "epoch": 6.52047528113728,
      "grad_norm": 0.7516576898660232,
      "learning_rate": 2.163616017491665e-05,
      "loss": 1.0444,
      "num_input_tokens_seen": 48356227888,
      "step": 61462
    },
    {
      "epoch": 6.520581370676851,
      "grad_norm": 0.6590993416825297,
      "learning_rate": 2.1635471527221605e-05,
      "loss": 1.0356,
      "num_input_tokens_seen": 48357014608,
      "step": 61463
    },
    {
      "epoch": 6.520687460216423,
      "grad_norm": 0.7078567365970556,
      "learning_rate": 2.1634782882126575e-05,
      "loss": 1.0225,
      "num_input_tokens_seen": 48357801440,
      "step": 61464
    },
    {
      "epoch": 6.520793549755994,
      "grad_norm": 0.6963545065519231,
      "learning_rate": 2.1634094239632086e-05,
      "loss": 1.0214,
      "num_input_tokens_seen": 48358588240,
      "step": 61465
    },
    {
      "epoch": 6.520899639295566,
      "grad_norm": 0.7819581814550306,
      "learning_rate": 2.1633405599738662e-05,
      "loss": 1.0162,
      "num_input_tokens_seen": 48359374912,
      "step": 61466
    },
    {
      "epoch": 6.521005728835137,
      "grad_norm": 0.7065790193293657,
      "learning_rate": 2.1632716962446852e-05,
      "loss": 1.0359,
      "num_input_tokens_seen": 48360161568,
      "step": 61467
    },
    {
      "epoch": 6.521111818374708,
      "grad_norm": 0.7404961690709497,
      "learning_rate": 2.163202832775718e-05,
      "loss": 1.045,
      "num_input_tokens_seen": 48360948336,
      "step": 61468
    },
    {
      "epoch": 6.52121790791428,
      "grad_norm": 0.8212675733783132,
      "learning_rate": 2.163133969567017e-05,
      "loss": 1.0284,
      "num_input_tokens_seen": 48361735136,
      "step": 61469
    },
    {
      "epoch": 6.521323997453851,
      "grad_norm": 0.7317603897861854,
      "learning_rate": 2.163065106618637e-05,
      "loss": 0.9775,
      "num_input_tokens_seen": 48362521808,
      "step": 61470
    },
    {
      "epoch": 6.521430086993423,
      "grad_norm": 0.7611891553842606,
      "learning_rate": 2.16299624393063e-05,
      "loss": 0.9687,
      "num_input_tokens_seen": 48363308528,
      "step": 61471
    },
    {
      "epoch": 6.521536176532994,
      "grad_norm": 0.6464190235433482,
      "learning_rate": 2.1629273815030493e-05,
      "loss": 0.9147,
      "num_input_tokens_seen": 48364095296,
      "step": 61472
    },
    {
      "epoch": 6.521642266072565,
      "grad_norm": 0.7833751753787865,
      "learning_rate": 2.162858519335949e-05,
      "loss": 0.9624,
      "num_input_tokens_seen": 48364882096,
      "step": 61473
    },
    {
      "epoch": 6.521748355612137,
      "grad_norm": 0.7002854476561684,
      "learning_rate": 2.1627896574293816e-05,
      "loss": 0.9651,
      "num_input_tokens_seen": 48365668848,
      "step": 61474
    },
    {
      "epoch": 6.521854445151708,
      "grad_norm": 0.8167884407058132,
      "learning_rate": 2.1627207957834e-05,
      "loss": 1.0451,
      "num_input_tokens_seen": 48366455568,
      "step": 61475
    },
    {
      "epoch": 6.52196053469128,
      "grad_norm": 0.8733020888126966,
      "learning_rate": 2.1626519343980584e-05,
      "loss": 0.9408,
      "num_input_tokens_seen": 48367242336,
      "step": 61476
    },
    {
      "epoch": 6.522066624230851,
      "grad_norm": 0.6513237857455232,
      "learning_rate": 2.162583073273409e-05,
      "loss": 0.9575,
      "num_input_tokens_seen": 48368029088,
      "step": 61477
    },
    {
      "epoch": 6.522172713770422,
      "grad_norm": 0.8669780160967375,
      "learning_rate": 2.162514212409506e-05,
      "loss": 0.9863,
      "num_input_tokens_seen": 48368815872,
      "step": 61478
    },
    {
      "epoch": 6.522278803309994,
      "grad_norm": 0.7562594830166642,
      "learning_rate": 2.1624453518064023e-05,
      "loss": 1.0091,
      "num_input_tokens_seen": 48369602688,
      "step": 61479
    },
    {
      "epoch": 6.522384892849565,
      "grad_norm": 0.9119137634027612,
      "learning_rate": 2.16237649146415e-05,
      "loss": 1.036,
      "num_input_tokens_seen": 48370389472,
      "step": 61480
    },
    {
      "epoch": 6.522490982389137,
      "grad_norm": 0.7650403471643132,
      "learning_rate": 2.1623076313828042e-05,
      "loss": 0.9502,
      "num_input_tokens_seen": 48371176336,
      "step": 61481
    },
    {
      "epoch": 6.522597071928708,
      "grad_norm": 0.8626455422731507,
      "learning_rate": 2.1622387715624167e-05,
      "loss": 1.0095,
      "num_input_tokens_seen": 48371963136,
      "step": 61482
    },
    {
      "epoch": 6.5227031614682796,
      "grad_norm": 0.7977877598237311,
      "learning_rate": 2.162169912003041e-05,
      "loss": 1.0003,
      "num_input_tokens_seen": 48372749920,
      "step": 61483
    },
    {
      "epoch": 6.522809251007851,
      "grad_norm": 0.5670717469892591,
      "learning_rate": 2.1621010527047308e-05,
      "loss": 0.9552,
      "num_input_tokens_seen": 48373536720,
      "step": 61484
    },
    {
      "epoch": 6.5229153405474225,
      "grad_norm": 0.7978752197411769,
      "learning_rate": 2.162032193667539e-05,
      "loss": 0.9864,
      "num_input_tokens_seen": 48374323504,
      "step": 61485
    },
    {
      "epoch": 6.5230214300869935,
      "grad_norm": 0.7032348952183826,
      "learning_rate": 2.1619633348915184e-05,
      "loss": 1.0313,
      "num_input_tokens_seen": 48375110208,
      "step": 61486
    },
    {
      "epoch": 6.523127519626565,
      "grad_norm": 0.6955673304286588,
      "learning_rate": 2.161894476376723e-05,
      "loss": 1.0739,
      "num_input_tokens_seen": 48375896976,
      "step": 61487
    },
    {
      "epoch": 6.5232336091661365,
      "grad_norm": 0.9242453438755837,
      "learning_rate": 2.161825618123206e-05,
      "loss": 1.0283,
      "num_input_tokens_seen": 48376683680,
      "step": 61488
    },
    {
      "epoch": 6.5233396987057075,
      "grad_norm": 0.810910178017881,
      "learning_rate": 2.1617567601310195e-05,
      "loss": 1.0171,
      "num_input_tokens_seen": 48377470400,
      "step": 61489
    },
    {
      "epoch": 6.523445788245279,
      "grad_norm": 0.8214103889284831,
      "learning_rate": 2.161687902400218e-05,
      "loss": 1.0639,
      "num_input_tokens_seen": 48378257152,
      "step": 61490
    },
    {
      "epoch": 6.5235518777848505,
      "grad_norm": 0.8364037878141442,
      "learning_rate": 2.161619044930854e-05,
      "loss": 0.9888,
      "num_input_tokens_seen": 48379043984,
      "step": 61491
    },
    {
      "epoch": 6.5236579673244215,
      "grad_norm": 0.7552693467487507,
      "learning_rate": 2.1615501877229803e-05,
      "loss": 1.064,
      "num_input_tokens_seen": 48379830768,
      "step": 61492
    },
    {
      "epoch": 6.523764056863993,
      "grad_norm": 1.004310459615567,
      "learning_rate": 2.1614813307766515e-05,
      "loss": 1.0567,
      "num_input_tokens_seen": 48380617504,
      "step": 61493
    },
    {
      "epoch": 6.523870146403564,
      "grad_norm": 1.0863122852879719,
      "learning_rate": 2.1614124740919193e-05,
      "loss": 1.0263,
      "num_input_tokens_seen": 48381404272,
      "step": 61494
    },
    {
      "epoch": 6.523976235943136,
      "grad_norm": 1.1435547674238487,
      "learning_rate": 2.161343617668838e-05,
      "loss": 1.0466,
      "num_input_tokens_seen": 48382191024,
      "step": 61495
    },
    {
      "epoch": 6.524082325482707,
      "grad_norm": 0.681557918854366,
      "learning_rate": 2.1612747615074607e-05,
      "loss": 1.046,
      "num_input_tokens_seen": 48382977776,
      "step": 61496
    },
    {
      "epoch": 6.524188415022278,
      "grad_norm": 1.0355695850154092,
      "learning_rate": 2.1612059056078396e-05,
      "loss": 1.0236,
      "num_input_tokens_seen": 48383764592,
      "step": 61497
    },
    {
      "epoch": 6.52429450456185,
      "grad_norm": 1.033278799863558,
      "learning_rate": 2.1611370499700293e-05,
      "loss": 1.0521,
      "num_input_tokens_seen": 48384551424,
      "step": 61498
    },
    {
      "epoch": 6.524400594101421,
      "grad_norm": 0.8349416880128636,
      "learning_rate": 2.1610681945940823e-05,
      "loss": 1.1232,
      "num_input_tokens_seen": 48385338192,
      "step": 61499
    },
    {
      "epoch": 6.524506683640993,
      "grad_norm": 1.0068693858444626,
      "learning_rate": 2.160999339480051e-05,
      "loss": 0.9871,
      "num_input_tokens_seen": 48386124944,
      "step": 61500
    },
    {
      "epoch": 6.524612773180564,
      "grad_norm": 1.213014380844604,
      "learning_rate": 2.1609304846279905e-05,
      "loss": 1.0348,
      "num_input_tokens_seen": 48386911680,
      "step": 61501
    },
    {
      "epoch": 6.524718862720135,
      "grad_norm": 0.7490711699640102,
      "learning_rate": 2.160861630037953e-05,
      "loss": 0.9655,
      "num_input_tokens_seen": 48387698480,
      "step": 61502
    },
    {
      "epoch": 6.524824952259707,
      "grad_norm": 0.9530056434577484,
      "learning_rate": 2.160792775709991e-05,
      "loss": 1.0351,
      "num_input_tokens_seen": 48388485184,
      "step": 61503
    },
    {
      "epoch": 6.524931041799278,
      "grad_norm": 0.8660010064859154,
      "learning_rate": 2.1607239216441586e-05,
      "loss": 0.9438,
      "num_input_tokens_seen": 48389271888,
      "step": 61504
    },
    {
      "epoch": 6.52503713133885,
      "grad_norm": 0.6894827615981203,
      "learning_rate": 2.160655067840509e-05,
      "loss": 1.0709,
      "num_input_tokens_seen": 48390058640,
      "step": 61505
    },
    {
      "epoch": 6.525143220878421,
      "grad_norm": 0.8322900501785281,
      "learning_rate": 2.1605862142990947e-05,
      "loss": 0.9899,
      "num_input_tokens_seen": 48390845424,
      "step": 61506
    },
    {
      "epoch": 6.525249310417993,
      "grad_norm": 0.8195091771752995,
      "learning_rate": 2.160517361019969e-05,
      "loss": 0.9763,
      "num_input_tokens_seen": 48391632288,
      "step": 61507
    },
    {
      "epoch": 6.525355399957564,
      "grad_norm": 0.7256305789390279,
      "learning_rate": 2.1604485080031862e-05,
      "loss": 0.9845,
      "num_input_tokens_seen": 48392419040,
      "step": 61508
    },
    {
      "epoch": 6.525461489497135,
      "grad_norm": 0.8999377576957711,
      "learning_rate": 2.1603796552487994e-05,
      "loss": 0.9388,
      "num_input_tokens_seen": 48393205920,
      "step": 61509
    },
    {
      "epoch": 6.525567579036707,
      "grad_norm": 0.8318457361887213,
      "learning_rate": 2.1603108027568603e-05,
      "loss": 1.0569,
      "num_input_tokens_seen": 48393992640,
      "step": 61510
    },
    {
      "epoch": 6.525673668576278,
      "grad_norm": 0.7142626585097055,
      "learning_rate": 2.1602419505274235e-05,
      "loss": 1.0292,
      "num_input_tokens_seen": 48394779392,
      "step": 61511
    },
    {
      "epoch": 6.52577975811585,
      "grad_norm": 0.8813041929391576,
      "learning_rate": 2.160173098560542e-05,
      "loss": 1.0784,
      "num_input_tokens_seen": 48395566192,
      "step": 61512
    },
    {
      "epoch": 6.525885847655421,
      "grad_norm": 0.8537370937962182,
      "learning_rate": 2.1601042468562682e-05,
      "loss": 1.0258,
      "num_input_tokens_seen": 48396352960,
      "step": 61513
    },
    {
      "epoch": 6.525991937194993,
      "grad_norm": 0.6733286708847465,
      "learning_rate": 2.1600353954146564e-05,
      "loss": 0.9819,
      "num_input_tokens_seen": 48397139664,
      "step": 61514
    },
    {
      "epoch": 6.526098026734564,
      "grad_norm": 0.8385916460987831,
      "learning_rate": 2.1599665442357587e-05,
      "loss": 1.0112,
      "num_input_tokens_seen": 48397926288,
      "step": 61515
    },
    {
      "epoch": 6.526204116274135,
      "grad_norm": 0.6530658071375022,
      "learning_rate": 2.1598976933196295e-05,
      "loss": 0.9288,
      "num_input_tokens_seen": 48398713024,
      "step": 61516
    },
    {
      "epoch": 6.526310205813707,
      "grad_norm": 0.7090180511118145,
      "learning_rate": 2.159828842666321e-05,
      "loss": 1.0373,
      "num_input_tokens_seen": 48399499856,
      "step": 61517
    },
    {
      "epoch": 6.526416295353278,
      "grad_norm": 0.7076227887146266,
      "learning_rate": 2.1597599922758867e-05,
      "loss": 0.9782,
      "num_input_tokens_seen": 48400286656,
      "step": 61518
    },
    {
      "epoch": 6.52652238489285,
      "grad_norm": 0.8354031203299495,
      "learning_rate": 2.1596911421483805e-05,
      "loss": 1.0297,
      "num_input_tokens_seen": 48401073408,
      "step": 61519
    },
    {
      "epoch": 6.526628474432421,
      "grad_norm": 0.6784738620440793,
      "learning_rate": 2.1596222922838546e-05,
      "loss": 1.0633,
      "num_input_tokens_seen": 48401860240,
      "step": 61520
    },
    {
      "epoch": 6.526734563971992,
      "grad_norm": 0.9079433684775869,
      "learning_rate": 2.1595534426823622e-05,
      "loss": 1.0647,
      "num_input_tokens_seen": 48402646960,
      "step": 61521
    },
    {
      "epoch": 6.526840653511564,
      "grad_norm": 0.7256182449924582,
      "learning_rate": 2.1594845933439576e-05,
      "loss": 1.0995,
      "num_input_tokens_seen": 48403433664,
      "step": 61522
    },
    {
      "epoch": 6.526946743051135,
      "grad_norm": 0.717841973277079,
      "learning_rate": 2.159415744268693e-05,
      "loss": 1.0249,
      "num_input_tokens_seen": 48404220336,
      "step": 61523
    },
    {
      "epoch": 6.527052832590707,
      "grad_norm": 0.7172326319599223,
      "learning_rate": 2.1593468954566218e-05,
      "loss": 0.9936,
      "num_input_tokens_seen": 48405007056,
      "step": 61524
    },
    {
      "epoch": 6.527158922130278,
      "grad_norm": 0.8130981192344664,
      "learning_rate": 2.1592780469077976e-05,
      "loss": 1.0624,
      "num_input_tokens_seen": 48405793872,
      "step": 61525
    },
    {
      "epoch": 6.527265011669849,
      "grad_norm": 0.6429758592740004,
      "learning_rate": 2.1592091986222736e-05,
      "loss": 1.0046,
      "num_input_tokens_seen": 48406580576,
      "step": 61526
    },
    {
      "epoch": 6.527371101209421,
      "grad_norm": 0.7030352692890103,
      "learning_rate": 2.159140350600102e-05,
      "loss": 0.9657,
      "num_input_tokens_seen": 48407367360,
      "step": 61527
    },
    {
      "epoch": 6.527477190748992,
      "grad_norm": 0.6782493940472343,
      "learning_rate": 2.159071502841337e-05,
      "loss": 0.9747,
      "num_input_tokens_seen": 48408154176,
      "step": 61528
    },
    {
      "epoch": 6.527583280288564,
      "grad_norm": 0.6846107749232649,
      "learning_rate": 2.159002655346032e-05,
      "loss": 0.9181,
      "num_input_tokens_seen": 48408941008,
      "step": 61529
    },
    {
      "epoch": 6.527689369828135,
      "grad_norm": 0.7497442368661008,
      "learning_rate": 2.158933808114239e-05,
      "loss": 0.9843,
      "num_input_tokens_seen": 48409727760,
      "step": 61530
    },
    {
      "epoch": 6.527795459367706,
      "grad_norm": 0.8254546561161814,
      "learning_rate": 2.158864961146012e-05,
      "loss": 1.1487,
      "num_input_tokens_seen": 48410514576,
      "step": 61531
    },
    {
      "epoch": 6.527901548907278,
      "grad_norm": 0.6949604363766194,
      "learning_rate": 2.1587961144414043e-05,
      "loss": 1.002,
      "num_input_tokens_seen": 48411301424,
      "step": 61532
    },
    {
      "epoch": 6.528007638446849,
      "grad_norm": 0.666584445134808,
      "learning_rate": 2.1587272680004693e-05,
      "loss": 0.8983,
      "num_input_tokens_seen": 48412088208,
      "step": 61533
    },
    {
      "epoch": 6.528113727986421,
      "grad_norm": 0.60332607436482,
      "learning_rate": 2.1586584218232598e-05,
      "loss": 1.0041,
      "num_input_tokens_seen": 48412874992,
      "step": 61534
    },
    {
      "epoch": 6.528219817525992,
      "grad_norm": 0.6016323125672511,
      "learning_rate": 2.1585895759098285e-05,
      "loss": 0.9437,
      "num_input_tokens_seen": 48413661808,
      "step": 61535
    },
    {
      "epoch": 6.528325907065564,
      "grad_norm": 0.7813791054886055,
      "learning_rate": 2.1585207302602297e-05,
      "loss": 1.0042,
      "num_input_tokens_seen": 48414448496,
      "step": 61536
    },
    {
      "epoch": 6.528431996605135,
      "grad_norm": 0.6698989350707119,
      "learning_rate": 2.1584518848745162e-05,
      "loss": 1.0419,
      "num_input_tokens_seen": 48415235168,
      "step": 61537
    },
    {
      "epoch": 6.528538086144706,
      "grad_norm": 0.9609439155067668,
      "learning_rate": 2.1583830397527406e-05,
      "loss": 0.9872,
      "num_input_tokens_seen": 48416022000,
      "step": 61538
    },
    {
      "epoch": 6.528644175684278,
      "grad_norm": 0.7944453226929861,
      "learning_rate": 2.1583141948949566e-05,
      "loss": 1.0349,
      "num_input_tokens_seen": 48416808800,
      "step": 61539
    },
    {
      "epoch": 6.528750265223849,
      "grad_norm": 0.7133982621049197,
      "learning_rate": 2.158245350301218e-05,
      "loss": 0.9902,
      "num_input_tokens_seen": 48417595504,
      "step": 61540
    },
    {
      "epoch": 6.528856354763421,
      "grad_norm": 0.7787398394165733,
      "learning_rate": 2.1581765059715763e-05,
      "loss": 1.0382,
      "num_input_tokens_seen": 48418382272,
      "step": 61541
    },
    {
      "epoch": 6.528962444302992,
      "grad_norm": 0.6817998743501332,
      "learning_rate": 2.1581076619060867e-05,
      "loss": 1.1015,
      "num_input_tokens_seen": 48419169008,
      "step": 61542
    },
    {
      "epoch": 6.529068533842564,
      "grad_norm": 0.804335183366578,
      "learning_rate": 2.1580388181048012e-05,
      "loss": 1.0631,
      "num_input_tokens_seen": 48419955728,
      "step": 61543
    },
    {
      "epoch": 6.529174623382135,
      "grad_norm": 0.7718236409937267,
      "learning_rate": 2.1579699745677727e-05,
      "loss": 1.0175,
      "num_input_tokens_seen": 48420742512,
      "step": 61544
    },
    {
      "epoch": 6.529280712921706,
      "grad_norm": 0.8519872822871565,
      "learning_rate": 2.1579011312950557e-05,
      "loss": 1.0445,
      "num_input_tokens_seen": 48421529216,
      "step": 61545
    },
    {
      "epoch": 6.529386802461278,
      "grad_norm": 0.7198178928059404,
      "learning_rate": 2.1578322882867025e-05,
      "loss": 0.9936,
      "num_input_tokens_seen": 48422316064,
      "step": 61546
    },
    {
      "epoch": 6.529492892000849,
      "grad_norm": 0.7195678956331825,
      "learning_rate": 2.1577634455427662e-05,
      "loss": 0.9575,
      "num_input_tokens_seen": 48423102896,
      "step": 61547
    },
    {
      "epoch": 6.5295989815404205,
      "grad_norm": 0.9907724412017422,
      "learning_rate": 2.1576946030633007e-05,
      "loss": 0.9969,
      "num_input_tokens_seen": 48423889664,
      "step": 61548
    },
    {
      "epoch": 6.5297050710799915,
      "grad_norm": 0.7888132284306646,
      "learning_rate": 2.157625760848358e-05,
      "loss": 1.01,
      "num_input_tokens_seen": 48424676416,
      "step": 61549
    },
    {
      "epoch": 6.529811160619563,
      "grad_norm": 0.7959601292372734,
      "learning_rate": 2.1575569188979928e-05,
      "loss": 0.9248,
      "num_input_tokens_seen": 48425463216,
      "step": 61550
    },
    {
      "epoch": 6.5299172501591345,
      "grad_norm": 0.8608344132372437,
      "learning_rate": 2.1574880772122574e-05,
      "loss": 0.967,
      "num_input_tokens_seen": 48426250032,
      "step": 61551
    },
    {
      "epoch": 6.5300233396987055,
      "grad_norm": 0.7641795485653748,
      "learning_rate": 2.157419235791205e-05,
      "loss": 0.99,
      "num_input_tokens_seen": 48427036704,
      "step": 61552
    },
    {
      "epoch": 6.530129429238277,
      "grad_norm": 0.8732304220386288,
      "learning_rate": 2.1573503946348893e-05,
      "loss": 0.9573,
      "num_input_tokens_seen": 48427823424,
      "step": 61553
    },
    {
      "epoch": 6.5302355187778485,
      "grad_norm": 0.7305866523576743,
      "learning_rate": 2.157281553743363e-05,
      "loss": 0.9777,
      "num_input_tokens_seen": 48428610144,
      "step": 61554
    },
    {
      "epoch": 6.5303416083174195,
      "grad_norm": 0.9331031615573154,
      "learning_rate": 2.1572127131166793e-05,
      "loss": 1.0775,
      "num_input_tokens_seen": 48429396912,
      "step": 61555
    },
    {
      "epoch": 6.530447697856991,
      "grad_norm": 0.7880720992332859,
      "learning_rate": 2.1571438727548917e-05,
      "loss": 1.0031,
      "num_input_tokens_seen": 48430183600,
      "step": 61556
    },
    {
      "epoch": 6.5305537873965624,
      "grad_norm": 0.6849794964327699,
      "learning_rate": 2.1570750326580532e-05,
      "loss": 0.9606,
      "num_input_tokens_seen": 48430970448,
      "step": 61557
    },
    {
      "epoch": 6.530659876936134,
      "grad_norm": 0.6823678466367222,
      "learning_rate": 2.1570061928262166e-05,
      "loss": 0.9728,
      "num_input_tokens_seen": 48431757184,
      "step": 61558
    },
    {
      "epoch": 6.530765966475705,
      "grad_norm": 0.7195402493854552,
      "learning_rate": 2.1569373532594365e-05,
      "loss": 1.0067,
      "num_input_tokens_seen": 48432544000,
      "step": 61559
    },
    {
      "epoch": 6.530872056015276,
      "grad_norm": 0.7470687525218214,
      "learning_rate": 2.1568685139577648e-05,
      "loss": 0.9809,
      "num_input_tokens_seen": 48433330816,
      "step": 61560
    },
    {
      "epoch": 6.530978145554848,
      "grad_norm": 0.8201223913926537,
      "learning_rate": 2.1567996749212544e-05,
      "loss": 1.0581,
      "num_input_tokens_seen": 48434117520,
      "step": 61561
    },
    {
      "epoch": 6.531084235094419,
      "grad_norm": 0.8558318471370059,
      "learning_rate": 2.15673083614996e-05,
      "loss": 0.9898,
      "num_input_tokens_seen": 48434904208,
      "step": 61562
    },
    {
      "epoch": 6.531190324633991,
      "grad_norm": 0.8511979747429361,
      "learning_rate": 2.156661997643933e-05,
      "loss": 1.0439,
      "num_input_tokens_seen": 48435690976,
      "step": 61563
    },
    {
      "epoch": 6.531296414173562,
      "grad_norm": 1.1105508598709535,
      "learning_rate": 2.1565931594032284e-05,
      "loss": 1.0433,
      "num_input_tokens_seen": 48436477728,
      "step": 61564
    },
    {
      "epoch": 6.531402503713134,
      "grad_norm": 0.6889194817184838,
      "learning_rate": 2.1565243214278986e-05,
      "loss": 1.0461,
      "num_input_tokens_seen": 48437264496,
      "step": 61565
    },
    {
      "epoch": 6.531508593252705,
      "grad_norm": 0.800037724465551,
      "learning_rate": 2.1564554837179956e-05,
      "loss": 0.9727,
      "num_input_tokens_seen": 48438051168,
      "step": 61566
    },
    {
      "epoch": 6.531614682792276,
      "grad_norm": 0.779206158450666,
      "learning_rate": 2.1563866462735748e-05,
      "loss": 1.0214,
      "num_input_tokens_seen": 48438837872,
      "step": 61567
    },
    {
      "epoch": 6.531720772331848,
      "grad_norm": 0.9153768530527686,
      "learning_rate": 2.1563178090946883e-05,
      "loss": 1.0209,
      "num_input_tokens_seen": 48439624560,
      "step": 61568
    },
    {
      "epoch": 6.531826861871419,
      "grad_norm": 0.8487447417327749,
      "learning_rate": 2.1562489721813887e-05,
      "loss": 0.9699,
      "num_input_tokens_seen": 48440411312,
      "step": 61569
    },
    {
      "epoch": 6.531932951410991,
      "grad_norm": 0.9688559441863873,
      "learning_rate": 2.15618013553373e-05,
      "loss": 1.0502,
      "num_input_tokens_seen": 48441198032,
      "step": 61570
    },
    {
      "epoch": 6.532039040950562,
      "grad_norm": 0.7340134360292455,
      "learning_rate": 2.1561112991517658e-05,
      "loss": 1.0139,
      "num_input_tokens_seen": 48441984832,
      "step": 61571
    },
    {
      "epoch": 6.532145130490134,
      "grad_norm": 0.6997795658160274,
      "learning_rate": 2.156042463035548e-05,
      "loss": 0.9736,
      "num_input_tokens_seen": 48442771600,
      "step": 61572
    },
    {
      "epoch": 6.532251220029705,
      "grad_norm": 0.8397496528903098,
      "learning_rate": 2.155973627185131e-05,
      "loss": 1.0144,
      "num_input_tokens_seen": 48443558320,
      "step": 61573
    },
    {
      "epoch": 6.532357309569276,
      "grad_norm": 0.8994176486197946,
      "learning_rate": 2.155904791600567e-05,
      "loss": 1.0363,
      "num_input_tokens_seen": 48444344976,
      "step": 61574
    },
    {
      "epoch": 6.532463399108848,
      "grad_norm": 0.864623690889197,
      "learning_rate": 2.1558359562819097e-05,
      "loss": 1.0728,
      "num_input_tokens_seen": 48445131696,
      "step": 61575
    },
    {
      "epoch": 6.532569488648419,
      "grad_norm": 0.9099917013290586,
      "learning_rate": 2.1557671212292124e-05,
      "loss": 0.993,
      "num_input_tokens_seen": 48445918464,
      "step": 61576
    },
    {
      "epoch": 6.532675578187991,
      "grad_norm": 0.7397979072889279,
      "learning_rate": 2.1556982864425286e-05,
      "loss": 0.9729,
      "num_input_tokens_seen": 48446705232,
      "step": 61577
    },
    {
      "epoch": 6.532781667727562,
      "grad_norm": 0.6312990841193229,
      "learning_rate": 2.1556294519219104e-05,
      "loss": 0.9426,
      "num_input_tokens_seen": 48447491984,
      "step": 61578
    },
    {
      "epoch": 6.532887757267133,
      "grad_norm": 0.9568108136366089,
      "learning_rate": 2.155560617667412e-05,
      "loss": 1.0005,
      "num_input_tokens_seen": 48448278784,
      "step": 61579
    },
    {
      "epoch": 6.532993846806705,
      "grad_norm": 0.7783050395189994,
      "learning_rate": 2.1554917836790858e-05,
      "loss": 1.0113,
      "num_input_tokens_seen": 48449065632,
      "step": 61580
    },
    {
      "epoch": 6.533099936346276,
      "grad_norm": 0.8565699556678932,
      "learning_rate": 2.155422949956986e-05,
      "loss": 0.9539,
      "num_input_tokens_seen": 48449852368,
      "step": 61581
    },
    {
      "epoch": 6.533206025885848,
      "grad_norm": 0.803169276848977,
      "learning_rate": 2.1553541165011652e-05,
      "loss": 1.0628,
      "num_input_tokens_seen": 48450639056,
      "step": 61582
    },
    {
      "epoch": 6.533312115425419,
      "grad_norm": 0.8324015467610332,
      "learning_rate": 2.1552852833116762e-05,
      "loss": 1.0223,
      "num_input_tokens_seen": 48451425808,
      "step": 61583
    },
    {
      "epoch": 6.53341820496499,
      "grad_norm": 0.6265427145992609,
      "learning_rate": 2.1552164503885733e-05,
      "loss": 1.0891,
      "num_input_tokens_seen": 48452212496,
      "step": 61584
    },
    {
      "epoch": 6.533524294504562,
      "grad_norm": 1.0831502199896923,
      "learning_rate": 2.155147617731909e-05,
      "loss": 1.0026,
      "num_input_tokens_seen": 48452999296,
      "step": 61585
    },
    {
      "epoch": 6.533630384044133,
      "grad_norm": 0.975797495645819,
      "learning_rate": 2.1550787853417358e-05,
      "loss": 1.0449,
      "num_input_tokens_seen": 48453785968,
      "step": 61586
    },
    {
      "epoch": 6.533736473583705,
      "grad_norm": 0.8702557302373256,
      "learning_rate": 2.155009953218108e-05,
      "loss": 1.0033,
      "num_input_tokens_seen": 48454572752,
      "step": 61587
    },
    {
      "epoch": 6.533842563123276,
      "grad_norm": 0.8747740592353729,
      "learning_rate": 2.1549411213610783e-05,
      "loss": 0.9947,
      "num_input_tokens_seen": 48455359440,
      "step": 61588
    },
    {
      "epoch": 6.533948652662847,
      "grad_norm": 0.848663415346505,
      "learning_rate": 2.1548722897706998e-05,
      "loss": 1.0514,
      "num_input_tokens_seen": 48456146160,
      "step": 61589
    },
    {
      "epoch": 6.534054742202419,
      "grad_norm": 0.8301621611839411,
      "learning_rate": 2.154803458447026e-05,
      "loss": 0.9294,
      "num_input_tokens_seen": 48456932896,
      "step": 61590
    },
    {
      "epoch": 6.53416083174199,
      "grad_norm": 1.1237185845325675,
      "learning_rate": 2.1547346273901102e-05,
      "loss": 1.0714,
      "num_input_tokens_seen": 48457719728,
      "step": 61591
    },
    {
      "epoch": 6.534266921281562,
      "grad_norm": 0.6437030230970637,
      "learning_rate": 2.154665796600005e-05,
      "loss": 0.9763,
      "num_input_tokens_seen": 48458506528,
      "step": 61592
    },
    {
      "epoch": 6.534373010821133,
      "grad_norm": 0.7092194178358425,
      "learning_rate": 2.1545969660767643e-05,
      "loss": 0.9064,
      "num_input_tokens_seen": 48459293296,
      "step": 61593
    },
    {
      "epoch": 6.534479100360705,
      "grad_norm": 0.768830800858687,
      "learning_rate": 2.154528135820441e-05,
      "loss": 1.0719,
      "num_input_tokens_seen": 48460080016,
      "step": 61594
    },
    {
      "epoch": 6.534585189900276,
      "grad_norm": 0.7839838012961413,
      "learning_rate": 2.1544593058310874e-05,
      "loss": 0.9347,
      "num_input_tokens_seen": 48460866816,
      "step": 61595
    },
    {
      "epoch": 6.534691279439847,
      "grad_norm": 0.7414995897142784,
      "learning_rate": 2.1543904761087584e-05,
      "loss": 0.9759,
      "num_input_tokens_seen": 48461653552,
      "step": 61596
    },
    {
      "epoch": 6.534797368979419,
      "grad_norm": 0.7233930562640914,
      "learning_rate": 2.1543216466535056e-05,
      "loss": 1.1228,
      "num_input_tokens_seen": 48462440240,
      "step": 61597
    },
    {
      "epoch": 6.53490345851899,
      "grad_norm": 0.9030782792991829,
      "learning_rate": 2.1542528174653832e-05,
      "loss": 0.976,
      "num_input_tokens_seen": 48463227056,
      "step": 61598
    },
    {
      "epoch": 6.535009548058562,
      "grad_norm": 0.6556521773173658,
      "learning_rate": 2.1541839885444442e-05,
      "loss": 0.9684,
      "num_input_tokens_seen": 48464013792,
      "step": 61599
    },
    {
      "epoch": 6.535115637598133,
      "grad_norm": 0.8204580187163429,
      "learning_rate": 2.1541151598907414e-05,
      "loss": 0.981,
      "num_input_tokens_seen": 48464800496,
      "step": 61600
    },
    {
      "epoch": 6.535221727137705,
      "grad_norm": 0.7220095928634294,
      "learning_rate": 2.1540463315043287e-05,
      "loss": 0.9735,
      "num_input_tokens_seen": 48465587344,
      "step": 61601
    },
    {
      "epoch": 6.535327816677276,
      "grad_norm": 0.7793806726595863,
      "learning_rate": 2.1539775033852578e-05,
      "loss": 0.9809,
      "num_input_tokens_seen": 48466374048,
      "step": 61602
    },
    {
      "epoch": 6.535433906216847,
      "grad_norm": 0.6917815756475484,
      "learning_rate": 2.1539086755335837e-05,
      "loss": 1.0479,
      "num_input_tokens_seen": 48467160768,
      "step": 61603
    },
    {
      "epoch": 6.535539995756419,
      "grad_norm": 0.6582421484176798,
      "learning_rate": 2.1538398479493586e-05,
      "loss": 0.9767,
      "num_input_tokens_seen": 48467947616,
      "step": 61604
    },
    {
      "epoch": 6.53564608529599,
      "grad_norm": 0.7680362151212311,
      "learning_rate": 2.153771020632636e-05,
      "loss": 1.0017,
      "num_input_tokens_seen": 48468734400,
      "step": 61605
    },
    {
      "epoch": 6.535752174835562,
      "grad_norm": 0.6845178427567553,
      "learning_rate": 2.1537021935834694e-05,
      "loss": 0.9668,
      "num_input_tokens_seen": 48469521232,
      "step": 61606
    },
    {
      "epoch": 6.535858264375133,
      "grad_norm": 0.7394163335887669,
      "learning_rate": 2.1536333668019113e-05,
      "loss": 1.0246,
      "num_input_tokens_seen": 48470308096,
      "step": 61607
    },
    {
      "epoch": 6.535964353914704,
      "grad_norm": 0.7186430912451055,
      "learning_rate": 2.1535645402880153e-05,
      "loss": 0.9839,
      "num_input_tokens_seen": 48471094960,
      "step": 61608
    },
    {
      "epoch": 6.536070443454276,
      "grad_norm": 0.893977765752291,
      "learning_rate": 2.1534957140418346e-05,
      "loss": 0.9426,
      "num_input_tokens_seen": 48471881664,
      "step": 61609
    },
    {
      "epoch": 6.536176532993847,
      "grad_norm": 0.7470013458868492,
      "learning_rate": 2.1534268880634216e-05,
      "loss": 1.0161,
      "num_input_tokens_seen": 48472668416,
      "step": 61610
    },
    {
      "epoch": 6.5362826225334185,
      "grad_norm": 0.8102868518100591,
      "learning_rate": 2.1533580623528307e-05,
      "loss": 0.9949,
      "num_input_tokens_seen": 48473455216,
      "step": 61611
    },
    {
      "epoch": 6.5363887120729895,
      "grad_norm": 0.8030680788241097,
      "learning_rate": 2.1532892369101146e-05,
      "loss": 0.9932,
      "num_input_tokens_seen": 48474241936,
      "step": 61612
    },
    {
      "epoch": 6.536494801612561,
      "grad_norm": 0.649188666149008,
      "learning_rate": 2.153220411735326e-05,
      "loss": 0.973,
      "num_input_tokens_seen": 48475028624,
      "step": 61613
    },
    {
      "epoch": 6.5366008911521325,
      "grad_norm": 0.9010345325828036,
      "learning_rate": 2.1531515868285183e-05,
      "loss": 0.9937,
      "num_input_tokens_seen": 48475815376,
      "step": 61614
    },
    {
      "epoch": 6.5367069806917035,
      "grad_norm": 1.1661840611985457,
      "learning_rate": 2.1530827621897456e-05,
      "loss": 1.048,
      "num_input_tokens_seen": 48476602080,
      "step": 61615
    },
    {
      "epoch": 6.5368130702312754,
      "grad_norm": 0.8218919939931542,
      "learning_rate": 2.1530139378190598e-05,
      "loss": 1.0117,
      "num_input_tokens_seen": 48477388912,
      "step": 61616
    },
    {
      "epoch": 6.5369191597708465,
      "grad_norm": 0.8687585808085209,
      "learning_rate": 2.1529451137165148e-05,
      "loss": 0.8835,
      "num_input_tokens_seen": 48478175776,
      "step": 61617
    },
    {
      "epoch": 6.5370252493104175,
      "grad_norm": 1.167946143899033,
      "learning_rate": 2.1528762898821635e-05,
      "loss": 1.1273,
      "num_input_tokens_seen": 48478962448,
      "step": 61618
    },
    {
      "epoch": 6.537131338849989,
      "grad_norm": 0.8923505915473529,
      "learning_rate": 2.1528074663160597e-05,
      "loss": 1.0034,
      "num_input_tokens_seen": 48479749248,
      "step": 61619
    },
    {
      "epoch": 6.5372374283895605,
      "grad_norm": 0.7111065405245709,
      "learning_rate": 2.1527386430182557e-05,
      "loss": 1.0611,
      "num_input_tokens_seen": 48480536000,
      "step": 61620
    },
    {
      "epoch": 6.537343517929132,
      "grad_norm": 0.921760700372246,
      "learning_rate": 2.1526698199888052e-05,
      "loss": 0.958,
      "num_input_tokens_seen": 48481322848,
      "step": 61621
    },
    {
      "epoch": 6.537449607468703,
      "grad_norm": 0.9892465929481234,
      "learning_rate": 2.1526009972277612e-05,
      "loss": 0.9218,
      "num_input_tokens_seen": 48482109728,
      "step": 61622
    },
    {
      "epoch": 6.537555697008275,
      "grad_norm": 0.7190495716380497,
      "learning_rate": 2.1525321747351772e-05,
      "loss": 1.029,
      "num_input_tokens_seen": 48482896528,
      "step": 61623
    },
    {
      "epoch": 6.537661786547846,
      "grad_norm": 0.9008230463927968,
      "learning_rate": 2.1524633525111056e-05,
      "loss": 0.9943,
      "num_input_tokens_seen": 48483683200,
      "step": 61624
    },
    {
      "epoch": 6.537767876087418,
      "grad_norm": 0.9716994719136017,
      "learning_rate": 2.1523945305556008e-05,
      "loss": 0.8962,
      "num_input_tokens_seen": 48484469920,
      "step": 61625
    },
    {
      "epoch": 6.537873965626989,
      "grad_norm": 0.798261319677194,
      "learning_rate": 2.152325708868715e-05,
      "loss": 0.9621,
      "num_input_tokens_seen": 48485256672,
      "step": 61626
    },
    {
      "epoch": 6.53798005516656,
      "grad_norm": 0.8110913644810457,
      "learning_rate": 2.1522568874505013e-05,
      "loss": 1.0138,
      "num_input_tokens_seen": 48486043488,
      "step": 61627
    },
    {
      "epoch": 6.538086144706132,
      "grad_norm": 0.9873285956990702,
      "learning_rate": 2.1521880663010137e-05,
      "loss": 1.0031,
      "num_input_tokens_seen": 48486830336,
      "step": 61628
    },
    {
      "epoch": 6.538192234245703,
      "grad_norm": 0.8464107794463281,
      "learning_rate": 2.1521192454203056e-05,
      "loss": 0.9403,
      "num_input_tokens_seen": 48487617200,
      "step": 61629
    },
    {
      "epoch": 6.538298323785275,
      "grad_norm": 0.7845190219102156,
      "learning_rate": 2.1520504248084284e-05,
      "loss": 1.0389,
      "num_input_tokens_seen": 48488403936,
      "step": 61630
    },
    {
      "epoch": 6.538404413324846,
      "grad_norm": 0.7776220695832075,
      "learning_rate": 2.1519816044654368e-05,
      "loss": 0.9331,
      "num_input_tokens_seen": 48489190864,
      "step": 61631
    },
    {
      "epoch": 6.538510502864417,
      "grad_norm": 0.844736288131094,
      "learning_rate": 2.151912784391384e-05,
      "loss": 0.9665,
      "num_input_tokens_seen": 48489977696,
      "step": 61632
    },
    {
      "epoch": 6.538616592403989,
      "grad_norm": 0.6902918787362832,
      "learning_rate": 2.151843964586322e-05,
      "loss": 1.0285,
      "num_input_tokens_seen": 48490764416,
      "step": 61633
    },
    {
      "epoch": 6.53872268194356,
      "grad_norm": 0.8763304588608595,
      "learning_rate": 2.1517751450503054e-05,
      "loss": 0.9643,
      "num_input_tokens_seen": 48491551184,
      "step": 61634
    },
    {
      "epoch": 6.538828771483132,
      "grad_norm": 0.7105219178050268,
      "learning_rate": 2.1517063257833864e-05,
      "loss": 0.9322,
      "num_input_tokens_seen": 48492338016,
      "step": 61635
    },
    {
      "epoch": 6.538934861022703,
      "grad_norm": 0.9032937149172956,
      "learning_rate": 2.1516375067856187e-05,
      "loss": 1.0342,
      "num_input_tokens_seen": 48493124864,
      "step": 61636
    },
    {
      "epoch": 6.539040950562274,
      "grad_norm": 1.0791202575295606,
      "learning_rate": 2.1515686880570556e-05,
      "loss": 1.0875,
      "num_input_tokens_seen": 48493911568,
      "step": 61637
    },
    {
      "epoch": 6.539147040101846,
      "grad_norm": 0.7213139702320895,
      "learning_rate": 2.1514998695977494e-05,
      "loss": 1.015,
      "num_input_tokens_seen": 48494698368,
      "step": 61638
    },
    {
      "epoch": 6.539253129641417,
      "grad_norm": 0.6136553634207356,
      "learning_rate": 2.1514310514077542e-05,
      "loss": 0.9648,
      "num_input_tokens_seen": 48495485120,
      "step": 61639
    },
    {
      "epoch": 6.539359219180989,
      "grad_norm": 0.7429485249174934,
      "learning_rate": 2.151362233487123e-05,
      "loss": 1.1011,
      "num_input_tokens_seen": 48496271856,
      "step": 61640
    },
    {
      "epoch": 6.53946530872056,
      "grad_norm": 0.7984889361649737,
      "learning_rate": 2.1512934158359083e-05,
      "loss": 1.0627,
      "num_input_tokens_seen": 48497058640,
      "step": 61641
    },
    {
      "epoch": 6.539571398260131,
      "grad_norm": 0.6929163851066322,
      "learning_rate": 2.1512245984541645e-05,
      "loss": 1.0,
      "num_input_tokens_seen": 48497845392,
      "step": 61642
    },
    {
      "epoch": 6.539677487799703,
      "grad_norm": 0.6669565775568215,
      "learning_rate": 2.151155781341944e-05,
      "loss": 0.9731,
      "num_input_tokens_seen": 48498632192,
      "step": 61643
    },
    {
      "epoch": 6.539783577339274,
      "grad_norm": 0.8096101450979646,
      "learning_rate": 2.1510869644992997e-05,
      "loss": 1.0753,
      "num_input_tokens_seen": 48499418880,
      "step": 61644
    },
    {
      "epoch": 6.539889666878846,
      "grad_norm": 0.6385818053807406,
      "learning_rate": 2.1510181479262854e-05,
      "loss": 0.9953,
      "num_input_tokens_seen": 48500205648,
      "step": 61645
    },
    {
      "epoch": 6.539995756418417,
      "grad_norm": 0.7683570023733003,
      "learning_rate": 2.150949331622954e-05,
      "loss": 1.049,
      "num_input_tokens_seen": 48500992384,
      "step": 61646
    },
    {
      "epoch": 6.540101845957988,
      "grad_norm": 0.7363471484979233,
      "learning_rate": 2.150880515589358e-05,
      "loss": 0.9834,
      "num_input_tokens_seen": 48501779104,
      "step": 61647
    },
    {
      "epoch": 6.54020793549756,
      "grad_norm": 0.8419611116256771,
      "learning_rate": 2.1508116998255527e-05,
      "loss": 1.0436,
      "num_input_tokens_seen": 48502565840,
      "step": 61648
    },
    {
      "epoch": 6.540314025037131,
      "grad_norm": 0.605766300563178,
      "learning_rate": 2.1507428843315892e-05,
      "loss": 0.9091,
      "num_input_tokens_seen": 48503352544,
      "step": 61649
    },
    {
      "epoch": 6.540420114576703,
      "grad_norm": 0.7429381129588841,
      "learning_rate": 2.150674069107521e-05,
      "loss": 0.9584,
      "num_input_tokens_seen": 48504139312,
      "step": 61650
    },
    {
      "epoch": 6.540526204116274,
      "grad_norm": 0.8833658634190159,
      "learning_rate": 2.150605254153402e-05,
      "loss": 1.0164,
      "num_input_tokens_seen": 48504926128,
      "step": 61651
    },
    {
      "epoch": 6.540632293655846,
      "grad_norm": 0.7429325653471989,
      "learning_rate": 2.1505364394692844e-05,
      "loss": 1.0085,
      "num_input_tokens_seen": 48505712816,
      "step": 61652
    },
    {
      "epoch": 6.540738383195417,
      "grad_norm": 0.9017115581306486,
      "learning_rate": 2.150467625055223e-05,
      "loss": 0.9915,
      "num_input_tokens_seen": 48506499632,
      "step": 61653
    },
    {
      "epoch": 6.540844472734989,
      "grad_norm": 0.8094606454140497,
      "learning_rate": 2.1503988109112694e-05,
      "loss": 0.9244,
      "num_input_tokens_seen": 48507286384,
      "step": 61654
    },
    {
      "epoch": 6.54095056227456,
      "grad_norm": 0.8266621173545927,
      "learning_rate": 2.150329997037477e-05,
      "loss": 0.9928,
      "num_input_tokens_seen": 48508073280,
      "step": 61655
    },
    {
      "epoch": 6.541056651814131,
      "grad_norm": 0.6524140408728438,
      "learning_rate": 2.1502611834339e-05,
      "loss": 1.0044,
      "num_input_tokens_seen": 48508860048,
      "step": 61656
    },
    {
      "epoch": 6.541162741353703,
      "grad_norm": 0.9217736510074868,
      "learning_rate": 2.150192370100591e-05,
      "loss": 1.1244,
      "num_input_tokens_seen": 48509646752,
      "step": 61657
    },
    {
      "epoch": 6.541268830893274,
      "grad_norm": 0.7779211656555918,
      "learning_rate": 2.150123557037602e-05,
      "loss": 0.9212,
      "num_input_tokens_seen": 48510433616,
      "step": 61658
    },
    {
      "epoch": 6.541374920432846,
      "grad_norm": 0.9505055939665007,
      "learning_rate": 2.1500547442449883e-05,
      "loss": 1.1102,
      "num_input_tokens_seen": 48511220352,
      "step": 61659
    },
    {
      "epoch": 6.541481009972417,
      "grad_norm": 0.7526454142872225,
      "learning_rate": 2.1499859317228023e-05,
      "loss": 1.0576,
      "num_input_tokens_seen": 48512007072,
      "step": 61660
    },
    {
      "epoch": 6.541587099511988,
      "grad_norm": 0.8536987409101197,
      "learning_rate": 2.1499171194710957e-05,
      "loss": 0.9874,
      "num_input_tokens_seen": 48512793856,
      "step": 61661
    },
    {
      "epoch": 6.54169318905156,
      "grad_norm": 0.8216636846580074,
      "learning_rate": 2.1498483074899235e-05,
      "loss": 0.9771,
      "num_input_tokens_seen": 48513580624,
      "step": 61662
    },
    {
      "epoch": 6.541799278591131,
      "grad_norm": 1.079101668733477,
      "learning_rate": 2.1497794957793384e-05,
      "loss": 1.0677,
      "num_input_tokens_seen": 48514367392,
      "step": 61663
    },
    {
      "epoch": 6.541905368130703,
      "grad_norm": 0.7290460015479537,
      "learning_rate": 2.149710684339393e-05,
      "loss": 0.9734,
      "num_input_tokens_seen": 48515154128,
      "step": 61664
    },
    {
      "epoch": 6.542011457670274,
      "grad_norm": 0.8689203459508195,
      "learning_rate": 2.149641873170141e-05,
      "loss": 1.0546,
      "num_input_tokens_seen": 48515940832,
      "step": 61665
    },
    {
      "epoch": 6.542117547209845,
      "grad_norm": 0.661433796095949,
      "learning_rate": 2.1495730622716356e-05,
      "loss": 1.0231,
      "num_input_tokens_seen": 48516727664,
      "step": 61666
    },
    {
      "epoch": 6.542223636749417,
      "grad_norm": 0.8154653387942234,
      "learning_rate": 2.14950425164393e-05,
      "loss": 1.0183,
      "num_input_tokens_seen": 48517514416,
      "step": 61667
    },
    {
      "epoch": 6.542329726288988,
      "grad_norm": 0.7060140437634463,
      "learning_rate": 2.1494354412870773e-05,
      "loss": 0.958,
      "num_input_tokens_seen": 48518301296,
      "step": 61668
    },
    {
      "epoch": 6.54243581582856,
      "grad_norm": 0.8140992184549258,
      "learning_rate": 2.1493666312011302e-05,
      "loss": 0.9842,
      "num_input_tokens_seen": 48519088064,
      "step": 61669
    },
    {
      "epoch": 6.542541905368131,
      "grad_norm": 0.6664892525297607,
      "learning_rate": 2.1492978213861425e-05,
      "loss": 0.9526,
      "num_input_tokens_seen": 48519874864,
      "step": 61670
    },
    {
      "epoch": 6.542647994907702,
      "grad_norm": 0.647254660289509,
      "learning_rate": 2.1492290118421678e-05,
      "loss": 0.9696,
      "num_input_tokens_seen": 48520661600,
      "step": 61671
    },
    {
      "epoch": 6.542754084447274,
      "grad_norm": 0.722184004217389,
      "learning_rate": 2.1491602025692574e-05,
      "loss": 1.0342,
      "num_input_tokens_seen": 48521448304,
      "step": 61672
    },
    {
      "epoch": 6.542860173986845,
      "grad_norm": 0.7250120603065676,
      "learning_rate": 2.1490913935674664e-05,
      "loss": 0.9931,
      "num_input_tokens_seen": 48522235104,
      "step": 61673
    },
    {
      "epoch": 6.5429662635264165,
      "grad_norm": 0.6928019041439129,
      "learning_rate": 2.1490225848368472e-05,
      "loss": 1.0005,
      "num_input_tokens_seen": 48523021888,
      "step": 61674
    },
    {
      "epoch": 6.543072353065988,
      "grad_norm": 0.6725872129984338,
      "learning_rate": 2.1489537763774527e-05,
      "loss": 0.9709,
      "num_input_tokens_seen": 48523808640,
      "step": 61675
    },
    {
      "epoch": 6.5431784426055595,
      "grad_norm": 1.0251266004865365,
      "learning_rate": 2.1488849681893368e-05,
      "loss": 0.9543,
      "num_input_tokens_seen": 48524595440,
      "step": 61676
    },
    {
      "epoch": 6.5432845321451305,
      "grad_norm": 0.6520716783791578,
      "learning_rate": 2.1488161602725527e-05,
      "loss": 0.9815,
      "num_input_tokens_seen": 48525382256,
      "step": 61677
    },
    {
      "epoch": 6.5433906216847015,
      "grad_norm": 0.6971155336903214,
      "learning_rate": 2.1487473526271524e-05,
      "loss": 0.9594,
      "num_input_tokens_seen": 48526169024,
      "step": 61678
    },
    {
      "epoch": 6.5434967112242735,
      "grad_norm": 0.8128621066026793,
      "learning_rate": 2.14867854525319e-05,
      "loss": 0.963,
      "num_input_tokens_seen": 48526955840,
      "step": 61679
    },
    {
      "epoch": 6.5436028007638445,
      "grad_norm": 0.7092991201965879,
      "learning_rate": 2.148609738150719e-05,
      "loss": 0.925,
      "num_input_tokens_seen": 48527742608,
      "step": 61680
    },
    {
      "epoch": 6.543708890303416,
      "grad_norm": 0.5629010022751323,
      "learning_rate": 2.1485409313197914e-05,
      "loss": 0.999,
      "num_input_tokens_seen": 48528529408,
      "step": 61681
    },
    {
      "epoch": 6.543814979842987,
      "grad_norm": 0.7327965649772112,
      "learning_rate": 2.1484721247604615e-05,
      "loss": 0.915,
      "num_input_tokens_seen": 48529316192,
      "step": 61682
    },
    {
      "epoch": 6.543921069382559,
      "grad_norm": 0.6720817861861431,
      "learning_rate": 2.1484033184727813e-05,
      "loss": 0.9807,
      "num_input_tokens_seen": 48530102944,
      "step": 61683
    },
    {
      "epoch": 6.54402715892213,
      "grad_norm": 1.0595522576325074,
      "learning_rate": 2.1483345124568058e-05,
      "loss": 1.0198,
      "num_input_tokens_seen": 48530889632,
      "step": 61684
    },
    {
      "epoch": 6.544133248461701,
      "grad_norm": 1.027067663085669,
      "learning_rate": 2.1482657067125866e-05,
      "loss": 1.0273,
      "num_input_tokens_seen": 48531676384,
      "step": 61685
    },
    {
      "epoch": 6.544239338001273,
      "grad_norm": 0.7299712720044178,
      "learning_rate": 2.148196901240177e-05,
      "loss": 1.0518,
      "num_input_tokens_seen": 48532463216,
      "step": 61686
    },
    {
      "epoch": 6.544345427540844,
      "grad_norm": 0.8823454285750917,
      "learning_rate": 2.148128096039631e-05,
      "loss": 0.9264,
      "num_input_tokens_seen": 48533250000,
      "step": 61687
    },
    {
      "epoch": 6.544451517080416,
      "grad_norm": 0.9668580381780919,
      "learning_rate": 2.1480592911110014e-05,
      "loss": 1.0239,
      "num_input_tokens_seen": 48534036800,
      "step": 61688
    },
    {
      "epoch": 6.544557606619987,
      "grad_norm": 1.1032787686075702,
      "learning_rate": 2.1479904864543407e-05,
      "loss": 1.009,
      "num_input_tokens_seen": 48534823568,
      "step": 61689
    },
    {
      "epoch": 6.544663696159558,
      "grad_norm": 0.8093206619517179,
      "learning_rate": 2.147921682069703e-05,
      "loss": 1.0432,
      "num_input_tokens_seen": 48535610288,
      "step": 61690
    },
    {
      "epoch": 6.54476978569913,
      "grad_norm": 0.8444483915303065,
      "learning_rate": 2.1478528779571412e-05,
      "loss": 0.945,
      "num_input_tokens_seen": 48536397088,
      "step": 61691
    },
    {
      "epoch": 6.544875875238701,
      "grad_norm": 0.7108781820540085,
      "learning_rate": 2.1477840741167075e-05,
      "loss": 1.0088,
      "num_input_tokens_seen": 48537183776,
      "step": 61692
    },
    {
      "epoch": 6.544981964778273,
      "grad_norm": 0.827296224891512,
      "learning_rate": 2.147715270548457e-05,
      "loss": 1.0236,
      "num_input_tokens_seen": 48537970448,
      "step": 61693
    },
    {
      "epoch": 6.545088054317844,
      "grad_norm": 0.711642124335801,
      "learning_rate": 2.1476464672524416e-05,
      "loss": 1.0007,
      "num_input_tokens_seen": 48538757200,
      "step": 61694
    },
    {
      "epoch": 6.545194143857415,
      "grad_norm": 0.8874988506415173,
      "learning_rate": 2.147577664228714e-05,
      "loss": 0.9496,
      "num_input_tokens_seen": 48539544016,
      "step": 61695
    },
    {
      "epoch": 6.545300233396987,
      "grad_norm": 0.7400984790875929,
      "learning_rate": 2.1475088614773285e-05,
      "loss": 0.9464,
      "num_input_tokens_seen": 48540330800,
      "step": 61696
    },
    {
      "epoch": 6.545406322936558,
      "grad_norm": 0.8996014524821067,
      "learning_rate": 2.1474400589983373e-05,
      "loss": 1.0297,
      "num_input_tokens_seen": 48541117504,
      "step": 61697
    },
    {
      "epoch": 6.54551241247613,
      "grad_norm": 0.7780513838692485,
      "learning_rate": 2.1473712567917946e-05,
      "loss": 0.9935,
      "num_input_tokens_seen": 48541904384,
      "step": 61698
    },
    {
      "epoch": 6.545618502015701,
      "grad_norm": 0.7176990565844084,
      "learning_rate": 2.147302454857753e-05,
      "loss": 0.9378,
      "num_input_tokens_seen": 48542691216,
      "step": 61699
    },
    {
      "epoch": 6.545724591555272,
      "grad_norm": 1.090382333054767,
      "learning_rate": 2.1472336531962657e-05,
      "loss": 1.0415,
      "num_input_tokens_seen": 48543477968,
      "step": 61700
    },
    {
      "epoch": 6.545830681094844,
      "grad_norm": 0.8901687687359514,
      "learning_rate": 2.1471648518073863e-05,
      "loss": 0.9784,
      "num_input_tokens_seen": 48544264768,
      "step": 61701
    },
    {
      "epoch": 6.545936770634415,
      "grad_norm": 0.6635022846936659,
      "learning_rate": 2.1470960506911667e-05,
      "loss": 0.966,
      "num_input_tokens_seen": 48545051504,
      "step": 61702
    },
    {
      "epoch": 6.546042860173987,
      "grad_norm": 0.8291552087849995,
      "learning_rate": 2.1470272498476616e-05,
      "loss": 1.0406,
      "num_input_tokens_seen": 48545838176,
      "step": 61703
    },
    {
      "epoch": 6.546148949713558,
      "grad_norm": 1.0787045174699366,
      "learning_rate": 2.1469584492769228e-05,
      "loss": 1.0168,
      "num_input_tokens_seen": 48546625008,
      "step": 61704
    },
    {
      "epoch": 6.54625503925313,
      "grad_norm": 0.6894828743779245,
      "learning_rate": 2.1468896489790045e-05,
      "loss": 0.9842,
      "num_input_tokens_seen": 48547411840,
      "step": 61705
    },
    {
      "epoch": 6.546361128792701,
      "grad_norm": 1.3459627191101688,
      "learning_rate": 2.1468208489539603e-05,
      "loss": 0.9717,
      "num_input_tokens_seen": 48548198592,
      "step": 61706
    },
    {
      "epoch": 6.546467218332272,
      "grad_norm": 1.368232004066818,
      "learning_rate": 2.1467520492018415e-05,
      "loss": 1.0337,
      "num_input_tokens_seen": 48548985280,
      "step": 61707
    },
    {
      "epoch": 6.546573307871844,
      "grad_norm": 0.8099496632146652,
      "learning_rate": 2.146683249722703e-05,
      "loss": 0.9995,
      "num_input_tokens_seen": 48549771952,
      "step": 61708
    },
    {
      "epoch": 6.546679397411415,
      "grad_norm": 1.2091904626220435,
      "learning_rate": 2.1466144505165972e-05,
      "loss": 0.9773,
      "num_input_tokens_seen": 48550558640,
      "step": 61709
    },
    {
      "epoch": 6.546785486950987,
      "grad_norm": 1.0151519546267769,
      "learning_rate": 2.146545651583577e-05,
      "loss": 0.924,
      "num_input_tokens_seen": 48551345504,
      "step": 61710
    },
    {
      "epoch": 6.546891576490558,
      "grad_norm": 1.033863888302128,
      "learning_rate": 2.146476852923696e-05,
      "loss": 1.0561,
      "num_input_tokens_seen": 48552132352,
      "step": 61711
    },
    {
      "epoch": 6.54699766603013,
      "grad_norm": 1.4155644127669529,
      "learning_rate": 2.146408054537008e-05,
      "loss": 1.0108,
      "num_input_tokens_seen": 48552919088,
      "step": 61712
    },
    {
      "epoch": 6.547103755569701,
      "grad_norm": 1.1079783198309228,
      "learning_rate": 2.1463392564235646e-05,
      "loss": 1.0178,
      "num_input_tokens_seen": 48553705840,
      "step": 61713
    },
    {
      "epoch": 6.547209845109272,
      "grad_norm": 0.8801352848369566,
      "learning_rate": 2.1462704585834205e-05,
      "loss": 1.0374,
      "num_input_tokens_seen": 48554492576,
      "step": 61714
    },
    {
      "epoch": 6.547315934648844,
      "grad_norm": 0.8873491700503138,
      "learning_rate": 2.146201661016628e-05,
      "loss": 1.0257,
      "num_input_tokens_seen": 48555279328,
      "step": 61715
    },
    {
      "epoch": 6.547422024188415,
      "grad_norm": 0.9247527619656679,
      "learning_rate": 2.1461328637232404e-05,
      "loss": 0.9755,
      "num_input_tokens_seen": 48556066096,
      "step": 61716
    },
    {
      "epoch": 6.547528113727987,
      "grad_norm": 0.8433599686515248,
      "learning_rate": 2.146064066703311e-05,
      "loss": 0.9563,
      "num_input_tokens_seen": 48556852992,
      "step": 61717
    },
    {
      "epoch": 6.547634203267558,
      "grad_norm": 0.8640263642761417,
      "learning_rate": 2.145995269956893e-05,
      "loss": 0.9897,
      "num_input_tokens_seen": 48557639680,
      "step": 61718
    },
    {
      "epoch": 6.547740292807129,
      "grad_norm": 0.9199930523422238,
      "learning_rate": 2.1459264734840392e-05,
      "loss": 1.0505,
      "num_input_tokens_seen": 48558426480,
      "step": 61719
    },
    {
      "epoch": 6.547846382346701,
      "grad_norm": 0.8719879904893831,
      "learning_rate": 2.1458576772848032e-05,
      "loss": 0.9806,
      "num_input_tokens_seen": 48559213232,
      "step": 61720
    },
    {
      "epoch": 6.547952471886272,
      "grad_norm": 0.815430938887926,
      "learning_rate": 2.145788881359238e-05,
      "loss": 0.9645,
      "num_input_tokens_seen": 48559999984,
      "step": 61721
    },
    {
      "epoch": 6.548058561425844,
      "grad_norm": 0.8879416482531205,
      "learning_rate": 2.1457200857073966e-05,
      "loss": 0.9291,
      "num_input_tokens_seen": 48560786768,
      "step": 61722
    },
    {
      "epoch": 6.548164650965415,
      "grad_norm": 1.0035442827503995,
      "learning_rate": 2.145651290329333e-05,
      "loss": 1.0764,
      "num_input_tokens_seen": 48561573456,
      "step": 61723
    },
    {
      "epoch": 6.548270740504986,
      "grad_norm": 1.0401584288792658,
      "learning_rate": 2.1455824952250985e-05,
      "loss": 0.9872,
      "num_input_tokens_seen": 48562360240,
      "step": 61724
    },
    {
      "epoch": 6.548376830044558,
      "grad_norm": 1.0614674178121555,
      "learning_rate": 2.1455137003947484e-05,
      "loss": 1.0302,
      "num_input_tokens_seen": 48563147008,
      "step": 61725
    },
    {
      "epoch": 6.548482919584129,
      "grad_norm": 0.9713120451676749,
      "learning_rate": 2.1454449058383348e-05,
      "loss": 1.0285,
      "num_input_tokens_seen": 48563933744,
      "step": 61726
    },
    {
      "epoch": 6.548589009123701,
      "grad_norm": 0.7306033359992548,
      "learning_rate": 2.1453761115559107e-05,
      "loss": 0.9382,
      "num_input_tokens_seen": 48564720480,
      "step": 61727
    },
    {
      "epoch": 6.548695098663272,
      "grad_norm": 0.8780701807895004,
      "learning_rate": 2.14530731754753e-05,
      "loss": 1.0135,
      "num_input_tokens_seen": 48565507328,
      "step": 61728
    },
    {
      "epoch": 6.548801188202843,
      "grad_norm": 0.871143049992687,
      "learning_rate": 2.145238523813245e-05,
      "loss": 1.0311,
      "num_input_tokens_seen": 48566294000,
      "step": 61729
    },
    {
      "epoch": 6.548907277742415,
      "grad_norm": 0.7818084788665436,
      "learning_rate": 2.1451697303531087e-05,
      "loss": 1.018,
      "num_input_tokens_seen": 48567080800,
      "step": 61730
    },
    {
      "epoch": 6.549013367281986,
      "grad_norm": 0.846509171053211,
      "learning_rate": 2.145100937167176e-05,
      "loss": 1.0211,
      "num_input_tokens_seen": 48567867472,
      "step": 61731
    },
    {
      "epoch": 6.549119456821558,
      "grad_norm": 0.7097073860140076,
      "learning_rate": 2.1450321442554984e-05,
      "loss": 0.9951,
      "num_input_tokens_seen": 48568654240,
      "step": 61732
    },
    {
      "epoch": 6.549225546361129,
      "grad_norm": 0.7522181653085754,
      "learning_rate": 2.1449633516181288e-05,
      "loss": 0.9859,
      "num_input_tokens_seen": 48569441072,
      "step": 61733
    },
    {
      "epoch": 6.5493316359007006,
      "grad_norm": 0.6927953738789818,
      "learning_rate": 2.144894559255122e-05,
      "loss": 1.0225,
      "num_input_tokens_seen": 48570227824,
      "step": 61734
    },
    {
      "epoch": 6.549437725440272,
      "grad_norm": 0.729491994885299,
      "learning_rate": 2.14482576716653e-05,
      "loss": 1.0929,
      "num_input_tokens_seen": 48571014528,
      "step": 61735
    },
    {
      "epoch": 6.549543814979843,
      "grad_norm": 0.7765863728589589,
      "learning_rate": 2.144756975352406e-05,
      "loss": 0.9879,
      "num_input_tokens_seen": 48571801280,
      "step": 61736
    },
    {
      "epoch": 6.5496499045194145,
      "grad_norm": 0.7789921095125306,
      "learning_rate": 2.144688183812804e-05,
      "loss": 0.9979,
      "num_input_tokens_seen": 48572588144,
      "step": 61737
    },
    {
      "epoch": 6.549755994058986,
      "grad_norm": 0.8176841774063778,
      "learning_rate": 2.1446193925477755e-05,
      "loss": 0.9573,
      "num_input_tokens_seen": 48573374960,
      "step": 61738
    },
    {
      "epoch": 6.5498620835985575,
      "grad_norm": 0.7218778788086443,
      "learning_rate": 2.1445506015573757e-05,
      "loss": 1.0436,
      "num_input_tokens_seen": 48574161792,
      "step": 61739
    },
    {
      "epoch": 6.5499681731381285,
      "grad_norm": 0.7912166437380964,
      "learning_rate": 2.1444818108416566e-05,
      "loss": 1.093,
      "num_input_tokens_seen": 48574948448,
      "step": 61740
    },
    {
      "epoch": 6.5500742626777,
      "grad_norm": 0.9100613834303212,
      "learning_rate": 2.144413020400671e-05,
      "loss": 1.0148,
      "num_input_tokens_seen": 48575735184,
      "step": 61741
    },
    {
      "epoch": 6.5501803522172715,
      "grad_norm": 0.7552740444257907,
      "learning_rate": 2.144344230234473e-05,
      "loss": 0.9999,
      "num_input_tokens_seen": 48576521936,
      "step": 61742
    },
    {
      "epoch": 6.5502864417568425,
      "grad_norm": 0.7512973641843064,
      "learning_rate": 2.1442754403431156e-05,
      "loss": 1.0311,
      "num_input_tokens_seen": 48577308672,
      "step": 61743
    },
    {
      "epoch": 6.550392531296414,
      "grad_norm": 0.7881190495501805,
      "learning_rate": 2.144206650726651e-05,
      "loss": 0.9915,
      "num_input_tokens_seen": 48578095456,
      "step": 61744
    },
    {
      "epoch": 6.550498620835985,
      "grad_norm": 0.8779002521394879,
      "learning_rate": 2.1441378613851337e-05,
      "loss": 0.9487,
      "num_input_tokens_seen": 48578882304,
      "step": 61745
    },
    {
      "epoch": 6.550604710375557,
      "grad_norm": 0.7762471778625624,
      "learning_rate": 2.144069072318616e-05,
      "loss": 1.024,
      "num_input_tokens_seen": 48579669104,
      "step": 61746
    },
    {
      "epoch": 6.550710799915128,
      "grad_norm": 0.7331209101530843,
      "learning_rate": 2.1440002835271512e-05,
      "loss": 0.9996,
      "num_input_tokens_seen": 48580455936,
      "step": 61747
    },
    {
      "epoch": 6.550816889454699,
      "grad_norm": 0.9275666970825681,
      "learning_rate": 2.1439314950107927e-05,
      "loss": 1.0069,
      "num_input_tokens_seen": 48581242592,
      "step": 61748
    },
    {
      "epoch": 6.550922978994271,
      "grad_norm": 0.7853093010986194,
      "learning_rate": 2.1438627067695936e-05,
      "loss": 1.0088,
      "num_input_tokens_seen": 48582029392,
      "step": 61749
    },
    {
      "epoch": 6.551029068533842,
      "grad_norm": 0.6986384878218465,
      "learning_rate": 2.1437939188036063e-05,
      "loss": 0.9768,
      "num_input_tokens_seen": 48582816208,
      "step": 61750
    },
    {
      "epoch": 6.551135158073414,
      "grad_norm": 0.7767803398723191,
      "learning_rate": 2.1437251311128854e-05,
      "loss": 0.9867,
      "num_input_tokens_seen": 48583602976,
      "step": 61751
    },
    {
      "epoch": 6.551241247612985,
      "grad_norm": 0.7782971754761545,
      "learning_rate": 2.143656343697483e-05,
      "loss": 1.0131,
      "num_input_tokens_seen": 48584389648,
      "step": 61752
    },
    {
      "epoch": 6.551347337152556,
      "grad_norm": 0.8608251334183494,
      "learning_rate": 2.143587556557452e-05,
      "loss": 1.039,
      "num_input_tokens_seen": 48585176288,
      "step": 61753
    },
    {
      "epoch": 6.551453426692128,
      "grad_norm": 0.884436663239663,
      "learning_rate": 2.1435187696928465e-05,
      "loss": 0.969,
      "num_input_tokens_seen": 48585963136,
      "step": 61754
    },
    {
      "epoch": 6.551559516231699,
      "grad_norm": 0.7535588127307025,
      "learning_rate": 2.143449983103719e-05,
      "loss": 0.9352,
      "num_input_tokens_seen": 48586749952,
      "step": 61755
    },
    {
      "epoch": 6.551665605771271,
      "grad_norm": 0.6952448080975742,
      "learning_rate": 2.1433811967901237e-05,
      "loss": 0.9633,
      "num_input_tokens_seen": 48587536800,
      "step": 61756
    },
    {
      "epoch": 6.551771695310842,
      "grad_norm": 0.903768323769125,
      "learning_rate": 2.1433124107521124e-05,
      "loss": 0.9665,
      "num_input_tokens_seen": 48588323632,
      "step": 61757
    },
    {
      "epoch": 6.551877784850413,
      "grad_norm": 0.734113180736834,
      "learning_rate": 2.1432436249897383e-05,
      "loss": 1.0558,
      "num_input_tokens_seen": 48589110400,
      "step": 61758
    },
    {
      "epoch": 6.551983874389985,
      "grad_norm": 0.8503892206616507,
      "learning_rate": 2.1431748395030557e-05,
      "loss": 0.957,
      "num_input_tokens_seen": 48589897120,
      "step": 61759
    },
    {
      "epoch": 6.552089963929556,
      "grad_norm": 0.7695028215532578,
      "learning_rate": 2.1431060542921173e-05,
      "loss": 1.04,
      "num_input_tokens_seen": 48590683872,
      "step": 61760
    },
    {
      "epoch": 6.552196053469128,
      "grad_norm": 0.6950772031474121,
      "learning_rate": 2.143037269356975e-05,
      "loss": 1.0385,
      "num_input_tokens_seen": 48591470576,
      "step": 61761
    },
    {
      "epoch": 6.552302143008699,
      "grad_norm": 1.0660189693369548,
      "learning_rate": 2.1429684846976842e-05,
      "loss": 1.0381,
      "num_input_tokens_seen": 48592257424,
      "step": 61762
    },
    {
      "epoch": 6.552408232548271,
      "grad_norm": 0.7712162578139407,
      "learning_rate": 2.1428997003142966e-05,
      "loss": 0.9602,
      "num_input_tokens_seen": 48593044224,
      "step": 61763
    },
    {
      "epoch": 6.552514322087842,
      "grad_norm": 0.7957417514597953,
      "learning_rate": 2.142830916206865e-05,
      "loss": 0.9904,
      "num_input_tokens_seen": 48593831040,
      "step": 61764
    },
    {
      "epoch": 6.552620411627413,
      "grad_norm": 0.7327816203409839,
      "learning_rate": 2.1427621323754436e-05,
      "loss": 1.0051,
      "num_input_tokens_seen": 48594617872,
      "step": 61765
    },
    {
      "epoch": 6.552726501166985,
      "grad_norm": 0.7153895816771387,
      "learning_rate": 2.1426933488200856e-05,
      "loss": 0.9616,
      "num_input_tokens_seen": 48595404720,
      "step": 61766
    },
    {
      "epoch": 6.552832590706556,
      "grad_norm": 0.7639187718279126,
      "learning_rate": 2.142624565540843e-05,
      "loss": 0.9806,
      "num_input_tokens_seen": 48596191488,
      "step": 61767
    },
    {
      "epoch": 6.552938680246128,
      "grad_norm": 0.8340484330071944,
      "learning_rate": 2.1425557825377702e-05,
      "loss": 1.0234,
      "num_input_tokens_seen": 48596978304,
      "step": 61768
    },
    {
      "epoch": 6.553044769785699,
      "grad_norm": 0.8351358823175623,
      "learning_rate": 2.142486999810919e-05,
      "loss": 0.9494,
      "num_input_tokens_seen": 48597765104,
      "step": 61769
    },
    {
      "epoch": 6.553150859325271,
      "grad_norm": 0.6242211767448865,
      "learning_rate": 2.1424182173603443e-05,
      "loss": 1.0262,
      "num_input_tokens_seen": 48598551984,
      "step": 61770
    },
    {
      "epoch": 6.553256948864842,
      "grad_norm": 0.7972441058149917,
      "learning_rate": 2.142349435186098e-05,
      "loss": 1.0429,
      "num_input_tokens_seen": 48599338784,
      "step": 61771
    },
    {
      "epoch": 6.553363038404413,
      "grad_norm": 0.8465171749381306,
      "learning_rate": 2.142280653288233e-05,
      "loss": 1.0012,
      "num_input_tokens_seen": 48600125536,
      "step": 61772
    },
    {
      "epoch": 6.553469127943985,
      "grad_norm": 0.7203608121052528,
      "learning_rate": 2.142211871666804e-05,
      "loss": 1.0739,
      "num_input_tokens_seen": 48600912240,
      "step": 61773
    },
    {
      "epoch": 6.553575217483556,
      "grad_norm": 0.7340110969456282,
      "learning_rate": 2.1421430903218625e-05,
      "loss": 0.9791,
      "num_input_tokens_seen": 48601698992,
      "step": 61774
    },
    {
      "epoch": 6.553681307023128,
      "grad_norm": 0.7134068445162886,
      "learning_rate": 2.1420743092534623e-05,
      "loss": 1.0179,
      "num_input_tokens_seen": 48602485792,
      "step": 61775
    },
    {
      "epoch": 6.553787396562699,
      "grad_norm": 0.9660987291504709,
      "learning_rate": 2.142005528461657e-05,
      "loss": 1.047,
      "num_input_tokens_seen": 48603272560,
      "step": 61776
    },
    {
      "epoch": 6.55389348610227,
      "grad_norm": 0.8750778357559155,
      "learning_rate": 2.1419367479464992e-05,
      "loss": 1.0086,
      "num_input_tokens_seen": 48604059312,
      "step": 61777
    },
    {
      "epoch": 6.553999575641842,
      "grad_norm": 0.815583071492088,
      "learning_rate": 2.1418679677080416e-05,
      "loss": 1.0466,
      "num_input_tokens_seen": 48604846016,
      "step": 61778
    },
    {
      "epoch": 6.554105665181413,
      "grad_norm": 0.8870395178957801,
      "learning_rate": 2.1417991877463384e-05,
      "loss": 1.0617,
      "num_input_tokens_seen": 48605632640,
      "step": 61779
    },
    {
      "epoch": 6.554211754720985,
      "grad_norm": 1.126607114400328,
      "learning_rate": 2.1417304080614426e-05,
      "loss": 0.9929,
      "num_input_tokens_seen": 48606419408,
      "step": 61780
    },
    {
      "epoch": 6.554317844260556,
      "grad_norm": 0.6670222899362184,
      "learning_rate": 2.1416616286534063e-05,
      "loss": 0.9421,
      "num_input_tokens_seen": 48607206176,
      "step": 61781
    },
    {
      "epoch": 6.554423933800127,
      "grad_norm": 0.6698860523569073,
      "learning_rate": 2.141592849522284e-05,
      "loss": 1.0383,
      "num_input_tokens_seen": 48607992944,
      "step": 61782
    },
    {
      "epoch": 6.554530023339699,
      "grad_norm": 0.777890900424647,
      "learning_rate": 2.141524070668128e-05,
      "loss": 0.9666,
      "num_input_tokens_seen": 48608779696,
      "step": 61783
    },
    {
      "epoch": 6.55463611287927,
      "grad_norm": 1.1566309396748697,
      "learning_rate": 2.1414552920909913e-05,
      "loss": 1.005,
      "num_input_tokens_seen": 48609566480,
      "step": 61784
    },
    {
      "epoch": 6.554742202418842,
      "grad_norm": 0.7338084127329043,
      "learning_rate": 2.1413865137909282e-05,
      "loss": 1.0592,
      "num_input_tokens_seen": 48610353328,
      "step": 61785
    },
    {
      "epoch": 6.554848291958413,
      "grad_norm": 0.850832424242205,
      "learning_rate": 2.14131773576799e-05,
      "loss": 0.9603,
      "num_input_tokens_seen": 48611140128,
      "step": 61786
    },
    {
      "epoch": 6.554954381497984,
      "grad_norm": 0.7696861355231265,
      "learning_rate": 2.141248958022232e-05,
      "loss": 1.0352,
      "num_input_tokens_seen": 48611926816,
      "step": 61787
    },
    {
      "epoch": 6.555060471037556,
      "grad_norm": 0.8374444039596475,
      "learning_rate": 2.141180180553706e-05,
      "loss": 1.0433,
      "num_input_tokens_seen": 48612713504,
      "step": 61788
    },
    {
      "epoch": 6.555166560577127,
      "grad_norm": 0.7722470004933695,
      "learning_rate": 2.141111403362465e-05,
      "loss": 0.9989,
      "num_input_tokens_seen": 48613500224,
      "step": 61789
    },
    {
      "epoch": 6.555272650116699,
      "grad_norm": 0.6533531746721126,
      "learning_rate": 2.141042626448563e-05,
      "loss": 0.9893,
      "num_input_tokens_seen": 48614287024,
      "step": 61790
    },
    {
      "epoch": 6.55537873965627,
      "grad_norm": 0.745921992555405,
      "learning_rate": 2.140973849812053e-05,
      "loss": 0.9969,
      "num_input_tokens_seen": 48615073744,
      "step": 61791
    },
    {
      "epoch": 6.555484829195842,
      "grad_norm": 0.7316992646173825,
      "learning_rate": 2.1409050734529863e-05,
      "loss": 0.9854,
      "num_input_tokens_seen": 48615860480,
      "step": 61792
    },
    {
      "epoch": 6.555590918735413,
      "grad_norm": 0.6973483454808423,
      "learning_rate": 2.1408362973714184e-05,
      "loss": 0.9087,
      "num_input_tokens_seen": 48616647264,
      "step": 61793
    },
    {
      "epoch": 6.555697008274985,
      "grad_norm": 0.9021979216330828,
      "learning_rate": 2.1407675215674023e-05,
      "loss": 1.0314,
      "num_input_tokens_seen": 48617434064,
      "step": 61794
    },
    {
      "epoch": 6.555803097814556,
      "grad_norm": 0.6429762671855985,
      "learning_rate": 2.1406987460409906e-05,
      "loss": 1.0124,
      "num_input_tokens_seen": 48618220944,
      "step": 61795
    },
    {
      "epoch": 6.555909187354127,
      "grad_norm": 0.6562411391537435,
      "learning_rate": 2.1406299707922357e-05,
      "loss": 1.0362,
      "num_input_tokens_seen": 48619007696,
      "step": 61796
    },
    {
      "epoch": 6.556015276893699,
      "grad_norm": 0.9026659606400695,
      "learning_rate": 2.1405611958211918e-05,
      "loss": 1.029,
      "num_input_tokens_seen": 48619794512,
      "step": 61797
    },
    {
      "epoch": 6.55612136643327,
      "grad_norm": 0.6729624054736917,
      "learning_rate": 2.140492421127912e-05,
      "loss": 0.9766,
      "num_input_tokens_seen": 48620581376,
      "step": 61798
    },
    {
      "epoch": 6.5562274559728415,
      "grad_norm": 0.8414981802883096,
      "learning_rate": 2.1404236467124484e-05,
      "loss": 0.9665,
      "num_input_tokens_seen": 48621368112,
      "step": 61799
    },
    {
      "epoch": 6.5563335455124125,
      "grad_norm": 0.6085508388675007,
      "learning_rate": 2.1403548725748553e-05,
      "loss": 0.993,
      "num_input_tokens_seen": 48622154880,
      "step": 61800
    },
    {
      "epoch": 6.556439635051984,
      "grad_norm": 0.6847523619216576,
      "learning_rate": 2.1402860987151853e-05,
      "loss": 0.8914,
      "num_input_tokens_seen": 48622941632,
      "step": 61801
    },
    {
      "epoch": 6.5565457245915555,
      "grad_norm": 0.5847335372377951,
      "learning_rate": 2.1402173251334915e-05,
      "loss": 0.8704,
      "num_input_tokens_seen": 48623728512,
      "step": 61802
    },
    {
      "epoch": 6.5566518141311265,
      "grad_norm": 0.7811665167260093,
      "learning_rate": 2.1401485518298275e-05,
      "loss": 1.0032,
      "num_input_tokens_seen": 48624515312,
      "step": 61803
    },
    {
      "epoch": 6.556757903670698,
      "grad_norm": 0.7612716761699676,
      "learning_rate": 2.140079778804246e-05,
      "loss": 1.0477,
      "num_input_tokens_seen": 48625302096,
      "step": 61804
    },
    {
      "epoch": 6.5568639932102695,
      "grad_norm": 0.9282802351971683,
      "learning_rate": 2.1400110060568e-05,
      "loss": 1.0602,
      "num_input_tokens_seen": 48626088832,
      "step": 61805
    },
    {
      "epoch": 6.5569700827498405,
      "grad_norm": 0.6811587232020888,
      "learning_rate": 2.1399422335875436e-05,
      "loss": 1.0003,
      "num_input_tokens_seen": 48626875600,
      "step": 61806
    },
    {
      "epoch": 6.557076172289412,
      "grad_norm": 0.821284040503825,
      "learning_rate": 2.1398734613965285e-05,
      "loss": 0.9831,
      "num_input_tokens_seen": 48627662368,
      "step": 61807
    },
    {
      "epoch": 6.5571822618289834,
      "grad_norm": 0.739576681292287,
      "learning_rate": 2.139804689483809e-05,
      "loss": 0.9642,
      "num_input_tokens_seen": 48628449168,
      "step": 61808
    },
    {
      "epoch": 6.557288351368555,
      "grad_norm": 0.7676899960805271,
      "learning_rate": 2.139735917849438e-05,
      "loss": 0.951,
      "num_input_tokens_seen": 48629235904,
      "step": 61809
    },
    {
      "epoch": 6.557394440908126,
      "grad_norm": 0.6737339538380673,
      "learning_rate": 2.1396671464934683e-05,
      "loss": 0.9156,
      "num_input_tokens_seen": 48630022624,
      "step": 61810
    },
    {
      "epoch": 6.557500530447697,
      "grad_norm": 0.9961893073137865,
      "learning_rate": 2.1395983754159535e-05,
      "loss": 0.9489,
      "num_input_tokens_seen": 48630809344,
      "step": 61811
    },
    {
      "epoch": 6.557606619987269,
      "grad_norm": 0.7199785997743477,
      "learning_rate": 2.1395296046169466e-05,
      "loss": 1.0016,
      "num_input_tokens_seen": 48631596080,
      "step": 61812
    },
    {
      "epoch": 6.55771270952684,
      "grad_norm": 0.9339790893403921,
      "learning_rate": 2.1394608340965e-05,
      "loss": 0.9384,
      "num_input_tokens_seen": 48632382816,
      "step": 61813
    },
    {
      "epoch": 6.557818799066412,
      "grad_norm": 0.8871373077821524,
      "learning_rate": 2.139392063854668e-05,
      "loss": 0.9251,
      "num_input_tokens_seen": 48633169616,
      "step": 61814
    },
    {
      "epoch": 6.557924888605983,
      "grad_norm": 0.8620050659179819,
      "learning_rate": 2.139323293891503e-05,
      "loss": 1.0147,
      "num_input_tokens_seen": 48633956368,
      "step": 61815
    },
    {
      "epoch": 6.558030978145554,
      "grad_norm": 0.8224798942663045,
      "learning_rate": 2.1392545242070583e-05,
      "loss": 0.9491,
      "num_input_tokens_seen": 48634743152,
      "step": 61816
    },
    {
      "epoch": 6.558137067685126,
      "grad_norm": 0.7402043767377181,
      "learning_rate": 2.1391857548013874e-05,
      "loss": 0.9842,
      "num_input_tokens_seen": 48635529856,
      "step": 61817
    },
    {
      "epoch": 6.558243157224697,
      "grad_norm": 0.7189752355446293,
      "learning_rate": 2.1391169856745435e-05,
      "loss": 0.9608,
      "num_input_tokens_seen": 48636316656,
      "step": 61818
    },
    {
      "epoch": 6.558349246764269,
      "grad_norm": 0.657672931174248,
      "learning_rate": 2.1390482168265784e-05,
      "loss": 0.9238,
      "num_input_tokens_seen": 48637103328,
      "step": 61819
    },
    {
      "epoch": 6.55845533630384,
      "grad_norm": 0.7273798937080025,
      "learning_rate": 2.138979448257547e-05,
      "loss": 0.9599,
      "num_input_tokens_seen": 48637890096,
      "step": 61820
    },
    {
      "epoch": 6.558561425843412,
      "grad_norm": 1.6446415831163779,
      "learning_rate": 2.1389106799675018e-05,
      "loss": 0.9918,
      "num_input_tokens_seen": 48638676912,
      "step": 61821
    },
    {
      "epoch": 6.558667515382983,
      "grad_norm": 0.6331943538746823,
      "learning_rate": 2.138841911956495e-05,
      "loss": 0.9245,
      "num_input_tokens_seen": 48639463792,
      "step": 61822
    },
    {
      "epoch": 6.558773604922555,
      "grad_norm": 0.6870122617726079,
      "learning_rate": 2.1387731442245815e-05,
      "loss": 1.0062,
      "num_input_tokens_seen": 48640250512,
      "step": 61823
    },
    {
      "epoch": 6.558879694462126,
      "grad_norm": 0.9227826354705554,
      "learning_rate": 2.1387043767718125e-05,
      "loss": 1.126,
      "num_input_tokens_seen": 48641037232,
      "step": 61824
    },
    {
      "epoch": 6.558985784001697,
      "grad_norm": 1.255740878976414,
      "learning_rate": 2.138635609598243e-05,
      "loss": 1.0485,
      "num_input_tokens_seen": 48641823920,
      "step": 61825
    },
    {
      "epoch": 6.559091873541269,
      "grad_norm": 0.8103421822466379,
      "learning_rate": 2.1385668427039253e-05,
      "loss": 0.9184,
      "num_input_tokens_seen": 48642610720,
      "step": 61826
    },
    {
      "epoch": 6.55919796308084,
      "grad_norm": 1.188797414528649,
      "learning_rate": 2.138498076088912e-05,
      "loss": 0.9898,
      "num_input_tokens_seen": 48643397536,
      "step": 61827
    },
    {
      "epoch": 6.559304052620412,
      "grad_norm": 1.0517179788921496,
      "learning_rate": 2.1384293097532573e-05,
      "loss": 1.0269,
      "num_input_tokens_seen": 48644184224,
      "step": 61828
    },
    {
      "epoch": 6.559410142159983,
      "grad_norm": 0.7787375819914449,
      "learning_rate": 2.138360543697014e-05,
      "loss": 0.9609,
      "num_input_tokens_seen": 48644971040,
      "step": 61829
    },
    {
      "epoch": 6.559516231699554,
      "grad_norm": 1.6794373850537783,
      "learning_rate": 2.138291777920234e-05,
      "loss": 0.9452,
      "num_input_tokens_seen": 48645757872,
      "step": 61830
    },
    {
      "epoch": 6.559622321239126,
      "grad_norm": 1.043833224306427,
      "learning_rate": 2.1382230124229723e-05,
      "loss": 0.9621,
      "num_input_tokens_seen": 48646544624,
      "step": 61831
    },
    {
      "epoch": 6.559728410778697,
      "grad_norm": 0.7617642381419681,
      "learning_rate": 2.1381542472052813e-05,
      "loss": 1.0474,
      "num_input_tokens_seen": 48647331440,
      "step": 61832
    },
    {
      "epoch": 6.559834500318269,
      "grad_norm": 0.9445580368541445,
      "learning_rate": 2.138085482267214e-05,
      "loss": 0.9331,
      "num_input_tokens_seen": 48648118272,
      "step": 61833
    },
    {
      "epoch": 6.55994058985784,
      "grad_norm": 1.1004444561269895,
      "learning_rate": 2.1380167176088235e-05,
      "loss": 1.0278,
      "num_input_tokens_seen": 48648904992,
      "step": 61834
    },
    {
      "epoch": 6.560046679397411,
      "grad_norm": 0.744971538522985,
      "learning_rate": 2.1379479532301633e-05,
      "loss": 0.96,
      "num_input_tokens_seen": 48649691712,
      "step": 61835
    },
    {
      "epoch": 6.560152768936983,
      "grad_norm": 0.8021698467980971,
      "learning_rate": 2.1378791891312856e-05,
      "loss": 1.0113,
      "num_input_tokens_seen": 48650478432,
      "step": 61836
    },
    {
      "epoch": 6.560258858476554,
      "grad_norm": 0.8559272715139304,
      "learning_rate": 2.137810425312245e-05,
      "loss": 0.9355,
      "num_input_tokens_seen": 48651265248,
      "step": 61837
    },
    {
      "epoch": 6.560364948016126,
      "grad_norm": 1.1275441868569323,
      "learning_rate": 2.137741661773094e-05,
      "loss": 1.0401,
      "num_input_tokens_seen": 48652052000,
      "step": 61838
    },
    {
      "epoch": 6.560471037555697,
      "grad_norm": 0.8412473307385312,
      "learning_rate": 2.137672898513885e-05,
      "loss": 0.9996,
      "num_input_tokens_seen": 48652838768,
      "step": 61839
    },
    {
      "epoch": 6.560577127095268,
      "grad_norm": 0.7205310552468992,
      "learning_rate": 2.137604135534672e-05,
      "loss": 1.0287,
      "num_input_tokens_seen": 48653625504,
      "step": 61840
    },
    {
      "epoch": 6.56068321663484,
      "grad_norm": 0.8129811488838152,
      "learning_rate": 2.1375353728355073e-05,
      "loss": 1.086,
      "num_input_tokens_seen": 48654412304,
      "step": 61841
    },
    {
      "epoch": 6.560789306174411,
      "grad_norm": 0.7724385778265203,
      "learning_rate": 2.1374666104164454e-05,
      "loss": 0.9954,
      "num_input_tokens_seen": 48655198992,
      "step": 61842
    },
    {
      "epoch": 6.560895395713983,
      "grad_norm": 0.8307088197518973,
      "learning_rate": 2.1373978482775385e-05,
      "loss": 0.9474,
      "num_input_tokens_seen": 48655985696,
      "step": 61843
    },
    {
      "epoch": 6.561001485253554,
      "grad_norm": 0.8010972356272557,
      "learning_rate": 2.1373290864188394e-05,
      "loss": 0.9772,
      "num_input_tokens_seen": 48656772464,
      "step": 61844
    },
    {
      "epoch": 6.561107574793126,
      "grad_norm": 0.9058052759346863,
      "learning_rate": 2.1372603248404024e-05,
      "loss": 0.9417,
      "num_input_tokens_seen": 48657559296,
      "step": 61845
    },
    {
      "epoch": 6.561213664332697,
      "grad_norm": 0.8622598167132945,
      "learning_rate": 2.13719156354228e-05,
      "loss": 1.0897,
      "num_input_tokens_seen": 48658346048,
      "step": 61846
    },
    {
      "epoch": 6.561319753872268,
      "grad_norm": 1.0172345431922147,
      "learning_rate": 2.137122802524525e-05,
      "loss": 1.0493,
      "num_input_tokens_seen": 48659132896,
      "step": 61847
    },
    {
      "epoch": 6.56142584341184,
      "grad_norm": 0.935038754129792,
      "learning_rate": 2.1370540417871908e-05,
      "loss": 1.0434,
      "num_input_tokens_seen": 48659919696,
      "step": 61848
    },
    {
      "epoch": 6.561531932951411,
      "grad_norm": 0.8413668760022174,
      "learning_rate": 2.1369852813303308e-05,
      "loss": 1.0565,
      "num_input_tokens_seen": 48660706496,
      "step": 61849
    },
    {
      "epoch": 6.561638022490983,
      "grad_norm": 0.8445928098397673,
      "learning_rate": 2.1369165211539976e-05,
      "loss": 0.9888,
      "num_input_tokens_seen": 48661493392,
      "step": 61850
    },
    {
      "epoch": 6.561744112030554,
      "grad_norm": 0.8786441053127422,
      "learning_rate": 2.136847761258245e-05,
      "loss": 1.0732,
      "num_input_tokens_seen": 48662280112,
      "step": 61851
    },
    {
      "epoch": 6.561850201570126,
      "grad_norm": 0.6853324955899217,
      "learning_rate": 2.1367790016431262e-05,
      "loss": 0.9777,
      "num_input_tokens_seen": 48663066912,
      "step": 61852
    },
    {
      "epoch": 6.561956291109697,
      "grad_norm": 0.6556764813770278,
      "learning_rate": 2.136710242308693e-05,
      "loss": 0.9819,
      "num_input_tokens_seen": 48663853600,
      "step": 61853
    },
    {
      "epoch": 6.562062380649268,
      "grad_norm": 0.9731890853840096,
      "learning_rate": 2.136641483255e-05,
      "loss": 1.0828,
      "num_input_tokens_seen": 48664640384,
      "step": 61854
    },
    {
      "epoch": 6.56216847018884,
      "grad_norm": 0.6673605656878995,
      "learning_rate": 2.1365727244820997e-05,
      "loss": 0.9817,
      "num_input_tokens_seen": 48665427200,
      "step": 61855
    },
    {
      "epoch": 6.562274559728411,
      "grad_norm": 0.6956661563722835,
      "learning_rate": 2.136503965990045e-05,
      "loss": 1.0303,
      "num_input_tokens_seen": 48666214000,
      "step": 61856
    },
    {
      "epoch": 6.562380649267983,
      "grad_norm": 0.7211983721569524,
      "learning_rate": 2.13643520777889e-05,
      "loss": 1.0181,
      "num_input_tokens_seen": 48667000768,
      "step": 61857
    },
    {
      "epoch": 6.562486738807554,
      "grad_norm": 0.5995421259284471,
      "learning_rate": 2.1363664498486867e-05,
      "loss": 0.9893,
      "num_input_tokens_seen": 48667787584,
      "step": 61858
    },
    {
      "epoch": 6.562592828347125,
      "grad_norm": 0.7433625143406035,
      "learning_rate": 2.136297692199489e-05,
      "loss": 1.092,
      "num_input_tokens_seen": 48668574368,
      "step": 61859
    },
    {
      "epoch": 6.562698917886697,
      "grad_norm": 0.6540795722960011,
      "learning_rate": 2.13622893483135e-05,
      "loss": 0.9396,
      "num_input_tokens_seen": 48669361216,
      "step": 61860
    },
    {
      "epoch": 6.562805007426268,
      "grad_norm": 0.7232177030151947,
      "learning_rate": 2.136160177744322e-05,
      "loss": 0.9548,
      "num_input_tokens_seen": 48670147984,
      "step": 61861
    },
    {
      "epoch": 6.5629110969658395,
      "grad_norm": 0.856389398305332,
      "learning_rate": 2.1360914209384592e-05,
      "loss": 0.9877,
      "num_input_tokens_seen": 48670934720,
      "step": 61862
    },
    {
      "epoch": 6.5630171865054105,
      "grad_norm": 0.8443346568475248,
      "learning_rate": 2.136022664413814e-05,
      "loss": 0.9894,
      "num_input_tokens_seen": 48671721568,
      "step": 61863
    },
    {
      "epoch": 6.563123276044982,
      "grad_norm": 0.7482655737721196,
      "learning_rate": 2.1359539081704396e-05,
      "loss": 0.9983,
      "num_input_tokens_seen": 48672508352,
      "step": 61864
    },
    {
      "epoch": 6.5632293655845535,
      "grad_norm": 0.7123715540024532,
      "learning_rate": 2.13588515220839e-05,
      "loss": 0.9736,
      "num_input_tokens_seen": 48673295040,
      "step": 61865
    },
    {
      "epoch": 6.5633354551241245,
      "grad_norm": 0.6783499201182014,
      "learning_rate": 2.1358163965277175e-05,
      "loss": 1.0063,
      "num_input_tokens_seen": 48674081856,
      "step": 61866
    },
    {
      "epoch": 6.5634415446636964,
      "grad_norm": 0.7510638580963788,
      "learning_rate": 2.135747641128475e-05,
      "loss": 1.043,
      "num_input_tokens_seen": 48674868768,
      "step": 61867
    },
    {
      "epoch": 6.5635476342032675,
      "grad_norm": 0.7474278694080156,
      "learning_rate": 2.1356788860107164e-05,
      "loss": 1.0098,
      "num_input_tokens_seen": 48675655456,
      "step": 61868
    },
    {
      "epoch": 6.5636537237428385,
      "grad_norm": 1.1116344175299082,
      "learning_rate": 2.1356101311744943e-05,
      "loss": 1.0725,
      "num_input_tokens_seen": 48676442240,
      "step": 61869
    },
    {
      "epoch": 6.56375981328241,
      "grad_norm": 0.6980977391515556,
      "learning_rate": 2.135541376619862e-05,
      "loss": 1.0332,
      "num_input_tokens_seen": 48677229008,
      "step": 61870
    },
    {
      "epoch": 6.5638659028219815,
      "grad_norm": 0.6812882565586234,
      "learning_rate": 2.1354726223468727e-05,
      "loss": 1.0192,
      "num_input_tokens_seen": 48678015776,
      "step": 61871
    },
    {
      "epoch": 6.563971992361553,
      "grad_norm": 0.65063156736718,
      "learning_rate": 2.135403868355579e-05,
      "loss": 0.9498,
      "num_input_tokens_seen": 48678802496,
      "step": 61872
    },
    {
      "epoch": 6.564078081901124,
      "grad_norm": 0.7676223239727845,
      "learning_rate": 2.1353351146460352e-05,
      "loss": 0.9598,
      "num_input_tokens_seen": 48679589248,
      "step": 61873
    },
    {
      "epoch": 6.564184171440696,
      "grad_norm": 0.7405580328945203,
      "learning_rate": 2.1352663612182934e-05,
      "loss": 1.0329,
      "num_input_tokens_seen": 48680375984,
      "step": 61874
    },
    {
      "epoch": 6.564290260980267,
      "grad_norm": 0.7395429977912227,
      "learning_rate": 2.1351976080724072e-05,
      "loss": 0.9671,
      "num_input_tokens_seen": 48681162720,
      "step": 61875
    },
    {
      "epoch": 6.564396350519838,
      "grad_norm": 0.8326304814924832,
      "learning_rate": 2.1351288552084295e-05,
      "loss": 0.9717,
      "num_input_tokens_seen": 48681949520,
      "step": 61876
    },
    {
      "epoch": 6.56450244005941,
      "grad_norm": 0.6749799439372537,
      "learning_rate": 2.1350601026264135e-05,
      "loss": 0.9533,
      "num_input_tokens_seen": 48682736352,
      "step": 61877
    },
    {
      "epoch": 6.564608529598981,
      "grad_norm": 0.6990540190455772,
      "learning_rate": 2.134991350326412e-05,
      "loss": 0.9999,
      "num_input_tokens_seen": 48683523216,
      "step": 61878
    },
    {
      "epoch": 6.564714619138553,
      "grad_norm": 0.8534892142862474,
      "learning_rate": 2.1349225983084793e-05,
      "loss": 1.0517,
      "num_input_tokens_seen": 48684309952,
      "step": 61879
    },
    {
      "epoch": 6.564820708678124,
      "grad_norm": 0.7549782102851537,
      "learning_rate": 2.134853846572667e-05,
      "loss": 1.0274,
      "num_input_tokens_seen": 48685096704,
      "step": 61880
    },
    {
      "epoch": 6.564926798217696,
      "grad_norm": 0.8630324596801925,
      "learning_rate": 2.134785095119029e-05,
      "loss": 0.9891,
      "num_input_tokens_seen": 48685883520,
      "step": 61881
    },
    {
      "epoch": 6.565032887757267,
      "grad_norm": 0.7999835808871124,
      "learning_rate": 2.1347163439476187e-05,
      "loss": 1.0068,
      "num_input_tokens_seen": 48686670304,
      "step": 61882
    },
    {
      "epoch": 6.565138977296838,
      "grad_norm": 0.7477224899303997,
      "learning_rate": 2.134647593058489e-05,
      "loss": 1.0644,
      "num_input_tokens_seen": 48687456976,
      "step": 61883
    },
    {
      "epoch": 6.56524506683641,
      "grad_norm": 0.8186712057684067,
      "learning_rate": 2.134578842451692e-05,
      "loss": 0.9615,
      "num_input_tokens_seen": 48688243712,
      "step": 61884
    },
    {
      "epoch": 6.565351156375981,
      "grad_norm": 0.9176329623625535,
      "learning_rate": 2.1345100921272827e-05,
      "loss": 0.9705,
      "num_input_tokens_seen": 48689030560,
      "step": 61885
    },
    {
      "epoch": 6.565457245915553,
      "grad_norm": 0.9189780510200479,
      "learning_rate": 2.1344413420853132e-05,
      "loss": 0.9905,
      "num_input_tokens_seen": 48689817344,
      "step": 61886
    },
    {
      "epoch": 6.565563335455124,
      "grad_norm": 0.7136276739425313,
      "learning_rate": 2.1343725923258356e-05,
      "loss": 0.9365,
      "num_input_tokens_seen": 48690604080,
      "step": 61887
    },
    {
      "epoch": 6.565669424994695,
      "grad_norm": 1.0038378890004565,
      "learning_rate": 2.1343038428489044e-05,
      "loss": 1.0816,
      "num_input_tokens_seen": 48691390832,
      "step": 61888
    },
    {
      "epoch": 6.565775514534267,
      "grad_norm": 0.9615556640135577,
      "learning_rate": 2.1342350936545736e-05,
      "loss": 1.0941,
      "num_input_tokens_seen": 48692177600,
      "step": 61889
    },
    {
      "epoch": 6.565881604073838,
      "grad_norm": 1.0656416351239806,
      "learning_rate": 2.1341663447428947e-05,
      "loss": 0.9967,
      "num_input_tokens_seen": 48692964368,
      "step": 61890
    },
    {
      "epoch": 6.56598769361341,
      "grad_norm": 0.9882620086497226,
      "learning_rate": 2.1340975961139208e-05,
      "loss": 1.0297,
      "num_input_tokens_seen": 48693751056,
      "step": 61891
    },
    {
      "epoch": 6.566093783152981,
      "grad_norm": 0.8447558073931815,
      "learning_rate": 2.134028847767706e-05,
      "loss": 1.0527,
      "num_input_tokens_seen": 48694537808,
      "step": 61892
    },
    {
      "epoch": 6.566199872692552,
      "grad_norm": 0.822130528128947,
      "learning_rate": 2.133960099704303e-05,
      "loss": 0.9708,
      "num_input_tokens_seen": 48695324656,
      "step": 61893
    },
    {
      "epoch": 6.566305962232124,
      "grad_norm": 1.0239694033456315,
      "learning_rate": 2.133891351923765e-05,
      "loss": 1.0012,
      "num_input_tokens_seen": 48696111360,
      "step": 61894
    },
    {
      "epoch": 6.566412051771695,
      "grad_norm": 0.6998204750607231,
      "learning_rate": 2.133822604426145e-05,
      "loss": 0.9762,
      "num_input_tokens_seen": 48696898064,
      "step": 61895
    },
    {
      "epoch": 6.566518141311267,
      "grad_norm": 0.8374699778893631,
      "learning_rate": 2.1337538572114958e-05,
      "loss": 0.9808,
      "num_input_tokens_seen": 48697684848,
      "step": 61896
    },
    {
      "epoch": 6.566624230850838,
      "grad_norm": 0.8298232434922332,
      "learning_rate": 2.1336851102798712e-05,
      "loss": 1.0394,
      "num_input_tokens_seen": 48698471680,
      "step": 61897
    },
    {
      "epoch": 6.566730320390409,
      "grad_norm": 0.7226749357232489,
      "learning_rate": 2.133616363631324e-05,
      "loss": 0.9708,
      "num_input_tokens_seen": 48699258512,
      "step": 61898
    },
    {
      "epoch": 6.566836409929981,
      "grad_norm": 0.74634906607851,
      "learning_rate": 2.1335476172659068e-05,
      "loss": 0.9984,
      "num_input_tokens_seen": 48700045312,
      "step": 61899
    },
    {
      "epoch": 6.566942499469552,
      "grad_norm": 0.7090364849491715,
      "learning_rate": 2.133478871183674e-05,
      "loss": 1.096,
      "num_input_tokens_seen": 48700832144,
      "step": 61900
    },
    {
      "epoch": 6.567048589009124,
      "grad_norm": 0.7859782695981101,
      "learning_rate": 2.1334101253846778e-05,
      "loss": 1.0134,
      "num_input_tokens_seen": 48701618864,
      "step": 61901
    },
    {
      "epoch": 6.567154678548695,
      "grad_norm": 0.7830889413341381,
      "learning_rate": 2.133341379868971e-05,
      "loss": 1.0533,
      "num_input_tokens_seen": 48702405632,
      "step": 61902
    },
    {
      "epoch": 6.567260768088267,
      "grad_norm": 0.8497222517722224,
      "learning_rate": 2.1332726346366078e-05,
      "loss": 1.0461,
      "num_input_tokens_seen": 48703192336,
      "step": 61903
    },
    {
      "epoch": 6.567366857627838,
      "grad_norm": 0.8133388715165963,
      "learning_rate": 2.1332038896876404e-05,
      "loss": 0.886,
      "num_input_tokens_seen": 48703979184,
      "step": 61904
    },
    {
      "epoch": 6.567472947167409,
      "grad_norm": 1.2202751119236963,
      "learning_rate": 2.1331351450221223e-05,
      "loss": 1.0654,
      "num_input_tokens_seen": 48704766000,
      "step": 61905
    },
    {
      "epoch": 6.567579036706981,
      "grad_norm": 0.7104626254000503,
      "learning_rate": 2.133066400640107e-05,
      "loss": 0.9741,
      "num_input_tokens_seen": 48705552832,
      "step": 61906
    },
    {
      "epoch": 6.567685126246552,
      "grad_norm": 0.8399596838664064,
      "learning_rate": 2.132997656541647e-05,
      "loss": 1.0119,
      "num_input_tokens_seen": 48706339664,
      "step": 61907
    },
    {
      "epoch": 6.567791215786124,
      "grad_norm": 0.790117014927684,
      "learning_rate": 2.132928912726795e-05,
      "loss": 1.0493,
      "num_input_tokens_seen": 48707126416,
      "step": 61908
    },
    {
      "epoch": 6.567897305325695,
      "grad_norm": 0.6535273821152068,
      "learning_rate": 2.132860169195606e-05,
      "loss": 0.9374,
      "num_input_tokens_seen": 48707913248,
      "step": 61909
    },
    {
      "epoch": 6.568003394865267,
      "grad_norm": 1.0048891056940474,
      "learning_rate": 2.1327914259481304e-05,
      "loss": 1.0819,
      "num_input_tokens_seen": 48708700080,
      "step": 61910
    },
    {
      "epoch": 6.568109484404838,
      "grad_norm": 0.8214621569991433,
      "learning_rate": 2.132722682984424e-05,
      "loss": 1.0122,
      "num_input_tokens_seen": 48709486816,
      "step": 61911
    },
    {
      "epoch": 6.568215573944409,
      "grad_norm": 0.879019792137361,
      "learning_rate": 2.1326539403045385e-05,
      "loss": 1.0616,
      "num_input_tokens_seen": 48710273504,
      "step": 61912
    },
    {
      "epoch": 6.568321663483981,
      "grad_norm": 0.8488859399125661,
      "learning_rate": 2.1325851979085266e-05,
      "loss": 0.8498,
      "num_input_tokens_seen": 48711060304,
      "step": 61913
    },
    {
      "epoch": 6.568427753023552,
      "grad_norm": 0.8033474539535417,
      "learning_rate": 2.1325164557964426e-05,
      "loss": 1.0256,
      "num_input_tokens_seen": 48711847072,
      "step": 61914
    },
    {
      "epoch": 6.568533842563124,
      "grad_norm": 0.687531231419048,
      "learning_rate": 2.1324477139683396e-05,
      "loss": 0.9548,
      "num_input_tokens_seen": 48712633904,
      "step": 61915
    },
    {
      "epoch": 6.568639932102695,
      "grad_norm": 0.8506942210600158,
      "learning_rate": 2.1323789724242695e-05,
      "loss": 1.0879,
      "num_input_tokens_seen": 48713420672,
      "step": 61916
    },
    {
      "epoch": 6.568746021642266,
      "grad_norm": 0.688568468416258,
      "learning_rate": 2.132310231164286e-05,
      "loss": 1.0373,
      "num_input_tokens_seen": 48714207424,
      "step": 61917
    },
    {
      "epoch": 6.568852111181838,
      "grad_norm": 0.8870098479978344,
      "learning_rate": 2.132241490188443e-05,
      "loss": 1.1097,
      "num_input_tokens_seen": 48714994192,
      "step": 61918
    },
    {
      "epoch": 6.568958200721409,
      "grad_norm": 0.9213023846956389,
      "learning_rate": 2.1321727494967924e-05,
      "loss": 1.062,
      "num_input_tokens_seen": 48715780912,
      "step": 61919
    },
    {
      "epoch": 6.569064290260981,
      "grad_norm": 0.7199743684082983,
      "learning_rate": 2.1321040090893883e-05,
      "loss": 1.0761,
      "num_input_tokens_seen": 48716567696,
      "step": 61920
    },
    {
      "epoch": 6.569170379800552,
      "grad_norm": 0.8462516685729665,
      "learning_rate": 2.1320352689662837e-05,
      "loss": 0.9346,
      "num_input_tokens_seen": 48717354496,
      "step": 61921
    },
    {
      "epoch": 6.569276469340123,
      "grad_norm": 0.80533604009436,
      "learning_rate": 2.1319665291275307e-05,
      "loss": 0.9641,
      "num_input_tokens_seen": 48718141280,
      "step": 61922
    },
    {
      "epoch": 6.569382558879695,
      "grad_norm": 0.7676288774104154,
      "learning_rate": 2.1318977895731837e-05,
      "loss": 1.0349,
      "num_input_tokens_seen": 48718927984,
      "step": 61923
    },
    {
      "epoch": 6.569488648419266,
      "grad_norm": 0.8802995828406496,
      "learning_rate": 2.1318290503032953e-05,
      "loss": 0.9806,
      "num_input_tokens_seen": 48719714800,
      "step": 61924
    },
    {
      "epoch": 6.5695947379588375,
      "grad_norm": 0.6528143176414487,
      "learning_rate": 2.131760311317918e-05,
      "loss": 0.8746,
      "num_input_tokens_seen": 48720501744,
      "step": 61925
    },
    {
      "epoch": 6.569700827498409,
      "grad_norm": 0.8178549850570236,
      "learning_rate": 2.1316915726171063e-05,
      "loss": 0.9685,
      "num_input_tokens_seen": 48721288512,
      "step": 61926
    },
    {
      "epoch": 6.56980691703798,
      "grad_norm": 0.8010158200334494,
      "learning_rate": 2.1316228342009116e-05,
      "loss": 1.0317,
      "num_input_tokens_seen": 48722075280,
      "step": 61927
    },
    {
      "epoch": 6.5699130065775515,
      "grad_norm": 0.8445956548564095,
      "learning_rate": 2.1315540960693892e-05,
      "loss": 1.0133,
      "num_input_tokens_seen": 48722862000,
      "step": 61928
    },
    {
      "epoch": 6.5700190961171225,
      "grad_norm": 0.6945013699521527,
      "learning_rate": 2.13148535822259e-05,
      "loss": 0.9281,
      "num_input_tokens_seen": 48723648800,
      "step": 61929
    },
    {
      "epoch": 6.5701251856566945,
      "grad_norm": 0.947673500781962,
      "learning_rate": 2.1314166206605685e-05,
      "loss": 1.1954,
      "num_input_tokens_seen": 48724435488,
      "step": 61930
    },
    {
      "epoch": 6.5702312751962655,
      "grad_norm": 0.7920748642275298,
      "learning_rate": 2.1313478833833773e-05,
      "loss": 0.9766,
      "num_input_tokens_seen": 48725222304,
      "step": 61931
    },
    {
      "epoch": 6.570337364735837,
      "grad_norm": 0.9590644471267175,
      "learning_rate": 2.13127914639107e-05,
      "loss": 1.0338,
      "num_input_tokens_seen": 48726009024,
      "step": 61932
    },
    {
      "epoch": 6.570443454275408,
      "grad_norm": 0.6167116416276424,
      "learning_rate": 2.1312104096836987e-05,
      "loss": 0.9498,
      "num_input_tokens_seen": 48726795888,
      "step": 61933
    },
    {
      "epoch": 6.5705495438149795,
      "grad_norm": 0.7916538248975274,
      "learning_rate": 2.131141673261318e-05,
      "loss": 1.0308,
      "num_input_tokens_seen": 48727582624,
      "step": 61934
    },
    {
      "epoch": 6.570655633354551,
      "grad_norm": 0.8649136430090766,
      "learning_rate": 2.1310729371239797e-05,
      "loss": 0.9302,
      "num_input_tokens_seen": 48728369408,
      "step": 61935
    },
    {
      "epoch": 6.570761722894122,
      "grad_norm": 0.7139733976781584,
      "learning_rate": 2.1310042012717376e-05,
      "loss": 1.0808,
      "num_input_tokens_seen": 48729156144,
      "step": 61936
    },
    {
      "epoch": 6.570867812433694,
      "grad_norm": 0.9614598434165118,
      "learning_rate": 2.1309354657046443e-05,
      "loss": 1.0347,
      "num_input_tokens_seen": 48729942816,
      "step": 61937
    },
    {
      "epoch": 6.570973901973265,
      "grad_norm": 0.9004775696494598,
      "learning_rate": 2.1308667304227537e-05,
      "loss": 0.9834,
      "num_input_tokens_seen": 48730729536,
      "step": 61938
    },
    {
      "epoch": 6.571079991512837,
      "grad_norm": 0.9297104945079503,
      "learning_rate": 2.1307979954261175e-05,
      "loss": 1.0318,
      "num_input_tokens_seen": 48731516352,
      "step": 61939
    },
    {
      "epoch": 6.571186081052408,
      "grad_norm": 0.9405924282180259,
      "learning_rate": 2.1307292607147907e-05,
      "loss": 1.1085,
      "num_input_tokens_seen": 48732303120,
      "step": 61940
    },
    {
      "epoch": 6.571292170591979,
      "grad_norm": 0.8220150438177325,
      "learning_rate": 2.1306605262888256e-05,
      "loss": 1.0487,
      "num_input_tokens_seen": 48733089808,
      "step": 61941
    },
    {
      "epoch": 6.571398260131551,
      "grad_norm": 0.7555842162457621,
      "learning_rate": 2.1305917921482747e-05,
      "loss": 0.9699,
      "num_input_tokens_seen": 48733876592,
      "step": 61942
    },
    {
      "epoch": 6.571504349671122,
      "grad_norm": 0.6929172467253083,
      "learning_rate": 2.130523058293192e-05,
      "loss": 1.017,
      "num_input_tokens_seen": 48734663408,
      "step": 61943
    },
    {
      "epoch": 6.571610439210694,
      "grad_norm": 0.9285072790778901,
      "learning_rate": 2.1304543247236293e-05,
      "loss": 0.9845,
      "num_input_tokens_seen": 48735450336,
      "step": 61944
    },
    {
      "epoch": 6.571716528750265,
      "grad_norm": 0.7675455185076295,
      "learning_rate": 2.130385591439642e-05,
      "loss": 0.9794,
      "num_input_tokens_seen": 48736237072,
      "step": 61945
    },
    {
      "epoch": 6.571822618289836,
      "grad_norm": 0.8170173716447043,
      "learning_rate": 2.130316858441281e-05,
      "loss": 0.9382,
      "num_input_tokens_seen": 48737023888,
      "step": 61946
    },
    {
      "epoch": 6.571928707829408,
      "grad_norm": 1.0462765130450695,
      "learning_rate": 2.1302481257286003e-05,
      "loss": 1.0919,
      "num_input_tokens_seen": 48737810608,
      "step": 61947
    },
    {
      "epoch": 6.572034797368979,
      "grad_norm": 0.8162276904419599,
      "learning_rate": 2.1301793933016533e-05,
      "loss": 0.9348,
      "num_input_tokens_seen": 48738597456,
      "step": 61948
    },
    {
      "epoch": 6.572140886908551,
      "grad_norm": 0.9174434398143609,
      "learning_rate": 2.1301106611604932e-05,
      "loss": 0.9812,
      "num_input_tokens_seen": 48739384336,
      "step": 61949
    },
    {
      "epoch": 6.572246976448122,
      "grad_norm": 1.000058065883552,
      "learning_rate": 2.1300419293051718e-05,
      "loss": 1.0663,
      "num_input_tokens_seen": 48740171072,
      "step": 61950
    },
    {
      "epoch": 6.572353065987693,
      "grad_norm": 0.7970267969232397,
      "learning_rate": 2.1299731977357437e-05,
      "loss": 0.9664,
      "num_input_tokens_seen": 48740957840,
      "step": 61951
    },
    {
      "epoch": 6.572459155527265,
      "grad_norm": 0.827527754391461,
      "learning_rate": 2.1299044664522617e-05,
      "loss": 1.0036,
      "num_input_tokens_seen": 48741744544,
      "step": 61952
    },
    {
      "epoch": 6.572565245066836,
      "grad_norm": 0.9967776996334181,
      "learning_rate": 2.129835735454778e-05,
      "loss": 0.9274,
      "num_input_tokens_seen": 48742531344,
      "step": 61953
    },
    {
      "epoch": 6.572671334606408,
      "grad_norm": 0.8613944836408003,
      "learning_rate": 2.1297670047433468e-05,
      "loss": 0.998,
      "num_input_tokens_seen": 48743318064,
      "step": 61954
    },
    {
      "epoch": 6.572777424145979,
      "grad_norm": 0.9401336778815131,
      "learning_rate": 2.129698274318021e-05,
      "loss": 0.9968,
      "num_input_tokens_seen": 48744104880,
      "step": 61955
    },
    {
      "epoch": 6.57288351368555,
      "grad_norm": 1.244644144316274,
      "learning_rate": 2.1296295441788527e-05,
      "loss": 0.9968,
      "num_input_tokens_seen": 48744891552,
      "step": 61956
    },
    {
      "epoch": 6.572989603225122,
      "grad_norm": 0.9472967543589463,
      "learning_rate": 2.1295608143258965e-05,
      "loss": 0.9553,
      "num_input_tokens_seen": 48745678400,
      "step": 61957
    },
    {
      "epoch": 6.573095692764693,
      "grad_norm": 1.199786679050465,
      "learning_rate": 2.129492084759205e-05,
      "loss": 1.037,
      "num_input_tokens_seen": 48746465168,
      "step": 61958
    },
    {
      "epoch": 6.573201782304265,
      "grad_norm": 0.899370245541324,
      "learning_rate": 2.1294233554788305e-05,
      "loss": 1.0361,
      "num_input_tokens_seen": 48747251968,
      "step": 61959
    },
    {
      "epoch": 6.573307871843836,
      "grad_norm": 0.8646981928608329,
      "learning_rate": 2.1293546264848274e-05,
      "loss": 1.0069,
      "num_input_tokens_seen": 48748038640,
      "step": 61960
    },
    {
      "epoch": 6.573413961383408,
      "grad_norm": 1.1513142444085078,
      "learning_rate": 2.129285897777247e-05,
      "loss": 1.0372,
      "num_input_tokens_seen": 48748825456,
      "step": 61961
    },
    {
      "epoch": 6.573520050922979,
      "grad_norm": 0.847612947469188,
      "learning_rate": 2.129217169356145e-05,
      "loss": 0.9965,
      "num_input_tokens_seen": 48749612160,
      "step": 61962
    },
    {
      "epoch": 6.57362614046255,
      "grad_norm": 0.811559995639349,
      "learning_rate": 2.129148441221573e-05,
      "loss": 0.9672,
      "num_input_tokens_seen": 48750398864,
      "step": 61963
    },
    {
      "epoch": 6.573732230002122,
      "grad_norm": 0.94332932256504,
      "learning_rate": 2.1290797133735828e-05,
      "loss": 1.0206,
      "num_input_tokens_seen": 48751185664,
      "step": 61964
    },
    {
      "epoch": 6.573838319541693,
      "grad_norm": 1.0414656138365728,
      "learning_rate": 2.1290109858122302e-05,
      "loss": 1.0406,
      "num_input_tokens_seen": 48751972384,
      "step": 61965
    },
    {
      "epoch": 6.573944409081265,
      "grad_norm": 0.7428446704774339,
      "learning_rate": 2.1289422585375667e-05,
      "loss": 1.0211,
      "num_input_tokens_seen": 48752759312,
      "step": 61966
    },
    {
      "epoch": 6.574050498620836,
      "grad_norm": 1.2150436308558534,
      "learning_rate": 2.1288735315496456e-05,
      "loss": 1.0095,
      "num_input_tokens_seen": 48753546064,
      "step": 61967
    },
    {
      "epoch": 6.574156588160408,
      "grad_norm": 1.6994282498566857,
      "learning_rate": 2.1288048048485204e-05,
      "loss": 0.9965,
      "num_input_tokens_seen": 48754332816,
      "step": 61968
    },
    {
      "epoch": 6.574262677699979,
      "grad_norm": 0.8453062171388372,
      "learning_rate": 2.1287360784342442e-05,
      "loss": 1.0194,
      "num_input_tokens_seen": 48755119600,
      "step": 61969
    },
    {
      "epoch": 6.57436876723955,
      "grad_norm": 1.2653172884422088,
      "learning_rate": 2.128667352306869e-05,
      "loss": 1.0699,
      "num_input_tokens_seen": 48755906352,
      "step": 61970
    },
    {
      "epoch": 6.574474856779122,
      "grad_norm": 1.432614078265882,
      "learning_rate": 2.128598626466449e-05,
      "loss": 1.0265,
      "num_input_tokens_seen": 48756693072,
      "step": 61971
    },
    {
      "epoch": 6.574580946318693,
      "grad_norm": 0.8740138334417302,
      "learning_rate": 2.1285299009130376e-05,
      "loss": 1.0228,
      "num_input_tokens_seen": 48757479920,
      "step": 61972
    },
    {
      "epoch": 6.574687035858265,
      "grad_norm": 1.1385524507804514,
      "learning_rate": 2.1284611756466873e-05,
      "loss": 1.0316,
      "num_input_tokens_seen": 48758266608,
      "step": 61973
    },
    {
      "epoch": 6.574793125397836,
      "grad_norm": 0.9221078227966846,
      "learning_rate": 2.128392450667451e-05,
      "loss": 1.0362,
      "num_input_tokens_seen": 48759053264,
      "step": 61974
    },
    {
      "epoch": 6.574899214937407,
      "grad_norm": 0.759526434682902,
      "learning_rate": 2.1283237259753818e-05,
      "loss": 1.009,
      "num_input_tokens_seen": 48759840048,
      "step": 61975
    },
    {
      "epoch": 6.575005304476979,
      "grad_norm": 0.7302763687273676,
      "learning_rate": 2.1282550015705338e-05,
      "loss": 1.0477,
      "num_input_tokens_seen": 48760626800,
      "step": 61976
    },
    {
      "epoch": 6.57511139401655,
      "grad_norm": 1.0112905777661056,
      "learning_rate": 2.1281862774529593e-05,
      "loss": 1.0427,
      "num_input_tokens_seen": 48761413680,
      "step": 61977
    },
    {
      "epoch": 6.575217483556122,
      "grad_norm": 0.7701466191728004,
      "learning_rate": 2.128117553622711e-05,
      "loss": 0.9681,
      "num_input_tokens_seen": 48762200464,
      "step": 61978
    },
    {
      "epoch": 6.575323573095693,
      "grad_norm": 0.9683846320637771,
      "learning_rate": 2.1280488300798436e-05,
      "loss": 0.9852,
      "num_input_tokens_seen": 48762987216,
      "step": 61979
    },
    {
      "epoch": 6.575429662635264,
      "grad_norm": 0.8910588712561234,
      "learning_rate": 2.1279801068244084e-05,
      "loss": 0.9856,
      "num_input_tokens_seen": 48763774016,
      "step": 61980
    },
    {
      "epoch": 6.575535752174836,
      "grad_norm": 0.854841262072598,
      "learning_rate": 2.127911383856459e-05,
      "loss": 0.985,
      "num_input_tokens_seen": 48764560800,
      "step": 61981
    },
    {
      "epoch": 6.575641841714407,
      "grad_norm": 0.9157384898588747,
      "learning_rate": 2.1278426611760483e-05,
      "loss": 0.9957,
      "num_input_tokens_seen": 48765347536,
      "step": 61982
    },
    {
      "epoch": 6.575747931253979,
      "grad_norm": 0.7407903695084563,
      "learning_rate": 2.127773938783231e-05,
      "loss": 0.9239,
      "num_input_tokens_seen": 48766134368,
      "step": 61983
    },
    {
      "epoch": 6.57585402079355,
      "grad_norm": 0.8609014967432418,
      "learning_rate": 2.1277052166780586e-05,
      "loss": 0.9981,
      "num_input_tokens_seen": 48766921152,
      "step": 61984
    },
    {
      "epoch": 6.575960110333121,
      "grad_norm": 0.7579847786958802,
      "learning_rate": 2.127636494860585e-05,
      "loss": 0.9965,
      "num_input_tokens_seen": 48767707888,
      "step": 61985
    },
    {
      "epoch": 6.576066199872693,
      "grad_norm": 0.8330914765407099,
      "learning_rate": 2.1275677733308627e-05,
      "loss": 1.0247,
      "num_input_tokens_seen": 48768494608,
      "step": 61986
    },
    {
      "epoch": 6.576172289412264,
      "grad_norm": 0.7352392861120426,
      "learning_rate": 2.1274990520889455e-05,
      "loss": 1.0259,
      "num_input_tokens_seen": 48769281424,
      "step": 61987
    },
    {
      "epoch": 6.5762783789518355,
      "grad_norm": 1.0979245227972587,
      "learning_rate": 2.1274303311348853e-05,
      "loss": 0.9739,
      "num_input_tokens_seen": 48770068144,
      "step": 61988
    },
    {
      "epoch": 6.576384468491407,
      "grad_norm": 0.8614916445328848,
      "learning_rate": 2.127361610468737e-05,
      "loss": 0.9845,
      "num_input_tokens_seen": 48770854896,
      "step": 61989
    },
    {
      "epoch": 6.5764905580309785,
      "grad_norm": 0.6367680809669244,
      "learning_rate": 2.1272928900905524e-05,
      "loss": 0.8746,
      "num_input_tokens_seen": 48771641728,
      "step": 61990
    },
    {
      "epoch": 6.5765966475705495,
      "grad_norm": 1.4703820300474664,
      "learning_rate": 2.1272241700003845e-05,
      "loss": 1.0759,
      "num_input_tokens_seen": 48772428416,
      "step": 61991
    },
    {
      "epoch": 6.576702737110121,
      "grad_norm": 0.8361873056011369,
      "learning_rate": 2.127155450198287e-05,
      "loss": 1.0272,
      "num_input_tokens_seen": 48773215216,
      "step": 61992
    },
    {
      "epoch": 6.5768088266496925,
      "grad_norm": 0.7511474043284389,
      "learning_rate": 2.1270867306843133e-05,
      "loss": 1.0154,
      "num_input_tokens_seen": 48774002000,
      "step": 61993
    },
    {
      "epoch": 6.5769149161892635,
      "grad_norm": 0.9782188203635448,
      "learning_rate": 2.1270180114585154e-05,
      "loss": 0.9394,
      "num_input_tokens_seen": 48774788880,
      "step": 61994
    },
    {
      "epoch": 6.577021005728835,
      "grad_norm": 0.94125462200467,
      "learning_rate": 2.1269492925209475e-05,
      "loss": 0.9991,
      "num_input_tokens_seen": 48775575600,
      "step": 61995
    },
    {
      "epoch": 6.577127095268406,
      "grad_norm": 0.6447887717066517,
      "learning_rate": 2.126880573871662e-05,
      "loss": 0.9706,
      "num_input_tokens_seen": 48776362384,
      "step": 61996
    },
    {
      "epoch": 6.577233184807978,
      "grad_norm": 1.1773152678173746,
      "learning_rate": 2.126811855510712e-05,
      "loss": 1.1148,
      "num_input_tokens_seen": 48777149216,
      "step": 61997
    },
    {
      "epoch": 6.577339274347549,
      "grad_norm": 1.07538789274921,
      "learning_rate": 2.1267431374381512e-05,
      "loss": 1.006,
      "num_input_tokens_seen": 48777935920,
      "step": 61998
    },
    {
      "epoch": 6.57744536388712,
      "grad_norm": 0.7392388701939371,
      "learning_rate": 2.1266744196540322e-05,
      "loss": 0.9768,
      "num_input_tokens_seen": 48778722784,
      "step": 61999
    },
    {
      "epoch": 6.577551453426692,
      "grad_norm": 0.9975597232222891,
      "learning_rate": 2.1266057021584085e-05,
      "loss": 1.0419,
      "num_input_tokens_seen": 48779509568,
      "step": 62000
    },
    {
      "epoch": 6.577551453426692,
      "eval_loss": 1.5085290670394897,
      "eval_runtime": 63.911,
      "eval_samples_per_second": 46.94,
      "eval_steps_per_second": 0.501,
      "num_input_tokens_seen": 48779509568,
      "step": 62000
    },
    {
      "epoch": 6.577657542966263,
      "grad_norm": 0.6901088365619213,
      "learning_rate": 2.126536984951333e-05,
      "loss": 1.0468,
      "num_input_tokens_seen": 48780296336,
      "step": 62001
    },
    {
      "epoch": 6.577763632505835,
      "grad_norm": 0.8287676923528636,
      "learning_rate": 2.1264682680328583e-05,
      "loss": 0.9672,
      "num_input_tokens_seen": 48781083136,
      "step": 62002
    },
    {
      "epoch": 6.577869722045406,
      "grad_norm": 0.6708389046570441,
      "learning_rate": 2.1263995514030382e-05,
      "loss": 0.9996,
      "num_input_tokens_seen": 48781869904,
      "step": 62003
    },
    {
      "epoch": 6.577975811584977,
      "grad_norm": 0.7604126096724293,
      "learning_rate": 2.126330835061926e-05,
      "loss": 0.9991,
      "num_input_tokens_seen": 48782656736,
      "step": 62004
    },
    {
      "epoch": 6.578081901124549,
      "grad_norm": 0.8225075582523916,
      "learning_rate": 2.1262621190095735e-05,
      "loss": 1.0713,
      "num_input_tokens_seen": 48783443568,
      "step": 62005
    },
    {
      "epoch": 6.57818799066412,
      "grad_norm": 0.7658325996792283,
      "learning_rate": 2.1261934032460353e-05,
      "loss": 0.9934,
      "num_input_tokens_seen": 48784230256,
      "step": 62006
    },
    {
      "epoch": 6.578294080203692,
      "grad_norm": 1.118037206382679,
      "learning_rate": 2.126124687771364e-05,
      "loss": 1.0308,
      "num_input_tokens_seen": 48785016944,
      "step": 62007
    },
    {
      "epoch": 6.578400169743263,
      "grad_norm": 1.2279865419824139,
      "learning_rate": 2.1260559725856118e-05,
      "loss": 1.0695,
      "num_input_tokens_seen": 48785803680,
      "step": 62008
    },
    {
      "epoch": 6.578506259282834,
      "grad_norm": 0.7965859154563346,
      "learning_rate": 2.1259872576888336e-05,
      "loss": 0.9614,
      "num_input_tokens_seen": 48786590464,
      "step": 62009
    },
    {
      "epoch": 6.578612348822406,
      "grad_norm": 0.7524972220716177,
      "learning_rate": 2.1259185430810807e-05,
      "loss": 1.0317,
      "num_input_tokens_seen": 48787377200,
      "step": 62010
    },
    {
      "epoch": 6.578718438361977,
      "grad_norm": 1.216869010333263,
      "learning_rate": 2.1258498287624072e-05,
      "loss": 0.9947,
      "num_input_tokens_seen": 48788163888,
      "step": 62011
    },
    {
      "epoch": 6.578824527901549,
      "grad_norm": 0.7516505996877422,
      "learning_rate": 2.125781114732866e-05,
      "loss": 1.0408,
      "num_input_tokens_seen": 48788950672,
      "step": 62012
    },
    {
      "epoch": 6.57893061744112,
      "grad_norm": 0.7394919698227739,
      "learning_rate": 2.1257124009925098e-05,
      "loss": 0.972,
      "num_input_tokens_seen": 48789737520,
      "step": 62013
    },
    {
      "epoch": 6.579036706980691,
      "grad_norm": 0.7907332925942412,
      "learning_rate": 2.1256436875413925e-05,
      "loss": 0.959,
      "num_input_tokens_seen": 48790524288,
      "step": 62014
    },
    {
      "epoch": 6.579142796520263,
      "grad_norm": 1.0122341754017972,
      "learning_rate": 2.1255749743795668e-05,
      "loss": 1.0345,
      "num_input_tokens_seen": 48791311040,
      "step": 62015
    },
    {
      "epoch": 6.579248886059834,
      "grad_norm": 0.7801843364897921,
      "learning_rate": 2.1255062615070852e-05,
      "loss": 0.9382,
      "num_input_tokens_seen": 48792097904,
      "step": 62016
    },
    {
      "epoch": 6.579354975599406,
      "grad_norm": 0.8513618969531702,
      "learning_rate": 2.1254375489240023e-05,
      "loss": 1.0057,
      "num_input_tokens_seen": 48792884704,
      "step": 62017
    },
    {
      "epoch": 6.579461065138977,
      "grad_norm": 0.8631957469501662,
      "learning_rate": 2.12536883663037e-05,
      "loss": 0.9951,
      "num_input_tokens_seen": 48793671568,
      "step": 62018
    },
    {
      "epoch": 6.579567154678549,
      "grad_norm": 0.8132091413111305,
      "learning_rate": 2.125300124626241e-05,
      "loss": 0.9683,
      "num_input_tokens_seen": 48794458368,
      "step": 62019
    },
    {
      "epoch": 6.57967324421812,
      "grad_norm": 0.9454456033395287,
      "learning_rate": 2.12523141291167e-05,
      "loss": 1.0589,
      "num_input_tokens_seen": 48795245120,
      "step": 62020
    },
    {
      "epoch": 6.579779333757692,
      "grad_norm": 0.8589308451744704,
      "learning_rate": 2.1251627014867087e-05,
      "loss": 1.0611,
      "num_input_tokens_seen": 48796031920,
      "step": 62021
    },
    {
      "epoch": 6.579885423297263,
      "grad_norm": 0.819575122698695,
      "learning_rate": 2.1250939903514104e-05,
      "loss": 1.0185,
      "num_input_tokens_seen": 48796818752,
      "step": 62022
    },
    {
      "epoch": 6.579991512836834,
      "grad_norm": 0.7497870251513515,
      "learning_rate": 2.1250252795058288e-05,
      "loss": 0.9404,
      "num_input_tokens_seen": 48797605552,
      "step": 62023
    },
    {
      "epoch": 6.580097602376406,
      "grad_norm": 0.6966253086454872,
      "learning_rate": 2.124956568950017e-05,
      "loss": 1.047,
      "num_input_tokens_seen": 48798392272,
      "step": 62024
    },
    {
      "epoch": 6.580203691915977,
      "grad_norm": 0.8135950280368377,
      "learning_rate": 2.124887858684027e-05,
      "loss": 1.0028,
      "num_input_tokens_seen": 48799179152,
      "step": 62025
    },
    {
      "epoch": 6.580309781455549,
      "grad_norm": 0.7878837510391072,
      "learning_rate": 2.124819148707913e-05,
      "loss": 1.031,
      "num_input_tokens_seen": 48799965984,
      "step": 62026
    },
    {
      "epoch": 6.58041587099512,
      "grad_norm": 1.2141336635245776,
      "learning_rate": 2.124750439021728e-05,
      "loss": 1.0783,
      "num_input_tokens_seen": 48800752800,
      "step": 62027
    },
    {
      "epoch": 6.580521960534691,
      "grad_norm": 0.7832330815934208,
      "learning_rate": 2.1246817296255246e-05,
      "loss": 0.9587,
      "num_input_tokens_seen": 48801539520,
      "step": 62028
    },
    {
      "epoch": 6.580628050074263,
      "grad_norm": 1.1092066502195388,
      "learning_rate": 2.124613020519356e-05,
      "loss": 1.0174,
      "num_input_tokens_seen": 48802326352,
      "step": 62029
    },
    {
      "epoch": 6.580734139613834,
      "grad_norm": 1.5264309607075626,
      "learning_rate": 2.1245443117032753e-05,
      "loss": 1.0133,
      "num_input_tokens_seen": 48803113008,
      "step": 62030
    },
    {
      "epoch": 6.580840229153406,
      "grad_norm": 0.8164886906653227,
      "learning_rate": 2.1244756031773365e-05,
      "loss": 1.0125,
      "num_input_tokens_seen": 48803899760,
      "step": 62031
    },
    {
      "epoch": 6.580946318692977,
      "grad_norm": 1.0161476252735828,
      "learning_rate": 2.1244068949415915e-05,
      "loss": 1.0302,
      "num_input_tokens_seen": 48804686448,
      "step": 62032
    },
    {
      "epoch": 6.581052408232548,
      "grad_norm": 0.9452242795700445,
      "learning_rate": 2.1243381869960935e-05,
      "loss": 1.0674,
      "num_input_tokens_seen": 48805473152,
      "step": 62033
    },
    {
      "epoch": 6.58115849777212,
      "grad_norm": 0.8547821591743134,
      "learning_rate": 2.124269479340896e-05,
      "loss": 1.1262,
      "num_input_tokens_seen": 48806259968,
      "step": 62034
    },
    {
      "epoch": 6.581264587311691,
      "grad_norm": 0.7078410483504946,
      "learning_rate": 2.1242007719760528e-05,
      "loss": 0.9177,
      "num_input_tokens_seen": 48807046768,
      "step": 62035
    },
    {
      "epoch": 6.581370676851263,
      "grad_norm": 0.8381724548813404,
      "learning_rate": 2.1241320649016154e-05,
      "loss": 0.9888,
      "num_input_tokens_seen": 48807833600,
      "step": 62036
    },
    {
      "epoch": 6.581476766390834,
      "grad_norm": 0.824365782158945,
      "learning_rate": 2.1240633581176385e-05,
      "loss": 1.0829,
      "num_input_tokens_seen": 48808620448,
      "step": 62037
    },
    {
      "epoch": 6.581582855930405,
      "grad_norm": 0.680220857464569,
      "learning_rate": 2.123994651624174e-05,
      "loss": 0.9738,
      "num_input_tokens_seen": 48809407312,
      "step": 62038
    },
    {
      "epoch": 6.581688945469977,
      "grad_norm": 0.8520627652196013,
      "learning_rate": 2.1239259454212747e-05,
      "loss": 0.9456,
      "num_input_tokens_seen": 48810194160,
      "step": 62039
    },
    {
      "epoch": 6.581795035009548,
      "grad_norm": 0.7821885638084914,
      "learning_rate": 2.123857239508995e-05,
      "loss": 1.0774,
      "num_input_tokens_seen": 48810980896,
      "step": 62040
    },
    {
      "epoch": 6.58190112454912,
      "grad_norm": 0.8185465860688109,
      "learning_rate": 2.123788533887388e-05,
      "loss": 1.0541,
      "num_input_tokens_seen": 48811767552,
      "step": 62041
    },
    {
      "epoch": 6.582007214088691,
      "grad_norm": 0.8923129810160982,
      "learning_rate": 2.123719828556505e-05,
      "loss": 1.0097,
      "num_input_tokens_seen": 48812554208,
      "step": 62042
    },
    {
      "epoch": 6.582113303628263,
      "grad_norm": 1.0804746078436984,
      "learning_rate": 2.1236511235164013e-05,
      "loss": 1.0526,
      "num_input_tokens_seen": 48813341040,
      "step": 62043
    },
    {
      "epoch": 6.582219393167834,
      "grad_norm": 0.9387905388620307,
      "learning_rate": 2.1235824187671286e-05,
      "loss": 1.0045,
      "num_input_tokens_seen": 48814127792,
      "step": 62044
    },
    {
      "epoch": 6.582325482707405,
      "grad_norm": 0.8185796764324215,
      "learning_rate": 2.1235137143087396e-05,
      "loss": 1.0306,
      "num_input_tokens_seen": 48814914576,
      "step": 62045
    },
    {
      "epoch": 6.582431572246977,
      "grad_norm": 0.8544898920813152,
      "learning_rate": 2.123445010141289e-05,
      "loss": 1.0193,
      "num_input_tokens_seen": 48815701392,
      "step": 62046
    },
    {
      "epoch": 6.582537661786548,
      "grad_norm": 0.8437510980647546,
      "learning_rate": 2.1233763062648287e-05,
      "loss": 1.0391,
      "num_input_tokens_seen": 48816488128,
      "step": 62047
    },
    {
      "epoch": 6.58264375132612,
      "grad_norm": 0.6024218468745361,
      "learning_rate": 2.1233076026794125e-05,
      "loss": 0.8757,
      "num_input_tokens_seen": 48817274960,
      "step": 62048
    },
    {
      "epoch": 6.582749840865691,
      "grad_norm": 0.7772392416368298,
      "learning_rate": 2.1232388993850934e-05,
      "loss": 1.0953,
      "num_input_tokens_seen": 48818061712,
      "step": 62049
    },
    {
      "epoch": 6.5828559304052625,
      "grad_norm": 0.6157299493178633,
      "learning_rate": 2.1231701963819232e-05,
      "loss": 1.0145,
      "num_input_tokens_seen": 48818848496,
      "step": 62050
    },
    {
      "epoch": 6.5829620199448335,
      "grad_norm": 0.8211910465307223,
      "learning_rate": 2.1231014936699566e-05,
      "loss": 1.0239,
      "num_input_tokens_seen": 48819635216,
      "step": 62051
    },
    {
      "epoch": 6.583068109484405,
      "grad_norm": 0.6924030941253136,
      "learning_rate": 2.1230327912492466e-05,
      "loss": 0.9616,
      "num_input_tokens_seen": 48820422048,
      "step": 62052
    },
    {
      "epoch": 6.5831741990239765,
      "grad_norm": 0.8091591864412289,
      "learning_rate": 2.1229640891198448e-05,
      "loss": 1.0245,
      "num_input_tokens_seen": 48821208832,
      "step": 62053
    },
    {
      "epoch": 6.5832802885635475,
      "grad_norm": 0.7095330600424741,
      "learning_rate": 2.1228953872818058e-05,
      "loss": 1.0848,
      "num_input_tokens_seen": 48821995536,
      "step": 62054
    },
    {
      "epoch": 6.583386378103119,
      "grad_norm": 0.7507621825795046,
      "learning_rate": 2.1228266857351826e-05,
      "loss": 0.9562,
      "num_input_tokens_seen": 48822782336,
      "step": 62055
    },
    {
      "epoch": 6.5834924676426905,
      "grad_norm": 0.6867448326728732,
      "learning_rate": 2.122757984480027e-05,
      "loss": 0.9901,
      "num_input_tokens_seen": 48823569168,
      "step": 62056
    },
    {
      "epoch": 6.5835985571822615,
      "grad_norm": 0.7375308440762706,
      "learning_rate": 2.1226892835163935e-05,
      "loss": 0.924,
      "num_input_tokens_seen": 48824355952,
      "step": 62057
    },
    {
      "epoch": 6.583704646721833,
      "grad_norm": 0.7589471861598096,
      "learning_rate": 2.122620582844335e-05,
      "loss": 1.0458,
      "num_input_tokens_seen": 48825142704,
      "step": 62058
    },
    {
      "epoch": 6.5838107362614045,
      "grad_norm": 0.6726396377846867,
      "learning_rate": 2.122551882463903e-05,
      "loss": 0.9134,
      "num_input_tokens_seen": 48825929520,
      "step": 62059
    },
    {
      "epoch": 6.583916825800976,
      "grad_norm": 0.744499661428593,
      "learning_rate": 2.1224831823751527e-05,
      "loss": 0.9174,
      "num_input_tokens_seen": 48826716256,
      "step": 62060
    },
    {
      "epoch": 6.584022915340547,
      "grad_norm": 0.7773702260005403,
      "learning_rate": 2.1224144825781368e-05,
      "loss": 1.0061,
      "num_input_tokens_seen": 48827502976,
      "step": 62061
    },
    {
      "epoch": 6.584129004880118,
      "grad_norm": 0.7826511466903894,
      "learning_rate": 2.122345783072907e-05,
      "loss": 1.0721,
      "num_input_tokens_seen": 48828289680,
      "step": 62062
    },
    {
      "epoch": 6.58423509441969,
      "grad_norm": 0.8240955566210256,
      "learning_rate": 2.1222770838595175e-05,
      "loss": 0.9843,
      "num_input_tokens_seen": 48829076416,
      "step": 62063
    },
    {
      "epoch": 6.584341183959261,
      "grad_norm": 0.6926428409326533,
      "learning_rate": 2.1222083849380213e-05,
      "loss": 1.0106,
      "num_input_tokens_seen": 48829863184,
      "step": 62064
    },
    {
      "epoch": 6.584447273498833,
      "grad_norm": 0.7652959465345429,
      "learning_rate": 2.1221396863084715e-05,
      "loss": 1.0506,
      "num_input_tokens_seen": 48830649984,
      "step": 62065
    },
    {
      "epoch": 6.584553363038404,
      "grad_norm": 0.7483726636052798,
      "learning_rate": 2.122070987970921e-05,
      "loss": 0.9591,
      "num_input_tokens_seen": 48831436768,
      "step": 62066
    },
    {
      "epoch": 6.584659452577975,
      "grad_norm": 0.8657318218488366,
      "learning_rate": 2.1220022899254226e-05,
      "loss": 0.9822,
      "num_input_tokens_seen": 48832223536,
      "step": 62067
    },
    {
      "epoch": 6.584765542117547,
      "grad_norm": 0.6227966331814814,
      "learning_rate": 2.1219335921720305e-05,
      "loss": 0.9123,
      "num_input_tokens_seen": 48833010384,
      "step": 62068
    },
    {
      "epoch": 6.584871631657118,
      "grad_norm": 0.762325189757914,
      "learning_rate": 2.1218648947107967e-05,
      "loss": 0.9899,
      "num_input_tokens_seen": 48833797152,
      "step": 62069
    },
    {
      "epoch": 6.58497772119669,
      "grad_norm": 0.8907040715308059,
      "learning_rate": 2.121796197541774e-05,
      "loss": 1.0502,
      "num_input_tokens_seen": 48834583968,
      "step": 62070
    },
    {
      "epoch": 6.585083810736261,
      "grad_norm": 1.0024247545923612,
      "learning_rate": 2.121727500665017e-05,
      "loss": 1.0031,
      "num_input_tokens_seen": 48835370640,
      "step": 62071
    },
    {
      "epoch": 6.585189900275833,
      "grad_norm": 0.7556050307015626,
      "learning_rate": 2.1216588040805775e-05,
      "loss": 1.0695,
      "num_input_tokens_seen": 48836157264,
      "step": 62072
    },
    {
      "epoch": 6.585295989815404,
      "grad_norm": 0.7073336053753583,
      "learning_rate": 2.1215901077885087e-05,
      "loss": 0.965,
      "num_input_tokens_seen": 48836944016,
      "step": 62073
    },
    {
      "epoch": 6.585402079354975,
      "grad_norm": 1.1328738010088426,
      "learning_rate": 2.1215214117888644e-05,
      "loss": 1.016,
      "num_input_tokens_seen": 48837730800,
      "step": 62074
    },
    {
      "epoch": 6.585508168894547,
      "grad_norm": 0.718889829424944,
      "learning_rate": 2.1214527160816973e-05,
      "loss": 0.9691,
      "num_input_tokens_seen": 48838517632,
      "step": 62075
    },
    {
      "epoch": 6.585614258434118,
      "grad_norm": 0.7026668830278331,
      "learning_rate": 2.1213840206670597e-05,
      "loss": 0.9688,
      "num_input_tokens_seen": 48839304384,
      "step": 62076
    },
    {
      "epoch": 6.58572034797369,
      "grad_norm": 1.1817003226662952,
      "learning_rate": 2.1213153255450053e-05,
      "loss": 0.9909,
      "num_input_tokens_seen": 48840091088,
      "step": 62077
    },
    {
      "epoch": 6.585826437513261,
      "grad_norm": 0.8701227628907211,
      "learning_rate": 2.121246630715588e-05,
      "loss": 1.0579,
      "num_input_tokens_seen": 48840877856,
      "step": 62078
    },
    {
      "epoch": 6.585932527052833,
      "grad_norm": 0.9585050339700012,
      "learning_rate": 2.1211779361788604e-05,
      "loss": 1.0517,
      "num_input_tokens_seen": 48841664688,
      "step": 62079
    },
    {
      "epoch": 6.586038616592404,
      "grad_norm": 0.8939000227668263,
      "learning_rate": 2.1211092419348745e-05,
      "loss": 1.0117,
      "num_input_tokens_seen": 48842451376,
      "step": 62080
    },
    {
      "epoch": 6.586144706131975,
      "grad_norm": 0.6900477590461119,
      "learning_rate": 2.1210405479836853e-05,
      "loss": 0.9697,
      "num_input_tokens_seen": 48843238272,
      "step": 62081
    },
    {
      "epoch": 6.586250795671547,
      "grad_norm": 0.8876607282362856,
      "learning_rate": 2.1209718543253445e-05,
      "loss": 0.9822,
      "num_input_tokens_seen": 48844025024,
      "step": 62082
    },
    {
      "epoch": 6.586356885211118,
      "grad_norm": 0.8160500689301238,
      "learning_rate": 2.120903160959905e-05,
      "loss": 0.9767,
      "num_input_tokens_seen": 48844811824,
      "step": 62083
    },
    {
      "epoch": 6.58646297475069,
      "grad_norm": 0.7594360504678712,
      "learning_rate": 2.1208344678874212e-05,
      "loss": 0.9614,
      "num_input_tokens_seen": 48845598608,
      "step": 62084
    },
    {
      "epoch": 6.586569064290261,
      "grad_norm": 1.009665641484526,
      "learning_rate": 2.1207657751079445e-05,
      "loss": 1.0293,
      "num_input_tokens_seen": 48846385456,
      "step": 62085
    },
    {
      "epoch": 6.586675153829832,
      "grad_norm": 0.6879157387437026,
      "learning_rate": 2.1206970826215297e-05,
      "loss": 0.951,
      "num_input_tokens_seen": 48847172384,
      "step": 62086
    },
    {
      "epoch": 6.586781243369404,
      "grad_norm": 0.7445882017775882,
      "learning_rate": 2.120628390428229e-05,
      "loss": 1.011,
      "num_input_tokens_seen": 48847959200,
      "step": 62087
    },
    {
      "epoch": 6.586887332908975,
      "grad_norm": 0.8696156579252994,
      "learning_rate": 2.120559698528095e-05,
      "loss": 1.0456,
      "num_input_tokens_seen": 48848745904,
      "step": 62088
    },
    {
      "epoch": 6.586993422448547,
      "grad_norm": 0.7568855196839843,
      "learning_rate": 2.120491006921182e-05,
      "loss": 1.0468,
      "num_input_tokens_seen": 48849532688,
      "step": 62089
    },
    {
      "epoch": 6.587099511988118,
      "grad_norm": 0.740279931097866,
      "learning_rate": 2.120422315607542e-05,
      "loss": 0.9469,
      "num_input_tokens_seen": 48850319520,
      "step": 62090
    },
    {
      "epoch": 6.587205601527689,
      "grad_norm": 1.0344592394747056,
      "learning_rate": 2.1203536245872282e-05,
      "loss": 0.9615,
      "num_input_tokens_seen": 48851106288,
      "step": 62091
    },
    {
      "epoch": 6.587311691067261,
      "grad_norm": 0.9300761088504005,
      "learning_rate": 2.120284933860295e-05,
      "loss": 1.0594,
      "num_input_tokens_seen": 48851893184,
      "step": 62092
    },
    {
      "epoch": 6.587417780606832,
      "grad_norm": 0.9934830554968248,
      "learning_rate": 2.1202162434267935e-05,
      "loss": 0.9623,
      "num_input_tokens_seen": 48852679872,
      "step": 62093
    },
    {
      "epoch": 6.587523870146404,
      "grad_norm": 1.0335564926189398,
      "learning_rate": 2.120147553286778e-05,
      "loss": 1.1047,
      "num_input_tokens_seen": 48853466736,
      "step": 62094
    },
    {
      "epoch": 6.587629959685975,
      "grad_norm": 0.6640971594860671,
      "learning_rate": 2.1200788634403014e-05,
      "loss": 1.0085,
      "num_input_tokens_seen": 48854253568,
      "step": 62095
    },
    {
      "epoch": 6.587736049225546,
      "grad_norm": 0.9867426938161836,
      "learning_rate": 2.1200101738874172e-05,
      "loss": 0.9727,
      "num_input_tokens_seen": 48855040368,
      "step": 62096
    },
    {
      "epoch": 6.587842138765118,
      "grad_norm": 1.1371120002788135,
      "learning_rate": 2.119941484628177e-05,
      "loss": 0.9752,
      "num_input_tokens_seen": 48855827088,
      "step": 62097
    },
    {
      "epoch": 6.587948228304689,
      "grad_norm": 0.8761177295105346,
      "learning_rate": 2.1198727956626354e-05,
      "loss": 0.9524,
      "num_input_tokens_seen": 48856613904,
      "step": 62098
    },
    {
      "epoch": 6.588054317844261,
      "grad_norm": 0.8224449461388679,
      "learning_rate": 2.1198041069908446e-05,
      "loss": 1.0207,
      "num_input_tokens_seen": 48857400624,
      "step": 62099
    },
    {
      "epoch": 6.588160407383832,
      "grad_norm": 0.990226317591373,
      "learning_rate": 2.1197354186128584e-05,
      "loss": 0.9527,
      "num_input_tokens_seen": 48858187472,
      "step": 62100
    },
    {
      "epoch": 6.588266496923404,
      "grad_norm": 0.7477309975710925,
      "learning_rate": 2.11966673052873e-05,
      "loss": 1.0254,
      "num_input_tokens_seen": 48858974192,
      "step": 62101
    },
    {
      "epoch": 6.588372586462975,
      "grad_norm": 1.1341374487821032,
      "learning_rate": 2.119598042738511e-05,
      "loss": 1.0191,
      "num_input_tokens_seen": 48859760928,
      "step": 62102
    },
    {
      "epoch": 6.588478676002546,
      "grad_norm": 0.992929812662415,
      "learning_rate": 2.119529355242256e-05,
      "loss": 1.014,
      "num_input_tokens_seen": 48860547664,
      "step": 62103
    },
    {
      "epoch": 6.588584765542118,
      "grad_norm": 0.79346896934892,
      "learning_rate": 2.1194606680400176e-05,
      "loss": 0.9745,
      "num_input_tokens_seen": 48861334432,
      "step": 62104
    },
    {
      "epoch": 6.588690855081689,
      "grad_norm": 0.7181867546958911,
      "learning_rate": 2.1193919811318483e-05,
      "loss": 0.9638,
      "num_input_tokens_seen": 48862121280,
      "step": 62105
    },
    {
      "epoch": 6.588796944621261,
      "grad_norm": 0.7577708867713795,
      "learning_rate": 2.1193232945178024e-05,
      "loss": 0.9842,
      "num_input_tokens_seen": 48862908064,
      "step": 62106
    },
    {
      "epoch": 6.588903034160832,
      "grad_norm": 0.779521906614467,
      "learning_rate": 2.119254608197932e-05,
      "loss": 0.9484,
      "num_input_tokens_seen": 48863694912,
      "step": 62107
    },
    {
      "epoch": 6.589009123700404,
      "grad_norm": 0.716559049762529,
      "learning_rate": 2.1191859221722903e-05,
      "loss": 1.0523,
      "num_input_tokens_seen": 48864481744,
      "step": 62108
    },
    {
      "epoch": 6.589115213239975,
      "grad_norm": 0.6878172976373244,
      "learning_rate": 2.1191172364409306e-05,
      "loss": 1.0223,
      "num_input_tokens_seen": 48865268576,
      "step": 62109
    },
    {
      "epoch": 6.589221302779546,
      "grad_norm": 0.8989865546117666,
      "learning_rate": 2.1190485510039065e-05,
      "loss": 0.9589,
      "num_input_tokens_seen": 48866055360,
      "step": 62110
    },
    {
      "epoch": 6.589327392319118,
      "grad_norm": 0.8073960804726575,
      "learning_rate": 2.1189798658612694e-05,
      "loss": 0.9831,
      "num_input_tokens_seen": 48866842192,
      "step": 62111
    },
    {
      "epoch": 6.589433481858689,
      "grad_norm": 0.7578398282024621,
      "learning_rate": 2.1189111810130748e-05,
      "loss": 0.9165,
      "num_input_tokens_seen": 48867629008,
      "step": 62112
    },
    {
      "epoch": 6.5895395713982605,
      "grad_norm": 0.796635401076558,
      "learning_rate": 2.1188424964593735e-05,
      "loss": 0.9268,
      "num_input_tokens_seen": 48868415840,
      "step": 62113
    },
    {
      "epoch": 6.5896456609378316,
      "grad_norm": 0.7761336611234696,
      "learning_rate": 2.1187738122002195e-05,
      "loss": 0.9642,
      "num_input_tokens_seen": 48869202592,
      "step": 62114
    },
    {
      "epoch": 6.589751750477403,
      "grad_norm": 0.8479375932008458,
      "learning_rate": 2.1187051282356666e-05,
      "loss": 0.8727,
      "num_input_tokens_seen": 48869989344,
      "step": 62115
    },
    {
      "epoch": 6.5898578400169745,
      "grad_norm": 0.8067709772838224,
      "learning_rate": 2.1186364445657663e-05,
      "loss": 1.0364,
      "num_input_tokens_seen": 48870776048,
      "step": 62116
    },
    {
      "epoch": 6.5899639295565455,
      "grad_norm": 0.9471120226336837,
      "learning_rate": 2.1185677611905732e-05,
      "loss": 1.0472,
      "num_input_tokens_seen": 48871562720,
      "step": 62117
    },
    {
      "epoch": 6.5900700190961174,
      "grad_norm": 0.7684090813521214,
      "learning_rate": 2.11849907811014e-05,
      "loss": 1.0245,
      "num_input_tokens_seen": 48872349520,
      "step": 62118
    },
    {
      "epoch": 6.5901761086356885,
      "grad_norm": 0.756781970011796,
      "learning_rate": 2.1184303953245185e-05,
      "loss": 1.0038,
      "num_input_tokens_seen": 48873136256,
      "step": 62119
    },
    {
      "epoch": 6.5902821981752595,
      "grad_norm": 1.0813468949978784,
      "learning_rate": 2.118361712833764e-05,
      "loss": 0.9659,
      "num_input_tokens_seen": 48873923072,
      "step": 62120
    },
    {
      "epoch": 6.590388287714831,
      "grad_norm": 0.8087758734327973,
      "learning_rate": 2.118293030637928e-05,
      "loss": 0.9347,
      "num_input_tokens_seen": 48874709856,
      "step": 62121
    },
    {
      "epoch": 6.5904943772544025,
      "grad_norm": 0.9684973089783241,
      "learning_rate": 2.118224348737063e-05,
      "loss": 0.9966,
      "num_input_tokens_seen": 48875496656,
      "step": 62122
    },
    {
      "epoch": 6.590600466793974,
      "grad_norm": 0.8523498211848515,
      "learning_rate": 2.1181556671312242e-05,
      "loss": 1.0466,
      "num_input_tokens_seen": 48876283456,
      "step": 62123
    },
    {
      "epoch": 6.590706556333545,
      "grad_norm": 0.814534334572135,
      "learning_rate": 2.118086985820463e-05,
      "loss": 0.9921,
      "num_input_tokens_seen": 48877070224,
      "step": 62124
    },
    {
      "epoch": 6.590812645873116,
      "grad_norm": 0.9983731126533135,
      "learning_rate": 2.1180183048048328e-05,
      "loss": 1.0065,
      "num_input_tokens_seen": 48877856880,
      "step": 62125
    },
    {
      "epoch": 6.590918735412688,
      "grad_norm": 0.7941548502500493,
      "learning_rate": 2.1179496240843873e-05,
      "loss": 1.0636,
      "num_input_tokens_seen": 48878643648,
      "step": 62126
    },
    {
      "epoch": 6.591024824952259,
      "grad_norm": 1.0161379253252905,
      "learning_rate": 2.117880943659179e-05,
      "loss": 0.9813,
      "num_input_tokens_seen": 48879430432,
      "step": 62127
    },
    {
      "epoch": 6.591130914491831,
      "grad_norm": 0.7055298731450785,
      "learning_rate": 2.1178122635292606e-05,
      "loss": 1.0243,
      "num_input_tokens_seen": 48880217296,
      "step": 62128
    },
    {
      "epoch": 6.591237004031402,
      "grad_norm": 0.8723971557555912,
      "learning_rate": 2.1177435836946862e-05,
      "loss": 0.9229,
      "num_input_tokens_seen": 48881004192,
      "step": 62129
    },
    {
      "epoch": 6.591343093570974,
      "grad_norm": 0.8564353816972923,
      "learning_rate": 2.1176749041555085e-05,
      "loss": 0.9657,
      "num_input_tokens_seen": 48881791008,
      "step": 62130
    },
    {
      "epoch": 6.591449183110545,
      "grad_norm": 0.8166664138468288,
      "learning_rate": 2.11760622491178e-05,
      "loss": 0.9789,
      "num_input_tokens_seen": 48882577744,
      "step": 62131
    },
    {
      "epoch": 6.591555272650116,
      "grad_norm": 0.9694949383225071,
      "learning_rate": 2.1175375459635543e-05,
      "loss": 1.0626,
      "num_input_tokens_seen": 48883364528,
      "step": 62132
    },
    {
      "epoch": 6.591661362189688,
      "grad_norm": 0.7352551200733801,
      "learning_rate": 2.117468867310884e-05,
      "loss": 0.9933,
      "num_input_tokens_seen": 48884151264,
      "step": 62133
    },
    {
      "epoch": 6.591767451729259,
      "grad_norm": 0.9349446030925873,
      "learning_rate": 2.117400188953823e-05,
      "loss": 0.9322,
      "num_input_tokens_seen": 48884938048,
      "step": 62134
    },
    {
      "epoch": 6.591873541268831,
      "grad_norm": 0.8572764851309129,
      "learning_rate": 2.117331510892424e-05,
      "loss": 1.0428,
      "num_input_tokens_seen": 48885724800,
      "step": 62135
    },
    {
      "epoch": 6.591979630808402,
      "grad_norm": 0.9419870547316231,
      "learning_rate": 2.1172628331267394e-05,
      "loss": 1.0683,
      "num_input_tokens_seen": 48886511504,
      "step": 62136
    },
    {
      "epoch": 6.592085720347974,
      "grad_norm": 0.6974281744325143,
      "learning_rate": 2.1171941556568235e-05,
      "loss": 0.973,
      "num_input_tokens_seen": 48887298224,
      "step": 62137
    },
    {
      "epoch": 6.592191809887545,
      "grad_norm": 0.7355657936578205,
      "learning_rate": 2.1171254784827287e-05,
      "loss": 1.0144,
      "num_input_tokens_seen": 48888085040,
      "step": 62138
    },
    {
      "epoch": 6.592297899427116,
      "grad_norm": 0.7891181714805879,
      "learning_rate": 2.1170568016045077e-05,
      "loss": 1.0424,
      "num_input_tokens_seen": 48888871856,
      "step": 62139
    },
    {
      "epoch": 6.592403988966688,
      "grad_norm": 0.7791378965369457,
      "learning_rate": 2.116988125022214e-05,
      "loss": 1.0092,
      "num_input_tokens_seen": 48889658672,
      "step": 62140
    },
    {
      "epoch": 6.592510078506259,
      "grad_norm": 0.7814120856668351,
      "learning_rate": 2.1169194487359008e-05,
      "loss": 1.0303,
      "num_input_tokens_seen": 48890445408,
      "step": 62141
    },
    {
      "epoch": 6.592616168045831,
      "grad_norm": 0.8043797057742753,
      "learning_rate": 2.1168507727456206e-05,
      "loss": 0.9796,
      "num_input_tokens_seen": 48891232160,
      "step": 62142
    },
    {
      "epoch": 6.592722257585402,
      "grad_norm": 0.7154926910646285,
      "learning_rate": 2.1167820970514277e-05,
      "loss": 0.929,
      "num_input_tokens_seen": 48892019008,
      "step": 62143
    },
    {
      "epoch": 6.592828347124973,
      "grad_norm": 1.269176742492777,
      "learning_rate": 2.116713421653374e-05,
      "loss": 1.0313,
      "num_input_tokens_seen": 48892805808,
      "step": 62144
    },
    {
      "epoch": 6.592934436664545,
      "grad_norm": 0.7289501556589111,
      "learning_rate": 2.1166447465515128e-05,
      "loss": 0.996,
      "num_input_tokens_seen": 48893592464,
      "step": 62145
    },
    {
      "epoch": 6.593040526204116,
      "grad_norm": 0.7890245591288898,
      "learning_rate": 2.116576071745897e-05,
      "loss": 1.0349,
      "num_input_tokens_seen": 48894379152,
      "step": 62146
    },
    {
      "epoch": 6.593146615743688,
      "grad_norm": 0.738737538008559,
      "learning_rate": 2.1165073972365805e-05,
      "loss": 1.0222,
      "num_input_tokens_seen": 48895165936,
      "step": 62147
    },
    {
      "epoch": 6.593252705283259,
      "grad_norm": 0.6788866659224411,
      "learning_rate": 2.1164387230236153e-05,
      "loss": 1.026,
      "num_input_tokens_seen": 48895952688,
      "step": 62148
    },
    {
      "epoch": 6.59335879482283,
      "grad_norm": 0.8121210997812629,
      "learning_rate": 2.1163700491070555e-05,
      "loss": 1.0414,
      "num_input_tokens_seen": 48896739504,
      "step": 62149
    },
    {
      "epoch": 6.593464884362402,
      "grad_norm": 0.7142695909574452,
      "learning_rate": 2.116301375486953e-05,
      "loss": 1.0004,
      "num_input_tokens_seen": 48897526304,
      "step": 62150
    },
    {
      "epoch": 6.593570973901973,
      "grad_norm": 0.7478165107422843,
      "learning_rate": 2.1162327021633628e-05,
      "loss": 0.9914,
      "num_input_tokens_seen": 48898313104,
      "step": 62151
    },
    {
      "epoch": 6.593677063441545,
      "grad_norm": 0.7413305350517856,
      "learning_rate": 2.116164029136336e-05,
      "loss": 0.9546,
      "num_input_tokens_seen": 48899099888,
      "step": 62152
    },
    {
      "epoch": 6.593783152981116,
      "grad_norm": 1.0846591362470561,
      "learning_rate": 2.1160953564059258e-05,
      "loss": 1.0794,
      "num_input_tokens_seen": 48899886576,
      "step": 62153
    },
    {
      "epoch": 6.593889242520687,
      "grad_norm": 0.6690604942329347,
      "learning_rate": 2.1160266839721865e-05,
      "loss": 0.9688,
      "num_input_tokens_seen": 48900673328,
      "step": 62154
    },
    {
      "epoch": 6.593995332060259,
      "grad_norm": 0.7324154379946025,
      "learning_rate": 2.1159580118351707e-05,
      "loss": 0.9901,
      "num_input_tokens_seen": 48901460160,
      "step": 62155
    },
    {
      "epoch": 6.59410142159983,
      "grad_norm": 0.9106640908650274,
      "learning_rate": 2.1158893399949306e-05,
      "loss": 0.9994,
      "num_input_tokens_seen": 48902246864,
      "step": 62156
    },
    {
      "epoch": 6.594207511139402,
      "grad_norm": 0.7621479097510951,
      "learning_rate": 2.1158206684515202e-05,
      "loss": 0.9911,
      "num_input_tokens_seen": 48903033632,
      "step": 62157
    },
    {
      "epoch": 6.594313600678973,
      "grad_norm": 0.7278178674659239,
      "learning_rate": 2.115751997204993e-05,
      "loss": 0.9277,
      "num_input_tokens_seen": 48903820480,
      "step": 62158
    },
    {
      "epoch": 6.594419690218545,
      "grad_norm": 0.8752099583619294,
      "learning_rate": 2.1156833262554e-05,
      "loss": 1.0106,
      "num_input_tokens_seen": 48904607216,
      "step": 62159
    },
    {
      "epoch": 6.594525779758116,
      "grad_norm": 0.7946066536450007,
      "learning_rate": 2.1156146556027966e-05,
      "loss": 0.9744,
      "num_input_tokens_seen": 48905393984,
      "step": 62160
    },
    {
      "epoch": 6.594631869297688,
      "grad_norm": 0.7079180450767857,
      "learning_rate": 2.1155459852472354e-05,
      "loss": 0.9636,
      "num_input_tokens_seen": 48906180720,
      "step": 62161
    },
    {
      "epoch": 6.594737958837259,
      "grad_norm": 1.109070306747554,
      "learning_rate": 2.1154773151887677e-05,
      "loss": 1.0837,
      "num_input_tokens_seen": 48906967456,
      "step": 62162
    },
    {
      "epoch": 6.59484404837683,
      "grad_norm": 0.9351947829767074,
      "learning_rate": 2.115408645427449e-05,
      "loss": 0.9804,
      "num_input_tokens_seen": 48907754144,
      "step": 62163
    },
    {
      "epoch": 6.594950137916402,
      "grad_norm": 0.7332832508469287,
      "learning_rate": 2.1153399759633306e-05,
      "loss": 1.0369,
      "num_input_tokens_seen": 48908540864,
      "step": 62164
    },
    {
      "epoch": 6.595056227455973,
      "grad_norm": 0.9615008300172019,
      "learning_rate": 2.1152713067964657e-05,
      "loss": 1.0296,
      "num_input_tokens_seen": 48909327616,
      "step": 62165
    },
    {
      "epoch": 6.595162316995545,
      "grad_norm": 0.732391590085938,
      "learning_rate": 2.115202637926909e-05,
      "loss": 0.9368,
      "num_input_tokens_seen": 48910114368,
      "step": 62166
    },
    {
      "epoch": 6.595268406535116,
      "grad_norm": 0.8468608834325868,
      "learning_rate": 2.1151339693547113e-05,
      "loss": 0.9799,
      "num_input_tokens_seen": 48910901120,
      "step": 62167
    },
    {
      "epoch": 6.595374496074687,
      "grad_norm": 0.8731315921390256,
      "learning_rate": 2.1150653010799276e-05,
      "loss": 1.0133,
      "num_input_tokens_seen": 48911687872,
      "step": 62168
    },
    {
      "epoch": 6.595480585614259,
      "grad_norm": 0.7793520527353742,
      "learning_rate": 2.11499663310261e-05,
      "loss": 0.941,
      "num_input_tokens_seen": 48912474704,
      "step": 62169
    },
    {
      "epoch": 6.59558667515383,
      "grad_norm": 0.8495296016465179,
      "learning_rate": 2.114927965422811e-05,
      "loss": 0.9881,
      "num_input_tokens_seen": 48913261552,
      "step": 62170
    },
    {
      "epoch": 6.595692764693402,
      "grad_norm": 0.6770753447832538,
      "learning_rate": 2.114859298040585e-05,
      "loss": 1.0387,
      "num_input_tokens_seen": 48914048272,
      "step": 62171
    },
    {
      "epoch": 6.595798854232973,
      "grad_norm": 0.7255538886942314,
      "learning_rate": 2.1147906309559837e-05,
      "loss": 0.9583,
      "num_input_tokens_seen": 48914835072,
      "step": 62172
    },
    {
      "epoch": 6.595904943772544,
      "grad_norm": 0.704215665281833,
      "learning_rate": 2.1147219641690617e-05,
      "loss": 0.9672,
      "num_input_tokens_seen": 48915621792,
      "step": 62173
    },
    {
      "epoch": 6.596011033312116,
      "grad_norm": 0.6597199423816837,
      "learning_rate": 2.114653297679871e-05,
      "loss": 0.9975,
      "num_input_tokens_seen": 48916408512,
      "step": 62174
    },
    {
      "epoch": 6.596117122851687,
      "grad_norm": 0.8736453260170136,
      "learning_rate": 2.114584631488465e-05,
      "loss": 1.0545,
      "num_input_tokens_seen": 48917195264,
      "step": 62175
    },
    {
      "epoch": 6.5962232123912585,
      "grad_norm": 0.7691375864621195,
      "learning_rate": 2.1145159655948972e-05,
      "loss": 1.0176,
      "num_input_tokens_seen": 48917982032,
      "step": 62176
    },
    {
      "epoch": 6.59632930193083,
      "grad_norm": 0.7400611632848778,
      "learning_rate": 2.114447299999219e-05,
      "loss": 1.0236,
      "num_input_tokens_seen": 48918768896,
      "step": 62177
    },
    {
      "epoch": 6.596435391470401,
      "grad_norm": 0.7120961233745593,
      "learning_rate": 2.1143786347014854e-05,
      "loss": 0.9417,
      "num_input_tokens_seen": 48919555648,
      "step": 62178
    },
    {
      "epoch": 6.5965414810099725,
      "grad_norm": 0.7800303757430206,
      "learning_rate": 2.114309969701749e-05,
      "loss": 0.9367,
      "num_input_tokens_seen": 48920342400,
      "step": 62179
    },
    {
      "epoch": 6.5966475705495435,
      "grad_norm": 0.8348049878813476,
      "learning_rate": 2.1142413050000617e-05,
      "loss": 1.0342,
      "num_input_tokens_seen": 48921129232,
      "step": 62180
    },
    {
      "epoch": 6.5967536600891155,
      "grad_norm": 0.8046038131772317,
      "learning_rate": 2.1141726405964778e-05,
      "loss": 1.0265,
      "num_input_tokens_seen": 48921915952,
      "step": 62181
    },
    {
      "epoch": 6.5968597496286865,
      "grad_norm": 0.7688982357836636,
      "learning_rate": 2.1141039764910504e-05,
      "loss": 0.9768,
      "num_input_tokens_seen": 48922702720,
      "step": 62182
    },
    {
      "epoch": 6.5969658391682575,
      "grad_norm": 0.8794892428860134,
      "learning_rate": 2.1140353126838315e-05,
      "loss": 0.9923,
      "num_input_tokens_seen": 48923489488,
      "step": 62183
    },
    {
      "epoch": 6.597071928707829,
      "grad_norm": 0.6975571675229856,
      "learning_rate": 2.113966649174875e-05,
      "loss": 0.9934,
      "num_input_tokens_seen": 48924276336,
      "step": 62184
    },
    {
      "epoch": 6.5971780182474005,
      "grad_norm": 0.9127795052303892,
      "learning_rate": 2.113897985964234e-05,
      "loss": 0.9828,
      "num_input_tokens_seen": 48925062992,
      "step": 62185
    },
    {
      "epoch": 6.597284107786972,
      "grad_norm": 0.8728338016502887,
      "learning_rate": 2.1138293230519608e-05,
      "loss": 1.0234,
      "num_input_tokens_seen": 48925849664,
      "step": 62186
    },
    {
      "epoch": 6.597390197326543,
      "grad_norm": 0.8338145194091837,
      "learning_rate": 2.113760660438109e-05,
      "loss": 1.0376,
      "num_input_tokens_seen": 48926636336,
      "step": 62187
    },
    {
      "epoch": 6.597496286866115,
      "grad_norm": 1.6131896328990694,
      "learning_rate": 2.1136919981227316e-05,
      "loss": 1.0847,
      "num_input_tokens_seen": 48927423056,
      "step": 62188
    },
    {
      "epoch": 6.597602376405686,
      "grad_norm": 0.8578382226702235,
      "learning_rate": 2.1136233361058822e-05,
      "loss": 0.9649,
      "num_input_tokens_seen": 48928209824,
      "step": 62189
    },
    {
      "epoch": 6.597708465945258,
      "grad_norm": 1.5215503371319712,
      "learning_rate": 2.1135546743876132e-05,
      "loss": 1.0031,
      "num_input_tokens_seen": 48928996560,
      "step": 62190
    },
    {
      "epoch": 6.597814555484829,
      "grad_norm": 0.9948774656431468,
      "learning_rate": 2.1134860129679772e-05,
      "loss": 0.8978,
      "num_input_tokens_seen": 48929783408,
      "step": 62191
    },
    {
      "epoch": 6.5979206450244,
      "grad_norm": 0.7460948444554065,
      "learning_rate": 2.1134173518470288e-05,
      "loss": 0.9851,
      "num_input_tokens_seen": 48930570160,
      "step": 62192
    },
    {
      "epoch": 6.598026734563972,
      "grad_norm": 1.1524771788916712,
      "learning_rate": 2.1133486910248197e-05,
      "loss": 1.0672,
      "num_input_tokens_seen": 48931356976,
      "step": 62193
    },
    {
      "epoch": 6.598132824103543,
      "grad_norm": 1.1020144022779828,
      "learning_rate": 2.1132800305014032e-05,
      "loss": 0.9852,
      "num_input_tokens_seen": 48932143680,
      "step": 62194
    },
    {
      "epoch": 6.598238913643115,
      "grad_norm": 0.7504602281410327,
      "learning_rate": 2.1132113702768328e-05,
      "loss": 1.0217,
      "num_input_tokens_seen": 48932930400,
      "step": 62195
    },
    {
      "epoch": 6.598345003182686,
      "grad_norm": 0.8087829565115485,
      "learning_rate": 2.1131427103511613e-05,
      "loss": 1.0408,
      "num_input_tokens_seen": 48933717184,
      "step": 62196
    },
    {
      "epoch": 6.598451092722257,
      "grad_norm": 0.873685029108864,
      "learning_rate": 2.1130740507244414e-05,
      "loss": 1.0203,
      "num_input_tokens_seen": 48934503968,
      "step": 62197
    },
    {
      "epoch": 6.598557182261829,
      "grad_norm": 0.8785624254919012,
      "learning_rate": 2.113005391396727e-05,
      "loss": 1.0821,
      "num_input_tokens_seen": 48935290784,
      "step": 62198
    },
    {
      "epoch": 6.5986632718014,
      "grad_norm": 0.7505876395574567,
      "learning_rate": 2.1129367323680706e-05,
      "loss": 0.916,
      "num_input_tokens_seen": 48936077600,
      "step": 62199
    },
    {
      "epoch": 6.598769361340972,
      "grad_norm": 0.7388665279171552,
      "learning_rate": 2.112868073638525e-05,
      "loss": 1.0181,
      "num_input_tokens_seen": 48936864336,
      "step": 62200
    },
    {
      "epoch": 6.598875450880543,
      "grad_norm": 1.0205951712589205,
      "learning_rate": 2.112799415208144e-05,
      "loss": 0.9997,
      "num_input_tokens_seen": 48937651088,
      "step": 62201
    },
    {
      "epoch": 6.598981540420114,
      "grad_norm": 0.7286645501154034,
      "learning_rate": 2.1127307570769797e-05,
      "loss": 1.0421,
      "num_input_tokens_seen": 48938437920,
      "step": 62202
    },
    {
      "epoch": 6.599087629959686,
      "grad_norm": 0.9255457789615262,
      "learning_rate": 2.1126620992450862e-05,
      "loss": 1.047,
      "num_input_tokens_seen": 48939224656,
      "step": 62203
    },
    {
      "epoch": 6.599193719499257,
      "grad_norm": 1.0102903976763797,
      "learning_rate": 2.112593441712516e-05,
      "loss": 1.0478,
      "num_input_tokens_seen": 48940011424,
      "step": 62204
    },
    {
      "epoch": 6.599299809038829,
      "grad_norm": 0.7523330918884324,
      "learning_rate": 2.112524784479322e-05,
      "loss": 1.0232,
      "num_input_tokens_seen": 48940798288,
      "step": 62205
    },
    {
      "epoch": 6.5994058985784,
      "grad_norm": 1.1310509209990276,
      "learning_rate": 2.1124561275455576e-05,
      "loss": 0.9862,
      "num_input_tokens_seen": 48941585088,
      "step": 62206
    },
    {
      "epoch": 6.599511988117971,
      "grad_norm": 0.9378494353110034,
      "learning_rate": 2.1123874709112763e-05,
      "loss": 1.0421,
      "num_input_tokens_seen": 48942371760,
      "step": 62207
    },
    {
      "epoch": 6.599618077657543,
      "grad_norm": 0.8400512311389209,
      "learning_rate": 2.1123188145765295e-05,
      "loss": 1.0068,
      "num_input_tokens_seen": 48943158544,
      "step": 62208
    },
    {
      "epoch": 6.599724167197114,
      "grad_norm": 1.13160225021619,
      "learning_rate": 2.112250158541372e-05,
      "loss": 1.0166,
      "num_input_tokens_seen": 48943945296,
      "step": 62209
    },
    {
      "epoch": 6.599830256736686,
      "grad_norm": 0.9366437836689345,
      "learning_rate": 2.1121815028058562e-05,
      "loss": 1.0003,
      "num_input_tokens_seen": 48944732032,
      "step": 62210
    },
    {
      "epoch": 6.599936346276257,
      "grad_norm": 0.9020399692655771,
      "learning_rate": 2.1121128473700347e-05,
      "loss": 0.9925,
      "num_input_tokens_seen": 48945518688,
      "step": 62211
    },
    {
      "epoch": 6.600042435815829,
      "grad_norm": 1.0421744453740127,
      "learning_rate": 2.112044192233962e-05,
      "loss": 0.9924,
      "num_input_tokens_seen": 48946305376,
      "step": 62212
    },
    {
      "epoch": 6.6001485253554,
      "grad_norm": 0.9126068487996467,
      "learning_rate": 2.1119755373976892e-05,
      "loss": 1.0064,
      "num_input_tokens_seen": 48947092080,
      "step": 62213
    },
    {
      "epoch": 6.600254614894971,
      "grad_norm": 0.8584045020230316,
      "learning_rate": 2.1119068828612703e-05,
      "loss": 1.0383,
      "num_input_tokens_seen": 48947878816,
      "step": 62214
    },
    {
      "epoch": 6.600360704434543,
      "grad_norm": 0.958151903658364,
      "learning_rate": 2.111838228624759e-05,
      "loss": 1.1079,
      "num_input_tokens_seen": 48948665568,
      "step": 62215
    },
    {
      "epoch": 6.600466793974114,
      "grad_norm": 0.8644208803801943,
      "learning_rate": 2.1117695746882078e-05,
      "loss": 0.9948,
      "num_input_tokens_seen": 48949452352,
      "step": 62216
    },
    {
      "epoch": 6.600572883513686,
      "grad_norm": 0.696797921836364,
      "learning_rate": 2.111700921051669e-05,
      "loss": 1.0022,
      "num_input_tokens_seen": 48950239120,
      "step": 62217
    },
    {
      "epoch": 6.600678973053257,
      "grad_norm": 0.9760010372783499,
      "learning_rate": 2.111632267715197e-05,
      "loss": 1.0444,
      "num_input_tokens_seen": 48951025808,
      "step": 62218
    },
    {
      "epoch": 6.600785062592829,
      "grad_norm": 0.847549361385824,
      "learning_rate": 2.111563614678843e-05,
      "loss": 1.0511,
      "num_input_tokens_seen": 48951812608,
      "step": 62219
    },
    {
      "epoch": 6.6008911521324,
      "grad_norm": 0.6880633597761103,
      "learning_rate": 2.1114949619426623e-05,
      "loss": 1.0051,
      "num_input_tokens_seen": 48952599440,
      "step": 62220
    },
    {
      "epoch": 6.600997241671971,
      "grad_norm": 0.8318434441208542,
      "learning_rate": 2.1114263095067072e-05,
      "loss": 0.9973,
      "num_input_tokens_seen": 48953386224,
      "step": 62221
    },
    {
      "epoch": 6.601103331211543,
      "grad_norm": 0.7538558821857152,
      "learning_rate": 2.1113576573710294e-05,
      "loss": 0.9677,
      "num_input_tokens_seen": 48954173040,
      "step": 62222
    },
    {
      "epoch": 6.601209420751114,
      "grad_norm": 0.7276538507727098,
      "learning_rate": 2.1112890055356837e-05,
      "loss": 0.9089,
      "num_input_tokens_seen": 48954959856,
      "step": 62223
    },
    {
      "epoch": 6.601315510290686,
      "grad_norm": 0.6153504807340351,
      "learning_rate": 2.1112203540007223e-05,
      "loss": 0.957,
      "num_input_tokens_seen": 48955746672,
      "step": 62224
    },
    {
      "epoch": 6.601421599830257,
      "grad_norm": 0.8126953509239107,
      "learning_rate": 2.111151702766198e-05,
      "loss": 1.0539,
      "num_input_tokens_seen": 48956533408,
      "step": 62225
    },
    {
      "epoch": 6.601527689369828,
      "grad_norm": 0.7190013225170114,
      "learning_rate": 2.111083051832165e-05,
      "loss": 1.046,
      "num_input_tokens_seen": 48957320144,
      "step": 62226
    },
    {
      "epoch": 6.6016337789094,
      "grad_norm": 0.7735873225234278,
      "learning_rate": 2.1110144011986753e-05,
      "loss": 0.9776,
      "num_input_tokens_seen": 48958106912,
      "step": 62227
    },
    {
      "epoch": 6.601739868448971,
      "grad_norm": 0.7088371360354344,
      "learning_rate": 2.110945750865782e-05,
      "loss": 0.984,
      "num_input_tokens_seen": 48958893648,
      "step": 62228
    },
    {
      "epoch": 6.601845957988543,
      "grad_norm": 0.7113447447482595,
      "learning_rate": 2.1108771008335388e-05,
      "loss": 0.9498,
      "num_input_tokens_seen": 48959680512,
      "step": 62229
    },
    {
      "epoch": 6.601952047528114,
      "grad_norm": 0.9630768988467459,
      "learning_rate": 2.1108084511019983e-05,
      "loss": 1.0564,
      "num_input_tokens_seen": 48960467280,
      "step": 62230
    },
    {
      "epoch": 6.602058137067685,
      "grad_norm": 0.7684898802948773,
      "learning_rate": 2.110739801671213e-05,
      "loss": 1.0284,
      "num_input_tokens_seen": 48961254048,
      "step": 62231
    },
    {
      "epoch": 6.602164226607257,
      "grad_norm": 0.9010161722204569,
      "learning_rate": 2.1106711525412375e-05,
      "loss": 0.9919,
      "num_input_tokens_seen": 48962040848,
      "step": 62232
    },
    {
      "epoch": 6.602270316146828,
      "grad_norm": 0.9048109930133063,
      "learning_rate": 2.1106025037121235e-05,
      "loss": 0.9997,
      "num_input_tokens_seen": 48962827520,
      "step": 62233
    },
    {
      "epoch": 6.6023764056864,
      "grad_norm": 0.7796156632016567,
      "learning_rate": 2.110533855183924e-05,
      "loss": 1.0093,
      "num_input_tokens_seen": 48963614288,
      "step": 62234
    },
    {
      "epoch": 6.602482495225971,
      "grad_norm": 0.7661707377244263,
      "learning_rate": 2.110465206956693e-05,
      "loss": 1.0432,
      "num_input_tokens_seen": 48964401088,
      "step": 62235
    },
    {
      "epoch": 6.602588584765542,
      "grad_norm": 1.2272450766554468,
      "learning_rate": 2.1103965590304827e-05,
      "loss": 1.0295,
      "num_input_tokens_seen": 48965187808,
      "step": 62236
    },
    {
      "epoch": 6.602694674305114,
      "grad_norm": 0.8974482006358507,
      "learning_rate": 2.1103279114053472e-05,
      "loss": 1.0016,
      "num_input_tokens_seen": 48965974528,
      "step": 62237
    },
    {
      "epoch": 6.602800763844685,
      "grad_norm": 0.8821451901784537,
      "learning_rate": 2.1102592640813386e-05,
      "loss": 0.9303,
      "num_input_tokens_seen": 48966761264,
      "step": 62238
    },
    {
      "epoch": 6.6029068533842565,
      "grad_norm": 1.0067055740795885,
      "learning_rate": 2.1101906170585095e-05,
      "loss": 0.9727,
      "num_input_tokens_seen": 48967548080,
      "step": 62239
    },
    {
      "epoch": 6.603012942923828,
      "grad_norm": 0.8763191966600226,
      "learning_rate": 2.1101219703369145e-05,
      "loss": 0.9836,
      "num_input_tokens_seen": 48968334864,
      "step": 62240
    },
    {
      "epoch": 6.6031190324633995,
      "grad_norm": 1.033124508499074,
      "learning_rate": 2.1100533239166057e-05,
      "loss": 1.0566,
      "num_input_tokens_seen": 48969121616,
      "step": 62241
    },
    {
      "epoch": 6.6032251220029705,
      "grad_norm": 1.3315968458524505,
      "learning_rate": 2.1099846777976357e-05,
      "loss": 1.0679,
      "num_input_tokens_seen": 48969908352,
      "step": 62242
    },
    {
      "epoch": 6.6033312115425415,
      "grad_norm": 1.065150123600372,
      "learning_rate": 2.1099160319800586e-05,
      "loss": 1.0823,
      "num_input_tokens_seen": 48970695152,
      "step": 62243
    },
    {
      "epoch": 6.6034373010821135,
      "grad_norm": 0.8588903816303175,
      "learning_rate": 2.109847386463927e-05,
      "loss": 1.0172,
      "num_input_tokens_seen": 48971481936,
      "step": 62244
    },
    {
      "epoch": 6.6035433906216845,
      "grad_norm": 0.9478601621834444,
      "learning_rate": 2.1097787412492934e-05,
      "loss": 1.0108,
      "num_input_tokens_seen": 48972268608,
      "step": 62245
    },
    {
      "epoch": 6.603649480161256,
      "grad_norm": 0.8426395142069651,
      "learning_rate": 2.109710096336212e-05,
      "loss": 0.907,
      "num_input_tokens_seen": 48973055424,
      "step": 62246
    },
    {
      "epoch": 6.603755569700827,
      "grad_norm": 0.7618428689894863,
      "learning_rate": 2.109641451724735e-05,
      "loss": 1.0498,
      "num_input_tokens_seen": 48973842176,
      "step": 62247
    },
    {
      "epoch": 6.603861659240399,
      "grad_norm": 0.7467023602919927,
      "learning_rate": 2.1095728074149148e-05,
      "loss": 0.9852,
      "num_input_tokens_seen": 48974628912,
      "step": 62248
    },
    {
      "epoch": 6.60396774877997,
      "grad_norm": 0.6866842595267123,
      "learning_rate": 2.109504163406806e-05,
      "loss": 0.9782,
      "num_input_tokens_seen": 48975415648,
      "step": 62249
    },
    {
      "epoch": 6.604073838319541,
      "grad_norm": 0.7070274385541641,
      "learning_rate": 2.1094355197004613e-05,
      "loss": 0.9277,
      "num_input_tokens_seen": 48976202368,
      "step": 62250
    },
    {
      "epoch": 6.604179927859113,
      "grad_norm": 0.7358823305022932,
      "learning_rate": 2.1093668762959323e-05,
      "loss": 0.9971,
      "num_input_tokens_seen": 48976989120,
      "step": 62251
    },
    {
      "epoch": 6.604286017398684,
      "grad_norm": 0.7720568373772458,
      "learning_rate": 2.109298233193274e-05,
      "loss": 1.0412,
      "num_input_tokens_seen": 48977775968,
      "step": 62252
    },
    {
      "epoch": 6.604392106938256,
      "grad_norm": 0.8087583813492467,
      "learning_rate": 2.109229590392538e-05,
      "loss": 0.9983,
      "num_input_tokens_seen": 48978562784,
      "step": 62253
    },
    {
      "epoch": 6.604498196477827,
      "grad_norm": 0.7775231901974103,
      "learning_rate": 2.1091609478937786e-05,
      "loss": 0.9986,
      "num_input_tokens_seen": 48979349504,
      "step": 62254
    },
    {
      "epoch": 6.604604286017398,
      "grad_norm": 0.8336701582791494,
      "learning_rate": 2.109092305697048e-05,
      "loss": 1.093,
      "num_input_tokens_seen": 48980136176,
      "step": 62255
    },
    {
      "epoch": 6.60471037555697,
      "grad_norm": 0.7760425683149251,
      "learning_rate": 2.1090236638023985e-05,
      "loss": 0.9998,
      "num_input_tokens_seen": 48980922928,
      "step": 62256
    },
    {
      "epoch": 6.604816465096541,
      "grad_norm": 1.1986663622800224,
      "learning_rate": 2.1089550222098848e-05,
      "loss": 1.0589,
      "num_input_tokens_seen": 48981709664,
      "step": 62257
    },
    {
      "epoch": 6.604922554636113,
      "grad_norm": 0.781345322870992,
      "learning_rate": 2.1088863809195592e-05,
      "loss": 1.0052,
      "num_input_tokens_seen": 48982496480,
      "step": 62258
    },
    {
      "epoch": 6.605028644175684,
      "grad_norm": 0.6790358617500506,
      "learning_rate": 2.1088177399314743e-05,
      "loss": 1.0015,
      "num_input_tokens_seen": 48983283216,
      "step": 62259
    },
    {
      "epoch": 6.605134733715255,
      "grad_norm": 0.9978287716685452,
      "learning_rate": 2.108749099245684e-05,
      "loss": 1.0935,
      "num_input_tokens_seen": 48984070032,
      "step": 62260
    },
    {
      "epoch": 6.605240823254827,
      "grad_norm": 0.6874797845169431,
      "learning_rate": 2.108680458862241e-05,
      "loss": 1.1019,
      "num_input_tokens_seen": 48984856848,
      "step": 62261
    },
    {
      "epoch": 6.605346912794398,
      "grad_norm": 0.9386547025259327,
      "learning_rate": 2.1086118187811976e-05,
      "loss": 1.0473,
      "num_input_tokens_seen": 48985643568,
      "step": 62262
    },
    {
      "epoch": 6.60545300233397,
      "grad_norm": 0.745838530910355,
      "learning_rate": 2.1085431790026083e-05,
      "loss": 0.9788,
      "num_input_tokens_seen": 48986430352,
      "step": 62263
    },
    {
      "epoch": 6.605559091873541,
      "grad_norm": 0.7856045587506415,
      "learning_rate": 2.1084745395265253e-05,
      "loss": 0.9892,
      "num_input_tokens_seen": 48987217120,
      "step": 62264
    },
    {
      "epoch": 6.605665181413112,
      "grad_norm": 1.027267979940264,
      "learning_rate": 2.108405900353001e-05,
      "loss": 0.9783,
      "num_input_tokens_seen": 48988003888,
      "step": 62265
    },
    {
      "epoch": 6.605771270952684,
      "grad_norm": 0.7402457281260301,
      "learning_rate": 2.1083372614820896e-05,
      "loss": 0.9778,
      "num_input_tokens_seen": 48988790624,
      "step": 62266
    },
    {
      "epoch": 6.605877360492255,
      "grad_norm": 0.9209329971246645,
      "learning_rate": 2.1082686229138437e-05,
      "loss": 1.0954,
      "num_input_tokens_seen": 48989577424,
      "step": 62267
    },
    {
      "epoch": 6.605983450031827,
      "grad_norm": 0.8454888464473561,
      "learning_rate": 2.108199984648315e-05,
      "loss": 0.9894,
      "num_input_tokens_seen": 48990364160,
      "step": 62268
    },
    {
      "epoch": 6.606089539571398,
      "grad_norm": 0.7700698271315136,
      "learning_rate": 2.108131346685559e-05,
      "loss": 1.0518,
      "num_input_tokens_seen": 48991150912,
      "step": 62269
    },
    {
      "epoch": 6.60619562911097,
      "grad_norm": 0.8855349943289614,
      "learning_rate": 2.1080627090256277e-05,
      "loss": 1.0221,
      "num_input_tokens_seen": 48991937728,
      "step": 62270
    },
    {
      "epoch": 6.606301718650541,
      "grad_norm": 0.7130467320309714,
      "learning_rate": 2.1079940716685745e-05,
      "loss": 1.0843,
      "num_input_tokens_seen": 48992724416,
      "step": 62271
    },
    {
      "epoch": 6.606407808190112,
      "grad_norm": 0.6729771552123889,
      "learning_rate": 2.107925434614451e-05,
      "loss": 1.0691,
      "num_input_tokens_seen": 48993511136,
      "step": 62272
    },
    {
      "epoch": 6.606513897729684,
      "grad_norm": 0.6977627863989693,
      "learning_rate": 2.1078567978633117e-05,
      "loss": 0.9734,
      "num_input_tokens_seen": 48994298000,
      "step": 62273
    },
    {
      "epoch": 6.606619987269255,
      "grad_norm": 0.7211976226966056,
      "learning_rate": 2.107788161415209e-05,
      "loss": 1.0211,
      "num_input_tokens_seen": 48995084752,
      "step": 62274
    },
    {
      "epoch": 6.606726076808827,
      "grad_norm": 0.6582951873436254,
      "learning_rate": 2.1077195252701965e-05,
      "loss": 1.0191,
      "num_input_tokens_seen": 48995871520,
      "step": 62275
    },
    {
      "epoch": 6.606832166348398,
      "grad_norm": 1.0054599834963098,
      "learning_rate": 2.1076508894283266e-05,
      "loss": 0.98,
      "num_input_tokens_seen": 48996658320,
      "step": 62276
    },
    {
      "epoch": 6.60693825588797,
      "grad_norm": 0.8683972598734302,
      "learning_rate": 2.1075822538896523e-05,
      "loss": 1.0177,
      "num_input_tokens_seen": 48997445072,
      "step": 62277
    },
    {
      "epoch": 6.607044345427541,
      "grad_norm": 0.6855228558340368,
      "learning_rate": 2.1075136186542275e-05,
      "loss": 1.0132,
      "num_input_tokens_seen": 48998231888,
      "step": 62278
    },
    {
      "epoch": 6.607150434967112,
      "grad_norm": 0.7880044734486387,
      "learning_rate": 2.1074449837221043e-05,
      "loss": 0.9489,
      "num_input_tokens_seen": 48999018752,
      "step": 62279
    },
    {
      "epoch": 6.607256524506684,
      "grad_norm": 1.1654343199496713,
      "learning_rate": 2.107376349093336e-05,
      "loss": 1.0351,
      "num_input_tokens_seen": 48999805488,
      "step": 62280
    },
    {
      "epoch": 6.607362614046255,
      "grad_norm": 0.8061159279127459,
      "learning_rate": 2.107307714767976e-05,
      "loss": 1.0176,
      "num_input_tokens_seen": 49000592288,
      "step": 62281
    },
    {
      "epoch": 6.607468703585827,
      "grad_norm": 0.7046138759161689,
      "learning_rate": 2.1072390807460772e-05,
      "loss": 0.9713,
      "num_input_tokens_seen": 49001379104,
      "step": 62282
    },
    {
      "epoch": 6.607574793125398,
      "grad_norm": 1.0267105528499405,
      "learning_rate": 2.107170447027692e-05,
      "loss": 0.9859,
      "num_input_tokens_seen": 49002165872,
      "step": 62283
    },
    {
      "epoch": 6.607680882664969,
      "grad_norm": 0.7067969481794986,
      "learning_rate": 2.1071018136128743e-05,
      "loss": 1.017,
      "num_input_tokens_seen": 49002952640,
      "step": 62284
    },
    {
      "epoch": 6.607786972204541,
      "grad_norm": 0.8510043355430603,
      "learning_rate": 2.1070331805016768e-05,
      "loss": 1.087,
      "num_input_tokens_seen": 49003739392,
      "step": 62285
    },
    {
      "epoch": 6.607893061744112,
      "grad_norm": 0.9674598188215177,
      "learning_rate": 2.106964547694152e-05,
      "loss": 1.0314,
      "num_input_tokens_seen": 49004526144,
      "step": 62286
    },
    {
      "epoch": 6.607999151283684,
      "grad_norm": 0.7770679096999727,
      "learning_rate": 2.1068959151903544e-05,
      "loss": 1.0045,
      "num_input_tokens_seen": 49005312880,
      "step": 62287
    },
    {
      "epoch": 6.608105240823255,
      "grad_norm": 0.8004808636152286,
      "learning_rate": 2.1068272829903356e-05,
      "loss": 0.9713,
      "num_input_tokens_seen": 49006099616,
      "step": 62288
    },
    {
      "epoch": 6.608211330362826,
      "grad_norm": 0.8835675863877528,
      "learning_rate": 2.1067586510941488e-05,
      "loss": 1.0166,
      "num_input_tokens_seen": 49006886416,
      "step": 62289
    },
    {
      "epoch": 6.608317419902398,
      "grad_norm": 0.7761773920811509,
      "learning_rate": 2.106690019501848e-05,
      "loss": 1.0908,
      "num_input_tokens_seen": 49007673152,
      "step": 62290
    },
    {
      "epoch": 6.608423509441969,
      "grad_norm": 0.9664983650577885,
      "learning_rate": 2.106621388213485e-05,
      "loss": 1.0076,
      "num_input_tokens_seen": 49008459936,
      "step": 62291
    },
    {
      "epoch": 6.608529598981541,
      "grad_norm": 0.7900749512418586,
      "learning_rate": 2.1065527572291137e-05,
      "loss": 0.9786,
      "num_input_tokens_seen": 49009246624,
      "step": 62292
    },
    {
      "epoch": 6.608635688521112,
      "grad_norm": 0.7442120953389427,
      "learning_rate": 2.1064841265487875e-05,
      "loss": 1.003,
      "num_input_tokens_seen": 49010033344,
      "step": 62293
    },
    {
      "epoch": 6.608741778060683,
      "grad_norm": 0.9866632663313286,
      "learning_rate": 2.106415496172558e-05,
      "loss": 0.8782,
      "num_input_tokens_seen": 49010820112,
      "step": 62294
    },
    {
      "epoch": 6.608847867600255,
      "grad_norm": 0.9893093217793415,
      "learning_rate": 2.106346866100479e-05,
      "loss": 1.0387,
      "num_input_tokens_seen": 49011606848,
      "step": 62295
    },
    {
      "epoch": 6.608953957139826,
      "grad_norm": 0.8060234502769794,
      "learning_rate": 2.1062782363326043e-05,
      "loss": 1.0118,
      "num_input_tokens_seen": 49012393744,
      "step": 62296
    },
    {
      "epoch": 6.609060046679398,
      "grad_norm": 0.9554652948000032,
      "learning_rate": 2.1062096068689858e-05,
      "loss": 1.0041,
      "num_input_tokens_seen": 49013180448,
      "step": 62297
    },
    {
      "epoch": 6.609166136218969,
      "grad_norm": 0.7569781795178333,
      "learning_rate": 2.106140977709677e-05,
      "loss": 0.9543,
      "num_input_tokens_seen": 49013967232,
      "step": 62298
    },
    {
      "epoch": 6.609272225758541,
      "grad_norm": 1.0437344919439449,
      "learning_rate": 2.1060723488547312e-05,
      "loss": 0.9386,
      "num_input_tokens_seen": 49014753968,
      "step": 62299
    },
    {
      "epoch": 6.609378315298112,
      "grad_norm": 0.9319327824529612,
      "learning_rate": 2.1060037203042003e-05,
      "loss": 0.9919,
      "num_input_tokens_seen": 49015540752,
      "step": 62300
    },
    {
      "epoch": 6.609484404837683,
      "grad_norm": 0.7745707294414701,
      "learning_rate": 2.105935092058139e-05,
      "loss": 1.0081,
      "num_input_tokens_seen": 49016327664,
      "step": 62301
    },
    {
      "epoch": 6.6095904943772545,
      "grad_norm": 1.1718396728991511,
      "learning_rate": 2.1058664641165994e-05,
      "loss": 1.0296,
      "num_input_tokens_seen": 49017114336,
      "step": 62302
    },
    {
      "epoch": 6.609696583916826,
      "grad_norm": 0.912943250129945,
      "learning_rate": 2.1057978364796342e-05,
      "loss": 0.9635,
      "num_input_tokens_seen": 49017901072,
      "step": 62303
    },
    {
      "epoch": 6.6098026734563975,
      "grad_norm": 0.8052891609563999,
      "learning_rate": 2.1057292091472976e-05,
      "loss": 1.0068,
      "num_input_tokens_seen": 49018687792,
      "step": 62304
    },
    {
      "epoch": 6.6099087629959685,
      "grad_norm": 0.7514764579156149,
      "learning_rate": 2.105660582119641e-05,
      "loss": 1.0226,
      "num_input_tokens_seen": 49019474576,
      "step": 62305
    },
    {
      "epoch": 6.61001485253554,
      "grad_norm": 0.775577301311974,
      "learning_rate": 2.105591955396719e-05,
      "loss": 0.9898,
      "num_input_tokens_seen": 49020261360,
      "step": 62306
    },
    {
      "epoch": 6.6101209420751115,
      "grad_norm": 0.892025533541098,
      "learning_rate": 2.1055233289785836e-05,
      "loss": 1.0409,
      "num_input_tokens_seen": 49021048176,
      "step": 62307
    },
    {
      "epoch": 6.6102270316146825,
      "grad_norm": 0.9338719777557812,
      "learning_rate": 2.1054547028652883e-05,
      "loss": 1.0329,
      "num_input_tokens_seen": 49021835008,
      "step": 62308
    },
    {
      "epoch": 6.610333121154254,
      "grad_norm": 0.9039108425216887,
      "learning_rate": 2.105386077056886e-05,
      "loss": 0.9479,
      "num_input_tokens_seen": 49022621744,
      "step": 62309
    },
    {
      "epoch": 6.6104392106938255,
      "grad_norm": 0.7509445581543922,
      "learning_rate": 2.10531745155343e-05,
      "loss": 0.9882,
      "num_input_tokens_seen": 49023408368,
      "step": 62310
    },
    {
      "epoch": 6.610545300233397,
      "grad_norm": 1.4069858977435417,
      "learning_rate": 2.1052488263549723e-05,
      "loss": 1.0166,
      "num_input_tokens_seen": 49024195104,
      "step": 62311
    },
    {
      "epoch": 6.610651389772968,
      "grad_norm": 0.8544489497926682,
      "learning_rate": 2.1051802014615675e-05,
      "loss": 1.084,
      "num_input_tokens_seen": 49024981856,
      "step": 62312
    },
    {
      "epoch": 6.610757479312539,
      "grad_norm": 0.7063912856234077,
      "learning_rate": 2.1051115768732683e-05,
      "loss": 1.0556,
      "num_input_tokens_seen": 49025768592,
      "step": 62313
    },
    {
      "epoch": 6.610863568852111,
      "grad_norm": 0.9592403489655893,
      "learning_rate": 2.105042952590126e-05,
      "loss": 1.0036,
      "num_input_tokens_seen": 49026555264,
      "step": 62314
    },
    {
      "epoch": 6.610969658391682,
      "grad_norm": 0.9692193894327541,
      "learning_rate": 2.104974328612196e-05,
      "loss": 1.0208,
      "num_input_tokens_seen": 49027342032,
      "step": 62315
    },
    {
      "epoch": 6.611075747931254,
      "grad_norm": 0.7035042857846792,
      "learning_rate": 2.10490570493953e-05,
      "loss": 0.9871,
      "num_input_tokens_seen": 49028128816,
      "step": 62316
    },
    {
      "epoch": 6.611181837470825,
      "grad_norm": 1.1609599583919412,
      "learning_rate": 2.1048370815721806e-05,
      "loss": 0.997,
      "num_input_tokens_seen": 49028915616,
      "step": 62317
    },
    {
      "epoch": 6.611287927010396,
      "grad_norm": 1.0960352551014887,
      "learning_rate": 2.1047684585102023e-05,
      "loss": 1.0086,
      "num_input_tokens_seen": 49029702368,
      "step": 62318
    },
    {
      "epoch": 6.611394016549968,
      "grad_norm": 0.780817831111881,
      "learning_rate": 2.104699835753647e-05,
      "loss": 0.98,
      "num_input_tokens_seen": 49030489216,
      "step": 62319
    },
    {
      "epoch": 6.611500106089539,
      "grad_norm": 1.1057143680855384,
      "learning_rate": 2.1046312133025682e-05,
      "loss": 0.9382,
      "num_input_tokens_seen": 49031276064,
      "step": 62320
    },
    {
      "epoch": 6.611606195629111,
      "grad_norm": 1.3989276607229844,
      "learning_rate": 2.1045625911570186e-05,
      "loss": 0.9016,
      "num_input_tokens_seen": 49032062848,
      "step": 62321
    },
    {
      "epoch": 6.611712285168682,
      "grad_norm": 1.0062286165270689,
      "learning_rate": 2.1044939693170513e-05,
      "loss": 0.9662,
      "num_input_tokens_seen": 49032849600,
      "step": 62322
    },
    {
      "epoch": 6.611818374708253,
      "grad_norm": 1.0491443180081266,
      "learning_rate": 2.10442534778272e-05,
      "loss": 1.0209,
      "num_input_tokens_seen": 49033636416,
      "step": 62323
    },
    {
      "epoch": 6.611924464247825,
      "grad_norm": 0.8575365683792188,
      "learning_rate": 2.104356726554077e-05,
      "loss": 0.993,
      "num_input_tokens_seen": 49034423184,
      "step": 62324
    },
    {
      "epoch": 6.612030553787396,
      "grad_norm": 0.7541655979690861,
      "learning_rate": 2.1042881056311746e-05,
      "loss": 0.9965,
      "num_input_tokens_seen": 49035209952,
      "step": 62325
    },
    {
      "epoch": 6.612136643326968,
      "grad_norm": 0.7527717855892275,
      "learning_rate": 2.1042194850140677e-05,
      "loss": 1.0343,
      "num_input_tokens_seen": 49035996640,
      "step": 62326
    },
    {
      "epoch": 6.612242732866539,
      "grad_norm": 0.7132995741520124,
      "learning_rate": 2.104150864702809e-05,
      "loss": 0.9894,
      "num_input_tokens_seen": 49036783392,
      "step": 62327
    },
    {
      "epoch": 6.612348822406111,
      "grad_norm": 0.9330722750083357,
      "learning_rate": 2.1040822446974496e-05,
      "loss": 1.0591,
      "num_input_tokens_seen": 49037570096,
      "step": 62328
    },
    {
      "epoch": 6.612454911945682,
      "grad_norm": 0.7230803651337971,
      "learning_rate": 2.1040136249980443e-05,
      "loss": 0.9647,
      "num_input_tokens_seen": 49038356864,
      "step": 62329
    },
    {
      "epoch": 6.612561001485254,
      "grad_norm": 0.9639050468169943,
      "learning_rate": 2.103945005604646e-05,
      "loss": 0.9636,
      "num_input_tokens_seen": 49039143664,
      "step": 62330
    },
    {
      "epoch": 6.612667091024825,
      "grad_norm": 0.84195700079622,
      "learning_rate": 2.1038763865173067e-05,
      "loss": 1.0857,
      "num_input_tokens_seen": 49039930320,
      "step": 62331
    },
    {
      "epoch": 6.612773180564396,
      "grad_norm": 1.1969197875029987,
      "learning_rate": 2.1038077677360808e-05,
      "loss": 1.1017,
      "num_input_tokens_seen": 49040717088,
      "step": 62332
    },
    {
      "epoch": 6.612879270103968,
      "grad_norm": 0.7496407170431646,
      "learning_rate": 2.1037391492610203e-05,
      "loss": 1.023,
      "num_input_tokens_seen": 49041503952,
      "step": 62333
    },
    {
      "epoch": 6.612985359643539,
      "grad_norm": 0.982372813971942,
      "learning_rate": 2.103670531092178e-05,
      "loss": 1.0008,
      "num_input_tokens_seen": 49042290656,
      "step": 62334
    },
    {
      "epoch": 6.613091449183111,
      "grad_norm": 1.0026344210242764,
      "learning_rate": 2.1036019132296082e-05,
      "loss": 1.0064,
      "num_input_tokens_seen": 49043077472,
      "step": 62335
    },
    {
      "epoch": 6.613197538722682,
      "grad_norm": 0.6889482005940644,
      "learning_rate": 2.1035332956733634e-05,
      "loss": 0.9778,
      "num_input_tokens_seen": 49043864208,
      "step": 62336
    },
    {
      "epoch": 6.613303628262253,
      "grad_norm": 1.0118997266703318,
      "learning_rate": 2.1034646784234957e-05,
      "loss": 0.993,
      "num_input_tokens_seen": 49044650960,
      "step": 62337
    },
    {
      "epoch": 6.613409717801825,
      "grad_norm": 0.9935611119079915,
      "learning_rate": 2.1033960614800595e-05,
      "loss": 1.0138,
      "num_input_tokens_seen": 49045437728,
      "step": 62338
    },
    {
      "epoch": 6.613515807341396,
      "grad_norm": 0.7988377650667398,
      "learning_rate": 2.1033274448431066e-05,
      "loss": 0.9082,
      "num_input_tokens_seen": 49046224624,
      "step": 62339
    },
    {
      "epoch": 6.613621896880968,
      "grad_norm": 1.2137014903824168,
      "learning_rate": 2.1032588285126912e-05,
      "loss": 1.0667,
      "num_input_tokens_seen": 49047011296,
      "step": 62340
    },
    {
      "epoch": 6.613727986420539,
      "grad_norm": 1.2156321715924405,
      "learning_rate": 2.1031902124888655e-05,
      "loss": 1.018,
      "num_input_tokens_seen": 49047798176,
      "step": 62341
    },
    {
      "epoch": 6.61383407596011,
      "grad_norm": 0.7214681254787267,
      "learning_rate": 2.1031215967716823e-05,
      "loss": 0.9662,
      "num_input_tokens_seen": 49048584912,
      "step": 62342
    },
    {
      "epoch": 6.613940165499682,
      "grad_norm": 1.248865929084235,
      "learning_rate": 2.103052981361196e-05,
      "loss": 1.1148,
      "num_input_tokens_seen": 49049371632,
      "step": 62343
    },
    {
      "epoch": 6.614046255039253,
      "grad_norm": 1.138651436878317,
      "learning_rate": 2.1029843662574583e-05,
      "loss": 1.0044,
      "num_input_tokens_seen": 49050158416,
      "step": 62344
    },
    {
      "epoch": 6.614152344578825,
      "grad_norm": 0.9339946312248808,
      "learning_rate": 2.1029157514605222e-05,
      "loss": 0.9858,
      "num_input_tokens_seen": 49050945120,
      "step": 62345
    },
    {
      "epoch": 6.614258434118396,
      "grad_norm": 1.034144500283829,
      "learning_rate": 2.1028471369704417e-05,
      "loss": 1.1289,
      "num_input_tokens_seen": 49051731824,
      "step": 62346
    },
    {
      "epoch": 6.614364523657967,
      "grad_norm": 1.6049605024149423,
      "learning_rate": 2.1027785227872694e-05,
      "loss": 1.015,
      "num_input_tokens_seen": 49052518576,
      "step": 62347
    },
    {
      "epoch": 6.614470613197539,
      "grad_norm": 1.1017889451582596,
      "learning_rate": 2.1027099089110574e-05,
      "loss": 0.9989,
      "num_input_tokens_seen": 49053305376,
      "step": 62348
    },
    {
      "epoch": 6.61457670273711,
      "grad_norm": 0.8853840372597869,
      "learning_rate": 2.1026412953418604e-05,
      "loss": 0.9549,
      "num_input_tokens_seen": 49054092080,
      "step": 62349
    },
    {
      "epoch": 6.614682792276682,
      "grad_norm": 1.1662617374178792,
      "learning_rate": 2.1025726820797303e-05,
      "loss": 0.9745,
      "num_input_tokens_seen": 49054878768,
      "step": 62350
    },
    {
      "epoch": 6.614788881816253,
      "grad_norm": 0.8103195024210902,
      "learning_rate": 2.10250406912472e-05,
      "loss": 0.9653,
      "num_input_tokens_seen": 49055665568,
      "step": 62351
    },
    {
      "epoch": 6.614894971355824,
      "grad_norm": 0.768731003988968,
      "learning_rate": 2.1024354564768832e-05,
      "loss": 0.9355,
      "num_input_tokens_seen": 49056452272,
      "step": 62352
    },
    {
      "epoch": 6.615001060895396,
      "grad_norm": 0.7264433303197728,
      "learning_rate": 2.1023668441362725e-05,
      "loss": 0.9746,
      "num_input_tokens_seen": 49057239040,
      "step": 62353
    },
    {
      "epoch": 6.615107150434967,
      "grad_norm": 0.8624021527458086,
      "learning_rate": 2.102298232102941e-05,
      "loss": 1.0043,
      "num_input_tokens_seen": 49058025728,
      "step": 62354
    },
    {
      "epoch": 6.615213239974539,
      "grad_norm": 0.6803270923174222,
      "learning_rate": 2.102229620376942e-05,
      "loss": 0.8879,
      "num_input_tokens_seen": 49058812688,
      "step": 62355
    },
    {
      "epoch": 6.61531932951411,
      "grad_norm": 0.7538871849114855,
      "learning_rate": 2.1021610089583278e-05,
      "loss": 0.9608,
      "num_input_tokens_seen": 49059599488,
      "step": 62356
    },
    {
      "epoch": 6.615425419053682,
      "grad_norm": 0.8947221608534521,
      "learning_rate": 2.1020923978471526e-05,
      "loss": 1.0414,
      "num_input_tokens_seen": 49060386192,
      "step": 62357
    },
    {
      "epoch": 6.615531508593253,
      "grad_norm": 0.8110560173120669,
      "learning_rate": 2.1020237870434682e-05,
      "loss": 0.9544,
      "num_input_tokens_seen": 49061173056,
      "step": 62358
    },
    {
      "epoch": 6.615637598132825,
      "grad_norm": 0.73331550946288,
      "learning_rate": 2.101955176547328e-05,
      "loss": 0.9267,
      "num_input_tokens_seen": 49061959872,
      "step": 62359
    },
    {
      "epoch": 6.615743687672396,
      "grad_norm": 0.8544516035952564,
      "learning_rate": 2.1018865663587855e-05,
      "loss": 0.9947,
      "num_input_tokens_seen": 49062746704,
      "step": 62360
    },
    {
      "epoch": 6.615849777211967,
      "grad_norm": 0.8012088402049112,
      "learning_rate": 2.1018179564778937e-05,
      "loss": 1.0117,
      "num_input_tokens_seen": 49063533504,
      "step": 62361
    },
    {
      "epoch": 6.615955866751539,
      "grad_norm": 0.7537696232195896,
      "learning_rate": 2.1017493469047043e-05,
      "loss": 1.016,
      "num_input_tokens_seen": 49064320272,
      "step": 62362
    },
    {
      "epoch": 6.61606195629111,
      "grad_norm": 0.8424238005503244,
      "learning_rate": 2.101680737639271e-05,
      "loss": 0.9985,
      "num_input_tokens_seen": 49065107040,
      "step": 62363
    },
    {
      "epoch": 6.6161680458306815,
      "grad_norm": 0.9411210454846201,
      "learning_rate": 2.1016121286816484e-05,
      "loss": 1.0436,
      "num_input_tokens_seen": 49065893824,
      "step": 62364
    },
    {
      "epoch": 6.6162741353702526,
      "grad_norm": 1.108116397179151,
      "learning_rate": 2.1015435200318885e-05,
      "loss": 0.9852,
      "num_input_tokens_seen": 49066680624,
      "step": 62365
    },
    {
      "epoch": 6.616380224909824,
      "grad_norm": 0.8853790405159719,
      "learning_rate": 2.1014749116900428e-05,
      "loss": 1.1378,
      "num_input_tokens_seen": 49067467296,
      "step": 62366
    },
    {
      "epoch": 6.6164863144493955,
      "grad_norm": 0.9788352128991431,
      "learning_rate": 2.1014063036561667e-05,
      "loss": 0.9863,
      "num_input_tokens_seen": 49068254080,
      "step": 62367
    },
    {
      "epoch": 6.6165924039889665,
      "grad_norm": 1.9216744752657957,
      "learning_rate": 2.1013376959303118e-05,
      "loss": 1.1795,
      "num_input_tokens_seen": 49069040848,
      "step": 62368
    },
    {
      "epoch": 6.6166984935285384,
      "grad_norm": 0.8701700232264797,
      "learning_rate": 2.1012690885125312e-05,
      "loss": 1.0056,
      "num_input_tokens_seen": 49069827744,
      "step": 62369
    },
    {
      "epoch": 6.6168045830681095,
      "grad_norm": 0.92238461215511,
      "learning_rate": 2.1012004814028782e-05,
      "loss": 0.9858,
      "num_input_tokens_seen": 49070614496,
      "step": 62370
    },
    {
      "epoch": 6.6169106726076805,
      "grad_norm": 1.020334869531391,
      "learning_rate": 2.1011318746014062e-05,
      "loss": 0.9708,
      "num_input_tokens_seen": 49071401296,
      "step": 62371
    },
    {
      "epoch": 6.617016762147252,
      "grad_norm": 0.9720534060785,
      "learning_rate": 2.1010632681081672e-05,
      "loss": 0.993,
      "num_input_tokens_seen": 49072188096,
      "step": 62372
    },
    {
      "epoch": 6.6171228516868235,
      "grad_norm": 1.132376642198614,
      "learning_rate": 2.1009946619232153e-05,
      "loss": 1.0265,
      "num_input_tokens_seen": 49072974816,
      "step": 62373
    },
    {
      "epoch": 6.617228941226395,
      "grad_norm": 0.987484296077949,
      "learning_rate": 2.1009260560466027e-05,
      "loss": 1.0176,
      "num_input_tokens_seen": 49073761584,
      "step": 62374
    },
    {
      "epoch": 6.617335030765966,
      "grad_norm": 0.7550227938192365,
      "learning_rate": 2.1008574504783823e-05,
      "loss": 0.9383,
      "num_input_tokens_seen": 49074548384,
      "step": 62375
    },
    {
      "epoch": 6.617441120305537,
      "grad_norm": 0.9759556337330633,
      "learning_rate": 2.1007888452186082e-05,
      "loss": 1.0083,
      "num_input_tokens_seen": 49075335104,
      "step": 62376
    },
    {
      "epoch": 6.617547209845109,
      "grad_norm": 1.0160314491420028,
      "learning_rate": 2.1007202402673327e-05,
      "loss": 1.0157,
      "num_input_tokens_seen": 49076121808,
      "step": 62377
    },
    {
      "epoch": 6.61765329938468,
      "grad_norm": 0.922415390548286,
      "learning_rate": 2.1006516356246086e-05,
      "loss": 1.1646,
      "num_input_tokens_seen": 49076908448,
      "step": 62378
    },
    {
      "epoch": 6.617759388924252,
      "grad_norm": 0.7481096716884993,
      "learning_rate": 2.1005830312904898e-05,
      "loss": 1.0274,
      "num_input_tokens_seen": 49077695248,
      "step": 62379
    },
    {
      "epoch": 6.617865478463823,
      "grad_norm": 1.175519697131801,
      "learning_rate": 2.100514427265028e-05,
      "loss": 1.0134,
      "num_input_tokens_seen": 49078482032,
      "step": 62380
    },
    {
      "epoch": 6.617971568003394,
      "grad_norm": 0.9327315279033097,
      "learning_rate": 2.1004458235482773e-05,
      "loss": 0.9661,
      "num_input_tokens_seen": 49079268768,
      "step": 62381
    },
    {
      "epoch": 6.618077657542966,
      "grad_norm": 0.6548293867254474,
      "learning_rate": 2.1003772201402904e-05,
      "loss": 0.9839,
      "num_input_tokens_seen": 49080055456,
      "step": 62382
    },
    {
      "epoch": 6.618183747082537,
      "grad_norm": 1.026902400959361,
      "learning_rate": 2.10030861704112e-05,
      "loss": 1.0548,
      "num_input_tokens_seen": 49080842160,
      "step": 62383
    },
    {
      "epoch": 6.618289836622109,
      "grad_norm": 1.0528869551660394,
      "learning_rate": 2.10024001425082e-05,
      "loss": 0.9327,
      "num_input_tokens_seen": 49081628960,
      "step": 62384
    },
    {
      "epoch": 6.61839592616168,
      "grad_norm": 0.8099189907396271,
      "learning_rate": 2.1001714117694422e-05,
      "loss": 1.0266,
      "num_input_tokens_seen": 49082415680,
      "step": 62385
    },
    {
      "epoch": 6.618502015701252,
      "grad_norm": 0.7806933642847942,
      "learning_rate": 2.10010280959704e-05,
      "loss": 0.976,
      "num_input_tokens_seen": 49083202432,
      "step": 62386
    },
    {
      "epoch": 6.618608105240823,
      "grad_norm": 0.9718284185365293,
      "learning_rate": 2.100034207733667e-05,
      "loss": 1.0755,
      "num_input_tokens_seen": 49083989136,
      "step": 62387
    },
    {
      "epoch": 6.618714194780395,
      "grad_norm": 1.002046188409489,
      "learning_rate": 2.099965606179376e-05,
      "loss": 1.0606,
      "num_input_tokens_seen": 49084775872,
      "step": 62388
    },
    {
      "epoch": 6.618820284319966,
      "grad_norm": 0.7459296313986266,
      "learning_rate": 2.099897004934219e-05,
      "loss": 1.0866,
      "num_input_tokens_seen": 49085562608,
      "step": 62389
    },
    {
      "epoch": 6.618926373859537,
      "grad_norm": 1.3116340403413582,
      "learning_rate": 2.0998284039982508e-05,
      "loss": 0.912,
      "num_input_tokens_seen": 49086349408,
      "step": 62390
    },
    {
      "epoch": 6.619032463399109,
      "grad_norm": 1.015920570224064,
      "learning_rate": 2.0997598033715237e-05,
      "loss": 1.0351,
      "num_input_tokens_seen": 49087136112,
      "step": 62391
    },
    {
      "epoch": 6.61913855293868,
      "grad_norm": 0.9093533489864151,
      "learning_rate": 2.0996912030540893e-05,
      "loss": 1.0061,
      "num_input_tokens_seen": 49087922896,
      "step": 62392
    },
    {
      "epoch": 6.619244642478252,
      "grad_norm": 0.7345225238991334,
      "learning_rate": 2.0996226030460025e-05,
      "loss": 0.9949,
      "num_input_tokens_seen": 49088709664,
      "step": 62393
    },
    {
      "epoch": 6.619350732017823,
      "grad_norm": 0.7434991594854151,
      "learning_rate": 2.099554003347315e-05,
      "loss": 0.9981,
      "num_input_tokens_seen": 49089496448,
      "step": 62394
    },
    {
      "epoch": 6.619456821557394,
      "grad_norm": 0.9322839871771614,
      "learning_rate": 2.0994854039580815e-05,
      "loss": 0.9883,
      "num_input_tokens_seen": 49090283152,
      "step": 62395
    },
    {
      "epoch": 6.619562911096966,
      "grad_norm": 0.6894952073291964,
      "learning_rate": 2.0994168048783533e-05,
      "loss": 0.9464,
      "num_input_tokens_seen": 49091069936,
      "step": 62396
    },
    {
      "epoch": 6.619669000636537,
      "grad_norm": 0.8111028561826199,
      "learning_rate": 2.099348206108184e-05,
      "loss": 1.0809,
      "num_input_tokens_seen": 49091856704,
      "step": 62397
    },
    {
      "epoch": 6.619775090176109,
      "grad_norm": 0.7613965258951637,
      "learning_rate": 2.0992796076476266e-05,
      "loss": 0.9876,
      "num_input_tokens_seen": 49092643392,
      "step": 62398
    },
    {
      "epoch": 6.61988117971568,
      "grad_norm": 0.8113818292654371,
      "learning_rate": 2.0992110094967344e-05,
      "loss": 0.9921,
      "num_input_tokens_seen": 49093430192,
      "step": 62399
    },
    {
      "epoch": 6.619987269255251,
      "grad_norm": 0.7772925914472539,
      "learning_rate": 2.0991424116555595e-05,
      "loss": 0.9123,
      "num_input_tokens_seen": 49094217008,
      "step": 62400
    },
    {
      "epoch": 6.620093358794823,
      "grad_norm": 1.0674454867696754,
      "learning_rate": 2.0990738141241568e-05,
      "loss": 1.0024,
      "num_input_tokens_seen": 49095003776,
      "step": 62401
    },
    {
      "epoch": 6.620199448334394,
      "grad_norm": 0.7210048901074764,
      "learning_rate": 2.0990052169025777e-05,
      "loss": 0.9826,
      "num_input_tokens_seen": 49095790544,
      "step": 62402
    },
    {
      "epoch": 6.620305537873966,
      "grad_norm": 0.8476482092966691,
      "learning_rate": 2.0989366199908747e-05,
      "loss": 0.9575,
      "num_input_tokens_seen": 49096577296,
      "step": 62403
    },
    {
      "epoch": 6.620411627413537,
      "grad_norm": 1.2324579268984948,
      "learning_rate": 2.0988680233891025e-05,
      "loss": 0.891,
      "num_input_tokens_seen": 49097364160,
      "step": 62404
    },
    {
      "epoch": 6.620517716953108,
      "grad_norm": 0.6993690719269631,
      "learning_rate": 2.0987994270973134e-05,
      "loss": 0.9752,
      "num_input_tokens_seen": 49098150960,
      "step": 62405
    },
    {
      "epoch": 6.62062380649268,
      "grad_norm": 0.8647021277915695,
      "learning_rate": 2.0987308311155598e-05,
      "loss": 1.0547,
      "num_input_tokens_seen": 49098937696,
      "step": 62406
    },
    {
      "epoch": 6.620729896032251,
      "grad_norm": 0.8822484301724323,
      "learning_rate": 2.0986622354438955e-05,
      "loss": 0.9298,
      "num_input_tokens_seen": 49099724560,
      "step": 62407
    },
    {
      "epoch": 6.620835985571823,
      "grad_norm": 0.7174477900896984,
      "learning_rate": 2.0985936400823733e-05,
      "loss": 0.9855,
      "num_input_tokens_seen": 49100511328,
      "step": 62408
    },
    {
      "epoch": 6.620942075111394,
      "grad_norm": 0.9042776154464893,
      "learning_rate": 2.098525045031046e-05,
      "loss": 1.003,
      "num_input_tokens_seen": 49101298128,
      "step": 62409
    },
    {
      "epoch": 6.621048164650966,
      "grad_norm": 1.0320202581550846,
      "learning_rate": 2.0984564502899673e-05,
      "loss": 1.1633,
      "num_input_tokens_seen": 49102084880,
      "step": 62410
    },
    {
      "epoch": 6.621154254190537,
      "grad_norm": 0.7442697820085095,
      "learning_rate": 2.098387855859189e-05,
      "loss": 0.9936,
      "num_input_tokens_seen": 49102871648,
      "step": 62411
    },
    {
      "epoch": 6.621260343730108,
      "grad_norm": 0.7556689229573007,
      "learning_rate": 2.0983192617387652e-05,
      "loss": 0.9445,
      "num_input_tokens_seen": 49103658384,
      "step": 62412
    },
    {
      "epoch": 6.62136643326968,
      "grad_norm": 0.939753476438699,
      "learning_rate": 2.0982506679287485e-05,
      "loss": 1.0638,
      "num_input_tokens_seen": 49104445152,
      "step": 62413
    },
    {
      "epoch": 6.621472522809251,
      "grad_norm": 0.8028650088085683,
      "learning_rate": 2.0981820744291914e-05,
      "loss": 1.0207,
      "num_input_tokens_seen": 49105231904,
      "step": 62414
    },
    {
      "epoch": 6.621578612348823,
      "grad_norm": 0.7760658882197357,
      "learning_rate": 2.098113481240148e-05,
      "loss": 0.9703,
      "num_input_tokens_seen": 49106018608,
      "step": 62415
    },
    {
      "epoch": 6.621684701888394,
      "grad_norm": 0.7761225404315736,
      "learning_rate": 2.0980448883616708e-05,
      "loss": 0.9619,
      "num_input_tokens_seen": 49106805328,
      "step": 62416
    },
    {
      "epoch": 6.621790791427966,
      "grad_norm": 0.7462028178834651,
      "learning_rate": 2.097976295793812e-05,
      "loss": 0.9694,
      "num_input_tokens_seen": 49107592048,
      "step": 62417
    },
    {
      "epoch": 6.621896880967537,
      "grad_norm": 0.7667909785894919,
      "learning_rate": 2.0979077035366256e-05,
      "loss": 1.009,
      "num_input_tokens_seen": 49108378768,
      "step": 62418
    },
    {
      "epoch": 6.622002970507108,
      "grad_norm": 0.7628249832495373,
      "learning_rate": 2.097839111590165e-05,
      "loss": 1.0003,
      "num_input_tokens_seen": 49109165552,
      "step": 62419
    },
    {
      "epoch": 6.62210906004668,
      "grad_norm": 1.1166700497858377,
      "learning_rate": 2.0977705199544816e-05,
      "loss": 1.0053,
      "num_input_tokens_seen": 49109952320,
      "step": 62420
    },
    {
      "epoch": 6.622215149586251,
      "grad_norm": 0.9320157640373291,
      "learning_rate": 2.0977019286296297e-05,
      "loss": 0.9901,
      "num_input_tokens_seen": 49110739056,
      "step": 62421
    },
    {
      "epoch": 6.622321239125823,
      "grad_norm": 0.7946915126569839,
      "learning_rate": 2.0976333376156623e-05,
      "loss": 1.0031,
      "num_input_tokens_seen": 49111525744,
      "step": 62422
    },
    {
      "epoch": 6.622427328665394,
      "grad_norm": 0.7246352870376541,
      "learning_rate": 2.0975647469126313e-05,
      "loss": 0.9937,
      "num_input_tokens_seen": 49112312496,
      "step": 62423
    },
    {
      "epoch": 6.622533418204965,
      "grad_norm": 0.8914724461928507,
      "learning_rate": 2.097496156520591e-05,
      "loss": 0.984,
      "num_input_tokens_seen": 49113099248,
      "step": 62424
    },
    {
      "epoch": 6.622639507744537,
      "grad_norm": 0.7227669628484809,
      "learning_rate": 2.0974275664395935e-05,
      "loss": 1.0539,
      "num_input_tokens_seen": 49113886048,
      "step": 62425
    },
    {
      "epoch": 6.622745597284108,
      "grad_norm": 0.9138450244329824,
      "learning_rate": 2.0973589766696926e-05,
      "loss": 1.0186,
      "num_input_tokens_seen": 49114672848,
      "step": 62426
    },
    {
      "epoch": 6.6228516868236795,
      "grad_norm": 0.6935715550528937,
      "learning_rate": 2.0972903872109407e-05,
      "loss": 1.0119,
      "num_input_tokens_seen": 49115459648,
      "step": 62427
    },
    {
      "epoch": 6.622957776363251,
      "grad_norm": 0.7288592516220109,
      "learning_rate": 2.0972217980633908e-05,
      "loss": 0.962,
      "num_input_tokens_seen": 49116246368,
      "step": 62428
    },
    {
      "epoch": 6.623063865902822,
      "grad_norm": 0.8962891477543893,
      "learning_rate": 2.0971532092270963e-05,
      "loss": 0.9916,
      "num_input_tokens_seen": 49117033120,
      "step": 62429
    },
    {
      "epoch": 6.6231699554423935,
      "grad_norm": 0.8139520870351973,
      "learning_rate": 2.09708462070211e-05,
      "loss": 1.0352,
      "num_input_tokens_seen": 49117819856,
      "step": 62430
    },
    {
      "epoch": 6.6232760449819645,
      "grad_norm": 0.9308087654887072,
      "learning_rate": 2.0970160324884845e-05,
      "loss": 1.0065,
      "num_input_tokens_seen": 49118606544,
      "step": 62431
    },
    {
      "epoch": 6.6233821345215365,
      "grad_norm": 0.7650445226391379,
      "learning_rate": 2.0969474445862736e-05,
      "loss": 1.0144,
      "num_input_tokens_seen": 49119393392,
      "step": 62432
    },
    {
      "epoch": 6.6234882240611075,
      "grad_norm": 0.7375540014546011,
      "learning_rate": 2.09687885699553e-05,
      "loss": 0.9725,
      "num_input_tokens_seen": 49120180176,
      "step": 62433
    },
    {
      "epoch": 6.6235943136006785,
      "grad_norm": 0.6767441496161403,
      "learning_rate": 2.096810269716306e-05,
      "loss": 0.9526,
      "num_input_tokens_seen": 49120966928,
      "step": 62434
    },
    {
      "epoch": 6.62370040314025,
      "grad_norm": 1.0408568378779919,
      "learning_rate": 2.0967416827486556e-05,
      "loss": 0.954,
      "num_input_tokens_seen": 49121753648,
      "step": 62435
    },
    {
      "epoch": 6.6238064926798215,
      "grad_norm": 1.0006109102713356,
      "learning_rate": 2.0966730960926314e-05,
      "loss": 1.0341,
      "num_input_tokens_seen": 49122540480,
      "step": 62436
    },
    {
      "epoch": 6.623912582219393,
      "grad_norm": 0.8024791260597507,
      "learning_rate": 2.0966045097482862e-05,
      "loss": 0.9907,
      "num_input_tokens_seen": 49123327264,
      "step": 62437
    },
    {
      "epoch": 6.624018671758964,
      "grad_norm": 0.9317249737936218,
      "learning_rate": 2.0965359237156735e-05,
      "loss": 1.0055,
      "num_input_tokens_seen": 49124113904,
      "step": 62438
    },
    {
      "epoch": 6.624124761298536,
      "grad_norm": 0.8807393665509178,
      "learning_rate": 2.096467337994846e-05,
      "loss": 0.9863,
      "num_input_tokens_seen": 49124900672,
      "step": 62439
    },
    {
      "epoch": 6.624230850838107,
      "grad_norm": 0.7352184485749043,
      "learning_rate": 2.0963987525858558e-05,
      "loss": 0.9234,
      "num_input_tokens_seen": 49125687376,
      "step": 62440
    },
    {
      "epoch": 6.624336940377678,
      "grad_norm": 0.752859679597233,
      "learning_rate": 2.0963301674887577e-05,
      "loss": 1.0409,
      "num_input_tokens_seen": 49126474208,
      "step": 62441
    },
    {
      "epoch": 6.62444302991725,
      "grad_norm": 0.8700811656353332,
      "learning_rate": 2.0962615827036033e-05,
      "loss": 0.9963,
      "num_input_tokens_seen": 49127261008,
      "step": 62442
    },
    {
      "epoch": 6.624549119456821,
      "grad_norm": 0.7522281138266245,
      "learning_rate": 2.0961929982304467e-05,
      "loss": 1.1104,
      "num_input_tokens_seen": 49128047824,
      "step": 62443
    },
    {
      "epoch": 6.624655208996393,
      "grad_norm": 0.7570108443707372,
      "learning_rate": 2.0961244140693405e-05,
      "loss": 1.0499,
      "num_input_tokens_seen": 49128834672,
      "step": 62444
    },
    {
      "epoch": 6.624761298535964,
      "grad_norm": 0.6746521648740559,
      "learning_rate": 2.0960558302203364e-05,
      "loss": 0.9891,
      "num_input_tokens_seen": 49129621440,
      "step": 62445
    },
    {
      "epoch": 6.624867388075536,
      "grad_norm": 0.8532295626683533,
      "learning_rate": 2.0959872466834893e-05,
      "loss": 0.9897,
      "num_input_tokens_seen": 49130408192,
      "step": 62446
    },
    {
      "epoch": 6.624973477615107,
      "grad_norm": 0.6040540460113697,
      "learning_rate": 2.0959186634588515e-05,
      "loss": 0.9142,
      "num_input_tokens_seen": 49131194864,
      "step": 62447
    },
    {
      "epoch": 6.625079567154678,
      "grad_norm": 0.8179823770671427,
      "learning_rate": 2.0958500805464754e-05,
      "loss": 0.9904,
      "num_input_tokens_seen": 49131981600,
      "step": 62448
    },
    {
      "epoch": 6.62518565669425,
      "grad_norm": 0.8026938266227988,
      "learning_rate": 2.0957814979464146e-05,
      "loss": 0.9929,
      "num_input_tokens_seen": 49132768352,
      "step": 62449
    },
    {
      "epoch": 6.625291746233821,
      "grad_norm": 0.7491241282258682,
      "learning_rate": 2.0957129156587222e-05,
      "loss": 1.0072,
      "num_input_tokens_seen": 49133555184,
      "step": 62450
    },
    {
      "epoch": 6.625397835773393,
      "grad_norm": 0.7168300840985937,
      "learning_rate": 2.095644333683451e-05,
      "loss": 0.9892,
      "num_input_tokens_seen": 49134342000,
      "step": 62451
    },
    {
      "epoch": 6.625503925312964,
      "grad_norm": 0.6660131969776659,
      "learning_rate": 2.095575752020654e-05,
      "loss": 0.9413,
      "num_input_tokens_seen": 49135128768,
      "step": 62452
    },
    {
      "epoch": 6.625610014852535,
      "grad_norm": 0.7106558126993536,
      "learning_rate": 2.0955071706703843e-05,
      "loss": 0.9619,
      "num_input_tokens_seen": 49135915632,
      "step": 62453
    },
    {
      "epoch": 6.625716104392107,
      "grad_norm": 0.7513004725679513,
      "learning_rate": 2.095438589632694e-05,
      "loss": 1.0284,
      "num_input_tokens_seen": 49136702448,
      "step": 62454
    },
    {
      "epoch": 6.625822193931678,
      "grad_norm": 0.8400569955452516,
      "learning_rate": 2.095370008907638e-05,
      "loss": 1.0655,
      "num_input_tokens_seen": 49137489184,
      "step": 62455
    },
    {
      "epoch": 6.62592828347125,
      "grad_norm": 0.7434560098892787,
      "learning_rate": 2.0953014284952677e-05,
      "loss": 0.9935,
      "num_input_tokens_seen": 49138275904,
      "step": 62456
    },
    {
      "epoch": 6.626034373010821,
      "grad_norm": 0.7606811162250008,
      "learning_rate": 2.0952328483956363e-05,
      "loss": 1.0682,
      "num_input_tokens_seen": 49139062608,
      "step": 62457
    },
    {
      "epoch": 6.626140462550392,
      "grad_norm": 0.7072900826721286,
      "learning_rate": 2.0951642686087962e-05,
      "loss": 0.9748,
      "num_input_tokens_seen": 49139849408,
      "step": 62458
    },
    {
      "epoch": 6.626246552089964,
      "grad_norm": 0.6468529095489549,
      "learning_rate": 2.0950956891348027e-05,
      "loss": 0.9963,
      "num_input_tokens_seen": 49140636144,
      "step": 62459
    },
    {
      "epoch": 6.626352641629535,
      "grad_norm": 0.7951217918767525,
      "learning_rate": 2.0950271099737075e-05,
      "loss": 1.0607,
      "num_input_tokens_seen": 49141422848,
      "step": 62460
    },
    {
      "epoch": 6.626458731169107,
      "grad_norm": 0.6738843209244705,
      "learning_rate": 2.0949585311255625e-05,
      "loss": 0.9404,
      "num_input_tokens_seen": 49142209584,
      "step": 62461
    },
    {
      "epoch": 6.626564820708678,
      "grad_norm": 0.8589904869770326,
      "learning_rate": 2.0948899525904226e-05,
      "loss": 0.974,
      "num_input_tokens_seen": 49142996256,
      "step": 62462
    },
    {
      "epoch": 6.626670910248249,
      "grad_norm": 0.6775756212186663,
      "learning_rate": 2.094821374368339e-05,
      "loss": 1.0024,
      "num_input_tokens_seen": 49143782944,
      "step": 62463
    },
    {
      "epoch": 6.626776999787821,
      "grad_norm": 0.6573210581516141,
      "learning_rate": 2.094752796459366e-05,
      "loss": 0.9873,
      "num_input_tokens_seen": 49144569712,
      "step": 62464
    },
    {
      "epoch": 6.626883089327392,
      "grad_norm": 0.778404815594631,
      "learning_rate": 2.0946842188635564e-05,
      "loss": 1.002,
      "num_input_tokens_seen": 49145356480,
      "step": 62465
    },
    {
      "epoch": 6.626989178866964,
      "grad_norm": 0.7762445250199005,
      "learning_rate": 2.0946156415809625e-05,
      "loss": 0.94,
      "num_input_tokens_seen": 49146143280,
      "step": 62466
    },
    {
      "epoch": 6.627095268406535,
      "grad_norm": 0.7515357613171164,
      "learning_rate": 2.094547064611638e-05,
      "loss": 0.9285,
      "num_input_tokens_seen": 49146929968,
      "step": 62467
    },
    {
      "epoch": 6.627201357946107,
      "grad_norm": 1.1130741003197635,
      "learning_rate": 2.094478487955636e-05,
      "loss": 1.0032,
      "num_input_tokens_seen": 49147716624,
      "step": 62468
    },
    {
      "epoch": 6.627307447485678,
      "grad_norm": 0.8505581862615207,
      "learning_rate": 2.0944099116130083e-05,
      "loss": 0.9763,
      "num_input_tokens_seen": 49148503392,
      "step": 62469
    },
    {
      "epoch": 6.627413537025249,
      "grad_norm": 0.7678275267948116,
      "learning_rate": 2.0943413355838093e-05,
      "loss": 1.016,
      "num_input_tokens_seen": 49149290144,
      "step": 62470
    },
    {
      "epoch": 6.627519626564821,
      "grad_norm": 0.7589260489001635,
      "learning_rate": 2.0942727598680914e-05,
      "loss": 1.0842,
      "num_input_tokens_seen": 49150076832,
      "step": 62471
    },
    {
      "epoch": 6.627625716104392,
      "grad_norm": 0.9248921041624188,
      "learning_rate": 2.0942041844659072e-05,
      "loss": 1.0015,
      "num_input_tokens_seen": 49150863600,
      "step": 62472
    },
    {
      "epoch": 6.627731805643964,
      "grad_norm": 0.6746324473658908,
      "learning_rate": 2.0941356093773105e-05,
      "loss": 0.9673,
      "num_input_tokens_seen": 49151650384,
      "step": 62473
    },
    {
      "epoch": 6.627837895183535,
      "grad_norm": 0.7589822255881832,
      "learning_rate": 2.094067034602354e-05,
      "loss": 0.9916,
      "num_input_tokens_seen": 49152437184,
      "step": 62474
    },
    {
      "epoch": 6.627943984723107,
      "grad_norm": 0.835767638175604,
      "learning_rate": 2.0939984601410898e-05,
      "loss": 1.046,
      "num_input_tokens_seen": 49153223984,
      "step": 62475
    },
    {
      "epoch": 6.628050074262678,
      "grad_norm": 0.7779847627868084,
      "learning_rate": 2.0939298859935725e-05,
      "loss": 0.9538,
      "num_input_tokens_seen": 49154010864,
      "step": 62476
    },
    {
      "epoch": 6.628156163802249,
      "grad_norm": 1.35200295697611,
      "learning_rate": 2.093861312159854e-05,
      "loss": 1.0619,
      "num_input_tokens_seen": 49154797568,
      "step": 62477
    },
    {
      "epoch": 6.628262253341821,
      "grad_norm": 1.1411406222426532,
      "learning_rate": 2.093792738639987e-05,
      "loss": 1.0229,
      "num_input_tokens_seen": 49155584352,
      "step": 62478
    },
    {
      "epoch": 6.628368342881392,
      "grad_norm": 0.774306257331142,
      "learning_rate": 2.093724165434026e-05,
      "loss": 0.9992,
      "num_input_tokens_seen": 49156371072,
      "step": 62479
    },
    {
      "epoch": 6.628474432420964,
      "grad_norm": 0.7800662978910153,
      "learning_rate": 2.0936555925420225e-05,
      "loss": 1.0046,
      "num_input_tokens_seen": 49157157792,
      "step": 62480
    },
    {
      "epoch": 6.628580521960535,
      "grad_norm": 0.6893767463309013,
      "learning_rate": 2.09358701996403e-05,
      "loss": 0.9588,
      "num_input_tokens_seen": 49157944544,
      "step": 62481
    },
    {
      "epoch": 6.628686611500106,
      "grad_norm": 0.6978176948540095,
      "learning_rate": 2.093518447700102e-05,
      "loss": 1.0169,
      "num_input_tokens_seen": 49158731312,
      "step": 62482
    },
    {
      "epoch": 6.628792701039678,
      "grad_norm": 0.7489301946047171,
      "learning_rate": 2.0934498757502902e-05,
      "loss": 1.007,
      "num_input_tokens_seen": 49159518016,
      "step": 62483
    },
    {
      "epoch": 6.628898790579249,
      "grad_norm": 0.713356440187715,
      "learning_rate": 2.093381304114649e-05,
      "loss": 0.9967,
      "num_input_tokens_seen": 49160304784,
      "step": 62484
    },
    {
      "epoch": 6.629004880118821,
      "grad_norm": 0.6502203165783532,
      "learning_rate": 2.093312732793231e-05,
      "loss": 0.8449,
      "num_input_tokens_seen": 49161091632,
      "step": 62485
    },
    {
      "epoch": 6.629110969658392,
      "grad_norm": 0.7897497314540918,
      "learning_rate": 2.0932441617860884e-05,
      "loss": 0.9768,
      "num_input_tokens_seen": 49161878432,
      "step": 62486
    },
    {
      "epoch": 6.629217059197963,
      "grad_norm": 0.6923876727217815,
      "learning_rate": 2.0931755910932756e-05,
      "loss": 0.9957,
      "num_input_tokens_seen": 49162665280,
      "step": 62487
    },
    {
      "epoch": 6.629323148737535,
      "grad_norm": 0.8299988993560203,
      "learning_rate": 2.093107020714844e-05,
      "loss": 0.9929,
      "num_input_tokens_seen": 49163451968,
      "step": 62488
    },
    {
      "epoch": 6.629429238277106,
      "grad_norm": 0.7578930080668546,
      "learning_rate": 2.0930384506508475e-05,
      "loss": 1.0676,
      "num_input_tokens_seen": 49164238768,
      "step": 62489
    },
    {
      "epoch": 6.6295353278166775,
      "grad_norm": 0.6763742662101155,
      "learning_rate": 2.092969880901339e-05,
      "loss": 0.9564,
      "num_input_tokens_seen": 49165025568,
      "step": 62490
    },
    {
      "epoch": 6.629641417356249,
      "grad_norm": 0.8300740266790538,
      "learning_rate": 2.092901311466372e-05,
      "loss": 1.0735,
      "num_input_tokens_seen": 49165812336,
      "step": 62491
    },
    {
      "epoch": 6.62974750689582,
      "grad_norm": 0.7899194561368886,
      "learning_rate": 2.0928327423459978e-05,
      "loss": 0.9706,
      "num_input_tokens_seen": 49166599136,
      "step": 62492
    },
    {
      "epoch": 6.6298535964353915,
      "grad_norm": 0.6907602559151261,
      "learning_rate": 2.0927641735402714e-05,
      "loss": 0.9797,
      "num_input_tokens_seen": 49167386000,
      "step": 62493
    },
    {
      "epoch": 6.6299596859749625,
      "grad_norm": 0.6838292029027347,
      "learning_rate": 2.0926956050492448e-05,
      "loss": 0.9943,
      "num_input_tokens_seen": 49168172736,
      "step": 62494
    },
    {
      "epoch": 6.6300657755145345,
      "grad_norm": 0.7133629611336776,
      "learning_rate": 2.0926270368729703e-05,
      "loss": 0.9909,
      "num_input_tokens_seen": 49168959504,
      "step": 62495
    },
    {
      "epoch": 6.6301718650541055,
      "grad_norm": 0.7234086762776867,
      "learning_rate": 2.0925584690115023e-05,
      "loss": 1.0001,
      "num_input_tokens_seen": 49169746336,
      "step": 62496
    },
    {
      "epoch": 6.630277954593677,
      "grad_norm": 0.6665214077459778,
      "learning_rate": 2.092489901464893e-05,
      "loss": 1.0687,
      "num_input_tokens_seen": 49170533056,
      "step": 62497
    },
    {
      "epoch": 6.6303840441332484,
      "grad_norm": 0.7414525730870222,
      "learning_rate": 2.0924213342331958e-05,
      "loss": 1.0144,
      "num_input_tokens_seen": 49171319808,
      "step": 62498
    },
    {
      "epoch": 6.6304901336728195,
      "grad_norm": 0.6472800020732349,
      "learning_rate": 2.0923527673164637e-05,
      "loss": 0.9635,
      "num_input_tokens_seen": 49172106560,
      "step": 62499
    },
    {
      "epoch": 6.630596223212391,
      "grad_norm": 0.7088936574108331,
      "learning_rate": 2.0922842007147485e-05,
      "loss": 1.008,
      "num_input_tokens_seen": 49172893200,
      "step": 62500
    },
    {
      "epoch": 6.630702312751962,
      "grad_norm": 0.6943028326473144,
      "learning_rate": 2.0922156344281048e-05,
      "loss": 1.0184,
      "num_input_tokens_seen": 49173679952,
      "step": 62501
    },
    {
      "epoch": 6.630808402291534,
      "grad_norm": 0.8763004177639266,
      "learning_rate": 2.092147068456585e-05,
      "loss": 0.9515,
      "num_input_tokens_seen": 49174466768,
      "step": 62502
    },
    {
      "epoch": 6.630914491831105,
      "grad_norm": 0.6359363789589584,
      "learning_rate": 2.092078502800241e-05,
      "loss": 0.9007,
      "num_input_tokens_seen": 49175253536,
      "step": 62503
    },
    {
      "epoch": 6.631020581370677,
      "grad_norm": 1.0576019975391964,
      "learning_rate": 2.092009937459128e-05,
      "loss": 1.0524,
      "num_input_tokens_seen": 49176040176,
      "step": 62504
    },
    {
      "epoch": 6.631126670910248,
      "grad_norm": 0.779638709871223,
      "learning_rate": 2.091941372433297e-05,
      "loss": 1.0739,
      "num_input_tokens_seen": 49176826976,
      "step": 62505
    },
    {
      "epoch": 6.631232760449819,
      "grad_norm": 0.8213766671856813,
      "learning_rate": 2.091872807722802e-05,
      "loss": 1.0422,
      "num_input_tokens_seen": 49177613712,
      "step": 62506
    },
    {
      "epoch": 6.631338849989391,
      "grad_norm": 0.8930568829661549,
      "learning_rate": 2.0918042433276956e-05,
      "loss": 1.0087,
      "num_input_tokens_seen": 49178400560,
      "step": 62507
    },
    {
      "epoch": 6.631444939528962,
      "grad_norm": 0.9915834802913357,
      "learning_rate": 2.0917356792480312e-05,
      "loss": 1.0146,
      "num_input_tokens_seen": 49179187344,
      "step": 62508
    },
    {
      "epoch": 6.631551029068534,
      "grad_norm": 0.9093303370322685,
      "learning_rate": 2.091667115483861e-05,
      "loss": 0.988,
      "num_input_tokens_seen": 49179974080,
      "step": 62509
    },
    {
      "epoch": 6.631657118608105,
      "grad_norm": 0.9940149653431033,
      "learning_rate": 2.0915985520352387e-05,
      "loss": 0.928,
      "num_input_tokens_seen": 49180760912,
      "step": 62510
    },
    {
      "epoch": 6.631763208147676,
      "grad_norm": 0.7605300094486864,
      "learning_rate": 2.091529988902217e-05,
      "loss": 0.97,
      "num_input_tokens_seen": 49181547664,
      "step": 62511
    },
    {
      "epoch": 6.631869297687248,
      "grad_norm": 0.6506440660332856,
      "learning_rate": 2.091461426084849e-05,
      "loss": 0.9435,
      "num_input_tokens_seen": 49182334432,
      "step": 62512
    },
    {
      "epoch": 6.631975387226819,
      "grad_norm": 0.8947325970853423,
      "learning_rate": 2.091392863583188e-05,
      "loss": 1.0348,
      "num_input_tokens_seen": 49183121216,
      "step": 62513
    },
    {
      "epoch": 6.632081476766391,
      "grad_norm": 1.0403965168680964,
      "learning_rate": 2.091324301397286e-05,
      "loss": 1.0811,
      "num_input_tokens_seen": 49183908000,
      "step": 62514
    },
    {
      "epoch": 6.632187566305962,
      "grad_norm": 0.9839203790179619,
      "learning_rate": 2.091255739527197e-05,
      "loss": 1.0115,
      "num_input_tokens_seen": 49184694880,
      "step": 62515
    },
    {
      "epoch": 6.632293655845533,
      "grad_norm": 0.7799165853507298,
      "learning_rate": 2.0911871779729735e-05,
      "loss": 0.9499,
      "num_input_tokens_seen": 49185481584,
      "step": 62516
    },
    {
      "epoch": 6.632399745385105,
      "grad_norm": 0.9983216966704043,
      "learning_rate": 2.091118616734668e-05,
      "loss": 0.9929,
      "num_input_tokens_seen": 49186268336,
      "step": 62517
    },
    {
      "epoch": 6.632505834924676,
      "grad_norm": 0.6916381362848605,
      "learning_rate": 2.0910500558123347e-05,
      "loss": 0.944,
      "num_input_tokens_seen": 49187055040,
      "step": 62518
    },
    {
      "epoch": 6.632611924464248,
      "grad_norm": 1.1173858020333718,
      "learning_rate": 2.090981495206026e-05,
      "loss": 0.9794,
      "num_input_tokens_seen": 49187841776,
      "step": 62519
    },
    {
      "epoch": 6.632718014003819,
      "grad_norm": 0.7832624766213565,
      "learning_rate": 2.090912934915794e-05,
      "loss": 0.9169,
      "num_input_tokens_seen": 49188628528,
      "step": 62520
    },
    {
      "epoch": 6.63282410354339,
      "grad_norm": 0.8497550823910839,
      "learning_rate": 2.0908443749416932e-05,
      "loss": 1.0677,
      "num_input_tokens_seen": 49189415248,
      "step": 62521
    },
    {
      "epoch": 6.632930193082962,
      "grad_norm": 0.7581288831618903,
      "learning_rate": 2.090775815283776e-05,
      "loss": 0.9132,
      "num_input_tokens_seen": 49190202032,
      "step": 62522
    },
    {
      "epoch": 6.633036282622533,
      "grad_norm": 0.9072048989535981,
      "learning_rate": 2.0907072559420947e-05,
      "loss": 0.9743,
      "num_input_tokens_seen": 49190988800,
      "step": 62523
    },
    {
      "epoch": 6.633142372162105,
      "grad_norm": 0.8422888564940749,
      "learning_rate": 2.090638696916703e-05,
      "loss": 1.0411,
      "num_input_tokens_seen": 49191775552,
      "step": 62524
    },
    {
      "epoch": 6.633248461701676,
      "grad_norm": 1.0495155139369696,
      "learning_rate": 2.090570138207654e-05,
      "loss": 1.0419,
      "num_input_tokens_seen": 49192562224,
      "step": 62525
    },
    {
      "epoch": 6.633354551241248,
      "grad_norm": 0.8444323500971043,
      "learning_rate": 2.0905015798149996e-05,
      "loss": 1.0318,
      "num_input_tokens_seen": 49193349040,
      "step": 62526
    },
    {
      "epoch": 6.633460640780819,
      "grad_norm": 0.8960242157762769,
      "learning_rate": 2.0904330217387944e-05,
      "loss": 0.9874,
      "num_input_tokens_seen": 49194135760,
      "step": 62527
    },
    {
      "epoch": 6.633566730320391,
      "grad_norm": 1.0485627020699573,
      "learning_rate": 2.0903644639790898e-05,
      "loss": 0.9613,
      "num_input_tokens_seen": 49194922576,
      "step": 62528
    },
    {
      "epoch": 6.633672819859962,
      "grad_norm": 0.8579126064068089,
      "learning_rate": 2.09029590653594e-05,
      "loss": 1.0077,
      "num_input_tokens_seen": 49195709344,
      "step": 62529
    },
    {
      "epoch": 6.633778909399533,
      "grad_norm": 0.8305610926313494,
      "learning_rate": 2.090227349409398e-05,
      "loss": 0.9766,
      "num_input_tokens_seen": 49196496192,
      "step": 62530
    },
    {
      "epoch": 6.633884998939105,
      "grad_norm": 0.8381511704881554,
      "learning_rate": 2.0901587925995152e-05,
      "loss": 1.0803,
      "num_input_tokens_seen": 49197282960,
      "step": 62531
    },
    {
      "epoch": 6.633991088478676,
      "grad_norm": 1.0541596403315767,
      "learning_rate": 2.090090236106346e-05,
      "loss": 1.0698,
      "num_input_tokens_seen": 49198069760,
      "step": 62532
    },
    {
      "epoch": 6.634097178018248,
      "grad_norm": 0.7848944113054376,
      "learning_rate": 2.090021679929944e-05,
      "loss": 0.9631,
      "num_input_tokens_seen": 49198856608,
      "step": 62533
    },
    {
      "epoch": 6.634203267557819,
      "grad_norm": 0.9880436934848242,
      "learning_rate": 2.08995312407036e-05,
      "loss": 1.0591,
      "num_input_tokens_seen": 49199643328,
      "step": 62534
    },
    {
      "epoch": 6.63430935709739,
      "grad_norm": 0.9321883671522532,
      "learning_rate": 2.0898845685276485e-05,
      "loss": 1.0639,
      "num_input_tokens_seen": 49200430160,
      "step": 62535
    },
    {
      "epoch": 6.634415446636962,
      "grad_norm": 0.6883492311159759,
      "learning_rate": 2.0898160133018626e-05,
      "loss": 1.0388,
      "num_input_tokens_seen": 49201216864,
      "step": 62536
    },
    {
      "epoch": 6.634521536176533,
      "grad_norm": 1.0401386414883096,
      "learning_rate": 2.0897474583930545e-05,
      "loss": 1.0192,
      "num_input_tokens_seen": 49202003728,
      "step": 62537
    },
    {
      "epoch": 6.634627625716105,
      "grad_norm": 0.7641511486778338,
      "learning_rate": 2.0896789038012775e-05,
      "loss": 1.0234,
      "num_input_tokens_seen": 49202790528,
      "step": 62538
    },
    {
      "epoch": 6.634733715255676,
      "grad_norm": 0.7731600757927668,
      "learning_rate": 2.089610349526585e-05,
      "loss": 0.9855,
      "num_input_tokens_seen": 49203577296,
      "step": 62539
    },
    {
      "epoch": 6.634839804795247,
      "grad_norm": 0.8248682614259429,
      "learning_rate": 2.089541795569029e-05,
      "loss": 0.9982,
      "num_input_tokens_seen": 49204364048,
      "step": 62540
    },
    {
      "epoch": 6.634945894334819,
      "grad_norm": 0.8596332733225468,
      "learning_rate": 2.0894732419286634e-05,
      "loss": 1.0387,
      "num_input_tokens_seen": 49205150752,
      "step": 62541
    },
    {
      "epoch": 6.63505198387439,
      "grad_norm": 0.6920558649739901,
      "learning_rate": 2.089404688605541e-05,
      "loss": 1.0018,
      "num_input_tokens_seen": 49205937568,
      "step": 62542
    },
    {
      "epoch": 6.635158073413962,
      "grad_norm": 0.7325228989080006,
      "learning_rate": 2.0893361355997142e-05,
      "loss": 1.0116,
      "num_input_tokens_seen": 49206724464,
      "step": 62543
    },
    {
      "epoch": 6.635264162953533,
      "grad_norm": 0.8063305144478224,
      "learning_rate": 2.0892675829112365e-05,
      "loss": 0.9925,
      "num_input_tokens_seen": 49207511184,
      "step": 62544
    },
    {
      "epoch": 6.635370252493104,
      "grad_norm": 0.7899359398478436,
      "learning_rate": 2.0891990305401604e-05,
      "loss": 0.999,
      "num_input_tokens_seen": 49208297936,
      "step": 62545
    },
    {
      "epoch": 6.635476342032676,
      "grad_norm": 0.7163424189541785,
      "learning_rate": 2.08913047848654e-05,
      "loss": 1.037,
      "num_input_tokens_seen": 49209084736,
      "step": 62546
    },
    {
      "epoch": 6.635582431572247,
      "grad_norm": 0.8908178649443902,
      "learning_rate": 2.0890619267504272e-05,
      "loss": 0.9486,
      "num_input_tokens_seen": 49209871632,
      "step": 62547
    },
    {
      "epoch": 6.635688521111819,
      "grad_norm": 0.706883557832059,
      "learning_rate": 2.0889933753318748e-05,
      "loss": 0.9807,
      "num_input_tokens_seen": 49210658464,
      "step": 62548
    },
    {
      "epoch": 6.63579461065139,
      "grad_norm": 0.781855447470236,
      "learning_rate": 2.088924824230937e-05,
      "loss": 1.0182,
      "num_input_tokens_seen": 49211445216,
      "step": 62549
    },
    {
      "epoch": 6.635900700190961,
      "grad_norm": 0.8100943190027651,
      "learning_rate": 2.088856273447666e-05,
      "loss": 1.0379,
      "num_input_tokens_seen": 49212232032,
      "step": 62550
    },
    {
      "epoch": 6.636006789730533,
      "grad_norm": 0.7815872265163255,
      "learning_rate": 2.088787722982114e-05,
      "loss": 1.0609,
      "num_input_tokens_seen": 49213018848,
      "step": 62551
    },
    {
      "epoch": 6.636112879270104,
      "grad_norm": 0.7627926665413272,
      "learning_rate": 2.0887191728343354e-05,
      "loss": 0.9954,
      "num_input_tokens_seen": 49213805616,
      "step": 62552
    },
    {
      "epoch": 6.6362189688096755,
      "grad_norm": 0.6976143219207296,
      "learning_rate": 2.088650623004382e-05,
      "loss": 1.0787,
      "num_input_tokens_seen": 49214592368,
      "step": 62553
    },
    {
      "epoch": 6.636325058349247,
      "grad_norm": 0.7608871293665268,
      "learning_rate": 2.088582073492308e-05,
      "loss": 1.013,
      "num_input_tokens_seen": 49215379120,
      "step": 62554
    },
    {
      "epoch": 6.6364311478888185,
      "grad_norm": 0.5603525980779687,
      "learning_rate": 2.088513524298165e-05,
      "loss": 0.901,
      "num_input_tokens_seen": 49216166048,
      "step": 62555
    },
    {
      "epoch": 6.6365372374283895,
      "grad_norm": 0.7491282192276909,
      "learning_rate": 2.0884449754220075e-05,
      "loss": 0.9531,
      "num_input_tokens_seen": 49216952864,
      "step": 62556
    },
    {
      "epoch": 6.636643326967961,
      "grad_norm": 0.845347262929942,
      "learning_rate": 2.0883764268638874e-05,
      "loss": 1.0377,
      "num_input_tokens_seen": 49217739616,
      "step": 62557
    },
    {
      "epoch": 6.6367494165075325,
      "grad_norm": 0.8495192866240779,
      "learning_rate": 2.0883078786238574e-05,
      "loss": 0.9758,
      "num_input_tokens_seen": 49218526368,
      "step": 62558
    },
    {
      "epoch": 6.6368555060471035,
      "grad_norm": 0.8473072391739892,
      "learning_rate": 2.0882393307019715e-05,
      "loss": 0.9784,
      "num_input_tokens_seen": 49219313120,
      "step": 62559
    },
    {
      "epoch": 6.636961595586675,
      "grad_norm": 0.7886722150670865,
      "learning_rate": 2.0881707830982824e-05,
      "loss": 1.0485,
      "num_input_tokens_seen": 49220099888,
      "step": 62560
    },
    {
      "epoch": 6.6370676851262465,
      "grad_norm": 0.9463994673961487,
      "learning_rate": 2.0881022358128423e-05,
      "loss": 1.05,
      "num_input_tokens_seen": 49220886704,
      "step": 62561
    },
    {
      "epoch": 6.637173774665818,
      "grad_norm": 0.7697914453043072,
      "learning_rate": 2.088033688845705e-05,
      "loss": 0.9528,
      "num_input_tokens_seen": 49221673472,
      "step": 62562
    },
    {
      "epoch": 6.637279864205389,
      "grad_norm": 0.818523036281014,
      "learning_rate": 2.0879651421969234e-05,
      "loss": 1.0004,
      "num_input_tokens_seen": 49222460224,
      "step": 62563
    },
    {
      "epoch": 6.63738595374496,
      "grad_norm": 0.9445396832356645,
      "learning_rate": 2.08789659586655e-05,
      "loss": 1.0772,
      "num_input_tokens_seen": 49223247056,
      "step": 62564
    },
    {
      "epoch": 6.637492043284532,
      "grad_norm": 0.7544900763024895,
      "learning_rate": 2.0878280498546376e-05,
      "loss": 1.0458,
      "num_input_tokens_seen": 49224033872,
      "step": 62565
    },
    {
      "epoch": 6.637598132824103,
      "grad_norm": 1.1856039254645214,
      "learning_rate": 2.0877595041612395e-05,
      "loss": 1.0693,
      "num_input_tokens_seen": 49224820544,
      "step": 62566
    },
    {
      "epoch": 6.637704222363675,
      "grad_norm": 1.140989425441913,
      "learning_rate": 2.0876909587864096e-05,
      "loss": 1.0405,
      "num_input_tokens_seen": 49225607392,
      "step": 62567
    },
    {
      "epoch": 6.637810311903246,
      "grad_norm": 0.7622854788165507,
      "learning_rate": 2.0876224137302e-05,
      "loss": 1.1014,
      "num_input_tokens_seen": 49226394048,
      "step": 62568
    },
    {
      "epoch": 6.637916401442817,
      "grad_norm": 1.1139598011787728,
      "learning_rate": 2.087553868992663e-05,
      "loss": 0.9612,
      "num_input_tokens_seen": 49227180864,
      "step": 62569
    },
    {
      "epoch": 6.638022490982389,
      "grad_norm": 0.7377424049998085,
      "learning_rate": 2.087485324573853e-05,
      "loss": 0.9524,
      "num_input_tokens_seen": 49227967648,
      "step": 62570
    },
    {
      "epoch": 6.63812858052196,
      "grad_norm": 0.8911140637613121,
      "learning_rate": 2.087416780473822e-05,
      "loss": 1.0504,
      "num_input_tokens_seen": 49228754496,
      "step": 62571
    },
    {
      "epoch": 6.638234670061532,
      "grad_norm": 0.7641258312199962,
      "learning_rate": 2.087348236692623e-05,
      "loss": 0.9649,
      "num_input_tokens_seen": 49229541264,
      "step": 62572
    },
    {
      "epoch": 6.638340759601103,
      "grad_norm": 0.8824167898808445,
      "learning_rate": 2.087279693230309e-05,
      "loss": 0.9699,
      "num_input_tokens_seen": 49230328032,
      "step": 62573
    },
    {
      "epoch": 6.638446849140674,
      "grad_norm": 0.7891083928803926,
      "learning_rate": 2.0872111500869338e-05,
      "loss": 0.992,
      "num_input_tokens_seen": 49231114832,
      "step": 62574
    },
    {
      "epoch": 6.638552938680246,
      "grad_norm": 0.7473984872152569,
      "learning_rate": 2.087142607262549e-05,
      "loss": 0.9548,
      "num_input_tokens_seen": 49231901520,
      "step": 62575
    },
    {
      "epoch": 6.638659028219817,
      "grad_norm": 0.7249064505171539,
      "learning_rate": 2.0870740647572083e-05,
      "loss": 0.9769,
      "num_input_tokens_seen": 49232688208,
      "step": 62576
    },
    {
      "epoch": 6.638765117759389,
      "grad_norm": 0.8737106166274923,
      "learning_rate": 2.0870055225709654e-05,
      "loss": 0.9749,
      "num_input_tokens_seen": 49233474928,
      "step": 62577
    },
    {
      "epoch": 6.63887120729896,
      "grad_norm": 0.7371125298549338,
      "learning_rate": 2.086936980703872e-05,
      "loss": 0.9604,
      "num_input_tokens_seen": 49234261824,
      "step": 62578
    },
    {
      "epoch": 6.638977296838532,
      "grad_norm": 0.7930476432791107,
      "learning_rate": 2.0868684391559813e-05,
      "loss": 1.117,
      "num_input_tokens_seen": 49235048544,
      "step": 62579
    },
    {
      "epoch": 6.639083386378103,
      "grad_norm": 0.7647345568444193,
      "learning_rate": 2.0867998979273474e-05,
      "loss": 0.9701,
      "num_input_tokens_seen": 49235835200,
      "step": 62580
    },
    {
      "epoch": 6.639189475917674,
      "grad_norm": 1.2179705824731424,
      "learning_rate": 2.0867313570180213e-05,
      "loss": 1.0487,
      "num_input_tokens_seen": 49236621968,
      "step": 62581
    },
    {
      "epoch": 6.639295565457246,
      "grad_norm": 0.6897751901887011,
      "learning_rate": 2.086662816428058e-05,
      "loss": 1.0058,
      "num_input_tokens_seen": 49237408752,
      "step": 62582
    },
    {
      "epoch": 6.639401654996817,
      "grad_norm": 1.0805868333128181,
      "learning_rate": 2.086594276157509e-05,
      "loss": 0.9868,
      "num_input_tokens_seen": 49238195520,
      "step": 62583
    },
    {
      "epoch": 6.639507744536389,
      "grad_norm": 0.6541644990551426,
      "learning_rate": 2.086525736206428e-05,
      "loss": 0.9562,
      "num_input_tokens_seen": 49238982272,
      "step": 62584
    },
    {
      "epoch": 6.63961383407596,
      "grad_norm": 0.9060379364236868,
      "learning_rate": 2.086457196574868e-05,
      "loss": 0.9743,
      "num_input_tokens_seen": 49239769072,
      "step": 62585
    },
    {
      "epoch": 6.639719923615532,
      "grad_norm": 0.778951053956235,
      "learning_rate": 2.0863886572628815e-05,
      "loss": 0.9798,
      "num_input_tokens_seen": 49240555824,
      "step": 62586
    },
    {
      "epoch": 6.639826013155103,
      "grad_norm": 0.805671960657401,
      "learning_rate": 2.0863201182705217e-05,
      "loss": 1.0435,
      "num_input_tokens_seen": 49241342512,
      "step": 62587
    },
    {
      "epoch": 6.639932102694674,
      "grad_norm": 0.7703871519424745,
      "learning_rate": 2.086251579597842e-05,
      "loss": 0.9663,
      "num_input_tokens_seen": 49242129392,
      "step": 62588
    },
    {
      "epoch": 6.640038192234246,
      "grad_norm": 0.774604760643751,
      "learning_rate": 2.086183041244894e-05,
      "loss": 0.9951,
      "num_input_tokens_seen": 49242916192,
      "step": 62589
    },
    {
      "epoch": 6.640144281773817,
      "grad_norm": 0.7554472731679982,
      "learning_rate": 2.0861145032117323e-05,
      "loss": 0.9913,
      "num_input_tokens_seen": 49243702992,
      "step": 62590
    },
    {
      "epoch": 6.640250371313389,
      "grad_norm": 1.1532229380019263,
      "learning_rate": 2.0860459654984092e-05,
      "loss": 0.9946,
      "num_input_tokens_seen": 49244489776,
      "step": 62591
    },
    {
      "epoch": 6.64035646085296,
      "grad_norm": 0.7562119372497227,
      "learning_rate": 2.0859774281049772e-05,
      "loss": 1.0443,
      "num_input_tokens_seen": 49245276544,
      "step": 62592
    },
    {
      "epoch": 6.640462550392531,
      "grad_norm": 0.8680363617635721,
      "learning_rate": 2.0859088910314903e-05,
      "loss": 1.0067,
      "num_input_tokens_seen": 49246063184,
      "step": 62593
    },
    {
      "epoch": 6.640568639932103,
      "grad_norm": 0.9149415356719529,
      "learning_rate": 2.085840354278001e-05,
      "loss": 1.0092,
      "num_input_tokens_seen": 49246849904,
      "step": 62594
    },
    {
      "epoch": 6.640674729471674,
      "grad_norm": 0.802145850600958,
      "learning_rate": 2.085771817844561e-05,
      "loss": 1.0497,
      "num_input_tokens_seen": 49247636640,
      "step": 62595
    },
    {
      "epoch": 6.640780819011246,
      "grad_norm": 0.7207874473286046,
      "learning_rate": 2.0857032817312256e-05,
      "loss": 0.9429,
      "num_input_tokens_seen": 49248423360,
      "step": 62596
    },
    {
      "epoch": 6.640886908550817,
      "grad_norm": 0.981969055338652,
      "learning_rate": 2.085634745938046e-05,
      "loss": 0.9778,
      "num_input_tokens_seen": 49249210160,
      "step": 62597
    },
    {
      "epoch": 6.640992998090388,
      "grad_norm": 0.7106451690169268,
      "learning_rate": 2.085566210465075e-05,
      "loss": 0.9824,
      "num_input_tokens_seen": 49249996960,
      "step": 62598
    },
    {
      "epoch": 6.64109908762996,
      "grad_norm": 1.00813281437106,
      "learning_rate": 2.0854976753123675e-05,
      "loss": 0.9579,
      "num_input_tokens_seen": 49250783776,
      "step": 62599
    },
    {
      "epoch": 6.641205177169531,
      "grad_norm": 0.7560172803340821,
      "learning_rate": 2.0854291404799742e-05,
      "loss": 1.0052,
      "num_input_tokens_seen": 49251570608,
      "step": 62600
    },
    {
      "epoch": 6.641311266709103,
      "grad_norm": 0.7777499309672542,
      "learning_rate": 2.0853606059679498e-05,
      "loss": 1.0286,
      "num_input_tokens_seen": 49252357312,
      "step": 62601
    },
    {
      "epoch": 6.641417356248674,
      "grad_norm": 0.8172810896718405,
      "learning_rate": 2.0852920717763468e-05,
      "loss": 0.9566,
      "num_input_tokens_seen": 49253143952,
      "step": 62602
    },
    {
      "epoch": 6.641523445788245,
      "grad_norm": 0.971572919191829,
      "learning_rate": 2.085223537905217e-05,
      "loss": 1.0008,
      "num_input_tokens_seen": 49253930624,
      "step": 62603
    },
    {
      "epoch": 6.641629535327817,
      "grad_norm": 0.7775062306933244,
      "learning_rate": 2.085155004354615e-05,
      "loss": 1.0185,
      "num_input_tokens_seen": 49254717376,
      "step": 62604
    },
    {
      "epoch": 6.641735624867388,
      "grad_norm": 0.7704152189270214,
      "learning_rate": 2.0850864711245928e-05,
      "loss": 0.9793,
      "num_input_tokens_seen": 49255504096,
      "step": 62605
    },
    {
      "epoch": 6.64184171440696,
      "grad_norm": 0.8492347287879305,
      "learning_rate": 2.0850179382152035e-05,
      "loss": 1.0206,
      "num_input_tokens_seen": 49256290800,
      "step": 62606
    },
    {
      "epoch": 6.641947803946531,
      "grad_norm": 0.9021429231601782,
      "learning_rate": 2.0849494056265005e-05,
      "loss": 1.0125,
      "num_input_tokens_seen": 49257077536,
      "step": 62607
    },
    {
      "epoch": 6.642053893486103,
      "grad_norm": 0.8001460507832644,
      "learning_rate": 2.0848808733585364e-05,
      "loss": 1.0066,
      "num_input_tokens_seen": 49257864272,
      "step": 62608
    },
    {
      "epoch": 6.642159983025674,
      "grad_norm": 0.7842299243316763,
      "learning_rate": 2.0848123414113636e-05,
      "loss": 1.0836,
      "num_input_tokens_seen": 49258651008,
      "step": 62609
    },
    {
      "epoch": 6.642266072565245,
      "grad_norm": 0.9738958475358616,
      "learning_rate": 2.084743809785036e-05,
      "loss": 1.0729,
      "num_input_tokens_seen": 49259437776,
      "step": 62610
    },
    {
      "epoch": 6.642372162104817,
      "grad_norm": 0.8261045360947963,
      "learning_rate": 2.0846752784796063e-05,
      "loss": 0.9688,
      "num_input_tokens_seen": 49260224608,
      "step": 62611
    },
    {
      "epoch": 6.642478251644388,
      "grad_norm": 0.9735893331499513,
      "learning_rate": 2.084606747495127e-05,
      "loss": 1.0169,
      "num_input_tokens_seen": 49261011392,
      "step": 62612
    },
    {
      "epoch": 6.64258434118396,
      "grad_norm": 0.682046481636472,
      "learning_rate": 2.084538216831652e-05,
      "loss": 1.0461,
      "num_input_tokens_seen": 49261798128,
      "step": 62613
    },
    {
      "epoch": 6.642690430723531,
      "grad_norm": 0.7264916294871901,
      "learning_rate": 2.0844696864892328e-05,
      "loss": 1.0375,
      "num_input_tokens_seen": 49262584848,
      "step": 62614
    },
    {
      "epoch": 6.6427965202631025,
      "grad_norm": 0.9925724701616301,
      "learning_rate": 2.0844011564679243e-05,
      "loss": 1.0701,
      "num_input_tokens_seen": 49263371664,
      "step": 62615
    },
    {
      "epoch": 6.6429026098026736,
      "grad_norm": 0.8504192882004421,
      "learning_rate": 2.084332626767778e-05,
      "loss": 1.0715,
      "num_input_tokens_seen": 49264158336,
      "step": 62616
    },
    {
      "epoch": 6.643008699342245,
      "grad_norm": 0.8437028077652934,
      "learning_rate": 2.0842640973888466e-05,
      "loss": 1.0494,
      "num_input_tokens_seen": 49264945072,
      "step": 62617
    },
    {
      "epoch": 6.6431147888818165,
      "grad_norm": 0.9102519113358278,
      "learning_rate": 2.0841955683311844e-05,
      "loss": 1.024,
      "num_input_tokens_seen": 49265731776,
      "step": 62618
    },
    {
      "epoch": 6.6432208784213875,
      "grad_norm": 0.6699083592728001,
      "learning_rate": 2.0841270395948436e-05,
      "loss": 1.0212,
      "num_input_tokens_seen": 49266518560,
      "step": 62619
    },
    {
      "epoch": 6.6433269679609595,
      "grad_norm": 0.6679063346124978,
      "learning_rate": 2.0840585111798768e-05,
      "loss": 0.9341,
      "num_input_tokens_seen": 49267305440,
      "step": 62620
    },
    {
      "epoch": 6.6434330575005305,
      "grad_norm": 0.8075904337708774,
      "learning_rate": 2.083989983086338e-05,
      "loss": 0.9181,
      "num_input_tokens_seen": 49268092224,
      "step": 62621
    },
    {
      "epoch": 6.6435391470401015,
      "grad_norm": 1.0143143607213294,
      "learning_rate": 2.0839214553142795e-05,
      "loss": 1.0684,
      "num_input_tokens_seen": 49268878944,
      "step": 62622
    },
    {
      "epoch": 6.643645236579673,
      "grad_norm": 0.6676622616332266,
      "learning_rate": 2.0838529278637536e-05,
      "loss": 0.9947,
      "num_input_tokens_seen": 49269665680,
      "step": 62623
    },
    {
      "epoch": 6.6437513261192445,
      "grad_norm": 0.7533548468420841,
      "learning_rate": 2.0837844007348146e-05,
      "loss": 0.9784,
      "num_input_tokens_seen": 49270452480,
      "step": 62624
    },
    {
      "epoch": 6.643857415658816,
      "grad_norm": 0.819764598890476,
      "learning_rate": 2.0837158739275146e-05,
      "loss": 0.9557,
      "num_input_tokens_seen": 49271239280,
      "step": 62625
    },
    {
      "epoch": 6.643963505198387,
      "grad_norm": 0.800124176271804,
      "learning_rate": 2.0836473474419067e-05,
      "loss": 1.0148,
      "num_input_tokens_seen": 49272026064,
      "step": 62626
    },
    {
      "epoch": 6.644069594737958,
      "grad_norm": 0.6854565767892481,
      "learning_rate": 2.083578821278044e-05,
      "loss": 0.9923,
      "num_input_tokens_seen": 49272812880,
      "step": 62627
    },
    {
      "epoch": 6.64417568427753,
      "grad_norm": 0.7492951352967856,
      "learning_rate": 2.0835102954359796e-05,
      "loss": 1.1073,
      "num_input_tokens_seen": 49273599664,
      "step": 62628
    },
    {
      "epoch": 6.644281773817101,
      "grad_norm": 0.604646614282268,
      "learning_rate": 2.0834417699157656e-05,
      "loss": 0.934,
      "num_input_tokens_seen": 49274386448,
      "step": 62629
    },
    {
      "epoch": 6.644387863356673,
      "grad_norm": 0.9920133197539218,
      "learning_rate": 2.083373244717456e-05,
      "loss": 1.0353,
      "num_input_tokens_seen": 49275173200,
      "step": 62630
    },
    {
      "epoch": 6.644493952896244,
      "grad_norm": 0.8032416656573146,
      "learning_rate": 2.0833047198411028e-05,
      "loss": 1.0885,
      "num_input_tokens_seen": 49275959920,
      "step": 62631
    },
    {
      "epoch": 6.644600042435815,
      "grad_norm": 0.7746861808064591,
      "learning_rate": 2.08323619528676e-05,
      "loss": 0.9347,
      "num_input_tokens_seen": 49276746768,
      "step": 62632
    },
    {
      "epoch": 6.644706131975387,
      "grad_norm": 0.7926744124446129,
      "learning_rate": 2.0831676710544803e-05,
      "loss": 1.0099,
      "num_input_tokens_seen": 49277533600,
      "step": 62633
    },
    {
      "epoch": 6.644812221514958,
      "grad_norm": 0.8836420926642067,
      "learning_rate": 2.083099147144316e-05,
      "loss": 1.1174,
      "num_input_tokens_seen": 49278320368,
      "step": 62634
    },
    {
      "epoch": 6.64491831105453,
      "grad_norm": 0.7201056200771814,
      "learning_rate": 2.0830306235563206e-05,
      "loss": 1.0404,
      "num_input_tokens_seen": 49279107152,
      "step": 62635
    },
    {
      "epoch": 6.645024400594101,
      "grad_norm": 0.7747169702332525,
      "learning_rate": 2.082962100290547e-05,
      "loss": 0.9557,
      "num_input_tokens_seen": 49279893888,
      "step": 62636
    },
    {
      "epoch": 6.645130490133673,
      "grad_norm": 1.0127624565784747,
      "learning_rate": 2.0828935773470476e-05,
      "loss": 1.034,
      "num_input_tokens_seen": 49280680672,
      "step": 62637
    },
    {
      "epoch": 6.645236579673244,
      "grad_norm": 0.7493667480782601,
      "learning_rate": 2.0828250547258763e-05,
      "loss": 1.0412,
      "num_input_tokens_seen": 49281467456,
      "step": 62638
    },
    {
      "epoch": 6.645342669212815,
      "grad_norm": 0.8656763920208789,
      "learning_rate": 2.0827565324270854e-05,
      "loss": 0.9791,
      "num_input_tokens_seen": 49282254208,
      "step": 62639
    },
    {
      "epoch": 6.645448758752387,
      "grad_norm": 0.6586505430902357,
      "learning_rate": 2.0826880104507278e-05,
      "loss": 1.0822,
      "num_input_tokens_seen": 49283040896,
      "step": 62640
    },
    {
      "epoch": 6.645554848291958,
      "grad_norm": 0.78683966970601,
      "learning_rate": 2.0826194887968566e-05,
      "loss": 1.0098,
      "num_input_tokens_seen": 49283827648,
      "step": 62641
    },
    {
      "epoch": 6.64566093783153,
      "grad_norm": 0.6364622946329389,
      "learning_rate": 2.082550967465525e-05,
      "loss": 1.0447,
      "num_input_tokens_seen": 49284614416,
      "step": 62642
    },
    {
      "epoch": 6.645767027371101,
      "grad_norm": 0.7170306137100252,
      "learning_rate": 2.0824824464567858e-05,
      "loss": 0.9954,
      "num_input_tokens_seen": 49285401200,
      "step": 62643
    },
    {
      "epoch": 6.645873116910673,
      "grad_norm": 0.6579145257083722,
      "learning_rate": 2.082413925770692e-05,
      "loss": 0.9389,
      "num_input_tokens_seen": 49286187936,
      "step": 62644
    },
    {
      "epoch": 6.645979206450244,
      "grad_norm": 0.8311839646918108,
      "learning_rate": 2.0823454054072966e-05,
      "loss": 0.9896,
      "num_input_tokens_seen": 49286974624,
      "step": 62645
    },
    {
      "epoch": 6.646085295989815,
      "grad_norm": 0.751360839713149,
      "learning_rate": 2.082276885366652e-05,
      "loss": 1.0073,
      "num_input_tokens_seen": 49287761344,
      "step": 62646
    },
    {
      "epoch": 6.646191385529387,
      "grad_norm": 0.6499777539376717,
      "learning_rate": 2.0822083656488117e-05,
      "loss": 0.9346,
      "num_input_tokens_seen": 49288548144,
      "step": 62647
    },
    {
      "epoch": 6.646297475068958,
      "grad_norm": 0.7119667680857333,
      "learning_rate": 2.0821398462538277e-05,
      "loss": 1.04,
      "num_input_tokens_seen": 49289334992,
      "step": 62648
    },
    {
      "epoch": 6.64640356460853,
      "grad_norm": 0.772591396565482,
      "learning_rate": 2.082071327181755e-05,
      "loss": 1.0321,
      "num_input_tokens_seen": 49290121776,
      "step": 62649
    },
    {
      "epoch": 6.646509654148101,
      "grad_norm": 1.1016448366230402,
      "learning_rate": 2.0820028084326443e-05,
      "loss": 0.9666,
      "num_input_tokens_seen": 49290908528,
      "step": 62650
    },
    {
      "epoch": 6.646615743687672,
      "grad_norm": 0.7393863613246238,
      "learning_rate": 2.0819342900065505e-05,
      "loss": 0.9957,
      "num_input_tokens_seen": 49291695328,
      "step": 62651
    },
    {
      "epoch": 6.646721833227244,
      "grad_norm": 0.8177041550031655,
      "learning_rate": 2.081865771903525e-05,
      "loss": 1.0157,
      "num_input_tokens_seen": 49292482112,
      "step": 62652
    },
    {
      "epoch": 6.646827922766815,
      "grad_norm": 0.8872362349164002,
      "learning_rate": 2.0817972541236218e-05,
      "loss": 0.985,
      "num_input_tokens_seen": 49293268784,
      "step": 62653
    },
    {
      "epoch": 6.646934012306387,
      "grad_norm": 0.7936075859789002,
      "learning_rate": 2.0817287366668937e-05,
      "loss": 1.035,
      "num_input_tokens_seen": 49294055568,
      "step": 62654
    },
    {
      "epoch": 6.647040101845958,
      "grad_norm": 0.8487560611440392,
      "learning_rate": 2.0816602195333924e-05,
      "loss": 0.9938,
      "num_input_tokens_seen": 49294842352,
      "step": 62655
    },
    {
      "epoch": 6.647146191385529,
      "grad_norm": 0.8053795673610129,
      "learning_rate": 2.0815917027231725e-05,
      "loss": 0.9782,
      "num_input_tokens_seen": 49295629200,
      "step": 62656
    },
    {
      "epoch": 6.647252280925101,
      "grad_norm": 0.7965372616191547,
      "learning_rate": 2.0815231862362863e-05,
      "loss": 0.9895,
      "num_input_tokens_seen": 49296415936,
      "step": 62657
    },
    {
      "epoch": 6.647358370464672,
      "grad_norm": 0.876427017906951,
      "learning_rate": 2.081454670072786e-05,
      "loss": 1.0249,
      "num_input_tokens_seen": 49297202752,
      "step": 62658
    },
    {
      "epoch": 6.647464460004244,
      "grad_norm": 0.748841842772499,
      "learning_rate": 2.0813861542327262e-05,
      "loss": 1.04,
      "num_input_tokens_seen": 49297989488,
      "step": 62659
    },
    {
      "epoch": 6.647570549543815,
      "grad_norm": 0.6496605033762363,
      "learning_rate": 2.0813176387161586e-05,
      "loss": 0.9959,
      "num_input_tokens_seen": 49298776304,
      "step": 62660
    },
    {
      "epoch": 6.647676639083386,
      "grad_norm": 0.7957956631829347,
      "learning_rate": 2.081249123523136e-05,
      "loss": 1.1034,
      "num_input_tokens_seen": 49299562960,
      "step": 62661
    },
    {
      "epoch": 6.647782728622958,
      "grad_norm": 0.7446937336694641,
      "learning_rate": 2.0811806086537124e-05,
      "loss": 0.9705,
      "num_input_tokens_seen": 49300349696,
      "step": 62662
    },
    {
      "epoch": 6.647888818162529,
      "grad_norm": 0.8722154833426119,
      "learning_rate": 2.0811120941079398e-05,
      "loss": 1.0763,
      "num_input_tokens_seen": 49301136544,
      "step": 62663
    },
    {
      "epoch": 6.647994907702101,
      "grad_norm": 0.7731444708977718,
      "learning_rate": 2.0810435798858713e-05,
      "loss": 1.0523,
      "num_input_tokens_seen": 49301923344,
      "step": 62664
    },
    {
      "epoch": 6.648100997241672,
      "grad_norm": 0.8025059294222524,
      "learning_rate": 2.0809750659875605e-05,
      "loss": 0.953,
      "num_input_tokens_seen": 49302710080,
      "step": 62665
    },
    {
      "epoch": 6.648207086781244,
      "grad_norm": 0.9564539027860283,
      "learning_rate": 2.0809065524130596e-05,
      "loss": 1.0129,
      "num_input_tokens_seen": 49303496928,
      "step": 62666
    },
    {
      "epoch": 6.648313176320815,
      "grad_norm": 0.66994569003463,
      "learning_rate": 2.0808380391624217e-05,
      "loss": 1.0257,
      "num_input_tokens_seen": 49304283792,
      "step": 62667
    },
    {
      "epoch": 6.648419265860386,
      "grad_norm": 0.8838286303026933,
      "learning_rate": 2.0807695262357e-05,
      "loss": 1.0708,
      "num_input_tokens_seen": 49305070480,
      "step": 62668
    },
    {
      "epoch": 6.648525355399958,
      "grad_norm": 0.854500643437788,
      "learning_rate": 2.0807010136329468e-05,
      "loss": 1.0119,
      "num_input_tokens_seen": 49305857280,
      "step": 62669
    },
    {
      "epoch": 6.648631444939529,
      "grad_norm": 0.6467140768117092,
      "learning_rate": 2.0806325013542166e-05,
      "loss": 1.0391,
      "num_input_tokens_seen": 49306644064,
      "step": 62670
    },
    {
      "epoch": 6.648737534479101,
      "grad_norm": 0.823890764722265,
      "learning_rate": 2.080563989399561e-05,
      "loss": 0.9695,
      "num_input_tokens_seen": 49307430720,
      "step": 62671
    },
    {
      "epoch": 6.648843624018672,
      "grad_norm": 0.9137344765014334,
      "learning_rate": 2.0804954777690326e-05,
      "loss": 1.0839,
      "num_input_tokens_seen": 49308217456,
      "step": 62672
    },
    {
      "epoch": 6.648949713558244,
      "grad_norm": 0.7111095595360879,
      "learning_rate": 2.0804269664626854e-05,
      "loss": 1.0008,
      "num_input_tokens_seen": 49309004208,
      "step": 62673
    },
    {
      "epoch": 6.649055803097815,
      "grad_norm": 0.7365340357510637,
      "learning_rate": 2.080358455480572e-05,
      "loss": 0.9444,
      "num_input_tokens_seen": 49309791024,
      "step": 62674
    },
    {
      "epoch": 6.649161892637386,
      "grad_norm": 0.6627878630579718,
      "learning_rate": 2.080289944822745e-05,
      "loss": 1.0276,
      "num_input_tokens_seen": 49310577824,
      "step": 62675
    },
    {
      "epoch": 6.649267982176958,
      "grad_norm": 0.7449294885481716,
      "learning_rate": 2.080221434489258e-05,
      "loss": 1.0337,
      "num_input_tokens_seen": 49311364608,
      "step": 62676
    },
    {
      "epoch": 6.649374071716529,
      "grad_norm": 0.7528245021597963,
      "learning_rate": 2.0801529244801636e-05,
      "loss": 1.0025,
      "num_input_tokens_seen": 49312151392,
      "step": 62677
    },
    {
      "epoch": 6.6494801612561005,
      "grad_norm": 0.6902806173992825,
      "learning_rate": 2.080084414795514e-05,
      "loss": 1.0136,
      "num_input_tokens_seen": 49312938176,
      "step": 62678
    },
    {
      "epoch": 6.649586250795672,
      "grad_norm": 0.6197444434953135,
      "learning_rate": 2.0800159054353636e-05,
      "loss": 0.9188,
      "num_input_tokens_seen": 49313724960,
      "step": 62679
    },
    {
      "epoch": 6.649692340335243,
      "grad_norm": 0.7169910051079468,
      "learning_rate": 2.0799473963997646e-05,
      "loss": 0.9517,
      "num_input_tokens_seen": 49314511760,
      "step": 62680
    },
    {
      "epoch": 6.6497984298748145,
      "grad_norm": 0.8246787540689455,
      "learning_rate": 2.0798788876887693e-05,
      "loss": 0.9573,
      "num_input_tokens_seen": 49315298544,
      "step": 62681
    },
    {
      "epoch": 6.6499045194143855,
      "grad_norm": 0.9389812600298655,
      "learning_rate": 2.0798103793024315e-05,
      "loss": 1.0309,
      "num_input_tokens_seen": 49316085360,
      "step": 62682
    },
    {
      "epoch": 6.6500106089539575,
      "grad_norm": 0.6797575017582103,
      "learning_rate": 2.0797418712408042e-05,
      "loss": 0.9613,
      "num_input_tokens_seen": 49316872112,
      "step": 62683
    },
    {
      "epoch": 6.6501166984935285,
      "grad_norm": 0.6603284949640306,
      "learning_rate": 2.0796733635039395e-05,
      "loss": 1.0438,
      "num_input_tokens_seen": 49317658864,
      "step": 62684
    },
    {
      "epoch": 6.6502227880330995,
      "grad_norm": 0.6802199387271455,
      "learning_rate": 2.0796048560918916e-05,
      "loss": 1.0821,
      "num_input_tokens_seen": 49318445536,
      "step": 62685
    },
    {
      "epoch": 6.650328877572671,
      "grad_norm": 0.6395731290749702,
      "learning_rate": 2.079536349004712e-05,
      "loss": 0.9881,
      "num_input_tokens_seen": 49319232304,
      "step": 62686
    },
    {
      "epoch": 6.6504349671122425,
      "grad_norm": 0.699185099604081,
      "learning_rate": 2.079467842242455e-05,
      "loss": 0.9444,
      "num_input_tokens_seen": 49320019056,
      "step": 62687
    },
    {
      "epoch": 6.650541056651814,
      "grad_norm": 0.6769650774010968,
      "learning_rate": 2.079399335805173e-05,
      "loss": 0.9224,
      "num_input_tokens_seen": 49320805920,
      "step": 62688
    },
    {
      "epoch": 6.650647146191385,
      "grad_norm": 0.7330298929616462,
      "learning_rate": 2.079330829692918e-05,
      "loss": 1.0189,
      "num_input_tokens_seen": 49321592768,
      "step": 62689
    },
    {
      "epoch": 6.6507532357309564,
      "grad_norm": 0.6365194071434729,
      "learning_rate": 2.0792623239057442e-05,
      "loss": 1.049,
      "num_input_tokens_seen": 49322379504,
      "step": 62690
    },
    {
      "epoch": 6.650859325270528,
      "grad_norm": 0.7669873505517126,
      "learning_rate": 2.0791938184437047e-05,
      "loss": 0.9893,
      "num_input_tokens_seen": 49323166192,
      "step": 62691
    },
    {
      "epoch": 6.650965414810099,
      "grad_norm": 0.7162915472016951,
      "learning_rate": 2.079125313306851e-05,
      "loss": 0.9883,
      "num_input_tokens_seen": 49323952928,
      "step": 62692
    },
    {
      "epoch": 6.651071504349671,
      "grad_norm": 0.996769606004847,
      "learning_rate": 2.0790568084952376e-05,
      "loss": 1.053,
      "num_input_tokens_seen": 49324739616,
      "step": 62693
    },
    {
      "epoch": 6.651177593889242,
      "grad_norm": 0.898516082039165,
      "learning_rate": 2.0789883040089164e-05,
      "loss": 0.9849,
      "num_input_tokens_seen": 49325526320,
      "step": 62694
    },
    {
      "epoch": 6.651283683428814,
      "grad_norm": 0.9041315557276671,
      "learning_rate": 2.0789197998479405e-05,
      "loss": 1.0031,
      "num_input_tokens_seen": 49326313072,
      "step": 62695
    },
    {
      "epoch": 6.651389772968385,
      "grad_norm": 0.7712490581324198,
      "learning_rate": 2.0788512960123635e-05,
      "loss": 1.0661,
      "num_input_tokens_seen": 49327099776,
      "step": 62696
    },
    {
      "epoch": 6.651495862507957,
      "grad_norm": 0.6705358502021312,
      "learning_rate": 2.078782792502238e-05,
      "loss": 0.9863,
      "num_input_tokens_seen": 49327886576,
      "step": 62697
    },
    {
      "epoch": 6.651601952047528,
      "grad_norm": 0.9011747979084656,
      "learning_rate": 2.078714289317616e-05,
      "loss": 1.0074,
      "num_input_tokens_seen": 49328673328,
      "step": 62698
    },
    {
      "epoch": 6.651708041587099,
      "grad_norm": 0.6982961941307841,
      "learning_rate": 2.0786457864585517e-05,
      "loss": 0.9622,
      "num_input_tokens_seen": 49329460112,
      "step": 62699
    },
    {
      "epoch": 6.651814131126671,
      "grad_norm": 0.6996202181977411,
      "learning_rate": 2.0785772839250978e-05,
      "loss": 1.0227,
      "num_input_tokens_seen": 49330246976,
      "step": 62700
    },
    {
      "epoch": 6.651920220666242,
      "grad_norm": 0.8757319891462172,
      "learning_rate": 2.0785087817173067e-05,
      "loss": 1.0255,
      "num_input_tokens_seen": 49331033744,
      "step": 62701
    },
    {
      "epoch": 6.652026310205814,
      "grad_norm": 0.818728077414122,
      "learning_rate": 2.0784402798352316e-05,
      "loss": 1.1058,
      "num_input_tokens_seen": 49331820416,
      "step": 62702
    },
    {
      "epoch": 6.652132399745385,
      "grad_norm": 0.758466964263315,
      "learning_rate": 2.078371778278925e-05,
      "loss": 1.0688,
      "num_input_tokens_seen": 49332607136,
      "step": 62703
    },
    {
      "epoch": 6.652238489284956,
      "grad_norm": 0.6752111219622371,
      "learning_rate": 2.0783032770484413e-05,
      "loss": 0.8515,
      "num_input_tokens_seen": 49333393952,
      "step": 62704
    },
    {
      "epoch": 6.652344578824528,
      "grad_norm": 0.7846313811810952,
      "learning_rate": 2.0782347761438324e-05,
      "loss": 0.9702,
      "num_input_tokens_seen": 49334180800,
      "step": 62705
    },
    {
      "epoch": 6.652450668364099,
      "grad_norm": 0.7651634330211464,
      "learning_rate": 2.0781662755651503e-05,
      "loss": 1.0054,
      "num_input_tokens_seen": 49334967680,
      "step": 62706
    },
    {
      "epoch": 6.652556757903671,
      "grad_norm": 0.8613682849773104,
      "learning_rate": 2.07809777531245e-05,
      "loss": 1.0435,
      "num_input_tokens_seen": 49335754432,
      "step": 62707
    },
    {
      "epoch": 6.652662847443242,
      "grad_norm": 0.802023362716226,
      "learning_rate": 2.078029275385783e-05,
      "loss": 0.9345,
      "num_input_tokens_seen": 49336541312,
      "step": 62708
    },
    {
      "epoch": 6.652768936982813,
      "grad_norm": 0.7490015832982182,
      "learning_rate": 2.0779607757852022e-05,
      "loss": 1.0114,
      "num_input_tokens_seen": 49337328064,
      "step": 62709
    },
    {
      "epoch": 6.652875026522385,
      "grad_norm": 0.7936861035315036,
      "learning_rate": 2.0778922765107614e-05,
      "loss": 1.0087,
      "num_input_tokens_seen": 49338114768,
      "step": 62710
    },
    {
      "epoch": 6.652981116061956,
      "grad_norm": 0.7025161311202247,
      "learning_rate": 2.077823777562513e-05,
      "loss": 1.0675,
      "num_input_tokens_seen": 49338901536,
      "step": 62711
    },
    {
      "epoch": 6.653087205601528,
      "grad_norm": 0.6798110022769662,
      "learning_rate": 2.0777552789405096e-05,
      "loss": 1.0408,
      "num_input_tokens_seen": 49339688256,
      "step": 62712
    },
    {
      "epoch": 6.653193295141099,
      "grad_norm": 0.7759048109988501,
      "learning_rate": 2.077686780644805e-05,
      "loss": 1.031,
      "num_input_tokens_seen": 49340474928,
      "step": 62713
    },
    {
      "epoch": 6.65329938468067,
      "grad_norm": 0.7010723402916881,
      "learning_rate": 2.0776182826754518e-05,
      "loss": 1.0354,
      "num_input_tokens_seen": 49341261696,
      "step": 62714
    },
    {
      "epoch": 6.653405474220242,
      "grad_norm": 0.7300884333346664,
      "learning_rate": 2.0775497850325022e-05,
      "loss": 1.0342,
      "num_input_tokens_seen": 49342048512,
      "step": 62715
    },
    {
      "epoch": 6.653511563759813,
      "grad_norm": 0.7898222876589553,
      "learning_rate": 2.0774812877160103e-05,
      "loss": 0.9774,
      "num_input_tokens_seen": 49342835280,
      "step": 62716
    },
    {
      "epoch": 6.653617653299385,
      "grad_norm": 0.6120833478948572,
      "learning_rate": 2.077412790726028e-05,
      "loss": 0.9652,
      "num_input_tokens_seen": 49343622032,
      "step": 62717
    },
    {
      "epoch": 6.653723742838956,
      "grad_norm": 0.6841260037445981,
      "learning_rate": 2.0773442940626088e-05,
      "loss": 0.982,
      "num_input_tokens_seen": 49344408816,
      "step": 62718
    },
    {
      "epoch": 6.653829832378527,
      "grad_norm": 0.7049557433762601,
      "learning_rate": 2.077275797725806e-05,
      "loss": 1.0052,
      "num_input_tokens_seen": 49345195552,
      "step": 62719
    },
    {
      "epoch": 6.653935921918099,
      "grad_norm": 0.7899581689622138,
      "learning_rate": 2.0772073017156713e-05,
      "loss": 1.0933,
      "num_input_tokens_seen": 49345982304,
      "step": 62720
    },
    {
      "epoch": 6.65404201145767,
      "grad_norm": 0.7165482018294693,
      "learning_rate": 2.077138806032259e-05,
      "loss": 1.0106,
      "num_input_tokens_seen": 49346769056,
      "step": 62721
    },
    {
      "epoch": 6.654148100997242,
      "grad_norm": 0.6926449465844151,
      "learning_rate": 2.0770703106756213e-05,
      "loss": 1.0104,
      "num_input_tokens_seen": 49347555760,
      "step": 62722
    },
    {
      "epoch": 6.654254190536813,
      "grad_norm": 0.8441201564910739,
      "learning_rate": 2.0770018156458107e-05,
      "loss": 1.049,
      "num_input_tokens_seen": 49348342544,
      "step": 62723
    },
    {
      "epoch": 6.654360280076385,
      "grad_norm": 0.9089389262287099,
      "learning_rate": 2.0769333209428813e-05,
      "loss": 0.9989,
      "num_input_tokens_seen": 49349129296,
      "step": 62724
    },
    {
      "epoch": 6.654466369615956,
      "grad_norm": 0.8155785891916935,
      "learning_rate": 2.0768648265668856e-05,
      "loss": 0.9969,
      "num_input_tokens_seen": 49349916080,
      "step": 62725
    },
    {
      "epoch": 6.654572459155528,
      "grad_norm": 0.7596663934940378,
      "learning_rate": 2.0767963325178754e-05,
      "loss": 1.0214,
      "num_input_tokens_seen": 49350702832,
      "step": 62726
    },
    {
      "epoch": 6.654678548695099,
      "grad_norm": 0.6280258805089278,
      "learning_rate": 2.0767278387959054e-05,
      "loss": 0.9425,
      "num_input_tokens_seen": 49351489632,
      "step": 62727
    },
    {
      "epoch": 6.65478463823467,
      "grad_norm": 0.6704376871863402,
      "learning_rate": 2.0766593454010276e-05,
      "loss": 0.9266,
      "num_input_tokens_seen": 49352276400,
      "step": 62728
    },
    {
      "epoch": 6.654890727774242,
      "grad_norm": 0.7513660477606969,
      "learning_rate": 2.0765908523332946e-05,
      "loss": 0.9429,
      "num_input_tokens_seen": 49353063216,
      "step": 62729
    },
    {
      "epoch": 6.654996817313813,
      "grad_norm": 0.7971304701206325,
      "learning_rate": 2.0765223595927603e-05,
      "loss": 1.103,
      "num_input_tokens_seen": 49353849968,
      "step": 62730
    },
    {
      "epoch": 6.655102906853385,
      "grad_norm": 0.8178955214873967,
      "learning_rate": 2.076453867179477e-05,
      "loss": 1.1464,
      "num_input_tokens_seen": 49354636640,
      "step": 62731
    },
    {
      "epoch": 6.655208996392956,
      "grad_norm": 0.6849519805438334,
      "learning_rate": 2.0763853750934977e-05,
      "loss": 0.9761,
      "num_input_tokens_seen": 49355423392,
      "step": 62732
    },
    {
      "epoch": 6.655315085932527,
      "grad_norm": 0.672707863670352,
      "learning_rate": 2.076316883334875e-05,
      "loss": 0.928,
      "num_input_tokens_seen": 49356210272,
      "step": 62733
    },
    {
      "epoch": 6.655421175472099,
      "grad_norm": 0.685277469953288,
      "learning_rate": 2.076248391903662e-05,
      "loss": 1.0714,
      "num_input_tokens_seen": 49356997024,
      "step": 62734
    },
    {
      "epoch": 6.65552726501167,
      "grad_norm": 0.622995421496863,
      "learning_rate": 2.0761799007999127e-05,
      "loss": 0.9392,
      "num_input_tokens_seen": 49357783824,
      "step": 62735
    },
    {
      "epoch": 6.655633354551242,
      "grad_norm": 0.6205057560932666,
      "learning_rate": 2.076111410023679e-05,
      "loss": 0.9153,
      "num_input_tokens_seen": 49358570576,
      "step": 62736
    },
    {
      "epoch": 6.655739444090813,
      "grad_norm": 0.7037078929851893,
      "learning_rate": 2.0760429195750132e-05,
      "loss": 1.0237,
      "num_input_tokens_seen": 49359357504,
      "step": 62737
    },
    {
      "epoch": 6.655845533630384,
      "grad_norm": 0.6748603906560782,
      "learning_rate": 2.0759744294539696e-05,
      "loss": 0.9714,
      "num_input_tokens_seen": 49360144224,
      "step": 62738
    },
    {
      "epoch": 6.655951623169956,
      "grad_norm": 0.8298058349029355,
      "learning_rate": 2.0759059396606003e-05,
      "loss": 1.0817,
      "num_input_tokens_seen": 49360930928,
      "step": 62739
    },
    {
      "epoch": 6.656057712709527,
      "grad_norm": 0.7427696091867102,
      "learning_rate": 2.0758374501949583e-05,
      "loss": 1.0254,
      "num_input_tokens_seen": 49361717632,
      "step": 62740
    },
    {
      "epoch": 6.6561638022490985,
      "grad_norm": 0.810445939209163,
      "learning_rate": 2.075768961057097e-05,
      "loss": 0.9933,
      "num_input_tokens_seen": 49362504432,
      "step": 62741
    },
    {
      "epoch": 6.65626989178867,
      "grad_norm": 0.630049386731198,
      "learning_rate": 2.075700472247069e-05,
      "loss": 0.9319,
      "num_input_tokens_seen": 49363291280,
      "step": 62742
    },
    {
      "epoch": 6.656375981328241,
      "grad_norm": 0.767719925760655,
      "learning_rate": 2.0756319837649264e-05,
      "loss": 0.9851,
      "num_input_tokens_seen": 49364078112,
      "step": 62743
    },
    {
      "epoch": 6.6564820708678125,
      "grad_norm": 0.6949842601285071,
      "learning_rate": 2.0755634956107235e-05,
      "loss": 1.0173,
      "num_input_tokens_seen": 49364864880,
      "step": 62744
    },
    {
      "epoch": 6.6565881604073835,
      "grad_norm": 0.788239432888298,
      "learning_rate": 2.0754950077845127e-05,
      "loss": 0.9911,
      "num_input_tokens_seen": 49365651648,
      "step": 62745
    },
    {
      "epoch": 6.6566942499469555,
      "grad_norm": 0.6671263665413427,
      "learning_rate": 2.0754265202863472e-05,
      "loss": 1.0252,
      "num_input_tokens_seen": 49366438512,
      "step": 62746
    },
    {
      "epoch": 6.6568003394865265,
      "grad_norm": 0.7303339626564881,
      "learning_rate": 2.0753580331162794e-05,
      "loss": 1.0422,
      "num_input_tokens_seen": 49367225408,
      "step": 62747
    },
    {
      "epoch": 6.656906429026098,
      "grad_norm": 0.7278781451222377,
      "learning_rate": 2.0752895462743625e-05,
      "loss": 1.005,
      "num_input_tokens_seen": 49368012128,
      "step": 62748
    },
    {
      "epoch": 6.6570125185656694,
      "grad_norm": 0.7903128523733642,
      "learning_rate": 2.0752210597606493e-05,
      "loss": 1.0335,
      "num_input_tokens_seen": 49368798896,
      "step": 62749
    },
    {
      "epoch": 6.6571186081052405,
      "grad_norm": 0.8114812038641354,
      "learning_rate": 2.0751525735751928e-05,
      "loss": 0.9833,
      "num_input_tokens_seen": 49369585600,
      "step": 62750
    },
    {
      "epoch": 6.657224697644812,
      "grad_norm": 0.6531962487056859,
      "learning_rate": 2.075084087718046e-05,
      "loss": 0.9368,
      "num_input_tokens_seen": 49370372352,
      "step": 62751
    },
    {
      "epoch": 6.657330787184383,
      "grad_norm": 0.8092150127129171,
      "learning_rate": 2.0750156021892623e-05,
      "loss": 0.9759,
      "num_input_tokens_seen": 49371159088,
      "step": 62752
    },
    {
      "epoch": 6.657436876723955,
      "grad_norm": 0.597779298186153,
      "learning_rate": 2.074947116988893e-05,
      "loss": 0.9784,
      "num_input_tokens_seen": 49371945888,
      "step": 62753
    },
    {
      "epoch": 6.657542966263526,
      "grad_norm": 0.7637087570981164,
      "learning_rate": 2.074878632116993e-05,
      "loss": 0.9397,
      "num_input_tokens_seen": 49372732624,
      "step": 62754
    },
    {
      "epoch": 6.657649055803098,
      "grad_norm": 0.6534079119147886,
      "learning_rate": 2.0748101475736134e-05,
      "loss": 1.0103,
      "num_input_tokens_seen": 49373519296,
      "step": 62755
    },
    {
      "epoch": 6.657755145342669,
      "grad_norm": 0.8486656642943216,
      "learning_rate": 2.0747416633588086e-05,
      "loss": 0.9917,
      "num_input_tokens_seen": 49374306144,
      "step": 62756
    },
    {
      "epoch": 6.65786123488224,
      "grad_norm": 0.7531324432081747,
      "learning_rate": 2.0746731794726315e-05,
      "loss": 0.9906,
      "num_input_tokens_seen": 49375092896,
      "step": 62757
    },
    {
      "epoch": 6.657967324421812,
      "grad_norm": 0.6638708784620359,
      "learning_rate": 2.0746046959151334e-05,
      "loss": 1.0215,
      "num_input_tokens_seen": 49375879712,
      "step": 62758
    },
    {
      "epoch": 6.658073413961383,
      "grad_norm": 0.8997410732218253,
      "learning_rate": 2.074536212686369e-05,
      "loss": 1.0281,
      "num_input_tokens_seen": 49376666528,
      "step": 62759
    },
    {
      "epoch": 6.658179503500955,
      "grad_norm": 0.8088888786837501,
      "learning_rate": 2.0744677297863908e-05,
      "loss": 1.0336,
      "num_input_tokens_seen": 49377453152,
      "step": 62760
    },
    {
      "epoch": 6.658285593040526,
      "grad_norm": 0.8391774089566045,
      "learning_rate": 2.0743992472152507e-05,
      "loss": 1.115,
      "num_input_tokens_seen": 49378239904,
      "step": 62761
    },
    {
      "epoch": 6.658391682580097,
      "grad_norm": 0.6831829447410736,
      "learning_rate": 2.074330764973003e-05,
      "loss": 1.0191,
      "num_input_tokens_seen": 49379026624,
      "step": 62762
    },
    {
      "epoch": 6.658497772119669,
      "grad_norm": 0.6176689810176224,
      "learning_rate": 2.0742622830597e-05,
      "loss": 0.9779,
      "num_input_tokens_seen": 49379813408,
      "step": 62763
    },
    {
      "epoch": 6.65860386165924,
      "grad_norm": 0.7797689367380577,
      "learning_rate": 2.0741938014753938e-05,
      "loss": 1.016,
      "num_input_tokens_seen": 49380600176,
      "step": 62764
    },
    {
      "epoch": 6.658709951198812,
      "grad_norm": 0.6650114108672569,
      "learning_rate": 2.074125320220139e-05,
      "loss": 0.9834,
      "num_input_tokens_seen": 49381386960,
      "step": 62765
    },
    {
      "epoch": 6.658816040738383,
      "grad_norm": 0.7908900680017663,
      "learning_rate": 2.074056839293987e-05,
      "loss": 1.0744,
      "num_input_tokens_seen": 49382173680,
      "step": 62766
    },
    {
      "epoch": 6.658922130277954,
      "grad_norm": 0.680002777297101,
      "learning_rate": 2.0739883586969917e-05,
      "loss": 0.9257,
      "num_input_tokens_seen": 49382960384,
      "step": 62767
    },
    {
      "epoch": 6.659028219817526,
      "grad_norm": 0.961090853484773,
      "learning_rate": 2.073919878429206e-05,
      "loss": 1.0494,
      "num_input_tokens_seen": 49383747120,
      "step": 62768
    },
    {
      "epoch": 6.659134309357097,
      "grad_norm": 0.7588184834609975,
      "learning_rate": 2.073851398490682e-05,
      "loss": 1.0337,
      "num_input_tokens_seen": 49384533872,
      "step": 62769
    },
    {
      "epoch": 6.659240398896669,
      "grad_norm": 0.8167619480177445,
      "learning_rate": 2.073782918881473e-05,
      "loss": 0.9756,
      "num_input_tokens_seen": 49385320640,
      "step": 62770
    },
    {
      "epoch": 6.65934648843624,
      "grad_norm": 0.8417282869302735,
      "learning_rate": 2.0737144396016328e-05,
      "loss": 1.0309,
      "num_input_tokens_seen": 49386107296,
      "step": 62771
    },
    {
      "epoch": 6.659452577975811,
      "grad_norm": 0.7477383941383049,
      "learning_rate": 2.0736459606512126e-05,
      "loss": 1.1094,
      "num_input_tokens_seen": 49386894000,
      "step": 62772
    },
    {
      "epoch": 6.659558667515383,
      "grad_norm": 0.788721172335838,
      "learning_rate": 2.0735774820302672e-05,
      "loss": 1.0308,
      "num_input_tokens_seen": 49387680768,
      "step": 62773
    },
    {
      "epoch": 6.659664757054954,
      "grad_norm": 1.0676100021269002,
      "learning_rate": 2.073509003738848e-05,
      "loss": 1.0374,
      "num_input_tokens_seen": 49388467536,
      "step": 62774
    },
    {
      "epoch": 6.659770846594526,
      "grad_norm": 0.8143291746725179,
      "learning_rate": 2.073440525777009e-05,
      "loss": 1.0061,
      "num_input_tokens_seen": 49389254240,
      "step": 62775
    },
    {
      "epoch": 6.659876936134097,
      "grad_norm": 0.7845331424104727,
      "learning_rate": 2.0733720481448024e-05,
      "loss": 0.9516,
      "num_input_tokens_seen": 49390040992,
      "step": 62776
    },
    {
      "epoch": 6.659983025673669,
      "grad_norm": 0.8954450645134489,
      "learning_rate": 2.0733035708422814e-05,
      "loss": 1.0168,
      "num_input_tokens_seen": 49390827728,
      "step": 62777
    },
    {
      "epoch": 6.66008911521324,
      "grad_norm": 0.9548602599048889,
      "learning_rate": 2.073235093869499e-05,
      "loss": 0.9595,
      "num_input_tokens_seen": 49391614576,
      "step": 62778
    },
    {
      "epoch": 6.660195204752811,
      "grad_norm": 1.0536637524132777,
      "learning_rate": 2.073166617226508e-05,
      "loss": 1.0043,
      "num_input_tokens_seen": 49392401264,
      "step": 62779
    },
    {
      "epoch": 6.660301294292383,
      "grad_norm": 0.8949831132834959,
      "learning_rate": 2.0730981409133614e-05,
      "loss": 1.0067,
      "num_input_tokens_seen": 49393187984,
      "step": 62780
    },
    {
      "epoch": 6.660407383831954,
      "grad_norm": 0.9371931109723287,
      "learning_rate": 2.0730296649301115e-05,
      "loss": 1.0323,
      "num_input_tokens_seen": 49393974816,
      "step": 62781
    },
    {
      "epoch": 6.660513473371526,
      "grad_norm": 0.8884183914565851,
      "learning_rate": 2.072961189276812e-05,
      "loss": 1.0259,
      "num_input_tokens_seen": 49394761504,
      "step": 62782
    },
    {
      "epoch": 6.660619562911097,
      "grad_norm": 0.9281214365894649,
      "learning_rate": 2.072892713953516e-05,
      "loss": 1.0305,
      "num_input_tokens_seen": 49395548240,
      "step": 62783
    },
    {
      "epoch": 6.660725652450669,
      "grad_norm": 1.0208582790944392,
      "learning_rate": 2.0728242389602752e-05,
      "loss": 0.9593,
      "num_input_tokens_seen": 49396335072,
      "step": 62784
    },
    {
      "epoch": 6.66083174199024,
      "grad_norm": 0.7867400376508877,
      "learning_rate": 2.072755764297144e-05,
      "loss": 0.9678,
      "num_input_tokens_seen": 49397121920,
      "step": 62785
    },
    {
      "epoch": 6.660937831529811,
      "grad_norm": 0.8186340034055992,
      "learning_rate": 2.0726872899641743e-05,
      "loss": 1.0234,
      "num_input_tokens_seen": 49397908704,
      "step": 62786
    },
    {
      "epoch": 6.661043921069383,
      "grad_norm": 0.8947961807789735,
      "learning_rate": 2.072618815961419e-05,
      "loss": 1.0548,
      "num_input_tokens_seen": 49398695488,
      "step": 62787
    },
    {
      "epoch": 6.661150010608954,
      "grad_norm": 0.9677251460439651,
      "learning_rate": 2.072550342288932e-05,
      "loss": 0.9176,
      "num_input_tokens_seen": 49399482288,
      "step": 62788
    },
    {
      "epoch": 6.661256100148526,
      "grad_norm": 0.8669066814149026,
      "learning_rate": 2.072481868946765e-05,
      "loss": 0.9728,
      "num_input_tokens_seen": 49400269040,
      "step": 62789
    },
    {
      "epoch": 6.661362189688097,
      "grad_norm": 1.0170912712228237,
      "learning_rate": 2.0724133959349717e-05,
      "loss": 1.041,
      "num_input_tokens_seen": 49401055824,
      "step": 62790
    },
    {
      "epoch": 6.661468279227668,
      "grad_norm": 0.7802890803654934,
      "learning_rate": 2.0723449232536053e-05,
      "loss": 1.0352,
      "num_input_tokens_seen": 49401842640,
      "step": 62791
    },
    {
      "epoch": 6.66157436876724,
      "grad_norm": 0.7809181158761133,
      "learning_rate": 2.072276450902717e-05,
      "loss": 1.0044,
      "num_input_tokens_seen": 49402629360,
      "step": 62792
    },
    {
      "epoch": 6.661680458306811,
      "grad_norm": 0.7752072234688606,
      "learning_rate": 2.072207978882362e-05,
      "loss": 0.9386,
      "num_input_tokens_seen": 49403416144,
      "step": 62793
    },
    {
      "epoch": 6.661786547846383,
      "grad_norm": 0.6607501715361984,
      "learning_rate": 2.0721395071925915e-05,
      "loss": 1.1097,
      "num_input_tokens_seen": 49404202928,
      "step": 62794
    },
    {
      "epoch": 6.661892637385954,
      "grad_norm": 0.7954952753265272,
      "learning_rate": 2.0720710358334592e-05,
      "loss": 0.9721,
      "num_input_tokens_seen": 49404989680,
      "step": 62795
    },
    {
      "epoch": 6.661998726925525,
      "grad_norm": 0.810803255138763,
      "learning_rate": 2.0720025648050183e-05,
      "loss": 0.9762,
      "num_input_tokens_seen": 49405776368,
      "step": 62796
    },
    {
      "epoch": 6.662104816465097,
      "grad_norm": 0.8223178063125184,
      "learning_rate": 2.0719340941073208e-05,
      "loss": 0.9708,
      "num_input_tokens_seen": 49406563120,
      "step": 62797
    },
    {
      "epoch": 6.662210906004668,
      "grad_norm": 0.7792504409612442,
      "learning_rate": 2.07186562374042e-05,
      "loss": 1.0339,
      "num_input_tokens_seen": 49407349936,
      "step": 62798
    },
    {
      "epoch": 6.66231699554424,
      "grad_norm": 0.8437777272111001,
      "learning_rate": 2.071797153704369e-05,
      "loss": 1.0112,
      "num_input_tokens_seen": 49408136608,
      "step": 62799
    },
    {
      "epoch": 6.662423085083811,
      "grad_norm": 0.7427128468652746,
      "learning_rate": 2.0717286839992207e-05,
      "loss": 1.138,
      "num_input_tokens_seen": 49408923312,
      "step": 62800
    },
    {
      "epoch": 6.662529174623382,
      "grad_norm": 0.83745161794218,
      "learning_rate": 2.0716602146250274e-05,
      "loss": 0.9337,
      "num_input_tokens_seen": 49409710176,
      "step": 62801
    },
    {
      "epoch": 6.662635264162954,
      "grad_norm": 0.8695339476443118,
      "learning_rate": 2.071591745581843e-05,
      "loss": 1.0356,
      "num_input_tokens_seen": 49410496896,
      "step": 62802
    },
    {
      "epoch": 6.662741353702525,
      "grad_norm": 0.764620760210399,
      "learning_rate": 2.07152327686972e-05,
      "loss": 1.0442,
      "num_input_tokens_seen": 49411283648,
      "step": 62803
    },
    {
      "epoch": 6.6628474432420965,
      "grad_norm": 0.9184173366722006,
      "learning_rate": 2.071454808488711e-05,
      "loss": 0.9968,
      "num_input_tokens_seen": 49412070384,
      "step": 62804
    },
    {
      "epoch": 6.662953532781668,
      "grad_norm": 0.6991075342323261,
      "learning_rate": 2.0713863404388695e-05,
      "loss": 1.0132,
      "num_input_tokens_seen": 49412857168,
      "step": 62805
    },
    {
      "epoch": 6.6630596223212395,
      "grad_norm": 0.8750799710612562,
      "learning_rate": 2.0713178727202475e-05,
      "loss": 0.9466,
      "num_input_tokens_seen": 49413643920,
      "step": 62806
    },
    {
      "epoch": 6.6631657118608105,
      "grad_norm": 0.7647169899342123,
      "learning_rate": 2.071249405332899e-05,
      "loss": 0.9803,
      "num_input_tokens_seen": 49414430704,
      "step": 62807
    },
    {
      "epoch": 6.6632718014003816,
      "grad_norm": 0.6867242249396787,
      "learning_rate": 2.0711809382768763e-05,
      "loss": 0.8657,
      "num_input_tokens_seen": 49415217568,
      "step": 62808
    },
    {
      "epoch": 6.6633778909399535,
      "grad_norm": 1.0000197123645844,
      "learning_rate": 2.071112471552232e-05,
      "loss": 0.967,
      "num_input_tokens_seen": 49416004288,
      "step": 62809
    },
    {
      "epoch": 6.6634839804795245,
      "grad_norm": 0.7424823296020918,
      "learning_rate": 2.0710440051590195e-05,
      "loss": 0.9842,
      "num_input_tokens_seen": 49416790976,
      "step": 62810
    },
    {
      "epoch": 6.663590070019096,
      "grad_norm": 0.936187214196547,
      "learning_rate": 2.0709755390972922e-05,
      "loss": 0.9849,
      "num_input_tokens_seen": 49417577744,
      "step": 62811
    },
    {
      "epoch": 6.6636961595586675,
      "grad_norm": 0.7203880922969575,
      "learning_rate": 2.0709070733671017e-05,
      "loss": 1.0337,
      "num_input_tokens_seen": 49418364496,
      "step": 62812
    },
    {
      "epoch": 6.663802249098239,
      "grad_norm": 0.7985066017730873,
      "learning_rate": 2.070838607968502e-05,
      "loss": 0.934,
      "num_input_tokens_seen": 49419151264,
      "step": 62813
    },
    {
      "epoch": 6.66390833863781,
      "grad_norm": 0.7832941683359949,
      "learning_rate": 2.0707701429015457e-05,
      "loss": 0.9893,
      "num_input_tokens_seen": 49419938096,
      "step": 62814
    },
    {
      "epoch": 6.664014428177381,
      "grad_norm": 0.822897913204186,
      "learning_rate": 2.0707016781662848e-05,
      "loss": 1.0083,
      "num_input_tokens_seen": 49420724848,
      "step": 62815
    },
    {
      "epoch": 6.664120517716953,
      "grad_norm": 0.8342741142906707,
      "learning_rate": 2.070633213762774e-05,
      "loss": 1.0266,
      "num_input_tokens_seen": 49421511584,
      "step": 62816
    },
    {
      "epoch": 6.664226607256524,
      "grad_norm": 0.7601247845350372,
      "learning_rate": 2.070564749691065e-05,
      "loss": 0.9855,
      "num_input_tokens_seen": 49422298400,
      "step": 62817
    },
    {
      "epoch": 6.664332696796096,
      "grad_norm": 0.7745245485684874,
      "learning_rate": 2.070496285951211e-05,
      "loss": 0.9423,
      "num_input_tokens_seen": 49423085168,
      "step": 62818
    },
    {
      "epoch": 6.664438786335667,
      "grad_norm": 0.9207672505873239,
      "learning_rate": 2.070427822543265e-05,
      "loss": 1.0249,
      "num_input_tokens_seen": 49423871968,
      "step": 62819
    },
    {
      "epoch": 6.664544875875238,
      "grad_norm": 0.6809838169008073,
      "learning_rate": 2.070359359467279e-05,
      "loss": 0.9952,
      "num_input_tokens_seen": 49424658784,
      "step": 62820
    },
    {
      "epoch": 6.66465096541481,
      "grad_norm": 0.9149481599709228,
      "learning_rate": 2.0702908967233075e-05,
      "loss": 1.0541,
      "num_input_tokens_seen": 49425445472,
      "step": 62821
    },
    {
      "epoch": 6.664757054954381,
      "grad_norm": 0.817836939276287,
      "learning_rate": 2.0702224343114025e-05,
      "loss": 0.9827,
      "num_input_tokens_seen": 49426232256,
      "step": 62822
    },
    {
      "epoch": 6.664863144493953,
      "grad_norm": 0.7103326588076698,
      "learning_rate": 2.0701539722316167e-05,
      "loss": 1.0312,
      "num_input_tokens_seen": 49427019056,
      "step": 62823
    },
    {
      "epoch": 6.664969234033524,
      "grad_norm": 1.061730889165483,
      "learning_rate": 2.0700855104840033e-05,
      "loss": 1.0492,
      "num_input_tokens_seen": 49427805840,
      "step": 62824
    },
    {
      "epoch": 6.665075323573095,
      "grad_norm": 0.7268155989707513,
      "learning_rate": 2.0700170490686156e-05,
      "loss": 1.096,
      "num_input_tokens_seen": 49428592608,
      "step": 62825
    },
    {
      "epoch": 6.665181413112667,
      "grad_norm": 0.8046146044154233,
      "learning_rate": 2.0699485879855053e-05,
      "loss": 1.0238,
      "num_input_tokens_seen": 49429379360,
      "step": 62826
    },
    {
      "epoch": 6.665287502652238,
      "grad_norm": 0.9974376844655116,
      "learning_rate": 2.0698801272347268e-05,
      "loss": 1.0604,
      "num_input_tokens_seen": 49430166112,
      "step": 62827
    },
    {
      "epoch": 6.66539359219181,
      "grad_norm": 0.7577583946643172,
      "learning_rate": 2.0698116668163324e-05,
      "loss": 1.0409,
      "num_input_tokens_seen": 49430952832,
      "step": 62828
    },
    {
      "epoch": 6.665499681731381,
      "grad_norm": 0.8873530757626834,
      "learning_rate": 2.0697432067303747e-05,
      "loss": 0.9573,
      "num_input_tokens_seen": 49431739536,
      "step": 62829
    },
    {
      "epoch": 6.665605771270952,
      "grad_norm": 0.7421169133270187,
      "learning_rate": 2.0696747469769067e-05,
      "loss": 0.9382,
      "num_input_tokens_seen": 49432526304,
      "step": 62830
    },
    {
      "epoch": 6.665711860810524,
      "grad_norm": 0.9578384506163825,
      "learning_rate": 2.0696062875559817e-05,
      "loss": 1.0219,
      "num_input_tokens_seen": 49433313040,
      "step": 62831
    },
    {
      "epoch": 6.665817950350095,
      "grad_norm": 0.8895956757438335,
      "learning_rate": 2.069537828467652e-05,
      "loss": 1.0368,
      "num_input_tokens_seen": 49434099840,
      "step": 62832
    },
    {
      "epoch": 6.665924039889667,
      "grad_norm": 0.8987252361486793,
      "learning_rate": 2.069469369711971e-05,
      "loss": 0.912,
      "num_input_tokens_seen": 49434886624,
      "step": 62833
    },
    {
      "epoch": 6.666030129429238,
      "grad_norm": 0.8381753199158868,
      "learning_rate": 2.069400911288992e-05,
      "loss": 1.0088,
      "num_input_tokens_seen": 49435673376,
      "step": 62834
    },
    {
      "epoch": 6.66613621896881,
      "grad_norm": 0.7278051389263676,
      "learning_rate": 2.069332453198766e-05,
      "loss": 0.9316,
      "num_input_tokens_seen": 49436460224,
      "step": 62835
    },
    {
      "epoch": 6.666242308508381,
      "grad_norm": 1.0292667970751543,
      "learning_rate": 2.0692639954413485e-05,
      "loss": 1.0604,
      "num_input_tokens_seen": 49437247040,
      "step": 62836
    },
    {
      "epoch": 6.666348398047952,
      "grad_norm": 0.8223783130156191,
      "learning_rate": 2.06919553801679e-05,
      "loss": 0.9953,
      "num_input_tokens_seen": 49438033824,
      "step": 62837
    },
    {
      "epoch": 6.666454487587524,
      "grad_norm": 0.8937567155646315,
      "learning_rate": 2.069127080925145e-05,
      "loss": 1.0764,
      "num_input_tokens_seen": 49438820528,
      "step": 62838
    },
    {
      "epoch": 6.666560577127095,
      "grad_norm": 0.6721756957680562,
      "learning_rate": 2.069058624166466e-05,
      "loss": 0.9959,
      "num_input_tokens_seen": 49439607296,
      "step": 62839
    },
    {
      "epoch": 6.666666666666667,
      "grad_norm": 0.7829686836245457,
      "learning_rate": 2.068990167740806e-05,
      "loss": 1.0619,
      "num_input_tokens_seen": 49440394096,
      "step": 62840
    },
    {
      "epoch": 6.666772756206238,
      "grad_norm": 0.7586074985091555,
      "learning_rate": 2.0689217116482173e-05,
      "loss": 0.9522,
      "num_input_tokens_seen": 49441180912,
      "step": 62841
    },
    {
      "epoch": 6.66687884574581,
      "grad_norm": 0.7271472754732232,
      "learning_rate": 2.0688532558887542e-05,
      "loss": 0.983,
      "num_input_tokens_seen": 49441967728,
      "step": 62842
    },
    {
      "epoch": 6.666984935285381,
      "grad_norm": 1.0144065738156032,
      "learning_rate": 2.068784800462468e-05,
      "loss": 1.0486,
      "num_input_tokens_seen": 49442754464,
      "step": 62843
    },
    {
      "epoch": 6.667091024824952,
      "grad_norm": 0.8837695050827766,
      "learning_rate": 2.0687163453694126e-05,
      "loss": 1.0864,
      "num_input_tokens_seen": 49443541152,
      "step": 62844
    },
    {
      "epoch": 6.667197114364524,
      "grad_norm": 0.8128002419829328,
      "learning_rate": 2.06864789060964e-05,
      "loss": 1.0735,
      "num_input_tokens_seen": 49444327920,
      "step": 62845
    },
    {
      "epoch": 6.667303203904095,
      "grad_norm": 1.1590992121254002,
      "learning_rate": 2.0685794361832046e-05,
      "loss": 1.0382,
      "num_input_tokens_seen": 49445114624,
      "step": 62846
    },
    {
      "epoch": 6.667409293443667,
      "grad_norm": 0.6788044737825716,
      "learning_rate": 2.0685109820901575e-05,
      "loss": 0.9714,
      "num_input_tokens_seen": 49445901408,
      "step": 62847
    },
    {
      "epoch": 6.667515382983238,
      "grad_norm": 0.8374369140476094,
      "learning_rate": 2.0684425283305527e-05,
      "loss": 0.9908,
      "num_input_tokens_seen": 49446688208,
      "step": 62848
    },
    {
      "epoch": 6.667621472522809,
      "grad_norm": 0.9048436723095562,
      "learning_rate": 2.0683740749044435e-05,
      "loss": 0.9756,
      "num_input_tokens_seen": 49447475040,
      "step": 62849
    },
    {
      "epoch": 6.667727562062381,
      "grad_norm": 0.7206574178049554,
      "learning_rate": 2.068305621811881e-05,
      "loss": 0.9824,
      "num_input_tokens_seen": 49448261824,
      "step": 62850
    },
    {
      "epoch": 6.667833651601952,
      "grad_norm": 0.7814397616751898,
      "learning_rate": 2.0682371690529198e-05,
      "loss": 1.0891,
      "num_input_tokens_seen": 49449048512,
      "step": 62851
    },
    {
      "epoch": 6.667939741141524,
      "grad_norm": 0.8556911898578937,
      "learning_rate": 2.0681687166276125e-05,
      "loss": 0.9895,
      "num_input_tokens_seen": 49449835232,
      "step": 62852
    },
    {
      "epoch": 6.668045830681095,
      "grad_norm": 0.8321052269137256,
      "learning_rate": 2.068100264536011e-05,
      "loss": 1.0872,
      "num_input_tokens_seen": 49450621952,
      "step": 62853
    },
    {
      "epoch": 6.668151920220666,
      "grad_norm": 0.7948026124180005,
      "learning_rate": 2.0680318127781698e-05,
      "loss": 0.9794,
      "num_input_tokens_seen": 49451408768,
      "step": 62854
    },
    {
      "epoch": 6.668258009760238,
      "grad_norm": 0.7617129386754143,
      "learning_rate": 2.0679633613541408e-05,
      "loss": 0.9273,
      "num_input_tokens_seen": 49452195616,
      "step": 62855
    },
    {
      "epoch": 6.668364099299809,
      "grad_norm": 0.7737310490432814,
      "learning_rate": 2.0678949102639763e-05,
      "loss": 1.013,
      "num_input_tokens_seen": 49452982368,
      "step": 62856
    },
    {
      "epoch": 6.668470188839381,
      "grad_norm": 0.9725363297094759,
      "learning_rate": 2.0678264595077308e-05,
      "loss": 1.0804,
      "num_input_tokens_seen": 49453769104,
      "step": 62857
    },
    {
      "epoch": 6.668576278378952,
      "grad_norm": 0.7354614628628416,
      "learning_rate": 2.0677580090854555e-05,
      "loss": 0.9842,
      "num_input_tokens_seen": 49454555840,
      "step": 62858
    },
    {
      "epoch": 6.668682367918523,
      "grad_norm": 0.8145076089724707,
      "learning_rate": 2.067689558997205e-05,
      "loss": 0.9214,
      "num_input_tokens_seen": 49455342544,
      "step": 62859
    },
    {
      "epoch": 6.668788457458095,
      "grad_norm": 0.8565248469701507,
      "learning_rate": 2.067621109243031e-05,
      "loss": 1.0914,
      "num_input_tokens_seen": 49456129232,
      "step": 62860
    },
    {
      "epoch": 6.668894546997666,
      "grad_norm": 0.8248613422852565,
      "learning_rate": 2.067552659822986e-05,
      "loss": 0.9653,
      "num_input_tokens_seen": 49456916016,
      "step": 62861
    },
    {
      "epoch": 6.669000636537238,
      "grad_norm": 0.810000283310768,
      "learning_rate": 2.0674842107371247e-05,
      "loss": 0.9026,
      "num_input_tokens_seen": 49457702768,
      "step": 62862
    },
    {
      "epoch": 6.669106726076809,
      "grad_norm": 0.8401810096518317,
      "learning_rate": 2.0674157619854986e-05,
      "loss": 1.0227,
      "num_input_tokens_seen": 49458489520,
      "step": 62863
    },
    {
      "epoch": 6.669212815616381,
      "grad_norm": 0.8165780377752115,
      "learning_rate": 2.0673473135681604e-05,
      "loss": 1.0286,
      "num_input_tokens_seen": 49459276272,
      "step": 62864
    },
    {
      "epoch": 6.669318905155952,
      "grad_norm": 0.746267424381653,
      "learning_rate": 2.067278865485164e-05,
      "loss": 0.9503,
      "num_input_tokens_seen": 49460063136,
      "step": 62865
    },
    {
      "epoch": 6.669424994695523,
      "grad_norm": 1.125383407380868,
      "learning_rate": 2.067210417736562e-05,
      "loss": 1.054,
      "num_input_tokens_seen": 49460849872,
      "step": 62866
    },
    {
      "epoch": 6.6695310842350946,
      "grad_norm": 0.7902508061631331,
      "learning_rate": 2.0671419703224065e-05,
      "loss": 1.032,
      "num_input_tokens_seen": 49461636656,
      "step": 62867
    },
    {
      "epoch": 6.669637173774666,
      "grad_norm": 0.8864780907316079,
      "learning_rate": 2.0670735232427512e-05,
      "loss": 1.0266,
      "num_input_tokens_seen": 49462423504,
      "step": 62868
    },
    {
      "epoch": 6.6697432633142375,
      "grad_norm": 0.7543585614168614,
      "learning_rate": 2.0670050764976492e-05,
      "loss": 1.0748,
      "num_input_tokens_seen": 49463210272,
      "step": 62869
    },
    {
      "epoch": 6.6698493528538085,
      "grad_norm": 0.6704689189668006,
      "learning_rate": 2.0669366300871523e-05,
      "loss": 0.9788,
      "num_input_tokens_seen": 49463997136,
      "step": 62870
    },
    {
      "epoch": 6.6699554423933805,
      "grad_norm": 1.114561646651536,
      "learning_rate": 2.0668681840113148e-05,
      "loss": 1.0442,
      "num_input_tokens_seen": 49464783856,
      "step": 62871
    },
    {
      "epoch": 6.6700615319329515,
      "grad_norm": 0.6442586612113437,
      "learning_rate": 2.0667997382701884e-05,
      "loss": 0.9809,
      "num_input_tokens_seen": 49465570624,
      "step": 62872
    },
    {
      "epoch": 6.6701676214725225,
      "grad_norm": 0.7199137759449162,
      "learning_rate": 2.066731292863826e-05,
      "loss": 1.0047,
      "num_input_tokens_seen": 49466357408,
      "step": 62873
    },
    {
      "epoch": 6.670273711012094,
      "grad_norm": 0.8454626567911694,
      "learning_rate": 2.0666628477922816e-05,
      "loss": 1.0981,
      "num_input_tokens_seen": 49467144160,
      "step": 62874
    },
    {
      "epoch": 6.6703798005516655,
      "grad_norm": 0.8495185528340161,
      "learning_rate": 2.0665944030556068e-05,
      "loss": 1.0976,
      "num_input_tokens_seen": 49467930912,
      "step": 62875
    },
    {
      "epoch": 6.670485890091237,
      "grad_norm": 0.8464157344227231,
      "learning_rate": 2.066525958653856e-05,
      "loss": 0.9892,
      "num_input_tokens_seen": 49468717616,
      "step": 62876
    },
    {
      "epoch": 6.670591979630808,
      "grad_norm": 0.9008558613400276,
      "learning_rate": 2.066457514587081e-05,
      "loss": 1.0928,
      "num_input_tokens_seen": 49469504432,
      "step": 62877
    },
    {
      "epoch": 6.670698069170379,
      "grad_norm": 0.7175260960109385,
      "learning_rate": 2.0663890708553343e-05,
      "loss": 1.0217,
      "num_input_tokens_seen": 49470291168,
      "step": 62878
    },
    {
      "epoch": 6.670804158709951,
      "grad_norm": 0.7204896402321094,
      "learning_rate": 2.06632062745867e-05,
      "loss": 1.1089,
      "num_input_tokens_seen": 49471077968,
      "step": 62879
    },
    {
      "epoch": 6.670910248249522,
      "grad_norm": 0.7054305290563304,
      "learning_rate": 2.0662521843971406e-05,
      "loss": 0.8951,
      "num_input_tokens_seen": 49471864880,
      "step": 62880
    },
    {
      "epoch": 6.671016337789094,
      "grad_norm": 1.0200734092843924,
      "learning_rate": 2.066183741670798e-05,
      "loss": 0.9679,
      "num_input_tokens_seen": 49472651664,
      "step": 62881
    },
    {
      "epoch": 6.671122427328665,
      "grad_norm": 0.7776142267308271,
      "learning_rate": 2.066115299279696e-05,
      "loss": 0.9532,
      "num_input_tokens_seen": 49473438432,
      "step": 62882
    },
    {
      "epoch": 6.671228516868236,
      "grad_norm": 0.7349522821766931,
      "learning_rate": 2.066046857223888e-05,
      "loss": 1.0149,
      "num_input_tokens_seen": 49474225184,
      "step": 62883
    },
    {
      "epoch": 6.671334606407808,
      "grad_norm": 0.6829096270246126,
      "learning_rate": 2.0659784155034258e-05,
      "loss": 1.0541,
      "num_input_tokens_seen": 49475011808,
      "step": 62884
    },
    {
      "epoch": 6.671440695947379,
      "grad_norm": 0.7327204793867527,
      "learning_rate": 2.0659099741183628e-05,
      "loss": 1.0043,
      "num_input_tokens_seen": 49475798608,
      "step": 62885
    },
    {
      "epoch": 6.671546785486951,
      "grad_norm": 0.6754058749898509,
      "learning_rate": 2.0658415330687524e-05,
      "loss": 0.9585,
      "num_input_tokens_seen": 49476585392,
      "step": 62886
    },
    {
      "epoch": 6.671652875026522,
      "grad_norm": 0.8223264616653492,
      "learning_rate": 2.065773092354646e-05,
      "loss": 0.9785,
      "num_input_tokens_seen": 49477372176,
      "step": 62887
    },
    {
      "epoch": 6.671758964566093,
      "grad_norm": 0.6940768479105156,
      "learning_rate": 2.0657046519760977e-05,
      "loss": 0.9591,
      "num_input_tokens_seen": 49478158832,
      "step": 62888
    },
    {
      "epoch": 6.671865054105665,
      "grad_norm": 0.7318610604486008,
      "learning_rate": 2.0656362119331608e-05,
      "loss": 0.9538,
      "num_input_tokens_seen": 49478945616,
      "step": 62889
    },
    {
      "epoch": 6.671971143645236,
      "grad_norm": 0.7398525426777993,
      "learning_rate": 2.065567772225886e-05,
      "loss": 0.9945,
      "num_input_tokens_seen": 49479732400,
      "step": 62890
    },
    {
      "epoch": 6.672077233184808,
      "grad_norm": 0.8408277634832257,
      "learning_rate": 2.065499332854329e-05,
      "loss": 0.9836,
      "num_input_tokens_seen": 49480519232,
      "step": 62891
    },
    {
      "epoch": 6.672183322724379,
      "grad_norm": 0.6854033024771716,
      "learning_rate": 2.0654308938185407e-05,
      "loss": 0.9843,
      "num_input_tokens_seen": 49481306064,
      "step": 62892
    },
    {
      "epoch": 6.672289412263951,
      "grad_norm": 0.7683848592496528,
      "learning_rate": 2.0653624551185752e-05,
      "loss": 1.0327,
      "num_input_tokens_seen": 49482092784,
      "step": 62893
    },
    {
      "epoch": 6.672395501803522,
      "grad_norm": 0.6334998561492556,
      "learning_rate": 2.0652940167544844e-05,
      "loss": 0.9159,
      "num_input_tokens_seen": 49482879616,
      "step": 62894
    },
    {
      "epoch": 6.672501591343094,
      "grad_norm": 0.6854401847057108,
      "learning_rate": 2.0652255787263218e-05,
      "loss": 0.9602,
      "num_input_tokens_seen": 49483666400,
      "step": 62895
    },
    {
      "epoch": 6.672607680882665,
      "grad_norm": 0.9032411090283498,
      "learning_rate": 2.0651571410341403e-05,
      "loss": 0.9968,
      "num_input_tokens_seen": 49484453216,
      "step": 62896
    },
    {
      "epoch": 6.672713770422236,
      "grad_norm": 0.710158248392889,
      "learning_rate": 2.0650887036779926e-05,
      "loss": 1.0071,
      "num_input_tokens_seen": 49485239936,
      "step": 62897
    },
    {
      "epoch": 6.672819859961808,
      "grad_norm": 0.9316051314598307,
      "learning_rate": 2.065020266657931e-05,
      "loss": 0.9809,
      "num_input_tokens_seen": 49486026720,
      "step": 62898
    },
    {
      "epoch": 6.672925949501379,
      "grad_norm": 0.9334581263100042,
      "learning_rate": 2.0649518299740097e-05,
      "loss": 1.0145,
      "num_input_tokens_seen": 49486813536,
      "step": 62899
    },
    {
      "epoch": 6.673032039040951,
      "grad_norm": 1.0231343868115041,
      "learning_rate": 2.0648833936262805e-05,
      "loss": 0.9958,
      "num_input_tokens_seen": 49487600352,
      "step": 62900
    },
    {
      "epoch": 6.673138128580522,
      "grad_norm": 0.9101682706966198,
      "learning_rate": 2.0648149576147962e-05,
      "loss": 0.9697,
      "num_input_tokens_seen": 49488387088,
      "step": 62901
    },
    {
      "epoch": 6.673244218120093,
      "grad_norm": 0.7909883103724897,
      "learning_rate": 2.064746521939611e-05,
      "loss": 1.0036,
      "num_input_tokens_seen": 49489173792,
      "step": 62902
    },
    {
      "epoch": 6.673350307659665,
      "grad_norm": 1.0013682055731734,
      "learning_rate": 2.0646780866007765e-05,
      "loss": 1.0161,
      "num_input_tokens_seen": 49489960560,
      "step": 62903
    },
    {
      "epoch": 6.673456397199236,
      "grad_norm": 0.8739128932700051,
      "learning_rate": 2.0646096515983457e-05,
      "loss": 1.0309,
      "num_input_tokens_seen": 49490747424,
      "step": 62904
    },
    {
      "epoch": 6.673562486738808,
      "grad_norm": 0.8371540201586916,
      "learning_rate": 2.0645412169323723e-05,
      "loss": 0.9536,
      "num_input_tokens_seen": 49491534208,
      "step": 62905
    },
    {
      "epoch": 6.673668576278379,
      "grad_norm": 0.901921015674642,
      "learning_rate": 2.0644727826029088e-05,
      "loss": 1.0573,
      "num_input_tokens_seen": 49492320928,
      "step": 62906
    },
    {
      "epoch": 6.67377466581795,
      "grad_norm": 0.9050804736485736,
      "learning_rate": 2.064404348610007e-05,
      "loss": 0.9297,
      "num_input_tokens_seen": 49493107648,
      "step": 62907
    },
    {
      "epoch": 6.673880755357522,
      "grad_norm": 0.614672859929726,
      "learning_rate": 2.0643359149537217e-05,
      "loss": 0.9896,
      "num_input_tokens_seen": 49493894336,
      "step": 62908
    },
    {
      "epoch": 6.673986844897093,
      "grad_norm": 0.8274257818351073,
      "learning_rate": 2.064267481634104e-05,
      "loss": 1.0492,
      "num_input_tokens_seen": 49494681136,
      "step": 62909
    },
    {
      "epoch": 6.674092934436665,
      "grad_norm": 0.8461176137665386,
      "learning_rate": 2.0641990486512082e-05,
      "loss": 1.014,
      "num_input_tokens_seen": 49495467904,
      "step": 62910
    },
    {
      "epoch": 6.674199023976236,
      "grad_norm": 1.4485186311743423,
      "learning_rate": 2.0641306160050868e-05,
      "loss": 1.0215,
      "num_input_tokens_seen": 49496254672,
      "step": 62911
    },
    {
      "epoch": 6.674305113515807,
      "grad_norm": 1.101461411203471,
      "learning_rate": 2.0640621836957918e-05,
      "loss": 0.9618,
      "num_input_tokens_seen": 49497041456,
      "step": 62912
    },
    {
      "epoch": 6.674411203055379,
      "grad_norm": 0.8567612877096498,
      "learning_rate": 2.0639937517233774e-05,
      "loss": 1.0379,
      "num_input_tokens_seen": 49497828240,
      "step": 62913
    },
    {
      "epoch": 6.67451729259495,
      "grad_norm": 1.1425567041393783,
      "learning_rate": 2.0639253200878955e-05,
      "loss": 1.0572,
      "num_input_tokens_seen": 49498614912,
      "step": 62914
    },
    {
      "epoch": 6.674623382134522,
      "grad_norm": 1.0885686543086373,
      "learning_rate": 2.063856888789399e-05,
      "loss": 1.023,
      "num_input_tokens_seen": 49499401616,
      "step": 62915
    },
    {
      "epoch": 6.674729471674093,
      "grad_norm": 0.951361383629141,
      "learning_rate": 2.063788457827942e-05,
      "loss": 1.0703,
      "num_input_tokens_seen": 49500188432,
      "step": 62916
    },
    {
      "epoch": 6.674835561213664,
      "grad_norm": 1.0281920428902247,
      "learning_rate": 2.0637200272035757e-05,
      "loss": 0.9766,
      "num_input_tokens_seen": 49500975216,
      "step": 62917
    },
    {
      "epoch": 6.674941650753236,
      "grad_norm": 0.9336398027089007,
      "learning_rate": 2.063651596916354e-05,
      "loss": 0.996,
      "num_input_tokens_seen": 49501761872,
      "step": 62918
    },
    {
      "epoch": 6.675047740292807,
      "grad_norm": 0.9106144143299293,
      "learning_rate": 2.0635831669663297e-05,
      "loss": 1.0691,
      "num_input_tokens_seen": 49502548656,
      "step": 62919
    },
    {
      "epoch": 6.675153829832379,
      "grad_norm": 0.6558350810601248,
      "learning_rate": 2.0635147373535553e-05,
      "loss": 1.0095,
      "num_input_tokens_seen": 49503335472,
      "step": 62920
    },
    {
      "epoch": 6.67525991937195,
      "grad_norm": 1.0515375578643196,
      "learning_rate": 2.063446308078084e-05,
      "loss": 1.0407,
      "num_input_tokens_seen": 49504122224,
      "step": 62921
    },
    {
      "epoch": 6.675366008911522,
      "grad_norm": 0.9485515655843909,
      "learning_rate": 2.0633778791399686e-05,
      "loss": 1.0464,
      "num_input_tokens_seen": 49504909024,
      "step": 62922
    },
    {
      "epoch": 6.675472098451093,
      "grad_norm": 0.8114762358818385,
      "learning_rate": 2.0633094505392614e-05,
      "loss": 1.0387,
      "num_input_tokens_seen": 49505695776,
      "step": 62923
    },
    {
      "epoch": 6.675578187990665,
      "grad_norm": 1.4850706993089977,
      "learning_rate": 2.0632410222760168e-05,
      "loss": 1.0035,
      "num_input_tokens_seen": 49506482560,
      "step": 62924
    },
    {
      "epoch": 6.675684277530236,
      "grad_norm": 0.7771952006487194,
      "learning_rate": 2.0631725943502864e-05,
      "loss": 0.9806,
      "num_input_tokens_seen": 49507269328,
      "step": 62925
    },
    {
      "epoch": 6.675790367069807,
      "grad_norm": 0.8890974352658709,
      "learning_rate": 2.063104166762123e-05,
      "loss": 1.0566,
      "num_input_tokens_seen": 49508056016,
      "step": 62926
    },
    {
      "epoch": 6.675896456609379,
      "grad_norm": 1.0218251822329356,
      "learning_rate": 2.0630357395115802e-05,
      "loss": 1.0021,
      "num_input_tokens_seen": 49508842752,
      "step": 62927
    },
    {
      "epoch": 6.67600254614895,
      "grad_norm": 1.0023714884838288,
      "learning_rate": 2.0629673125987107e-05,
      "loss": 1.1353,
      "num_input_tokens_seen": 49509629520,
      "step": 62928
    },
    {
      "epoch": 6.6761086356885215,
      "grad_norm": 0.8128066109208254,
      "learning_rate": 2.062898886023567e-05,
      "loss": 0.985,
      "num_input_tokens_seen": 49510416288,
      "step": 62929
    },
    {
      "epoch": 6.676214725228093,
      "grad_norm": 0.8872347265391894,
      "learning_rate": 2.0628304597862022e-05,
      "loss": 0.9398,
      "num_input_tokens_seen": 49511202992,
      "step": 62930
    },
    {
      "epoch": 6.676320814767664,
      "grad_norm": 0.6873265612139657,
      "learning_rate": 2.0627620338866695e-05,
      "loss": 0.9754,
      "num_input_tokens_seen": 49511989648,
      "step": 62931
    },
    {
      "epoch": 6.6764269043072355,
      "grad_norm": 0.9665524067173886,
      "learning_rate": 2.062693608325021e-05,
      "loss": 1.0388,
      "num_input_tokens_seen": 49512776464,
      "step": 62932
    },
    {
      "epoch": 6.6765329938468065,
      "grad_norm": 0.7524114338840274,
      "learning_rate": 2.0626251831013103e-05,
      "loss": 0.9331,
      "num_input_tokens_seen": 49513563200,
      "step": 62933
    },
    {
      "epoch": 6.6766390833863785,
      "grad_norm": 1.030104844019478,
      "learning_rate": 2.0625567582155893e-05,
      "loss": 0.9748,
      "num_input_tokens_seen": 49514349984,
      "step": 62934
    },
    {
      "epoch": 6.6767451729259495,
      "grad_norm": 0.808190704954384,
      "learning_rate": 2.0624883336679123e-05,
      "loss": 0.9866,
      "num_input_tokens_seen": 49515136768,
      "step": 62935
    },
    {
      "epoch": 6.6768512624655205,
      "grad_norm": 0.9312102349933447,
      "learning_rate": 2.0624199094583313e-05,
      "loss": 1.0009,
      "num_input_tokens_seen": 49515923536,
      "step": 62936
    },
    {
      "epoch": 6.676957352005092,
      "grad_norm": 1.0753372060655912,
      "learning_rate": 2.0623514855868997e-05,
      "loss": 1.0327,
      "num_input_tokens_seen": 49516710304,
      "step": 62937
    },
    {
      "epoch": 6.6770634415446635,
      "grad_norm": 0.7980788409262324,
      "learning_rate": 2.06228306205367e-05,
      "loss": 1.0053,
      "num_input_tokens_seen": 49517497136,
      "step": 62938
    },
    {
      "epoch": 6.677169531084235,
      "grad_norm": 0.99106540960531,
      "learning_rate": 2.0622146388586945e-05,
      "loss": 0.9513,
      "num_input_tokens_seen": 49518283824,
      "step": 62939
    },
    {
      "epoch": 6.677275620623806,
      "grad_norm": 0.931623478624158,
      "learning_rate": 2.0621462160020274e-05,
      "loss": 0.9939,
      "num_input_tokens_seen": 49519070624,
      "step": 62940
    },
    {
      "epoch": 6.6773817101633774,
      "grad_norm": 0.9300951255934853,
      "learning_rate": 2.062077793483721e-05,
      "loss": 1.098,
      "num_input_tokens_seen": 49519857360,
      "step": 62941
    },
    {
      "epoch": 6.677487799702949,
      "grad_norm": 0.7464360371163583,
      "learning_rate": 2.062009371303827e-05,
      "loss": 1.0183,
      "num_input_tokens_seen": 49520644128,
      "step": 62942
    },
    {
      "epoch": 6.67759388924252,
      "grad_norm": 1.0046753176422714,
      "learning_rate": 2.0619409494624004e-05,
      "loss": 0.9852,
      "num_input_tokens_seen": 49521430928,
      "step": 62943
    },
    {
      "epoch": 6.677699978782092,
      "grad_norm": 0.9567689184494302,
      "learning_rate": 2.061872527959492e-05,
      "loss": 1.0344,
      "num_input_tokens_seen": 49522217792,
      "step": 62944
    },
    {
      "epoch": 6.677806068321663,
      "grad_norm": 0.8582463334313992,
      "learning_rate": 2.0618041067951565e-05,
      "loss": 0.9096,
      "num_input_tokens_seen": 49523004688,
      "step": 62945
    },
    {
      "epoch": 6.677912157861235,
      "grad_norm": 0.9818744239934981,
      "learning_rate": 2.061735685969446e-05,
      "loss": 0.9805,
      "num_input_tokens_seen": 49523791504,
      "step": 62946
    },
    {
      "epoch": 6.678018247400806,
      "grad_norm": 0.7100352314391407,
      "learning_rate": 2.0616672654824128e-05,
      "loss": 0.9339,
      "num_input_tokens_seen": 49524578352,
      "step": 62947
    },
    {
      "epoch": 6.678124336940377,
      "grad_norm": 0.8576677703572384,
      "learning_rate": 2.0615988453341104e-05,
      "loss": 0.9654,
      "num_input_tokens_seen": 49525365152,
      "step": 62948
    },
    {
      "epoch": 6.678230426479949,
      "grad_norm": 0.8216573738832452,
      "learning_rate": 2.0615304255245915e-05,
      "loss": 0.9176,
      "num_input_tokens_seen": 49526151840,
      "step": 62949
    },
    {
      "epoch": 6.67833651601952,
      "grad_norm": 0.7524886811094387,
      "learning_rate": 2.061462006053909e-05,
      "loss": 1.0379,
      "num_input_tokens_seen": 49526938560,
      "step": 62950
    },
    {
      "epoch": 6.678442605559092,
      "grad_norm": 0.8374736932188093,
      "learning_rate": 2.061393586922116e-05,
      "loss": 1.0327,
      "num_input_tokens_seen": 49527725344,
      "step": 62951
    },
    {
      "epoch": 6.678548695098663,
      "grad_norm": 0.7428204165366038,
      "learning_rate": 2.061325168129265e-05,
      "loss": 0.9972,
      "num_input_tokens_seen": 49528512224,
      "step": 62952
    },
    {
      "epoch": 6.678654784638235,
      "grad_norm": 0.819657622321735,
      "learning_rate": 2.0612567496754086e-05,
      "loss": 1.0069,
      "num_input_tokens_seen": 49529299056,
      "step": 62953
    },
    {
      "epoch": 6.678760874177806,
      "grad_norm": 0.7451092749626712,
      "learning_rate": 2.061188331560601e-05,
      "loss": 1.0038,
      "num_input_tokens_seen": 49530085904,
      "step": 62954
    },
    {
      "epoch": 6.678866963717377,
      "grad_norm": 0.8038482236883995,
      "learning_rate": 2.061119913784894e-05,
      "loss": 1.1112,
      "num_input_tokens_seen": 49530872624,
      "step": 62955
    },
    {
      "epoch": 6.678973053256949,
      "grad_norm": 1.1062764604948851,
      "learning_rate": 2.0610514963483403e-05,
      "loss": 1.0608,
      "num_input_tokens_seen": 49531659392,
      "step": 62956
    },
    {
      "epoch": 6.67907914279652,
      "grad_norm": 0.7309254361187668,
      "learning_rate": 2.0609830792509934e-05,
      "loss": 1.0118,
      "num_input_tokens_seen": 49532446064,
      "step": 62957
    },
    {
      "epoch": 6.679185232336092,
      "grad_norm": 0.85203816091783,
      "learning_rate": 2.0609146624929058e-05,
      "loss": 0.9888,
      "num_input_tokens_seen": 49533232752,
      "step": 62958
    },
    {
      "epoch": 6.679291321875663,
      "grad_norm": 0.9051962076228316,
      "learning_rate": 2.0608462460741302e-05,
      "loss": 0.9749,
      "num_input_tokens_seen": 49534019552,
      "step": 62959
    },
    {
      "epoch": 6.679397411415234,
      "grad_norm": 0.8999044026823401,
      "learning_rate": 2.06077782999472e-05,
      "loss": 1.0716,
      "num_input_tokens_seen": 49534806368,
      "step": 62960
    },
    {
      "epoch": 6.679503500954806,
      "grad_norm": 0.9049307652173355,
      "learning_rate": 2.0607094142547275e-05,
      "loss": 0.9633,
      "num_input_tokens_seen": 49535593120,
      "step": 62961
    },
    {
      "epoch": 6.679609590494377,
      "grad_norm": 0.8753859466232211,
      "learning_rate": 2.060640998854206e-05,
      "loss": 1.0561,
      "num_input_tokens_seen": 49536379792,
      "step": 62962
    },
    {
      "epoch": 6.679715680033949,
      "grad_norm": 1.007949647637532,
      "learning_rate": 2.0605725837932086e-05,
      "loss": 1.0309,
      "num_input_tokens_seen": 49537166480,
      "step": 62963
    },
    {
      "epoch": 6.67982176957352,
      "grad_norm": 0.8225641875031006,
      "learning_rate": 2.0605041690717874e-05,
      "loss": 0.9782,
      "num_input_tokens_seen": 49537953296,
      "step": 62964
    },
    {
      "epoch": 6.679927859113091,
      "grad_norm": 0.7730653471219954,
      "learning_rate": 2.060435754689996e-05,
      "loss": 1.0097,
      "num_input_tokens_seen": 49538740112,
      "step": 62965
    },
    {
      "epoch": 6.680033948652663,
      "grad_norm": 0.6736500493402169,
      "learning_rate": 2.0603673406478867e-05,
      "loss": 0.9375,
      "num_input_tokens_seen": 49539526896,
      "step": 62966
    },
    {
      "epoch": 6.680140038192234,
      "grad_norm": 0.887254095016001,
      "learning_rate": 2.0602989269455125e-05,
      "loss": 0.9731,
      "num_input_tokens_seen": 49540313648,
      "step": 62967
    },
    {
      "epoch": 6.680246127731806,
      "grad_norm": 0.8080155781460931,
      "learning_rate": 2.060230513582927e-05,
      "loss": 1.0306,
      "num_input_tokens_seen": 49541100480,
      "step": 62968
    },
    {
      "epoch": 6.680352217271377,
      "grad_norm": 0.8060705076907766,
      "learning_rate": 2.0601621005601822e-05,
      "loss": 1.0053,
      "num_input_tokens_seen": 49541887344,
      "step": 62969
    },
    {
      "epoch": 6.680458306810948,
      "grad_norm": 0.8854920154103847,
      "learning_rate": 2.0600936878773308e-05,
      "loss": 1.026,
      "num_input_tokens_seen": 49542674144,
      "step": 62970
    },
    {
      "epoch": 6.68056439635052,
      "grad_norm": 0.8485857187428868,
      "learning_rate": 2.0600252755344265e-05,
      "loss": 0.9751,
      "num_input_tokens_seen": 49543460960,
      "step": 62971
    },
    {
      "epoch": 6.680670485890091,
      "grad_norm": 0.7645389221784981,
      "learning_rate": 2.059956863531522e-05,
      "loss": 1.0778,
      "num_input_tokens_seen": 49544247744,
      "step": 62972
    },
    {
      "epoch": 6.680776575429663,
      "grad_norm": 0.7838025678328426,
      "learning_rate": 2.059888451868669e-05,
      "loss": 0.9205,
      "num_input_tokens_seen": 49545034496,
      "step": 62973
    },
    {
      "epoch": 6.680882664969234,
      "grad_norm": 0.7399421081374232,
      "learning_rate": 2.0598200405459224e-05,
      "loss": 0.972,
      "num_input_tokens_seen": 49545821408,
      "step": 62974
    },
    {
      "epoch": 6.680988754508806,
      "grad_norm": 0.9364243146322895,
      "learning_rate": 2.0597516295633334e-05,
      "loss": 1.1262,
      "num_input_tokens_seen": 49546608032,
      "step": 62975
    },
    {
      "epoch": 6.681094844048377,
      "grad_norm": 0.667253221531736,
      "learning_rate": 2.059683218920955e-05,
      "loss": 0.922,
      "num_input_tokens_seen": 49547394752,
      "step": 62976
    },
    {
      "epoch": 6.681200933587948,
      "grad_norm": 0.7925848968270671,
      "learning_rate": 2.059614808618841e-05,
      "loss": 1.0497,
      "num_input_tokens_seen": 49548181472,
      "step": 62977
    },
    {
      "epoch": 6.68130702312752,
      "grad_norm": 0.7133134304681923,
      "learning_rate": 2.0595463986570436e-05,
      "loss": 0.9454,
      "num_input_tokens_seen": 49548968288,
      "step": 62978
    },
    {
      "epoch": 6.681413112667091,
      "grad_norm": 0.7458683984923291,
      "learning_rate": 2.059477989035616e-05,
      "loss": 0.9853,
      "num_input_tokens_seen": 49549755072,
      "step": 62979
    },
    {
      "epoch": 6.681519202206663,
      "grad_norm": 0.7128606022790177,
      "learning_rate": 2.059409579754611e-05,
      "loss": 1.0534,
      "num_input_tokens_seen": 49550541776,
      "step": 62980
    },
    {
      "epoch": 6.681625291746234,
      "grad_norm": 0.7305563250531175,
      "learning_rate": 2.059341170814081e-05,
      "loss": 0.9256,
      "num_input_tokens_seen": 49551328512,
      "step": 62981
    },
    {
      "epoch": 6.681731381285806,
      "grad_norm": 0.7611971152158035,
      "learning_rate": 2.059272762214079e-05,
      "loss": 1.0409,
      "num_input_tokens_seen": 49552115264,
      "step": 62982
    },
    {
      "epoch": 6.681837470825377,
      "grad_norm": 0.8304973703296775,
      "learning_rate": 2.059204353954659e-05,
      "loss": 1.0677,
      "num_input_tokens_seen": 49552902080,
      "step": 62983
    },
    {
      "epoch": 6.681943560364948,
      "grad_norm": 0.8926328965724312,
      "learning_rate": 2.059135946035872e-05,
      "loss": 1.0457,
      "num_input_tokens_seen": 49553688864,
      "step": 62984
    },
    {
      "epoch": 6.68204964990452,
      "grad_norm": 0.8896082259016356,
      "learning_rate": 2.0590675384577723e-05,
      "loss": 0.9944,
      "num_input_tokens_seen": 49554475664,
      "step": 62985
    },
    {
      "epoch": 6.682155739444091,
      "grad_norm": 0.842695839388313,
      "learning_rate": 2.0589991312204123e-05,
      "loss": 1.0258,
      "num_input_tokens_seen": 49555262432,
      "step": 62986
    },
    {
      "epoch": 6.682261828983663,
      "grad_norm": 0.8201590228983755,
      "learning_rate": 2.0589307243238442e-05,
      "loss": 1.0633,
      "num_input_tokens_seen": 49556049184,
      "step": 62987
    },
    {
      "epoch": 6.682367918523234,
      "grad_norm": 0.8065849954585652,
      "learning_rate": 2.0588623177681225e-05,
      "loss": 0.9716,
      "num_input_tokens_seen": 49556835888,
      "step": 62988
    },
    {
      "epoch": 6.682474008062805,
      "grad_norm": 0.7866887169719945,
      "learning_rate": 2.0587939115532983e-05,
      "loss": 0.9807,
      "num_input_tokens_seen": 49557622576,
      "step": 62989
    },
    {
      "epoch": 6.682580097602377,
      "grad_norm": 0.8496417862357187,
      "learning_rate": 2.0587255056794252e-05,
      "loss": 1.0214,
      "num_input_tokens_seen": 49558409296,
      "step": 62990
    },
    {
      "epoch": 6.682686187141948,
      "grad_norm": 0.7561415777102817,
      "learning_rate": 2.0586571001465565e-05,
      "loss": 1.0462,
      "num_input_tokens_seen": 49559195968,
      "step": 62991
    },
    {
      "epoch": 6.6827922766815195,
      "grad_norm": 0.895702820557454,
      "learning_rate": 2.0585886949547448e-05,
      "loss": 1.0598,
      "num_input_tokens_seen": 49559982688,
      "step": 62992
    },
    {
      "epoch": 6.682898366221091,
      "grad_norm": 0.7126523191527134,
      "learning_rate": 2.058520290104042e-05,
      "loss": 0.9861,
      "num_input_tokens_seen": 49560769440,
      "step": 62993
    },
    {
      "epoch": 6.683004455760662,
      "grad_norm": 0.7304633822652804,
      "learning_rate": 2.0584518855945027e-05,
      "loss": 1.039,
      "num_input_tokens_seen": 49561556192,
      "step": 62994
    },
    {
      "epoch": 6.6831105453002335,
      "grad_norm": 0.983784730959791,
      "learning_rate": 2.058383481426178e-05,
      "loss": 0.935,
      "num_input_tokens_seen": 49562342960,
      "step": 62995
    },
    {
      "epoch": 6.6832166348398045,
      "grad_norm": 0.8578264143719365,
      "learning_rate": 2.058315077599122e-05,
      "loss": 1.0211,
      "num_input_tokens_seen": 49563129664,
      "step": 62996
    },
    {
      "epoch": 6.6833227243793765,
      "grad_norm": 0.6621983219659713,
      "learning_rate": 2.0582466741133875e-05,
      "loss": 0.9661,
      "num_input_tokens_seen": 49563916544,
      "step": 62997
    },
    {
      "epoch": 6.6834288139189475,
      "grad_norm": 1.160535201036424,
      "learning_rate": 2.0581782709690262e-05,
      "loss": 0.9909,
      "num_input_tokens_seen": 49564703344,
      "step": 62998
    },
    {
      "epoch": 6.6835349034585185,
      "grad_norm": 0.8031075347580953,
      "learning_rate": 2.058109868166092e-05,
      "loss": 0.9291,
      "num_input_tokens_seen": 49565490096,
      "step": 62999
    },
    {
      "epoch": 6.6836409929980904,
      "grad_norm": 0.8903686491245562,
      "learning_rate": 2.0580414657046383e-05,
      "loss": 0.9852,
      "num_input_tokens_seen": 49566276880,
      "step": 63000
    },
    {
      "epoch": 6.6836409929980904,
      "eval_loss": 1.508221983909607,
      "eval_runtime": 65.261,
      "eval_samples_per_second": 45.969,
      "eval_steps_per_second": 0.49,
      "num_input_tokens_seen": 49566276880,
      "step": 63000
    },
    {
      "epoch": 6.6837470825376615,
      "grad_norm": 0.8435860702777452,
      "learning_rate": 2.057973063584716e-05,
      "loss": 1.0354,
      "num_input_tokens_seen": 49567063648,
      "step": 63001
    },
    {
      "epoch": 6.683853172077233,
      "grad_norm": 0.6911190817704718,
      "learning_rate": 2.05790466180638e-05,
      "loss": 0.959,
      "num_input_tokens_seen": 49567850448,
      "step": 63002
    },
    {
      "epoch": 6.683959261616804,
      "grad_norm": 0.7884239085116688,
      "learning_rate": 2.0578362603696823e-05,
      "loss": 1.0334,
      "num_input_tokens_seen": 49568637248,
      "step": 63003
    },
    {
      "epoch": 6.684065351156376,
      "grad_norm": 0.7896307272652522,
      "learning_rate": 2.0577678592746752e-05,
      "loss": 1.0536,
      "num_input_tokens_seen": 49569424112,
      "step": 63004
    },
    {
      "epoch": 6.684171440695947,
      "grad_norm": 0.6822819303032392,
      "learning_rate": 2.0576994585214128e-05,
      "loss": 0.9901,
      "num_input_tokens_seen": 49570210944,
      "step": 63005
    },
    {
      "epoch": 6.684277530235518,
      "grad_norm": 1.3231187136627576,
      "learning_rate": 2.0576310581099468e-05,
      "loss": 1.0123,
      "num_input_tokens_seen": 49570997728,
      "step": 63006
    },
    {
      "epoch": 6.68438361977509,
      "grad_norm": 1.1284164677647088,
      "learning_rate": 2.0575626580403304e-05,
      "loss": 1.0322,
      "num_input_tokens_seen": 49571784464,
      "step": 63007
    },
    {
      "epoch": 6.684489709314661,
      "grad_norm": 1.627840936670903,
      "learning_rate": 2.0574942583126168e-05,
      "loss": 1.0577,
      "num_input_tokens_seen": 49572571248,
      "step": 63008
    },
    {
      "epoch": 6.684595798854233,
      "grad_norm": 0.8244289792402858,
      "learning_rate": 2.0574258589268593e-05,
      "loss": 0.9306,
      "num_input_tokens_seen": 49573358080,
      "step": 63009
    },
    {
      "epoch": 6.684701888393804,
      "grad_norm": 1.0620393367409489,
      "learning_rate": 2.0573574598831092e-05,
      "loss": 1.0884,
      "num_input_tokens_seen": 49574144800,
      "step": 63010
    },
    {
      "epoch": 6.684807977933376,
      "grad_norm": 0.8263455924589624,
      "learning_rate": 2.0572890611814205e-05,
      "loss": 1.1484,
      "num_input_tokens_seen": 49574931584,
      "step": 63011
    },
    {
      "epoch": 6.684914067472947,
      "grad_norm": 1.1926949014898145,
      "learning_rate": 2.0572206628218454e-05,
      "loss": 1.0604,
      "num_input_tokens_seen": 49575718416,
      "step": 63012
    },
    {
      "epoch": 6.685020157012518,
      "grad_norm": 1.124022000224319,
      "learning_rate": 2.057152264804438e-05,
      "loss": 1.0688,
      "num_input_tokens_seen": 49576505168,
      "step": 63013
    },
    {
      "epoch": 6.68512624655209,
      "grad_norm": 0.7888938517450106,
      "learning_rate": 2.0570838671292503e-05,
      "loss": 0.9607,
      "num_input_tokens_seen": 49577291936,
      "step": 63014
    },
    {
      "epoch": 6.685232336091661,
      "grad_norm": 1.1526984480663438,
      "learning_rate": 2.0570154697963344e-05,
      "loss": 1.0158,
      "num_input_tokens_seen": 49578078688,
      "step": 63015
    },
    {
      "epoch": 6.685338425631233,
      "grad_norm": 1.0037415682599855,
      "learning_rate": 2.056947072805745e-05,
      "loss": 0.9438,
      "num_input_tokens_seen": 49578865488,
      "step": 63016
    },
    {
      "epoch": 6.685444515170804,
      "grad_norm": 0.7495417484531651,
      "learning_rate": 2.0568786761575333e-05,
      "loss": 1.0264,
      "num_input_tokens_seen": 49579652208,
      "step": 63017
    },
    {
      "epoch": 6.685550604710375,
      "grad_norm": 1.1227233529742893,
      "learning_rate": 2.0568102798517525e-05,
      "loss": 0.9497,
      "num_input_tokens_seen": 49580438960,
      "step": 63018
    },
    {
      "epoch": 6.685656694249947,
      "grad_norm": 1.1932530219022812,
      "learning_rate": 2.056741883888456e-05,
      "loss": 0.8999,
      "num_input_tokens_seen": 49581225792,
      "step": 63019
    },
    {
      "epoch": 6.685762783789518,
      "grad_norm": 0.8523611344046934,
      "learning_rate": 2.0566734882676968e-05,
      "loss": 0.9588,
      "num_input_tokens_seen": 49582012608,
      "step": 63020
    },
    {
      "epoch": 6.68586887332909,
      "grad_norm": 0.7824328296110264,
      "learning_rate": 2.0566050929895263e-05,
      "loss": 1.0816,
      "num_input_tokens_seen": 49582799312,
      "step": 63021
    },
    {
      "epoch": 6.685974962868661,
      "grad_norm": 0.9489923541616803,
      "learning_rate": 2.0565366980539995e-05,
      "loss": 1.0066,
      "num_input_tokens_seen": 49583586016,
      "step": 63022
    },
    {
      "epoch": 6.686081052408232,
      "grad_norm": 0.9407225144491177,
      "learning_rate": 2.0564683034611677e-05,
      "loss": 1.0656,
      "num_input_tokens_seen": 49584372800,
      "step": 63023
    },
    {
      "epoch": 6.686187141947804,
      "grad_norm": 0.7276329300607906,
      "learning_rate": 2.0563999092110837e-05,
      "loss": 0.9544,
      "num_input_tokens_seen": 49585159728,
      "step": 63024
    },
    {
      "epoch": 6.686293231487375,
      "grad_norm": 1.174991331371088,
      "learning_rate": 2.0563315153038014e-05,
      "loss": 0.968,
      "num_input_tokens_seen": 49585946576,
      "step": 63025
    },
    {
      "epoch": 6.686399321026947,
      "grad_norm": 1.4067409471552181,
      "learning_rate": 2.0562631217393727e-05,
      "loss": 0.9952,
      "num_input_tokens_seen": 49586733280,
      "step": 63026
    },
    {
      "epoch": 6.686505410566518,
      "grad_norm": 0.9225775055924977,
      "learning_rate": 2.0561947285178513e-05,
      "loss": 0.9548,
      "num_input_tokens_seen": 49587520080,
      "step": 63027
    },
    {
      "epoch": 6.686611500106089,
      "grad_norm": 1.3927927230856219,
      "learning_rate": 2.0561263356392895e-05,
      "loss": 0.9819,
      "num_input_tokens_seen": 49588306832,
      "step": 63028
    },
    {
      "epoch": 6.686717589645661,
      "grad_norm": 1.901723322942444,
      "learning_rate": 2.056057943103739e-05,
      "loss": 1.0434,
      "num_input_tokens_seen": 49589093648,
      "step": 63029
    },
    {
      "epoch": 6.686823679185232,
      "grad_norm": 1.5179983216891384,
      "learning_rate": 2.0559895509112554e-05,
      "loss": 1.0271,
      "num_input_tokens_seen": 49589880416,
      "step": 63030
    },
    {
      "epoch": 6.686929768724804,
      "grad_norm": 1.0833058100729271,
      "learning_rate": 2.0559211590618894e-05,
      "loss": 1.015,
      "num_input_tokens_seen": 49590667136,
      "step": 63031
    },
    {
      "epoch": 6.687035858264375,
      "grad_norm": 1.4518765357605916,
      "learning_rate": 2.0558527675556948e-05,
      "loss": 1.0788,
      "num_input_tokens_seen": 49591453968,
      "step": 63032
    },
    {
      "epoch": 6.687141947803947,
      "grad_norm": 1.5384244572495385,
      "learning_rate": 2.0557843763927237e-05,
      "loss": 1.0172,
      "num_input_tokens_seen": 49592240832,
      "step": 63033
    },
    {
      "epoch": 6.687248037343518,
      "grad_norm": 1.6036120919934815,
      "learning_rate": 2.05571598557303e-05,
      "loss": 1.0802,
      "num_input_tokens_seen": 49593027520,
      "step": 63034
    },
    {
      "epoch": 6.687354126883089,
      "grad_norm": 0.8817649001981721,
      "learning_rate": 2.055647595096666e-05,
      "loss": 0.9982,
      "num_input_tokens_seen": 49593814256,
      "step": 63035
    },
    {
      "epoch": 6.687460216422661,
      "grad_norm": 1.1585164116226585,
      "learning_rate": 2.0555792049636838e-05,
      "loss": 0.9544,
      "num_input_tokens_seen": 49594601040,
      "step": 63036
    },
    {
      "epoch": 6.687566305962232,
      "grad_norm": 0.8861511825478517,
      "learning_rate": 2.0555108151741376e-05,
      "loss": 1.0152,
      "num_input_tokens_seen": 49595387824,
      "step": 63037
    },
    {
      "epoch": 6.687672395501804,
      "grad_norm": 1.1637398986614815,
      "learning_rate": 2.0554424257280796e-05,
      "loss": 1.0042,
      "num_input_tokens_seen": 49596174592,
      "step": 63038
    },
    {
      "epoch": 6.687778485041375,
      "grad_norm": 0.992593597957805,
      "learning_rate": 2.055374036625562e-05,
      "loss": 1.0083,
      "num_input_tokens_seen": 49596961296,
      "step": 63039
    },
    {
      "epoch": 6.687884574580947,
      "grad_norm": 1.1480416994113205,
      "learning_rate": 2.055305647866639e-05,
      "loss": 1.0234,
      "num_input_tokens_seen": 49597748112,
      "step": 63040
    },
    {
      "epoch": 6.687990664120518,
      "grad_norm": 1.0444219637450851,
      "learning_rate": 2.055237259451363e-05,
      "loss": 0.9711,
      "num_input_tokens_seen": 49598534928,
      "step": 63041
    },
    {
      "epoch": 6.688096753660089,
      "grad_norm": 1.080254651312986,
      "learning_rate": 2.0551688713797855e-05,
      "loss": 0.9642,
      "num_input_tokens_seen": 49599321632,
      "step": 63042
    },
    {
      "epoch": 6.688202843199661,
      "grad_norm": 1.0799554521311225,
      "learning_rate": 2.055100483651961e-05,
      "loss": 0.9075,
      "num_input_tokens_seen": 49600108432,
      "step": 63043
    },
    {
      "epoch": 6.688308932739232,
      "grad_norm": 0.8973725868829026,
      "learning_rate": 2.055032096267942e-05,
      "loss": 0.9403,
      "num_input_tokens_seen": 49600895200,
      "step": 63044
    },
    {
      "epoch": 6.688415022278804,
      "grad_norm": 0.854678581254899,
      "learning_rate": 2.0549637092277807e-05,
      "loss": 1.0327,
      "num_input_tokens_seen": 49601681936,
      "step": 63045
    },
    {
      "epoch": 6.688521111818375,
      "grad_norm": 0.9879315441777592,
      "learning_rate": 2.0548953225315308e-05,
      "loss": 1.0509,
      "num_input_tokens_seen": 49602468768,
      "step": 63046
    },
    {
      "epoch": 6.688627201357946,
      "grad_norm": 1.2258353060733171,
      "learning_rate": 2.0548269361792444e-05,
      "loss": 0.9742,
      "num_input_tokens_seen": 49603255520,
      "step": 63047
    },
    {
      "epoch": 6.688733290897518,
      "grad_norm": 1.5788688230666739,
      "learning_rate": 2.054758550170975e-05,
      "loss": 1.077,
      "num_input_tokens_seen": 49604042256,
      "step": 63048
    },
    {
      "epoch": 6.688839380437089,
      "grad_norm": 0.8780456326529481,
      "learning_rate": 2.054690164506775e-05,
      "loss": 0.9811,
      "num_input_tokens_seen": 49604828960,
      "step": 63049
    },
    {
      "epoch": 6.688945469976661,
      "grad_norm": 1.3134089571776857,
      "learning_rate": 2.0546217791866972e-05,
      "loss": 1.0119,
      "num_input_tokens_seen": 49605615840,
      "step": 63050
    },
    {
      "epoch": 6.689051559516232,
      "grad_norm": 1.1013972462899377,
      "learning_rate": 2.054553394210795e-05,
      "loss": 0.9131,
      "num_input_tokens_seen": 49606402688,
      "step": 63051
    },
    {
      "epoch": 6.689157649055803,
      "grad_norm": 0.8841573086579491,
      "learning_rate": 2.0544850095791207e-05,
      "loss": 1.0556,
      "num_input_tokens_seen": 49607189456,
      "step": 63052
    },
    {
      "epoch": 6.689263738595375,
      "grad_norm": 0.8485464705096273,
      "learning_rate": 2.0544166252917268e-05,
      "loss": 1.0665,
      "num_input_tokens_seen": 49607976224,
      "step": 63053
    },
    {
      "epoch": 6.689369828134946,
      "grad_norm": 1.0226477167620256,
      "learning_rate": 2.0543482413486677e-05,
      "loss": 1.0901,
      "num_input_tokens_seen": 49608763008,
      "step": 63054
    },
    {
      "epoch": 6.6894759176745175,
      "grad_norm": 0.6873678732627346,
      "learning_rate": 2.0542798577499945e-05,
      "loss": 0.9966,
      "num_input_tokens_seen": 49609549792,
      "step": 63055
    },
    {
      "epoch": 6.689582007214089,
      "grad_norm": 0.7556523649620125,
      "learning_rate": 2.0542114744957606e-05,
      "loss": 0.9507,
      "num_input_tokens_seen": 49610336544,
      "step": 63056
    },
    {
      "epoch": 6.68968809675366,
      "grad_norm": 0.9380777944596407,
      "learning_rate": 2.0541430915860193e-05,
      "loss": 0.9907,
      "num_input_tokens_seen": 49611123328,
      "step": 63057
    },
    {
      "epoch": 6.6897941862932315,
      "grad_norm": 0.6621703103117741,
      "learning_rate": 2.0540747090208233e-05,
      "loss": 0.9417,
      "num_input_tokens_seen": 49611910128,
      "step": 63058
    },
    {
      "epoch": 6.689900275832803,
      "grad_norm": 0.7236291112547925,
      "learning_rate": 2.054006326800225e-05,
      "loss": 0.94,
      "num_input_tokens_seen": 49612696912,
      "step": 63059
    },
    {
      "epoch": 6.6900063653723745,
      "grad_norm": 1.052294355251232,
      "learning_rate": 2.0539379449242776e-05,
      "loss": 0.9652,
      "num_input_tokens_seen": 49613483600,
      "step": 63060
    },
    {
      "epoch": 6.6901124549119455,
      "grad_norm": 0.8172358205012215,
      "learning_rate": 2.053869563393034e-05,
      "loss": 1.0508,
      "num_input_tokens_seen": 49614270368,
      "step": 63061
    },
    {
      "epoch": 6.690218544451517,
      "grad_norm": 0.9415732988591168,
      "learning_rate": 2.0538011822065464e-05,
      "loss": 1.0247,
      "num_input_tokens_seen": 49615057152,
      "step": 63062
    },
    {
      "epoch": 6.6903246339910885,
      "grad_norm": 0.7625166343298502,
      "learning_rate": 2.0537328013648686e-05,
      "loss": 1.0557,
      "num_input_tokens_seen": 49615843920,
      "step": 63063
    },
    {
      "epoch": 6.69043072353066,
      "grad_norm": 0.8435195613702932,
      "learning_rate": 2.053664420868053e-05,
      "loss": 1.009,
      "num_input_tokens_seen": 49616630752,
      "step": 63064
    },
    {
      "epoch": 6.690536813070231,
      "grad_norm": 0.8997469255204799,
      "learning_rate": 2.0535960407161526e-05,
      "loss": 1.0553,
      "num_input_tokens_seen": 49617417456,
      "step": 63065
    },
    {
      "epoch": 6.690642902609802,
      "grad_norm": 0.881201350449215,
      "learning_rate": 2.0535276609092198e-05,
      "loss": 1.0874,
      "num_input_tokens_seen": 49618204224,
      "step": 63066
    },
    {
      "epoch": 6.690748992149374,
      "grad_norm": 0.7015757885998845,
      "learning_rate": 2.0534592814473075e-05,
      "loss": 0.9363,
      "num_input_tokens_seen": 49618991088,
      "step": 63067
    },
    {
      "epoch": 6.690855081688945,
      "grad_norm": 0.9884646184049057,
      "learning_rate": 2.0533909023304693e-05,
      "loss": 1.0085,
      "num_input_tokens_seen": 49619777824,
      "step": 63068
    },
    {
      "epoch": 6.690961171228517,
      "grad_norm": 0.834008616593011,
      "learning_rate": 2.053322523558757e-05,
      "loss": 0.9705,
      "num_input_tokens_seen": 49620564624,
      "step": 63069
    },
    {
      "epoch": 6.691067260768088,
      "grad_norm": 0.9350804744006246,
      "learning_rate": 2.053254145132224e-05,
      "loss": 0.9303,
      "num_input_tokens_seen": 49621351392,
      "step": 63070
    },
    {
      "epoch": 6.691173350307659,
      "grad_norm": 1.2745434605597956,
      "learning_rate": 2.0531857670509236e-05,
      "loss": 1.046,
      "num_input_tokens_seen": 49622138160,
      "step": 63071
    },
    {
      "epoch": 6.691279439847231,
      "grad_norm": 0.8829317421765058,
      "learning_rate": 2.053117389314908e-05,
      "loss": 1.0372,
      "num_input_tokens_seen": 49622924944,
      "step": 63072
    },
    {
      "epoch": 6.691385529386802,
      "grad_norm": 0.6914652019532604,
      "learning_rate": 2.0530490119242295e-05,
      "loss": 0.9522,
      "num_input_tokens_seen": 49623711664,
      "step": 63073
    },
    {
      "epoch": 6.691491618926374,
      "grad_norm": 0.7899810381096785,
      "learning_rate": 2.0529806348789422e-05,
      "loss": 1.005,
      "num_input_tokens_seen": 49624498368,
      "step": 63074
    },
    {
      "epoch": 6.691597708465945,
      "grad_norm": 0.7502096998095678,
      "learning_rate": 2.0529122581790987e-05,
      "loss": 0.9791,
      "num_input_tokens_seen": 49625285072,
      "step": 63075
    },
    {
      "epoch": 6.691703798005516,
      "grad_norm": 0.9190382789776669,
      "learning_rate": 2.0528438818247507e-05,
      "loss": 1.0256,
      "num_input_tokens_seen": 49626071856,
      "step": 63076
    },
    {
      "epoch": 6.691809887545088,
      "grad_norm": 0.6266787119631936,
      "learning_rate": 2.0527755058159522e-05,
      "loss": 0.9043,
      "num_input_tokens_seen": 49626858752,
      "step": 63077
    },
    {
      "epoch": 6.691915977084659,
      "grad_norm": 0.8152293643135448,
      "learning_rate": 2.052707130152756e-05,
      "loss": 1.0358,
      "num_input_tokens_seen": 49627645520,
      "step": 63078
    },
    {
      "epoch": 6.692022066624231,
      "grad_norm": 0.7360387078173785,
      "learning_rate": 2.0526387548352137e-05,
      "loss": 0.9697,
      "num_input_tokens_seen": 49628432352,
      "step": 63079
    },
    {
      "epoch": 6.692128156163802,
      "grad_norm": 0.8816037721701063,
      "learning_rate": 2.05257037986338e-05,
      "loss": 1.0226,
      "num_input_tokens_seen": 49629219136,
      "step": 63080
    },
    {
      "epoch": 6.692234245703373,
      "grad_norm": 0.8420864406934524,
      "learning_rate": 2.052502005237306e-05,
      "loss": 0.9301,
      "num_input_tokens_seen": 49630005936,
      "step": 63081
    },
    {
      "epoch": 6.692340335242945,
      "grad_norm": 0.8622951749360847,
      "learning_rate": 2.052433630957046e-05,
      "loss": 1.0497,
      "num_input_tokens_seen": 49630792768,
      "step": 63082
    },
    {
      "epoch": 6.692446424782516,
      "grad_norm": 0.9101848050471728,
      "learning_rate": 2.0523652570226517e-05,
      "loss": 0.9911,
      "num_input_tokens_seen": 49631579568,
      "step": 63083
    },
    {
      "epoch": 6.692552514322088,
      "grad_norm": 0.7300528454677853,
      "learning_rate": 2.0522968834341763e-05,
      "loss": 1.012,
      "num_input_tokens_seen": 49632366368,
      "step": 63084
    },
    {
      "epoch": 6.692658603861659,
      "grad_norm": 0.7867558249639109,
      "learning_rate": 2.052228510191673e-05,
      "loss": 1.0291,
      "num_input_tokens_seen": 49633153040,
      "step": 63085
    },
    {
      "epoch": 6.69276469340123,
      "grad_norm": 0.6988989538313284,
      "learning_rate": 2.0521601372951947e-05,
      "loss": 1.0483,
      "num_input_tokens_seen": 49633939808,
      "step": 63086
    },
    {
      "epoch": 6.692870782940802,
      "grad_norm": 0.7234320293759323,
      "learning_rate": 2.0520917647447928e-05,
      "loss": 0.9698,
      "num_input_tokens_seen": 49634726624,
      "step": 63087
    },
    {
      "epoch": 6.692976872480373,
      "grad_norm": 0.8553655535828162,
      "learning_rate": 2.0520233925405224e-05,
      "loss": 1.031,
      "num_input_tokens_seen": 49635513344,
      "step": 63088
    },
    {
      "epoch": 6.693082962019945,
      "grad_norm": 0.9188556287161226,
      "learning_rate": 2.051955020682435e-05,
      "loss": 0.9762,
      "num_input_tokens_seen": 49636300064,
      "step": 63089
    },
    {
      "epoch": 6.693189051559516,
      "grad_norm": 0.8403961893629195,
      "learning_rate": 2.051886649170583e-05,
      "loss": 1.0461,
      "num_input_tokens_seen": 49637086704,
      "step": 63090
    },
    {
      "epoch": 6.693295141099088,
      "grad_norm": 0.8450266804251625,
      "learning_rate": 2.0518182780050205e-05,
      "loss": 0.9667,
      "num_input_tokens_seen": 49637873552,
      "step": 63091
    },
    {
      "epoch": 6.693401230638659,
      "grad_norm": 0.704413225923084,
      "learning_rate": 2.0517499071857995e-05,
      "loss": 1.0422,
      "num_input_tokens_seen": 49638660320,
      "step": 63092
    },
    {
      "epoch": 6.693507320178231,
      "grad_norm": 0.9983952318308394,
      "learning_rate": 2.051681536712973e-05,
      "loss": 1.0562,
      "num_input_tokens_seen": 49639447056,
      "step": 63093
    },
    {
      "epoch": 6.693613409717802,
      "grad_norm": 0.923776880663328,
      "learning_rate": 2.0516131665865935e-05,
      "loss": 0.971,
      "num_input_tokens_seen": 49640233888,
      "step": 63094
    },
    {
      "epoch": 6.693719499257373,
      "grad_norm": 0.8364211328069082,
      "learning_rate": 2.0515447968067147e-05,
      "loss": 1.0252,
      "num_input_tokens_seen": 49641020608,
      "step": 63095
    },
    {
      "epoch": 6.693825588796945,
      "grad_norm": 1.1459572116166556,
      "learning_rate": 2.0514764273733883e-05,
      "loss": 1.0568,
      "num_input_tokens_seen": 49641807264,
      "step": 63096
    },
    {
      "epoch": 6.693931678336516,
      "grad_norm": 0.8574527697235467,
      "learning_rate": 2.0514080582866684e-05,
      "loss": 0.8841,
      "num_input_tokens_seen": 49642594064,
      "step": 63097
    },
    {
      "epoch": 6.694037767876088,
      "grad_norm": 1.0008160481920212,
      "learning_rate": 2.0513396895466062e-05,
      "loss": 0.9762,
      "num_input_tokens_seen": 49643380832,
      "step": 63098
    },
    {
      "epoch": 6.694143857415659,
      "grad_norm": 0.7134391426378485,
      "learning_rate": 2.051271321153257e-05,
      "loss": 1.0422,
      "num_input_tokens_seen": 49644167488,
      "step": 63099
    },
    {
      "epoch": 6.69424994695523,
      "grad_norm": 0.7080802681472144,
      "learning_rate": 2.0512029531066712e-05,
      "loss": 0.9802,
      "num_input_tokens_seen": 49644954272,
      "step": 63100
    },
    {
      "epoch": 6.694356036494802,
      "grad_norm": 1.2317832472737964,
      "learning_rate": 2.0511345854069024e-05,
      "loss": 1.0653,
      "num_input_tokens_seen": 49645740976,
      "step": 63101
    },
    {
      "epoch": 6.694462126034373,
      "grad_norm": 0.68420927279159,
      "learning_rate": 2.0510662180540044e-05,
      "loss": 1.0458,
      "num_input_tokens_seen": 49646527744,
      "step": 63102
    },
    {
      "epoch": 6.694568215573945,
      "grad_norm": 1.1236083331894144,
      "learning_rate": 2.050997851048029e-05,
      "loss": 0.9599,
      "num_input_tokens_seen": 49647314496,
      "step": 63103
    },
    {
      "epoch": 6.694674305113516,
      "grad_norm": 0.9851638804927001,
      "learning_rate": 2.050929484389029e-05,
      "loss": 1.0612,
      "num_input_tokens_seen": 49648101200,
      "step": 63104
    },
    {
      "epoch": 6.694780394653087,
      "grad_norm": 0.7417860698807124,
      "learning_rate": 2.050861118077058e-05,
      "loss": 0.965,
      "num_input_tokens_seen": 49648888080,
      "step": 63105
    },
    {
      "epoch": 6.694886484192659,
      "grad_norm": 0.9057225921234408,
      "learning_rate": 2.050792752112168e-05,
      "loss": 1.07,
      "num_input_tokens_seen": 49649674832,
      "step": 63106
    },
    {
      "epoch": 6.69499257373223,
      "grad_norm": 1.1189502205149455,
      "learning_rate": 2.050724386494412e-05,
      "loss": 1.0334,
      "num_input_tokens_seen": 49650461584,
      "step": 63107
    },
    {
      "epoch": 6.695098663271802,
      "grad_norm": 0.9043710797515255,
      "learning_rate": 2.0506560212238432e-05,
      "loss": 1.0347,
      "num_input_tokens_seen": 49651248384,
      "step": 63108
    },
    {
      "epoch": 6.695204752811373,
      "grad_norm": 0.7887442730676968,
      "learning_rate": 2.0505876563005145e-05,
      "loss": 1.0659,
      "num_input_tokens_seen": 49652035136,
      "step": 63109
    },
    {
      "epoch": 6.695310842350944,
      "grad_norm": 0.7006961609226087,
      "learning_rate": 2.0505192917244782e-05,
      "loss": 0.9931,
      "num_input_tokens_seen": 49652821904,
      "step": 63110
    },
    {
      "epoch": 6.695416931890516,
      "grad_norm": 0.6803329363476849,
      "learning_rate": 2.0504509274957873e-05,
      "loss": 0.9315,
      "num_input_tokens_seen": 49653608720,
      "step": 63111
    },
    {
      "epoch": 6.695523021430087,
      "grad_norm": 0.6708265606363741,
      "learning_rate": 2.0503825636144952e-05,
      "loss": 0.9656,
      "num_input_tokens_seen": 49654395568,
      "step": 63112
    },
    {
      "epoch": 6.695629110969659,
      "grad_norm": 0.8231263212766521,
      "learning_rate": 2.0503142000806536e-05,
      "loss": 1.059,
      "num_input_tokens_seen": 49655182352,
      "step": 63113
    },
    {
      "epoch": 6.69573520050923,
      "grad_norm": 0.8634921889535241,
      "learning_rate": 2.0502458368943165e-05,
      "loss": 1.0075,
      "num_input_tokens_seen": 49655969136,
      "step": 63114
    },
    {
      "epoch": 6.695841290048802,
      "grad_norm": 0.826298802321315,
      "learning_rate": 2.0501774740555356e-05,
      "loss": 0.9642,
      "num_input_tokens_seen": 49656755904,
      "step": 63115
    },
    {
      "epoch": 6.695947379588373,
      "grad_norm": 0.8612619141966992,
      "learning_rate": 2.050109111564365e-05,
      "loss": 0.9659,
      "num_input_tokens_seen": 49657542736,
      "step": 63116
    },
    {
      "epoch": 6.696053469127944,
      "grad_norm": 0.8204957897310206,
      "learning_rate": 2.0500407494208566e-05,
      "loss": 1.0691,
      "num_input_tokens_seen": 49658329456,
      "step": 63117
    },
    {
      "epoch": 6.6961595586675156,
      "grad_norm": 0.9102739516328593,
      "learning_rate": 2.0499723876250633e-05,
      "loss": 1.0534,
      "num_input_tokens_seen": 49659116272,
      "step": 63118
    },
    {
      "epoch": 6.696265648207087,
      "grad_norm": 0.7539331082307433,
      "learning_rate": 2.049904026177039e-05,
      "loss": 0.9908,
      "num_input_tokens_seen": 49659903040,
      "step": 63119
    },
    {
      "epoch": 6.6963717377466585,
      "grad_norm": 0.8493185877233009,
      "learning_rate": 2.0498356650768352e-05,
      "loss": 1.0531,
      "num_input_tokens_seen": 49660689824,
      "step": 63120
    },
    {
      "epoch": 6.6964778272862295,
      "grad_norm": 0.8267196964666553,
      "learning_rate": 2.049767304324505e-05,
      "loss": 1.0306,
      "num_input_tokens_seen": 49661476560,
      "step": 63121
    },
    {
      "epoch": 6.6965839168258015,
      "grad_norm": 0.678153005981801,
      "learning_rate": 2.0496989439201014e-05,
      "loss": 1.039,
      "num_input_tokens_seen": 49662263312,
      "step": 63122
    },
    {
      "epoch": 6.6966900063653725,
      "grad_norm": 0.7677629469248595,
      "learning_rate": 2.0496305838636773e-05,
      "loss": 1.0643,
      "num_input_tokens_seen": 49663050048,
      "step": 63123
    },
    {
      "epoch": 6.6967960959049435,
      "grad_norm": 0.7117511982293794,
      "learning_rate": 2.049562224155285e-05,
      "loss": 0.9927,
      "num_input_tokens_seen": 49663836880,
      "step": 63124
    },
    {
      "epoch": 6.696902185444515,
      "grad_norm": 1.1250621081376242,
      "learning_rate": 2.0494938647949776e-05,
      "loss": 1.0091,
      "num_input_tokens_seen": 49664623600,
      "step": 63125
    },
    {
      "epoch": 6.6970082749840865,
      "grad_norm": 0.7917136741610812,
      "learning_rate": 2.049425505782809e-05,
      "loss": 0.9842,
      "num_input_tokens_seen": 49665410352,
      "step": 63126
    },
    {
      "epoch": 6.697114364523658,
      "grad_norm": 0.8554652767760844,
      "learning_rate": 2.049357147118831e-05,
      "loss": 0.9929,
      "num_input_tokens_seen": 49666197024,
      "step": 63127
    },
    {
      "epoch": 6.697220454063229,
      "grad_norm": 0.8659496772126466,
      "learning_rate": 2.0492887888030964e-05,
      "loss": 0.9973,
      "num_input_tokens_seen": 49666983728,
      "step": 63128
    },
    {
      "epoch": 6.6973265436028,
      "grad_norm": 0.6641668588194571,
      "learning_rate": 2.0492204308356586e-05,
      "loss": 1.0049,
      "num_input_tokens_seen": 49667770544,
      "step": 63129
    },
    {
      "epoch": 6.697432633142372,
      "grad_norm": 0.7013567375730344,
      "learning_rate": 2.0491520732165698e-05,
      "loss": 0.9216,
      "num_input_tokens_seen": 49668557312,
      "step": 63130
    },
    {
      "epoch": 6.697538722681943,
      "grad_norm": 0.854341402267253,
      "learning_rate": 2.0490837159458826e-05,
      "loss": 0.9427,
      "num_input_tokens_seen": 49669344208,
      "step": 63131
    },
    {
      "epoch": 6.697644812221515,
      "grad_norm": 0.7980014723726461,
      "learning_rate": 2.049015359023651e-05,
      "loss": 1.0395,
      "num_input_tokens_seen": 49670131056,
      "step": 63132
    },
    {
      "epoch": 6.697750901761086,
      "grad_norm": 0.9232766293948971,
      "learning_rate": 2.0489470024499268e-05,
      "loss": 0.992,
      "num_input_tokens_seen": 49670917872,
      "step": 63133
    },
    {
      "epoch": 6.697856991300657,
      "grad_norm": 0.7932491512784239,
      "learning_rate": 2.048878646224763e-05,
      "loss": 1.0291,
      "num_input_tokens_seen": 49671704720,
      "step": 63134
    },
    {
      "epoch": 6.697963080840229,
      "grad_norm": 0.9860441269887928,
      "learning_rate": 2.0488102903482127e-05,
      "loss": 1.0328,
      "num_input_tokens_seen": 49672491440,
      "step": 63135
    },
    {
      "epoch": 6.6980691703798,
      "grad_norm": 0.8009881534693204,
      "learning_rate": 2.0487419348203283e-05,
      "loss": 1.0508,
      "num_input_tokens_seen": 49673278208,
      "step": 63136
    },
    {
      "epoch": 6.698175259919372,
      "grad_norm": 0.7707331721582137,
      "learning_rate": 2.0486735796411633e-05,
      "loss": 1.0116,
      "num_input_tokens_seen": 49674065024,
      "step": 63137
    },
    {
      "epoch": 6.698281349458943,
      "grad_norm": 0.7586287683191776,
      "learning_rate": 2.0486052248107703e-05,
      "loss": 1.0314,
      "num_input_tokens_seen": 49674851888,
      "step": 63138
    },
    {
      "epoch": 6.698387438998514,
      "grad_norm": 0.9632536434113801,
      "learning_rate": 2.048536870329201e-05,
      "loss": 0.9484,
      "num_input_tokens_seen": 49675638656,
      "step": 63139
    },
    {
      "epoch": 6.698493528538086,
      "grad_norm": 0.7872371633028329,
      "learning_rate": 2.04846851619651e-05,
      "loss": 1.0105,
      "num_input_tokens_seen": 49676425344,
      "step": 63140
    },
    {
      "epoch": 6.698599618077657,
      "grad_norm": 0.7644854082415824,
      "learning_rate": 2.048400162412749e-05,
      "loss": 0.9917,
      "num_input_tokens_seen": 49677212128,
      "step": 63141
    },
    {
      "epoch": 6.698705707617229,
      "grad_norm": 0.8954082532556168,
      "learning_rate": 2.0483318089779706e-05,
      "loss": 0.9452,
      "num_input_tokens_seen": 49677998896,
      "step": 63142
    },
    {
      "epoch": 6.6988117971568,
      "grad_norm": 0.9411232632829611,
      "learning_rate": 2.048263455892229e-05,
      "loss": 0.9394,
      "num_input_tokens_seen": 49678785632,
      "step": 63143
    },
    {
      "epoch": 6.698917886696372,
      "grad_norm": 0.8800367431211721,
      "learning_rate": 2.048195103155576e-05,
      "loss": 1.0414,
      "num_input_tokens_seen": 49679572448,
      "step": 63144
    },
    {
      "epoch": 6.699023976235943,
      "grad_norm": 0.870477505347601,
      "learning_rate": 2.048126750768064e-05,
      "loss": 0.9785,
      "num_input_tokens_seen": 49680359264,
      "step": 63145
    },
    {
      "epoch": 6.699130065775514,
      "grad_norm": 1.0916437532615832,
      "learning_rate": 2.048058398729747e-05,
      "loss": 1.1066,
      "num_input_tokens_seen": 49681145952,
      "step": 63146
    },
    {
      "epoch": 6.699236155315086,
      "grad_norm": 0.701911304461266,
      "learning_rate": 2.047990047040677e-05,
      "loss": 1.0083,
      "num_input_tokens_seen": 49681932608,
      "step": 63147
    },
    {
      "epoch": 6.699342244854657,
      "grad_norm": 1.07704532266958,
      "learning_rate": 2.0479216957009068e-05,
      "loss": 0.9833,
      "num_input_tokens_seen": 49682719376,
      "step": 63148
    },
    {
      "epoch": 6.699448334394229,
      "grad_norm": 0.9693165302885218,
      "learning_rate": 2.04785334471049e-05,
      "loss": 0.965,
      "num_input_tokens_seen": 49683506240,
      "step": 63149
    },
    {
      "epoch": 6.6995544239338,
      "grad_norm": 0.9022984818040922,
      "learning_rate": 2.047784994069478e-05,
      "loss": 0.9529,
      "num_input_tokens_seen": 49684292976,
      "step": 63150
    },
    {
      "epoch": 6.699660513473372,
      "grad_norm": 1.03673475099464,
      "learning_rate": 2.047716643777925e-05,
      "loss": 1.0505,
      "num_input_tokens_seen": 49685079744,
      "step": 63151
    },
    {
      "epoch": 6.699766603012943,
      "grad_norm": 0.934158513522218,
      "learning_rate": 2.0476482938358834e-05,
      "loss": 1.0672,
      "num_input_tokens_seen": 49685866624,
      "step": 63152
    },
    {
      "epoch": 6.699872692552514,
      "grad_norm": 1.037884966596815,
      "learning_rate": 2.047579944243406e-05,
      "loss": 0.9981,
      "num_input_tokens_seen": 49686653408,
      "step": 63153
    },
    {
      "epoch": 6.699978782092086,
      "grad_norm": 0.6477115934221954,
      "learning_rate": 2.0475115950005453e-05,
      "loss": 0.9037,
      "num_input_tokens_seen": 49687440224,
      "step": 63154
    },
    {
      "epoch": 6.700084871631657,
      "grad_norm": 0.8573394933117428,
      "learning_rate": 2.0474432461073544e-05,
      "loss": 0.9971,
      "num_input_tokens_seen": 49688226992,
      "step": 63155
    },
    {
      "epoch": 6.700190961171229,
      "grad_norm": 0.8104027488199514,
      "learning_rate": 2.0473748975638856e-05,
      "loss": 0.9944,
      "num_input_tokens_seen": 49689013760,
      "step": 63156
    },
    {
      "epoch": 6.7002970507108,
      "grad_norm": 0.7982872736160366,
      "learning_rate": 2.0473065493701932e-05,
      "loss": 0.9928,
      "num_input_tokens_seen": 49689800544,
      "step": 63157
    },
    {
      "epoch": 6.700403140250371,
      "grad_norm": 1.1049706007357778,
      "learning_rate": 2.0472382015263284e-05,
      "loss": 0.928,
      "num_input_tokens_seen": 49690587312,
      "step": 63158
    },
    {
      "epoch": 6.700509229789943,
      "grad_norm": 0.7044112721723921,
      "learning_rate": 2.0471698540323446e-05,
      "loss": 1.0089,
      "num_input_tokens_seen": 49691374080,
      "step": 63159
    },
    {
      "epoch": 6.700615319329514,
      "grad_norm": 1.1289249802147179,
      "learning_rate": 2.0471015068882947e-05,
      "loss": 0.9347,
      "num_input_tokens_seen": 49692160816,
      "step": 63160
    },
    {
      "epoch": 6.700721408869086,
      "grad_norm": 1.2610117520283755,
      "learning_rate": 2.0470331600942318e-05,
      "loss": 1.0642,
      "num_input_tokens_seen": 49692947600,
      "step": 63161
    },
    {
      "epoch": 6.700827498408657,
      "grad_norm": 0.7244379629417999,
      "learning_rate": 2.046964813650208e-05,
      "loss": 0.9376,
      "num_input_tokens_seen": 49693734432,
      "step": 63162
    },
    {
      "epoch": 6.700933587948228,
      "grad_norm": 1.0737147802596212,
      "learning_rate": 2.0468964675562767e-05,
      "loss": 1.0251,
      "num_input_tokens_seen": 49694521200,
      "step": 63163
    },
    {
      "epoch": 6.7010396774878,
      "grad_norm": 0.897433534238782,
      "learning_rate": 2.0468281218124906e-05,
      "loss": 0.9712,
      "num_input_tokens_seen": 49695308000,
      "step": 63164
    },
    {
      "epoch": 6.701145767027371,
      "grad_norm": 0.8453683386807286,
      "learning_rate": 2.0467597764189024e-05,
      "loss": 1.0339,
      "num_input_tokens_seen": 49696094736,
      "step": 63165
    },
    {
      "epoch": 6.701251856566943,
      "grad_norm": 0.9157775598905754,
      "learning_rate": 2.0466914313755648e-05,
      "loss": 0.9852,
      "num_input_tokens_seen": 49696881504,
      "step": 63166
    },
    {
      "epoch": 6.701357946106514,
      "grad_norm": 0.9073011991297086,
      "learning_rate": 2.0466230866825305e-05,
      "loss": 1.0381,
      "num_input_tokens_seen": 49697668352,
      "step": 63167
    },
    {
      "epoch": 6.701464035646085,
      "grad_norm": 0.8637319373243426,
      "learning_rate": 2.046554742339853e-05,
      "loss": 1.0489,
      "num_input_tokens_seen": 49698455088,
      "step": 63168
    },
    {
      "epoch": 6.701570125185657,
      "grad_norm": 0.7350703689890368,
      "learning_rate": 2.0464863983475847e-05,
      "loss": 0.969,
      "num_input_tokens_seen": 49699241840,
      "step": 63169
    },
    {
      "epoch": 6.701676214725228,
      "grad_norm": 0.8274336154117523,
      "learning_rate": 2.046418054705778e-05,
      "loss": 1.0343,
      "num_input_tokens_seen": 49700028576,
      "step": 63170
    },
    {
      "epoch": 6.7017823042648,
      "grad_norm": 0.8010414704586019,
      "learning_rate": 2.0463497114144862e-05,
      "loss": 1.0119,
      "num_input_tokens_seen": 49700815328,
      "step": 63171
    },
    {
      "epoch": 6.701888393804371,
      "grad_norm": 0.7713482065736527,
      "learning_rate": 2.046281368473763e-05,
      "loss": 1.0071,
      "num_input_tokens_seen": 49701602192,
      "step": 63172
    },
    {
      "epoch": 6.701994483343943,
      "grad_norm": 0.8212474838803402,
      "learning_rate": 2.0462130258836586e-05,
      "loss": 1.0038,
      "num_input_tokens_seen": 49702388992,
      "step": 63173
    },
    {
      "epoch": 6.702100572883514,
      "grad_norm": 0.7482426907973602,
      "learning_rate": 2.0461446836442287e-05,
      "loss": 0.9859,
      "num_input_tokens_seen": 49703175744,
      "step": 63174
    },
    {
      "epoch": 6.702206662423085,
      "grad_norm": 0.65694494873153,
      "learning_rate": 2.0460763417555247e-05,
      "loss": 0.9735,
      "num_input_tokens_seen": 49703962544,
      "step": 63175
    },
    {
      "epoch": 6.702312751962657,
      "grad_norm": 0.6887126566464861,
      "learning_rate": 2.046008000217599e-05,
      "loss": 1.0163,
      "num_input_tokens_seen": 49704749248,
      "step": 63176
    },
    {
      "epoch": 6.702418841502228,
      "grad_norm": 0.6651806745118949,
      "learning_rate": 2.045939659030506e-05,
      "loss": 0.9767,
      "num_input_tokens_seen": 49705536128,
      "step": 63177
    },
    {
      "epoch": 6.7025249310418,
      "grad_norm": 0.9576877962841417,
      "learning_rate": 2.045871318194297e-05,
      "loss": 0.9874,
      "num_input_tokens_seen": 49706322960,
      "step": 63178
    },
    {
      "epoch": 6.702631020581371,
      "grad_norm": 0.8060464528626041,
      "learning_rate": 2.0458029777090244e-05,
      "loss": 0.9518,
      "num_input_tokens_seen": 49707109712,
      "step": 63179
    },
    {
      "epoch": 6.7027371101209425,
      "grad_norm": 0.6971385213164053,
      "learning_rate": 2.045734637574743e-05,
      "loss": 1.0728,
      "num_input_tokens_seen": 49707896464,
      "step": 63180
    },
    {
      "epoch": 6.702843199660514,
      "grad_norm": 0.7340361023265415,
      "learning_rate": 2.0456662977915045e-05,
      "loss": 1.0028,
      "num_input_tokens_seen": 49708683216,
      "step": 63181
    },
    {
      "epoch": 6.702949289200085,
      "grad_norm": 0.7468216696116251,
      "learning_rate": 2.0455979583593613e-05,
      "loss": 1.0,
      "num_input_tokens_seen": 49709469952,
      "step": 63182
    },
    {
      "epoch": 6.7030553787396565,
      "grad_norm": 0.9467846122859581,
      "learning_rate": 2.0455296192783672e-05,
      "loss": 1.0744,
      "num_input_tokens_seen": 49710256656,
      "step": 63183
    },
    {
      "epoch": 6.7031614682792275,
      "grad_norm": 0.7703679649435698,
      "learning_rate": 2.0454612805485736e-05,
      "loss": 1.0461,
      "num_input_tokens_seen": 49711043424,
      "step": 63184
    },
    {
      "epoch": 6.7032675578187995,
      "grad_norm": 0.9579897115709951,
      "learning_rate": 2.045392942170035e-05,
      "loss": 1.0606,
      "num_input_tokens_seen": 49711830208,
      "step": 63185
    },
    {
      "epoch": 6.7033736473583705,
      "grad_norm": 0.6746045261472357,
      "learning_rate": 2.0453246041428034e-05,
      "loss": 0.874,
      "num_input_tokens_seen": 49712617008,
      "step": 63186
    },
    {
      "epoch": 6.7034797368979415,
      "grad_norm": 1.070313223000966,
      "learning_rate": 2.045256266466931e-05,
      "loss": 1.0069,
      "num_input_tokens_seen": 49713403824,
      "step": 63187
    },
    {
      "epoch": 6.703585826437513,
      "grad_norm": 0.8923163140840694,
      "learning_rate": 2.0451879291424717e-05,
      "loss": 0.9934,
      "num_input_tokens_seen": 49714190592,
      "step": 63188
    },
    {
      "epoch": 6.7036919159770845,
      "grad_norm": 0.7511405441624734,
      "learning_rate": 2.045119592169478e-05,
      "loss": 0.9943,
      "num_input_tokens_seen": 49714977280,
      "step": 63189
    },
    {
      "epoch": 6.703798005516656,
      "grad_norm": 0.6879262298249247,
      "learning_rate": 2.045051255548002e-05,
      "loss": 0.9691,
      "num_input_tokens_seen": 49715764112,
      "step": 63190
    },
    {
      "epoch": 6.703904095056227,
      "grad_norm": 0.5904661810118264,
      "learning_rate": 2.0449829192780973e-05,
      "loss": 1.0044,
      "num_input_tokens_seen": 49716550800,
      "step": 63191
    },
    {
      "epoch": 6.7040101845957984,
      "grad_norm": 0.7755993197005175,
      "learning_rate": 2.0449145833598165e-05,
      "loss": 0.9305,
      "num_input_tokens_seen": 49717337696,
      "step": 63192
    },
    {
      "epoch": 6.70411627413537,
      "grad_norm": 0.6663611249026461,
      "learning_rate": 2.0448462477932122e-05,
      "loss": 1.0413,
      "num_input_tokens_seen": 49718124384,
      "step": 63193
    },
    {
      "epoch": 6.704222363674941,
      "grad_norm": 0.7960797210220086,
      "learning_rate": 2.0447779125783373e-05,
      "loss": 0.9898,
      "num_input_tokens_seen": 49718911280,
      "step": 63194
    },
    {
      "epoch": 6.704328453214513,
      "grad_norm": 0.6780479652256465,
      "learning_rate": 2.0447095777152454e-05,
      "loss": 0.9199,
      "num_input_tokens_seen": 49719698064,
      "step": 63195
    },
    {
      "epoch": 6.704434542754084,
      "grad_norm": 0.7504682612141896,
      "learning_rate": 2.0446412432039876e-05,
      "loss": 0.9548,
      "num_input_tokens_seen": 49720484912,
      "step": 63196
    },
    {
      "epoch": 6.704540632293655,
      "grad_norm": 0.6715933654406482,
      "learning_rate": 2.044572909044618e-05,
      "loss": 0.9828,
      "num_input_tokens_seen": 49721271632,
      "step": 63197
    },
    {
      "epoch": 6.704646721833227,
      "grad_norm": 0.7124999626207141,
      "learning_rate": 2.0445045752371894e-05,
      "loss": 0.9535,
      "num_input_tokens_seen": 49722058496,
      "step": 63198
    },
    {
      "epoch": 6.704752811372798,
      "grad_norm": 0.8661265191274431,
      "learning_rate": 2.0444362417817537e-05,
      "loss": 1.0146,
      "num_input_tokens_seen": 49722845200,
      "step": 63199
    },
    {
      "epoch": 6.70485890091237,
      "grad_norm": 0.7469342706144589,
      "learning_rate": 2.044367908678365e-05,
      "loss": 0.9568,
      "num_input_tokens_seen": 49723631984,
      "step": 63200
    },
    {
      "epoch": 6.704964990451941,
      "grad_norm": 0.7858774049123733,
      "learning_rate": 2.0442995759270746e-05,
      "loss": 0.9113,
      "num_input_tokens_seen": 49724418800,
      "step": 63201
    },
    {
      "epoch": 6.705071079991513,
      "grad_norm": 0.8617734230259215,
      "learning_rate": 2.0442312435279368e-05,
      "loss": 1.0318,
      "num_input_tokens_seen": 49725205520,
      "step": 63202
    },
    {
      "epoch": 6.705177169531084,
      "grad_norm": 0.8917304836786666,
      "learning_rate": 2.0441629114810038e-05,
      "loss": 0.9676,
      "num_input_tokens_seen": 49725992240,
      "step": 63203
    },
    {
      "epoch": 6.705283259070655,
      "grad_norm": 0.6974365239215748,
      "learning_rate": 2.0440945797863277e-05,
      "loss": 0.9374,
      "num_input_tokens_seen": 49726778992,
      "step": 63204
    },
    {
      "epoch": 6.705389348610227,
      "grad_norm": 0.6419174221185918,
      "learning_rate": 2.0440262484439624e-05,
      "loss": 0.9564,
      "num_input_tokens_seen": 49727565776,
      "step": 63205
    },
    {
      "epoch": 6.705495438149798,
      "grad_norm": 0.8473272830624513,
      "learning_rate": 2.04395791745396e-05,
      "loss": 0.9917,
      "num_input_tokens_seen": 49728352576,
      "step": 63206
    },
    {
      "epoch": 6.70560152768937,
      "grad_norm": 0.6331522064038739,
      "learning_rate": 2.0438895868163737e-05,
      "loss": 0.9991,
      "num_input_tokens_seen": 49729139408,
      "step": 63207
    },
    {
      "epoch": 6.705707617228941,
      "grad_norm": 0.8307894173031332,
      "learning_rate": 2.043821256531256e-05,
      "loss": 1.0551,
      "num_input_tokens_seen": 49729926112,
      "step": 63208
    },
    {
      "epoch": 6.705813706768513,
      "grad_norm": 0.8641451920969418,
      "learning_rate": 2.0437529265986606e-05,
      "loss": 1.0226,
      "num_input_tokens_seen": 49730712800,
      "step": 63209
    },
    {
      "epoch": 6.705919796308084,
      "grad_norm": 0.7668514010269847,
      "learning_rate": 2.043684597018638e-05,
      "loss": 1.0411,
      "num_input_tokens_seen": 49731499584,
      "step": 63210
    },
    {
      "epoch": 6.706025885847655,
      "grad_norm": 0.754886513240119,
      "learning_rate": 2.043616267791244e-05,
      "loss": 1.0202,
      "num_input_tokens_seen": 49732286352,
      "step": 63211
    },
    {
      "epoch": 6.706131975387227,
      "grad_norm": 0.7978065609854482,
      "learning_rate": 2.0435479389165297e-05,
      "loss": 1.0557,
      "num_input_tokens_seen": 49733073072,
      "step": 63212
    },
    {
      "epoch": 6.706238064926798,
      "grad_norm": 0.7382094014385729,
      "learning_rate": 2.0434796103945476e-05,
      "loss": 1.0096,
      "num_input_tokens_seen": 49733859936,
      "step": 63213
    },
    {
      "epoch": 6.70634415446637,
      "grad_norm": 0.6172551421017165,
      "learning_rate": 2.0434112822253514e-05,
      "loss": 0.8962,
      "num_input_tokens_seen": 49734646720,
      "step": 63214
    },
    {
      "epoch": 6.706450244005941,
      "grad_norm": 0.9551006899886634,
      "learning_rate": 2.0433429544089936e-05,
      "loss": 1.0643,
      "num_input_tokens_seen": 49735433440,
      "step": 63215
    },
    {
      "epoch": 6.706556333545512,
      "grad_norm": 0.7918045302682235,
      "learning_rate": 2.0432746269455266e-05,
      "loss": 1.0621,
      "num_input_tokens_seen": 49736220176,
      "step": 63216
    },
    {
      "epoch": 6.706662423085084,
      "grad_norm": 0.7865720690255815,
      "learning_rate": 2.043206299835004e-05,
      "loss": 1.0273,
      "num_input_tokens_seen": 49737006960,
      "step": 63217
    },
    {
      "epoch": 6.706768512624655,
      "grad_norm": 0.8060672793803184,
      "learning_rate": 2.0431379730774773e-05,
      "loss": 1.1199,
      "num_input_tokens_seen": 49737793696,
      "step": 63218
    },
    {
      "epoch": 6.706874602164227,
      "grad_norm": 0.7886179964736592,
      "learning_rate": 2.043069646673001e-05,
      "loss": 1.0315,
      "num_input_tokens_seen": 49738580528,
      "step": 63219
    },
    {
      "epoch": 6.706980691703798,
      "grad_norm": 0.8410069448074697,
      "learning_rate": 2.0430013206216264e-05,
      "loss": 0.9293,
      "num_input_tokens_seen": 49739367392,
      "step": 63220
    },
    {
      "epoch": 6.707086781243369,
      "grad_norm": 0.8733390432780617,
      "learning_rate": 2.0429329949234076e-05,
      "loss": 1.0174,
      "num_input_tokens_seen": 49740154080,
      "step": 63221
    },
    {
      "epoch": 6.707192870782941,
      "grad_norm": 0.7154655088335579,
      "learning_rate": 2.0428646695783965e-05,
      "loss": 0.9882,
      "num_input_tokens_seen": 49740940816,
      "step": 63222
    },
    {
      "epoch": 6.707298960322512,
      "grad_norm": 0.8407261003759411,
      "learning_rate": 2.0427963445866465e-05,
      "loss": 0.8946,
      "num_input_tokens_seen": 49741727760,
      "step": 63223
    },
    {
      "epoch": 6.707405049862084,
      "grad_norm": 0.7170887791595753,
      "learning_rate": 2.0427280199482102e-05,
      "loss": 0.9578,
      "num_input_tokens_seen": 49742514464,
      "step": 63224
    },
    {
      "epoch": 6.707511139401655,
      "grad_norm": 0.8307585823074013,
      "learning_rate": 2.0426596956631395e-05,
      "loss": 1.0303,
      "num_input_tokens_seen": 49743301248,
      "step": 63225
    },
    {
      "epoch": 6.707617228941226,
      "grad_norm": 0.6903704639573032,
      "learning_rate": 2.042591371731489e-05,
      "loss": 0.9917,
      "num_input_tokens_seen": 49744087936,
      "step": 63226
    },
    {
      "epoch": 6.707723318480798,
      "grad_norm": 0.8077782399900397,
      "learning_rate": 2.04252304815331e-05,
      "loss": 1.048,
      "num_input_tokens_seen": 49744874656,
      "step": 63227
    },
    {
      "epoch": 6.707829408020369,
      "grad_norm": 0.6727713192287033,
      "learning_rate": 2.0424547249286553e-05,
      "loss": 0.9576,
      "num_input_tokens_seen": 49745661472,
      "step": 63228
    },
    {
      "epoch": 6.707935497559941,
      "grad_norm": 0.6977117036338745,
      "learning_rate": 2.0423864020575786e-05,
      "loss": 0.9966,
      "num_input_tokens_seen": 49746448288,
      "step": 63229
    },
    {
      "epoch": 6.708041587099512,
      "grad_norm": 0.7467967765464791,
      "learning_rate": 2.0423180795401325e-05,
      "loss": 1.0276,
      "num_input_tokens_seen": 49747234992,
      "step": 63230
    },
    {
      "epoch": 6.708147676639084,
      "grad_norm": 0.7250584183110516,
      "learning_rate": 2.0422497573763688e-05,
      "loss": 0.9935,
      "num_input_tokens_seen": 49748021744,
      "step": 63231
    },
    {
      "epoch": 6.708253766178655,
      "grad_norm": 0.8063235901579595,
      "learning_rate": 2.042181435566342e-05,
      "loss": 1.0541,
      "num_input_tokens_seen": 49748808544,
      "step": 63232
    },
    {
      "epoch": 6.708359855718226,
      "grad_norm": 0.7291602234053273,
      "learning_rate": 2.0421131141101037e-05,
      "loss": 0.9936,
      "num_input_tokens_seen": 49749595328,
      "step": 63233
    },
    {
      "epoch": 6.708465945257798,
      "grad_norm": 0.7187290643546657,
      "learning_rate": 2.042044793007706e-05,
      "loss": 0.9955,
      "num_input_tokens_seen": 49750382208,
      "step": 63234
    },
    {
      "epoch": 6.708572034797369,
      "grad_norm": 0.6807751265902542,
      "learning_rate": 2.0419764722592036e-05,
      "loss": 0.9669,
      "num_input_tokens_seen": 49751169024,
      "step": 63235
    },
    {
      "epoch": 6.708678124336941,
      "grad_norm": 0.70128851301013,
      "learning_rate": 2.0419081518646483e-05,
      "loss": 0.9607,
      "num_input_tokens_seen": 49751955792,
      "step": 63236
    },
    {
      "epoch": 6.708784213876512,
      "grad_norm": 1.0326096282685826,
      "learning_rate": 2.0418398318240926e-05,
      "loss": 0.9733,
      "num_input_tokens_seen": 49752742432,
      "step": 63237
    },
    {
      "epoch": 6.708890303416084,
      "grad_norm": 0.8502937247568044,
      "learning_rate": 2.0417715121375898e-05,
      "loss": 1.0173,
      "num_input_tokens_seen": 49753529312,
      "step": 63238
    },
    {
      "epoch": 6.708996392955655,
      "grad_norm": 0.764386101936182,
      "learning_rate": 2.0417031928051922e-05,
      "loss": 0.953,
      "num_input_tokens_seen": 49754316064,
      "step": 63239
    },
    {
      "epoch": 6.709102482495226,
      "grad_norm": 1.3006824511232054,
      "learning_rate": 2.0416348738269537e-05,
      "loss": 0.9752,
      "num_input_tokens_seen": 49755102880,
      "step": 63240
    },
    {
      "epoch": 6.709208572034798,
      "grad_norm": 0.8736074908105811,
      "learning_rate": 2.041566555202926e-05,
      "loss": 1.0209,
      "num_input_tokens_seen": 49755889568,
      "step": 63241
    },
    {
      "epoch": 6.709314661574369,
      "grad_norm": 0.7548379496533211,
      "learning_rate": 2.0414982369331614e-05,
      "loss": 1.0202,
      "num_input_tokens_seen": 49756676384,
      "step": 63242
    },
    {
      "epoch": 6.7094207511139405,
      "grad_norm": 0.9963407272483443,
      "learning_rate": 2.0414299190177148e-05,
      "loss": 0.9894,
      "num_input_tokens_seen": 49757463152,
      "step": 63243
    },
    {
      "epoch": 6.709526840653512,
      "grad_norm": 0.7612282362716857,
      "learning_rate": 2.0413616014566372e-05,
      "loss": 0.9521,
      "num_input_tokens_seen": 49758249872,
      "step": 63244
    },
    {
      "epoch": 6.709632930193083,
      "grad_norm": 0.8481956913562733,
      "learning_rate": 2.0412932842499813e-05,
      "loss": 1.0409,
      "num_input_tokens_seen": 49759036544,
      "step": 63245
    },
    {
      "epoch": 6.7097390197326545,
      "grad_norm": 0.7429732902954788,
      "learning_rate": 2.0412249673978012e-05,
      "loss": 0.9653,
      "num_input_tokens_seen": 49759823328,
      "step": 63246
    },
    {
      "epoch": 6.7098451092722255,
      "grad_norm": 0.8733601931187266,
      "learning_rate": 2.0411566509001488e-05,
      "loss": 1.0103,
      "num_input_tokens_seen": 49760610096,
      "step": 63247
    },
    {
      "epoch": 6.7099511988117975,
      "grad_norm": 0.7180175391447863,
      "learning_rate": 2.041088334757077e-05,
      "loss": 0.9988,
      "num_input_tokens_seen": 49761396784,
      "step": 63248
    },
    {
      "epoch": 6.7100572883513685,
      "grad_norm": 0.7753762089597829,
      "learning_rate": 2.0410200189686388e-05,
      "loss": 0.9774,
      "num_input_tokens_seen": 49762183504,
      "step": 63249
    },
    {
      "epoch": 6.7101633778909395,
      "grad_norm": 0.7784863666671047,
      "learning_rate": 2.040951703534887e-05,
      "loss": 0.9441,
      "num_input_tokens_seen": 49762970304,
      "step": 63250
    },
    {
      "epoch": 6.7102694674305114,
      "grad_norm": 0.7232517608309815,
      "learning_rate": 2.0408833884558737e-05,
      "loss": 1.0336,
      "num_input_tokens_seen": 49763757136,
      "step": 63251
    },
    {
      "epoch": 6.7103755569700825,
      "grad_norm": 0.7165487981079282,
      "learning_rate": 2.0408150737316528e-05,
      "loss": 1.0117,
      "num_input_tokens_seen": 49764543968,
      "step": 63252
    },
    {
      "epoch": 6.710481646509654,
      "grad_norm": 0.8670123833373364,
      "learning_rate": 2.040746759362276e-05,
      "loss": 0.9834,
      "num_input_tokens_seen": 49765330736,
      "step": 63253
    },
    {
      "epoch": 6.710587736049225,
      "grad_norm": 0.7868890557315117,
      "learning_rate": 2.040678445347797e-05,
      "loss": 1.0042,
      "num_input_tokens_seen": 49766117472,
      "step": 63254
    },
    {
      "epoch": 6.7106938255887965,
      "grad_norm": 0.8228256711066367,
      "learning_rate": 2.0406101316882683e-05,
      "loss": 1.0149,
      "num_input_tokens_seen": 49766904176,
      "step": 63255
    },
    {
      "epoch": 6.710799915128368,
      "grad_norm": 0.6658727158499874,
      "learning_rate": 2.040541818383742e-05,
      "loss": 0.9558,
      "num_input_tokens_seen": 49767690928,
      "step": 63256
    },
    {
      "epoch": 6.710906004667939,
      "grad_norm": 0.7906755015194251,
      "learning_rate": 2.0404735054342724e-05,
      "loss": 0.9563,
      "num_input_tokens_seen": 49768477696,
      "step": 63257
    },
    {
      "epoch": 6.711012094207511,
      "grad_norm": 0.8156314486219333,
      "learning_rate": 2.040405192839911e-05,
      "loss": 1.0456,
      "num_input_tokens_seen": 49769264400,
      "step": 63258
    },
    {
      "epoch": 6.711118183747082,
      "grad_norm": 0.7582654854358487,
      "learning_rate": 2.0403368806007107e-05,
      "loss": 1.0324,
      "num_input_tokens_seen": 49770051136,
      "step": 63259
    },
    {
      "epoch": 6.711224273286654,
      "grad_norm": 0.7623285210823625,
      "learning_rate": 2.040268568716725e-05,
      "loss": 0.9585,
      "num_input_tokens_seen": 49770837920,
      "step": 63260
    },
    {
      "epoch": 6.711330362826225,
      "grad_norm": 0.6546916740846067,
      "learning_rate": 2.0402002571880062e-05,
      "loss": 0.9393,
      "num_input_tokens_seen": 49771624688,
      "step": 63261
    },
    {
      "epoch": 6.711436452365797,
      "grad_norm": 0.777057958530909,
      "learning_rate": 2.0401319460146067e-05,
      "loss": 0.9552,
      "num_input_tokens_seen": 49772411472,
      "step": 63262
    },
    {
      "epoch": 6.711542541905368,
      "grad_norm": 0.758719892858767,
      "learning_rate": 2.0400636351965806e-05,
      "loss": 1.0252,
      "num_input_tokens_seen": 49773198256,
      "step": 63263
    },
    {
      "epoch": 6.711648631444939,
      "grad_norm": 0.6562015759335105,
      "learning_rate": 2.0399953247339793e-05,
      "loss": 0.9724,
      "num_input_tokens_seen": 49773984912,
      "step": 63264
    },
    {
      "epoch": 6.711754720984511,
      "grad_norm": 0.7070210790624878,
      "learning_rate": 2.0399270146268557e-05,
      "loss": 0.9909,
      "num_input_tokens_seen": 49774771616,
      "step": 63265
    },
    {
      "epoch": 6.711860810524082,
      "grad_norm": 0.9425408241537678,
      "learning_rate": 2.0398587048752637e-05,
      "loss": 0.9815,
      "num_input_tokens_seen": 49775558400,
      "step": 63266
    },
    {
      "epoch": 6.711966900063654,
      "grad_norm": 0.9553428601203136,
      "learning_rate": 2.039790395479255e-05,
      "loss": 1.088,
      "num_input_tokens_seen": 49776345104,
      "step": 63267
    },
    {
      "epoch": 6.712072989603225,
      "grad_norm": 1.2935722196717996,
      "learning_rate": 2.039722086438883e-05,
      "loss": 0.9753,
      "num_input_tokens_seen": 49777131840,
      "step": 63268
    },
    {
      "epoch": 6.712179079142796,
      "grad_norm": 1.000162674876004,
      "learning_rate": 2.0396537777542003e-05,
      "loss": 1.095,
      "num_input_tokens_seen": 49777918592,
      "step": 63269
    },
    {
      "epoch": 6.712285168682368,
      "grad_norm": 0.7321097211062167,
      "learning_rate": 2.039585469425259e-05,
      "loss": 0.9416,
      "num_input_tokens_seen": 49778705296,
      "step": 63270
    },
    {
      "epoch": 6.712391258221939,
      "grad_norm": 1.068595454966568,
      "learning_rate": 2.0395171614521134e-05,
      "loss": 0.9285,
      "num_input_tokens_seen": 49779492096,
      "step": 63271
    },
    {
      "epoch": 6.712497347761511,
      "grad_norm": 0.9945124808191337,
      "learning_rate": 2.0394488538348154e-05,
      "loss": 1.0128,
      "num_input_tokens_seen": 49780278832,
      "step": 63272
    },
    {
      "epoch": 6.712603437301082,
      "grad_norm": 0.813432506373934,
      "learning_rate": 2.039380546573417e-05,
      "loss": 0.9787,
      "num_input_tokens_seen": 49781065664,
      "step": 63273
    },
    {
      "epoch": 6.712709526840653,
      "grad_norm": 0.763847226645857,
      "learning_rate": 2.0393122396679722e-05,
      "loss": 0.995,
      "num_input_tokens_seen": 49781852496,
      "step": 63274
    },
    {
      "epoch": 6.712815616380225,
      "grad_norm": 0.7750975005289849,
      "learning_rate": 2.0392439331185337e-05,
      "loss": 0.9729,
      "num_input_tokens_seen": 49782639280,
      "step": 63275
    },
    {
      "epoch": 6.712921705919796,
      "grad_norm": 0.9165786840615732,
      "learning_rate": 2.0391756269251536e-05,
      "loss": 0.9917,
      "num_input_tokens_seen": 49783425968,
      "step": 63276
    },
    {
      "epoch": 6.713027795459368,
      "grad_norm": 0.7530744563189887,
      "learning_rate": 2.0391073210878852e-05,
      "loss": 0.9131,
      "num_input_tokens_seen": 49784212848,
      "step": 63277
    },
    {
      "epoch": 6.713133884998939,
      "grad_norm": 0.8900704922468782,
      "learning_rate": 2.0390390156067816e-05,
      "loss": 0.9959,
      "num_input_tokens_seen": 49784999568,
      "step": 63278
    },
    {
      "epoch": 6.71323997453851,
      "grad_norm": 0.8215473393438842,
      "learning_rate": 2.0389707104818943e-05,
      "loss": 1.0265,
      "num_input_tokens_seen": 49785786256,
      "step": 63279
    },
    {
      "epoch": 6.713346064078082,
      "grad_norm": 0.6963077919717875,
      "learning_rate": 2.0389024057132772e-05,
      "loss": 1.0367,
      "num_input_tokens_seen": 49786572976,
      "step": 63280
    },
    {
      "epoch": 6.713452153617653,
      "grad_norm": 0.8832567491005023,
      "learning_rate": 2.038834101300983e-05,
      "loss": 1.0615,
      "num_input_tokens_seen": 49787359792,
      "step": 63281
    },
    {
      "epoch": 6.713558243157225,
      "grad_norm": 0.820655368711375,
      "learning_rate": 2.0387657972450643e-05,
      "loss": 1.0072,
      "num_input_tokens_seen": 49788146624,
      "step": 63282
    },
    {
      "epoch": 6.713664332696796,
      "grad_norm": 0.7688546475459989,
      "learning_rate": 2.0386974935455735e-05,
      "loss": 0.9616,
      "num_input_tokens_seen": 49788933344,
      "step": 63283
    },
    {
      "epoch": 6.713770422236367,
      "grad_norm": 1.026761381199038,
      "learning_rate": 2.0386291902025644e-05,
      "loss": 1.0488,
      "num_input_tokens_seen": 49789720144,
      "step": 63284
    },
    {
      "epoch": 6.713876511775939,
      "grad_norm": 0.9223829004693536,
      "learning_rate": 2.038560887216088e-05,
      "loss": 1.0248,
      "num_input_tokens_seen": 49790506864,
      "step": 63285
    },
    {
      "epoch": 6.71398260131551,
      "grad_norm": 1.0224855911339517,
      "learning_rate": 2.0384925845861992e-05,
      "loss": 1.0319,
      "num_input_tokens_seen": 49791293664,
      "step": 63286
    },
    {
      "epoch": 6.714088690855082,
      "grad_norm": 0.888160151798333,
      "learning_rate": 2.038424282312949e-05,
      "loss": 0.9881,
      "num_input_tokens_seen": 49792080352,
      "step": 63287
    },
    {
      "epoch": 6.714194780394653,
      "grad_norm": 0.8391640869787326,
      "learning_rate": 2.0383559803963918e-05,
      "loss": 1.0494,
      "num_input_tokens_seen": 49792867024,
      "step": 63288
    },
    {
      "epoch": 6.714300869934225,
      "grad_norm": 1.0015639108117753,
      "learning_rate": 2.0382876788365794e-05,
      "loss": 1.0708,
      "num_input_tokens_seen": 49793653824,
      "step": 63289
    },
    {
      "epoch": 6.714406959473796,
      "grad_norm": 0.7559749271136388,
      "learning_rate": 2.038219377633564e-05,
      "loss": 0.9916,
      "num_input_tokens_seen": 49794440640,
      "step": 63290
    },
    {
      "epoch": 6.714513049013368,
      "grad_norm": 0.7014973569834466,
      "learning_rate": 2.0381510767874e-05,
      "loss": 1.0198,
      "num_input_tokens_seen": 49795227424,
      "step": 63291
    },
    {
      "epoch": 6.714619138552939,
      "grad_norm": 0.7929255600626076,
      "learning_rate": 2.0380827762981387e-05,
      "loss": 1.0056,
      "num_input_tokens_seen": 49796014176,
      "step": 63292
    },
    {
      "epoch": 6.71472522809251,
      "grad_norm": 0.6878626024873391,
      "learning_rate": 2.0380144761658333e-05,
      "loss": 0.9488,
      "num_input_tokens_seen": 49796800960,
      "step": 63293
    },
    {
      "epoch": 6.714831317632082,
      "grad_norm": 0.6695522437788165,
      "learning_rate": 2.0379461763905378e-05,
      "loss": 0.9809,
      "num_input_tokens_seen": 49797587808,
      "step": 63294
    },
    {
      "epoch": 6.714937407171653,
      "grad_norm": 0.7561394399374601,
      "learning_rate": 2.0378778769723032e-05,
      "loss": 1.0233,
      "num_input_tokens_seen": 49798374512,
      "step": 63295
    },
    {
      "epoch": 6.715043496711225,
      "grad_norm": 0.6506586513681426,
      "learning_rate": 2.037809577911183e-05,
      "loss": 0.953,
      "num_input_tokens_seen": 49799161264,
      "step": 63296
    },
    {
      "epoch": 6.715149586250796,
      "grad_norm": 0.9511294400173087,
      "learning_rate": 2.03774127920723e-05,
      "loss": 1.1048,
      "num_input_tokens_seen": 49799948016,
      "step": 63297
    },
    {
      "epoch": 6.715255675790367,
      "grad_norm": 0.769042028394732,
      "learning_rate": 2.0376729808604974e-05,
      "loss": 0.9919,
      "num_input_tokens_seen": 49800734768,
      "step": 63298
    },
    {
      "epoch": 6.715361765329939,
      "grad_norm": 1.149930685664555,
      "learning_rate": 2.037604682871037e-05,
      "loss": 1.042,
      "num_input_tokens_seen": 49801521440,
      "step": 63299
    },
    {
      "epoch": 6.71546785486951,
      "grad_norm": 0.7428454708243772,
      "learning_rate": 2.0375363852389025e-05,
      "loss": 1.0794,
      "num_input_tokens_seen": 49802308224,
      "step": 63300
    },
    {
      "epoch": 6.715573944409082,
      "grad_norm": 0.7390432953934061,
      "learning_rate": 2.0374680879641465e-05,
      "loss": 0.9583,
      "num_input_tokens_seen": 49803095056,
      "step": 63301
    },
    {
      "epoch": 6.715680033948653,
      "grad_norm": 0.7277278653031215,
      "learning_rate": 2.0373997910468207e-05,
      "loss": 1.0044,
      "num_input_tokens_seen": 49803881808,
      "step": 63302
    },
    {
      "epoch": 6.715786123488224,
      "grad_norm": 0.7637027648007451,
      "learning_rate": 2.0373314944869795e-05,
      "loss": 1.0117,
      "num_input_tokens_seen": 49804668512,
      "step": 63303
    },
    {
      "epoch": 6.715892213027796,
      "grad_norm": 0.7775991944753404,
      "learning_rate": 2.0372631982846746e-05,
      "loss": 1.0113,
      "num_input_tokens_seen": 49805455216,
      "step": 63304
    },
    {
      "epoch": 6.715998302567367,
      "grad_norm": 0.636732577212615,
      "learning_rate": 2.0371949024399595e-05,
      "loss": 0.9473,
      "num_input_tokens_seen": 49806241984,
      "step": 63305
    },
    {
      "epoch": 6.7161043921069385,
      "grad_norm": 0.7886657130086216,
      "learning_rate": 2.0371266069528865e-05,
      "loss": 0.9798,
      "num_input_tokens_seen": 49807028672,
      "step": 63306
    },
    {
      "epoch": 6.71621048164651,
      "grad_norm": 0.8730072265304545,
      "learning_rate": 2.037058311823508e-05,
      "loss": 0.9586,
      "num_input_tokens_seen": 49807815472,
      "step": 63307
    },
    {
      "epoch": 6.716316571186081,
      "grad_norm": 0.674479587671213,
      "learning_rate": 2.036990017051878e-05,
      "loss": 1.0569,
      "num_input_tokens_seen": 49808602272,
      "step": 63308
    },
    {
      "epoch": 6.7164226607256525,
      "grad_norm": 0.9169165803145374,
      "learning_rate": 2.0369217226380483e-05,
      "loss": 0.9587,
      "num_input_tokens_seen": 49809389024,
      "step": 63309
    },
    {
      "epoch": 6.716528750265224,
      "grad_norm": 0.7566310461911303,
      "learning_rate": 2.0368534285820714e-05,
      "loss": 0.9756,
      "num_input_tokens_seen": 49810175792,
      "step": 63310
    },
    {
      "epoch": 6.7166348398047955,
      "grad_norm": 0.8024938108565308,
      "learning_rate": 2.036785134884001e-05,
      "loss": 1.1041,
      "num_input_tokens_seen": 49810962544,
      "step": 63311
    },
    {
      "epoch": 6.7167409293443665,
      "grad_norm": 0.7440160357008838,
      "learning_rate": 2.0367168415438896e-05,
      "loss": 0.9698,
      "num_input_tokens_seen": 49811749312,
      "step": 63312
    },
    {
      "epoch": 6.716847018883938,
      "grad_norm": 0.6552248840207081,
      "learning_rate": 2.0366485485617895e-05,
      "loss": 0.9519,
      "num_input_tokens_seen": 49812536112,
      "step": 63313
    },
    {
      "epoch": 6.7169531084235095,
      "grad_norm": 0.7398088419650263,
      "learning_rate": 2.0365802559377532e-05,
      "loss": 1.1449,
      "num_input_tokens_seen": 49813322944,
      "step": 63314
    },
    {
      "epoch": 6.7170591979630805,
      "grad_norm": 0.7789565437208237,
      "learning_rate": 2.036511963671835e-05,
      "loss": 0.9863,
      "num_input_tokens_seen": 49814109792,
      "step": 63315
    },
    {
      "epoch": 6.717165287502652,
      "grad_norm": 1.015295460474748,
      "learning_rate": 2.0364436717640868e-05,
      "loss": 0.9866,
      "num_input_tokens_seen": 49814896544,
      "step": 63316
    },
    {
      "epoch": 6.717271377042223,
      "grad_norm": 0.9361576476435615,
      "learning_rate": 2.0363753802145606e-05,
      "loss": 1.0514,
      "num_input_tokens_seen": 49815683216,
      "step": 63317
    },
    {
      "epoch": 6.717377466581795,
      "grad_norm": 0.8483114579915618,
      "learning_rate": 2.0363070890233104e-05,
      "loss": 0.9158,
      "num_input_tokens_seen": 49816470016,
      "step": 63318
    },
    {
      "epoch": 6.717483556121366,
      "grad_norm": 0.6728511752740295,
      "learning_rate": 2.0362387981903887e-05,
      "loss": 0.9431,
      "num_input_tokens_seen": 49817256864,
      "step": 63319
    },
    {
      "epoch": 6.717589645660938,
      "grad_norm": 0.7591322902401955,
      "learning_rate": 2.0361705077158476e-05,
      "loss": 1.0353,
      "num_input_tokens_seen": 49818043696,
      "step": 63320
    },
    {
      "epoch": 6.717695735200509,
      "grad_norm": 0.6818059000463219,
      "learning_rate": 2.0361022175997408e-05,
      "loss": 0.9391,
      "num_input_tokens_seen": 49818830544,
      "step": 63321
    },
    {
      "epoch": 6.71780182474008,
      "grad_norm": 1.1469678129328602,
      "learning_rate": 2.0360339278421206e-05,
      "loss": 1.0691,
      "num_input_tokens_seen": 49819617376,
      "step": 63322
    },
    {
      "epoch": 6.717907914279652,
      "grad_norm": 0.7881230291292016,
      "learning_rate": 2.0359656384430393e-05,
      "loss": 0.8915,
      "num_input_tokens_seen": 49820404000,
      "step": 63323
    },
    {
      "epoch": 6.718014003819223,
      "grad_norm": 0.6887005369511011,
      "learning_rate": 2.0358973494025504e-05,
      "loss": 0.9529,
      "num_input_tokens_seen": 49821190784,
      "step": 63324
    },
    {
      "epoch": 6.718120093358795,
      "grad_norm": 0.8387400257490917,
      "learning_rate": 2.0358290607207058e-05,
      "loss": 0.94,
      "num_input_tokens_seen": 49821977520,
      "step": 63325
    },
    {
      "epoch": 6.718226182898366,
      "grad_norm": 0.7447411501100616,
      "learning_rate": 2.0357607723975596e-05,
      "loss": 0.9269,
      "num_input_tokens_seen": 49822764336,
      "step": 63326
    },
    {
      "epoch": 6.718332272437937,
      "grad_norm": 0.7584715380186694,
      "learning_rate": 2.0356924844331645e-05,
      "loss": 1.0422,
      "num_input_tokens_seen": 49823550992,
      "step": 63327
    },
    {
      "epoch": 6.718438361977509,
      "grad_norm": 0.744460531571663,
      "learning_rate": 2.035624196827571e-05,
      "loss": 1.0076,
      "num_input_tokens_seen": 49824337824,
      "step": 63328
    },
    {
      "epoch": 6.71854445151708,
      "grad_norm": 0.6654971228288052,
      "learning_rate": 2.0355559095808347e-05,
      "loss": 0.9472,
      "num_input_tokens_seen": 49825124560,
      "step": 63329
    },
    {
      "epoch": 6.718650541056652,
      "grad_norm": 0.7361892498728579,
      "learning_rate": 2.035487622693007e-05,
      "loss": 1.0577,
      "num_input_tokens_seen": 49825911376,
      "step": 63330
    },
    {
      "epoch": 6.718756630596223,
      "grad_norm": 0.7937767965449442,
      "learning_rate": 2.03541933616414e-05,
      "loss": 0.9751,
      "num_input_tokens_seen": 49826698128,
      "step": 63331
    },
    {
      "epoch": 6.718862720135794,
      "grad_norm": 0.707229836108965,
      "learning_rate": 2.0353510499942886e-05,
      "loss": 1.0235,
      "num_input_tokens_seen": 49827484832,
      "step": 63332
    },
    {
      "epoch": 6.718968809675366,
      "grad_norm": 0.9675810955183799,
      "learning_rate": 2.0352827641835038e-05,
      "loss": 0.9832,
      "num_input_tokens_seen": 49828271712,
      "step": 63333
    },
    {
      "epoch": 6.719074899214937,
      "grad_norm": 0.7417516827185985,
      "learning_rate": 2.035214478731838e-05,
      "loss": 1.0281,
      "num_input_tokens_seen": 49829058512,
      "step": 63334
    },
    {
      "epoch": 6.719180988754509,
      "grad_norm": 0.7701582928219822,
      "learning_rate": 2.0351461936393456e-05,
      "loss": 0.9695,
      "num_input_tokens_seen": 49829845328,
      "step": 63335
    },
    {
      "epoch": 6.71928707829408,
      "grad_norm": 0.773063939151641,
      "learning_rate": 2.0350779089060786e-05,
      "loss": 0.9478,
      "num_input_tokens_seen": 49830632144,
      "step": 63336
    },
    {
      "epoch": 6.719393167833651,
      "grad_norm": 0.8848216693097594,
      "learning_rate": 2.0350096245320893e-05,
      "loss": 1.0719,
      "num_input_tokens_seen": 49831418864,
      "step": 63337
    },
    {
      "epoch": 6.719499257373223,
      "grad_norm": 1.0094402929795374,
      "learning_rate": 2.0349413405174318e-05,
      "loss": 0.978,
      "num_input_tokens_seen": 49832205568,
      "step": 63338
    },
    {
      "epoch": 6.719605346912794,
      "grad_norm": 0.8667443568522814,
      "learning_rate": 2.0348730568621575e-05,
      "loss": 1.0078,
      "num_input_tokens_seen": 49832992416,
      "step": 63339
    },
    {
      "epoch": 6.719711436452366,
      "grad_norm": 0.678599203397094,
      "learning_rate": 2.034804773566319e-05,
      "loss": 1.0157,
      "num_input_tokens_seen": 49833779216,
      "step": 63340
    },
    {
      "epoch": 6.719817525991937,
      "grad_norm": 1.1437248790354582,
      "learning_rate": 2.0347364906299703e-05,
      "loss": 1.099,
      "num_input_tokens_seen": 49834565952,
      "step": 63341
    },
    {
      "epoch": 6.719923615531509,
      "grad_norm": 0.6849184140080776,
      "learning_rate": 2.0346682080531634e-05,
      "loss": 1.0582,
      "num_input_tokens_seen": 49835352784,
      "step": 63342
    },
    {
      "epoch": 6.72002970507108,
      "grad_norm": 0.8077069312554997,
      "learning_rate": 2.0345999258359515e-05,
      "loss": 0.9646,
      "num_input_tokens_seen": 49836139488,
      "step": 63343
    },
    {
      "epoch": 6.720135794610651,
      "grad_norm": 1.1519952436267078,
      "learning_rate": 2.0345316439783874e-05,
      "loss": 0.9772,
      "num_input_tokens_seen": 49836926240,
      "step": 63344
    },
    {
      "epoch": 6.720241884150223,
      "grad_norm": 0.7551606951871739,
      "learning_rate": 2.034463362480523e-05,
      "loss": 1.0004,
      "num_input_tokens_seen": 49837712928,
      "step": 63345
    },
    {
      "epoch": 6.720347973689794,
      "grad_norm": 0.8328245434250824,
      "learning_rate": 2.034395081342412e-05,
      "loss": 0.9546,
      "num_input_tokens_seen": 49838499680,
      "step": 63346
    },
    {
      "epoch": 6.720454063229366,
      "grad_norm": 0.8259110357157728,
      "learning_rate": 2.0343268005641068e-05,
      "loss": 1.1134,
      "num_input_tokens_seen": 49839286400,
      "step": 63347
    },
    {
      "epoch": 6.720560152768937,
      "grad_norm": 0.7361684701632764,
      "learning_rate": 2.0342585201456598e-05,
      "loss": 1.0145,
      "num_input_tokens_seen": 49840073152,
      "step": 63348
    },
    {
      "epoch": 6.720666242308509,
      "grad_norm": 0.6737098515894874,
      "learning_rate": 2.0341902400871246e-05,
      "loss": 1.0059,
      "num_input_tokens_seen": 49840859824,
      "step": 63349
    },
    {
      "epoch": 6.72077233184808,
      "grad_norm": 0.7619095299926868,
      "learning_rate": 2.0341219603885536e-05,
      "loss": 1.0569,
      "num_input_tokens_seen": 49841646560,
      "step": 63350
    },
    {
      "epoch": 6.720878421387651,
      "grad_norm": 0.8818225079037241,
      "learning_rate": 2.0340536810499987e-05,
      "loss": 1.0111,
      "num_input_tokens_seen": 49842433392,
      "step": 63351
    },
    {
      "epoch": 6.720984510927223,
      "grad_norm": 0.7526449262962666,
      "learning_rate": 2.0339854020715142e-05,
      "loss": 0.9342,
      "num_input_tokens_seen": 49843220192,
      "step": 63352
    },
    {
      "epoch": 6.721090600466794,
      "grad_norm": 0.8159993995917902,
      "learning_rate": 2.0339171234531525e-05,
      "loss": 1.0394,
      "num_input_tokens_seen": 49844006880,
      "step": 63353
    },
    {
      "epoch": 6.721196690006366,
      "grad_norm": 0.7123431034585277,
      "learning_rate": 2.0338488451949647e-05,
      "loss": 1.0267,
      "num_input_tokens_seen": 49844793664,
      "step": 63354
    },
    {
      "epoch": 6.721302779545937,
      "grad_norm": 0.7690470353221018,
      "learning_rate": 2.0337805672970056e-05,
      "loss": 1.1098,
      "num_input_tokens_seen": 49845580400,
      "step": 63355
    },
    {
      "epoch": 6.721408869085508,
      "grad_norm": 0.7262454213594577,
      "learning_rate": 2.0337122897593268e-05,
      "loss": 0.9472,
      "num_input_tokens_seen": 49846367168,
      "step": 63356
    },
    {
      "epoch": 6.72151495862508,
      "grad_norm": 0.7454565634806516,
      "learning_rate": 2.033644012581982e-05,
      "loss": 0.9133,
      "num_input_tokens_seen": 49847153984,
      "step": 63357
    },
    {
      "epoch": 6.721621048164651,
      "grad_norm": 0.7347817964603263,
      "learning_rate": 2.0335757357650235e-05,
      "loss": 1.013,
      "num_input_tokens_seen": 49847940672,
      "step": 63358
    },
    {
      "epoch": 6.721727137704223,
      "grad_norm": 0.7798833225165498,
      "learning_rate": 2.0335074593085033e-05,
      "loss": 0.9932,
      "num_input_tokens_seen": 49848727376,
      "step": 63359
    },
    {
      "epoch": 6.721833227243794,
      "grad_norm": 0.7337661031361316,
      "learning_rate": 2.0334391832124752e-05,
      "loss": 1.024,
      "num_input_tokens_seen": 49849514208,
      "step": 63360
    },
    {
      "epoch": 6.721939316783365,
      "grad_norm": 0.7101669928304907,
      "learning_rate": 2.033370907476992e-05,
      "loss": 0.9725,
      "num_input_tokens_seen": 49850300944,
      "step": 63361
    },
    {
      "epoch": 6.722045406322937,
      "grad_norm": 0.7595632968099519,
      "learning_rate": 2.0333026321021053e-05,
      "loss": 0.9607,
      "num_input_tokens_seen": 49851087776,
      "step": 63362
    },
    {
      "epoch": 6.722151495862508,
      "grad_norm": 0.6712549679556108,
      "learning_rate": 2.033234357087869e-05,
      "loss": 0.9834,
      "num_input_tokens_seen": 49851874544,
      "step": 63363
    },
    {
      "epoch": 6.72225758540208,
      "grad_norm": 0.7393375401563232,
      "learning_rate": 2.0331660824343358e-05,
      "loss": 0.9819,
      "num_input_tokens_seen": 49852661200,
      "step": 63364
    },
    {
      "epoch": 6.722363674941651,
      "grad_norm": 0.7572805288088245,
      "learning_rate": 2.0330978081415576e-05,
      "loss": 1.0675,
      "num_input_tokens_seen": 49853447920,
      "step": 63365
    },
    {
      "epoch": 6.722469764481222,
      "grad_norm": 0.725982181454581,
      "learning_rate": 2.0330295342095883e-05,
      "loss": 1.0106,
      "num_input_tokens_seen": 49854234704,
      "step": 63366
    },
    {
      "epoch": 6.722575854020794,
      "grad_norm": 0.7299794913417671,
      "learning_rate": 2.0329612606384797e-05,
      "loss": 0.9867,
      "num_input_tokens_seen": 49855021472,
      "step": 63367
    },
    {
      "epoch": 6.722681943560365,
      "grad_norm": 0.6799851399135575,
      "learning_rate": 2.0328929874282848e-05,
      "loss": 1.0139,
      "num_input_tokens_seen": 49855808224,
      "step": 63368
    },
    {
      "epoch": 6.7227880330999366,
      "grad_norm": 0.7446246693072153,
      "learning_rate": 2.032824714579057e-05,
      "loss": 1.0141,
      "num_input_tokens_seen": 49856595008,
      "step": 63369
    },
    {
      "epoch": 6.722894122639508,
      "grad_norm": 0.9210851858638628,
      "learning_rate": 2.0327564420908483e-05,
      "loss": 1.0259,
      "num_input_tokens_seen": 49857381744,
      "step": 63370
    },
    {
      "epoch": 6.7230002121790795,
      "grad_norm": 0.7079242327856387,
      "learning_rate": 2.0326881699637114e-05,
      "loss": 1.0107,
      "num_input_tokens_seen": 49858168544,
      "step": 63371
    },
    {
      "epoch": 6.7231063017186505,
      "grad_norm": 0.6930608295300689,
      "learning_rate": 2.0326198981976995e-05,
      "loss": 0.9404,
      "num_input_tokens_seen": 49858955312,
      "step": 63372
    },
    {
      "epoch": 6.723212391258222,
      "grad_norm": 0.7837529552735627,
      "learning_rate": 2.032551626792865e-05,
      "loss": 0.9627,
      "num_input_tokens_seen": 49859742096,
      "step": 63373
    },
    {
      "epoch": 6.7233184807977935,
      "grad_norm": 0.808154783941875,
      "learning_rate": 2.0324833557492616e-05,
      "loss": 1.0242,
      "num_input_tokens_seen": 49860528880,
      "step": 63374
    },
    {
      "epoch": 6.7234245703373645,
      "grad_norm": 0.6702841783153967,
      "learning_rate": 2.0324150850669413e-05,
      "loss": 1.0033,
      "num_input_tokens_seen": 49861315616,
      "step": 63375
    },
    {
      "epoch": 6.723530659876936,
      "grad_norm": 0.8655759988080217,
      "learning_rate": 2.032346814745956e-05,
      "loss": 1.0109,
      "num_input_tokens_seen": 49862102368,
      "step": 63376
    },
    {
      "epoch": 6.7236367494165075,
      "grad_norm": 0.709726147106661,
      "learning_rate": 2.0322785447863602e-05,
      "loss": 1.0437,
      "num_input_tokens_seen": 49862889120,
      "step": 63377
    },
    {
      "epoch": 6.723742838956079,
      "grad_norm": 0.9668879603497875,
      "learning_rate": 2.032210275188206e-05,
      "loss": 0.9899,
      "num_input_tokens_seen": 49863675920,
      "step": 63378
    },
    {
      "epoch": 6.72384892849565,
      "grad_norm": 0.8886935588517553,
      "learning_rate": 2.0321420059515452e-05,
      "loss": 1.0262,
      "num_input_tokens_seen": 49864462672,
      "step": 63379
    },
    {
      "epoch": 6.723955018035221,
      "grad_norm": 0.9429314115463391,
      "learning_rate": 2.0320737370764317e-05,
      "loss": 1.0042,
      "num_input_tokens_seen": 49865249456,
      "step": 63380
    },
    {
      "epoch": 6.724061107574793,
      "grad_norm": 0.8517349432271996,
      "learning_rate": 2.0320054685629182e-05,
      "loss": 1.0388,
      "num_input_tokens_seen": 49866036256,
      "step": 63381
    },
    {
      "epoch": 6.724167197114364,
      "grad_norm": 0.7222436303999517,
      "learning_rate": 2.0319372004110564e-05,
      "loss": 0.9676,
      "num_input_tokens_seen": 49866823088,
      "step": 63382
    },
    {
      "epoch": 6.724273286653936,
      "grad_norm": 0.9573836657481279,
      "learning_rate": 2.0318689326209002e-05,
      "loss": 0.9937,
      "num_input_tokens_seen": 49867609872,
      "step": 63383
    },
    {
      "epoch": 6.724379376193507,
      "grad_norm": 0.8085162674370187,
      "learning_rate": 2.031800665192502e-05,
      "loss": 1.0078,
      "num_input_tokens_seen": 49868396624,
      "step": 63384
    },
    {
      "epoch": 6.724485465733078,
      "grad_norm": 0.8396927573428014,
      "learning_rate": 2.0317323981259144e-05,
      "loss": 0.9684,
      "num_input_tokens_seen": 49869183424,
      "step": 63385
    },
    {
      "epoch": 6.72459155527265,
      "grad_norm": 0.7738607462379092,
      "learning_rate": 2.0316641314211903e-05,
      "loss": 0.8745,
      "num_input_tokens_seen": 49869970192,
      "step": 63386
    },
    {
      "epoch": 6.724697644812221,
      "grad_norm": 0.8699757343997159,
      "learning_rate": 2.0315958650783828e-05,
      "loss": 0.9383,
      "num_input_tokens_seen": 49870757024,
      "step": 63387
    },
    {
      "epoch": 6.724803734351793,
      "grad_norm": 1.1867597239044039,
      "learning_rate": 2.0315275990975436e-05,
      "loss": 1.0052,
      "num_input_tokens_seen": 49871543760,
      "step": 63388
    },
    {
      "epoch": 6.724909823891364,
      "grad_norm": 1.2095024516937718,
      "learning_rate": 2.0314593334787266e-05,
      "loss": 0.9362,
      "num_input_tokens_seen": 49872330512,
      "step": 63389
    },
    {
      "epoch": 6.725015913430935,
      "grad_norm": 0.8369205711766743,
      "learning_rate": 2.0313910682219834e-05,
      "loss": 1.0552,
      "num_input_tokens_seen": 49873117312,
      "step": 63390
    },
    {
      "epoch": 6.725122002970507,
      "grad_norm": 0.771653977154301,
      "learning_rate": 2.031322803327368e-05,
      "loss": 0.9531,
      "num_input_tokens_seen": 49873904048,
      "step": 63391
    },
    {
      "epoch": 6.725228092510078,
      "grad_norm": 1.214411152285242,
      "learning_rate": 2.031254538794933e-05,
      "loss": 1.0446,
      "num_input_tokens_seen": 49874690864,
      "step": 63392
    },
    {
      "epoch": 6.72533418204965,
      "grad_norm": 0.9631676023479256,
      "learning_rate": 2.03118627462473e-05,
      "loss": 0.9988,
      "num_input_tokens_seen": 49875477648,
      "step": 63393
    },
    {
      "epoch": 6.725440271589221,
      "grad_norm": 0.7789377906794839,
      "learning_rate": 2.0311180108168125e-05,
      "loss": 0.9555,
      "num_input_tokens_seen": 49876264384,
      "step": 63394
    },
    {
      "epoch": 6.725546361128792,
      "grad_norm": 0.9608404411704093,
      "learning_rate": 2.031049747371234e-05,
      "loss": 1.0666,
      "num_input_tokens_seen": 49877051104,
      "step": 63395
    },
    {
      "epoch": 6.725652450668364,
      "grad_norm": 1.1716612105084032,
      "learning_rate": 2.0309814842880458e-05,
      "loss": 0.9912,
      "num_input_tokens_seen": 49877837872,
      "step": 63396
    },
    {
      "epoch": 6.725758540207935,
      "grad_norm": 0.9140600599009683,
      "learning_rate": 2.0309132215673016e-05,
      "loss": 1.0197,
      "num_input_tokens_seen": 49878624688,
      "step": 63397
    },
    {
      "epoch": 6.725864629747507,
      "grad_norm": 0.9389804463075951,
      "learning_rate": 2.030844959209054e-05,
      "loss": 0.9561,
      "num_input_tokens_seen": 49879411472,
      "step": 63398
    },
    {
      "epoch": 6.725970719287078,
      "grad_norm": 1.0110751079069968,
      "learning_rate": 2.0307766972133553e-05,
      "loss": 1.0185,
      "num_input_tokens_seen": 49880198208,
      "step": 63399
    },
    {
      "epoch": 6.72607680882665,
      "grad_norm": 0.7949299939141033,
      "learning_rate": 2.030708435580259e-05,
      "loss": 1.0547,
      "num_input_tokens_seen": 49880984976,
      "step": 63400
    },
    {
      "epoch": 6.726182898366221,
      "grad_norm": 0.8208416310119973,
      "learning_rate": 2.030640174309817e-05,
      "loss": 0.9953,
      "num_input_tokens_seen": 49881771792,
      "step": 63401
    },
    {
      "epoch": 6.726288987905792,
      "grad_norm": 0.7935629448386602,
      "learning_rate": 2.0305719134020826e-05,
      "loss": 0.9858,
      "num_input_tokens_seen": 49882558560,
      "step": 63402
    },
    {
      "epoch": 6.726395077445364,
      "grad_norm": 0.8327061234797737,
      "learning_rate": 2.0305036528571085e-05,
      "loss": 0.9917,
      "num_input_tokens_seen": 49883345296,
      "step": 63403
    },
    {
      "epoch": 6.726501166984935,
      "grad_norm": 0.7385015062765876,
      "learning_rate": 2.030435392674948e-05,
      "loss": 0.9384,
      "num_input_tokens_seen": 49884132080,
      "step": 63404
    },
    {
      "epoch": 6.726607256524507,
      "grad_norm": 0.8798987233563236,
      "learning_rate": 2.0303671328556522e-05,
      "loss": 1.0269,
      "num_input_tokens_seen": 49884918800,
      "step": 63405
    },
    {
      "epoch": 6.726713346064078,
      "grad_norm": 0.8480718169725755,
      "learning_rate": 2.0302988733992757e-05,
      "loss": 0.9642,
      "num_input_tokens_seen": 49885705488,
      "step": 63406
    },
    {
      "epoch": 6.72681943560365,
      "grad_norm": 0.8091690607530694,
      "learning_rate": 2.0302306143058698e-05,
      "loss": 1.0347,
      "num_input_tokens_seen": 49886492256,
      "step": 63407
    },
    {
      "epoch": 6.726925525143221,
      "grad_norm": 0.6831239475440624,
      "learning_rate": 2.0301623555754887e-05,
      "loss": 0.8997,
      "num_input_tokens_seen": 49887279056,
      "step": 63408
    },
    {
      "epoch": 6.727031614682792,
      "grad_norm": 0.7896151540229378,
      "learning_rate": 2.030094097208183e-05,
      "loss": 0.9935,
      "num_input_tokens_seen": 49888065872,
      "step": 63409
    },
    {
      "epoch": 6.727137704222364,
      "grad_norm": 0.775454219974607,
      "learning_rate": 2.0300258392040077e-05,
      "loss": 0.9965,
      "num_input_tokens_seen": 49888852544,
      "step": 63410
    },
    {
      "epoch": 6.727243793761935,
      "grad_norm": 0.8283171515171943,
      "learning_rate": 2.0299575815630146e-05,
      "loss": 1.0488,
      "num_input_tokens_seen": 49889639296,
      "step": 63411
    },
    {
      "epoch": 6.727349883301507,
      "grad_norm": 0.854655334420782,
      "learning_rate": 2.029889324285257e-05,
      "loss": 1.0866,
      "num_input_tokens_seen": 49890426000,
      "step": 63412
    },
    {
      "epoch": 6.727455972841078,
      "grad_norm": 1.2498963668257463,
      "learning_rate": 2.0298210673707864e-05,
      "loss": 0.9701,
      "num_input_tokens_seen": 49891212768,
      "step": 63413
    },
    {
      "epoch": 6.727562062380649,
      "grad_norm": 0.7382993227883548,
      "learning_rate": 2.0297528108196563e-05,
      "loss": 1.0106,
      "num_input_tokens_seen": 49891999680,
      "step": 63414
    },
    {
      "epoch": 6.727668151920221,
      "grad_norm": 0.8574400612304768,
      "learning_rate": 2.02968455463192e-05,
      "loss": 1.1314,
      "num_input_tokens_seen": 49892786336,
      "step": 63415
    },
    {
      "epoch": 6.727774241459792,
      "grad_norm": 1.1219135173783912,
      "learning_rate": 2.0296162988076296e-05,
      "loss": 1.0152,
      "num_input_tokens_seen": 49893573104,
      "step": 63416
    },
    {
      "epoch": 6.727880330999364,
      "grad_norm": 0.7570742767712811,
      "learning_rate": 2.0295480433468373e-05,
      "loss": 1.0282,
      "num_input_tokens_seen": 49894359920,
      "step": 63417
    },
    {
      "epoch": 6.727986420538935,
      "grad_norm": 0.7149325271464063,
      "learning_rate": 2.0294797882495973e-05,
      "loss": 0.9937,
      "num_input_tokens_seen": 49895146656,
      "step": 63418
    },
    {
      "epoch": 6.728092510078506,
      "grad_norm": 0.7500496803154959,
      "learning_rate": 2.029411533515961e-05,
      "loss": 0.9966,
      "num_input_tokens_seen": 49895933488,
      "step": 63419
    },
    {
      "epoch": 6.728198599618078,
      "grad_norm": 0.6517517704054266,
      "learning_rate": 2.0293432791459816e-05,
      "loss": 0.9109,
      "num_input_tokens_seen": 49896720336,
      "step": 63420
    },
    {
      "epoch": 6.728304689157649,
      "grad_norm": 0.7393851888736401,
      "learning_rate": 2.0292750251397122e-05,
      "loss": 1.0019,
      "num_input_tokens_seen": 49897507088,
      "step": 63421
    },
    {
      "epoch": 6.728410778697221,
      "grad_norm": 0.7350860762826845,
      "learning_rate": 2.0292067714972052e-05,
      "loss": 0.9559,
      "num_input_tokens_seen": 49898293888,
      "step": 63422
    },
    {
      "epoch": 6.728516868236792,
      "grad_norm": 0.7542560964530886,
      "learning_rate": 2.029138518218513e-05,
      "loss": 1.0552,
      "num_input_tokens_seen": 49899080656,
      "step": 63423
    },
    {
      "epoch": 6.728622957776363,
      "grad_norm": 0.7791296669586337,
      "learning_rate": 2.029070265303689e-05,
      "loss": 0.9613,
      "num_input_tokens_seen": 49899867408,
      "step": 63424
    },
    {
      "epoch": 6.728729047315935,
      "grad_norm": 0.6536746024892945,
      "learning_rate": 2.0290020127527863e-05,
      "loss": 0.9445,
      "num_input_tokens_seen": 49900654208,
      "step": 63425
    },
    {
      "epoch": 6.728835136855506,
      "grad_norm": 0.7620078632034556,
      "learning_rate": 2.028933760565856e-05,
      "loss": 1.0393,
      "num_input_tokens_seen": 49901440928,
      "step": 63426
    },
    {
      "epoch": 6.728941226395078,
      "grad_norm": 1.0886402688156784,
      "learning_rate": 2.0288655087429526e-05,
      "loss": 1.0084,
      "num_input_tokens_seen": 49902227856,
      "step": 63427
    },
    {
      "epoch": 6.729047315934649,
      "grad_norm": 0.8271004912126491,
      "learning_rate": 2.0287972572841274e-05,
      "loss": 0.9462,
      "num_input_tokens_seen": 49903014624,
      "step": 63428
    },
    {
      "epoch": 6.729153405474221,
      "grad_norm": 0.7512998976958642,
      "learning_rate": 2.028729006189434e-05,
      "loss": 1.031,
      "num_input_tokens_seen": 49903801408,
      "step": 63429
    },
    {
      "epoch": 6.729259495013792,
      "grad_norm": 1.0028147606115867,
      "learning_rate": 2.028660755458926e-05,
      "loss": 1.0312,
      "num_input_tokens_seen": 49904588160,
      "step": 63430
    },
    {
      "epoch": 6.7293655845533635,
      "grad_norm": 0.7572551289413598,
      "learning_rate": 2.028592505092654e-05,
      "loss": 0.949,
      "num_input_tokens_seen": 49905375040,
      "step": 63431
    },
    {
      "epoch": 6.729471674092935,
      "grad_norm": 0.8578545788181301,
      "learning_rate": 2.0285242550906724e-05,
      "loss": 0.9672,
      "num_input_tokens_seen": 49906161808,
      "step": 63432
    },
    {
      "epoch": 6.729577763632506,
      "grad_norm": 1.236412591281012,
      "learning_rate": 2.0284560054530334e-05,
      "loss": 1.0655,
      "num_input_tokens_seen": 49906948528,
      "step": 63433
    },
    {
      "epoch": 6.7296838531720775,
      "grad_norm": 1.0108078961288511,
      "learning_rate": 2.0283877561797897e-05,
      "loss": 1.0125,
      "num_input_tokens_seen": 49907735216,
      "step": 63434
    },
    {
      "epoch": 6.7297899427116485,
      "grad_norm": 0.8517840376709862,
      "learning_rate": 2.028319507270994e-05,
      "loss": 1.0221,
      "num_input_tokens_seen": 49908522096,
      "step": 63435
    },
    {
      "epoch": 6.7298960322512205,
      "grad_norm": 1.3725439652338913,
      "learning_rate": 2.0282512587266994e-05,
      "loss": 0.9785,
      "num_input_tokens_seen": 49909308880,
      "step": 63436
    },
    {
      "epoch": 6.7300021217907915,
      "grad_norm": 1.3012122683214988,
      "learning_rate": 2.028183010546958e-05,
      "loss": 1.0342,
      "num_input_tokens_seen": 49910095632,
      "step": 63437
    },
    {
      "epoch": 6.7301082113303625,
      "grad_norm": 0.6662786618422103,
      "learning_rate": 2.0281147627318232e-05,
      "loss": 0.999,
      "num_input_tokens_seen": 49910882384,
      "step": 63438
    },
    {
      "epoch": 6.730214300869934,
      "grad_norm": 0.9782588318754103,
      "learning_rate": 2.0280465152813476e-05,
      "loss": 0.998,
      "num_input_tokens_seen": 49911669120,
      "step": 63439
    },
    {
      "epoch": 6.7303203904095055,
      "grad_norm": 1.2796338345605467,
      "learning_rate": 2.0279782681955834e-05,
      "loss": 1.0142,
      "num_input_tokens_seen": 49912455808,
      "step": 63440
    },
    {
      "epoch": 6.730426479949077,
      "grad_norm": 0.7464196861250836,
      "learning_rate": 2.0279100214745838e-05,
      "loss": 0.9591,
      "num_input_tokens_seen": 49913242688,
      "step": 63441
    },
    {
      "epoch": 6.730532569488648,
      "grad_norm": 0.7107758764391416,
      "learning_rate": 2.027841775118402e-05,
      "loss": 1.0083,
      "num_input_tokens_seen": 49914029440,
      "step": 63442
    },
    {
      "epoch": 6.7306386590282195,
      "grad_norm": 0.9549379510423697,
      "learning_rate": 2.0277735291270893e-05,
      "loss": 0.9186,
      "num_input_tokens_seen": 49914816224,
      "step": 63443
    },
    {
      "epoch": 6.730744748567791,
      "grad_norm": 0.7885871847718651,
      "learning_rate": 2.0277052835007005e-05,
      "loss": 0.9835,
      "num_input_tokens_seen": 49915603008,
      "step": 63444
    },
    {
      "epoch": 6.730850838107362,
      "grad_norm": 0.8214548514581975,
      "learning_rate": 2.027637038239286e-05,
      "loss": 1.0201,
      "num_input_tokens_seen": 49916389728,
      "step": 63445
    },
    {
      "epoch": 6.730956927646934,
      "grad_norm": 0.8210131748113721,
      "learning_rate": 2.0275687933429004e-05,
      "loss": 0.9898,
      "num_input_tokens_seen": 49917176480,
      "step": 63446
    },
    {
      "epoch": 6.731063017186505,
      "grad_norm": 0.8490696179032287,
      "learning_rate": 2.027500548811596e-05,
      "loss": 1.0219,
      "num_input_tokens_seen": 49917963184,
      "step": 63447
    },
    {
      "epoch": 6.731169106726076,
      "grad_norm": 0.9954778888419242,
      "learning_rate": 2.027432304645425e-05,
      "loss": 1.0263,
      "num_input_tokens_seen": 49918749936,
      "step": 63448
    },
    {
      "epoch": 6.731275196265648,
      "grad_norm": 1.1506896017189912,
      "learning_rate": 2.0273640608444404e-05,
      "loss": 1.097,
      "num_input_tokens_seen": 49919536688,
      "step": 63449
    },
    {
      "epoch": 6.731381285805219,
      "grad_norm": 0.8941506148978177,
      "learning_rate": 2.0272958174086954e-05,
      "loss": 1.0127,
      "num_input_tokens_seen": 49920323472,
      "step": 63450
    },
    {
      "epoch": 6.731487375344791,
      "grad_norm": 1.2045880035587317,
      "learning_rate": 2.0272275743382417e-05,
      "loss": 1.0356,
      "num_input_tokens_seen": 49921110192,
      "step": 63451
    },
    {
      "epoch": 6.731593464884362,
      "grad_norm": 1.0195757745428984,
      "learning_rate": 2.027159331633133e-05,
      "loss": 1.0435,
      "num_input_tokens_seen": 49921897008,
      "step": 63452
    },
    {
      "epoch": 6.731699554423933,
      "grad_norm": 0.7671675515814502,
      "learning_rate": 2.027091089293422e-05,
      "loss": 1.0418,
      "num_input_tokens_seen": 49922683696,
      "step": 63453
    },
    {
      "epoch": 6.731805643963505,
      "grad_norm": 1.179874530465005,
      "learning_rate": 2.0270228473191606e-05,
      "loss": 1.0556,
      "num_input_tokens_seen": 49923470496,
      "step": 63454
    },
    {
      "epoch": 6.731911733503076,
      "grad_norm": 0.8252156442777533,
      "learning_rate": 2.0269546057104023e-05,
      "loss": 0.9663,
      "num_input_tokens_seen": 49924257408,
      "step": 63455
    },
    {
      "epoch": 6.732017823042648,
      "grad_norm": 0.8809204387389176,
      "learning_rate": 2.0268863644671996e-05,
      "loss": 0.9741,
      "num_input_tokens_seen": 49925044208,
      "step": 63456
    },
    {
      "epoch": 6.732123912582219,
      "grad_norm": 0.8760968400338154,
      "learning_rate": 2.026818123589605e-05,
      "loss": 0.9842,
      "num_input_tokens_seen": 49925830960,
      "step": 63457
    },
    {
      "epoch": 6.732230002121791,
      "grad_norm": 0.9971152039411056,
      "learning_rate": 2.0267498830776715e-05,
      "loss": 1.0379,
      "num_input_tokens_seen": 49926617696,
      "step": 63458
    },
    {
      "epoch": 6.732336091661362,
      "grad_norm": 0.8133864920541911,
      "learning_rate": 2.0266816429314517e-05,
      "loss": 0.9972,
      "num_input_tokens_seen": 49927404400,
      "step": 63459
    },
    {
      "epoch": 6.732442181200934,
      "grad_norm": 1.031333460017917,
      "learning_rate": 2.026613403150999e-05,
      "loss": 1.0559,
      "num_input_tokens_seen": 49928191184,
      "step": 63460
    },
    {
      "epoch": 6.732548270740505,
      "grad_norm": 0.8261793863960356,
      "learning_rate": 2.0265451637363653e-05,
      "loss": 1.0091,
      "num_input_tokens_seen": 49928977904,
      "step": 63461
    },
    {
      "epoch": 6.732654360280076,
      "grad_norm": 0.7643165025548463,
      "learning_rate": 2.0264769246876034e-05,
      "loss": 0.9255,
      "num_input_tokens_seen": 49929764672,
      "step": 63462
    },
    {
      "epoch": 6.732760449819648,
      "grad_norm": 0.8922715926590563,
      "learning_rate": 2.0264086860047666e-05,
      "loss": 1.0302,
      "num_input_tokens_seen": 49930551408,
      "step": 63463
    },
    {
      "epoch": 6.732866539359219,
      "grad_norm": 0.8476312686821502,
      "learning_rate": 2.0263404476879072e-05,
      "loss": 1.0605,
      "num_input_tokens_seen": 49931338224,
      "step": 63464
    },
    {
      "epoch": 6.732972628898791,
      "grad_norm": 0.9730235687938239,
      "learning_rate": 2.0262722097370776e-05,
      "loss": 1.0215,
      "num_input_tokens_seen": 49932124976,
      "step": 63465
    },
    {
      "epoch": 6.733078718438362,
      "grad_norm": 0.8137214443249852,
      "learning_rate": 2.0262039721523312e-05,
      "loss": 0.9287,
      "num_input_tokens_seen": 49932911776,
      "step": 63466
    },
    {
      "epoch": 6.733184807977933,
      "grad_norm": 1.7125885908281204,
      "learning_rate": 2.026135734933721e-05,
      "loss": 0.9451,
      "num_input_tokens_seen": 49933698480,
      "step": 63467
    },
    {
      "epoch": 6.733290897517505,
      "grad_norm": 0.7010016448412532,
      "learning_rate": 2.026067498081298e-05,
      "loss": 1.0046,
      "num_input_tokens_seen": 49934485296,
      "step": 63468
    },
    {
      "epoch": 6.733396987057076,
      "grad_norm": 0.7718695595223481,
      "learning_rate": 2.0259992615951172e-05,
      "loss": 0.9744,
      "num_input_tokens_seen": 49935272016,
      "step": 63469
    },
    {
      "epoch": 6.733503076596648,
      "grad_norm": 0.8525296981788821,
      "learning_rate": 2.02593102547523e-05,
      "loss": 1.0225,
      "num_input_tokens_seen": 49936058752,
      "step": 63470
    },
    {
      "epoch": 6.733609166136219,
      "grad_norm": 0.7504319555859973,
      "learning_rate": 2.0258627897216888e-05,
      "loss": 1.0146,
      "num_input_tokens_seen": 49936845456,
      "step": 63471
    },
    {
      "epoch": 6.73371525567579,
      "grad_norm": 0.7654012526065802,
      "learning_rate": 2.0257945543345477e-05,
      "loss": 1.0247,
      "num_input_tokens_seen": 49937632144,
      "step": 63472
    },
    {
      "epoch": 6.733821345215362,
      "grad_norm": 0.8027126674583265,
      "learning_rate": 2.0257263193138588e-05,
      "loss": 1.0445,
      "num_input_tokens_seen": 49938418976,
      "step": 63473
    },
    {
      "epoch": 6.733927434754933,
      "grad_norm": 0.7807600328839511,
      "learning_rate": 2.0256580846596736e-05,
      "loss": 1.048,
      "num_input_tokens_seen": 49939205776,
      "step": 63474
    },
    {
      "epoch": 6.734033524294505,
      "grad_norm": 0.7085172985495083,
      "learning_rate": 2.025589850372047e-05,
      "loss": 0.942,
      "num_input_tokens_seen": 49939992528,
      "step": 63475
    },
    {
      "epoch": 6.734139613834076,
      "grad_norm": 0.7945153939658469,
      "learning_rate": 2.0255216164510298e-05,
      "loss": 0.9722,
      "num_input_tokens_seen": 49940779312,
      "step": 63476
    },
    {
      "epoch": 6.734245703373647,
      "grad_norm": 0.7814743071901248,
      "learning_rate": 2.025453382896676e-05,
      "loss": 1.0197,
      "num_input_tokens_seen": 49941565984,
      "step": 63477
    },
    {
      "epoch": 6.734351792913219,
      "grad_norm": 0.723793008849245,
      "learning_rate": 2.025385149709038e-05,
      "loss": 0.9324,
      "num_input_tokens_seen": 49942352688,
      "step": 63478
    },
    {
      "epoch": 6.73445788245279,
      "grad_norm": 0.9605523277353255,
      "learning_rate": 2.025316916888168e-05,
      "loss": 1.041,
      "num_input_tokens_seen": 49943139472,
      "step": 63479
    },
    {
      "epoch": 6.734563971992362,
      "grad_norm": 0.7310994536420737,
      "learning_rate": 2.0252486844341197e-05,
      "loss": 1.0772,
      "num_input_tokens_seen": 49943926272,
      "step": 63480
    },
    {
      "epoch": 6.734670061531933,
      "grad_norm": 0.8318317837236038,
      "learning_rate": 2.0251804523469454e-05,
      "loss": 1.0183,
      "num_input_tokens_seen": 49944712976,
      "step": 63481
    },
    {
      "epoch": 6.734776151071505,
      "grad_norm": 0.7320550467872475,
      "learning_rate": 2.025112220626697e-05,
      "loss": 0.9895,
      "num_input_tokens_seen": 49945499728,
      "step": 63482
    },
    {
      "epoch": 6.734882240611076,
      "grad_norm": 0.8459385184727825,
      "learning_rate": 2.0250439892734286e-05,
      "loss": 1.0627,
      "num_input_tokens_seen": 49946286400,
      "step": 63483
    },
    {
      "epoch": 6.734988330150647,
      "grad_norm": 0.7372688375143811,
      "learning_rate": 2.024975758287192e-05,
      "loss": 0.9815,
      "num_input_tokens_seen": 49947073200,
      "step": 63484
    },
    {
      "epoch": 6.735094419690219,
      "grad_norm": 0.8768772678250119,
      "learning_rate": 2.02490752766804e-05,
      "loss": 0.9875,
      "num_input_tokens_seen": 49947859888,
      "step": 63485
    },
    {
      "epoch": 6.73520050922979,
      "grad_norm": 0.7150048137295594,
      "learning_rate": 2.024839297416026e-05,
      "loss": 1.0758,
      "num_input_tokens_seen": 49948646608,
      "step": 63486
    },
    {
      "epoch": 6.735306598769362,
      "grad_norm": 0.6792809542377097,
      "learning_rate": 2.0247710675312016e-05,
      "loss": 0.9808,
      "num_input_tokens_seen": 49949433360,
      "step": 63487
    },
    {
      "epoch": 6.735412688308933,
      "grad_norm": 0.6283990294474322,
      "learning_rate": 2.0247028380136204e-05,
      "loss": 0.9113,
      "num_input_tokens_seen": 49950220192,
      "step": 63488
    },
    {
      "epoch": 6.735518777848505,
      "grad_norm": 1.2414840312039659,
      "learning_rate": 2.024634608863335e-05,
      "loss": 1.1222,
      "num_input_tokens_seen": 49951006816,
      "step": 63489
    },
    {
      "epoch": 6.735624867388076,
      "grad_norm": 0.8387101351621391,
      "learning_rate": 2.0245663800803983e-05,
      "loss": 1.011,
      "num_input_tokens_seen": 49951793568,
      "step": 63490
    },
    {
      "epoch": 6.735730956927647,
      "grad_norm": 0.828647495496149,
      "learning_rate": 2.0244981516648622e-05,
      "loss": 1.0463,
      "num_input_tokens_seen": 49952580352,
      "step": 63491
    },
    {
      "epoch": 6.735837046467219,
      "grad_norm": 1.4796921559827225,
      "learning_rate": 2.0244299236167804e-05,
      "loss": 1.0652,
      "num_input_tokens_seen": 49953367072,
      "step": 63492
    },
    {
      "epoch": 6.73594313600679,
      "grad_norm": 1.1506499257167901,
      "learning_rate": 2.024361695936205e-05,
      "loss": 1.0128,
      "num_input_tokens_seen": 49954153856,
      "step": 63493
    },
    {
      "epoch": 6.7360492255463615,
      "grad_norm": 0.892446233608871,
      "learning_rate": 2.024293468623189e-05,
      "loss": 0.9093,
      "num_input_tokens_seen": 49954940560,
      "step": 63494
    },
    {
      "epoch": 6.736155315085933,
      "grad_norm": 1.146354656968787,
      "learning_rate": 2.0242252416777852e-05,
      "loss": 0.9985,
      "num_input_tokens_seen": 49955727344,
      "step": 63495
    },
    {
      "epoch": 6.736261404625504,
      "grad_norm": 1.277420481457743,
      "learning_rate": 2.024157015100046e-05,
      "loss": 1.0505,
      "num_input_tokens_seen": 49956514016,
      "step": 63496
    },
    {
      "epoch": 6.7363674941650755,
      "grad_norm": 0.7714401129451319,
      "learning_rate": 2.0240887888900243e-05,
      "loss": 1.0206,
      "num_input_tokens_seen": 49957300688,
      "step": 63497
    },
    {
      "epoch": 6.7364735837046466,
      "grad_norm": 0.9384742737778017,
      "learning_rate": 2.024020563047773e-05,
      "loss": 1.0617,
      "num_input_tokens_seen": 49958087344,
      "step": 63498
    },
    {
      "epoch": 6.7365796732442185,
      "grad_norm": 1.1945040822825985,
      "learning_rate": 2.0239523375733442e-05,
      "loss": 0.9557,
      "num_input_tokens_seen": 49958874096,
      "step": 63499
    },
    {
      "epoch": 6.7366857627837895,
      "grad_norm": 0.8187997446879417,
      "learning_rate": 2.0238841124667914e-05,
      "loss": 0.9387,
      "num_input_tokens_seen": 49959660752,
      "step": 63500
    },
    {
      "epoch": 6.7367918523233605,
      "grad_norm": 0.9638030721796045,
      "learning_rate": 2.023815887728167e-05,
      "loss": 1.0523,
      "num_input_tokens_seen": 49960447520,
      "step": 63501
    },
    {
      "epoch": 6.7368979418629324,
      "grad_norm": 0.8437976855438934,
      "learning_rate": 2.0237476633575232e-05,
      "loss": 1.0162,
      "num_input_tokens_seen": 49961234304,
      "step": 63502
    },
    {
      "epoch": 6.7370040314025035,
      "grad_norm": 0.8827877081865916,
      "learning_rate": 2.0236794393549142e-05,
      "loss": 1.0244,
      "num_input_tokens_seen": 49962021024,
      "step": 63503
    },
    {
      "epoch": 6.737110120942075,
      "grad_norm": 0.7263507299865526,
      "learning_rate": 2.02361121572039e-05,
      "loss": 0.9763,
      "num_input_tokens_seen": 49962807776,
      "step": 63504
    },
    {
      "epoch": 6.737216210481646,
      "grad_norm": 0.7468607814732452,
      "learning_rate": 2.0235429924540066e-05,
      "loss": 0.9736,
      "num_input_tokens_seen": 49963594640,
      "step": 63505
    },
    {
      "epoch": 6.7373223000212175,
      "grad_norm": 0.9314324008608258,
      "learning_rate": 2.0234747695558147e-05,
      "loss": 0.973,
      "num_input_tokens_seen": 49964381424,
      "step": 63506
    },
    {
      "epoch": 6.737428389560789,
      "grad_norm": 0.7894835361566827,
      "learning_rate": 2.023406547025868e-05,
      "loss": 1.0066,
      "num_input_tokens_seen": 49965168128,
      "step": 63507
    },
    {
      "epoch": 6.73753447910036,
      "grad_norm": 0.7555591039218515,
      "learning_rate": 2.0233383248642183e-05,
      "loss": 1.0342,
      "num_input_tokens_seen": 49965954896,
      "step": 63508
    },
    {
      "epoch": 6.737640568639932,
      "grad_norm": 1.1159812343547117,
      "learning_rate": 2.023270103070919e-05,
      "loss": 1.0343,
      "num_input_tokens_seen": 49966741632,
      "step": 63509
    },
    {
      "epoch": 6.737746658179503,
      "grad_norm": 0.685685420340634,
      "learning_rate": 2.0232018816460223e-05,
      "loss": 1.089,
      "num_input_tokens_seen": 49967528464,
      "step": 63510
    },
    {
      "epoch": 6.737852747719075,
      "grad_norm": 1.018027786921232,
      "learning_rate": 2.023133660589582e-05,
      "loss": 1.1378,
      "num_input_tokens_seen": 49968315168,
      "step": 63511
    },
    {
      "epoch": 6.737958837258646,
      "grad_norm": 0.7056744207271188,
      "learning_rate": 2.023065439901649e-05,
      "loss": 1.0022,
      "num_input_tokens_seen": 49969102000,
      "step": 63512
    },
    {
      "epoch": 6.738064926798217,
      "grad_norm": 0.9145658222622469,
      "learning_rate": 2.022997219582277e-05,
      "loss": 1.0369,
      "num_input_tokens_seen": 49969888736,
      "step": 63513
    },
    {
      "epoch": 6.738171016337789,
      "grad_norm": 0.694047687820426,
      "learning_rate": 2.0229289996315192e-05,
      "loss": 0.9197,
      "num_input_tokens_seen": 49970675584,
      "step": 63514
    },
    {
      "epoch": 6.73827710587736,
      "grad_norm": 0.880852666088195,
      "learning_rate": 2.022860780049428e-05,
      "loss": 0.995,
      "num_input_tokens_seen": 49971462320,
      "step": 63515
    },
    {
      "epoch": 6.738383195416932,
      "grad_norm": 0.6777709937752029,
      "learning_rate": 2.022792560836056e-05,
      "loss": 0.8967,
      "num_input_tokens_seen": 49972249152,
      "step": 63516
    },
    {
      "epoch": 6.738489284956503,
      "grad_norm": 0.6788007004590845,
      "learning_rate": 2.0227243419914553e-05,
      "loss": 0.9385,
      "num_input_tokens_seen": 49973035888,
      "step": 63517
    },
    {
      "epoch": 6.738595374496075,
      "grad_norm": 0.8369434229418583,
      "learning_rate": 2.0226561235156797e-05,
      "loss": 1.014,
      "num_input_tokens_seen": 49973822704,
      "step": 63518
    },
    {
      "epoch": 6.738701464035646,
      "grad_norm": 0.7514194269034323,
      "learning_rate": 2.0225879054087822e-05,
      "loss": 0.9963,
      "num_input_tokens_seen": 49974609504,
      "step": 63519
    },
    {
      "epoch": 6.738807553575217,
      "grad_norm": 0.820083943058309,
      "learning_rate": 2.0225196876708133e-05,
      "loss": 1.0259,
      "num_input_tokens_seen": 49975396320,
      "step": 63520
    },
    {
      "epoch": 6.738913643114789,
      "grad_norm": 0.8623502297846588,
      "learning_rate": 2.022451470301828e-05,
      "loss": 0.9533,
      "num_input_tokens_seen": 49976183088,
      "step": 63521
    },
    {
      "epoch": 6.73901973265436,
      "grad_norm": 0.8546183590299953,
      "learning_rate": 2.0223832533018784e-05,
      "loss": 1.0496,
      "num_input_tokens_seen": 49976969744,
      "step": 63522
    },
    {
      "epoch": 6.739125822193932,
      "grad_norm": 0.7078203707043926,
      "learning_rate": 2.022315036671016e-05,
      "loss": 0.9905,
      "num_input_tokens_seen": 49977756544,
      "step": 63523
    },
    {
      "epoch": 6.739231911733503,
      "grad_norm": 0.809527338760109,
      "learning_rate": 2.0222468204092955e-05,
      "loss": 1.1029,
      "num_input_tokens_seen": 49978543248,
      "step": 63524
    },
    {
      "epoch": 6.739338001273074,
      "grad_norm": 1.0014258327805086,
      "learning_rate": 2.0221786045167685e-05,
      "loss": 0.9726,
      "num_input_tokens_seen": 49979330048,
      "step": 63525
    },
    {
      "epoch": 6.739444090812646,
      "grad_norm": 0.8332063746104494,
      "learning_rate": 2.022110388993487e-05,
      "loss": 0.9382,
      "num_input_tokens_seen": 49980116832,
      "step": 63526
    },
    {
      "epoch": 6.739550180352217,
      "grad_norm": 0.9412919143645517,
      "learning_rate": 2.0220421738395057e-05,
      "loss": 0.987,
      "num_input_tokens_seen": 49980903488,
      "step": 63527
    },
    {
      "epoch": 6.739656269891789,
      "grad_norm": 0.6340521271751073,
      "learning_rate": 2.0219739590548757e-05,
      "loss": 0.8541,
      "num_input_tokens_seen": 49981690208,
      "step": 63528
    },
    {
      "epoch": 6.73976235943136,
      "grad_norm": 1.1471509453076445,
      "learning_rate": 2.02190574463965e-05,
      "loss": 0.9923,
      "num_input_tokens_seen": 49982477056,
      "step": 63529
    },
    {
      "epoch": 6.739868448970931,
      "grad_norm": 1.0297974813342918,
      "learning_rate": 2.0218375305938818e-05,
      "loss": 1.0078,
      "num_input_tokens_seen": 49983263792,
      "step": 63530
    },
    {
      "epoch": 6.739974538510503,
      "grad_norm": 0.773734615824325,
      "learning_rate": 2.0217693169176232e-05,
      "loss": 1.049,
      "num_input_tokens_seen": 49984050624,
      "step": 63531
    },
    {
      "epoch": 6.740080628050074,
      "grad_norm": 1.1825433407750503,
      "learning_rate": 2.021701103610928e-05,
      "loss": 1.0524,
      "num_input_tokens_seen": 49984837296,
      "step": 63532
    },
    {
      "epoch": 6.740186717589646,
      "grad_norm": 1.0145084263070383,
      "learning_rate": 2.021632890673848e-05,
      "loss": 1.022,
      "num_input_tokens_seen": 49985623968,
      "step": 63533
    },
    {
      "epoch": 6.740292807129217,
      "grad_norm": 1.3453637611113423,
      "learning_rate": 2.021564678106435e-05,
      "loss": 1.0683,
      "num_input_tokens_seen": 49986410672,
      "step": 63534
    },
    {
      "epoch": 6.740398896668788,
      "grad_norm": 1.0352837416388487,
      "learning_rate": 2.0214964659087436e-05,
      "loss": 0.9585,
      "num_input_tokens_seen": 49987197376,
      "step": 63535
    },
    {
      "epoch": 6.74050498620836,
      "grad_norm": 0.82247881947911,
      "learning_rate": 2.021428254080826e-05,
      "loss": 1.0318,
      "num_input_tokens_seen": 49987984208,
      "step": 63536
    },
    {
      "epoch": 6.740611075747931,
      "grad_norm": 0.8627811683509569,
      "learning_rate": 2.0213600426227337e-05,
      "loss": 1.0346,
      "num_input_tokens_seen": 49988770976,
      "step": 63537
    },
    {
      "epoch": 6.740717165287503,
      "grad_norm": 0.7199996022486985,
      "learning_rate": 2.021291831534521e-05,
      "loss": 1.039,
      "num_input_tokens_seen": 49989557824,
      "step": 63538
    },
    {
      "epoch": 6.740823254827074,
      "grad_norm": 0.8580162476401588,
      "learning_rate": 2.02122362081624e-05,
      "loss": 1.0442,
      "num_input_tokens_seen": 49990344640,
      "step": 63539
    },
    {
      "epoch": 6.740929344366646,
      "grad_norm": 0.7414634699288114,
      "learning_rate": 2.0211554104679424e-05,
      "loss": 1.0846,
      "num_input_tokens_seen": 49991131376,
      "step": 63540
    },
    {
      "epoch": 6.741035433906217,
      "grad_norm": 0.7186230700570511,
      "learning_rate": 2.021087200489683e-05,
      "loss": 1.0224,
      "num_input_tokens_seen": 49991918192,
      "step": 63541
    },
    {
      "epoch": 6.741141523445788,
      "grad_norm": 0.7903801700173841,
      "learning_rate": 2.021018990881513e-05,
      "loss": 1.029,
      "num_input_tokens_seen": 49992704976,
      "step": 63542
    },
    {
      "epoch": 6.74124761298536,
      "grad_norm": 0.7274359418192825,
      "learning_rate": 2.020950781643485e-05,
      "loss": 1.0945,
      "num_input_tokens_seen": 49993491808,
      "step": 63543
    },
    {
      "epoch": 6.741353702524931,
      "grad_norm": 0.7519711743489771,
      "learning_rate": 2.020882572775653e-05,
      "loss": 0.9928,
      "num_input_tokens_seen": 49994278592,
      "step": 63544
    },
    {
      "epoch": 6.741459792064503,
      "grad_norm": 0.8462555370702575,
      "learning_rate": 2.0208143642780684e-05,
      "loss": 0.9878,
      "num_input_tokens_seen": 49995065472,
      "step": 63545
    },
    {
      "epoch": 6.741565881604074,
      "grad_norm": 0.8172917716595577,
      "learning_rate": 2.020746156150784e-05,
      "loss": 1.0322,
      "num_input_tokens_seen": 49995852288,
      "step": 63546
    },
    {
      "epoch": 6.741671971143646,
      "grad_norm": 0.8376253649700307,
      "learning_rate": 2.0206779483938536e-05,
      "loss": 1.0129,
      "num_input_tokens_seen": 49996638992,
      "step": 63547
    },
    {
      "epoch": 6.741778060683217,
      "grad_norm": 0.7207653464487418,
      "learning_rate": 2.0206097410073286e-05,
      "loss": 0.9807,
      "num_input_tokens_seen": 49997425792,
      "step": 63548
    },
    {
      "epoch": 6.741884150222788,
      "grad_norm": 0.7764742087319467,
      "learning_rate": 2.0205415339912627e-05,
      "loss": 1.0242,
      "num_input_tokens_seen": 49998212576,
      "step": 63549
    },
    {
      "epoch": 6.74199023976236,
      "grad_norm": 0.7205265581630634,
      "learning_rate": 2.0204733273457082e-05,
      "loss": 1.0181,
      "num_input_tokens_seen": 49998999472,
      "step": 63550
    },
    {
      "epoch": 6.742096329301931,
      "grad_norm": 0.7949189964139736,
      "learning_rate": 2.0204051210707175e-05,
      "loss": 0.9612,
      "num_input_tokens_seen": 49999786144,
      "step": 63551
    },
    {
      "epoch": 6.742202418841503,
      "grad_norm": 0.8657875129915907,
      "learning_rate": 2.0203369151663444e-05,
      "loss": 1.0464,
      "num_input_tokens_seen": 50000572880,
      "step": 63552
    },
    {
      "epoch": 6.742308508381074,
      "grad_norm": 0.8140848094660734,
      "learning_rate": 2.0202687096326406e-05,
      "loss": 1.0453,
      "num_input_tokens_seen": 50001359728,
      "step": 63553
    },
    {
      "epoch": 6.742414597920645,
      "grad_norm": 0.7505047923858357,
      "learning_rate": 2.0202005044696588e-05,
      "loss": 0.9719,
      "num_input_tokens_seen": 50002146544,
      "step": 63554
    },
    {
      "epoch": 6.742520687460217,
      "grad_norm": 0.7145354834266091,
      "learning_rate": 2.0201322996774518e-05,
      "loss": 0.9894,
      "num_input_tokens_seen": 50002933280,
      "step": 63555
    },
    {
      "epoch": 6.742626776999788,
      "grad_norm": 0.8186208765673987,
      "learning_rate": 2.020064095256073e-05,
      "loss": 0.9836,
      "num_input_tokens_seen": 50003720064,
      "step": 63556
    },
    {
      "epoch": 6.7427328665393595,
      "grad_norm": 0.7958115438752474,
      "learning_rate": 2.019995891205574e-05,
      "loss": 1.0892,
      "num_input_tokens_seen": 50004506896,
      "step": 63557
    },
    {
      "epoch": 6.742838956078931,
      "grad_norm": 1.0476610127626964,
      "learning_rate": 2.0199276875260086e-05,
      "loss": 1.0597,
      "num_input_tokens_seen": 50005293680,
      "step": 63558
    },
    {
      "epoch": 6.742945045618502,
      "grad_norm": 0.8491372451049092,
      "learning_rate": 2.0198594842174292e-05,
      "loss": 0.9942,
      "num_input_tokens_seen": 50006080416,
      "step": 63559
    },
    {
      "epoch": 6.7430511351580735,
      "grad_norm": 1.1548542268483644,
      "learning_rate": 2.0197912812798875e-05,
      "loss": 1.0003,
      "num_input_tokens_seen": 50006867152,
      "step": 63560
    },
    {
      "epoch": 6.743157224697645,
      "grad_norm": 1.1228631448766486,
      "learning_rate": 2.0197230787134378e-05,
      "loss": 0.9552,
      "num_input_tokens_seen": 50007653888,
      "step": 63561
    },
    {
      "epoch": 6.7432633142372165,
      "grad_norm": 0.8832165967261068,
      "learning_rate": 2.019654876518131e-05,
      "loss": 0.9533,
      "num_input_tokens_seen": 50008440608,
      "step": 63562
    },
    {
      "epoch": 6.7433694037767875,
      "grad_norm": 1.0758750935595696,
      "learning_rate": 2.0195866746940217e-05,
      "loss": 0.9901,
      "num_input_tokens_seen": 50009227376,
      "step": 63563
    },
    {
      "epoch": 6.7434754933163585,
      "grad_norm": 1.3999756595256951,
      "learning_rate": 2.019518473241162e-05,
      "loss": 1.0668,
      "num_input_tokens_seen": 50010014128,
      "step": 63564
    },
    {
      "epoch": 6.7435815828559305,
      "grad_norm": 1.0059838323089347,
      "learning_rate": 2.0194502721596035e-05,
      "loss": 0.9892,
      "num_input_tokens_seen": 50010800880,
      "step": 63565
    },
    {
      "epoch": 6.7436876723955015,
      "grad_norm": 0.8056119771337213,
      "learning_rate": 2.0193820714494e-05,
      "loss": 1.0267,
      "num_input_tokens_seen": 50011587712,
      "step": 63566
    },
    {
      "epoch": 6.743793761935073,
      "grad_norm": 1.324557767298633,
      "learning_rate": 2.0193138711106042e-05,
      "loss": 0.9839,
      "num_input_tokens_seen": 50012374448,
      "step": 63567
    },
    {
      "epoch": 6.743899851474644,
      "grad_norm": 1.1831172842913305,
      "learning_rate": 2.019245671143268e-05,
      "loss": 0.9923,
      "num_input_tokens_seen": 50013161168,
      "step": 63568
    },
    {
      "epoch": 6.744005941014216,
      "grad_norm": 0.7511664112927069,
      "learning_rate": 2.019177471547445e-05,
      "loss": 0.9771,
      "num_input_tokens_seen": 50013947936,
      "step": 63569
    },
    {
      "epoch": 6.744112030553787,
      "grad_norm": 1.025561111877487,
      "learning_rate": 2.019109272323188e-05,
      "loss": 0.9877,
      "num_input_tokens_seen": 50014734704,
      "step": 63570
    },
    {
      "epoch": 6.744218120093358,
      "grad_norm": 1.055959747486293,
      "learning_rate": 2.0190410734705485e-05,
      "loss": 1.0089,
      "num_input_tokens_seen": 50015521472,
      "step": 63571
    },
    {
      "epoch": 6.74432420963293,
      "grad_norm": 0.7725306709675829,
      "learning_rate": 2.0189728749895803e-05,
      "loss": 0.9357,
      "num_input_tokens_seen": 50016308336,
      "step": 63572
    },
    {
      "epoch": 6.744430299172501,
      "grad_norm": 1.0867546899791145,
      "learning_rate": 2.0189046768803358e-05,
      "loss": 0.9997,
      "num_input_tokens_seen": 50017095104,
      "step": 63573
    },
    {
      "epoch": 6.744536388712073,
      "grad_norm": 1.2706358595506904,
      "learning_rate": 2.0188364791428673e-05,
      "loss": 0.9835,
      "num_input_tokens_seen": 50017881872,
      "step": 63574
    },
    {
      "epoch": 6.744642478251644,
      "grad_norm": 0.9934952047877424,
      "learning_rate": 2.018768281777228e-05,
      "loss": 0.9736,
      "num_input_tokens_seen": 50018668656,
      "step": 63575
    },
    {
      "epoch": 6.744748567791216,
      "grad_norm": 1.249374211974841,
      "learning_rate": 2.0187000847834706e-05,
      "loss": 1.0185,
      "num_input_tokens_seen": 50019455424,
      "step": 63576
    },
    {
      "epoch": 6.744854657330787,
      "grad_norm": 1.2629426828916812,
      "learning_rate": 2.0186318881616472e-05,
      "loss": 1.0203,
      "num_input_tokens_seen": 50020242272,
      "step": 63577
    },
    {
      "epoch": 6.744960746870358,
      "grad_norm": 1.012031665935316,
      "learning_rate": 2.0185636919118115e-05,
      "loss": 1.012,
      "num_input_tokens_seen": 50021028928,
      "step": 63578
    },
    {
      "epoch": 6.74506683640993,
      "grad_norm": 0.8341494402738658,
      "learning_rate": 2.0184954960340153e-05,
      "loss": 0.9958,
      "num_input_tokens_seen": 50021815760,
      "step": 63579
    },
    {
      "epoch": 6.745172925949501,
      "grad_norm": 1.0646455422842682,
      "learning_rate": 2.018427300528312e-05,
      "loss": 0.9903,
      "num_input_tokens_seen": 50022602528,
      "step": 63580
    },
    {
      "epoch": 6.745279015489073,
      "grad_norm": 0.9046593112303374,
      "learning_rate": 2.0183591053947538e-05,
      "loss": 0.9989,
      "num_input_tokens_seen": 50023389328,
      "step": 63581
    },
    {
      "epoch": 6.745385105028644,
      "grad_norm": 0.8442365535531975,
      "learning_rate": 2.0182909106333932e-05,
      "loss": 0.9948,
      "num_input_tokens_seen": 50024176032,
      "step": 63582
    },
    {
      "epoch": 6.745491194568215,
      "grad_norm": 0.758411605761575,
      "learning_rate": 2.0182227162442835e-05,
      "loss": 1.0567,
      "num_input_tokens_seen": 50024962752,
      "step": 63583
    },
    {
      "epoch": 6.745597284107787,
      "grad_norm": 0.8414508656633066,
      "learning_rate": 2.0181545222274774e-05,
      "loss": 1.0061,
      "num_input_tokens_seen": 50025749488,
      "step": 63584
    },
    {
      "epoch": 6.745703373647358,
      "grad_norm": 0.697916478857344,
      "learning_rate": 2.018086328583027e-05,
      "loss": 0.9681,
      "num_input_tokens_seen": 50026536256,
      "step": 63585
    },
    {
      "epoch": 6.74580946318693,
      "grad_norm": 0.6750701723239096,
      "learning_rate": 2.0180181353109857e-05,
      "loss": 0.9084,
      "num_input_tokens_seen": 50027323008,
      "step": 63586
    },
    {
      "epoch": 6.745915552726501,
      "grad_norm": 0.8955675913228042,
      "learning_rate": 2.0179499424114058e-05,
      "loss": 0.9737,
      "num_input_tokens_seen": 50028109792,
      "step": 63587
    },
    {
      "epoch": 6.746021642266072,
      "grad_norm": 0.8200795963570439,
      "learning_rate": 2.0178817498843395e-05,
      "loss": 0.95,
      "num_input_tokens_seen": 50028896640,
      "step": 63588
    },
    {
      "epoch": 6.746127731805644,
      "grad_norm": 0.9420783439545249,
      "learning_rate": 2.0178135577298407e-05,
      "loss": 1.0009,
      "num_input_tokens_seen": 50029683376,
      "step": 63589
    },
    {
      "epoch": 6.746233821345215,
      "grad_norm": 1.042269768974482,
      "learning_rate": 2.017745365947961e-05,
      "loss": 1.0139,
      "num_input_tokens_seen": 50030470240,
      "step": 63590
    },
    {
      "epoch": 6.746339910884787,
      "grad_norm": 0.8419747195932122,
      "learning_rate": 2.0176771745387534e-05,
      "loss": 1.0094,
      "num_input_tokens_seen": 50031256960,
      "step": 63591
    },
    {
      "epoch": 6.746446000424358,
      "grad_norm": 0.858963707170877,
      "learning_rate": 2.0176089835022713e-05,
      "loss": 1.0272,
      "num_input_tokens_seen": 50032043616,
      "step": 63592
    },
    {
      "epoch": 6.746552089963929,
      "grad_norm": 0.7848117347229355,
      "learning_rate": 2.0175407928385667e-05,
      "loss": 1.0162,
      "num_input_tokens_seen": 50032830400,
      "step": 63593
    },
    {
      "epoch": 6.746658179503501,
      "grad_norm": 0.8486682389619065,
      "learning_rate": 2.017472602547692e-05,
      "loss": 0.9805,
      "num_input_tokens_seen": 50033617216,
      "step": 63594
    },
    {
      "epoch": 6.746764269043072,
      "grad_norm": 0.8897088619336634,
      "learning_rate": 2.017404412629701e-05,
      "loss": 0.9497,
      "num_input_tokens_seen": 50034404048,
      "step": 63595
    },
    {
      "epoch": 6.746870358582644,
      "grad_norm": 0.8426160568739693,
      "learning_rate": 2.0173362230846445e-05,
      "loss": 1.0153,
      "num_input_tokens_seen": 50035190832,
      "step": 63596
    },
    {
      "epoch": 6.746976448122215,
      "grad_norm": 0.9157568608245962,
      "learning_rate": 2.0172680339125778e-05,
      "loss": 1.0486,
      "num_input_tokens_seen": 50035977568,
      "step": 63597
    },
    {
      "epoch": 6.747082537661787,
      "grad_norm": 0.7320286087713852,
      "learning_rate": 2.0171998451135515e-05,
      "loss": 1.0034,
      "num_input_tokens_seen": 50036764384,
      "step": 63598
    },
    {
      "epoch": 6.747188627201358,
      "grad_norm": 1.4156070791178463,
      "learning_rate": 2.017131656687618e-05,
      "loss": 1.1074,
      "num_input_tokens_seen": 50037551088,
      "step": 63599
    },
    {
      "epoch": 6.74729471674093,
      "grad_norm": 1.025086022334411,
      "learning_rate": 2.017063468634832e-05,
      "loss": 0.9797,
      "num_input_tokens_seen": 50038337904,
      "step": 63600
    },
    {
      "epoch": 6.747400806280501,
      "grad_norm": 0.8522574138910388,
      "learning_rate": 2.0169952809552455e-05,
      "loss": 1.09,
      "num_input_tokens_seen": 50039124576,
      "step": 63601
    },
    {
      "epoch": 6.747506895820072,
      "grad_norm": 0.9761294225916073,
      "learning_rate": 2.0169270936489108e-05,
      "loss": 0.995,
      "num_input_tokens_seen": 50039911248,
      "step": 63602
    },
    {
      "epoch": 6.747612985359644,
      "grad_norm": 1.0882933854132149,
      "learning_rate": 2.0168589067158798e-05,
      "loss": 0.9729,
      "num_input_tokens_seen": 50040697952,
      "step": 63603
    },
    {
      "epoch": 6.747719074899215,
      "grad_norm": 1.116346734633457,
      "learning_rate": 2.016790720156207e-05,
      "loss": 1.0484,
      "num_input_tokens_seen": 50041484656,
      "step": 63604
    },
    {
      "epoch": 6.747825164438787,
      "grad_norm": 0.9298420104575449,
      "learning_rate": 2.016722533969944e-05,
      "loss": 0.9439,
      "num_input_tokens_seen": 50042271424,
      "step": 63605
    },
    {
      "epoch": 6.747931253978358,
      "grad_norm": 2.007790751715206,
      "learning_rate": 2.0166543481571436e-05,
      "loss": 1.0325,
      "num_input_tokens_seen": 50043058176,
      "step": 63606
    },
    {
      "epoch": 6.748037343517929,
      "grad_norm": 1.1914785918502082,
      "learning_rate": 2.0165861627178583e-05,
      "loss": 1.0889,
      "num_input_tokens_seen": 50043844880,
      "step": 63607
    },
    {
      "epoch": 6.748143433057501,
      "grad_norm": 0.8862969997367246,
      "learning_rate": 2.0165179776521416e-05,
      "loss": 1.0101,
      "num_input_tokens_seen": 50044631632,
      "step": 63608
    },
    {
      "epoch": 6.748249522597072,
      "grad_norm": 0.919379839880457,
      "learning_rate": 2.0164497929600447e-05,
      "loss": 0.9507,
      "num_input_tokens_seen": 50045418480,
      "step": 63609
    },
    {
      "epoch": 6.748355612136644,
      "grad_norm": 1.5387605060920806,
      "learning_rate": 2.016381608641622e-05,
      "loss": 1.0788,
      "num_input_tokens_seen": 50046205168,
      "step": 63610
    },
    {
      "epoch": 6.748461701676215,
      "grad_norm": 1.1284401260618064,
      "learning_rate": 2.0163134246969254e-05,
      "loss": 1.095,
      "num_input_tokens_seen": 50046991872,
      "step": 63611
    },
    {
      "epoch": 6.748567791215786,
      "grad_norm": 0.9081241088865747,
      "learning_rate": 2.016245241126007e-05,
      "loss": 0.9764,
      "num_input_tokens_seen": 50047778592,
      "step": 63612
    },
    {
      "epoch": 6.748673880755358,
      "grad_norm": 1.4142218943163993,
      "learning_rate": 2.016177057928921e-05,
      "loss": 0.9971,
      "num_input_tokens_seen": 50048565344,
      "step": 63613
    },
    {
      "epoch": 6.748779970294929,
      "grad_norm": 1.1957935722466524,
      "learning_rate": 2.0161088751057182e-05,
      "loss": 1.0637,
      "num_input_tokens_seen": 50049352160,
      "step": 63614
    },
    {
      "epoch": 6.748886059834501,
      "grad_norm": 0.9940227915827036,
      "learning_rate": 2.0160406926564524e-05,
      "loss": 1.1124,
      "num_input_tokens_seen": 50050138880,
      "step": 63615
    },
    {
      "epoch": 6.748992149374072,
      "grad_norm": 0.9342999290250752,
      "learning_rate": 2.0159725105811767e-05,
      "loss": 1.0534,
      "num_input_tokens_seen": 50050925648,
      "step": 63616
    },
    {
      "epoch": 6.749098238913643,
      "grad_norm": 0.909662158264626,
      "learning_rate": 2.0159043288799426e-05,
      "loss": 1.0669,
      "num_input_tokens_seen": 50051712432,
      "step": 63617
    },
    {
      "epoch": 6.749204328453215,
      "grad_norm": 1.3246893604112744,
      "learning_rate": 2.015836147552804e-05,
      "loss": 1.0382,
      "num_input_tokens_seen": 50052499200,
      "step": 63618
    },
    {
      "epoch": 6.749310417992786,
      "grad_norm": 0.714152160513186,
      "learning_rate": 2.015767966599813e-05,
      "loss": 1.0206,
      "num_input_tokens_seen": 50053285968,
      "step": 63619
    },
    {
      "epoch": 6.749416507532358,
      "grad_norm": 1.0784251589776936,
      "learning_rate": 2.0156997860210217e-05,
      "loss": 1.1074,
      "num_input_tokens_seen": 50054072672,
      "step": 63620
    },
    {
      "epoch": 6.749522597071929,
      "grad_norm": 0.8832028476949103,
      "learning_rate": 2.015631605816484e-05,
      "loss": 0.9477,
      "num_input_tokens_seen": 50054859504,
      "step": 63621
    },
    {
      "epoch": 6.7496286866115,
      "grad_norm": 0.8100641679908045,
      "learning_rate": 2.0155634259862522e-05,
      "loss": 1.0899,
      "num_input_tokens_seen": 50055646208,
      "step": 63622
    },
    {
      "epoch": 6.7497347761510715,
      "grad_norm": 0.813532363109764,
      "learning_rate": 2.0154952465303778e-05,
      "loss": 1.0342,
      "num_input_tokens_seen": 50056432960,
      "step": 63623
    },
    {
      "epoch": 6.749840865690643,
      "grad_norm": 1.2287838316574524,
      "learning_rate": 2.015427067448915e-05,
      "loss": 0.9688,
      "num_input_tokens_seen": 50057219760,
      "step": 63624
    },
    {
      "epoch": 6.7499469552302145,
      "grad_norm": 0.960961204764248,
      "learning_rate": 2.0153588887419163e-05,
      "loss": 0.9751,
      "num_input_tokens_seen": 50058006544,
      "step": 63625
    },
    {
      "epoch": 6.7500530447697855,
      "grad_norm": 0.8686357293212912,
      "learning_rate": 2.0152907104094336e-05,
      "loss": 0.9609,
      "num_input_tokens_seen": 50058793360,
      "step": 63626
    },
    {
      "epoch": 6.750159134309357,
      "grad_norm": 1.7267539634195685,
      "learning_rate": 2.01522253245152e-05,
      "loss": 1.0283,
      "num_input_tokens_seen": 50059580096,
      "step": 63627
    },
    {
      "epoch": 6.7502652238489285,
      "grad_norm": 0.8553331740234652,
      "learning_rate": 2.0151543548682288e-05,
      "loss": 0.9938,
      "num_input_tokens_seen": 50060366880,
      "step": 63628
    },
    {
      "epoch": 6.7503713133885,
      "grad_norm": 0.7718012715580378,
      "learning_rate": 2.015086177659611e-05,
      "loss": 0.9944,
      "num_input_tokens_seen": 50061153616,
      "step": 63629
    },
    {
      "epoch": 6.750477402928071,
      "grad_norm": 0.7212771074648198,
      "learning_rate": 2.0150180008257214e-05,
      "loss": 1.006,
      "num_input_tokens_seen": 50061940384,
      "step": 63630
    },
    {
      "epoch": 6.750583492467642,
      "grad_norm": 0.7583904907418155,
      "learning_rate": 2.0149498243666112e-05,
      "loss": 0.98,
      "num_input_tokens_seen": 50062727136,
      "step": 63631
    },
    {
      "epoch": 6.750689582007214,
      "grad_norm": 0.9052947733059837,
      "learning_rate": 2.014881648282333e-05,
      "loss": 1.0264,
      "num_input_tokens_seen": 50063513808,
      "step": 63632
    },
    {
      "epoch": 6.750795671546785,
      "grad_norm": 0.9346010197676411,
      "learning_rate": 2.014813472572941e-05,
      "loss": 1.0182,
      "num_input_tokens_seen": 50064300560,
      "step": 63633
    },
    {
      "epoch": 6.750901761086357,
      "grad_norm": 1.4318210086498422,
      "learning_rate": 2.014745297238486e-05,
      "loss": 0.8969,
      "num_input_tokens_seen": 50065087344,
      "step": 63634
    },
    {
      "epoch": 6.751007850625928,
      "grad_norm": 1.022977181694285,
      "learning_rate": 2.0146771222790227e-05,
      "loss": 1.0215,
      "num_input_tokens_seen": 50065874112,
      "step": 63635
    },
    {
      "epoch": 6.751113940165499,
      "grad_norm": 0.7231331382522335,
      "learning_rate": 2.014608947694602e-05,
      "loss": 0.9945,
      "num_input_tokens_seen": 50066660896,
      "step": 63636
    },
    {
      "epoch": 6.751220029705071,
      "grad_norm": 1.0466613508114044,
      "learning_rate": 2.0145407734852772e-05,
      "loss": 0.9678,
      "num_input_tokens_seen": 50067447728,
      "step": 63637
    },
    {
      "epoch": 6.751326119244642,
      "grad_norm": 0.7574360650734361,
      "learning_rate": 2.0144725996511012e-05,
      "loss": 0.9661,
      "num_input_tokens_seen": 50068234576,
      "step": 63638
    },
    {
      "epoch": 6.751432208784214,
      "grad_norm": 0.7598704800812625,
      "learning_rate": 2.014404426192127e-05,
      "loss": 1.0517,
      "num_input_tokens_seen": 50069021264,
      "step": 63639
    },
    {
      "epoch": 6.751538298323785,
      "grad_norm": 0.9380505933941607,
      "learning_rate": 2.0143362531084058e-05,
      "loss": 1.0116,
      "num_input_tokens_seen": 50069808048,
      "step": 63640
    },
    {
      "epoch": 6.751644387863356,
      "grad_norm": 0.6675624459135733,
      "learning_rate": 2.014268080399992e-05,
      "loss": 0.9548,
      "num_input_tokens_seen": 50070594832,
      "step": 63641
    },
    {
      "epoch": 6.751750477402928,
      "grad_norm": 0.7057751146938176,
      "learning_rate": 2.0141999080669377e-05,
      "loss": 0.9887,
      "num_input_tokens_seen": 50071381568,
      "step": 63642
    },
    {
      "epoch": 6.751856566942499,
      "grad_norm": 0.8525340647642022,
      "learning_rate": 2.0141317361092947e-05,
      "loss": 1.0122,
      "num_input_tokens_seen": 50072168288,
      "step": 63643
    },
    {
      "epoch": 6.751962656482071,
      "grad_norm": 0.7803522345817654,
      "learning_rate": 2.014063564527117e-05,
      "loss": 1.0175,
      "num_input_tokens_seen": 50072955008,
      "step": 63644
    },
    {
      "epoch": 6.752068746021642,
      "grad_norm": 0.7365706337781954,
      "learning_rate": 2.013995393320457e-05,
      "loss": 1.003,
      "num_input_tokens_seen": 50073741872,
      "step": 63645
    },
    {
      "epoch": 6.752174835561213,
      "grad_norm": 0.7450499775617572,
      "learning_rate": 2.0139272224893663e-05,
      "loss": 1.0145,
      "num_input_tokens_seen": 50074528608,
      "step": 63646
    },
    {
      "epoch": 6.752280925100785,
      "grad_norm": 0.718827905118417,
      "learning_rate": 2.013859052033899e-05,
      "loss": 1.0415,
      "num_input_tokens_seen": 50075315440,
      "step": 63647
    },
    {
      "epoch": 6.752387014640356,
      "grad_norm": 0.9081598808111856,
      "learning_rate": 2.013790881954107e-05,
      "loss": 0.9601,
      "num_input_tokens_seen": 50076102128,
      "step": 63648
    },
    {
      "epoch": 6.752493104179928,
      "grad_norm": 0.9493937696104062,
      "learning_rate": 2.013722712250043e-05,
      "loss": 1.0271,
      "num_input_tokens_seen": 50076888816,
      "step": 63649
    },
    {
      "epoch": 6.752599193719499,
      "grad_norm": 0.9410865510992031,
      "learning_rate": 2.01365454292176e-05,
      "loss": 1.0414,
      "num_input_tokens_seen": 50077675600,
      "step": 63650
    },
    {
      "epoch": 6.75270528325907,
      "grad_norm": 0.8389363922062041,
      "learning_rate": 2.01358637396931e-05,
      "loss": 0.932,
      "num_input_tokens_seen": 50078462352,
      "step": 63651
    },
    {
      "epoch": 6.752811372798642,
      "grad_norm": 0.7866056068065564,
      "learning_rate": 2.0135182053927468e-05,
      "loss": 1.0258,
      "num_input_tokens_seen": 50079249120,
      "step": 63652
    },
    {
      "epoch": 6.752917462338213,
      "grad_norm": 1.0610548014320336,
      "learning_rate": 2.0134500371921225e-05,
      "loss": 0.9816,
      "num_input_tokens_seen": 50080035840,
      "step": 63653
    },
    {
      "epoch": 6.753023551877785,
      "grad_norm": 1.0244060780063575,
      "learning_rate": 2.013381869367489e-05,
      "loss": 0.9092,
      "num_input_tokens_seen": 50080822528,
      "step": 63654
    },
    {
      "epoch": 6.753129641417356,
      "grad_norm": 0.8727293892994943,
      "learning_rate": 2.0133137019189006e-05,
      "loss": 1.0327,
      "num_input_tokens_seen": 50081609392,
      "step": 63655
    },
    {
      "epoch": 6.753235730956928,
      "grad_norm": 1.1408598316884275,
      "learning_rate": 2.0132455348464087e-05,
      "loss": 1.0371,
      "num_input_tokens_seen": 50082396112,
      "step": 63656
    },
    {
      "epoch": 6.753341820496499,
      "grad_norm": 0.7536373674965104,
      "learning_rate": 2.0131773681500658e-05,
      "loss": 0.9224,
      "num_input_tokens_seen": 50083182928,
      "step": 63657
    },
    {
      "epoch": 6.753447910036071,
      "grad_norm": 0.9839250060649128,
      "learning_rate": 2.0131092018299265e-05,
      "loss": 1.048,
      "num_input_tokens_seen": 50083969648,
      "step": 63658
    },
    {
      "epoch": 6.753553999575642,
      "grad_norm": 0.7303904355484822,
      "learning_rate": 2.0130410358860413e-05,
      "loss": 0.9826,
      "num_input_tokens_seen": 50084756432,
      "step": 63659
    },
    {
      "epoch": 6.753660089115213,
      "grad_norm": 1.285943576346268,
      "learning_rate": 2.0129728703184633e-05,
      "loss": 1.0102,
      "num_input_tokens_seen": 50085543168,
      "step": 63660
    },
    {
      "epoch": 6.753766178654785,
      "grad_norm": 0.7999926702114045,
      "learning_rate": 2.012904705127246e-05,
      "loss": 0.9554,
      "num_input_tokens_seen": 50086330000,
      "step": 63661
    },
    {
      "epoch": 6.753872268194356,
      "grad_norm": 0.8935577212340536,
      "learning_rate": 2.0128365403124423e-05,
      "loss": 1.0347,
      "num_input_tokens_seen": 50087116688,
      "step": 63662
    },
    {
      "epoch": 6.753978357733928,
      "grad_norm": 1.0978877395675066,
      "learning_rate": 2.0127683758741032e-05,
      "loss": 1.0311,
      "num_input_tokens_seen": 50087903456,
      "step": 63663
    },
    {
      "epoch": 6.754084447273499,
      "grad_norm": 0.8301380554597603,
      "learning_rate": 2.0127002118122828e-05,
      "loss": 0.9899,
      "num_input_tokens_seen": 50088690208,
      "step": 63664
    },
    {
      "epoch": 6.75419053681307,
      "grad_norm": 0.8742474727510777,
      "learning_rate": 2.012632048127033e-05,
      "loss": 1.0222,
      "num_input_tokens_seen": 50089476944,
      "step": 63665
    },
    {
      "epoch": 6.754296626352642,
      "grad_norm": 0.7467973324071601,
      "learning_rate": 2.0125638848184075e-05,
      "loss": 0.9775,
      "num_input_tokens_seen": 50090263600,
      "step": 63666
    },
    {
      "epoch": 6.754402715892213,
      "grad_norm": 0.7157864405807276,
      "learning_rate": 2.0124957218864583e-05,
      "loss": 0.9725,
      "num_input_tokens_seen": 50091050352,
      "step": 63667
    },
    {
      "epoch": 6.754508805431785,
      "grad_norm": 0.8177670064939421,
      "learning_rate": 2.0124275593312374e-05,
      "loss": 0.9812,
      "num_input_tokens_seen": 50091837168,
      "step": 63668
    },
    {
      "epoch": 6.754614894971356,
      "grad_norm": 1.1168038216250569,
      "learning_rate": 2.012359397152799e-05,
      "loss": 0.9497,
      "num_input_tokens_seen": 50092623952,
      "step": 63669
    },
    {
      "epoch": 6.754720984510927,
      "grad_norm": 0.9693188797363281,
      "learning_rate": 2.0122912353511948e-05,
      "loss": 0.9565,
      "num_input_tokens_seen": 50093410752,
      "step": 63670
    },
    {
      "epoch": 6.754827074050499,
      "grad_norm": 1.0557651725376092,
      "learning_rate": 2.012223073926477e-05,
      "loss": 0.9721,
      "num_input_tokens_seen": 50094197504,
      "step": 63671
    },
    {
      "epoch": 6.75493316359007,
      "grad_norm": 0.8131850645119597,
      "learning_rate": 2.0121549128786993e-05,
      "loss": 1.0035,
      "num_input_tokens_seen": 50094984240,
      "step": 63672
    },
    {
      "epoch": 6.755039253129642,
      "grad_norm": 0.8569293148744757,
      "learning_rate": 2.012086752207914e-05,
      "loss": 1.0174,
      "num_input_tokens_seen": 50095771056,
      "step": 63673
    },
    {
      "epoch": 6.755145342669213,
      "grad_norm": 0.857526292263815,
      "learning_rate": 2.0120185919141736e-05,
      "loss": 1.0499,
      "num_input_tokens_seen": 50096557792,
      "step": 63674
    },
    {
      "epoch": 6.755251432208784,
      "grad_norm": 0.8169158330086838,
      "learning_rate": 2.011950431997531e-05,
      "loss": 1.0731,
      "num_input_tokens_seen": 50097344480,
      "step": 63675
    },
    {
      "epoch": 6.755357521748356,
      "grad_norm": 0.7224294849015014,
      "learning_rate": 2.011882272458039e-05,
      "loss": 0.9912,
      "num_input_tokens_seen": 50098131168,
      "step": 63676
    },
    {
      "epoch": 6.755463611287927,
      "grad_norm": 0.7341786834098439,
      "learning_rate": 2.0118141132957496e-05,
      "loss": 1.0385,
      "num_input_tokens_seen": 50098917952,
      "step": 63677
    },
    {
      "epoch": 6.755569700827499,
      "grad_norm": 0.7645256096503149,
      "learning_rate": 2.0117459545107165e-05,
      "loss": 0.9504,
      "num_input_tokens_seen": 50099704800,
      "step": 63678
    },
    {
      "epoch": 6.75567579036707,
      "grad_norm": 0.9057400020981666,
      "learning_rate": 2.0116777961029915e-05,
      "loss": 1.0144,
      "num_input_tokens_seen": 50100491520,
      "step": 63679
    },
    {
      "epoch": 6.755781879906642,
      "grad_norm": 0.8053806896030138,
      "learning_rate": 2.0116096380726274e-05,
      "loss": 1.0453,
      "num_input_tokens_seen": 50101278208,
      "step": 63680
    },
    {
      "epoch": 6.755887969446213,
      "grad_norm": 0.9137995283895506,
      "learning_rate": 2.0115414804196772e-05,
      "loss": 0.9966,
      "num_input_tokens_seen": 50102064960,
      "step": 63681
    },
    {
      "epoch": 6.755994058985784,
      "grad_norm": 0.7027867501901108,
      "learning_rate": 2.0114733231441933e-05,
      "loss": 0.9777,
      "num_input_tokens_seen": 50102851664,
      "step": 63682
    },
    {
      "epoch": 6.756100148525356,
      "grad_norm": 0.8457115606106183,
      "learning_rate": 2.0114051662462286e-05,
      "loss": 0.9868,
      "num_input_tokens_seen": 50103638480,
      "step": 63683
    },
    {
      "epoch": 6.756206238064927,
      "grad_norm": 0.947911847116105,
      "learning_rate": 2.0113370097258357e-05,
      "loss": 1.0168,
      "num_input_tokens_seen": 50104425184,
      "step": 63684
    },
    {
      "epoch": 6.7563123276044985,
      "grad_norm": 0.7660199454656403,
      "learning_rate": 2.011268853583067e-05,
      "loss": 1.0457,
      "num_input_tokens_seen": 50105211856,
      "step": 63685
    },
    {
      "epoch": 6.7564184171440695,
      "grad_norm": 1.0441293414590709,
      "learning_rate": 2.0112006978179756e-05,
      "loss": 1.0883,
      "num_input_tokens_seen": 50105998592,
      "step": 63686
    },
    {
      "epoch": 6.7565245066836415,
      "grad_norm": 0.9370997066993335,
      "learning_rate": 2.0111325424306142e-05,
      "loss": 1.0169,
      "num_input_tokens_seen": 50106785392,
      "step": 63687
    },
    {
      "epoch": 6.7566305962232125,
      "grad_norm": 0.9108563445356286,
      "learning_rate": 2.0110643874210343e-05,
      "loss": 1.0225,
      "num_input_tokens_seen": 50107572048,
      "step": 63688
    },
    {
      "epoch": 6.7567366857627835,
      "grad_norm": 0.9556892736130763,
      "learning_rate": 2.0109962327892907e-05,
      "loss": 1.0052,
      "num_input_tokens_seen": 50108358848,
      "step": 63689
    },
    {
      "epoch": 6.756842775302355,
      "grad_norm": 0.784208161171475,
      "learning_rate": 2.0109280785354345e-05,
      "loss": 0.9374,
      "num_input_tokens_seen": 50109145616,
      "step": 63690
    },
    {
      "epoch": 6.7569488648419265,
      "grad_norm": 0.7545388676899811,
      "learning_rate": 2.010859924659518e-05,
      "loss": 1.0187,
      "num_input_tokens_seen": 50109932304,
      "step": 63691
    },
    {
      "epoch": 6.757054954381498,
      "grad_norm": 0.8911465057181561,
      "learning_rate": 2.0107917711615955e-05,
      "loss": 1.0873,
      "num_input_tokens_seen": 50110719040,
      "step": 63692
    },
    {
      "epoch": 6.757161043921069,
      "grad_norm": 0.7217606060454925,
      "learning_rate": 2.0107236180417186e-05,
      "loss": 1.0505,
      "num_input_tokens_seen": 50111505776,
      "step": 63693
    },
    {
      "epoch": 6.7572671334606405,
      "grad_norm": 0.7181016646833862,
      "learning_rate": 2.0106554652999392e-05,
      "loss": 1.0065,
      "num_input_tokens_seen": 50112292576,
      "step": 63694
    },
    {
      "epoch": 6.757373223000212,
      "grad_norm": 0.7319542426942687,
      "learning_rate": 2.010587312936311e-05,
      "loss": 0.9443,
      "num_input_tokens_seen": 50113079312,
      "step": 63695
    },
    {
      "epoch": 6.757479312539783,
      "grad_norm": 0.6586953776146269,
      "learning_rate": 2.0105191609508873e-05,
      "loss": 0.9463,
      "num_input_tokens_seen": 50113866112,
      "step": 63696
    },
    {
      "epoch": 6.757585402079355,
      "grad_norm": 0.746479645341995,
      "learning_rate": 2.01045100934372e-05,
      "loss": 0.9734,
      "num_input_tokens_seen": 50114652912,
      "step": 63697
    },
    {
      "epoch": 6.757691491618926,
      "grad_norm": 0.6499719717974004,
      "learning_rate": 2.0103828581148616e-05,
      "loss": 1.0231,
      "num_input_tokens_seen": 50115439664,
      "step": 63698
    },
    {
      "epoch": 6.757797581158497,
      "grad_norm": 0.6654939068901676,
      "learning_rate": 2.0103147072643652e-05,
      "loss": 0.9987,
      "num_input_tokens_seen": 50116226480,
      "step": 63699
    },
    {
      "epoch": 6.757903670698069,
      "grad_norm": 0.861594065651766,
      "learning_rate": 2.0102465567922835e-05,
      "loss": 1.0335,
      "num_input_tokens_seen": 50117013248,
      "step": 63700
    },
    {
      "epoch": 6.75800976023764,
      "grad_norm": 0.6951997110111634,
      "learning_rate": 2.010178406698668e-05,
      "loss": 1.069,
      "num_input_tokens_seen": 50117799968,
      "step": 63701
    },
    {
      "epoch": 6.758115849777212,
      "grad_norm": 0.9951441625567907,
      "learning_rate": 2.010110256983573e-05,
      "loss": 1.0206,
      "num_input_tokens_seen": 50118586736,
      "step": 63702
    },
    {
      "epoch": 6.758221939316783,
      "grad_norm": 0.9072790403765095,
      "learning_rate": 2.0100421076470496e-05,
      "loss": 0.953,
      "num_input_tokens_seen": 50119373536,
      "step": 63703
    },
    {
      "epoch": 6.758328028856354,
      "grad_norm": 0.6732978910742928,
      "learning_rate": 2.009973958689152e-05,
      "loss": 1.0416,
      "num_input_tokens_seen": 50120160288,
      "step": 63704
    },
    {
      "epoch": 6.758434118395926,
      "grad_norm": 0.792787131011389,
      "learning_rate": 2.0099058101099322e-05,
      "loss": 0.9756,
      "num_input_tokens_seen": 50120946896,
      "step": 63705
    },
    {
      "epoch": 6.758540207935497,
      "grad_norm": 0.8431229050779695,
      "learning_rate": 2.009837661909442e-05,
      "loss": 0.9399,
      "num_input_tokens_seen": 50121733696,
      "step": 63706
    },
    {
      "epoch": 6.758646297475069,
      "grad_norm": 0.7313790893149322,
      "learning_rate": 2.009769514087736e-05,
      "loss": 0.9808,
      "num_input_tokens_seen": 50122520496,
      "step": 63707
    },
    {
      "epoch": 6.75875238701464,
      "grad_norm": 0.7859909687218682,
      "learning_rate": 2.0097013666448657e-05,
      "loss": 1.0262,
      "num_input_tokens_seen": 50123307232,
      "step": 63708
    },
    {
      "epoch": 6.758858476554212,
      "grad_norm": 0.8277893025051539,
      "learning_rate": 2.0096332195808827e-05,
      "loss": 1.039,
      "num_input_tokens_seen": 50124094000,
      "step": 63709
    },
    {
      "epoch": 6.758964566093783,
      "grad_norm": 1.0296189170009655,
      "learning_rate": 2.0095650728958416e-05,
      "loss": 0.9561,
      "num_input_tokens_seen": 50124880832,
      "step": 63710
    },
    {
      "epoch": 6.759070655633354,
      "grad_norm": 1.132858340025407,
      "learning_rate": 2.0094969265897942e-05,
      "loss": 0.956,
      "num_input_tokens_seen": 50125667632,
      "step": 63711
    },
    {
      "epoch": 6.759176745172926,
      "grad_norm": 0.7796640598057367,
      "learning_rate": 2.0094287806627927e-05,
      "loss": 1.0558,
      "num_input_tokens_seen": 50126454368,
      "step": 63712
    },
    {
      "epoch": 6.759282834712497,
      "grad_norm": 0.7078233730007534,
      "learning_rate": 2.0093606351148906e-05,
      "loss": 0.9538,
      "num_input_tokens_seen": 50127241136,
      "step": 63713
    },
    {
      "epoch": 6.759388924252069,
      "grad_norm": 0.7323749599270796,
      "learning_rate": 2.00929248994614e-05,
      "loss": 0.9619,
      "num_input_tokens_seen": 50128027920,
      "step": 63714
    },
    {
      "epoch": 6.75949501379164,
      "grad_norm": 0.7914661783679466,
      "learning_rate": 2.009224345156594e-05,
      "loss": 0.9646,
      "num_input_tokens_seen": 50128814688,
      "step": 63715
    },
    {
      "epoch": 6.759601103331212,
      "grad_norm": 0.7321161258701597,
      "learning_rate": 2.009156200746305e-05,
      "loss": 1.0246,
      "num_input_tokens_seen": 50129601424,
      "step": 63716
    },
    {
      "epoch": 6.759707192870783,
      "grad_norm": 0.7149219877319593,
      "learning_rate": 2.0090880567153258e-05,
      "loss": 0.935,
      "num_input_tokens_seen": 50130388208,
      "step": 63717
    },
    {
      "epoch": 6.759813282410354,
      "grad_norm": 0.9267983790746042,
      "learning_rate": 2.0090199130637082e-05,
      "loss": 1.0113,
      "num_input_tokens_seen": 50131175008,
      "step": 63718
    },
    {
      "epoch": 6.759919371949926,
      "grad_norm": 0.8374685573094781,
      "learning_rate": 2.0089517697915065e-05,
      "loss": 1.0302,
      "num_input_tokens_seen": 50131961744,
      "step": 63719
    },
    {
      "epoch": 6.760025461489497,
      "grad_norm": 1.2239237899647404,
      "learning_rate": 2.0088836268987718e-05,
      "loss": 0.9646,
      "num_input_tokens_seen": 50132748480,
      "step": 63720
    },
    {
      "epoch": 6.760131551029069,
      "grad_norm": 0.7983251209060642,
      "learning_rate": 2.0088154843855577e-05,
      "loss": 1.0319,
      "num_input_tokens_seen": 50133535232,
      "step": 63721
    },
    {
      "epoch": 6.76023764056864,
      "grad_norm": 0.8993421553484757,
      "learning_rate": 2.008747342251917e-05,
      "loss": 0.9983,
      "num_input_tokens_seen": 50134321936,
      "step": 63722
    },
    {
      "epoch": 6.760343730108211,
      "grad_norm": 1.3029333008193649,
      "learning_rate": 2.0086792004979012e-05,
      "loss": 0.9789,
      "num_input_tokens_seen": 50135108752,
      "step": 63723
    },
    {
      "epoch": 6.760449819647783,
      "grad_norm": 0.8486124975752494,
      "learning_rate": 2.0086110591235643e-05,
      "loss": 1.0575,
      "num_input_tokens_seen": 50135895488,
      "step": 63724
    },
    {
      "epoch": 6.760555909187354,
      "grad_norm": 0.8862926032163453,
      "learning_rate": 2.0085429181289583e-05,
      "loss": 0.9778,
      "num_input_tokens_seen": 50136682208,
      "step": 63725
    },
    {
      "epoch": 6.760661998726926,
      "grad_norm": 1.1559480035449161,
      "learning_rate": 2.0084747775141354e-05,
      "loss": 1.0719,
      "num_input_tokens_seen": 50137468928,
      "step": 63726
    },
    {
      "epoch": 6.760768088266497,
      "grad_norm": 0.8226126206705497,
      "learning_rate": 2.0084066372791492e-05,
      "loss": 0.978,
      "num_input_tokens_seen": 50138255616,
      "step": 63727
    },
    {
      "epoch": 6.760874177806068,
      "grad_norm": 1.0912060534143113,
      "learning_rate": 2.0083384974240522e-05,
      "loss": 1.008,
      "num_input_tokens_seen": 50139042464,
      "step": 63728
    },
    {
      "epoch": 6.76098026734564,
      "grad_norm": 0.8079021284301707,
      "learning_rate": 2.008270357948896e-05,
      "loss": 0.9508,
      "num_input_tokens_seen": 50139829216,
      "step": 63729
    },
    {
      "epoch": 6.761086356885211,
      "grad_norm": 0.8468115654846756,
      "learning_rate": 2.0082022188537346e-05,
      "loss": 0.9507,
      "num_input_tokens_seen": 50140615952,
      "step": 63730
    },
    {
      "epoch": 6.761192446424783,
      "grad_norm": 0.8242052631990895,
      "learning_rate": 2.00813408013862e-05,
      "loss": 0.8983,
      "num_input_tokens_seen": 50141402720,
      "step": 63731
    },
    {
      "epoch": 6.761298535964354,
      "grad_norm": 0.9482321868341453,
      "learning_rate": 2.0080659418036045e-05,
      "loss": 0.9404,
      "num_input_tokens_seen": 50142189472,
      "step": 63732
    },
    {
      "epoch": 6.761404625503925,
      "grad_norm": 0.9543052786414841,
      "learning_rate": 2.007997803848742e-05,
      "loss": 1.0426,
      "num_input_tokens_seen": 50142976192,
      "step": 63733
    },
    {
      "epoch": 6.761510715043497,
      "grad_norm": 0.8055947356866671,
      "learning_rate": 2.007929666274084e-05,
      "loss": 1.0688,
      "num_input_tokens_seen": 50143762880,
      "step": 63734
    },
    {
      "epoch": 6.761616804583068,
      "grad_norm": 0.7170649738565815,
      "learning_rate": 2.007861529079683e-05,
      "loss": 1.0121,
      "num_input_tokens_seen": 50144549616,
      "step": 63735
    },
    {
      "epoch": 6.76172289412264,
      "grad_norm": 0.8660950864707601,
      "learning_rate": 2.007793392265593e-05,
      "loss": 1.0221,
      "num_input_tokens_seen": 50145336288,
      "step": 63736
    },
    {
      "epoch": 6.761828983662211,
      "grad_norm": 0.7256923356574094,
      "learning_rate": 2.007725255831865e-05,
      "loss": 1.1008,
      "num_input_tokens_seen": 50146123008,
      "step": 63737
    },
    {
      "epoch": 6.761935073201783,
      "grad_norm": 0.8002985674240665,
      "learning_rate": 2.007657119778553e-05,
      "loss": 1.0088,
      "num_input_tokens_seen": 50146909728,
      "step": 63738
    },
    {
      "epoch": 6.762041162741354,
      "grad_norm": 0.7550705770240247,
      "learning_rate": 2.0075889841057094e-05,
      "loss": 1.0002,
      "num_input_tokens_seen": 50147696496,
      "step": 63739
    },
    {
      "epoch": 6.762147252280925,
      "grad_norm": 0.692242752454606,
      "learning_rate": 2.007520848813386e-05,
      "loss": 1.0883,
      "num_input_tokens_seen": 50148483216,
      "step": 63740
    },
    {
      "epoch": 6.762253341820497,
      "grad_norm": 0.6516783378729637,
      "learning_rate": 2.0074527139016365e-05,
      "loss": 0.9791,
      "num_input_tokens_seen": 50149270048,
      "step": 63741
    },
    {
      "epoch": 6.762359431360068,
      "grad_norm": 0.6387610640598006,
      "learning_rate": 2.0073845793705132e-05,
      "loss": 0.9554,
      "num_input_tokens_seen": 50150056800,
      "step": 63742
    },
    {
      "epoch": 6.76246552089964,
      "grad_norm": 0.7475006138112887,
      "learning_rate": 2.007316445220068e-05,
      "loss": 0.9794,
      "num_input_tokens_seen": 50150843536,
      "step": 63743
    },
    {
      "epoch": 6.762571610439211,
      "grad_norm": 0.7539891192293197,
      "learning_rate": 2.0072483114503545e-05,
      "loss": 0.9262,
      "num_input_tokens_seen": 50151630352,
      "step": 63744
    },
    {
      "epoch": 6.7626776999787825,
      "grad_norm": 0.8105031373824211,
      "learning_rate": 2.0071801780614254e-05,
      "loss": 1.0093,
      "num_input_tokens_seen": 50152417152,
      "step": 63745
    },
    {
      "epoch": 6.762783789518354,
      "grad_norm": 0.8460886154448809,
      "learning_rate": 2.0071120450533324e-05,
      "loss": 0.9792,
      "num_input_tokens_seen": 50153203920,
      "step": 63746
    },
    {
      "epoch": 6.762889879057925,
      "grad_norm": 0.700101982961299,
      "learning_rate": 2.0070439124261292e-05,
      "loss": 0.9664,
      "num_input_tokens_seen": 50153990704,
      "step": 63747
    },
    {
      "epoch": 6.7629959685974965,
      "grad_norm": 0.667525233022041,
      "learning_rate": 2.006975780179868e-05,
      "loss": 1.0546,
      "num_input_tokens_seen": 50154777408,
      "step": 63748
    },
    {
      "epoch": 6.7631020581370676,
      "grad_norm": 0.704553229770003,
      "learning_rate": 2.006907648314601e-05,
      "loss": 1.0125,
      "num_input_tokens_seen": 50155564112,
      "step": 63749
    },
    {
      "epoch": 6.7632081476766395,
      "grad_norm": 0.7477506514714116,
      "learning_rate": 2.0068395168303816e-05,
      "loss": 0.9685,
      "num_input_tokens_seen": 50156350912,
      "step": 63750
    },
    {
      "epoch": 6.7633142372162105,
      "grad_norm": 0.6749711600532139,
      "learning_rate": 2.0067713857272623e-05,
      "loss": 0.9924,
      "num_input_tokens_seen": 50157137664,
      "step": 63751
    },
    {
      "epoch": 6.7634203267557815,
      "grad_norm": 0.80820660966492,
      "learning_rate": 2.006703255005295e-05,
      "loss": 1.0317,
      "num_input_tokens_seen": 50157924416,
      "step": 63752
    },
    {
      "epoch": 6.7635264162953534,
      "grad_norm": 0.8666387817143806,
      "learning_rate": 2.0066351246645336e-05,
      "loss": 0.9989,
      "num_input_tokens_seen": 50158711136,
      "step": 63753
    },
    {
      "epoch": 6.7636325058349245,
      "grad_norm": 1.2315997030105237,
      "learning_rate": 2.0065669947050298e-05,
      "loss": 0.9478,
      "num_input_tokens_seen": 50159497968,
      "step": 63754
    },
    {
      "epoch": 6.763738595374496,
      "grad_norm": 0.73311308875254,
      "learning_rate": 2.0064988651268365e-05,
      "loss": 0.9949,
      "num_input_tokens_seen": 50160284704,
      "step": 63755
    },
    {
      "epoch": 6.763844684914067,
      "grad_norm": 0.6604580876457137,
      "learning_rate": 2.006430735930007e-05,
      "loss": 0.9392,
      "num_input_tokens_seen": 50161071488,
      "step": 63756
    },
    {
      "epoch": 6.7639507744536385,
      "grad_norm": 0.8534040650758502,
      "learning_rate": 2.0063626071145926e-05,
      "loss": 1.0576,
      "num_input_tokens_seen": 50161858224,
      "step": 63757
    },
    {
      "epoch": 6.76405686399321,
      "grad_norm": 0.871917916648334,
      "learning_rate": 2.006294478680647e-05,
      "loss": 0.9863,
      "num_input_tokens_seen": 50162644896,
      "step": 63758
    },
    {
      "epoch": 6.764162953532781,
      "grad_norm": 0.8870500566484122,
      "learning_rate": 2.0062263506282226e-05,
      "loss": 1.0047,
      "num_input_tokens_seen": 50163431632,
      "step": 63759
    },
    {
      "epoch": 6.764269043072353,
      "grad_norm": 0.8859961848806553,
      "learning_rate": 2.0061582229573717e-05,
      "loss": 1.0247,
      "num_input_tokens_seen": 50164218416,
      "step": 63760
    },
    {
      "epoch": 6.764375132611924,
      "grad_norm": 0.9576675986358418,
      "learning_rate": 2.0060900956681474e-05,
      "loss": 1.0064,
      "num_input_tokens_seen": 50165005120,
      "step": 63761
    },
    {
      "epoch": 6.764481222151495,
      "grad_norm": 0.838132484664154,
      "learning_rate": 2.0060219687606026e-05,
      "loss": 1.0366,
      "num_input_tokens_seen": 50165791824,
      "step": 63762
    },
    {
      "epoch": 6.764587311691067,
      "grad_norm": 0.7763516917251636,
      "learning_rate": 2.0059538422347887e-05,
      "loss": 1.0255,
      "num_input_tokens_seen": 50166578736,
      "step": 63763
    },
    {
      "epoch": 6.764693401230638,
      "grad_norm": 0.7389772329696926,
      "learning_rate": 2.0058857160907597e-05,
      "loss": 0.9997,
      "num_input_tokens_seen": 50167365536,
      "step": 63764
    },
    {
      "epoch": 6.76479949077021,
      "grad_norm": 0.8131797654807793,
      "learning_rate": 2.0058175903285678e-05,
      "loss": 0.9977,
      "num_input_tokens_seen": 50168152256,
      "step": 63765
    },
    {
      "epoch": 6.764905580309781,
      "grad_norm": 0.7987810673522919,
      "learning_rate": 2.005749464948265e-05,
      "loss": 1.0147,
      "num_input_tokens_seen": 50168939008,
      "step": 63766
    },
    {
      "epoch": 6.765011669849353,
      "grad_norm": 0.9327303917020145,
      "learning_rate": 2.0056813399499054e-05,
      "loss": 1.0636,
      "num_input_tokens_seen": 50169725744,
      "step": 63767
    },
    {
      "epoch": 6.765117759388924,
      "grad_norm": 1.1165760752012743,
      "learning_rate": 2.0056132153335396e-05,
      "loss": 1.0562,
      "num_input_tokens_seen": 50170512480,
      "step": 63768
    },
    {
      "epoch": 6.765223848928495,
      "grad_norm": 0.8152656353156269,
      "learning_rate": 2.0055450910992223e-05,
      "loss": 0.9155,
      "num_input_tokens_seen": 50171299264,
      "step": 63769
    },
    {
      "epoch": 6.765329938468067,
      "grad_norm": 0.6880133253531512,
      "learning_rate": 2.0054769672470053e-05,
      "loss": 0.9701,
      "num_input_tokens_seen": 50172086048,
      "step": 63770
    },
    {
      "epoch": 6.765436028007638,
      "grad_norm": 0.9133690994498286,
      "learning_rate": 2.0054088437769404e-05,
      "loss": 1.0316,
      "num_input_tokens_seen": 50172872880,
      "step": 63771
    },
    {
      "epoch": 6.76554211754721,
      "grad_norm": 0.7150277264392603,
      "learning_rate": 2.005340720689082e-05,
      "loss": 1.0181,
      "num_input_tokens_seen": 50173659600,
      "step": 63772
    },
    {
      "epoch": 6.765648207086781,
      "grad_norm": 0.6665048428965784,
      "learning_rate": 2.0052725979834812e-05,
      "loss": 1.0229,
      "num_input_tokens_seen": 50174446368,
      "step": 63773
    },
    {
      "epoch": 6.765754296626353,
      "grad_norm": 0.8873888863496078,
      "learning_rate": 2.005204475660191e-05,
      "loss": 0.9946,
      "num_input_tokens_seen": 50175233040,
      "step": 63774
    },
    {
      "epoch": 6.765860386165924,
      "grad_norm": 0.6581156386596319,
      "learning_rate": 2.005136353719265e-05,
      "loss": 1.0075,
      "num_input_tokens_seen": 50176019792,
      "step": 63775
    },
    {
      "epoch": 6.765966475705495,
      "grad_norm": 0.7850400721408988,
      "learning_rate": 2.0050682321607546e-05,
      "loss": 1.0569,
      "num_input_tokens_seen": 50176806544,
      "step": 63776
    },
    {
      "epoch": 6.766072565245067,
      "grad_norm": 0.9690151695437595,
      "learning_rate": 2.0050001109847128e-05,
      "loss": 1.0026,
      "num_input_tokens_seen": 50177593376,
      "step": 63777
    },
    {
      "epoch": 6.766178654784638,
      "grad_norm": 0.8118859309269791,
      "learning_rate": 2.0049319901911927e-05,
      "loss": 1.0999,
      "num_input_tokens_seen": 50178380080,
      "step": 63778
    },
    {
      "epoch": 6.76628474432421,
      "grad_norm": 0.8495498130815545,
      "learning_rate": 2.004863869780247e-05,
      "loss": 0.9814,
      "num_input_tokens_seen": 50179166880,
      "step": 63779
    },
    {
      "epoch": 6.766390833863781,
      "grad_norm": 0.8227684258075908,
      "learning_rate": 2.004795749751927e-05,
      "loss": 1.0472,
      "num_input_tokens_seen": 50179953664,
      "step": 63780
    },
    {
      "epoch": 6.766496923403352,
      "grad_norm": 0.8021892618724331,
      "learning_rate": 2.0047276301062873e-05,
      "loss": 0.967,
      "num_input_tokens_seen": 50180740400,
      "step": 63781
    },
    {
      "epoch": 6.766603012942924,
      "grad_norm": 0.7619508868111571,
      "learning_rate": 2.0046595108433792e-05,
      "loss": 1.0092,
      "num_input_tokens_seen": 50181527152,
      "step": 63782
    },
    {
      "epoch": 6.766709102482495,
      "grad_norm": 0.7834313035828392,
      "learning_rate": 2.0045913919632554e-05,
      "loss": 0.9474,
      "num_input_tokens_seen": 50182313984,
      "step": 63783
    },
    {
      "epoch": 6.766815192022067,
      "grad_norm": 0.7011727344522645,
      "learning_rate": 2.004523273465969e-05,
      "loss": 1.0455,
      "num_input_tokens_seen": 50183100784,
      "step": 63784
    },
    {
      "epoch": 6.766921281561638,
      "grad_norm": 1.1034356188880874,
      "learning_rate": 2.0044551553515723e-05,
      "loss": 1.0205,
      "num_input_tokens_seen": 50183887488,
      "step": 63785
    },
    {
      "epoch": 6.767027371101209,
      "grad_norm": 1.1989550803884805,
      "learning_rate": 2.0043870376201184e-05,
      "loss": 0.9655,
      "num_input_tokens_seen": 50184674272,
      "step": 63786
    },
    {
      "epoch": 6.767133460640781,
      "grad_norm": 0.6347932886466721,
      "learning_rate": 2.00431892027166e-05,
      "loss": 0.9917,
      "num_input_tokens_seen": 50185461088,
      "step": 63787
    },
    {
      "epoch": 6.767239550180352,
      "grad_norm": 0.75544668307236,
      "learning_rate": 2.0042508033062486e-05,
      "loss": 0.9447,
      "num_input_tokens_seen": 50186247872,
      "step": 63788
    },
    {
      "epoch": 6.767345639719924,
      "grad_norm": 0.7506181634703625,
      "learning_rate": 2.004182686723938e-05,
      "loss": 0.9978,
      "num_input_tokens_seen": 50187034624,
      "step": 63789
    },
    {
      "epoch": 6.767451729259495,
      "grad_norm": 0.7224800940584638,
      "learning_rate": 2.0041145705247797e-05,
      "loss": 1.0231,
      "num_input_tokens_seen": 50187821376,
      "step": 63790
    },
    {
      "epoch": 6.767557818799066,
      "grad_norm": 0.7801012429842695,
      "learning_rate": 2.004046454708828e-05,
      "loss": 0.9634,
      "num_input_tokens_seen": 50188608144,
      "step": 63791
    },
    {
      "epoch": 6.767663908338638,
      "grad_norm": 0.6499810034926002,
      "learning_rate": 2.0039783392761342e-05,
      "loss": 0.8999,
      "num_input_tokens_seen": 50189394864,
      "step": 63792
    },
    {
      "epoch": 6.767769997878209,
      "grad_norm": 0.7612998714199785,
      "learning_rate": 2.003910224226752e-05,
      "loss": 0.945,
      "num_input_tokens_seen": 50190181664,
      "step": 63793
    },
    {
      "epoch": 6.767876087417781,
      "grad_norm": 0.8113375578032382,
      "learning_rate": 2.0038421095607335e-05,
      "loss": 0.9619,
      "num_input_tokens_seen": 50190968416,
      "step": 63794
    },
    {
      "epoch": 6.767982176957352,
      "grad_norm": 0.7691772093853708,
      "learning_rate": 2.0037739952781304e-05,
      "loss": 1.0032,
      "num_input_tokens_seen": 50191755152,
      "step": 63795
    },
    {
      "epoch": 6.768088266496924,
      "grad_norm": 0.8818930057164457,
      "learning_rate": 2.003705881378997e-05,
      "loss": 1.0405,
      "num_input_tokens_seen": 50192541920,
      "step": 63796
    },
    {
      "epoch": 6.768194356036495,
      "grad_norm": 0.8269595861783849,
      "learning_rate": 2.003637767863385e-05,
      "loss": 0.9995,
      "num_input_tokens_seen": 50193328672,
      "step": 63797
    },
    {
      "epoch": 6.768300445576067,
      "grad_norm": 0.8293646531773543,
      "learning_rate": 2.0035696547313464e-05,
      "loss": 1.1103,
      "num_input_tokens_seen": 50194115488,
      "step": 63798
    },
    {
      "epoch": 6.768406535115638,
      "grad_norm": 0.9405486316457056,
      "learning_rate": 2.0035015419829358e-05,
      "loss": 1.027,
      "num_input_tokens_seen": 50194902272,
      "step": 63799
    },
    {
      "epoch": 6.768512624655209,
      "grad_norm": 0.9338608844100671,
      "learning_rate": 2.003433429618204e-05,
      "loss": 1.0173,
      "num_input_tokens_seen": 50195689120,
      "step": 63800
    },
    {
      "epoch": 6.768618714194781,
      "grad_norm": 0.89961974551739,
      "learning_rate": 2.0033653176372042e-05,
      "loss": 1.0593,
      "num_input_tokens_seen": 50196475856,
      "step": 63801
    },
    {
      "epoch": 6.768724803734352,
      "grad_norm": 0.9012474978971441,
      "learning_rate": 2.0032972060399893e-05,
      "loss": 1.0272,
      "num_input_tokens_seen": 50197262624,
      "step": 63802
    },
    {
      "epoch": 6.768830893273924,
      "grad_norm": 0.7888526642418751,
      "learning_rate": 2.0032290948266118e-05,
      "loss": 0.9783,
      "num_input_tokens_seen": 50198049392,
      "step": 63803
    },
    {
      "epoch": 6.768936982813495,
      "grad_norm": 0.7433223878149344,
      "learning_rate": 2.0031609839971238e-05,
      "loss": 1.0098,
      "num_input_tokens_seen": 50198836176,
      "step": 63804
    },
    {
      "epoch": 6.769043072353066,
      "grad_norm": 0.9442897210136644,
      "learning_rate": 2.0030928735515793e-05,
      "loss": 1.108,
      "num_input_tokens_seen": 50199622848,
      "step": 63805
    },
    {
      "epoch": 6.769149161892638,
      "grad_norm": 1.220637107390151,
      "learning_rate": 2.003024763490029e-05,
      "loss": 0.9279,
      "num_input_tokens_seen": 50200409584,
      "step": 63806
    },
    {
      "epoch": 6.769255251432209,
      "grad_norm": 0.7148262307075494,
      "learning_rate": 2.0029566538125272e-05,
      "loss": 0.9763,
      "num_input_tokens_seen": 50201196400,
      "step": 63807
    },
    {
      "epoch": 6.7693613409717805,
      "grad_norm": 0.9018820024802376,
      "learning_rate": 2.002888544519126e-05,
      "loss": 0.9626,
      "num_input_tokens_seen": 50201983136,
      "step": 63808
    },
    {
      "epoch": 6.769467430511352,
      "grad_norm": 0.8580536757717323,
      "learning_rate": 2.0028204356098773e-05,
      "loss": 1.0302,
      "num_input_tokens_seen": 50202769808,
      "step": 63809
    },
    {
      "epoch": 6.769573520050923,
      "grad_norm": 0.8129966794687804,
      "learning_rate": 2.0027523270848353e-05,
      "loss": 0.9701,
      "num_input_tokens_seen": 50203556608,
      "step": 63810
    },
    {
      "epoch": 6.7696796095904945,
      "grad_norm": 1.0505495637155802,
      "learning_rate": 2.0026842189440515e-05,
      "loss": 0.9594,
      "num_input_tokens_seen": 50204343376,
      "step": 63811
    },
    {
      "epoch": 6.769785699130066,
      "grad_norm": 0.9590871545859418,
      "learning_rate": 2.002616111187578e-05,
      "loss": 0.9359,
      "num_input_tokens_seen": 50205130256,
      "step": 63812
    },
    {
      "epoch": 6.7698917886696375,
      "grad_norm": 0.7981459554498382,
      "learning_rate": 2.0025480038154686e-05,
      "loss": 0.9226,
      "num_input_tokens_seen": 50205917056,
      "step": 63813
    },
    {
      "epoch": 6.7699978782092085,
      "grad_norm": 0.7362672388848477,
      "learning_rate": 2.002479896827776e-05,
      "loss": 1.0094,
      "num_input_tokens_seen": 50206703888,
      "step": 63814
    },
    {
      "epoch": 6.7701039677487795,
      "grad_norm": 0.6485508648908759,
      "learning_rate": 2.0024117902245516e-05,
      "loss": 1.0205,
      "num_input_tokens_seen": 50207490672,
      "step": 63815
    },
    {
      "epoch": 6.7702100572883515,
      "grad_norm": 0.8049402716803143,
      "learning_rate": 2.0023436840058492e-05,
      "loss": 1.0438,
      "num_input_tokens_seen": 50208277456,
      "step": 63816
    },
    {
      "epoch": 6.7703161468279225,
      "grad_norm": 0.6251271305095322,
      "learning_rate": 2.002275578171721e-05,
      "loss": 0.9534,
      "num_input_tokens_seen": 50209064224,
      "step": 63817
    },
    {
      "epoch": 6.770422236367494,
      "grad_norm": 0.6979326106210513,
      "learning_rate": 2.002207472722219e-05,
      "loss": 1.0176,
      "num_input_tokens_seen": 50209851024,
      "step": 63818
    },
    {
      "epoch": 6.770528325907065,
      "grad_norm": 0.8039127620588188,
      "learning_rate": 2.0021393676573976e-05,
      "loss": 0.99,
      "num_input_tokens_seen": 50210637776,
      "step": 63819
    },
    {
      "epoch": 6.7706344154466365,
      "grad_norm": 0.7498558556783126,
      "learning_rate": 2.0020712629773078e-05,
      "loss": 0.9848,
      "num_input_tokens_seen": 50211424544,
      "step": 63820
    },
    {
      "epoch": 6.770740504986208,
      "grad_norm": 0.7735605067882938,
      "learning_rate": 2.002003158682002e-05,
      "loss": 1.0324,
      "num_input_tokens_seen": 50212211248,
      "step": 63821
    },
    {
      "epoch": 6.770846594525779,
      "grad_norm": 0.76694738326963,
      "learning_rate": 2.0019350547715343e-05,
      "loss": 1.0665,
      "num_input_tokens_seen": 50212998080,
      "step": 63822
    },
    {
      "epoch": 6.770952684065351,
      "grad_norm": 0.7738690185201093,
      "learning_rate": 2.0018669512459562e-05,
      "loss": 0.9669,
      "num_input_tokens_seen": 50213784752,
      "step": 63823
    },
    {
      "epoch": 6.771058773604922,
      "grad_norm": 0.7708505927002487,
      "learning_rate": 2.0017988481053214e-05,
      "loss": 0.9392,
      "num_input_tokens_seen": 50214571440,
      "step": 63824
    },
    {
      "epoch": 6.771164863144494,
      "grad_norm": 0.785026311051637,
      "learning_rate": 2.0017307453496813e-05,
      "loss": 0.9947,
      "num_input_tokens_seen": 50215358208,
      "step": 63825
    },
    {
      "epoch": 6.771270952684065,
      "grad_norm": 0.9727292996505776,
      "learning_rate": 2.0016626429790886e-05,
      "loss": 1.0457,
      "num_input_tokens_seen": 50216144992,
      "step": 63826
    },
    {
      "epoch": 6.771377042223637,
      "grad_norm": 0.7165778865992368,
      "learning_rate": 2.001594540993597e-05,
      "loss": 0.965,
      "num_input_tokens_seen": 50216931760,
      "step": 63827
    },
    {
      "epoch": 6.771483131763208,
      "grad_norm": 0.7297147621035548,
      "learning_rate": 2.0015264393932587e-05,
      "loss": 1.0051,
      "num_input_tokens_seen": 50217718416,
      "step": 63828
    },
    {
      "epoch": 6.771589221302779,
      "grad_norm": 0.8550741927974732,
      "learning_rate": 2.0014583381781256e-05,
      "loss": 1.0597,
      "num_input_tokens_seen": 50218505200,
      "step": 63829
    },
    {
      "epoch": 6.771695310842351,
      "grad_norm": 0.7513803970200302,
      "learning_rate": 2.0013902373482512e-05,
      "loss": 0.9815,
      "num_input_tokens_seen": 50219291952,
      "step": 63830
    },
    {
      "epoch": 6.771801400381922,
      "grad_norm": 0.7291012113948768,
      "learning_rate": 2.001322136903688e-05,
      "loss": 0.9926,
      "num_input_tokens_seen": 50220078736,
      "step": 63831
    },
    {
      "epoch": 6.771907489921494,
      "grad_norm": 0.7748205449178448,
      "learning_rate": 2.0012540368444876e-05,
      "loss": 0.9863,
      "num_input_tokens_seen": 50220865504,
      "step": 63832
    },
    {
      "epoch": 6.772013579461065,
      "grad_norm": 0.7056177193936723,
      "learning_rate": 2.001185937170704e-05,
      "loss": 0.9915,
      "num_input_tokens_seen": 50221652336,
      "step": 63833
    },
    {
      "epoch": 6.772119669000636,
      "grad_norm": 0.7230633504793964,
      "learning_rate": 2.0011178378823897e-05,
      "loss": 1.0356,
      "num_input_tokens_seen": 50222439056,
      "step": 63834
    },
    {
      "epoch": 6.772225758540208,
      "grad_norm": 0.8145241169882186,
      "learning_rate": 2.0010497389795963e-05,
      "loss": 1.0577,
      "num_input_tokens_seen": 50223225808,
      "step": 63835
    },
    {
      "epoch": 6.772331848079779,
      "grad_norm": 0.7159340759602834,
      "learning_rate": 2.0009816404623773e-05,
      "loss": 1.0399,
      "num_input_tokens_seen": 50224012560,
      "step": 63836
    },
    {
      "epoch": 6.772437937619351,
      "grad_norm": 0.9156781102105951,
      "learning_rate": 2.000913542330785e-05,
      "loss": 1.1005,
      "num_input_tokens_seen": 50224799280,
      "step": 63837
    },
    {
      "epoch": 6.772544027158922,
      "grad_norm": 0.7162326535130761,
      "learning_rate": 2.0008454445848718e-05,
      "loss": 1.0645,
      "num_input_tokens_seen": 50225585968,
      "step": 63838
    },
    {
      "epoch": 6.772650116698493,
      "grad_norm": 0.7002744094646223,
      "learning_rate": 2.0007773472246907e-05,
      "loss": 0.9162,
      "num_input_tokens_seen": 50226372656,
      "step": 63839
    },
    {
      "epoch": 6.772756206238065,
      "grad_norm": 0.726379926116398,
      "learning_rate": 2.000709250250294e-05,
      "loss": 1.0389,
      "num_input_tokens_seen": 50227159392,
      "step": 63840
    },
    {
      "epoch": 6.772862295777636,
      "grad_norm": 0.8032125787773081,
      "learning_rate": 2.000641153661735e-05,
      "loss": 1.0596,
      "num_input_tokens_seen": 50227946048,
      "step": 63841
    },
    {
      "epoch": 6.772968385317208,
      "grad_norm": 0.8368285424904788,
      "learning_rate": 2.0005730574590657e-05,
      "loss": 1.0082,
      "num_input_tokens_seen": 50228732784,
      "step": 63842
    },
    {
      "epoch": 6.773074474856779,
      "grad_norm": 0.9594102186808859,
      "learning_rate": 2.000504961642339e-05,
      "loss": 1.015,
      "num_input_tokens_seen": 50229519536,
      "step": 63843
    },
    {
      "epoch": 6.77318056439635,
      "grad_norm": 0.7657668591126074,
      "learning_rate": 2.0004368662116073e-05,
      "loss": 1.0093,
      "num_input_tokens_seen": 50230306288,
      "step": 63844
    },
    {
      "epoch": 6.773286653935922,
      "grad_norm": 1.0529114203142838,
      "learning_rate": 2.0003687711669236e-05,
      "loss": 1.0441,
      "num_input_tokens_seen": 50231092960,
      "step": 63845
    },
    {
      "epoch": 6.773392743475493,
      "grad_norm": 0.7756934970936408,
      "learning_rate": 2.0003006765083395e-05,
      "loss": 1.0069,
      "num_input_tokens_seen": 50231879728,
      "step": 63846
    },
    {
      "epoch": 6.773498833015065,
      "grad_norm": 0.8813920478006231,
      "learning_rate": 2.0002325822359093e-05,
      "loss": 1.0114,
      "num_input_tokens_seen": 50232666608,
      "step": 63847
    },
    {
      "epoch": 6.773604922554636,
      "grad_norm": 0.7578010455182649,
      "learning_rate": 2.0001644883496844e-05,
      "loss": 1.025,
      "num_input_tokens_seen": 50233453328,
      "step": 63848
    },
    {
      "epoch": 6.773711012094208,
      "grad_norm": 0.6814301193088103,
      "learning_rate": 2.000096394849717e-05,
      "loss": 0.9082,
      "num_input_tokens_seen": 50234240128,
      "step": 63849
    },
    {
      "epoch": 6.773817101633779,
      "grad_norm": 0.8892812755173652,
      "learning_rate": 2.0000283017360614e-05,
      "loss": 0.9547,
      "num_input_tokens_seen": 50235026896,
      "step": 63850
    },
    {
      "epoch": 6.77392319117335,
      "grad_norm": 0.8748993083690351,
      "learning_rate": 1.999960209008769e-05,
      "loss": 1.0079,
      "num_input_tokens_seen": 50235813680,
      "step": 63851
    },
    {
      "epoch": 6.774029280712922,
      "grad_norm": 0.7152755427443939,
      "learning_rate": 1.9998921166678923e-05,
      "loss": 1.0208,
      "num_input_tokens_seen": 50236600480,
      "step": 63852
    },
    {
      "epoch": 6.774135370252493,
      "grad_norm": 0.7279237330508478,
      "learning_rate": 1.9998240247134846e-05,
      "loss": 1.052,
      "num_input_tokens_seen": 50237387296,
      "step": 63853
    },
    {
      "epoch": 6.774241459792065,
      "grad_norm": 0.8049475167524306,
      "learning_rate": 1.9997559331455984e-05,
      "loss": 1.0022,
      "num_input_tokens_seen": 50238174096,
      "step": 63854
    },
    {
      "epoch": 6.774347549331636,
      "grad_norm": 0.8237725736791763,
      "learning_rate": 1.9996878419642854e-05,
      "loss": 0.9734,
      "num_input_tokens_seen": 50238960896,
      "step": 63855
    },
    {
      "epoch": 6.774453638871208,
      "grad_norm": 0.8069013268278327,
      "learning_rate": 1.9996197511695997e-05,
      "loss": 0.995,
      "num_input_tokens_seen": 50239747680,
      "step": 63856
    },
    {
      "epoch": 6.774559728410779,
      "grad_norm": 0.7366756105229985,
      "learning_rate": 1.9995516607615926e-05,
      "loss": 1.0176,
      "num_input_tokens_seen": 50240534368,
      "step": 63857
    },
    {
      "epoch": 6.77466581795035,
      "grad_norm": 0.741304473132503,
      "learning_rate": 1.9994835707403177e-05,
      "loss": 1.0233,
      "num_input_tokens_seen": 50241321136,
      "step": 63858
    },
    {
      "epoch": 6.774771907489922,
      "grad_norm": 0.8135923815748858,
      "learning_rate": 1.9994154811058275e-05,
      "loss": 1.006,
      "num_input_tokens_seen": 50242107856,
      "step": 63859
    },
    {
      "epoch": 6.774877997029493,
      "grad_norm": 0.9353184873388743,
      "learning_rate": 1.9993473918581736e-05,
      "loss": 1.0002,
      "num_input_tokens_seen": 50242894624,
      "step": 63860
    },
    {
      "epoch": 6.774984086569065,
      "grad_norm": 0.7662913315480945,
      "learning_rate": 1.99927930299741e-05,
      "loss": 1.0306,
      "num_input_tokens_seen": 50243681392,
      "step": 63861
    },
    {
      "epoch": 6.775090176108636,
      "grad_norm": 0.9179849753392093,
      "learning_rate": 1.9992112145235885e-05,
      "loss": 1.0515,
      "num_input_tokens_seen": 50244468112,
      "step": 63862
    },
    {
      "epoch": 6.775196265648207,
      "grad_norm": 0.6647708809265606,
      "learning_rate": 1.9991431264367614e-05,
      "loss": 0.9205,
      "num_input_tokens_seen": 50245254944,
      "step": 63863
    },
    {
      "epoch": 6.775302355187779,
      "grad_norm": 0.79183163778803,
      "learning_rate": 1.9990750387369822e-05,
      "loss": 0.9761,
      "num_input_tokens_seen": 50246041760,
      "step": 63864
    },
    {
      "epoch": 6.77540844472735,
      "grad_norm": 1.061276313451459,
      "learning_rate": 1.9990069514243032e-05,
      "loss": 1.0422,
      "num_input_tokens_seen": 50246828512,
      "step": 63865
    },
    {
      "epoch": 6.775514534266922,
      "grad_norm": 0.7516370266858693,
      "learning_rate": 1.9989388644987765e-05,
      "loss": 0.9245,
      "num_input_tokens_seen": 50247615280,
      "step": 63866
    },
    {
      "epoch": 6.775620623806493,
      "grad_norm": 0.9563955705369116,
      "learning_rate": 1.9988707779604557e-05,
      "loss": 1.0448,
      "num_input_tokens_seen": 50248401968,
      "step": 63867
    },
    {
      "epoch": 6.775726713346064,
      "grad_norm": 0.9014048740606184,
      "learning_rate": 1.9988026918093926e-05,
      "loss": 0.9891,
      "num_input_tokens_seen": 50249188656,
      "step": 63868
    },
    {
      "epoch": 6.775832802885636,
      "grad_norm": 0.7893086270491105,
      "learning_rate": 1.9987346060456397e-05,
      "loss": 1.0371,
      "num_input_tokens_seen": 50249975408,
      "step": 63869
    },
    {
      "epoch": 6.775938892425207,
      "grad_norm": 0.8163809667706898,
      "learning_rate": 1.9986665206692506e-05,
      "loss": 1.0019,
      "num_input_tokens_seen": 50250762192,
      "step": 63870
    },
    {
      "epoch": 6.776044981964779,
      "grad_norm": 0.9270349364760011,
      "learning_rate": 1.9985984356802774e-05,
      "loss": 1.0501,
      "num_input_tokens_seen": 50251548944,
      "step": 63871
    },
    {
      "epoch": 6.77615107150435,
      "grad_norm": 0.8582024648305725,
      "learning_rate": 1.9985303510787716e-05,
      "loss": 0.9956,
      "num_input_tokens_seen": 50252335728,
      "step": 63872
    },
    {
      "epoch": 6.776257161043921,
      "grad_norm": 0.7939143172529163,
      "learning_rate": 1.9984622668647878e-05,
      "loss": 1.063,
      "num_input_tokens_seen": 50253122416,
      "step": 63873
    },
    {
      "epoch": 6.7763632505834925,
      "grad_norm": 1.0595904779127134,
      "learning_rate": 1.998394183038377e-05,
      "loss": 1.0061,
      "num_input_tokens_seen": 50253909248,
      "step": 63874
    },
    {
      "epoch": 6.776469340123064,
      "grad_norm": 0.9767614968646269,
      "learning_rate": 1.9983260995995932e-05,
      "loss": 1.0091,
      "num_input_tokens_seen": 50254696000,
      "step": 63875
    },
    {
      "epoch": 6.7765754296626355,
      "grad_norm": 0.9485215969662655,
      "learning_rate": 1.998258016548488e-05,
      "loss": 1.0551,
      "num_input_tokens_seen": 50255482768,
      "step": 63876
    },
    {
      "epoch": 6.7766815192022065,
      "grad_norm": 0.8254760310543631,
      "learning_rate": 1.9981899338851136e-05,
      "loss": 1.0327,
      "num_input_tokens_seen": 50256269392,
      "step": 63877
    },
    {
      "epoch": 6.776787608741778,
      "grad_norm": 0.8476983225213703,
      "learning_rate": 1.998121851609524e-05,
      "loss": 1.0365,
      "num_input_tokens_seen": 50257056128,
      "step": 63878
    },
    {
      "epoch": 6.7768936982813495,
      "grad_norm": 0.8622554925712205,
      "learning_rate": 1.9980537697217712e-05,
      "loss": 0.9379,
      "num_input_tokens_seen": 50257842816,
      "step": 63879
    },
    {
      "epoch": 6.7769997878209205,
      "grad_norm": 0.7821718897913378,
      "learning_rate": 1.9979856882219073e-05,
      "loss": 0.9647,
      "num_input_tokens_seen": 50258629472,
      "step": 63880
    },
    {
      "epoch": 6.777105877360492,
      "grad_norm": 0.7969804933769022,
      "learning_rate": 1.9979176071099855e-05,
      "loss": 0.9912,
      "num_input_tokens_seen": 50259416288,
      "step": 63881
    },
    {
      "epoch": 6.7772119669000634,
      "grad_norm": 0.7427042324702262,
      "learning_rate": 1.9978495263860587e-05,
      "loss": 1.0235,
      "num_input_tokens_seen": 50260202992,
      "step": 63882
    },
    {
      "epoch": 6.777318056439635,
      "grad_norm": 0.8279733082404969,
      "learning_rate": 1.9977814460501783e-05,
      "loss": 1.0509,
      "num_input_tokens_seen": 50260989696,
      "step": 63883
    },
    {
      "epoch": 6.777424145979206,
      "grad_norm": 0.9343438175803317,
      "learning_rate": 1.997713366102398e-05,
      "loss": 0.9773,
      "num_input_tokens_seen": 50261776512,
      "step": 63884
    },
    {
      "epoch": 6.777530235518778,
      "grad_norm": 0.9533102340823386,
      "learning_rate": 1.997645286542769e-05,
      "loss": 0.9696,
      "num_input_tokens_seen": 50262563296,
      "step": 63885
    },
    {
      "epoch": 6.777636325058349,
      "grad_norm": 0.792526316246514,
      "learning_rate": 1.9975772073713462e-05,
      "loss": 1.031,
      "num_input_tokens_seen": 50263349984,
      "step": 63886
    },
    {
      "epoch": 6.77774241459792,
      "grad_norm": 0.6658275446538717,
      "learning_rate": 1.9975091285881805e-05,
      "loss": 0.9692,
      "num_input_tokens_seen": 50264136800,
      "step": 63887
    },
    {
      "epoch": 6.777848504137492,
      "grad_norm": 0.713853025498413,
      "learning_rate": 1.9974410501933256e-05,
      "loss": 1.0109,
      "num_input_tokens_seen": 50264923648,
      "step": 63888
    },
    {
      "epoch": 6.777954593677063,
      "grad_norm": 0.7282030616274392,
      "learning_rate": 1.9973729721868333e-05,
      "loss": 0.9667,
      "num_input_tokens_seen": 50265710416,
      "step": 63889
    },
    {
      "epoch": 6.778060683216635,
      "grad_norm": 0.6277688089050132,
      "learning_rate": 1.997304894568756e-05,
      "loss": 0.9928,
      "num_input_tokens_seen": 50266497216,
      "step": 63890
    },
    {
      "epoch": 6.778166772756206,
      "grad_norm": 0.6535338026479909,
      "learning_rate": 1.9972368173391474e-05,
      "loss": 0.9705,
      "num_input_tokens_seen": 50267284000,
      "step": 63891
    },
    {
      "epoch": 6.778272862295777,
      "grad_norm": 0.8063491939564694,
      "learning_rate": 1.9971687404980592e-05,
      "loss": 1.0891,
      "num_input_tokens_seen": 50268070800,
      "step": 63892
    },
    {
      "epoch": 6.778378951835349,
      "grad_norm": 0.7230740211622423,
      "learning_rate": 1.9971006640455437e-05,
      "loss": 0.9573,
      "num_input_tokens_seen": 50268857616,
      "step": 63893
    },
    {
      "epoch": 6.77848504137492,
      "grad_norm": 0.6861649602320022,
      "learning_rate": 1.9970325879816547e-05,
      "loss": 1.0561,
      "num_input_tokens_seen": 50269644336,
      "step": 63894
    },
    {
      "epoch": 6.778591130914492,
      "grad_norm": 0.7874513448797253,
      "learning_rate": 1.9969645123064437e-05,
      "loss": 1.019,
      "num_input_tokens_seen": 50270431104,
      "step": 63895
    },
    {
      "epoch": 6.778697220454063,
      "grad_norm": 0.7764853362466164,
      "learning_rate": 1.9968964370199642e-05,
      "loss": 1.097,
      "num_input_tokens_seen": 50271217904,
      "step": 63896
    },
    {
      "epoch": 6.778803309993634,
      "grad_norm": 0.6793828693775645,
      "learning_rate": 1.9968283621222685e-05,
      "loss": 1.0013,
      "num_input_tokens_seen": 50272004736,
      "step": 63897
    },
    {
      "epoch": 6.778909399533206,
      "grad_norm": 0.8618513312436427,
      "learning_rate": 1.9967602876134083e-05,
      "loss": 1.0251,
      "num_input_tokens_seen": 50272791584,
      "step": 63898
    },
    {
      "epoch": 6.779015489072777,
      "grad_norm": 0.7023607630961837,
      "learning_rate": 1.9966922134934375e-05,
      "loss": 1.0858,
      "num_input_tokens_seen": 50273578336,
      "step": 63899
    },
    {
      "epoch": 6.779121578612349,
      "grad_norm": 0.8670504967370857,
      "learning_rate": 1.9966241397624087e-05,
      "loss": 1.0481,
      "num_input_tokens_seen": 50274365104,
      "step": 63900
    },
    {
      "epoch": 6.77922766815192,
      "grad_norm": 1.0511416516077428,
      "learning_rate": 1.996556066420373e-05,
      "loss": 1.051,
      "num_input_tokens_seen": 50275151824,
      "step": 63901
    },
    {
      "epoch": 6.779333757691491,
      "grad_norm": 0.7536277747206405,
      "learning_rate": 1.9964879934673846e-05,
      "loss": 0.9793,
      "num_input_tokens_seen": 50275938688,
      "step": 63902
    },
    {
      "epoch": 6.779439847231063,
      "grad_norm": 0.8475256375287574,
      "learning_rate": 1.9964199209034953e-05,
      "loss": 0.9945,
      "num_input_tokens_seen": 50276725360,
      "step": 63903
    },
    {
      "epoch": 6.779545936770634,
      "grad_norm": 0.7697310030348473,
      "learning_rate": 1.9963518487287577e-05,
      "loss": 0.9492,
      "num_input_tokens_seen": 50277512176,
      "step": 63904
    },
    {
      "epoch": 6.779652026310206,
      "grad_norm": 0.646675901868167,
      "learning_rate": 1.9962837769432253e-05,
      "loss": 0.9714,
      "num_input_tokens_seen": 50278299056,
      "step": 63905
    },
    {
      "epoch": 6.779758115849777,
      "grad_norm": 0.933627582366946,
      "learning_rate": 1.9962157055469493e-05,
      "loss": 0.9252,
      "num_input_tokens_seen": 50279085888,
      "step": 63906
    },
    {
      "epoch": 6.779864205389349,
      "grad_norm": 0.8407219401603458,
      "learning_rate": 1.9961476345399832e-05,
      "loss": 0.9865,
      "num_input_tokens_seen": 50279872672,
      "step": 63907
    },
    {
      "epoch": 6.77997029492892,
      "grad_norm": 0.771157224049481,
      "learning_rate": 1.9960795639223798e-05,
      "loss": 0.9964,
      "num_input_tokens_seen": 50280659424,
      "step": 63908
    },
    {
      "epoch": 6.780076384468491,
      "grad_norm": 0.8465486374195361,
      "learning_rate": 1.9960114936941907e-05,
      "loss": 0.897,
      "num_input_tokens_seen": 50281446112,
      "step": 63909
    },
    {
      "epoch": 6.780182474008063,
      "grad_norm": 0.87940696009874,
      "learning_rate": 1.9959434238554697e-05,
      "loss": 1.0187,
      "num_input_tokens_seen": 50282232912,
      "step": 63910
    },
    {
      "epoch": 6.780288563547634,
      "grad_norm": 0.8400991497429844,
      "learning_rate": 1.9958753544062687e-05,
      "loss": 1.0017,
      "num_input_tokens_seen": 50283019728,
      "step": 63911
    },
    {
      "epoch": 6.780394653087206,
      "grad_norm": 0.8261889412703696,
      "learning_rate": 1.99580728534664e-05,
      "loss": 1.0908,
      "num_input_tokens_seen": 50283806448,
      "step": 63912
    },
    {
      "epoch": 6.780500742626777,
      "grad_norm": 0.8345458102647391,
      "learning_rate": 1.995739216676637e-05,
      "loss": 1.0509,
      "num_input_tokens_seen": 50284593264,
      "step": 63913
    },
    {
      "epoch": 6.780606832166349,
      "grad_norm": 0.8229205378525657,
      "learning_rate": 1.995671148396312e-05,
      "loss": 0.9396,
      "num_input_tokens_seen": 50285380000,
      "step": 63914
    },
    {
      "epoch": 6.78071292170592,
      "grad_norm": 0.9502794259494298,
      "learning_rate": 1.9956030805057175e-05,
      "loss": 1.0523,
      "num_input_tokens_seen": 50286166768,
      "step": 63915
    },
    {
      "epoch": 6.780819011245491,
      "grad_norm": 0.8967263917221912,
      "learning_rate": 1.995535013004906e-05,
      "loss": 1.0376,
      "num_input_tokens_seen": 50286953472,
      "step": 63916
    },
    {
      "epoch": 6.780925100785063,
      "grad_norm": 0.7314284795817183,
      "learning_rate": 1.9954669458939306e-05,
      "loss": 0.9844,
      "num_input_tokens_seen": 50287740160,
      "step": 63917
    },
    {
      "epoch": 6.781031190324634,
      "grad_norm": 0.8606208531809983,
      "learning_rate": 1.9953988791728428e-05,
      "loss": 1.0208,
      "num_input_tokens_seen": 50288526976,
      "step": 63918
    },
    {
      "epoch": 6.781137279864206,
      "grad_norm": 0.7821907317894795,
      "learning_rate": 1.995330812841697e-05,
      "loss": 0.8476,
      "num_input_tokens_seen": 50289313840,
      "step": 63919
    },
    {
      "epoch": 6.781243369403777,
      "grad_norm": 0.7345311662295876,
      "learning_rate": 1.9952627469005443e-05,
      "loss": 0.9762,
      "num_input_tokens_seen": 50290100640,
      "step": 63920
    },
    {
      "epoch": 6.781349458943348,
      "grad_norm": 0.8989511516550494,
      "learning_rate": 1.995194681349437e-05,
      "loss": 0.9741,
      "num_input_tokens_seen": 50290887376,
      "step": 63921
    },
    {
      "epoch": 6.78145554848292,
      "grad_norm": 0.7321549971892994,
      "learning_rate": 1.9951266161884293e-05,
      "loss": 1.0223,
      "num_input_tokens_seen": 50291674144,
      "step": 63922
    },
    {
      "epoch": 6.781561638022491,
      "grad_norm": 0.8073217583769324,
      "learning_rate": 1.995058551417573e-05,
      "loss": 1.0216,
      "num_input_tokens_seen": 50292460832,
      "step": 63923
    },
    {
      "epoch": 6.781667727562063,
      "grad_norm": 0.6952897501433718,
      "learning_rate": 1.9949904870369197e-05,
      "loss": 0.8687,
      "num_input_tokens_seen": 50293247680,
      "step": 63924
    },
    {
      "epoch": 6.781773817101634,
      "grad_norm": 0.7123061487514112,
      "learning_rate": 1.9949224230465238e-05,
      "loss": 1.0143,
      "num_input_tokens_seen": 50294034400,
      "step": 63925
    },
    {
      "epoch": 6.781879906641205,
      "grad_norm": 0.7539456463451687,
      "learning_rate": 1.9948543594464363e-05,
      "loss": 0.9637,
      "num_input_tokens_seen": 50294821232,
      "step": 63926
    },
    {
      "epoch": 6.781985996180777,
      "grad_norm": 0.7431302951608935,
      "learning_rate": 1.9947862962367114e-05,
      "loss": 1.0439,
      "num_input_tokens_seen": 50295608000,
      "step": 63927
    },
    {
      "epoch": 6.782092085720348,
      "grad_norm": 0.8173154290440122,
      "learning_rate": 1.994718233417401e-05,
      "loss": 1.0857,
      "num_input_tokens_seen": 50296394752,
      "step": 63928
    },
    {
      "epoch": 6.78219817525992,
      "grad_norm": 0.7986123698244396,
      "learning_rate": 1.9946501709885562e-05,
      "loss": 1.0127,
      "num_input_tokens_seen": 50297181552,
      "step": 63929
    },
    {
      "epoch": 6.782304264799491,
      "grad_norm": 0.7863186924101921,
      "learning_rate": 1.994582108950232e-05,
      "loss": 1.0113,
      "num_input_tokens_seen": 50297968304,
      "step": 63930
    },
    {
      "epoch": 6.782410354339062,
      "grad_norm": 0.8982951561471402,
      "learning_rate": 1.9945140473024796e-05,
      "loss": 1.0935,
      "num_input_tokens_seen": 50298754912,
      "step": 63931
    },
    {
      "epoch": 6.782516443878634,
      "grad_norm": 0.6362267991889166,
      "learning_rate": 1.9944459860453517e-05,
      "loss": 0.9881,
      "num_input_tokens_seen": 50299541712,
      "step": 63932
    },
    {
      "epoch": 6.782622533418205,
      "grad_norm": 0.8160857227400119,
      "learning_rate": 1.9943779251789013e-05,
      "loss": 0.9376,
      "num_input_tokens_seen": 50300328448,
      "step": 63933
    },
    {
      "epoch": 6.782728622957777,
      "grad_norm": 0.9593646009020426,
      "learning_rate": 1.994309864703181e-05,
      "loss": 1.0999,
      "num_input_tokens_seen": 50301115168,
      "step": 63934
    },
    {
      "epoch": 6.782834712497348,
      "grad_norm": 0.7922345054268684,
      "learning_rate": 1.994241804618243e-05,
      "loss": 1.0551,
      "num_input_tokens_seen": 50301901824,
      "step": 63935
    },
    {
      "epoch": 6.7829408020369195,
      "grad_norm": 1.0861400621312782,
      "learning_rate": 1.99417374492414e-05,
      "loss": 1.0177,
      "num_input_tokens_seen": 50302688528,
      "step": 63936
    },
    {
      "epoch": 6.7830468915764905,
      "grad_norm": 0.9850947132025687,
      "learning_rate": 1.994105685620925e-05,
      "loss": 1.0593,
      "num_input_tokens_seen": 50303475264,
      "step": 63937
    },
    {
      "epoch": 6.783152981116062,
      "grad_norm": 0.7143920004465684,
      "learning_rate": 1.9940376267086497e-05,
      "loss": 0.9563,
      "num_input_tokens_seen": 50304262064,
      "step": 63938
    },
    {
      "epoch": 6.7832590706556335,
      "grad_norm": 0.8218755142196935,
      "learning_rate": 1.993969568187368e-05,
      "loss": 1.0212,
      "num_input_tokens_seen": 50305048752,
      "step": 63939
    },
    {
      "epoch": 6.7833651601952045,
      "grad_norm": 1.39388158079033,
      "learning_rate": 1.9939015100571316e-05,
      "loss": 0.9778,
      "num_input_tokens_seen": 50305835552,
      "step": 63940
    },
    {
      "epoch": 6.783471249734776,
      "grad_norm": 0.8273402162090127,
      "learning_rate": 1.9938334523179927e-05,
      "loss": 0.9963,
      "num_input_tokens_seen": 50306622336,
      "step": 63941
    },
    {
      "epoch": 6.7835773392743475,
      "grad_norm": 0.8685828857112451,
      "learning_rate": 1.993765394970005e-05,
      "loss": 1.0027,
      "num_input_tokens_seen": 50307409152,
      "step": 63942
    },
    {
      "epoch": 6.783683428813919,
      "grad_norm": 1.0323367160139867,
      "learning_rate": 1.99369733801322e-05,
      "loss": 0.9397,
      "num_input_tokens_seen": 50308195984,
      "step": 63943
    },
    {
      "epoch": 6.78378951835349,
      "grad_norm": 0.9843397329727512,
      "learning_rate": 1.9936292814476913e-05,
      "loss": 1.0164,
      "num_input_tokens_seen": 50308982704,
      "step": 63944
    },
    {
      "epoch": 6.7838956078930615,
      "grad_norm": 0.8386035819455062,
      "learning_rate": 1.9935612252734715e-05,
      "loss": 1.0797,
      "num_input_tokens_seen": 50309769424,
      "step": 63945
    },
    {
      "epoch": 6.784001697432633,
      "grad_norm": 1.2116301083149923,
      "learning_rate": 1.9934931694906117e-05,
      "loss": 1.0282,
      "num_input_tokens_seen": 50310556176,
      "step": 63946
    },
    {
      "epoch": 6.784107786972204,
      "grad_norm": 0.938104922246605,
      "learning_rate": 1.9934251140991662e-05,
      "loss": 1.0542,
      "num_input_tokens_seen": 50311342912,
      "step": 63947
    },
    {
      "epoch": 6.784213876511776,
      "grad_norm": 0.7451371107351996,
      "learning_rate": 1.9933570590991868e-05,
      "loss": 0.9897,
      "num_input_tokens_seen": 50312129776,
      "step": 63948
    },
    {
      "epoch": 6.784319966051347,
      "grad_norm": 1.284693990648556,
      "learning_rate": 1.993289004490726e-05,
      "loss": 1.0529,
      "num_input_tokens_seen": 50312916528,
      "step": 63949
    },
    {
      "epoch": 6.784426055590918,
      "grad_norm": 1.018207519618773,
      "learning_rate": 1.993220950273837e-05,
      "loss": 0.9767,
      "num_input_tokens_seen": 50313703216,
      "step": 63950
    },
    {
      "epoch": 6.78453214513049,
      "grad_norm": 0.8347534806012398,
      "learning_rate": 1.9931528964485718e-05,
      "loss": 1.0799,
      "num_input_tokens_seen": 50314489984,
      "step": 63951
    },
    {
      "epoch": 6.784638234670061,
      "grad_norm": 1.0448064394255123,
      "learning_rate": 1.9930848430149826e-05,
      "loss": 1.0238,
      "num_input_tokens_seen": 50315276800,
      "step": 63952
    },
    {
      "epoch": 6.784744324209633,
      "grad_norm": 0.8040510151430116,
      "learning_rate": 1.9930167899731235e-05,
      "loss": 1.02,
      "num_input_tokens_seen": 50316063600,
      "step": 63953
    },
    {
      "epoch": 6.784850413749204,
      "grad_norm": 0.9067481598603779,
      "learning_rate": 1.9929487373230456e-05,
      "loss": 0.9363,
      "num_input_tokens_seen": 50316850352,
      "step": 63954
    },
    {
      "epoch": 6.784956503288775,
      "grad_norm": 0.6616470570596459,
      "learning_rate": 1.9928806850648017e-05,
      "loss": 1.02,
      "num_input_tokens_seen": 50317637136,
      "step": 63955
    },
    {
      "epoch": 6.785062592828347,
      "grad_norm": 0.862044903933786,
      "learning_rate": 1.9928126331984454e-05,
      "loss": 1.0148,
      "num_input_tokens_seen": 50318423904,
      "step": 63956
    },
    {
      "epoch": 6.785168682367918,
      "grad_norm": 1.1731745343476607,
      "learning_rate": 1.9927445817240283e-05,
      "loss": 1.0008,
      "num_input_tokens_seen": 50319210560,
      "step": 63957
    },
    {
      "epoch": 6.78527477190749,
      "grad_norm": 0.9120046252295679,
      "learning_rate": 1.992676530641603e-05,
      "loss": 0.9493,
      "num_input_tokens_seen": 50319997360,
      "step": 63958
    },
    {
      "epoch": 6.785380861447061,
      "grad_norm": 0.9542295592901169,
      "learning_rate": 1.9926084799512232e-05,
      "loss": 0.9481,
      "num_input_tokens_seen": 50320784096,
      "step": 63959
    },
    {
      "epoch": 6.785486950986632,
      "grad_norm": 1.060140937967834,
      "learning_rate": 1.9925404296529397e-05,
      "loss": 1.0142,
      "num_input_tokens_seen": 50321570864,
      "step": 63960
    },
    {
      "epoch": 6.785593040526204,
      "grad_norm": 0.9684758850056191,
      "learning_rate": 1.992472379746807e-05,
      "loss": 1.0664,
      "num_input_tokens_seen": 50322357584,
      "step": 63961
    },
    {
      "epoch": 6.785699130065775,
      "grad_norm": 0.998554214513763,
      "learning_rate": 1.9924043302328765e-05,
      "loss": 1.0323,
      "num_input_tokens_seen": 50323144320,
      "step": 63962
    },
    {
      "epoch": 6.785805219605347,
      "grad_norm": 0.8147067198704814,
      "learning_rate": 1.9923362811112004e-05,
      "loss": 1.0067,
      "num_input_tokens_seen": 50323931136,
      "step": 63963
    },
    {
      "epoch": 6.785911309144918,
      "grad_norm": 0.7785800094897122,
      "learning_rate": 1.9922682323818326e-05,
      "loss": 1.0009,
      "num_input_tokens_seen": 50324717872,
      "step": 63964
    },
    {
      "epoch": 6.78601739868449,
      "grad_norm": 0.8935511896810701,
      "learning_rate": 1.992200184044825e-05,
      "loss": 1.0106,
      "num_input_tokens_seen": 50325504624,
      "step": 63965
    },
    {
      "epoch": 6.786123488224061,
      "grad_norm": 0.7046112503935016,
      "learning_rate": 1.9921321361002297e-05,
      "loss": 0.9829,
      "num_input_tokens_seen": 50326291424,
      "step": 63966
    },
    {
      "epoch": 6.786229577763633,
      "grad_norm": 0.7084579247760481,
      "learning_rate": 1.9920640885481002e-05,
      "loss": 1.0143,
      "num_input_tokens_seen": 50327078192,
      "step": 63967
    },
    {
      "epoch": 6.786335667303204,
      "grad_norm": 0.7788295179619358,
      "learning_rate": 1.991996041388489e-05,
      "loss": 1.0107,
      "num_input_tokens_seen": 50327864976,
      "step": 63968
    },
    {
      "epoch": 6.786441756842775,
      "grad_norm": 0.8005776226811786,
      "learning_rate": 1.9919279946214475e-05,
      "loss": 1.0762,
      "num_input_tokens_seen": 50328651728,
      "step": 63969
    },
    {
      "epoch": 6.786547846382347,
      "grad_norm": 0.7955958494112043,
      "learning_rate": 1.9918599482470295e-05,
      "loss": 0.9831,
      "num_input_tokens_seen": 50329438480,
      "step": 63970
    },
    {
      "epoch": 6.786653935921918,
      "grad_norm": 0.7370938725476102,
      "learning_rate": 1.9917919022652876e-05,
      "loss": 1.0613,
      "num_input_tokens_seen": 50330225200,
      "step": 63971
    },
    {
      "epoch": 6.78676002546149,
      "grad_norm": 0.6714910771897385,
      "learning_rate": 1.9917238566762732e-05,
      "loss": 0.9723,
      "num_input_tokens_seen": 50331011904,
      "step": 63972
    },
    {
      "epoch": 6.786866115001061,
      "grad_norm": 0.7333852849394583,
      "learning_rate": 1.9916558114800405e-05,
      "loss": 1.0429,
      "num_input_tokens_seen": 50331798640,
      "step": 63973
    },
    {
      "epoch": 6.786972204540632,
      "grad_norm": 0.7952996653848277,
      "learning_rate": 1.991587766676641e-05,
      "loss": 0.9976,
      "num_input_tokens_seen": 50332585376,
      "step": 63974
    },
    {
      "epoch": 6.787078294080204,
      "grad_norm": 0.5786799245999679,
      "learning_rate": 1.9915197222661272e-05,
      "loss": 0.9622,
      "num_input_tokens_seen": 50333372160,
      "step": 63975
    },
    {
      "epoch": 6.787184383619775,
      "grad_norm": 0.9883913988544032,
      "learning_rate": 1.9914516782485528e-05,
      "loss": 1.0165,
      "num_input_tokens_seen": 50334159008,
      "step": 63976
    },
    {
      "epoch": 6.787290473159347,
      "grad_norm": 0.6735637324965674,
      "learning_rate": 1.9913836346239687e-05,
      "loss": 1.0117,
      "num_input_tokens_seen": 50334945712,
      "step": 63977
    },
    {
      "epoch": 6.787396562698918,
      "grad_norm": 0.8523191421529527,
      "learning_rate": 1.9913155913924292e-05,
      "loss": 1.0228,
      "num_input_tokens_seen": 50335732560,
      "step": 63978
    },
    {
      "epoch": 6.787502652238489,
      "grad_norm": 0.9139421180674028,
      "learning_rate": 1.991247548553986e-05,
      "loss": 0.9666,
      "num_input_tokens_seen": 50336519408,
      "step": 63979
    },
    {
      "epoch": 6.787608741778061,
      "grad_norm": 0.8745657936269322,
      "learning_rate": 1.9911795061086906e-05,
      "loss": 1.0865,
      "num_input_tokens_seen": 50337306272,
      "step": 63980
    },
    {
      "epoch": 6.787714831317632,
      "grad_norm": 0.9028777856983363,
      "learning_rate": 1.991111464056597e-05,
      "loss": 1.0592,
      "num_input_tokens_seen": 50338092992,
      "step": 63981
    },
    {
      "epoch": 6.787820920857204,
      "grad_norm": 0.8294660279092118,
      "learning_rate": 1.9910434223977586e-05,
      "loss": 0.9776,
      "num_input_tokens_seen": 50338879792,
      "step": 63982
    },
    {
      "epoch": 6.787927010396775,
      "grad_norm": 0.6792899115449027,
      "learning_rate": 1.9909753811322267e-05,
      "loss": 1.0168,
      "num_input_tokens_seen": 50339666544,
      "step": 63983
    },
    {
      "epoch": 6.788033099936346,
      "grad_norm": 0.9387510150324482,
      "learning_rate": 1.9909073402600535e-05,
      "loss": 1.0387,
      "num_input_tokens_seen": 50340453360,
      "step": 63984
    },
    {
      "epoch": 6.788139189475918,
      "grad_norm": 0.9835536735775017,
      "learning_rate": 1.990839299781293e-05,
      "loss": 1.0672,
      "num_input_tokens_seen": 50341240080,
      "step": 63985
    },
    {
      "epoch": 6.788245279015489,
      "grad_norm": 0.8356995657372817,
      "learning_rate": 1.9907712596959967e-05,
      "loss": 1.025,
      "num_input_tokens_seen": 50342026800,
      "step": 63986
    },
    {
      "epoch": 6.788351368555061,
      "grad_norm": 1.2875193998267909,
      "learning_rate": 1.9907032200042167e-05,
      "loss": 1.017,
      "num_input_tokens_seen": 50342813536,
      "step": 63987
    },
    {
      "epoch": 6.788457458094632,
      "grad_norm": 1.018945864728257,
      "learning_rate": 1.990635180706007e-05,
      "loss": 1.0242,
      "num_input_tokens_seen": 50343600256,
      "step": 63988
    },
    {
      "epoch": 6.788563547634203,
      "grad_norm": 0.832189283498032,
      "learning_rate": 1.9905671418014194e-05,
      "loss": 0.9697,
      "num_input_tokens_seen": 50344387120,
      "step": 63989
    },
    {
      "epoch": 6.788669637173775,
      "grad_norm": 1.1133137301259788,
      "learning_rate": 1.9904991032905064e-05,
      "loss": 0.9972,
      "num_input_tokens_seen": 50345173856,
      "step": 63990
    },
    {
      "epoch": 6.788775726713346,
      "grad_norm": 1.2943854800498962,
      "learning_rate": 1.990431065173321e-05,
      "loss": 0.9865,
      "num_input_tokens_seen": 50345960576,
      "step": 63991
    },
    {
      "epoch": 6.788881816252918,
      "grad_norm": 0.7808365724460039,
      "learning_rate": 1.9903630274499155e-05,
      "loss": 0.9952,
      "num_input_tokens_seen": 50346747264,
      "step": 63992
    },
    {
      "epoch": 6.788987905792489,
      "grad_norm": 1.15387771114917,
      "learning_rate": 1.9902949901203418e-05,
      "loss": 0.9814,
      "num_input_tokens_seen": 50347534080,
      "step": 63993
    },
    {
      "epoch": 6.789093995332061,
      "grad_norm": 0.9450940186823596,
      "learning_rate": 1.990226953184654e-05,
      "loss": 0.9493,
      "num_input_tokens_seen": 50348320976,
      "step": 63994
    },
    {
      "epoch": 6.789200084871632,
      "grad_norm": 0.9641921359518564,
      "learning_rate": 1.9901589166429037e-05,
      "loss": 1.0313,
      "num_input_tokens_seen": 50349107760,
      "step": 63995
    },
    {
      "epoch": 6.7893061744112035,
      "grad_norm": 0.7215427964224692,
      "learning_rate": 1.9900908804951435e-05,
      "loss": 1.0393,
      "num_input_tokens_seen": 50349894528,
      "step": 63996
    },
    {
      "epoch": 6.789412263950775,
      "grad_norm": 0.9356600834196537,
      "learning_rate": 1.990022844741426e-05,
      "loss": 0.9403,
      "num_input_tokens_seen": 50350681408,
      "step": 63997
    },
    {
      "epoch": 6.789518353490346,
      "grad_norm": 0.9867533481198043,
      "learning_rate": 1.989954809381804e-05,
      "loss": 1.0673,
      "num_input_tokens_seen": 50351468128,
      "step": 63998
    },
    {
      "epoch": 6.7896244430299175,
      "grad_norm": 0.7668445708838162,
      "learning_rate": 1.98988677441633e-05,
      "loss": 1.0482,
      "num_input_tokens_seen": 50352254928,
      "step": 63999
    },
    {
      "epoch": 6.7897305325694886,
      "grad_norm": 0.9797954285512951,
      "learning_rate": 1.989818739845057e-05,
      "loss": 0.9577,
      "num_input_tokens_seen": 50353041680,
      "step": 64000
    },
    {
      "epoch": 6.7897305325694886,
      "eval_loss": 1.494019627571106,
      "eval_runtime": 63.4427,
      "eval_samples_per_second": 47.287,
      "eval_steps_per_second": 0.504,
      "num_input_tokens_seen": 50353041680,
      "step": 64000
    }
  ],
  "logging_steps": 1,
  "max_steps": 113112,
  "num_input_tokens_seen": 50353041680,
  "num_train_epochs": 12,
  "save_steps": 2000,
  "stateful_callbacks": {
    "TrainerControl": {
      "args": {
        "should_epoch_stop": false,
        "should_evaluate": false,
        "should_log": false,
        "should_save": true,
        "should_training_stop": false
      },
      "attributes": {}
    }
  },
  "total_flos": 2.564669717474181e+17,
  "train_batch_size": 2,
  "trial_name": null,
  "trial_params": null
}
